{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 198, "global_step": 1980, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0010108668182966893, "grad_norm": 8.506893157958984, "learning_rate": 0.0, "loss": 0.2525153160095215, "num_input_tokens_seen": 2014, "step": 1, "train_runtime": 8.1467, "train_tokens_per_second": 247.217 }, { "epoch": 0.0020217336365933787, "grad_norm": 7.676785469055176, "learning_rate": 4.000000000000001e-06, "loss": 0.2333833873271942, "num_input_tokens_seen": 4302, "step": 2, "train_runtime": 10.5575, "train_tokens_per_second": 407.482 }, { "epoch": 0.003032600454890068, "grad_norm": 5.56013298034668, "learning_rate": 8.000000000000001e-06, "loss": 0.20100091397762299, "num_input_tokens_seen": 6256, "step": 3, "train_runtime": 12.8851, "train_tokens_per_second": 485.524 }, { "epoch": 0.004043467273186757, "grad_norm": 3.537539005279541, "learning_rate": 1.2e-05, "loss": 0.12631550431251526, "num_input_tokens_seen": 8140, "step": 4, "train_runtime": 15.1509, "train_tokens_per_second": 537.26 }, { "epoch": 0.005054334091483447, "grad_norm": 3.2350640296936035, "learning_rate": 1.6000000000000003e-05, "loss": 0.1263377070426941, "num_input_tokens_seen": 9800, "step": 5, "train_runtime": 17.4855, "train_tokens_per_second": 560.463 }, { "epoch": 0.006065200909780136, "grad_norm": 3.040302038192749, "learning_rate": 2e-05, "loss": 0.15985995531082153, "num_input_tokens_seen": 11810, "step": 6, "train_runtime": 19.8808, "train_tokens_per_second": 594.039 }, { "epoch": 0.0070760677280768255, "grad_norm": 2.353942632675171, "learning_rate": 1.998987341772152e-05, "loss": 0.12493391335010529, "num_input_tokens_seen": 13386, "step": 7, "train_runtime": 22.1341, "train_tokens_per_second": 604.769 }, { "epoch": 0.008086934546373515, "grad_norm": 2.236783027648926, "learning_rate": 1.997974683544304e-05, "loss": 0.10446575284004211, "num_input_tokens_seen": 15448, "step": 8, "train_runtime": 24.4794, "train_tokens_per_second": 631.061 }, { "epoch": 0.009097801364670205, "grad_norm": 2.195513963699341, "learning_rate": 1.996962025316456e-05, "loss": 0.11554163694381714, "num_input_tokens_seen": 17280, "step": 9, "train_runtime": 26.7545, "train_tokens_per_second": 645.872 }, { "epoch": 0.010108668182966895, "grad_norm": 2.050267457962036, "learning_rate": 1.9959493670886078e-05, "loss": 0.1334109902381897, "num_input_tokens_seen": 19228, "step": 10, "train_runtime": 29.0256, "train_tokens_per_second": 662.45 }, { "epoch": 0.011119535001263583, "grad_norm": 2.197054862976074, "learning_rate": 1.9949367088607597e-05, "loss": 0.13452044129371643, "num_input_tokens_seen": 21282, "step": 11, "train_runtime": 31.4148, "train_tokens_per_second": 677.451 }, { "epoch": 0.012130401819560273, "grad_norm": 1.5404812097549438, "learning_rate": 1.9939240506329116e-05, "loss": 0.11211110651493073, "num_input_tokens_seen": 23866, "step": 12, "train_runtime": 33.8865, "train_tokens_per_second": 704.293 }, { "epoch": 0.013141268637856963, "grad_norm": 2.436166763305664, "learning_rate": 1.9929113924050635e-05, "loss": 0.15277458727359772, "num_input_tokens_seen": 25162, "step": 13, "train_runtime": 36.1, "train_tokens_per_second": 697.008 }, { "epoch": 0.014152135456153651, "grad_norm": 2.166334390640259, "learning_rate": 1.9918987341772154e-05, "loss": 0.1117962896823883, "num_input_tokens_seen": 27000, "step": 14, "train_runtime": 38.4314, "train_tokens_per_second": 702.551 }, { "epoch": 0.015163002274450341, "grad_norm": 1.7016150951385498, "learning_rate": 1.9908860759493673e-05, "loss": 0.14756187796592712, "num_input_tokens_seen": 29284, "step": 15, "train_runtime": 40.8298, "train_tokens_per_second": 717.221 }, { "epoch": 0.01617386909274703, "grad_norm": 1.590873122215271, "learning_rate": 1.9898734177215192e-05, "loss": 0.10208898782730103, "num_input_tokens_seen": 30880, "step": 16, "train_runtime": 43.0632, "train_tokens_per_second": 717.086 }, { "epoch": 0.01718473591104372, "grad_norm": 1.8935258388519287, "learning_rate": 1.988860759493671e-05, "loss": 0.12088144570589066, "num_input_tokens_seen": 32636, "step": 17, "train_runtime": 45.3162, "train_tokens_per_second": 720.183 }, { "epoch": 0.01819560272934041, "grad_norm": 1.7732003927230835, "learning_rate": 1.9878481012658227e-05, "loss": 0.11159995198249817, "num_input_tokens_seen": 34086, "step": 18, "train_runtime": 47.5312, "train_tokens_per_second": 717.129 }, { "epoch": 0.0192064695476371, "grad_norm": 1.8494051694869995, "learning_rate": 1.986835443037975e-05, "loss": 0.13126812875270844, "num_input_tokens_seen": 35890, "step": 19, "train_runtime": 49.7621, "train_tokens_per_second": 721.232 }, { "epoch": 0.02021733636593379, "grad_norm": 1.9393033981323242, "learning_rate": 1.985822784810127e-05, "loss": 0.12357176840305328, "num_input_tokens_seen": 37808, "step": 20, "train_runtime": 52.0773, "train_tokens_per_second": 725.997 }, { "epoch": 0.02122820318423048, "grad_norm": 2.33729887008667, "learning_rate": 1.9848101265822785e-05, "loss": 0.12302634119987488, "num_input_tokens_seen": 39772, "step": 21, "train_runtime": 54.3308, "train_tokens_per_second": 732.034 }, { "epoch": 0.022239070002527166, "grad_norm": 2.332458019256592, "learning_rate": 1.9837974683544307e-05, "loss": 0.135231152176857, "num_input_tokens_seen": 41968, "step": 22, "train_runtime": 56.6929, "train_tokens_per_second": 740.268 }, { "epoch": 0.023249936820823856, "grad_norm": 1.934679388999939, "learning_rate": 1.9827848101265826e-05, "loss": 0.13030485808849335, "num_input_tokens_seen": 43884, "step": 23, "train_runtime": 58.9618, "train_tokens_per_second": 744.278 }, { "epoch": 0.024260803639120546, "grad_norm": 2.044053554534912, "learning_rate": 1.9817721518987342e-05, "loss": 0.09511726349592209, "num_input_tokens_seen": 45820, "step": 24, "train_runtime": 61.2022, "train_tokens_per_second": 748.666 }, { "epoch": 0.025271670457417236, "grad_norm": 1.9673645496368408, "learning_rate": 1.9807594936708864e-05, "loss": 0.12695713341236115, "num_input_tokens_seen": 47302, "step": 25, "train_runtime": 63.3997, "train_tokens_per_second": 746.092 }, { "epoch": 0.026282537275713926, "grad_norm": 1.7110137939453125, "learning_rate": 1.979746835443038e-05, "loss": 0.10450948029756546, "num_input_tokens_seen": 48978, "step": 26, "train_runtime": 65.5816, "train_tokens_per_second": 746.825 }, { "epoch": 0.027293404094010616, "grad_norm": 2.1584558486938477, "learning_rate": 1.97873417721519e-05, "loss": 0.15018154680728912, "num_input_tokens_seen": 50812, "step": 27, "train_runtime": 67.8371, "train_tokens_per_second": 749.03 }, { "epoch": 0.028304270912307302, "grad_norm": 2.2640867233276367, "learning_rate": 1.977721518987342e-05, "loss": 0.11018655449151993, "num_input_tokens_seen": 52666, "step": 28, "train_runtime": 70.1303, "train_tokens_per_second": 750.973 }, { "epoch": 0.029315137730603992, "grad_norm": 2.3095314502716064, "learning_rate": 1.9767088607594937e-05, "loss": 0.14648404717445374, "num_input_tokens_seen": 54330, "step": 29, "train_runtime": 72.3367, "train_tokens_per_second": 751.071 }, { "epoch": 0.030326004548900682, "grad_norm": 2.0651280879974365, "learning_rate": 1.9756962025316456e-05, "loss": 0.12345363199710846, "num_input_tokens_seen": 55990, "step": 30, "train_runtime": 74.6124, "train_tokens_per_second": 750.411 }, { "epoch": 0.03133687136719737, "grad_norm": 1.8660341501235962, "learning_rate": 1.974683544303798e-05, "loss": 0.09264306724071503, "num_input_tokens_seen": 57646, "step": 31, "train_runtime": 92.9802, "train_tokens_per_second": 619.981 }, { "epoch": 0.03234773818549406, "grad_norm": 1.4165245294570923, "learning_rate": 1.9736708860759494e-05, "loss": 0.09966084361076355, "num_input_tokens_seen": 59978, "step": 32, "train_runtime": 95.3586, "train_tokens_per_second": 628.973 }, { "epoch": 0.03335860500379075, "grad_norm": 2.1475155353546143, "learning_rate": 1.9726582278481014e-05, "loss": 0.12514939904212952, "num_input_tokens_seen": 61296, "step": 33, "train_runtime": 97.5187, "train_tokens_per_second": 628.556 }, { "epoch": 0.03436947182208744, "grad_norm": 1.5792697668075562, "learning_rate": 1.9716455696202533e-05, "loss": 0.12737156450748444, "num_input_tokens_seen": 63650, "step": 34, "train_runtime": 99.8854, "train_tokens_per_second": 637.23 }, { "epoch": 0.03538033864038413, "grad_norm": 1.7555632591247559, "learning_rate": 1.970632911392405e-05, "loss": 0.12677490711212158, "num_input_tokens_seen": 65694, "step": 35, "train_runtime": 102.2476, "train_tokens_per_second": 642.499 }, { "epoch": 0.03639120545868082, "grad_norm": 1.6866122484207153, "learning_rate": 1.969620253164557e-05, "loss": 0.09945788979530334, "num_input_tokens_seen": 67306, "step": 36, "train_runtime": 104.4451, "train_tokens_per_second": 644.415 }, { "epoch": 0.037402072276977505, "grad_norm": 2.158679962158203, "learning_rate": 1.968607594936709e-05, "loss": 0.14948192238807678, "num_input_tokens_seen": 69350, "step": 37, "train_runtime": 106.808, "train_tokens_per_second": 649.296 }, { "epoch": 0.0384129390952742, "grad_norm": 2.2676992416381836, "learning_rate": 1.967594936708861e-05, "loss": 0.14130638539791107, "num_input_tokens_seen": 71108, "step": 38, "train_runtime": 109.0227, "train_tokens_per_second": 652.231 }, { "epoch": 0.039423805913570885, "grad_norm": 1.7943005561828613, "learning_rate": 1.9665822784810128e-05, "loss": 0.13869130611419678, "num_input_tokens_seen": 72894, "step": 39, "train_runtime": 111.2519, "train_tokens_per_second": 655.216 }, { "epoch": 0.04043467273186758, "grad_norm": 1.3528027534484863, "learning_rate": 1.9655696202531647e-05, "loss": 0.10072000324726105, "num_input_tokens_seen": 74832, "step": 40, "train_runtime": 113.5818, "train_tokens_per_second": 658.838 }, { "epoch": 0.041445539550164265, "grad_norm": 1.7628815174102783, "learning_rate": 1.9645569620253166e-05, "loss": 0.13465619087219238, "num_input_tokens_seen": 76986, "step": 41, "train_runtime": 115.9664, "train_tokens_per_second": 663.865 }, { "epoch": 0.04245640636846096, "grad_norm": 2.3988149166107178, "learning_rate": 1.9635443037974685e-05, "loss": 0.10453267395496368, "num_input_tokens_seen": 78728, "step": 42, "train_runtime": 118.3009, "train_tokens_per_second": 665.49 }, { "epoch": 0.043467273186757645, "grad_norm": 1.4457941055297852, "learning_rate": 1.9625316455696204e-05, "loss": 0.08477690815925598, "num_input_tokens_seen": 80352, "step": 43, "train_runtime": 120.5416, "train_tokens_per_second": 666.591 }, { "epoch": 0.04447814000505433, "grad_norm": 1.8616442680358887, "learning_rate": 1.9615189873417723e-05, "loss": 0.10402233153581619, "num_input_tokens_seen": 82186, "step": 44, "train_runtime": 122.844, "train_tokens_per_second": 669.028 }, { "epoch": 0.045489006823351025, "grad_norm": 1.9784412384033203, "learning_rate": 1.9605063291139243e-05, "loss": 0.12321233749389648, "num_input_tokens_seen": 84134, "step": 45, "train_runtime": 125.1089, "train_tokens_per_second": 672.486 }, { "epoch": 0.04649987364164771, "grad_norm": 1.38789701461792, "learning_rate": 1.959493670886076e-05, "loss": 0.11749634146690369, "num_input_tokens_seen": 86412, "step": 46, "train_runtime": 127.5308, "train_tokens_per_second": 677.577 }, { "epoch": 0.047510740459944405, "grad_norm": 1.7648074626922607, "learning_rate": 1.958481012658228e-05, "loss": 0.11442861706018448, "num_input_tokens_seen": 88426, "step": 47, "train_runtime": 129.9524, "train_tokens_per_second": 680.449 }, { "epoch": 0.04852160727824109, "grad_norm": 1.6100456714630127, "learning_rate": 1.95746835443038e-05, "loss": 0.11065111309289932, "num_input_tokens_seen": 90310, "step": 48, "train_runtime": 132.2487, "train_tokens_per_second": 682.88 }, { "epoch": 0.04953247409653778, "grad_norm": 1.5381323099136353, "learning_rate": 1.956455696202532e-05, "loss": 0.11945416778326035, "num_input_tokens_seen": 92530, "step": 49, "train_runtime": 134.598, "train_tokens_per_second": 687.455 }, { "epoch": 0.05054334091483447, "grad_norm": 1.450587511062622, "learning_rate": 1.9554430379746835e-05, "loss": 0.10527409613132477, "num_input_tokens_seen": 94718, "step": 50, "train_runtime": 136.9365, "train_tokens_per_second": 691.693 }, { "epoch": 0.05155420773313116, "grad_norm": 1.7181240320205688, "learning_rate": 1.9544303797468357e-05, "loss": 0.10942867398262024, "num_input_tokens_seen": 96530, "step": 51, "train_runtime": 139.1971, "train_tokens_per_second": 693.477 }, { "epoch": 0.05256507455142785, "grad_norm": 1.6302286386489868, "learning_rate": 1.9534177215189876e-05, "loss": 0.1107134222984314, "num_input_tokens_seen": 98434, "step": 52, "train_runtime": 141.4523, "train_tokens_per_second": 695.881 }, { "epoch": 0.05357594136972454, "grad_norm": 1.4967299699783325, "learning_rate": 1.9524050632911392e-05, "loss": 0.10694774240255356, "num_input_tokens_seen": 100400, "step": 53, "train_runtime": 143.7107, "train_tokens_per_second": 698.626 }, { "epoch": 0.05458680818802123, "grad_norm": 1.5010350942611694, "learning_rate": 1.9513924050632914e-05, "loss": 0.08706866204738617, "num_input_tokens_seen": 101800, "step": 54, "train_runtime": 145.902, "train_tokens_per_second": 697.729 }, { "epoch": 0.05559767500631792, "grad_norm": 1.9456924200057983, "learning_rate": 1.9503797468354433e-05, "loss": 0.1087537631392479, "num_input_tokens_seen": 103632, "step": 55, "train_runtime": 148.1733, "train_tokens_per_second": 699.397 }, { "epoch": 0.056608541824614604, "grad_norm": 1.7735391855239868, "learning_rate": 1.949367088607595e-05, "loss": 0.14347060024738312, "num_input_tokens_seen": 105654, "step": 56, "train_runtime": 150.5644, "train_tokens_per_second": 701.719 }, { "epoch": 0.0576194086429113, "grad_norm": 1.873093843460083, "learning_rate": 1.948354430379747e-05, "loss": 0.13866883516311646, "num_input_tokens_seen": 107452, "step": 57, "train_runtime": 152.8554, "train_tokens_per_second": 702.965 }, { "epoch": 0.058630275461207984, "grad_norm": 1.2524882555007935, "learning_rate": 1.9473417721518987e-05, "loss": 0.08895567059516907, "num_input_tokens_seen": 109702, "step": 58, "train_runtime": 155.2944, "train_tokens_per_second": 706.413 }, { "epoch": 0.05964114227950468, "grad_norm": 1.770918369293213, "learning_rate": 1.9463291139240506e-05, "loss": 0.11555160582065582, "num_input_tokens_seen": 111458, "step": 59, "train_runtime": 157.6024, "train_tokens_per_second": 707.21 }, { "epoch": 0.060652009097801364, "grad_norm": 2.2099945545196533, "learning_rate": 1.945316455696203e-05, "loss": 0.1112520769238472, "num_input_tokens_seen": 112866, "step": 60, "train_runtime": 159.7889, "train_tokens_per_second": 706.344 }, { "epoch": 0.06166287591609806, "grad_norm": 1.9527833461761475, "learning_rate": 1.9443037974683544e-05, "loss": 0.14135530591011047, "num_input_tokens_seen": 115128, "step": 61, "train_runtime": 175.6086, "train_tokens_per_second": 655.594 }, { "epoch": 0.06267374273439474, "grad_norm": 2.4236061573028564, "learning_rate": 1.9432911392405064e-05, "loss": 0.11961868405342102, "num_input_tokens_seen": 117058, "step": 62, "train_runtime": 177.917, "train_tokens_per_second": 657.936 }, { "epoch": 0.06368460955269144, "grad_norm": 1.5899832248687744, "learning_rate": 1.9422784810126586e-05, "loss": 0.1059185191988945, "num_input_tokens_seen": 119258, "step": 63, "train_runtime": 180.4015, "train_tokens_per_second": 661.07 }, { "epoch": 0.06469547637098812, "grad_norm": 1.4054566621780396, "learning_rate": 1.9412658227848102e-05, "loss": 0.0871809720993042, "num_input_tokens_seen": 121276, "step": 64, "train_runtime": 182.7583, "train_tokens_per_second": 663.587 }, { "epoch": 0.06570634318928481, "grad_norm": 1.5707159042358398, "learning_rate": 1.940253164556962e-05, "loss": 0.10112117230892181, "num_input_tokens_seen": 122996, "step": 65, "train_runtime": 185.035, "train_tokens_per_second": 664.718 }, { "epoch": 0.0667172100075815, "grad_norm": 1.552430510520935, "learning_rate": 1.939240506329114e-05, "loss": 0.107082799077034, "num_input_tokens_seen": 125242, "step": 66, "train_runtime": 187.3972, "train_tokens_per_second": 668.324 }, { "epoch": 0.0677280768258782, "grad_norm": 1.6381937265396118, "learning_rate": 1.938227848101266e-05, "loss": 0.1008966863155365, "num_input_tokens_seen": 127580, "step": 67, "train_runtime": 189.7902, "train_tokens_per_second": 672.216 }, { "epoch": 0.06873894364417488, "grad_norm": 1.7757294178009033, "learning_rate": 1.9372151898734178e-05, "loss": 0.09650348126888275, "num_input_tokens_seen": 129804, "step": 68, "train_runtime": 192.1347, "train_tokens_per_second": 675.589 }, { "epoch": 0.06974981046247157, "grad_norm": 1.7566887140274048, "learning_rate": 1.9362025316455697e-05, "loss": 0.1532202512025833, "num_input_tokens_seen": 131960, "step": 69, "train_runtime": 194.4645, "train_tokens_per_second": 678.581 }, { "epoch": 0.07076067728076826, "grad_norm": 1.4537709951400757, "learning_rate": 1.9351898734177216e-05, "loss": 0.12261821329593658, "num_input_tokens_seen": 133790, "step": 70, "train_runtime": 196.7306, "train_tokens_per_second": 680.067 }, { "epoch": 0.07177154409906494, "grad_norm": 1.4357869625091553, "learning_rate": 1.9341772151898735e-05, "loss": 0.09564615786075592, "num_input_tokens_seen": 135344, "step": 71, "train_runtime": 198.9071, "train_tokens_per_second": 680.438 }, { "epoch": 0.07278241091736164, "grad_norm": 1.570696234703064, "learning_rate": 1.9331645569620254e-05, "loss": 0.08187444508075714, "num_input_tokens_seen": 136974, "step": 72, "train_runtime": 201.0947, "train_tokens_per_second": 681.142 }, { "epoch": 0.07379327773565833, "grad_norm": 1.7900714874267578, "learning_rate": 1.9321518987341774e-05, "loss": 0.10589981079101562, "num_input_tokens_seen": 138742, "step": 73, "train_runtime": 203.3062, "train_tokens_per_second": 682.429 }, { "epoch": 0.07480414455395501, "grad_norm": 1.569770097732544, "learning_rate": 1.9311392405063293e-05, "loss": 0.10022330284118652, "num_input_tokens_seen": 140352, "step": 74, "train_runtime": 205.5147, "train_tokens_per_second": 682.929 }, { "epoch": 0.0758150113722517, "grad_norm": 1.275302767753601, "learning_rate": 1.930126582278481e-05, "loss": 0.08037956804037094, "num_input_tokens_seen": 142278, "step": 75, "train_runtime": 207.7919, "train_tokens_per_second": 684.714 }, { "epoch": 0.0768258781905484, "grad_norm": 1.855034351348877, "learning_rate": 1.929113924050633e-05, "loss": 0.10013698041439056, "num_input_tokens_seen": 144160, "step": 76, "train_runtime": 210.0556, "train_tokens_per_second": 686.294 }, { "epoch": 0.07783674500884509, "grad_norm": 5.506159782409668, "learning_rate": 1.928101265822785e-05, "loss": 0.10819685459136963, "num_input_tokens_seen": 146444, "step": 77, "train_runtime": 212.4903, "train_tokens_per_second": 689.18 }, { "epoch": 0.07884761182714177, "grad_norm": 1.6996967792510986, "learning_rate": 1.927088607594937e-05, "loss": 0.09614938497543335, "num_input_tokens_seen": 148724, "step": 78, "train_runtime": 214.8652, "train_tokens_per_second": 692.173 }, { "epoch": 0.07985847864543846, "grad_norm": 1.5823657512664795, "learning_rate": 1.9260759493670888e-05, "loss": 0.10873556137084961, "num_input_tokens_seen": 150364, "step": 79, "train_runtime": 217.0375, "train_tokens_per_second": 692.802 }, { "epoch": 0.08086934546373516, "grad_norm": 2.107003688812256, "learning_rate": 1.9250632911392407e-05, "loss": 0.14108863472938538, "num_input_tokens_seen": 152144, "step": 80, "train_runtime": 219.3032, "train_tokens_per_second": 693.761 }, { "epoch": 0.08188021228203184, "grad_norm": 1.9523966312408447, "learning_rate": 1.9240506329113926e-05, "loss": 0.11961855739355087, "num_input_tokens_seen": 153538, "step": 81, "train_runtime": 221.4523, "train_tokens_per_second": 693.323 }, { "epoch": 0.08289107910032853, "grad_norm": 1.4230780601501465, "learning_rate": 1.9230379746835445e-05, "loss": 0.10475742816925049, "num_input_tokens_seen": 155578, "step": 82, "train_runtime": 223.8001, "train_tokens_per_second": 695.165 }, { "epoch": 0.08390194591862522, "grad_norm": 1.6393123865127563, "learning_rate": 1.9220253164556964e-05, "loss": 0.10261191427707672, "num_input_tokens_seen": 157254, "step": 83, "train_runtime": 226.0656, "train_tokens_per_second": 695.612 }, { "epoch": 0.08491281273692192, "grad_norm": 1.2770360708236694, "learning_rate": 1.9210126582278483e-05, "loss": 0.07230052351951599, "num_input_tokens_seen": 158702, "step": 84, "train_runtime": 228.1978, "train_tokens_per_second": 695.458 }, { "epoch": 0.0859236795552186, "grad_norm": 1.7239381074905396, "learning_rate": 1.9200000000000003e-05, "loss": 0.11455848067998886, "num_input_tokens_seen": 160346, "step": 85, "train_runtime": 230.4051, "train_tokens_per_second": 695.931 }, { "epoch": 0.08693454637351529, "grad_norm": 1.8309370279312134, "learning_rate": 1.918987341772152e-05, "loss": 0.13381218910217285, "num_input_tokens_seen": 162460, "step": 86, "train_runtime": 232.7105, "train_tokens_per_second": 698.121 }, { "epoch": 0.08794541319181198, "grad_norm": 1.411454200744629, "learning_rate": 1.917974683544304e-05, "loss": 0.10632367432117462, "num_input_tokens_seen": 164650, "step": 87, "train_runtime": 235.0917, "train_tokens_per_second": 700.365 }, { "epoch": 0.08895628001010866, "grad_norm": 1.9270180463790894, "learning_rate": 1.916962025316456e-05, "loss": 0.10820554196834564, "num_input_tokens_seen": 166154, "step": 88, "train_runtime": 237.2707, "train_tokens_per_second": 700.272 }, { "epoch": 0.08996714682840536, "grad_norm": 1.873599648475647, "learning_rate": 1.915949367088608e-05, "loss": 0.1287396252155304, "num_input_tokens_seen": 167978, "step": 89, "train_runtime": 239.5113, "train_tokens_per_second": 701.336 }, { "epoch": 0.09097801364670205, "grad_norm": 1.8736536502838135, "learning_rate": 1.9149367088607595e-05, "loss": 0.12423866987228394, "num_input_tokens_seen": 169662, "step": 90, "train_runtime": 241.7224, "train_tokens_per_second": 701.888 }, { "epoch": 0.09198888046499874, "grad_norm": 1.5817285776138306, "learning_rate": 1.9139240506329117e-05, "loss": 0.11752364039421082, "num_input_tokens_seen": 171702, "step": 91, "train_runtime": 257.4921, "train_tokens_per_second": 666.824 }, { "epoch": 0.09299974728329542, "grad_norm": 1.419991374015808, "learning_rate": 1.9129113924050636e-05, "loss": 0.0935627743601799, "num_input_tokens_seen": 173154, "step": 92, "train_runtime": 259.6397, "train_tokens_per_second": 666.901 }, { "epoch": 0.09401061410159212, "grad_norm": 1.9239012002944946, "learning_rate": 1.9118987341772152e-05, "loss": 0.10259293019771576, "num_input_tokens_seen": 175074, "step": 93, "train_runtime": 261.8772, "train_tokens_per_second": 668.535 }, { "epoch": 0.09502148091988881, "grad_norm": 1.7783845663070679, "learning_rate": 1.9108860759493674e-05, "loss": 0.08148714900016785, "num_input_tokens_seen": 177174, "step": 94, "train_runtime": 264.238, "train_tokens_per_second": 670.509 }, { "epoch": 0.09603234773818549, "grad_norm": 1.4966665506362915, "learning_rate": 1.9098734177215193e-05, "loss": 0.08918128907680511, "num_input_tokens_seen": 178894, "step": 95, "train_runtime": 266.4846, "train_tokens_per_second": 671.311 }, { "epoch": 0.09704321455648218, "grad_norm": 1.6010295152664185, "learning_rate": 1.908860759493671e-05, "loss": 0.10201150178909302, "num_input_tokens_seen": 180318, "step": 96, "train_runtime": 268.6632, "train_tokens_per_second": 671.167 }, { "epoch": 0.09805408137477888, "grad_norm": 1.4962912797927856, "learning_rate": 1.9078481012658228e-05, "loss": 0.11616621911525726, "num_input_tokens_seen": 182496, "step": 97, "train_runtime": 271.0206, "train_tokens_per_second": 673.366 }, { "epoch": 0.09906494819307556, "grad_norm": 1.4796838760375977, "learning_rate": 1.9068354430379747e-05, "loss": 0.12867720425128937, "num_input_tokens_seen": 184870, "step": 98, "train_runtime": 273.4063, "train_tokens_per_second": 676.173 }, { "epoch": 0.10007581501137225, "grad_norm": 1.7509914636611938, "learning_rate": 1.9058227848101266e-05, "loss": 0.12179767340421677, "num_input_tokens_seen": 187088, "step": 99, "train_runtime": 275.8123, "train_tokens_per_second": 678.316 }, { "epoch": 0.10108668182966894, "grad_norm": 1.5425728559494019, "learning_rate": 1.9048101265822785e-05, "loss": 0.11425593495368958, "num_input_tokens_seen": 188710, "step": 100, "train_runtime": 278.1176, "train_tokens_per_second": 678.526 }, { "epoch": 0.10209754864796564, "grad_norm": 1.8624966144561768, "learning_rate": 1.9037974683544304e-05, "loss": 0.14122828841209412, "num_input_tokens_seen": 190694, "step": 101, "train_runtime": 280.5004, "train_tokens_per_second": 679.835 }, { "epoch": 0.10310841546626232, "grad_norm": 1.6076759099960327, "learning_rate": 1.9027848101265824e-05, "loss": 0.1249576210975647, "num_input_tokens_seen": 192500, "step": 102, "train_runtime": 282.9772, "train_tokens_per_second": 680.267 }, { "epoch": 0.10411928228455901, "grad_norm": 1.8289830684661865, "learning_rate": 1.9017721518987343e-05, "loss": 0.12983912229537964, "num_input_tokens_seen": 194224, "step": 103, "train_runtime": 285.3966, "train_tokens_per_second": 680.541 }, { "epoch": 0.1051301491028557, "grad_norm": 1.4450889825820923, "learning_rate": 1.9007594936708862e-05, "loss": 0.1161910742521286, "num_input_tokens_seen": 196598, "step": 104, "train_runtime": 287.817, "train_tokens_per_second": 683.066 }, { "epoch": 0.10614101592115238, "grad_norm": 1.6481293439865112, "learning_rate": 1.899746835443038e-05, "loss": 0.12809798121452332, "num_input_tokens_seen": 199018, "step": 105, "train_runtime": 290.2358, "train_tokens_per_second": 685.711 }, { "epoch": 0.10715188273944908, "grad_norm": 1.6318658590316772, "learning_rate": 1.89873417721519e-05, "loss": 0.11569087207317352, "num_input_tokens_seen": 200604, "step": 106, "train_runtime": 292.5091, "train_tokens_per_second": 685.804 }, { "epoch": 0.10816274955774577, "grad_norm": 1.725794792175293, "learning_rate": 1.897721518987342e-05, "loss": 0.1173192709684372, "num_input_tokens_seen": 202286, "step": 107, "train_runtime": 294.7331, "train_tokens_per_second": 686.336 }, { "epoch": 0.10917361637604246, "grad_norm": 1.5027580261230469, "learning_rate": 1.8967088607594938e-05, "loss": 0.12167303264141083, "num_input_tokens_seen": 204376, "step": 108, "train_runtime": 297.0733, "train_tokens_per_second": 687.965 }, { "epoch": 0.11018448319433914, "grad_norm": 1.6913418769836426, "learning_rate": 1.8956962025316457e-05, "loss": 0.11281217634677887, "num_input_tokens_seen": 206010, "step": 109, "train_runtime": 299.2876, "train_tokens_per_second": 688.334 }, { "epoch": 0.11119535001263584, "grad_norm": 1.5609663724899292, "learning_rate": 1.8946835443037976e-05, "loss": 0.14416992664337158, "num_input_tokens_seen": 207814, "step": 110, "train_runtime": 301.5041, "train_tokens_per_second": 689.258 }, { "epoch": 0.11220621683093253, "grad_norm": 1.447195291519165, "learning_rate": 1.8936708860759495e-05, "loss": 0.08768196403980255, "num_input_tokens_seen": 209512, "step": 111, "train_runtime": 303.7733, "train_tokens_per_second": 689.699 }, { "epoch": 0.11321708364922921, "grad_norm": 1.609835147857666, "learning_rate": 1.8926582278481014e-05, "loss": 0.11692729592323303, "num_input_tokens_seen": 211092, "step": 112, "train_runtime": 305.9966, "train_tokens_per_second": 689.851 }, { "epoch": 0.1142279504675259, "grad_norm": 2.001396894454956, "learning_rate": 1.8916455696202533e-05, "loss": 0.12284542620182037, "num_input_tokens_seen": 212812, "step": 113, "train_runtime": 308.2443, "train_tokens_per_second": 690.4 }, { "epoch": 0.1152388172858226, "grad_norm": 1.9883241653442383, "learning_rate": 1.8906329113924053e-05, "loss": 0.12710854411125183, "num_input_tokens_seen": 214682, "step": 114, "train_runtime": 310.611, "train_tokens_per_second": 691.16 }, { "epoch": 0.11624968410411929, "grad_norm": 2.105234146118164, "learning_rate": 1.889620253164557e-05, "loss": 0.14509180188179016, "num_input_tokens_seen": 216826, "step": 115, "train_runtime": 313.0412, "train_tokens_per_second": 692.644 }, { "epoch": 0.11726055092241597, "grad_norm": 1.8560389280319214, "learning_rate": 1.888607594936709e-05, "loss": 0.13155341148376465, "num_input_tokens_seen": 218824, "step": 116, "train_runtime": 315.3893, "train_tokens_per_second": 693.822 }, { "epoch": 0.11827141774071266, "grad_norm": 1.8292335271835327, "learning_rate": 1.887594936708861e-05, "loss": 0.12597715854644775, "num_input_tokens_seen": 220542, "step": 117, "train_runtime": 317.6546, "train_tokens_per_second": 694.282 }, { "epoch": 0.11928228455900936, "grad_norm": 1.6812541484832764, "learning_rate": 1.886582278481013e-05, "loss": 0.10085409134626389, "num_input_tokens_seen": 222116, "step": 118, "train_runtime": 319.8691, "train_tokens_per_second": 694.396 }, { "epoch": 0.12029315137730603, "grad_norm": 1.4323360919952393, "learning_rate": 1.8855696202531648e-05, "loss": 0.08915829658508301, "num_input_tokens_seen": 224040, "step": 119, "train_runtime": 322.2311, "train_tokens_per_second": 695.277 }, { "epoch": 0.12130401819560273, "grad_norm": 1.7646902799606323, "learning_rate": 1.8845569620253167e-05, "loss": 0.11199093610048294, "num_input_tokens_seen": 225810, "step": 120, "train_runtime": 324.5507, "train_tokens_per_second": 695.762 }, { "epoch": 0.12231488501389942, "grad_norm": 1.4256528615951538, "learning_rate": 1.8835443037974686e-05, "loss": 0.0777023658156395, "num_input_tokens_seen": 227214, "step": 121, "train_runtime": 341.3149, "train_tokens_per_second": 665.702 }, { "epoch": 0.12332575183219611, "grad_norm": 1.4666156768798828, "learning_rate": 1.8825316455696202e-05, "loss": 0.10978391766548157, "num_input_tokens_seen": 229020, "step": 122, "train_runtime": 343.5689, "train_tokens_per_second": 666.591 }, { "epoch": 0.1243366186504928, "grad_norm": 1.4810764789581299, "learning_rate": 1.8815189873417724e-05, "loss": 0.09080948680639267, "num_input_tokens_seen": 230962, "step": 123, "train_runtime": 345.9213, "train_tokens_per_second": 667.672 }, { "epoch": 0.1253474854687895, "grad_norm": 1.444600224494934, "learning_rate": 1.8805063291139243e-05, "loss": 0.10851176083087921, "num_input_tokens_seen": 232580, "step": 124, "train_runtime": 348.1398, "train_tokens_per_second": 668.065 }, { "epoch": 0.12635835228708617, "grad_norm": 1.5433681011199951, "learning_rate": 1.879493670886076e-05, "loss": 0.11208166182041168, "num_input_tokens_seen": 234272, "step": 125, "train_runtime": 350.3289, "train_tokens_per_second": 668.72 }, { "epoch": 0.12736921910538287, "grad_norm": 1.2799385786056519, "learning_rate": 1.878481012658228e-05, "loss": 0.09377605468034744, "num_input_tokens_seen": 236512, "step": 126, "train_runtime": 352.664, "train_tokens_per_second": 670.644 }, { "epoch": 0.12838008592367955, "grad_norm": 1.6316152811050415, "learning_rate": 1.87746835443038e-05, "loss": 0.1482527256011963, "num_input_tokens_seen": 238912, "step": 127, "train_runtime": 355.0241, "train_tokens_per_second": 672.946 }, { "epoch": 0.12939095274197623, "grad_norm": 1.8516558408737183, "learning_rate": 1.8764556962025316e-05, "loss": 0.12970715761184692, "num_input_tokens_seen": 241040, "step": 128, "train_runtime": 357.3299, "train_tokens_per_second": 674.559 }, { "epoch": 0.13040181956027294, "grad_norm": 1.7439422607421875, "learning_rate": 1.875443037974684e-05, "loss": 0.10727793723344803, "num_input_tokens_seen": 242810, "step": 129, "train_runtime": 359.5624, "train_tokens_per_second": 675.293 }, { "epoch": 0.13141268637856962, "grad_norm": 1.7847952842712402, "learning_rate": 1.8744303797468355e-05, "loss": 0.12795516848564148, "num_input_tokens_seen": 244636, "step": 130, "train_runtime": 361.8498, "train_tokens_per_second": 676.071 }, { "epoch": 0.1324235531968663, "grad_norm": 1.4231994152069092, "learning_rate": 1.8734177215189874e-05, "loss": 0.09431955963373184, "num_input_tokens_seen": 246324, "step": 131, "train_runtime": 364.1371, "train_tokens_per_second": 676.46 }, { "epoch": 0.133434420015163, "grad_norm": 1.6861406564712524, "learning_rate": 1.8724050632911396e-05, "loss": 0.1439673751592636, "num_input_tokens_seen": 248122, "step": 132, "train_runtime": 366.5857, "train_tokens_per_second": 676.846 }, { "epoch": 0.1344452868334597, "grad_norm": 1.4552510976791382, "learning_rate": 1.8713924050632912e-05, "loss": 0.09559144824743271, "num_input_tokens_seen": 250064, "step": 133, "train_runtime": 368.913, "train_tokens_per_second": 677.84 }, { "epoch": 0.1354561536517564, "grad_norm": 1.485036015510559, "learning_rate": 1.870379746835443e-05, "loss": 0.0976657047867775, "num_input_tokens_seen": 251986, "step": 134, "train_runtime": 371.2416, "train_tokens_per_second": 678.766 }, { "epoch": 0.13646702047005307, "grad_norm": 2.0229406356811523, "learning_rate": 1.8693670886075953e-05, "loss": 0.10776853561401367, "num_input_tokens_seen": 253914, "step": 135, "train_runtime": 373.5523, "train_tokens_per_second": 679.728 }, { "epoch": 0.13747788728834975, "grad_norm": 1.7993659973144531, "learning_rate": 1.868354430379747e-05, "loss": 0.0977972149848938, "num_input_tokens_seen": 255648, "step": 136, "train_runtime": 375.7938, "train_tokens_per_second": 680.288 }, { "epoch": 0.13848875410664646, "grad_norm": 1.521706461906433, "learning_rate": 1.8673417721518988e-05, "loss": 0.08950497210025787, "num_input_tokens_seen": 257298, "step": 137, "train_runtime": 377.9829, "train_tokens_per_second": 680.713 }, { "epoch": 0.13949962092494314, "grad_norm": 1.6079732179641724, "learning_rate": 1.8663291139240507e-05, "loss": 0.1278381645679474, "num_input_tokens_seen": 258954, "step": 138, "train_runtime": 380.2355, "train_tokens_per_second": 681.036 }, { "epoch": 0.14051048774323982, "grad_norm": 1.5357948541641235, "learning_rate": 1.8653164556962026e-05, "loss": 0.09309880435466766, "num_input_tokens_seen": 260652, "step": 139, "train_runtime": 382.4921, "train_tokens_per_second": 681.457 }, { "epoch": 0.14152135456153653, "grad_norm": 1.5426337718963623, "learning_rate": 1.8643037974683545e-05, "loss": 0.09987395256757736, "num_input_tokens_seen": 262534, "step": 140, "train_runtime": 384.7794, "train_tokens_per_second": 682.297 }, { "epoch": 0.1425322213798332, "grad_norm": 1.3595482110977173, "learning_rate": 1.8632911392405064e-05, "loss": 0.08942777663469315, "num_input_tokens_seen": 264060, "step": 141, "train_runtime": 387.0331, "train_tokens_per_second": 682.267 }, { "epoch": 0.1435430881981299, "grad_norm": 1.641709804534912, "learning_rate": 1.8622784810126584e-05, "loss": 0.08591048419475555, "num_input_tokens_seen": 265636, "step": 142, "train_runtime": 389.2082, "train_tokens_per_second": 682.504 }, { "epoch": 0.1445539550164266, "grad_norm": 1.7246475219726562, "learning_rate": 1.8612658227848103e-05, "loss": 0.12977781891822815, "num_input_tokens_seen": 267074, "step": 143, "train_runtime": 391.3529, "train_tokens_per_second": 682.438 }, { "epoch": 0.14556482183472327, "grad_norm": 1.306073546409607, "learning_rate": 1.8602531645569622e-05, "loss": 0.09224815666675568, "num_input_tokens_seen": 269338, "step": 144, "train_runtime": 393.6818, "train_tokens_per_second": 684.151 }, { "epoch": 0.14657568865301995, "grad_norm": 1.6135250329971313, "learning_rate": 1.859240506329114e-05, "loss": 0.1096469908952713, "num_input_tokens_seen": 271342, "step": 145, "train_runtime": 395.971, "train_tokens_per_second": 685.257 }, { "epoch": 0.14758655547131666, "grad_norm": 1.6248900890350342, "learning_rate": 1.858227848101266e-05, "loss": 0.08891341090202332, "num_input_tokens_seen": 273232, "step": 146, "train_runtime": 398.2645, "train_tokens_per_second": 686.057 }, { "epoch": 0.14859742228961334, "grad_norm": 1.447414755821228, "learning_rate": 1.857215189873418e-05, "loss": 0.09662678837776184, "num_input_tokens_seen": 275106, "step": 147, "train_runtime": 400.5277, "train_tokens_per_second": 686.859 }, { "epoch": 0.14960828910791002, "grad_norm": 1.7878117561340332, "learning_rate": 1.8562025316455698e-05, "loss": 0.1260918527841568, "num_input_tokens_seen": 276940, "step": 148, "train_runtime": 402.7234, "train_tokens_per_second": 687.668 }, { "epoch": 0.15061915592620673, "grad_norm": 1.4992377758026123, "learning_rate": 1.8551898734177217e-05, "loss": 0.11068637669086456, "num_input_tokens_seen": 278862, "step": 149, "train_runtime": 405.0307, "train_tokens_per_second": 688.496 }, { "epoch": 0.1516300227445034, "grad_norm": 1.598223090171814, "learning_rate": 1.8541772151898736e-05, "loss": 0.1253667175769806, "num_input_tokens_seen": 280454, "step": 150, "train_runtime": 407.2075, "train_tokens_per_second": 688.725 }, { "epoch": 0.15264088956280011, "grad_norm": 1.4451793432235718, "learning_rate": 1.8531645569620255e-05, "loss": 0.09338060021400452, "num_input_tokens_seen": 282348, "step": 151, "train_runtime": 424.3627, "train_tokens_per_second": 665.346 }, { "epoch": 0.1536517563810968, "grad_norm": 1.3872953653335571, "learning_rate": 1.8521518987341774e-05, "loss": 0.0805031806230545, "num_input_tokens_seen": 284070, "step": 152, "train_runtime": 426.71, "train_tokens_per_second": 665.721 }, { "epoch": 0.15466262319939347, "grad_norm": 1.7340925931930542, "learning_rate": 1.8511392405063293e-05, "loss": 0.1279347985982895, "num_input_tokens_seen": 285946, "step": 153, "train_runtime": 429.024, "train_tokens_per_second": 666.504 }, { "epoch": 0.15567349001769018, "grad_norm": 1.3884550333023071, "learning_rate": 1.850126582278481e-05, "loss": 0.11289025843143463, "num_input_tokens_seen": 287824, "step": 154, "train_runtime": 431.2747, "train_tokens_per_second": 667.38 }, { "epoch": 0.15668435683598686, "grad_norm": 1.3569774627685547, "learning_rate": 1.849113924050633e-05, "loss": 0.10962873697280884, "num_input_tokens_seen": 290194, "step": 155, "train_runtime": 433.69, "train_tokens_per_second": 669.128 }, { "epoch": 0.15769522365428354, "grad_norm": 1.3600742816925049, "learning_rate": 1.848101265822785e-05, "loss": 0.10517730563879013, "num_input_tokens_seen": 292346, "step": 156, "train_runtime": 436.0582, "train_tokens_per_second": 670.429 }, { "epoch": 0.15870609047258025, "grad_norm": 1.3142476081848145, "learning_rate": 1.8470886075949366e-05, "loss": 0.11763598769903183, "num_input_tokens_seen": 294520, "step": 157, "train_runtime": 438.4213, "train_tokens_per_second": 671.774 }, { "epoch": 0.15971695729087693, "grad_norm": 1.3365898132324219, "learning_rate": 1.846075949367089e-05, "loss": 0.11077255010604858, "num_input_tokens_seen": 296632, "step": 158, "train_runtime": 440.8273, "train_tokens_per_second": 672.898 }, { "epoch": 0.1607278241091736, "grad_norm": 1.4594699144363403, "learning_rate": 1.8450632911392408e-05, "loss": 0.09953862428665161, "num_input_tokens_seen": 298670, "step": 159, "train_runtime": 443.2049, "train_tokens_per_second": 673.887 }, { "epoch": 0.1617386909274703, "grad_norm": 1.6890226602554321, "learning_rate": 1.8440506329113924e-05, "loss": 0.11373594403266907, "num_input_tokens_seen": 300156, "step": 160, "train_runtime": 445.3824, "train_tokens_per_second": 673.929 }, { "epoch": 0.162749557745767, "grad_norm": 1.4438869953155518, "learning_rate": 1.8430379746835446e-05, "loss": 0.12429876625537872, "num_input_tokens_seen": 301862, "step": 161, "train_runtime": 447.5962, "train_tokens_per_second": 674.407 }, { "epoch": 0.16376042456406367, "grad_norm": 1.6493380069732666, "learning_rate": 1.8420253164556962e-05, "loss": 0.09954585134983063, "num_input_tokens_seen": 303282, "step": 162, "train_runtime": 449.7545, "train_tokens_per_second": 674.328 }, { "epoch": 0.16477129138236038, "grad_norm": 1.360890507698059, "learning_rate": 1.841012658227848e-05, "loss": 0.10392744094133377, "num_input_tokens_seen": 304986, "step": 163, "train_runtime": 451.9741, "train_tokens_per_second": 674.786 }, { "epoch": 0.16578215820065706, "grad_norm": 1.5973113775253296, "learning_rate": 1.8400000000000003e-05, "loss": 0.10154791176319122, "num_input_tokens_seen": 306760, "step": 164, "train_runtime": 454.1921, "train_tokens_per_second": 675.397 }, { "epoch": 0.16679302501895377, "grad_norm": 1.3810741901397705, "learning_rate": 1.838987341772152e-05, "loss": 0.10939119011163712, "num_input_tokens_seen": 308746, "step": 165, "train_runtime": 456.5098, "train_tokens_per_second": 676.318 }, { "epoch": 0.16780389183725045, "grad_norm": 1.8896007537841797, "learning_rate": 1.8379746835443038e-05, "loss": 0.11585641652345657, "num_input_tokens_seen": 310382, "step": 166, "train_runtime": 458.7116, "train_tokens_per_second": 676.639 }, { "epoch": 0.16881475865554713, "grad_norm": 1.8823837041854858, "learning_rate": 1.836962025316456e-05, "loss": 0.1313817948102951, "num_input_tokens_seen": 312192, "step": 167, "train_runtime": 460.9528, "train_tokens_per_second": 677.275 }, { "epoch": 0.16982562547384383, "grad_norm": 1.5411574840545654, "learning_rate": 1.8359493670886076e-05, "loss": 0.10811397433280945, "num_input_tokens_seen": 313830, "step": 168, "train_runtime": 463.162, "train_tokens_per_second": 677.582 }, { "epoch": 0.1708364922921405, "grad_norm": 1.1355396509170532, "learning_rate": 1.8349367088607595e-05, "loss": 0.08281151205301285, "num_input_tokens_seen": 316264, "step": 169, "train_runtime": 465.5817, "train_tokens_per_second": 679.288 }, { "epoch": 0.1718473591104372, "grad_norm": 1.4537347555160522, "learning_rate": 1.8339240506329115e-05, "loss": 0.10685627907514572, "num_input_tokens_seen": 318554, "step": 170, "train_runtime": 467.9284, "train_tokens_per_second": 680.775 }, { "epoch": 0.1728582259287339, "grad_norm": 1.9830877780914307, "learning_rate": 1.8329113924050634e-05, "loss": 0.12449070811271667, "num_input_tokens_seen": 320016, "step": 171, "train_runtime": 470.0651, "train_tokens_per_second": 680.791 }, { "epoch": 0.17386909274703058, "grad_norm": 1.317903995513916, "learning_rate": 1.8318987341772153e-05, "loss": 0.09867916256189346, "num_input_tokens_seen": 321488, "step": 172, "train_runtime": 472.198, "train_tokens_per_second": 680.833 }, { "epoch": 0.17487995956532726, "grad_norm": 1.537931203842163, "learning_rate": 1.8308860759493672e-05, "loss": 0.11955583095550537, "num_input_tokens_seen": 323296, "step": 173, "train_runtime": 474.4565, "train_tokens_per_second": 681.403 }, { "epoch": 0.17589082638362397, "grad_norm": 1.729315161705017, "learning_rate": 1.829873417721519e-05, "loss": 0.15529963374137878, "num_input_tokens_seen": 325238, "step": 174, "train_runtime": 476.7604, "train_tokens_per_second": 682.183 }, { "epoch": 0.17690169320192065, "grad_norm": 1.2993214130401611, "learning_rate": 1.828860759493671e-05, "loss": 0.10498125106096268, "num_input_tokens_seen": 327534, "step": 175, "train_runtime": 479.0961, "train_tokens_per_second": 683.65 }, { "epoch": 0.17791256002021733, "grad_norm": 1.38814115524292, "learning_rate": 1.827848101265823e-05, "loss": 0.11244213581085205, "num_input_tokens_seen": 329454, "step": 176, "train_runtime": 481.3543, "train_tokens_per_second": 684.431 }, { "epoch": 0.17892342683851403, "grad_norm": 1.5756162405014038, "learning_rate": 1.8268354430379748e-05, "loss": 0.11264954507350922, "num_input_tokens_seen": 331260, "step": 177, "train_runtime": 483.5772, "train_tokens_per_second": 685.02 }, { "epoch": 0.1799342936568107, "grad_norm": 1.7160416841506958, "learning_rate": 1.8258227848101267e-05, "loss": 0.11802274733781815, "num_input_tokens_seen": 333080, "step": 178, "train_runtime": 485.801, "train_tokens_per_second": 685.631 }, { "epoch": 0.1809451604751074, "grad_norm": 1.4553736448287964, "learning_rate": 1.8248101265822786e-05, "loss": 0.08927750587463379, "num_input_tokens_seen": 334598, "step": 179, "train_runtime": 487.9588, "train_tokens_per_second": 685.71 }, { "epoch": 0.1819560272934041, "grad_norm": 1.1470091342926025, "learning_rate": 1.8237974683544305e-05, "loss": 0.07438832521438599, "num_input_tokens_seen": 336020, "step": 180, "train_runtime": 490.0918, "train_tokens_per_second": 685.627 }, { "epoch": 0.18296689411170078, "grad_norm": 1.8155831098556519, "learning_rate": 1.8227848101265824e-05, "loss": 0.1461377888917923, "num_input_tokens_seen": 337744, "step": 181, "train_runtime": 505.6862, "train_tokens_per_second": 667.892 }, { "epoch": 0.18397776092999749, "grad_norm": 1.4382243156433105, "learning_rate": 1.8217721518987344e-05, "loss": 0.06910036504268646, "num_input_tokens_seen": 339166, "step": 182, "train_runtime": 507.8957, "train_tokens_per_second": 667.787 }, { "epoch": 0.18498862774829417, "grad_norm": 1.170188307762146, "learning_rate": 1.8207594936708863e-05, "loss": 0.08987250924110413, "num_input_tokens_seen": 341148, "step": 183, "train_runtime": 510.1967, "train_tokens_per_second": 668.66 }, { "epoch": 0.18599949456659085, "grad_norm": 1.4776676893234253, "learning_rate": 1.8197468354430382e-05, "loss": 0.10269522666931152, "num_input_tokens_seen": 342926, "step": 184, "train_runtime": 512.4435, "train_tokens_per_second": 669.198 }, { "epoch": 0.18701036138488755, "grad_norm": 1.3591065406799316, "learning_rate": 1.81873417721519e-05, "loss": 0.1041112095117569, "num_input_tokens_seen": 344884, "step": 185, "train_runtime": 514.6948, "train_tokens_per_second": 670.075 }, { "epoch": 0.18802122820318423, "grad_norm": 1.5035899877548218, "learning_rate": 1.817721518987342e-05, "loss": 0.13766233623027802, "num_input_tokens_seen": 346828, "step": 186, "train_runtime": 517.0104, "train_tokens_per_second": 670.834 }, { "epoch": 0.1890320950214809, "grad_norm": 1.3790515661239624, "learning_rate": 1.816708860759494e-05, "loss": 0.07921651005744934, "num_input_tokens_seen": 348858, "step": 187, "train_runtime": 519.4003, "train_tokens_per_second": 671.655 }, { "epoch": 0.19004296183977762, "grad_norm": 1.6024411916732788, "learning_rate": 1.8156962025316458e-05, "loss": 0.13930165767669678, "num_input_tokens_seen": 350544, "step": 188, "train_runtime": 521.6743, "train_tokens_per_second": 671.959 }, { "epoch": 0.1910538286580743, "grad_norm": 1.5712974071502686, "learning_rate": 1.8146835443037977e-05, "loss": 0.11272571980953217, "num_input_tokens_seen": 352694, "step": 189, "train_runtime": 524.0062, "train_tokens_per_second": 673.072 }, { "epoch": 0.19206469547637098, "grad_norm": 1.1387803554534912, "learning_rate": 1.8136708860759496e-05, "loss": 0.10390694439411163, "num_input_tokens_seen": 354786, "step": 190, "train_runtime": 526.415, "train_tokens_per_second": 673.966 }, { "epoch": 0.19307556229466769, "grad_norm": 1.6854265928268433, "learning_rate": 1.8126582278481012e-05, "loss": 0.12850573658943176, "num_input_tokens_seen": 356610, "step": 191, "train_runtime": 528.7417, "train_tokens_per_second": 674.45 }, { "epoch": 0.19408642911296436, "grad_norm": 1.5621191263198853, "learning_rate": 1.8116455696202534e-05, "loss": 0.14934185147285461, "num_input_tokens_seen": 358904, "step": 192, "train_runtime": 531.1095, "train_tokens_per_second": 675.763 }, { "epoch": 0.19509729593126104, "grad_norm": 1.9637142419815063, "learning_rate": 1.8106329113924053e-05, "loss": 0.129349023103714, "num_input_tokens_seen": 360522, "step": 193, "train_runtime": 533.3131, "train_tokens_per_second": 676.004 }, { "epoch": 0.19610816274955775, "grad_norm": 1.415863037109375, "learning_rate": 1.809620253164557e-05, "loss": 0.1059366837143898, "num_input_tokens_seen": 362594, "step": 194, "train_runtime": 535.6788, "train_tokens_per_second": 676.887 }, { "epoch": 0.19711902956785443, "grad_norm": 1.4663597345352173, "learning_rate": 1.808607594936709e-05, "loss": 0.08218872547149658, "num_input_tokens_seen": 364210, "step": 195, "train_runtime": 538.0065, "train_tokens_per_second": 676.962 }, { "epoch": 0.1981298963861511, "grad_norm": 1.2336485385894775, "learning_rate": 1.807594936708861e-05, "loss": 0.09393628686666489, "num_input_tokens_seen": 366304, "step": 196, "train_runtime": 540.3737, "train_tokens_per_second": 677.872 }, { "epoch": 0.19914076320444782, "grad_norm": 1.206937313079834, "learning_rate": 1.8065822784810126e-05, "loss": 0.0911276713013649, "num_input_tokens_seen": 368402, "step": 197, "train_runtime": 542.7979, "train_tokens_per_second": 678.709 }, { "epoch": 0.2001516300227445, "grad_norm": 1.638015866279602, "learning_rate": 1.805569620253165e-05, "loss": 0.116812564432621, "num_input_tokens_seen": 370366, "step": 198, "train_runtime": 545.1086, "train_tokens_per_second": 679.435 }, { "epoch": 0.2001516300227445, "eval_loss": 0.4045993685722351, "eval_runtime": 57.2181, "eval_samples_per_second": 15.362, "eval_steps_per_second": 7.69, "num_input_tokens_seen": 370366, "step": 198 }, { "epoch": 0.2011624968410412, "grad_norm": 1.7983155250549316, "learning_rate": 1.8045569620253165e-05, "loss": 0.10726121068000793, "num_input_tokens_seen": 371792, "step": 199, "train_runtime": 604.9973, "train_tokens_per_second": 614.535 }, { "epoch": 0.20217336365933788, "grad_norm": 1.305222988128662, "learning_rate": 1.8035443037974684e-05, "loss": 0.09841762483119965, "num_input_tokens_seen": 373630, "step": 200, "train_runtime": 607.3184, "train_tokens_per_second": 615.213 }, { "epoch": 0.20318423047763456, "grad_norm": 1.360268473625183, "learning_rate": 1.8025316455696206e-05, "loss": 0.08387979865074158, "num_input_tokens_seen": 375662, "step": 201, "train_runtime": 609.6146, "train_tokens_per_second": 616.229 }, { "epoch": 0.20419509729593127, "grad_norm": 1.5405970811843872, "learning_rate": 1.8015189873417722e-05, "loss": 0.08348280191421509, "num_input_tokens_seen": 377436, "step": 202, "train_runtime": 611.8975, "train_tokens_per_second": 616.829 }, { "epoch": 0.20520596411422795, "grad_norm": 1.6074672937393188, "learning_rate": 1.800506329113924e-05, "loss": 0.12273652851581573, "num_input_tokens_seen": 379004, "step": 203, "train_runtime": 614.0767, "train_tokens_per_second": 617.193 }, { "epoch": 0.20621683093252463, "grad_norm": 1.5545850992202759, "learning_rate": 1.7994936708860763e-05, "loss": 0.11406390368938446, "num_input_tokens_seen": 380828, "step": 204, "train_runtime": 616.3233, "train_tokens_per_second": 617.903 }, { "epoch": 0.20722769775082134, "grad_norm": 1.4091166257858276, "learning_rate": 1.798481012658228e-05, "loss": 0.08966867625713348, "num_input_tokens_seen": 382788, "step": 205, "train_runtime": 618.7111, "train_tokens_per_second": 618.686 }, { "epoch": 0.20823856456911802, "grad_norm": 1.5181801319122314, "learning_rate": 1.7974683544303798e-05, "loss": 0.11340916901826859, "num_input_tokens_seen": 384470, "step": 206, "train_runtime": 620.9427, "train_tokens_per_second": 619.171 }, { "epoch": 0.2092494313874147, "grad_norm": 1.1864792108535767, "learning_rate": 1.7964556962025317e-05, "loss": 0.08574163168668747, "num_input_tokens_seen": 386452, "step": 207, "train_runtime": 623.2617, "train_tokens_per_second": 620.048 }, { "epoch": 0.2102602982057114, "grad_norm": 1.295786738395691, "learning_rate": 1.7954430379746836e-05, "loss": 0.1107814610004425, "num_input_tokens_seen": 388504, "step": 208, "train_runtime": 625.6026, "train_tokens_per_second": 621.008 }, { "epoch": 0.21127116502400808, "grad_norm": 1.6799001693725586, "learning_rate": 1.7944303797468355e-05, "loss": 0.10416647046804428, "num_input_tokens_seen": 390166, "step": 209, "train_runtime": 627.8041, "train_tokens_per_second": 621.477 }, { "epoch": 0.21228203184230476, "grad_norm": 1.3828239440917969, "learning_rate": 1.7934177215189875e-05, "loss": 0.09480056911706924, "num_input_tokens_seen": 391552, "step": 210, "train_runtime": 630.0066, "train_tokens_per_second": 621.505 }, { "epoch": 0.21329289866060147, "grad_norm": 1.36429762840271, "learning_rate": 1.7924050632911394e-05, "loss": 0.1117706447839737, "num_input_tokens_seen": 393310, "step": 211, "train_runtime": 645.8096, "train_tokens_per_second": 609.019 }, { "epoch": 0.21430376547889815, "grad_norm": 1.2817749977111816, "learning_rate": 1.7913924050632913e-05, "loss": 0.09771767258644104, "num_input_tokens_seen": 395432, "step": 212, "train_runtime": 648.1951, "train_tokens_per_second": 610.051 }, { "epoch": 0.21531463229719486, "grad_norm": 1.4492032527923584, "learning_rate": 1.7903797468354432e-05, "loss": 0.08509109169244766, "num_input_tokens_seen": 397112, "step": 213, "train_runtime": 650.5053, "train_tokens_per_second": 610.467 }, { "epoch": 0.21632549911549154, "grad_norm": 1.0825918912887573, "learning_rate": 1.789367088607595e-05, "loss": 0.07626418769359589, "num_input_tokens_seen": 399078, "step": 214, "train_runtime": 652.8474, "train_tokens_per_second": 611.288 }, { "epoch": 0.21733636593378822, "grad_norm": 1.3212746381759644, "learning_rate": 1.788354430379747e-05, "loss": 0.09869857132434845, "num_input_tokens_seen": 401186, "step": 215, "train_runtime": 655.1711, "train_tokens_per_second": 612.338 }, { "epoch": 0.21834723275208492, "grad_norm": 1.7335662841796875, "learning_rate": 1.787341772151899e-05, "loss": 0.12159474939107895, "num_input_tokens_seen": 402874, "step": 216, "train_runtime": 657.4287, "train_tokens_per_second": 612.803 }, { "epoch": 0.2193580995703816, "grad_norm": 1.2020677328109741, "learning_rate": 1.7863291139240508e-05, "loss": 0.08844815939664841, "num_input_tokens_seen": 404962, "step": 217, "train_runtime": 659.7366, "train_tokens_per_second": 613.824 }, { "epoch": 0.22036896638867828, "grad_norm": 1.1301757097244263, "learning_rate": 1.7853164556962027e-05, "loss": 0.10469231754541397, "num_input_tokens_seen": 407460, "step": 218, "train_runtime": 662.1986, "train_tokens_per_second": 615.314 }, { "epoch": 0.221379833206975, "grad_norm": 1.5773680210113525, "learning_rate": 1.7843037974683546e-05, "loss": 0.12331892549991608, "num_input_tokens_seen": 409224, "step": 219, "train_runtime": 664.4252, "train_tokens_per_second": 615.907 }, { "epoch": 0.22239070002527167, "grad_norm": 1.22328782081604, "learning_rate": 1.7832911392405065e-05, "loss": 0.08160631358623505, "num_input_tokens_seen": 411000, "step": 220, "train_runtime": 666.6697, "train_tokens_per_second": 616.497 }, { "epoch": 0.22340156684356835, "grad_norm": 1.4057965278625488, "learning_rate": 1.7822784810126584e-05, "loss": 0.12025749683380127, "num_input_tokens_seen": 412552, "step": 221, "train_runtime": 668.8419, "train_tokens_per_second": 616.815 }, { "epoch": 0.22441243366186506, "grad_norm": 1.2786431312561035, "learning_rate": 1.7812658227848104e-05, "loss": 0.0865008682012558, "num_input_tokens_seen": 414648, "step": 222, "train_runtime": 671.1527, "train_tokens_per_second": 617.815 }, { "epoch": 0.22542330048016174, "grad_norm": 1.1525317430496216, "learning_rate": 1.780253164556962e-05, "loss": 0.08533370494842529, "num_input_tokens_seen": 416936, "step": 223, "train_runtime": 673.5284, "train_tokens_per_second": 619.033 }, { "epoch": 0.22643416729845842, "grad_norm": 1.500102162361145, "learning_rate": 1.779240506329114e-05, "loss": 0.09850093722343445, "num_input_tokens_seen": 418750, "step": 224, "train_runtime": 675.7377, "train_tokens_per_second": 619.693 }, { "epoch": 0.22744503411675512, "grad_norm": 1.3471362590789795, "learning_rate": 1.778227848101266e-05, "loss": 0.09441721439361572, "num_input_tokens_seen": 420940, "step": 225, "train_runtime": 678.0766, "train_tokens_per_second": 620.785 }, { "epoch": 0.2284559009350518, "grad_norm": 1.6434186697006226, "learning_rate": 1.7772151898734176e-05, "loss": 0.09287134557962418, "num_input_tokens_seen": 422712, "step": 226, "train_runtime": 680.3077, "train_tokens_per_second": 621.354 }, { "epoch": 0.22946676775334848, "grad_norm": 1.1667215824127197, "learning_rate": 1.77620253164557e-05, "loss": 0.10266640782356262, "num_input_tokens_seen": 424832, "step": 227, "train_runtime": 682.642, "train_tokens_per_second": 622.335 }, { "epoch": 0.2304776345716452, "grad_norm": 1.6905391216278076, "learning_rate": 1.7751898734177218e-05, "loss": 0.11705461144447327, "num_input_tokens_seen": 426646, "step": 228, "train_runtime": 684.9234, "train_tokens_per_second": 622.911 }, { "epoch": 0.23148850138994187, "grad_norm": 1.4415863752365112, "learning_rate": 1.7741772151898734e-05, "loss": 0.1196313351392746, "num_input_tokens_seen": 428700, "step": 229, "train_runtime": 687.2438, "train_tokens_per_second": 623.796 }, { "epoch": 0.23249936820823858, "grad_norm": 1.5781841278076172, "learning_rate": 1.7731645569620256e-05, "loss": 0.1281026005744934, "num_input_tokens_seen": 430232, "step": 230, "train_runtime": 689.4211, "train_tokens_per_second": 624.048 }, { "epoch": 0.23351023502653526, "grad_norm": 1.4502201080322266, "learning_rate": 1.7721518987341772e-05, "loss": 0.09619516134262085, "num_input_tokens_seen": 431962, "step": 231, "train_runtime": 691.6605, "train_tokens_per_second": 624.529 }, { "epoch": 0.23452110184483194, "grad_norm": 1.558029294013977, "learning_rate": 1.771139240506329e-05, "loss": 0.11640623211860657, "num_input_tokens_seen": 434320, "step": 232, "train_runtime": 694.0479, "train_tokens_per_second": 625.778 }, { "epoch": 0.23553196866312864, "grad_norm": 1.0241588354110718, "learning_rate": 1.7701265822784813e-05, "loss": 0.07907229661941528, "num_input_tokens_seen": 436184, "step": 233, "train_runtime": 696.3154, "train_tokens_per_second": 626.417 }, { "epoch": 0.23654283548142532, "grad_norm": 2.456648826599121, "learning_rate": 1.769113924050633e-05, "loss": 0.14079484343528748, "num_input_tokens_seen": 438052, "step": 234, "train_runtime": 698.6063, "train_tokens_per_second": 627.037 }, { "epoch": 0.237553702299722, "grad_norm": 1.2903836965560913, "learning_rate": 1.7681012658227848e-05, "loss": 0.11079635471105576, "num_input_tokens_seen": 440310, "step": 235, "train_runtime": 700.9765, "train_tokens_per_second": 628.138 }, { "epoch": 0.2385645691180187, "grad_norm": 1.4764586687088013, "learning_rate": 1.767088607594937e-05, "loss": 0.13691546022891998, "num_input_tokens_seen": 442282, "step": 236, "train_runtime": 703.2773, "train_tokens_per_second": 628.887 }, { "epoch": 0.2395754359363154, "grad_norm": 1.6779723167419434, "learning_rate": 1.7660759493670886e-05, "loss": 0.14767500758171082, "num_input_tokens_seen": 444134, "step": 237, "train_runtime": 705.5514, "train_tokens_per_second": 629.485 }, { "epoch": 0.24058630275461207, "grad_norm": 1.5181294679641724, "learning_rate": 1.7650632911392405e-05, "loss": 0.10068044811487198, "num_input_tokens_seen": 445702, "step": 238, "train_runtime": 707.7385, "train_tokens_per_second": 629.755 }, { "epoch": 0.24159716957290878, "grad_norm": 1.3846091032028198, "learning_rate": 1.7640506329113925e-05, "loss": 0.13093288242816925, "num_input_tokens_seen": 447646, "step": 239, "train_runtime": 710.0388, "train_tokens_per_second": 630.453 }, { "epoch": 0.24260803639120546, "grad_norm": 1.7610591650009155, "learning_rate": 1.7630379746835444e-05, "loss": 0.09435681253671646, "num_input_tokens_seen": 448988, "step": 240, "train_runtime": 712.1873, "train_tokens_per_second": 630.435 }, { "epoch": 0.24361890320950214, "grad_norm": 1.635029911994934, "learning_rate": 1.7620253164556963e-05, "loss": 0.09653934091329575, "num_input_tokens_seen": 450462, "step": 241, "train_runtime": 729.847, "train_tokens_per_second": 617.201 }, { "epoch": 0.24462977002779884, "grad_norm": 1.7021474838256836, "learning_rate": 1.7610126582278482e-05, "loss": 0.0920029804110527, "num_input_tokens_seen": 451978, "step": 242, "train_runtime": 732.0506, "train_tokens_per_second": 617.414 }, { "epoch": 0.24564063684609552, "grad_norm": 1.4489452838897705, "learning_rate": 1.76e-05, "loss": 0.08425816893577576, "num_input_tokens_seen": 453610, "step": 243, "train_runtime": 734.2579, "train_tokens_per_second": 617.78 }, { "epoch": 0.24665150366439223, "grad_norm": 1.2246116399765015, "learning_rate": 1.758987341772152e-05, "loss": 0.10387931764125824, "num_input_tokens_seen": 455582, "step": 244, "train_runtime": 736.5776, "train_tokens_per_second": 618.512 }, { "epoch": 0.2476623704826889, "grad_norm": 1.3314871788024902, "learning_rate": 1.757974683544304e-05, "loss": 0.07409219443798065, "num_input_tokens_seen": 457100, "step": 245, "train_runtime": 738.7345, "train_tokens_per_second": 618.761 }, { "epoch": 0.2486732373009856, "grad_norm": 1.466596007347107, "learning_rate": 1.7569620253164558e-05, "loss": 0.10883258283138275, "num_input_tokens_seen": 459110, "step": 246, "train_runtime": 741.0587, "train_tokens_per_second": 619.533 }, { "epoch": 0.2496841041192823, "grad_norm": 2.061326026916504, "learning_rate": 1.7559493670886077e-05, "loss": 0.1471419781446457, "num_input_tokens_seen": 460896, "step": 247, "train_runtime": 743.3057, "train_tokens_per_second": 620.063 }, { "epoch": 0.250694970937579, "grad_norm": 1.279106616973877, "learning_rate": 1.7549367088607596e-05, "loss": 0.08752479404211044, "num_input_tokens_seen": 462456, "step": 248, "train_runtime": 745.4907, "train_tokens_per_second": 620.338 }, { "epoch": 0.2517058377558757, "grad_norm": 1.5109342336654663, "learning_rate": 1.7539240506329115e-05, "loss": 0.09314848482608795, "num_input_tokens_seen": 464000, "step": 249, "train_runtime": 747.7051, "train_tokens_per_second": 620.566 }, { "epoch": 0.25271670457417234, "grad_norm": 1.7662253379821777, "learning_rate": 1.7529113924050634e-05, "loss": 0.08689254522323608, "num_input_tokens_seen": 465810, "step": 250, "train_runtime": 750.1167, "train_tokens_per_second": 620.983 }, { "epoch": 0.25372757139246904, "grad_norm": 1.5193723440170288, "learning_rate": 1.7518987341772154e-05, "loss": 0.11294049024581909, "num_input_tokens_seen": 468190, "step": 251, "train_runtime": 752.6207, "train_tokens_per_second": 622.08 }, { "epoch": 0.25473843821076575, "grad_norm": 1.3169605731964111, "learning_rate": 1.7508860759493673e-05, "loss": 0.08772353082895279, "num_input_tokens_seen": 470162, "step": 252, "train_runtime": 754.9573, "train_tokens_per_second": 622.766 }, { "epoch": 0.2557493050290624, "grad_norm": 1.653164029121399, "learning_rate": 1.7498734177215192e-05, "loss": 0.12575408816337585, "num_input_tokens_seen": 472040, "step": 253, "train_runtime": 757.2276, "train_tokens_per_second": 623.379 }, { "epoch": 0.2567601718473591, "grad_norm": 1.513001799583435, "learning_rate": 1.748860759493671e-05, "loss": 0.10402000695466995, "num_input_tokens_seen": 474150, "step": 254, "train_runtime": 759.5128, "train_tokens_per_second": 624.282 }, { "epoch": 0.2577710386656558, "grad_norm": 1.3591423034667969, "learning_rate": 1.747848101265823e-05, "loss": 0.08404304832220078, "num_input_tokens_seen": 476552, "step": 255, "train_runtime": 761.9035, "train_tokens_per_second": 625.476 }, { "epoch": 0.25878190548395247, "grad_norm": 1.7220196723937988, "learning_rate": 1.746835443037975e-05, "loss": 0.10737068206071854, "num_input_tokens_seen": 478316, "step": 256, "train_runtime": 764.1431, "train_tokens_per_second": 625.951 }, { "epoch": 0.2597927723022492, "grad_norm": 1.4888932704925537, "learning_rate": 1.7458227848101268e-05, "loss": 0.11215661466121674, "num_input_tokens_seen": 480664, "step": 257, "train_runtime": 766.5332, "train_tokens_per_second": 627.062 }, { "epoch": 0.2608036391205459, "grad_norm": 1.499002456665039, "learning_rate": 1.7448101265822787e-05, "loss": 0.09889926016330719, "num_input_tokens_seen": 482522, "step": 258, "train_runtime": 768.7862, "train_tokens_per_second": 627.641 }, { "epoch": 0.26181450593884253, "grad_norm": 1.3719797134399414, "learning_rate": 1.7437974683544306e-05, "loss": 0.12259243428707123, "num_input_tokens_seen": 484608, "step": 259, "train_runtime": 771.1057, "train_tokens_per_second": 628.459 }, { "epoch": 0.26282537275713924, "grad_norm": 1.3795220851898193, "learning_rate": 1.7427848101265825e-05, "loss": 0.10820159316062927, "num_input_tokens_seen": 486676, "step": 260, "train_runtime": 773.398, "train_tokens_per_second": 629.27 }, { "epoch": 0.26383623957543595, "grad_norm": 1.8952531814575195, "learning_rate": 1.7417721518987344e-05, "loss": 0.1369628757238388, "num_input_tokens_seen": 488252, "step": 261, "train_runtime": 775.574, "train_tokens_per_second": 629.536 }, { "epoch": 0.2648471063937326, "grad_norm": 1.487768292427063, "learning_rate": 1.7407594936708863e-05, "loss": 0.12266696989536285, "num_input_tokens_seen": 490056, "step": 262, "train_runtime": 777.8833, "train_tokens_per_second": 629.987 }, { "epoch": 0.2658579732120293, "grad_norm": 1.667852520942688, "learning_rate": 1.739746835443038e-05, "loss": 0.13039934635162354, "num_input_tokens_seen": 492050, "step": 263, "train_runtime": 780.2294, "train_tokens_per_second": 630.648 }, { "epoch": 0.266868840030326, "grad_norm": 1.686392068862915, "learning_rate": 1.73873417721519e-05, "loss": 0.09256687760353088, "num_input_tokens_seen": 494088, "step": 264, "train_runtime": 782.5517, "train_tokens_per_second": 631.381 }, { "epoch": 0.26787970684862267, "grad_norm": 1.3775935173034668, "learning_rate": 1.737721518987342e-05, "loss": 0.13270871341228485, "num_input_tokens_seen": 496250, "step": 265, "train_runtime": 784.8891, "train_tokens_per_second": 632.255 }, { "epoch": 0.2688905736669194, "grad_norm": 1.4882550239562988, "learning_rate": 1.7367088607594936e-05, "loss": 0.11100231111049652, "num_input_tokens_seen": 498554, "step": 266, "train_runtime": 787.3206, "train_tokens_per_second": 633.229 }, { "epoch": 0.2699014404852161, "grad_norm": 1.6049178838729858, "learning_rate": 1.735696202531646e-05, "loss": 0.10452968627214432, "num_input_tokens_seen": 500336, "step": 267, "train_runtime": 789.5692, "train_tokens_per_second": 633.682 }, { "epoch": 0.2709123073035128, "grad_norm": 1.414746880531311, "learning_rate": 1.7346835443037978e-05, "loss": 0.11845418810844421, "num_input_tokens_seen": 502388, "step": 268, "train_runtime": 791.8439, "train_tokens_per_second": 634.453 }, { "epoch": 0.27192317412180944, "grad_norm": 1.485299825668335, "learning_rate": 1.7336708860759494e-05, "loss": 0.08825024962425232, "num_input_tokens_seen": 504016, "step": 269, "train_runtime": 794.1155, "train_tokens_per_second": 634.689 }, { "epoch": 0.27293404094010615, "grad_norm": 1.4826604127883911, "learning_rate": 1.7326582278481016e-05, "loss": 0.13610872626304626, "num_input_tokens_seen": 506228, "step": 270, "train_runtime": 796.5551, "train_tokens_per_second": 635.522 }, { "epoch": 0.27394490775840286, "grad_norm": 1.5785086154937744, "learning_rate": 1.7316455696202532e-05, "loss": 0.09215106070041656, "num_input_tokens_seen": 507924, "step": 271, "train_runtime": 814.0631, "train_tokens_per_second": 623.937 }, { "epoch": 0.2749557745766995, "grad_norm": 1.530111312866211, "learning_rate": 1.730632911392405e-05, "loss": 0.10139001160860062, "num_input_tokens_seen": 509700, "step": 272, "train_runtime": 816.4309, "train_tokens_per_second": 624.303 }, { "epoch": 0.2759666413949962, "grad_norm": 1.2713271379470825, "learning_rate": 1.729620253164557e-05, "loss": 0.1057865172624588, "num_input_tokens_seen": 511482, "step": 273, "train_runtime": 818.8016, "train_tokens_per_second": 624.671 }, { "epoch": 0.2769775082132929, "grad_norm": 1.2762155532836914, "learning_rate": 1.728607594936709e-05, "loss": 0.10544420778751373, "num_input_tokens_seen": 513976, "step": 274, "train_runtime": 821.2782, "train_tokens_per_second": 625.824 }, { "epoch": 0.2779883750315896, "grad_norm": 1.5279234647750854, "learning_rate": 1.7275949367088608e-05, "loss": 0.1072789803147316, "num_input_tokens_seen": 515382, "step": 275, "train_runtime": 823.4179, "train_tokens_per_second": 625.906 }, { "epoch": 0.2789992418498863, "grad_norm": 1.2843568325042725, "learning_rate": 1.7265822784810127e-05, "loss": 0.08076569437980652, "num_input_tokens_seen": 517038, "step": 276, "train_runtime": 825.793, "train_tokens_per_second": 626.111 }, { "epoch": 0.280010108668183, "grad_norm": 1.492134928703308, "learning_rate": 1.7255696202531646e-05, "loss": 0.11192678660154343, "num_input_tokens_seen": 519080, "step": 277, "train_runtime": 828.1851, "train_tokens_per_second": 626.768 }, { "epoch": 0.28102097548647964, "grad_norm": 1.2823917865753174, "learning_rate": 1.7245569620253165e-05, "loss": 0.11176803708076477, "num_input_tokens_seen": 520804, "step": 278, "train_runtime": 830.4401, "train_tokens_per_second": 627.142 }, { "epoch": 0.28203184230477635, "grad_norm": 1.2782809734344482, "learning_rate": 1.7235443037974685e-05, "loss": 0.11687865853309631, "num_input_tokens_seen": 523082, "step": 279, "train_runtime": 832.7674, "train_tokens_per_second": 628.125 }, { "epoch": 0.28304270912307306, "grad_norm": 1.5529136657714844, "learning_rate": 1.7225316455696204e-05, "loss": 0.11955727636814117, "num_input_tokens_seen": 524988, "step": 280, "train_runtime": 835.0226, "train_tokens_per_second": 628.711 }, { "epoch": 0.2840535759413697, "grad_norm": 2.094829797744751, "learning_rate": 1.7215189873417723e-05, "loss": 0.09432722628116608, "num_input_tokens_seen": 526770, "step": 281, "train_runtime": 837.2395, "train_tokens_per_second": 629.175 }, { "epoch": 0.2850644427596664, "grad_norm": 1.9160499572753906, "learning_rate": 1.7205063291139242e-05, "loss": 0.09831471741199493, "num_input_tokens_seen": 528400, "step": 282, "train_runtime": 839.4927, "train_tokens_per_second": 629.428 }, { "epoch": 0.2860753095779631, "grad_norm": 1.2781708240509033, "learning_rate": 1.719493670886076e-05, "loss": 0.09331564605236053, "num_input_tokens_seen": 530224, "step": 283, "train_runtime": 841.7166, "train_tokens_per_second": 629.932 }, { "epoch": 0.2870861763962598, "grad_norm": 1.4574735164642334, "learning_rate": 1.718481012658228e-05, "loss": 0.10699676722288132, "num_input_tokens_seen": 532286, "step": 284, "train_runtime": 844.0128, "train_tokens_per_second": 630.661 }, { "epoch": 0.2880970432145565, "grad_norm": 1.2516075372695923, "learning_rate": 1.71746835443038e-05, "loss": 0.0777752548456192, "num_input_tokens_seen": 534178, "step": 285, "train_runtime": 846.5658, "train_tokens_per_second": 630.994 }, { "epoch": 0.2891079100328532, "grad_norm": 1.3657443523406982, "learning_rate": 1.7164556962025318e-05, "loss": 0.10243025422096252, "num_input_tokens_seen": 535870, "step": 286, "train_runtime": 848.7713, "train_tokens_per_second": 631.348 }, { "epoch": 0.29011877685114984, "grad_norm": 1.4470164775848389, "learning_rate": 1.7154430379746837e-05, "loss": 0.11428594589233398, "num_input_tokens_seen": 537938, "step": 287, "train_runtime": 851.0535, "train_tokens_per_second": 632.085 }, { "epoch": 0.29112964366944655, "grad_norm": 1.3402222394943237, "learning_rate": 1.7144303797468356e-05, "loss": 0.09148528426885605, "num_input_tokens_seen": 540342, "step": 288, "train_runtime": 853.4611, "train_tokens_per_second": 633.118 }, { "epoch": 0.29214051048774325, "grad_norm": 1.4701645374298096, "learning_rate": 1.7134177215189875e-05, "loss": 0.10003398358821869, "num_input_tokens_seen": 542224, "step": 289, "train_runtime": 855.7411, "train_tokens_per_second": 633.631 }, { "epoch": 0.2931513773060399, "grad_norm": 1.7833036184310913, "learning_rate": 1.7124050632911394e-05, "loss": 0.10028425604104996, "num_input_tokens_seen": 544196, "step": 290, "train_runtime": 858.0045, "train_tokens_per_second": 634.258 }, { "epoch": 0.2941622441243366, "grad_norm": 1.3784419298171997, "learning_rate": 1.7113924050632914e-05, "loss": 0.09718849509954453, "num_input_tokens_seen": 546366, "step": 291, "train_runtime": 860.3662, "train_tokens_per_second": 635.039 }, { "epoch": 0.2951731109426333, "grad_norm": 1.7228463888168335, "learning_rate": 1.7103797468354433e-05, "loss": 0.09118913114070892, "num_input_tokens_seen": 548322, "step": 292, "train_runtime": 862.6776, "train_tokens_per_second": 635.605 }, { "epoch": 0.29618397776093, "grad_norm": 1.278310775756836, "learning_rate": 1.7093670886075952e-05, "loss": 0.08900696039199829, "num_input_tokens_seen": 550206, "step": 293, "train_runtime": 864.9696, "train_tokens_per_second": 636.099 }, { "epoch": 0.2971948445792267, "grad_norm": 1.6270031929016113, "learning_rate": 1.708354430379747e-05, "loss": 0.09637334942817688, "num_input_tokens_seen": 552534, "step": 294, "train_runtime": 867.3358, "train_tokens_per_second": 637.047 }, { "epoch": 0.2982057113975234, "grad_norm": 1.4598493576049805, "learning_rate": 1.7073417721518987e-05, "loss": 0.13069799542427063, "num_input_tokens_seen": 554498, "step": 295, "train_runtime": 869.6432, "train_tokens_per_second": 637.615 }, { "epoch": 0.29921657821582004, "grad_norm": 1.857382893562317, "learning_rate": 1.706329113924051e-05, "loss": 0.08895819634199142, "num_input_tokens_seen": 555778, "step": 296, "train_runtime": 871.7636, "train_tokens_per_second": 637.533 }, { "epoch": 0.30022744503411675, "grad_norm": 1.45383882522583, "learning_rate": 1.7053164556962028e-05, "loss": 0.08400879800319672, "num_input_tokens_seen": 557814, "step": 297, "train_runtime": 874.0642, "train_tokens_per_second": 638.184 }, { "epoch": 0.30123831185241345, "grad_norm": 1.2739516496658325, "learning_rate": 1.7043037974683544e-05, "loss": 0.09343541413545609, "num_input_tokens_seen": 560236, "step": 298, "train_runtime": 876.4843, "train_tokens_per_second": 639.185 }, { "epoch": 0.30224917867071016, "grad_norm": 1.4769498109817505, "learning_rate": 1.7032911392405066e-05, "loss": 0.0803271234035492, "num_input_tokens_seen": 561910, "step": 299, "train_runtime": 878.688, "train_tokens_per_second": 639.488 }, { "epoch": 0.3032600454890068, "grad_norm": 1.2992624044418335, "learning_rate": 1.7022784810126585e-05, "loss": 0.07486756145954132, "num_input_tokens_seen": 563520, "step": 300, "train_runtime": 880.8268, "train_tokens_per_second": 639.763 }, { "epoch": 0.3042709123073035, "grad_norm": 1.409480333328247, "learning_rate": 1.70126582278481e-05, "loss": 0.12226992845535278, "num_input_tokens_seen": 565432, "step": 301, "train_runtime": 897.9704, "train_tokens_per_second": 629.678 }, { "epoch": 0.30528177912560023, "grad_norm": 1.3607956171035767, "learning_rate": 1.7002531645569623e-05, "loss": 0.08789639174938202, "num_input_tokens_seen": 567426, "step": 302, "train_runtime": 900.2444, "train_tokens_per_second": 630.302 }, { "epoch": 0.3062926459438969, "grad_norm": 1.2299937009811401, "learning_rate": 1.699240506329114e-05, "loss": 0.08111349493265152, "num_input_tokens_seen": 569566, "step": 303, "train_runtime": 902.5401, "train_tokens_per_second": 631.07 }, { "epoch": 0.3073035127621936, "grad_norm": 1.6185789108276367, "learning_rate": 1.6982278481012658e-05, "loss": 0.09807392954826355, "num_input_tokens_seen": 570788, "step": 304, "train_runtime": 904.614, "train_tokens_per_second": 630.974 }, { "epoch": 0.3083143795804903, "grad_norm": 1.7131162881851196, "learning_rate": 1.697215189873418e-05, "loss": 0.12074774503707886, "num_input_tokens_seen": 572294, "step": 305, "train_runtime": 906.7949, "train_tokens_per_second": 631.117 }, { "epoch": 0.30932524639878695, "grad_norm": 1.5033224821090698, "learning_rate": 1.6962025316455696e-05, "loss": 0.13393236696720123, "num_input_tokens_seen": 574604, "step": 306, "train_runtime": 909.1603, "train_tokens_per_second": 632.016 }, { "epoch": 0.31033611321708365, "grad_norm": 1.6546261310577393, "learning_rate": 1.6951898734177216e-05, "loss": 0.10731075704097748, "num_input_tokens_seen": 576448, "step": 307, "train_runtime": 911.393, "train_tokens_per_second": 632.491 }, { "epoch": 0.31134698003538036, "grad_norm": 1.6043623685836792, "learning_rate": 1.6941772151898738e-05, "loss": 0.10167066007852554, "num_input_tokens_seen": 578256, "step": 308, "train_runtime": 913.6297, "train_tokens_per_second": 632.922 }, { "epoch": 0.312357846853677, "grad_norm": 1.7753088474273682, "learning_rate": 1.6931645569620254e-05, "loss": 0.13217665255069733, "num_input_tokens_seen": 580722, "step": 309, "train_runtime": 916.0141, "train_tokens_per_second": 633.966 }, { "epoch": 0.3133687136719737, "grad_norm": 1.5941412448883057, "learning_rate": 1.6921518987341773e-05, "loss": 0.10651037096977234, "num_input_tokens_seen": 582702, "step": 310, "train_runtime": 918.317, "train_tokens_per_second": 634.533 }, { "epoch": 0.3143795804902704, "grad_norm": 1.6881039142608643, "learning_rate": 1.6911392405063292e-05, "loss": 0.13192051649093628, "num_input_tokens_seen": 584540, "step": 311, "train_runtime": 920.6956, "train_tokens_per_second": 634.89 }, { "epoch": 0.3153904473085671, "grad_norm": 1.2865118980407715, "learning_rate": 1.690126582278481e-05, "loss": 0.09769687056541443, "num_input_tokens_seen": 586196, "step": 312, "train_runtime": 922.9055, "train_tokens_per_second": 635.164 }, { "epoch": 0.3164013141268638, "grad_norm": 1.3329963684082031, "learning_rate": 1.689113924050633e-05, "loss": 0.08811003714799881, "num_input_tokens_seen": 588350, "step": 313, "train_runtime": 925.2492, "train_tokens_per_second": 635.883 }, { "epoch": 0.3174121809451605, "grad_norm": 1.3556103706359863, "learning_rate": 1.688101265822785e-05, "loss": 0.10852400213479996, "num_input_tokens_seen": 590494, "step": 314, "train_runtime": 927.5584, "train_tokens_per_second": 636.611 }, { "epoch": 0.31842304776345715, "grad_norm": 1.3499561548233032, "learning_rate": 1.6870886075949368e-05, "loss": 0.08952528238296509, "num_input_tokens_seen": 592296, "step": 315, "train_runtime": 929.8427, "train_tokens_per_second": 636.985 }, { "epoch": 0.31943391458175385, "grad_norm": 1.6870841979980469, "learning_rate": 1.6860759493670887e-05, "loss": 0.14597761631011963, "num_input_tokens_seen": 594442, "step": 316, "train_runtime": 932.2967, "train_tokens_per_second": 637.61 }, { "epoch": 0.32044478140005056, "grad_norm": 1.2874904870986938, "learning_rate": 1.6850632911392406e-05, "loss": 0.10051897168159485, "num_input_tokens_seen": 596700, "step": 317, "train_runtime": 934.7422, "train_tokens_per_second": 638.358 }, { "epoch": 0.3214556482183472, "grad_norm": 1.3767913579940796, "learning_rate": 1.6840506329113925e-05, "loss": 0.1061960756778717, "num_input_tokens_seen": 598890, "step": 318, "train_runtime": 937.2301, "train_tokens_per_second": 639.0 }, { "epoch": 0.3224665150366439, "grad_norm": 1.6041687726974487, "learning_rate": 1.6830379746835445e-05, "loss": 0.10163749754428864, "num_input_tokens_seen": 600748, "step": 319, "train_runtime": 939.6168, "train_tokens_per_second": 639.354 }, { "epoch": 0.3234773818549406, "grad_norm": 1.4598690271377563, "learning_rate": 1.6820253164556964e-05, "loss": 0.09881944954395294, "num_input_tokens_seen": 602598, "step": 320, "train_runtime": 941.9622, "train_tokens_per_second": 639.726 }, { "epoch": 0.3244882486732373, "grad_norm": 1.4148222208023071, "learning_rate": 1.6810126582278483e-05, "loss": 0.0919995978474617, "num_input_tokens_seen": 604068, "step": 321, "train_runtime": 944.1339, "train_tokens_per_second": 639.812 }, { "epoch": 0.325499115491534, "grad_norm": 1.1756342649459839, "learning_rate": 1.6800000000000002e-05, "loss": 0.0852050930261612, "num_input_tokens_seen": 605770, "step": 322, "train_runtime": 946.385, "train_tokens_per_second": 640.088 }, { "epoch": 0.3265099823098307, "grad_norm": 1.5971572399139404, "learning_rate": 1.678987341772152e-05, "loss": 0.11823036521673203, "num_input_tokens_seen": 607382, "step": 323, "train_runtime": 948.592, "train_tokens_per_second": 640.298 }, { "epoch": 0.32752084912812734, "grad_norm": 1.3547089099884033, "learning_rate": 1.677974683544304e-05, "loss": 0.11181734502315521, "num_input_tokens_seen": 609506, "step": 324, "train_runtime": 950.9562, "train_tokens_per_second": 640.94 }, { "epoch": 0.32853171594642405, "grad_norm": 1.2220993041992188, "learning_rate": 1.676962025316456e-05, "loss": 0.0703224316239357, "num_input_tokens_seen": 611400, "step": 325, "train_runtime": 953.2391, "train_tokens_per_second": 641.392 }, { "epoch": 0.32954258276472076, "grad_norm": 1.8233991861343384, "learning_rate": 1.6759493670886078e-05, "loss": 0.11083690822124481, "num_input_tokens_seen": 612836, "step": 326, "train_runtime": 955.3964, "train_tokens_per_second": 641.447 }, { "epoch": 0.3305534495830174, "grad_norm": 1.5295997858047485, "learning_rate": 1.6749367088607594e-05, "loss": 0.1028873473405838, "num_input_tokens_seen": 614146, "step": 327, "train_runtime": 957.5511, "train_tokens_per_second": 641.371 }, { "epoch": 0.3315643164013141, "grad_norm": 2.0421392917633057, "learning_rate": 1.6739240506329116e-05, "loss": 0.08458258956670761, "num_input_tokens_seen": 615256, "step": 328, "train_runtime": 959.6481, "train_tokens_per_second": 641.127 }, { "epoch": 0.3325751832196108, "grad_norm": 1.3370336294174194, "learning_rate": 1.6729113924050635e-05, "loss": 0.08434239029884338, "num_input_tokens_seen": 617376, "step": 329, "train_runtime": 961.9827, "train_tokens_per_second": 641.775 }, { "epoch": 0.33358605003790753, "grad_norm": 1.5026538372039795, "learning_rate": 1.671898734177215e-05, "loss": 0.12171722948551178, "num_input_tokens_seen": 619276, "step": 330, "train_runtime": 964.2576, "train_tokens_per_second": 642.231 }, { "epoch": 0.3345969168562042, "grad_norm": 1.5519927740097046, "learning_rate": 1.6708860759493674e-05, "loss": 0.11145951598882675, "num_input_tokens_seen": 621170, "step": 331, "train_runtime": 981.4765, "train_tokens_per_second": 632.893 }, { "epoch": 0.3356077836745009, "grad_norm": 1.5354214906692505, "learning_rate": 1.6698734177215193e-05, "loss": 0.1101895347237587, "num_input_tokens_seen": 623702, "step": 332, "train_runtime": 983.9355, "train_tokens_per_second": 633.885 }, { "epoch": 0.3366186504927976, "grad_norm": 1.3286933898925781, "learning_rate": 1.668860759493671e-05, "loss": 0.07348203659057617, "num_input_tokens_seen": 625398, "step": 333, "train_runtime": 986.1737, "train_tokens_per_second": 634.166 }, { "epoch": 0.33762951731109425, "grad_norm": 1.9805306196212769, "learning_rate": 1.667848101265823e-05, "loss": 0.09451054036617279, "num_input_tokens_seen": 627014, "step": 334, "train_runtime": 988.3484, "train_tokens_per_second": 634.406 }, { "epoch": 0.33864038412939096, "grad_norm": 1.3444042205810547, "learning_rate": 1.6668354430379746e-05, "loss": 0.09824031591415405, "num_input_tokens_seen": 628980, "step": 335, "train_runtime": 990.6394, "train_tokens_per_second": 634.923 }, { "epoch": 0.33965125094768767, "grad_norm": 1.9391517639160156, "learning_rate": 1.6658227848101266e-05, "loss": 0.11450466513633728, "num_input_tokens_seen": 630750, "step": 336, "train_runtime": 992.9136, "train_tokens_per_second": 635.252 }, { "epoch": 0.3406621177659843, "grad_norm": 1.6187993288040161, "learning_rate": 1.6648101265822788e-05, "loss": 0.12155002355575562, "num_input_tokens_seen": 632848, "step": 337, "train_runtime": 995.2466, "train_tokens_per_second": 635.871 }, { "epoch": 0.341672984584281, "grad_norm": 1.7981492280960083, "learning_rate": 1.6637974683544304e-05, "loss": 0.13006402552127838, "num_input_tokens_seen": 634710, "step": 338, "train_runtime": 997.5703, "train_tokens_per_second": 636.256 }, { "epoch": 0.34268385140257773, "grad_norm": 1.4146748781204224, "learning_rate": 1.6627848101265823e-05, "loss": 0.07810388505458832, "num_input_tokens_seen": 636400, "step": 339, "train_runtime": 999.8783, "train_tokens_per_second": 636.477 }, { "epoch": 0.3436947182208744, "grad_norm": 1.3834339380264282, "learning_rate": 1.6617721518987345e-05, "loss": 0.09099924564361572, "num_input_tokens_seen": 638424, "step": 340, "train_runtime": 1002.2323, "train_tokens_per_second": 637.002 }, { "epoch": 0.3447055850391711, "grad_norm": 1.5695958137512207, "learning_rate": 1.660759493670886e-05, "loss": 0.10461483895778656, "num_input_tokens_seen": 639900, "step": 341, "train_runtime": 1004.4667, "train_tokens_per_second": 637.054 }, { "epoch": 0.3457164518574678, "grad_norm": 1.3106541633605957, "learning_rate": 1.659746835443038e-05, "loss": 0.10517305135726929, "num_input_tokens_seen": 641800, "step": 342, "train_runtime": 1006.7328, "train_tokens_per_second": 637.508 }, { "epoch": 0.34672731867576445, "grad_norm": 1.5017896890640259, "learning_rate": 1.65873417721519e-05, "loss": 0.11018554121255875, "num_input_tokens_seen": 644028, "step": 343, "train_runtime": 1009.0752, "train_tokens_per_second": 638.236 }, { "epoch": 0.34773818549406116, "grad_norm": 1.2032376527786255, "learning_rate": 1.6577215189873418e-05, "loss": 0.08843756467103958, "num_input_tokens_seen": 645904, "step": 344, "train_runtime": 1011.346, "train_tokens_per_second": 638.658 }, { "epoch": 0.34874905231235787, "grad_norm": 1.1695470809936523, "learning_rate": 1.6567088607594937e-05, "loss": 0.06325731426477432, "num_input_tokens_seen": 647174, "step": 345, "train_runtime": 1013.4667, "train_tokens_per_second": 638.574 }, { "epoch": 0.3497599191306545, "grad_norm": 1.8199679851531982, "learning_rate": 1.6556962025316456e-05, "loss": 0.12382033467292786, "num_input_tokens_seen": 648866, "step": 346, "train_runtime": 1015.6887, "train_tokens_per_second": 638.843 }, { "epoch": 0.3507707859489512, "grad_norm": 1.3210959434509277, "learning_rate": 1.6546835443037976e-05, "loss": 0.10739161819219589, "num_input_tokens_seen": 651554, "step": 347, "train_runtime": 1018.2033, "train_tokens_per_second": 639.906 }, { "epoch": 0.35178165276724793, "grad_norm": 1.9572030305862427, "learning_rate": 1.6536708860759495e-05, "loss": 0.08785548061132431, "num_input_tokens_seen": 652762, "step": 348, "train_runtime": 1020.3918, "train_tokens_per_second": 639.717 }, { "epoch": 0.3527925195855446, "grad_norm": 1.2821578979492188, "learning_rate": 1.6526582278481014e-05, "loss": 0.07090479135513306, "num_input_tokens_seen": 654322, "step": 349, "train_runtime": 1022.5927, "train_tokens_per_second": 639.866 }, { "epoch": 0.3538033864038413, "grad_norm": 1.4195822477340698, "learning_rate": 1.6516455696202533e-05, "loss": 0.08603788167238235, "num_input_tokens_seen": 656156, "step": 350, "train_runtime": 1024.8406, "train_tokens_per_second": 640.252 }, { "epoch": 0.354814253222138, "grad_norm": 1.4972152709960938, "learning_rate": 1.6506329113924052e-05, "loss": 0.09922720491886139, "num_input_tokens_seen": 657980, "step": 351, "train_runtime": 1027.1208, "train_tokens_per_second": 640.606 }, { "epoch": 0.35582512004043465, "grad_norm": 1.589414358139038, "learning_rate": 1.649620253164557e-05, "loss": 0.11485034972429276, "num_input_tokens_seen": 659612, "step": 352, "train_runtime": 1029.33, "train_tokens_per_second": 640.817 }, { "epoch": 0.35683598685873136, "grad_norm": 1.634354829788208, "learning_rate": 1.648607594936709e-05, "loss": 0.11900883913040161, "num_input_tokens_seen": 661560, "step": 353, "train_runtime": 1031.6102, "train_tokens_per_second": 641.289 }, { "epoch": 0.35784685367702807, "grad_norm": 1.4277557134628296, "learning_rate": 1.647594936708861e-05, "loss": 0.09803351014852524, "num_input_tokens_seen": 663524, "step": 354, "train_runtime": 1033.9392, "train_tokens_per_second": 641.744 }, { "epoch": 0.3588577204953247, "grad_norm": 1.006697654724121, "learning_rate": 1.6465822784810128e-05, "loss": 0.07800620794296265, "num_input_tokens_seen": 666486, "step": 355, "train_runtime": 1036.5554, "train_tokens_per_second": 642.982 }, { "epoch": 0.3598685873136214, "grad_norm": 1.6165040731430054, "learning_rate": 1.6455696202531647e-05, "loss": 0.07517444342374802, "num_input_tokens_seen": 667976, "step": 356, "train_runtime": 1038.7334, "train_tokens_per_second": 643.068 }, { "epoch": 0.36087945413191813, "grad_norm": 1.2826602458953857, "learning_rate": 1.6445569620253166e-05, "loss": 0.09816960990428925, "num_input_tokens_seen": 670104, "step": 357, "train_runtime": 1041.1268, "train_tokens_per_second": 643.633 }, { "epoch": 0.3618903209502148, "grad_norm": 1.544905424118042, "learning_rate": 1.6435443037974685e-05, "loss": 0.07951736450195312, "num_input_tokens_seen": 671812, "step": 358, "train_runtime": 1043.3338, "train_tokens_per_second": 643.909 }, { "epoch": 0.3629011877685115, "grad_norm": 1.5321018695831299, "learning_rate": 1.6425316455696205e-05, "loss": 0.1257629692554474, "num_input_tokens_seen": 673840, "step": 359, "train_runtime": 1045.6789, "train_tokens_per_second": 644.404 }, { "epoch": 0.3639120545868082, "grad_norm": 1.5514605045318604, "learning_rate": 1.6415189873417724e-05, "loss": 0.10741757601499557, "num_input_tokens_seen": 675820, "step": 360, "train_runtime": 1048.0645, "train_tokens_per_second": 644.827 }, { "epoch": 0.36492292140510485, "grad_norm": 1.1789236068725586, "learning_rate": 1.6405063291139243e-05, "loss": 0.07961886376142502, "num_input_tokens_seen": 677590, "step": 361, "train_runtime": 1065.5145, "train_tokens_per_second": 635.928 }, { "epoch": 0.36593378822340156, "grad_norm": 1.5250983238220215, "learning_rate": 1.6394936708860762e-05, "loss": 0.1249462366104126, "num_input_tokens_seen": 679656, "step": 362, "train_runtime": 1067.9822, "train_tokens_per_second": 636.393 }, { "epoch": 0.36694465504169826, "grad_norm": 1.3443119525909424, "learning_rate": 1.638481012658228e-05, "loss": 0.11207073926925659, "num_input_tokens_seen": 681542, "step": 363, "train_runtime": 1070.3137, "train_tokens_per_second": 636.768 }, { "epoch": 0.36795552185999497, "grad_norm": 1.2133140563964844, "learning_rate": 1.63746835443038e-05, "loss": 0.08309883624315262, "num_input_tokens_seen": 683072, "step": 364, "train_runtime": 1072.6198, "train_tokens_per_second": 636.826 }, { "epoch": 0.3689663886782916, "grad_norm": 1.3501054048538208, "learning_rate": 1.636455696202532e-05, "loss": 0.10249121487140656, "num_input_tokens_seen": 684780, "step": 365, "train_runtime": 1074.8369, "train_tokens_per_second": 637.101 }, { "epoch": 0.36997725549658833, "grad_norm": 1.3758456707000732, "learning_rate": 1.6354430379746838e-05, "loss": 0.13326986134052277, "num_input_tokens_seen": 687052, "step": 366, "train_runtime": 1077.2431, "train_tokens_per_second": 637.787 }, { "epoch": 0.37098812231488504, "grad_norm": 1.2025797367095947, "learning_rate": 1.6344303797468354e-05, "loss": 0.11053229868412018, "num_input_tokens_seen": 689058, "step": 367, "train_runtime": 1079.5103, "train_tokens_per_second": 638.306 }, { "epoch": 0.3719989891331817, "grad_norm": 1.3191109895706177, "learning_rate": 1.6334177215189876e-05, "loss": 0.1132110059261322, "num_input_tokens_seen": 690736, "step": 368, "train_runtime": 1081.7273, "train_tokens_per_second": 638.549 }, { "epoch": 0.3730098559514784, "grad_norm": 1.3614546060562134, "learning_rate": 1.6324050632911395e-05, "loss": 0.09920522570610046, "num_input_tokens_seen": 692596, "step": 369, "train_runtime": 1083.9848, "train_tokens_per_second": 638.935 }, { "epoch": 0.3740207227697751, "grad_norm": 1.4268485307693481, "learning_rate": 1.631392405063291e-05, "loss": 0.11578072607517242, "num_input_tokens_seen": 694712, "step": 370, "train_runtime": 1086.2939, "train_tokens_per_second": 639.525 }, { "epoch": 0.37503158958807176, "grad_norm": 1.1919304132461548, "learning_rate": 1.6303797468354434e-05, "loss": 0.07230079919099808, "num_input_tokens_seen": 696466, "step": 371, "train_runtime": 1088.5269, "train_tokens_per_second": 639.824 }, { "epoch": 0.37604245640636846, "grad_norm": 1.2799185514450073, "learning_rate": 1.629367088607595e-05, "loss": 0.06554621458053589, "num_input_tokens_seen": 697804, "step": 372, "train_runtime": 1090.6703, "train_tokens_per_second": 639.794 }, { "epoch": 0.37705332322466517, "grad_norm": 1.4671586751937866, "learning_rate": 1.6283544303797468e-05, "loss": 0.10723006725311279, "num_input_tokens_seen": 699614, "step": 373, "train_runtime": 1092.9454, "train_tokens_per_second": 640.118 }, { "epoch": 0.3780641900429618, "grad_norm": 1.632125973701477, "learning_rate": 1.627341772151899e-05, "loss": 0.11110654473304749, "num_input_tokens_seen": 700990, "step": 374, "train_runtime": 1095.0854, "train_tokens_per_second": 640.124 }, { "epoch": 0.37907505686125853, "grad_norm": 1.1445481777191162, "learning_rate": 1.6263291139240506e-05, "loss": 0.10859709978103638, "num_input_tokens_seen": 703404, "step": 375, "train_runtime": 1097.4698, "train_tokens_per_second": 640.932 }, { "epoch": 0.38008592367955524, "grad_norm": 1.453262209892273, "learning_rate": 1.6253164556962026e-05, "loss": 0.10258646309375763, "num_input_tokens_seen": 705094, "step": 376, "train_runtime": 1099.6843, "train_tokens_per_second": 641.179 }, { "epoch": 0.3810967904978519, "grad_norm": 1.593936800956726, "learning_rate": 1.6243037974683548e-05, "loss": 0.11771631240844727, "num_input_tokens_seen": 706698, "step": 377, "train_runtime": 1101.865, "train_tokens_per_second": 641.365 }, { "epoch": 0.3821076573161486, "grad_norm": 1.1572998762130737, "learning_rate": 1.6232911392405064e-05, "loss": 0.06967834383249283, "num_input_tokens_seen": 708394, "step": 378, "train_runtime": 1104.1007, "train_tokens_per_second": 641.603 }, { "epoch": 0.3831185241344453, "grad_norm": 1.2723830938339233, "learning_rate": 1.6222784810126583e-05, "loss": 0.08734267204999924, "num_input_tokens_seen": 710096, "step": 379, "train_runtime": 1106.2998, "train_tokens_per_second": 641.866 }, { "epoch": 0.38412939095274196, "grad_norm": 1.3895487785339355, "learning_rate": 1.6212658227848102e-05, "loss": 0.06834635883569717, "num_input_tokens_seen": 711458, "step": 380, "train_runtime": 1108.4048, "train_tokens_per_second": 641.876 }, { "epoch": 0.38514025777103866, "grad_norm": 1.4300158023834229, "learning_rate": 1.620253164556962e-05, "loss": 0.12024091929197311, "num_input_tokens_seen": 713746, "step": 381, "train_runtime": 1110.7597, "train_tokens_per_second": 642.575 }, { "epoch": 0.38615112458933537, "grad_norm": 1.3179868459701538, "learning_rate": 1.619240506329114e-05, "loss": 0.07144320756196976, "num_input_tokens_seen": 715434, "step": 382, "train_runtime": 1112.9623, "train_tokens_per_second": 642.82 }, { "epoch": 0.387161991407632, "grad_norm": 1.2376477718353271, "learning_rate": 1.618227848101266e-05, "loss": 0.08733730763196945, "num_input_tokens_seen": 717224, "step": 383, "train_runtime": 1115.1583, "train_tokens_per_second": 643.159 }, { "epoch": 0.38817285822592873, "grad_norm": 1.5439473390579224, "learning_rate": 1.6172151898734178e-05, "loss": 0.12377951294183731, "num_input_tokens_seen": 718734, "step": 384, "train_runtime": 1117.3266, "train_tokens_per_second": 643.262 }, { "epoch": 0.38918372504422544, "grad_norm": 1.0904730558395386, "learning_rate": 1.6162025316455697e-05, "loss": 0.07275289297103882, "num_input_tokens_seen": 720200, "step": 385, "train_runtime": 1119.516, "train_tokens_per_second": 643.314 }, { "epoch": 0.3901945918625221, "grad_norm": 1.4814702272415161, "learning_rate": 1.6151898734177216e-05, "loss": 0.11074559390544891, "num_input_tokens_seen": 722210, "step": 386, "train_runtime": 1121.8135, "train_tokens_per_second": 643.788 }, { "epoch": 0.3912054586808188, "grad_norm": 1.364432454109192, "learning_rate": 1.6141772151898735e-05, "loss": 0.09846647828817368, "num_input_tokens_seen": 724340, "step": 387, "train_runtime": 1124.1489, "train_tokens_per_second": 644.345 }, { "epoch": 0.3922163254991155, "grad_norm": 1.567051649093628, "learning_rate": 1.6131645569620255e-05, "loss": 0.10375119745731354, "num_input_tokens_seen": 725928, "step": 388, "train_runtime": 1126.3304, "train_tokens_per_second": 644.507 }, { "epoch": 0.39322719231741216, "grad_norm": 1.3150216341018677, "learning_rate": 1.6121518987341774e-05, "loss": 0.09941066801548004, "num_input_tokens_seen": 728306, "step": 389, "train_runtime": 1128.726, "train_tokens_per_second": 645.246 }, { "epoch": 0.39423805913570886, "grad_norm": 1.4323986768722534, "learning_rate": 1.6111392405063293e-05, "loss": 0.12157496809959412, "num_input_tokens_seen": 730248, "step": 390, "train_runtime": 1130.9986, "train_tokens_per_second": 645.667 }, { "epoch": 0.39524892595400557, "grad_norm": 1.3855671882629395, "learning_rate": 1.6101265822784812e-05, "loss": 0.08571504056453705, "num_input_tokens_seen": 732022, "step": 391, "train_runtime": 1148.4282, "train_tokens_per_second": 637.412 }, { "epoch": 0.3962597927723022, "grad_norm": 1.5683603286743164, "learning_rate": 1.609113924050633e-05, "loss": 0.13069680333137512, "num_input_tokens_seen": 734084, "step": 392, "train_runtime": 1150.74, "train_tokens_per_second": 637.923 }, { "epoch": 0.39727065959059893, "grad_norm": 1.5007070302963257, "learning_rate": 1.608101265822785e-05, "loss": 0.11729087680578232, "num_input_tokens_seen": 735922, "step": 393, "train_runtime": 1152.9967, "train_tokens_per_second": 638.269 }, { "epoch": 0.39828152640889564, "grad_norm": 1.3590445518493652, "learning_rate": 1.607088607594937e-05, "loss": 0.10647516697645187, "num_input_tokens_seen": 737962, "step": 394, "train_runtime": 1155.2977, "train_tokens_per_second": 638.763 }, { "epoch": 0.39929239322719234, "grad_norm": 1.802383542060852, "learning_rate": 1.6060759493670888e-05, "loss": 0.12328140437602997, "num_input_tokens_seen": 739550, "step": 395, "train_runtime": 1157.5286, "train_tokens_per_second": 638.904 }, { "epoch": 0.400303260045489, "grad_norm": 1.37345290184021, "learning_rate": 1.6050632911392404e-05, "loss": 0.0954669788479805, "num_input_tokens_seen": 741172, "step": 396, "train_runtime": 1159.7827, "train_tokens_per_second": 639.061 }, { "epoch": 0.400303260045489, "eval_loss": 0.3872518241405487, "eval_runtime": 55.0988, "eval_samples_per_second": 15.953, "eval_steps_per_second": 7.986, "num_input_tokens_seen": 741172, "step": 396 }, { "epoch": 0.4013141268637857, "grad_norm": 1.3639532327651978, "learning_rate": 1.6040506329113926e-05, "loss": 0.08709590882062912, "num_input_tokens_seen": 743004, "step": 397, "train_runtime": 1217.1537, "train_tokens_per_second": 610.444 }, { "epoch": 0.4023249936820824, "grad_norm": 1.1442697048187256, "learning_rate": 1.6030379746835445e-05, "loss": 0.09475848823785782, "num_input_tokens_seen": 744848, "step": 398, "train_runtime": 1219.4153, "train_tokens_per_second": 610.824 }, { "epoch": 0.40333586050037906, "grad_norm": 1.2756831645965576, "learning_rate": 1.602025316455696e-05, "loss": 0.0921563133597374, "num_input_tokens_seen": 746680, "step": 399, "train_runtime": 1221.7141, "train_tokens_per_second": 611.174 }, { "epoch": 0.40434672731867577, "grad_norm": 1.3857290744781494, "learning_rate": 1.6010126582278484e-05, "loss": 0.10650795698165894, "num_input_tokens_seen": 748696, "step": 400, "train_runtime": 1224.0205, "train_tokens_per_second": 611.669 }, { "epoch": 0.4053575941369725, "grad_norm": 1.2589681148529053, "learning_rate": 1.6000000000000003e-05, "loss": 0.08366907387971878, "num_input_tokens_seen": 750616, "step": 401, "train_runtime": 1226.3543, "train_tokens_per_second": 612.071 }, { "epoch": 0.40636846095526913, "grad_norm": 1.5011835098266602, "learning_rate": 1.598987341772152e-05, "loss": 0.11901634931564331, "num_input_tokens_seen": 752420, "step": 402, "train_runtime": 1228.6163, "train_tokens_per_second": 612.413 }, { "epoch": 0.40737932777356584, "grad_norm": 1.5548064708709717, "learning_rate": 1.597974683544304e-05, "loss": 0.1128741055727005, "num_input_tokens_seen": 754336, "step": 403, "train_runtime": 1230.8945, "train_tokens_per_second": 612.836 }, { "epoch": 0.40839019459186254, "grad_norm": 1.4540143013000488, "learning_rate": 1.5969620253164557e-05, "loss": 0.09682419896125793, "num_input_tokens_seen": 756468, "step": 404, "train_runtime": 1233.2427, "train_tokens_per_second": 613.397 }, { "epoch": 0.4094010614101592, "grad_norm": 1.2885997295379639, "learning_rate": 1.5959493670886076e-05, "loss": 0.10913906246423721, "num_input_tokens_seen": 758516, "step": 405, "train_runtime": 1235.6416, "train_tokens_per_second": 613.864 }, { "epoch": 0.4104119282284559, "grad_norm": 1.3824455738067627, "learning_rate": 1.5949367088607598e-05, "loss": 0.10396812856197357, "num_input_tokens_seen": 760364, "step": 406, "train_runtime": 1237.8792, "train_tokens_per_second": 614.247 }, { "epoch": 0.4114227950467526, "grad_norm": 2.2940287590026855, "learning_rate": 1.5939240506329114e-05, "loss": 0.10810710489749908, "num_input_tokens_seen": 762296, "step": 407, "train_runtime": 1240.2508, "train_tokens_per_second": 614.631 }, { "epoch": 0.41243366186504926, "grad_norm": 1.3997433185577393, "learning_rate": 1.5929113924050633e-05, "loss": 0.08424016833305359, "num_input_tokens_seen": 764002, "step": 408, "train_runtime": 1242.5433, "train_tokens_per_second": 614.87 }, { "epoch": 0.41344452868334597, "grad_norm": 1.3747771978378296, "learning_rate": 1.5918987341772155e-05, "loss": 0.13588640093803406, "num_input_tokens_seen": 766318, "step": 409, "train_runtime": 1244.9952, "train_tokens_per_second": 615.519 }, { "epoch": 0.4144553955016427, "grad_norm": 1.525220274925232, "learning_rate": 1.590886075949367e-05, "loss": 0.09460221230983734, "num_input_tokens_seen": 768542, "step": 410, "train_runtime": 1247.3324, "train_tokens_per_second": 616.149 }, { "epoch": 0.41546626231993933, "grad_norm": 1.5507614612579346, "learning_rate": 1.589873417721519e-05, "loss": 0.08481799066066742, "num_input_tokens_seen": 770400, "step": 411, "train_runtime": 1249.59, "train_tokens_per_second": 616.522 }, { "epoch": 0.41647712913823604, "grad_norm": 1.088625192642212, "learning_rate": 1.588860759493671e-05, "loss": 0.08084049820899963, "num_input_tokens_seen": 773532, "step": 412, "train_runtime": 1252.1702, "train_tokens_per_second": 617.753 }, { "epoch": 0.41748799595653274, "grad_norm": 1.157347559928894, "learning_rate": 1.5878481012658228e-05, "loss": 0.07886244356632233, "num_input_tokens_seen": 775576, "step": 413, "train_runtime": 1254.4628, "train_tokens_per_second": 618.253 }, { "epoch": 0.4184988627748294, "grad_norm": 1.718621850013733, "learning_rate": 1.5868354430379747e-05, "loss": 0.11512285470962524, "num_input_tokens_seen": 777670, "step": 414, "train_runtime": 1256.7786, "train_tokens_per_second": 618.78 }, { "epoch": 0.4195097295931261, "grad_norm": 1.499655842781067, "learning_rate": 1.5858227848101266e-05, "loss": 0.10185996443033218, "num_input_tokens_seen": 779290, "step": 415, "train_runtime": 1259.0203, "train_tokens_per_second": 618.965 }, { "epoch": 0.4205205964114228, "grad_norm": 1.5286248922348022, "learning_rate": 1.5848101265822786e-05, "loss": 0.11060277372598648, "num_input_tokens_seen": 781116, "step": 416, "train_runtime": 1261.2613, "train_tokens_per_second": 619.313 }, { "epoch": 0.42153146322971946, "grad_norm": 1.2865464687347412, "learning_rate": 1.5837974683544305e-05, "loss": 0.10144440829753876, "num_input_tokens_seen": 783262, "step": 417, "train_runtime": 1263.5843, "train_tokens_per_second": 619.873 }, { "epoch": 0.42254233004801617, "grad_norm": 1.285799503326416, "learning_rate": 1.5827848101265824e-05, "loss": 0.09051541239023209, "num_input_tokens_seen": 785110, "step": 418, "train_runtime": 1265.9202, "train_tokens_per_second": 620.189 }, { "epoch": 0.4235531968663129, "grad_norm": 1.2414003610610962, "learning_rate": 1.5817721518987343e-05, "loss": 0.10315880924463272, "num_input_tokens_seen": 787038, "step": 419, "train_runtime": 1268.2454, "train_tokens_per_second": 620.572 }, { "epoch": 0.4245640636846095, "grad_norm": 1.362291932106018, "learning_rate": 1.5807594936708862e-05, "loss": 0.10962265729904175, "num_input_tokens_seen": 788866, "step": 420, "train_runtime": 1270.5292, "train_tokens_per_second": 620.896 }, { "epoch": 0.42557493050290623, "grad_norm": 1.3942428827285767, "learning_rate": 1.579746835443038e-05, "loss": 0.08523203432559967, "num_input_tokens_seen": 790578, "step": 421, "train_runtime": 1287.8445, "train_tokens_per_second": 613.877 }, { "epoch": 0.42658579732120294, "grad_norm": 1.325069785118103, "learning_rate": 1.57873417721519e-05, "loss": 0.08947727084159851, "num_input_tokens_seen": 792632, "step": 422, "train_runtime": 1290.1336, "train_tokens_per_second": 614.38 }, { "epoch": 0.4275966641394996, "grad_norm": 1.4082978963851929, "learning_rate": 1.577721518987342e-05, "loss": 0.07078568637371063, "num_input_tokens_seen": 794344, "step": 423, "train_runtime": 1292.3695, "train_tokens_per_second": 614.642 }, { "epoch": 0.4286075309577963, "grad_norm": 1.1040624380111694, "learning_rate": 1.5767088607594938e-05, "loss": 0.0761384516954422, "num_input_tokens_seen": 796212, "step": 424, "train_runtime": 1294.6402, "train_tokens_per_second": 615.006 }, { "epoch": 0.429618397776093, "grad_norm": 1.1366462707519531, "learning_rate": 1.5756962025316457e-05, "loss": 0.09637749940156937, "num_input_tokens_seen": 798458, "step": 425, "train_runtime": 1297.0632, "train_tokens_per_second": 615.589 }, { "epoch": 0.4306292645943897, "grad_norm": 1.388405203819275, "learning_rate": 1.5746835443037976e-05, "loss": 0.10852111876010895, "num_input_tokens_seen": 800190, "step": 426, "train_runtime": 1299.3023, "train_tokens_per_second": 615.861 }, { "epoch": 0.43164013141268637, "grad_norm": 1.279977798461914, "learning_rate": 1.5736708860759495e-05, "loss": 0.08166302740573883, "num_input_tokens_seen": 801656, "step": 427, "train_runtime": 1301.4619, "train_tokens_per_second": 615.966 }, { "epoch": 0.4326509982309831, "grad_norm": 1.1389224529266357, "learning_rate": 1.5726582278481015e-05, "loss": 0.06751921772956848, "num_input_tokens_seen": 803426, "step": 428, "train_runtime": 1303.8705, "train_tokens_per_second": 616.185 }, { "epoch": 0.4336618650492798, "grad_norm": 1.2209196090698242, "learning_rate": 1.5716455696202534e-05, "loss": 0.07853812724351883, "num_input_tokens_seen": 805396, "step": 429, "train_runtime": 1306.1459, "train_tokens_per_second": 616.62 }, { "epoch": 0.43467273186757643, "grad_norm": 1.1403597593307495, "learning_rate": 1.5706329113924053e-05, "loss": 0.10636825859546661, "num_input_tokens_seen": 807228, "step": 430, "train_runtime": 1308.3976, "train_tokens_per_second": 616.959 }, { "epoch": 0.43568359868587314, "grad_norm": 1.4978351593017578, "learning_rate": 1.5696202531645572e-05, "loss": 0.11419200897216797, "num_input_tokens_seen": 808880, "step": 431, "train_runtime": 1310.5998, "train_tokens_per_second": 617.183 }, { "epoch": 0.43669446550416985, "grad_norm": 1.1914385557174683, "learning_rate": 1.568607594936709e-05, "loss": 0.09804163128137589, "num_input_tokens_seen": 811672, "step": 432, "train_runtime": 1313.1271, "train_tokens_per_second": 618.121 }, { "epoch": 0.4377053323224665, "grad_norm": 1.1298398971557617, "learning_rate": 1.567594936708861e-05, "loss": 0.07625232636928558, "num_input_tokens_seen": 813512, "step": 433, "train_runtime": 1315.4346, "train_tokens_per_second": 618.436 }, { "epoch": 0.4387161991407632, "grad_norm": 1.5358973741531372, "learning_rate": 1.566582278481013e-05, "loss": 0.10365542024374008, "num_input_tokens_seen": 815038, "step": 434, "train_runtime": 1317.6541, "train_tokens_per_second": 618.552 }, { "epoch": 0.4397270659590599, "grad_norm": 1.553647756576538, "learning_rate": 1.5655696202531648e-05, "loss": 0.1037188470363617, "num_input_tokens_seen": 816976, "step": 435, "train_runtime": 1319.9001, "train_tokens_per_second": 618.968 }, { "epoch": 0.44073793277735657, "grad_norm": 1.0904991626739502, "learning_rate": 1.5645569620253164e-05, "loss": 0.0808977261185646, "num_input_tokens_seen": 818870, "step": 436, "train_runtime": 1322.1532, "train_tokens_per_second": 619.346 }, { "epoch": 0.4417487995956533, "grad_norm": 1.5115450620651245, "learning_rate": 1.5635443037974686e-05, "loss": 0.11773766577243805, "num_input_tokens_seen": 821004, "step": 437, "train_runtime": 1324.509, "train_tokens_per_second": 619.855 }, { "epoch": 0.44275966641395, "grad_norm": 1.0825086832046509, "learning_rate": 1.5625316455696205e-05, "loss": 0.07502110302448273, "num_input_tokens_seen": 823306, "step": 438, "train_runtime": 1326.9529, "train_tokens_per_second": 620.449 }, { "epoch": 0.44377053323224663, "grad_norm": 1.4008469581604004, "learning_rate": 1.561518987341772e-05, "loss": 0.12766876816749573, "num_input_tokens_seen": 825712, "step": 439, "train_runtime": 1329.4654, "train_tokens_per_second": 621.086 }, { "epoch": 0.44478140005054334, "grad_norm": 1.4241653680801392, "learning_rate": 1.5605063291139244e-05, "loss": 0.09557639807462692, "num_input_tokens_seen": 827680, "step": 440, "train_runtime": 1331.8762, "train_tokens_per_second": 621.439 }, { "epoch": 0.44579226686884005, "grad_norm": 1.3624467849731445, "learning_rate": 1.5594936708860763e-05, "loss": 0.10515819489955902, "num_input_tokens_seen": 829328, "step": 441, "train_runtime": 1334.1661, "train_tokens_per_second": 621.608 }, { "epoch": 0.4468031336871367, "grad_norm": 1.4202001094818115, "learning_rate": 1.558481012658228e-05, "loss": 0.09325391799211502, "num_input_tokens_seen": 831254, "step": 442, "train_runtime": 1336.4782, "train_tokens_per_second": 621.973 }, { "epoch": 0.4478140005054334, "grad_norm": 1.4952328205108643, "learning_rate": 1.55746835443038e-05, "loss": 0.12340879440307617, "num_input_tokens_seen": 833076, "step": 443, "train_runtime": 1338.8319, "train_tokens_per_second": 622.241 }, { "epoch": 0.4488248673237301, "grad_norm": 1.1978174448013306, "learning_rate": 1.5564556962025317e-05, "loss": 0.10327230393886566, "num_input_tokens_seen": 835272, "step": 444, "train_runtime": 1341.2874, "train_tokens_per_second": 622.739 }, { "epoch": 0.44983573414202677, "grad_norm": 1.4203438758850098, "learning_rate": 1.5554430379746836e-05, "loss": 0.1020071730017662, "num_input_tokens_seen": 837422, "step": 445, "train_runtime": 1343.6062, "train_tokens_per_second": 623.264 }, { "epoch": 0.4508466009603235, "grad_norm": 1.1363866329193115, "learning_rate": 1.5544303797468358e-05, "loss": 0.08220135420560837, "num_input_tokens_seen": 839660, "step": 446, "train_runtime": 1345.9437, "train_tokens_per_second": 623.845 }, { "epoch": 0.4518574677786202, "grad_norm": 1.6075685024261475, "learning_rate": 1.5534177215189874e-05, "loss": 0.12566004693508148, "num_input_tokens_seen": 841170, "step": 447, "train_runtime": 1348.1186, "train_tokens_per_second": 623.958 }, { "epoch": 0.45286833459691683, "grad_norm": 1.448835015296936, "learning_rate": 1.5524050632911393e-05, "loss": 0.12754669785499573, "num_input_tokens_seen": 843086, "step": 448, "train_runtime": 1350.3928, "train_tokens_per_second": 624.326 }, { "epoch": 0.45387920141521354, "grad_norm": 1.1091268062591553, "learning_rate": 1.5513924050632912e-05, "loss": 0.06876929104328156, "num_input_tokens_seen": 845328, "step": 449, "train_runtime": 1352.7205, "train_tokens_per_second": 624.91 }, { "epoch": 0.45489006823351025, "grad_norm": 1.4727420806884766, "learning_rate": 1.550379746835443e-05, "loss": 0.1233140230178833, "num_input_tokens_seen": 847832, "step": 450, "train_runtime": 1355.1187, "train_tokens_per_second": 625.651 }, { "epoch": 0.4559009350518069, "grad_norm": 0.9638090133666992, "learning_rate": 1.549367088607595e-05, "loss": 0.062319010496139526, "num_input_tokens_seen": 849910, "step": 451, "train_runtime": 1371.6498, "train_tokens_per_second": 619.626 }, { "epoch": 0.4569118018701036, "grad_norm": 1.1417428255081177, "learning_rate": 1.548354430379747e-05, "loss": 0.10173853486776352, "num_input_tokens_seen": 852294, "step": 452, "train_runtime": 1374.1042, "train_tokens_per_second": 620.254 }, { "epoch": 0.4579226686884003, "grad_norm": 1.3086588382720947, "learning_rate": 1.5473417721518988e-05, "loss": 0.09739860892295837, "num_input_tokens_seen": 854262, "step": 453, "train_runtime": 1376.4508, "train_tokens_per_second": 620.627 }, { "epoch": 0.45893353550669697, "grad_norm": 1.3375917673110962, "learning_rate": 1.5463291139240507e-05, "loss": 0.1066465973854065, "num_input_tokens_seen": 856256, "step": 454, "train_runtime": 1378.7841, "train_tokens_per_second": 621.023 }, { "epoch": 0.4599444023249937, "grad_norm": 1.4359407424926758, "learning_rate": 1.5453164556962026e-05, "loss": 0.08826154470443726, "num_input_tokens_seen": 857960, "step": 455, "train_runtime": 1381.0232, "train_tokens_per_second": 621.25 }, { "epoch": 0.4609552691432904, "grad_norm": 1.2359154224395752, "learning_rate": 1.5443037974683546e-05, "loss": 0.07979286462068558, "num_input_tokens_seen": 859844, "step": 456, "train_runtime": 1383.2948, "train_tokens_per_second": 621.591 }, { "epoch": 0.4619661359615871, "grad_norm": 2.229543685913086, "learning_rate": 1.5432911392405065e-05, "loss": 0.12227626144886017, "num_input_tokens_seen": 862234, "step": 457, "train_runtime": 1385.7057, "train_tokens_per_second": 622.235 }, { "epoch": 0.46297700277988374, "grad_norm": 1.5136470794677734, "learning_rate": 1.5422784810126584e-05, "loss": 0.1630091667175293, "num_input_tokens_seen": 864526, "step": 458, "train_runtime": 1388.0672, "train_tokens_per_second": 622.827 }, { "epoch": 0.46398786959818045, "grad_norm": 1.4026036262512207, "learning_rate": 1.5412658227848103e-05, "loss": 0.08755923062562943, "num_input_tokens_seen": 866254, "step": 459, "train_runtime": 1390.2948, "train_tokens_per_second": 623.072 }, { "epoch": 0.46499873641647715, "grad_norm": 1.5655118227005005, "learning_rate": 1.5402531645569622e-05, "loss": 0.11648698896169662, "num_input_tokens_seen": 868044, "step": 460, "train_runtime": 1392.5821, "train_tokens_per_second": 623.334 }, { "epoch": 0.4660096032347738, "grad_norm": 1.6040105819702148, "learning_rate": 1.539240506329114e-05, "loss": 0.12708653509616852, "num_input_tokens_seen": 869820, "step": 461, "train_runtime": 1394.8295, "train_tokens_per_second": 623.603 }, { "epoch": 0.4670204700530705, "grad_norm": 1.1650915145874023, "learning_rate": 1.538227848101266e-05, "loss": 0.0768815353512764, "num_input_tokens_seen": 871334, "step": 462, "train_runtime": 1397.0258, "train_tokens_per_second": 623.706 }, { "epoch": 0.4680313368713672, "grad_norm": 1.2267590761184692, "learning_rate": 1.537215189873418e-05, "loss": 0.11306999623775482, "num_input_tokens_seen": 873256, "step": 463, "train_runtime": 1399.3227, "train_tokens_per_second": 624.056 }, { "epoch": 0.4690422036896639, "grad_norm": 1.8214051723480225, "learning_rate": 1.5362025316455698e-05, "loss": 0.1086057648062706, "num_input_tokens_seen": 875286, "step": 464, "train_runtime": 1401.5966, "train_tokens_per_second": 624.492 }, { "epoch": 0.4700530705079606, "grad_norm": 1.5773112773895264, "learning_rate": 1.5351898734177217e-05, "loss": 0.09585914015769958, "num_input_tokens_seen": 876870, "step": 465, "train_runtime": 1403.8159, "train_tokens_per_second": 624.633 }, { "epoch": 0.4710639373262573, "grad_norm": 1.3764119148254395, "learning_rate": 1.5341772151898736e-05, "loss": 0.08842549473047256, "num_input_tokens_seen": 878840, "step": 466, "train_runtime": 1406.0904, "train_tokens_per_second": 625.024 }, { "epoch": 0.47207480414455394, "grad_norm": 1.25182044506073, "learning_rate": 1.5331645569620255e-05, "loss": 0.0800933912396431, "num_input_tokens_seen": 880468, "step": 467, "train_runtime": 1408.2757, "train_tokens_per_second": 625.21 }, { "epoch": 0.47308567096285065, "grad_norm": 1.4983059167861938, "learning_rate": 1.532151898734177e-05, "loss": 0.08812262117862701, "num_input_tokens_seen": 882314, "step": 468, "train_runtime": 1410.5973, "train_tokens_per_second": 625.49 }, { "epoch": 0.47409653778114735, "grad_norm": 1.5544148683547974, "learning_rate": 1.5311392405063294e-05, "loss": 0.09277161955833435, "num_input_tokens_seen": 884162, "step": 469, "train_runtime": 1412.8327, "train_tokens_per_second": 625.808 }, { "epoch": 0.475107404599444, "grad_norm": 1.2759485244750977, "learning_rate": 1.5301265822784813e-05, "loss": 0.08562381565570831, "num_input_tokens_seen": 885872, "step": 470, "train_runtime": 1415.1272, "train_tokens_per_second": 626.002 }, { "epoch": 0.4761182714177407, "grad_norm": 1.410587191581726, "learning_rate": 1.529113924050633e-05, "loss": 0.10296129435300827, "num_input_tokens_seen": 887478, "step": 471, "train_runtime": 1417.34, "train_tokens_per_second": 626.157 }, { "epoch": 0.4771291382360374, "grad_norm": 1.3727208375930786, "learning_rate": 1.528101265822785e-05, "loss": 0.10469543188810349, "num_input_tokens_seen": 889464, "step": 472, "train_runtime": 1419.682, "train_tokens_per_second": 626.523 }, { "epoch": 0.47814000505433407, "grad_norm": 1.1912351846694946, "learning_rate": 1.527088607594937e-05, "loss": 0.08748653531074524, "num_input_tokens_seen": 890990, "step": 473, "train_runtime": 1421.8167, "train_tokens_per_second": 626.656 }, { "epoch": 0.4791508718726308, "grad_norm": 1.2304508686065674, "learning_rate": 1.5260759493670886e-05, "loss": 0.08261626958847046, "num_input_tokens_seen": 892672, "step": 474, "train_runtime": 1424.0693, "train_tokens_per_second": 626.846 }, { "epoch": 0.4801617386909275, "grad_norm": 1.2530360221862793, "learning_rate": 1.5250632911392406e-05, "loss": 0.0887748971581459, "num_input_tokens_seen": 894660, "step": 475, "train_runtime": 1426.5372, "train_tokens_per_second": 627.155 }, { "epoch": 0.48117260550922414, "grad_norm": 1.5004278421401978, "learning_rate": 1.5240506329113924e-05, "loss": 0.10353885591030121, "num_input_tokens_seen": 896764, "step": 476, "train_runtime": 1428.9466, "train_tokens_per_second": 627.57 }, { "epoch": 0.48218347232752085, "grad_norm": 1.3240872621536255, "learning_rate": 1.5230379746835445e-05, "loss": 0.09488523751497269, "num_input_tokens_seen": 898270, "step": 477, "train_runtime": 1431.1262, "train_tokens_per_second": 627.667 }, { "epoch": 0.48319433914581755, "grad_norm": 1.6358325481414795, "learning_rate": 1.5220253164556964e-05, "loss": 0.10431206226348877, "num_input_tokens_seen": 900776, "step": 478, "train_runtime": 1433.5816, "train_tokens_per_second": 628.34 }, { "epoch": 0.4842052059641142, "grad_norm": 1.6957182884216309, "learning_rate": 1.5210126582278481e-05, "loss": 0.0877433717250824, "num_input_tokens_seen": 902464, "step": 479, "train_runtime": 1435.7843, "train_tokens_per_second": 628.551 }, { "epoch": 0.4852160727824109, "grad_norm": 1.5795923471450806, "learning_rate": 1.5200000000000002e-05, "loss": 0.11310522258281708, "num_input_tokens_seen": 904536, "step": 480, "train_runtime": 1438.2063, "train_tokens_per_second": 628.933 }, { "epoch": 0.4862269396007076, "grad_norm": 1.4067100286483765, "learning_rate": 1.5189873417721521e-05, "loss": 0.1028033122420311, "num_input_tokens_seen": 906342, "step": 481, "train_runtime": 1454.2403, "train_tokens_per_second": 623.241 }, { "epoch": 0.48723780641900427, "grad_norm": 1.2052048444747925, "learning_rate": 1.5179746835443038e-05, "loss": 0.08187657594680786, "num_input_tokens_seen": 908624, "step": 482, "train_runtime": 1456.6482, "train_tokens_per_second": 623.777 }, { "epoch": 0.488248673237301, "grad_norm": 1.2163141965866089, "learning_rate": 1.5169620253164559e-05, "loss": 0.09129151701927185, "num_input_tokens_seen": 910822, "step": 483, "train_runtime": 1458.9901, "train_tokens_per_second": 624.282 }, { "epoch": 0.4892595400555977, "grad_norm": 1.49179208278656, "learning_rate": 1.5159493670886076e-05, "loss": 0.11724289506673813, "num_input_tokens_seen": 912538, "step": 484, "train_runtime": 1461.3004, "train_tokens_per_second": 624.47 }, { "epoch": 0.49027040687389434, "grad_norm": 1.0660570859909058, "learning_rate": 1.5149367088607596e-05, "loss": 0.07163531333208084, "num_input_tokens_seen": 914398, "step": 485, "train_runtime": 1463.609, "train_tokens_per_second": 624.756 }, { "epoch": 0.49128127369219105, "grad_norm": 1.3062098026275635, "learning_rate": 1.5139240506329116e-05, "loss": 0.08330444991588593, "num_input_tokens_seen": 915784, "step": 486, "train_runtime": 1465.7715, "train_tokens_per_second": 624.78 }, { "epoch": 0.49229214051048775, "grad_norm": 1.5049551725387573, "learning_rate": 1.5129113924050634e-05, "loss": 0.09343305230140686, "num_input_tokens_seen": 917832, "step": 487, "train_runtime": 1468.2228, "train_tokens_per_second": 625.131 }, { "epoch": 0.49330300732878446, "grad_norm": 1.3915646076202393, "learning_rate": 1.5118987341772153e-05, "loss": 0.14162439107894897, "num_input_tokens_seen": 919822, "step": 488, "train_runtime": 1470.5186, "train_tokens_per_second": 625.509 }, { "epoch": 0.4943138741470811, "grad_norm": 1.029426097869873, "learning_rate": 1.5108860759493674e-05, "loss": 0.06789886206388474, "num_input_tokens_seen": 921798, "step": 489, "train_runtime": 1472.8087, "train_tokens_per_second": 625.878 }, { "epoch": 0.4953247409653778, "grad_norm": 1.1193761825561523, "learning_rate": 1.5098734177215191e-05, "loss": 0.08151046931743622, "num_input_tokens_seen": 923560, "step": 490, "train_runtime": 1475.0875, "train_tokens_per_second": 626.105 }, { "epoch": 0.4963356077836745, "grad_norm": 1.4701436758041382, "learning_rate": 1.508860759493671e-05, "loss": 0.08011287450790405, "num_input_tokens_seen": 925226, "step": 491, "train_runtime": 1477.3851, "train_tokens_per_second": 626.259 }, { "epoch": 0.4973464746019712, "grad_norm": 1.2409087419509888, "learning_rate": 1.5078481012658227e-05, "loss": 0.08883355557918549, "num_input_tokens_seen": 926804, "step": 492, "train_runtime": 1479.8328, "train_tokens_per_second": 626.29 }, { "epoch": 0.4983573414202679, "grad_norm": 1.2009402513504028, "learning_rate": 1.5068354430379748e-05, "loss": 0.10840057581663132, "num_input_tokens_seen": 928740, "step": 493, "train_runtime": 1482.1156, "train_tokens_per_second": 626.631 }, { "epoch": 0.4993682082385646, "grad_norm": 1.3997632265090942, "learning_rate": 1.5058227848101267e-05, "loss": 0.10527746379375458, "num_input_tokens_seen": 930264, "step": 494, "train_runtime": 1484.3311, "train_tokens_per_second": 626.723 }, { "epoch": 0.5003790750568613, "grad_norm": 1.5624264478683472, "learning_rate": 1.5048101265822785e-05, "loss": 0.09936410188674927, "num_input_tokens_seen": 931754, "step": 495, "train_runtime": 1486.507, "train_tokens_per_second": 626.808 }, { "epoch": 0.501389941875158, "grad_norm": 1.3960294723510742, "learning_rate": 1.5037974683544306e-05, "loss": 0.12032736837863922, "num_input_tokens_seen": 933608, "step": 496, "train_runtime": 1488.7905, "train_tokens_per_second": 627.092 }, { "epoch": 0.5024008086934546, "grad_norm": 1.1936594247817993, "learning_rate": 1.5027848101265825e-05, "loss": 0.10966365039348602, "num_input_tokens_seen": 935584, "step": 497, "train_runtime": 1491.0642, "train_tokens_per_second": 627.461 }, { "epoch": 0.5034116755117514, "grad_norm": 1.394915223121643, "learning_rate": 1.5017721518987342e-05, "loss": 0.0936424508690834, "num_input_tokens_seen": 937248, "step": 498, "train_runtime": 1493.2837, "train_tokens_per_second": 627.642 }, { "epoch": 0.504422542330048, "grad_norm": 1.1654257774353027, "learning_rate": 1.5007594936708863e-05, "loss": 0.08217742294073105, "num_input_tokens_seen": 939192, "step": 499, "train_runtime": 1495.558, "train_tokens_per_second": 627.988 }, { "epoch": 0.5054334091483447, "grad_norm": 1.341120719909668, "learning_rate": 1.499746835443038e-05, "loss": 0.09140294790267944, "num_input_tokens_seen": 941142, "step": 500, "train_runtime": 1497.8542, "train_tokens_per_second": 628.327 }, { "epoch": 0.5064442759666414, "grad_norm": 1.223242163658142, "learning_rate": 1.49873417721519e-05, "loss": 0.07253067195415497, "num_input_tokens_seen": 942764, "step": 501, "train_runtime": 1500.1332, "train_tokens_per_second": 628.454 }, { "epoch": 0.5074551427849381, "grad_norm": 1.4446712732315063, "learning_rate": 1.497721518987342e-05, "loss": 0.11088109761476517, "num_input_tokens_seen": 944456, "step": 502, "train_runtime": 1502.3381, "train_tokens_per_second": 628.657 }, { "epoch": 0.5084660096032347, "grad_norm": 1.3642338514328003, "learning_rate": 1.4967088607594937e-05, "loss": 0.0994197428226471, "num_input_tokens_seen": 946438, "step": 503, "train_runtime": 1504.6147, "train_tokens_per_second": 629.023 }, { "epoch": 0.5094768764215315, "grad_norm": 1.311281681060791, "learning_rate": 1.4956962025316456e-05, "loss": 0.07897685468196869, "num_input_tokens_seen": 947942, "step": 504, "train_runtime": 1506.826, "train_tokens_per_second": 629.099 }, { "epoch": 0.5104877432398282, "grad_norm": 1.1747621297836304, "learning_rate": 1.4946835443037977e-05, "loss": 0.0812889114022255, "num_input_tokens_seen": 950170, "step": 505, "train_runtime": 1509.1522, "train_tokens_per_second": 629.605 }, { "epoch": 0.5114986100581248, "grad_norm": 1.2405896186828613, "learning_rate": 1.4936708860759495e-05, "loss": 0.09990272670984268, "num_input_tokens_seen": 952068, "step": 506, "train_runtime": 1511.3884, "train_tokens_per_second": 629.929 }, { "epoch": 0.5125094768764216, "grad_norm": 1.1583400964736938, "learning_rate": 1.4926582278481014e-05, "loss": 0.08129554241895676, "num_input_tokens_seen": 954106, "step": 507, "train_runtime": 1513.6533, "train_tokens_per_second": 630.333 }, { "epoch": 0.5135203436947182, "grad_norm": 1.3690828084945679, "learning_rate": 1.4916455696202531e-05, "loss": 0.09495596587657928, "num_input_tokens_seen": 956278, "step": 508, "train_runtime": 1515.997, "train_tokens_per_second": 630.791 }, { "epoch": 0.5145312105130149, "grad_norm": 1.5271061658859253, "learning_rate": 1.4906329113924052e-05, "loss": 0.1311858743429184, "num_input_tokens_seen": 957986, "step": 509, "train_runtime": 1518.2556, "train_tokens_per_second": 630.978 }, { "epoch": 0.5155420773313116, "grad_norm": 1.2158321142196655, "learning_rate": 1.4896202531645571e-05, "loss": 0.07281412184238434, "num_input_tokens_seen": 960114, "step": 510, "train_runtime": 1520.5902, "train_tokens_per_second": 631.409 }, { "epoch": 0.5165529441496083, "grad_norm": 1.267778992652893, "learning_rate": 1.4886075949367088e-05, "loss": 0.07296498119831085, "num_input_tokens_seen": 961990, "step": 511, "train_runtime": 1536.972, "train_tokens_per_second": 625.9 }, { "epoch": 0.5175638109679049, "grad_norm": 1.342843770980835, "learning_rate": 1.487594936708861e-05, "loss": 0.0883895754814148, "num_input_tokens_seen": 964296, "step": 512, "train_runtime": 1539.3376, "train_tokens_per_second": 626.436 }, { "epoch": 0.5185746777862017, "grad_norm": 1.561376690864563, "learning_rate": 1.4865822784810128e-05, "loss": 0.11057661473751068, "num_input_tokens_seen": 965920, "step": 513, "train_runtime": 1541.5702, "train_tokens_per_second": 626.582 }, { "epoch": 0.5195855446044984, "grad_norm": 1.4014407396316528, "learning_rate": 1.4855696202531646e-05, "loss": 0.10055877268314362, "num_input_tokens_seen": 967894, "step": 514, "train_runtime": 1543.9261, "train_tokens_per_second": 626.904 }, { "epoch": 0.520596411422795, "grad_norm": 1.510994553565979, "learning_rate": 1.4845569620253166e-05, "loss": 0.09872489422559738, "num_input_tokens_seen": 970006, "step": 515, "train_runtime": 1546.2716, "train_tokens_per_second": 627.319 }, { "epoch": 0.5216072782410918, "grad_norm": 1.2100088596343994, "learning_rate": 1.4835443037974684e-05, "loss": 0.08809270709753036, "num_input_tokens_seen": 971940, "step": 516, "train_runtime": 1548.5422, "train_tokens_per_second": 627.648 }, { "epoch": 0.5226181450593884, "grad_norm": 1.283185362815857, "learning_rate": 1.4825316455696203e-05, "loss": 0.09899348020553589, "num_input_tokens_seen": 973842, "step": 517, "train_runtime": 1550.8105, "train_tokens_per_second": 627.957 }, { "epoch": 0.5236290118776851, "grad_norm": 1.7970081567764282, "learning_rate": 1.4815189873417724e-05, "loss": 0.13198940455913544, "num_input_tokens_seen": 975408, "step": 518, "train_runtime": 1553.0622, "train_tokens_per_second": 628.055 }, { "epoch": 0.5246398786959818, "grad_norm": 2.1203253269195557, "learning_rate": 1.4805063291139241e-05, "loss": 0.10351548343896866, "num_input_tokens_seen": 976992, "step": 519, "train_runtime": 1555.2869, "train_tokens_per_second": 628.175 }, { "epoch": 0.5256507455142785, "grad_norm": 1.3503495454788208, "learning_rate": 1.479493670886076e-05, "loss": 0.1093158945441246, "num_input_tokens_seen": 979234, "step": 520, "train_runtime": 1557.6262, "train_tokens_per_second": 628.671 }, { "epoch": 0.5266616123325751, "grad_norm": 1.8989427089691162, "learning_rate": 1.4784810126582281e-05, "loss": 0.08838169276714325, "num_input_tokens_seen": 980844, "step": 521, "train_runtime": 1559.8377, "train_tokens_per_second": 628.812 }, { "epoch": 0.5276724791508719, "grad_norm": 1.437752604484558, "learning_rate": 1.4774683544303798e-05, "loss": 0.12611472606658936, "num_input_tokens_seen": 982764, "step": 522, "train_runtime": 1562.1103, "train_tokens_per_second": 629.126 }, { "epoch": 0.5286833459691685, "grad_norm": 1.428272008895874, "learning_rate": 1.4764556962025317e-05, "loss": 0.11297731846570969, "num_input_tokens_seen": 984420, "step": 523, "train_runtime": 1564.3837, "train_tokens_per_second": 629.27 }, { "epoch": 0.5296942127874652, "grad_norm": 1.6326502561569214, "learning_rate": 1.4754430379746836e-05, "loss": 0.12765304744243622, "num_input_tokens_seen": 986348, "step": 524, "train_runtime": 1566.6967, "train_tokens_per_second": 629.572 }, { "epoch": 0.530705079605762, "grad_norm": 1.2742489576339722, "learning_rate": 1.4744303797468356e-05, "loss": 0.08136743307113647, "num_input_tokens_seen": 988886, "step": 525, "train_runtime": 1569.2091, "train_tokens_per_second": 630.181 }, { "epoch": 0.5317159464240586, "grad_norm": 1.4503283500671387, "learning_rate": 1.4734177215189875e-05, "loss": 0.11254356801509857, "num_input_tokens_seen": 991078, "step": 526, "train_runtime": 1571.597, "train_tokens_per_second": 630.618 }, { "epoch": 0.5327268132423553, "grad_norm": 1.2532612085342407, "learning_rate": 1.4724050632911394e-05, "loss": 0.06500692665576935, "num_input_tokens_seen": 992786, "step": 527, "train_runtime": 1573.8847, "train_tokens_per_second": 630.787 }, { "epoch": 0.533737680060652, "grad_norm": 1.1754192113876343, "learning_rate": 1.4713924050632913e-05, "loss": 0.07045131176710129, "num_input_tokens_seen": 994364, "step": 528, "train_runtime": 1576.0595, "train_tokens_per_second": 630.918 }, { "epoch": 0.5347485468789487, "grad_norm": 1.5875356197357178, "learning_rate": 1.4703797468354432e-05, "loss": 0.08082123845815659, "num_input_tokens_seen": 996310, "step": 529, "train_runtime": 1578.3601, "train_tokens_per_second": 631.231 }, { "epoch": 0.5357594136972453, "grad_norm": 1.5012823343276978, "learning_rate": 1.4693670886075951e-05, "loss": 0.10939884185791016, "num_input_tokens_seen": 998072, "step": 530, "train_runtime": 1580.6071, "train_tokens_per_second": 631.449 }, { "epoch": 0.5367702805155421, "grad_norm": 1.4216855764389038, "learning_rate": 1.468354430379747e-05, "loss": 0.08538244664669037, "num_input_tokens_seen": 999422, "step": 531, "train_runtime": 1582.7805, "train_tokens_per_second": 631.434 }, { "epoch": 0.5377811473338387, "grad_norm": 1.4364869594573975, "learning_rate": 1.4673417721518987e-05, "loss": 0.10728795826435089, "num_input_tokens_seen": 1001204, "step": 532, "train_runtime": 1584.9948, "train_tokens_per_second": 631.677 }, { "epoch": 0.5387920141521354, "grad_norm": 1.5693148374557495, "learning_rate": 1.4663291139240508e-05, "loss": 0.08584736287593842, "num_input_tokens_seen": 1002712, "step": 533, "train_runtime": 1587.1717, "train_tokens_per_second": 631.76 }, { "epoch": 0.5398028809704322, "grad_norm": 1.8310790061950684, "learning_rate": 1.4653164556962027e-05, "loss": 0.14106503129005432, "num_input_tokens_seen": 1004918, "step": 534, "train_runtime": 1589.5276, "train_tokens_per_second": 632.212 }, { "epoch": 0.5408137477887288, "grad_norm": 1.524724006652832, "learning_rate": 1.4643037974683545e-05, "loss": 0.07863933593034744, "num_input_tokens_seen": 1006830, "step": 535, "train_runtime": 1591.8305, "train_tokens_per_second": 632.498 }, { "epoch": 0.5418246146070256, "grad_norm": 1.793192744255066, "learning_rate": 1.4632911392405065e-05, "loss": 0.0889945775270462, "num_input_tokens_seen": 1008674, "step": 536, "train_runtime": 1594.062, "train_tokens_per_second": 632.77 }, { "epoch": 0.5428354814253222, "grad_norm": 1.2465921640396118, "learning_rate": 1.4622784810126585e-05, "loss": 0.09050318598747253, "num_input_tokens_seen": 1010454, "step": 537, "train_runtime": 1596.3341, "train_tokens_per_second": 632.984 }, { "epoch": 0.5438463482436189, "grad_norm": 1.1289308071136475, "learning_rate": 1.4612658227848102e-05, "loss": 0.0836988016963005, "num_input_tokens_seen": 1012450, "step": 538, "train_runtime": 1598.612, "train_tokens_per_second": 633.331 }, { "epoch": 0.5448572150619156, "grad_norm": 1.6175777912139893, "learning_rate": 1.4602531645569623e-05, "loss": 0.09603976458311081, "num_input_tokens_seen": 1014482, "step": 539, "train_runtime": 1600.9696, "train_tokens_per_second": 633.667 }, { "epoch": 0.5458680818802123, "grad_norm": 1.4792476892471313, "learning_rate": 1.459240506329114e-05, "loss": 0.09882150590419769, "num_input_tokens_seen": 1016358, "step": 540, "train_runtime": 1603.2078, "train_tokens_per_second": 633.953 }, { "epoch": 0.546878948698509, "grad_norm": 1.4835591316223145, "learning_rate": 1.458227848101266e-05, "loss": 0.09315601736307144, "num_input_tokens_seen": 1018128, "step": 541, "train_runtime": 1619.5066, "train_tokens_per_second": 628.666 }, { "epoch": 0.5478898155168057, "grad_norm": 1.0326731204986572, "learning_rate": 1.457215189873418e-05, "loss": 0.08888642489910126, "num_input_tokens_seen": 1020734, "step": 542, "train_runtime": 1621.9786, "train_tokens_per_second": 629.314 }, { "epoch": 0.5489006823351024, "grad_norm": 1.6520812511444092, "learning_rate": 1.4562025316455697e-05, "loss": 0.11820662766695023, "num_input_tokens_seen": 1022694, "step": 543, "train_runtime": 1624.2661, "train_tokens_per_second": 629.634 }, { "epoch": 0.549911549153399, "grad_norm": 1.2735785245895386, "learning_rate": 1.4551898734177216e-05, "loss": 0.08194012939929962, "num_input_tokens_seen": 1024474, "step": 544, "train_runtime": 1626.5106, "train_tokens_per_second": 629.86 }, { "epoch": 0.5509224159716958, "grad_norm": 1.289209246635437, "learning_rate": 1.4541772151898734e-05, "loss": 0.10879933834075928, "num_input_tokens_seen": 1026564, "step": 545, "train_runtime": 1628.8592, "train_tokens_per_second": 630.235 }, { "epoch": 0.5519332827899924, "grad_norm": 1.1850883960723877, "learning_rate": 1.4531645569620255e-05, "loss": 0.08871644735336304, "num_input_tokens_seen": 1028902, "step": 546, "train_runtime": 1631.3021, "train_tokens_per_second": 630.724 }, { "epoch": 0.5529441496082891, "grad_norm": 1.2800348997116089, "learning_rate": 1.4521518987341774e-05, "loss": 0.09548143297433853, "num_input_tokens_seen": 1030790, "step": 547, "train_runtime": 1633.5656, "train_tokens_per_second": 631.006 }, { "epoch": 0.5539550164265858, "grad_norm": 1.6444133520126343, "learning_rate": 1.4511392405063291e-05, "loss": 0.09822962433099747, "num_input_tokens_seen": 1032664, "step": 548, "train_runtime": 1635.8492, "train_tokens_per_second": 631.271 }, { "epoch": 0.5549658832448825, "grad_norm": 1.2001855373382568, "learning_rate": 1.4501265822784812e-05, "loss": 0.0989033579826355, "num_input_tokens_seen": 1035148, "step": 549, "train_runtime": 1638.3639, "train_tokens_per_second": 631.818 }, { "epoch": 0.5559767500631791, "grad_norm": 1.5036348104476929, "learning_rate": 1.4491139240506331e-05, "loss": 0.11629313230514526, "num_input_tokens_seen": 1037144, "step": 550, "train_runtime": 1640.6717, "train_tokens_per_second": 632.146 }, { "epoch": 0.5569876168814759, "grad_norm": 1.3959003686904907, "learning_rate": 1.4481012658227848e-05, "loss": 0.08654140681028366, "num_input_tokens_seen": 1038914, "step": 551, "train_runtime": 1642.9292, "train_tokens_per_second": 632.355 }, { "epoch": 0.5579984836997726, "grad_norm": 1.6200852394104004, "learning_rate": 1.4470886075949369e-05, "loss": 0.07833883911371231, "num_input_tokens_seen": 1040926, "step": 552, "train_runtime": 1645.262, "train_tokens_per_second": 632.681 }, { "epoch": 0.5590093505180692, "grad_norm": 1.2970929145812988, "learning_rate": 1.4460759493670887e-05, "loss": 0.07217128574848175, "num_input_tokens_seen": 1042626, "step": 553, "train_runtime": 1647.4423, "train_tokens_per_second": 632.876 }, { "epoch": 0.560020217336366, "grad_norm": 1.4967849254608154, "learning_rate": 1.4450632911392406e-05, "loss": 0.09161016345024109, "num_input_tokens_seen": 1044082, "step": 554, "train_runtime": 1649.6274, "train_tokens_per_second": 632.92 }, { "epoch": 0.5610310841546626, "grad_norm": 1.1432979106903076, "learning_rate": 1.4440506329113926e-05, "loss": 0.075189508497715, "num_input_tokens_seen": 1045858, "step": 555, "train_runtime": 1651.8681, "train_tokens_per_second": 633.137 }, { "epoch": 0.5620419509729593, "grad_norm": 1.1668124198913574, "learning_rate": 1.4430379746835444e-05, "loss": 0.08752522617578506, "num_input_tokens_seen": 1047734, "step": 556, "train_runtime": 1654.143, "train_tokens_per_second": 633.4 }, { "epoch": 0.563052817791256, "grad_norm": 1.1975582838058472, "learning_rate": 1.4420253164556963e-05, "loss": 0.08159657567739487, "num_input_tokens_seen": 1049074, "step": 557, "train_runtime": 1656.2978, "train_tokens_per_second": 633.385 }, { "epoch": 0.5640636846095527, "grad_norm": 1.4059653282165527, "learning_rate": 1.4410126582278484e-05, "loss": 0.11405330151319504, "num_input_tokens_seen": 1050914, "step": 558, "train_runtime": 1658.6954, "train_tokens_per_second": 633.579 }, { "epoch": 0.5650745514278493, "grad_norm": 1.376706600189209, "learning_rate": 1.4400000000000001e-05, "loss": 0.10115694999694824, "num_input_tokens_seen": 1052764, "step": 559, "train_runtime": 1660.9996, "train_tokens_per_second": 633.814 }, { "epoch": 0.5660854182461461, "grad_norm": 1.294089674949646, "learning_rate": 1.438987341772152e-05, "loss": 0.102215975522995, "num_input_tokens_seen": 1054490, "step": 560, "train_runtime": 1663.3142, "train_tokens_per_second": 633.969 }, { "epoch": 0.5670962850644428, "grad_norm": 1.1829617023468018, "learning_rate": 1.4379746835443038e-05, "loss": 0.08898695558309555, "num_input_tokens_seen": 1056460, "step": 561, "train_runtime": 1665.6588, "train_tokens_per_second": 634.26 }, { "epoch": 0.5681071518827394, "grad_norm": 1.4848825931549072, "learning_rate": 1.4369620253164558e-05, "loss": 0.11753303557634354, "num_input_tokens_seen": 1058084, "step": 562, "train_runtime": 1667.8735, "train_tokens_per_second": 634.391 }, { "epoch": 0.5691180187010362, "grad_norm": 1.299782633781433, "learning_rate": 1.4359493670886077e-05, "loss": 0.10481813549995422, "num_input_tokens_seen": 1060308, "step": 563, "train_runtime": 1670.2485, "train_tokens_per_second": 634.821 }, { "epoch": 0.5701288855193328, "grad_norm": 1.2719480991363525, "learning_rate": 1.4349367088607595e-05, "loss": 0.08594390004873276, "num_input_tokens_seen": 1061998, "step": 564, "train_runtime": 1672.4751, "train_tokens_per_second": 634.986 }, { "epoch": 0.5711397523376295, "grad_norm": 1.4669873714447021, "learning_rate": 1.4339240506329116e-05, "loss": 0.11037176847457886, "num_input_tokens_seen": 1063624, "step": 565, "train_runtime": 1674.7872, "train_tokens_per_second": 635.08 }, { "epoch": 0.5721506191559262, "grad_norm": 1.2808465957641602, "learning_rate": 1.4329113924050635e-05, "loss": 0.0842655748128891, "num_input_tokens_seen": 1065408, "step": 566, "train_runtime": 1677.1211, "train_tokens_per_second": 635.26 }, { "epoch": 0.5731614859742229, "grad_norm": 1.0893831253051758, "learning_rate": 1.4318987341772152e-05, "loss": 0.09920214116573334, "num_input_tokens_seen": 1067676, "step": 567, "train_runtime": 1679.5113, "train_tokens_per_second": 635.706 }, { "epoch": 0.5741723527925195, "grad_norm": 1.3617602586746216, "learning_rate": 1.4308860759493673e-05, "loss": 0.08810853958129883, "num_input_tokens_seen": 1069738, "step": 568, "train_runtime": 1681.8336, "train_tokens_per_second": 636.055 }, { "epoch": 0.5751832196108163, "grad_norm": 1.481034517288208, "learning_rate": 1.429873417721519e-05, "loss": 0.09026068449020386, "num_input_tokens_seen": 1071286, "step": 569, "train_runtime": 1684.0444, "train_tokens_per_second": 636.139 }, { "epoch": 0.576194086429113, "grad_norm": 1.343260645866394, "learning_rate": 1.428860759493671e-05, "loss": 0.08098727464675903, "num_input_tokens_seen": 1073526, "step": 570, "train_runtime": 1686.3793, "train_tokens_per_second": 636.586 }, { "epoch": 0.5772049532474096, "grad_norm": 1.2387670278549194, "learning_rate": 1.427848101265823e-05, "loss": 0.129585862159729, "num_input_tokens_seen": 1076090, "step": 571, "train_runtime": 1703.5398, "train_tokens_per_second": 631.679 }, { "epoch": 0.5782158200657064, "grad_norm": 1.4559392929077148, "learning_rate": 1.4268354430379747e-05, "loss": 0.11523658037185669, "num_input_tokens_seen": 1078008, "step": 572, "train_runtime": 1705.7843, "train_tokens_per_second": 631.972 }, { "epoch": 0.579226686884003, "grad_norm": 1.7048641443252563, "learning_rate": 1.4258227848101267e-05, "loss": 0.12695106863975525, "num_input_tokens_seen": 1079674, "step": 573, "train_runtime": 1708.1147, "train_tokens_per_second": 632.085 }, { "epoch": 0.5802375537022997, "grad_norm": 1.0525803565979004, "learning_rate": 1.4248101265822787e-05, "loss": 0.07779115438461304, "num_input_tokens_seen": 1081812, "step": 574, "train_runtime": 1710.4142, "train_tokens_per_second": 632.485 }, { "epoch": 0.5812484205205964, "grad_norm": 1.0833847522735596, "learning_rate": 1.4237974683544305e-05, "loss": 0.06608449667692184, "num_input_tokens_seen": 1084224, "step": 575, "train_runtime": 1712.7785, "train_tokens_per_second": 633.021 }, { "epoch": 0.5822592873388931, "grad_norm": 1.3155786991119385, "learning_rate": 1.4227848101265824e-05, "loss": 0.10153818130493164, "num_input_tokens_seen": 1085852, "step": 576, "train_runtime": 1714.9937, "train_tokens_per_second": 633.152 }, { "epoch": 0.5832701541571897, "grad_norm": 1.1174075603485107, "learning_rate": 1.4217721518987341e-05, "loss": 0.09092947840690613, "num_input_tokens_seen": 1088162, "step": 577, "train_runtime": 1717.4203, "train_tokens_per_second": 633.603 }, { "epoch": 0.5842810209754865, "grad_norm": 1.3650635480880737, "learning_rate": 1.4207594936708862e-05, "loss": 0.08384772390127182, "num_input_tokens_seen": 1089830, "step": 578, "train_runtime": 1719.6325, "train_tokens_per_second": 633.758 }, { "epoch": 0.5852918877937832, "grad_norm": 1.4608466625213623, "learning_rate": 1.4197468354430381e-05, "loss": 0.09117217361927032, "num_input_tokens_seen": 1091450, "step": 579, "train_runtime": 1721.8127, "train_tokens_per_second": 633.896 }, { "epoch": 0.5863027546120798, "grad_norm": 1.2263563871383667, "learning_rate": 1.4187341772151898e-05, "loss": 0.09236721694469452, "num_input_tokens_seen": 1093596, "step": 580, "train_runtime": 1724.1406, "train_tokens_per_second": 634.285 }, { "epoch": 0.5873136214303766, "grad_norm": 1.2389177083969116, "learning_rate": 1.417721518987342e-05, "loss": 0.1001046821475029, "num_input_tokens_seen": 1095482, "step": 581, "train_runtime": 1726.3722, "train_tokens_per_second": 634.557 }, { "epoch": 0.5883244882486732, "grad_norm": 1.4099202156066895, "learning_rate": 1.4167088607594938e-05, "loss": 0.10450707376003265, "num_input_tokens_seen": 1097222, "step": 582, "train_runtime": 1728.6093, "train_tokens_per_second": 634.743 }, { "epoch": 0.5893353550669699, "grad_norm": 1.3976120948791504, "learning_rate": 1.4156962025316456e-05, "loss": 0.0986606627702713, "num_input_tokens_seen": 1099366, "step": 583, "train_runtime": 1730.9042, "train_tokens_per_second": 635.14 }, { "epoch": 0.5903462218852666, "grad_norm": 1.5271971225738525, "learning_rate": 1.4146835443037976e-05, "loss": 0.11914996802806854, "num_input_tokens_seen": 1101232, "step": 584, "train_runtime": 1733.1427, "train_tokens_per_second": 635.396 }, { "epoch": 0.5913570887035633, "grad_norm": 1.394169807434082, "learning_rate": 1.4136708860759494e-05, "loss": 0.13228291273117065, "num_input_tokens_seen": 1103144, "step": 585, "train_runtime": 1735.4054, "train_tokens_per_second": 635.669 }, { "epoch": 0.59236795552186, "grad_norm": 1.1584802865982056, "learning_rate": 1.4126582278481013e-05, "loss": 0.09044644981622696, "num_input_tokens_seen": 1105134, "step": 586, "train_runtime": 1737.6833, "train_tokens_per_second": 635.981 }, { "epoch": 0.5933788223401567, "grad_norm": 1.2238107919692993, "learning_rate": 1.4116455696202534e-05, "loss": 0.10371394455432892, "num_input_tokens_seen": 1106752, "step": 587, "train_runtime": 1739.8836, "train_tokens_per_second": 636.107 }, { "epoch": 0.5943896891584534, "grad_norm": 1.5565840005874634, "learning_rate": 1.4106329113924051e-05, "loss": 0.093437559902668, "num_input_tokens_seen": 1108152, "step": 588, "train_runtime": 1742.0736, "train_tokens_per_second": 636.111 }, { "epoch": 0.59540055597675, "grad_norm": 1.2015377283096313, "learning_rate": 1.409620253164557e-05, "loss": 0.08773557841777802, "num_input_tokens_seen": 1109994, "step": 589, "train_runtime": 1744.3725, "train_tokens_per_second": 636.329 }, { "epoch": 0.5964114227950468, "grad_norm": 1.4085197448730469, "learning_rate": 1.4086075949367091e-05, "loss": 0.09602763503789902, "num_input_tokens_seen": 1112366, "step": 590, "train_runtime": 1747.0116, "train_tokens_per_second": 636.725 }, { "epoch": 0.5974222896133434, "grad_norm": 1.3660284280776978, "learning_rate": 1.4075949367088608e-05, "loss": 0.11296717822551727, "num_input_tokens_seen": 1114230, "step": 591, "train_runtime": 1749.2776, "train_tokens_per_second": 636.966 }, { "epoch": 0.5984331564316401, "grad_norm": 1.5200594663619995, "learning_rate": 1.4065822784810127e-05, "loss": 0.11103707551956177, "num_input_tokens_seen": 1115886, "step": 592, "train_runtime": 1751.5377, "train_tokens_per_second": 637.089 }, { "epoch": 0.5994440232499368, "grad_norm": 1.2209599018096924, "learning_rate": 1.4055696202531647e-05, "loss": 0.08207274973392487, "num_input_tokens_seen": 1117622, "step": 593, "train_runtime": 1753.7926, "train_tokens_per_second": 637.26 }, { "epoch": 0.6004548900682335, "grad_norm": 1.2323637008666992, "learning_rate": 1.4045569620253166e-05, "loss": 0.08164481818675995, "num_input_tokens_seen": 1119962, "step": 594, "train_runtime": 1756.1607, "train_tokens_per_second": 637.733 }, { "epoch": 0.6004548900682335, "eval_loss": 0.3728827238082886, "eval_runtime": 54.7389, "eval_samples_per_second": 16.058, "eval_steps_per_second": 8.038, "num_input_tokens_seen": 1119962, "step": 594 }, { "epoch": 0.6014657568865301, "grad_norm": 1.4974766969680786, "learning_rate": 1.4035443037974685e-05, "loss": 0.11136750131845474, "num_input_tokens_seen": 1121502, "step": 595, "train_runtime": 1813.2392, "train_tokens_per_second": 618.507 }, { "epoch": 0.6024766237048269, "grad_norm": 1.230702519416809, "learning_rate": 1.4025316455696202e-05, "loss": 0.07754892855882645, "num_input_tokens_seen": 1123712, "step": 596, "train_runtime": 1815.5803, "train_tokens_per_second": 618.927 }, { "epoch": 0.6034874905231236, "grad_norm": 1.3749258518218994, "learning_rate": 1.4015189873417723e-05, "loss": 0.08618313074111938, "num_input_tokens_seen": 1125700, "step": 597, "train_runtime": 1817.8863, "train_tokens_per_second": 619.236 }, { "epoch": 0.6044983573414203, "grad_norm": 1.4063817262649536, "learning_rate": 1.4005063291139242e-05, "loss": 0.12821811437606812, "num_input_tokens_seen": 1127428, "step": 598, "train_runtime": 1820.1038, "train_tokens_per_second": 619.431 }, { "epoch": 0.605509224159717, "grad_norm": 1.7265965938568115, "learning_rate": 1.399493670886076e-05, "loss": 0.09498798847198486, "num_input_tokens_seen": 1128956, "step": 599, "train_runtime": 1822.2867, "train_tokens_per_second": 619.527 }, { "epoch": 0.6065200909780136, "grad_norm": 1.4627681970596313, "learning_rate": 1.398481012658228e-05, "loss": 0.11261933296918869, "num_input_tokens_seen": 1130624, "step": 600, "train_runtime": 1824.4907, "train_tokens_per_second": 619.693 }, { "epoch": 0.6075309577963104, "grad_norm": 1.4472676515579224, "learning_rate": 1.3974683544303798e-05, "loss": 0.10068300366401672, "num_input_tokens_seen": 1132692, "step": 601, "train_runtime": 1840.2127, "train_tokens_per_second": 615.522 }, { "epoch": 0.608541824614607, "grad_norm": 1.8458853960037231, "learning_rate": 1.3964556962025317e-05, "loss": 0.1499527394771576, "num_input_tokens_seen": 1134506, "step": 602, "train_runtime": 1842.4982, "train_tokens_per_second": 615.743 }, { "epoch": 0.6095526914329037, "grad_norm": 1.1479370594024658, "learning_rate": 1.3954430379746837e-05, "loss": 0.07514189928770065, "num_input_tokens_seen": 1136336, "step": 603, "train_runtime": 1844.7626, "train_tokens_per_second": 615.98 }, { "epoch": 0.6105635582512005, "grad_norm": 1.1275358200073242, "learning_rate": 1.3944303797468355e-05, "loss": 0.07794931530952454, "num_input_tokens_seen": 1138190, "step": 604, "train_runtime": 1847.0661, "train_tokens_per_second": 616.215 }, { "epoch": 0.6115744250694971, "grad_norm": 1.5748790502548218, "learning_rate": 1.3934177215189874e-05, "loss": 0.11096584796905518, "num_input_tokens_seen": 1140056, "step": 605, "train_runtime": 1849.3173, "train_tokens_per_second": 616.474 }, { "epoch": 0.6125852918877938, "grad_norm": 1.0246809720993042, "learning_rate": 1.3924050632911395e-05, "loss": 0.07092858850955963, "num_input_tokens_seen": 1141870, "step": 606, "train_runtime": 1851.5985, "train_tokens_per_second": 616.694 }, { "epoch": 0.6135961587060905, "grad_norm": 1.459824562072754, "learning_rate": 1.3913924050632912e-05, "loss": 0.10918493568897247, "num_input_tokens_seen": 1143626, "step": 607, "train_runtime": 1853.8778, "train_tokens_per_second": 616.883 }, { "epoch": 0.6146070255243872, "grad_norm": 1.285499930381775, "learning_rate": 1.3903797468354431e-05, "loss": 0.11168704926967621, "num_input_tokens_seen": 1145798, "step": 608, "train_runtime": 1856.239, "train_tokens_per_second": 617.269 }, { "epoch": 0.6156178923426838, "grad_norm": 1.3664791584014893, "learning_rate": 1.389367088607595e-05, "loss": 0.09251128137111664, "num_input_tokens_seen": 1147482, "step": 609, "train_runtime": 1858.4667, "train_tokens_per_second": 617.435 }, { "epoch": 0.6166287591609806, "grad_norm": 1.304483413696289, "learning_rate": 1.388354430379747e-05, "loss": 0.08640559017658234, "num_input_tokens_seen": 1149396, "step": 610, "train_runtime": 1860.7328, "train_tokens_per_second": 617.711 }, { "epoch": 0.6176396259792772, "grad_norm": 1.1270325183868408, "learning_rate": 1.3873417721518988e-05, "loss": 0.07292294502258301, "num_input_tokens_seen": 1150896, "step": 611, "train_runtime": 1863.0463, "train_tokens_per_second": 617.75 }, { "epoch": 0.6186504927975739, "grad_norm": 1.4046927690505981, "learning_rate": 1.3863291139240507e-05, "loss": 0.14309613406658173, "num_input_tokens_seen": 1153316, "step": 612, "train_runtime": 1865.5701, "train_tokens_per_second": 618.211 }, { "epoch": 0.6196613596158707, "grad_norm": 1.4617398977279663, "learning_rate": 1.3853164556962027e-05, "loss": 0.10099618881940842, "num_input_tokens_seen": 1155122, "step": 613, "train_runtime": 1867.807, "train_tokens_per_second": 618.438 }, { "epoch": 0.6206722264341673, "grad_norm": 1.148921012878418, "learning_rate": 1.3843037974683546e-05, "loss": 0.07941463589668274, "num_input_tokens_seen": 1156720, "step": 614, "train_runtime": 1869.983, "train_tokens_per_second": 618.572 }, { "epoch": 0.621683093252464, "grad_norm": 1.072580099105835, "learning_rate": 1.3832911392405065e-05, "loss": 0.07684888690710068, "num_input_tokens_seen": 1158748, "step": 615, "train_runtime": 1872.2934, "train_tokens_per_second": 618.892 }, { "epoch": 0.6226939600707607, "grad_norm": 1.4846950769424438, "learning_rate": 1.3822784810126584e-05, "loss": 0.12174379825592041, "num_input_tokens_seen": 1160814, "step": 616, "train_runtime": 1874.6157, "train_tokens_per_second": 619.228 }, { "epoch": 0.6237048268890574, "grad_norm": 1.6231915950775146, "learning_rate": 1.3812658227848101e-05, "loss": 0.13438279926776886, "num_input_tokens_seen": 1162850, "step": 617, "train_runtime": 1876.9235, "train_tokens_per_second": 619.551 }, { "epoch": 0.624715693707354, "grad_norm": 1.226564884185791, "learning_rate": 1.3802531645569622e-05, "loss": 0.0925150066614151, "num_input_tokens_seen": 1165406, "step": 618, "train_runtime": 1879.3431, "train_tokens_per_second": 620.113 }, { "epoch": 0.6257265605256508, "grad_norm": 1.6471208333969116, "learning_rate": 1.3792405063291141e-05, "loss": 0.1100998967885971, "num_input_tokens_seen": 1167150, "step": 619, "train_runtime": 1881.5797, "train_tokens_per_second": 620.303 }, { "epoch": 0.6267374273439474, "grad_norm": 1.223799467086792, "learning_rate": 1.3782278481012658e-05, "loss": 0.10464879870414734, "num_input_tokens_seen": 1169178, "step": 620, "train_runtime": 1883.8878, "train_tokens_per_second": 620.62 }, { "epoch": 0.6277482941622441, "grad_norm": 1.2662726640701294, "learning_rate": 1.377215189873418e-05, "loss": 0.09581077098846436, "num_input_tokens_seen": 1170776, "step": 621, "train_runtime": 1886.1062, "train_tokens_per_second": 620.737 }, { "epoch": 0.6287591609805409, "grad_norm": 1.2782937288284302, "learning_rate": 1.3762025316455698e-05, "loss": 0.07302618026733398, "num_input_tokens_seen": 1172508, "step": 622, "train_runtime": 1888.3373, "train_tokens_per_second": 620.921 }, { "epoch": 0.6297700277988375, "grad_norm": 1.15910005569458, "learning_rate": 1.3751898734177216e-05, "loss": 0.09295112639665604, "num_input_tokens_seen": 1174694, "step": 623, "train_runtime": 1890.6942, "train_tokens_per_second": 621.303 }, { "epoch": 0.6307808946171342, "grad_norm": 1.6547151803970337, "learning_rate": 1.3741772151898736e-05, "loss": 0.08670621365308762, "num_input_tokens_seen": 1176490, "step": 624, "train_runtime": 1892.9669, "train_tokens_per_second": 621.506 }, { "epoch": 0.6317917614354309, "grad_norm": 1.1826273202896118, "learning_rate": 1.3731645569620254e-05, "loss": 0.07737353444099426, "num_input_tokens_seen": 1178784, "step": 625, "train_runtime": 1895.3074, "train_tokens_per_second": 621.949 }, { "epoch": 0.6328026282537276, "grad_norm": 1.4511724710464478, "learning_rate": 1.3721518987341773e-05, "loss": 0.09621845930814743, "num_input_tokens_seen": 1180080, "step": 626, "train_runtime": 1897.5065, "train_tokens_per_second": 621.911 }, { "epoch": 0.6338134950720242, "grad_norm": 1.4344146251678467, "learning_rate": 1.3711392405063294e-05, "loss": 0.07546381652355194, "num_input_tokens_seen": 1181322, "step": 627, "train_runtime": 1899.716, "train_tokens_per_second": 621.841 }, { "epoch": 0.634824361890321, "grad_norm": 1.3891464471817017, "learning_rate": 1.3701265822784811e-05, "loss": 0.13230165839195251, "num_input_tokens_seen": 1183382, "step": 628, "train_runtime": 1902.0587, "train_tokens_per_second": 622.159 }, { "epoch": 0.6358352287086176, "grad_norm": 1.2920548915863037, "learning_rate": 1.369113924050633e-05, "loss": 0.10276541858911514, "num_input_tokens_seen": 1185392, "step": 629, "train_runtime": 1904.3721, "train_tokens_per_second": 622.458 }, { "epoch": 0.6368460955269143, "grad_norm": 1.4265518188476562, "learning_rate": 1.3681012658227851e-05, "loss": 0.1239503026008606, "num_input_tokens_seen": 1187446, "step": 630, "train_runtime": 1906.7148, "train_tokens_per_second": 622.771 }, { "epoch": 0.637856962345211, "grad_norm": 1.3055717945098877, "learning_rate": 1.3670886075949368e-05, "loss": 0.09938111156225204, "num_input_tokens_seen": 1189472, "step": 631, "train_runtime": 1922.3408, "train_tokens_per_second": 618.762 }, { "epoch": 0.6388678291635077, "grad_norm": 1.341225266456604, "learning_rate": 1.3660759493670887e-05, "loss": 0.10700959712266922, "num_input_tokens_seen": 1191462, "step": 632, "train_runtime": 1924.6437, "train_tokens_per_second": 619.056 }, { "epoch": 0.6398786959818044, "grad_norm": 1.4074451923370361, "learning_rate": 1.3650632911392405e-05, "loss": 0.1088184043765068, "num_input_tokens_seen": 1193630, "step": 633, "train_runtime": 1926.982, "train_tokens_per_second": 619.43 }, { "epoch": 0.6408895628001011, "grad_norm": 1.350207805633545, "learning_rate": 1.3640506329113926e-05, "loss": 0.09866318106651306, "num_input_tokens_seen": 1195248, "step": 634, "train_runtime": 1929.25, "train_tokens_per_second": 619.54 }, { "epoch": 0.6419004296183978, "grad_norm": 1.2634080648422241, "learning_rate": 1.3630379746835445e-05, "loss": 0.10193081945180893, "num_input_tokens_seen": 1197508, "step": 635, "train_runtime": 1931.638, "train_tokens_per_second": 619.944 }, { "epoch": 0.6429112964366944, "grad_norm": 1.1352425813674927, "learning_rate": 1.3620253164556962e-05, "loss": 0.09427931904792786, "num_input_tokens_seen": 1199538, "step": 636, "train_runtime": 1934.0314, "train_tokens_per_second": 620.227 }, { "epoch": 0.6439221632549912, "grad_norm": 1.3848373889923096, "learning_rate": 1.3610126582278483e-05, "loss": 0.10558828711509705, "num_input_tokens_seen": 1201214, "step": 637, "train_runtime": 1936.3585, "train_tokens_per_second": 620.347 }, { "epoch": 0.6449330300732878, "grad_norm": 1.2026723623275757, "learning_rate": 1.3600000000000002e-05, "loss": 0.08852043747901917, "num_input_tokens_seen": 1202928, "step": 638, "train_runtime": 1938.6621, "train_tokens_per_second": 620.494 }, { "epoch": 0.6459438968915845, "grad_norm": 1.1012513637542725, "learning_rate": 1.358987341772152e-05, "loss": 0.08230563998222351, "num_input_tokens_seen": 1205536, "step": 639, "train_runtime": 1941.1067, "train_tokens_per_second": 621.056 }, { "epoch": 0.6469547637098813, "grad_norm": 1.008036732673645, "learning_rate": 1.357974683544304e-05, "loss": 0.09450970590114594, "num_input_tokens_seen": 1208210, "step": 640, "train_runtime": 1943.6072, "train_tokens_per_second": 621.633 }, { "epoch": 0.6479656305281779, "grad_norm": 1.4536775350570679, "learning_rate": 1.3569620253164557e-05, "loss": 0.10127629339694977, "num_input_tokens_seen": 1209926, "step": 641, "train_runtime": 1945.9397, "train_tokens_per_second": 621.77 }, { "epoch": 0.6489764973464746, "grad_norm": 1.9795511960983276, "learning_rate": 1.3559493670886077e-05, "loss": 0.15318067371845245, "num_input_tokens_seen": 1211520, "step": 642, "train_runtime": 1948.1584, "train_tokens_per_second": 621.88 }, { "epoch": 0.6499873641647713, "grad_norm": 1.412170648574829, "learning_rate": 1.3549367088607597e-05, "loss": 0.09511595219373703, "num_input_tokens_seen": 1213840, "step": 643, "train_runtime": 1950.588, "train_tokens_per_second": 622.294 }, { "epoch": 0.650998230983068, "grad_norm": 1.7817212343215942, "learning_rate": 1.3539240506329115e-05, "loss": 0.14267957210540771, "num_input_tokens_seen": 1215450, "step": 644, "train_runtime": 1952.8277, "train_tokens_per_second": 622.405 }, { "epoch": 0.6520090978013646, "grad_norm": 1.1762109994888306, "learning_rate": 1.3529113924050634e-05, "loss": 0.10678732395172119, "num_input_tokens_seen": 1217814, "step": 645, "train_runtime": 1955.1947, "train_tokens_per_second": 622.861 }, { "epoch": 0.6530199646196614, "grad_norm": 1.2385965585708618, "learning_rate": 1.3518987341772155e-05, "loss": 0.11040400713682175, "num_input_tokens_seen": 1220000, "step": 646, "train_runtime": 1957.5921, "train_tokens_per_second": 623.215 }, { "epoch": 0.654030831437958, "grad_norm": 1.7378219366073608, "learning_rate": 1.3508860759493672e-05, "loss": 0.09476306289434433, "num_input_tokens_seen": 1221386, "step": 647, "train_runtime": 1959.7685, "train_tokens_per_second": 623.23 }, { "epoch": 0.6550416982562547, "grad_norm": 1.2294435501098633, "learning_rate": 1.3498734177215191e-05, "loss": 0.08711254596710205, "num_input_tokens_seen": 1222972, "step": 648, "train_runtime": 1962.0276, "train_tokens_per_second": 623.32 }, { "epoch": 0.6560525650745515, "grad_norm": 1.0858039855957031, "learning_rate": 1.3488607594936708e-05, "loss": 0.08094838261604309, "num_input_tokens_seen": 1224776, "step": 649, "train_runtime": 1964.3018, "train_tokens_per_second": 623.517 }, { "epoch": 0.6570634318928481, "grad_norm": 1.4281175136566162, "learning_rate": 1.347848101265823e-05, "loss": 0.10982443392276764, "num_input_tokens_seen": 1226784, "step": 650, "train_runtime": 1966.5943, "train_tokens_per_second": 623.811 }, { "epoch": 0.6580742987111448, "grad_norm": 1.8370027542114258, "learning_rate": 1.3468354430379748e-05, "loss": 0.1082611083984375, "num_input_tokens_seen": 1228484, "step": 651, "train_runtime": 1968.8016, "train_tokens_per_second": 623.976 }, { "epoch": 0.6590851655294415, "grad_norm": 1.2840733528137207, "learning_rate": 1.3458227848101266e-05, "loss": 0.08515030145645142, "num_input_tokens_seen": 1230210, "step": 652, "train_runtime": 1970.9987, "train_tokens_per_second": 624.156 }, { "epoch": 0.6600960323477382, "grad_norm": 1.6538041830062866, "learning_rate": 1.3448101265822786e-05, "loss": 0.14575600624084473, "num_input_tokens_seen": 1232078, "step": 653, "train_runtime": 1973.2675, "train_tokens_per_second": 624.385 }, { "epoch": 0.6611068991660348, "grad_norm": 1.4147297143936157, "learning_rate": 1.3437974683544306e-05, "loss": 0.09866475313901901, "num_input_tokens_seen": 1233970, "step": 654, "train_runtime": 1975.5126, "train_tokens_per_second": 624.633 }, { "epoch": 0.6621177659843316, "grad_norm": 1.150806188583374, "learning_rate": 1.3427848101265823e-05, "loss": 0.09834861755371094, "num_input_tokens_seen": 1235770, "step": 655, "train_runtime": 1977.7801, "train_tokens_per_second": 624.827 }, { "epoch": 0.6631286328026282, "grad_norm": 1.2239781618118286, "learning_rate": 1.3417721518987344e-05, "loss": 0.09434303641319275, "num_input_tokens_seen": 1237816, "step": 656, "train_runtime": 1980.0888, "train_tokens_per_second": 625.132 }, { "epoch": 0.6641394996209249, "grad_norm": 1.286088228225708, "learning_rate": 1.3407594936708861e-05, "loss": 0.08801987767219543, "num_input_tokens_seen": 1240466, "step": 657, "train_runtime": 1982.5757, "train_tokens_per_second": 625.684 }, { "epoch": 0.6651503664392217, "grad_norm": 1.1865568161010742, "learning_rate": 1.339746835443038e-05, "loss": 0.08435536921024323, "num_input_tokens_seen": 1242766, "step": 658, "train_runtime": 1984.9526, "train_tokens_per_second": 626.094 }, { "epoch": 0.6661612332575183, "grad_norm": 1.3380271196365356, "learning_rate": 1.3387341772151901e-05, "loss": 0.08816331624984741, "num_input_tokens_seen": 1244288, "step": 659, "train_runtime": 1987.1526, "train_tokens_per_second": 626.166 }, { "epoch": 0.6671721000758151, "grad_norm": 1.245286464691162, "learning_rate": 1.3377215189873418e-05, "loss": 0.063364677131176, "num_input_tokens_seen": 1245836, "step": 660, "train_runtime": 1989.3989, "train_tokens_per_second": 626.237 }, { "epoch": 0.6681829668941117, "grad_norm": 1.1613205671310425, "learning_rate": 1.3367088607594937e-05, "loss": 0.0773451030254364, "num_input_tokens_seen": 1247956, "step": 661, "train_runtime": 2005.1443, "train_tokens_per_second": 622.377 }, { "epoch": 0.6691938337124084, "grad_norm": 1.5810867547988892, "learning_rate": 1.3356962025316458e-05, "loss": 0.09334032237529755, "num_input_tokens_seen": 1249858, "step": 662, "train_runtime": 2007.4394, "train_tokens_per_second": 622.613 }, { "epoch": 0.6702047005307051, "grad_norm": 1.2277162075042725, "learning_rate": 1.3346835443037976e-05, "loss": 0.11391384154558182, "num_input_tokens_seen": 1252000, "step": 663, "train_runtime": 2009.8695, "train_tokens_per_second": 622.926 }, { "epoch": 0.6712155673490018, "grad_norm": 1.1767802238464355, "learning_rate": 1.3336708860759495e-05, "loss": 0.06979891657829285, "num_input_tokens_seen": 1253574, "step": 664, "train_runtime": 2012.0865, "train_tokens_per_second": 623.022 }, { "epoch": 0.6722264341672984, "grad_norm": 1.2678321599960327, "learning_rate": 1.3326582278481012e-05, "loss": 0.07842098921537399, "num_input_tokens_seen": 1255260, "step": 665, "train_runtime": 2014.2821, "train_tokens_per_second": 623.18 }, { "epoch": 0.6732373009855952, "grad_norm": 1.0496454238891602, "learning_rate": 1.3316455696202533e-05, "loss": 0.10145942866802216, "num_input_tokens_seen": 1257338, "step": 666, "train_runtime": 2016.6438, "train_tokens_per_second": 623.48 }, { "epoch": 0.6742481678038919, "grad_norm": 1.7913352251052856, "learning_rate": 1.3306329113924052e-05, "loss": 0.10923612862825394, "num_input_tokens_seen": 1259314, "step": 667, "train_runtime": 2018.9446, "train_tokens_per_second": 623.749 }, { "epoch": 0.6752590346221885, "grad_norm": 1.2996304035186768, "learning_rate": 1.329620253164557e-05, "loss": 0.08440631628036499, "num_input_tokens_seen": 1261426, "step": 668, "train_runtime": 2021.2342, "train_tokens_per_second": 624.087 }, { "epoch": 0.6762699014404853, "grad_norm": 1.1881675720214844, "learning_rate": 1.328607594936709e-05, "loss": 0.08615678548812866, "num_input_tokens_seen": 1263376, "step": 669, "train_runtime": 2023.5579, "train_tokens_per_second": 624.334 }, { "epoch": 0.6772807682587819, "grad_norm": 1.4807711839675903, "learning_rate": 1.327594936708861e-05, "loss": 0.09940747916698456, "num_input_tokens_seen": 1265248, "step": 670, "train_runtime": 2025.958, "train_tokens_per_second": 624.518 }, { "epoch": 0.6782916350770786, "grad_norm": 1.29509699344635, "learning_rate": 1.3265822784810127e-05, "loss": 0.07858435809612274, "num_input_tokens_seen": 1267244, "step": 671, "train_runtime": 2028.3122, "train_tokens_per_second": 624.778 }, { "epoch": 0.6793025018953753, "grad_norm": 1.6262776851654053, "learning_rate": 1.3255696202531647e-05, "loss": 0.09985235333442688, "num_input_tokens_seen": 1269154, "step": 672, "train_runtime": 2030.6226, "train_tokens_per_second": 625.007 }, { "epoch": 0.680313368713672, "grad_norm": 1.2777587175369263, "learning_rate": 1.3245569620253165e-05, "loss": 0.05365104600787163, "num_input_tokens_seen": 1270498, "step": 673, "train_runtime": 2032.7512, "train_tokens_per_second": 625.014 }, { "epoch": 0.6813242355319686, "grad_norm": 1.5250898599624634, "learning_rate": 1.3235443037974684e-05, "loss": 0.12705999612808228, "num_input_tokens_seen": 1272808, "step": 674, "train_runtime": 2035.1808, "train_tokens_per_second": 625.403 }, { "epoch": 0.6823351023502654, "grad_norm": 1.2472586631774902, "learning_rate": 1.3225316455696205e-05, "loss": 0.08404464274644852, "num_input_tokens_seen": 1274488, "step": 675, "train_runtime": 2037.445, "train_tokens_per_second": 625.532 }, { "epoch": 0.683345969168562, "grad_norm": 1.4096324443817139, "learning_rate": 1.3215189873417722e-05, "loss": 0.09273739159107208, "num_input_tokens_seen": 1275734, "step": 676, "train_runtime": 2039.7406, "train_tokens_per_second": 625.439 }, { "epoch": 0.6843568359868587, "grad_norm": 1.3529670238494873, "learning_rate": 1.3205063291139241e-05, "loss": 0.0949849858880043, "num_input_tokens_seen": 1278096, "step": 677, "train_runtime": 2042.2298, "train_tokens_per_second": 625.834 }, { "epoch": 0.6853677028051555, "grad_norm": 1.4302928447723389, "learning_rate": 1.3194936708860762e-05, "loss": 0.0908072367310524, "num_input_tokens_seen": 1279612, "step": 678, "train_runtime": 2044.4393, "train_tokens_per_second": 625.899 }, { "epoch": 0.6863785696234521, "grad_norm": 1.5077518224716187, "learning_rate": 1.318481012658228e-05, "loss": 0.12817761301994324, "num_input_tokens_seen": 1281712, "step": 679, "train_runtime": 2046.7869, "train_tokens_per_second": 626.207 }, { "epoch": 0.6873894364417488, "grad_norm": 1.6469041109085083, "learning_rate": 1.3174683544303798e-05, "loss": 0.11668027937412262, "num_input_tokens_seen": 1284012, "step": 680, "train_runtime": 2049.1493, "train_tokens_per_second": 626.607 }, { "epoch": 0.6884003032600455, "grad_norm": 1.4139769077301025, "learning_rate": 1.3164556962025317e-05, "loss": 0.06819451600313187, "num_input_tokens_seen": 1285832, "step": 681, "train_runtime": 2051.4208, "train_tokens_per_second": 626.801 }, { "epoch": 0.6894111700783422, "grad_norm": 1.3623279333114624, "learning_rate": 1.3154430379746837e-05, "loss": 0.1149786114692688, "num_input_tokens_seen": 1287984, "step": 682, "train_runtime": 2053.8291, "train_tokens_per_second": 627.114 }, { "epoch": 0.6904220368966388, "grad_norm": 1.9275081157684326, "learning_rate": 1.3144303797468356e-05, "loss": 0.1380566954612732, "num_input_tokens_seen": 1289848, "step": 683, "train_runtime": 2056.1008, "train_tokens_per_second": 627.327 }, { "epoch": 0.6914329037149356, "grad_norm": 1.4662679433822632, "learning_rate": 1.3134177215189875e-05, "loss": 0.11257638037204742, "num_input_tokens_seen": 1291486, "step": 684, "train_runtime": 2058.342, "train_tokens_per_second": 627.44 }, { "epoch": 0.6924437705332323, "grad_norm": 1.4109159708023071, "learning_rate": 1.3124050632911394e-05, "loss": 0.11249294131994247, "num_input_tokens_seen": 1293226, "step": 685, "train_runtime": 2060.5782, "train_tokens_per_second": 627.603 }, { "epoch": 0.6934546373515289, "grad_norm": 1.3101881742477417, "learning_rate": 1.3113924050632913e-05, "loss": 0.08162788301706314, "num_input_tokens_seen": 1294980, "step": 686, "train_runtime": 2062.8207, "train_tokens_per_second": 627.771 }, { "epoch": 0.6944655041698257, "grad_norm": 1.2676407098770142, "learning_rate": 1.310379746835443e-05, "loss": 0.07914060354232788, "num_input_tokens_seen": 1296604, "step": 687, "train_runtime": 2065.0577, "train_tokens_per_second": 627.878 }, { "epoch": 0.6954763709881223, "grad_norm": 1.3755985498428345, "learning_rate": 1.3093670886075951e-05, "loss": 0.08941030502319336, "num_input_tokens_seen": 1298266, "step": 688, "train_runtime": 2067.348, "train_tokens_per_second": 627.986 }, { "epoch": 0.696487237806419, "grad_norm": 1.135475993156433, "learning_rate": 1.3083544303797468e-05, "loss": 0.08094897866249084, "num_input_tokens_seen": 1300102, "step": 689, "train_runtime": 2069.7822, "train_tokens_per_second": 628.135 }, { "epoch": 0.6974981046247157, "grad_norm": 1.3128398656845093, "learning_rate": 1.3073417721518988e-05, "loss": 0.10910716652870178, "num_input_tokens_seen": 1301776, "step": 690, "train_runtime": 2071.9913, "train_tokens_per_second": 628.273 }, { "epoch": 0.6985089714430124, "grad_norm": 1.333283543586731, "learning_rate": 1.3063291139240508e-05, "loss": 0.07274118065834045, "num_input_tokens_seen": 1303442, "step": 691, "train_runtime": 2087.6634, "train_tokens_per_second": 624.354 }, { "epoch": 0.699519838261309, "grad_norm": 1.4998698234558105, "learning_rate": 1.3053164556962026e-05, "loss": 0.11137869209051132, "num_input_tokens_seen": 1305156, "step": 692, "train_runtime": 2089.8745, "train_tokens_per_second": 624.514 }, { "epoch": 0.7005307050796058, "grad_norm": 1.498834252357483, "learning_rate": 1.3043037974683545e-05, "loss": 0.13288113474845886, "num_input_tokens_seen": 1306902, "step": 693, "train_runtime": 2092.1851, "train_tokens_per_second": 624.659 }, { "epoch": 0.7015415718979024, "grad_norm": 1.2488044500350952, "learning_rate": 1.3032911392405066e-05, "loss": 0.0887034684419632, "num_input_tokens_seen": 1308664, "step": 694, "train_runtime": 2094.4446, "train_tokens_per_second": 624.826 }, { "epoch": 0.7025524387161991, "grad_norm": 1.2471626996994019, "learning_rate": 1.3022784810126583e-05, "loss": 0.09268858283758163, "num_input_tokens_seen": 1310814, "step": 695, "train_runtime": 2096.7758, "train_tokens_per_second": 625.157 }, { "epoch": 0.7035633055344959, "grad_norm": 1.370259404182434, "learning_rate": 1.3012658227848102e-05, "loss": 0.09940025955438614, "num_input_tokens_seen": 1312786, "step": 696, "train_runtime": 2099.1036, "train_tokens_per_second": 625.403 }, { "epoch": 0.7045741723527925, "grad_norm": 1.0626189708709717, "learning_rate": 1.3002531645569621e-05, "loss": 0.07294227927923203, "num_input_tokens_seen": 1315162, "step": 697, "train_runtime": 2101.5378, "train_tokens_per_second": 625.809 }, { "epoch": 0.7055850391710892, "grad_norm": 1.2751500606536865, "learning_rate": 1.299240506329114e-05, "loss": 0.10228762775659561, "num_input_tokens_seen": 1316704, "step": 698, "train_runtime": 2103.8802, "train_tokens_per_second": 625.846 }, { "epoch": 0.7065959059893859, "grad_norm": 1.4122878313064575, "learning_rate": 1.298227848101266e-05, "loss": 0.09768881648778915, "num_input_tokens_seen": 1318362, "step": 699, "train_runtime": 2106.117, "train_tokens_per_second": 625.968 }, { "epoch": 0.7076067728076826, "grad_norm": 1.5043821334838867, "learning_rate": 1.2972151898734178e-05, "loss": 0.11154785752296448, "num_input_tokens_seen": 1319922, "step": 700, "train_runtime": 2108.342, "train_tokens_per_second": 626.047 }, { "epoch": 0.7086176396259792, "grad_norm": 1.0825846195220947, "learning_rate": 1.2962025316455697e-05, "loss": 0.08886873722076416, "num_input_tokens_seen": 1322010, "step": 701, "train_runtime": 2110.684, "train_tokens_per_second": 626.342 }, { "epoch": 0.709628506444276, "grad_norm": 1.2912213802337646, "learning_rate": 1.2951898734177217e-05, "loss": 0.10815602540969849, "num_input_tokens_seen": 1324172, "step": 702, "train_runtime": 2113.0478, "train_tokens_per_second": 626.664 }, { "epoch": 0.7106393732625726, "grad_norm": 1.1536753177642822, "learning_rate": 1.2941772151898736e-05, "loss": 0.07558616250753403, "num_input_tokens_seen": 1325838, "step": 703, "train_runtime": 2115.2376, "train_tokens_per_second": 626.803 }, { "epoch": 0.7116502400808693, "grad_norm": 1.50513756275177, "learning_rate": 1.2931645569620255e-05, "loss": 0.10250692069530487, "num_input_tokens_seen": 1327436, "step": 704, "train_runtime": 2117.4109, "train_tokens_per_second": 626.915 }, { "epoch": 0.7126611068991661, "grad_norm": 1.2506285905838013, "learning_rate": 1.2921518987341772e-05, "loss": 0.08238071203231812, "num_input_tokens_seen": 1329294, "step": 705, "train_runtime": 2119.6936, "train_tokens_per_second": 627.116 }, { "epoch": 0.7136719737174627, "grad_norm": 1.3678765296936035, "learning_rate": 1.2911392405063293e-05, "loss": 0.08024592697620392, "num_input_tokens_seen": 1331232, "step": 706, "train_runtime": 2121.9591, "train_tokens_per_second": 627.36 }, { "epoch": 0.7146828405357594, "grad_norm": 1.443300724029541, "learning_rate": 1.2901265822784812e-05, "loss": 0.12251617014408112, "num_input_tokens_seen": 1333056, "step": 707, "train_runtime": 2124.2655, "train_tokens_per_second": 627.537 }, { "epoch": 0.7156937073540561, "grad_norm": 1.2339009046554565, "learning_rate": 1.289113924050633e-05, "loss": 0.10755623877048492, "num_input_tokens_seen": 1334582, "step": 708, "train_runtime": 2126.5397, "train_tokens_per_second": 627.584 }, { "epoch": 0.7167045741723528, "grad_norm": 1.3110127449035645, "learning_rate": 1.288101265822785e-05, "loss": 0.08711139112710953, "num_input_tokens_seen": 1336404, "step": 709, "train_runtime": 2128.8117, "train_tokens_per_second": 627.77 }, { "epoch": 0.7177154409906494, "grad_norm": 1.476033091545105, "learning_rate": 1.287088607594937e-05, "loss": 0.12103165686130524, "num_input_tokens_seen": 1338188, "step": 710, "train_runtime": 2131.0517, "train_tokens_per_second": 627.947 }, { "epoch": 0.7187263078089462, "grad_norm": 1.1368860006332397, "learning_rate": 1.2860759493670887e-05, "loss": 0.09072631597518921, "num_input_tokens_seen": 1340470, "step": 711, "train_runtime": 2133.428, "train_tokens_per_second": 628.317 }, { "epoch": 0.7197371746272428, "grad_norm": 1.4660931825637817, "learning_rate": 1.2850632911392407e-05, "loss": 0.10700499266386032, "num_input_tokens_seen": 1342374, "step": 712, "train_runtime": 2135.6679, "train_tokens_per_second": 628.55 }, { "epoch": 0.7207480414455395, "grad_norm": 1.401763916015625, "learning_rate": 1.2840506329113925e-05, "loss": 0.08156513422727585, "num_input_tokens_seen": 1344294, "step": 713, "train_runtime": 2137.9525, "train_tokens_per_second": 628.776 }, { "epoch": 0.7217589082638363, "grad_norm": 1.135650873184204, "learning_rate": 1.2830379746835444e-05, "loss": 0.08099284768104553, "num_input_tokens_seen": 1346268, "step": 714, "train_runtime": 2140.2283, "train_tokens_per_second": 629.03 }, { "epoch": 0.7227697750821329, "grad_norm": 1.2015876770019531, "learning_rate": 1.2820253164556965e-05, "loss": 0.08257974684238434, "num_input_tokens_seen": 1347826, "step": 715, "train_runtime": 2142.438, "train_tokens_per_second": 629.109 }, { "epoch": 0.7237806419004296, "grad_norm": 1.2310470342636108, "learning_rate": 1.2810126582278482e-05, "loss": 0.08701344579458237, "num_input_tokens_seen": 1349612, "step": 716, "train_runtime": 2144.6719, "train_tokens_per_second": 629.286 }, { "epoch": 0.7247915087187263, "grad_norm": 1.2671425342559814, "learning_rate": 1.2800000000000001e-05, "loss": 0.10148347914218903, "num_input_tokens_seen": 1351630, "step": 717, "train_runtime": 2146.9435, "train_tokens_per_second": 629.56 }, { "epoch": 0.725802375537023, "grad_norm": 1.3022403717041016, "learning_rate": 1.2789873417721522e-05, "loss": 0.08409610390663147, "num_input_tokens_seen": 1353802, "step": 718, "train_runtime": 2149.2954, "train_tokens_per_second": 629.882 }, { "epoch": 0.7268132423553196, "grad_norm": 1.1092630624771118, "learning_rate": 1.277974683544304e-05, "loss": 0.07556605339050293, "num_input_tokens_seen": 1355654, "step": 719, "train_runtime": 2151.5615, "train_tokens_per_second": 630.079 }, { "epoch": 0.7278241091736164, "grad_norm": 1.5835394859313965, "learning_rate": 1.2769620253164558e-05, "loss": 0.1381828486919403, "num_input_tokens_seen": 1357500, "step": 720, "train_runtime": 2153.8352, "train_tokens_per_second": 630.271 }, { "epoch": 0.728834975991913, "grad_norm": 1.4468761682510376, "learning_rate": 1.2759493670886076e-05, "loss": 0.09593550115823746, "num_input_tokens_seen": 1359508, "step": 721, "train_runtime": 2169.5334, "train_tokens_per_second": 626.636 }, { "epoch": 0.7298458428102097, "grad_norm": 1.1962016820907593, "learning_rate": 1.2749367088607597e-05, "loss": 0.0873030573129654, "num_input_tokens_seen": 1361332, "step": 722, "train_runtime": 2171.7711, "train_tokens_per_second": 626.83 }, { "epoch": 0.7308567096285065, "grad_norm": 1.1502801179885864, "learning_rate": 1.2739240506329116e-05, "loss": 0.0930904671549797, "num_input_tokens_seen": 1363258, "step": 723, "train_runtime": 2174.085, "train_tokens_per_second": 627.049 }, { "epoch": 0.7318675764468031, "grad_norm": 0.8665573596954346, "learning_rate": 1.2729113924050633e-05, "loss": 0.06266863644123077, "num_input_tokens_seen": 1365702, "step": 724, "train_runtime": 2176.4881, "train_tokens_per_second": 627.48 }, { "epoch": 0.7328784432650999, "grad_norm": 1.243510127067566, "learning_rate": 1.2718987341772154e-05, "loss": 0.07042838633060455, "num_input_tokens_seen": 1367666, "step": 725, "train_runtime": 2178.7487, "train_tokens_per_second": 627.73 }, { "epoch": 0.7338893100833965, "grad_norm": 1.488826036453247, "learning_rate": 1.2708860759493671e-05, "loss": 0.0845520943403244, "num_input_tokens_seen": 1369268, "step": 726, "train_runtime": 2180.9313, "train_tokens_per_second": 627.836 }, { "epoch": 0.7349001769016932, "grad_norm": 1.3990442752838135, "learning_rate": 1.269873417721519e-05, "loss": 0.08900083601474762, "num_input_tokens_seen": 1370694, "step": 727, "train_runtime": 2183.1088, "train_tokens_per_second": 627.863 }, { "epoch": 0.7359110437199899, "grad_norm": 1.2960129976272583, "learning_rate": 1.2688607594936711e-05, "loss": 0.10376360267400742, "num_input_tokens_seen": 1372434, "step": 728, "train_runtime": 2185.3092, "train_tokens_per_second": 628.027 }, { "epoch": 0.7369219105382866, "grad_norm": 1.9930686950683594, "learning_rate": 1.2678481012658228e-05, "loss": 0.07666580379009247, "num_input_tokens_seen": 1374256, "step": 729, "train_runtime": 2187.5515, "train_tokens_per_second": 628.217 }, { "epoch": 0.7379327773565832, "grad_norm": 1.2373098134994507, "learning_rate": 1.2668354430379748e-05, "loss": 0.09075476974248886, "num_input_tokens_seen": 1376118, "step": 730, "train_runtime": 2189.8706, "train_tokens_per_second": 628.402 }, { "epoch": 0.73894364417488, "grad_norm": 1.373629093170166, "learning_rate": 1.2658227848101268e-05, "loss": 0.08953611552715302, "num_input_tokens_seen": 1377884, "step": 731, "train_runtime": 2192.128, "train_tokens_per_second": 628.56 }, { "epoch": 0.7399545109931767, "grad_norm": 1.2163437604904175, "learning_rate": 1.2648101265822786e-05, "loss": 0.09008659422397614, "num_input_tokens_seen": 1379496, "step": 732, "train_runtime": 2194.3577, "train_tokens_per_second": 628.656 }, { "epoch": 0.7409653778114733, "grad_norm": 1.2478456497192383, "learning_rate": 1.2637974683544305e-05, "loss": 0.07520309090614319, "num_input_tokens_seen": 1381244, "step": 733, "train_runtime": 2196.6255, "train_tokens_per_second": 628.803 }, { "epoch": 0.7419762446297701, "grad_norm": 1.6541633605957031, "learning_rate": 1.2627848101265822e-05, "loss": 0.09266624599695206, "num_input_tokens_seen": 1383306, "step": 734, "train_runtime": 2198.9875, "train_tokens_per_second": 629.065 }, { "epoch": 0.7429871114480667, "grad_norm": 1.1022968292236328, "learning_rate": 1.2617721518987343e-05, "loss": 0.08509687334299088, "num_input_tokens_seen": 1385492, "step": 735, "train_runtime": 2201.3099, "train_tokens_per_second": 629.394 }, { "epoch": 0.7439979782663634, "grad_norm": 1.5268213748931885, "learning_rate": 1.2607594936708862e-05, "loss": 0.11774347722530365, "num_input_tokens_seen": 1387608, "step": 736, "train_runtime": 2203.6344, "train_tokens_per_second": 629.691 }, { "epoch": 0.7450088450846601, "grad_norm": 1.312606930732727, "learning_rate": 1.259746835443038e-05, "loss": 0.10731050372123718, "num_input_tokens_seen": 1389814, "step": 737, "train_runtime": 2206.0149, "train_tokens_per_second": 630.011 }, { "epoch": 0.7460197119029568, "grad_norm": 1.449189305305481, "learning_rate": 1.25873417721519e-05, "loss": 0.11829297244548798, "num_input_tokens_seen": 1391662, "step": 738, "train_runtime": 2208.2625, "train_tokens_per_second": 630.207 }, { "epoch": 0.7470305787212534, "grad_norm": 1.2229044437408447, "learning_rate": 1.257721518987342e-05, "loss": 0.09924839437007904, "num_input_tokens_seen": 1393230, "step": 739, "train_runtime": 2210.5093, "train_tokens_per_second": 630.276 }, { "epoch": 0.7480414455395502, "grad_norm": 0.9675111174583435, "learning_rate": 1.2567088607594937e-05, "loss": 0.06866496056318283, "num_input_tokens_seen": 1395328, "step": 740, "train_runtime": 2212.9001, "train_tokens_per_second": 630.543 }, { "epoch": 0.7490523123578469, "grad_norm": 1.437273621559143, "learning_rate": 1.2556962025316457e-05, "loss": 0.12035974115133286, "num_input_tokens_seen": 1397110, "step": 741, "train_runtime": 2215.1286, "train_tokens_per_second": 630.713 }, { "epoch": 0.7500631791761435, "grad_norm": 1.3278621435165405, "learning_rate": 1.2546835443037975e-05, "loss": 0.11160625517368317, "num_input_tokens_seen": 1399078, "step": 742, "train_runtime": 2217.4451, "train_tokens_per_second": 630.941 }, { "epoch": 0.7510740459944403, "grad_norm": 1.2631326913833618, "learning_rate": 1.2536708860759494e-05, "loss": 0.072649747133255, "num_input_tokens_seen": 1400736, "step": 743, "train_runtime": 2219.6523, "train_tokens_per_second": 631.061 }, { "epoch": 0.7520849128127369, "grad_norm": 1.2321404218673706, "learning_rate": 1.2526582278481015e-05, "loss": 0.09959045052528381, "num_input_tokens_seen": 1403160, "step": 744, "train_runtime": 2222.062, "train_tokens_per_second": 631.468 }, { "epoch": 0.7530957796310336, "grad_norm": 1.221240758895874, "learning_rate": 1.2516455696202532e-05, "loss": 0.08668084442615509, "num_input_tokens_seen": 1405066, "step": 745, "train_runtime": 2224.2903, "train_tokens_per_second": 631.692 }, { "epoch": 0.7541066464493303, "grad_norm": 1.5003905296325684, "learning_rate": 1.2506329113924051e-05, "loss": 0.11735235154628754, "num_input_tokens_seen": 1406536, "step": 746, "train_runtime": 2226.4237, "train_tokens_per_second": 631.747 }, { "epoch": 0.755117513267627, "grad_norm": 1.13472318649292, "learning_rate": 1.2496202531645572e-05, "loss": 0.07171247154474258, "num_input_tokens_seen": 1408360, "step": 747, "train_runtime": 2228.6579, "train_tokens_per_second": 631.932 }, { "epoch": 0.7561283800859236, "grad_norm": 1.063692569732666, "learning_rate": 1.248607594936709e-05, "loss": 0.07593874633312225, "num_input_tokens_seen": 1410444, "step": 748, "train_runtime": 2230.9177, "train_tokens_per_second": 632.226 }, { "epoch": 0.7571392469042204, "grad_norm": 0.9933139681816101, "learning_rate": 1.2475949367088608e-05, "loss": 0.07491488009691238, "num_input_tokens_seen": 1412882, "step": 749, "train_runtime": 2233.319, "train_tokens_per_second": 632.638 }, { "epoch": 0.7581501137225171, "grad_norm": 1.3128093481063843, "learning_rate": 1.2465822784810126e-05, "loss": 0.0925944596529007, "num_input_tokens_seen": 1415136, "step": 750, "train_runtime": 2235.65, "train_tokens_per_second": 632.986 }, { "epoch": 0.7591609805408137, "grad_norm": 1.1090009212493896, "learning_rate": 1.2455696202531647e-05, "loss": 0.08612965792417526, "num_input_tokens_seen": 1416954, "step": 751, "train_runtime": 2251.2547, "train_tokens_per_second": 629.406 }, { "epoch": 0.7601718473591105, "grad_norm": 1.309633493423462, "learning_rate": 1.2445569620253166e-05, "loss": 0.08517396450042725, "num_input_tokens_seen": 1419028, "step": 752, "train_runtime": 2253.5806, "train_tokens_per_second": 629.677 }, { "epoch": 0.7611827141774071, "grad_norm": 1.451980710029602, "learning_rate": 1.2435443037974683e-05, "loss": 0.12312909960746765, "num_input_tokens_seen": 1421050, "step": 753, "train_runtime": 2255.8839, "train_tokens_per_second": 629.93 }, { "epoch": 0.7621935809957038, "grad_norm": 1.2391310930252075, "learning_rate": 1.2425316455696204e-05, "loss": 0.08031059056520462, "num_input_tokens_seen": 1422814, "step": 754, "train_runtime": 2258.1535, "train_tokens_per_second": 630.079 }, { "epoch": 0.7632044478140005, "grad_norm": 1.2742424011230469, "learning_rate": 1.2415189873417723e-05, "loss": 0.0937035083770752, "num_input_tokens_seen": 1424398, "step": 755, "train_runtime": 2260.3586, "train_tokens_per_second": 630.165 }, { "epoch": 0.7642153146322972, "grad_norm": 1.4075407981872559, "learning_rate": 1.240506329113924e-05, "loss": 0.09099723398685455, "num_input_tokens_seen": 1426688, "step": 756, "train_runtime": 2262.7488, "train_tokens_per_second": 630.511 }, { "epoch": 0.7652261814505938, "grad_norm": 1.7033988237380981, "learning_rate": 1.2394936708860761e-05, "loss": 0.1424482762813568, "num_input_tokens_seen": 1428828, "step": 757, "train_runtime": 2265.0958, "train_tokens_per_second": 630.802 }, { "epoch": 0.7662370482688906, "grad_norm": 1.0469303131103516, "learning_rate": 1.2384810126582278e-05, "loss": 0.07260406017303467, "num_input_tokens_seen": 1430676, "step": 758, "train_runtime": 2267.3597, "train_tokens_per_second": 630.988 }, { "epoch": 0.7672479150871873, "grad_norm": 1.3124287128448486, "learning_rate": 1.2374683544303798e-05, "loss": 0.11914030462503433, "num_input_tokens_seen": 1432730, "step": 759, "train_runtime": 2269.7143, "train_tokens_per_second": 631.238 }, { "epoch": 0.7682587819054839, "grad_norm": 1.3265185356140137, "learning_rate": 1.2364556962025318e-05, "loss": 0.09607601165771484, "num_input_tokens_seen": 1434948, "step": 760, "train_runtime": 2272.1137, "train_tokens_per_second": 631.548 }, { "epoch": 0.7692696487237807, "grad_norm": 1.3244144916534424, "learning_rate": 1.2354430379746836e-05, "loss": 0.09496047347784042, "num_input_tokens_seen": 1436938, "step": 761, "train_runtime": 2274.5501, "train_tokens_per_second": 631.746 }, { "epoch": 0.7702805155420773, "grad_norm": 1.0441399812698364, "learning_rate": 1.2344303797468355e-05, "loss": 0.07020121812820435, "num_input_tokens_seen": 1439072, "step": 762, "train_runtime": 2276.9142, "train_tokens_per_second": 632.027 }, { "epoch": 0.771291382360374, "grad_norm": 1.4196510314941406, "learning_rate": 1.2334177215189876e-05, "loss": 0.08475708961486816, "num_input_tokens_seen": 1440696, "step": 763, "train_runtime": 2279.1738, "train_tokens_per_second": 632.113 }, { "epoch": 0.7723022491786707, "grad_norm": 1.190209984779358, "learning_rate": 1.2324050632911393e-05, "loss": 0.09173276275396347, "num_input_tokens_seen": 1442820, "step": 764, "train_runtime": 2281.4728, "train_tokens_per_second": 632.407 }, { "epoch": 0.7733131159969674, "grad_norm": 1.1727373600006104, "learning_rate": 1.2313924050632912e-05, "loss": 0.089374840259552, "num_input_tokens_seen": 1445002, "step": 765, "train_runtime": 2283.7845, "train_tokens_per_second": 632.723 }, { "epoch": 0.774323982815264, "grad_norm": 1.1790472269058228, "learning_rate": 1.2303797468354431e-05, "loss": 0.08570949733257294, "num_input_tokens_seen": 1446852, "step": 766, "train_runtime": 2286.0611, "train_tokens_per_second": 632.902 }, { "epoch": 0.7753348496335608, "grad_norm": 1.1178817749023438, "learning_rate": 1.229367088607595e-05, "loss": 0.05503210052847862, "num_input_tokens_seen": 1448588, "step": 767, "train_runtime": 2288.2661, "train_tokens_per_second": 633.051 }, { "epoch": 0.7763457164518575, "grad_norm": 1.3860853910446167, "learning_rate": 1.228354430379747e-05, "loss": 0.0975511372089386, "num_input_tokens_seen": 1450580, "step": 768, "train_runtime": 2290.685, "train_tokens_per_second": 633.252 }, { "epoch": 0.7773565832701541, "grad_norm": 1.205965518951416, "learning_rate": 1.2273417721518988e-05, "loss": 0.08186589181423187, "num_input_tokens_seen": 1452580, "step": 769, "train_runtime": 2292.9926, "train_tokens_per_second": 633.487 }, { "epoch": 0.7783674500884509, "grad_norm": 1.3132317066192627, "learning_rate": 1.2263291139240508e-05, "loss": 0.11491493880748749, "num_input_tokens_seen": 1454246, "step": 770, "train_runtime": 2295.2388, "train_tokens_per_second": 633.592 }, { "epoch": 0.7793783169067475, "grad_norm": 1.4057326316833496, "learning_rate": 1.2253164556962027e-05, "loss": 0.09340424835681915, "num_input_tokens_seen": 1456172, "step": 771, "train_runtime": 2297.5182, "train_tokens_per_second": 633.802 }, { "epoch": 0.7803891837250442, "grad_norm": 1.348260760307312, "learning_rate": 1.2243037974683546e-05, "loss": 0.09945379197597504, "num_input_tokens_seen": 1458110, "step": 772, "train_runtime": 2299.8038, "train_tokens_per_second": 634.015 }, { "epoch": 0.7814000505433409, "grad_norm": 1.357066035270691, "learning_rate": 1.2232911392405065e-05, "loss": 0.10925261676311493, "num_input_tokens_seen": 1459878, "step": 773, "train_runtime": 2302.0426, "train_tokens_per_second": 634.166 }, { "epoch": 0.7824109173616376, "grad_norm": 1.5371371507644653, "learning_rate": 1.2222784810126582e-05, "loss": 0.09402672946453094, "num_input_tokens_seen": 1461484, "step": 774, "train_runtime": 2304.2211, "train_tokens_per_second": 634.264 }, { "epoch": 0.7834217841799342, "grad_norm": 1.3534631729125977, "learning_rate": 1.2212658227848101e-05, "loss": 0.09957920014858246, "num_input_tokens_seen": 1463336, "step": 775, "train_runtime": 2306.5036, "train_tokens_per_second": 634.439 }, { "epoch": 0.784432650998231, "grad_norm": 1.579530119895935, "learning_rate": 1.2202531645569622e-05, "loss": 0.07522060722112656, "num_input_tokens_seen": 1464984, "step": 776, "train_runtime": 2308.7105, "train_tokens_per_second": 634.546 }, { "epoch": 0.7854435178165277, "grad_norm": 1.7755144834518433, "learning_rate": 1.219240506329114e-05, "loss": 0.1491493433713913, "num_input_tokens_seen": 1466894, "step": 777, "train_runtime": 2310.9641, "train_tokens_per_second": 634.754 }, { "epoch": 0.7864543846348243, "grad_norm": 1.397637963294983, "learning_rate": 1.2182278481012658e-05, "loss": 0.09773722290992737, "num_input_tokens_seen": 1468682, "step": 778, "train_runtime": 2313.2023, "train_tokens_per_second": 634.913 }, { "epoch": 0.7874652514531211, "grad_norm": 1.133230447769165, "learning_rate": 1.217215189873418e-05, "loss": 0.08112357556819916, "num_input_tokens_seen": 1470236, "step": 779, "train_runtime": 2315.3877, "train_tokens_per_second": 634.985 }, { "epoch": 0.7884761182714177, "grad_norm": 1.238479733467102, "learning_rate": 1.2162025316455697e-05, "loss": 0.07440964132547379, "num_input_tokens_seen": 1472040, "step": 780, "train_runtime": 2317.6707, "train_tokens_per_second": 635.138 }, { "epoch": 0.7894869850897144, "grad_norm": 1.3582795858383179, "learning_rate": 1.2151898734177216e-05, "loss": 0.08965818583965302, "num_input_tokens_seen": 1474404, "step": 781, "train_runtime": 2333.4251, "train_tokens_per_second": 631.863 }, { "epoch": 0.7904978519080111, "grad_norm": 1.657088041305542, "learning_rate": 1.2141772151898735e-05, "loss": 0.11930066347122192, "num_input_tokens_seen": 1476702, "step": 782, "train_runtime": 2335.8046, "train_tokens_per_second": 632.203 }, { "epoch": 0.7915087187263078, "grad_norm": 1.2233569622039795, "learning_rate": 1.2131645569620254e-05, "loss": 0.09705591201782227, "num_input_tokens_seen": 1478698, "step": 783, "train_runtime": 2338.0877, "train_tokens_per_second": 632.439 }, { "epoch": 0.7925195855446044, "grad_norm": 1.1697092056274414, "learning_rate": 1.2121518987341773e-05, "loss": 0.092095747590065, "num_input_tokens_seen": 1480804, "step": 784, "train_runtime": 2340.3968, "train_tokens_per_second": 632.715 }, { "epoch": 0.7935304523629012, "grad_norm": 1.7770445346832275, "learning_rate": 1.2111392405063292e-05, "loss": 0.13721917569637299, "num_input_tokens_seen": 1482470, "step": 785, "train_runtime": 2342.615, "train_tokens_per_second": 632.827 }, { "epoch": 0.7945413191811979, "grad_norm": 1.1368803977966309, "learning_rate": 1.2101265822784811e-05, "loss": 0.08487553894519806, "num_input_tokens_seen": 1484010, "step": 786, "train_runtime": 2344.7976, "train_tokens_per_second": 632.895 }, { "epoch": 0.7955521859994946, "grad_norm": 1.4755949974060059, "learning_rate": 1.209113924050633e-05, "loss": 0.11078151315450668, "num_input_tokens_seen": 1485590, "step": 787, "train_runtime": 2346.9978, "train_tokens_per_second": 632.975 }, { "epoch": 0.7965630528177913, "grad_norm": 1.3972913026809692, "learning_rate": 1.208101265822785e-05, "loss": 0.10825448483228683, "num_input_tokens_seen": 1487662, "step": 788, "train_runtime": 2349.3566, "train_tokens_per_second": 633.221 }, { "epoch": 0.7975739196360879, "grad_norm": 1.3730190992355347, "learning_rate": 1.2070886075949368e-05, "loss": 0.13756567239761353, "num_input_tokens_seen": 1490132, "step": 789, "train_runtime": 2351.765, "train_tokens_per_second": 633.623 }, { "epoch": 0.7985847864543847, "grad_norm": 1.1280244588851929, "learning_rate": 1.2060759493670886e-05, "loss": 0.08637134730815887, "num_input_tokens_seen": 1491952, "step": 790, "train_runtime": 2354.2732, "train_tokens_per_second": 633.721 }, { "epoch": 0.7995956532726813, "grad_norm": 1.4997068643569946, "learning_rate": 1.2050632911392407e-05, "loss": 0.08552324771881104, "num_input_tokens_seen": 1493938, "step": 791, "train_runtime": 2356.7144, "train_tokens_per_second": 633.907 }, { "epoch": 0.800606520090978, "grad_norm": 2.009636640548706, "learning_rate": 1.2040506329113926e-05, "loss": 0.10743894428014755, "num_input_tokens_seen": 1495656, "step": 792, "train_runtime": 2359.0196, "train_tokens_per_second": 634.016 }, { "epoch": 0.800606520090978, "eval_loss": 0.35930678248405457, "eval_runtime": 54.3304, "eval_samples_per_second": 16.179, "eval_steps_per_second": 8.099, "num_input_tokens_seen": 1495656, "step": 792 }, { "epoch": 0.8016173869092748, "grad_norm": 1.7928344011306763, "learning_rate": 1.2030379746835443e-05, "loss": 0.11549399048089981, "num_input_tokens_seen": 1497184, "step": 793, "train_runtime": 2415.5783, "train_tokens_per_second": 619.804 }, { "epoch": 0.8026282537275714, "grad_norm": 1.2222858667373657, "learning_rate": 1.2020253164556964e-05, "loss": 0.05913369357585907, "num_input_tokens_seen": 1498650, "step": 794, "train_runtime": 2417.7861, "train_tokens_per_second": 619.844 }, { "epoch": 0.8036391205458681, "grad_norm": 1.4649543762207031, "learning_rate": 1.2010126582278483e-05, "loss": 0.09922467172145844, "num_input_tokens_seen": 1500418, "step": 795, "train_runtime": 2420.03, "train_tokens_per_second": 620.0 }, { "epoch": 0.8046499873641648, "grad_norm": 1.232645869255066, "learning_rate": 1.2e-05, "loss": 0.08798468858003616, "num_input_tokens_seen": 1502404, "step": 796, "train_runtime": 2422.3368, "train_tokens_per_second": 620.229 }, { "epoch": 0.8056608541824615, "grad_norm": 1.0265458822250366, "learning_rate": 1.1989873417721521e-05, "loss": 0.077436164021492, "num_input_tokens_seen": 1504506, "step": 797, "train_runtime": 2424.6461, "train_tokens_per_second": 620.505 }, { "epoch": 0.8066717210007581, "grad_norm": 1.3002969026565552, "learning_rate": 1.1979746835443038e-05, "loss": 0.08807089924812317, "num_input_tokens_seen": 1506334, "step": 798, "train_runtime": 2426.9357, "train_tokens_per_second": 620.673 }, { "epoch": 0.8076825878190549, "grad_norm": 1.5173736810684204, "learning_rate": 1.1969620253164558e-05, "loss": 0.11598929017782211, "num_input_tokens_seen": 1508208, "step": 799, "train_runtime": 2429.2135, "train_tokens_per_second": 620.863 }, { "epoch": 0.8086934546373515, "grad_norm": 1.0948872566223145, "learning_rate": 1.1959493670886078e-05, "loss": 0.07768983393907547, "num_input_tokens_seen": 1509974, "step": 800, "train_runtime": 2431.474, "train_tokens_per_second": 621.012 }, { "epoch": 0.8097043214556482, "grad_norm": 1.5887296199798584, "learning_rate": 1.1949367088607596e-05, "loss": 0.13126257061958313, "num_input_tokens_seen": 1511792, "step": 801, "train_runtime": 2433.8018, "train_tokens_per_second": 621.165 }, { "epoch": 0.810715188273945, "grad_norm": 1.3212714195251465, "learning_rate": 1.1939240506329115e-05, "loss": 0.10201811790466309, "num_input_tokens_seen": 1513666, "step": 802, "train_runtime": 2436.0742, "train_tokens_per_second": 621.355 }, { "epoch": 0.8117260550922416, "grad_norm": 1.2121456861495972, "learning_rate": 1.1929113924050636e-05, "loss": 0.09122280031442642, "num_input_tokens_seen": 1516078, "step": 803, "train_runtime": 2438.4704, "train_tokens_per_second": 621.733 }, { "epoch": 0.8127369219105383, "grad_norm": 1.2374351024627686, "learning_rate": 1.1918987341772153e-05, "loss": 0.07882948219776154, "num_input_tokens_seen": 1517678, "step": 804, "train_runtime": 2440.6457, "train_tokens_per_second": 621.835 }, { "epoch": 0.813747788728835, "grad_norm": 1.380174994468689, "learning_rate": 1.1908860759493672e-05, "loss": 0.09974582493305206, "num_input_tokens_seen": 1519652, "step": 805, "train_runtime": 2442.9211, "train_tokens_per_second": 622.063 }, { "epoch": 0.8147586555471317, "grad_norm": 1.328392744064331, "learning_rate": 1.189873417721519e-05, "loss": 0.09549365192651749, "num_input_tokens_seen": 1521208, "step": 806, "train_runtime": 2445.1007, "train_tokens_per_second": 622.145 }, { "epoch": 0.8157695223654283, "grad_norm": 1.6172430515289307, "learning_rate": 1.188860759493671e-05, "loss": 0.06688052415847778, "num_input_tokens_seen": 1523202, "step": 807, "train_runtime": 2447.3708, "train_tokens_per_second": 622.383 }, { "epoch": 0.8167803891837251, "grad_norm": 1.511674404144287, "learning_rate": 1.187848101265823e-05, "loss": 0.11953920125961304, "num_input_tokens_seen": 1524950, "step": 808, "train_runtime": 2449.6067, "train_tokens_per_second": 622.528 }, { "epoch": 0.8177912560020217, "grad_norm": 1.4442185163497925, "learning_rate": 1.1868354430379747e-05, "loss": 0.08532628417015076, "num_input_tokens_seen": 1526390, "step": 809, "train_runtime": 2451.7873, "train_tokens_per_second": 622.562 }, { "epoch": 0.8188021228203184, "grad_norm": 1.389597773551941, "learning_rate": 1.1858227848101267e-05, "loss": 0.09901273995637894, "num_input_tokens_seen": 1528232, "step": 810, "train_runtime": 2454.0735, "train_tokens_per_second": 622.733 }, { "epoch": 0.8198129896386152, "grad_norm": 1.3464856147766113, "learning_rate": 1.1848101265822787e-05, "loss": 0.10714782029390335, "num_input_tokens_seen": 1530056, "step": 811, "train_runtime": 2469.7011, "train_tokens_per_second": 619.531 }, { "epoch": 0.8208238564569118, "grad_norm": 1.619875431060791, "learning_rate": 1.1837974683544304e-05, "loss": 0.12249326705932617, "num_input_tokens_seen": 1532250, "step": 812, "train_runtime": 2472.0727, "train_tokens_per_second": 619.824 }, { "epoch": 0.8218347232752085, "grad_norm": 1.0970927476882935, "learning_rate": 1.1827848101265825e-05, "loss": 0.07444127649068832, "num_input_tokens_seen": 1534102, "step": 813, "train_runtime": 2474.3566, "train_tokens_per_second": 620.0 }, { "epoch": 0.8228455900935052, "grad_norm": 1.2683417797088623, "learning_rate": 1.1817721518987342e-05, "loss": 0.0832136869430542, "num_input_tokens_seen": 1535648, "step": 814, "train_runtime": 2476.5509, "train_tokens_per_second": 620.075 }, { "epoch": 0.8238564569118019, "grad_norm": 1.217896819114685, "learning_rate": 1.1807594936708861e-05, "loss": 0.086221843957901, "num_input_tokens_seen": 1537408, "step": 815, "train_runtime": 2478.8425, "train_tokens_per_second": 620.212 }, { "epoch": 0.8248673237300985, "grad_norm": 1.1209136247634888, "learning_rate": 1.1797468354430382e-05, "loss": 0.05607465282082558, "num_input_tokens_seen": 1539398, "step": 816, "train_runtime": 2481.1293, "train_tokens_per_second": 620.442 }, { "epoch": 0.8258781905483953, "grad_norm": 1.3270211219787598, "learning_rate": 1.17873417721519e-05, "loss": 0.09606637060642242, "num_input_tokens_seen": 1541054, "step": 817, "train_runtime": 2483.3588, "train_tokens_per_second": 620.552 }, { "epoch": 0.8268890573666919, "grad_norm": 1.0250391960144043, "learning_rate": 1.1777215189873418e-05, "loss": 0.08006328344345093, "num_input_tokens_seen": 1543138, "step": 818, "train_runtime": 2485.6833, "train_tokens_per_second": 620.81 }, { "epoch": 0.8278999241849886, "grad_norm": 1.1161867380142212, "learning_rate": 1.176708860759494e-05, "loss": 0.0717461109161377, "num_input_tokens_seen": 1544674, "step": 819, "train_runtime": 2487.9235, "train_tokens_per_second": 620.869 }, { "epoch": 0.8289107910032854, "grad_norm": 1.4846850633621216, "learning_rate": 1.1756962025316457e-05, "loss": 0.13073456287384033, "num_input_tokens_seen": 1546470, "step": 820, "train_runtime": 2490.1578, "train_tokens_per_second": 621.033 }, { "epoch": 0.829921657821582, "grad_norm": 1.3668291568756104, "learning_rate": 1.1746835443037976e-05, "loss": 0.10845942050218582, "num_input_tokens_seen": 1548530, "step": 821, "train_runtime": 2492.6282, "train_tokens_per_second": 621.244 }, { "epoch": 0.8309325246398787, "grad_norm": 1.655059814453125, "learning_rate": 1.1736708860759493e-05, "loss": 0.09784270823001862, "num_input_tokens_seen": 1549984, "step": 822, "train_runtime": 2495.0317, "train_tokens_per_second": 621.228 }, { "epoch": 0.8319433914581754, "grad_norm": 1.283531665802002, "learning_rate": 1.1726582278481014e-05, "loss": 0.0716037005186081, "num_input_tokens_seen": 1552118, "step": 823, "train_runtime": 2497.4111, "train_tokens_per_second": 621.491 }, { "epoch": 0.8329542582764721, "grad_norm": 1.3344287872314453, "learning_rate": 1.1716455696202533e-05, "loss": 0.10793325304985046, "num_input_tokens_seen": 1554850, "step": 824, "train_runtime": 2499.9058, "train_tokens_per_second": 621.963 }, { "epoch": 0.8339651250947687, "grad_norm": 1.2568620443344116, "learning_rate": 1.170632911392405e-05, "loss": 0.09416936337947845, "num_input_tokens_seen": 1556788, "step": 825, "train_runtime": 2502.1786, "train_tokens_per_second": 622.173 }, { "epoch": 0.8349759919130655, "grad_norm": 1.3056141138076782, "learning_rate": 1.1696202531645571e-05, "loss": 0.11997391283512115, "num_input_tokens_seen": 1558446, "step": 826, "train_runtime": 2504.4166, "train_tokens_per_second": 622.279 }, { "epoch": 0.8359868587313621, "grad_norm": 1.4461060762405396, "learning_rate": 1.168607594936709e-05, "loss": 0.11721283197402954, "num_input_tokens_seen": 1560354, "step": 827, "train_runtime": 2506.6819, "train_tokens_per_second": 622.478 }, { "epoch": 0.8369977255496588, "grad_norm": 1.654499888420105, "learning_rate": 1.1675949367088608e-05, "loss": 0.14523056149482727, "num_input_tokens_seen": 1562322, "step": 828, "train_runtime": 2508.9837, "train_tokens_per_second": 622.691 }, { "epoch": 0.8380085923679556, "grad_norm": 1.6324923038482666, "learning_rate": 1.1665822784810128e-05, "loss": 0.09989740699529648, "num_input_tokens_seen": 1564184, "step": 829, "train_runtime": 2511.2273, "train_tokens_per_second": 622.876 }, { "epoch": 0.8390194591862522, "grad_norm": 1.7122888565063477, "learning_rate": 1.1655696202531646e-05, "loss": 0.11083639413118362, "num_input_tokens_seen": 1565994, "step": 830, "train_runtime": 2513.5596, "train_tokens_per_second": 623.018 }, { "epoch": 0.8400303260045489, "grad_norm": 1.2459877729415894, "learning_rate": 1.1645569620253165e-05, "loss": 0.09095220267772675, "num_input_tokens_seen": 1567916, "step": 831, "train_runtime": 2515.8203, "train_tokens_per_second": 623.223 }, { "epoch": 0.8410411928228456, "grad_norm": 1.263240933418274, "learning_rate": 1.1635443037974686e-05, "loss": 0.10126728564500809, "num_input_tokens_seen": 1569890, "step": 832, "train_runtime": 2518.1751, "train_tokens_per_second": 623.424 }, { "epoch": 0.8420520596411423, "grad_norm": 1.4330466985702515, "learning_rate": 1.1625316455696203e-05, "loss": 0.11584387719631195, "num_input_tokens_seen": 1572012, "step": 833, "train_runtime": 2520.4854, "train_tokens_per_second": 623.694 }, { "epoch": 0.8430629264594389, "grad_norm": 1.1377328634262085, "learning_rate": 1.1615189873417722e-05, "loss": 0.06077614426612854, "num_input_tokens_seen": 1573832, "step": 834, "train_runtime": 2522.7251, "train_tokens_per_second": 623.862 }, { "epoch": 0.8440737932777357, "grad_norm": 1.0365792512893677, "learning_rate": 1.1605063291139243e-05, "loss": 0.0817495584487915, "num_input_tokens_seen": 1575922, "step": 835, "train_runtime": 2525.047, "train_tokens_per_second": 624.116 }, { "epoch": 0.8450846600960323, "grad_norm": 1.4109801054000854, "learning_rate": 1.159493670886076e-05, "loss": 0.11633533239364624, "num_input_tokens_seen": 1577630, "step": 836, "train_runtime": 2527.2722, "train_tokens_per_second": 624.242 }, { "epoch": 0.846095526914329, "grad_norm": 1.3445757627487183, "learning_rate": 1.158481012658228e-05, "loss": 0.08244745433330536, "num_input_tokens_seen": 1579326, "step": 837, "train_runtime": 2529.4949, "train_tokens_per_second": 624.364 }, { "epoch": 0.8471063937326258, "grad_norm": 1.3189071416854858, "learning_rate": 1.1574683544303797e-05, "loss": 0.09386275708675385, "num_input_tokens_seen": 1581406, "step": 838, "train_runtime": 2531.792, "train_tokens_per_second": 624.619 }, { "epoch": 0.8481172605509224, "grad_norm": 1.2236045598983765, "learning_rate": 1.1564556962025318e-05, "loss": 0.09385530650615692, "num_input_tokens_seen": 1583126, "step": 839, "train_runtime": 2534.0216, "train_tokens_per_second": 624.748 }, { "epoch": 0.849128127369219, "grad_norm": 1.2396245002746582, "learning_rate": 1.1554430379746837e-05, "loss": 0.105586938560009, "num_input_tokens_seen": 1585318, "step": 840, "train_runtime": 2536.3768, "train_tokens_per_second": 625.033 }, { "epoch": 0.8501389941875158, "grad_norm": 1.0138757228851318, "learning_rate": 1.1544303797468354e-05, "loss": 0.060473039746284485, "num_input_tokens_seen": 1586846, "step": 841, "train_runtime": 2551.8492, "train_tokens_per_second": 621.842 }, { "epoch": 0.8511498610058125, "grad_norm": 1.7759934663772583, "learning_rate": 1.1534177215189875e-05, "loss": 0.08443131297826767, "num_input_tokens_seen": 1588624, "step": 842, "train_runtime": 2554.0486, "train_tokens_per_second": 622.002 }, { "epoch": 0.8521607278241091, "grad_norm": 1.3102169036865234, "learning_rate": 1.1524050632911394e-05, "loss": 0.09713117778301239, "num_input_tokens_seen": 1590574, "step": 843, "train_runtime": 2556.3518, "train_tokens_per_second": 622.205 }, { "epoch": 0.8531715946424059, "grad_norm": 1.360823154449463, "learning_rate": 1.1513924050632911e-05, "loss": 0.09284176677465439, "num_input_tokens_seen": 1592676, "step": 844, "train_runtime": 2558.6917, "train_tokens_per_second": 622.457 }, { "epoch": 0.8541824614607025, "grad_norm": 1.1800224781036377, "learning_rate": 1.1503797468354432e-05, "loss": 0.09340135753154755, "num_input_tokens_seen": 1594634, "step": 845, "train_runtime": 2560.9627, "train_tokens_per_second": 622.67 }, { "epoch": 0.8551933282789992, "grad_norm": 1.7343326807022095, "learning_rate": 1.149367088607595e-05, "loss": 0.0815059244632721, "num_input_tokens_seen": 1596328, "step": 846, "train_runtime": 2563.2004, "train_tokens_per_second": 622.787 }, { "epoch": 0.856204195097296, "grad_norm": 1.2050825357437134, "learning_rate": 1.1483544303797469e-05, "loss": 0.11697637289762497, "num_input_tokens_seen": 1598918, "step": 847, "train_runtime": 2565.6376, "train_tokens_per_second": 623.205 }, { "epoch": 0.8572150619155926, "grad_norm": 1.4726566076278687, "learning_rate": 1.147341772151899e-05, "loss": 0.13028667867183685, "num_input_tokens_seen": 1600810, "step": 848, "train_runtime": 2567.9316, "train_tokens_per_second": 623.385 }, { "epoch": 0.8582259287338894, "grad_norm": 1.2934855222702026, "learning_rate": 1.1463291139240507e-05, "loss": 0.10013256967067719, "num_input_tokens_seen": 1602868, "step": 849, "train_runtime": 2570.2184, "train_tokens_per_second": 623.631 }, { "epoch": 0.859236795552186, "grad_norm": 1.3081752061843872, "learning_rate": 1.1453164556962026e-05, "loss": 0.08440461754798889, "num_input_tokens_seen": 1604334, "step": 850, "train_runtime": 2572.4376, "train_tokens_per_second": 623.663 }, { "epoch": 0.8602476623704827, "grad_norm": 1.536041498184204, "learning_rate": 1.1443037974683547e-05, "loss": 0.12332676351070404, "num_input_tokens_seen": 1606456, "step": 851, "train_runtime": 2574.9985, "train_tokens_per_second": 623.867 }, { "epoch": 0.8612585291887794, "grad_norm": 1.4961923360824585, "learning_rate": 1.1432911392405064e-05, "loss": 0.08930612355470657, "num_input_tokens_seen": 1608280, "step": 852, "train_runtime": 2577.2845, "train_tokens_per_second": 624.021 }, { "epoch": 0.8622693960070761, "grad_norm": 1.233816146850586, "learning_rate": 1.1422784810126583e-05, "loss": 0.07946805655956268, "num_input_tokens_seen": 1609990, "step": 853, "train_runtime": 2579.534, "train_tokens_per_second": 624.14 }, { "epoch": 0.8632802628253727, "grad_norm": 1.2792223691940308, "learning_rate": 1.1412658227848102e-05, "loss": 0.1130804792046547, "num_input_tokens_seen": 1611726, "step": 854, "train_runtime": 2581.7812, "train_tokens_per_second": 624.269 }, { "epoch": 0.8642911296436695, "grad_norm": 1.2561981678009033, "learning_rate": 1.1402531645569621e-05, "loss": 0.10342805087566376, "num_input_tokens_seen": 1613962, "step": 855, "train_runtime": 2584.1287, "train_tokens_per_second": 624.567 }, { "epoch": 0.8653019964619661, "grad_norm": 1.2710999250411987, "learning_rate": 1.139240506329114e-05, "loss": 0.08188050240278244, "num_input_tokens_seen": 1615632, "step": 856, "train_runtime": 2586.3626, "train_tokens_per_second": 624.673 }, { "epoch": 0.8663128632802628, "grad_norm": 1.585524320602417, "learning_rate": 1.138227848101266e-05, "loss": 0.08345942199230194, "num_input_tokens_seen": 1617550, "step": 857, "train_runtime": 2588.6582, "train_tokens_per_second": 624.86 }, { "epoch": 0.8673237300985596, "grad_norm": 1.2750364542007446, "learning_rate": 1.1372151898734178e-05, "loss": 0.09358559548854828, "num_input_tokens_seen": 1619282, "step": 858, "train_runtime": 2590.908, "train_tokens_per_second": 624.986 }, { "epoch": 0.8683345969168562, "grad_norm": 1.430489420890808, "learning_rate": 1.1362025316455698e-05, "loss": 0.10552196949720383, "num_input_tokens_seen": 1620816, "step": 859, "train_runtime": 2593.121, "train_tokens_per_second": 625.044 }, { "epoch": 0.8693454637351529, "grad_norm": 1.147262454032898, "learning_rate": 1.1351898734177217e-05, "loss": 0.09242111444473267, "num_input_tokens_seen": 1622940, "step": 860, "train_runtime": 2595.4643, "train_tokens_per_second": 625.299 }, { "epoch": 0.8703563305534496, "grad_norm": 1.1435247659683228, "learning_rate": 1.1341772151898736e-05, "loss": 0.08492071181535721, "num_input_tokens_seen": 1624928, "step": 861, "train_runtime": 2597.7423, "train_tokens_per_second": 625.515 }, { "epoch": 0.8713671973717463, "grad_norm": 1.2436879873275757, "learning_rate": 1.1331645569620253e-05, "loss": 0.10726184397935867, "num_input_tokens_seen": 1626842, "step": 862, "train_runtime": 2599.9931, "train_tokens_per_second": 625.71 }, { "epoch": 0.8723780641900429, "grad_norm": 1.2487578392028809, "learning_rate": 1.1321518987341772e-05, "loss": 0.09124457091093063, "num_input_tokens_seen": 1628466, "step": 863, "train_runtime": 2602.204, "train_tokens_per_second": 625.803 }, { "epoch": 0.8733889310083397, "grad_norm": 1.1977343559265137, "learning_rate": 1.1311392405063293e-05, "loss": 0.08865179866552353, "num_input_tokens_seen": 1630404, "step": 864, "train_runtime": 2604.4756, "train_tokens_per_second": 626.001 }, { "epoch": 0.8743997978266363, "grad_norm": 1.2378313541412354, "learning_rate": 1.130126582278481e-05, "loss": 0.10676542669534683, "num_input_tokens_seen": 1632534, "step": 865, "train_runtime": 2606.8878, "train_tokens_per_second": 626.239 }, { "epoch": 0.875410664644933, "grad_norm": 1.7088805437088013, "learning_rate": 1.129113924050633e-05, "loss": 0.08600839227437973, "num_input_tokens_seen": 1634250, "step": 866, "train_runtime": 2609.105, "train_tokens_per_second": 626.364 }, { "epoch": 0.8764215314632298, "grad_norm": 1.0192761421203613, "learning_rate": 1.128101265822785e-05, "loss": 0.07756936550140381, "num_input_tokens_seen": 1636256, "step": 867, "train_runtime": 2611.4178, "train_tokens_per_second": 626.578 }, { "epoch": 0.8774323982815264, "grad_norm": 1.2040374279022217, "learning_rate": 1.1270886075949368e-05, "loss": 0.10210748016834259, "num_input_tokens_seen": 1638308, "step": 868, "train_runtime": 2613.7515, "train_tokens_per_second": 626.803 }, { "epoch": 0.8784432650998231, "grad_norm": 1.1048957109451294, "learning_rate": 1.1260759493670887e-05, "loss": 0.05952364578843117, "num_input_tokens_seen": 1639966, "step": 869, "train_runtime": 2615.999, "train_tokens_per_second": 626.899 }, { "epoch": 0.8794541319181198, "grad_norm": 1.111210823059082, "learning_rate": 1.1250632911392406e-05, "loss": 0.09272414445877075, "num_input_tokens_seen": 1642326, "step": 870, "train_runtime": 2618.4432, "train_tokens_per_second": 627.215 }, { "epoch": 0.8804649987364165, "grad_norm": 1.1282939910888672, "learning_rate": 1.1240506329113925e-05, "loss": 0.0725017562508583, "num_input_tokens_seen": 1643814, "step": 871, "train_runtime": 2633.9133, "train_tokens_per_second": 624.096 }, { "epoch": 0.8814758655547131, "grad_norm": 1.5181385278701782, "learning_rate": 1.1230379746835444e-05, "loss": 0.07863800972700119, "num_input_tokens_seen": 1645608, "step": 872, "train_runtime": 2636.2032, "train_tokens_per_second": 624.234 }, { "epoch": 0.8824867323730099, "grad_norm": 1.4236536026000977, "learning_rate": 1.1220253164556963e-05, "loss": 0.12383362650871277, "num_input_tokens_seen": 1647372, "step": 873, "train_runtime": 2638.4522, "train_tokens_per_second": 624.371 }, { "epoch": 0.8834975991913065, "grad_norm": 1.9042201042175293, "learning_rate": 1.1210126582278482e-05, "loss": 0.13041570782661438, "num_input_tokens_seen": 1649480, "step": 874, "train_runtime": 2640.7905, "train_tokens_per_second": 624.616 }, { "epoch": 0.8845084660096032, "grad_norm": 1.4499646425247192, "learning_rate": 1.1200000000000001e-05, "loss": 0.1207432895898819, "num_input_tokens_seen": 1651222, "step": 875, "train_runtime": 2643.0695, "train_tokens_per_second": 624.737 }, { "epoch": 0.8855193328279, "grad_norm": 1.054856777191162, "learning_rate": 1.118987341772152e-05, "loss": 0.07857292890548706, "num_input_tokens_seen": 1653380, "step": 876, "train_runtime": 2645.5031, "train_tokens_per_second": 624.978 }, { "epoch": 0.8865301996461966, "grad_norm": 1.4799036979675293, "learning_rate": 1.117974683544304e-05, "loss": 0.11102406680583954, "num_input_tokens_seen": 1654968, "step": 877, "train_runtime": 2647.6718, "train_tokens_per_second": 625.065 }, { "epoch": 0.8875410664644933, "grad_norm": 1.5008419752120972, "learning_rate": 1.1169620253164557e-05, "loss": 0.09687478840351105, "num_input_tokens_seen": 1656582, "step": 878, "train_runtime": 2649.8987, "train_tokens_per_second": 625.149 }, { "epoch": 0.88855193328279, "grad_norm": 1.3605046272277832, "learning_rate": 1.1159493670886078e-05, "loss": 0.09195833653211594, "num_input_tokens_seen": 1658438, "step": 879, "train_runtime": 2652.1339, "train_tokens_per_second": 625.322 }, { "epoch": 0.8895628001010867, "grad_norm": 1.4020121097564697, "learning_rate": 1.1149367088607597e-05, "loss": 0.11234365403652191, "num_input_tokens_seen": 1660068, "step": 880, "train_runtime": 2654.4921, "train_tokens_per_second": 625.381 }, { "epoch": 0.8905736669193833, "grad_norm": 1.208852767944336, "learning_rate": 1.1139240506329114e-05, "loss": 0.08281447738409042, "num_input_tokens_seen": 1661494, "step": 881, "train_runtime": 2656.8487, "train_tokens_per_second": 625.363 }, { "epoch": 0.8915845337376801, "grad_norm": 1.037976622581482, "learning_rate": 1.1129113924050635e-05, "loss": 0.05970768630504608, "num_input_tokens_seen": 1663150, "step": 882, "train_runtime": 2659.055, "train_tokens_per_second": 625.467 }, { "epoch": 0.8925954005559767, "grad_norm": 1.2863762378692627, "learning_rate": 1.1118987341772154e-05, "loss": 0.07820567488670349, "num_input_tokens_seen": 1664702, "step": 883, "train_runtime": 2661.2329, "train_tokens_per_second": 625.538 }, { "epoch": 0.8936062673742734, "grad_norm": 1.1576390266418457, "learning_rate": 1.1108860759493671e-05, "loss": 0.09026230871677399, "num_input_tokens_seen": 1667500, "step": 884, "train_runtime": 2663.722, "train_tokens_per_second": 626.004 }, { "epoch": 0.8946171341925702, "grad_norm": 1.0148956775665283, "learning_rate": 1.1098734177215192e-05, "loss": 0.07751452177762985, "num_input_tokens_seen": 1669594, "step": 885, "train_runtime": 2666.0191, "train_tokens_per_second": 626.25 }, { "epoch": 0.8956280010108668, "grad_norm": 1.491645336151123, "learning_rate": 1.108860759493671e-05, "loss": 0.09333303570747375, "num_input_tokens_seen": 1671040, "step": 886, "train_runtime": 2668.1599, "train_tokens_per_second": 626.289 }, { "epoch": 0.8966388678291635, "grad_norm": 1.2536612749099731, "learning_rate": 1.1078481012658229e-05, "loss": 0.09178593009710312, "num_input_tokens_seen": 1672500, "step": 887, "train_runtime": 2670.3255, "train_tokens_per_second": 626.328 }, { "epoch": 0.8976497346474602, "grad_norm": 1.4343655109405518, "learning_rate": 1.106835443037975e-05, "loss": 0.07966658473014832, "num_input_tokens_seen": 1674008, "step": 888, "train_runtime": 2672.4715, "train_tokens_per_second": 626.389 }, { "epoch": 0.8986606014657569, "grad_norm": 1.1468838453292847, "learning_rate": 1.1058227848101267e-05, "loss": 0.06319437175989151, "num_input_tokens_seen": 1676148, "step": 889, "train_runtime": 2674.8308, "train_tokens_per_second": 626.637 }, { "epoch": 0.8996714682840535, "grad_norm": 1.5938904285430908, "learning_rate": 1.1048101265822786e-05, "loss": 0.13954637944698334, "num_input_tokens_seen": 1677864, "step": 890, "train_runtime": 2677.0491, "train_tokens_per_second": 626.759 }, { "epoch": 0.9006823351023503, "grad_norm": 1.0170766115188599, "learning_rate": 1.1037974683544307e-05, "loss": 0.06047394126653671, "num_input_tokens_seen": 1679694, "step": 891, "train_runtime": 2679.3068, "train_tokens_per_second": 626.914 }, { "epoch": 0.901693201920647, "grad_norm": 1.4534028768539429, "learning_rate": 1.1027848101265824e-05, "loss": 0.11416472494602203, "num_input_tokens_seen": 1681590, "step": 892, "train_runtime": 2681.5788, "train_tokens_per_second": 627.09 }, { "epoch": 0.9027040687389436, "grad_norm": 0.9670836925506592, "learning_rate": 1.1017721518987343e-05, "loss": 0.05867832154035568, "num_input_tokens_seen": 1683350, "step": 893, "train_runtime": 2683.7967, "train_tokens_per_second": 627.227 }, { "epoch": 0.9037149355572404, "grad_norm": 1.0167635679244995, "learning_rate": 1.100759493670886e-05, "loss": 0.06254291534423828, "num_input_tokens_seen": 1685174, "step": 894, "train_runtime": 2686.0335, "train_tokens_per_second": 627.384 }, { "epoch": 0.904725802375537, "grad_norm": 1.2036210298538208, "learning_rate": 1.0997468354430381e-05, "loss": 0.09041282534599304, "num_input_tokens_seen": 1687326, "step": 895, "train_runtime": 2688.328, "train_tokens_per_second": 627.649 }, { "epoch": 0.9057366691938337, "grad_norm": 1.472809910774231, "learning_rate": 1.09873417721519e-05, "loss": 0.08746948838233948, "num_input_tokens_seen": 1689160, "step": 896, "train_runtime": 2690.6012, "train_tokens_per_second": 627.8 }, { "epoch": 0.9067475360121304, "grad_norm": 1.5001329183578491, "learning_rate": 1.0977215189873418e-05, "loss": 0.07501882314682007, "num_input_tokens_seen": 1690894, "step": 897, "train_runtime": 2692.8316, "train_tokens_per_second": 627.924 }, { "epoch": 0.9077584028304271, "grad_norm": 1.3893307447433472, "learning_rate": 1.0967088607594938e-05, "loss": 0.0938003659248352, "num_input_tokens_seen": 1692400, "step": 898, "train_runtime": 2695.078, "train_tokens_per_second": 627.96 }, { "epoch": 0.9087692696487237, "grad_norm": 1.2841914892196655, "learning_rate": 1.0956962025316458e-05, "loss": 0.09565150737762451, "num_input_tokens_seen": 1694112, "step": 899, "train_runtime": 2697.2872, "train_tokens_per_second": 628.08 }, { "epoch": 0.9097801364670205, "grad_norm": 1.5948413610458374, "learning_rate": 1.0946835443037975e-05, "loss": 0.12826338410377502, "num_input_tokens_seen": 1695600, "step": 900, "train_runtime": 2699.4302, "train_tokens_per_second": 628.133 }, { "epoch": 0.9107910032853171, "grad_norm": 1.1783521175384521, "learning_rate": 1.0936708860759496e-05, "loss": 0.09433984011411667, "num_input_tokens_seen": 1697734, "step": 901, "train_runtime": 2713.9562, "train_tokens_per_second": 625.557 }, { "epoch": 0.9118018701036138, "grad_norm": 1.1530615091323853, "learning_rate": 1.0926582278481013e-05, "loss": 0.08439808338880539, "num_input_tokens_seen": 1699566, "step": 902, "train_runtime": 2716.2257, "train_tokens_per_second": 625.709 }, { "epoch": 0.9128127369219106, "grad_norm": 1.3786677122116089, "learning_rate": 1.0916455696202532e-05, "loss": 0.08519135415554047, "num_input_tokens_seen": 1701632, "step": 903, "train_runtime": 2718.5394, "train_tokens_per_second": 625.936 }, { "epoch": 0.9138236037402072, "grad_norm": 1.207466959953308, "learning_rate": 1.0906329113924053e-05, "loss": 0.08704199641942978, "num_input_tokens_seen": 1703610, "step": 904, "train_runtime": 2720.8624, "train_tokens_per_second": 626.129 }, { "epoch": 0.9148344705585039, "grad_norm": 1.3876044750213623, "learning_rate": 1.089620253164557e-05, "loss": 0.08722815662622452, "num_input_tokens_seen": 1705760, "step": 905, "train_runtime": 2723.3105, "train_tokens_per_second": 626.355 }, { "epoch": 0.9158453373768006, "grad_norm": 1.3396273851394653, "learning_rate": 1.088607594936709e-05, "loss": 0.11136481910943985, "num_input_tokens_seen": 1708032, "step": 906, "train_runtime": 2725.6741, "train_tokens_per_second": 626.646 }, { "epoch": 0.9168562041950973, "grad_norm": 1.7690585851669312, "learning_rate": 1.0875949367088607e-05, "loss": 0.13523980975151062, "num_input_tokens_seen": 1709656, "step": 907, "train_runtime": 2727.9133, "train_tokens_per_second": 626.727 }, { "epoch": 0.9178670710133939, "grad_norm": 1.2731359004974365, "learning_rate": 1.0865822784810128e-05, "loss": 0.09120108187198639, "num_input_tokens_seen": 1711488, "step": 908, "train_runtime": 2730.1541, "train_tokens_per_second": 626.883 }, { "epoch": 0.9188779378316907, "grad_norm": 1.1677757501602173, "learning_rate": 1.0855696202531647e-05, "loss": 0.07026521861553192, "num_input_tokens_seen": 1713238, "step": 909, "train_runtime": 2732.4122, "train_tokens_per_second": 627.006 }, { "epoch": 0.9198888046499873, "grad_norm": 1.2155470848083496, "learning_rate": 1.0845569620253164e-05, "loss": 0.07531221210956573, "num_input_tokens_seen": 1714968, "step": 910, "train_runtime": 2734.7467, "train_tokens_per_second": 627.103 }, { "epoch": 0.9208996714682841, "grad_norm": 1.3503425121307373, "learning_rate": 1.0835443037974685e-05, "loss": 0.0716508999466896, "num_input_tokens_seen": 1716480, "step": 911, "train_runtime": 2737.0312, "train_tokens_per_second": 627.132 }, { "epoch": 0.9219105382865808, "grad_norm": 1.126657485961914, "learning_rate": 1.0825316455696204e-05, "loss": 0.06158575043082237, "num_input_tokens_seen": 1718392, "step": 912, "train_runtime": 2739.3199, "train_tokens_per_second": 627.306 }, { "epoch": 0.9229214051048774, "grad_norm": 1.3263458013534546, "learning_rate": 1.0815189873417721e-05, "loss": 0.09726858884096146, "num_input_tokens_seen": 1720378, "step": 913, "train_runtime": 2741.6101, "train_tokens_per_second": 627.506 }, { "epoch": 0.9239322719231742, "grad_norm": 1.4066224098205566, "learning_rate": 1.0805063291139242e-05, "loss": 0.11678944528102875, "num_input_tokens_seen": 1722602, "step": 914, "train_runtime": 2743.9506, "train_tokens_per_second": 627.782 }, { "epoch": 0.9249431387414708, "grad_norm": 1.2614234685897827, "learning_rate": 1.079493670886076e-05, "loss": 0.08505284041166306, "num_input_tokens_seen": 1724174, "step": 915, "train_runtime": 2746.1314, "train_tokens_per_second": 627.856 }, { "epoch": 0.9259540055597675, "grad_norm": 1.3592069149017334, "learning_rate": 1.0784810126582279e-05, "loss": 0.10287471860647202, "num_input_tokens_seen": 1726094, "step": 916, "train_runtime": 2748.3985, "train_tokens_per_second": 628.036 }, { "epoch": 0.9269648723780642, "grad_norm": 1.3442494869232178, "learning_rate": 1.07746835443038e-05, "loss": 0.10883361101150513, "num_input_tokens_seen": 1728142, "step": 917, "train_runtime": 2750.6957, "train_tokens_per_second": 628.256 }, { "epoch": 0.9279757391963609, "grad_norm": 1.4693677425384521, "learning_rate": 1.0764556962025317e-05, "loss": 0.08407851308584213, "num_input_tokens_seen": 1729944, "step": 918, "train_runtime": 2752.9092, "train_tokens_per_second": 628.406 }, { "epoch": 0.9289866060146575, "grad_norm": 1.1104780435562134, "learning_rate": 1.0754430379746836e-05, "loss": 0.06933184713125229, "num_input_tokens_seen": 1731584, "step": 919, "train_runtime": 2755.1449, "train_tokens_per_second": 628.491 }, { "epoch": 0.9299974728329543, "grad_norm": 1.067386507987976, "learning_rate": 1.0744303797468357e-05, "loss": 0.08393247425556183, "num_input_tokens_seen": 1733392, "step": 920, "train_runtime": 2757.4007, "train_tokens_per_second": 628.633 }, { "epoch": 0.931008339651251, "grad_norm": 1.0293340682983398, "learning_rate": 1.0734177215189874e-05, "loss": 0.07523457705974579, "num_input_tokens_seen": 1735478, "step": 921, "train_runtime": 2759.7052, "train_tokens_per_second": 628.864 }, { "epoch": 0.9320192064695476, "grad_norm": 1.4051296710968018, "learning_rate": 1.0724050632911393e-05, "loss": 0.10520265996456146, "num_input_tokens_seen": 1737024, "step": 922, "train_runtime": 2761.887, "train_tokens_per_second": 628.927 }, { "epoch": 0.9330300732878444, "grad_norm": 1.302826166152954, "learning_rate": 1.071392405063291e-05, "loss": 0.0870056301355362, "num_input_tokens_seen": 1738466, "step": 923, "train_runtime": 2764.0354, "train_tokens_per_second": 628.959 }, { "epoch": 0.934040940106141, "grad_norm": 1.1568562984466553, "learning_rate": 1.0703797468354431e-05, "loss": 0.08165904134511948, "num_input_tokens_seen": 1740182, "step": 924, "train_runtime": 2766.2755, "train_tokens_per_second": 629.07 }, { "epoch": 0.9350518069244377, "grad_norm": 1.498045802116394, "learning_rate": 1.069367088607595e-05, "loss": 0.07458744943141937, "num_input_tokens_seen": 1742024, "step": 925, "train_runtime": 2768.5295, "train_tokens_per_second": 629.224 }, { "epoch": 0.9360626737427344, "grad_norm": 1.5417124032974243, "learning_rate": 1.0683544303797468e-05, "loss": 0.08173717558383942, "num_input_tokens_seen": 1744238, "step": 926, "train_runtime": 2770.8653, "train_tokens_per_second": 629.492 }, { "epoch": 0.9370735405610311, "grad_norm": 1.4843844175338745, "learning_rate": 1.0673417721518988e-05, "loss": 0.09999965876340866, "num_input_tokens_seen": 1746118, "step": 927, "train_runtime": 2773.1104, "train_tokens_per_second": 629.66 }, { "epoch": 0.9380844073793277, "grad_norm": 1.3070656061172485, "learning_rate": 1.0663291139240508e-05, "loss": 0.08072533458471298, "num_input_tokens_seen": 1748128, "step": 928, "train_runtime": 2775.3922, "train_tokens_per_second": 629.867 }, { "epoch": 0.9390952741976245, "grad_norm": 1.1128119230270386, "learning_rate": 1.0653164556962025e-05, "loss": 0.07749972492456436, "num_input_tokens_seen": 1749964, "step": 929, "train_runtime": 2777.6304, "train_tokens_per_second": 630.02 }, { "epoch": 0.9401061410159212, "grad_norm": 1.4054396152496338, "learning_rate": 1.0643037974683546e-05, "loss": 0.10775762796401978, "num_input_tokens_seen": 1752108, "step": 930, "train_runtime": 2779.9497, "train_tokens_per_second": 630.266 }, { "epoch": 0.9411170078342178, "grad_norm": 1.2067521810531616, "learning_rate": 1.0632911392405063e-05, "loss": 0.061036814004182816, "num_input_tokens_seen": 1753674, "step": 931, "train_runtime": 2795.9291, "train_tokens_per_second": 627.224 }, { "epoch": 0.9421278746525146, "grad_norm": 1.5800102949142456, "learning_rate": 1.0622784810126582e-05, "loss": 0.13530917465686798, "num_input_tokens_seen": 1755348, "step": 932, "train_runtime": 2798.1598, "train_tokens_per_second": 627.322 }, { "epoch": 0.9431387414708112, "grad_norm": 1.1216083765029907, "learning_rate": 1.0612658227848103e-05, "loss": 0.06917855888605118, "num_input_tokens_seen": 1757138, "step": 933, "train_runtime": 2800.4535, "train_tokens_per_second": 627.448 }, { "epoch": 0.9441496082891079, "grad_norm": 1.2829315662384033, "learning_rate": 1.060253164556962e-05, "loss": 0.11217761039733887, "num_input_tokens_seen": 1759246, "step": 934, "train_runtime": 2802.7831, "train_tokens_per_second": 627.678 }, { "epoch": 0.9451604751074046, "grad_norm": 1.126326084136963, "learning_rate": 1.059240506329114e-05, "loss": 0.08738552033901215, "num_input_tokens_seen": 1760924, "step": 935, "train_runtime": 2805.0314, "train_tokens_per_second": 627.773 }, { "epoch": 0.9461713419257013, "grad_norm": 1.3069648742675781, "learning_rate": 1.058227848101266e-05, "loss": 0.09563612192869186, "num_input_tokens_seen": 1762612, "step": 936, "train_runtime": 2807.2487, "train_tokens_per_second": 627.879 }, { "epoch": 0.9471822087439979, "grad_norm": 1.8466509580612183, "learning_rate": 1.0572151898734178e-05, "loss": 0.09266931563615799, "num_input_tokens_seen": 1764110, "step": 937, "train_runtime": 2809.4139, "train_tokens_per_second": 627.928 }, { "epoch": 0.9481930755622947, "grad_norm": 1.0844366550445557, "learning_rate": 1.0562025316455697e-05, "loss": 0.0760909914970398, "num_input_tokens_seen": 1765750, "step": 938, "train_runtime": 2811.6021, "train_tokens_per_second": 628.023 }, { "epoch": 0.9492039423805914, "grad_norm": 1.2627480030059814, "learning_rate": 1.0551898734177216e-05, "loss": 0.08009866625070572, "num_input_tokens_seen": 1768042, "step": 939, "train_runtime": 2813.9799, "train_tokens_per_second": 628.307 }, { "epoch": 0.950214809198888, "grad_norm": 1.338079571723938, "learning_rate": 1.0541772151898735e-05, "loss": 0.09438227117061615, "num_input_tokens_seen": 1769708, "step": 940, "train_runtime": 2816.1705, "train_tokens_per_second": 628.409 }, { "epoch": 0.9512256760171848, "grad_norm": 1.1252024173736572, "learning_rate": 1.0531645569620254e-05, "loss": 0.07405475527048111, "num_input_tokens_seen": 1771470, "step": 941, "train_runtime": 2818.3813, "train_tokens_per_second": 628.542 }, { "epoch": 0.9522365428354814, "grad_norm": 1.2941299676895142, "learning_rate": 1.0521518987341773e-05, "loss": 0.1025523766875267, "num_input_tokens_seen": 1773556, "step": 942, "train_runtime": 2820.7599, "train_tokens_per_second": 628.751 }, { "epoch": 0.9532474096537781, "grad_norm": 1.3735921382904053, "learning_rate": 1.0511392405063292e-05, "loss": 0.10084748268127441, "num_input_tokens_seen": 1775544, "step": 943, "train_runtime": 2823.1414, "train_tokens_per_second": 628.925 }, { "epoch": 0.9542582764720748, "grad_norm": 1.2376788854599, "learning_rate": 1.0501265822784811e-05, "loss": 0.08542808145284653, "num_input_tokens_seen": 1777788, "step": 944, "train_runtime": 2825.491, "train_tokens_per_second": 629.196 }, { "epoch": 0.9552691432903715, "grad_norm": 1.7774964570999146, "learning_rate": 1.049113924050633e-05, "loss": 0.1164168193936348, "num_input_tokens_seen": 1779460, "step": 945, "train_runtime": 2827.6964, "train_tokens_per_second": 629.297 }, { "epoch": 0.9562800101086681, "grad_norm": 1.1214243173599243, "learning_rate": 1.048101265822785e-05, "loss": 0.10965441912412643, "num_input_tokens_seen": 1781276, "step": 946, "train_runtime": 2829.995, "train_tokens_per_second": 629.427 }, { "epoch": 0.9572908769269649, "grad_norm": 1.211427927017212, "learning_rate": 1.0470886075949367e-05, "loss": 0.07722736895084381, "num_input_tokens_seen": 1783112, "step": 947, "train_runtime": 2832.3556, "train_tokens_per_second": 629.551 }, { "epoch": 0.9583017437452616, "grad_norm": 1.2366421222686768, "learning_rate": 1.0460759493670888e-05, "loss": 0.06977664679288864, "num_input_tokens_seen": 1784986, "step": 948, "train_runtime": 2834.7276, "train_tokens_per_second": 629.685 }, { "epoch": 0.9593126105635582, "grad_norm": 1.3729935884475708, "learning_rate": 1.0450632911392407e-05, "loss": 0.12681029736995697, "num_input_tokens_seen": 1787244, "step": 949, "train_runtime": 2837.0511, "train_tokens_per_second": 629.965 }, { "epoch": 0.960323477381855, "grad_norm": 1.2358911037445068, "learning_rate": 1.0440506329113924e-05, "loss": 0.08143652230501175, "num_input_tokens_seen": 1788888, "step": 950, "train_runtime": 2839.3479, "train_tokens_per_second": 630.035 }, { "epoch": 0.9613343442001516, "grad_norm": 1.2744375467300415, "learning_rate": 1.0430379746835443e-05, "loss": 0.07948824018239975, "num_input_tokens_seen": 1790766, "step": 951, "train_runtime": 2841.7231, "train_tokens_per_second": 630.169 }, { "epoch": 0.9623452110184483, "grad_norm": 1.2582530975341797, "learning_rate": 1.0420253164556964e-05, "loss": 0.08794012665748596, "num_input_tokens_seen": 1792828, "step": 952, "train_runtime": 2844.0645, "train_tokens_per_second": 630.375 }, { "epoch": 0.963356077836745, "grad_norm": 1.4969607591629028, "learning_rate": 1.0410126582278481e-05, "loss": 0.09313049167394638, "num_input_tokens_seen": 1794592, "step": 953, "train_runtime": 2846.3064, "train_tokens_per_second": 630.499 }, { "epoch": 0.9643669446550417, "grad_norm": 1.5015640258789062, "learning_rate": 1.04e-05, "loss": 0.09978991001844406, "num_input_tokens_seen": 1796582, "step": 954, "train_runtime": 2848.5542, "train_tokens_per_second": 630.7 }, { "epoch": 0.9653778114733383, "grad_norm": 1.805250883102417, "learning_rate": 1.038987341772152e-05, "loss": 0.09670915454626083, "num_input_tokens_seen": 1798762, "step": 955, "train_runtime": 2850.8744, "train_tokens_per_second": 630.951 }, { "epoch": 0.9663886782916351, "grad_norm": 1.4795347452163696, "learning_rate": 1.0379746835443039e-05, "loss": 0.08996425569057465, "num_input_tokens_seen": 1800326, "step": 956, "train_runtime": 2853.084, "train_tokens_per_second": 631.011 }, { "epoch": 0.9673995451099318, "grad_norm": 0.9255862832069397, "learning_rate": 1.0369620253164558e-05, "loss": 0.058813609182834625, "num_input_tokens_seen": 1802300, "step": 957, "train_runtime": 2855.3629, "train_tokens_per_second": 631.198 }, { "epoch": 0.9684104119282284, "grad_norm": 1.4676817655563354, "learning_rate": 1.0359493670886077e-05, "loss": 0.09787975251674652, "num_input_tokens_seen": 1804308, "step": 958, "train_runtime": 2857.7397, "train_tokens_per_second": 631.376 }, { "epoch": 0.9694212787465252, "grad_norm": 1.2104109525680542, "learning_rate": 1.0349367088607596e-05, "loss": 0.08531485497951508, "num_input_tokens_seen": 1806076, "step": 959, "train_runtime": 2860.0443, "train_tokens_per_second": 631.485 }, { "epoch": 0.9704321455648218, "grad_norm": 1.3908240795135498, "learning_rate": 1.0339240506329115e-05, "loss": 0.06906469166278839, "num_input_tokens_seen": 1807730, "step": 960, "train_runtime": 2862.251, "train_tokens_per_second": 631.576 }, { "epoch": 0.9714430123831185, "grad_norm": 1.6727023124694824, "learning_rate": 1.0329113924050634e-05, "loss": 0.10353363305330276, "num_input_tokens_seen": 1809348, "step": 961, "train_runtime": 2877.8083, "train_tokens_per_second": 628.724 }, { "epoch": 0.9724538792014152, "grad_norm": 1.5217154026031494, "learning_rate": 1.0318987341772153e-05, "loss": 0.10294269770383835, "num_input_tokens_seen": 1811064, "step": 962, "train_runtime": 2880.0629, "train_tokens_per_second": 628.828 }, { "epoch": 0.9734647460197119, "grad_norm": 1.4586036205291748, "learning_rate": 1.030886075949367e-05, "loss": 0.1298624575138092, "num_input_tokens_seen": 1813668, "step": 963, "train_runtime": 2882.509, "train_tokens_per_second": 629.198 }, { "epoch": 0.9744756128380085, "grad_norm": 1.3519442081451416, "learning_rate": 1.0298734177215191e-05, "loss": 0.07855690270662308, "num_input_tokens_seen": 1815248, "step": 964, "train_runtime": 2884.6649, "train_tokens_per_second": 629.275 }, { "epoch": 0.9754864796563053, "grad_norm": 1.5139068365097046, "learning_rate": 1.028860759493671e-05, "loss": 0.07745806872844696, "num_input_tokens_seen": 1816818, "step": 965, "train_runtime": 2886.8776, "train_tokens_per_second": 629.337 }, { "epoch": 0.976497346474602, "grad_norm": 1.4229735136032104, "learning_rate": 1.0278481012658228e-05, "loss": 0.08527548611164093, "num_input_tokens_seen": 1818406, "step": 966, "train_runtime": 2889.1878, "train_tokens_per_second": 629.383 }, { "epoch": 0.9775082132928986, "grad_norm": 1.1302425861358643, "learning_rate": 1.0268354430379748e-05, "loss": 0.08704423904418945, "num_input_tokens_seen": 1820820, "step": 967, "train_runtime": 2891.6001, "train_tokens_per_second": 629.693 }, { "epoch": 0.9785190801111954, "grad_norm": 1.5682348012924194, "learning_rate": 1.0258227848101268e-05, "loss": 0.09315840899944305, "num_input_tokens_seen": 1822530, "step": 968, "train_runtime": 2893.8251, "train_tokens_per_second": 629.8 }, { "epoch": 0.979529946929492, "grad_norm": 1.3528974056243896, "learning_rate": 1.0248101265822785e-05, "loss": 0.07272883504629135, "num_input_tokens_seen": 1824318, "step": 969, "train_runtime": 2896.0731, "train_tokens_per_second": 629.928 }, { "epoch": 0.9805408137477887, "grad_norm": 1.1246165037155151, "learning_rate": 1.0237974683544306e-05, "loss": 0.08196530491113663, "num_input_tokens_seen": 1826020, "step": 970, "train_runtime": 2898.2925, "train_tokens_per_second": 630.033 }, { "epoch": 0.9815516805660854, "grad_norm": 1.3558357954025269, "learning_rate": 1.0227848101265823e-05, "loss": 0.10895586013793945, "num_input_tokens_seen": 1827850, "step": 971, "train_runtime": 2900.5995, "train_tokens_per_second": 630.163 }, { "epoch": 0.9825625473843821, "grad_norm": 1.047476887702942, "learning_rate": 1.0217721518987342e-05, "loss": 0.08318047225475311, "num_input_tokens_seen": 1829772, "step": 972, "train_runtime": 2902.9263, "train_tokens_per_second": 630.32 }, { "epoch": 0.9835734142026787, "grad_norm": 1.2297887802124023, "learning_rate": 1.0207594936708863e-05, "loss": 0.09063711762428284, "num_input_tokens_seen": 1831816, "step": 973, "train_runtime": 2905.3397, "train_tokens_per_second": 630.5 }, { "epoch": 0.9845842810209755, "grad_norm": 1.2506780624389648, "learning_rate": 1.019746835443038e-05, "loss": 0.09520822763442993, "num_input_tokens_seen": 1833678, "step": 974, "train_runtime": 2907.6767, "train_tokens_per_second": 630.633 }, { "epoch": 0.9855951478392722, "grad_norm": 1.036617398262024, "learning_rate": 1.01873417721519e-05, "loss": 0.05149223655462265, "num_input_tokens_seen": 1835588, "step": 975, "train_runtime": 2910.004, "train_tokens_per_second": 630.785 }, { "epoch": 0.9866060146575689, "grad_norm": 1.249518632888794, "learning_rate": 1.017721518987342e-05, "loss": 0.08044559508562088, "num_input_tokens_seen": 1837268, "step": 976, "train_runtime": 2912.2941, "train_tokens_per_second": 630.866 }, { "epoch": 0.9876168814758656, "grad_norm": 1.2275365591049194, "learning_rate": 1.0167088607594938e-05, "loss": 0.09414568543434143, "num_input_tokens_seen": 1839268, "step": 977, "train_runtime": 2914.6048, "train_tokens_per_second": 631.052 }, { "epoch": 0.9886277482941622, "grad_norm": 1.383276104927063, "learning_rate": 1.0156962025316457e-05, "loss": 0.1156046986579895, "num_input_tokens_seen": 1841210, "step": 978, "train_runtime": 2916.9128, "train_tokens_per_second": 631.219 }, { "epoch": 0.989638615112459, "grad_norm": 1.388059139251709, "learning_rate": 1.0146835443037974e-05, "loss": 0.0882212296128273, "num_input_tokens_seen": 1842680, "step": 979, "train_runtime": 2919.0657, "train_tokens_per_second": 631.257 }, { "epoch": 0.9906494819307556, "grad_norm": 1.3873894214630127, "learning_rate": 1.0136708860759495e-05, "loss": 0.11233676970005035, "num_input_tokens_seen": 1844666, "step": 980, "train_runtime": 2921.3698, "train_tokens_per_second": 631.439 }, { "epoch": 0.9916603487490523, "grad_norm": 1.4980145692825317, "learning_rate": 1.0126582278481014e-05, "loss": 0.0733579695224762, "num_input_tokens_seen": 1846488, "step": 981, "train_runtime": 2923.6221, "train_tokens_per_second": 631.575 }, { "epoch": 0.992671215567349, "grad_norm": 1.169364333152771, "learning_rate": 1.0116455696202531e-05, "loss": 0.07496096938848495, "num_input_tokens_seen": 1847874, "step": 982, "train_runtime": 2925.7767, "train_tokens_per_second": 631.584 }, { "epoch": 0.9936820823856457, "grad_norm": 1.3312809467315674, "learning_rate": 1.0106329113924052e-05, "loss": 0.125822514295578, "num_input_tokens_seen": 1850558, "step": 983, "train_runtime": 2928.3045, "train_tokens_per_second": 631.955 }, { "epoch": 0.9946929492039424, "grad_norm": 1.3782777786254883, "learning_rate": 1.0096202531645571e-05, "loss": 0.10531510412693024, "num_input_tokens_seen": 1852386, "step": 984, "train_runtime": 2930.5511, "train_tokens_per_second": 632.095 }, { "epoch": 0.9957038160222391, "grad_norm": 1.1993474960327148, "learning_rate": 1.0086075949367089e-05, "loss": 0.07088446617126465, "num_input_tokens_seen": 1853996, "step": 985, "train_runtime": 2932.7736, "train_tokens_per_second": 632.165 }, { "epoch": 0.9967146828405358, "grad_norm": 1.3125388622283936, "learning_rate": 1.007594936708861e-05, "loss": 0.08627714216709137, "num_input_tokens_seen": 1855850, "step": 986, "train_runtime": 2935.0487, "train_tokens_per_second": 632.306 }, { "epoch": 0.9977255496588324, "grad_norm": 1.1183034181594849, "learning_rate": 1.0065822784810127e-05, "loss": 0.07033257186412811, "num_input_tokens_seen": 1857768, "step": 987, "train_runtime": 2937.326, "train_tokens_per_second": 632.469 }, { "epoch": 0.9987364164771292, "grad_norm": 1.2570730447769165, "learning_rate": 1.0055696202531646e-05, "loss": 0.08110842853784561, "num_input_tokens_seen": 1859650, "step": 988, "train_runtime": 2939.6413, "train_tokens_per_second": 632.611 }, { "epoch": 0.9997472832954258, "grad_norm": 1.5044852495193481, "learning_rate": 1.0045569620253167e-05, "loss": 0.1258259266614914, "num_input_tokens_seen": 1861366, "step": 989, "train_runtime": 2941.8745, "train_tokens_per_second": 632.714 }, { "epoch": 1.0, "grad_norm": 21.823984146118164, "learning_rate": 1.0035443037974684e-05, "loss": 0.24952997267246246, "num_input_tokens_seen": 1861552, "step": 990, "train_runtime": 2946.0328, "train_tokens_per_second": 631.884 }, { "epoch": 1.0, "eval_loss": 0.3537242114543915, "eval_runtime": 54.2852, "eval_samples_per_second": 16.192, "eval_steps_per_second": 8.105, "num_input_tokens_seen": 1861552, "step": 990 }, { "epoch": 1.0010108668182967, "grad_norm": 1.090188980102539, "learning_rate": 1.0025316455696203e-05, "loss": 0.059413257986307144, "num_input_tokens_seen": 1863014, "step": 991, "train_runtime": 3015.8505, "train_tokens_per_second": 617.741 }, { "epoch": 1.0020217336365933, "grad_norm": 1.0046461820602417, "learning_rate": 1.0015189873417724e-05, "loss": 0.08590734004974365, "num_input_tokens_seen": 1865072, "step": 992, "train_runtime": 3018.1929, "train_tokens_per_second": 617.943 }, { "epoch": 1.0030326004548902, "grad_norm": 0.9283597469329834, "learning_rate": 1.0005063291139241e-05, "loss": 0.07354570925235748, "num_input_tokens_seen": 1867012, "step": 993, "train_runtime": 3020.4699, "train_tokens_per_second": 618.12 }, { "epoch": 1.0040434672731868, "grad_norm": 1.0630100965499878, "learning_rate": 9.99493670886076e-06, "loss": 0.08562401682138443, "num_input_tokens_seen": 1868564, "step": 994, "train_runtime": 3022.6476, "train_tokens_per_second": 618.188 }, { "epoch": 1.0050543340914835, "grad_norm": 0.7541443705558777, "learning_rate": 9.98481012658228e-06, "loss": 0.052490636706352234, "num_input_tokens_seen": 1870560, "step": 995, "train_runtime": 3024.9181, "train_tokens_per_second": 618.384 }, { "epoch": 1.0060652009097801, "grad_norm": 0.8982731699943542, "learning_rate": 9.974683544303799e-06, "loss": 0.0504504069685936, "num_input_tokens_seen": 1872450, "step": 996, "train_runtime": 3027.1886, "train_tokens_per_second": 618.544 }, { "epoch": 1.0070760677280768, "grad_norm": 1.615670919418335, "learning_rate": 9.964556962025318e-06, "loss": 0.07105681300163269, "num_input_tokens_seen": 1874370, "step": 997, "train_runtime": 3029.4799, "train_tokens_per_second": 618.71 }, { "epoch": 1.0080869345463734, "grad_norm": 1.0482178926467896, "learning_rate": 9.954430379746837e-06, "loss": 0.0805853009223938, "num_input_tokens_seen": 1876216, "step": 998, "train_runtime": 3031.7269, "train_tokens_per_second": 618.86 }, { "epoch": 1.0090978013646703, "grad_norm": 0.9585389494895935, "learning_rate": 9.944303797468356e-06, "loss": 0.047966934740543365, "num_input_tokens_seen": 1878082, "step": 999, "train_runtime": 3034.0109, "train_tokens_per_second": 619.01 }, { "epoch": 1.010108668182967, "grad_norm": 1.2671263217926025, "learning_rate": 9.934177215189875e-06, "loss": 0.07086250931024551, "num_input_tokens_seen": 1879650, "step": 1000, "train_runtime": 3036.1834, "train_tokens_per_second": 619.083 }, { "epoch": 1.0111195350012636, "grad_norm": 0.9175081849098206, "learning_rate": 9.924050632911392e-06, "loss": 0.055121179670095444, "num_input_tokens_seen": 1881368, "step": 1001, "train_runtime": 3038.6548, "train_tokens_per_second": 619.145 }, { "epoch": 1.0121304018195603, "grad_norm": 1.1538333892822266, "learning_rate": 9.913924050632913e-06, "loss": 0.051699936389923096, "num_input_tokens_seen": 1882806, "step": 1002, "train_runtime": 3040.8521, "train_tokens_per_second": 619.171 }, { "epoch": 1.013141268637857, "grad_norm": 0.9294945597648621, "learning_rate": 9.903797468354432e-06, "loss": 0.052237533032894135, "num_input_tokens_seen": 1884588, "step": 1003, "train_runtime": 3043.1036, "train_tokens_per_second": 619.298 }, { "epoch": 1.0141521354561536, "grad_norm": 1.0442825555801392, "learning_rate": 9.89367088607595e-06, "loss": 0.06165135279297829, "num_input_tokens_seen": 1886554, "step": 1004, "train_runtime": 3045.3521, "train_tokens_per_second": 619.486 }, { "epoch": 1.0151630022744504, "grad_norm": 1.1734623908996582, "learning_rate": 9.883544303797469e-06, "loss": 0.05909053236246109, "num_input_tokens_seen": 1888610, "step": 1005, "train_runtime": 3047.6581, "train_tokens_per_second": 619.692 }, { "epoch": 1.016173869092747, "grad_norm": 1.118070363998413, "learning_rate": 9.87341772151899e-06, "loss": 0.053689271211624146, "num_input_tokens_seen": 1890282, "step": 1006, "train_runtime": 3049.9039, "train_tokens_per_second": 619.784 }, { "epoch": 1.0171847359110437, "grad_norm": 0.7742297053337097, "learning_rate": 9.863291139240507e-06, "loss": 0.03591981530189514, "num_input_tokens_seen": 1891916, "step": 1007, "train_runtime": 3052.0998, "train_tokens_per_second": 619.874 }, { "epoch": 1.0181956027293404, "grad_norm": 1.0873570442199707, "learning_rate": 9.853164556962026e-06, "loss": 0.051595840603113174, "num_input_tokens_seen": 1893622, "step": 1008, "train_runtime": 3054.3191, "train_tokens_per_second": 619.982 }, { "epoch": 1.019206469547637, "grad_norm": 1.2785816192626953, "learning_rate": 9.843037974683545e-06, "loss": 0.06961002200841904, "num_input_tokens_seen": 1895592, "step": 1009, "train_runtime": 3056.6275, "train_tokens_per_second": 620.158 }, { "epoch": 1.0202173363659337, "grad_norm": 0.9817463755607605, "learning_rate": 9.832911392405064e-06, "loss": 0.050475168973207474, "num_input_tokens_seen": 1897352, "step": 1010, "train_runtime": 3058.8932, "train_tokens_per_second": 620.274 }, { "epoch": 1.0212282031842306, "grad_norm": 1.2408863306045532, "learning_rate": 9.822784810126583e-06, "loss": 0.062181588262319565, "num_input_tokens_seen": 1898760, "step": 1011, "train_runtime": 3061.0348, "train_tokens_per_second": 620.3 }, { "epoch": 1.0222390700025272, "grad_norm": 1.0834853649139404, "learning_rate": 9.812658227848102e-06, "loss": 0.053876448422670364, "num_input_tokens_seen": 1900986, "step": 1012, "train_runtime": 3063.3761, "train_tokens_per_second": 620.553 }, { "epoch": 1.0232499368208239, "grad_norm": 1.0059926509857178, "learning_rate": 9.802531645569621e-06, "loss": 0.045563697814941406, "num_input_tokens_seen": 1902980, "step": 1013, "train_runtime": 3065.6718, "train_tokens_per_second": 620.738 }, { "epoch": 1.0242608036391205, "grad_norm": 1.8022197484970093, "learning_rate": 9.79240506329114e-06, "loss": 0.06333720684051514, "num_input_tokens_seen": 1904582, "step": 1014, "train_runtime": 3067.8646, "train_tokens_per_second": 620.817 }, { "epoch": 1.0252716704574172, "grad_norm": 1.1936384439468384, "learning_rate": 9.78227848101266e-06, "loss": 0.06332344561815262, "num_input_tokens_seen": 1906454, "step": 1015, "train_runtime": 3070.1066, "train_tokens_per_second": 620.973 }, { "epoch": 1.0262825372757138, "grad_norm": 1.0198880434036255, "learning_rate": 9.772151898734179e-06, "loss": 0.05684672296047211, "num_input_tokens_seen": 1908566, "step": 1016, "train_runtime": 3072.4785, "train_tokens_per_second": 621.181 }, { "epoch": 1.0272934040940107, "grad_norm": 1.1272902488708496, "learning_rate": 9.762025316455696e-06, "loss": 0.04964352026581764, "num_input_tokens_seen": 1910098, "step": 1017, "train_runtime": 3074.6987, "train_tokens_per_second": 621.231 }, { "epoch": 1.0283042709123074, "grad_norm": 1.453578233718872, "learning_rate": 9.751898734177217e-06, "loss": 0.035638563334941864, "num_input_tokens_seen": 1911660, "step": 1018, "train_runtime": 3076.9556, "train_tokens_per_second": 621.283 }, { "epoch": 1.029315137730604, "grad_norm": 1.4090577363967896, "learning_rate": 9.741772151898736e-06, "loss": 0.08451429754495621, "num_input_tokens_seen": 1914106, "step": 1019, "train_runtime": 3079.3753, "train_tokens_per_second": 621.589 }, { "epoch": 1.0303260045489007, "grad_norm": 1.227582335472107, "learning_rate": 9.731645569620253e-06, "loss": 0.051470160484313965, "num_input_tokens_seen": 1916250, "step": 1020, "train_runtime": 3081.737, "train_tokens_per_second": 621.808 }, { "epoch": 1.0313368713671973, "grad_norm": 1.048599362373352, "learning_rate": 9.721518987341772e-06, "loss": 0.04310810565948486, "num_input_tokens_seen": 1918076, "step": 1021, "train_runtime": 3096.2147, "train_tokens_per_second": 619.491 }, { "epoch": 1.032347738185494, "grad_norm": 1.0663803815841675, "learning_rate": 9.711392405063293e-06, "loss": 0.05646198242902756, "num_input_tokens_seen": 1919904, "step": 1022, "train_runtime": 3098.5638, "train_tokens_per_second": 619.611 }, { "epoch": 1.0333586050037908, "grad_norm": 0.9684441685676575, "learning_rate": 9.70126582278481e-06, "loss": 0.04822005331516266, "num_input_tokens_seen": 1921690, "step": 1023, "train_runtime": 3100.8399, "train_tokens_per_second": 619.732 }, { "epoch": 1.0343694718220875, "grad_norm": 1.1114486455917358, "learning_rate": 9.69113924050633e-06, "loss": 0.05490822717547417, "num_input_tokens_seen": 1923734, "step": 1024, "train_runtime": 3103.1667, "train_tokens_per_second": 619.926 }, { "epoch": 1.0353803386403841, "grad_norm": 0.8609014749526978, "learning_rate": 9.681012658227849e-06, "loss": 0.03940562903881073, "num_input_tokens_seen": 1925552, "step": 1025, "train_runtime": 3105.4492, "train_tokens_per_second": 620.056 }, { "epoch": 1.0363912054586808, "grad_norm": 1.2412512302398682, "learning_rate": 9.670886075949368e-06, "loss": 0.07361410558223724, "num_input_tokens_seen": 1927862, "step": 1026, "train_runtime": 3107.826, "train_tokens_per_second": 620.325 }, { "epoch": 1.0374020722769774, "grad_norm": 1.5505046844482422, "learning_rate": 9.660759493670887e-06, "loss": 0.06292421370744705, "num_input_tokens_seen": 1930110, "step": 1027, "train_runtime": 3110.1941, "train_tokens_per_second": 620.575 }, { "epoch": 1.038412939095274, "grad_norm": 1.5445483922958374, "learning_rate": 9.650632911392406e-06, "loss": 0.06876043975353241, "num_input_tokens_seen": 1932032, "step": 1028, "train_runtime": 3112.4815, "train_tokens_per_second": 620.737 }, { "epoch": 1.039423805913571, "grad_norm": 1.0396747589111328, "learning_rate": 9.640506329113925e-06, "loss": 0.04588109254837036, "num_input_tokens_seen": 1934146, "step": 1029, "train_runtime": 3115.1357, "train_tokens_per_second": 620.887 }, { "epoch": 1.0404346727318676, "grad_norm": 1.227482557296753, "learning_rate": 9.630379746835444e-06, "loss": 0.0684301108121872, "num_input_tokens_seen": 1936018, "step": 1030, "train_runtime": 3117.4068, "train_tokens_per_second": 621.035 }, { "epoch": 1.0414455395501643, "grad_norm": 1.1692776679992676, "learning_rate": 9.620253164556963e-06, "loss": 0.06540321558713913, "num_input_tokens_seen": 1937840, "step": 1031, "train_runtime": 3119.7217, "train_tokens_per_second": 621.158 }, { "epoch": 1.042456406368461, "grad_norm": 1.1892913579940796, "learning_rate": 9.610126582278482e-06, "loss": 0.0633426383137703, "num_input_tokens_seen": 1939736, "step": 1032, "train_runtime": 3122.08, "train_tokens_per_second": 621.296 }, { "epoch": 1.0434672731867576, "grad_norm": 1.1392109394073486, "learning_rate": 9.600000000000001e-06, "loss": 0.06080387160181999, "num_input_tokens_seen": 1941232, "step": 1033, "train_runtime": 3124.3392, "train_tokens_per_second": 621.326 }, { "epoch": 1.0444781400050542, "grad_norm": 1.3295029401779175, "learning_rate": 9.58987341772152e-06, "loss": 0.06093157082796097, "num_input_tokens_seen": 1943502, "step": 1034, "train_runtime": 3126.7182, "train_tokens_per_second": 621.579 }, { "epoch": 1.045489006823351, "grad_norm": 1.7235727310180664, "learning_rate": 9.57974683544304e-06, "loss": 0.08213045448064804, "num_input_tokens_seen": 1945588, "step": 1035, "train_runtime": 3129.0319, "train_tokens_per_second": 621.786 }, { "epoch": 1.0464998736416478, "grad_norm": 1.2702877521514893, "learning_rate": 9.569620253164559e-06, "loss": 0.057667411863803864, "num_input_tokens_seen": 1947762, "step": 1036, "train_runtime": 3131.3751, "train_tokens_per_second": 622.015 }, { "epoch": 1.0475107404599444, "grad_norm": 1.0603086948394775, "learning_rate": 9.559493670886076e-06, "loss": 0.051095783710479736, "num_input_tokens_seen": 1949644, "step": 1037, "train_runtime": 3133.7008, "train_tokens_per_second": 622.154 }, { "epoch": 1.048521607278241, "grad_norm": 1.0244430303573608, "learning_rate": 9.549367088607597e-06, "loss": 0.04529440030455589, "num_input_tokens_seen": 1951800, "step": 1038, "train_runtime": 3136.1466, "train_tokens_per_second": 622.356 }, { "epoch": 1.0495324740965377, "grad_norm": 1.6149035692214966, "learning_rate": 9.539240506329114e-06, "loss": 0.06959658861160278, "num_input_tokens_seen": 1953690, "step": 1039, "train_runtime": 3138.4268, "train_tokens_per_second": 622.506 }, { "epoch": 1.0505433409148344, "grad_norm": 0.9820495247840881, "learning_rate": 9.529113924050633e-06, "loss": 0.05469644069671631, "num_input_tokens_seen": 1955684, "step": 1040, "train_runtime": 3140.7473, "train_tokens_per_second": 622.681 }, { "epoch": 1.0515542077331312, "grad_norm": 1.5499889850616455, "learning_rate": 9.518987341772152e-06, "loss": 0.07478737831115723, "num_input_tokens_seen": 1957194, "step": 1041, "train_runtime": 3142.9782, "train_tokens_per_second": 622.72 }, { "epoch": 1.052565074551428, "grad_norm": 0.9262644052505493, "learning_rate": 9.508860759493671e-06, "loss": 0.048888735473155975, "num_input_tokens_seen": 1959200, "step": 1042, "train_runtime": 3145.3251, "train_tokens_per_second": 622.893 }, { "epoch": 1.0535759413697245, "grad_norm": 1.365299105644226, "learning_rate": 9.49873417721519e-06, "loss": 0.0644601434469223, "num_input_tokens_seen": 1960834, "step": 1043, "train_runtime": 3147.5374, "train_tokens_per_second": 622.974 }, { "epoch": 1.0545868081880212, "grad_norm": 2.561173677444458, "learning_rate": 9.48860759493671e-06, "loss": 0.06372687220573425, "num_input_tokens_seen": 1962374, "step": 1044, "train_runtime": 3149.7262, "train_tokens_per_second": 623.03 }, { "epoch": 1.0555976750063178, "grad_norm": 1.5165947675704956, "learning_rate": 9.478481012658229e-06, "loss": 0.071042999625206, "num_input_tokens_seen": 1964462, "step": 1045, "train_runtime": 3152.0308, "train_tokens_per_second": 623.237 }, { "epoch": 1.0566085418246145, "grad_norm": 1.3632253408432007, "learning_rate": 9.468354430379748e-06, "loss": 0.07348132133483887, "num_input_tokens_seen": 1966108, "step": 1046, "train_runtime": 3154.2419, "train_tokens_per_second": 623.322 }, { "epoch": 1.0576194086429114, "grad_norm": 1.3681747913360596, "learning_rate": 9.458227848101267e-06, "loss": 0.06395052373409271, "num_input_tokens_seen": 1968492, "step": 1047, "train_runtime": 3156.7553, "train_tokens_per_second": 623.581 }, { "epoch": 1.058630275461208, "grad_norm": 1.3107277154922485, "learning_rate": 9.448101265822786e-06, "loss": 0.0616154819726944, "num_input_tokens_seen": 1970174, "step": 1048, "train_runtime": 3159.0565, "train_tokens_per_second": 623.659 }, { "epoch": 1.0596411422795047, "grad_norm": 1.3554524183273315, "learning_rate": 9.437974683544305e-06, "loss": 0.047980040311813354, "num_input_tokens_seen": 1972186, "step": 1049, "train_runtime": 3161.3657, "train_tokens_per_second": 623.84 }, { "epoch": 1.0606520090978013, "grad_norm": 1.1780120134353638, "learning_rate": 9.427848101265824e-06, "loss": 0.07722882181406021, "num_input_tokens_seen": 1974348, "step": 1050, "train_runtime": 3163.7132, "train_tokens_per_second": 624.06 }, { "epoch": 1.061662875916098, "grad_norm": 0.9879222512245178, "learning_rate": 9.417721518987343e-06, "loss": 0.02780820056796074, "num_input_tokens_seen": 1976044, "step": 1051, "train_runtime": 3178.1542, "train_tokens_per_second": 621.758 }, { "epoch": 1.0626737427343946, "grad_norm": 1.1026676893234253, "learning_rate": 9.407594936708862e-06, "loss": 0.049638256430625916, "num_input_tokens_seen": 1977710, "step": 1052, "train_runtime": 3180.4168, "train_tokens_per_second": 621.84 }, { "epoch": 1.0636846095526915, "grad_norm": 1.2987622022628784, "learning_rate": 9.39746835443038e-06, "loss": 0.07319340109825134, "num_input_tokens_seen": 1979460, "step": 1053, "train_runtime": 3182.7512, "train_tokens_per_second": 621.934 }, { "epoch": 1.0646954763709882, "grad_norm": 1.4163175821304321, "learning_rate": 9.3873417721519e-06, "loss": 0.054538704454898834, "num_input_tokens_seen": 1981128, "step": 1054, "train_runtime": 3184.9272, "train_tokens_per_second": 622.032 }, { "epoch": 1.0657063431892848, "grad_norm": 3.484403133392334, "learning_rate": 9.37721518987342e-06, "loss": 0.0736357644200325, "num_input_tokens_seen": 1983712, "step": 1055, "train_runtime": 3187.3684, "train_tokens_per_second": 622.367 }, { "epoch": 1.0667172100075815, "grad_norm": 1.5456719398498535, "learning_rate": 9.367088607594937e-06, "loss": 0.04635040834546089, "num_input_tokens_seen": 1985418, "step": 1056, "train_runtime": 3189.6463, "train_tokens_per_second": 622.457 }, { "epoch": 1.0677280768258781, "grad_norm": 1.1814062595367432, "learning_rate": 9.356962025316456e-06, "loss": 0.06225111335515976, "num_input_tokens_seen": 1987526, "step": 1057, "train_runtime": 3192.012, "train_tokens_per_second": 622.656 }, { "epoch": 1.068738943644175, "grad_norm": 1.2772281169891357, "learning_rate": 9.346835443037977e-06, "loss": 0.04973405972123146, "num_input_tokens_seen": 1989352, "step": 1058, "train_runtime": 3194.2846, "train_tokens_per_second": 622.785 }, { "epoch": 1.0697498104624716, "grad_norm": 1.4468482732772827, "learning_rate": 9.336708860759494e-06, "loss": 0.06707950681447983, "num_input_tokens_seen": 1991022, "step": 1059, "train_runtime": 3196.4927, "train_tokens_per_second": 622.877 }, { "epoch": 1.0707606772807683, "grad_norm": 1.2882323265075684, "learning_rate": 9.326582278481013e-06, "loss": 0.06885062903165817, "num_input_tokens_seen": 1992680, "step": 1060, "train_runtime": 3198.7043, "train_tokens_per_second": 622.965 }, { "epoch": 1.071771544099065, "grad_norm": 1.5417802333831787, "learning_rate": 9.316455696202532e-06, "loss": 0.06702878326177597, "num_input_tokens_seen": 1995068, "step": 1061, "train_runtime": 3201.3821, "train_tokens_per_second": 623.19 }, { "epoch": 1.0727824109173616, "grad_norm": 1.1460639238357544, "learning_rate": 9.306329113924051e-06, "loss": 0.05765167623758316, "num_input_tokens_seen": 1996926, "step": 1062, "train_runtime": 3203.7526, "train_tokens_per_second": 623.308 }, { "epoch": 1.0737932777356582, "grad_norm": 1.452125906944275, "learning_rate": 9.29620253164557e-06, "loss": 0.0469055250287056, "num_input_tokens_seen": 1998294, "step": 1063, "train_runtime": 3205.8998, "train_tokens_per_second": 623.318 }, { "epoch": 1.074804144553955, "grad_norm": 1.635292649269104, "learning_rate": 9.28607594936709e-06, "loss": 0.07289348542690277, "num_input_tokens_seen": 2000332, "step": 1064, "train_runtime": 3208.1716, "train_tokens_per_second": 623.512 }, { "epoch": 1.0758150113722518, "grad_norm": 1.4546730518341064, "learning_rate": 9.275949367088609e-06, "loss": 0.06234751641750336, "num_input_tokens_seen": 2002028, "step": 1065, "train_runtime": 3210.3387, "train_tokens_per_second": 623.619 }, { "epoch": 1.0768258781905484, "grad_norm": 1.0785565376281738, "learning_rate": 9.265822784810128e-06, "loss": 0.05137242004275322, "num_input_tokens_seen": 2004148, "step": 1066, "train_runtime": 3212.6724, "train_tokens_per_second": 623.826 }, { "epoch": 1.077836745008845, "grad_norm": 1.1812286376953125, "learning_rate": 9.255696202531647e-06, "loss": 0.05945739522576332, "num_input_tokens_seen": 2006290, "step": 1067, "train_runtime": 3214.9667, "train_tokens_per_second": 624.047 }, { "epoch": 1.0788476118271417, "grad_norm": 1.445425033569336, "learning_rate": 9.245569620253166e-06, "loss": 0.05825085937976837, "num_input_tokens_seen": 2008128, "step": 1068, "train_runtime": 3217.1989, "train_tokens_per_second": 624.185 }, { "epoch": 1.0798584786454384, "grad_norm": 1.2002581357955933, "learning_rate": 9.235443037974683e-06, "loss": 0.05513761565089226, "num_input_tokens_seen": 2010360, "step": 1069, "train_runtime": 3219.5556, "train_tokens_per_second": 624.422 }, { "epoch": 1.0808693454637353, "grad_norm": 1.1316932439804077, "learning_rate": 9.225316455696204e-06, "loss": 0.05086222290992737, "num_input_tokens_seen": 2012614, "step": 1070, "train_runtime": 3221.8849, "train_tokens_per_second": 624.67 }, { "epoch": 1.081880212282032, "grad_norm": 1.5588624477386475, "learning_rate": 9.215189873417723e-06, "loss": 0.05340712144970894, "num_input_tokens_seen": 2014350, "step": 1071, "train_runtime": 3224.1143, "train_tokens_per_second": 624.776 }, { "epoch": 1.0828910791003286, "grad_norm": 1.281995177268982, "learning_rate": 9.20506329113924e-06, "loss": 0.06859094649553299, "num_input_tokens_seen": 2016280, "step": 1072, "train_runtime": 3226.3736, "train_tokens_per_second": 624.937 }, { "epoch": 1.0839019459186252, "grad_norm": 1.3881559371948242, "learning_rate": 9.19493670886076e-06, "loss": 0.06530670821666718, "num_input_tokens_seen": 2018160, "step": 1073, "train_runtime": 3228.5993, "train_tokens_per_second": 625.088 }, { "epoch": 1.0849128127369219, "grad_norm": 1.2683074474334717, "learning_rate": 9.18481012658228e-06, "loss": 0.0578412264585495, "num_input_tokens_seen": 2020416, "step": 1074, "train_runtime": 3230.959, "train_tokens_per_second": 625.33 }, { "epoch": 1.0859236795552185, "grad_norm": 1.052309274673462, "learning_rate": 9.174683544303798e-06, "loss": 0.059152744710445404, "num_input_tokens_seen": 2022348, "step": 1075, "train_runtime": 3233.2263, "train_tokens_per_second": 625.489 }, { "epoch": 1.0869345463735154, "grad_norm": 1.2832680940628052, "learning_rate": 9.164556962025317e-06, "loss": 0.05791567265987396, "num_input_tokens_seen": 2024030, "step": 1076, "train_runtime": 3235.4212, "train_tokens_per_second": 625.585 }, { "epoch": 1.087945413191812, "grad_norm": 1.4182716608047485, "learning_rate": 9.154430379746836e-06, "loss": 0.06937595456838608, "num_input_tokens_seen": 2025526, "step": 1077, "train_runtime": 3237.5638, "train_tokens_per_second": 625.633 }, { "epoch": 1.0889562800101087, "grad_norm": 1.2201087474822998, "learning_rate": 9.144303797468355e-06, "loss": 0.05016665160655975, "num_input_tokens_seen": 2027310, "step": 1078, "train_runtime": 3239.8149, "train_tokens_per_second": 625.749 }, { "epoch": 1.0899671468284053, "grad_norm": 1.0213748216629028, "learning_rate": 9.134177215189874e-06, "loss": 0.045126307755708694, "num_input_tokens_seen": 2029130, "step": 1079, "train_runtime": 3242.0877, "train_tokens_per_second": 625.871 }, { "epoch": 1.090978013646702, "grad_norm": 1.107077956199646, "learning_rate": 9.124050632911393e-06, "loss": 0.05676788091659546, "num_input_tokens_seen": 2031392, "step": 1080, "train_runtime": 3244.453, "train_tokens_per_second": 626.112 }, { "epoch": 1.0919888804649986, "grad_norm": 1.2918614149093628, "learning_rate": 9.113924050632912e-06, "loss": 0.06851403415203094, "num_input_tokens_seen": 2033048, "step": 1081, "train_runtime": 3258.8928, "train_tokens_per_second": 623.846 }, { "epoch": 1.0929997472832955, "grad_norm": 0.9818199276924133, "learning_rate": 9.103797468354431e-06, "loss": 0.047627776861190796, "num_input_tokens_seen": 2034860, "step": 1082, "train_runtime": 3261.1933, "train_tokens_per_second": 623.962 }, { "epoch": 1.0940106141015922, "grad_norm": 1.2099056243896484, "learning_rate": 9.09367088607595e-06, "loss": 0.04850488528609276, "num_input_tokens_seen": 2036578, "step": 1083, "train_runtime": 3263.4922, "train_tokens_per_second": 624.049 }, { "epoch": 1.0950214809198888, "grad_norm": 1.2491371631622314, "learning_rate": 9.08354430379747e-06, "loss": 0.04796820878982544, "num_input_tokens_seen": 2038364, "step": 1084, "train_runtime": 3265.7635, "train_tokens_per_second": 624.162 }, { "epoch": 1.0960323477381855, "grad_norm": 0.9802494049072266, "learning_rate": 9.073417721518989e-06, "loss": 0.033174172043800354, "num_input_tokens_seen": 2040330, "step": 1085, "train_runtime": 3268.1811, "train_tokens_per_second": 624.301 }, { "epoch": 1.0970432145564821, "grad_norm": 1.0527691841125488, "learning_rate": 9.063291139240506e-06, "loss": 0.03538256138563156, "num_input_tokens_seen": 2042242, "step": 1086, "train_runtime": 3270.5916, "train_tokens_per_second": 624.426 }, { "epoch": 1.0980540813747788, "grad_norm": 1.4610166549682617, "learning_rate": 9.053164556962027e-06, "loss": 0.06688831746578217, "num_input_tokens_seen": 2044062, "step": 1087, "train_runtime": 3272.8711, "train_tokens_per_second": 624.547 }, { "epoch": 1.0990649481930757, "grad_norm": 1.2289828062057495, "learning_rate": 9.043037974683546e-06, "loss": 0.05300654470920563, "num_input_tokens_seen": 2045578, "step": 1088, "train_runtime": 3275.0406, "train_tokens_per_second": 624.596 }, { "epoch": 1.1000758150113723, "grad_norm": 1.2802950143814087, "learning_rate": 9.032911392405063e-06, "loss": 0.05777037516236305, "num_input_tokens_seen": 2047120, "step": 1089, "train_runtime": 3277.2231, "train_tokens_per_second": 624.651 }, { "epoch": 1.101086681829669, "grad_norm": 1.4316028356552124, "learning_rate": 9.022784810126582e-06, "loss": 0.06609408557415009, "num_input_tokens_seen": 2048692, "step": 1090, "train_runtime": 3279.3916, "train_tokens_per_second": 624.717 }, { "epoch": 1.1020975486479656, "grad_norm": 1.4526844024658203, "learning_rate": 9.012658227848103e-06, "loss": 0.0704093649983406, "num_input_tokens_seen": 2050836, "step": 1091, "train_runtime": 3281.6971, "train_tokens_per_second": 624.932 }, { "epoch": 1.1031084154662623, "grad_norm": 1.185599684715271, "learning_rate": 9.00253164556962e-06, "loss": 0.08056314289569855, "num_input_tokens_seen": 2052972, "step": 1092, "train_runtime": 3284.0631, "train_tokens_per_second": 625.132 }, { "epoch": 1.104119282284559, "grad_norm": 1.4482617378234863, "learning_rate": 8.99240506329114e-06, "loss": 0.052174363285303116, "num_input_tokens_seen": 2055178, "step": 1093, "train_runtime": 3286.4338, "train_tokens_per_second": 625.352 }, { "epoch": 1.1051301491028558, "grad_norm": 1.218012809753418, "learning_rate": 8.982278481012659e-06, "loss": 0.06104224920272827, "num_input_tokens_seen": 2056806, "step": 1094, "train_runtime": 3288.6456, "train_tokens_per_second": 625.426 }, { "epoch": 1.1061410159211524, "grad_norm": 1.0124777555465698, "learning_rate": 8.972151898734178e-06, "loss": 0.04813598096370697, "num_input_tokens_seen": 2059252, "step": 1095, "train_runtime": 3291.0474, "train_tokens_per_second": 625.713 }, { "epoch": 1.107151882739449, "grad_norm": 0.9334543943405151, "learning_rate": 8.962025316455697e-06, "loss": 0.03611904755234718, "num_input_tokens_seen": 2061036, "step": 1096, "train_runtime": 3293.2934, "train_tokens_per_second": 625.828 }, { "epoch": 1.1081627495577457, "grad_norm": 1.174657940864563, "learning_rate": 8.951898734177216e-06, "loss": 0.05326293408870697, "num_input_tokens_seen": 2063098, "step": 1097, "train_runtime": 3295.5584, "train_tokens_per_second": 626.024 }, { "epoch": 1.1091736163760424, "grad_norm": 1.4373377561569214, "learning_rate": 8.941772151898735e-06, "loss": 0.07180237025022507, "num_input_tokens_seen": 2065018, "step": 1098, "train_runtime": 3297.8642, "train_tokens_per_second": 626.168 }, { "epoch": 1.110184483194339, "grad_norm": 1.0424410104751587, "learning_rate": 8.931645569620254e-06, "loss": 0.0501631423830986, "num_input_tokens_seen": 2067042, "step": 1099, "train_runtime": 3300.125, "train_tokens_per_second": 626.353 }, { "epoch": 1.111195350012636, "grad_norm": 1.1881895065307617, "learning_rate": 8.921518987341773e-06, "loss": 0.05463118851184845, "num_input_tokens_seen": 2068762, "step": 1100, "train_runtime": 3302.376, "train_tokens_per_second": 626.447 }, { "epoch": 1.1122062168309326, "grad_norm": 1.6544052362442017, "learning_rate": 8.911392405063292e-06, "loss": 0.06034505367279053, "num_input_tokens_seen": 2070476, "step": 1101, "train_runtime": 3304.6072, "train_tokens_per_second": 626.542 }, { "epoch": 1.1132170836492292, "grad_norm": 1.0974977016448975, "learning_rate": 8.90126582278481e-06, "loss": 0.05488116666674614, "num_input_tokens_seen": 2072284, "step": 1102, "train_runtime": 3306.8385, "train_tokens_per_second": 626.666 }, { "epoch": 1.1142279504675259, "grad_norm": 1.380908727645874, "learning_rate": 8.89113924050633e-06, "loss": 0.053319301456213, "num_input_tokens_seen": 2074296, "step": 1103, "train_runtime": 3309.183, "train_tokens_per_second": 626.83 }, { "epoch": 1.1152388172858225, "grad_norm": 1.1827045679092407, "learning_rate": 8.88101265822785e-06, "loss": 0.045568160712718964, "num_input_tokens_seen": 2076596, "step": 1104, "train_runtime": 3311.5583, "train_tokens_per_second": 627.075 }, { "epoch": 1.1162496841041194, "grad_norm": 1.226758599281311, "learning_rate": 8.870886075949367e-06, "loss": 0.0543665811419487, "num_input_tokens_seen": 2078276, "step": 1105, "train_runtime": 3313.7593, "train_tokens_per_second": 627.166 }, { "epoch": 1.117260550922416, "grad_norm": 1.2752267122268677, "learning_rate": 8.860759493670886e-06, "loss": 0.06291696429252625, "num_input_tokens_seen": 2080060, "step": 1106, "train_runtime": 3315.9981, "train_tokens_per_second": 627.28 }, { "epoch": 1.1182714177407127, "grad_norm": 1.2787002325057983, "learning_rate": 8.850632911392407e-06, "loss": 0.0689842626452446, "num_input_tokens_seen": 2082446, "step": 1107, "train_runtime": 3318.3661, "train_tokens_per_second": 627.552 }, { "epoch": 1.1192822845590094, "grad_norm": 1.2914907932281494, "learning_rate": 8.840506329113924e-06, "loss": 0.052648428827524185, "num_input_tokens_seen": 2083832, "step": 1108, "train_runtime": 3320.5176, "train_tokens_per_second": 627.562 }, { "epoch": 1.120293151377306, "grad_norm": 1.1470319032669067, "learning_rate": 8.830379746835443e-06, "loss": 0.0601373016834259, "num_input_tokens_seen": 2086060, "step": 1109, "train_runtime": 3322.8417, "train_tokens_per_second": 627.794 }, { "epoch": 1.1213040181956027, "grad_norm": 1.1858102083206177, "learning_rate": 8.820253164556962e-06, "loss": 0.03755956143140793, "num_input_tokens_seen": 2087998, "step": 1110, "train_runtime": 3325.106, "train_tokens_per_second": 627.949 }, { "epoch": 1.1223148850138993, "grad_norm": 1.2062602043151855, "learning_rate": 8.810126582278481e-06, "loss": 0.05221632495522499, "num_input_tokens_seen": 2090364, "step": 1111, "train_runtime": 3341.8286, "train_tokens_per_second": 625.515 }, { "epoch": 1.1233257518321962, "grad_norm": 0.9900615811347961, "learning_rate": 8.8e-06, "loss": 0.039271071553230286, "num_input_tokens_seen": 2092166, "step": 1112, "train_runtime": 3344.0715, "train_tokens_per_second": 625.634 }, { "epoch": 1.1243366186504928, "grad_norm": 1.0736415386199951, "learning_rate": 8.78987341772152e-06, "loss": 0.048174936324357986, "num_input_tokens_seen": 2094464, "step": 1113, "train_runtime": 3346.4141, "train_tokens_per_second": 625.883 }, { "epoch": 1.1253474854687895, "grad_norm": 1.6410328149795532, "learning_rate": 8.779746835443039e-06, "loss": 0.11351293325424194, "num_input_tokens_seen": 2096704, "step": 1114, "train_runtime": 3348.8682, "train_tokens_per_second": 626.093 }, { "epoch": 1.1263583522870861, "grad_norm": 1.3577684164047241, "learning_rate": 8.769620253164558e-06, "loss": 0.06730435788631439, "num_input_tokens_seen": 2098626, "step": 1115, "train_runtime": 3351.1424, "train_tokens_per_second": 626.242 }, { "epoch": 1.1273692191053828, "grad_norm": 1.2522841691970825, "learning_rate": 8.759493670886077e-06, "loss": 0.06695160269737244, "num_input_tokens_seen": 2100258, "step": 1116, "train_runtime": 3353.3985, "train_tokens_per_second": 626.307 }, { "epoch": 1.1283800859236797, "grad_norm": 1.22892427444458, "learning_rate": 8.749367088607596e-06, "loss": 0.05180026963353157, "num_input_tokens_seen": 2102152, "step": 1117, "train_runtime": 3355.6891, "train_tokens_per_second": 626.444 }, { "epoch": 1.1293909527419763, "grad_norm": 1.385102391242981, "learning_rate": 8.739240506329115e-06, "loss": 0.08410146832466125, "num_input_tokens_seen": 2104124, "step": 1118, "train_runtime": 3358.0609, "train_tokens_per_second": 626.589 }, { "epoch": 1.130401819560273, "grad_norm": 1.1967195272445679, "learning_rate": 8.729113924050634e-06, "loss": 0.0709337592124939, "num_input_tokens_seen": 2106328, "step": 1119, "train_runtime": 3360.4864, "train_tokens_per_second": 626.793 }, { "epoch": 1.1314126863785696, "grad_norm": 1.071784496307373, "learning_rate": 8.718987341772153e-06, "loss": 0.05565584823489189, "num_input_tokens_seen": 2108402, "step": 1120, "train_runtime": 3362.8, "train_tokens_per_second": 626.978 }, { "epoch": 1.1324235531968663, "grad_norm": 1.5142130851745605, "learning_rate": 8.708860759493672e-06, "loss": 0.05373769253492355, "num_input_tokens_seen": 2110132, "step": 1121, "train_runtime": 3365.1115, "train_tokens_per_second": 627.062 }, { "epoch": 1.133434420015163, "grad_norm": 0.9879475235939026, "learning_rate": 8.69873417721519e-06, "loss": 0.051886241883039474, "num_input_tokens_seen": 2112090, "step": 1122, "train_runtime": 3367.423, "train_tokens_per_second": 627.213 }, { "epoch": 1.1344452868334596, "grad_norm": 1.239451289176941, "learning_rate": 8.68860759493671e-06, "loss": 0.05598483979701996, "num_input_tokens_seen": 2113744, "step": 1123, "train_runtime": 3369.6472, "train_tokens_per_second": 627.289 }, { "epoch": 1.1354561536517565, "grad_norm": 1.5516914129257202, "learning_rate": 8.67848101265823e-06, "loss": 0.07529913634061813, "num_input_tokens_seen": 2115786, "step": 1124, "train_runtime": 3372.0645, "train_tokens_per_second": 627.445 }, { "epoch": 1.136467020470053, "grad_norm": 1.0989845991134644, "learning_rate": 8.668354430379747e-06, "loss": 0.04982699081301689, "num_input_tokens_seen": 2117714, "step": 1125, "train_runtime": 3374.3774, "train_tokens_per_second": 627.587 }, { "epoch": 1.1374778872883498, "grad_norm": 1.6945449113845825, "learning_rate": 8.658227848101266e-06, "loss": 0.07149287313222885, "num_input_tokens_seen": 2119428, "step": 1126, "train_runtime": 3376.5955, "train_tokens_per_second": 627.682 }, { "epoch": 1.1384887541066464, "grad_norm": 1.6831201314926147, "learning_rate": 8.648101265822785e-06, "loss": 0.07772374153137207, "num_input_tokens_seen": 2121072, "step": 1127, "train_runtime": 3378.842, "train_tokens_per_second": 627.751 }, { "epoch": 1.139499620924943, "grad_norm": 1.1811333894729614, "learning_rate": 8.637974683544304e-06, "loss": 0.0715109333395958, "num_input_tokens_seen": 2123588, "step": 1128, "train_runtime": 3381.2699, "train_tokens_per_second": 628.045 }, { "epoch": 1.14051048774324, "grad_norm": 0.9881759881973267, "learning_rate": 8.627848101265823e-06, "loss": 0.04984269291162491, "num_input_tokens_seen": 2125496, "step": 1129, "train_runtime": 3383.5601, "train_tokens_per_second": 628.183 }, { "epoch": 1.1415213545615366, "grad_norm": 1.1169991493225098, "learning_rate": 8.617721518987342e-06, "loss": 0.047656506299972534, "num_input_tokens_seen": 2127294, "step": 1130, "train_runtime": 3385.8155, "train_tokens_per_second": 628.296 }, { "epoch": 1.1425322213798332, "grad_norm": 1.1157288551330566, "learning_rate": 8.607594936708861e-06, "loss": 0.0789991095662117, "num_input_tokens_seen": 2130054, "step": 1131, "train_runtime": 3388.3242, "train_tokens_per_second": 628.645 }, { "epoch": 1.1435430881981299, "grad_norm": 1.2771586179733276, "learning_rate": 8.59746835443038e-06, "loss": 0.07300856709480286, "num_input_tokens_seen": 2131806, "step": 1132, "train_runtime": 3390.5449, "train_tokens_per_second": 628.75 }, { "epoch": 1.1445539550164265, "grad_norm": 1.3346760272979736, "learning_rate": 8.5873417721519e-06, "loss": 0.052616190165281296, "num_input_tokens_seen": 2133332, "step": 1133, "train_runtime": 3392.7349, "train_tokens_per_second": 628.794 }, { "epoch": 1.1455648218347232, "grad_norm": 1.368011713027954, "learning_rate": 8.577215189873419e-06, "loss": 0.06489899754524231, "num_input_tokens_seen": 2134852, "step": 1134, "train_runtime": 3394.9329, "train_tokens_per_second": 628.835 }, { "epoch": 1.1465756886530198, "grad_norm": 1.4414085149765015, "learning_rate": 8.567088607594938e-06, "loss": 0.0653754249215126, "num_input_tokens_seen": 2136526, "step": 1135, "train_runtime": 3397.1582, "train_tokens_per_second": 628.916 }, { "epoch": 1.1475865554713167, "grad_norm": 1.2470828294754028, "learning_rate": 8.556962025316457e-06, "loss": 0.06085464730858803, "num_input_tokens_seen": 2138368, "step": 1136, "train_runtime": 3399.4507, "train_tokens_per_second": 629.033 }, { "epoch": 1.1485974222896134, "grad_norm": 1.3528227806091309, "learning_rate": 8.546835443037976e-06, "loss": 0.07301013171672821, "num_input_tokens_seen": 2140978, "step": 1137, "train_runtime": 3401.93, "train_tokens_per_second": 629.342 }, { "epoch": 1.14960828910791, "grad_norm": 1.1700470447540283, "learning_rate": 8.536708860759493e-06, "loss": 0.053934965282678604, "num_input_tokens_seen": 2143190, "step": 1138, "train_runtime": 3404.3181, "train_tokens_per_second": 629.55 }, { "epoch": 1.1506191559262067, "grad_norm": 1.2100038528442383, "learning_rate": 8.526582278481014e-06, "loss": 0.041298866271972656, "num_input_tokens_seen": 2144560, "step": 1139, "train_runtime": 3406.4386, "train_tokens_per_second": 629.561 }, { "epoch": 1.1516300227445033, "grad_norm": 1.1575100421905518, "learning_rate": 8.516455696202533e-06, "loss": 0.04897582158446312, "num_input_tokens_seen": 2146132, "step": 1140, "train_runtime": 3408.6236, "train_tokens_per_second": 629.618 }, { "epoch": 1.1526408895628002, "grad_norm": 1.4517966508865356, "learning_rate": 8.50632911392405e-06, "loss": 0.0664825588464737, "num_input_tokens_seen": 2148060, "step": 1141, "train_runtime": 3424.7222, "train_tokens_per_second": 627.222 }, { "epoch": 1.1536517563810968, "grad_norm": 1.500447392463684, "learning_rate": 8.49620253164557e-06, "loss": 0.07931496202945709, "num_input_tokens_seen": 2149560, "step": 1142, "train_runtime": 3426.8771, "train_tokens_per_second": 627.265 }, { "epoch": 1.1546626231993935, "grad_norm": 1.2216112613677979, "learning_rate": 8.48607594936709e-06, "loss": 0.05845990031957626, "num_input_tokens_seen": 2151656, "step": 1143, "train_runtime": 3429.222, "train_tokens_per_second": 627.447 }, { "epoch": 1.1556734900176902, "grad_norm": 1.1007955074310303, "learning_rate": 8.475949367088608e-06, "loss": 0.04873022064566612, "num_input_tokens_seen": 2153778, "step": 1144, "train_runtime": 3431.5552, "train_tokens_per_second": 627.639 }, { "epoch": 1.1566843568359868, "grad_norm": 1.0702317953109741, "learning_rate": 8.465822784810127e-06, "loss": 0.04530014470219612, "num_input_tokens_seen": 2156104, "step": 1145, "train_runtime": 3433.9013, "train_tokens_per_second": 627.888 }, { "epoch": 1.1576952236542835, "grad_norm": 1.0356625318527222, "learning_rate": 8.455696202531646e-06, "loss": 0.048252686858177185, "num_input_tokens_seen": 2158052, "step": 1146, "train_runtime": 3436.1734, "train_tokens_per_second": 628.039 }, { "epoch": 1.1587060904725803, "grad_norm": 1.275313377380371, "learning_rate": 8.445569620253165e-06, "loss": 0.06277644634246826, "num_input_tokens_seen": 2159532, "step": 1147, "train_runtime": 3438.3302, "train_tokens_per_second": 628.076 }, { "epoch": 1.159716957290877, "grad_norm": 1.675642967224121, "learning_rate": 8.435443037974684e-06, "loss": 0.08211557567119598, "num_input_tokens_seen": 2161148, "step": 1148, "train_runtime": 3440.5232, "train_tokens_per_second": 628.145 }, { "epoch": 1.1607278241091736, "grad_norm": 1.333276629447937, "learning_rate": 8.425316455696203e-06, "loss": 0.05804230272769928, "num_input_tokens_seen": 2163152, "step": 1149, "train_runtime": 3442.8351, "train_tokens_per_second": 628.305 }, { "epoch": 1.1617386909274703, "grad_norm": 1.1461790800094604, "learning_rate": 8.415189873417722e-06, "loss": 0.04971778392791748, "num_input_tokens_seen": 2165346, "step": 1150, "train_runtime": 3445.1913, "train_tokens_per_second": 628.513 }, { "epoch": 1.162749557745767, "grad_norm": 1.3544596433639526, "learning_rate": 8.405063291139241e-06, "loss": 0.06081068515777588, "num_input_tokens_seen": 2167748, "step": 1151, "train_runtime": 3447.6256, "train_tokens_per_second": 628.765 }, { "epoch": 1.1637604245640636, "grad_norm": 1.0783390998840332, "learning_rate": 8.39493670886076e-06, "loss": 0.0675191655755043, "num_input_tokens_seen": 2169900, "step": 1152, "train_runtime": 3450.0377, "train_tokens_per_second": 628.95 }, { "epoch": 1.1647712913823605, "grad_norm": 1.427892804145813, "learning_rate": 8.38481012658228e-06, "loss": 0.06211494281888008, "num_input_tokens_seen": 2171650, "step": 1153, "train_runtime": 3452.3415, "train_tokens_per_second": 629.037 }, { "epoch": 1.1657821582006571, "grad_norm": 1.1272474527359009, "learning_rate": 8.374683544303797e-06, "loss": 0.04372329264879227, "num_input_tokens_seen": 2173872, "step": 1154, "train_runtime": 3454.71, "train_tokens_per_second": 629.249 }, { "epoch": 1.1667930250189538, "grad_norm": 1.1589261293411255, "learning_rate": 8.364556962025318e-06, "loss": 0.036889009177684784, "num_input_tokens_seen": 2175528, "step": 1155, "train_runtime": 3456.9587, "train_tokens_per_second": 629.318 }, { "epoch": 1.1678038918372504, "grad_norm": 1.3673213720321655, "learning_rate": 8.354430379746837e-06, "loss": 0.05929093807935715, "num_input_tokens_seen": 2177430, "step": 1156, "train_runtime": 3459.2146, "train_tokens_per_second": 629.458 }, { "epoch": 1.168814758655547, "grad_norm": 1.4972892999649048, "learning_rate": 8.344303797468354e-06, "loss": 0.052913933992385864, "num_input_tokens_seen": 2178862, "step": 1157, "train_runtime": 3461.3917, "train_tokens_per_second": 629.476 }, { "epoch": 1.1698256254738437, "grad_norm": 1.1993151903152466, "learning_rate": 8.334177215189873e-06, "loss": 0.05444449186325073, "num_input_tokens_seen": 2180700, "step": 1158, "train_runtime": 3463.6655, "train_tokens_per_second": 629.593 }, { "epoch": 1.1708364922921406, "grad_norm": 1.5625636577606201, "learning_rate": 8.324050632911394e-06, "loss": 0.07694568485021591, "num_input_tokens_seen": 2182790, "step": 1159, "train_runtime": 3465.9798, "train_tokens_per_second": 629.776 }, { "epoch": 1.1718473591104372, "grad_norm": 1.707200050354004, "learning_rate": 8.313924050632911e-06, "loss": 0.10209743678569794, "num_input_tokens_seen": 2184616, "step": 1160, "train_runtime": 3468.2923, "train_tokens_per_second": 629.882 }, { "epoch": 1.172858225928734, "grad_norm": 1.5268076658248901, "learning_rate": 8.30379746835443e-06, "loss": 0.06384491175413132, "num_input_tokens_seen": 2186642, "step": 1161, "train_runtime": 3470.6357, "train_tokens_per_second": 630.041 }, { "epoch": 1.1738690927470306, "grad_norm": 1.423162579536438, "learning_rate": 8.29367088607595e-06, "loss": 0.0545058473944664, "num_input_tokens_seen": 2188852, "step": 1162, "train_runtime": 3473.0832, "train_tokens_per_second": 630.233 }, { "epoch": 1.1748799595653272, "grad_norm": 1.1817657947540283, "learning_rate": 8.283544303797469e-06, "loss": 0.06416331231594086, "num_input_tokens_seen": 2190730, "step": 1163, "train_runtime": 3475.4334, "train_tokens_per_second": 630.347 }, { "epoch": 1.175890826383624, "grad_norm": 1.054011583328247, "learning_rate": 8.273417721518988e-06, "loss": 0.03909891098737717, "num_input_tokens_seen": 2192420, "step": 1164, "train_runtime": 3477.6456, "train_tokens_per_second": 630.432 }, { "epoch": 1.1769016932019207, "grad_norm": 1.0762697458267212, "learning_rate": 8.263291139240507e-06, "loss": 0.03878183290362358, "num_input_tokens_seen": 2194292, "step": 1165, "train_runtime": 3479.9587, "train_tokens_per_second": 630.551 }, { "epoch": 1.1779125600202174, "grad_norm": 0.9733167290687561, "learning_rate": 8.253164556962026e-06, "loss": 0.03576451539993286, "num_input_tokens_seen": 2196356, "step": 1166, "train_runtime": 3482.3145, "train_tokens_per_second": 630.717 }, { "epoch": 1.178923426838514, "grad_norm": 1.3922288417816162, "learning_rate": 8.243037974683545e-06, "loss": 0.07775457203388214, "num_input_tokens_seen": 2198536, "step": 1167, "train_runtime": 3484.6529, "train_tokens_per_second": 630.92 }, { "epoch": 1.1799342936568107, "grad_norm": 1.4985376596450806, "learning_rate": 8.232911392405064e-06, "loss": 0.06136911362409592, "num_input_tokens_seen": 2200490, "step": 1168, "train_runtime": 3486.9543, "train_tokens_per_second": 631.064 }, { "epoch": 1.1809451604751073, "grad_norm": 1.588498592376709, "learning_rate": 8.222784810126583e-06, "loss": 0.05329131707549095, "num_input_tokens_seen": 2202402, "step": 1169, "train_runtime": 3489.2492, "train_tokens_per_second": 631.197 }, { "epoch": 1.181956027293404, "grad_norm": 1.248744010925293, "learning_rate": 8.212658227848102e-06, "loss": 0.043204858899116516, "num_input_tokens_seen": 2204174, "step": 1170, "train_runtime": 3491.4847, "train_tokens_per_second": 631.3 }, { "epoch": 1.1829668941117009, "grad_norm": 1.2362407445907593, "learning_rate": 8.202531645569621e-06, "loss": 0.055201996117830276, "num_input_tokens_seen": 2206006, "step": 1171, "train_runtime": 3508.0583, "train_tokens_per_second": 628.84 }, { "epoch": 1.1839777609299975, "grad_norm": 1.1224781274795532, "learning_rate": 8.19240506329114e-06, "loss": 0.05462568625807762, "num_input_tokens_seen": 2207678, "step": 1172, "train_runtime": 3510.2786, "train_tokens_per_second": 628.918 }, { "epoch": 1.1849886277482942, "grad_norm": 1.4427181482315063, "learning_rate": 8.18227848101266e-06, "loss": 0.055276695638895035, "num_input_tokens_seen": 2209704, "step": 1173, "train_runtime": 3512.5815, "train_tokens_per_second": 629.083 }, { "epoch": 1.1859994945665908, "grad_norm": 1.1946271657943726, "learning_rate": 8.172151898734177e-06, "loss": 0.05866575613617897, "num_input_tokens_seen": 2211704, "step": 1174, "train_runtime": 3514.9645, "train_tokens_per_second": 629.225 }, { "epoch": 1.1870103613848875, "grad_norm": 1.156442642211914, "learning_rate": 8.162025316455698e-06, "loss": 0.059589408338069916, "num_input_tokens_seen": 2213624, "step": 1175, "train_runtime": 3517.2364, "train_tokens_per_second": 629.365 }, { "epoch": 1.1880212282031843, "grad_norm": 1.233392596244812, "learning_rate": 8.151898734177217e-06, "loss": 0.06653599441051483, "num_input_tokens_seen": 2215790, "step": 1176, "train_runtime": 3519.5687, "train_tokens_per_second": 629.563 }, { "epoch": 1.189032095021481, "grad_norm": 1.1985082626342773, "learning_rate": 8.141772151898734e-06, "loss": 0.06252250075340271, "num_input_tokens_seen": 2217462, "step": 1177, "train_runtime": 3521.7911, "train_tokens_per_second": 629.64 }, { "epoch": 1.1900429618397776, "grad_norm": 1.437553882598877, "learning_rate": 8.131645569620253e-06, "loss": 0.07226981222629547, "num_input_tokens_seen": 2219292, "step": 1178, "train_runtime": 3524.0288, "train_tokens_per_second": 629.76 }, { "epoch": 1.1910538286580743, "grad_norm": 1.4563100337982178, "learning_rate": 8.121518987341774e-06, "loss": 0.0649099051952362, "num_input_tokens_seen": 2221190, "step": 1179, "train_runtime": 3526.3067, "train_tokens_per_second": 629.891 }, { "epoch": 1.192064695476371, "grad_norm": 1.53696608543396, "learning_rate": 8.111392405063291e-06, "loss": 0.08135532587766647, "num_input_tokens_seen": 2223196, "step": 1180, "train_runtime": 3528.6214, "train_tokens_per_second": 630.047 }, { "epoch": 1.1930755622946676, "grad_norm": 1.2576117515563965, "learning_rate": 8.10126582278481e-06, "loss": 0.055172935128211975, "num_input_tokens_seen": 2224970, "step": 1181, "train_runtime": 3530.8656, "train_tokens_per_second": 630.149 }, { "epoch": 1.1940864291129643, "grad_norm": 1.5804694890975952, "learning_rate": 8.09113924050633e-06, "loss": 0.07707778364419937, "num_input_tokens_seen": 2227122, "step": 1182, "train_runtime": 3533.176, "train_tokens_per_second": 630.346 }, { "epoch": 1.1950972959312611, "grad_norm": 1.2614355087280273, "learning_rate": 8.081012658227849e-06, "loss": 0.042505331337451935, "num_input_tokens_seen": 2229118, "step": 1183, "train_runtime": 3535.4597, "train_tokens_per_second": 630.503 }, { "epoch": 1.1961081627495578, "grad_norm": 1.6972736120224, "learning_rate": 8.070886075949368e-06, "loss": 0.05081099644303322, "num_input_tokens_seen": 2230492, "step": 1184, "train_runtime": 3537.5771, "train_tokens_per_second": 630.514 }, { "epoch": 1.1971190295678544, "grad_norm": 1.3364206552505493, "learning_rate": 8.060759493670887e-06, "loss": 0.05734006687998772, "num_input_tokens_seen": 2232598, "step": 1185, "train_runtime": 3539.9292, "train_tokens_per_second": 630.69 }, { "epoch": 1.198129896386151, "grad_norm": 1.1175353527069092, "learning_rate": 8.050632911392406e-06, "loss": 0.042109165340662, "num_input_tokens_seen": 2234364, "step": 1186, "train_runtime": 3542.1742, "train_tokens_per_second": 630.789 }, { "epoch": 1.1991407632044477, "grad_norm": 1.4004695415496826, "learning_rate": 8.040506329113925e-06, "loss": 0.07079403102397919, "num_input_tokens_seen": 2236454, "step": 1187, "train_runtime": 3544.5006, "train_tokens_per_second": 630.964 }, { "epoch": 1.2001516300227446, "grad_norm": 1.8970848321914673, "learning_rate": 8.030379746835444e-06, "loss": 0.07711949944496155, "num_input_tokens_seen": 2237934, "step": 1188, "train_runtime": 3546.6795, "train_tokens_per_second": 630.994 }, { "epoch": 1.2001516300227446, "eval_loss": 0.3687424063682556, "eval_runtime": 54.3625, "eval_samples_per_second": 16.169, "eval_steps_per_second": 8.094, "num_input_tokens_seen": 2237934, "step": 1188 }, { "epoch": 1.2011624968410413, "grad_norm": 1.3333828449249268, "learning_rate": 8.020253164556963e-06, "loss": 0.05751827731728554, "num_input_tokens_seen": 2239668, "step": 1189, "train_runtime": 3603.3172, "train_tokens_per_second": 621.557 }, { "epoch": 1.202173363659338, "grad_norm": 0.967258632183075, "learning_rate": 8.01012658227848e-06, "loss": 0.04930635541677475, "num_input_tokens_seen": 2241998, "step": 1190, "train_runtime": 3605.7206, "train_tokens_per_second": 621.789 }, { "epoch": 1.2031842304776346, "grad_norm": 1.7901451587677002, "learning_rate": 8.000000000000001e-06, "loss": 0.06181413680315018, "num_input_tokens_seen": 2243886, "step": 1191, "train_runtime": 3607.9935, "train_tokens_per_second": 621.921 }, { "epoch": 1.2041950972959312, "grad_norm": 1.2481358051300049, "learning_rate": 7.98987341772152e-06, "loss": 0.048134684562683105, "num_input_tokens_seen": 2245630, "step": 1192, "train_runtime": 3610.2343, "train_tokens_per_second": 622.018 }, { "epoch": 1.2052059641142279, "grad_norm": 1.5724238157272339, "learning_rate": 7.979746835443038e-06, "loss": 0.07093324512243271, "num_input_tokens_seen": 2247608, "step": 1193, "train_runtime": 3612.546, "train_tokens_per_second": 622.167 }, { "epoch": 1.2062168309325245, "grad_norm": 1.4698814153671265, "learning_rate": 7.969620253164557e-06, "loss": 0.04218070209026337, "num_input_tokens_seen": 2249956, "step": 1194, "train_runtime": 3614.9292, "train_tokens_per_second": 622.407 }, { "epoch": 1.2072276977508214, "grad_norm": 1.8323177099227905, "learning_rate": 7.959493670886078e-06, "loss": 0.0682552233338356, "num_input_tokens_seen": 2251722, "step": 1195, "train_runtime": 3617.1781, "train_tokens_per_second": 622.508 }, { "epoch": 1.208238564569118, "grad_norm": 1.7569893598556519, "learning_rate": 7.949367088607595e-06, "loss": 0.07162746787071228, "num_input_tokens_seen": 2253246, "step": 1196, "train_runtime": 3619.3612, "train_tokens_per_second": 622.554 }, { "epoch": 1.2092494313874147, "grad_norm": 1.1859911680221558, "learning_rate": 7.939240506329114e-06, "loss": 0.04805188626050949, "num_input_tokens_seen": 2254870, "step": 1197, "train_runtime": 3621.5788, "train_tokens_per_second": 622.621 }, { "epoch": 1.2102602982057113, "grad_norm": 1.1672230958938599, "learning_rate": 7.929113924050633e-06, "loss": 0.047470320016145706, "num_input_tokens_seen": 2256480, "step": 1198, "train_runtime": 3623.8601, "train_tokens_per_second": 622.673 }, { "epoch": 1.211271165024008, "grad_norm": 1.3061758279800415, "learning_rate": 7.918987341772152e-06, "loss": 0.05248216167092323, "num_input_tokens_seen": 2257978, "step": 1199, "train_runtime": 3626.0217, "train_tokens_per_second": 622.715 }, { "epoch": 1.2122820318423049, "grad_norm": 1.6017221212387085, "learning_rate": 7.908860759493671e-06, "loss": 0.072176493704319, "num_input_tokens_seen": 2259402, "step": 1200, "train_runtime": 3628.1755, "train_tokens_per_second": 622.738 }, { "epoch": 1.2132928986606015, "grad_norm": 1.2543563842773438, "learning_rate": 7.89873417721519e-06, "loss": 0.050776977092027664, "num_input_tokens_seen": 2260964, "step": 1201, "train_runtime": 3644.6274, "train_tokens_per_second": 620.355 }, { "epoch": 1.2143037654788982, "grad_norm": 0.9192790389060974, "learning_rate": 7.88860759493671e-06, "loss": 0.03936336934566498, "num_input_tokens_seen": 2262478, "step": 1202, "train_runtime": 3646.8141, "train_tokens_per_second": 620.399 }, { "epoch": 1.2153146322971948, "grad_norm": 1.234483242034912, "learning_rate": 7.878481012658229e-06, "loss": 0.0455319881439209, "num_input_tokens_seen": 2263914, "step": 1203, "train_runtime": 3649.1016, "train_tokens_per_second": 620.403 }, { "epoch": 1.2163254991154915, "grad_norm": 1.1697463989257812, "learning_rate": 7.868354430379748e-06, "loss": 0.055918656289577484, "num_input_tokens_seen": 2266010, "step": 1204, "train_runtime": 3651.4805, "train_tokens_per_second": 620.573 }, { "epoch": 1.2173363659337881, "grad_norm": 1.7618815898895264, "learning_rate": 7.858227848101267e-06, "loss": 0.06636051088571548, "num_input_tokens_seen": 2267862, "step": 1205, "train_runtime": 3653.7851, "train_tokens_per_second": 620.688 }, { "epoch": 1.218347232752085, "grad_norm": 1.242294192314148, "learning_rate": 7.848101265822786e-06, "loss": 0.04812423139810562, "num_input_tokens_seen": 2269564, "step": 1206, "train_runtime": 3656.0364, "train_tokens_per_second": 620.772 }, { "epoch": 1.2193580995703817, "grad_norm": 1.1910755634307861, "learning_rate": 7.837974683544305e-06, "loss": 0.05991936847567558, "num_input_tokens_seen": 2272080, "step": 1207, "train_runtime": 3658.4764, "train_tokens_per_second": 621.045 }, { "epoch": 1.2203689663886783, "grad_norm": 1.2928847074508667, "learning_rate": 7.827848101265824e-06, "loss": 0.052168942987918854, "num_input_tokens_seen": 2273334, "step": 1208, "train_runtime": 3660.5719, "train_tokens_per_second": 621.032 }, { "epoch": 1.221379833206975, "grad_norm": 1.2783948183059692, "learning_rate": 7.817721518987343e-06, "loss": 0.06510590016841888, "num_input_tokens_seen": 2275454, "step": 1209, "train_runtime": 3662.8793, "train_tokens_per_second": 621.22 }, { "epoch": 1.2223907000252716, "grad_norm": 1.7674273252487183, "learning_rate": 7.80759493670886e-06, "loss": 0.04185160994529724, "num_input_tokens_seen": 2277052, "step": 1210, "train_runtime": 3665.126, "train_tokens_per_second": 621.275 }, { "epoch": 1.2234015668435683, "grad_norm": 1.0900136232376099, "learning_rate": 7.797468354430381e-06, "loss": 0.035728149116039276, "num_input_tokens_seen": 2278706, "step": 1211, "train_runtime": 3667.343, "train_tokens_per_second": 621.351 }, { "epoch": 1.2244124336618651, "grad_norm": 1.7899435758590698, "learning_rate": 7.7873417721519e-06, "loss": 0.06428918242454529, "num_input_tokens_seen": 2280384, "step": 1212, "train_runtime": 3669.57, "train_tokens_per_second": 621.431 }, { "epoch": 1.2254233004801618, "grad_norm": 1.4243944883346558, "learning_rate": 7.777215189873418e-06, "loss": 0.06730536371469498, "num_input_tokens_seen": 2282836, "step": 1213, "train_runtime": 3671.9922, "train_tokens_per_second": 621.689 }, { "epoch": 1.2264341672984584, "grad_norm": 1.6462485790252686, "learning_rate": 7.767088607594937e-06, "loss": 0.057023413479328156, "num_input_tokens_seen": 2284726, "step": 1214, "train_runtime": 3674.2725, "train_tokens_per_second": 621.817 }, { "epoch": 1.227445034116755, "grad_norm": 1.2234854698181152, "learning_rate": 7.756962025316456e-06, "loss": 0.06149659305810928, "num_input_tokens_seen": 2287752, "step": 1215, "train_runtime": 3676.8565, "train_tokens_per_second": 622.203 }, { "epoch": 1.2284559009350517, "grad_norm": 1.159865379333496, "learning_rate": 7.746835443037975e-06, "loss": 0.04254642128944397, "num_input_tokens_seen": 2289266, "step": 1216, "train_runtime": 3679.0534, "train_tokens_per_second": 622.243 }, { "epoch": 1.2294667677533484, "grad_norm": 1.3408385515213013, "learning_rate": 7.736708860759494e-06, "loss": 0.053428713232278824, "num_input_tokens_seen": 2291274, "step": 1217, "train_runtime": 3681.3653, "train_tokens_per_second": 622.398 }, { "epoch": 1.2304776345716453, "grad_norm": 1.2482548952102661, "learning_rate": 7.726582278481013e-06, "loss": 0.05629862844944, "num_input_tokens_seen": 2293442, "step": 1218, "train_runtime": 3683.6741, "train_tokens_per_second": 622.596 }, { "epoch": 1.231488501389942, "grad_norm": 1.045045018196106, "learning_rate": 7.716455696202532e-06, "loss": 0.05139722675085068, "num_input_tokens_seen": 2295438, "step": 1219, "train_runtime": 3685.9778, "train_tokens_per_second": 622.749 }, { "epoch": 1.2324993682082386, "grad_norm": 1.2410844564437866, "learning_rate": 7.706329113924051e-06, "loss": 0.04247979819774628, "num_input_tokens_seen": 2297814, "step": 1220, "train_runtime": 3688.4051, "train_tokens_per_second": 622.983 }, { "epoch": 1.2335102350265352, "grad_norm": 1.216529130935669, "learning_rate": 7.69620253164557e-06, "loss": 0.049616873264312744, "num_input_tokens_seen": 2299686, "step": 1221, "train_runtime": 3690.6467, "train_tokens_per_second": 623.112 }, { "epoch": 1.2345211018448319, "grad_norm": 1.1823710203170776, "learning_rate": 7.68607594936709e-06, "loss": 0.04045352339744568, "num_input_tokens_seen": 2301578, "step": 1222, "train_runtime": 3692.8889, "train_tokens_per_second": 623.246 }, { "epoch": 1.2355319686631288, "grad_norm": 1.2898205518722534, "learning_rate": 7.675949367088609e-06, "loss": 0.05988980084657669, "num_input_tokens_seen": 2303610, "step": 1223, "train_runtime": 3695.1624, "train_tokens_per_second": 623.412 }, { "epoch": 1.2365428354814254, "grad_norm": 1.1859538555145264, "learning_rate": 7.665822784810128e-06, "loss": 0.048559948801994324, "num_input_tokens_seen": 2305512, "step": 1224, "train_runtime": 3697.4557, "train_tokens_per_second": 623.54 }, { "epoch": 1.237553702299722, "grad_norm": 1.8632739782333374, "learning_rate": 7.655696202531647e-06, "loss": 0.05580410733819008, "num_input_tokens_seen": 2307674, "step": 1225, "train_runtime": 3699.8035, "train_tokens_per_second": 623.729 }, { "epoch": 1.2385645691180187, "grad_norm": 1.4416550397872925, "learning_rate": 7.645569620253164e-06, "loss": 0.0591302216053009, "num_input_tokens_seen": 2309670, "step": 1226, "train_runtime": 3702.0836, "train_tokens_per_second": 623.884 }, { "epoch": 1.2395754359363154, "grad_norm": 1.3483821153640747, "learning_rate": 7.635443037974685e-06, "loss": 0.044712476432323456, "num_input_tokens_seen": 2311322, "step": 1227, "train_runtime": 3704.3366, "train_tokens_per_second": 623.95 }, { "epoch": 1.240586302754612, "grad_norm": 1.6321603059768677, "learning_rate": 7.625316455696203e-06, "loss": 0.04973188787698746, "num_input_tokens_seen": 2312726, "step": 1228, "train_runtime": 3706.5158, "train_tokens_per_second": 623.962 }, { "epoch": 1.2415971695729087, "grad_norm": 1.1471374034881592, "learning_rate": 7.615189873417722e-06, "loss": 0.05518278107047081, "num_input_tokens_seen": 2314644, "step": 1229, "train_runtime": 3708.8157, "train_tokens_per_second": 624.092 }, { "epoch": 1.2426080363912055, "grad_norm": 1.3072782754898071, "learning_rate": 7.6050632911392405e-06, "loss": 0.0519881397485733, "num_input_tokens_seen": 2316536, "step": 1230, "train_runtime": 3711.091, "train_tokens_per_second": 624.22 }, { "epoch": 1.2436189032095022, "grad_norm": 1.395263910293579, "learning_rate": 7.5949367088607605e-06, "loss": 0.06062118709087372, "num_input_tokens_seen": 2318024, "step": 1231, "train_runtime": 3726.8768, "train_tokens_per_second": 621.975 }, { "epoch": 1.2446297700277988, "grad_norm": 1.3331067562103271, "learning_rate": 7.5848101265822796e-06, "loss": 0.07556059211492538, "num_input_tokens_seen": 2320428, "step": 1232, "train_runtime": 3729.3148, "train_tokens_per_second": 622.213 }, { "epoch": 1.2456406368460955, "grad_norm": 1.5281811952590942, "learning_rate": 7.574683544303798e-06, "loss": 0.06573790311813354, "num_input_tokens_seen": 2322182, "step": 1233, "train_runtime": 3731.5742, "train_tokens_per_second": 622.306 }, { "epoch": 1.2466515036643921, "grad_norm": 1.394310474395752, "learning_rate": 7.564556962025317e-06, "loss": 0.06115046888589859, "num_input_tokens_seen": 2323616, "step": 1234, "train_runtime": 3733.765, "train_tokens_per_second": 622.325 }, { "epoch": 1.247662370482689, "grad_norm": 1.5008997917175293, "learning_rate": 7.554430379746837e-06, "loss": 0.07988383620977402, "num_input_tokens_seen": 2325408, "step": 1235, "train_runtime": 3736.0465, "train_tokens_per_second": 622.425 }, { "epoch": 1.2486732373009857, "grad_norm": 0.9623056054115295, "learning_rate": 7.544303797468355e-06, "loss": 0.045632608234882355, "num_input_tokens_seen": 2327858, "step": 1236, "train_runtime": 3738.5179, "train_tokens_per_second": 622.669 }, { "epoch": 1.2496841041192823, "grad_norm": 1.1915478706359863, "learning_rate": 7.534177215189874e-06, "loss": 0.043249502778053284, "num_input_tokens_seen": 2329798, "step": 1237, "train_runtime": 3740.7932, "train_tokens_per_second": 622.809 }, { "epoch": 1.250694970937579, "grad_norm": 1.0730327367782593, "learning_rate": 7.524050632911392e-06, "loss": 0.05751641094684601, "num_input_tokens_seen": 2332188, "step": 1238, "train_runtime": 3743.2875, "train_tokens_per_second": 623.032 }, { "epoch": 1.2517058377558756, "grad_norm": 1.4013127088546753, "learning_rate": 7.513924050632912e-06, "loss": 0.0634988471865654, "num_input_tokens_seen": 2334310, "step": 1239, "train_runtime": 3745.642, "train_tokens_per_second": 623.207 }, { "epoch": 1.2527167045741723, "grad_norm": 1.3232216835021973, "learning_rate": 7.503797468354431e-06, "loss": 0.0602821409702301, "num_input_tokens_seen": 2336354, "step": 1240, "train_runtime": 3747.9665, "train_tokens_per_second": 623.366 }, { "epoch": 1.253727571392469, "grad_norm": 1.1508218050003052, "learning_rate": 7.49367088607595e-06, "loss": 0.04428628832101822, "num_input_tokens_seen": 2338472, "step": 1241, "train_runtime": 3750.3185, "train_tokens_per_second": 623.54 }, { "epoch": 1.2547384382107658, "grad_norm": 1.5455573797225952, "learning_rate": 7.483544303797469e-06, "loss": 0.06668779253959656, "num_input_tokens_seen": 2340730, "step": 1242, "train_runtime": 3752.9886, "train_tokens_per_second": 623.698 }, { "epoch": 1.2557493050290625, "grad_norm": 1.5112093687057495, "learning_rate": 7.473417721518989e-06, "loss": 0.05614790692925453, "num_input_tokens_seen": 2342948, "step": 1243, "train_runtime": 3755.3258, "train_tokens_per_second": 623.9 }, { "epoch": 1.256760171847359, "grad_norm": 1.386748194694519, "learning_rate": 7.463291139240507e-06, "loss": 0.05175211653113365, "num_input_tokens_seen": 2345132, "step": 1244, "train_runtime": 3757.7003, "train_tokens_per_second": 624.087 }, { "epoch": 1.2577710386656558, "grad_norm": 1.5524296760559082, "learning_rate": 7.453164556962026e-06, "loss": 0.06800000369548798, "num_input_tokens_seen": 2346772, "step": 1245, "train_runtime": 3759.9756, "train_tokens_per_second": 624.146 }, { "epoch": 1.2587819054839524, "grad_norm": 1.4179092645645142, "learning_rate": 7.443037974683544e-06, "loss": 0.06086236983537674, "num_input_tokens_seen": 2348770, "step": 1246, "train_runtime": 3762.3294, "train_tokens_per_second": 624.286 }, { "epoch": 1.2597927723022493, "grad_norm": 1.2474757432937622, "learning_rate": 7.432911392405064e-06, "loss": 0.06393437832593918, "num_input_tokens_seen": 2350794, "step": 1247, "train_runtime": 3764.666, "train_tokens_per_second": 624.436 }, { "epoch": 1.260803639120546, "grad_norm": 1.182120680809021, "learning_rate": 7.422784810126583e-06, "loss": 0.054492250084877014, "num_input_tokens_seen": 2352492, "step": 1248, "train_runtime": 3766.8863, "train_tokens_per_second": 624.519 }, { "epoch": 1.2618145059388426, "grad_norm": 1.5892659425735474, "learning_rate": 7.4126582278481014e-06, "loss": 0.08521469682455063, "num_input_tokens_seen": 2354176, "step": 1249, "train_runtime": 3769.1181, "train_tokens_per_second": 624.596 }, { "epoch": 1.2628253727571392, "grad_norm": 1.1960848569869995, "learning_rate": 7.4025316455696205e-06, "loss": 0.055863481014966965, "num_input_tokens_seen": 2356116, "step": 1250, "train_runtime": 3771.467, "train_tokens_per_second": 624.721 }, { "epoch": 1.263836239575436, "grad_norm": 2.125699520111084, "learning_rate": 7.3924050632911405e-06, "loss": 0.07721327245235443, "num_input_tokens_seen": 2357662, "step": 1251, "train_runtime": 3773.7573, "train_tokens_per_second": 624.752 }, { "epoch": 1.2648471063937325, "grad_norm": 1.4590431451797485, "learning_rate": 7.382278481012659e-06, "loss": 0.052303265780210495, "num_input_tokens_seen": 2359266, "step": 1252, "train_runtime": 3775.9615, "train_tokens_per_second": 624.812 }, { "epoch": 1.2658579732120292, "grad_norm": 1.2073882818222046, "learning_rate": 7.372151898734178e-06, "loss": 0.04308575391769409, "num_input_tokens_seen": 2361054, "step": 1253, "train_runtime": 3778.2318, "train_tokens_per_second": 624.91 }, { "epoch": 1.266868840030326, "grad_norm": 1.4119540452957153, "learning_rate": 7.362025316455697e-06, "loss": 0.05672318488359451, "num_input_tokens_seen": 2362734, "step": 1254, "train_runtime": 3780.4321, "train_tokens_per_second": 624.99 }, { "epoch": 1.2678797068486227, "grad_norm": 1.2578742504119873, "learning_rate": 7.351898734177216e-06, "loss": 0.06953655183315277, "num_input_tokens_seen": 2364500, "step": 1255, "train_runtime": 3782.6941, "train_tokens_per_second": 625.084 }, { "epoch": 1.2688905736669194, "grad_norm": 1.3448150157928467, "learning_rate": 7.341772151898735e-06, "loss": 0.04783962666988373, "num_input_tokens_seen": 2366698, "step": 1256, "train_runtime": 3785.0436, "train_tokens_per_second": 625.276 }, { "epoch": 1.269901440485216, "grad_norm": 1.3297990560531616, "learning_rate": 7.331645569620254e-06, "loss": 0.050486110150814056, "num_input_tokens_seen": 2368722, "step": 1257, "train_runtime": 3787.3476, "train_tokens_per_second": 625.43 }, { "epoch": 1.270912307303513, "grad_norm": 1.0803709030151367, "learning_rate": 7.321518987341772e-06, "loss": 0.05573941767215729, "num_input_tokens_seen": 2370806, "step": 1258, "train_runtime": 3789.6801, "train_tokens_per_second": 625.595 }, { "epoch": 1.2719231741218096, "grad_norm": 1.1125187873840332, "learning_rate": 7.311392405063292e-06, "loss": 0.04718473553657532, "num_input_tokens_seen": 2372522, "step": 1259, "train_runtime": 3791.9679, "train_tokens_per_second": 625.67 }, { "epoch": 1.2729340409401062, "grad_norm": 1.0505123138427734, "learning_rate": 7.301265822784811e-06, "loss": 0.04578212648630142, "num_input_tokens_seen": 2374258, "step": 1260, "train_runtime": 3794.2543, "train_tokens_per_second": 625.751 }, { "epoch": 1.2739449077584029, "grad_norm": 1.0820823907852173, "learning_rate": 7.29113924050633e-06, "loss": 0.042990993708372116, "num_input_tokens_seen": 2375890, "step": 1261, "train_runtime": 3809.8469, "train_tokens_per_second": 623.618 }, { "epoch": 1.2749557745766995, "grad_norm": 0.9400637745857239, "learning_rate": 7.281012658227849e-06, "loss": 0.03949103131890297, "num_input_tokens_seen": 2377974, "step": 1262, "train_runtime": 3812.2122, "train_tokens_per_second": 623.778 }, { "epoch": 1.2759666413949962, "grad_norm": 1.3851995468139648, "learning_rate": 7.270886075949367e-06, "loss": 0.05658121407032013, "num_input_tokens_seen": 2379908, "step": 1263, "train_runtime": 3814.5151, "train_tokens_per_second": 623.908 }, { "epoch": 1.2769775082132928, "grad_norm": 1.4746298789978027, "learning_rate": 7.260759493670887e-06, "loss": 0.07203026115894318, "num_input_tokens_seen": 2382120, "step": 1264, "train_runtime": 3816.8503, "train_tokens_per_second": 624.106 }, { "epoch": 1.2779883750315895, "grad_norm": 1.1128922700881958, "learning_rate": 7.250632911392406e-06, "loss": 0.039608296006917953, "num_input_tokens_seen": 2383738, "step": 1265, "train_runtime": 3819.0324, "train_tokens_per_second": 624.173 }, { "epoch": 1.2789992418498863, "grad_norm": 1.2160228490829468, "learning_rate": 7.240506329113924e-06, "loss": 0.05472289398312569, "num_input_tokens_seen": 2385874, "step": 1266, "train_runtime": 3821.3407, "train_tokens_per_second": 624.355 }, { "epoch": 1.280010108668183, "grad_norm": 1.1629916429519653, "learning_rate": 7.230379746835443e-06, "loss": 0.06323608756065369, "num_input_tokens_seen": 2388636, "step": 1267, "train_runtime": 3823.8359, "train_tokens_per_second": 624.67 }, { "epoch": 1.2810209754864796, "grad_norm": 1.362239122390747, "learning_rate": 7.220253164556963e-06, "loss": 0.05546117573976517, "num_input_tokens_seen": 2390426, "step": 1268, "train_runtime": 3826.0566, "train_tokens_per_second": 624.775 }, { "epoch": 1.2820318423047763, "grad_norm": 1.3258403539657593, "learning_rate": 7.2101265822784814e-06, "loss": 0.06692615896463394, "num_input_tokens_seen": 2392536, "step": 1269, "train_runtime": 3828.3655, "train_tokens_per_second": 624.95 }, { "epoch": 1.2830427091230732, "grad_norm": 1.2993758916854858, "learning_rate": 7.2000000000000005e-06, "loss": 0.047084324061870575, "num_input_tokens_seen": 2394276, "step": 1270, "train_runtime": 3830.6242, "train_tokens_per_second": 625.035 }, { "epoch": 1.2840535759413698, "grad_norm": 1.388413667678833, "learning_rate": 7.189873417721519e-06, "loss": 0.059688519686460495, "num_input_tokens_seen": 2396094, "step": 1271, "train_runtime": 3833.0621, "train_tokens_per_second": 625.112 }, { "epoch": 1.2850644427596665, "grad_norm": 1.6889876127243042, "learning_rate": 7.179746835443039e-06, "loss": 0.08853891491889954, "num_input_tokens_seen": 2398042, "step": 1272, "train_runtime": 3835.3231, "train_tokens_per_second": 625.252 }, { "epoch": 1.2860753095779631, "grad_norm": 1.4108036756515503, "learning_rate": 7.169620253164558e-06, "loss": 0.06351727992296219, "num_input_tokens_seen": 2400290, "step": 1273, "train_runtime": 3837.6515, "train_tokens_per_second": 625.458 }, { "epoch": 1.2870861763962598, "grad_norm": 1.4529653787612915, "learning_rate": 7.159493670886076e-06, "loss": 0.046431802213191986, "num_input_tokens_seen": 2402024, "step": 1274, "train_runtime": 3839.8616, "train_tokens_per_second": 625.55 }, { "epoch": 1.2880970432145564, "grad_norm": 1.927977442741394, "learning_rate": 7.149367088607595e-06, "loss": 0.06092975288629532, "num_input_tokens_seen": 2403846, "step": 1275, "train_runtime": 3842.1551, "train_tokens_per_second": 625.65 }, { "epoch": 1.289107910032853, "grad_norm": 1.2304484844207764, "learning_rate": 7.139240506329115e-06, "loss": 0.054616767913103104, "num_input_tokens_seen": 2405930, "step": 1276, "train_runtime": 3844.4937, "train_tokens_per_second": 625.812 }, { "epoch": 1.2901187768511497, "grad_norm": 1.2034251689910889, "learning_rate": 7.129113924050633e-06, "loss": 0.05521988123655319, "num_input_tokens_seen": 2407904, "step": 1277, "train_runtime": 3846.7853, "train_tokens_per_second": 625.952 }, { "epoch": 1.2911296436694466, "grad_norm": 1.896065592765808, "learning_rate": 7.118987341772152e-06, "loss": 0.06472885608673096, "num_input_tokens_seen": 2410116, "step": 1278, "train_runtime": 3849.1352, "train_tokens_per_second": 626.145 }, { "epoch": 1.2921405104877433, "grad_norm": 1.20551598072052, "learning_rate": 7.108860759493671e-06, "loss": 0.06310249865055084, "num_input_tokens_seen": 2412480, "step": 1279, "train_runtime": 3851.5265, "train_tokens_per_second": 626.37 }, { "epoch": 1.29315137730604, "grad_norm": 1.4300223588943481, "learning_rate": 7.0987341772151905e-06, "loss": 0.0528576634824276, "num_input_tokens_seen": 2413934, "step": 1280, "train_runtime": 3853.6476, "train_tokens_per_second": 626.402 }, { "epoch": 1.2941622441243366, "grad_norm": 1.3833800554275513, "learning_rate": 7.08860759493671e-06, "loss": 0.07344702631235123, "num_input_tokens_seen": 2415538, "step": 1281, "train_runtime": 3855.8363, "train_tokens_per_second": 626.463 }, { "epoch": 1.2951731109426334, "grad_norm": 1.0929604768753052, "learning_rate": 7.078481012658228e-06, "loss": 0.04777875915169716, "num_input_tokens_seen": 2418354, "step": 1282, "train_runtime": 3858.3512, "train_tokens_per_second": 626.784 }, { "epoch": 1.29618397776093, "grad_norm": 1.6052258014678955, "learning_rate": 7.068354430379747e-06, "loss": 0.052375856786966324, "num_input_tokens_seen": 2420410, "step": 1283, "train_runtime": 3860.6545, "train_tokens_per_second": 626.943 }, { "epoch": 1.2971948445792267, "grad_norm": 1.1358217000961304, "learning_rate": 7.058227848101267e-06, "loss": 0.03975092992186546, "num_input_tokens_seen": 2422074, "step": 1284, "train_runtime": 3862.8286, "train_tokens_per_second": 627.021 }, { "epoch": 1.2982057113975234, "grad_norm": 1.4586998224258423, "learning_rate": 7.048101265822785e-06, "loss": 0.05373745039105415, "num_input_tokens_seen": 2423840, "step": 1285, "train_runtime": 3865.0327, "train_tokens_per_second": 627.12 }, { "epoch": 1.29921657821582, "grad_norm": 1.156754493713379, "learning_rate": 7.037974683544304e-06, "loss": 0.05291145294904709, "num_input_tokens_seen": 2425850, "step": 1286, "train_runtime": 3867.3022, "train_tokens_per_second": 627.272 }, { "epoch": 1.3002274450341167, "grad_norm": 1.2575299739837646, "learning_rate": 7.027848101265823e-06, "loss": 0.0599808506667614, "num_input_tokens_seen": 2428110, "step": 1287, "train_runtime": 3869.6466, "train_tokens_per_second": 627.476 }, { "epoch": 1.3012383118524133, "grad_norm": 1.223726749420166, "learning_rate": 7.017721518987342e-06, "loss": 0.05270208418369293, "num_input_tokens_seen": 2430236, "step": 1288, "train_runtime": 3871.9793, "train_tokens_per_second": 627.647 }, { "epoch": 1.3022491786707102, "grad_norm": 1.3750054836273193, "learning_rate": 7.0075949367088614e-06, "loss": 0.0491962805390358, "num_input_tokens_seen": 2432132, "step": 1289, "train_runtime": 3874.2428, "train_tokens_per_second": 627.77 }, { "epoch": 1.3032600454890069, "grad_norm": 1.603071689605713, "learning_rate": 6.99746835443038e-06, "loss": 0.08003854006528854, "num_input_tokens_seen": 2433912, "step": 1290, "train_runtime": 3876.4749, "train_tokens_per_second": 627.867 }, { "epoch": 1.3042709123073035, "grad_norm": 1.4792207479476929, "learning_rate": 6.987341772151899e-06, "loss": 0.06192871928215027, "num_input_tokens_seen": 2435450, "step": 1291, "train_runtime": 3892.4066, "train_tokens_per_second": 625.693 }, { "epoch": 1.3052817791256002, "grad_norm": 1.1881080865859985, "learning_rate": 6.977215189873419e-06, "loss": 0.048305366188287735, "num_input_tokens_seen": 2437190, "step": 1292, "train_runtime": 3894.6507, "train_tokens_per_second": 625.779 }, { "epoch": 1.3062926459438968, "grad_norm": 1.3181772232055664, "learning_rate": 6.967088607594937e-06, "loss": 0.054380863904953, "num_input_tokens_seen": 2439320, "step": 1293, "train_runtime": 3897.0466, "train_tokens_per_second": 625.941 }, { "epoch": 1.3073035127621937, "grad_norm": 1.3481340408325195, "learning_rate": 6.956962025316456e-06, "loss": 0.05058111995458603, "num_input_tokens_seen": 2440856, "step": 1294, "train_runtime": 3899.2289, "train_tokens_per_second": 625.984 }, { "epoch": 1.3083143795804903, "grad_norm": 1.3278868198394775, "learning_rate": 6.946835443037975e-06, "loss": 0.04658079892396927, "num_input_tokens_seen": 2442592, "step": 1295, "train_runtime": 3901.4947, "train_tokens_per_second": 626.066 }, { "epoch": 1.309325246398787, "grad_norm": 1.3212907314300537, "learning_rate": 6.936708860759494e-06, "loss": 0.07202155143022537, "num_input_tokens_seen": 2444864, "step": 1296, "train_runtime": 3903.8581, "train_tokens_per_second": 626.269 }, { "epoch": 1.3103361132170837, "grad_norm": 1.452693223953247, "learning_rate": 6.926582278481013e-06, "loss": 0.058132391422986984, "num_input_tokens_seen": 2446738, "step": 1297, "train_runtime": 3906.182, "train_tokens_per_second": 626.376 }, { "epoch": 1.3113469800353803, "grad_norm": 1.4813017845153809, "learning_rate": 6.916455696202532e-06, "loss": 0.0758880078792572, "num_input_tokens_seen": 2448408, "step": 1298, "train_runtime": 3908.4216, "train_tokens_per_second": 626.444 }, { "epoch": 1.312357846853677, "grad_norm": 1.4571219682693481, "learning_rate": 6.906329113924051e-06, "loss": 0.07111041247844696, "num_input_tokens_seen": 2450152, "step": 1299, "train_runtime": 3910.6613, "train_tokens_per_second": 626.531 }, { "epoch": 1.3133687136719736, "grad_norm": 1.1863071918487549, "learning_rate": 6.8962025316455705e-06, "loss": 0.060917239636182785, "num_input_tokens_seen": 2451912, "step": 1300, "train_runtime": 3913.021, "train_tokens_per_second": 626.603 }, { "epoch": 1.3143795804902705, "grad_norm": 1.6423072814941406, "learning_rate": 6.88607594936709e-06, "loss": 0.04655277729034424, "num_input_tokens_seen": 2453816, "step": 1301, "train_runtime": 3915.3644, "train_tokens_per_second": 626.715 }, { "epoch": 1.3153904473085671, "grad_norm": 1.3400390148162842, "learning_rate": 6.875949367088608e-06, "loss": 0.04788367822766304, "num_input_tokens_seen": 2455718, "step": 1302, "train_runtime": 3917.7202, "train_tokens_per_second": 626.823 }, { "epoch": 1.3164013141268638, "grad_norm": 1.463574767112732, "learning_rate": 6.865822784810127e-06, "loss": 0.06563840061426163, "num_input_tokens_seen": 2457762, "step": 1303, "train_runtime": 3920.0283, "train_tokens_per_second": 626.976 }, { "epoch": 1.3174121809451604, "grad_norm": 1.3056226968765259, "learning_rate": 6.855696202531647e-06, "loss": 0.061565324664115906, "num_input_tokens_seen": 2460088, "step": 1304, "train_runtime": 3922.4999, "train_tokens_per_second": 627.173 }, { "epoch": 1.318423047763457, "grad_norm": 1.284570574760437, "learning_rate": 6.845569620253165e-06, "loss": 0.056237488985061646, "num_input_tokens_seen": 2461942, "step": 1305, "train_runtime": 3924.7495, "train_tokens_per_second": 627.286 }, { "epoch": 1.319433914581754, "grad_norm": 1.21128511428833, "learning_rate": 6.835443037974684e-06, "loss": 0.043198779225349426, "num_input_tokens_seen": 2463904, "step": 1306, "train_runtime": 3927.052, "train_tokens_per_second": 627.418 }, { "epoch": 1.3204447814000506, "grad_norm": 1.1530758142471313, "learning_rate": 6.825316455696202e-06, "loss": 0.0534062460064888, "num_input_tokens_seen": 2465722, "step": 1307, "train_runtime": 3929.3542, "train_tokens_per_second": 627.513 }, { "epoch": 1.3214556482183473, "grad_norm": 1.3490420579910278, "learning_rate": 6.815189873417722e-06, "loss": 0.05943992733955383, "num_input_tokens_seen": 2467266, "step": 1308, "train_runtime": 3931.5583, "train_tokens_per_second": 627.554 }, { "epoch": 1.322466515036644, "grad_norm": 1.3117525577545166, "learning_rate": 6.805063291139241e-06, "loss": 0.05493208020925522, "num_input_tokens_seen": 2469430, "step": 1309, "train_runtime": 3933.9128, "train_tokens_per_second": 627.729 }, { "epoch": 1.3234773818549406, "grad_norm": 1.1769880056381226, "learning_rate": 6.79493670886076e-06, "loss": 0.05271150916814804, "num_input_tokens_seen": 2471652, "step": 1310, "train_runtime": 3936.2597, "train_tokens_per_second": 627.919 }, { "epoch": 1.3244882486732372, "grad_norm": 1.6591688394546509, "learning_rate": 6.784810126582279e-06, "loss": 0.08554491400718689, "num_input_tokens_seen": 2473280, "step": 1311, "train_runtime": 3938.4836, "train_tokens_per_second": 627.978 }, { "epoch": 1.3254991154915339, "grad_norm": 1.4286710023880005, "learning_rate": 6.774683544303799e-06, "loss": 0.06489214301109314, "num_input_tokens_seen": 2475394, "step": 1312, "train_runtime": 3940.7957, "train_tokens_per_second": 628.146 }, { "epoch": 1.3265099823098307, "grad_norm": 1.3228434324264526, "learning_rate": 6.764556962025317e-06, "loss": 0.0692477747797966, "num_input_tokens_seen": 2477104, "step": 1313, "train_runtime": 3943.0216, "train_tokens_per_second": 628.225 }, { "epoch": 1.3275208491281274, "grad_norm": 1.3991831541061401, "learning_rate": 6.754430379746836e-06, "loss": 0.06959948688745499, "num_input_tokens_seen": 2479042, "step": 1314, "train_runtime": 3945.3329, "train_tokens_per_second": 628.348 }, { "epoch": 1.328531715946424, "grad_norm": 1.1324790716171265, "learning_rate": 6.744303797468354e-06, "loss": 0.03849688172340393, "num_input_tokens_seen": 2480676, "step": 1315, "train_runtime": 3947.5461, "train_tokens_per_second": 628.41 }, { "epoch": 1.3295425827647207, "grad_norm": 1.4252482652664185, "learning_rate": 6.734177215189874e-06, "loss": 0.06371836364269257, "num_input_tokens_seen": 2482858, "step": 1316, "train_runtime": 3949.9076, "train_tokens_per_second": 628.586 }, { "epoch": 1.3305534495830174, "grad_norm": 1.5386812686920166, "learning_rate": 6.724050632911393e-06, "loss": 0.07826663553714752, "num_input_tokens_seen": 2484364, "step": 1317, "train_runtime": 3952.1292, "train_tokens_per_second": 628.614 }, { "epoch": 1.3315643164013142, "grad_norm": 1.658719778060913, "learning_rate": 6.7139240506329115e-06, "loss": 0.05043855309486389, "num_input_tokens_seen": 2486306, "step": 1318, "train_runtime": 3954.4094, "train_tokens_per_second": 628.743 }, { "epoch": 1.3325751832196109, "grad_norm": 1.2035260200500488, "learning_rate": 6.7037974683544306e-06, "loss": 0.06669348478317261, "num_input_tokens_seen": 2488390, "step": 1319, "train_runtime": 3956.7139, "train_tokens_per_second": 628.903 }, { "epoch": 1.3335860500379075, "grad_norm": 1.6911429166793823, "learning_rate": 6.6936708860759505e-06, "loss": 0.051741354167461395, "num_input_tokens_seen": 2490366, "step": 1320, "train_runtime": 3959.009, "train_tokens_per_second": 629.038 }, { "epoch": 1.3345969168562042, "grad_norm": 1.2079441547393799, "learning_rate": 6.683544303797469e-06, "loss": 0.054227374494075775, "num_input_tokens_seen": 2492082, "step": 1321, "train_runtime": 3975.5875, "train_tokens_per_second": 626.846 }, { "epoch": 1.3356077836745008, "grad_norm": 1.141798496246338, "learning_rate": 6.673417721518988e-06, "loss": 0.0495566725730896, "num_input_tokens_seen": 2493558, "step": 1322, "train_runtime": 3977.7635, "train_tokens_per_second": 626.874 }, { "epoch": 1.3366186504927975, "grad_norm": 1.162388801574707, "learning_rate": 6.663291139240506e-06, "loss": 0.04409773647785187, "num_input_tokens_seen": 2494988, "step": 1323, "train_runtime": 3979.9302, "train_tokens_per_second": 626.892 }, { "epoch": 1.3376295173110941, "grad_norm": 1.5943406820297241, "learning_rate": 6.653164556962026e-06, "loss": 0.07473370432853699, "num_input_tokens_seen": 2496558, "step": 1324, "train_runtime": 3982.1704, "train_tokens_per_second": 626.934 }, { "epoch": 1.338640384129391, "grad_norm": 1.2546615600585938, "learning_rate": 6.643037974683545e-06, "loss": 0.05474703758955002, "num_input_tokens_seen": 2498468, "step": 1325, "train_runtime": 3984.4065, "train_tokens_per_second": 627.062 }, { "epoch": 1.3396512509476877, "grad_norm": 1.1279000043869019, "learning_rate": 6.632911392405063e-06, "loss": 0.038108162581920624, "num_input_tokens_seen": 2500298, "step": 1326, "train_runtime": 3986.642, "train_tokens_per_second": 627.169 }, { "epoch": 1.3406621177659843, "grad_norm": 1.7238247394561768, "learning_rate": 6.622784810126582e-06, "loss": 0.0777852013707161, "num_input_tokens_seen": 2502174, "step": 1327, "train_runtime": 3988.9541, "train_tokens_per_second": 627.276 }, { "epoch": 1.341672984584281, "grad_norm": 1.118719220161438, "learning_rate": 6.612658227848102e-06, "loss": 0.05201104283332825, "num_input_tokens_seen": 2503952, "step": 1328, "train_runtime": 3991.1962, "train_tokens_per_second": 627.369 }, { "epoch": 1.3426838514025778, "grad_norm": 1.1212520599365234, "learning_rate": 6.6025316455696206e-06, "loss": 0.05457029491662979, "num_input_tokens_seen": 2505714, "step": 1329, "train_runtime": 3993.4535, "train_tokens_per_second": 627.455 }, { "epoch": 1.3436947182208745, "grad_norm": 1.209311842918396, "learning_rate": 6.59240506329114e-06, "loss": 0.07266074419021606, "num_input_tokens_seen": 2507846, "step": 1330, "train_runtime": 3995.7723, "train_tokens_per_second": 627.625 }, { "epoch": 1.3447055850391711, "grad_norm": 1.234279751777649, "learning_rate": 6.582278481012659e-06, "loss": 0.03919084370136261, "num_input_tokens_seen": 2510048, "step": 1331, "train_runtime": 3998.1095, "train_tokens_per_second": 627.809 }, { "epoch": 1.3457164518574678, "grad_norm": 1.3071277141571045, "learning_rate": 6.572151898734178e-06, "loss": 0.05816945433616638, "num_input_tokens_seen": 2511812, "step": 1332, "train_runtime": 4000.3514, "train_tokens_per_second": 627.898 }, { "epoch": 1.3467273186757645, "grad_norm": 2.054145097732544, "learning_rate": 6.562025316455697e-06, "loss": 0.08112684637308121, "num_input_tokens_seen": 2514084, "step": 1333, "train_runtime": 4002.7095, "train_tokens_per_second": 628.096 }, { "epoch": 1.347738185494061, "grad_norm": 1.3808009624481201, "learning_rate": 6.551898734177215e-06, "loss": 0.045785874128341675, "num_input_tokens_seen": 2515838, "step": 1334, "train_runtime": 4004.9185, "train_tokens_per_second": 628.187 }, { "epoch": 1.3487490523123578, "grad_norm": 1.2221318483352661, "learning_rate": 6.541772151898734e-06, "loss": 0.054682791233062744, "num_input_tokens_seen": 2517778, "step": 1335, "train_runtime": 4007.2695, "train_tokens_per_second": 628.303 }, { "epoch": 1.3497599191306544, "grad_norm": 1.4122490882873535, "learning_rate": 6.531645569620254e-06, "loss": 0.05897856131196022, "num_input_tokens_seen": 2519282, "step": 1336, "train_runtime": 4009.468, "train_tokens_per_second": 628.333 }, { "epoch": 1.3507707859489513, "grad_norm": 1.4037399291992188, "learning_rate": 6.521518987341772e-06, "loss": 0.06538009643554688, "num_input_tokens_seen": 2520964, "step": 1337, "train_runtime": 4011.7061, "train_tokens_per_second": 628.402 }, { "epoch": 1.351781652767248, "grad_norm": 1.2378387451171875, "learning_rate": 6.5113924050632915e-06, "loss": 0.06422580778598785, "num_input_tokens_seen": 2523034, "step": 1338, "train_runtime": 4014.0088, "train_tokens_per_second": 628.557 }, { "epoch": 1.3527925195855446, "grad_norm": 1.3696224689483643, "learning_rate": 6.5012658227848106e-06, "loss": 0.054821230471134186, "num_input_tokens_seen": 2525260, "step": 1339, "train_runtime": 4016.3466, "train_tokens_per_second": 628.746 }, { "epoch": 1.3538033864038412, "grad_norm": 1.2748407125473022, "learning_rate": 6.49113924050633e-06, "loss": 0.0619157999753952, "num_input_tokens_seen": 2527338, "step": 1340, "train_runtime": 4018.6636, "train_tokens_per_second": 628.9 }, { "epoch": 1.354814253222138, "grad_norm": 1.5537949800491333, "learning_rate": 6.481012658227849e-06, "loss": 0.06975711137056351, "num_input_tokens_seen": 2529494, "step": 1341, "train_runtime": 4020.973, "train_tokens_per_second": 629.075 }, { "epoch": 1.3558251200404348, "grad_norm": 1.4514718055725098, "learning_rate": 6.470886075949368e-06, "loss": 0.08354055136442184, "num_input_tokens_seen": 2531304, "step": 1342, "train_runtime": 4023.2288, "train_tokens_per_second": 629.172 }, { "epoch": 1.3568359868587314, "grad_norm": 1.5649539232254028, "learning_rate": 6.460759493670886e-06, "loss": 0.07228446006774902, "num_input_tokens_seen": 2533062, "step": 1343, "train_runtime": 4025.476, "train_tokens_per_second": 629.258 }, { "epoch": 1.357846853677028, "grad_norm": 1.298068642616272, "learning_rate": 6.450632911392406e-06, "loss": 0.06058548018336296, "num_input_tokens_seen": 2535360, "step": 1344, "train_runtime": 4027.896, "train_tokens_per_second": 629.45 }, { "epoch": 1.3588577204953247, "grad_norm": 1.2628767490386963, "learning_rate": 6.440506329113925e-06, "loss": 0.059151772409677505, "num_input_tokens_seen": 2537128, "step": 1345, "train_runtime": 4030.13, "train_tokens_per_second": 629.54 }, { "epoch": 1.3598685873136214, "grad_norm": 1.291844129562378, "learning_rate": 6.430379746835443e-06, "loss": 0.0626007616519928, "num_input_tokens_seen": 2539182, "step": 1346, "train_runtime": 4032.4581, "train_tokens_per_second": 629.686 }, { "epoch": 1.360879454131918, "grad_norm": 2.242800235748291, "learning_rate": 6.420253164556962e-06, "loss": 0.0355905145406723, "num_input_tokens_seen": 2541200, "step": 1347, "train_runtime": 4034.7924, "train_tokens_per_second": 629.822 }, { "epoch": 1.3618903209502147, "grad_norm": 1.0931439399719238, "learning_rate": 6.410126582278482e-06, "loss": 0.04841747507452965, "num_input_tokens_seen": 2543378, "step": 1348, "train_runtime": 4037.1568, "train_tokens_per_second": 629.992 }, { "epoch": 1.3629011877685115, "grad_norm": 1.017020344734192, "learning_rate": 6.4000000000000006e-06, "loss": 0.04899681359529495, "num_input_tokens_seen": 2545350, "step": 1349, "train_runtime": 4039.4283, "train_tokens_per_second": 630.126 }, { "epoch": 1.3639120545868082, "grad_norm": 1.3168435096740723, "learning_rate": 6.38987341772152e-06, "loss": 0.061506081372499466, "num_input_tokens_seen": 2547356, "step": 1350, "train_runtime": 4041.7682, "train_tokens_per_second": 630.258 }, { "epoch": 1.3649229214051048, "grad_norm": 1.3419066667556763, "learning_rate": 6.379746835443038e-06, "loss": 0.051432445645332336, "num_input_tokens_seen": 2549126, "step": 1351, "train_runtime": 4057.4305, "train_tokens_per_second": 628.261 }, { "epoch": 1.3659337882234015, "grad_norm": 1.3823827505111694, "learning_rate": 6.369620253164558e-06, "loss": 0.059081874787807465, "num_input_tokens_seen": 2551066, "step": 1352, "train_runtime": 4059.7077, "train_tokens_per_second": 628.387 }, { "epoch": 1.3669446550416984, "grad_norm": 1.4057139158248901, "learning_rate": 6.359493670886077e-06, "loss": 0.07083790749311447, "num_input_tokens_seen": 2553038, "step": 1353, "train_runtime": 4061.9986, "train_tokens_per_second": 628.518 }, { "epoch": 1.367955521859995, "grad_norm": 1.2331106662750244, "learning_rate": 6.349367088607595e-06, "loss": 0.049345988780260086, "num_input_tokens_seen": 2555022, "step": 1354, "train_runtime": 4064.2766, "train_tokens_per_second": 628.654 }, { "epoch": 1.3689663886782917, "grad_norm": 1.599181890487671, "learning_rate": 6.339240506329114e-06, "loss": 0.03669581562280655, "num_input_tokens_seen": 2556426, "step": 1355, "train_runtime": 4066.4235, "train_tokens_per_second": 628.667 }, { "epoch": 1.3699772554965883, "grad_norm": 1.5763306617736816, "learning_rate": 6.329113924050634e-06, "loss": 0.0630222037434578, "num_input_tokens_seen": 2558122, "step": 1356, "train_runtime": 4068.6434, "train_tokens_per_second": 628.741 }, { "epoch": 1.370988122314885, "grad_norm": 1.3165096044540405, "learning_rate": 6.318987341772152e-06, "loss": 0.060910359025001526, "num_input_tokens_seen": 2560308, "step": 1357, "train_runtime": 4070.9815, "train_tokens_per_second": 628.917 }, { "epoch": 1.3719989891331816, "grad_norm": 1.2796040773391724, "learning_rate": 6.3088607594936715e-06, "loss": 0.05310271307826042, "num_input_tokens_seen": 2562338, "step": 1358, "train_runtime": 4073.2616, "train_tokens_per_second": 629.063 }, { "epoch": 1.3730098559514783, "grad_norm": 1.2358952760696411, "learning_rate": 6.29873417721519e-06, "loss": 0.05557725951075554, "num_input_tokens_seen": 2563842, "step": 1359, "train_runtime": 4075.4347, "train_tokens_per_second": 629.097 }, { "epoch": 1.3740207227697752, "grad_norm": 1.4226715564727783, "learning_rate": 6.28860759493671e-06, "loss": 0.054653145372867584, "num_input_tokens_seen": 2565870, "step": 1360, "train_runtime": 4077.7367, "train_tokens_per_second": 629.239 }, { "epoch": 1.3750315895880718, "grad_norm": 1.3460056781768799, "learning_rate": 6.278481012658229e-06, "loss": 0.05934952199459076, "num_input_tokens_seen": 2567614, "step": 1361, "train_runtime": 4080.234, "train_tokens_per_second": 629.281 }, { "epoch": 1.3760424564063685, "grad_norm": 1.0250606536865234, "learning_rate": 6.268354430379747e-06, "loss": 0.05108030512928963, "num_input_tokens_seen": 2569486, "step": 1362, "train_runtime": 4082.5838, "train_tokens_per_second": 629.377 }, { "epoch": 1.3770533232246651, "grad_norm": 1.0781219005584717, "learning_rate": 6.258227848101266e-06, "loss": 0.04799749329686165, "num_input_tokens_seen": 2571478, "step": 1363, "train_runtime": 4084.972, "train_tokens_per_second": 629.497 }, { "epoch": 1.3780641900429618, "grad_norm": 1.516428828239441, "learning_rate": 6.248101265822786e-06, "loss": 0.062270086258649826, "num_input_tokens_seen": 2573162, "step": 1364, "train_runtime": 4087.2647, "train_tokens_per_second": 629.556 }, { "epoch": 1.3790750568612586, "grad_norm": 1.3159164190292358, "learning_rate": 6.237974683544304e-06, "loss": 0.045468129217624664, "num_input_tokens_seen": 2574666, "step": 1365, "train_runtime": 4089.4563, "train_tokens_per_second": 629.586 }, { "epoch": 1.3800859236795553, "grad_norm": 1.253880500793457, "learning_rate": 6.227848101265823e-06, "loss": 0.04943940415978432, "num_input_tokens_seen": 2576094, "step": 1366, "train_runtime": 4091.6038, "train_tokens_per_second": 629.605 }, { "epoch": 1.381096790497852, "grad_norm": 1.144112467765808, "learning_rate": 6.2177215189873415e-06, "loss": 0.04010799527168274, "num_input_tokens_seen": 2577802, "step": 1367, "train_runtime": 4093.9055, "train_tokens_per_second": 629.668 }, { "epoch": 1.3821076573161486, "grad_norm": 1.289851427078247, "learning_rate": 6.2075949367088615e-06, "loss": 0.05895276367664337, "num_input_tokens_seen": 2580078, "step": 1368, "train_runtime": 4096.2773, "train_tokens_per_second": 629.859 }, { "epoch": 1.3831185241344452, "grad_norm": 1.3746508359909058, "learning_rate": 6.1974683544303805e-06, "loss": 0.05186750739812851, "num_input_tokens_seen": 2581822, "step": 1369, "train_runtime": 4098.5361, "train_tokens_per_second": 629.938 }, { "epoch": 1.384129390952742, "grad_norm": 1.1321715116500854, "learning_rate": 6.187341772151899e-06, "loss": 0.05690278112888336, "num_input_tokens_seen": 2584068, "step": 1370, "train_runtime": 4100.8891, "train_tokens_per_second": 630.124 }, { "epoch": 1.3851402577710386, "grad_norm": 1.1682864427566528, "learning_rate": 6.177215189873418e-06, "loss": 0.035503584891557693, "num_input_tokens_seen": 2585860, "step": 1371, "train_runtime": 4103.1333, "train_tokens_per_second": 630.216 }, { "epoch": 1.3861511245893354, "grad_norm": 1.2780135869979858, "learning_rate": 6.167088607594938e-06, "loss": 0.05588618293404579, "num_input_tokens_seen": 2587634, "step": 1372, "train_runtime": 4105.369, "train_tokens_per_second": 630.305 }, { "epoch": 1.387161991407632, "grad_norm": 1.4143054485321045, "learning_rate": 6.156962025316456e-06, "loss": 0.05068785697221756, "num_input_tokens_seen": 2589498, "step": 1373, "train_runtime": 4107.6688, "train_tokens_per_second": 630.406 }, { "epoch": 1.3881728582259287, "grad_norm": 2.3067827224731445, "learning_rate": 6.146835443037975e-06, "loss": 0.04583851993083954, "num_input_tokens_seen": 2591676, "step": 1374, "train_runtime": 4110.008, "train_tokens_per_second": 630.577 }, { "epoch": 1.3891837250442254, "grad_norm": 1.3914011716842651, "learning_rate": 6.136708860759494e-06, "loss": 0.04922180250287056, "num_input_tokens_seen": 2593544, "step": 1375, "train_runtime": 4112.3136, "train_tokens_per_second": 630.678 }, { "epoch": 1.390194591862522, "grad_norm": 1.1687066555023193, "learning_rate": 6.126582278481013e-06, "loss": 0.05256985127925873, "num_input_tokens_seen": 2595692, "step": 1376, "train_runtime": 4114.6516, "train_tokens_per_second": 630.841 }, { "epoch": 1.391205458680819, "grad_norm": 1.7809689044952393, "learning_rate": 6.116455696202532e-06, "loss": 0.088633693754673, "num_input_tokens_seen": 2597534, "step": 1377, "train_runtime": 4116.8917, "train_tokens_per_second": 630.945 }, { "epoch": 1.3922163254991156, "grad_norm": 1.2149196863174438, "learning_rate": 6.106329113924051e-06, "loss": 0.07367751747369766, "num_input_tokens_seen": 2600018, "step": 1378, "train_runtime": 4119.299, "train_tokens_per_second": 631.18 }, { "epoch": 1.3932271923174122, "grad_norm": 1.497098684310913, "learning_rate": 6.09620253164557e-06, "loss": 0.05990324541926384, "num_input_tokens_seen": 2602052, "step": 1379, "train_runtime": 4121.5898, "train_tokens_per_second": 631.322 }, { "epoch": 1.3942380591357089, "grad_norm": 1.3180423974990845, "learning_rate": 6.08607594936709e-06, "loss": 0.05272394418716431, "num_input_tokens_seen": 2603758, "step": 1380, "train_runtime": 4123.8066, "train_tokens_per_second": 631.397 }, { "epoch": 1.3952489259540055, "grad_norm": 1.1364562511444092, "learning_rate": 6.075949367088608e-06, "loss": 0.04444532468914986, "num_input_tokens_seen": 2605644, "step": 1381, "train_runtime": 4139.3944, "train_tokens_per_second": 629.475 }, { "epoch": 1.3962597927723022, "grad_norm": 1.0885640382766724, "learning_rate": 6.065822784810127e-06, "loss": 0.04684608429670334, "num_input_tokens_seen": 2607354, "step": 1382, "train_runtime": 4141.7807, "train_tokens_per_second": 629.525 }, { "epoch": 1.3972706595905988, "grad_norm": 1.0900933742523193, "learning_rate": 6.055696202531646e-06, "loss": 0.04039217159152031, "num_input_tokens_seen": 2609280, "step": 1383, "train_runtime": 4144.264, "train_tokens_per_second": 629.612 }, { "epoch": 1.3982815264088957, "grad_norm": 1.595590591430664, "learning_rate": 6.045569620253165e-06, "loss": 0.09087800979614258, "num_input_tokens_seen": 2611402, "step": 1384, "train_runtime": 4146.6957, "train_tokens_per_second": 629.755 }, { "epoch": 1.3992923932271923, "grad_norm": 1.808232069015503, "learning_rate": 6.035443037974684e-06, "loss": 0.06717859208583832, "num_input_tokens_seen": 2612776, "step": 1385, "train_runtime": 4148.8773, "train_tokens_per_second": 629.755 }, { "epoch": 1.400303260045489, "grad_norm": 1.3342633247375488, "learning_rate": 6.025316455696203e-06, "loss": 0.06523144990205765, "num_input_tokens_seen": 2614562, "step": 1386, "train_runtime": 4151.161, "train_tokens_per_second": 629.839 }, { "epoch": 1.400303260045489, "eval_loss": 0.3663868308067322, "eval_runtime": 54.4304, "eval_samples_per_second": 16.149, "eval_steps_per_second": 8.084, "num_input_tokens_seen": 2614562, "step": 1386 }, { "epoch": 1.4013141268637856, "grad_norm": 1.2589857578277588, "learning_rate": 6.0151898734177215e-06, "loss": 0.051366157829761505, "num_input_tokens_seen": 2616790, "step": 1387, "train_runtime": 4207.9601, "train_tokens_per_second": 621.867 }, { "epoch": 1.4023249936820825, "grad_norm": 1.1806261539459229, "learning_rate": 6.0050632911392415e-06, "loss": 0.047723814845085144, "num_input_tokens_seen": 2618498, "step": 1388, "train_runtime": 4210.2811, "train_tokens_per_second": 621.929 }, { "epoch": 1.4033358605003792, "grad_norm": 1.5206774473190308, "learning_rate": 5.9949367088607605e-06, "loss": 0.05788637325167656, "num_input_tokens_seen": 2620730, "step": 1389, "train_runtime": 4212.6223, "train_tokens_per_second": 622.114 }, { "epoch": 1.4043467273186758, "grad_norm": 1.2093030214309692, "learning_rate": 5.984810126582279e-06, "loss": 0.051944561302661896, "num_input_tokens_seen": 2622210, "step": 1390, "train_runtime": 4214.809, "train_tokens_per_second": 622.142 }, { "epoch": 1.4053575941369725, "grad_norm": 1.2598261833190918, "learning_rate": 5.974683544303798e-06, "loss": 0.060215115547180176, "num_input_tokens_seen": 2623708, "step": 1391, "train_runtime": 4216.9732, "train_tokens_per_second": 622.178 }, { "epoch": 1.4063684609552691, "grad_norm": 1.3054869174957275, "learning_rate": 5.964556962025318e-06, "loss": 0.07101056724786758, "num_input_tokens_seen": 2625760, "step": 1392, "train_runtime": 4219.3319, "train_tokens_per_second": 622.317 }, { "epoch": 1.4073793277735658, "grad_norm": 1.3434244394302368, "learning_rate": 5.954430379746836e-06, "loss": 0.06410141289234161, "num_input_tokens_seen": 2627750, "step": 1393, "train_runtime": 4221.6614, "train_tokens_per_second": 622.445 }, { "epoch": 1.4083901945918624, "grad_norm": 1.4165593385696411, "learning_rate": 5.944303797468355e-06, "loss": 0.062341753393411636, "num_input_tokens_seen": 2630024, "step": 1394, "train_runtime": 4224.0667, "train_tokens_per_second": 622.628 }, { "epoch": 1.409401061410159, "grad_norm": 1.2924467325210571, "learning_rate": 5.934177215189873e-06, "loss": 0.044377949088811874, "num_input_tokens_seen": 2631576, "step": 1395, "train_runtime": 4226.2458, "train_tokens_per_second": 622.675 }, { "epoch": 1.410411928228456, "grad_norm": 1.0085480213165283, "learning_rate": 5.924050632911393e-06, "loss": 0.046639084815979004, "num_input_tokens_seen": 2633758, "step": 1396, "train_runtime": 4228.5679, "train_tokens_per_second": 622.849 }, { "epoch": 1.4114227950467526, "grad_norm": 1.485747218132019, "learning_rate": 5.913924050632912e-06, "loss": 0.057200685143470764, "num_input_tokens_seen": 2635928, "step": 1397, "train_runtime": 4230.8845, "train_tokens_per_second": 623.021 }, { "epoch": 1.4124336618650493, "grad_norm": 1.4903545379638672, "learning_rate": 5.903797468354431e-06, "loss": 0.05418243259191513, "num_input_tokens_seen": 2637284, "step": 1398, "train_runtime": 4233.0715, "train_tokens_per_second": 623.019 }, { "epoch": 1.413444528683346, "grad_norm": 1.4975517988204956, "learning_rate": 5.89367088607595e-06, "loss": 0.06205286830663681, "num_input_tokens_seen": 2639002, "step": 1399, "train_runtime": 4235.2916, "train_tokens_per_second": 623.098 }, { "epoch": 1.4144553955016428, "grad_norm": 1.6095198392868042, "learning_rate": 5.88354430379747e-06, "loss": 0.053863804787397385, "num_input_tokens_seen": 2640572, "step": 1400, "train_runtime": 4237.4897, "train_tokens_per_second": 623.145 }, { "epoch": 1.4154662623199394, "grad_norm": 1.2906925678253174, "learning_rate": 5.873417721518988e-06, "loss": 0.05912800133228302, "num_input_tokens_seen": 2642784, "step": 1401, "train_runtime": 4239.8582, "train_tokens_per_second": 623.319 }, { "epoch": 1.416477129138236, "grad_norm": 0.9742889404296875, "learning_rate": 5.863291139240507e-06, "loss": 0.04222407191991806, "num_input_tokens_seen": 2645018, "step": 1402, "train_runtime": 4242.2005, "train_tokens_per_second": 623.501 }, { "epoch": 1.4174879959565327, "grad_norm": 1.3450779914855957, "learning_rate": 5.853164556962025e-06, "loss": 0.04991640895605087, "num_input_tokens_seen": 2646966, "step": 1403, "train_runtime": 4244.4943, "train_tokens_per_second": 623.623 }, { "epoch": 1.4184988627748294, "grad_norm": 1.3153343200683594, "learning_rate": 5.843037974683545e-06, "loss": 0.06341435760259628, "num_input_tokens_seen": 2649610, "step": 1404, "train_runtime": 4246.9311, "train_tokens_per_second": 623.888 }, { "epoch": 1.419509729593126, "grad_norm": 1.331592321395874, "learning_rate": 5.832911392405064e-06, "loss": 0.05741046741604805, "num_input_tokens_seen": 2651580, "step": 1405, "train_runtime": 4249.2265, "train_tokens_per_second": 624.015 }, { "epoch": 1.4205205964114227, "grad_norm": 1.0401424169540405, "learning_rate": 5.8227848101265824e-06, "loss": 0.0531093031167984, "num_input_tokens_seen": 2653682, "step": 1406, "train_runtime": 4251.5097, "train_tokens_per_second": 624.174 }, { "epoch": 1.4215314632297193, "grad_norm": 1.3022911548614502, "learning_rate": 5.8126582278481015e-06, "loss": 0.0452243909239769, "num_input_tokens_seen": 2655742, "step": 1407, "train_runtime": 4253.8024, "train_tokens_per_second": 624.322 }, { "epoch": 1.4225423300480162, "grad_norm": 1.4204517602920532, "learning_rate": 5.8025316455696214e-06, "loss": 0.06786120682954788, "num_input_tokens_seen": 2658112, "step": 1408, "train_runtime": 4256.172, "train_tokens_per_second": 624.531 }, { "epoch": 1.4235531968663129, "grad_norm": 1.1559796333312988, "learning_rate": 5.79240506329114e-06, "loss": 0.03615058958530426, "num_input_tokens_seen": 2659640, "step": 1409, "train_runtime": 4258.3596, "train_tokens_per_second": 624.569 }, { "epoch": 1.4245640636846095, "grad_norm": 1.2559725046157837, "learning_rate": 5.782278481012659e-06, "loss": 0.05145192891359329, "num_input_tokens_seen": 2661468, "step": 1410, "train_runtime": 4260.6147, "train_tokens_per_second": 624.668 }, { "epoch": 1.4255749305029062, "grad_norm": 1.135015606880188, "learning_rate": 5.772151898734177e-06, "loss": 0.04511488974094391, "num_input_tokens_seen": 2663680, "step": 1411, "train_runtime": 4277.3982, "train_tokens_per_second": 622.734 }, { "epoch": 1.426585797321203, "grad_norm": 1.108528733253479, "learning_rate": 5.762025316455697e-06, "loss": 0.058695998042821884, "num_input_tokens_seen": 2666480, "step": 1412, "train_runtime": 4279.9157, "train_tokens_per_second": 623.022 }, { "epoch": 1.4275966641394997, "grad_norm": 1.3734612464904785, "learning_rate": 5.751898734177216e-06, "loss": 0.06597540527582169, "num_input_tokens_seen": 2668490, "step": 1413, "train_runtime": 4282.2171, "train_tokens_per_second": 623.156 }, { "epoch": 1.4286075309577964, "grad_norm": 1.483980655670166, "learning_rate": 5.741772151898734e-06, "loss": 0.06790570914745331, "num_input_tokens_seen": 2670236, "step": 1414, "train_runtime": 4284.5602, "train_tokens_per_second": 623.223 }, { "epoch": 1.429618397776093, "grad_norm": 1.3360049724578857, "learning_rate": 5.731645569620253e-06, "loss": 0.0684797614812851, "num_input_tokens_seen": 2672264, "step": 1415, "train_runtime": 4286.8856, "train_tokens_per_second": 623.358 }, { "epoch": 1.4306292645943897, "grad_norm": 1.18574857711792, "learning_rate": 5.721518987341773e-06, "loss": 0.05380445718765259, "num_input_tokens_seen": 2674302, "step": 1416, "train_runtime": 4289.1527, "train_tokens_per_second": 623.504 }, { "epoch": 1.4316401314126863, "grad_norm": 1.2353146076202393, "learning_rate": 5.7113924050632915e-06, "loss": 0.04403803125023842, "num_input_tokens_seen": 2676036, "step": 1417, "train_runtime": 4291.3891, "train_tokens_per_second": 623.583 }, { "epoch": 1.432650998230983, "grad_norm": 1.565489649772644, "learning_rate": 5.701265822784811e-06, "loss": 0.08054578304290771, "num_input_tokens_seen": 2678014, "step": 1418, "train_runtime": 4293.6992, "train_tokens_per_second": 623.708 }, { "epoch": 1.4336618650492798, "grad_norm": 1.164918065071106, "learning_rate": 5.69113924050633e-06, "loss": 0.04634508490562439, "num_input_tokens_seen": 2679970, "step": 1419, "train_runtime": 4295.9793, "train_tokens_per_second": 623.832 }, { "epoch": 1.4346727318675765, "grad_norm": 1.5861961841583252, "learning_rate": 5.681012658227849e-06, "loss": 0.07068551331758499, "num_input_tokens_seen": 2681874, "step": 1420, "train_runtime": 4298.263, "train_tokens_per_second": 623.944 }, { "epoch": 1.4356835986858731, "grad_norm": 1.173180341720581, "learning_rate": 5.670886075949368e-06, "loss": 0.04166347160935402, "num_input_tokens_seen": 2683802, "step": 1421, "train_runtime": 4300.5509, "train_tokens_per_second": 624.06 }, { "epoch": 1.4366944655041698, "grad_norm": 1.6341310739517212, "learning_rate": 5.660759493670886e-06, "loss": 0.06834426522254944, "num_input_tokens_seen": 2685204, "step": 1422, "train_runtime": 4302.6621, "train_tokens_per_second": 624.08 }, { "epoch": 1.4377053323224664, "grad_norm": 1.2905670404434204, "learning_rate": 5.650632911392405e-06, "loss": 0.0567033626139164, "num_input_tokens_seen": 2687734, "step": 1423, "train_runtime": 4305.0868, "train_tokens_per_second": 624.316 }, { "epoch": 1.4387161991407633, "grad_norm": 1.6841981410980225, "learning_rate": 5.640506329113925e-06, "loss": 0.06087081879377365, "num_input_tokens_seen": 2689396, "step": 1424, "train_runtime": 4307.329, "train_tokens_per_second": 624.377 }, { "epoch": 1.43972706595906, "grad_norm": 1.744522213935852, "learning_rate": 5.630379746835443e-06, "loss": 0.07477660477161407, "num_input_tokens_seen": 2691060, "step": 1425, "train_runtime": 4309.5386, "train_tokens_per_second": 624.443 }, { "epoch": 1.4407379327773566, "grad_norm": 1.0791798830032349, "learning_rate": 5.6202531645569624e-06, "loss": 0.03928723931312561, "num_input_tokens_seen": 2692586, "step": 1426, "train_runtime": 4311.6925, "train_tokens_per_second": 624.485 }, { "epoch": 1.4417487995956533, "grad_norm": 1.3450736999511719, "learning_rate": 5.6101265822784815e-06, "loss": 0.06375723332166672, "num_input_tokens_seen": 2694948, "step": 1427, "train_runtime": 4314.0879, "train_tokens_per_second": 624.685 }, { "epoch": 1.44275966641395, "grad_norm": 2.001465320587158, "learning_rate": 5.600000000000001e-06, "loss": 0.05643053352832794, "num_input_tokens_seen": 2697050, "step": 1428, "train_runtime": 4316.3871, "train_tokens_per_second": 624.84 }, { "epoch": 1.4437705332322466, "grad_norm": 1.0974299907684326, "learning_rate": 5.58987341772152e-06, "loss": 0.05764308571815491, "num_input_tokens_seen": 2699474, "step": 1429, "train_runtime": 4318.7847, "train_tokens_per_second": 625.054 }, { "epoch": 1.4447814000505432, "grad_norm": 1.6183689832687378, "learning_rate": 5.579746835443039e-06, "loss": 0.07020246237516403, "num_input_tokens_seen": 2701090, "step": 1430, "train_runtime": 4320.9917, "train_tokens_per_second": 625.109 }, { "epoch": 1.44579226686884, "grad_norm": 1.2373324632644653, "learning_rate": 5.569620253164557e-06, "loss": 0.0557381808757782, "num_input_tokens_seen": 2702828, "step": 1431, "train_runtime": 4323.2133, "train_tokens_per_second": 625.19 }, { "epoch": 1.4468031336871368, "grad_norm": 1.3397997617721558, "learning_rate": 5.559493670886077e-06, "loss": 0.05817887932062149, "num_input_tokens_seen": 2704850, "step": 1432, "train_runtime": 4325.4847, "train_tokens_per_second": 625.329 }, { "epoch": 1.4478140005054334, "grad_norm": 1.0370874404907227, "learning_rate": 5.549367088607596e-06, "loss": 0.04069850966334343, "num_input_tokens_seen": 2706554, "step": 1433, "train_runtime": 4327.7331, "train_tokens_per_second": 625.398 }, { "epoch": 1.44882486732373, "grad_norm": 2.3947393894195557, "learning_rate": 5.539240506329114e-06, "loss": 0.06741803884506226, "num_input_tokens_seen": 2708422, "step": 1434, "train_runtime": 4330.0563, "train_tokens_per_second": 625.493 }, { "epoch": 1.4498357341420267, "grad_norm": 2.450782060623169, "learning_rate": 5.529113924050633e-06, "loss": 0.0634034126996994, "num_input_tokens_seen": 2710138, "step": 1435, "train_runtime": 4332.33, "train_tokens_per_second": 625.561 }, { "epoch": 1.4508466009603236, "grad_norm": 1.5516140460968018, "learning_rate": 5.518987341772153e-06, "loss": 0.08794175833463669, "num_input_tokens_seen": 2712362, "step": 1436, "train_runtime": 4334.739, "train_tokens_per_second": 625.727 }, { "epoch": 1.4518574677786202, "grad_norm": 1.4325538873672485, "learning_rate": 5.5088607594936715e-06, "loss": 0.06939689069986343, "num_input_tokens_seen": 2714324, "step": 1437, "train_runtime": 4337.0449, "train_tokens_per_second": 625.846 }, { "epoch": 1.4528683345969169, "grad_norm": 1.338346004486084, "learning_rate": 5.498734177215191e-06, "loss": 0.03815968334674835, "num_input_tokens_seen": 2716354, "step": 1438, "train_runtime": 4339.3454, "train_tokens_per_second": 625.982 }, { "epoch": 1.4538792014152135, "grad_norm": 1.0405141115188599, "learning_rate": 5.488607594936709e-06, "loss": 0.035293880850076675, "num_input_tokens_seen": 2718476, "step": 1439, "train_runtime": 4341.6901, "train_tokens_per_second": 626.133 }, { "epoch": 1.4548900682335102, "grad_norm": 2.9229345321655273, "learning_rate": 5.478481012658229e-06, "loss": 0.05270947888493538, "num_input_tokens_seen": 2720324, "step": 1440, "train_runtime": 4343.9417, "train_tokens_per_second": 626.234 }, { "epoch": 1.4559009350518068, "grad_norm": 1.3125211000442505, "learning_rate": 5.468354430379748e-06, "loss": 0.047921039164066315, "num_input_tokens_seen": 2721974, "step": 1441, "train_runtime": 4359.5344, "train_tokens_per_second": 624.373 }, { "epoch": 1.4569118018701035, "grad_norm": 1.2566816806793213, "learning_rate": 5.458227848101266e-06, "loss": 0.0636405348777771, "num_input_tokens_seen": 2724214, "step": 1442, "train_runtime": 4361.9161, "train_tokens_per_second": 624.545 }, { "epoch": 1.4579226686884004, "grad_norm": 2.127671480178833, "learning_rate": 5.448101265822785e-06, "loss": 0.09057963639497757, "num_input_tokens_seen": 2725932, "step": 1443, "train_runtime": 4364.43, "train_tokens_per_second": 624.579 }, { "epoch": 1.458933535506697, "grad_norm": 2.1411712169647217, "learning_rate": 5.437974683544303e-06, "loss": 0.060190021991729736, "num_input_tokens_seen": 2727498, "step": 1444, "train_runtime": 4366.7173, "train_tokens_per_second": 624.611 }, { "epoch": 1.4599444023249937, "grad_norm": 1.2093969583511353, "learning_rate": 5.427848101265823e-06, "loss": 0.042883116751909256, "num_input_tokens_seen": 2729276, "step": 1445, "train_runtime": 4368.9357, "train_tokens_per_second": 624.7 }, { "epoch": 1.4609552691432903, "grad_norm": 1.0948315858840942, "learning_rate": 5.417721518987342e-06, "loss": 0.04013436287641525, "num_input_tokens_seen": 2731094, "step": 1446, "train_runtime": 4371.2213, "train_tokens_per_second": 624.79 }, { "epoch": 1.4619661359615872, "grad_norm": 1.258665680885315, "learning_rate": 5.407594936708861e-06, "loss": 0.04527812823653221, "num_input_tokens_seen": 2732632, "step": 1447, "train_runtime": 4373.3988, "train_tokens_per_second": 624.83 }, { "epoch": 1.4629770027798839, "grad_norm": 1.2352830171585083, "learning_rate": 5.39746835443038e-06, "loss": 0.06785471737384796, "num_input_tokens_seen": 2734660, "step": 1448, "train_runtime": 4375.7124, "train_tokens_per_second": 624.963 }, { "epoch": 1.4639878695981805, "grad_norm": 1.411289930343628, "learning_rate": 5.3873417721519e-06, "loss": 0.06744305789470673, "num_input_tokens_seen": 2736088, "step": 1449, "train_runtime": 4377.8714, "train_tokens_per_second": 624.981 }, { "epoch": 1.4649987364164772, "grad_norm": 1.1486389636993408, "learning_rate": 5.377215189873418e-06, "loss": 0.041869692504405975, "num_input_tokens_seen": 2737516, "step": 1450, "train_runtime": 4380.0118, "train_tokens_per_second": 625.002 }, { "epoch": 1.4660096032347738, "grad_norm": 1.1115456819534302, "learning_rate": 5.367088607594937e-06, "loss": 0.05015439912676811, "num_input_tokens_seen": 2740122, "step": 1451, "train_runtime": 4382.459, "train_tokens_per_second": 625.248 }, { "epoch": 1.4670204700530705, "grad_norm": 1.5198140144348145, "learning_rate": 5.356962025316455e-06, "loss": 0.05162966996431351, "num_input_tokens_seen": 2741914, "step": 1452, "train_runtime": 4384.7514, "train_tokens_per_second": 625.329 }, { "epoch": 1.468031336871367, "grad_norm": 1.2787257432937622, "learning_rate": 5.346835443037975e-06, "loss": 0.04590470343828201, "num_input_tokens_seen": 2743786, "step": 1453, "train_runtime": 4387.0441, "train_tokens_per_second": 625.429 }, { "epoch": 1.4690422036896638, "grad_norm": 1.1875731945037842, "learning_rate": 5.336708860759494e-06, "loss": 0.048388317227363586, "num_input_tokens_seen": 2745376, "step": 1454, "train_runtime": 4389.209, "train_tokens_per_second": 625.483 }, { "epoch": 1.4700530705079606, "grad_norm": 1.0641950368881226, "learning_rate": 5.3265822784810125e-06, "loss": 0.04221426323056221, "num_input_tokens_seen": 2747474, "step": 1455, "train_runtime": 4391.5383, "train_tokens_per_second": 625.629 }, { "epoch": 1.4710639373262573, "grad_norm": 1.1338188648223877, "learning_rate": 5.3164556962025316e-06, "loss": 0.04780226945877075, "num_input_tokens_seen": 2749496, "step": 1456, "train_runtime": 4393.8789, "train_tokens_per_second": 625.756 }, { "epoch": 1.472074804144554, "grad_norm": 1.335322380065918, "learning_rate": 5.3063291139240515e-06, "loss": 0.06389928609132767, "num_input_tokens_seen": 2751386, "step": 1457, "train_runtime": 4396.1554, "train_tokens_per_second": 625.862 }, { "epoch": 1.4730856709628506, "grad_norm": 1.1962878704071045, "learning_rate": 5.29620253164557e-06, "loss": 0.05268601328134537, "num_input_tokens_seen": 2753164, "step": 1458, "train_runtime": 4398.3912, "train_tokens_per_second": 625.948 }, { "epoch": 1.4740965377811475, "grad_norm": 1.2526472806930542, "learning_rate": 5.286075949367089e-06, "loss": 0.050169482827186584, "num_input_tokens_seen": 2755032, "step": 1459, "train_runtime": 4400.6965, "train_tokens_per_second": 626.045 }, { "epoch": 1.4751074045994441, "grad_norm": 1.687121033668518, "learning_rate": 5.275949367088608e-06, "loss": 0.046259500086307526, "num_input_tokens_seen": 2756680, "step": 1460, "train_runtime": 4402.9523, "train_tokens_per_second": 626.098 }, { "epoch": 1.4761182714177408, "grad_norm": 1.152158260345459, "learning_rate": 5.265822784810127e-06, "loss": 0.04726831614971161, "num_input_tokens_seen": 2758496, "step": 1461, "train_runtime": 4405.1903, "train_tokens_per_second": 626.192 }, { "epoch": 1.4771291382360374, "grad_norm": 1.302581787109375, "learning_rate": 5.255696202531646e-06, "loss": 0.05704841390252113, "num_input_tokens_seen": 2760264, "step": 1462, "train_runtime": 4407.4014, "train_tokens_per_second": 626.279 }, { "epoch": 1.478140005054334, "grad_norm": 1.2298142910003662, "learning_rate": 5.245569620253165e-06, "loss": 0.053375955671072006, "num_input_tokens_seen": 2762474, "step": 1463, "train_runtime": 4409.7349, "train_tokens_per_second": 626.449 }, { "epoch": 1.4791508718726307, "grad_norm": 1.3026584386825562, "learning_rate": 5.235443037974683e-06, "loss": 0.07974346727132797, "num_input_tokens_seen": 2764950, "step": 1464, "train_runtime": 4412.1653, "train_tokens_per_second": 626.665 }, { "epoch": 1.4801617386909274, "grad_norm": 1.2211552858352661, "learning_rate": 5.225316455696203e-06, "loss": 0.04752020537853241, "num_input_tokens_seen": 2766558, "step": 1465, "train_runtime": 4414.3802, "train_tokens_per_second": 626.715 }, { "epoch": 1.481172605509224, "grad_norm": 1.1044403314590454, "learning_rate": 5.2151898734177216e-06, "loss": 0.04026167094707489, "num_input_tokens_seen": 2768498, "step": 1466, "train_runtime": 4416.6897, "train_tokens_per_second": 626.826 }, { "epoch": 1.482183472327521, "grad_norm": 1.61728835105896, "learning_rate": 5.205063291139241e-06, "loss": 0.06809349358081818, "num_input_tokens_seen": 2770106, "step": 1467, "train_runtime": 4418.9009, "train_tokens_per_second": 626.877 }, { "epoch": 1.4831943391458176, "grad_norm": 1.3205126523971558, "learning_rate": 5.19493670886076e-06, "loss": 0.0746985524892807, "num_input_tokens_seen": 2771954, "step": 1468, "train_runtime": 4421.1396, "train_tokens_per_second": 626.977 }, { "epoch": 1.4842052059641142, "grad_norm": 1.513152003288269, "learning_rate": 5.184810126582279e-06, "loss": 0.04724295809864998, "num_input_tokens_seen": 2773760, "step": 1469, "train_runtime": 4423.3732, "train_tokens_per_second": 627.069 }, { "epoch": 1.4852160727824109, "grad_norm": 1.2082949876785278, "learning_rate": 5.174683544303798e-06, "loss": 0.06078195571899414, "num_input_tokens_seen": 2776132, "step": 1470, "train_runtime": 4425.7458, "train_tokens_per_second": 627.269 }, { "epoch": 1.4862269396007077, "grad_norm": 1.462839961051941, "learning_rate": 5.164556962025317e-06, "loss": 0.04663144052028656, "num_input_tokens_seen": 2777870, "step": 1471, "train_runtime": 4442.6069, "train_tokens_per_second": 625.279 }, { "epoch": 1.4872378064190044, "grad_norm": 1.2602648735046387, "learning_rate": 5.154430379746835e-06, "loss": 0.05627944692969322, "num_input_tokens_seen": 2779626, "step": 1472, "train_runtime": 4444.8361, "train_tokens_per_second": 625.361 }, { "epoch": 1.488248673237301, "grad_norm": 1.3976972103118896, "learning_rate": 5.144303797468355e-06, "loss": 0.057730481028556824, "num_input_tokens_seen": 2780798, "step": 1473, "train_runtime": 4446.9424, "train_tokens_per_second": 625.328 }, { "epoch": 1.4892595400555977, "grad_norm": 1.3106977939605713, "learning_rate": 5.134177215189874e-06, "loss": 0.0638170912861824, "num_input_tokens_seen": 2782748, "step": 1474, "train_runtime": 4449.1785, "train_tokens_per_second": 625.452 }, { "epoch": 1.4902704068738943, "grad_norm": 1.3717737197875977, "learning_rate": 5.1240506329113925e-06, "loss": 0.041115276515483856, "num_input_tokens_seen": 2784756, "step": 1475, "train_runtime": 4451.4857, "train_tokens_per_second": 625.579 }, { "epoch": 1.491281273692191, "grad_norm": 1.4171078205108643, "learning_rate": 5.1139240506329116e-06, "loss": 0.04597721993923187, "num_input_tokens_seen": 2786760, "step": 1476, "train_runtime": 4453.792, "train_tokens_per_second": 625.705 }, { "epoch": 1.4922921405104876, "grad_norm": 1.3031914234161377, "learning_rate": 5.1037974683544315e-06, "loss": 0.06663566827774048, "num_input_tokens_seen": 2788472, "step": 1477, "train_runtime": 4456.0151, "train_tokens_per_second": 625.777 }, { "epoch": 1.4933030073287845, "grad_norm": 1.0535391569137573, "learning_rate": 5.09367088607595e-06, "loss": 0.0422329418361187, "num_input_tokens_seen": 2790172, "step": 1478, "train_runtime": 4458.2598, "train_tokens_per_second": 625.843 }, { "epoch": 1.4943138741470812, "grad_norm": 1.1845626831054688, "learning_rate": 5.083544303797469e-06, "loss": 0.04153173416852951, "num_input_tokens_seen": 2791846, "step": 1479, "train_runtime": 4460.509, "train_tokens_per_second": 625.903 }, { "epoch": 1.4953247409653778, "grad_norm": 1.359662652015686, "learning_rate": 5.073417721518987e-06, "loss": 0.06811964511871338, "num_input_tokens_seen": 2793818, "step": 1480, "train_runtime": 4462.8299, "train_tokens_per_second": 626.019 }, { "epoch": 1.4963356077836745, "grad_norm": 1.278808355331421, "learning_rate": 5.063291139240507e-06, "loss": 0.051876235753297806, "num_input_tokens_seen": 2795626, "step": 1481, "train_runtime": 4465.0788, "train_tokens_per_second": 626.109 }, { "epoch": 1.4973464746019711, "grad_norm": 1.8733328580856323, "learning_rate": 5.053164556962026e-06, "loss": 0.0724148079752922, "num_input_tokens_seen": 2797286, "step": 1482, "train_runtime": 4467.2961, "train_tokens_per_second": 626.17 }, { "epoch": 1.498357341420268, "grad_norm": 1.9308044910430908, "learning_rate": 5.043037974683544e-06, "loss": 0.06310687959194183, "num_input_tokens_seen": 2798946, "step": 1483, "train_runtime": 4469.5211, "train_tokens_per_second": 626.23 }, { "epoch": 1.4993682082385646, "grad_norm": 1.4102615118026733, "learning_rate": 5.032911392405063e-06, "loss": 0.06878439337015152, "num_input_tokens_seen": 2800864, "step": 1484, "train_runtime": 4471.8112, "train_tokens_per_second": 626.338 }, { "epoch": 1.5003790750568613, "grad_norm": 1.3868674039840698, "learning_rate": 5.022784810126583e-06, "loss": 0.04760458692908287, "num_input_tokens_seen": 2802846, "step": 1485, "train_runtime": 4474.1019, "train_tokens_per_second": 626.46 }, { "epoch": 1.501389941875158, "grad_norm": 1.689648151397705, "learning_rate": 5.0126582278481016e-06, "loss": 0.08007767796516418, "num_input_tokens_seen": 2804606, "step": 1486, "train_runtime": 4476.3512, "train_tokens_per_second": 626.538 }, { "epoch": 1.5024008086934546, "grad_norm": 1.2327882051467896, "learning_rate": 5.002531645569621e-06, "loss": 0.047864578664302826, "num_input_tokens_seen": 2806254, "step": 1487, "train_runtime": 4478.5873, "train_tokens_per_second": 626.594 }, { "epoch": 1.5034116755117513, "grad_norm": 1.3961400985717773, "learning_rate": 4.99240506329114e-06, "loss": 0.057346735149621964, "num_input_tokens_seen": 2807812, "step": 1488, "train_runtime": 4480.7738, "train_tokens_per_second": 626.636 }, { "epoch": 1.504422542330048, "grad_norm": 1.029375433921814, "learning_rate": 4.982278481012659e-06, "loss": 0.04208916798233986, "num_input_tokens_seen": 2809866, "step": 1489, "train_runtime": 4483.0693, "train_tokens_per_second": 626.773 }, { "epoch": 1.5054334091483446, "grad_norm": 1.3852033615112305, "learning_rate": 4.972151898734178e-06, "loss": 0.05466679483652115, "num_input_tokens_seen": 2811744, "step": 1490, "train_runtime": 4485.3238, "train_tokens_per_second": 626.876 }, { "epoch": 1.5064442759666414, "grad_norm": 1.0315070152282715, "learning_rate": 4.962025316455696e-06, "loss": 0.05923735350370407, "num_input_tokens_seen": 2814384, "step": 1491, "train_runtime": 4487.7906, "train_tokens_per_second": 627.12 }, { "epoch": 1.507455142784938, "grad_norm": 1.108384132385254, "learning_rate": 4.951898734177216e-06, "loss": 0.05330324172973633, "num_input_tokens_seen": 2816184, "step": 1492, "train_runtime": 4490.0461, "train_tokens_per_second": 627.206 }, { "epoch": 1.5084660096032347, "grad_norm": 1.3703676462173462, "learning_rate": 4.941772151898734e-06, "loss": 0.05342656746506691, "num_input_tokens_seen": 2818180, "step": 1493, "train_runtime": 4492.3853, "train_tokens_per_second": 627.324 }, { "epoch": 1.5094768764215316, "grad_norm": 1.3506438732147217, "learning_rate": 4.931645569620253e-06, "loss": 0.05577048659324646, "num_input_tokens_seen": 2820102, "step": 1494, "train_runtime": 4494.6641, "train_tokens_per_second": 627.433 }, { "epoch": 1.5104877432398283, "grad_norm": 1.4416794776916504, "learning_rate": 4.9215189873417725e-06, "loss": 0.04947788268327713, "num_input_tokens_seen": 2821580, "step": 1495, "train_runtime": 4496.8705, "train_tokens_per_second": 627.454 }, { "epoch": 1.511498610058125, "grad_norm": 1.0802147388458252, "learning_rate": 4.9113924050632915e-06, "loss": 0.042999714612960815, "num_input_tokens_seen": 2824202, "step": 1496, "train_runtime": 4499.3361, "train_tokens_per_second": 627.693 }, { "epoch": 1.5125094768764216, "grad_norm": 1.066115379333496, "learning_rate": 4.901265822784811e-06, "loss": 0.05374641716480255, "num_input_tokens_seen": 2826432, "step": 1497, "train_runtime": 4501.7328, "train_tokens_per_second": 627.854 }, { "epoch": 1.5135203436947182, "grad_norm": 1.0133928060531616, "learning_rate": 4.89113924050633e-06, "loss": 0.04801242798566818, "num_input_tokens_seen": 2828690, "step": 1498, "train_runtime": 4504.1005, "train_tokens_per_second": 628.026 }, { "epoch": 1.5145312105130149, "grad_norm": 1.4185975790023804, "learning_rate": 4.881012658227848e-06, "loss": 0.053610898554325104, "num_input_tokens_seen": 2830248, "step": 1499, "train_runtime": 4506.3101, "train_tokens_per_second": 628.063 }, { "epoch": 1.5155420773313115, "grad_norm": 1.0259369611740112, "learning_rate": 4.870886075949368e-06, "loss": 0.04819566756486893, "num_input_tokens_seen": 2832522, "step": 1500, "train_runtime": 4508.6847, "train_tokens_per_second": 628.237 }, { "epoch": 1.5165529441496082, "grad_norm": 1.22133469581604, "learning_rate": 4.860759493670886e-06, "loss": 0.05674818158149719, "num_input_tokens_seen": 2834288, "step": 1501, "train_runtime": 4524.4207, "train_tokens_per_second": 626.442 }, { "epoch": 1.5175638109679048, "grad_norm": 1.2766376733779907, "learning_rate": 4.850632911392405e-06, "loss": 0.05139131098985672, "num_input_tokens_seen": 2836114, "step": 1502, "train_runtime": 4526.8123, "train_tokens_per_second": 626.515 }, { "epoch": 1.5185746777862017, "grad_norm": 1.3432129621505737, "learning_rate": 4.840506329113924e-06, "loss": 0.06788015365600586, "num_input_tokens_seen": 2838072, "step": 1503, "train_runtime": 4529.1766, "train_tokens_per_second": 626.62 }, { "epoch": 1.5195855446044984, "grad_norm": 1.4195806980133057, "learning_rate": 4.830379746835443e-06, "loss": 0.049872562289237976, "num_input_tokens_seen": 2840010, "step": 1504, "train_runtime": 4531.4606, "train_tokens_per_second": 626.732 }, { "epoch": 1.520596411422795, "grad_norm": 1.5526108741760254, "learning_rate": 4.8202531645569625e-06, "loss": 0.04352928698062897, "num_input_tokens_seen": 2841990, "step": 1505, "train_runtime": 4533.7361, "train_tokens_per_second": 626.854 }, { "epoch": 1.5216072782410919, "grad_norm": 1.3962048292160034, "learning_rate": 4.8101265822784815e-06, "loss": 0.05957988277077675, "num_input_tokens_seen": 2843498, "step": 1506, "train_runtime": 4535.8841, "train_tokens_per_second": 626.889 }, { "epoch": 1.5226181450593885, "grad_norm": 1.6576125621795654, "learning_rate": 4.800000000000001e-06, "loss": 0.07533112168312073, "num_input_tokens_seen": 2845090, "step": 1507, "train_runtime": 4538.0583, "train_tokens_per_second": 626.94 }, { "epoch": 1.5236290118776852, "grad_norm": 1.7079765796661377, "learning_rate": 4.78987341772152e-06, "loss": 0.0601004958152771, "num_input_tokens_seen": 2846700, "step": 1508, "train_runtime": 4540.2674, "train_tokens_per_second": 626.989 }, { "epoch": 1.5246398786959818, "grad_norm": 1.2272881269454956, "learning_rate": 4.779746835443038e-06, "loss": 0.04607832804322243, "num_input_tokens_seen": 2848114, "step": 1509, "train_runtime": 4542.4244, "train_tokens_per_second": 627.003 }, { "epoch": 1.5256507455142785, "grad_norm": 1.4930332899093628, "learning_rate": 4.769620253164557e-06, "loss": 0.07360376417636871, "num_input_tokens_seen": 2849846, "step": 1510, "train_runtime": 4544.6459, "train_tokens_per_second": 627.078 }, { "epoch": 1.5266616123325751, "grad_norm": 1.4419664144515991, "learning_rate": 4.759493670886076e-06, "loss": 0.06184345483779907, "num_input_tokens_seen": 2851468, "step": 1511, "train_runtime": 4546.8862, "train_tokens_per_second": 627.125 }, { "epoch": 1.5276724791508718, "grad_norm": 1.348374605178833, "learning_rate": 4.749367088607595e-06, "loss": 0.06621316820383072, "num_input_tokens_seen": 2853370, "step": 1512, "train_runtime": 4549.1738, "train_tokens_per_second": 627.228 }, { "epoch": 1.5286833459691684, "grad_norm": 1.2672215700149536, "learning_rate": 4.739240506329114e-06, "loss": 0.07050938159227371, "num_input_tokens_seen": 2855182, "step": 1513, "train_runtime": 4551.4166, "train_tokens_per_second": 627.317 }, { "epoch": 1.529694212787465, "grad_norm": 1.4655346870422363, "learning_rate": 4.729113924050633e-06, "loss": 0.06721789389848709, "num_input_tokens_seen": 2857214, "step": 1514, "train_runtime": 4553.7647, "train_tokens_per_second": 627.44 }, { "epoch": 1.530705079605762, "grad_norm": 1.517762541770935, "learning_rate": 4.7189873417721525e-06, "loss": 0.05682816356420517, "num_input_tokens_seen": 2859046, "step": 1515, "train_runtime": 4556.0681, "train_tokens_per_second": 627.525 }, { "epoch": 1.5317159464240586, "grad_norm": 1.3225510120391846, "learning_rate": 4.7088607594936715e-06, "loss": 0.05826298147439957, "num_input_tokens_seen": 2861014, "step": 1516, "train_runtime": 4558.4249, "train_tokens_per_second": 627.632 }, { "epoch": 1.5327268132423553, "grad_norm": 1.1289844512939453, "learning_rate": 4.69873417721519e-06, "loss": 0.0564601793885231, "num_input_tokens_seen": 2862968, "step": 1517, "train_runtime": 4560.7052, "train_tokens_per_second": 627.747 }, { "epoch": 1.5337376800606521, "grad_norm": 1.1863211393356323, "learning_rate": 4.68860759493671e-06, "loss": 0.03920586034655571, "num_input_tokens_seen": 2864930, "step": 1518, "train_runtime": 4562.9942, "train_tokens_per_second": 627.862 }, { "epoch": 1.5347485468789488, "grad_norm": 1.074202537536621, "learning_rate": 4.678481012658228e-06, "loss": 0.04804112762212753, "num_input_tokens_seen": 2867000, "step": 1519, "train_runtime": 4565.318, "train_tokens_per_second": 627.996 }, { "epoch": 1.5357594136972454, "grad_norm": 1.1481704711914062, "learning_rate": 4.668354430379747e-06, "loss": 0.040212418884038925, "num_input_tokens_seen": 2869152, "step": 1520, "train_runtime": 4567.6733, "train_tokens_per_second": 628.143 }, { "epoch": 1.536770280515542, "grad_norm": 1.4831442832946777, "learning_rate": 4.658227848101266e-06, "loss": 0.06600040942430496, "num_input_tokens_seen": 2870778, "step": 1521, "train_runtime": 4569.8853, "train_tokens_per_second": 628.195 }, { "epoch": 1.5377811473338387, "grad_norm": 1.2420631647109985, "learning_rate": 4.648101265822785e-06, "loss": 0.05727258324623108, "num_input_tokens_seen": 2872896, "step": 1522, "train_runtime": 4572.2168, "train_tokens_per_second": 628.338 }, { "epoch": 1.5387920141521354, "grad_norm": 1.1956125497817993, "learning_rate": 4.637974683544304e-06, "loss": 0.05453263595700264, "num_input_tokens_seen": 2874902, "step": 1523, "train_runtime": 4574.5244, "train_tokens_per_second": 628.459 }, { "epoch": 1.539802880970432, "grad_norm": 1.2424403429031372, "learning_rate": 4.627848101265823e-06, "loss": 0.049895938485860825, "num_input_tokens_seen": 2876462, "step": 1524, "train_runtime": 4576.7088, "train_tokens_per_second": 628.5 }, { "epoch": 1.5408137477887287, "grad_norm": 1.2138495445251465, "learning_rate": 4.617721518987342e-06, "loss": 0.06158655881881714, "num_input_tokens_seen": 2878202, "step": 1525, "train_runtime": 4578.9598, "train_tokens_per_second": 628.571 }, { "epoch": 1.5418246146070256, "grad_norm": 1.1184782981872559, "learning_rate": 4.6075949367088615e-06, "loss": 0.05643635615706444, "num_input_tokens_seen": 2880316, "step": 1526, "train_runtime": 4581.2901, "train_tokens_per_second": 628.713 }, { "epoch": 1.5428354814253222, "grad_norm": 1.4851226806640625, "learning_rate": 4.59746835443038e-06, "loss": 0.06179232895374298, "num_input_tokens_seen": 2881992, "step": 1527, "train_runtime": 4583.5051, "train_tokens_per_second": 628.775 }, { "epoch": 1.5438463482436189, "grad_norm": 0.94132000207901, "learning_rate": 4.587341772151899e-06, "loss": 0.03961401805281639, "num_input_tokens_seen": 2883762, "step": 1528, "train_runtime": 4585.7925, "train_tokens_per_second": 628.847 }, { "epoch": 1.5448572150619158, "grad_norm": 1.4120358228683472, "learning_rate": 4.577215189873418e-06, "loss": 0.0553383007645607, "num_input_tokens_seen": 2886030, "step": 1529, "train_runtime": 4588.1973, "train_tokens_per_second": 629.012 }, { "epoch": 1.5458680818802124, "grad_norm": 1.3151836395263672, "learning_rate": 4.567088607594937e-06, "loss": 0.05081061273813248, "num_input_tokens_seen": 2887852, "step": 1530, "train_runtime": 4590.4695, "train_tokens_per_second": 629.097 }, { "epoch": 1.546878948698509, "grad_norm": 1.3867336511611938, "learning_rate": 4.556962025316456e-06, "loss": 0.06330150365829468, "num_input_tokens_seen": 2889610, "step": 1531, "train_runtime": 4606.0312, "train_tokens_per_second": 627.354 }, { "epoch": 1.5478898155168057, "grad_norm": 1.3176735639572144, "learning_rate": 4.546835443037975e-06, "loss": 0.06053399667143822, "num_input_tokens_seen": 2891706, "step": 1532, "train_runtime": 4608.3281, "train_tokens_per_second": 627.496 }, { "epoch": 1.5489006823351024, "grad_norm": 1.4362438917160034, "learning_rate": 4.536708860759494e-06, "loss": 0.07300815731287003, "num_input_tokens_seen": 2893848, "step": 1533, "train_runtime": 4610.708, "train_tokens_per_second": 627.636 }, { "epoch": 1.549911549153399, "grad_norm": 1.0981767177581787, "learning_rate": 4.526582278481013e-06, "loss": 0.03816743940114975, "num_input_tokens_seen": 2895582, "step": 1534, "train_runtime": 4612.9444, "train_tokens_per_second": 627.708 }, { "epoch": 1.5509224159716957, "grad_norm": 1.4019081592559814, "learning_rate": 4.516455696202532e-06, "loss": 0.050167202949523926, "num_input_tokens_seen": 2897422, "step": 1535, "train_runtime": 4615.1556, "train_tokens_per_second": 627.806 }, { "epoch": 1.5519332827899923, "grad_norm": 1.178011178970337, "learning_rate": 4.5063291139240515e-06, "loss": 0.033923763781785965, "num_input_tokens_seen": 2898578, "step": 1536, "train_runtime": 4617.2118, "train_tokens_per_second": 627.777 }, { "epoch": 1.552944149608289, "grad_norm": 0.9976033568382263, "learning_rate": 4.49620253164557e-06, "loss": 0.051811426877975464, "num_input_tokens_seen": 2900830, "step": 1537, "train_runtime": 4619.5337, "train_tokens_per_second": 627.949 }, { "epoch": 1.5539550164265858, "grad_norm": 1.2337932586669922, "learning_rate": 4.486075949367089e-06, "loss": 0.05312459170818329, "num_input_tokens_seen": 2902758, "step": 1538, "train_runtime": 4621.804, "train_tokens_per_second": 628.057 }, { "epoch": 1.5549658832448825, "grad_norm": 1.2490909099578857, "learning_rate": 4.475949367088608e-06, "loss": 0.0594743937253952, "num_input_tokens_seen": 2904738, "step": 1539, "train_runtime": 4624.0593, "train_tokens_per_second": 628.179 }, { "epoch": 1.5559767500631791, "grad_norm": 1.274011492729187, "learning_rate": 4.465822784810127e-06, "loss": 0.06778080761432648, "num_input_tokens_seen": 2907096, "step": 1540, "train_runtime": 4626.4602, "train_tokens_per_second": 628.363 }, { "epoch": 1.556987616881476, "grad_norm": 1.357280969619751, "learning_rate": 4.455696202531646e-06, "loss": 0.06358253955841064, "num_input_tokens_seen": 2908836, "step": 1541, "train_runtime": 4628.8142, "train_tokens_per_second": 628.419 }, { "epoch": 1.5579984836997727, "grad_norm": 1.592889428138733, "learning_rate": 4.445569620253165e-06, "loss": 0.05604672431945801, "num_input_tokens_seen": 2910510, "step": 1542, "train_runtime": 4631.0341, "train_tokens_per_second": 628.48 }, { "epoch": 1.5590093505180693, "grad_norm": 0.9576203227043152, "learning_rate": 4.4354430379746834e-06, "loss": 0.03890995681285858, "num_input_tokens_seen": 2912316, "step": 1543, "train_runtime": 4633.265, "train_tokens_per_second": 628.567 }, { "epoch": 1.560020217336366, "grad_norm": 1.5377309322357178, "learning_rate": 4.425316455696203e-06, "loss": 0.0765279158949852, "num_input_tokens_seen": 2914070, "step": 1544, "train_runtime": 4635.5036, "train_tokens_per_second": 628.642 }, { "epoch": 1.5610310841546626, "grad_norm": 1.701785922050476, "learning_rate": 4.415189873417722e-06, "loss": 0.0848785936832428, "num_input_tokens_seen": 2916386, "step": 1545, "train_runtime": 4637.8598, "train_tokens_per_second": 628.822 }, { "epoch": 1.5620419509729593, "grad_norm": 1.2688883543014526, "learning_rate": 4.405063291139241e-06, "loss": 0.060875337570905685, "num_input_tokens_seen": 2918148, "step": 1546, "train_runtime": 4640.1228, "train_tokens_per_second": 628.895 }, { "epoch": 1.563052817791256, "grad_norm": 1.1968705654144287, "learning_rate": 4.39493670886076e-06, "loss": 0.0575110949575901, "num_input_tokens_seen": 2920642, "step": 1547, "train_runtime": 4642.5702, "train_tokens_per_second": 629.1 }, { "epoch": 1.5640636846095526, "grad_norm": 1.4697033166885376, "learning_rate": 4.384810126582279e-06, "loss": 0.06372949481010437, "num_input_tokens_seen": 2922254, "step": 1548, "train_runtime": 4644.8072, "train_tokens_per_second": 629.144 }, { "epoch": 1.5650745514278492, "grad_norm": 1.3741692304611206, "learning_rate": 4.374683544303798e-06, "loss": 0.04079161584377289, "num_input_tokens_seen": 2924156, "step": 1549, "train_runtime": 4647.0781, "train_tokens_per_second": 629.246 }, { "epoch": 1.566085418246146, "grad_norm": 1.4274075031280518, "learning_rate": 4.364556962025317e-06, "loss": 0.07402218133211136, "num_input_tokens_seen": 2926290, "step": 1550, "train_runtime": 4649.4117, "train_tokens_per_second": 629.389 }, { "epoch": 1.5670962850644428, "grad_norm": 1.2086807489395142, "learning_rate": 4.354430379746836e-06, "loss": 0.05297299474477768, "num_input_tokens_seen": 2928344, "step": 1551, "train_runtime": 4651.73, "train_tokens_per_second": 629.517 }, { "epoch": 1.5681071518827394, "grad_norm": 0.9295864105224609, "learning_rate": 4.344303797468355e-06, "loss": 0.032322127372026443, "num_input_tokens_seen": 2930198, "step": 1552, "train_runtime": 4654.0126, "train_tokens_per_second": 629.607 }, { "epoch": 1.5691180187010363, "grad_norm": 1.0612962245941162, "learning_rate": 4.3341772151898734e-06, "loss": 0.03210993483662605, "num_input_tokens_seen": 2931694, "step": 1553, "train_runtime": 4656.1517, "train_tokens_per_second": 629.639 }, { "epoch": 1.570128885519333, "grad_norm": 1.5804210901260376, "learning_rate": 4.3240506329113925e-06, "loss": 0.07168054580688477, "num_input_tokens_seen": 2933774, "step": 1554, "train_runtime": 4658.5312, "train_tokens_per_second": 629.764 }, { "epoch": 1.5711397523376296, "grad_norm": 1.3794080018997192, "learning_rate": 4.313924050632912e-06, "loss": 0.06514356285333633, "num_input_tokens_seen": 2935584, "step": 1555, "train_runtime": 4660.7964, "train_tokens_per_second": 629.846 }, { "epoch": 1.5721506191559262, "grad_norm": 1.4102269411087036, "learning_rate": 4.303797468354431e-06, "loss": 0.05319744348526001, "num_input_tokens_seen": 2937110, "step": 1556, "train_runtime": 4663.002, "train_tokens_per_second": 629.875 }, { "epoch": 1.573161485974223, "grad_norm": 1.2388628721237183, "learning_rate": 4.29367088607595e-06, "loss": 0.04378683865070343, "num_input_tokens_seen": 2938708, "step": 1557, "train_runtime": 4665.1951, "train_tokens_per_second": 629.922 }, { "epoch": 1.5741723527925195, "grad_norm": 1.3174517154693604, "learning_rate": 4.283544303797469e-06, "loss": 0.06327192485332489, "num_input_tokens_seen": 2941278, "step": 1558, "train_runtime": 4667.7011, "train_tokens_per_second": 630.134 }, { "epoch": 1.5751832196108162, "grad_norm": 1.4438049793243408, "learning_rate": 4.273417721518988e-06, "loss": 0.06322846561670303, "num_input_tokens_seen": 2942738, "step": 1559, "train_runtime": 4669.8447, "train_tokens_per_second": 630.158 }, { "epoch": 1.5761940864291129, "grad_norm": 1.2885171175003052, "learning_rate": 4.263291139240507e-06, "loss": 0.05553532764315605, "num_input_tokens_seen": 2944420, "step": 1560, "train_runtime": 4672.0637, "train_tokens_per_second": 630.218 }, { "epoch": 1.5772049532474095, "grad_norm": 1.6389775276184082, "learning_rate": 4.253164556962025e-06, "loss": 0.06942377984523773, "num_input_tokens_seen": 2946336, "step": 1561, "train_runtime": 4687.7107, "train_tokens_per_second": 628.523 }, { "epoch": 1.5782158200657064, "grad_norm": 1.2550915479660034, "learning_rate": 4.243037974683545e-06, "loss": 0.06170507147908211, "num_input_tokens_seen": 2947836, "step": 1562, "train_runtime": 4689.8812, "train_tokens_per_second": 628.552 }, { "epoch": 1.579226686884003, "grad_norm": 1.1916841268539429, "learning_rate": 4.232911392405063e-06, "loss": 0.055288903415203094, "num_input_tokens_seen": 2950112, "step": 1563, "train_runtime": 4692.2551, "train_tokens_per_second": 628.719 }, { "epoch": 1.5802375537022997, "grad_norm": 1.5838149785995483, "learning_rate": 4.2227848101265825e-06, "loss": 0.0642075315117836, "num_input_tokens_seen": 2952126, "step": 1564, "train_runtime": 4694.5231, "train_tokens_per_second": 628.845 }, { "epoch": 1.5812484205205966, "grad_norm": 1.3996124267578125, "learning_rate": 4.212658227848102e-06, "loss": 0.057322438806295395, "num_input_tokens_seen": 2953936, "step": 1565, "train_runtime": 4696.7953, "train_tokens_per_second": 628.926 }, { "epoch": 1.5822592873388932, "grad_norm": 1.3723688125610352, "learning_rate": 4.202531645569621e-06, "loss": 0.061545997858047485, "num_input_tokens_seen": 2955706, "step": 1566, "train_runtime": 4699.0361, "train_tokens_per_second": 629.003 }, { "epoch": 1.5832701541571899, "grad_norm": 1.5268528461456299, "learning_rate": 4.19240506329114e-06, "loss": 0.06614181399345398, "num_input_tokens_seen": 2957292, "step": 1567, "train_runtime": 4701.2707, "train_tokens_per_second": 629.041 }, { "epoch": 1.5842810209754865, "grad_norm": 1.491364598274231, "learning_rate": 4.182278481012659e-06, "loss": 0.06419438868761063, "num_input_tokens_seen": 2959516, "step": 1568, "train_runtime": 4703.6141, "train_tokens_per_second": 629.2 }, { "epoch": 1.5852918877937832, "grad_norm": 1.192054271697998, "learning_rate": 4.172151898734177e-06, "loss": 0.04947643727064133, "num_input_tokens_seen": 2961496, "step": 1569, "train_runtime": 4705.9071, "train_tokens_per_second": 629.315 }, { "epoch": 1.5863027546120798, "grad_norm": 1.2916615009307861, "learning_rate": 4.162025316455697e-06, "loss": 0.046376898884773254, "num_input_tokens_seen": 2963170, "step": 1570, "train_runtime": 4708.1188, "train_tokens_per_second": 629.375 }, { "epoch": 1.5873136214303765, "grad_norm": 1.3182624578475952, "learning_rate": 4.151898734177215e-06, "loss": 0.055604659020900726, "num_input_tokens_seen": 2965072, "step": 1571, "train_runtime": 4710.4542, "train_tokens_per_second": 629.466 }, { "epoch": 1.5883244882486731, "grad_norm": 1.2492234706878662, "learning_rate": 4.141772151898734e-06, "loss": 0.05962325632572174, "num_input_tokens_seen": 2967136, "step": 1572, "train_runtime": 4712.8342, "train_tokens_per_second": 629.586 }, { "epoch": 1.5893353550669698, "grad_norm": 1.1575913429260254, "learning_rate": 4.131645569620253e-06, "loss": 0.04633761942386627, "num_input_tokens_seen": 2968980, "step": 1573, "train_runtime": 4715.0822, "train_tokens_per_second": 629.677 }, { "epoch": 1.5903462218852666, "grad_norm": 1.2850408554077148, "learning_rate": 4.1215189873417725e-06, "loss": 0.056543268263339996, "num_input_tokens_seen": 2970630, "step": 1574, "train_runtime": 4717.2841, "train_tokens_per_second": 629.733 }, { "epoch": 1.5913570887035633, "grad_norm": 1.213210105895996, "learning_rate": 4.111392405063292e-06, "loss": 0.05120829492807388, "num_input_tokens_seen": 2972686, "step": 1575, "train_runtime": 4719.584, "train_tokens_per_second": 629.862 }, { "epoch": 1.59236795552186, "grad_norm": 1.2734119892120361, "learning_rate": 4.101265822784811e-06, "loss": 0.05734711512923241, "num_input_tokens_seen": 2974526, "step": 1576, "train_runtime": 4721.8334, "train_tokens_per_second": 629.951 }, { "epoch": 1.5933788223401568, "grad_norm": 1.0458225011825562, "learning_rate": 4.09113924050633e-06, "loss": 0.0468803271651268, "num_input_tokens_seen": 2976356, "step": 1577, "train_runtime": 4724.1274, "train_tokens_per_second": 630.033 }, { "epoch": 1.5943896891584535, "grad_norm": 1.3595490455627441, "learning_rate": 4.081012658227849e-06, "loss": 0.057377636432647705, "num_input_tokens_seen": 2977998, "step": 1578, "train_runtime": 4726.3364, "train_tokens_per_second": 630.086 }, { "epoch": 1.5954005559767501, "grad_norm": 1.2467687129974365, "learning_rate": 4.070886075949367e-06, "loss": 0.054508354514837265, "num_input_tokens_seen": 2979636, "step": 1579, "train_runtime": 4728.5291, "train_tokens_per_second": 630.14 }, { "epoch": 1.5964114227950468, "grad_norm": 1.2042741775512695, "learning_rate": 4.060759493670887e-06, "loss": 0.059663258492946625, "num_input_tokens_seen": 2981328, "step": 1580, "train_runtime": 4730.7443, "train_tokens_per_second": 630.203 }, { "epoch": 1.5974222896133434, "grad_norm": 1.2732118368148804, "learning_rate": 4.050632911392405e-06, "loss": 0.06218750402331352, "num_input_tokens_seen": 2982932, "step": 1581, "train_runtime": 4732.9191, "train_tokens_per_second": 630.252 }, { "epoch": 1.59843315643164, "grad_norm": 1.5464329719543457, "learning_rate": 4.040506329113924e-06, "loss": 0.06518936902284622, "num_input_tokens_seen": 2985058, "step": 1582, "train_runtime": 4735.2542, "train_tokens_per_second": 630.39 }, { "epoch": 1.5994440232499367, "grad_norm": 1.7101939916610718, "learning_rate": 4.030379746835443e-06, "loss": 0.04698918014764786, "num_input_tokens_seen": 2987304, "step": 1583, "train_runtime": 4737.5879, "train_tokens_per_second": 630.554 }, { "epoch": 1.6004548900682334, "grad_norm": 1.2198654413223267, "learning_rate": 4.0202531645569625e-06, "loss": 0.06318310648202896, "num_input_tokens_seen": 2989272, "step": 1584, "train_runtime": 4739.8983, "train_tokens_per_second": 630.662 }, { "epoch": 1.6004548900682334, "eval_loss": 0.3663329482078552, "eval_runtime": 54.3212, "eval_samples_per_second": 16.182, "eval_steps_per_second": 8.1, "num_input_tokens_seen": 2989272, "step": 1584 }, { "epoch": 1.60146575688653, "grad_norm": 1.1672413349151611, "learning_rate": 4.010126582278482e-06, "loss": 0.03929019346833229, "num_input_tokens_seen": 2991142, "step": 1585, "train_runtime": 4796.5172, "train_tokens_per_second": 623.607 }, { "epoch": 1.602476623704827, "grad_norm": 1.689853310585022, "learning_rate": 4.000000000000001e-06, "loss": 0.058579038828611374, "num_input_tokens_seen": 2992704, "step": 1586, "train_runtime": 4798.7011, "train_tokens_per_second": 623.649 }, { "epoch": 1.6034874905231236, "grad_norm": 1.5296273231506348, "learning_rate": 3.989873417721519e-06, "loss": 0.055761225521564484, "num_input_tokens_seen": 2994422, "step": 1587, "train_runtime": 4800.9454, "train_tokens_per_second": 623.715 }, { "epoch": 1.6044983573414204, "grad_norm": 1.5676381587982178, "learning_rate": 3.979746835443039e-06, "loss": 0.07547661662101746, "num_input_tokens_seen": 2996456, "step": 1588, "train_runtime": 4803.2516, "train_tokens_per_second": 623.839 }, { "epoch": 1.605509224159717, "grad_norm": 1.5270965099334717, "learning_rate": 3.969620253164557e-06, "loss": 0.042157530784606934, "num_input_tokens_seen": 2998580, "step": 1589, "train_runtime": 4805.5859, "train_tokens_per_second": 623.978 }, { "epoch": 1.6065200909780137, "grad_norm": 1.384373664855957, "learning_rate": 3.959493670886076e-06, "loss": 0.051778409630060196, "num_input_tokens_seen": 3000296, "step": 1590, "train_runtime": 4807.8296, "train_tokens_per_second": 624.044 }, { "epoch": 1.6075309577963104, "grad_norm": 1.4385806322097778, "learning_rate": 3.949367088607595e-06, "loss": 0.05921599268913269, "num_input_tokens_seen": 3002560, "step": 1591, "train_runtime": 4823.6043, "train_tokens_per_second": 622.472 }, { "epoch": 1.608541824614607, "grad_norm": 1.31643545627594, "learning_rate": 3.939240506329114e-06, "loss": 0.045938633382320404, "num_input_tokens_seen": 3004104, "step": 1592, "train_runtime": 4825.776, "train_tokens_per_second": 622.512 }, { "epoch": 1.6095526914329037, "grad_norm": 1.273729681968689, "learning_rate": 3.929113924050633e-06, "loss": 0.04683920741081238, "num_input_tokens_seen": 3005420, "step": 1593, "train_runtime": 4827.892, "train_tokens_per_second": 622.512 }, { "epoch": 1.6105635582512003, "grad_norm": 1.8324092626571655, "learning_rate": 3.9189873417721525e-06, "loss": 0.10185383260250092, "num_input_tokens_seen": 3006926, "step": 1594, "train_runtime": 4830.0627, "train_tokens_per_second": 622.544 }, { "epoch": 1.611574425069497, "grad_norm": 1.9990055561065674, "learning_rate": 3.908860759493672e-06, "loss": 0.051357023417949677, "num_input_tokens_seen": 3008578, "step": 1595, "train_runtime": 4832.2417, "train_tokens_per_second": 622.605 }, { "epoch": 1.6125852918877936, "grad_norm": 1.311766266822815, "learning_rate": 3.898734177215191e-06, "loss": 0.06318081170320511, "num_input_tokens_seen": 3010530, "step": 1596, "train_runtime": 4834.5102, "train_tokens_per_second": 622.717 }, { "epoch": 1.6135961587060905, "grad_norm": 1.0897035598754883, "learning_rate": 3.888607594936709e-06, "loss": 0.05656641721725464, "num_input_tokens_seen": 3012808, "step": 1597, "train_runtime": 4836.8865, "train_tokens_per_second": 622.882 }, { "epoch": 1.6146070255243872, "grad_norm": 1.5967590808868408, "learning_rate": 3.878481012658228e-06, "loss": 0.07358765602111816, "num_input_tokens_seen": 3014468, "step": 1598, "train_runtime": 4839.0885, "train_tokens_per_second": 622.941 }, { "epoch": 1.6156178923426838, "grad_norm": 1.463265299797058, "learning_rate": 3.868354430379747e-06, "loss": 0.06203243136405945, "num_input_tokens_seen": 3015760, "step": 1599, "train_runtime": 4841.2142, "train_tokens_per_second": 622.935 }, { "epoch": 1.6166287591609807, "grad_norm": 1.2703170776367188, "learning_rate": 3.858227848101266e-06, "loss": 0.0503770112991333, "num_input_tokens_seen": 3017286, "step": 1600, "train_runtime": 4843.3962, "train_tokens_per_second": 622.969 }, { "epoch": 1.6176396259792774, "grad_norm": 1.5702494382858276, "learning_rate": 3.848101265822785e-06, "loss": 0.08263242244720459, "num_input_tokens_seen": 3019240, "step": 1601, "train_runtime": 4845.8433, "train_tokens_per_second": 623.058 }, { "epoch": 1.618650492797574, "grad_norm": 1.310970425605774, "learning_rate": 3.837974683544304e-06, "loss": 0.06051701307296753, "num_input_tokens_seen": 3021418, "step": 1602, "train_runtime": 4848.2543, "train_tokens_per_second": 623.197 }, { "epoch": 1.6196613596158707, "grad_norm": 1.295046091079712, "learning_rate": 3.827848101265823e-06, "loss": 0.05538259446620941, "num_input_tokens_seen": 3023596, "step": 1603, "train_runtime": 4850.5894, "train_tokens_per_second": 623.346 }, { "epoch": 1.6206722264341673, "grad_norm": 1.1572978496551514, "learning_rate": 3.8177215189873425e-06, "loss": 0.05210157111287117, "num_input_tokens_seen": 3025522, "step": 1604, "train_runtime": 4852.8945, "train_tokens_per_second": 623.447 }, { "epoch": 1.621683093252464, "grad_norm": 1.2352598905563354, "learning_rate": 3.807594936708861e-06, "loss": 0.057181812822818756, "num_input_tokens_seen": 3027840, "step": 1605, "train_runtime": 4855.2586, "train_tokens_per_second": 623.621 }, { "epoch": 1.6226939600707606, "grad_norm": 1.310869574546814, "learning_rate": 3.7974683544303802e-06, "loss": 0.06201940029859543, "num_input_tokens_seen": 3029608, "step": 1606, "train_runtime": 4857.5402, "train_tokens_per_second": 623.692 }, { "epoch": 1.6237048268890573, "grad_norm": 1.218132495880127, "learning_rate": 3.787341772151899e-06, "loss": 0.04639403522014618, "num_input_tokens_seen": 3031396, "step": 1607, "train_runtime": 4859.7466, "train_tokens_per_second": 623.777 }, { "epoch": 1.624715693707354, "grad_norm": 1.306732177734375, "learning_rate": 3.7772151898734184e-06, "loss": 0.057783059775829315, "num_input_tokens_seen": 3033048, "step": 1608, "train_runtime": 4861.9726, "train_tokens_per_second": 623.831 }, { "epoch": 1.6257265605256508, "grad_norm": 1.3649557828903198, "learning_rate": 3.767088607594937e-06, "loss": 0.05704411864280701, "num_input_tokens_seen": 3035034, "step": 1609, "train_runtime": 4864.2512, "train_tokens_per_second": 623.947 }, { "epoch": 1.6267374273439474, "grad_norm": 1.366093635559082, "learning_rate": 3.756962025316456e-06, "loss": 0.0632607713341713, "num_input_tokens_seen": 3036868, "step": 1610, "train_runtime": 4866.5102, "train_tokens_per_second": 624.034 }, { "epoch": 1.627748294162244, "grad_norm": 1.4790771007537842, "learning_rate": 3.746835443037975e-06, "loss": 0.062478166073560715, "num_input_tokens_seen": 3038720, "step": 1611, "train_runtime": 4868.7678, "train_tokens_per_second": 624.125 }, { "epoch": 1.628759160980541, "grad_norm": 1.6402771472930908, "learning_rate": 3.7367088607594943e-06, "loss": 0.06919492036104202, "num_input_tokens_seen": 3040610, "step": 1612, "train_runtime": 4871.0361, "train_tokens_per_second": 624.222 }, { "epoch": 1.6297700277988376, "grad_norm": 1.089000940322876, "learning_rate": 3.726582278481013e-06, "loss": 0.04717552661895752, "num_input_tokens_seen": 3042618, "step": 1613, "train_runtime": 4873.3092, "train_tokens_per_second": 624.343 }, { "epoch": 1.6307808946171343, "grad_norm": 1.3077912330627441, "learning_rate": 3.716455696202532e-06, "loss": 0.05890218913555145, "num_input_tokens_seen": 3044814, "step": 1614, "train_runtime": 4875.6533, "train_tokens_per_second": 624.494 }, { "epoch": 1.631791761435431, "grad_norm": 1.5189601182937622, "learning_rate": 3.7063291139240507e-06, "loss": 0.058564163744449615, "num_input_tokens_seen": 3046482, "step": 1615, "train_runtime": 4877.8602, "train_tokens_per_second": 624.553 }, { "epoch": 1.6328026282537276, "grad_norm": 1.5458300113677979, "learning_rate": 3.6962025316455702e-06, "loss": 0.06204815208911896, "num_input_tokens_seen": 3048240, "step": 1616, "train_runtime": 4880.1552, "train_tokens_per_second": 624.619 }, { "epoch": 1.6338134950720242, "grad_norm": 1.033968448638916, "learning_rate": 3.686075949367089e-06, "loss": 0.05834265798330307, "num_input_tokens_seen": 3050738, "step": 1617, "train_runtime": 4882.561, "train_tokens_per_second": 624.823 }, { "epoch": 1.6348243618903209, "grad_norm": 1.3086661100387573, "learning_rate": 3.675949367088608e-06, "loss": 0.0483185350894928, "num_input_tokens_seen": 3052798, "step": 1618, "train_runtime": 4884.8652, "train_tokens_per_second": 624.95 }, { "epoch": 1.6358352287086175, "grad_norm": 1.1004079580307007, "learning_rate": 3.665822784810127e-06, "loss": 0.038739271461963654, "num_input_tokens_seen": 3054350, "step": 1619, "train_runtime": 4887.0497, "train_tokens_per_second": 624.989 }, { "epoch": 1.6368460955269142, "grad_norm": 1.2069733142852783, "learning_rate": 3.655696202531646e-06, "loss": 0.039483167231082916, "num_input_tokens_seen": 3056636, "step": 1620, "train_runtime": 4889.4276, "train_tokens_per_second": 625.152 }, { "epoch": 1.637856962345211, "grad_norm": 1.307073712348938, "learning_rate": 3.645569620253165e-06, "loss": 0.04968315362930298, "num_input_tokens_seen": 3058180, "step": 1621, "train_runtime": 4905.4757, "train_tokens_per_second": 623.422 }, { "epoch": 1.6388678291635077, "grad_norm": 1.0826923847198486, "learning_rate": 3.6354430379746835e-06, "loss": 0.04820631444454193, "num_input_tokens_seen": 3059906, "step": 1622, "train_runtime": 4907.6825, "train_tokens_per_second": 623.493 }, { "epoch": 1.6398786959818044, "grad_norm": 0.9074928164482117, "learning_rate": 3.625316455696203e-06, "loss": 0.03573989123106003, "num_input_tokens_seen": 3062134, "step": 1623, "train_runtime": 4910.0854, "train_tokens_per_second": 623.642 }, { "epoch": 1.6408895628001012, "grad_norm": 1.1247352361679077, "learning_rate": 3.6151898734177216e-06, "loss": 0.049534816294908524, "num_input_tokens_seen": 3063896, "step": 1624, "train_runtime": 4912.3056, "train_tokens_per_second": 623.719 }, { "epoch": 1.6419004296183979, "grad_norm": 1.4930373430252075, "learning_rate": 3.6050632911392407e-06, "loss": 0.06582847237586975, "num_input_tokens_seen": 3065622, "step": 1625, "train_runtime": 4914.5498, "train_tokens_per_second": 623.785 }, { "epoch": 1.6429112964366945, "grad_norm": 2.20893931388855, "learning_rate": 3.5949367088607594e-06, "loss": 0.0630914717912674, "num_input_tokens_seen": 3067090, "step": 1626, "train_runtime": 4916.7014, "train_tokens_per_second": 623.811 }, { "epoch": 1.6439221632549912, "grad_norm": 1.1391489505767822, "learning_rate": 3.584810126582279e-06, "loss": 0.05367257446050644, "num_input_tokens_seen": 3069452, "step": 1627, "train_runtime": 4919.1085, "train_tokens_per_second": 623.985 }, { "epoch": 1.6449330300732878, "grad_norm": 1.2861955165863037, "learning_rate": 3.5746835443037975e-06, "loss": 0.04748687148094177, "num_input_tokens_seen": 3071050, "step": 1628, "train_runtime": 4921.3293, "train_tokens_per_second": 624.029 }, { "epoch": 1.6459438968915845, "grad_norm": 1.6114451885223389, "learning_rate": 3.5645569620253166e-06, "loss": 0.07197785377502441, "num_input_tokens_seen": 3072606, "step": 1629, "train_runtime": 4923.5241, "train_tokens_per_second": 624.066 }, { "epoch": 1.6469547637098811, "grad_norm": 1.5271601676940918, "learning_rate": 3.5544303797468353e-06, "loss": 0.04787354916334152, "num_input_tokens_seen": 3074244, "step": 1630, "train_runtime": 4925.7525, "train_tokens_per_second": 624.117 }, { "epoch": 1.6479656305281778, "grad_norm": 1.7118289470672607, "learning_rate": 3.544303797468355e-06, "loss": 0.06489066034555435, "num_input_tokens_seen": 3075800, "step": 1631, "train_runtime": 4928.0998, "train_tokens_per_second": 624.135 }, { "epoch": 1.6489764973464744, "grad_norm": 1.116047739982605, "learning_rate": 3.5341772151898735e-06, "loss": 0.03874336928129196, "num_input_tokens_seen": 3077748, "step": 1632, "train_runtime": 4930.3864, "train_tokens_per_second": 624.241 }, { "epoch": 1.6499873641647713, "grad_norm": 1.237392544746399, "learning_rate": 3.5240506329113925e-06, "loss": 0.05634452402591705, "num_input_tokens_seen": 3079672, "step": 1633, "train_runtime": 4932.703, "train_tokens_per_second": 624.338 }, { "epoch": 1.650998230983068, "grad_norm": 1.5994071960449219, "learning_rate": 3.5139240506329116e-06, "loss": 0.07179383933544159, "num_input_tokens_seen": 3081838, "step": 1634, "train_runtime": 4935.0457, "train_tokens_per_second": 624.48 }, { "epoch": 1.6520090978013646, "grad_norm": 1.5029454231262207, "learning_rate": 3.5037974683544307e-06, "loss": 0.07771960645914078, "num_input_tokens_seen": 3084034, "step": 1635, "train_runtime": 4937.3827, "train_tokens_per_second": 624.629 }, { "epoch": 1.6530199646196615, "grad_norm": 1.5678901672363281, "learning_rate": 3.4936708860759494e-06, "loss": 0.06559330224990845, "num_input_tokens_seen": 3085876, "step": 1636, "train_runtime": 4939.6535, "train_tokens_per_second": 624.715 }, { "epoch": 1.6540308314379581, "grad_norm": 1.4560083150863647, "learning_rate": 3.4835443037974685e-06, "loss": 0.07017797976732254, "num_input_tokens_seen": 3087968, "step": 1637, "train_runtime": 4941.9676, "train_tokens_per_second": 624.846 }, { "epoch": 1.6550416982562548, "grad_norm": 1.0919362306594849, "learning_rate": 3.4734177215189875e-06, "loss": 0.05355212837457657, "num_input_tokens_seen": 3089862, "step": 1638, "train_runtime": 4944.2331, "train_tokens_per_second": 624.943 }, { "epoch": 1.6560525650745515, "grad_norm": 1.4916249513626099, "learning_rate": 3.4632911392405066e-06, "loss": 0.07239791750907898, "num_input_tokens_seen": 3091530, "step": 1639, "train_runtime": 4946.4187, "train_tokens_per_second": 625.004 }, { "epoch": 1.657063431892848, "grad_norm": 1.4590784311294556, "learning_rate": 3.4531645569620253e-06, "loss": 0.04920034110546112, "num_input_tokens_seen": 3093300, "step": 1640, "train_runtime": 4948.6907, "train_tokens_per_second": 625.074 }, { "epoch": 1.6580742987111448, "grad_norm": 1.2773500680923462, "learning_rate": 3.443037974683545e-06, "loss": 0.0706145167350769, "num_input_tokens_seen": 3095484, "step": 1641, "train_runtime": 4951.032, "train_tokens_per_second": 625.22 }, { "epoch": 1.6590851655294414, "grad_norm": 1.154941201210022, "learning_rate": 3.4329113924050635e-06, "loss": 0.04785441607236862, "num_input_tokens_seen": 3097440, "step": 1642, "train_runtime": 4953.3447, "train_tokens_per_second": 625.323 }, { "epoch": 1.660096032347738, "grad_norm": 1.2175999879837036, "learning_rate": 3.4227848101265825e-06, "loss": 0.05075257271528244, "num_input_tokens_seen": 3099356, "step": 1643, "train_runtime": 4955.7301, "train_tokens_per_second": 625.409 }, { "epoch": 1.6611068991660347, "grad_norm": 1.4382654428482056, "learning_rate": 3.412658227848101e-06, "loss": 0.06688381731510162, "num_input_tokens_seen": 3101190, "step": 1644, "train_runtime": 4957.9881, "train_tokens_per_second": 625.494 }, { "epoch": 1.6621177659843316, "grad_norm": 1.05448317527771, "learning_rate": 3.4025316455696207e-06, "loss": 0.04826867952942848, "num_input_tokens_seen": 3103408, "step": 1645, "train_runtime": 4960.3376, "train_tokens_per_second": 625.645 }, { "epoch": 1.6631286328026282, "grad_norm": 1.277748942375183, "learning_rate": 3.3924050632911394e-06, "loss": 0.05567628890275955, "num_input_tokens_seen": 3105644, "step": 1646, "train_runtime": 4962.6731, "train_tokens_per_second": 625.801 }, { "epoch": 1.664139499620925, "grad_norm": 1.3424869775772095, "learning_rate": 3.3822784810126585e-06, "loss": 0.052945174276828766, "num_input_tokens_seen": 3107626, "step": 1647, "train_runtime": 4964.9861, "train_tokens_per_second": 625.908 }, { "epoch": 1.6651503664392218, "grad_norm": 1.553688406944275, "learning_rate": 3.372151898734177e-06, "loss": 0.06445041298866272, "num_input_tokens_seen": 3109686, "step": 1648, "train_runtime": 4967.3237, "train_tokens_per_second": 626.028 }, { "epoch": 1.6661612332575184, "grad_norm": 1.3637549877166748, "learning_rate": 3.3620253164556966e-06, "loss": 0.06860950589179993, "num_input_tokens_seen": 3111442, "step": 1649, "train_runtime": 4969.585, "train_tokens_per_second": 626.097 }, { "epoch": 1.667172100075815, "grad_norm": 1.2801460027694702, "learning_rate": 3.3518987341772153e-06, "loss": 0.05368033051490784, "num_input_tokens_seen": 3113542, "step": 1650, "train_runtime": 4971.9122, "train_tokens_per_second": 626.226 }, { "epoch": 1.6681829668941117, "grad_norm": 1.313769817352295, "learning_rate": 3.3417721518987344e-06, "loss": 0.05135171115398407, "num_input_tokens_seen": 3115364, "step": 1651, "train_runtime": 4988.095, "train_tokens_per_second": 624.56 }, { "epoch": 1.6691938337124084, "grad_norm": 1.1594148874282837, "learning_rate": 3.331645569620253e-06, "loss": 0.04917239770293236, "num_input_tokens_seen": 3117738, "step": 1652, "train_runtime": 4990.4879, "train_tokens_per_second": 624.736 }, { "epoch": 1.670204700530705, "grad_norm": 1.0684016942977905, "learning_rate": 3.3215189873417725e-06, "loss": 0.04415421560406685, "num_input_tokens_seen": 3119876, "step": 1653, "train_runtime": 4992.8306, "train_tokens_per_second": 624.871 }, { "epoch": 1.6712155673490017, "grad_norm": 1.3335574865341187, "learning_rate": 3.311392405063291e-06, "loss": 0.05189182609319687, "num_input_tokens_seen": 3121986, "step": 1654, "train_runtime": 4995.1492, "train_tokens_per_second": 625.004 }, { "epoch": 1.6722264341672983, "grad_norm": 1.289138913154602, "learning_rate": 3.3012658227848103e-06, "loss": 0.06688280403614044, "num_input_tokens_seen": 3123822, "step": 1655, "train_runtime": 4997.4292, "train_tokens_per_second": 625.086 }, { "epoch": 1.6732373009855952, "grad_norm": 1.097314476966858, "learning_rate": 3.2911392405063294e-06, "loss": 0.03791508451104164, "num_input_tokens_seen": 3125864, "step": 1656, "train_runtime": 4999.7012, "train_tokens_per_second": 625.21 }, { "epoch": 1.6742481678038919, "grad_norm": 1.4409215450286865, "learning_rate": 3.2810126582278485e-06, "loss": 0.03573412075638771, "num_input_tokens_seen": 3127242, "step": 1657, "train_runtime": 5001.8208, "train_tokens_per_second": 625.221 }, { "epoch": 1.6752590346221885, "grad_norm": 1.55764639377594, "learning_rate": 3.270886075949367e-06, "loss": 0.058477044105529785, "num_input_tokens_seen": 3128716, "step": 1658, "train_runtime": 5004.0028, "train_tokens_per_second": 625.243 }, { "epoch": 1.6762699014404854, "grad_norm": 1.7484968900680542, "learning_rate": 3.260759493670886e-06, "loss": 0.07414916157722473, "num_input_tokens_seen": 3130486, "step": 1659, "train_runtime": 5006.2512, "train_tokens_per_second": 625.315 }, { "epoch": 1.677280768258782, "grad_norm": 1.5339076519012451, "learning_rate": 3.2506329113924053e-06, "loss": 0.0380026251077652, "num_input_tokens_seen": 3132030, "step": 1660, "train_runtime": 5008.4587, "train_tokens_per_second": 625.348 }, { "epoch": 1.6782916350770787, "grad_norm": 1.1547660827636719, "learning_rate": 3.2405063291139244e-06, "loss": 0.04821736738085747, "num_input_tokens_seen": 3133638, "step": 1661, "train_runtime": 5010.793, "train_tokens_per_second": 625.378 }, { "epoch": 1.6793025018953753, "grad_norm": 1.6885863542556763, "learning_rate": 3.230379746835443e-06, "loss": 0.0635613203048706, "num_input_tokens_seen": 3135314, "step": 1662, "train_runtime": 5013.0182, "train_tokens_per_second": 625.434 }, { "epoch": 1.680313368713672, "grad_norm": 1.4018542766571045, "learning_rate": 3.2202531645569625e-06, "loss": 0.06594564020633698, "num_input_tokens_seen": 3137340, "step": 1663, "train_runtime": 5015.2867, "train_tokens_per_second": 625.555 }, { "epoch": 1.6813242355319686, "grad_norm": 1.5609691143035889, "learning_rate": 3.210126582278481e-06, "loss": 0.06660561263561249, "num_input_tokens_seen": 3139916, "step": 1664, "train_runtime": 5017.7223, "train_tokens_per_second": 625.765 }, { "epoch": 1.6823351023502653, "grad_norm": 1.3404815196990967, "learning_rate": 3.2000000000000003e-06, "loss": 0.05947958678007126, "num_input_tokens_seen": 3141946, "step": 1665, "train_runtime": 5020.0333, "train_tokens_per_second": 625.882 }, { "epoch": 1.683345969168562, "grad_norm": 1.3477376699447632, "learning_rate": 3.189873417721519e-06, "loss": 0.04895316809415817, "num_input_tokens_seen": 3143520, "step": 1666, "train_runtime": 5022.2131, "train_tokens_per_second": 625.923 }, { "epoch": 1.6843568359868586, "grad_norm": 1.264715313911438, "learning_rate": 3.1797468354430384e-06, "loss": 0.03985775634646416, "num_input_tokens_seen": 3145024, "step": 1667, "train_runtime": 5024.3936, "train_tokens_per_second": 625.951 }, { "epoch": 1.6853677028051555, "grad_norm": 1.588227391242981, "learning_rate": 3.169620253164557e-06, "loss": 0.07643485069274902, "num_input_tokens_seen": 3146530, "step": 1668, "train_runtime": 5026.5474, "train_tokens_per_second": 625.982 }, { "epoch": 1.6863785696234521, "grad_norm": 1.2682186365127563, "learning_rate": 3.159493670886076e-06, "loss": 0.054399602115154266, "num_input_tokens_seen": 3148500, "step": 1669, "train_runtime": 5028.8301, "train_tokens_per_second": 626.09 }, { "epoch": 1.6873894364417488, "grad_norm": 1.1590795516967773, "learning_rate": 3.149367088607595e-06, "loss": 0.05733440816402435, "num_input_tokens_seen": 3150822, "step": 1670, "train_runtime": 5031.1993, "train_tokens_per_second": 626.257 }, { "epoch": 1.6884003032600456, "grad_norm": 1.8241840600967407, "learning_rate": 3.1392405063291144e-06, "loss": 0.06027050316333771, "num_input_tokens_seen": 3152442, "step": 1671, "train_runtime": 5033.4142, "train_tokens_per_second": 626.303 }, { "epoch": 1.6894111700783423, "grad_norm": 1.4099621772766113, "learning_rate": 3.129113924050633e-06, "loss": 0.07096248120069504, "num_input_tokens_seen": 3154712, "step": 1672, "train_runtime": 5035.7455, "train_tokens_per_second": 626.464 }, { "epoch": 1.690422036896639, "grad_norm": 1.4060488939285278, "learning_rate": 3.118987341772152e-06, "loss": 0.04511949419975281, "num_input_tokens_seen": 3156586, "step": 1673, "train_runtime": 5037.9832, "train_tokens_per_second": 626.557 }, { "epoch": 1.6914329037149356, "grad_norm": 1.4204593896865845, "learning_rate": 3.1088607594936708e-06, "loss": 0.07037386298179626, "num_input_tokens_seen": 3158526, "step": 1674, "train_runtime": 5040.2504, "train_tokens_per_second": 626.661 }, { "epoch": 1.6924437705332323, "grad_norm": 1.5116983652114868, "learning_rate": 3.0987341772151903e-06, "loss": 0.06725286692380905, "num_input_tokens_seen": 3160372, "step": 1675, "train_runtime": 5042.5054, "train_tokens_per_second": 626.746 }, { "epoch": 1.693454637351529, "grad_norm": 1.4775930643081665, "learning_rate": 3.088607594936709e-06, "loss": 0.06278984248638153, "num_input_tokens_seen": 3162204, "step": 1676, "train_runtime": 5044.7467, "train_tokens_per_second": 626.831 }, { "epoch": 1.6944655041698256, "grad_norm": 1.424811840057373, "learning_rate": 3.078481012658228e-06, "loss": 0.06108666583895683, "num_input_tokens_seen": 3164144, "step": 1677, "train_runtime": 5047.0594, "train_tokens_per_second": 626.928 }, { "epoch": 1.6954763709881222, "grad_norm": 1.261054515838623, "learning_rate": 3.068354430379747e-06, "loss": 0.04168813303112984, "num_input_tokens_seen": 3165916, "step": 1678, "train_runtime": 5049.315, "train_tokens_per_second": 626.999 }, { "epoch": 1.6964872378064189, "grad_norm": 1.656855821609497, "learning_rate": 3.058227848101266e-06, "loss": 0.05792325735092163, "num_input_tokens_seen": 3167602, "step": 1679, "train_runtime": 5051.5183, "train_tokens_per_second": 627.059 }, { "epoch": 1.6974981046247157, "grad_norm": 1.3091037273406982, "learning_rate": 3.048101265822785e-06, "loss": 0.05761159956455231, "num_input_tokens_seen": 3169826, "step": 1680, "train_runtime": 5053.849, "train_tokens_per_second": 627.21 }, { "epoch": 1.6985089714430124, "grad_norm": 1.2030730247497559, "learning_rate": 3.037974683544304e-06, "loss": 0.038950107991695404, "num_input_tokens_seen": 3171628, "step": 1681, "train_runtime": 5068.3366, "train_tokens_per_second": 625.773 }, { "epoch": 1.699519838261309, "grad_norm": 1.358215570449829, "learning_rate": 3.027848101265823e-06, "loss": 0.0661626011133194, "num_input_tokens_seen": 3173482, "step": 1682, "train_runtime": 5070.612, "train_tokens_per_second": 625.858 }, { "epoch": 1.700530705079606, "grad_norm": 1.5518194437026978, "learning_rate": 3.017721518987342e-06, "loss": 0.06892532855272293, "num_input_tokens_seen": 3175088, "step": 1683, "train_runtime": 5072.7876, "train_tokens_per_second": 625.906 }, { "epoch": 1.7015415718979026, "grad_norm": 1.2152044773101807, "learning_rate": 3.0075949367088608e-06, "loss": 0.06139761954545975, "num_input_tokens_seen": 3177244, "step": 1684, "train_runtime": 5075.1136, "train_tokens_per_second": 626.044 }, { "epoch": 1.7025524387161992, "grad_norm": 1.1380729675292969, "learning_rate": 2.9974683544303803e-06, "loss": 0.03789081424474716, "num_input_tokens_seen": 3178878, "step": 1685, "train_runtime": 5077.3501, "train_tokens_per_second": 626.09 }, { "epoch": 1.7035633055344959, "grad_norm": 1.2746224403381348, "learning_rate": 2.987341772151899e-06, "loss": 0.061715319752693176, "num_input_tokens_seen": 3181054, "step": 1686, "train_runtime": 5079.6889, "train_tokens_per_second": 626.23 }, { "epoch": 1.7045741723527925, "grad_norm": 1.2717055082321167, "learning_rate": 2.977215189873418e-06, "loss": 0.07180582731962204, "num_input_tokens_seen": 3182894, "step": 1687, "train_runtime": 5081.9371, "train_tokens_per_second": 626.315 }, { "epoch": 1.7055850391710892, "grad_norm": 1.3061388731002808, "learning_rate": 2.9670886075949367e-06, "loss": 0.06722988933324814, "num_input_tokens_seen": 3185000, "step": 1688, "train_runtime": 5084.3054, "train_tokens_per_second": 626.438 }, { "epoch": 1.7065959059893858, "grad_norm": 1.494813323020935, "learning_rate": 2.956962025316456e-06, "loss": 0.05606045573949814, "num_input_tokens_seen": 3186718, "step": 1689, "train_runtime": 5086.7546, "train_tokens_per_second": 626.474 }, { "epoch": 1.7076067728076825, "grad_norm": 1.5084346532821655, "learning_rate": 2.946835443037975e-06, "loss": 0.05965816229581833, "num_input_tokens_seen": 3188424, "step": 1690, "train_runtime": 5088.9936, "train_tokens_per_second": 626.533 }, { "epoch": 1.7086176396259791, "grad_norm": 1.051021695137024, "learning_rate": 2.936708860759494e-06, "loss": 0.04397488012909889, "num_input_tokens_seen": 3190914, "step": 1691, "train_runtime": 5091.3892, "train_tokens_per_second": 626.728 }, { "epoch": 1.709628506444276, "grad_norm": 1.4790111780166626, "learning_rate": 2.9265822784810126e-06, "loss": 0.051483381539583206, "num_input_tokens_seen": 3192874, "step": 1692, "train_runtime": 5093.8331, "train_tokens_per_second": 626.812 }, { "epoch": 1.7106393732625726, "grad_norm": 1.1525030136108398, "learning_rate": 2.916455696202532e-06, "loss": 0.05331018939614296, "num_input_tokens_seen": 3194340, "step": 1693, "train_runtime": 5096.0103, "train_tokens_per_second": 626.832 }, { "epoch": 1.7116502400808693, "grad_norm": 1.2143023014068604, "learning_rate": 2.9063291139240508e-06, "loss": 0.042922090739011765, "num_input_tokens_seen": 3196300, "step": 1694, "train_runtime": 5098.283, "train_tokens_per_second": 626.937 }, { "epoch": 1.7126611068991662, "grad_norm": 1.183375597000122, "learning_rate": 2.89620253164557e-06, "loss": 0.06555414944887161, "num_input_tokens_seen": 3198282, "step": 1695, "train_runtime": 5100.5932, "train_tokens_per_second": 627.041 }, { "epoch": 1.7136719737174628, "grad_norm": 1.7683194875717163, "learning_rate": 2.8860759493670885e-06, "loss": 0.07557274401187897, "num_input_tokens_seen": 3199958, "step": 1696, "train_runtime": 5102.7968, "train_tokens_per_second": 627.099 }, { "epoch": 1.7146828405357595, "grad_norm": 1.642382264137268, "learning_rate": 2.875949367088608e-06, "loss": 0.07335276901721954, "num_input_tokens_seen": 3201796, "step": 1697, "train_runtime": 5105.0784, "train_tokens_per_second": 627.179 }, { "epoch": 1.7156937073540561, "grad_norm": 1.3908863067626953, "learning_rate": 2.8658227848101267e-06, "loss": 0.06027093529701233, "num_input_tokens_seen": 3203628, "step": 1698, "train_runtime": 5107.3208, "train_tokens_per_second": 627.262 }, { "epoch": 1.7167045741723528, "grad_norm": 1.5782723426818848, "learning_rate": 2.8556962025316458e-06, "loss": 0.07139906287193298, "num_input_tokens_seen": 3205424, "step": 1699, "train_runtime": 5109.5423, "train_tokens_per_second": 627.341 }, { "epoch": 1.7177154409906494, "grad_norm": 1.1833198070526123, "learning_rate": 2.845569620253165e-06, "loss": 0.05544673651456833, "num_input_tokens_seen": 3207514, "step": 1700, "train_runtime": 5111.8374, "train_tokens_per_second": 627.468 }, { "epoch": 1.718726307808946, "grad_norm": 1.814977765083313, "learning_rate": 2.835443037974684e-06, "loss": 0.08291111141443253, "num_input_tokens_seen": 3209430, "step": 1701, "train_runtime": 5114.1121, "train_tokens_per_second": 627.563 }, { "epoch": 1.7197371746272427, "grad_norm": 1.644702672958374, "learning_rate": 2.8253164556962026e-06, "loss": 0.05391887202858925, "num_input_tokens_seen": 3211230, "step": 1702, "train_runtime": 5116.3445, "train_tokens_per_second": 627.641 }, { "epoch": 1.7207480414455394, "grad_norm": 1.7358590364456177, "learning_rate": 2.8151898734177217e-06, "loss": 0.06020115688443184, "num_input_tokens_seen": 3213296, "step": 1703, "train_runtime": 5118.6199, "train_tokens_per_second": 627.766 }, { "epoch": 1.7217589082638363, "grad_norm": 1.419994831085205, "learning_rate": 2.8050632911392408e-06, "loss": 0.07038295269012451, "num_input_tokens_seen": 3215426, "step": 1704, "train_runtime": 5120.9568, "train_tokens_per_second": 627.896 }, { "epoch": 1.722769775082133, "grad_norm": 1.4363977909088135, "learning_rate": 2.79493670886076e-06, "loss": 0.055247142910957336, "num_input_tokens_seen": 3217030, "step": 1705, "train_runtime": 5123.1464, "train_tokens_per_second": 627.94 }, { "epoch": 1.7237806419004296, "grad_norm": 1.2219488620758057, "learning_rate": 2.7848101265822785e-06, "loss": 0.04963585361838341, "num_input_tokens_seen": 3219282, "step": 1706, "train_runtime": 5125.5511, "train_tokens_per_second": 628.085 }, { "epoch": 1.7247915087187264, "grad_norm": 1.0972269773483276, "learning_rate": 2.774683544303798e-06, "loss": 0.05038131773471832, "num_input_tokens_seen": 3221324, "step": 1707, "train_runtime": 5127.9116, "train_tokens_per_second": 628.194 }, { "epoch": 1.725802375537023, "grad_norm": 1.1392947435379028, "learning_rate": 2.7645569620253167e-06, "loss": 0.04151773452758789, "num_input_tokens_seen": 3223002, "step": 1708, "train_runtime": 5130.1239, "train_tokens_per_second": 628.25 }, { "epoch": 1.7268132423553197, "grad_norm": 1.592848539352417, "learning_rate": 2.7544303797468358e-06, "loss": 0.06350857764482498, "num_input_tokens_seen": 3224970, "step": 1709, "train_runtime": 5132.3997, "train_tokens_per_second": 628.355 }, { "epoch": 1.7278241091736164, "grad_norm": 1.2553719282150269, "learning_rate": 2.7443037974683544e-06, "loss": 0.04228603467345238, "num_input_tokens_seen": 3226402, "step": 1710, "train_runtime": 5134.5792, "train_tokens_per_second": 628.367 }, { "epoch": 1.728834975991913, "grad_norm": 1.384685754776001, "learning_rate": 2.734177215189874e-06, "loss": 0.050136856734752655, "num_input_tokens_seen": 3228294, "step": 1711, "train_runtime": 5149.0504, "train_tokens_per_second": 626.969 }, { "epoch": 1.7298458428102097, "grad_norm": 1.3079723119735718, "learning_rate": 2.7240506329113926e-06, "loss": 0.06112975254654884, "num_input_tokens_seen": 3230478, "step": 1712, "train_runtime": 5151.3796, "train_tokens_per_second": 627.109 }, { "epoch": 1.7308567096285064, "grad_norm": 1.4471968412399292, "learning_rate": 2.7139240506329117e-06, "loss": 0.04918985068798065, "num_input_tokens_seen": 3232430, "step": 1713, "train_runtime": 5153.6547, "train_tokens_per_second": 627.211 }, { "epoch": 1.731867576446803, "grad_norm": 1.5963494777679443, "learning_rate": 2.7037974683544303e-06, "loss": 0.07741352170705795, "num_input_tokens_seen": 3234332, "step": 1714, "train_runtime": 5155.94, "train_tokens_per_second": 627.302 }, { "epoch": 1.7328784432650999, "grad_norm": 1.1868281364440918, "learning_rate": 2.69367088607595e-06, "loss": 0.05764024332165718, "num_input_tokens_seen": 3236438, "step": 1715, "train_runtime": 5158.2071, "train_tokens_per_second": 627.435 }, { "epoch": 1.7338893100833965, "grad_norm": 1.416505217552185, "learning_rate": 2.6835443037974685e-06, "loss": 0.04790296405553818, "num_input_tokens_seen": 3238184, "step": 1716, "train_runtime": 5160.4459, "train_tokens_per_second": 627.501 }, { "epoch": 1.7349001769016932, "grad_norm": 1.231259822845459, "learning_rate": 2.6734177215189876e-06, "loss": 0.04259142279624939, "num_input_tokens_seen": 3239792, "step": 1717, "train_runtime": 5162.6736, "train_tokens_per_second": 627.542 }, { "epoch": 1.73591104371999, "grad_norm": 1.1704325675964355, "learning_rate": 2.6632911392405062e-06, "loss": 0.057569827884435654, "num_input_tokens_seen": 3241846, "step": 1718, "train_runtime": 5164.9773, "train_tokens_per_second": 627.659 }, { "epoch": 1.7369219105382867, "grad_norm": 1.3232004642486572, "learning_rate": 2.6531645569620257e-06, "loss": 0.05082739517092705, "num_input_tokens_seen": 3243330, "step": 1719, "train_runtime": 5167.19, "train_tokens_per_second": 627.678 }, { "epoch": 1.7379327773565834, "grad_norm": 1.7098069190979004, "learning_rate": 2.6430379746835444e-06, "loss": 0.046800512820482254, "num_input_tokens_seen": 3244718, "step": 1720, "train_runtime": 5169.358, "train_tokens_per_second": 627.683 }, { "epoch": 1.73894364417488, "grad_norm": 1.6553046703338623, "learning_rate": 2.6329113924050635e-06, "loss": 0.0658150166273117, "num_input_tokens_seen": 3246278, "step": 1721, "train_runtime": 5171.5428, "train_tokens_per_second": 627.719 }, { "epoch": 1.7399545109931767, "grad_norm": 1.56905996799469, "learning_rate": 2.6227848101265826e-06, "loss": 0.08340397477149963, "num_input_tokens_seen": 3248164, "step": 1722, "train_runtime": 5173.8844, "train_tokens_per_second": 627.8 }, { "epoch": 1.7409653778114733, "grad_norm": 1.3230301141738892, "learning_rate": 2.6126582278481017e-06, "loss": 0.05231938511133194, "num_input_tokens_seen": 3249786, "step": 1723, "train_runtime": 5176.1478, "train_tokens_per_second": 627.839 }, { "epoch": 1.74197624462977, "grad_norm": 1.3642750978469849, "learning_rate": 2.6025316455696203e-06, "loss": 0.05207236483693123, "num_input_tokens_seen": 3251246, "step": 1724, "train_runtime": 5178.3586, "train_tokens_per_second": 627.853 }, { "epoch": 1.7429871114480666, "grad_norm": 1.70603346824646, "learning_rate": 2.5924050632911394e-06, "loss": 0.06655357033014297, "num_input_tokens_seen": 3252628, "step": 1725, "train_runtime": 5180.5002, "train_tokens_per_second": 627.86 }, { "epoch": 1.7439979782663633, "grad_norm": 1.0853768587112427, "learning_rate": 2.5822784810126585e-06, "loss": 0.03993096202611923, "num_input_tokens_seen": 3254830, "step": 1726, "train_runtime": 5182.9408, "train_tokens_per_second": 627.989 }, { "epoch": 1.7450088450846601, "grad_norm": 1.2915998697280884, "learning_rate": 2.5721518987341776e-06, "loss": 0.055095624178647995, "num_input_tokens_seen": 3256576, "step": 1727, "train_runtime": 5185.1588, "train_tokens_per_second": 628.057 }, { "epoch": 1.7460197119029568, "grad_norm": 0.9929714798927307, "learning_rate": 2.5620253164556962e-06, "loss": 0.039859525859355927, "num_input_tokens_seen": 3258778, "step": 1728, "train_runtime": 5187.5361, "train_tokens_per_second": 628.194 }, { "epoch": 1.7470305787212534, "grad_norm": 1.6721854209899902, "learning_rate": 2.5518987341772157e-06, "loss": 0.06250029057264328, "num_input_tokens_seen": 3260680, "step": 1729, "train_runtime": 5189.8551, "train_tokens_per_second": 628.28 }, { "epoch": 1.7480414455395503, "grad_norm": 1.2347322702407837, "learning_rate": 2.5417721518987344e-06, "loss": 0.041486263275146484, "num_input_tokens_seen": 3262762, "step": 1730, "train_runtime": 5192.1666, "train_tokens_per_second": 628.401 }, { "epoch": 1.749052312357847, "grad_norm": 1.375963568687439, "learning_rate": 2.5316455696202535e-06, "loss": 0.06132054701447487, "num_input_tokens_seen": 3264636, "step": 1731, "train_runtime": 5194.4166, "train_tokens_per_second": 628.489 }, { "epoch": 1.7500631791761436, "grad_norm": 1.9958546161651611, "learning_rate": 2.521518987341772e-06, "loss": 0.05005979910492897, "num_input_tokens_seen": 3266290, "step": 1732, "train_runtime": 5196.622, "train_tokens_per_second": 628.541 }, { "epoch": 1.7510740459944403, "grad_norm": 1.1845694780349731, "learning_rate": 2.5113924050632917e-06, "loss": 0.04483165964484215, "num_input_tokens_seen": 3268124, "step": 1733, "train_runtime": 5198.8951, "train_tokens_per_second": 628.619 }, { "epoch": 1.752084912812737, "grad_norm": 1.1084177494049072, "learning_rate": 2.5012658227848103e-06, "loss": 0.0325375497341156, "num_input_tokens_seen": 3269868, "step": 1734, "train_runtime": 5201.125, "train_tokens_per_second": 628.685 }, { "epoch": 1.7530957796310336, "grad_norm": 1.0399636030197144, "learning_rate": 2.4911392405063294e-06, "loss": 0.029853176325559616, "num_input_tokens_seen": 3271730, "step": 1735, "train_runtime": 5203.4105, "train_tokens_per_second": 628.766 }, { "epoch": 1.7541066464493302, "grad_norm": 1.1212575435638428, "learning_rate": 2.481012658227848e-06, "loss": 0.04909026622772217, "num_input_tokens_seen": 3273410, "step": 1736, "train_runtime": 5205.6414, "train_tokens_per_second": 628.82 }, { "epoch": 1.7551175132676269, "grad_norm": 1.4462919235229492, "learning_rate": 2.470886075949367e-06, "loss": 0.03970807418227196, "num_input_tokens_seen": 3274634, "step": 1737, "train_runtime": 5207.7367, "train_tokens_per_second": 628.802 }, { "epoch": 1.7561283800859235, "grad_norm": 1.2837393283843994, "learning_rate": 2.4607594936708862e-06, "loss": 0.05064672231674194, "num_input_tokens_seen": 3276240, "step": 1738, "train_runtime": 5209.9421, "train_tokens_per_second": 628.844 }, { "epoch": 1.7571392469042204, "grad_norm": 1.4514061212539673, "learning_rate": 2.4506329113924053e-06, "loss": 0.06642775982618332, "num_input_tokens_seen": 3278222, "step": 1739, "train_runtime": 5212.204, "train_tokens_per_second": 628.951 }, { "epoch": 1.758150113722517, "grad_norm": 1.253423810005188, "learning_rate": 2.440506329113924e-06, "loss": 0.05761011317372322, "num_input_tokens_seen": 3279978, "step": 1740, "train_runtime": 5214.4107, "train_tokens_per_second": 629.022 }, { "epoch": 1.7591609805408137, "grad_norm": 1.2656490802764893, "learning_rate": 2.430379746835443e-06, "loss": 0.04442978650331497, "num_input_tokens_seen": 3282112, "step": 1741, "train_runtime": 5230.228, "train_tokens_per_second": 627.528 }, { "epoch": 1.7601718473591106, "grad_norm": 1.2130296230316162, "learning_rate": 2.420253164556962e-06, "loss": 0.05412264168262482, "num_input_tokens_seen": 3284090, "step": 1742, "train_runtime": 5232.6443, "train_tokens_per_second": 627.616 }, { "epoch": 1.7611827141774072, "grad_norm": 1.0931416749954224, "learning_rate": 2.4101265822784812e-06, "loss": 0.04760541766881943, "num_input_tokens_seen": 3285966, "step": 1743, "train_runtime": 5234.9581, "train_tokens_per_second": 627.697 }, { "epoch": 1.762193580995704, "grad_norm": 1.3005732297897339, "learning_rate": 2.4000000000000003e-06, "loss": 0.06743331998586655, "num_input_tokens_seen": 3287836, "step": 1744, "train_runtime": 5237.2041, "train_tokens_per_second": 627.785 }, { "epoch": 1.7632044478140005, "grad_norm": 1.2369167804718018, "learning_rate": 2.389873417721519e-06, "loss": 0.057023998349905014, "num_input_tokens_seen": 3289794, "step": 1745, "train_runtime": 5239.5151, "train_tokens_per_second": 627.881 }, { "epoch": 1.7642153146322972, "grad_norm": 1.1120179891586304, "learning_rate": 2.379746835443038e-06, "loss": 0.03772059828042984, "num_input_tokens_seen": 3291814, "step": 1746, "train_runtime": 5241.8309, "train_tokens_per_second": 627.989 }, { "epoch": 1.7652261814505938, "grad_norm": 1.1966243982315063, "learning_rate": 2.369620253164557e-06, "loss": 0.05821807682514191, "num_input_tokens_seen": 3293728, "step": 1747, "train_runtime": 5244.1125, "train_tokens_per_second": 628.081 }, { "epoch": 1.7662370482688905, "grad_norm": 1.4127540588378906, "learning_rate": 2.3594936708860762e-06, "loss": 0.05692339688539505, "num_input_tokens_seen": 3295612, "step": 1748, "train_runtime": 5246.3544, "train_tokens_per_second": 628.172 }, { "epoch": 1.7672479150871871, "grad_norm": 1.5254579782485962, "learning_rate": 2.349367088607595e-06, "loss": 0.06370013952255249, "num_input_tokens_seen": 3297530, "step": 1749, "train_runtime": 5248.7038, "train_tokens_per_second": 628.256 }, { "epoch": 1.7682587819054838, "grad_norm": 1.0889806747436523, "learning_rate": 2.339240506329114e-06, "loss": 0.04300104081630707, "num_input_tokens_seen": 3299672, "step": 1750, "train_runtime": 5251.0411, "train_tokens_per_second": 628.384 }, { "epoch": 1.7692696487237807, "grad_norm": 1.6858285665512085, "learning_rate": 2.329113924050633e-06, "loss": 0.05766045302152634, "num_input_tokens_seen": 3301324, "step": 1751, "train_runtime": 5253.3303, "train_tokens_per_second": 628.425 }, { "epoch": 1.7702805155420773, "grad_norm": 1.1065605878829956, "learning_rate": 2.318987341772152e-06, "loss": 0.05296618491411209, "num_input_tokens_seen": 3303024, "step": 1752, "train_runtime": 5255.5401, "train_tokens_per_second": 628.484 }, { "epoch": 1.771291382360374, "grad_norm": 1.292311668395996, "learning_rate": 2.308860759493671e-06, "loss": 0.04545572027564049, "num_input_tokens_seen": 3304390, "step": 1753, "train_runtime": 5257.6699, "train_tokens_per_second": 628.489 }, { "epoch": 1.7723022491786709, "grad_norm": 1.6802729368209839, "learning_rate": 2.29873417721519e-06, "loss": 0.06228732317686081, "num_input_tokens_seen": 3306056, "step": 1754, "train_runtime": 5259.8827, "train_tokens_per_second": 628.542 }, { "epoch": 1.7733131159969675, "grad_norm": 1.3820728063583374, "learning_rate": 2.288607594936709e-06, "loss": 0.043544918298721313, "num_input_tokens_seen": 3308636, "step": 1755, "train_runtime": 5262.3307, "train_tokens_per_second": 628.74 }, { "epoch": 1.7743239828152642, "grad_norm": 1.2809100151062012, "learning_rate": 2.278481012658228e-06, "loss": 0.04450707137584686, "num_input_tokens_seen": 3310440, "step": 1756, "train_runtime": 5264.5934, "train_tokens_per_second": 628.812 }, { "epoch": 1.7753348496335608, "grad_norm": 1.3307225704193115, "learning_rate": 2.268354430379747e-06, "loss": 0.05021868646144867, "num_input_tokens_seen": 3312156, "step": 1757, "train_runtime": 5266.8612, "train_tokens_per_second": 628.867 }, { "epoch": 1.7763457164518575, "grad_norm": 1.0402779579162598, "learning_rate": 2.258227848101266e-06, "loss": 0.03799012303352356, "num_input_tokens_seen": 3314202, "step": 1758, "train_runtime": 5269.1894, "train_tokens_per_second": 628.978 }, { "epoch": 1.7773565832701541, "grad_norm": 1.2089042663574219, "learning_rate": 2.248101265822785e-06, "loss": 0.04334067553281784, "num_input_tokens_seen": 3315796, "step": 1759, "train_runtime": 5271.3738, "train_tokens_per_second": 629.019 }, { "epoch": 1.7783674500884508, "grad_norm": 1.2877362966537476, "learning_rate": 2.237974683544304e-06, "loss": 0.049931056797504425, "num_input_tokens_seen": 3317610, "step": 1760, "train_runtime": 5273.6526, "train_tokens_per_second": 629.092 }, { "epoch": 1.7793783169067474, "grad_norm": 1.2813947200775146, "learning_rate": 2.227848101265823e-06, "loss": 0.059495292603969574, "num_input_tokens_seen": 3319370, "step": 1761, "train_runtime": 5275.9368, "train_tokens_per_second": 629.153 }, { "epoch": 1.780389183725044, "grad_norm": 1.388823390007019, "learning_rate": 2.2177215189873417e-06, "loss": 0.052768148481845856, "num_input_tokens_seen": 3321328, "step": 1762, "train_runtime": 5278.245, "train_tokens_per_second": 629.249 }, { "epoch": 1.781400050543341, "grad_norm": 1.5318822860717773, "learning_rate": 2.207594936708861e-06, "loss": 0.06609731167554855, "num_input_tokens_seen": 3322902, "step": 1763, "train_runtime": 5280.3977, "train_tokens_per_second": 629.29 }, { "epoch": 1.7824109173616376, "grad_norm": 1.3329148292541504, "learning_rate": 2.19746835443038e-06, "loss": 0.06167571619153023, "num_input_tokens_seen": 3324686, "step": 1764, "train_runtime": 5282.6133, "train_tokens_per_second": 629.364 }, { "epoch": 1.7834217841799342, "grad_norm": 1.3537893295288086, "learning_rate": 2.187341772151899e-06, "loss": 0.06361069530248642, "num_input_tokens_seen": 3327138, "step": 1765, "train_runtime": 5285.0111, "train_tokens_per_second": 629.542 }, { "epoch": 1.7844326509982311, "grad_norm": 1.1344093084335327, "learning_rate": 2.177215189873418e-06, "loss": 0.057892173528671265, "num_input_tokens_seen": 3329122, "step": 1766, "train_runtime": 5287.3169, "train_tokens_per_second": 629.643 }, { "epoch": 1.7854435178165278, "grad_norm": 1.3750102519989014, "learning_rate": 2.1670886075949367e-06, "loss": 0.04363403469324112, "num_input_tokens_seen": 3330766, "step": 1767, "train_runtime": 5289.5256, "train_tokens_per_second": 629.691 }, { "epoch": 1.7864543846348244, "grad_norm": 1.705133080482483, "learning_rate": 2.156962025316456e-06, "loss": 0.053902529180049896, "num_input_tokens_seen": 3332672, "step": 1768, "train_runtime": 5291.781, "train_tokens_per_second": 629.783 }, { "epoch": 1.787465251453121, "grad_norm": 1.1496018171310425, "learning_rate": 2.146835443037975e-06, "loss": 0.04963824525475502, "num_input_tokens_seen": 3334644, "step": 1769, "train_runtime": 5294.1344, "train_tokens_per_second": 629.875 }, { "epoch": 1.7884761182714177, "grad_norm": 1.2758835554122925, "learning_rate": 2.136708860759494e-06, "loss": 0.0505569651722908, "num_input_tokens_seen": 3336452, "step": 1770, "train_runtime": 5296.3473, "train_tokens_per_second": 629.953 }, { "epoch": 1.7894869850897144, "grad_norm": 1.2700601816177368, "learning_rate": 2.1265822784810126e-06, "loss": 0.05532461032271385, "num_input_tokens_seen": 3338456, "step": 1771, "train_runtime": 5312.2418, "train_tokens_per_second": 628.446 }, { "epoch": 1.790497851908011, "grad_norm": 1.4618710279464722, "learning_rate": 2.1164556962025317e-06, "loss": 0.07050764560699463, "num_input_tokens_seen": 3340018, "step": 1772, "train_runtime": 5314.3885, "train_tokens_per_second": 628.486 }, { "epoch": 1.7915087187263077, "grad_norm": 1.1822164058685303, "learning_rate": 2.106329113924051e-06, "loss": 0.048912353813648224, "num_input_tokens_seen": 3342170, "step": 1773, "train_runtime": 5316.7959, "train_tokens_per_second": 628.606 }, { "epoch": 1.7925195855446043, "grad_norm": 1.1533139944076538, "learning_rate": 2.09620253164557e-06, "loss": 0.04874260723590851, "num_input_tokens_seen": 3343816, "step": 1774, "train_runtime": 5319.0819, "train_tokens_per_second": 628.645 }, { "epoch": 1.7935304523629012, "grad_norm": 1.4660189151763916, "learning_rate": 2.0860759493670885e-06, "loss": 0.05181489884853363, "num_input_tokens_seen": 3345358, "step": 1775, "train_runtime": 5321.3081, "train_tokens_per_second": 628.672 }, { "epoch": 1.7945413191811979, "grad_norm": 1.4509342908859253, "learning_rate": 2.0759493670886076e-06, "loss": 0.05990975350141525, "num_input_tokens_seen": 3347366, "step": 1776, "train_runtime": 5323.6016, "train_tokens_per_second": 628.778 }, { "epoch": 1.7955521859994947, "grad_norm": 1.3399603366851807, "learning_rate": 2.0658227848101267e-06, "loss": 0.053806304931640625, "num_input_tokens_seen": 3349976, "step": 1777, "train_runtime": 5326.008, "train_tokens_per_second": 628.984 }, { "epoch": 1.7965630528177914, "grad_norm": 1.341980218887329, "learning_rate": 2.055696202531646e-06, "loss": 0.06572294980287552, "num_input_tokens_seen": 3351784, "step": 1778, "train_runtime": 5328.2431, "train_tokens_per_second": 629.06 }, { "epoch": 1.797573919636088, "grad_norm": 1.309593677520752, "learning_rate": 2.045569620253165e-06, "loss": 0.06417813897132874, "num_input_tokens_seen": 3353932, "step": 1779, "train_runtime": 5330.5755, "train_tokens_per_second": 629.188 }, { "epoch": 1.7985847864543847, "grad_norm": 1.408837080001831, "learning_rate": 2.0354430379746835e-06, "loss": 0.0630507543683052, "num_input_tokens_seen": 3355726, "step": 1780, "train_runtime": 5332.8093, "train_tokens_per_second": 629.26 }, { "epoch": 1.7995956532726813, "grad_norm": 1.135152816772461, "learning_rate": 2.0253164556962026e-06, "loss": 0.04721590131521225, "num_input_tokens_seen": 3358448, "step": 1781, "train_runtime": 5335.2893, "train_tokens_per_second": 629.478 }, { "epoch": 1.800606520090978, "grad_norm": 1.1626096963882446, "learning_rate": 2.0151898734177217e-06, "loss": 0.060310959815979004, "num_input_tokens_seen": 3360568, "step": 1782, "train_runtime": 5337.6136, "train_tokens_per_second": 629.601 }, { "epoch": 1.800606520090978, "eval_loss": 0.3664248585700989, "eval_runtime": 54.5014, "eval_samples_per_second": 16.128, "eval_steps_per_second": 8.073, "num_input_tokens_seen": 3360568, "step": 1782 }, { "epoch": 1.8016173869092746, "grad_norm": 1.2499885559082031, "learning_rate": 2.005063291139241e-06, "loss": 0.05978626385331154, "num_input_tokens_seen": 3362796, "step": 1783, "train_runtime": 5394.4877, "train_tokens_per_second": 623.376 }, { "epoch": 1.8026282537275713, "grad_norm": 1.3499104976654053, "learning_rate": 1.9949367088607595e-06, "loss": 0.06265848875045776, "num_input_tokens_seen": 3364652, "step": 1784, "train_runtime": 5396.7521, "train_tokens_per_second": 623.459 }, { "epoch": 1.803639120545868, "grad_norm": 1.4324194192886353, "learning_rate": 1.9848101265822785e-06, "loss": 0.05359485000371933, "num_input_tokens_seen": 3366096, "step": 1785, "train_runtime": 5398.8732, "train_tokens_per_second": 623.481 }, { "epoch": 1.8046499873641648, "grad_norm": 1.269586205482483, "learning_rate": 1.9746835443037976e-06, "loss": 0.043103210628032684, "num_input_tokens_seen": 3368244, "step": 1786, "train_runtime": 5401.2311, "train_tokens_per_second": 623.607 }, { "epoch": 1.8056608541824615, "grad_norm": 1.6268213987350464, "learning_rate": 1.9645569620253167e-06, "loss": 0.07587891817092896, "num_input_tokens_seen": 3369938, "step": 1787, "train_runtime": 5403.4442, "train_tokens_per_second": 623.665 }, { "epoch": 1.8066717210007581, "grad_norm": 2.2663137912750244, "learning_rate": 1.954430379746836e-06, "loss": 0.05486909672617912, "num_input_tokens_seen": 3371544, "step": 1788, "train_runtime": 5405.5838, "train_tokens_per_second": 623.715 }, { "epoch": 1.807682587819055, "grad_norm": 1.3724452257156372, "learning_rate": 1.9443037974683544e-06, "loss": 0.042518265545368195, "num_input_tokens_seen": 3372914, "step": 1789, "train_runtime": 5407.693, "train_tokens_per_second": 623.725 }, { "epoch": 1.8086934546373516, "grad_norm": 1.1299023628234863, "learning_rate": 1.9341772151898735e-06, "loss": 0.0554213710129261, "num_input_tokens_seen": 3374998, "step": 1790, "train_runtime": 5410.0205, "train_tokens_per_second": 623.842 }, { "epoch": 1.8097043214556483, "grad_norm": 1.0861995220184326, "learning_rate": 1.9240506329113926e-06, "loss": 0.05097381770610809, "num_input_tokens_seen": 3376898, "step": 1791, "train_runtime": 5412.2847, "train_tokens_per_second": 623.932 }, { "epoch": 1.810715188273945, "grad_norm": 1.3107178211212158, "learning_rate": 1.9139240506329117e-06, "loss": 0.0591639019548893, "num_input_tokens_seen": 3379128, "step": 1792, "train_runtime": 5414.7192, "train_tokens_per_second": 624.063 }, { "epoch": 1.8117260550922416, "grad_norm": 1.7104859352111816, "learning_rate": 1.9037974683544306e-06, "loss": 0.05437002703547478, "num_input_tokens_seen": 3380466, "step": 1793, "train_runtime": 5416.8642, "train_tokens_per_second": 624.063 }, { "epoch": 1.8127369219105383, "grad_norm": 1.2663828134536743, "learning_rate": 1.8936708860759494e-06, "loss": 0.056174956262111664, "num_input_tokens_seen": 3381916, "step": 1794, "train_runtime": 5419.0256, "train_tokens_per_second": 624.082 }, { "epoch": 1.813747788728835, "grad_norm": 1.0927003622055054, "learning_rate": 1.8835443037974685e-06, "loss": 0.04781580716371536, "num_input_tokens_seen": 3384378, "step": 1795, "train_runtime": 5421.4335, "train_tokens_per_second": 624.259 }, { "epoch": 1.8147586555471316, "grad_norm": 1.5116275548934937, "learning_rate": 1.8734177215189874e-06, "loss": 0.0798468217253685, "num_input_tokens_seen": 3386200, "step": 1796, "train_runtime": 5423.6687, "train_tokens_per_second": 624.338 }, { "epoch": 1.8157695223654282, "grad_norm": 1.0812292098999023, "learning_rate": 1.8632911392405065e-06, "loss": 0.04019061475992203, "num_input_tokens_seen": 3388380, "step": 1797, "train_runtime": 5426.0056, "train_tokens_per_second": 624.47 }, { "epoch": 1.816780389183725, "grad_norm": 1.4491227865219116, "learning_rate": 1.8531645569620254e-06, "loss": 0.039338499307632446, "num_input_tokens_seen": 3390244, "step": 1798, "train_runtime": 5428.3781, "train_tokens_per_second": 624.541 }, { "epoch": 1.8177912560020217, "grad_norm": 1.4811445474624634, "learning_rate": 1.8430379746835444e-06, "loss": 0.06751224398612976, "num_input_tokens_seen": 3392044, "step": 1799, "train_runtime": 5430.6209, "train_tokens_per_second": 624.614 }, { "epoch": 1.8188021228203184, "grad_norm": 1.068530559539795, "learning_rate": 1.8329113924050635e-06, "loss": 0.04439627379179001, "num_input_tokens_seen": 3394136, "step": 1800, "train_runtime": 5432.9258, "train_tokens_per_second": 624.734 }, { "epoch": 1.8198129896386153, "grad_norm": 1.0574533939361572, "learning_rate": 1.8227848101265824e-06, "loss": 0.04897860065102577, "num_input_tokens_seen": 3396196, "step": 1801, "train_runtime": 5448.6542, "train_tokens_per_second": 623.309 }, { "epoch": 1.820823856456912, "grad_norm": 1.2108123302459717, "learning_rate": 1.8126582278481015e-06, "loss": 0.04313907027244568, "num_input_tokens_seen": 3398414, "step": 1802, "train_runtime": 5450.9941, "train_tokens_per_second": 623.448 }, { "epoch": 1.8218347232752086, "grad_norm": 1.490373134613037, "learning_rate": 1.8025316455696204e-06, "loss": 0.05872609466314316, "num_input_tokens_seen": 3400244, "step": 1803, "train_runtime": 5453.2413, "train_tokens_per_second": 623.527 }, { "epoch": 1.8228455900935052, "grad_norm": 1.4431567192077637, "learning_rate": 1.7924050632911394e-06, "loss": 0.06668207794427872, "num_input_tokens_seen": 3401862, "step": 1804, "train_runtime": 5455.4959, "train_tokens_per_second": 623.566 }, { "epoch": 1.8238564569118019, "grad_norm": 1.7261453866958618, "learning_rate": 1.7822784810126583e-06, "loss": 0.05830330401659012, "num_input_tokens_seen": 3403396, "step": 1805, "train_runtime": 5457.6708, "train_tokens_per_second": 623.599 }, { "epoch": 1.8248673237300985, "grad_norm": 1.2453124523162842, "learning_rate": 1.7721518987341774e-06, "loss": 0.04764130711555481, "num_input_tokens_seen": 3405348, "step": 1806, "train_runtime": 5459.987, "train_tokens_per_second": 623.692 }, { "epoch": 1.8258781905483952, "grad_norm": 1.1063189506530762, "learning_rate": 1.7620253164556963e-06, "loss": 0.04134732857346535, "num_input_tokens_seen": 3407222, "step": 1807, "train_runtime": 5462.2645, "train_tokens_per_second": 623.775 }, { "epoch": 1.8268890573666918, "grad_norm": 1.3576112985610962, "learning_rate": 1.7518987341772154e-06, "loss": 0.0450436994433403, "num_input_tokens_seen": 3408828, "step": 1808, "train_runtime": 5464.4541, "train_tokens_per_second": 623.819 }, { "epoch": 1.8278999241849885, "grad_norm": 1.13437819480896, "learning_rate": 1.7417721518987342e-06, "loss": 0.03500455617904663, "num_input_tokens_seen": 3410766, "step": 1809, "train_runtime": 5466.7321, "train_tokens_per_second": 623.913 }, { "epoch": 1.8289107910032854, "grad_norm": 1.3162808418273926, "learning_rate": 1.7316455696202533e-06, "loss": 0.03751616179943085, "num_input_tokens_seen": 3412244, "step": 1810, "train_runtime": 5468.9127, "train_tokens_per_second": 623.935 }, { "epoch": 1.829921657821582, "grad_norm": 1.3975801467895508, "learning_rate": 1.7215189873417724e-06, "loss": 0.05604361742734909, "num_input_tokens_seen": 3413644, "step": 1811, "train_runtime": 5471.2383, "train_tokens_per_second": 623.925 }, { "epoch": 1.8309325246398787, "grad_norm": 1.4612771272659302, "learning_rate": 1.7113924050632913e-06, "loss": 0.06397251039743423, "num_input_tokens_seen": 3415632, "step": 1812, "train_runtime": 5473.6343, "train_tokens_per_second": 624.015 }, { "epoch": 1.8319433914581755, "grad_norm": 1.4182970523834229, "learning_rate": 1.7012658227848104e-06, "loss": 0.06215008720755577, "num_input_tokens_seen": 3417608, "step": 1813, "train_runtime": 5475.9048, "train_tokens_per_second": 624.117 }, { "epoch": 1.8329542582764722, "grad_norm": 1.336040735244751, "learning_rate": 1.6911392405063292e-06, "loss": 0.08397555351257324, "num_input_tokens_seen": 3419590, "step": 1814, "train_runtime": 5478.2125, "train_tokens_per_second": 624.216 }, { "epoch": 1.8339651250947688, "grad_norm": 1.0550512075424194, "learning_rate": 1.6810126582278483e-06, "loss": 0.04642835259437561, "num_input_tokens_seen": 3421706, "step": 1815, "train_runtime": 5480.5151, "train_tokens_per_second": 624.34 }, { "epoch": 1.8349759919130655, "grad_norm": 1.1457314491271973, "learning_rate": 1.6708860759493672e-06, "loss": 0.065874382853508, "num_input_tokens_seen": 3423888, "step": 1816, "train_runtime": 5482.819, "train_tokens_per_second": 624.476 }, { "epoch": 1.8359868587313621, "grad_norm": 1.548355221748352, "learning_rate": 1.6607594936708863e-06, "loss": 0.06853128969669342, "num_input_tokens_seen": 3425318, "step": 1817, "train_runtime": 5484.9924, "train_tokens_per_second": 624.489 }, { "epoch": 1.8369977255496588, "grad_norm": 1.3600349426269531, "learning_rate": 1.6506329113924051e-06, "loss": 0.046113211661577225, "num_input_tokens_seen": 3426994, "step": 1818, "train_runtime": 5487.1693, "train_tokens_per_second": 624.547 }, { "epoch": 1.8380085923679554, "grad_norm": 1.5665621757507324, "learning_rate": 1.6405063291139242e-06, "loss": 0.0590553916990757, "num_input_tokens_seen": 3428430, "step": 1819, "train_runtime": 5489.2871, "train_tokens_per_second": 624.567 }, { "epoch": 1.839019459186252, "grad_norm": 1.5991250276565552, "learning_rate": 1.630379746835443e-06, "loss": 0.050970666110515594, "num_input_tokens_seen": 3429958, "step": 1820, "train_runtime": 5491.4639, "train_tokens_per_second": 624.598 }, { "epoch": 1.8400303260045487, "grad_norm": 1.3793953657150269, "learning_rate": 1.6202531645569622e-06, "loss": 0.0674283429980278, "num_input_tokens_seen": 3431730, "step": 1821, "train_runtime": 5493.7033, "train_tokens_per_second": 624.666 }, { "epoch": 1.8410411928228456, "grad_norm": 1.6066606044769287, "learning_rate": 1.6101265822784813e-06, "loss": 0.07037971913814545, "num_input_tokens_seen": 3433280, "step": 1822, "train_runtime": 5495.9491, "train_tokens_per_second": 624.693 }, { "epoch": 1.8420520596411423, "grad_norm": 1.3880949020385742, "learning_rate": 1.6000000000000001e-06, "loss": 0.05144776403903961, "num_input_tokens_seen": 3435124, "step": 1823, "train_runtime": 5498.2228, "train_tokens_per_second": 624.77 }, { "epoch": 1.843062926459439, "grad_norm": 1.7201285362243652, "learning_rate": 1.5898734177215192e-06, "loss": 0.0744432657957077, "num_input_tokens_seen": 3436512, "step": 1824, "train_runtime": 5500.3675, "train_tokens_per_second": 624.779 }, { "epoch": 1.8440737932777358, "grad_norm": 1.615710735321045, "learning_rate": 1.579746835443038e-06, "loss": 0.05054347589612007, "num_input_tokens_seen": 3437948, "step": 1825, "train_runtime": 5502.5096, "train_tokens_per_second": 624.796 }, { "epoch": 1.8450846600960324, "grad_norm": 1.3520798683166504, "learning_rate": 1.5696202531645572e-06, "loss": 0.06495378166437149, "num_input_tokens_seen": 3439876, "step": 1826, "train_runtime": 5504.8221, "train_tokens_per_second": 624.884 }, { "epoch": 1.846095526914329, "grad_norm": 1.4349499940872192, "learning_rate": 1.559493670886076e-06, "loss": 0.06821642071008682, "num_input_tokens_seen": 3441730, "step": 1827, "train_runtime": 5507.0642, "train_tokens_per_second": 624.966 }, { "epoch": 1.8471063937326258, "grad_norm": 1.3526065349578857, "learning_rate": 1.5493670886075951e-06, "loss": 0.04434981942176819, "num_input_tokens_seen": 3443580, "step": 1828, "train_runtime": 5509.279, "train_tokens_per_second": 625.051 }, { "epoch": 1.8481172605509224, "grad_norm": 1.303549885749817, "learning_rate": 1.539240506329114e-06, "loss": 0.04251484572887421, "num_input_tokens_seen": 3445306, "step": 1829, "train_runtime": 5511.5501, "train_tokens_per_second": 625.107 }, { "epoch": 1.849128127369219, "grad_norm": 1.7012320756912231, "learning_rate": 1.529113924050633e-06, "loss": 0.06697791814804077, "num_input_tokens_seen": 3447488, "step": 1830, "train_runtime": 5513.924, "train_tokens_per_second": 625.233 }, { "epoch": 1.8501389941875157, "grad_norm": 1.9567233324050903, "learning_rate": 1.518987341772152e-06, "loss": 0.06960449367761612, "num_input_tokens_seen": 3449220, "step": 1831, "train_runtime": 5528.436, "train_tokens_per_second": 623.905 }, { "epoch": 1.8511498610058124, "grad_norm": 1.2680948972702026, "learning_rate": 1.508860759493671e-06, "loss": 0.053070344030857086, "num_input_tokens_seen": 3451032, "step": 1832, "train_runtime": 5530.7009, "train_tokens_per_second": 623.977 }, { "epoch": 1.852160727824109, "grad_norm": 1.1677778959274292, "learning_rate": 1.4987341772151901e-06, "loss": 0.03939846530556679, "num_input_tokens_seen": 3452824, "step": 1833, "train_runtime": 5533.0059, "train_tokens_per_second": 624.041 }, { "epoch": 1.8531715946424059, "grad_norm": 1.1770761013031006, "learning_rate": 1.488607594936709e-06, "loss": 0.03609131649136543, "num_input_tokens_seen": 3454654, "step": 1834, "train_runtime": 5535.3736, "train_tokens_per_second": 624.105 }, { "epoch": 1.8541824614607025, "grad_norm": 1.313709020614624, "learning_rate": 1.478481012658228e-06, "loss": 0.041569799184799194, "num_input_tokens_seen": 3456194, "step": 1835, "train_runtime": 5537.5806, "train_tokens_per_second": 624.134 }, { "epoch": 1.8551933282789992, "grad_norm": 1.3749877214431763, "learning_rate": 1.468354430379747e-06, "loss": 0.035944532603025436, "num_input_tokens_seen": 3458628, "step": 1836, "train_runtime": 5540.0225, "train_tokens_per_second": 624.299 }, { "epoch": 1.856204195097296, "grad_norm": 1.559613823890686, "learning_rate": 1.458227848101266e-06, "loss": 0.06211206316947937, "num_input_tokens_seen": 3460506, "step": 1837, "train_runtime": 5542.3069, "train_tokens_per_second": 624.38 }, { "epoch": 1.8572150619155927, "grad_norm": 1.2114509344100952, "learning_rate": 1.448101265822785e-06, "loss": 0.04860848933458328, "num_input_tokens_seen": 3462502, "step": 1838, "train_runtime": 5544.6184, "train_tokens_per_second": 624.48 }, { "epoch": 1.8582259287338894, "grad_norm": 1.2931417226791382, "learning_rate": 1.437974683544304e-06, "loss": 0.045285362750291824, "num_input_tokens_seen": 3464010, "step": 1839, "train_runtime": 5546.7942, "train_tokens_per_second": 624.507 }, { "epoch": 1.859236795552186, "grad_norm": 1.4669591188430786, "learning_rate": 1.4278481012658229e-06, "loss": 0.04686623066663742, "num_input_tokens_seen": 3465982, "step": 1840, "train_runtime": 5549.0982, "train_tokens_per_second": 624.603 }, { "epoch": 1.8602476623704827, "grad_norm": 1.4337525367736816, "learning_rate": 1.417721518987342e-06, "loss": 0.07382497191429138, "num_input_tokens_seen": 3468036, "step": 1841, "train_runtime": 5551.3966, "train_tokens_per_second": 624.714 }, { "epoch": 1.8612585291887793, "grad_norm": 1.317531704902649, "learning_rate": 1.4075949367088608e-06, "loss": 0.054642219096422195, "num_input_tokens_seen": 3469660, "step": 1842, "train_runtime": 5553.5939, "train_tokens_per_second": 624.759 }, { "epoch": 1.862269396007076, "grad_norm": 1.6953511238098145, "learning_rate": 1.39746835443038e-06, "loss": 0.07365219295024872, "num_input_tokens_seen": 3471300, "step": 1843, "train_runtime": 5555.807, "train_tokens_per_second": 624.806 }, { "epoch": 1.8632802628253726, "grad_norm": 1.3182090520858765, "learning_rate": 1.387341772151899e-06, "loss": 0.05989851802587509, "num_input_tokens_seen": 3472838, "step": 1844, "train_runtime": 5557.9917, "train_tokens_per_second": 624.837 }, { "epoch": 1.8642911296436695, "grad_norm": 1.4372217655181885, "learning_rate": 1.3772151898734179e-06, "loss": 0.05546453222632408, "num_input_tokens_seen": 3474660, "step": 1845, "train_runtime": 5560.2293, "train_tokens_per_second": 624.913 }, { "epoch": 1.8653019964619661, "grad_norm": 1.42632257938385, "learning_rate": 1.367088607594937e-06, "loss": 0.0642927885055542, "num_input_tokens_seen": 3476294, "step": 1846, "train_runtime": 5562.4262, "train_tokens_per_second": 624.96 }, { "epoch": 1.8663128632802628, "grad_norm": 1.1571648120880127, "learning_rate": 1.3569620253164558e-06, "loss": 0.03720973804593086, "num_input_tokens_seen": 3477836, "step": 1847, "train_runtime": 5564.5947, "train_tokens_per_second": 624.994 }, { "epoch": 1.8673237300985597, "grad_norm": 1.2866696119308472, "learning_rate": 1.346835443037975e-06, "loss": 0.05578981712460518, "num_input_tokens_seen": 3479554, "step": 1848, "train_runtime": 5566.8306, "train_tokens_per_second": 625.051 }, { "epoch": 1.8683345969168563, "grad_norm": 1.5326685905456543, "learning_rate": 1.3367088607594938e-06, "loss": 0.06295924633741379, "num_input_tokens_seen": 3481364, "step": 1849, "train_runtime": 5569.099, "train_tokens_per_second": 625.122 }, { "epoch": 1.869345463735153, "grad_norm": 1.3938623666763306, "learning_rate": 1.3265822784810129e-06, "loss": 0.07753098011016846, "num_input_tokens_seen": 3483210, "step": 1850, "train_runtime": 5571.3639, "train_tokens_per_second": 625.199 }, { "epoch": 1.8703563305534496, "grad_norm": 0.940585196018219, "learning_rate": 1.3164556962025317e-06, "loss": 0.03267010673880577, "num_input_tokens_seen": 3484998, "step": 1851, "train_runtime": 5573.5967, "train_tokens_per_second": 625.269 }, { "epoch": 1.8713671973717463, "grad_norm": 1.0479862689971924, "learning_rate": 1.3063291139240508e-06, "loss": 0.03430189564824104, "num_input_tokens_seen": 3486614, "step": 1852, "train_runtime": 5575.8042, "train_tokens_per_second": 625.311 }, { "epoch": 1.872378064190043, "grad_norm": 1.2628525495529175, "learning_rate": 1.2962025316455697e-06, "loss": 0.04698391258716583, "num_input_tokens_seen": 3488406, "step": 1853, "train_runtime": 5578.019, "train_tokens_per_second": 625.384 }, { "epoch": 1.8733889310083396, "grad_norm": 1.6127231121063232, "learning_rate": 1.2860759493670888e-06, "loss": 0.06976167857646942, "num_input_tokens_seen": 3489924, "step": 1854, "train_runtime": 5580.2856, "train_tokens_per_second": 625.402 }, { "epoch": 1.8743997978266362, "grad_norm": 1.2900846004486084, "learning_rate": 1.2759493670886079e-06, "loss": 0.04649154469370842, "num_input_tokens_seen": 3492204, "step": 1855, "train_runtime": 5582.6512, "train_tokens_per_second": 625.546 }, { "epoch": 1.875410664644933, "grad_norm": 1.1668962240219116, "learning_rate": 1.2658227848101267e-06, "loss": 0.02965341880917549, "num_input_tokens_seen": 3493908, "step": 1856, "train_runtime": 5584.8966, "train_tokens_per_second": 625.599 }, { "epoch": 1.8764215314632298, "grad_norm": 1.1431705951690674, "learning_rate": 1.2556962025316458e-06, "loss": 0.05246175453066826, "num_input_tokens_seen": 3495948, "step": 1857, "train_runtime": 5587.168, "train_tokens_per_second": 625.71 }, { "epoch": 1.8774323982815264, "grad_norm": 1.3699880838394165, "learning_rate": 1.2455696202531647e-06, "loss": 0.05064959079027176, "num_input_tokens_seen": 3498066, "step": 1858, "train_runtime": 5589.4946, "train_tokens_per_second": 625.829 }, { "epoch": 1.878443265099823, "grad_norm": 1.0862371921539307, "learning_rate": 1.2354430379746836e-06, "loss": 0.05020325630903244, "num_input_tokens_seen": 3500240, "step": 1859, "train_runtime": 5591.8246, "train_tokens_per_second": 625.957 }, { "epoch": 1.87945413191812, "grad_norm": 1.525439739227295, "learning_rate": 1.2253164556962027e-06, "loss": 0.06935298442840576, "num_input_tokens_seen": 3502098, "step": 1860, "train_runtime": 5594.1119, "train_tokens_per_second": 626.033 }, { "epoch": 1.8804649987364166, "grad_norm": 1.3590785264968872, "learning_rate": 1.2151898734177215e-06, "loss": 0.041813626885414124, "num_input_tokens_seen": 3504010, "step": 1861, "train_runtime": 5608.8547, "train_tokens_per_second": 624.728 }, { "epoch": 1.8814758655547132, "grad_norm": 1.380476474761963, "learning_rate": 1.2050632911392406e-06, "loss": 0.07701250910758972, "num_input_tokens_seen": 3506308, "step": 1862, "train_runtime": 5611.2132, "train_tokens_per_second": 624.875 }, { "epoch": 1.88248673237301, "grad_norm": 1.5668699741363525, "learning_rate": 1.1949367088607595e-06, "loss": 0.04789157584309578, "num_input_tokens_seen": 3508312, "step": 1863, "train_runtime": 5613.5129, "train_tokens_per_second": 624.976 }, { "epoch": 1.8834975991913065, "grad_norm": 1.7109662294387817, "learning_rate": 1.1848101265822786e-06, "loss": 0.0572693832218647, "num_input_tokens_seen": 3510196, "step": 1864, "train_runtime": 5615.7769, "train_tokens_per_second": 625.06 }, { "epoch": 1.8845084660096032, "grad_norm": 1.3793543577194214, "learning_rate": 1.1746835443037974e-06, "loss": 0.05042321979999542, "num_input_tokens_seen": 3511816, "step": 1865, "train_runtime": 5617.9865, "train_tokens_per_second": 625.102 }, { "epoch": 1.8855193328278999, "grad_norm": 1.190150260925293, "learning_rate": 1.1645569620253165e-06, "loss": 0.04872255399823189, "num_input_tokens_seen": 3513736, "step": 1866, "train_runtime": 5620.2597, "train_tokens_per_second": 625.191 }, { "epoch": 1.8865301996461965, "grad_norm": 1.5015819072723389, "learning_rate": 1.1544303797468354e-06, "loss": 0.05711166188120842, "num_input_tokens_seen": 3515274, "step": 1867, "train_runtime": 5622.4345, "train_tokens_per_second": 625.223 }, { "epoch": 1.8875410664644932, "grad_norm": 1.3962602615356445, "learning_rate": 1.1443037974683545e-06, "loss": 0.055755674839019775, "num_input_tokens_seen": 3517364, "step": 1868, "train_runtime": 5624.7426, "train_tokens_per_second": 625.338 }, { "epoch": 1.88855193328279, "grad_norm": 1.265474557876587, "learning_rate": 1.1341772151898736e-06, "loss": 0.060417093336582184, "num_input_tokens_seen": 3519344, "step": 1869, "train_runtime": 5627.2291, "train_tokens_per_second": 625.413 }, { "epoch": 1.8895628001010867, "grad_norm": 1.1677736043930054, "learning_rate": 1.1240506329113924e-06, "loss": 0.041969869285821915, "num_input_tokens_seen": 3521038, "step": 1870, "train_runtime": 5629.4312, "train_tokens_per_second": 625.47 }, { "epoch": 1.8905736669193833, "grad_norm": 1.2462869882583618, "learning_rate": 1.1139240506329115e-06, "loss": 0.05771699920296669, "num_input_tokens_seen": 3522880, "step": 1871, "train_runtime": 5631.6695, "train_tokens_per_second": 625.548 }, { "epoch": 1.8915845337376802, "grad_norm": 1.385130763053894, "learning_rate": 1.1037974683544304e-06, "loss": 0.07197462767362595, "num_input_tokens_seen": 3525122, "step": 1872, "train_runtime": 5634.1757, "train_tokens_per_second": 625.668 }, { "epoch": 1.8925954005559769, "grad_norm": 1.5400617122650146, "learning_rate": 1.0936708860759495e-06, "loss": 0.06472428143024445, "num_input_tokens_seen": 3526860, "step": 1873, "train_runtime": 5636.4081, "train_tokens_per_second": 625.728 }, { "epoch": 1.8936062673742735, "grad_norm": 1.3437457084655762, "learning_rate": 1.0835443037974684e-06, "loss": 0.057449765503406525, "num_input_tokens_seen": 3528716, "step": 1874, "train_runtime": 5638.6949, "train_tokens_per_second": 625.804 }, { "epoch": 1.8946171341925702, "grad_norm": 1.5442469120025635, "learning_rate": 1.0734177215189874e-06, "loss": 0.07203658670186996, "num_input_tokens_seen": 3530244, "step": 1875, "train_runtime": 5640.8552, "train_tokens_per_second": 625.835 }, { "epoch": 1.8956280010108668, "grad_norm": 1.6463550329208374, "learning_rate": 1.0632911392405063e-06, "loss": 0.05945805460214615, "num_input_tokens_seen": 3531840, "step": 1876, "train_runtime": 5643.0617, "train_tokens_per_second": 625.873 }, { "epoch": 1.8966388678291635, "grad_norm": 1.2262964248657227, "learning_rate": 1.0531645569620254e-06, "loss": 0.04987657815217972, "num_input_tokens_seen": 3533806, "step": 1877, "train_runtime": 5645.3716, "train_tokens_per_second": 625.965 }, { "epoch": 1.8976497346474601, "grad_norm": 1.6830824613571167, "learning_rate": 1.0430379746835443e-06, "loss": 0.06614528596401215, "num_input_tokens_seen": 3535284, "step": 1878, "train_runtime": 5647.5175, "train_tokens_per_second": 625.989 }, { "epoch": 1.8986606014657568, "grad_norm": 1.456224799156189, "learning_rate": 1.0329113924050634e-06, "loss": 0.08167030662298203, "num_input_tokens_seen": 3537260, "step": 1879, "train_runtime": 5649.7835, "train_tokens_per_second": 626.088 }, { "epoch": 1.8996714682840534, "grad_norm": 1.2950639724731445, "learning_rate": 1.0227848101265824e-06, "loss": 0.04762929677963257, "num_input_tokens_seen": 3539170, "step": 1880, "train_runtime": 5652.0587, "train_tokens_per_second": 626.174 }, { "epoch": 1.9006823351023503, "grad_norm": 1.28152596950531, "learning_rate": 1.0126582278481013e-06, "loss": 0.05366584658622742, "num_input_tokens_seen": 3540982, "step": 1881, "train_runtime": 5654.3758, "train_tokens_per_second": 626.237 }, { "epoch": 1.901693201920647, "grad_norm": 1.4385573863983154, "learning_rate": 1.0025316455696204e-06, "loss": 0.07367570698261261, "num_input_tokens_seen": 3543062, "step": 1882, "train_runtime": 5656.6719, "train_tokens_per_second": 626.351 }, { "epoch": 1.9027040687389436, "grad_norm": 1.0679799318313599, "learning_rate": 9.924050632911393e-07, "loss": 0.04781443998217583, "num_input_tokens_seen": 3545132, "step": 1883, "train_runtime": 5658.94, "train_tokens_per_second": 626.466 }, { "epoch": 1.9037149355572405, "grad_norm": 1.4399374723434448, "learning_rate": 9.822784810126584e-07, "loss": 0.04740697517991066, "num_input_tokens_seen": 3546714, "step": 1884, "train_runtime": 5661.1141, "train_tokens_per_second": 626.505 }, { "epoch": 1.9047258023755371, "grad_norm": 1.315198540687561, "learning_rate": 9.721518987341772e-07, "loss": 0.04880426079034805, "num_input_tokens_seen": 3548604, "step": 1885, "train_runtime": 5663.3878, "train_tokens_per_second": 626.587 }, { "epoch": 1.9057366691938338, "grad_norm": 1.624666452407837, "learning_rate": 9.620253164556963e-07, "loss": 0.07246091216802597, "num_input_tokens_seen": 3550542, "step": 1886, "train_runtime": 5665.6596, "train_tokens_per_second": 626.678 }, { "epoch": 1.9067475360121304, "grad_norm": 1.181203842163086, "learning_rate": 9.518987341772153e-07, "loss": 0.05116025358438492, "num_input_tokens_seen": 3552096, "step": 1887, "train_runtime": 5667.868, "train_tokens_per_second": 626.708 }, { "epoch": 1.907758402830427, "grad_norm": 1.6072170734405518, "learning_rate": 9.417721518987343e-07, "loss": 0.06815660744905472, "num_input_tokens_seen": 3553786, "step": 1888, "train_runtime": 5670.0852, "train_tokens_per_second": 626.761 }, { "epoch": 1.9087692696487237, "grad_norm": 1.5671355724334717, "learning_rate": 9.316455696202532e-07, "loss": 0.07512356340885162, "num_input_tokens_seen": 3555838, "step": 1889, "train_runtime": 5672.4116, "train_tokens_per_second": 626.865 }, { "epoch": 1.9097801364670204, "grad_norm": 1.0043747425079346, "learning_rate": 9.215189873417722e-07, "loss": 0.047433193773031235, "num_input_tokens_seen": 3557936, "step": 1890, "train_runtime": 5674.7416, "train_tokens_per_second": 626.978 }, { "epoch": 1.910791003285317, "grad_norm": 1.227074146270752, "learning_rate": 9.113924050632912e-07, "loss": 0.06004814803600311, "num_input_tokens_seen": 3559842, "step": 1891, "train_runtime": 5689.1579, "train_tokens_per_second": 625.724 }, { "epoch": 1.9118018701036137, "grad_norm": 1.4453916549682617, "learning_rate": 9.012658227848102e-07, "loss": 0.06125418096780777, "num_input_tokens_seen": 3561686, "step": 1892, "train_runtime": 5691.395, "train_tokens_per_second": 625.802 }, { "epoch": 1.9128127369219106, "grad_norm": 1.3768304586410522, "learning_rate": 8.911392405063292e-07, "loss": 0.058950942009687424, "num_input_tokens_seen": 3563160, "step": 1893, "train_runtime": 5693.5401, "train_tokens_per_second": 625.825 }, { "epoch": 1.9138236037402072, "grad_norm": 1.6235307455062866, "learning_rate": 8.810126582278481e-07, "loss": 0.06537044048309326, "num_input_tokens_seen": 3564766, "step": 1894, "train_runtime": 5695.7154, "train_tokens_per_second": 625.868 }, { "epoch": 1.9148344705585039, "grad_norm": 1.2254753112792969, "learning_rate": 8.708860759493671e-07, "loss": 0.04504122585058212, "num_input_tokens_seen": 3566548, "step": 1895, "train_runtime": 5697.9596, "train_tokens_per_second": 625.934 }, { "epoch": 1.9158453373768007, "grad_norm": 1.1283148527145386, "learning_rate": 8.607594936708862e-07, "loss": 0.05272985249757767, "num_input_tokens_seen": 3568356, "step": 1896, "train_runtime": 5700.2025, "train_tokens_per_second": 626.005 }, { "epoch": 1.9168562041950974, "grad_norm": 1.8246378898620605, "learning_rate": 8.506329113924052e-07, "loss": 0.08242052793502808, "num_input_tokens_seen": 3570256, "step": 1897, "train_runtime": 5702.4811, "train_tokens_per_second": 626.088 }, { "epoch": 1.917867071013394, "grad_norm": 1.414107084274292, "learning_rate": 8.405063291139242e-07, "loss": 0.07147019356489182, "num_input_tokens_seen": 3572150, "step": 1898, "train_runtime": 5704.7521, "train_tokens_per_second": 626.171 }, { "epoch": 1.9188779378316907, "grad_norm": 1.3033477067947388, "learning_rate": 8.303797468354431e-07, "loss": 0.07025488466024399, "num_input_tokens_seen": 3574394, "step": 1899, "train_runtime": 5707.1842, "train_tokens_per_second": 626.297 }, { "epoch": 1.9198888046499873, "grad_norm": 1.1754509210586548, "learning_rate": 8.202531645569621e-07, "loss": 0.04968511313199997, "num_input_tokens_seen": 3576864, "step": 1900, "train_runtime": 5709.6344, "train_tokens_per_second": 626.461 }, { "epoch": 1.920899671468284, "grad_norm": 1.4616328477859497, "learning_rate": 8.101265822784811e-07, "loss": 0.05543573200702667, "num_input_tokens_seen": 3578852, "step": 1901, "train_runtime": 5711.9452, "train_tokens_per_second": 626.556 }, { "epoch": 1.9219105382865806, "grad_norm": 2.396864414215088, "learning_rate": 8.000000000000001e-07, "loss": 0.06355445086956024, "num_input_tokens_seen": 3580110, "step": 1902, "train_runtime": 5714.2485, "train_tokens_per_second": 626.523 }, { "epoch": 1.9229214051048773, "grad_norm": 1.4294058084487915, "learning_rate": 7.89873417721519e-07, "loss": 0.060292791575193405, "num_input_tokens_seen": 3582264, "step": 1903, "train_runtime": 5716.7676, "train_tokens_per_second": 626.624 }, { "epoch": 1.9239322719231742, "grad_norm": 1.4013493061065674, "learning_rate": 7.79746835443038e-07, "loss": 0.06805936992168427, "num_input_tokens_seen": 3583906, "step": 1904, "train_runtime": 5718.9845, "train_tokens_per_second": 626.668 }, { "epoch": 1.9249431387414708, "grad_norm": 1.514113187789917, "learning_rate": 7.69620253164557e-07, "loss": 0.07049944251775742, "num_input_tokens_seen": 3585726, "step": 1905, "train_runtime": 5721.2633, "train_tokens_per_second": 626.737 }, { "epoch": 1.9259540055597675, "grad_norm": 2.08992075920105, "learning_rate": 7.59493670886076e-07, "loss": 0.05363238602876663, "num_input_tokens_seen": 3587382, "step": 1906, "train_runtime": 5723.5139, "train_tokens_per_second": 626.78 }, { "epoch": 1.9269648723780644, "grad_norm": 1.1218788623809814, "learning_rate": 7.493670886075951e-07, "loss": 0.0493963249027729, "num_input_tokens_seen": 3589402, "step": 1907, "train_runtime": 5725.8213, "train_tokens_per_second": 626.88 }, { "epoch": 1.927975739196361, "grad_norm": 1.096281886100769, "learning_rate": 7.39240506329114e-07, "loss": 0.0370219424366951, "num_input_tokens_seen": 3590808, "step": 1908, "train_runtime": 5728.0114, "train_tokens_per_second": 626.886 }, { "epoch": 1.9289866060146577, "grad_norm": 1.1913776397705078, "learning_rate": 7.29113924050633e-07, "loss": 0.058016881346702576, "num_input_tokens_seen": 3593456, "step": 1909, "train_runtime": 5730.4887, "train_tokens_per_second": 627.077 }, { "epoch": 1.9299974728329543, "grad_norm": 1.1618238687515259, "learning_rate": 7.18987341772152e-07, "loss": 0.05671081691980362, "num_input_tokens_seen": 3595598, "step": 1910, "train_runtime": 5732.7933, "train_tokens_per_second": 627.198 }, { "epoch": 1.931008339651251, "grad_norm": 1.2383519411087036, "learning_rate": 7.08860759493671e-07, "loss": 0.05270574986934662, "num_input_tokens_seen": 3597450, "step": 1911, "train_runtime": 5735.041, "train_tokens_per_second": 627.275 }, { "epoch": 1.9320192064695476, "grad_norm": 1.1728078126907349, "learning_rate": 6.9873417721519e-07, "loss": 0.05217333883047104, "num_input_tokens_seen": 3599768, "step": 1912, "train_runtime": 5737.4268, "train_tokens_per_second": 627.419 }, { "epoch": 1.9330300732878443, "grad_norm": 1.3664581775665283, "learning_rate": 6.886075949367089e-07, "loss": 0.05507992208003998, "num_input_tokens_seen": 3601768, "step": 1913, "train_runtime": 5739.7315, "train_tokens_per_second": 627.515 }, { "epoch": 1.934040940106141, "grad_norm": 1.2706823348999023, "learning_rate": 6.784810126582279e-07, "loss": 0.059434473514556885, "num_input_tokens_seen": 3604040, "step": 1914, "train_runtime": 5742.1541, "train_tokens_per_second": 627.646 }, { "epoch": 1.9350518069244376, "grad_norm": 1.2227834463119507, "learning_rate": 6.683544303797469e-07, "loss": 0.05084661394357681, "num_input_tokens_seen": 3605882, "step": 1915, "train_runtime": 5744.4029, "train_tokens_per_second": 627.721 }, { "epoch": 1.9360626737427344, "grad_norm": 1.2547407150268555, "learning_rate": 6.582278481012659e-07, "loss": 0.05846727639436722, "num_input_tokens_seen": 3607992, "step": 1916, "train_runtime": 5746.7956, "train_tokens_per_second": 627.827 }, { "epoch": 1.937073540561031, "grad_norm": 1.4522916078567505, "learning_rate": 6.481012658227849e-07, "loss": 0.04499681293964386, "num_input_tokens_seen": 3609462, "step": 1917, "train_runtime": 5748.9518, "train_tokens_per_second": 627.847 }, { "epoch": 1.9380844073793277, "grad_norm": 1.0351849794387817, "learning_rate": 6.379746835443039e-07, "loss": 0.04698522388935089, "num_input_tokens_seen": 3611516, "step": 1918, "train_runtime": 5751.3202, "train_tokens_per_second": 627.946 }, { "epoch": 1.9390952741976246, "grad_norm": 1.4694240093231201, "learning_rate": 6.278481012658229e-07, "loss": 0.043037835508584976, "num_input_tokens_seen": 3613642, "step": 1919, "train_runtime": 5753.6937, "train_tokens_per_second": 628.056 }, { "epoch": 1.9401061410159213, "grad_norm": 1.187623143196106, "learning_rate": 6.177215189873418e-07, "loss": 0.06462160497903824, "num_input_tokens_seen": 3615978, "step": 1920, "train_runtime": 5756.1132, "train_tokens_per_second": 628.198 }, { "epoch": 1.941117007834218, "grad_norm": 1.4466322660446167, "learning_rate": 6.075949367088608e-07, "loss": 0.060681525617837906, "num_input_tokens_seen": 3617712, "step": 1921, "train_runtime": 5773.3292, "train_tokens_per_second": 626.625 }, { "epoch": 1.9421278746525146, "grad_norm": 1.4236836433410645, "learning_rate": 5.974683544303797e-07, "loss": 0.06719941645860672, "num_input_tokens_seen": 3619592, "step": 1922, "train_runtime": 5775.6404, "train_tokens_per_second": 626.7 }, { "epoch": 1.9431387414708112, "grad_norm": 1.1856107711791992, "learning_rate": 5.873417721518987e-07, "loss": 0.047833673655986786, "num_input_tokens_seen": 3621670, "step": 1923, "train_runtime": 5778.0237, "train_tokens_per_second": 626.801 }, { "epoch": 1.9441496082891079, "grad_norm": 1.4113465547561646, "learning_rate": 5.772151898734177e-07, "loss": 0.06201735883951187, "num_input_tokens_seen": 3623864, "step": 1924, "train_runtime": 5780.3819, "train_tokens_per_second": 626.925 }, { "epoch": 1.9451604751074045, "grad_norm": 1.6672515869140625, "learning_rate": 5.670886075949368e-07, "loss": 0.06638215482234955, "num_input_tokens_seen": 3625582, "step": 1925, "train_runtime": 5782.6588, "train_tokens_per_second": 626.975 }, { "epoch": 1.9461713419257012, "grad_norm": 1.30471670627594, "learning_rate": 5.569620253164558e-07, "loss": 0.04921981319785118, "num_input_tokens_seen": 3627172, "step": 1926, "train_runtime": 5784.8724, "train_tokens_per_second": 627.01 }, { "epoch": 1.9471822087439978, "grad_norm": 1.170035719871521, "learning_rate": 5.468354430379747e-07, "loss": 0.033231914043426514, "num_input_tokens_seen": 3628574, "step": 1927, "train_runtime": 5787.0262, "train_tokens_per_second": 627.019 }, { "epoch": 1.9481930755622947, "grad_norm": 1.3314383029937744, "learning_rate": 5.367088607594937e-07, "loss": 0.05085628479719162, "num_input_tokens_seen": 3630570, "step": 1928, "train_runtime": 5789.3341, "train_tokens_per_second": 627.114 }, { "epoch": 1.9492039423805914, "grad_norm": 1.1564934253692627, "learning_rate": 5.265822784810127e-07, "loss": 0.0381021611392498, "num_input_tokens_seen": 3632622, "step": 1929, "train_runtime": 5791.6456, "train_tokens_per_second": 627.218 }, { "epoch": 1.950214809198888, "grad_norm": 1.094068169593811, "learning_rate": 5.164556962025317e-07, "loss": 0.0400090217590332, "num_input_tokens_seen": 3634376, "step": 1930, "train_runtime": 5793.8926, "train_tokens_per_second": 627.277 }, { "epoch": 1.9512256760171849, "grad_norm": 1.881561040878296, "learning_rate": 5.063291139240507e-07, "loss": 0.047163210809230804, "num_input_tokens_seen": 3636136, "step": 1931, "train_runtime": 5796.1417, "train_tokens_per_second": 627.337 }, { "epoch": 1.9522365428354815, "grad_norm": 1.5697989463806152, "learning_rate": 4.962025316455696e-07, "loss": 0.04581909626722336, "num_input_tokens_seen": 3637648, "step": 1932, "train_runtime": 5798.3317, "train_tokens_per_second": 627.361 }, { "epoch": 1.9532474096537782, "grad_norm": 1.2818243503570557, "learning_rate": 4.860759493670886e-07, "loss": 0.040838710963726044, "num_input_tokens_seen": 3639374, "step": 1933, "train_runtime": 5800.5559, "train_tokens_per_second": 627.418 }, { "epoch": 1.9542582764720748, "grad_norm": 1.1898375749588013, "learning_rate": 4.7594936708860764e-07, "loss": 0.045235615223646164, "num_input_tokens_seen": 3640998, "step": 1934, "train_runtime": 5802.7767, "train_tokens_per_second": 627.458 }, { "epoch": 1.9552691432903715, "grad_norm": 1.100252389907837, "learning_rate": 4.658227848101266e-07, "loss": 0.04474688321352005, "num_input_tokens_seen": 3643372, "step": 1935, "train_runtime": 5805.1409, "train_tokens_per_second": 627.611 }, { "epoch": 1.9562800101086681, "grad_norm": 1.3565642833709717, "learning_rate": 4.556962025316456e-07, "loss": 0.06523145735263824, "num_input_tokens_seen": 3645376, "step": 1936, "train_runtime": 5807.382, "train_tokens_per_second": 627.714 }, { "epoch": 1.9572908769269648, "grad_norm": 1.2880141735076904, "learning_rate": 4.455696202531646e-07, "loss": 0.060890838503837585, "num_input_tokens_seen": 3647236, "step": 1937, "train_runtime": 5809.6287, "train_tokens_per_second": 627.792 }, { "epoch": 1.9583017437452614, "grad_norm": 1.5652706623077393, "learning_rate": 4.3544303797468356e-07, "loss": 0.07239330559968948, "num_input_tokens_seen": 3649178, "step": 1938, "train_runtime": 5811.9006, "train_tokens_per_second": 627.88 }, { "epoch": 1.959312610563558, "grad_norm": 1.3191746473312378, "learning_rate": 4.253164556962026e-07, "loss": 0.059902891516685486, "num_input_tokens_seen": 3651538, "step": 1939, "train_runtime": 5814.2999, "train_tokens_per_second": 628.027 }, { "epoch": 1.960323477381855, "grad_norm": 0.9755680561065674, "learning_rate": 4.1518987341772157e-07, "loss": 0.03792475908994675, "num_input_tokens_seen": 3653874, "step": 1940, "train_runtime": 5816.6629, "train_tokens_per_second": 628.174 }, { "epoch": 1.9613343442001516, "grad_norm": 1.5447108745574951, "learning_rate": 4.0506329113924055e-07, "loss": 0.055281493812799454, "num_input_tokens_seen": 3655382, "step": 1941, "train_runtime": 5818.8473, "train_tokens_per_second": 628.197 }, { "epoch": 1.9623452110184483, "grad_norm": 1.597838282585144, "learning_rate": 3.949367088607595e-07, "loss": 0.044146083295345306, "num_input_tokens_seen": 3656910, "step": 1942, "train_runtime": 5821.0344, "train_tokens_per_second": 628.223 }, { "epoch": 1.9633560778367452, "grad_norm": 1.4328070878982544, "learning_rate": 3.848101265822785e-07, "loss": 0.07204818725585938, "num_input_tokens_seen": 3658812, "step": 1943, "train_runtime": 5823.3391, "train_tokens_per_second": 628.301 }, { "epoch": 1.9643669446550418, "grad_norm": 1.06763756275177, "learning_rate": 3.7468354430379753e-07, "loss": 0.04172516614198685, "num_input_tokens_seen": 3660618, "step": 1944, "train_runtime": 5825.5817, "train_tokens_per_second": 628.37 }, { "epoch": 1.9653778114733385, "grad_norm": 1.1053352355957031, "learning_rate": 3.645569620253165e-07, "loss": 0.03737139329314232, "num_input_tokens_seen": 3662816, "step": 1945, "train_runtime": 5827.8859, "train_tokens_per_second": 628.498 }, { "epoch": 1.966388678291635, "grad_norm": 1.413617730140686, "learning_rate": 3.544303797468355e-07, "loss": 0.045816756784915924, "num_input_tokens_seen": 3664510, "step": 1946, "train_runtime": 5830.1387, "train_tokens_per_second": 628.546 }, { "epoch": 1.9673995451099318, "grad_norm": 1.3344900608062744, "learning_rate": 3.4430379746835447e-07, "loss": 0.053659211844205856, "num_input_tokens_seen": 3666856, "step": 1947, "train_runtime": 5832.5396, "train_tokens_per_second": 628.689 }, { "epoch": 1.9684104119282284, "grad_norm": 1.4741601943969727, "learning_rate": 3.3417721518987345e-07, "loss": 0.05253228545188904, "num_input_tokens_seen": 3668630, "step": 1948, "train_runtime": 5834.7812, "train_tokens_per_second": 628.752 }, { "epoch": 1.969421278746525, "grad_norm": 1.300722599029541, "learning_rate": 3.240506329113924e-07, "loss": 0.0691450908780098, "num_input_tokens_seen": 3670330, "step": 1949, "train_runtime": 5837.012, "train_tokens_per_second": 628.803 }, { "epoch": 1.9704321455648217, "grad_norm": 1.6856491565704346, "learning_rate": 3.1392405063291146e-07, "loss": 0.044100165367126465, "num_input_tokens_seen": 3672008, "step": 1950, "train_runtime": 5839.1846, "train_tokens_per_second": 628.856 }, { "epoch": 1.9714430123831184, "grad_norm": 1.366133689880371, "learning_rate": 3.037974683544304e-07, "loss": 0.05769915133714676, "num_input_tokens_seen": 3674074, "step": 1951, "train_runtime": 5853.8862, "train_tokens_per_second": 627.63 }, { "epoch": 1.9724538792014152, "grad_norm": 1.6894501447677612, "learning_rate": 2.9367088607594936e-07, "loss": 0.07025322318077087, "num_input_tokens_seen": 3676084, "step": 1952, "train_runtime": 5856.157, "train_tokens_per_second": 627.73 }, { "epoch": 1.973464746019712, "grad_norm": 1.2029181718826294, "learning_rate": 2.835443037974684e-07, "loss": 0.041464902460575104, "num_input_tokens_seen": 3678154, "step": 1953, "train_runtime": 5858.4511, "train_tokens_per_second": 627.837 }, { "epoch": 1.9744756128380085, "grad_norm": 1.5632749795913696, "learning_rate": 2.7341772151898737e-07, "loss": 0.08382153511047363, "num_input_tokens_seen": 3680106, "step": 1954, "train_runtime": 5860.7258, "train_tokens_per_second": 627.927 }, { "epoch": 1.9754864796563054, "grad_norm": 1.28147292137146, "learning_rate": 2.6329113924050635e-07, "loss": 0.030513249337673187, "num_input_tokens_seen": 3682152, "step": 1955, "train_runtime": 5863.0484, "train_tokens_per_second": 628.027 }, { "epoch": 1.976497346474602, "grad_norm": 1.233107089996338, "learning_rate": 2.5316455696202533e-07, "loss": 0.045211970806121826, "num_input_tokens_seen": 3683756, "step": 1956, "train_runtime": 5865.3086, "train_tokens_per_second": 628.058 }, { "epoch": 1.9775082132928987, "grad_norm": 1.6602846384048462, "learning_rate": 2.430379746835443e-07, "loss": 0.06595426797866821, "num_input_tokens_seen": 3685400, "step": 1957, "train_runtime": 5867.5371, "train_tokens_per_second": 628.1 }, { "epoch": 1.9785190801111954, "grad_norm": 1.6605432033538818, "learning_rate": 2.329113924050633e-07, "loss": 0.07228749990463257, "num_input_tokens_seen": 3687110, "step": 1958, "train_runtime": 5869.757, "train_tokens_per_second": 628.154 }, { "epoch": 1.979529946929492, "grad_norm": 1.2205003499984741, "learning_rate": 2.227848101265823e-07, "loss": 0.045379042625427246, "num_input_tokens_seen": 3688784, "step": 1959, "train_runtime": 5871.9878, "train_tokens_per_second": 628.2 }, { "epoch": 1.9805408137477887, "grad_norm": 1.359030842781067, "learning_rate": 2.126582278481013e-07, "loss": 0.07342518866062164, "num_input_tokens_seen": 3690750, "step": 1960, "train_runtime": 5874.3306, "train_tokens_per_second": 628.284 }, { "epoch": 1.9815516805660853, "grad_norm": 1.3784176111221313, "learning_rate": 2.0253164556962027e-07, "loss": 0.0556640587747097, "num_input_tokens_seen": 3692700, "step": 1961, "train_runtime": 5876.6067, "train_tokens_per_second": 628.373 }, { "epoch": 1.982562547384382, "grad_norm": 1.2333017587661743, "learning_rate": 1.9240506329113925e-07, "loss": 0.04461481422185898, "num_input_tokens_seen": 3694398, "step": 1962, "train_runtime": 5879.1261, "train_tokens_per_second": 628.392 }, { "epoch": 1.9835734142026786, "grad_norm": 2.013918876647949, "learning_rate": 1.8227848101265826e-07, "loss": 0.07952126860618591, "num_input_tokens_seen": 3695908, "step": 1963, "train_runtime": 5881.3504, "train_tokens_per_second": 628.411 }, { "epoch": 1.9845842810209755, "grad_norm": 1.2891860008239746, "learning_rate": 1.7215189873417723e-07, "loss": 0.05664373189210892, "num_input_tokens_seen": 3698094, "step": 1964, "train_runtime": 5883.6952, "train_tokens_per_second": 628.533 }, { "epoch": 1.9855951478392722, "grad_norm": 1.332255244255066, "learning_rate": 1.620253164556962e-07, "loss": 0.06749482452869415, "num_input_tokens_seen": 3700184, "step": 1965, "train_runtime": 5886.0278, "train_tokens_per_second": 628.639 }, { "epoch": 1.986606014657569, "grad_norm": 1.4188288450241089, "learning_rate": 1.518987341772152e-07, "loss": 0.055493321269750595, "num_input_tokens_seen": 3701876, "step": 1966, "train_runtime": 5888.2697, "train_tokens_per_second": 628.687 }, { "epoch": 1.9876168814758657, "grad_norm": 1.320956826210022, "learning_rate": 1.417721518987342e-07, "loss": 0.06059660762548447, "num_input_tokens_seen": 3703512, "step": 1967, "train_runtime": 5890.4485, "train_tokens_per_second": 628.732 }, { "epoch": 1.9886277482941623, "grad_norm": 33.71479415893555, "learning_rate": 1.3164556962025317e-07, "loss": 0.04406532645225525, "num_input_tokens_seen": 3705336, "step": 1968, "train_runtime": 5892.6835, "train_tokens_per_second": 628.803 }, { "epoch": 1.989638615112459, "grad_norm": 1.292183518409729, "learning_rate": 1.2151898734177215e-07, "loss": 0.05553293600678444, "num_input_tokens_seen": 3707076, "step": 1969, "train_runtime": 5894.9226, "train_tokens_per_second": 628.859 }, { "epoch": 1.9906494819307556, "grad_norm": 1.9007545709609985, "learning_rate": 1.1139240506329114e-07, "loss": 0.07554098963737488, "num_input_tokens_seen": 3708656, "step": 1970, "train_runtime": 5897.1043, "train_tokens_per_second": 628.894 }, { "epoch": 1.9916603487490523, "grad_norm": 1.814345359802246, "learning_rate": 1.0126582278481014e-07, "loss": 0.06582854688167572, "num_input_tokens_seen": 3710238, "step": 1971, "train_runtime": 5899.2792, "train_tokens_per_second": 628.931 }, { "epoch": 1.992671215567349, "grad_norm": 1.0943604707717896, "learning_rate": 9.113924050632913e-08, "loss": 0.051717597991228104, "num_input_tokens_seen": 3712330, "step": 1972, "train_runtime": 5901.5442, "train_tokens_per_second": 629.044 }, { "epoch": 1.9936820823856456, "grad_norm": 1.5968142747879028, "learning_rate": 8.10126582278481e-08, "loss": 0.06050843745470047, "num_input_tokens_seen": 3713826, "step": 1973, "train_runtime": 5903.7162, "train_tokens_per_second": 629.066 }, { "epoch": 1.9946929492039422, "grad_norm": 1.145068645477295, "learning_rate": 7.08860759493671e-08, "loss": 0.04888053983449936, "num_input_tokens_seen": 3716112, "step": 1974, "train_runtime": 5906.0585, "train_tokens_per_second": 629.203 }, { "epoch": 1.9957038160222391, "grad_norm": 1.3995318412780762, "learning_rate": 6.075949367088608e-08, "loss": 0.061537325382232666, "num_input_tokens_seen": 3717602, "step": 1975, "train_runtime": 5908.2381, "train_tokens_per_second": 629.223 }, { "epoch": 1.9967146828405358, "grad_norm": 0.9206666350364685, "learning_rate": 5.063291139240507e-08, "loss": 0.02986668422818184, "num_input_tokens_seen": 3719202, "step": 1976, "train_runtime": 5910.4093, "train_tokens_per_second": 629.263 }, { "epoch": 1.9977255496588324, "grad_norm": 1.5160229206085205, "learning_rate": 4.050632911392405e-08, "loss": 0.06555500626564026, "num_input_tokens_seen": 3720932, "step": 1977, "train_runtime": 5912.6278, "train_tokens_per_second": 629.32 }, { "epoch": 1.9987364164771293, "grad_norm": 1.421866536140442, "learning_rate": 3.037974683544304e-08, "loss": 0.0551639124751091, "num_input_tokens_seen": 3722462, "step": 1978, "train_runtime": 5914.7797, "train_tokens_per_second": 629.349 }, { "epoch": 1.999747283295426, "grad_norm": 1.2375504970550537, "learning_rate": 2.0253164556962027e-08, "loss": 0.06062401831150055, "num_input_tokens_seen": 3724864, "step": 1979, "train_runtime": 5917.1893, "train_tokens_per_second": 629.499 }, { "epoch": 2.0, "grad_norm": 13.45600414276123, "learning_rate": 1.0126582278481013e-08, "loss": 0.10668642073869705, "num_input_tokens_seen": 3724995, "step": 1980, "train_runtime": 5917.7901, "train_tokens_per_second": 629.457 }, { "epoch": 2.0, "eval_loss": 0.365520179271698, "eval_runtime": 54.2315, "eval_samples_per_second": 16.208, "eval_steps_per_second": 8.113, "num_input_tokens_seen": 3724995, "step": 1980 } ], "logging_steps": 1, "max_steps": 1980, "num_input_tokens_seen": 3724995, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.804686815910976e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }