{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 15680, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0006377551020408163, "grad_norm": 0.6313766146507682, "learning_rate": 9.999998394288208e-06, "loss": 0.33850436210632323, "num_input_tokens_seen": 309624, "step": 5, "train_runtime": 66.1477, "train_tokens_per_second": 4680.794 }, { "epoch": 0.0012755102040816326, "grad_norm": 0.6205915413500387, "learning_rate": 9.999991871085821e-06, "loss": 0.3195484161376953, "num_input_tokens_seen": 617984, "step": 10, "train_runtime": 131.5668, "train_tokens_per_second": 4697.11 }, { "epoch": 0.001913265306122449, "grad_norm": 0.6369759482202858, "learning_rate": 9.999980330042391e-06, "loss": 0.31821389198303224, "num_input_tokens_seen": 922216, "step": 15, "train_runtime": 189.9263, "train_tokens_per_second": 4855.651 }, { "epoch": 0.002551020408163265, "grad_norm": 0.6101008388950145, "learning_rate": 9.999963771169503e-06, "loss": 0.3285261392593384, "num_input_tokens_seen": 1228440, "step": 20, "train_runtime": 255.8324, "train_tokens_per_second": 4801.737 }, { "epoch": 0.0031887755102040817, "grad_norm": 0.6834911121613362, "learning_rate": 9.999942194483775e-06, "loss": 0.3178420543670654, "num_input_tokens_seen": 1534256, "step": 25, "train_runtime": 314.5148, "train_tokens_per_second": 4878.168 }, { "epoch": 0.003826530612244898, "grad_norm": 0.6170487360838941, "learning_rate": 9.999915600006857e-06, "loss": 0.3137950897216797, "num_input_tokens_seen": 1841184, "step": 30, "train_runtime": 370.1851, "train_tokens_per_second": 4973.685 }, { "epoch": 0.004464285714285714, "grad_norm": 0.6716564497994858, "learning_rate": 9.999883987765443e-06, "loss": 0.30161247253417967, "num_input_tokens_seen": 2134520, "step": 35, "train_runtime": 444.1605, "train_tokens_per_second": 4805.74 }, { "epoch": 0.00510204081632653, "grad_norm": 0.6523834223862264, "learning_rate": 9.999847357791256e-06, "loss": 0.3267825126647949, "num_input_tokens_seen": 2437936, "step": 40, "train_runtime": 512.2405, "train_tokens_per_second": 4759.358 }, { "epoch": 0.005739795918367347, "grad_norm": 0.6398987507232226, "learning_rate": 9.999805710121055e-06, "loss": 0.3393638849258423, "num_input_tokens_seen": 2754040, "step": 45, "train_runtime": 571.3353, "train_tokens_per_second": 4820.357 }, { "epoch": 0.006377551020408163, "grad_norm": 0.6106921304806688, "learning_rate": 9.99975904479664e-06, "loss": 0.3237131118774414, "num_input_tokens_seen": 3041032, "step": 50, "train_runtime": 641.5805, "train_tokens_per_second": 4739.907 }, { "epoch": 0.00701530612244898, "grad_norm": 0.6958236841111044, "learning_rate": 9.999707361864841e-06, "loss": 0.36842975616455076, "num_input_tokens_seen": 3355376, "step": 55, "train_runtime": 689.5653, "train_tokens_per_second": 4865.929 }, { "epoch": 0.007653061224489796, "grad_norm": 0.7335802456853094, "learning_rate": 9.999650661377527e-06, "loss": 0.3665752410888672, "num_input_tokens_seen": 3655680, "step": 60, "train_runtime": 748.2584, "train_tokens_per_second": 4885.585 }, { "epoch": 0.008290816326530613, "grad_norm": 0.6788516722261737, "learning_rate": 9.999588943391597e-06, "loss": 0.3658756256103516, "num_input_tokens_seen": 3965648, "step": 65, "train_runtime": 821.1636, "train_tokens_per_second": 4829.303 }, { "epoch": 0.008928571428571428, "grad_norm": 0.6773708513395791, "learning_rate": 9.999522207968992e-06, "loss": 0.32802519798278806, "num_input_tokens_seen": 4276160, "step": 70, "train_runtime": 874.2068, "train_tokens_per_second": 4891.474 }, { "epoch": 0.009566326530612245, "grad_norm": 0.618622603818562, "learning_rate": 9.999450455176686e-06, "loss": 0.3478161573410034, "num_input_tokens_seen": 4584392, "step": 75, "train_runtime": 936.5082, "train_tokens_per_second": 4895.197 }, { "epoch": 0.01020408163265306, "grad_norm": 0.6260901752075039, "learning_rate": 9.99937368508669e-06, "loss": 0.3187378168106079, "num_input_tokens_seen": 4891664, "step": 80, "train_runtime": 1004.7186, "train_tokens_per_second": 4868.691 }, { "epoch": 0.010841836734693877, "grad_norm": 0.667190746463301, "learning_rate": 9.999291897776043e-06, "loss": 0.32980921268463137, "num_input_tokens_seen": 5189440, "step": 85, "train_runtime": 1078.1879, "train_tokens_per_second": 4813.113 }, { "epoch": 0.011479591836734694, "grad_norm": 0.5750586926863843, "learning_rate": 9.999205093326825e-06, "loss": 0.33111636638641356, "num_input_tokens_seen": 5485064, "step": 90, "train_runtime": 1146.8163, "train_tokens_per_second": 4782.862 }, { "epoch": 0.01211734693877551, "grad_norm": 0.6017076025749912, "learning_rate": 9.999113271826154e-06, "loss": 0.31922378540039065, "num_input_tokens_seen": 5780584, "step": 95, "train_runtime": 1208.5778, "train_tokens_per_second": 4782.964 }, { "epoch": 0.012755102040816327, "grad_norm": 0.606460864307619, "learning_rate": 9.999016433366178e-06, "loss": 0.34738271236419677, "num_input_tokens_seen": 6084648, "step": 100, "train_runtime": 1276.8553, "train_tokens_per_second": 4765.339 }, { "epoch": 0.013392857142857142, "grad_norm": 0.6197516341828899, "learning_rate": 9.998914578044079e-06, "loss": 0.3142980098724365, "num_input_tokens_seen": 6390464, "step": 105, "train_runtime": 1337.4726, "train_tokens_per_second": 4778.015 }, { "epoch": 0.01403061224489796, "grad_norm": 0.6235817964061284, "learning_rate": 9.998807705962079e-06, "loss": 0.3406642436981201, "num_input_tokens_seen": 6691224, "step": 110, "train_runtime": 1407.56, "train_tokens_per_second": 4753.775 }, { "epoch": 0.014668367346938776, "grad_norm": 0.677622003307496, "learning_rate": 9.99869581722743e-06, "loss": 0.3410198211669922, "num_input_tokens_seen": 6997664, "step": 115, "train_runtime": 1478.1146, "train_tokens_per_second": 4734.182 }, { "epoch": 0.015306122448979591, "grad_norm": 0.6649293990093726, "learning_rate": 9.99857891195242e-06, "loss": 0.34250473976135254, "num_input_tokens_seen": 7304528, "step": 120, "train_runtime": 1539.9315, "train_tokens_per_second": 4743.411 }, { "epoch": 0.01594387755102041, "grad_norm": 0.7071355973636468, "learning_rate": 9.998456990254371e-06, "loss": 0.32828989028930666, "num_input_tokens_seen": 7613176, "step": 125, "train_runtime": 1611.0141, "train_tokens_per_second": 4725.704 }, { "epoch": 0.016581632653061226, "grad_norm": 0.6158828508586639, "learning_rate": 9.998330052255642e-06, "loss": 0.3207663059234619, "num_input_tokens_seen": 7931376, "step": 130, "train_runtime": 1661.8304, "train_tokens_per_second": 4772.675 }, { "epoch": 0.01721938775510204, "grad_norm": 0.6507793141596079, "learning_rate": 9.998198098083623e-06, "loss": 0.3120201349258423, "num_input_tokens_seen": 8220976, "step": 135, "train_runtime": 1716.4662, "train_tokens_per_second": 4789.477 }, { "epoch": 0.017857142857142856, "grad_norm": 0.6480114718063784, "learning_rate": 9.998061127870738e-06, "loss": 0.3055912733078003, "num_input_tokens_seen": 8512112, "step": 140, "train_runtime": 1792.2391, "train_tokens_per_second": 4749.429 }, { "epoch": 0.018494897959183673, "grad_norm": 0.6852857295771357, "learning_rate": 9.997919141754448e-06, "loss": 0.35830059051513674, "num_input_tokens_seen": 8802400, "step": 145, "train_runtime": 1856.7624, "train_tokens_per_second": 4740.725 }, { "epoch": 0.01913265306122449, "grad_norm": 0.6199941796324793, "learning_rate": 9.997772139877245e-06, "loss": 0.3327900171279907, "num_input_tokens_seen": 9110000, "step": 150, "train_runtime": 1933.1163, "train_tokens_per_second": 4712.598 }, { "epoch": 0.019770408163265307, "grad_norm": 0.6153251276990073, "learning_rate": 9.997620122386658e-06, "loss": 0.33315272331237794, "num_input_tokens_seen": 9414456, "step": 155, "train_runtime": 1998.4404, "train_tokens_per_second": 4710.901 }, { "epoch": 0.02040816326530612, "grad_norm": 0.6646714549122126, "learning_rate": 9.997463089435242e-06, "loss": 0.32426862716674804, "num_input_tokens_seen": 9726616, "step": 160, "train_runtime": 2058.6526, "train_tokens_per_second": 4724.749 }, { "epoch": 0.021045918367346938, "grad_norm": 0.6534691087987078, "learning_rate": 9.997301041180597e-06, "loss": 0.342034649848938, "num_input_tokens_seen": 10030152, "step": 165, "train_runtime": 2128.5744, "train_tokens_per_second": 4712.145 }, { "epoch": 0.021683673469387755, "grad_norm": 0.6909544282185469, "learning_rate": 9.997133977785342e-06, "loss": 0.3254104137420654, "num_input_tokens_seen": 10335744, "step": 170, "train_runtime": 2180.5109, "train_tokens_per_second": 4740.056 }, { "epoch": 0.022321428571428572, "grad_norm": 0.6415788664349892, "learning_rate": 9.996961899417145e-06, "loss": 0.35123443603515625, "num_input_tokens_seen": 10643144, "step": 175, "train_runtime": 2249.0893, "train_tokens_per_second": 4732.202 }, { "epoch": 0.02295918367346939, "grad_norm": 0.6318044218192264, "learning_rate": 9.996784806248694e-06, "loss": 0.3360785961151123, "num_input_tokens_seen": 10946704, "step": 180, "train_runtime": 2314.4156, "train_tokens_per_second": 4729.792 }, { "epoch": 0.023596938775510203, "grad_norm": 0.6258613065343058, "learning_rate": 9.996602698457716e-06, "loss": 0.3184788465499878, "num_input_tokens_seen": 11253984, "step": 185, "train_runtime": 2390.5895, "train_tokens_per_second": 4707.619 }, { "epoch": 0.02423469387755102, "grad_norm": 0.6236546663558538, "learning_rate": 9.996415576226967e-06, "loss": 0.3205930233001709, "num_input_tokens_seen": 11557352, "step": 190, "train_runtime": 2455.2743, "train_tokens_per_second": 4707.153 }, { "epoch": 0.024872448979591837, "grad_norm": 0.6211891202484879, "learning_rate": 9.996223439744238e-06, "loss": 0.2992743492126465, "num_input_tokens_seen": 11867464, "step": 195, "train_runtime": 2522.985, "train_tokens_per_second": 4703.739 }, { "epoch": 0.025510204081632654, "grad_norm": 0.6677730693527612, "learning_rate": 9.996026289202352e-06, "loss": 0.3238770246505737, "num_input_tokens_seen": 12178464, "step": 200, "train_runtime": 2579.1454, "train_tokens_per_second": 4721.899 }, { "epoch": 0.02614795918367347, "grad_norm": 0.5823244571655314, "learning_rate": 9.995824124799164e-06, "loss": 0.36721694469451904, "num_input_tokens_seen": 12485272, "step": 205, "train_runtime": 2642.3033, "train_tokens_per_second": 4725.147 }, { "epoch": 0.026785714285714284, "grad_norm": 0.5931239174350026, "learning_rate": 9.995616946737558e-06, "loss": 0.3346077919006348, "num_input_tokens_seen": 12788440, "step": 210, "train_runtime": 2705.3052, "train_tokens_per_second": 4727.171 }, { "epoch": 0.0274234693877551, "grad_norm": 0.6489082273588189, "learning_rate": 9.995404755225454e-06, "loss": 0.3342667818069458, "num_input_tokens_seen": 13084544, "step": 215, "train_runtime": 2783.4989, "train_tokens_per_second": 4700.754 }, { "epoch": 0.02806122448979592, "grad_norm": 0.5670967952124059, "learning_rate": 9.995187550475799e-06, "loss": 0.30646519660949706, "num_input_tokens_seen": 13382224, "step": 220, "train_runtime": 2846.279, "train_tokens_per_second": 4701.656 }, { "epoch": 0.028698979591836735, "grad_norm": 0.6528085049465088, "learning_rate": 9.994965332706574e-06, "loss": 0.30767092704772947, "num_input_tokens_seen": 13672600, "step": 225, "train_runtime": 2913.7946, "train_tokens_per_second": 4692.369 }, { "epoch": 0.029336734693877552, "grad_norm": 0.6560986976249802, "learning_rate": 9.994738102140791e-06, "loss": 0.34403650760650634, "num_input_tokens_seen": 13985608, "step": 230, "train_runtime": 2982.5514, "train_tokens_per_second": 4689.142 }, { "epoch": 0.029974489795918366, "grad_norm": 0.655839503346995, "learning_rate": 9.994505859006489e-06, "loss": 0.32221179008483886, "num_input_tokens_seen": 14272056, "step": 235, "train_runtime": 3055.4689, "train_tokens_per_second": 4670.987 }, { "epoch": 0.030612244897959183, "grad_norm": 0.6214811118379946, "learning_rate": 9.994268603536743e-06, "loss": 0.3470602035522461, "num_input_tokens_seen": 14577080, "step": 240, "train_runtime": 3111.7544, "train_tokens_per_second": 4684.521 }, { "epoch": 0.03125, "grad_norm": 0.5494146630666381, "learning_rate": 9.994026335969654e-06, "loss": 0.32835218906402586, "num_input_tokens_seen": 14874720, "step": 245, "train_runtime": 3184.6531, "train_tokens_per_second": 4670.751 }, { "epoch": 0.03188775510204082, "grad_norm": 0.6047196528111599, "learning_rate": 9.993779056548357e-06, "loss": 0.32953906059265137, "num_input_tokens_seen": 15175768, "step": 250, "train_runtime": 3247.5928, "train_tokens_per_second": 4672.928 }, { "epoch": 0.032525510204081634, "grad_norm": 0.6743699455037632, "learning_rate": 9.99352676552101e-06, "loss": 0.33337490558624266, "num_input_tokens_seen": 15469696, "step": 255, "train_runtime": 3304.0945, "train_tokens_per_second": 4681.978 }, { "epoch": 0.03316326530612245, "grad_norm": 0.5933691290415959, "learning_rate": 9.993269463140805e-06, "loss": 0.3574438333511353, "num_input_tokens_seen": 15779624, "step": 260, "train_runtime": 3361.674, "train_tokens_per_second": 4693.978 }, { "epoch": 0.03380102040816327, "grad_norm": 0.6327740999108824, "learning_rate": 9.993007149665968e-06, "loss": 0.33641748428344725, "num_input_tokens_seen": 16077880, "step": 265, "train_runtime": 3431.2529, "train_tokens_per_second": 4685.717 }, { "epoch": 0.03443877551020408, "grad_norm": 0.5737650225224535, "learning_rate": 9.992739825359743e-06, "loss": 0.3066434383392334, "num_input_tokens_seen": 16374368, "step": 270, "train_runtime": 3504.5078, "train_tokens_per_second": 4672.373 }, { "epoch": 0.035076530612244895, "grad_norm": 0.6111088036267571, "learning_rate": 9.992467490490411e-06, "loss": 0.3326112747192383, "num_input_tokens_seen": 16685616, "step": 275, "train_runtime": 3574.2741, "train_tokens_per_second": 4668.253 }, { "epoch": 0.03571428571428571, "grad_norm": 0.6361151501047907, "learning_rate": 9.99219014533128e-06, "loss": 0.34957115650177, "num_input_tokens_seen": 17007744, "step": 280, "train_runtime": 3623.1821, "train_tokens_per_second": 4694.145 }, { "epoch": 0.03635204081632653, "grad_norm": 0.6791204972403216, "learning_rate": 9.991907790160686e-06, "loss": 0.33728978633880613, "num_input_tokens_seen": 17322144, "step": 285, "train_runtime": 3695.6144, "train_tokens_per_second": 4687.216 }, { "epoch": 0.036989795918367346, "grad_norm": 0.6933069106222348, "learning_rate": 9.991620425261987e-06, "loss": 0.33463027477264407, "num_input_tokens_seen": 17633104, "step": 290, "train_runtime": 3762.1203, "train_tokens_per_second": 4687.012 }, { "epoch": 0.03762755102040816, "grad_norm": 0.6497657790060584, "learning_rate": 9.99132805092358e-06, "loss": 0.33530759811401367, "num_input_tokens_seen": 17934608, "step": 295, "train_runtime": 3820.0982, "train_tokens_per_second": 4694.803 }, { "epoch": 0.03826530612244898, "grad_norm": 0.6882412546792613, "learning_rate": 9.99103066743888e-06, "loss": 0.36384072303771975, "num_input_tokens_seen": 18229648, "step": 300, "train_runtime": 3891.6162, "train_tokens_per_second": 4684.339 }, { "epoch": 0.0389030612244898, "grad_norm": 0.6601675334042054, "learning_rate": 9.990728275106332e-06, "loss": 0.32778329849243165, "num_input_tokens_seen": 18535656, "step": 305, "train_runtime": 3959.4362, "train_tokens_per_second": 4681.388 }, { "epoch": 0.039540816326530615, "grad_norm": 0.646885641152173, "learning_rate": 9.990420874229408e-06, "loss": 0.3228672981262207, "num_input_tokens_seen": 18843904, "step": 310, "train_runtime": 4026.317, "train_tokens_per_second": 4680.184 }, { "epoch": 0.04017857142857143, "grad_norm": 0.5931343448102652, "learning_rate": 9.990108465116606e-06, "loss": 0.32550835609436035, "num_input_tokens_seen": 19145520, "step": 315, "train_runtime": 4100.4082, "train_tokens_per_second": 4669.174 }, { "epoch": 0.04081632653061224, "grad_norm": 0.6677742695692401, "learning_rate": 9.989791048081452e-06, "loss": 0.3454264163970947, "num_input_tokens_seen": 19447640, "step": 320, "train_runtime": 4165.5338, "train_tokens_per_second": 4668.703 }, { "epoch": 0.04145408163265306, "grad_norm": 0.6533746396017394, "learning_rate": 9.989468623442494e-06, "loss": 0.36098618507385255, "num_input_tokens_seen": 19749576, "step": 325, "train_runtime": 4228.9644, "train_tokens_per_second": 4670.074 }, { "epoch": 0.042091836734693876, "grad_norm": 0.668231205428044, "learning_rate": 9.989141191523309e-06, "loss": 0.3276120662689209, "num_input_tokens_seen": 20035464, "step": 330, "train_runtime": 4285.975, "train_tokens_per_second": 4674.657 }, { "epoch": 0.04272959183673469, "grad_norm": 0.7191606014130846, "learning_rate": 9.988808752652498e-06, "loss": 0.3200536251068115, "num_input_tokens_seen": 20327480, "step": 335, "train_runtime": 4357.5244, "train_tokens_per_second": 4664.915 }, { "epoch": 0.04336734693877551, "grad_norm": 0.6495192286239109, "learning_rate": 9.988471307163684e-06, "loss": 0.30787248611450196, "num_input_tokens_seen": 20620464, "step": 340, "train_runtime": 4419.6411, "train_tokens_per_second": 4665.642 }, { "epoch": 0.04400510204081633, "grad_norm": 0.6033660537585547, "learning_rate": 9.988128855395522e-06, "loss": 0.3384589195251465, "num_input_tokens_seen": 20928144, "step": 345, "train_runtime": 4486.7509, "train_tokens_per_second": 4664.432 }, { "epoch": 0.044642857142857144, "grad_norm": 0.6270276756841308, "learning_rate": 9.987781397691683e-06, "loss": 0.3512593746185303, "num_input_tokens_seen": 21241216, "step": 350, "train_runtime": 4555.1403, "train_tokens_per_second": 4663.131 }, { "epoch": 0.04528061224489796, "grad_norm": 0.6379085152276468, "learning_rate": 9.987428934400864e-06, "loss": 0.33603107929229736, "num_input_tokens_seen": 21542400, "step": 355, "train_runtime": 4629.5182, "train_tokens_per_second": 4653.27 }, { "epoch": 0.04591836734693878, "grad_norm": 0.6445613765371325, "learning_rate": 9.98707146587679e-06, "loss": 0.3387459754943848, "num_input_tokens_seen": 21842576, "step": 360, "train_runtime": 4697.6725, "train_tokens_per_second": 4649.659 }, { "epoch": 0.046556122448979595, "grad_norm": 0.6049239039573681, "learning_rate": 9.986708992478202e-06, "loss": 0.3367520809173584, "num_input_tokens_seen": 22156256, "step": 365, "train_runtime": 4755.0115, "train_tokens_per_second": 4659.559 }, { "epoch": 0.047193877551020405, "grad_norm": 0.6640689638548932, "learning_rate": 9.98634151456887e-06, "loss": 0.3515306949615479, "num_input_tokens_seen": 22468688, "step": 370, "train_runtime": 4821.2083, "train_tokens_per_second": 4660.385 }, { "epoch": 0.04783163265306122, "grad_norm": 0.5714771338985628, "learning_rate": 9.985969032517582e-06, "loss": 0.3335010528564453, "num_input_tokens_seen": 22779688, "step": 375, "train_runtime": 4888.5125, "train_tokens_per_second": 4659.84 }, { "epoch": 0.04846938775510204, "grad_norm": 0.6375577903834478, "learning_rate": 9.985591546698151e-06, "loss": 0.33521523475646975, "num_input_tokens_seen": 23085304, "step": 380, "train_runtime": 4953.1284, "train_tokens_per_second": 4660.752 }, { "epoch": 0.049107142857142856, "grad_norm": 0.6750011275254378, "learning_rate": 9.98520905748941e-06, "loss": 0.34557697772979734, "num_input_tokens_seen": 23388632, "step": 385, "train_runtime": 5012.5547, "train_tokens_per_second": 4666.01 }, { "epoch": 0.04974489795918367, "grad_norm": 0.6307576116085186, "learning_rate": 9.984821565275214e-06, "loss": 0.31669833660125735, "num_input_tokens_seen": 23702200, "step": 390, "train_runtime": 5064.9324, "train_tokens_per_second": 4679.668 }, { "epoch": 0.05038265306122449, "grad_norm": 0.7090277542261124, "learning_rate": 9.984429070444437e-06, "loss": 0.3379413843154907, "num_input_tokens_seen": 23994432, "step": 395, "train_runtime": 5138.7592, "train_tokens_per_second": 4669.305 }, { "epoch": 0.05102040816326531, "grad_norm": 0.6241354831363873, "learning_rate": 9.984031573390977e-06, "loss": 0.33236329555511473, "num_input_tokens_seen": 24295472, "step": 400, "train_runtime": 5199.699, "train_tokens_per_second": 4672.477 }, { "epoch": 0.051658163265306124, "grad_norm": 0.6334452015043983, "learning_rate": 9.983629074513749e-06, "loss": 0.361618185043335, "num_input_tokens_seen": 24605608, "step": 405, "train_runtime": 5279.4591, "train_tokens_per_second": 4660.63 }, { "epoch": 0.05229591836734694, "grad_norm": 0.6075619104856002, "learning_rate": 9.983221574216688e-06, "loss": 0.33792781829833984, "num_input_tokens_seen": 24917816, "step": 410, "train_runtime": 5356.0183, "train_tokens_per_second": 4652.302 }, { "epoch": 0.05293367346938776, "grad_norm": 0.5927953294938682, "learning_rate": 9.98280907290875e-06, "loss": 0.34446349143981936, "num_input_tokens_seen": 25215896, "step": 415, "train_runtime": 5422.7067, "train_tokens_per_second": 4650.057 }, { "epoch": 0.05357142857142857, "grad_norm": 0.6349671362506129, "learning_rate": 9.98239157100391e-06, "loss": 0.31869771480560305, "num_input_tokens_seen": 25511528, "step": 420, "train_runtime": 5486.2099, "train_tokens_per_second": 4650.119 }, { "epoch": 0.054209183673469385, "grad_norm": 0.6363245190083693, "learning_rate": 9.981969068921157e-06, "loss": 0.32179903984069824, "num_input_tokens_seen": 25805496, "step": 425, "train_runtime": 5562.0273, "train_tokens_per_second": 4639.585 }, { "epoch": 0.0548469387755102, "grad_norm": 0.5953777633043515, "learning_rate": 9.981541567084506e-06, "loss": 0.32957944869995115, "num_input_tokens_seen": 26108872, "step": 430, "train_runtime": 5614.2716, "train_tokens_per_second": 4650.447 }, { "epoch": 0.05548469387755102, "grad_norm": 0.55458880364536, "learning_rate": 9.98110906592298e-06, "loss": 0.3697628974914551, "num_input_tokens_seen": 26433456, "step": 435, "train_runtime": 5675.2963, "train_tokens_per_second": 4657.635 }, { "epoch": 0.05612244897959184, "grad_norm": 0.6582635660637224, "learning_rate": 9.980671565870628e-06, "loss": 0.35071864128112795, "num_input_tokens_seen": 26732128, "step": 440, "train_runtime": 5750.8954, "train_tokens_per_second": 4648.342 }, { "epoch": 0.056760204081632654, "grad_norm": 0.5742208718122617, "learning_rate": 9.98022906736651e-06, "loss": 0.3407757759094238, "num_input_tokens_seen": 27028024, "step": 445, "train_runtime": 5819.2972, "train_tokens_per_second": 4644.551 }, { "epoch": 0.05739795918367347, "grad_norm": 0.5761437244964501, "learning_rate": 9.979781570854704e-06, "loss": 0.34862961769104006, "num_input_tokens_seen": 27341456, "step": 450, "train_runtime": 5879.7817, "train_tokens_per_second": 4650.08 }, { "epoch": 0.05803571428571429, "grad_norm": 0.5981064953687432, "learning_rate": 9.979329076784305e-06, "loss": 0.361210036277771, "num_input_tokens_seen": 27637416, "step": 455, "train_runtime": 5947.1589, "train_tokens_per_second": 4647.163 }, { "epoch": 0.058673469387755105, "grad_norm": 0.649912764397423, "learning_rate": 9.978871585609422e-06, "loss": 0.33243255615234374, "num_input_tokens_seen": 27936360, "step": 460, "train_runtime": 6019.5129, "train_tokens_per_second": 4640.967 }, { "epoch": 0.05931122448979592, "grad_norm": 0.643413112020552, "learning_rate": 9.978409097789178e-06, "loss": 0.3394655704498291, "num_input_tokens_seen": 28246160, "step": 465, "train_runtime": 6070.7082, "train_tokens_per_second": 4652.861 }, { "epoch": 0.05994897959183673, "grad_norm": 0.6137203637301495, "learning_rate": 9.977941613787714e-06, "loss": 0.3474451541900635, "num_input_tokens_seen": 28549672, "step": 470, "train_runtime": 6144.1843, "train_tokens_per_second": 4646.617 }, { "epoch": 0.06058673469387755, "grad_norm": 0.6349170869369642, "learning_rate": 9.977469134074181e-06, "loss": 0.3277826070785522, "num_input_tokens_seen": 28850928, "step": 475, "train_runtime": 6217.4577, "train_tokens_per_second": 4640.31 }, { "epoch": 0.061224489795918366, "grad_norm": 0.7111752400586683, "learning_rate": 9.976991659122748e-06, "loss": 0.3291780471801758, "num_input_tokens_seen": 29155440, "step": 480, "train_runtime": 6284.6269, "train_tokens_per_second": 4639.168 }, { "epoch": 0.06186224489795918, "grad_norm": 0.5912100762259809, "learning_rate": 9.976509189412591e-06, "loss": 0.3117806434631348, "num_input_tokens_seen": 29454808, "step": 485, "train_runtime": 6344.9385, "train_tokens_per_second": 4642.253 }, { "epoch": 0.0625, "grad_norm": 0.593222482776597, "learning_rate": 9.976021725427905e-06, "loss": 0.3248849153518677, "num_input_tokens_seen": 29753184, "step": 490, "train_runtime": 6414.4261, "train_tokens_per_second": 4638.48 }, { "epoch": 0.06313775510204081, "grad_norm": 0.5757997254457702, "learning_rate": 9.975529267657892e-06, "loss": 0.3143364191055298, "num_input_tokens_seen": 30053816, "step": 495, "train_runtime": 6487.1309, "train_tokens_per_second": 4632.836 }, { "epoch": 0.06377551020408163, "grad_norm": 0.6593953309542427, "learning_rate": 9.97503181659677e-06, "loss": 0.3483597755432129, "num_input_tokens_seen": 30370832, "step": 500, "train_runtime": 6537.8396, "train_tokens_per_second": 4645.393 }, { "epoch": 0.06441326530612244, "grad_norm": 0.6286079628698305, "learning_rate": 9.974529372743762e-06, "loss": 0.3520472288131714, "num_input_tokens_seen": 30677376, "step": 505, "train_runtime": 6590.1231, "train_tokens_per_second": 4655.054 }, { "epoch": 0.06505102040816327, "grad_norm": 0.6742459446609242, "learning_rate": 9.97402193660311e-06, "loss": 0.32537987232208254, "num_input_tokens_seen": 30984552, "step": 510, "train_runtime": 6655.3612, "train_tokens_per_second": 4655.578 }, { "epoch": 0.06568877551020408, "grad_norm": 0.6515613566569659, "learning_rate": 9.973509508684061e-06, "loss": 0.3295437812805176, "num_input_tokens_seen": 31290592, "step": 515, "train_runtime": 6721.7448, "train_tokens_per_second": 4655.129 }, { "epoch": 0.0663265306122449, "grad_norm": 0.6002794411888607, "learning_rate": 9.972992089500868e-06, "loss": 0.3507524013519287, "num_input_tokens_seen": 31581920, "step": 520, "train_runtime": 6792.6906, "train_tokens_per_second": 4649.398 }, { "epoch": 0.06696428571428571, "grad_norm": 0.6998894513007168, "learning_rate": 9.972469679572802e-06, "loss": 0.33227179050445554, "num_input_tokens_seen": 31883032, "step": 525, "train_runtime": 6849.6859, "train_tokens_per_second": 4654.671 }, { "epoch": 0.06760204081632654, "grad_norm": 0.651718521446083, "learning_rate": 9.971942279424136e-06, "loss": 0.3360892772674561, "num_input_tokens_seen": 32197784, "step": 530, "train_runtime": 6908.1131, "train_tokens_per_second": 4660.865 }, { "epoch": 0.06823979591836735, "grad_norm": 0.6460825483711362, "learning_rate": 9.971409889584151e-06, "loss": 0.34338998794555664, "num_input_tokens_seen": 32504160, "step": 535, "train_runtime": 6977.8177, "train_tokens_per_second": 4658.213 }, { "epoch": 0.06887755102040816, "grad_norm": 0.6497177932901091, "learning_rate": 9.970872510587142e-06, "loss": 0.34417474269866943, "num_input_tokens_seen": 32804584, "step": 540, "train_runtime": 7042.265, "train_tokens_per_second": 4658.243 }, { "epoch": 0.06951530612244898, "grad_norm": 0.6393545300470731, "learning_rate": 9.970330142972403e-06, "loss": 0.35027050971984863, "num_input_tokens_seen": 33113264, "step": 545, "train_runtime": 7118.1472, "train_tokens_per_second": 4651.95 }, { "epoch": 0.07015306122448979, "grad_norm": 0.6698249362905612, "learning_rate": 9.969782787284237e-06, "loss": 0.3356395483016968, "num_input_tokens_seen": 33425640, "step": 550, "train_runtime": 7179.3723, "train_tokens_per_second": 4655.789 }, { "epoch": 0.07079081632653061, "grad_norm": 0.6702548205068602, "learning_rate": 9.969230444071956e-06, "loss": 0.3323835849761963, "num_input_tokens_seen": 33730696, "step": 555, "train_runtime": 7237.5872, "train_tokens_per_second": 4660.489 }, { "epoch": 0.07142857142857142, "grad_norm": 0.6123175171096529, "learning_rate": 9.968673113889874e-06, "loss": 0.34821453094482424, "num_input_tokens_seen": 34035864, "step": 560, "train_runtime": 7294.7884, "train_tokens_per_second": 4665.778 }, { "epoch": 0.07206632653061225, "grad_norm": 0.6720244851960792, "learning_rate": 9.968110797297312e-06, "loss": 0.3442867279052734, "num_input_tokens_seen": 34341288, "step": 565, "train_runtime": 7365.9536, "train_tokens_per_second": 4662.165 }, { "epoch": 0.07270408163265306, "grad_norm": 0.6160081517048929, "learning_rate": 9.967543494858591e-06, "loss": 0.35814208984375, "num_input_tokens_seen": 34651224, "step": 570, "train_runtime": 7433.406, "train_tokens_per_second": 4661.554 }, { "epoch": 0.07334183673469388, "grad_norm": 0.6217454360955795, "learning_rate": 9.966971207143041e-06, "loss": 0.34238247871398925, "num_input_tokens_seen": 34960960, "step": 575, "train_runtime": 7494.761, "train_tokens_per_second": 4664.72 }, { "epoch": 0.07397959183673469, "grad_norm": 1.2904884702226334, "learning_rate": 9.966393934724992e-06, "loss": 0.3418263912200928, "num_input_tokens_seen": 35271552, "step": 580, "train_runtime": 7551.6917, "train_tokens_per_second": 4670.682 }, { "epoch": 0.07461734693877552, "grad_norm": 0.6324057925636936, "learning_rate": 9.965811678183777e-06, "loss": 0.330104398727417, "num_input_tokens_seen": 35581248, "step": 585, "train_runtime": 7620.6631, "train_tokens_per_second": 4669.049 }, { "epoch": 0.07525510204081633, "grad_norm": 0.646585573794272, "learning_rate": 9.965224438103733e-06, "loss": 0.34459099769592283, "num_input_tokens_seen": 35896192, "step": 590, "train_runtime": 7684.1699, "train_tokens_per_second": 4671.447 }, { "epoch": 0.07589285714285714, "grad_norm": 0.6258608008360923, "learning_rate": 9.964632215074193e-06, "loss": 0.3336080551147461, "num_input_tokens_seen": 36209472, "step": 595, "train_runtime": 7752.3812, "train_tokens_per_second": 4670.755 }, { "epoch": 0.07653061224489796, "grad_norm": 0.5619516673673918, "learning_rate": 9.964035009689498e-06, "loss": 0.33786745071411134, "num_input_tokens_seen": 36513008, "step": 600, "train_runtime": 7813.4726, "train_tokens_per_second": 4673.083 }, { "epoch": 0.07716836734693877, "grad_norm": 0.6998511212309851, "learning_rate": 9.963432822548982e-06, "loss": 0.32400827407836913, "num_input_tokens_seen": 36799952, "step": 605, "train_runtime": 7869.9921, "train_tokens_per_second": 4675.983 }, { "epoch": 0.0778061224489796, "grad_norm": 0.6340485994796795, "learning_rate": 9.962825654256984e-06, "loss": 0.33402822017669676, "num_input_tokens_seen": 37101008, "step": 610, "train_runtime": 7926.1372, "train_tokens_per_second": 4680.844 }, { "epoch": 0.0784438775510204, "grad_norm": 0.6514619233256685, "learning_rate": 9.962213505422838e-06, "loss": 0.3186351776123047, "num_input_tokens_seen": 37406416, "step": 615, "train_runtime": 8002.9603, "train_tokens_per_second": 4674.072 }, { "epoch": 0.07908163265306123, "grad_norm": 0.6353041852541652, "learning_rate": 9.96159637666088e-06, "loss": 0.3287219047546387, "num_input_tokens_seen": 37700984, "step": 620, "train_runtime": 8071.9407, "train_tokens_per_second": 4670.622 }, { "epoch": 0.07971938775510204, "grad_norm": 0.7428472192357477, "learning_rate": 9.96097426859044e-06, "loss": 0.309468412399292, "num_input_tokens_seen": 37974384, "step": 625, "train_runtime": 8140.39, "train_tokens_per_second": 4664.934 }, { "epoch": 0.08035714285714286, "grad_norm": 0.563023413948935, "learning_rate": 9.960347181835848e-06, "loss": 0.31683375835418703, "num_input_tokens_seen": 38282248, "step": 630, "train_runtime": 8205.1443, "train_tokens_per_second": 4665.64 }, { "epoch": 0.08099489795918367, "grad_norm": 0.6463783859310616, "learning_rate": 9.95971511702643e-06, "loss": 0.32001914978027346, "num_input_tokens_seen": 38580048, "step": 635, "train_runtime": 8269.7685, "train_tokens_per_second": 4665.191 }, { "epoch": 0.08163265306122448, "grad_norm": 0.6863907881842608, "learning_rate": 9.959078074796505e-06, "loss": 0.3427865028381348, "num_input_tokens_seen": 38888080, "step": 640, "train_runtime": 8324.1349, "train_tokens_per_second": 4671.726 }, { "epoch": 0.08227040816326531, "grad_norm": 0.6166462935595397, "learning_rate": 9.958436055785391e-06, "loss": 0.3504422664642334, "num_input_tokens_seen": 39201064, "step": 645, "train_runtime": 8402.0196, "train_tokens_per_second": 4665.672 }, { "epoch": 0.08290816326530612, "grad_norm": 0.6129701573859874, "learning_rate": 9.9577890606374e-06, "loss": 0.3311141014099121, "num_input_tokens_seen": 39506496, "step": 650, "train_runtime": 8457.9418, "train_tokens_per_second": 4670.935 }, { "epoch": 0.08354591836734694, "grad_norm": 0.6576165531867053, "learning_rate": 9.957137090001834e-06, "loss": 0.34262380599975584, "num_input_tokens_seen": 39787552, "step": 655, "train_runtime": 8511.4495, "train_tokens_per_second": 4674.592 }, { "epoch": 0.08418367346938775, "grad_norm": 0.6597706109347632, "learning_rate": 9.956480144532992e-06, "loss": 0.3301884889602661, "num_input_tokens_seen": 40090352, "step": 660, "train_runtime": 8580.9114, "train_tokens_per_second": 4672.039 }, { "epoch": 0.08482142857142858, "grad_norm": 0.8245169872586329, "learning_rate": 9.955818224890166e-06, "loss": 0.3425352334976196, "num_input_tokens_seen": 40405072, "step": 665, "train_runtime": 8639.845, "train_tokens_per_second": 4676.597 }, { "epoch": 0.08545918367346939, "grad_norm": 0.62100333481103, "learning_rate": 9.955151331737638e-06, "loss": 0.3391813516616821, "num_input_tokens_seen": 40722368, "step": 670, "train_runtime": 8702.4887, "train_tokens_per_second": 4679.393 }, { "epoch": 0.08609693877551021, "grad_norm": 0.5885127232768026, "learning_rate": 9.954479465744681e-06, "loss": 0.32563443183898927, "num_input_tokens_seen": 41015040, "step": 675, "train_runtime": 8766.1622, "train_tokens_per_second": 4678.791 }, { "epoch": 0.08673469387755102, "grad_norm": 0.642935608039282, "learning_rate": 9.95380262758556e-06, "loss": 0.3731600522994995, "num_input_tokens_seen": 41315736, "step": 680, "train_runtime": 8828.3355, "train_tokens_per_second": 4679.901 }, { "epoch": 0.08737244897959184, "grad_norm": 0.6561126308399429, "learning_rate": 9.953120817939532e-06, "loss": 0.3367309093475342, "num_input_tokens_seen": 41621136, "step": 685, "train_runtime": 8895.075, "train_tokens_per_second": 4679.121 }, { "epoch": 0.08801020408163265, "grad_norm": 0.6485319029413061, "learning_rate": 9.952434037490835e-06, "loss": 0.3516701698303223, "num_input_tokens_seen": 41931728, "step": 690, "train_runtime": 8962.3701, "train_tokens_per_second": 4678.643 }, { "epoch": 0.08864795918367346, "grad_norm": 0.5933925996798751, "learning_rate": 9.951742286928706e-06, "loss": 0.32941617965698244, "num_input_tokens_seen": 42235328, "step": 695, "train_runtime": 9021.7432, "train_tokens_per_second": 4681.504 }, { "epoch": 0.08928571428571429, "grad_norm": 0.564562833510779, "learning_rate": 9.951045566947361e-06, "loss": 0.31849193572998047, "num_input_tokens_seen": 42539752, "step": 700, "train_runtime": 9082.1865, "train_tokens_per_second": 4683.867 }, { "epoch": 0.0899234693877551, "grad_norm": 0.617759203056016, "learning_rate": 9.950343878246011e-06, "loss": 0.3369591236114502, "num_input_tokens_seen": 42844680, "step": 705, "train_runtime": 9151.1138, "train_tokens_per_second": 4681.909 }, { "epoch": 0.09056122448979592, "grad_norm": 0.6718067036117873, "learning_rate": 9.949637221528847e-06, "loss": 0.3505253314971924, "num_input_tokens_seen": 43149992, "step": 710, "train_runtime": 9214.6197, "train_tokens_per_second": 4682.775 }, { "epoch": 0.09119897959183673, "grad_norm": 0.7213035397634782, "learning_rate": 9.94892559750505e-06, "loss": 0.34964261054992674, "num_input_tokens_seen": 43455200, "step": 715, "train_runtime": 9285.6942, "train_tokens_per_second": 4679.801 }, { "epoch": 0.09183673469387756, "grad_norm": 0.6616448628629455, "learning_rate": 9.948209006888782e-06, "loss": 0.34442615509033203, "num_input_tokens_seen": 43756952, "step": 720, "train_runtime": 9350.4408, "train_tokens_per_second": 4679.667 }, { "epoch": 0.09247448979591837, "grad_norm": 0.641629063439199, "learning_rate": 9.947487450399196e-06, "loss": 0.37545912265777587, "num_input_tokens_seen": 44071424, "step": 725, "train_runtime": 9400.2472, "train_tokens_per_second": 4688.326 }, { "epoch": 0.09311224489795919, "grad_norm": 0.6240625238331874, "learning_rate": 9.946760928760419e-06, "loss": 0.3321858882904053, "num_input_tokens_seen": 44374592, "step": 730, "train_runtime": 9467.356, "train_tokens_per_second": 4687.116 }, { "epoch": 0.09375, "grad_norm": 0.6322018195102153, "learning_rate": 9.946029442701572e-06, "loss": 0.32565453052520754, "num_input_tokens_seen": 44671440, "step": 735, "train_runtime": 9523.3977, "train_tokens_per_second": 4690.704 }, { "epoch": 0.09438775510204081, "grad_norm": 0.6605175435876213, "learning_rate": 9.945292992956747e-06, "loss": 0.3345797538757324, "num_input_tokens_seen": 44976088, "step": 740, "train_runtime": 9594.0464, "train_tokens_per_second": 4687.916 }, { "epoch": 0.09502551020408163, "grad_norm": 0.5972935827923552, "learning_rate": 9.944551580265025e-06, "loss": 0.34259605407714844, "num_input_tokens_seen": 45280296, "step": 745, "train_runtime": 9666.5333, "train_tokens_per_second": 4684.233 }, { "epoch": 0.09566326530612244, "grad_norm": 0.6512752099965131, "learning_rate": 9.943805205370467e-06, "loss": 0.35463581085205076, "num_input_tokens_seen": 45583616, "step": 750, "train_runtime": 9730.0762, "train_tokens_per_second": 4684.816 }, { "epoch": 0.09630102040816327, "grad_norm": 0.6564157072566779, "learning_rate": 9.94305386902211e-06, "loss": 0.3260321140289307, "num_input_tokens_seen": 45876952, "step": 755, "train_runtime": 9798.0296, "train_tokens_per_second": 4682.263 }, { "epoch": 0.09693877551020408, "grad_norm": 0.6346769074928412, "learning_rate": 9.942297571973973e-06, "loss": 0.33512492179870607, "num_input_tokens_seen": 46178848, "step": 760, "train_runtime": 9868.2039, "train_tokens_per_second": 4679.56 }, { "epoch": 0.0975765306122449, "grad_norm": 0.5622200359560194, "learning_rate": 9.941536314985054e-06, "loss": 0.32372226715087893, "num_input_tokens_seen": 46489520, "step": 765, "train_runtime": 9943.8403, "train_tokens_per_second": 4675.208 }, { "epoch": 0.09821428571428571, "grad_norm": 0.652691796843303, "learning_rate": 9.940770098819329e-06, "loss": 0.3503239631652832, "num_input_tokens_seen": 46802232, "step": 770, "train_runtime": 9993.5689, "train_tokens_per_second": 4683.235 }, { "epoch": 0.09885204081632654, "grad_norm": 0.6504801242347312, "learning_rate": 9.939998924245742e-06, "loss": 0.32001385688781736, "num_input_tokens_seen": 47109088, "step": 775, "train_runtime": 10055.9232, "train_tokens_per_second": 4684.71 }, { "epoch": 0.09948979591836735, "grad_norm": 0.6290107603055541, "learning_rate": 9.93922279203823e-06, "loss": 0.3270054578781128, "num_input_tokens_seen": 47396392, "step": 780, "train_runtime": 10115.628, "train_tokens_per_second": 4685.462 }, { "epoch": 0.10012755102040816, "grad_norm": 0.5984760115235302, "learning_rate": 9.938441702975689e-06, "loss": 0.33510923385620117, "num_input_tokens_seen": 47691224, "step": 785, "train_runtime": 10171.722, "train_tokens_per_second": 4688.609 }, { "epoch": 0.10076530612244898, "grad_norm": 0.5945590755184339, "learning_rate": 9.937655657842001e-06, "loss": 0.33897085189819337, "num_input_tokens_seen": 48000248, "step": 790, "train_runtime": 10244.0159, "train_tokens_per_second": 4685.687 }, { "epoch": 0.10140306122448979, "grad_norm": 0.6403831240042489, "learning_rate": 9.936864657426014e-06, "loss": 0.3564270496368408, "num_input_tokens_seen": 48316296, "step": 795, "train_runtime": 10293.9437, "train_tokens_per_second": 4693.662 }, { "epoch": 0.10204081632653061, "grad_norm": 0.6446524416085734, "learning_rate": 9.936068702521553e-06, "loss": 0.3363536834716797, "num_input_tokens_seen": 48619456, "step": 800, "train_runtime": 10357.3747, "train_tokens_per_second": 4694.187 }, { "epoch": 0.10267857142857142, "grad_norm": 0.5714798655252041, "learning_rate": 9.935267793927416e-06, "loss": 0.3507491111755371, "num_input_tokens_seen": 48924672, "step": 805, "train_runtime": 10423.3082, "train_tokens_per_second": 4693.776 }, { "epoch": 0.10331632653061225, "grad_norm": 0.5951054701936696, "learning_rate": 9.93446193244737e-06, "loss": 0.3112443447113037, "num_input_tokens_seen": 49225280, "step": 810, "train_runtime": 10484.5803, "train_tokens_per_second": 4695.017 }, { "epoch": 0.10395408163265306, "grad_norm": 0.5913459917729529, "learning_rate": 9.933651118890151e-06, "loss": 0.3627671718597412, "num_input_tokens_seen": 49527824, "step": 815, "train_runtime": 10553.6081, "train_tokens_per_second": 4692.975 }, { "epoch": 0.10459183673469388, "grad_norm": 0.6067586558019212, "learning_rate": 9.93283535406947e-06, "loss": 0.31316590309143066, "num_input_tokens_seen": 49818424, "step": 820, "train_runtime": 10609.2781, "train_tokens_per_second": 4695.741 }, { "epoch": 0.10522959183673469, "grad_norm": 0.5900034325851385, "learning_rate": 9.932014638804001e-06, "loss": 0.3390337467193604, "num_input_tokens_seen": 50120392, "step": 825, "train_runtime": 10679.1642, "train_tokens_per_second": 4693.288 }, { "epoch": 0.10586734693877552, "grad_norm": 0.6118873763765331, "learning_rate": 9.931188973917393e-06, "loss": 0.3528244972229004, "num_input_tokens_seen": 50437328, "step": 830, "train_runtime": 10749.3443, "train_tokens_per_second": 4692.131 }, { "epoch": 0.10650510204081633, "grad_norm": 0.6191303656527237, "learning_rate": 9.930358360238255e-06, "loss": 0.3476259708404541, "num_input_tokens_seen": 50739776, "step": 835, "train_runtime": 10821.0403, "train_tokens_per_second": 4688.992 }, { "epoch": 0.10714285714285714, "grad_norm": 0.9321027342684852, "learning_rate": 9.929522798600168e-06, "loss": 0.32042813301086426, "num_input_tokens_seen": 51054616, "step": 840, "train_runtime": 10882.3019, "train_tokens_per_second": 4691.527 }, { "epoch": 0.10778061224489796, "grad_norm": 0.612929250179954, "learning_rate": 9.928682289841674e-06, "loss": 0.33142428398132323, "num_input_tokens_seen": 51357944, "step": 845, "train_runtime": 10949.2079, "train_tokens_per_second": 4690.562 }, { "epoch": 0.10841836734693877, "grad_norm": 0.6443381175533973, "learning_rate": 9.927836834806284e-06, "loss": 0.35215234756469727, "num_input_tokens_seen": 51662968, "step": 850, "train_runtime": 11020.3408, "train_tokens_per_second": 4687.965 }, { "epoch": 0.1090561224489796, "grad_norm": 0.6980326547970849, "learning_rate": 9.926986434342471e-06, "loss": 0.3072350025177002, "num_input_tokens_seen": 51955408, "step": 855, "train_runtime": 11084.8998, "train_tokens_per_second": 4687.044 }, { "epoch": 0.1096938775510204, "grad_norm": 0.6265378803336521, "learning_rate": 9.926131089303672e-06, "loss": 0.33462932109832766, "num_input_tokens_seen": 52261056, "step": 860, "train_runtime": 11146.8728, "train_tokens_per_second": 4688.405 }, { "epoch": 0.11033163265306123, "grad_norm": 0.6485933375531521, "learning_rate": 9.925270800548285e-06, "loss": 0.32468724250793457, "num_input_tokens_seen": 52553456, "step": 865, "train_runtime": 11211.2365, "train_tokens_per_second": 4687.57 }, { "epoch": 0.11096938775510204, "grad_norm": 0.753232518571963, "learning_rate": 9.924405568939667e-06, "loss": 0.38157219886779786, "num_input_tokens_seen": 52859568, "step": 870, "train_runtime": 11268.6986, "train_tokens_per_second": 4690.832 }, { "epoch": 0.11160714285714286, "grad_norm": 0.6538272459043324, "learning_rate": 9.923535395346145e-06, "loss": 0.31001625061035154, "num_input_tokens_seen": 53163928, "step": 875, "train_runtime": 11336.7117, "train_tokens_per_second": 4689.537 }, { "epoch": 0.11224489795918367, "grad_norm": 0.5755487815405781, "learning_rate": 9.92266028064099e-06, "loss": 0.30125041007995607, "num_input_tokens_seen": 53474152, "step": 880, "train_runtime": 11403.7345, "train_tokens_per_second": 4689.179 }, { "epoch": 0.11288265306122448, "grad_norm": 0.679482039375145, "learning_rate": 9.921780225702448e-06, "loss": 0.32144479751586913, "num_input_tokens_seen": 53781448, "step": 885, "train_runtime": 11477.1682, "train_tokens_per_second": 4685.951 }, { "epoch": 0.11352040816326531, "grad_norm": 0.6019576388093533, "learning_rate": 9.920895231413714e-06, "loss": 0.3461263418197632, "num_input_tokens_seen": 54101144, "step": 890, "train_runtime": 11539.6978, "train_tokens_per_second": 4688.263 }, { "epoch": 0.11415816326530612, "grad_norm": 0.6273273601475747, "learning_rate": 9.92000529866294e-06, "loss": 0.3378733158111572, "num_input_tokens_seen": 54410120, "step": 895, "train_runtime": 11606.4535, "train_tokens_per_second": 4687.92 }, { "epoch": 0.11479591836734694, "grad_norm": 0.6373721839889133, "learning_rate": 9.919110428343235e-06, "loss": 0.3378178596496582, "num_input_tokens_seen": 54718832, "step": 900, "train_runtime": 11659.9144, "train_tokens_per_second": 4692.902 }, { "epoch": 0.11543367346938775, "grad_norm": 0.5372536134204118, "learning_rate": 9.918210621352667e-06, "loss": 0.3274667978286743, "num_input_tokens_seen": 55019664, "step": 905, "train_runtime": 11730.9735, "train_tokens_per_second": 4690.119 }, { "epoch": 0.11607142857142858, "grad_norm": 0.6244634917562096, "learning_rate": 9.917305878594251e-06, "loss": 0.35554866790771483, "num_input_tokens_seen": 55329784, "step": 910, "train_runtime": 11809.9727, "train_tokens_per_second": 4685.005 }, { "epoch": 0.11670918367346939, "grad_norm": 0.6503819855008445, "learning_rate": 9.916396200975966e-06, "loss": 0.3127890110015869, "num_input_tokens_seen": 55623544, "step": 915, "train_runtime": 11871.2639, "train_tokens_per_second": 4685.562 }, { "epoch": 0.11734693877551021, "grad_norm": 0.6252291437789995, "learning_rate": 9.91548158941073e-06, "loss": 0.33112030029296874, "num_input_tokens_seen": 55927480, "step": 920, "train_runtime": 11940.2567, "train_tokens_per_second": 4683.943 }, { "epoch": 0.11798469387755102, "grad_norm": 0.5367371258827875, "learning_rate": 9.914562044816424e-06, "loss": 0.3396120548248291, "num_input_tokens_seen": 56238632, "step": 925, "train_runtime": 12013.7771, "train_tokens_per_second": 4681.178 }, { "epoch": 0.11862244897959184, "grad_norm": 0.6196964334710047, "learning_rate": 9.913637568115873e-06, "loss": 0.34828312397003175, "num_input_tokens_seen": 56523656, "step": 930, "train_runtime": 12080.8434, "train_tokens_per_second": 4678.784 }, { "epoch": 0.11926020408163265, "grad_norm": 0.6757997370063455, "learning_rate": 9.912708160236854e-06, "loss": 0.3335379123687744, "num_input_tokens_seen": 56827640, "step": 935, "train_runtime": 12133.9846, "train_tokens_per_second": 4683.345 }, { "epoch": 0.11989795918367346, "grad_norm": 0.5945713330525164, "learning_rate": 9.911773822112094e-06, "loss": 0.3137048244476318, "num_input_tokens_seen": 57124504, "step": 940, "train_runtime": 12198.6931, "train_tokens_per_second": 4682.838 }, { "epoch": 0.12053571428571429, "grad_norm": 0.5437143823809053, "learning_rate": 9.910834554679266e-06, "loss": 0.3561995029449463, "num_input_tokens_seen": 57425768, "step": 945, "train_runtime": 12271.2348, "train_tokens_per_second": 4679.706 }, { "epoch": 0.1211734693877551, "grad_norm": 0.7265574889311718, "learning_rate": 9.909890358880991e-06, "loss": 0.35443639755249023, "num_input_tokens_seen": 57725000, "step": 950, "train_runtime": 12346.5447, "train_tokens_per_second": 4675.397 }, { "epoch": 0.12181122448979592, "grad_norm": 0.579079551444378, "learning_rate": 9.908941235664835e-06, "loss": 0.3275070428848267, "num_input_tokens_seen": 58031336, "step": 955, "train_runtime": 12403.8628, "train_tokens_per_second": 4678.489 }, { "epoch": 0.12244897959183673, "grad_norm": 0.6174899647909609, "learning_rate": 9.907987185983307e-06, "loss": 0.3348393440246582, "num_input_tokens_seen": 58330568, "step": 960, "train_runtime": 12479.2646, "train_tokens_per_second": 4674.199 }, { "epoch": 0.12308673469387756, "grad_norm": 0.5622889563305987, "learning_rate": 9.907028210793868e-06, "loss": 0.32388012409210204, "num_input_tokens_seen": 58623792, "step": 965, "train_runtime": 12550.4246, "train_tokens_per_second": 4671.06 }, { "epoch": 0.12372448979591837, "grad_norm": 0.5555181465350426, "learning_rate": 9.906064311058911e-06, "loss": 0.3385571002960205, "num_input_tokens_seen": 58940704, "step": 970, "train_runtime": 12619.0253, "train_tokens_per_second": 4670.781 }, { "epoch": 0.12436224489795919, "grad_norm": 0.6177073026704814, "learning_rate": 9.90509548774578e-06, "loss": 0.31595683097839355, "num_input_tokens_seen": 59253592, "step": 975, "train_runtime": 12676.2346, "train_tokens_per_second": 4674.384 }, { "epoch": 0.125, "grad_norm": 0.6474714592562275, "learning_rate": 9.904121741826757e-06, "loss": 0.31098217964172364, "num_input_tokens_seen": 59551672, "step": 980, "train_runtime": 12733.5429, "train_tokens_per_second": 4676.756 }, { "epoch": 0.1256377551020408, "grad_norm": 0.6164468862965365, "learning_rate": 9.903143074279061e-06, "loss": 0.3462122678756714, "num_input_tokens_seen": 59863016, "step": 985, "train_runtime": 12790.1496, "train_tokens_per_second": 4680.4 }, { "epoch": 0.12627551020408162, "grad_norm": 0.5735618832789965, "learning_rate": 9.902159486084857e-06, "loss": 0.3320111513137817, "num_input_tokens_seen": 60161872, "step": 990, "train_runtime": 12856.4346, "train_tokens_per_second": 4679.514 }, { "epoch": 0.12691326530612246, "grad_norm": 0.6992565730851574, "learning_rate": 9.90117097823124e-06, "loss": 0.3359437704086304, "num_input_tokens_seen": 60465968, "step": 995, "train_runtime": 12924.8758, "train_tokens_per_second": 4678.263 }, { "epoch": 0.12755102040816327, "grad_norm": 0.6217414292705282, "learning_rate": 9.900177551710252e-06, "loss": 0.3319170713424683, "num_input_tokens_seen": 60768400, "step": 1000, "train_runtime": 12994.399, "train_tokens_per_second": 4676.507 }, { "epoch": 0.12818877551020408, "grad_norm": 0.5924633670456982, "learning_rate": 9.899179207518863e-06, "loss": 0.3651275157928467, "num_input_tokens_seen": 61080280, "step": 1005, "train_runtime": 13058.3122, "train_tokens_per_second": 4677.502 }, { "epoch": 0.1288265306122449, "grad_norm": 0.5687355197613791, "learning_rate": 9.89817594665898e-06, "loss": 0.33693101406097414, "num_input_tokens_seen": 61398592, "step": 1010, "train_runtime": 13130.7397, "train_tokens_per_second": 4675.943 }, { "epoch": 0.12946428571428573, "grad_norm": 0.6466288372316616, "learning_rate": 9.897167770137449e-06, "loss": 0.32893297672271726, "num_input_tokens_seen": 61709984, "step": 1015, "train_runtime": 13193.1442, "train_tokens_per_second": 4677.428 }, { "epoch": 0.13010204081632654, "grad_norm": 0.6322209107485859, "learning_rate": 9.89615467896604e-06, "loss": 0.3443321943283081, "num_input_tokens_seen": 62022072, "step": 1020, "train_runtime": 13255.5256, "train_tokens_per_second": 4678.96 }, { "epoch": 0.13073979591836735, "grad_norm": 0.5974934839984513, "learning_rate": 9.895136674161466e-06, "loss": 0.31420562267303465, "num_input_tokens_seen": 62326000, "step": 1025, "train_runtime": 13321.4397, "train_tokens_per_second": 4678.623 }, { "epoch": 0.13137755102040816, "grad_norm": 0.6123161071863797, "learning_rate": 9.894113756745362e-06, "loss": 0.3463484287261963, "num_input_tokens_seen": 62637088, "step": 1030, "train_runtime": 13392.564, "train_tokens_per_second": 4677.005 }, { "epoch": 0.13201530612244897, "grad_norm": 0.6059368270099965, "learning_rate": 9.893085927744302e-06, "loss": 0.3330828189849854, "num_input_tokens_seen": 62939296, "step": 1035, "train_runtime": 13456.54, "train_tokens_per_second": 4677.227 }, { "epoch": 0.1326530612244898, "grad_norm": 0.5889600903987154, "learning_rate": 9.892053188189778e-06, "loss": 0.3249910831451416, "num_input_tokens_seen": 63241312, "step": 1040, "train_runtime": 13531.3937, "train_tokens_per_second": 4673.673 }, { "epoch": 0.13329081632653061, "grad_norm": 0.593460422531129, "learning_rate": 9.89101553911822e-06, "loss": 0.332883358001709, "num_input_tokens_seen": 63542296, "step": 1045, "train_runtime": 13600.5526, "train_tokens_per_second": 4672.038 }, { "epoch": 0.13392857142857142, "grad_norm": 0.6279699500325815, "learning_rate": 9.889972981570984e-06, "loss": 0.32372775077819826, "num_input_tokens_seen": 63841688, "step": 1050, "train_runtime": 13664.5375, "train_tokens_per_second": 4672.071 }, { "epoch": 0.13456632653061223, "grad_norm": 0.5991600083612287, "learning_rate": 9.888925516594344e-06, "loss": 0.33316926956176757, "num_input_tokens_seen": 64152120, "step": 1055, "train_runtime": 13732.2053, "train_tokens_per_second": 4671.655 }, { "epoch": 0.13520408163265307, "grad_norm": 0.599830369848699, "learning_rate": 9.887873145239505e-06, "loss": 0.34979519844055174, "num_input_tokens_seen": 64463160, "step": 1060, "train_runtime": 13799.2665, "train_tokens_per_second": 4671.492 }, { "epoch": 0.13584183673469388, "grad_norm": 0.636347589464702, "learning_rate": 9.886815868562596e-06, "loss": 0.3216874122619629, "num_input_tokens_seen": 64768464, "step": 1065, "train_runtime": 13860.3494, "train_tokens_per_second": 4672.932 }, { "epoch": 0.1364795918367347, "grad_norm": 0.5370893072761296, "learning_rate": 9.885753687624671e-06, "loss": 0.31194138526916504, "num_input_tokens_seen": 65065256, "step": 1070, "train_runtime": 13918.2591, "train_tokens_per_second": 4674.813 }, { "epoch": 0.1371173469387755, "grad_norm": 0.651574208195918, "learning_rate": 9.884686603491697e-06, "loss": 0.34079148769378664, "num_input_tokens_seen": 65374104, "step": 1075, "train_runtime": 13979.5939, "train_tokens_per_second": 4676.395 }, { "epoch": 0.1377551020408163, "grad_norm": 0.6508794125806138, "learning_rate": 9.883614617234574e-06, "loss": 0.33709142208099363, "num_input_tokens_seen": 65675264, "step": 1080, "train_runtime": 14047.0217, "train_tokens_per_second": 4675.387 }, { "epoch": 0.13839285714285715, "grad_norm": 0.5785407358443382, "learning_rate": 9.882537729929111e-06, "loss": 0.33071603775024416, "num_input_tokens_seen": 65976824, "step": 1085, "train_runtime": 14110.0194, "train_tokens_per_second": 4675.885 }, { "epoch": 0.13903061224489796, "grad_norm": 0.6086267377627738, "learning_rate": 9.88145594265604e-06, "loss": 0.33824639320373534, "num_input_tokens_seen": 66274184, "step": 1090, "train_runtime": 14157.1032, "train_tokens_per_second": 4681.338 }, { "epoch": 0.13966836734693877, "grad_norm": 0.7124070129387011, "learning_rate": 9.880369256501009e-06, "loss": 0.3228901863098145, "num_input_tokens_seen": 66556608, "step": 1095, "train_runtime": 14210.6632, "train_tokens_per_second": 4683.568 }, { "epoch": 0.14030612244897958, "grad_norm": 0.6202223061956437, "learning_rate": 9.879277672554586e-06, "loss": 0.3071782350540161, "num_input_tokens_seen": 66858872, "step": 1100, "train_runtime": 14268.9491, "train_tokens_per_second": 4685.62 }, { "epoch": 0.14094387755102042, "grad_norm": 0.6261694646491559, "learning_rate": 9.878181191912251e-06, "loss": 0.3458325624465942, "num_input_tokens_seen": 67163584, "step": 1105, "train_runtime": 14326.1045, "train_tokens_per_second": 4688.196 }, { "epoch": 0.14158163265306123, "grad_norm": 0.5500372706011527, "learning_rate": 9.877079815674397e-06, "loss": 0.3350841045379639, "num_input_tokens_seen": 67468600, "step": 1110, "train_runtime": 14393.6743, "train_tokens_per_second": 4687.379 }, { "epoch": 0.14221938775510204, "grad_norm": 0.5755528320511979, "learning_rate": 9.875973544946335e-06, "loss": 0.3193055152893066, "num_input_tokens_seen": 67777000, "step": 1115, "train_runtime": 14458.4182, "train_tokens_per_second": 4687.719 }, { "epoch": 0.14285714285714285, "grad_norm": 0.5630465939482919, "learning_rate": 9.874862380838284e-06, "loss": 0.29361796379089355, "num_input_tokens_seen": 68091832, "step": 1120, "train_runtime": 14522.3737, "train_tokens_per_second": 4688.754 }, { "epoch": 0.1434948979591837, "grad_norm": 0.5648592974298217, "learning_rate": 9.873746324465372e-06, "loss": 0.3391995429992676, "num_input_tokens_seen": 68401992, "step": 1125, "train_runtime": 14581.5859, "train_tokens_per_second": 4690.984 }, { "epoch": 0.1441326530612245, "grad_norm": 0.5907326903199505, "learning_rate": 9.872625376947642e-06, "loss": 0.3495980739593506, "num_input_tokens_seen": 68711720, "step": 1130, "train_runtime": 14646.5288, "train_tokens_per_second": 4691.331 }, { "epoch": 0.1447704081632653, "grad_norm": 0.6745907973502699, "learning_rate": 9.871499539410045e-06, "loss": 0.3603889226913452, "num_input_tokens_seen": 69022608, "step": 1135, "train_runtime": 14703.0569, "train_tokens_per_second": 4694.439 }, { "epoch": 0.14540816326530612, "grad_norm": 0.623210573264961, "learning_rate": 9.870368812982433e-06, "loss": 0.33861393928527833, "num_input_tokens_seen": 69342064, "step": 1140, "train_runtime": 14760.0119, "train_tokens_per_second": 4697.968 }, { "epoch": 0.14604591836734693, "grad_norm": 0.6487015160167615, "learning_rate": 9.869233198799572e-06, "loss": 0.35953919887542723, "num_input_tokens_seen": 69648560, "step": 1145, "train_runtime": 14827.9375, "train_tokens_per_second": 4697.117 }, { "epoch": 0.14668367346938777, "grad_norm": 0.6052028325524192, "learning_rate": 9.86809269800113e-06, "loss": 0.3488070011138916, "num_input_tokens_seen": 69946440, "step": 1150, "train_runtime": 14890.0099, "train_tokens_per_second": 4697.542 }, { "epoch": 0.14732142857142858, "grad_norm": 0.600872342321137, "learning_rate": 9.86694731173168e-06, "loss": 0.3258484363555908, "num_input_tokens_seen": 70251592, "step": 1155, "train_runtime": 14953.6021, "train_tokens_per_second": 4697.971 }, { "epoch": 0.14795918367346939, "grad_norm": 0.5252518214439542, "learning_rate": 9.865797041140695e-06, "loss": 0.32013731002807616, "num_input_tokens_seen": 70563112, "step": 1160, "train_runtime": 15008.0415, "train_tokens_per_second": 4701.687 }, { "epoch": 0.1485969387755102, "grad_norm": 0.6192588481743379, "learning_rate": 9.864641887382552e-06, "loss": 0.34639954566955566, "num_input_tokens_seen": 70878168, "step": 1165, "train_runtime": 15079.1516, "train_tokens_per_second": 4700.408 }, { "epoch": 0.14923469387755103, "grad_norm": 0.6911373002192646, "learning_rate": 9.863481851616528e-06, "loss": 0.34975519180297854, "num_input_tokens_seen": 71184248, "step": 1170, "train_runtime": 15143.6133, "train_tokens_per_second": 4700.612 }, { "epoch": 0.14987244897959184, "grad_norm": 0.571469570715032, "learning_rate": 9.862316935006803e-06, "loss": 0.34158849716186523, "num_input_tokens_seen": 71487968, "step": 1175, "train_runtime": 15203.7592, "train_tokens_per_second": 4701.993 }, { "epoch": 0.15051020408163265, "grad_norm": 0.551149256404094, "learning_rate": 9.86114713872245e-06, "loss": 0.3300424575805664, "num_input_tokens_seen": 71793392, "step": 1180, "train_runtime": 15279.8415, "train_tokens_per_second": 4698.569 }, { "epoch": 0.15114795918367346, "grad_norm": 0.6198455562277363, "learning_rate": 9.85997246393744e-06, "loss": 0.3214893102645874, "num_input_tokens_seen": 72085568, "step": 1185, "train_runtime": 15340.7072, "train_tokens_per_second": 4698.973 }, { "epoch": 0.15178571428571427, "grad_norm": 0.6330587851850584, "learning_rate": 9.858792911830643e-06, "loss": 0.34440088272094727, "num_input_tokens_seen": 72398520, "step": 1190, "train_runtime": 15408.0866, "train_tokens_per_second": 4698.735 }, { "epoch": 0.1524234693877551, "grad_norm": 0.6445338213269326, "learning_rate": 9.857608483585823e-06, "loss": 0.32814226150512693, "num_input_tokens_seen": 72690904, "step": 1195, "train_runtime": 15478.9022, "train_tokens_per_second": 4696.128 }, { "epoch": 0.15306122448979592, "grad_norm": 0.6491893481187504, "learning_rate": 9.856419180391636e-06, "loss": 0.3319169759750366, "num_input_tokens_seen": 72992704, "step": 1200, "train_runtime": 15556.4263, "train_tokens_per_second": 4692.125 }, { "epoch": 0.15369897959183673, "grad_norm": 0.6766123969843775, "learning_rate": 9.855225003441629e-06, "loss": 0.3418698310852051, "num_input_tokens_seen": 73289816, "step": 1205, "train_runtime": 15618.4499, "train_tokens_per_second": 4692.515 }, { "epoch": 0.15433673469387754, "grad_norm": 0.6074843890700258, "learning_rate": 9.85402595393424e-06, "loss": 0.33366372585296633, "num_input_tokens_seen": 73600072, "step": 1210, "train_runtime": 15685.2806, "train_tokens_per_second": 4692.302 }, { "epoch": 0.15497448979591838, "grad_norm": 0.5381123213921943, "learning_rate": 9.852822033072805e-06, "loss": 0.33455376625061034, "num_input_tokens_seen": 73906704, "step": 1215, "train_runtime": 15755.0043, "train_tokens_per_second": 4690.999 }, { "epoch": 0.1556122448979592, "grad_norm": 0.604250713337634, "learning_rate": 9.85161324206554e-06, "loss": 0.3582612991333008, "num_input_tokens_seen": 74201976, "step": 1220, "train_runtime": 15831.4985, "train_tokens_per_second": 4686.984 }, { "epoch": 0.15625, "grad_norm": 0.6200113895012692, "learning_rate": 9.850399582125548e-06, "loss": 0.3431835174560547, "num_input_tokens_seen": 74500840, "step": 1225, "train_runtime": 15885.0875, "train_tokens_per_second": 4689.986 }, { "epoch": 0.1568877551020408, "grad_norm": 0.673570817712159, "learning_rate": 9.849181054470827e-06, "loss": 0.34818758964538576, "num_input_tokens_seen": 74809560, "step": 1230, "train_runtime": 15952.0925, "train_tokens_per_second": 4689.639 }, { "epoch": 0.15752551020408162, "grad_norm": 0.7610110401468843, "learning_rate": 9.84795766032425e-06, "loss": 0.3170036792755127, "num_input_tokens_seen": 75113704, "step": 1235, "train_runtime": 16020.717, "train_tokens_per_second": 4688.536 }, { "epoch": 0.15816326530612246, "grad_norm": 0.6754346268170676, "learning_rate": 9.84672940091358e-06, "loss": 0.3286417007446289, "num_input_tokens_seen": 75401424, "step": 1240, "train_runtime": 16090.0586, "train_tokens_per_second": 4686.212 }, { "epoch": 0.15880102040816327, "grad_norm": 0.5720135423973471, "learning_rate": 9.845496277471463e-06, "loss": 0.3288563251495361, "num_input_tokens_seen": 75706752, "step": 1245, "train_runtime": 16149.7182, "train_tokens_per_second": 4687.806 }, { "epoch": 0.15943877551020408, "grad_norm": 0.5815285081831328, "learning_rate": 9.84425829123542e-06, "loss": 0.3585826873779297, "num_input_tokens_seen": 76007288, "step": 1250, "train_runtime": 16208.6122, "train_tokens_per_second": 4689.315 }, { "epoch": 0.1600765306122449, "grad_norm": 0.6005471155824291, "learning_rate": 9.84301544344786e-06, "loss": 0.34567928314208984, "num_input_tokens_seen": 76320024, "step": 1255, "train_runtime": 16268.9419, "train_tokens_per_second": 4691.149 }, { "epoch": 0.16071428571428573, "grad_norm": 0.6226023100698392, "learning_rate": 9.841767735356069e-06, "loss": 0.3292954683303833, "num_input_tokens_seen": 76603280, "step": 1260, "train_runtime": 16332.3032, "train_tokens_per_second": 4690.293 }, { "epoch": 0.16135204081632654, "grad_norm": 0.5842796545660951, "learning_rate": 9.840515168212208e-06, "loss": 0.3470223665237427, "num_input_tokens_seen": 76911416, "step": 1265, "train_runtime": 16388.5587, "train_tokens_per_second": 4692.995 }, { "epoch": 0.16198979591836735, "grad_norm": 0.5892994958787647, "learning_rate": 9.839257743273313e-06, "loss": 0.35660953521728517, "num_input_tokens_seen": 77218272, "step": 1270, "train_runtime": 16452.1484, "train_tokens_per_second": 4693.507 }, { "epoch": 0.16262755102040816, "grad_norm": 0.5684784352513662, "learning_rate": 9.8379954618013e-06, "loss": 0.31610519886016847, "num_input_tokens_seen": 77514744, "step": 1275, "train_runtime": 16520.7862, "train_tokens_per_second": 4691.952 }, { "epoch": 0.16326530612244897, "grad_norm": 0.5213398598954231, "learning_rate": 9.836728325062956e-06, "loss": 0.3151726484298706, "num_input_tokens_seen": 77823208, "step": 1280, "train_runtime": 16587.8748, "train_tokens_per_second": 4691.572 }, { "epoch": 0.1639030612244898, "grad_norm": 0.6029850909966052, "learning_rate": 9.83545633432994e-06, "loss": 0.34789628982543946, "num_input_tokens_seen": 78133400, "step": 1285, "train_runtime": 16657.7724, "train_tokens_per_second": 4690.507 }, { "epoch": 0.16454081632653061, "grad_norm": 0.5855806050135156, "learning_rate": 9.834179490878789e-06, "loss": 0.31041646003723145, "num_input_tokens_seen": 78430640, "step": 1290, "train_runtime": 16706.6472, "train_tokens_per_second": 4694.577 }, { "epoch": 0.16517857142857142, "grad_norm": 0.6483103953840245, "learning_rate": 9.832897795990896e-06, "loss": 0.3281932592391968, "num_input_tokens_seen": 78732032, "step": 1295, "train_runtime": 16772.0203, "train_tokens_per_second": 4694.249 }, { "epoch": 0.16581632653061223, "grad_norm": 0.5765423183133421, "learning_rate": 9.83161125095254e-06, "loss": 0.32477402687072754, "num_input_tokens_seen": 79043112, "step": 1300, "train_runtime": 16842.4359, "train_tokens_per_second": 4693.093 }, { "epoch": 0.16645408163265307, "grad_norm": 0.6425529652746363, "learning_rate": 9.830319857054853e-06, "loss": 0.31569385528564453, "num_input_tokens_seen": 79352128, "step": 1305, "train_runtime": 16908.6278, "train_tokens_per_second": 4692.996 }, { "epoch": 0.16709183673469388, "grad_norm": 0.601514067974229, "learning_rate": 9.82902361559384e-06, "loss": 0.3569095849990845, "num_input_tokens_seen": 79658200, "step": 1310, "train_runtime": 16972.1093, "train_tokens_per_second": 4693.477 }, { "epoch": 0.1677295918367347, "grad_norm": 0.5844899308913513, "learning_rate": 9.82772252787037e-06, "loss": 0.3371304988861084, "num_input_tokens_seen": 79970224, "step": 1315, "train_runtime": 17032.1991, "train_tokens_per_second": 4695.238 }, { "epoch": 0.1683673469387755, "grad_norm": 0.6295624315198685, "learning_rate": 9.826416595190177e-06, "loss": 0.35589327812194826, "num_input_tokens_seen": 80254064, "step": 1320, "train_runtime": 17099.1341, "train_tokens_per_second": 4693.458 }, { "epoch": 0.1690051020408163, "grad_norm": 0.6064368753336963, "learning_rate": 9.825105818863854e-06, "loss": 0.31534266471862793, "num_input_tokens_seen": 80554360, "step": 1325, "train_runtime": 17170.128, "train_tokens_per_second": 4691.541 }, { "epoch": 0.16964285714285715, "grad_norm": 0.6218906934525381, "learning_rate": 9.823790200206857e-06, "loss": 0.35923516750335693, "num_input_tokens_seen": 80855544, "step": 1330, "train_runtime": 17238.4699, "train_tokens_per_second": 4690.413 }, { "epoch": 0.17028061224489796, "grad_norm": 0.6919246313636518, "learning_rate": 9.822469740539503e-06, "loss": 0.3390108585357666, "num_input_tokens_seen": 81157864, "step": 1335, "train_runtime": 17298.2101, "train_tokens_per_second": 4691.691 }, { "epoch": 0.17091836734693877, "grad_norm": 0.6586039302284977, "learning_rate": 9.821144441186964e-06, "loss": 0.36199450492858887, "num_input_tokens_seen": 81472488, "step": 1340, "train_runtime": 17359.5203, "train_tokens_per_second": 4693.245 }, { "epoch": 0.17155612244897958, "grad_norm": 0.6101100898122199, "learning_rate": 9.819814303479268e-06, "loss": 0.34079747200012206, "num_input_tokens_seen": 81782968, "step": 1345, "train_runtime": 17435.2492, "train_tokens_per_second": 4690.668 }, { "epoch": 0.17219387755102042, "grad_norm": 0.687974682643214, "learning_rate": 9.818479328751303e-06, "loss": 0.32731170654296876, "num_input_tokens_seen": 82079256, "step": 1350, "train_runtime": 17497.4705, "train_tokens_per_second": 4690.921 }, { "epoch": 0.17283163265306123, "grad_norm": 0.6398125509922725, "learning_rate": 9.817139518342811e-06, "loss": 0.3492893218994141, "num_input_tokens_seen": 82394552, "step": 1355, "train_runtime": 17561.8393, "train_tokens_per_second": 4691.681 }, { "epoch": 0.17346938775510204, "grad_norm": 0.6023525103112162, "learning_rate": 9.815794873598384e-06, "loss": 0.3357325315475464, "num_input_tokens_seen": 82700328, "step": 1360, "train_runtime": 17623.788, "train_tokens_per_second": 4692.54 }, { "epoch": 0.17410714285714285, "grad_norm": 0.5927411576027568, "learning_rate": 9.814445395867467e-06, "loss": 0.33596770763397216, "num_input_tokens_seen": 82995568, "step": 1365, "train_runtime": 17682.3461, "train_tokens_per_second": 4693.697 }, { "epoch": 0.1747448979591837, "grad_norm": 0.5869024102535607, "learning_rate": 9.813091086504356e-06, "loss": 0.3234375476837158, "num_input_tokens_seen": 83286056, "step": 1370, "train_runtime": 17752.7155, "train_tokens_per_second": 4691.454 }, { "epoch": 0.1753826530612245, "grad_norm": 0.6770217851493542, "learning_rate": 9.811731946868192e-06, "loss": 0.34646997451782224, "num_input_tokens_seen": 83594600, "step": 1375, "train_runtime": 17825.1559, "train_tokens_per_second": 4689.698 }, { "epoch": 0.1760204081632653, "grad_norm": 0.6158790602590283, "learning_rate": 9.810367978322971e-06, "loss": 0.3418739318847656, "num_input_tokens_seen": 83902040, "step": 1380, "train_runtime": 17901.1437, "train_tokens_per_second": 4686.965 }, { "epoch": 0.17665816326530612, "grad_norm": 0.635968825879491, "learning_rate": 9.808999182237527e-06, "loss": 0.3338493347167969, "num_input_tokens_seen": 84187696, "step": 1385, "train_runtime": 17963.0468, "train_tokens_per_second": 4686.716 }, { "epoch": 0.17729591836734693, "grad_norm": 0.6397866500946762, "learning_rate": 9.807625559985546e-06, "loss": 0.35117316246032715, "num_input_tokens_seen": 84486344, "step": 1390, "train_runtime": 18026.1294, "train_tokens_per_second": 4686.882 }, { "epoch": 0.17793367346938777, "grad_norm": 0.6953159641397932, "learning_rate": 9.806247112945548e-06, "loss": 0.34419639110565187, "num_input_tokens_seen": 84789144, "step": 1395, "train_runtime": 18096.0387, "train_tokens_per_second": 4685.509 }, { "epoch": 0.17857142857142858, "grad_norm": 0.5786554718477309, "learning_rate": 9.804863842500906e-06, "loss": 0.32353553771972654, "num_input_tokens_seen": 85088672, "step": 1400, "train_runtime": 18171.3592, "train_tokens_per_second": 4682.571 }, { "epoch": 0.17920918367346939, "grad_norm": 0.6394331538844329, "learning_rate": 9.803475750039828e-06, "loss": 0.33654494285583497, "num_input_tokens_seen": 85395520, "step": 1405, "train_runtime": 18233.9007, "train_tokens_per_second": 4683.338 }, { "epoch": 0.1798469387755102, "grad_norm": 0.6519198773120587, "learning_rate": 9.80208283695536e-06, "loss": 0.35454869270324707, "num_input_tokens_seen": 85693248, "step": 1410, "train_runtime": 18297.3619, "train_tokens_per_second": 4683.366 }, { "epoch": 0.18048469387755103, "grad_norm": 0.583077400062921, "learning_rate": 9.80068510464539e-06, "loss": 0.34549190998077395, "num_input_tokens_seen": 85996488, "step": 1415, "train_runtime": 18359.2733, "train_tokens_per_second": 4684.09 }, { "epoch": 0.18112244897959184, "grad_norm": 0.559112413986124, "learning_rate": 9.799282554512637e-06, "loss": 0.3202133417129517, "num_input_tokens_seen": 86298048, "step": 1420, "train_runtime": 18435.7238, "train_tokens_per_second": 4681.023 }, { "epoch": 0.18176020408163265, "grad_norm": 0.6115506518189591, "learning_rate": 9.797875187964661e-06, "loss": 0.32825522422790526, "num_input_tokens_seen": 86604512, "step": 1425, "train_runtime": 18492.8336, "train_tokens_per_second": 4683.139 }, { "epoch": 0.18239795918367346, "grad_norm": 0.7063801060093161, "learning_rate": 9.79646300641385e-06, "loss": 0.3472906589508057, "num_input_tokens_seen": 86906176, "step": 1430, "train_runtime": 18562.0904, "train_tokens_per_second": 4681.918 }, { "epoch": 0.18303571428571427, "grad_norm": 0.9402045630578656, "learning_rate": 9.795046011277427e-06, "loss": 0.3585078716278076, "num_input_tokens_seen": 87224464, "step": 1435, "train_runtime": 18617.0363, "train_tokens_per_second": 4685.196 }, { "epoch": 0.1836734693877551, "grad_norm": 0.6208106233758729, "learning_rate": 9.793624203977446e-06, "loss": 0.3277950048446655, "num_input_tokens_seen": 87529408, "step": 1440, "train_runtime": 18681.5971, "train_tokens_per_second": 4685.328 }, { "epoch": 0.18431122448979592, "grad_norm": 0.7787654832597471, "learning_rate": 9.792197585940792e-06, "loss": 0.32544598579406736, "num_input_tokens_seen": 87829336, "step": 1445, "train_runtime": 18738.8119, "train_tokens_per_second": 4687.028 }, { "epoch": 0.18494897959183673, "grad_norm": 0.5738666671588774, "learning_rate": 9.790766158599172e-06, "loss": 0.35848388671875, "num_input_tokens_seen": 88140344, "step": 1450, "train_runtime": 18813.001, "train_tokens_per_second": 4685.076 }, { "epoch": 0.18558673469387754, "grad_norm": 0.6769713603304937, "learning_rate": 9.789329923389128e-06, "loss": 0.346897554397583, "num_input_tokens_seen": 88442888, "step": 1455, "train_runtime": 18877.8546, "train_tokens_per_second": 4685.007 }, { "epoch": 0.18622448979591838, "grad_norm": 0.6827615245423831, "learning_rate": 9.787888881752018e-06, "loss": 0.34128966331481936, "num_input_tokens_seen": 88741608, "step": 1460, "train_runtime": 18946.3371, "train_tokens_per_second": 4683.84 }, { "epoch": 0.1868622448979592, "grad_norm": 0.609570747387964, "learning_rate": 9.78644303513403e-06, "loss": 0.3022934913635254, "num_input_tokens_seen": 89034512, "step": 1465, "train_runtime": 19012.8709, "train_tokens_per_second": 4682.855 }, { "epoch": 0.1875, "grad_norm": 0.5839733500263187, "learning_rate": 9.784992384986173e-06, "loss": 0.33053126335144045, "num_input_tokens_seen": 89346616, "step": 1470, "train_runtime": 19070.2625, "train_tokens_per_second": 4685.128 }, { "epoch": 0.1881377551020408, "grad_norm": 0.6349108071927354, "learning_rate": 9.783536932764273e-06, "loss": 0.31446478366851804, "num_input_tokens_seen": 89639184, "step": 1475, "train_runtime": 19139.0289, "train_tokens_per_second": 4683.581 }, { "epoch": 0.18877551020408162, "grad_norm": 0.7009626312104598, "learning_rate": 9.782076679928981e-06, "loss": 0.3313866138458252, "num_input_tokens_seen": 89941344, "step": 1480, "train_runtime": 19207.9576, "train_tokens_per_second": 4682.504 }, { "epoch": 0.18941326530612246, "grad_norm": 0.6103496584672967, "learning_rate": 9.78061162794576e-06, "loss": 0.3180057525634766, "num_input_tokens_seen": 90246672, "step": 1485, "train_runtime": 19270.919, "train_tokens_per_second": 4683.05 }, { "epoch": 0.19005102040816327, "grad_norm": 0.657551239573293, "learning_rate": 9.779141778284893e-06, "loss": 0.35165953636169434, "num_input_tokens_seen": 90543072, "step": 1490, "train_runtime": 19336.0767, "train_tokens_per_second": 4682.598 }, { "epoch": 0.19068877551020408, "grad_norm": 0.6078249652219899, "learning_rate": 9.77766713242148e-06, "loss": 0.33533573150634766, "num_input_tokens_seen": 90861600, "step": 1495, "train_runtime": 19391.6258, "train_tokens_per_second": 4685.61 }, { "epoch": 0.1913265306122449, "grad_norm": 0.6052964539905235, "learning_rate": 9.776187691835424e-06, "loss": 0.343070387840271, "num_input_tokens_seen": 91165096, "step": 1500, "train_runtime": 19463.7243, "train_tokens_per_second": 4683.846 }, { "epoch": 0.19196428571428573, "grad_norm": 0.6040610134539512, "learning_rate": 9.774703458011453e-06, "loss": 0.3406609058380127, "num_input_tokens_seen": 91469480, "step": 1505, "train_runtime": 19531.31, "train_tokens_per_second": 4683.223 }, { "epoch": 0.19260204081632654, "grad_norm": 0.6099501886236799, "learning_rate": 9.773214432439098e-06, "loss": 0.348543381690979, "num_input_tokens_seen": 91781056, "step": 1510, "train_runtime": 19601.2663, "train_tokens_per_second": 4682.404 }, { "epoch": 0.19323979591836735, "grad_norm": 0.6071308410923287, "learning_rate": 9.771720616612697e-06, "loss": 0.3520734071731567, "num_input_tokens_seen": 92087768, "step": 1515, "train_runtime": 19673.3854, "train_tokens_per_second": 4680.83 }, { "epoch": 0.19387755102040816, "grad_norm": 0.6263835890108274, "learning_rate": 9.770222012031404e-06, "loss": 0.3443084716796875, "num_input_tokens_seen": 92386408, "step": 1520, "train_runtime": 19737.0164, "train_tokens_per_second": 4680.87 }, { "epoch": 0.19451530612244897, "grad_norm": 0.5864280482644441, "learning_rate": 9.768718620199168e-06, "loss": 0.3578033447265625, "num_input_tokens_seen": 92703640, "step": 1525, "train_runtime": 19795.5394, "train_tokens_per_second": 4683.057 }, { "epoch": 0.1951530612244898, "grad_norm": 0.6311396478788095, "learning_rate": 9.76721044262475e-06, "loss": 0.3278501510620117, "num_input_tokens_seen": 93006512, "step": 1530, "train_runtime": 19862.0833, "train_tokens_per_second": 4682.616 }, { "epoch": 0.19579081632653061, "grad_norm": 0.5855843370148337, "learning_rate": 9.765697480821714e-06, "loss": 0.33351426124572753, "num_input_tokens_seen": 93316656, "step": 1535, "train_runtime": 19925.5238, "train_tokens_per_second": 4683.272 }, { "epoch": 0.19642857142857142, "grad_norm": 0.6686340218559972, "learning_rate": 9.764179736308419e-06, "loss": 0.3357309103012085, "num_input_tokens_seen": 93635280, "step": 1540, "train_runtime": 19987.1797, "train_tokens_per_second": 4684.767 }, { "epoch": 0.19706632653061223, "grad_norm": 0.6698909869610306, "learning_rate": 9.762657210608028e-06, "loss": 0.33041768074035643, "num_input_tokens_seen": 93939712, "step": 1545, "train_runtime": 20039.3999, "train_tokens_per_second": 4687.751 }, { "epoch": 0.19770408163265307, "grad_norm": 0.5995295470856815, "learning_rate": 9.761129905248505e-06, "loss": 0.3290611505508423, "num_input_tokens_seen": 94249200, "step": 1550, "train_runtime": 20106.1318, "train_tokens_per_second": 4687.585 }, { "epoch": 0.19834183673469388, "grad_norm": 0.6519370050719231, "learning_rate": 9.759597821762603e-06, "loss": 0.36706769466400146, "num_input_tokens_seen": 94561768, "step": 1555, "train_runtime": 20165.6648, "train_tokens_per_second": 4689.246 }, { "epoch": 0.1989795918367347, "grad_norm": 0.6705660271899463, "learning_rate": 9.758060961687879e-06, "loss": 0.3317730188369751, "num_input_tokens_seen": 94858616, "step": 1560, "train_runtime": 20235.7289, "train_tokens_per_second": 4687.68 }, { "epoch": 0.1996173469387755, "grad_norm": 0.5125415703099178, "learning_rate": 9.756519326566677e-06, "loss": 0.35649838447570803, "num_input_tokens_seen": 95146448, "step": 1565, "train_runtime": 20303.9973, "train_tokens_per_second": 4686.094 }, { "epoch": 0.2002551020408163, "grad_norm": 0.5664448645100401, "learning_rate": 9.754972917946138e-06, "loss": 0.34983410835266116, "num_input_tokens_seen": 95445928, "step": 1570, "train_runtime": 20363.9882, "train_tokens_per_second": 4686.996 }, { "epoch": 0.20089285714285715, "grad_norm": 0.658224122786756, "learning_rate": 9.753421737378188e-06, "loss": 0.33331751823425293, "num_input_tokens_seen": 95743248, "step": 1575, "train_runtime": 20437.5432, "train_tokens_per_second": 4684.675 }, { "epoch": 0.20153061224489796, "grad_norm": 0.6531108135828381, "learning_rate": 9.751865786419546e-06, "loss": 0.3314680099487305, "num_input_tokens_seen": 96051904, "step": 1580, "train_runtime": 20508.0466, "train_tokens_per_second": 4683.62 }, { "epoch": 0.20216836734693877, "grad_norm": 0.5643789475087291, "learning_rate": 9.750305066631717e-06, "loss": 0.3457353115081787, "num_input_tokens_seen": 96357912, "step": 1585, "train_runtime": 20575.3858, "train_tokens_per_second": 4683.164 }, { "epoch": 0.20280612244897958, "grad_norm": 0.6512259971234623, "learning_rate": 9.748739579580995e-06, "loss": 0.36769120693206786, "num_input_tokens_seen": 96661584, "step": 1590, "train_runtime": 20640.7671, "train_tokens_per_second": 4683.042 }, { "epoch": 0.20344387755102042, "grad_norm": 0.6158621899309391, "learning_rate": 9.747169326838451e-06, "loss": 0.328265118598938, "num_input_tokens_seen": 96963800, "step": 1595, "train_runtime": 20720.1999, "train_tokens_per_second": 4679.675 }, { "epoch": 0.20408163265306123, "grad_norm": 0.6446817922675011, "learning_rate": 9.74559430997995e-06, "loss": 0.3056048393249512, "num_input_tokens_seen": 97270552, "step": 1600, "train_runtime": 20781.181, "train_tokens_per_second": 4680.704 }, { "epoch": 0.20471938775510204, "grad_norm": 0.5889398725102091, "learning_rate": 9.744014530586124e-06, "loss": 0.3354539632797241, "num_input_tokens_seen": 97574656, "step": 1605, "train_runtime": 20844.5544, "train_tokens_per_second": 4681.062 }, { "epoch": 0.20535714285714285, "grad_norm": 0.6617314093110237, "learning_rate": 9.742429990242394e-06, "loss": 0.3385885715484619, "num_input_tokens_seen": 97875664, "step": 1610, "train_runtime": 20912.0733, "train_tokens_per_second": 4680.342 }, { "epoch": 0.2059948979591837, "grad_norm": 0.5622388851008245, "learning_rate": 9.740840690538961e-06, "loss": 0.33730876445770264, "num_input_tokens_seen": 98188344, "step": 1615, "train_runtime": 20991.9156, "train_tokens_per_second": 4677.436 }, { "epoch": 0.2066326530612245, "grad_norm": 0.6184018191793977, "learning_rate": 9.739246633070796e-06, "loss": 0.3308307409286499, "num_input_tokens_seen": 98483392, "step": 1620, "train_runtime": 21058.0192, "train_tokens_per_second": 4676.764 }, { "epoch": 0.2072704081632653, "grad_norm": 0.6692617822427062, "learning_rate": 9.737647819437645e-06, "loss": 0.33433582782745364, "num_input_tokens_seen": 98797736, "step": 1625, "train_runtime": 21117.4021, "train_tokens_per_second": 4678.499 }, { "epoch": 0.20790816326530612, "grad_norm": 0.6180732480184044, "learning_rate": 9.73604425124403e-06, "loss": 0.3261995792388916, "num_input_tokens_seen": 99095392, "step": 1630, "train_runtime": 21186.3963, "train_tokens_per_second": 4677.312 }, { "epoch": 0.20854591836734693, "grad_norm": 0.672907040535661, "learning_rate": 9.734435930099246e-06, "loss": 0.3504668951034546, "num_input_tokens_seen": 99402384, "step": 1635, "train_runtime": 21264.2669, "train_tokens_per_second": 4674.621 }, { "epoch": 0.20918367346938777, "grad_norm": 0.6468683924248895, "learning_rate": 9.732822857617352e-06, "loss": 0.3475662708282471, "num_input_tokens_seen": 99720720, "step": 1640, "train_runtime": 21336.2991, "train_tokens_per_second": 4673.759 }, { "epoch": 0.20982142857142858, "grad_norm": 0.7137629298946826, "learning_rate": 9.731205035417183e-06, "loss": 0.32748582363128664, "num_input_tokens_seen": 100025296, "step": 1645, "train_runtime": 21409.0905, "train_tokens_per_second": 4672.095 }, { "epoch": 0.21045918367346939, "grad_norm": 0.5841812857235733, "learning_rate": 9.729582465122334e-06, "loss": 0.30248146057128905, "num_input_tokens_seen": 100324064, "step": 1650, "train_runtime": 21472.1864, "train_tokens_per_second": 4672.28 }, { "epoch": 0.2110969387755102, "grad_norm": 0.6216174551790111, "learning_rate": 9.727955148361166e-06, "loss": 0.3440696239471436, "num_input_tokens_seen": 100629136, "step": 1655, "train_runtime": 21544.5045, "train_tokens_per_second": 4670.757 }, { "epoch": 0.21173469387755103, "grad_norm": 0.6870197385899494, "learning_rate": 9.72632308676681e-06, "loss": 0.35681972503662107, "num_input_tokens_seen": 100933584, "step": 1660, "train_runtime": 21619.5784, "train_tokens_per_second": 4668.619 }, { "epoch": 0.21237244897959184, "grad_norm": 0.6033968390142657, "learning_rate": 9.724686281977146e-06, "loss": 0.339033842086792, "num_input_tokens_seen": 101232000, "step": 1665, "train_runtime": 21672.925, "train_tokens_per_second": 4670.897 }, { "epoch": 0.21301020408163265, "grad_norm": 0.6605680912767716, "learning_rate": 9.72304473563483e-06, "loss": 0.32911860942840576, "num_input_tokens_seen": 101532152, "step": 1670, "train_runtime": 21743.3698, "train_tokens_per_second": 4669.568 }, { "epoch": 0.21364795918367346, "grad_norm": 0.6057055273564611, "learning_rate": 9.721398449387265e-06, "loss": 0.34564208984375, "num_input_tokens_seen": 101844896, "step": 1675, "train_runtime": 21802.5161, "train_tokens_per_second": 4671.245 }, { "epoch": 0.21428571428571427, "grad_norm": 0.6712000744681125, "learning_rate": 9.719747424886613e-06, "loss": 0.32876513004302976, "num_input_tokens_seen": 102143320, "step": 1680, "train_runtime": 21865.6942, "train_tokens_per_second": 4671.396 }, { "epoch": 0.2149234693877551, "grad_norm": 0.5678300769230327, "learning_rate": 9.718091663789795e-06, "loss": 0.32980966567993164, "num_input_tokens_seen": 102464416, "step": 1685, "train_runtime": 21921.2594, "train_tokens_per_second": 4674.203 }, { "epoch": 0.21556122448979592, "grad_norm": 0.6077964209882442, "learning_rate": 9.716431167758482e-06, "loss": 0.3364400386810303, "num_input_tokens_seen": 102758392, "step": 1690, "train_runtime": 21990.5214, "train_tokens_per_second": 4672.849 }, { "epoch": 0.21619897959183673, "grad_norm": 0.6554874702286015, "learning_rate": 9.714765938459097e-06, "loss": 0.31924474239349365, "num_input_tokens_seen": 103060904, "step": 1695, "train_runtime": 22063.839, "train_tokens_per_second": 4671.032 }, { "epoch": 0.21683673469387754, "grad_norm": 0.6453871857802653, "learning_rate": 9.713095977562813e-06, "loss": 0.33878040313720703, "num_input_tokens_seen": 103368528, "step": 1700, "train_runtime": 22130.9977, "train_tokens_per_second": 4670.758 }, { "epoch": 0.21747448979591838, "grad_norm": 0.6426887219110298, "learning_rate": 9.711421286745554e-06, "loss": 0.3179375171661377, "num_input_tokens_seen": 103666416, "step": 1705, "train_runtime": 22196.6409, "train_tokens_per_second": 4670.365 }, { "epoch": 0.2181122448979592, "grad_norm": 0.60196172861106, "learning_rate": 9.70974186768799e-06, "loss": 0.3452445507049561, "num_input_tokens_seen": 103951664, "step": 1710, "train_runtime": 22255.5419, "train_tokens_per_second": 4670.822 }, { "epoch": 0.21875, "grad_norm": 0.6132093034250564, "learning_rate": 9.708057722075532e-06, "loss": 0.34422879219055175, "num_input_tokens_seen": 104255176, "step": 1715, "train_runtime": 22319.7294, "train_tokens_per_second": 4670.987 }, { "epoch": 0.2193877551020408, "grad_norm": 1.0482197968622364, "learning_rate": 9.706368851598343e-06, "loss": 0.34129197597503663, "num_input_tokens_seen": 104552216, "step": 1720, "train_runtime": 22386.2925, "train_tokens_per_second": 4670.368 }, { "epoch": 0.22002551020408162, "grad_norm": 0.5256163199980716, "learning_rate": 9.704675257951316e-06, "loss": 0.32835357189178466, "num_input_tokens_seen": 104868176, "step": 1725, "train_runtime": 22447.7966, "train_tokens_per_second": 4671.647 }, { "epoch": 0.22066326530612246, "grad_norm": 0.6695721720659025, "learning_rate": 9.702976942834096e-06, "loss": 0.33469085693359374, "num_input_tokens_seen": 105160960, "step": 1730, "train_runtime": 22509.1775, "train_tokens_per_second": 4671.915 }, { "epoch": 0.22130102040816327, "grad_norm": 0.6230385357847109, "learning_rate": 9.701273907951058e-06, "loss": 0.3191352844238281, "num_input_tokens_seen": 105470256, "step": 1735, "train_runtime": 22574.5748, "train_tokens_per_second": 4672.082 }, { "epoch": 0.22193877551020408, "grad_norm": 0.6248704925874972, "learning_rate": 9.699566155011317e-06, "loss": 0.3543462038040161, "num_input_tokens_seen": 105780200, "step": 1740, "train_runtime": 22641.1173, "train_tokens_per_second": 4672.04 }, { "epoch": 0.2225765306122449, "grad_norm": 0.5450021457057649, "learning_rate": 9.697853685728721e-06, "loss": 0.32406888008117674, "num_input_tokens_seen": 106078048, "step": 1745, "train_runtime": 22702.7513, "train_tokens_per_second": 4672.475 }, { "epoch": 0.22321428571428573, "grad_norm": 0.6523177995021735, "learning_rate": 9.696136501821858e-06, "loss": 0.32779037952423096, "num_input_tokens_seen": 106370016, "step": 1750, "train_runtime": 22770.0901, "train_tokens_per_second": 4671.48 }, { "epoch": 0.22385204081632654, "grad_norm": 0.7197164756320799, "learning_rate": 9.694414605014035e-06, "loss": 0.3535364389419556, "num_input_tokens_seen": 106684184, "step": 1755, "train_runtime": 22839.957, "train_tokens_per_second": 4670.945 }, { "epoch": 0.22448979591836735, "grad_norm": 0.5899732558505255, "learning_rate": 9.6926879970333e-06, "loss": 0.32790746688842776, "num_input_tokens_seen": 106998216, "step": 1760, "train_runtime": 22893.992, "train_tokens_per_second": 4673.637 }, { "epoch": 0.22512755102040816, "grad_norm": 0.6168161384769302, "learning_rate": 9.690956679612422e-06, "loss": 0.33826274871826173, "num_input_tokens_seen": 107306360, "step": 1765, "train_runtime": 22951.1765, "train_tokens_per_second": 4675.419 }, { "epoch": 0.22576530612244897, "grad_norm": 0.6104637422756916, "learning_rate": 9.6892206544889e-06, "loss": 0.32278287410736084, "num_input_tokens_seen": 107609480, "step": 1770, "train_runtime": 23017.8681, "train_tokens_per_second": 4675.041 }, { "epoch": 0.2264030612244898, "grad_norm": 0.6512960385084632, "learning_rate": 9.687479923404959e-06, "loss": 0.3486739158630371, "num_input_tokens_seen": 107926024, "step": 1775, "train_runtime": 23072.1009, "train_tokens_per_second": 4677.772 }, { "epoch": 0.22704081632653061, "grad_norm": 0.46664293177956334, "learning_rate": 9.68573448810754e-06, "loss": 0.31470379829406736, "num_input_tokens_seen": 108233416, "step": 1780, "train_runtime": 23136.5152, "train_tokens_per_second": 4678.034 }, { "epoch": 0.22767857142857142, "grad_norm": 0.6314733786111536, "learning_rate": 9.683984350348313e-06, "loss": 0.32955155372619627, "num_input_tokens_seen": 108542880, "step": 1785, "train_runtime": 23206.5379, "train_tokens_per_second": 4677.254 }, { "epoch": 0.22831632653061223, "grad_norm": 0.6113132858996045, "learning_rate": 9.68222951188366e-06, "loss": 0.3453743696212769, "num_input_tokens_seen": 108843736, "step": 1790, "train_runtime": 23273.2837, "train_tokens_per_second": 4676.767 }, { "epoch": 0.22895408163265307, "grad_norm": 0.5834108473728911, "learning_rate": 9.680469974474685e-06, "loss": 0.32249295711517334, "num_input_tokens_seen": 109150272, "step": 1795, "train_runtime": 23346.8051, "train_tokens_per_second": 4675.17 }, { "epoch": 0.22959183673469388, "grad_norm": 0.58938960320997, "learning_rate": 9.67870573988721e-06, "loss": 0.3216817855834961, "num_input_tokens_seen": 109455200, "step": 1800, "train_runtime": 23409.455, "train_tokens_per_second": 4675.683 }, { "epoch": 0.2302295918367347, "grad_norm": 0.8446716184001303, "learning_rate": 9.676936809891763e-06, "loss": 0.3525111436843872, "num_input_tokens_seen": 109764480, "step": 1805, "train_runtime": 23483.604, "train_tokens_per_second": 4674.09 }, { "epoch": 0.2308673469387755, "grad_norm": 0.615189710384464, "learning_rate": 9.675163186263591e-06, "loss": 0.3223212003707886, "num_input_tokens_seen": 110066288, "step": 1810, "train_runtime": 23554.5749, "train_tokens_per_second": 4672.82 }, { "epoch": 0.2315051020408163, "grad_norm": 0.5754384451688632, "learning_rate": 9.673384870782649e-06, "loss": 0.31503829956054685, "num_input_tokens_seen": 110362264, "step": 1815, "train_runtime": 23629.0737, "train_tokens_per_second": 4670.613 }, { "epoch": 0.23214285714285715, "grad_norm": 0.6350773841658875, "learning_rate": 9.6716018652336e-06, "loss": 0.350568962097168, "num_input_tokens_seen": 110668672, "step": 1820, "train_runtime": 23685.1886, "train_tokens_per_second": 4672.484 }, { "epoch": 0.23278061224489796, "grad_norm": 0.6722719077492426, "learning_rate": 9.669814171405818e-06, "loss": 0.34694905281066896, "num_input_tokens_seen": 110968352, "step": 1825, "train_runtime": 23751.2713, "train_tokens_per_second": 4672.102 }, { "epoch": 0.23341836734693877, "grad_norm": 0.6228912303661778, "learning_rate": 9.668021791093372e-06, "loss": 0.3096019744873047, "num_input_tokens_seen": 111282464, "step": 1830, "train_runtime": 23806.8118, "train_tokens_per_second": 4674.396 }, { "epoch": 0.23405612244897958, "grad_norm": 0.6542588610104904, "learning_rate": 9.666224726095048e-06, "loss": 0.3228870153427124, "num_input_tokens_seen": 111590336, "step": 1835, "train_runtime": 23870.8875, "train_tokens_per_second": 4674.746 }, { "epoch": 0.23469387755102042, "grad_norm": 0.6585031873202504, "learning_rate": 9.66442297821432e-06, "loss": 0.3584311485290527, "num_input_tokens_seen": 111899696, "step": 1840, "train_runtime": 23936.6995, "train_tokens_per_second": 4674.817 }, { "epoch": 0.23533163265306123, "grad_norm": 0.5898295862093664, "learning_rate": 9.662616549259374e-06, "loss": 0.30771589279174805, "num_input_tokens_seen": 112185968, "step": 1845, "train_runtime": 24008.3018, "train_tokens_per_second": 4672.799 }, { "epoch": 0.23596938775510204, "grad_norm": 0.6508941366898215, "learning_rate": 9.660805441043082e-06, "loss": 0.36535985469818116, "num_input_tokens_seen": 112485216, "step": 1850, "train_runtime": 24072.8985, "train_tokens_per_second": 4672.691 }, { "epoch": 0.23660714285714285, "grad_norm": 0.5513057418407049, "learning_rate": 9.65898965538302e-06, "loss": 0.31926376819610597, "num_input_tokens_seen": 112792024, "step": 1855, "train_runtime": 24142.1832, "train_tokens_per_second": 4671.989 }, { "epoch": 0.2372448979591837, "grad_norm": 0.5416953303992011, "learning_rate": 9.657169194101457e-06, "loss": 0.3331429958343506, "num_input_tokens_seen": 113094072, "step": 1860, "train_runtime": 24214.7571, "train_tokens_per_second": 4670.461 }, { "epoch": 0.2378826530612245, "grad_norm": 0.6195037185120192, "learning_rate": 9.655344059025351e-06, "loss": 0.339237904548645, "num_input_tokens_seen": 113410272, "step": 1865, "train_runtime": 24277.9126, "train_tokens_per_second": 4671.335 }, { "epoch": 0.2385204081632653, "grad_norm": 0.6658985533340913, "learning_rate": 9.653514251986354e-06, "loss": 0.34667558670043946, "num_input_tokens_seen": 113705304, "step": 1870, "train_runtime": 24338.1994, "train_tokens_per_second": 4671.886 }, { "epoch": 0.23915816326530612, "grad_norm": 0.6200509903536591, "learning_rate": 9.651679774820804e-06, "loss": 0.321960973739624, "num_input_tokens_seen": 114015568, "step": 1875, "train_runtime": 24388.0746, "train_tokens_per_second": 4675.054 }, { "epoch": 0.23979591836734693, "grad_norm": 0.636091566053549, "learning_rate": 9.649840629369728e-06, "loss": 0.3509210109710693, "num_input_tokens_seen": 114325720, "step": 1880, "train_runtime": 24461.5857, "train_tokens_per_second": 4673.684 }, { "epoch": 0.24043367346938777, "grad_norm": 0.657535257785578, "learning_rate": 9.647996817478835e-06, "loss": 0.3434359073638916, "num_input_tokens_seen": 114632136, "step": 1885, "train_runtime": 24537.3443, "train_tokens_per_second": 4671.742 }, { "epoch": 0.24107142857142858, "grad_norm": 0.6140700552709698, "learning_rate": 9.646148340998521e-06, "loss": 0.32828240394592284, "num_input_tokens_seen": 114922240, "step": 1890, "train_runtime": 24601.3517, "train_tokens_per_second": 4671.379 }, { "epoch": 0.24170918367346939, "grad_norm": 0.6578277822186156, "learning_rate": 9.64429520178386e-06, "loss": 0.35318818092346194, "num_input_tokens_seen": 115215224, "step": 1895, "train_runtime": 24666.4565, "train_tokens_per_second": 4670.927 }, { "epoch": 0.2423469387755102, "grad_norm": 0.6233192565315776, "learning_rate": 9.642437401694608e-06, "loss": 0.335646915435791, "num_input_tokens_seen": 115527552, "step": 1900, "train_runtime": 24740.1503, "train_tokens_per_second": 4669.638 }, { "epoch": 0.24298469387755103, "grad_norm": 0.5723546415005316, "learning_rate": 9.640574942595195e-06, "loss": 0.32998104095458985, "num_input_tokens_seen": 115821808, "step": 1905, "train_runtime": 24803.1445, "train_tokens_per_second": 4669.642 }, { "epoch": 0.24362244897959184, "grad_norm": 0.6652879717246634, "learning_rate": 9.638707826354732e-06, "loss": 0.33642148971557617, "num_input_tokens_seen": 116115216, "step": 1910, "train_runtime": 24866.3469, "train_tokens_per_second": 4669.573 }, { "epoch": 0.24426020408163265, "grad_norm": 0.584264535542241, "learning_rate": 9.636836054846997e-06, "loss": 0.32282869815826415, "num_input_tokens_seen": 116415800, "step": 1915, "train_runtime": 24928.176, "train_tokens_per_second": 4670.049 }, { "epoch": 0.24489795918367346, "grad_norm": 0.597573024851043, "learning_rate": 9.634959629950444e-06, "loss": 0.30709261894226075, "num_input_tokens_seen": 116717552, "step": 1920, "train_runtime": 25000.1179, "train_tokens_per_second": 4668.68 }, { "epoch": 0.24553571428571427, "grad_norm": 0.6656629131945074, "learning_rate": 9.6330785535482e-06, "loss": 0.3267780303955078, "num_input_tokens_seen": 117006136, "step": 1925, "train_runtime": 25067.316, "train_tokens_per_second": 4667.677 }, { "epoch": 0.2461734693877551, "grad_norm": 0.7050617650662212, "learning_rate": 9.631192827528054e-06, "loss": 0.3533444404602051, "num_input_tokens_seen": 117313624, "step": 1930, "train_runtime": 25140.9951, "train_tokens_per_second": 4666.228 }, { "epoch": 0.24681122448979592, "grad_norm": 0.6287617293269191, "learning_rate": 9.629302453782462e-06, "loss": 0.31642513275146483, "num_input_tokens_seen": 117618136, "step": 1935, "train_runtime": 25214.6032, "train_tokens_per_second": 4664.683 }, { "epoch": 0.24744897959183673, "grad_norm": 0.6302693162573803, "learning_rate": 9.62740743420855e-06, "loss": 0.35641942024230955, "num_input_tokens_seen": 117914104, "step": 1940, "train_runtime": 25277.4877, "train_tokens_per_second": 4664.787 }, { "epoch": 0.24808673469387754, "grad_norm": 0.6156501910538401, "learning_rate": 9.625507770708098e-06, "loss": 0.3540866136550903, "num_input_tokens_seen": 118221680, "step": 1945, "train_runtime": 25333.6354, "train_tokens_per_second": 4666.59 }, { "epoch": 0.24872448979591838, "grad_norm": 0.6189556769637666, "learning_rate": 9.623603465187554e-06, "loss": 0.3389142036437988, "num_input_tokens_seen": 118522328, "step": 1950, "train_runtime": 25401.2332, "train_tokens_per_second": 4666.007 }, { "epoch": 0.2493622448979592, "grad_norm": 0.581304482769978, "learning_rate": 9.621694519558021e-06, "loss": 0.3108387470245361, "num_input_tokens_seen": 118829640, "step": 1955, "train_runtime": 25467.7789, "train_tokens_per_second": 4665.882 }, { "epoch": 0.25, "grad_norm": 0.572105158541402, "learning_rate": 9.619780935735258e-06, "loss": 0.3287662982940674, "num_input_tokens_seen": 119132240, "step": 1960, "train_runtime": 25537.5091, "train_tokens_per_second": 4664.991 }, { "epoch": 0.25063775510204084, "grad_norm": 0.689536161742216, "learning_rate": 9.617862715639685e-06, "loss": 0.32274279594421384, "num_input_tokens_seen": 119434136, "step": 1965, "train_runtime": 25614.07, "train_tokens_per_second": 4662.833 }, { "epoch": 0.2512755102040816, "grad_norm": 0.5757971447214045, "learning_rate": 9.615939861196364e-06, "loss": 0.34737372398376465, "num_input_tokens_seen": 119756744, "step": 1970, "train_runtime": 25685.048, "train_tokens_per_second": 4662.508 }, { "epoch": 0.25191326530612246, "grad_norm": 0.6088554653419755, "learning_rate": 9.614012374335014e-06, "loss": 0.3462496757507324, "num_input_tokens_seen": 120074472, "step": 1975, "train_runtime": 25738.5391, "train_tokens_per_second": 4665.163 }, { "epoch": 0.25255102040816324, "grad_norm": 0.5165799129994694, "learning_rate": 9.612080256990006e-06, "loss": 0.30801560878753664, "num_input_tokens_seen": 120371440, "step": 1980, "train_runtime": 25797.2104, "train_tokens_per_second": 4666.064 }, { "epoch": 0.2531887755102041, "grad_norm": 0.685217918137659, "learning_rate": 9.610143511100354e-06, "loss": 0.3369981527328491, "num_input_tokens_seen": 120668168, "step": 1985, "train_runtime": 25858.7819, "train_tokens_per_second": 4666.429 }, { "epoch": 0.2538265306122449, "grad_norm": 0.6602263616886537, "learning_rate": 9.608202138609714e-06, "loss": 0.3087838411331177, "num_input_tokens_seen": 120962704, "step": 1990, "train_runtime": 25925.2431, "train_tokens_per_second": 4665.827 }, { "epoch": 0.2544642857142857, "grad_norm": 0.6210613558847153, "learning_rate": 9.606256141466394e-06, "loss": 0.3179054260253906, "num_input_tokens_seen": 121257544, "step": 1995, "train_runtime": 25991.6959, "train_tokens_per_second": 4665.242 }, { "epoch": 0.25510204081632654, "grad_norm": 0.627194515529005, "learning_rate": 9.604305521623335e-06, "loss": 0.33051357269287107, "num_input_tokens_seen": 121558016, "step": 2000, "train_runtime": 26057.4945, "train_tokens_per_second": 4664.992 }, { "epoch": 0.2557397959183674, "grad_norm": 0.6114595189736588, "learning_rate": 9.602350281038123e-06, "loss": 0.3401334762573242, "num_input_tokens_seen": 121861496, "step": 2005, "train_runtime": 26130.2559, "train_tokens_per_second": 4663.617 }, { "epoch": 0.25637755102040816, "grad_norm": 0.6621780413858983, "learning_rate": 9.600390421672976e-06, "loss": 0.3431340932846069, "num_input_tokens_seen": 122161632, "step": 2010, "train_runtime": 26188.5267, "train_tokens_per_second": 4664.7 }, { "epoch": 0.257015306122449, "grad_norm": 0.7067543408043822, "learning_rate": 9.59842594549475e-06, "loss": 0.3796668291091919, "num_input_tokens_seen": 122475304, "step": 2015, "train_runtime": 26247.8272, "train_tokens_per_second": 4666.112 }, { "epoch": 0.2576530612244898, "grad_norm": 1.433248066928353, "learning_rate": 9.596456854474933e-06, "loss": 0.3507995128631592, "num_input_tokens_seen": 122785040, "step": 2020, "train_runtime": 26312.7337, "train_tokens_per_second": 4666.373 }, { "epoch": 0.2582908163265306, "grad_norm": 0.7614373423772619, "learning_rate": 9.594483150589647e-06, "loss": 0.3719475746154785, "num_input_tokens_seen": 123072088, "step": 2025, "train_runtime": 26369.887, "train_tokens_per_second": 4667.145 }, { "epoch": 0.25892857142857145, "grad_norm": 0.5916339291000087, "learning_rate": 9.592504835819642e-06, "loss": 0.32286806106567384, "num_input_tokens_seen": 123369592, "step": 2030, "train_runtime": 26441.9834, "train_tokens_per_second": 4665.671 }, { "epoch": 0.25956632653061223, "grad_norm": 0.5242712990169962, "learning_rate": 9.590521912150294e-06, "loss": 0.3350060939788818, "num_input_tokens_seen": 123680416, "step": 2035, "train_runtime": 26518.023, "train_tokens_per_second": 4664.013 }, { "epoch": 0.2602040816326531, "grad_norm": 0.6586684421360529, "learning_rate": 9.588534381571606e-06, "loss": 0.3625217914581299, "num_input_tokens_seen": 123991008, "step": 2040, "train_runtime": 26586.6716, "train_tokens_per_second": 4663.653 }, { "epoch": 0.26084183673469385, "grad_norm": 0.6898137997632707, "learning_rate": 9.586542246078203e-06, "loss": 0.3413558006286621, "num_input_tokens_seen": 124293272, "step": 2045, "train_runtime": 26654.3873, "train_tokens_per_second": 4663.145 }, { "epoch": 0.2614795918367347, "grad_norm": 0.5822105996114149, "learning_rate": 9.584545507669333e-06, "loss": 0.32697596549987795, "num_input_tokens_seen": 124601432, "step": 2050, "train_runtime": 26722.4206, "train_tokens_per_second": 4662.805 }, { "epoch": 0.26211734693877553, "grad_norm": 0.6422340553091131, "learning_rate": 9.582544168348864e-06, "loss": 0.32872767448425294, "num_input_tokens_seen": 124908560, "step": 2055, "train_runtime": 26790.9196, "train_tokens_per_second": 4662.347 }, { "epoch": 0.2627551020408163, "grad_norm": 0.6240089031569784, "learning_rate": 9.580538230125275e-06, "loss": 0.31921873092651365, "num_input_tokens_seen": 125204664, "step": 2060, "train_runtime": 26852.1852, "train_tokens_per_second": 4662.736 }, { "epoch": 0.26339285714285715, "grad_norm": 0.6815815083946033, "learning_rate": 9.57852769501167e-06, "loss": 0.3307302951812744, "num_input_tokens_seen": 125506080, "step": 2065, "train_runtime": 26914.4019, "train_tokens_per_second": 4663.157 }, { "epoch": 0.26403061224489793, "grad_norm": 0.5968652405541623, "learning_rate": 9.576512565025759e-06, "loss": 0.3403089284896851, "num_input_tokens_seen": 125807424, "step": 2070, "train_runtime": 26990.1978, "train_tokens_per_second": 4661.226 }, { "epoch": 0.26466836734693877, "grad_norm": 0.5939180111595969, "learning_rate": 9.574492842189865e-06, "loss": 0.3476198673248291, "num_input_tokens_seen": 126122304, "step": 2075, "train_runtime": 27053.9764, "train_tokens_per_second": 4661.877 }, { "epoch": 0.2653061224489796, "grad_norm": 0.6215273804787333, "learning_rate": 9.572468528530923e-06, "loss": 0.3389333724975586, "num_input_tokens_seen": 126428616, "step": 2080, "train_runtime": 27118.5249, "train_tokens_per_second": 4662.076 }, { "epoch": 0.2659438775510204, "grad_norm": 1.7346451945661905, "learning_rate": 9.570439626080472e-06, "loss": 0.3335702419281006, "num_input_tokens_seen": 126732032, "step": 2085, "train_runtime": 27193.5009, "train_tokens_per_second": 4660.379 }, { "epoch": 0.26658163265306123, "grad_norm": 0.5789927273759574, "learning_rate": 9.568406136874657e-06, "loss": 0.3421825647354126, "num_input_tokens_seen": 127033448, "step": 2090, "train_runtime": 27252.3425, "train_tokens_per_second": 4661.377 }, { "epoch": 0.26721938775510207, "grad_norm": 0.6284209400592989, "learning_rate": 9.566368062954227e-06, "loss": 0.348024582862854, "num_input_tokens_seen": 127334352, "step": 2095, "train_runtime": 27323.7215, "train_tokens_per_second": 4660.213 }, { "epoch": 0.26785714285714285, "grad_norm": 0.7275169918126387, "learning_rate": 9.564325406364532e-06, "loss": 0.32784428596496584, "num_input_tokens_seen": 127628856, "step": 2100, "train_runtime": 27391.1009, "train_tokens_per_second": 4659.501 }, { "epoch": 0.2684948979591837, "grad_norm": 0.685588875445038, "learning_rate": 9.562278169155518e-06, "loss": 0.31891841888427735, "num_input_tokens_seen": 127932352, "step": 2105, "train_runtime": 27465.9802, "train_tokens_per_second": 4657.848 }, { "epoch": 0.26913265306122447, "grad_norm": 0.6368294637105282, "learning_rate": 9.560226353381735e-06, "loss": 0.3372203826904297, "num_input_tokens_seen": 128220496, "step": 2110, "train_runtime": 27522.3695, "train_tokens_per_second": 4658.774 }, { "epoch": 0.2697704081632653, "grad_norm": 0.5977870469094814, "learning_rate": 9.55816996110232e-06, "loss": 0.31939680576324464, "num_input_tokens_seen": 128517880, "step": 2115, "train_runtime": 27587.7468, "train_tokens_per_second": 4658.513 }, { "epoch": 0.27040816326530615, "grad_norm": 0.6149500125523669, "learning_rate": 9.556108994381007e-06, "loss": 0.3233501434326172, "num_input_tokens_seen": 128818952, "step": 2120, "train_runtime": 27638.8016, "train_tokens_per_second": 4660.801 }, { "epoch": 0.2710459183673469, "grad_norm": 0.6985257716826092, "learning_rate": 9.55404345528612e-06, "loss": 0.35180096626281737, "num_input_tokens_seen": 129110440, "step": 2125, "train_runtime": 27692.8255, "train_tokens_per_second": 4662.234 }, { "epoch": 0.27168367346938777, "grad_norm": 0.6387223819839052, "learning_rate": 9.551973345890572e-06, "loss": 0.33643279075622556, "num_input_tokens_seen": 129406776, "step": 2130, "train_runtime": 27746.3988, "train_tokens_per_second": 4663.912 }, { "epoch": 0.27232142857142855, "grad_norm": 0.6630014602117915, "learning_rate": 9.549898668271862e-06, "loss": 0.37986087799072266, "num_input_tokens_seen": 129723592, "step": 2135, "train_runtime": 27810.6656, "train_tokens_per_second": 4664.527 }, { "epoch": 0.2729591836734694, "grad_norm": 0.6998665321005898, "learning_rate": 9.547819424512075e-06, "loss": 0.3238245964050293, "num_input_tokens_seen": 130027232, "step": 2140, "train_runtime": 27876.3893, "train_tokens_per_second": 4664.422 }, { "epoch": 0.2735969387755102, "grad_norm": 0.6482975563513065, "learning_rate": 9.545735616697875e-06, "loss": 0.3344579696655273, "num_input_tokens_seen": 130331312, "step": 2145, "train_runtime": 27941.891, "train_tokens_per_second": 4664.37 }, { "epoch": 0.274234693877551, "grad_norm": 0.5734214162164026, "learning_rate": 9.54364724692051e-06, "loss": 0.32822456359863283, "num_input_tokens_seen": 130631744, "step": 2150, "train_runtime": 28015.028, "train_tokens_per_second": 4662.917 }, { "epoch": 0.27487244897959184, "grad_norm": 0.6719178969699857, "learning_rate": 9.541554317275807e-06, "loss": 0.33201870918273924, "num_input_tokens_seen": 130932192, "step": 2155, "train_runtime": 28089.5669, "train_tokens_per_second": 4661.239 }, { "epoch": 0.2755102040816326, "grad_norm": 0.6440642242563434, "learning_rate": 9.539456829864164e-06, "loss": 0.3319772005081177, "num_input_tokens_seen": 131236424, "step": 2160, "train_runtime": 28156.2279, "train_tokens_per_second": 4661.009 }, { "epoch": 0.27614795918367346, "grad_norm": 0.5985989929529333, "learning_rate": 9.537354786790558e-06, "loss": 0.3271048069000244, "num_input_tokens_seen": 131538720, "step": 2165, "train_runtime": 28220.416, "train_tokens_per_second": 4661.119 }, { "epoch": 0.2767857142857143, "grad_norm": 0.6101031230908778, "learning_rate": 9.535248190164537e-06, "loss": 0.3490221261978149, "num_input_tokens_seen": 131847192, "step": 2170, "train_runtime": 28273.268, "train_tokens_per_second": 4663.316 }, { "epoch": 0.2774234693877551, "grad_norm": 0.6233698493259191, "learning_rate": 9.533137042100214e-06, "loss": 0.3301276206970215, "num_input_tokens_seen": 132153528, "step": 2175, "train_runtime": 28338.7671, "train_tokens_per_second": 4663.348 }, { "epoch": 0.2780612244897959, "grad_norm": 0.675889434483717, "learning_rate": 9.531021344716275e-06, "loss": 0.34771027565002444, "num_input_tokens_seen": 132455944, "step": 2180, "train_runtime": 28400.3994, "train_tokens_per_second": 4663.876 }, { "epoch": 0.27869897959183676, "grad_norm": 0.6074855332165697, "learning_rate": 9.528901100135971e-06, "loss": 0.32829039096832274, "num_input_tokens_seen": 132755232, "step": 2185, "train_runtime": 28469.4423, "train_tokens_per_second": 4663.078 }, { "epoch": 0.27933673469387754, "grad_norm": 0.6712975298444689, "learning_rate": 9.526776310487116e-06, "loss": 0.3137925863265991, "num_input_tokens_seen": 133059576, "step": 2190, "train_runtime": 28526.9266, "train_tokens_per_second": 4664.35 }, { "epoch": 0.2799744897959184, "grad_norm": 0.6352671046160449, "learning_rate": 9.524646977902083e-06, "loss": 0.33733036518096926, "num_input_tokens_seen": 133364448, "step": 2195, "train_runtime": 28595.4686, "train_tokens_per_second": 4663.832 }, { "epoch": 0.28061224489795916, "grad_norm": 0.6130702477666586, "learning_rate": 9.522513104517807e-06, "loss": 0.34655616283416746, "num_input_tokens_seen": 133671040, "step": 2200, "train_runtime": 28640.8713, "train_tokens_per_second": 4667.143 }, { "epoch": 0.28125, "grad_norm": 0.6405320405199912, "learning_rate": 9.52037469247578e-06, "loss": 0.3232752561569214, "num_input_tokens_seen": 133967984, "step": 2205, "train_runtime": 28694.0307, "train_tokens_per_second": 4668.845 }, { "epoch": 0.28188775510204084, "grad_norm": 0.6421967037212513, "learning_rate": 9.518231743922049e-06, "loss": 0.3547585248947144, "num_input_tokens_seen": 134265280, "step": 2210, "train_runtime": 28756.9357, "train_tokens_per_second": 4668.97 }, { "epoch": 0.2825255102040816, "grad_norm": 0.5754881277928156, "learning_rate": 9.516084261007207e-06, "loss": 0.344525146484375, "num_input_tokens_seen": 134583128, "step": 2215, "train_runtime": 28815.9492, "train_tokens_per_second": 4670.439 }, { "epoch": 0.28316326530612246, "grad_norm": 0.6544882715223516, "learning_rate": 9.513932245886409e-06, "loss": 0.32808513641357423, "num_input_tokens_seen": 134877664, "step": 2220, "train_runtime": 28875.3166, "train_tokens_per_second": 4671.037 }, { "epoch": 0.28380102040816324, "grad_norm": 0.6069905880793696, "learning_rate": 9.511775700719347e-06, "loss": 0.3475784778594971, "num_input_tokens_seen": 135163120, "step": 2225, "train_runtime": 28938.2272, "train_tokens_per_second": 4670.746 }, { "epoch": 0.2844387755102041, "grad_norm": 0.6417998679063434, "learning_rate": 9.50961462767027e-06, "loss": 0.33773374557495117, "num_input_tokens_seen": 135475328, "step": 2230, "train_runtime": 28996.3294, "train_tokens_per_second": 4672.154 }, { "epoch": 0.2850765306122449, "grad_norm": 0.62007247529229, "learning_rate": 9.507449028907961e-06, "loss": 0.3306095123291016, "num_input_tokens_seen": 135785712, "step": 2235, "train_runtime": 29071.8744, "train_tokens_per_second": 4670.69 }, { "epoch": 0.2857142857142857, "grad_norm": 0.607967783035985, "learning_rate": 9.505278906605752e-06, "loss": 0.34046273231506347, "num_input_tokens_seen": 136081960, "step": 2240, "train_runtime": 29132.4061, "train_tokens_per_second": 4671.154 }, { "epoch": 0.28635204081632654, "grad_norm": 0.6926293415406519, "learning_rate": 9.503104262941515e-06, "loss": 0.30557568073272706, "num_input_tokens_seen": 136392784, "step": 2245, "train_runtime": 29193.0625, "train_tokens_per_second": 4672.096 }, { "epoch": 0.2869897959183674, "grad_norm": 0.5863241339230645, "learning_rate": 9.500925100097652e-06, "loss": 0.3169878005981445, "num_input_tokens_seen": 136707440, "step": 2250, "train_runtime": 29254.6306, "train_tokens_per_second": 4673.019 }, { "epoch": 0.28762755102040816, "grad_norm": 0.64560871812282, "learning_rate": 9.498741420261109e-06, "loss": 0.3424893856048584, "num_input_tokens_seen": 137016104, "step": 2255, "train_runtime": 29320.6932, "train_tokens_per_second": 4673.017 }, { "epoch": 0.288265306122449, "grad_norm": 0.622639387104968, "learning_rate": 9.496553225623358e-06, "loss": 0.34136936664581297, "num_input_tokens_seen": 137319680, "step": 2260, "train_runtime": 29387.2361, "train_tokens_per_second": 4672.766 }, { "epoch": 0.2889030612244898, "grad_norm": 0.672758711986229, "learning_rate": 9.494360518380405e-06, "loss": 0.3330190896987915, "num_input_tokens_seen": 137617704, "step": 2265, "train_runtime": 29459.0509, "train_tokens_per_second": 4671.491 }, { "epoch": 0.2895408163265306, "grad_norm": 0.5953712510342588, "learning_rate": 9.49216330073279e-06, "loss": 0.3248729705810547, "num_input_tokens_seen": 137913424, "step": 2270, "train_runtime": 29525.4431, "train_tokens_per_second": 4671.003 }, { "epoch": 0.29017857142857145, "grad_norm": 0.5790091177853225, "learning_rate": 9.489961574885567e-06, "loss": 0.3313121795654297, "num_input_tokens_seen": 138217224, "step": 2275, "train_runtime": 29592.5955, "train_tokens_per_second": 4670.669 }, { "epoch": 0.29081632653061223, "grad_norm": 0.6349700782333549, "learning_rate": 9.487755343048328e-06, "loss": 0.33457436561584475, "num_input_tokens_seen": 138511400, "step": 2280, "train_runtime": 29659.6408, "train_tokens_per_second": 4670.03 }, { "epoch": 0.2914540816326531, "grad_norm": 0.6414273351448437, "learning_rate": 9.485544607435177e-06, "loss": 0.33912661075592043, "num_input_tokens_seen": 138805184, "step": 2285, "train_runtime": 29725.8377, "train_tokens_per_second": 4669.513 }, { "epoch": 0.29209183673469385, "grad_norm": 0.5509349800442801, "learning_rate": 9.483329370264743e-06, "loss": 0.33886494636535647, "num_input_tokens_seen": 139096920, "step": 2290, "train_runtime": 29795.2282, "train_tokens_per_second": 4668.429 }, { "epoch": 0.2927295918367347, "grad_norm": 0.6461902552788196, "learning_rate": 9.48110963376017e-06, "loss": 0.3412975549697876, "num_input_tokens_seen": 139391024, "step": 2295, "train_runtime": 29868.3203, "train_tokens_per_second": 4666.852 }, { "epoch": 0.29336734693877553, "grad_norm": 0.6252669208659251, "learning_rate": 9.47888540014912e-06, "loss": 0.3495046615600586, "num_input_tokens_seen": 139696504, "step": 2300, "train_runtime": 29933.1969, "train_tokens_per_second": 4666.942 }, { "epoch": 0.2940051020408163, "grad_norm": 0.5924907844107669, "learning_rate": 9.476656671663766e-06, "loss": 0.32523541450500487, "num_input_tokens_seen": 139993480, "step": 2305, "train_runtime": 30002.813, "train_tokens_per_second": 4666.012 }, { "epoch": 0.29464285714285715, "grad_norm": 0.7090138453110337, "learning_rate": 9.474423450540794e-06, "loss": 0.31680908203125, "num_input_tokens_seen": 140293864, "step": 2310, "train_runtime": 30063.5095, "train_tokens_per_second": 4666.583 }, { "epoch": 0.29528061224489793, "grad_norm": 0.641100675957291, "learning_rate": 9.472185739021396e-06, "loss": 0.35444614887237547, "num_input_tokens_seen": 140604936, "step": 2315, "train_runtime": 30123.6805, "train_tokens_per_second": 4667.588 }, { "epoch": 0.29591836734693877, "grad_norm": 0.6112601789105732, "learning_rate": 9.469943539351272e-06, "loss": 0.3213543653488159, "num_input_tokens_seen": 140904200, "step": 2320, "train_runtime": 30187.5952, "train_tokens_per_second": 4667.619 }, { "epoch": 0.2965561224489796, "grad_norm": 0.5906407618036358, "learning_rate": 9.467696853780625e-06, "loss": 0.34745540618896487, "num_input_tokens_seen": 141205224, "step": 2325, "train_runtime": 30254.6717, "train_tokens_per_second": 4667.22 }, { "epoch": 0.2971938775510204, "grad_norm": 0.6386828330282118, "learning_rate": 9.465445684564165e-06, "loss": 0.35611257553100584, "num_input_tokens_seen": 141513120, "step": 2330, "train_runtime": 30328.8833, "train_tokens_per_second": 4665.952 }, { "epoch": 0.29783163265306123, "grad_norm": 0.6725992439797863, "learning_rate": 9.463190033961092e-06, "loss": 0.3520667314529419, "num_input_tokens_seen": 141822048, "step": 2335, "train_runtime": 30398.8053, "train_tokens_per_second": 4665.382 }, { "epoch": 0.29846938775510207, "grad_norm": 0.6144161947870468, "learning_rate": 9.46092990423511e-06, "loss": 0.3467228889465332, "num_input_tokens_seen": 142127800, "step": 2340, "train_runtime": 30459.6782, "train_tokens_per_second": 4666.097 }, { "epoch": 0.29910714285714285, "grad_norm": 0.610908675314489, "learning_rate": 9.45866529765442e-06, "loss": 0.33246798515319825, "num_input_tokens_seen": 142446600, "step": 2345, "train_runtime": 30522.0312, "train_tokens_per_second": 4667.009 }, { "epoch": 0.2997448979591837, "grad_norm": 0.5213697942791907, "learning_rate": 9.456396216491713e-06, "loss": 0.34263951778411866, "num_input_tokens_seen": 142756616, "step": 2350, "train_runtime": 30587.5466, "train_tokens_per_second": 4667.148 }, { "epoch": 0.30038265306122447, "grad_norm": 0.6634250372068631, "learning_rate": 9.454122663024167e-06, "loss": 0.3423199415206909, "num_input_tokens_seen": 143058944, "step": 2355, "train_runtime": 30658.3181, "train_tokens_per_second": 4666.236 }, { "epoch": 0.3010204081632653, "grad_norm": 0.5854785785977943, "learning_rate": 9.451844639533453e-06, "loss": 0.320352840423584, "num_input_tokens_seen": 143361264, "step": 2360, "train_runtime": 30729.0955, "train_tokens_per_second": 4665.327 }, { "epoch": 0.30165816326530615, "grad_norm": 0.6102082780565505, "learning_rate": 9.44956214830573e-06, "loss": 0.3393766641616821, "num_input_tokens_seen": 143666552, "step": 2365, "train_runtime": 30793.6136, "train_tokens_per_second": 4665.466 }, { "epoch": 0.3022959183673469, "grad_norm": 1.0665172501048106, "learning_rate": 9.447275191631631e-06, "loss": 0.3327906608581543, "num_input_tokens_seen": 143979752, "step": 2370, "train_runtime": 30848.9958, "train_tokens_per_second": 4667.243 }, { "epoch": 0.30293367346938777, "grad_norm": 0.6647329108943871, "learning_rate": 9.444983771806281e-06, "loss": 0.3404208183288574, "num_input_tokens_seen": 144290592, "step": 2375, "train_runtime": 30899.6308, "train_tokens_per_second": 4669.654 }, { "epoch": 0.30357142857142855, "grad_norm": 0.623910979008559, "learning_rate": 9.44268789112928e-06, "loss": 0.30806612968444824, "num_input_tokens_seen": 144589824, "step": 2380, "train_runtime": 30971.8011, "train_tokens_per_second": 4668.434 }, { "epoch": 0.3042091836734694, "grad_norm": 0.591747167472421, "learning_rate": 9.440387551904705e-06, "loss": 0.3120733261108398, "num_input_tokens_seen": 144895296, "step": 2385, "train_runtime": 31033.0481, "train_tokens_per_second": 4669.064 }, { "epoch": 0.3048469387755102, "grad_norm": 0.6050224036140351, "learning_rate": 9.438082756441103e-06, "loss": 0.3376578092575073, "num_input_tokens_seen": 145203024, "step": 2390, "train_runtime": 31092.6318, "train_tokens_per_second": 4670.014 }, { "epoch": 0.305484693877551, "grad_norm": 0.594862069410769, "learning_rate": 9.4357735070515e-06, "loss": 0.33997819423675535, "num_input_tokens_seen": 145517392, "step": 2395, "train_runtime": 31162.2023, "train_tokens_per_second": 4669.676 }, { "epoch": 0.30612244897959184, "grad_norm": 0.6898138261948322, "learning_rate": 9.433459806053392e-06, "loss": 0.3264634132385254, "num_input_tokens_seen": 145811144, "step": 2400, "train_runtime": 31224.2055, "train_tokens_per_second": 4669.811 }, { "epoch": 0.3067602040816326, "grad_norm": 0.5453565880179001, "learning_rate": 9.431141655768733e-06, "loss": 0.347784423828125, "num_input_tokens_seen": 146115888, "step": 2405, "train_runtime": 31284.4086, "train_tokens_per_second": 4670.566 }, { "epoch": 0.30739795918367346, "grad_norm": 0.5593261854840652, "learning_rate": 9.428819058523953e-06, "loss": 0.3411884784698486, "num_input_tokens_seen": 146418576, "step": 2410, "train_runtime": 31359.232, "train_tokens_per_second": 4669.074 }, { "epoch": 0.3080357142857143, "grad_norm": 0.611737519404148, "learning_rate": 9.42649201664994e-06, "loss": 0.33095855712890626, "num_input_tokens_seen": 146713496, "step": 2415, "train_runtime": 31423.2437, "train_tokens_per_second": 4668.948 }, { "epoch": 0.3086734693877551, "grad_norm": 0.6356188069601292, "learning_rate": 9.424160532482042e-06, "loss": 0.3445183277130127, "num_input_tokens_seen": 147025448, "step": 2420, "train_runtime": 31481.6979, "train_tokens_per_second": 4670.188 }, { "epoch": 0.3093112244897959, "grad_norm": 0.5914621764135959, "learning_rate": 9.421824608360068e-06, "loss": 0.35089085102081297, "num_input_tokens_seen": 147333872, "step": 2425, "train_runtime": 31546.0157, "train_tokens_per_second": 4670.443 }, { "epoch": 0.30994897959183676, "grad_norm": 0.6453748491997388, "learning_rate": 9.419484246628279e-06, "loss": 0.32887113094329834, "num_input_tokens_seen": 147634248, "step": 2430, "train_runtime": 31609.5632, "train_tokens_per_second": 4670.556 }, { "epoch": 0.31058673469387754, "grad_norm": 0.5664137633617244, "learning_rate": 9.417139449635394e-06, "loss": 0.33138527870178225, "num_input_tokens_seen": 147924552, "step": 2435, "train_runtime": 31680.6953, "train_tokens_per_second": 4669.233 }, { "epoch": 0.3112244897959184, "grad_norm": 0.6066526860583623, "learning_rate": 9.414790219734578e-06, "loss": 0.32412359714508054, "num_input_tokens_seen": 148233704, "step": 2440, "train_runtime": 31745.772, "train_tokens_per_second": 4669.4 }, { "epoch": 0.31186224489795916, "grad_norm": 0.6447124007824722, "learning_rate": 9.41243655928345e-06, "loss": 0.32866530418395995, "num_input_tokens_seen": 148534120, "step": 2445, "train_runtime": 31793.5393, "train_tokens_per_second": 4671.833 }, { "epoch": 0.3125, "grad_norm": 0.7494477452485521, "learning_rate": 9.410078470644069e-06, "loss": 0.3428959846496582, "num_input_tokens_seen": 148828048, "step": 2450, "train_runtime": 31870.1946, "train_tokens_per_second": 4669.819 }, { "epoch": 0.31313775510204084, "grad_norm": 0.6417954136398213, "learning_rate": 9.407715956182942e-06, "loss": 0.3676748275756836, "num_input_tokens_seen": 149136848, "step": 2455, "train_runtime": 31943.0656, "train_tokens_per_second": 4668.833 }, { "epoch": 0.3137755102040816, "grad_norm": 0.6350797663441539, "learning_rate": 9.405349018271021e-06, "loss": 0.30690693855285645, "num_input_tokens_seen": 149445896, "step": 2460, "train_runtime": 32006.1498, "train_tokens_per_second": 4669.287 }, { "epoch": 0.31441326530612246, "grad_norm": 0.6864100318642214, "learning_rate": 9.40297765928369e-06, "loss": 0.35631861686706545, "num_input_tokens_seen": 149745824, "step": 2465, "train_runtime": 32071.9141, "train_tokens_per_second": 4669.064 }, { "epoch": 0.31505102040816324, "grad_norm": 0.6590135341609927, "learning_rate": 9.400601881600776e-06, "loss": 0.3548426628112793, "num_input_tokens_seen": 150051240, "step": 2470, "train_runtime": 32141.3372, "train_tokens_per_second": 4668.482 }, { "epoch": 0.3156887755102041, "grad_norm": 0.5599258217777506, "learning_rate": 9.398221687606535e-06, "loss": 0.30653972625732423, "num_input_tokens_seen": 150352384, "step": 2475, "train_runtime": 32203.4824, "train_tokens_per_second": 4668.824 }, { "epoch": 0.3163265306122449, "grad_norm": 0.6606285229487573, "learning_rate": 9.395837079689661e-06, "loss": 0.3408294439315796, "num_input_tokens_seen": 150646432, "step": 2480, "train_runtime": 32276.5113, "train_tokens_per_second": 4667.37 }, { "epoch": 0.3169642857142857, "grad_norm": 0.6955671485681683, "learning_rate": 9.393448060243272e-06, "loss": 0.33505294322967527, "num_input_tokens_seen": 150940672, "step": 2485, "train_runtime": 32350.0257, "train_tokens_per_second": 4665.859 }, { "epoch": 0.31760204081632654, "grad_norm": 0.6461058416579228, "learning_rate": 9.391054631664918e-06, "loss": 0.31870713233947756, "num_input_tokens_seen": 151244112, "step": 2490, "train_runtime": 32413.3615, "train_tokens_per_second": 4666.104 }, { "epoch": 0.3182397959183674, "grad_norm": 0.6324593473340161, "learning_rate": 9.388656796356569e-06, "loss": 0.3533759117126465, "num_input_tokens_seen": 151543264, "step": 2495, "train_runtime": 32486.3477, "train_tokens_per_second": 4664.829 }, { "epoch": 0.31887755102040816, "grad_norm": 0.7787696882323114, "learning_rate": 9.386254556724622e-06, "loss": 0.33388419151306153, "num_input_tokens_seen": 151833704, "step": 2500, "train_runtime": 32544.6127, "train_tokens_per_second": 4665.402 }, { "epoch": 0.319515306122449, "grad_norm": 0.5990995821779157, "learning_rate": 9.383847915179892e-06, "loss": 0.2864094257354736, "num_input_tokens_seen": 152130248, "step": 2505, "train_runtime": 32607.4554, "train_tokens_per_second": 4665.505 }, { "epoch": 0.3201530612244898, "grad_norm": 0.6419322189850525, "learning_rate": 9.381436874137613e-06, "loss": 0.3475051403045654, "num_input_tokens_seen": 152442352, "step": 2510, "train_runtime": 32673.4188, "train_tokens_per_second": 4665.638 }, { "epoch": 0.3207908163265306, "grad_norm": 0.6505549961954357, "learning_rate": 9.37902143601743e-06, "loss": 0.3537461757659912, "num_input_tokens_seen": 152760032, "step": 2515, "train_runtime": 32719.699, "train_tokens_per_second": 4668.748 }, { "epoch": 0.32142857142857145, "grad_norm": 0.5861846328820182, "learning_rate": 9.376601603243408e-06, "loss": 0.348602819442749, "num_input_tokens_seen": 153068600, "step": 2520, "train_runtime": 32770.6385, "train_tokens_per_second": 4670.907 }, { "epoch": 0.32206632653061223, "grad_norm": 0.7079839564574756, "learning_rate": 9.374177378244014e-06, "loss": 0.3363666534423828, "num_input_tokens_seen": 153377984, "step": 2525, "train_runtime": 32849.9291, "train_tokens_per_second": 4669.051 }, { "epoch": 0.3227040816326531, "grad_norm": 0.5879781830033334, "learning_rate": 9.37174876345213e-06, "loss": 0.3585888624191284, "num_input_tokens_seen": 153689064, "step": 2530, "train_runtime": 32914.019, "train_tokens_per_second": 4669.41 }, { "epoch": 0.32334183673469385, "grad_norm": 0.6540182742323833, "learning_rate": 9.369315761305039e-06, "loss": 0.31468565464019777, "num_input_tokens_seen": 153984552, "step": 2535, "train_runtime": 32979.5771, "train_tokens_per_second": 4669.088 }, { "epoch": 0.3239795918367347, "grad_norm": 0.6650660841122097, "learning_rate": 9.36687837424443e-06, "loss": 0.34476327896118164, "num_input_tokens_seen": 154287496, "step": 2540, "train_runtime": 33054.6929, "train_tokens_per_second": 4667.643 }, { "epoch": 0.32461734693877553, "grad_norm": 0.6233755553317001, "learning_rate": 9.364436604716389e-06, "loss": 0.3406651973724365, "num_input_tokens_seen": 154585272, "step": 2545, "train_runtime": 33123.6683, "train_tokens_per_second": 4666.913 }, { "epoch": 0.3252551020408163, "grad_norm": 0.6101525641330187, "learning_rate": 9.361990455171405e-06, "loss": 0.3554771661758423, "num_input_tokens_seen": 154886344, "step": 2550, "train_runtime": 33192.3732, "train_tokens_per_second": 4666.323 }, { "epoch": 0.32589285714285715, "grad_norm": 0.5682004310503971, "learning_rate": 9.359539928064358e-06, "loss": 0.32879574298858644, "num_input_tokens_seen": 155183904, "step": 2555, "train_runtime": 33265.43, "train_tokens_per_second": 4665.02 }, { "epoch": 0.32653061224489793, "grad_norm": 0.6046645904565979, "learning_rate": 9.357085025854525e-06, "loss": 0.32778658866882326, "num_input_tokens_seen": 155479896, "step": 2560, "train_runtime": 33327.2187, "train_tokens_per_second": 4665.253 }, { "epoch": 0.32716836734693877, "grad_norm": 0.6581990983962149, "learning_rate": 9.354625751005568e-06, "loss": 0.3326746702194214, "num_input_tokens_seen": 155769320, "step": 2565, "train_runtime": 33392.0899, "train_tokens_per_second": 4664.857 }, { "epoch": 0.3278061224489796, "grad_norm": 0.5969263683150732, "learning_rate": 9.352162105985544e-06, "loss": 0.3629491090774536, "num_input_tokens_seen": 156069912, "step": 2570, "train_runtime": 33461.8702, "train_tokens_per_second": 4664.112 }, { "epoch": 0.3284438775510204, "grad_norm": 0.5808380876202471, "learning_rate": 9.349694093266893e-06, "loss": 0.35565996170043945, "num_input_tokens_seen": 156382408, "step": 2575, "train_runtime": 33522.2671, "train_tokens_per_second": 4665.031 }, { "epoch": 0.32908163265306123, "grad_norm": 0.5636273327318048, "learning_rate": 9.347221715326437e-06, "loss": 0.31146578788757323, "num_input_tokens_seen": 156682336, "step": 2580, "train_runtime": 33587.2443, "train_tokens_per_second": 4664.936 }, { "epoch": 0.32971938775510207, "grad_norm": 0.6487848791397187, "learning_rate": 9.344744974645382e-06, "loss": 0.3354040145874023, "num_input_tokens_seen": 156989784, "step": 2585, "train_runtime": 33659.8888, "train_tokens_per_second": 4664.002 }, { "epoch": 0.33035714285714285, "grad_norm": 0.5585759467138597, "learning_rate": 9.342263873709307e-06, "loss": 0.3347164630889893, "num_input_tokens_seen": 157290608, "step": 2590, "train_runtime": 33726.6933, "train_tokens_per_second": 4663.683 }, { "epoch": 0.3309948979591837, "grad_norm": 0.6994474755761214, "learning_rate": 9.339778415008171e-06, "loss": 0.33094253540039065, "num_input_tokens_seen": 157596152, "step": 2595, "train_runtime": 33784.6265, "train_tokens_per_second": 4664.73 }, { "epoch": 0.33163265306122447, "grad_norm": 0.5525052017458213, "learning_rate": 9.337288601036307e-06, "loss": 0.31957478523254396, "num_input_tokens_seen": 157906568, "step": 2600, "train_runtime": 33836.3773, "train_tokens_per_second": 4666.769 }, { "epoch": 0.3322704081632653, "grad_norm": 0.6278856592683223, "learning_rate": 9.334794434292416e-06, "loss": 0.35186176300048827, "num_input_tokens_seen": 158220672, "step": 2605, "train_runtime": 33895.5559, "train_tokens_per_second": 4667.888 }, { "epoch": 0.33290816326530615, "grad_norm": 0.6876677412592418, "learning_rate": 9.33229591727957e-06, "loss": 0.3774047136306763, "num_input_tokens_seen": 158532136, "step": 2610, "train_runtime": 33966.8312, "train_tokens_per_second": 4667.263 }, { "epoch": 0.3335459183673469, "grad_norm": 0.5117917866687411, "learning_rate": 9.329793052505203e-06, "loss": 0.31768646240234377, "num_input_tokens_seen": 158820376, "step": 2615, "train_runtime": 34036.0631, "train_tokens_per_second": 4666.238 }, { "epoch": 0.33418367346938777, "grad_norm": 0.6339635444309031, "learning_rate": 9.327285842481114e-06, "loss": 0.32222609519958495, "num_input_tokens_seen": 159119232, "step": 2620, "train_runtime": 34103.306, "train_tokens_per_second": 4665.801 }, { "epoch": 0.33482142857142855, "grad_norm": 0.7031918289873753, "learning_rate": 9.324774289723469e-06, "loss": 0.33108365535736084, "num_input_tokens_seen": 159423616, "step": 2625, "train_runtime": 34164.9634, "train_tokens_per_second": 4666.29 }, { "epoch": 0.3354591836734694, "grad_norm": 0.5939881258178996, "learning_rate": 9.322258396752781e-06, "loss": 0.311852240562439, "num_input_tokens_seen": 159729448, "step": 2630, "train_runtime": 34226.2164, "train_tokens_per_second": 4666.874 }, { "epoch": 0.3360969387755102, "grad_norm": 0.6185057311864506, "learning_rate": 9.319738166093925e-06, "loss": 0.33764641284942626, "num_input_tokens_seen": 160035936, "step": 2635, "train_runtime": 34291.2022, "train_tokens_per_second": 4666.968 }, { "epoch": 0.336734693877551, "grad_norm": 0.5838681290380003, "learning_rate": 9.31721360027613e-06, "loss": 0.35221052169799805, "num_input_tokens_seen": 160344704, "step": 2640, "train_runtime": 34346.869, "train_tokens_per_second": 4668.394 }, { "epoch": 0.33737244897959184, "grad_norm": 0.5943851267565616, "learning_rate": 9.314684701832974e-06, "loss": 0.3359955072402954, "num_input_tokens_seen": 160656000, "step": 2645, "train_runtime": 34405.4803, "train_tokens_per_second": 4669.489 }, { "epoch": 0.3380102040816326, "grad_norm": 0.6619312646741659, "learning_rate": 9.312151473302381e-06, "loss": 0.3358307838439941, "num_input_tokens_seen": 160975440, "step": 2650, "train_runtime": 34459.3594, "train_tokens_per_second": 4671.458 }, { "epoch": 0.33864795918367346, "grad_norm": 1.537017500320144, "learning_rate": 9.309613917226627e-06, "loss": 0.32498579025268554, "num_input_tokens_seen": 161287256, "step": 2655, "train_runtime": 34513.7246, "train_tokens_per_second": 4673.134 }, { "epoch": 0.3392857142857143, "grad_norm": 0.6704002948164608, "learning_rate": 9.307072036152324e-06, "loss": 0.3317585468292236, "num_input_tokens_seen": 161591088, "step": 2660, "train_runtime": 34569.154, "train_tokens_per_second": 4674.43 }, { "epoch": 0.3399234693877551, "grad_norm": 3.357026823966067, "learning_rate": 9.304525832630426e-06, "loss": 0.35298595428466795, "num_input_tokens_seen": 161899864, "step": 2665, "train_runtime": 34615.6725, "train_tokens_per_second": 4677.068 }, { "epoch": 0.3405612244897959, "grad_norm": 0.6276999935784682, "learning_rate": 9.30197530921623e-06, "loss": 0.3207338809967041, "num_input_tokens_seen": 162190664, "step": 2670, "train_runtime": 34674.1465, "train_tokens_per_second": 4677.568 }, { "epoch": 0.34119897959183676, "grad_norm": 0.6447054948284444, "learning_rate": 9.29942046846936e-06, "loss": 0.36296284198760986, "num_input_tokens_seen": 162492848, "step": 2675, "train_runtime": 34736.6134, "train_tokens_per_second": 4677.855 }, { "epoch": 0.34183673469387754, "grad_norm": 0.6659259383281735, "learning_rate": 9.29686131295378e-06, "loss": 0.34287004470825194, "num_input_tokens_seen": 162799640, "step": 2680, "train_runtime": 34800.4481, "train_tokens_per_second": 4678.09 }, { "epoch": 0.3424744897959184, "grad_norm": 0.6160996870715756, "learning_rate": 9.294297845237778e-06, "loss": 0.32772340774536135, "num_input_tokens_seen": 163091384, "step": 2685, "train_runtime": 34870.4575, "train_tokens_per_second": 4677.065 }, { "epoch": 0.34311224489795916, "grad_norm": 0.6637960980537871, "learning_rate": 9.291730067893978e-06, "loss": 0.33747942447662355, "num_input_tokens_seen": 163408824, "step": 2690, "train_runtime": 34936.4167, "train_tokens_per_second": 4677.321 }, { "epoch": 0.34375, "grad_norm": 0.5806253007995478, "learning_rate": 9.28915798349932e-06, "loss": 0.34053735733032225, "num_input_tokens_seen": 163712008, "step": 2695, "train_runtime": 34996.0742, "train_tokens_per_second": 4678.011 }, { "epoch": 0.34438775510204084, "grad_norm": 0.5519737963229622, "learning_rate": 9.28658159463507e-06, "loss": 0.3610675573348999, "num_input_tokens_seen": 164021160, "step": 2700, "train_runtime": 35058.4891, "train_tokens_per_second": 4678.501 }, { "epoch": 0.3450255102040816, "grad_norm": 0.5769031799916639, "learning_rate": 9.284000903886818e-06, "loss": 0.3434394598007202, "num_input_tokens_seen": 164325600, "step": 2705, "train_runtime": 35124.4865, "train_tokens_per_second": 4678.377 }, { "epoch": 0.34566326530612246, "grad_norm": 0.5964397528249339, "learning_rate": 9.281415913844465e-06, "loss": 0.3025984287261963, "num_input_tokens_seen": 164618672, "step": 2710, "train_runtime": 35187.2744, "train_tokens_per_second": 4678.358 }, { "epoch": 0.34630102040816324, "grad_norm": 0.6144875198789141, "learning_rate": 9.278826627102228e-06, "loss": 0.32732648849487306, "num_input_tokens_seen": 164918320, "step": 2715, "train_runtime": 35259.9225, "train_tokens_per_second": 4677.217 }, { "epoch": 0.3469387755102041, "grad_norm": 0.6339683127694683, "learning_rate": 9.276233046258637e-06, "loss": 0.35390415191650393, "num_input_tokens_seen": 165221192, "step": 2720, "train_runtime": 35331.5231, "train_tokens_per_second": 4676.311 }, { "epoch": 0.3475765306122449, "grad_norm": 0.7106694950438467, "learning_rate": 9.273635173916535e-06, "loss": 0.3319819927215576, "num_input_tokens_seen": 165519432, "step": 2725, "train_runtime": 35402.4405, "train_tokens_per_second": 4675.368 }, { "epoch": 0.3482142857142857, "grad_norm": 0.6325425007324904, "learning_rate": 9.271033012683063e-06, "loss": 0.32244267463684084, "num_input_tokens_seen": 165814768, "step": 2730, "train_runtime": 35468.3018, "train_tokens_per_second": 4675.013 }, { "epoch": 0.34885204081632654, "grad_norm": 0.738569970816405, "learning_rate": 9.268426565169677e-06, "loss": 0.36324148178100585, "num_input_tokens_seen": 166118744, "step": 2735, "train_runtime": 35539.3616, "train_tokens_per_second": 4674.219 }, { "epoch": 0.3494897959183674, "grad_norm": 0.5759820580206395, "learning_rate": 9.265815833992126e-06, "loss": 0.3284599304199219, "num_input_tokens_seen": 166410816, "step": 2740, "train_runtime": 35608.415, "train_tokens_per_second": 4673.356 }, { "epoch": 0.35012755102040816, "grad_norm": 0.5748435489146855, "learning_rate": 9.263200821770462e-06, "loss": 0.3294307470321655, "num_input_tokens_seen": 166702848, "step": 2745, "train_runtime": 35678.5207, "train_tokens_per_second": 4672.359 }, { "epoch": 0.350765306122449, "grad_norm": 0.6659830395525751, "learning_rate": 9.260581531129032e-06, "loss": 0.3194013833999634, "num_input_tokens_seen": 167006248, "step": 2750, "train_runtime": 35747.2172, "train_tokens_per_second": 4671.867 }, { "epoch": 0.3514030612244898, "grad_norm": 0.6210573361812904, "learning_rate": 9.257957964696475e-06, "loss": 0.3320168972015381, "num_input_tokens_seen": 167315752, "step": 2755, "train_runtime": 35814.7093, "train_tokens_per_second": 4671.705 }, { "epoch": 0.3520408163265306, "grad_norm": 0.632148633969262, "learning_rate": 9.255330125105728e-06, "loss": 0.3254489183425903, "num_input_tokens_seen": 167627704, "step": 2760, "train_runtime": 35883.4015, "train_tokens_per_second": 4671.455 }, { "epoch": 0.35267857142857145, "grad_norm": 0.5862505482561928, "learning_rate": 9.252698014994008e-06, "loss": 0.35499675273895265, "num_input_tokens_seen": 167929672, "step": 2765, "train_runtime": 35954.0454, "train_tokens_per_second": 4670.675 }, { "epoch": 0.35331632653061223, "grad_norm": 0.5614888584027603, "learning_rate": 9.250061637002822e-06, "loss": 0.3320456504821777, "num_input_tokens_seen": 168226976, "step": 2770, "train_runtime": 36021.9545, "train_tokens_per_second": 4670.123 }, { "epoch": 0.3539540816326531, "grad_norm": 0.6631468104613814, "learning_rate": 9.24742099377796e-06, "loss": 0.3739363193511963, "num_input_tokens_seen": 168540912, "step": 2775, "train_runtime": 36085.8513, "train_tokens_per_second": 4670.554 }, { "epoch": 0.35459183673469385, "grad_norm": 0.572270159485271, "learning_rate": 9.244776087969492e-06, "loss": 0.33939266204833984, "num_input_tokens_seen": 168838760, "step": 2780, "train_runtime": 36158.9856, "train_tokens_per_second": 4669.344 }, { "epoch": 0.3552295918367347, "grad_norm": 0.5855835377406302, "learning_rate": 9.242126922231763e-06, "loss": 0.3214082717895508, "num_input_tokens_seen": 169136064, "step": 2785, "train_runtime": 36220.962, "train_tokens_per_second": 4669.563 }, { "epoch": 0.35586734693877553, "grad_norm": 0.6277419797401431, "learning_rate": 9.239473499223399e-06, "loss": 0.335541296005249, "num_input_tokens_seen": 169438592, "step": 2790, "train_runtime": 36286.8167, "train_tokens_per_second": 4669.426 }, { "epoch": 0.3565051020408163, "grad_norm": 0.695117959320036, "learning_rate": 9.236815821607295e-06, "loss": 0.35208282470703123, "num_input_tokens_seen": 169753176, "step": 2795, "train_runtime": 36346.4815, "train_tokens_per_second": 4670.416 }, { "epoch": 0.35714285714285715, "grad_norm": 0.6389643526772001, "learning_rate": 9.234153892050616e-06, "loss": 0.35019755363464355, "num_input_tokens_seen": 170057392, "step": 2800, "train_runtime": 36419.0912, "train_tokens_per_second": 4669.457 }, { "epoch": 0.35778061224489793, "grad_norm": 0.5914066202080734, "learning_rate": 9.231487713224793e-06, "loss": 0.32256550788879396, "num_input_tokens_seen": 170370160, "step": 2805, "train_runtime": 36487.9242, "train_tokens_per_second": 4669.22 }, { "epoch": 0.35841836734693877, "grad_norm": 0.6221792543769145, "learning_rate": 9.228817287805523e-06, "loss": 0.35767345428466796, "num_input_tokens_seen": 170668320, "step": 2810, "train_runtime": 36543.2233, "train_tokens_per_second": 4670.314 }, { "epoch": 0.3590561224489796, "grad_norm": 0.645679524738949, "learning_rate": 9.226142618472765e-06, "loss": 0.3371246814727783, "num_input_tokens_seen": 170973560, "step": 2815, "train_runtime": 36602.9245, "train_tokens_per_second": 4671.036 }, { "epoch": 0.3596938775510204, "grad_norm": 0.6052849458401102, "learning_rate": 9.223463707910736e-06, "loss": 0.32080750465393065, "num_input_tokens_seen": 171263632, "step": 2820, "train_runtime": 36657.9381, "train_tokens_per_second": 4671.938 }, { "epoch": 0.36033163265306123, "grad_norm": 0.5936493011922163, "learning_rate": 9.22078055880791e-06, "loss": 0.3442652463912964, "num_input_tokens_seen": 171562192, "step": 2825, "train_runtime": 36725.7365, "train_tokens_per_second": 4671.443 }, { "epoch": 0.36096938775510207, "grad_norm": 0.6263734728465141, "learning_rate": 9.218093173857014e-06, "loss": 0.317061185836792, "num_input_tokens_seen": 171858536, "step": 2830, "train_runtime": 36790.3942, "train_tokens_per_second": 4671.288 }, { "epoch": 0.36160714285714285, "grad_norm": 0.6645303163373804, "learning_rate": 9.21540155575503e-06, "loss": 0.37257728576660154, "num_input_tokens_seen": 172165192, "step": 2835, "train_runtime": 36847.811, "train_tokens_per_second": 4672.332 }, { "epoch": 0.3622448979591837, "grad_norm": 0.6587149142814338, "learning_rate": 9.212705707203177e-06, "loss": 0.3401576042175293, "num_input_tokens_seen": 172474456, "step": 2840, "train_runtime": 36913.8231, "train_tokens_per_second": 4672.354 }, { "epoch": 0.36288265306122447, "grad_norm": 0.6048189666141288, "learning_rate": 9.210005630906936e-06, "loss": 0.35530571937561034, "num_input_tokens_seen": 172794016, "step": 2845, "train_runtime": 36987.6805, "train_tokens_per_second": 4671.664 }, { "epoch": 0.3635204081632653, "grad_norm": 0.7282644912069675, "learning_rate": 9.207301329576017e-06, "loss": 0.3370820999145508, "num_input_tokens_seen": 173098728, "step": 2850, "train_runtime": 37059.1021, "train_tokens_per_second": 4670.883 }, { "epoch": 0.36415816326530615, "grad_norm": 0.6453836226269013, "learning_rate": 9.204592805924378e-06, "loss": 0.3250255584716797, "num_input_tokens_seen": 173405192, "step": 2855, "train_runtime": 37128.7211, "train_tokens_per_second": 4670.379 }, { "epoch": 0.3647959183673469, "grad_norm": 0.6142423379629992, "learning_rate": 9.201880062670207e-06, "loss": 0.35407509803771975, "num_input_tokens_seen": 173709184, "step": 2860, "train_runtime": 37195.9411, "train_tokens_per_second": 4670.111 }, { "epoch": 0.36543367346938777, "grad_norm": 0.5836807662560142, "learning_rate": 9.199163102535937e-06, "loss": 0.35567197799682615, "num_input_tokens_seen": 174005904, "step": 2865, "train_runtime": 37273.1105, "train_tokens_per_second": 4668.403 }, { "epoch": 0.36607142857142855, "grad_norm": 0.5665829230515435, "learning_rate": 9.196441928248222e-06, "loss": 0.3214565277099609, "num_input_tokens_seen": 174307712, "step": 2870, "train_runtime": 37341.2654, "train_tokens_per_second": 4667.965 }, { "epoch": 0.3667091836734694, "grad_norm": 0.6183474998074492, "learning_rate": 9.193716542537956e-06, "loss": 0.33814573287963867, "num_input_tokens_seen": 174623384, "step": 2875, "train_runtime": 37408.3943, "train_tokens_per_second": 4668.027 }, { "epoch": 0.3673469387755102, "grad_norm": 0.6280789635059695, "learning_rate": 9.19098694814025e-06, "loss": 0.3294132947921753, "num_input_tokens_seen": 174922208, "step": 2880, "train_runtime": 37471.0044, "train_tokens_per_second": 4668.202 }, { "epoch": 0.367984693877551, "grad_norm": 0.5877021053310618, "learning_rate": 9.188253147794443e-06, "loss": 0.351007080078125, "num_input_tokens_seen": 175229896, "step": 2885, "train_runtime": 37537.9516, "train_tokens_per_second": 4668.073 }, { "epoch": 0.36862244897959184, "grad_norm": 0.6256900617275598, "learning_rate": 9.185515144244097e-06, "loss": 0.34029929637908934, "num_input_tokens_seen": 175532040, "step": 2890, "train_runtime": 37597.9508, "train_tokens_per_second": 4668.66 }, { "epoch": 0.3692602040816326, "grad_norm": 0.6588914210325635, "learning_rate": 9.182772940236986e-06, "loss": 0.3353889942169189, "num_input_tokens_seen": 175835776, "step": 2895, "train_runtime": 37668.146, "train_tokens_per_second": 4668.023 }, { "epoch": 0.36989795918367346, "grad_norm": 0.6313523605519256, "learning_rate": 9.180026538525106e-06, "loss": 0.31960842609405515, "num_input_tokens_seen": 176141928, "step": 2900, "train_runtime": 37728.1665, "train_tokens_per_second": 4668.712 }, { "epoch": 0.3705357142857143, "grad_norm": 0.573107384113324, "learning_rate": 9.177275941864663e-06, "loss": 0.35578694343566897, "num_input_tokens_seen": 176446368, "step": 2905, "train_runtime": 37794.3189, "train_tokens_per_second": 4668.595 }, { "epoch": 0.3711734693877551, "grad_norm": 0.5731345850938927, "learning_rate": 9.174521153016072e-06, "loss": 0.33559885025024416, "num_input_tokens_seen": 176756824, "step": 2910, "train_runtime": 37853.7472, "train_tokens_per_second": 4669.467 }, { "epoch": 0.3718112244897959, "grad_norm": 0.6182752939068035, "learning_rate": 9.171762174743954e-06, "loss": 0.33328685760498045, "num_input_tokens_seen": 177065320, "step": 2915, "train_runtime": 37918.1928, "train_tokens_per_second": 4669.667 }, { "epoch": 0.37244897959183676, "grad_norm": 0.6799748268215919, "learning_rate": 9.168999009817141e-06, "loss": 0.33100380897521975, "num_input_tokens_seen": 177368072, "step": 2920, "train_runtime": 37988.2744, "train_tokens_per_second": 4669.022 }, { "epoch": 0.37308673469387754, "grad_norm": 0.6506459692910762, "learning_rate": 9.166231661008658e-06, "loss": 0.3455332040786743, "num_input_tokens_seen": 177684296, "step": 2925, "train_runtime": 38063.2205, "train_tokens_per_second": 4668.136 }, { "epoch": 0.3737244897959184, "grad_norm": 0.6286667442429432, "learning_rate": 9.163460131095735e-06, "loss": 0.33367528915405276, "num_input_tokens_seen": 177984512, "step": 2930, "train_runtime": 38132.8945, "train_tokens_per_second": 4667.48 }, { "epoch": 0.37436224489795916, "grad_norm": 0.5712602431075823, "learning_rate": 9.160684422859794e-06, "loss": 0.3466202259063721, "num_input_tokens_seen": 178290584, "step": 2935, "train_runtime": 38203.2929, "train_tokens_per_second": 4666.89 }, { "epoch": 0.375, "grad_norm": 0.6526649634821595, "learning_rate": 9.157904539086454e-06, "loss": 0.3054463863372803, "num_input_tokens_seen": 178587696, "step": 2940, "train_runtime": 38255.7101, "train_tokens_per_second": 4668.262 }, { "epoch": 0.37563775510204084, "grad_norm": 0.6184464389304304, "learning_rate": 9.15512048256552e-06, "loss": 0.32589786052703856, "num_input_tokens_seen": 178896720, "step": 2945, "train_runtime": 38317.4065, "train_tokens_per_second": 4668.811 }, { "epoch": 0.3762755102040816, "grad_norm": 0.5552739239070901, "learning_rate": 9.15233225609099e-06, "loss": 0.3620042324066162, "num_input_tokens_seen": 179201000, "step": 2950, "train_runtime": 38378.5683, "train_tokens_per_second": 4669.299 }, { "epoch": 0.37691326530612246, "grad_norm": 0.5162166500595451, "learning_rate": 9.149539862461044e-06, "loss": 0.2974902629852295, "num_input_tokens_seen": 179506648, "step": 2955, "train_runtime": 38446.2337, "train_tokens_per_second": 4669.031 }, { "epoch": 0.37755102040816324, "grad_norm": 0.6620949196358052, "learning_rate": 9.14674330447804e-06, "loss": 0.30786125659942626, "num_input_tokens_seen": 179794472, "step": 2960, "train_runtime": 38511.9579, "train_tokens_per_second": 4668.536 }, { "epoch": 0.3781887755102041, "grad_norm": 0.6700230669142001, "learning_rate": 9.143942584948525e-06, "loss": 0.34150445461273193, "num_input_tokens_seen": 180093352, "step": 2965, "train_runtime": 38580.8417, "train_tokens_per_second": 4667.948 }, { "epoch": 0.3788265306122449, "grad_norm": 0.5478533505985292, "learning_rate": 9.141137706683212e-06, "loss": 0.30869088172912595, "num_input_tokens_seen": 180392080, "step": 2970, "train_runtime": 38650.0598, "train_tokens_per_second": 4667.317 }, { "epoch": 0.3794642857142857, "grad_norm": 0.678337655081668, "learning_rate": 9.138328672496994e-06, "loss": 0.3172877073287964, "num_input_tokens_seen": 180697368, "step": 2975, "train_runtime": 38714.4903, "train_tokens_per_second": 4667.435 }, { "epoch": 0.38010204081632654, "grad_norm": 0.6415863337052933, "learning_rate": 9.135515485208933e-06, "loss": 0.36992654800415037, "num_input_tokens_seen": 181003232, "step": 2980, "train_runtime": 38782.0693, "train_tokens_per_second": 4667.189 }, { "epoch": 0.3807397959183674, "grad_norm": 0.6732183984497285, "learning_rate": 9.132698147642258e-06, "loss": 0.36478912830352783, "num_input_tokens_seen": 181304680, "step": 2985, "train_runtime": 38844.9148, "train_tokens_per_second": 4667.398 }, { "epoch": 0.38137755102040816, "grad_norm": 0.6655835113305426, "learning_rate": 9.129876662624366e-06, "loss": 0.3404196262359619, "num_input_tokens_seen": 181618216, "step": 2990, "train_runtime": 38914.3985, "train_tokens_per_second": 4667.121 }, { "epoch": 0.382015306122449, "grad_norm": 0.6170004441491723, "learning_rate": 9.127051032986814e-06, "loss": 0.377862811088562, "num_input_tokens_seen": 181925896, "step": 2995, "train_runtime": 38971.9278, "train_tokens_per_second": 4668.127 }, { "epoch": 0.3826530612244898, "grad_norm": 0.6059184841126629, "learning_rate": 9.124221261565316e-06, "loss": 0.3464046478271484, "num_input_tokens_seen": 182226640, "step": 3000, "train_runtime": 39042.6605, "train_tokens_per_second": 4667.372 }, { "epoch": 0.3832908163265306, "grad_norm": 0.6876833630306839, "learning_rate": 9.121387351199748e-06, "loss": 0.33391451835632324, "num_input_tokens_seen": 182541464, "step": 3005, "train_runtime": 39101.7645, "train_tokens_per_second": 4668.369 }, { "epoch": 0.38392857142857145, "grad_norm": 0.6239294662858951, "learning_rate": 9.118549304734136e-06, "loss": 0.3343007564544678, "num_input_tokens_seen": 182840416, "step": 3010, "train_runtime": 39157.4459, "train_tokens_per_second": 4669.365 }, { "epoch": 0.38456632653061223, "grad_norm": 0.6787382490837304, "learning_rate": 9.115707125016658e-06, "loss": 0.32906546592712405, "num_input_tokens_seen": 183150872, "step": 3015, "train_runtime": 39227.2893, "train_tokens_per_second": 4668.966 }, { "epoch": 0.3852040816326531, "grad_norm": 0.6087883139818103, "learning_rate": 9.112860814899637e-06, "loss": 0.3491034984588623, "num_input_tokens_seen": 183456848, "step": 3020, "train_runtime": 39306.7877, "train_tokens_per_second": 4667.307 }, { "epoch": 0.38584183673469385, "grad_norm": 0.5756683852291705, "learning_rate": 9.110010377239552e-06, "loss": 0.33542647361755373, "num_input_tokens_seen": 183754136, "step": 3025, "train_runtime": 39373.2272, "train_tokens_per_second": 4666.982 }, { "epoch": 0.3864795918367347, "grad_norm": 0.6047218819178658, "learning_rate": 9.107155814897007e-06, "loss": 0.3634347438812256, "num_input_tokens_seen": 184055568, "step": 3030, "train_runtime": 39439.871, "train_tokens_per_second": 4666.739 }, { "epoch": 0.38711734693877553, "grad_norm": 0.6724971852548446, "learning_rate": 9.10429713073676e-06, "loss": 0.3365731716156006, "num_input_tokens_seen": 184350472, "step": 3035, "train_runtime": 39504.5952, "train_tokens_per_second": 4666.558 }, { "epoch": 0.3877551020408163, "grad_norm": 0.592126040117668, "learning_rate": 9.101434327627696e-06, "loss": 0.3240904569625854, "num_input_tokens_seen": 184649680, "step": 3040, "train_runtime": 39580.6974, "train_tokens_per_second": 4665.145 }, { "epoch": 0.38839285714285715, "grad_norm": 0.7763590285508554, "learning_rate": 9.098567408442844e-06, "loss": 0.3177307605743408, "num_input_tokens_seen": 184945944, "step": 3045, "train_runtime": 39641.093, "train_tokens_per_second": 4665.511 }, { "epoch": 0.38903061224489793, "grad_norm": 0.5875868470111111, "learning_rate": 9.095696376059353e-06, "loss": 0.3542469024658203, "num_input_tokens_seen": 185251256, "step": 3050, "train_runtime": 39703.0058, "train_tokens_per_second": 4665.925 }, { "epoch": 0.38966836734693877, "grad_norm": 0.5847860295978273, "learning_rate": 9.092821233358507e-06, "loss": 0.35657784938812254, "num_input_tokens_seen": 185551480, "step": 3055, "train_runtime": 39764.1848, "train_tokens_per_second": 4666.297 }, { "epoch": 0.3903061224489796, "grad_norm": 0.6271717615017474, "learning_rate": 9.08994198322571e-06, "loss": 0.3421341419219971, "num_input_tokens_seen": 185856064, "step": 3060, "train_runtime": 39831.0054, "train_tokens_per_second": 4666.115 }, { "epoch": 0.3909438775510204, "grad_norm": 0.5714588255841407, "learning_rate": 9.087058628550492e-06, "loss": 0.3498190402984619, "num_input_tokens_seen": 186159872, "step": 3065, "train_runtime": 39901.5872, "train_tokens_per_second": 4665.475 }, { "epoch": 0.39158163265306123, "grad_norm": 0.562812539277608, "learning_rate": 9.084171172226502e-06, "loss": 0.3342771291732788, "num_input_tokens_seen": 186472704, "step": 3070, "train_runtime": 39967.9694, "train_tokens_per_second": 4665.554 }, { "epoch": 0.39221938775510207, "grad_norm": 0.5631366168298503, "learning_rate": 9.081279617151502e-06, "loss": 0.3412167549133301, "num_input_tokens_seen": 186778176, "step": 3075, "train_runtime": 40033.8552, "train_tokens_per_second": 4665.506 }, { "epoch": 0.39285714285714285, "grad_norm": 0.705040663198948, "learning_rate": 9.078383966227369e-06, "loss": 0.3425647735595703, "num_input_tokens_seen": 187063736, "step": 3080, "train_runtime": 40092.033, "train_tokens_per_second": 4665.858 }, { "epoch": 0.3934948979591837, "grad_norm": 0.6215548340584263, "learning_rate": 9.075484222360094e-06, "loss": 0.3367135047912598, "num_input_tokens_seen": 187368624, "step": 3085, "train_runtime": 40157.096, "train_tokens_per_second": 4665.891 }, { "epoch": 0.39413265306122447, "grad_norm": 0.5527858614708204, "learning_rate": 9.07258038845977e-06, "loss": 0.3358824014663696, "num_input_tokens_seen": 187663328, "step": 3090, "train_runtime": 40220.8318, "train_tokens_per_second": 4665.824 }, { "epoch": 0.3947704081632653, "grad_norm": 1.2400382462560369, "learning_rate": 9.069672467440598e-06, "loss": 0.33083035945892336, "num_input_tokens_seen": 187973304, "step": 3095, "train_runtime": 40292.7091, "train_tokens_per_second": 4665.194 }, { "epoch": 0.39540816326530615, "grad_norm": 0.580912158692128, "learning_rate": 9.066760462220878e-06, "loss": 0.33884828090667723, "num_input_tokens_seen": 188282120, "step": 3100, "train_runtime": 40359.1714, "train_tokens_per_second": 4665.163 }, { "epoch": 0.3960459183673469, "grad_norm": 0.6333973041936676, "learning_rate": 9.063844375723014e-06, "loss": 0.3614191055297852, "num_input_tokens_seen": 188588584, "step": 3105, "train_runtime": 40412.2684, "train_tokens_per_second": 4666.617 }, { "epoch": 0.39668367346938777, "grad_norm": 0.6616804860116007, "learning_rate": 9.060924210873501e-06, "loss": 0.3382896423339844, "num_input_tokens_seen": 188877960, "step": 3110, "train_runtime": 40479.3542, "train_tokens_per_second": 4666.032 }, { "epoch": 0.39732142857142855, "grad_norm": 0.5940013837269007, "learning_rate": 9.057999970602926e-06, "loss": 0.3252332448959351, "num_input_tokens_seen": 189183784, "step": 3115, "train_runtime": 40532.2194, "train_tokens_per_second": 4667.491 }, { "epoch": 0.3979591836734694, "grad_norm": 0.6260211613428975, "learning_rate": 9.055071657845973e-06, "loss": 0.32281057834625243, "num_input_tokens_seen": 189493632, "step": 3120, "train_runtime": 40607.1692, "train_tokens_per_second": 4666.507 }, { "epoch": 0.3985969387755102, "grad_norm": 0.5737762890912685, "learning_rate": 9.052139275541404e-06, "loss": 0.30558199882507325, "num_input_tokens_seen": 189783792, "step": 3125, "train_runtime": 40679.3976, "train_tokens_per_second": 4665.354 }, { "epoch": 0.399234693877551, "grad_norm": 0.6283015593723065, "learning_rate": 9.049202826632072e-06, "loss": 0.3246393442153931, "num_input_tokens_seen": 190085928, "step": 3130, "train_runtime": 40750.9828, "train_tokens_per_second": 4664.573 }, { "epoch": 0.39987244897959184, "grad_norm": 0.6689106619691115, "learning_rate": 9.046262314064907e-06, "loss": 0.324275541305542, "num_input_tokens_seen": 190382216, "step": 3135, "train_runtime": 40817.4109, "train_tokens_per_second": 4664.24 }, { "epoch": 0.4005102040816326, "grad_norm": 0.6360393990753626, "learning_rate": 9.04331774079092e-06, "loss": 0.3147127151489258, "num_input_tokens_seen": 190675216, "step": 3140, "train_runtime": 40881.2044, "train_tokens_per_second": 4664.129 }, { "epoch": 0.40114795918367346, "grad_norm": 0.6214882977851226, "learning_rate": 9.040369109765196e-06, "loss": 0.32260823249816895, "num_input_tokens_seen": 190965104, "step": 3145, "train_runtime": 40955.7806, "train_tokens_per_second": 4662.714 }, { "epoch": 0.4017857142857143, "grad_norm": 0.6637829015701485, "learning_rate": 9.037416423946891e-06, "loss": 0.3365804195404053, "num_input_tokens_seen": 191261352, "step": 3150, "train_runtime": 41016.5369, "train_tokens_per_second": 4663.03 }, { "epoch": 0.4024234693877551, "grad_norm": 0.6892121705707139, "learning_rate": 9.034459686299232e-06, "loss": 0.33006772994995115, "num_input_tokens_seen": 191568288, "step": 3155, "train_runtime": 41082.9564, "train_tokens_per_second": 4662.963 }, { "epoch": 0.4030612244897959, "grad_norm": 0.6292349021817905, "learning_rate": 9.031498899789513e-06, "loss": 0.3405275344848633, "num_input_tokens_seen": 191879040, "step": 3160, "train_runtime": 41159.2321, "train_tokens_per_second": 4661.871 }, { "epoch": 0.40369897959183676, "grad_norm": 0.6416600064075941, "learning_rate": 9.028534067389087e-06, "loss": 0.34804649353027345, "num_input_tokens_seen": 192184496, "step": 3165, "train_runtime": 41217.9089, "train_tokens_per_second": 4662.645 }, { "epoch": 0.40433673469387754, "grad_norm": 0.6028801651675489, "learning_rate": 9.025565192073374e-06, "loss": 0.31906704902648925, "num_input_tokens_seen": 192501256, "step": 3170, "train_runtime": 41282.7892, "train_tokens_per_second": 4662.991 }, { "epoch": 0.4049744897959184, "grad_norm": 0.6013871902386567, "learning_rate": 9.022592276821843e-06, "loss": 0.3202676773071289, "num_input_tokens_seen": 192801104, "step": 3175, "train_runtime": 41350.7709, "train_tokens_per_second": 4662.576 }, { "epoch": 0.40561224489795916, "grad_norm": 0.6532415703338951, "learning_rate": 9.019615324618027e-06, "loss": 0.3559399604797363, "num_input_tokens_seen": 193101872, "step": 3180, "train_runtime": 41407.7088, "train_tokens_per_second": 4663.428 }, { "epoch": 0.40625, "grad_norm": 0.6191157615724391, "learning_rate": 9.016634338449504e-06, "loss": 0.3301278591156006, "num_input_tokens_seen": 193401672, "step": 3185, "train_runtime": 41472.1512, "train_tokens_per_second": 4663.411 }, { "epoch": 0.40688775510204084, "grad_norm": 0.6973825057090168, "learning_rate": 9.0136493213079e-06, "loss": 0.3401746988296509, "num_input_tokens_seen": 193709256, "step": 3190, "train_runtime": 41541.9209, "train_tokens_per_second": 4662.983 }, { "epoch": 0.4075255102040816, "grad_norm": 0.6821771969199714, "learning_rate": 9.01066027618889e-06, "loss": 0.324747896194458, "num_input_tokens_seen": 194004880, "step": 3195, "train_runtime": 41607.2159, "train_tokens_per_second": 4662.77 }, { "epoch": 0.40816326530612246, "grad_norm": 0.6134365426069813, "learning_rate": 9.007667206092188e-06, "loss": 0.3389841318130493, "num_input_tokens_seen": 194301520, "step": 3200, "train_runtime": 41682.5693, "train_tokens_per_second": 4661.457 }, { "epoch": 0.40880102040816324, "grad_norm": 0.6142967231252621, "learning_rate": 9.00467011402155e-06, "loss": 0.3330172061920166, "num_input_tokens_seen": 194608512, "step": 3205, "train_runtime": 41760.7855, "train_tokens_per_second": 4660.078 }, { "epoch": 0.4094387755102041, "grad_norm": 0.6090999730172338, "learning_rate": 9.001669002984767e-06, "loss": 0.3154860019683838, "num_input_tokens_seen": 194893256, "step": 3210, "train_runtime": 41832.6509, "train_tokens_per_second": 4658.879 }, { "epoch": 0.4100765306122449, "grad_norm": 0.6169265613712519, "learning_rate": 8.998663875993666e-06, "loss": 0.3542327880859375, "num_input_tokens_seen": 195193368, "step": 3215, "train_runtime": 41896.08, "train_tokens_per_second": 4658.989 }, { "epoch": 0.4107142857142857, "grad_norm": 0.5498958620113921, "learning_rate": 8.995654736064096e-06, "loss": 0.32598466873168946, "num_input_tokens_seen": 195489920, "step": 3220, "train_runtime": 41960.6643, "train_tokens_per_second": 4658.885 }, { "epoch": 0.41135204081632654, "grad_norm": 0.6081149945341389, "learning_rate": 8.992641586215944e-06, "loss": 0.32182776927948, "num_input_tokens_seen": 195793216, "step": 3225, "train_runtime": 42028.6884, "train_tokens_per_second": 4658.561 }, { "epoch": 0.4119897959183674, "grad_norm": 0.5562314290478565, "learning_rate": 8.989624429473116e-06, "loss": 0.34074854850769043, "num_input_tokens_seen": 196100528, "step": 3230, "train_runtime": 42092.2974, "train_tokens_per_second": 4658.822 }, { "epoch": 0.41262755102040816, "grad_norm": 0.628203657068124, "learning_rate": 8.986603268863536e-06, "loss": 0.3286905765533447, "num_input_tokens_seen": 196393664, "step": 3235, "train_runtime": 42156.5376, "train_tokens_per_second": 4658.676 }, { "epoch": 0.413265306122449, "grad_norm": 0.6241058236960567, "learning_rate": 8.983578107419153e-06, "loss": 0.34261574745178225, "num_input_tokens_seen": 196697800, "step": 3240, "train_runtime": 42218.0436, "train_tokens_per_second": 4659.093 }, { "epoch": 0.4139030612244898, "grad_norm": 0.6728497794200269, "learning_rate": 8.980548948175926e-06, "loss": 0.3467216491699219, "num_input_tokens_seen": 197005264, "step": 3245, "train_runtime": 42279.8914, "train_tokens_per_second": 4659.55 }, { "epoch": 0.4145408163265306, "grad_norm": 0.8621514340505042, "learning_rate": 8.97751579417383e-06, "loss": 0.3394784688949585, "num_input_tokens_seen": 197297408, "step": 3250, "train_runtime": 42350.6875, "train_tokens_per_second": 4658.659 }, { "epoch": 0.41517857142857145, "grad_norm": 0.6153003291823951, "learning_rate": 8.974478648456845e-06, "loss": 0.34244298934936523, "num_input_tokens_seen": 197610888, "step": 3255, "train_runtime": 42424.4, "train_tokens_per_second": 4657.954 }, { "epoch": 0.41581632653061223, "grad_norm": 0.5896156619261562, "learning_rate": 8.971437514072959e-06, "loss": 0.33392794132232667, "num_input_tokens_seen": 197904104, "step": 3260, "train_runtime": 42490.4267, "train_tokens_per_second": 4657.616 }, { "epoch": 0.4164540816326531, "grad_norm": 0.5514546498909295, "learning_rate": 8.968392394074164e-06, "loss": 0.3191607713699341, "num_input_tokens_seen": 198223760, "step": 3265, "train_runtime": 42544.331, "train_tokens_per_second": 4659.229 }, { "epoch": 0.41709183673469385, "grad_norm": 0.5114826217649231, "learning_rate": 8.965343291516448e-06, "loss": 0.324001145362854, "num_input_tokens_seen": 198520776, "step": 3270, "train_runtime": 42613.6229, "train_tokens_per_second": 4658.622 }, { "epoch": 0.4177295918367347, "grad_norm": 0.5906218319794891, "learning_rate": 8.962290209459801e-06, "loss": 0.33489012718200684, "num_input_tokens_seen": 198828432, "step": 3275, "train_runtime": 42672.0773, "train_tokens_per_second": 4659.451 }, { "epoch": 0.41836734693877553, "grad_norm": 0.8141909804684863, "learning_rate": 8.959233150968203e-06, "loss": 0.3072980403900146, "num_input_tokens_seen": 199125336, "step": 3280, "train_runtime": 42730.6336, "train_tokens_per_second": 4660.014 }, { "epoch": 0.4190051020408163, "grad_norm": 0.5693135294695517, "learning_rate": 8.956172119109625e-06, "loss": 0.33353633880615235, "num_input_tokens_seen": 199438904, "step": 3285, "train_runtime": 42799.3366, "train_tokens_per_second": 4659.86 }, { "epoch": 0.41964285714285715, "grad_norm": 0.5614417137817604, "learning_rate": 8.953107116956027e-06, "loss": 0.34106614589691164, "num_input_tokens_seen": 199752248, "step": 3290, "train_runtime": 42867.8006, "train_tokens_per_second": 4659.727 }, { "epoch": 0.42028061224489793, "grad_norm": 0.5830425466578484, "learning_rate": 8.950038147583353e-06, "loss": 0.34395198822021483, "num_input_tokens_seen": 200059536, "step": 3295, "train_runtime": 42936.7429, "train_tokens_per_second": 4659.402 }, { "epoch": 0.42091836734693877, "grad_norm": 0.5922092142397991, "learning_rate": 8.946965214071528e-06, "loss": 0.33737869262695314, "num_input_tokens_seen": 200353952, "step": 3300, "train_runtime": 43008.6939, "train_tokens_per_second": 4658.452 }, { "epoch": 0.4215561224489796, "grad_norm": 0.7632206076268352, "learning_rate": 8.943888319504456e-06, "loss": 0.35701279640197753, "num_input_tokens_seen": 200664080, "step": 3305, "train_runtime": 43070.3424, "train_tokens_per_second": 4658.985 }, { "epoch": 0.4221938775510204, "grad_norm": 0.6028949445797422, "learning_rate": 8.940807466970014e-06, "loss": 0.3449193000793457, "num_input_tokens_seen": 200978760, "step": 3310, "train_runtime": 43136.8719, "train_tokens_per_second": 4659.094 }, { "epoch": 0.42283163265306123, "grad_norm": 0.5907954504190535, "learning_rate": 8.937722659560054e-06, "loss": 0.34102916717529297, "num_input_tokens_seen": 201280168, "step": 3315, "train_runtime": 43212.1164, "train_tokens_per_second": 4657.957 }, { "epoch": 0.42346938775510207, "grad_norm": 0.5920307060294568, "learning_rate": 8.934633900370395e-06, "loss": 0.33057827949523927, "num_input_tokens_seen": 201590040, "step": 3320, "train_runtime": 43270.9762, "train_tokens_per_second": 4658.782 }, { "epoch": 0.42410714285714285, "grad_norm": 0.6581209511524866, "learning_rate": 8.931541192500822e-06, "loss": 0.34342374801635744, "num_input_tokens_seen": 201892176, "step": 3325, "train_runtime": 43330.4223, "train_tokens_per_second": 4659.363 }, { "epoch": 0.4247448979591837, "grad_norm": 0.5803011854198395, "learning_rate": 8.928444539055086e-06, "loss": 0.3427203893661499, "num_input_tokens_seen": 202205768, "step": 3330, "train_runtime": 43397.0785, "train_tokens_per_second": 4659.433 }, { "epoch": 0.42538265306122447, "grad_norm": 0.6432927089595954, "learning_rate": 8.92534394314089e-06, "loss": 0.3572682857513428, "num_input_tokens_seen": 202521176, "step": 3335, "train_runtime": 43460.8207, "train_tokens_per_second": 4659.856 }, { "epoch": 0.4260204081632653, "grad_norm": 0.7242477526819633, "learning_rate": 8.922239407869904e-06, "loss": 0.3468234300613403, "num_input_tokens_seen": 202832992, "step": 3340, "train_runtime": 43525.8644, "train_tokens_per_second": 4660.057 }, { "epoch": 0.42665816326530615, "grad_norm": 0.6999456822183165, "learning_rate": 8.919130936357743e-06, "loss": 0.35007805824279786, "num_input_tokens_seen": 203131248, "step": 3345, "train_runtime": 43589.7982, "train_tokens_per_second": 4660.064 }, { "epoch": 0.4272959183673469, "grad_norm": 0.6101904475075166, "learning_rate": 8.916018531723975e-06, "loss": 0.32661712169647217, "num_input_tokens_seen": 203441272, "step": 3350, "train_runtime": 43658.7128, "train_tokens_per_second": 4659.809 }, { "epoch": 0.42793367346938777, "grad_norm": 0.6130959340037874, "learning_rate": 8.91290219709212e-06, "loss": 0.3261438846588135, "num_input_tokens_seen": 203750872, "step": 3355, "train_runtime": 43729.0432, "train_tokens_per_second": 4659.395 }, { "epoch": 0.42857142857142855, "grad_norm": 0.6493482786986688, "learning_rate": 8.909781935589629e-06, "loss": 0.3584270000457764, "num_input_tokens_seen": 204067096, "step": 3360, "train_runtime": 43794.0055, "train_tokens_per_second": 4659.704 }, { "epoch": 0.4292091836734694, "grad_norm": 0.5889032217179043, "learning_rate": 8.906657750347909e-06, "loss": 0.33870534896850585, "num_input_tokens_seen": 204383624, "step": 3365, "train_runtime": 43844.6231, "train_tokens_per_second": 4661.544 }, { "epoch": 0.4298469387755102, "grad_norm": 0.5419021099122644, "learning_rate": 8.903529644502297e-06, "loss": 0.3180680751800537, "num_input_tokens_seen": 204692960, "step": 3370, "train_runtime": 43916.3662, "train_tokens_per_second": 4660.972 }, { "epoch": 0.430484693877551, "grad_norm": 0.621544249114791, "learning_rate": 8.900397621192063e-06, "loss": 0.33640327453613283, "num_input_tokens_seen": 204997448, "step": 3375, "train_runtime": 43991.6741, "train_tokens_per_second": 4659.915 }, { "epoch": 0.43112244897959184, "grad_norm": 0.6050089551962087, "learning_rate": 8.897261683560413e-06, "loss": 0.33349683284759524, "num_input_tokens_seen": 205302480, "step": 3380, "train_runtime": 44065.1786, "train_tokens_per_second": 4659.064 }, { "epoch": 0.4317602040816326, "grad_norm": 0.754840342504173, "learning_rate": 8.89412183475448e-06, "loss": 0.36110312938690187, "num_input_tokens_seen": 205609000, "step": 3385, "train_runtime": 44128.4128, "train_tokens_per_second": 4659.334 }, { "epoch": 0.43239795918367346, "grad_norm": 0.5990457935156054, "learning_rate": 8.890978077925323e-06, "loss": 0.3305992126464844, "num_input_tokens_seen": 205906960, "step": 3390, "train_runtime": 44200.6081, "train_tokens_per_second": 4658.464 }, { "epoch": 0.4330357142857143, "grad_norm": 0.5857853241662915, "learning_rate": 8.887830416227918e-06, "loss": 0.33739218711853025, "num_input_tokens_seen": 206210696, "step": 3395, "train_runtime": 44275.8896, "train_tokens_per_second": 4657.404 }, { "epoch": 0.4336734693877551, "grad_norm": 0.6383005925200967, "learning_rate": 8.884678852821165e-06, "loss": 0.3457144021987915, "num_input_tokens_seen": 206510688, "step": 3400, "train_runtime": 44334.6533, "train_tokens_per_second": 4657.997 }, { "epoch": 0.4343112244897959, "grad_norm": 0.6268344964822126, "learning_rate": 8.881523390867876e-06, "loss": 0.3492433547973633, "num_input_tokens_seen": 206826344, "step": 3405, "train_runtime": 44403.9141, "train_tokens_per_second": 4657.84 }, { "epoch": 0.43494897959183676, "grad_norm": 0.6896730273877322, "learning_rate": 8.878364033534781e-06, "loss": 0.3448661804199219, "num_input_tokens_seen": 207133176, "step": 3410, "train_runtime": 44469.4236, "train_tokens_per_second": 4657.879 }, { "epoch": 0.43558673469387754, "grad_norm": 0.5781296268129277, "learning_rate": 8.875200783992514e-06, "loss": 0.3526355266571045, "num_input_tokens_seen": 207443552, "step": 3415, "train_runtime": 44536.3626, "train_tokens_per_second": 4657.847 }, { "epoch": 0.4362244897959184, "grad_norm": 0.5847382276580055, "learning_rate": 8.872033645415617e-06, "loss": 0.3426992654800415, "num_input_tokens_seen": 207753784, "step": 3420, "train_runtime": 44595.5073, "train_tokens_per_second": 4658.626 }, { "epoch": 0.43686224489795916, "grad_norm": 0.5844254850337194, "learning_rate": 8.868862620982534e-06, "loss": 0.32737252712249754, "num_input_tokens_seen": 208057576, "step": 3425, "train_runtime": 44666.7211, "train_tokens_per_second": 4658.0 }, { "epoch": 0.4375, "grad_norm": 0.5693357038747994, "learning_rate": 8.86568771387561e-06, "loss": 0.35897324085235593, "num_input_tokens_seen": 208378240, "step": 3430, "train_runtime": 44738.6746, "train_tokens_per_second": 4657.676 }, { "epoch": 0.43813775510204084, "grad_norm": 0.6292235196885807, "learning_rate": 8.862508927281086e-06, "loss": 0.3397051334381104, "num_input_tokens_seen": 208677608, "step": 3435, "train_runtime": 44806.0687, "train_tokens_per_second": 4657.351 }, { "epoch": 0.4387755102040816, "grad_norm": 0.6656699103580476, "learning_rate": 8.859326264389098e-06, "loss": 0.3317503690719604, "num_input_tokens_seen": 208979040, "step": 3440, "train_runtime": 44868.7902, "train_tokens_per_second": 4657.559 }, { "epoch": 0.43941326530612246, "grad_norm": 0.5913088524568678, "learning_rate": 8.856139728393667e-06, "loss": 0.32828850746154786, "num_input_tokens_seen": 209282536, "step": 3445, "train_runtime": 44931.7285, "train_tokens_per_second": 4657.79 }, { "epoch": 0.44005102040816324, "grad_norm": 0.7367234724225616, "learning_rate": 8.852949322492708e-06, "loss": 0.3224157810211182, "num_input_tokens_seen": 209589696, "step": 3450, "train_runtime": 45001.3185, "train_tokens_per_second": 4657.412 }, { "epoch": 0.4406887755102041, "grad_norm": 0.6518804929508688, "learning_rate": 8.849755049888014e-06, "loss": 0.3120415687561035, "num_input_tokens_seen": 209895168, "step": 3455, "train_runtime": 45053.3682, "train_tokens_per_second": 4658.812 }, { "epoch": 0.4413265306122449, "grad_norm": 0.6329772560530746, "learning_rate": 8.84655691378526e-06, "loss": 0.35138235092163084, "num_input_tokens_seen": 210209408, "step": 3460, "train_runtime": 45121.5113, "train_tokens_per_second": 4658.74 }, { "epoch": 0.4419642857142857, "grad_norm": 0.6083189363119031, "learning_rate": 8.843354917394e-06, "loss": 0.3106915712356567, "num_input_tokens_seen": 210511320, "step": 3465, "train_runtime": 45185.4567, "train_tokens_per_second": 4658.829 }, { "epoch": 0.44260204081632654, "grad_norm": 0.6485137944506096, "learning_rate": 8.840149063927663e-06, "loss": 0.3368816375732422, "num_input_tokens_seen": 210811088, "step": 3470, "train_runtime": 45254.2994, "train_tokens_per_second": 4658.366 }, { "epoch": 0.4432397959183674, "grad_norm": 0.6092074936218119, "learning_rate": 8.836939356603542e-06, "loss": 0.339404559135437, "num_input_tokens_seen": 211116448, "step": 3475, "train_runtime": 45315.305, "train_tokens_per_second": 4658.833 }, { "epoch": 0.44387755102040816, "grad_norm": 0.5633065601403158, "learning_rate": 8.833725798642809e-06, "loss": 0.3408853530883789, "num_input_tokens_seen": 211422040, "step": 3480, "train_runtime": 45375.3562, "train_tokens_per_second": 4659.402 }, { "epoch": 0.444515306122449, "grad_norm": 0.6201839375568762, "learning_rate": 8.830508393270487e-06, "loss": 0.3162368297576904, "num_input_tokens_seen": 211719672, "step": 3485, "train_runtime": 45443.2728, "train_tokens_per_second": 4658.988 }, { "epoch": 0.4451530612244898, "grad_norm": 0.5651255280682073, "learning_rate": 8.827287143715472e-06, "loss": 0.3251905679702759, "num_input_tokens_seen": 212028616, "step": 3490, "train_runtime": 45509.5767, "train_tokens_per_second": 4658.989 }, { "epoch": 0.4457908163265306, "grad_norm": 0.6887442211325981, "learning_rate": 8.824062053210512e-06, "loss": 0.33139405250549314, "num_input_tokens_seen": 212317040, "step": 3495, "train_runtime": 45582.7374, "train_tokens_per_second": 4657.839 }, { "epoch": 0.44642857142857145, "grad_norm": 0.6587881500321826, "learning_rate": 8.820833124992207e-06, "loss": 0.33382697105407716, "num_input_tokens_seen": 212617704, "step": 3500, "train_runtime": 45649.8867, "train_tokens_per_second": 4657.574 }, { "epoch": 0.44706632653061223, "grad_norm": 0.5922595852872055, "learning_rate": 8.817600362301018e-06, "loss": 0.33900742530822753, "num_input_tokens_seen": 212928504, "step": 3505, "train_runtime": 45698.8399, "train_tokens_per_second": 4659.385 }, { "epoch": 0.4477040816326531, "grad_norm": 0.6856015401514906, "learning_rate": 8.814363768381242e-06, "loss": 0.34448800086975095, "num_input_tokens_seen": 213231112, "step": 3510, "train_runtime": 45756.1646, "train_tokens_per_second": 4660.161 }, { "epoch": 0.44834183673469385, "grad_norm": 0.5798228631240803, "learning_rate": 8.81112334648103e-06, "loss": 0.31914894580841063, "num_input_tokens_seen": 213533896, "step": 3515, "train_runtime": 45826.3218, "train_tokens_per_second": 4659.634 }, { "epoch": 0.4489795918367347, "grad_norm": 0.5974213947846045, "learning_rate": 8.807879099852372e-06, "loss": 0.3257153034210205, "num_input_tokens_seen": 213833744, "step": 3520, "train_runtime": 45886.9257, "train_tokens_per_second": 4660.015 }, { "epoch": 0.44961734693877553, "grad_norm": 0.6616558421164055, "learning_rate": 8.804631031751096e-06, "loss": 0.3289602041244507, "num_input_tokens_seen": 214140608, "step": 3525, "train_runtime": 45955.8381, "train_tokens_per_second": 4659.704 }, { "epoch": 0.4502551020408163, "grad_norm": 0.5493349107092007, "learning_rate": 8.801379145436866e-06, "loss": 0.32906880378723147, "num_input_tokens_seen": 214444440, "step": 3530, "train_runtime": 46018.3078, "train_tokens_per_second": 4659.981 }, { "epoch": 0.45089285714285715, "grad_norm": 0.5863711108445256, "learning_rate": 8.798123444173174e-06, "loss": 0.3326809167861938, "num_input_tokens_seen": 214764408, "step": 3535, "train_runtime": 46079.5232, "train_tokens_per_second": 4660.734 }, { "epoch": 0.45153061224489793, "grad_norm": 0.5692545931440874, "learning_rate": 8.794863931227346e-06, "loss": 0.3165797233581543, "num_input_tokens_seen": 215066664, "step": 3540, "train_runtime": 46138.4384, "train_tokens_per_second": 4661.334 }, { "epoch": 0.45216836734693877, "grad_norm": 0.590150731385412, "learning_rate": 8.79160060987053e-06, "loss": 0.32453289031982424, "num_input_tokens_seen": 215375520, "step": 3545, "train_runtime": 46197.8852, "train_tokens_per_second": 4662.021 }, { "epoch": 0.4528061224489796, "grad_norm": 0.6298776588000911, "learning_rate": 8.788333483377699e-06, "loss": 0.33482890129089354, "num_input_tokens_seen": 215684472, "step": 3550, "train_runtime": 46264.3918, "train_tokens_per_second": 4661.997 }, { "epoch": 0.4534438775510204, "grad_norm": 0.7164484415230423, "learning_rate": 8.785062555027637e-06, "loss": 0.32947793006896975, "num_input_tokens_seen": 215978352, "step": 3555, "train_runtime": 46332.379, "train_tokens_per_second": 4661.499 }, { "epoch": 0.45408163265306123, "grad_norm": 0.6005379480462399, "learning_rate": 8.781787828102958e-06, "loss": 0.3068972587585449, "num_input_tokens_seen": 216279984, "step": 3560, "train_runtime": 46396.3682, "train_tokens_per_second": 4661.571 }, { "epoch": 0.45471938775510207, "grad_norm": 0.628236753497089, "learning_rate": 8.778509305890069e-06, "loss": 0.3233363151550293, "num_input_tokens_seen": 216587936, "step": 3565, "train_runtime": 46461.1093, "train_tokens_per_second": 4661.704 }, { "epoch": 0.45535714285714285, "grad_norm": 0.6604944018759947, "learning_rate": 8.775226991679205e-06, "loss": 0.31778683662414553, "num_input_tokens_seen": 216883960, "step": 3570, "train_runtime": 46527.9806, "train_tokens_per_second": 4661.366 }, { "epoch": 0.4559948979591837, "grad_norm": 0.6045429187096011, "learning_rate": 8.77194088876439e-06, "loss": 0.359822940826416, "num_input_tokens_seen": 217190424, "step": 3575, "train_runtime": 46600.9421, "train_tokens_per_second": 4660.644 }, { "epoch": 0.45663265306122447, "grad_norm": 0.6093154195881341, "learning_rate": 8.768651000443463e-06, "loss": 0.3432753086090088, "num_input_tokens_seen": 217492848, "step": 3580, "train_runtime": 46668.3348, "train_tokens_per_second": 4660.394 }, { "epoch": 0.4572704081632653, "grad_norm": 0.6020313159495515, "learning_rate": 8.765357330018056e-06, "loss": 0.3330278158187866, "num_input_tokens_seen": 217802264, "step": 3585, "train_runtime": 46733.4455, "train_tokens_per_second": 4660.522 }, { "epoch": 0.45790816326530615, "grad_norm": 0.592677521696768, "learning_rate": 8.762059880793595e-06, "loss": 0.31818888187408445, "num_input_tokens_seen": 218101968, "step": 3590, "train_runtime": 46802.4783, "train_tokens_per_second": 4660.052 }, { "epoch": 0.4585459183673469, "grad_norm": 0.6090140714152729, "learning_rate": 8.758758656079303e-06, "loss": 0.34148919582366943, "num_input_tokens_seen": 218407680, "step": 3595, "train_runtime": 46858.3375, "train_tokens_per_second": 4661.021 }, { "epoch": 0.45918367346938777, "grad_norm": 0.58287892611014, "learning_rate": 8.755453659188186e-06, "loss": 0.34990203380584717, "num_input_tokens_seen": 218713272, "step": 3600, "train_runtime": 46923.1988, "train_tokens_per_second": 4661.09 }, { "epoch": 0.45982142857142855, "grad_norm": 0.5833916162586771, "learning_rate": 8.752144893437045e-06, "loss": 0.3203828573226929, "num_input_tokens_seen": 219022144, "step": 3605, "train_runtime": 46993.4779, "train_tokens_per_second": 4660.692 }, { "epoch": 0.4604591836734694, "grad_norm": 0.5956637639825637, "learning_rate": 8.748832362146454e-06, "loss": 0.32918357849121094, "num_input_tokens_seen": 219326448, "step": 3610, "train_runtime": 47068.5692, "train_tokens_per_second": 4659.722 }, { "epoch": 0.4610969387755102, "grad_norm": 0.664499572011986, "learning_rate": 8.745516068640767e-06, "loss": 0.3219877243041992, "num_input_tokens_seen": 219624856, "step": 3615, "train_runtime": 47131.7287, "train_tokens_per_second": 4659.809 }, { "epoch": 0.461734693877551, "grad_norm": 0.6569114261470931, "learning_rate": 8.742196016248121e-06, "loss": 0.3326474666595459, "num_input_tokens_seen": 219925872, "step": 3620, "train_runtime": 47186.9921, "train_tokens_per_second": 4660.731 }, { "epoch": 0.46237244897959184, "grad_norm": 0.7617400027936144, "learning_rate": 8.738872208300417e-06, "loss": 0.3078127384185791, "num_input_tokens_seen": 220214592, "step": 3625, "train_runtime": 47254.858, "train_tokens_per_second": 4660.147 }, { "epoch": 0.4630102040816326, "grad_norm": 0.6347466685079263, "learning_rate": 8.735544648133331e-06, "loss": 0.3348182439804077, "num_input_tokens_seen": 220521248, "step": 3630, "train_runtime": 47320.6913, "train_tokens_per_second": 4660.144 }, { "epoch": 0.46364795918367346, "grad_norm": 0.6211229675216676, "learning_rate": 8.7322133390863e-06, "loss": 0.35152287483215333, "num_input_tokens_seen": 220810352, "step": 3635, "train_runtime": 47394.397, "train_tokens_per_second": 4658.997 }, { "epoch": 0.4642857142857143, "grad_norm": 0.7067748043120594, "learning_rate": 8.728878284502526e-06, "loss": 0.3194485902786255, "num_input_tokens_seen": 221106400, "step": 3640, "train_runtime": 47461.2057, "train_tokens_per_second": 4658.676 }, { "epoch": 0.4649234693877551, "grad_norm": 0.6362789992815582, "learning_rate": 8.725539487728969e-06, "loss": 0.33799190521240235, "num_input_tokens_seen": 221420712, "step": 3645, "train_runtime": 47526.8595, "train_tokens_per_second": 4658.854 }, { "epoch": 0.4655612244897959, "grad_norm": 0.5918305492650939, "learning_rate": 8.722196952116346e-06, "loss": 0.31893162727355956, "num_input_tokens_seen": 221725936, "step": 3650, "train_runtime": 47592.967, "train_tokens_per_second": 4658.796 }, { "epoch": 0.46619897959183676, "grad_norm": 0.6187216060217506, "learning_rate": 8.718850681019125e-06, "loss": 0.3435813426971436, "num_input_tokens_seen": 222021640, "step": 3655, "train_runtime": 47658.7045, "train_tokens_per_second": 4658.575 }, { "epoch": 0.46683673469387754, "grad_norm": 0.6007532120518013, "learning_rate": 8.715500677795519e-06, "loss": 0.3304643392562866, "num_input_tokens_seen": 222314448, "step": 3660, "train_runtime": 47737.5544, "train_tokens_per_second": 4657.014 }, { "epoch": 0.4674744897959184, "grad_norm": 0.6159209527989902, "learning_rate": 8.712146945807494e-06, "loss": 0.3191221714019775, "num_input_tokens_seen": 222623648, "step": 3665, "train_runtime": 47795.5768, "train_tokens_per_second": 4657.83 }, { "epoch": 0.46811224489795916, "grad_norm": 0.6731481661966066, "learning_rate": 8.708789488420753e-06, "loss": 0.32197272777557373, "num_input_tokens_seen": 222922432, "step": 3670, "train_runtime": 47870.6142, "train_tokens_per_second": 4656.77 }, { "epoch": 0.46875, "grad_norm": 0.6757831485969278, "learning_rate": 8.705428309004737e-06, "loss": 0.31526567935943606, "num_input_tokens_seen": 223229936, "step": 3675, "train_runtime": 47938.8509, "train_tokens_per_second": 4656.556 }, { "epoch": 0.46938775510204084, "grad_norm": 0.7112337740632515, "learning_rate": 8.702063410932628e-06, "loss": 0.3370952606201172, "num_input_tokens_seen": 223528488, "step": 3680, "train_runtime": 48014.0837, "train_tokens_per_second": 4655.478 }, { "epoch": 0.4700255102040816, "grad_norm": 0.6470080319086245, "learning_rate": 8.698694797581335e-06, "loss": 0.30045714378356936, "num_input_tokens_seen": 223821368, "step": 3685, "train_runtime": 48088.7204, "train_tokens_per_second": 4654.342 }, { "epoch": 0.47066326530612246, "grad_norm": 0.6107567931135042, "learning_rate": 8.695322472331497e-06, "loss": 0.34927806854248045, "num_input_tokens_seen": 224128912, "step": 3690, "train_runtime": 48154.5956, "train_tokens_per_second": 4654.362 }, { "epoch": 0.47130102040816324, "grad_norm": 0.5961638372408326, "learning_rate": 8.691946438567476e-06, "loss": 0.3163304328918457, "num_input_tokens_seen": 224441784, "step": 3695, "train_runtime": 48208.6294, "train_tokens_per_second": 4655.635 }, { "epoch": 0.4719387755102041, "grad_norm": 0.6182783846051844, "learning_rate": 8.688566699677362e-06, "loss": 0.33351778984069824, "num_input_tokens_seen": 224754568, "step": 3700, "train_runtime": 48261.291, "train_tokens_per_second": 4657.036 }, { "epoch": 0.4725765306122449, "grad_norm": 0.6391520103763577, "learning_rate": 8.685183259052951e-06, "loss": 0.32537355422973635, "num_input_tokens_seen": 225050008, "step": 3705, "train_runtime": 48328.626, "train_tokens_per_second": 4656.661 }, { "epoch": 0.4732142857142857, "grad_norm": 0.6602857375485054, "learning_rate": 8.68179612008977e-06, "loss": 0.3055689334869385, "num_input_tokens_seen": 225357160, "step": 3710, "train_runtime": 48391.4814, "train_tokens_per_second": 4656.959 }, { "epoch": 0.47385204081632654, "grad_norm": 0.547557456378693, "learning_rate": 8.678405286187046e-06, "loss": 0.32492766380310056, "num_input_tokens_seen": 225664864, "step": 3715, "train_runtime": 48447.0383, "train_tokens_per_second": 4657.97 }, { "epoch": 0.4744897959183674, "grad_norm": 0.5719022452845505, "learning_rate": 8.675010760747717e-06, "loss": 0.31012744903564454, "num_input_tokens_seen": 225978576, "step": 3720, "train_runtime": 48511.6481, "train_tokens_per_second": 4658.233 }, { "epoch": 0.47512755102040816, "grad_norm": 0.5936112059215125, "learning_rate": 8.671612547178428e-06, "loss": 0.35015435218811036, "num_input_tokens_seen": 226288696, "step": 3725, "train_runtime": 48576.1779, "train_tokens_per_second": 4658.429 }, { "epoch": 0.475765306122449, "grad_norm": 0.605088400054027, "learning_rate": 8.668210648889523e-06, "loss": 0.3316817045211792, "num_input_tokens_seen": 226587976, "step": 3730, "train_runtime": 48644.9087, "train_tokens_per_second": 4658.0 }, { "epoch": 0.4764030612244898, "grad_norm": 0.7170426138582027, "learning_rate": 8.664805069295046e-06, "loss": 0.31617088317871095, "num_input_tokens_seen": 226879712, "step": 3735, "train_runtime": 48707.6769, "train_tokens_per_second": 4657.987 }, { "epoch": 0.4770408163265306, "grad_norm": 0.5225170151134908, "learning_rate": 8.661395811812732e-06, "loss": 0.3001605987548828, "num_input_tokens_seen": 227183312, "step": 3740, "train_runtime": 48768.7211, "train_tokens_per_second": 4658.382 }, { "epoch": 0.47767857142857145, "grad_norm": 0.657497902829899, "learning_rate": 8.657982879864007e-06, "loss": 0.32870779037475584, "num_input_tokens_seen": 227483608, "step": 3745, "train_runtime": 48836.0865, "train_tokens_per_second": 4658.105 }, { "epoch": 0.47831632653061223, "grad_norm": 0.7152430489686709, "learning_rate": 8.654566276873992e-06, "loss": 0.3120705604553223, "num_input_tokens_seen": 227777824, "step": 3750, "train_runtime": 48905.4388, "train_tokens_per_second": 4657.515 }, { "epoch": 0.4789540816326531, "grad_norm": 0.6011045497669353, "learning_rate": 8.651146006271483e-06, "loss": 0.33093512058258057, "num_input_tokens_seen": 228081080, "step": 3755, "train_runtime": 48977.8418, "train_tokens_per_second": 4656.822 }, { "epoch": 0.47959183673469385, "grad_norm": 0.6013894891716157, "learning_rate": 8.64772207148896e-06, "loss": 0.33283772468566897, "num_input_tokens_seen": 228389848, "step": 3760, "train_runtime": 49050.6235, "train_tokens_per_second": 4656.207 }, { "epoch": 0.4802295918367347, "grad_norm": 0.6456911475911199, "learning_rate": 8.644294475962583e-06, "loss": 0.33153154850006106, "num_input_tokens_seen": 228686136, "step": 3765, "train_runtime": 49115.0176, "train_tokens_per_second": 4656.135 }, { "epoch": 0.48086734693877553, "grad_norm": 0.5802838347857451, "learning_rate": 8.640863223132183e-06, "loss": 0.3430925846099854, "num_input_tokens_seen": 228987808, "step": 3770, "train_runtime": 49175.4255, "train_tokens_per_second": 4656.55 }, { "epoch": 0.4815051020408163, "grad_norm": 0.5944701201279429, "learning_rate": 8.63742831644126e-06, "loss": 0.3659370899200439, "num_input_tokens_seen": 229298856, "step": 3775, "train_runtime": 49242.4393, "train_tokens_per_second": 4656.529 }, { "epoch": 0.48214285714285715, "grad_norm": 0.6364665335788862, "learning_rate": 8.633989759336984e-06, "loss": 0.34424939155578616, "num_input_tokens_seen": 229600528, "step": 3780, "train_runtime": 49310.6682, "train_tokens_per_second": 4656.204 }, { "epoch": 0.48278061224489793, "grad_norm": 0.7089879214400359, "learning_rate": 8.630547555270187e-06, "loss": 0.3644766330718994, "num_input_tokens_seen": 229905632, "step": 3785, "train_runtime": 49372.6658, "train_tokens_per_second": 4656.537 }, { "epoch": 0.48341836734693877, "grad_norm": 0.6271171405674849, "learning_rate": 8.627101707695365e-06, "loss": 0.32773098945617674, "num_input_tokens_seen": 230215496, "step": 3790, "train_runtime": 49435.6049, "train_tokens_per_second": 4656.876 }, { "epoch": 0.4840561224489796, "grad_norm": 0.5629236117996881, "learning_rate": 8.62365222007066e-06, "loss": 0.3321268320083618, "num_input_tokens_seen": 230515376, "step": 3795, "train_runtime": 49493.6597, "train_tokens_per_second": 4657.473 }, { "epoch": 0.4846938775510204, "grad_norm": 0.5580576774068381, "learning_rate": 8.620199095857877e-06, "loss": 0.3428853988647461, "num_input_tokens_seen": 230814064, "step": 3800, "train_runtime": 49564.9336, "train_tokens_per_second": 4656.802 }, { "epoch": 0.48533163265306123, "grad_norm": 0.6734770527934579, "learning_rate": 8.616742338522467e-06, "loss": 0.3223045587539673, "num_input_tokens_seen": 231106232, "step": 3805, "train_runtime": 49624.0942, "train_tokens_per_second": 4657.138 }, { "epoch": 0.48596938775510207, "grad_norm": 0.6027423188513089, "learning_rate": 8.613281951533527e-06, "loss": 0.30772149562835693, "num_input_tokens_seen": 231418568, "step": 3810, "train_runtime": 49691.9282, "train_tokens_per_second": 4657.066 }, { "epoch": 0.48660714285714285, "grad_norm": 0.620730028536161, "learning_rate": 8.609817938363799e-06, "loss": 0.3534107685089111, "num_input_tokens_seen": 231724240, "step": 3815, "train_runtime": 49749.4493, "train_tokens_per_second": 4657.825 }, { "epoch": 0.4872448979591837, "grad_norm": 0.6023564046787745, "learning_rate": 8.60635030248966e-06, "loss": 0.3601125001907349, "num_input_tokens_seen": 232033184, "step": 3820, "train_runtime": 49820.1508, "train_tokens_per_second": 4657.416 }, { "epoch": 0.48788265306122447, "grad_norm": 0.5820284956858566, "learning_rate": 8.602879047391127e-06, "loss": 0.3287564992904663, "num_input_tokens_seen": 232332512, "step": 3825, "train_runtime": 49887.8581, "train_tokens_per_second": 4657.095 }, { "epoch": 0.4885204081632653, "grad_norm": 0.5435262720901459, "learning_rate": 8.599404176551843e-06, "loss": 0.33783981800079343, "num_input_tokens_seen": 232642256, "step": 3830, "train_runtime": 49961.0696, "train_tokens_per_second": 4656.471 }, { "epoch": 0.48915816326530615, "grad_norm": 0.5898348531043288, "learning_rate": 8.595925693459086e-06, "loss": 0.32908217906951903, "num_input_tokens_seen": 232936208, "step": 3835, "train_runtime": 50029.4144, "train_tokens_per_second": 4655.985 }, { "epoch": 0.4897959183673469, "grad_norm": 0.6777176694788429, "learning_rate": 8.59244360160376e-06, "loss": 0.3408887624740601, "num_input_tokens_seen": 233254512, "step": 3840, "train_runtime": 50082.2953, "train_tokens_per_second": 4657.425 }, { "epoch": 0.49043367346938777, "grad_norm": 0.6490802984424683, "learning_rate": 8.588957904480381e-06, "loss": 0.3298821449279785, "num_input_tokens_seen": 233551432, "step": 3845, "train_runtime": 50153.4482, "train_tokens_per_second": 4656.737 }, { "epoch": 0.49107142857142855, "grad_norm": 0.644982223462375, "learning_rate": 8.585468605587094e-06, "loss": 0.3687849521636963, "num_input_tokens_seen": 233836184, "step": 3850, "train_runtime": 50221.8557, "train_tokens_per_second": 4656.064 }, { "epoch": 0.4917091836734694, "grad_norm": 0.6266169141222809, "learning_rate": 8.581975708425652e-06, "loss": 0.34029111862182615, "num_input_tokens_seen": 234149936, "step": 3855, "train_runtime": 50293.7681, "train_tokens_per_second": 4655.645 }, { "epoch": 0.4923469387755102, "grad_norm": 0.574291085519132, "learning_rate": 8.578479216501422e-06, "loss": 0.32351346015930177, "num_input_tokens_seen": 234445496, "step": 3860, "train_runtime": 50366.3962, "train_tokens_per_second": 4654.8 }, { "epoch": 0.492984693877551, "grad_norm": 0.5552501971461397, "learning_rate": 8.574979133323378e-06, "loss": 0.3432778835296631, "num_input_tokens_seen": 234765680, "step": 3865, "train_runtime": 50433.1949, "train_tokens_per_second": 4654.983 }, { "epoch": 0.49362244897959184, "grad_norm": 0.5766227232875598, "learning_rate": 8.571475462404098e-06, "loss": 0.3516408443450928, "num_input_tokens_seen": 235072624, "step": 3870, "train_runtime": 50496.9399, "train_tokens_per_second": 4655.186 }, { "epoch": 0.4942602040816326, "grad_norm": 0.6372292409084065, "learning_rate": 8.567968207259759e-06, "loss": 0.3464944839477539, "num_input_tokens_seen": 235380696, "step": 3875, "train_runtime": 50554.7986, "train_tokens_per_second": 4655.952 }, { "epoch": 0.49489795918367346, "grad_norm": 0.6023486727101804, "learning_rate": 8.564457371410139e-06, "loss": 0.3397261619567871, "num_input_tokens_seen": 235692760, "step": 3880, "train_runtime": 50612.5342, "train_tokens_per_second": 4656.806 }, { "epoch": 0.4955357142857143, "grad_norm": 0.6552499797293001, "learning_rate": 8.560942958378604e-06, "loss": 0.34970316886901853, "num_input_tokens_seen": 236001480, "step": 3885, "train_runtime": 50676.4157, "train_tokens_per_second": 4657.028 }, { "epoch": 0.4961734693877551, "grad_norm": 0.5336817905647219, "learning_rate": 8.557424971692117e-06, "loss": 0.35130982398986815, "num_input_tokens_seen": 236306648, "step": 3890, "train_runtime": 50747.1448, "train_tokens_per_second": 4656.551 }, { "epoch": 0.4968112244897959, "grad_norm": 0.5527697429127871, "learning_rate": 8.55390341488122e-06, "loss": 0.3193791389465332, "num_input_tokens_seen": 236604488, "step": 3895, "train_runtime": 50810.3713, "train_tokens_per_second": 4656.618 }, { "epoch": 0.49744897959183676, "grad_norm": 0.6175124900145508, "learning_rate": 8.550378291480041e-06, "loss": 0.3339862823486328, "num_input_tokens_seen": 236905912, "step": 3900, "train_runtime": 50871.7258, "train_tokens_per_second": 4656.927 }, { "epoch": 0.49808673469387754, "grad_norm": 0.6822366523915481, "learning_rate": 8.54684960502629e-06, "loss": 0.32977321147918703, "num_input_tokens_seen": 237197104, "step": 3905, "train_runtime": 50934.5909, "train_tokens_per_second": 4656.896 }, { "epoch": 0.4987244897959184, "grad_norm": 0.6573747525944167, "learning_rate": 8.543317359061247e-06, "loss": 0.32253079414367675, "num_input_tokens_seen": 237505528, "step": 3910, "train_runtime": 50996.1654, "train_tokens_per_second": 4657.321 }, { "epoch": 0.49936224489795916, "grad_norm": 0.6080138587125168, "learning_rate": 8.539781557129772e-06, "loss": 0.3567155361175537, "num_input_tokens_seen": 237813768, "step": 3915, "train_runtime": 51057.7262, "train_tokens_per_second": 4657.743 }, { "epoch": 0.5, "grad_norm": 0.6502081197077322, "learning_rate": 8.536242202780285e-06, "loss": 0.34138736724853513, "num_input_tokens_seen": 238128160, "step": 3920, "train_runtime": 51116.414, "train_tokens_per_second": 4658.546 }, { "epoch": 0.5006377551020408, "grad_norm": 0.6123351154071554, "learning_rate": 8.532699299564777e-06, "loss": 0.33693814277648926, "num_input_tokens_seen": 238424680, "step": 3925, "train_runtime": 51189.0324, "train_tokens_per_second": 4657.73 }, { "epoch": 0.5012755102040817, "grad_norm": 0.5962592524709964, "learning_rate": 8.529152851038798e-06, "loss": 0.3420262813568115, "num_input_tokens_seen": 238728160, "step": 3930, "train_runtime": 51248.7541, "train_tokens_per_second": 4658.224 }, { "epoch": 0.5019132653061225, "grad_norm": 0.6452137863780961, "learning_rate": 8.52560286076146e-06, "loss": 0.3414464473724365, "num_input_tokens_seen": 239026280, "step": 3935, "train_runtime": 51312.8956, "train_tokens_per_second": 4658.211 }, { "epoch": 0.5025510204081632, "grad_norm": 0.5286085457622516, "learning_rate": 8.522049332295421e-06, "loss": 0.3040300369262695, "num_input_tokens_seen": 239330112, "step": 3940, "train_runtime": 51375.0974, "train_tokens_per_second": 4658.485 }, { "epoch": 0.5031887755102041, "grad_norm": 0.5907977823780266, "learning_rate": 8.5184922692069e-06, "loss": 0.30737330913543703, "num_input_tokens_seen": 239623416, "step": 3945, "train_runtime": 51442.1079, "train_tokens_per_second": 4658.118 }, { "epoch": 0.5038265306122449, "grad_norm": 0.6253963561292852, "learning_rate": 8.514931675065654e-06, "loss": 0.34375686645507814, "num_input_tokens_seen": 239949088, "step": 3950, "train_runtime": 51497.1449, "train_tokens_per_second": 4659.464 }, { "epoch": 0.5044642857142857, "grad_norm": 0.5817830506603652, "learning_rate": 8.51136755344499e-06, "loss": 0.3413503646850586, "num_input_tokens_seen": 240249752, "step": 3955, "train_runtime": 51570.0528, "train_tokens_per_second": 4658.707 }, { "epoch": 0.5051020408163265, "grad_norm": 0.6140954907942193, "learning_rate": 8.507799907921754e-06, "loss": 0.34429771900177003, "num_input_tokens_seen": 240561680, "step": 3960, "train_runtime": 51634.5519, "train_tokens_per_second": 4658.928 }, { "epoch": 0.5057397959183674, "grad_norm": 0.6027612668326606, "learning_rate": 8.504228742076325e-06, "loss": 0.2996108055114746, "num_input_tokens_seen": 240872848, "step": 3965, "train_runtime": 51701.6938, "train_tokens_per_second": 4658.897 }, { "epoch": 0.5063775510204082, "grad_norm": 0.5832533965594051, "learning_rate": 8.500654059492618e-06, "loss": 0.3469754934310913, "num_input_tokens_seen": 241173696, "step": 3970, "train_runtime": 51772.4157, "train_tokens_per_second": 4658.343 }, { "epoch": 0.5070153061224489, "grad_norm": 0.598068625125809, "learning_rate": 8.497075863758079e-06, "loss": 0.33405184745788574, "num_input_tokens_seen": 241476848, "step": 3975, "train_runtime": 51826.4034, "train_tokens_per_second": 4659.34 }, { "epoch": 0.5076530612244898, "grad_norm": 0.6090274485920489, "learning_rate": 8.493494158463674e-06, "loss": 0.34064507484436035, "num_input_tokens_seen": 241769888, "step": 3980, "train_runtime": 51889.3028, "train_tokens_per_second": 4659.34 }, { "epoch": 0.5082908163265306, "grad_norm": 0.5764020632951243, "learning_rate": 8.489908947203897e-06, "loss": 0.32036867141723635, "num_input_tokens_seen": 242074176, "step": 3985, "train_runtime": 51952.744, "train_tokens_per_second": 4659.507 }, { "epoch": 0.5089285714285714, "grad_norm": 0.7242092475659759, "learning_rate": 8.486320233576757e-06, "loss": 0.33285179138183596, "num_input_tokens_seen": 242362680, "step": 3990, "train_runtime": 52017.5364, "train_tokens_per_second": 4659.249 }, { "epoch": 0.5095663265306123, "grad_norm": 0.6547031028417888, "learning_rate": 8.482728021183777e-06, "loss": 0.3297649145126343, "num_input_tokens_seen": 242654240, "step": 3995, "train_runtime": 52078.2091, "train_tokens_per_second": 4659.42 }, { "epoch": 0.5102040816326531, "grad_norm": 0.6358861563754288, "learning_rate": 8.479132313629996e-06, "loss": 0.3276358127593994, "num_input_tokens_seen": 242954720, "step": 4000, "train_runtime": 52148.0392, "train_tokens_per_second": 4658.943 }, { "epoch": 0.5108418367346939, "grad_norm": 0.5814639689939518, "learning_rate": 8.475533114523954e-06, "loss": 0.3316447019577026, "num_input_tokens_seen": 243266952, "step": 4005, "train_runtime": 52208.9272, "train_tokens_per_second": 4659.49 }, { "epoch": 0.5114795918367347, "grad_norm": 0.5811701828500324, "learning_rate": 8.471930427477704e-06, "loss": 0.34278225898742676, "num_input_tokens_seen": 243562512, "step": 4010, "train_runtime": 52274.7962, "train_tokens_per_second": 4659.272 }, { "epoch": 0.5121173469387755, "grad_norm": 0.8127426829512003, "learning_rate": 8.468324256106789e-06, "loss": 0.3474293231964111, "num_input_tokens_seen": 243867856, "step": 4015, "train_runtime": 52319.5304, "train_tokens_per_second": 4661.125 }, { "epoch": 0.5127551020408163, "grad_norm": 0.6079638254587282, "learning_rate": 8.464714604030256e-06, "loss": 0.3270159482955933, "num_input_tokens_seen": 244155792, "step": 4020, "train_runtime": 52377.0182, "train_tokens_per_second": 4661.506 }, { "epoch": 0.5133928571428571, "grad_norm": 0.6174658791855551, "learning_rate": 8.461101474870642e-06, "loss": 0.32132925987243655, "num_input_tokens_seen": 244454032, "step": 4025, "train_runtime": 52436.0585, "train_tokens_per_second": 4661.945 }, { "epoch": 0.514030612244898, "grad_norm": 0.6180605320426141, "learning_rate": 8.457484872253976e-06, "loss": 0.33786468505859374, "num_input_tokens_seen": 244756848, "step": 4030, "train_runtime": 52510.39, "train_tokens_per_second": 4661.113 }, { "epoch": 0.5146683673469388, "grad_norm": 0.6256830321428409, "learning_rate": 8.453864799809772e-06, "loss": 0.3316938877105713, "num_input_tokens_seen": 245066784, "step": 4035, "train_runtime": 52566.0158, "train_tokens_per_second": 4662.076 }, { "epoch": 0.5153061224489796, "grad_norm": 0.5528575316724593, "learning_rate": 8.450241261171022e-06, "loss": 0.3056922435760498, "num_input_tokens_seen": 245349960, "step": 4040, "train_runtime": 52633.982, "train_tokens_per_second": 4661.436 }, { "epoch": 0.5159438775510204, "grad_norm": 0.5701067986347147, "learning_rate": 8.446614259974201e-06, "loss": 0.3409639835357666, "num_input_tokens_seen": 245655704, "step": 4045, "train_runtime": 52695.1388, "train_tokens_per_second": 4661.829 }, { "epoch": 0.5165816326530612, "grad_norm": 0.5770814423382815, "learning_rate": 8.44298379985926e-06, "loss": 0.32842864990234377, "num_input_tokens_seen": 245951352, "step": 4050, "train_runtime": 52762.8471, "train_tokens_per_second": 4661.45 }, { "epoch": 0.517219387755102, "grad_norm": 0.583521188324923, "learning_rate": 8.439349884469621e-06, "loss": 0.32632737159729003, "num_input_tokens_seen": 246260984, "step": 4055, "train_runtime": 52838.9104, "train_tokens_per_second": 4660.599 }, { "epoch": 0.5178571428571429, "grad_norm": 0.5831683900063419, "learning_rate": 8.435712517452167e-06, "loss": 0.3498189926147461, "num_input_tokens_seen": 246580168, "step": 4060, "train_runtime": 52901.2621, "train_tokens_per_second": 4661.14 }, { "epoch": 0.5184948979591837, "grad_norm": 0.5860177840547365, "learning_rate": 8.432071702457253e-06, "loss": 0.32159740924835206, "num_input_tokens_seen": 246871632, "step": 4065, "train_runtime": 52971.5142, "train_tokens_per_second": 4660.46 }, { "epoch": 0.5191326530612245, "grad_norm": 0.6673405050973865, "learning_rate": 8.428427443138689e-06, "loss": 0.3185391426086426, "num_input_tokens_seen": 247174896, "step": 4070, "train_runtime": 53039.7347, "train_tokens_per_second": 4660.183 }, { "epoch": 0.5197704081632653, "grad_norm": 0.6459087480582097, "learning_rate": 8.424779743153747e-06, "loss": 0.3615418910980225, "num_input_tokens_seen": 247484000, "step": 4075, "train_runtime": 53117.8875, "train_tokens_per_second": 4659.146 }, { "epoch": 0.5204081632653061, "grad_norm": 0.6223924077912255, "learning_rate": 8.421128606163145e-06, "loss": 0.3403435230255127, "num_input_tokens_seen": 247782864, "step": 4080, "train_runtime": 53187.3932, "train_tokens_per_second": 4658.677 }, { "epoch": 0.5210459183673469, "grad_norm": 0.5813458681204556, "learning_rate": 8.417474035831055e-06, "loss": 0.3410142183303833, "num_input_tokens_seen": 248091320, "step": 4085, "train_runtime": 53263.6908, "train_tokens_per_second": 4657.794 }, { "epoch": 0.5216836734693877, "grad_norm": 0.6309334729105832, "learning_rate": 8.413816035825095e-06, "loss": 0.3152641296386719, "num_input_tokens_seen": 248381832, "step": 4090, "train_runtime": 53331.3353, "train_tokens_per_second": 4657.334 }, { "epoch": 0.5223214285714286, "grad_norm": 0.6204939129556473, "learning_rate": 8.410154609816324e-06, "loss": 0.3589243173599243, "num_input_tokens_seen": 248693944, "step": 4095, "train_runtime": 53394.4663, "train_tokens_per_second": 4657.673 }, { "epoch": 0.5229591836734694, "grad_norm": 0.6698042327208841, "learning_rate": 8.406489761479235e-06, "loss": 0.3444381237030029, "num_input_tokens_seen": 248989360, "step": 4100, "train_runtime": 53467.622, "train_tokens_per_second": 4656.825 }, { "epoch": 0.5235969387755102, "grad_norm": 0.650372763522801, "learning_rate": 8.402821494491762e-06, "loss": 0.3539252519607544, "num_input_tokens_seen": 249294192, "step": 4105, "train_runtime": 53525.2602, "train_tokens_per_second": 4657.505 }, { "epoch": 0.5242346938775511, "grad_norm": 1.0162701733297357, "learning_rate": 8.399149812535269e-06, "loss": 0.3387748718261719, "num_input_tokens_seen": 249599112, "step": 4110, "train_runtime": 53575.3695, "train_tokens_per_second": 4658.841 }, { "epoch": 0.5248724489795918, "grad_norm": 0.6059781273687016, "learning_rate": 8.395474719294541e-06, "loss": 0.3216937780380249, "num_input_tokens_seen": 249894528, "step": 4115, "train_runtime": 53633.1185, "train_tokens_per_second": 4659.332 }, { "epoch": 0.5255102040816326, "grad_norm": 0.6072738267997749, "learning_rate": 8.391796218457794e-06, "loss": 0.3277886390686035, "num_input_tokens_seen": 250198456, "step": 4120, "train_runtime": 53688.9453, "train_tokens_per_second": 4660.148 }, { "epoch": 0.5261479591836735, "grad_norm": 0.643469498851059, "learning_rate": 8.388114313716658e-06, "loss": 0.3698796510696411, "num_input_tokens_seen": 250505920, "step": 4125, "train_runtime": 53755.0758, "train_tokens_per_second": 4660.135 }, { "epoch": 0.5267857142857143, "grad_norm": 0.6000460110686265, "learning_rate": 8.384429008766183e-06, "loss": 0.34650416374206544, "num_input_tokens_seen": 250820328, "step": 4130, "train_runtime": 53817.1049, "train_tokens_per_second": 4660.606 }, { "epoch": 0.5274234693877551, "grad_norm": 0.6271119719393099, "learning_rate": 8.380740307304831e-06, "loss": 0.31575334072113037, "num_input_tokens_seen": 251122984, "step": 4135, "train_runtime": 53874.8542, "train_tokens_per_second": 4661.228 }, { "epoch": 0.5280612244897959, "grad_norm": 0.6179729508877755, "learning_rate": 8.377048213034469e-06, "loss": 0.3536393642425537, "num_input_tokens_seen": 251421264, "step": 4140, "train_runtime": 53949.6247, "train_tokens_per_second": 4660.297 }, { "epoch": 0.5286989795918368, "grad_norm": 0.6090342687776809, "learning_rate": 8.373352729660373e-06, "loss": 0.35466365814208983, "num_input_tokens_seen": 251730568, "step": 4145, "train_runtime": 54022.3122, "train_tokens_per_second": 4659.752 }, { "epoch": 0.5293367346938775, "grad_norm": 0.5617293491551522, "learning_rate": 8.369653860891218e-06, "loss": 0.3340321063995361, "num_input_tokens_seen": 252036272, "step": 4150, "train_runtime": 54088.5695, "train_tokens_per_second": 4659.696 }, { "epoch": 0.5299744897959183, "grad_norm": 0.5556872361827987, "learning_rate": 8.365951610439078e-06, "loss": 0.3348118543624878, "num_input_tokens_seen": 252339592, "step": 4155, "train_runtime": 54144.2236, "train_tokens_per_second": 4660.508 }, { "epoch": 0.5306122448979592, "grad_norm": 0.6216737414602903, "learning_rate": 8.362245982019419e-06, "loss": 0.3383298397064209, "num_input_tokens_seen": 252647808, "step": 4160, "train_runtime": 54195.123, "train_tokens_per_second": 4661.818 }, { "epoch": 0.53125, "grad_norm": 0.580657736022884, "learning_rate": 8.358536979351098e-06, "loss": 0.3288172721862793, "num_input_tokens_seen": 252955704, "step": 4165, "train_runtime": 54255.6952, "train_tokens_per_second": 4662.289 }, { "epoch": 0.5318877551020408, "grad_norm": 0.7030259938621994, "learning_rate": 8.35482460615636e-06, "loss": 0.33261590003967284, "num_input_tokens_seen": 253256544, "step": 4170, "train_runtime": 54331.9484, "train_tokens_per_second": 4661.282 }, { "epoch": 0.5325255102040817, "grad_norm": 0.5128588950764369, "learning_rate": 8.351108866160827e-06, "loss": 0.3089122295379639, "num_input_tokens_seen": 253562032, "step": 4175, "train_runtime": 54395.0345, "train_tokens_per_second": 4661.492 }, { "epoch": 0.5331632653061225, "grad_norm": 0.5722884092944742, "learning_rate": 8.347389763093507e-06, "loss": 0.3515080213546753, "num_input_tokens_seen": 253862712, "step": 4180, "train_runtime": 54455.6775, "train_tokens_per_second": 4661.823 }, { "epoch": 0.5338010204081632, "grad_norm": 0.7257019076609187, "learning_rate": 8.34366730068678e-06, "loss": 0.3021442651748657, "num_input_tokens_seen": 254178096, "step": 4185, "train_runtime": 54522.9841, "train_tokens_per_second": 4661.852 }, { "epoch": 0.5344387755102041, "grad_norm": 0.618143234739904, "learning_rate": 8.339941482676394e-06, "loss": 0.3398129940032959, "num_input_tokens_seen": 254472504, "step": 4190, "train_runtime": 54596.9337, "train_tokens_per_second": 4660.93 }, { "epoch": 0.5350765306122449, "grad_norm": 0.6401486806740152, "learning_rate": 8.336212312801469e-06, "loss": 0.33443522453308105, "num_input_tokens_seen": 254780208, "step": 4195, "train_runtime": 54646.4304, "train_tokens_per_second": 4662.339 }, { "epoch": 0.5357142857142857, "grad_norm": 0.5832593997249361, "learning_rate": 8.332479794804489e-06, "loss": 0.32670321464538576, "num_input_tokens_seen": 255088280, "step": 4200, "train_runtime": 54722.0812, "train_tokens_per_second": 4661.524 }, { "epoch": 0.5363520408163265, "grad_norm": 0.6243660356934823, "learning_rate": 8.328743932431293e-06, "loss": 0.3391838312149048, "num_input_tokens_seen": 255398952, "step": 4205, "train_runtime": 54782.111, "train_tokens_per_second": 4662.087 }, { "epoch": 0.5369897959183674, "grad_norm": 0.595061368256599, "learning_rate": 8.325004729431083e-06, "loss": 0.33151419162750245, "num_input_tokens_seen": 255709048, "step": 4210, "train_runtime": 54840.549, "train_tokens_per_second": 4662.773 }, { "epoch": 0.5376275510204082, "grad_norm": 0.6589900199646409, "learning_rate": 8.32126218955641e-06, "loss": 0.32023797035217283, "num_input_tokens_seen": 256007488, "step": 4215, "train_runtime": 54913.8178, "train_tokens_per_second": 4661.987 }, { "epoch": 0.5382653061224489, "grad_norm": 0.5688734747502078, "learning_rate": 8.317516316563172e-06, "loss": 0.33050549030303955, "num_input_tokens_seen": 256312784, "step": 4220, "train_runtime": 54976.3523, "train_tokens_per_second": 4662.237 }, { "epoch": 0.5389030612244898, "grad_norm": 0.6100360803622228, "learning_rate": 8.313767114210615e-06, "loss": 0.3239306449890137, "num_input_tokens_seen": 256610864, "step": 4225, "train_runtime": 55043.8192, "train_tokens_per_second": 4661.938 }, { "epoch": 0.5395408163265306, "grad_norm": 0.6329495549647348, "learning_rate": 8.310014586261329e-06, "loss": 0.32516295909881593, "num_input_tokens_seen": 256905128, "step": 4230, "train_runtime": 55117.4109, "train_tokens_per_second": 4661.052 }, { "epoch": 0.5401785714285714, "grad_norm": 0.5788937358176532, "learning_rate": 8.306258736481231e-06, "loss": 0.321623706817627, "num_input_tokens_seen": 257220440, "step": 4235, "train_runtime": 55167.3251, "train_tokens_per_second": 4662.551 }, { "epoch": 0.5408163265306123, "grad_norm": 0.6166029813273239, "learning_rate": 8.302499568639583e-06, "loss": 0.3558704376220703, "num_input_tokens_seen": 257529992, "step": 4240, "train_runtime": 55227.6824, "train_tokens_per_second": 4663.06 }, { "epoch": 0.5414540816326531, "grad_norm": 0.5913914207581168, "learning_rate": 8.298737086508973e-06, "loss": 0.3280658721923828, "num_input_tokens_seen": 257830008, "step": 4245, "train_runtime": 55291.8955, "train_tokens_per_second": 4663.071 }, { "epoch": 0.5420918367346939, "grad_norm": 0.5743530312209789, "learning_rate": 8.294971293865315e-06, "loss": 0.32333903312683104, "num_input_tokens_seen": 258134680, "step": 4250, "train_runtime": 55363.3988, "train_tokens_per_second": 4662.551 }, { "epoch": 0.5427295918367347, "grad_norm": 0.5742413186288639, "learning_rate": 8.29120219448784e-06, "loss": 0.337364649772644, "num_input_tokens_seen": 258440416, "step": 4255, "train_runtime": 55434.4475, "train_tokens_per_second": 4662.091 }, { "epoch": 0.5433673469387755, "grad_norm": 0.6395149410799369, "learning_rate": 8.287429792159108e-06, "loss": 0.33406877517700195, "num_input_tokens_seen": 258733896, "step": 4260, "train_runtime": 55507.5119, "train_tokens_per_second": 4661.241 }, { "epoch": 0.5440051020408163, "grad_norm": 0.6090939041497327, "learning_rate": 8.283654090664986e-06, "loss": 0.32870163917541506, "num_input_tokens_seen": 259042576, "step": 4265, "train_runtime": 55576.4895, "train_tokens_per_second": 4661.01 }, { "epoch": 0.5446428571428571, "grad_norm": 0.6445881345465262, "learning_rate": 8.279875093794652e-06, "loss": 0.3245696544647217, "num_input_tokens_seen": 259348728, "step": 4270, "train_runtime": 55644.9794, "train_tokens_per_second": 4660.775 }, { "epoch": 0.545280612244898, "grad_norm": 0.603234032732469, "learning_rate": 8.276092805340596e-06, "loss": 0.35511810779571534, "num_input_tokens_seen": 259651088, "step": 4275, "train_runtime": 55706.7744, "train_tokens_per_second": 4661.033 }, { "epoch": 0.5459183673469388, "grad_norm": 0.6818970361684568, "learning_rate": 8.27230722909861e-06, "loss": 0.3598794460296631, "num_input_tokens_seen": 259958224, "step": 4280, "train_runtime": 55768.5734, "train_tokens_per_second": 4661.375 }, { "epoch": 0.5465561224489796, "grad_norm": 0.6505327242995605, "learning_rate": 8.268518368867781e-06, "loss": 0.33161163330078125, "num_input_tokens_seen": 260251048, "step": 4285, "train_runtime": 55833.9926, "train_tokens_per_second": 4661.158 }, { "epoch": 0.5471938775510204, "grad_norm": 0.6111247630488971, "learning_rate": 8.264726228450495e-06, "loss": 0.3262234449386597, "num_input_tokens_seen": 260554448, "step": 4290, "train_runtime": 55905.2245, "train_tokens_per_second": 4660.646 }, { "epoch": 0.5478316326530612, "grad_norm": 0.560187020542292, "learning_rate": 8.260930811652433e-06, "loss": 0.30494074821472167, "num_input_tokens_seen": 260860120, "step": 4295, "train_runtime": 55974.5718, "train_tokens_per_second": 4660.333 }, { "epoch": 0.548469387755102, "grad_norm": 0.6556376956868236, "learning_rate": 8.257132122282557e-06, "loss": 0.3426995754241943, "num_input_tokens_seen": 261152392, "step": 4300, "train_runtime": 56040.4177, "train_tokens_per_second": 4660.072 }, { "epoch": 0.5491071428571429, "grad_norm": 1.2172845913803712, "learning_rate": 8.253330164153118e-06, "loss": 0.35701465606689453, "num_input_tokens_seen": 261458776, "step": 4305, "train_runtime": 56103.0496, "train_tokens_per_second": 4660.331 }, { "epoch": 0.5497448979591837, "grad_norm": 0.6008391817753075, "learning_rate": 8.24952494107965e-06, "loss": 0.3199004650115967, "num_input_tokens_seen": 261748456, "step": 4310, "train_runtime": 56174.9237, "train_tokens_per_second": 4659.525 }, { "epoch": 0.5503826530612245, "grad_norm": 0.6256053884342111, "learning_rate": 8.245716456880954e-06, "loss": 0.32810063362121583, "num_input_tokens_seen": 262052304, "step": 4315, "train_runtime": 56244.5277, "train_tokens_per_second": 4659.161 }, { "epoch": 0.5510204081632653, "grad_norm": 0.5756480132256692, "learning_rate": 8.241904715379115e-06, "loss": 0.30528922080993653, "num_input_tokens_seen": 262339992, "step": 4320, "train_runtime": 56310.5372, "train_tokens_per_second": 4658.808 }, { "epoch": 0.5516581632653061, "grad_norm": 0.7898428422930921, "learning_rate": 8.23808972039948e-06, "loss": 0.3237664222717285, "num_input_tokens_seen": 262641960, "step": 4325, "train_runtime": 56385.1224, "train_tokens_per_second": 4658.001 }, { "epoch": 0.5522959183673469, "grad_norm": 0.6306552080612552, "learning_rate": 8.234271475770662e-06, "loss": 0.345841646194458, "num_input_tokens_seen": 262946000, "step": 4330, "train_runtime": 56445.266, "train_tokens_per_second": 4658.424 }, { "epoch": 0.5529336734693877, "grad_norm": 0.6090517723682343, "learning_rate": 8.230449985324538e-06, "loss": 0.35211758613586425, "num_input_tokens_seen": 263244136, "step": 4335, "train_runtime": 56497.7456, "train_tokens_per_second": 4659.374 }, { "epoch": 0.5535714285714286, "grad_norm": 0.6726399178350145, "learning_rate": 8.226625252896239e-06, "loss": 0.3599707126617432, "num_input_tokens_seen": 263558408, "step": 4340, "train_runtime": 56558.7384, "train_tokens_per_second": 4659.906 }, { "epoch": 0.5542091836734694, "grad_norm": 0.6354251802729429, "learning_rate": 8.222797282324152e-06, "loss": 0.34988815784454347, "num_input_tokens_seen": 263867960, "step": 4345, "train_runtime": 56624.2854, "train_tokens_per_second": 4659.979 }, { "epoch": 0.5548469387755102, "grad_norm": 0.5856782387382612, "learning_rate": 8.218966077449912e-06, "loss": 0.31808695793151853, "num_input_tokens_seen": 264172056, "step": 4350, "train_runtime": 56694.3273, "train_tokens_per_second": 4659.585 }, { "epoch": 0.5554846938775511, "grad_norm": 0.6182070325857266, "learning_rate": 8.215131642118401e-06, "loss": 0.32405288219451905, "num_input_tokens_seen": 264484880, "step": 4355, "train_runtime": 56748.976, "train_tokens_per_second": 4660.611 }, { "epoch": 0.5561224489795918, "grad_norm": 0.6757059490288188, "learning_rate": 8.211293980177744e-06, "loss": 0.34016482830047606, "num_input_tokens_seen": 264784920, "step": 4360, "train_runtime": 56812.2188, "train_tokens_per_second": 4660.704 }, { "epoch": 0.5567602040816326, "grad_norm": 0.6197881883465047, "learning_rate": 8.2074530954793e-06, "loss": 0.3228370904922485, "num_input_tokens_seen": 265087688, "step": 4365, "train_runtime": 56878.7717, "train_tokens_per_second": 4660.573 }, { "epoch": 0.5573979591836735, "grad_norm": 0.7030021254750853, "learning_rate": 8.203608991877669e-06, "loss": 0.33140063285827637, "num_input_tokens_seen": 265373784, "step": 4370, "train_runtime": 56943.0178, "train_tokens_per_second": 4660.339 }, { "epoch": 0.5580357142857143, "grad_norm": 0.5653275803125225, "learning_rate": 8.199761673230674e-06, "loss": 0.3155759334564209, "num_input_tokens_seen": 265686896, "step": 4375, "train_runtime": 57007.7207, "train_tokens_per_second": 4660.542 }, { "epoch": 0.5586734693877551, "grad_norm": 0.6345660325552052, "learning_rate": 8.195911143399368e-06, "loss": 0.3315152168273926, "num_input_tokens_seen": 265979352, "step": 4380, "train_runtime": 57074.253, "train_tokens_per_second": 4660.234 }, { "epoch": 0.5593112244897959, "grad_norm": 0.5627906489416599, "learning_rate": 8.192057406248028e-06, "loss": 0.3102290153503418, "num_input_tokens_seen": 266271928, "step": 4385, "train_runtime": 57134.1088, "train_tokens_per_second": 4660.472 }, { "epoch": 0.5599489795918368, "grad_norm": 0.6191145572605166, "learning_rate": 8.18820046564415e-06, "loss": 0.33108863830566404, "num_input_tokens_seen": 266577400, "step": 4390, "train_runtime": 57191.0161, "train_tokens_per_second": 4661.176 }, { "epoch": 0.5605867346938775, "grad_norm": 0.5960521522944929, "learning_rate": 8.184340325458439e-06, "loss": 0.3300520658493042, "num_input_tokens_seen": 266880024, "step": 4395, "train_runtime": 57250.013, "train_tokens_per_second": 4661.659 }, { "epoch": 0.5612244897959183, "grad_norm": 0.5831245845951161, "learning_rate": 8.180476989564818e-06, "loss": 0.3358687162399292, "num_input_tokens_seen": 267187080, "step": 4400, "train_runtime": 57312.1615, "train_tokens_per_second": 4661.961 }, { "epoch": 0.5618622448979592, "grad_norm": 0.566574126965116, "learning_rate": 8.176610461840415e-06, "loss": 0.33371782302856445, "num_input_tokens_seen": 267483488, "step": 4405, "train_runtime": 57382.3321, "train_tokens_per_second": 4661.426 }, { "epoch": 0.5625, "grad_norm": 0.6386464348029305, "learning_rate": 8.17274074616556e-06, "loss": 0.34981279373168944, "num_input_tokens_seen": 267778744, "step": 4410, "train_runtime": 57439.8382, "train_tokens_per_second": 4661.899 }, { "epoch": 0.5631377551020408, "grad_norm": 0.6265982841558887, "learning_rate": 8.16886784642378e-06, "loss": 0.3423975229263306, "num_input_tokens_seen": 268078000, "step": 4415, "train_runtime": 57512.1122, "train_tokens_per_second": 4661.244 }, { "epoch": 0.5637755102040817, "grad_norm": 0.6213852571279617, "learning_rate": 8.164991766501804e-06, "loss": 0.3394098997116089, "num_input_tokens_seen": 268384416, "step": 4420, "train_runtime": 57582.4629, "train_tokens_per_second": 4660.871 }, { "epoch": 0.5644132653061225, "grad_norm": 0.6432331774316757, "learning_rate": 8.16111251028955e-06, "loss": 0.315293288230896, "num_input_tokens_seen": 268675008, "step": 4425, "train_runtime": 57650.6913, "train_tokens_per_second": 4660.395 }, { "epoch": 0.5650510204081632, "grad_norm": 0.6143902666347689, "learning_rate": 8.157230081680118e-06, "loss": 0.32767605781555176, "num_input_tokens_seen": 268986712, "step": 4430, "train_runtime": 57710.5038, "train_tokens_per_second": 4660.966 }, { "epoch": 0.5656887755102041, "grad_norm": 0.5563706398159549, "learning_rate": 8.153344484569798e-06, "loss": 0.34493412971496584, "num_input_tokens_seen": 269287992, "step": 4435, "train_runtime": 57778.1765, "train_tokens_per_second": 4660.722 }, { "epoch": 0.5663265306122449, "grad_norm": 0.6450219066178285, "learning_rate": 8.14945572285806e-06, "loss": 0.34345855712890627, "num_input_tokens_seen": 269589840, "step": 4440, "train_runtime": 57836.4873, "train_tokens_per_second": 4661.242 }, { "epoch": 0.5669642857142857, "grad_norm": 0.6177947769403859, "learning_rate": 8.145563800447547e-06, "loss": 0.3244961738586426, "num_input_tokens_seen": 269897656, "step": 4445, "train_runtime": 57894.8442, "train_tokens_per_second": 4661.86 }, { "epoch": 0.5676020408163265, "grad_norm": 0.6674494880750335, "learning_rate": 8.141668721244073e-06, "loss": 0.33897535800933837, "num_input_tokens_seen": 270205176, "step": 4450, "train_runtime": 57957.129, "train_tokens_per_second": 4662.156 }, { "epoch": 0.5682397959183674, "grad_norm": 0.6399848039940615, "learning_rate": 8.137770489156624e-06, "loss": 0.32180759906768797, "num_input_tokens_seen": 270504888, "step": 4455, "train_runtime": 58018.3077, "train_tokens_per_second": 4662.406 }, { "epoch": 0.5688775510204082, "grad_norm": 0.578493062949667, "learning_rate": 8.133869108097349e-06, "loss": 0.31485824584960936, "num_input_tokens_seen": 270817528, "step": 4460, "train_runtime": 58078.3445, "train_tokens_per_second": 4662.969 }, { "epoch": 0.5695153061224489, "grad_norm": 0.626719750726604, "learning_rate": 8.129964581981554e-06, "loss": 0.3301039934158325, "num_input_tokens_seen": 271113568, "step": 4465, "train_runtime": 58144.7076, "train_tokens_per_second": 4662.739 }, { "epoch": 0.5701530612244898, "grad_norm": 0.6595078436656858, "learning_rate": 8.126056914727705e-06, "loss": 0.34999229907989504, "num_input_tokens_seen": 271422464, "step": 4470, "train_runtime": 58203.5296, "train_tokens_per_second": 4663.333 }, { "epoch": 0.5707908163265306, "grad_norm": 0.6950368995093762, "learning_rate": 8.122146110257419e-06, "loss": 0.343953537940979, "num_input_tokens_seen": 271721272, "step": 4475, "train_runtime": 58267.0338, "train_tokens_per_second": 4663.379 }, { "epoch": 0.5714285714285714, "grad_norm": 0.6180965739348507, "learning_rate": 8.11823217249546e-06, "loss": 0.3216872692108154, "num_input_tokens_seen": 272032224, "step": 4480, "train_runtime": 58338.5044, "train_tokens_per_second": 4662.996 }, { "epoch": 0.5720663265306123, "grad_norm": 0.5269746753228531, "learning_rate": 8.114315105369739e-06, "loss": 0.34439973831176757, "num_input_tokens_seen": 272342792, "step": 4485, "train_runtime": 58395.7931, "train_tokens_per_second": 4663.74 }, { "epoch": 0.5727040816326531, "grad_norm": 0.643538393285888, "learning_rate": 8.110394912811308e-06, "loss": 0.3304832935333252, "num_input_tokens_seen": 272647752, "step": 4490, "train_runtime": 58453.5655, "train_tokens_per_second": 4664.348 }, { "epoch": 0.5733418367346939, "grad_norm": 0.5933974245973419, "learning_rate": 8.106471598754353e-06, "loss": 0.3181920528411865, "num_input_tokens_seen": 272952752, "step": 4495, "train_runtime": 58511.3847, "train_tokens_per_second": 4664.951 }, { "epoch": 0.5739795918367347, "grad_norm": 0.6545169706021291, "learning_rate": 8.102545167136191e-06, "loss": 0.3237417221069336, "num_input_tokens_seen": 273259992, "step": 4500, "train_runtime": 58568.2779, "train_tokens_per_second": 4665.665 }, { "epoch": 0.5746173469387755, "grad_norm": 0.5676528809317268, "learning_rate": 8.098615621897272e-06, "loss": 0.3160714626312256, "num_input_tokens_seen": 273546088, "step": 4505, "train_runtime": 58635.3904, "train_tokens_per_second": 4665.205 }, { "epoch": 0.5752551020408163, "grad_norm": 0.5457134346155577, "learning_rate": 8.094682966981172e-06, "loss": 0.3343855142593384, "num_input_tokens_seen": 273846816, "step": 4510, "train_runtime": 58701.6981, "train_tokens_per_second": 4665.058 }, { "epoch": 0.5758928571428571, "grad_norm": 0.6021407602482653, "learning_rate": 8.090747206334582e-06, "loss": 0.30679736137390134, "num_input_tokens_seen": 274148336, "step": 4515, "train_runtime": 58763.4119, "train_tokens_per_second": 4665.29 }, { "epoch": 0.576530612244898, "grad_norm": 0.6363908329815029, "learning_rate": 8.086808343907313e-06, "loss": 0.3471099853515625, "num_input_tokens_seen": 274448928, "step": 4520, "train_runtime": 58814.3425, "train_tokens_per_second": 4666.361 }, { "epoch": 0.5771683673469388, "grad_norm": 0.5719847354063033, "learning_rate": 8.082866383652288e-06, "loss": 0.31707210540771485, "num_input_tokens_seen": 274760712, "step": 4525, "train_runtime": 58878.8956, "train_tokens_per_second": 4666.54 }, { "epoch": 0.5778061224489796, "grad_norm": 0.5920024664008375, "learning_rate": 8.07892132952554e-06, "loss": 0.3436100482940674, "num_input_tokens_seen": 275066192, "step": 4530, "train_runtime": 58954.14, "train_tokens_per_second": 4665.765 }, { "epoch": 0.5784438775510204, "grad_norm": 0.6934804408029586, "learning_rate": 8.074973185486206e-06, "loss": 0.3058030128479004, "num_input_tokens_seen": 275363072, "step": 4535, "train_runtime": 59010.6635, "train_tokens_per_second": 4666.327 }, { "epoch": 0.5790816326530612, "grad_norm": 0.5999272012793515, "learning_rate": 8.071021955496526e-06, "loss": 0.34128503799438475, "num_input_tokens_seen": 275663040, "step": 4540, "train_runtime": 59078.8766, "train_tokens_per_second": 4666.017 }, { "epoch": 0.579719387755102, "grad_norm": 0.5679709245220098, "learning_rate": 8.067067643521834e-06, "loss": 0.3404224872589111, "num_input_tokens_seen": 275975912, "step": 4545, "train_runtime": 59135.0954, "train_tokens_per_second": 4666.872 }, { "epoch": 0.5803571428571429, "grad_norm": 0.664053925117659, "learning_rate": 8.063110253530557e-06, "loss": 0.3541407108306885, "num_input_tokens_seen": 276277248, "step": 4550, "train_runtime": 59204.7878, "train_tokens_per_second": 4666.468 }, { "epoch": 0.5809948979591837, "grad_norm": 1.4570603403507616, "learning_rate": 8.059149789494215e-06, "loss": 0.32312707901000975, "num_input_tokens_seen": 276556904, "step": 4555, "train_runtime": 59269.0289, "train_tokens_per_second": 4666.128 }, { "epoch": 0.5816326530612245, "grad_norm": 0.6241014199416344, "learning_rate": 8.055186255387409e-06, "loss": 0.3319542646408081, "num_input_tokens_seen": 276857984, "step": 4560, "train_runtime": 59344.3973, "train_tokens_per_second": 4665.276 }, { "epoch": 0.5822704081632653, "grad_norm": 0.6554170093325126, "learning_rate": 8.051219655187818e-06, "loss": 0.3470942974090576, "num_input_tokens_seen": 277177000, "step": 4565, "train_runtime": 59406.8529, "train_tokens_per_second": 4665.741 }, { "epoch": 0.5829081632653061, "grad_norm": 0.7260344299114648, "learning_rate": 8.04724999287621e-06, "loss": 0.33258297443389895, "num_input_tokens_seen": 277478560, "step": 4570, "train_runtime": 59479.697, "train_tokens_per_second": 4665.097 }, { "epoch": 0.5835459183673469, "grad_norm": 0.5684570794452062, "learning_rate": 8.043277272436415e-06, "loss": 0.3166254997253418, "num_input_tokens_seen": 277781656, "step": 4575, "train_runtime": 59541.3895, "train_tokens_per_second": 4665.354 }, { "epoch": 0.5841836734693877, "grad_norm": 0.6025307167484164, "learning_rate": 8.039301497855331e-06, "loss": 0.3375540733337402, "num_input_tokens_seen": 278074920, "step": 4580, "train_runtime": 59605.1089, "train_tokens_per_second": 4665.287 }, { "epoch": 0.5848214285714286, "grad_norm": 0.6353710410028152, "learning_rate": 8.035322673122934e-06, "loss": 0.33584496974945066, "num_input_tokens_seen": 278385592, "step": 4585, "train_runtime": 59672.671, "train_tokens_per_second": 4665.211 }, { "epoch": 0.5854591836734694, "grad_norm": 0.5749678021350256, "learning_rate": 8.031340802232246e-06, "loss": 0.3267554044723511, "num_input_tokens_seen": 278690728, "step": 4590, "train_runtime": 59743.6738, "train_tokens_per_second": 4664.774 }, { "epoch": 0.5860969387755102, "grad_norm": 0.6351825933927931, "learning_rate": 8.027355889179356e-06, "loss": 0.33541412353515626, "num_input_tokens_seen": 278997912, "step": 4595, "train_runtime": 59803.038, "train_tokens_per_second": 4665.28 }, { "epoch": 0.5867346938775511, "grad_norm": 0.6412443966760725, "learning_rate": 8.0233679379634e-06, "loss": 0.3400087833404541, "num_input_tokens_seen": 279300264, "step": 4600, "train_runtime": 59876.0884, "train_tokens_per_second": 4664.638 }, { "epoch": 0.5873724489795918, "grad_norm": 0.5716880259212794, "learning_rate": 8.019376952586567e-06, "loss": 0.3251744270324707, "num_input_tokens_seen": 279603888, "step": 4605, "train_runtime": 59946.8549, "train_tokens_per_second": 4664.196 }, { "epoch": 0.5880102040816326, "grad_norm": 0.6149445066272312, "learning_rate": 8.01538293705409e-06, "loss": 0.34337458610534666, "num_input_tokens_seen": 279902336, "step": 4610, "train_runtime": 60009.1595, "train_tokens_per_second": 4664.327 }, { "epoch": 0.5886479591836735, "grad_norm": 0.6434618638162447, "learning_rate": 8.011385895374239e-06, "loss": 0.3512176752090454, "num_input_tokens_seen": 280206616, "step": 4615, "train_runtime": 60079.2758, "train_tokens_per_second": 4663.948 }, { "epoch": 0.5892857142857143, "grad_norm": 0.5872883115017938, "learning_rate": 8.007385831558329e-06, "loss": 0.3329361915588379, "num_input_tokens_seen": 280506992, "step": 4620, "train_runtime": 60150.8363, "train_tokens_per_second": 4663.393 }, { "epoch": 0.5899234693877551, "grad_norm": 0.554868862354082, "learning_rate": 8.003382749620704e-06, "loss": 0.3576455593109131, "num_input_tokens_seen": 280808544, "step": 4625, "train_runtime": 60230.8059, "train_tokens_per_second": 4662.208 }, { "epoch": 0.5905612244897959, "grad_norm": 0.5553576132935054, "learning_rate": 7.99937665357873e-06, "loss": 0.3338657855987549, "num_input_tokens_seen": 281115176, "step": 4630, "train_runtime": 60292.4288, "train_tokens_per_second": 4662.529 }, { "epoch": 0.5911989795918368, "grad_norm": 0.5674501935313173, "learning_rate": 7.995367547452811e-06, "loss": 0.30156421661376953, "num_input_tokens_seen": 281402488, "step": 4635, "train_runtime": 60357.7686, "train_tokens_per_second": 4662.241 }, { "epoch": 0.5918367346938775, "grad_norm": 0.5802911571097128, "learning_rate": 7.991355435266362e-06, "loss": 0.334645938873291, "num_input_tokens_seen": 281710624, "step": 4640, "train_runtime": 60421.3044, "train_tokens_per_second": 4662.439 }, { "epoch": 0.5924744897959183, "grad_norm": 0.6349513802375457, "learning_rate": 7.987340321045816e-06, "loss": 0.3482946872711182, "num_input_tokens_seen": 282012216, "step": 4645, "train_runtime": 60485.0048, "train_tokens_per_second": 4662.515 }, { "epoch": 0.5931122448979592, "grad_norm": 0.5573471217513042, "learning_rate": 7.983322208820624e-06, "loss": 0.33052778244018555, "num_input_tokens_seen": 282306456, "step": 4650, "train_runtime": 60555.3502, "train_tokens_per_second": 4661.957 }, { "epoch": 0.59375, "grad_norm": 0.6602647431954177, "learning_rate": 7.97930110262324e-06, "loss": 0.375149130821228, "num_input_tokens_seen": 282621480, "step": 4655, "train_runtime": 60609.0158, "train_tokens_per_second": 4663.027 }, { "epoch": 0.5943877551020408, "grad_norm": 0.6595985885235768, "learning_rate": 7.975277006489126e-06, "loss": 0.3693304300308228, "num_input_tokens_seen": 282926240, "step": 4660, "train_runtime": 60663.4131, "train_tokens_per_second": 4663.869 }, { "epoch": 0.5950255102040817, "grad_norm": 0.5684116290932937, "learning_rate": 7.971249924456742e-06, "loss": 0.3131096839904785, "num_input_tokens_seen": 283222512, "step": 4665, "train_runtime": 60732.2967, "train_tokens_per_second": 4663.458 }, { "epoch": 0.5956632653061225, "grad_norm": 0.6221996859576358, "learning_rate": 7.967219860567547e-06, "loss": 0.3460294008255005, "num_input_tokens_seen": 283518112, "step": 4670, "train_runtime": 60790.6214, "train_tokens_per_second": 4663.846 }, { "epoch": 0.5963010204081632, "grad_norm": 0.6320786766100532, "learning_rate": 7.963186818865993e-06, "loss": 0.33358302116394045, "num_input_tokens_seen": 283805976, "step": 4675, "train_runtime": 60864.1233, "train_tokens_per_second": 4662.944 }, { "epoch": 0.5969387755102041, "grad_norm": 0.6376403103388871, "learning_rate": 7.959150803399519e-06, "loss": 0.33843064308166504, "num_input_tokens_seen": 284115784, "step": 4680, "train_runtime": 60931.736, "train_tokens_per_second": 4662.854 }, { "epoch": 0.5975765306122449, "grad_norm": 0.6224191853678193, "learning_rate": 7.955111818218544e-06, "loss": 0.33420662879943847, "num_input_tokens_seen": 284410904, "step": 4685, "train_runtime": 61012.3022, "train_tokens_per_second": 4661.534 }, { "epoch": 0.5982142857142857, "grad_norm": 0.6193691805387954, "learning_rate": 7.951069867376477e-06, "loss": 0.3390709638595581, "num_input_tokens_seen": 284725216, "step": 4690, "train_runtime": 61079.6857, "train_tokens_per_second": 4661.537 }, { "epoch": 0.5988520408163265, "grad_norm": 0.646227711037228, "learning_rate": 7.947024954929696e-06, "loss": 0.35746586322784424, "num_input_tokens_seen": 285031680, "step": 4695, "train_runtime": 61143.8269, "train_tokens_per_second": 4661.659 }, { "epoch": 0.5994897959183674, "grad_norm": 0.6740064328926865, "learning_rate": 7.942977084937552e-06, "loss": 0.32452802658081054, "num_input_tokens_seen": 285330936, "step": 4700, "train_runtime": 61207.4163, "train_tokens_per_second": 4661.705 }, { "epoch": 0.6001275510204082, "grad_norm": 0.6473059340262228, "learning_rate": 7.938926261462366e-06, "loss": 0.3147572040557861, "num_input_tokens_seen": 285641568, "step": 4705, "train_runtime": 61269.392, "train_tokens_per_second": 4662.06 }, { "epoch": 0.6007653061224489, "grad_norm": 0.6293561266830001, "learning_rate": 7.934872488569423e-06, "loss": 0.3319873809814453, "num_input_tokens_seen": 285940128, "step": 4710, "train_runtime": 61341.2258, "train_tokens_per_second": 4661.467 }, { "epoch": 0.6014030612244898, "grad_norm": 0.6755563851553431, "learning_rate": 7.930815770326968e-06, "loss": 0.3462022304534912, "num_input_tokens_seen": 286236152, "step": 4715, "train_runtime": 61406.0953, "train_tokens_per_second": 4661.364 }, { "epoch": 0.6020408163265306, "grad_norm": 0.5858959645393711, "learning_rate": 7.926756110806197e-06, "loss": 0.30179471969604493, "num_input_tokens_seen": 286540184, "step": 4720, "train_runtime": 61461.7461, "train_tokens_per_second": 4662.09 }, { "epoch": 0.6026785714285714, "grad_norm": 0.6666598087218537, "learning_rate": 7.922693514081267e-06, "loss": 0.33141958713531494, "num_input_tokens_seen": 286833736, "step": 4725, "train_runtime": 61520.0469, "train_tokens_per_second": 4662.443 }, { "epoch": 0.6033163265306123, "grad_norm": 0.6391942747513293, "learning_rate": 7.918627984229274e-06, "loss": 0.338878870010376, "num_input_tokens_seen": 287138016, "step": 4730, "train_runtime": 61581.6349, "train_tokens_per_second": 4662.722 }, { "epoch": 0.6039540816326531, "grad_norm": 0.6113485497108972, "learning_rate": 7.914559525330262e-06, "loss": 0.35114235877990724, "num_input_tokens_seen": 287450896, "step": 4735, "train_runtime": 61643.7397, "train_tokens_per_second": 4663.1 }, { "epoch": 0.6045918367346939, "grad_norm": 0.5644556364920948, "learning_rate": 7.910488141467215e-06, "loss": 0.330631947517395, "num_input_tokens_seen": 287761752, "step": 4740, "train_runtime": 61701.008, "train_tokens_per_second": 4663.81 }, { "epoch": 0.6052295918367347, "grad_norm": 0.6426886023485954, "learning_rate": 7.906413836726049e-06, "loss": 0.3229456901550293, "num_input_tokens_seen": 288062320, "step": 4745, "train_runtime": 61769.8193, "train_tokens_per_second": 4663.48 }, { "epoch": 0.6058673469387755, "grad_norm": 0.5588105265523678, "learning_rate": 7.902336615195614e-06, "loss": 0.3303380012512207, "num_input_tokens_seen": 288357504, "step": 4750, "train_runtime": 61832.314, "train_tokens_per_second": 4663.541 }, { "epoch": 0.6065051020408163, "grad_norm": 0.6260031107978368, "learning_rate": 7.89825648096769e-06, "loss": 0.33974905014038087, "num_input_tokens_seen": 288654072, "step": 4755, "train_runtime": 61907.0899, "train_tokens_per_second": 4662.698 }, { "epoch": 0.6071428571428571, "grad_norm": 0.5458423897744933, "learning_rate": 7.89417343813697e-06, "loss": 0.3210566282272339, "num_input_tokens_seen": 288951872, "step": 4760, "train_runtime": 61969.6499, "train_tokens_per_second": 4662.797 }, { "epoch": 0.607780612244898, "grad_norm": 0.6370883128603102, "learning_rate": 7.890087490801077e-06, "loss": 0.32726516723632815, "num_input_tokens_seen": 289243832, "step": 4765, "train_runtime": 62039.7788, "train_tokens_per_second": 4662.232 }, { "epoch": 0.6084183673469388, "grad_norm": 0.5310342852708402, "learning_rate": 7.885998643060544e-06, "loss": 0.3283411979675293, "num_input_tokens_seen": 289548232, "step": 4770, "train_runtime": 62098.7189, "train_tokens_per_second": 4662.709 }, { "epoch": 0.6090561224489796, "grad_norm": 0.5635723415844118, "learning_rate": 7.881906899018815e-06, "loss": 0.3176594257354736, "num_input_tokens_seen": 289868800, "step": 4775, "train_runtime": 62148.1586, "train_tokens_per_second": 4664.157 }, { "epoch": 0.6096938775510204, "grad_norm": 0.5869010517099058, "learning_rate": 7.87781226278224e-06, "loss": 0.33094594478607176, "num_input_tokens_seen": 290163856, "step": 4780, "train_runtime": 62209.3692, "train_tokens_per_second": 4664.311 }, { "epoch": 0.6103316326530612, "grad_norm": 0.572120310946249, "learning_rate": 7.873714738460075e-06, "loss": 0.3263236999511719, "num_input_tokens_seen": 290462384, "step": 4785, "train_runtime": 62277.5925, "train_tokens_per_second": 4663.995 }, { "epoch": 0.610969387755102, "grad_norm": 0.5822636382201469, "learning_rate": 7.86961433016447e-06, "loss": 0.3235758304595947, "num_input_tokens_seen": 290775128, "step": 4790, "train_runtime": 62349.5125, "train_tokens_per_second": 4663.631 }, { "epoch": 0.6116071428571429, "grad_norm": 0.6029053979543979, "learning_rate": 7.865511042010469e-06, "loss": 0.31907784938812256, "num_input_tokens_seen": 291066008, "step": 4795, "train_runtime": 62412.6057, "train_tokens_per_second": 4663.577 }, { "epoch": 0.6122448979591837, "grad_norm": 0.6364330502640352, "learning_rate": 7.861404878116014e-06, "loss": 0.3359909772872925, "num_input_tokens_seen": 291355224, "step": 4800, "train_runtime": 62484.2112, "train_tokens_per_second": 4662.862 }, { "epoch": 0.6128826530612245, "grad_norm": 0.5671585607212491, "learning_rate": 7.857295842601921e-06, "loss": 0.3385308265686035, "num_input_tokens_seen": 291666904, "step": 4805, "train_runtime": 62531.9872, "train_tokens_per_second": 4664.283 }, { "epoch": 0.6135204081632653, "grad_norm": 0.6162061836917074, "learning_rate": 7.853183939591898e-06, "loss": 0.3188408136367798, "num_input_tokens_seen": 291954960, "step": 4810, "train_runtime": 62595.0014, "train_tokens_per_second": 4664.19 }, { "epoch": 0.6141581632653061, "grad_norm": 0.5758849290254675, "learning_rate": 7.849069173212526e-06, "loss": 0.33262321949005125, "num_input_tokens_seen": 292263992, "step": 4815, "train_runtime": 62670.2416, "train_tokens_per_second": 4663.521 }, { "epoch": 0.6147959183673469, "grad_norm": 0.6268541643214147, "learning_rate": 7.844951547593261e-06, "loss": 0.3587038516998291, "num_input_tokens_seen": 292570608, "step": 4820, "train_runtime": 62743.6215, "train_tokens_per_second": 4662.954 }, { "epoch": 0.6154336734693877, "grad_norm": 0.781103749729596, "learning_rate": 7.840831066866423e-06, "loss": 0.34357218742370604, "num_input_tokens_seen": 292889008, "step": 4825, "train_runtime": 62802.8569, "train_tokens_per_second": 4663.626 }, { "epoch": 0.6160714285714286, "grad_norm": 0.5723834748914789, "learning_rate": 7.83670773516721e-06, "loss": 0.30017411708831787, "num_input_tokens_seen": 293192336, "step": 4830, "train_runtime": 62868.64, "train_tokens_per_second": 4663.571 }, { "epoch": 0.6167091836734694, "grad_norm": 0.7844624121572441, "learning_rate": 7.83258155663367e-06, "loss": 0.34011092185974123, "num_input_tokens_seen": 293504568, "step": 4835, "train_runtime": 62917.6662, "train_tokens_per_second": 4664.899 }, { "epoch": 0.6173469387755102, "grad_norm": 0.6637915760976678, "learning_rate": 7.828452535406707e-06, "loss": 0.32102341651916505, "num_input_tokens_seen": 293801056, "step": 4840, "train_runtime": 62980.9822, "train_tokens_per_second": 4664.917 }, { "epoch": 0.6179846938775511, "grad_norm": 0.6612890525763778, "learning_rate": 7.82432067563009e-06, "loss": 0.28260757923126223, "num_input_tokens_seen": 294104640, "step": 4845, "train_runtime": 63044.6342, "train_tokens_per_second": 4665.023 }, { "epoch": 0.6186224489795918, "grad_norm": 0.561487135445506, "learning_rate": 7.820185981450422e-06, "loss": 0.3284600019454956, "num_input_tokens_seen": 294420608, "step": 4850, "train_runtime": 63112.8408, "train_tokens_per_second": 4664.987 }, { "epoch": 0.6192602040816326, "grad_norm": 0.6578404198864279, "learning_rate": 7.816048457017163e-06, "loss": 0.35275702476501464, "num_input_tokens_seen": 294729432, "step": 4855, "train_runtime": 63182.353, "train_tokens_per_second": 4664.743 }, { "epoch": 0.6198979591836735, "grad_norm": 0.6628087083893931, "learning_rate": 7.811908106482601e-06, "loss": 0.32400710582733155, "num_input_tokens_seen": 295026480, "step": 4860, "train_runtime": 63253.1576, "train_tokens_per_second": 4664.217 }, { "epoch": 0.6205357142857143, "grad_norm": 0.6062819712448757, "learning_rate": 7.807764934001875e-06, "loss": 0.3197571039199829, "num_input_tokens_seen": 295335136, "step": 4865, "train_runtime": 63318.8303, "train_tokens_per_second": 4664.254 }, { "epoch": 0.6211734693877551, "grad_norm": 0.554016057626016, "learning_rate": 7.803618943732943e-06, "loss": 0.30578064918518066, "num_input_tokens_seen": 295621456, "step": 4870, "train_runtime": 63382.3028, "train_tokens_per_second": 4664.101 }, { "epoch": 0.6218112244897959, "grad_norm": 0.673440426442395, "learning_rate": 7.799470139836593e-06, "loss": 0.33724274635314944, "num_input_tokens_seen": 295928456, "step": 4875, "train_runtime": 63449.7801, "train_tokens_per_second": 4663.979 }, { "epoch": 0.6224489795918368, "grad_norm": 0.598591390005993, "learning_rate": 7.795318526476448e-06, "loss": 0.3247530460357666, "num_input_tokens_seen": 296232464, "step": 4880, "train_runtime": 63503.3866, "train_tokens_per_second": 4664.829 }, { "epoch": 0.6230867346938775, "grad_norm": 0.6207353679082063, "learning_rate": 7.791164107818933e-06, "loss": 0.3155781030654907, "num_input_tokens_seen": 296533328, "step": 4885, "train_runtime": 63564.6937, "train_tokens_per_second": 4665.063 }, { "epoch": 0.6237244897959183, "grad_norm": 0.5600020735357846, "learning_rate": 7.787006888033304e-06, "loss": 0.3392642021179199, "num_input_tokens_seen": 296836440, "step": 4890, "train_runtime": 63634.6068, "train_tokens_per_second": 4664.701 }, { "epoch": 0.6243622448979592, "grad_norm": 0.621301757055225, "learning_rate": 7.782846871291619e-06, "loss": 0.33809504508972166, "num_input_tokens_seen": 297135096, "step": 4895, "train_runtime": 63693.8066, "train_tokens_per_second": 4665.055 }, { "epoch": 0.625, "grad_norm": 0.5581457268079149, "learning_rate": 7.778684061768744e-06, "loss": 0.33953664302825926, "num_input_tokens_seen": 297429472, "step": 4900, "train_runtime": 63760.2905, "train_tokens_per_second": 4664.807 }, { "epoch": 0.6256377551020408, "grad_norm": 0.6240505820939524, "learning_rate": 7.774518463642351e-06, "loss": 0.33265602588653564, "num_input_tokens_seen": 297713592, "step": 4905, "train_runtime": 63818.8102, "train_tokens_per_second": 4664.982 }, { "epoch": 0.6262755102040817, "grad_norm": 0.5886198862837947, "learning_rate": 7.770350081092906e-06, "loss": 0.3128589391708374, "num_input_tokens_seen": 298015744, "step": 4910, "train_runtime": 63886.5387, "train_tokens_per_second": 4664.766 }, { "epoch": 0.6269132653061225, "grad_norm": 0.7028247548263732, "learning_rate": 7.766178918303675e-06, "loss": 0.32480950355529786, "num_input_tokens_seen": 298324856, "step": 4915, "train_runtime": 63949.751, "train_tokens_per_second": 4664.989 }, { "epoch": 0.6275510204081632, "grad_norm": 0.609308928617577, "learning_rate": 7.762004979460711e-06, "loss": 0.3458104610443115, "num_input_tokens_seen": 298626488, "step": 4920, "train_runtime": 64014.9401, "train_tokens_per_second": 4664.95 }, { "epoch": 0.6281887755102041, "grad_norm": 0.601149571843337, "learning_rate": 7.75782826875285e-06, "loss": 0.32567148208618163, "num_input_tokens_seen": 298934448, "step": 4925, "train_runtime": 64090.7438, "train_tokens_per_second": 4664.237 }, { "epoch": 0.6288265306122449, "grad_norm": 0.6905427443909213, "learning_rate": 7.753648790371716e-06, "loss": 0.3416671991348267, "num_input_tokens_seen": 299242480, "step": 4930, "train_runtime": 64156.6957, "train_tokens_per_second": 4664.244 }, { "epoch": 0.6294642857142857, "grad_norm": 0.6074075357499965, "learning_rate": 7.749466548511706e-06, "loss": 0.32350864410400393, "num_input_tokens_seen": 299546696, "step": 4935, "train_runtime": 64224.297, "train_tokens_per_second": 4664.071 }, { "epoch": 0.6301020408163265, "grad_norm": 0.54837645000057, "learning_rate": 7.745281547369992e-06, "loss": 0.3141555070877075, "num_input_tokens_seen": 299857664, "step": 4940, "train_runtime": 64281.7126, "train_tokens_per_second": 4664.743 }, { "epoch": 0.6307397959183674, "grad_norm": 0.656812618336775, "learning_rate": 7.741093791146517e-06, "loss": 0.33570907115936277, "num_input_tokens_seen": 300162488, "step": 4945, "train_runtime": 64349.2952, "train_tokens_per_second": 4664.581 }, { "epoch": 0.6313775510204082, "grad_norm": 0.7271739146461138, "learning_rate": 7.736903284043985e-06, "loss": 0.31252236366271974, "num_input_tokens_seen": 300470800, "step": 4950, "train_runtime": 64410.7323, "train_tokens_per_second": 4664.918 }, { "epoch": 0.6320153061224489, "grad_norm": 0.5592254871328908, "learning_rate": 7.73271003026786e-06, "loss": 0.32289905548095704, "num_input_tokens_seen": 300771088, "step": 4955, "train_runtime": 64485.8894, "train_tokens_per_second": 4664.138 }, { "epoch": 0.6326530612244898, "grad_norm": 0.5909667799778385, "learning_rate": 7.72851403402637e-06, "loss": 0.3148157596588135, "num_input_tokens_seen": 301087160, "step": 4960, "train_runtime": 64546.7075, "train_tokens_per_second": 4664.64 }, { "epoch": 0.6332908163265306, "grad_norm": 0.6001910064087375, "learning_rate": 7.724315299530485e-06, "loss": 0.3344589710235596, "num_input_tokens_seen": 301394496, "step": 4965, "train_runtime": 64614.713, "train_tokens_per_second": 4664.487 }, { "epoch": 0.6339285714285714, "grad_norm": 0.686313433188379, "learning_rate": 7.720113830993934e-06, "loss": 0.346239709854126, "num_input_tokens_seen": 301692832, "step": 4970, "train_runtime": 64681.1812, "train_tokens_per_second": 4664.306 }, { "epoch": 0.6345663265306123, "grad_norm": 0.5807770199122811, "learning_rate": 7.71590963263318e-06, "loss": 0.3092792987823486, "num_input_tokens_seen": 301993848, "step": 4975, "train_runtime": 64758.1342, "train_tokens_per_second": 4663.412 }, { "epoch": 0.6352040816326531, "grad_norm": 0.5960635267156836, "learning_rate": 7.711702708667432e-06, "loss": 0.3285883903503418, "num_input_tokens_seen": 302288504, "step": 4980, "train_runtime": 64828.5858, "train_tokens_per_second": 4662.889 }, { "epoch": 0.6358418367346939, "grad_norm": 0.6264412065564793, "learning_rate": 7.70749306331863e-06, "loss": 0.3152578353881836, "num_input_tokens_seen": 302596976, "step": 4985, "train_runtime": 64894.2577, "train_tokens_per_second": 4662.924 }, { "epoch": 0.6364795918367347, "grad_norm": 0.6384532801785069, "learning_rate": 7.703280700811447e-06, "loss": 0.3586283683776855, "num_input_tokens_seen": 302885624, "step": 4990, "train_runtime": 64956.1119, "train_tokens_per_second": 4662.927 }, { "epoch": 0.6371173469387755, "grad_norm": 0.650443987703099, "learning_rate": 7.699065625373285e-06, "loss": 0.34339160919189454, "num_input_tokens_seen": 303170080, "step": 4995, "train_runtime": 65022.0927, "train_tokens_per_second": 4662.57 }, { "epoch": 0.6377551020408163, "grad_norm": 0.6388349023596219, "learning_rate": 7.694847841234268e-06, "loss": 0.31816675662994387, "num_input_tokens_seen": 303462440, "step": 5000, "train_runtime": 65090.1892, "train_tokens_per_second": 4662.184 }, { "epoch": 0.6383928571428571, "grad_norm": 0.5935913817839399, "learning_rate": 7.690627352627232e-06, "loss": 0.356259822845459, "num_input_tokens_seen": 303774280, "step": 5005, "train_runtime": 65151.9451, "train_tokens_per_second": 4662.551 }, { "epoch": 0.639030612244898, "grad_norm": 0.6480781837963139, "learning_rate": 7.686404163787734e-06, "loss": 0.3103009223937988, "num_input_tokens_seen": 304067248, "step": 5010, "train_runtime": 65223.1825, "train_tokens_per_second": 4661.95 }, { "epoch": 0.6396683673469388, "grad_norm": 0.6012006012262137, "learning_rate": 7.68217827895404e-06, "loss": 0.3121501445770264, "num_input_tokens_seen": 304370400, "step": 5015, "train_runtime": 65275.136, "train_tokens_per_second": 4662.884 }, { "epoch": 0.6403061224489796, "grad_norm": 0.6712143913991747, "learning_rate": 7.677949702367122e-06, "loss": 0.3567068576812744, "num_input_tokens_seen": 304674832, "step": 5020, "train_runtime": 65339.7216, "train_tokens_per_second": 4662.934 }, { "epoch": 0.6409438775510204, "grad_norm": 0.5599610051996647, "learning_rate": 7.673718438270649e-06, "loss": 0.3278343200683594, "num_input_tokens_seen": 304981880, "step": 5025, "train_runtime": 65411.5493, "train_tokens_per_second": 4662.508 }, { "epoch": 0.6415816326530612, "grad_norm": 0.6239344933483976, "learning_rate": 7.66948449091099e-06, "loss": 0.3229900598526001, "num_input_tokens_seen": 305285928, "step": 5030, "train_runtime": 65477.2048, "train_tokens_per_second": 4662.476 }, { "epoch": 0.642219387755102, "grad_norm": 0.6098449426813721, "learning_rate": 7.66524786453721e-06, "loss": 0.3233805656433105, "num_input_tokens_seen": 305584664, "step": 5035, "train_runtime": 65549.2606, "train_tokens_per_second": 4661.909 }, { "epoch": 0.6428571428571429, "grad_norm": 0.6247649176462382, "learning_rate": 7.661008563401056e-06, "loss": 0.3556224346160889, "num_input_tokens_seen": 305868632, "step": 5040, "train_runtime": 65606.5949, "train_tokens_per_second": 4662.163 }, { "epoch": 0.6434948979591837, "grad_norm": 0.5993651751501048, "learning_rate": 7.656766591756964e-06, "loss": 0.34767487049102785, "num_input_tokens_seen": 306179728, "step": 5045, "train_runtime": 65669.0743, "train_tokens_per_second": 4662.465 }, { "epoch": 0.6441326530612245, "grad_norm": 0.639117877395612, "learning_rate": 7.652521953862051e-06, "loss": 0.33482675552368163, "num_input_tokens_seen": 306489360, "step": 5050, "train_runtime": 65716.7925, "train_tokens_per_second": 4663.791 }, { "epoch": 0.6447704081632653, "grad_norm": 0.5849993879590735, "learning_rate": 7.648274653976102e-06, "loss": 0.3288681745529175, "num_input_tokens_seen": 306789736, "step": 5055, "train_runtime": 65778.6707, "train_tokens_per_second": 4663.97 }, { "epoch": 0.6454081632653061, "grad_norm": 0.6338086296242965, "learning_rate": 7.644024696361587e-06, "loss": 0.32494688034057617, "num_input_tokens_seen": 307097616, "step": 5060, "train_runtime": 65836.927, "train_tokens_per_second": 4664.519 }, { "epoch": 0.6460459183673469, "grad_norm": 0.5876557918206017, "learning_rate": 7.639772085283629e-06, "loss": 0.33415367603302004, "num_input_tokens_seen": 307408752, "step": 5065, "train_runtime": 65898.5938, "train_tokens_per_second": 4664.876 }, { "epoch": 0.6466836734693877, "grad_norm": 0.5839685640993281, "learning_rate": 7.635516825010022e-06, "loss": 0.3211622714996338, "num_input_tokens_seen": 307705200, "step": 5070, "train_runtime": 65964.8574, "train_tokens_per_second": 4664.684 }, { "epoch": 0.6473214285714286, "grad_norm": 0.5313809049144229, "learning_rate": 7.631258919811215e-06, "loss": 0.3212575435638428, "num_input_tokens_seen": 308018488, "step": 5075, "train_runtime": 66023.7313, "train_tokens_per_second": 4665.269 }, { "epoch": 0.6479591836734694, "grad_norm": 0.7271067216633091, "learning_rate": 7.626998373960317e-06, "loss": 0.3299903869628906, "num_input_tokens_seen": 308322376, "step": 5080, "train_runtime": 66094.8533, "train_tokens_per_second": 4664.847 }, { "epoch": 0.6485969387755102, "grad_norm": 0.7099319100446666, "learning_rate": 7.6227351917330835e-06, "loss": 0.3272510290145874, "num_input_tokens_seen": 308624608, "step": 5085, "train_runtime": 66157.0424, "train_tokens_per_second": 4665.03 }, { "epoch": 0.6492346938775511, "grad_norm": 0.5611417491839693, "learning_rate": 7.618469377407911e-06, "loss": 0.35759220123291013, "num_input_tokens_seen": 308935880, "step": 5090, "train_runtime": 66212.2113, "train_tokens_per_second": 4665.844 }, { "epoch": 0.6498724489795918, "grad_norm": 0.6029794330260951, "learning_rate": 7.614200935265845e-06, "loss": 0.3380232572555542, "num_input_tokens_seen": 309228488, "step": 5095, "train_runtime": 66282.9979, "train_tokens_per_second": 4665.276 }, { "epoch": 0.6505102040816326, "grad_norm": 0.5994525877243074, "learning_rate": 7.609929869590566e-06, "loss": 0.3147365808486938, "num_input_tokens_seen": 309541768, "step": 5100, "train_runtime": 66351.6034, "train_tokens_per_second": 4665.174 }, { "epoch": 0.6511479591836735, "grad_norm": 0.6222623980322116, "learning_rate": 7.605656184668385e-06, "loss": 0.32534070014953614, "num_input_tokens_seen": 309852264, "step": 5105, "train_runtime": 66411.8441, "train_tokens_per_second": 4665.618 }, { "epoch": 0.6517857142857143, "grad_norm": 0.5874904480880205, "learning_rate": 7.6013798847882455e-06, "loss": 0.3319838285446167, "num_input_tokens_seen": 310164128, "step": 5110, "train_runtime": 66464.1894, "train_tokens_per_second": 4666.635 }, { "epoch": 0.6524234693877551, "grad_norm": 0.5605939289385559, "learning_rate": 7.597100974241711e-06, "loss": 0.33452045917510986, "num_input_tokens_seen": 310465392, "step": 5115, "train_runtime": 66537.1495, "train_tokens_per_second": 4666.046 }, { "epoch": 0.6530612244897959, "grad_norm": 0.6209280952740241, "learning_rate": 7.592819457322967e-06, "loss": 0.3549307346343994, "num_input_tokens_seen": 310764976, "step": 5120, "train_runtime": 66599.5403, "train_tokens_per_second": 4666.173 }, { "epoch": 0.6536989795918368, "grad_norm": 0.5731115356851546, "learning_rate": 7.588535338328816e-06, "loss": 0.32546820640563967, "num_input_tokens_seen": 311068176, "step": 5125, "train_runtime": 66670.1991, "train_tokens_per_second": 4665.775 }, { "epoch": 0.6543367346938775, "grad_norm": 0.5160733758277285, "learning_rate": 7.584248621558669e-06, "loss": 0.33570246696472167, "num_input_tokens_seen": 311375264, "step": 5130, "train_runtime": 66733.5287, "train_tokens_per_second": 4665.949 }, { "epoch": 0.6549744897959183, "grad_norm": 0.6280358766100539, "learning_rate": 7.579959311314549e-06, "loss": 0.3122812509536743, "num_input_tokens_seen": 311663640, "step": 5135, "train_runtime": 66807.4591, "train_tokens_per_second": 4665.102 }, { "epoch": 0.6556122448979592, "grad_norm": 0.7342922788385822, "learning_rate": 7.575667411901074e-06, "loss": 0.33909385204315184, "num_input_tokens_seen": 311971384, "step": 5140, "train_runtime": 66862.4758, "train_tokens_per_second": 4665.866 }, { "epoch": 0.65625, "grad_norm": 0.5504399102589533, "learning_rate": 7.571372927625469e-06, "loss": 0.30200581550598143, "num_input_tokens_seen": 312278304, "step": 5145, "train_runtime": 66931.2224, "train_tokens_per_second": 4665.66 }, { "epoch": 0.6568877551020408, "grad_norm": 0.6350235883558237, "learning_rate": 7.567075862797546e-06, "loss": 0.3463855504989624, "num_input_tokens_seen": 312583576, "step": 5150, "train_runtime": 67003.1506, "train_tokens_per_second": 4665.207 }, { "epoch": 0.6575255102040817, "grad_norm": 0.5878594793890254, "learning_rate": 7.562776221729709e-06, "loss": 0.3354689121246338, "num_input_tokens_seen": 312893440, "step": 5155, "train_runtime": 67062.7977, "train_tokens_per_second": 4665.678 }, { "epoch": 0.6581632653061225, "grad_norm": 0.6261798997073404, "learning_rate": 7.558474008736951e-06, "loss": 0.3523919105529785, "num_input_tokens_seen": 313192904, "step": 5160, "train_runtime": 67123.8409, "train_tokens_per_second": 4665.897 }, { "epoch": 0.6588010204081632, "grad_norm": 0.6377921783909494, "learning_rate": 7.554169228136842e-06, "loss": 0.3369914054870605, "num_input_tokens_seen": 313489048, "step": 5165, "train_runtime": 67187.7626, "train_tokens_per_second": 4665.865 }, { "epoch": 0.6594387755102041, "grad_norm": 0.7885707396439451, "learning_rate": 7.549861884249529e-06, "loss": 0.3480203151702881, "num_input_tokens_seen": 313797432, "step": 5170, "train_runtime": 67259.0989, "train_tokens_per_second": 4665.502 }, { "epoch": 0.6600765306122449, "grad_norm": 0.557473276764076, "learning_rate": 7.545551981397733e-06, "loss": 0.3440972566604614, "num_input_tokens_seen": 314115728, "step": 5175, "train_runtime": 67332.3398, "train_tokens_per_second": 4665.154 }, { "epoch": 0.6607142857142857, "grad_norm": 1.2055867539620164, "learning_rate": 7.541239523906742e-06, "loss": 0.3330733060836792, "num_input_tokens_seen": 314426512, "step": 5180, "train_runtime": 67394.0315, "train_tokens_per_second": 4665.495 }, { "epoch": 0.6613520408163265, "grad_norm": 0.6684195088007945, "learning_rate": 7.536924516104411e-06, "loss": 0.31601767539978026, "num_input_tokens_seen": 314716736, "step": 5185, "train_runtime": 67469.1985, "train_tokens_per_second": 4664.599 }, { "epoch": 0.6619897959183674, "grad_norm": 0.5894649896209727, "learning_rate": 7.532606962321149e-06, "loss": 0.32779479026794434, "num_input_tokens_seen": 315014520, "step": 5190, "train_runtime": 67526.9463, "train_tokens_per_second": 4665.019 }, { "epoch": 0.6626275510204082, "grad_norm": 0.6098349370529698, "learning_rate": 7.528286866889924e-06, "loss": 0.3065429925918579, "num_input_tokens_seen": 315320568, "step": 5195, "train_runtime": 67595.9776, "train_tokens_per_second": 4664.783 }, { "epoch": 0.6632653061224489, "grad_norm": 0.6309166508502535, "learning_rate": 7.523964234146251e-06, "loss": 0.34712815284729004, "num_input_tokens_seen": 315634520, "step": 5200, "train_runtime": 67649.3854, "train_tokens_per_second": 4665.741 }, { "epoch": 0.6639030612244898, "grad_norm": 0.600054875455631, "learning_rate": 7.519639068428199e-06, "loss": 0.3406857967376709, "num_input_tokens_seen": 315938296, "step": 5205, "train_runtime": 67714.4417, "train_tokens_per_second": 4665.745 }, { "epoch": 0.6645408163265306, "grad_norm": 0.6260107068106353, "learning_rate": 7.515311374076368e-06, "loss": 0.3166226625442505, "num_input_tokens_seen": 316243072, "step": 5210, "train_runtime": 67782.659, "train_tokens_per_second": 4665.545 }, { "epoch": 0.6651785714285714, "grad_norm": 0.7558778469353974, "learning_rate": 7.5109811554339054e-06, "loss": 0.33198843002319334, "num_input_tokens_seen": 316550280, "step": 5215, "train_runtime": 67850.8903, "train_tokens_per_second": 4665.381 }, { "epoch": 0.6658163265306123, "grad_norm": 0.6794956607022652, "learning_rate": 7.506648416846485e-06, "loss": 0.3436640739440918, "num_input_tokens_seen": 316868448, "step": 5220, "train_runtime": 67902.4544, "train_tokens_per_second": 4666.524 }, { "epoch": 0.6664540816326531, "grad_norm": 0.588239386568709, "learning_rate": 7.502313162662316e-06, "loss": 0.3301560878753662, "num_input_tokens_seen": 317168256, "step": 5225, "train_runtime": 67975.9438, "train_tokens_per_second": 4665.89 }, { "epoch": 0.6670918367346939, "grad_norm": 0.5473296248429648, "learning_rate": 7.4979753972321265e-06, "loss": 0.31626310348510744, "num_input_tokens_seen": 317480320, "step": 5230, "train_runtime": 68048.371, "train_tokens_per_second": 4665.509 }, { "epoch": 0.6677295918367347, "grad_norm": 0.5500807486411848, "learning_rate": 7.493635124909167e-06, "loss": 0.31904003620147703, "num_input_tokens_seen": 317786664, "step": 5235, "train_runtime": 68128.2384, "train_tokens_per_second": 4664.537 }, { "epoch": 0.6683673469387755, "grad_norm": 0.5811028943455897, "learning_rate": 7.489292350049205e-06, "loss": 0.32049336433410647, "num_input_tokens_seen": 318090448, "step": 5240, "train_runtime": 68185.3268, "train_tokens_per_second": 4665.087 }, { "epoch": 0.6690051020408163, "grad_norm": 0.5623988371433525, "learning_rate": 7.484947077010519e-06, "loss": 0.3046008348464966, "num_input_tokens_seen": 318407360, "step": 5245, "train_runtime": 68249.2821, "train_tokens_per_second": 4665.358 }, { "epoch": 0.6696428571428571, "grad_norm": 0.6776051509696445, "learning_rate": 7.480599310153891e-06, "loss": 0.3047685146331787, "num_input_tokens_seen": 318686592, "step": 5250, "train_runtime": 68313.5643, "train_tokens_per_second": 4665.056 }, { "epoch": 0.670280612244898, "grad_norm": 0.6224288425840941, "learning_rate": 7.476249053842613e-06, "loss": 0.3419510364532471, "num_input_tokens_seen": 318984160, "step": 5255, "train_runtime": 68380.1767, "train_tokens_per_second": 4664.863 }, { "epoch": 0.6709183673469388, "grad_norm": 0.6286778320000875, "learning_rate": 7.471896312442467e-06, "loss": 0.32067461013793946, "num_input_tokens_seen": 319279088, "step": 5260, "train_runtime": 68451.2372, "train_tokens_per_second": 4664.329 }, { "epoch": 0.6715561224489796, "grad_norm": 0.5408996274044002, "learning_rate": 7.467541090321735e-06, "loss": 0.3092599153518677, "num_input_tokens_seen": 319582768, "step": 5265, "train_runtime": 68517.0909, "train_tokens_per_second": 4664.278 }, { "epoch": 0.6721938775510204, "grad_norm": 0.6550156616436309, "learning_rate": 7.463183391851186e-06, "loss": 0.34105687141418456, "num_input_tokens_seen": 319887592, "step": 5270, "train_runtime": 68565.1059, "train_tokens_per_second": 4665.458 }, { "epoch": 0.6728316326530612, "grad_norm": 0.5640935858174217, "learning_rate": 7.4588232214040744e-06, "loss": 0.3312492370605469, "num_input_tokens_seen": 320179160, "step": 5275, "train_runtime": 68640.17, "train_tokens_per_second": 4664.603 }, { "epoch": 0.673469387755102, "grad_norm": 0.5802278666882329, "learning_rate": 7.454460583356138e-06, "loss": 0.31220436096191406, "num_input_tokens_seen": 320468448, "step": 5280, "train_runtime": 68701.3544, "train_tokens_per_second": 4664.66 }, { "epoch": 0.6741071428571429, "grad_norm": 0.5742901619279837, "learning_rate": 7.4500954820855854e-06, "loss": 0.32859785556793214, "num_input_tokens_seen": 320776112, "step": 5285, "train_runtime": 68763.7941, "train_tokens_per_second": 4664.898 }, { "epoch": 0.6747448979591837, "grad_norm": 0.6296472556685766, "learning_rate": 7.445727921973104e-06, "loss": 0.3388023853302002, "num_input_tokens_seen": 321083768, "step": 5290, "train_runtime": 68843.7298, "train_tokens_per_second": 4663.951 }, { "epoch": 0.6753826530612245, "grad_norm": 0.5939938217312132, "learning_rate": 7.441357907401841e-06, "loss": 0.349368953704834, "num_input_tokens_seen": 321388456, "step": 5295, "train_runtime": 68920.4066, "train_tokens_per_second": 4663.183 }, { "epoch": 0.6760204081632653, "grad_norm": 0.5950419311161232, "learning_rate": 7.436985442757415e-06, "loss": 0.3301686763763428, "num_input_tokens_seen": 321699936, "step": 5300, "train_runtime": 68976.6748, "train_tokens_per_second": 4663.895 }, { "epoch": 0.6766581632653061, "grad_norm": 0.5886652925647744, "learning_rate": 7.432610532427899e-06, "loss": 0.3316835403442383, "num_input_tokens_seen": 322016888, "step": 5305, "train_runtime": 69027.8101, "train_tokens_per_second": 4665.031 }, { "epoch": 0.6772959183673469, "grad_norm": 0.6483338428234111, "learning_rate": 7.428233180803821e-06, "loss": 0.3472487688064575, "num_input_tokens_seen": 322323416, "step": 5310, "train_runtime": 69087.3584, "train_tokens_per_second": 4665.447 }, { "epoch": 0.6779336734693877, "grad_norm": 0.6604829029071831, "learning_rate": 7.423853392278158e-06, "loss": 0.3495924949645996, "num_input_tokens_seen": 322618320, "step": 5315, "train_runtime": 69151.3099, "train_tokens_per_second": 4665.397 }, { "epoch": 0.6785714285714286, "grad_norm": 0.625851074036591, "learning_rate": 7.419471171246334e-06, "loss": 0.3318294286727905, "num_input_tokens_seen": 322920944, "step": 5320, "train_runtime": 69206.4594, "train_tokens_per_second": 4666.052 }, { "epoch": 0.6792091836734694, "grad_norm": 0.6787277188188651, "learning_rate": 7.415086522106215e-06, "loss": 0.33146181106567385, "num_input_tokens_seen": 323229392, "step": 5325, "train_runtime": 69267.3088, "train_tokens_per_second": 4666.406 }, { "epoch": 0.6798469387755102, "grad_norm": 0.588898335172044, "learning_rate": 7.410699449258102e-06, "loss": 0.3333503246307373, "num_input_tokens_seen": 323539944, "step": 5330, "train_runtime": 69330.8453, "train_tokens_per_second": 4666.609 }, { "epoch": 0.6804846938775511, "grad_norm": 0.6651399649625767, "learning_rate": 7.406309957104727e-06, "loss": 0.31888589859008787, "num_input_tokens_seen": 323845648, "step": 5335, "train_runtime": 69392.707, "train_tokens_per_second": 4666.854 }, { "epoch": 0.6811224489795918, "grad_norm": 0.6132995379294711, "learning_rate": 7.401918050051256e-06, "loss": 0.32655973434448243, "num_input_tokens_seen": 324152360, "step": 5340, "train_runtime": 69458.2621, "train_tokens_per_second": 4666.865 }, { "epoch": 0.6817602040816326, "grad_norm": 0.5914369333981617, "learning_rate": 7.39752373250527e-06, "loss": 0.3464339256286621, "num_input_tokens_seen": 324461336, "step": 5345, "train_runtime": 69528.0201, "train_tokens_per_second": 4666.627 }, { "epoch": 0.6823979591836735, "grad_norm": 0.6206028765459817, "learning_rate": 7.393127008876777e-06, "loss": 0.3387403726577759, "num_input_tokens_seen": 324765688, "step": 5350, "train_runtime": 69593.4509, "train_tokens_per_second": 4666.613 }, { "epoch": 0.6830357142857143, "grad_norm": 0.6124027013893614, "learning_rate": 7.388727883578195e-06, "loss": 0.33055853843688965, "num_input_tokens_seen": 325067576, "step": 5355, "train_runtime": 69659.8013, "train_tokens_per_second": 4666.502 }, { "epoch": 0.6836734693877551, "grad_norm": 0.578899436811348, "learning_rate": 7.384326361024352e-06, "loss": 0.3409270763397217, "num_input_tokens_seen": 325377208, "step": 5360, "train_runtime": 69725.547, "train_tokens_per_second": 4666.542 }, { "epoch": 0.6843112244897959, "grad_norm": 1.4905814522448033, "learning_rate": 7.3799224456324865e-06, "loss": 0.34844231605529785, "num_input_tokens_seen": 325686680, "step": 5365, "train_runtime": 69780.2504, "train_tokens_per_second": 4667.319 }, { "epoch": 0.6849489795918368, "grad_norm": 0.6700794882530573, "learning_rate": 7.375516141822232e-06, "loss": 0.34676122665405273, "num_input_tokens_seen": 325995200, "step": 5370, "train_runtime": 69836.2209, "train_tokens_per_second": 4667.996 }, { "epoch": 0.6855867346938775, "grad_norm": 0.6015316796392, "learning_rate": 7.371107454015626e-06, "loss": 0.3110495090484619, "num_input_tokens_seen": 326303576, "step": 5375, "train_runtime": 69906.6207, "train_tokens_per_second": 4667.706 }, { "epoch": 0.6862244897959183, "grad_norm": 0.5671787721416277, "learning_rate": 7.3666963866370886e-06, "loss": 0.35372376441955566, "num_input_tokens_seen": 326611640, "step": 5380, "train_runtime": 69973.4664, "train_tokens_per_second": 4667.65 }, { "epoch": 0.6868622448979592, "grad_norm": 0.5416291571428138, "learning_rate": 7.3622829441134395e-06, "loss": 0.327644419670105, "num_input_tokens_seen": 326919968, "step": 5385, "train_runtime": 70040.409, "train_tokens_per_second": 4667.591 }, { "epoch": 0.6875, "grad_norm": 0.6808143576663714, "learning_rate": 7.357867130873875e-06, "loss": 0.3390071392059326, "num_input_tokens_seen": 327232832, "step": 5390, "train_runtime": 70100.1573, "train_tokens_per_second": 4668.076 }, { "epoch": 0.6881377551020408, "grad_norm": 0.6059110568690664, "learning_rate": 7.353448951349971e-06, "loss": 0.32433485984802246, "num_input_tokens_seen": 327541008, "step": 5395, "train_runtime": 70165.5977, "train_tokens_per_second": 4668.114 }, { "epoch": 0.6887755102040817, "grad_norm": 0.7204965819899145, "learning_rate": 7.349028409975681e-06, "loss": 0.3259130477905273, "num_input_tokens_seen": 327827272, "step": 5400, "train_runtime": 70237.2177, "train_tokens_per_second": 4667.43 }, { "epoch": 0.6894132653061225, "grad_norm": 0.6122643776935173, "learning_rate": 7.344605511187322e-06, "loss": 0.327258038520813, "num_input_tokens_seen": 328118504, "step": 5405, "train_runtime": 70293.2273, "train_tokens_per_second": 4667.854 }, { "epoch": 0.6900510204081632, "grad_norm": 0.5563082324746123, "learning_rate": 7.3401802594235894e-06, "loss": 0.3184638023376465, "num_input_tokens_seen": 328421136, "step": 5410, "train_runtime": 70363.2588, "train_tokens_per_second": 4667.509 }, { "epoch": 0.6906887755102041, "grad_norm": 0.5963140377954498, "learning_rate": 7.3357526591255265e-06, "loss": 0.327569317817688, "num_input_tokens_seen": 328718016, "step": 5415, "train_runtime": 70433.2862, "train_tokens_per_second": 4667.083 }, { "epoch": 0.6913265306122449, "grad_norm": 0.583905619885943, "learning_rate": 7.331322714736543e-06, "loss": 0.33679890632629395, "num_input_tokens_seen": 329015224, "step": 5420, "train_runtime": 70503.2202, "train_tokens_per_second": 4666.669 }, { "epoch": 0.6919642857142857, "grad_norm": 0.6177694828222271, "learning_rate": 7.326890430702396e-06, "loss": 0.3472728252410889, "num_input_tokens_seen": 329314184, "step": 5425, "train_runtime": 70571.6455, "train_tokens_per_second": 4666.381 }, { "epoch": 0.6926020408163265, "grad_norm": 0.5902678991465765, "learning_rate": 7.3224558114711905e-06, "loss": 0.3267884016036987, "num_input_tokens_seen": 329621696, "step": 5430, "train_runtime": 70641.1305, "train_tokens_per_second": 4666.144 }, { "epoch": 0.6932397959183674, "grad_norm": 0.7533725371491875, "learning_rate": 7.31801886149338e-06, "loss": 0.30158908367156984, "num_input_tokens_seen": 329919672, "step": 5435, "train_runtime": 70709.638, "train_tokens_per_second": 4665.837 }, { "epoch": 0.6938775510204082, "grad_norm": 0.666889462817546, "learning_rate": 7.313579585221752e-06, "loss": 0.34727749824523924, "num_input_tokens_seen": 330233896, "step": 5440, "train_runtime": 70764.7404, "train_tokens_per_second": 4666.645 }, { "epoch": 0.6945153061224489, "grad_norm": 0.5907073754530744, "learning_rate": 7.309137987111428e-06, "loss": 0.33589582443237304, "num_input_tokens_seen": 330530192, "step": 5445, "train_runtime": 70827.9949, "train_tokens_per_second": 4666.66 }, { "epoch": 0.6951530612244898, "grad_norm": 0.6530789790493967, "learning_rate": 7.304694071619866e-06, "loss": 0.3435753345489502, "num_input_tokens_seen": 330839440, "step": 5450, "train_runtime": 70882.9173, "train_tokens_per_second": 4667.407 }, { "epoch": 0.6957908163265306, "grad_norm": 0.5808913398797967, "learning_rate": 7.300247843206844e-06, "loss": 0.33095269203186034, "num_input_tokens_seen": 331125736, "step": 5455, "train_runtime": 70938.9735, "train_tokens_per_second": 4667.755 }, { "epoch": 0.6964285714285714, "grad_norm": 0.657713456241302, "learning_rate": 7.2957993063344615e-06, "loss": 0.3572857856750488, "num_input_tokens_seen": 331437480, "step": 5460, "train_runtime": 70996.2714, "train_tokens_per_second": 4668.379 }, { "epoch": 0.6970663265306123, "grad_norm": 0.661292725378582, "learning_rate": 7.291348465467136e-06, "loss": 0.32533111572265627, "num_input_tokens_seen": 331737480, "step": 5465, "train_runtime": 71066.994, "train_tokens_per_second": 4667.954 }, { "epoch": 0.6977040816326531, "grad_norm": 0.5561707413448671, "learning_rate": 7.286895325071599e-06, "loss": 0.3380601167678833, "num_input_tokens_seen": 332047296, "step": 5470, "train_runtime": 71130.3039, "train_tokens_per_second": 4668.155 }, { "epoch": 0.6983418367346939, "grad_norm": 0.5911161863962754, "learning_rate": 7.282439889616887e-06, "loss": 0.30793912410736085, "num_input_tokens_seen": 332348792, "step": 5475, "train_runtime": 71197.7994, "train_tokens_per_second": 4667.964 }, { "epoch": 0.6989795918367347, "grad_norm": 0.5788008200790318, "learning_rate": 7.277982163574339e-06, "loss": 0.33248081207275393, "num_input_tokens_seen": 332647496, "step": 5480, "train_runtime": 71256.7339, "train_tokens_per_second": 4668.296 }, { "epoch": 0.6996173469387755, "grad_norm": 0.563191763270536, "learning_rate": 7.273522151417598e-06, "loss": 0.327709436416626, "num_input_tokens_seen": 332958368, "step": 5485, "train_runtime": 71329.611, "train_tokens_per_second": 4667.884 }, { "epoch": 0.7002551020408163, "grad_norm": 0.6206240771212169, "learning_rate": 7.2690598576225954e-06, "loss": 0.327768611907959, "num_input_tokens_seen": 333253504, "step": 5490, "train_runtime": 71406.3473, "train_tokens_per_second": 4667.001 }, { "epoch": 0.7008928571428571, "grad_norm": 0.6607129218814294, "learning_rate": 7.264595286667554e-06, "loss": 0.3356297254562378, "num_input_tokens_seen": 333529432, "step": 5495, "train_runtime": 71473.3755, "train_tokens_per_second": 4666.485 }, { "epoch": 0.701530612244898, "grad_norm": 0.6302316526555676, "learning_rate": 7.2601284430329836e-06, "loss": 0.31958589553833006, "num_input_tokens_seen": 333837952, "step": 5500, "train_runtime": 71540.7581, "train_tokens_per_second": 4666.402 }, { "epoch": 0.7021683673469388, "grad_norm": 0.582175265602265, "learning_rate": 7.255659331201673e-06, "loss": 0.31284639835357664, "num_input_tokens_seen": 334139480, "step": 5505, "train_runtime": 71609.7302, "train_tokens_per_second": 4666.118 }, { "epoch": 0.7028061224489796, "grad_norm": 0.5642191190377086, "learning_rate": 7.251187955658691e-06, "loss": 0.3290869235992432, "num_input_tokens_seen": 334432600, "step": 5510, "train_runtime": 71672.4885, "train_tokens_per_second": 4666.122 }, { "epoch": 0.7034438775510204, "grad_norm": 0.5920364480819984, "learning_rate": 7.246714320891371e-06, "loss": 0.3378335237503052, "num_input_tokens_seen": 334738240, "step": 5515, "train_runtime": 71744.6332, "train_tokens_per_second": 4665.69 }, { "epoch": 0.7040816326530612, "grad_norm": 0.6125949109455139, "learning_rate": 7.24223843138932e-06, "loss": 0.32679245471954343, "num_input_tokens_seen": 335033688, "step": 5520, "train_runtime": 71814.7444, "train_tokens_per_second": 4665.249 }, { "epoch": 0.704719387755102, "grad_norm": 0.6221386376333026, "learning_rate": 7.237760291644405e-06, "loss": 0.3354485988616943, "num_input_tokens_seen": 335339536, "step": 5525, "train_runtime": 71874.4703, "train_tokens_per_second": 4665.628 }, { "epoch": 0.7053571428571429, "grad_norm": 0.5862948755770035, "learning_rate": 7.233279906150752e-06, "loss": 0.3378009796142578, "num_input_tokens_seen": 335617824, "step": 5530, "train_runtime": 71940.2307, "train_tokens_per_second": 4665.231 }, { "epoch": 0.7059948979591837, "grad_norm": 0.590531810670554, "learning_rate": 7.228797279404744e-06, "loss": 0.3126326322555542, "num_input_tokens_seen": 335926560, "step": 5535, "train_runtime": 72005.3302, "train_tokens_per_second": 4665.301 }, { "epoch": 0.7066326530612245, "grad_norm": 0.5867686757091221, "learning_rate": 7.224312415905005e-06, "loss": 0.3219478130340576, "num_input_tokens_seen": 336238896, "step": 5540, "train_runtime": 72075.2057, "train_tokens_per_second": 4665.112 }, { "epoch": 0.7072704081632653, "grad_norm": 0.7170878987217519, "learning_rate": 7.219825320152411e-06, "loss": 0.31927881240844724, "num_input_tokens_seen": 336545928, "step": 5545, "train_runtime": 72141.8066, "train_tokens_per_second": 4665.061 }, { "epoch": 0.7079081632653061, "grad_norm": 0.6497445986568611, "learning_rate": 7.2153359966500765e-06, "loss": 0.33097076416015625, "num_input_tokens_seen": 336863184, "step": 5550, "train_runtime": 72205.9275, "train_tokens_per_second": 4665.312 }, { "epoch": 0.7085459183673469, "grad_norm": 0.5740950852414692, "learning_rate": 7.210844449903352e-06, "loss": 0.3214916229248047, "num_input_tokens_seen": 337164816, "step": 5555, "train_runtime": 72272.0232, "train_tokens_per_second": 4665.219 }, { "epoch": 0.7091836734693877, "grad_norm": 0.6232369971662685, "learning_rate": 7.206350684419814e-06, "loss": 0.3146527767181396, "num_input_tokens_seen": 337478608, "step": 5560, "train_runtime": 72329.9707, "train_tokens_per_second": 4665.82 }, { "epoch": 0.7098214285714286, "grad_norm": 0.6216524464851271, "learning_rate": 7.2018547047092745e-06, "loss": 0.3411190748214722, "num_input_tokens_seen": 337792616, "step": 5565, "train_runtime": 72400.4977, "train_tokens_per_second": 4665.612 }, { "epoch": 0.7104591836734694, "grad_norm": 0.6316057403682567, "learning_rate": 7.1973565152837635e-06, "loss": 0.3246105194091797, "num_input_tokens_seen": 338097400, "step": 5570, "train_runtime": 72459.0139, "train_tokens_per_second": 4666.05 }, { "epoch": 0.7110969387755102, "grad_norm": 0.5859982217550813, "learning_rate": 7.192856120657524e-06, "loss": 0.33641302585601807, "num_input_tokens_seen": 338401176, "step": 5575, "train_runtime": 72532.5175, "train_tokens_per_second": 4665.51 }, { "epoch": 0.7117346938775511, "grad_norm": 0.6600579934426793, "learning_rate": 7.18835352534702e-06, "loss": 0.30387799739837645, "num_input_tokens_seen": 338686568, "step": 5580, "train_runtime": 72603.8349, "train_tokens_per_second": 4664.858 }, { "epoch": 0.7123724489795918, "grad_norm": 0.5854797426337409, "learning_rate": 7.183848733870917e-06, "loss": 0.319439697265625, "num_input_tokens_seen": 338995184, "step": 5585, "train_runtime": 72667.0423, "train_tokens_per_second": 4665.047 }, { "epoch": 0.7130102040816326, "grad_norm": 0.5689084429663139, "learning_rate": 7.179341750750092e-06, "loss": 0.3119250059127808, "num_input_tokens_seen": 339304344, "step": 5590, "train_runtime": 72730.0804, "train_tokens_per_second": 4665.255 }, { "epoch": 0.7136479591836735, "grad_norm": 0.6906071777710958, "learning_rate": 7.174832580507614e-06, "loss": 0.37570886611938475, "num_input_tokens_seen": 339600024, "step": 5595, "train_runtime": 72789.0288, "train_tokens_per_second": 4665.539 }, { "epoch": 0.7142857142857143, "grad_norm": 0.5688465678450141, "learning_rate": 7.170321227668752e-06, "loss": 0.3130634784698486, "num_input_tokens_seen": 339897768, "step": 5600, "train_runtime": 72855.4263, "train_tokens_per_second": 4665.373 }, { "epoch": 0.7149234693877551, "grad_norm": 0.5687010721380742, "learning_rate": 7.165807696760964e-06, "loss": 0.3177204608917236, "num_input_tokens_seen": 340201488, "step": 5605, "train_runtime": 72921.782, "train_tokens_per_second": 4665.293 }, { "epoch": 0.7155612244897959, "grad_norm": 0.5668284353788912, "learning_rate": 7.16129199231389e-06, "loss": 0.31652255058288575, "num_input_tokens_seen": 340513480, "step": 5610, "train_runtime": 72986.5017, "train_tokens_per_second": 4665.431 }, { "epoch": 0.7161989795918368, "grad_norm": 0.6065589618769056, "learning_rate": 7.15677411885936e-06, "loss": 0.32903294563293456, "num_input_tokens_seen": 340814592, "step": 5615, "train_runtime": 73055.5021, "train_tokens_per_second": 4665.146 }, { "epoch": 0.7168367346938775, "grad_norm": 0.6199070267833474, "learning_rate": 7.152254080931372e-06, "loss": 0.34875319004058836, "num_input_tokens_seen": 341125176, "step": 5620, "train_runtime": 73125.7921, "train_tokens_per_second": 4664.909 }, { "epoch": 0.7174744897959183, "grad_norm": 0.6459436729232075, "learning_rate": 7.1477318830661e-06, "loss": 0.36013131141662597, "num_input_tokens_seen": 341427632, "step": 5625, "train_runtime": 73194.3893, "train_tokens_per_second": 4664.669 }, { "epoch": 0.7181122448979592, "grad_norm": 0.5738189271833315, "learning_rate": 7.143207529801888e-06, "loss": 0.3343724250793457, "num_input_tokens_seen": 341719568, "step": 5630, "train_runtime": 73260.3066, "train_tokens_per_second": 4664.457 }, { "epoch": 0.71875, "grad_norm": 0.5858170490383494, "learning_rate": 7.1386810256792374e-06, "loss": 0.3392931938171387, "num_input_tokens_seen": 342019008, "step": 5635, "train_runtime": 73333.7142, "train_tokens_per_second": 4663.871 }, { "epoch": 0.7193877551020408, "grad_norm": 0.6160116996822735, "learning_rate": 7.134152375240812e-06, "loss": 0.29196462631225584, "num_input_tokens_seen": 342315160, "step": 5640, "train_runtime": 73405.6238, "train_tokens_per_second": 4663.337 }, { "epoch": 0.7200255102040817, "grad_norm": 0.5570448929611207, "learning_rate": 7.1296215830314295e-06, "loss": 0.3171334505081177, "num_input_tokens_seen": 342614960, "step": 5645, "train_runtime": 73466.3518, "train_tokens_per_second": 4663.563 }, { "epoch": 0.7206632653061225, "grad_norm": 0.6103563782721396, "learning_rate": 7.125088653598057e-06, "loss": 0.3042132377624512, "num_input_tokens_seen": 342912480, "step": 5650, "train_runtime": 73530.6953, "train_tokens_per_second": 4663.528 }, { "epoch": 0.7213010204081632, "grad_norm": 0.5953809118782077, "learning_rate": 7.1205535914898035e-06, "loss": 0.3171056270599365, "num_input_tokens_seen": 343216744, "step": 5655, "train_runtime": 73595.9657, "train_tokens_per_second": 4663.527 }, { "epoch": 0.7219387755102041, "grad_norm": 0.624785105512535, "learning_rate": 7.116016401257921e-06, "loss": 0.3005784034729004, "num_input_tokens_seen": 343522224, "step": 5660, "train_runtime": 73659.3765, "train_tokens_per_second": 4663.659 }, { "epoch": 0.7225765306122449, "grad_norm": 0.6666384460772958, "learning_rate": 7.1114770874558e-06, "loss": 0.33109331130981445, "num_input_tokens_seen": 343836648, "step": 5665, "train_runtime": 73724.3917, "train_tokens_per_second": 4663.811 }, { "epoch": 0.7232142857142857, "grad_norm": 0.6200346099959192, "learning_rate": 7.1069356546389555e-06, "loss": 0.3131404399871826, "num_input_tokens_seen": 344124648, "step": 5670, "train_runtime": 73798.7997, "train_tokens_per_second": 4663.011 }, { "epoch": 0.7238520408163265, "grad_norm": 0.6876751716263368, "learning_rate": 7.1023921073650325e-06, "loss": 0.34466369152069093, "num_input_tokens_seen": 344412648, "step": 5675, "train_runtime": 73855.4871, "train_tokens_per_second": 4663.332 }, { "epoch": 0.7244897959183674, "grad_norm": 0.6087284744869788, "learning_rate": 7.0978464501938e-06, "loss": 0.3497285842895508, "num_input_tokens_seen": 344714768, "step": 5680, "train_runtime": 73922.9284, "train_tokens_per_second": 4663.164 }, { "epoch": 0.7251275510204082, "grad_norm": 0.5739136579301118, "learning_rate": 7.093298687687141e-06, "loss": 0.3339118242263794, "num_input_tokens_seen": 345026816, "step": 5685, "train_runtime": 73988.7422, "train_tokens_per_second": 4663.234 }, { "epoch": 0.7257653061224489, "grad_norm": 0.692778186737699, "learning_rate": 7.088748824409053e-06, "loss": 0.36696739196777345, "num_input_tokens_seen": 345326376, "step": 5690, "train_runtime": 74052.1506, "train_tokens_per_second": 4663.286 }, { "epoch": 0.7264030612244898, "grad_norm": 0.6108096494683619, "learning_rate": 7.084196864925643e-06, "loss": 0.3174098491668701, "num_input_tokens_seen": 345631752, "step": 5695, "train_runtime": 74115.11, "train_tokens_per_second": 4663.445 }, { "epoch": 0.7270408163265306, "grad_norm": 0.6099136171760403, "learning_rate": 7.079642813805118e-06, "loss": 0.33266453742980956, "num_input_tokens_seen": 345940288, "step": 5700, "train_runtime": 74177.7298, "train_tokens_per_second": 4663.668 }, { "epoch": 0.7276785714285714, "grad_norm": 0.6145960848559486, "learning_rate": 7.075086675617788e-06, "loss": 0.33375253677368166, "num_input_tokens_seen": 346246208, "step": 5705, "train_runtime": 74241.1258, "train_tokens_per_second": 4663.806 }, { "epoch": 0.7283163265306123, "grad_norm": 0.6647919581563738, "learning_rate": 7.070528454936054e-06, "loss": 0.3297909736633301, "num_input_tokens_seen": 346546152, "step": 5710, "train_runtime": 74299.9081, "train_tokens_per_second": 4664.153 }, { "epoch": 0.7289540816326531, "grad_norm": 0.6745637918147991, "learning_rate": 7.065968156334413e-06, "loss": 0.3185250759124756, "num_input_tokens_seen": 346831096, "step": 5715, "train_runtime": 74366.2627, "train_tokens_per_second": 4663.823 }, { "epoch": 0.7295918367346939, "grad_norm": 0.5538137665844209, "learning_rate": 7.061405784389438e-06, "loss": 0.32861080169677737, "num_input_tokens_seen": 347131824, "step": 5720, "train_runtime": 74417.165, "train_tokens_per_second": 4664.674 }, { "epoch": 0.7302295918367347, "grad_norm": 0.6141795221101976, "learning_rate": 7.05684134367979e-06, "loss": 0.33352041244506836, "num_input_tokens_seen": 347433720, "step": 5725, "train_runtime": 74481.5452, "train_tokens_per_second": 4664.695 }, { "epoch": 0.7308673469387755, "grad_norm": 0.6315137917901033, "learning_rate": 7.052274838786204e-06, "loss": 0.3256068706512451, "num_input_tokens_seen": 347739456, "step": 5730, "train_runtime": 74545.587, "train_tokens_per_second": 4664.789 }, { "epoch": 0.7315051020408163, "grad_norm": 0.5899822147597998, "learning_rate": 7.047706274291488e-06, "loss": 0.3421637535095215, "num_input_tokens_seen": 348042144, "step": 5735, "train_runtime": 74611.9649, "train_tokens_per_second": 4664.696 }, { "epoch": 0.7321428571428571, "grad_norm": 0.6383420146332125, "learning_rate": 7.043135654780513e-06, "loss": 0.3239234447479248, "num_input_tokens_seen": 348349184, "step": 5740, "train_runtime": 74673.1392, "train_tokens_per_second": 4664.986 }, { "epoch": 0.732780612244898, "grad_norm": 0.6647982665082789, "learning_rate": 7.038562984840216e-06, "loss": 0.3468273878097534, "num_input_tokens_seen": 348657576, "step": 5745, "train_runtime": 74743.6028, "train_tokens_per_second": 4664.715 }, { "epoch": 0.7334183673469388, "grad_norm": 0.6360341258895988, "learning_rate": 7.033988269059593e-06, "loss": 0.35527334213256834, "num_input_tokens_seen": 348959448, "step": 5750, "train_runtime": 74818.5321, "train_tokens_per_second": 4664.078 }, { "epoch": 0.7340561224489796, "grad_norm": 0.6551149745352199, "learning_rate": 7.029411512029687e-06, "loss": 0.3083681583404541, "num_input_tokens_seen": 349278664, "step": 5755, "train_runtime": 74884.9479, "train_tokens_per_second": 4664.204 }, { "epoch": 0.7346938775510204, "grad_norm": 0.5597358503159139, "learning_rate": 7.024832718343594e-06, "loss": 0.3165610313415527, "num_input_tokens_seen": 349589600, "step": 5760, "train_runtime": 74936.2695, "train_tokens_per_second": 4665.159 }, { "epoch": 0.7353316326530612, "grad_norm": 0.602928020388534, "learning_rate": 7.020251892596456e-06, "loss": 0.30977587699890136, "num_input_tokens_seen": 349870128, "step": 5765, "train_runtime": 74992.9054, "train_tokens_per_second": 4665.376 }, { "epoch": 0.735969387755102, "grad_norm": 0.559042510700635, "learning_rate": 7.015669039385449e-06, "loss": 0.33393781185150145, "num_input_tokens_seen": 350175688, "step": 5770, "train_runtime": 75048.7015, "train_tokens_per_second": 4665.979 }, { "epoch": 0.7366071428571429, "grad_norm": 0.6140008788178031, "learning_rate": 7.011084163309786e-06, "loss": 0.36183881759643555, "num_input_tokens_seen": 350475216, "step": 5775, "train_runtime": 75116.1318, "train_tokens_per_second": 4665.778 }, { "epoch": 0.7372448979591837, "grad_norm": 0.6520628271953471, "learning_rate": 7.006497268970712e-06, "loss": 0.33647539615631106, "num_input_tokens_seen": 350786336, "step": 5780, "train_runtime": 75182.9294, "train_tokens_per_second": 4665.771 }, { "epoch": 0.7378826530612245, "grad_norm": 0.6233474505973957, "learning_rate": 7.001908360971495e-06, "loss": 0.3370200634002686, "num_input_tokens_seen": 351099720, "step": 5785, "train_runtime": 75237.035, "train_tokens_per_second": 4666.581 }, { "epoch": 0.7385204081632653, "grad_norm": 0.7470598154815499, "learning_rate": 6.997317443917424e-06, "loss": 0.3196087121963501, "num_input_tokens_seen": 351392808, "step": 5790, "train_runtime": 75302.5827, "train_tokens_per_second": 4666.411 }, { "epoch": 0.7391581632653061, "grad_norm": 0.5461156408706147, "learning_rate": 6.9927245224158066e-06, "loss": 0.34132537841796873, "num_input_tokens_seen": 351698480, "step": 5795, "train_runtime": 75374.0898, "train_tokens_per_second": 4666.039 }, { "epoch": 0.7397959183673469, "grad_norm": 0.548528853606226, "learning_rate": 6.988129601075961e-06, "loss": 0.33192293643951415, "num_input_tokens_seen": 352000720, "step": 5800, "train_runtime": 75441.4729, "train_tokens_per_second": 4665.878 }, { "epoch": 0.7404336734693877, "grad_norm": 0.7104822501217407, "learning_rate": 6.983532684509208e-06, "loss": 0.34473247528076173, "num_input_tokens_seen": 352294224, "step": 5805, "train_runtime": 75506.1737, "train_tokens_per_second": 4665.767 }, { "epoch": 0.7410714285714286, "grad_norm": 0.5885968025978827, "learning_rate": 6.978933777328878e-06, "loss": 0.32946100234985354, "num_input_tokens_seen": 352604544, "step": 5810, "train_runtime": 75582.1313, "train_tokens_per_second": 4665.184 }, { "epoch": 0.7417091836734694, "grad_norm": 0.5862463096375644, "learning_rate": 6.974332884150292e-06, "loss": 0.33791561126708985, "num_input_tokens_seen": 352914192, "step": 5815, "train_runtime": 75655.7869, "train_tokens_per_second": 4664.735 }, { "epoch": 0.7423469387755102, "grad_norm": 0.6387843424603685, "learning_rate": 6.96973000959077e-06, "loss": 0.3198561191558838, "num_input_tokens_seen": 353228696, "step": 5820, "train_runtime": 75718.2625, "train_tokens_per_second": 4665.04 }, { "epoch": 0.7429846938775511, "grad_norm": 0.6156698937848678, "learning_rate": 6.965125158269619e-06, "loss": 0.3436471462249756, "num_input_tokens_seen": 353528736, "step": 5825, "train_runtime": 75785.1764, "train_tokens_per_second": 4664.88 }, { "epoch": 0.7436224489795918, "grad_norm": 0.6463215182094665, "learning_rate": 6.9605183348081265e-06, "loss": 0.35364034175872805, "num_input_tokens_seen": 353839872, "step": 5830, "train_runtime": 75838.2181, "train_tokens_per_second": 4665.72 }, { "epoch": 0.7442602040816326, "grad_norm": 0.5705940916617028, "learning_rate": 6.955909543829564e-06, "loss": 0.34197463989257815, "num_input_tokens_seen": 354148056, "step": 5835, "train_runtime": 75908.2897, "train_tokens_per_second": 4665.473 }, { "epoch": 0.7448979591836735, "grad_norm": 0.6150639786222485, "learning_rate": 6.951298789959172e-06, "loss": 0.32314419746398926, "num_input_tokens_seen": 354445568, "step": 5840, "train_runtime": 75979.1681, "train_tokens_per_second": 4665.036 }, { "epoch": 0.7455357142857143, "grad_norm": 0.5764764170987056, "learning_rate": 6.946686077824167e-06, "loss": 0.3016700267791748, "num_input_tokens_seen": 354726728, "step": 5845, "train_runtime": 76043.4819, "train_tokens_per_second": 4664.788 }, { "epoch": 0.7461734693877551, "grad_norm": 0.6244869964936728, "learning_rate": 6.942071412053728e-06, "loss": 0.3447637319564819, "num_input_tokens_seen": 355041640, "step": 5850, "train_runtime": 76102.5316, "train_tokens_per_second": 4665.307 }, { "epoch": 0.7468112244897959, "grad_norm": 0.5437386597279267, "learning_rate": 6.937454797278991e-06, "loss": 0.30813610553741455, "num_input_tokens_seen": 355341584, "step": 5855, "train_runtime": 76165.1398, "train_tokens_per_second": 4665.41 }, { "epoch": 0.7474489795918368, "grad_norm": 0.6129276896456994, "learning_rate": 6.932836238133054e-06, "loss": 0.332719612121582, "num_input_tokens_seen": 355644760, "step": 5860, "train_runtime": 76242.1853, "train_tokens_per_second": 4664.672 }, { "epoch": 0.7480867346938775, "grad_norm": 0.6254378993439251, "learning_rate": 6.928215739250963e-06, "loss": 0.3112212657928467, "num_input_tokens_seen": 355938224, "step": 5865, "train_runtime": 76316.5034, "train_tokens_per_second": 4663.974 }, { "epoch": 0.7487244897959183, "grad_norm": 0.7044378334523771, "learning_rate": 6.923593305269711e-06, "loss": 0.3458071708679199, "num_input_tokens_seen": 356230344, "step": 5870, "train_runtime": 76378.7704, "train_tokens_per_second": 4663.997 }, { "epoch": 0.7493622448979592, "grad_norm": 0.5746317383052223, "learning_rate": 6.9189689408282345e-06, "loss": 0.3587623119354248, "num_input_tokens_seen": 356541344, "step": 5875, "train_runtime": 76446.2596, "train_tokens_per_second": 4663.948 }, { "epoch": 0.75, "grad_norm": 0.5839156599948164, "learning_rate": 6.914342650567405e-06, "loss": 0.3423443794250488, "num_input_tokens_seen": 356855496, "step": 5880, "train_runtime": 76514.8126, "train_tokens_per_second": 4663.875 }, { "epoch": 0.7506377551020408, "grad_norm": 0.6067382079199007, "learning_rate": 6.9097144391300285e-06, "loss": 0.3316153287887573, "num_input_tokens_seen": 357168744, "step": 5885, "train_runtime": 76567.3764, "train_tokens_per_second": 4664.764 }, { "epoch": 0.7512755102040817, "grad_norm": 0.6851279100024733, "learning_rate": 6.905084311160837e-06, "loss": 0.3190103054046631, "num_input_tokens_seen": 357471984, "step": 5890, "train_runtime": 76635.8642, "train_tokens_per_second": 4664.552 }, { "epoch": 0.7519132653061225, "grad_norm": 0.6147269666210299, "learning_rate": 6.90045227130649e-06, "loss": 0.3483097076416016, "num_input_tokens_seen": 357782784, "step": 5895, "train_runtime": 76693.7951, "train_tokens_per_second": 4665.081 }, { "epoch": 0.7525510204081632, "grad_norm": 0.564602641320379, "learning_rate": 6.8958183242155615e-06, "loss": 0.323588228225708, "num_input_tokens_seen": 358089800, "step": 5900, "train_runtime": 76751.1814, "train_tokens_per_second": 4665.593 }, { "epoch": 0.7531887755102041, "grad_norm": 0.5601331958131273, "learning_rate": 6.891182474538539e-06, "loss": 0.33099820613861086, "num_input_tokens_seen": 358399920, "step": 5905, "train_runtime": 76813.0904, "train_tokens_per_second": 4665.87 }, { "epoch": 0.7538265306122449, "grad_norm": 0.7381218893687573, "learning_rate": 6.886544726927826e-06, "loss": 0.32611565589904784, "num_input_tokens_seen": 358705672, "step": 5910, "train_runtime": 76879.3853, "train_tokens_per_second": 4665.824 }, { "epoch": 0.7544642857142857, "grad_norm": 0.5983243405906501, "learning_rate": 6.881905086037721e-06, "loss": 0.3351559638977051, "num_input_tokens_seen": 359014616, "step": 5915, "train_runtime": 76946.6056, "train_tokens_per_second": 4665.763 }, { "epoch": 0.7551020408163265, "grad_norm": 0.6525149194121894, "learning_rate": 6.877263556524432e-06, "loss": 0.31889750957489016, "num_input_tokens_seen": 359320984, "step": 5920, "train_runtime": 77011.3336, "train_tokens_per_second": 4665.82 }, { "epoch": 0.7557397959183674, "grad_norm": 0.5305086071161054, "learning_rate": 6.872620143046056e-06, "loss": 0.29836535453796387, "num_input_tokens_seen": 359619040, "step": 5925, "train_runtime": 77078.6369, "train_tokens_per_second": 4665.612 }, { "epoch": 0.7563775510204082, "grad_norm": 0.664885483277217, "learning_rate": 6.867974850262582e-06, "loss": 0.32633788585662843, "num_input_tokens_seen": 359932688, "step": 5930, "train_runtime": 77129.9165, "train_tokens_per_second": 4666.577 }, { "epoch": 0.7570153061224489, "grad_norm": 0.5575635399142616, "learning_rate": 6.863327682835887e-06, "loss": 0.3186999559402466, "num_input_tokens_seen": 360249184, "step": 5935, "train_runtime": 77189.587, "train_tokens_per_second": 4667.07 }, { "epoch": 0.7576530612244898, "grad_norm": 0.6726497256065533, "learning_rate": 6.858678645429728e-06, "loss": 0.34361996650695803, "num_input_tokens_seen": 360550856, "step": 5940, "train_runtime": 77263.2271, "train_tokens_per_second": 4666.526 }, { "epoch": 0.7582908163265306, "grad_norm": 0.6385074144866467, "learning_rate": 6.85402774270974e-06, "loss": 0.3265536308288574, "num_input_tokens_seen": 360848560, "step": 5945, "train_runtime": 77328.4218, "train_tokens_per_second": 4666.442 }, { "epoch": 0.7589285714285714, "grad_norm": 0.5575980924675723, "learning_rate": 6.849374979343426e-06, "loss": 0.31394202709198, "num_input_tokens_seen": 361158960, "step": 5950, "train_runtime": 77385.6518, "train_tokens_per_second": 4667.002 }, { "epoch": 0.7595663265306123, "grad_norm": 0.5600620882620891, "learning_rate": 6.84472036000016e-06, "loss": 0.3174293518066406, "num_input_tokens_seen": 361465312, "step": 5955, "train_runtime": 77447.6671, "train_tokens_per_second": 4667.22 }, { "epoch": 0.7602040816326531, "grad_norm": 0.6357556763963484, "learning_rate": 6.840063889351177e-06, "loss": 0.3175032138824463, "num_input_tokens_seen": 361767408, "step": 5960, "train_runtime": 77518.7869, "train_tokens_per_second": 4666.835 }, { "epoch": 0.7608418367346939, "grad_norm": 0.6142886014161878, "learning_rate": 6.835405572069572e-06, "loss": 0.3279739856719971, "num_input_tokens_seen": 362078816, "step": 5965, "train_runtime": 77598.5194, "train_tokens_per_second": 4666.053 }, { "epoch": 0.7614795918367347, "grad_norm": 0.5718797437710346, "learning_rate": 6.830745412830291e-06, "loss": 0.3344055414199829, "num_input_tokens_seen": 362387792, "step": 5970, "train_runtime": 77667.0341, "train_tokens_per_second": 4665.915 }, { "epoch": 0.7621173469387755, "grad_norm": 0.6464457092923884, "learning_rate": 6.826083416310129e-06, "loss": 0.32223589420318605, "num_input_tokens_seen": 362684544, "step": 5975, "train_runtime": 77742.0732, "train_tokens_per_second": 4665.229 }, { "epoch": 0.7627551020408163, "grad_norm": 0.6462567337229259, "learning_rate": 6.821419587187727e-06, "loss": 0.3272323369979858, "num_input_tokens_seen": 363005704, "step": 5980, "train_runtime": 77794.6777, "train_tokens_per_second": 4666.202 }, { "epoch": 0.7633928571428571, "grad_norm": 0.629682432967277, "learning_rate": 6.816753930143558e-06, "loss": 0.33120250701904297, "num_input_tokens_seen": 363314248, "step": 5985, "train_runtime": 77857.4932, "train_tokens_per_second": 4666.401 }, { "epoch": 0.764030612244898, "grad_norm": 0.6084422932129973, "learning_rate": 6.812086449859941e-06, "loss": 0.3483760833740234, "num_input_tokens_seen": 363612824, "step": 5990, "train_runtime": 77917.3347, "train_tokens_per_second": 4666.649 }, { "epoch": 0.7646683673469388, "grad_norm": 0.6086043126291493, "learning_rate": 6.807417151021015e-06, "loss": 0.3102273464202881, "num_input_tokens_seen": 363903136, "step": 5995, "train_runtime": 77986.8113, "train_tokens_per_second": 4666.214 }, { "epoch": 0.7653061224489796, "grad_norm": 0.5253091189133416, "learning_rate": 6.802746038312749e-06, "loss": 0.3180234909057617, "num_input_tokens_seen": 364214792, "step": 6000, "train_runtime": 78058.1001, "train_tokens_per_second": 4665.945 }, { "epoch": 0.7659438775510204, "grad_norm": 0.5865611367250618, "learning_rate": 6.79807311642293e-06, "loss": 0.308447003364563, "num_input_tokens_seen": 364516496, "step": 6005, "train_runtime": 78123.6172, "train_tokens_per_second": 4665.894 }, { "epoch": 0.7665816326530612, "grad_norm": 0.742585427058255, "learning_rate": 6.793398390041159e-06, "loss": 0.3338149070739746, "num_input_tokens_seen": 364812400, "step": 6010, "train_runtime": 78177.1426, "train_tokens_per_second": 4666.484 }, { "epoch": 0.767219387755102, "grad_norm": 0.6279573157717177, "learning_rate": 6.788721863858856e-06, "loss": 0.32828316688537595, "num_input_tokens_seen": 365116488, "step": 6015, "train_runtime": 78245.1961, "train_tokens_per_second": 4666.312 }, { "epoch": 0.7678571428571429, "grad_norm": 0.601824542408468, "learning_rate": 6.784043542569236e-06, "loss": 0.34796159267425536, "num_input_tokens_seen": 365417272, "step": 6020, "train_runtime": 78317.7469, "train_tokens_per_second": 4665.83 }, { "epoch": 0.7684948979591837, "grad_norm": 0.6150796694963792, "learning_rate": 6.7793634308673265e-06, "loss": 0.33051772117614747, "num_input_tokens_seen": 365734064, "step": 6025, "train_runtime": 78377.152, "train_tokens_per_second": 4666.335 }, { "epoch": 0.7691326530612245, "grad_norm": 0.6046368366820677, "learning_rate": 6.7746815334499426e-06, "loss": 0.36424710750579836, "num_input_tokens_seen": 366049464, "step": 6030, "train_runtime": 78448.8901, "train_tokens_per_second": 4666.089 }, { "epoch": 0.7697704081632653, "grad_norm": 0.5750524833227629, "learning_rate": 6.7699978550156954e-06, "loss": 0.32325961589813235, "num_input_tokens_seen": 366343576, "step": 6035, "train_runtime": 78515.9379, "train_tokens_per_second": 4665.85 }, { "epoch": 0.7704081632653061, "grad_norm": 0.5626232096953089, "learning_rate": 6.765312400264985e-06, "loss": 0.3155065059661865, "num_input_tokens_seen": 366636248, "step": 6040, "train_runtime": 78588.1266, "train_tokens_per_second": 4665.288 }, { "epoch": 0.7710459183673469, "grad_norm": 0.558817365723986, "learning_rate": 6.760625173899992e-06, "loss": 0.337229585647583, "num_input_tokens_seen": 366941976, "step": 6045, "train_runtime": 78664.9058, "train_tokens_per_second": 4664.621 }, { "epoch": 0.7716836734693877, "grad_norm": 0.6399197605548381, "learning_rate": 6.755936180624674e-06, "loss": 0.32468380928039553, "num_input_tokens_seen": 367248712, "step": 6050, "train_runtime": 78735.3628, "train_tokens_per_second": 4664.343 }, { "epoch": 0.7723214285714286, "grad_norm": 0.5470693399519958, "learning_rate": 6.751245425144765e-06, "loss": 0.32178239822387694, "num_input_tokens_seen": 367551760, "step": 6055, "train_runtime": 78809.3, "train_tokens_per_second": 4663.812 }, { "epoch": 0.7729591836734694, "grad_norm": 0.5914673884446321, "learning_rate": 6.746552912167766e-06, "loss": 0.32709217071533203, "num_input_tokens_seen": 367848936, "step": 6060, "train_runtime": 78872.5468, "train_tokens_per_second": 4663.84 }, { "epoch": 0.7735969387755102, "grad_norm": 0.5501746225450489, "learning_rate": 6.741858646402941e-06, "loss": 0.3186192035675049, "num_input_tokens_seen": 368142096, "step": 6065, "train_runtime": 78931.2452, "train_tokens_per_second": 4664.086 }, { "epoch": 0.7742346938775511, "grad_norm": 0.609968757706805, "learning_rate": 6.737162632561311e-06, "loss": 0.3359341621398926, "num_input_tokens_seen": 368445424, "step": 6070, "train_runtime": 78992.8181, "train_tokens_per_second": 4664.29 }, { "epoch": 0.7748724489795918, "grad_norm": 0.6369744096594077, "learning_rate": 6.732464875355657e-06, "loss": 0.31608850955963136, "num_input_tokens_seen": 368733496, "step": 6075, "train_runtime": 79057.457, "train_tokens_per_second": 4664.12 }, { "epoch": 0.7755102040816326, "grad_norm": 0.6393426913398693, "learning_rate": 6.7277653795005085e-06, "loss": 0.3017498254776001, "num_input_tokens_seen": 369034840, "step": 6080, "train_runtime": 79130.8288, "train_tokens_per_second": 4663.604 }, { "epoch": 0.7761479591836735, "grad_norm": 0.6038968306160026, "learning_rate": 6.723064149712131e-06, "loss": 0.32140769958496096, "num_input_tokens_seen": 369326688, "step": 6085, "train_runtime": 79203.3952, "train_tokens_per_second": 4663.016 }, { "epoch": 0.7767857142857143, "grad_norm": 0.5825328672269104, "learning_rate": 6.718361190708542e-06, "loss": 0.3158728122711182, "num_input_tokens_seen": 369618520, "step": 6090, "train_runtime": 79271.1472, "train_tokens_per_second": 4662.712 }, { "epoch": 0.7774234693877551, "grad_norm": 0.6176295264548202, "learning_rate": 6.713656507209489e-06, "loss": 0.33606772422790526, "num_input_tokens_seen": 369926744, "step": 6095, "train_runtime": 79348.8362, "train_tokens_per_second": 4662.031 }, { "epoch": 0.7780612244897959, "grad_norm": 0.6662682504949609, "learning_rate": 6.708950103936448e-06, "loss": 0.34429340362548827, "num_input_tokens_seen": 370215696, "step": 6100, "train_runtime": 79408.8203, "train_tokens_per_second": 4662.148 }, { "epoch": 0.7786989795918368, "grad_norm": 0.5750509168739135, "learning_rate": 6.704241985612625e-06, "loss": 0.3338142395019531, "num_input_tokens_seen": 370522096, "step": 6105, "train_runtime": 79476.6215, "train_tokens_per_second": 4662.026 }, { "epoch": 0.7793367346938775, "grad_norm": 0.6224476023884783, "learning_rate": 6.699532156962945e-06, "loss": 0.35149459838867186, "num_input_tokens_seen": 370830696, "step": 6110, "train_runtime": 79542.6319, "train_tokens_per_second": 4662.037 }, { "epoch": 0.7799744897959183, "grad_norm": 0.6121664876685937, "learning_rate": 6.6948206227140525e-06, "loss": 0.310459041595459, "num_input_tokens_seen": 371121648, "step": 6115, "train_runtime": 79610.8168, "train_tokens_per_second": 4661.699 }, { "epoch": 0.7806122448979592, "grad_norm": 0.7352469724085692, "learning_rate": 6.690107387594298e-06, "loss": 0.33449711799621584, "num_input_tokens_seen": 371420784, "step": 6120, "train_runtime": 79676.8981, "train_tokens_per_second": 4661.587 }, { "epoch": 0.78125, "grad_norm": 0.5947004628298128, "learning_rate": 6.685392456333744e-06, "loss": 0.34175596237182615, "num_input_tokens_seen": 371734544, "step": 6125, "train_runtime": 79741.5568, "train_tokens_per_second": 4661.742 }, { "epoch": 0.7818877551020408, "grad_norm": 0.8740188356488516, "learning_rate": 6.680675833664151e-06, "loss": 0.3424098491668701, "num_input_tokens_seen": 372041800, "step": 6130, "train_runtime": 79805.6374, "train_tokens_per_second": 4661.849 }, { "epoch": 0.7825255102040817, "grad_norm": 0.6536618358080417, "learning_rate": 6.67595752431898e-06, "loss": 0.3392969608306885, "num_input_tokens_seen": 372345688, "step": 6135, "train_runtime": 79870.8449, "train_tokens_per_second": 4661.847 }, { "epoch": 0.7831632653061225, "grad_norm": 0.5551735279679838, "learning_rate": 6.671237533033388e-06, "loss": 0.3433082580566406, "num_input_tokens_seen": 372652808, "step": 6140, "train_runtime": 79935.6229, "train_tokens_per_second": 4661.912 }, { "epoch": 0.7838010204081632, "grad_norm": 0.6893147550496415, "learning_rate": 6.66651586454421e-06, "loss": 0.3486523151397705, "num_input_tokens_seen": 372959856, "step": 6145, "train_runtime": 80009.8612, "train_tokens_per_second": 4661.424 }, { "epoch": 0.7844387755102041, "grad_norm": 0.6584184347838129, "learning_rate": 6.661792523589972e-06, "loss": 0.32809312343597413, "num_input_tokens_seen": 373252488, "step": 6150, "train_runtime": 80065.2693, "train_tokens_per_second": 4661.853 }, { "epoch": 0.7850765306122449, "grad_norm": 0.6952856515693691, "learning_rate": 6.65706751491088e-06, "loss": 0.31272296905517577, "num_input_tokens_seen": 373532416, "step": 6155, "train_runtime": 80123.0032, "train_tokens_per_second": 4661.987 }, { "epoch": 0.7857142857142857, "grad_norm": 0.598605271188881, "learning_rate": 6.652340843248806e-06, "loss": 0.32628664970397947, "num_input_tokens_seen": 373842496, "step": 6160, "train_runtime": 80185.1956, "train_tokens_per_second": 4662.238 }, { "epoch": 0.7863520408163265, "grad_norm": 0.6160544936173801, "learning_rate": 6.647612513347297e-06, "loss": 0.3464928150177002, "num_input_tokens_seen": 374144912, "step": 6165, "train_runtime": 80247.2719, "train_tokens_per_second": 4662.4 }, { "epoch": 0.7869897959183674, "grad_norm": 0.6015077295812333, "learning_rate": 6.642882529951561e-06, "loss": 0.3017390727996826, "num_input_tokens_seen": 374445840, "step": 6170, "train_runtime": 80308.8766, "train_tokens_per_second": 4662.571 }, { "epoch": 0.7876275510204082, "grad_norm": 0.5709503751639645, "learning_rate": 6.638150897808469e-06, "loss": 0.32829220294952394, "num_input_tokens_seen": 374751360, "step": 6175, "train_runtime": 80373.3675, "train_tokens_per_second": 4662.631 }, { "epoch": 0.7882653061224489, "grad_norm": 0.6255217183603037, "learning_rate": 6.6334176216665406e-06, "loss": 0.35643610954284666, "num_input_tokens_seen": 375070264, "step": 6180, "train_runtime": 80446.5686, "train_tokens_per_second": 4662.353 }, { "epoch": 0.7889030612244898, "grad_norm": 0.6107073525501082, "learning_rate": 6.628682706275953e-06, "loss": 0.3124289035797119, "num_input_tokens_seen": 375387304, "step": 6185, "train_runtime": 80516.9307, "train_tokens_per_second": 4662.216 }, { "epoch": 0.7895408163265306, "grad_norm": 0.524448236617867, "learning_rate": 6.623946156388523e-06, "loss": 0.31171629428863523, "num_input_tokens_seen": 375695664, "step": 6190, "train_runtime": 80579.8189, "train_tokens_per_second": 4662.404 }, { "epoch": 0.7901785714285714, "grad_norm": 0.5649584088837674, "learning_rate": 6.619207976757708e-06, "loss": 0.3073967218399048, "num_input_tokens_seen": 376000720, "step": 6195, "train_runtime": 80650.7899, "train_tokens_per_second": 4662.084 }, { "epoch": 0.7908163265306123, "grad_norm": 0.5932107758307361, "learning_rate": 6.614468172138603e-06, "loss": 0.33098201751708983, "num_input_tokens_seen": 376307968, "step": 6200, "train_runtime": 80718.4357, "train_tokens_per_second": 4661.983 }, { "epoch": 0.7914540816326531, "grad_norm": 0.7436937706248128, "learning_rate": 6.609726747287934e-06, "loss": 0.36113386154174804, "num_input_tokens_seen": 376615000, "step": 6205, "train_runtime": 80785.8571, "train_tokens_per_second": 4661.893 }, { "epoch": 0.7920918367346939, "grad_norm": 0.594063557630725, "learning_rate": 6.60498370696405e-06, "loss": 0.33744571208953855, "num_input_tokens_seen": 376925336, "step": 6210, "train_runtime": 80852.5824, "train_tokens_per_second": 4661.884 }, { "epoch": 0.7927295918367347, "grad_norm": 0.6226478270178896, "learning_rate": 6.600239055926923e-06, "loss": 0.32979750633239746, "num_input_tokens_seen": 377234936, "step": 6215, "train_runtime": 80919.1383, "train_tokens_per_second": 4661.875 }, { "epoch": 0.7933673469387755, "grad_norm": 0.5730911412772792, "learning_rate": 6.595492798938146e-06, "loss": 0.31255078315734863, "num_input_tokens_seen": 377545848, "step": 6220, "train_runtime": 80998.3094, "train_tokens_per_second": 4661.157 }, { "epoch": 0.7940051020408163, "grad_norm": 0.5987700994193833, "learning_rate": 6.5907449407609145e-06, "loss": 0.31581578254699705, "num_input_tokens_seen": 377855984, "step": 6225, "train_runtime": 81053.4701, "train_tokens_per_second": 4661.811 }, { "epoch": 0.7946428571428571, "grad_norm": 0.6665221316079585, "learning_rate": 6.585995486160038e-06, "loss": 0.34901602268218995, "num_input_tokens_seen": 378147568, "step": 6230, "train_runtime": 81127.3373, "train_tokens_per_second": 4661.161 }, { "epoch": 0.795280612244898, "grad_norm": 0.5583686682811075, "learning_rate": 6.581244439901926e-06, "loss": 0.32438206672668457, "num_input_tokens_seen": 378444336, "step": 6235, "train_runtime": 81201.6598, "train_tokens_per_second": 4660.549 }, { "epoch": 0.7959183673469388, "grad_norm": 0.6452049423092018, "learning_rate": 6.576491806754583e-06, "loss": 0.33559203147888184, "num_input_tokens_seen": 378743920, "step": 6240, "train_runtime": 81276.0583, "train_tokens_per_second": 4659.969 }, { "epoch": 0.7965561224489796, "grad_norm": 0.6689246592368139, "learning_rate": 6.571737591487611e-06, "loss": 0.3278643131256104, "num_input_tokens_seen": 379029696, "step": 6245, "train_runtime": 81347.8642, "train_tokens_per_second": 4659.369 }, { "epoch": 0.7971938775510204, "grad_norm": 0.627908531821963, "learning_rate": 6.566981798872196e-06, "loss": 0.3245952844619751, "num_input_tokens_seen": 379328424, "step": 6250, "train_runtime": 81402.2374, "train_tokens_per_second": 4659.926 }, { "epoch": 0.7978316326530612, "grad_norm": 0.5954047788072642, "learning_rate": 6.562224433681108e-06, "loss": 0.3304758071899414, "num_input_tokens_seen": 379631176, "step": 6255, "train_runtime": 81470.7054, "train_tokens_per_second": 4659.726 }, { "epoch": 0.798469387755102, "grad_norm": 0.6123728605895805, "learning_rate": 6.557465500688696e-06, "loss": 0.32650887966156006, "num_input_tokens_seen": 379935264, "step": 6260, "train_runtime": 81529.9905, "train_tokens_per_second": 4660.068 }, { "epoch": 0.7991071428571429, "grad_norm": 0.5951134259675872, "learning_rate": 6.55270500467088e-06, "loss": 0.332712984085083, "num_input_tokens_seen": 380227320, "step": 6265, "train_runtime": 81590.636, "train_tokens_per_second": 4660.183 }, { "epoch": 0.7997448979591837, "grad_norm": 0.6662929709457899, "learning_rate": 6.5479429504051526e-06, "loss": 0.3316300392150879, "num_input_tokens_seen": 380549496, "step": 6270, "train_runtime": 81653.2872, "train_tokens_per_second": 4660.553 }, { "epoch": 0.8003826530612245, "grad_norm": 0.6135397745851576, "learning_rate": 6.543179342670565e-06, "loss": 0.33006997108459474, "num_input_tokens_seen": 380858120, "step": 6275, "train_runtime": 81712.2338, "train_tokens_per_second": 4660.968 }, { "epoch": 0.8010204081632653, "grad_norm": 0.5700410729663047, "learning_rate": 6.53841418624773e-06, "loss": 0.3384885311126709, "num_input_tokens_seen": 381172088, "step": 6280, "train_runtime": 81769.3396, "train_tokens_per_second": 4661.553 }, { "epoch": 0.8016581632653061, "grad_norm": 0.6802979132660769, "learning_rate": 6.53364748591882e-06, "loss": 0.31926870346069336, "num_input_tokens_seen": 381480256, "step": 6285, "train_runtime": 81844.5595, "train_tokens_per_second": 4661.034 }, { "epoch": 0.8022959183673469, "grad_norm": 0.5752546558654944, "learning_rate": 6.528879246467546e-06, "loss": 0.3026753902435303, "num_input_tokens_seen": 381790184, "step": 6290, "train_runtime": 81924.4838, "train_tokens_per_second": 4660.27 }, { "epoch": 0.8029336734693877, "grad_norm": 0.5934807419403207, "learning_rate": 6.524109472679172e-06, "loss": 0.32082395553588866, "num_input_tokens_seen": 382099120, "step": 6295, "train_runtime": 81985.387, "train_tokens_per_second": 4660.576 }, { "epoch": 0.8035714285714286, "grad_norm": 0.5961198320827925, "learning_rate": 6.519338169340499e-06, "loss": 0.3002665042877197, "num_input_tokens_seen": 382391256, "step": 6300, "train_runtime": 82055.3024, "train_tokens_per_second": 4660.165 }, { "epoch": 0.8042091836734694, "grad_norm": 0.663586778912891, "learning_rate": 6.514565341239861e-06, "loss": 0.35150899887084963, "num_input_tokens_seen": 382694608, "step": 6305, "train_runtime": 82129.8251, "train_tokens_per_second": 4659.63 }, { "epoch": 0.8048469387755102, "grad_norm": 0.557004826692435, "learning_rate": 6.509790993167129e-06, "loss": 0.3224548578262329, "num_input_tokens_seen": 382998672, "step": 6310, "train_runtime": 82197.7839, "train_tokens_per_second": 4659.477 }, { "epoch": 0.8054846938775511, "grad_norm": 0.6436670145346937, "learning_rate": 6.505015129913689e-06, "loss": 0.32113525867462156, "num_input_tokens_seen": 383300808, "step": 6315, "train_runtime": 82263.0179, "train_tokens_per_second": 4659.455 }, { "epoch": 0.8061224489795918, "grad_norm": 0.6013563442523447, "learning_rate": 6.5002377562724585e-06, "loss": 0.31710638999938967, "num_input_tokens_seen": 383597304, "step": 6320, "train_runtime": 82326.0654, "train_tokens_per_second": 4659.488 }, { "epoch": 0.8067602040816326, "grad_norm": 0.7658646999119676, "learning_rate": 6.495458877037861e-06, "loss": 0.3188472747802734, "num_input_tokens_seen": 383907680, "step": 6325, "train_runtime": 82382.2507, "train_tokens_per_second": 4660.078 }, { "epoch": 0.8073979591836735, "grad_norm": 0.6187017459527038, "learning_rate": 6.490678497005839e-06, "loss": 0.3157522678375244, "num_input_tokens_seen": 384204280, "step": 6330, "train_runtime": 82453.6683, "train_tokens_per_second": 4659.638 }, { "epoch": 0.8080357142857143, "grad_norm": 0.6037166420742117, "learning_rate": 6.485896620973836e-06, "loss": 0.33968181610107423, "num_input_tokens_seen": 384514248, "step": 6335, "train_runtime": 82518.7284, "train_tokens_per_second": 4659.721 }, { "epoch": 0.8086734693877551, "grad_norm": 0.6461015234705619, "learning_rate": 6.481113253740799e-06, "loss": 0.31825881004333495, "num_input_tokens_seen": 384818136, "step": 6340, "train_runtime": 82591.5828, "train_tokens_per_second": 4659.29 }, { "epoch": 0.8093112244897959, "grad_norm": 0.6236157216796101, "learning_rate": 6.4763284001071715e-06, "loss": 0.32604708671569826, "num_input_tokens_seen": 385109072, "step": 6345, "train_runtime": 82662.8348, "train_tokens_per_second": 4658.793 }, { "epoch": 0.8099489795918368, "grad_norm": 0.617790913547995, "learning_rate": 6.4715420648748875e-06, "loss": 0.3351900577545166, "num_input_tokens_seen": 385425072, "step": 6350, "train_runtime": 82708.7407, "train_tokens_per_second": 4660.028 }, { "epoch": 0.8105867346938775, "grad_norm": 0.6086106861541603, "learning_rate": 6.46675425284737e-06, "loss": 0.31918950080871583, "num_input_tokens_seen": 385746512, "step": 6355, "train_runtime": 82770.1291, "train_tokens_per_second": 4660.456 }, { "epoch": 0.8112244897959183, "grad_norm": 0.5931590625891464, "learning_rate": 6.461964968829521e-06, "loss": 0.33324904441833497, "num_input_tokens_seen": 386044952, "step": 6360, "train_runtime": 82838.0062, "train_tokens_per_second": 4660.24 }, { "epoch": 0.8118622448979592, "grad_norm": 0.6622398128993591, "learning_rate": 6.457174217627722e-06, "loss": 0.3209887981414795, "num_input_tokens_seen": 386342120, "step": 6365, "train_runtime": 82905.0683, "train_tokens_per_second": 4660.054 }, { "epoch": 0.8125, "grad_norm": 0.6323717940288658, "learning_rate": 6.452382004049829e-06, "loss": 0.33527679443359376, "num_input_tokens_seen": 386646536, "step": 6370, "train_runtime": 82976.4238, "train_tokens_per_second": 4659.716 }, { "epoch": 0.8131377551020408, "grad_norm": 0.569865981444307, "learning_rate": 6.447588332905159e-06, "loss": 0.3298801422119141, "num_input_tokens_seen": 386949672, "step": 6375, "train_runtime": 83034.7558, "train_tokens_per_second": 4660.093 }, { "epoch": 0.8137755102040817, "grad_norm": 0.6043021041929536, "learning_rate": 6.4427932090044975e-06, "loss": 0.31019001007080077, "num_input_tokens_seen": 387249864, "step": 6380, "train_runtime": 83095.7845, "train_tokens_per_second": 4660.283 }, { "epoch": 0.8144132653061225, "grad_norm": 0.6370069942377361, "learning_rate": 6.437996637160086e-06, "loss": 0.30964839458465576, "num_input_tokens_seen": 387560656, "step": 6385, "train_runtime": 83159.147, "train_tokens_per_second": 4660.469 }, { "epoch": 0.8150510204081632, "grad_norm": 0.6015292072296982, "learning_rate": 6.433198622185621e-06, "loss": 0.3111919403076172, "num_input_tokens_seen": 387871280, "step": 6390, "train_runtime": 83225.6121, "train_tokens_per_second": 4660.48 }, { "epoch": 0.8156887755102041, "grad_norm": 0.6271936646021271, "learning_rate": 6.428399168896244e-06, "loss": 0.32283749580383303, "num_input_tokens_seen": 388172504, "step": 6395, "train_runtime": 83297.3809, "train_tokens_per_second": 4660.081 }, { "epoch": 0.8163265306122449, "grad_norm": 0.5838022923142084, "learning_rate": 6.423598282108541e-06, "loss": 0.3457418203353882, "num_input_tokens_seen": 388470624, "step": 6400, "train_runtime": 83363.089, "train_tokens_per_second": 4659.984 }, { "epoch": 0.8169642857142857, "grad_norm": 0.6815142257501933, "learning_rate": 6.41879596664054e-06, "loss": 0.3063065767288208, "num_input_tokens_seen": 388756200, "step": 6405, "train_runtime": 83431.8978, "train_tokens_per_second": 4659.563 }, { "epoch": 0.8176020408163265, "grad_norm": 0.6545595194246681, "learning_rate": 6.413992227311695e-06, "loss": 0.3302279472351074, "num_input_tokens_seen": 389061280, "step": 6410, "train_runtime": 83500.2499, "train_tokens_per_second": 4659.403 }, { "epoch": 0.8182397959183674, "grad_norm": 0.7018484712197044, "learning_rate": 6.409187068942899e-06, "loss": 0.34242465496063235, "num_input_tokens_seen": 389359968, "step": 6415, "train_runtime": 83569.2757, "train_tokens_per_second": 4659.128 }, { "epoch": 0.8188775510204082, "grad_norm": 0.6389283896565507, "learning_rate": 6.4043804963564616e-06, "loss": 0.3474923610687256, "num_input_tokens_seen": 389657360, "step": 6420, "train_runtime": 83635.9142, "train_tokens_per_second": 4658.972 }, { "epoch": 0.8195153061224489, "grad_norm": 0.7848232670416885, "learning_rate": 6.399572514376114e-06, "loss": 0.32995893955230715, "num_input_tokens_seen": 389956520, "step": 6425, "train_runtime": 83704.6178, "train_tokens_per_second": 4658.722 }, { "epoch": 0.8201530612244898, "grad_norm": 0.5588125579339422, "learning_rate": 6.394763127827001e-06, "loss": 0.34971914291381834, "num_input_tokens_seen": 390262136, "step": 6430, "train_runtime": 83769.1158, "train_tokens_per_second": 4658.783 }, { "epoch": 0.8207908163265306, "grad_norm": 0.5891738832949114, "learning_rate": 6.389952341535681e-06, "loss": 0.31062195301055906, "num_input_tokens_seen": 390557592, "step": 6435, "train_runtime": 83829.2771, "train_tokens_per_second": 4658.964 }, { "epoch": 0.8214285714285714, "grad_norm": 0.6444968160053899, "learning_rate": 6.385140160330113e-06, "loss": 0.3330610036849976, "num_input_tokens_seen": 390863264, "step": 6440, "train_runtime": 83900.8256, "train_tokens_per_second": 4658.634 }, { "epoch": 0.8220663265306123, "grad_norm": 0.6268657531488134, "learning_rate": 6.380326589039653e-06, "loss": 0.3594696521759033, "num_input_tokens_seen": 391172112, "step": 6445, "train_runtime": 83963.7395, "train_tokens_per_second": 4658.822 }, { "epoch": 0.8227040816326531, "grad_norm": 0.5742508108223557, "learning_rate": 6.375511632495062e-06, "loss": 0.3546117305755615, "num_input_tokens_seen": 391471568, "step": 6450, "train_runtime": 84028.32, "train_tokens_per_second": 4658.805 }, { "epoch": 0.8233418367346939, "grad_norm": 0.5760720307562832, "learning_rate": 6.370695295528482e-06, "loss": 0.31263294219970705, "num_input_tokens_seen": 391776424, "step": 6455, "train_runtime": 84107.7425, "train_tokens_per_second": 4658.03 }, { "epoch": 0.8239795918367347, "grad_norm": 0.6013164979326018, "learning_rate": 6.365877582973442e-06, "loss": 0.31137876510620116, "num_input_tokens_seen": 392070888, "step": 6460, "train_runtime": 84172.343, "train_tokens_per_second": 4657.954 }, { "epoch": 0.8246173469387755, "grad_norm": 0.6567154381584758, "learning_rate": 6.361058499664856e-06, "loss": 0.3098623514175415, "num_input_tokens_seen": 392367136, "step": 6465, "train_runtime": 84242.7761, "train_tokens_per_second": 4657.576 }, { "epoch": 0.8252551020408163, "grad_norm": 0.5720345799826225, "learning_rate": 6.3562380504390095e-06, "loss": 0.33841404914855955, "num_input_tokens_seen": 392670760, "step": 6470, "train_runtime": 84306.1391, "train_tokens_per_second": 4657.677 }, { "epoch": 0.8258928571428571, "grad_norm": 0.5465239630144308, "learning_rate": 6.35141624013356e-06, "loss": 0.3283223628997803, "num_input_tokens_seen": 392969760, "step": 6475, "train_runtime": 84371.6456, "train_tokens_per_second": 4657.605 }, { "epoch": 0.826530612244898, "grad_norm": 0.5962936472643869, "learning_rate": 6.34659307358753e-06, "loss": 0.3258841037750244, "num_input_tokens_seen": 393274232, "step": 6480, "train_runtime": 84439.421, "train_tokens_per_second": 4657.472 }, { "epoch": 0.8271683673469388, "grad_norm": 0.5841123087828858, "learning_rate": 6.341768555641306e-06, "loss": 0.3115019083023071, "num_input_tokens_seen": 393577920, "step": 6485, "train_runtime": 84514.3281, "train_tokens_per_second": 4656.937 }, { "epoch": 0.8278061224489796, "grad_norm": 0.6525095785159231, "learning_rate": 6.3369426911366275e-06, "loss": 0.33711268901824953, "num_input_tokens_seen": 393884184, "step": 6490, "train_runtime": 84572.3308, "train_tokens_per_second": 4657.365 }, { "epoch": 0.8284438775510204, "grad_norm": 2.880153799858662, "learning_rate": 6.332115484916586e-06, "loss": 0.32443020343780515, "num_input_tokens_seen": 394188088, "step": 6495, "train_runtime": 84650.3639, "train_tokens_per_second": 4656.661 }, { "epoch": 0.8290816326530612, "grad_norm": 0.5806111511308769, "learning_rate": 6.327286941825621e-06, "loss": 0.32749388217926023, "num_input_tokens_seen": 394492024, "step": 6500, "train_runtime": 84718.2783, "train_tokens_per_second": 4656.516 }, { "epoch": 0.829719387755102, "grad_norm": 0.6463155758573111, "learning_rate": 6.322457066709511e-06, "loss": 0.3317603588104248, "num_input_tokens_seen": 394788840, "step": 6505, "train_runtime": 84780.2793, "train_tokens_per_second": 4656.612 }, { "epoch": 0.8303571428571429, "grad_norm": 0.5919753293216771, "learning_rate": 6.317625864415374e-06, "loss": 0.333458685874939, "num_input_tokens_seen": 395087728, "step": 6510, "train_runtime": 84844.7953, "train_tokens_per_second": 4656.594 }, { "epoch": 0.8309948979591837, "grad_norm": 0.5666796302862332, "learning_rate": 6.312793339791662e-06, "loss": 0.3259648323059082, "num_input_tokens_seen": 395396384, "step": 6515, "train_runtime": 84907.0552, "train_tokens_per_second": 4656.814 }, { "epoch": 0.8316326530612245, "grad_norm": 0.5467432627293126, "learning_rate": 6.307959497688146e-06, "loss": 0.3173699140548706, "num_input_tokens_seen": 395713712, "step": 6520, "train_runtime": 84961.0482, "train_tokens_per_second": 4657.59 }, { "epoch": 0.8322704081632653, "grad_norm": 0.5785933416138389, "learning_rate": 6.303124342955928e-06, "loss": 0.30993361473083497, "num_input_tokens_seen": 396025264, "step": 6525, "train_runtime": 85025.9291, "train_tokens_per_second": 4657.7 }, { "epoch": 0.8329081632653061, "grad_norm": 0.6734163619536873, "learning_rate": 6.29828788044742e-06, "loss": 0.35101368427276614, "num_input_tokens_seen": 396326840, "step": 6530, "train_runtime": 85090.5541, "train_tokens_per_second": 4657.707 }, { "epoch": 0.8335459183673469, "grad_norm": 0.5907392688328745, "learning_rate": 6.293450115016353e-06, "loss": 0.3599194765090942, "num_input_tokens_seen": 396631624, "step": 6535, "train_runtime": 85165.0064, "train_tokens_per_second": 4657.214 }, { "epoch": 0.8341836734693877, "grad_norm": 0.5737048833343137, "learning_rate": 6.288611051517761e-06, "loss": 0.30787858963012693, "num_input_tokens_seen": 396939384, "step": 6540, "train_runtime": 85226.8383, "train_tokens_per_second": 4657.446 }, { "epoch": 0.8348214285714286, "grad_norm": 0.627008135161107, "learning_rate": 6.283770694807983e-06, "loss": 0.33837013244628905, "num_input_tokens_seen": 397242280, "step": 6545, "train_runtime": 85285.1229, "train_tokens_per_second": 4657.814 }, { "epoch": 0.8354591836734694, "grad_norm": 0.5817710958056629, "learning_rate": 6.2789290497446546e-06, "loss": 0.32402629852294923, "num_input_tokens_seen": 397544432, "step": 6550, "train_runtime": 85338.2856, "train_tokens_per_second": 4658.453 }, { "epoch": 0.8360969387755102, "grad_norm": 0.5508573650397668, "learning_rate": 6.274086121186704e-06, "loss": 0.3160156011581421, "num_input_tokens_seen": 397846616, "step": 6555, "train_runtime": 85400.0057, "train_tokens_per_second": 4658.625 }, { "epoch": 0.8367346938775511, "grad_norm": 0.5698976746345229, "learning_rate": 6.269241913994348e-06, "loss": 0.3336780071258545, "num_input_tokens_seen": 398146648, "step": 6560, "train_runtime": 85464.9343, "train_tokens_per_second": 4658.597 }, { "epoch": 0.8373724489795918, "grad_norm": 0.58908453323151, "learning_rate": 6.264396433029089e-06, "loss": 0.31669230461120607, "num_input_tokens_seen": 398463520, "step": 6565, "train_runtime": 85526.4788, "train_tokens_per_second": 4658.949 }, { "epoch": 0.8380102040816326, "grad_norm": 0.5893894659322871, "learning_rate": 6.2595496831537025e-06, "loss": 0.33449468612670896, "num_input_tokens_seen": 398761768, "step": 6570, "train_runtime": 85602.5773, "train_tokens_per_second": 4658.292 }, { "epoch": 0.8386479591836735, "grad_norm": 0.5854698219730254, "learning_rate": 6.254701669232243e-06, "loss": 0.3276800632476807, "num_input_tokens_seen": 399063288, "step": 6575, "train_runtime": 85668.9507, "train_tokens_per_second": 4658.202 }, { "epoch": 0.8392857142857143, "grad_norm": 0.6087896103292258, "learning_rate": 6.24985239613003e-06, "loss": 0.3333900451660156, "num_input_tokens_seen": 399362432, "step": 6580, "train_runtime": 85729.04, "train_tokens_per_second": 4658.427 }, { "epoch": 0.8399234693877551, "grad_norm": 0.6761284159315526, "learning_rate": 6.24500186871365e-06, "loss": 0.3394115447998047, "num_input_tokens_seen": 399677872, "step": 6585, "train_runtime": 85790.9397, "train_tokens_per_second": 4658.742 }, { "epoch": 0.8405612244897959, "grad_norm": 0.6011641987499475, "learning_rate": 6.240150091850941e-06, "loss": 0.30324516296386717, "num_input_tokens_seen": 399979672, "step": 6590, "train_runtime": 85859.4699, "train_tokens_per_second": 4658.539 }, { "epoch": 0.8411989795918368, "grad_norm": 0.6934634797968782, "learning_rate": 6.235297070411004e-06, "loss": 0.30373287200927734, "num_input_tokens_seen": 400268008, "step": 6595, "train_runtime": 85913.442, "train_tokens_per_second": 4658.968 }, { "epoch": 0.8418367346938775, "grad_norm": 0.6383056643165729, "learning_rate": 6.230442809264186e-06, "loss": 0.32518959045410156, "num_input_tokens_seen": 400566488, "step": 6600, "train_runtime": 85986.5719, "train_tokens_per_second": 4658.477 }, { "epoch": 0.8424744897959183, "grad_norm": 0.6064798600689645, "learning_rate": 6.225587313282071e-06, "loss": 0.3347949981689453, "num_input_tokens_seen": 400862976, "step": 6605, "train_runtime": 86053.6311, "train_tokens_per_second": 4658.292 }, { "epoch": 0.8431122448979592, "grad_norm": 0.5976829840641008, "learning_rate": 6.220730587337496e-06, "loss": 0.3171133041381836, "num_input_tokens_seen": 401154544, "step": 6610, "train_runtime": 86112.3978, "train_tokens_per_second": 4658.499 }, { "epoch": 0.84375, "grad_norm": 0.9827168306828648, "learning_rate": 6.21587263630452e-06, "loss": 0.318402099609375, "num_input_tokens_seen": 401472632, "step": 6615, "train_runtime": 86171.9306, "train_tokens_per_second": 4658.972 }, { "epoch": 0.8443877551020408, "grad_norm": 0.7070664354739608, "learning_rate": 6.2110134650584355e-06, "loss": 0.3207444429397583, "num_input_tokens_seen": 401768440, "step": 6620, "train_runtime": 86239.9675, "train_tokens_per_second": 4658.727 }, { "epoch": 0.8450255102040817, "grad_norm": 0.6534442138463878, "learning_rate": 6.2061530784757625e-06, "loss": 0.32271835803985593, "num_input_tokens_seen": 402067584, "step": 6625, "train_runtime": 86305.4398, "train_tokens_per_second": 4658.659 }, { "epoch": 0.8456632653061225, "grad_norm": 0.6086535906849888, "learning_rate": 6.201291481434238e-06, "loss": 0.3248939275741577, "num_input_tokens_seen": 402378216, "step": 6630, "train_runtime": 86372.6655, "train_tokens_per_second": 4658.629 }, { "epoch": 0.8463010204081632, "grad_norm": 0.612229472029973, "learning_rate": 6.196428678812816e-06, "loss": 0.3274501323699951, "num_input_tokens_seen": 402690616, "step": 6635, "train_runtime": 86451.2395, "train_tokens_per_second": 4658.009 }, { "epoch": 0.8469387755102041, "grad_norm": 0.6880105099037892, "learning_rate": 6.191564675491653e-06, "loss": 0.3477298736572266, "num_input_tokens_seen": 402988264, "step": 6640, "train_runtime": 86515.0636, "train_tokens_per_second": 4658.013 }, { "epoch": 0.8475765306122449, "grad_norm": 0.5832688242674897, "learning_rate": 6.1866994763521215e-06, "loss": 0.3256032466888428, "num_input_tokens_seen": 403287792, "step": 6645, "train_runtime": 86585.9563, "train_tokens_per_second": 4657.658 }, { "epoch": 0.8482142857142857, "grad_norm": 0.7112080174273683, "learning_rate": 6.1818330862767864e-06, "loss": 0.3299060344696045, "num_input_tokens_seen": 403598584, "step": 6650, "train_runtime": 86662.1619, "train_tokens_per_second": 4657.149 }, { "epoch": 0.8488520408163265, "grad_norm": 0.6657637345303508, "learning_rate": 6.176965510149409e-06, "loss": 0.3210991621017456, "num_input_tokens_seen": 403901864, "step": 6655, "train_runtime": 86722.7716, "train_tokens_per_second": 4657.391 }, { "epoch": 0.8494897959183674, "grad_norm": 0.6561772299058288, "learning_rate": 6.172096752854943e-06, "loss": 0.325441312789917, "num_input_tokens_seen": 404221656, "step": 6660, "train_runtime": 86777.3834, "train_tokens_per_second": 4658.145 }, { "epoch": 0.8501275510204082, "grad_norm": 0.6170286687454818, "learning_rate": 6.1672268192795285e-06, "loss": 0.33939661979675295, "num_input_tokens_seen": 404524552, "step": 6665, "train_runtime": 86846.2906, "train_tokens_per_second": 4657.937 }, { "epoch": 0.8507653061224489, "grad_norm": 0.5836196547961641, "learning_rate": 6.16235571431048e-06, "loss": 0.33211517333984375, "num_input_tokens_seen": 404845408, "step": 6670, "train_runtime": 86901.9065, "train_tokens_per_second": 4658.648 }, { "epoch": 0.8514030612244898, "grad_norm": 0.6182432750234188, "learning_rate": 6.157483442836294e-06, "loss": 0.34074184894561765, "num_input_tokens_seen": 405152056, "step": 6675, "train_runtime": 86966.0434, "train_tokens_per_second": 4658.739 }, { "epoch": 0.8520408163265306, "grad_norm": 0.5778241670275283, "learning_rate": 6.1526100097466345e-06, "loss": 0.3007451295852661, "num_input_tokens_seen": 405452704, "step": 6680, "train_runtime": 87032.5202, "train_tokens_per_second": 4658.635 }, { "epoch": 0.8526785714285714, "grad_norm": 0.5814159265196439, "learning_rate": 6.147735419932334e-06, "loss": 0.3128827571868896, "num_input_tokens_seen": 405763768, "step": 6685, "train_runtime": 87102.6208, "train_tokens_per_second": 4658.456 }, { "epoch": 0.8533163265306123, "grad_norm": 0.6343133127276688, "learning_rate": 6.142859678285378e-06, "loss": 0.329839825630188, "num_input_tokens_seen": 406067088, "step": 6690, "train_runtime": 87170.6739, "train_tokens_per_second": 4658.299 }, { "epoch": 0.8539540816326531, "grad_norm": 0.6425824705170711, "learning_rate": 6.13798278969892e-06, "loss": 0.33551831245422364, "num_input_tokens_seen": 406381664, "step": 6695, "train_runtime": 87221.5598, "train_tokens_per_second": 4659.188 }, { "epoch": 0.8545918367346939, "grad_norm": 0.6150998116233627, "learning_rate": 6.133104759067257e-06, "loss": 0.3395432949066162, "num_input_tokens_seen": 406688472, "step": 6700, "train_runtime": 87287.9773, "train_tokens_per_second": 4659.158 }, { "epoch": 0.8552295918367347, "grad_norm": 0.7722656530742228, "learning_rate": 6.1282255912858315e-06, "loss": 0.31645817756652833, "num_input_tokens_seen": 406991872, "step": 6705, "train_runtime": 87361.6625, "train_tokens_per_second": 4658.701 }, { "epoch": 0.8558673469387755, "grad_norm": 0.5749535580614875, "learning_rate": 6.1233452912512295e-06, "loss": 0.35752263069152834, "num_input_tokens_seen": 407305736, "step": 6710, "train_runtime": 87430.1312, "train_tokens_per_second": 4658.643 }, { "epoch": 0.8565051020408163, "grad_norm": 0.6054773718675978, "learning_rate": 6.118463863861174e-06, "loss": 0.32277803421020507, "num_input_tokens_seen": 407606096, "step": 6715, "train_runtime": 87488.3826, "train_tokens_per_second": 4658.974 }, { "epoch": 0.8571428571428571, "grad_norm": 0.5502253748394416, "learning_rate": 6.113581314014517e-06, "loss": 0.3247419595718384, "num_input_tokens_seen": 407909024, "step": 6720, "train_runtime": 87553.7945, "train_tokens_per_second": 4658.953 }, { "epoch": 0.857780612244898, "grad_norm": 0.6238722159992686, "learning_rate": 6.10869764661124e-06, "loss": 0.3387800931930542, "num_input_tokens_seen": 408218712, "step": 6725, "train_runtime": 87622.8176, "train_tokens_per_second": 4658.817 }, { "epoch": 0.8584183673469388, "grad_norm": 0.5910120036735711, "learning_rate": 6.103812866552444e-06, "loss": 0.31037344932556155, "num_input_tokens_seen": 408515880, "step": 6730, "train_runtime": 87688.7316, "train_tokens_per_second": 4658.704 }, { "epoch": 0.8590561224489796, "grad_norm": 0.628719461401233, "learning_rate": 6.0989269787403445e-06, "loss": 0.32601146697998046, "num_input_tokens_seen": 408812200, "step": 6735, "train_runtime": 87754.4398, "train_tokens_per_second": 4658.593 }, { "epoch": 0.8596938775510204, "grad_norm": 0.6335840002068116, "learning_rate": 6.094039988078273e-06, "loss": 0.33951191902160643, "num_input_tokens_seen": 409120600, "step": 6740, "train_runtime": 87803.9024, "train_tokens_per_second": 4659.481 }, { "epoch": 0.8603316326530612, "grad_norm": 0.5953512093094517, "learning_rate": 6.089151899470668e-06, "loss": 0.32826507091522217, "num_input_tokens_seen": 409431152, "step": 6745, "train_runtime": 87866.9323, "train_tokens_per_second": 4659.673 }, { "epoch": 0.860969387755102, "grad_norm": 0.5994422268905771, "learning_rate": 6.084262717823064e-06, "loss": 0.3277494192123413, "num_input_tokens_seen": 409740144, "step": 6750, "train_runtime": 87933.6284, "train_tokens_per_second": 4659.652 }, { "epoch": 0.8616071428571429, "grad_norm": 0.6159714059053882, "learning_rate": 6.079372448042098e-06, "loss": 0.3410026550292969, "num_input_tokens_seen": 410051832, "step": 6755, "train_runtime": 87995.8201, "train_tokens_per_second": 4659.901 }, { "epoch": 0.8622448979591837, "grad_norm": 0.6726111143451388, "learning_rate": 6.074481095035498e-06, "loss": 0.34213569164276125, "num_input_tokens_seen": 410351752, "step": 6760, "train_runtime": 88043.06, "train_tokens_per_second": 4660.807 }, { "epoch": 0.8628826530612245, "grad_norm": 0.5894010754354287, "learning_rate": 6.069588663712077e-06, "loss": 0.3385669946670532, "num_input_tokens_seen": 410653368, "step": 6765, "train_runtime": 88115.9985, "train_tokens_per_second": 4660.372 }, { "epoch": 0.8635204081632653, "grad_norm": 1.1067748071567547, "learning_rate": 6.064695158981732e-06, "loss": 0.33953258991241453, "num_input_tokens_seen": 410953864, "step": 6770, "train_runtime": 88194.0368, "train_tokens_per_second": 4659.656 }, { "epoch": 0.8641581632653061, "grad_norm": 0.6652045901148732, "learning_rate": 6.059800585755436e-06, "loss": 0.33167431354522703, "num_input_tokens_seen": 411263728, "step": 6775, "train_runtime": 88252.7673, "train_tokens_per_second": 4660.066 }, { "epoch": 0.8647959183673469, "grad_norm": 0.6505117316280133, "learning_rate": 6.054904948945238e-06, "loss": 0.3388916015625, "num_input_tokens_seen": 411574240, "step": 6780, "train_runtime": 88321.8296, "train_tokens_per_second": 4659.938 }, { "epoch": 0.8654336734693877, "grad_norm": 0.5780226702180542, "learning_rate": 6.050008253464247e-06, "loss": 0.3238846778869629, "num_input_tokens_seen": 411886128, "step": 6785, "train_runtime": 88384.0158, "train_tokens_per_second": 4660.188 }, { "epoch": 0.8660714285714286, "grad_norm": 0.6348347745882694, "learning_rate": 6.045110504226643e-06, "loss": 0.31720457077026365, "num_input_tokens_seen": 412184528, "step": 6790, "train_runtime": 88453.1393, "train_tokens_per_second": 4659.92 }, { "epoch": 0.8667091836734694, "grad_norm": 0.6159052094836616, "learning_rate": 6.0402117061476574e-06, "loss": 0.32110598087310793, "num_input_tokens_seen": 412488296, "step": 6795, "train_runtime": 88517.6452, "train_tokens_per_second": 4659.956 }, { "epoch": 0.8673469387755102, "grad_norm": 0.583082714162748, "learning_rate": 6.035311864143576e-06, "loss": 0.3190933704376221, "num_input_tokens_seen": 412792448, "step": 6800, "train_runtime": 88584.3884, "train_tokens_per_second": 4659.878 }, { "epoch": 0.8679846938775511, "grad_norm": 0.6329054180616354, "learning_rate": 6.030410983131733e-06, "loss": 0.3117242336273193, "num_input_tokens_seen": 413089200, "step": 6805, "train_runtime": 88648.4546, "train_tokens_per_second": 4659.858 }, { "epoch": 0.8686224489795918, "grad_norm": 1.0193393634445236, "learning_rate": 6.025509068030504e-06, "loss": 0.3140235424041748, "num_input_tokens_seen": 413392544, "step": 6810, "train_runtime": 88715.7465, "train_tokens_per_second": 4659.743 }, { "epoch": 0.8692602040816326, "grad_norm": 0.5683846750466159, "learning_rate": 6.020606123759305e-06, "loss": 0.33549013137817385, "num_input_tokens_seen": 413708784, "step": 6815, "train_runtime": 88778.9398, "train_tokens_per_second": 4659.988 }, { "epoch": 0.8698979591836735, "grad_norm": 0.5996200287821946, "learning_rate": 6.0157021552385805e-06, "loss": 0.32853450775146487, "num_input_tokens_seen": 414010272, "step": 6820, "train_runtime": 88848.909, "train_tokens_per_second": 4659.711 }, { "epoch": 0.8705357142857143, "grad_norm": 0.6096990676793227, "learning_rate": 6.010797167389808e-06, "loss": 0.34289889335632323, "num_input_tokens_seen": 414315712, "step": 6825, "train_runtime": 88900.2642, "train_tokens_per_second": 4660.455 }, { "epoch": 0.8711734693877551, "grad_norm": 0.6158292907241294, "learning_rate": 6.005891165135484e-06, "loss": 0.324583101272583, "num_input_tokens_seen": 414619040, "step": 6830, "train_runtime": 88974.2695, "train_tokens_per_second": 4659.988 }, { "epoch": 0.8718112244897959, "grad_norm": 0.62656675666996, "learning_rate": 6.000984153399123e-06, "loss": 0.3294857978820801, "num_input_tokens_seen": 414921552, "step": 6835, "train_runtime": 89043.8204, "train_tokens_per_second": 4659.746 }, { "epoch": 0.8724489795918368, "grad_norm": 0.5738738266668524, "learning_rate": 5.996076137105258e-06, "loss": 0.31545100212097166, "num_input_tokens_seen": 415222344, "step": 6840, "train_runtime": 89106.6037, "train_tokens_per_second": 4659.838 }, { "epoch": 0.8730867346938775, "grad_norm": 0.61010245641856, "learning_rate": 5.991167121179422e-06, "loss": 0.3479300498962402, "num_input_tokens_seen": 415531568, "step": 6845, "train_runtime": 89179.902, "train_tokens_per_second": 4659.475 }, { "epoch": 0.8737244897959183, "grad_norm": 0.6002850636159796, "learning_rate": 5.986257110548157e-06, "loss": 0.3386786937713623, "num_input_tokens_seen": 415827216, "step": 6850, "train_runtime": 89247.8163, "train_tokens_per_second": 4659.242 }, { "epoch": 0.8743622448979592, "grad_norm": 0.6307622924247351, "learning_rate": 5.981346110139001e-06, "loss": 0.35399162769317627, "num_input_tokens_seen": 416142632, "step": 6855, "train_runtime": 89324.0385, "train_tokens_per_second": 4658.798 }, { "epoch": 0.875, "grad_norm": 0.5723339817358812, "learning_rate": 5.976434124880487e-06, "loss": 0.3396456718444824, "num_input_tokens_seen": 416454960, "step": 6860, "train_runtime": 89384.0452, "train_tokens_per_second": 4659.164 }, { "epoch": 0.8756377551020408, "grad_norm": 0.6082194962582594, "learning_rate": 5.971521159702136e-06, "loss": 0.35317091941833495, "num_input_tokens_seen": 416763704, "step": 6865, "train_runtime": 89445.7172, "train_tokens_per_second": 4659.404 }, { "epoch": 0.8762755102040817, "grad_norm": 0.6157072471215066, "learning_rate": 5.966607219534448e-06, "loss": 0.3282179355621338, "num_input_tokens_seen": 417073280, "step": 6870, "train_runtime": 89516.3285, "train_tokens_per_second": 4659.187 }, { "epoch": 0.8769132653061225, "grad_norm": 0.5589296381663512, "learning_rate": 5.9616923093089095e-06, "loss": 0.3264785289764404, "num_input_tokens_seen": 417380120, "step": 6875, "train_runtime": 89569.3142, "train_tokens_per_second": 4659.856 }, { "epoch": 0.8775510204081632, "grad_norm": 0.6297249186199603, "learning_rate": 5.956776433957974e-06, "loss": 0.3343611240386963, "num_input_tokens_seen": 417687864, "step": 6880, "train_runtime": 89635.6819, "train_tokens_per_second": 4659.839 }, { "epoch": 0.8781887755102041, "grad_norm": 0.6026776729970337, "learning_rate": 5.951859598415063e-06, "loss": 0.33244986534118653, "num_input_tokens_seen": 417982568, "step": 6885, "train_runtime": 89698.3117, "train_tokens_per_second": 4659.871 }, { "epoch": 0.8788265306122449, "grad_norm": 0.5892975746978071, "learning_rate": 5.94694180761457e-06, "loss": 0.34135990142822265, "num_input_tokens_seen": 418288616, "step": 6890, "train_runtime": 89773.1174, "train_tokens_per_second": 4659.397 }, { "epoch": 0.8794642857142857, "grad_norm": 0.5675595345165033, "learning_rate": 5.942023066491839e-06, "loss": 0.32839064598083495, "num_input_tokens_seen": 418606240, "step": 6895, "train_runtime": 89835.7312, "train_tokens_per_second": 4659.685 }, { "epoch": 0.8801020408163265, "grad_norm": 0.6193483409474435, "learning_rate": 5.937103379983169e-06, "loss": 0.32634963989257815, "num_input_tokens_seen": 418910840, "step": 6900, "train_runtime": 89910.0006, "train_tokens_per_second": 4659.224 }, { "epoch": 0.8807397959183674, "grad_norm": 0.638309417243741, "learning_rate": 5.93218275302581e-06, "loss": 0.3340644836425781, "num_input_tokens_seen": 419219648, "step": 6905, "train_runtime": 89969.7123, "train_tokens_per_second": 4659.564 }, { "epoch": 0.8813775510204082, "grad_norm": 0.5340941556168116, "learning_rate": 5.927261190557955e-06, "loss": 0.31465539932250974, "num_input_tokens_seen": 419522896, "step": 6910, "train_runtime": 90040.3697, "train_tokens_per_second": 4659.276 }, { "epoch": 0.8820153061224489, "grad_norm": 0.5585091825607283, "learning_rate": 5.922338697518736e-06, "loss": 0.31777148246765136, "num_input_tokens_seen": 419833632, "step": 6915, "train_runtime": 90108.003, "train_tokens_per_second": 4659.227 }, { "epoch": 0.8826530612244898, "grad_norm": 0.6203310454487292, "learning_rate": 5.917415278848217e-06, "loss": 0.34000697135925295, "num_input_tokens_seen": 420149256, "step": 6920, "train_runtime": 90185.906, "train_tokens_per_second": 4658.702 }, { "epoch": 0.8832908163265306, "grad_norm": 0.6183876680824408, "learning_rate": 5.9124909394873955e-06, "loss": 0.3393259048461914, "num_input_tokens_seen": 420454576, "step": 6925, "train_runtime": 90243.9503, "train_tokens_per_second": 4659.089 }, { "epoch": 0.8839285714285714, "grad_norm": 0.6763192784941738, "learning_rate": 5.907565684378187e-06, "loss": 0.3432659387588501, "num_input_tokens_seen": 420748952, "step": 6930, "train_runtime": 90317.9918, "train_tokens_per_second": 4658.529 }, { "epoch": 0.8845663265306123, "grad_norm": 0.5468502596718098, "learning_rate": 5.902639518463429e-06, "loss": 0.3281343698501587, "num_input_tokens_seen": 421061672, "step": 6935, "train_runtime": 90378.2197, "train_tokens_per_second": 4658.884 }, { "epoch": 0.8852040816326531, "grad_norm": 0.6173701173906413, "learning_rate": 5.897712446686875e-06, "loss": 0.3060306072235107, "num_input_tokens_seen": 421354016, "step": 6940, "train_runtime": 90443.2914, "train_tokens_per_second": 4658.765 }, { "epoch": 0.8858418367346939, "grad_norm": 0.6116926654712084, "learning_rate": 5.892784473993184e-06, "loss": 0.32022268772125245, "num_input_tokens_seen": 421664096, "step": 6945, "train_runtime": 90505.8102, "train_tokens_per_second": 4658.973 }, { "epoch": 0.8864795918367347, "grad_norm": 0.6536503421323548, "learning_rate": 5.887855605327921e-06, "loss": 0.3388242721557617, "num_input_tokens_seen": 421977680, "step": 6950, "train_runtime": 90564.4915, "train_tokens_per_second": 4659.416 }, { "epoch": 0.8871173469387755, "grad_norm": 0.6197043239112039, "learning_rate": 5.882925845637551e-06, "loss": 0.3288001298904419, "num_input_tokens_seen": 422278024, "step": 6955, "train_runtime": 90635.1128, "train_tokens_per_second": 4659.1 }, { "epoch": 0.8877551020408163, "grad_norm": 0.6085897437814526, "learning_rate": 5.877995199869433e-06, "loss": 0.3016238212585449, "num_input_tokens_seen": 422579688, "step": 6960, "train_runtime": 90709.3597, "train_tokens_per_second": 4658.612 }, { "epoch": 0.8883928571428571, "grad_norm": 0.5691093492945718, "learning_rate": 5.87306367297181e-06, "loss": 0.3010798454284668, "num_input_tokens_seen": 422882808, "step": 6965, "train_runtime": 90766.9754, "train_tokens_per_second": 4658.994 }, { "epoch": 0.889030612244898, "grad_norm": 0.633966372540404, "learning_rate": 5.868131269893818e-06, "loss": 0.3299619197845459, "num_input_tokens_seen": 423187696, "step": 6970, "train_runtime": 90829.1946, "train_tokens_per_second": 4659.159 }, { "epoch": 0.8896683673469388, "grad_norm": 0.6862812288031181, "learning_rate": 5.863197995585468e-06, "loss": 0.3324789047241211, "num_input_tokens_seen": 423489032, "step": 6975, "train_runtime": 90904.8533, "train_tokens_per_second": 4658.597 }, { "epoch": 0.8903061224489796, "grad_norm": 0.6129910170597797, "learning_rate": 5.858263854997642e-06, "loss": 0.3130115270614624, "num_input_tokens_seen": 423791448, "step": 6980, "train_runtime": 90980.1013, "train_tokens_per_second": 4658.067 }, { "epoch": 0.8909438775510204, "grad_norm": 0.6889373904018948, "learning_rate": 5.853328853082098e-06, "loss": 0.33639523983001707, "num_input_tokens_seen": 424099240, "step": 6985, "train_runtime": 91053.8683, "train_tokens_per_second": 4657.674 }, { "epoch": 0.8915816326530612, "grad_norm": 0.6487956986698731, "learning_rate": 5.848392994791452e-06, "loss": 0.31321704387664795, "num_input_tokens_seen": 424398816, "step": 6990, "train_runtime": 91123.7521, "train_tokens_per_second": 4657.39 }, { "epoch": 0.892219387755102, "grad_norm": 0.5752884642905449, "learning_rate": 5.843456285079185e-06, "loss": 0.32476589679718015, "num_input_tokens_seen": 424692664, "step": 6995, "train_runtime": 91186.7653, "train_tokens_per_second": 4657.394 }, { "epoch": 0.8928571428571429, "grad_norm": 0.8369275993174212, "learning_rate": 5.838518728899627e-06, "loss": 0.3245981216430664, "num_input_tokens_seen": 424992552, "step": 7000, "train_runtime": 91246.3735, "train_tokens_per_second": 4657.638 }, { "epoch": 0.8934948979591837, "grad_norm": 0.6212390365806565, "learning_rate": 5.833580331207964e-06, "loss": 0.3225821256637573, "num_input_tokens_seen": 425287872, "step": 7005, "train_runtime": 91316.1681, "train_tokens_per_second": 4657.312 }, { "epoch": 0.8941326530612245, "grad_norm": 0.5958943094933631, "learning_rate": 5.828641096960223e-06, "loss": 0.34339883327484133, "num_input_tokens_seen": 425592264, "step": 7010, "train_runtime": 91387.0629, "train_tokens_per_second": 4657.03 }, { "epoch": 0.8947704081632653, "grad_norm": 0.6745530956803485, "learning_rate": 5.823701031113267e-06, "loss": 0.32695627212524414, "num_input_tokens_seen": 425906136, "step": 7015, "train_runtime": 91446.0903, "train_tokens_per_second": 4657.456 }, { "epoch": 0.8954081632653061, "grad_norm": 0.5292787632217651, "learning_rate": 5.8187601386248004e-06, "loss": 0.32545430660247804, "num_input_tokens_seen": 426201056, "step": 7020, "train_runtime": 91507.8066, "train_tokens_per_second": 4657.538 }, { "epoch": 0.8960459183673469, "grad_norm": 0.5968900855812483, "learning_rate": 5.8138184244533516e-06, "loss": 0.3182164430618286, "num_input_tokens_seen": 426497408, "step": 7025, "train_runtime": 91579.0022, "train_tokens_per_second": 4657.153 }, { "epoch": 0.8966836734693877, "grad_norm": 0.57990914735019, "learning_rate": 5.808875893558277e-06, "loss": 0.31878080368041994, "num_input_tokens_seen": 426794296, "step": 7030, "train_runtime": 91645.3438, "train_tokens_per_second": 4657.021 }, { "epoch": 0.8973214285714286, "grad_norm": 0.5994009927046162, "learning_rate": 5.8039325508997524e-06, "loss": 0.31372628211975095, "num_input_tokens_seen": 427098144, "step": 7035, "train_runtime": 91710.4468, "train_tokens_per_second": 4657.028 }, { "epoch": 0.8979591836734694, "grad_norm": 0.58470949819841, "learning_rate": 5.798988401438765e-06, "loss": 0.3209484577178955, "num_input_tokens_seen": 427409712, "step": 7040, "train_runtime": 91769.2455, "train_tokens_per_second": 4657.44 }, { "epoch": 0.8985969387755102, "grad_norm": 0.5459566895258812, "learning_rate": 5.7940434501371175e-06, "loss": 0.2963754177093506, "num_input_tokens_seen": 427722720, "step": 7045, "train_runtime": 91832.4817, "train_tokens_per_second": 4657.641 }, { "epoch": 0.8992346938775511, "grad_norm": 0.5464202688657641, "learning_rate": 5.78909770195741e-06, "loss": 0.336498761177063, "num_input_tokens_seen": 428037344, "step": 7050, "train_runtime": 91896.4776, "train_tokens_per_second": 4657.821 }, { "epoch": 0.8998724489795918, "grad_norm": 0.5918581612652531, "learning_rate": 5.7841511618630484e-06, "loss": 0.3361975193023682, "num_input_tokens_seen": 428338744, "step": 7055, "train_runtime": 91955.0584, "train_tokens_per_second": 4658.131 }, { "epoch": 0.9005102040816326, "grad_norm": 0.5989399830763436, "learning_rate": 5.779203834818232e-06, "loss": 0.3048173189163208, "num_input_tokens_seen": 428636752, "step": 7060, "train_runtime": 92025.6383, "train_tokens_per_second": 4657.797 }, { "epoch": 0.9011479591836735, "grad_norm": 0.6211553615360176, "learning_rate": 5.774255725787946e-06, "loss": 0.3191343069076538, "num_input_tokens_seen": 428944496, "step": 7065, "train_runtime": 92094.017, "train_tokens_per_second": 4657.68 }, { "epoch": 0.9017857142857143, "grad_norm": 0.5780687534165849, "learning_rate": 5.769306839737968e-06, "loss": 0.3296975135803223, "num_input_tokens_seen": 429250792, "step": 7070, "train_runtime": 92155.0756, "train_tokens_per_second": 4657.918 }, { "epoch": 0.9024234693877551, "grad_norm": 0.7428599286309785, "learning_rate": 5.764357181634847e-06, "loss": 0.3285045623779297, "num_input_tokens_seen": 429563984, "step": 7075, "train_runtime": 92218.342, "train_tokens_per_second": 4658.119 }, { "epoch": 0.9030612244897959, "grad_norm": 0.6293129087083874, "learning_rate": 5.759406756445911e-06, "loss": 0.34009225368499757, "num_input_tokens_seen": 429866120, "step": 7080, "train_runtime": 92289.2336, "train_tokens_per_second": 4657.814 }, { "epoch": 0.9036989795918368, "grad_norm": 0.5932264976811832, "learning_rate": 5.754455569139258e-06, "loss": 0.3277864456176758, "num_input_tokens_seen": 430171480, "step": 7085, "train_runtime": 92349.0988, "train_tokens_per_second": 4658.102 }, { "epoch": 0.9043367346938775, "grad_norm": 0.6211237918901299, "learning_rate": 5.74950362468375e-06, "loss": 0.33977360725402833, "num_input_tokens_seen": 430471856, "step": 7090, "train_runtime": 92423.4907, "train_tokens_per_second": 4657.602 }, { "epoch": 0.9049744897959183, "grad_norm": 0.601155659697981, "learning_rate": 5.74455092804901e-06, "loss": 0.3126554250717163, "num_input_tokens_seen": 430765624, "step": 7095, "train_runtime": 92484.8366, "train_tokens_per_second": 4657.689 }, { "epoch": 0.9056122448979592, "grad_norm": 0.5659404830215208, "learning_rate": 5.739597484205415e-06, "loss": 0.3299864768981934, "num_input_tokens_seen": 431077520, "step": 7100, "train_runtime": 92553.5679, "train_tokens_per_second": 4657.6 }, { "epoch": 0.90625, "grad_norm": 0.6158019873620275, "learning_rate": 5.734643298124091e-06, "loss": 0.3100090980529785, "num_input_tokens_seen": 431392784, "step": 7105, "train_runtime": 92610.8809, "train_tokens_per_second": 4658.122 }, { "epoch": 0.9068877551020408, "grad_norm": 0.7116486718196253, "learning_rate": 5.7296883747769096e-06, "loss": 0.34330143928527834, "num_input_tokens_seen": 431698568, "step": 7110, "train_runtime": 92676.596, "train_tokens_per_second": 4658.119 }, { "epoch": 0.9075255102040817, "grad_norm": 0.6347882352327057, "learning_rate": 5.724732719136481e-06, "loss": 0.33743948936462403, "num_input_tokens_seen": 432004008, "step": 7115, "train_runtime": 92742.449, "train_tokens_per_second": 4658.104 }, { "epoch": 0.9081632653061225, "grad_norm": 1.3582835645543267, "learning_rate": 5.719776336176156e-06, "loss": 0.3645359516143799, "num_input_tokens_seen": 432315232, "step": 7120, "train_runtime": 92804.8603, "train_tokens_per_second": 4658.325 }, { "epoch": 0.9088010204081632, "grad_norm": 0.6302302722909888, "learning_rate": 5.714819230870008e-06, "loss": 0.3343202114105225, "num_input_tokens_seen": 432623952, "step": 7125, "train_runtime": 92879.3354, "train_tokens_per_second": 4657.914 }, { "epoch": 0.9094387755102041, "grad_norm": 0.6264369369260477, "learning_rate": 5.709861408192838e-06, "loss": 0.3022934436798096, "num_input_tokens_seen": 432923000, "step": 7130, "train_runtime": 92953.8411, "train_tokens_per_second": 4657.398 }, { "epoch": 0.9100765306122449, "grad_norm": 0.6432488478492226, "learning_rate": 5.704902873120169e-06, "loss": 0.3636758327484131, "num_input_tokens_seen": 433223992, "step": 7135, "train_runtime": 93023.3667, "train_tokens_per_second": 4657.152 }, { "epoch": 0.9107142857142857, "grad_norm": 0.5829344402778385, "learning_rate": 5.699943630628237e-06, "loss": 0.3100710391998291, "num_input_tokens_seen": 433527848, "step": 7140, "train_runtime": 93081.8656, "train_tokens_per_second": 4657.49 }, { "epoch": 0.9113520408163265, "grad_norm": 0.5526469566314375, "learning_rate": 5.694983685693987e-06, "loss": 0.33217525482177734, "num_input_tokens_seen": 433827296, "step": 7145, "train_runtime": 93142.0513, "train_tokens_per_second": 4657.695 }, { "epoch": 0.9119897959183674, "grad_norm": 0.5780058168652707, "learning_rate": 5.690023043295071e-06, "loss": 0.3236429452896118, "num_input_tokens_seen": 434126264, "step": 7150, "train_runtime": 93216.6326, "train_tokens_per_second": 4657.176 }, { "epoch": 0.9126275510204082, "grad_norm": 0.6048496623171362, "learning_rate": 5.6850617084098416e-06, "loss": 0.34194958209991455, "num_input_tokens_seen": 434426760, "step": 7155, "train_runtime": 93285.3704, "train_tokens_per_second": 4656.966 }, { "epoch": 0.9132653061224489, "grad_norm": 0.6488646015967442, "learning_rate": 5.6800996860173404e-06, "loss": 0.3341176509857178, "num_input_tokens_seen": 434731896, "step": 7160, "train_runtime": 93337.1224, "train_tokens_per_second": 4657.653 }, { "epoch": 0.9139030612244898, "grad_norm": 0.611836929281971, "learning_rate": 5.675136981097309e-06, "loss": 0.316843056678772, "num_input_tokens_seen": 435030744, "step": 7165, "train_runtime": 93395.832, "train_tokens_per_second": 4657.925 }, { "epoch": 0.9145408163265306, "grad_norm": 0.5603054379719846, "learning_rate": 5.670173598630163e-06, "loss": 0.31385073661804197, "num_input_tokens_seen": 435328592, "step": 7170, "train_runtime": 93459.4387, "train_tokens_per_second": 4657.941 }, { "epoch": 0.9151785714285714, "grad_norm": 0.5619751681038885, "learning_rate": 5.6652095435970074e-06, "loss": 0.331546688079834, "num_input_tokens_seen": 435645672, "step": 7175, "train_runtime": 93520.8527, "train_tokens_per_second": 4658.273 }, { "epoch": 0.9158163265306123, "grad_norm": 0.5899417449963834, "learning_rate": 5.6602448209796165e-06, "loss": 0.30263442993164064, "num_input_tokens_seen": 435933128, "step": 7180, "train_runtime": 93589.0984, "train_tokens_per_second": 4657.948 }, { "epoch": 0.9164540816326531, "grad_norm": 0.6110417187873899, "learning_rate": 5.655279435760436e-06, "loss": 0.33107576370239256, "num_input_tokens_seen": 436241608, "step": 7185, "train_runtime": 93662.2867, "train_tokens_per_second": 4657.602 }, { "epoch": 0.9170918367346939, "grad_norm": 0.617808942550835, "learning_rate": 5.650313392922578e-06, "loss": 0.350404691696167, "num_input_tokens_seen": 436545304, "step": 7190, "train_runtime": 93725.158, "train_tokens_per_second": 4657.717 }, { "epoch": 0.9177295918367347, "grad_norm": 0.6129782951042175, "learning_rate": 5.64534669744981e-06, "loss": 0.30472793579101565, "num_input_tokens_seen": 436846352, "step": 7195, "train_runtime": 93792.2876, "train_tokens_per_second": 4657.594 }, { "epoch": 0.9183673469387755, "grad_norm": 0.5835829941484578, "learning_rate": 5.640379354326563e-06, "loss": 0.3401020050048828, "num_input_tokens_seen": 437151096, "step": 7200, "train_runtime": 93852.1533, "train_tokens_per_second": 4657.87 }, { "epoch": 0.9190051020408163, "grad_norm": 0.6207580203306774, "learning_rate": 5.63541136853791e-06, "loss": 0.3340470314025879, "num_input_tokens_seen": 437457208, "step": 7205, "train_runtime": 93920.5666, "train_tokens_per_second": 4657.736 }, { "epoch": 0.9196428571428571, "grad_norm": 0.6195876235301718, "learning_rate": 5.630442745069568e-06, "loss": 0.3098969221115112, "num_input_tokens_seen": 437757936, "step": 7210, "train_runtime": 93989.8753, "train_tokens_per_second": 4657.501 }, { "epoch": 0.920280612244898, "grad_norm": 0.5827833159501568, "learning_rate": 5.625473488907905e-06, "loss": 0.3573422908782959, "num_input_tokens_seen": 438057032, "step": 7215, "train_runtime": 94045.464, "train_tokens_per_second": 4657.928 }, { "epoch": 0.9209183673469388, "grad_norm": 0.6279376837393513, "learning_rate": 5.620503605039912e-06, "loss": 0.33810203075408934, "num_input_tokens_seen": 438355976, "step": 7220, "train_runtime": 94117.5499, "train_tokens_per_second": 4657.537 }, { "epoch": 0.9215561224489796, "grad_norm": 0.6528797216296661, "learning_rate": 5.615533098453215e-06, "loss": 0.3303686141967773, "num_input_tokens_seen": 438655912, "step": 7225, "train_runtime": 94193.2575, "train_tokens_per_second": 4656.978 }, { "epoch": 0.9221938775510204, "grad_norm": 0.5335016037971426, "learning_rate": 5.610561974136065e-06, "loss": 0.30500807762146, "num_input_tokens_seen": 438963328, "step": 7230, "train_runtime": 94250.7251, "train_tokens_per_second": 4657.4 }, { "epoch": 0.9228316326530612, "grad_norm": 0.5680252169060411, "learning_rate": 5.605590237077332e-06, "loss": 0.30874583721160886, "num_input_tokens_seen": 439259696, "step": 7235, "train_runtime": 94326.3534, "train_tokens_per_second": 4656.808 }, { "epoch": 0.923469387755102, "grad_norm": 0.6134626347075202, "learning_rate": 5.600617892266503e-06, "loss": 0.33132448196411135, "num_input_tokens_seen": 439564888, "step": 7240, "train_runtime": 94395.6222, "train_tokens_per_second": 4656.624 }, { "epoch": 0.9241071428571429, "grad_norm": 0.7101929570256023, "learning_rate": 5.5956449446936715e-06, "loss": 0.33731722831726074, "num_input_tokens_seen": 439871352, "step": 7245, "train_runtime": 94463.7725, "train_tokens_per_second": 4656.508 }, { "epoch": 0.9247448979591837, "grad_norm": 0.6208386726137252, "learning_rate": 5.590671399349539e-06, "loss": 0.30220632553100585, "num_input_tokens_seen": 440175224, "step": 7250, "train_runtime": 94529.0352, "train_tokens_per_second": 4656.508 }, { "epoch": 0.9253826530612245, "grad_norm": 0.6057749008208727, "learning_rate": 5.585697261225404e-06, "loss": 0.33912243843078616, "num_input_tokens_seen": 440483888, "step": 7255, "train_runtime": 94602.9872, "train_tokens_per_second": 4656.131 }, { "epoch": 0.9260204081632653, "grad_norm": 0.6436432236051591, "learning_rate": 5.58072253531316e-06, "loss": 0.3079514980316162, "num_input_tokens_seen": 440792440, "step": 7260, "train_runtime": 94666.454, "train_tokens_per_second": 4656.269 }, { "epoch": 0.9266581632653061, "grad_norm": 0.611831918626776, "learning_rate": 5.575747226605298e-06, "loss": 0.3464851140975952, "num_input_tokens_seen": 441096904, "step": 7265, "train_runtime": 94732.0455, "train_tokens_per_second": 4656.259 }, { "epoch": 0.9272959183673469, "grad_norm": 0.5782058210719649, "learning_rate": 5.570771340094883e-06, "loss": 0.3171382427215576, "num_input_tokens_seen": 441390952, "step": 7270, "train_runtime": 94795.1636, "train_tokens_per_second": 4656.26 }, { "epoch": 0.9279336734693877, "grad_norm": 0.6445610490656555, "learning_rate": 5.565794880775565e-06, "loss": 0.3248934268951416, "num_input_tokens_seen": 441705680, "step": 7275, "train_runtime": 94858.8705, "train_tokens_per_second": 4656.451 }, { "epoch": 0.9285714285714286, "grad_norm": 0.6618988924445185, "learning_rate": 5.560817853641568e-06, "loss": 0.34633026123046873, "num_input_tokens_seen": 442011840, "step": 7280, "train_runtime": 94929.2671, "train_tokens_per_second": 4656.223 }, { "epoch": 0.9292091836734694, "grad_norm": 0.6099102932835904, "learning_rate": 5.5558402636876885e-06, "loss": 0.3423534154891968, "num_input_tokens_seen": 442315264, "step": 7285, "train_runtime": 94997.9199, "train_tokens_per_second": 4656.052 }, { "epoch": 0.9298469387755102, "grad_norm": 0.5917154518525781, "learning_rate": 5.550862115909287e-06, "loss": 0.3233125925064087, "num_input_tokens_seen": 442602968, "step": 7290, "train_runtime": 95058.8301, "train_tokens_per_second": 4656.095 }, { "epoch": 0.9304846938775511, "grad_norm": 0.6617977932000766, "learning_rate": 5.545883415302276e-06, "loss": 0.3399376630783081, "num_input_tokens_seen": 442912720, "step": 7295, "train_runtime": 95131.7112, "train_tokens_per_second": 4655.784 }, { "epoch": 0.9311224489795918, "grad_norm": 0.6503030440623012, "learning_rate": 5.540904166863136e-06, "loss": 0.3292389869689941, "num_input_tokens_seen": 443214392, "step": 7300, "train_runtime": 95200.9687, "train_tokens_per_second": 4655.566 }, { "epoch": 0.9317602040816326, "grad_norm": 0.6114322068753539, "learning_rate": 5.535924375588887e-06, "loss": 0.32429957389831543, "num_input_tokens_seen": 443518360, "step": 7305, "train_runtime": 95266.3136, "train_tokens_per_second": 4655.563 }, { "epoch": 0.9323979591836735, "grad_norm": 0.5958960141965831, "learning_rate": 5.530944046477098e-06, "loss": 0.34727861881256106, "num_input_tokens_seen": 443824776, "step": 7310, "train_runtime": 95334.9067, "train_tokens_per_second": 4655.428 }, { "epoch": 0.9330357142857143, "grad_norm": 0.6220915816417448, "learning_rate": 5.525963184525877e-06, "loss": 0.31817402839660647, "num_input_tokens_seen": 444132048, "step": 7315, "train_runtime": 95394.9115, "train_tokens_per_second": 4655.721 }, { "epoch": 0.9336734693877551, "grad_norm": 0.640954113641302, "learning_rate": 5.5209817947338685e-06, "loss": 0.33860623836517334, "num_input_tokens_seen": 444440104, "step": 7320, "train_runtime": 95472.0678, "train_tokens_per_second": 4655.185 }, { "epoch": 0.9343112244897959, "grad_norm": 0.6926038866488701, "learning_rate": 5.5159998821002425e-06, "loss": 0.3216454029083252, "num_input_tokens_seen": 444730064, "step": 7325, "train_runtime": 95544.2943, "train_tokens_per_second": 4654.7 }, { "epoch": 0.9349489795918368, "grad_norm": 0.6395627568665867, "learning_rate": 5.511017451624698e-06, "loss": 0.3319781064987183, "num_input_tokens_seen": 445022400, "step": 7330, "train_runtime": 95605.4663, "train_tokens_per_second": 4654.78 }, { "epoch": 0.9355867346938775, "grad_norm": 0.5273091656155408, "learning_rate": 5.506034508307453e-06, "loss": 0.32101285457611084, "num_input_tokens_seen": 445313984, "step": 7335, "train_runtime": 95666.8777, "train_tokens_per_second": 4654.84 }, { "epoch": 0.9362244897959183, "grad_norm": 0.658261886396777, "learning_rate": 5.501051057149234e-06, "loss": 0.34318544864654543, "num_input_tokens_seen": 445611808, "step": 7340, "train_runtime": 95739.3601, "train_tokens_per_second": 4654.426 }, { "epoch": 0.9368622448979592, "grad_norm": 0.7703843129622262, "learning_rate": 5.496067103151288e-06, "loss": 0.31019752025604247, "num_input_tokens_seen": 445903928, "step": 7345, "train_runtime": 95799.6466, "train_tokens_per_second": 4654.547 }, { "epoch": 0.9375, "grad_norm": 0.6187082091632335, "learning_rate": 5.491082651315359e-06, "loss": 0.32934820652008057, "num_input_tokens_seen": 446217904, "step": 7350, "train_runtime": 95872.4724, "train_tokens_per_second": 4654.286 }, { "epoch": 0.9381377551020408, "grad_norm": 0.5609898508690694, "learning_rate": 5.4860977066436915e-06, "loss": 0.33247902393341067, "num_input_tokens_seen": 446539136, "step": 7355, "train_runtime": 95934.8268, "train_tokens_per_second": 4654.609 }, { "epoch": 0.9387755102040817, "grad_norm": 0.5558736498241871, "learning_rate": 5.481112274139026e-06, "loss": 0.3279747247695923, "num_input_tokens_seen": 446828760, "step": 7360, "train_runtime": 96004.602, "train_tokens_per_second": 4654.243 }, { "epoch": 0.9394132653061225, "grad_norm": 0.5841949904362537, "learning_rate": 5.476126358804594e-06, "loss": 0.3111677885055542, "num_input_tokens_seen": 447125808, "step": 7365, "train_runtime": 96072.9392, "train_tokens_per_second": 4654.024 }, { "epoch": 0.9400510204081632, "grad_norm": 0.5572463984794219, "learning_rate": 5.471139965644108e-06, "loss": 0.3141068458557129, "num_input_tokens_seen": 447421784, "step": 7370, "train_runtime": 96139.9287, "train_tokens_per_second": 4653.86 }, { "epoch": 0.9406887755102041, "grad_norm": 0.5856299318596453, "learning_rate": 5.46615309966176e-06, "loss": 0.32782411575317383, "num_input_tokens_seen": 447734880, "step": 7375, "train_runtime": 96194.1054, "train_tokens_per_second": 4654.494 }, { "epoch": 0.9413265306122449, "grad_norm": 0.5876070137236294, "learning_rate": 5.461165765862223e-06, "loss": 0.36186442375183103, "num_input_tokens_seen": 448036040, "step": 7380, "train_runtime": 96264.4631, "train_tokens_per_second": 4654.221 }, { "epoch": 0.9419642857142857, "grad_norm": 0.5452430461863326, "learning_rate": 5.456177969250632e-06, "loss": 0.3144784688949585, "num_input_tokens_seen": 448339064, "step": 7385, "train_runtime": 96330.5057, "train_tokens_per_second": 4654.175 }, { "epoch": 0.9426020408163265, "grad_norm": 0.5500309785987467, "learning_rate": 5.451189714832588e-06, "loss": 0.33200769424438475, "num_input_tokens_seen": 448634848, "step": 7390, "train_runtime": 96397.1529, "train_tokens_per_second": 4654.026 }, { "epoch": 0.9432397959183674, "grad_norm": 0.6129476571360919, "learning_rate": 5.446201007614156e-06, "loss": 0.352520227432251, "num_input_tokens_seen": 448932160, "step": 7395, "train_runtime": 96461.6202, "train_tokens_per_second": 4653.998 }, { "epoch": 0.9438775510204082, "grad_norm": 0.6186157828132597, "learning_rate": 5.441211852601849e-06, "loss": 0.3336463928222656, "num_input_tokens_seen": 449228936, "step": 7400, "train_runtime": 96525.9913, "train_tokens_per_second": 4653.969 }, { "epoch": 0.9445153061224489, "grad_norm": 0.5636015344138771, "learning_rate": 5.4362222548026325e-06, "loss": 0.33085658550262453, "num_input_tokens_seen": 449545320, "step": 7405, "train_runtime": 96591.8618, "train_tokens_per_second": 4654.07 }, { "epoch": 0.9451530612244898, "grad_norm": 0.62816717573118, "learning_rate": 5.43123221922392e-06, "loss": 0.3475645065307617, "num_input_tokens_seen": 449867272, "step": 7410, "train_runtime": 96653.3194, "train_tokens_per_second": 4654.442 }, { "epoch": 0.9457908163265306, "grad_norm": 0.6210180550702343, "learning_rate": 5.426241750873557e-06, "loss": 0.33647613525390624, "num_input_tokens_seen": 450173248, "step": 7415, "train_runtime": 96729.9668, "train_tokens_per_second": 4653.917 }, { "epoch": 0.9464285714285714, "grad_norm": 0.6061292817661059, "learning_rate": 5.42125085475983e-06, "loss": 0.30979266166687014, "num_input_tokens_seen": 450477304, "step": 7420, "train_runtime": 96795.8443, "train_tokens_per_second": 4653.891 }, { "epoch": 0.9470663265306123, "grad_norm": 0.5654865729852379, "learning_rate": 5.4162595358914475e-06, "loss": 0.31366941928863523, "num_input_tokens_seen": 450766696, "step": 7425, "train_runtime": 96861.3468, "train_tokens_per_second": 4653.731 }, { "epoch": 0.9477040816326531, "grad_norm": 0.5746923763393963, "learning_rate": 5.41126779927755e-06, "loss": 0.2894803524017334, "num_input_tokens_seen": 451078288, "step": 7430, "train_runtime": 96935.906, "train_tokens_per_second": 4653.366 }, { "epoch": 0.9483418367346939, "grad_norm": 0.622467448620151, "learning_rate": 5.4062756499276945e-06, "loss": 0.3030913591384888, "num_input_tokens_seen": 451375832, "step": 7435, "train_runtime": 97000.5206, "train_tokens_per_second": 4653.334 }, { "epoch": 0.9489795918367347, "grad_norm": 0.6974679560372611, "learning_rate": 5.401283092851848e-06, "loss": 0.32454471588134765, "num_input_tokens_seen": 451683696, "step": 7440, "train_runtime": 97066.0221, "train_tokens_per_second": 4653.366 }, { "epoch": 0.9496173469387755, "grad_norm": 0.6730161110801747, "learning_rate": 5.396290133060394e-06, "loss": 0.33219094276428224, "num_input_tokens_seen": 451988336, "step": 7445, "train_runtime": 97124.5383, "train_tokens_per_second": 4653.699 }, { "epoch": 0.9502551020408163, "grad_norm": 0.7152501057074385, "learning_rate": 5.391296775564114e-06, "loss": 0.3516712188720703, "num_input_tokens_seen": 452279800, "step": 7450, "train_runtime": 97193.9254, "train_tokens_per_second": 4653.375 }, { "epoch": 0.9508928571428571, "grad_norm": 0.6018966871088204, "learning_rate": 5.386303025374192e-06, "loss": 0.3267823219299316, "num_input_tokens_seen": 452569432, "step": 7455, "train_runtime": 97249.267, "train_tokens_per_second": 4653.705 }, { "epoch": 0.951530612244898, "grad_norm": 0.5884060900415792, "learning_rate": 5.381308887502204e-06, "loss": 0.32781100273132324, "num_input_tokens_seen": 452875960, "step": 7460, "train_runtime": 97320.3665, "train_tokens_per_second": 4653.455 }, { "epoch": 0.9521683673469388, "grad_norm": 0.588400128425506, "learning_rate": 5.376314366960118e-06, "loss": 0.31268844604492185, "num_input_tokens_seen": 453174224, "step": 7465, "train_runtime": 97382.9657, "train_tokens_per_second": 4653.527 }, { "epoch": 0.9528061224489796, "grad_norm": 0.6161681381907058, "learning_rate": 5.371319468760283e-06, "loss": 0.3634037017822266, "num_input_tokens_seen": 453475112, "step": 7470, "train_runtime": 97452.1415, "train_tokens_per_second": 4653.311 }, { "epoch": 0.9534438775510204, "grad_norm": 0.6035718300929784, "learning_rate": 5.366324197915426e-06, "loss": 0.35582818984985354, "num_input_tokens_seen": 453791072, "step": 7475, "train_runtime": 97522.84, "train_tokens_per_second": 4653.177 }, { "epoch": 0.9540816326530612, "grad_norm": 0.5479412766278943, "learning_rate": 5.361328559438655e-06, "loss": 0.32398262023925783, "num_input_tokens_seen": 454089208, "step": 7480, "train_runtime": 97590.6123, "train_tokens_per_second": 4653.001 }, { "epoch": 0.954719387755102, "grad_norm": 0.6203335233591618, "learning_rate": 5.3563325583434376e-06, "loss": 0.3262059688568115, "num_input_tokens_seen": 454392432, "step": 7485, "train_runtime": 97667.0425, "train_tokens_per_second": 4652.464 }, { "epoch": 0.9553571428571429, "grad_norm": 0.6510802818047046, "learning_rate": 5.351336199643612e-06, "loss": 0.3240252733230591, "num_input_tokens_seen": 454693328, "step": 7490, "train_runtime": 97744.0395, "train_tokens_per_second": 4651.878 }, { "epoch": 0.9559948979591837, "grad_norm": 0.6274483889915605, "learning_rate": 5.346339488353374e-06, "loss": 0.34021596908569335, "num_input_tokens_seen": 454996912, "step": 7495, "train_runtime": 97808.5332, "train_tokens_per_second": 4651.914 }, { "epoch": 0.9566326530612245, "grad_norm": 0.7061927649586376, "learning_rate": 5.341342429487271e-06, "loss": 0.31961989402770996, "num_input_tokens_seen": 455298984, "step": 7500, "train_runtime": 97874.0191, "train_tokens_per_second": 4651.888 }, { "epoch": 0.9572704081632653, "grad_norm": 0.5841115410135582, "learning_rate": 5.336345028060199e-06, "loss": 0.3159759283065796, "num_input_tokens_seen": 455607960, "step": 7505, "train_runtime": 97949.3064, "train_tokens_per_second": 4651.467 }, { "epoch": 0.9579081632653061, "grad_norm": 0.6978605355910545, "learning_rate": 5.331347289087402e-06, "loss": 0.33841490745544434, "num_input_tokens_seen": 455902144, "step": 7510, "train_runtime": 98008.61, "train_tokens_per_second": 4651.654 }, { "epoch": 0.9585459183673469, "grad_norm": 0.6327166338301546, "learning_rate": 5.326349217584459e-06, "loss": 0.30366837978363037, "num_input_tokens_seen": 456206152, "step": 7515, "train_runtime": 98072.4036, "train_tokens_per_second": 4651.728 }, { "epoch": 0.9591836734693877, "grad_norm": 0.6578129664300764, "learning_rate": 5.321350818567285e-06, "loss": 0.31577486991882325, "num_input_tokens_seen": 456504376, "step": 7520, "train_runtime": 98144.1948, "train_tokens_per_second": 4651.364 }, { "epoch": 0.9598214285714286, "grad_norm": 0.6901553111021399, "learning_rate": 5.3163520970521194e-06, "loss": 0.31000518798828125, "num_input_tokens_seen": 456809144, "step": 7525, "train_runtime": 98204.6031, "train_tokens_per_second": 4651.606 }, { "epoch": 0.9604591836734694, "grad_norm": 0.6419223040805333, "learning_rate": 5.311353058055533e-06, "loss": 0.319872522354126, "num_input_tokens_seen": 457106664, "step": 7530, "train_runtime": 98279.4697, "train_tokens_per_second": 4651.09 }, { "epoch": 0.9610969387755102, "grad_norm": 0.6003832927960608, "learning_rate": 5.306353706594407e-06, "loss": 0.3212242126464844, "num_input_tokens_seen": 457401712, "step": 7535, "train_runtime": 98348.7658, "train_tokens_per_second": 4650.813 }, { "epoch": 0.9617346938775511, "grad_norm": 0.5707879823933953, "learning_rate": 5.3013540476859404e-06, "loss": 0.3323201179504395, "num_input_tokens_seen": 457706640, "step": 7540, "train_runtime": 98422.6659, "train_tokens_per_second": 4650.419 }, { "epoch": 0.9623724489795918, "grad_norm": 0.5935247624471444, "learning_rate": 5.2963540863476404e-06, "loss": 0.28949751853942873, "num_input_tokens_seen": 458015200, "step": 7545, "train_runtime": 98492.8037, "train_tokens_per_second": 4650.24 }, { "epoch": 0.9630102040816326, "grad_norm": 0.6348233190150885, "learning_rate": 5.291353827597317e-06, "loss": 0.3134197473526001, "num_input_tokens_seen": 458318128, "step": 7550, "train_runtime": 98559.2024, "train_tokens_per_second": 4650.181 }, { "epoch": 0.9636479591836735, "grad_norm": 0.542306457023443, "learning_rate": 5.28635327645308e-06, "loss": 0.3190800428390503, "num_input_tokens_seen": 458630192, "step": 7555, "train_runtime": 98617.3868, "train_tokens_per_second": 4650.602 }, { "epoch": 0.9642857142857143, "grad_norm": 0.6234870704223687, "learning_rate": 5.281352437933331e-06, "loss": 0.32537388801574707, "num_input_tokens_seen": 458941680, "step": 7560, "train_runtime": 98674.0139, "train_tokens_per_second": 4651.09 }, { "epoch": 0.9649234693877551, "grad_norm": 0.6563923185368536, "learning_rate": 5.276351317056762e-06, "loss": 0.33820252418518065, "num_input_tokens_seen": 459239448, "step": 7565, "train_runtime": 98749.203, "train_tokens_per_second": 4650.564 }, { "epoch": 0.9655612244897959, "grad_norm": 0.573388055090737, "learning_rate": 5.271349918842344e-06, "loss": 0.32301039695739747, "num_input_tokens_seen": 459535592, "step": 7570, "train_runtime": 98815.9993, "train_tokens_per_second": 4650.417 }, { "epoch": 0.9661989795918368, "grad_norm": 0.6346907070870014, "learning_rate": 5.266348248309332e-06, "loss": 0.34938960075378417, "num_input_tokens_seen": 459839392, "step": 7575, "train_runtime": 98880.3976, "train_tokens_per_second": 4650.461 }, { "epoch": 0.9668367346938775, "grad_norm": 0.5673390742304041, "learning_rate": 5.2613463104772535e-06, "loss": 0.32122604846954345, "num_input_tokens_seen": 460145248, "step": 7580, "train_runtime": 98951.9034, "train_tokens_per_second": 4650.191 }, { "epoch": 0.9674744897959183, "grad_norm": 0.5863174042631039, "learning_rate": 5.256344110365896e-06, "loss": 0.3423152446746826, "num_input_tokens_seen": 460450360, "step": 7585, "train_runtime": 99008.4551, "train_tokens_per_second": 4650.617 }, { "epoch": 0.9681122448979592, "grad_norm": 0.6017504751228284, "learning_rate": 5.251341652995325e-06, "loss": 0.32942781448364256, "num_input_tokens_seen": 460751656, "step": 7590, "train_runtime": 99082.0659, "train_tokens_per_second": 4650.202 }, { "epoch": 0.96875, "grad_norm": 0.5750574521144, "learning_rate": 5.246338943385849e-06, "loss": 0.3291962146759033, "num_input_tokens_seen": 461062480, "step": 7595, "train_runtime": 99140.8353, "train_tokens_per_second": 4650.581 }, { "epoch": 0.9693877551020408, "grad_norm": 0.6221715700005203, "learning_rate": 5.24133598655804e-06, "loss": 0.31624937057495117, "num_input_tokens_seen": 461362320, "step": 7600, "train_runtime": 99201.305, "train_tokens_per_second": 4650.769 }, { "epoch": 0.9700255102040817, "grad_norm": 0.6957054548286925, "learning_rate": 5.2363327875327115e-06, "loss": 0.35048661231994627, "num_input_tokens_seen": 461662608, "step": 7605, "train_runtime": 99258.0619, "train_tokens_per_second": 4651.135 }, { "epoch": 0.9706632653061225, "grad_norm": 0.6123494402701751, "learning_rate": 5.231329351330927e-06, "loss": 0.307574200630188, "num_input_tokens_seen": 461951816, "step": 7610, "train_runtime": 99313.3687, "train_tokens_per_second": 4651.457 }, { "epoch": 0.9713010204081632, "grad_norm": 0.6034186500704106, "learning_rate": 5.226325682973984e-06, "loss": 0.33936357498168945, "num_input_tokens_seen": 462266560, "step": 7615, "train_runtime": 99369.7077, "train_tokens_per_second": 4651.987 }, { "epoch": 0.9719387755102041, "grad_norm": 0.6239223500534754, "learning_rate": 5.221321787483409e-06, "loss": 0.30183818340301516, "num_input_tokens_seen": 462553424, "step": 7620, "train_runtime": 99428.1103, "train_tokens_per_second": 4652.139 }, { "epoch": 0.9725765306122449, "grad_norm": 0.5498370673286883, "learning_rate": 5.216317669880965e-06, "loss": 0.3296989440917969, "num_input_tokens_seen": 462874408, "step": 7625, "train_runtime": 99494.731, "train_tokens_per_second": 4652.25 }, { "epoch": 0.9732142857142857, "grad_norm": 0.6322795699391487, "learning_rate": 5.21131333518863e-06, "loss": 0.3277259826660156, "num_input_tokens_seen": 463178672, "step": 7630, "train_runtime": 99550.4143, "train_tokens_per_second": 4652.705 }, { "epoch": 0.9738520408163265, "grad_norm": 0.6111160155773336, "learning_rate": 5.206308788428604e-06, "loss": 0.32791035175323485, "num_input_tokens_seen": 463487760, "step": 7635, "train_runtime": 99611.746, "train_tokens_per_second": 4652.943 }, { "epoch": 0.9744897959183674, "grad_norm": 0.6136903235756072, "learning_rate": 5.201304034623303e-06, "loss": 0.3223903656005859, "num_input_tokens_seen": 463788224, "step": 7640, "train_runtime": 99671.5435, "train_tokens_per_second": 4653.166 }, { "epoch": 0.9751275510204082, "grad_norm": 0.6220422479739535, "learning_rate": 5.1962990787953436e-06, "loss": 0.34218950271606446, "num_input_tokens_seen": 464093352, "step": 7645, "train_runtime": 99736.9533, "train_tokens_per_second": 4653.174 }, { "epoch": 0.9757653061224489, "grad_norm": 0.6215687010622566, "learning_rate": 5.191293925967548e-06, "loss": 0.3228957414627075, "num_input_tokens_seen": 464402904, "step": 7650, "train_runtime": 99806.9438, "train_tokens_per_second": 4653.012 }, { "epoch": 0.9764030612244898, "grad_norm": 0.6863971797846118, "learning_rate": 5.186288581162939e-06, "loss": 0.3238239049911499, "num_input_tokens_seen": 464703560, "step": 7655, "train_runtime": 99884.4102, "train_tokens_per_second": 4652.413 }, { "epoch": 0.9770408163265306, "grad_norm": 0.6250189379927238, "learning_rate": 5.181283049404728e-06, "loss": 0.327274751663208, "num_input_tokens_seen": 464999088, "step": 7660, "train_runtime": 99950.2681, "train_tokens_per_second": 4652.305 }, { "epoch": 0.9776785714285714, "grad_norm": 0.5657739843144446, "learning_rate": 5.1762773357163175e-06, "loss": 0.3050973415374756, "num_input_tokens_seen": 465311888, "step": 7665, "train_runtime": 100010.5888, "train_tokens_per_second": 4652.626 }, { "epoch": 0.9783163265306123, "grad_norm": 0.6021250645420273, "learning_rate": 5.171271445121286e-06, "loss": 0.3465284824371338, "num_input_tokens_seen": 465625424, "step": 7670, "train_runtime": 100063.5896, "train_tokens_per_second": 4653.295 }, { "epoch": 0.9789540816326531, "grad_norm": 0.6648857296020965, "learning_rate": 5.166265382643402e-06, "loss": 0.34261624813079833, "num_input_tokens_seen": 465924320, "step": 7675, "train_runtime": 100118.6981, "train_tokens_per_second": 4653.719 }, { "epoch": 0.9795918367346939, "grad_norm": 0.5425209533084114, "learning_rate": 5.161259153306592e-06, "loss": 0.32228875160217285, "num_input_tokens_seen": 466225272, "step": 7680, "train_runtime": 100185.4733, "train_tokens_per_second": 4653.621 }, { "epoch": 0.9802295918367347, "grad_norm": 0.6594876001926052, "learning_rate": 5.156252762134959e-06, "loss": 0.3042541742324829, "num_input_tokens_seen": 466522448, "step": 7685, "train_runtime": 100245.252, "train_tokens_per_second": 4653.811 }, { "epoch": 0.9808673469387755, "grad_norm": 0.6120901688455826, "learning_rate": 5.1512462141527675e-06, "loss": 0.326982307434082, "num_input_tokens_seen": 466829432, "step": 7690, "train_runtime": 100306.9353, "train_tokens_per_second": 4654.01 }, { "epoch": 0.9815051020408163, "grad_norm": 0.72869624956535, "learning_rate": 5.146239514384437e-06, "loss": 0.3118090867996216, "num_input_tokens_seen": 467125040, "step": 7695, "train_runtime": 100365.7346, "train_tokens_per_second": 4654.228 }, { "epoch": 0.9821428571428571, "grad_norm": 0.5858297135389228, "learning_rate": 5.14123266785454e-06, "loss": 0.31283886432647706, "num_input_tokens_seen": 467430568, "step": 7700, "train_runtime": 100428.1672, "train_tokens_per_second": 4654.377 }, { "epoch": 0.982780612244898, "grad_norm": 0.6616219119550749, "learning_rate": 5.136225679587797e-06, "loss": 0.3235911846160889, "num_input_tokens_seen": 467731488, "step": 7705, "train_runtime": 100488.6765, "train_tokens_per_second": 4654.569 }, { "epoch": 0.9834183673469388, "grad_norm": 0.6475714179562695, "learning_rate": 5.131218554609072e-06, "loss": 0.3317469596862793, "num_input_tokens_seen": 468049016, "step": 7710, "train_runtime": 100540.8673, "train_tokens_per_second": 4655.311 }, { "epoch": 0.9840561224489796, "grad_norm": 0.6104648998710915, "learning_rate": 5.126211297943362e-06, "loss": 0.3359741449356079, "num_input_tokens_seen": 468358808, "step": 7715, "train_runtime": 100613.2756, "train_tokens_per_second": 4655.04 }, { "epoch": 0.9846938775510204, "grad_norm": 0.6925028543025519, "learning_rate": 5.121203914615799e-06, "loss": 0.3237119197845459, "num_input_tokens_seen": 468666280, "step": 7720, "train_runtime": 100675.1044, "train_tokens_per_second": 4655.235 }, { "epoch": 0.9853316326530612, "grad_norm": 0.720995537625908, "learning_rate": 5.116196409651645e-06, "loss": 0.33925719261169435, "num_input_tokens_seen": 468960272, "step": 7725, "train_runtime": 100741.7138, "train_tokens_per_second": 4655.075 }, { "epoch": 0.985969387755102, "grad_norm": 0.5152183498459357, "learning_rate": 5.111188788076278e-06, "loss": 0.3303224086761475, "num_input_tokens_seen": 469255544, "step": 7730, "train_runtime": 100816.4365, "train_tokens_per_second": 4654.554 }, { "epoch": 0.9866071428571429, "grad_norm": 0.5392899174732972, "learning_rate": 5.106181054915196e-06, "loss": 0.29469146728515627, "num_input_tokens_seen": 469554832, "step": 7735, "train_runtime": 100888.5535, "train_tokens_per_second": 4654.193 }, { "epoch": 0.9872448979591837, "grad_norm": 0.5888347307774385, "learning_rate": 5.10117321519401e-06, "loss": 0.3403113126754761, "num_input_tokens_seen": 469860760, "step": 7740, "train_runtime": 100959.0582, "train_tokens_per_second": 4653.973 }, { "epoch": 0.9878826530612245, "grad_norm": 0.6171581041053468, "learning_rate": 5.0961652739384356e-06, "loss": 0.35056252479553224, "num_input_tokens_seen": 470173952, "step": 7745, "train_runtime": 101020.7346, "train_tokens_per_second": 4654.232 }, { "epoch": 0.9885204081632653, "grad_norm": 0.9065682412688728, "learning_rate": 5.091157236174295e-06, "loss": 0.2968605995178223, "num_input_tokens_seen": 470483144, "step": 7750, "train_runtime": 101074.947, "train_tokens_per_second": 4654.795 }, { "epoch": 0.9891581632653061, "grad_norm": 0.6732971859874851, "learning_rate": 5.086149106927499e-06, "loss": 0.31652278900146485, "num_input_tokens_seen": 470768664, "step": 7755, "train_runtime": 101147.1087, "train_tokens_per_second": 4654.297 }, { "epoch": 0.9897959183673469, "grad_norm": 0.6221879977048489, "learning_rate": 5.081140891224061e-06, "loss": 0.3348564624786377, "num_input_tokens_seen": 471069616, "step": 7760, "train_runtime": 101208.9241, "train_tokens_per_second": 4654.428 }, { "epoch": 0.9904336734693877, "grad_norm": 0.6458286263649597, "learning_rate": 5.076132594090068e-06, "loss": 0.32708206176757815, "num_input_tokens_seen": 471374728, "step": 7765, "train_runtime": 101276.3606, "train_tokens_per_second": 4654.341 }, { "epoch": 0.9910714285714286, "grad_norm": 0.6250983995368763, "learning_rate": 5.071124220551703e-06, "loss": 0.3107258081436157, "num_input_tokens_seen": 471671400, "step": 7770, "train_runtime": 101331.795, "train_tokens_per_second": 4654.723 }, { "epoch": 0.9917091836734694, "grad_norm": 0.596583920106894, "learning_rate": 5.066115775635213e-06, "loss": 0.3611313343048096, "num_input_tokens_seen": 471987080, "step": 7775, "train_runtime": 101388.9103, "train_tokens_per_second": 4655.214 }, { "epoch": 0.9923469387755102, "grad_norm": 0.5404534855849914, "learning_rate": 5.061107264366926e-06, "loss": 0.3070375442504883, "num_input_tokens_seen": 472305712, "step": 7780, "train_runtime": 101456.6814, "train_tokens_per_second": 4655.245 }, { "epoch": 0.9929846938775511, "grad_norm": 0.619493258101051, "learning_rate": 5.05609869177323e-06, "loss": 0.32773163318634035, "num_input_tokens_seen": 472612736, "step": 7785, "train_runtime": 101513.4314, "train_tokens_per_second": 4655.667 }, { "epoch": 0.9936224489795918, "grad_norm": 0.6073300169522049, "learning_rate": 5.05109006288058e-06, "loss": 0.3287439107894897, "num_input_tokens_seen": 472917496, "step": 7790, "train_runtime": 101585.616, "train_tokens_per_second": 4655.359 }, { "epoch": 0.9942602040816326, "grad_norm": 0.5976543699814326, "learning_rate": 5.046081382715484e-06, "loss": 0.32365686893463136, "num_input_tokens_seen": 473218584, "step": 7795, "train_runtime": 101661.1465, "train_tokens_per_second": 4654.862 }, { "epoch": 0.9948979591836735, "grad_norm": 0.5794707914008376, "learning_rate": 5.0410726563045005e-06, "loss": 0.3211040496826172, "num_input_tokens_seen": 473517592, "step": 7800, "train_runtime": 101731.9811, "train_tokens_per_second": 4654.56 }, { "epoch": 0.9955357142857143, "grad_norm": 0.6662957115139384, "learning_rate": 5.036063888674239e-06, "loss": 0.32327837944030763, "num_input_tokens_seen": 473813360, "step": 7805, "train_runtime": 101793.3238, "train_tokens_per_second": 4654.66 }, { "epoch": 0.9961734693877551, "grad_norm": 0.6987883027560683, "learning_rate": 5.031055084851349e-06, "loss": 0.30079605579376223, "num_input_tokens_seen": 474124592, "step": 7810, "train_runtime": 101858.0502, "train_tokens_per_second": 4654.758 }, { "epoch": 0.9968112244897959, "grad_norm": 4.253525166511764, "learning_rate": 5.0260462498625084e-06, "loss": 0.3088978290557861, "num_input_tokens_seen": 474430976, "step": 7815, "train_runtime": 101916.7207, "train_tokens_per_second": 4655.085 }, { "epoch": 0.9974489795918368, "grad_norm": 0.586371936059209, "learning_rate": 5.021037388734439e-06, "loss": 0.33654088973999025, "num_input_tokens_seen": 474733096, "step": 7820, "train_runtime": 101978.5564, "train_tokens_per_second": 4655.225 }, { "epoch": 0.9980867346938775, "grad_norm": 0.576815230469967, "learning_rate": 5.016028506493881e-06, "loss": 0.29360170364379884, "num_input_tokens_seen": 475031800, "step": 7825, "train_runtime": 102041.6684, "train_tokens_per_second": 4655.273 }, { "epoch": 0.9987244897959183, "grad_norm": 0.5791985939268749, "learning_rate": 5.011019608167596e-06, "loss": 0.3257938861846924, "num_input_tokens_seen": 475328464, "step": 7830, "train_runtime": 102114.9461, "train_tokens_per_second": 4654.837 }, { "epoch": 0.9993622448979592, "grad_norm": 0.5999869417308511, "learning_rate": 5.006010698782365e-06, "loss": 0.3119340896606445, "num_input_tokens_seen": 475626552, "step": 7835, "train_runtime": 102182.8039, "train_tokens_per_second": 4654.663 }, { "epoch": 1.0, "grad_norm": 0.9166941734572396, "learning_rate": 5.001001783364978e-06, "loss": 0.30375056266784667, "num_input_tokens_seen": 475942160, "step": 7840, "train_runtime": 102242.4953, "train_tokens_per_second": 4655.033 }, { "epoch": 1.000637755102041, "grad_norm": 0.6247612870740253, "learning_rate": 4.995992866942232e-06, "loss": 0.267057466506958, "num_input_tokens_seen": 476239480, "step": 7845, "train_runtime": 102333.1184, "train_tokens_per_second": 4653.816 }, { "epoch": 1.0012755102040816, "grad_norm": 0.6909996036907871, "learning_rate": 4.990983954540925e-06, "loss": 0.2515033960342407, "num_input_tokens_seen": 476545208, "step": 7850, "train_runtime": 102395.6601, "train_tokens_per_second": 4653.959 }, { "epoch": 1.0019132653061225, "grad_norm": 0.6642170263412407, "learning_rate": 4.985975051187848e-06, "loss": 0.28331613540649414, "num_input_tokens_seen": 476859168, "step": 7855, "train_runtime": 102455.6737, "train_tokens_per_second": 4654.297 }, { "epoch": 1.0025510204081634, "grad_norm": 0.5862386325889741, "learning_rate": 4.980966161909785e-06, "loss": 0.24894070625305176, "num_input_tokens_seen": 477158016, "step": 7860, "train_runtime": 102531.3424, "train_tokens_per_second": 4653.777 }, { "epoch": 1.003188775510204, "grad_norm": 0.6820283813961971, "learning_rate": 4.975957291733511e-06, "loss": 0.2599456310272217, "num_input_tokens_seen": 477467600, "step": 7865, "train_runtime": 102600.8077, "train_tokens_per_second": 4653.644 }, { "epoch": 1.003826530612245, "grad_norm": 0.6293553093183993, "learning_rate": 4.970948445685772e-06, "loss": 0.26632611751556395, "num_input_tokens_seen": 477774896, "step": 7870, "train_runtime": 102674.6458, "train_tokens_per_second": 4653.29 }, { "epoch": 1.0044642857142858, "grad_norm": 0.6733067324704437, "learning_rate": 4.965939628793295e-06, "loss": 0.25829689502716063, "num_input_tokens_seen": 478085696, "step": 7875, "train_runtime": 102745.0125, "train_tokens_per_second": 4653.128 }, { "epoch": 1.0051020408163265, "grad_norm": 0.7376486939890683, "learning_rate": 4.960930846082783e-06, "loss": 0.27562432289123534, "num_input_tokens_seen": 478395512, "step": 7880, "train_runtime": 102807.5283, "train_tokens_per_second": 4653.312 }, { "epoch": 1.0057397959183674, "grad_norm": 0.6553939980833222, "learning_rate": 4.955922102580894e-06, "loss": 0.28523437976837157, "num_input_tokens_seen": 478696016, "step": 7885, "train_runtime": 102883.5291, "train_tokens_per_second": 4652.795 }, { "epoch": 1.0063775510204083, "grad_norm": 0.6084703407447201, "learning_rate": 4.9509134033142525e-06, "loss": 0.2536736488342285, "num_input_tokens_seen": 479003496, "step": 7890, "train_runtime": 102950.3634, "train_tokens_per_second": 4652.762 }, { "epoch": 1.007015306122449, "grad_norm": 0.7395301219386818, "learning_rate": 4.945904753309441e-06, "loss": 0.2690150260925293, "num_input_tokens_seen": 479311408, "step": 7895, "train_runtime": 103014.9331, "train_tokens_per_second": 4652.834 }, { "epoch": 1.0076530612244898, "grad_norm": 0.5996989201007621, "learning_rate": 4.940896157592985e-06, "loss": 0.24584484100341797, "num_input_tokens_seen": 479633944, "step": 7900, "train_runtime": 103081.9048, "train_tokens_per_second": 4652.94 }, { "epoch": 1.0082908163265305, "grad_norm": 1.0123091077906727, "learning_rate": 4.935887621191364e-06, "loss": 0.25741584300994874, "num_input_tokens_seen": 479943672, "step": 7905, "train_runtime": 103153.4164, "train_tokens_per_second": 4652.717 }, { "epoch": 1.0089285714285714, "grad_norm": 0.638985555424403, "learning_rate": 4.930879149130993e-06, "loss": 0.25302848815917967, "num_input_tokens_seen": 480246768, "step": 7910, "train_runtime": 103212.3781, "train_tokens_per_second": 4652.996 }, { "epoch": 1.0095663265306123, "grad_norm": 0.9761997263307471, "learning_rate": 4.925870746438223e-06, "loss": 0.2453629970550537, "num_input_tokens_seen": 480555560, "step": 7915, "train_runtime": 103273.0034, "train_tokens_per_second": 4653.254 }, { "epoch": 1.010204081632653, "grad_norm": 0.5582028468211174, "learning_rate": 4.920862418139335e-06, "loss": 0.24580702781677247, "num_input_tokens_seen": 480874576, "step": 7920, "train_runtime": 103341.5607, "train_tokens_per_second": 4653.254 }, { "epoch": 1.0108418367346939, "grad_norm": 0.692965875206244, "learning_rate": 4.91585416926054e-06, "loss": 0.25847864151000977, "num_input_tokens_seen": 481165672, "step": 7925, "train_runtime": 103402.9572, "train_tokens_per_second": 4653.307 }, { "epoch": 1.0114795918367347, "grad_norm": 0.6521915504350331, "learning_rate": 4.91084600482796e-06, "loss": 0.28442893028259275, "num_input_tokens_seen": 481472544, "step": 7930, "train_runtime": 103471.1104, "train_tokens_per_second": 4653.207 }, { "epoch": 1.0121173469387754, "grad_norm": 0.6593458337833973, "learning_rate": 4.905837929867643e-06, "loss": 0.2587409496307373, "num_input_tokens_seen": 481783768, "step": 7935, "train_runtime": 103536.0132, "train_tokens_per_second": 4653.297 }, { "epoch": 1.0127551020408163, "grad_norm": 0.6336318443270292, "learning_rate": 4.900829949405539e-06, "loss": 0.2645289421081543, "num_input_tokens_seen": 482093968, "step": 7940, "train_runtime": 103611.1224, "train_tokens_per_second": 4652.917 }, { "epoch": 1.0133928571428572, "grad_norm": 0.6657497957556802, "learning_rate": 4.895822068467505e-06, "loss": 0.2553886651992798, "num_input_tokens_seen": 482395560, "step": 7945, "train_runtime": 103673.5821, "train_tokens_per_second": 4653.023 }, { "epoch": 1.0140306122448979, "grad_norm": 0.6812110362287225, "learning_rate": 4.890814292079303e-06, "loss": 0.2639014482498169, "num_input_tokens_seen": 482696040, "step": 7950, "train_runtime": 103738.4539, "train_tokens_per_second": 4653.01 }, { "epoch": 1.0146683673469388, "grad_norm": 0.6321603411543906, "learning_rate": 4.885806625266585e-06, "loss": 0.2515778303146362, "num_input_tokens_seen": 482997952, "step": 7955, "train_runtime": 103814.8986, "train_tokens_per_second": 4652.492 }, { "epoch": 1.0153061224489797, "grad_norm": 0.5741318142930434, "learning_rate": 4.8807990730548905e-06, "loss": 0.2634756088256836, "num_input_tokens_seen": 483299448, "step": 7960, "train_runtime": 103880.1013, "train_tokens_per_second": 4652.474 }, { "epoch": 1.0159438775510203, "grad_norm": 0.635321293778533, "learning_rate": 4.8757916404696545e-06, "loss": 0.2525560617446899, "num_input_tokens_seen": 483598280, "step": 7965, "train_runtime": 103950.5884, "train_tokens_per_second": 4652.194 }, { "epoch": 1.0165816326530612, "grad_norm": 0.6340507571071121, "learning_rate": 4.870784332536181e-06, "loss": 0.26147069931030276, "num_input_tokens_seen": 483902832, "step": 7970, "train_runtime": 104010.0218, "train_tokens_per_second": 4652.464 }, { "epoch": 1.0172193877551021, "grad_norm": 0.637133557237528, "learning_rate": 4.865777154279653e-06, "loss": 0.2916694164276123, "num_input_tokens_seen": 484213240, "step": 7975, "train_runtime": 104071.9412, "train_tokens_per_second": 4652.678 }, { "epoch": 1.0178571428571428, "grad_norm": 0.689867539623888, "learning_rate": 4.8607701107251274e-06, "loss": 0.2569180965423584, "num_input_tokens_seen": 484520120, "step": 7980, "train_runtime": 104147.976, "train_tokens_per_second": 4652.228 }, { "epoch": 1.0184948979591837, "grad_norm": 0.6790640266183066, "learning_rate": 4.855763206897516e-06, "loss": 0.26433415412902833, "num_input_tokens_seen": 484814000, "step": 7985, "train_runtime": 104219.3971, "train_tokens_per_second": 4651.86 }, { "epoch": 1.0191326530612246, "grad_norm": 0.6665199792341517, "learning_rate": 4.850756447821602e-06, "loss": 0.25423283576965333, "num_input_tokens_seen": 485110200, "step": 7990, "train_runtime": 104276.1594, "train_tokens_per_second": 4652.168 }, { "epoch": 1.0197704081632653, "grad_norm": 0.6364233064926358, "learning_rate": 4.845749838522016e-06, "loss": 0.2718416929244995, "num_input_tokens_seen": 485420576, "step": 7995, "train_runtime": 104343.8851, "train_tokens_per_second": 4652.123 }, { "epoch": 1.0204081632653061, "grad_norm": 0.6202741303914555, "learning_rate": 4.84074338402324e-06, "loss": 0.26037960052490233, "num_input_tokens_seen": 485740608, "step": 8000, "train_runtime": 104401.1017, "train_tokens_per_second": 4652.639 }, { "epoch": 1.021045918367347, "grad_norm": 0.7220910599114735, "learning_rate": 4.835737089349599e-06, "loss": 0.2492842674255371, "num_input_tokens_seen": 486046816, "step": 8005, "train_runtime": 104462.7113, "train_tokens_per_second": 4652.826 }, { "epoch": 1.0216836734693877, "grad_norm": 0.5840777439565414, "learning_rate": 4.8307309595252624e-06, "loss": 0.261875057220459, "num_input_tokens_seen": 486355088, "step": 8010, "train_runtime": 104527.5586, "train_tokens_per_second": 4652.889 }, { "epoch": 1.0223214285714286, "grad_norm": 0.666076705817103, "learning_rate": 4.82572499957423e-06, "loss": 0.24945347309112548, "num_input_tokens_seen": 486668640, "step": 8015, "train_runtime": 104588.7746, "train_tokens_per_second": 4653.163 }, { "epoch": 1.0229591836734695, "grad_norm": 0.856542958405885, "learning_rate": 4.820719214520329e-06, "loss": 0.2600055694580078, "num_input_tokens_seen": 486972232, "step": 8020, "train_runtime": 104643.5721, "train_tokens_per_second": 4653.628 }, { "epoch": 1.0235969387755102, "grad_norm": 0.6381585023747365, "learning_rate": 4.815713609387221e-06, "loss": 0.2600249290466309, "num_input_tokens_seen": 487258464, "step": 8025, "train_runtime": 104715.3174, "train_tokens_per_second": 4653.173 }, { "epoch": 1.024234693877551, "grad_norm": 0.6715307356212113, "learning_rate": 4.810708189198374e-06, "loss": 0.25761544704437256, "num_input_tokens_seen": 487564392, "step": 8030, "train_runtime": 104780.5311, "train_tokens_per_second": 4653.196 }, { "epoch": 1.0248724489795917, "grad_norm": 0.643898777376009, "learning_rate": 4.80570295897708e-06, "loss": 0.26144454479217527, "num_input_tokens_seen": 487865256, "step": 8035, "train_runtime": 104848.4722, "train_tokens_per_second": 4653.051 }, { "epoch": 1.0255102040816326, "grad_norm": 0.7028248442260028, "learning_rate": 4.800697923746437e-06, "loss": 0.2451169013977051, "num_input_tokens_seen": 488171848, "step": 8040, "train_runtime": 104917.1839, "train_tokens_per_second": 4652.926 }, { "epoch": 1.0261479591836735, "grad_norm": 0.6465862682800327, "learning_rate": 4.795693088529345e-06, "loss": 0.24808902740478517, "num_input_tokens_seen": 488475712, "step": 8045, "train_runtime": 104982.6553, "train_tokens_per_second": 4652.918 }, { "epoch": 1.0267857142857142, "grad_norm": 0.5944052821225811, "learning_rate": 4.790688458348509e-06, "loss": 0.23900938034057617, "num_input_tokens_seen": 488771280, "step": 8050, "train_runtime": 105051.8384, "train_tokens_per_second": 4652.668 }, { "epoch": 1.027423469387755, "grad_norm": 0.6708975172355104, "learning_rate": 4.7856840382264234e-06, "loss": 0.2610027313232422, "num_input_tokens_seen": 489065984, "step": 8055, "train_runtime": 105120.8691, "train_tokens_per_second": 4652.416 }, { "epoch": 1.028061224489796, "grad_norm": 0.656067227588874, "learning_rate": 4.780679833185372e-06, "loss": 0.2779052257537842, "num_input_tokens_seen": 489372736, "step": 8060, "train_runtime": 105177.9651, "train_tokens_per_second": 4652.807 }, { "epoch": 1.0286989795918366, "grad_norm": 0.6408509861089134, "learning_rate": 4.775675848247427e-06, "loss": 0.246592378616333, "num_input_tokens_seen": 489656160, "step": 8065, "train_runtime": 105249.934, "train_tokens_per_second": 4652.318 }, { "epoch": 1.0293367346938775, "grad_norm": 0.6385842298683069, "learning_rate": 4.770672088434433e-06, "loss": 0.2661409854888916, "num_input_tokens_seen": 489956800, "step": 8070, "train_runtime": 105319.2908, "train_tokens_per_second": 4652.109 }, { "epoch": 1.0299744897959184, "grad_norm": 0.6751569338827333, "learning_rate": 4.765668558768015e-06, "loss": 0.25893139839172363, "num_input_tokens_seen": 490255024, "step": 8075, "train_runtime": 105378.8446, "train_tokens_per_second": 4652.31 }, { "epoch": 1.030612244897959, "grad_norm": 0.7029112914351848, "learning_rate": 4.760665264269566e-06, "loss": 0.2638129234313965, "num_input_tokens_seen": 490550736, "step": 8080, "train_runtime": 105450.2212, "train_tokens_per_second": 4651.965 }, { "epoch": 1.03125, "grad_norm": 0.6062632654229719, "learning_rate": 4.755662209960238e-06, "loss": 0.2742192506790161, "num_input_tokens_seen": 490851432, "step": 8085, "train_runtime": 105512.6796, "train_tokens_per_second": 4652.061 }, { "epoch": 1.031887755102041, "grad_norm": 0.620424732783558, "learning_rate": 4.750659400860945e-06, "loss": 0.2618445634841919, "num_input_tokens_seen": 491159256, "step": 8090, "train_runtime": 105568.4628, "train_tokens_per_second": 4652.519 }, { "epoch": 1.0325255102040816, "grad_norm": 0.6392574834281675, "learning_rate": 4.74565684199236e-06, "loss": 0.2552893400192261, "num_input_tokens_seen": 491470608, "step": 8095, "train_runtime": 105636.7798, "train_tokens_per_second": 4652.457 }, { "epoch": 1.0331632653061225, "grad_norm": 0.6726663259450165, "learning_rate": 4.740654538374896e-06, "loss": 0.2529830694198608, "num_input_tokens_seen": 491763560, "step": 8100, "train_runtime": 105696.9829, "train_tokens_per_second": 4652.579 }, { "epoch": 1.0338010204081634, "grad_norm": 0.6587618385624907, "learning_rate": 4.735652495028714e-06, "loss": 0.25743880271911623, "num_input_tokens_seen": 492064832, "step": 8105, "train_runtime": 105773.7668, "train_tokens_per_second": 4652.05 }, { "epoch": 1.034438775510204, "grad_norm": 0.5783179768407403, "learning_rate": 4.7306507169737176e-06, "loss": 0.2751675367355347, "num_input_tokens_seen": 492377080, "step": 8110, "train_runtime": 105839.6023, "train_tokens_per_second": 4652.106 }, { "epoch": 1.035076530612245, "grad_norm": 0.6465319699013996, "learning_rate": 4.725649209229537e-06, "loss": 0.25722560882568357, "num_input_tokens_seen": 492681472, "step": 8115, "train_runtime": 105912.9296, "train_tokens_per_second": 4651.759 }, { "epoch": 1.0357142857142858, "grad_norm": 0.6642526932627694, "learning_rate": 4.720647976815536e-06, "loss": 0.24139046669006348, "num_input_tokens_seen": 492970464, "step": 8120, "train_runtime": 105970.3804, "train_tokens_per_second": 4651.965 }, { "epoch": 1.0363520408163265, "grad_norm": 0.6473252402579394, "learning_rate": 4.7156470247508e-06, "loss": 0.275927734375, "num_input_tokens_seen": 493277120, "step": 8125, "train_runtime": 106037.1042, "train_tokens_per_second": 4651.929 }, { "epoch": 1.0369897959183674, "grad_norm": 0.6084817317793819, "learning_rate": 4.710646358054133e-06, "loss": 0.2354154109954834, "num_input_tokens_seen": 493583608, "step": 8130, "train_runtime": 106110.0221, "train_tokens_per_second": 4651.621 }, { "epoch": 1.0376275510204083, "grad_norm": 0.7212498914109421, "learning_rate": 4.705645981744055e-06, "loss": 0.258892822265625, "num_input_tokens_seen": 493890512, "step": 8135, "train_runtime": 106183.9086, "train_tokens_per_second": 4651.275 }, { "epoch": 1.038265306122449, "grad_norm": 0.6546681839807147, "learning_rate": 4.700645900838793e-06, "loss": 0.25546367168426515, "num_input_tokens_seen": 494183480, "step": 8140, "train_runtime": 106256.4337, "train_tokens_per_second": 4650.857 }, { "epoch": 1.0389030612244898, "grad_norm": 0.5896754902838178, "learning_rate": 4.695646120356275e-06, "loss": 0.2416550874710083, "num_input_tokens_seen": 494496488, "step": 8145, "train_runtime": 106323.3221, "train_tokens_per_second": 4650.875 }, { "epoch": 1.0395408163265305, "grad_norm": 0.5810570907446073, "learning_rate": 4.69064664531413e-06, "loss": 0.24819722175598144, "num_input_tokens_seen": 494818504, "step": 8150, "train_runtime": 106382.0337, "train_tokens_per_second": 4651.335 }, { "epoch": 1.0401785714285714, "grad_norm": 0.5770375167186163, "learning_rate": 4.685647480729684e-06, "loss": 0.23823702335357666, "num_input_tokens_seen": 495124752, "step": 8155, "train_runtime": 106455.573, "train_tokens_per_second": 4650.999 }, { "epoch": 1.0408163265306123, "grad_norm": 0.5969216247175317, "learning_rate": 4.680648631619945e-06, "loss": 0.266727876663208, "num_input_tokens_seen": 495417592, "step": 8160, "train_runtime": 106525.7383, "train_tokens_per_second": 4650.684 }, { "epoch": 1.041454081632653, "grad_norm": 0.7016300683844784, "learning_rate": 4.675650103001606e-06, "loss": 0.2604006052017212, "num_input_tokens_seen": 495721688, "step": 8165, "train_runtime": 106582.1881, "train_tokens_per_second": 4651.074 }, { "epoch": 1.0420918367346939, "grad_norm": 0.6467472959587393, "learning_rate": 4.670651899891043e-06, "loss": 0.2684458017349243, "num_input_tokens_seen": 496029336, "step": 8170, "train_runtime": 106639.8096, "train_tokens_per_second": 4651.446 }, { "epoch": 1.0427295918367347, "grad_norm": 0.6566571084817839, "learning_rate": 4.6656540273042986e-06, "loss": 0.23414976596832277, "num_input_tokens_seen": 496320248, "step": 8175, "train_runtime": 106705.718, "train_tokens_per_second": 4651.299 }, { "epoch": 1.0433673469387754, "grad_norm": 0.6642033019512137, "learning_rate": 4.66065649025709e-06, "loss": 0.26569809913635256, "num_input_tokens_seen": 496622736, "step": 8180, "train_runtime": 106782.1967, "train_tokens_per_second": 4650.801 }, { "epoch": 1.0440051020408163, "grad_norm": 0.6433544310559931, "learning_rate": 4.655659293764793e-06, "loss": 0.27560110092163087, "num_input_tokens_seen": 496940704, "step": 8185, "train_runtime": 106835.9992, "train_tokens_per_second": 4651.435 }, { "epoch": 1.0446428571428572, "grad_norm": 0.6801894221346246, "learning_rate": 4.6506624428424405e-06, "loss": 0.2756011724472046, "num_input_tokens_seen": 497235288, "step": 8190, "train_runtime": 106905.8988, "train_tokens_per_second": 4651.149 }, { "epoch": 1.0452806122448979, "grad_norm": 0.6593686921006262, "learning_rate": 4.645665942504728e-06, "loss": 0.27366573810577394, "num_input_tokens_seen": 497531328, "step": 8195, "train_runtime": 106972.2557, "train_tokens_per_second": 4651.031 }, { "epoch": 1.0459183673469388, "grad_norm": 0.7013843354836571, "learning_rate": 4.640669797765987e-06, "loss": 0.2521559715270996, "num_input_tokens_seen": 497820552, "step": 8200, "train_runtime": 107039.6241, "train_tokens_per_second": 4650.806 }, { "epoch": 1.0465561224489797, "grad_norm": 0.5962201167638378, "learning_rate": 4.6356740136402e-06, "loss": 0.25814969539642335, "num_input_tokens_seen": 498130520, "step": 8205, "train_runtime": 107095.0698, "train_tokens_per_second": 4651.293 }, { "epoch": 1.0471938775510203, "grad_norm": 0.6937696700908256, "learning_rate": 4.630678595140985e-06, "loss": 0.2693226099014282, "num_input_tokens_seen": 498428464, "step": 8210, "train_runtime": 107163.8015, "train_tokens_per_second": 4651.09 }, { "epoch": 1.0478316326530612, "grad_norm": 0.6359586973652941, "learning_rate": 4.625683547281592e-06, "loss": 0.2454256534576416, "num_input_tokens_seen": 498741112, "step": 8215, "train_runtime": 107237.407, "train_tokens_per_second": 4650.813 }, { "epoch": 1.0484693877551021, "grad_norm": 0.6222516562474432, "learning_rate": 4.620688875074902e-06, "loss": 0.2583413362503052, "num_input_tokens_seen": 499042560, "step": 8220, "train_runtime": 107303.6836, "train_tokens_per_second": 4650.75 }, { "epoch": 1.0491071428571428, "grad_norm": 0.684295054601306, "learning_rate": 4.615694583533418e-06, "loss": 0.24875664710998535, "num_input_tokens_seen": 499340840, "step": 8225, "train_runtime": 107362.1364, "train_tokens_per_second": 4650.996 }, { "epoch": 1.0497448979591837, "grad_norm": 0.6651829513990113, "learning_rate": 4.610700677669259e-06, "loss": 0.2657691717147827, "num_input_tokens_seen": 499653984, "step": 8230, "train_runtime": 107419.1222, "train_tokens_per_second": 4651.444 }, { "epoch": 1.0503826530612246, "grad_norm": 0.6262488827007487, "learning_rate": 4.605707162494157e-06, "loss": 0.26746602058410646, "num_input_tokens_seen": 499955880, "step": 8235, "train_runtime": 107484.7661, "train_tokens_per_second": 4651.412 }, { "epoch": 1.0510204081632653, "grad_norm": 0.6310229490441964, "learning_rate": 4.600714043019456e-06, "loss": 0.25636651515960696, "num_input_tokens_seen": 500260776, "step": 8240, "train_runtime": 107544.1602, "train_tokens_per_second": 4651.678 }, { "epoch": 1.0516581632653061, "grad_norm": 0.6879500520531826, "learning_rate": 4.5957213242560985e-06, "loss": 0.2619192600250244, "num_input_tokens_seen": 500560728, "step": 8245, "train_runtime": 107609.1779, "train_tokens_per_second": 4651.655 }, { "epoch": 1.052295918367347, "grad_norm": 0.5514238162725921, "learning_rate": 4.5907290112146265e-06, "loss": 0.24567170143127443, "num_input_tokens_seen": 500864232, "step": 8250, "train_runtime": 107665.2845, "train_tokens_per_second": 4652.049 }, { "epoch": 1.0529336734693877, "grad_norm": 0.6918867101607463, "learning_rate": 4.585737108905178e-06, "loss": 0.25845234394073485, "num_input_tokens_seen": 501171944, "step": 8255, "train_runtime": 107714.5333, "train_tokens_per_second": 4652.779 }, { "epoch": 1.0535714285714286, "grad_norm": 0.6568866025069288, "learning_rate": 4.5807456223374695e-06, "loss": 0.26011834144592283, "num_input_tokens_seen": 501482344, "step": 8260, "train_runtime": 107784.813, "train_tokens_per_second": 4652.625 }, { "epoch": 1.0542091836734695, "grad_norm": 0.6772907381209184, "learning_rate": 4.57575455652081e-06, "loss": 0.24192533493041993, "num_input_tokens_seen": 501767928, "step": 8265, "train_runtime": 107859.0094, "train_tokens_per_second": 4652.072 }, { "epoch": 1.0548469387755102, "grad_norm": 0.6817981326124604, "learning_rate": 4.570763916464084e-06, "loss": 0.2520601749420166, "num_input_tokens_seen": 502063992, "step": 8270, "train_runtime": 107921.5358, "train_tokens_per_second": 4652.121 }, { "epoch": 1.055484693877551, "grad_norm": 0.5940719591783477, "learning_rate": 4.565773707175743e-06, "loss": 0.27521862983703616, "num_input_tokens_seen": 502375752, "step": 8275, "train_runtime": 107975.6393, "train_tokens_per_second": 4652.677 }, { "epoch": 1.0561224489795917, "grad_norm": 0.6494867279933533, "learning_rate": 4.560783933663814e-06, "loss": 0.2762296676635742, "num_input_tokens_seen": 502676192, "step": 8280, "train_runtime": 108035.3648, "train_tokens_per_second": 4652.886 }, { "epoch": 1.0567602040816326, "grad_norm": 0.629753785819062, "learning_rate": 4.5557946009358846e-06, "loss": 0.2601089239120483, "num_input_tokens_seen": 502984856, "step": 8285, "train_runtime": 108105.2293, "train_tokens_per_second": 4652.734 }, { "epoch": 1.0573979591836735, "grad_norm": 0.5748847670556543, "learning_rate": 4.550805713999094e-06, "loss": 0.23802318572998046, "num_input_tokens_seen": 503296512, "step": 8290, "train_runtime": 108169.2907, "train_tokens_per_second": 4652.86 }, { "epoch": 1.0580357142857142, "grad_norm": 0.6811748430518816, "learning_rate": 4.545817277860143e-06, "loss": 0.27293121814727783, "num_input_tokens_seen": 503588512, "step": 8295, "train_runtime": 108232.862, "train_tokens_per_second": 4652.824 }, { "epoch": 1.058673469387755, "grad_norm": 0.6694897094057808, "learning_rate": 4.540829297525272e-06, "loss": 0.27684831619262695, "num_input_tokens_seen": 503900680, "step": 8300, "train_runtime": 108288.235, "train_tokens_per_second": 4653.328 }, { "epoch": 1.059311224489796, "grad_norm": 0.6332558484893667, "learning_rate": 4.53584177800027e-06, "loss": 0.24174211025238038, "num_input_tokens_seen": 504207016, "step": 8305, "train_runtime": 108344.5029, "train_tokens_per_second": 4653.739 }, { "epoch": 1.0599489795918366, "grad_norm": 0.6255828542219396, "learning_rate": 4.530854724290461e-06, "loss": 0.24687228202819825, "num_input_tokens_seen": 504518576, "step": 8310, "train_runtime": 108417.3121, "train_tokens_per_second": 4653.487 }, { "epoch": 1.0605867346938775, "grad_norm": 0.6754211592346366, "learning_rate": 4.5258681414007005e-06, "loss": 0.2555249691009521, "num_input_tokens_seen": 504814448, "step": 8315, "train_runtime": 108485.7262, "train_tokens_per_second": 4653.28 }, { "epoch": 1.0612244897959184, "grad_norm": 0.6111824380618206, "learning_rate": 4.5208820343353726e-06, "loss": 0.24149341583251954, "num_input_tokens_seen": 505109024, "step": 8320, "train_runtime": 108560.1597, "train_tokens_per_second": 4652.803 }, { "epoch": 1.061862244897959, "grad_norm": 0.6921188319092784, "learning_rate": 4.515896408098387e-06, "loss": 0.24489209651947022, "num_input_tokens_seen": 505399152, "step": 8325, "train_runtime": 108632.4622, "train_tokens_per_second": 4652.377 }, { "epoch": 1.0625, "grad_norm": 0.6457386674680605, "learning_rate": 4.510911267693164e-06, "loss": 0.27535414695739746, "num_input_tokens_seen": 505692008, "step": 8330, "train_runtime": 108694.8052, "train_tokens_per_second": 4652.403 }, { "epoch": 1.063137755102041, "grad_norm": 0.6404589113203911, "learning_rate": 4.505926618122641e-06, "loss": 0.25455851554870607, "num_input_tokens_seen": 506000168, "step": 8335, "train_runtime": 108761.9998, "train_tokens_per_second": 4652.362 }, { "epoch": 1.0637755102040816, "grad_norm": 0.6726710709845345, "learning_rate": 4.5009424643892644e-06, "loss": 0.2708827018737793, "num_input_tokens_seen": 506306912, "step": 8340, "train_runtime": 108815.3123, "train_tokens_per_second": 4652.901 }, { "epoch": 1.0644132653061225, "grad_norm": 0.6698963462362696, "learning_rate": 4.4959588114949785e-06, "loss": 0.24709620475769042, "num_input_tokens_seen": 506598448, "step": 8345, "train_runtime": 108871.1825, "train_tokens_per_second": 4653.191 }, { "epoch": 1.0650510204081634, "grad_norm": 0.6153694586832253, "learning_rate": 4.490975664441227e-06, "loss": 0.24962987899780273, "num_input_tokens_seen": 506905000, "step": 8350, "train_runtime": 108933.4304, "train_tokens_per_second": 4653.347 }, { "epoch": 1.065688775510204, "grad_norm": 0.620077961138061, "learning_rate": 4.4859930282289475e-06, "loss": 0.2546701431274414, "num_input_tokens_seen": 507222320, "step": 8355, "train_runtime": 108988.7403, "train_tokens_per_second": 4653.897 }, { "epoch": 1.066326530612245, "grad_norm": 0.6231083614697688, "learning_rate": 4.48101090785856e-06, "loss": 0.28885631561279296, "num_input_tokens_seen": 507517176, "step": 8360, "train_runtime": 109062.4286, "train_tokens_per_second": 4653.456 }, { "epoch": 1.0669642857142858, "grad_norm": 0.7449931510092558, "learning_rate": 4.4760293083299736e-06, "loss": 0.26137232780456543, "num_input_tokens_seen": 507804944, "step": 8365, "train_runtime": 109128.8225, "train_tokens_per_second": 4653.261 }, { "epoch": 1.0676020408163265, "grad_norm": 0.6686152755009991, "learning_rate": 4.471048234642572e-06, "loss": 0.2702186584472656, "num_input_tokens_seen": 508107408, "step": 8370, "train_runtime": 109188.7672, "train_tokens_per_second": 4653.477 }, { "epoch": 1.0682397959183674, "grad_norm": 0.7020326980677524, "learning_rate": 4.466067691795208e-06, "loss": 0.26437246799468994, "num_input_tokens_seen": 508414640, "step": 8375, "train_runtime": 109261.8547, "train_tokens_per_second": 4653.176 }, { "epoch": 1.068877551020408, "grad_norm": 0.6688995113612123, "learning_rate": 4.4610876847862034e-06, "loss": 0.2574469566345215, "num_input_tokens_seen": 508717400, "step": 8380, "train_runtime": 109335.2266, "train_tokens_per_second": 4652.822 }, { "epoch": 1.069515306122449, "grad_norm": 0.714734676236501, "learning_rate": 4.456108218613346e-06, "loss": 0.27723989486694334, "num_input_tokens_seen": 509023408, "step": 8385, "train_runtime": 109394.6985, "train_tokens_per_second": 4653.09 }, { "epoch": 1.0701530612244898, "grad_norm": 0.5704584998462686, "learning_rate": 4.451129298273877e-06, "loss": 0.2590214252471924, "num_input_tokens_seen": 509332808, "step": 8390, "train_runtime": 109456.5926, "train_tokens_per_second": 4653.286 }, { "epoch": 1.0707908163265305, "grad_norm": 0.6512911702869287, "learning_rate": 4.4461509287644885e-06, "loss": 0.25503556728363036, "num_input_tokens_seen": 509641560, "step": 8395, "train_runtime": 109520.4782, "train_tokens_per_second": 4653.391 }, { "epoch": 1.0714285714285714, "grad_norm": 0.5976966356347777, "learning_rate": 4.441173115081327e-06, "loss": 0.23296217918395995, "num_input_tokens_seen": 509941488, "step": 8400, "train_runtime": 109585.1984, "train_tokens_per_second": 4653.379 }, { "epoch": 1.0720663265306123, "grad_norm": 0.6228044749405278, "learning_rate": 4.43619586221997e-06, "loss": 0.27005853652954104, "num_input_tokens_seen": 510234680, "step": 8405, "train_runtime": 109642.8463, "train_tokens_per_second": 4653.607 }, { "epoch": 1.072704081632653, "grad_norm": 0.63348561639179, "learning_rate": 4.4312191751754415e-06, "loss": 0.23705193996429444, "num_input_tokens_seen": 510535432, "step": 8410, "train_runtime": 109715.4691, "train_tokens_per_second": 4653.268 }, { "epoch": 1.0733418367346939, "grad_norm": 0.6841082125372675, "learning_rate": 4.426243058942196e-06, "loss": 0.2547664403915405, "num_input_tokens_seen": 510829424, "step": 8415, "train_runtime": 109774.5772, "train_tokens_per_second": 4653.44 }, { "epoch": 1.0739795918367347, "grad_norm": 0.7232820006970838, "learning_rate": 4.42126751851411e-06, "loss": 0.2672074556350708, "num_input_tokens_seen": 511132368, "step": 8420, "train_runtime": 109841.1571, "train_tokens_per_second": 4653.377 }, { "epoch": 1.0746173469387754, "grad_norm": 0.7090149309099536, "learning_rate": 4.4162925588844895e-06, "loss": 0.269744348526001, "num_input_tokens_seen": 511428392, "step": 8425, "train_runtime": 109906.826, "train_tokens_per_second": 4653.291 }, { "epoch": 1.0752551020408163, "grad_norm": 0.6697337167265367, "learning_rate": 4.4113181850460504e-06, "loss": 0.25969829559326174, "num_input_tokens_seen": 511735696, "step": 8430, "train_runtime": 109975.9882, "train_tokens_per_second": 4653.158 }, { "epoch": 1.0758928571428572, "grad_norm": 0.6955769703739513, "learning_rate": 4.406344401990927e-06, "loss": 0.2720786571502686, "num_input_tokens_seen": 512041384, "step": 8435, "train_runtime": 110030.3589, "train_tokens_per_second": 4653.637 }, { "epoch": 1.0765306122448979, "grad_norm": 0.6990517466345093, "learning_rate": 4.401371214710658e-06, "loss": 0.2635928153991699, "num_input_tokens_seen": 512335736, "step": 8440, "train_runtime": 110084.6351, "train_tokens_per_second": 4654.017 }, { "epoch": 1.0771683673469388, "grad_norm": 0.5871716823716583, "learning_rate": 4.396398628196181e-06, "loss": 0.24565181732177735, "num_input_tokens_seen": 512636824, "step": 8445, "train_runtime": 110158.4388, "train_tokens_per_second": 4653.632 }, { "epoch": 1.0778061224489797, "grad_norm": 0.6538259620328585, "learning_rate": 4.391426647437836e-06, "loss": 0.2619929313659668, "num_input_tokens_seen": 512931896, "step": 8450, "train_runtime": 110223.0242, "train_tokens_per_second": 4653.582 }, { "epoch": 1.0784438775510203, "grad_norm": 0.626992678120448, "learning_rate": 4.386455277425355e-06, "loss": 0.24539623260498047, "num_input_tokens_seen": 513237216, "step": 8455, "train_runtime": 110282.9833, "train_tokens_per_second": 4653.821 }, { "epoch": 1.0790816326530612, "grad_norm": 0.6565855097817582, "learning_rate": 4.381484523147852e-06, "loss": 0.2395007610321045, "num_input_tokens_seen": 513545312, "step": 8460, "train_runtime": 110356.3949, "train_tokens_per_second": 4653.517 }, { "epoch": 1.0797193877551021, "grad_norm": 0.6354154110897268, "learning_rate": 4.376514389593827e-06, "loss": 0.24681005477905274, "num_input_tokens_seen": 513836768, "step": 8465, "train_runtime": 110425.6141, "train_tokens_per_second": 4653.239 }, { "epoch": 1.0803571428571428, "grad_norm": 0.7171363243436465, "learning_rate": 4.3715448817511565e-06, "loss": 0.26409809589385985, "num_input_tokens_seen": 514138696, "step": 8470, "train_runtime": 110492.6387, "train_tokens_per_second": 4653.149 }, { "epoch": 1.0809948979591837, "grad_norm": 0.7197280803089543, "learning_rate": 4.3665760046070885e-06, "loss": 0.25276215076446534, "num_input_tokens_seen": 514447760, "step": 8475, "train_runtime": 110562.2261, "train_tokens_per_second": 4653.016 }, { "epoch": 1.0816326530612246, "grad_norm": 0.6764093081611164, "learning_rate": 4.361607763148236e-06, "loss": 0.24439802169799804, "num_input_tokens_seen": 514743056, "step": 8480, "train_runtime": 110626.314, "train_tokens_per_second": 4652.989 }, { "epoch": 1.0822704081632653, "grad_norm": 0.7445548995509881, "learning_rate": 4.356640162360582e-06, "loss": 0.2473681688308716, "num_input_tokens_seen": 515046088, "step": 8485, "train_runtime": 110697.5579, "train_tokens_per_second": 4652.732 }, { "epoch": 1.0829081632653061, "grad_norm": 0.6605282556895079, "learning_rate": 4.3516732072294545e-06, "loss": 0.25981926918029785, "num_input_tokens_seen": 515354392, "step": 8490, "train_runtime": 110768.4954, "train_tokens_per_second": 4652.536 }, { "epoch": 1.083545918367347, "grad_norm": 0.78980964959287, "learning_rate": 4.346706902739544e-06, "loss": 0.2604411840438843, "num_input_tokens_seen": 515653976, "step": 8495, "train_runtime": 110826.1551, "train_tokens_per_second": 4652.818 }, { "epoch": 1.0841836734693877, "grad_norm": 0.6105232803409607, "learning_rate": 4.3417412538748824e-06, "loss": 0.2681291580200195, "num_input_tokens_seen": 515960096, "step": 8500, "train_runtime": 110894.6781, "train_tokens_per_second": 4652.704 }, { "epoch": 1.0848214285714286, "grad_norm": 0.7533094617059788, "learning_rate": 4.336776265618844e-06, "loss": 0.24369583129882813, "num_input_tokens_seen": 516259976, "step": 8505, "train_runtime": 110971.1032, "train_tokens_per_second": 4652.202 }, { "epoch": 1.0854591836734695, "grad_norm": 0.7094543382418285, "learning_rate": 4.331811942954143e-06, "loss": 0.2504972696304321, "num_input_tokens_seen": 516557400, "step": 8510, "train_runtime": 111025.1931, "train_tokens_per_second": 4652.614 }, { "epoch": 1.0860969387755102, "grad_norm": 0.5659879062873587, "learning_rate": 4.3268482908628245e-06, "loss": 0.25997779369354246, "num_input_tokens_seen": 516859248, "step": 8515, "train_runtime": 111085.0512, "train_tokens_per_second": 4652.825 }, { "epoch": 1.086734693877551, "grad_norm": 0.6567166938858798, "learning_rate": 4.321885314326258e-06, "loss": 0.23948345184326172, "num_input_tokens_seen": 517168080, "step": 8520, "train_runtime": 111154.8731, "train_tokens_per_second": 4652.68 }, { "epoch": 1.087372448979592, "grad_norm": 0.6788260721034282, "learning_rate": 4.316923018325137e-06, "loss": 0.25132384300231936, "num_input_tokens_seen": 517462696, "step": 8525, "train_runtime": 111221.6272, "train_tokens_per_second": 4652.537 }, { "epoch": 1.0880102040816326, "grad_norm": 0.6899299468505758, "learning_rate": 4.3119614078394756e-06, "loss": 0.2746640682220459, "num_input_tokens_seen": 517771872, "step": 8530, "train_runtime": 111296.2163, "train_tokens_per_second": 4652.197 }, { "epoch": 1.0886479591836735, "grad_norm": 0.6958708744235721, "learning_rate": 4.3070004878485925e-06, "loss": 0.25914363861083983, "num_input_tokens_seen": 518070000, "step": 8535, "train_runtime": 111359.8351, "train_tokens_per_second": 4652.216 }, { "epoch": 1.0892857142857142, "grad_norm": 0.6236966250731748, "learning_rate": 4.30204026333112e-06, "loss": 0.2593933343887329, "num_input_tokens_seen": 518386712, "step": 8540, "train_runtime": 111422.2229, "train_tokens_per_second": 4652.454 }, { "epoch": 1.089923469387755, "grad_norm": 0.6224503051450146, "learning_rate": 4.297080739264987e-06, "loss": 0.2581711053848267, "num_input_tokens_seen": 518698160, "step": 8545, "train_runtime": 111474.3926, "train_tokens_per_second": 4653.07 }, { "epoch": 1.090561224489796, "grad_norm": 0.6347803948249341, "learning_rate": 4.292121920627423e-06, "loss": 0.25314912796020506, "num_input_tokens_seen": 518996176, "step": 8550, "train_runtime": 111544.4488, "train_tokens_per_second": 4652.819 }, { "epoch": 1.0911989795918366, "grad_norm": 0.775808725416068, "learning_rate": 4.287163812394952e-06, "loss": 0.25922203063964844, "num_input_tokens_seen": 519299072, "step": 8555, "train_runtime": 111618.4393, "train_tokens_per_second": 4652.449 }, { "epoch": 1.0918367346938775, "grad_norm": 0.6314140806578885, "learning_rate": 4.282206419543379e-06, "loss": 0.2555856227874756, "num_input_tokens_seen": 519593872, "step": 8560, "train_runtime": 111695.7856, "train_tokens_per_second": 4651.866 }, { "epoch": 1.0924744897959184, "grad_norm": 0.6713664786987801, "learning_rate": 4.2772497470477934e-06, "loss": 0.2524415493011475, "num_input_tokens_seen": 519899040, "step": 8565, "train_runtime": 111756.2816, "train_tokens_per_second": 4652.079 }, { "epoch": 1.093112244897959, "grad_norm": 0.632549152859099, "learning_rate": 4.272293799882565e-06, "loss": 0.25772848129272463, "num_input_tokens_seen": 520204488, "step": 8570, "train_runtime": 111822.7613, "train_tokens_per_second": 4652.045 }, { "epoch": 1.09375, "grad_norm": 0.6935953187354543, "learning_rate": 4.267338583021331e-06, "loss": 0.26155643463134765, "num_input_tokens_seen": 520506248, "step": 8575, "train_runtime": 111880.4115, "train_tokens_per_second": 4652.345 }, { "epoch": 1.094387755102041, "grad_norm": 0.6267017654146606, "learning_rate": 4.262384101436997e-06, "loss": 0.2655954360961914, "num_input_tokens_seen": 520817536, "step": 8580, "train_runtime": 111952.1936, "train_tokens_per_second": 4652.142 }, { "epoch": 1.0950255102040816, "grad_norm": 0.6545632677163803, "learning_rate": 4.257430360101734e-06, "loss": 0.25361220836639403, "num_input_tokens_seen": 521116136, "step": 8585, "train_runtime": 112021.71, "train_tokens_per_second": 4651.921 }, { "epoch": 1.0956632653061225, "grad_norm": 0.6773920458249225, "learning_rate": 4.252477363986963e-06, "loss": 0.2651734590530396, "num_input_tokens_seen": 521413200, "step": 8590, "train_runtime": 112083.5453, "train_tokens_per_second": 4652.005 }, { "epoch": 1.0963010204081634, "grad_norm": 0.6760247929377783, "learning_rate": 4.247525118063366e-06, "loss": 0.25967419147491455, "num_input_tokens_seen": 521719080, "step": 8595, "train_runtime": 112146.6083, "train_tokens_per_second": 4652.116 }, { "epoch": 1.096938775510204, "grad_norm": 0.7361384427827368, "learning_rate": 4.242573627300866e-06, "loss": 0.2496013879776001, "num_input_tokens_seen": 522027776, "step": 8600, "train_runtime": 112211.59, "train_tokens_per_second": 4652.173 }, { "epoch": 1.097576530612245, "grad_norm": 0.7112095971701625, "learning_rate": 4.237622896668628e-06, "loss": 0.23990926742553711, "num_input_tokens_seen": 522328536, "step": 8605, "train_runtime": 112275.6717, "train_tokens_per_second": 4652.197 }, { "epoch": 1.0982142857142858, "grad_norm": 0.5728848513613037, "learning_rate": 4.232672931135058e-06, "loss": 0.2499545097351074, "num_input_tokens_seen": 522618664, "step": 8610, "train_runtime": 112343.064, "train_tokens_per_second": 4651.989 }, { "epoch": 1.0988520408163265, "grad_norm": 0.6471874739768435, "learning_rate": 4.227723735667793e-06, "loss": 0.25888404846191404, "num_input_tokens_seen": 522921736, "step": 8615, "train_runtime": 112405.616, "train_tokens_per_second": 4652.096 }, { "epoch": 1.0994897959183674, "grad_norm": 0.6875386080205632, "learning_rate": 4.222775315233693e-06, "loss": 0.2819283723831177, "num_input_tokens_seen": 523233512, "step": 8620, "train_runtime": 112478.6201, "train_tokens_per_second": 4651.849 }, { "epoch": 1.100127551020408, "grad_norm": 0.6569749537869434, "learning_rate": 4.217827674798845e-06, "loss": 0.2621577739715576, "num_input_tokens_seen": 523541032, "step": 8625, "train_runtime": 112549.288, "train_tokens_per_second": 4651.66 }, { "epoch": 1.100765306122449, "grad_norm": 0.6790870912016186, "learning_rate": 4.2128808193285555e-06, "loss": 0.26994221210479735, "num_input_tokens_seen": 523846904, "step": 8630, "train_runtime": 112623.9832, "train_tokens_per_second": 4651.291 }, { "epoch": 1.1014030612244898, "grad_norm": 0.6686336627874682, "learning_rate": 4.2079347537873325e-06, "loss": 0.262078070640564, "num_input_tokens_seen": 524142576, "step": 8635, "train_runtime": 112698.2326, "train_tokens_per_second": 4650.85 }, { "epoch": 1.1020408163265305, "grad_norm": 0.6913949851570558, "learning_rate": 4.2029894831389036e-06, "loss": 0.2705439329147339, "num_input_tokens_seen": 524450280, "step": 8640, "train_runtime": 112766.3885, "train_tokens_per_second": 4650.768 }, { "epoch": 1.1026785714285714, "grad_norm": 0.644982167172311, "learning_rate": 4.198045012346192e-06, "loss": 0.25299763679504395, "num_input_tokens_seen": 524764680, "step": 8645, "train_runtime": 112839.1068, "train_tokens_per_second": 4650.557 }, { "epoch": 1.1033163265306123, "grad_norm": 0.6974639447763437, "learning_rate": 4.1931013463713165e-06, "loss": 0.2784655809402466, "num_input_tokens_seen": 525060152, "step": 8650, "train_runtime": 112901.3259, "train_tokens_per_second": 4650.611 }, { "epoch": 1.103954081632653, "grad_norm": 0.6297322783406425, "learning_rate": 4.188158490175596e-06, "loss": 0.23096976280212403, "num_input_tokens_seen": 525366264, "step": 8655, "train_runtime": 112965.6203, "train_tokens_per_second": 4650.674 }, { "epoch": 1.1045918367346939, "grad_norm": 0.621717322580187, "learning_rate": 4.1832164487195295e-06, "loss": 0.24602036476135253, "num_input_tokens_seen": 525679368, "step": 8660, "train_runtime": 113032.0236, "train_tokens_per_second": 4650.712 }, { "epoch": 1.1052295918367347, "grad_norm": 0.6702723562719789, "learning_rate": 4.1782752269627995e-06, "loss": 0.2634816408157349, "num_input_tokens_seen": 525989064, "step": 8665, "train_runtime": 113087.4765, "train_tokens_per_second": 4651.17 }, { "epoch": 1.1058673469387754, "grad_norm": 0.6655949634928194, "learning_rate": 4.17333482986427e-06, "loss": 0.25561840534210206, "num_input_tokens_seen": 526300736, "step": 8670, "train_runtime": 113160.9482, "train_tokens_per_second": 4650.904 }, { "epoch": 1.1065051020408163, "grad_norm": 0.6482019607965435, "learning_rate": 4.16839526238197e-06, "loss": 0.2742323875427246, "num_input_tokens_seen": 526603144, "step": 8675, "train_runtime": 113230.2081, "train_tokens_per_second": 4650.73 }, { "epoch": 1.1071428571428572, "grad_norm": 0.6421331929913958, "learning_rate": 4.1634565294731045e-06, "loss": 0.2627676248550415, "num_input_tokens_seen": 526911344, "step": 8680, "train_runtime": 113300.3539, "train_tokens_per_second": 4650.571 }, { "epoch": 1.1077806122448979, "grad_norm": 0.6216744146333252, "learning_rate": 4.158518636094037e-06, "loss": 0.2641258478164673, "num_input_tokens_seen": 527229720, "step": 8685, "train_runtime": 113361.3858, "train_tokens_per_second": 4650.876 }, { "epoch": 1.1084183673469388, "grad_norm": 0.6039791858554615, "learning_rate": 4.153581587200287e-06, "loss": 0.2487846851348877, "num_input_tokens_seen": 527532776, "step": 8690, "train_runtime": 113438.9355, "train_tokens_per_second": 4650.368 }, { "epoch": 1.1090561224489797, "grad_norm": 0.6777894782617317, "learning_rate": 4.148645387746526e-06, "loss": 0.2532509803771973, "num_input_tokens_seen": 527834776, "step": 8695, "train_runtime": 113498.0376, "train_tokens_per_second": 4650.607 }, { "epoch": 1.1096938775510203, "grad_norm": 0.8143053554422732, "learning_rate": 4.143710042686579e-06, "loss": 0.25780043601989744, "num_input_tokens_seen": 528137192, "step": 8700, "train_runtime": 113570.0771, "train_tokens_per_second": 4650.32 }, { "epoch": 1.1103316326530612, "grad_norm": 0.6394011415019081, "learning_rate": 4.138775556973406e-06, "loss": 0.26498196125030515, "num_input_tokens_seen": 528440456, "step": 8705, "train_runtime": 113642.3309, "train_tokens_per_second": 4650.032 }, { "epoch": 1.1109693877551021, "grad_norm": 0.6489234851554295, "learning_rate": 4.133841935559109e-06, "loss": 0.26532301902770994, "num_input_tokens_seen": 528746080, "step": 8710, "train_runtime": 113705.612, "train_tokens_per_second": 4650.132 }, { "epoch": 1.1116071428571428, "grad_norm": 0.5899919397086718, "learning_rate": 4.1289091833949235e-06, "loss": 0.24462313652038575, "num_input_tokens_seen": 529028272, "step": 8715, "train_runtime": 113760.9322, "train_tokens_per_second": 4650.351 }, { "epoch": 1.1122448979591837, "grad_norm": 0.6681595352961904, "learning_rate": 4.123977305431209e-06, "loss": 0.26124532222747804, "num_input_tokens_seen": 529326792, "step": 8720, "train_runtime": 113828.2974, "train_tokens_per_second": 4650.221 }, { "epoch": 1.1128826530612246, "grad_norm": 0.7967346989172764, "learning_rate": 4.119046306617449e-06, "loss": 0.26501011848449707, "num_input_tokens_seen": 529624760, "step": 8725, "train_runtime": 113893.5473, "train_tokens_per_second": 4650.174 }, { "epoch": 1.1135204081632653, "grad_norm": 0.6203710374313256, "learning_rate": 4.114116191902248e-06, "loss": 0.28026351928710935, "num_input_tokens_seen": 529934352, "step": 8730, "train_runtime": 113964.0747, "train_tokens_per_second": 4650.012 }, { "epoch": 1.1141581632653061, "grad_norm": 0.6771760971082005, "learning_rate": 4.109186966233315e-06, "loss": 0.276874041557312, "num_input_tokens_seen": 530240440, "step": 8735, "train_runtime": 114033.2417, "train_tokens_per_second": 4649.876 }, { "epoch": 1.114795918367347, "grad_norm": 0.6677140771253915, "learning_rate": 4.104258634557478e-06, "loss": 0.2529959201812744, "num_input_tokens_seen": 530544176, "step": 8740, "train_runtime": 114107.8513, "train_tokens_per_second": 4649.498 }, { "epoch": 1.1154336734693877, "grad_norm": 0.5849309371137589, "learning_rate": 4.09933120182066e-06, "loss": 0.24083590507507324, "num_input_tokens_seen": 530825680, "step": 8745, "train_runtime": 114179.7829, "train_tokens_per_second": 4649.034 }, { "epoch": 1.1160714285714286, "grad_norm": 0.6986256981069222, "learning_rate": 4.094404672967882e-06, "loss": 0.2577672958374023, "num_input_tokens_seen": 531129632, "step": 8750, "train_runtime": 114244.6756, "train_tokens_per_second": 4649.054 }, { "epoch": 1.1167091836734695, "grad_norm": 0.6291116675381879, "learning_rate": 4.089479052943261e-06, "loss": 0.2546741008758545, "num_input_tokens_seen": 531421264, "step": 8755, "train_runtime": 114311.4113, "train_tokens_per_second": 4648.891 }, { "epoch": 1.1173469387755102, "grad_norm": 0.6683424189424261, "learning_rate": 4.084554346690003e-06, "loss": 0.2510077476501465, "num_input_tokens_seen": 531722392, "step": 8760, "train_runtime": 114382.5873, "train_tokens_per_second": 4648.631 }, { "epoch": 1.117984693877551, "grad_norm": 0.6811331218594819, "learning_rate": 4.079630559150392e-06, "loss": 0.2494870662689209, "num_input_tokens_seen": 532031576, "step": 8765, "train_runtime": 114458.0853, "train_tokens_per_second": 4648.266 }, { "epoch": 1.118622448979592, "grad_norm": 0.6409957446589616, "learning_rate": 4.074707695265792e-06, "loss": 0.2718391418457031, "num_input_tokens_seen": 532346776, "step": 8770, "train_runtime": 114514.0097, "train_tokens_per_second": 4648.748 }, { "epoch": 1.1192602040816326, "grad_norm": 0.6196177887451563, "learning_rate": 4.069785759976645e-06, "loss": 0.24614083766937256, "num_input_tokens_seen": 532659184, "step": 8775, "train_runtime": 114570.0017, "train_tokens_per_second": 4649.203 }, { "epoch": 1.1198979591836735, "grad_norm": 0.6312075905748146, "learning_rate": 4.0648647582224504e-06, "loss": 0.23855199813842773, "num_input_tokens_seen": 532964288, "step": 8780, "train_runtime": 114643.7731, "train_tokens_per_second": 4648.873 }, { "epoch": 1.1205357142857142, "grad_norm": 0.6693286564819559, "learning_rate": 4.059944694941783e-06, "loss": 0.24307601451873778, "num_input_tokens_seen": 533257496, "step": 8785, "train_runtime": 114711.8264, "train_tokens_per_second": 4648.671 }, { "epoch": 1.121173469387755, "grad_norm": 0.6018047291772123, "learning_rate": 4.0550255750722674e-06, "loss": 0.2722148895263672, "num_input_tokens_seen": 533572624, "step": 8790, "train_runtime": 114778.5459, "train_tokens_per_second": 4648.714 }, { "epoch": 1.121811224489796, "grad_norm": 0.6571055183840769, "learning_rate": 4.050107403550582e-06, "loss": 0.25997745990753174, "num_input_tokens_seen": 533874248, "step": 8795, "train_runtime": 114844.7632, "train_tokens_per_second": 4648.66 }, { "epoch": 1.1224489795918366, "grad_norm": 0.697352468549373, "learning_rate": 4.0451901853124596e-06, "loss": 0.2595637083053589, "num_input_tokens_seen": 534163736, "step": 8800, "train_runtime": 114909.7614, "train_tokens_per_second": 4648.55 }, { "epoch": 1.1230867346938775, "grad_norm": 0.6641710553181707, "learning_rate": 4.04027392529267e-06, "loss": 0.24140620231628418, "num_input_tokens_seen": 534459272, "step": 8805, "train_runtime": 114977.4312, "train_tokens_per_second": 4648.384 }, { "epoch": 1.1237244897959184, "grad_norm": 0.6204822347961743, "learning_rate": 4.035358628425022e-06, "loss": 0.26332621574401854, "num_input_tokens_seen": 534773128, "step": 8810, "train_runtime": 115027.5058, "train_tokens_per_second": 4649.089 }, { "epoch": 1.124362244897959, "grad_norm": 0.6160923511236912, "learning_rate": 4.030444299642363e-06, "loss": 0.25716571807861327, "num_input_tokens_seen": 535081112, "step": 8815, "train_runtime": 115097.1997, "train_tokens_per_second": 4648.95 }, { "epoch": 1.125, "grad_norm": 0.5877869159249574, "learning_rate": 4.02553094387656e-06, "loss": 0.25978541374206543, "num_input_tokens_seen": 535374072, "step": 8820, "train_runtime": 115167.309, "train_tokens_per_second": 4648.664 }, { "epoch": 1.125637755102041, "grad_norm": 0.6586013411058614, "learning_rate": 4.020618566058514e-06, "loss": 0.2957251787185669, "num_input_tokens_seen": 535689208, "step": 8825, "train_runtime": 115218.2257, "train_tokens_per_second": 4649.344 }, { "epoch": 1.1262755102040816, "grad_norm": 0.6367456147035857, "learning_rate": 4.015707171118136e-06, "loss": 0.24315261840820312, "num_input_tokens_seen": 535993008, "step": 8830, "train_runtime": 115283.5317, "train_tokens_per_second": 4649.346 }, { "epoch": 1.1269132653061225, "grad_norm": 0.6844291597487553, "learning_rate": 4.010796763984355e-06, "loss": 0.26010923385620116, "num_input_tokens_seen": 536287536, "step": 8835, "train_runtime": 115349.1198, "train_tokens_per_second": 4649.256 }, { "epoch": 1.1275510204081634, "grad_norm": 0.7441505374728936, "learning_rate": 4.005887349585106e-06, "loss": 0.2572501182556152, "num_input_tokens_seen": 536601616, "step": 8840, "train_runtime": 115410.3241, "train_tokens_per_second": 4649.511 }, { "epoch": 1.128188775510204, "grad_norm": 0.6688566228964161, "learning_rate": 4.000978932847332e-06, "loss": 0.24611384868621827, "num_input_tokens_seen": 536903984, "step": 8845, "train_runtime": 115483.9981, "train_tokens_per_second": 4649.163 }, { "epoch": 1.128826530612245, "grad_norm": 0.8668765078160117, "learning_rate": 3.996071518696969e-06, "loss": 0.253182053565979, "num_input_tokens_seen": 537200032, "step": 8850, "train_runtime": 115549.4825, "train_tokens_per_second": 4649.091 }, { "epoch": 1.1294642857142858, "grad_norm": 0.6354563329873995, "learning_rate": 3.99116511205895e-06, "loss": 0.2547412395477295, "num_input_tokens_seen": 537511520, "step": 8855, "train_runtime": 115612.0733, "train_tokens_per_second": 4649.268 }, { "epoch": 1.1301020408163265, "grad_norm": 0.6073506202891805, "learning_rate": 3.986259717857201e-06, "loss": 0.25578083992004397, "num_input_tokens_seen": 537814664, "step": 8860, "train_runtime": 115669.384, "train_tokens_per_second": 4649.585 }, { "epoch": 1.1307397959183674, "grad_norm": 0.6024339634852962, "learning_rate": 3.9813553410146225e-06, "loss": 0.24348747730255127, "num_input_tokens_seen": 538115864, "step": 8865, "train_runtime": 115732.8856, "train_tokens_per_second": 4649.637 }, { "epoch": 1.131377551020408, "grad_norm": 0.5755948047363689, "learning_rate": 3.9764519864531026e-06, "loss": 0.25777478218078614, "num_input_tokens_seen": 538415760, "step": 8870, "train_runtime": 115806.3956, "train_tokens_per_second": 4649.275 }, { "epoch": 1.132015306122449, "grad_norm": 0.766417172131927, "learning_rate": 3.971549659093499e-06, "loss": 0.2522728681564331, "num_input_tokens_seen": 538716616, "step": 8875, "train_runtime": 115869.7015, "train_tokens_per_second": 4649.331 }, { "epoch": 1.1326530612244898, "grad_norm": 0.7528524832008608, "learning_rate": 3.966648363855637e-06, "loss": 0.24546959400177001, "num_input_tokens_seen": 539024984, "step": 8880, "train_runtime": 115938.9831, "train_tokens_per_second": 4649.213 }, { "epoch": 1.1332908163265305, "grad_norm": 0.6316767517043722, "learning_rate": 3.961748105658312e-06, "loss": 0.2723077774047852, "num_input_tokens_seen": 539325304, "step": 8885, "train_runtime": 116009.2966, "train_tokens_per_second": 4648.983 }, { "epoch": 1.1339285714285714, "grad_norm": 0.5980594623638233, "learning_rate": 3.956848889419276e-06, "loss": 0.25560190677642824, "num_input_tokens_seen": 539631960, "step": 8890, "train_runtime": 116083.711, "train_tokens_per_second": 4648.645 }, { "epoch": 1.1345663265306123, "grad_norm": 0.5682418130757153, "learning_rate": 3.951950720055231e-06, "loss": 0.24716031551361084, "num_input_tokens_seen": 539923576, "step": 8895, "train_runtime": 116150.1354, "train_tokens_per_second": 4648.497 }, { "epoch": 1.135204081632653, "grad_norm": 0.6739247553620884, "learning_rate": 3.947053602481834e-06, "loss": 0.24239625930786132, "num_input_tokens_seen": 540207120, "step": 8900, "train_runtime": 116219.8851, "train_tokens_per_second": 4648.147 }, { "epoch": 1.1358418367346939, "grad_norm": 0.6048463044809329, "learning_rate": 3.9421575416136866e-06, "loss": 0.2518806457519531, "num_input_tokens_seen": 540519408, "step": 8905, "train_runtime": 116287.0634, "train_tokens_per_second": 4648.147 }, { "epoch": 1.1364795918367347, "grad_norm": 0.6345051902281528, "learning_rate": 3.937262542364324e-06, "loss": 0.23644161224365234, "num_input_tokens_seen": 540821840, "step": 8910, "train_runtime": 116354.9095, "train_tokens_per_second": 4648.036 }, { "epoch": 1.1371173469387754, "grad_norm": 0.6535233933728755, "learning_rate": 3.932368609646223e-06, "loss": 0.24362196922302246, "num_input_tokens_seen": 541125600, "step": 8915, "train_runtime": 116424.3936, "train_tokens_per_second": 4647.871 }, { "epoch": 1.1377551020408163, "grad_norm": 0.6229053726587129, "learning_rate": 3.927475748370784e-06, "loss": 0.2587940216064453, "num_input_tokens_seen": 541430368, "step": 8920, "train_runtime": 116504.0721, "train_tokens_per_second": 4647.309 }, { "epoch": 1.1383928571428572, "grad_norm": 0.6531128073896356, "learning_rate": 3.922583963448336e-06, "loss": 0.2494271755218506, "num_input_tokens_seen": 541730480, "step": 8925, "train_runtime": 116573.9245, "train_tokens_per_second": 4647.098 }, { "epoch": 1.1390306122448979, "grad_norm": 0.6282383024166348, "learning_rate": 3.9176932597881286e-06, "loss": 0.24280223846435547, "num_input_tokens_seen": 542040136, "step": 8930, "train_runtime": 116638.2435, "train_tokens_per_second": 4647.19 }, { "epoch": 1.1396683673469388, "grad_norm": 0.5540607193383991, "learning_rate": 3.912803642298323e-06, "loss": 0.2466367721557617, "num_input_tokens_seen": 542342080, "step": 8935, "train_runtime": 116701.0867, "train_tokens_per_second": 4647.275 }, { "epoch": 1.1403061224489797, "grad_norm": 0.5938538544519124, "learning_rate": 3.90791511588599e-06, "loss": 0.2512343883514404, "num_input_tokens_seen": 542652920, "step": 8940, "train_runtime": 116778.1641, "train_tokens_per_second": 4646.87 }, { "epoch": 1.1409438775510203, "grad_norm": 0.6292093673254473, "learning_rate": 3.903027685457112e-06, "loss": 0.23715415000915527, "num_input_tokens_seen": 542959840, "step": 8945, "train_runtime": 116841.1911, "train_tokens_per_second": 4646.99 }, { "epoch": 1.1415816326530612, "grad_norm": 0.7342036154377143, "learning_rate": 3.898141355916563e-06, "loss": 0.26971964836120604, "num_input_tokens_seen": 543258480, "step": 8950, "train_runtime": 116908.5041, "train_tokens_per_second": 4646.869 }, { "epoch": 1.1422193877551021, "grad_norm": 0.6446318464742593, "learning_rate": 3.893256132168117e-06, "loss": 0.24709455966949462, "num_input_tokens_seen": 543565848, "step": 8955, "train_runtime": 116979.643, "train_tokens_per_second": 4646.67 }, { "epoch": 1.1428571428571428, "grad_norm": 0.6946970284297688, "learning_rate": 3.888372019114438e-06, "loss": 0.27740399837493895, "num_input_tokens_seen": 543874712, "step": 8960, "train_runtime": 117053.892, "train_tokens_per_second": 4646.362 }, { "epoch": 1.1434948979591837, "grad_norm": 0.6225922465374178, "learning_rate": 3.8834890216570715e-06, "loss": 0.24256086349487305, "num_input_tokens_seen": 544181184, "step": 8965, "train_runtime": 117118.3172, "train_tokens_per_second": 4646.422 }, { "epoch": 1.1441326530612246, "grad_norm": 0.5767601583617836, "learning_rate": 3.878607144696449e-06, "loss": 0.26886234283447263, "num_input_tokens_seen": 544499280, "step": 8970, "train_runtime": 117179.5076, "train_tokens_per_second": 4646.711 }, { "epoch": 1.1447704081632653, "grad_norm": 0.7203369868395961, "learning_rate": 3.873726393131877e-06, "loss": 0.24144067764282226, "num_input_tokens_seen": 544791656, "step": 8975, "train_runtime": 117244.177, "train_tokens_per_second": 4646.641 }, { "epoch": 1.1454081632653061, "grad_norm": 0.6785159121697449, "learning_rate": 3.868846771861528e-06, "loss": 0.25340542793273924, "num_input_tokens_seen": 545087336, "step": 8980, "train_runtime": 117314.6175, "train_tokens_per_second": 4646.372 }, { "epoch": 1.146045918367347, "grad_norm": 0.6621496294951646, "learning_rate": 3.86396828578244e-06, "loss": 0.2459954261779785, "num_input_tokens_seen": 545394440, "step": 8985, "train_runtime": 117381.6402, "train_tokens_per_second": 4646.335 }, { "epoch": 1.1466836734693877, "grad_norm": 0.6228571824192749, "learning_rate": 3.859090939790521e-06, "loss": 0.26397042274475097, "num_input_tokens_seen": 545693688, "step": 8990, "train_runtime": 117450.9288, "train_tokens_per_second": 4646.142 }, { "epoch": 1.1473214285714286, "grad_norm": 0.6434743028346319, "learning_rate": 3.854214738780523e-06, "loss": 0.25994985103607177, "num_input_tokens_seen": 545998160, "step": 8995, "train_runtime": 117516.2834, "train_tokens_per_second": 4646.149 }, { "epoch": 1.1479591836734695, "grad_norm": 0.6480926801760627, "learning_rate": 3.849339687646055e-06, "loss": 0.26729607582092285, "num_input_tokens_seen": 546317448, "step": 9000, "train_runtime": 117591.7755, "train_tokens_per_second": 4645.881 }, { "epoch": 1.1485969387755102, "grad_norm": 0.6329400342074115, "learning_rate": 3.844465791279575e-06, "loss": 0.23711986541748048, "num_input_tokens_seen": 546603024, "step": 9005, "train_runtime": 117658.2574, "train_tokens_per_second": 4645.683 }, { "epoch": 1.149234693877551, "grad_norm": 0.6319202274699528, "learning_rate": 3.839593054572374e-06, "loss": 0.25211658477783205, "num_input_tokens_seen": 546895864, "step": 9010, "train_runtime": 117726.7789, "train_tokens_per_second": 4645.467 }, { "epoch": 1.149872448979592, "grad_norm": 0.7173512648576292, "learning_rate": 3.834721482414586e-06, "loss": 0.23781025409698486, "num_input_tokens_seen": 547189024, "step": 9015, "train_runtime": 117793.5964, "train_tokens_per_second": 4645.321 }, { "epoch": 1.1505102040816326, "grad_norm": 0.6742994082947601, "learning_rate": 3.829851079695174e-06, "loss": 0.2751111268997192, "num_input_tokens_seen": 547503640, "step": 9020, "train_runtime": 117865.0062, "train_tokens_per_second": 4645.176 }, { "epoch": 1.1511479591836735, "grad_norm": 0.7062489346148081, "learning_rate": 3.824981851301924e-06, "loss": 0.2480980396270752, "num_input_tokens_seen": 547811248, "step": 9025, "train_runtime": 117922.3768, "train_tokens_per_second": 4645.524 }, { "epoch": 1.1517857142857142, "grad_norm": 0.6754832083900386, "learning_rate": 3.820113802121453e-06, "loss": 0.2552891731262207, "num_input_tokens_seen": 548116528, "step": 9030, "train_runtime": 117987.8041, "train_tokens_per_second": 4645.535 }, { "epoch": 1.152423469387755, "grad_norm": 0.6442899344507199, "learning_rate": 3.815246937039182e-06, "loss": 0.25223641395568847, "num_input_tokens_seen": 548427008, "step": 9035, "train_runtime": 118052.8714, "train_tokens_per_second": 4645.605 }, { "epoch": 1.153061224489796, "grad_norm": 0.6499806078846673, "learning_rate": 3.810381260939354e-06, "loss": 0.2701232433319092, "num_input_tokens_seen": 548739432, "step": 9040, "train_runtime": 118115.4248, "train_tokens_per_second": 4645.79 }, { "epoch": 1.1536989795918366, "grad_norm": 0.7314891698229721, "learning_rate": 3.8055167787050134e-06, "loss": 0.25761349201202394, "num_input_tokens_seen": 549036680, "step": 9045, "train_runtime": 118171.7805, "train_tokens_per_second": 4646.09 }, { "epoch": 1.1543367346938775, "grad_norm": 0.683669749994871, "learning_rate": 3.8006534952180062e-06, "loss": 0.296785306930542, "num_input_tokens_seen": 549349696, "step": 9050, "train_runtime": 118233.3656, "train_tokens_per_second": 4646.317 }, { "epoch": 1.1549744897959184, "grad_norm": 0.7175970091232914, "learning_rate": 3.79579141535898e-06, "loss": 0.26458353996276857, "num_input_tokens_seen": 549661760, "step": 9055, "train_runtime": 118300.6297, "train_tokens_per_second": 4646.313 }, { "epoch": 1.155612244897959, "grad_norm": 0.6390365058333171, "learning_rate": 3.7909305440073707e-06, "loss": 0.2598105907440186, "num_input_tokens_seen": 549966736, "step": 9060, "train_runtime": 118362.0592, "train_tokens_per_second": 4646.478 }, { "epoch": 1.15625, "grad_norm": 0.6406087564810814, "learning_rate": 3.786070886041401e-06, "loss": 0.2434762239456177, "num_input_tokens_seen": 550258880, "step": 9065, "train_runtime": 118440.6712, "train_tokens_per_second": 4645.861 }, { "epoch": 1.156887755102041, "grad_norm": 0.567035901087959, "learning_rate": 3.7812124463380766e-06, "loss": 0.2483445882797241, "num_input_tokens_seen": 550571984, "step": 9070, "train_runtime": 118514.6154, "train_tokens_per_second": 4645.604 }, { "epoch": 1.1575255102040816, "grad_norm": 0.5703637135265959, "learning_rate": 3.7763552297731845e-06, "loss": 0.25247507095336913, "num_input_tokens_seen": 550878272, "step": 9075, "train_runtime": 118586.3175, "train_tokens_per_second": 4645.378 }, { "epoch": 1.1581632653061225, "grad_norm": 0.6406293192824949, "learning_rate": 3.771499241221277e-06, "loss": 0.28102898597717285, "num_input_tokens_seen": 551189928, "step": 9080, "train_runtime": 118641.8266, "train_tokens_per_second": 4645.831 }, { "epoch": 1.1588010204081634, "grad_norm": 0.6269056057353551, "learning_rate": 3.766644485555679e-06, "loss": 0.25998654365539553, "num_input_tokens_seen": 551490536, "step": 9085, "train_runtime": 118713.6419, "train_tokens_per_second": 4645.553 }, { "epoch": 1.159438775510204, "grad_norm": 0.6138490858247232, "learning_rate": 3.7617909676484788e-06, "loss": 0.24906582832336427, "num_input_tokens_seen": 551800888, "step": 9090, "train_runtime": 118786.3654, "train_tokens_per_second": 4645.322 }, { "epoch": 1.160076530612245, "grad_norm": 0.6859516693849371, "learning_rate": 3.7569386923705173e-06, "loss": 0.25821330547332766, "num_input_tokens_seen": 552112808, "step": 9095, "train_runtime": 118853.748, "train_tokens_per_second": 4645.313 }, { "epoch": 1.1607142857142858, "grad_norm": 0.6240387119145479, "learning_rate": 3.752087664591394e-06, "loss": 0.23380570411682128, "num_input_tokens_seen": 552415496, "step": 9100, "train_runtime": 118902.4853, "train_tokens_per_second": 4645.954 }, { "epoch": 1.1613520408163265, "grad_norm": 0.5647994495841705, "learning_rate": 3.7472378891794537e-06, "loss": 0.27939319610595703, "num_input_tokens_seen": 552715160, "step": 9105, "train_runtime": 118976.8579, "train_tokens_per_second": 4645.569 }, { "epoch": 1.1619897959183674, "grad_norm": 0.6673699722318139, "learning_rate": 3.7423893710017826e-06, "loss": 0.2548710107803345, "num_input_tokens_seen": 553027504, "step": 9110, "train_runtime": 119040.4117, "train_tokens_per_second": 4645.712 }, { "epoch": 1.162627551020408, "grad_norm": 0.7397290422057428, "learning_rate": 3.7375421149242102e-06, "loss": 0.27686965465545654, "num_input_tokens_seen": 553319712, "step": 9115, "train_runtime": 119106.5825, "train_tokens_per_second": 4645.585 }, { "epoch": 1.163265306122449, "grad_norm": 0.6110700112790147, "learning_rate": 3.7326961258112963e-06, "loss": 0.27753410339355467, "num_input_tokens_seen": 553618416, "step": 9120, "train_runtime": 119166.667, "train_tokens_per_second": 4645.749 }, { "epoch": 1.1639030612244898, "grad_norm": 0.7417733503562559, "learning_rate": 3.7278514085263275e-06, "loss": 0.2638828754425049, "num_input_tokens_seen": 553920520, "step": 9125, "train_runtime": 119237.3321, "train_tokens_per_second": 4645.529 }, { "epoch": 1.1645408163265305, "grad_norm": 0.7167049053623508, "learning_rate": 3.7230079679313157e-06, "loss": 0.2771193742752075, "num_input_tokens_seen": 554225448, "step": 9130, "train_runtime": 119293.7618, "train_tokens_per_second": 4645.888 }, { "epoch": 1.1651785714285714, "grad_norm": 0.5945102517876708, "learning_rate": 3.7181658088869954e-06, "loss": 0.25243654251098635, "num_input_tokens_seen": 554527792, "step": 9135, "train_runtime": 119361.2962, "train_tokens_per_second": 4645.792 }, { "epoch": 1.1658163265306123, "grad_norm": 0.6982078029262607, "learning_rate": 3.7133249362528075e-06, "loss": 0.27841687202453613, "num_input_tokens_seen": 554827168, "step": 9140, "train_runtime": 119420.2954, "train_tokens_per_second": 4646.004 }, { "epoch": 1.166454081632653, "grad_norm": 0.5554748498950471, "learning_rate": 3.708485354886906e-06, "loss": 0.23977646827697754, "num_input_tokens_seen": 555129232, "step": 9145, "train_runtime": 119487.802, "train_tokens_per_second": 4645.907 }, { "epoch": 1.1670918367346939, "grad_norm": 0.6681976381838787, "learning_rate": 3.7036470696461535e-06, "loss": 0.25014777183532716, "num_input_tokens_seen": 555422128, "step": 9150, "train_runtime": 119557.2032, "train_tokens_per_second": 4645.66 }, { "epoch": 1.1677295918367347, "grad_norm": 0.6624244457089297, "learning_rate": 3.698810085386101e-06, "loss": 0.23124778270721436, "num_input_tokens_seen": 555712664, "step": 9155, "train_runtime": 119624.4585, "train_tokens_per_second": 4645.477 }, { "epoch": 1.1683673469387754, "grad_norm": 0.645178968549477, "learning_rate": 3.693974406961004e-06, "loss": 0.23919620513916015, "num_input_tokens_seen": 556008712, "step": 9160, "train_runtime": 119694.5366, "train_tokens_per_second": 4645.23 }, { "epoch": 1.1690051020408163, "grad_norm": 0.6807500370413369, "learning_rate": 3.689140039223802e-06, "loss": 0.25184340476989747, "num_input_tokens_seen": 556316288, "step": 9165, "train_runtime": 119760.5645, "train_tokens_per_second": 4645.238 }, { "epoch": 1.1696428571428572, "grad_norm": 0.7270478809642932, "learning_rate": 3.6843069870261196e-06, "loss": 0.24816541671752929, "num_input_tokens_seen": 556629264, "step": 9170, "train_runtime": 119823.4727, "train_tokens_per_second": 4645.411 }, { "epoch": 1.1702806122448979, "grad_norm": 0.735604362472043, "learning_rate": 3.6794752552182654e-06, "loss": 0.2609705448150635, "num_input_tokens_seen": 556930672, "step": 9175, "train_runtime": 119900.2521, "train_tokens_per_second": 4644.95 }, { "epoch": 1.1709183673469388, "grad_norm": 0.6239171600231348, "learning_rate": 3.674644848649217e-06, "loss": 0.2458580732345581, "num_input_tokens_seen": 557224256, "step": 9180, "train_runtime": 119961.9083, "train_tokens_per_second": 4645.01 }, { "epoch": 1.1715561224489797, "grad_norm": 0.6786664998580014, "learning_rate": 3.669815772166625e-06, "loss": 0.2798786163330078, "num_input_tokens_seen": 557531800, "step": 9185, "train_runtime": 120027.734, "train_tokens_per_second": 4645.025 }, { "epoch": 1.1721938775510203, "grad_norm": 0.6526246976544205, "learning_rate": 3.6649880306168073e-06, "loss": 0.24728355407714844, "num_input_tokens_seen": 557835696, "step": 9190, "train_runtime": 120094.4711, "train_tokens_per_second": 4644.974 }, { "epoch": 1.1728316326530612, "grad_norm": 0.6941040048296104, "learning_rate": 3.6601616288447352e-06, "loss": 0.24804656505584716, "num_input_tokens_seen": 558143680, "step": 9195, "train_runtime": 120165.5013, "train_tokens_per_second": 4644.791 }, { "epoch": 1.1734693877551021, "grad_norm": 0.7422109498183178, "learning_rate": 3.655336571694044e-06, "loss": 0.23939886093139648, "num_input_tokens_seen": 558435040, "step": 9200, "train_runtime": 120228.5567, "train_tokens_per_second": 4644.779 }, { "epoch": 1.1741071428571428, "grad_norm": 0.6202743505662963, "learning_rate": 3.6505128640070152e-06, "loss": 0.24841651916503907, "num_input_tokens_seen": 558748312, "step": 9205, "train_runtime": 120297.9674, "train_tokens_per_second": 4644.703 }, { "epoch": 1.1747448979591837, "grad_norm": 0.6412255282172917, "learning_rate": 3.6456905106245743e-06, "loss": 0.2559295654296875, "num_input_tokens_seen": 559058256, "step": 9210, "train_runtime": 120361.1424, "train_tokens_per_second": 4644.84 }, { "epoch": 1.1753826530612246, "grad_norm": 0.6891076562375162, "learning_rate": 3.6408695163862895e-06, "loss": 0.2709405183792114, "num_input_tokens_seen": 559360120, "step": 9215, "train_runtime": 120430.5611, "train_tokens_per_second": 4644.669 }, { "epoch": 1.1760204081632653, "grad_norm": 0.602780498095672, "learning_rate": 3.6360498861303693e-06, "loss": 0.2672729969024658, "num_input_tokens_seen": 559663176, "step": 9220, "train_runtime": 120497.372, "train_tokens_per_second": 4644.609 }, { "epoch": 1.1766581632653061, "grad_norm": 0.644008402645429, "learning_rate": 3.631231624693645e-06, "loss": 0.26173014640808107, "num_input_tokens_seen": 559969824, "step": 9225, "train_runtime": 120557.0325, "train_tokens_per_second": 4644.854 }, { "epoch": 1.177295918367347, "grad_norm": 0.6350871203103394, "learning_rate": 3.6264147369115788e-06, "loss": 0.2579504013061523, "num_input_tokens_seen": 560272344, "step": 9230, "train_runtime": 120627.1844, "train_tokens_per_second": 4644.661 }, { "epoch": 1.1779336734693877, "grad_norm": 0.6485451973793857, "learning_rate": 3.621599227618258e-06, "loss": 0.24934630393981932, "num_input_tokens_seen": 560567064, "step": 9235, "train_runtime": 120698.6906, "train_tokens_per_second": 4644.351 }, { "epoch": 1.1785714285714286, "grad_norm": 0.6544192643141078, "learning_rate": 3.6167851016463762e-06, "loss": 0.2503244161605835, "num_input_tokens_seen": 560860256, "step": 9240, "train_runtime": 120759.48, "train_tokens_per_second": 4644.441 }, { "epoch": 1.1792091836734695, "grad_norm": 0.6241115845616516, "learning_rate": 3.61197236382725e-06, "loss": 0.24509780406951903, "num_input_tokens_seen": 561172000, "step": 9245, "train_runtime": 120818.411, "train_tokens_per_second": 4644.756 }, { "epoch": 1.1798469387755102, "grad_norm": 0.6458798203659332, "learning_rate": 3.6071610189907975e-06, "loss": 0.26144001483917234, "num_input_tokens_seen": 561472240, "step": 9250, "train_runtime": 120880.7071, "train_tokens_per_second": 4644.846 }, { "epoch": 1.180484693877551, "grad_norm": 0.7538210148514893, "learning_rate": 3.602351071965536e-06, "loss": 0.2761153936386108, "num_input_tokens_seen": 561781768, "step": 9255, "train_runtime": 120946.7927, "train_tokens_per_second": 4644.867 }, { "epoch": 1.181122448979592, "grad_norm": 0.669378573702209, "learning_rate": 3.597542527578586e-06, "loss": 0.25878252983093264, "num_input_tokens_seen": 562087760, "step": 9260, "train_runtime": 121006.0154, "train_tokens_per_second": 4645.122 }, { "epoch": 1.1817602040816326, "grad_norm": 0.6577261689258893, "learning_rate": 3.5927353906556583e-06, "loss": 0.282159686088562, "num_input_tokens_seen": 562399704, "step": 9265, "train_runtime": 121068.6595, "train_tokens_per_second": 4645.296 }, { "epoch": 1.1823979591836735, "grad_norm": 0.615019101145986, "learning_rate": 3.587929666021048e-06, "loss": 0.23938889503479005, "num_input_tokens_seen": 562710120, "step": 9270, "train_runtime": 121137.3838, "train_tokens_per_second": 4645.223 }, { "epoch": 1.1830357142857142, "grad_norm": 0.6166695210589391, "learning_rate": 3.5831253584976377e-06, "loss": 0.24919326305389405, "num_input_tokens_seen": 563009640, "step": 9275, "train_runtime": 121203.932, "train_tokens_per_second": 4645.143 }, { "epoch": 1.183673469387755, "grad_norm": 0.6383444618754819, "learning_rate": 3.578322472906882e-06, "loss": 0.25875191688537597, "num_input_tokens_seen": 563313456, "step": 9280, "train_runtime": 121267.3525, "train_tokens_per_second": 4645.219 }, { "epoch": 1.184311224489796, "grad_norm": 0.5956095629968433, "learning_rate": 3.5735210140688163e-06, "loss": 0.2727609872817993, "num_input_tokens_seen": 563624904, "step": 9285, "train_runtime": 121334.2716, "train_tokens_per_second": 4645.224 }, { "epoch": 1.1849489795918366, "grad_norm": 0.6636736374676456, "learning_rate": 3.568720986802039e-06, "loss": 0.2516184329986572, "num_input_tokens_seen": 563914608, "step": 9290, "train_runtime": 121404.3413, "train_tokens_per_second": 4644.93 }, { "epoch": 1.1855867346938775, "grad_norm": 0.6929999269615047, "learning_rate": 3.56392239592371e-06, "loss": 0.24294590950012207, "num_input_tokens_seen": 564227864, "step": 9295, "train_runtime": 121457.275, "train_tokens_per_second": 4645.484 }, { "epoch": 1.1862244897959184, "grad_norm": 0.6008541880041068, "learning_rate": 3.559125246249552e-06, "loss": 0.23285303115844727, "num_input_tokens_seen": 564530856, "step": 9300, "train_runtime": 121523.8302, "train_tokens_per_second": 4645.433 }, { "epoch": 1.186862244897959, "grad_norm": 0.6051562898635172, "learning_rate": 3.554329542593841e-06, "loss": 0.24616332054138185, "num_input_tokens_seen": 564840936, "step": 9305, "train_runtime": 121590.8913, "train_tokens_per_second": 4645.421 }, { "epoch": 1.1875, "grad_norm": 0.6042571130671134, "learning_rate": 3.549535289769399e-06, "loss": 0.2721709728240967, "num_input_tokens_seen": 565145832, "step": 9310, "train_runtime": 121646.9229, "train_tokens_per_second": 4645.788 }, { "epoch": 1.188137755102041, "grad_norm": 0.5940346288462378, "learning_rate": 3.544742492587593e-06, "loss": 0.25292162895202636, "num_input_tokens_seen": 565450120, "step": 9315, "train_runtime": 121718.5439, "train_tokens_per_second": 4645.554 }, { "epoch": 1.1887755102040816, "grad_norm": 0.6234099120937138, "learning_rate": 3.5399511558583323e-06, "loss": 0.24716696739196778, "num_input_tokens_seen": 565760960, "step": 9320, "train_runtime": 121778.0047, "train_tokens_per_second": 4645.839 }, { "epoch": 1.1894132653061225, "grad_norm": 0.6822500842747656, "learning_rate": 3.5351612843900555e-06, "loss": 0.27025156021118163, "num_input_tokens_seen": 566059608, "step": 9325, "train_runtime": 121838.3169, "train_tokens_per_second": 4645.99 }, { "epoch": 1.1900510204081634, "grad_norm": 0.618687190311368, "learning_rate": 3.5303728829897336e-06, "loss": 0.24979643821716307, "num_input_tokens_seen": 566349128, "step": 9330, "train_runtime": 121907.8723, "train_tokens_per_second": 4645.714 }, { "epoch": 1.190688775510204, "grad_norm": 0.7218385310383179, "learning_rate": 3.5255859564628637e-06, "loss": 0.2737593650817871, "num_input_tokens_seen": 566657304, "step": 9335, "train_runtime": 121976.982, "train_tokens_per_second": 4645.608 }, { "epoch": 1.191326530612245, "grad_norm": 0.6787468317957424, "learning_rate": 3.5208005096134567e-06, "loss": 0.27191920280456544, "num_input_tokens_seen": 566961464, "step": 9340, "train_runtime": 122041.4244, "train_tokens_per_second": 4645.648 }, { "epoch": 1.1919642857142858, "grad_norm": 0.719032768526688, "learning_rate": 3.516016547244047e-06, "loss": 0.281893253326416, "num_input_tokens_seen": 567275376, "step": 9345, "train_runtime": 122106.7763, "train_tokens_per_second": 4645.732 }, { "epoch": 1.1926020408163265, "grad_norm": 0.6239259777646281, "learning_rate": 3.5112340741556737e-06, "loss": 0.23227195739746093, "num_input_tokens_seen": 567570008, "step": 9350, "train_runtime": 122176.3341, "train_tokens_per_second": 4645.499 }, { "epoch": 1.1932397959183674, "grad_norm": 0.6608478022282359, "learning_rate": 3.5064530951478822e-06, "loss": 0.25134925842285155, "num_input_tokens_seen": 567862344, "step": 9355, "train_runtime": 122239.5036, "train_tokens_per_second": 4645.49 }, { "epoch": 1.193877551020408, "grad_norm": 0.6791779666007302, "learning_rate": 3.501673615018717e-06, "loss": 0.257344913482666, "num_input_tokens_seen": 568165880, "step": 9360, "train_runtime": 122316.6048, "train_tokens_per_second": 4645.043 }, { "epoch": 1.194515306122449, "grad_norm": 0.7097955397102591, "learning_rate": 3.496895638564724e-06, "loss": 0.2674292802810669, "num_input_tokens_seen": 568478840, "step": 9365, "train_runtime": 122364.2219, "train_tokens_per_second": 4645.793 }, { "epoch": 1.1951530612244898, "grad_norm": 0.5477342861602996, "learning_rate": 3.492119170580933e-06, "loss": 0.26298508644104, "num_input_tokens_seen": 568791504, "step": 9370, "train_runtime": 122426.5837, "train_tokens_per_second": 4645.98 }, { "epoch": 1.1957908163265305, "grad_norm": 0.5994955894784763, "learning_rate": 3.4873442158608638e-06, "loss": 0.23578338623046874, "num_input_tokens_seen": 569086712, "step": 9375, "train_runtime": 122496.8953, "train_tokens_per_second": 4645.724 }, { "epoch": 1.1964285714285714, "grad_norm": 0.6632625907484253, "learning_rate": 3.4825707791965213e-06, "loss": 0.24221220016479492, "num_input_tokens_seen": 569390656, "step": 9380, "train_runtime": 122568.9851, "train_tokens_per_second": 4645.471 }, { "epoch": 1.1970663265306123, "grad_norm": 0.6133307012409632, "learning_rate": 3.477798865378375e-06, "loss": 0.25411770343780515, "num_input_tokens_seen": 569697440, "step": 9385, "train_runtime": 122630.5745, "train_tokens_per_second": 4645.639 }, { "epoch": 1.197704081632653, "grad_norm": 0.6641846049590382, "learning_rate": 3.4730284791953793e-06, "loss": 0.2513757228851318, "num_input_tokens_seen": 570015832, "step": 9390, "train_runtime": 122700.3538, "train_tokens_per_second": 4645.592 }, { "epoch": 1.1983418367346939, "grad_norm": 0.6300890210144545, "learning_rate": 3.4682596254349487e-06, "loss": 0.2546231746673584, "num_input_tokens_seen": 570318520, "step": 9395, "train_runtime": 122769.3257, "train_tokens_per_second": 4645.448 }, { "epoch": 1.1989795918367347, "grad_norm": 0.6797534089242993, "learning_rate": 3.4634923088829586e-06, "loss": 0.2677803039550781, "num_input_tokens_seen": 570618864, "step": 9400, "train_runtime": 122836.4089, "train_tokens_per_second": 4645.356 }, { "epoch": 1.1996173469387754, "grad_norm": 0.6052770201065073, "learning_rate": 3.4587265343237474e-06, "loss": 0.2581784725189209, "num_input_tokens_seen": 570930248, "step": 9405, "train_runtime": 122899.9562, "train_tokens_per_second": 4645.488 }, { "epoch": 1.2002551020408163, "grad_norm": 0.605556935207266, "learning_rate": 3.4539623065401014e-06, "loss": 0.26486501693725584, "num_input_tokens_seen": 571244312, "step": 9410, "train_runtime": 122964.309, "train_tokens_per_second": 4645.611 }, { "epoch": 1.2008928571428572, "grad_norm": 0.5901276245521979, "learning_rate": 3.4491996303132553e-06, "loss": 0.26423025131225586, "num_input_tokens_seen": 571546144, "step": 9415, "train_runtime": 123029.5844, "train_tokens_per_second": 4645.599 }, { "epoch": 1.2015306122448979, "grad_norm": 0.8140654353032616, "learning_rate": 3.444438510422889e-06, "loss": 0.26038737297058107, "num_input_tokens_seen": 571850512, "step": 9420, "train_runtime": 123100.4514, "train_tokens_per_second": 4645.397 }, { "epoch": 1.2021683673469388, "grad_norm": 0.6415253190625197, "learning_rate": 3.4396789516471152e-06, "loss": 0.25277788639068605, "num_input_tokens_seen": 572162672, "step": 9425, "train_runtime": 123172.7106, "train_tokens_per_second": 4645.206 }, { "epoch": 1.2028061224489797, "grad_norm": 0.6498992505212711, "learning_rate": 3.4349209587624876e-06, "loss": 0.26095411777496336, "num_input_tokens_seen": 572478112, "step": 9430, "train_runtime": 123227.8961, "train_tokens_per_second": 4645.686 }, { "epoch": 1.2034438775510203, "grad_norm": 0.6384547583756184, "learning_rate": 3.4301645365439827e-06, "loss": 0.2607147216796875, "num_input_tokens_seen": 572768984, "step": 9435, "train_runtime": 123292.0608, "train_tokens_per_second": 4645.627 }, { "epoch": 1.2040816326530612, "grad_norm": 0.5492421097654189, "learning_rate": 3.4254096897650026e-06, "loss": 0.24343760013580323, "num_input_tokens_seen": 573065496, "step": 9440, "train_runtime": 123361.9626, "train_tokens_per_second": 4645.399 }, { "epoch": 1.2047193877551021, "grad_norm": 0.7492384906913376, "learning_rate": 3.4206564231973664e-06, "loss": 0.2628458499908447, "num_input_tokens_seen": 573373352, "step": 9445, "train_runtime": 123425.8893, "train_tokens_per_second": 4645.487 }, { "epoch": 1.2053571428571428, "grad_norm": 0.6848727653628047, "learning_rate": 3.4159047416113133e-06, "loss": 0.2423173427581787, "num_input_tokens_seen": 573665624, "step": 9450, "train_runtime": 123490.8524, "train_tokens_per_second": 4645.41 }, { "epoch": 1.2059948979591837, "grad_norm": 0.6151650299218879, "learning_rate": 3.4111546497754834e-06, "loss": 0.2351745843887329, "num_input_tokens_seen": 573958232, "step": 9455, "train_runtime": 123558.1197, "train_tokens_per_second": 4645.249 }, { "epoch": 1.2066326530612246, "grad_norm": 0.643481328726907, "learning_rate": 3.406406152456926e-06, "loss": 0.27458600997924804, "num_input_tokens_seen": 574272616, "step": 9460, "train_runtime": 123617.9173, "train_tokens_per_second": 4645.545 }, { "epoch": 1.2072704081632653, "grad_norm": 0.6546095475979791, "learning_rate": 3.4016592544210937e-06, "loss": 0.25125956535339355, "num_input_tokens_seen": 574572872, "step": 9465, "train_runtime": 123679.1006, "train_tokens_per_second": 4645.675 }, { "epoch": 1.2079081632653061, "grad_norm": 0.645162808449116, "learning_rate": 3.3969139604318257e-06, "loss": 0.27151367664337156, "num_input_tokens_seen": 574889856, "step": 9470, "train_runtime": 123747.1769, "train_tokens_per_second": 4645.681 }, { "epoch": 1.208545918367347, "grad_norm": 0.718029624025104, "learning_rate": 3.3921702752513576e-06, "loss": 0.266917085647583, "num_input_tokens_seen": 575194832, "step": 9475, "train_runtime": 123819.5178, "train_tokens_per_second": 4645.429 }, { "epoch": 1.2091836734693877, "grad_norm": 0.6053928629417192, "learning_rate": 3.3874282036403106e-06, "loss": 0.261753511428833, "num_input_tokens_seen": 575499512, "step": 9480, "train_runtime": 123880.1935, "train_tokens_per_second": 4645.614 }, { "epoch": 1.2098214285714286, "grad_norm": 0.6720324410157728, "learning_rate": 3.3826877503576805e-06, "loss": 0.24433953762054444, "num_input_tokens_seen": 575788032, "step": 9485, "train_runtime": 123953.4641, "train_tokens_per_second": 4645.195 }, { "epoch": 1.2104591836734695, "grad_norm": 0.7291148842700406, "learning_rate": 3.3779489201608468e-06, "loss": 0.2573875427246094, "num_input_tokens_seen": 576091944, "step": 9490, "train_runtime": 124027.906, "train_tokens_per_second": 4644.857 }, { "epoch": 1.2110969387755102, "grad_norm": 0.7062895668021288, "learning_rate": 3.373211717805557e-06, "loss": 0.23786654472351074, "num_input_tokens_seen": 576380232, "step": 9495, "train_runtime": 124092.8276, "train_tokens_per_second": 4644.751 }, { "epoch": 1.211734693877551, "grad_norm": 0.7542692179269392, "learning_rate": 3.3684761480459218e-06, "loss": 0.2816202640533447, "num_input_tokens_seen": 576690824, "step": 9500, "train_runtime": 124158.2954, "train_tokens_per_second": 4644.803 }, { "epoch": 1.212372448979592, "grad_norm": 0.6082962015511804, "learning_rate": 3.363742215634416e-06, "loss": 0.2572930335998535, "num_input_tokens_seen": 577004104, "step": 9505, "train_runtime": 124209.677, "train_tokens_per_second": 4645.404 }, { "epoch": 1.2130102040816326, "grad_norm": 0.6063825112611065, "learning_rate": 3.3590099253218745e-06, "loss": 0.2601757526397705, "num_input_tokens_seen": 577309832, "step": 9510, "train_runtime": 124279.3024, "train_tokens_per_second": 4645.261 }, { "epoch": 1.2136479591836735, "grad_norm": 0.7259437327933773, "learning_rate": 3.3542792818574793e-06, "loss": 0.26034154891967776, "num_input_tokens_seen": 577625664, "step": 9515, "train_runtime": 124342.6287, "train_tokens_per_second": 4645.436 }, { "epoch": 1.2142857142857142, "grad_norm": 0.7434337151323354, "learning_rate": 3.3495502899887624e-06, "loss": 0.24712867736816407, "num_input_tokens_seen": 577925920, "step": 9520, "train_runtime": 124401.1151, "train_tokens_per_second": 4645.665 }, { "epoch": 1.214923469387755, "grad_norm": 0.6421712597067616, "learning_rate": 3.344822954461595e-06, "loss": 0.2680546760559082, "num_input_tokens_seen": 578241024, "step": 9525, "train_runtime": 124450.2257, "train_tokens_per_second": 4646.364 }, { "epoch": 1.215561224489796, "grad_norm": 0.6202226500554692, "learning_rate": 3.34009728002019e-06, "loss": 0.26010828018188475, "num_input_tokens_seen": 578558576, "step": 9530, "train_runtime": 124496.961, "train_tokens_per_second": 4647.17 }, { "epoch": 1.2161989795918366, "grad_norm": 0.6090945321495278, "learning_rate": 3.3353732714070933e-06, "loss": 0.26022019386291506, "num_input_tokens_seen": 578861152, "step": 9535, "train_runtime": 124565.817, "train_tokens_per_second": 4647.031 }, { "epoch": 1.2168367346938775, "grad_norm": 0.7723797409337256, "learning_rate": 3.3306509333631755e-06, "loss": 0.26360206604003905, "num_input_tokens_seen": 579170880, "step": 9540, "train_runtime": 124628.3368, "train_tokens_per_second": 4647.185 }, { "epoch": 1.2174744897959184, "grad_norm": 0.6023917274244316, "learning_rate": 3.325930270627632e-06, "loss": 0.24070911407470702, "num_input_tokens_seen": 579462640, "step": 9545, "train_runtime": 124701.877, "train_tokens_per_second": 4646.784 }, { "epoch": 1.218112244897959, "grad_norm": 0.6116123405130297, "learning_rate": 3.3212112879379806e-06, "loss": 0.2483356475830078, "num_input_tokens_seen": 579752112, "step": 9550, "train_runtime": 124764.4211, "train_tokens_per_second": 4646.774 }, { "epoch": 1.21875, "grad_norm": 0.6800150427630616, "learning_rate": 3.3164939900300467e-06, "loss": 0.2761533737182617, "num_input_tokens_seen": 580059640, "step": 9555, "train_runtime": 124821.1157, "train_tokens_per_second": 4647.128 }, { "epoch": 1.219387755102041, "grad_norm": 0.6919701122421402, "learning_rate": 3.31177838163797e-06, "loss": 0.26920223236083984, "num_input_tokens_seen": 580366720, "step": 9560, "train_runtime": 124885.381, "train_tokens_per_second": 4647.195 }, { "epoch": 1.2200255102040816, "grad_norm": 0.6820769296505718, "learning_rate": 3.3070644674941938e-06, "loss": 0.23745627403259278, "num_input_tokens_seen": 580669264, "step": 9565, "train_runtime": 124952.154, "train_tokens_per_second": 4647.133 }, { "epoch": 1.2206632653061225, "grad_norm": 0.6766487773518557, "learning_rate": 3.302352252329456e-06, "loss": 0.26337151527404784, "num_input_tokens_seen": 580976232, "step": 9570, "train_runtime": 125027.1775, "train_tokens_per_second": 4646.8 }, { "epoch": 1.2213010204081634, "grad_norm": 0.5956951042470227, "learning_rate": 3.2976417408727978e-06, "loss": 0.273178243637085, "num_input_tokens_seen": 581296456, "step": 9575, "train_runtime": 125087.8872, "train_tokens_per_second": 4647.104 }, { "epoch": 1.221938775510204, "grad_norm": 0.6402258920372919, "learning_rate": 3.2929329378515466e-06, "loss": 0.261471152305603, "num_input_tokens_seen": 581614240, "step": 9580, "train_runtime": 125147.3849, "train_tokens_per_second": 4647.434 }, { "epoch": 1.222576530612245, "grad_norm": 0.7057805386972357, "learning_rate": 3.288225847991312e-06, "loss": 0.26575982570648193, "num_input_tokens_seen": 581908472, "step": 9585, "train_runtime": 125222.18, "train_tokens_per_second": 4647.008 }, { "epoch": 1.2232142857142858, "grad_norm": 0.6614193883668372, "learning_rate": 3.2835204760159883e-06, "loss": 0.24958672523498535, "num_input_tokens_seen": 582199800, "step": 9590, "train_runtime": 125289.5903, "train_tokens_per_second": 4646.833 }, { "epoch": 1.2238520408163265, "grad_norm": 0.7693666183824296, "learning_rate": 3.278816826647747e-06, "loss": 0.24088971614837645, "num_input_tokens_seen": 582494648, "step": 9595, "train_runtime": 125346.1978, "train_tokens_per_second": 4647.087 }, { "epoch": 1.2244897959183674, "grad_norm": 0.7672272633233124, "learning_rate": 3.2741149046070274e-06, "loss": 0.27124848365783694, "num_input_tokens_seen": 582806568, "step": 9600, "train_runtime": 125395.4622, "train_tokens_per_second": 4647.748 }, { "epoch": 1.225127551020408, "grad_norm": 0.6894928761161964, "learning_rate": 3.269414714612534e-06, "loss": 0.2765587329864502, "num_input_tokens_seen": 583109984, "step": 9605, "train_runtime": 125464.3099, "train_tokens_per_second": 4647.616 }, { "epoch": 1.225765306122449, "grad_norm": 0.8045788710717332, "learning_rate": 3.2647162613812435e-06, "loss": 0.25553967952728274, "num_input_tokens_seen": 583420288, "step": 9610, "train_runtime": 125520.7611, "train_tokens_per_second": 4647.998 }, { "epoch": 1.2264030612244898, "grad_norm": 0.7071738400477622, "learning_rate": 3.2600195496283716e-06, "loss": 0.2552331447601318, "num_input_tokens_seen": 583728232, "step": 9615, "train_runtime": 125588.4357, "train_tokens_per_second": 4647.946 }, { "epoch": 1.2270408163265305, "grad_norm": 0.6120604863160233, "learning_rate": 3.2553245840674037e-06, "loss": 0.2471709966659546, "num_input_tokens_seen": 584022528, "step": 9620, "train_runtime": 125658.4643, "train_tokens_per_second": 4647.697 }, { "epoch": 1.2276785714285714, "grad_norm": 0.6604253917564401, "learning_rate": 3.2506313694100643e-06, "loss": 0.26244239807128905, "num_input_tokens_seen": 584327616, "step": 9625, "train_runtime": 125718.9925, "train_tokens_per_second": 4647.887 }, { "epoch": 1.2283163265306123, "grad_norm": 0.6232415973266351, "learning_rate": 3.245939910366319e-06, "loss": 0.2675912618637085, "num_input_tokens_seen": 584631752, "step": 9630, "train_runtime": 125772.9344, "train_tokens_per_second": 4648.311 }, { "epoch": 1.228954081632653, "grad_norm": 0.6437369355610519, "learning_rate": 3.2412502116443783e-06, "loss": 0.25380563735961914, "num_input_tokens_seen": 584940920, "step": 9635, "train_runtime": 125844.4155, "train_tokens_per_second": 4648.128 }, { "epoch": 1.2295918367346939, "grad_norm": 0.6309497737441148, "learning_rate": 3.236562277950682e-06, "loss": 0.2619779586791992, "num_input_tokens_seen": 585235728, "step": 9640, "train_runtime": 125910.2575, "train_tokens_per_second": 4648.039 }, { "epoch": 1.2302295918367347, "grad_norm": 0.6611933619652276, "learning_rate": 3.231876113989897e-06, "loss": 0.2630010604858398, "num_input_tokens_seen": 585544368, "step": 9645, "train_runtime": 125975.5673, "train_tokens_per_second": 4648.079 }, { "epoch": 1.2308673469387754, "grad_norm": 0.6810986272814734, "learning_rate": 3.227191724464918e-06, "loss": 0.24690713882446289, "num_input_tokens_seen": 585837104, "step": 9650, "train_runtime": 126037.5642, "train_tokens_per_second": 4648.115 }, { "epoch": 1.2315051020408163, "grad_norm": 0.6961524232829194, "learning_rate": 3.2225091140768537e-06, "loss": 0.23948249816894532, "num_input_tokens_seen": 586144912, "step": 9655, "train_runtime": 126104.616, "train_tokens_per_second": 4648.085 }, { "epoch": 1.2321428571428572, "grad_norm": 0.650424688729444, "learning_rate": 3.2178282875250356e-06, "loss": 0.243941068649292, "num_input_tokens_seen": 586457568, "step": 9660, "train_runtime": 126173.5276, "train_tokens_per_second": 4648.024 }, { "epoch": 1.2327806122448979, "grad_norm": 0.5876253311521507, "learning_rate": 3.213149249506997e-06, "loss": 0.26530961990356444, "num_input_tokens_seen": 586767512, "step": 9665, "train_runtime": 126249.395, "train_tokens_per_second": 4647.686 }, { "epoch": 1.2334183673469388, "grad_norm": 0.673696068504565, "learning_rate": 3.208472004718479e-06, "loss": 0.2521230697631836, "num_input_tokens_seen": 587068624, "step": 9670, "train_runtime": 126306.4449, "train_tokens_per_second": 4647.97 }, { "epoch": 1.2340561224489797, "grad_norm": 0.6279495619779293, "learning_rate": 3.2037965578534245e-06, "loss": 0.27018778324127196, "num_input_tokens_seen": 587380544, "step": 9675, "train_runtime": 126380.0099, "train_tokens_per_second": 4647.733 }, { "epoch": 1.2346938775510203, "grad_norm": 0.7179734053191383, "learning_rate": 3.199122913603972e-06, "loss": 0.24798645973205566, "num_input_tokens_seen": 587682416, "step": 9680, "train_runtime": 126449.5054, "train_tokens_per_second": 4647.566 }, { "epoch": 1.2353316326530612, "grad_norm": 0.6291555011100273, "learning_rate": 3.1944510766604473e-06, "loss": 0.253771448135376, "num_input_tokens_seen": 587994000, "step": 9685, "train_runtime": 126521.3881, "train_tokens_per_second": 4647.388 }, { "epoch": 1.2359693877551021, "grad_norm": 0.706946272636358, "learning_rate": 3.1897810517113657e-06, "loss": 0.2575406551361084, "num_input_tokens_seen": 588303784, "step": 9690, "train_runtime": 126569.4031, "train_tokens_per_second": 4648.073 }, { "epoch": 1.2366071428571428, "grad_norm": 0.7003097570759911, "learning_rate": 3.1851128434434263e-06, "loss": 0.2514672756195068, "num_input_tokens_seen": 588603984, "step": 9695, "train_runtime": 126628.0385, "train_tokens_per_second": 4648.291 }, { "epoch": 1.2372448979591837, "grad_norm": 0.6753710085012944, "learning_rate": 3.1804464565414993e-06, "loss": 0.26751532554626467, "num_input_tokens_seen": 588907392, "step": 9700, "train_runtime": 126689.8644, "train_tokens_per_second": 4648.418 }, { "epoch": 1.2378826530612246, "grad_norm": 0.6405753566997168, "learning_rate": 3.17578189568863e-06, "loss": 0.2393946886062622, "num_input_tokens_seen": 589200744, "step": 9705, "train_runtime": 126744.5972, "train_tokens_per_second": 4648.725 }, { "epoch": 1.2385204081632653, "grad_norm": 0.6168794223813908, "learning_rate": 3.1711191655660327e-06, "loss": 0.256895112991333, "num_input_tokens_seen": 589514904, "step": 9710, "train_runtime": 126815.9873, "train_tokens_per_second": 4648.585 }, { "epoch": 1.2391581632653061, "grad_norm": 0.7566616034104741, "learning_rate": 3.1664582708530796e-06, "loss": 0.2531773805618286, "num_input_tokens_seen": 589802968, "step": 9715, "train_runtime": 126881.4978, "train_tokens_per_second": 4648.455 }, { "epoch": 1.239795918367347, "grad_norm": 0.6371920115656248, "learning_rate": 3.161799216227307e-06, "loss": 0.2313767671585083, "num_input_tokens_seen": 590100256, "step": 9720, "train_runtime": 126950.3212, "train_tokens_per_second": 4648.277 }, { "epoch": 1.2404336734693877, "grad_norm": 0.6850969299624414, "learning_rate": 3.157142006364401e-06, "loss": 0.256287145614624, "num_input_tokens_seen": 590398160, "step": 9725, "train_runtime": 127015.3617, "train_tokens_per_second": 4648.242 }, { "epoch": 1.2410714285714286, "grad_norm": 0.6707570764989049, "learning_rate": 3.1524866459381966e-06, "loss": 0.25388460159301757, "num_input_tokens_seen": 590694312, "step": 9730, "train_runtime": 127083.5671, "train_tokens_per_second": 4648.078 }, { "epoch": 1.2417091836734695, "grad_norm": 0.6804430561708349, "learning_rate": 3.147833139620671e-06, "loss": 0.25645253658294676, "num_input_tokens_seen": 590994960, "step": 9735, "train_runtime": 127140.3685, "train_tokens_per_second": 4648.366 }, { "epoch": 1.2423469387755102, "grad_norm": 0.6681750437913, "learning_rate": 3.143181492081947e-06, "loss": 0.26023178100585936, "num_input_tokens_seen": 591304168, "step": 9740, "train_runtime": 127188.4334, "train_tokens_per_second": 4649.04 }, { "epoch": 1.242984693877551, "grad_norm": 0.557440274643686, "learning_rate": 3.1385317079902743e-06, "loss": 0.26649203300476076, "num_input_tokens_seen": 591618200, "step": 9745, "train_runtime": 127245.3409, "train_tokens_per_second": 4649.429 }, { "epoch": 1.243622448979592, "grad_norm": 0.6415297135469716, "learning_rate": 3.133883792012037e-06, "loss": 0.24660344123840333, "num_input_tokens_seen": 591928872, "step": 9750, "train_runtime": 127307.7603, "train_tokens_per_second": 4649.59 }, { "epoch": 1.2442602040816326, "grad_norm": 0.6213889480690334, "learning_rate": 3.1292377488117466e-06, "loss": 0.2687695026397705, "num_input_tokens_seen": 592234376, "step": 9755, "train_runtime": 127364.8152, "train_tokens_per_second": 4649.906 }, { "epoch": 1.2448979591836735, "grad_norm": 0.6495897733022374, "learning_rate": 3.124593583052026e-06, "loss": 0.25377483367919923, "num_input_tokens_seen": 592531608, "step": 9760, "train_runtime": 127437.5012, "train_tokens_per_second": 4649.586 }, { "epoch": 1.2455357142857142, "grad_norm": 0.6523830276643983, "learning_rate": 3.119951299393625e-06, "loss": 0.2609021902084351, "num_input_tokens_seen": 592827608, "step": 9765, "train_runtime": 127497.901, "train_tokens_per_second": 4649.705 }, { "epoch": 1.246173469387755, "grad_norm": 0.7011963327521072, "learning_rate": 3.115310902495396e-06, "loss": 0.26243650913238525, "num_input_tokens_seen": 593137488, "step": 9770, "train_runtime": 127571.704, "train_tokens_per_second": 4649.444 }, { "epoch": 1.246811224489796, "grad_norm": 0.6816688394845224, "learning_rate": 3.1106723970143016e-06, "loss": 0.273140025138855, "num_input_tokens_seen": 593451248, "step": 9775, "train_runtime": 127642.3561, "train_tokens_per_second": 4649.329 }, { "epoch": 1.2474489795918366, "grad_norm": 0.6954608888802939, "learning_rate": 3.10603578760541e-06, "loss": 0.24771556854248047, "num_input_tokens_seen": 593735344, "step": 9780, "train_runtime": 127713.5722, "train_tokens_per_second": 4648.96 }, { "epoch": 1.2480867346938775, "grad_norm": 0.6552008274039413, "learning_rate": 3.101401078921878e-06, "loss": 0.2547657251358032, "num_input_tokens_seen": 594041320, "step": 9785, "train_runtime": 127777.3076, "train_tokens_per_second": 4649.036 }, { "epoch": 1.2487244897959184, "grad_norm": 0.7631631481534996, "learning_rate": 3.0967682756149607e-06, "loss": 0.2581759452819824, "num_input_tokens_seen": 594341352, "step": 9790, "train_runtime": 127849.4879, "train_tokens_per_second": 4648.758 }, { "epoch": 1.249362244897959, "grad_norm": 0.7153650277500097, "learning_rate": 3.0921373823340028e-06, "loss": 0.25716280937194824, "num_input_tokens_seen": 594646352, "step": 9795, "train_runtime": 127917.3968, "train_tokens_per_second": 4648.675 }, { "epoch": 1.25, "grad_norm": 0.7737620565303293, "learning_rate": 3.0875084037264237e-06, "loss": 0.25070748329162595, "num_input_tokens_seen": 594951600, "step": 9800, "train_runtime": 127979.9371, "train_tokens_per_second": 4648.788 }, { "epoch": 1.250637755102041, "grad_norm": 0.6105011346752942, "learning_rate": 3.0828813444377304e-06, "loss": 0.26685409545898436, "num_input_tokens_seen": 595265464, "step": 9805, "train_runtime": 128040.6729, "train_tokens_per_second": 4649.034 }, { "epoch": 1.2512755102040816, "grad_norm": 0.6801389888878429, "learning_rate": 3.0782562091114997e-06, "loss": 0.24711506366729735, "num_input_tokens_seen": 595563768, "step": 9810, "train_runtime": 128103.6441, "train_tokens_per_second": 4649.077 }, { "epoch": 1.2519132653061225, "grad_norm": 0.6358161259128543, "learning_rate": 3.0736330023893774e-06, "loss": 0.27412877082824705, "num_input_tokens_seen": 595873808, "step": 9815, "train_runtime": 128150.8662, "train_tokens_per_second": 4649.784 }, { "epoch": 1.2525510204081631, "grad_norm": 0.547957933485934, "learning_rate": 3.0690117289110732e-06, "loss": 0.2447650909423828, "num_input_tokens_seen": 596168104, "step": 9820, "train_runtime": 128214.4639, "train_tokens_per_second": 4649.773 }, { "epoch": 1.253188775510204, "grad_norm": 0.687675566564068, "learning_rate": 3.0643923933143603e-06, "loss": 0.27698750495910646, "num_input_tokens_seen": 596477128, "step": 9825, "train_runtime": 128274.5149, "train_tokens_per_second": 4650.005 }, { "epoch": 1.253826530612245, "grad_norm": 0.6494597349522581, "learning_rate": 3.059775000235063e-06, "loss": 0.24812660217285157, "num_input_tokens_seen": 596775888, "step": 9830, "train_runtime": 128334.0069, "train_tokens_per_second": 4650.177 }, { "epoch": 1.2544642857142856, "grad_norm": 0.6742342248112834, "learning_rate": 3.0551595543070567e-06, "loss": 0.25735490322113036, "num_input_tokens_seen": 597083000, "step": 9835, "train_runtime": 128394.0745, "train_tokens_per_second": 4650.394 }, { "epoch": 1.2551020408163265, "grad_norm": 0.588132941763026, "learning_rate": 3.050546060162267e-06, "loss": 0.25598070621490476, "num_input_tokens_seen": 597384416, "step": 9840, "train_runtime": 128458.1201, "train_tokens_per_second": 4650.422 }, { "epoch": 1.2557397959183674, "grad_norm": 0.6523181185468291, "learning_rate": 3.045934522430655e-06, "loss": 0.2531641960144043, "num_input_tokens_seen": 597683408, "step": 9845, "train_runtime": 128519.4913, "train_tokens_per_second": 4650.527 }, { "epoch": 1.256377551020408, "grad_norm": 0.5186578824755282, "learning_rate": 3.0413249457402206e-06, "loss": 0.24352428913116456, "num_input_tokens_seen": 597978680, "step": 9850, "train_runtime": 128575.6032, "train_tokens_per_second": 4650.794 }, { "epoch": 1.257015306122449, "grad_norm": 0.7497706288807056, "learning_rate": 3.0367173347169978e-06, "loss": 0.2518972396850586, "num_input_tokens_seen": 598278904, "step": 9855, "train_runtime": 128644.3456, "train_tokens_per_second": 4650.643 }, { "epoch": 1.2576530612244898, "grad_norm": 0.6682936358424924, "learning_rate": 3.0321116939850435e-06, "loss": 0.25064496994018554, "num_input_tokens_seen": 598588448, "step": 9860, "train_runtime": 128715.656, "train_tokens_per_second": 4650.471 }, { "epoch": 1.2582908163265305, "grad_norm": 0.6569544347037569, "learning_rate": 3.0275080281664417e-06, "loss": 0.26858522891998293, "num_input_tokens_seen": 598894360, "step": 9865, "train_runtime": 128776.5363, "train_tokens_per_second": 4650.648 }, { "epoch": 1.2589285714285714, "grad_norm": 0.6280506510343941, "learning_rate": 3.0229063418812932e-06, "loss": 0.2568094253540039, "num_input_tokens_seen": 599191976, "step": 9870, "train_runtime": 128849.6351, "train_tokens_per_second": 4650.32 }, { "epoch": 1.2595663265306123, "grad_norm": 1.0130878857610142, "learning_rate": 3.0183066397477103e-06, "loss": 0.24946315288543702, "num_input_tokens_seen": 599499472, "step": 9875, "train_runtime": 128907.73, "train_tokens_per_second": 4650.609 }, { "epoch": 1.260204081632653, "grad_norm": 0.7316748022706298, "learning_rate": 3.013708926381814e-06, "loss": 0.2662359237670898, "num_input_tokens_seen": 599806944, "step": 9880, "train_runtime": 128977.9497, "train_tokens_per_second": 4650.461 }, { "epoch": 1.2608418367346939, "grad_norm": 0.651018892310976, "learning_rate": 3.0091132063977344e-06, "loss": 0.2581866502761841, "num_input_tokens_seen": 600115496, "step": 9885, "train_runtime": 129042.3842, "train_tokens_per_second": 4650.53 }, { "epoch": 1.2614795918367347, "grad_norm": 0.7103080293781776, "learning_rate": 3.004519484407594e-06, "loss": 0.25688824653625486, "num_input_tokens_seen": 600426616, "step": 9890, "train_runtime": 129107.0702, "train_tokens_per_second": 4650.61 }, { "epoch": 1.2621173469387754, "grad_norm": 0.6152615903240626, "learning_rate": 2.9999277650215164e-06, "loss": 0.25172607898712157, "num_input_tokens_seen": 600719552, "step": 9895, "train_runtime": 129175.3695, "train_tokens_per_second": 4650.419 }, { "epoch": 1.2627551020408163, "grad_norm": 0.6428804398792916, "learning_rate": 2.9953380528476105e-06, "loss": 0.25584452152252196, "num_input_tokens_seen": 601024464, "step": 9900, "train_runtime": 129248.2615, "train_tokens_per_second": 4650.155 }, { "epoch": 1.2633928571428572, "grad_norm": 0.5992685996482658, "learning_rate": 2.9907503524919734e-06, "loss": 0.26361684799194335, "num_input_tokens_seen": 601324424, "step": 9905, "train_runtime": 129318.0209, "train_tokens_per_second": 4649.966 }, { "epoch": 1.2640306122448979, "grad_norm": 0.5960767762245135, "learning_rate": 2.9861646685586843e-06, "loss": 0.26084651947021487, "num_input_tokens_seen": 601633216, "step": 9910, "train_runtime": 129390.1912, "train_tokens_per_second": 4649.759 }, { "epoch": 1.2646683673469388, "grad_norm": 0.6304029794461745, "learning_rate": 2.981581005649795e-06, "loss": 0.25563340187072753, "num_input_tokens_seen": 601941432, "step": 9915, "train_runtime": 129450.1832, "train_tokens_per_second": 4649.985 }, { "epoch": 1.2653061224489797, "grad_norm": 0.7046465445006264, "learning_rate": 2.9769993683653324e-06, "loss": 0.2499422550201416, "num_input_tokens_seen": 602250352, "step": 9920, "train_runtime": 129518.73, "train_tokens_per_second": 4649.909 }, { "epoch": 1.2659438775510203, "grad_norm": 0.6054572425287019, "learning_rate": 2.9724197613032917e-06, "loss": 0.24319024085998536, "num_input_tokens_seen": 602558568, "step": 9925, "train_runtime": 129579.8484, "train_tokens_per_second": 4650.095 }, { "epoch": 1.2665816326530612, "grad_norm": 0.6476194312179154, "learning_rate": 2.9678421890596254e-06, "loss": 0.25522913932800295, "num_input_tokens_seen": 602868024, "step": 9930, "train_runtime": 129647.6093, "train_tokens_per_second": 4650.051 }, { "epoch": 1.2672193877551021, "grad_norm": 0.6681534094124768, "learning_rate": 2.9632666562282477e-06, "loss": 0.26373605728149413, "num_input_tokens_seen": 603170320, "step": 9935, "train_runtime": 129708.6046, "train_tokens_per_second": 4650.195 }, { "epoch": 1.2678571428571428, "grad_norm": 0.6172682304373681, "learning_rate": 2.9586931674010265e-06, "loss": 0.2531527757644653, "num_input_tokens_seen": 603477864, "step": 9940, "train_runtime": 129774.7676, "train_tokens_per_second": 4650.194 }, { "epoch": 1.2684948979591837, "grad_norm": 0.5602088394574272, "learning_rate": 2.9541217271677747e-06, "loss": 0.2425062894821167, "num_input_tokens_seen": 603787784, "step": 9945, "train_runtime": 129839.2639, "train_tokens_per_second": 4650.271 }, { "epoch": 1.2691326530612246, "grad_norm": 0.6393547227516018, "learning_rate": 2.949552340116254e-06, "loss": 0.2609687089920044, "num_input_tokens_seen": 604096976, "step": 9950, "train_runtime": 129915.6675, "train_tokens_per_second": 4649.916 }, { "epoch": 1.2697704081632653, "grad_norm": 0.7057184622242589, "learning_rate": 2.9449850108321644e-06, "loss": 0.242216157913208, "num_input_tokens_seen": 604392392, "step": 9955, "train_runtime": 129982.4602, "train_tokens_per_second": 4649.8 }, { "epoch": 1.2704081632653061, "grad_norm": 0.6099371831529727, "learning_rate": 2.9404197438991377e-06, "loss": 0.26979479789733884, "num_input_tokens_seen": 604699384, "step": 9960, "train_runtime": 130048.0207, "train_tokens_per_second": 4649.816 }, { "epoch": 1.271045918367347, "grad_norm": 0.7060903353195286, "learning_rate": 2.935856543898737e-06, "loss": 0.2459017515182495, "num_input_tokens_seen": 605005040, "step": 9965, "train_runtime": 130111.253, "train_tokens_per_second": 4649.906 }, { "epoch": 1.2716836734693877, "grad_norm": 0.6778245237757761, "learning_rate": 2.9312954154104563e-06, "loss": 0.26631999015808105, "num_input_tokens_seen": 605306128, "step": 9970, "train_runtime": 130177.6962, "train_tokens_per_second": 4649.845 }, { "epoch": 1.2723214285714286, "grad_norm": 0.5990361048893761, "learning_rate": 2.9267363630117028e-06, "loss": 0.2491915225982666, "num_input_tokens_seen": 605616512, "step": 9975, "train_runtime": 130245.6472, "train_tokens_per_second": 4649.802 }, { "epoch": 1.2729591836734695, "grad_norm": 0.7182257701001821, "learning_rate": 2.9221793912778053e-06, "loss": 0.2490309476852417, "num_input_tokens_seen": 605908128, "step": 9980, "train_runtime": 130304.8941, "train_tokens_per_second": 4649.926 }, { "epoch": 1.2735969387755102, "grad_norm": 0.6271430490639972, "learning_rate": 2.9176245047820064e-06, "loss": 0.2644538640975952, "num_input_tokens_seen": 606204472, "step": 9985, "train_runtime": 130360.7128, "train_tokens_per_second": 4650.208 }, { "epoch": 1.274234693877551, "grad_norm": 0.6897428999300005, "learning_rate": 2.913071708095446e-06, "loss": 0.2759737730026245, "num_input_tokens_seen": 606511672, "step": 9990, "train_runtime": 130420.8642, "train_tokens_per_second": 4650.419 }, { "epoch": 1.274872448979592, "grad_norm": 0.6135000369081007, "learning_rate": 2.908521005787177e-06, "loss": 0.25093646049499513, "num_input_tokens_seen": 606807536, "step": 9995, "train_runtime": 130488.9034, "train_tokens_per_second": 4650.262 }, { "epoch": 1.2755102040816326, "grad_norm": 0.6637867383854398, "learning_rate": 2.903972402424151e-06, "loss": 0.26477274894714353, "num_input_tokens_seen": 607106096, "step": 10000, "train_runtime": 130563.6249, "train_tokens_per_second": 4649.887 }, { "epoch": 1.2761479591836735, "grad_norm": 0.7321868174113467, "learning_rate": 2.899425902571203e-06, "loss": 0.28002426624298093, "num_input_tokens_seen": 607424872, "step": 10005, "train_runtime": 130618.45, "train_tokens_per_second": 4650.376 }, { "epoch": 1.2767857142857144, "grad_norm": 0.7247413141361364, "learning_rate": 2.8948815107910653e-06, "loss": 0.25679717063903806, "num_input_tokens_seen": 607733480, "step": 10010, "train_runtime": 130684.2643, "train_tokens_per_second": 4650.395 }, { "epoch": 1.277423469387755, "grad_norm": 0.6190331531886365, "learning_rate": 2.8903392316443534e-06, "loss": 0.257327938079834, "num_input_tokens_seen": 608038432, "step": 10015, "train_runtime": 130756.388, "train_tokens_per_second": 4650.162 }, { "epoch": 1.278061224489796, "grad_norm": 0.6102981167242966, "learning_rate": 2.885799069689561e-06, "loss": 0.25208125114440916, "num_input_tokens_seen": 608354768, "step": 10020, "train_runtime": 130813.2447, "train_tokens_per_second": 4650.559 }, { "epoch": 1.2786989795918369, "grad_norm": 0.6294305335884982, "learning_rate": 2.8812610294830568e-06, "loss": 0.2639681100845337, "num_input_tokens_seen": 608646632, "step": 10025, "train_runtime": 130882.8881, "train_tokens_per_second": 4650.315 }, { "epoch": 1.2793367346938775, "grad_norm": 0.7137119012445925, "learning_rate": 2.8767251155790826e-06, "loss": 0.25915184020996096, "num_input_tokens_seen": 608954568, "step": 10030, "train_runtime": 130950.7914, "train_tokens_per_second": 4650.255 }, { "epoch": 1.2799744897959184, "grad_norm": 0.6110036230769141, "learning_rate": 2.8721913325297434e-06, "loss": 0.27418949604034426, "num_input_tokens_seen": 609265952, "step": 10035, "train_runtime": 131009.8313, "train_tokens_per_second": 4650.536 }, { "epoch": 1.280612244897959, "grad_norm": 0.6725197054712593, "learning_rate": 2.8676596848850084e-06, "loss": 0.25756547451019285, "num_input_tokens_seen": 609583120, "step": 10040, "train_runtime": 131071.6354, "train_tokens_per_second": 4650.763 }, { "epoch": 1.28125, "grad_norm": 0.6011573752497347, "learning_rate": 2.8631301771927024e-06, "loss": 0.219584321975708, "num_input_tokens_seen": 609891536, "step": 10045, "train_runtime": 131137.8367, "train_tokens_per_second": 4650.767 }, { "epoch": 1.281887755102041, "grad_norm": 0.6476099551009382, "learning_rate": 2.858602813998501e-06, "loss": 0.261248779296875, "num_input_tokens_seen": 610191608, "step": 10050, "train_runtime": 131209.2128, "train_tokens_per_second": 4650.524 }, { "epoch": 1.2825255102040816, "grad_norm": 0.7285425158352521, "learning_rate": 2.8540775998459336e-06, "loss": 0.2619506597518921, "num_input_tokens_seen": 610492744, "step": 10055, "train_runtime": 131276.3329, "train_tokens_per_second": 4650.44 }, { "epoch": 1.2831632653061225, "grad_norm": 0.649914020532788, "learning_rate": 2.849554539276361e-06, "loss": 0.2608958721160889, "num_input_tokens_seen": 610807288, "step": 10060, "train_runtime": 131350.7727, "train_tokens_per_second": 4650.199 }, { "epoch": 1.2838010204081631, "grad_norm": 0.6279072982442597, "learning_rate": 2.845033636828998e-06, "loss": 0.2728137016296387, "num_input_tokens_seen": 611113336, "step": 10065, "train_runtime": 131424.7595, "train_tokens_per_second": 4649.91 }, { "epoch": 1.284438775510204, "grad_norm": 0.6576997380235776, "learning_rate": 2.840514897040884e-06, "loss": 0.25149002075195315, "num_input_tokens_seen": 611424664, "step": 10070, "train_runtime": 131491.3931, "train_tokens_per_second": 4649.922 }, { "epoch": 1.285076530612245, "grad_norm": 0.7135138265820079, "learning_rate": 2.835998324446887e-06, "loss": 0.24344327449798583, "num_input_tokens_seen": 611722296, "step": 10075, "train_runtime": 131560.8457, "train_tokens_per_second": 4649.729 }, { "epoch": 1.2857142857142856, "grad_norm": 0.8300117316787209, "learning_rate": 2.831483923579703e-06, "loss": 0.21739587783813477, "num_input_tokens_seen": 612008712, "step": 10080, "train_runtime": 131630.3069, "train_tokens_per_second": 4649.451 }, { "epoch": 1.2863520408163265, "grad_norm": 0.7170568738190197, "learning_rate": 2.8269716989698547e-06, "loss": 0.2605217456817627, "num_input_tokens_seen": 612309344, "step": 10085, "train_runtime": 131699.8802, "train_tokens_per_second": 4649.278 }, { "epoch": 1.2869897959183674, "grad_norm": 0.690429723103565, "learning_rate": 2.822461655145669e-06, "loss": 0.2618260383605957, "num_input_tokens_seen": 612608216, "step": 10090, "train_runtime": 131763.1517, "train_tokens_per_second": 4649.314 }, { "epoch": 1.287627551020408, "grad_norm": 0.7211370361617034, "learning_rate": 2.817953796633289e-06, "loss": 0.24970576763153077, "num_input_tokens_seen": 612908504, "step": 10095, "train_runtime": 131831.2232, "train_tokens_per_second": 4649.191 }, { "epoch": 1.288265306122449, "grad_norm": 0.7259032001730406, "learning_rate": 2.813448127956672e-06, "loss": 0.2589538335800171, "num_input_tokens_seen": 613202592, "step": 10100, "train_runtime": 131894.2426, "train_tokens_per_second": 4649.199 }, { "epoch": 1.2889030612244898, "grad_norm": 0.6197107246379037, "learning_rate": 2.8089446536375642e-06, "loss": 0.2536892890930176, "num_input_tokens_seen": 613511544, "step": 10105, "train_runtime": 131961.9325, "train_tokens_per_second": 4649.155 }, { "epoch": 1.2895408163265305, "grad_norm": 0.7105835763581693, "learning_rate": 2.8044433781955196e-06, "loss": 0.2439013957977295, "num_input_tokens_seen": 613812360, "step": 10110, "train_runtime": 132024.5481, "train_tokens_per_second": 4649.229 }, { "epoch": 1.2901785714285714, "grad_norm": 0.5749126725639873, "learning_rate": 2.7999443061478827e-06, "loss": 0.2278393268585205, "num_input_tokens_seen": 614108216, "step": 10115, "train_runtime": 132091.8692, "train_tokens_per_second": 4649.099 }, { "epoch": 1.2908163265306123, "grad_norm": 0.7989012983361106, "learning_rate": 2.795447442009786e-06, "loss": 0.2468031167984009, "num_input_tokens_seen": 614409664, "step": 10120, "train_runtime": 132156.0444, "train_tokens_per_second": 4649.123 }, { "epoch": 1.291454081632653, "grad_norm": 0.67816707037487, "learning_rate": 2.7909527902941467e-06, "loss": 0.26167936325073243, "num_input_tokens_seen": 614716896, "step": 10125, "train_runtime": 132223.5742, "train_tokens_per_second": 4649.072 }, { "epoch": 1.2920918367346939, "grad_norm": 0.6771644170164809, "learning_rate": 2.786460355511662e-06, "loss": 0.2604956150054932, "num_input_tokens_seen": 615013432, "step": 10130, "train_runtime": 132282.9754, "train_tokens_per_second": 4649.226 }, { "epoch": 1.2927295918367347, "grad_norm": 0.5849170247320123, "learning_rate": 2.7819701421708047e-06, "loss": 0.2588627338409424, "num_input_tokens_seen": 615303208, "step": 10135, "train_runtime": 132344.7601, "train_tokens_per_second": 4649.245 }, { "epoch": 1.2933673469387754, "grad_norm": 0.6647315408989721, "learning_rate": 2.7774821547778176e-06, "loss": 0.276265287399292, "num_input_tokens_seen": 615628832, "step": 10140, "train_runtime": 132389.603, "train_tokens_per_second": 4650.13 }, { "epoch": 1.2940051020408163, "grad_norm": 0.6733416147279704, "learning_rate": 2.772996397836704e-06, "loss": 0.25055019855499266, "num_input_tokens_seen": 615931752, "step": 10145, "train_runtime": 132448.6172, "train_tokens_per_second": 4650.345 }, { "epoch": 1.2946428571428572, "grad_norm": 0.6500325488391534, "learning_rate": 2.768512875849242e-06, "loss": 0.23627872467041017, "num_input_tokens_seen": 616243688, "step": 10150, "train_runtime": 132496.0352, "train_tokens_per_second": 4651.035 }, { "epoch": 1.2952806122448979, "grad_norm": 0.6266059224504728, "learning_rate": 2.7640315933149568e-06, "loss": 0.26852166652679443, "num_input_tokens_seen": 616547944, "step": 10155, "train_runtime": 132564.6291, "train_tokens_per_second": 4650.923 }, { "epoch": 1.2959183673469388, "grad_norm": 0.6994851934152331, "learning_rate": 2.7595525547311257e-06, "loss": 0.24700803756713868, "num_input_tokens_seen": 616845272, "step": 10160, "train_runtime": 132636.8062, "train_tokens_per_second": 4650.634 }, { "epoch": 1.2965561224489797, "grad_norm": 0.6365087964133738, "learning_rate": 2.755075764592777e-06, "loss": 0.26582865715026854, "num_input_tokens_seen": 617160472, "step": 10165, "train_runtime": 132701.6567, "train_tokens_per_second": 4650.737 }, { "epoch": 1.2971938775510203, "grad_norm": 0.5938124532129865, "learning_rate": 2.750601227392687e-06, "loss": 0.24859161376953126, "num_input_tokens_seen": 617456352, "step": 10170, "train_runtime": 132771.0572, "train_tokens_per_second": 4650.534 }, { "epoch": 1.2978316326530612, "grad_norm": 0.6937636225671621, "learning_rate": 2.7461289476213617e-06, "loss": 0.2627084732055664, "num_input_tokens_seen": 617764112, "step": 10175, "train_runtime": 132829.6461, "train_tokens_per_second": 4650.8 }, { "epoch": 1.2984693877551021, "grad_norm": 0.6882085993566683, "learning_rate": 2.741658929767045e-06, "loss": 0.24822802543640138, "num_input_tokens_seen": 618072856, "step": 10180, "train_runtime": 132887.3005, "train_tokens_per_second": 4651.106 }, { "epoch": 1.2991071428571428, "grad_norm": 0.648652873862695, "learning_rate": 2.7371911783157178e-06, "loss": 0.23618090152740479, "num_input_tokens_seen": 618365920, "step": 10185, "train_runtime": 132947.2677, "train_tokens_per_second": 4651.212 }, { "epoch": 1.2997448979591837, "grad_norm": 0.5628727217052052, "learning_rate": 2.7327256977510764e-06, "loss": 0.261117959022522, "num_input_tokens_seen": 618681128, "step": 10190, "train_runtime": 133002.6092, "train_tokens_per_second": 4651.647 }, { "epoch": 1.3003826530612246, "grad_norm": 0.6734165895986504, "learning_rate": 2.7282624925545432e-06, "loss": 0.2443925380706787, "num_input_tokens_seen": 618987336, "step": 10195, "train_runtime": 133049.8715, "train_tokens_per_second": 4652.296 }, { "epoch": 1.3010204081632653, "grad_norm": 0.6491868597447439, "learning_rate": 2.723801567205256e-06, "loss": 0.2537305593490601, "num_input_tokens_seen": 619294688, "step": 10200, "train_runtime": 133121.5278, "train_tokens_per_second": 4652.1 }, { "epoch": 1.3016581632653061, "grad_norm": 0.6428935089414552, "learning_rate": 2.7193429261800657e-06, "loss": 0.2404731035232544, "num_input_tokens_seen": 619599992, "step": 10205, "train_runtime": 133185.5983, "train_tokens_per_second": 4652.155 }, { "epoch": 1.302295918367347, "grad_norm": 0.6936701268816926, "learning_rate": 2.7148865739535303e-06, "loss": 0.2664501667022705, "num_input_tokens_seen": 619904240, "step": 10210, "train_runtime": 133242.1964, "train_tokens_per_second": 4652.462 }, { "epoch": 1.3029336734693877, "grad_norm": 0.629156863618074, "learning_rate": 2.710432514997909e-06, "loss": 0.27101132869720457, "num_input_tokens_seen": 620218168, "step": 10215, "train_runtime": 133305.0068, "train_tokens_per_second": 4652.625 }, { "epoch": 1.3035714285714286, "grad_norm": 0.8439382359438976, "learning_rate": 2.7059807537831624e-06, "loss": 0.2491471290588379, "num_input_tokens_seen": 620530952, "step": 10220, "train_runtime": 133368.8263, "train_tokens_per_second": 4652.744 }, { "epoch": 1.3042091836734695, "grad_norm": 0.6380148848448121, "learning_rate": 2.7015312947769436e-06, "loss": 0.25763468742370604, "num_input_tokens_seen": 620831664, "step": 10225, "train_runtime": 133438.3092, "train_tokens_per_second": 4652.574 }, { "epoch": 1.3048469387755102, "grad_norm": 0.7221871794117705, "learning_rate": 2.6970841424445947e-06, "loss": 0.26262674331665037, "num_input_tokens_seen": 621126216, "step": 10230, "train_runtime": 133505.9152, "train_tokens_per_second": 4652.425 }, { "epoch": 1.305484693877551, "grad_norm": 0.6411570328012643, "learning_rate": 2.692639301249144e-06, "loss": 0.2711535692214966, "num_input_tokens_seen": 621431064, "step": 10235, "train_runtime": 133572.2515, "train_tokens_per_second": 4652.396 }, { "epoch": 1.306122448979592, "grad_norm": 0.7123075157071713, "learning_rate": 2.6881967756513004e-06, "loss": 0.24485445022583008, "num_input_tokens_seen": 621748664, "step": 10240, "train_runtime": 133619.3022, "train_tokens_per_second": 4653.135 }, { "epoch": 1.3067602040816326, "grad_norm": 0.6380666943265844, "learning_rate": 2.6837565701094505e-06, "loss": 0.26869773864746094, "num_input_tokens_seen": 622049712, "step": 10245, "train_runtime": 133690.8125, "train_tokens_per_second": 4652.898 }, { "epoch": 1.3073979591836735, "grad_norm": 0.7029422356592782, "learning_rate": 2.679318689079645e-06, "loss": 0.2626228094100952, "num_input_tokens_seen": 622359040, "step": 10250, "train_runtime": 133762.0832, "train_tokens_per_second": 4652.731 }, { "epoch": 1.3080357142857144, "grad_norm": 0.65230916271705, "learning_rate": 2.6748831370156148e-06, "loss": 0.24830842018127441, "num_input_tokens_seen": 622654288, "step": 10255, "train_runtime": 133827.315, "train_tokens_per_second": 4652.67 }, { "epoch": 1.308673469387755, "grad_norm": 0.6305512068807968, "learning_rate": 2.6704499183687404e-06, "loss": 0.24921224117279053, "num_input_tokens_seen": 622960992, "step": 10260, "train_runtime": 133891.5144, "train_tokens_per_second": 4652.729 }, { "epoch": 1.309311224489796, "grad_norm": 0.6641317675834468, "learning_rate": 2.6660190375880656e-06, "loss": 0.24191765785217284, "num_input_tokens_seen": 623271960, "step": 10265, "train_runtime": 133963.8275, "train_tokens_per_second": 4652.539 }, { "epoch": 1.3099489795918369, "grad_norm": 0.620307548738313, "learning_rate": 2.661590499120296e-06, "loss": 0.2493054151535034, "num_input_tokens_seen": 623578472, "step": 10270, "train_runtime": 134019.4072, "train_tokens_per_second": 4652.897 }, { "epoch": 1.3105867346938775, "grad_norm": 0.6408356538606649, "learning_rate": 2.657164307409773e-06, "loss": 0.2380746841430664, "num_input_tokens_seen": 623877328, "step": 10275, "train_runtime": 134078.8456, "train_tokens_per_second": 4653.063 }, { "epoch": 1.3112244897959184, "grad_norm": 0.5961639808305982, "learning_rate": 2.6527404668984907e-06, "loss": 0.24416801929473878, "num_input_tokens_seen": 624169576, "step": 10280, "train_runtime": 134146.2055, "train_tokens_per_second": 4652.905 }, { "epoch": 1.311862244897959, "grad_norm": 0.606658146504834, "learning_rate": 2.648318982026082e-06, "loss": 0.23076577186584474, "num_input_tokens_seen": 624471232, "step": 10285, "train_runtime": 134198.9787, "train_tokens_per_second": 4653.323 }, { "epoch": 1.3125, "grad_norm": 0.7003322418402668, "learning_rate": 2.6438998572298157e-06, "loss": 0.25791611671447756, "num_input_tokens_seen": 624766680, "step": 10290, "train_runtime": 134268.7884, "train_tokens_per_second": 4653.104 }, { "epoch": 1.313137755102041, "grad_norm": 0.7379463589403175, "learning_rate": 2.639483096944593e-06, "loss": 0.2841819763183594, "num_input_tokens_seen": 625069280, "step": 10295, "train_runtime": 134325.7322, "train_tokens_per_second": 4653.384 }, { "epoch": 1.3137755102040816, "grad_norm": 0.7038679723358398, "learning_rate": 2.63506870560294e-06, "loss": 0.25959005355834963, "num_input_tokens_seen": 625385304, "step": 10300, "train_runtime": 134388.9597, "train_tokens_per_second": 4653.547 }, { "epoch": 1.3144132653061225, "grad_norm": 0.694339505158264, "learning_rate": 2.6306566876350072e-06, "loss": 0.28363423347473143, "num_input_tokens_seen": 625697000, "step": 10305, "train_runtime": 134456.6965, "train_tokens_per_second": 4653.521 }, { "epoch": 1.3150510204081631, "grad_norm": 0.6729179093091422, "learning_rate": 2.626247047468563e-06, "loss": 0.2525624752044678, "num_input_tokens_seen": 625983968, "step": 10310, "train_runtime": 134518.7724, "train_tokens_per_second": 4653.506 }, { "epoch": 1.315688775510204, "grad_norm": 0.6307130113578302, "learning_rate": 2.6218397895289893e-06, "loss": 0.25787949562072754, "num_input_tokens_seen": 626278856, "step": 10315, "train_runtime": 134586.7912, "train_tokens_per_second": 4653.346 }, { "epoch": 1.316326530612245, "grad_norm": 0.6396057526222012, "learning_rate": 2.617434918239278e-06, "loss": 0.2836592197418213, "num_input_tokens_seen": 626594600, "step": 10320, "train_runtime": 134652.054, "train_tokens_per_second": 4653.435 }, { "epoch": 1.3169642857142856, "grad_norm": 0.6579783302043273, "learning_rate": 2.6130324380200234e-06, "loss": 0.27531752586364744, "num_input_tokens_seen": 626907120, "step": 10325, "train_runtime": 134709.5533, "train_tokens_per_second": 4653.769 }, { "epoch": 1.3176020408163265, "grad_norm": 0.7121021764571803, "learning_rate": 2.6086323532894225e-06, "loss": 0.2745412826538086, "num_input_tokens_seen": 627215384, "step": 10330, "train_runtime": 134771.8803, "train_tokens_per_second": 4653.904 }, { "epoch": 1.3182397959183674, "grad_norm": 0.6775781147529878, "learning_rate": 2.604234668463268e-06, "loss": 0.2636935949325562, "num_input_tokens_seen": 627522696, "step": 10335, "train_runtime": 134848.2587, "train_tokens_per_second": 4653.547 }, { "epoch": 1.318877551020408, "grad_norm": 0.676427120925447, "learning_rate": 2.5998393879549444e-06, "loss": 0.24675984382629396, "num_input_tokens_seen": 627822656, "step": 10340, "train_runtime": 134911.3137, "train_tokens_per_second": 4653.595 }, { "epoch": 1.319515306122449, "grad_norm": 0.6446057835307174, "learning_rate": 2.5954465161754226e-06, "loss": 0.2533129692077637, "num_input_tokens_seen": 628140568, "step": 10345, "train_runtime": 134974.9025, "train_tokens_per_second": 4653.758 }, { "epoch": 1.3201530612244898, "grad_norm": 0.6817642612737654, "learning_rate": 2.5910560575332524e-06, "loss": 0.2645681381225586, "num_input_tokens_seen": 628449208, "step": 10350, "train_runtime": 135037.885, "train_tokens_per_second": 4653.873 }, { "epoch": 1.3207908163265305, "grad_norm": 0.6776014241789975, "learning_rate": 2.5866680164345704e-06, "loss": 0.26526970863342286, "num_input_tokens_seen": 628754088, "step": 10355, "train_runtime": 135094.8645, "train_tokens_per_second": 4654.167 }, { "epoch": 1.3214285714285714, "grad_norm": 0.5642825013265818, "learning_rate": 2.5822823972830825e-06, "loss": 0.2514237403869629, "num_input_tokens_seen": 629068856, "step": 10360, "train_runtime": 135155.0177, "train_tokens_per_second": 4654.425 }, { "epoch": 1.3220663265306123, "grad_norm": 0.7327301705078337, "learning_rate": 2.5778992044800597e-06, "loss": 0.26770195960998533, "num_input_tokens_seen": 629366976, "step": 10365, "train_runtime": 135212.7967, "train_tokens_per_second": 4654.641 }, { "epoch": 1.322704081632653, "grad_norm": 0.5960025519414979, "learning_rate": 2.573518442424343e-06, "loss": 0.24228177070617676, "num_input_tokens_seen": 629667240, "step": 10370, "train_runtime": 135276.1603, "train_tokens_per_second": 4654.68 }, { "epoch": 1.3233418367346939, "grad_norm": 0.6116470066239749, "learning_rate": 2.569140115512338e-06, "loss": 0.2634902000427246, "num_input_tokens_seen": 629965416, "step": 10375, "train_runtime": 135348.6113, "train_tokens_per_second": 4654.391 }, { "epoch": 1.3239795918367347, "grad_norm": 0.5870005842251248, "learning_rate": 2.564764228137996e-06, "loss": 0.24268980026245118, "num_input_tokens_seen": 630276384, "step": 10380, "train_runtime": 135418.5572, "train_tokens_per_second": 4654.284 }, { "epoch": 1.3246173469387754, "grad_norm": 0.6140813594421831, "learning_rate": 2.5603907846928277e-06, "loss": 0.23833558559417725, "num_input_tokens_seen": 630580696, "step": 10385, "train_runtime": 135486.4945, "train_tokens_per_second": 4654.196 }, { "epoch": 1.3252551020408163, "grad_norm": 0.7194897793225727, "learning_rate": 2.556019789565889e-06, "loss": 0.2554591655731201, "num_input_tokens_seen": 630884048, "step": 10390, "train_runtime": 135558.9181, "train_tokens_per_second": 4653.947 }, { "epoch": 1.3258928571428572, "grad_norm": 0.6523988729726404, "learning_rate": 2.5516512471437783e-06, "loss": 0.2595228910446167, "num_input_tokens_seen": 631185680, "step": 10395, "train_runtime": 135630.3377, "train_tokens_per_second": 4653.72 }, { "epoch": 1.3265306122448979, "grad_norm": 0.6408525997044796, "learning_rate": 2.547285161810634e-06, "loss": 0.24489250183105468, "num_input_tokens_seen": 631496624, "step": 10400, "train_runtime": 135693.988, "train_tokens_per_second": 4653.829 }, { "epoch": 1.3271683673469388, "grad_norm": 0.6287652104536363, "learning_rate": 2.5429215379481267e-06, "loss": 0.23495521545410156, "num_input_tokens_seen": 631786144, "step": 10405, "train_runtime": 135751.3601, "train_tokens_per_second": 4653.995 }, { "epoch": 1.3278061224489797, "grad_norm": 0.749636468899271, "learning_rate": 2.5385603799354574e-06, "loss": 0.25196335315704343, "num_input_tokens_seen": 632093448, "step": 10410, "train_runtime": 135826.3662, "train_tokens_per_second": 4653.687 }, { "epoch": 1.3284438775510203, "grad_norm": 0.6425794870646088, "learning_rate": 2.534201692149354e-06, "loss": 0.2630856275558472, "num_input_tokens_seen": 632396136, "step": 10415, "train_runtime": 135882.1028, "train_tokens_per_second": 4654.006 }, { "epoch": 1.3290816326530612, "grad_norm": 0.6860730297327605, "learning_rate": 2.5298454789640636e-06, "loss": 0.2595140218734741, "num_input_tokens_seen": 632701096, "step": 10420, "train_runtime": 135941.9066, "train_tokens_per_second": 4654.202 }, { "epoch": 1.3297193877551021, "grad_norm": 0.6770836255647433, "learning_rate": 2.5254917447513503e-06, "loss": 0.24976706504821777, "num_input_tokens_seen": 632999184, "step": 10425, "train_runtime": 136015.0857, "train_tokens_per_second": 4653.89 }, { "epoch": 1.3303571428571428, "grad_norm": 0.6479162926817887, "learning_rate": 2.5211404938804917e-06, "loss": 0.25724124908447266, "num_input_tokens_seen": 633291624, "step": 10430, "train_runtime": 136085.2051, "train_tokens_per_second": 4653.641 }, { "epoch": 1.3309948979591837, "grad_norm": 0.6257966867323908, "learning_rate": 2.5167917307182675e-06, "loss": 0.24438064098358153, "num_input_tokens_seen": 633604200, "step": 10435, "train_runtime": 136156.77, "train_tokens_per_second": 4653.49 }, { "epoch": 1.3316326530612246, "grad_norm": 0.6305823586995404, "learning_rate": 2.5124454596289704e-06, "loss": 0.2546777009963989, "num_input_tokens_seen": 633907848, "step": 10440, "train_runtime": 136218.761, "train_tokens_per_second": 4653.602 }, { "epoch": 1.3322704081632653, "grad_norm": 0.70414678915359, "learning_rate": 2.508101684974387e-06, "loss": 0.2731082677841187, "num_input_tokens_seen": 634214488, "step": 10445, "train_runtime": 136277.663, "train_tokens_per_second": 4653.84 }, { "epoch": 1.3329081632653061, "grad_norm": 0.7045600039751864, "learning_rate": 2.5037604111137935e-06, "loss": 0.25175440311431885, "num_input_tokens_seen": 634512472, "step": 10450, "train_runtime": 136334.7747, "train_tokens_per_second": 4654.077 }, { "epoch": 1.333545918367347, "grad_norm": 0.6982239045524724, "learning_rate": 2.4994216424039637e-06, "loss": 0.26717848777770997, "num_input_tokens_seen": 634811112, "step": 10455, "train_runtime": 136402.5798, "train_tokens_per_second": 4653.952 }, { "epoch": 1.3341836734693877, "grad_norm": 0.7241038788461323, "learning_rate": 2.495085383199159e-06, "loss": 0.24141874313354492, "num_input_tokens_seen": 635107792, "step": 10460, "train_runtime": 136470.642, "train_tokens_per_second": 4653.805 }, { "epoch": 1.3348214285714286, "grad_norm": 0.5690722032425513, "learning_rate": 2.4907516378511137e-06, "loss": 0.2344221591949463, "num_input_tokens_seen": 635413496, "step": 10465, "train_runtime": 136536.9124, "train_tokens_per_second": 4653.785 }, { "epoch": 1.3354591836734695, "grad_norm": 0.6611650346510646, "learning_rate": 2.486420410709043e-06, "loss": 0.2744720935821533, "num_input_tokens_seen": 635717640, "step": 10470, "train_runtime": 136602.6341, "train_tokens_per_second": 4653.773 }, { "epoch": 1.3360969387755102, "grad_norm": 0.6479139327116292, "learning_rate": 2.482091706119642e-06, "loss": 0.2511033296585083, "num_input_tokens_seen": 636030608, "step": 10475, "train_runtime": 136662.1909, "train_tokens_per_second": 4654.035 }, { "epoch": 1.336734693877551, "grad_norm": 0.678178923807823, "learning_rate": 2.4777655284270623e-06, "loss": 0.25283474922180177, "num_input_tokens_seen": 636337536, "step": 10480, "train_runtime": 136732.7215, "train_tokens_per_second": 4653.879 }, { "epoch": 1.337372448979592, "grad_norm": 0.6802857394272956, "learning_rate": 2.473441881972927e-06, "loss": 0.2502155065536499, "num_input_tokens_seen": 636632528, "step": 10485, "train_runtime": 136801.8893, "train_tokens_per_second": 4653.682 }, { "epoch": 1.3380102040816326, "grad_norm": 0.7264578611546987, "learning_rate": 2.4691207710963185e-06, "loss": 0.27263717651367186, "num_input_tokens_seen": 636940976, "step": 10490, "train_runtime": 136871.2442, "train_tokens_per_second": 4653.578 }, { "epoch": 1.3386479591836735, "grad_norm": 0.6467516275814501, "learning_rate": 2.464802200133772e-06, "loss": 0.25528175830841066, "num_input_tokens_seen": 637252544, "step": 10495, "train_runtime": 136937.207, "train_tokens_per_second": 4653.611 }, { "epoch": 1.3392857142857144, "grad_norm": 0.7639110842016443, "learning_rate": 2.4604861734192755e-06, "loss": 0.2494715690612793, "num_input_tokens_seen": 637538400, "step": 10500, "train_runtime": 137009.1181, "train_tokens_per_second": 4653.255 }, { "epoch": 1.339923469387755, "grad_norm": 0.6978560512446076, "learning_rate": 2.456172695284263e-06, "loss": 0.2574897289276123, "num_input_tokens_seen": 637829512, "step": 10505, "train_runtime": 137074.4399, "train_tokens_per_second": 4653.162 }, { "epoch": 1.340561224489796, "grad_norm": 0.6433184043998549, "learning_rate": 2.4518617700576116e-06, "loss": 0.25566754341125486, "num_input_tokens_seen": 638144032, "step": 10510, "train_runtime": 137126.6969, "train_tokens_per_second": 4653.682 }, { "epoch": 1.3411989795918369, "grad_norm": 0.6613905419455521, "learning_rate": 2.447553402065637e-06, "loss": 0.23982324600219726, "num_input_tokens_seen": 638449872, "step": 10515, "train_runtime": 137195.1138, "train_tokens_per_second": 4653.59 }, { "epoch": 1.3418367346938775, "grad_norm": 0.6470415769391574, "learning_rate": 2.4432475956320824e-06, "loss": 0.24281463623046876, "num_input_tokens_seen": 638754928, "step": 10520, "train_runtime": 137261.0735, "train_tokens_per_second": 4653.577 }, { "epoch": 1.3424744897959184, "grad_norm": 0.6013572112951462, "learning_rate": 2.4389443550781304e-06, "loss": 0.2543042182922363, "num_input_tokens_seen": 639060400, "step": 10525, "train_runtime": 137321.1544, "train_tokens_per_second": 4653.765 }, { "epoch": 1.343112244897959, "grad_norm": 0.615071899800615, "learning_rate": 2.4346436847223836e-06, "loss": 0.24138739109039306, "num_input_tokens_seen": 639352320, "step": 10530, "train_runtime": 137385.6249, "train_tokens_per_second": 4653.706 }, { "epoch": 1.34375, "grad_norm": 0.6328537978193586, "learning_rate": 2.4303455888808618e-06, "loss": 0.253510856628418, "num_input_tokens_seen": 639673216, "step": 10535, "train_runtime": 137453.9003, "train_tokens_per_second": 4653.729 }, { "epoch": 1.344387755102041, "grad_norm": 0.651441410672442, "learning_rate": 2.4260500718670036e-06, "loss": 0.2616002559661865, "num_input_tokens_seen": 639980632, "step": 10540, "train_runtime": 137531.0913, "train_tokens_per_second": 4653.352 }, { "epoch": 1.3450255102040816, "grad_norm": 0.7015196917719295, "learning_rate": 2.4217571379916673e-06, "loss": 0.2384871006011963, "num_input_tokens_seen": 640294192, "step": 10545, "train_runtime": 137599.4791, "train_tokens_per_second": 4653.318 }, { "epoch": 1.3456632653061225, "grad_norm": 0.6998072802468709, "learning_rate": 2.4174667915631038e-06, "loss": 0.27579896450042723, "num_input_tokens_seen": 640588232, "step": 10550, "train_runtime": 137663.6147, "train_tokens_per_second": 4653.286 }, { "epoch": 1.3463010204081631, "grad_norm": 0.7016327537117313, "learning_rate": 2.413179036886978e-06, "loss": 0.2730722188949585, "num_input_tokens_seen": 640899440, "step": 10555, "train_runtime": 137716.4348, "train_tokens_per_second": 4653.761 }, { "epoch": 1.346938775510204, "grad_norm": 0.5847915314701873, "learning_rate": 2.408893878266355e-06, "loss": 0.26175551414489745, "num_input_tokens_seen": 641202424, "step": 10560, "train_runtime": 137776.9655, "train_tokens_per_second": 4653.916 }, { "epoch": 1.347576530612245, "grad_norm": 0.6487385023535115, "learning_rate": 2.404611320001686e-06, "loss": 0.263177752494812, "num_input_tokens_seen": 641499128, "step": 10565, "train_runtime": 137851.8385, "train_tokens_per_second": 4653.541 }, { "epoch": 1.3482142857142856, "grad_norm": 0.6904179368056829, "learning_rate": 2.4003313663908182e-06, "loss": 0.2511106491088867, "num_input_tokens_seen": 641811424, "step": 10570, "train_runtime": 137918.2592, "train_tokens_per_second": 4653.564 }, { "epoch": 1.3488520408163265, "grad_norm": 0.7734205389206501, "learning_rate": 2.3960540217289856e-06, "loss": 0.2438887119293213, "num_input_tokens_seen": 642110896, "step": 10575, "train_runtime": 137975.1196, "train_tokens_per_second": 4653.817 }, { "epoch": 1.3494897959183674, "grad_norm": 0.6849424327462471, "learning_rate": 2.3917792903088013e-06, "loss": 0.2553779125213623, "num_input_tokens_seen": 642416424, "step": 10580, "train_runtime": 138026.6713, "train_tokens_per_second": 4654.292 }, { "epoch": 1.350127551020408, "grad_norm": 0.682346840735774, "learning_rate": 2.387507176420256e-06, "loss": 0.2522465229034424, "num_input_tokens_seen": 642710552, "step": 10585, "train_runtime": 138101.3125, "train_tokens_per_second": 4653.906 }, { "epoch": 1.350765306122449, "grad_norm": 0.680619519077353, "learning_rate": 2.383237684350716e-06, "loss": 0.24289708137512206, "num_input_tokens_seen": 643003000, "step": 10590, "train_runtime": 138167.4873, "train_tokens_per_second": 4653.794 }, { "epoch": 1.3514030612244898, "grad_norm": 0.7758551088163684, "learning_rate": 2.378970818384914e-06, "loss": 0.2685849666595459, "num_input_tokens_seen": 643309952, "step": 10595, "train_runtime": 138237.0251, "train_tokens_per_second": 4653.673 }, { "epoch": 1.3520408163265305, "grad_norm": 0.6099978672505727, "learning_rate": 2.374706582804948e-06, "loss": 0.2731654167175293, "num_input_tokens_seen": 643622504, "step": 10600, "train_runtime": 138308.5133, "train_tokens_per_second": 4653.528 }, { "epoch": 1.3526785714285714, "grad_norm": 0.6176015901979797, "learning_rate": 2.3704449818902763e-06, "loss": 0.23430299758911133, "num_input_tokens_seen": 643922296, "step": 10605, "train_runtime": 138371.2462, "train_tokens_per_second": 4653.585 }, { "epoch": 1.3533163265306123, "grad_norm": 0.6312026294529185, "learning_rate": 2.366186019917713e-06, "loss": 0.26416237354278566, "num_input_tokens_seen": 644226648, "step": 10610, "train_runtime": 138447.6608, "train_tokens_per_second": 4653.214 }, { "epoch": 1.353954081632653, "grad_norm": 0.5697447749801084, "learning_rate": 2.3619297011614236e-06, "loss": 0.24305322170257568, "num_input_tokens_seen": 644529424, "step": 10615, "train_runtime": 138517.5458, "train_tokens_per_second": 4653.053 }, { "epoch": 1.3545918367346939, "grad_norm": 0.703943199557105, "learning_rate": 2.3576760298929236e-06, "loss": 0.27020907402038574, "num_input_tokens_seen": 644823984, "step": 10620, "train_runtime": 138580.3714, "train_tokens_per_second": 4653.069 }, { "epoch": 1.3552295918367347, "grad_norm": 0.6371976780201754, "learning_rate": 2.353425010381063e-06, "loss": 0.2463529586791992, "num_input_tokens_seen": 645127368, "step": 10625, "train_runtime": 138648.3282, "train_tokens_per_second": 4652.976 }, { "epoch": 1.3558673469387754, "grad_norm": 0.6849575221807079, "learning_rate": 2.349176646892045e-06, "loss": 0.2500694990158081, "num_input_tokens_seen": 645431280, "step": 10630, "train_runtime": 138714.7105, "train_tokens_per_second": 4652.94 }, { "epoch": 1.3565051020408163, "grad_norm": 0.6739018605585745, "learning_rate": 2.344930943689393e-06, "loss": 0.25265026092529297, "num_input_tokens_seen": 645752504, "step": 10635, "train_runtime": 138767.4436, "train_tokens_per_second": 4653.487 }, { "epoch": 1.3571428571428572, "grad_norm": 0.7320819590462384, "learning_rate": 2.3406879050339664e-06, "loss": 0.25464611053466796, "num_input_tokens_seen": 646053008, "step": 10640, "train_runtime": 138836.5189, "train_tokens_per_second": 4653.336 }, { "epoch": 1.3577806122448979, "grad_norm": 0.6326393653192357, "learning_rate": 2.3364475351839573e-06, "loss": 0.2856419086456299, "num_input_tokens_seen": 646363800, "step": 10645, "train_runtime": 138902.8072, "train_tokens_per_second": 4653.353 }, { "epoch": 1.3584183673469388, "grad_norm": 0.6238707170767187, "learning_rate": 2.3322098383948666e-06, "loss": 0.25574593544006347, "num_input_tokens_seen": 646662400, "step": 10650, "train_runtime": 138981.0839, "train_tokens_per_second": 4652.881 }, { "epoch": 1.3590561224489797, "grad_norm": 0.7119462373413934, "learning_rate": 2.327974818919521e-06, "loss": 0.2599836826324463, "num_input_tokens_seen": 646961552, "step": 10655, "train_runtime": 139043.9753, "train_tokens_per_second": 4652.928 }, { "epoch": 1.3596938775510203, "grad_norm": 0.6576389455281506, "learning_rate": 2.323742481008059e-06, "loss": 0.26797871589660643, "num_input_tokens_seen": 647269032, "step": 10660, "train_runtime": 139098.9088, "train_tokens_per_second": 4653.301 }, { "epoch": 1.3603316326530612, "grad_norm": 0.6732629641000283, "learning_rate": 2.3195128289079265e-06, "loss": 0.2578679323196411, "num_input_tokens_seen": 647568480, "step": 10665, "train_runtime": 139159.9933, "train_tokens_per_second": 4653.41 }, { "epoch": 1.3609693877551021, "grad_norm": 0.6746025544320785, "learning_rate": 2.315285866863875e-06, "loss": 0.27208359241485597, "num_input_tokens_seen": 647874144, "step": 10670, "train_runtime": 139222.0315, "train_tokens_per_second": 4653.532 }, { "epoch": 1.3616071428571428, "grad_norm": 0.9209266628908638, "learning_rate": 2.3110615991179556e-06, "loss": 0.24118657112121583, "num_input_tokens_seen": 648176336, "step": 10675, "train_runtime": 139276.9936, "train_tokens_per_second": 4653.865 }, { "epoch": 1.3622448979591837, "grad_norm": 0.6300570060400691, "learning_rate": 2.3068400299095172e-06, "loss": 0.2557355880737305, "num_input_tokens_seen": 648491096, "step": 10680, "train_runtime": 139343.1151, "train_tokens_per_second": 4653.916 }, { "epoch": 1.3628826530612246, "grad_norm": 0.6171430512983377, "learning_rate": 2.302621163475198e-06, "loss": 0.24427404403686523, "num_input_tokens_seen": 648799472, "step": 10685, "train_runtime": 139413.2653, "train_tokens_per_second": 4653.786 }, { "epoch": 1.3635204081632653, "grad_norm": 0.7335552082699521, "learning_rate": 2.2984050040489266e-06, "loss": 0.2685335636138916, "num_input_tokens_seen": 649093176, "step": 10690, "train_runtime": 139479.0576, "train_tokens_per_second": 4653.696 }, { "epoch": 1.3641581632653061, "grad_norm": 0.7072866477484043, "learning_rate": 2.2941915558619123e-06, "loss": 0.24063777923583984, "num_input_tokens_seen": 649381256, "step": 10695, "train_runtime": 139542.8225, "train_tokens_per_second": 4653.634 }, { "epoch": 1.364795918367347, "grad_norm": 0.6944594337005354, "learning_rate": 2.2899808231426447e-06, "loss": 0.25992212295532224, "num_input_tokens_seen": 649682888, "step": 10700, "train_runtime": 139609.0242, "train_tokens_per_second": 4653.588 }, { "epoch": 1.3654336734693877, "grad_norm": 0.6766058412661532, "learning_rate": 2.28577281011689e-06, "loss": 0.26885318756103516, "num_input_tokens_seen": 649995064, "step": 10705, "train_runtime": 139660.4965, "train_tokens_per_second": 4654.108 }, { "epoch": 1.3660714285714286, "grad_norm": 0.7018897965557243, "learning_rate": 2.281567521007678e-06, "loss": 0.23794171810150147, "num_input_tokens_seen": 650299792, "step": 10710, "train_runtime": 139727.3155, "train_tokens_per_second": 4654.063 }, { "epoch": 1.3667091836734695, "grad_norm": 0.6458270881545367, "learning_rate": 2.277364960035316e-06, "loss": 0.24845671653747559, "num_input_tokens_seen": 650599768, "step": 10715, "train_runtime": 139795.6731, "train_tokens_per_second": 4653.934 }, { "epoch": 1.3673469387755102, "grad_norm": 0.6378253214235245, "learning_rate": 2.2731651314173665e-06, "loss": 0.2722214937210083, "num_input_tokens_seen": 650901360, "step": 10720, "train_runtime": 139861.637, "train_tokens_per_second": 4653.895 }, { "epoch": 1.367984693877551, "grad_norm": 0.6439971278285374, "learning_rate": 2.2689680393686457e-06, "loss": 0.25092372894287107, "num_input_tokens_seen": 651208024, "step": 10725, "train_runtime": 139931.0735, "train_tokens_per_second": 4653.777 }, { "epoch": 1.368622448979592, "grad_norm": 0.67511136748276, "learning_rate": 2.2647736881012337e-06, "loss": 0.26037437915802003, "num_input_tokens_seen": 651509616, "step": 10730, "train_runtime": 139994.8024, "train_tokens_per_second": 4653.813 }, { "epoch": 1.3692602040816326, "grad_norm": 0.6325514970286513, "learning_rate": 2.2605820818244563e-06, "loss": 0.2595388650894165, "num_input_tokens_seen": 651812552, "step": 10735, "train_runtime": 140062.0458, "train_tokens_per_second": 4653.741 }, { "epoch": 1.3698979591836735, "grad_norm": 0.666538231347289, "learning_rate": 2.256393224744878e-06, "loss": 0.247703218460083, "num_input_tokens_seen": 652123936, "step": 10740, "train_runtime": 140115.296, "train_tokens_per_second": 4654.195 }, { "epoch": 1.3705357142857144, "grad_norm": 0.6245066028156089, "learning_rate": 2.252207121066311e-06, "loss": 0.2506424903869629, "num_input_tokens_seen": 652436208, "step": 10745, "train_runtime": 140172.2333, "train_tokens_per_second": 4654.532 }, { "epoch": 1.371173469387755, "grad_norm": 0.6897518255700242, "learning_rate": 2.248023774989804e-06, "loss": 0.2539947032928467, "num_input_tokens_seen": 652728840, "step": 10750, "train_runtime": 140244.505, "train_tokens_per_second": 4654.22 }, { "epoch": 1.371811224489796, "grad_norm": 0.6652062345999039, "learning_rate": 2.2438431907136365e-06, "loss": 0.25039238929748536, "num_input_tokens_seen": 653037248, "step": 10755, "train_runtime": 140317.5554, "train_tokens_per_second": 4653.995 }, { "epoch": 1.3724489795918369, "grad_norm": 0.6998307506209887, "learning_rate": 2.2396653724333167e-06, "loss": 0.2588667392730713, "num_input_tokens_seen": 653331840, "step": 10760, "train_runtime": 140382.2853, "train_tokens_per_second": 4653.948 }, { "epoch": 1.3730867346938775, "grad_norm": 0.7066375590823599, "learning_rate": 2.235490324341577e-06, "loss": 0.25351243019104003, "num_input_tokens_seen": 653619864, "step": 10765, "train_runtime": 140447.3579, "train_tokens_per_second": 4653.842 }, { "epoch": 1.3737244897959184, "grad_norm": 0.6894289922417881, "learning_rate": 2.2313180506283695e-06, "loss": 0.24595603942871094, "num_input_tokens_seen": 653918392, "step": 10770, "train_runtime": 140515.882, "train_tokens_per_second": 4653.697 }, { "epoch": 1.374362244897959, "grad_norm": 0.6348190895126634, "learning_rate": 2.227148555480863e-06, "loss": 0.25271408557891845, "num_input_tokens_seen": 654231808, "step": 10775, "train_runtime": 140578.6986, "train_tokens_per_second": 4653.847 }, { "epoch": 1.375, "grad_norm": 0.7041985937569952, "learning_rate": 2.222981843083436e-06, "loss": 0.2630213022232056, "num_input_tokens_seen": 654537768, "step": 10780, "train_runtime": 140648.6004, "train_tokens_per_second": 4653.71 }, { "epoch": 1.375637755102041, "grad_norm": 0.6473438090805954, "learning_rate": 2.2188179176176767e-06, "loss": 0.24607279300689697, "num_input_tokens_seen": 654839688, "step": 10785, "train_runtime": 140706.8133, "train_tokens_per_second": 4653.93 }, { "epoch": 1.3762755102040816, "grad_norm": 0.7402374340188662, "learning_rate": 2.2146567832623737e-06, "loss": 0.2657738924026489, "num_input_tokens_seen": 655155736, "step": 10790, "train_runtime": 140771.7221, "train_tokens_per_second": 4654.029 }, { "epoch": 1.3769132653061225, "grad_norm": 0.6499488706520828, "learning_rate": 2.2104984441935167e-06, "loss": 0.26737127304077146, "num_input_tokens_seen": 655448320, "step": 10795, "train_runtime": 140838.6502, "train_tokens_per_second": 4653.895 }, { "epoch": 1.3775510204081631, "grad_norm": 0.7711023442574942, "learning_rate": 2.20634290458429e-06, "loss": 0.2794210910797119, "num_input_tokens_seen": 655752952, "step": 10800, "train_runtime": 140908.7662, "train_tokens_per_second": 4653.741 }, { "epoch": 1.378188775510204, "grad_norm": 0.6198423134424618, "learning_rate": 2.2021901686050684e-06, "loss": 0.2476513147354126, "num_input_tokens_seen": 656054200, "step": 10805, "train_runtime": 140970.6449, "train_tokens_per_second": 4653.836 }, { "epoch": 1.378826530612245, "grad_norm": 0.6489766549170461, "learning_rate": 2.1980402404234074e-06, "loss": 0.26006624698638914, "num_input_tokens_seen": 656343272, "step": 10810, "train_runtime": 141034.9838, "train_tokens_per_second": 4653.762 }, { "epoch": 1.3794642857142856, "grad_norm": 0.6124169753289999, "learning_rate": 2.1938931242040557e-06, "loss": 0.23834261894226075, "num_input_tokens_seen": 656653912, "step": 10815, "train_runtime": 141102.7794, "train_tokens_per_second": 4653.728 }, { "epoch": 1.3801020408163265, "grad_norm": 0.6864530445874658, "learning_rate": 2.1897488241089336e-06, "loss": 0.24825513362884521, "num_input_tokens_seen": 656939456, "step": 10820, "train_runtime": 141170.4554, "train_tokens_per_second": 4653.519 }, { "epoch": 1.3807397959183674, "grad_norm": 0.6558066319681096, "learning_rate": 2.1856073442971322e-06, "loss": 0.23897290229797363, "num_input_tokens_seen": 657245400, "step": 10825, "train_runtime": 141246.3502, "train_tokens_per_second": 4653.185 }, { "epoch": 1.381377551020408, "grad_norm": 0.6315243823307106, "learning_rate": 2.181468688924916e-06, "loss": 0.25669231414794924, "num_input_tokens_seen": 657542320, "step": 10830, "train_runtime": 141315.8761, "train_tokens_per_second": 4652.997 }, { "epoch": 1.382015306122449, "grad_norm": 0.679056503801347, "learning_rate": 2.1773328621457196e-06, "loss": 0.266129207611084, "num_input_tokens_seen": 657848208, "step": 10835, "train_runtime": 141388.7871, "train_tokens_per_second": 4652.761 }, { "epoch": 1.3826530612244898, "grad_norm": 0.6481972340374259, "learning_rate": 2.1731998681101293e-06, "loss": 0.2581286907196045, "num_input_tokens_seen": 658141328, "step": 10840, "train_runtime": 141452.578, "train_tokens_per_second": 4652.735 }, { "epoch": 1.3832908163265305, "grad_norm": 0.5779596087218133, "learning_rate": 2.169069710965892e-06, "loss": 0.2503084659576416, "num_input_tokens_seen": 658449416, "step": 10845, "train_runtime": 141518.4324, "train_tokens_per_second": 4652.747 }, { "epoch": 1.3839285714285714, "grad_norm": 0.6133966098993952, "learning_rate": 2.1649423948579157e-06, "loss": 0.2516158580780029, "num_input_tokens_seen": 658752104, "step": 10850, "train_runtime": 141584.6078, "train_tokens_per_second": 4652.71 }, { "epoch": 1.3845663265306123, "grad_norm": 0.767753818892085, "learning_rate": 2.160817923928244e-06, "loss": 0.24149253368377685, "num_input_tokens_seen": 659068832, "step": 10855, "train_runtime": 141644.9478, "train_tokens_per_second": 4652.964 }, { "epoch": 1.385204081632653, "grad_norm": 0.592673489479143, "learning_rate": 2.156696302316074e-06, "loss": 0.24596431255340576, "num_input_tokens_seen": 659370344, "step": 10860, "train_runtime": 141708.6494, "train_tokens_per_second": 4653.0 }, { "epoch": 1.3858418367346939, "grad_norm": 0.6587773413475897, "learning_rate": 2.1525775341577404e-06, "loss": 0.2650430679321289, "num_input_tokens_seen": 659675272, "step": 10865, "train_runtime": 141780.046, "train_tokens_per_second": 4652.808 }, { "epoch": 1.3864795918367347, "grad_norm": 0.6304895019907499, "learning_rate": 2.1484616235867152e-06, "loss": 0.2624351501464844, "num_input_tokens_seen": 659984064, "step": 10870, "train_runtime": 141839.4022, "train_tokens_per_second": 4653.038 }, { "epoch": 1.3871173469387754, "grad_norm": 0.7080954736257979, "learning_rate": 2.1443485747336014e-06, "loss": 0.2529263973236084, "num_input_tokens_seen": 660283112, "step": 10875, "train_runtime": 141912.2568, "train_tokens_per_second": 4652.756 }, { "epoch": 1.3877551020408163, "grad_norm": 0.7192499873806749, "learning_rate": 2.140238391726131e-06, "loss": 0.23541016578674318, "num_input_tokens_seen": 660575688, "step": 10880, "train_runtime": 141975.9961, "train_tokens_per_second": 4652.728 }, { "epoch": 1.3883928571428572, "grad_norm": 0.6555123158847614, "learning_rate": 2.1361310786891596e-06, "loss": 0.24966943264007568, "num_input_tokens_seen": 660891000, "step": 10885, "train_runtime": 142026.5793, "train_tokens_per_second": 4653.291 }, { "epoch": 1.3890306122448979, "grad_norm": 0.6341630278590069, "learning_rate": 2.1320266397446655e-06, "loss": 0.24406077861785888, "num_input_tokens_seen": 661181296, "step": 10890, "train_runtime": 142100.5999, "train_tokens_per_second": 4652.91 }, { "epoch": 1.3896683673469388, "grad_norm": 0.6522383502190727, "learning_rate": 2.1279250790117327e-06, "loss": 0.24395380020141602, "num_input_tokens_seen": 661486088, "step": 10895, "train_runtime": 142172.7724, "train_tokens_per_second": 4652.692 }, { "epoch": 1.3903061224489797, "grad_norm": 0.6315288970380799, "learning_rate": 2.123826400606571e-06, "loss": 0.24505012035369872, "num_input_tokens_seen": 661776696, "step": 10900, "train_runtime": 142246.1174, "train_tokens_per_second": 4652.336 }, { "epoch": 1.3909438775510203, "grad_norm": 0.7412865776148488, "learning_rate": 2.119730608642489e-06, "loss": 0.2468052625656128, "num_input_tokens_seen": 662075896, "step": 10905, "train_runtime": 142312.876, "train_tokens_per_second": 4652.256 }, { "epoch": 1.3915816326530612, "grad_norm": 0.7447682594698796, "learning_rate": 2.1156377072298972e-06, "loss": 0.2510690450668335, "num_input_tokens_seen": 662382448, "step": 10910, "train_runtime": 142384.1467, "train_tokens_per_second": 4652.08 }, { "epoch": 1.3922193877551021, "grad_norm": 0.6465834278051001, "learning_rate": 2.111547700476308e-06, "loss": 0.26249260902404786, "num_input_tokens_seen": 662690784, "step": 10915, "train_runtime": 142439.5463, "train_tokens_per_second": 4652.435 }, { "epoch": 1.3928571428571428, "grad_norm": 0.7033734542030893, "learning_rate": 2.107460592486333e-06, "loss": 0.268072772026062, "num_input_tokens_seen": 662980848, "step": 10920, "train_runtime": 142504.2991, "train_tokens_per_second": 4652.357 }, { "epoch": 1.3934948979591837, "grad_norm": 0.6292468927908194, "learning_rate": 2.1033763873616675e-06, "loss": 0.24447717666625976, "num_input_tokens_seen": 663286584, "step": 10925, "train_runtime": 142579.6955, "train_tokens_per_second": 4652.041 }, { "epoch": 1.3941326530612246, "grad_norm": 0.5931620942430261, "learning_rate": 2.0992950892010948e-06, "loss": 0.2554739475250244, "num_input_tokens_seen": 663595984, "step": 10930, "train_runtime": 142638.9585, "train_tokens_per_second": 4652.277 }, { "epoch": 1.3947704081632653, "grad_norm": 0.6163909609686915, "learning_rate": 2.0952167021004887e-06, "loss": 0.2546344995498657, "num_input_tokens_seen": 663913360, "step": 10935, "train_runtime": 142709.5336, "train_tokens_per_second": 4652.2 }, { "epoch": 1.3954081632653061, "grad_norm": 0.5882756757092259, "learning_rate": 2.0911412301527895e-06, "loss": 0.248978590965271, "num_input_tokens_seen": 664212632, "step": 10940, "train_runtime": 142778.2066, "train_tokens_per_second": 4652.059 }, { "epoch": 1.396045918367347, "grad_norm": 0.6274000873800156, "learning_rate": 2.08706867744802e-06, "loss": 0.24985527992248535, "num_input_tokens_seen": 664511248, "step": 10945, "train_runtime": 142842.6126, "train_tokens_per_second": 4652.052 }, { "epoch": 1.3966836734693877, "grad_norm": 0.6184724192923571, "learning_rate": 2.0829990480732715e-06, "loss": 0.25580124855041503, "num_input_tokens_seen": 664799920, "step": 10950, "train_runtime": 142908.8862, "train_tokens_per_second": 4651.915 }, { "epoch": 1.3973214285714286, "grad_norm": 0.7150837740716233, "learning_rate": 2.0789323461127015e-06, "loss": 0.258500075340271, "num_input_tokens_seen": 665103792, "step": 10955, "train_runtime": 142971.6498, "train_tokens_per_second": 4651.998 }, { "epoch": 1.3979591836734695, "grad_norm": 0.7029402338819539, "learning_rate": 2.0748685756475286e-06, "loss": 0.2610204219818115, "num_input_tokens_seen": 665399664, "step": 10960, "train_runtime": 143034.9047, "train_tokens_per_second": 4652.009 }, { "epoch": 1.3985969387755102, "grad_norm": 0.6880501359533734, "learning_rate": 2.0708077407560305e-06, "loss": 0.24911460876464844, "num_input_tokens_seen": 665695688, "step": 10965, "train_runtime": 143093.5604, "train_tokens_per_second": 4652.171 }, { "epoch": 1.399234693877551, "grad_norm": 0.7276087711781211, "learning_rate": 2.06674984551354e-06, "loss": 0.2696921110153198, "num_input_tokens_seen": 666000336, "step": 10970, "train_runtime": 143150.2238, "train_tokens_per_second": 4652.458 }, { "epoch": 1.399872448979592, "grad_norm": 0.6611084736675233, "learning_rate": 2.062694893992436e-06, "loss": 0.24796009063720703, "num_input_tokens_seen": 666303304, "step": 10975, "train_runtime": 143209.2762, "train_tokens_per_second": 4652.655 }, { "epoch": 1.4005102040816326, "grad_norm": 0.6789059871274964, "learning_rate": 2.0586428902621474e-06, "loss": 0.24918723106384277, "num_input_tokens_seen": 666622728, "step": 10980, "train_runtime": 143254.657, "train_tokens_per_second": 4653.411 }, { "epoch": 1.4011479591836735, "grad_norm": 0.6725874595012141, "learning_rate": 2.0545938383891427e-06, "loss": 0.2662821292877197, "num_input_tokens_seen": 666917368, "step": 10985, "train_runtime": 143316.1471, "train_tokens_per_second": 4653.47 }, { "epoch": 1.4017857142857144, "grad_norm": 0.653781330360485, "learning_rate": 2.050547742436929e-06, "loss": 0.23631629943847657, "num_input_tokens_seen": 667217976, "step": 10990, "train_runtime": 143388.8015, "train_tokens_per_second": 4653.208 }, { "epoch": 1.402423469387755, "grad_norm": 0.6200075478649029, "learning_rate": 2.0465046064660437e-06, "loss": 0.2509471416473389, "num_input_tokens_seen": 667515672, "step": 10995, "train_runtime": 143458.2482, "train_tokens_per_second": 4653.031 }, { "epoch": 1.403061224489796, "grad_norm": 0.604581929551146, "learning_rate": 2.0424644345340554e-06, "loss": 0.24612851142883302, "num_input_tokens_seen": 667817512, "step": 11000, "train_runtime": 143523.1041, "train_tokens_per_second": 4653.031 }, { "epoch": 1.4036989795918369, "grad_norm": 0.678247158757741, "learning_rate": 2.038427230695565e-06, "loss": 0.24648277759552, "num_input_tokens_seen": 668120112, "step": 11005, "train_runtime": 143592.6223, "train_tokens_per_second": 4652.886 }, { "epoch": 1.4043367346938775, "grad_norm": 0.6286842547424614, "learning_rate": 2.034392999002182e-06, "loss": 0.2571901321411133, "num_input_tokens_seen": 668429272, "step": 11010, "train_runtime": 143668.67, "train_tokens_per_second": 4652.575 }, { "epoch": 1.4049744897959184, "grad_norm": 0.6550917364941298, "learning_rate": 2.0303617435025407e-06, "loss": 0.24138829708099366, "num_input_tokens_seen": 668739184, "step": 11015, "train_runtime": 143739.0058, "train_tokens_per_second": 4652.454 }, { "epoch": 1.405612244897959, "grad_norm": 0.6006425158343822, "learning_rate": 2.0263334682422923e-06, "loss": 0.2457888126373291, "num_input_tokens_seen": 669040392, "step": 11020, "train_runtime": 143815.1956, "train_tokens_per_second": 4652.084 }, { "epoch": 1.40625, "grad_norm": 0.7155943726564788, "learning_rate": 2.0223081772640867e-06, "loss": 0.2669305086135864, "num_input_tokens_seen": 669337248, "step": 11025, "train_runtime": 143873.3566, "train_tokens_per_second": 4652.267 }, { "epoch": 1.406887755102041, "grad_norm": 0.5918915902802782, "learning_rate": 2.0182858746075873e-06, "loss": 0.24875364303588868, "num_input_tokens_seen": 669647448, "step": 11030, "train_runtime": 143939.8178, "train_tokens_per_second": 4652.274 }, { "epoch": 1.4075255102040816, "grad_norm": 0.6224308265696982, "learning_rate": 2.014266564309455e-06, "loss": 0.2550758123397827, "num_input_tokens_seen": 669939544, "step": 11035, "train_runtime": 144002.6143, "train_tokens_per_second": 4652.273 }, { "epoch": 1.4081632653061225, "grad_norm": 0.7045550189140467, "learning_rate": 2.010250250403349e-06, "loss": 0.2659616947174072, "num_input_tokens_seen": 670236248, "step": 11040, "train_runtime": 144060.0709, "train_tokens_per_second": 4652.478 }, { "epoch": 1.4088010204081631, "grad_norm": 0.6146701009290687, "learning_rate": 2.00623693691992e-06, "loss": 0.2394233226776123, "num_input_tokens_seen": 670550248, "step": 11045, "train_runtime": 144126.109, "train_tokens_per_second": 4652.524 }, { "epoch": 1.409438775510204, "grad_norm": 0.6217305449765971, "learning_rate": 2.0022266278868086e-06, "loss": 0.2595332145690918, "num_input_tokens_seen": 670855080, "step": 11050, "train_runtime": 144187.8508, "train_tokens_per_second": 4652.646 }, { "epoch": 1.410076530612245, "grad_norm": 0.7312246103580766, "learning_rate": 1.9982193273286404e-06, "loss": 0.2402665615081787, "num_input_tokens_seen": 671159224, "step": 11055, "train_runtime": 144237.0253, "train_tokens_per_second": 4653.169 }, { "epoch": 1.4107142857142856, "grad_norm": 0.6980968981401449, "learning_rate": 1.9942150392670207e-06, "loss": 0.24990315437316896, "num_input_tokens_seen": 671456704, "step": 11060, "train_runtime": 144307.5285, "train_tokens_per_second": 4652.957 }, { "epoch": 1.4113520408163265, "grad_norm": 0.8088300387825774, "learning_rate": 1.990213767720533e-06, "loss": 0.2636767148971558, "num_input_tokens_seen": 671772664, "step": 11065, "train_runtime": 144366.5253, "train_tokens_per_second": 4653.244 }, { "epoch": 1.4119897959183674, "grad_norm": 0.6487090457377199, "learning_rate": 1.9862155167047324e-06, "loss": 0.26303236484527587, "num_input_tokens_seen": 672075568, "step": 11070, "train_runtime": 144433.1382, "train_tokens_per_second": 4653.195 }, { "epoch": 1.412627551020408, "grad_norm": 0.7040276445864658, "learning_rate": 1.982220290232143e-06, "loss": 0.2502783536911011, "num_input_tokens_seen": 672377576, "step": 11075, "train_runtime": 144500.5412, "train_tokens_per_second": 4653.115 }, { "epoch": 1.413265306122449, "grad_norm": 0.6810987286282223, "learning_rate": 1.9782280923122555e-06, "loss": 0.2444309711456299, "num_input_tokens_seen": 672674632, "step": 11080, "train_runtime": 144566.3023, "train_tokens_per_second": 4653.053 }, { "epoch": 1.4139030612244898, "grad_norm": 0.6463127960515297, "learning_rate": 1.9742389269515137e-06, "loss": 0.2458259105682373, "num_input_tokens_seen": 672988200, "step": 11085, "train_runtime": 144636.961, "train_tokens_per_second": 4652.948 }, { "epoch": 1.4145408163265305, "grad_norm": 0.6103837085208516, "learning_rate": 1.970252798153329e-06, "loss": 0.22437753677368164, "num_input_tokens_seen": 673289928, "step": 11090, "train_runtime": 144699.2516, "train_tokens_per_second": 4653.03 }, { "epoch": 1.4151785714285714, "grad_norm": 0.6710805945631285, "learning_rate": 1.9662697099180607e-06, "loss": 0.2727480888366699, "num_input_tokens_seen": 673609528, "step": 11095, "train_runtime": 144753.367, "train_tokens_per_second": 4653.498 }, { "epoch": 1.4158163265306123, "grad_norm": 0.6650466747935465, "learning_rate": 1.9622896662430098e-06, "loss": 0.24592394828796388, "num_input_tokens_seen": 673911976, "step": 11100, "train_runtime": 144816.7329, "train_tokens_per_second": 4653.55 }, { "epoch": 1.416454081632653, "grad_norm": 0.6881162712221625, "learning_rate": 1.9583126711224342e-06, "loss": 0.25740480422973633, "num_input_tokens_seen": 674217488, "step": 11105, "train_runtime": 144879.2297, "train_tokens_per_second": 4653.652 }, { "epoch": 1.4170918367346939, "grad_norm": 0.6304863826762142, "learning_rate": 1.954338728547526e-06, "loss": 0.25806460380554197, "num_input_tokens_seen": 674528768, "step": 11110, "train_runtime": 144947.6353, "train_tokens_per_second": 4653.603 }, { "epoch": 1.4177295918367347, "grad_norm": 0.5838760323917608, "learning_rate": 1.9503678425064097e-06, "loss": 0.26084744930267334, "num_input_tokens_seen": 674833976, "step": 11115, "train_runtime": 145021.509, "train_tokens_per_second": 4653.337 }, { "epoch": 1.4183673469387754, "grad_norm": 0.6044228807138501, "learning_rate": 1.9464000169841495e-06, "loss": 0.2530702829360962, "num_input_tokens_seen": 675144408, "step": 11120, "train_runtime": 145090.0515, "train_tokens_per_second": 4653.278 }, { "epoch": 1.4190051020408163, "grad_norm": 0.6851616617139263, "learning_rate": 1.942435255962736e-06, "loss": 0.2522618055343628, "num_input_tokens_seen": 675444376, "step": 11125, "train_runtime": 145158.6162, "train_tokens_per_second": 4653.147 }, { "epoch": 1.4196428571428572, "grad_norm": 0.659989561463371, "learning_rate": 1.938473563421082e-06, "loss": 0.2615769624710083, "num_input_tokens_seen": 675753496, "step": 11130, "train_runtime": 145222.3305, "train_tokens_per_second": 4653.234 }, { "epoch": 1.4202806122448979, "grad_norm": 0.610403521010447, "learning_rate": 1.934514943335024e-06, "loss": 0.25546267032623293, "num_input_tokens_seen": 676051376, "step": 11135, "train_runtime": 145295.6783, "train_tokens_per_second": 4652.935 }, { "epoch": 1.4209183673469388, "grad_norm": 0.6489582829306019, "learning_rate": 1.930559399677313e-06, "loss": 0.26701812744140624, "num_input_tokens_seen": 676348080, "step": 11140, "train_runtime": 145370.4233, "train_tokens_per_second": 4652.584 }, { "epoch": 1.4215561224489797, "grad_norm": 0.696342377331813, "learning_rate": 1.9266069364176144e-06, "loss": 0.26505365371704104, "num_input_tokens_seen": 676648304, "step": 11145, "train_runtime": 145433.6569, "train_tokens_per_second": 4652.625 }, { "epoch": 1.4221938775510203, "grad_norm": 0.6049080136284425, "learning_rate": 1.9226575575225002e-06, "loss": 0.26203341484069825, "num_input_tokens_seen": 676951648, "step": 11150, "train_runtime": 145490.8333, "train_tokens_per_second": 4652.882 }, { "epoch": 1.4228316326530612, "grad_norm": 0.8259829756622332, "learning_rate": 1.918711266955448e-06, "loss": 0.26873183250427246, "num_input_tokens_seen": 677263584, "step": 11155, "train_runtime": 145557.7369, "train_tokens_per_second": 4652.886 }, { "epoch": 1.4234693877551021, "grad_norm": 0.65287980347922, "learning_rate": 1.914768068676836e-06, "loss": 0.24950363636016845, "num_input_tokens_seen": 677572232, "step": 11160, "train_runtime": 145630.1619, "train_tokens_per_second": 4652.692 }, { "epoch": 1.4241071428571428, "grad_norm": 0.7017597610220788, "learning_rate": 1.9108279666439394e-06, "loss": 0.2430121660232544, "num_input_tokens_seen": 677882176, "step": 11165, "train_runtime": 145695.7154, "train_tokens_per_second": 4652.726 }, { "epoch": 1.4247448979591837, "grad_norm": 0.6412105711113006, "learning_rate": 1.9068909648109258e-06, "loss": 0.270355224609375, "num_input_tokens_seen": 678173632, "step": 11170, "train_runtime": 145760.5805, "train_tokens_per_second": 4652.655 }, { "epoch": 1.4253826530612246, "grad_norm": 0.6807194539663797, "learning_rate": 1.9029570671288511e-06, "loss": 0.25338528156280515, "num_input_tokens_seen": 678474600, "step": 11175, "train_runtime": 145818.2662, "train_tokens_per_second": 4652.878 }, { "epoch": 1.4260204081632653, "grad_norm": 0.6991012794676906, "learning_rate": 1.899026277545658e-06, "loss": 0.25733702182769774, "num_input_tokens_seen": 678780864, "step": 11180, "train_runtime": 145883.5944, "train_tokens_per_second": 4652.894 }, { "epoch": 1.4266581632653061, "grad_norm": 0.6677068937815375, "learning_rate": 1.895098600006164e-06, "loss": 0.25646467208862306, "num_input_tokens_seen": 679088520, "step": 11185, "train_runtime": 145961.5774, "train_tokens_per_second": 4652.516 }, { "epoch": 1.427295918367347, "grad_norm": 0.6687378811532653, "learning_rate": 1.8911740384520717e-06, "loss": 0.25247950553894044, "num_input_tokens_seen": 679405536, "step": 11190, "train_runtime": 146027.8484, "train_tokens_per_second": 4652.575 }, { "epoch": 1.4279336734693877, "grad_norm": 0.638291105690982, "learning_rate": 1.8872525968219541e-06, "loss": 0.2619307041168213, "num_input_tokens_seen": 679708992, "step": 11195, "train_runtime": 146092.8956, "train_tokens_per_second": 4652.581 }, { "epoch": 1.4285714285714286, "grad_norm": 0.6510291957929055, "learning_rate": 1.8833342790512472e-06, "loss": 0.2534599304199219, "num_input_tokens_seen": 680014824, "step": 11200, "train_runtime": 146148.156, "train_tokens_per_second": 4652.914 }, { "epoch": 1.4292091836734695, "grad_norm": 0.6219358860383175, "learning_rate": 1.8794190890722575e-06, "loss": 0.25667262077331543, "num_input_tokens_seen": 680316552, "step": 11205, "train_runtime": 146209.7228, "train_tokens_per_second": 4653.019 }, { "epoch": 1.4298469387755102, "grad_norm": 0.6511492931917631, "learning_rate": 1.875507030814156e-06, "loss": 0.24242887496948243, "num_input_tokens_seen": 680617056, "step": 11210, "train_runtime": 146273.6837, "train_tokens_per_second": 4653.038 }, { "epoch": 1.430484693877551, "grad_norm": 0.6142662389207844, "learning_rate": 1.871598108202961e-06, "loss": 0.25613572597503664, "num_input_tokens_seen": 680913152, "step": 11215, "train_runtime": 146333.2509, "train_tokens_per_second": 4653.168 }, { "epoch": 1.431122448979592, "grad_norm": 0.6010152931977929, "learning_rate": 1.8676923251615503e-06, "loss": 0.24273557662963868, "num_input_tokens_seen": 681212248, "step": 11220, "train_runtime": 146400.5962, "train_tokens_per_second": 4653.07 }, { "epoch": 1.4317602040816326, "grad_norm": 0.7367522839094218, "learning_rate": 1.863789685609655e-06, "loss": 0.25536012649536133, "num_input_tokens_seen": 681517160, "step": 11225, "train_runtime": 146466.0992, "train_tokens_per_second": 4653.071 }, { "epoch": 1.4323979591836735, "grad_norm": 0.6386127756897391, "learning_rate": 1.8598901934638402e-06, "loss": 0.25140721797943116, "num_input_tokens_seen": 681824104, "step": 11230, "train_runtime": 146519.1214, "train_tokens_per_second": 4653.482 }, { "epoch": 1.4330357142857144, "grad_norm": 0.6559922692928403, "learning_rate": 1.8559938526375215e-06, "loss": 0.26719353199005125, "num_input_tokens_seen": 682111592, "step": 11235, "train_runtime": 146583.941, "train_tokens_per_second": 4653.386 }, { "epoch": 1.433673469387755, "grad_norm": 0.6614059379119014, "learning_rate": 1.8521006670409481e-06, "loss": 0.2607134819030762, "num_input_tokens_seen": 682419768, "step": 11240, "train_runtime": 146649.2813, "train_tokens_per_second": 4653.414 }, { "epoch": 1.434311224489796, "grad_norm": 0.6255632269000909, "learning_rate": 1.8482106405812046e-06, "loss": 0.2534268856048584, "num_input_tokens_seen": 682722376, "step": 11245, "train_runtime": 146715.2995, "train_tokens_per_second": 4653.382 }, { "epoch": 1.4349489795918369, "grad_norm": 0.628044852794189, "learning_rate": 1.8443237771622037e-06, "loss": 0.261114501953125, "num_input_tokens_seen": 683030000, "step": 11250, "train_runtime": 146786.4286, "train_tokens_per_second": 4653.223 }, { "epoch": 1.4355867346938775, "grad_norm": 0.6303084742948237, "learning_rate": 1.840440080684684e-06, "loss": 0.2725719451904297, "num_input_tokens_seen": 683344624, "step": 11255, "train_runtime": 146841.0765, "train_tokens_per_second": 4653.634 }, { "epoch": 1.4362244897959184, "grad_norm": 0.7133814236210575, "learning_rate": 1.8365595550462068e-06, "loss": 0.26194334030151367, "num_input_tokens_seen": 683647312, "step": 11260, "train_runtime": 146910.9089, "train_tokens_per_second": 4653.482 }, { "epoch": 1.436862244897959, "grad_norm": 0.6572877425943786, "learning_rate": 1.8326822041411524e-06, "loss": 0.25354886054992676, "num_input_tokens_seen": 683953976, "step": 11265, "train_runtime": 146967.1436, "train_tokens_per_second": 4653.788 }, { "epoch": 1.4375, "grad_norm": 0.6807081378467906, "learning_rate": 1.828808031860707e-06, "loss": 0.2550026893615723, "num_input_tokens_seen": 684245328, "step": 11270, "train_runtime": 147037.7816, "train_tokens_per_second": 4653.534 }, { "epoch": 1.438137755102041, "grad_norm": 0.6421792190220771, "learning_rate": 1.824937042092879e-06, "loss": 0.255743408203125, "num_input_tokens_seen": 684534456, "step": 11275, "train_runtime": 147100.7536, "train_tokens_per_second": 4653.507 }, { "epoch": 1.4387755102040816, "grad_norm": 0.6703049773622103, "learning_rate": 1.8210692387224776e-06, "loss": 0.2595668792724609, "num_input_tokens_seen": 684835696, "step": 11280, "train_runtime": 147152.7923, "train_tokens_per_second": 4653.909 }, { "epoch": 1.4394132653061225, "grad_norm": 0.705144171072784, "learning_rate": 1.8172046256311087e-06, "loss": 0.262544584274292, "num_input_tokens_seen": 685141560, "step": 11285, "train_runtime": 147220.3621, "train_tokens_per_second": 4653.851 }, { "epoch": 1.4400510204081631, "grad_norm": 0.5983619231553162, "learning_rate": 1.8133432066971823e-06, "loss": 0.24910640716552734, "num_input_tokens_seen": 685444368, "step": 11290, "train_runtime": 147293.6179, "train_tokens_per_second": 4653.592 }, { "epoch": 1.440688775510204, "grad_norm": 0.7044716748584612, "learning_rate": 1.8094849857959074e-06, "loss": 0.267687463760376, "num_input_tokens_seen": 685735024, "step": 11295, "train_runtime": 147363.6411, "train_tokens_per_second": 4653.353 }, { "epoch": 1.441326530612245, "grad_norm": 0.6729325667272261, "learning_rate": 1.8056299667992721e-06, "loss": 0.25908875465393066, "num_input_tokens_seen": 686029680, "step": 11300, "train_runtime": 147424.7146, "train_tokens_per_second": 4653.424 }, { "epoch": 1.4419642857142856, "grad_norm": 0.6602083938659958, "learning_rate": 1.8017781535760581e-06, "loss": 0.2524980068206787, "num_input_tokens_seen": 686323368, "step": 11305, "train_runtime": 147490.7589, "train_tokens_per_second": 4653.331 }, { "epoch": 1.4426020408163265, "grad_norm": 0.7239698072065522, "learning_rate": 1.7979295499918338e-06, "loss": 0.25349082946777346, "num_input_tokens_seen": 686619760, "step": 11310, "train_runtime": 147558.1911, "train_tokens_per_second": 4653.213 }, { "epoch": 1.4432397959183674, "grad_norm": 0.635097988576949, "learning_rate": 1.7940841599089364e-06, "loss": 0.26335620880126953, "num_input_tokens_seen": 686937152, "step": 11315, "train_runtime": 147611.6909, "train_tokens_per_second": 4653.677 }, { "epoch": 1.443877551020408, "grad_norm": 0.640691388944003, "learning_rate": 1.790241987186485e-06, "loss": 0.2568617582321167, "num_input_tokens_seen": 687234768, "step": 11320, "train_runtime": 147678.6639, "train_tokens_per_second": 4653.582 }, { "epoch": 1.444515306122449, "grad_norm": 0.6255519134411113, "learning_rate": 1.7864030356803685e-06, "loss": 0.2553276300430298, "num_input_tokens_seen": 687535408, "step": 11325, "train_runtime": 147737.6656, "train_tokens_per_second": 4653.758 }, { "epoch": 1.4451530612244898, "grad_norm": 0.6569709229834011, "learning_rate": 1.7825673092432433e-06, "loss": 0.26634774208068845, "num_input_tokens_seen": 687842240, "step": 11330, "train_runtime": 147795.4392, "train_tokens_per_second": 4654.015 }, { "epoch": 1.4457908163265305, "grad_norm": 0.6146477199018123, "learning_rate": 1.7787348117245278e-06, "loss": 0.24077410697937013, "num_input_tokens_seen": 688143488, "step": 11335, "train_runtime": 147851.7803, "train_tokens_per_second": 4654.279 }, { "epoch": 1.4464285714285714, "grad_norm": 0.6745603895723179, "learning_rate": 1.7749055469704013e-06, "loss": 0.24639506340026857, "num_input_tokens_seen": 688438208, "step": 11340, "train_runtime": 147925.3508, "train_tokens_per_second": 4653.957 }, { "epoch": 1.4470663265306123, "grad_norm": 0.6365832756715657, "learning_rate": 1.771079518823799e-06, "loss": 0.2675870418548584, "num_input_tokens_seen": 688750184, "step": 11345, "train_runtime": 147998.0674, "train_tokens_per_second": 4653.778 }, { "epoch": 1.447704081632653, "grad_norm": 0.6345086185106481, "learning_rate": 1.7672567311244065e-06, "loss": 0.24507179260253906, "num_input_tokens_seen": 689051608, "step": 11350, "train_runtime": 148067.9814, "train_tokens_per_second": 4653.617 }, { "epoch": 1.4483418367346939, "grad_norm": 0.7331991768030408, "learning_rate": 1.7634371877086587e-06, "loss": 0.251706600189209, "num_input_tokens_seen": 689338368, "step": 11355, "train_runtime": 148122.4903, "train_tokens_per_second": 4653.84 }, { "epoch": 1.4489795918367347, "grad_norm": 0.6022787473010074, "learning_rate": 1.7596208924097336e-06, "loss": 0.2331090450286865, "num_input_tokens_seen": 689645832, "step": 11360, "train_runtime": 148195.7569, "train_tokens_per_second": 4653.614 }, { "epoch": 1.4496173469387754, "grad_norm": 0.6283517904938899, "learning_rate": 1.7558078490575531e-06, "loss": 0.2676694393157959, "num_input_tokens_seen": 689953024, "step": 11365, "train_runtime": 148258.7314, "train_tokens_per_second": 4653.709 }, { "epoch": 1.4502551020408163, "grad_norm": 0.6577691490155231, "learning_rate": 1.7519980614787673e-06, "loss": 0.26604576110839845, "num_input_tokens_seen": 690265872, "step": 11370, "train_runtime": 148310.2138, "train_tokens_per_second": 4654.203 }, { "epoch": 1.4508928571428572, "grad_norm": 0.6751365630787896, "learning_rate": 1.748191533496766e-06, "loss": 0.2404193878173828, "num_input_tokens_seen": 690559424, "step": 11375, "train_runtime": 148381.5591, "train_tokens_per_second": 4653.944 }, { "epoch": 1.4515306122448979, "grad_norm": 0.6791540330159553, "learning_rate": 1.7443882689316693e-06, "loss": 0.261887264251709, "num_input_tokens_seen": 690867440, "step": 11380, "train_runtime": 148446.7869, "train_tokens_per_second": 4653.974 }, { "epoch": 1.4521683673469388, "grad_norm": 0.5696416042203014, "learning_rate": 1.7405882716003154e-06, "loss": 0.2412036657333374, "num_input_tokens_seen": 691179896, "step": 11385, "train_runtime": 148503.0122, "train_tokens_per_second": 4654.316 }, { "epoch": 1.4528061224489797, "grad_norm": 0.663334327792484, "learning_rate": 1.7367915453162653e-06, "loss": 0.2515883207321167, "num_input_tokens_seen": 691479832, "step": 11390, "train_runtime": 148575.0559, "train_tokens_per_second": 4654.078 }, { "epoch": 1.4534438775510203, "grad_norm": 0.7672916515860333, "learning_rate": 1.732998093889805e-06, "loss": 0.25553102493286134, "num_input_tokens_seen": 691770328, "step": 11395, "train_runtime": 148643.9058, "train_tokens_per_second": 4653.876 }, { "epoch": 1.4540816326530612, "grad_norm": 0.7613214609422131, "learning_rate": 1.7292079211279229e-06, "loss": 0.2637500286102295, "num_input_tokens_seen": 692047224, "step": 11400, "train_runtime": 148707.8063, "train_tokens_per_second": 4653.738 }, { "epoch": 1.4547193877551021, "grad_norm": 0.6793202080818056, "learning_rate": 1.7254210308343233e-06, "loss": 0.2611916303634644, "num_input_tokens_seen": 692351568, "step": 11405, "train_runtime": 148772.0315, "train_tokens_per_second": 4653.775 }, { "epoch": 1.4553571428571428, "grad_norm": 0.6934879394356063, "learning_rate": 1.721637426809415e-06, "loss": 0.2512598991394043, "num_input_tokens_seen": 692648960, "step": 11410, "train_runtime": 148844.8894, "train_tokens_per_second": 4653.495 }, { "epoch": 1.4559948979591837, "grad_norm": 0.75152296594556, "learning_rate": 1.7178571128503097e-06, "loss": 0.2514254093170166, "num_input_tokens_seen": 692945064, "step": 11415, "train_runtime": 148915.559, "train_tokens_per_second": 4653.275 }, { "epoch": 1.4566326530612246, "grad_norm": 0.6026216151819691, "learning_rate": 1.7140800927508162e-06, "loss": 0.26080052852630614, "num_input_tokens_seen": 693250712, "step": 11420, "train_runtime": 148980.5413, "train_tokens_per_second": 4653.297 }, { "epoch": 1.4572704081632653, "grad_norm": 0.6652573244887677, "learning_rate": 1.7103063703014372e-06, "loss": 0.25720174312591554, "num_input_tokens_seen": 693557616, "step": 11425, "train_runtime": 149051.2751, "train_tokens_per_second": 4653.148 }, { "epoch": 1.4579081632653061, "grad_norm": 0.7123151801360577, "learning_rate": 1.706535949289368e-06, "loss": 0.27224562168121336, "num_input_tokens_seen": 693865096, "step": 11430, "train_runtime": 149124.6564, "train_tokens_per_second": 4652.92 }, { "epoch": 1.458545918367347, "grad_norm": 0.7165055019879256, "learning_rate": 1.7027688334984881e-06, "loss": 0.26955580711364746, "num_input_tokens_seen": 694167488, "step": 11435, "train_runtime": 149194.6544, "train_tokens_per_second": 4652.764 }, { "epoch": 1.4591836734693877, "grad_norm": 0.6742270512617384, "learning_rate": 1.6990050267093621e-06, "loss": 0.24876112937927247, "num_input_tokens_seen": 694471352, "step": 11440, "train_runtime": 149246.5097, "train_tokens_per_second": 4653.183 }, { "epoch": 1.4598214285714286, "grad_norm": 0.6383675482091885, "learning_rate": 1.6952445326992327e-06, "loss": 0.23597230911254882, "num_input_tokens_seen": 694760392, "step": 11445, "train_runtime": 149313.7796, "train_tokens_per_second": 4653.023 }, { "epoch": 1.4604591836734695, "grad_norm": 0.7035456067026871, "learning_rate": 1.6914873552420185e-06, "loss": 0.26068577766418455, "num_input_tokens_seen": 695056072, "step": 11450, "train_runtime": 149390.9183, "train_tokens_per_second": 4652.599 }, { "epoch": 1.4610969387755102, "grad_norm": 0.6285270523273403, "learning_rate": 1.687733498108311e-06, "loss": 0.26918802261352537, "num_input_tokens_seen": 695365848, "step": 11455, "train_runtime": 149448.4664, "train_tokens_per_second": 4652.88 }, { "epoch": 1.461734693877551, "grad_norm": 0.6693220843063449, "learning_rate": 1.6839829650653632e-06, "loss": 0.24681711196899414, "num_input_tokens_seen": 695661496, "step": 11460, "train_runtime": 149511.3983, "train_tokens_per_second": 4652.899 }, { "epoch": 1.462372448979592, "grad_norm": 0.7651750699630233, "learning_rate": 1.6802357598771014e-06, "loss": 0.2575855016708374, "num_input_tokens_seen": 695960184, "step": 11465, "train_runtime": 149577.9152, "train_tokens_per_second": 4652.827 }, { "epoch": 1.4630102040816326, "grad_norm": 0.7036196087435692, "learning_rate": 1.6764918863041079e-06, "loss": 0.25083796977996825, "num_input_tokens_seen": 696258456, "step": 11470, "train_runtime": 149640.317, "train_tokens_per_second": 4652.88 }, { "epoch": 1.4636479591836735, "grad_norm": 0.6862839891742669, "learning_rate": 1.6727513481036167e-06, "loss": 0.23392910957336427, "num_input_tokens_seen": 696562944, "step": 11475, "train_runtime": 149709.7164, "train_tokens_per_second": 4652.757 }, { "epoch": 1.4642857142857144, "grad_norm": 0.6643195742481856, "learning_rate": 1.6690141490295259e-06, "loss": 0.2381272792816162, "num_input_tokens_seen": 696861776, "step": 11480, "train_runtime": 149781.0158, "train_tokens_per_second": 4652.537 }, { "epoch": 1.464923469387755, "grad_norm": 0.6700710365667815, "learning_rate": 1.6652802928323698e-06, "loss": 0.2412243127822876, "num_input_tokens_seen": 697176216, "step": 11485, "train_runtime": 149856.7681, "train_tokens_per_second": 4652.284 }, { "epoch": 1.465561224489796, "grad_norm": 0.6561042403096796, "learning_rate": 1.6615497832593365e-06, "loss": 0.25841598510742186, "num_input_tokens_seen": 697478792, "step": 11490, "train_runtime": 149923.1941, "train_tokens_per_second": 4652.241 }, { "epoch": 1.4661989795918369, "grad_norm": 0.6941070429451296, "learning_rate": 1.6578226240542528e-06, "loss": 0.2742449760437012, "num_input_tokens_seen": 697785848, "step": 11495, "train_runtime": 149988.4626, "train_tokens_per_second": 4652.263 }, { "epoch": 1.4668367346938775, "grad_norm": 0.6802527349106692, "learning_rate": 1.6540988189575823e-06, "loss": 0.2669424533843994, "num_input_tokens_seen": 698107216, "step": 11500, "train_runtime": 150056.271, "train_tokens_per_second": 4652.303 }, { "epoch": 1.4674744897959184, "grad_norm": 0.6649874981638693, "learning_rate": 1.6503783717064247e-06, "loss": 0.2652735710144043, "num_input_tokens_seen": 698415200, "step": 11505, "train_runtime": 150133.3092, "train_tokens_per_second": 4651.967 }, { "epoch": 1.468112244897959, "grad_norm": 0.7210063670504991, "learning_rate": 1.6466612860345083e-06, "loss": 0.2547138690948486, "num_input_tokens_seen": 698717160, "step": 11510, "train_runtime": 150202.1339, "train_tokens_per_second": 4651.846 }, { "epoch": 1.46875, "grad_norm": 0.6904115337156073, "learning_rate": 1.6429475656721878e-06, "loss": 0.2531946897506714, "num_input_tokens_seen": 699019328, "step": 11515, "train_runtime": 150273.788, "train_tokens_per_second": 4651.638 }, { "epoch": 1.469387755102041, "grad_norm": 0.6096103663871228, "learning_rate": 1.6392372143464407e-06, "loss": 0.24852967262268066, "num_input_tokens_seen": 699332520, "step": 11520, "train_runtime": 150326.2769, "train_tokens_per_second": 4652.098 }, { "epoch": 1.4700255102040816, "grad_norm": 0.83723132893415, "learning_rate": 1.635530235780865e-06, "loss": 0.2493694543838501, "num_input_tokens_seen": 699626568, "step": 11525, "train_runtime": 150399.2931, "train_tokens_per_second": 4651.794 }, { "epoch": 1.4706632653061225, "grad_norm": 0.6874689194377291, "learning_rate": 1.6318266336956713e-06, "loss": 0.239760160446167, "num_input_tokens_seen": 699925336, "step": 11530, "train_runtime": 150473.2629, "train_tokens_per_second": 4651.493 }, { "epoch": 1.4713010204081631, "grad_norm": 0.6081449887494256, "learning_rate": 1.6281264118076833e-06, "loss": 0.23812055587768555, "num_input_tokens_seen": 700232720, "step": 11535, "train_runtime": 150540.3556, "train_tokens_per_second": 4651.462 }, { "epoch": 1.471938775510204, "grad_norm": 0.6389000206547071, "learning_rate": 1.6244295738303323e-06, "loss": 0.2438938856124878, "num_input_tokens_seen": 700527648, "step": 11540, "train_runtime": 150611.8723, "train_tokens_per_second": 4651.211 }, { "epoch": 1.472576530612245, "grad_norm": 0.6718629266348322, "learning_rate": 1.6207361234736535e-06, "loss": 0.2975417375564575, "num_input_tokens_seen": 700843920, "step": 11545, "train_runtime": 150663.5359, "train_tokens_per_second": 4651.716 }, { "epoch": 1.4732142857142856, "grad_norm": 0.6449463224727301, "learning_rate": 1.6170460644442814e-06, "loss": 0.25352983474731444, "num_input_tokens_seen": 701144312, "step": 11550, "train_runtime": 150730.063, "train_tokens_per_second": 4651.655 }, { "epoch": 1.4738520408163265, "grad_norm": 0.7997272426587076, "learning_rate": 1.6133594004454512e-06, "loss": 0.26451525688171384, "num_input_tokens_seen": 701449824, "step": 11555, "train_runtime": 150799.9905, "train_tokens_per_second": 4651.524 }, { "epoch": 1.4744897959183674, "grad_norm": 0.6763084026613673, "learning_rate": 1.6096761351769813e-06, "loss": 0.26746971607208253, "num_input_tokens_seen": 701742128, "step": 11560, "train_runtime": 150867.234, "train_tokens_per_second": 4651.389 }, { "epoch": 1.475127551020408, "grad_norm": 0.6794598871157979, "learning_rate": 1.6059962723352912e-06, "loss": 0.2517268657684326, "num_input_tokens_seen": 702054784, "step": 11565, "train_runtime": 150929.2574, "train_tokens_per_second": 4651.549 }, { "epoch": 1.475765306122449, "grad_norm": 0.6899303692739722, "learning_rate": 1.6023198156133796e-06, "loss": 0.2649550437927246, "num_input_tokens_seen": 702354392, "step": 11570, "train_runtime": 150994.8582, "train_tokens_per_second": 4651.512 }, { "epoch": 1.4764030612244898, "grad_norm": 0.5932483402474683, "learning_rate": 1.5986467687008256e-06, "loss": 0.23227922916412352, "num_input_tokens_seen": 702659368, "step": 11575, "train_runtime": 151054.3276, "train_tokens_per_second": 4651.7 }, { "epoch": 1.4770408163265305, "grad_norm": 0.6628646805863575, "learning_rate": 1.5949771352837873e-06, "loss": 0.27329676151275634, "num_input_tokens_seen": 702974120, "step": 11580, "train_runtime": 151123.6404, "train_tokens_per_second": 4651.649 }, { "epoch": 1.4776785714285714, "grad_norm": 0.6005475806622863, "learning_rate": 1.5913109190450033e-06, "loss": 0.2482689619064331, "num_input_tokens_seen": 703274640, "step": 11585, "train_runtime": 151199.0932, "train_tokens_per_second": 4651.315 }, { "epoch": 1.4783163265306123, "grad_norm": 0.7087277704302467, "learning_rate": 1.5876481236637725e-06, "loss": 0.25067954063415526, "num_input_tokens_seen": 703571232, "step": 11590, "train_runtime": 151267.0529, "train_tokens_per_second": 4651.186 }, { "epoch": 1.478954081632653, "grad_norm": 0.6929832721752661, "learning_rate": 1.5839887528159664e-06, "loss": 0.24625492095947266, "num_input_tokens_seen": 703886312, "step": 11595, "train_runtime": 151335.5903, "train_tokens_per_second": 4651.162 }, { "epoch": 1.4795918367346939, "grad_norm": 0.7363768129383547, "learning_rate": 1.580332810174024e-06, "loss": 0.27662837505340576, "num_input_tokens_seen": 704198792, "step": 11600, "train_runtime": 151411.2335, "train_tokens_per_second": 4650.902 }, { "epoch": 1.4802295918367347, "grad_norm": 0.6949936888575473, "learning_rate": 1.5766802994069336e-06, "loss": 0.2493530035018921, "num_input_tokens_seen": 704515848, "step": 11605, "train_runtime": 151471.1362, "train_tokens_per_second": 4651.156 }, { "epoch": 1.4808673469387754, "grad_norm": 0.6292968059570132, "learning_rate": 1.573031224180247e-06, "loss": 0.27558221817016604, "num_input_tokens_seen": 704821864, "step": 11610, "train_runtime": 151535.6845, "train_tokens_per_second": 4651.194 }, { "epoch": 1.4815051020408163, "grad_norm": 0.6738011434557234, "learning_rate": 1.5693855881560654e-06, "loss": 0.23457353115081786, "num_input_tokens_seen": 705133552, "step": 11615, "train_runtime": 151602.2108, "train_tokens_per_second": 4651.209 }, { "epoch": 1.4821428571428572, "grad_norm": 0.662589033840902, "learning_rate": 1.5657433949930406e-06, "loss": 0.25937981605529786, "num_input_tokens_seen": 705442408, "step": 11620, "train_runtime": 151676.7926, "train_tokens_per_second": 4650.958 }, { "epoch": 1.4827806122448979, "grad_norm": 0.6699351629628751, "learning_rate": 1.5621046483463663e-06, "loss": 0.2675338268280029, "num_input_tokens_seen": 705756872, "step": 11625, "train_runtime": 151745.0479, "train_tokens_per_second": 4650.938 }, { "epoch": 1.4834183673469388, "grad_norm": 0.7252766587622275, "learning_rate": 1.5584693518677796e-06, "loss": 0.2641123294830322, "num_input_tokens_seen": 706064448, "step": 11630, "train_runtime": 151816.1304, "train_tokens_per_second": 4650.787 }, { "epoch": 1.4840561224489797, "grad_norm": 0.6411274114325384, "learning_rate": 1.554837509205554e-06, "loss": 0.24312682151794435, "num_input_tokens_seen": 706367832, "step": 11635, "train_runtime": 151882.446, "train_tokens_per_second": 4650.754 }, { "epoch": 1.4846938775510203, "grad_norm": 0.6423826592976337, "learning_rate": 1.5512091240044996e-06, "loss": 0.2624907732009888, "num_input_tokens_seen": 706681984, "step": 11640, "train_runtime": 151942.2284, "train_tokens_per_second": 4650.991 }, { "epoch": 1.4853316326530612, "grad_norm": 0.7663904546335204, "learning_rate": 1.5475841999059487e-06, "loss": 0.27055678367614744, "num_input_tokens_seen": 706987120, "step": 11645, "train_runtime": 152005.7348, "train_tokens_per_second": 4651.056 }, { "epoch": 1.4859693877551021, "grad_norm": 0.6313909324997609, "learning_rate": 1.5439627405477714e-06, "loss": 0.2421438217163086, "num_input_tokens_seen": 707300040, "step": 11650, "train_runtime": 152065.1961, "train_tokens_per_second": 4651.295 }, { "epoch": 1.4866071428571428, "grad_norm": 0.6534547954585155, "learning_rate": 1.5403447495643542e-06, "loss": 0.23953189849853515, "num_input_tokens_seen": 707605520, "step": 11655, "train_runtime": 152139.5543, "train_tokens_per_second": 4651.029 }, { "epoch": 1.4872448979591837, "grad_norm": 0.6527691401390453, "learning_rate": 1.5367302305866017e-06, "loss": 0.2567351579666138, "num_input_tokens_seen": 707906880, "step": 11660, "train_runtime": 152208.2664, "train_tokens_per_second": 4650.91 }, { "epoch": 1.4878826530612246, "grad_norm": 0.7298686287037895, "learning_rate": 1.5331191872419349e-06, "loss": 0.25123307704925535, "num_input_tokens_seen": 708213592, "step": 11665, "train_runtime": 152277.8543, "train_tokens_per_second": 4650.798 }, { "epoch": 1.4885204081632653, "grad_norm": 0.73646842290651, "learning_rate": 1.5295116231542935e-06, "loss": 0.2430964231491089, "num_input_tokens_seen": 708503720, "step": 11670, "train_runtime": 152344.4542, "train_tokens_per_second": 4650.67 }, { "epoch": 1.4891581632653061, "grad_norm": 0.6199818195617495, "learning_rate": 1.5259075419441144e-06, "loss": 0.25212526321411133, "num_input_tokens_seen": 708809960, "step": 11675, "train_runtime": 152411.4443, "train_tokens_per_second": 4650.635 }, { "epoch": 1.489795918367347, "grad_norm": 0.7303765404971818, "learning_rate": 1.5223069472283464e-06, "loss": 0.2657268762588501, "num_input_tokens_seen": 709116352, "step": 11680, "train_runtime": 152468.2353, "train_tokens_per_second": 4650.912 }, { "epoch": 1.4904336734693877, "grad_norm": 0.6133630983750509, "learning_rate": 1.5187098426204411e-06, "loss": 0.22965846061706544, "num_input_tokens_seen": 709399184, "step": 11685, "train_runtime": 152536.6366, "train_tokens_per_second": 4650.681 }, { "epoch": 1.4910714285714286, "grad_norm": 0.7161191464349163, "learning_rate": 1.5151162317303398e-06, "loss": 0.23941805362701415, "num_input_tokens_seen": 709692272, "step": 11690, "train_runtime": 152605.7257, "train_tokens_per_second": 4650.496 }, { "epoch": 1.4917091836734695, "grad_norm": 0.669251318517889, "learning_rate": 1.5115261181644842e-06, "loss": 0.26945855617523196, "num_input_tokens_seen": 710004984, "step": 11695, "train_runtime": 152682.019, "train_tokens_per_second": 4650.22 }, { "epoch": 1.4923469387755102, "grad_norm": 0.6460954619175574, "learning_rate": 1.5079395055258027e-06, "loss": 0.23934993743896485, "num_input_tokens_seen": 710313688, "step": 11700, "train_runtime": 152745.5762, "train_tokens_per_second": 4650.306 }, { "epoch": 1.492984693877551, "grad_norm": 0.613900227712934, "learning_rate": 1.5043563974137132e-06, "loss": 0.22617621421813966, "num_input_tokens_seen": 710618288, "step": 11705, "train_runtime": 152807.8819, "train_tokens_per_second": 4650.403 }, { "epoch": 1.493622448979592, "grad_norm": 0.675599640664044, "learning_rate": 1.5007767974241133e-06, "loss": 0.2418062686920166, "num_input_tokens_seen": 710926392, "step": 11710, "train_runtime": 152873.0827, "train_tokens_per_second": 4650.435 }, { "epoch": 1.4942602040816326, "grad_norm": 0.6174613887003167, "learning_rate": 1.497200709149383e-06, "loss": 0.2354290008544922, "num_input_tokens_seen": 711230608, "step": 11715, "train_runtime": 152933.8752, "train_tokens_per_second": 4650.576 }, { "epoch": 1.4948979591836735, "grad_norm": 0.697269811303447, "learning_rate": 1.493628136178376e-06, "loss": 0.2707733154296875, "num_input_tokens_seen": 711527456, "step": 11720, "train_runtime": 153003.793, "train_tokens_per_second": 4650.391 }, { "epoch": 1.4955357142857144, "grad_norm": 0.6802569943864075, "learning_rate": 1.49005908209642e-06, "loss": 0.2669675827026367, "num_input_tokens_seen": 711838440, "step": 11725, "train_runtime": 153067.2024, "train_tokens_per_second": 4650.496 }, { "epoch": 1.496173469387755, "grad_norm": 0.6672094633913374, "learning_rate": 1.4864935504853062e-06, "loss": 0.24235136508941652, "num_input_tokens_seen": 712150208, "step": 11730, "train_runtime": 153141.6004, "train_tokens_per_second": 4650.273 }, { "epoch": 1.496811224489796, "grad_norm": 0.6512272194630198, "learning_rate": 1.4829315449232984e-06, "loss": 0.2580772876739502, "num_input_tokens_seen": 712457024, "step": 11735, "train_runtime": 153204.1999, "train_tokens_per_second": 4650.375 }, { "epoch": 1.4974489795918369, "grad_norm": 0.7186619430371217, "learning_rate": 1.4793730689851187e-06, "loss": 0.2615934133529663, "num_input_tokens_seen": 712757864, "step": 11740, "train_runtime": 153269.0385, "train_tokens_per_second": 4650.371 }, { "epoch": 1.4980867346938775, "grad_norm": 0.6517705009255923, "learning_rate": 1.4758181262419425e-06, "loss": 0.24282798767089844, "num_input_tokens_seen": 713075888, "step": 11745, "train_runtime": 153334.0472, "train_tokens_per_second": 4650.473 }, { "epoch": 1.4987244897959184, "grad_norm": 0.6569295399291899, "learning_rate": 1.4722667202614037e-06, "loss": 0.23960046768188475, "num_input_tokens_seen": 713371464, "step": 11750, "train_runtime": 153388.3982, "train_tokens_per_second": 4650.752 }, { "epoch": 1.499362244897959, "grad_norm": 0.7019841676795132, "learning_rate": 1.4687188546075903e-06, "loss": 0.23960208892822266, "num_input_tokens_seen": 713657632, "step": 11755, "train_runtime": 153458.7883, "train_tokens_per_second": 4650.484 }, { "epoch": 1.5, "grad_norm": 0.6403120523509626, "learning_rate": 1.4651745328410289e-06, "loss": 0.258426833152771, "num_input_tokens_seen": 713955144, "step": 11760, "train_runtime": 153527.5697, "train_tokens_per_second": 4650.338 }, { "epoch": 1.5006377551020407, "grad_norm": 0.6522180290527697, "learning_rate": 1.4616337585186941e-06, "loss": 0.24520792961120605, "num_input_tokens_seen": 714257392, "step": 11765, "train_runtime": 153594.7663, "train_tokens_per_second": 4650.272 }, { "epoch": 1.5012755102040818, "grad_norm": 0.6244342453355227, "learning_rate": 1.4580965351940045e-06, "loss": 0.26330649852752686, "num_input_tokens_seen": 714569056, "step": 11770, "train_runtime": 153664.5251, "train_tokens_per_second": 4650.189 }, { "epoch": 1.5019132653061225, "grad_norm": 0.6309084668490915, "learning_rate": 1.454562866416806e-06, "loss": 0.23243155479431152, "num_input_tokens_seen": 714881472, "step": 11775, "train_runtime": 153718.1096, "train_tokens_per_second": 4650.6 }, { "epoch": 1.5025510204081631, "grad_norm": 0.5808562626569077, "learning_rate": 1.4510327557333843e-06, "loss": 0.2522455930709839, "num_input_tokens_seen": 715192808, "step": 11780, "train_runtime": 153793.2709, "train_tokens_per_second": 4650.352 }, { "epoch": 1.5031887755102042, "grad_norm": 0.6563879128278611, "learning_rate": 1.4475062066864516e-06, "loss": 0.2767788410186768, "num_input_tokens_seen": 715515792, "step": 11785, "train_runtime": 153853.7861, "train_tokens_per_second": 4650.622 }, { "epoch": 1.503826530612245, "grad_norm": 0.6227574867093538, "learning_rate": 1.4439832228151457e-06, "loss": 0.24577155113220214, "num_input_tokens_seen": 715831936, "step": 11790, "train_runtime": 153901.7271, "train_tokens_per_second": 4651.227 }, { "epoch": 1.5044642857142856, "grad_norm": 0.6138943688581633, "learning_rate": 1.4404638076550276e-06, "loss": 0.2581317901611328, "num_input_tokens_seen": 716136120, "step": 11795, "train_runtime": 153953.6899, "train_tokens_per_second": 4651.633 }, { "epoch": 1.5051020408163265, "grad_norm": 0.6624156064238919, "learning_rate": 1.4369479647380758e-06, "loss": 0.2634751319885254, "num_input_tokens_seen": 716445392, "step": 11800, "train_runtime": 154022.9587, "train_tokens_per_second": 4651.549 }, { "epoch": 1.5057397959183674, "grad_norm": 0.6929581381180583, "learning_rate": 1.4334356975926843e-06, "loss": 0.2595194339752197, "num_input_tokens_seen": 716746224, "step": 11805, "train_runtime": 154097.722, "train_tokens_per_second": 4651.245 }, { "epoch": 1.506377551020408, "grad_norm": 0.6476555100531105, "learning_rate": 1.429927009743659e-06, "loss": 0.2642998218536377, "num_input_tokens_seen": 717062648, "step": 11810, "train_runtime": 154155.19, "train_tokens_per_second": 4651.563 }, { "epoch": 1.507015306122449, "grad_norm": 0.690826021203568, "learning_rate": 1.4264219047122125e-06, "loss": 0.26960577964782717, "num_input_tokens_seen": 717368720, "step": 11815, "train_runtime": 154213.5952, "train_tokens_per_second": 4651.786 }, { "epoch": 1.5076530612244898, "grad_norm": 0.6016910574060026, "learning_rate": 1.422920386015963e-06, "loss": 0.25219082832336426, "num_input_tokens_seen": 717673224, "step": 11820, "train_runtime": 154266.9301, "train_tokens_per_second": 4652.152 }, { "epoch": 1.5082908163265305, "grad_norm": 0.6534672221331839, "learning_rate": 1.4194224571689286e-06, "loss": 0.26119270324707033, "num_input_tokens_seen": 717975600, "step": 11825, "train_runtime": 154335.2884, "train_tokens_per_second": 4652.051 }, { "epoch": 1.5089285714285714, "grad_norm": 0.6185095518581548, "learning_rate": 1.4159281216815269e-06, "loss": 0.26681981086730955, "num_input_tokens_seen": 718269840, "step": 11830, "train_runtime": 154412.0099, "train_tokens_per_second": 4651.645 }, { "epoch": 1.5095663265306123, "grad_norm": 0.6684805621613861, "learning_rate": 1.412437383060563e-06, "loss": 0.24793519973754882, "num_input_tokens_seen": 718583704, "step": 11835, "train_runtime": 154471.8592, "train_tokens_per_second": 4651.875 }, { "epoch": 1.510204081632653, "grad_norm": 0.797425326744484, "learning_rate": 1.4089502448092418e-06, "loss": 0.25735931396484374, "num_input_tokens_seen": 718886464, "step": 11840, "train_runtime": 154537.0972, "train_tokens_per_second": 4651.87 }, { "epoch": 1.5108418367346939, "grad_norm": 0.7215197781217865, "learning_rate": 1.4054667104271497e-06, "loss": 0.2530500411987305, "num_input_tokens_seen": 719178912, "step": 11845, "train_runtime": 154602.6924, "train_tokens_per_second": 4651.788 }, { "epoch": 1.5114795918367347, "grad_norm": 0.5517203232441623, "learning_rate": 1.4019867834102525e-06, "loss": 0.25861315727233886, "num_input_tokens_seen": 719488832, "step": 11850, "train_runtime": 154666.1485, "train_tokens_per_second": 4651.883 }, { "epoch": 1.5121173469387754, "grad_norm": 0.6400167365239027, "learning_rate": 1.398510467250906e-06, "loss": 0.23546905517578126, "num_input_tokens_seen": 719789416, "step": 11855, "train_runtime": 154741.9525, "train_tokens_per_second": 4651.547 }, { "epoch": 1.5127551020408163, "grad_norm": 0.7072383194006815, "learning_rate": 1.3950377654378312e-06, "loss": 0.2624575853347778, "num_input_tokens_seen": 720099464, "step": 11860, "train_runtime": 154812.0911, "train_tokens_per_second": 4651.442 }, { "epoch": 1.5133928571428572, "grad_norm": 0.7617778889505888, "learning_rate": 1.3915686814561285e-06, "loss": 0.2599982023239136, "num_input_tokens_seen": 720395896, "step": 11865, "train_runtime": 154875.0287, "train_tokens_per_second": 4651.466 }, { "epoch": 1.5140306122448979, "grad_norm": 0.6801430846003712, "learning_rate": 1.3881032187872666e-06, "loss": 0.2580726623535156, "num_input_tokens_seen": 720701088, "step": 11870, "train_runtime": 154942.1964, "train_tokens_per_second": 4651.419 }, { "epoch": 1.5146683673469388, "grad_norm": 0.6725219117370117, "learning_rate": 1.3846413809090792e-06, "loss": 0.24667282104492189, "num_input_tokens_seen": 720984848, "step": 11875, "train_runtime": 155004.8064, "train_tokens_per_second": 4651.371 }, { "epoch": 1.5153061224489797, "grad_norm": 0.6333060000660075, "learning_rate": 1.381183171295762e-06, "loss": 0.2713295936584473, "num_input_tokens_seen": 721284416, "step": 11880, "train_runtime": 155077.6104, "train_tokens_per_second": 4651.119 }, { "epoch": 1.5159438775510203, "grad_norm": 0.6418711574137776, "learning_rate": 1.3777285934178697e-06, "loss": 0.26169524192810056, "num_input_tokens_seen": 721595160, "step": 11885, "train_runtime": 155140.4977, "train_tokens_per_second": 4651.237 }, { "epoch": 1.5165816326530612, "grad_norm": 0.6462644081520978, "learning_rate": 1.3742776507423127e-06, "loss": 0.2720316171646118, "num_input_tokens_seen": 721886792, "step": 11890, "train_runtime": 155203.1296, "train_tokens_per_second": 4651.239 }, { "epoch": 1.5172193877551021, "grad_norm": 0.6265701983248271, "learning_rate": 1.3708303467323536e-06, "loss": 0.24444787502288817, "num_input_tokens_seen": 722191392, "step": 11895, "train_runtime": 155260.1119, "train_tokens_per_second": 4651.493 }, { "epoch": 1.5178571428571428, "grad_norm": 0.6080293985446179, "learning_rate": 1.367386684847602e-06, "loss": 0.24946393966674804, "num_input_tokens_seen": 722495968, "step": 11900, "train_runtime": 155325.7968, "train_tokens_per_second": 4651.487 }, { "epoch": 1.5184948979591837, "grad_norm": 0.7042361456981605, "learning_rate": 1.3639466685440133e-06, "loss": 0.2545601844787598, "num_input_tokens_seen": 722787536, "step": 11905, "train_runtime": 155403.6674, "train_tokens_per_second": 4651.033 }, { "epoch": 1.5191326530612246, "grad_norm": 0.6526395755457752, "learning_rate": 1.360510301273884e-06, "loss": 0.24752330780029297, "num_input_tokens_seen": 723079568, "step": 11910, "train_runtime": 155475.8836, "train_tokens_per_second": 4650.751 }, { "epoch": 1.5197704081632653, "grad_norm": 0.6920301297712828, "learning_rate": 1.3570775864858487e-06, "loss": 0.26047818660736083, "num_input_tokens_seen": 723382784, "step": 11915, "train_runtime": 155545.369, "train_tokens_per_second": 4650.622 }, { "epoch": 1.5204081632653061, "grad_norm": 0.7825761711802505, "learning_rate": 1.3536485276248768e-06, "loss": 0.24889864921569824, "num_input_tokens_seen": 723681840, "step": 11920, "train_runtime": 155607.433, "train_tokens_per_second": 4650.689 }, { "epoch": 1.521045918367347, "grad_norm": 0.6399928528672232, "learning_rate": 1.350223128132268e-06, "loss": 0.24691829681396485, "num_input_tokens_seen": 723983624, "step": 11925, "train_runtime": 155683.011, "train_tokens_per_second": 4650.37 }, { "epoch": 1.5216836734693877, "grad_norm": 0.728504362584846, "learning_rate": 1.3468013914456518e-06, "loss": 0.2515766143798828, "num_input_tokens_seen": 724282784, "step": 11930, "train_runtime": 155746.2417, "train_tokens_per_second": 4650.403 }, { "epoch": 1.5223214285714286, "grad_norm": 0.6493723109247684, "learning_rate": 1.3433833209989743e-06, "loss": 0.2518887996673584, "num_input_tokens_seen": 724577608, "step": 11935, "train_runtime": 155806.9747, "train_tokens_per_second": 4650.482 }, { "epoch": 1.5229591836734695, "grad_norm": 0.7027434732171063, "learning_rate": 1.3399689202225136e-06, "loss": 0.2504230737686157, "num_input_tokens_seen": 724872224, "step": 11940, "train_runtime": 155874.443, "train_tokens_per_second": 4650.36 }, { "epoch": 1.5235969387755102, "grad_norm": 0.6535899077544529, "learning_rate": 1.3365581925428594e-06, "loss": 0.253280782699585, "num_input_tokens_seen": 725180384, "step": 11945, "train_runtime": 155947.0663, "train_tokens_per_second": 4650.17 }, { "epoch": 1.524234693877551, "grad_norm": 0.707458938724632, "learning_rate": 1.3331511413829113e-06, "loss": 0.2489948272705078, "num_input_tokens_seen": 725483576, "step": 11950, "train_runtime": 156020.2085, "train_tokens_per_second": 4649.933 }, { "epoch": 1.524872448979592, "grad_norm": 0.8008707159298643, "learning_rate": 1.3297477701618833e-06, "loss": 0.2944218635559082, "num_input_tokens_seen": 725791648, "step": 11955, "train_runtime": 156091.9103, "train_tokens_per_second": 4649.771 }, { "epoch": 1.5255102040816326, "grad_norm": 0.6746720094362882, "learning_rate": 1.3263480822953011e-06, "loss": 0.24970026016235353, "num_input_tokens_seen": 726100440, "step": 11960, "train_runtime": 156155.1141, "train_tokens_per_second": 4649.867 }, { "epoch": 1.5261479591836735, "grad_norm": 0.7606976589129846, "learning_rate": 1.3229520811949836e-06, "loss": 0.2613847732543945, "num_input_tokens_seen": 726418864, "step": 11965, "train_runtime": 156213.7931, "train_tokens_per_second": 4650.158 }, { "epoch": 1.5267857142857144, "grad_norm": 0.673824089849578, "learning_rate": 1.3195597702690577e-06, "loss": 0.2561951160430908, "num_input_tokens_seen": 726713968, "step": 11970, "train_runtime": 156279.0687, "train_tokens_per_second": 4650.104 }, { "epoch": 1.527423469387755, "grad_norm": 0.6521630410082774, "learning_rate": 1.3161711529219434e-06, "loss": 0.24800543785095214, "num_input_tokens_seen": 726998080, "step": 11975, "train_runtime": 156344.8422, "train_tokens_per_second": 4649.965 }, { "epoch": 1.5280612244897958, "grad_norm": 0.664011278667914, "learning_rate": 1.3127862325543555e-06, "loss": 0.2613114356994629, "num_input_tokens_seen": 727314256, "step": 11980, "train_runtime": 156408.8857, "train_tokens_per_second": 4650.083 }, { "epoch": 1.5286989795918369, "grad_norm": 0.6800994302773266, "learning_rate": 1.3094050125632973e-06, "loss": 0.24103777408599852, "num_input_tokens_seen": 727614136, "step": 11985, "train_runtime": 156482.4272, "train_tokens_per_second": 4649.814 }, { "epoch": 1.5293367346938775, "grad_norm": 0.6575959516635664, "learning_rate": 1.30602749634206e-06, "loss": 0.26449012756347656, "num_input_tokens_seen": 727924752, "step": 11990, "train_runtime": 156534.2532, "train_tokens_per_second": 4650.259 }, { "epoch": 1.5299744897959182, "grad_norm": 0.6090825136182979, "learning_rate": 1.302653687280216e-06, "loss": 0.25784077644348147, "num_input_tokens_seen": 728228968, "step": 11995, "train_runtime": 156601.5897, "train_tokens_per_second": 4650.202 }, { "epoch": 1.5306122448979593, "grad_norm": 0.6375662939031023, "learning_rate": 1.299283588763619e-06, "loss": 0.2542006492614746, "num_input_tokens_seen": 728525984, "step": 12000, "train_runtime": 156670.3864, "train_tokens_per_second": 4650.055 }, { "epoch": 1.53125, "grad_norm": 0.6810512872276492, "learning_rate": 1.2959172041743985e-06, "loss": 0.2613798141479492, "num_input_tokens_seen": 728835224, "step": 12005, "train_runtime": 156732.5491, "train_tokens_per_second": 4650.184 }, { "epoch": 1.5318877551020407, "grad_norm": 0.733040943616195, "learning_rate": 1.2925545368909558e-06, "loss": 0.2360307455062866, "num_input_tokens_seen": 729121784, "step": 12010, "train_runtime": 156803.9519, "train_tokens_per_second": 4649.894 }, { "epoch": 1.5325255102040818, "grad_norm": 0.6912753074644812, "learning_rate": 1.289195590287965e-06, "loss": 0.25995163917541503, "num_input_tokens_seen": 729424080, "step": 12015, "train_runtime": 156864.734, "train_tokens_per_second": 4650.02 }, { "epoch": 1.5331632653061225, "grad_norm": 0.7037050729121367, "learning_rate": 1.285840367736358e-06, "loss": 0.25633811950683594, "num_input_tokens_seen": 729730768, "step": 12020, "train_runtime": 156924.8548, "train_tokens_per_second": 4650.192 }, { "epoch": 1.5338010204081631, "grad_norm": 0.6941207469555901, "learning_rate": 1.2824888726033391e-06, "loss": 0.2491147756576538, "num_input_tokens_seen": 730035304, "step": 12025, "train_runtime": 156992.9708, "train_tokens_per_second": 4650.115 }, { "epoch": 1.5344387755102042, "grad_norm": 0.6863693055640985, "learning_rate": 1.2791411082523692e-06, "loss": 0.2503811836242676, "num_input_tokens_seen": 730325824, "step": 12030, "train_runtime": 157058.949, "train_tokens_per_second": 4650.011 }, { "epoch": 1.535076530612245, "grad_norm": 0.6773444450347682, "learning_rate": 1.2757970780431594e-06, "loss": 0.27198493480682373, "num_input_tokens_seen": 730630584, "step": 12035, "train_runtime": 157134.4856, "train_tokens_per_second": 4649.715 }, { "epoch": 1.5357142857142856, "grad_norm": 0.7069076912015884, "learning_rate": 1.2724567853316788e-06, "loss": 0.24685401916503907, "num_input_tokens_seen": 730926424, "step": 12040, "train_runtime": 157212.3694, "train_tokens_per_second": 4649.293 }, { "epoch": 1.5363520408163265, "grad_norm": 0.6719480918536438, "learning_rate": 1.2691202334701474e-06, "loss": 0.2603030204772949, "num_input_tokens_seen": 731245296, "step": 12045, "train_runtime": 157282.4769, "train_tokens_per_second": 4649.248 }, { "epoch": 1.5369897959183674, "grad_norm": 0.6809489913946712, "learning_rate": 1.2657874258070247e-06, "loss": 0.24165427684783936, "num_input_tokens_seen": 731549024, "step": 12050, "train_runtime": 157352.4093, "train_tokens_per_second": 4649.112 }, { "epoch": 1.537627551020408, "grad_norm": 0.665830841555118, "learning_rate": 1.2624583656870153e-06, "loss": 0.24589719772338867, "num_input_tokens_seen": 731854376, "step": 12055, "train_runtime": 157413.2736, "train_tokens_per_second": 4649.255 }, { "epoch": 1.538265306122449, "grad_norm": 0.7004659243635903, "learning_rate": 1.2591330564510683e-06, "loss": 0.24840226173400878, "num_input_tokens_seen": 732146608, "step": 12060, "train_runtime": 157481.9292, "train_tokens_per_second": 4649.083 }, { "epoch": 1.5389030612244898, "grad_norm": 0.67867125984092, "learning_rate": 1.2558115014363592e-06, "loss": 0.2419034481048584, "num_input_tokens_seen": 732451520, "step": 12065, "train_runtime": 157558.0906, "train_tokens_per_second": 4648.771 }, { "epoch": 1.5395408163265305, "grad_norm": 0.6589380234833201, "learning_rate": 1.2524937039763025e-06, "loss": 0.25946569442749023, "num_input_tokens_seen": 732764640, "step": 12070, "train_runtime": 157617.0796, "train_tokens_per_second": 4649.018 }, { "epoch": 1.5401785714285714, "grad_norm": 0.6869336535457288, "learning_rate": 1.2491796674005385e-06, "loss": 0.2480013370513916, "num_input_tokens_seen": 733067904, "step": 12075, "train_runtime": 157688.603, "train_tokens_per_second": 4648.833 }, { "epoch": 1.5408163265306123, "grad_norm": 0.6493326430733583, "learning_rate": 1.2458693950349349e-06, "loss": 0.27153429985046384, "num_input_tokens_seen": 733376560, "step": 12080, "train_runtime": 157757.158, "train_tokens_per_second": 4648.769 }, { "epoch": 1.541454081632653, "grad_norm": 0.7245698269749907, "learning_rate": 1.2425628902015818e-06, "loss": 0.24982929229736328, "num_input_tokens_seen": 733668536, "step": 12085, "train_runtime": 157814.4223, "train_tokens_per_second": 4648.932 }, { "epoch": 1.5420918367346939, "grad_norm": 0.6548672882769807, "learning_rate": 1.2392601562187867e-06, "loss": 0.25737121105194094, "num_input_tokens_seen": 733967608, "step": 12090, "train_runtime": 157886.1355, "train_tokens_per_second": 4648.715 }, { "epoch": 1.5427295918367347, "grad_norm": 0.626716168682283, "learning_rate": 1.2359611964010747e-06, "loss": 0.26229133605957033, "num_input_tokens_seen": 734268424, "step": 12095, "train_runtime": 157953.518, "train_tokens_per_second": 4648.636 }, { "epoch": 1.5433673469387754, "grad_norm": 0.7023623923339372, "learning_rate": 1.2326660140591835e-06, "loss": 0.24214916229248046, "num_input_tokens_seen": 734570048, "step": 12100, "train_runtime": 158020.4129, "train_tokens_per_second": 4648.577 }, { "epoch": 1.5440051020408163, "grad_norm": 0.6458540208307123, "learning_rate": 1.2293746125000538e-06, "loss": 0.2654332876205444, "num_input_tokens_seen": 734878848, "step": 12105, "train_runtime": 158080.2557, "train_tokens_per_second": 4648.771 }, { "epoch": 1.5446428571428572, "grad_norm": 0.6321348613604179, "learning_rate": 1.2260869950268422e-06, "loss": 0.25348896980285646, "num_input_tokens_seen": 735169440, "step": 12110, "train_runtime": 158152.9672, "train_tokens_per_second": 4648.471 }, { "epoch": 1.5452806122448979, "grad_norm": 0.6215893303584566, "learning_rate": 1.2228031649389021e-06, "loss": 0.23989582061767578, "num_input_tokens_seen": 735470464, "step": 12115, "train_runtime": 158225.2378, "train_tokens_per_second": 4648.25 }, { "epoch": 1.5459183673469388, "grad_norm": 0.6630734645291291, "learning_rate": 1.2195231255317834e-06, "loss": 0.2431865692138672, "num_input_tokens_seen": 735778104, "step": 12120, "train_runtime": 158291.9873, "train_tokens_per_second": 4648.233 }, { "epoch": 1.5465561224489797, "grad_norm": 0.5979526128037281, "learning_rate": 1.2162468800972344e-06, "loss": 0.2632904052734375, "num_input_tokens_seen": 736087024, "step": 12125, "train_runtime": 158360.3683, "train_tokens_per_second": 4648.177 }, { "epoch": 1.5471938775510203, "grad_norm": 0.7078350457459534, "learning_rate": 1.2129744319232013e-06, "loss": 0.2559070587158203, "num_input_tokens_seen": 736400016, "step": 12130, "train_runtime": 158427.5125, "train_tokens_per_second": 4648.183 }, { "epoch": 1.5478316326530612, "grad_norm": 0.6967124468116201, "learning_rate": 1.2097057842938093e-06, "loss": 0.23843395709991455, "num_input_tokens_seen": 736714392, "step": 12135, "train_runtime": 158499.4134, "train_tokens_per_second": 4648.058 }, { "epoch": 1.5484693877551021, "grad_norm": 0.6847539702153206, "learning_rate": 1.206440940489375e-06, "loss": 0.2515080690383911, "num_input_tokens_seen": 737012256, "step": 12140, "train_runtime": 158557.999, "train_tokens_per_second": 4648.219 }, { "epoch": 1.5491071428571428, "grad_norm": 0.6025976955597792, "learning_rate": 1.203179903786401e-06, "loss": 0.2598711967468262, "num_input_tokens_seen": 737325784, "step": 12145, "train_runtime": 158620.8065, "train_tokens_per_second": 4648.355 }, { "epoch": 1.5497448979591837, "grad_norm": 0.6463825176551172, "learning_rate": 1.1999226774575618e-06, "loss": 0.24842023849487305, "num_input_tokens_seen": 737609096, "step": 12150, "train_runtime": 158687.6455, "train_tokens_per_second": 4648.182 }, { "epoch": 1.5503826530612246, "grad_norm": 0.6566695886080559, "learning_rate": 1.1966692647717127e-06, "loss": 0.2655647754669189, "num_input_tokens_seen": 737918056, "step": 12155, "train_runtime": 158750.0407, "train_tokens_per_second": 4648.302 }, { "epoch": 1.5510204081632653, "grad_norm": 0.603574418856841, "learning_rate": 1.1934196689938804e-06, "loss": 0.24559359550476073, "num_input_tokens_seen": 738225024, "step": 12160, "train_runtime": 158808.3636, "train_tokens_per_second": 4648.527 }, { "epoch": 1.5516581632653061, "grad_norm": 0.6730319896336483, "learning_rate": 1.1901738933852608e-06, "loss": 0.27126526832580566, "num_input_tokens_seen": 738522432, "step": 12165, "train_runtime": 158876.3494, "train_tokens_per_second": 4648.41 }, { "epoch": 1.552295918367347, "grad_norm": 0.7200139917166635, "learning_rate": 1.1869319412032171e-06, "loss": 0.23754267692565917, "num_input_tokens_seen": 738817336, "step": 12170, "train_runtime": 158941.2413, "train_tokens_per_second": 4648.368 }, { "epoch": 1.5529336734693877, "grad_norm": 0.6089938268511548, "learning_rate": 1.1836938157012746e-06, "loss": 0.23989269733428956, "num_input_tokens_seen": 739126784, "step": 12175, "train_runtime": 158990.99, "train_tokens_per_second": 4648.86 }, { "epoch": 1.5535714285714286, "grad_norm": 0.6955702361750687, "learning_rate": 1.180459520129118e-06, "loss": 0.2581769943237305, "num_input_tokens_seen": 739438768, "step": 12180, "train_runtime": 159052.7638, "train_tokens_per_second": 4649.016 }, { "epoch": 1.5542091836734695, "grad_norm": 0.6237399623312642, "learning_rate": 1.1772290577325895e-06, "loss": 0.26799817085266114, "num_input_tokens_seen": 739734376, "step": 12185, "train_runtime": 159125.1411, "train_tokens_per_second": 4648.759 }, { "epoch": 1.5548469387755102, "grad_norm": 1.0016838504443217, "learning_rate": 1.174002431753683e-06, "loss": 0.25603523254394533, "num_input_tokens_seen": 740027464, "step": 12190, "train_runtime": 159188.7785, "train_tokens_per_second": 4648.741 }, { "epoch": 1.555484693877551, "grad_norm": 0.6660423706946417, "learning_rate": 1.1707796454305437e-06, "loss": 0.23553390502929689, "num_input_tokens_seen": 740332856, "step": 12195, "train_runtime": 159257.0766, "train_tokens_per_second": 4648.665 }, { "epoch": 1.556122448979592, "grad_norm": 0.7377728105319677, "learning_rate": 1.167560701997462e-06, "loss": 0.23785796165466308, "num_input_tokens_seen": 740630472, "step": 12200, "train_runtime": 159322.3265, "train_tokens_per_second": 4648.63 }, { "epoch": 1.5567602040816326, "grad_norm": 0.6513154516722532, "learning_rate": 1.1643456046848745e-06, "loss": 0.2628336429595947, "num_input_tokens_seen": 740938432, "step": 12205, "train_runtime": 159377.7956, "train_tokens_per_second": 4648.944 }, { "epoch": 1.5573979591836735, "grad_norm": 0.7078302120378647, "learning_rate": 1.161134356719351e-06, "loss": 0.24759845733642577, "num_input_tokens_seen": 741239992, "step": 12210, "train_runtime": 159446.4784, "train_tokens_per_second": 4648.833 }, { "epoch": 1.5580357142857144, "grad_norm": 0.6849642774899249, "learning_rate": 1.1579269613236094e-06, "loss": 0.25596597194671633, "num_input_tokens_seen": 741543208, "step": 12215, "train_runtime": 159506.9488, "train_tokens_per_second": 4648.971 }, { "epoch": 1.558673469387755, "grad_norm": 0.6957177025296452, "learning_rate": 1.1547234217164904e-06, "loss": 0.24630370140075683, "num_input_tokens_seen": 741853032, "step": 12220, "train_runtime": 159567.633, "train_tokens_per_second": 4649.145 }, { "epoch": 1.5593112244897958, "grad_norm": 0.8110997041912901, "learning_rate": 1.1515237411129698e-06, "loss": 0.2798213005065918, "num_input_tokens_seen": 742146616, "step": 12225, "train_runtime": 159636.0723, "train_tokens_per_second": 4648.991 }, { "epoch": 1.5599489795918369, "grad_norm": 0.5939899974031979, "learning_rate": 1.148327922724155e-06, "loss": 0.2604410648345947, "num_input_tokens_seen": 742453680, "step": 12230, "train_runtime": 159700.2719, "train_tokens_per_second": 4649.045 }, { "epoch": 1.5605867346938775, "grad_norm": 0.6203420194491245, "learning_rate": 1.1451359697572684e-06, "loss": 0.24161162376403808, "num_input_tokens_seen": 742755152, "step": 12235, "train_runtime": 159772.5733, "train_tokens_per_second": 4648.828 }, { "epoch": 1.5612244897959182, "grad_norm": 0.6274593917407443, "learning_rate": 1.141947885415659e-06, "loss": 0.2437690258026123, "num_input_tokens_seen": 743055552, "step": 12240, "train_runtime": 159836.7285, "train_tokens_per_second": 4648.841 }, { "epoch": 1.5618622448979593, "grad_norm": 0.6859634198906147, "learning_rate": 1.1387636728987927e-06, "loss": 0.26891021728515624, "num_input_tokens_seen": 743348152, "step": 12245, "train_runtime": 159901.2782, "train_tokens_per_second": 4648.794 }, { "epoch": 1.5625, "grad_norm": 0.7543946247330733, "learning_rate": 1.135583335402249e-06, "loss": 0.2813580513000488, "num_input_tokens_seen": 743649088, "step": 12250, "train_runtime": 159975.996, "train_tokens_per_second": 4648.504 }, { "epoch": 1.5631377551020407, "grad_norm": 0.7375762686537727, "learning_rate": 1.1324068761177176e-06, "loss": 0.26078205108642577, "num_input_tokens_seen": 743956208, "step": 12255, "train_runtime": 160033.7913, "train_tokens_per_second": 4648.745 }, { "epoch": 1.5637755102040818, "grad_norm": 0.6320469685833705, "learning_rate": 1.129234298232999e-06, "loss": 0.23866262435913085, "num_input_tokens_seen": 744251880, "step": 12260, "train_runtime": 160105.4615, "train_tokens_per_second": 4648.51 }, { "epoch": 1.5644132653061225, "grad_norm": 0.7016221467512594, "learning_rate": 1.1260656049319957e-06, "loss": 0.25392653942108157, "num_input_tokens_seen": 744561384, "step": 12265, "train_runtime": 160180.8267, "train_tokens_per_second": 4648.255 }, { "epoch": 1.5650510204081631, "grad_norm": 0.6206845679523242, "learning_rate": 1.1229007993947122e-06, "loss": 0.22959496974945068, "num_input_tokens_seen": 744861632, "step": 12270, "train_runtime": 160256.3916, "train_tokens_per_second": 4647.937 }, { "epoch": 1.5656887755102042, "grad_norm": 0.635809068968366, "learning_rate": 1.119739884797253e-06, "loss": 0.2407773494720459, "num_input_tokens_seen": 745159520, "step": 12275, "train_runtime": 160328.2446, "train_tokens_per_second": 4647.712 }, { "epoch": 1.566326530612245, "grad_norm": 0.6135957879838808, "learning_rate": 1.116582864311816e-06, "loss": 0.2587071418762207, "num_input_tokens_seen": 745473160, "step": 12280, "train_runtime": 160398.0401, "train_tokens_per_second": 4647.645 }, { "epoch": 1.5669642857142856, "grad_norm": 0.6633182069955801, "learning_rate": 1.1134297411066925e-06, "loss": 0.25202369689941406, "num_input_tokens_seen": 745782512, "step": 12285, "train_runtime": 160458.8237, "train_tokens_per_second": 4647.812 }, { "epoch": 1.5676020408163265, "grad_norm": 0.7290278901024204, "learning_rate": 1.1102805183462605e-06, "loss": 0.2682202816009521, "num_input_tokens_seen": 746079024, "step": 12290, "train_runtime": 160531.6962, "train_tokens_per_second": 4647.55 }, { "epoch": 1.5682397959183674, "grad_norm": 0.680217591331704, "learning_rate": 1.1071351991909863e-06, "loss": 0.2658061504364014, "num_input_tokens_seen": 746387368, "step": 12295, "train_runtime": 160586.665, "train_tokens_per_second": 4647.879 }, { "epoch": 1.568877551020408, "grad_norm": 0.6669425109814144, "learning_rate": 1.1039937867974166e-06, "loss": 0.24722461700439452, "num_input_tokens_seen": 746695480, "step": 12300, "train_runtime": 160657.1925, "train_tokens_per_second": 4647.756 }, { "epoch": 1.569515306122449, "grad_norm": 0.6879081393123695, "learning_rate": 1.1008562843181796e-06, "loss": 0.24347903728485107, "num_input_tokens_seen": 747007624, "step": 12305, "train_runtime": 160707.9711, "train_tokens_per_second": 4648.23 }, { "epoch": 1.5701530612244898, "grad_norm": 0.6805344549483223, "learning_rate": 1.0977226949019743e-06, "loss": 0.25902271270751953, "num_input_tokens_seen": 747317696, "step": 12310, "train_runtime": 160774.188, "train_tokens_per_second": 4648.244 }, { "epoch": 1.5707908163265305, "grad_norm": 0.690352949680991, "learning_rate": 1.09459302169358e-06, "loss": 0.26403059959411623, "num_input_tokens_seen": 747607568, "step": 12315, "train_runtime": 160840.4773, "train_tokens_per_second": 4648.131 }, { "epoch": 1.5714285714285714, "grad_norm": 0.5855693473094103, "learning_rate": 1.0914672678338434e-06, "loss": 0.24433636665344238, "num_input_tokens_seen": 747925216, "step": 12320, "train_runtime": 160912.6931, "train_tokens_per_second": 4648.019 }, { "epoch": 1.5720663265306123, "grad_norm": 0.6064300330678128, "learning_rate": 1.088345436459673e-06, "loss": 0.253980016708374, "num_input_tokens_seen": 748233008, "step": 12325, "train_runtime": 160964.3216, "train_tokens_per_second": 4648.44 }, { "epoch": 1.572704081632653, "grad_norm": 0.6585216485835502, "learning_rate": 1.0852275307040454e-06, "loss": 0.2468017578125, "num_input_tokens_seen": 748531304, "step": 12330, "train_runtime": 161039.2322, "train_tokens_per_second": 4648.13 }, { "epoch": 1.5733418367346939, "grad_norm": 0.9329390462393788, "learning_rate": 1.082113553696001e-06, "loss": 0.2438680648803711, "num_input_tokens_seen": 748829480, "step": 12335, "train_runtime": 161106.0483, "train_tokens_per_second": 4648.053 }, { "epoch": 1.5739795918367347, "grad_norm": 0.6342739903657667, "learning_rate": 1.0790035085606282e-06, "loss": 0.2425311803817749, "num_input_tokens_seen": 749126768, "step": 12340, "train_runtime": 161177.8775, "train_tokens_per_second": 4647.826 }, { "epoch": 1.5746173469387754, "grad_norm": 0.6580289275192713, "learning_rate": 1.0758973984190764e-06, "loss": 0.2524994373321533, "num_input_tokens_seen": 749431224, "step": 12345, "train_runtime": 161244.4081, "train_tokens_per_second": 4647.797 }, { "epoch": 1.5752551020408163, "grad_norm": 0.6234385628360789, "learning_rate": 1.072795226388544e-06, "loss": 0.2606823444366455, "num_input_tokens_seen": 749740744, "step": 12350, "train_runtime": 161309.4357, "train_tokens_per_second": 4647.842 }, { "epoch": 1.5758928571428572, "grad_norm": 0.6702496133284668, "learning_rate": 1.0696969955822772e-06, "loss": 0.26224217414855955, "num_input_tokens_seen": 750049528, "step": 12355, "train_runtime": 161364.2733, "train_tokens_per_second": 4648.176 }, { "epoch": 1.5765306122448979, "grad_norm": 0.755795291137064, "learning_rate": 1.0666027091095672e-06, "loss": 0.26146037578582765, "num_input_tokens_seen": 750354768, "step": 12360, "train_runtime": 161422.5277, "train_tokens_per_second": 4648.389 }, { "epoch": 1.5771683673469388, "grad_norm": 0.6517319605002192, "learning_rate": 1.063512370075746e-06, "loss": 0.26197237968444825, "num_input_tokens_seen": 750665432, "step": 12365, "train_runtime": 161496.964, "train_tokens_per_second": 4648.171 }, { "epoch": 1.5778061224489797, "grad_norm": 0.651251326730073, "learning_rate": 1.060425981582186e-06, "loss": 0.2529475688934326, "num_input_tokens_seen": 750965168, "step": 12370, "train_runtime": 161567.0836, "train_tokens_per_second": 4648.008 }, { "epoch": 1.5784438775510203, "grad_norm": 0.7758776621921266, "learning_rate": 1.0573435467262922e-06, "loss": 0.2558449268341064, "num_input_tokens_seen": 751272352, "step": 12375, "train_runtime": 161630.7318, "train_tokens_per_second": 4648.079 }, { "epoch": 1.5790816326530612, "grad_norm": 0.7109361021397126, "learning_rate": 1.0542650686015039e-06, "loss": 0.25114145278930666, "num_input_tokens_seen": 751568720, "step": 12380, "train_runtime": 161690.0745, "train_tokens_per_second": 4648.206 }, { "epoch": 1.5797193877551021, "grad_norm": 0.7577522354548263, "learning_rate": 1.0511905502972885e-06, "loss": 0.2342022180557251, "num_input_tokens_seen": 751854528, "step": 12385, "train_runtime": 161756.5953, "train_tokens_per_second": 4648.061 }, { "epoch": 1.5803571428571428, "grad_norm": 0.6628391627410214, "learning_rate": 1.0481199948991416e-06, "loss": 0.2556438446044922, "num_input_tokens_seen": 752152672, "step": 12390, "train_runtime": 161827.3768, "train_tokens_per_second": 4647.87 }, { "epoch": 1.5809948979591837, "grad_norm": 0.5925759235289038, "learning_rate": 1.0450534054885765e-06, "loss": 0.24029622077941895, "num_input_tokens_seen": 752451632, "step": 12395, "train_runtime": 161894.0761, "train_tokens_per_second": 4647.802 }, { "epoch": 1.5816326530612246, "grad_norm": 0.6436167380481044, "learning_rate": 1.0419907851431321e-06, "loss": 0.24811995029449463, "num_input_tokens_seen": 752748848, "step": 12400, "train_runtime": 161967.8942, "train_tokens_per_second": 4647.519 }, { "epoch": 1.5822704081632653, "grad_norm": 0.5683408987596007, "learning_rate": 1.0389321369363636e-06, "loss": 0.252943229675293, "num_input_tokens_seen": 753048504, "step": 12405, "train_runtime": 162044.2892, "train_tokens_per_second": 4647.177 }, { "epoch": 1.5829081632653061, "grad_norm": 0.7459873593609917, "learning_rate": 1.0358774639378344e-06, "loss": 0.24510138034820556, "num_input_tokens_seen": 753350536, "step": 12410, "train_runtime": 162106.7656, "train_tokens_per_second": 4647.249 }, { "epoch": 1.583545918367347, "grad_norm": 0.6015788491277244, "learning_rate": 1.0328267692131227e-06, "loss": 0.23749666213989257, "num_input_tokens_seen": 753655064, "step": 12415, "train_runtime": 162181.177, "train_tokens_per_second": 4646.995 }, { "epoch": 1.5841836734693877, "grad_norm": 0.6346068440396071, "learning_rate": 1.0297800558238175e-06, "loss": 0.2700827598571777, "num_input_tokens_seen": 753965960, "step": 12420, "train_runtime": 162241.871, "train_tokens_per_second": 4647.172 }, { "epoch": 1.5848214285714286, "grad_norm": 0.6181126675184303, "learning_rate": 1.026737326827505e-06, "loss": 0.2491556167602539, "num_input_tokens_seen": 754261800, "step": 12425, "train_runtime": 162314.88, "train_tokens_per_second": 4646.905 }, { "epoch": 1.5854591836734695, "grad_norm": 0.6400739322880858, "learning_rate": 1.0236985852777748e-06, "loss": 0.22559471130371095, "num_input_tokens_seen": 754566128, "step": 12430, "train_runtime": 162386.383, "train_tokens_per_second": 4646.733 }, { "epoch": 1.5860969387755102, "grad_norm": 0.6611720183258928, "learning_rate": 1.020663834224222e-06, "loss": 0.25476698875427245, "num_input_tokens_seen": 754874792, "step": 12435, "train_runtime": 162439.4803, "train_tokens_per_second": 4647.114 }, { "epoch": 1.586734693877551, "grad_norm": 0.6717042386516047, "learning_rate": 1.017633076712426e-06, "loss": 0.2633042335510254, "num_input_tokens_seen": 755183832, "step": 12440, "train_runtime": 162507.3109, "train_tokens_per_second": 4647.076 }, { "epoch": 1.587372448979592, "grad_norm": 0.6448707254906307, "learning_rate": 1.0146063157839653e-06, "loss": 0.24064431190490723, "num_input_tokens_seen": 755483224, "step": 12445, "train_runtime": 162562.8587, "train_tokens_per_second": 4647.33 }, { "epoch": 1.5880102040816326, "grad_norm": 0.6782417280961641, "learning_rate": 1.0115835544764063e-06, "loss": 0.2448643207550049, "num_input_tokens_seen": 755793864, "step": 12450, "train_runtime": 162642.277, "train_tokens_per_second": 4646.971 }, { "epoch": 1.5886479591836735, "grad_norm": 0.730241214502829, "learning_rate": 1.0085647958233008e-06, "loss": 0.23660359382629395, "num_input_tokens_seen": 756095472, "step": 12455, "train_runtime": 162703.9159, "train_tokens_per_second": 4647.064 }, { "epoch": 1.5892857142857144, "grad_norm": 0.6339507181811259, "learning_rate": 1.0055500428541836e-06, "loss": 0.23841919898986816, "num_input_tokens_seen": 756410888, "step": 12460, "train_runtime": 162769.9956, "train_tokens_per_second": 4647.115 }, { "epoch": 1.589923469387755, "grad_norm": 0.7954503791909062, "learning_rate": 1.0025392985945703e-06, "loss": 0.25959603786468505, "num_input_tokens_seen": 756716856, "step": 12465, "train_runtime": 162823.6443, "train_tokens_per_second": 4647.463 }, { "epoch": 1.5905612244897958, "grad_norm": 0.6330852145188037, "learning_rate": 9.995325660659533e-07, "loss": 0.25395450592041013, "num_input_tokens_seen": 757020568, "step": 12470, "train_runtime": 162902.8794, "train_tokens_per_second": 4647.067 }, { "epoch": 1.5911989795918369, "grad_norm": 0.6568184414599136, "learning_rate": 9.965298482857993e-07, "loss": 0.25415830612182616, "num_input_tokens_seen": 757323152, "step": 12475, "train_runtime": 162964.734, "train_tokens_per_second": 4647.16 }, { "epoch": 1.5918367346938775, "grad_norm": 0.6240054378691067, "learning_rate": 9.935311482675413e-07, "loss": 0.2535807371139526, "num_input_tokens_seen": 757630000, "step": 12480, "train_runtime": 163028.3631, "train_tokens_per_second": 4647.228 }, { "epoch": 1.5924744897959182, "grad_norm": 0.6457252261362081, "learning_rate": 9.905364690205888e-07, "loss": 0.2578327417373657, "num_input_tokens_seen": 757940600, "step": 12485, "train_runtime": 163092.1774, "train_tokens_per_second": 4647.314 }, { "epoch": 1.5931122448979593, "grad_norm": 0.6839511232994004, "learning_rate": 9.875458135503113e-07, "loss": 0.26314606666564944, "num_input_tokens_seen": 758251840, "step": 12490, "train_runtime": 163157.0738, "train_tokens_per_second": 4647.373 }, { "epoch": 1.59375, "grad_norm": 0.663254212663678, "learning_rate": 9.845591848580376e-07, "loss": 0.23812398910522461, "num_input_tokens_seen": 758555896, "step": 12495, "train_runtime": 163235.6326, "train_tokens_per_second": 4646.999 }, { "epoch": 1.5943877551020407, "grad_norm": 0.6812542727199498, "learning_rate": 9.815765859410586e-07, "loss": 0.269971227645874, "num_input_tokens_seen": 758850688, "step": 12500, "train_runtime": 163302.0593, "train_tokens_per_second": 4646.914 }, { "epoch": 1.5950255102040818, "grad_norm": 0.6430649487312459, "learning_rate": 9.785980197926242e-07, "loss": 0.24490811824798583, "num_input_tokens_seen": 759157776, "step": 12505, "train_runtime": 163369.5905, "train_tokens_per_second": 4646.873 }, { "epoch": 1.5956632653061225, "grad_norm": 0.6769972255789957, "learning_rate": 9.7562348940193e-07, "loss": 0.25566740036010743, "num_input_tokens_seen": 759468720, "step": 12510, "train_runtime": 163438.4854, "train_tokens_per_second": 4646.817 }, { "epoch": 1.5963010204081631, "grad_norm": 0.6413108724848737, "learning_rate": 9.726529977541243e-07, "loss": 0.24758310317993165, "num_input_tokens_seen": 759783072, "step": 12515, "train_runtime": 163496.7421, "train_tokens_per_second": 4647.084 }, { "epoch": 1.5969387755102042, "grad_norm": 0.6876242906005937, "learning_rate": 9.696865478303075e-07, "loss": 0.24775145053863526, "num_input_tokens_seen": 760088384, "step": 12520, "train_runtime": 163559.2065, "train_tokens_per_second": 4647.176 }, { "epoch": 1.597576530612245, "grad_norm": 0.6154892690237602, "learning_rate": 9.667241426075152e-07, "loss": 0.26232051849365234, "num_input_tokens_seen": 760400232, "step": 12525, "train_runtime": 163628.499, "train_tokens_per_second": 4647.114 }, { "epoch": 1.5982142857142856, "grad_norm": 0.7051712926015147, "learning_rate": 9.637657850587289e-07, "loss": 0.25011744499206545, "num_input_tokens_seen": 760702064, "step": 12530, "train_runtime": 163695.1537, "train_tokens_per_second": 4647.065 }, { "epoch": 1.5988520408163265, "grad_norm": 0.6263122887546746, "learning_rate": 9.608114781528671e-07, "loss": 0.22640318870544435, "num_input_tokens_seen": 760993656, "step": 12535, "train_runtime": 163763.9541, "train_tokens_per_second": 4646.894 }, { "epoch": 1.5994897959183674, "grad_norm": 0.8739539461244864, "learning_rate": 9.578612248547836e-07, "loss": 0.25423121452331543, "num_input_tokens_seen": 761293168, "step": 12540, "train_runtime": 163831.0134, "train_tokens_per_second": 4646.82 }, { "epoch": 1.600127551020408, "grad_norm": 0.6684990455461551, "learning_rate": 9.549150281252633e-07, "loss": 0.24723145961761475, "num_input_tokens_seen": 761597688, "step": 12545, "train_runtime": 163894.8582, "train_tokens_per_second": 4646.867 }, { "epoch": 1.600765306122449, "grad_norm": 0.6423018731637105, "learning_rate": 9.519728909210202e-07, "loss": 0.2562461614608765, "num_input_tokens_seen": 761898112, "step": 12550, "train_runtime": 163966.9091, "train_tokens_per_second": 4646.658 }, { "epoch": 1.6014030612244898, "grad_norm": 0.6717204273912907, "learning_rate": 9.49034816194695e-07, "loss": 0.24855079650878906, "num_input_tokens_seen": 762201840, "step": 12555, "train_runtime": 164025.806, "train_tokens_per_second": 4646.841 }, { "epoch": 1.6020408163265305, "grad_norm": 0.6531453875530732, "learning_rate": 9.461008068948502e-07, "loss": 0.25662262439727784, "num_input_tokens_seen": 762511008, "step": 12560, "train_runtime": 164092.7065, "train_tokens_per_second": 4646.831 }, { "epoch": 1.6026785714285714, "grad_norm": 0.6070432186468975, "learning_rate": 9.431708659659694e-07, "loss": 0.2622831344604492, "num_input_tokens_seen": 762819600, "step": 12565, "train_runtime": 164154.4675, "train_tokens_per_second": 4646.962 }, { "epoch": 1.6033163265306123, "grad_norm": 0.73515273248632, "learning_rate": 9.402449963484528e-07, "loss": 0.2846518516540527, "num_input_tokens_seen": 763114568, "step": 12570, "train_runtime": 164218.8269, "train_tokens_per_second": 4646.937 }, { "epoch": 1.603954081632653, "grad_norm": 0.6320718832689852, "learning_rate": 9.373232009786154e-07, "loss": 0.25565176010131835, "num_input_tokens_seen": 763426824, "step": 12575, "train_runtime": 164290.0544, "train_tokens_per_second": 4646.823 }, { "epoch": 1.6045918367346939, "grad_norm": 0.6435414856314439, "learning_rate": 9.344054827886839e-07, "loss": 0.24167089462280272, "num_input_tokens_seen": 763735968, "step": 12580, "train_runtime": 164349.7934, "train_tokens_per_second": 4647.015 }, { "epoch": 1.6052295918367347, "grad_norm": 0.6775080813258296, "learning_rate": 9.314918447067877e-07, "loss": 0.25985682010650635, "num_input_tokens_seen": 764041712, "step": 12585, "train_runtime": 164415.7592, "train_tokens_per_second": 4647.01 }, { "epoch": 1.6058673469387754, "grad_norm": 0.6539921493558628, "learning_rate": 9.285822896569724e-07, "loss": 0.2366727590560913, "num_input_tokens_seen": 764362000, "step": 12590, "train_runtime": 164477.1793, "train_tokens_per_second": 4647.222 }, { "epoch": 1.6065051020408163, "grad_norm": 0.6916270860827861, "learning_rate": 9.256768205591754e-07, "loss": 0.2414870262145996, "num_input_tokens_seen": 764667152, "step": 12595, "train_runtime": 164546.0853, "train_tokens_per_second": 4647.131 }, { "epoch": 1.6071428571428572, "grad_norm": 0.5895810637455151, "learning_rate": 9.227754403292377e-07, "loss": 0.2509591579437256, "num_input_tokens_seen": 764968712, "step": 12600, "train_runtime": 164593.4889, "train_tokens_per_second": 4647.624 }, { "epoch": 1.6077806122448979, "grad_norm": 0.7110181866293258, "learning_rate": 9.198781518789007e-07, "loss": 0.25958638191223143, "num_input_tokens_seen": 765281152, "step": 12605, "train_runtime": 164650.7227, "train_tokens_per_second": 4647.906 }, { "epoch": 1.6084183673469388, "grad_norm": 0.6421934326938831, "learning_rate": 9.169849581157925e-07, "loss": 0.26078200340270996, "num_input_tokens_seen": 765588280, "step": 12610, "train_runtime": 164710.0853, "train_tokens_per_second": 4648.096 }, { "epoch": 1.6090561224489797, "grad_norm": 0.7019644430031099, "learning_rate": 9.140958619434353e-07, "loss": 0.24608101844787597, "num_input_tokens_seen": 765895232, "step": 12615, "train_runtime": 164769.8889, "train_tokens_per_second": 4648.272 }, { "epoch": 1.6096938775510203, "grad_norm": 0.6613627444193002, "learning_rate": 9.112108662612401e-07, "loss": 0.24444227218627929, "num_input_tokens_seen": 766209152, "step": 12620, "train_runtime": 164829.6191, "train_tokens_per_second": 4648.492 }, { "epoch": 1.6103316326530612, "grad_norm": 0.6655626500240223, "learning_rate": 9.083299739645007e-07, "loss": 0.25504388809204104, "num_input_tokens_seen": 766515456, "step": 12625, "train_runtime": 164890.7621, "train_tokens_per_second": 4648.626 }, { "epoch": 1.6109693877551021, "grad_norm": 0.6664621269846308, "learning_rate": 9.054531879443945e-07, "loss": 0.24010090827941893, "num_input_tokens_seen": 766811560, "step": 12630, "train_runtime": 164954.2327, "train_tokens_per_second": 4648.632 }, { "epoch": 1.6116071428571428, "grad_norm": 0.7012525846119625, "learning_rate": 9.025805110879765e-07, "loss": 0.23866443634033202, "num_input_tokens_seen": 767105144, "step": 12635, "train_runtime": 165026.8157, "train_tokens_per_second": 4648.367 }, { "epoch": 1.6122448979591837, "grad_norm": 0.6761558011488014, "learning_rate": 8.997119462781784e-07, "loss": 0.26564598083496094, "num_input_tokens_seen": 767407136, "step": 12640, "train_runtime": 165088.5375, "train_tokens_per_second": 4648.458 }, { "epoch": 1.6128826530612246, "grad_norm": 0.6257364716430434, "learning_rate": 8.968474963938062e-07, "loss": 0.2686514377593994, "num_input_tokens_seen": 767714440, "step": 12645, "train_runtime": 165147.3166, "train_tokens_per_second": 4648.664 }, { "epoch": 1.6135204081632653, "grad_norm": 0.6518750582262893, "learning_rate": 8.939871643095344e-07, "loss": 0.24472124576568605, "num_input_tokens_seen": 768028176, "step": 12650, "train_runtime": 165214.0288, "train_tokens_per_second": 4648.686 }, { "epoch": 1.6141581632653061, "grad_norm": 0.9517786978644486, "learning_rate": 8.911309528959072e-07, "loss": 0.23885109424591064, "num_input_tokens_seen": 768310720, "step": 12655, "train_runtime": 165278.177, "train_tokens_per_second": 4648.591 }, { "epoch": 1.614795918367347, "grad_norm": 0.6710515862145993, "learning_rate": 8.882788650193308e-07, "loss": 0.25642588138580324, "num_input_tokens_seen": 768609424, "step": 12660, "train_runtime": 165350.9736, "train_tokens_per_second": 4648.351 }, { "epoch": 1.6154336734693877, "grad_norm": 0.7388780230675929, "learning_rate": 8.854309035420772e-07, "loss": 0.24589982032775878, "num_input_tokens_seen": 768910864, "step": 12665, "train_runtime": 165424.8765, "train_tokens_per_second": 4648.097 }, { "epoch": 1.6160714285714286, "grad_norm": 0.5957853216469311, "learning_rate": 8.8258707132227e-07, "loss": 0.24904451370239258, "num_input_tokens_seen": 769224144, "step": 12670, "train_runtime": 165489.6155, "train_tokens_per_second": 4648.172 }, { "epoch": 1.6167091836734695, "grad_norm": 0.7132504903398998, "learning_rate": 8.797473712138976e-07, "loss": 0.2533883571624756, "num_input_tokens_seen": 769534752, "step": 12675, "train_runtime": 165557.229, "train_tokens_per_second": 4648.15 }, { "epoch": 1.6173469387755102, "grad_norm": 1.095703129087896, "learning_rate": 8.769118060667969e-07, "loss": 0.26964540481567384, "num_input_tokens_seen": 769849432, "step": 12680, "train_runtime": 165623.9959, "train_tokens_per_second": 4648.176 }, { "epoch": 1.617984693877551, "grad_norm": 0.5650373890406885, "learning_rate": 8.740803787266522e-07, "loss": 0.24618177413940429, "num_input_tokens_seen": 770147568, "step": 12685, "train_runtime": 165689.3216, "train_tokens_per_second": 4648.142 }, { "epoch": 1.618622448979592, "grad_norm": 0.691918460107524, "learning_rate": 8.712530920350026e-07, "loss": 0.2687231540679932, "num_input_tokens_seen": 770452992, "step": 12690, "train_runtime": 165756.7138, "train_tokens_per_second": 4648.095 }, { "epoch": 1.6192602040816326, "grad_norm": 0.6717102323006657, "learning_rate": 8.684299488292275e-07, "loss": 0.25114462375640867, "num_input_tokens_seen": 770747832, "step": 12695, "train_runtime": 165831.2316, "train_tokens_per_second": 4647.785 }, { "epoch": 1.6198979591836735, "grad_norm": 0.6485772922668345, "learning_rate": 8.656109519425454e-07, "loss": 0.24409866333007812, "num_input_tokens_seen": 771058800, "step": 12700, "train_runtime": 165893.6085, "train_tokens_per_second": 4647.911 }, { "epoch": 1.6205357142857144, "grad_norm": 0.6370709899706526, "learning_rate": 8.627961042040183e-07, "loss": 0.260186767578125, "num_input_tokens_seen": 771367112, "step": 12705, "train_runtime": 165957.67, "train_tokens_per_second": 4647.975 }, { "epoch": 1.621173469387755, "grad_norm": 0.6552549424628946, "learning_rate": 8.599854084385422e-07, "loss": 0.2518947601318359, "num_input_tokens_seen": 771673080, "step": 12710, "train_runtime": 166022.1598, "train_tokens_per_second": 4648.013 }, { "epoch": 1.6218112244897958, "grad_norm": 0.6712303761106847, "learning_rate": 8.571788674668469e-07, "loss": 0.2479722499847412, "num_input_tokens_seen": 771961968, "step": 12715, "train_runtime": 166094.98, "train_tokens_per_second": 4647.714 }, { "epoch": 1.6224489795918369, "grad_norm": 0.6403917027777989, "learning_rate": 8.543764841054919e-07, "loss": 0.2650299072265625, "num_input_tokens_seen": 772271248, "step": 12720, "train_runtime": 166157.5141, "train_tokens_per_second": 4647.826 }, { "epoch": 1.6230867346938775, "grad_norm": 0.6207948302831311, "learning_rate": 8.515782611668649e-07, "loss": 0.24235401153564454, "num_input_tokens_seen": 772580152, "step": 12725, "train_runtime": 166222.6592, "train_tokens_per_second": 4647.863 }, { "epoch": 1.6237244897959182, "grad_norm": 0.6235366276277365, "learning_rate": 8.487842014591779e-07, "loss": 0.2494971752166748, "num_input_tokens_seen": 772893608, "step": 12730, "train_runtime": 166298.9091, "train_tokens_per_second": 4647.617 }, { "epoch": 1.6243622448979593, "grad_norm": 0.6475420590957922, "learning_rate": 8.459943077864651e-07, "loss": 0.2487192392349243, "num_input_tokens_seen": 773206664, "step": 12735, "train_runtime": 166357.1118, "train_tokens_per_second": 4647.873 }, { "epoch": 1.625, "grad_norm": 0.6043118267700197, "learning_rate": 8.432085829485792e-07, "loss": 0.23452670574188234, "num_input_tokens_seen": 773511840, "step": 12740, "train_runtime": 166419.6854, "train_tokens_per_second": 4647.959 }, { "epoch": 1.6256377551020407, "grad_norm": 0.6258257029860365, "learning_rate": 8.404270297411904e-07, "loss": 0.23406319618225097, "num_input_tokens_seen": 773795056, "step": 12745, "train_runtime": 166489.5778, "train_tokens_per_second": 4647.709 }, { "epoch": 1.6262755102040818, "grad_norm": 0.6748373692673187, "learning_rate": 8.376496509557808e-07, "loss": 0.24109892845153807, "num_input_tokens_seen": 774086496, "step": 12750, "train_runtime": 166558.0852, "train_tokens_per_second": 4647.547 }, { "epoch": 1.6269132653061225, "grad_norm": 0.5912168780820537, "learning_rate": 8.348764493796447e-07, "loss": 0.2351205587387085, "num_input_tokens_seen": 774407344, "step": 12755, "train_runtime": 166612.9101, "train_tokens_per_second": 4647.943 }, { "epoch": 1.6275510204081631, "grad_norm": 0.6398902840648175, "learning_rate": 8.321074277958835e-07, "loss": 0.22835516929626465, "num_input_tokens_seen": 774713704, "step": 12760, "train_runtime": 166680.5548, "train_tokens_per_second": 4647.895 }, { "epoch": 1.6281887755102042, "grad_norm": 0.600158707800418, "learning_rate": 8.293425889834045e-07, "loss": 0.24194543361663817, "num_input_tokens_seen": 775024480, "step": 12765, "train_runtime": 166748.931, "train_tokens_per_second": 4647.853 }, { "epoch": 1.628826530612245, "grad_norm": 0.649943783495159, "learning_rate": 8.265819357169124e-07, "loss": 0.25502166748046873, "num_input_tokens_seen": 775311536, "step": 12770, "train_runtime": 166819.561, "train_tokens_per_second": 4647.606 }, { "epoch": 1.6294642857142856, "grad_norm": 0.6760333282071129, "learning_rate": 8.238254707669208e-07, "loss": 0.24874403476715087, "num_input_tokens_seen": 775627888, "step": 12775, "train_runtime": 166894.9868, "train_tokens_per_second": 4647.401 }, { "epoch": 1.6301020408163265, "grad_norm": 0.6916972987662771, "learning_rate": 8.210731968997331e-07, "loss": 0.2492523431777954, "num_input_tokens_seen": 775932416, "step": 12780, "train_runtime": 166959.6287, "train_tokens_per_second": 4647.425 }, { "epoch": 1.6307397959183674, "grad_norm": 0.6405934150651219, "learning_rate": 8.183251168774476e-07, "loss": 0.26210508346557615, "num_input_tokens_seen": 776250104, "step": 12785, "train_runtime": 167024.186, "train_tokens_per_second": 4647.531 }, { "epoch": 1.631377551020408, "grad_norm": 0.6984561798431718, "learning_rate": 8.155812334579532e-07, "loss": 0.26555054187774657, "num_input_tokens_seen": 776555176, "step": 12790, "train_runtime": 167088.2304, "train_tokens_per_second": 4647.576 }, { "epoch": 1.632015306122449, "grad_norm": 0.6725511432312967, "learning_rate": 8.128415493949326e-07, "loss": 0.24640944004058837, "num_input_tokens_seen": 776859304, "step": 12795, "train_runtime": 167158.2613, "train_tokens_per_second": 4647.448 }, { "epoch": 1.6326530612244898, "grad_norm": 0.7031564911090373, "learning_rate": 8.101060674378463e-07, "loss": 0.25874876976013184, "num_input_tokens_seen": 777159832, "step": 12800, "train_runtime": 167227.9464, "train_tokens_per_second": 4647.308 }, { "epoch": 1.6332908163265305, "grad_norm": 0.6419896032981751, "learning_rate": 8.073747903319418e-07, "loss": 0.24507718086242675, "num_input_tokens_seen": 777445384, "step": 12805, "train_runtime": 167288.2821, "train_tokens_per_second": 4647.339 }, { "epoch": 1.6339285714285714, "grad_norm": 0.6945349273462113, "learning_rate": 8.046477208182501e-07, "loss": 0.268278980255127, "num_input_tokens_seen": 777738600, "step": 12810, "train_runtime": 167357.3929, "train_tokens_per_second": 4647.172 }, { "epoch": 1.6345663265306123, "grad_norm": 0.6192297441163143, "learning_rate": 8.019248616335717e-07, "loss": 0.26207268238067627, "num_input_tokens_seen": 778042536, "step": 12815, "train_runtime": 167423.4732, "train_tokens_per_second": 4647.153 }, { "epoch": 1.635204081632653, "grad_norm": 0.6679164110253424, "learning_rate": 7.992062155104879e-07, "loss": 0.2402644395828247, "num_input_tokens_seen": 778347480, "step": 12820, "train_runtime": 167485.8631, "train_tokens_per_second": 4647.243 }, { "epoch": 1.6358418367346939, "grad_norm": 0.7196758258318408, "learning_rate": 7.964917851773496e-07, "loss": 0.263356351852417, "num_input_tokens_seen": 778652856, "step": 12825, "train_runtime": 167554.5656, "train_tokens_per_second": 4647.16 }, { "epoch": 1.6364795918367347, "grad_norm": 0.6713829114133978, "learning_rate": 7.937815733582771e-07, "loss": 0.26779518127441404, "num_input_tokens_seen": 778960296, "step": 12830, "train_runtime": 167614.0902, "train_tokens_per_second": 4647.344 }, { "epoch": 1.6371173469387754, "grad_norm": 0.5928561672777125, "learning_rate": 7.910755827731576e-07, "loss": 0.23808066844940184, "num_input_tokens_seen": 779262384, "step": 12835, "train_runtime": 167687.292, "train_tokens_per_second": 4647.117 }, { "epoch": 1.6377551020408163, "grad_norm": 0.6671776925554667, "learning_rate": 7.883738161376414e-07, "loss": 0.23737592697143556, "num_input_tokens_seen": 779563184, "step": 12840, "train_runtime": 167748.5715, "train_tokens_per_second": 4647.212 }, { "epoch": 1.6383928571428572, "grad_norm": 0.6871976813821795, "learning_rate": 7.856762761631398e-07, "loss": 0.24407224655151366, "num_input_tokens_seen": 779881240, "step": 12845, "train_runtime": 167818.4208, "train_tokens_per_second": 4647.173 }, { "epoch": 1.6390306122448979, "grad_norm": 0.7142196653106222, "learning_rate": 7.829829655568239e-07, "loss": 0.2409985065460205, "num_input_tokens_seen": 780172920, "step": 12850, "train_runtime": 167881.531, "train_tokens_per_second": 4647.163 }, { "epoch": 1.6396683673469388, "grad_norm": 0.7376532862214654, "learning_rate": 7.802938870216159e-07, "loss": 0.255547308921814, "num_input_tokens_seen": 780480104, "step": 12855, "train_runtime": 167948.5035, "train_tokens_per_second": 4647.139 }, { "epoch": 1.6403061224489797, "grad_norm": 0.6089057538564588, "learning_rate": 7.776090432561967e-07, "loss": 0.229118275642395, "num_input_tokens_seen": 780783224, "step": 12860, "train_runtime": 168011.6113, "train_tokens_per_second": 4647.198 }, { "epoch": 1.6409438775510203, "grad_norm": 0.7440044578666771, "learning_rate": 7.749284369549954e-07, "loss": 0.27794227600097654, "num_input_tokens_seen": 781090976, "step": 12865, "train_runtime": 168076.9357, "train_tokens_per_second": 4647.223 }, { "epoch": 1.6415816326530612, "grad_norm": 0.660081761218456, "learning_rate": 7.722520708081843e-07, "loss": 0.24514400959014893, "num_input_tokens_seen": 781398792, "step": 12870, "train_runtime": 168144.6422, "train_tokens_per_second": 4647.182 }, { "epoch": 1.6422193877551021, "grad_norm": 0.6957063767801462, "learning_rate": 7.695799475016846e-07, "loss": 0.2551210880279541, "num_input_tokens_seen": 781715312, "step": 12875, "train_runtime": 168195.7598, "train_tokens_per_second": 4647.652 }, { "epoch": 1.6428571428571428, "grad_norm": 0.6920126738404653, "learning_rate": 7.669120697171617e-07, "loss": 0.24247095584869385, "num_input_tokens_seen": 782018872, "step": 12880, "train_runtime": 168266.8482, "train_tokens_per_second": 4647.492 }, { "epoch": 1.6434948979591837, "grad_norm": 0.7161977483184672, "learning_rate": 7.642484401320138e-07, "loss": 0.2649207592010498, "num_input_tokens_seen": 782310112, "step": 12885, "train_runtime": 168338.2235, "train_tokens_per_second": 4647.252 }, { "epoch": 1.6441326530612246, "grad_norm": 0.645323956347639, "learning_rate": 7.615890614193788e-07, "loss": 0.2558600902557373, "num_input_tokens_seen": 782613848, "step": 12890, "train_runtime": 168402.0099, "train_tokens_per_second": 4647.295 }, { "epoch": 1.6447704081632653, "grad_norm": 0.7350749728534063, "learning_rate": 7.589339362481334e-07, "loss": 0.26041407585144044, "num_input_tokens_seen": 782912536, "step": 12895, "train_runtime": 168479.4939, "train_tokens_per_second": 4646.931 }, { "epoch": 1.6454081632653061, "grad_norm": 0.7315785775996593, "learning_rate": 7.562830672828775e-07, "loss": 0.2617289304733276, "num_input_tokens_seen": 783219264, "step": 12900, "train_runtime": 168536.6184, "train_tokens_per_second": 4647.176 }, { "epoch": 1.646045918367347, "grad_norm": 0.5986714401284035, "learning_rate": 7.536364571839439e-07, "loss": 0.26701955795288085, "num_input_tokens_seen": 783532200, "step": 12905, "train_runtime": 168590.2163, "train_tokens_per_second": 4647.554 }, { "epoch": 1.6466836734693877, "grad_norm": 0.6373404485150242, "learning_rate": 7.509941086073907e-07, "loss": 0.26680240631103513, "num_input_tokens_seen": 783844176, "step": 12910, "train_runtime": 168658.7672, "train_tokens_per_second": 4647.515 }, { "epoch": 1.6473214285714286, "grad_norm": 0.7478457373623948, "learning_rate": 7.483560242049998e-07, "loss": 0.2463916301727295, "num_input_tokens_seen": 784130784, "step": 12915, "train_runtime": 168728.7601, "train_tokens_per_second": 4647.286 }, { "epoch": 1.6479591836734695, "grad_norm": 0.6040051783701004, "learning_rate": 7.457222066242725e-07, "loss": 0.24036722183227538, "num_input_tokens_seen": 784447456, "step": 12920, "train_runtime": 168803.5961, "train_tokens_per_second": 4647.102 }, { "epoch": 1.6485969387755102, "grad_norm": 0.5724296435449022, "learning_rate": 7.430926585084292e-07, "loss": 0.24784183502197266, "num_input_tokens_seen": 784767912, "step": 12925, "train_runtime": 168865.3747, "train_tokens_per_second": 4647.299 }, { "epoch": 1.649234693877551, "grad_norm": 0.6161602208167504, "learning_rate": 7.404673824964048e-07, "loss": 0.25671067237854006, "num_input_tokens_seen": 785078864, "step": 12930, "train_runtime": 168920.8491, "train_tokens_per_second": 4647.614 }, { "epoch": 1.649872448979592, "grad_norm": 0.6653737470727212, "learning_rate": 7.37846381222847e-07, "loss": 0.2695626974105835, "num_input_tokens_seen": 785393048, "step": 12935, "train_runtime": 168984.6808, "train_tokens_per_second": 4647.717 }, { "epoch": 1.6505102040816326, "grad_norm": 0.6729359819046147, "learning_rate": 7.352296573181139e-07, "loss": 0.23758177757263182, "num_input_tokens_seen": 785691312, "step": 12940, "train_runtime": 169057.8521, "train_tokens_per_second": 4647.47 }, { "epoch": 1.6511479591836735, "grad_norm": 0.7259161159526286, "learning_rate": 7.326172134082704e-07, "loss": 0.26804699897766116, "num_input_tokens_seen": 785992592, "step": 12945, "train_runtime": 169125.7438, "train_tokens_per_second": 4647.386 }, { "epoch": 1.6517857142857144, "grad_norm": 0.6972611463595348, "learning_rate": 7.300090521150882e-07, "loss": 0.26202845573425293, "num_input_tokens_seen": 786295144, "step": 12950, "train_runtime": 169190.347, "train_tokens_per_second": 4647.4 }, { "epoch": 1.652423469387755, "grad_norm": 0.6996257601862602, "learning_rate": 7.274051760560364e-07, "loss": 0.2594417095184326, "num_input_tokens_seen": 786595296, "step": 12955, "train_runtime": 169251.5681, "train_tokens_per_second": 4647.492 }, { "epoch": 1.6530612244897958, "grad_norm": 0.6956483422072044, "learning_rate": 7.248055878442861e-07, "loss": 0.25502710342407225, "num_input_tokens_seen": 786887408, "step": 12960, "train_runtime": 169315.5845, "train_tokens_per_second": 4647.46 }, { "epoch": 1.6536989795918369, "grad_norm": 0.6318095173521857, "learning_rate": 7.222102900887102e-07, "loss": 0.28072850704193114, "num_input_tokens_seen": 787190392, "step": 12965, "train_runtime": 169378.8465, "train_tokens_per_second": 4647.513 }, { "epoch": 1.6543367346938775, "grad_norm": 0.797435690024026, "learning_rate": 7.196192853938672e-07, "loss": 0.2597139835357666, "num_input_tokens_seen": 787490568, "step": 12970, "train_runtime": 169444.4574, "train_tokens_per_second": 4647.485 }, { "epoch": 1.6549744897959182, "grad_norm": 0.6367133962237158, "learning_rate": 7.170325763600106e-07, "loss": 0.24894609451293945, "num_input_tokens_seen": 787785952, "step": 12975, "train_runtime": 169499.3648, "train_tokens_per_second": 4647.722 }, { "epoch": 1.6556122448979593, "grad_norm": 0.6834042418423427, "learning_rate": 7.144501655830882e-07, "loss": 0.2468048334121704, "num_input_tokens_seen": 788076952, "step": 12980, "train_runtime": 169563.6177, "train_tokens_per_second": 4647.677 }, { "epoch": 1.65625, "grad_norm": 0.700017295575168, "learning_rate": 7.118720556547259e-07, "loss": 0.2554357051849365, "num_input_tokens_seen": 788368824, "step": 12985, "train_runtime": 169620.6824, "train_tokens_per_second": 4647.834 }, { "epoch": 1.6568877551020407, "grad_norm": 0.7179057334335764, "learning_rate": 7.092982491622374e-07, "loss": 0.261881685256958, "num_input_tokens_seen": 788675568, "step": 12990, "train_runtime": 169678.38, "train_tokens_per_second": 4648.062 }, { "epoch": 1.6575255102040818, "grad_norm": 0.7314788021055493, "learning_rate": 7.067287486886181e-07, "loss": 0.24860353469848634, "num_input_tokens_seen": 788981344, "step": 12995, "train_runtime": 169746.6263, "train_tokens_per_second": 4647.994 }, { "epoch": 1.6581632653061225, "grad_norm": 0.6219051493099943, "learning_rate": 7.04163556812541e-07, "loss": 0.2610947132110596, "num_input_tokens_seen": 789282208, "step": 13000, "train_runtime": 169810.3115, "train_tokens_per_second": 4648.023 }, { "epoch": 1.6588010204081631, "grad_norm": 0.6735901059791817, "learning_rate": 7.016026761083556e-07, "loss": 0.2498173713684082, "num_input_tokens_seen": 789584376, "step": 13005, "train_runtime": 169882.9359, "train_tokens_per_second": 4647.815 }, { "epoch": 1.6594387755102042, "grad_norm": 0.6114395561094688, "learning_rate": 6.990461091460832e-07, "loss": 0.25535106658935547, "num_input_tokens_seen": 789879496, "step": 13010, "train_runtime": 169946.2966, "train_tokens_per_second": 4647.818 }, { "epoch": 1.660076530612245, "grad_norm": 0.652726195798795, "learning_rate": 6.964938584914188e-07, "loss": 0.2566126585006714, "num_input_tokens_seen": 790183328, "step": 13015, "train_runtime": 170018.965, "train_tokens_per_second": 4647.619 }, { "epoch": 1.6607142857142856, "grad_norm": 0.6508018780529824, "learning_rate": 6.939459267057236e-07, "loss": 0.2553213119506836, "num_input_tokens_seen": 790497336, "step": 13020, "train_runtime": 170076.9135, "train_tokens_per_second": 4647.881 }, { "epoch": 1.6613520408163265, "grad_norm": 0.654588286168501, "learning_rate": 6.914023163460248e-07, "loss": 0.2686570644378662, "num_input_tokens_seen": 790798448, "step": 13025, "train_runtime": 170145.0643, "train_tokens_per_second": 4647.79 }, { "epoch": 1.6619897959183674, "grad_norm": 0.6961943531662362, "learning_rate": 6.888630299650134e-07, "loss": 0.2502615213394165, "num_input_tokens_seen": 791104728, "step": 13030, "train_runtime": 170207.6932, "train_tokens_per_second": 4647.879 }, { "epoch": 1.662627551020408, "grad_norm": 0.6604878791794039, "learning_rate": 6.863280701110409e-07, "loss": 0.23832058906555176, "num_input_tokens_seen": 791402312, "step": 13035, "train_runtime": 170279.2635, "train_tokens_per_second": 4647.673 }, { "epoch": 1.663265306122449, "grad_norm": 0.7042894468943262, "learning_rate": 6.837974393281171e-07, "loss": 0.24954562187194823, "num_input_tokens_seen": 791703896, "step": 13040, "train_runtime": 170341.38, "train_tokens_per_second": 4647.749 }, { "epoch": 1.6639030612244898, "grad_norm": 0.6495592094015468, "learning_rate": 6.812711401559036e-07, "loss": 0.23029787540435792, "num_input_tokens_seen": 791997456, "step": 13045, "train_runtime": 170404.5112, "train_tokens_per_second": 4647.749 }, { "epoch": 1.6645408163265305, "grad_norm": 0.6606908330358849, "learning_rate": 6.787491751297215e-07, "loss": 0.2461026668548584, "num_input_tokens_seen": 792301680, "step": 13050, "train_runtime": 170468.167, "train_tokens_per_second": 4647.798 }, { "epoch": 1.6651785714285714, "grad_norm": 0.69760734388266, "learning_rate": 6.762315467805391e-07, "loss": 0.28578948974609375, "num_input_tokens_seen": 792607080, "step": 13055, "train_runtime": 170532.8667, "train_tokens_per_second": 4647.826 }, { "epoch": 1.6658163265306123, "grad_norm": 0.7601081293086912, "learning_rate": 6.737182576349682e-07, "loss": 0.246743106842041, "num_input_tokens_seen": 792914096, "step": 13060, "train_runtime": 170606.4979, "train_tokens_per_second": 4647.62 }, { "epoch": 1.666454081632653, "grad_norm": 0.6877040137064744, "learning_rate": 6.712093102152739e-07, "loss": 0.24052057266235352, "num_input_tokens_seen": 793216536, "step": 13065, "train_runtime": 170678.1463, "train_tokens_per_second": 4647.441 }, { "epoch": 1.6670918367346939, "grad_norm": 0.5969262966889857, "learning_rate": 6.687047070393599e-07, "loss": 0.2614285469055176, "num_input_tokens_seen": 793522384, "step": 13070, "train_runtime": 170744.8061, "train_tokens_per_second": 4647.417 }, { "epoch": 1.6677295918367347, "grad_norm": 0.6661205590578827, "learning_rate": 6.662044506207682e-07, "loss": 0.2567417144775391, "num_input_tokens_seen": 793828944, "step": 13075, "train_runtime": 170802.18, "train_tokens_per_second": 4647.651 }, { "epoch": 1.6683673469387754, "grad_norm": 0.6185885633000117, "learning_rate": 6.637085434686818e-07, "loss": 0.253106427192688, "num_input_tokens_seen": 794146080, "step": 13080, "train_runtime": 170857.761, "train_tokens_per_second": 4647.995 }, { "epoch": 1.6690051020408163, "grad_norm": 0.7594755059064203, "learning_rate": 6.612169880879182e-07, "loss": 0.24351756572723388, "num_input_tokens_seen": 794452296, "step": 13085, "train_runtime": 170922.5506, "train_tokens_per_second": 4648.025 }, { "epoch": 1.6696428571428572, "grad_norm": 0.8822950418836593, "learning_rate": 6.587297869789267e-07, "loss": 0.25382318496704104, "num_input_tokens_seen": 794756976, "step": 13090, "train_runtime": 170981.4459, "train_tokens_per_second": 4648.206 }, { "epoch": 1.6702806122448979, "grad_norm": 0.6204122292589561, "learning_rate": 6.562469426377876e-07, "loss": 0.25609397888183594, "num_input_tokens_seen": 795069352, "step": 13095, "train_runtime": 171052.2104, "train_tokens_per_second": 4648.109 }, { "epoch": 1.6709183673469388, "grad_norm": 0.6885263526936767, "learning_rate": 6.537684575562092e-07, "loss": 0.2575140237808228, "num_input_tokens_seen": 795365352, "step": 13100, "train_runtime": 171123.378, "train_tokens_per_second": 4647.906 }, { "epoch": 1.6715561224489797, "grad_norm": 0.5939617734955507, "learning_rate": 6.512943342215234e-07, "loss": 0.26410722732543945, "num_input_tokens_seen": 795678608, "step": 13105, "train_runtime": 171180.4204, "train_tokens_per_second": 4648.187 }, { "epoch": 1.6721938775510203, "grad_norm": 0.6700230393287288, "learning_rate": 6.48824575116686e-07, "loss": 0.2558436870574951, "num_input_tokens_seen": 795975296, "step": 13110, "train_runtime": 171248.6134, "train_tokens_per_second": 4648.069 }, { "epoch": 1.6728316326530612, "grad_norm": 0.6511984697457034, "learning_rate": 6.463591827202731e-07, "loss": 0.2514554262161255, "num_input_tokens_seen": 796281592, "step": 13115, "train_runtime": 171307.2427, "train_tokens_per_second": 4648.266 }, { "epoch": 1.6734693877551021, "grad_norm": 0.6649083733321107, "learning_rate": 6.43898159506478e-07, "loss": 0.2432316780090332, "num_input_tokens_seen": 796582856, "step": 13120, "train_runtime": 171376.2934, "train_tokens_per_second": 4648.151 }, { "epoch": 1.6741071428571428, "grad_norm": 0.6294188107652842, "learning_rate": 6.414415079451092e-07, "loss": 0.24376821517944336, "num_input_tokens_seen": 796872776, "step": 13125, "train_runtime": 171438.8505, "train_tokens_per_second": 4648.146 }, { "epoch": 1.6747448979591837, "grad_norm": 0.6789238026386295, "learning_rate": 6.389892305015882e-07, "loss": 0.2742983341217041, "num_input_tokens_seen": 797187792, "step": 13130, "train_runtime": 171506.428, "train_tokens_per_second": 4648.151 }, { "epoch": 1.6753826530612246, "grad_norm": 0.6076933171974049, "learning_rate": 6.365413296369466e-07, "loss": 0.24300801753997803, "num_input_tokens_seen": 797483784, "step": 13135, "train_runtime": 171572.1649, "train_tokens_per_second": 4648.095 }, { "epoch": 1.6760204081632653, "grad_norm": 0.7168667349383481, "learning_rate": 6.340978078078253e-07, "loss": 0.24329781532287598, "num_input_tokens_seen": 797783992, "step": 13140, "train_runtime": 171638.1145, "train_tokens_per_second": 4648.058 }, { "epoch": 1.6766581632653061, "grad_norm": 0.5899359019932424, "learning_rate": 6.316586674664654e-07, "loss": 0.24906373023986816, "num_input_tokens_seen": 798095032, "step": 13145, "train_runtime": 171710.1951, "train_tokens_per_second": 4647.919 }, { "epoch": 1.677295918367347, "grad_norm": 0.6557035081135042, "learning_rate": 6.292239110607185e-07, "loss": 0.2658334732055664, "num_input_tokens_seen": 798396536, "step": 13150, "train_runtime": 171785.7432, "train_tokens_per_second": 4647.63 }, { "epoch": 1.6779336734693877, "grad_norm": 0.6005148875851889, "learning_rate": 6.26793541034032e-07, "loss": 0.23490290641784667, "num_input_tokens_seen": 798675488, "step": 13155, "train_runtime": 171851.0286, "train_tokens_per_second": 4647.487 }, { "epoch": 1.6785714285714286, "grad_norm": 0.6255835844291253, "learning_rate": 6.243675598254501e-07, "loss": 0.24631378650665284, "num_input_tokens_seen": 798979112, "step": 13160, "train_runtime": 171915.5124, "train_tokens_per_second": 4647.51 }, { "epoch": 1.6792091836734695, "grad_norm": 0.6639968923924517, "learning_rate": 6.21945969869614e-07, "loss": 0.24266324043273926, "num_input_tokens_seen": 799286176, "step": 13165, "train_runtime": 171988.225, "train_tokens_per_second": 4647.331 }, { "epoch": 1.6798469387755102, "grad_norm": 0.6913054421720293, "learning_rate": 6.195287735967626e-07, "loss": 0.22390503883361818, "num_input_tokens_seen": 799599776, "step": 13170, "train_runtime": 172042.4176, "train_tokens_per_second": 4647.69 }, { "epoch": 1.680484693877551, "grad_norm": 0.6601408563471931, "learning_rate": 6.171159734327164e-07, "loss": 0.2543494462966919, "num_input_tokens_seen": 799903368, "step": 13175, "train_runtime": 172111.4657, "train_tokens_per_second": 4647.589 }, { "epoch": 1.681122448979592, "grad_norm": 0.7278103517343254, "learning_rate": 6.147075717988904e-07, "loss": 0.24501893520355225, "num_input_tokens_seen": 800207056, "step": 13180, "train_runtime": 172177.1603, "train_tokens_per_second": 4647.58 }, { "epoch": 1.6817602040816326, "grad_norm": 0.6882107332000177, "learning_rate": 6.12303571112286e-07, "loss": 0.2572981834411621, "num_input_tokens_seen": 800511624, "step": 13185, "train_runtime": 172242.6711, "train_tokens_per_second": 4647.58 }, { "epoch": 1.6823979591836735, "grad_norm": 0.6414566805891898, "learning_rate": 6.099039737854834e-07, "loss": 0.2360074996948242, "num_input_tokens_seen": 800811064, "step": 13190, "train_runtime": 172318.1387, "train_tokens_per_second": 4647.282 }, { "epoch": 1.6830357142857144, "grad_norm": 0.6378694853146921, "learning_rate": 6.075087822266462e-07, "loss": 0.22553706169128418, "num_input_tokens_seen": 801112472, "step": 13195, "train_runtime": 172376.5946, "train_tokens_per_second": 4647.455 }, { "epoch": 1.683673469387755, "grad_norm": 0.7353522949445532, "learning_rate": 6.051179988395172e-07, "loss": 0.24001829624176024, "num_input_tokens_seen": 801409320, "step": 13200, "train_runtime": 172446.868, "train_tokens_per_second": 4647.283 }, { "epoch": 1.6843112244897958, "grad_norm": 0.6460275443676332, "learning_rate": 6.027316260234146e-07, "loss": 0.25508794784545896, "num_input_tokens_seen": 801695944, "step": 13205, "train_runtime": 172510.3045, "train_tokens_per_second": 4647.235 }, { "epoch": 1.6849489795918369, "grad_norm": 0.6123069601635089, "learning_rate": 6.003496661732294e-07, "loss": 0.23457629680633546, "num_input_tokens_seen": 802004992, "step": 13210, "train_runtime": 172572.7687, "train_tokens_per_second": 4647.344 }, { "epoch": 1.6855867346938775, "grad_norm": 0.6576269523805083, "learning_rate": 5.979721216794248e-07, "loss": 0.24449772834777833, "num_input_tokens_seen": 802316736, "step": 13215, "train_runtime": 172632.7628, "train_tokens_per_second": 4647.535 }, { "epoch": 1.6862244897959182, "grad_norm": 0.6373869199709481, "learning_rate": 5.955989949280339e-07, "loss": 0.2484027624130249, "num_input_tokens_seen": 802621320, "step": 13220, "train_runtime": 172703.2604, "train_tokens_per_second": 4647.401 }, { "epoch": 1.6868622448979593, "grad_norm": 0.6765967013532039, "learning_rate": 5.932302883006546e-07, "loss": 0.24606828689575194, "num_input_tokens_seen": 802920632, "step": 13225, "train_runtime": 172767.4249, "train_tokens_per_second": 4647.408 }, { "epoch": 1.6875, "grad_norm": 0.6421432588198012, "learning_rate": 5.908660041744473e-07, "loss": 0.25984389781951905, "num_input_tokens_seen": 803215896, "step": 13230, "train_runtime": 172831.9334, "train_tokens_per_second": 4647.381 }, { "epoch": 1.6881377551020407, "grad_norm": 0.6845704620349297, "learning_rate": 5.88506144922139e-07, "loss": 0.2351299285888672, "num_input_tokens_seen": 803516888, "step": 13235, "train_runtime": 172894.4456, "train_tokens_per_second": 4647.442 }, { "epoch": 1.6887755102040818, "grad_norm": 0.7025820115997669, "learning_rate": 5.861507129120136e-07, "loss": 0.26414904594421384, "num_input_tokens_seen": 803810240, "step": 13240, "train_runtime": 172964.0166, "train_tokens_per_second": 4647.269 }, { "epoch": 1.6894132653061225, "grad_norm": 0.7472631460747936, "learning_rate": 5.83799710507909e-07, "loss": 0.25545492172241213, "num_input_tokens_seen": 804093920, "step": 13245, "train_runtime": 173031.3847, "train_tokens_per_second": 4647.099 }, { "epoch": 1.6900510204081631, "grad_norm": 0.7679617662934242, "learning_rate": 5.814531400692208e-07, "loss": 0.26322863101959226, "num_input_tokens_seen": 804396312, "step": 13250, "train_runtime": 173100.8754, "train_tokens_per_second": 4646.98 }, { "epoch": 1.6906887755102042, "grad_norm": 0.6114569152138319, "learning_rate": 5.791110039508991e-07, "loss": 0.24986505508422852, "num_input_tokens_seen": 804713896, "step": 13255, "train_runtime": 173153.1822, "train_tokens_per_second": 4647.41 }, { "epoch": 1.691326530612245, "grad_norm": 0.686443915314153, "learning_rate": 5.767733045034384e-07, "loss": 0.2752215385437012, "num_input_tokens_seen": 805030240, "step": 13260, "train_runtime": 173210.2933, "train_tokens_per_second": 4647.704 }, { "epoch": 1.6919642857142856, "grad_norm": 0.6551831629345426, "learning_rate": 5.744400440728826e-07, "loss": 0.25286269187927246, "num_input_tokens_seen": 805319600, "step": 13265, "train_runtime": 173287.5594, "train_tokens_per_second": 4647.302 }, { "epoch": 1.6926020408163265, "grad_norm": 0.7862394352964676, "learning_rate": 5.721112250008254e-07, "loss": 0.24343976974487305, "num_input_tokens_seen": 805599816, "step": 13270, "train_runtime": 173352.1217, "train_tokens_per_second": 4647.188 }, { "epoch": 1.6932397959183674, "grad_norm": 0.6541326760795353, "learning_rate": 5.697868496243958e-07, "loss": 0.24480876922607422, "num_input_tokens_seen": 805887848, "step": 13275, "train_runtime": 173419.0605, "train_tokens_per_second": 4647.055 }, { "epoch": 1.693877551020408, "grad_norm": 0.6778576794479275, "learning_rate": 5.674669202762684e-07, "loss": 0.25247907638549805, "num_input_tokens_seen": 806196384, "step": 13280, "train_runtime": 173492.1644, "train_tokens_per_second": 4646.875 }, { "epoch": 1.694515306122449, "grad_norm": 0.6439818130367023, "learning_rate": 5.651514392846535e-07, "loss": 0.2437495231628418, "num_input_tokens_seen": 806500696, "step": 13285, "train_runtime": 173561.0655, "train_tokens_per_second": 4646.784 }, { "epoch": 1.6951530612244898, "grad_norm": 0.6706718045627558, "learning_rate": 5.628404089732986e-07, "loss": 0.2544881343841553, "num_input_tokens_seen": 806810160, "step": 13290, "train_runtime": 173626.3889, "train_tokens_per_second": 4646.818 }, { "epoch": 1.6957908163265305, "grad_norm": 0.7304220260099141, "learning_rate": 5.605338316614839e-07, "loss": 0.25745701789855957, "num_input_tokens_seen": 807112440, "step": 13295, "train_runtime": 173694.5112, "train_tokens_per_second": 4646.735 }, { "epoch": 1.6964285714285714, "grad_norm": 0.6162790075864725, "learning_rate": 5.582317096640205e-07, "loss": 0.2437589645385742, "num_input_tokens_seen": 807413184, "step": 13300, "train_runtime": 173762.4513, "train_tokens_per_second": 4646.649 }, { "epoch": 1.6970663265306123, "grad_norm": 0.6547404051230347, "learning_rate": 5.559340452912488e-07, "loss": 0.24849872589111327, "num_input_tokens_seen": 807731504, "step": 13305, "train_runtime": 173814.3615, "train_tokens_per_second": 4647.093 }, { "epoch": 1.697704081632653, "grad_norm": 0.6101879213333442, "learning_rate": 5.536408408490357e-07, "loss": 0.23475873470306396, "num_input_tokens_seen": 808032920, "step": 13310, "train_runtime": 173878.1385, "train_tokens_per_second": 4647.122 }, { "epoch": 1.6983418367346939, "grad_norm": 0.6805653048642977, "learning_rate": 5.513520986387721e-07, "loss": 0.2626044511795044, "num_input_tokens_seen": 808338432, "step": 13315, "train_runtime": 173946.2483, "train_tokens_per_second": 4647.059 }, { "epoch": 1.6989795918367347, "grad_norm": 0.6795411098661497, "learning_rate": 5.490678209573702e-07, "loss": 0.2594637632369995, "num_input_tokens_seen": 808650944, "step": 13320, "train_runtime": 174006.1976, "train_tokens_per_second": 4647.254 }, { "epoch": 1.6996173469387754, "grad_norm": 0.7221133636236472, "learning_rate": 5.467880100972633e-07, "loss": 0.24765939712524415, "num_input_tokens_seen": 808959368, "step": 13325, "train_runtime": 174071.1629, "train_tokens_per_second": 4647.291 }, { "epoch": 1.7002551020408163, "grad_norm": 0.601381599602597, "learning_rate": 5.445126683463991e-07, "loss": 0.24539852142333984, "num_input_tokens_seen": 809263464, "step": 13330, "train_runtime": 174145.0622, "train_tokens_per_second": 4647.065 }, { "epoch": 1.7008928571428572, "grad_norm": 0.7462785409425798, "learning_rate": 5.422417979882416e-07, "loss": 0.24530429840087892, "num_input_tokens_seen": 809557232, "step": 13335, "train_runtime": 174219.7268, "train_tokens_per_second": 4646.76 }, { "epoch": 1.7015306122448979, "grad_norm": 0.6091027212542391, "learning_rate": 5.399754013017711e-07, "loss": 0.26610822677612306, "num_input_tokens_seen": 809849272, "step": 13340, "train_runtime": 174286.9811, "train_tokens_per_second": 4646.642 }, { "epoch": 1.7021683673469388, "grad_norm": 0.6836631433776763, "learning_rate": 5.377134805614714e-07, "loss": 0.2476370096206665, "num_input_tokens_seen": 810150448, "step": 13345, "train_runtime": 174343.4431, "train_tokens_per_second": 4646.865 }, { "epoch": 1.7028061224489797, "grad_norm": 0.656118211163798, "learning_rate": 5.354560380373391e-07, "loss": 0.23286876678466797, "num_input_tokens_seen": 810450680, "step": 13350, "train_runtime": 174406.4934, "train_tokens_per_second": 4646.907 }, { "epoch": 1.7034438775510203, "grad_norm": 0.6095295851422854, "learning_rate": 5.33203075994877e-07, "loss": 0.26010301113128664, "num_input_tokens_seen": 810750576, "step": 13355, "train_runtime": 174476.514, "train_tokens_per_second": 4646.761 }, { "epoch": 1.7040816326530612, "grad_norm": 0.6538707511126961, "learning_rate": 5.30954596695088e-07, "loss": 0.2614151477813721, "num_input_tokens_seen": 811061000, "step": 13360, "train_runtime": 174534.244, "train_tokens_per_second": 4647.002 }, { "epoch": 1.7047193877551021, "grad_norm": 0.6992112135245512, "learning_rate": 5.287106023944782e-07, "loss": 0.2446915864944458, "num_input_tokens_seen": 811364840, "step": 13365, "train_runtime": 174601.4086, "train_tokens_per_second": 4646.955 }, { "epoch": 1.7053571428571428, "grad_norm": 0.6749212694990641, "learning_rate": 5.264710953450536e-07, "loss": 0.2663325309753418, "num_input_tokens_seen": 811669248, "step": 13370, "train_runtime": 174670.908, "train_tokens_per_second": 4646.849 }, { "epoch": 1.7059948979591837, "grad_norm": 0.6756642574882481, "learning_rate": 5.242360777943151e-07, "loss": 0.26160728931427, "num_input_tokens_seen": 811973912, "step": 13375, "train_runtime": 174740.3209, "train_tokens_per_second": 4646.746 }, { "epoch": 1.7066326530612246, "grad_norm": 0.7266428847277792, "learning_rate": 5.220055519852596e-07, "loss": 0.2614679574966431, "num_input_tokens_seen": 812269376, "step": 13380, "train_runtime": 174812.2899, "train_tokens_per_second": 4646.523 }, { "epoch": 1.7072704081632653, "grad_norm": 0.6409602778513998, "learning_rate": 5.197795201563744e-07, "loss": 0.26145367622375487, "num_input_tokens_seen": 812574120, "step": 13385, "train_runtime": 174865.0983, "train_tokens_per_second": 4646.863 }, { "epoch": 1.7079081632653061, "grad_norm": 0.6362314502165928, "learning_rate": 5.17557984541639e-07, "loss": 0.2672783851623535, "num_input_tokens_seen": 812875616, "step": 13390, "train_runtime": 174921.8089, "train_tokens_per_second": 4647.08 }, { "epoch": 1.708545918367347, "grad_norm": 0.6602153513659031, "learning_rate": 5.153409473705196e-07, "loss": 0.24822840690612794, "num_input_tokens_seen": 813175688, "step": 13395, "train_runtime": 174987.0558, "train_tokens_per_second": 4647.062 }, { "epoch": 1.7091836734693877, "grad_norm": 0.6824710805889549, "learning_rate": 5.131284108679669e-07, "loss": 0.25509934425354003, "num_input_tokens_seen": 813475616, "step": 13400, "train_runtime": 175051.6624, "train_tokens_per_second": 4647.06 }, { "epoch": 1.7098214285714286, "grad_norm": 0.7214556204881735, "learning_rate": 5.109203772544164e-07, "loss": 0.25195741653442383, "num_input_tokens_seen": 813776688, "step": 13405, "train_runtime": 175111.7734, "train_tokens_per_second": 4647.184 }, { "epoch": 1.7104591836734695, "grad_norm": 0.6530731194100159, "learning_rate": 5.087168487457838e-07, "loss": 0.2547295570373535, "num_input_tokens_seen": 814086584, "step": 13410, "train_runtime": 175180.2361, "train_tokens_per_second": 4647.137 }, { "epoch": 1.7110969387755102, "grad_norm": 0.6734735506154492, "learning_rate": 5.065178275534649e-07, "loss": 0.24732956886291504, "num_input_tokens_seen": 814396000, "step": 13415, "train_runtime": 175251.0201, "train_tokens_per_second": 4647.026 }, { "epoch": 1.711734693877551, "grad_norm": 0.6588060391082898, "learning_rate": 5.043233158843286e-07, "loss": 0.2538780212402344, "num_input_tokens_seen": 814709408, "step": 13420, "train_runtime": 175321.622, "train_tokens_per_second": 4646.942 }, { "epoch": 1.712372448979592, "grad_norm": 0.6253785817459473, "learning_rate": 5.021333159407232e-07, "loss": 0.258031439781189, "num_input_tokens_seen": 815013680, "step": 13425, "train_runtime": 175388.9032, "train_tokens_per_second": 4646.894 }, { "epoch": 1.7130102040816326, "grad_norm": 0.6223563531524244, "learning_rate": 4.999478299204663e-07, "loss": 0.23726649284362794, "num_input_tokens_seen": 815325336, "step": 13430, "train_runtime": 175442.4964, "train_tokens_per_second": 4647.251 }, { "epoch": 1.7136479591836735, "grad_norm": 0.6174363850558218, "learning_rate": 4.977668600168428e-07, "loss": 0.23950729370117188, "num_input_tokens_seen": 815613392, "step": 13435, "train_runtime": 175518.5989, "train_tokens_per_second": 4646.877 }, { "epoch": 1.7142857142857144, "grad_norm": 0.5987978775881054, "learning_rate": 4.95590408418613e-07, "loss": 0.2627774953842163, "num_input_tokens_seen": 815921320, "step": 13440, "train_runtime": 175584.2231, "train_tokens_per_second": 4646.894 }, { "epoch": 1.714923469387755, "grad_norm": 0.6625060930478297, "learning_rate": 4.934184773099943e-07, "loss": 0.27510771751403806, "num_input_tokens_seen": 816239416, "step": 13445, "train_runtime": 175658.2589, "train_tokens_per_second": 4646.747 }, { "epoch": 1.7155612244897958, "grad_norm": 0.5766109387544881, "learning_rate": 4.912510688706729e-07, "loss": 0.2529017448425293, "num_input_tokens_seen": 816543240, "step": 13450, "train_runtime": 175723.552, "train_tokens_per_second": 4646.749 }, { "epoch": 1.7161989795918369, "grad_norm": 0.6261581832501326, "learning_rate": 4.89088185275794e-07, "loss": 0.2732319116592407, "num_input_tokens_seen": 816852968, "step": 13455, "train_runtime": 175785.6898, "train_tokens_per_second": 4646.868 }, { "epoch": 1.7168367346938775, "grad_norm": 0.6495123546009153, "learning_rate": 4.869298286959629e-07, "loss": 0.2589241981506348, "num_input_tokens_seen": 817160528, "step": 13460, "train_runtime": 175854.4415, "train_tokens_per_second": 4646.801 }, { "epoch": 1.7174744897959182, "grad_norm": 0.6897678748516881, "learning_rate": 4.847760012972402e-07, "loss": 0.24462056159973145, "num_input_tokens_seen": 817470512, "step": 13465, "train_runtime": 175920.5458, "train_tokens_per_second": 4646.817 }, { "epoch": 1.7181122448979593, "grad_norm": 0.5820599825977025, "learning_rate": 4.826267052411432e-07, "loss": 0.2470067024230957, "num_input_tokens_seen": 817764792, "step": 13470, "train_runtime": 175984.2991, "train_tokens_per_second": 4646.805 }, { "epoch": 1.71875, "grad_norm": 0.6199065448408366, "learning_rate": 4.804819426846402e-07, "loss": 0.2478943109512329, "num_input_tokens_seen": 818067224, "step": 13475, "train_runtime": 176052.2544, "train_tokens_per_second": 4646.73 }, { "epoch": 1.7193877551020407, "grad_norm": 0.7305909389713294, "learning_rate": 4.783417157801496e-07, "loss": 0.2814014911651611, "num_input_tokens_seen": 818371368, "step": 13480, "train_runtime": 176116.1352, "train_tokens_per_second": 4646.771 }, { "epoch": 1.7200255102040818, "grad_norm": 0.6601304986648187, "learning_rate": 4.7620602667553973e-07, "loss": 0.24475960731506347, "num_input_tokens_seen": 818675136, "step": 13485, "train_runtime": 176182.0275, "train_tokens_per_second": 4646.757 }, { "epoch": 1.7206632653061225, "grad_norm": 0.6585753514402448, "learning_rate": 4.7407487751412297e-07, "loss": 0.2473832368850708, "num_input_tokens_seen": 818969848, "step": 13490, "train_runtime": 176245.8929, "train_tokens_per_second": 4646.746 }, { "epoch": 1.7213010204081631, "grad_norm": 0.6785347715300538, "learning_rate": 4.719482704346567e-07, "loss": 0.25057687759399416, "num_input_tokens_seen": 819271288, "step": 13495, "train_runtime": 176315.113, "train_tokens_per_second": 4646.631 }, { "epoch": 1.7219387755102042, "grad_norm": 0.6355962626394969, "learning_rate": 4.6982620757133947e-07, "loss": 0.2580732345581055, "num_input_tokens_seen": 819576904, "step": 13500, "train_runtime": 176378.7128, "train_tokens_per_second": 4646.688 }, { "epoch": 1.722576530612245, "grad_norm": 0.7766392615848923, "learning_rate": 4.677086910538092e-07, "loss": 0.250787091255188, "num_input_tokens_seen": 819888528, "step": 13505, "train_runtime": 176444.6693, "train_tokens_per_second": 4646.717 }, { "epoch": 1.7232142857142856, "grad_norm": 0.6335216455614607, "learning_rate": 4.6559572300714227e-07, "loss": 0.24778370857238768, "num_input_tokens_seen": 820188984, "step": 13510, "train_runtime": 176509.2452, "train_tokens_per_second": 4646.72 }, { "epoch": 1.7238520408163265, "grad_norm": 0.7380125184980411, "learning_rate": 4.6348730555185017e-07, "loss": 0.26547608375549314, "num_input_tokens_seen": 820484616, "step": 13515, "train_runtime": 176568.408, "train_tokens_per_second": 4646.837 }, { "epoch": 1.7244897959183674, "grad_norm": 0.6265763025101634, "learning_rate": 4.6138344080387477e-07, "loss": 0.24309449195861815, "num_input_tokens_seen": 820793416, "step": 13520, "train_runtime": 176634.2089, "train_tokens_per_second": 4646.854 }, { "epoch": 1.725127551020408, "grad_norm": 0.60170752157238, "learning_rate": 4.5928413087459325e-07, "loss": 0.2588818073272705, "num_input_tokens_seen": 821094712, "step": 13525, "train_runtime": 176707.2394, "train_tokens_per_second": 4646.639 }, { "epoch": 1.725765306122449, "grad_norm": 0.7034269884118203, "learning_rate": 4.571893778708103e-07, "loss": 0.23107919692993165, "num_input_tokens_seen": 821399712, "step": 13530, "train_runtime": 176771.1188, "train_tokens_per_second": 4646.685 }, { "epoch": 1.7264030612244898, "grad_norm": 0.6511470149372105, "learning_rate": 4.550991838947555e-07, "loss": 0.265388560295105, "num_input_tokens_seen": 821707328, "step": 13535, "train_runtime": 176833.4494, "train_tokens_per_second": 4646.787 }, { "epoch": 1.7270408163265305, "grad_norm": 0.6710553403884467, "learning_rate": 4.5301355104408364e-07, "loss": 0.2338574171066284, "num_input_tokens_seen": 822009192, "step": 13540, "train_runtime": 176909.3498, "train_tokens_per_second": 4646.499 }, { "epoch": 1.7276785714285714, "grad_norm": 0.6798197272438135, "learning_rate": 4.509324814118754e-07, "loss": 0.25485005378723147, "num_input_tokens_seen": 822306680, "step": 13545, "train_runtime": 176964.9246, "train_tokens_per_second": 4646.721 }, { "epoch": 1.7283163265306123, "grad_norm": 0.7753455593426912, "learning_rate": 4.48855977086628e-07, "loss": 0.25541257858276367, "num_input_tokens_seen": 822605176, "step": 13550, "train_runtime": 177025.1618, "train_tokens_per_second": 4646.826 }, { "epoch": 1.728954081632653, "grad_norm": 0.7149215180122932, "learning_rate": 4.4678404015225774e-07, "loss": 0.24527978897094727, "num_input_tokens_seen": 822907840, "step": 13555, "train_runtime": 177099.1207, "train_tokens_per_second": 4646.595 }, { "epoch": 1.7295918367346939, "grad_norm": 0.6971028776253299, "learning_rate": 4.447166726881008e-07, "loss": 0.26441819667816163, "num_input_tokens_seen": 823217208, "step": 13560, "train_runtime": 177175.0466, "train_tokens_per_second": 4646.35 }, { "epoch": 1.7302295918367347, "grad_norm": 0.6703504694700919, "learning_rate": 4.4265387676890203e-07, "loss": 0.24485955238342286, "num_input_tokens_seen": 823522816, "step": 13565, "train_runtime": 177237.6068, "train_tokens_per_second": 4646.434 }, { "epoch": 1.7308673469387754, "grad_norm": 0.6428849614154608, "learning_rate": 4.4059565446482264e-07, "loss": 0.23918466567993163, "num_input_tokens_seen": 823824144, "step": 13570, "train_runtime": 177302.6242, "train_tokens_per_second": 4646.43 }, { "epoch": 1.7315051020408163, "grad_norm": 0.6392656161875652, "learning_rate": 4.385420078414321e-07, "loss": 0.2566037893295288, "num_input_tokens_seen": 824116440, "step": 13575, "train_runtime": 177365.3695, "train_tokens_per_second": 4646.434 }, { "epoch": 1.7321428571428572, "grad_norm": 0.6965722442977956, "learning_rate": 4.364929389597078e-07, "loss": 0.23905861377716064, "num_input_tokens_seen": 824420288, "step": 13580, "train_runtime": 177429.1114, "train_tokens_per_second": 4646.477 }, { "epoch": 1.7327806122448979, "grad_norm": 0.6787328147362667, "learning_rate": 4.344484498760343e-07, "loss": 0.25505044460296633, "num_input_tokens_seen": 824731064, "step": 13585, "train_runtime": 177489.3243, "train_tokens_per_second": 4646.652 }, { "epoch": 1.7334183673469388, "grad_norm": 0.6430044392578245, "learning_rate": 4.324085426421981e-07, "loss": 0.27058048248291017, "num_input_tokens_seen": 825043776, "step": 13590, "train_runtime": 177556.7657, "train_tokens_per_second": 4646.648 }, { "epoch": 1.7340561224489797, "grad_norm": 0.664261873904836, "learning_rate": 4.3037321930539e-07, "loss": 0.24852211475372316, "num_input_tokens_seen": 825343224, "step": 13595, "train_runtime": 177625.3829, "train_tokens_per_second": 4646.539 }, { "epoch": 1.7346938775510203, "grad_norm": 0.6328411981625071, "learning_rate": 4.283424819081988e-07, "loss": 0.24766051769256592, "num_input_tokens_seen": 825642352, "step": 13600, "train_runtime": 177694.6897, "train_tokens_per_second": 4646.41 }, { "epoch": 1.7353316326530612, "grad_norm": 0.6192323219119893, "learning_rate": 4.2631633248860937e-07, "loss": 0.24031505584716797, "num_input_tokens_seen": 825946616, "step": 13605, "train_runtime": 177760.2681, "train_tokens_per_second": 4646.407 }, { "epoch": 1.7359693877551021, "grad_norm": 0.6748273193909125, "learning_rate": 4.2429477308000676e-07, "loss": 0.24826493263244628, "num_input_tokens_seen": 826243296, "step": 13610, "train_runtime": 177827.8368, "train_tokens_per_second": 4646.31 }, { "epoch": 1.7366071428571428, "grad_norm": 0.7136297364370146, "learning_rate": 4.222778057111665e-07, "loss": 0.26136996746063235, "num_input_tokens_seen": 826537744, "step": 13615, "train_runtime": 177892.9233, "train_tokens_per_second": 4646.265 }, { "epoch": 1.7372448979591837, "grad_norm": 0.5820350102037467, "learning_rate": 4.202654324062544e-07, "loss": 0.2185586452484131, "num_input_tokens_seen": 826831632, "step": 13620, "train_runtime": 177947.7145, "train_tokens_per_second": 4646.486 }, { "epoch": 1.7378826530612246, "grad_norm": 0.6366344431603493, "learning_rate": 4.182576551848283e-07, "loss": 0.24439539909362792, "num_input_tokens_seen": 827132840, "step": 13625, "train_runtime": 178009.3383, "train_tokens_per_second": 4646.57 }, { "epoch": 1.7385204081632653, "grad_norm": 0.6833577349409844, "learning_rate": 4.1625447606183533e-07, "loss": 0.23791561126708985, "num_input_tokens_seen": 827439840, "step": 13630, "train_runtime": 178079.292, "train_tokens_per_second": 4646.469 }, { "epoch": 1.7391581632653061, "grad_norm": 0.6669176618264123, "learning_rate": 4.142558970476024e-07, "loss": 0.2288142204284668, "num_input_tokens_seen": 827753720, "step": 13635, "train_runtime": 178139.9289, "train_tokens_per_second": 4646.649 }, { "epoch": 1.739795918367347, "grad_norm": 0.6408512920375541, "learning_rate": 4.1226192014784393e-07, "loss": 0.2142507553100586, "num_input_tokens_seen": 828054520, "step": 13640, "train_runtime": 178199.167, "train_tokens_per_second": 4646.792 }, { "epoch": 1.7404336734693877, "grad_norm": 0.7204366097448385, "learning_rate": 4.102725473636571e-07, "loss": 0.24937853813171387, "num_input_tokens_seen": 828362584, "step": 13645, "train_runtime": 178260.0878, "train_tokens_per_second": 4646.932 }, { "epoch": 1.7410714285714286, "grad_norm": 0.7351000011253044, "learning_rate": 4.0828778069151363e-07, "loss": 0.27016596794128417, "num_input_tokens_seen": 828668024, "step": 13650, "train_runtime": 178338.4885, "train_tokens_per_second": 4646.602 }, { "epoch": 1.7417091836734695, "grad_norm": 0.6230140317665974, "learning_rate": 4.063076221232676e-07, "loss": 0.24024586677551268, "num_input_tokens_seen": 828968552, "step": 13655, "train_runtime": 178404.0612, "train_tokens_per_second": 4646.579 }, { "epoch": 1.7423469387755102, "grad_norm": 0.7086958836856496, "learning_rate": 4.043320736461448e-07, "loss": 0.27800915241241453, "num_input_tokens_seen": 829280800, "step": 13660, "train_runtime": 178464.4523, "train_tokens_per_second": 4646.756 }, { "epoch": 1.742984693877551, "grad_norm": 0.6161159829434065, "learning_rate": 4.0236113724274716e-07, "loss": 0.2446291923522949, "num_input_tokens_seen": 829588144, "step": 13665, "train_runtime": 178528.3859, "train_tokens_per_second": 4646.814 }, { "epoch": 1.743622448979592, "grad_norm": 0.6257870799616637, "learning_rate": 4.0039481489104636e-07, "loss": 0.2662153959274292, "num_input_tokens_seen": 829898896, "step": 13670, "train_runtime": 178590.2827, "train_tokens_per_second": 4646.943 }, { "epoch": 1.7442602040816326, "grad_norm": 0.6325520658994559, "learning_rate": 3.98433108564385e-07, "loss": 0.24277727603912352, "num_input_tokens_seen": 830197328, "step": 13675, "train_runtime": 178653.0888, "train_tokens_per_second": 4646.98 }, { "epoch": 1.7448979591836735, "grad_norm": 0.6674103850787549, "learning_rate": 3.964760202314716e-07, "loss": 0.24192190170288086, "num_input_tokens_seen": 830513592, "step": 13680, "train_runtime": 178708.4145, "train_tokens_per_second": 4647.311 }, { "epoch": 1.7455357142857144, "grad_norm": 0.663067930734789, "learning_rate": 3.9452355185638226e-07, "loss": 0.25597119331359863, "num_input_tokens_seen": 830815680, "step": 13685, "train_runtime": 178781.0334, "train_tokens_per_second": 4647.113 }, { "epoch": 1.746173469387755, "grad_norm": 0.7594095249949443, "learning_rate": 3.9257570539855237e-07, "loss": 0.2551027774810791, "num_input_tokens_seen": 831116968, "step": 13690, "train_runtime": 178833.74, "train_tokens_per_second": 4647.428 }, { "epoch": 1.7468112244897958, "grad_norm": 0.6802275542106344, "learning_rate": 3.9063248281278555e-07, "loss": 0.24135251045227052, "num_input_tokens_seen": 831412080, "step": 13695, "train_runtime": 178905.7841, "train_tokens_per_second": 4647.206 }, { "epoch": 1.7474489795918369, "grad_norm": 0.6075509637244532, "learning_rate": 3.8869388604924007e-07, "loss": 0.2383573532104492, "num_input_tokens_seen": 831711544, "step": 13700, "train_runtime": 178972.8335, "train_tokens_per_second": 4647.138 }, { "epoch": 1.7480867346938775, "grad_norm": 0.6119671525051149, "learning_rate": 3.8675991705343197e-07, "loss": 0.2385228157043457, "num_input_tokens_seen": 832007984, "step": 13705, "train_runtime": 179036.3298, "train_tokens_per_second": 4647.146 }, { "epoch": 1.7487244897959182, "grad_norm": 0.6284455385677916, "learning_rate": 3.848305777662342e-07, "loss": 0.2456441879272461, "num_input_tokens_seen": 832303496, "step": 13710, "train_runtime": 179102.8964, "train_tokens_per_second": 4647.069 }, { "epoch": 1.7493622448979593, "grad_norm": 0.5998925230170503, "learning_rate": 3.829058701238764e-07, "loss": 0.2562390327453613, "num_input_tokens_seen": 832603704, "step": 13715, "train_runtime": 179165.3503, "train_tokens_per_second": 4647.125 }, { "epoch": 1.75, "grad_norm": 0.6185610623610748, "learning_rate": 3.8098579605793385e-07, "loss": 0.25684871673583987, "num_input_tokens_seen": 832912352, "step": 13720, "train_runtime": 179222.6214, "train_tokens_per_second": 4647.362 }, { "epoch": 1.7506377551020407, "grad_norm": 0.6887984162820846, "learning_rate": 3.790703574953353e-07, "loss": 0.25089006423950194, "num_input_tokens_seen": 833230920, "step": 13725, "train_runtime": 179288.8269, "train_tokens_per_second": 4647.422 }, { "epoch": 1.7512755102040818, "grad_norm": 0.6352271383759429, "learning_rate": 3.771595563583602e-07, "loss": 0.22961339950561524, "num_input_tokens_seen": 833535792, "step": 13730, "train_runtime": 179367.2834, "train_tokens_per_second": 4647.089 }, { "epoch": 1.7519132653061225, "grad_norm": 0.760425539674986, "learning_rate": 3.752533945646275e-07, "loss": 0.27449326515197753, "num_input_tokens_seen": 833842504, "step": 13735, "train_runtime": 179426.6537, "train_tokens_per_second": 4647.261 }, { "epoch": 1.7525510204081631, "grad_norm": 0.7291184134987161, "learning_rate": 3.733518740271047e-07, "loss": 0.24901988506317138, "num_input_tokens_seen": 834138640, "step": 13740, "train_runtime": 179490.3874, "train_tokens_per_second": 4647.261 }, { "epoch": 1.7531887755102042, "grad_norm": 0.660442184020874, "learning_rate": 3.7145499665410147e-07, "loss": 0.24527840614318847, "num_input_tokens_seen": 834425800, "step": 13745, "train_runtime": 179558.736, "train_tokens_per_second": 4647.091 }, { "epoch": 1.753826530612245, "grad_norm": 0.6594943264407748, "learning_rate": 3.695627643492655e-07, "loss": 0.2338253974914551, "num_input_tokens_seen": 834725488, "step": 13750, "train_runtime": 179623.282, "train_tokens_per_second": 4647.09 }, { "epoch": 1.7544642857142856, "grad_norm": 0.6688459721750367, "learning_rate": 3.6767517901158455e-07, "loss": 0.236647891998291, "num_input_tokens_seen": 835027360, "step": 13755, "train_runtime": 179682.3795, "train_tokens_per_second": 4647.241 }, { "epoch": 1.7551020408163265, "grad_norm": 0.6213010699853478, "learning_rate": 3.6579224253538213e-07, "loss": 0.2543475866317749, "num_input_tokens_seen": 835324880, "step": 13760, "train_runtime": 179744.6966, "train_tokens_per_second": 4647.285 }, { "epoch": 1.7557397959183674, "grad_norm": 0.7126939250044705, "learning_rate": 3.639139568103173e-07, "loss": 0.2533092021942139, "num_input_tokens_seen": 835637264, "step": 13765, "train_runtime": 179807.1156, "train_tokens_per_second": 4647.409 }, { "epoch": 1.756377551020408, "grad_norm": 0.7787011727512609, "learning_rate": 3.620403237213799e-07, "loss": 0.25517432689666747, "num_input_tokens_seen": 835941560, "step": 13770, "train_runtime": 179868.7194, "train_tokens_per_second": 4647.509 }, { "epoch": 1.757015306122449, "grad_norm": 0.7571677415678235, "learning_rate": 3.6017134514889196e-07, "loss": 0.26593616008758547, "num_input_tokens_seen": 836258672, "step": 13775, "train_runtime": 179923.4454, "train_tokens_per_second": 4647.858 }, { "epoch": 1.7576530612244898, "grad_norm": 0.6690829842295413, "learning_rate": 3.583070229685043e-07, "loss": 0.2549485206604004, "num_input_tokens_seen": 836561840, "step": 13780, "train_runtime": 179983.311, "train_tokens_per_second": 4647.997 }, { "epoch": 1.7582908163265305, "grad_norm": 0.7150546347355768, "learning_rate": 3.564473590511941e-07, "loss": 0.24862639904022216, "num_input_tokens_seen": 836865200, "step": 13785, "train_runtime": 180051.2278, "train_tokens_per_second": 4647.928 }, { "epoch": 1.7589285714285714, "grad_norm": 0.5953940498152313, "learning_rate": 3.5459235526326464e-07, "loss": 0.240686297416687, "num_input_tokens_seen": 837168000, "step": 13790, "train_runtime": 180115.1063, "train_tokens_per_second": 4647.961 }, { "epoch": 1.7595663265306123, "grad_norm": 0.6596747408033998, "learning_rate": 3.527420134663401e-07, "loss": 0.2507588863372803, "num_input_tokens_seen": 837463912, "step": 13795, "train_runtime": 180171.9969, "train_tokens_per_second": 4648.136 }, { "epoch": 1.760204081632653, "grad_norm": 0.7453931252493031, "learning_rate": 3.5089633551736946e-07, "loss": 0.246191143989563, "num_input_tokens_seen": 837767624, "step": 13800, "train_runtime": 180234.6778, "train_tokens_per_second": 4648.204 }, { "epoch": 1.7608418367346939, "grad_norm": 0.6343858395241456, "learning_rate": 3.4905532326861946e-07, "loss": 0.23849906921386718, "num_input_tokens_seen": 838076624, "step": 13805, "train_runtime": 180300.4707, "train_tokens_per_second": 4648.222 }, { "epoch": 1.7614795918367347, "grad_norm": 0.6993935655900692, "learning_rate": 3.4721897856767275e-07, "loss": 0.2654818773269653, "num_input_tokens_seen": 838387688, "step": 13810, "train_runtime": 180372.754, "train_tokens_per_second": 4648.084 }, { "epoch": 1.7621173469387754, "grad_norm": 0.7849860789012794, "learning_rate": 3.4538730325743174e-07, "loss": 0.24663257598876953, "num_input_tokens_seen": 838688192, "step": 13815, "train_runtime": 180446.2759, "train_tokens_per_second": 4647.855 }, { "epoch": 1.7627551020408163, "grad_norm": 0.6588620875640854, "learning_rate": 3.4356029917610833e-07, "loss": 0.24232873916625977, "num_input_tokens_seen": 838997520, "step": 13820, "train_runtime": 180511.1573, "train_tokens_per_second": 4647.898 }, { "epoch": 1.7633928571428572, "grad_norm": 0.6643840471979123, "learning_rate": 3.417379681572297e-07, "loss": 0.24702844619750977, "num_input_tokens_seen": 839296400, "step": 13825, "train_runtime": 180587.4613, "train_tokens_per_second": 4647.59 }, { "epoch": 1.7640306122448979, "grad_norm": 0.7288712257155641, "learning_rate": 3.3992031202963293e-07, "loss": 0.25472800731658934, "num_input_tokens_seen": 839608360, "step": 13830, "train_runtime": 180639.9779, "train_tokens_per_second": 4647.965 }, { "epoch": 1.7646683673469388, "grad_norm": 0.6195781054964941, "learning_rate": 3.3810733261746167e-07, "loss": 0.24146430492401122, "num_input_tokens_seen": 839922696, "step": 13835, "train_runtime": 180713.3854, "train_tokens_per_second": 4647.817 }, { "epoch": 1.7653061224489797, "grad_norm": 0.6629599072218642, "learning_rate": 3.362990317401688e-07, "loss": 0.2496337413787842, "num_input_tokens_seen": 840213632, "step": 13840, "train_runtime": 180780.084, "train_tokens_per_second": 4647.711 }, { "epoch": 1.7659438775510203, "grad_norm": 0.7104737196447849, "learning_rate": 3.344954112125087e-07, "loss": 0.23286681175231932, "num_input_tokens_seen": 840513384, "step": 13845, "train_runtime": 180858.3911, "train_tokens_per_second": 4647.356 }, { "epoch": 1.7665816326530612, "grad_norm": 0.6650838498230978, "learning_rate": 3.3269647284454253e-07, "loss": 0.24792745113372802, "num_input_tokens_seen": 840793696, "step": 13850, "train_runtime": 180928.1672, "train_tokens_per_second": 4647.113 }, { "epoch": 1.7672193877551021, "grad_norm": 0.7428204263279207, "learning_rate": 3.309022184416288e-07, "loss": 0.2583718776702881, "num_input_tokens_seen": 841104192, "step": 13855, "train_runtime": 180997.5697, "train_tokens_per_second": 4647.047 }, { "epoch": 1.7678571428571428, "grad_norm": 0.6503670677463549, "learning_rate": 3.2911264980442834e-07, "loss": 0.25423059463500974, "num_input_tokens_seen": 841415992, "step": 13860, "train_runtime": 181065.3529, "train_tokens_per_second": 4647.029 }, { "epoch": 1.7684948979591837, "grad_norm": 0.6359925475280099, "learning_rate": 3.273277687288978e-07, "loss": 0.2673047542572021, "num_input_tokens_seen": 841723464, "step": 13865, "train_runtime": 181131.2083, "train_tokens_per_second": 4647.037 }, { "epoch": 1.7691326530612246, "grad_norm": 0.6618450911892061, "learning_rate": 3.255475770062899e-07, "loss": 0.25228047370910645, "num_input_tokens_seen": 842018680, "step": 13870, "train_runtime": 181196.6132, "train_tokens_per_second": 4646.989 }, { "epoch": 1.7697704081632653, "grad_norm": 0.7361786903531883, "learning_rate": 3.237720764231517e-07, "loss": 0.27175297737121584, "num_input_tokens_seen": 842324096, "step": 13875, "train_runtime": 181260.2651, "train_tokens_per_second": 4647.042 }, { "epoch": 1.7704081632653061, "grad_norm": 0.6056380018779747, "learning_rate": 3.220012687613222e-07, "loss": 0.2552263975143433, "num_input_tokens_seen": 842624944, "step": 13880, "train_runtime": 181333.0954, "train_tokens_per_second": 4646.835 }, { "epoch": 1.771045918367347, "grad_norm": 0.7720243317578994, "learning_rate": 3.2023515579793e-07, "loss": 0.26123366355895994, "num_input_tokens_seen": 842936928, "step": 13885, "train_runtime": 181398.226, "train_tokens_per_second": 4646.886 }, { "epoch": 1.7716836734693877, "grad_norm": 0.6295963283423344, "learning_rate": 3.1847373930539326e-07, "loss": 0.24546425342559813, "num_input_tokens_seen": 843244832, "step": 13890, "train_runtime": 181454.3124, "train_tokens_per_second": 4647.147 }, { "epoch": 1.7723214285714286, "grad_norm": 0.6467099201436239, "learning_rate": 3.167170210514153e-07, "loss": 0.2333463191986084, "num_input_tokens_seen": 843537008, "step": 13895, "train_runtime": 181519.9392, "train_tokens_per_second": 4647.076 }, { "epoch": 1.7729591836734695, "grad_norm": 0.6329033059130065, "learning_rate": 3.14965002798987e-07, "loss": 0.2539116621017456, "num_input_tokens_seen": 843848648, "step": 13900, "train_runtime": 181589.5625, "train_tokens_per_second": 4647.011 }, { "epoch": 1.7735969387755102, "grad_norm": 0.6681516188241793, "learning_rate": 3.1321768630638073e-07, "loss": 0.23679733276367188, "num_input_tokens_seen": 844152576, "step": 13905, "train_runtime": 181647.8166, "train_tokens_per_second": 4647.194 }, { "epoch": 1.774234693877551, "grad_norm": 0.6513231584972891, "learning_rate": 3.1147507332715044e-07, "loss": 0.24175968170166015, "num_input_tokens_seen": 844450232, "step": 13910, "train_runtime": 181713.9919, "train_tokens_per_second": 4647.139 }, { "epoch": 1.774872448979592, "grad_norm": 0.6402550001567784, "learning_rate": 3.097371656101289e-07, "loss": 0.25646772384643557, "num_input_tokens_seen": 844753504, "step": 13915, "train_runtime": 181779.8747, "train_tokens_per_second": 4647.123 }, { "epoch": 1.7755102040816326, "grad_norm": 0.6702558880296042, "learning_rate": 3.080039648994304e-07, "loss": 0.2563156604766846, "num_input_tokens_seen": 845053312, "step": 13920, "train_runtime": 181842.9033, "train_tokens_per_second": 4647.161 }, { "epoch": 1.7761479591836735, "grad_norm": 0.6585912651253576, "learning_rate": 3.062754729344408e-07, "loss": 0.2489215612411499, "num_input_tokens_seen": 845353704, "step": 13925, "train_runtime": 181907.9236, "train_tokens_per_second": 4647.152 }, { "epoch": 1.7767857142857144, "grad_norm": 0.703042446598996, "learning_rate": 3.0455169144982257e-07, "loss": 0.24673690795898437, "num_input_tokens_seen": 845669088, "step": 13930, "train_runtime": 181977.421, "train_tokens_per_second": 4647.11 }, { "epoch": 1.777423469387755, "grad_norm": 0.6530625339120676, "learning_rate": 3.028326221755118e-07, "loss": 0.2515824317932129, "num_input_tokens_seen": 845963736, "step": 13935, "train_runtime": 182039.512, "train_tokens_per_second": 4647.144 }, { "epoch": 1.7780612244897958, "grad_norm": 0.6846638353735537, "learning_rate": 3.0111826683671407e-07, "loss": 0.29273903369903564, "num_input_tokens_seen": 846263064, "step": 13940, "train_runtime": 182101.1988, "train_tokens_per_second": 4647.213 }, { "epoch": 1.7786989795918369, "grad_norm": 0.6624536048396347, "learning_rate": 2.9940862715390483e-07, "loss": 0.2593369483947754, "num_input_tokens_seen": 846571384, "step": 13945, "train_runtime": 182176.6939, "train_tokens_per_second": 4646.98 }, { "epoch": 1.7793367346938775, "grad_norm": 0.6629850876763493, "learning_rate": 2.9770370484282665e-07, "loss": 0.24895977973937988, "num_input_tokens_seen": 846871040, "step": 13950, "train_runtime": 182251.9296, "train_tokens_per_second": 4646.705 }, { "epoch": 1.7799744897959182, "grad_norm": 0.7033528480998114, "learning_rate": 2.960035016144885e-07, "loss": 0.2705617666244507, "num_input_tokens_seen": 847170952, "step": 13955, "train_runtime": 182323.756, "train_tokens_per_second": 4646.52 }, { "epoch": 1.7806122448979593, "grad_norm": 0.6696348082058241, "learning_rate": 2.943080191751629e-07, "loss": 0.26220757961273194, "num_input_tokens_seen": 847480888, "step": 13960, "train_runtime": 182380.7598, "train_tokens_per_second": 4646.767 }, { "epoch": 1.78125, "grad_norm": 0.6381588890555563, "learning_rate": 2.9261725922638485e-07, "loss": 0.24409053325653077, "num_input_tokens_seen": 847780648, "step": 13965, "train_runtime": 182447.1243, "train_tokens_per_second": 4646.72 }, { "epoch": 1.7818877551020407, "grad_norm": 0.6943220822102325, "learning_rate": 2.9093122346494974e-07, "loss": 0.23370254039764404, "num_input_tokens_seen": 848066224, "step": 13970, "train_runtime": 182503.7318, "train_tokens_per_second": 4646.843 }, { "epoch": 1.7825255102040818, "grad_norm": 0.5779729833787437, "learning_rate": 2.8924991358291354e-07, "loss": 0.2403944969177246, "num_input_tokens_seen": 848364288, "step": 13975, "train_runtime": 182557.4179, "train_tokens_per_second": 4647.109 }, { "epoch": 1.7831632653061225, "grad_norm": 0.7469470835026416, "learning_rate": 2.875733312675855e-07, "loss": 0.2287726640701294, "num_input_tokens_seen": 848652288, "step": 13980, "train_runtime": 182618.8975, "train_tokens_per_second": 4647.122 }, { "epoch": 1.7838010204081631, "grad_norm": 0.7216525773887124, "learning_rate": 2.8590147820153513e-07, "loss": 0.2606127977371216, "num_input_tokens_seen": 848956280, "step": 13985, "train_runtime": 182683.4529, "train_tokens_per_second": 4647.144 }, { "epoch": 1.7844387755102042, "grad_norm": 0.6859899777720221, "learning_rate": 2.8423435606258485e-07, "loss": 0.25071115493774415, "num_input_tokens_seen": 849265056, "step": 13990, "train_runtime": 182740.7151, "train_tokens_per_second": 4647.377 }, { "epoch": 1.785076530612245, "grad_norm": 0.7838533272897487, "learning_rate": 2.8257196652380523e-07, "loss": 0.27875847816467286, "num_input_tokens_seen": 849562600, "step": 13995, "train_runtime": 182812.1603, "train_tokens_per_second": 4647.189 }, { "epoch": 1.7857142857142856, "grad_norm": 0.6870819284813265, "learning_rate": 2.809143112535212e-07, "loss": 0.25108349323272705, "num_input_tokens_seen": 849859784, "step": 14000, "train_runtime": 182873.9372, "train_tokens_per_second": 4647.244 }, { "epoch": 1.7863520408163265, "grad_norm": 0.6557445435384791, "learning_rate": 2.7926139191530697e-07, "loss": 0.24347131252288817, "num_input_tokens_seen": 850149912, "step": 14005, "train_runtime": 182942.3276, "train_tokens_per_second": 4647.092 }, { "epoch": 1.7869897959183674, "grad_norm": 0.6161919896676236, "learning_rate": 2.7761321016798183e-07, "loss": 0.25662524700164796, "num_input_tokens_seen": 850451656, "step": 14010, "train_runtime": 183007.8151, "train_tokens_per_second": 4647.078 }, { "epoch": 1.787627551020408, "grad_norm": 0.6480858234573649, "learning_rate": 2.7596976766560977e-07, "loss": 0.25433058738708497, "num_input_tokens_seen": 850768992, "step": 14015, "train_runtime": 183080.2664, "train_tokens_per_second": 4646.973 }, { "epoch": 1.788265306122449, "grad_norm": 0.6157549086187802, "learning_rate": 2.743310660575027e-07, "loss": 0.22808046340942384, "num_input_tokens_seen": 851067016, "step": 14020, "train_runtime": 183152.4548, "train_tokens_per_second": 4646.768 }, { "epoch": 1.7889030612244898, "grad_norm": 0.6577093841837045, "learning_rate": 2.726971069882101e-07, "loss": 0.2544532060623169, "num_input_tokens_seen": 851376720, "step": 14025, "train_runtime": 183229.1979, "train_tokens_per_second": 4646.512 }, { "epoch": 1.7895408163265305, "grad_norm": 0.6313778365859739, "learning_rate": 2.7106789209752513e-07, "loss": 0.23698220252990723, "num_input_tokens_seen": 851672720, "step": 14030, "train_runtime": 183296.8813, "train_tokens_per_second": 4646.411 }, { "epoch": 1.7901785714285714, "grad_norm": 0.6976681415900199, "learning_rate": 2.6944342302047785e-07, "loss": 0.2619039297103882, "num_input_tokens_seen": 851976424, "step": 14035, "train_runtime": 183368.148, "train_tokens_per_second": 4646.262 }, { "epoch": 1.7908163265306123, "grad_norm": 0.6318411761298479, "learning_rate": 2.678237013873375e-07, "loss": 0.26267783641815184, "num_input_tokens_seen": 852281432, "step": 14040, "train_runtime": 183423.3029, "train_tokens_per_second": 4646.528 }, { "epoch": 1.791454081632653, "grad_norm": 0.6047257626502369, "learning_rate": 2.66208728823607e-07, "loss": 0.2652120113372803, "num_input_tokens_seen": 852594760, "step": 14045, "train_runtime": 183498.0974, "train_tokens_per_second": 4646.341 }, { "epoch": 1.7920918367346939, "grad_norm": 0.7264580741551205, "learning_rate": 2.6459850695002454e-07, "loss": 0.24768829345703125, "num_input_tokens_seen": 852914064, "step": 14050, "train_runtime": 183548.1676, "train_tokens_per_second": 4646.813 }, { "epoch": 1.7927295918367347, "grad_norm": 0.7594343746620614, "learning_rate": 2.629930373825595e-07, "loss": 0.24914608001708985, "num_input_tokens_seen": 853226440, "step": 14055, "train_runtime": 183609.4309, "train_tokens_per_second": 4646.964 }, { "epoch": 1.7933673469387754, "grad_norm": 0.7112763675532762, "learning_rate": 2.6139232173241434e-07, "loss": 0.2694690227508545, "num_input_tokens_seen": 853536736, "step": 14060, "train_runtime": 183679.4922, "train_tokens_per_second": 4646.881 }, { "epoch": 1.7940051020408163, "grad_norm": 0.6551911498856521, "learning_rate": 2.5979636160601673e-07, "loss": 0.24811267852783203, "num_input_tokens_seen": 853826704, "step": 14065, "train_runtime": 183747.2023, "train_tokens_per_second": 4646.747 }, { "epoch": 1.7946428571428572, "grad_norm": 0.6838683823425431, "learning_rate": 2.5820515860502604e-07, "loss": 0.27320079803466796, "num_input_tokens_seen": 854143904, "step": 14070, "train_runtime": 183806.5216, "train_tokens_per_second": 4646.973 }, { "epoch": 1.7952806122448979, "grad_norm": 0.6286894231694805, "learning_rate": 2.5661871432632545e-07, "loss": 0.2347564935684204, "num_input_tokens_seen": 854451200, "step": 14075, "train_runtime": 183870.7025, "train_tokens_per_second": 4647.022 }, { "epoch": 1.7959183673469388, "grad_norm": 0.4986039569614931, "learning_rate": 2.550370303620214e-07, "loss": 0.20640251636505128, "num_input_tokens_seen": 854750472, "step": 14080, "train_runtime": 183938.071, "train_tokens_per_second": 4646.947 }, { "epoch": 1.7965561224489797, "grad_norm": 0.7190719301797829, "learning_rate": 2.534601082994437e-07, "loss": 0.2538137912750244, "num_input_tokens_seen": 855047024, "step": 14085, "train_runtime": 184005.8618, "train_tokens_per_second": 4646.847 }, { "epoch": 1.7971938775510203, "grad_norm": 0.6826560743610066, "learning_rate": 2.5188794972114684e-07, "loss": 0.2629712104797363, "num_input_tokens_seen": 855326880, "step": 14090, "train_runtime": 184074.28, "train_tokens_per_second": 4646.64 }, { "epoch": 1.7978316326530612, "grad_norm": 0.6121660757427955, "learning_rate": 2.503205562048994e-07, "loss": 0.23544673919677733, "num_input_tokens_seen": 855626608, "step": 14095, "train_runtime": 184150.4967, "train_tokens_per_second": 4646.344 }, { "epoch": 1.7984693877551021, "grad_norm": 0.7785284207508509, "learning_rate": 2.487579293236897e-07, "loss": 0.2749136447906494, "num_input_tokens_seen": 855935280, "step": 14100, "train_runtime": 184217.7303, "train_tokens_per_second": 4646.324 }, { "epoch": 1.7991071428571428, "grad_norm": 0.6536024201963503, "learning_rate": 2.4720007064572506e-07, "loss": 0.25101404190063475, "num_input_tokens_seen": 856237432, "step": 14105, "train_runtime": 184284.5597, "train_tokens_per_second": 4646.279 }, { "epoch": 1.7997448979591837, "grad_norm": 0.713273301359594, "learning_rate": 2.456469817344237e-07, "loss": 0.24380555152893066, "num_input_tokens_seen": 856528816, "step": 14110, "train_runtime": 184348.4076, "train_tokens_per_second": 4646.25 }, { "epoch": 1.8003826530612246, "grad_norm": 0.7100508414107232, "learning_rate": 2.4409866414841996e-07, "loss": 0.25036029815673827, "num_input_tokens_seen": 856837488, "step": 14115, "train_runtime": 184398.2947, "train_tokens_per_second": 4646.667 }, { "epoch": 1.8010204081632653, "grad_norm": 0.606344854788227, "learning_rate": 2.4255511944155764e-07, "loss": 0.2392751932144165, "num_input_tokens_seen": 857138856, "step": 14120, "train_runtime": 184466.5761, "train_tokens_per_second": 4646.581 }, { "epoch": 1.8016581632653061, "grad_norm": 0.5690719359798412, "learning_rate": 2.410163491628925e-07, "loss": 0.2524121761322021, "num_input_tokens_seen": 857460528, "step": 14125, "train_runtime": 184523.5605, "train_tokens_per_second": 4646.889 }, { "epoch": 1.802295918367347, "grad_norm": 0.6631517596741462, "learning_rate": 2.394823548566877e-07, "loss": 0.24928345680236816, "num_input_tokens_seen": 857764176, "step": 14130, "train_runtime": 184603.0616, "train_tokens_per_second": 4646.533 }, { "epoch": 1.8029336734693877, "grad_norm": 0.6523048042702136, "learning_rate": 2.3795313806241337e-07, "loss": 0.23600704669952394, "num_input_tokens_seen": 858062936, "step": 14135, "train_runtime": 184666.2406, "train_tokens_per_second": 4646.561 }, { "epoch": 1.8035714285714286, "grad_norm": 0.6837868788862734, "learning_rate": 2.364287003147453e-07, "loss": 0.24544596672058105, "num_input_tokens_seen": 858351512, "step": 14140, "train_runtime": 184732.4412, "train_tokens_per_second": 4646.458 }, { "epoch": 1.8042091836734695, "grad_norm": 0.6808156534706771, "learning_rate": 2.3490904314356412e-07, "loss": 0.2638862133026123, "num_input_tokens_seen": 858666680, "step": 14145, "train_runtime": 184807.5782, "train_tokens_per_second": 4646.274 }, { "epoch": 1.8048469387755102, "grad_norm": 0.7256553064605521, "learning_rate": 2.3339416807395154e-07, "loss": 0.25586857795715334, "num_input_tokens_seen": 858970664, "step": 14150, "train_runtime": 184873.5503, "train_tokens_per_second": 4646.26 }, { "epoch": 1.805484693877551, "grad_norm": 0.6270706782907929, "learning_rate": 2.3188407662618983e-07, "loss": 0.24245853424072267, "num_input_tokens_seen": 859261112, "step": 14155, "train_runtime": 184941.1489, "train_tokens_per_second": 4646.133 }, { "epoch": 1.806122448979592, "grad_norm": 0.64741133491633, "learning_rate": 2.3037877031576172e-07, "loss": 0.2581301212310791, "num_input_tokens_seen": 859577136, "step": 14160, "train_runtime": 185000.7743, "train_tokens_per_second": 4646.343 }, { "epoch": 1.8067602040816326, "grad_norm": 0.6632840804843064, "learning_rate": 2.2887825065334822e-07, "loss": 0.2506843566894531, "num_input_tokens_seen": 859880464, "step": 14165, "train_runtime": 185065.143, "train_tokens_per_second": 4646.366 }, { "epoch": 1.8073979591836735, "grad_norm": 0.713382029018524, "learning_rate": 2.2738251914482312e-07, "loss": 0.24305098056793212, "num_input_tokens_seen": 860178936, "step": 14170, "train_runtime": 185142.2931, "train_tokens_per_second": 4646.042 }, { "epoch": 1.8080357142857144, "grad_norm": 0.6850868170743648, "learning_rate": 2.258915772912601e-07, "loss": 0.23382172584533692, "num_input_tokens_seen": 860472656, "step": 14175, "train_runtime": 185210.4182, "train_tokens_per_second": 4645.919 }, { "epoch": 1.808673469387755, "grad_norm": 0.6509414843067686, "learning_rate": 2.2440542658892172e-07, "loss": 0.26403107643127444, "num_input_tokens_seen": 860776504, "step": 14180, "train_runtime": 185277.0564, "train_tokens_per_second": 4645.888 }, { "epoch": 1.8093112244897958, "grad_norm": 0.663937822628379, "learning_rate": 2.2292406852926385e-07, "loss": 0.25989222526550293, "num_input_tokens_seen": 861080704, "step": 14185, "train_runtime": 185342.5877, "train_tokens_per_second": 4645.887 }, { "epoch": 1.8099489795918369, "grad_norm": 0.7188686180245325, "learning_rate": 2.214475045989345e-07, "loss": 0.2608367919921875, "num_input_tokens_seen": 861392760, "step": 14190, "train_runtime": 185399.4962, "train_tokens_per_second": 4646.144 }, { "epoch": 1.8105867346938775, "grad_norm": 0.6708563723098995, "learning_rate": 2.199757362797672e-07, "loss": 0.24211552143096923, "num_input_tokens_seen": 861703280, "step": 14195, "train_runtime": 185469.4488, "train_tokens_per_second": 4646.066 }, { "epoch": 1.8112244897959182, "grad_norm": 0.706510013791032, "learning_rate": 2.1850876504878492e-07, "loss": 0.26641933917999266, "num_input_tokens_seen": 862005704, "step": 14200, "train_runtime": 185522.502, "train_tokens_per_second": 4646.367 }, { "epoch": 1.8118622448979593, "grad_norm": 0.6217409753033918, "learning_rate": 2.1704659237819558e-07, "loss": 0.2593922853469849, "num_input_tokens_seen": 862313352, "step": 14205, "train_runtime": 185594.2525, "train_tokens_per_second": 4646.229 }, { "epoch": 1.8125, "grad_norm": 0.6715338430285219, "learning_rate": 2.1558921973539092e-07, "loss": 0.22741270065307617, "num_input_tokens_seen": 862611096, "step": 14210, "train_runtime": 185656.4179, "train_tokens_per_second": 4646.277 }, { "epoch": 1.8131377551020407, "grad_norm": 0.6998027270839655, "learning_rate": 2.1413664858294713e-07, "loss": 0.2631678104400635, "num_input_tokens_seen": 862909136, "step": 14215, "train_runtime": 185707.6256, "train_tokens_per_second": 4646.6 }, { "epoch": 1.8137755102040818, "grad_norm": 0.5670888159968765, "learning_rate": 2.126888803786209e-07, "loss": 0.23754780292510985, "num_input_tokens_seen": 863205776, "step": 14220, "train_runtime": 185763.461, "train_tokens_per_second": 4646.801 }, { "epoch": 1.8144132653061225, "grad_norm": 0.7433984551662745, "learning_rate": 2.1124591657534776e-07, "loss": 0.2515824556350708, "num_input_tokens_seen": 863513144, "step": 14225, "train_runtime": 185823.9326, "train_tokens_per_second": 4646.943 }, { "epoch": 1.8150510204081631, "grad_norm": 0.6718313238722916, "learning_rate": 2.0980775862124326e-07, "loss": 0.26154017448425293, "num_input_tokens_seen": 863819928, "step": 14230, "train_runtime": 185886.3326, "train_tokens_per_second": 4647.033 }, { "epoch": 1.8156887755102042, "grad_norm": 0.7065683223653454, "learning_rate": 2.083744079595995e-07, "loss": 0.24450421333312988, "num_input_tokens_seen": 864123928, "step": 14235, "train_runtime": 185939.1605, "train_tokens_per_second": 4647.348 }, { "epoch": 1.816326530612245, "grad_norm": 0.6260478894014965, "learning_rate": 2.069458660288831e-07, "loss": 0.25495457649230957, "num_input_tokens_seen": 864431064, "step": 14240, "train_runtime": 185996.0951, "train_tokens_per_second": 4647.576 }, { "epoch": 1.8169642857142856, "grad_norm": 0.6957318363665137, "learning_rate": 2.0552213426273725e-07, "loss": 0.26381802558898926, "num_input_tokens_seen": 864729568, "step": 14245, "train_runtime": 186059.0462, "train_tokens_per_second": 4647.608 }, { "epoch": 1.8176020408163265, "grad_norm": 0.6389361327846603, "learning_rate": 2.0410321408997459e-07, "loss": 0.25765416622161863, "num_input_tokens_seen": 865040992, "step": 14250, "train_runtime": 186137.216, "train_tokens_per_second": 4647.33 }, { "epoch": 1.8182397959183674, "grad_norm": 0.6401658008989223, "learning_rate": 2.0268910693458154e-07, "loss": 0.25167059898376465, "num_input_tokens_seen": 865330088, "step": 14255, "train_runtime": 186201.8332, "train_tokens_per_second": 4647.269 }, { "epoch": 1.818877551020408, "grad_norm": 0.6473296193207879, "learning_rate": 2.0127981421571295e-07, "loss": 0.23990678787231445, "num_input_tokens_seen": 865633168, "step": 14260, "train_runtime": 186268.6883, "train_tokens_per_second": 4647.229 }, { "epoch": 1.819515306122449, "grad_norm": 0.7195140822124848, "learning_rate": 1.998753373476936e-07, "loss": 0.25752208232879636, "num_input_tokens_seen": 865932040, "step": 14265, "train_runtime": 186330.5301, "train_tokens_per_second": 4647.29 }, { "epoch": 1.8201530612244898, "grad_norm": 0.7001758138626799, "learning_rate": 1.9847567774001153e-07, "loss": 0.2669686794281006, "num_input_tokens_seen": 866232520, "step": 14270, "train_runtime": 186394.3236, "train_tokens_per_second": 4647.312 }, { "epoch": 1.8207908163265305, "grad_norm": 0.7296375689862533, "learning_rate": 1.9708083679732538e-07, "loss": 0.2516944885253906, "num_input_tokens_seen": 866539944, "step": 14275, "train_runtime": 186458.8822, "train_tokens_per_second": 4647.351 }, { "epoch": 1.8214285714285714, "grad_norm": 0.6677299264673359, "learning_rate": 1.9569081591945537e-07, "loss": 0.2641996622085571, "num_input_tokens_seen": 866835376, "step": 14280, "train_runtime": 186521.6387, "train_tokens_per_second": 4647.372 }, { "epoch": 1.8220663265306123, "grad_norm": 0.6780265762181436, "learning_rate": 1.9430561650138292e-07, "loss": 0.2752277374267578, "num_input_tokens_seen": 867149688, "step": 14285, "train_runtime": 186588.3087, "train_tokens_per_second": 4647.396 }, { "epoch": 1.822704081632653, "grad_norm": 0.700308185107038, "learning_rate": 1.9292523993325318e-07, "loss": 0.2481313943862915, "num_input_tokens_seen": 867451672, "step": 14290, "train_runtime": 186662.5271, "train_tokens_per_second": 4647.166 }, { "epoch": 1.8233418367346939, "grad_norm": 0.7158540700829921, "learning_rate": 1.9154968760037142e-07, "loss": 0.24785711765289306, "num_input_tokens_seen": 867746048, "step": 14295, "train_runtime": 186727.6649, "train_tokens_per_second": 4647.121 }, { "epoch": 1.8239795918367347, "grad_norm": 0.7064749893470933, "learning_rate": 1.9017896088319888e-07, "loss": 0.26390371322631834, "num_input_tokens_seen": 868050248, "step": 14300, "train_runtime": 186786.3421, "train_tokens_per_second": 4647.29 }, { "epoch": 1.8246173469387754, "grad_norm": 0.6555062357278937, "learning_rate": 1.8881306115735632e-07, "loss": 0.23825533390045167, "num_input_tokens_seen": 868353320, "step": 14305, "train_runtime": 186851.2879, "train_tokens_per_second": 4647.296 }, { "epoch": 1.8252551020408163, "grad_norm": 0.6445761263231499, "learning_rate": 1.8745198979361944e-07, "loss": 0.25106494426727294, "num_input_tokens_seen": 868666888, "step": 14310, "train_runtime": 186906.1346, "train_tokens_per_second": 4647.61 }, { "epoch": 1.8258928571428572, "grad_norm": 0.6356923129717615, "learning_rate": 1.8609574815791843e-07, "loss": 0.25816683769226073, "num_input_tokens_seen": 868959528, "step": 14315, "train_runtime": 186975.7484, "train_tokens_per_second": 4647.445 }, { "epoch": 1.8265306122448979, "grad_norm": 0.6946034954343195, "learning_rate": 1.8474433761133614e-07, "loss": 0.2542288780212402, "num_input_tokens_seen": 869269160, "step": 14320, "train_runtime": 187046.8974, "train_tokens_per_second": 4647.333 }, { "epoch": 1.8271683673469388, "grad_norm": 0.660378050821299, "learning_rate": 1.833977595101083e-07, "loss": 0.26385793685913084, "num_input_tokens_seen": 869579752, "step": 14325, "train_runtime": 187114.798, "train_tokens_per_second": 4647.306 }, { "epoch": 1.8278061224489797, "grad_norm": 0.6366486775794228, "learning_rate": 1.8205601520561945e-07, "loss": 0.24700777530670165, "num_input_tokens_seen": 869872912, "step": 14330, "train_runtime": 187182.5796, "train_tokens_per_second": 4647.189 }, { "epoch": 1.8284438775510203, "grad_norm": 0.6473337544815833, "learning_rate": 1.8071910604440356e-07, "loss": 0.2464057445526123, "num_input_tokens_seen": 870179712, "step": 14335, "train_runtime": 187246.6634, "train_tokens_per_second": 4647.237 }, { "epoch": 1.8290816326530612, "grad_norm": 0.5948782537013565, "learning_rate": 1.79387033368143e-07, "loss": 0.23783507347106933, "num_input_tokens_seen": 870472648, "step": 14340, "train_runtime": 187306.0704, "train_tokens_per_second": 4647.327 }, { "epoch": 1.8297193877551021, "grad_norm": 0.6901984740177014, "learning_rate": 1.7805979851366505e-07, "loss": 0.25328662395477297, "num_input_tokens_seen": 870770136, "step": 14345, "train_runtime": 187369.6636, "train_tokens_per_second": 4647.338 }, { "epoch": 1.8303571428571428, "grad_norm": 0.6756107635776969, "learning_rate": 1.7673740281294316e-07, "loss": 0.25124058723449705, "num_input_tokens_seen": 871079520, "step": 14350, "train_runtime": 187444.0672, "train_tokens_per_second": 4647.144 }, { "epoch": 1.8309948979591837, "grad_norm": 0.6127683238599845, "learning_rate": 1.7541984759309294e-07, "loss": 0.2524874687194824, "num_input_tokens_seen": 871377240, "step": 14355, "train_runtime": 187512.5228, "train_tokens_per_second": 4647.035 }, { "epoch": 1.8316326530612246, "grad_norm": 0.674476404412451, "learning_rate": 1.7410713417637338e-07, "loss": 0.2508760929107666, "num_input_tokens_seen": 871676128, "step": 14360, "train_runtime": 187577.2399, "train_tokens_per_second": 4647.025 }, { "epoch": 1.8322704081632653, "grad_norm": 0.7270189261309183, "learning_rate": 1.7279926388018564e-07, "loss": 0.24621005058288575, "num_input_tokens_seen": 871980776, "step": 14365, "train_runtime": 187641.0739, "train_tokens_per_second": 4647.068 }, { "epoch": 1.8329081632653061, "grad_norm": 0.6963106266766658, "learning_rate": 1.714962380170665e-07, "loss": 0.23934614658355713, "num_input_tokens_seen": 872279784, "step": 14370, "train_runtime": 187710.1285, "train_tokens_per_second": 4646.951 }, { "epoch": 1.833545918367347, "grad_norm": 0.6853932411913404, "learning_rate": 1.701980578946938e-07, "loss": 0.22678751945495607, "num_input_tokens_seen": 872592464, "step": 14375, "train_runtime": 187774.326, "train_tokens_per_second": 4647.028 }, { "epoch": 1.8341836734693877, "grad_norm": 0.7962057581032416, "learning_rate": 1.6890472481588426e-07, "loss": 0.2569415092468262, "num_input_tokens_seen": 872884192, "step": 14380, "train_runtime": 187848.7707, "train_tokens_per_second": 4646.739 }, { "epoch": 1.8348214285714286, "grad_norm": 0.6615958345699283, "learning_rate": 1.6761624007858524e-07, "loss": 0.24323534965515137, "num_input_tokens_seen": 873200056, "step": 14385, "train_runtime": 187899.9735, "train_tokens_per_second": 4647.154 }, { "epoch": 1.8354591836734695, "grad_norm": 0.6614228182106681, "learning_rate": 1.6633260497588233e-07, "loss": 0.25774874687194826, "num_input_tokens_seen": 873496664, "step": 14390, "train_runtime": 187974.3484, "train_tokens_per_second": 4646.893 }, { "epoch": 1.8360969387755102, "grad_norm": 0.6877463849143334, "learning_rate": 1.6505382079599341e-07, "loss": 0.26739423274993895, "num_input_tokens_seen": 873815000, "step": 14395, "train_runtime": 188039.779, "train_tokens_per_second": 4646.969 }, { "epoch": 1.836734693877551, "grad_norm": 0.7078027136954513, "learning_rate": 1.6377988882226691e-07, "loss": 0.2510525226593018, "num_input_tokens_seen": 874111704, "step": 14400, "train_runtime": 188116.0135, "train_tokens_per_second": 4646.663 }, { "epoch": 1.837372448979592, "grad_norm": 0.7580819643931567, "learning_rate": 1.6251081033318294e-07, "loss": 0.2626865148544312, "num_input_tokens_seen": 874416736, "step": 14405, "train_runtime": 188183.8824, "train_tokens_per_second": 4646.608 }, { "epoch": 1.8380102040816326, "grad_norm": 0.7085086490871588, "learning_rate": 1.6124658660234993e-07, "loss": 0.25091991424560545, "num_input_tokens_seen": 874708496, "step": 14410, "train_runtime": 188256.4407, "train_tokens_per_second": 4646.367 }, { "epoch": 1.8386479591836735, "grad_norm": 0.6446046434293724, "learning_rate": 1.5998721889850577e-07, "loss": 0.2551647901535034, "num_input_tokens_seen": 875023056, "step": 14415, "train_runtime": 188306.5667, "train_tokens_per_second": 4646.801 }, { "epoch": 1.8392857142857144, "grad_norm": 0.662134237887001, "learning_rate": 1.5873270848551227e-07, "loss": 0.2508412837982178, "num_input_tokens_seen": 875310232, "step": 14420, "train_runtime": 188373.5681, "train_tokens_per_second": 4646.672 }, { "epoch": 1.839923469387755, "grad_norm": 0.6112720261337682, "learning_rate": 1.5748305662236008e-07, "loss": 0.2600100994110107, "num_input_tokens_seen": 875617936, "step": 14425, "train_runtime": 188442.4026, "train_tokens_per_second": 4646.608 }, { "epoch": 1.8405612244897958, "grad_norm": 0.610175837551541, "learning_rate": 1.562382645631605e-07, "loss": 0.24649903774261475, "num_input_tokens_seen": 875913640, "step": 14430, "train_runtime": 188515.8723, "train_tokens_per_second": 4646.365 }, { "epoch": 1.8411989795918369, "grad_norm": 0.6658147878089529, "learning_rate": 1.549983335571509e-07, "loss": 0.24332361221313475, "num_input_tokens_seen": 876218840, "step": 14435, "train_runtime": 188572.153, "train_tokens_per_second": 4646.597 }, { "epoch": 1.8418367346938775, "grad_norm": 0.7215403228955583, "learning_rate": 1.537632648486864e-07, "loss": 0.2727149248123169, "num_input_tokens_seen": 876527088, "step": 14440, "train_runtime": 188635.6936, "train_tokens_per_second": 4646.666 }, { "epoch": 1.8424744897959182, "grad_norm": 0.6682756447039231, "learning_rate": 1.5253305967724674e-07, "loss": 0.24445388317108155, "num_input_tokens_seen": 876825528, "step": 14445, "train_runtime": 188693.5814, "train_tokens_per_second": 4646.822 }, { "epoch": 1.8431122448979593, "grad_norm": 0.6355429041547278, "learning_rate": 1.513077192774287e-07, "loss": 0.2287886619567871, "num_input_tokens_seen": 877131672, "step": 14450, "train_runtime": 188760.8044, "train_tokens_per_second": 4646.789 }, { "epoch": 1.84375, "grad_norm": 0.6808345607996471, "learning_rate": 1.500872448789459e-07, "loss": 0.2465895652770996, "num_input_tokens_seen": 877437424, "step": 14455, "train_runtime": 188816.2473, "train_tokens_per_second": 4647.044 }, { "epoch": 1.8443877551020407, "grad_norm": 0.6173045192997421, "learning_rate": 1.4887163770662905e-07, "loss": 0.2551894664764404, "num_input_tokens_seen": 877726048, "step": 14460, "train_runtime": 188873.6196, "train_tokens_per_second": 4647.161 }, { "epoch": 1.8450255102040818, "grad_norm": 0.6090481756128957, "learning_rate": 1.4766089898042678e-07, "loss": 0.2440091848373413, "num_input_tokens_seen": 878032896, "step": 14465, "train_runtime": 188930.2722, "train_tokens_per_second": 4647.391 }, { "epoch": 1.8456632653061225, "grad_norm": 0.6849560768714724, "learning_rate": 1.4645502991539883e-07, "loss": 0.24983086585998535, "num_input_tokens_seen": 878336096, "step": 14470, "train_runtime": 189001.2366, "train_tokens_per_second": 4647.251 }, { "epoch": 1.8463010204081631, "grad_norm": 0.6332439136947746, "learning_rate": 1.452540317217188e-07, "loss": 0.2324315309524536, "num_input_tokens_seen": 878647240, "step": 14475, "train_runtime": 189074.486, "train_tokens_per_second": 4647.096 }, { "epoch": 1.8469387755102042, "grad_norm": 0.6390851043551204, "learning_rate": 1.440579056046737e-07, "loss": 0.2568353176116943, "num_input_tokens_seen": 878950824, "step": 14480, "train_runtime": 189139.028, "train_tokens_per_second": 4647.115 }, { "epoch": 1.847576530612245, "grad_norm": 0.7183239161813246, "learning_rate": 1.428666527646577e-07, "loss": 0.2626702308654785, "num_input_tokens_seen": 879270336, "step": 14485, "train_runtime": 189198.8639, "train_tokens_per_second": 4647.334 }, { "epoch": 1.8482142857142856, "grad_norm": 0.7044687927889742, "learning_rate": 1.4168027439717735e-07, "loss": 0.25818753242492676, "num_input_tokens_seen": 879571280, "step": 14490, "train_runtime": 189262.0499, "train_tokens_per_second": 4647.373 }, { "epoch": 1.8488520408163265, "grad_norm": 0.640036435227342, "learning_rate": 1.4049877169284575e-07, "loss": 0.2519019842147827, "num_input_tokens_seen": 879869408, "step": 14495, "train_runtime": 189321.1195, "train_tokens_per_second": 4647.497 }, { "epoch": 1.8494897959183674, "grad_norm": 0.6266036999291648, "learning_rate": 1.3932214583738334e-07, "loss": 0.273012113571167, "num_input_tokens_seen": 880185176, "step": 14500, "train_runtime": 189386.1211, "train_tokens_per_second": 4647.57 }, { "epoch": 1.850127551020408, "grad_norm": 0.6474337326362705, "learning_rate": 1.3815039801161723e-07, "loss": 0.23094744682312013, "num_input_tokens_seen": 880486032, "step": 14505, "train_runtime": 189455.2359, "train_tokens_per_second": 4647.462 }, { "epoch": 1.850765306122449, "grad_norm": 0.6427624494514836, "learning_rate": 1.369835293914773e-07, "loss": 0.25781404972076416, "num_input_tokens_seen": 880787096, "step": 14510, "train_runtime": 189511.6112, "train_tokens_per_second": 4647.668 }, { "epoch": 1.8514030612244898, "grad_norm": 0.6415880011453653, "learning_rate": 1.358215411479974e-07, "loss": 0.2545320510864258, "num_input_tokens_seen": 881095592, "step": 14515, "train_runtime": 189587.434, "train_tokens_per_second": 4647.437 }, { "epoch": 1.8520408163265305, "grad_norm": 0.6401573982383106, "learning_rate": 1.3466443444731525e-07, "loss": 0.2468923568725586, "num_input_tokens_seen": 881389136, "step": 14520, "train_runtime": 189655.5039, "train_tokens_per_second": 4647.316 }, { "epoch": 1.8526785714285714, "grad_norm": 0.685404466407528, "learning_rate": 1.3351221045066698e-07, "loss": 0.25362067222595214, "num_input_tokens_seen": 881695144, "step": 14525, "train_runtime": 189721.7728, "train_tokens_per_second": 4647.306 }, { "epoch": 1.8533163265306123, "grad_norm": 0.6354264987157726, "learning_rate": 1.3236487031439037e-07, "loss": 0.2443603277206421, "num_input_tokens_seen": 882008248, "step": 14530, "train_runtime": 189787.2808, "train_tokens_per_second": 4647.352 }, { "epoch": 1.853954081632653, "grad_norm": 0.6704886175647126, "learning_rate": 1.3122241518992107e-07, "loss": 0.23978824615478517, "num_input_tokens_seen": 882314240, "step": 14535, "train_runtime": 189852.5231, "train_tokens_per_second": 4647.366 }, { "epoch": 1.8545918367346939, "grad_norm": 0.8442090166251053, "learning_rate": 1.3008484622379358e-07, "loss": 0.2655137300491333, "num_input_tokens_seen": 882616304, "step": 14540, "train_runtime": 189920.9843, "train_tokens_per_second": 4647.282 }, { "epoch": 1.8552295918367347, "grad_norm": 0.6764105086813371, "learning_rate": 1.2895216455763582e-07, "loss": 0.2473900079727173, "num_input_tokens_seen": 882923560, "step": 14545, "train_runtime": 189978.8193, "train_tokens_per_second": 4647.484 }, { "epoch": 1.8558673469387754, "grad_norm": 0.7022617311790411, "learning_rate": 1.278243713281757e-07, "loss": 0.2586209774017334, "num_input_tokens_seen": 883219664, "step": 14550, "train_runtime": 190056.7007, "train_tokens_per_second": 4647.138 }, { "epoch": 1.8565051020408163, "grad_norm": 0.5938136729185922, "learning_rate": 1.2670146766723013e-07, "loss": 0.234542179107666, "num_input_tokens_seen": 883530760, "step": 14555, "train_runtime": 190116.9986, "train_tokens_per_second": 4647.3 }, { "epoch": 1.8571428571428572, "grad_norm": 0.6633103907103941, "learning_rate": 1.2558345470171153e-07, "loss": 0.2434833526611328, "num_input_tokens_seen": 883836120, "step": 14560, "train_runtime": 190184.6109, "train_tokens_per_second": 4647.254 }, { "epoch": 1.8577806122448979, "grad_norm": 0.6651934099047041, "learning_rate": 1.244703335536257e-07, "loss": 0.2338038921356201, "num_input_tokens_seen": 884131064, "step": 14565, "train_runtime": 190246.0994, "train_tokens_per_second": 4647.302 }, { "epoch": 1.8584183673469388, "grad_norm": 0.6593021054152319, "learning_rate": 1.2336210534006576e-07, "loss": 0.254522705078125, "num_input_tokens_seen": 884427608, "step": 14570, "train_runtime": 190307.0874, "train_tokens_per_second": 4647.371 }, { "epoch": 1.8590561224489797, "grad_norm": 0.7006739894624194, "learning_rate": 1.2225877117321705e-07, "loss": 0.23550329208374024, "num_input_tokens_seen": 884738240, "step": 14575, "train_runtime": 190385.2489, "train_tokens_per_second": 4647.094 }, { "epoch": 1.8596938775510203, "grad_norm": 0.6381391847097326, "learning_rate": 1.2116033216035162e-07, "loss": 0.26369943618774416, "num_input_tokens_seen": 885046808, "step": 14580, "train_runtime": 190459.7978, "train_tokens_per_second": 4646.896 }, { "epoch": 1.8603316326530612, "grad_norm": 0.6705524383278435, "learning_rate": 1.20066789403831e-07, "loss": 0.26955347061157225, "num_input_tokens_seen": 885351872, "step": 14585, "train_runtime": 190517.1238, "train_tokens_per_second": 4647.099 }, { "epoch": 1.8609693877551021, "grad_norm": 0.6174540318052323, "learning_rate": 1.1897814400110064e-07, "loss": 0.24823312759399413, "num_input_tokens_seen": 885663712, "step": 14590, "train_runtime": 190575.0922, "train_tokens_per_second": 4647.321 }, { "epoch": 1.8616071428571428, "grad_norm": 0.6761567719825483, "learning_rate": 1.1789439704469219e-07, "loss": 0.2636047124862671, "num_input_tokens_seen": 885960504, "step": 14595, "train_runtime": 190639.4012, "train_tokens_per_second": 4647.311 }, { "epoch": 1.8622448979591837, "grad_norm": 0.6309923322609609, "learning_rate": 1.168155496222223e-07, "loss": 0.2618051290512085, "num_input_tokens_seen": 886267272, "step": 14600, "train_runtime": 190707.3016, "train_tokens_per_second": 4647.264 }, { "epoch": 1.8628826530612246, "grad_norm": 0.625295239253637, "learning_rate": 1.1574160281638935e-07, "loss": 0.2571128845214844, "num_input_tokens_seen": 886563408, "step": 14605, "train_runtime": 190762.3627, "train_tokens_per_second": 4647.476 }, { "epoch": 1.8635204081632653, "grad_norm": 0.6617635960001381, "learning_rate": 1.1467255770497343e-07, "loss": 0.24137578010559083, "num_input_tokens_seen": 886868720, "step": 14610, "train_runtime": 190831.106, "train_tokens_per_second": 4647.401 }, { "epoch": 1.8641581632653061, "grad_norm": 0.6745362192358028, "learning_rate": 1.1360841536083633e-07, "loss": 0.23988428115844726, "num_input_tokens_seen": 887181184, "step": 14615, "train_runtime": 190888.7338, "train_tokens_per_second": 4647.635 }, { "epoch": 1.864795918367347, "grad_norm": 0.6825878261964686, "learning_rate": 1.125491768519199e-07, "loss": 0.2605908393859863, "num_input_tokens_seen": 887479224, "step": 14620, "train_runtime": 190966.4323, "train_tokens_per_second": 4647.305 }, { "epoch": 1.8654336734693877, "grad_norm": 0.645239604402163, "learning_rate": 1.1149484324124326e-07, "loss": 0.25436906814575194, "num_input_tokens_seen": 887799912, "step": 14625, "train_runtime": 191035.1537, "train_tokens_per_second": 4647.312 }, { "epoch": 1.8660714285714286, "grad_norm": 0.7403347112064289, "learning_rate": 1.1044541558690281e-07, "loss": 0.25912206172943114, "num_input_tokens_seen": 888088832, "step": 14630, "train_runtime": 191092.3326, "train_tokens_per_second": 4647.433 }, { "epoch": 1.8667091836734695, "grad_norm": 0.7230370391364567, "learning_rate": 1.094008949420744e-07, "loss": 0.22946701049804688, "num_input_tokens_seen": 888399576, "step": 14635, "train_runtime": 191157.0422, "train_tokens_per_second": 4647.485 }, { "epoch": 1.8673469387755102, "grad_norm": 0.6907678499682646, "learning_rate": 1.0836128235500676e-07, "loss": 0.23314986228942872, "num_input_tokens_seen": 888707984, "step": 14640, "train_runtime": 191216.5543, "train_tokens_per_second": 4647.652 }, { "epoch": 1.867984693877551, "grad_norm": 0.6631760247916414, "learning_rate": 1.0732657886902308e-07, "loss": 0.2371466875076294, "num_input_tokens_seen": 889023480, "step": 14645, "train_runtime": 191281.7976, "train_tokens_per_second": 4647.716 }, { "epoch": 1.868622448979592, "grad_norm": 0.6625549576654546, "learning_rate": 1.0629678552252109e-07, "loss": 0.25177536010742185, "num_input_tokens_seen": 889315784, "step": 14650, "train_runtime": 191350.9212, "train_tokens_per_second": 4647.565 }, { "epoch": 1.8692602040816326, "grad_norm": 0.6557793654429599, "learning_rate": 1.0527190334897076e-07, "loss": 0.26426329612731936, "num_input_tokens_seen": 889620424, "step": 14655, "train_runtime": 191416.8843, "train_tokens_per_second": 4647.555 }, { "epoch": 1.8698979591836735, "grad_norm": 0.6724420927989058, "learning_rate": 1.0425193337691208e-07, "loss": 0.2512818813323975, "num_input_tokens_seen": 889919392, "step": 14660, "train_runtime": 191481.7376, "train_tokens_per_second": 4647.542 }, { "epoch": 1.8705357142857144, "grad_norm": 0.6773586930650444, "learning_rate": 1.0323687662995685e-07, "loss": 0.271722412109375, "num_input_tokens_seen": 890229504, "step": 14665, "train_runtime": 191548.2801, "train_tokens_per_second": 4647.546 }, { "epoch": 1.871173469387755, "grad_norm": 0.62826592172563, "learning_rate": 1.0222673412678518e-07, "loss": 0.23242733478546143, "num_input_tokens_seen": 890534280, "step": 14670, "train_runtime": 191616.1162, "train_tokens_per_second": 4647.492 }, { "epoch": 1.8718112244897958, "grad_norm": 0.6378366560239725, "learning_rate": 1.0122150688114507e-07, "loss": 0.25556354522705077, "num_input_tokens_seen": 890838848, "step": 14675, "train_runtime": 191678.2331, "train_tokens_per_second": 4647.574 }, { "epoch": 1.8724489795918369, "grad_norm": 0.6153509806232496, "learning_rate": 1.0022119590185287e-07, "loss": 0.25017662048339845, "num_input_tokens_seen": 891149616, "step": 14680, "train_runtime": 191746.3293, "train_tokens_per_second": 4647.545 }, { "epoch": 1.8730867346938775, "grad_norm": 0.671415910331799, "learning_rate": 9.922580219279055e-08, "loss": 0.25757060050964353, "num_input_tokens_seen": 891449720, "step": 14685, "train_runtime": 191823.8479, "train_tokens_per_second": 4647.231 }, { "epoch": 1.8737244897959182, "grad_norm": 0.7137048685934427, "learning_rate": 9.82353267529046e-08, "loss": 0.2548252582550049, "num_input_tokens_seen": 891747784, "step": 14690, "train_runtime": 191884.1037, "train_tokens_per_second": 4647.325 }, { "epoch": 1.8743622448979593, "grad_norm": 0.6596229862745624, "learning_rate": 9.72497705762071e-08, "loss": 0.2520712375640869, "num_input_tokens_seen": 892058120, "step": 14695, "train_runtime": 191947.7977, "train_tokens_per_second": 4647.4 }, { "epoch": 1.875, "grad_norm": 0.6780638735375085, "learning_rate": 9.626913465177246e-08, "loss": 0.26645793914794924, "num_input_tokens_seen": 892363192, "step": 14700, "train_runtime": 192009.6554, "train_tokens_per_second": 4647.491 }, { "epoch": 1.8756377551020407, "grad_norm": 0.6405694736902278, "learning_rate": 9.529341996373675e-08, "loss": 0.2566962718963623, "num_input_tokens_seen": 892669392, "step": 14705, "train_runtime": 192082.3114, "train_tokens_per_second": 4647.327 }, { "epoch": 1.8762755102040818, "grad_norm": 0.6509202472516895, "learning_rate": 9.432262749129784e-08, "loss": 0.24963088035583497, "num_input_tokens_seen": 892968720, "step": 14710, "train_runtime": 192156.2238, "train_tokens_per_second": 4647.098 }, { "epoch": 1.8769132653061225, "grad_norm": 0.778756285306421, "learning_rate": 9.335675820871415e-08, "loss": 0.24836084842681885, "num_input_tokens_seen": 893280344, "step": 14715, "train_runtime": 192216.0713, "train_tokens_per_second": 4647.272 }, { "epoch": 1.8775510204081631, "grad_norm": 0.7139360855592187, "learning_rate": 9.239581308530254e-08, "loss": 0.27693932056427, "num_input_tokens_seen": 893587816, "step": 14720, "train_runtime": 192280.2293, "train_tokens_per_second": 4647.32 }, { "epoch": 1.8781887755102042, "grad_norm": 0.9524393643486794, "learning_rate": 9.143979308543993e-08, "loss": 0.2538874626159668, "num_input_tokens_seen": 893900112, "step": 14725, "train_runtime": 192344.8959, "train_tokens_per_second": 4647.382 }, { "epoch": 1.878826530612245, "grad_norm": 0.6972297812402133, "learning_rate": 9.048869916855662e-08, "loss": 0.2388587236404419, "num_input_tokens_seen": 894202528, "step": 14730, "train_runtime": 192410.9123, "train_tokens_per_second": 4647.359 }, { "epoch": 1.8794642857142856, "grad_norm": 0.7200074370892064, "learning_rate": 8.954253228914356e-08, "loss": 0.24752345085144042, "num_input_tokens_seen": 894517032, "step": 14735, "train_runtime": 192485.7653, "train_tokens_per_second": 4647.185 }, { "epoch": 1.8801020408163265, "grad_norm": 0.7667717526084538, "learning_rate": 8.860129339674562e-08, "loss": 0.2614644289016724, "num_input_tokens_seen": 894810904, "step": 14740, "train_runtime": 192545.6707, "train_tokens_per_second": 4647.266 }, { "epoch": 1.8807397959183674, "grad_norm": 0.610970003049497, "learning_rate": 8.766498343596053e-08, "loss": 0.23589935302734374, "num_input_tokens_seen": 895101344, "step": 14745, "train_runtime": 192613.469, "train_tokens_per_second": 4647.138 }, { "epoch": 1.881377551020408, "grad_norm": 0.6752224221115799, "learning_rate": 8.67336033464411e-08, "loss": 0.2402803421020508, "num_input_tokens_seen": 895400528, "step": 14750, "train_runtime": 192686.7509, "train_tokens_per_second": 4646.923 }, { "epoch": 1.882015306122449, "grad_norm": 0.731006217203887, "learning_rate": 8.580715406289353e-08, "loss": 0.23293819427490234, "num_input_tokens_seen": 895706304, "step": 14755, "train_runtime": 192763.9837, "train_tokens_per_second": 4646.648 }, { "epoch": 1.8826530612244898, "grad_norm": 0.6650984421358715, "learning_rate": 8.488563651507242e-08, "loss": 0.2630185127258301, "num_input_tokens_seen": 896006184, "step": 14760, "train_runtime": 192829.1678, "train_tokens_per_second": 4646.632 }, { "epoch": 1.8832908163265305, "grad_norm": 0.6788993548832946, "learning_rate": 8.396905162778523e-08, "loss": 0.26844196319580077, "num_input_tokens_seen": 896313528, "step": 14765, "train_runtime": 192891.096, "train_tokens_per_second": 4646.734 }, { "epoch": 1.8839285714285714, "grad_norm": 0.6692467737558845, "learning_rate": 8.305740032089116e-08, "loss": 0.2632472991943359, "num_input_tokens_seen": 896619432, "step": 14770, "train_runtime": 192960.9219, "train_tokens_per_second": 4646.637 }, { "epoch": 1.8845663265306123, "grad_norm": 0.5692059577633254, "learning_rate": 8.215068350929334e-08, "loss": 0.25128650665283203, "num_input_tokens_seen": 896916752, "step": 14775, "train_runtime": 193037.4187, "train_tokens_per_second": 4646.336 }, { "epoch": 1.885204081632653, "grad_norm": 0.6830063880564934, "learning_rate": 8.124890210294667e-08, "loss": 0.24625537395477295, "num_input_tokens_seen": 897221008, "step": 14780, "train_runtime": 193101.1866, "train_tokens_per_second": 4646.377 }, { "epoch": 1.8858418367346939, "grad_norm": 0.724929616005513, "learning_rate": 8.035205700685167e-08, "loss": 0.2617891788482666, "num_input_tokens_seen": 897511264, "step": 14785, "train_runtime": 193167.4357, "train_tokens_per_second": 4646.287 }, { "epoch": 1.8864795918367347, "grad_norm": 0.6710932872068884, "learning_rate": 7.946014912105505e-08, "loss": 0.26091532707214354, "num_input_tokens_seen": 897807720, "step": 14790, "train_runtime": 193248.1877, "train_tokens_per_second": 4645.879 }, { "epoch": 1.8871173469387754, "grad_norm": 0.7016151066427102, "learning_rate": 7.857317934064857e-08, "loss": 0.2553201198577881, "num_input_tokens_seen": 898117528, "step": 14795, "train_runtime": 193317.5078, "train_tokens_per_second": 4645.816 }, { "epoch": 1.8877551020408163, "grad_norm": 0.6811844967660088, "learning_rate": 7.769114855576799e-08, "loss": 0.26304941177368163, "num_input_tokens_seen": 898417680, "step": 14800, "train_runtime": 193387.6582, "train_tokens_per_second": 4645.683 }, { "epoch": 1.8883928571428572, "grad_norm": 0.8877659045871802, "learning_rate": 7.6814057651593e-08, "loss": 0.25156078338623045, "num_input_tokens_seen": 898714720, "step": 14805, "train_runtime": 193464.5556, "train_tokens_per_second": 4645.371 }, { "epoch": 1.8890306122448979, "grad_norm": 0.6594008814729282, "learning_rate": 7.594190750834617e-08, "loss": 0.24910693168640136, "num_input_tokens_seen": 899011592, "step": 14810, "train_runtime": 193538.5333, "train_tokens_per_second": 4645.13 }, { "epoch": 1.8896683673469388, "grad_norm": 0.6314110620163867, "learning_rate": 7.507469900129016e-08, "loss": 0.25336446762084963, "num_input_tokens_seen": 899318184, "step": 14815, "train_runtime": 193593.9739, "train_tokens_per_second": 4645.383 }, { "epoch": 1.8903061224489797, "grad_norm": 0.6638875288172695, "learning_rate": 7.421243300072989e-08, "loss": 0.23741183280944825, "num_input_tokens_seen": 899618656, "step": 14820, "train_runtime": 193650.562, "train_tokens_per_second": 4645.577 }, { "epoch": 1.8909438775510203, "grad_norm": 0.6194066197151755, "learning_rate": 7.335511037200982e-08, "loss": 0.2510697841644287, "num_input_tokens_seen": 899924056, "step": 14825, "train_runtime": 193703.02, "train_tokens_per_second": 4645.896 }, { "epoch": 1.8915816326530612, "grad_norm": 0.6089635763799623, "learning_rate": 7.250273197551227e-08, "loss": 0.23379080295562743, "num_input_tokens_seen": 900226328, "step": 14830, "train_runtime": 193777.3724, "train_tokens_per_second": 4645.673 }, { "epoch": 1.8922193877551021, "grad_norm": 0.7337019039784103, "learning_rate": 7.165529866665855e-08, "loss": 0.23528714179992677, "num_input_tokens_seen": 900513536, "step": 14835, "train_runtime": 193837.193, "train_tokens_per_second": 4645.721 }, { "epoch": 1.8928571428571428, "grad_norm": 0.6454351181533083, "learning_rate": 7.081281129590777e-08, "loss": 0.2547890663146973, "num_input_tokens_seen": 900821760, "step": 14840, "train_runtime": 193909.6783, "train_tokens_per_second": 4645.574 }, { "epoch": 1.8934948979591837, "grad_norm": 0.7226144777369936, "learning_rate": 6.99752707087542e-08, "loss": 0.26011736392974855, "num_input_tokens_seen": 901126832, "step": 14845, "train_runtime": 193972.6126, "train_tokens_per_second": 4645.64 }, { "epoch": 1.8941326530612246, "grad_norm": 0.5872104501936667, "learning_rate": 6.91426777457288e-08, "loss": 0.25217404365539553, "num_input_tokens_seen": 901424120, "step": 14850, "train_runtime": 194044.4187, "train_tokens_per_second": 4645.452 }, { "epoch": 1.8947704081632653, "grad_norm": 0.7711445799170084, "learning_rate": 6.831503324239707e-08, "loss": 0.24703493118286132, "num_input_tokens_seen": 901724328, "step": 14855, "train_runtime": 194110.0007, "train_tokens_per_second": 4645.43 }, { "epoch": 1.8954081632653061, "grad_norm": 0.7023465986124341, "learning_rate": 6.749233802935684e-08, "loss": 0.2439436674118042, "num_input_tokens_seen": 902025920, "step": 14860, "train_runtime": 194169.7617, "train_tokens_per_second": 4645.553 }, { "epoch": 1.896045918367347, "grad_norm": 0.6630922976778474, "learning_rate": 6.667459293224155e-08, "loss": 0.2603579044342041, "num_input_tokens_seen": 902344136, "step": 14865, "train_runtime": 194218.4433, "train_tokens_per_second": 4646.027 }, { "epoch": 1.8966836734693877, "grad_norm": 0.673900051723132, "learning_rate": 6.586179877171473e-08, "loss": 0.24415109157562256, "num_input_tokens_seen": 902653128, "step": 14870, "train_runtime": 194274.2905, "train_tokens_per_second": 4646.282 }, { "epoch": 1.8973214285714286, "grad_norm": 0.6509213291700938, "learning_rate": 6.505395636347222e-08, "loss": 0.24298529624938964, "num_input_tokens_seen": 902969696, "step": 14875, "train_runtime": 194339.7776, "train_tokens_per_second": 4646.345 }, { "epoch": 1.8979591836734695, "grad_norm": 0.5752364867057913, "learning_rate": 6.425106651824054e-08, "loss": 0.24060254096984862, "num_input_tokens_seen": 903275896, "step": 14880, "train_runtime": 194400.783, "train_tokens_per_second": 4646.462 }, { "epoch": 1.8985969387755102, "grad_norm": 0.6258477215576815, "learning_rate": 6.345313004177511e-08, "loss": 0.23076014518737792, "num_input_tokens_seen": 903589936, "step": 14885, "train_runtime": 194467.4704, "train_tokens_per_second": 4646.484 }, { "epoch": 1.899234693877551, "grad_norm": 0.5958702299030119, "learning_rate": 6.266014773486207e-08, "loss": 0.23166513442993164, "num_input_tokens_seen": 903899464, "step": 14890, "train_runtime": 194532.9383, "train_tokens_per_second": 4646.511 }, { "epoch": 1.899872448979592, "grad_norm": 0.6304073581468033, "learning_rate": 6.187212039331314e-08, "loss": 0.24292712211608886, "num_input_tokens_seen": 904199632, "step": 14895, "train_runtime": 194597.5108, "train_tokens_per_second": 4646.512 }, { "epoch": 1.9005102040816326, "grad_norm": 0.6838106741225728, "learning_rate": 6.108904880797017e-08, "loss": 0.24226779937744142, "num_input_tokens_seen": 904499744, "step": 14900, "train_runtime": 194667.7083, "train_tokens_per_second": 4646.378 }, { "epoch": 1.9011479591836735, "grad_norm": 0.679098533124189, "learning_rate": 6.031093376469899e-08, "loss": 0.2677560091018677, "num_input_tokens_seen": 904810904, "step": 14905, "train_runtime": 194734.9704, "train_tokens_per_second": 4646.371 }, { "epoch": 1.9017857142857144, "grad_norm": 0.7047378809168635, "learning_rate": 5.9537776044393256e-08, "loss": 0.2479987621307373, "num_input_tokens_seen": 905119168, "step": 14910, "train_runtime": 194803.6285, "train_tokens_per_second": 4646.316 }, { "epoch": 1.902423469387755, "grad_norm": 0.5684364054960253, "learning_rate": 5.87695764229701e-08, "loss": 0.23430242538452148, "num_input_tokens_seen": 905425624, "step": 14915, "train_runtime": 194872.5299, "train_tokens_per_second": 4646.246 }, { "epoch": 1.9030612244897958, "grad_norm": 0.7559823323485224, "learning_rate": 5.80063356713717e-08, "loss": 0.26269304752349854, "num_input_tokens_seen": 905726560, "step": 14920, "train_runtime": 194930.7129, "train_tokens_per_second": 4646.403 }, { "epoch": 1.9036989795918369, "grad_norm": 0.6822043816304155, "learning_rate": 5.7248054555563704e-08, "loss": 0.2633235931396484, "num_input_tokens_seen": 906035824, "step": 14925, "train_runtime": 194986.1528, "train_tokens_per_second": 4646.668 }, { "epoch": 1.9043367346938775, "grad_norm": 0.6632641780306863, "learning_rate": 5.6494733836534035e-08, "loss": 0.24860916137695313, "num_input_tokens_seen": 906346096, "step": 14930, "train_runtime": 195049.3716, "train_tokens_per_second": 4646.752 }, { "epoch": 1.9049744897959182, "grad_norm": 0.6258973686369059, "learning_rate": 5.574637427029239e-08, "loss": 0.24390010833740233, "num_input_tokens_seen": 906648504, "step": 14935, "train_runtime": 195112.3756, "train_tokens_per_second": 4646.802 }, { "epoch": 1.9056122448979593, "grad_norm": 0.760002254228921, "learning_rate": 5.50029766078708e-08, "loss": 0.26183409690856935, "num_input_tokens_seen": 906951760, "step": 14940, "train_runtime": 195181.55, "train_tokens_per_second": 4646.708 }, { "epoch": 1.90625, "grad_norm": 0.6095984450226043, "learning_rate": 5.426454159531913e-08, "loss": 0.25227718353271483, "num_input_tokens_seen": 907262016, "step": 14945, "train_runtime": 195251.5453, "train_tokens_per_second": 4646.632 }, { "epoch": 1.9068877551020407, "grad_norm": 0.5567129695809843, "learning_rate": 5.3531069973709607e-08, "loss": 0.2548694610595703, "num_input_tokens_seen": 907561240, "step": 14950, "train_runtime": 195320.9545, "train_tokens_per_second": 4646.512 }, { "epoch": 1.9075255102040818, "grad_norm": 0.6926951020902639, "learning_rate": 5.280256247913229e-08, "loss": 0.26091346740722654, "num_input_tokens_seen": 907859912, "step": 14955, "train_runtime": 195392.9353, "train_tokens_per_second": 4646.329 }, { "epoch": 1.9081632653061225, "grad_norm": 0.6581359098639753, "learning_rate": 5.207901984269459e-08, "loss": 0.24626507759094238, "num_input_tokens_seen": 908156416, "step": 14960, "train_runtime": 195455.9186, "train_tokens_per_second": 4646.349 }, { "epoch": 1.9088010204081631, "grad_norm": 0.6771379588752399, "learning_rate": 5.136044279052288e-08, "loss": 0.260360860824585, "num_input_tokens_seen": 908460312, "step": 14965, "train_runtime": 195526.4192, "train_tokens_per_second": 4646.228 }, { "epoch": 1.9094387755102042, "grad_norm": 0.6564757017128225, "learning_rate": 5.0646832043758645e-08, "loss": 0.23393001556396484, "num_input_tokens_seen": 908759856, "step": 14970, "train_runtime": 195581.843, "train_tokens_per_second": 4646.443 }, { "epoch": 1.910076530612245, "grad_norm": 0.6505722919038079, "learning_rate": 4.993818831856123e-08, "loss": 0.25123028755187987, "num_input_tokens_seen": 909059128, "step": 14975, "train_runtime": 195651.7876, "train_tokens_per_second": 4646.311 }, { "epoch": 1.9107142857142856, "grad_norm": 0.6862658423869104, "learning_rate": 4.923451232610288e-08, "loss": 0.2689199686050415, "num_input_tokens_seen": 909368704, "step": 14980, "train_runtime": 195709.3519, "train_tokens_per_second": 4646.527 }, { "epoch": 1.9113520408163265, "grad_norm": 0.6118149479886968, "learning_rate": 4.8535804772572024e-08, "loss": 0.24207632541656493, "num_input_tokens_seen": 909668768, "step": 14985, "train_runtime": 195771.7263, "train_tokens_per_second": 4646.579 }, { "epoch": 1.9119897959183674, "grad_norm": 0.7068122232336729, "learning_rate": 4.7842066359170544e-08, "loss": 0.26170997619628905, "num_input_tokens_seen": 909982280, "step": 14990, "train_runtime": 195831.4708, "train_tokens_per_second": 4646.762 }, { "epoch": 1.912627551020408, "grad_norm": 0.6311868431963777, "learning_rate": 4.715329778211375e-08, "loss": 0.24396302700042724, "num_input_tokens_seen": 910291280, "step": 14995, "train_runtime": 195892.0501, "train_tokens_per_second": 4646.903 }, { "epoch": 1.913265306122449, "grad_norm": 0.6618045098131926, "learning_rate": 4.646949973262871e-08, "loss": 0.241226863861084, "num_input_tokens_seen": 910597016, "step": 15000, "train_runtime": 195954.5226, "train_tokens_per_second": 4646.981 }, { "epoch": 1.9139030612244898, "grad_norm": 0.6936883965561665, "learning_rate": 4.579067289695427e-08, "loss": 0.25010688304901124, "num_input_tokens_seen": 910889416, "step": 15005, "train_runtime": 196020.2285, "train_tokens_per_second": 4646.915 }, { "epoch": 1.9145408163265305, "grad_norm": 0.7035237706792213, "learning_rate": 4.511681795634049e-08, "loss": 0.24684762954711914, "num_input_tokens_seen": 911194392, "step": 15010, "train_runtime": 196090.9804, "train_tokens_per_second": 4646.794 }, { "epoch": 1.9151785714285714, "grad_norm": 0.6322354753921676, "learning_rate": 4.4447935587049185e-08, "loss": 0.24867401123046876, "num_input_tokens_seen": 911506240, "step": 15015, "train_runtime": 196159.3016, "train_tokens_per_second": 4646.765 }, { "epoch": 1.9158163265306123, "grad_norm": 0.6199826293536299, "learning_rate": 4.37840264603484e-08, "loss": 0.24369287490844727, "num_input_tokens_seen": 911812040, "step": 15020, "train_runtime": 196220.2107, "train_tokens_per_second": 4646.881 }, { "epoch": 1.916454081632653, "grad_norm": 0.6283653539917077, "learning_rate": 4.312509124251907e-08, "loss": 0.26245894432067873, "num_input_tokens_seen": 912118696, "step": 15025, "train_runtime": 196285.1403, "train_tokens_per_second": 4646.907 }, { "epoch": 1.9170918367346939, "grad_norm": 0.6365747752856089, "learning_rate": 4.247113059484775e-08, "loss": 0.24296834468841552, "num_input_tokens_seen": 912411904, "step": 15030, "train_runtime": 196359.8021, "train_tokens_per_second": 4646.633 }, { "epoch": 1.9177295918367347, "grad_norm": 0.6921456195408252, "learning_rate": 4.1822145173630033e-08, "loss": 0.23697316646575928, "num_input_tokens_seen": 912720144, "step": 15035, "train_runtime": 196425.7606, "train_tokens_per_second": 4646.642 }, { "epoch": 1.9183673469387754, "grad_norm": 0.6103621580852481, "learning_rate": 4.117813563016826e-08, "loss": 0.24823360443115233, "num_input_tokens_seen": 913034744, "step": 15040, "train_runtime": 196481.0788, "train_tokens_per_second": 4646.935 }, { "epoch": 1.9190051020408163, "grad_norm": 0.6223000336676402, "learning_rate": 4.0539102610770434e-08, "loss": 0.2661388397216797, "num_input_tokens_seen": 913344128, "step": 15045, "train_runtime": 196537.9916, "train_tokens_per_second": 4647.163 }, { "epoch": 1.9196428571428572, "grad_norm": 0.6176804790718705, "learning_rate": 3.990504675675133e-08, "loss": 0.24283137321472167, "num_input_tokens_seen": 913656280, "step": 15050, "train_runtime": 196599.1813, "train_tokens_per_second": 4647.305 }, { "epoch": 1.9202806122448979, "grad_norm": 0.692932533981291, "learning_rate": 3.927596870442973e-08, "loss": 0.2644121885299683, "num_input_tokens_seen": 913958416, "step": 15055, "train_runtime": 196655.93, "train_tokens_per_second": 4647.5 }, { "epoch": 1.9209183673469388, "grad_norm": 0.7009069930702748, "learning_rate": 3.8651869085130076e-08, "loss": 0.24419598579406737, "num_input_tokens_seen": 914260256, "step": 15060, "train_runtime": 196729.9289, "train_tokens_per_second": 4647.286 }, { "epoch": 1.9215561224489797, "grad_norm": 0.6427188050500241, "learning_rate": 3.8032748525179684e-08, "loss": 0.23569097518920898, "num_input_tokens_seen": 914553184, "step": 15065, "train_runtime": 196806.1105, "train_tokens_per_second": 4646.976 }, { "epoch": 1.9221938775510203, "grad_norm": 0.6405735410167481, "learning_rate": 3.741860764590877e-08, "loss": 0.24265587329864502, "num_input_tokens_seen": 914855288, "step": 15070, "train_runtime": 196880.4543, "train_tokens_per_second": 4646.755 }, { "epoch": 1.9228316326530612, "grad_norm": 0.6170910879559761, "learning_rate": 3.680944706365097e-08, "loss": 0.25319323539733884, "num_input_tokens_seen": 915159176, "step": 15075, "train_runtime": 196951.652, "train_tokens_per_second": 4646.618 }, { "epoch": 1.9234693877551021, "grad_norm": 0.6047867279145934, "learning_rate": 3.6205267389741724e-08, "loss": 0.23566744327545167, "num_input_tokens_seen": 915473424, "step": 15080, "train_runtime": 197013.4256, "train_tokens_per_second": 4646.757 }, { "epoch": 1.9241071428571428, "grad_norm": 0.643163464215507, "learning_rate": 3.560606923051768e-08, "loss": 0.23976473808288573, "num_input_tokens_seen": 915764344, "step": 15085, "train_runtime": 197083.9997, "train_tokens_per_second": 4646.569 }, { "epoch": 1.9247448979591837, "grad_norm": 0.6942785035430976, "learning_rate": 3.5011853187315035e-08, "loss": 0.23405833244323732, "num_input_tokens_seen": 916061512, "step": 15090, "train_runtime": 197148.4158, "train_tokens_per_second": 4646.558 }, { "epoch": 1.9253826530612246, "grad_norm": 0.6309596070222945, "learning_rate": 3.442261985647177e-08, "loss": 0.25694937705993653, "num_input_tokens_seen": 916381160, "step": 15095, "train_runtime": 197225.9566, "train_tokens_per_second": 4646.352 }, { "epoch": 1.9260204081632653, "grad_norm": 0.6690711283204608, "learning_rate": 3.383836982932542e-08, "loss": 0.2462223768234253, "num_input_tokens_seen": 916678328, "step": 15100, "train_runtime": 197291.473, "train_tokens_per_second": 4646.315 }, { "epoch": 1.9266581632653061, "grad_norm": 0.6414088969806848, "learning_rate": 3.325910369220975e-08, "loss": 0.25452375411987305, "num_input_tokens_seen": 916992400, "step": 15105, "train_runtime": 197346.9904, "train_tokens_per_second": 4646.599 }, { "epoch": 1.927295918367347, "grad_norm": 0.6832228334139179, "learning_rate": 3.268482202646084e-08, "loss": 0.2523342609405518, "num_input_tokens_seen": 917292000, "step": 15110, "train_runtime": 197411.991, "train_tokens_per_second": 4646.587 }, { "epoch": 1.9279336734693877, "grad_norm": 0.6914368072719113, "learning_rate": 3.211552540840934e-08, "loss": 0.26769270896911623, "num_input_tokens_seen": 917597016, "step": 15115, "train_runtime": 197482.0316, "train_tokens_per_second": 4646.484 }, { "epoch": 1.9285714285714286, "grad_norm": 0.7639182198577933, "learning_rate": 3.1551214409384355e-08, "loss": 0.23019323348999024, "num_input_tokens_seen": 917908152, "step": 15120, "train_runtime": 197558.7458, "train_tokens_per_second": 4646.254 }, { "epoch": 1.9292091836734695, "grad_norm": 0.661951476734585, "learning_rate": 3.09918895957112e-08, "loss": 0.2444523811340332, "num_input_tokens_seen": 918217408, "step": 15125, "train_runtime": 197626.8518, "train_tokens_per_second": 4646.218 }, { "epoch": 1.9298469387755102, "grad_norm": 0.7461359982111557, "learning_rate": 3.0437551528711974e-08, "loss": 0.2376544237136841, "num_input_tokens_seen": 918506528, "step": 15130, "train_runtime": 197693.0533, "train_tokens_per_second": 4646.124 }, { "epoch": 1.930484693877551, "grad_norm": 0.59542529064351, "learning_rate": 2.988820076470278e-08, "loss": 0.25788092613220215, "num_input_tokens_seen": 918805920, "step": 15135, "train_runtime": 197765.548, "train_tokens_per_second": 4645.935 }, { "epoch": 1.931122448979592, "grad_norm": 0.5968634469164296, "learning_rate": 2.934383785499595e-08, "loss": 0.23025188446044922, "num_input_tokens_seen": 919113720, "step": 15140, "train_runtime": 197818.2006, "train_tokens_per_second": 4646.255 }, { "epoch": 1.9317602040816326, "grad_norm": 0.7298214145553429, "learning_rate": 2.880446334589837e-08, "loss": 0.2734971046447754, "num_input_tokens_seen": 919419376, "step": 15145, "train_runtime": 197882.1511, "train_tokens_per_second": 4646.298 }, { "epoch": 1.9323979591836735, "grad_norm": 0.7018643224048751, "learning_rate": 2.8270077778708714e-08, "loss": 0.25088844299316404, "num_input_tokens_seen": 919729912, "step": 15150, "train_runtime": 197941.2509, "train_tokens_per_second": 4646.479 }, { "epoch": 1.9330357142857144, "grad_norm": 0.6706079135994369, "learning_rate": 2.7740681689721327e-08, "loss": 0.2477257490158081, "num_input_tokens_seen": 920027720, "step": 15155, "train_runtime": 198007.7054, "train_tokens_per_second": 4646.424 }, { "epoch": 1.933673469387755, "grad_norm": 0.6630686337450358, "learning_rate": 2.721627561022122e-08, "loss": 0.25936317443847656, "num_input_tokens_seen": 920323064, "step": 15160, "train_runtime": 198071.6653, "train_tokens_per_second": 4646.415 }, { "epoch": 1.9343112244897958, "grad_norm": 0.6035022817342884, "learning_rate": 2.6696860066487417e-08, "loss": 0.2339953899383545, "num_input_tokens_seen": 920627616, "step": 15165, "train_runtime": 198144.17, "train_tokens_per_second": 4646.251 }, { "epoch": 1.9349489795918369, "grad_norm": 0.7183830825847068, "learning_rate": 2.6182435579789055e-08, "loss": 0.2542128562927246, "num_input_tokens_seen": 920923736, "step": 15170, "train_runtime": 198208.6669, "train_tokens_per_second": 4646.233 }, { "epoch": 1.9355867346938775, "grad_norm": 0.6806673000923349, "learning_rate": 2.567300266638706e-08, "loss": 0.27027325630187987, "num_input_tokens_seen": 921217520, "step": 15175, "train_runtime": 198280.9546, "train_tokens_per_second": 4646.021 }, { "epoch": 1.9362244897959182, "grad_norm": 0.7614629532461339, "learning_rate": 2.516856183753358e-08, "loss": 0.2549232006072998, "num_input_tokens_seen": 921505632, "step": 15180, "train_runtime": 198341.0521, "train_tokens_per_second": 4646.066 }, { "epoch": 1.9368622448979593, "grad_norm": 0.7897218362116912, "learning_rate": 2.4669113599469774e-08, "loss": 0.24539024829864503, "num_input_tokens_seen": 921818320, "step": 15185, "train_runtime": 198407.6694, "train_tokens_per_second": 4646.082 }, { "epoch": 1.9375, "grad_norm": 0.6273112141121303, "learning_rate": 2.4174658453426368e-08, "loss": 0.24641995429992675, "num_input_tokens_seen": 922118720, "step": 15190, "train_runtime": 198475.3425, "train_tokens_per_second": 4646.011 }, { "epoch": 1.9381377551020407, "grad_norm": 0.800921008943011, "learning_rate": 2.3685196895624206e-08, "loss": 0.2644636631011963, "num_input_tokens_seen": 922420232, "step": 15195, "train_runtime": 198535.7621, "train_tokens_per_second": 4646.116 }, { "epoch": 1.9387755102040818, "grad_norm": 0.6749239767271911, "learning_rate": 2.3200729417272028e-08, "loss": 0.2815537452697754, "num_input_tokens_seen": 922733976, "step": 15200, "train_runtime": 198598.6298, "train_tokens_per_second": 4646.225 }, { "epoch": 1.9394132653061225, "grad_norm": 0.6502870759297176, "learning_rate": 2.2721256504567026e-08, "loss": 0.24536752700805664, "num_input_tokens_seen": 923030704, "step": 15205, "train_runtime": 198676.0273, "train_tokens_per_second": 4645.909 }, { "epoch": 1.9400510204081631, "grad_norm": 0.6721506499078248, "learning_rate": 2.2246778638692623e-08, "loss": 0.241164493560791, "num_input_tokens_seen": 923335856, "step": 15210, "train_runtime": 198752.0539, "train_tokens_per_second": 4645.667 }, { "epoch": 1.9406887755102042, "grad_norm": 0.601116855162163, "learning_rate": 2.177729629582237e-08, "loss": 0.26407551765441895, "num_input_tokens_seen": 923639016, "step": 15215, "train_runtime": 198811.5165, "train_tokens_per_second": 4645.802 }, { "epoch": 1.941326530612245, "grad_norm": 0.5823190210070482, "learning_rate": 2.1312809947113267e-08, "loss": 0.22718312740325927, "num_input_tokens_seen": 923939616, "step": 15220, "train_runtime": 198878.8625, "train_tokens_per_second": 4645.741 }, { "epoch": 1.9419642857142856, "grad_norm": 0.6932532957430269, "learning_rate": 2.0853320058710214e-08, "loss": 0.23678016662597656, "num_input_tokens_seen": 924234088, "step": 15225, "train_runtime": 198943.0174, "train_tokens_per_second": 4645.723 }, { "epoch": 1.9426020408163265, "grad_norm": 0.6411570772643133, "learning_rate": 2.0398827091743234e-08, "loss": 0.27280292510986326, "num_input_tokens_seen": 924543768, "step": 15230, "train_runtime": 199016.607, "train_tokens_per_second": 4645.561 }, { "epoch": 1.9432397959183674, "grad_norm": 0.6094249346498507, "learning_rate": 1.9949331502327475e-08, "loss": 0.23533403873443604, "num_input_tokens_seen": 924832536, "step": 15235, "train_runtime": 199087.1224, "train_tokens_per_second": 4645.366 }, { "epoch": 1.943877551020408, "grad_norm": 0.6801283977984018, "learning_rate": 1.950483374156431e-08, "loss": 0.26111152172088625, "num_input_tokens_seen": 925138328, "step": 15240, "train_runtime": 199153.887, "train_tokens_per_second": 4645.344 }, { "epoch": 1.944515306122449, "grad_norm": 0.6425962753034345, "learning_rate": 1.9065334255536916e-08, "loss": 0.25782184600830077, "num_input_tokens_seen": 925447200, "step": 15245, "train_runtime": 199225.8819, "train_tokens_per_second": 4645.216 }, { "epoch": 1.9451530612244898, "grad_norm": 0.6434454146016215, "learning_rate": 1.8630833485314693e-08, "loss": 0.24272508621215821, "num_input_tokens_seen": 925753016, "step": 15250, "train_runtime": 199302.7033, "train_tokens_per_second": 4644.96 }, { "epoch": 1.9457908163265305, "grad_norm": 0.6971730916606771, "learning_rate": 1.8201331866948834e-08, "loss": 0.25693254470825194, "num_input_tokens_seen": 926056384, "step": 15255, "train_runtime": 199373.5173, "train_tokens_per_second": 4644.831 }, { "epoch": 1.9464285714285714, "grad_norm": 0.6431297755968343, "learning_rate": 1.7776829831474553e-08, "loss": 0.2646693229675293, "num_input_tokens_seen": 926363824, "step": 15260, "train_runtime": 199440.0629, "train_tokens_per_second": 4644.823 }, { "epoch": 1.9470663265306123, "grad_norm": 0.6666066906242785, "learning_rate": 1.735732780490884e-08, "loss": 0.27986161708831786, "num_input_tokens_seen": 926674400, "step": 15265, "train_runtime": 199495.8617, "train_tokens_per_second": 4645.081 }, { "epoch": 1.947704081632653, "grad_norm": 0.6656222223883199, "learning_rate": 1.694282620825216e-08, "loss": 0.2596017122268677, "num_input_tokens_seen": 926972904, "step": 15270, "train_runtime": 199564.442, "train_tokens_per_second": 4644.98 }, { "epoch": 1.9483418367346939, "grad_norm": 0.6275419261464044, "learning_rate": 1.6533325457485093e-08, "loss": 0.25693569183349607, "num_input_tokens_seen": 927282680, "step": 15275, "train_runtime": 199629.5856, "train_tokens_per_second": 4645.016 }, { "epoch": 1.9489795918367347, "grad_norm": 0.733231245261694, "learning_rate": 1.612882596357057e-08, "loss": 0.2503585577011108, "num_input_tokens_seen": 927592416, "step": 15280, "train_runtime": 199700.9486, "train_tokens_per_second": 4644.907 }, { "epoch": 1.9496173469387754, "grad_norm": 0.6585430168053389, "learning_rate": 1.5729328132452203e-08, "loss": 0.24806904792785645, "num_input_tokens_seen": 927904256, "step": 15285, "train_runtime": 199764.2267, "train_tokens_per_second": 4644.997 }, { "epoch": 1.9502551020408163, "grad_norm": 0.6606777651635418, "learning_rate": 1.533483236505373e-08, "loss": 0.24865076541900635, "num_input_tokens_seen": 928217856, "step": 15290, "train_runtime": 199830.4145, "train_tokens_per_second": 4645.028 }, { "epoch": 1.9508928571428572, "grad_norm": 0.6117485454438667, "learning_rate": 1.494533905727902e-08, "loss": 0.26568968296051027, "num_input_tokens_seen": 928520184, "step": 15295, "train_runtime": 199898.8403, "train_tokens_per_second": 4644.95 }, { "epoch": 1.9515306122448979, "grad_norm": 0.7172290442315818, "learning_rate": 1.4560848600012056e-08, "loss": 0.24280576705932616, "num_input_tokens_seen": 928828280, "step": 15300, "train_runtime": 199960.7418, "train_tokens_per_second": 4645.053 }, { "epoch": 1.9521683673469388, "grad_norm": 0.5929442067738704, "learning_rate": 1.4181361379115854e-08, "loss": 0.25272064208984374, "num_input_tokens_seen": 929145448, "step": 15305, "train_runtime": 200030.8148, "train_tokens_per_second": 4645.012 }, { "epoch": 1.9528061224489797, "grad_norm": 0.6939548267696385, "learning_rate": 1.3806877775432436e-08, "loss": 0.24609718322753907, "num_input_tokens_seen": 929452648, "step": 15310, "train_runtime": 200084.4506, "train_tokens_per_second": 4645.302 }, { "epoch": 1.9534438775510203, "grad_norm": 0.7921844194217872, "learning_rate": 1.3437398164781734e-08, "loss": 0.24976670742034912, "num_input_tokens_seen": 929748480, "step": 15315, "train_runtime": 200149.5511, "train_tokens_per_second": 4645.269 }, { "epoch": 1.9540816326530612, "grad_norm": 0.6323729258574822, "learning_rate": 1.3072922917963249e-08, "loss": 0.24251127243041992, "num_input_tokens_seen": 930053288, "step": 15320, "train_runtime": 200213.486, "train_tokens_per_second": 4645.308 }, { "epoch": 1.9547193877551021, "grad_norm": 0.6906993758341127, "learning_rate": 1.2713452400752724e-08, "loss": 0.2625253677368164, "num_input_tokens_seen": 930369984, "step": 15325, "train_runtime": 200280.8044, "train_tokens_per_second": 4645.328 }, { "epoch": 1.9553571428571428, "grad_norm": 0.6574415884308985, "learning_rate": 1.2358986973903807e-08, "loss": 0.2642559051513672, "num_input_tokens_seen": 930684352, "step": 15330, "train_runtime": 200345.4531, "train_tokens_per_second": 4645.398 }, { "epoch": 1.9559948979591837, "grad_norm": 0.6779783906783353, "learning_rate": 1.2009526993147503e-08, "loss": 0.2565456390380859, "num_input_tokens_seen": 930994304, "step": 15335, "train_runtime": 200406.1223, "train_tokens_per_second": 4645.538 }, { "epoch": 1.9566326530612246, "grad_norm": 0.5707303816920276, "learning_rate": 1.1665072809191602e-08, "loss": 0.24982020854949952, "num_input_tokens_seen": 931306504, "step": 15340, "train_runtime": 200467.0895, "train_tokens_per_second": 4645.683 }, { "epoch": 1.9572704081632653, "grad_norm": 0.6364327412740145, "learning_rate": 1.132562476771959e-08, "loss": 0.25244736671447754, "num_input_tokens_seen": 931609672, "step": 15345, "train_runtime": 200521.3871, "train_tokens_per_second": 4645.937 }, { "epoch": 1.9579081632653061, "grad_norm": 0.6742588290680526, "learning_rate": 1.0991183209391188e-08, "loss": 0.24548232555389404, "num_input_tokens_seen": 931914232, "step": 15350, "train_runtime": 200590.7823, "train_tokens_per_second": 4645.848 }, { "epoch": 1.958545918367347, "grad_norm": 0.6639449792544483, "learning_rate": 1.0661748469842359e-08, "loss": 0.2334390640258789, "num_input_tokens_seen": 932218120, "step": 15355, "train_runtime": 200655.2846, "train_tokens_per_second": 4645.869 }, { "epoch": 1.9591836734693877, "grad_norm": 0.7667890659307897, "learning_rate": 1.0337320879683087e-08, "loss": 0.23780970573425292, "num_input_tokens_seen": 932530040, "step": 15360, "train_runtime": 200728.498, "train_tokens_per_second": 4645.728 }, { "epoch": 1.9598214285714286, "grad_norm": 1.3434161686822583, "learning_rate": 1.0017900764500155e-08, "loss": 0.255706787109375, "num_input_tokens_seen": 932840976, "step": 15365, "train_runtime": 200783.3764, "train_tokens_per_second": 4646.007 }, { "epoch": 1.9604591836734695, "grad_norm": 0.568162911645631, "learning_rate": 9.703488444853248e-09, "loss": 0.2541600942611694, "num_input_tokens_seen": 933147184, "step": 15370, "train_runtime": 200854.2584, "train_tokens_per_second": 4645.892 }, { "epoch": 1.9610969387755102, "grad_norm": 0.6462376565475885, "learning_rate": 9.39408423627719e-09, "loss": 0.24727683067321776, "num_input_tokens_seen": 933449616, "step": 15375, "train_runtime": 200912.2784, "train_tokens_per_second": 4646.056 }, { "epoch": 1.961734693877551, "grad_norm": 0.6670489638809874, "learning_rate": 9.089688449280265e-09, "loss": 0.2606107950210571, "num_input_tokens_seen": 933748368, "step": 15380, "train_runtime": 200986.7656, "train_tokens_per_second": 4645.82 }, { "epoch": 1.962372448979592, "grad_norm": 0.6731224891552309, "learning_rate": 8.79030138934589e-09, "loss": 0.25869710445404054, "num_input_tokens_seen": 934066280, "step": 15385, "train_runtime": 201032.061, "train_tokens_per_second": 4646.355 }, { "epoch": 1.9630102040816326, "grad_norm": 0.6351121907164077, "learning_rate": 8.49592335692928e-09, "loss": 0.23783254623413086, "num_input_tokens_seen": 934360528, "step": 15390, "train_runtime": 201092.7173, "train_tokens_per_second": 4646.417 }, { "epoch": 1.9636479591836735, "grad_norm": 0.682117467602623, "learning_rate": 8.206554647459675e-09, "loss": 0.22529397010803223, "num_input_tokens_seen": 934662128, "step": 15395, "train_runtime": 201167.2167, "train_tokens_per_second": 4646.195 }, { "epoch": 1.9642857142857144, "grad_norm": 0.6821335275257784, "learning_rate": 7.922195551338107e-09, "loss": 0.2720287084579468, "num_input_tokens_seen": 934954856, "step": 15400, "train_runtime": 201225.6993, "train_tokens_per_second": 4646.299 }, { "epoch": 1.964923469387755, "grad_norm": 0.662620995677526, "learning_rate": 7.642846353939637e-09, "loss": 0.2662359237670898, "num_input_tokens_seen": 935263264, "step": 15405, "train_runtime": 201304.3613, "train_tokens_per_second": 4646.016 }, { "epoch": 1.9655612244897958, "grad_norm": 0.6280068912895532, "learning_rate": 7.368507335610009e-09, "loss": 0.2379246711730957, "num_input_tokens_seen": 935557064, "step": 15410, "train_runtime": 201365.9686, "train_tokens_per_second": 4646.054 }, { "epoch": 1.9661989795918369, "grad_norm": 0.6099009764095411, "learning_rate": 7.099178771668436e-09, "loss": 0.24412119388580322, "num_input_tokens_seen": 935867560, "step": 15415, "train_runtime": 201429.8519, "train_tokens_per_second": 4646.121 }, { "epoch": 1.9668367346938775, "grad_norm": 0.6845277674559912, "learning_rate": 6.834860932403709e-09, "loss": 0.25436787605285643, "num_input_tokens_seen": 936164024, "step": 15420, "train_runtime": 201510.2903, "train_tokens_per_second": 4645.738 }, { "epoch": 1.9674744897959182, "grad_norm": 0.6636064340985193, "learning_rate": 6.575554083078084e-09, "loss": 0.2626820087432861, "num_input_tokens_seen": 936466568, "step": 15425, "train_runtime": 201582.2793, "train_tokens_per_second": 4645.58 }, { "epoch": 1.9681122448979593, "grad_norm": 0.7282240604628171, "learning_rate": 6.321258483924508e-09, "loss": 0.2702171802520752, "num_input_tokens_seen": 936768752, "step": 15430, "train_runtime": 201645.1336, "train_tokens_per_second": 4645.63 }, { "epoch": 1.96875, "grad_norm": 0.683843369114111, "learning_rate": 6.071974390144953e-09, "loss": 0.23894684314727782, "num_input_tokens_seen": 937071272, "step": 15435, "train_runtime": 201706.7922, "train_tokens_per_second": 4645.71 }, { "epoch": 1.9693877551020407, "grad_norm": 0.7116665504616505, "learning_rate": 5.827702051914852e-09, "loss": 0.25569274425506594, "num_input_tokens_seen": 937374224, "step": 15440, "train_runtime": 201782.1183, "train_tokens_per_second": 4645.477 }, { "epoch": 1.9700255102040818, "grad_norm": 0.7290339208563372, "learning_rate": 5.5884417143775574e-09, "loss": 0.2737967252731323, "num_input_tokens_seen": 937680296, "step": 15445, "train_runtime": 201837.285, "train_tokens_per_second": 4645.724 }, { "epoch": 1.9706632653061225, "grad_norm": 0.719496216823003, "learning_rate": 5.354193617648218e-09, "loss": 0.25485644340515134, "num_input_tokens_seen": 937965664, "step": 15450, "train_runtime": 201906.2543, "train_tokens_per_second": 4645.55 }, { "epoch": 1.9713010204081631, "grad_norm": 0.6817270705455376, "learning_rate": 5.124957996811009e-09, "loss": 0.2593040466308594, "num_input_tokens_seen": 938265008, "step": 15455, "train_runtime": 201970.522, "train_tokens_per_second": 4645.554 }, { "epoch": 1.9719387755102042, "grad_norm": 0.6383414887725855, "learning_rate": 4.900735081919128e-09, "loss": 0.23735318183898926, "num_input_tokens_seen": 938569376, "step": 15460, "train_runtime": 202033.0734, "train_tokens_per_second": 4645.622 }, { "epoch": 1.972576530612245, "grad_norm": 0.6458138943082795, "learning_rate": 4.6815250979970195e-09, "loss": 0.25776076316833496, "num_input_tokens_seen": 938878464, "step": 15465, "train_runtime": 202094.6504, "train_tokens_per_second": 4645.736 }, { "epoch": 1.9732142857142856, "grad_norm": 0.637196312980925, "learning_rate": 4.467328265037041e-09, "loss": 0.25017719268798827, "num_input_tokens_seen": 939168384, "step": 15470, "train_runtime": 202158.0587, "train_tokens_per_second": 4645.713 }, { "epoch": 1.9738520408163265, "grad_norm": 0.5942506586339228, "learning_rate": 4.258144798000019e-09, "loss": 0.2674983501434326, "num_input_tokens_seen": 939479720, "step": 15475, "train_runtime": 202228.6521, "train_tokens_per_second": 4645.631 }, { "epoch": 1.9744897959183674, "grad_norm": 0.6741715420082401, "learning_rate": 4.05397490681636e-09, "loss": 0.2481661319732666, "num_input_tokens_seen": 939776816, "step": 15480, "train_runtime": 202298.5971, "train_tokens_per_second": 4645.493 }, { "epoch": 1.975127551020408, "grad_norm": 0.7177061038203771, "learning_rate": 3.854818796385495e-09, "loss": 0.26866137981414795, "num_input_tokens_seen": 940072480, "step": 15485, "train_runtime": 202360.2348, "train_tokens_per_second": 4645.54 }, { "epoch": 1.975765306122449, "grad_norm": 0.6509472749608338, "learning_rate": 3.660676666573659e-09, "loss": 0.24293665885925292, "num_input_tokens_seen": 940372488, "step": 15490, "train_runtime": 202424.866, "train_tokens_per_second": 4645.538 }, { "epoch": 1.9764030612244898, "grad_norm": 0.6646487596865714, "learning_rate": 3.4715487122161107e-09, "loss": 0.2463254451751709, "num_input_tokens_seen": 940678120, "step": 15495, "train_runtime": 202490.7442, "train_tokens_per_second": 4645.536 }, { "epoch": 1.9770408163265305, "grad_norm": 0.6649270996945488, "learning_rate": 3.287435123116578e-09, "loss": 0.258991003036499, "num_input_tokens_seen": 940991336, "step": 15500, "train_runtime": 202554.0482, "train_tokens_per_second": 4645.631 }, { "epoch": 1.9776785714285714, "grad_norm": 0.687046950087734, "learning_rate": 3.1083360840455935e-09, "loss": 0.24148159027099608, "num_input_tokens_seen": 941285288, "step": 15505, "train_runtime": 202617.521, "train_tokens_per_second": 4645.626 }, { "epoch": 1.9783163265306123, "grad_norm": 0.7612710304971785, "learning_rate": 2.9342517747410482e-09, "loss": 0.25423603057861327, "num_input_tokens_seen": 941603816, "step": 15510, "train_runtime": 202668.4043, "train_tokens_per_second": 4646.032 }, { "epoch": 1.978954081632653, "grad_norm": 0.6790729073095124, "learning_rate": 2.7651823699093027e-09, "loss": 0.24060502052307128, "num_input_tokens_seen": 941927344, "step": 15515, "train_runtime": 202721.8213, "train_tokens_per_second": 4646.403 }, { "epoch": 1.9795918367346939, "grad_norm": 0.7419740535259216, "learning_rate": 2.6011280392235215e-09, "loss": 0.25852391719818113, "num_input_tokens_seen": 942228704, "step": 15520, "train_runtime": 202789.095, "train_tokens_per_second": 4646.348 }, { "epoch": 1.9802295918367347, "grad_norm": 0.6641922208558795, "learning_rate": 2.442088947323118e-09, "loss": 0.2551721572875977, "num_input_tokens_seen": 942534256, "step": 15525, "train_runtime": 202861.7971, "train_tokens_per_second": 4646.189 }, { "epoch": 1.9808673469387754, "grad_norm": 0.6034823957794491, "learning_rate": 2.288065253814864e-09, "loss": 0.2408912420272827, "num_input_tokens_seen": 942822104, "step": 15530, "train_runtime": 202925.0236, "train_tokens_per_second": 4646.16 }, { "epoch": 1.9815051020408163, "grad_norm": 0.6185290463513637, "learning_rate": 2.139057113272891e-09, "loss": 0.249487042427063, "num_input_tokens_seen": 943125064, "step": 15535, "train_runtime": 202986.8056, "train_tokens_per_second": 4646.238 }, { "epoch": 1.9821428571428572, "grad_norm": 0.700980111156108, "learning_rate": 1.995064675237024e-09, "loss": 0.24320669174194337, "num_input_tokens_seen": 943414656, "step": 15540, "train_runtime": 203052.9781, "train_tokens_per_second": 4646.15 }, { "epoch": 1.9827806122448979, "grad_norm": 0.6680659977178877, "learning_rate": 1.8560880842133366e-09, "loss": 0.2668965578079224, "num_input_tokens_seen": 943715632, "step": 15545, "train_runtime": 203109.5051, "train_tokens_per_second": 4646.339 }, { "epoch": 1.9834183673469388, "grad_norm": 0.6832056937466896, "learning_rate": 1.7221274796752618e-09, "loss": 0.2613052845001221, "num_input_tokens_seen": 944022192, "step": 15550, "train_runtime": 203180.7187, "train_tokens_per_second": 4646.219 }, { "epoch": 1.9840561224489797, "grad_norm": 0.6653955276996287, "learning_rate": 1.5931829960608158e-09, "loss": 0.266310453414917, "num_input_tokens_seen": 944328320, "step": 15555, "train_runtime": 203251.005, "train_tokens_per_second": 4646.119 }, { "epoch": 1.9846938775510203, "grad_norm": 0.6843844432253159, "learning_rate": 1.469254762775374e-09, "loss": 0.2567771911621094, "num_input_tokens_seen": 944620232, "step": 15560, "train_runtime": 203308.201, "train_tokens_per_second": 4646.248 }, { "epoch": 1.9853316326530612, "grad_norm": 0.6452788820576626, "learning_rate": 1.350342904188895e-09, "loss": 0.25018773078918455, "num_input_tokens_seen": 944927232, "step": 15565, "train_runtime": 203351.7131, "train_tokens_per_second": 4646.763 }, { "epoch": 1.9859693877551021, "grad_norm": 0.6391438789234974, "learning_rate": 1.2364475396386966e-09, "loss": 0.25844545364379884, "num_input_tokens_seen": 945234328, "step": 15570, "train_runtime": 203419.2949, "train_tokens_per_second": 4646.729 }, { "epoch": 1.9866071428571428, "grad_norm": 0.6599275936883742, "learning_rate": 1.1275687834266803e-09, "loss": 0.24469830989837646, "num_input_tokens_seen": 945532880, "step": 15575, "train_runtime": 203488.83, "train_tokens_per_second": 4646.608 }, { "epoch": 1.9872448979591837, "grad_norm": 0.6697241520164385, "learning_rate": 1.0237067448193306e-09, "loss": 0.24163453578948973, "num_input_tokens_seen": 945847360, "step": 15580, "train_runtime": 203561.7077, "train_tokens_per_second": 4646.49 }, { "epoch": 1.9878826530612246, "grad_norm": 0.6638025854331141, "learning_rate": 9.248615280499362e-10, "loss": 0.24226274490356445, "num_input_tokens_seen": 946141912, "step": 15585, "train_runtime": 203617.9354, "train_tokens_per_second": 4646.653 }, { "epoch": 1.9885204081632653, "grad_norm": 0.7521110076166722, "learning_rate": 8.310332323169246e-10, "loss": 0.2418217182159424, "num_input_tokens_seen": 946445056, "step": 15590, "train_runtime": 203690.9792, "train_tokens_per_second": 4646.475 }, { "epoch": 1.9891581632653061, "grad_norm": 0.7037770439883531, "learning_rate": 7.422219517833062e-10, "loss": 0.25137481689453123, "num_input_tokens_seen": 946746768, "step": 15595, "train_runtime": 203761.1565, "train_tokens_per_second": 4646.355 }, { "epoch": 1.989795918367347, "grad_norm": 0.647441479828051, "learning_rate": 6.584277755772306e-10, "loss": 0.24022195339202881, "num_input_tokens_seen": 947033408, "step": 15600, "train_runtime": 203821.8061, "train_tokens_per_second": 4646.379 }, { "epoch": 1.9904336734693877, "grad_norm": 0.6193009607138327, "learning_rate": 5.796507877919855e-10, "loss": 0.24291386604309081, "num_input_tokens_seen": 947333432, "step": 15605, "train_runtime": 203881.3778, "train_tokens_per_second": 4646.493 }, { "epoch": 1.9910714285714286, "grad_norm": 0.6491329994488889, "learning_rate": 5.058910674859973e-10, "loss": 0.25441684722900393, "num_input_tokens_seen": 947631536, "step": 15610, "train_runtime": 203947.025, "train_tokens_per_second": 4646.459 }, { "epoch": 1.9917091836734695, "grad_norm": 0.675203280757148, "learning_rate": 4.371486886822762e-10, "loss": 0.2432384490966797, "num_input_tokens_seen": 947946016, "step": 15615, "train_runtime": 204003.6215, "train_tokens_per_second": 4646.712 }, { "epoch": 1.9923469387755102, "grad_norm": 0.6856722346574126, "learning_rate": 3.7342372036841546e-10, "loss": 0.2673120737075806, "num_input_tokens_seen": 948251504, "step": 15620, "train_runtime": 204068.2295, "train_tokens_per_second": 4646.738 }, { "epoch": 1.992984693877551, "grad_norm": 0.6423156847670656, "learning_rate": 3.147162264971471e-10, "loss": 0.26491403579711914, "num_input_tokens_seen": 948559176, "step": 15625, "train_runtime": 204130.627, "train_tokens_per_second": 4646.824 }, { "epoch": 1.993622448979592, "grad_norm": 0.5998854673719396, "learning_rate": 2.610262659852314e-10, "loss": 0.23858168125152587, "num_input_tokens_seen": 948871280, "step": 15630, "train_runtime": 204191.073, "train_tokens_per_second": 4646.977 }, { "epoch": 1.9942602040816326, "grad_norm": 0.6171558060159329, "learning_rate": 2.123538927145674e-10, "loss": 0.25632877349853517, "num_input_tokens_seen": 949161856, "step": 15635, "train_runtime": 204260.3076, "train_tokens_per_second": 4646.825 }, { "epoch": 1.9948979591836735, "grad_norm": 0.6536324489667538, "learning_rate": 1.686991555310824e-10, "loss": 0.2401134490966797, "num_input_tokens_seen": 949457536, "step": 15640, "train_runtime": 204329.9453, "train_tokens_per_second": 4646.688 }, { "epoch": 1.9955357142857144, "grad_norm": 0.7366112659743931, "learning_rate": 1.3006209824584226e-10, "loss": 0.24632782936096193, "num_input_tokens_seen": 949760728, "step": 15645, "train_runtime": 204387.1487, "train_tokens_per_second": 4646.871 }, { "epoch": 1.996173469387755, "grad_norm": 0.7691263250269446, "learning_rate": 9.6442759632831e-11, "loss": 0.24630413055419922, "num_input_tokens_seen": 950074048, "step": 15650, "train_runtime": 204458.7634, "train_tokens_per_second": 4646.776 }, { "epoch": 1.9968112244897958, "grad_norm": 0.629024715586974, "learning_rate": 6.784117343228147e-11, "loss": 0.22919554710388185, "num_input_tokens_seen": 950380584, "step": 15655, "train_runtime": 204511.7495, "train_tokens_per_second": 4647.071 }, { "epoch": 1.9974489795918369, "grad_norm": 0.703394379431084, "learning_rate": 4.425736834789973e-11, "loss": 0.2392258644104004, "num_input_tokens_seen": 950672704, "step": 15660, "train_runtime": 204582.9692, "train_tokens_per_second": 4646.881 }, { "epoch": 1.9980867346938775, "grad_norm": 0.6532427160875364, "learning_rate": 2.5691368046865118e-11, "loss": 0.2364060640335083, "num_input_tokens_seen": 950979656, "step": 15665, "train_runtime": 204655.5746, "train_tokens_per_second": 4646.732 }, { "epoch": 1.9987244897959182, "grad_norm": 0.6688449806367598, "learning_rate": 1.214319116260576e-11, "loss": 0.24228816032409667, "num_input_tokens_seen": 951292560, "step": 15670, "train_runtime": 204718.0305, "train_tokens_per_second": 4646.843 }, { "epoch": 1.9993622448979593, "grad_norm": 0.7314343258292, "learning_rate": 3.6128512903577105e-12, "loss": 0.25652594566345216, "num_input_tokens_seen": 951600896, "step": 15675, "train_runtime": 204786.0422, "train_tokens_per_second": 4646.805 }, { "epoch": 2.0, "grad_norm": 0.7020156799873025, "learning_rate": 1.0035699216093265e-13, "loss": 0.23354415893554686, "num_input_tokens_seen": 951884320, "step": 15680, "train_runtime": 204849.0219, "train_tokens_per_second": 4646.76 }, { "epoch": 2.0, "num_input_tokens_seen": 951884320, "step": 15680, "total_flos": 1760361553723392.0, "train_loss": 0.2931738243951481, "train_runtime": 204889.8677, "train_samples_per_second": 0.306, "train_steps_per_second": 0.077 } ], "logging_steps": 5, "max_steps": 15680, "num_input_tokens_seen": 951884320, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1760361553723392.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }