{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 15680, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0006377551020408163, "grad_norm": 0.5606629150294529, "learning_rate": 9.999998394288208e-06, "loss": 0.32555317878723145, "num_input_tokens_seen": 307056, "step": 5, "train_runtime": 70.644, "train_tokens_per_second": 4346.524 }, { "epoch": 0.0012755102040816326, "grad_norm": 0.7593070557109454, "learning_rate": 9.999991871085821e-06, "loss": 0.3172970533370972, "num_input_tokens_seen": 619368, "step": 10, "train_runtime": 129.5013, "train_tokens_per_second": 4782.716 }, { "epoch": 0.001913265306122449, "grad_norm": 0.6388307972758556, "learning_rate": 9.999980330042391e-06, "loss": 0.3005043983459473, "num_input_tokens_seen": 919640, "step": 15, "train_runtime": 197.7304, "train_tokens_per_second": 4650.979 }, { "epoch": 0.002551020408163265, "grad_norm": 0.669146696435932, "learning_rate": 9.999963771169503e-06, "loss": 0.3088076591491699, "num_input_tokens_seen": 1230568, "step": 20, "train_runtime": 255.401, "train_tokens_per_second": 4818.181 }, { "epoch": 0.0031887755102040817, "grad_norm": 0.6777401540799771, "learning_rate": 9.999942194483775e-06, "loss": 0.3104086399078369, "num_input_tokens_seen": 1532272, "step": 25, "train_runtime": 310.5411, "train_tokens_per_second": 4934.201 }, { "epoch": 0.003826530612244898, "grad_norm": 0.6676639429470436, "learning_rate": 9.999915600006857e-06, "loss": 0.29593493938446047, "num_input_tokens_seen": 1816368, "step": 30, "train_runtime": 371.4824, "train_tokens_per_second": 4889.513 }, { "epoch": 0.004464285714285714, "grad_norm": 0.6524667967178304, "learning_rate": 9.999883987765443e-06, "loss": 0.31024646759033203, "num_input_tokens_seen": 2113528, "step": 35, "train_runtime": 429.8203, "train_tokens_per_second": 4917.236 }, { "epoch": 0.00510204081632653, "grad_norm": 0.6353759506595735, "learning_rate": 9.999847357791256e-06, "loss": 0.3009695529937744, "num_input_tokens_seen": 2422408, "step": 40, "train_runtime": 505.854, "train_tokens_per_second": 4788.749 }, { "epoch": 0.005739795918367347, "grad_norm": 0.6662553077885118, "learning_rate": 9.999805710121055e-06, "loss": 0.30118274688720703, "num_input_tokens_seen": 2737912, "step": 45, "train_runtime": 576.8314, "train_tokens_per_second": 4746.468 }, { "epoch": 0.006377551020408163, "grad_norm": 0.6649355594885129, "learning_rate": 9.99975904479664e-06, "loss": 0.335707688331604, "num_input_tokens_seen": 3032176, "step": 50, "train_runtime": 644.2997, "train_tokens_per_second": 4706.158 }, { "epoch": 0.00701530612244898, "grad_norm": 0.6128090342381591, "learning_rate": 9.999707361864841e-06, "loss": 0.2981316566467285, "num_input_tokens_seen": 3326688, "step": 55, "train_runtime": 706.3582, "train_tokens_per_second": 4709.633 }, { "epoch": 0.007653061224489796, "grad_norm": 0.6146153348665865, "learning_rate": 9.999650661377527e-06, "loss": 0.3245338201522827, "num_input_tokens_seen": 3643440, "step": 60, "train_runtime": 774.5001, "train_tokens_per_second": 4704.247 }, { "epoch": 0.008290816326530613, "grad_norm": 0.6785023098079027, "learning_rate": 9.999588943391597e-06, "loss": 0.3105494022369385, "num_input_tokens_seen": 3931984, "step": 65, "train_runtime": 848.9996, "train_tokens_per_second": 4631.314 }, { "epoch": 0.008928571428571428, "grad_norm": 0.6655731547295166, "learning_rate": 9.999522207968992e-06, "loss": 0.31799840927124023, "num_input_tokens_seen": 4232600, "step": 70, "train_runtime": 911.9567, "train_tokens_per_second": 4641.229 }, { "epoch": 0.009566326530612245, "grad_norm": 0.8247868120346744, "learning_rate": 9.999450455176686e-06, "loss": 0.31391355991363523, "num_input_tokens_seen": 4541848, "step": 75, "train_runtime": 955.2831, "train_tokens_per_second": 4754.452 }, { "epoch": 0.01020408163265306, "grad_norm": 0.6199820358842323, "learning_rate": 9.99937368508669e-06, "loss": 0.3074874639511108, "num_input_tokens_seen": 4841560, "step": 80, "train_runtime": 1018.2827, "train_tokens_per_second": 4754.632 }, { "epoch": 0.010841836734693877, "grad_norm": 0.7319306172868103, "learning_rate": 9.999291897776043e-06, "loss": 0.3182725429534912, "num_input_tokens_seen": 5127432, "step": 85, "train_runtime": 1078.4405, "train_tokens_per_second": 4754.487 }, { "epoch": 0.011479591836734694, "grad_norm": 0.6685715685218444, "learning_rate": 9.999205093326825e-06, "loss": 0.3352250337600708, "num_input_tokens_seen": 5436216, "step": 90, "train_runtime": 1145.626, "train_tokens_per_second": 4745.193 }, { "epoch": 0.01211734693877551, "grad_norm": 0.6622114853124953, "learning_rate": 9.999113271826154e-06, "loss": 0.3200762987136841, "num_input_tokens_seen": 5736632, "step": 95, "train_runtime": 1215.2064, "train_tokens_per_second": 4720.706 }, { "epoch": 0.012755102040816327, "grad_norm": 0.6864874287783332, "learning_rate": 9.999016433366178e-06, "loss": 0.3209428310394287, "num_input_tokens_seen": 6036576, "step": 100, "train_runtime": 1285.2068, "train_tokens_per_second": 4696.969 }, { "epoch": 0.013392857142857142, "grad_norm": 0.6354038469659828, "learning_rate": 9.998914578044079e-06, "loss": 0.3147577285766602, "num_input_tokens_seen": 6324568, "step": 105, "train_runtime": 1349.6796, "train_tokens_per_second": 4685.977 }, { "epoch": 0.01403061224489796, "grad_norm": 0.6791525229535978, "learning_rate": 9.998807705962079e-06, "loss": 0.3091780662536621, "num_input_tokens_seen": 6618624, "step": 110, "train_runtime": 1410.8023, "train_tokens_per_second": 4691.39 }, { "epoch": 0.014668367346938776, "grad_norm": 0.5904897872744799, "learning_rate": 9.99869581722743e-06, "loss": 0.3179654598236084, "num_input_tokens_seen": 6928552, "step": 115, "train_runtime": 1471.3438, "train_tokens_per_second": 4708.996 }, { "epoch": 0.015306122448979591, "grad_norm": 0.5866546516408551, "learning_rate": 9.99857891195242e-06, "loss": 0.30416264533996584, "num_input_tokens_seen": 7235768, "step": 120, "train_runtime": 1541.301, "train_tokens_per_second": 4694.585 }, { "epoch": 0.01594387755102041, "grad_norm": 0.5847461573271263, "learning_rate": 9.998456990254371e-06, "loss": 0.3292226314544678, "num_input_tokens_seen": 7548984, "step": 125, "train_runtime": 1585.4463, "train_tokens_per_second": 4761.425 }, { "epoch": 0.016581632653061226, "grad_norm": 0.663765539854714, "learning_rate": 9.998330052255642e-06, "loss": 0.30205209255218507, "num_input_tokens_seen": 7854000, "step": 130, "train_runtime": 1656.5651, "train_tokens_per_second": 4741.136 }, { "epoch": 0.01721938775510204, "grad_norm": 0.5938051231759824, "learning_rate": 9.998198098083623e-06, "loss": 0.31253373622894287, "num_input_tokens_seen": 8150232, "step": 135, "train_runtime": 1719.6335, "train_tokens_per_second": 4739.517 }, { "epoch": 0.017857142857142856, "grad_norm": 0.6766189571803923, "learning_rate": 9.998061127870738e-06, "loss": 0.3201970100402832, "num_input_tokens_seen": 8453184, "step": 140, "train_runtime": 1773.6419, "train_tokens_per_second": 4766.004 }, { "epoch": 0.018494897959183673, "grad_norm": 0.6541348589014065, "learning_rate": 9.997919141754448e-06, "loss": 0.31698040962219237, "num_input_tokens_seen": 8742848, "step": 145, "train_runtime": 1837.6218, "train_tokens_per_second": 4757.697 }, { "epoch": 0.01913265306122449, "grad_norm": 0.6791837085985184, "learning_rate": 9.997772139877245e-06, "loss": 0.3183109998703003, "num_input_tokens_seen": 9051224, "step": 150, "train_runtime": 1906.2014, "train_tokens_per_second": 4748.304 }, { "epoch": 0.019770408163265307, "grad_norm": 0.8304155968229497, "learning_rate": 9.997620122386658e-06, "loss": 0.3402367115020752, "num_input_tokens_seen": 9348064, "step": 155, "train_runtime": 1974.4495, "train_tokens_per_second": 4734.517 }, { "epoch": 0.02040816326530612, "grad_norm": 0.6632211550468946, "learning_rate": 9.997463089435242e-06, "loss": 0.3259411811828613, "num_input_tokens_seen": 9639544, "step": 160, "train_runtime": 2043.9311, "train_tokens_per_second": 4716.179 }, { "epoch": 0.021045918367346938, "grad_norm": 0.6576049807668407, "learning_rate": 9.997301041180597e-06, "loss": 0.32861177921295165, "num_input_tokens_seen": 9945192, "step": 165, "train_runtime": 2103.3501, "train_tokens_per_second": 4728.263 }, { "epoch": 0.021683673469387755, "grad_norm": 0.6304566369226388, "learning_rate": 9.997133977785342e-06, "loss": 0.31604456901550293, "num_input_tokens_seen": 10255232, "step": 170, "train_runtime": 2165.9496, "train_tokens_per_second": 4734.751 }, { "epoch": 0.022321428571428572, "grad_norm": 0.6805488864873742, "learning_rate": 9.996961899417145e-06, "loss": 0.31748697757720945, "num_input_tokens_seen": 10566904, "step": 175, "train_runtime": 2229.7478, "train_tokens_per_second": 4739.058 }, { "epoch": 0.02295918367346939, "grad_norm": 0.6082949994569637, "learning_rate": 9.996784806248694e-06, "loss": 0.29314508438110354, "num_input_tokens_seen": 10877624, "step": 180, "train_runtime": 2300.7334, "train_tokens_per_second": 4727.894 }, { "epoch": 0.023596938775510203, "grad_norm": 0.6497868120512466, "learning_rate": 9.996602698457716e-06, "loss": 0.3461932182312012, "num_input_tokens_seen": 11176016, "step": 185, "train_runtime": 2358.3838, "train_tokens_per_second": 4738.845 }, { "epoch": 0.02423469387755102, "grad_norm": 0.6093118092640974, "learning_rate": 9.996415576226967e-06, "loss": 0.3246460914611816, "num_input_tokens_seen": 11489872, "step": 190, "train_runtime": 2410.919, "train_tokens_per_second": 4765.764 }, { "epoch": 0.024872448979591837, "grad_norm": 0.5901408518219843, "learning_rate": 9.996223439744238e-06, "loss": 0.34906563758850095, "num_input_tokens_seen": 11796712, "step": 195, "train_runtime": 2471.8639, "train_tokens_per_second": 4772.395 }, { "epoch": 0.025510204081632654, "grad_norm": 0.7443418375897536, "learning_rate": 9.996026289202352e-06, "loss": 0.3157334566116333, "num_input_tokens_seen": 12094920, "step": 200, "train_runtime": 2534.5638, "train_tokens_per_second": 4771.993 }, { "epoch": 0.02614795918367347, "grad_norm": 0.6328150179349048, "learning_rate": 9.995824124799164e-06, "loss": 0.3202739477157593, "num_input_tokens_seen": 12402328, "step": 205, "train_runtime": 2599.7223, "train_tokens_per_second": 4770.636 }, { "epoch": 0.026785714285714284, "grad_norm": 0.5679139496449538, "learning_rate": 9.995616946737558e-06, "loss": 0.30471899509429934, "num_input_tokens_seen": 12693232, "step": 210, "train_runtime": 2660.0942, "train_tokens_per_second": 4771.723 }, { "epoch": 0.0274234693877551, "grad_norm": 0.6479245859651804, "learning_rate": 9.995404755225454e-06, "loss": 0.3205737590789795, "num_input_tokens_seen": 12988256, "step": 215, "train_runtime": 2727.0257, "train_tokens_per_second": 4762.792 }, { "epoch": 0.02806122448979592, "grad_norm": 0.6394405912298028, "learning_rate": 9.995187550475799e-06, "loss": 0.2996486186981201, "num_input_tokens_seen": 13274424, "step": 220, "train_runtime": 2790.309, "train_tokens_per_second": 4757.331 }, { "epoch": 0.028698979591836735, "grad_norm": 0.607272545676857, "learning_rate": 9.994965332706574e-06, "loss": 0.3249512195587158, "num_input_tokens_seen": 13570744, "step": 225, "train_runtime": 2857.2788, "train_tokens_per_second": 4749.534 }, { "epoch": 0.029336734693877552, "grad_norm": 0.7294675452895084, "learning_rate": 9.994738102140791e-06, "loss": 0.33909082412719727, "num_input_tokens_seen": 13872696, "step": 230, "train_runtime": 2919.6481, "train_tokens_per_second": 4751.496 }, { "epoch": 0.029974489795918366, "grad_norm": 0.6378127712293848, "learning_rate": 9.994505859006489e-06, "loss": 0.34965171813964846, "num_input_tokens_seen": 14164936, "step": 235, "train_runtime": 2991.8019, "train_tokens_per_second": 4734.583 }, { "epoch": 0.030612244897959183, "grad_norm": 0.591562332095497, "learning_rate": 9.994268603536743e-06, "loss": 0.330527138710022, "num_input_tokens_seen": 14468000, "step": 240, "train_runtime": 3052.1748, "train_tokens_per_second": 4740.226 }, { "epoch": 0.03125, "grad_norm": 0.6503140425037022, "learning_rate": 9.994026335969654e-06, "loss": 0.34091250896453856, "num_input_tokens_seen": 14769440, "step": 245, "train_runtime": 3121.2753, "train_tokens_per_second": 4731.861 }, { "epoch": 0.03188775510204082, "grad_norm": 0.7206538638886743, "learning_rate": 9.993779056548357e-06, "loss": 0.32621986865997316, "num_input_tokens_seen": 15070728, "step": 250, "train_runtime": 3179.8481, "train_tokens_per_second": 4739.449 }, { "epoch": 0.032525510204081634, "grad_norm": 0.6417790379171046, "learning_rate": 9.99352676552101e-06, "loss": 0.32343032360076907, "num_input_tokens_seen": 15381016, "step": 255, "train_runtime": 3244.6399, "train_tokens_per_second": 4740.439 }, { "epoch": 0.03316326530612245, "grad_norm": 0.7257546948478659, "learning_rate": 9.993269463140805e-06, "loss": 0.33203413486480715, "num_input_tokens_seen": 15678832, "step": 260, "train_runtime": 3313.1898, "train_tokens_per_second": 4732.247 }, { "epoch": 0.03380102040816327, "grad_norm": 0.5972157409099551, "learning_rate": 9.993007149665968e-06, "loss": 0.30761942863464353, "num_input_tokens_seen": 16002672, "step": 265, "train_runtime": 3368.7361, "train_tokens_per_second": 4750.349 }, { "epoch": 0.03443877551020408, "grad_norm": 0.6274491114706233, "learning_rate": 9.992739825359743e-06, "loss": 0.3240455150604248, "num_input_tokens_seen": 16299328, "step": 270, "train_runtime": 3429.672, "train_tokens_per_second": 4752.445 }, { "epoch": 0.035076530612244895, "grad_norm": 0.633623366571598, "learning_rate": 9.992467490490411e-06, "loss": 0.3531185150146484, "num_input_tokens_seen": 16600456, "step": 275, "train_runtime": 3497.6353, "train_tokens_per_second": 4746.194 }, { "epoch": 0.03571428571428571, "grad_norm": 0.6160667032053221, "learning_rate": 9.99219014533128e-06, "loss": 0.3064985752105713, "num_input_tokens_seen": 16908000, "step": 280, "train_runtime": 3560.7808, "train_tokens_per_second": 4748.397 }, { "epoch": 0.03635204081632653, "grad_norm": 0.6738097526273257, "learning_rate": 9.991907790160686e-06, "loss": 0.32353625297546384, "num_input_tokens_seen": 17206424, "step": 285, "train_runtime": 3631.8727, "train_tokens_per_second": 4737.618 }, { "epoch": 0.036989795918367346, "grad_norm": 0.6817527588786203, "learning_rate": 9.991620425261987e-06, "loss": 0.3298201084136963, "num_input_tokens_seen": 17512464, "step": 290, "train_runtime": 3693.5072, "train_tokens_per_second": 4741.419 }, { "epoch": 0.03762755102040816, "grad_norm": 0.6571499745360195, "learning_rate": 9.99132805092358e-06, "loss": 0.3204179048538208, "num_input_tokens_seen": 17819256, "step": 295, "train_runtime": 3751.968, "train_tokens_per_second": 4749.309 }, { "epoch": 0.03826530612244898, "grad_norm": 0.6382139716578328, "learning_rate": 9.99103066743888e-06, "loss": 0.3137251853942871, "num_input_tokens_seen": 18118704, "step": 300, "train_runtime": 3816.7296, "train_tokens_per_second": 4747.18 }, { "epoch": 0.0389030612244898, "grad_norm": 0.6468563537536628, "learning_rate": 9.990728275106332e-06, "loss": 0.33147296905517576, "num_input_tokens_seen": 18416920, "step": 305, "train_runtime": 3888.0192, "train_tokens_per_second": 4736.839 }, { "epoch": 0.039540816326530615, "grad_norm": 0.565317175678439, "learning_rate": 9.990420874229408e-06, "loss": 0.3082550525665283, "num_input_tokens_seen": 18712736, "step": 310, "train_runtime": 3950.42, "train_tokens_per_second": 4736.898 }, { "epoch": 0.04017857142857143, "grad_norm": 0.711772451702932, "learning_rate": 9.990108465116606e-06, "loss": 0.33627796173095703, "num_input_tokens_seen": 18999736, "step": 315, "train_runtime": 4022.8437, "train_tokens_per_second": 4722.962 }, { "epoch": 0.04081632653061224, "grad_norm": 0.6024687267299634, "learning_rate": 9.989791048081452e-06, "loss": 0.34989590644836427, "num_input_tokens_seen": 19301608, "step": 320, "train_runtime": 4091.466, "train_tokens_per_second": 4717.529 }, { "epoch": 0.04145408163265306, "grad_norm": 0.6438135368684226, "learning_rate": 9.989468623442494e-06, "loss": 0.3031839609146118, "num_input_tokens_seen": 19594792, "step": 325, "train_runtime": 4151.5342, "train_tokens_per_second": 4719.892 }, { "epoch": 0.042091836734693876, "grad_norm": 0.6809717294079394, "learning_rate": 9.989141191523309e-06, "loss": 0.3175718545913696, "num_input_tokens_seen": 19865664, "step": 330, "train_runtime": 4224.6826, "train_tokens_per_second": 4702.286 }, { "epoch": 0.04272959183673469, "grad_norm": 0.6787774677132214, "learning_rate": 9.988808752652498e-06, "loss": 0.3163781642913818, "num_input_tokens_seen": 20161264, "step": 335, "train_runtime": 4283.0728, "train_tokens_per_second": 4707.196 }, { "epoch": 0.04336734693877551, "grad_norm": 0.606984869535405, "learning_rate": 9.988471307163684e-06, "loss": 0.3327335834503174, "num_input_tokens_seen": 20460944, "step": 340, "train_runtime": 4347.2456, "train_tokens_per_second": 4706.645 }, { "epoch": 0.04400510204081633, "grad_norm": 0.7121877671474408, "learning_rate": 9.988128855395522e-06, "loss": 0.31911287307739256, "num_input_tokens_seen": 20759440, "step": 345, "train_runtime": 4417.4681, "train_tokens_per_second": 4699.398 }, { "epoch": 0.044642857142857144, "grad_norm": 0.7092694846190201, "learning_rate": 9.987781397691683e-06, "loss": 0.3497852087020874, "num_input_tokens_seen": 21051728, "step": 350, "train_runtime": 4489.3049, "train_tokens_per_second": 4689.307 }, { "epoch": 0.04528061224489796, "grad_norm": 0.6829232197373883, "learning_rate": 9.987428934400864e-06, "loss": 0.33017926216125487, "num_input_tokens_seen": 21350144, "step": 355, "train_runtime": 4561.7355, "train_tokens_per_second": 4680.268 }, { "epoch": 0.04591836734693878, "grad_norm": 0.6792644968287634, "learning_rate": 9.98707146587679e-06, "loss": 0.31848602294921874, "num_input_tokens_seen": 21642016, "step": 360, "train_runtime": 4620.6082, "train_tokens_per_second": 4683.802 }, { "epoch": 0.046556122448979595, "grad_norm": 0.5901350660402305, "learning_rate": 9.986708992478202e-06, "loss": 0.30682835578918455, "num_input_tokens_seen": 21955552, "step": 365, "train_runtime": 4685.473, "train_tokens_per_second": 4685.877 }, { "epoch": 0.047193877551020405, "grad_norm": 0.5923571477531686, "learning_rate": 9.98634151456887e-06, "loss": 0.29576663970947265, "num_input_tokens_seen": 22264416, "step": 370, "train_runtime": 4735.8841, "train_tokens_per_second": 4701.216 }, { "epoch": 0.04783163265306122, "grad_norm": 0.6394976500523845, "learning_rate": 9.985969032517582e-06, "loss": 0.3408482551574707, "num_input_tokens_seen": 22582104, "step": 375, "train_runtime": 4796.2194, "train_tokens_per_second": 4708.313 }, { "epoch": 0.04846938775510204, "grad_norm": 0.6948625367608592, "learning_rate": 9.985591546698151e-06, "loss": 0.32459070682525637, "num_input_tokens_seen": 22874592, "step": 380, "train_runtime": 4863.8457, "train_tokens_per_second": 4702.985 }, { "epoch": 0.049107142857142856, "grad_norm": 0.6621128282688693, "learning_rate": 9.98520905748941e-06, "loss": 0.3638442039489746, "num_input_tokens_seen": 23168960, "step": 385, "train_runtime": 4924.6561, "train_tokens_per_second": 4704.686 }, { "epoch": 0.04974489795918367, "grad_norm": 0.5449516416009511, "learning_rate": 9.984821565275214e-06, "loss": 0.31552510261535643, "num_input_tokens_seen": 23476952, "step": 390, "train_runtime": 4985.8864, "train_tokens_per_second": 4708.682 }, { "epoch": 0.05038265306122449, "grad_norm": 0.6218114965530601, "learning_rate": 9.984429070444437e-06, "loss": 0.3246952533721924, "num_input_tokens_seen": 23783704, "step": 395, "train_runtime": 5042.3193, "train_tokens_per_second": 4716.818 }, { "epoch": 0.05102040816326531, "grad_norm": 0.6938120251411585, "learning_rate": 9.984031573390977e-06, "loss": 0.31642162799835205, "num_input_tokens_seen": 24084240, "step": 400, "train_runtime": 5106.6348, "train_tokens_per_second": 4716.264 }, { "epoch": 0.051658163265306124, "grad_norm": 0.6408719146211228, "learning_rate": 9.983629074513749e-06, "loss": 0.3200521469116211, "num_input_tokens_seen": 24392072, "step": 405, "train_runtime": 5162.8643, "train_tokens_per_second": 4724.523 }, { "epoch": 0.05229591836734694, "grad_norm": 0.5789189971057029, "learning_rate": 9.983221574216688e-06, "loss": 0.3312517166137695, "num_input_tokens_seen": 24695208, "step": 410, "train_runtime": 5230.068, "train_tokens_per_second": 4721.776 }, { "epoch": 0.05293367346938776, "grad_norm": 0.6249544848251316, "learning_rate": 9.98280907290875e-06, "loss": 0.3149777889251709, "num_input_tokens_seen": 25001944, "step": 415, "train_runtime": 5288.4449, "train_tokens_per_second": 4727.655 }, { "epoch": 0.05357142857142857, "grad_norm": 0.5877787304045785, "learning_rate": 9.98239157100391e-06, "loss": 0.313005256652832, "num_input_tokens_seen": 25314664, "step": 420, "train_runtime": 5355.1453, "train_tokens_per_second": 4727.167 }, { "epoch": 0.054209183673469385, "grad_norm": 0.6097079957803321, "learning_rate": 9.981969068921157e-06, "loss": 0.3354280710220337, "num_input_tokens_seen": 25624904, "step": 425, "train_runtime": 5429.7986, "train_tokens_per_second": 4719.31 }, { "epoch": 0.0548469387755102, "grad_norm": 0.6231312381575178, "learning_rate": 9.981541567084506e-06, "loss": 0.30369086265563966, "num_input_tokens_seen": 25912224, "step": 430, "train_runtime": 5494.9138, "train_tokens_per_second": 4715.674 }, { "epoch": 0.05548469387755102, "grad_norm": 0.6124856979200631, "learning_rate": 9.98110906592298e-06, "loss": 0.3130204439163208, "num_input_tokens_seen": 26221560, "step": 435, "train_runtime": 5561.1032, "train_tokens_per_second": 4715.172 }, { "epoch": 0.05612244897959184, "grad_norm": 0.7234427591142097, "learning_rate": 9.980671565870628e-06, "loss": 0.3251868486404419, "num_input_tokens_seen": 26509480, "step": 440, "train_runtime": 5618.0134, "train_tokens_per_second": 4718.657 }, { "epoch": 0.056760204081632654, "grad_norm": 0.7264223860858371, "learning_rate": 9.98022906736651e-06, "loss": 0.338460111618042, "num_input_tokens_seen": 26797608, "step": 445, "train_runtime": 5686.6321, "train_tokens_per_second": 4712.386 }, { "epoch": 0.05739795918367347, "grad_norm": 0.587867187729823, "learning_rate": 9.979781570854704e-06, "loss": 0.3184667110443115, "num_input_tokens_seen": 27103592, "step": 450, "train_runtime": 5750.9363, "train_tokens_per_second": 4712.901 }, { "epoch": 0.05803571428571429, "grad_norm": 0.6426574915923813, "learning_rate": 9.979329076784305e-06, "loss": 0.300250506401062, "num_input_tokens_seen": 27398720, "step": 455, "train_runtime": 5819.9648, "train_tokens_per_second": 4707.712 }, { "epoch": 0.058673469387755105, "grad_norm": 0.6225789987596188, "learning_rate": 9.978871585609422e-06, "loss": 0.32442636489868165, "num_input_tokens_seen": 27717824, "step": 460, "train_runtime": 5873.7344, "train_tokens_per_second": 4718.944 }, { "epoch": 0.05931122448979592, "grad_norm": 0.5973787264008296, "learning_rate": 9.978409097789178e-06, "loss": 0.3366720199584961, "num_input_tokens_seen": 28021088, "step": 465, "train_runtime": 5943.536, "train_tokens_per_second": 4714.548 }, { "epoch": 0.05994897959183673, "grad_norm": 0.6069025514534458, "learning_rate": 9.977941613787714e-06, "loss": 0.2983412504196167, "num_input_tokens_seen": 28312744, "step": 470, "train_runtime": 5999.5463, "train_tokens_per_second": 4719.148 }, { "epoch": 0.06058673469387755, "grad_norm": 0.6414932786095137, "learning_rate": 9.977469134074181e-06, "loss": 0.3117494583129883, "num_input_tokens_seen": 28608608, "step": 475, "train_runtime": 6073.1591, "train_tokens_per_second": 4710.663 }, { "epoch": 0.061224489795918366, "grad_norm": 0.5766432270379303, "learning_rate": 9.976991659122748e-06, "loss": 0.332213020324707, "num_input_tokens_seen": 28919968, "step": 480, "train_runtime": 6142.8908, "train_tokens_per_second": 4707.876 }, { "epoch": 0.06186224489795918, "grad_norm": 0.687213434108391, "learning_rate": 9.976509189412591e-06, "loss": 0.32208664417266847, "num_input_tokens_seen": 29221048, "step": 485, "train_runtime": 6200.1589, "train_tokens_per_second": 4712.951 }, { "epoch": 0.0625, "grad_norm": 0.6164832754267603, "learning_rate": 9.976021725427905e-06, "loss": 0.30185608863830565, "num_input_tokens_seen": 29514096, "step": 490, "train_runtime": 6268.6853, "train_tokens_per_second": 4708.18 }, { "epoch": 0.06313775510204081, "grad_norm": 0.5608106101306191, "learning_rate": 9.975529267657892e-06, "loss": 0.3353261470794678, "num_input_tokens_seen": 29819160, "step": 495, "train_runtime": 6330.802, "train_tokens_per_second": 4710.171 }, { "epoch": 0.06377551020408163, "grad_norm": 0.6414173387060472, "learning_rate": 9.97503181659677e-06, "loss": 0.3376767635345459, "num_input_tokens_seen": 30123016, "step": 500, "train_runtime": 6395.8326, "train_tokens_per_second": 4709.788 }, { "epoch": 0.06441326530612244, "grad_norm": 1.0983782636367827, "learning_rate": 9.974529372743762e-06, "loss": 0.35728614330291747, "num_input_tokens_seen": 30428672, "step": 505, "train_runtime": 6458.7711, "train_tokens_per_second": 4711.217 }, { "epoch": 0.06505102040816327, "grad_norm": 0.6220557654114379, "learning_rate": 9.97402193660311e-06, "loss": 0.34481186866760255, "num_input_tokens_seen": 30726152, "step": 510, "train_runtime": 6524.046, "train_tokens_per_second": 4709.677 }, { "epoch": 0.06568877551020408, "grad_norm": 0.5294936170454477, "learning_rate": 9.973509508684061e-06, "loss": 0.30537350177764894, "num_input_tokens_seen": 31040816, "step": 515, "train_runtime": 6591.8962, "train_tokens_per_second": 4708.936 }, { "epoch": 0.0663265306122449, "grad_norm": 0.6660172134985414, "learning_rate": 9.972992089500868e-06, "loss": 0.3000118494033813, "num_input_tokens_seen": 31340616, "step": 520, "train_runtime": 6655.4303, "train_tokens_per_second": 4709.029 }, { "epoch": 0.06696428571428571, "grad_norm": 0.5608559388484903, "learning_rate": 9.972469679572802e-06, "loss": 0.3160065174102783, "num_input_tokens_seen": 31632232, "step": 525, "train_runtime": 6722.5039, "train_tokens_per_second": 4705.424 }, { "epoch": 0.06760204081632654, "grad_norm": 0.6358022650010828, "learning_rate": 9.971942279424136e-06, "loss": 0.330961275100708, "num_input_tokens_seen": 31932512, "step": 530, "train_runtime": 6793.9904, "train_tokens_per_second": 4700.111 }, { "epoch": 0.06823979591836735, "grad_norm": 0.6717442313471188, "learning_rate": 9.971409889584151e-06, "loss": 0.3318564176559448, "num_input_tokens_seen": 32235152, "step": 535, "train_runtime": 6863.2145, "train_tokens_per_second": 4696.801 }, { "epoch": 0.06887755102040816, "grad_norm": 0.6592231573120175, "learning_rate": 9.970872510587142e-06, "loss": 0.3217033386230469, "num_input_tokens_seen": 32533016, "step": 540, "train_runtime": 6929.4769, "train_tokens_per_second": 4694.873 }, { "epoch": 0.06951530612244898, "grad_norm": 0.6719574151234373, "learning_rate": 9.970330142972403e-06, "loss": 0.30914323329925536, "num_input_tokens_seen": 32833312, "step": 545, "train_runtime": 7000.378, "train_tokens_per_second": 4690.22 }, { "epoch": 0.07015306122448979, "grad_norm": 0.5935025976726969, "learning_rate": 9.969782787284237e-06, "loss": 0.32875947952270507, "num_input_tokens_seen": 33147480, "step": 550, "train_runtime": 7065.8158, "train_tokens_per_second": 4691.246 }, { "epoch": 0.07079081632653061, "grad_norm": 0.5404040639433234, "learning_rate": 9.969230444071956e-06, "loss": 0.2959745407104492, "num_input_tokens_seen": 33452880, "step": 555, "train_runtime": 7124.2157, "train_tokens_per_second": 4695.658 }, { "epoch": 0.07142857142857142, "grad_norm": 0.6941661209620434, "learning_rate": 9.968673113889874e-06, "loss": 0.28325576782226564, "num_input_tokens_seen": 33732872, "step": 560, "train_runtime": 7186.4275, "train_tokens_per_second": 4693.97 }, { "epoch": 0.07206632653061225, "grad_norm": 0.6130601638560698, "learning_rate": 9.968110797297312e-06, "loss": 0.33871145248413087, "num_input_tokens_seen": 34031504, "step": 565, "train_runtime": 7245.269, "train_tokens_per_second": 4697.066 }, { "epoch": 0.07270408163265306, "grad_norm": 0.7471357200132628, "learning_rate": 9.967543494858591e-06, "loss": 0.3374213695526123, "num_input_tokens_seen": 34322088, "step": 570, "train_runtime": 7311.3288, "train_tokens_per_second": 4694.371 }, { "epoch": 0.07334183673469388, "grad_norm": 0.5507845697057443, "learning_rate": 9.966971207143041e-06, "loss": 0.29483556747436523, "num_input_tokens_seen": 34628464, "step": 575, "train_runtime": 7366.2422, "train_tokens_per_second": 4700.967 }, { "epoch": 0.07397959183673469, "grad_norm": 0.5780226519591101, "learning_rate": 9.966393934724992e-06, "loss": 0.304833984375, "num_input_tokens_seen": 34935360, "step": 580, "train_runtime": 7434.2548, "train_tokens_per_second": 4699.242 }, { "epoch": 0.07461734693877552, "grad_norm": 0.680301531971061, "learning_rate": 9.965811678183777e-06, "loss": 0.3297819375991821, "num_input_tokens_seen": 35232952, "step": 585, "train_runtime": 7495.366, "train_tokens_per_second": 4700.631 }, { "epoch": 0.07525510204081633, "grad_norm": 0.5924148284649571, "learning_rate": 9.965224438103733e-06, "loss": 0.32800214290618895, "num_input_tokens_seen": 35544336, "step": 590, "train_runtime": 7562.7599, "train_tokens_per_second": 4699.916 }, { "epoch": 0.07589285714285714, "grad_norm": 0.6551797249996265, "learning_rate": 9.964632215074193e-06, "loss": 0.3100182771682739, "num_input_tokens_seen": 35846112, "step": 595, "train_runtime": 7629.9065, "train_tokens_per_second": 4698.106 }, { "epoch": 0.07653061224489796, "grad_norm": 0.6393776518734431, "learning_rate": 9.964035009689498e-06, "loss": 0.31659588813781736, "num_input_tokens_seen": 36143816, "step": 600, "train_runtime": 7695.312, "train_tokens_per_second": 4696.862 }, { "epoch": 0.07716836734693877, "grad_norm": 0.60578047473953, "learning_rate": 9.963432822548982e-06, "loss": 0.2801633358001709, "num_input_tokens_seen": 36442288, "step": 605, "train_runtime": 7764.4173, "train_tokens_per_second": 4693.499 }, { "epoch": 0.0778061224489796, "grad_norm": 0.6609439547465508, "learning_rate": 9.962825654256984e-06, "loss": 0.3205680847167969, "num_input_tokens_seen": 36740720, "step": 610, "train_runtime": 7837.3296, "train_tokens_per_second": 4687.913 }, { "epoch": 0.0784438775510204, "grad_norm": 0.5596926565317494, "learning_rate": 9.962213505422838e-06, "loss": 0.32973132133483884, "num_input_tokens_seen": 37050280, "step": 615, "train_runtime": 7899.5307, "train_tokens_per_second": 4690.187 }, { "epoch": 0.07908163265306123, "grad_norm": 0.6288867716165758, "learning_rate": 9.96159637666088e-06, "loss": 0.3185285568237305, "num_input_tokens_seen": 37362816, "step": 620, "train_runtime": 7972.0212, "train_tokens_per_second": 4686.743 }, { "epoch": 0.07971938775510204, "grad_norm": 0.6053102405034232, "learning_rate": 9.96097426859044e-06, "loss": 0.30266656875610354, "num_input_tokens_seen": 37657664, "step": 625, "train_runtime": 8036.5517, "train_tokens_per_second": 4685.799 }, { "epoch": 0.08035714285714286, "grad_norm": 0.5929508426778245, "learning_rate": 9.960347181835848e-06, "loss": 0.3362568378448486, "num_input_tokens_seen": 37953256, "step": 630, "train_runtime": 8101.3319, "train_tokens_per_second": 4684.817 }, { "epoch": 0.08099489795918367, "grad_norm": 0.5990356640392523, "learning_rate": 9.95971511702643e-06, "loss": 0.3335370302200317, "num_input_tokens_seen": 38261928, "step": 635, "train_runtime": 8165.5101, "train_tokens_per_second": 4685.798 }, { "epoch": 0.08163265306122448, "grad_norm": 0.6128622752949864, "learning_rate": 9.959078074796505e-06, "loss": 0.30237016677856443, "num_input_tokens_seen": 38567456, "step": 640, "train_runtime": 8231.7885, "train_tokens_per_second": 4685.185 }, { "epoch": 0.08227040816326531, "grad_norm": 0.6152463940681897, "learning_rate": 9.958436055785391e-06, "loss": 0.3088388442993164, "num_input_tokens_seen": 38864792, "step": 645, "train_runtime": 8287.9684, "train_tokens_per_second": 4689.303 }, { "epoch": 0.08290816326530612, "grad_norm": 0.6553132749686336, "learning_rate": 9.9577890606374e-06, "loss": 0.32641143798828126, "num_input_tokens_seen": 39140920, "step": 650, "train_runtime": 8353.9801, "train_tokens_per_second": 4685.302 }, { "epoch": 0.08354591836734694, "grad_norm": 0.6119341484296121, "learning_rate": 9.957137090001834e-06, "loss": 0.34890944957733155, "num_input_tokens_seen": 39450344, "step": 655, "train_runtime": 8418.7079, "train_tokens_per_second": 4686.033 }, { "epoch": 0.08418367346938775, "grad_norm": 0.6288933704786654, "learning_rate": 9.956480144532992e-06, "loss": 0.32751471996307374, "num_input_tokens_seen": 39741144, "step": 660, "train_runtime": 8480.8337, "train_tokens_per_second": 4685.995 }, { "epoch": 0.08482142857142858, "grad_norm": 0.5550925641636524, "learning_rate": 9.955818224890166e-06, "loss": 0.301294732093811, "num_input_tokens_seen": 40053448, "step": 665, "train_runtime": 8536.8798, "train_tokens_per_second": 4691.813 }, { "epoch": 0.08545918367346939, "grad_norm": 0.5896776348699012, "learning_rate": 9.955151331737638e-06, "loss": 0.32529559135437014, "num_input_tokens_seen": 40364272, "step": 670, "train_runtime": 8606.7891, "train_tokens_per_second": 4689.818 }, { "epoch": 0.08609693877551021, "grad_norm": 0.6244477227734737, "learning_rate": 9.954479465744681e-06, "loss": 0.30895309448242186, "num_input_tokens_seen": 40652352, "step": 675, "train_runtime": 8680.4236, "train_tokens_per_second": 4683.222 }, { "epoch": 0.08673469387755102, "grad_norm": 0.6537923271745987, "learning_rate": 9.95380262758556e-06, "loss": 0.34395403861999513, "num_input_tokens_seen": 40955904, "step": 680, "train_runtime": 8734.5293, "train_tokens_per_second": 4688.965 }, { "epoch": 0.08737244897959184, "grad_norm": 0.5680360919622338, "learning_rate": 9.953120817939532e-06, "loss": 0.3261738300323486, "num_input_tokens_seen": 41274320, "step": 685, "train_runtime": 8803.1769, "train_tokens_per_second": 4688.571 }, { "epoch": 0.08801020408163265, "grad_norm": 0.6507982924694738, "learning_rate": 9.952434037490835e-06, "loss": 0.34364681243896483, "num_input_tokens_seen": 41565784, "step": 690, "train_runtime": 8873.5797, "train_tokens_per_second": 4684.218 }, { "epoch": 0.08864795918367346, "grad_norm": 0.5721567224791083, "learning_rate": 9.951742286928706e-06, "loss": 0.31003880500793457, "num_input_tokens_seen": 41878216, "step": 695, "train_runtime": 8941.4147, "train_tokens_per_second": 4683.623 }, { "epoch": 0.08928571428571429, "grad_norm": 0.62241533513591, "learning_rate": 9.951045566947361e-06, "loss": 0.31658937931060793, "num_input_tokens_seen": 42162784, "step": 700, "train_runtime": 9004.6117, "train_tokens_per_second": 4682.354 }, { "epoch": 0.0899234693877551, "grad_norm": 0.6436845568443312, "learning_rate": 9.950343878246011e-06, "loss": 0.33315672874450686, "num_input_tokens_seen": 42462184, "step": 705, "train_runtime": 9073.6235, "train_tokens_per_second": 4679.738 }, { "epoch": 0.09056122448979592, "grad_norm": 0.5942064773040654, "learning_rate": 9.949637221528847e-06, "loss": 0.309171199798584, "num_input_tokens_seen": 42764072, "step": 710, "train_runtime": 9144.3897, "train_tokens_per_second": 4676.536 }, { "epoch": 0.09119897959183673, "grad_norm": 0.6031870848834505, "learning_rate": 9.94892559750505e-06, "loss": 0.30094854831695556, "num_input_tokens_seen": 43068888, "step": 715, "train_runtime": 9208.8944, "train_tokens_per_second": 4676.879 }, { "epoch": 0.09183673469387756, "grad_norm": 0.5937684412015127, "learning_rate": 9.948209006888782e-06, "loss": 0.3068702220916748, "num_input_tokens_seen": 43363368, "step": 720, "train_runtime": 9266.0798, "train_tokens_per_second": 4679.797 }, { "epoch": 0.09247448979591837, "grad_norm": 0.626594993813998, "learning_rate": 9.947487450399196e-06, "loss": 0.30313475131988527, "num_input_tokens_seen": 43664912, "step": 725, "train_runtime": 9327.0004, "train_tokens_per_second": 4681.56 }, { "epoch": 0.09311224489795919, "grad_norm": 0.6088546257040371, "learning_rate": 9.946760928760419e-06, "loss": 0.32722713947296145, "num_input_tokens_seen": 43950432, "step": 730, "train_runtime": 9380.4369, "train_tokens_per_second": 4685.329 }, { "epoch": 0.09375, "grad_norm": 0.719430601296753, "learning_rate": 9.946029442701572e-06, "loss": 0.3238682270050049, "num_input_tokens_seen": 44237160, "step": 735, "train_runtime": 9442.7344, "train_tokens_per_second": 4684.783 }, { "epoch": 0.09438775510204081, "grad_norm": 0.6703492333647523, "learning_rate": 9.945292992956747e-06, "loss": 0.34824090003967284, "num_input_tokens_seen": 44524808, "step": 740, "train_runtime": 9516.0973, "train_tokens_per_second": 4678.894 }, { "epoch": 0.09502551020408163, "grad_norm": 0.6648986101307878, "learning_rate": 9.944551580265025e-06, "loss": 0.2878001928329468, "num_input_tokens_seen": 44819888, "step": 745, "train_runtime": 9584.2294, "train_tokens_per_second": 4676.421 }, { "epoch": 0.09566326530612244, "grad_norm": 0.6265596220483821, "learning_rate": 9.943805205370467e-06, "loss": 0.29811065196990966, "num_input_tokens_seen": 45111088, "step": 750, "train_runtime": 9646.616, "train_tokens_per_second": 4676.364 }, { "epoch": 0.09630102040816327, "grad_norm": 0.6369850036746705, "learning_rate": 9.94305386902211e-06, "loss": 0.3029534339904785, "num_input_tokens_seen": 45396712, "step": 755, "train_runtime": 9706.4685, "train_tokens_per_second": 4676.955 }, { "epoch": 0.09693877551020408, "grad_norm": 0.7009399437487792, "learning_rate": 9.942297571973973e-06, "loss": 0.31508803367614746, "num_input_tokens_seen": 45704072, "step": 760, "train_runtime": 9766.4704, "train_tokens_per_second": 4679.692 }, { "epoch": 0.0975765306122449, "grad_norm": 0.6732654773954694, "learning_rate": 9.941536314985054e-06, "loss": 0.3145891666412354, "num_input_tokens_seen": 46011488, "step": 765, "train_runtime": 9844.4757, "train_tokens_per_second": 4673.838 }, { "epoch": 0.09821428571428571, "grad_norm": 0.6714319811854066, "learning_rate": 9.940770098819329e-06, "loss": 0.2932924747467041, "num_input_tokens_seen": 46308584, "step": 770, "train_runtime": 9906.462, "train_tokens_per_second": 4674.584 }, { "epoch": 0.09885204081632654, "grad_norm": 0.5948171857193486, "learning_rate": 9.939998924245742e-06, "loss": 0.3305630683898926, "num_input_tokens_seen": 46611024, "step": 775, "train_runtime": 9969.1515, "train_tokens_per_second": 4675.526 }, { "epoch": 0.09948979591836735, "grad_norm": 0.6881406977355818, "learning_rate": 9.93922279203823e-06, "loss": 0.31389031410217283, "num_input_tokens_seen": 46910264, "step": 780, "train_runtime": 10022.2978, "train_tokens_per_second": 4680.59 }, { "epoch": 0.10012755102040816, "grad_norm": 0.7115771502207534, "learning_rate": 9.938441702975689e-06, "loss": 0.30338244438171386, "num_input_tokens_seen": 47206432, "step": 785, "train_runtime": 10089.0775, "train_tokens_per_second": 4678.964 }, { "epoch": 0.10076530612244898, "grad_norm": 0.6640895019101406, "learning_rate": 9.937655657842001e-06, "loss": 0.31490967273712156, "num_input_tokens_seen": 47499424, "step": 790, "train_runtime": 10146.8944, "train_tokens_per_second": 4681.179 }, { "epoch": 0.10140306122448979, "grad_norm": 0.6623807327573633, "learning_rate": 9.936864657426014e-06, "loss": 0.31421527862548826, "num_input_tokens_seen": 47796664, "step": 795, "train_runtime": 10219.13, "train_tokens_per_second": 4677.175 }, { "epoch": 0.10204081632653061, "grad_norm": 0.661257226744512, "learning_rate": 9.936068702521553e-06, "loss": 0.341552734375, "num_input_tokens_seen": 48091408, "step": 800, "train_runtime": 10277.118, "train_tokens_per_second": 4679.464 }, { "epoch": 0.10267857142857142, "grad_norm": 0.7209962136089281, "learning_rate": 9.935267793927416e-06, "loss": 0.32032017707824706, "num_input_tokens_seen": 48390784, "step": 805, "train_runtime": 10354.1699, "train_tokens_per_second": 4673.555 }, { "epoch": 0.10331632653061225, "grad_norm": 0.5488066440785075, "learning_rate": 9.93446193244737e-06, "loss": 0.3139784336090088, "num_input_tokens_seen": 48696176, "step": 810, "train_runtime": 10406.7942, "train_tokens_per_second": 4679.268 }, { "epoch": 0.10395408163265306, "grad_norm": 0.544898948943717, "learning_rate": 9.933651118890151e-06, "loss": 0.2795098781585693, "num_input_tokens_seen": 49003600, "step": 815, "train_runtime": 10468.8302, "train_tokens_per_second": 4680.905 }, { "epoch": 0.10459183673469388, "grad_norm": 0.6187756471207275, "learning_rate": 9.93283535406947e-06, "loss": 0.32117714881896975, "num_input_tokens_seen": 49303792, "step": 820, "train_runtime": 10539.9136, "train_tokens_per_second": 4677.817 }, { "epoch": 0.10522959183673469, "grad_norm": 0.5417719818828942, "learning_rate": 9.932014638804001e-06, "loss": 0.3011282444000244, "num_input_tokens_seen": 49597720, "step": 825, "train_runtime": 10611.7683, "train_tokens_per_second": 4673.841 }, { "epoch": 0.10586734693877552, "grad_norm": 0.5866159331507957, "learning_rate": 9.931188973917393e-06, "loss": 0.3179909706115723, "num_input_tokens_seen": 49904016, "step": 830, "train_runtime": 10678.652, "train_tokens_per_second": 4673.251 }, { "epoch": 0.10650510204081633, "grad_norm": 0.6378722878023269, "learning_rate": 9.930358360238255e-06, "loss": 0.3088613271713257, "num_input_tokens_seen": 50207048, "step": 835, "train_runtime": 10742.1626, "train_tokens_per_second": 4673.831 }, { "epoch": 0.10714285714285714, "grad_norm": 0.5956580159604341, "learning_rate": 9.929522798600168e-06, "loss": 0.3251255989074707, "num_input_tokens_seen": 50507064, "step": 840, "train_runtime": 10808.9908, "train_tokens_per_second": 4672.69 }, { "epoch": 0.10778061224489796, "grad_norm": 0.5592604343521482, "learning_rate": 9.928682289841674e-06, "loss": 0.29808411598205564, "num_input_tokens_seen": 50799800, "step": 845, "train_runtime": 10867.1029, "train_tokens_per_second": 4674.641 }, { "epoch": 0.10841836734693877, "grad_norm": 0.6821118302048432, "learning_rate": 9.927836834806284e-06, "loss": 0.31413898468017576, "num_input_tokens_seen": 51109008, "step": 850, "train_runtime": 10928.4495, "train_tokens_per_second": 4676.693 }, { "epoch": 0.1090561224489796, "grad_norm": 0.6112797837438632, "learning_rate": 9.926986434342471e-06, "loss": 0.33620872497558596, "num_input_tokens_seen": 51419856, "step": 855, "train_runtime": 10977.6527, "train_tokens_per_second": 4684.048 }, { "epoch": 0.1096938775510204, "grad_norm": 0.6965902197834406, "learning_rate": 9.926131089303672e-06, "loss": 0.32804648876190184, "num_input_tokens_seen": 51718856, "step": 860, "train_runtime": 11045.6007, "train_tokens_per_second": 4682.304 }, { "epoch": 0.11033163265306123, "grad_norm": 0.5922989265164307, "learning_rate": 9.925270800548285e-06, "loss": 0.2920385360717773, "num_input_tokens_seen": 52001312, "step": 865, "train_runtime": 11110.6562, "train_tokens_per_second": 4680.31 }, { "epoch": 0.11096938775510204, "grad_norm": 0.5552690111657114, "learning_rate": 9.924405568939667e-06, "loss": 0.2939499616622925, "num_input_tokens_seen": 52289960, "step": 870, "train_runtime": 11167.8448, "train_tokens_per_second": 4682.189 }, { "epoch": 0.11160714285714286, "grad_norm": 0.7357628357379227, "learning_rate": 9.923535395346145e-06, "loss": 0.31589181423187257, "num_input_tokens_seen": 52579872, "step": 875, "train_runtime": 11232.4079, "train_tokens_per_second": 4681.086 }, { "epoch": 0.11224489795918367, "grad_norm": 0.7322803384441785, "learning_rate": 9.92266028064099e-06, "loss": 0.31965022087097167, "num_input_tokens_seen": 52881552, "step": 880, "train_runtime": 11301.1359, "train_tokens_per_second": 4679.313 }, { "epoch": 0.11288265306122448, "grad_norm": 0.68574343125282, "learning_rate": 9.921780225702448e-06, "loss": 0.32580366134643557, "num_input_tokens_seen": 53180168, "step": 885, "train_runtime": 11360.1319, "train_tokens_per_second": 4681.298 }, { "epoch": 0.11352040816326531, "grad_norm": 0.626630658179409, "learning_rate": 9.920895231413714e-06, "loss": 0.31912999153137206, "num_input_tokens_seen": 53479400, "step": 890, "train_runtime": 11427.9244, "train_tokens_per_second": 4679.712 }, { "epoch": 0.11415816326530612, "grad_norm": 0.6308652018383727, "learning_rate": 9.92000529866294e-06, "loss": 0.2981255054473877, "num_input_tokens_seen": 53757944, "step": 895, "train_runtime": 11488.6682, "train_tokens_per_second": 4679.215 }, { "epoch": 0.11479591836734694, "grad_norm": 0.5792513572099894, "learning_rate": 9.919110428343235e-06, "loss": 0.336773419380188, "num_input_tokens_seen": 54073360, "step": 900, "train_runtime": 11549.696, "train_tokens_per_second": 4681.799 }, { "epoch": 0.11543367346938775, "grad_norm": 0.5578804162195902, "learning_rate": 9.918210621352667e-06, "loss": 0.29676618576049807, "num_input_tokens_seen": 54382992, "step": 905, "train_runtime": 11615.1619, "train_tokens_per_second": 4682.069 }, { "epoch": 0.11607142857142858, "grad_norm": 0.5825139503867761, "learning_rate": 9.917305878594251e-06, "loss": 0.3137337684631348, "num_input_tokens_seen": 54688480, "step": 910, "train_runtime": 11690.9802, "train_tokens_per_second": 4677.835 }, { "epoch": 0.11670918367346939, "grad_norm": 0.6405537860326604, "learning_rate": 9.916396200975966e-06, "loss": 0.3228217840194702, "num_input_tokens_seen": 54978288, "step": 915, "train_runtime": 11758.4874, "train_tokens_per_second": 4675.626 }, { "epoch": 0.11734693877551021, "grad_norm": 0.6152578874032614, "learning_rate": 9.91548158941073e-06, "loss": 0.3395294189453125, "num_input_tokens_seen": 55269312, "step": 920, "train_runtime": 11826.8238, "train_tokens_per_second": 4673.217 }, { "epoch": 0.11798469387755102, "grad_norm": 0.5712778569213676, "learning_rate": 9.914562044816424e-06, "loss": 0.3318194389343262, "num_input_tokens_seen": 55567456, "step": 925, "train_runtime": 11892.7035, "train_tokens_per_second": 4672.399 }, { "epoch": 0.11862244897959184, "grad_norm": 0.5973264820162346, "learning_rate": 9.913637568115873e-06, "loss": 0.3069302082061768, "num_input_tokens_seen": 55862328, "step": 930, "train_runtime": 11955.3605, "train_tokens_per_second": 4672.576 }, { "epoch": 0.11926020408163265, "grad_norm": 0.5917702718278268, "learning_rate": 9.912708160236854e-06, "loss": 0.2973860502243042, "num_input_tokens_seen": 56176552, "step": 935, "train_runtime": 12021.9816, "train_tokens_per_second": 4672.82 }, { "epoch": 0.11989795918367346, "grad_norm": 0.5914721778462996, "learning_rate": 9.911773822112094e-06, "loss": 0.31302266120910643, "num_input_tokens_seen": 56476512, "step": 940, "train_runtime": 12080.7884, "train_tokens_per_second": 4674.903 }, { "epoch": 0.12053571428571429, "grad_norm": 0.5599367349904536, "learning_rate": 9.910834554679266e-06, "loss": 0.298633337020874, "num_input_tokens_seen": 56778048, "step": 945, "train_runtime": 12133.4272, "train_tokens_per_second": 4679.473 }, { "epoch": 0.1211734693877551, "grad_norm": 0.6253758896492649, "learning_rate": 9.909890358880991e-06, "loss": 0.34549541473388673, "num_input_tokens_seen": 57088192, "step": 950, "train_runtime": 12184.659, "train_tokens_per_second": 4685.252 }, { "epoch": 0.12181122448979592, "grad_norm": 0.6700044937088339, "learning_rate": 9.908941235664835e-06, "loss": 0.3271981716156006, "num_input_tokens_seen": 57380160, "step": 955, "train_runtime": 12244.7229, "train_tokens_per_second": 4686.113 }, { "epoch": 0.12244897959183673, "grad_norm": 0.6511179079267093, "learning_rate": 9.907987185983307e-06, "loss": 0.30856757164001464, "num_input_tokens_seen": 57671608, "step": 960, "train_runtime": 12312.6788, "train_tokens_per_second": 4683.92 }, { "epoch": 0.12308673469387756, "grad_norm": 0.6347264543032678, "learning_rate": 9.907028210793868e-06, "loss": 0.3388669490814209, "num_input_tokens_seen": 57988552, "step": 965, "train_runtime": 12375.9362, "train_tokens_per_second": 4685.589 }, { "epoch": 0.12372448979591837, "grad_norm": 0.6987486238581951, "learning_rate": 9.906064311058911e-06, "loss": 0.35554654598236085, "num_input_tokens_seen": 58296672, "step": 970, "train_runtime": 12436.9652, "train_tokens_per_second": 4687.371 }, { "epoch": 0.12436224489795919, "grad_norm": 0.6107891338604124, "learning_rate": 9.90509548774578e-06, "loss": 0.2888030052185059, "num_input_tokens_seen": 58608296, "step": 975, "train_runtime": 12498.8867, "train_tokens_per_second": 4689.081 }, { "epoch": 0.125, "grad_norm": 0.6392507862116199, "learning_rate": 9.904121741826757e-06, "loss": 0.3465890884399414, "num_input_tokens_seen": 58903200, "step": 980, "train_runtime": 12567.6865, "train_tokens_per_second": 4686.877 }, { "epoch": 0.1256377551020408, "grad_norm": 0.6406840589093801, "learning_rate": 9.903143074279061e-06, "loss": 0.3300570249557495, "num_input_tokens_seen": 59205872, "step": 985, "train_runtime": 12636.9273, "train_tokens_per_second": 4685.148 }, { "epoch": 0.12627551020408162, "grad_norm": 0.5817406031322423, "learning_rate": 9.902159486084857e-06, "loss": 0.3436952829360962, "num_input_tokens_seen": 59501888, "step": 990, "train_runtime": 12708.2782, "train_tokens_per_second": 4682.136 }, { "epoch": 0.12691326530612246, "grad_norm": 0.5604581561085965, "learning_rate": 9.90117097823124e-06, "loss": 0.3070975780487061, "num_input_tokens_seen": 59793520, "step": 995, "train_runtime": 12767.709, "train_tokens_per_second": 4683.183 }, { "epoch": 0.12755102040816327, "grad_norm": 0.5731625321807637, "learning_rate": 9.900177551710252e-06, "loss": 0.30677595138549807, "num_input_tokens_seen": 60096304, "step": 1000, "train_runtime": 12833.3771, "train_tokens_per_second": 4682.813 }, { "epoch": 0.12818877551020408, "grad_norm": 0.7803286085707585, "learning_rate": 9.899179207518863e-06, "loss": 0.3457111597061157, "num_input_tokens_seen": 60401392, "step": 1005, "train_runtime": 12896.7323, "train_tokens_per_second": 4683.465 }, { "epoch": 0.1288265306122449, "grad_norm": 0.7006445386826811, "learning_rate": 9.89817594665898e-06, "loss": 0.3316737174987793, "num_input_tokens_seen": 60692632, "step": 1010, "train_runtime": 12970.2757, "train_tokens_per_second": 4679.363 }, { "epoch": 0.12946428571428573, "grad_norm": 0.5850857329875174, "learning_rate": 9.897167770137449e-06, "loss": 0.3376582145690918, "num_input_tokens_seen": 60990224, "step": 1015, "train_runtime": 13022.514, "train_tokens_per_second": 4683.445 }, { "epoch": 0.13010204081632654, "grad_norm": 0.5877881119871815, "learning_rate": 9.89615467896604e-06, "loss": 0.31652557849884033, "num_input_tokens_seen": 61282832, "step": 1020, "train_runtime": 13086.7786, "train_tokens_per_second": 4682.805 }, { "epoch": 0.13073979591836735, "grad_norm": 0.6350167715825561, "learning_rate": 9.895136674161466e-06, "loss": 0.36972153186798096, "num_input_tokens_seen": 61579128, "step": 1025, "train_runtime": 13146.4427, "train_tokens_per_second": 4684.091 }, { "epoch": 0.13137755102040816, "grad_norm": 0.6478268207128107, "learning_rate": 9.894113756745362e-06, "loss": 0.34624972343444826, "num_input_tokens_seen": 61888048, "step": 1030, "train_runtime": 13207.1108, "train_tokens_per_second": 4685.964 }, { "epoch": 0.13201530612244897, "grad_norm": 0.643687752492837, "learning_rate": 9.893085927744302e-06, "loss": 0.31321775913238525, "num_input_tokens_seen": 62182464, "step": 1035, "train_runtime": 13281.3897, "train_tokens_per_second": 4681.925 }, { "epoch": 0.1326530612244898, "grad_norm": 0.7749921845531136, "learning_rate": 9.892053188189778e-06, "loss": 0.3312078475952148, "num_input_tokens_seen": 62481672, "step": 1040, "train_runtime": 13341.1358, "train_tokens_per_second": 4683.385 }, { "epoch": 0.13329081632653061, "grad_norm": 0.6176461633030148, "learning_rate": 9.89101553911822e-06, "loss": 0.33130059242248533, "num_input_tokens_seen": 62770304, "step": 1045, "train_runtime": 13398.0925, "train_tokens_per_second": 4685.018 }, { "epoch": 0.13392857142857142, "grad_norm": 0.5640493570474314, "learning_rate": 9.889972981570984e-06, "loss": 0.34102232456207277, "num_input_tokens_seen": 63079128, "step": 1050, "train_runtime": 13453.0172, "train_tokens_per_second": 4688.846 }, { "epoch": 0.13456632653061223, "grad_norm": 0.6098806851952427, "learning_rate": 9.888925516594344e-06, "loss": 0.31255135536193845, "num_input_tokens_seen": 63374288, "step": 1055, "train_runtime": 13520.5802, "train_tokens_per_second": 4687.246 }, { "epoch": 0.13520408163265307, "grad_norm": 0.6016838976343992, "learning_rate": 9.887873145239505e-06, "loss": 0.32413506507873535, "num_input_tokens_seen": 63685544, "step": 1060, "train_runtime": 13583.1412, "train_tokens_per_second": 4688.573 }, { "epoch": 0.13584183673469388, "grad_norm": 0.6974335096565114, "learning_rate": 9.886815868562596e-06, "loss": 0.3247077226638794, "num_input_tokens_seen": 63985992, "step": 1065, "train_runtime": 13641.8081, "train_tokens_per_second": 4690.433 }, { "epoch": 0.1364795918367347, "grad_norm": 0.5503294330866604, "learning_rate": 9.885753687624671e-06, "loss": 0.32499494552612307, "num_input_tokens_seen": 64290784, "step": 1070, "train_runtime": 13708.5892, "train_tokens_per_second": 4689.818 }, { "epoch": 0.1371173469387755, "grad_norm": 0.5497811927600912, "learning_rate": 9.884686603491697e-06, "loss": 0.30507540702819824, "num_input_tokens_seen": 64580560, "step": 1075, "train_runtime": 13774.1678, "train_tokens_per_second": 4688.527 }, { "epoch": 0.1377551020408163, "grad_norm": 0.7370277106298851, "learning_rate": 9.883614617234574e-06, "loss": 0.31615376472473145, "num_input_tokens_seen": 64887752, "step": 1080, "train_runtime": 13843.7194, "train_tokens_per_second": 4687.162 }, { "epoch": 0.13839285714285715, "grad_norm": 0.5747869854992422, "learning_rate": 9.882537729929111e-06, "loss": 0.31842334270477296, "num_input_tokens_seen": 65177312, "step": 1085, "train_runtime": 13900.8839, "train_tokens_per_second": 4688.717 }, { "epoch": 0.13903061224489796, "grad_norm": 0.5994241942474536, "learning_rate": 9.88145594265604e-06, "loss": 0.33463475704193113, "num_input_tokens_seen": 65477552, "step": 1090, "train_runtime": 13957.0563, "train_tokens_per_second": 4691.358 }, { "epoch": 0.13966836734693877, "grad_norm": 0.5350594766885293, "learning_rate": 9.880369256501009e-06, "loss": 0.32270474433898927, "num_input_tokens_seen": 65773704, "step": 1095, "train_runtime": 14020.0614, "train_tokens_per_second": 4691.399 }, { "epoch": 0.14030612244897958, "grad_norm": 0.5856356402792805, "learning_rate": 9.879277672554586e-06, "loss": 0.3453704357147217, "num_input_tokens_seen": 66078288, "step": 1100, "train_runtime": 14092.98, "train_tokens_per_second": 4688.738 }, { "epoch": 0.14094387755102042, "grad_norm": 0.7066698779118917, "learning_rate": 9.878181191912251e-06, "loss": 0.342348051071167, "num_input_tokens_seen": 66389960, "step": 1105, "train_runtime": 14148.192, "train_tokens_per_second": 4692.47 }, { "epoch": 0.14158163265306123, "grad_norm": 0.6732728396315365, "learning_rate": 9.877079815674397e-06, "loss": 0.336626935005188, "num_input_tokens_seen": 66687024, "step": 1110, "train_runtime": 14215.1781, "train_tokens_per_second": 4691.255 }, { "epoch": 0.14221938775510204, "grad_norm": 0.6253707519183908, "learning_rate": 9.875973544946335e-06, "loss": 0.3181014060974121, "num_input_tokens_seen": 66992032, "step": 1115, "train_runtime": 14286.1982, "train_tokens_per_second": 4689.283 }, { "epoch": 0.14285714285714285, "grad_norm": 0.6049025984710364, "learning_rate": 9.874862380838284e-06, "loss": 0.3243386745452881, "num_input_tokens_seen": 67301344, "step": 1120, "train_runtime": 14357.9471, "train_tokens_per_second": 4687.393 }, { "epoch": 0.1434948979591837, "grad_norm": 0.581962219439854, "learning_rate": 9.873746324465372e-06, "loss": 0.32609100341796876, "num_input_tokens_seen": 67605624, "step": 1125, "train_runtime": 14425.1262, "train_tokens_per_second": 4686.657 }, { "epoch": 0.1441326530612245, "grad_norm": 0.6891948701654147, "learning_rate": 9.872625376947642e-06, "loss": 0.36863346099853517, "num_input_tokens_seen": 67914000, "step": 1130, "train_runtime": 14489.5411, "train_tokens_per_second": 4687.105 }, { "epoch": 0.1447704081632653, "grad_norm": 0.6585553967582634, "learning_rate": 9.871499539410045e-06, "loss": 0.336389422416687, "num_input_tokens_seen": 68208728, "step": 1135, "train_runtime": 14551.1305, "train_tokens_per_second": 4687.521 }, { "epoch": 0.14540816326530612, "grad_norm": 0.6240599879124094, "learning_rate": 9.870368812982433e-06, "loss": 0.3170750379562378, "num_input_tokens_seen": 68503840, "step": 1140, "train_runtime": 14623.6933, "train_tokens_per_second": 4684.442 }, { "epoch": 0.14604591836734693, "grad_norm": 0.6363383880401341, "learning_rate": 9.869233198799572e-06, "loss": 0.3022523164749146, "num_input_tokens_seen": 68794536, "step": 1145, "train_runtime": 14683.4451, "train_tokens_per_second": 4685.177 }, { "epoch": 0.14668367346938777, "grad_norm": 0.5788965255735574, "learning_rate": 9.86809269800113e-06, "loss": 0.3102893829345703, "num_input_tokens_seen": 69097584, "step": 1150, "train_runtime": 14746.5166, "train_tokens_per_second": 4685.689 }, { "epoch": 0.14732142857142858, "grad_norm": 0.540792417537845, "learning_rate": 9.86694731173168e-06, "loss": 0.3258485794067383, "num_input_tokens_seen": 69400448, "step": 1155, "train_runtime": 14823.6477, "train_tokens_per_second": 4681.739 }, { "epoch": 0.14795918367346939, "grad_norm": 0.6371755914466374, "learning_rate": 9.865797041140695e-06, "loss": 0.3410828113555908, "num_input_tokens_seen": 69694432, "step": 1160, "train_runtime": 14898.2847, "train_tokens_per_second": 4678.017 }, { "epoch": 0.1485969387755102, "grad_norm": 0.6907737129507281, "learning_rate": 9.864641887382552e-06, "loss": 0.3313009262084961, "num_input_tokens_seen": 70000464, "step": 1165, "train_runtime": 14973.2259, "train_tokens_per_second": 4675.042 }, { "epoch": 0.14923469387755103, "grad_norm": 0.645599339462072, "learning_rate": 9.863481851616528e-06, "loss": 0.33059353828430177, "num_input_tokens_seen": 70291160, "step": 1170, "train_runtime": 15041.846, "train_tokens_per_second": 4673.041 }, { "epoch": 0.14987244897959184, "grad_norm": 0.6778562215219686, "learning_rate": 9.862316935006803e-06, "loss": 0.34509251117706297, "num_input_tokens_seen": 70595328, "step": 1175, "train_runtime": 15107.0039, "train_tokens_per_second": 4673.02 }, { "epoch": 0.15051020408163265, "grad_norm": 0.5947368297067033, "learning_rate": 9.86114713872245e-06, "loss": 0.3179985523223877, "num_input_tokens_seen": 70891792, "step": 1180, "train_runtime": 15179.6228, "train_tokens_per_second": 4670.195 }, { "epoch": 0.15114795918367346, "grad_norm": 0.639355512325466, "learning_rate": 9.85997246393744e-06, "loss": 0.2997492551803589, "num_input_tokens_seen": 71187232, "step": 1185, "train_runtime": 15243.6794, "train_tokens_per_second": 4669.951 }, { "epoch": 0.15178571428571427, "grad_norm": 0.5952671858659276, "learning_rate": 9.858792911830643e-06, "loss": 0.3210294246673584, "num_input_tokens_seen": 71495592, "step": 1190, "train_runtime": 15310.89, "train_tokens_per_second": 4669.591 }, { "epoch": 0.1524234693877551, "grad_norm": 0.5932781344053283, "learning_rate": 9.857608483585823e-06, "loss": 0.32401361465454104, "num_input_tokens_seen": 71815632, "step": 1195, "train_runtime": 15374.9978, "train_tokens_per_second": 4670.936 }, { "epoch": 0.15306122448979592, "grad_norm": 0.513803869774437, "learning_rate": 9.856419180391636e-06, "loss": 0.2997368097305298, "num_input_tokens_seen": 72127616, "step": 1200, "train_runtime": 15437.5576, "train_tokens_per_second": 4672.217 }, { "epoch": 0.15369897959183673, "grad_norm": 0.6406041180556482, "learning_rate": 9.855225003441629e-06, "loss": 0.3473092555999756, "num_input_tokens_seen": 72438664, "step": 1205, "train_runtime": 15502.8818, "train_tokens_per_second": 4672.593 }, { "epoch": 0.15433673469387754, "grad_norm": 0.6204091343286625, "learning_rate": 9.85402595393424e-06, "loss": 0.3153236865997314, "num_input_tokens_seen": 72724400, "step": 1210, "train_runtime": 15570.96, "train_tokens_per_second": 4670.515 }, { "epoch": 0.15497448979591838, "grad_norm": 0.6226101352218131, "learning_rate": 9.852822033072805e-06, "loss": 0.33648636341094973, "num_input_tokens_seen": 73022520, "step": 1215, "train_runtime": 15638.4136, "train_tokens_per_second": 4669.433 }, { "epoch": 0.1556122448979592, "grad_norm": 0.616337565200306, "learning_rate": 9.85161324206554e-06, "loss": 0.3274383544921875, "num_input_tokens_seen": 73330568, "step": 1220, "train_runtime": 15700.4452, "train_tokens_per_second": 4670.604 }, { "epoch": 0.15625, "grad_norm": 0.5865853821331624, "learning_rate": 9.850399582125548e-06, "loss": 0.3142099857330322, "num_input_tokens_seen": 73637840, "step": 1225, "train_runtime": 15757.748, "train_tokens_per_second": 4673.12 }, { "epoch": 0.1568877551020408, "grad_norm": 0.6033716859627452, "learning_rate": 9.849181054470827e-06, "loss": 0.30474565029144285, "num_input_tokens_seen": 73923712, "step": 1230, "train_runtime": 15822.0851, "train_tokens_per_second": 4672.185 }, { "epoch": 0.15752551020408162, "grad_norm": 0.5910514385779135, "learning_rate": 9.84795766032425e-06, "loss": 0.314410138130188, "num_input_tokens_seen": 74208384, "step": 1235, "train_runtime": 15882.1475, "train_tokens_per_second": 4672.44 }, { "epoch": 0.15816326530612246, "grad_norm": 0.749622008061032, "learning_rate": 9.84672940091358e-06, "loss": 0.3144389629364014, "num_input_tokens_seen": 74496304, "step": 1240, "train_runtime": 15950.3528, "train_tokens_per_second": 4670.511 }, { "epoch": 0.15880102040816327, "grad_norm": 0.6930546014040261, "learning_rate": 9.845496277471463e-06, "loss": 0.3085564136505127, "num_input_tokens_seen": 74781656, "step": 1245, "train_runtime": 16018.7634, "train_tokens_per_second": 4668.379 }, { "epoch": 0.15943877551020408, "grad_norm": 0.5848372027862598, "learning_rate": 9.84425829123542e-06, "loss": 0.3176731109619141, "num_input_tokens_seen": 75095368, "step": 1250, "train_runtime": 16084.6142, "train_tokens_per_second": 4668.77 }, { "epoch": 0.1600765306122449, "grad_norm": 1.5703473449110465, "learning_rate": 9.84301544344786e-06, "loss": 0.33735177516937254, "num_input_tokens_seen": 75394808, "step": 1255, "train_runtime": 16144.4235, "train_tokens_per_second": 4670.022 }, { "epoch": 0.16071428571428573, "grad_norm": 0.5655628998642258, "learning_rate": 9.841767735356069e-06, "loss": 0.29922213554382326, "num_input_tokens_seen": 75696816, "step": 1260, "train_runtime": 16213.9234, "train_tokens_per_second": 4668.63 }, { "epoch": 0.16135204081632654, "grad_norm": 0.5468474890427991, "learning_rate": 9.840515168212208e-06, "loss": 0.3142865180969238, "num_input_tokens_seen": 75997032, "step": 1265, "train_runtime": 16269.2171, "train_tokens_per_second": 4671.216 }, { "epoch": 0.16198979591836735, "grad_norm": 0.6977623447232346, "learning_rate": 9.839257743273313e-06, "loss": 0.3169466495513916, "num_input_tokens_seen": 76306232, "step": 1270, "train_runtime": 16336.5091, "train_tokens_per_second": 4670.902 }, { "epoch": 0.16262755102040816, "grad_norm": 0.6307116574118067, "learning_rate": 9.8379954618013e-06, "loss": 0.3264782905578613, "num_input_tokens_seen": 76616680, "step": 1275, "train_runtime": 16403.3467, "train_tokens_per_second": 4670.796 }, { "epoch": 0.16326530612244897, "grad_norm": 0.6481160726385983, "learning_rate": 9.836728325062956e-06, "loss": 0.32020001411437987, "num_input_tokens_seen": 76911192, "step": 1280, "train_runtime": 16466.5796, "train_tokens_per_second": 4670.745 }, { "epoch": 0.1639030612244898, "grad_norm": 0.6260219252872821, "learning_rate": 9.83545633432994e-06, "loss": 0.3197026252746582, "num_input_tokens_seen": 77213144, "step": 1285, "train_runtime": 16538.6986, "train_tokens_per_second": 4668.635 }, { "epoch": 0.16454081632653061, "grad_norm": 0.6061939398138922, "learning_rate": 9.834179490878789e-06, "loss": 0.32415170669555665, "num_input_tokens_seen": 77511552, "step": 1290, "train_runtime": 16608.3086, "train_tokens_per_second": 4667.035 }, { "epoch": 0.16517857142857142, "grad_norm": 0.624518323832078, "learning_rate": 9.832897795990896e-06, "loss": 0.3314162254333496, "num_input_tokens_seen": 77819352, "step": 1295, "train_runtime": 16670.9625, "train_tokens_per_second": 4667.958 }, { "epoch": 0.16581632653061223, "grad_norm": 0.6035466373238898, "learning_rate": 9.83161125095254e-06, "loss": 0.3390120267868042, "num_input_tokens_seen": 78124624, "step": 1300, "train_runtime": 16722.1329, "train_tokens_per_second": 4671.929 }, { "epoch": 0.16645408163265307, "grad_norm": 0.604635713790092, "learning_rate": 9.830319857054853e-06, "loss": 0.32261736392974855, "num_input_tokens_seen": 78425016, "step": 1305, "train_runtime": 16782.9521, "train_tokens_per_second": 4672.898 }, { "epoch": 0.16709183673469388, "grad_norm": 0.6308378582995104, "learning_rate": 9.82902361559384e-06, "loss": 0.3400526523590088, "num_input_tokens_seen": 78725448, "step": 1310, "train_runtime": 16845.0134, "train_tokens_per_second": 4673.517 }, { "epoch": 0.1677295918367347, "grad_norm": 0.6775668307882584, "learning_rate": 9.82772252787037e-06, "loss": 0.32093000411987305, "num_input_tokens_seen": 79019432, "step": 1315, "train_runtime": 16898.2536, "train_tokens_per_second": 4676.189 }, { "epoch": 0.1683673469387755, "grad_norm": 0.7150284876508191, "learning_rate": 9.826416595190177e-06, "loss": 0.32538139820098877, "num_input_tokens_seen": 79302880, "step": 1320, "train_runtime": 16960.6423, "train_tokens_per_second": 4675.7 }, { "epoch": 0.1690051020408163, "grad_norm": 0.6080349805720094, "learning_rate": 9.825105818863854e-06, "loss": 0.2659433603286743, "num_input_tokens_seen": 79609552, "step": 1325, "train_runtime": 17024.5507, "train_tokens_per_second": 4676.162 }, { "epoch": 0.16964285714285715, "grad_norm": 0.6644582121488926, "learning_rate": 9.823790200206857e-06, "loss": 0.35074310302734374, "num_input_tokens_seen": 79911872, "step": 1330, "train_runtime": 17091.2088, "train_tokens_per_second": 4675.613 }, { "epoch": 0.17028061224489796, "grad_norm": 0.5988993982839885, "learning_rate": 9.822469740539503e-06, "loss": 0.3313178539276123, "num_input_tokens_seen": 80214880, "step": 1335, "train_runtime": 17152.7302, "train_tokens_per_second": 4676.508 }, { "epoch": 0.17091836734693877, "grad_norm": 0.6734717878509392, "learning_rate": 9.821144441186964e-06, "loss": 0.29335453510284426, "num_input_tokens_seen": 80505568, "step": 1340, "train_runtime": 17220.5566, "train_tokens_per_second": 4674.969 }, { "epoch": 0.17155612244897958, "grad_norm": 0.7450898696825456, "learning_rate": 9.819814303479268e-06, "loss": 0.3468411922454834, "num_input_tokens_seen": 80798056, "step": 1345, "train_runtime": 17275.7965, "train_tokens_per_second": 4676.951 }, { "epoch": 0.17219387755102042, "grad_norm": 0.6193250292674742, "learning_rate": 9.818479328751303e-06, "loss": 0.3229133129119873, "num_input_tokens_seen": 81077272, "step": 1350, "train_runtime": 17338.1589, "train_tokens_per_second": 4676.233 }, { "epoch": 0.17283163265306123, "grad_norm": 0.5734338838942346, "learning_rate": 9.817139518342811e-06, "loss": 0.34751739501953127, "num_input_tokens_seen": 81381760, "step": 1355, "train_runtime": 17404.5748, "train_tokens_per_second": 4675.883 }, { "epoch": 0.17346938775510204, "grad_norm": 0.598503096145298, "learning_rate": 9.815794873598384e-06, "loss": 0.32517199516296386, "num_input_tokens_seen": 81689296, "step": 1360, "train_runtime": 17468.4889, "train_tokens_per_second": 4676.38 }, { "epoch": 0.17410714285714285, "grad_norm": 0.5786479595145131, "learning_rate": 9.814445395867467e-06, "loss": 0.32674236297607423, "num_input_tokens_seen": 81993936, "step": 1365, "train_runtime": 17535.8677, "train_tokens_per_second": 4675.784 }, { "epoch": 0.1747448979591837, "grad_norm": 0.6426414968956544, "learning_rate": 9.813091086504356e-06, "loss": 0.33481631278991697, "num_input_tokens_seen": 82291264, "step": 1370, "train_runtime": 17598.9769, "train_tokens_per_second": 4675.912 }, { "epoch": 0.1753826530612245, "grad_norm": 0.6772863683681803, "learning_rate": 9.811731946868192e-06, "loss": 0.3312889575958252, "num_input_tokens_seen": 82576648, "step": 1375, "train_runtime": 17674.1013, "train_tokens_per_second": 4672.184 }, { "epoch": 0.1760204081632653, "grad_norm": 0.6183891713769821, "learning_rate": 9.810367978322971e-06, "loss": 0.32770624160766604, "num_input_tokens_seen": 82855264, "step": 1380, "train_runtime": 17739.7033, "train_tokens_per_second": 4670.612 }, { "epoch": 0.17665816326530612, "grad_norm": 0.6743162881667827, "learning_rate": 9.808999182237527e-06, "loss": 0.32761325836181643, "num_input_tokens_seen": 83163056, "step": 1385, "train_runtime": 17809.4298, "train_tokens_per_second": 4669.608 }, { "epoch": 0.17729591836734693, "grad_norm": 0.6417615450472127, "learning_rate": 9.807625559985546e-06, "loss": 0.31441588401794435, "num_input_tokens_seen": 83459208, "step": 1390, "train_runtime": 17870.7623, "train_tokens_per_second": 4670.154 }, { "epoch": 0.17793367346938777, "grad_norm": 0.5655903433812112, "learning_rate": 9.806247112945548e-06, "loss": 0.30176577568054197, "num_input_tokens_seen": 83768232, "step": 1395, "train_runtime": 17933.5064, "train_tokens_per_second": 4671.046 }, { "epoch": 0.17857142857142858, "grad_norm": 0.6186427531608422, "learning_rate": 9.804863842500906e-06, "loss": 0.3389891147613525, "num_input_tokens_seen": 84066288, "step": 1400, "train_runtime": 17998.6148, "train_tokens_per_second": 4670.709 }, { "epoch": 0.17920918367346939, "grad_norm": 0.577582621616322, "learning_rate": 9.803475750039828e-06, "loss": 0.3311573028564453, "num_input_tokens_seen": 84367984, "step": 1405, "train_runtime": 18069.4343, "train_tokens_per_second": 4669.099 }, { "epoch": 0.1798469387755102, "grad_norm": 0.5793464491006457, "learning_rate": 9.80208283695536e-06, "loss": 0.3258392095565796, "num_input_tokens_seen": 84669608, "step": 1410, "train_runtime": 18144.4137, "train_tokens_per_second": 4666.428 }, { "epoch": 0.18048469387755103, "grad_norm": 0.576273241426476, "learning_rate": 9.80068510464539e-06, "loss": 0.3283647298812866, "num_input_tokens_seen": 84968192, "step": 1415, "train_runtime": 18218.7607, "train_tokens_per_second": 4663.775 }, { "epoch": 0.18112244897959184, "grad_norm": 0.6027961814579025, "learning_rate": 9.799282554512637e-06, "loss": 0.31317665576934817, "num_input_tokens_seen": 85267272, "step": 1420, "train_runtime": 18275.5674, "train_tokens_per_second": 4665.643 }, { "epoch": 0.18176020408163265, "grad_norm": 0.6472109682658503, "learning_rate": 9.797875187964661e-06, "loss": 0.36163792610168455, "num_input_tokens_seen": 85573528, "step": 1425, "train_runtime": 18350.5815, "train_tokens_per_second": 4663.26 }, { "epoch": 0.18239795918367346, "grad_norm": 0.6570387718669111, "learning_rate": 9.79646300641385e-06, "loss": 0.33827977180480956, "num_input_tokens_seen": 85888168, "step": 1430, "train_runtime": 18407.6843, "train_tokens_per_second": 4665.887 }, { "epoch": 0.18303571428571427, "grad_norm": 0.5915865126409967, "learning_rate": 9.795046011277427e-06, "loss": 0.2988413333892822, "num_input_tokens_seen": 86197056, "step": 1435, "train_runtime": 18484.4433, "train_tokens_per_second": 4663.222 }, { "epoch": 0.1836734693877551, "grad_norm": 0.6319044202710384, "learning_rate": 9.793624203977446e-06, "loss": 0.3205398082733154, "num_input_tokens_seen": 86495336, "step": 1440, "train_runtime": 18549.8044, "train_tokens_per_second": 4662.871 }, { "epoch": 0.18431122448979592, "grad_norm": 0.602782954776995, "learning_rate": 9.792197585940792e-06, "loss": 0.3298956871032715, "num_input_tokens_seen": 86813224, "step": 1445, "train_runtime": 18619.406, "train_tokens_per_second": 4662.513 }, { "epoch": 0.18494897959183673, "grad_norm": 0.5754024523751752, "learning_rate": 9.790766158599172e-06, "loss": 0.30818729400634765, "num_input_tokens_seen": 87113448, "step": 1450, "train_runtime": 18686.6467, "train_tokens_per_second": 4661.802 }, { "epoch": 0.18558673469387754, "grad_norm": 0.6881805944021485, "learning_rate": 9.789329923389128e-06, "loss": 0.32339422702789306, "num_input_tokens_seen": 87413584, "step": 1455, "train_runtime": 18754.1814, "train_tokens_per_second": 4661.018 }, { "epoch": 0.18622448979591838, "grad_norm": 0.6193905311957907, "learning_rate": 9.787888881752018e-06, "loss": 0.3140754699707031, "num_input_tokens_seen": 87714304, "step": 1460, "train_runtime": 18813.2731, "train_tokens_per_second": 4662.363 }, { "epoch": 0.1868622448979592, "grad_norm": 0.5697777601138168, "learning_rate": 9.78644303513403e-06, "loss": 0.32805964946746824, "num_input_tokens_seen": 88010424, "step": 1465, "train_runtime": 18884.5056, "train_tokens_per_second": 4660.457 }, { "epoch": 0.1875, "grad_norm": 0.5761455879704065, "learning_rate": 9.784992384986173e-06, "loss": 0.3325707674026489, "num_input_tokens_seen": 88312208, "step": 1470, "train_runtime": 18945.8281, "train_tokens_per_second": 4661.301 }, { "epoch": 0.1881377551020408, "grad_norm": 0.6312574029931073, "learning_rate": 9.783536932764273e-06, "loss": 0.31943345069885254, "num_input_tokens_seen": 88600744, "step": 1475, "train_runtime": 19010.9206, "train_tokens_per_second": 4660.518 }, { "epoch": 0.18877551020408162, "grad_norm": 0.5557668031229552, "learning_rate": 9.782076679928981e-06, "loss": 0.30451416969299316, "num_input_tokens_seen": 88897368, "step": 1480, "train_runtime": 19074.2654, "train_tokens_per_second": 4660.592 }, { "epoch": 0.18941326530612246, "grad_norm": 0.6064797044911235, "learning_rate": 9.78061162794576e-06, "loss": 0.3167304277420044, "num_input_tokens_seen": 89206296, "step": 1485, "train_runtime": 19135.7143, "train_tokens_per_second": 4661.77 }, { "epoch": 0.19005102040816327, "grad_norm": 0.7163669268796902, "learning_rate": 9.779141778284893e-06, "loss": 0.32610111236572265, "num_input_tokens_seen": 89519288, "step": 1490, "train_runtime": 19186.547, "train_tokens_per_second": 4665.732 }, { "epoch": 0.19068877551020408, "grad_norm": 0.6028664586912892, "learning_rate": 9.77766713242148e-06, "loss": 0.3151542663574219, "num_input_tokens_seen": 89810448, "step": 1495, "train_runtime": 19253.8342, "train_tokens_per_second": 4664.549 }, { "epoch": 0.1913265306122449, "grad_norm": 0.5932933121302334, "learning_rate": 9.776187691835424e-06, "loss": 0.3264111042022705, "num_input_tokens_seen": 90118960, "step": 1500, "train_runtime": 19328.9784, "train_tokens_per_second": 4662.376 }, { "epoch": 0.19196428571428573, "grad_norm": 0.5718879186944182, "learning_rate": 9.774703458011453e-06, "loss": 0.31701092720031737, "num_input_tokens_seen": 90423136, "step": 1505, "train_runtime": 19384.6841, "train_tokens_per_second": 4664.669 }, { "epoch": 0.19260204081632654, "grad_norm": 0.5732930244436449, "learning_rate": 9.773214432439098e-06, "loss": 0.32857470512390136, "num_input_tokens_seen": 90716256, "step": 1510, "train_runtime": 19449.9174, "train_tokens_per_second": 4664.095 }, { "epoch": 0.19323979591836735, "grad_norm": 0.6264692762177914, "learning_rate": 9.771720616612697e-06, "loss": 0.3403751373291016, "num_input_tokens_seen": 91000816, "step": 1515, "train_runtime": 19513.2349, "train_tokens_per_second": 4663.543 }, { "epoch": 0.19387755102040816, "grad_norm": 0.5879142904469583, "learning_rate": 9.770222012031404e-06, "loss": 0.3135849952697754, "num_input_tokens_seen": 91292152, "step": 1520, "train_runtime": 19588.8663, "train_tokens_per_second": 4660.41 }, { "epoch": 0.19451530612244897, "grad_norm": 0.6186807155432585, "learning_rate": 9.768718620199168e-06, "loss": 0.3122847080230713, "num_input_tokens_seen": 91584544, "step": 1525, "train_runtime": 19655.1895, "train_tokens_per_second": 4659.56 }, { "epoch": 0.1951530612244898, "grad_norm": 0.6143695774772617, "learning_rate": 9.76721044262475e-06, "loss": 0.302173376083374, "num_input_tokens_seen": 91892136, "step": 1530, "train_runtime": 19715.1758, "train_tokens_per_second": 4660.985 }, { "epoch": 0.19579081632653061, "grad_norm": 0.6423532206679058, "learning_rate": 9.765697480821714e-06, "loss": 0.32527501583099366, "num_input_tokens_seen": 92199840, "step": 1535, "train_runtime": 19771.8732, "train_tokens_per_second": 4663.182 }, { "epoch": 0.19642857142857142, "grad_norm": 0.8069967571373494, "learning_rate": 9.764179736308419e-06, "loss": 0.3400618553161621, "num_input_tokens_seen": 92513480, "step": 1540, "train_runtime": 19826.0737, "train_tokens_per_second": 4666.253 }, { "epoch": 0.19706632653061223, "grad_norm": 0.9233258986747941, "learning_rate": 9.762657210608028e-06, "loss": 0.3346916675567627, "num_input_tokens_seen": 92813864, "step": 1545, "train_runtime": 19884.5282, "train_tokens_per_second": 4667.642 }, { "epoch": 0.19770408163265307, "grad_norm": 0.8489790906182042, "learning_rate": 9.761129905248505e-06, "loss": 0.3408361911773682, "num_input_tokens_seen": 93112808, "step": 1550, "train_runtime": 19955.849, "train_tokens_per_second": 4665.941 }, { "epoch": 0.19834183673469388, "grad_norm": 0.6666863063443117, "learning_rate": 9.759597821762603e-06, "loss": 0.32660608291625975, "num_input_tokens_seen": 93403528, "step": 1555, "train_runtime": 20025.1716, "train_tokens_per_second": 4664.306 }, { "epoch": 0.1989795918367347, "grad_norm": 0.5539952771846446, "learning_rate": 9.758060961687879e-06, "loss": 0.347269606590271, "num_input_tokens_seen": 93706008, "step": 1560, "train_runtime": 20085.773, "train_tokens_per_second": 4665.293 }, { "epoch": 0.1996173469387755, "grad_norm": 0.5466107019623242, "learning_rate": 9.756519326566677e-06, "loss": 0.3399479627609253, "num_input_tokens_seen": 94012760, "step": 1565, "train_runtime": 20155.7307, "train_tokens_per_second": 4664.319 }, { "epoch": 0.2002551020408163, "grad_norm": 0.585516484028218, "learning_rate": 9.754972917946138e-06, "loss": 0.3284050941467285, "num_input_tokens_seen": 94322480, "step": 1570, "train_runtime": 20220.8537, "train_tokens_per_second": 4664.614 }, { "epoch": 0.20089285714285715, "grad_norm": 0.6350719112756239, "learning_rate": 9.753421737378188e-06, "loss": 0.3520487070083618, "num_input_tokens_seen": 94623816, "step": 1575, "train_runtime": 20283.6263, "train_tokens_per_second": 4665.034 }, { "epoch": 0.20153061224489796, "grad_norm": 0.5088503114605749, "learning_rate": 9.751865786419546e-06, "loss": 0.3247365951538086, "num_input_tokens_seen": 94925560, "step": 1580, "train_runtime": 20340.2822, "train_tokens_per_second": 4666.875 }, { "epoch": 0.20216836734693877, "grad_norm": 0.5359700169183711, "learning_rate": 9.750305066631717e-06, "loss": 0.3115284204483032, "num_input_tokens_seen": 95240304, "step": 1585, "train_runtime": 20397.2195, "train_tokens_per_second": 4669.279 }, { "epoch": 0.20280612244897958, "grad_norm": 0.7442337531112403, "learning_rate": 9.748739579580995e-06, "loss": 0.32700955867767334, "num_input_tokens_seen": 95522168, "step": 1590, "train_runtime": 20455.8691, "train_tokens_per_second": 4669.67 }, { "epoch": 0.20344387755102042, "grad_norm": 0.5765541750227784, "learning_rate": 9.747169326838451e-06, "loss": 0.2974551200866699, "num_input_tokens_seen": 95817688, "step": 1595, "train_runtime": 20518.0377, "train_tokens_per_second": 4669.925 }, { "epoch": 0.20408163265306123, "grad_norm": 0.5344399026968158, "learning_rate": 9.74559430997995e-06, "loss": 0.286482572555542, "num_input_tokens_seen": 96124656, "step": 1600, "train_runtime": 20579.1449, "train_tokens_per_second": 4670.974 }, { "epoch": 0.20471938775510204, "grad_norm": 0.5542855767607231, "learning_rate": 9.744014530586124e-06, "loss": 0.3121712446212769, "num_input_tokens_seen": 96432192, "step": 1605, "train_runtime": 20636.432, "train_tokens_per_second": 4672.91 }, { "epoch": 0.20535714285714285, "grad_norm": 0.6417270797527082, "learning_rate": 9.742429990242394e-06, "loss": 0.3185253143310547, "num_input_tokens_seen": 96733072, "step": 1610, "train_runtime": 20690.8871, "train_tokens_per_second": 4675.153 }, { "epoch": 0.2059948979591837, "grad_norm": 0.8196337875958973, "learning_rate": 9.740840690538961e-06, "loss": 0.34393696784973143, "num_input_tokens_seen": 97033976, "step": 1615, "train_runtime": 20770.3778, "train_tokens_per_second": 4671.748 }, { "epoch": 0.2066326530612245, "grad_norm": 0.7553206240898032, "learning_rate": 9.739246633070796e-06, "loss": 0.3039816617965698, "num_input_tokens_seen": 97334640, "step": 1620, "train_runtime": 20826.8186, "train_tokens_per_second": 4673.524 }, { "epoch": 0.2072704081632653, "grad_norm": 0.5848461607387229, "learning_rate": 9.737647819437645e-06, "loss": 0.32238154411315917, "num_input_tokens_seen": 97635840, "step": 1625, "train_runtime": 20891.1271, "train_tokens_per_second": 4673.555 }, { "epoch": 0.20790816326530612, "grad_norm": 0.6590019837579646, "learning_rate": 9.73604425124403e-06, "loss": 0.3333409309387207, "num_input_tokens_seen": 97926552, "step": 1630, "train_runtime": 20959.8775, "train_tokens_per_second": 4672.096 }, { "epoch": 0.20854591836734693, "grad_norm": 0.6800291269132569, "learning_rate": 9.734435930099246e-06, "loss": 0.32056217193603515, "num_input_tokens_seen": 98218656, "step": 1635, "train_runtime": 21020.074, "train_tokens_per_second": 4672.612 }, { "epoch": 0.20918367346938777, "grad_norm": 0.5415844117036988, "learning_rate": 9.732822857617352e-06, "loss": 0.3002612113952637, "num_input_tokens_seen": 98504848, "step": 1640, "train_runtime": 21077.7169, "train_tokens_per_second": 4673.412 }, { "epoch": 0.20982142857142858, "grad_norm": 0.6193481368187909, "learning_rate": 9.731205035417183e-06, "loss": 0.3319518804550171, "num_input_tokens_seen": 98806944, "step": 1645, "train_runtime": 21140.7188, "train_tokens_per_second": 4673.774 }, { "epoch": 0.21045918367346939, "grad_norm": 0.6077166715888609, "learning_rate": 9.729582465122334e-06, "loss": 0.33286495208740235, "num_input_tokens_seen": 99115168, "step": 1650, "train_runtime": 21195.2064, "train_tokens_per_second": 4676.301 }, { "epoch": 0.2110969387755102, "grad_norm": 0.5909430297339548, "learning_rate": 9.727955148361166e-06, "loss": 0.32822155952453613, "num_input_tokens_seen": 99396568, "step": 1655, "train_runtime": 21261.9658, "train_tokens_per_second": 4674.853 }, { "epoch": 0.21173469387755103, "grad_norm": 0.6011483095378239, "learning_rate": 9.72632308676681e-06, "loss": 0.33887970447540283, "num_input_tokens_seen": 99714032, "step": 1660, "train_runtime": 21331.2956, "train_tokens_per_second": 4674.542 }, { "epoch": 0.21237244897959184, "grad_norm": 0.559470750563947, "learning_rate": 9.724686281977146e-06, "loss": 0.32210845947265626, "num_input_tokens_seen": 100000736, "step": 1665, "train_runtime": 21401.8927, "train_tokens_per_second": 4672.518 }, { "epoch": 0.21301020408163265, "grad_norm": 0.6567689329295388, "learning_rate": 9.72304473563483e-06, "loss": 0.33064305782318115, "num_input_tokens_seen": 100289480, "step": 1670, "train_runtime": 21463.9962, "train_tokens_per_second": 4672.451 }, { "epoch": 0.21364795918367346, "grad_norm": 0.6018245890126758, "learning_rate": 9.721398449387265e-06, "loss": 0.30869359970092775, "num_input_tokens_seen": 100577872, "step": 1675, "train_runtime": 21529.0437, "train_tokens_per_second": 4671.73 }, { "epoch": 0.21428571428571427, "grad_norm": 0.6395107833809925, "learning_rate": 9.719747424886613e-06, "loss": 0.3150346279144287, "num_input_tokens_seen": 100863168, "step": 1680, "train_runtime": 21599.2901, "train_tokens_per_second": 4669.745 }, { "epoch": 0.2149234693877551, "grad_norm": 0.5271941265038819, "learning_rate": 9.718091663789795e-06, "loss": 0.31960508823394773, "num_input_tokens_seen": 101162408, "step": 1685, "train_runtime": 21667.5749, "train_tokens_per_second": 4668.839 }, { "epoch": 0.21556122448979592, "grad_norm": 0.5481431804332924, "learning_rate": 9.716431167758482e-06, "loss": 0.3123780250549316, "num_input_tokens_seen": 101460984, "step": 1690, "train_runtime": 21728.5693, "train_tokens_per_second": 4669.474 }, { "epoch": 0.21619897959183673, "grad_norm": 0.6086299934433471, "learning_rate": 9.714765938459097e-06, "loss": 0.3333261013031006, "num_input_tokens_seen": 101761920, "step": 1695, "train_runtime": 21783.126, "train_tokens_per_second": 4671.594 }, { "epoch": 0.21683673469387754, "grad_norm": 0.6365447361149097, "learning_rate": 9.713095977562813e-06, "loss": 0.3120710849761963, "num_input_tokens_seen": 102053720, "step": 1700, "train_runtime": 21855.0072, "train_tokens_per_second": 4669.581 }, { "epoch": 0.21747448979591838, "grad_norm": 0.6855948828164128, "learning_rate": 9.711421286745554e-06, "loss": 0.3282258749008179, "num_input_tokens_seen": 102353896, "step": 1705, "train_runtime": 21918.2908, "train_tokens_per_second": 4669.794 }, { "epoch": 0.2181122448979592, "grad_norm": 0.6620982489776986, "learning_rate": 9.70974186768799e-06, "loss": 0.3506155252456665, "num_input_tokens_seen": 102660488, "step": 1710, "train_runtime": 21979.9884, "train_tokens_per_second": 4670.634 }, { "epoch": 0.21875, "grad_norm": 0.5350707355091577, "learning_rate": 9.708057722075532e-06, "loss": 0.2788844108581543, "num_input_tokens_seen": 102962576, "step": 1715, "train_runtime": 22039.8013, "train_tokens_per_second": 4671.665 }, { "epoch": 0.2193877551020408, "grad_norm": 0.5954127998391153, "learning_rate": 9.706368851598343e-06, "loss": 0.35607798099517823, "num_input_tokens_seen": 103270088, "step": 1720, "train_runtime": 22100.4497, "train_tokens_per_second": 4672.76 }, { "epoch": 0.22002551020408162, "grad_norm": 0.6113164632124081, "learning_rate": 9.704675257951316e-06, "loss": 0.3244358539581299, "num_input_tokens_seen": 103567896, "step": 1725, "train_runtime": 22171.8036, "train_tokens_per_second": 4671.153 }, { "epoch": 0.22066326530612246, "grad_norm": 0.6635617763751173, "learning_rate": 9.702976942834096e-06, "loss": 0.36413140296936036, "num_input_tokens_seen": 103858784, "step": 1730, "train_runtime": 22242.7813, "train_tokens_per_second": 4669.325 }, { "epoch": 0.22130102040816327, "grad_norm": 0.5945460106687103, "learning_rate": 9.701273907951058e-06, "loss": 0.32247157096862794, "num_input_tokens_seen": 104166592, "step": 1735, "train_runtime": 22311.0144, "train_tokens_per_second": 4668.842 }, { "epoch": 0.22193877551020408, "grad_norm": 0.5986015319544813, "learning_rate": 9.699566155011317e-06, "loss": 0.3243138790130615, "num_input_tokens_seen": 104481144, "step": 1740, "train_runtime": 22377.095, "train_tokens_per_second": 4669.111 }, { "epoch": 0.2225765306122449, "grad_norm": 0.6072340691688982, "learning_rate": 9.697853685728721e-06, "loss": 0.28355393409729, "num_input_tokens_seen": 104789096, "step": 1745, "train_runtime": 22448.0265, "train_tokens_per_second": 4668.076 }, { "epoch": 0.22321428571428573, "grad_norm": 0.7710206984061643, "learning_rate": 9.696136501821858e-06, "loss": 0.3441521406173706, "num_input_tokens_seen": 105099160, "step": 1750, "train_runtime": 22506.2221, "train_tokens_per_second": 4669.782 }, { "epoch": 0.22385204081632654, "grad_norm": 0.5534601761751993, "learning_rate": 9.694414605014035e-06, "loss": 0.2991414785385132, "num_input_tokens_seen": 105399368, "step": 1755, "train_runtime": 22572.1161, "train_tokens_per_second": 4669.45 }, { "epoch": 0.22448979591836735, "grad_norm": 0.6135564145614848, "learning_rate": 9.6926879970333e-06, "loss": 0.34076249599456787, "num_input_tokens_seen": 105713400, "step": 1760, "train_runtime": 22621.1206, "train_tokens_per_second": 4673.217 }, { "epoch": 0.22512755102040816, "grad_norm": 0.6390624645538395, "learning_rate": 9.690956679612422e-06, "loss": 0.3157844543457031, "num_input_tokens_seen": 106017008, "step": 1765, "train_runtime": 22683.2953, "train_tokens_per_second": 4673.792 }, { "epoch": 0.22576530612244897, "grad_norm": 0.6247895903764572, "learning_rate": 9.6892206544889e-06, "loss": 0.33294594287872314, "num_input_tokens_seen": 106333352, "step": 1770, "train_runtime": 22732.1296, "train_tokens_per_second": 4677.668 }, { "epoch": 0.2264030612244898, "grad_norm": 0.5941472594118004, "learning_rate": 9.687479923404959e-06, "loss": 0.3039743900299072, "num_input_tokens_seen": 106624944, "step": 1775, "train_runtime": 22799.7411, "train_tokens_per_second": 4676.586 }, { "epoch": 0.22704081632653061, "grad_norm": 0.598925695045739, "learning_rate": 9.68573448810754e-06, "loss": 0.32722058296203616, "num_input_tokens_seen": 106924616, "step": 1780, "train_runtime": 22861.3056, "train_tokens_per_second": 4677.1 }, { "epoch": 0.22767857142857142, "grad_norm": 0.565965130082789, "learning_rate": 9.683984350348313e-06, "loss": 0.32197444438934325, "num_input_tokens_seen": 107232608, "step": 1785, "train_runtime": 22936.9477, "train_tokens_per_second": 4675.104 }, { "epoch": 0.22831632653061223, "grad_norm": 0.6180087221242067, "learning_rate": 9.68222951188366e-06, "loss": 0.3341755628585815, "num_input_tokens_seen": 107531872, "step": 1790, "train_runtime": 23000.7952, "train_tokens_per_second": 4675.137 }, { "epoch": 0.22895408163265307, "grad_norm": 0.5223681605772506, "learning_rate": 9.680469974474685e-06, "loss": 0.3221714973449707, "num_input_tokens_seen": 107841640, "step": 1795, "train_runtime": 23058.9012, "train_tokens_per_second": 4676.79 }, { "epoch": 0.22959183673469388, "grad_norm": 0.5957130183551872, "learning_rate": 9.67870573988721e-06, "loss": 0.3386493682861328, "num_input_tokens_seen": 108140352, "step": 1800, "train_runtime": 23124.1502, "train_tokens_per_second": 4676.511 }, { "epoch": 0.2302295918367347, "grad_norm": 0.6059549249466671, "learning_rate": 9.676936809891763e-06, "loss": 0.3442098617553711, "num_input_tokens_seen": 108453968, "step": 1805, "train_runtime": 23190.2532, "train_tokens_per_second": 4676.705 }, { "epoch": 0.2308673469387755, "grad_norm": 0.6213669171971626, "learning_rate": 9.675163186263591e-06, "loss": 0.31106042861938477, "num_input_tokens_seen": 108741728, "step": 1810, "train_runtime": 23260.6327, "train_tokens_per_second": 4674.926 }, { "epoch": 0.2315051020408163, "grad_norm": 0.6288194323670704, "learning_rate": 9.673384870782649e-06, "loss": 0.329655385017395, "num_input_tokens_seen": 109034568, "step": 1815, "train_runtime": 23319.9422, "train_tokens_per_second": 4675.593 }, { "epoch": 0.23214285714285715, "grad_norm": 0.6339100799532578, "learning_rate": 9.6716018652336e-06, "loss": 0.3513630390167236, "num_input_tokens_seen": 109336904, "step": 1820, "train_runtime": 23391.3656, "train_tokens_per_second": 4674.242 }, { "epoch": 0.23278061224489796, "grad_norm": 0.59353528931617, "learning_rate": 9.669814171405818e-06, "loss": 0.3033082723617554, "num_input_tokens_seen": 109642616, "step": 1825, "train_runtime": 23445.8954, "train_tokens_per_second": 4676.41 }, { "epoch": 0.23341836734693877, "grad_norm": 0.6255898925485908, "learning_rate": 9.668021791093372e-06, "loss": 0.3282336235046387, "num_input_tokens_seen": 109949272, "step": 1830, "train_runtime": 23501.9415, "train_tokens_per_second": 4678.306 }, { "epoch": 0.23405612244897958, "grad_norm": 0.7250785340279433, "learning_rate": 9.666224726095048e-06, "loss": 0.3378988981246948, "num_input_tokens_seen": 110248184, "step": 1835, "train_runtime": 23566.4014, "train_tokens_per_second": 4678.193 }, { "epoch": 0.23469387755102042, "grad_norm": 0.6944942590307985, "learning_rate": 9.66442297821432e-06, "loss": 0.3463714122772217, "num_input_tokens_seen": 110544184, "step": 1840, "train_runtime": 23623.7931, "train_tokens_per_second": 4679.358 }, { "epoch": 0.23533163265306123, "grad_norm": 0.6219284149204517, "learning_rate": 9.662616549259374e-06, "loss": 0.3074399471282959, "num_input_tokens_seen": 110843984, "step": 1845, "train_runtime": 23694.1152, "train_tokens_per_second": 4678.123 }, { "epoch": 0.23596938775510204, "grad_norm": 0.558501639276207, "learning_rate": 9.660805441043082e-06, "loss": 0.30753483772277834, "num_input_tokens_seen": 111144448, "step": 1850, "train_runtime": 23750.718, "train_tokens_per_second": 4679.625 }, { "epoch": 0.23660714285714285, "grad_norm": 1.0253823706929464, "learning_rate": 9.65898965538302e-06, "loss": 0.34722580909729006, "num_input_tokens_seen": 111440120, "step": 1855, "train_runtime": 23816.6419, "train_tokens_per_second": 4679.086 }, { "epoch": 0.2372448979591837, "grad_norm": 0.6442962618904584, "learning_rate": 9.657169194101457e-06, "loss": 0.3536875009536743, "num_input_tokens_seen": 111738960, "step": 1860, "train_runtime": 23892.2735, "train_tokens_per_second": 4676.782 }, { "epoch": 0.2378826530612245, "grad_norm": 0.5836927414515857, "learning_rate": 9.655344059025351e-06, "loss": 0.32279133796691895, "num_input_tokens_seen": 112021544, "step": 1865, "train_runtime": 23955.8069, "train_tokens_per_second": 4676.175 }, { "epoch": 0.2385204081632653, "grad_norm": 0.6952663262351617, "learning_rate": 9.653514251986354e-06, "loss": 0.3028008460998535, "num_input_tokens_seen": 112318408, "step": 1870, "train_runtime": 24014.3599, "train_tokens_per_second": 4677.135 }, { "epoch": 0.23915816326530612, "grad_norm": 0.527700252310987, "learning_rate": 9.651679774820804e-06, "loss": 0.31937668323516843, "num_input_tokens_seen": 112617648, "step": 1875, "train_runtime": 24078.3066, "train_tokens_per_second": 4677.142 }, { "epoch": 0.23979591836734693, "grad_norm": 0.562703611670736, "learning_rate": 9.649840629369728e-06, "loss": 0.3241946935653687, "num_input_tokens_seen": 112930624, "step": 1880, "train_runtime": 24142.8503, "train_tokens_per_second": 4677.601 }, { "epoch": 0.24043367346938777, "grad_norm": 0.623722641429278, "learning_rate": 9.647996817478835e-06, "loss": 0.344280481338501, "num_input_tokens_seen": 113217640, "step": 1885, "train_runtime": 24200.6276, "train_tokens_per_second": 4678.294 }, { "epoch": 0.24107142857142858, "grad_norm": 0.5647700791617076, "learning_rate": 9.646148340998521e-06, "loss": 0.3104014158248901, "num_input_tokens_seen": 113529480, "step": 1890, "train_runtime": 24257.7697, "train_tokens_per_second": 4680.129 }, { "epoch": 0.24170918367346939, "grad_norm": 0.5667491923917192, "learning_rate": 9.64429520178386e-06, "loss": 0.31038522720336914, "num_input_tokens_seen": 113819120, "step": 1895, "train_runtime": 24321.9091, "train_tokens_per_second": 4679.695 }, { "epoch": 0.2423469387755102, "grad_norm": 0.6427769837002572, "learning_rate": 9.642437401694608e-06, "loss": 0.3571403980255127, "num_input_tokens_seen": 114132296, "step": 1900, "train_runtime": 24392.6403, "train_tokens_per_second": 4678.964 }, { "epoch": 0.24298469387755103, "grad_norm": 0.6209772677893988, "learning_rate": 9.640574942595195e-06, "loss": 0.32203919887542726, "num_input_tokens_seen": 114447456, "step": 1905, "train_runtime": 24458.6073, "train_tokens_per_second": 4679.23 }, { "epoch": 0.24362244897959184, "grad_norm": 0.5637953152973806, "learning_rate": 9.638707826354732e-06, "loss": 0.31209521293640136, "num_input_tokens_seen": 114753352, "step": 1910, "train_runtime": 24524.4172, "train_tokens_per_second": 4679.147 }, { "epoch": 0.24426020408163265, "grad_norm": 0.5823798976109281, "learning_rate": 9.636836054846997e-06, "loss": 0.31901235580444337, "num_input_tokens_seen": 115050112, "step": 1915, "train_runtime": 24597.96, "train_tokens_per_second": 4677.222 }, { "epoch": 0.24489795918367346, "grad_norm": 0.6719305469028826, "learning_rate": 9.634959629950444e-06, "loss": 0.29732065200805663, "num_input_tokens_seen": 115350832, "step": 1920, "train_runtime": 24655.5555, "train_tokens_per_second": 4678.493 }, { "epoch": 0.24553571428571427, "grad_norm": 0.5579926470705943, "learning_rate": 9.6330785535482e-06, "loss": 0.3192960262298584, "num_input_tokens_seen": 115655024, "step": 1925, "train_runtime": 24715.6406, "train_tokens_per_second": 4679.427 }, { "epoch": 0.2461734693877551, "grad_norm": 0.6004158154783408, "learning_rate": 9.631192827528054e-06, "loss": 0.3167712688446045, "num_input_tokens_seen": 115940248, "step": 1930, "train_runtime": 24778.0303, "train_tokens_per_second": 4679.155 }, { "epoch": 0.24681122448979592, "grad_norm": 0.7097341672547058, "learning_rate": 9.629302453782462e-06, "loss": 0.34239945411682127, "num_input_tokens_seen": 116243072, "step": 1935, "train_runtime": 24829.7494, "train_tokens_per_second": 4681.605 }, { "epoch": 0.24744897959183673, "grad_norm": 0.6007324013896582, "learning_rate": 9.62740743420855e-06, "loss": 0.3372066020965576, "num_input_tokens_seen": 116557320, "step": 1940, "train_runtime": 24896.0702, "train_tokens_per_second": 4681.756 }, { "epoch": 0.24808673469387754, "grad_norm": 0.6010879011596942, "learning_rate": 9.625507770708098e-06, "loss": 0.33537166118621825, "num_input_tokens_seen": 116850296, "step": 1945, "train_runtime": 24956.4545, "train_tokens_per_second": 4682.167 }, { "epoch": 0.24872448979591838, "grad_norm": 0.5642263779586972, "learning_rate": 9.623603465187554e-06, "loss": 0.3403872013092041, "num_input_tokens_seen": 117165232, "step": 1950, "train_runtime": 25016.4062, "train_tokens_per_second": 4683.536 }, { "epoch": 0.2493622448979592, "grad_norm": 0.646102123535778, "learning_rate": 9.621694519558021e-06, "loss": 0.3353994369506836, "num_input_tokens_seen": 117469912, "step": 1955, "train_runtime": 25089.8824, "train_tokens_per_second": 4681.963 }, { "epoch": 0.25, "grad_norm": 0.7292598852552631, "learning_rate": 9.619780935735258e-06, "loss": 0.3624607563018799, "num_input_tokens_seen": 117767632, "step": 1960, "train_runtime": 25158.8153, "train_tokens_per_second": 4680.969 }, { "epoch": 0.25063775510204084, "grad_norm": 0.5308857230100679, "learning_rate": 9.617862715639685e-06, "loss": 0.2849001407623291, "num_input_tokens_seen": 118078936, "step": 1965, "train_runtime": 25227.7331, "train_tokens_per_second": 4680.521 }, { "epoch": 0.2512755102040816, "grad_norm": 0.6435926803053078, "learning_rate": 9.615939861196364e-06, "loss": 0.3471491813659668, "num_input_tokens_seen": 118373224, "step": 1970, "train_runtime": 25301.05, "train_tokens_per_second": 4678.589 }, { "epoch": 0.25191326530612246, "grad_norm": 0.6160911738361701, "learning_rate": 9.614012374335014e-06, "loss": 0.3345517158508301, "num_input_tokens_seen": 118665768, "step": 1975, "train_runtime": 25374.3773, "train_tokens_per_second": 4676.598 }, { "epoch": 0.25255102040816324, "grad_norm": 0.6078198965546298, "learning_rate": 9.612080256990006e-06, "loss": 0.3112973213195801, "num_input_tokens_seen": 118963984, "step": 1980, "train_runtime": 25436.7886, "train_tokens_per_second": 4676.848 }, { "epoch": 0.2531887755102041, "grad_norm": 0.5884732352967934, "learning_rate": 9.610143511100354e-06, "loss": 0.30260891914367677, "num_input_tokens_seen": 119243072, "step": 1985, "train_runtime": 25507.8858, "train_tokens_per_second": 4674.753 }, { "epoch": 0.2538265306122449, "grad_norm": 0.5867017741557491, "learning_rate": 9.608202138609714e-06, "loss": 0.31354618072509766, "num_input_tokens_seen": 119547376, "step": 1990, "train_runtime": 25579.3014, "train_tokens_per_second": 4673.598 }, { "epoch": 0.2544642857142857, "grad_norm": 0.5930499940162742, "learning_rate": 9.606256141466394e-06, "loss": 0.3089960813522339, "num_input_tokens_seen": 119848944, "step": 1995, "train_runtime": 25641.2909, "train_tokens_per_second": 4674.06 }, { "epoch": 0.25510204081632654, "grad_norm": 0.6399697120868858, "learning_rate": 9.604305521623335e-06, "loss": 0.29999723434448244, "num_input_tokens_seen": 120155520, "step": 2000, "train_runtime": 25709.5198, "train_tokens_per_second": 4673.581 }, { "epoch": 0.2557397959183674, "grad_norm": 0.5492487573374648, "learning_rate": 9.602350281038123e-06, "loss": 0.3378730297088623, "num_input_tokens_seen": 120461080, "step": 2005, "train_runtime": 25772.7865, "train_tokens_per_second": 4673.964 }, { "epoch": 0.25637755102040816, "grad_norm": 0.704438904242841, "learning_rate": 9.600390421672976e-06, "loss": 0.34598360061645506, "num_input_tokens_seen": 120752152, "step": 2010, "train_runtime": 25835.8802, "train_tokens_per_second": 4673.816 }, { "epoch": 0.257015306122449, "grad_norm": 0.5801593494794286, "learning_rate": 9.59842594549475e-06, "loss": 0.3566749572753906, "num_input_tokens_seen": 121057624, "step": 2015, "train_runtime": 25906.0535, "train_tokens_per_second": 4672.947 }, { "epoch": 0.2576530612244898, "grad_norm": 0.6376080616812323, "learning_rate": 9.596456854474933e-06, "loss": 0.3009960174560547, "num_input_tokens_seen": 121356392, "step": 2020, "train_runtime": 25976.6194, "train_tokens_per_second": 4671.755 }, { "epoch": 0.2582908163265306, "grad_norm": 0.5979766863747837, "learning_rate": 9.594483150589647e-06, "loss": 0.32624316215515137, "num_input_tokens_seen": 121656992, "step": 2025, "train_runtime": 26028.5388, "train_tokens_per_second": 4673.985 }, { "epoch": 0.25892857142857145, "grad_norm": 0.6312514232256536, "learning_rate": 9.592504835819642e-06, "loss": 0.33791747093200686, "num_input_tokens_seen": 121958920, "step": 2030, "train_runtime": 26087.6457, "train_tokens_per_second": 4674.968 }, { "epoch": 0.25956632653061223, "grad_norm": 0.6681405212622115, "learning_rate": 9.590521912150294e-06, "loss": 0.32710092067718505, "num_input_tokens_seen": 122265488, "step": 2035, "train_runtime": 26139.3938, "train_tokens_per_second": 4677.442 }, { "epoch": 0.2602040816326531, "grad_norm": 0.7037855571998192, "learning_rate": 9.588534381571606e-06, "loss": 0.31521337032318114, "num_input_tokens_seen": 122573968, "step": 2040, "train_runtime": 26194.6883, "train_tokens_per_second": 4679.344 }, { "epoch": 0.26084183673469385, "grad_norm": 0.5783322471293008, "learning_rate": 9.586542246078203e-06, "loss": 0.330059552192688, "num_input_tokens_seen": 122862792, "step": 2045, "train_runtime": 26263.2862, "train_tokens_per_second": 4678.12 }, { "epoch": 0.2614795918367347, "grad_norm": 0.6150497473375843, "learning_rate": 9.584545507669333e-06, "loss": 0.30462510585784913, "num_input_tokens_seen": 123159968, "step": 2050, "train_runtime": 26334.5848, "train_tokens_per_second": 4676.739 }, { "epoch": 0.26211734693877553, "grad_norm": 0.59872654736947, "learning_rate": 9.582544168348864e-06, "loss": 0.31244144439697263, "num_input_tokens_seen": 123452512, "step": 2055, "train_runtime": 26402.5919, "train_tokens_per_second": 4675.772 }, { "epoch": 0.2627551020408163, "grad_norm": 0.6211287049459203, "learning_rate": 9.580538230125275e-06, "loss": 0.344005823135376, "num_input_tokens_seen": 123734472, "step": 2060, "train_runtime": 26468.247, "train_tokens_per_second": 4674.827 }, { "epoch": 0.26339285714285715, "grad_norm": 0.6481823971187728, "learning_rate": 9.57852769501167e-06, "loss": 0.3296398639678955, "num_input_tokens_seen": 124037960, "step": 2065, "train_runtime": 26530.3794, "train_tokens_per_second": 4675.318 }, { "epoch": 0.26403061224489793, "grad_norm": 0.5941205675123112, "learning_rate": 9.576512565025759e-06, "loss": 0.31540956497192385, "num_input_tokens_seen": 124342752, "step": 2070, "train_runtime": 26592.1225, "train_tokens_per_second": 4675.924 }, { "epoch": 0.26466836734693877, "grad_norm": 0.6326195230505037, "learning_rate": 9.574492842189865e-06, "loss": 0.34804620742797854, "num_input_tokens_seen": 124662472, "step": 2075, "train_runtime": 26647.0273, "train_tokens_per_second": 4678.288 }, { "epoch": 0.2653061224489796, "grad_norm": 0.5693984902338113, "learning_rate": 9.572468528530923e-06, "loss": 0.29468479156494143, "num_input_tokens_seen": 124958736, "step": 2080, "train_runtime": 26710.9839, "train_tokens_per_second": 4678.178 }, { "epoch": 0.2659438775510204, "grad_norm": 0.6512563017816041, "learning_rate": 9.570439626080472e-06, "loss": 0.3527271509170532, "num_input_tokens_seen": 125241776, "step": 2085, "train_runtime": 26772.1002, "train_tokens_per_second": 4678.071 }, { "epoch": 0.26658163265306123, "grad_norm": 0.6206313058829079, "learning_rate": 9.568406136874657e-06, "loss": 0.3105809450149536, "num_input_tokens_seen": 125535920, "step": 2090, "train_runtime": 26835.7399, "train_tokens_per_second": 4677.938 }, { "epoch": 0.26721938775510207, "grad_norm": 0.5644830315991491, "learning_rate": 9.566368062954227e-06, "loss": 0.3023581027984619, "num_input_tokens_seen": 125827480, "step": 2095, "train_runtime": 26894.1398, "train_tokens_per_second": 4678.621 }, { "epoch": 0.26785714285714285, "grad_norm": 0.6662881978380841, "learning_rate": 9.564325406364532e-06, "loss": 0.33686540126800535, "num_input_tokens_seen": 126148872, "step": 2100, "train_runtime": 26946.1488, "train_tokens_per_second": 4681.518 }, { "epoch": 0.2684948979591837, "grad_norm": 0.616541008841765, "learning_rate": 9.562278169155518e-06, "loss": 0.3285606622695923, "num_input_tokens_seen": 126463968, "step": 2105, "train_runtime": 27001.0604, "train_tokens_per_second": 4683.667 }, { "epoch": 0.26913265306122447, "grad_norm": 0.5501720018606887, "learning_rate": 9.560226353381735e-06, "loss": 0.3161233186721802, "num_input_tokens_seen": 126769104, "step": 2110, "train_runtime": 27066.9531, "train_tokens_per_second": 4683.538 }, { "epoch": 0.2697704081632653, "grad_norm": 0.6098186680772301, "learning_rate": 9.55816996110232e-06, "loss": 0.33042201995849607, "num_input_tokens_seen": 127070176, "step": 2115, "train_runtime": 27121.159, "train_tokens_per_second": 4685.278 }, { "epoch": 0.27040816326530615, "grad_norm": 0.6562972170179081, "learning_rate": 9.556108994381007e-06, "loss": 0.33913230895996094, "num_input_tokens_seen": 127378504, "step": 2120, "train_runtime": 27184.3758, "train_tokens_per_second": 4685.725 }, { "epoch": 0.2710459183673469, "grad_norm": 0.5696608649074028, "learning_rate": 9.55404345528612e-06, "loss": 0.32880458831787107, "num_input_tokens_seen": 127693280, "step": 2125, "train_runtime": 27238.5903, "train_tokens_per_second": 4687.955 }, { "epoch": 0.27168367346938777, "grad_norm": 0.5776721935255191, "learning_rate": 9.551973345890572e-06, "loss": 0.3231329441070557, "num_input_tokens_seen": 128000488, "step": 2130, "train_runtime": 27293.669, "train_tokens_per_second": 4689.75 }, { "epoch": 0.27232142857142855, "grad_norm": 0.6742303614240489, "learning_rate": 9.549898668271862e-06, "loss": 0.32097625732421875, "num_input_tokens_seen": 128303912, "step": 2135, "train_runtime": 27344.549, "train_tokens_per_second": 4692.12 }, { "epoch": 0.2729591836734694, "grad_norm": 0.5630324691347439, "learning_rate": 9.547819424512075e-06, "loss": 0.333871865272522, "num_input_tokens_seen": 128597200, "step": 2140, "train_runtime": 27404.847, "train_tokens_per_second": 4692.498 }, { "epoch": 0.2735969387755102, "grad_norm": 0.6737715351955407, "learning_rate": 9.545735616697875e-06, "loss": 0.3379852294921875, "num_input_tokens_seen": 128907856, "step": 2145, "train_runtime": 27474.3731, "train_tokens_per_second": 4691.931 }, { "epoch": 0.274234693877551, "grad_norm": 0.633589763494367, "learning_rate": 9.54364724692051e-06, "loss": 0.34932861328125, "num_input_tokens_seen": 129221728, "step": 2150, "train_runtime": 27551.387, "train_tokens_per_second": 4690.208 }, { "epoch": 0.27487244897959184, "grad_norm": 0.5976884715434537, "learning_rate": 9.541554317275807e-06, "loss": 0.30597634315490724, "num_input_tokens_seen": 129523728, "step": 2155, "train_runtime": 27605.7458, "train_tokens_per_second": 4691.912 }, { "epoch": 0.2755102040816326, "grad_norm": 0.5936498054938893, "learning_rate": 9.539456829864164e-06, "loss": 0.2829718112945557, "num_input_tokens_seen": 129812504, "step": 2160, "train_runtime": 27680.8759, "train_tokens_per_second": 4689.61 }, { "epoch": 0.27614795918367346, "grad_norm": 0.6135433871825898, "learning_rate": 9.537354786790558e-06, "loss": 0.335500693321228, "num_input_tokens_seen": 130124616, "step": 2165, "train_runtime": 27750.1509, "train_tokens_per_second": 4689.15 }, { "epoch": 0.2767857142857143, "grad_norm": 0.6283514694093978, "learning_rate": 9.535248190164537e-06, "loss": 0.34310569763183596, "num_input_tokens_seen": 130420944, "step": 2170, "train_runtime": 27816.7927, "train_tokens_per_second": 4688.569 }, { "epoch": 0.2774234693877551, "grad_norm": 0.5532100827303795, "learning_rate": 9.533137042100214e-06, "loss": 0.3102876663208008, "num_input_tokens_seen": 130705888, "step": 2175, "train_runtime": 27874.0843, "train_tokens_per_second": 4689.155 }, { "epoch": 0.2780612244897959, "grad_norm": 0.551989879026994, "learning_rate": 9.531021344716275e-06, "loss": 0.30455660820007324, "num_input_tokens_seen": 131007712, "step": 2180, "train_runtime": 27941.7726, "train_tokens_per_second": 4688.597 }, { "epoch": 0.27869897959183676, "grad_norm": 0.604405208631062, "learning_rate": 9.528901100135971e-06, "loss": 0.3334838390350342, "num_input_tokens_seen": 131301160, "step": 2185, "train_runtime": 28007.0995, "train_tokens_per_second": 4688.138 }, { "epoch": 0.27933673469387754, "grad_norm": 0.6372287038655521, "learning_rate": 9.526776310487116e-06, "loss": 0.30718910694122314, "num_input_tokens_seen": 131601576, "step": 2190, "train_runtime": 28074.0945, "train_tokens_per_second": 4687.652 }, { "epoch": 0.2799744897959184, "grad_norm": 0.6095463320329509, "learning_rate": 9.524646977902083e-06, "loss": 0.3460432291030884, "num_input_tokens_seen": 131907152, "step": 2195, "train_runtime": 28135.9899, "train_tokens_per_second": 4688.2 }, { "epoch": 0.28061224489795916, "grad_norm": 0.5801013513430481, "learning_rate": 9.522513104517807e-06, "loss": 0.3240336894989014, "num_input_tokens_seen": 132205376, "step": 2200, "train_runtime": 28200.4482, "train_tokens_per_second": 4688.059 }, { "epoch": 0.28125, "grad_norm": 0.7268316975488225, "learning_rate": 9.52037469247578e-06, "loss": 0.3053292274475098, "num_input_tokens_seen": 132499760, "step": 2205, "train_runtime": 28257.3095, "train_tokens_per_second": 4689.044 }, { "epoch": 0.28188775510204084, "grad_norm": 0.5689089557303342, "learning_rate": 9.518231743922049e-06, "loss": 0.33064699172973633, "num_input_tokens_seen": 132799952, "step": 2210, "train_runtime": 28331.5474, "train_tokens_per_second": 4687.353 }, { "epoch": 0.2825255102040816, "grad_norm": 0.6724396550763708, "learning_rate": 9.516084261007207e-06, "loss": 0.32482156753540037, "num_input_tokens_seen": 133086712, "step": 2215, "train_runtime": 28405.2893, "train_tokens_per_second": 4685.279 }, { "epoch": 0.28316326530612246, "grad_norm": 0.6347967696237345, "learning_rate": 9.513932245886409e-06, "loss": 0.29505276679992676, "num_input_tokens_seen": 133376464, "step": 2220, "train_runtime": 28467.0786, "train_tokens_per_second": 4685.288 }, { "epoch": 0.28380102040816324, "grad_norm": 0.5464938949973542, "learning_rate": 9.511775700719347e-06, "loss": 0.32130861282348633, "num_input_tokens_seen": 133678184, "step": 2225, "train_runtime": 28536.8175, "train_tokens_per_second": 4684.411 }, { "epoch": 0.2844387755102041, "grad_norm": 0.579213261484982, "learning_rate": 9.50961462767027e-06, "loss": 0.3393184900283813, "num_input_tokens_seen": 133974496, "step": 2230, "train_runtime": 28611.7797, "train_tokens_per_second": 4682.494 }, { "epoch": 0.2850765306122449, "grad_norm": 0.6172083632586678, "learning_rate": 9.507449028907961e-06, "loss": 0.327873158454895, "num_input_tokens_seen": 134264256, "step": 2235, "train_runtime": 28680.0516, "train_tokens_per_second": 4681.451 }, { "epoch": 0.2857142857142857, "grad_norm": 0.6569159177539318, "learning_rate": 9.505278906605752e-06, "loss": 0.32256019115448, "num_input_tokens_seen": 134555712, "step": 2240, "train_runtime": 28741.5535, "train_tokens_per_second": 4681.574 }, { "epoch": 0.28635204081632654, "grad_norm": 0.6489904409400776, "learning_rate": 9.503104262941515e-06, "loss": 0.3126920938491821, "num_input_tokens_seen": 134843824, "step": 2245, "train_runtime": 28809.5578, "train_tokens_per_second": 4680.524 }, { "epoch": 0.2869897959183674, "grad_norm": 0.5889950079552234, "learning_rate": 9.500925100097652e-06, "loss": 0.3146326541900635, "num_input_tokens_seen": 135143624, "step": 2250, "train_runtime": 28885.544, "train_tokens_per_second": 4678.59 }, { "epoch": 0.28762755102040816, "grad_norm": 0.5901022593560107, "learning_rate": 9.498741420261109e-06, "loss": 0.3119138240814209, "num_input_tokens_seen": 135438736, "step": 2255, "train_runtime": 28945.8891, "train_tokens_per_second": 4679.032 }, { "epoch": 0.288265306122449, "grad_norm": 0.6679007996119871, "learning_rate": 9.496553225623358e-06, "loss": 0.3327902317047119, "num_input_tokens_seen": 135721752, "step": 2260, "train_runtime": 29006.2014, "train_tokens_per_second": 4679.06 }, { "epoch": 0.2889030612244898, "grad_norm": 0.6418452396909745, "learning_rate": 9.494360518380405e-06, "loss": 0.30309200286865234, "num_input_tokens_seen": 136006624, "step": 2265, "train_runtime": 29078.9405, "train_tokens_per_second": 4677.152 }, { "epoch": 0.2895408163265306, "grad_norm": 0.6740226014371311, "learning_rate": 9.49216330073279e-06, "loss": 0.3591219663619995, "num_input_tokens_seen": 136304952, "step": 2270, "train_runtime": 29136.3858, "train_tokens_per_second": 4678.17 }, { "epoch": 0.29017857142857145, "grad_norm": 0.6190880149541824, "learning_rate": 9.489961574885567e-06, "loss": 0.30411219596862793, "num_input_tokens_seen": 136585840, "step": 2275, "train_runtime": 29200.6372, "train_tokens_per_second": 4677.495 }, { "epoch": 0.29081632653061223, "grad_norm": 0.5512260948689923, "learning_rate": 9.487755343048328e-06, "loss": 0.32656924724578856, "num_input_tokens_seen": 136885088, "step": 2280, "train_runtime": 29269.8852, "train_tokens_per_second": 4676.653 }, { "epoch": 0.2914540816326531, "grad_norm": 0.6453574262630075, "learning_rate": 9.485544607435177e-06, "loss": 0.3365833044052124, "num_input_tokens_seen": 137186696, "step": 2285, "train_runtime": 29332.5357, "train_tokens_per_second": 4676.946 }, { "epoch": 0.29209183673469385, "grad_norm": 0.5523789076458793, "learning_rate": 9.483329370264743e-06, "loss": 0.3248692750930786, "num_input_tokens_seen": 137492544, "step": 2290, "train_runtime": 29396.2427, "train_tokens_per_second": 4677.215 }, { "epoch": 0.2927295918367347, "grad_norm": 0.596344921349206, "learning_rate": 9.48110963376017e-06, "loss": 0.3270201444625854, "num_input_tokens_seen": 137782080, "step": 2295, "train_runtime": 29468.9381, "train_tokens_per_second": 4675.502 }, { "epoch": 0.29336734693877553, "grad_norm": 0.6736132108784195, "learning_rate": 9.47888540014912e-06, "loss": 0.3187110900878906, "num_input_tokens_seen": 138078120, "step": 2300, "train_runtime": 29538.7803, "train_tokens_per_second": 4674.469 }, { "epoch": 0.2940051020408163, "grad_norm": 0.532669593986322, "learning_rate": 9.476656671663766e-06, "loss": 0.30268163681030275, "num_input_tokens_seen": 138377568, "step": 2305, "train_runtime": 29604.2275, "train_tokens_per_second": 4674.25 }, { "epoch": 0.29464285714285715, "grad_norm": 0.6510441114111867, "learning_rate": 9.474423450540794e-06, "loss": 0.33988251686096194, "num_input_tokens_seen": 138671160, "step": 2310, "train_runtime": 29670.8385, "train_tokens_per_second": 4673.652 }, { "epoch": 0.29528061224489793, "grad_norm": 0.6234702256034333, "learning_rate": 9.472185739021396e-06, "loss": 0.31470139026641847, "num_input_tokens_seen": 138968528, "step": 2315, "train_runtime": 29738.0543, "train_tokens_per_second": 4673.087 }, { "epoch": 0.29591836734693877, "grad_norm": 0.5751340719081197, "learning_rate": 9.469943539351272e-06, "loss": 0.31812400817871095, "num_input_tokens_seen": 139276064, "step": 2320, "train_runtime": 29805.6272, "train_tokens_per_second": 4672.811 }, { "epoch": 0.2965561224489796, "grad_norm": 0.5786021273078671, "learning_rate": 9.467696853780625e-06, "loss": 0.33053481578826904, "num_input_tokens_seen": 139576128, "step": 2325, "train_runtime": 29860.1304, "train_tokens_per_second": 4674.331 }, { "epoch": 0.2971938775510204, "grad_norm": 0.5986777323470593, "learning_rate": 9.465445684564165e-06, "loss": 0.3223258495330811, "num_input_tokens_seen": 139880552, "step": 2330, "train_runtime": 29926.5424, "train_tokens_per_second": 4674.13 }, { "epoch": 0.29783163265306123, "grad_norm": 0.5571699592153114, "learning_rate": 9.463190033961092e-06, "loss": 0.34364633560180663, "num_input_tokens_seen": 140180800, "step": 2335, "train_runtime": 29985.9569, "train_tokens_per_second": 4674.882 }, { "epoch": 0.29846938775510207, "grad_norm": 0.5900640933697718, "learning_rate": 9.46092990423511e-06, "loss": 0.3437541723251343, "num_input_tokens_seen": 140482296, "step": 2340, "train_runtime": 30050.2785, "train_tokens_per_second": 4674.908 }, { "epoch": 0.29910714285714285, "grad_norm": 0.6193560109419097, "learning_rate": 9.45866529765442e-06, "loss": 0.34493107795715333, "num_input_tokens_seen": 140776768, "step": 2345, "train_runtime": 30119.3252, "train_tokens_per_second": 4673.968 }, { "epoch": 0.2997448979591837, "grad_norm": 0.6205275388754196, "learning_rate": 9.456396216491713e-06, "loss": 0.3377701759338379, "num_input_tokens_seen": 141076136, "step": 2350, "train_runtime": 30177.7701, "train_tokens_per_second": 4674.836 }, { "epoch": 0.30038265306122447, "grad_norm": 0.6397239800403964, "learning_rate": 9.454122663024167e-06, "loss": 0.31418709754943847, "num_input_tokens_seen": 141374512, "step": 2355, "train_runtime": 30240.8034, "train_tokens_per_second": 4674.959 }, { "epoch": 0.3010204081632653, "grad_norm": 0.5815300830224596, "learning_rate": 9.451844639533453e-06, "loss": 0.31237623691558836, "num_input_tokens_seen": 141660368, "step": 2360, "train_runtime": 30309.4086, "train_tokens_per_second": 4673.808 }, { "epoch": 0.30165816326530615, "grad_norm": 0.6687419180167138, "learning_rate": 9.44956214830573e-06, "loss": 0.3478510618209839, "num_input_tokens_seen": 141967256, "step": 2365, "train_runtime": 30368.9784, "train_tokens_per_second": 4674.746 }, { "epoch": 0.3022959183673469, "grad_norm": 0.5828907587240244, "learning_rate": 9.447275191631631e-06, "loss": 0.3015713691711426, "num_input_tokens_seen": 142263600, "step": 2370, "train_runtime": 30433.5815, "train_tokens_per_second": 4674.56 }, { "epoch": 0.30293367346938777, "grad_norm": 0.7619381501207457, "learning_rate": 9.444983771806281e-06, "loss": 0.31589689254760744, "num_input_tokens_seen": 142557944, "step": 2375, "train_runtime": 30484.0685, "train_tokens_per_second": 4676.474 }, { "epoch": 0.30357142857142855, "grad_norm": 0.7039368564710913, "learning_rate": 9.44268789112928e-06, "loss": 0.35042586326599123, "num_input_tokens_seen": 142858264, "step": 2380, "train_runtime": 30547.7524, "train_tokens_per_second": 4676.556 }, { "epoch": 0.3042091836734694, "grad_norm": 0.5527063373626678, "learning_rate": 9.440387551904705e-06, "loss": 0.2907209634780884, "num_input_tokens_seen": 143148344, "step": 2385, "train_runtime": 30609.9933, "train_tokens_per_second": 4676.523 }, { "epoch": 0.3048469387755102, "grad_norm": 0.5773185427370752, "learning_rate": 9.438082756441103e-06, "loss": 0.33542962074279786, "num_input_tokens_seen": 143466320, "step": 2390, "train_runtime": 30657.9794, "train_tokens_per_second": 4679.575 }, { "epoch": 0.305484693877551, "grad_norm": 0.6069011727187676, "learning_rate": 9.4357735070515e-06, "loss": 0.34381320476531985, "num_input_tokens_seen": 143768480, "step": 2395, "train_runtime": 30727.0062, "train_tokens_per_second": 4678.896 }, { "epoch": 0.30612244897959184, "grad_norm": 0.6224162118341987, "learning_rate": 9.433459806053392e-06, "loss": 0.30916447639465333, "num_input_tokens_seen": 144080664, "step": 2400, "train_runtime": 30796.7448, "train_tokens_per_second": 4678.438 }, { "epoch": 0.3067602040816326, "grad_norm": 0.6058702743286325, "learning_rate": 9.431141655768733e-06, "loss": 0.3193027496337891, "num_input_tokens_seen": 144385056, "step": 2405, "train_runtime": 30866.2766, "train_tokens_per_second": 4677.761 }, { "epoch": 0.30739795918367346, "grad_norm": 0.5938586145105029, "learning_rate": 9.428819058523953e-06, "loss": 0.31721904277801516, "num_input_tokens_seen": 144691264, "step": 2410, "train_runtime": 30923.7767, "train_tokens_per_second": 4678.965 }, { "epoch": 0.3080357142857143, "grad_norm": 0.5326567040194892, "learning_rate": 9.42649201664994e-06, "loss": 0.3103544473648071, "num_input_tokens_seen": 144999024, "step": 2415, "train_runtime": 30999.5501, "train_tokens_per_second": 4677.456 }, { "epoch": 0.3086734693877551, "grad_norm": 0.6147451958275432, "learning_rate": 9.424160532482042e-06, "loss": 0.33042163848876954, "num_input_tokens_seen": 145300312, "step": 2420, "train_runtime": 31065.25, "train_tokens_per_second": 4677.262 }, { "epoch": 0.3093112244897959, "grad_norm": 0.6699472678811865, "learning_rate": 9.421824608360068e-06, "loss": 0.31264162063598633, "num_input_tokens_seen": 145603704, "step": 2425, "train_runtime": 31131.0589, "train_tokens_per_second": 4677.12 }, { "epoch": 0.30994897959183676, "grad_norm": 0.6012355174720134, "learning_rate": 9.419484246628279e-06, "loss": 0.3024762153625488, "num_input_tokens_seen": 145885752, "step": 2430, "train_runtime": 31199.3458, "train_tokens_per_second": 4675.923 }, { "epoch": 0.31058673469387754, "grad_norm": 0.5707752988400112, "learning_rate": 9.417139449635394e-06, "loss": 0.3117316722869873, "num_input_tokens_seen": 146187696, "step": 2435, "train_runtime": 31264.451, "train_tokens_per_second": 4675.844 }, { "epoch": 0.3112244897959184, "grad_norm": 0.6416544677241595, "learning_rate": 9.414790219734578e-06, "loss": 0.3597858905792236, "num_input_tokens_seen": 146492336, "step": 2440, "train_runtime": 31317.289, "train_tokens_per_second": 4677.683 }, { "epoch": 0.31186224489795916, "grad_norm": 0.6166769162022172, "learning_rate": 9.41243655928345e-06, "loss": 0.30897738933563235, "num_input_tokens_seen": 146810920, "step": 2445, "train_runtime": 31384.647, "train_tokens_per_second": 4677.794 }, { "epoch": 0.3125, "grad_norm": 0.6108503616106563, "learning_rate": 9.410078470644069e-06, "loss": 0.30934574604034426, "num_input_tokens_seen": 147095600, "step": 2450, "train_runtime": 31453.8324, "train_tokens_per_second": 4676.556 }, { "epoch": 0.31313775510204084, "grad_norm": 0.4554145588657622, "learning_rate": 9.407715956182942e-06, "loss": 0.2786367893218994, "num_input_tokens_seen": 147406976, "step": 2455, "train_runtime": 31521.4732, "train_tokens_per_second": 4676.399 }, { "epoch": 0.3137755102040816, "grad_norm": 0.5642409078592039, "learning_rate": 9.405349018271021e-06, "loss": 0.3179809093475342, "num_input_tokens_seen": 147685440, "step": 2460, "train_runtime": 31586.8845, "train_tokens_per_second": 4675.53 }, { "epoch": 0.31441326530612246, "grad_norm": 0.5953585134819426, "learning_rate": 9.40297765928369e-06, "loss": 0.3162703990936279, "num_input_tokens_seen": 147986592, "step": 2465, "train_runtime": 31656.4537, "train_tokens_per_second": 4674.768 }, { "epoch": 0.31505102040816324, "grad_norm": 0.559696592077772, "learning_rate": 9.400601881600776e-06, "loss": 0.30867977142333985, "num_input_tokens_seen": 148295552, "step": 2470, "train_runtime": 31722.1295, "train_tokens_per_second": 4674.83 }, { "epoch": 0.3156887755102041, "grad_norm": 0.7691180619862527, "learning_rate": 9.398221687606535e-06, "loss": 0.3155848741531372, "num_input_tokens_seen": 148575152, "step": 2475, "train_runtime": 31785.5175, "train_tokens_per_second": 4674.303 }, { "epoch": 0.3163265306122449, "grad_norm": 0.6003783135059826, "learning_rate": 9.395837079689661e-06, "loss": 0.3411431789398193, "num_input_tokens_seen": 148877328, "step": 2480, "train_runtime": 31855.9629, "train_tokens_per_second": 4673.452 }, { "epoch": 0.3169642857142857, "grad_norm": 0.7310249378431494, "learning_rate": 9.393448060243272e-06, "loss": 0.30136809349060056, "num_input_tokens_seen": 149175304, "step": 2485, "train_runtime": 31924.3398, "train_tokens_per_second": 4672.776 }, { "epoch": 0.31760204081632654, "grad_norm": 0.609029292002024, "learning_rate": 9.391054631664918e-06, "loss": 0.28966469764709474, "num_input_tokens_seen": 149466488, "step": 2490, "train_runtime": 31992.955, "train_tokens_per_second": 4671.856 }, { "epoch": 0.3182397959183674, "grad_norm": 0.5693332037854462, "learning_rate": 9.388656796356569e-06, "loss": 0.31182107925415037, "num_input_tokens_seen": 149768536, "step": 2495, "train_runtime": 32067.2172, "train_tokens_per_second": 4670.456 }, { "epoch": 0.31887755102040816, "grad_norm": 0.5508709642797137, "learning_rate": 9.386254556724622e-06, "loss": 0.31195390224456787, "num_input_tokens_seen": 150078072, "step": 2500, "train_runtime": 32125.383, "train_tokens_per_second": 4671.635 }, { "epoch": 0.319515306122449, "grad_norm": 0.6332043098303607, "learning_rate": 9.383847915179892e-06, "loss": 0.3054932117462158, "num_input_tokens_seen": 150381440, "step": 2505, "train_runtime": 32187.5312, "train_tokens_per_second": 4672.04 }, { "epoch": 0.3201530612244898, "grad_norm": 0.697380145824633, "learning_rate": 9.381436874137613e-06, "loss": 0.35328240394592286, "num_input_tokens_seen": 150684960, "step": 2510, "train_runtime": 32247.0597, "train_tokens_per_second": 4672.828 }, { "epoch": 0.3207908163265306, "grad_norm": 0.8395252940112994, "learning_rate": 9.37902143601743e-06, "loss": 0.3169242858886719, "num_input_tokens_seen": 150986632, "step": 2515, "train_runtime": 32302.2906, "train_tokens_per_second": 4674.177 }, { "epoch": 0.32142857142857145, "grad_norm": 0.641319800087093, "learning_rate": 9.376601603243408e-06, "loss": 0.337641167640686, "num_input_tokens_seen": 151275848, "step": 2520, "train_runtime": 32355.6892, "train_tokens_per_second": 4675.402 }, { "epoch": 0.32206632653061223, "grad_norm": 0.8507791204923795, "learning_rate": 9.374177378244014e-06, "loss": 0.3014083385467529, "num_input_tokens_seen": 151568936, "step": 2525, "train_runtime": 32424.5142, "train_tokens_per_second": 4674.517 }, { "epoch": 0.3227040816326531, "grad_norm": 0.5841578663857016, "learning_rate": 9.37174876345213e-06, "loss": 0.34109816551208494, "num_input_tokens_seen": 151873808, "step": 2530, "train_runtime": 32481.7854, "train_tokens_per_second": 4675.661 }, { "epoch": 0.32334183673469385, "grad_norm": 0.6087239471988137, "learning_rate": 9.369315761305039e-06, "loss": 0.3376614093780518, "num_input_tokens_seen": 152175944, "step": 2535, "train_runtime": 32549.2355, "train_tokens_per_second": 4675.254 }, { "epoch": 0.3239795918367347, "grad_norm": 0.6321419126349881, "learning_rate": 9.36687837424443e-06, "loss": 0.3259952306747437, "num_input_tokens_seen": 152474144, "step": 2540, "train_runtime": 32605.5044, "train_tokens_per_second": 4676.331 }, { "epoch": 0.32461734693877553, "grad_norm": 0.6305802677195149, "learning_rate": 9.364436604716389e-06, "loss": 0.3154458999633789, "num_input_tokens_seen": 152777320, "step": 2545, "train_runtime": 32669.1717, "train_tokens_per_second": 4676.498 }, { "epoch": 0.3252551020408163, "grad_norm": 0.6190955912840279, "learning_rate": 9.361990455171405e-06, "loss": 0.34942078590393066, "num_input_tokens_seen": 153075104, "step": 2550, "train_runtime": 32732.8173, "train_tokens_per_second": 4676.503 }, { "epoch": 0.32589285714285715, "grad_norm": 0.5692325189918546, "learning_rate": 9.359539928064358e-06, "loss": 0.3225237846374512, "num_input_tokens_seen": 153360088, "step": 2555, "train_runtime": 32798.0862, "train_tokens_per_second": 4675.885 }, { "epoch": 0.32653061224489793, "grad_norm": 0.5707301790567272, "learning_rate": 9.357085025854525e-06, "loss": 0.31881611347198485, "num_input_tokens_seen": 153662392, "step": 2560, "train_runtime": 32864.1581, "train_tokens_per_second": 4675.683 }, { "epoch": 0.32716836734693877, "grad_norm": 0.6025023211113483, "learning_rate": 9.354625751005568e-06, "loss": 0.3189993381500244, "num_input_tokens_seen": 153965352, "step": 2565, "train_runtime": 32922.1984, "train_tokens_per_second": 4676.642 }, { "epoch": 0.3278061224489796, "grad_norm": 0.668348688818242, "learning_rate": 9.352162105985544e-06, "loss": 0.2961996555328369, "num_input_tokens_seen": 154268976, "step": 2570, "train_runtime": 32987.4387, "train_tokens_per_second": 4676.598 }, { "epoch": 0.3284438775510204, "grad_norm": 0.6012599795128927, "learning_rate": 9.349694093266893e-06, "loss": 0.32537577152252195, "num_input_tokens_seen": 154572360, "step": 2575, "train_runtime": 33040.7815, "train_tokens_per_second": 4678.23 }, { "epoch": 0.32908163265306123, "grad_norm": 0.6362604300955796, "learning_rate": 9.347221715326437e-06, "loss": 0.3090221405029297, "num_input_tokens_seen": 154874224, "step": 2580, "train_runtime": 33106.8149, "train_tokens_per_second": 4678.016 }, { "epoch": 0.32971938775510207, "grad_norm": 0.6232342613496551, "learning_rate": 9.344744974645382e-06, "loss": 0.3642828941345215, "num_input_tokens_seen": 155176232, "step": 2585, "train_runtime": 33155.6486, "train_tokens_per_second": 4680.235 }, { "epoch": 0.33035714285714285, "grad_norm": 0.5659453051690176, "learning_rate": 9.342263873709307e-06, "loss": 0.3241748571395874, "num_input_tokens_seen": 155478928, "step": 2590, "train_runtime": 33233.6455, "train_tokens_per_second": 4678.359 }, { "epoch": 0.3309948979591837, "grad_norm": 0.6008320540897968, "learning_rate": 9.339778415008171e-06, "loss": 0.32315621376037595, "num_input_tokens_seen": 155777776, "step": 2595, "train_runtime": 33301.0643, "train_tokens_per_second": 4677.862 }, { "epoch": 0.33163265306122447, "grad_norm": 0.5383881192962248, "learning_rate": 9.337288601036307e-06, "loss": 0.33694684505462646, "num_input_tokens_seen": 156076760, "step": 2600, "train_runtime": 33362.4084, "train_tokens_per_second": 4678.222 }, { "epoch": 0.3322704081632653, "grad_norm": 0.9747619675710759, "learning_rate": 9.334794434292416e-06, "loss": 0.31783132553100585, "num_input_tokens_seen": 156376176, "step": 2605, "train_runtime": 33427.4902, "train_tokens_per_second": 4678.071 }, { "epoch": 0.33290816326530615, "grad_norm": 0.5734884113962813, "learning_rate": 9.33229591727957e-06, "loss": 0.33543288707733154, "num_input_tokens_seen": 156692888, "step": 2610, "train_runtime": 33481.8063, "train_tokens_per_second": 4679.941 }, { "epoch": 0.3335459183673469, "grad_norm": 0.6058629357240961, "learning_rate": 9.329793052505203e-06, "loss": 0.32535901069641116, "num_input_tokens_seen": 156994264, "step": 2615, "train_runtime": 33555.0729, "train_tokens_per_second": 4678.704 }, { "epoch": 0.33418367346938777, "grad_norm": 0.6183279915744094, "learning_rate": 9.327285842481114e-06, "loss": 0.3213878393173218, "num_input_tokens_seen": 157279728, "step": 2620, "train_runtime": 33626.2153, "train_tokens_per_second": 4677.295 }, { "epoch": 0.33482142857142855, "grad_norm": 0.5495162121213072, "learning_rate": 9.324774289723469e-06, "loss": 0.3177948474884033, "num_input_tokens_seen": 157572640, "step": 2625, "train_runtime": 33679.8091, "train_tokens_per_second": 4678.549 }, { "epoch": 0.3354591836734694, "grad_norm": 0.5591209518424833, "learning_rate": 9.322258396752781e-06, "loss": 0.2949415922164917, "num_input_tokens_seen": 157869944, "step": 2630, "train_runtime": 33742.3061, "train_tokens_per_second": 4678.695 }, { "epoch": 0.3360969387755102, "grad_norm": 0.5719415058049913, "learning_rate": 9.319738166093925e-06, "loss": 0.31316614151000977, "num_input_tokens_seen": 158157168, "step": 2635, "train_runtime": 33808.7789, "train_tokens_per_second": 4677.991 }, { "epoch": 0.336734693877551, "grad_norm": 0.5826705577574305, "learning_rate": 9.31721360027613e-06, "loss": 0.32461071014404297, "num_input_tokens_seen": 158480072, "step": 2640, "train_runtime": 33859.1303, "train_tokens_per_second": 4680.571 }, { "epoch": 0.33737244897959184, "grad_norm": 0.5889465111150584, "learning_rate": 9.314684701832974e-06, "loss": 0.3051118850708008, "num_input_tokens_seen": 158777024, "step": 2645, "train_runtime": 33928.0924, "train_tokens_per_second": 4679.81 }, { "epoch": 0.3380102040816326, "grad_norm": 0.660741713565453, "learning_rate": 9.312151473302381e-06, "loss": 0.31853926181793213, "num_input_tokens_seen": 159063112, "step": 2650, "train_runtime": 33992.0852, "train_tokens_per_second": 4679.416 }, { "epoch": 0.33864795918367346, "grad_norm": 0.5938152207243252, "learning_rate": 9.309613917226627e-06, "loss": 0.31599428653717043, "num_input_tokens_seen": 159377008, "step": 2655, "train_runtime": 34058.1005, "train_tokens_per_second": 4679.562 }, { "epoch": 0.3392857142857143, "grad_norm": 0.6360821211627453, "learning_rate": 9.307072036152324e-06, "loss": 0.336210823059082, "num_input_tokens_seen": 159676160, "step": 2660, "train_runtime": 34120.1166, "train_tokens_per_second": 4679.825 }, { "epoch": 0.3399234693877551, "grad_norm": 0.5966107426536384, "learning_rate": 9.304525832630426e-06, "loss": 0.3047550439834595, "num_input_tokens_seen": 159984008, "step": 2665, "train_runtime": 34173.4165, "train_tokens_per_second": 4681.534 }, { "epoch": 0.3405612244897959, "grad_norm": 0.6756774734313965, "learning_rate": 9.30197530921623e-06, "loss": 0.323002552986145, "num_input_tokens_seen": 160278584, "step": 2670, "train_runtime": 34235.8639, "train_tokens_per_second": 4681.599 }, { "epoch": 0.34119897959183676, "grad_norm": 0.5767799189063431, "learning_rate": 9.29942046846936e-06, "loss": 0.30430898666381834, "num_input_tokens_seen": 160570328, "step": 2675, "train_runtime": 34302.707, "train_tokens_per_second": 4680.981 }, { "epoch": 0.34183673469387754, "grad_norm": 0.5411949368670815, "learning_rate": 9.29686131295378e-06, "loss": 0.3525160074234009, "num_input_tokens_seen": 160883952, "step": 2680, "train_runtime": 34364.4493, "train_tokens_per_second": 4681.697 }, { "epoch": 0.3424744897959184, "grad_norm": 0.59458431338836, "learning_rate": 9.294297845237778e-06, "loss": 0.302536940574646, "num_input_tokens_seen": 161174664, "step": 2685, "train_runtime": 34426.1941, "train_tokens_per_second": 4681.745 }, { "epoch": 0.34311224489795916, "grad_norm": 0.5883334196101253, "learning_rate": 9.291730067893978e-06, "loss": 0.34590141773223876, "num_input_tokens_seen": 161479088, "step": 2690, "train_runtime": 34482.2939, "train_tokens_per_second": 4682.957 }, { "epoch": 0.34375, "grad_norm": 0.5472357039730193, "learning_rate": 9.28915798349932e-06, "loss": 0.3102647066116333, "num_input_tokens_seen": 161787824, "step": 2695, "train_runtime": 34549.4021, "train_tokens_per_second": 4682.797 }, { "epoch": 0.34438775510204084, "grad_norm": 0.5392811374401831, "learning_rate": 9.28658159463507e-06, "loss": 0.3034888982772827, "num_input_tokens_seen": 162090808, "step": 2700, "train_runtime": 34618.9419, "train_tokens_per_second": 4682.142 }, { "epoch": 0.3450255102040816, "grad_norm": 0.6128208366625503, "learning_rate": 9.284000903886818e-06, "loss": 0.33556556701660156, "num_input_tokens_seen": 162395336, "step": 2705, "train_runtime": 34675.9325, "train_tokens_per_second": 4683.229 }, { "epoch": 0.34566326530612246, "grad_norm": 0.5920738541816492, "learning_rate": 9.281415913844465e-06, "loss": 0.3328749656677246, "num_input_tokens_seen": 162704312, "step": 2710, "train_runtime": 34740.415, "train_tokens_per_second": 4683.43 }, { "epoch": 0.34630102040816324, "grad_norm": 0.5626938659231687, "learning_rate": 9.278826627102228e-06, "loss": 0.3225257396697998, "num_input_tokens_seen": 163009696, "step": 2715, "train_runtime": 34808.6108, "train_tokens_per_second": 4683.028 }, { "epoch": 0.3469387755102041, "grad_norm": 0.6090967600997974, "learning_rate": 9.276233046258637e-06, "loss": 0.31754341125488283, "num_input_tokens_seen": 163307656, "step": 2720, "train_runtime": 34883.4983, "train_tokens_per_second": 4681.516 }, { "epoch": 0.3475765306122449, "grad_norm": 0.5780285311782188, "learning_rate": 9.273635173916535e-06, "loss": 0.3150130271911621, "num_input_tokens_seen": 163608672, "step": 2725, "train_runtime": 34948.7192, "train_tokens_per_second": 4681.393 }, { "epoch": 0.3482142857142857, "grad_norm": 0.5952943749771893, "learning_rate": 9.271033012683063e-06, "loss": 0.31302311420440676, "num_input_tokens_seen": 163922288, "step": 2730, "train_runtime": 35009.2128, "train_tokens_per_second": 4682.261 }, { "epoch": 0.34885204081632654, "grad_norm": 0.5937140156910731, "learning_rate": 9.268426565169677e-06, "loss": 0.2982464790344238, "num_input_tokens_seen": 164223960, "step": 2735, "train_runtime": 35080.0222, "train_tokens_per_second": 4681.41 }, { "epoch": 0.3494897959183674, "grad_norm": 0.5730896448133669, "learning_rate": 9.265815833992126e-06, "loss": 0.32490172386169436, "num_input_tokens_seen": 164527904, "step": 2740, "train_runtime": 35148.8704, "train_tokens_per_second": 4680.887 }, { "epoch": 0.35012755102040816, "grad_norm": 0.7064587156090127, "learning_rate": 9.263200821770462e-06, "loss": 0.33021042346954343, "num_input_tokens_seen": 164830720, "step": 2745, "train_runtime": 35224.2632, "train_tokens_per_second": 4679.465 }, { "epoch": 0.350765306122449, "grad_norm": 0.6771130884511102, "learning_rate": 9.260581531129032e-06, "loss": 0.3445593357086182, "num_input_tokens_seen": 165145048, "step": 2750, "train_runtime": 35294.5474, "train_tokens_per_second": 4679.053 }, { "epoch": 0.3514030612244898, "grad_norm": 0.5884157999002683, "learning_rate": 9.257957964696475e-06, "loss": 0.3210636615753174, "num_input_tokens_seen": 165452016, "step": 2755, "train_runtime": 35362.1859, "train_tokens_per_second": 4678.784 }, { "epoch": 0.3520408163265306, "grad_norm": 0.6076898201423231, "learning_rate": 9.255330125105728e-06, "loss": 0.32838950157165525, "num_input_tokens_seen": 165746352, "step": 2760, "train_runtime": 35427.8831, "train_tokens_per_second": 4678.415 }, { "epoch": 0.35267857142857145, "grad_norm": 0.6218117249933128, "learning_rate": 9.252698014994008e-06, "loss": 0.32069547176361085, "num_input_tokens_seen": 166059632, "step": 2765, "train_runtime": 35492.7951, "train_tokens_per_second": 4678.686 }, { "epoch": 0.35331632653061223, "grad_norm": 0.5975109095759474, "learning_rate": 9.250061637002822e-06, "loss": 0.3303449392318726, "num_input_tokens_seen": 166377536, "step": 2770, "train_runtime": 35547.221, "train_tokens_per_second": 4680.465 }, { "epoch": 0.3539540816326531, "grad_norm": 0.609305190711373, "learning_rate": 9.24742099377796e-06, "loss": 0.33595004081726076, "num_input_tokens_seen": 166680352, "step": 2775, "train_runtime": 35607.2614, "train_tokens_per_second": 4681.078 }, { "epoch": 0.35459183673469385, "grad_norm": 0.5837509994898966, "learning_rate": 9.244776087969492e-06, "loss": 0.32201323509216306, "num_input_tokens_seen": 166988808, "step": 2780, "train_runtime": 35667.4106, "train_tokens_per_second": 4681.832 }, { "epoch": 0.3552295918367347, "grad_norm": 0.5524478839275134, "learning_rate": 9.242126922231763e-06, "loss": 0.3159002780914307, "num_input_tokens_seen": 167284544, "step": 2785, "train_runtime": 35731.2887, "train_tokens_per_second": 4681.738 }, { "epoch": 0.35586734693877553, "grad_norm": 0.6107485769850661, "learning_rate": 9.239473499223399e-06, "loss": 0.34589133262634275, "num_input_tokens_seen": 167600864, "step": 2790, "train_runtime": 35803.4834, "train_tokens_per_second": 4681.133 }, { "epoch": 0.3565051020408163, "grad_norm": 0.6283645408979892, "learning_rate": 9.236815821607295e-06, "loss": 0.33268554210662843, "num_input_tokens_seen": 167902712, "step": 2795, "train_runtime": 35864.9739, "train_tokens_per_second": 4681.523 }, { "epoch": 0.35714285714285715, "grad_norm": 0.6203263014262271, "learning_rate": 9.234153892050616e-06, "loss": 0.31472318172454833, "num_input_tokens_seen": 168202368, "step": 2800, "train_runtime": 35937.563, "train_tokens_per_second": 4680.406 }, { "epoch": 0.35778061224489793, "grad_norm": 0.5850516113592246, "learning_rate": 9.231487713224793e-06, "loss": 0.28984746932983396, "num_input_tokens_seen": 168472288, "step": 2805, "train_runtime": 36006.3167, "train_tokens_per_second": 4678.965 }, { "epoch": 0.35841836734693877, "grad_norm": 0.5770863363835493, "learning_rate": 9.228817287805523e-06, "loss": 0.32077693939208984, "num_input_tokens_seen": 168776944, "step": 2810, "train_runtime": 36068.1892, "train_tokens_per_second": 4679.385 }, { "epoch": 0.3590561224489796, "grad_norm": 0.6104714968428147, "learning_rate": 9.226142618472765e-06, "loss": 0.3266309261322021, "num_input_tokens_seen": 169074648, "step": 2815, "train_runtime": 36144.8528, "train_tokens_per_second": 4677.696 }, { "epoch": 0.3596938775510204, "grad_norm": 0.5829999977939861, "learning_rate": 9.223463707910736e-06, "loss": 0.3029497146606445, "num_input_tokens_seen": 169363720, "step": 2820, "train_runtime": 36216.3979, "train_tokens_per_second": 4676.437 }, { "epoch": 0.36033163265306123, "grad_norm": 0.5888224016142662, "learning_rate": 9.22078055880791e-06, "loss": 0.3287858724594116, "num_input_tokens_seen": 169667624, "step": 2825, "train_runtime": 36274.5372, "train_tokens_per_second": 4677.32 }, { "epoch": 0.36096938775510207, "grad_norm": 0.6344613567674637, "learning_rate": 9.218093173857014e-06, "loss": 0.3351175785064697, "num_input_tokens_seen": 169943176, "step": 2830, "train_runtime": 36335.8157, "train_tokens_per_second": 4677.016 }, { "epoch": 0.36160714285714285, "grad_norm": 0.5388841134081853, "learning_rate": 9.21540155575503e-06, "loss": 0.31265280246734617, "num_input_tokens_seen": 170242256, "step": 2835, "train_runtime": 36393.7576, "train_tokens_per_second": 4677.787 }, { "epoch": 0.3622448979591837, "grad_norm": 0.6093139387451828, "learning_rate": 9.212705707203177e-06, "loss": 0.3472312927246094, "num_input_tokens_seen": 170547664, "step": 2840, "train_runtime": 36458.8101, "train_tokens_per_second": 4677.818 }, { "epoch": 0.36288265306122447, "grad_norm": 0.652622476960517, "learning_rate": 9.210005630906936e-06, "loss": 0.35820655822753905, "num_input_tokens_seen": 170836896, "step": 2845, "train_runtime": 36524.0788, "train_tokens_per_second": 4677.377 }, { "epoch": 0.3635204081632653, "grad_norm": 0.6800502452751199, "learning_rate": 9.207301329576017e-06, "loss": 0.3250127792358398, "num_input_tokens_seen": 171124112, "step": 2850, "train_runtime": 36591.694, "train_tokens_per_second": 4676.583 }, { "epoch": 0.36415816326530615, "grad_norm": 0.6458571217852985, "learning_rate": 9.204592805924378e-06, "loss": 0.30792794227600095, "num_input_tokens_seen": 171415632, "step": 2855, "train_runtime": 36654.0505, "train_tokens_per_second": 4676.581 }, { "epoch": 0.3647959183673469, "grad_norm": 0.6138572708964783, "learning_rate": 9.201880062670207e-06, "loss": 0.3266331911087036, "num_input_tokens_seen": 171710064, "step": 2860, "train_runtime": 36715.3574, "train_tokens_per_second": 4676.791 }, { "epoch": 0.36543367346938777, "grad_norm": 0.6277275327646562, "learning_rate": 9.199163102535937e-06, "loss": 0.32140178680419923, "num_input_tokens_seen": 171999240, "step": 2865, "train_runtime": 36780.1837, "train_tokens_per_second": 4676.411 }, { "epoch": 0.36607142857142855, "grad_norm": 0.6434628865578913, "learning_rate": 9.196441928248222e-06, "loss": 0.3261692762374878, "num_input_tokens_seen": 172288472, "step": 2870, "train_runtime": 36848.3777, "train_tokens_per_second": 4675.605 }, { "epoch": 0.3667091836734694, "grad_norm": 0.6073808497029558, "learning_rate": 9.193716542537956e-06, "loss": 0.30363967418670657, "num_input_tokens_seen": 172588344, "step": 2875, "train_runtime": 36917.1158, "train_tokens_per_second": 4675.022 }, { "epoch": 0.3673469387755102, "grad_norm": 0.569207919774566, "learning_rate": 9.19098694814025e-06, "loss": 0.32173728942871094, "num_input_tokens_seen": 172875936, "step": 2880, "train_runtime": 36985.191, "train_tokens_per_second": 4674.193 }, { "epoch": 0.367984693877551, "grad_norm": 0.5974814328107237, "learning_rate": 9.188253147794443e-06, "loss": 0.3502845287322998, "num_input_tokens_seen": 173184040, "step": 2885, "train_runtime": 37048.7315, "train_tokens_per_second": 4674.493 }, { "epoch": 0.36862244897959184, "grad_norm": 0.6585625245888168, "learning_rate": 9.185515144244097e-06, "loss": 0.32525386810302737, "num_input_tokens_seen": 173471360, "step": 2890, "train_runtime": 37114.1096, "train_tokens_per_second": 4674.0 }, { "epoch": 0.3692602040816326, "grad_norm": 0.6083140568131817, "learning_rate": 9.182772940236986e-06, "loss": 0.33935277462005614, "num_input_tokens_seen": 173774960, "step": 2895, "train_runtime": 37177.3464, "train_tokens_per_second": 4674.216 }, { "epoch": 0.36989795918367346, "grad_norm": 0.6226672976351433, "learning_rate": 9.180026538525106e-06, "loss": 0.3294100522994995, "num_input_tokens_seen": 174073352, "step": 2900, "train_runtime": 37238.7128, "train_tokens_per_second": 4674.527 }, { "epoch": 0.3705357142857143, "grad_norm": 0.6169838965189202, "learning_rate": 9.177275941864663e-06, "loss": 0.34671285152435305, "num_input_tokens_seen": 174387672, "step": 2905, "train_runtime": 37302.8993, "train_tokens_per_second": 4674.909 }, { "epoch": 0.3711734693877551, "grad_norm": 0.6323971217256894, "learning_rate": 9.174521153016072e-06, "loss": 0.33532469272613524, "num_input_tokens_seen": 174680184, "step": 2910, "train_runtime": 37369.6818, "train_tokens_per_second": 4674.382 }, { "epoch": 0.3718112244897959, "grad_norm": 0.6457474184064677, "learning_rate": 9.171762174743954e-06, "loss": 0.3320272207260132, "num_input_tokens_seen": 174977832, "step": 2915, "train_runtime": 37431.3959, "train_tokens_per_second": 4674.627 }, { "epoch": 0.37244897959183676, "grad_norm": 0.6449675776625434, "learning_rate": 9.168999009817141e-06, "loss": 0.3314546585083008, "num_input_tokens_seen": 175264952, "step": 2920, "train_runtime": 37493.4442, "train_tokens_per_second": 4674.549 }, { "epoch": 0.37308673469387754, "grad_norm": 0.554900892997336, "learning_rate": 9.166231661008658e-06, "loss": 0.302897310256958, "num_input_tokens_seen": 175559528, "step": 2925, "train_runtime": 37557.9035, "train_tokens_per_second": 4674.37 }, { "epoch": 0.3737244897959184, "grad_norm": 0.5205229094984876, "learning_rate": 9.163460131095735e-06, "loss": 0.32758631706237795, "num_input_tokens_seen": 175861776, "step": 2930, "train_runtime": 37624.4119, "train_tokens_per_second": 4674.14 }, { "epoch": 0.37436224489795916, "grad_norm": 0.603082200961075, "learning_rate": 9.160684422859794e-06, "loss": 0.3190114736557007, "num_input_tokens_seen": 176159896, "step": 2935, "train_runtime": 37698.0916, "train_tokens_per_second": 4672.913 }, { "epoch": 0.375, "grad_norm": 0.5625469295871551, "learning_rate": 9.157904539086454e-06, "loss": 0.30655779838562014, "num_input_tokens_seen": 176464624, "step": 2940, "train_runtime": 37756.5104, "train_tokens_per_second": 4673.754 }, { "epoch": 0.37563775510204084, "grad_norm": 0.5597768880272735, "learning_rate": 9.15512048256552e-06, "loss": 0.2903357982635498, "num_input_tokens_seen": 176765064, "step": 2945, "train_runtime": 37813.0883, "train_tokens_per_second": 4674.706 }, { "epoch": 0.3762755102040816, "grad_norm": 0.6270106554429195, "learning_rate": 9.15233225609099e-06, "loss": 0.35812888145446775, "num_input_tokens_seen": 177072888, "step": 2950, "train_runtime": 37876.0431, "train_tokens_per_second": 4675.063 }, { "epoch": 0.37691326530612246, "grad_norm": 0.668670832201587, "learning_rate": 9.149539862461044e-06, "loss": 0.3203724384307861, "num_input_tokens_seen": 177373176, "step": 2955, "train_runtime": 37939.6809, "train_tokens_per_second": 4675.136 }, { "epoch": 0.37755102040816324, "grad_norm": 0.5660199250068496, "learning_rate": 9.14674330447804e-06, "loss": 0.303403377532959, "num_input_tokens_seen": 177674416, "step": 2960, "train_runtime": 37990.9536, "train_tokens_per_second": 4676.756 }, { "epoch": 0.3781887755102041, "grad_norm": 0.7481698219271392, "learning_rate": 9.143942584948525e-06, "loss": 0.30948538780212403, "num_input_tokens_seen": 177967240, "step": 2965, "train_runtime": 38056.6991, "train_tokens_per_second": 4676.371 }, { "epoch": 0.3788265306122449, "grad_norm": 0.5222886232940973, "learning_rate": 9.141137706683212e-06, "loss": 0.3155945301055908, "num_input_tokens_seen": 178253216, "step": 2970, "train_runtime": 38121.8658, "train_tokens_per_second": 4675.879 }, { "epoch": 0.3794642857142857, "grad_norm": 0.49631703953331113, "learning_rate": 9.138328672496994e-06, "loss": 0.31378564834594724, "num_input_tokens_seen": 178544880, "step": 2975, "train_runtime": 38183.9745, "train_tokens_per_second": 4675.911 }, { "epoch": 0.38010204081632654, "grad_norm": 0.6436058231086087, "learning_rate": 9.135515485208933e-06, "loss": 0.3197082757949829, "num_input_tokens_seen": 178850032, "step": 2980, "train_runtime": 38253.6709, "train_tokens_per_second": 4675.369 }, { "epoch": 0.3807397959183674, "grad_norm": 0.5725211682100639, "learning_rate": 9.132698147642258e-06, "loss": 0.31581218242645265, "num_input_tokens_seen": 179168080, "step": 2985, "train_runtime": 38309.5937, "train_tokens_per_second": 4676.846 }, { "epoch": 0.38137755102040816, "grad_norm": 0.6246530414856488, "learning_rate": 9.129876662624366e-06, "loss": 0.3519841194152832, "num_input_tokens_seen": 179479912, "step": 2990, "train_runtime": 38379.5778, "train_tokens_per_second": 4676.443 }, { "epoch": 0.382015306122449, "grad_norm": 0.6094334734716867, "learning_rate": 9.127051032986814e-06, "loss": 0.2976883888244629, "num_input_tokens_seen": 179771336, "step": 2995, "train_runtime": 38446.0382, "train_tokens_per_second": 4675.939 }, { "epoch": 0.3826530612244898, "grad_norm": 0.579574719034915, "learning_rate": 9.124221261565316e-06, "loss": 0.3473198413848877, "num_input_tokens_seen": 180073608, "step": 3000, "train_runtime": 38511.5091, "train_tokens_per_second": 4675.839 }, { "epoch": 0.3832908163265306, "grad_norm": 0.6510082302461844, "learning_rate": 9.121387351199748e-06, "loss": 0.32548723220825193, "num_input_tokens_seen": 180367392, "step": 3005, "train_runtime": 38574.6434, "train_tokens_per_second": 4675.802 }, { "epoch": 0.38392857142857145, "grad_norm": 0.6382767685052189, "learning_rate": 9.118549304734136e-06, "loss": 0.32240729331970214, "num_input_tokens_seen": 180668864, "step": 3010, "train_runtime": 38634.8884, "train_tokens_per_second": 4676.314 }, { "epoch": 0.38456632653061223, "grad_norm": 0.5632490493326954, "learning_rate": 9.115707125016658e-06, "loss": 0.33153977394104006, "num_input_tokens_seen": 180960696, "step": 3015, "train_runtime": 38688.9969, "train_tokens_per_second": 4677.317 }, { "epoch": 0.3852040816326531, "grad_norm": 0.6514142403869994, "learning_rate": 9.112860814899637e-06, "loss": 0.32599313259124757, "num_input_tokens_seen": 181273312, "step": 3020, "train_runtime": 38750.2165, "train_tokens_per_second": 4677.995 }, { "epoch": 0.38584183673469385, "grad_norm": 0.6182466837580296, "learning_rate": 9.110010377239552e-06, "loss": 0.33211407661437986, "num_input_tokens_seen": 181574648, "step": 3025, "train_runtime": 38815.5721, "train_tokens_per_second": 4677.882 }, { "epoch": 0.3864795918367347, "grad_norm": 0.5601908246102765, "learning_rate": 9.107155814897007e-06, "loss": 0.324910306930542, "num_input_tokens_seen": 181866008, "step": 3030, "train_runtime": 38880.295, "train_tokens_per_second": 4677.588 }, { "epoch": 0.38711734693877553, "grad_norm": 0.4971285244063714, "learning_rate": 9.10429713073676e-06, "loss": 0.3084129810333252, "num_input_tokens_seen": 182175176, "step": 3035, "train_runtime": 38938.018, "train_tokens_per_second": 4678.594 }, { "epoch": 0.3877551020408163, "grad_norm": 0.6178381426220323, "learning_rate": 9.101434327627696e-06, "loss": 0.34023480415344237, "num_input_tokens_seen": 182486080, "step": 3040, "train_runtime": 38996.5405, "train_tokens_per_second": 4679.545 }, { "epoch": 0.38839285714285715, "grad_norm": 0.5548632507090535, "learning_rate": 9.098567408442844e-06, "loss": 0.3091944932937622, "num_input_tokens_seen": 182802528, "step": 3045, "train_runtime": 39052.9148, "train_tokens_per_second": 4680.893 }, { "epoch": 0.38903061224489793, "grad_norm": 0.5474032113628822, "learning_rate": 9.095696376059353e-06, "loss": 0.3133708000183105, "num_input_tokens_seen": 183105160, "step": 3050, "train_runtime": 39109.3133, "train_tokens_per_second": 4681.881 }, { "epoch": 0.38966836734693877, "grad_norm": 0.6843299763951822, "learning_rate": 9.092821233358507e-06, "loss": 0.33481783866882325, "num_input_tokens_seen": 183408712, "step": 3055, "train_runtime": 39170.6318, "train_tokens_per_second": 4682.302 }, { "epoch": 0.3903061224489796, "grad_norm": 0.5811761384996502, "learning_rate": 9.08994198322571e-06, "loss": 0.3331594705581665, "num_input_tokens_seen": 183706944, "step": 3060, "train_runtime": 39238.5567, "train_tokens_per_second": 4681.797 }, { "epoch": 0.3909438775510204, "grad_norm": 0.5674901161494683, "learning_rate": 9.087058628550492e-06, "loss": 0.31420512199401857, "num_input_tokens_seen": 184015168, "step": 3065, "train_runtime": 39303.8812, "train_tokens_per_second": 4681.857 }, { "epoch": 0.39158163265306123, "grad_norm": 0.7158630858394088, "learning_rate": 9.084171172226502e-06, "loss": 0.2939667463302612, "num_input_tokens_seen": 184332648, "step": 3070, "train_runtime": 39354.5198, "train_tokens_per_second": 4683.9 }, { "epoch": 0.39221938775510207, "grad_norm": 0.5816620511179589, "learning_rate": 9.081279617151502e-06, "loss": 0.3151503086090088, "num_input_tokens_seen": 184623808, "step": 3075, "train_runtime": 39403.7366, "train_tokens_per_second": 4685.439 }, { "epoch": 0.39285714285714285, "grad_norm": 0.6445589588862652, "learning_rate": 9.078383966227369e-06, "loss": 0.32155604362487794, "num_input_tokens_seen": 184932032, "step": 3080, "train_runtime": 39463.4086, "train_tokens_per_second": 4686.165 }, { "epoch": 0.3934948979591837, "grad_norm": 0.5216398653856932, "learning_rate": 9.075484222360094e-06, "loss": 0.307496976852417, "num_input_tokens_seen": 185235592, "step": 3085, "train_runtime": 39523.4911, "train_tokens_per_second": 4686.721 }, { "epoch": 0.39413265306122447, "grad_norm": 0.7094243044216487, "learning_rate": 9.07258038845977e-06, "loss": 0.32785470485687257, "num_input_tokens_seen": 185545640, "step": 3090, "train_runtime": 39583.9255, "train_tokens_per_second": 4687.399 }, { "epoch": 0.3947704081632653, "grad_norm": 0.6309446058605152, "learning_rate": 9.069672467440598e-06, "loss": 0.3231490135192871, "num_input_tokens_seen": 185845600, "step": 3095, "train_runtime": 39658.7876, "train_tokens_per_second": 4686.114 }, { "epoch": 0.39540816326530615, "grad_norm": 0.585772820107222, "learning_rate": 9.066760462220878e-06, "loss": 0.337585973739624, "num_input_tokens_seen": 186156072, "step": 3100, "train_runtime": 39717.11, "train_tokens_per_second": 4687.05 }, { "epoch": 0.3960459183673469, "grad_norm": 0.6192860021409862, "learning_rate": 9.063844375723014e-06, "loss": 0.31592369079589844, "num_input_tokens_seen": 186463704, "step": 3105, "train_runtime": 39786.4089, "train_tokens_per_second": 4686.618 }, { "epoch": 0.39668367346938777, "grad_norm": 0.5311206414365938, "learning_rate": 9.060924210873501e-06, "loss": 0.3220933437347412, "num_input_tokens_seen": 186785992, "step": 3110, "train_runtime": 39847.0541, "train_tokens_per_second": 4687.573 }, { "epoch": 0.39732142857142855, "grad_norm": 0.5881670251104146, "learning_rate": 9.057999970602926e-06, "loss": 0.3254377841949463, "num_input_tokens_seen": 187099280, "step": 3115, "train_runtime": 39910.9643, "train_tokens_per_second": 4687.917 }, { "epoch": 0.3979591836734694, "grad_norm": 0.5769219565213103, "learning_rate": 9.055071657845973e-06, "loss": 0.31120288372039795, "num_input_tokens_seen": 187390408, "step": 3120, "train_runtime": 39982.7885, "train_tokens_per_second": 4686.777 }, { "epoch": 0.3985969387755102, "grad_norm": 0.693372345161722, "learning_rate": 9.052139275541404e-06, "loss": 0.3250961065292358, "num_input_tokens_seen": 187701720, "step": 3125, "train_runtime": 40040.1779, "train_tokens_per_second": 4687.834 }, { "epoch": 0.399234693877551, "grad_norm": 0.5960444987475249, "learning_rate": 9.049202826632072e-06, "loss": 0.2999398231506348, "num_input_tokens_seen": 187998736, "step": 3130, "train_runtime": 40096.9613, "train_tokens_per_second": 4688.603 }, { "epoch": 0.39987244897959184, "grad_norm": 0.5463541161895422, "learning_rate": 9.046262314064907e-06, "loss": 0.33198843002319334, "num_input_tokens_seen": 188297576, "step": 3135, "train_runtime": 40161.2612, "train_tokens_per_second": 4688.537 }, { "epoch": 0.4005102040816326, "grad_norm": 0.6241038136594013, "learning_rate": 9.04331774079092e-06, "loss": 0.3063666343688965, "num_input_tokens_seen": 188595928, "step": 3140, "train_runtime": 40207.4881, "train_tokens_per_second": 4690.567 }, { "epoch": 0.40114795918367346, "grad_norm": 0.6073385562269218, "learning_rate": 9.040369109765196e-06, "loss": 0.3146181583404541, "num_input_tokens_seen": 188895056, "step": 3145, "train_runtime": 40270.6058, "train_tokens_per_second": 4690.644 }, { "epoch": 0.4017857142857143, "grad_norm": 0.6020250384039302, "learning_rate": 9.037416423946891e-06, "loss": 0.3437767505645752, "num_input_tokens_seen": 189191384, "step": 3150, "train_runtime": 40334.6693, "train_tokens_per_second": 4690.54 }, { "epoch": 0.4024234693877551, "grad_norm": 0.6119629066804524, "learning_rate": 9.034459686299232e-06, "loss": 0.31041080951690675, "num_input_tokens_seen": 189495232, "step": 3155, "train_runtime": 40395.4823, "train_tokens_per_second": 4691.001 }, { "epoch": 0.4030612244897959, "grad_norm": 0.5490785230095873, "learning_rate": 9.031498899789513e-06, "loss": 0.3348876714706421, "num_input_tokens_seen": 189813744, "step": 3160, "train_runtime": 40457.3509, "train_tokens_per_second": 4691.7 }, { "epoch": 0.40369897959183676, "grad_norm": 0.6039839232260207, "learning_rate": 9.028534067389087e-06, "loss": 0.325526762008667, "num_input_tokens_seen": 190113264, "step": 3165, "train_runtime": 40516.0089, "train_tokens_per_second": 4692.3 }, { "epoch": 0.40433673469387754, "grad_norm": 0.6303117453449549, "learning_rate": 9.025565192073374e-06, "loss": 0.3193602323532104, "num_input_tokens_seen": 190413432, "step": 3170, "train_runtime": 40585.7812, "train_tokens_per_second": 4691.629 }, { "epoch": 0.4049744897959184, "grad_norm": 0.502369365072304, "learning_rate": 9.022592276821843e-06, "loss": 0.314216160774231, "num_input_tokens_seen": 190718384, "step": 3175, "train_runtime": 40647.5957, "train_tokens_per_second": 4691.997 }, { "epoch": 0.40561224489795916, "grad_norm": 0.679147229110305, "learning_rate": 9.019615324618027e-06, "loss": 0.3158599615097046, "num_input_tokens_seen": 191023384, "step": 3180, "train_runtime": 40710.5992, "train_tokens_per_second": 4692.227 }, { "epoch": 0.40625, "grad_norm": 2.1548596354114316, "learning_rate": 9.016634338449504e-06, "loss": 0.3082659006118774, "num_input_tokens_seen": 191334512, "step": 3185, "train_runtime": 40784.1677, "train_tokens_per_second": 4691.392 }, { "epoch": 0.40688775510204084, "grad_norm": 0.6126987296501494, "learning_rate": 9.0136493213079e-06, "loss": 0.35937573909759524, "num_input_tokens_seen": 191644088, "step": 3190, "train_runtime": 40837.2098, "train_tokens_per_second": 4692.879 }, { "epoch": 0.4075255102040816, "grad_norm": 0.5911598977521823, "learning_rate": 9.01066027618889e-06, "loss": 0.32959134578704835, "num_input_tokens_seen": 191943728, "step": 3195, "train_runtime": 40905.0155, "train_tokens_per_second": 4692.425 }, { "epoch": 0.40816326530612246, "grad_norm": 0.6158375431469726, "learning_rate": 9.007667206092188e-06, "loss": 0.3300974130630493, "num_input_tokens_seen": 192245368, "step": 3200, "train_runtime": 40978.8867, "train_tokens_per_second": 4691.327 }, { "epoch": 0.40880102040816324, "grad_norm": 0.5524067403238563, "learning_rate": 9.00467011402155e-06, "loss": 0.3166048526763916, "num_input_tokens_seen": 192550496, "step": 3205, "train_runtime": 41056.7877, "train_tokens_per_second": 4689.858 }, { "epoch": 0.4094387755102041, "grad_norm": 0.6526435021969289, "learning_rate": 9.001669002984767e-06, "loss": 0.31752676963806153, "num_input_tokens_seen": 192839112, "step": 3210, "train_runtime": 41113.8029, "train_tokens_per_second": 4690.374 }, { "epoch": 0.4100765306122449, "grad_norm": 0.6171092895650897, "learning_rate": 8.998663875993666e-06, "loss": 0.3099684238433838, "num_input_tokens_seen": 193145744, "step": 3215, "train_runtime": 41173.0537, "train_tokens_per_second": 4691.072 }, { "epoch": 0.4107142857142857, "grad_norm": 0.6351840250528298, "learning_rate": 8.995654736064096e-06, "loss": 0.3157944679260254, "num_input_tokens_seen": 193444720, "step": 3220, "train_runtime": 41242.4823, "train_tokens_per_second": 4690.424 }, { "epoch": 0.41135204081632654, "grad_norm": 0.7096499688646882, "learning_rate": 8.992641586215944e-06, "loss": 0.31511194705963136, "num_input_tokens_seen": 193740152, "step": 3225, "train_runtime": 41316.6862, "train_tokens_per_second": 4689.15 }, { "epoch": 0.4119897959183674, "grad_norm": 0.6489642469997576, "learning_rate": 8.989624429473116e-06, "loss": 0.3469348192214966, "num_input_tokens_seen": 194038616, "step": 3230, "train_runtime": 41372.4449, "train_tokens_per_second": 4690.045 }, { "epoch": 0.41262755102040816, "grad_norm": 0.6253957179146292, "learning_rate": 8.986603268863536e-06, "loss": 0.30385029315948486, "num_input_tokens_seen": 194342968, "step": 3235, "train_runtime": 41435.5938, "train_tokens_per_second": 4690.242 }, { "epoch": 0.413265306122449, "grad_norm": 0.5764196777561061, "learning_rate": 8.983578107419153e-06, "loss": 0.3338628768920898, "num_input_tokens_seen": 194634464, "step": 3240, "train_runtime": 41499.3601, "train_tokens_per_second": 4690.059 }, { "epoch": 0.4139030612244898, "grad_norm": 0.6363802995158825, "learning_rate": 8.980548948175926e-06, "loss": 0.32214794158935545, "num_input_tokens_seen": 194934600, "step": 3245, "train_runtime": 41570.4501, "train_tokens_per_second": 4689.259 }, { "epoch": 0.4145408163265306, "grad_norm": 0.6255302689335023, "learning_rate": 8.97751579417383e-06, "loss": 0.347865629196167, "num_input_tokens_seen": 195236360, "step": 3250, "train_runtime": 41640.6809, "train_tokens_per_second": 4688.597 }, { "epoch": 0.41517857142857145, "grad_norm": 0.5504023160480871, "learning_rate": 8.974478648456845e-06, "loss": 0.33169217109680177, "num_input_tokens_seen": 195547784, "step": 3255, "train_runtime": 41708.5101, "train_tokens_per_second": 4688.438 }, { "epoch": 0.41581632653061223, "grad_norm": 0.599057696663512, "learning_rate": 8.971437514072959e-06, "loss": 0.3121060848236084, "num_input_tokens_seen": 195850144, "step": 3260, "train_runtime": 41778.9639, "train_tokens_per_second": 4687.769 }, { "epoch": 0.4164540816326531, "grad_norm": 0.5589495788658304, "learning_rate": 8.968392394074164e-06, "loss": 0.3321085929870605, "num_input_tokens_seen": 196149992, "step": 3265, "train_runtime": 41836.1766, "train_tokens_per_second": 4688.526 }, { "epoch": 0.41709183673469385, "grad_norm": 0.8438741101842504, "learning_rate": 8.965343291516448e-06, "loss": 0.3220966339111328, "num_input_tokens_seen": 196442800, "step": 3270, "train_runtime": 41908.493, "train_tokens_per_second": 4687.422 }, { "epoch": 0.4177295918367347, "grad_norm": 0.5219612583404035, "learning_rate": 8.962290209459801e-06, "loss": 0.29323763847351075, "num_input_tokens_seen": 196751416, "step": 3275, "train_runtime": 41961.715, "train_tokens_per_second": 4688.832 }, { "epoch": 0.41836734693877553, "grad_norm": 0.5921272335273982, "learning_rate": 8.959233150968203e-06, "loss": 0.30167346000671386, "num_input_tokens_seen": 197039568, "step": 3280, "train_runtime": 42022.326, "train_tokens_per_second": 4688.926 }, { "epoch": 0.4190051020408163, "grad_norm": 0.6436079802230608, "learning_rate": 8.956172119109625e-06, "loss": 0.32533998489379884, "num_input_tokens_seen": 197316768, "step": 3285, "train_runtime": 42088.9143, "train_tokens_per_second": 4688.094 }, { "epoch": 0.41964285714285715, "grad_norm": 0.5625984955814649, "learning_rate": 8.953107116956027e-06, "loss": 0.33030574321746825, "num_input_tokens_seen": 197621504, "step": 3290, "train_runtime": 42147.4511, "train_tokens_per_second": 4688.813 }, { "epoch": 0.42028061224489793, "grad_norm": 0.6472563142078905, "learning_rate": 8.950038147583353e-06, "loss": 0.32565693855285643, "num_input_tokens_seen": 197910040, "step": 3295, "train_runtime": 42210.7532, "train_tokens_per_second": 4688.617 }, { "epoch": 0.42091836734693877, "grad_norm": 0.651944716977726, "learning_rate": 8.946965214071528e-06, "loss": 0.3277165174484253, "num_input_tokens_seen": 198210360, "step": 3300, "train_runtime": 42276.57, "train_tokens_per_second": 4688.421 }, { "epoch": 0.4215561224489796, "grad_norm": 0.5644835498940443, "learning_rate": 8.943888319504456e-06, "loss": 0.3059228897094727, "num_input_tokens_seen": 198520280, "step": 3305, "train_runtime": 42340.6205, "train_tokens_per_second": 4688.648 }, { "epoch": 0.4221938775510204, "grad_norm": 0.6174447870952193, "learning_rate": 8.940807466970014e-06, "loss": 0.33121767044067385, "num_input_tokens_seen": 198822224, "step": 3310, "train_runtime": 42395.7598, "train_tokens_per_second": 4689.672 }, { "epoch": 0.42283163265306123, "grad_norm": 0.6052243828745715, "learning_rate": 8.937722659560054e-06, "loss": 0.342440128326416, "num_input_tokens_seen": 199124776, "step": 3315, "train_runtime": 42464.2008, "train_tokens_per_second": 4689.239 }, { "epoch": 0.42346938775510207, "grad_norm": 0.5528499168638967, "learning_rate": 8.934633900370395e-06, "loss": 0.3259343385696411, "num_input_tokens_seen": 199420408, "step": 3320, "train_runtime": 42534.3094, "train_tokens_per_second": 4688.46 }, { "epoch": 0.42410714285714285, "grad_norm": 0.5671579367989095, "learning_rate": 8.931541192500822e-06, "loss": 0.29687554836273194, "num_input_tokens_seen": 199716672, "step": 3325, "train_runtime": 42598.2667, "train_tokens_per_second": 4688.376 }, { "epoch": 0.4247448979591837, "grad_norm": 0.5894132936373059, "learning_rate": 8.928444539055086e-06, "loss": 0.33872098922729493, "num_input_tokens_seen": 200021208, "step": 3330, "train_runtime": 42668.2397, "train_tokens_per_second": 4687.824 }, { "epoch": 0.42538265306122447, "grad_norm": 0.6090440054505855, "learning_rate": 8.92534394314089e-06, "loss": 0.33945250511169434, "num_input_tokens_seen": 200315992, "step": 3335, "train_runtime": 42726.5478, "train_tokens_per_second": 4688.326 }, { "epoch": 0.4260204081632653, "grad_norm": 0.5735284959805205, "learning_rate": 8.922239407869904e-06, "loss": 0.3439453601837158, "num_input_tokens_seen": 200609824, "step": 3340, "train_runtime": 42790.9851, "train_tokens_per_second": 4688.133 }, { "epoch": 0.42665816326530615, "grad_norm": 0.5581658857242167, "learning_rate": 8.919130936357743e-06, "loss": 0.3368233680725098, "num_input_tokens_seen": 200902288, "step": 3345, "train_runtime": 42866.4423, "train_tokens_per_second": 4686.703 }, { "epoch": 0.4272959183673469, "grad_norm": 0.6014445852209643, "learning_rate": 8.916018531723975e-06, "loss": 0.3475268602371216, "num_input_tokens_seen": 201211416, "step": 3350, "train_runtime": 42934.4717, "train_tokens_per_second": 4686.477 }, { "epoch": 0.42793367346938777, "grad_norm": 0.6456452430025559, "learning_rate": 8.91290219709212e-06, "loss": 0.31551270484924315, "num_input_tokens_seen": 201488776, "step": 3355, "train_runtime": 42999.6964, "train_tokens_per_second": 4685.819 }, { "epoch": 0.42857142857142855, "grad_norm": 0.6640341757996214, "learning_rate": 8.909781935589629e-06, "loss": 0.3253334522247314, "num_input_tokens_seen": 201782120, "step": 3360, "train_runtime": 43065.6986, "train_tokens_per_second": 4685.449 }, { "epoch": 0.4292091836734694, "grad_norm": 0.6483824588057587, "learning_rate": 8.906657750347909e-06, "loss": 0.32048940658569336, "num_input_tokens_seen": 202068240, "step": 3365, "train_runtime": 43134.2271, "train_tokens_per_second": 4684.638 }, { "epoch": 0.4298469387755102, "grad_norm": 0.5715684018538307, "learning_rate": 8.903529644502297e-06, "loss": 0.3232470989227295, "num_input_tokens_seen": 202369128, "step": 3370, "train_runtime": 43202.7163, "train_tokens_per_second": 4684.176 }, { "epoch": 0.430484693877551, "grad_norm": 0.5447639244848349, "learning_rate": 8.900397621192063e-06, "loss": 0.33262906074523924, "num_input_tokens_seen": 202668864, "step": 3375, "train_runtime": 43261.3826, "train_tokens_per_second": 4684.752 }, { "epoch": 0.43112244897959184, "grad_norm": 0.6136167689578654, "learning_rate": 8.897261683560413e-06, "loss": 0.3484243869781494, "num_input_tokens_seen": 202992192, "step": 3380, "train_runtime": 43312.0423, "train_tokens_per_second": 4686.738 }, { "epoch": 0.4317602040816326, "grad_norm": 0.5605678764252943, "learning_rate": 8.89412183475448e-06, "loss": 0.31671900749206544, "num_input_tokens_seen": 203292680, "step": 3385, "train_runtime": 43385.9122, "train_tokens_per_second": 4685.684 }, { "epoch": 0.43239795918367346, "grad_norm": 0.5449801304902008, "learning_rate": 8.890978077925323e-06, "loss": 0.30098576545715333, "num_input_tokens_seen": 203602792, "step": 3390, "train_runtime": 43455.4191, "train_tokens_per_second": 4685.326 }, { "epoch": 0.4330357142857143, "grad_norm": 0.5718214775448611, "learning_rate": 8.887830416227918e-06, "loss": 0.3349436283111572, "num_input_tokens_seen": 203894240, "step": 3395, "train_runtime": 43516.0658, "train_tokens_per_second": 4685.493 }, { "epoch": 0.4336734693877551, "grad_norm": 0.5491846722687903, "learning_rate": 8.884678852821165e-06, "loss": 0.3207132339477539, "num_input_tokens_seen": 204195296, "step": 3400, "train_runtime": 43584.9617, "train_tokens_per_second": 4684.994 }, { "epoch": 0.4343112244897959, "grad_norm": 0.5131986116157814, "learning_rate": 8.881523390867876e-06, "loss": 0.28901073932647703, "num_input_tokens_seen": 204501952, "step": 3405, "train_runtime": 43643.4227, "train_tokens_per_second": 4685.745 }, { "epoch": 0.43494897959183676, "grad_norm": 0.6369571741647311, "learning_rate": 8.878364033534781e-06, "loss": 0.316038990020752, "num_input_tokens_seen": 204808760, "step": 3410, "train_runtime": 43701.254, "train_tokens_per_second": 4686.565 }, { "epoch": 0.43558673469387754, "grad_norm": 0.6049679474241683, "learning_rate": 8.875200783992514e-06, "loss": 0.3199471950531006, "num_input_tokens_seen": 205114392, "step": 3415, "train_runtime": 43759.3217, "train_tokens_per_second": 4687.33 }, { "epoch": 0.4362244897959184, "grad_norm": 0.5442531763542, "learning_rate": 8.872033645415617e-06, "loss": 0.3352459669113159, "num_input_tokens_seen": 205429936, "step": 3420, "train_runtime": 43820.5566, "train_tokens_per_second": 4687.981 }, { "epoch": 0.43686224489795916, "grad_norm": 0.60890948257868, "learning_rate": 8.868862620982534e-06, "loss": 0.32459220886230467, "num_input_tokens_seen": 205724432, "step": 3425, "train_runtime": 43889.6241, "train_tokens_per_second": 4687.314 }, { "epoch": 0.4375, "grad_norm": 0.5715140225599952, "learning_rate": 8.86568771387561e-06, "loss": 0.2873693466186523, "num_input_tokens_seen": 206029616, "step": 3430, "train_runtime": 43962.5793, "train_tokens_per_second": 4686.477 }, { "epoch": 0.43813775510204084, "grad_norm": 0.6279456681396556, "learning_rate": 8.862508927281086e-06, "loss": 0.3436110973358154, "num_input_tokens_seen": 206319016, "step": 3435, "train_runtime": 44037.1796, "train_tokens_per_second": 4685.11 }, { "epoch": 0.4387755102040816, "grad_norm": 0.6260792472646204, "learning_rate": 8.859326264389098e-06, "loss": 0.30514523983001707, "num_input_tokens_seen": 206606112, "step": 3440, "train_runtime": 44100.5969, "train_tokens_per_second": 4684.882 }, { "epoch": 0.43941326530612246, "grad_norm": 0.68482154832881, "learning_rate": 8.856139728393667e-06, "loss": 0.32379128932952883, "num_input_tokens_seen": 206904232, "step": 3445, "train_runtime": 44168.5824, "train_tokens_per_second": 4684.421 }, { "epoch": 0.44005102040816324, "grad_norm": 0.5930425986425011, "learning_rate": 8.852949322492708e-06, "loss": 0.28973195552825926, "num_input_tokens_seen": 207193664, "step": 3450, "train_runtime": 44231.8882, "train_tokens_per_second": 4684.26 }, { "epoch": 0.4406887755102041, "grad_norm": 0.6825580182781947, "learning_rate": 8.849755049888014e-06, "loss": 0.29935970306396487, "num_input_tokens_seen": 207494832, "step": 3455, "train_runtime": 44287.5443, "train_tokens_per_second": 4685.174 }, { "epoch": 0.4413265306122449, "grad_norm": 0.5133954359714166, "learning_rate": 8.84655691378526e-06, "loss": 0.29735455513000486, "num_input_tokens_seen": 207804120, "step": 3460, "train_runtime": 44348.9126, "train_tokens_per_second": 4685.664 }, { "epoch": 0.4419642857142857, "grad_norm": 0.7101324223192657, "learning_rate": 8.843354917394e-06, "loss": 0.32294692993164065, "num_input_tokens_seen": 208093840, "step": 3465, "train_runtime": 44422.4075, "train_tokens_per_second": 4684.434 }, { "epoch": 0.44260204081632654, "grad_norm": 0.616180186681375, "learning_rate": 8.840149063927663e-06, "loss": 0.3034783601760864, "num_input_tokens_seen": 208411648, "step": 3470, "train_runtime": 44483.9149, "train_tokens_per_second": 4685.101 }, { "epoch": 0.4432397959183674, "grad_norm": 0.6407549783367804, "learning_rate": 8.836939356603542e-06, "loss": 0.3212604522705078, "num_input_tokens_seen": 208712352, "step": 3475, "train_runtime": 44555.0981, "train_tokens_per_second": 4684.365 }, { "epoch": 0.44387755102040816, "grad_norm": 0.6310875509643901, "learning_rate": 8.833725798642809e-06, "loss": 0.3165870666503906, "num_input_tokens_seen": 209023584, "step": 3480, "train_runtime": 44627.7031, "train_tokens_per_second": 4683.718 }, { "epoch": 0.444515306122449, "grad_norm": 0.5486220172333803, "learning_rate": 8.830508393270487e-06, "loss": 0.3032956123352051, "num_input_tokens_seen": 209326680, "step": 3485, "train_runtime": 44687.319, "train_tokens_per_second": 4684.252 }, { "epoch": 0.4451530612244898, "grad_norm": 0.6036304484912378, "learning_rate": 8.827287143715472e-06, "loss": 0.3312588930130005, "num_input_tokens_seen": 209634992, "step": 3490, "train_runtime": 44743.8105, "train_tokens_per_second": 4685.229 }, { "epoch": 0.4457908163265306, "grad_norm": 1.0000561430667463, "learning_rate": 8.824062053210512e-06, "loss": 0.3453768253326416, "num_input_tokens_seen": 209945984, "step": 3495, "train_runtime": 44799.5629, "train_tokens_per_second": 4686.34 }, { "epoch": 0.44642857142857145, "grad_norm": 0.6165732258516156, "learning_rate": 8.820833124992207e-06, "loss": 0.31481189727783204, "num_input_tokens_seen": 210254920, "step": 3500, "train_runtime": 44865.7239, "train_tokens_per_second": 4686.315 }, { "epoch": 0.44706632653061223, "grad_norm": 0.635726610334787, "learning_rate": 8.817600362301018e-06, "loss": 0.33425703048706057, "num_input_tokens_seen": 210556560, "step": 3505, "train_runtime": 44924.0301, "train_tokens_per_second": 4686.947 }, { "epoch": 0.4477040816326531, "grad_norm": 0.566236154272825, "learning_rate": 8.814363768381242e-06, "loss": 0.33902735710144044, "num_input_tokens_seen": 210871448, "step": 3510, "train_runtime": 44987.2966, "train_tokens_per_second": 4687.355 }, { "epoch": 0.44834183673469385, "grad_norm": 0.5145047175941144, "learning_rate": 8.81112334648103e-06, "loss": 0.31283936500549314, "num_input_tokens_seen": 211172816, "step": 3515, "train_runtime": 45042.6304, "train_tokens_per_second": 4688.288 }, { "epoch": 0.4489795918367347, "grad_norm": 0.5673226459992542, "learning_rate": 8.807879099852372e-06, "loss": 0.30037946701049806, "num_input_tokens_seen": 211474016, "step": 3520, "train_runtime": 45115.5993, "train_tokens_per_second": 4687.381 }, { "epoch": 0.44961734693877553, "grad_norm": 0.5881209697924512, "learning_rate": 8.804631031751096e-06, "loss": 0.29651522636413574, "num_input_tokens_seen": 211771800, "step": 3525, "train_runtime": 45174.4221, "train_tokens_per_second": 4687.87 }, { "epoch": 0.4502551020408163, "grad_norm": 0.6182947239481263, "learning_rate": 8.801379145436866e-06, "loss": 0.2972166299819946, "num_input_tokens_seen": 212068808, "step": 3530, "train_runtime": 45241.6059, "train_tokens_per_second": 4687.473 }, { "epoch": 0.45089285714285715, "grad_norm": 0.5918083309528803, "learning_rate": 8.798123444173174e-06, "loss": 0.3081668853759766, "num_input_tokens_seen": 212370816, "step": 3535, "train_runtime": 45312.2187, "train_tokens_per_second": 4686.833 }, { "epoch": 0.45153061224489793, "grad_norm": 0.6423743956345168, "learning_rate": 8.794863931227346e-06, "loss": 0.30899815559387206, "num_input_tokens_seen": 212667944, "step": 3540, "train_runtime": 45381.4461, "train_tokens_per_second": 4686.231 }, { "epoch": 0.45216836734693877, "grad_norm": 0.566686236522869, "learning_rate": 8.79160060987053e-06, "loss": 0.3186926364898682, "num_input_tokens_seen": 212976656, "step": 3545, "train_runtime": 45441.7075, "train_tokens_per_second": 4686.81 }, { "epoch": 0.4528061224489796, "grad_norm": 0.5891548119707445, "learning_rate": 8.788333483377699e-06, "loss": 0.33061072826385496, "num_input_tokens_seen": 213278936, "step": 3550, "train_runtime": 45501.3328, "train_tokens_per_second": 4687.312 }, { "epoch": 0.4534438775510204, "grad_norm": 0.6233804886050337, "learning_rate": 8.785062555027637e-06, "loss": 0.31149797439575194, "num_input_tokens_seen": 213573832, "step": 3555, "train_runtime": 45558.5219, "train_tokens_per_second": 4687.901 }, { "epoch": 0.45408163265306123, "grad_norm": 0.5966089919793925, "learning_rate": 8.781787828102958e-06, "loss": 0.3415715217590332, "num_input_tokens_seen": 213883168, "step": 3560, "train_runtime": 45616.5553, "train_tokens_per_second": 4688.718 }, { "epoch": 0.45471938775510207, "grad_norm": 0.5861249272190848, "learning_rate": 8.778509305890069e-06, "loss": 0.3334629774093628, "num_input_tokens_seen": 214190912, "step": 3565, "train_runtime": 45675.1674, "train_tokens_per_second": 4689.439 }, { "epoch": 0.45535714285714285, "grad_norm": 0.6369980505919692, "learning_rate": 8.775226991679205e-06, "loss": 0.3384882926940918, "num_input_tokens_seen": 214502256, "step": 3570, "train_runtime": 45737.4637, "train_tokens_per_second": 4689.859 }, { "epoch": 0.4559948979591837, "grad_norm": 0.6964150252536505, "learning_rate": 8.77194088876439e-06, "loss": 0.3140512704849243, "num_input_tokens_seen": 214783328, "step": 3575, "train_runtime": 45802.4673, "train_tokens_per_second": 4689.34 }, { "epoch": 0.45663265306122447, "grad_norm": 0.7522468475076703, "learning_rate": 8.768651000443463e-06, "loss": 0.3444084644317627, "num_input_tokens_seen": 215087536, "step": 3580, "train_runtime": 45860.8405, "train_tokens_per_second": 4690.004 }, { "epoch": 0.4572704081632653, "grad_norm": 0.6162932046287327, "learning_rate": 8.765357330018056e-06, "loss": 0.3437525510787964, "num_input_tokens_seen": 215396736, "step": 3585, "train_runtime": 45922.62, "train_tokens_per_second": 4690.428 }, { "epoch": 0.45790816326530615, "grad_norm": 0.5843167708342699, "learning_rate": 8.762059880793595e-06, "loss": 0.32638962268829347, "num_input_tokens_seen": 215690808, "step": 3590, "train_runtime": 45983.7838, "train_tokens_per_second": 4690.584 }, { "epoch": 0.4585459183673469, "grad_norm": 0.5824123384380021, "learning_rate": 8.758758656079303e-06, "loss": 0.3440886974334717, "num_input_tokens_seen": 215988576, "step": 3595, "train_runtime": 46053.4432, "train_tokens_per_second": 4689.955 }, { "epoch": 0.45918367346938777, "grad_norm": 0.5574951426169432, "learning_rate": 8.755453659188186e-06, "loss": 0.33778557777404783, "num_input_tokens_seen": 216292144, "step": 3600, "train_runtime": 46114.0844, "train_tokens_per_second": 4690.371 }, { "epoch": 0.45982142857142855, "grad_norm": 0.5899376920985997, "learning_rate": 8.752144893437045e-06, "loss": 0.3352713108062744, "num_input_tokens_seen": 216593688, "step": 3605, "train_runtime": 46172.8945, "train_tokens_per_second": 4690.927 }, { "epoch": 0.4604591836734694, "grad_norm": 0.5847283713717142, "learning_rate": 8.748832362146454e-06, "loss": 0.3330048084259033, "num_input_tokens_seen": 216892048, "step": 3610, "train_runtime": 46246.9183, "train_tokens_per_second": 4689.87 }, { "epoch": 0.4610969387755102, "grad_norm": 0.6010388681667821, "learning_rate": 8.745516068640767e-06, "loss": 0.2907567977905273, "num_input_tokens_seen": 217182808, "step": 3615, "train_runtime": 46313.6167, "train_tokens_per_second": 4689.394 }, { "epoch": 0.461734693877551, "grad_norm": 0.6939045255363584, "learning_rate": 8.742196016248121e-06, "loss": 0.2981436014175415, "num_input_tokens_seen": 217476928, "step": 3620, "train_runtime": 46376.0369, "train_tokens_per_second": 4689.425 }, { "epoch": 0.46237244897959184, "grad_norm": 0.5563072773387618, "learning_rate": 8.738872208300417e-06, "loss": 0.31744837760925293, "num_input_tokens_seen": 217795992, "step": 3625, "train_runtime": 46434.5679, "train_tokens_per_second": 4690.385 }, { "epoch": 0.4630102040816326, "grad_norm": 0.6408152032899023, "learning_rate": 8.735544648133331e-06, "loss": 0.3405008316040039, "num_input_tokens_seen": 218097816, "step": 3630, "train_runtime": 46498.9249, "train_tokens_per_second": 4690.384 }, { "epoch": 0.46364795918367346, "grad_norm": 0.6246290179711698, "learning_rate": 8.7322133390863e-06, "loss": 0.34192686080932616, "num_input_tokens_seen": 218410720, "step": 3635, "train_runtime": 46567.0491, "train_tokens_per_second": 4690.242 }, { "epoch": 0.4642857142857143, "grad_norm": 0.5739391616187374, "learning_rate": 8.728878284502526e-06, "loss": 0.31751222610473634, "num_input_tokens_seen": 218711912, "step": 3640, "train_runtime": 46620.9326, "train_tokens_per_second": 4691.281 }, { "epoch": 0.4649234693877551, "grad_norm": 0.6632229939982521, "learning_rate": 8.725539487728969e-06, "loss": 0.3527590990066528, "num_input_tokens_seen": 219006304, "step": 3645, "train_runtime": 46682.8516, "train_tokens_per_second": 4691.365 }, { "epoch": 0.4655612244897959, "grad_norm": 0.6959421541032137, "learning_rate": 8.722196952116346e-06, "loss": 0.33302555084228513, "num_input_tokens_seen": 219299648, "step": 3650, "train_runtime": 46743.2716, "train_tokens_per_second": 4691.577 }, { "epoch": 0.46619897959183676, "grad_norm": 0.5985583649914814, "learning_rate": 8.718850681019125e-06, "loss": 0.33802356719970705, "num_input_tokens_seen": 219592736, "step": 3655, "train_runtime": 46813.6385, "train_tokens_per_second": 4690.785 }, { "epoch": 0.46683673469387754, "grad_norm": 0.6809419700700615, "learning_rate": 8.715500677795519e-06, "loss": 0.33800294399261477, "num_input_tokens_seen": 219904256, "step": 3660, "train_runtime": 46871.2824, "train_tokens_per_second": 4691.663 }, { "epoch": 0.4674744897959184, "grad_norm": 0.6257133112041434, "learning_rate": 8.712146945807494e-06, "loss": 0.3399499416351318, "num_input_tokens_seen": 220187592, "step": 3665, "train_runtime": 46940.6251, "train_tokens_per_second": 4690.768 }, { "epoch": 0.46811224489795916, "grad_norm": 0.5210991711236733, "learning_rate": 8.708789488420753e-06, "loss": 0.32831809520721433, "num_input_tokens_seen": 220488080, "step": 3670, "train_runtime": 46990.9104, "train_tokens_per_second": 4692.143 }, { "epoch": 0.46875, "grad_norm": 0.5852972272116405, "learning_rate": 8.705428309004737e-06, "loss": 0.3230716705322266, "num_input_tokens_seen": 220795200, "step": 3675, "train_runtime": 47058.8267, "train_tokens_per_second": 4691.898 }, { "epoch": 0.46938775510204084, "grad_norm": 0.5679929385782518, "learning_rate": 8.702063410932628e-06, "loss": 0.3512821912765503, "num_input_tokens_seen": 221091784, "step": 3680, "train_runtime": 47126.5318, "train_tokens_per_second": 4691.45 }, { "epoch": 0.4700255102040816, "grad_norm": 0.589604580913648, "learning_rate": 8.698694797581335e-06, "loss": 0.2926384210586548, "num_input_tokens_seen": 221399344, "step": 3685, "train_runtime": 47186.9126, "train_tokens_per_second": 4691.965 }, { "epoch": 0.47066326530612246, "grad_norm": 0.6807809442674404, "learning_rate": 8.695322472331497e-06, "loss": 0.3219421148300171, "num_input_tokens_seen": 221684384, "step": 3690, "train_runtime": 47251.7952, "train_tokens_per_second": 4691.555 }, { "epoch": 0.47130102040816324, "grad_norm": 0.5938210126388256, "learning_rate": 8.691946438567476e-06, "loss": 0.31500236988067626, "num_input_tokens_seen": 221997312, "step": 3695, "train_runtime": 47303.1611, "train_tokens_per_second": 4693.076 }, { "epoch": 0.4719387755102041, "grad_norm": 0.6250194018595292, "learning_rate": 8.688566699677362e-06, "loss": 0.35878853797912597, "num_input_tokens_seen": 222286616, "step": 3700, "train_runtime": 47372.0139, "train_tokens_per_second": 4692.362 }, { "epoch": 0.4725765306122449, "grad_norm": 0.5749015433831429, "learning_rate": 8.685183259052951e-06, "loss": 0.3441047668457031, "num_input_tokens_seen": 222584216, "step": 3705, "train_runtime": 47427.3118, "train_tokens_per_second": 4693.165 }, { "epoch": 0.4732142857142857, "grad_norm": 0.6419814308046566, "learning_rate": 8.68179612008977e-06, "loss": 0.3282122850418091, "num_input_tokens_seen": 222872640, "step": 3710, "train_runtime": 47497.5249, "train_tokens_per_second": 4692.3 }, { "epoch": 0.47385204081632654, "grad_norm": 0.5790820541061571, "learning_rate": 8.678405286187046e-06, "loss": 0.31385016441345215, "num_input_tokens_seen": 223165808, "step": 3715, "train_runtime": 47555.5361, "train_tokens_per_second": 4692.741 }, { "epoch": 0.4744897959183674, "grad_norm": 0.6269065031836492, "learning_rate": 8.675010760747717e-06, "loss": 0.3562500476837158, "num_input_tokens_seen": 223466440, "step": 3720, "train_runtime": 47632.67, "train_tokens_per_second": 4691.453 }, { "epoch": 0.47512755102040816, "grad_norm": 0.5956108833409146, "learning_rate": 8.671612547178428e-06, "loss": 0.2841916561126709, "num_input_tokens_seen": 223768640, "step": 3725, "train_runtime": 47692.5676, "train_tokens_per_second": 4691.898 }, { "epoch": 0.475765306122449, "grad_norm": 0.5753812107727605, "learning_rate": 8.668210648889523e-06, "loss": 0.3037557125091553, "num_input_tokens_seen": 224057208, "step": 3730, "train_runtime": 47762.3177, "train_tokens_per_second": 4691.087 }, { "epoch": 0.4764030612244898, "grad_norm": 0.6385507767296246, "learning_rate": 8.664805069295046e-06, "loss": 0.32805795669555665, "num_input_tokens_seen": 224342936, "step": 3735, "train_runtime": 47829.9512, "train_tokens_per_second": 4690.428 }, { "epoch": 0.4770408163265306, "grad_norm": 0.5394380313557849, "learning_rate": 8.661395811812732e-06, "loss": 0.3325211524963379, "num_input_tokens_seen": 224636952, "step": 3740, "train_runtime": 47894.1985, "train_tokens_per_second": 4690.275 }, { "epoch": 0.47767857142857145, "grad_norm": 0.6191117466541218, "learning_rate": 8.657982879864007e-06, "loss": 0.3126026391983032, "num_input_tokens_seen": 224933736, "step": 3745, "train_runtime": 47967.8341, "train_tokens_per_second": 4689.262 }, { "epoch": 0.47831632653061223, "grad_norm": 0.6409625329689695, "learning_rate": 8.654566276873992e-06, "loss": 0.3323666572570801, "num_input_tokens_seen": 225243288, "step": 3750, "train_runtime": 48041.5411, "train_tokens_per_second": 4688.511 }, { "epoch": 0.4789540816326531, "grad_norm": 0.6793527208485282, "learning_rate": 8.651146006271483e-06, "loss": 0.34303305149078367, "num_input_tokens_seen": 225532656, "step": 3755, "train_runtime": 48104.817, "train_tokens_per_second": 4688.359 }, { "epoch": 0.47959183673469385, "grad_norm": 0.6336706905015029, "learning_rate": 8.64772207148896e-06, "loss": 0.3112976312637329, "num_input_tokens_seen": 225828272, "step": 3760, "train_runtime": 48168.9398, "train_tokens_per_second": 4688.255 }, { "epoch": 0.4802295918367347, "grad_norm": 0.7415618167200674, "learning_rate": 8.644294475962583e-06, "loss": 0.3418597936630249, "num_input_tokens_seen": 226122576, "step": 3765, "train_runtime": 48231.1311, "train_tokens_per_second": 4688.312 }, { "epoch": 0.48086734693877553, "grad_norm": 0.6102114351372901, "learning_rate": 8.640863223132183e-06, "loss": 0.3238770246505737, "num_input_tokens_seen": 226425192, "step": 3770, "train_runtime": 48292.1185, "train_tokens_per_second": 4688.657 }, { "epoch": 0.4815051020408163, "grad_norm": 0.6071001149024883, "learning_rate": 8.63742831644126e-06, "loss": 0.3333350658416748, "num_input_tokens_seen": 226718696, "step": 3775, "train_runtime": 48353.2438, "train_tokens_per_second": 4688.8 }, { "epoch": 0.48214285714285715, "grad_norm": 0.5605538974785508, "learning_rate": 8.633989759336984e-06, "loss": 0.3035125732421875, "num_input_tokens_seen": 227007680, "step": 3780, "train_runtime": 48414.7454, "train_tokens_per_second": 4688.813 }, { "epoch": 0.48278061224489793, "grad_norm": 0.6273277143209608, "learning_rate": 8.630547555270187e-06, "loss": 0.34965779781341555, "num_input_tokens_seen": 227308672, "step": 3785, "train_runtime": 48482.0996, "train_tokens_per_second": 4688.507 }, { "epoch": 0.48341836734693877, "grad_norm": 0.6720150621973842, "learning_rate": 8.627101707695365e-06, "loss": 0.31407837867736815, "num_input_tokens_seen": 227613472, "step": 3790, "train_runtime": 48544.7444, "train_tokens_per_second": 4688.736 }, { "epoch": 0.4840561224489796, "grad_norm": 0.6009996028106223, "learning_rate": 8.62365222007066e-06, "loss": 0.3078362226486206, "num_input_tokens_seen": 227928160, "step": 3795, "train_runtime": 48609.3152, "train_tokens_per_second": 4688.981 }, { "epoch": 0.4846938775510204, "grad_norm": 0.6075814248709552, "learning_rate": 8.620199095857877e-06, "loss": 0.31285624504089354, "num_input_tokens_seen": 228223560, "step": 3800, "train_runtime": 48671.7948, "train_tokens_per_second": 4689.031 }, { "epoch": 0.48533163265306123, "grad_norm": 0.6516147255557245, "learning_rate": 8.616742338522467e-06, "loss": 0.3143020153045654, "num_input_tokens_seen": 228520104, "step": 3805, "train_runtime": 48728.592, "train_tokens_per_second": 4689.651 }, { "epoch": 0.48596938775510207, "grad_norm": 0.6460117416964749, "learning_rate": 8.613281951533527e-06, "loss": 0.3114283800125122, "num_input_tokens_seen": 228806096, "step": 3810, "train_runtime": 48802.2897, "train_tokens_per_second": 4688.43 }, { "epoch": 0.48660714285714285, "grad_norm": 0.5595261197912934, "learning_rate": 8.609817938363799e-06, "loss": 0.3336583852767944, "num_input_tokens_seen": 229106960, "step": 3815, "train_runtime": 48859.5373, "train_tokens_per_second": 4689.094 }, { "epoch": 0.4872448979591837, "grad_norm": 0.6269987048054863, "learning_rate": 8.60635030248966e-06, "loss": 0.3201381921768188, "num_input_tokens_seen": 229412248, "step": 3820, "train_runtime": 48929.9828, "train_tokens_per_second": 4688.582 }, { "epoch": 0.48788265306122447, "grad_norm": 0.6205237417180155, "learning_rate": 8.602879047391127e-06, "loss": 0.3380389451980591, "num_input_tokens_seen": 229711352, "step": 3825, "train_runtime": 48992.2172, "train_tokens_per_second": 4688.731 }, { "epoch": 0.4885204081632653, "grad_norm": 0.6368541432579827, "learning_rate": 8.599404176551843e-06, "loss": 0.31137685775756835, "num_input_tokens_seen": 229995312, "step": 3830, "train_runtime": 49045.3729, "train_tokens_per_second": 4689.44 }, { "epoch": 0.48915816326530615, "grad_norm": 0.588258055441562, "learning_rate": 8.595925693459086e-06, "loss": 0.33580193519592283, "num_input_tokens_seen": 230293248, "step": 3835, "train_runtime": 49116.6255, "train_tokens_per_second": 4688.703 }, { "epoch": 0.4897959183673469, "grad_norm": 0.6410596538528932, "learning_rate": 8.59244360160376e-06, "loss": 0.3307149887084961, "num_input_tokens_seen": 230581480, "step": 3840, "train_runtime": 49176.25, "train_tokens_per_second": 4688.879 }, { "epoch": 0.49043367346938777, "grad_norm": 0.6670839034570284, "learning_rate": 8.588957904480381e-06, "loss": 0.29323835372924806, "num_input_tokens_seen": 230880424, "step": 3845, "train_runtime": 49231.6709, "train_tokens_per_second": 4689.673 }, { "epoch": 0.49107142857142855, "grad_norm": 0.5555115612515904, "learning_rate": 8.585468605587094e-06, "loss": 0.342155909538269, "num_input_tokens_seen": 231184408, "step": 3850, "train_runtime": 49298.6318, "train_tokens_per_second": 4689.469 }, { "epoch": 0.4917091836734694, "grad_norm": 0.6073705320677633, "learning_rate": 8.581975708425652e-06, "loss": 0.33124098777770994, "num_input_tokens_seen": 231495880, "step": 3855, "train_runtime": 49356.435, "train_tokens_per_second": 4690.288 }, { "epoch": 0.4923469387755102, "grad_norm": 0.604541663972026, "learning_rate": 8.578479216501422e-06, "loss": 0.34891135692596437, "num_input_tokens_seen": 231786912, "step": 3860, "train_runtime": 49425.9884, "train_tokens_per_second": 4689.576 }, { "epoch": 0.492984693877551, "grad_norm": 0.5689662248411393, "learning_rate": 8.574979133323378e-06, "loss": 0.33214640617370605, "num_input_tokens_seen": 232092464, "step": 3865, "train_runtime": 49491.7501, "train_tokens_per_second": 4689.518 }, { "epoch": 0.49362244897959184, "grad_norm": 0.5835116464633966, "learning_rate": 8.571475462404098e-06, "loss": 0.31715946197509765, "num_input_tokens_seen": 232386200, "step": 3870, "train_runtime": 49566.4294, "train_tokens_per_second": 4688.379 }, { "epoch": 0.4942602040816326, "grad_norm": 0.5947108264754066, "learning_rate": 8.567968207259759e-06, "loss": 0.31617448329925535, "num_input_tokens_seen": 232683656, "step": 3875, "train_runtime": 49622.2812, "train_tokens_per_second": 4689.096 }, { "epoch": 0.49489795918367346, "grad_norm": 0.7234261523076563, "learning_rate": 8.564457371410139e-06, "loss": 0.32854447364807127, "num_input_tokens_seen": 232987152, "step": 3880, "train_runtime": 49693.4975, "train_tokens_per_second": 4688.484 }, { "epoch": 0.4955357142857143, "grad_norm": 0.5856843551656463, "learning_rate": 8.560942958378604e-06, "loss": 0.31505703926086426, "num_input_tokens_seen": 233274344, "step": 3885, "train_runtime": 49767.2794, "train_tokens_per_second": 4687.304 }, { "epoch": 0.4961734693877551, "grad_norm": 0.6173254846006689, "learning_rate": 8.557424971692117e-06, "loss": 0.3176628351211548, "num_input_tokens_seen": 233581288, "step": 3890, "train_runtime": 49824.5603, "train_tokens_per_second": 4688.075 }, { "epoch": 0.4968112244897959, "grad_norm": 0.6407797196291325, "learning_rate": 8.55390341488122e-06, "loss": 0.33142986297607424, "num_input_tokens_seen": 233883048, "step": 3895, "train_runtime": 49902.8684, "train_tokens_per_second": 4686.766 }, { "epoch": 0.49744897959183676, "grad_norm": 0.6809906279006612, "learning_rate": 8.550378291480041e-06, "loss": 0.3280193567276001, "num_input_tokens_seen": 234179512, "step": 3900, "train_runtime": 49966.9784, "train_tokens_per_second": 4686.685 }, { "epoch": 0.49808673469387754, "grad_norm": 0.5442065664869937, "learning_rate": 8.54684960502629e-06, "loss": 0.3108412027359009, "num_input_tokens_seen": 234481384, "step": 3905, "train_runtime": 50026.9708, "train_tokens_per_second": 4687.099 }, { "epoch": 0.4987244897959184, "grad_norm": 0.6001100539623434, "learning_rate": 8.543317359061247e-06, "loss": 0.31249351501464845, "num_input_tokens_seen": 234779032, "step": 3910, "train_runtime": 50094.8558, "train_tokens_per_second": 4686.689 }, { "epoch": 0.49936224489795916, "grad_norm": 0.608820557192486, "learning_rate": 8.539781557129772e-06, "loss": 0.3282254695892334, "num_input_tokens_seen": 235067024, "step": 3915, "train_runtime": 50163.2095, "train_tokens_per_second": 4686.044 }, { "epoch": 0.5, "grad_norm": 0.6134403949536948, "learning_rate": 8.536242202780285e-06, "loss": 0.3381755828857422, "num_input_tokens_seen": 235365120, "step": 3920, "train_runtime": 50225.6456, "train_tokens_per_second": 4686.154 }, { "epoch": 0.5006377551020408, "grad_norm": 0.529618085808314, "learning_rate": 8.532699299564777e-06, "loss": 0.30429079532623293, "num_input_tokens_seen": 235663552, "step": 3925, "train_runtime": 50283.826, "train_tokens_per_second": 4686.667 }, { "epoch": 0.5012755102040817, "grad_norm": 0.5401237694639268, "learning_rate": 8.529152851038798e-06, "loss": 0.3484530448913574, "num_input_tokens_seen": 235979680, "step": 3930, "train_runtime": 50345.9633, "train_tokens_per_second": 4687.162 }, { "epoch": 0.5019132653061225, "grad_norm": 0.5979224945384497, "learning_rate": 8.52560286076146e-06, "loss": 0.3274678230285645, "num_input_tokens_seen": 236281408, "step": 3935, "train_runtime": 50414.4229, "train_tokens_per_second": 4686.782 }, { "epoch": 0.5025510204081632, "grad_norm": 0.7674430914384112, "learning_rate": 8.522049332295421e-06, "loss": 0.3291932106018066, "num_input_tokens_seen": 236585680, "step": 3940, "train_runtime": 50473.1228, "train_tokens_per_second": 4687.36 }, { "epoch": 0.5031887755102041, "grad_norm": 0.6846798692593288, "learning_rate": 8.5184922692069e-06, "loss": 0.3128329277038574, "num_input_tokens_seen": 236896464, "step": 3945, "train_runtime": 50533.5785, "train_tokens_per_second": 4687.902 }, { "epoch": 0.5038265306122449, "grad_norm": 0.6282341631706102, "learning_rate": 8.514931675065654e-06, "loss": 0.338327956199646, "num_input_tokens_seen": 237201312, "step": 3950, "train_runtime": 50595.675, "train_tokens_per_second": 4688.174 }, { "epoch": 0.5044642857142857, "grad_norm": 0.5993769276365452, "learning_rate": 8.51136755344499e-06, "loss": 0.32868807315826415, "num_input_tokens_seen": 237482056, "step": 3955, "train_runtime": 50661.2703, "train_tokens_per_second": 4687.645 }, { "epoch": 0.5051020408163265, "grad_norm": 0.8772604828539141, "learning_rate": 8.507799907921754e-06, "loss": 0.30279438495635985, "num_input_tokens_seen": 237779776, "step": 3960, "train_runtime": 50733.6626, "train_tokens_per_second": 4686.825 }, { "epoch": 0.5057397959183674, "grad_norm": 0.5415278949758084, "learning_rate": 8.504228742076325e-06, "loss": 0.3054949283599854, "num_input_tokens_seen": 238075712, "step": 3965, "train_runtime": 50797.9224, "train_tokens_per_second": 4686.721 }, { "epoch": 0.5063775510204082, "grad_norm": 0.6364973916989575, "learning_rate": 8.500654059492618e-06, "loss": 0.338958215713501, "num_input_tokens_seen": 238371592, "step": 3970, "train_runtime": 50857.4995, "train_tokens_per_second": 4687.049 }, { "epoch": 0.5070153061224489, "grad_norm": 0.6041940008915029, "learning_rate": 8.497075863758079e-06, "loss": 0.32581939697265627, "num_input_tokens_seen": 238677336, "step": 3975, "train_runtime": 50923.371, "train_tokens_per_second": 4686.99 }, { "epoch": 0.5076530612244898, "grad_norm": 0.5422672998389819, "learning_rate": 8.493494158463674e-06, "loss": 0.32880821228027346, "num_input_tokens_seen": 238986112, "step": 3980, "train_runtime": 50997.1362, "train_tokens_per_second": 4686.265 }, { "epoch": 0.5082908163265306, "grad_norm": 0.594000297710505, "learning_rate": 8.489908947203897e-06, "loss": 0.34253578186035155, "num_input_tokens_seen": 239296208, "step": 3985, "train_runtime": 51065.1994, "train_tokens_per_second": 4686.092 }, { "epoch": 0.5089285714285714, "grad_norm": 0.6022810808139175, "learning_rate": 8.486320233576757e-06, "loss": 0.3009287595748901, "num_input_tokens_seen": 239582264, "step": 3990, "train_runtime": 51133.0334, "train_tokens_per_second": 4685.469 }, { "epoch": 0.5095663265306123, "grad_norm": 0.5739027753713752, "learning_rate": 8.482728021183777e-06, "loss": 0.2939309597015381, "num_input_tokens_seen": 239882328, "step": 3995, "train_runtime": 51206.1406, "train_tokens_per_second": 4684.64 }, { "epoch": 0.5102040816326531, "grad_norm": 0.6039637328340155, "learning_rate": 8.479132313629996e-06, "loss": 0.3285217761993408, "num_input_tokens_seen": 240167464, "step": 4000, "train_runtime": 51272.7174, "train_tokens_per_second": 4684.118 }, { "epoch": 0.5108418367346939, "grad_norm": 0.5853286775780016, "learning_rate": 8.475533114523954e-06, "loss": 0.3112363815307617, "num_input_tokens_seen": 240456352, "step": 4005, "train_runtime": 51337.5249, "train_tokens_per_second": 4683.832 }, { "epoch": 0.5114795918367347, "grad_norm": 0.5563056564871881, "learning_rate": 8.471930427477704e-06, "loss": 0.3293452739715576, "num_input_tokens_seen": 240753960, "step": 4010, "train_runtime": 51405.9346, "train_tokens_per_second": 4683.388 }, { "epoch": 0.5121173469387755, "grad_norm": 0.5897994472914004, "learning_rate": 8.468324256106789e-06, "loss": 0.32114386558532715, "num_input_tokens_seen": 241066184, "step": 4015, "train_runtime": 51470.099, "train_tokens_per_second": 4683.616 }, { "epoch": 0.5127551020408163, "grad_norm": 0.6492322193880778, "learning_rate": 8.464714604030256e-06, "loss": 0.30771784782409667, "num_input_tokens_seen": 241371416, "step": 4020, "train_runtime": 51539.3753, "train_tokens_per_second": 4683.243 }, { "epoch": 0.5133928571428571, "grad_norm": 0.6364867293398085, "learning_rate": 8.461101474870642e-06, "loss": 0.3258524894714355, "num_input_tokens_seen": 241671152, "step": 4025, "train_runtime": 51602.3985, "train_tokens_per_second": 4683.332 }, { "epoch": 0.514030612244898, "grad_norm": 0.6674651696176255, "learning_rate": 8.457484872253976e-06, "loss": 0.31948442459106446, "num_input_tokens_seen": 241978096, "step": 4030, "train_runtime": 51661.0997, "train_tokens_per_second": 4683.952 }, { "epoch": 0.5146683673469388, "grad_norm": 0.5973739586952436, "learning_rate": 8.453864799809772e-06, "loss": 0.3342707633972168, "num_input_tokens_seen": 242285752, "step": 4035, "train_runtime": 51729.6137, "train_tokens_per_second": 4683.695 }, { "epoch": 0.5153061224489796, "grad_norm": 0.5616265387147885, "learning_rate": 8.450241261171022e-06, "loss": 0.31052722930908205, "num_input_tokens_seen": 242579024, "step": 4040, "train_runtime": 51804.5156, "train_tokens_per_second": 4682.585 }, { "epoch": 0.5159438775510204, "grad_norm": 0.5969278945501028, "learning_rate": 8.446614259974201e-06, "loss": 0.30537512302398684, "num_input_tokens_seen": 242870944, "step": 4045, "train_runtime": 51877.7153, "train_tokens_per_second": 4681.604 }, { "epoch": 0.5165816326530612, "grad_norm": 0.6356334614782454, "learning_rate": 8.44298379985926e-06, "loss": 0.3459012031555176, "num_input_tokens_seen": 243173728, "step": 4050, "train_runtime": 51941.9346, "train_tokens_per_second": 4681.646 }, { "epoch": 0.517219387755102, "grad_norm": 0.6497022024172072, "learning_rate": 8.439349884469621e-06, "loss": 0.31816725730895995, "num_input_tokens_seen": 243482640, "step": 4055, "train_runtime": 52005.9855, "train_tokens_per_second": 4681.82 }, { "epoch": 0.5178571428571429, "grad_norm": 0.6731650154036644, "learning_rate": 8.435712517452167e-06, "loss": 0.3488030910491943, "num_input_tokens_seen": 243787968, "step": 4060, "train_runtime": 52071.1423, "train_tokens_per_second": 4681.825 }, { "epoch": 0.5184948979591837, "grad_norm": 0.5692312417385954, "learning_rate": 8.432071702457253e-06, "loss": 0.3288985013961792, "num_input_tokens_seen": 244092336, "step": 4065, "train_runtime": 52142.0306, "train_tokens_per_second": 4681.297 }, { "epoch": 0.5191326530612245, "grad_norm": 0.5408079660399894, "learning_rate": 8.428427443138689e-06, "loss": 0.3070178985595703, "num_input_tokens_seen": 244379936, "step": 4070, "train_runtime": 52196.2794, "train_tokens_per_second": 4681.942 }, { "epoch": 0.5197704081632653, "grad_norm": 0.6145659542390675, "learning_rate": 8.424779743153747e-06, "loss": 0.30741429328918457, "num_input_tokens_seen": 244662840, "step": 4075, "train_runtime": 52253.7032, "train_tokens_per_second": 4682.211 }, { "epoch": 0.5204081632653061, "grad_norm": 0.6353161518584013, "learning_rate": 8.421128606163145e-06, "loss": 0.3511251926422119, "num_input_tokens_seen": 244966000, "step": 4080, "train_runtime": 52317.8245, "train_tokens_per_second": 4682.267 }, { "epoch": 0.5210459183673469, "grad_norm": 0.6094802701256447, "learning_rate": 8.417474035831055e-06, "loss": 0.2934889316558838, "num_input_tokens_seen": 245260784, "step": 4085, "train_runtime": 52383.4783, "train_tokens_per_second": 4682.026 }, { "epoch": 0.5216836734693877, "grad_norm": 0.6727496823709653, "learning_rate": 8.413816035825095e-06, "loss": 0.3110150098800659, "num_input_tokens_seen": 245550280, "step": 4090, "train_runtime": 52457.2366, "train_tokens_per_second": 4680.961 }, { "epoch": 0.5223214285714286, "grad_norm": 0.5485785769866987, "learning_rate": 8.410154609816324e-06, "loss": 0.296339225769043, "num_input_tokens_seen": 245839128, "step": 4095, "train_runtime": 52526.9748, "train_tokens_per_second": 4680.245 }, { "epoch": 0.5229591836734694, "grad_norm": 0.5557512696798947, "learning_rate": 8.406489761479235e-06, "loss": 0.33946802616119387, "num_input_tokens_seen": 246127200, "step": 4100, "train_runtime": 52577.7259, "train_tokens_per_second": 4681.207 }, { "epoch": 0.5235969387755102, "grad_norm": 0.6014225056580619, "learning_rate": 8.402821494491762e-06, "loss": 0.30245676040649416, "num_input_tokens_seen": 246421424, "step": 4105, "train_runtime": 52647.4962, "train_tokens_per_second": 4680.592 }, { "epoch": 0.5242346938775511, "grad_norm": 0.6246767533912915, "learning_rate": 8.399149812535269e-06, "loss": 0.33345613479614256, "num_input_tokens_seen": 246735904, "step": 4110, "train_runtime": 52702.3016, "train_tokens_per_second": 4681.691 }, { "epoch": 0.5248724489795918, "grad_norm": 0.5961399193010901, "learning_rate": 8.395474719294541e-06, "loss": 0.31256182193756105, "num_input_tokens_seen": 247038904, "step": 4115, "train_runtime": 52767.868, "train_tokens_per_second": 4681.616 }, { "epoch": 0.5255102040816326, "grad_norm": 0.6732978417816181, "learning_rate": 8.391796218457794e-06, "loss": 0.3450355052947998, "num_input_tokens_seen": 247343624, "step": 4120, "train_runtime": 52834.4009, "train_tokens_per_second": 4681.488 }, { "epoch": 0.5261479591836735, "grad_norm": 0.6034276666979609, "learning_rate": 8.388114313716658e-06, "loss": 0.35344223976135253, "num_input_tokens_seen": 247636408, "step": 4125, "train_runtime": 52906.1553, "train_tokens_per_second": 4680.673 }, { "epoch": 0.5267857142857143, "grad_norm": 0.5822756790678641, "learning_rate": 8.384429008766183e-06, "loss": 0.34767148494720457, "num_input_tokens_seen": 247943096, "step": 4130, "train_runtime": 52972.1639, "train_tokens_per_second": 4680.63 }, { "epoch": 0.5274234693877551, "grad_norm": 0.5534471990850092, "learning_rate": 8.380740307304831e-06, "loss": 0.28744490146636964, "num_input_tokens_seen": 248250080, "step": 4135, "train_runtime": 53046.5905, "train_tokens_per_second": 4679.85 }, { "epoch": 0.5280612244897959, "grad_norm": 0.6180102089530837, "learning_rate": 8.377048213034469e-06, "loss": 0.3034853219985962, "num_input_tokens_seen": 248551000, "step": 4140, "train_runtime": 53104.4224, "train_tokens_per_second": 4680.42 }, { "epoch": 0.5286989795918368, "grad_norm": 0.6340302009964914, "learning_rate": 8.373352729660373e-06, "loss": 0.34547905921936034, "num_input_tokens_seen": 248853736, "step": 4145, "train_runtime": 53167.5911, "train_tokens_per_second": 4680.553 }, { "epoch": 0.5293367346938775, "grad_norm": 0.580590114831241, "learning_rate": 8.369653860891218e-06, "loss": 0.335661792755127, "num_input_tokens_seen": 249153448, "step": 4150, "train_runtime": 53235.7742, "train_tokens_per_second": 4680.188 }, { "epoch": 0.5299744897959183, "grad_norm": 0.8148059899498963, "learning_rate": 8.365951610439078e-06, "loss": 0.3232774257659912, "num_input_tokens_seen": 249454664, "step": 4155, "train_runtime": 53310.5359, "train_tokens_per_second": 4679.275 }, { "epoch": 0.5306122448979592, "grad_norm": 0.5925809138419219, "learning_rate": 8.362245982019419e-06, "loss": 0.321329402923584, "num_input_tokens_seen": 249759488, "step": 4160, "train_runtime": 53364.5393, "train_tokens_per_second": 4680.252 }, { "epoch": 0.53125, "grad_norm": 0.5797856049342134, "learning_rate": 8.358536979351098e-06, "loss": 0.34303817749023435, "num_input_tokens_seen": 250052816, "step": 4165, "train_runtime": 53435.8316, "train_tokens_per_second": 4679.497 }, { "epoch": 0.5318877551020408, "grad_norm": 0.6059898471049472, "learning_rate": 8.35482460615636e-06, "loss": 0.31549644470214844, "num_input_tokens_seen": 250362600, "step": 4170, "train_runtime": 53500.0538, "train_tokens_per_second": 4679.67 }, { "epoch": 0.5325255102040817, "grad_norm": 0.6307640947510069, "learning_rate": 8.351108866160827e-06, "loss": 0.32418289184570315, "num_input_tokens_seen": 250653216, "step": 4175, "train_runtime": 53560.4576, "train_tokens_per_second": 4679.818 }, { "epoch": 0.5331632653061225, "grad_norm": 0.63557884154035, "learning_rate": 8.347389763093507e-06, "loss": 0.330997633934021, "num_input_tokens_seen": 250938992, "step": 4180, "train_runtime": 53624.5737, "train_tokens_per_second": 4679.552 }, { "epoch": 0.5338010204081632, "grad_norm": 0.6664096437044886, "learning_rate": 8.34366730068678e-06, "loss": 0.34677467346191404, "num_input_tokens_seen": 251237216, "step": 4185, "train_runtime": 53695.991, "train_tokens_per_second": 4678.882 }, { "epoch": 0.5344387755102041, "grad_norm": 0.5452953894462239, "learning_rate": 8.339941482676394e-06, "loss": 0.329576301574707, "num_input_tokens_seen": 251540176, "step": 4190, "train_runtime": 53768.7052, "train_tokens_per_second": 4678.189 }, { "epoch": 0.5350765306122449, "grad_norm": 0.5926858088338427, "learning_rate": 8.336212312801469e-06, "loss": 0.3385266542434692, "num_input_tokens_seen": 251846328, "step": 4195, "train_runtime": 53836.4095, "train_tokens_per_second": 4677.993 }, { "epoch": 0.5357142857142857, "grad_norm": 0.631641679615256, "learning_rate": 8.332479794804489e-06, "loss": 0.32497210502624513, "num_input_tokens_seen": 252149328, "step": 4200, "train_runtime": 53895.9305, "train_tokens_per_second": 4678.448 }, { "epoch": 0.5363520408163265, "grad_norm": 0.6191889858674562, "learning_rate": 8.328743932431293e-06, "loss": 0.33168396949768064, "num_input_tokens_seen": 252469872, "step": 4205, "train_runtime": 53960.4025, "train_tokens_per_second": 4678.799 }, { "epoch": 0.5369897959183674, "grad_norm": 0.6146660611071938, "learning_rate": 8.325004729431083e-06, "loss": 0.3352448225021362, "num_input_tokens_seen": 252767728, "step": 4210, "train_runtime": 54027.2317, "train_tokens_per_second": 4678.525 }, { "epoch": 0.5376275510204082, "grad_norm": 0.5967061292516193, "learning_rate": 8.32126218955641e-06, "loss": 0.30342822074890136, "num_input_tokens_seen": 253064680, "step": 4215, "train_runtime": 54082.7429, "train_tokens_per_second": 4679.213 }, { "epoch": 0.5382653061224489, "grad_norm": 0.5643048497659794, "learning_rate": 8.317516316563172e-06, "loss": 0.3140439510345459, "num_input_tokens_seen": 253377952, "step": 4220, "train_runtime": 54143.3604, "train_tokens_per_second": 4679.76 }, { "epoch": 0.5389030612244898, "grad_norm": 0.6708561525924382, "learning_rate": 8.313767114210615e-06, "loss": 0.3102859020233154, "num_input_tokens_seen": 253651992, "step": 4225, "train_runtime": 54208.0086, "train_tokens_per_second": 4679.235 }, { "epoch": 0.5395408163265306, "grad_norm": 0.6462374542167583, "learning_rate": 8.310014586261329e-06, "loss": 0.3332800388336182, "num_input_tokens_seen": 253945136, "step": 4230, "train_runtime": 54273.4829, "train_tokens_per_second": 4678.991 }, { "epoch": 0.5401785714285714, "grad_norm": 0.6087934695641831, "learning_rate": 8.306258736481231e-06, "loss": 0.30633761882781985, "num_input_tokens_seen": 254258168, "step": 4235, "train_runtime": 54327.249, "train_tokens_per_second": 4680.122 }, { "epoch": 0.5408163265306123, "grad_norm": 0.581317239680331, "learning_rate": 8.302499568639583e-06, "loss": 0.33106720447540283, "num_input_tokens_seen": 254560128, "step": 4240, "train_runtime": 54385.9692, "train_tokens_per_second": 4680.621 }, { "epoch": 0.5414540816326531, "grad_norm": 0.5832690040111503, "learning_rate": 8.298737086508973e-06, "loss": 0.34075093269348145, "num_input_tokens_seen": 254854240, "step": 4245, "train_runtime": 54452.3276, "train_tokens_per_second": 4680.319 }, { "epoch": 0.5420918367346939, "grad_norm": 0.6479127787282017, "learning_rate": 8.294971293865315e-06, "loss": 0.3228892803192139, "num_input_tokens_seen": 255160192, "step": 4250, "train_runtime": 54502.7329, "train_tokens_per_second": 4681.604 }, { "epoch": 0.5427295918367347, "grad_norm": 0.549889966578858, "learning_rate": 8.29120219448784e-06, "loss": 0.2891772031784058, "num_input_tokens_seen": 255452128, "step": 4255, "train_runtime": 54577.2321, "train_tokens_per_second": 4680.562 }, { "epoch": 0.5433673469387755, "grad_norm": 0.6029598755497491, "learning_rate": 8.287429792159108e-06, "loss": 0.30979280471801757, "num_input_tokens_seen": 255744456, "step": 4260, "train_runtime": 54636.473, "train_tokens_per_second": 4680.838 }, { "epoch": 0.5440051020408163, "grad_norm": 0.5916236217514762, "learning_rate": 8.283654090664986e-06, "loss": 0.3161670207977295, "num_input_tokens_seen": 256054536, "step": 4265, "train_runtime": 54698.8425, "train_tokens_per_second": 4681.169 }, { "epoch": 0.5446428571428571, "grad_norm": 0.6367433641413873, "learning_rate": 8.279875093794652e-06, "loss": 0.30004215240478516, "num_input_tokens_seen": 256333248, "step": 4270, "train_runtime": 54769.6234, "train_tokens_per_second": 4680.208 }, { "epoch": 0.545280612244898, "grad_norm": 0.5042579518790996, "learning_rate": 8.276092805340596e-06, "loss": 0.29477152824401853, "num_input_tokens_seen": 256626592, "step": 4275, "train_runtime": 54842.3787, "train_tokens_per_second": 4679.348 }, { "epoch": 0.5459183673469388, "grad_norm": 1.1128245768635054, "learning_rate": 8.27230722909861e-06, "loss": 0.32368955612182615, "num_input_tokens_seen": 256933704, "step": 4280, "train_runtime": 54917.0586, "train_tokens_per_second": 4678.577 }, { "epoch": 0.5465561224489796, "grad_norm": 0.5968864271196218, "learning_rate": 8.268518368867781e-06, "loss": 0.3586747646331787, "num_input_tokens_seen": 257231712, "step": 4285, "train_runtime": 54977.612, "train_tokens_per_second": 4678.845 }, { "epoch": 0.5471938775510204, "grad_norm": 0.5998615928387417, "learning_rate": 8.264726228450495e-06, "loss": 0.3417146444320679, "num_input_tokens_seen": 257525104, "step": 4290, "train_runtime": 55031.7486, "train_tokens_per_second": 4679.573 }, { "epoch": 0.5478316326530612, "grad_norm": 0.6128832260840915, "learning_rate": 8.260930811652433e-06, "loss": 0.3421389102935791, "num_input_tokens_seen": 257824568, "step": 4295, "train_runtime": 55093.1213, "train_tokens_per_second": 4679.796 }, { "epoch": 0.548469387755102, "grad_norm": 0.6418323436502023, "learning_rate": 8.257132122282557e-06, "loss": 0.3121157646179199, "num_input_tokens_seen": 258118576, "step": 4300, "train_runtime": 55152.2017, "train_tokens_per_second": 4680.114 }, { "epoch": 0.5491071428571429, "grad_norm": 0.5842052529896943, "learning_rate": 8.253330164153118e-06, "loss": 0.30317847728729247, "num_input_tokens_seen": 258433376, "step": 4305, "train_runtime": 55213.9357, "train_tokens_per_second": 4680.582 }, { "epoch": 0.5497448979591837, "grad_norm": 0.5719238330795828, "learning_rate": 8.24952494107965e-06, "loss": 0.3032562255859375, "num_input_tokens_seen": 258723184, "step": 4310, "train_runtime": 55289.11, "train_tokens_per_second": 4679.46 }, { "epoch": 0.5503826530612245, "grad_norm": 0.5999036755436128, "learning_rate": 8.245716456880954e-06, "loss": 0.32174317836761473, "num_input_tokens_seen": 259015328, "step": 4315, "train_runtime": 55358.7971, "train_tokens_per_second": 4678.847 }, { "epoch": 0.5510204081632653, "grad_norm": 0.6097436452809384, "learning_rate": 8.241904715379115e-06, "loss": 0.3356198310852051, "num_input_tokens_seen": 259311400, "step": 4320, "train_runtime": 55419.4483, "train_tokens_per_second": 4679.069 }, { "epoch": 0.5516581632653061, "grad_norm": 0.6063697057688631, "learning_rate": 8.23808972039948e-06, "loss": 0.3257925033569336, "num_input_tokens_seen": 259601608, "step": 4325, "train_runtime": 55487.9113, "train_tokens_per_second": 4678.526 }, { "epoch": 0.5522959183673469, "grad_norm": 0.5822107839726435, "learning_rate": 8.234271475770662e-06, "loss": 0.3142188549041748, "num_input_tokens_seen": 259907824, "step": 4330, "train_runtime": 55564.8605, "train_tokens_per_second": 4677.557 }, { "epoch": 0.5529336734693877, "grad_norm": 0.5330086736550768, "learning_rate": 8.230449985324538e-06, "loss": 0.3134969711303711, "num_input_tokens_seen": 260201456, "step": 4335, "train_runtime": 55629.7575, "train_tokens_per_second": 4677.379 }, { "epoch": 0.5535714285714286, "grad_norm": 0.5481024736599419, "learning_rate": 8.226625252896239e-06, "loss": 0.32528071403503417, "num_input_tokens_seen": 260510920, "step": 4340, "train_runtime": 55695.1674, "train_tokens_per_second": 4677.442 }, { "epoch": 0.5542091836734694, "grad_norm": 0.7373651181598547, "learning_rate": 8.222797282324152e-06, "loss": 0.34186592102050783, "num_input_tokens_seen": 260802744, "step": 4345, "train_runtime": 55766.6206, "train_tokens_per_second": 4676.682 }, { "epoch": 0.5548469387755102, "grad_norm": 0.5905825099069442, "learning_rate": 8.218966077449912e-06, "loss": 0.31566557884216306, "num_input_tokens_seen": 261105232, "step": 4350, "train_runtime": 55827.3125, "train_tokens_per_second": 4677.016 }, { "epoch": 0.5554846938775511, "grad_norm": 0.6507514232075635, "learning_rate": 8.215131642118401e-06, "loss": 0.3226027488708496, "num_input_tokens_seen": 261415160, "step": 4355, "train_runtime": 55893.593, "train_tokens_per_second": 4677.015 }, { "epoch": 0.5561224489795918, "grad_norm": 0.6227011582604052, "learning_rate": 8.211293980177744e-06, "loss": 0.2847200632095337, "num_input_tokens_seen": 261699240, "step": 4360, "train_runtime": 55954.2652, "train_tokens_per_second": 4677.02 }, { "epoch": 0.5567602040816326, "grad_norm": 0.5688769001803791, "learning_rate": 8.2074530954793e-06, "loss": 0.2905887603759766, "num_input_tokens_seen": 262010480, "step": 4365, "train_runtime": 56021.1398, "train_tokens_per_second": 4676.993 }, { "epoch": 0.5573979591836735, "grad_norm": 0.6077548704289386, "learning_rate": 8.203608991877669e-06, "loss": 0.35893514156341555, "num_input_tokens_seen": 262308904, "step": 4370, "train_runtime": 56083.6474, "train_tokens_per_second": 4677.101 }, { "epoch": 0.5580357142857143, "grad_norm": 0.608483822828799, "learning_rate": 8.199761673230674e-06, "loss": 0.29238204956054686, "num_input_tokens_seen": 262616976, "step": 4375, "train_runtime": 56154.2218, "train_tokens_per_second": 4676.709 }, { "epoch": 0.5586734693877551, "grad_norm": 0.5830624962518477, "learning_rate": 8.195911143399368e-06, "loss": 0.3076601982116699, "num_input_tokens_seen": 262909384, "step": 4380, "train_runtime": 56221.6719, "train_tokens_per_second": 4676.3 }, { "epoch": 0.5593112244897959, "grad_norm": 0.673049126211511, "learning_rate": 8.192057406248028e-06, "loss": 0.3068440675735474, "num_input_tokens_seen": 263213760, "step": 4385, "train_runtime": 56295.113, "train_tokens_per_second": 4675.606 }, { "epoch": 0.5599489795918368, "grad_norm": 0.5736353161658411, "learning_rate": 8.18820046564415e-06, "loss": 0.32100448608398435, "num_input_tokens_seen": 263515416, "step": 4390, "train_runtime": 56361.6434, "train_tokens_per_second": 4675.439 }, { "epoch": 0.5605867346938775, "grad_norm": 0.593170776988159, "learning_rate": 8.184340325458439e-06, "loss": 0.30128042697906493, "num_input_tokens_seen": 263822760, "step": 4395, "train_runtime": 56427.6086, "train_tokens_per_second": 4675.42 }, { "epoch": 0.5612244897959183, "grad_norm": 0.6292006445058823, "learning_rate": 8.180476989564818e-06, "loss": 0.2959024429321289, "num_input_tokens_seen": 264122448, "step": 4400, "train_runtime": 56493.3571, "train_tokens_per_second": 4675.283 }, { "epoch": 0.5618622448979592, "grad_norm": 0.5821519726630247, "learning_rate": 8.176610461840415e-06, "loss": 0.3054521083831787, "num_input_tokens_seen": 264436904, "step": 4405, "train_runtime": 56557.7219, "train_tokens_per_second": 4675.523 }, { "epoch": 0.5625, "grad_norm": 0.668053801557447, "learning_rate": 8.17274074616556e-06, "loss": 0.33715431690216063, "num_input_tokens_seen": 264738224, "step": 4410, "train_runtime": 56620.5839, "train_tokens_per_second": 4675.653 }, { "epoch": 0.5631377551020408, "grad_norm": 0.6303997378853025, "learning_rate": 8.16886784642378e-06, "loss": 0.31183786392211915, "num_input_tokens_seen": 265031064, "step": 4415, "train_runtime": 56686.7773, "train_tokens_per_second": 4675.36 }, { "epoch": 0.5637755102040817, "grad_norm": 0.5962982226170522, "learning_rate": 8.164991766501804e-06, "loss": 0.3513195037841797, "num_input_tokens_seen": 265310864, "step": 4420, "train_runtime": 56744.2799, "train_tokens_per_second": 4675.553 }, { "epoch": 0.5644132653061225, "grad_norm": 0.6182195185195032, "learning_rate": 8.16111251028955e-06, "loss": 0.31078166961669923, "num_input_tokens_seen": 265611584, "step": 4425, "train_runtime": 56807.1546, "train_tokens_per_second": 4675.671 }, { "epoch": 0.5650510204081632, "grad_norm": 0.4950459126655072, "learning_rate": 8.157230081680118e-06, "loss": 0.31040363311767577, "num_input_tokens_seen": 265908936, "step": 4430, "train_runtime": 56878.4901, "train_tokens_per_second": 4675.035 }, { "epoch": 0.5656887755102041, "grad_norm": 0.625629747375622, "learning_rate": 8.153344484569798e-06, "loss": 0.33584554195404054, "num_input_tokens_seen": 266214216, "step": 4435, "train_runtime": 56944.8151, "train_tokens_per_second": 4674.951 }, { "epoch": 0.5663265306122449, "grad_norm": 0.5575423240531477, "learning_rate": 8.14945572285806e-06, "loss": 0.2880943775177002, "num_input_tokens_seen": 266521944, "step": 4440, "train_runtime": 57011.7003, "train_tokens_per_second": 4674.864 }, { "epoch": 0.5669642857142857, "grad_norm": 0.6377758398703642, "learning_rate": 8.145563800447547e-06, "loss": 0.32821414470672605, "num_input_tokens_seen": 266821112, "step": 4445, "train_runtime": 57080.3068, "train_tokens_per_second": 4674.486 }, { "epoch": 0.5676020408163265, "grad_norm": 0.6990364683606246, "learning_rate": 8.141668721244073e-06, "loss": 0.33448290824890137, "num_input_tokens_seen": 267110056, "step": 4450, "train_runtime": 57135.8468, "train_tokens_per_second": 4675.0 }, { "epoch": 0.5682397959183674, "grad_norm": 0.5582537167645563, "learning_rate": 8.137770489156624e-06, "loss": 0.32361855506896975, "num_input_tokens_seen": 267406768, "step": 4455, "train_runtime": 57201.0749, "train_tokens_per_second": 4674.856 }, { "epoch": 0.5688775510204082, "grad_norm": 0.6190981061148347, "learning_rate": 8.133869108097349e-06, "loss": 0.3138890743255615, "num_input_tokens_seen": 267703584, "step": 4460, "train_runtime": 57268.5972, "train_tokens_per_second": 4674.527 }, { "epoch": 0.5695153061224489, "grad_norm": 0.5847490108749284, "learning_rate": 8.129964581981554e-06, "loss": 0.32745659351348877, "num_input_tokens_seen": 267999824, "step": 4465, "train_runtime": 57337.5739, "train_tokens_per_second": 4674.07 }, { "epoch": 0.5701530612244898, "grad_norm": 0.5755116016825046, "learning_rate": 8.126056914727705e-06, "loss": 0.32536706924438474, "num_input_tokens_seen": 268308056, "step": 4470, "train_runtime": 57396.0366, "train_tokens_per_second": 4674.679 }, { "epoch": 0.5707908163265306, "grad_norm": 0.6154693294509455, "learning_rate": 8.122146110257419e-06, "loss": 0.31456241607666013, "num_input_tokens_seen": 268596848, "step": 4475, "train_runtime": 57462.4776, "train_tokens_per_second": 4674.3 }, { "epoch": 0.5714285714285714, "grad_norm": 0.5502179221099155, "learning_rate": 8.11823217249546e-06, "loss": 0.310486888885498, "num_input_tokens_seen": 268895872, "step": 4480, "train_runtime": 57524.0889, "train_tokens_per_second": 4674.492 }, { "epoch": 0.5720663265306123, "grad_norm": 0.5802016769840421, "learning_rate": 8.114315105369739e-06, "loss": 0.30334928035736086, "num_input_tokens_seen": 269201352, "step": 4485, "train_runtime": 57586.6413, "train_tokens_per_second": 4674.719 }, { "epoch": 0.5727040816326531, "grad_norm": 0.5883515183462985, "learning_rate": 8.110394912811308e-06, "loss": 0.30872986316680906, "num_input_tokens_seen": 269491536, "step": 4490, "train_runtime": 57656.0337, "train_tokens_per_second": 4674.125 }, { "epoch": 0.5733418367346939, "grad_norm": 0.649324643030826, "learning_rate": 8.106471598754353e-06, "loss": 0.33896265029907224, "num_input_tokens_seen": 269792872, "step": 4495, "train_runtime": 57712.569, "train_tokens_per_second": 4674.768 }, { "epoch": 0.5739795918367347, "grad_norm": 0.627166759763884, "learning_rate": 8.102545167136191e-06, "loss": 0.3339379787445068, "num_input_tokens_seen": 270112504, "step": 4500, "train_runtime": 57770.4755, "train_tokens_per_second": 4675.615 }, { "epoch": 0.5746173469387755, "grad_norm": 0.5896976553712885, "learning_rate": 8.098615621897272e-06, "loss": 0.34661197662353516, "num_input_tokens_seen": 270419208, "step": 4505, "train_runtime": 57835.7103, "train_tokens_per_second": 4675.644 }, { "epoch": 0.5752551020408163, "grad_norm": 0.5560755207064892, "learning_rate": 8.094682966981172e-06, "loss": 0.32341957092285156, "num_input_tokens_seen": 270709976, "step": 4510, "train_runtime": 57899.4109, "train_tokens_per_second": 4675.522 }, { "epoch": 0.5758928571428571, "grad_norm": 0.6455684435641715, "learning_rate": 8.090747206334582e-06, "loss": 0.3314667224884033, "num_input_tokens_seen": 270992920, "step": 4515, "train_runtime": 57957.1139, "train_tokens_per_second": 4675.749 }, { "epoch": 0.576530612244898, "grad_norm": 0.5887125092425513, "learning_rate": 8.086808343907313e-06, "loss": 0.3472761869430542, "num_input_tokens_seen": 271290696, "step": 4520, "train_runtime": 58015.5676, "train_tokens_per_second": 4676.171 }, { "epoch": 0.5771683673469388, "grad_norm": 0.6918344194685301, "learning_rate": 8.082866383652288e-06, "loss": 0.35142107009887696, "num_input_tokens_seen": 271602944, "step": 4525, "train_runtime": 58073.2704, "train_tokens_per_second": 4676.901 }, { "epoch": 0.5778061224489796, "grad_norm": 0.5656574815084812, "learning_rate": 8.07892132952554e-06, "loss": 0.31038622856140136, "num_input_tokens_seen": 271903088, "step": 4530, "train_runtime": 58129.2517, "train_tokens_per_second": 4677.56 }, { "epoch": 0.5784438775510204, "grad_norm": 0.5842917315653896, "learning_rate": 8.074973185486206e-06, "loss": 0.30137619972229, "num_input_tokens_seen": 272210992, "step": 4535, "train_runtime": 58188.5757, "train_tokens_per_second": 4678.083 }, { "epoch": 0.5790816326530612, "grad_norm": 0.5949065684239946, "learning_rate": 8.071021955496526e-06, "loss": 0.32496907711029055, "num_input_tokens_seen": 272530424, "step": 4540, "train_runtime": 58258.679, "train_tokens_per_second": 4677.937 }, { "epoch": 0.579719387755102, "grad_norm": 0.6225068609990876, "learning_rate": 8.067067643521834e-06, "loss": 0.3328864574432373, "num_input_tokens_seen": 272843728, "step": 4545, "train_runtime": 58321.4303, "train_tokens_per_second": 4678.276 }, { "epoch": 0.5803571428571429, "grad_norm": 0.5864685523092161, "learning_rate": 8.063110253530557e-06, "loss": 0.3262446403503418, "num_input_tokens_seen": 273157344, "step": 4550, "train_runtime": 58386.701, "train_tokens_per_second": 4678.417 }, { "epoch": 0.5809948979591837, "grad_norm": 0.5987457013718706, "learning_rate": 8.059149789494215e-06, "loss": 0.3453367233276367, "num_input_tokens_seen": 273462168, "step": 4555, "train_runtime": 58454.6399, "train_tokens_per_second": 4678.194 }, { "epoch": 0.5816326530612245, "grad_norm": 0.5917895077389059, "learning_rate": 8.055186255387409e-06, "loss": 0.326198148727417, "num_input_tokens_seen": 273774352, "step": 4560, "train_runtime": 58517.3721, "train_tokens_per_second": 4678.514 }, { "epoch": 0.5822704081632653, "grad_norm": 0.6515604444187467, "learning_rate": 8.051219655187818e-06, "loss": 0.32740585803985595, "num_input_tokens_seen": 274066568, "step": 4565, "train_runtime": 58586.4292, "train_tokens_per_second": 4677.987 }, { "epoch": 0.5829081632653061, "grad_norm": 0.5795418883268696, "learning_rate": 8.04724999287621e-06, "loss": 0.3357175350189209, "num_input_tokens_seen": 274380280, "step": 4570, "train_runtime": 58643.7348, "train_tokens_per_second": 4678.765 }, { "epoch": 0.5835459183673469, "grad_norm": 0.6632735372633155, "learning_rate": 8.043277272436415e-06, "loss": 0.3141871452331543, "num_input_tokens_seen": 274676088, "step": 4575, "train_runtime": 58708.7292, "train_tokens_per_second": 4678.624 }, { "epoch": 0.5841836734693877, "grad_norm": 0.54087084864485, "learning_rate": 8.039301497855331e-06, "loss": 0.33591418266296386, "num_input_tokens_seen": 274981048, "step": 4580, "train_runtime": 58762.902, "train_tokens_per_second": 4679.501 }, { "epoch": 0.5848214285714286, "grad_norm": 0.6427792175214475, "learning_rate": 8.035322673122934e-06, "loss": 0.3060802459716797, "num_input_tokens_seen": 275282680, "step": 4585, "train_runtime": 58817.932, "train_tokens_per_second": 4680.251 }, { "epoch": 0.5854591836734694, "grad_norm": 0.6031025817377057, "learning_rate": 8.031340802232246e-06, "loss": 0.33022494316101075, "num_input_tokens_seen": 275578376, "step": 4590, "train_runtime": 58886.4379, "train_tokens_per_second": 4679.828 }, { "epoch": 0.5860969387755102, "grad_norm": 0.5225939761001044, "learning_rate": 8.027355889179356e-06, "loss": 0.35036659240722656, "num_input_tokens_seen": 275890552, "step": 4595, "train_runtime": 58956.8332, "train_tokens_per_second": 4679.535 }, { "epoch": 0.5867346938775511, "grad_norm": 0.6038568442283259, "learning_rate": 8.0233679379634e-06, "loss": 0.3158730506896973, "num_input_tokens_seen": 276186592, "step": 4600, "train_runtime": 59016.9952, "train_tokens_per_second": 4679.781 }, { "epoch": 0.5873724489795918, "grad_norm": 0.5418728232199929, "learning_rate": 8.019376952586567e-06, "loss": 0.30447533130645754, "num_input_tokens_seen": 276493112, "step": 4605, "train_runtime": 59087.1949, "train_tokens_per_second": 4679.408 }, { "epoch": 0.5880102040816326, "grad_norm": 0.6604770163281342, "learning_rate": 8.01538293705409e-06, "loss": 0.29389081001281736, "num_input_tokens_seen": 276778280, "step": 4610, "train_runtime": 59156.0214, "train_tokens_per_second": 4678.785 }, { "epoch": 0.5886479591836735, "grad_norm": 0.5910960639532645, "learning_rate": 8.011385895374239e-06, "loss": 0.31752629280090333, "num_input_tokens_seen": 277079264, "step": 4615, "train_runtime": 59217.2144, "train_tokens_per_second": 4679.032 }, { "epoch": 0.5892857142857143, "grad_norm": 0.5874338866486604, "learning_rate": 8.007385831558329e-06, "loss": 0.3469626665115356, "num_input_tokens_seen": 277388912, "step": 4620, "train_runtime": 59285.0545, "train_tokens_per_second": 4678.901 }, { "epoch": 0.5899234693877551, "grad_norm": 0.6283317385335976, "learning_rate": 8.003382749620704e-06, "loss": 0.3177196741104126, "num_input_tokens_seen": 277684968, "step": 4625, "train_runtime": 59352.4811, "train_tokens_per_second": 4678.574 }, { "epoch": 0.5905612244897959, "grad_norm": 0.6337329309218752, "learning_rate": 7.99937665357873e-06, "loss": 0.3333481788635254, "num_input_tokens_seen": 277989152, "step": 4630, "train_runtime": 59424.6485, "train_tokens_per_second": 4678.011 }, { "epoch": 0.5911989795918368, "grad_norm": 0.6077936632271252, "learning_rate": 7.995367547452811e-06, "loss": 0.29072420597076415, "num_input_tokens_seen": 278272968, "step": 4635, "train_runtime": 59483.0749, "train_tokens_per_second": 4678.187 }, { "epoch": 0.5918367346938775, "grad_norm": 0.615433923915632, "learning_rate": 7.991355435266362e-06, "loss": 0.2903087615966797, "num_input_tokens_seen": 278571200, "step": 4640, "train_runtime": 59545.8982, "train_tokens_per_second": 4678.26 }, { "epoch": 0.5924744897959183, "grad_norm": 0.6792375997945723, "learning_rate": 7.987340321045816e-06, "loss": 0.30604982376098633, "num_input_tokens_seen": 278866808, "step": 4645, "train_runtime": 59618.4852, "train_tokens_per_second": 4677.523 }, { "epoch": 0.5931122448979592, "grad_norm": 0.6909830234790262, "learning_rate": 7.983322208820624e-06, "loss": 0.32366094589233396, "num_input_tokens_seen": 279147960, "step": 4650, "train_runtime": 59677.0057, "train_tokens_per_second": 4677.647 }, { "epoch": 0.59375, "grad_norm": 0.5682240529995807, "learning_rate": 7.97930110262324e-06, "loss": 0.30706181526184084, "num_input_tokens_seen": 279457336, "step": 4655, "train_runtime": 59747.2249, "train_tokens_per_second": 4677.327 }, { "epoch": 0.5943877551020408, "grad_norm": 0.5855001978640996, "learning_rate": 7.975277006489126e-06, "loss": 0.31863577365875245, "num_input_tokens_seen": 279739376, "step": 4660, "train_runtime": 59808.0774, "train_tokens_per_second": 4677.284 }, { "epoch": 0.5950255102040817, "grad_norm": 0.6283309046222093, "learning_rate": 7.971249924456742e-06, "loss": 0.3421057462692261, "num_input_tokens_seen": 280055896, "step": 4665, "train_runtime": 59876.8153, "train_tokens_per_second": 4677.201 }, { "epoch": 0.5956632653061225, "grad_norm": 0.6852848428090714, "learning_rate": 7.967219860567547e-06, "loss": 0.3344215631484985, "num_input_tokens_seen": 280344680, "step": 4670, "train_runtime": 59939.7728, "train_tokens_per_second": 4677.106 }, { "epoch": 0.5963010204081632, "grad_norm": 0.5976999232776021, "learning_rate": 7.963186818865993e-06, "loss": 0.31830806732177735, "num_input_tokens_seen": 280641200, "step": 4675, "train_runtime": 59997.9658, "train_tokens_per_second": 4677.512 }, { "epoch": 0.5969387755102041, "grad_norm": 0.6595538383558863, "learning_rate": 7.959150803399519e-06, "loss": 0.3340503215789795, "num_input_tokens_seen": 280944136, "step": 4680, "train_runtime": 60073.8834, "train_tokens_per_second": 4676.643 }, { "epoch": 0.5975765306122449, "grad_norm": 0.5490632590212808, "learning_rate": 7.955111818218544e-06, "loss": 0.2980647563934326, "num_input_tokens_seen": 281248600, "step": 4685, "train_runtime": 60131.2907, "train_tokens_per_second": 4677.242 }, { "epoch": 0.5982142857142857, "grad_norm": 0.6775033404877127, "learning_rate": 7.951069867376477e-06, "loss": 0.335029673576355, "num_input_tokens_seen": 281561744, "step": 4690, "train_runtime": 60195.349, "train_tokens_per_second": 4677.467 }, { "epoch": 0.5988520408163265, "grad_norm": 0.6153161340577447, "learning_rate": 7.947024954929696e-06, "loss": 0.3289950370788574, "num_input_tokens_seen": 281867880, "step": 4695, "train_runtime": 60271.5282, "train_tokens_per_second": 4676.634 }, { "epoch": 0.5994897959183674, "grad_norm": 0.6146139115004825, "learning_rate": 7.942977084937552e-06, "loss": 0.3104766845703125, "num_input_tokens_seen": 282165104, "step": 4700, "train_runtime": 60344.3141, "train_tokens_per_second": 4675.919 }, { "epoch": 0.6001275510204082, "grad_norm": 0.6597846232204004, "learning_rate": 7.938926261462366e-06, "loss": 0.32243638038635253, "num_input_tokens_seen": 282447688, "step": 4705, "train_runtime": 60408.1953, "train_tokens_per_second": 4675.652 }, { "epoch": 0.6007653061224489, "grad_norm": 0.6147432109350911, "learning_rate": 7.934872488569423e-06, "loss": 0.328096604347229, "num_input_tokens_seen": 282739992, "step": 4710, "train_runtime": 60473.6074, "train_tokens_per_second": 4675.428 }, { "epoch": 0.6014030612244898, "grad_norm": 0.6242896507087882, "learning_rate": 7.930815770326968e-06, "loss": 0.3395079135894775, "num_input_tokens_seen": 283026552, "step": 4715, "train_runtime": 60528.8065, "train_tokens_per_second": 4675.898 }, { "epoch": 0.6020408163265306, "grad_norm": 0.6249277645914738, "learning_rate": 7.926756110806197e-06, "loss": 0.3366846084594727, "num_input_tokens_seen": 283322448, "step": 4720, "train_runtime": 60592.3677, "train_tokens_per_second": 4675.877 }, { "epoch": 0.6026785714285714, "grad_norm": 0.629573578510475, "learning_rate": 7.922693514081267e-06, "loss": 0.33675575256347656, "num_input_tokens_seen": 283632392, "step": 4725, "train_runtime": 60668.4159, "train_tokens_per_second": 4675.124 }, { "epoch": 0.6033163265306123, "grad_norm": 0.6909843984830276, "learning_rate": 7.918627984229274e-06, "loss": 0.3276346206665039, "num_input_tokens_seen": 283930896, "step": 4730, "train_runtime": 60736.3279, "train_tokens_per_second": 4674.812 }, { "epoch": 0.6039540816326531, "grad_norm": 0.556604652718109, "learning_rate": 7.914559525330262e-06, "loss": 0.30612616539001464, "num_input_tokens_seen": 284233336, "step": 4735, "train_runtime": 60810.0437, "train_tokens_per_second": 4674.118 }, { "epoch": 0.6045918367346939, "grad_norm": 0.5489958640080462, "learning_rate": 7.910488141467215e-06, "loss": 0.30764472484588623, "num_input_tokens_seen": 284535840, "step": 4740, "train_runtime": 60870.9018, "train_tokens_per_second": 4674.415 }, { "epoch": 0.6052295918367347, "grad_norm": 0.6349237008579836, "learning_rate": 7.906413836726049e-06, "loss": 0.3160310029983521, "num_input_tokens_seen": 284842016, "step": 4745, "train_runtime": 60928.9895, "train_tokens_per_second": 4674.983 }, { "epoch": 0.6058673469387755, "grad_norm": 0.663809716098464, "learning_rate": 7.902336615195614e-06, "loss": 0.30224664211273194, "num_input_tokens_seen": 285134624, "step": 4750, "train_runtime": 60986.9207, "train_tokens_per_second": 4675.341 }, { "epoch": 0.6065051020408163, "grad_norm": 0.6536914593460793, "learning_rate": 7.89825648096769e-06, "loss": 0.3554865837097168, "num_input_tokens_seen": 285448544, "step": 4755, "train_runtime": 61046.5608, "train_tokens_per_second": 4675.915 }, { "epoch": 0.6071428571428571, "grad_norm": 0.5566778191411491, "learning_rate": 7.89417343813697e-06, "loss": 0.30611572265625, "num_input_tokens_seen": 285755440, "step": 4760, "train_runtime": 61122.2035, "train_tokens_per_second": 4675.15 }, { "epoch": 0.607780612244898, "grad_norm": 0.5449701216835566, "learning_rate": 7.890087490801077e-06, "loss": 0.30018014907836915, "num_input_tokens_seen": 286052824, "step": 4765, "train_runtime": 61185.6008, "train_tokens_per_second": 4675.166 }, { "epoch": 0.6084183673469388, "grad_norm": 0.6464923010268058, "learning_rate": 7.885998643060544e-06, "loss": 0.2942426443099976, "num_input_tokens_seen": 286352088, "step": 4770, "train_runtime": 61244.7406, "train_tokens_per_second": 4675.538 }, { "epoch": 0.6090561224489796, "grad_norm": 0.5962819806881094, "learning_rate": 7.881906899018815e-06, "loss": 0.3343794822692871, "num_input_tokens_seen": 286647208, "step": 4775, "train_runtime": 61310.5843, "train_tokens_per_second": 4675.33 }, { "epoch": 0.6096938775510204, "grad_norm": 0.5805268901725466, "learning_rate": 7.87781226278224e-06, "loss": 0.30678706169128417, "num_input_tokens_seen": 286937328, "step": 4780, "train_runtime": 61362.5036, "train_tokens_per_second": 4676.102 }, { "epoch": 0.6103316326530612, "grad_norm": 0.6437899436315898, "learning_rate": 7.873714738460075e-06, "loss": 0.3248507022857666, "num_input_tokens_seen": 287226808, "step": 4785, "train_runtime": 61443.8801, "train_tokens_per_second": 4674.62 }, { "epoch": 0.610969387755102, "grad_norm": 0.5852781947619063, "learning_rate": 7.86961433016447e-06, "loss": 0.32093214988708496, "num_input_tokens_seen": 287538528, "step": 4790, "train_runtime": 61516.2233, "train_tokens_per_second": 4674.19 }, { "epoch": 0.6116071428571429, "grad_norm": 0.6754745796276539, "learning_rate": 7.865511042010469e-06, "loss": 0.3276777505874634, "num_input_tokens_seen": 287840048, "step": 4795, "train_runtime": 61583.222, "train_tokens_per_second": 4674.001 }, { "epoch": 0.6122448979591837, "grad_norm": 0.626323586120589, "learning_rate": 7.861404878116014e-06, "loss": 0.3292057037353516, "num_input_tokens_seen": 288140544, "step": 4800, "train_runtime": 61637.4782, "train_tokens_per_second": 4674.762 }, { "epoch": 0.6128826530612245, "grad_norm": 0.7520627783549967, "learning_rate": 7.857295842601921e-06, "loss": 0.3104045867919922, "num_input_tokens_seen": 288449832, "step": 4805, "train_runtime": 61692.264, "train_tokens_per_second": 4675.624 }, { "epoch": 0.6135204081632653, "grad_norm": 0.5664426864627804, "learning_rate": 7.853183939591898e-06, "loss": 0.3004433631896973, "num_input_tokens_seen": 288740632, "step": 4810, "train_runtime": 61750.7635, "train_tokens_per_second": 4675.904 }, { "epoch": 0.6141581632653061, "grad_norm": 0.600372992492814, "learning_rate": 7.849069173212526e-06, "loss": 0.30824880599975585, "num_input_tokens_seen": 289036488, "step": 4815, "train_runtime": 61809.6933, "train_tokens_per_second": 4676.232 }, { "epoch": 0.6147959183673469, "grad_norm": 0.6426046266226517, "learning_rate": 7.844951547593261e-06, "loss": 0.3388571262359619, "num_input_tokens_seen": 289337856, "step": 4820, "train_runtime": 61877.2968, "train_tokens_per_second": 4675.994 }, { "epoch": 0.6154336734693877, "grad_norm": 0.6572670897112, "learning_rate": 7.840831066866423e-06, "loss": 0.3076493740081787, "num_input_tokens_seen": 289627360, "step": 4825, "train_runtime": 61950.161, "train_tokens_per_second": 4675.167 }, { "epoch": 0.6160714285714286, "grad_norm": 0.518151383501858, "learning_rate": 7.83670773516721e-06, "loss": 0.3006767749786377, "num_input_tokens_seen": 289937744, "step": 4830, "train_runtime": 62006.6492, "train_tokens_per_second": 4675.914 }, { "epoch": 0.6167091836734694, "grad_norm": 0.6708194572562727, "learning_rate": 7.83258155663367e-06, "loss": 0.3451414108276367, "num_input_tokens_seen": 290220600, "step": 4835, "train_runtime": 62076.1159, "train_tokens_per_second": 4675.238 }, { "epoch": 0.6173469387755102, "grad_norm": 0.5400032632095155, "learning_rate": 7.828452535406707e-06, "loss": 0.3213111400604248, "num_input_tokens_seen": 290525632, "step": 4840, "train_runtime": 62137.0817, "train_tokens_per_second": 4675.56 }, { "epoch": 0.6179846938775511, "grad_norm": 0.6390266182613682, "learning_rate": 7.82432067563009e-06, "loss": 0.32868859767913816, "num_input_tokens_seen": 290813016, "step": 4845, "train_runtime": 62210.2044, "train_tokens_per_second": 4674.684 }, { "epoch": 0.6186224489795918, "grad_norm": 0.5639678226521079, "learning_rate": 7.820185981450422e-06, "loss": 0.3112217903137207, "num_input_tokens_seen": 291116336, "step": 4850, "train_runtime": 62271.583, "train_tokens_per_second": 4674.947 }, { "epoch": 0.6192602040816326, "grad_norm": 0.5168941595517222, "learning_rate": 7.816048457017163e-06, "loss": 0.32264735698699953, "num_input_tokens_seen": 291425128, "step": 4855, "train_runtime": 62334.2272, "train_tokens_per_second": 4675.202 }, { "epoch": 0.6198979591836735, "grad_norm": 0.6172682257231668, "learning_rate": 7.811908106482601e-06, "loss": 0.31756374835968015, "num_input_tokens_seen": 291729000, "step": 4860, "train_runtime": 62392.5053, "train_tokens_per_second": 4675.706 }, { "epoch": 0.6205357142857143, "grad_norm": 0.5892438876269591, "learning_rate": 7.807764934001875e-06, "loss": 0.3277350187301636, "num_input_tokens_seen": 292033976, "step": 4865, "train_runtime": 62459.489, "train_tokens_per_second": 4675.574 }, { "epoch": 0.6211734693877551, "grad_norm": 0.6457575102508739, "learning_rate": 7.803618943732943e-06, "loss": 0.3173250675201416, "num_input_tokens_seen": 292325616, "step": 4870, "train_runtime": 62524.1033, "train_tokens_per_second": 4675.407 }, { "epoch": 0.6218112244897959, "grad_norm": 0.5758951210097139, "learning_rate": 7.799470139836593e-06, "loss": 0.31996634006500246, "num_input_tokens_seen": 292634232, "step": 4875, "train_runtime": 62597.9942, "train_tokens_per_second": 4674.818 }, { "epoch": 0.6224489795918368, "grad_norm": 0.5909826249235933, "learning_rate": 7.795318526476448e-06, "loss": 0.33882918357849123, "num_input_tokens_seen": 292931376, "step": 4880, "train_runtime": 62667.1691, "train_tokens_per_second": 4674.399 }, { "epoch": 0.6230867346938775, "grad_norm": 0.6086976638220172, "learning_rate": 7.791164107818933e-06, "loss": 0.31146893501281736, "num_input_tokens_seen": 293224304, "step": 4885, "train_runtime": 62743.5085, "train_tokens_per_second": 4673.381 }, { "epoch": 0.6237244897959183, "grad_norm": 0.580480051408316, "learning_rate": 7.787006888033304e-06, "loss": 0.3144942283630371, "num_input_tokens_seen": 293523048, "step": 4890, "train_runtime": 62808.265, "train_tokens_per_second": 4673.319 }, { "epoch": 0.6243622448979592, "grad_norm": 0.6371609435151778, "learning_rate": 7.782846871291619e-06, "loss": 0.3092595100402832, "num_input_tokens_seen": 293821216, "step": 4895, "train_runtime": 62870.7807, "train_tokens_per_second": 4673.414 }, { "epoch": 0.625, "grad_norm": 0.5499171585445445, "learning_rate": 7.778684061768744e-06, "loss": 0.2991960048675537, "num_input_tokens_seen": 294107864, "step": 4900, "train_runtime": 62934.3929, "train_tokens_per_second": 4673.245 }, { "epoch": 0.6256377551020408, "grad_norm": 0.5501051787913646, "learning_rate": 7.774518463642351e-06, "loss": 0.30958659648895265, "num_input_tokens_seen": 294414864, "step": 4905, "train_runtime": 62992.8264, "train_tokens_per_second": 4673.784 }, { "epoch": 0.6262755102040817, "grad_norm": 0.6533886515282153, "learning_rate": 7.770350081092906e-06, "loss": 0.32001142501831054, "num_input_tokens_seen": 294714672, "step": 4910, "train_runtime": 63052.3152, "train_tokens_per_second": 4674.129 }, { "epoch": 0.6269132653061225, "grad_norm": 0.5976532218295886, "learning_rate": 7.766178918303675e-06, "loss": 0.33820013999938964, "num_input_tokens_seen": 295023040, "step": 4915, "train_runtime": 63110.2752, "train_tokens_per_second": 4674.723 }, { "epoch": 0.6275510204081632, "grad_norm": 0.6125342171002576, "learning_rate": 7.762004979460711e-06, "loss": 0.3244414567947388, "num_input_tokens_seen": 295323616, "step": 4920, "train_runtime": 63184.0344, "train_tokens_per_second": 4674.023 }, { "epoch": 0.6281887755102041, "grad_norm": 0.5924976362043458, "learning_rate": 7.75782826875285e-06, "loss": 0.3276236057281494, "num_input_tokens_seen": 295615896, "step": 4925, "train_runtime": 63249.4879, "train_tokens_per_second": 4673.807 }, { "epoch": 0.6288265306122449, "grad_norm": 0.6082869176992618, "learning_rate": 7.753648790371716e-06, "loss": 0.33316860198974607, "num_input_tokens_seen": 295919816, "step": 4930, "train_runtime": 63318.2125, "train_tokens_per_second": 4673.534 }, { "epoch": 0.6294642857142857, "grad_norm": 0.7002911402149473, "learning_rate": 7.749466548511706e-06, "loss": 0.3236359119415283, "num_input_tokens_seen": 296198432, "step": 4935, "train_runtime": 63378.1008, "train_tokens_per_second": 4673.514 }, { "epoch": 0.6301020408163265, "grad_norm": 0.5816219463264141, "learning_rate": 7.745281547369992e-06, "loss": 0.3121765375137329, "num_input_tokens_seen": 296495328, "step": 4940, "train_runtime": 63443.5318, "train_tokens_per_second": 4673.374 }, { "epoch": 0.6307397959183674, "grad_norm": 0.6022866691062141, "learning_rate": 7.741093791146517e-06, "loss": 0.3518125057220459, "num_input_tokens_seen": 296795576, "step": 4945, "train_runtime": 63510.0051, "train_tokens_per_second": 4673.21 }, { "epoch": 0.6313775510204082, "grad_norm": 0.5766450882516254, "learning_rate": 7.736903284043985e-06, "loss": 0.30551507472991946, "num_input_tokens_seen": 297096360, "step": 4950, "train_runtime": 63573.7966, "train_tokens_per_second": 4673.252 }, { "epoch": 0.6320153061224489, "grad_norm": 0.6809684572369225, "learning_rate": 7.73271003026786e-06, "loss": 0.28991546630859377, "num_input_tokens_seen": 297396616, "step": 4955, "train_runtime": 63641.4024, "train_tokens_per_second": 4673.005 }, { "epoch": 0.6326530612244898, "grad_norm": 0.7136593430658471, "learning_rate": 7.72851403402637e-06, "loss": 0.3405500888824463, "num_input_tokens_seen": 297702568, "step": 4960, "train_runtime": 63703.3727, "train_tokens_per_second": 4673.262 }, { "epoch": 0.6332908163265306, "grad_norm": 0.6915335746408366, "learning_rate": 7.724315299530485e-06, "loss": 0.3068784236907959, "num_input_tokens_seen": 298000528, "step": 4965, "train_runtime": 63761.4508, "train_tokens_per_second": 4673.679 }, { "epoch": 0.6339285714285714, "grad_norm": 0.578644485028179, "learning_rate": 7.720113830993934e-06, "loss": 0.2965397357940674, "num_input_tokens_seen": 298288560, "step": 4970, "train_runtime": 63820.1295, "train_tokens_per_second": 4673.895 }, { "epoch": 0.6345663265306123, "grad_norm": 0.6109386315094099, "learning_rate": 7.71590963263318e-06, "loss": 0.282192587852478, "num_input_tokens_seen": 298589976, "step": 4975, "train_runtime": 63890.578, "train_tokens_per_second": 4673.459 }, { "epoch": 0.6352040816326531, "grad_norm": 0.6330384270424209, "learning_rate": 7.711702708667432e-06, "loss": 0.30868093967437743, "num_input_tokens_seen": 298884408, "step": 4980, "train_runtime": 63958.552, "train_tokens_per_second": 4673.095 }, { "epoch": 0.6358418367346939, "grad_norm": 0.6484254325873305, "learning_rate": 7.70749306331863e-06, "loss": 0.32778377532958985, "num_input_tokens_seen": 299174816, "step": 4985, "train_runtime": 64026.0495, "train_tokens_per_second": 4672.705 }, { "epoch": 0.6364795918367347, "grad_norm": 0.6253637143526166, "learning_rate": 7.703280700811447e-06, "loss": 0.31407947540283204, "num_input_tokens_seen": 299479872, "step": 4990, "train_runtime": 64095.8976, "train_tokens_per_second": 4672.372 }, { "epoch": 0.6371173469387755, "grad_norm": 0.6863215067239808, "learning_rate": 7.699065625373285e-06, "loss": 0.3558173894882202, "num_input_tokens_seen": 299788304, "step": 4995, "train_runtime": 64170.0961, "train_tokens_per_second": 4671.776 }, { "epoch": 0.6377551020408163, "grad_norm": 0.6250919444850997, "learning_rate": 7.694847841234268e-06, "loss": 0.3238536834716797, "num_input_tokens_seen": 300093128, "step": 5000, "train_runtime": 64232.8458, "train_tokens_per_second": 4671.958 }, { "epoch": 0.6383928571428571, "grad_norm": 0.5664256225168005, "learning_rate": 7.690627352627232e-06, "loss": 0.3008042573928833, "num_input_tokens_seen": 300381680, "step": 5005, "train_runtime": 64295.0871, "train_tokens_per_second": 4671.923 }, { "epoch": 0.639030612244898, "grad_norm": 0.5663882388947498, "learning_rate": 7.686404163787734e-06, "loss": 0.3397226810455322, "num_input_tokens_seen": 300692048, "step": 5010, "train_runtime": 64362.2952, "train_tokens_per_second": 4671.866 }, { "epoch": 0.6396683673469388, "grad_norm": 0.6387714807175179, "learning_rate": 7.68217827895404e-06, "loss": 0.3287776708602905, "num_input_tokens_seen": 301001184, "step": 5015, "train_runtime": 64439.2668, "train_tokens_per_second": 4671.083 }, { "epoch": 0.6403061224489796, "grad_norm": 0.5376293974091604, "learning_rate": 7.677949702367122e-06, "loss": 0.29458041191101075, "num_input_tokens_seen": 301303224, "step": 5020, "train_runtime": 64505.8927, "train_tokens_per_second": 4670.941 }, { "epoch": 0.6409438775510204, "grad_norm": 0.6333155482226666, "learning_rate": 7.673718438270649e-06, "loss": 0.3165082216262817, "num_input_tokens_seen": 301604056, "step": 5025, "train_runtime": 64566.5956, "train_tokens_per_second": 4671.209 }, { "epoch": 0.6415816326530612, "grad_norm": 0.6056866270349751, "learning_rate": 7.66948449091099e-06, "loss": 0.34581298828125, "num_input_tokens_seen": 301916416, "step": 5030, "train_runtime": 64635.2437, "train_tokens_per_second": 4671.08 }, { "epoch": 0.642219387755102, "grad_norm": 0.6205809220255843, "learning_rate": 7.66524786453721e-06, "loss": 0.31554408073425294, "num_input_tokens_seen": 302230184, "step": 5035, "train_runtime": 64704.3763, "train_tokens_per_second": 4670.939 }, { "epoch": 0.6428571428571429, "grad_norm": 0.5971419512432528, "learning_rate": 7.661008563401056e-06, "loss": 0.3280364513397217, "num_input_tokens_seen": 302539664, "step": 5040, "train_runtime": 64766.6388, "train_tokens_per_second": 4671.227 }, { "epoch": 0.6434948979591837, "grad_norm": 0.7949296375737326, "learning_rate": 7.656766591756964e-06, "loss": 0.31493797302246096, "num_input_tokens_seen": 302838568, "step": 5045, "train_runtime": 64827.9024, "train_tokens_per_second": 4671.423 }, { "epoch": 0.6441326530612245, "grad_norm": 0.5739689987719244, "learning_rate": 7.652521953862051e-06, "loss": 0.31455976963043214, "num_input_tokens_seen": 303146840, "step": 5050, "train_runtime": 64896.9355, "train_tokens_per_second": 4671.204 }, { "epoch": 0.6447704081632653, "grad_norm": 0.6820974189995908, "learning_rate": 7.648274653976102e-06, "loss": 0.3152459621429443, "num_input_tokens_seen": 303426728, "step": 5055, "train_runtime": 64967.5737, "train_tokens_per_second": 4670.433 }, { "epoch": 0.6454081632653061, "grad_norm": 0.625971283453452, "learning_rate": 7.644024696361587e-06, "loss": 0.3105034828186035, "num_input_tokens_seen": 303722768, "step": 5060, "train_runtime": 65036.4977, "train_tokens_per_second": 4670.036 }, { "epoch": 0.6460459183673469, "grad_norm": 0.5668267723732782, "learning_rate": 7.639772085283629e-06, "loss": 0.26640992164611815, "num_input_tokens_seen": 304019360, "step": 5065, "train_runtime": 65101.5581, "train_tokens_per_second": 4669.924 }, { "epoch": 0.6466836734693877, "grad_norm": 0.583395623415064, "learning_rate": 7.635516825010022e-06, "loss": 0.3122267246246338, "num_input_tokens_seen": 304326912, "step": 5070, "train_runtime": 65162.5529, "train_tokens_per_second": 4670.273 }, { "epoch": 0.6473214285714286, "grad_norm": 0.5322851635438068, "learning_rate": 7.631258919811215e-06, "loss": 0.30737671852111814, "num_input_tokens_seen": 304625808, "step": 5075, "train_runtime": 65229.3484, "train_tokens_per_second": 4670.073 }, { "epoch": 0.6479591836734694, "grad_norm": 0.5258592000351716, "learning_rate": 7.626998373960317e-06, "loss": 0.3087155342102051, "num_input_tokens_seen": 304932568, "step": 5080, "train_runtime": 65284.274, "train_tokens_per_second": 4670.843 }, { "epoch": 0.6485969387755102, "grad_norm": 0.5943785416732551, "learning_rate": 7.6227351917330835e-06, "loss": 0.32790634632110593, "num_input_tokens_seen": 305218960, "step": 5085, "train_runtime": 65353.0934, "train_tokens_per_second": 4670.306 }, { "epoch": 0.6492346938775511, "grad_norm": 0.5843599530027952, "learning_rate": 7.618469377407911e-06, "loss": 0.31712956428527833, "num_input_tokens_seen": 305520712, "step": 5090, "train_runtime": 65426.3681, "train_tokens_per_second": 4669.688 }, { "epoch": 0.6498724489795918, "grad_norm": 0.5914629103925383, "learning_rate": 7.614200935265845e-06, "loss": 0.30661187171936033, "num_input_tokens_seen": 305823824, "step": 5095, "train_runtime": 65494.4667, "train_tokens_per_second": 4669.46 }, { "epoch": 0.6505102040816326, "grad_norm": 0.6477041798359954, "learning_rate": 7.609929869590566e-06, "loss": 0.30426583290100095, "num_input_tokens_seen": 306127224, "step": 5100, "train_runtime": 65566.039, "train_tokens_per_second": 4668.991 }, { "epoch": 0.6511479591836735, "grad_norm": 0.5960900470317049, "learning_rate": 7.605656184668385e-06, "loss": 0.3433689117431641, "num_input_tokens_seen": 306433400, "step": 5105, "train_runtime": 65621.983, "train_tokens_per_second": 4669.676 }, { "epoch": 0.6517857142857143, "grad_norm": 0.6287577618544843, "learning_rate": 7.6013798847882455e-06, "loss": 0.30711252689361573, "num_input_tokens_seen": 306726808, "step": 5110, "train_runtime": 65691.7669, "train_tokens_per_second": 4669.182 }, { "epoch": 0.6524234693877551, "grad_norm": 0.5725835282668112, "learning_rate": 7.597100974241711e-06, "loss": 0.3282453536987305, "num_input_tokens_seen": 307036920, "step": 5115, "train_runtime": 65749.2341, "train_tokens_per_second": 4669.817 }, { "epoch": 0.6530612244897959, "grad_norm": 0.5735835153695586, "learning_rate": 7.592819457322967e-06, "loss": 0.31277282238006593, "num_input_tokens_seen": 307348912, "step": 5120, "train_runtime": 65805.5313, "train_tokens_per_second": 4670.563 }, { "epoch": 0.6536989795918368, "grad_norm": 0.6478752506247863, "learning_rate": 7.588535338328816e-06, "loss": 0.33504557609558105, "num_input_tokens_seen": 307662240, "step": 5125, "train_runtime": 65871.7396, "train_tokens_per_second": 4670.626 }, { "epoch": 0.6543367346938775, "grad_norm": 0.5360790048049417, "learning_rate": 7.584248621558669e-06, "loss": 0.33577775955200195, "num_input_tokens_seen": 307973576, "step": 5130, "train_runtime": 65945.9886, "train_tokens_per_second": 4670.088 }, { "epoch": 0.6549744897959183, "grad_norm": 0.630992103318103, "learning_rate": 7.579959311314549e-06, "loss": 0.32630224227905275, "num_input_tokens_seen": 308269776, "step": 5135, "train_runtime": 66000.5134, "train_tokens_per_second": 4670.718 }, { "epoch": 0.6556122448979592, "grad_norm": 0.585089749702886, "learning_rate": 7.575667411901074e-06, "loss": 0.33813388347625734, "num_input_tokens_seen": 308570536, "step": 5140, "train_runtime": 66059.6134, "train_tokens_per_second": 4671.092 }, { "epoch": 0.65625, "grad_norm": 0.6180172337705084, "learning_rate": 7.571372927625469e-06, "loss": 0.2856073141098022, "num_input_tokens_seen": 308858760, "step": 5145, "train_runtime": 66125.8292, "train_tokens_per_second": 4670.773 }, { "epoch": 0.6568877551020408, "grad_norm": 0.6205414200755942, "learning_rate": 7.567075862797546e-06, "loss": 0.3189757585525513, "num_input_tokens_seen": 309151432, "step": 5150, "train_runtime": 66195.2196, "train_tokens_per_second": 4670.298 }, { "epoch": 0.6575255102040817, "grad_norm": 0.45497411279431826, "learning_rate": 7.562776221729709e-06, "loss": 0.2730249404907227, "num_input_tokens_seen": 309448000, "step": 5155, "train_runtime": 66273.5363, "train_tokens_per_second": 4669.254 }, { "epoch": 0.6581632653061225, "grad_norm": 0.6431193726473291, "learning_rate": 7.558474008736951e-06, "loss": 0.33919711112976075, "num_input_tokens_seen": 309755312, "step": 5160, "train_runtime": 66337.0644, "train_tokens_per_second": 4669.415 }, { "epoch": 0.6588010204081632, "grad_norm": 0.6345790174538617, "learning_rate": 7.554169228136842e-06, "loss": 0.32866082191467283, "num_input_tokens_seen": 310046040, "step": 5165, "train_runtime": 66398.9286, "train_tokens_per_second": 4669.443 }, { "epoch": 0.6594387755102041, "grad_norm": 0.6466110440669572, "learning_rate": 7.549861884249529e-06, "loss": 0.31755714416503905, "num_input_tokens_seen": 310348952, "step": 5170, "train_runtime": 66464.8666, "train_tokens_per_second": 4669.368 }, { "epoch": 0.6600765306122449, "grad_norm": 0.6753687852421429, "learning_rate": 7.545551981397733e-06, "loss": 0.33164520263671876, "num_input_tokens_seen": 310648160, "step": 5175, "train_runtime": 66521.503, "train_tokens_per_second": 4669.891 }, { "epoch": 0.6607142857142857, "grad_norm": 0.658451408497734, "learning_rate": 7.541239523906742e-06, "loss": 0.30910749435424806, "num_input_tokens_seen": 310943712, "step": 5180, "train_runtime": 66574.9573, "train_tokens_per_second": 4670.581 }, { "epoch": 0.6613520408163265, "grad_norm": 0.6091814398062841, "learning_rate": 7.536924516104411e-06, "loss": 0.3098081111907959, "num_input_tokens_seen": 311228776, "step": 5185, "train_runtime": 66629.5605, "train_tokens_per_second": 4671.032 }, { "epoch": 0.6619897959183674, "grad_norm": 0.6174964320202159, "learning_rate": 7.532606962321149e-06, "loss": 0.31559340953826903, "num_input_tokens_seen": 311525824, "step": 5190, "train_runtime": 66687.8162, "train_tokens_per_second": 4671.405 }, { "epoch": 0.6626275510204082, "grad_norm": 0.5745193401631046, "learning_rate": 7.528286866889924e-06, "loss": 0.3417334079742432, "num_input_tokens_seen": 311825560, "step": 5195, "train_runtime": 66762.5988, "train_tokens_per_second": 4670.662 }, { "epoch": 0.6632653061224489, "grad_norm": 0.5378342298277153, "learning_rate": 7.523964234146251e-06, "loss": 0.3097379207611084, "num_input_tokens_seen": 312120744, "step": 5200, "train_runtime": 66833.4645, "train_tokens_per_second": 4670.127 }, { "epoch": 0.6639030612244898, "grad_norm": 0.5923373947572459, "learning_rate": 7.519639068428199e-06, "loss": 0.3182514667510986, "num_input_tokens_seen": 312409120, "step": 5205, "train_runtime": 66892.4783, "train_tokens_per_second": 4670.318 }, { "epoch": 0.6645408163265306, "grad_norm": 0.6071032131368624, "learning_rate": 7.515311374076368e-06, "loss": 0.3007327079772949, "num_input_tokens_seen": 312709064, "step": 5210, "train_runtime": 66954.6939, "train_tokens_per_second": 4670.458 }, { "epoch": 0.6651785714285714, "grad_norm": 0.6560051603946989, "learning_rate": 7.5109811554339054e-06, "loss": 0.33915157318115235, "num_input_tokens_seen": 313010520, "step": 5215, "train_runtime": 67023.5518, "train_tokens_per_second": 4670.157 }, { "epoch": 0.6658163265306123, "grad_norm": 0.5871591032812562, "learning_rate": 7.506648416846485e-06, "loss": 0.2778173446655273, "num_input_tokens_seen": 313304880, "step": 5220, "train_runtime": 67091.1107, "train_tokens_per_second": 4669.842 }, { "epoch": 0.6664540816326531, "grad_norm": 0.6423214904932472, "learning_rate": 7.502313162662316e-06, "loss": 0.3125695943832397, "num_input_tokens_seen": 313603488, "step": 5225, "train_runtime": 67152.8292, "train_tokens_per_second": 4669.997 }, { "epoch": 0.6670918367346939, "grad_norm": 0.6714441450406599, "learning_rate": 7.4979753972321265e-06, "loss": 0.32171783447265623, "num_input_tokens_seen": 313895880, "step": 5230, "train_runtime": 67209.7897, "train_tokens_per_second": 4670.389 }, { "epoch": 0.6677295918367347, "grad_norm": 0.6280272825117984, "learning_rate": 7.493635124909167e-06, "loss": 0.30132863521575926, "num_input_tokens_seen": 314181560, "step": 5235, "train_runtime": 67282.2628, "train_tokens_per_second": 4669.605 }, { "epoch": 0.6683673469387755, "grad_norm": 0.6046789286619518, "learning_rate": 7.489292350049205e-06, "loss": 0.34362359046936036, "num_input_tokens_seen": 314480704, "step": 5240, "train_runtime": 67344.5283, "train_tokens_per_second": 4669.729 }, { "epoch": 0.6690051020408163, "grad_norm": 0.6942861193479892, "learning_rate": 7.484947077010519e-06, "loss": 0.2994524955749512, "num_input_tokens_seen": 314785344, "step": 5245, "train_runtime": 67415.0252, "train_tokens_per_second": 4669.365 }, { "epoch": 0.6696428571428571, "grad_norm": 0.6531309656478049, "learning_rate": 7.480599310153891e-06, "loss": 0.3404392719268799, "num_input_tokens_seen": 315073712, "step": 5250, "train_runtime": 67475.7065, "train_tokens_per_second": 4669.439 }, { "epoch": 0.670280612244898, "grad_norm": 0.6287139881930139, "learning_rate": 7.476249053842613e-06, "loss": 0.31229596138000487, "num_input_tokens_seen": 315369368, "step": 5255, "train_runtime": 67542.6896, "train_tokens_per_second": 4669.186 }, { "epoch": 0.6709183673469388, "grad_norm": 0.6008136713743412, "learning_rate": 7.471896312442467e-06, "loss": 0.30401148796081545, "num_input_tokens_seen": 315671744, "step": 5260, "train_runtime": 67608.0524, "train_tokens_per_second": 4669.144 }, { "epoch": 0.6715561224489796, "grad_norm": 0.640502984649124, "learning_rate": 7.467541090321735e-06, "loss": 0.312398099899292, "num_input_tokens_seen": 315956648, "step": 5265, "train_runtime": 67674.1447, "train_tokens_per_second": 4668.794 }, { "epoch": 0.6721938775510204, "grad_norm": 0.6857237219956531, "learning_rate": 7.463183391851186e-06, "loss": 0.3361454963684082, "num_input_tokens_seen": 316269784, "step": 5270, "train_runtime": 67726.7386, "train_tokens_per_second": 4669.792 }, { "epoch": 0.6728316326530612, "grad_norm": 0.560048697643107, "learning_rate": 7.4588232214040744e-06, "loss": 0.3127558469772339, "num_input_tokens_seen": 316561816, "step": 5275, "train_runtime": 67802.9223, "train_tokens_per_second": 4668.852 }, { "epoch": 0.673469387755102, "grad_norm": 0.6315437137503608, "learning_rate": 7.454460583356138e-06, "loss": 0.33094162940979005, "num_input_tokens_seen": 316859640, "step": 5280, "train_runtime": 67868.741, "train_tokens_per_second": 4668.713 }, { "epoch": 0.6741071428571429, "grad_norm": 0.6589156035175846, "learning_rate": 7.4500954820855854e-06, "loss": 0.31834456920623777, "num_input_tokens_seen": 317163760, "step": 5285, "train_runtime": 67930.3554, "train_tokens_per_second": 4668.955 }, { "epoch": 0.6747448979591837, "grad_norm": 0.5594566819219117, "learning_rate": 7.445727921973104e-06, "loss": 0.31772470474243164, "num_input_tokens_seen": 317456784, "step": 5290, "train_runtime": 67995.0793, "train_tokens_per_second": 4668.82 }, { "epoch": 0.6753826530612245, "grad_norm": 0.5753294134784083, "learning_rate": 7.441357907401841e-06, "loss": 0.33693690299987794, "num_input_tokens_seen": 317774432, "step": 5295, "train_runtime": 68066.3482, "train_tokens_per_second": 4668.598 }, { "epoch": 0.6760204081632653, "grad_norm": 0.6508193992785211, "learning_rate": 7.436985442757415e-06, "loss": 0.33437199592590333, "num_input_tokens_seen": 318074152, "step": 5300, "train_runtime": 68138.8467, "train_tokens_per_second": 4668.03 }, { "epoch": 0.6766581632653061, "grad_norm": 0.6658023048885741, "learning_rate": 7.432610532427899e-06, "loss": 0.290529727935791, "num_input_tokens_seen": 318366544, "step": 5305, "train_runtime": 68204.2277, "train_tokens_per_second": 4667.842 }, { "epoch": 0.6772959183673469, "grad_norm": 0.6078737467243067, "learning_rate": 7.428233180803821e-06, "loss": 0.3208777904510498, "num_input_tokens_seen": 318669464, "step": 5310, "train_runtime": 68276.0065, "train_tokens_per_second": 4667.371 }, { "epoch": 0.6779336734693877, "grad_norm": 0.6370812769416774, "learning_rate": 7.423853392278158e-06, "loss": 0.3412617206573486, "num_input_tokens_seen": 318964520, "step": 5315, "train_runtime": 68341.6345, "train_tokens_per_second": 4667.206 }, { "epoch": 0.6785714285714286, "grad_norm": 0.6791444764089478, "learning_rate": 7.419471171246334e-06, "loss": 0.31648027896881104, "num_input_tokens_seen": 319266552, "step": 5320, "train_runtime": 68403.3871, "train_tokens_per_second": 4667.409 }, { "epoch": 0.6792091836734694, "grad_norm": 0.6209476744426583, "learning_rate": 7.415086522106215e-06, "loss": 0.3592404842376709, "num_input_tokens_seen": 319559784, "step": 5325, "train_runtime": 68469.0896, "train_tokens_per_second": 4667.212 }, { "epoch": 0.6798469387755102, "grad_norm": 0.6687067839958473, "learning_rate": 7.410699449258102e-06, "loss": 0.30386877059936523, "num_input_tokens_seen": 319855416, "step": 5330, "train_runtime": 68544.7873, "train_tokens_per_second": 4666.371 }, { "epoch": 0.6804846938775511, "grad_norm": 0.5567310646869349, "learning_rate": 7.406309957104727e-06, "loss": 0.3273475646972656, "num_input_tokens_seen": 320159136, "step": 5335, "train_runtime": 68607.8178, "train_tokens_per_second": 4666.511 }, { "epoch": 0.6811224489795918, "grad_norm": 0.6195204654488123, "learning_rate": 7.401918050051256e-06, "loss": 0.33095426559448243, "num_input_tokens_seen": 320459376, "step": 5340, "train_runtime": 68669.0539, "train_tokens_per_second": 4666.722 }, { "epoch": 0.6817602040816326, "grad_norm": 0.5936377968108272, "learning_rate": 7.39752373250527e-06, "loss": 0.31267762184143066, "num_input_tokens_seen": 320761440, "step": 5345, "train_runtime": 68729.2521, "train_tokens_per_second": 4667.029 }, { "epoch": 0.6823979591836735, "grad_norm": 0.5934863280670649, "learning_rate": 7.393127008876777e-06, "loss": 0.31867103576660155, "num_input_tokens_seen": 321048384, "step": 5350, "train_runtime": 68798.5837, "train_tokens_per_second": 4666.497 }, { "epoch": 0.6830357142857143, "grad_norm": 0.5841510400498795, "learning_rate": 7.388727883578195e-06, "loss": 0.30554609298706054, "num_input_tokens_seen": 321342320, "step": 5355, "train_runtime": 68871.2286, "train_tokens_per_second": 4665.843 }, { "epoch": 0.6836734693877551, "grad_norm": 0.6307707627641727, "learning_rate": 7.384326361024352e-06, "loss": 0.300091028213501, "num_input_tokens_seen": 321641256, "step": 5360, "train_runtime": 68936.4124, "train_tokens_per_second": 4665.767 }, { "epoch": 0.6843112244897959, "grad_norm": 0.6306372146818784, "learning_rate": 7.3799224456324865e-06, "loss": 0.30863926410675047, "num_input_tokens_seen": 321937816, "step": 5365, "train_runtime": 68994.569, "train_tokens_per_second": 4666.133 }, { "epoch": 0.6849489795918368, "grad_norm": 0.6008248350813888, "learning_rate": 7.375516141822232e-06, "loss": 0.3344412088394165, "num_input_tokens_seen": 322242640, "step": 5370, "train_runtime": 69054.7659, "train_tokens_per_second": 4666.479 }, { "epoch": 0.6855867346938775, "grad_norm": 0.8279346981897546, "learning_rate": 7.371107454015626e-06, "loss": 0.3194762945175171, "num_input_tokens_seen": 322524848, "step": 5375, "train_runtime": 69122.6831, "train_tokens_per_second": 4665.977 }, { "epoch": 0.6862244897959183, "grad_norm": 0.6209797654488943, "learning_rate": 7.3666963866370886e-06, "loss": 0.31194396018981935, "num_input_tokens_seen": 322829736, "step": 5380, "train_runtime": 69181.8802, "train_tokens_per_second": 4666.391 }, { "epoch": 0.6868622448979592, "grad_norm": 0.5691481622117558, "learning_rate": 7.3622829441134395e-06, "loss": 0.2930125713348389, "num_input_tokens_seen": 323123808, "step": 5385, "train_runtime": 69235.0295, "train_tokens_per_second": 4667.057 }, { "epoch": 0.6875, "grad_norm": 0.6473616644941033, "learning_rate": 7.357867130873875e-06, "loss": 0.3505560874938965, "num_input_tokens_seen": 323429168, "step": 5390, "train_runtime": 69292.5759, "train_tokens_per_second": 4667.588 }, { "epoch": 0.6881377551020408, "grad_norm": 0.6467814560569287, "learning_rate": 7.353448951349971e-06, "loss": 0.3212274074554443, "num_input_tokens_seen": 323721952, "step": 5395, "train_runtime": 69359.1103, "train_tokens_per_second": 4667.331 }, { "epoch": 0.6887755102040817, "grad_norm": 0.600696886308647, "learning_rate": 7.349028409975681e-06, "loss": 0.30536613464355467, "num_input_tokens_seen": 324008792, "step": 5400, "train_runtime": 69432.2952, "train_tokens_per_second": 4666.543 }, { "epoch": 0.6894132653061225, "grad_norm": 0.5884289747346985, "learning_rate": 7.344605511187322e-06, "loss": 0.32222843170166016, "num_input_tokens_seen": 324302264, "step": 5405, "train_runtime": 69497.2928, "train_tokens_per_second": 4666.401 }, { "epoch": 0.6900510204081632, "grad_norm": 0.6526508714808632, "learning_rate": 7.3401802594235894e-06, "loss": 0.32078051567077637, "num_input_tokens_seen": 324603400, "step": 5410, "train_runtime": 69564.2313, "train_tokens_per_second": 4666.24 }, { "epoch": 0.6906887755102041, "grad_norm": 0.587802745663465, "learning_rate": 7.3357526591255265e-06, "loss": 0.3128876924514771, "num_input_tokens_seen": 324905992, "step": 5415, "train_runtime": 69628.4336, "train_tokens_per_second": 4666.283 }, { "epoch": 0.6913265306122449, "grad_norm": 0.6294607766993028, "learning_rate": 7.331322714736543e-06, "loss": 0.310003662109375, "num_input_tokens_seen": 325216272, "step": 5420, "train_runtime": 69688.5627, "train_tokens_per_second": 4666.709 }, { "epoch": 0.6919642857142857, "grad_norm": 0.6494295041813904, "learning_rate": 7.326890430702396e-06, "loss": 0.34342279434204104, "num_input_tokens_seen": 325510864, "step": 5425, "train_runtime": 69761.3268, "train_tokens_per_second": 4666.065 }, { "epoch": 0.6926020408163265, "grad_norm": 0.5551213723940004, "learning_rate": 7.3224558114711905e-06, "loss": 0.31579127311706545, "num_input_tokens_seen": 325814872, "step": 5430, "train_runtime": 69835.6678, "train_tokens_per_second": 4665.451 }, { "epoch": 0.6932397959183674, "grad_norm": 0.570192939463917, "learning_rate": 7.31801886149338e-06, "loss": 0.3156977653503418, "num_input_tokens_seen": 326102152, "step": 5435, "train_runtime": 69901.8161, "train_tokens_per_second": 4665.146 }, { "epoch": 0.6938775510204082, "grad_norm": 0.6075826448906008, "learning_rate": 7.313579585221752e-06, "loss": 0.31879711151123047, "num_input_tokens_seen": 326405384, "step": 5440, "train_runtime": 69971.8967, "train_tokens_per_second": 4664.807 }, { "epoch": 0.6945153061224489, "grad_norm": 0.6530047373930488, "learning_rate": 7.309137987111428e-06, "loss": 0.3283576965332031, "num_input_tokens_seen": 326701896, "step": 5445, "train_runtime": 70026.3146, "train_tokens_per_second": 4665.416 }, { "epoch": 0.6951530612244898, "grad_norm": 0.5200186914870559, "learning_rate": 7.304694071619866e-06, "loss": 0.3029489040374756, "num_input_tokens_seen": 327008480, "step": 5450, "train_runtime": 70086.9124, "train_tokens_per_second": 4665.757 }, { "epoch": 0.6957908163265306, "grad_norm": 0.6400323639371005, "learning_rate": 7.300247843206844e-06, "loss": 0.3218910455703735, "num_input_tokens_seen": 327312080, "step": 5455, "train_runtime": 70151.711, "train_tokens_per_second": 4665.775 }, { "epoch": 0.6964285714285714, "grad_norm": 0.745126229894632, "learning_rate": 7.2957993063344615e-06, "loss": 0.3268340826034546, "num_input_tokens_seen": 327610720, "step": 5460, "train_runtime": 70211.1615, "train_tokens_per_second": 4666.077 }, { "epoch": 0.6970663265306123, "grad_norm": 0.6267138034083698, "learning_rate": 7.291348465467136e-06, "loss": 0.3033930778503418, "num_input_tokens_seen": 327908664, "step": 5465, "train_runtime": 70281.0144, "train_tokens_per_second": 4665.679 }, { "epoch": 0.6977040816326531, "grad_norm": 0.593440548594412, "learning_rate": 7.286895325071599e-06, "loss": 0.31491804122924805, "num_input_tokens_seen": 328213216, "step": 5470, "train_runtime": 70348.5324, "train_tokens_per_second": 4665.53 }, { "epoch": 0.6983418367346939, "grad_norm": 0.5532470434303797, "learning_rate": 7.282439889616887e-06, "loss": 0.31497039794921877, "num_input_tokens_seen": 328494408, "step": 5475, "train_runtime": 70417.7486, "train_tokens_per_second": 4664.938 }, { "epoch": 0.6989795918367347, "grad_norm": 0.6900719796874891, "learning_rate": 7.277982163574339e-06, "loss": 0.3080450534820557, "num_input_tokens_seen": 328776992, "step": 5480, "train_runtime": 70478.2147, "train_tokens_per_second": 4664.945 }, { "epoch": 0.6996173469387755, "grad_norm": 0.7299462946103753, "learning_rate": 7.273522151417598e-06, "loss": 0.3473284482955933, "num_input_tokens_seen": 329077928, "step": 5485, "train_runtime": 70545.7672, "train_tokens_per_second": 4664.744 }, { "epoch": 0.7002551020408163, "grad_norm": 0.5425858036772111, "learning_rate": 7.2690598576225954e-06, "loss": 0.3336508750915527, "num_input_tokens_seen": 329378848, "step": 5490, "train_runtime": 70608.5906, "train_tokens_per_second": 4664.855 }, { "epoch": 0.7008928571428571, "grad_norm": 0.5647942767407259, "learning_rate": 7.264595286667554e-06, "loss": 0.310113525390625, "num_input_tokens_seen": 329661384, "step": 5495, "train_runtime": 70661.2711, "train_tokens_per_second": 4665.376 }, { "epoch": 0.701530612244898, "grad_norm": 0.512781121429987, "learning_rate": 7.2601284430329836e-06, "loss": 0.3203456163406372, "num_input_tokens_seen": 329971352, "step": 5500, "train_runtime": 70737.8087, "train_tokens_per_second": 4664.71 }, { "epoch": 0.7021683673469388, "grad_norm": 0.5688066588778269, "learning_rate": 7.255659331201673e-06, "loss": 0.3099203109741211, "num_input_tokens_seen": 330291552, "step": 5505, "train_runtime": 70798.6698, "train_tokens_per_second": 4665.223 }, { "epoch": 0.7028061224489796, "grad_norm": 0.5891400739535447, "learning_rate": 7.251187955658691e-06, "loss": 0.3002140760421753, "num_input_tokens_seen": 330586912, "step": 5510, "train_runtime": 70862.5548, "train_tokens_per_second": 4665.185 }, { "epoch": 0.7034438775510204, "grad_norm": 0.5634930859443, "learning_rate": 7.246714320891371e-06, "loss": 0.303344202041626, "num_input_tokens_seen": 330881376, "step": 5515, "train_runtime": 70936.0328, "train_tokens_per_second": 4664.504 }, { "epoch": 0.7040816326530612, "grad_norm": 0.7030866651444997, "learning_rate": 7.24223843138932e-06, "loss": 0.34733502864837645, "num_input_tokens_seen": 331184952, "step": 5520, "train_runtime": 70995.1486, "train_tokens_per_second": 4664.896 }, { "epoch": 0.704719387755102, "grad_norm": 0.6239650926525834, "learning_rate": 7.237760291644405e-06, "loss": 0.3356089353561401, "num_input_tokens_seen": 331476552, "step": 5525, "train_runtime": 71056.1078, "train_tokens_per_second": 4664.997 }, { "epoch": 0.7053571428571429, "grad_norm": 0.5444120060158437, "learning_rate": 7.233279906150752e-06, "loss": 0.2855654239654541, "num_input_tokens_seen": 331770192, "step": 5530, "train_runtime": 71128.7262, "train_tokens_per_second": 4664.363 }, { "epoch": 0.7059948979591837, "grad_norm": 0.5728118319140764, "learning_rate": 7.228797279404744e-06, "loss": 0.3068604230880737, "num_input_tokens_seen": 332079320, "step": 5535, "train_runtime": 71196.7875, "train_tokens_per_second": 4664.246 }, { "epoch": 0.7066326530612245, "grad_norm": 0.6239924959947185, "learning_rate": 7.224312415905005e-06, "loss": 0.3272867202758789, "num_input_tokens_seen": 332367456, "step": 5540, "train_runtime": 71266.177, "train_tokens_per_second": 4663.748 }, { "epoch": 0.7072704081632653, "grad_norm": 0.6408351287033327, "learning_rate": 7.219825320152411e-06, "loss": 0.31500868797302245, "num_input_tokens_seen": 332646216, "step": 5545, "train_runtime": 71329.6649, "train_tokens_per_second": 4663.505 }, { "epoch": 0.7079081632653061, "grad_norm": 0.608909772396368, "learning_rate": 7.2153359966500765e-06, "loss": 0.342067551612854, "num_input_tokens_seen": 332943400, "step": 5550, "train_runtime": 71393.3297, "train_tokens_per_second": 4663.508 }, { "epoch": 0.7085459183673469, "grad_norm": 0.5893268458814994, "learning_rate": 7.210844449903352e-06, "loss": 0.2956761598587036, "num_input_tokens_seen": 333248504, "step": 5555, "train_runtime": 71456.0605, "train_tokens_per_second": 4663.684 }, { "epoch": 0.7091836734693877, "grad_norm": 0.5988037762181453, "learning_rate": 7.206350684419814e-06, "loss": 0.3130906105041504, "num_input_tokens_seen": 333548136, "step": 5560, "train_runtime": 71529.7065, "train_tokens_per_second": 4663.072 }, { "epoch": 0.7098214285714286, "grad_norm": 0.5755608587354144, "learning_rate": 7.2018547047092745e-06, "loss": 0.3113144874572754, "num_input_tokens_seen": 333859296, "step": 5565, "train_runtime": 71594.5593, "train_tokens_per_second": 4663.194 }, { "epoch": 0.7104591836734694, "grad_norm": 0.6933761028281489, "learning_rate": 7.1973565152837635e-06, "loss": 0.2980863094329834, "num_input_tokens_seen": 334133912, "step": 5570, "train_runtime": 71660.1254, "train_tokens_per_second": 4662.759 }, { "epoch": 0.7110969387755102, "grad_norm": 0.5744246362594235, "learning_rate": 7.192856120657524e-06, "loss": 0.3452368021011353, "num_input_tokens_seen": 334436520, "step": 5575, "train_runtime": 71727.3936, "train_tokens_per_second": 4662.605 }, { "epoch": 0.7117346938775511, "grad_norm": 0.5562666466329808, "learning_rate": 7.18835352534702e-06, "loss": 0.3156794786453247, "num_input_tokens_seen": 334724960, "step": 5580, "train_runtime": 71792.7717, "train_tokens_per_second": 4662.377 }, { "epoch": 0.7123724489795918, "grad_norm": 0.5810126803543275, "learning_rate": 7.183848733870917e-06, "loss": 0.31806468963623047, "num_input_tokens_seen": 335027432, "step": 5585, "train_runtime": 71853.7856, "train_tokens_per_second": 4662.627 }, { "epoch": 0.7130102040816326, "grad_norm": 0.5614850789313679, "learning_rate": 7.179341750750092e-06, "loss": 0.3097982883453369, "num_input_tokens_seen": 335315032, "step": 5590, "train_runtime": 71920.507, "train_tokens_per_second": 4662.301 }, { "epoch": 0.7136479591836735, "grad_norm": 0.7027806136416876, "learning_rate": 7.174832580507614e-06, "loss": 0.3387152671813965, "num_input_tokens_seen": 335615736, "step": 5595, "train_runtime": 71990.4425, "train_tokens_per_second": 4661.949 }, { "epoch": 0.7142857142857143, "grad_norm": 0.5677823402656198, "learning_rate": 7.170321227668752e-06, "loss": 0.3012820243835449, "num_input_tokens_seen": 335911536, "step": 5600, "train_runtime": 72042.9342, "train_tokens_per_second": 4662.658 }, { "epoch": 0.7149234693877551, "grad_norm": 0.6854391883576302, "learning_rate": 7.165807696760964e-06, "loss": 0.3246180534362793, "num_input_tokens_seen": 336216560, "step": 5605, "train_runtime": 72104.3182, "train_tokens_per_second": 4662.919 }, { "epoch": 0.7155612244897959, "grad_norm": 0.5519379710985469, "learning_rate": 7.16129199231389e-06, "loss": 0.3269120931625366, "num_input_tokens_seen": 336525464, "step": 5610, "train_runtime": 72167.3153, "train_tokens_per_second": 4663.128 }, { "epoch": 0.7161989795918368, "grad_norm": 0.513365672663749, "learning_rate": 7.15677411885936e-06, "loss": 0.3312812328338623, "num_input_tokens_seen": 336842232, "step": 5615, "train_runtime": 72212.8576, "train_tokens_per_second": 4664.574 }, { "epoch": 0.7168367346938775, "grad_norm": 0.6341148503548436, "learning_rate": 7.152254080931372e-06, "loss": 0.3205650806427002, "num_input_tokens_seen": 337150176, "step": 5620, "train_runtime": 72283.9459, "train_tokens_per_second": 4664.247 }, { "epoch": 0.7174744897959183, "grad_norm": 0.5548980557737851, "learning_rate": 7.1477318830661e-06, "loss": 0.3206507682800293, "num_input_tokens_seen": 337437632, "step": 5625, "train_runtime": 72345.8729, "train_tokens_per_second": 4664.228 }, { "epoch": 0.7181122448979592, "grad_norm": 0.5971686031945006, "learning_rate": 7.143207529801888e-06, "loss": 0.31696553230285646, "num_input_tokens_seen": 337741592, "step": 5630, "train_runtime": 72402.8212, "train_tokens_per_second": 4664.757 }, { "epoch": 0.71875, "grad_norm": 0.5987837254902296, "learning_rate": 7.1386810256792374e-06, "loss": 0.3265007495880127, "num_input_tokens_seen": 338054400, "step": 5635, "train_runtime": 72461.0792, "train_tokens_per_second": 4665.324 }, { "epoch": 0.7193877551020408, "grad_norm": 0.6011374940867165, "learning_rate": 7.134152375240812e-06, "loss": 0.3095307588577271, "num_input_tokens_seen": 338358256, "step": 5640, "train_runtime": 72513.7511, "train_tokens_per_second": 4666.125 }, { "epoch": 0.7200255102040817, "grad_norm": 0.5562678963814983, "learning_rate": 7.1296215830314295e-06, "loss": 0.3101684331893921, "num_input_tokens_seen": 338639064, "step": 5645, "train_runtime": 72581.1899, "train_tokens_per_second": 4665.659 }, { "epoch": 0.7206632653061225, "grad_norm": 0.6891181205804473, "learning_rate": 7.125088653598057e-06, "loss": 0.31908905506134033, "num_input_tokens_seen": 338936432, "step": 5650, "train_runtime": 72655.789, "train_tokens_per_second": 4664.961 }, { "epoch": 0.7213010204081632, "grad_norm": 0.599370342027607, "learning_rate": 7.1205535914898035e-06, "loss": 0.3092601537704468, "num_input_tokens_seen": 339243760, "step": 5655, "train_runtime": 72729.6511, "train_tokens_per_second": 4664.449 }, { "epoch": 0.7219387755102041, "grad_norm": 0.5428513321361451, "learning_rate": 7.116016401257921e-06, "loss": 0.309174108505249, "num_input_tokens_seen": 339537904, "step": 5660, "train_runtime": 72800.7996, "train_tokens_per_second": 4663.931 }, { "epoch": 0.7225765306122449, "grad_norm": 0.676493803165307, "learning_rate": 7.1114770874558e-06, "loss": 0.32912750244140626, "num_input_tokens_seen": 339838352, "step": 5665, "train_runtime": 72872.0773, "train_tokens_per_second": 4663.492 }, { "epoch": 0.7232142857142857, "grad_norm": 0.6124251596984999, "learning_rate": 7.1069356546389555e-06, "loss": 0.3122929573059082, "num_input_tokens_seen": 340124272, "step": 5670, "train_runtime": 72934.4532, "train_tokens_per_second": 4663.424 }, { "epoch": 0.7238520408163265, "grad_norm": 0.6551044599285598, "learning_rate": 7.1023921073650325e-06, "loss": 0.3367321491241455, "num_input_tokens_seen": 340427880, "step": 5675, "train_runtime": 73002.8802, "train_tokens_per_second": 4663.212 }, { "epoch": 0.7244897959183674, "grad_norm": 0.5838697926266972, "learning_rate": 7.0978464501938e-06, "loss": 0.3130692958831787, "num_input_tokens_seen": 340725064, "step": 5680, "train_runtime": 73061.914, "train_tokens_per_second": 4663.511 }, { "epoch": 0.7251275510204082, "grad_norm": 0.655893167777473, "learning_rate": 7.093298687687141e-06, "loss": 0.3281263828277588, "num_input_tokens_seen": 341012904, "step": 5685, "train_runtime": 73122.1396, "train_tokens_per_second": 4663.607 }, { "epoch": 0.7257653061224489, "grad_norm": 0.579608632469256, "learning_rate": 7.088748824409053e-06, "loss": 0.32417736053466795, "num_input_tokens_seen": 341309872, "step": 5690, "train_runtime": 73187.1886, "train_tokens_per_second": 4663.519 }, { "epoch": 0.7264030612244898, "grad_norm": 0.6737364289551899, "learning_rate": 7.084196864925643e-06, "loss": 0.3085744619369507, "num_input_tokens_seen": 341604184, "step": 5695, "train_runtime": 73250.1928, "train_tokens_per_second": 4663.526 }, { "epoch": 0.7270408163265306, "grad_norm": 0.5394877761343759, "learning_rate": 7.079642813805118e-06, "loss": 0.2835739850997925, "num_input_tokens_seen": 341909216, "step": 5700, "train_runtime": 73309.7341, "train_tokens_per_second": 4663.899 }, { "epoch": 0.7276785714285714, "grad_norm": 0.5693239010320096, "learning_rate": 7.075086675617788e-06, "loss": 0.31586780548095705, "num_input_tokens_seen": 342216536, "step": 5705, "train_runtime": 73368.6682, "train_tokens_per_second": 4664.342 }, { "epoch": 0.7283163265306123, "grad_norm": 0.6293092230529511, "learning_rate": 7.070528454936054e-06, "loss": 0.3154031753540039, "num_input_tokens_seen": 342510720, "step": 5710, "train_runtime": 73432.9702, "train_tokens_per_second": 4664.263 }, { "epoch": 0.7289540816326531, "grad_norm": 0.6247204617519868, "learning_rate": 7.065968156334413e-06, "loss": 0.3413267135620117, "num_input_tokens_seen": 342819008, "step": 5715, "train_runtime": 73505.2332, "train_tokens_per_second": 4663.872 }, { "epoch": 0.7295918367346939, "grad_norm": 0.5607540231944393, "learning_rate": 7.061405784389438e-06, "loss": 0.2918368101119995, "num_input_tokens_seen": 343129288, "step": 5720, "train_runtime": 73556.2738, "train_tokens_per_second": 4664.854 }, { "epoch": 0.7302295918367347, "grad_norm": 0.5737415637644253, "learning_rate": 7.05684134367979e-06, "loss": 0.32287158966064455, "num_input_tokens_seen": 343442576, "step": 5725, "train_runtime": 73619.9869, "train_tokens_per_second": 4665.072 }, { "epoch": 0.7308673469387755, "grad_norm": 0.6516254960633631, "learning_rate": 7.052274838786204e-06, "loss": 0.31599087715148927, "num_input_tokens_seen": 343729528, "step": 5730, "train_runtime": 73689.7979, "train_tokens_per_second": 4664.547 }, { "epoch": 0.7315051020408163, "grad_norm": 0.6419116302607135, "learning_rate": 7.047706274291488e-06, "loss": 0.33379082679748534, "num_input_tokens_seen": 344020672, "step": 5735, "train_runtime": 73747.1483, "train_tokens_per_second": 4664.867 }, { "epoch": 0.7321428571428571, "grad_norm": 0.6429067893548648, "learning_rate": 7.043135654780513e-06, "loss": 0.31350982189178467, "num_input_tokens_seen": 344330088, "step": 5740, "train_runtime": 73808.7612, "train_tokens_per_second": 4665.166 }, { "epoch": 0.732780612244898, "grad_norm": 0.6412908482581101, "learning_rate": 7.038562984840216e-06, "loss": 0.31070795059204104, "num_input_tokens_seen": 344616200, "step": 5745, "train_runtime": 73882.4156, "train_tokens_per_second": 4664.387 }, { "epoch": 0.7334183673469388, "grad_norm": 0.623040144230442, "learning_rate": 7.033988269059593e-06, "loss": 0.31840083599090574, "num_input_tokens_seen": 344917440, "step": 5750, "train_runtime": 73953.8959, "train_tokens_per_second": 4663.952 }, { "epoch": 0.7340561224489796, "grad_norm": 0.628578861280673, "learning_rate": 7.029411512029687e-06, "loss": 0.3089389085769653, "num_input_tokens_seen": 345217608, "step": 5755, "train_runtime": 74024.1975, "train_tokens_per_second": 4663.578 }, { "epoch": 0.7346938775510204, "grad_norm": 0.5606091803259069, "learning_rate": 7.024832718343594e-06, "loss": 0.29696319103240965, "num_input_tokens_seen": 345494232, "step": 5760, "train_runtime": 74084.842, "train_tokens_per_second": 4663.494 }, { "epoch": 0.7353316326530612, "grad_norm": 0.6110013208452163, "learning_rate": 7.020251892596456e-06, "loss": 0.33933837413787843, "num_input_tokens_seen": 345773888, "step": 5765, "train_runtime": 74147.9634, "train_tokens_per_second": 4663.296 }, { "epoch": 0.735969387755102, "grad_norm": 0.5937391578055509, "learning_rate": 7.015669039385449e-06, "loss": 0.32836318016052246, "num_input_tokens_seen": 346081664, "step": 5770, "train_runtime": 74214.095, "train_tokens_per_second": 4663.288 }, { "epoch": 0.7366071428571429, "grad_norm": 0.5767933191935242, "learning_rate": 7.011084163309786e-06, "loss": 0.3163835287094116, "num_input_tokens_seen": 346388624, "step": 5775, "train_runtime": 74295.7532, "train_tokens_per_second": 4662.294 }, { "epoch": 0.7372448979591837, "grad_norm": 0.6200013210658539, "learning_rate": 7.006497268970712e-06, "loss": 0.3465720176696777, "num_input_tokens_seen": 346690048, "step": 5780, "train_runtime": 74362.9628, "train_tokens_per_second": 4662.133 }, { "epoch": 0.7378826530612245, "grad_norm": 0.5860895337522811, "learning_rate": 7.001908360971495e-06, "loss": 0.30460400581359864, "num_input_tokens_seen": 346979944, "step": 5785, "train_runtime": 74427.8912, "train_tokens_per_second": 4661.961 }, { "epoch": 0.7385204081632653, "grad_norm": 0.5893342038131894, "learning_rate": 6.997317443917424e-06, "loss": 0.330953311920166, "num_input_tokens_seen": 347275248, "step": 5790, "train_runtime": 74495.4865, "train_tokens_per_second": 4661.695 }, { "epoch": 0.7391581632653061, "grad_norm": 0.6181135044247561, "learning_rate": 6.9927245224158066e-06, "loss": 0.29505696296691897, "num_input_tokens_seen": 347580432, "step": 5795, "train_runtime": 74559.5101, "train_tokens_per_second": 4661.785 }, { "epoch": 0.7397959183673469, "grad_norm": 0.5616472690246123, "learning_rate": 6.988129601075961e-06, "loss": 0.32417964935302734, "num_input_tokens_seen": 347877008, "step": 5800, "train_runtime": 74612.3328, "train_tokens_per_second": 4662.46 }, { "epoch": 0.7404336734693877, "grad_norm": 0.5771117709451439, "learning_rate": 6.983532684509208e-06, "loss": 0.31626770496368406, "num_input_tokens_seen": 348157464, "step": 5805, "train_runtime": 74682.9093, "train_tokens_per_second": 4661.809 }, { "epoch": 0.7410714285714286, "grad_norm": 0.6524021867150832, "learning_rate": 6.978933777328878e-06, "loss": 0.3219144344329834, "num_input_tokens_seen": 348450544, "step": 5810, "train_runtime": 74752.5374, "train_tokens_per_second": 4661.388 }, { "epoch": 0.7417091836734694, "grad_norm": 0.8802892201540943, "learning_rate": 6.974332884150292e-06, "loss": 0.3003734588623047, "num_input_tokens_seen": 348748816, "step": 5815, "train_runtime": 74812.6672, "train_tokens_per_second": 4661.628 }, { "epoch": 0.7423469387755102, "grad_norm": 0.5492570085094902, "learning_rate": 6.96973000959077e-06, "loss": 0.32568812370300293, "num_input_tokens_seen": 349044736, "step": 5820, "train_runtime": 74875.5254, "train_tokens_per_second": 4661.667 }, { "epoch": 0.7429846938775511, "grad_norm": 0.6516981459950403, "learning_rate": 6.965125158269619e-06, "loss": 0.33084864616394044, "num_input_tokens_seen": 349337304, "step": 5825, "train_runtime": 74948.0739, "train_tokens_per_second": 4661.058 }, { "epoch": 0.7436224489795918, "grad_norm": 0.5294860523386414, "learning_rate": 6.9605183348081265e-06, "loss": 0.31689841747283937, "num_input_tokens_seen": 349647744, "step": 5830, "train_runtime": 75008.9694, "train_tokens_per_second": 4661.412 }, { "epoch": 0.7442602040816326, "grad_norm": 0.6739558272302397, "learning_rate": 6.955909543829564e-06, "loss": 0.32897903919219973, "num_input_tokens_seen": 349938208, "step": 5835, "train_runtime": 75066.8762, "train_tokens_per_second": 4661.686 }, { "epoch": 0.7448979591836735, "grad_norm": 0.6373827784654852, "learning_rate": 6.951298789959172e-06, "loss": 0.31219475269317626, "num_input_tokens_seen": 350225080, "step": 5840, "train_runtime": 75124.6662, "train_tokens_per_second": 4661.919 }, { "epoch": 0.7455357142857143, "grad_norm": 0.5835360397196525, "learning_rate": 6.946686077824167e-06, "loss": 0.3332829475402832, "num_input_tokens_seen": 350524048, "step": 5845, "train_runtime": 75188.8705, "train_tokens_per_second": 4661.914 }, { "epoch": 0.7461734693877551, "grad_norm": 0.6520631081854955, "learning_rate": 6.942071412053728e-06, "loss": 0.2965895175933838, "num_input_tokens_seen": 350824584, "step": 5850, "train_runtime": 75248.6658, "train_tokens_per_second": 4662.203 }, { "epoch": 0.7468112244897959, "grad_norm": 0.6599584764606783, "learning_rate": 6.937454797278991e-06, "loss": 0.32917354106903074, "num_input_tokens_seen": 351137552, "step": 5855, "train_runtime": 75312.9623, "train_tokens_per_second": 4662.379 }, { "epoch": 0.7474489795918368, "grad_norm": 0.5688668088307691, "learning_rate": 6.932836238133054e-06, "loss": 0.3156865358352661, "num_input_tokens_seen": 351434200, "step": 5860, "train_runtime": 75378.7756, "train_tokens_per_second": 4662.243 }, { "epoch": 0.7480867346938775, "grad_norm": 0.691188150805711, "learning_rate": 6.928215739250963e-06, "loss": 0.29285922050476076, "num_input_tokens_seen": 351721312, "step": 5865, "train_runtime": 75442.2192, "train_tokens_per_second": 4662.128 }, { "epoch": 0.7487244897959183, "grad_norm": 0.6367175792798876, "learning_rate": 6.923593305269711e-06, "loss": 0.3241368293762207, "num_input_tokens_seen": 352017416, "step": 5870, "train_runtime": 75505.6431, "train_tokens_per_second": 4662.134 }, { "epoch": 0.7493622448979592, "grad_norm": 0.5737297755630368, "learning_rate": 6.9189689408282345e-06, "loss": 0.3378509521484375, "num_input_tokens_seen": 352320464, "step": 5875, "train_runtime": 75570.3406, "train_tokens_per_second": 4662.153 }, { "epoch": 0.75, "grad_norm": 0.6365716099382133, "learning_rate": 6.914342650567405e-06, "loss": 0.3078855037689209, "num_input_tokens_seen": 352612088, "step": 5880, "train_runtime": 75630.9608, "train_tokens_per_second": 4662.272 }, { "epoch": 0.7506377551020408, "grad_norm": 0.585545534743707, "learning_rate": 6.9097144391300285e-06, "loss": 0.318976092338562, "num_input_tokens_seen": 352905800, "step": 5885, "train_runtime": 75697.1376, "train_tokens_per_second": 4662.076 }, { "epoch": 0.7512755102040817, "grad_norm": 0.5863621066790211, "learning_rate": 6.905084311160837e-06, "loss": 0.32762937545776366, "num_input_tokens_seen": 353216736, "step": 5890, "train_runtime": 75764.3689, "train_tokens_per_second": 4662.043 }, { "epoch": 0.7519132653061225, "grad_norm": 0.6353532987193916, "learning_rate": 6.90045227130649e-06, "loss": 0.32003273963928225, "num_input_tokens_seen": 353530984, "step": 5895, "train_runtime": 75832.3062, "train_tokens_per_second": 4662.01 }, { "epoch": 0.7525510204081632, "grad_norm": 0.6017119626901829, "learning_rate": 6.8958183242155615e-06, "loss": 0.29575016498565676, "num_input_tokens_seen": 353840848, "step": 5900, "train_runtime": 75892.0809, "train_tokens_per_second": 4662.421 }, { "epoch": 0.7531887755102041, "grad_norm": 0.6034869442022718, "learning_rate": 6.891182474538539e-06, "loss": 0.3226417064666748, "num_input_tokens_seen": 354129328, "step": 5905, "train_runtime": 75967.9806, "train_tokens_per_second": 4661.56 }, { "epoch": 0.7538265306122449, "grad_norm": 0.6269025894057103, "learning_rate": 6.886544726927826e-06, "loss": 0.32311596870422366, "num_input_tokens_seen": 354431368, "step": 5910, "train_runtime": 76043.1807, "train_tokens_per_second": 4660.922 }, { "epoch": 0.7544642857142857, "grad_norm": 0.5905587693464358, "learning_rate": 6.881905086037721e-06, "loss": 0.28950068950653074, "num_input_tokens_seen": 354746904, "step": 5915, "train_runtime": 76101.1077, "train_tokens_per_second": 4661.521 }, { "epoch": 0.7551020408163265, "grad_norm": 0.6341417919505897, "learning_rate": 6.877263556524432e-06, "loss": 0.333311939239502, "num_input_tokens_seen": 355047584, "step": 5920, "train_runtime": 76168.9611, "train_tokens_per_second": 4661.316 }, { "epoch": 0.7557397959183674, "grad_norm": 0.5848267786266075, "learning_rate": 6.872620143046056e-06, "loss": 0.30979280471801757, "num_input_tokens_seen": 355342328, "step": 5925, "train_runtime": 76233.81, "train_tokens_per_second": 4661.217 }, { "epoch": 0.7563775510204082, "grad_norm": 0.5941793485823651, "learning_rate": 6.867974850262582e-06, "loss": 0.3388402462005615, "num_input_tokens_seen": 355650912, "step": 5930, "train_runtime": 76289.5218, "train_tokens_per_second": 4661.858 }, { "epoch": 0.7570153061224489, "grad_norm": 0.5416742865479929, "learning_rate": 6.863327682835887e-06, "loss": 0.31301352977752683, "num_input_tokens_seen": 355972024, "step": 5935, "train_runtime": 76343.9285, "train_tokens_per_second": 4662.742 }, { "epoch": 0.7576530612244898, "grad_norm": 0.5944668862745454, "learning_rate": 6.858678645429728e-06, "loss": 0.3231534957885742, "num_input_tokens_seen": 356273760, "step": 5940, "train_runtime": 76416.5962, "train_tokens_per_second": 4662.256 }, { "epoch": 0.7582908163265306, "grad_norm": 0.60876421575269, "learning_rate": 6.85402774270974e-06, "loss": 0.3035454034805298, "num_input_tokens_seen": 356561896, "step": 5945, "train_runtime": 76476.3086, "train_tokens_per_second": 4662.384 }, { "epoch": 0.7589285714285714, "grad_norm": 0.584356004877175, "learning_rate": 6.849374979343426e-06, "loss": 0.33470563888549804, "num_input_tokens_seen": 356883248, "step": 5950, "train_runtime": 76543.6473, "train_tokens_per_second": 4662.48 }, { "epoch": 0.7595663265306123, "grad_norm": 0.6735457874399653, "learning_rate": 6.84472036000016e-06, "loss": 0.3113273620605469, "num_input_tokens_seen": 357186760, "step": 5955, "train_runtime": 76604.0499, "train_tokens_per_second": 4662.766 }, { "epoch": 0.7602040816326531, "grad_norm": 0.5398270797593189, "learning_rate": 6.840063889351177e-06, "loss": 0.29850049018859864, "num_input_tokens_seen": 357493416, "step": 5960, "train_runtime": 76666.5356, "train_tokens_per_second": 4662.966 }, { "epoch": 0.7608418367346939, "grad_norm": 0.637683964437538, "learning_rate": 6.835405572069572e-06, "loss": 0.3150575876235962, "num_input_tokens_seen": 357801504, "step": 5965, "train_runtime": 76730.531, "train_tokens_per_second": 4663.092 }, { "epoch": 0.7614795918367347, "grad_norm": 0.5882936203541248, "learning_rate": 6.830745412830291e-06, "loss": 0.3131128787994385, "num_input_tokens_seen": 358090144, "step": 5970, "train_runtime": 76793.9281, "train_tokens_per_second": 4663.001 }, { "epoch": 0.7621173469387755, "grad_norm": 0.5407032572429494, "learning_rate": 6.826083416310129e-06, "loss": 0.3144979000091553, "num_input_tokens_seen": 358382488, "step": 5975, "train_runtime": 76847.6766, "train_tokens_per_second": 4663.544 }, { "epoch": 0.7627551020408163, "grad_norm": 0.6315366716254545, "learning_rate": 6.821419587187727e-06, "loss": 0.3227547645568848, "num_input_tokens_seen": 358660592, "step": 5980, "train_runtime": 76912.7466, "train_tokens_per_second": 4663.214 }, { "epoch": 0.7633928571428571, "grad_norm": 0.6037809244004879, "learning_rate": 6.816753930143558e-06, "loss": 0.31183757781982424, "num_input_tokens_seen": 358960128, "step": 5985, "train_runtime": 76979.2434, "train_tokens_per_second": 4663.077 }, { "epoch": 0.764030612244898, "grad_norm": 0.6946191668857217, "learning_rate": 6.812086449859941e-06, "loss": 0.311761212348938, "num_input_tokens_seen": 359267296, "step": 5990, "train_runtime": 77031.7524, "train_tokens_per_second": 4663.886 }, { "epoch": 0.7646683673469388, "grad_norm": 0.565472235354576, "learning_rate": 6.807417151021015e-06, "loss": 0.3410171985626221, "num_input_tokens_seen": 359558824, "step": 5995, "train_runtime": 77092.7315, "train_tokens_per_second": 4663.978 }, { "epoch": 0.7653061224489796, "grad_norm": 0.5555826911790634, "learning_rate": 6.802746038312749e-06, "loss": 0.3195962905883789, "num_input_tokens_seen": 359868936, "step": 6000, "train_runtime": 77155.0352, "train_tokens_per_second": 4664.231 }, { "epoch": 0.7659438775510204, "grad_norm": 0.5342150038853042, "learning_rate": 6.79807311642293e-06, "loss": 0.31259951591491697, "num_input_tokens_seen": 360164520, "step": 6005, "train_runtime": 77222.711, "train_tokens_per_second": 4663.971 }, { "epoch": 0.7665816326530612, "grad_norm": 0.6055030347230119, "learning_rate": 6.793398390041159e-06, "loss": 0.3051009654998779, "num_input_tokens_seen": 360474088, "step": 6010, "train_runtime": 77269.2801, "train_tokens_per_second": 4665.167 }, { "epoch": 0.767219387755102, "grad_norm": 0.6039069580622654, "learning_rate": 6.788721863858856e-06, "loss": 0.3037103176116943, "num_input_tokens_seen": 360754400, "step": 6015, "train_runtime": 77331.8812, "train_tokens_per_second": 4665.015 }, { "epoch": 0.7678571428571429, "grad_norm": 0.5920840464539026, "learning_rate": 6.784043542569236e-06, "loss": 0.3146142721176147, "num_input_tokens_seen": 361050456, "step": 6020, "train_runtime": 77403.7861, "train_tokens_per_second": 4664.506 }, { "epoch": 0.7684948979591837, "grad_norm": 0.6063580119658678, "learning_rate": 6.7793634308673265e-06, "loss": 0.3116027593612671, "num_input_tokens_seen": 361360328, "step": 6025, "train_runtime": 77473.4802, "train_tokens_per_second": 4664.31 }, { "epoch": 0.7691326530612245, "grad_norm": 0.6070484223576093, "learning_rate": 6.7746815334499426e-06, "loss": 0.30540153980255125, "num_input_tokens_seen": 361662224, "step": 6030, "train_runtime": 77545.4846, "train_tokens_per_second": 4663.872 }, { "epoch": 0.7697704081632653, "grad_norm": 0.5792044891291048, "learning_rate": 6.7699978550156954e-06, "loss": 0.31980509757995607, "num_input_tokens_seen": 361964112, "step": 6035, "train_runtime": 77606.0584, "train_tokens_per_second": 4664.122 }, { "epoch": 0.7704081632653061, "grad_norm": 0.5202278457370635, "learning_rate": 6.765312400264985e-06, "loss": 0.3199894428253174, "num_input_tokens_seen": 362279936, "step": 6040, "train_runtime": 77659.8235, "train_tokens_per_second": 4664.96 }, { "epoch": 0.7710459183673469, "grad_norm": 0.5867446845865297, "learning_rate": 6.760625173899992e-06, "loss": 0.31152822971343996, "num_input_tokens_seen": 362570056, "step": 6045, "train_runtime": 77726.1988, "train_tokens_per_second": 4664.708 }, { "epoch": 0.7716836734693877, "grad_norm": 0.606783979605095, "learning_rate": 6.755936180624674e-06, "loss": 0.29929795265197756, "num_input_tokens_seen": 362853320, "step": 6050, "train_runtime": 77783.7031, "train_tokens_per_second": 4664.902 }, { "epoch": 0.7723214285714286, "grad_norm": 0.5882279974676495, "learning_rate": 6.751245425144765e-06, "loss": 0.3252225875854492, "num_input_tokens_seen": 363154000, "step": 6055, "train_runtime": 77854.9987, "train_tokens_per_second": 4664.492 }, { "epoch": 0.7729591836734694, "grad_norm": 0.6204455476082986, "learning_rate": 6.746552912167766e-06, "loss": 0.2846733570098877, "num_input_tokens_seen": 363454440, "step": 6060, "train_runtime": 77915.8005, "train_tokens_per_second": 4664.708 }, { "epoch": 0.7735969387755102, "grad_norm": 0.6324651027545711, "learning_rate": 6.741858646402941e-06, "loss": 0.3407684326171875, "num_input_tokens_seen": 363751104, "step": 6065, "train_runtime": 77977.5438, "train_tokens_per_second": 4664.819 }, { "epoch": 0.7742346938775511, "grad_norm": 0.5352416376404033, "learning_rate": 6.737162632561311e-06, "loss": 0.29468593597412107, "num_input_tokens_seen": 364061960, "step": 6070, "train_runtime": 78040.1638, "train_tokens_per_second": 4665.059 }, { "epoch": 0.7748724489795918, "grad_norm": 0.6185847427444751, "learning_rate": 6.732464875355657e-06, "loss": 0.3351437568664551, "num_input_tokens_seen": 364357224, "step": 6075, "train_runtime": 78101.9157, "train_tokens_per_second": 4665.151 }, { "epoch": 0.7755102040816326, "grad_norm": 0.6091453075723209, "learning_rate": 6.7277653795005085e-06, "loss": 0.32475030422210693, "num_input_tokens_seen": 364642304, "step": 6080, "train_runtime": 78171.4356, "train_tokens_per_second": 4664.649 }, { "epoch": 0.7761479591836735, "grad_norm": 0.6654318166872217, "learning_rate": 6.723064149712131e-06, "loss": 0.3222649097442627, "num_input_tokens_seen": 364942760, "step": 6085, "train_runtime": 78236.8926, "train_tokens_per_second": 4664.587 }, { "epoch": 0.7767857142857143, "grad_norm": 0.6193247613367058, "learning_rate": 6.718361190708542e-06, "loss": 0.3156604290008545, "num_input_tokens_seen": 365259032, "step": 6090, "train_runtime": 78293.4974, "train_tokens_per_second": 4665.254 }, { "epoch": 0.7774234693877551, "grad_norm": 0.665726352101644, "learning_rate": 6.713656507209489e-06, "loss": 0.33889386653900144, "num_input_tokens_seen": 365556656, "step": 6095, "train_runtime": 78342.3526, "train_tokens_per_second": 4666.143 }, { "epoch": 0.7780612244897959, "grad_norm": 0.6369863038873577, "learning_rate": 6.708950103936448e-06, "loss": 0.3098180294036865, "num_input_tokens_seen": 365845600, "step": 6100, "train_runtime": 78402.5516, "train_tokens_per_second": 4666.246 }, { "epoch": 0.7786989795918368, "grad_norm": 0.5770540204745025, "learning_rate": 6.704241985612625e-06, "loss": 0.32828497886657715, "num_input_tokens_seen": 366150704, "step": 6105, "train_runtime": 78470.2801, "train_tokens_per_second": 4666.107 }, { "epoch": 0.7793367346938775, "grad_norm": 0.5658637392761506, "learning_rate": 6.699532156962945e-06, "loss": 0.31436471939086913, "num_input_tokens_seen": 366448944, "step": 6110, "train_runtime": 78530.699, "train_tokens_per_second": 4666.315 }, { "epoch": 0.7799744897959183, "grad_norm": 0.6531724313969975, "learning_rate": 6.6948206227140525e-06, "loss": 0.33806796073913575, "num_input_tokens_seen": 366749016, "step": 6115, "train_runtime": 78591.4583, "train_tokens_per_second": 4666.525 }, { "epoch": 0.7806122448979592, "grad_norm": 0.705172393284724, "learning_rate": 6.690107387594298e-06, "loss": 0.3181670427322388, "num_input_tokens_seen": 367047544, "step": 6120, "train_runtime": 78653.9582, "train_tokens_per_second": 4666.612 }, { "epoch": 0.78125, "grad_norm": 0.6320122617674263, "learning_rate": 6.685392456333744e-06, "loss": 0.29224820137023927, "num_input_tokens_seen": 367342096, "step": 6125, "train_runtime": 78721.4587, "train_tokens_per_second": 4666.353 }, { "epoch": 0.7818877551020408, "grad_norm": 0.5751095955705227, "learning_rate": 6.680675833664151e-06, "loss": 0.34242610931396483, "num_input_tokens_seen": 367646520, "step": 6130, "train_runtime": 78776.8337, "train_tokens_per_second": 4666.937 }, { "epoch": 0.7825255102040817, "grad_norm": 0.7247333049487453, "learning_rate": 6.67595752431898e-06, "loss": 0.3134866714477539, "num_input_tokens_seen": 367920896, "step": 6135, "train_runtime": 78844.1279, "train_tokens_per_second": 4666.434 }, { "epoch": 0.7831632653061225, "grad_norm": 0.6181022749426421, "learning_rate": 6.671237533033388e-06, "loss": 0.3164665699005127, "num_input_tokens_seen": 368226224, "step": 6140, "train_runtime": 78894.1503, "train_tokens_per_second": 4667.345 }, { "epoch": 0.7838010204081632, "grad_norm": 0.6088077988506396, "learning_rate": 6.66651586454421e-06, "loss": 0.3136889934539795, "num_input_tokens_seen": 368522792, "step": 6145, "train_runtime": 78959.7175, "train_tokens_per_second": 4667.225 }, { "epoch": 0.7844387755102041, "grad_norm": 0.5976310044878483, "learning_rate": 6.661792523589972e-06, "loss": 0.29033560752868653, "num_input_tokens_seen": 368821224, "step": 6150, "train_runtime": 79019.8184, "train_tokens_per_second": 4667.452 }, { "epoch": 0.7850765306122449, "grad_norm": 0.6629498888375844, "learning_rate": 6.65706751491088e-06, "loss": 0.3224802494049072, "num_input_tokens_seen": 369100760, "step": 6155, "train_runtime": 79083.1157, "train_tokens_per_second": 4667.251 }, { "epoch": 0.7857142857142857, "grad_norm": 0.6142346816031169, "learning_rate": 6.652340843248806e-06, "loss": 0.3112659454345703, "num_input_tokens_seen": 369393584, "step": 6160, "train_runtime": 79141.4529, "train_tokens_per_second": 4667.511 }, { "epoch": 0.7863520408163265, "grad_norm": 0.5517826119783504, "learning_rate": 6.647612513347297e-06, "loss": 0.2997623682022095, "num_input_tokens_seen": 369672280, "step": 6165, "train_runtime": 79196.9514, "train_tokens_per_second": 4667.759 }, { "epoch": 0.7869897959183674, "grad_norm": 0.604744948814889, "learning_rate": 6.642882529951561e-06, "loss": 0.30200629234313964, "num_input_tokens_seen": 369972056, "step": 6170, "train_runtime": 79268.6732, "train_tokens_per_second": 4667.317 }, { "epoch": 0.7876275510204082, "grad_norm": 0.5928238184254466, "learning_rate": 6.638150897808469e-06, "loss": 0.3180851936340332, "num_input_tokens_seen": 370285480, "step": 6175, "train_runtime": 79337.6191, "train_tokens_per_second": 4667.212 }, { "epoch": 0.7882653061224489, "grad_norm": 0.5578302357166072, "learning_rate": 6.6334176216665406e-06, "loss": 0.3170527458190918, "num_input_tokens_seen": 370593456, "step": 6180, "train_runtime": 79399.5846, "train_tokens_per_second": 4667.448 }, { "epoch": 0.7889030612244898, "grad_norm": 0.8621658286713906, "learning_rate": 6.628682706275953e-06, "loss": 0.33642194271087644, "num_input_tokens_seen": 370893072, "step": 6185, "train_runtime": 79467.2199, "train_tokens_per_second": 4667.246 }, { "epoch": 0.7895408163265306, "grad_norm": 0.5393751716222243, "learning_rate": 6.623946156388523e-06, "loss": 0.3066478490829468, "num_input_tokens_seen": 371208088, "step": 6190, "train_runtime": 79540.416, "train_tokens_per_second": 4666.912 }, { "epoch": 0.7901785714285714, "grad_norm": 0.5671943980487131, "learning_rate": 6.619207976757708e-06, "loss": 0.2984332799911499, "num_input_tokens_seen": 371503888, "step": 6195, "train_runtime": 79599.2555, "train_tokens_per_second": 4667.178 }, { "epoch": 0.7908163265306123, "grad_norm": 0.6903010968290758, "learning_rate": 6.614468172138603e-06, "loss": 0.3375420093536377, "num_input_tokens_seen": 371784424, "step": 6200, "train_runtime": 79659.4687, "train_tokens_per_second": 4667.172 }, { "epoch": 0.7914540816326531, "grad_norm": 0.5678990709503928, "learning_rate": 6.609726747287934e-06, "loss": 0.3009253978729248, "num_input_tokens_seen": 372074512, "step": 6205, "train_runtime": 79731.8077, "train_tokens_per_second": 4666.576 }, { "epoch": 0.7920918367346939, "grad_norm": 0.5884104225346212, "learning_rate": 6.60498370696405e-06, "loss": 0.3048467874526978, "num_input_tokens_seen": 372391472, "step": 6210, "train_runtime": 79782.987, "train_tokens_per_second": 4667.555 }, { "epoch": 0.7927295918367347, "grad_norm": 0.6219725624461221, "learning_rate": 6.600239055926923e-06, "loss": 0.342468786239624, "num_input_tokens_seen": 372690712, "step": 6215, "train_runtime": 79850.5693, "train_tokens_per_second": 4667.352 }, { "epoch": 0.7933673469387755, "grad_norm": 0.5759103556707833, "learning_rate": 6.595492798938146e-06, "loss": 0.2964707612991333, "num_input_tokens_seen": 372980160, "step": 6220, "train_runtime": 79907.2822, "train_tokens_per_second": 4667.662 }, { "epoch": 0.7940051020408163, "grad_norm": 0.6560616953026334, "learning_rate": 6.5907449407609145e-06, "loss": 0.3294534206390381, "num_input_tokens_seen": 373276592, "step": 6225, "train_runtime": 79971.6459, "train_tokens_per_second": 4667.612 }, { "epoch": 0.7946428571428571, "grad_norm": 0.6075933232196977, "learning_rate": 6.585995486160038e-06, "loss": 0.32330219745635985, "num_input_tokens_seen": 373580264, "step": 6230, "train_runtime": 80031.9246, "train_tokens_per_second": 4667.891 }, { "epoch": 0.795280612244898, "grad_norm": 0.6117048961658761, "learning_rate": 6.581244439901926e-06, "loss": 0.31589932441711427, "num_input_tokens_seen": 373881384, "step": 6235, "train_runtime": 80106.9612, "train_tokens_per_second": 4667.277 }, { "epoch": 0.7959183673469388, "grad_norm": 0.6364040012997616, "learning_rate": 6.576491806754583e-06, "loss": 0.3358692407608032, "num_input_tokens_seen": 374181560, "step": 6240, "train_runtime": 80175.2874, "train_tokens_per_second": 4667.044 }, { "epoch": 0.7965561224489796, "grad_norm": 0.6078783651176742, "learning_rate": 6.571737591487611e-06, "loss": 0.2995163440704346, "num_input_tokens_seen": 374481944, "step": 6245, "train_runtime": 80231.6106, "train_tokens_per_second": 4667.511 }, { "epoch": 0.7971938775510204, "grad_norm": 0.5631314811210728, "learning_rate": 6.566981798872196e-06, "loss": 0.2826210975646973, "num_input_tokens_seen": 374787232, "step": 6250, "train_runtime": 80302.0862, "train_tokens_per_second": 4667.217 }, { "epoch": 0.7978316326530612, "grad_norm": 0.6573391038039677, "learning_rate": 6.562224433681108e-06, "loss": 0.3200786828994751, "num_input_tokens_seen": 375072512, "step": 6255, "train_runtime": 80365.0699, "train_tokens_per_second": 4667.109 }, { "epoch": 0.798469387755102, "grad_norm": 0.6524553859053104, "learning_rate": 6.557465500688696e-06, "loss": 0.3107785940170288, "num_input_tokens_seen": 375375488, "step": 6260, "train_runtime": 80436.89, "train_tokens_per_second": 4666.708 }, { "epoch": 0.7991071428571429, "grad_norm": 0.5721551379940883, "learning_rate": 6.55270500467088e-06, "loss": 0.3176266193389893, "num_input_tokens_seen": 375665088, "step": 6265, "train_runtime": 80497.857, "train_tokens_per_second": 4666.771 }, { "epoch": 0.7997448979591837, "grad_norm": 0.570386334621138, "learning_rate": 6.5479429504051526e-06, "loss": 0.30910840034484866, "num_input_tokens_seen": 375975144, "step": 6270, "train_runtime": 80558.5344, "train_tokens_per_second": 4667.105 }, { "epoch": 0.8003826530612245, "grad_norm": 0.6624500993470845, "learning_rate": 6.543179342670565e-06, "loss": 0.3345738410949707, "num_input_tokens_seen": 376273768, "step": 6275, "train_runtime": 80613.4859, "train_tokens_per_second": 4667.628 }, { "epoch": 0.8010204081632653, "grad_norm": 0.5514177978725938, "learning_rate": 6.53841418624773e-06, "loss": 0.27700390815734866, "num_input_tokens_seen": 376570160, "step": 6280, "train_runtime": 80680.357, "train_tokens_per_second": 4667.433 }, { "epoch": 0.8016581632653061, "grad_norm": 0.6103525141332224, "learning_rate": 6.53364748591882e-06, "loss": 0.30763068199157717, "num_input_tokens_seen": 376871272, "step": 6285, "train_runtime": 80742.579, "train_tokens_per_second": 4667.565 }, { "epoch": 0.8022959183673469, "grad_norm": 0.5973259444864897, "learning_rate": 6.528879246467546e-06, "loss": 0.32227473258972167, "num_input_tokens_seen": 377162112, "step": 6290, "train_runtime": 80812.9176, "train_tokens_per_second": 4667.102 }, { "epoch": 0.8029336734693877, "grad_norm": 0.5886180237196361, "learning_rate": 6.524109472679172e-06, "loss": 0.3222978115081787, "num_input_tokens_seen": 377468504, "step": 6295, "train_runtime": 80882.3703, "train_tokens_per_second": 4666.882 }, { "epoch": 0.8035714285714286, "grad_norm": 0.6296556623300213, "learning_rate": 6.519338169340499e-06, "loss": 0.3378443241119385, "num_input_tokens_seen": 377766856, "step": 6300, "train_runtime": 80946.6364, "train_tokens_per_second": 4666.863 }, { "epoch": 0.8042091836734694, "grad_norm": 0.6521390135069829, "learning_rate": 6.514565341239861e-06, "loss": 0.3549522638320923, "num_input_tokens_seen": 378056736, "step": 6305, "train_runtime": 81012.3663, "train_tokens_per_second": 4666.655 }, { "epoch": 0.8048469387755102, "grad_norm": 0.5831745656351125, "learning_rate": 6.509790993167129e-06, "loss": 0.3268167018890381, "num_input_tokens_seen": 378359720, "step": 6310, "train_runtime": 81079.6852, "train_tokens_per_second": 4666.517 }, { "epoch": 0.8054846938775511, "grad_norm": 0.6768644315495205, "learning_rate": 6.505015129913689e-06, "loss": 0.31839518547058104, "num_input_tokens_seen": 378660256, "step": 6315, "train_runtime": 81154.1649, "train_tokens_per_second": 4665.937 }, { "epoch": 0.8061224489795918, "grad_norm": 0.5333202428201802, "learning_rate": 6.5002377562724585e-06, "loss": 0.3217827320098877, "num_input_tokens_seen": 378966872, "step": 6320, "train_runtime": 81218.2191, "train_tokens_per_second": 4666.033 }, { "epoch": 0.8067602040816326, "grad_norm": 0.5724622174452084, "learning_rate": 6.495458877037861e-06, "loss": 0.30530538558959963, "num_input_tokens_seen": 379259880, "step": 6325, "train_runtime": 81283.7854, "train_tokens_per_second": 4665.874 }, { "epoch": 0.8073979591836735, "grad_norm": 0.5754135264649226, "learning_rate": 6.490678497005839e-06, "loss": 0.3361009359359741, "num_input_tokens_seen": 379574600, "step": 6330, "train_runtime": 81343.1769, "train_tokens_per_second": 4666.336 }, { "epoch": 0.8080357142857143, "grad_norm": 0.6991322085025484, "learning_rate": 6.485896620973836e-06, "loss": 0.3305660724639893, "num_input_tokens_seen": 379873224, "step": 6335, "train_runtime": 81409.2661, "train_tokens_per_second": 4666.216 }, { "epoch": 0.8086734693877551, "grad_norm": 0.5648402154997423, "learning_rate": 6.481113253740799e-06, "loss": 0.31418297290802, "num_input_tokens_seen": 380154392, "step": 6340, "train_runtime": 81473.2564, "train_tokens_per_second": 4666.002 }, { "epoch": 0.8093112244897959, "grad_norm": 0.5991247444358954, "learning_rate": 6.4763284001071715e-06, "loss": 0.32512798309326174, "num_input_tokens_seen": 380458984, "step": 6345, "train_runtime": 81525.0358, "train_tokens_per_second": 4666.775 }, { "epoch": 0.8099489795918368, "grad_norm": 0.5988449159868657, "learning_rate": 6.4715420648748875e-06, "loss": 0.3281686305999756, "num_input_tokens_seen": 380748208, "step": 6350, "train_runtime": 81587.4934, "train_tokens_per_second": 4666.747 }, { "epoch": 0.8105867346938775, "grad_norm": 0.5806090235931327, "learning_rate": 6.46675425284737e-06, "loss": 0.3032946825027466, "num_input_tokens_seen": 381038696, "step": 6355, "train_runtime": 81654.954, "train_tokens_per_second": 4666.449 }, { "epoch": 0.8112244897959183, "grad_norm": 0.6360053599256708, "learning_rate": 6.461964968829521e-06, "loss": 0.3584984064102173, "num_input_tokens_seen": 381344440, "step": 6360, "train_runtime": 81729.3812, "train_tokens_per_second": 4665.941 }, { "epoch": 0.8118622448979592, "grad_norm": 0.53782709800568, "learning_rate": 6.457174217627722e-06, "loss": 0.31561667919158937, "num_input_tokens_seen": 381634800, "step": 6365, "train_runtime": 81783.7636, "train_tokens_per_second": 4666.388 }, { "epoch": 0.8125, "grad_norm": 0.585889169753346, "learning_rate": 6.452382004049829e-06, "loss": 0.3004056453704834, "num_input_tokens_seen": 381921968, "step": 6370, "train_runtime": 81844.6119, "train_tokens_per_second": 4666.428 }, { "epoch": 0.8131377551020408, "grad_norm": 0.5274551192749435, "learning_rate": 6.447588332905159e-06, "loss": 0.3129526376724243, "num_input_tokens_seen": 382232480, "step": 6375, "train_runtime": 81904.6225, "train_tokens_per_second": 4666.8 }, { "epoch": 0.8137755102040817, "grad_norm": 0.5857955769609019, "learning_rate": 6.4427932090044975e-06, "loss": 0.3357415676116943, "num_input_tokens_seen": 382532080, "step": 6380, "train_runtime": 81965.6802, "train_tokens_per_second": 4666.979 }, { "epoch": 0.8144132653061225, "grad_norm": 0.6156441051791702, "learning_rate": 6.437996637160086e-06, "loss": 0.30234622955322266, "num_input_tokens_seen": 382833360, "step": 6385, "train_runtime": 82033.0697, "train_tokens_per_second": 4666.817 }, { "epoch": 0.8150510204081632, "grad_norm": 0.6447229491703402, "learning_rate": 6.433198622185621e-06, "loss": 0.3164085388183594, "num_input_tokens_seen": 383129024, "step": 6390, "train_runtime": 82102.0275, "train_tokens_per_second": 4666.499 }, { "epoch": 0.8156887755102041, "grad_norm": 0.5711706385685005, "learning_rate": 6.428399168896244e-06, "loss": 0.32012438774108887, "num_input_tokens_seen": 383427432, "step": 6395, "train_runtime": 82169.0532, "train_tokens_per_second": 4666.324 }, { "epoch": 0.8163265306122449, "grad_norm": 0.5529100640187739, "learning_rate": 6.423598282108541e-06, "loss": 0.3004781246185303, "num_input_tokens_seen": 383734304, "step": 6400, "train_runtime": 82230.7124, "train_tokens_per_second": 4666.557 }, { "epoch": 0.8169642857142857, "grad_norm": 0.5651625948307254, "learning_rate": 6.41879596664054e-06, "loss": 0.31356689929962156, "num_input_tokens_seen": 384050208, "step": 6405, "train_runtime": 82297.3081, "train_tokens_per_second": 4666.619 }, { "epoch": 0.8176020408163265, "grad_norm": 0.6052901987965118, "learning_rate": 6.413992227311695e-06, "loss": 0.3242011070251465, "num_input_tokens_seen": 384352520, "step": 6410, "train_runtime": 82354.7932, "train_tokens_per_second": 4667.033 }, { "epoch": 0.8182397959183674, "grad_norm": 0.5824791938820854, "learning_rate": 6.409187068942899e-06, "loss": 0.3379192352294922, "num_input_tokens_seen": 384661472, "step": 6415, "train_runtime": 82410.6773, "train_tokens_per_second": 4667.617 }, { "epoch": 0.8188775510204082, "grad_norm": 0.597160115833879, "learning_rate": 6.4043804963564616e-06, "loss": 0.30432326793670655, "num_input_tokens_seen": 384952496, "step": 6420, "train_runtime": 82477.6853, "train_tokens_per_second": 4667.353 }, { "epoch": 0.8195153061224489, "grad_norm": 0.5829624892103409, "learning_rate": 6.399572514376114e-06, "loss": 0.3168663263320923, "num_input_tokens_seen": 385260312, "step": 6425, "train_runtime": 82554.1325, "train_tokens_per_second": 4666.76 }, { "epoch": 0.8201530612244898, "grad_norm": 0.5881912162459694, "learning_rate": 6.394763127827001e-06, "loss": 0.31240570545196533, "num_input_tokens_seen": 385552880, "step": 6430, "train_runtime": 82620.6023, "train_tokens_per_second": 4666.546 }, { "epoch": 0.8207908163265306, "grad_norm": 0.6143150978869795, "learning_rate": 6.389952341535681e-06, "loss": 0.32782998085021975, "num_input_tokens_seen": 385839272, "step": 6435, "train_runtime": 82685.204, "train_tokens_per_second": 4666.364 }, { "epoch": 0.8214285714285714, "grad_norm": 0.604183169197261, "learning_rate": 6.385140160330113e-06, "loss": 0.3201569080352783, "num_input_tokens_seen": 386133216, "step": 6440, "train_runtime": 82753.7661, "train_tokens_per_second": 4666.05 }, { "epoch": 0.8220663265306123, "grad_norm": 0.641592597660603, "learning_rate": 6.380326589039653e-06, "loss": 0.32984390258789065, "num_input_tokens_seen": 386436536, "step": 6445, "train_runtime": 82820.0168, "train_tokens_per_second": 4665.98 }, { "epoch": 0.8227040816326531, "grad_norm": 0.4990669626030833, "learning_rate": 6.375511632495062e-06, "loss": 0.31126041412353517, "num_input_tokens_seen": 386728840, "step": 6450, "train_runtime": 82890.8014, "train_tokens_per_second": 4665.522 }, { "epoch": 0.8233418367346939, "grad_norm": 0.5958384582118913, "learning_rate": 6.370695295528482e-06, "loss": 0.3371361494064331, "num_input_tokens_seen": 387049320, "step": 6455, "train_runtime": 82949.2764, "train_tokens_per_second": 4666.096 }, { "epoch": 0.8239795918367347, "grad_norm": 0.582417258146294, "learning_rate": 6.365877582973442e-06, "loss": 0.3114039897918701, "num_input_tokens_seen": 387353424, "step": 6460, "train_runtime": 83022.9156, "train_tokens_per_second": 4665.621 }, { "epoch": 0.8246173469387755, "grad_norm": 0.6247624844944313, "learning_rate": 6.361058499664856e-06, "loss": 0.29075353145599364, "num_input_tokens_seen": 387662184, "step": 6465, "train_runtime": 83080.1501, "train_tokens_per_second": 4666.123 }, { "epoch": 0.8252551020408163, "grad_norm": 0.6715022866722622, "learning_rate": 6.3562380504390095e-06, "loss": 0.3124758005142212, "num_input_tokens_seen": 387962320, "step": 6470, "train_runtime": 83143.6752, "train_tokens_per_second": 4666.168 }, { "epoch": 0.8258928571428571, "grad_norm": 0.5886998087369898, "learning_rate": 6.35141624013356e-06, "loss": 0.3298856258392334, "num_input_tokens_seen": 388268512, "step": 6475, "train_runtime": 83207.6486, "train_tokens_per_second": 4666.26 }, { "epoch": 0.826530612244898, "grad_norm": 0.682117483213479, "learning_rate": 6.34659307358753e-06, "loss": 0.32467265129089357, "num_input_tokens_seen": 388584360, "step": 6480, "train_runtime": 83276.0966, "train_tokens_per_second": 4666.217 }, { "epoch": 0.8271683673469388, "grad_norm": 0.673165921740877, "learning_rate": 6.341768555641306e-06, "loss": 0.30635595321655273, "num_input_tokens_seen": 388895224, "step": 6485, "train_runtime": 83331.6552, "train_tokens_per_second": 4666.837 }, { "epoch": 0.8278061224489796, "grad_norm": 0.6245067172447053, "learning_rate": 6.3369426911366275e-06, "loss": 0.2976788759231567, "num_input_tokens_seen": 389181952, "step": 6490, "train_runtime": 83396.7508, "train_tokens_per_second": 4666.632 }, { "epoch": 0.8284438775510204, "grad_norm": 0.6731416193267825, "learning_rate": 6.332115484916586e-06, "loss": 0.32232754230499266, "num_input_tokens_seen": 389468936, "step": 6495, "train_runtime": 83449.3886, "train_tokens_per_second": 4667.127 }, { "epoch": 0.8290816326530612, "grad_norm": 0.5547321497121352, "learning_rate": 6.327286941825621e-06, "loss": 0.30284967422485354, "num_input_tokens_seen": 389772488, "step": 6500, "train_runtime": 83507.3897, "train_tokens_per_second": 4667.521 }, { "epoch": 0.829719387755102, "grad_norm": 0.5731879400528207, "learning_rate": 6.322457066709511e-06, "loss": 0.3258717775344849, "num_input_tokens_seen": 390076200, "step": 6505, "train_runtime": 83564.1325, "train_tokens_per_second": 4667.986 }, { "epoch": 0.8303571428571429, "grad_norm": 0.5851361866151272, "learning_rate": 6.317625864415374e-06, "loss": 0.34453649520874025, "num_input_tokens_seen": 390373984, "step": 6510, "train_runtime": 83627.1732, "train_tokens_per_second": 4668.028 }, { "epoch": 0.8309948979591837, "grad_norm": 0.5933232999638829, "learning_rate": 6.312793339791662e-06, "loss": 0.3070641040802002, "num_input_tokens_seen": 390670072, "step": 6515, "train_runtime": 83690.651, "train_tokens_per_second": 4668.025 }, { "epoch": 0.8316326530612245, "grad_norm": 0.5669500400298843, "learning_rate": 6.307959497688146e-06, "loss": 0.30180792808532714, "num_input_tokens_seen": 390961488, "step": 6520, "train_runtime": 83750.8039, "train_tokens_per_second": 4668.152 }, { "epoch": 0.8322704081632653, "grad_norm": 0.5348433107701372, "learning_rate": 6.303124342955928e-06, "loss": 0.28929288387298585, "num_input_tokens_seen": 391264560, "step": 6525, "train_runtime": 83806.0417, "train_tokens_per_second": 4668.692 }, { "epoch": 0.8329081632653061, "grad_norm": 0.5821412719588734, "learning_rate": 6.29828788044742e-06, "loss": 0.30586791038513184, "num_input_tokens_seen": 391565080, "step": 6530, "train_runtime": 83873.2438, "train_tokens_per_second": 4668.534 }, { "epoch": 0.8335459183673469, "grad_norm": 0.6481037498029766, "learning_rate": 6.293450115016353e-06, "loss": 0.32516870498657224, "num_input_tokens_seen": 391871952, "step": 6535, "train_runtime": 83938.3482, "train_tokens_per_second": 4668.569 }, { "epoch": 0.8341836734693877, "grad_norm": 0.5962720550715901, "learning_rate": 6.288611051517761e-06, "loss": 0.32063119411468505, "num_input_tokens_seen": 392158336, "step": 6540, "train_runtime": 84015.0472, "train_tokens_per_second": 4667.715 }, { "epoch": 0.8348214285714286, "grad_norm": 0.5814538878413128, "learning_rate": 6.283770694807983e-06, "loss": 0.31683061122894285, "num_input_tokens_seen": 392467928, "step": 6545, "train_runtime": 84084.7952, "train_tokens_per_second": 4667.526 }, { "epoch": 0.8354591836734694, "grad_norm": 0.609185462134041, "learning_rate": 6.2789290497446546e-06, "loss": 0.2990833044052124, "num_input_tokens_seen": 392754144, "step": 6550, "train_runtime": 84146.9144, "train_tokens_per_second": 4667.481 }, { "epoch": 0.8360969387755102, "grad_norm": 0.5970171483645796, "learning_rate": 6.274086121186704e-06, "loss": 0.30519733428955076, "num_input_tokens_seen": 393035544, "step": 6555, "train_runtime": 84208.4249, "train_tokens_per_second": 4667.414 }, { "epoch": 0.8367346938775511, "grad_norm": 0.6206139250303385, "learning_rate": 6.269241913994348e-06, "loss": 0.34519333839416505, "num_input_tokens_seen": 393349192, "step": 6560, "train_runtime": 84265.1631, "train_tokens_per_second": 4667.993 }, { "epoch": 0.8373724489795918, "grad_norm": 0.5771468950095635, "learning_rate": 6.264396433029089e-06, "loss": 0.31926770210266114, "num_input_tokens_seen": 393662968, "step": 6565, "train_runtime": 84333.6413, "train_tokens_per_second": 4667.923 }, { "epoch": 0.8380102040816326, "grad_norm": 0.5315154151047687, "learning_rate": 6.2595496831537025e-06, "loss": 0.31521120071411135, "num_input_tokens_seen": 393960976, "step": 6570, "train_runtime": 84386.6592, "train_tokens_per_second": 4668.522 }, { "epoch": 0.8386479591836735, "grad_norm": 0.5414787300923072, "learning_rate": 6.254701669232243e-06, "loss": 0.30462558269500734, "num_input_tokens_seen": 394258296, "step": 6575, "train_runtime": 84455.7533, "train_tokens_per_second": 4668.223 }, { "epoch": 0.8392857142857143, "grad_norm": 0.6603055840351818, "learning_rate": 6.24985239613003e-06, "loss": 0.3152480602264404, "num_input_tokens_seen": 394552432, "step": 6580, "train_runtime": 84514.3729, "train_tokens_per_second": 4668.465 }, { "epoch": 0.8399234693877551, "grad_norm": 0.584825007451768, "learning_rate": 6.24500186871365e-06, "loss": 0.30623745918273926, "num_input_tokens_seen": 394853408, "step": 6585, "train_runtime": 84581.1855, "train_tokens_per_second": 4668.336 }, { "epoch": 0.8405612244897959, "grad_norm": 0.4930003653474112, "learning_rate": 6.240150091850941e-06, "loss": 0.3308518886566162, "num_input_tokens_seen": 395160664, "step": 6590, "train_runtime": 84641.9631, "train_tokens_per_second": 4668.614 }, { "epoch": 0.8411989795918368, "grad_norm": 0.6160894940287035, "learning_rate": 6.235297070411004e-06, "loss": 0.33232975006103516, "num_input_tokens_seen": 395461608, "step": 6595, "train_runtime": 84700.4224, "train_tokens_per_second": 4668.945 }, { "epoch": 0.8418367346938775, "grad_norm": 0.5630953384824021, "learning_rate": 6.230442809264186e-06, "loss": 0.31195032596588135, "num_input_tokens_seen": 395759016, "step": 6600, "train_runtime": 84774.0173, "train_tokens_per_second": 4668.4 }, { "epoch": 0.8424744897959183, "grad_norm": 0.6195254986287914, "learning_rate": 6.225587313282071e-06, "loss": 0.32104930877685545, "num_input_tokens_seen": 396054736, "step": 6605, "train_runtime": 84835.3441, "train_tokens_per_second": 4668.511 }, { "epoch": 0.8431122448979592, "grad_norm": 0.5809396114170757, "learning_rate": 6.220730587337496e-06, "loss": 0.3140249490737915, "num_input_tokens_seen": 396361608, "step": 6610, "train_runtime": 84907.1987, "train_tokens_per_second": 4668.174 }, { "epoch": 0.84375, "grad_norm": 0.6362805032477586, "learning_rate": 6.21587263630452e-06, "loss": 0.2962120771408081, "num_input_tokens_seen": 396646088, "step": 6615, "train_runtime": 84980.0625, "train_tokens_per_second": 4667.519 }, { "epoch": 0.8443877551020408, "grad_norm": 0.5937557493652235, "learning_rate": 6.2110134650584355e-06, "loss": 0.3020913124084473, "num_input_tokens_seen": 396945720, "step": 6620, "train_runtime": 85053.2493, "train_tokens_per_second": 4667.026 }, { "epoch": 0.8450255102040817, "grad_norm": 0.6226118867048471, "learning_rate": 6.2061530784757625e-06, "loss": 0.3444786787033081, "num_input_tokens_seen": 397248272, "step": 6625, "train_runtime": 85118.0255, "train_tokens_per_second": 4667.029 }, { "epoch": 0.8456632653061225, "grad_norm": 0.5892118579679192, "learning_rate": 6.201291481434238e-06, "loss": 0.3050083637237549, "num_input_tokens_seen": 397539016, "step": 6630, "train_runtime": 85182.4486, "train_tokens_per_second": 4666.912 }, { "epoch": 0.8463010204081632, "grad_norm": 0.5508066480329329, "learning_rate": 6.196428678812816e-06, "loss": 0.2922708034515381, "num_input_tokens_seen": 397836288, "step": 6635, "train_runtime": 85254.9993, "train_tokens_per_second": 4666.428 }, { "epoch": 0.8469387755102041, "grad_norm": 0.613685181300794, "learning_rate": 6.191564675491653e-06, "loss": 0.30857760906219484, "num_input_tokens_seen": 398137728, "step": 6640, "train_runtime": 85324.112, "train_tokens_per_second": 4666.181 }, { "epoch": 0.8475765306122449, "grad_norm": 0.5585401274307471, "learning_rate": 6.1866994763521215e-06, "loss": 0.29730515480041503, "num_input_tokens_seen": 398424976, "step": 6645, "train_runtime": 85390.0874, "train_tokens_per_second": 4665.939 }, { "epoch": 0.8482142857142857, "grad_norm": 0.5759389942635973, "learning_rate": 6.1818330862767864e-06, "loss": 0.30812749862670896, "num_input_tokens_seen": 398730408, "step": 6650, "train_runtime": 85464.1197, "train_tokens_per_second": 4665.471 }, { "epoch": 0.8488520408163265, "grad_norm": 0.6197027624764138, "learning_rate": 6.176965510149409e-06, "loss": 0.3033617973327637, "num_input_tokens_seen": 399037552, "step": 6655, "train_runtime": 85530.1083, "train_tokens_per_second": 4665.463 }, { "epoch": 0.8494897959183674, "grad_norm": 0.622364215380817, "learning_rate": 6.172096752854943e-06, "loss": 0.3203045606613159, "num_input_tokens_seen": 399333192, "step": 6660, "train_runtime": 85584.7089, "train_tokens_per_second": 4665.941 }, { "epoch": 0.8501275510204082, "grad_norm": 0.6401552047276462, "learning_rate": 6.1672268192795285e-06, "loss": 0.29885144233703614, "num_input_tokens_seen": 399628280, "step": 6665, "train_runtime": 85646.3763, "train_tokens_per_second": 4666.027 }, { "epoch": 0.8507653061224489, "grad_norm": 0.7250927430486945, "learning_rate": 6.16235571431048e-06, "loss": 0.3294283390045166, "num_input_tokens_seen": 399924800, "step": 6670, "train_runtime": 85720.061, "train_tokens_per_second": 4665.475 }, { "epoch": 0.8514030612244898, "grad_norm": 0.6634142320835769, "learning_rate": 6.157483442836294e-06, "loss": 0.33495144844055175, "num_input_tokens_seen": 400216624, "step": 6675, "train_runtime": 85784.2314, "train_tokens_per_second": 4665.387 }, { "epoch": 0.8520408163265306, "grad_norm": 0.5997126035442919, "learning_rate": 6.1526100097466345e-06, "loss": 0.31827507019042967, "num_input_tokens_seen": 400523824, "step": 6680, "train_runtime": 85846.9255, "train_tokens_per_second": 4665.558 }, { "epoch": 0.8526785714285714, "grad_norm": 0.64754068179524, "learning_rate": 6.147735419932334e-06, "loss": 0.3034789562225342, "num_input_tokens_seen": 400827320, "step": 6685, "train_runtime": 85912.644, "train_tokens_per_second": 4665.522 }, { "epoch": 0.8533163265306123, "grad_norm": 0.799892030264851, "learning_rate": 6.142859678285378e-06, "loss": 0.33355953693389895, "num_input_tokens_seen": 401125816, "step": 6690, "train_runtime": 85982.7443, "train_tokens_per_second": 4665.19 }, { "epoch": 0.8539540816326531, "grad_norm": 0.6392905494428465, "learning_rate": 6.13798278969892e-06, "loss": 0.3342573642730713, "num_input_tokens_seen": 401410360, "step": 6695, "train_runtime": 86048.236, "train_tokens_per_second": 4664.946 }, { "epoch": 0.8545918367346939, "grad_norm": 0.5203894297352434, "learning_rate": 6.133104759067257e-06, "loss": 0.30130274295806886, "num_input_tokens_seen": 401717752, "step": 6700, "train_runtime": 86109.7386, "train_tokens_per_second": 4665.184 }, { "epoch": 0.8552295918367347, "grad_norm": 0.5605527505484186, "learning_rate": 6.1282255912858315e-06, "loss": 0.29971344470977784, "num_input_tokens_seen": 402013016, "step": 6705, "train_runtime": 86170.1548, "train_tokens_per_second": 4665.339 }, { "epoch": 0.8558673469387755, "grad_norm": 0.604448906313011, "learning_rate": 6.1233452912512295e-06, "loss": 0.3489644765853882, "num_input_tokens_seen": 402319832, "step": 6710, "train_runtime": 86235.6136, "train_tokens_per_second": 4665.356 }, { "epoch": 0.8565051020408163, "grad_norm": 0.5895474848157423, "learning_rate": 6.118463863861174e-06, "loss": 0.2796917915344238, "num_input_tokens_seen": 402625488, "step": 6715, "train_runtime": 86298.1269, "train_tokens_per_second": 4665.518 }, { "epoch": 0.8571428571428571, "grad_norm": 0.6249355630850112, "learning_rate": 6.113581314014517e-06, "loss": 0.31249542236328126, "num_input_tokens_seen": 402925992, "step": 6720, "train_runtime": 86355.461, "train_tokens_per_second": 4665.901 }, { "epoch": 0.857780612244898, "grad_norm": 0.6304542140852867, "learning_rate": 6.10869764661124e-06, "loss": 0.3219332456588745, "num_input_tokens_seen": 403207984, "step": 6725, "train_runtime": 86413.3914, "train_tokens_per_second": 4666.036 }, { "epoch": 0.8584183673469388, "grad_norm": 0.5918915350014844, "learning_rate": 6.103812866552444e-06, "loss": 0.294742488861084, "num_input_tokens_seen": 403494608, "step": 6730, "train_runtime": 86472.1025, "train_tokens_per_second": 4666.182 }, { "epoch": 0.8590561224489796, "grad_norm": 0.6322048157286655, "learning_rate": 6.0989269787403445e-06, "loss": 0.3376746416091919, "num_input_tokens_seen": 403784440, "step": 6735, "train_runtime": 86533.3987, "train_tokens_per_second": 4666.227 }, { "epoch": 0.8596938775510204, "grad_norm": 0.5858078669370196, "learning_rate": 6.094039988078273e-06, "loss": 0.31620571613311765, "num_input_tokens_seen": 404085600, "step": 6740, "train_runtime": 86598.9299, "train_tokens_per_second": 4666.173 }, { "epoch": 0.8603316326530612, "grad_norm": 0.5598138022206285, "learning_rate": 6.089151899470668e-06, "loss": 0.2858736038208008, "num_input_tokens_seen": 404382184, "step": 6745, "train_runtime": 86672.1992, "train_tokens_per_second": 4665.65 }, { "epoch": 0.860969387755102, "grad_norm": 0.6743694114584343, "learning_rate": 6.084262717823064e-06, "loss": 0.2900573253631592, "num_input_tokens_seen": 404686752, "step": 6750, "train_runtime": 86725.718, "train_tokens_per_second": 4666.283 }, { "epoch": 0.8616071428571429, "grad_norm": 0.5880382421521227, "learning_rate": 6.079372448042098e-06, "loss": 0.2982300043106079, "num_input_tokens_seen": 404985704, "step": 6755, "train_runtime": 86801.7811, "train_tokens_per_second": 4665.638 }, { "epoch": 0.8622448979591837, "grad_norm": 0.556309105213148, "learning_rate": 6.074481095035498e-06, "loss": 0.32536613941192627, "num_input_tokens_seen": 405288072, "step": 6760, "train_runtime": 86862.2901, "train_tokens_per_second": 4665.869 }, { "epoch": 0.8628826530612245, "grad_norm": 0.612299823377922, "learning_rate": 6.069588663712077e-06, "loss": 0.3190335273742676, "num_input_tokens_seen": 405576032, "step": 6765, "train_runtime": 86933.1464, "train_tokens_per_second": 4665.378 }, { "epoch": 0.8635204081632653, "grad_norm": 0.6356943946491983, "learning_rate": 6.064695158981732e-06, "loss": 0.3045177459716797, "num_input_tokens_seen": 405871224, "step": 6770, "train_runtime": 87006.0629, "train_tokens_per_second": 4664.861 }, { "epoch": 0.8641581632653061, "grad_norm": 0.596680131580734, "learning_rate": 6.059800585755436e-06, "loss": 0.333588695526123, "num_input_tokens_seen": 406175840, "step": 6775, "train_runtime": 87075.4011, "train_tokens_per_second": 4664.645 }, { "epoch": 0.8647959183673469, "grad_norm": 0.6638468096818336, "learning_rate": 6.054904948945238e-06, "loss": 0.2864166259765625, "num_input_tokens_seen": 406470040, "step": 6780, "train_runtime": 87135.9405, "train_tokens_per_second": 4664.781 }, { "epoch": 0.8654336734693877, "grad_norm": 0.6896758525257892, "learning_rate": 6.050008253464247e-06, "loss": 0.3302961587905884, "num_input_tokens_seen": 406767296, "step": 6785, "train_runtime": 87200.7229, "train_tokens_per_second": 4664.724 }, { "epoch": 0.8660714285714286, "grad_norm": 0.627576937677198, "learning_rate": 6.045110504226643e-06, "loss": 0.2932382583618164, "num_input_tokens_seen": 407074112, "step": 6790, "train_runtime": 87260.0977, "train_tokens_per_second": 4665.066 }, { "epoch": 0.8667091836734694, "grad_norm": 0.5683611368657269, "learning_rate": 6.0402117061476574e-06, "loss": 0.3078974485397339, "num_input_tokens_seen": 407361312, "step": 6795, "train_runtime": 87320.2148, "train_tokens_per_second": 4665.143 }, { "epoch": 0.8673469387755102, "grad_norm": 0.5748921175063846, "learning_rate": 6.035311864143576e-06, "loss": 0.3090816974639893, "num_input_tokens_seen": 407661936, "step": 6800, "train_runtime": 87384.4751, "train_tokens_per_second": 4665.153 }, { "epoch": 0.8679846938775511, "grad_norm": 0.5863373467183365, "learning_rate": 6.030410983131733e-06, "loss": 0.3100122928619385, "num_input_tokens_seen": 407956216, "step": 6805, "train_runtime": 87453.438, "train_tokens_per_second": 4664.839 }, { "epoch": 0.8686224489795918, "grad_norm": 0.5968343807116784, "learning_rate": 6.025509068030504e-06, "loss": 0.3232810735702515, "num_input_tokens_seen": 408256432, "step": 6810, "train_runtime": 87532.1653, "train_tokens_per_second": 4664.073 }, { "epoch": 0.8692602040816326, "grad_norm": 0.5521085973090777, "learning_rate": 6.020606123759305e-06, "loss": 0.3054074287414551, "num_input_tokens_seen": 408540944, "step": 6815, "train_runtime": 87598.7119, "train_tokens_per_second": 4663.778 }, { "epoch": 0.8698979591836735, "grad_norm": 0.6592982922710323, "learning_rate": 6.0157021552385805e-06, "loss": 0.35090322494506837, "num_input_tokens_seen": 408838824, "step": 6820, "train_runtime": 87658.1677, "train_tokens_per_second": 4664.013 }, { "epoch": 0.8705357142857143, "grad_norm": 0.6056940862517836, "learning_rate": 6.010797167389808e-06, "loss": 0.325609827041626, "num_input_tokens_seen": 409138552, "step": 6825, "train_runtime": 87726.4786, "train_tokens_per_second": 4663.798 }, { "epoch": 0.8711734693877551, "grad_norm": 0.5546337459085608, "learning_rate": 6.005891165135484e-06, "loss": 0.298302149772644, "num_input_tokens_seen": 409427272, "step": 6830, "train_runtime": 87792.2703, "train_tokens_per_second": 4663.591 }, { "epoch": 0.8718112244897959, "grad_norm": 0.5880820071208903, "learning_rate": 6.000984153399123e-06, "loss": 0.31217527389526367, "num_input_tokens_seen": 409724232, "step": 6835, "train_runtime": 87859.937, "train_tokens_per_second": 4663.38 }, { "epoch": 0.8724489795918368, "grad_norm": 0.701466624618536, "learning_rate": 5.996076137105258e-06, "loss": 0.3225777387619019, "num_input_tokens_seen": 410015192, "step": 6840, "train_runtime": 87919.7174, "train_tokens_per_second": 4663.518 }, { "epoch": 0.8730867346938775, "grad_norm": 0.6201285590127129, "learning_rate": 5.991167121179422e-06, "loss": 0.3138850212097168, "num_input_tokens_seen": 410303616, "step": 6845, "train_runtime": 87982.5899, "train_tokens_per_second": 4663.464 }, { "epoch": 0.8737244897959183, "grad_norm": 0.5214246251077226, "learning_rate": 5.986257110548157e-06, "loss": 0.31941967010498046, "num_input_tokens_seen": 410602016, "step": 6850, "train_runtime": 88040.7969, "train_tokens_per_second": 4663.77 }, { "epoch": 0.8743622448979592, "grad_norm": 0.6001896043025774, "learning_rate": 5.981346110139001e-06, "loss": 0.3214601516723633, "num_input_tokens_seen": 410906336, "step": 6855, "train_runtime": 88105.2609, "train_tokens_per_second": 4663.812 }, { "epoch": 0.875, "grad_norm": 0.6660455026594599, "learning_rate": 5.976434124880487e-06, "loss": 0.3431683540344238, "num_input_tokens_seen": 411215096, "step": 6860, "train_runtime": 88171.4904, "train_tokens_per_second": 4663.81 }, { "epoch": 0.8756377551020408, "grad_norm": 0.6252393868053129, "learning_rate": 5.971521159702136e-06, "loss": 0.3205599784851074, "num_input_tokens_seen": 411510640, "step": 6865, "train_runtime": 88239.2355, "train_tokens_per_second": 4663.579 }, { "epoch": 0.8762755102040817, "grad_norm": 0.5547679986866066, "learning_rate": 5.966607219534448e-06, "loss": 0.32694807052612307, "num_input_tokens_seen": 411818544, "step": 6870, "train_runtime": 88302.8578, "train_tokens_per_second": 4663.706 }, { "epoch": 0.8769132653061225, "grad_norm": 0.632475699148163, "learning_rate": 5.9616923093089095e-06, "loss": 0.33402485847473146, "num_input_tokens_seen": 412117168, "step": 6875, "train_runtime": 88363.6338, "train_tokens_per_second": 4663.878 }, { "epoch": 0.8775510204081632, "grad_norm": 0.6107142526376932, "learning_rate": 5.956776433957974e-06, "loss": 0.30840229988098145, "num_input_tokens_seen": 412418192, "step": 6880, "train_runtime": 88419.5643, "train_tokens_per_second": 4664.332 }, { "epoch": 0.8781887755102041, "grad_norm": 0.9774654780676465, "learning_rate": 5.951859598415063e-06, "loss": 0.30924062728881835, "num_input_tokens_seen": 412735408, "step": 6885, "train_runtime": 88470.7151, "train_tokens_per_second": 4665.221 }, { "epoch": 0.8788265306122449, "grad_norm": 1.0116220455961549, "learning_rate": 5.94694180761457e-06, "loss": 0.30491957664489744, "num_input_tokens_seen": 413040720, "step": 6890, "train_runtime": 88543.2452, "train_tokens_per_second": 4664.847 }, { "epoch": 0.8794642857142857, "grad_norm": 0.6616404324530736, "learning_rate": 5.942023066491839e-06, "loss": 0.3186971187591553, "num_input_tokens_seen": 413349792, "step": 6895, "train_runtime": 88603.0006, "train_tokens_per_second": 4665.19 }, { "epoch": 0.8801020408163265, "grad_norm": 0.5868765548473264, "learning_rate": 5.937103379983169e-06, "loss": 0.3613459587097168, "num_input_tokens_seen": 413649416, "step": 6900, "train_runtime": 88669.8198, "train_tokens_per_second": 4665.053 }, { "epoch": 0.8807397959183674, "grad_norm": 0.6703907898729683, "learning_rate": 5.93218275302581e-06, "loss": 0.31890115737915037, "num_input_tokens_seen": 413946488, "step": 6905, "train_runtime": 88735.7122, "train_tokens_per_second": 4664.937 }, { "epoch": 0.8813775510204082, "grad_norm": 0.5597040222849586, "learning_rate": 5.927261190557955e-06, "loss": 0.29169273376464844, "num_input_tokens_seen": 414246552, "step": 6910, "train_runtime": 88800.3166, "train_tokens_per_second": 4664.922 }, { "epoch": 0.8820153061224489, "grad_norm": 0.541876198766452, "learning_rate": 5.922338697518736e-06, "loss": 0.31300668716430663, "num_input_tokens_seen": 414536744, "step": 6915, "train_runtime": 88870.94, "train_tokens_per_second": 4664.48 }, { "epoch": 0.8826530612244898, "grad_norm": 0.5846556553233282, "learning_rate": 5.917415278848217e-06, "loss": 0.28698785305023194, "num_input_tokens_seen": 414818808, "step": 6920, "train_runtime": 88935.0086, "train_tokens_per_second": 4664.292 }, { "epoch": 0.8832908163265306, "grad_norm": 0.650362363722194, "learning_rate": 5.9124909394873955e-06, "loss": 0.31494836807250975, "num_input_tokens_seen": 415118352, "step": 6925, "train_runtime": 88997.3932, "train_tokens_per_second": 4664.388 }, { "epoch": 0.8839285714285714, "grad_norm": 0.6267998906671569, "learning_rate": 5.907565684378187e-06, "loss": 0.3305811882019043, "num_input_tokens_seen": 415427312, "step": 6930, "train_runtime": 89062.0108, "train_tokens_per_second": 4664.473 }, { "epoch": 0.8845663265306123, "grad_norm": 0.563557148742557, "learning_rate": 5.902639518463429e-06, "loss": 0.32275214195251467, "num_input_tokens_seen": 415736648, "step": 6935, "train_runtime": 89134.0945, "train_tokens_per_second": 4664.171 }, { "epoch": 0.8852040816326531, "grad_norm": 0.7094212717207782, "learning_rate": 5.897712446686875e-06, "loss": 0.3357053756713867, "num_input_tokens_seen": 416036176, "step": 6940, "train_runtime": 89190.4817, "train_tokens_per_second": 4664.58 }, { "epoch": 0.8858418367346939, "grad_norm": 0.6162545250950107, "learning_rate": 5.892784473993184e-06, "loss": 0.3229557275772095, "num_input_tokens_seen": 416352976, "step": 6945, "train_runtime": 89253.7085, "train_tokens_per_second": 4664.826 }, { "epoch": 0.8864795918367347, "grad_norm": 0.6215196508406043, "learning_rate": 5.887855605327921e-06, "loss": 0.3064050436019897, "num_input_tokens_seen": 416634768, "step": 6950, "train_runtime": 89323.6516, "train_tokens_per_second": 4664.328 }, { "epoch": 0.8871173469387755, "grad_norm": 0.5379298754808535, "learning_rate": 5.882925845637551e-06, "loss": 0.28948819637298584, "num_input_tokens_seen": 416930736, "step": 6955, "train_runtime": 89393.0204, "train_tokens_per_second": 4664.019 }, { "epoch": 0.8877551020408163, "grad_norm": 0.5644010264450229, "learning_rate": 5.877995199869433e-06, "loss": 0.3060819387435913, "num_input_tokens_seen": 417231360, "step": 6960, "train_runtime": 89448.7321, "train_tokens_per_second": 4664.475 }, { "epoch": 0.8883928571428571, "grad_norm": 0.6798951714405044, "learning_rate": 5.87306367297181e-06, "loss": 0.30504908561706545, "num_input_tokens_seen": 417533072, "step": 6965, "train_runtime": 89508.645, "train_tokens_per_second": 4664.723 }, { "epoch": 0.889030612244898, "grad_norm": 0.5536973330920619, "learning_rate": 5.868131269893818e-06, "loss": 0.3097344398498535, "num_input_tokens_seen": 417836296, "step": 6970, "train_runtime": 89576.4258, "train_tokens_per_second": 4664.579 }, { "epoch": 0.8896683673469388, "grad_norm": 0.6021738763175897, "learning_rate": 5.863197995585468e-06, "loss": 0.3265312910079956, "num_input_tokens_seen": 418148064, "step": 6975, "train_runtime": 89638.8695, "train_tokens_per_second": 4664.807 }, { "epoch": 0.8903061224489796, "grad_norm": 0.618131289530354, "learning_rate": 5.858263854997642e-06, "loss": 0.2940220832824707, "num_input_tokens_seen": 418428672, "step": 6980, "train_runtime": 89704.8581, "train_tokens_per_second": 4664.504 }, { "epoch": 0.8909438775510204, "grad_norm": 0.5704197760787771, "learning_rate": 5.853328853082098e-06, "loss": 0.2685279846191406, "num_input_tokens_seen": 418726304, "step": 6985, "train_runtime": 89773.3817, "train_tokens_per_second": 4664.259 }, { "epoch": 0.8915816326530612, "grad_norm": 0.5365262731253033, "learning_rate": 5.848392994791452e-06, "loss": 0.3194777488708496, "num_input_tokens_seen": 419029440, "step": 6990, "train_runtime": 89846.132, "train_tokens_per_second": 4663.856 }, { "epoch": 0.892219387755102, "grad_norm": 0.5611762037072114, "learning_rate": 5.843456285079185e-06, "loss": 0.3002311229705811, "num_input_tokens_seen": 419339984, "step": 6995, "train_runtime": 89910.4977, "train_tokens_per_second": 4663.971 }, { "epoch": 0.8928571428571429, "grad_norm": 0.5660753227530252, "learning_rate": 5.838518728899627e-06, "loss": 0.32773146629333494, "num_input_tokens_seen": 419652256, "step": 7000, "train_runtime": 89975.8773, "train_tokens_per_second": 4664.053 }, { "epoch": 0.8934948979591837, "grad_norm": 0.5787960280049785, "learning_rate": 5.833580331207964e-06, "loss": 0.3284013748168945, "num_input_tokens_seen": 419949944, "step": 7005, "train_runtime": 90041.6254, "train_tokens_per_second": 4663.953 }, { "epoch": 0.8941326530612245, "grad_norm": 0.7800960751316296, "learning_rate": 5.828641096960223e-06, "loss": 0.3397322654724121, "num_input_tokens_seen": 420245304, "step": 7010, "train_runtime": 90104.637, "train_tokens_per_second": 4663.97 }, { "epoch": 0.8947704081632653, "grad_norm": 0.5767757632144042, "learning_rate": 5.823701031113267e-06, "loss": 0.314349889755249, "num_input_tokens_seen": 420564848, "step": 7015, "train_runtime": 90164.0479, "train_tokens_per_second": 4664.441 }, { "epoch": 0.8954081632653061, "grad_norm": 0.7347328141444277, "learning_rate": 5.8187601386248004e-06, "loss": 0.3227765798568726, "num_input_tokens_seen": 420840552, "step": 7020, "train_runtime": 90229.1894, "train_tokens_per_second": 4664.129 }, { "epoch": 0.8960459183673469, "grad_norm": 0.6435925456275953, "learning_rate": 5.8138184244533516e-06, "loss": 0.3211270570755005, "num_input_tokens_seen": 421141232, "step": 7025, "train_runtime": 90286.2359, "train_tokens_per_second": 4664.512 }, { "epoch": 0.8966836734693877, "grad_norm": 0.5845604759406505, "learning_rate": 5.808875893558277e-06, "loss": 0.3297579288482666, "num_input_tokens_seen": 421447712, "step": 7030, "train_runtime": 90363.4074, "train_tokens_per_second": 4663.92 }, { "epoch": 0.8973214285714286, "grad_norm": 0.6969413341437088, "learning_rate": 5.8039325508997524e-06, "loss": 0.3073333740234375, "num_input_tokens_seen": 421743216, "step": 7035, "train_runtime": 90437.1693, "train_tokens_per_second": 4663.384 }, { "epoch": 0.8979591836734694, "grad_norm": 0.6433918640370359, "learning_rate": 5.798988401438765e-06, "loss": 0.3218099117279053, "num_input_tokens_seen": 422058392, "step": 7040, "train_runtime": 90491.6651, "train_tokens_per_second": 4664.058 }, { "epoch": 0.8985969387755102, "grad_norm": 0.5405343373056593, "learning_rate": 5.7940434501371175e-06, "loss": 0.3057726860046387, "num_input_tokens_seen": 422363208, "step": 7045, "train_runtime": 90550.6574, "train_tokens_per_second": 4664.386 }, { "epoch": 0.8992346938775511, "grad_norm": 0.5352537262482511, "learning_rate": 5.78909770195741e-06, "loss": 0.32413716316223146, "num_input_tokens_seen": 422670128, "step": 7050, "train_runtime": 90623.295, "train_tokens_per_second": 4664.034 }, { "epoch": 0.8998724489795918, "grad_norm": 0.506117529730911, "learning_rate": 5.7841511618630484e-06, "loss": 0.27179660797119143, "num_input_tokens_seen": 422979688, "step": 7055, "train_runtime": 90686.3358, "train_tokens_per_second": 4664.205 }, { "epoch": 0.9005102040816326, "grad_norm": 0.5578594055386115, "learning_rate": 5.779203834818232e-06, "loss": 0.30615389347076416, "num_input_tokens_seen": 423259432, "step": 7060, "train_runtime": 90748.6292, "train_tokens_per_second": 4664.086 }, { "epoch": 0.9011479591836735, "grad_norm": 0.5554250561137382, "learning_rate": 5.774255725787946e-06, "loss": 0.3139845371246338, "num_input_tokens_seen": 423564312, "step": 7065, "train_runtime": 90816.878, "train_tokens_per_second": 4663.938 }, { "epoch": 0.9017857142857143, "grad_norm": 0.6190073776215691, "learning_rate": 5.769306839737968e-06, "loss": 0.33006107807159424, "num_input_tokens_seen": 423874328, "step": 7070, "train_runtime": 90880.9723, "train_tokens_per_second": 4664.06 }, { "epoch": 0.9024234693877551, "grad_norm": 0.5699923662864511, "learning_rate": 5.764357181634847e-06, "loss": 0.31683037281036375, "num_input_tokens_seen": 424187552, "step": 7075, "train_runtime": 90946.2654, "train_tokens_per_second": 4664.156 }, { "epoch": 0.9030612244897959, "grad_norm": 0.6382617981880363, "learning_rate": 5.759406756445911e-06, "loss": 0.2922383785247803, "num_input_tokens_seen": 424485240, "step": 7080, "train_runtime": 91006.2202, "train_tokens_per_second": 4664.354 }, { "epoch": 0.9036989795918368, "grad_norm": 0.5703120241122546, "learning_rate": 5.754455569139258e-06, "loss": 0.28797054290771484, "num_input_tokens_seen": 424786256, "step": 7085, "train_runtime": 91068.2514, "train_tokens_per_second": 4664.482 }, { "epoch": 0.9043367346938775, "grad_norm": 0.5873448565170643, "learning_rate": 5.74950362468375e-06, "loss": 0.31067476272583006, "num_input_tokens_seen": 425076784, "step": 7090, "train_runtime": 91123.2751, "train_tokens_per_second": 4664.854 }, { "epoch": 0.9049744897959183, "grad_norm": 0.5987005729754719, "learning_rate": 5.74455092804901e-06, "loss": 0.3357563018798828, "num_input_tokens_seen": 425390160, "step": 7095, "train_runtime": 91184.8039, "train_tokens_per_second": 4665.143 }, { "epoch": 0.9056122448979592, "grad_norm": 0.5980979454653461, "learning_rate": 5.739597484205415e-06, "loss": 0.3039411544799805, "num_input_tokens_seen": 425694392, "step": 7100, "train_runtime": 91240.766, "train_tokens_per_second": 4665.616 }, { "epoch": 0.90625, "grad_norm": 0.5747493898487499, "learning_rate": 5.734643298124091e-06, "loss": 0.328928279876709, "num_input_tokens_seen": 425988048, "step": 7105, "train_runtime": 91313.1806, "train_tokens_per_second": 4665.132 }, { "epoch": 0.9068877551020408, "grad_norm": 0.5756988861054836, "learning_rate": 5.7296883747769096e-06, "loss": 0.3134473323822021, "num_input_tokens_seen": 426290152, "step": 7110, "train_runtime": 91377.9608, "train_tokens_per_second": 4665.131 }, { "epoch": 0.9075255102040817, "grad_norm": 0.6001531054678257, "learning_rate": 5.724732719136481e-06, "loss": 0.30744113922119143, "num_input_tokens_seen": 426598472, "step": 7115, "train_runtime": 91438.2323, "train_tokens_per_second": 4665.428 }, { "epoch": 0.9081632653061225, "grad_norm": 0.6068903422869749, "learning_rate": 5.719776336176156e-06, "loss": 0.3021916151046753, "num_input_tokens_seen": 426889416, "step": 7120, "train_runtime": 91503.7633, "train_tokens_per_second": 4665.266 }, { "epoch": 0.9088010204081632, "grad_norm": 0.5827151496950657, "learning_rate": 5.714819230870008e-06, "loss": 0.3168118715286255, "num_input_tokens_seen": 427194840, "step": 7125, "train_runtime": 91578.983, "train_tokens_per_second": 4664.769 }, { "epoch": 0.9094387755102041, "grad_norm": 0.5584850520855441, "learning_rate": 5.709861408192838e-06, "loss": 0.3096959590911865, "num_input_tokens_seen": 427492600, "step": 7130, "train_runtime": 91641.1969, "train_tokens_per_second": 4664.852 }, { "epoch": 0.9100765306122449, "grad_norm": 0.6197603815914464, "learning_rate": 5.704902873120169e-06, "loss": 0.29640045166015627, "num_input_tokens_seen": 427795448, "step": 7135, "train_runtime": 91692.3431, "train_tokens_per_second": 4665.553 }, { "epoch": 0.9107142857142857, "grad_norm": 0.6434202792469139, "learning_rate": 5.699943630628237e-06, "loss": 0.33102595806121826, "num_input_tokens_seen": 428104504, "step": 7140, "train_runtime": 91751.1201, "train_tokens_per_second": 4665.932 }, { "epoch": 0.9113520408163265, "grad_norm": 0.6292040750369453, "learning_rate": 5.694983685693987e-06, "loss": 0.3137689113616943, "num_input_tokens_seen": 428404848, "step": 7145, "train_runtime": 91799.9214, "train_tokens_per_second": 4666.723 }, { "epoch": 0.9119897959183674, "grad_norm": 0.6662152030153948, "learning_rate": 5.690023043295071e-06, "loss": 0.3325874090194702, "num_input_tokens_seen": 428703112, "step": 7150, "train_runtime": 91871.4612, "train_tokens_per_second": 4666.336 }, { "epoch": 0.9126275510204082, "grad_norm": 0.6540754605598266, "learning_rate": 5.6850617084098416e-06, "loss": 0.3043696641921997, "num_input_tokens_seen": 429000456, "step": 7155, "train_runtime": 91925.1303, "train_tokens_per_second": 4666.846 }, { "epoch": 0.9132653061224489, "grad_norm": 0.6632619898495971, "learning_rate": 5.6800996860173404e-06, "loss": 0.3231004476547241, "num_input_tokens_seen": 429297088, "step": 7160, "train_runtime": 91982.0064, "train_tokens_per_second": 4667.186 }, { "epoch": 0.9139030612244898, "grad_norm": 0.5703567693286303, "learning_rate": 5.675136981097309e-06, "loss": 0.3142138719558716, "num_input_tokens_seen": 429579968, "step": 7165, "train_runtime": 92041.4932, "train_tokens_per_second": 4667.242 }, { "epoch": 0.9145408163265306, "grad_norm": 0.5687135244709596, "learning_rate": 5.670173598630163e-06, "loss": 0.3060192108154297, "num_input_tokens_seen": 429874288, "step": 7170, "train_runtime": 92110.0601, "train_tokens_per_second": 4666.963 }, { "epoch": 0.9151785714285714, "grad_norm": 0.589292917190867, "learning_rate": 5.6652095435970074e-06, "loss": 0.30223712921142576, "num_input_tokens_seen": 430160784, "step": 7175, "train_runtime": 92179.9907, "train_tokens_per_second": 4666.531 }, { "epoch": 0.9158163265306123, "grad_norm": 0.5288173131215935, "learning_rate": 5.6602448209796165e-06, "loss": 0.30651304721832273, "num_input_tokens_seen": 430467256, "step": 7180, "train_runtime": 92247.5774, "train_tokens_per_second": 4666.434 }, { "epoch": 0.9164540816326531, "grad_norm": 0.6095056093311735, "learning_rate": 5.655279435760436e-06, "loss": 0.32366907596588135, "num_input_tokens_seen": 430770832, "step": 7185, "train_runtime": 92308.2816, "train_tokens_per_second": 4666.654 }, { "epoch": 0.9170918367346939, "grad_norm": 0.5543637119691666, "learning_rate": 5.650313392922578e-06, "loss": 0.3008253812789917, "num_input_tokens_seen": 431072344, "step": 7190, "train_runtime": 92367.9908, "train_tokens_per_second": 4666.902 }, { "epoch": 0.9177295918367347, "grad_norm": 0.5866655140224115, "learning_rate": 5.64534669744981e-06, "loss": 0.31891732215881347, "num_input_tokens_seen": 431381272, "step": 7195, "train_runtime": 92440.1997, "train_tokens_per_second": 4666.598 }, { "epoch": 0.9183673469387755, "grad_norm": 0.6073417287934477, "learning_rate": 5.640379354326563e-06, "loss": 0.32229931354522706, "num_input_tokens_seen": 431680488, "step": 7200, "train_runtime": 92505.6784, "train_tokens_per_second": 4666.53 }, { "epoch": 0.9190051020408163, "grad_norm": 0.661024416370543, "learning_rate": 5.63541136853791e-06, "loss": 0.2939903736114502, "num_input_tokens_seen": 431969632, "step": 7205, "train_runtime": 92574.933, "train_tokens_per_second": 4666.162 }, { "epoch": 0.9196428571428571, "grad_norm": 0.6845318201418956, "learning_rate": 5.630442745069568e-06, "loss": 0.3262001037597656, "num_input_tokens_seen": 432267888, "step": 7210, "train_runtime": 92638.8251, "train_tokens_per_second": 4666.163 }, { "epoch": 0.920280612244898, "grad_norm": 0.5940156412457124, "learning_rate": 5.625473488907905e-06, "loss": 0.3024473190307617, "num_input_tokens_seen": 432570896, "step": 7215, "train_runtime": 92710.2873, "train_tokens_per_second": 4665.835 }, { "epoch": 0.9209183673469388, "grad_norm": 0.5800769800283246, "learning_rate": 5.620503605039912e-06, "loss": 0.3193344593048096, "num_input_tokens_seen": 432878976, "step": 7220, "train_runtime": 92777.5906, "train_tokens_per_second": 4665.771 }, { "epoch": 0.9215561224489796, "grad_norm": 0.5572565007548289, "learning_rate": 5.615533098453215e-06, "loss": 0.2801225185394287, "num_input_tokens_seen": 433186248, "step": 7225, "train_runtime": 92838.4875, "train_tokens_per_second": 4666.02 }, { "epoch": 0.9221938775510204, "grad_norm": 0.5186992946677108, "learning_rate": 5.610561974136065e-06, "loss": 0.29192466735839845, "num_input_tokens_seen": 433486960, "step": 7230, "train_runtime": 92886.9217, "train_tokens_per_second": 4666.824 }, { "epoch": 0.9228316326530612, "grad_norm": 0.7562562116699331, "learning_rate": 5.605590237077332e-06, "loss": 0.3300828218460083, "num_input_tokens_seen": 433780840, "step": 7235, "train_runtime": 92956.316, "train_tokens_per_second": 4666.502 }, { "epoch": 0.923469387755102, "grad_norm": 0.5801308207234838, "learning_rate": 5.600617892266503e-06, "loss": 0.29742567539215087, "num_input_tokens_seen": 434096064, "step": 7240, "train_runtime": 93028.6449, "train_tokens_per_second": 4666.262 }, { "epoch": 0.9241071428571429, "grad_norm": 0.6394480180012891, "learning_rate": 5.5956449446936715e-06, "loss": 0.30805795192718505, "num_input_tokens_seen": 434398496, "step": 7245, "train_runtime": 93103.9915, "train_tokens_per_second": 4665.734 }, { "epoch": 0.9247448979591837, "grad_norm": 0.7338940794726408, "learning_rate": 5.590671399349539e-06, "loss": 0.3318042516708374, "num_input_tokens_seen": 434695112, "step": 7250, "train_runtime": 93170.4705, "train_tokens_per_second": 4665.589 }, { "epoch": 0.9253826530612245, "grad_norm": 0.6256606219661659, "learning_rate": 5.585697261225404e-06, "loss": 0.31543722152709963, "num_input_tokens_seen": 434997880, "step": 7255, "train_runtime": 93234.4865, "train_tokens_per_second": 4665.633 }, { "epoch": 0.9260204081632653, "grad_norm": 0.6650623900070087, "learning_rate": 5.58072253531316e-06, "loss": 0.32381477355957033, "num_input_tokens_seen": 435307224, "step": 7260, "train_runtime": 93296.8306, "train_tokens_per_second": 4665.831 }, { "epoch": 0.9266581632653061, "grad_norm": 0.6038362676540124, "learning_rate": 5.575747226605298e-06, "loss": 0.31850357055664064, "num_input_tokens_seen": 435620200, "step": 7265, "train_runtime": 93358.8387, "train_tokens_per_second": 4666.084 }, { "epoch": 0.9272959183673469, "grad_norm": 0.5095918793011849, "learning_rate": 5.570771340094883e-06, "loss": 0.28309895992279055, "num_input_tokens_seen": 435941080, "step": 7270, "train_runtime": 93415.0525, "train_tokens_per_second": 4666.711 }, { "epoch": 0.9279336734693877, "grad_norm": 0.6440571472363364, "learning_rate": 5.565794880775565e-06, "loss": 0.30919201374053956, "num_input_tokens_seen": 436238216, "step": 7275, "train_runtime": 93482.4774, "train_tokens_per_second": 4666.524 }, { "epoch": 0.9285714285714286, "grad_norm": 0.6201475695430417, "learning_rate": 5.560817853641568e-06, "loss": 0.2955244779586792, "num_input_tokens_seen": 436542688, "step": 7280, "train_runtime": 93551.8807, "train_tokens_per_second": 4666.317 }, { "epoch": 0.9292091836734694, "grad_norm": 0.5196330467583057, "learning_rate": 5.5558402636876885e-06, "loss": 0.2989202976226807, "num_input_tokens_seen": 436838992, "step": 7285, "train_runtime": 93607.9933, "train_tokens_per_second": 4666.685 }, { "epoch": 0.9298469387755102, "grad_norm": 0.5986134892779362, "learning_rate": 5.550862115909287e-06, "loss": 0.34584856033325195, "num_input_tokens_seen": 437148752, "step": 7290, "train_runtime": 93664.1461, "train_tokens_per_second": 4667.194 }, { "epoch": 0.9304846938775511, "grad_norm": 0.6363052132408222, "learning_rate": 5.545883415302276e-06, "loss": 0.3146224498748779, "num_input_tokens_seen": 437450384, "step": 7295, "train_runtime": 93722.1008, "train_tokens_per_second": 4667.526 }, { "epoch": 0.9311224489795918, "grad_norm": 0.6579653171206922, "learning_rate": 5.540904166863136e-06, "loss": 0.29396662712097166, "num_input_tokens_seen": 437743192, "step": 7300, "train_runtime": 93791.3072, "train_tokens_per_second": 4667.204 }, { "epoch": 0.9317602040816326, "grad_norm": 0.5407312888731015, "learning_rate": 5.535924375588887e-06, "loss": 0.276171875, "num_input_tokens_seen": 438038192, "step": 7305, "train_runtime": 93843.6526, "train_tokens_per_second": 4667.744 }, { "epoch": 0.9323979591836735, "grad_norm": 0.6408789940643321, "learning_rate": 5.530944046477098e-06, "loss": 0.3132428407669067, "num_input_tokens_seen": 438329456, "step": 7310, "train_runtime": 93898.2718, "train_tokens_per_second": 4668.131 }, { "epoch": 0.9330357142857143, "grad_norm": 0.636867795471314, "learning_rate": 5.525963184525877e-06, "loss": 0.3216026067733765, "num_input_tokens_seen": 438628168, "step": 7315, "train_runtime": 93963.7142, "train_tokens_per_second": 4668.059 }, { "epoch": 0.9336734693877551, "grad_norm": 0.5997438277249362, "learning_rate": 5.5209817947338685e-06, "loss": 0.32601065635681153, "num_input_tokens_seen": 438913408, "step": 7320, "train_runtime": 94031.2371, "train_tokens_per_second": 4667.74 }, { "epoch": 0.9343112244897959, "grad_norm": 0.6171801976002438, "learning_rate": 5.5159998821002425e-06, "loss": 0.3318033218383789, "num_input_tokens_seen": 439212088, "step": 7325, "train_runtime": 94093.8948, "train_tokens_per_second": 4667.806 }, { "epoch": 0.9349489795918368, "grad_norm": 0.5738435965055434, "learning_rate": 5.511017451624698e-06, "loss": 0.2951535701751709, "num_input_tokens_seen": 439503280, "step": 7330, "train_runtime": 94164.4511, "train_tokens_per_second": 4667.401 }, { "epoch": 0.9355867346938775, "grad_norm": 0.6756323345305557, "learning_rate": 5.506034508307453e-06, "loss": 0.29136927127838136, "num_input_tokens_seen": 439792240, "step": 7335, "train_runtime": 94229.1144, "train_tokens_per_second": 4667.265 }, { "epoch": 0.9362244897959183, "grad_norm": 0.555093105086905, "learning_rate": 5.501051057149234e-06, "loss": 0.3056096315383911, "num_input_tokens_seen": 440094736, "step": 7340, "train_runtime": 94295.2096, "train_tokens_per_second": 4667.201 }, { "epoch": 0.9368622448979592, "grad_norm": 0.5501806298116312, "learning_rate": 5.496067103151288e-06, "loss": 0.32032227516174316, "num_input_tokens_seen": 440391912, "step": 7345, "train_runtime": 94357.626, "train_tokens_per_second": 4667.264 }, { "epoch": 0.9375, "grad_norm": 0.5850828313124876, "learning_rate": 5.491082651315359e-06, "loss": 0.3087699174880981, "num_input_tokens_seen": 440686592, "step": 7350, "train_runtime": 94431.6859, "train_tokens_per_second": 4666.724 }, { "epoch": 0.9381377551020408, "grad_norm": 0.5713305456694097, "learning_rate": 5.4860977066436915e-06, "loss": 0.33030338287353517, "num_input_tokens_seen": 440978816, "step": 7355, "train_runtime": 94493.1498, "train_tokens_per_second": 4666.781 }, { "epoch": 0.9387755102040817, "grad_norm": 0.6320981171774707, "learning_rate": 5.481112274139026e-06, "loss": 0.3123514652252197, "num_input_tokens_seen": 441283240, "step": 7360, "train_runtime": 94549.0858, "train_tokens_per_second": 4667.24 }, { "epoch": 0.9394132653061225, "grad_norm": 0.6413611906967972, "learning_rate": 5.476126358804594e-06, "loss": 0.30727410316467285, "num_input_tokens_seen": 441574960, "step": 7365, "train_runtime": 94612.4054, "train_tokens_per_second": 4667.199 }, { "epoch": 0.9400510204081632, "grad_norm": 0.5797745517308095, "learning_rate": 5.471139965644108e-06, "loss": 0.296018648147583, "num_input_tokens_seen": 441853960, "step": 7370, "train_runtime": 94673.828, "train_tokens_per_second": 4667.118 }, { "epoch": 0.9406887755102041, "grad_norm": 0.5731409662928846, "learning_rate": 5.46615309966176e-06, "loss": 0.3353337287902832, "num_input_tokens_seen": 442166752, "step": 7375, "train_runtime": 94732.356, "train_tokens_per_second": 4667.537 }, { "epoch": 0.9413265306122449, "grad_norm": 0.6622186231748212, "learning_rate": 5.461165765862223e-06, "loss": 0.3128879308700562, "num_input_tokens_seen": 442456888, "step": 7380, "train_runtime": 94794.4704, "train_tokens_per_second": 4667.539 }, { "epoch": 0.9419642857142857, "grad_norm": 0.6549417567270942, "learning_rate": 5.456177969250632e-06, "loss": 0.3014249324798584, "num_input_tokens_seen": 442747864, "step": 7385, "train_runtime": 94863.7335, "train_tokens_per_second": 4667.198 }, { "epoch": 0.9426020408163265, "grad_norm": 0.6086689270822957, "learning_rate": 5.451189714832588e-06, "loss": 0.3215111255645752, "num_input_tokens_seen": 443043328, "step": 7390, "train_runtime": 94929.0736, "train_tokens_per_second": 4667.098 }, { "epoch": 0.9432397959183674, "grad_norm": 0.5829099727877867, "learning_rate": 5.446201007614156e-06, "loss": 0.2938807487487793, "num_input_tokens_seen": 443333072, "step": 7395, "train_runtime": 94991.3903, "train_tokens_per_second": 4667.087 }, { "epoch": 0.9438775510204082, "grad_norm": 0.6091982000250068, "learning_rate": 5.441211852601849e-06, "loss": 0.32256112098693845, "num_input_tokens_seen": 443631760, "step": 7400, "train_runtime": 95066.4991, "train_tokens_per_second": 4666.541 }, { "epoch": 0.9445153061224489, "grad_norm": 0.6618698775504013, "learning_rate": 5.4362222548026325e-06, "loss": 0.33964810371398924, "num_input_tokens_seen": 443919000, "step": 7405, "train_runtime": 95133.364, "train_tokens_per_second": 4666.281 }, { "epoch": 0.9451530612244898, "grad_norm": 0.5938798444680511, "learning_rate": 5.43123221922392e-06, "loss": 0.31477525234222414, "num_input_tokens_seen": 444222072, "step": 7410, "train_runtime": 95198.4376, "train_tokens_per_second": 4666.275 }, { "epoch": 0.9457908163265306, "grad_norm": 0.596341767375758, "learning_rate": 5.426241750873557e-06, "loss": 0.31355721950531007, "num_input_tokens_seen": 444526456, "step": 7415, "train_runtime": 95262.728, "train_tokens_per_second": 4666.321 }, { "epoch": 0.9464285714285714, "grad_norm": 0.816500727563092, "learning_rate": 5.42125085475983e-06, "loss": 0.3167865753173828, "num_input_tokens_seen": 444840448, "step": 7420, "train_runtime": 95334.2699, "train_tokens_per_second": 4666.113 }, { "epoch": 0.9470663265306123, "grad_norm": 0.5760463089242822, "learning_rate": 5.4162595358914475e-06, "loss": 0.3132263422012329, "num_input_tokens_seen": 445140360, "step": 7425, "train_runtime": 95407.5386, "train_tokens_per_second": 4665.673 }, { "epoch": 0.9477040816326531, "grad_norm": 0.6454927109178517, "learning_rate": 5.41126779927755e-06, "loss": 0.2961220979690552, "num_input_tokens_seen": 445441328, "step": 7430, "train_runtime": 95477.4718, "train_tokens_per_second": 4665.408 }, { "epoch": 0.9483418367346939, "grad_norm": 0.6100564771314775, "learning_rate": 5.4062756499276945e-06, "loss": 0.3174859046936035, "num_input_tokens_seen": 445745480, "step": 7435, "train_runtime": 95541.4066, "train_tokens_per_second": 4665.469 }, { "epoch": 0.9489795918367347, "grad_norm": 0.670902823072716, "learning_rate": 5.401283092851848e-06, "loss": 0.3194777011871338, "num_input_tokens_seen": 446040072, "step": 7440, "train_runtime": 95602.6469, "train_tokens_per_second": 4665.562 }, { "epoch": 0.9496173469387755, "grad_norm": 0.5924655478586123, "learning_rate": 5.396290133060394e-06, "loss": 0.3156425952911377, "num_input_tokens_seen": 446342496, "step": 7445, "train_runtime": 95670.2199, "train_tokens_per_second": 4665.428 }, { "epoch": 0.9502551020408163, "grad_norm": 0.6293344566850531, "learning_rate": 5.391296775564114e-06, "loss": 0.35019216537475584, "num_input_tokens_seen": 446653656, "step": 7450, "train_runtime": 95736.8092, "train_tokens_per_second": 4665.433 }, { "epoch": 0.9508928571428571, "grad_norm": 0.5680684445110501, "learning_rate": 5.386303025374192e-06, "loss": 0.3140332460403442, "num_input_tokens_seen": 446957728, "step": 7455, "train_runtime": 95801.9799, "train_tokens_per_second": 4665.433 }, { "epoch": 0.951530612244898, "grad_norm": 0.6153391098064949, "learning_rate": 5.381308887502204e-06, "loss": 0.31685566902160645, "num_input_tokens_seen": 447262552, "step": 7460, "train_runtime": 95873.869, "train_tokens_per_second": 4665.114 }, { "epoch": 0.9521683673469388, "grad_norm": 0.5404774882365914, "learning_rate": 5.376314366960118e-06, "loss": 0.32549347877502444, "num_input_tokens_seen": 447571488, "step": 7465, "train_runtime": 95938.0777, "train_tokens_per_second": 4665.212 }, { "epoch": 0.9528061224489796, "grad_norm": 0.6105593376103999, "learning_rate": 5.371319468760283e-06, "loss": 0.3242738485336304, "num_input_tokens_seen": 447887584, "step": 7470, "train_runtime": 96006.8173, "train_tokens_per_second": 4665.164 }, { "epoch": 0.9534438775510204, "grad_norm": 0.5776911685050845, "learning_rate": 5.366324197915426e-06, "loss": 0.30603318214416503, "num_input_tokens_seen": 448191752, "step": 7475, "train_runtime": 96073.7649, "train_tokens_per_second": 4665.08 }, { "epoch": 0.9540816326530612, "grad_norm": 0.5698671243647103, "learning_rate": 5.361328559438655e-06, "loss": 0.3016000747680664, "num_input_tokens_seen": 448502592, "step": 7480, "train_runtime": 96149.5553, "train_tokens_per_second": 4664.635 }, { "epoch": 0.954719387755102, "grad_norm": 0.6147263058767498, "learning_rate": 5.3563325583434376e-06, "loss": 0.327193021774292, "num_input_tokens_seen": 448812280, "step": 7485, "train_runtime": 96212.5883, "train_tokens_per_second": 4664.798 }, { "epoch": 0.9553571428571429, "grad_norm": 0.591686025763404, "learning_rate": 5.351336199643612e-06, "loss": 0.3120138645172119, "num_input_tokens_seen": 449115768, "step": 7490, "train_runtime": 96273.7713, "train_tokens_per_second": 4664.986 }, { "epoch": 0.9559948979591837, "grad_norm": 0.5987198258971944, "learning_rate": 5.346339488353374e-06, "loss": 0.2821963310241699, "num_input_tokens_seen": 449426136, "step": 7495, "train_runtime": 96340.1704, "train_tokens_per_second": 4664.992 }, { "epoch": 0.9566326530612245, "grad_norm": 0.5593344935745522, "learning_rate": 5.341342429487271e-06, "loss": 0.3055206537246704, "num_input_tokens_seen": 449735360, "step": 7500, "train_runtime": 96395.2839, "train_tokens_per_second": 4665.533 }, { "epoch": 0.9572704081632653, "grad_norm": 0.5987260749649931, "learning_rate": 5.336345028060199e-06, "loss": 0.3117807388305664, "num_input_tokens_seen": 450037880, "step": 7505, "train_runtime": 96443.9631, "train_tokens_per_second": 4666.315 }, { "epoch": 0.9579081632653061, "grad_norm": 0.6234861581669837, "learning_rate": 5.331347289087402e-06, "loss": 0.30819096565246584, "num_input_tokens_seen": 450333008, "step": 7510, "train_runtime": 96499.3839, "train_tokens_per_second": 4666.693 }, { "epoch": 0.9585459183673469, "grad_norm": 0.6060985686918107, "learning_rate": 5.326349217584459e-06, "loss": 0.29360136985778806, "num_input_tokens_seen": 450608408, "step": 7515, "train_runtime": 96566.1646, "train_tokens_per_second": 4666.318 }, { "epoch": 0.9591836734693877, "grad_norm": 0.5757095572868233, "learning_rate": 5.321350818567285e-06, "loss": 0.2921141624450684, "num_input_tokens_seen": 450896456, "step": 7520, "train_runtime": 96622.3478, "train_tokens_per_second": 4666.586 }, { "epoch": 0.9598214285714286, "grad_norm": 0.6448208027024613, "learning_rate": 5.3163520970521194e-06, "loss": 0.3008954286575317, "num_input_tokens_seen": 451192672, "step": 7525, "train_runtime": 96678.0882, "train_tokens_per_second": 4666.959 }, { "epoch": 0.9604591836734694, "grad_norm": 0.6534088140144655, "learning_rate": 5.311353058055533e-06, "loss": 0.3075784921646118, "num_input_tokens_seen": 451490672, "step": 7530, "train_runtime": 96751.2105, "train_tokens_per_second": 4666.512 }, { "epoch": 0.9610969387755102, "grad_norm": 0.6482668306282363, "learning_rate": 5.306353706594407e-06, "loss": 0.3319397926330566, "num_input_tokens_seen": 451796936, "step": 7535, "train_runtime": 96815.6519, "train_tokens_per_second": 4666.569 }, { "epoch": 0.9617346938775511, "grad_norm": 0.6424720638157772, "learning_rate": 5.3013540476859404e-06, "loss": 0.3318361520767212, "num_input_tokens_seen": 452106944, "step": 7540, "train_runtime": 96884.3575, "train_tokens_per_second": 4666.46 }, { "epoch": 0.9623724489795918, "grad_norm": 0.6268719170355765, "learning_rate": 5.2963540863476404e-06, "loss": 0.33273561000823976, "num_input_tokens_seen": 452387040, "step": 7545, "train_runtime": 96946.3593, "train_tokens_per_second": 4666.364 }, { "epoch": 0.9630102040816326, "grad_norm": 0.6354858722146296, "learning_rate": 5.291353827597317e-06, "loss": 0.28787033557891845, "num_input_tokens_seen": 452697032, "step": 7550, "train_runtime": 97014.8052, "train_tokens_per_second": 4666.267 }, { "epoch": 0.9636479591836735, "grad_norm": 0.600150934837588, "learning_rate": 5.28635327645308e-06, "loss": 0.32324178218841554, "num_input_tokens_seen": 452992904, "step": 7555, "train_runtime": 97081.2505, "train_tokens_per_second": 4666.121 }, { "epoch": 0.9642857142857143, "grad_norm": 0.5994538828916294, "learning_rate": 5.281352437933331e-06, "loss": 0.33991477489471433, "num_input_tokens_seen": 453279512, "step": 7560, "train_runtime": 97141.0514, "train_tokens_per_second": 4666.199 }, { "epoch": 0.9649234693877551, "grad_norm": 0.6487132106250739, "learning_rate": 5.276351317056762e-06, "loss": 0.3196584463119507, "num_input_tokens_seen": 453575816, "step": 7565, "train_runtime": 97203.0516, "train_tokens_per_second": 4666.271 }, { "epoch": 0.9655612244897959, "grad_norm": 0.546755169161235, "learning_rate": 5.271349918842344e-06, "loss": 0.33159217834472654, "num_input_tokens_seen": 453874112, "step": 7570, "train_runtime": 97262.0756, "train_tokens_per_second": 4666.507 }, { "epoch": 0.9661989795918368, "grad_norm": 0.5919380980375913, "learning_rate": 5.266348248309332e-06, "loss": 0.3290063142776489, "num_input_tokens_seen": 454165920, "step": 7575, "train_runtime": 97322.3772, "train_tokens_per_second": 4666.614 }, { "epoch": 0.9668367346938775, "grad_norm": 0.5550551918094889, "learning_rate": 5.2613463104772535e-06, "loss": 0.2901280879974365, "num_input_tokens_seen": 454470512, "step": 7580, "train_runtime": 97390.3922, "train_tokens_per_second": 4666.482 }, { "epoch": 0.9674744897959183, "grad_norm": 0.589767468565175, "learning_rate": 5.256344110365896e-06, "loss": 0.3240648746490479, "num_input_tokens_seen": 454775944, "step": 7585, "train_runtime": 97454.1725, "train_tokens_per_second": 4666.562 }, { "epoch": 0.9681122448979592, "grad_norm": 0.6522874216313619, "learning_rate": 5.251341652995325e-06, "loss": 0.33693685531616213, "num_input_tokens_seen": 455077336, "step": 7590, "train_runtime": 97514.4635, "train_tokens_per_second": 4666.768 }, { "epoch": 0.96875, "grad_norm": 0.5625013432026852, "learning_rate": 5.246338943385849e-06, "loss": 0.34079480171203613, "num_input_tokens_seen": 455362376, "step": 7595, "train_runtime": 97575.7883, "train_tokens_per_second": 4666.756 }, { "epoch": 0.9693877551020408, "grad_norm": 0.6701653593534399, "learning_rate": 5.24133598655804e-06, "loss": 0.3260797023773193, "num_input_tokens_seen": 455661464, "step": 7600, "train_runtime": 97637.8168, "train_tokens_per_second": 4666.854 }, { "epoch": 0.9700255102040817, "grad_norm": 0.6336350263548726, "learning_rate": 5.2363327875327115e-06, "loss": 0.29935464859008787, "num_input_tokens_seen": 455954448, "step": 7605, "train_runtime": 97705.3349, "train_tokens_per_second": 4666.628 }, { "epoch": 0.9706632653061225, "grad_norm": 0.5434675291168316, "learning_rate": 5.231329351330927e-06, "loss": 0.29101612567901614, "num_input_tokens_seen": 456271840, "step": 7610, "train_runtime": 97766.1481, "train_tokens_per_second": 4666.972 }, { "epoch": 0.9713010204081632, "grad_norm": 0.5576678165573105, "learning_rate": 5.226325682973984e-06, "loss": 0.3211846351623535, "num_input_tokens_seen": 456578832, "step": 7615, "train_runtime": 97829.9184, "train_tokens_per_second": 4667.067 }, { "epoch": 0.9719387755102041, "grad_norm": 0.6763873645307562, "learning_rate": 5.221321787483409e-06, "loss": 0.3094940662384033, "num_input_tokens_seen": 456888984, "step": 7620, "train_runtime": 97893.9988, "train_tokens_per_second": 4667.181 }, { "epoch": 0.9725765306122449, "grad_norm": 0.6651163303626488, "learning_rate": 5.216317669880965e-06, "loss": 0.3145118236541748, "num_input_tokens_seen": 457173616, "step": 7625, "train_runtime": 97961.9243, "train_tokens_per_second": 4666.85 }, { "epoch": 0.9732142857142857, "grad_norm": 0.5701022534247328, "learning_rate": 5.21131333518863e-06, "loss": 0.3109163284301758, "num_input_tokens_seen": 457485832, "step": 7630, "train_runtime": 98034.3858, "train_tokens_per_second": 4666.585 }, { "epoch": 0.9738520408163265, "grad_norm": 0.6080132650043788, "learning_rate": 5.206308788428604e-06, "loss": 0.32394387722015383, "num_input_tokens_seen": 457789536, "step": 7635, "train_runtime": 98109.9725, "train_tokens_per_second": 4666.086 }, { "epoch": 0.9744897959183674, "grad_norm": 0.6046240464616601, "learning_rate": 5.201304034623303e-06, "loss": 0.3452263355255127, "num_input_tokens_seen": 458099200, "step": 7640, "train_runtime": 98172.8133, "train_tokens_per_second": 4666.253 }, { "epoch": 0.9751275510204082, "grad_norm": 0.6475743563371117, "learning_rate": 5.1962990787953436e-06, "loss": 0.32486186027526853, "num_input_tokens_seen": 458388136, "step": 7645, "train_runtime": 98242.5093, "train_tokens_per_second": 4665.884 }, { "epoch": 0.9757653061224489, "grad_norm": 0.5980063889313315, "learning_rate": 5.191293925967548e-06, "loss": 0.29793720245361327, "num_input_tokens_seen": 458675736, "step": 7650, "train_runtime": 98310.9341, "train_tokens_per_second": 4665.562 }, { "epoch": 0.9764030612244898, "grad_norm": 0.5292021897954804, "learning_rate": 5.186288581162939e-06, "loss": 0.3058775424957275, "num_input_tokens_seen": 458982360, "step": 7655, "train_runtime": 98377.2266, "train_tokens_per_second": 4665.535 }, { "epoch": 0.9770408163265306, "grad_norm": 0.5996618706074013, "learning_rate": 5.181283049404728e-06, "loss": 0.30587172508239746, "num_input_tokens_seen": 459279984, "step": 7660, "train_runtime": 98450.0886, "train_tokens_per_second": 4665.105 }, { "epoch": 0.9776785714285714, "grad_norm": 0.5248917801822073, "learning_rate": 5.1762773357163175e-06, "loss": 0.27962732315063477, "num_input_tokens_seen": 459570208, "step": 7665, "train_runtime": 98512.6984, "train_tokens_per_second": 4665.086 }, { "epoch": 0.9783163265306123, "grad_norm": 0.5926032130293605, "learning_rate": 5.171271445121286e-06, "loss": 0.2774610996246338, "num_input_tokens_seen": 459860232, "step": 7670, "train_runtime": 98570.0192, "train_tokens_per_second": 4665.315 }, { "epoch": 0.9789540816326531, "grad_norm": 0.6484820227148456, "learning_rate": 5.166265382643402e-06, "loss": 0.3253363370895386, "num_input_tokens_seen": 460147904, "step": 7675, "train_runtime": 98639.7667, "train_tokens_per_second": 4664.933 }, { "epoch": 0.9795918367346939, "grad_norm": 0.4907343854867156, "learning_rate": 5.161259153306592e-06, "loss": 0.27699477672576905, "num_input_tokens_seen": 460444704, "step": 7680, "train_runtime": 98707.1327, "train_tokens_per_second": 4664.756 }, { "epoch": 0.9802295918367347, "grad_norm": 0.6138292638952311, "learning_rate": 5.156252762134959e-06, "loss": 0.29723730087280276, "num_input_tokens_seen": 460735744, "step": 7685, "train_runtime": 98780.7921, "train_tokens_per_second": 4664.224 }, { "epoch": 0.9808673469387755, "grad_norm": 0.5790012334958022, "learning_rate": 5.1512462141527675e-06, "loss": 0.31710524559020997, "num_input_tokens_seen": 461045584, "step": 7690, "train_runtime": 98848.0018, "train_tokens_per_second": 4664.187 }, { "epoch": 0.9815051020408163, "grad_norm": 0.5729531652566596, "learning_rate": 5.146239514384437e-06, "loss": 0.32338848114013674, "num_input_tokens_seen": 461354272, "step": 7695, "train_runtime": 98905.6236, "train_tokens_per_second": 4664.591 }, { "epoch": 0.9821428571428571, "grad_norm": 0.605641575088013, "learning_rate": 5.14123266785454e-06, "loss": 0.3240955352783203, "num_input_tokens_seen": 461642712, "step": 7700, "train_runtime": 98973.9734, "train_tokens_per_second": 4664.284 }, { "epoch": 0.982780612244898, "grad_norm": 0.5543165704011824, "learning_rate": 5.136225679587797e-06, "loss": 0.29973626136779785, "num_input_tokens_seen": 461941752, "step": 7705, "train_runtime": 99031.9811, "train_tokens_per_second": 4664.571 }, { "epoch": 0.9834183673469388, "grad_norm": 0.5908493236810771, "learning_rate": 5.131218554609072e-06, "loss": 0.3147848129272461, "num_input_tokens_seen": 462253096, "step": 7710, "train_runtime": 99095.786, "train_tokens_per_second": 4664.71 }, { "epoch": 0.9840561224489796, "grad_norm": 0.5496162048277468, "learning_rate": 5.126211297943362e-06, "loss": 0.3021842002868652, "num_input_tokens_seen": 462550192, "step": 7715, "train_runtime": 99158.9418, "train_tokens_per_second": 4664.735 }, { "epoch": 0.9846938775510204, "grad_norm": 0.6397961246977143, "learning_rate": 5.121203914615799e-06, "loss": 0.3146205425262451, "num_input_tokens_seen": 462872160, "step": 7720, "train_runtime": 99217.5475, "train_tokens_per_second": 4665.225 }, { "epoch": 0.9853316326530612, "grad_norm": 0.5947195068505116, "learning_rate": 5.116196409651645e-06, "loss": 0.3136601448059082, "num_input_tokens_seen": 463170848, "step": 7725, "train_runtime": 99281.4491, "train_tokens_per_second": 4665.231 }, { "epoch": 0.985969387755102, "grad_norm": 0.583155497751477, "learning_rate": 5.111188788076278e-06, "loss": 0.33538773059844973, "num_input_tokens_seen": 463476088, "step": 7730, "train_runtime": 99361.6793, "train_tokens_per_second": 4664.536 }, { "epoch": 0.9866071428571429, "grad_norm": 0.6345423842564097, "learning_rate": 5.106181054915196e-06, "loss": 0.32474794387817385, "num_input_tokens_seen": 463795016, "step": 7735, "train_runtime": 99415.135, "train_tokens_per_second": 4665.235 }, { "epoch": 0.9872448979591837, "grad_norm": 0.6211131091765834, "learning_rate": 5.10117321519401e-06, "loss": 0.3254901885986328, "num_input_tokens_seen": 464095728, "step": 7740, "train_runtime": 99477.4373, "train_tokens_per_second": 4665.337 }, { "epoch": 0.9878826530612245, "grad_norm": 0.6283576703196156, "learning_rate": 5.0961652739384356e-06, "loss": 0.29070339202880857, "num_input_tokens_seen": 464401824, "step": 7745, "train_runtime": 99541.3676, "train_tokens_per_second": 4665.415 }, { "epoch": 0.9885204081632653, "grad_norm": 0.6765271402073013, "learning_rate": 5.091157236174295e-06, "loss": 0.3426629066467285, "num_input_tokens_seen": 464722208, "step": 7750, "train_runtime": 99592.6593, "train_tokens_per_second": 4666.23 }, { "epoch": 0.9891581632653061, "grad_norm": 0.540617019497874, "learning_rate": 5.086149106927499e-06, "loss": 0.2858463525772095, "num_input_tokens_seen": 465023720, "step": 7755, "train_runtime": 99667.3487, "train_tokens_per_second": 4665.758 }, { "epoch": 0.9897959183673469, "grad_norm": 0.6074886827015675, "learning_rate": 5.081140891224061e-06, "loss": 0.28305037021636964, "num_input_tokens_seen": 465316320, "step": 7760, "train_runtime": 99736.8677, "train_tokens_per_second": 4665.439 }, { "epoch": 0.9904336734693877, "grad_norm": 0.5861559786845644, "learning_rate": 5.076132594090068e-06, "loss": 0.30130348205566404, "num_input_tokens_seen": 465627800, "step": 7765, "train_runtime": 99786.5775, "train_tokens_per_second": 4666.237 }, { "epoch": 0.9910714285714286, "grad_norm": 0.603733945471739, "learning_rate": 5.071124220551703e-06, "loss": 0.30890641212463377, "num_input_tokens_seen": 465929352, "step": 7770, "train_runtime": 99859.418, "train_tokens_per_second": 4665.853 }, { "epoch": 0.9917091836734694, "grad_norm": 0.4571867681651973, "learning_rate": 5.066115775635213e-06, "loss": 0.30515527725219727, "num_input_tokens_seen": 466240856, "step": 7775, "train_runtime": 99924.8984, "train_tokens_per_second": 4665.913 }, { "epoch": 0.9923469387755102, "grad_norm": 0.6394776832577932, "learning_rate": 5.061107264366926e-06, "loss": 0.2977296829223633, "num_input_tokens_seen": 466530752, "step": 7780, "train_runtime": 99982.0987, "train_tokens_per_second": 4666.143 }, { "epoch": 0.9929846938775511, "grad_norm": 0.6321535056897735, "learning_rate": 5.05609869177323e-06, "loss": 0.30818977355957033, "num_input_tokens_seen": 466843744, "step": 7785, "train_runtime": 100056.2757, "train_tokens_per_second": 4665.812 }, { "epoch": 0.9936224489795918, "grad_norm": 0.5400668637736669, "learning_rate": 5.05109006288058e-06, "loss": 0.31366040706634524, "num_input_tokens_seen": 467149864, "step": 7790, "train_runtime": 100125.7303, "train_tokens_per_second": 4665.633 }, { "epoch": 0.9942602040816326, "grad_norm": 0.6452088140800006, "learning_rate": 5.046081382715484e-06, "loss": 0.29803402423858644, "num_input_tokens_seen": 467449768, "step": 7795, "train_runtime": 100179.7084, "train_tokens_per_second": 4666.112 }, { "epoch": 0.9948979591836735, "grad_norm": 0.5701539179741821, "learning_rate": 5.0410726563045005e-06, "loss": 0.3019112586975098, "num_input_tokens_seen": 467753208, "step": 7800, "train_runtime": 100246.42, "train_tokens_per_second": 4666.034 }, { "epoch": 0.9955357142857143, "grad_norm": 0.5601865942144285, "learning_rate": 5.036063888674239e-06, "loss": 0.3023086071014404, "num_input_tokens_seen": 468059360, "step": 7805, "train_runtime": 100315.9634, "train_tokens_per_second": 4665.851 }, { "epoch": 0.9961734693877551, "grad_norm": 0.6097741741301059, "learning_rate": 5.031055084851349e-06, "loss": 0.28096904754638674, "num_input_tokens_seen": 468363536, "step": 7810, "train_runtime": 100375.4937, "train_tokens_per_second": 4666.114 }, { "epoch": 0.9968112244897959, "grad_norm": 0.5597421027232963, "learning_rate": 5.0260462498625084e-06, "loss": 0.318403434753418, "num_input_tokens_seen": 468668776, "step": 7815, "train_runtime": 100438.6541, "train_tokens_per_second": 4666.219 }, { "epoch": 0.9974489795918368, "grad_norm": 0.6143193062402761, "learning_rate": 5.021037388734439e-06, "loss": 0.31057963371276853, "num_input_tokens_seen": 468978488, "step": 7820, "train_runtime": 100502.1577, "train_tokens_per_second": 4666.352 }, { "epoch": 0.9980867346938775, "grad_norm": 0.6202264825508076, "learning_rate": 5.016028506493881e-06, "loss": 0.29598608016967776, "num_input_tokens_seen": 469295688, "step": 7825, "train_runtime": 100569.2484, "train_tokens_per_second": 4666.394 }, { "epoch": 0.9987244897959183, "grad_norm": 0.5462962001030922, "learning_rate": 5.011019608167596e-06, "loss": 0.29022941589355467, "num_input_tokens_seen": 469598840, "step": 7830, "train_runtime": 100631.4582, "train_tokens_per_second": 4666.521 }, { "epoch": 0.9993622448979592, "grad_norm": 0.6483707288128262, "learning_rate": 5.006010698782365e-06, "loss": 0.32463507652282714, "num_input_tokens_seen": 469890360, "step": 7835, "train_runtime": 100695.154, "train_tokens_per_second": 4666.464 }, { "epoch": 1.0, "grad_norm": 0.7132004143103949, "learning_rate": 5.001001783364978e-06, "loss": 0.3155714511871338, "num_input_tokens_seen": 470193152, "step": 7840, "train_runtime": 100761.1902, "train_tokens_per_second": 4666.411 }, { "epoch": 1.000637755102041, "grad_norm": 0.7063670221257499, "learning_rate": 4.995992866942232e-06, "loss": 0.27135615348815917, "num_input_tokens_seen": 470501136, "step": 7845, "train_runtime": 100855.7953, "train_tokens_per_second": 4665.088 }, { "epoch": 1.0012755102040816, "grad_norm": 0.7205766028299049, "learning_rate": 4.990983954540925e-06, "loss": 0.23918299674987792, "num_input_tokens_seen": 470799744, "step": 7850, "train_runtime": 100923.0157, "train_tokens_per_second": 4664.939 }, { "epoch": 1.0019132653061225, "grad_norm": 0.7440549615755528, "learning_rate": 4.985975051187848e-06, "loss": 0.2603339672088623, "num_input_tokens_seen": 471113560, "step": 7855, "train_runtime": 100975.9239, "train_tokens_per_second": 4665.603 }, { "epoch": 1.0025510204081634, "grad_norm": 0.6740790164198203, "learning_rate": 4.980966161909785e-06, "loss": 0.2453685760498047, "num_input_tokens_seen": 471406032, "step": 7860, "train_runtime": 101042.6418, "train_tokens_per_second": 4665.417 }, { "epoch": 1.003188775510204, "grad_norm": 0.5965397254378703, "learning_rate": 4.975957291733511e-06, "loss": 0.25345773696899415, "num_input_tokens_seen": 471722416, "step": 7865, "train_runtime": 101116.116, "train_tokens_per_second": 4665.156 }, { "epoch": 1.003826530612245, "grad_norm": 0.6354748638878189, "learning_rate": 4.970948445685772e-06, "loss": 0.22407064437866211, "num_input_tokens_seen": 471995736, "step": 7870, "train_runtime": 101184.7663, "train_tokens_per_second": 4664.692 }, { "epoch": 1.0044642857142858, "grad_norm": 0.6967893112176949, "learning_rate": 4.965939628793295e-06, "loss": 0.24353766441345215, "num_input_tokens_seen": 472305800, "step": 7875, "train_runtime": 101256.5768, "train_tokens_per_second": 4664.446 }, { "epoch": 1.0051020408163265, "grad_norm": 0.676968804710127, "learning_rate": 4.960930846082783e-06, "loss": 0.2777569770812988, "num_input_tokens_seen": 472613936, "step": 7880, "train_runtime": 101322.7275, "train_tokens_per_second": 4664.442 }, { "epoch": 1.0057397959183674, "grad_norm": 0.5643974833710756, "learning_rate": 4.955922102580894e-06, "loss": 0.24412152767181397, "num_input_tokens_seen": 472915392, "step": 7885, "train_runtime": 101395.3722, "train_tokens_per_second": 4664.073 }, { "epoch": 1.0063775510204083, "grad_norm": 0.7241753470400919, "learning_rate": 4.9509134033142525e-06, "loss": 0.23244500160217285, "num_input_tokens_seen": 473204720, "step": 7890, "train_runtime": 101457.5229, "train_tokens_per_second": 4664.067 }, { "epoch": 1.007015306122449, "grad_norm": 0.7318825243421886, "learning_rate": 4.945904753309441e-06, "loss": 0.27535371780395507, "num_input_tokens_seen": 473506616, "step": 7895, "train_runtime": 101528.1269, "train_tokens_per_second": 4663.797 }, { "epoch": 1.0076530612244898, "grad_norm": 0.6395240024520434, "learning_rate": 4.940896157592985e-06, "loss": 0.23467187881469725, "num_input_tokens_seen": 473805792, "step": 7900, "train_runtime": 101600.7105, "train_tokens_per_second": 4663.41 }, { "epoch": 1.0082908163265305, "grad_norm": 0.6749424965862421, "learning_rate": 4.935887621191364e-06, "loss": 0.25825228691101076, "num_input_tokens_seen": 474115248, "step": 7905, "train_runtime": 101661.7366, "train_tokens_per_second": 4663.655 }, { "epoch": 1.0089285714285714, "grad_norm": 0.6464308565745938, "learning_rate": 4.930879149130993e-06, "loss": 0.25428595542907717, "num_input_tokens_seen": 474418992, "step": 7910, "train_runtime": 101724.7789, "train_tokens_per_second": 4663.751 }, { "epoch": 1.0095663265306123, "grad_norm": 0.7086695672538507, "learning_rate": 4.925870746438223e-06, "loss": 0.2341998815536499, "num_input_tokens_seen": 474698872, "step": 7915, "train_runtime": 101786.7418, "train_tokens_per_second": 4663.661 }, { "epoch": 1.010204081632653, "grad_norm": 0.6683637085600683, "learning_rate": 4.920862418139335e-06, "loss": 0.2417293071746826, "num_input_tokens_seen": 474994944, "step": 7920, "train_runtime": 101841.7269, "train_tokens_per_second": 4664.05 }, { "epoch": 1.0108418367346939, "grad_norm": 0.6913590181544073, "learning_rate": 4.91585416926054e-06, "loss": 0.24323151111602784, "num_input_tokens_seen": 475289264, "step": 7925, "train_runtime": 101908.8462, "train_tokens_per_second": 4663.867 }, { "epoch": 1.0114795918367347, "grad_norm": 0.7226028388516762, "learning_rate": 4.91084600482796e-06, "loss": 0.23154821395874023, "num_input_tokens_seen": 475583128, "step": 7930, "train_runtime": 101981.3247, "train_tokens_per_second": 4663.434 }, { "epoch": 1.0121173469387754, "grad_norm": 0.6687960980981288, "learning_rate": 4.905837929867643e-06, "loss": 0.2589773893356323, "num_input_tokens_seen": 475902616, "step": 7935, "train_runtime": 102053.4561, "train_tokens_per_second": 4663.268 }, { "epoch": 1.0127551020408163, "grad_norm": 0.61616438449182, "learning_rate": 4.900829949405539e-06, "loss": 0.2532099723815918, "num_input_tokens_seen": 476190664, "step": 7940, "train_runtime": 102111.5179, "train_tokens_per_second": 4663.437 }, { "epoch": 1.0133928571428572, "grad_norm": 0.6123550636551225, "learning_rate": 4.895822068467505e-06, "loss": 0.2447188377380371, "num_input_tokens_seen": 476499112, "step": 7945, "train_runtime": 102170.5412, "train_tokens_per_second": 4663.762 }, { "epoch": 1.0140306122448979, "grad_norm": 0.6581367871078015, "learning_rate": 4.890814292079303e-06, "loss": 0.26943182945251465, "num_input_tokens_seen": 476815032, "step": 7950, "train_runtime": 102230.2551, "train_tokens_per_second": 4664.128 }, { "epoch": 1.0146683673469388, "grad_norm": 0.568421364437829, "learning_rate": 4.885806625266585e-06, "loss": 0.23051421642303466, "num_input_tokens_seen": 477098568, "step": 7955, "train_runtime": 102282.8105, "train_tokens_per_second": 4664.504 }, { "epoch": 1.0153061224489797, "grad_norm": 0.6099696747243039, "learning_rate": 4.8807990730548905e-06, "loss": 0.2716972351074219, "num_input_tokens_seen": 477390840, "step": 7960, "train_runtime": 102347.4804, "train_tokens_per_second": 4664.412 }, { "epoch": 1.0159438775510203, "grad_norm": 0.5391053729948323, "learning_rate": 4.8757916404696545e-06, "loss": 0.22613182067871093, "num_input_tokens_seen": 477687248, "step": 7965, "train_runtime": 102426.2004, "train_tokens_per_second": 4663.721 }, { "epoch": 1.0165816326530612, "grad_norm": 0.6559138211623041, "learning_rate": 4.870784332536181e-06, "loss": 0.24821786880493163, "num_input_tokens_seen": 477979368, "step": 7970, "train_runtime": 102486.4612, "train_tokens_per_second": 4663.829 }, { "epoch": 1.0172193877551021, "grad_norm": 0.6723493475992208, "learning_rate": 4.865777154279653e-06, "loss": 0.26028215885162354, "num_input_tokens_seen": 478280648, "step": 7975, "train_runtime": 102562.7945, "train_tokens_per_second": 4663.296 }, { "epoch": 1.0178571428571428, "grad_norm": 0.6210324868756046, "learning_rate": 4.8607701107251274e-06, "loss": 0.2637598514556885, "num_input_tokens_seen": 478594504, "step": 7980, "train_runtime": 102623.5945, "train_tokens_per_second": 4663.591 }, { "epoch": 1.0184948979591837, "grad_norm": 0.5864754377444793, "learning_rate": 4.855763206897516e-06, "loss": 0.25537154674530027, "num_input_tokens_seen": 478896512, "step": 7985, "train_runtime": 102685.038, "train_tokens_per_second": 4663.742 }, { "epoch": 1.0191326530612246, "grad_norm": 0.67423971781068, "learning_rate": 4.850756447821602e-06, "loss": 0.2521768569946289, "num_input_tokens_seen": 479186984, "step": 7990, "train_runtime": 102748.9622, "train_tokens_per_second": 4663.667 }, { "epoch": 1.0197704081632653, "grad_norm": 0.6232373731879575, "learning_rate": 4.845749838522016e-06, "loss": 0.22831923961639405, "num_input_tokens_seen": 479482192, "step": 7995, "train_runtime": 102822.2966, "train_tokens_per_second": 4663.212 }, { "epoch": 1.0204081632653061, "grad_norm": 0.6082933837002366, "learning_rate": 4.84074338402324e-06, "loss": 0.24029741287231446, "num_input_tokens_seen": 479777744, "step": 8000, "train_runtime": 102892.6301, "train_tokens_per_second": 4662.897 }, { "epoch": 1.021045918367347, "grad_norm": 0.6932153992534329, "learning_rate": 4.835737089349599e-06, "loss": 0.2580875396728516, "num_input_tokens_seen": 480085464, "step": 8005, "train_runtime": 102946.6047, "train_tokens_per_second": 4663.441 }, { "epoch": 1.0216836734693877, "grad_norm": 0.6398197766513816, "learning_rate": 4.8307309595252624e-06, "loss": 0.24136962890625, "num_input_tokens_seen": 480388920, "step": 8010, "train_runtime": 103008.574, "train_tokens_per_second": 4663.582 }, { "epoch": 1.0223214285714286, "grad_norm": 0.5655827604804655, "learning_rate": 4.82572499957423e-06, "loss": 0.22456057071685792, "num_input_tokens_seen": 480695024, "step": 8015, "train_runtime": 103063.8494, "train_tokens_per_second": 4664.051 }, { "epoch": 1.0229591836734695, "grad_norm": 0.6674421538864252, "learning_rate": 4.820719214520329e-06, "loss": 0.22296371459960937, "num_input_tokens_seen": 480982296, "step": 8020, "train_runtime": 103129.4477, "train_tokens_per_second": 4663.87 }, { "epoch": 1.0235969387755102, "grad_norm": 0.7010180058705325, "learning_rate": 4.815713609387221e-06, "loss": 0.22968318462371826, "num_input_tokens_seen": 481268960, "step": 8025, "train_runtime": 103200.1372, "train_tokens_per_second": 4663.453 }, { "epoch": 1.024234693877551, "grad_norm": 0.7424588837248032, "learning_rate": 4.810708189198374e-06, "loss": 0.25366778373718263, "num_input_tokens_seen": 481543296, "step": 8030, "train_runtime": 103274.6296, "train_tokens_per_second": 4662.745 }, { "epoch": 1.0248724489795917, "grad_norm": 0.6489336132554717, "learning_rate": 4.80570295897708e-06, "loss": 0.24692921638488768, "num_input_tokens_seen": 481829120, "step": 8035, "train_runtime": 103340.8353, "train_tokens_per_second": 4662.524 }, { "epoch": 1.0255102040816326, "grad_norm": 0.6126117737638476, "learning_rate": 4.800697923746437e-06, "loss": 0.24772284030914307, "num_input_tokens_seen": 482135760, "step": 8040, "train_runtime": 103390.5847, "train_tokens_per_second": 4663.246 }, { "epoch": 1.0261479591836735, "grad_norm": 0.6213374960515321, "learning_rate": 4.795693088529345e-06, "loss": 0.2315685510635376, "num_input_tokens_seen": 482444240, "step": 8045, "train_runtime": 103449.884, "train_tokens_per_second": 4663.555 }, { "epoch": 1.0267857142857142, "grad_norm": 0.6578325237121249, "learning_rate": 4.790688458348509e-06, "loss": 0.2314953088760376, "num_input_tokens_seen": 482724176, "step": 8050, "train_runtime": 103511.8759, "train_tokens_per_second": 4663.467 }, { "epoch": 1.027423469387755, "grad_norm": 0.6392076860059664, "learning_rate": 4.7856840382264234e-06, "loss": 0.2663999080657959, "num_input_tokens_seen": 483026872, "step": 8055, "train_runtime": 103584.7084, "train_tokens_per_second": 4663.11 }, { "epoch": 1.028061224489796, "grad_norm": 0.6271337962363529, "learning_rate": 4.780679833185372e-06, "loss": 0.237894868850708, "num_input_tokens_seen": 483309624, "step": 8060, "train_runtime": 103642.4458, "train_tokens_per_second": 4663.24 }, { "epoch": 1.0286989795918366, "grad_norm": 0.6272003459089206, "learning_rate": 4.775675848247427e-06, "loss": 0.24145734310150146, "num_input_tokens_seen": 483622136, "step": 8065, "train_runtime": 103720.4166, "train_tokens_per_second": 4662.748 }, { "epoch": 1.0293367346938775, "grad_norm": 0.7643285491618245, "learning_rate": 4.770672088434433e-06, "loss": 0.26503143310546873, "num_input_tokens_seen": 483927584, "step": 8070, "train_runtime": 103786.938, "train_tokens_per_second": 4662.702 }, { "epoch": 1.0299744897959184, "grad_norm": 0.7224211334277504, "learning_rate": 4.765668558768015e-06, "loss": 0.2647601366043091, "num_input_tokens_seen": 484219912, "step": 8075, "train_runtime": 103846.0738, "train_tokens_per_second": 4662.862 }, { "epoch": 1.030612244897959, "grad_norm": 0.6260556021229013, "learning_rate": 4.760665264269566e-06, "loss": 0.2593989372253418, "num_input_tokens_seen": 484523920, "step": 8080, "train_runtime": 103918.9874, "train_tokens_per_second": 4662.516 }, { "epoch": 1.03125, "grad_norm": 0.7384068818094177, "learning_rate": 4.755662209960238e-06, "loss": 0.2510901927947998, "num_input_tokens_seen": 484819144, "step": 8085, "train_runtime": 103978.2914, "train_tokens_per_second": 4662.696 }, { "epoch": 1.031887755102041, "grad_norm": 0.78521447721399, "learning_rate": 4.750659400860945e-06, "loss": 0.2539271354675293, "num_input_tokens_seen": 485118608, "step": 8090, "train_runtime": 104037.4872, "train_tokens_per_second": 4662.921 }, { "epoch": 1.0325255102040816, "grad_norm": 0.6250747330880316, "learning_rate": 4.74565684199236e-06, "loss": 0.24170682430267335, "num_input_tokens_seen": 485436096, "step": 8095, "train_runtime": 104108.6134, "train_tokens_per_second": 4662.785 }, { "epoch": 1.0331632653061225, "grad_norm": 0.6782670204566934, "learning_rate": 4.740654538374896e-06, "loss": 0.2533915042877197, "num_input_tokens_seen": 485738432, "step": 8100, "train_runtime": 104165.3291, "train_tokens_per_second": 4663.149 }, { "epoch": 1.0338010204081634, "grad_norm": 0.593760496801077, "learning_rate": 4.735652495028714e-06, "loss": 0.24408226013183593, "num_input_tokens_seen": 486036120, "step": 8105, "train_runtime": 104224.6897, "train_tokens_per_second": 4663.349 }, { "epoch": 1.034438775510204, "grad_norm": 0.6852036028617559, "learning_rate": 4.7306507169737176e-06, "loss": 0.24594330787658691, "num_input_tokens_seen": 486347296, "step": 8110, "train_runtime": 104289.0295, "train_tokens_per_second": 4663.456 }, { "epoch": 1.035076530612245, "grad_norm": 0.6724049261384363, "learning_rate": 4.725649209229537e-06, "loss": 0.2450767993927002, "num_input_tokens_seen": 486645472, "step": 8115, "train_runtime": 104347.8074, "train_tokens_per_second": 4663.687 }, { "epoch": 1.0357142857142858, "grad_norm": 0.652922414752715, "learning_rate": 4.720647976815536e-06, "loss": 0.24182796478271484, "num_input_tokens_seen": 486943200, "step": 8120, "train_runtime": 104411.5615, "train_tokens_per_second": 4663.69 }, { "epoch": 1.0363520408163265, "grad_norm": 0.6386399166479841, "learning_rate": 4.7156470247508e-06, "loss": 0.2487572193145752, "num_input_tokens_seen": 487234656, "step": 8125, "train_runtime": 104478.4581, "train_tokens_per_second": 4663.494 }, { "epoch": 1.0369897959183674, "grad_norm": 0.6375505378297279, "learning_rate": 4.710646358054133e-06, "loss": 0.2301931858062744, "num_input_tokens_seen": 487533672, "step": 8130, "train_runtime": 104555.1924, "train_tokens_per_second": 4662.931 }, { "epoch": 1.0376275510204083, "grad_norm": 0.690799677250621, "learning_rate": 4.705645981744055e-06, "loss": 0.2515393257141113, "num_input_tokens_seen": 487821880, "step": 8135, "train_runtime": 104624.4958, "train_tokens_per_second": 4662.597 }, { "epoch": 1.038265306122449, "grad_norm": 0.6805220934630078, "learning_rate": 4.700645900838793e-06, "loss": 0.2581647872924805, "num_input_tokens_seen": 488114280, "step": 8140, "train_runtime": 104693.1979, "train_tokens_per_second": 4662.33 }, { "epoch": 1.0389030612244898, "grad_norm": 0.6547597860715865, "learning_rate": 4.695646120356275e-06, "loss": 0.23448925018310546, "num_input_tokens_seen": 488397288, "step": 8145, "train_runtime": 104767.1561, "train_tokens_per_second": 4661.74 }, { "epoch": 1.0395408163265305, "grad_norm": 0.588188314591436, "learning_rate": 4.69064664531413e-06, "loss": 0.2562718868255615, "num_input_tokens_seen": 488707832, "step": 8150, "train_runtime": 104834.3514, "train_tokens_per_second": 4661.715 }, { "epoch": 1.0401785714285714, "grad_norm": 0.6041528110153581, "learning_rate": 4.685647480729684e-06, "loss": 0.22281389236450194, "num_input_tokens_seen": 489010392, "step": 8155, "train_runtime": 104903.0247, "train_tokens_per_second": 4661.547 }, { "epoch": 1.0408163265306123, "grad_norm": 0.7010735358941815, "learning_rate": 4.680648631619945e-06, "loss": 0.23440265655517578, "num_input_tokens_seen": 489313720, "step": 8160, "train_runtime": 104965.4902, "train_tokens_per_second": 4661.663 }, { "epoch": 1.041454081632653, "grad_norm": 0.5494106667712622, "learning_rate": 4.675650103001606e-06, "loss": 0.24059038162231444, "num_input_tokens_seen": 489611376, "step": 8165, "train_runtime": 105030.9282, "train_tokens_per_second": 4661.592 }, { "epoch": 1.0420918367346939, "grad_norm": 0.6547849325586217, "learning_rate": 4.670651899891043e-06, "loss": 0.26830923557281494, "num_input_tokens_seen": 489908088, "step": 8170, "train_runtime": 105101.5458, "train_tokens_per_second": 4661.283 }, { "epoch": 1.0427295918367347, "grad_norm": 0.7478085413499376, "learning_rate": 4.6656540273042986e-06, "loss": 0.2521498680114746, "num_input_tokens_seen": 490205880, "step": 8175, "train_runtime": 105167.8946, "train_tokens_per_second": 4661.174 }, { "epoch": 1.0433673469387754, "grad_norm": 0.6947748976659139, "learning_rate": 4.66065649025709e-06, "loss": 0.2561060905456543, "num_input_tokens_seen": 490510144, "step": 8180, "train_runtime": 105223.8519, "train_tokens_per_second": 4661.587 }, { "epoch": 1.0440051020408163, "grad_norm": 0.6422039834091763, "learning_rate": 4.655659293764793e-06, "loss": 0.23210339546203612, "num_input_tokens_seen": 490820784, "step": 8185, "train_runtime": 105294.0904, "train_tokens_per_second": 4661.428 }, { "epoch": 1.0446428571428572, "grad_norm": 0.5832399499471925, "learning_rate": 4.6506624428424405e-06, "loss": 0.2376014232635498, "num_input_tokens_seen": 491122776, "step": 8190, "train_runtime": 105363.1273, "train_tokens_per_second": 4661.24 }, { "epoch": 1.0452806122448979, "grad_norm": 0.6015679326644382, "learning_rate": 4.645665942504728e-06, "loss": 0.2396768569946289, "num_input_tokens_seen": 491417992, "step": 8195, "train_runtime": 105417.1187, "train_tokens_per_second": 4661.653 }, { "epoch": 1.0459183673469388, "grad_norm": 0.9163963802550906, "learning_rate": 4.640669797765987e-06, "loss": 0.2639081239700317, "num_input_tokens_seen": 491699496, "step": 8200, "train_runtime": 105476.645, "train_tokens_per_second": 4661.691 }, { "epoch": 1.0465561224489797, "grad_norm": 0.6607861493632479, "learning_rate": 4.6356740136402e-06, "loss": 0.2335533618927002, "num_input_tokens_seen": 492000240, "step": 8205, "train_runtime": 105541.6368, "train_tokens_per_second": 4661.67 }, { "epoch": 1.0471938775510203, "grad_norm": 0.6708484584467924, "learning_rate": 4.630678595140985e-06, "loss": 0.23867573738098144, "num_input_tokens_seen": 492284344, "step": 8210, "train_runtime": 105602.4552, "train_tokens_per_second": 4661.675 }, { "epoch": 1.0478316326530612, "grad_norm": 0.7111724217709186, "learning_rate": 4.625683547281592e-06, "loss": 0.25943105220794677, "num_input_tokens_seen": 492579312, "step": 8215, "train_runtime": 105662.3284, "train_tokens_per_second": 4661.825 }, { "epoch": 1.0484693877551021, "grad_norm": 1.6127182936475108, "learning_rate": 4.620688875074902e-06, "loss": 0.25869834423065186, "num_input_tokens_seen": 492867768, "step": 8220, "train_runtime": 105732.377, "train_tokens_per_second": 4661.465 }, { "epoch": 1.0491071428571428, "grad_norm": 0.616028641947979, "learning_rate": 4.615694583533418e-06, "loss": 0.24853596687316895, "num_input_tokens_seen": 493172160, "step": 8225, "train_runtime": 105806.6879, "train_tokens_per_second": 4661.068 }, { "epoch": 1.0497448979591837, "grad_norm": 0.6369125192979328, "learning_rate": 4.610700677669259e-06, "loss": 0.26491570472717285, "num_input_tokens_seen": 493464224, "step": 8230, "train_runtime": 105879.8915, "train_tokens_per_second": 4660.604 }, { "epoch": 1.0503826530612246, "grad_norm": 0.6476716752501955, "learning_rate": 4.605707162494157e-06, "loss": 0.255249547958374, "num_input_tokens_seen": 493752528, "step": 8235, "train_runtime": 105958.7546, "train_tokens_per_second": 4659.856 }, { "epoch": 1.0510204081632653, "grad_norm": 0.6636453758071511, "learning_rate": 4.600714043019456e-06, "loss": 0.24991931915283203, "num_input_tokens_seen": 494066096, "step": 8240, "train_runtime": 106027.2826, "train_tokens_per_second": 4659.802 }, { "epoch": 1.0516581632653061, "grad_norm": 0.632592406944963, "learning_rate": 4.5957213242560985e-06, "loss": 0.23273146152496338, "num_input_tokens_seen": 494363272, "step": 8245, "train_runtime": 106083.1102, "train_tokens_per_second": 4660.151 }, { "epoch": 1.052295918367347, "grad_norm": 0.6183258733887178, "learning_rate": 4.5907290112146265e-06, "loss": 0.2537068843841553, "num_input_tokens_seen": 494667136, "step": 8250, "train_runtime": 106145.9691, "train_tokens_per_second": 4660.254 }, { "epoch": 1.0529336734693877, "grad_norm": 0.6001141758422646, "learning_rate": 4.585737108905178e-06, "loss": 0.21852438449859618, "num_input_tokens_seen": 494969088, "step": 8255, "train_runtime": 106205.2281, "train_tokens_per_second": 4660.496 }, { "epoch": 1.0535714285714286, "grad_norm": 0.6329533428253195, "learning_rate": 4.5807456223374695e-06, "loss": 0.2435009717941284, "num_input_tokens_seen": 495274640, "step": 8260, "train_runtime": 106258.549, "train_tokens_per_second": 4661.033 }, { "epoch": 1.0542091836734695, "grad_norm": 0.6272827069368175, "learning_rate": 4.57575455652081e-06, "loss": 0.2449747085571289, "num_input_tokens_seen": 495584168, "step": 8265, "train_runtime": 106320.8425, "train_tokens_per_second": 4661.214 }, { "epoch": 1.0548469387755102, "grad_norm": 0.6524770493077416, "learning_rate": 4.570763916464084e-06, "loss": 0.2195876121520996, "num_input_tokens_seen": 495871720, "step": 8270, "train_runtime": 106380.0726, "train_tokens_per_second": 4661.322 }, { "epoch": 1.055484693877551, "grad_norm": 0.6366331214503633, "learning_rate": 4.565773707175743e-06, "loss": 0.2583183526992798, "num_input_tokens_seen": 496157304, "step": 8275, "train_runtime": 106456.4656, "train_tokens_per_second": 4660.659 }, { "epoch": 1.0561224489795917, "grad_norm": 0.6630599897765524, "learning_rate": 4.560783933663814e-06, "loss": 0.25582590103149416, "num_input_tokens_seen": 496441344, "step": 8280, "train_runtime": 106524.8375, "train_tokens_per_second": 4660.334 }, { "epoch": 1.0567602040816326, "grad_norm": 0.6226155958471633, "learning_rate": 4.5557946009358846e-06, "loss": 0.2566941261291504, "num_input_tokens_seen": 496736528, "step": 8285, "train_runtime": 106589.8279, "train_tokens_per_second": 4660.262 }, { "epoch": 1.0573979591836735, "grad_norm": 0.6844929404939469, "learning_rate": 4.550805713999094e-06, "loss": 0.2503832817077637, "num_input_tokens_seen": 497042912, "step": 8290, "train_runtime": 106659.0276, "train_tokens_per_second": 4660.111 }, { "epoch": 1.0580357142857142, "grad_norm": 0.7050648304264016, "learning_rate": 4.545817277860143e-06, "loss": 0.235514497756958, "num_input_tokens_seen": 497334944, "step": 8295, "train_runtime": 106719.115, "train_tokens_per_second": 4660.224 }, { "epoch": 1.058673469387755, "grad_norm": 0.6753001483023913, "learning_rate": 4.540829297525272e-06, "loss": 0.23983364105224608, "num_input_tokens_seen": 497616896, "step": 8300, "train_runtime": 106788.966, "train_tokens_per_second": 4659.816 }, { "epoch": 1.059311224489796, "grad_norm": 0.6633887701073338, "learning_rate": 4.53584177800027e-06, "loss": 0.25391721725463867, "num_input_tokens_seen": 497912912, "step": 8305, "train_runtime": 106851.0031, "train_tokens_per_second": 4659.881 }, { "epoch": 1.0599489795918366, "grad_norm": 0.5993826661676184, "learning_rate": 4.530854724290461e-06, "loss": 0.25507731437683107, "num_input_tokens_seen": 498206496, "step": 8310, "train_runtime": 106919.7773, "train_tokens_per_second": 4659.629 }, { "epoch": 1.0605867346938775, "grad_norm": 0.6662739749912538, "learning_rate": 4.5258681414007005e-06, "loss": 0.2637107133865356, "num_input_tokens_seen": 498507960, "step": 8315, "train_runtime": 106996.7552, "train_tokens_per_second": 4659.094 }, { "epoch": 1.0612244897959184, "grad_norm": 0.5679221404656976, "learning_rate": 4.5208820343353726e-06, "loss": 0.23627259731292724, "num_input_tokens_seen": 498809664, "step": 8320, "train_runtime": 107058.119, "train_tokens_per_second": 4659.242 }, { "epoch": 1.061862244897959, "grad_norm": 0.5786166526952957, "learning_rate": 4.515896408098387e-06, "loss": 0.2349698781967163, "num_input_tokens_seen": 499116280, "step": 8325, "train_runtime": 107119.6699, "train_tokens_per_second": 4659.427 }, { "epoch": 1.0625, "grad_norm": 0.608677092154444, "learning_rate": 4.510911267693164e-06, "loss": 0.2412008285522461, "num_input_tokens_seen": 499411432, "step": 8330, "train_runtime": 107178.991, "train_tokens_per_second": 4659.602 }, { "epoch": 1.063137755102041, "grad_norm": 0.6523443635691932, "learning_rate": 4.505926618122641e-06, "loss": 0.25432002544403076, "num_input_tokens_seen": 499716936, "step": 8335, "train_runtime": 107242.455, "train_tokens_per_second": 4659.693 }, { "epoch": 1.0637755102040816, "grad_norm": 0.6656181552793023, "learning_rate": 4.5009424643892644e-06, "loss": 0.26527795791625974, "num_input_tokens_seen": 500018064, "step": 8340, "train_runtime": 107308.2021, "train_tokens_per_second": 4659.644 }, { "epoch": 1.0644132653061225, "grad_norm": 0.6450333545005282, "learning_rate": 4.4959588114949785e-06, "loss": 0.2552632808685303, "num_input_tokens_seen": 500319952, "step": 8345, "train_runtime": 107373.947, "train_tokens_per_second": 4659.603 }, { "epoch": 1.0650510204081634, "grad_norm": 0.666522284543712, "learning_rate": 4.490975664441227e-06, "loss": 0.2451164960861206, "num_input_tokens_seen": 500615320, "step": 8350, "train_runtime": 107442.4022, "train_tokens_per_second": 4659.383 }, { "epoch": 1.065688775510204, "grad_norm": 0.6475147741320086, "learning_rate": 4.4859930282289475e-06, "loss": 0.24610958099365235, "num_input_tokens_seen": 500903224, "step": 8355, "train_runtime": 107517.8799, "train_tokens_per_second": 4658.79 }, { "epoch": 1.066326530612245, "grad_norm": 0.6512810536661453, "learning_rate": 4.48101090785856e-06, "loss": 0.23372960090637207, "num_input_tokens_seen": 501212080, "step": 8360, "train_runtime": 107574.2447, "train_tokens_per_second": 4659.22 }, { "epoch": 1.0669642857142858, "grad_norm": 0.6692692683844598, "learning_rate": 4.4760293083299736e-06, "loss": 0.2537166833877563, "num_input_tokens_seen": 501513856, "step": 8365, "train_runtime": 107636.0389, "train_tokens_per_second": 4659.349 }, { "epoch": 1.0676020408163265, "grad_norm": 0.6802222357751844, "learning_rate": 4.471048234642572e-06, "loss": 0.27139983177185056, "num_input_tokens_seen": 501825848, "step": 8370, "train_runtime": 107693.3794, "train_tokens_per_second": 4659.765 }, { "epoch": 1.0682397959183674, "grad_norm": 0.6141573801798184, "learning_rate": 4.466067691795208e-06, "loss": 0.24951858520507814, "num_input_tokens_seen": 502135968, "step": 8375, "train_runtime": 107748.9125, "train_tokens_per_second": 4660.242 }, { "epoch": 1.068877551020408, "grad_norm": 0.6770204722988951, "learning_rate": 4.4610876847862034e-06, "loss": 0.26896252632141116, "num_input_tokens_seen": 502434496, "step": 8380, "train_runtime": 107826.2483, "train_tokens_per_second": 4659.668 }, { "epoch": 1.069515306122449, "grad_norm": 0.9004020387442226, "learning_rate": 4.456108218613346e-06, "loss": 0.2850655078887939, "num_input_tokens_seen": 502731136, "step": 8385, "train_runtime": 107897.7267, "train_tokens_per_second": 4659.33 }, { "epoch": 1.0701530612244898, "grad_norm": 0.6583034221887463, "learning_rate": 4.451129298273877e-06, "loss": 0.25475876331329345, "num_input_tokens_seen": 503032912, "step": 8390, "train_runtime": 107949.7713, "train_tokens_per_second": 4659.879 }, { "epoch": 1.0707908163265305, "grad_norm": 0.6430763705170768, "learning_rate": 4.4461509287644885e-06, "loss": 0.24304118156433105, "num_input_tokens_seen": 503329176, "step": 8395, "train_runtime": 108011.0848, "train_tokens_per_second": 4659.977 }, { "epoch": 1.0714285714285714, "grad_norm": 0.5660273995465457, "learning_rate": 4.441173115081327e-06, "loss": 0.24364175796508789, "num_input_tokens_seen": 503632680, "step": 8400, "train_runtime": 108077.8713, "train_tokens_per_second": 4659.906 }, { "epoch": 1.0720663265306123, "grad_norm": 0.6107229313949432, "learning_rate": 4.43619586221997e-06, "loss": 0.25842485427856443, "num_input_tokens_seen": 503947216, "step": 8405, "train_runtime": 108138.3778, "train_tokens_per_second": 4660.207 }, { "epoch": 1.072704081632653, "grad_norm": 0.6144189248574193, "learning_rate": 4.4312191751754415e-06, "loss": 0.22999982833862304, "num_input_tokens_seen": 504248392, "step": 8410, "train_runtime": 108208.4975, "train_tokens_per_second": 4659.97 }, { "epoch": 1.0733418367346939, "grad_norm": 0.6687803146210762, "learning_rate": 4.426243058942196e-06, "loss": 0.2347099542617798, "num_input_tokens_seen": 504557584, "step": 8415, "train_runtime": 108267.1493, "train_tokens_per_second": 4660.302 }, { "epoch": 1.0739795918367347, "grad_norm": 0.5889694346744581, "learning_rate": 4.42126751851411e-06, "loss": 0.22898523807525634, "num_input_tokens_seen": 504857424, "step": 8420, "train_runtime": 108331.0921, "train_tokens_per_second": 4660.319 }, { "epoch": 1.0746173469387754, "grad_norm": 0.6695630492744628, "learning_rate": 4.4162925588844895e-06, "loss": 0.23672561645507811, "num_input_tokens_seen": 505160792, "step": 8425, "train_runtime": 108381.8974, "train_tokens_per_second": 4660.933 }, { "epoch": 1.0752551020408163, "grad_norm": 0.6419046672953492, "learning_rate": 4.4113181850460504e-06, "loss": 0.23820641040802001, "num_input_tokens_seen": 505469544, "step": 8430, "train_runtime": 108461.8041, "train_tokens_per_second": 4660.346 }, { "epoch": 1.0758928571428572, "grad_norm": 0.6564311883698931, "learning_rate": 4.406344401990927e-06, "loss": 0.24784979820251465, "num_input_tokens_seen": 505777952, "step": 8435, "train_runtime": 108526.8087, "train_tokens_per_second": 4660.396 }, { "epoch": 1.0765306122448979, "grad_norm": 0.6302951845203199, "learning_rate": 4.401371214710658e-06, "loss": 0.22909510135650635, "num_input_tokens_seen": 506076848, "step": 8440, "train_runtime": 108587.9026, "train_tokens_per_second": 4660.527 }, { "epoch": 1.0771683673469388, "grad_norm": 0.5525748546668868, "learning_rate": 4.396398628196181e-06, "loss": 0.24703164100646974, "num_input_tokens_seen": 506366536, "step": 8445, "train_runtime": 108664.3182, "train_tokens_per_second": 4659.915 }, { "epoch": 1.0778061224489797, "grad_norm": 0.5892407507277255, "learning_rate": 4.391426647437836e-06, "loss": 0.2493654489517212, "num_input_tokens_seen": 506671088, "step": 8450, "train_runtime": 108725.6082, "train_tokens_per_second": 4660.09 }, { "epoch": 1.0784438775510203, "grad_norm": 0.6858416107099327, "learning_rate": 4.386455277425355e-06, "loss": 0.23719313144683837, "num_input_tokens_seen": 506968520, "step": 8455, "train_runtime": 108795.0967, "train_tokens_per_second": 4659.847 }, { "epoch": 1.0790816326530612, "grad_norm": 0.6341771851077849, "learning_rate": 4.381484523147852e-06, "loss": 0.26437945365905763, "num_input_tokens_seen": 507268616, "step": 8460, "train_runtime": 108860.8914, "train_tokens_per_second": 4659.787 }, { "epoch": 1.0797193877551021, "grad_norm": 0.6230770952175335, "learning_rate": 4.376514389593827e-06, "loss": 0.25137033462524416, "num_input_tokens_seen": 507566088, "step": 8465, "train_runtime": 108928.4265, "train_tokens_per_second": 4659.629 }, { "epoch": 1.0803571428571428, "grad_norm": 0.6903878203003238, "learning_rate": 4.3715448817511565e-06, "loss": 0.2370760917663574, "num_input_tokens_seen": 507883104, "step": 8470, "train_runtime": 109000.8963, "train_tokens_per_second": 4659.44 }, { "epoch": 1.0809948979591837, "grad_norm": 0.5973717072526464, "learning_rate": 4.3665760046070885e-06, "loss": 0.23699584007263183, "num_input_tokens_seen": 508188696, "step": 8475, "train_runtime": 109065.5472, "train_tokens_per_second": 4659.48 }, { "epoch": 1.0816326530612246, "grad_norm": 0.5788254959377019, "learning_rate": 4.361607763148236e-06, "loss": 0.22778549194335937, "num_input_tokens_seen": 508495216, "step": 8480, "train_runtime": 109122.4298, "train_tokens_per_second": 4659.86 }, { "epoch": 1.0822704081632653, "grad_norm": 0.6916897496545412, "learning_rate": 4.356640162360582e-06, "loss": 0.2446908950805664, "num_input_tokens_seen": 508782408, "step": 8485, "train_runtime": 109183.7869, "train_tokens_per_second": 4659.871 }, { "epoch": 1.0829081632653061, "grad_norm": 0.5857273313626739, "learning_rate": 4.3516732072294545e-06, "loss": 0.2512369155883789, "num_input_tokens_seen": 509096616, "step": 8490, "train_runtime": 109240.8955, "train_tokens_per_second": 4660.312 }, { "epoch": 1.083545918367347, "grad_norm": 0.6386722073991092, "learning_rate": 4.346706902739544e-06, "loss": 0.25554609298706055, "num_input_tokens_seen": 509395648, "step": 8495, "train_runtime": 109295.429, "train_tokens_per_second": 4660.722 }, { "epoch": 1.0841836734693877, "grad_norm": 0.6861412852364408, "learning_rate": 4.3417412538748824e-06, "loss": 0.24098649024963378, "num_input_tokens_seen": 509699320, "step": 8500, "train_runtime": 109351.0394, "train_tokens_per_second": 4661.129 }, { "epoch": 1.0848214285714286, "grad_norm": 0.6072046279238779, "learning_rate": 4.336776265618844e-06, "loss": 0.2599900722503662, "num_input_tokens_seen": 510003248, "step": 8505, "train_runtime": 109425.0831, "train_tokens_per_second": 4660.753 }, { "epoch": 1.0854591836734695, "grad_norm": 0.8551260945967675, "learning_rate": 4.331811942954143e-06, "loss": 0.2413041114807129, "num_input_tokens_seen": 510278912, "step": 8510, "train_runtime": 109487.242, "train_tokens_per_second": 4660.624 }, { "epoch": 1.0860969387755102, "grad_norm": 0.6659236914285106, "learning_rate": 4.3268482908628245e-06, "loss": 0.24942457675933838, "num_input_tokens_seen": 510580200, "step": 8515, "train_runtime": 109554.1565, "train_tokens_per_second": 4660.528 }, { "epoch": 1.086734693877551, "grad_norm": 0.7739805326763189, "learning_rate": 4.321885314326258e-06, "loss": 0.2388164758682251, "num_input_tokens_seen": 510883392, "step": 8520, "train_runtime": 109611.0834, "train_tokens_per_second": 4660.873 }, { "epoch": 1.087372448979592, "grad_norm": 0.6225166331507451, "learning_rate": 4.316923018325137e-06, "loss": 0.22586362361907958, "num_input_tokens_seen": 511191600, "step": 8525, "train_runtime": 109666.9653, "train_tokens_per_second": 4661.309 }, { "epoch": 1.0880102040816326, "grad_norm": 0.6413617564403306, "learning_rate": 4.3119614078394756e-06, "loss": 0.23577985763549805, "num_input_tokens_seen": 511484384, "step": 8530, "train_runtime": 109728.3426, "train_tokens_per_second": 4661.37 }, { "epoch": 1.0886479591836735, "grad_norm": 0.6235517419524493, "learning_rate": 4.3070004878485925e-06, "loss": 0.24158282279968263, "num_input_tokens_seen": 511784280, "step": 8535, "train_runtime": 109799.3159, "train_tokens_per_second": 4661.088 }, { "epoch": 1.0892857142857142, "grad_norm": 0.5865082138653116, "learning_rate": 4.30204026333112e-06, "loss": 0.2610388994216919, "num_input_tokens_seen": 512085792, "step": 8540, "train_runtime": 109858.7028, "train_tokens_per_second": 4661.313 }, { "epoch": 1.089923469387755, "grad_norm": 0.6053085239154334, "learning_rate": 4.297080739264987e-06, "loss": 0.2202895164489746, "num_input_tokens_seen": 512393920, "step": 8545, "train_runtime": 109920.9462, "train_tokens_per_second": 4661.477 }, { "epoch": 1.090561224489796, "grad_norm": 0.7097943296568763, "learning_rate": 4.292121920627423e-06, "loss": 0.25112998485565186, "num_input_tokens_seen": 512688592, "step": 8550, "train_runtime": 109996.2003, "train_tokens_per_second": 4660.966 }, { "epoch": 1.0911989795918366, "grad_norm": 0.6153079940819608, "learning_rate": 4.287163812394952e-06, "loss": 0.22177939414978026, "num_input_tokens_seen": 512992664, "step": 8555, "train_runtime": 110064.6268, "train_tokens_per_second": 4660.831 }, { "epoch": 1.0918367346938775, "grad_norm": 0.6422902413039913, "learning_rate": 4.282206419543379e-06, "loss": 0.24580161571502684, "num_input_tokens_seen": 513292160, "step": 8560, "train_runtime": 110142.0474, "train_tokens_per_second": 4660.274 }, { "epoch": 1.0924744897959184, "grad_norm": 0.784318111678597, "learning_rate": 4.2772497470477934e-06, "loss": 0.2570383071899414, "num_input_tokens_seen": 513580216, "step": 8565, "train_runtime": 110201.4713, "train_tokens_per_second": 4660.375 }, { "epoch": 1.093112244897959, "grad_norm": 0.57623539824992, "learning_rate": 4.272293799882565e-06, "loss": 0.2587752342224121, "num_input_tokens_seen": 513887568, "step": 8570, "train_runtime": 110261.4572, "train_tokens_per_second": 4660.627 }, { "epoch": 1.09375, "grad_norm": 0.6942732863649478, "learning_rate": 4.267338583021331e-06, "loss": 0.24844789505004883, "num_input_tokens_seen": 514190592, "step": 8575, "train_runtime": 110327.7734, "train_tokens_per_second": 4660.573 }, { "epoch": 1.094387755102041, "grad_norm": 0.6538682735284778, "learning_rate": 4.262384101436997e-06, "loss": 0.24650192260742188, "num_input_tokens_seen": 514502072, "step": 8580, "train_runtime": 110385.3433, "train_tokens_per_second": 4660.964 }, { "epoch": 1.0950255102040816, "grad_norm": 0.6069131663138339, "learning_rate": 4.257430360101734e-06, "loss": 0.2545419454574585, "num_input_tokens_seen": 514818112, "step": 8585, "train_runtime": 110457.489, "train_tokens_per_second": 4660.781 }, { "epoch": 1.0956632653061225, "grad_norm": 0.5788914544539152, "learning_rate": 4.252477363986963e-06, "loss": 0.2407358169555664, "num_input_tokens_seen": 515124544, "step": 8590, "train_runtime": 110529.3895, "train_tokens_per_second": 4660.521 }, { "epoch": 1.0963010204081634, "grad_norm": 0.8910302050946797, "learning_rate": 4.247525118063366e-06, "loss": 0.24895682334899902, "num_input_tokens_seen": 515425744, "step": 8595, "train_runtime": 110593.7547, "train_tokens_per_second": 4660.532 }, { "epoch": 1.096938775510204, "grad_norm": 0.6594975719339832, "learning_rate": 4.242573627300866e-06, "loss": 0.2434098243713379, "num_input_tokens_seen": 515739952, "step": 8600, "train_runtime": 110652.9106, "train_tokens_per_second": 4660.88 }, { "epoch": 1.097576530612245, "grad_norm": 0.7240782170388725, "learning_rate": 4.237622896668628e-06, "loss": 0.23852176666259767, "num_input_tokens_seen": 516034008, "step": 8605, "train_runtime": 110709.3234, "train_tokens_per_second": 4661.161 }, { "epoch": 1.0982142857142858, "grad_norm": 0.6637953558110109, "learning_rate": 4.232672931135058e-06, "loss": 0.24601476192474364, "num_input_tokens_seen": 516328520, "step": 8610, "train_runtime": 110768.3536, "train_tokens_per_second": 4661.336 }, { "epoch": 1.0988520408163265, "grad_norm": 0.6789934166654039, "learning_rate": 4.227723735667793e-06, "loss": 0.2546565532684326, "num_input_tokens_seen": 516627344, "step": 8615, "train_runtime": 110834.7893, "train_tokens_per_second": 4661.238 }, { "epoch": 1.0994897959183674, "grad_norm": 0.6743180358260381, "learning_rate": 4.222775315233693e-06, "loss": 0.2450329303741455, "num_input_tokens_seen": 516926536, "step": 8620, "train_runtime": 110891.3765, "train_tokens_per_second": 4661.558 }, { "epoch": 1.100127551020408, "grad_norm": 0.6819867044598046, "learning_rate": 4.217827674798845e-06, "loss": 0.2333766460418701, "num_input_tokens_seen": 517208032, "step": 8625, "train_runtime": 110960.744, "train_tokens_per_second": 4661.18 }, { "epoch": 1.100765306122449, "grad_norm": 0.661119390373851, "learning_rate": 4.2128808193285555e-06, "loss": 0.25281786918640137, "num_input_tokens_seen": 517511480, "step": 8630, "train_runtime": 111018.3836, "train_tokens_per_second": 4661.494 }, { "epoch": 1.1014030612244898, "grad_norm": 0.6292791859153245, "learning_rate": 4.2079347537873325e-06, "loss": 0.25015289783477784, "num_input_tokens_seen": 517806768, "step": 8635, "train_runtime": 111074.1525, "train_tokens_per_second": 4661.812 }, { "epoch": 1.1020408163265305, "grad_norm": 0.560281951568524, "learning_rate": 4.2029894831389036e-06, "loss": 0.23009247779846193, "num_input_tokens_seen": 518107424, "step": 8640, "train_runtime": 111145.3314, "train_tokens_per_second": 4661.531 }, { "epoch": 1.1026785714285714, "grad_norm": 0.6251386010444134, "learning_rate": 4.198045012346192e-06, "loss": 0.24771604537963868, "num_input_tokens_seen": 518414256, "step": 8645, "train_runtime": 111210.8146, "train_tokens_per_second": 4661.545 }, { "epoch": 1.1033163265306123, "grad_norm": 0.7705113770677164, "learning_rate": 4.1931013463713165e-06, "loss": 0.259547758102417, "num_input_tokens_seen": 518702976, "step": 8650, "train_runtime": 111275.476, "train_tokens_per_second": 4661.431 }, { "epoch": 1.103954081632653, "grad_norm": 0.7054425512566621, "learning_rate": 4.188158490175596e-06, "loss": 0.22324018478393554, "num_input_tokens_seen": 519006576, "step": 8655, "train_runtime": 111332.1181, "train_tokens_per_second": 4661.787 }, { "epoch": 1.1045918367346939, "grad_norm": 0.6464946280216061, "learning_rate": 4.1832164487195295e-06, "loss": 0.26404922008514403, "num_input_tokens_seen": 519322336, "step": 8660, "train_runtime": 111406.9787, "train_tokens_per_second": 4661.488 }, { "epoch": 1.1052295918367347, "grad_norm": 0.635481471424389, "learning_rate": 4.1782752269627995e-06, "loss": 0.23730854988098143, "num_input_tokens_seen": 519620848, "step": 8665, "train_runtime": 111476.8516, "train_tokens_per_second": 4661.244 }, { "epoch": 1.1058673469387754, "grad_norm": 0.7693134141834581, "learning_rate": 4.17333482986427e-06, "loss": 0.2592004776000977, "num_input_tokens_seen": 519931392, "step": 8670, "train_runtime": 111549.1729, "train_tokens_per_second": 4661.006 }, { "epoch": 1.1065051020408163, "grad_norm": 0.5766353405067196, "learning_rate": 4.16839526238197e-06, "loss": 0.22901449203491211, "num_input_tokens_seen": 520241504, "step": 8675, "train_runtime": 111604.5074, "train_tokens_per_second": 4661.474 }, { "epoch": 1.1071428571428572, "grad_norm": 0.639494213084661, "learning_rate": 4.1634565294731045e-06, "loss": 0.25211329460144044, "num_input_tokens_seen": 520539736, "step": 8680, "train_runtime": 111660.078, "train_tokens_per_second": 4661.825 }, { "epoch": 1.1077806122448979, "grad_norm": 0.5700841107449708, "learning_rate": 4.158518636094037e-06, "loss": 0.24518826007843017, "num_input_tokens_seen": 520837320, "step": 8685, "train_runtime": 111716.1387, "train_tokens_per_second": 4662.149 }, { "epoch": 1.1084183673469388, "grad_norm": 0.5718162723588303, "learning_rate": 4.153581587200287e-06, "loss": 0.2576592922210693, "num_input_tokens_seen": 521140296, "step": 8690, "train_runtime": 111769.3873, "train_tokens_per_second": 4662.639 }, { "epoch": 1.1090561224489797, "grad_norm": 0.6218159544464157, "learning_rate": 4.148645387746526e-06, "loss": 0.2505445718765259, "num_input_tokens_seen": 521443008, "step": 8695, "train_runtime": 111821.7977, "train_tokens_per_second": 4663.161 }, { "epoch": 1.1096938775510203, "grad_norm": 0.6813986888146172, "learning_rate": 4.143710042686579e-06, "loss": 0.2475372314453125, "num_input_tokens_seen": 521750504, "step": 8700, "train_runtime": 111878.6859, "train_tokens_per_second": 4663.538 }, { "epoch": 1.1103316326530612, "grad_norm": 0.6058288226100228, "learning_rate": 4.138775556973406e-06, "loss": 0.26158604621887205, "num_input_tokens_seen": 522030912, "step": 8705, "train_runtime": 111942.0057, "train_tokens_per_second": 4663.405 }, { "epoch": 1.1109693877551021, "grad_norm": 0.6904469086085062, "learning_rate": 4.133841935559109e-06, "loss": 0.26089537143707275, "num_input_tokens_seen": 522323992, "step": 8710, "train_runtime": 112004.2566, "train_tokens_per_second": 4663.43 }, { "epoch": 1.1116071428571428, "grad_norm": 0.6707493974163103, "learning_rate": 4.1289091833949235e-06, "loss": 0.25034823417663576, "num_input_tokens_seen": 522620576, "step": 8715, "train_runtime": 112066.0083, "train_tokens_per_second": 4663.507 }, { "epoch": 1.1122448979591837, "grad_norm": 0.6948665945679124, "learning_rate": 4.123977305431209e-06, "loss": 0.22675719261169433, "num_input_tokens_seen": 522909792, "step": 8720, "train_runtime": 112138.3084, "train_tokens_per_second": 4663.079 }, { "epoch": 1.1128826530612246, "grad_norm": 0.653997402260834, "learning_rate": 4.119046306617449e-06, "loss": 0.23716330528259277, "num_input_tokens_seen": 523206376, "step": 8725, "train_runtime": 112199.7623, "train_tokens_per_second": 4663.168 }, { "epoch": 1.1135204081632653, "grad_norm": 0.6347530765050445, "learning_rate": 4.114116191902248e-06, "loss": 0.24915711879730223, "num_input_tokens_seen": 523516496, "step": 8730, "train_runtime": 112261.3015, "train_tokens_per_second": 4663.375 }, { "epoch": 1.1141581632653061, "grad_norm": 0.699603284516342, "learning_rate": 4.109186966233315e-06, "loss": 0.2517080545425415, "num_input_tokens_seen": 523824840, "step": 8735, "train_runtime": 112330.128, "train_tokens_per_second": 4663.262 }, { "epoch": 1.114795918367347, "grad_norm": 0.6011570474960909, "learning_rate": 4.104258634557478e-06, "loss": 0.24463653564453125, "num_input_tokens_seen": 524126296, "step": 8740, "train_runtime": 112390.756, "train_tokens_per_second": 4663.429 }, { "epoch": 1.1154336734693877, "grad_norm": 0.8184521177672255, "learning_rate": 4.09933120182066e-06, "loss": 0.23126814365386963, "num_input_tokens_seen": 524421360, "step": 8745, "train_runtime": 112462.0875, "train_tokens_per_second": 4663.095 }, { "epoch": 1.1160714285714286, "grad_norm": 0.7711043543729131, "learning_rate": 4.094404672967882e-06, "loss": 0.23586022853851318, "num_input_tokens_seen": 524712216, "step": 8750, "train_runtime": 112531.4826, "train_tokens_per_second": 4662.804 }, { "epoch": 1.1167091836734695, "grad_norm": 0.569997286888262, "learning_rate": 4.089479052943261e-06, "loss": 0.23141369819641114, "num_input_tokens_seen": 525016712, "step": 8755, "train_runtime": 112589.8613, "train_tokens_per_second": 4663.09 }, { "epoch": 1.1173469387755102, "grad_norm": 0.6029928288031483, "learning_rate": 4.084554346690003e-06, "loss": 0.25970346927642823, "num_input_tokens_seen": 525305040, "step": 8760, "train_runtime": 112656.111, "train_tokens_per_second": 4662.908 }, { "epoch": 1.117984693877551, "grad_norm": 0.6589543488231843, "learning_rate": 4.079630559150392e-06, "loss": 0.24691288471221923, "num_input_tokens_seen": 525586784, "step": 8765, "train_runtime": 112723.6392, "train_tokens_per_second": 4662.614 }, { "epoch": 1.118622448979592, "grad_norm": 0.61521781871156, "learning_rate": 4.074707695265792e-06, "loss": 0.2508359909057617, "num_input_tokens_seen": 525891264, "step": 8770, "train_runtime": 112787.6434, "train_tokens_per_second": 4662.667 }, { "epoch": 1.1192602040816326, "grad_norm": 0.6420620386451169, "learning_rate": 4.069785759976645e-06, "loss": 0.24450926780700682, "num_input_tokens_seen": 526189544, "step": 8775, "train_runtime": 112843.4565, "train_tokens_per_second": 4663.004 }, { "epoch": 1.1198979591836735, "grad_norm": 0.841776634817563, "learning_rate": 4.0648647582224504e-06, "loss": 0.2408369541168213, "num_input_tokens_seen": 526488680, "step": 8780, "train_runtime": 112902.7282, "train_tokens_per_second": 4663.206 }, { "epoch": 1.1205357142857142, "grad_norm": 0.6045633595489134, "learning_rate": 4.059944694941783e-06, "loss": 0.22510142326354982, "num_input_tokens_seen": 526800512, "step": 8785, "train_runtime": 112958.7177, "train_tokens_per_second": 4663.655 }, { "epoch": 1.121173469387755, "grad_norm": 0.6776121769528503, "learning_rate": 4.0550255750722674e-06, "loss": 0.24085683822631837, "num_input_tokens_seen": 527107496, "step": 8790, "train_runtime": 113032.7839, "train_tokens_per_second": 4663.315 }, { "epoch": 1.121811224489796, "grad_norm": 0.6049770917730501, "learning_rate": 4.050107403550582e-06, "loss": 0.2417008876800537, "num_input_tokens_seen": 527399464, "step": 8795, "train_runtime": 113098.9307, "train_tokens_per_second": 4663.169 }, { "epoch": 1.1224489795918366, "grad_norm": 0.6695859870368668, "learning_rate": 4.0451901853124596e-06, "loss": 0.24154107570648192, "num_input_tokens_seen": 527709368, "step": 8800, "train_runtime": 113158.2587, "train_tokens_per_second": 4663.463 }, { "epoch": 1.1230867346938775, "grad_norm": 0.6085742985049531, "learning_rate": 4.04027392529267e-06, "loss": 0.2165979862213135, "num_input_tokens_seen": 528015248, "step": 8805, "train_runtime": 113222.2721, "train_tokens_per_second": 4663.528 }, { "epoch": 1.1237244897959184, "grad_norm": 0.7926317096607808, "learning_rate": 4.035358628425022e-06, "loss": 0.2610020637512207, "num_input_tokens_seen": 528302576, "step": 8810, "train_runtime": 113289.0832, "train_tokens_per_second": 4663.314 }, { "epoch": 1.124362244897959, "grad_norm": 0.6610127980447489, "learning_rate": 4.030444299642363e-06, "loss": 0.2666980743408203, "num_input_tokens_seen": 528610872, "step": 8815, "train_runtime": 113353.9008, "train_tokens_per_second": 4663.367 }, { "epoch": 1.125, "grad_norm": 0.6486416535490288, "learning_rate": 4.02553094387656e-06, "loss": 0.27113239765167235, "num_input_tokens_seen": 528897960, "step": 8820, "train_runtime": 113414.262, "train_tokens_per_second": 4663.417 }, { "epoch": 1.125637755102041, "grad_norm": 0.6527299179917347, "learning_rate": 4.020618566058514e-06, "loss": 0.23246688842773439, "num_input_tokens_seen": 529217848, "step": 8825, "train_runtime": 113477.6125, "train_tokens_per_second": 4663.632 }, { "epoch": 1.1262755102040816, "grad_norm": 0.6086829460001116, "learning_rate": 4.015707171118136e-06, "loss": 0.24707884788513185, "num_input_tokens_seen": 529527624, "step": 8830, "train_runtime": 113545.3715, "train_tokens_per_second": 4663.577 }, { "epoch": 1.1269132653061225, "grad_norm": 0.6135742903501101, "learning_rate": 4.010796763984355e-06, "loss": 0.2489476203918457, "num_input_tokens_seen": 529838424, "step": 8835, "train_runtime": 113616.4467, "train_tokens_per_second": 4663.395 }, { "epoch": 1.1275510204081634, "grad_norm": 0.6258624758361515, "learning_rate": 4.005887349585106e-06, "loss": 0.24770126342773438, "num_input_tokens_seen": 530131984, "step": 8840, "train_runtime": 113690.7991, "train_tokens_per_second": 4662.928 }, { "epoch": 1.128188775510204, "grad_norm": 0.6462539060419881, "learning_rate": 4.000978932847332e-06, "loss": 0.2586657047271729, "num_input_tokens_seen": 530430848, "step": 8845, "train_runtime": 113753.3411, "train_tokens_per_second": 4662.991 }, { "epoch": 1.128826530612245, "grad_norm": 0.560858907102757, "learning_rate": 3.996071518696969e-06, "loss": 0.24396800994873047, "num_input_tokens_seen": 530739048, "step": 8850, "train_runtime": 113807.1722, "train_tokens_per_second": 4663.494 }, { "epoch": 1.1294642857142858, "grad_norm": 0.678900867275871, "learning_rate": 3.99116511205895e-06, "loss": 0.2503016471862793, "num_input_tokens_seen": 531036064, "step": 8855, "train_runtime": 113864.5592, "train_tokens_per_second": 4663.752 }, { "epoch": 1.1301020408163265, "grad_norm": 0.6501528824998741, "learning_rate": 3.986259717857201e-06, "loss": 0.2325228452682495, "num_input_tokens_seen": 531345072, "step": 8860, "train_runtime": 113926.8569, "train_tokens_per_second": 4663.914 }, { "epoch": 1.1307397959183674, "grad_norm": 0.6719603416085055, "learning_rate": 3.9813553410146225e-06, "loss": 0.2344541072845459, "num_input_tokens_seen": 531640184, "step": 8865, "train_runtime": 113993.78, "train_tokens_per_second": 4663.765 }, { "epoch": 1.131377551020408, "grad_norm": 0.5983287801634353, "learning_rate": 3.9764519864531026e-06, "loss": 0.24439842700958253, "num_input_tokens_seen": 531936528, "step": 8870, "train_runtime": 114068.0639, "train_tokens_per_second": 4663.326 }, { "epoch": 1.132015306122449, "grad_norm": 0.5993162683759906, "learning_rate": 3.971549659093499e-06, "loss": 0.23204846382141114, "num_input_tokens_seen": 532227288, "step": 8875, "train_runtime": 114132.6913, "train_tokens_per_second": 4663.233 }, { "epoch": 1.1326530612244898, "grad_norm": 0.5948447703546732, "learning_rate": 3.966648363855637e-06, "loss": 0.2498317003250122, "num_input_tokens_seen": 532531048, "step": 8880, "train_runtime": 114189.1418, "train_tokens_per_second": 4663.587 }, { "epoch": 1.1332908163265305, "grad_norm": 0.6109721055890992, "learning_rate": 3.961748105658312e-06, "loss": 0.24610438346862792, "num_input_tokens_seen": 532823672, "step": 8885, "train_runtime": 114253.6052, "train_tokens_per_second": 4663.517 }, { "epoch": 1.1339285714285714, "grad_norm": 0.5863524541777505, "learning_rate": 3.956848889419276e-06, "loss": 0.25118041038513184, "num_input_tokens_seen": 533133984, "step": 8890, "train_runtime": 114322.7721, "train_tokens_per_second": 4663.41 }, { "epoch": 1.1345663265306123, "grad_norm": 0.6698500360829401, "learning_rate": 3.951950720055231e-06, "loss": 0.2555887222290039, "num_input_tokens_seen": 533425512, "step": 8895, "train_runtime": 114378.8561, "train_tokens_per_second": 4663.672 }, { "epoch": 1.135204081632653, "grad_norm": 0.7470990401150549, "learning_rate": 3.947053602481834e-06, "loss": 0.24155745506286622, "num_input_tokens_seen": 533722200, "step": 8900, "train_runtime": 114430.3179, "train_tokens_per_second": 4664.168 }, { "epoch": 1.1358418367346939, "grad_norm": 0.5784733966288881, "learning_rate": 3.9421575416136866e-06, "loss": 0.251849889755249, "num_input_tokens_seen": 534014344, "step": 8905, "train_runtime": 114491.7871, "train_tokens_per_second": 4664.215 }, { "epoch": 1.1364795918367347, "grad_norm": 0.6426342730063402, "learning_rate": 3.937262542364324e-06, "loss": 0.24389877319335937, "num_input_tokens_seen": 534309280, "step": 8910, "train_runtime": 114556.6863, "train_tokens_per_second": 4664.147 }, { "epoch": 1.1371173469387754, "grad_norm": 0.6184032214831218, "learning_rate": 3.932368609646223e-06, "loss": 0.23805222511291504, "num_input_tokens_seen": 534611264, "step": 8915, "train_runtime": 114623.8185, "train_tokens_per_second": 4664.05 }, { "epoch": 1.1377551020408163, "grad_norm": 0.6955281150748618, "learning_rate": 3.927475748370784e-06, "loss": 0.24289226531982422, "num_input_tokens_seen": 534911912, "step": 8920, "train_runtime": 114694.9732, "train_tokens_per_second": 4663.778 }, { "epoch": 1.1383928571428572, "grad_norm": 0.6444689763555554, "learning_rate": 3.922583963448336e-06, "loss": 0.2645781755447388, "num_input_tokens_seen": 535221712, "step": 8925, "train_runtime": 114754.4892, "train_tokens_per_second": 4664.059 }, { "epoch": 1.1390306122448979, "grad_norm": 0.7044417930873609, "learning_rate": 3.9176932597881286e-06, "loss": 0.26086721420288084, "num_input_tokens_seen": 535523032, "step": 8930, "train_runtime": 114819.8863, "train_tokens_per_second": 4664.027 }, { "epoch": 1.1396683673469388, "grad_norm": 0.7011005108852735, "learning_rate": 3.912803642298323e-06, "loss": 0.23372416496276854, "num_input_tokens_seen": 535814944, "step": 8935, "train_runtime": 114878.2483, "train_tokens_per_second": 4664.198 }, { "epoch": 1.1403061224489797, "grad_norm": 0.6347562665809505, "learning_rate": 3.90791511588599e-06, "loss": 0.25880999565124513, "num_input_tokens_seen": 536124032, "step": 8940, "train_runtime": 114946.6072, "train_tokens_per_second": 4664.114 }, { "epoch": 1.1409438775510203, "grad_norm": 0.6599876980833477, "learning_rate": 3.903027685457112e-06, "loss": 0.2445706844329834, "num_input_tokens_seen": 536418776, "step": 8945, "train_runtime": 115001.4023, "train_tokens_per_second": 4664.454 }, { "epoch": 1.1415816326530612, "grad_norm": 0.62710591246252, "learning_rate": 3.898141355916563e-06, "loss": 0.24156970977783204, "num_input_tokens_seen": 536713192, "step": 8950, "train_runtime": 115071.1806, "train_tokens_per_second": 4664.184 }, { "epoch": 1.1422193877551021, "grad_norm": 0.5594054910943858, "learning_rate": 3.893256132168117e-06, "loss": 0.22762279510498046, "num_input_tokens_seen": 537018000, "step": 8955, "train_runtime": 115137.7132, "train_tokens_per_second": 4664.136 }, { "epoch": 1.1428571428571428, "grad_norm": 0.6018653801349356, "learning_rate": 3.888372019114438e-06, "loss": 0.22532968521118163, "num_input_tokens_seen": 537291952, "step": 8960, "train_runtime": 115208.1882, "train_tokens_per_second": 4663.661 }, { "epoch": 1.1434948979591837, "grad_norm": 0.6906651665295294, "learning_rate": 3.8834890216570715e-06, "loss": 0.2603922367095947, "num_input_tokens_seen": 537589832, "step": 8965, "train_runtime": 115273.4421, "train_tokens_per_second": 4663.605 }, { "epoch": 1.1441326530612246, "grad_norm": 0.6358963163709775, "learning_rate": 3.878607144696449e-06, "loss": 0.24374897480010987, "num_input_tokens_seen": 537890624, "step": 8970, "train_runtime": 115346.5018, "train_tokens_per_second": 4663.259 }, { "epoch": 1.1447704081632653, "grad_norm": 0.6534673080564684, "learning_rate": 3.873726393131877e-06, "loss": 0.23672876358032227, "num_input_tokens_seen": 538188488, "step": 8975, "train_runtime": 115414.0543, "train_tokens_per_second": 4663.11 }, { "epoch": 1.1454081632653061, "grad_norm": 0.6379043559718519, "learning_rate": 3.868846771861528e-06, "loss": 0.2526662349700928, "num_input_tokens_seen": 538473736, "step": 8980, "train_runtime": 115472.0993, "train_tokens_per_second": 4663.237 }, { "epoch": 1.146045918367347, "grad_norm": 0.587786521523755, "learning_rate": 3.86396828578244e-06, "loss": 0.24660902023315429, "num_input_tokens_seen": 538782264, "step": 8985, "train_runtime": 115520.9504, "train_tokens_per_second": 4663.936 }, { "epoch": 1.1466836734693877, "grad_norm": 0.6518577329012045, "learning_rate": 3.859090939790521e-06, "loss": 0.23081755638122559, "num_input_tokens_seen": 539065056, "step": 8990, "train_runtime": 115588.1693, "train_tokens_per_second": 4663.67 }, { "epoch": 1.1473214285714286, "grad_norm": 0.6217135552266576, "learning_rate": 3.854214738780523e-06, "loss": 0.24677810668945313, "num_input_tokens_seen": 539369512, "step": 8995, "train_runtime": 115655.3494, "train_tokens_per_second": 4663.593 }, { "epoch": 1.1479591836734695, "grad_norm": 0.7097649318957695, "learning_rate": 3.849339687646055e-06, "loss": 0.27447986602783203, "num_input_tokens_seen": 539667064, "step": 9000, "train_runtime": 115716.9333, "train_tokens_per_second": 4663.683 }, { "epoch": 1.1485969387755102, "grad_norm": 0.7626611740955035, "learning_rate": 3.844465791279575e-06, "loss": 0.2431164026260376, "num_input_tokens_seen": 539955840, "step": 9005, "train_runtime": 115771.4757, "train_tokens_per_second": 4663.98 }, { "epoch": 1.149234693877551, "grad_norm": 0.635715227930441, "learning_rate": 3.839593054572374e-06, "loss": 0.2344665050506592, "num_input_tokens_seen": 540259608, "step": 9010, "train_runtime": 115828.3342, "train_tokens_per_second": 4664.313 }, { "epoch": 1.149872448979592, "grad_norm": 0.6741538632282347, "learning_rate": 3.834721482414586e-06, "loss": 0.24207234382629395, "num_input_tokens_seen": 540556576, "step": 9015, "train_runtime": 115892.5665, "train_tokens_per_second": 4664.29 }, { "epoch": 1.1505102040816326, "grad_norm": 0.6822093729956156, "learning_rate": 3.829851079695174e-06, "loss": 0.2660356044769287, "num_input_tokens_seen": 540862224, "step": 9020, "train_runtime": 115963.4675, "train_tokens_per_second": 4664.074 }, { "epoch": 1.1511479591836735, "grad_norm": 0.5855754212435335, "learning_rate": 3.824981851301924e-06, "loss": 0.2310089111328125, "num_input_tokens_seen": 541175464, "step": 9025, "train_runtime": 116025.638, "train_tokens_per_second": 4664.275 }, { "epoch": 1.1517857142857142, "grad_norm": 0.7456571687236758, "learning_rate": 3.820113802121453e-06, "loss": 0.23663051128387452, "num_input_tokens_seen": 541462456, "step": 9030, "train_runtime": 116100.1959, "train_tokens_per_second": 4663.751 }, { "epoch": 1.152423469387755, "grad_norm": 0.5594020174254829, "learning_rate": 3.815246937039182e-06, "loss": 0.22132573127746583, "num_input_tokens_seen": 541753776, "step": 9035, "train_runtime": 116166.2489, "train_tokens_per_second": 4663.607 }, { "epoch": 1.153061224489796, "grad_norm": 0.694202489015025, "learning_rate": 3.810381260939354e-06, "loss": 0.2147247314453125, "num_input_tokens_seen": 542054880, "step": 9040, "train_runtime": 116225.5582, "train_tokens_per_second": 4663.818 }, { "epoch": 1.1536989795918366, "grad_norm": 0.6691855742024077, "learning_rate": 3.8055167787050134e-06, "loss": 0.2462533950805664, "num_input_tokens_seen": 542359544, "step": 9045, "train_runtime": 116296.6266, "train_tokens_per_second": 4663.588 }, { "epoch": 1.1543367346938775, "grad_norm": 0.6256484008561468, "learning_rate": 3.8006534952180062e-06, "loss": 0.24401683807373048, "num_input_tokens_seen": 542659152, "step": 9050, "train_runtime": 116359.1845, "train_tokens_per_second": 4663.656 }, { "epoch": 1.1549744897959184, "grad_norm": 0.6430972241200976, "learning_rate": 3.79579141535898e-06, "loss": 0.24500937461853028, "num_input_tokens_seen": 542942632, "step": 9055, "train_runtime": 116422.6336, "train_tokens_per_second": 4663.549 }, { "epoch": 1.155612244897959, "grad_norm": 0.5955060538312635, "learning_rate": 3.7909305440073707e-06, "loss": 0.24865365028381348, "num_input_tokens_seen": 543240272, "step": 9060, "train_runtime": 116478.2095, "train_tokens_per_second": 4663.879 }, { "epoch": 1.15625, "grad_norm": 0.6177609398095152, "learning_rate": 3.786070886041401e-06, "loss": 0.22608916759490966, "num_input_tokens_seen": 543538488, "step": 9065, "train_runtime": 116542.1808, "train_tokens_per_second": 4663.878 }, { "epoch": 1.156887755102041, "grad_norm": 0.6200387597458965, "learning_rate": 3.7812124463380766e-06, "loss": 0.24038472175598144, "num_input_tokens_seen": 543834648, "step": 9070, "train_runtime": 116603.1814, "train_tokens_per_second": 4663.978 }, { "epoch": 1.1575255102040816, "grad_norm": 0.7038111749796568, "learning_rate": 3.7763552297731845e-06, "loss": 0.2305060863494873, "num_input_tokens_seen": 544124952, "step": 9075, "train_runtime": 116665.3221, "train_tokens_per_second": 4663.982 }, { "epoch": 1.1581632653061225, "grad_norm": 0.7451002695056345, "learning_rate": 3.771499241221277e-06, "loss": 0.24811456203460694, "num_input_tokens_seen": 544431408, "step": 9080, "train_runtime": 116728.2745, "train_tokens_per_second": 4664.092 }, { "epoch": 1.1588010204081634, "grad_norm": 0.6751730016623045, "learning_rate": 3.766644485555679e-06, "loss": 0.25781056880950926, "num_input_tokens_seen": 544735616, "step": 9085, "train_runtime": 116793.9754, "train_tokens_per_second": 4664.073 }, { "epoch": 1.159438775510204, "grad_norm": 0.6172387705145659, "learning_rate": 3.7617909676484788e-06, "loss": 0.22715344429016113, "num_input_tokens_seen": 545035608, "step": 9090, "train_runtime": 116862.9783, "train_tokens_per_second": 4663.886 }, { "epoch": 1.160076530612245, "grad_norm": 0.6562851751710456, "learning_rate": 3.7569386923705173e-06, "loss": 0.23681538105010985, "num_input_tokens_seen": 545335384, "step": 9095, "train_runtime": 116916.212, "train_tokens_per_second": 4664.326 }, { "epoch": 1.1607142857142858, "grad_norm": 0.602306701220074, "learning_rate": 3.752087664591394e-06, "loss": 0.24715650081634521, "num_input_tokens_seen": 545640128, "step": 9100, "train_runtime": 116965.1864, "train_tokens_per_second": 4664.979 }, { "epoch": 1.1613520408163265, "grad_norm": 0.6942235252239803, "learning_rate": 3.7472378891794537e-06, "loss": 0.2595963478088379, "num_input_tokens_seen": 545941880, "step": 9105, "train_runtime": 117029.5323, "train_tokens_per_second": 4664.992 }, { "epoch": 1.1619897959183674, "grad_norm": 0.6967520469521169, "learning_rate": 3.7423893710017826e-06, "loss": 0.24517674446105958, "num_input_tokens_seen": 546229888, "step": 9110, "train_runtime": 117095.5233, "train_tokens_per_second": 4664.823 }, { "epoch": 1.162627551020408, "grad_norm": 0.6292964339974995, "learning_rate": 3.7375421149242102e-06, "loss": 0.25058884620666505, "num_input_tokens_seen": 546533384, "step": 9115, "train_runtime": 117160.1731, "train_tokens_per_second": 4664.839 }, { "epoch": 1.163265306122449, "grad_norm": 0.6459696765253816, "learning_rate": 3.7326961258112963e-06, "loss": 0.2546118974685669, "num_input_tokens_seen": 546827608, "step": 9120, "train_runtime": 117226.779, "train_tokens_per_second": 4664.699 }, { "epoch": 1.1639030612244898, "grad_norm": 0.6359502309514716, "learning_rate": 3.7278514085263275e-06, "loss": 0.2721463680267334, "num_input_tokens_seen": 547120440, "step": 9125, "train_runtime": 117289.348, "train_tokens_per_second": 4664.707 }, { "epoch": 1.1645408163265305, "grad_norm": 0.6769281285982229, "learning_rate": 3.7230079679313157e-06, "loss": 0.256221342086792, "num_input_tokens_seen": 547427632, "step": 9130, "train_runtime": 117349.2818, "train_tokens_per_second": 4664.942 }, { "epoch": 1.1651785714285714, "grad_norm": 0.8581595851773528, "learning_rate": 3.7181658088869954e-06, "loss": 0.26300437450408937, "num_input_tokens_seen": 547739000, "step": 9135, "train_runtime": 117423.8759, "train_tokens_per_second": 4664.631 }, { "epoch": 1.1658163265306123, "grad_norm": 0.6424659767116858, "learning_rate": 3.7133249362528075e-06, "loss": 0.24833297729492188, "num_input_tokens_seen": 548037560, "step": 9140, "train_runtime": 117495.8573, "train_tokens_per_second": 4664.314 }, { "epoch": 1.166454081632653, "grad_norm": 0.631329380463012, "learning_rate": 3.708485354886906e-06, "loss": 0.22677249908447267, "num_input_tokens_seen": 548346544, "step": 9145, "train_runtime": 117559.1515, "train_tokens_per_second": 4664.431 }, { "epoch": 1.1670918367346939, "grad_norm": 0.6714517377518626, "learning_rate": 3.7036470696461535e-06, "loss": 0.25949141979217527, "num_input_tokens_seen": 548637168, "step": 9150, "train_runtime": 117622.3477, "train_tokens_per_second": 4664.396 }, { "epoch": 1.1677295918367347, "grad_norm": 0.6835736808563946, "learning_rate": 3.698810085386101e-06, "loss": 0.2544286012649536, "num_input_tokens_seen": 548931232, "step": 9155, "train_runtime": 117689.8689, "train_tokens_per_second": 4664.218 }, { "epoch": 1.1683673469387754, "grad_norm": 0.6110788024764375, "learning_rate": 3.693974406961004e-06, "loss": 0.2577073335647583, "num_input_tokens_seen": 549245168, "step": 9160, "train_runtime": 117750.8411, "train_tokens_per_second": 4664.469 }, { "epoch": 1.1690051020408163, "grad_norm": 0.6770064378364575, "learning_rate": 3.689140039223802e-06, "loss": 0.25592479705810545, "num_input_tokens_seen": 549548056, "step": 9165, "train_runtime": 117824.0662, "train_tokens_per_second": 4664.141 }, { "epoch": 1.1696428571428572, "grad_norm": 0.6187611265175217, "learning_rate": 3.6843069870261196e-06, "loss": 0.2484119176864624, "num_input_tokens_seen": 549839520, "step": 9170, "train_runtime": 117888.4783, "train_tokens_per_second": 4664.065 }, { "epoch": 1.1702806122448979, "grad_norm": 0.5803643727511468, "learning_rate": 3.6794752552182654e-06, "loss": 0.24884932041168212, "num_input_tokens_seen": 550147808, "step": 9175, "train_runtime": 117950.1268, "train_tokens_per_second": 4664.241 }, { "epoch": 1.1709183673469388, "grad_norm": 0.6528384407806481, "learning_rate": 3.674644848649217e-06, "loss": 0.24987993240356446, "num_input_tokens_seen": 550460824, "step": 9180, "train_runtime": 118009.1496, "train_tokens_per_second": 4664.561 }, { "epoch": 1.1715561224489797, "grad_norm": 0.6322431619920269, "learning_rate": 3.669815772166625e-06, "loss": 0.23595900535583497, "num_input_tokens_seen": 550767152, "step": 9185, "train_runtime": 118081.2508, "train_tokens_per_second": 4664.307 }, { "epoch": 1.1721938775510203, "grad_norm": 0.6027450146415512, "learning_rate": 3.6649880306168073e-06, "loss": 0.25257282257080077, "num_input_tokens_seen": 551070096, "step": 9190, "train_runtime": 118152.1277, "train_tokens_per_second": 4664.073 }, { "epoch": 1.1728316326530612, "grad_norm": 0.6259146317279678, "learning_rate": 3.6601616288447352e-06, "loss": 0.22191522121429444, "num_input_tokens_seen": 551382240, "step": 9195, "train_runtime": 118221.1076, "train_tokens_per_second": 4663.991 }, { "epoch": 1.1734693877551021, "grad_norm": 0.7630515997330095, "learning_rate": 3.655336571694044e-06, "loss": 0.26834137439727784, "num_input_tokens_seen": 551668544, "step": 9200, "train_runtime": 118284.8524, "train_tokens_per_second": 4663.898 }, { "epoch": 1.1741071428571428, "grad_norm": 0.597978151035573, "learning_rate": 3.6505128640070152e-06, "loss": 0.24073524475097657, "num_input_tokens_seen": 551963936, "step": 9205, "train_runtime": 118361.3459, "train_tokens_per_second": 4663.38 }, { "epoch": 1.1747448979591837, "grad_norm": 0.6130406112564567, "learning_rate": 3.6456905106245743e-06, "loss": 0.253322958946228, "num_input_tokens_seen": 552254864, "step": 9210, "train_runtime": 118421.5701, "train_tokens_per_second": 4663.465 }, { "epoch": 1.1753826530612246, "grad_norm": 0.6039484361070391, "learning_rate": 3.6408695163862895e-06, "loss": 0.22835330963134765, "num_input_tokens_seen": 552565152, "step": 9215, "train_runtime": 118482.4192, "train_tokens_per_second": 4663.689 }, { "epoch": 1.1760204081632653, "grad_norm": 0.7558607931592242, "learning_rate": 3.6360498861303693e-06, "loss": 0.2553338766098022, "num_input_tokens_seen": 552865136, "step": 9220, "train_runtime": 118547.5556, "train_tokens_per_second": 4663.657 }, { "epoch": 1.1766581632653061, "grad_norm": 0.6296071342408717, "learning_rate": 3.631231624693645e-06, "loss": 0.24725809097290039, "num_input_tokens_seen": 553177424, "step": 9225, "train_runtime": 118624.0642, "train_tokens_per_second": 4663.282 }, { "epoch": 1.177295918367347, "grad_norm": 0.6134551301136502, "learning_rate": 3.6264147369115788e-06, "loss": 0.2447408676147461, "num_input_tokens_seen": 553478216, "step": 9230, "train_runtime": 118695.0777, "train_tokens_per_second": 4663.026 }, { "epoch": 1.1779336734693877, "grad_norm": 0.609506357508338, "learning_rate": 3.621599227618258e-06, "loss": 0.24174644947052001, "num_input_tokens_seen": 553766792, "step": 9235, "train_runtime": 118759.8057, "train_tokens_per_second": 4662.914 }, { "epoch": 1.1785714285714286, "grad_norm": 0.6881325119035495, "learning_rate": 3.6167851016463762e-06, "loss": 0.25118389129638674, "num_input_tokens_seen": 554078144, "step": 9240, "train_runtime": 118833.6779, "train_tokens_per_second": 4662.636 }, { "epoch": 1.1792091836734695, "grad_norm": 0.6949850142071543, "learning_rate": 3.61197236382725e-06, "loss": 0.264749813079834, "num_input_tokens_seen": 554353128, "step": 9245, "train_runtime": 118901.1332, "train_tokens_per_second": 4662.303 }, { "epoch": 1.1798469387755102, "grad_norm": 0.6237410584708641, "learning_rate": 3.6071610189907975e-06, "loss": 0.2633744955062866, "num_input_tokens_seen": 554654464, "step": 9250, "train_runtime": 118961.4601, "train_tokens_per_second": 4662.472 }, { "epoch": 1.180484693877551, "grad_norm": 0.607375416487404, "learning_rate": 3.602351071965536e-06, "loss": 0.2352853775024414, "num_input_tokens_seen": 554957296, "step": 9255, "train_runtime": 119024.8538, "train_tokens_per_second": 4662.533 }, { "epoch": 1.181122448979592, "grad_norm": 0.6229404929317026, "learning_rate": 3.597542527578586e-06, "loss": 0.2447524070739746, "num_input_tokens_seen": 555268560, "step": 9260, "train_runtime": 119074.8666, "train_tokens_per_second": 4663.189 }, { "epoch": 1.1817602040816326, "grad_norm": 0.6978467524958565, "learning_rate": 3.5927353906556583e-06, "loss": 0.25916457176208496, "num_input_tokens_seen": 555550816, "step": 9265, "train_runtime": 119142.412, "train_tokens_per_second": 4662.914 }, { "epoch": 1.1823979591836735, "grad_norm": 0.6531276949703494, "learning_rate": 3.587929666021048e-06, "loss": 0.25164358615875243, "num_input_tokens_seen": 555873480, "step": 9270, "train_runtime": 119195.4844, "train_tokens_per_second": 4663.545 }, { "epoch": 1.1830357142857142, "grad_norm": 0.7364330224536769, "learning_rate": 3.5831253584976377e-06, "loss": 0.24759864807128906, "num_input_tokens_seen": 556177128, "step": 9275, "train_runtime": 119260.0804, "train_tokens_per_second": 4663.565 }, { "epoch": 1.183673469387755, "grad_norm": 0.6462113257712689, "learning_rate": 3.578322472906882e-06, "loss": 0.2553884506225586, "num_input_tokens_seen": 556473376, "step": 9280, "train_runtime": 119327.0084, "train_tokens_per_second": 4663.432 }, { "epoch": 1.184311224489796, "grad_norm": 0.629273389281804, "learning_rate": 3.5735210140688163e-06, "loss": 0.23726444244384765, "num_input_tokens_seen": 556768616, "step": 9285, "train_runtime": 119397.3057, "train_tokens_per_second": 4663.159 }, { "epoch": 1.1849489795918366, "grad_norm": 0.6166447669029329, "learning_rate": 3.568720986802039e-06, "loss": 0.23703157901763916, "num_input_tokens_seen": 557075072, "step": 9290, "train_runtime": 119464.9214, "train_tokens_per_second": 4663.085 }, { "epoch": 1.1855867346938775, "grad_norm": 0.5888052487622764, "learning_rate": 3.56392239592371e-06, "loss": 0.23610968589782716, "num_input_tokens_seen": 557373416, "step": 9295, "train_runtime": 119541.318, "train_tokens_per_second": 4662.601 }, { "epoch": 1.1862244897959184, "grad_norm": 0.7006106595864101, "learning_rate": 3.559125246249552e-06, "loss": 0.24983363151550292, "num_input_tokens_seen": 557676320, "step": 9300, "train_runtime": 119611.277, "train_tokens_per_second": 4662.406 }, { "epoch": 1.186862244897959, "grad_norm": 0.6302775441592273, "learning_rate": 3.554329542593841e-06, "loss": 0.24187581539154052, "num_input_tokens_seen": 557962864, "step": 9305, "train_runtime": 119668.3273, "train_tokens_per_second": 4662.578 }, { "epoch": 1.1875, "grad_norm": 0.6658184462450729, "learning_rate": 3.549535289769399e-06, "loss": 0.24613499641418457, "num_input_tokens_seen": 558233360, "step": 9310, "train_runtime": 119737.4592, "train_tokens_per_second": 4662.145 }, { "epoch": 1.188137755102041, "grad_norm": 0.726298207769721, "learning_rate": 3.544742492587593e-06, "loss": 0.28460307121276857, "num_input_tokens_seen": 558524488, "step": 9315, "train_runtime": 119805.6747, "train_tokens_per_second": 4661.92 }, { "epoch": 1.1887755102040816, "grad_norm": 0.690872033354097, "learning_rate": 3.5399511558583323e-06, "loss": 0.24558644294738768, "num_input_tokens_seen": 558822904, "step": 9320, "train_runtime": 119877.3924, "train_tokens_per_second": 4661.62 }, { "epoch": 1.1894132653061225, "grad_norm": 0.636094550133446, "learning_rate": 3.5351612843900555e-06, "loss": 0.23512711524963378, "num_input_tokens_seen": 559123576, "step": 9325, "train_runtime": 119947.4983, "train_tokens_per_second": 4661.403 }, { "epoch": 1.1900510204081634, "grad_norm": 0.6683601460308425, "learning_rate": 3.5303728829897336e-06, "loss": 0.25034427642822266, "num_input_tokens_seen": 559425440, "step": 9330, "train_runtime": 120013.1594, "train_tokens_per_second": 4661.367 }, { "epoch": 1.190688775510204, "grad_norm": 0.6695643430497313, "learning_rate": 3.5255859564628637e-06, "loss": 0.24240822792053224, "num_input_tokens_seen": 559730616, "step": 9335, "train_runtime": 120076.7622, "train_tokens_per_second": 4661.44 }, { "epoch": 1.191326530612245, "grad_norm": 0.6623470970724884, "learning_rate": 3.5208005096134567e-06, "loss": 0.2593933820724487, "num_input_tokens_seen": 560028952, "step": 9340, "train_runtime": 120146.2545, "train_tokens_per_second": 4661.227 }, { "epoch": 1.1919642857142858, "grad_norm": 0.6678385536760265, "learning_rate": 3.516016547244047e-06, "loss": 0.21670892238616943, "num_input_tokens_seen": 560343528, "step": 9345, "train_runtime": 120212.6634, "train_tokens_per_second": 4661.269 }, { "epoch": 1.1926020408163265, "grad_norm": 0.8182870131267127, "learning_rate": 3.5112340741556737e-06, "loss": 0.26225972175598145, "num_input_tokens_seen": 560643024, "step": 9350, "train_runtime": 120270.7753, "train_tokens_per_second": 4661.507 }, { "epoch": 1.1932397959183674, "grad_norm": 0.5997101290632552, "learning_rate": 3.5064530951478822e-06, "loss": 0.23266761302947997, "num_input_tokens_seen": 560939344, "step": 9355, "train_runtime": 120341.6154, "train_tokens_per_second": 4661.225 }, { "epoch": 1.193877551020408, "grad_norm": 0.6497956114394874, "learning_rate": 3.501673615018717e-06, "loss": 0.24074554443359375, "num_input_tokens_seen": 561249864, "step": 9360, "train_runtime": 120409.5106, "train_tokens_per_second": 4661.176 }, { "epoch": 1.194515306122449, "grad_norm": 0.6099208940229317, "learning_rate": 3.496895638564724e-06, "loss": 0.247788667678833, "num_input_tokens_seen": 561551416, "step": 9365, "train_runtime": 120465.6494, "train_tokens_per_second": 4661.507 }, { "epoch": 1.1951530612244898, "grad_norm": 0.6974162082537729, "learning_rate": 3.492119170580933e-06, "loss": 0.2576225996017456, "num_input_tokens_seen": 561860984, "step": 9370, "train_runtime": 120538.6994, "train_tokens_per_second": 4661.25 }, { "epoch": 1.1957908163265305, "grad_norm": 0.6831801746858304, "learning_rate": 3.4873442158608638e-06, "loss": 0.24086074829101561, "num_input_tokens_seen": 562138512, "step": 9375, "train_runtime": 120602.265, "train_tokens_per_second": 4661.094 }, { "epoch": 1.1964285714285714, "grad_norm": 0.7347750564493745, "learning_rate": 3.4825707791965213e-06, "loss": 0.25907833576202394, "num_input_tokens_seen": 562444504, "step": 9380, "train_runtime": 120667.4375, "train_tokens_per_second": 4661.113 }, { "epoch": 1.1970663265306123, "grad_norm": 0.6830529434820147, "learning_rate": 3.477798865378375e-06, "loss": 0.2647451877593994, "num_input_tokens_seen": 562736128, "step": 9385, "train_runtime": 120744.8089, "train_tokens_per_second": 4660.541 }, { "epoch": 1.197704081632653, "grad_norm": 0.6699661918602079, "learning_rate": 3.4730284791953793e-06, "loss": 0.23806190490722656, "num_input_tokens_seen": 563036856, "step": 9390, "train_runtime": 120815.7666, "train_tokens_per_second": 4660.293 }, { "epoch": 1.1983418367346939, "grad_norm": 0.6660307024039173, "learning_rate": 3.4682596254349487e-06, "loss": 0.2621174335479736, "num_input_tokens_seen": 563341440, "step": 9395, "train_runtime": 120879.9135, "train_tokens_per_second": 4660.34 }, { "epoch": 1.1989795918367347, "grad_norm": 0.6888233895005237, "learning_rate": 3.4634923088829586e-06, "loss": 0.23306708335876464, "num_input_tokens_seen": 563643520, "step": 9400, "train_runtime": 120954.1091, "train_tokens_per_second": 4659.978 }, { "epoch": 1.1996173469387754, "grad_norm": 0.6150800837168472, "learning_rate": 3.4587265343237474e-06, "loss": 0.2485969066619873, "num_input_tokens_seen": 563936920, "step": 9405, "train_runtime": 121018.3573, "train_tokens_per_second": 4659.929 }, { "epoch": 1.2002551020408163, "grad_norm": 0.6353422200146611, "learning_rate": 3.4539623065401014e-06, "loss": 0.2417161464691162, "num_input_tokens_seen": 564243456, "step": 9410, "train_runtime": 121084.8256, "train_tokens_per_second": 4659.902 }, { "epoch": 1.2008928571428572, "grad_norm": 0.6336374806099082, "learning_rate": 3.4491996303132553e-06, "loss": 0.2554072380065918, "num_input_tokens_seen": 564555928, "step": 9415, "train_runtime": 121138.3299, "train_tokens_per_second": 4660.424 }, { "epoch": 1.2015306122448979, "grad_norm": 0.6884006889013108, "learning_rate": 3.444438510422889e-06, "loss": 0.22291643619537355, "num_input_tokens_seen": 564840192, "step": 9420, "train_runtime": 121194.2743, "train_tokens_per_second": 4660.618 }, { "epoch": 1.2021683673469388, "grad_norm": 0.5912748419669106, "learning_rate": 3.4396789516471152e-06, "loss": 0.23480658531188964, "num_input_tokens_seen": 565145792, "step": 9425, "train_runtime": 121257.7308, "train_tokens_per_second": 4660.699 }, { "epoch": 1.2028061224489797, "grad_norm": 0.6174977455663048, "learning_rate": 3.4349209587624876e-06, "loss": 0.259614086151123, "num_input_tokens_seen": 565446576, "step": 9430, "train_runtime": 121325.7457, "train_tokens_per_second": 4660.565 }, { "epoch": 1.2034438775510203, "grad_norm": 0.6502749099140333, "learning_rate": 3.4301645365439827e-06, "loss": 0.26551547050476076, "num_input_tokens_seen": 565764464, "step": 9435, "train_runtime": 121386.7255, "train_tokens_per_second": 4660.843 }, { "epoch": 1.2040816326530612, "grad_norm": 0.6233623788941873, "learning_rate": 3.4254096897650026e-06, "loss": 0.23483748435974122, "num_input_tokens_seen": 566077560, "step": 9440, "train_runtime": 121445.9811, "train_tokens_per_second": 4661.147 }, { "epoch": 1.2047193877551021, "grad_norm": 0.6713930657422693, "learning_rate": 3.4206564231973664e-06, "loss": 0.23852186203002929, "num_input_tokens_seen": 566381952, "step": 9445, "train_runtime": 121502.5826, "train_tokens_per_second": 4661.481 }, { "epoch": 1.2053571428571428, "grad_norm": 0.5998381766696496, "learning_rate": 3.4159047416113133e-06, "loss": 0.23655376434326172, "num_input_tokens_seen": 566690112, "step": 9450, "train_runtime": 121568.6943, "train_tokens_per_second": 4661.481 }, { "epoch": 1.2059948979591837, "grad_norm": 0.585610590757165, "learning_rate": 3.4111546497754834e-06, "loss": 0.2396397113800049, "num_input_tokens_seen": 566993576, "step": 9455, "train_runtime": 121623.1231, "train_tokens_per_second": 4661.89 }, { "epoch": 1.2066326530612246, "grad_norm": 0.6394254926611324, "learning_rate": 3.406406152456926e-06, "loss": 0.25543689727783203, "num_input_tokens_seen": 567296048, "step": 9460, "train_runtime": 121692.9237, "train_tokens_per_second": 4661.701 }, { "epoch": 1.2072704081632653, "grad_norm": 0.6736076741793873, "learning_rate": 3.4016592544210937e-06, "loss": 0.22780184745788573, "num_input_tokens_seen": 567611232, "step": 9465, "train_runtime": 121748.117, "train_tokens_per_second": 4662.177 }, { "epoch": 1.2079081632653061, "grad_norm": 0.724909092864873, "learning_rate": 3.3969139604318257e-06, "loss": 0.2502995491027832, "num_input_tokens_seen": 567904160, "step": 9470, "train_runtime": 121819.3603, "train_tokens_per_second": 4661.855 }, { "epoch": 1.208545918367347, "grad_norm": 0.6354101488056316, "learning_rate": 3.3921702752513576e-06, "loss": 0.23016157150268554, "num_input_tokens_seen": 568200096, "step": 9475, "train_runtime": 121870.4569, "train_tokens_per_second": 4662.328 }, { "epoch": 1.2091836734693877, "grad_norm": 0.7218693513273385, "learning_rate": 3.3874282036403106e-06, "loss": 0.23276865482330322, "num_input_tokens_seen": 568498312, "step": 9480, "train_runtime": 121943.7495, "train_tokens_per_second": 4661.972 }, { "epoch": 1.2098214285714286, "grad_norm": 0.7254054278864226, "learning_rate": 3.3826877503576805e-06, "loss": 0.24601442813873292, "num_input_tokens_seen": 568788904, "step": 9485, "train_runtime": 122015.1089, "train_tokens_per_second": 4661.627 }, { "epoch": 1.2104591836734695, "grad_norm": 0.7746722846285617, "learning_rate": 3.3779489201608468e-06, "loss": 0.25545225143432615, "num_input_tokens_seen": 569073328, "step": 9490, "train_runtime": 122069.6447, "train_tokens_per_second": 4661.874 }, { "epoch": 1.2110969387755102, "grad_norm": 0.634040013325104, "learning_rate": 3.373211717805557e-06, "loss": 0.24503130912780763, "num_input_tokens_seen": 569371048, "step": 9495, "train_runtime": 122136.9593, "train_tokens_per_second": 4661.742 }, { "epoch": 1.211734693877551, "grad_norm": 0.5463735961398527, "learning_rate": 3.3684761480459218e-06, "loss": 0.24413666725158692, "num_input_tokens_seen": 569682568, "step": 9500, "train_runtime": 122204.3646, "train_tokens_per_second": 4661.72 }, { "epoch": 1.212372448979592, "grad_norm": 0.640346597606397, "learning_rate": 3.363742215634416e-06, "loss": 0.22815101146697997, "num_input_tokens_seen": 569986536, "step": 9505, "train_runtime": 122259.3282, "train_tokens_per_second": 4662.111 }, { "epoch": 1.2130102040816326, "grad_norm": 0.5562411538974917, "learning_rate": 3.3590099253218745e-06, "loss": 0.24046213626861573, "num_input_tokens_seen": 570289152, "step": 9510, "train_runtime": 122326.6957, "train_tokens_per_second": 4662.017 }, { "epoch": 1.2136479591836735, "grad_norm": 0.594256768739644, "learning_rate": 3.3542792818574793e-06, "loss": 0.2501716136932373, "num_input_tokens_seen": 570600240, "step": 9515, "train_runtime": 122391.128, "train_tokens_per_second": 4662.105 }, { "epoch": 1.2142857142857142, "grad_norm": 0.6750620716967806, "learning_rate": 3.3495502899887624e-06, "loss": 0.26310560703277586, "num_input_tokens_seen": 570889384, "step": 9520, "train_runtime": 122450.4879, "train_tokens_per_second": 4662.206 }, { "epoch": 1.214923469387755, "grad_norm": 0.7131524670740134, "learning_rate": 3.344822954461595e-06, "loss": 0.22837610244750978, "num_input_tokens_seen": 571197592, "step": 9525, "train_runtime": 122510.2591, "train_tokens_per_second": 4662.447 }, { "epoch": 1.215561224489796, "grad_norm": 0.6539464488458759, "learning_rate": 3.34009728002019e-06, "loss": 0.23309762477874757, "num_input_tokens_seen": 571495144, "step": 9530, "train_runtime": 122579.2496, "train_tokens_per_second": 4662.25 }, { "epoch": 1.2161989795918366, "grad_norm": 0.6845398888019838, "learning_rate": 3.3353732714070933e-06, "loss": 0.23382034301757812, "num_input_tokens_seen": 571790752, "step": 9535, "train_runtime": 122636.2501, "train_tokens_per_second": 4662.494 }, { "epoch": 1.2168367346938775, "grad_norm": 0.5880402846387599, "learning_rate": 3.3306509333631755e-06, "loss": 0.24842290878295897, "num_input_tokens_seen": 572077008, "step": 9540, "train_runtime": 122703.9193, "train_tokens_per_second": 4662.255 }, { "epoch": 1.2174744897959184, "grad_norm": 0.6439471879577157, "learning_rate": 3.325930270627632e-06, "loss": 0.2351449489593506, "num_input_tokens_seen": 572344136, "step": 9545, "train_runtime": 122760.4623, "train_tokens_per_second": 4662.284 }, { "epoch": 1.218112244897959, "grad_norm": 0.6941666628201706, "learning_rate": 3.3212112879379806e-06, "loss": 0.2537204742431641, "num_input_tokens_seen": 572636944, "step": 9550, "train_runtime": 122825.5499, "train_tokens_per_second": 4662.197 }, { "epoch": 1.21875, "grad_norm": 0.8305207909209866, "learning_rate": 3.3164939900300467e-06, "loss": 0.25160627365112304, "num_input_tokens_seen": 572928200, "step": 9555, "train_runtime": 122889.2114, "train_tokens_per_second": 4662.152 }, { "epoch": 1.219387755102041, "grad_norm": 0.6425826189693363, "learning_rate": 3.31177838163797e-06, "loss": 0.2512808084487915, "num_input_tokens_seen": 573228480, "step": 9560, "train_runtime": 122954.6929, "train_tokens_per_second": 4662.111 }, { "epoch": 1.2200255102040816, "grad_norm": 0.7235417645152831, "learning_rate": 3.3070644674941938e-06, "loss": 0.2483961582183838, "num_input_tokens_seen": 573525744, "step": 9565, "train_runtime": 123017.8877, "train_tokens_per_second": 4662.133 }, { "epoch": 1.2206632653061225, "grad_norm": 0.676437011184346, "learning_rate": 3.302352252329456e-06, "loss": 0.2219179630279541, "num_input_tokens_seen": 573826040, "step": 9570, "train_runtime": 123089.1066, "train_tokens_per_second": 4661.875 }, { "epoch": 1.2213010204081634, "grad_norm": 0.7021298551423343, "learning_rate": 3.2976417408727978e-06, "loss": 0.2485231876373291, "num_input_tokens_seen": 574124728, "step": 9575, "train_runtime": 123151.3361, "train_tokens_per_second": 4661.945 }, { "epoch": 1.221938775510204, "grad_norm": 0.5885944348296309, "learning_rate": 3.2929329378515466e-06, "loss": 0.2570828914642334, "num_input_tokens_seen": 574445152, "step": 9580, "train_runtime": 123215.1794, "train_tokens_per_second": 4662.13 }, { "epoch": 1.222576530612245, "grad_norm": 0.719852957071995, "learning_rate": 3.288225847991312e-06, "loss": 0.249613356590271, "num_input_tokens_seen": 574736216, "step": 9585, "train_runtime": 123285.219, "train_tokens_per_second": 4661.842 }, { "epoch": 1.2232142857142858, "grad_norm": 0.6467967168188589, "learning_rate": 3.2835204760159883e-06, "loss": 0.2640578269958496, "num_input_tokens_seen": 575033336, "step": 9590, "train_runtime": 123339.5056, "train_tokens_per_second": 4662.199 }, { "epoch": 1.2238520408163265, "grad_norm": 0.618876874848355, "learning_rate": 3.278816826647747e-06, "loss": 0.22925953865051268, "num_input_tokens_seen": 575322848, "step": 9595, "train_runtime": 123403.1543, "train_tokens_per_second": 4662.141 }, { "epoch": 1.2244897959183674, "grad_norm": 1.0537863884932905, "learning_rate": 3.2741149046070274e-06, "loss": 0.247985315322876, "num_input_tokens_seen": 575622176, "step": 9600, "train_runtime": 123469.0493, "train_tokens_per_second": 4662.077 }, { "epoch": 1.225127551020408, "grad_norm": 0.672465506512946, "learning_rate": 3.269414714612534e-06, "loss": 0.2552971839904785, "num_input_tokens_seen": 575936872, "step": 9605, "train_runtime": 123537.8016, "train_tokens_per_second": 4662.029 }, { "epoch": 1.225765306122449, "grad_norm": 0.6439160971463344, "learning_rate": 3.2647162613812435e-06, "loss": 0.25532970428466795, "num_input_tokens_seen": 576231408, "step": 9610, "train_runtime": 123598.8492, "train_tokens_per_second": 4662.11 }, { "epoch": 1.2264030612244898, "grad_norm": 0.6707144940046731, "learning_rate": 3.2600195496283716e-06, "loss": 0.2427670478820801, "num_input_tokens_seen": 576540112, "step": 9615, "train_runtime": 123647.5813, "train_tokens_per_second": 4662.769 }, { "epoch": 1.2270408163265305, "grad_norm": 0.6483414717759375, "learning_rate": 3.2553245840674037e-06, "loss": 0.2417902946472168, "num_input_tokens_seen": 576838640, "step": 9620, "train_runtime": 123700.2175, "train_tokens_per_second": 4663.198 }, { "epoch": 1.2276785714285714, "grad_norm": 0.5917535571007025, "learning_rate": 3.2506313694100643e-06, "loss": 0.2310344696044922, "num_input_tokens_seen": 577150248, "step": 9625, "train_runtime": 123781.3019, "train_tokens_per_second": 4662.661 }, { "epoch": 1.2283163265306123, "grad_norm": 0.6605121606704848, "learning_rate": 3.245939910366319e-06, "loss": 0.22664246559143067, "num_input_tokens_seen": 577424432, "step": 9630, "train_runtime": 123848.237, "train_tokens_per_second": 4662.355 }, { "epoch": 1.228954081632653, "grad_norm": 0.6414315445805147, "learning_rate": 3.2412502116443783e-06, "loss": 0.2320406436920166, "num_input_tokens_seen": 577731528, "step": 9635, "train_runtime": 123904.2092, "train_tokens_per_second": 4662.727 }, { "epoch": 1.2295918367346939, "grad_norm": 0.610721756241424, "learning_rate": 3.236562277950682e-06, "loss": 0.2285013198852539, "num_input_tokens_seen": 578022736, "step": 9640, "train_runtime": 123955.2853, "train_tokens_per_second": 4663.155 }, { "epoch": 1.2302295918367347, "grad_norm": 0.6632598272231298, "learning_rate": 3.231876113989897e-06, "loss": 0.24210233688354493, "num_input_tokens_seen": 578316872, "step": 9645, "train_runtime": 124019.0156, "train_tokens_per_second": 4663.131 }, { "epoch": 1.2308673469387754, "grad_norm": 0.6290910465594164, "learning_rate": 3.227191724464918e-06, "loss": 0.23908476829528807, "num_input_tokens_seen": 578603112, "step": 9650, "train_runtime": 124083.7123, "train_tokens_per_second": 4663.006 }, { "epoch": 1.2315051020408163, "grad_norm": 0.6028383692432482, "learning_rate": 3.2225091140768537e-06, "loss": 0.23353929519653321, "num_input_tokens_seen": 578893808, "step": 9655, "train_runtime": 124146.8512, "train_tokens_per_second": 4662.976 }, { "epoch": 1.2321428571428572, "grad_norm": 0.6940282199334723, "learning_rate": 3.2178282875250356e-06, "loss": 0.24055807590484618, "num_input_tokens_seen": 579190224, "step": 9660, "train_runtime": 124213.7144, "train_tokens_per_second": 4662.852 }, { "epoch": 1.2327806122448979, "grad_norm": 0.6351038537015795, "learning_rate": 3.213149249506997e-06, "loss": 0.2548715114593506, "num_input_tokens_seen": 579491968, "step": 9665, "train_runtime": 124276.8311, "train_tokens_per_second": 4662.912 }, { "epoch": 1.2334183673469388, "grad_norm": 0.7180850012402774, "learning_rate": 3.208472004718479e-06, "loss": 0.2566064834594727, "num_input_tokens_seen": 579772312, "step": 9670, "train_runtime": 124341.8525, "train_tokens_per_second": 4662.729 }, { "epoch": 1.2340561224489797, "grad_norm": 0.5798785800653484, "learning_rate": 3.2037965578534245e-06, "loss": 0.26011550426483154, "num_input_tokens_seen": 580074776, "step": 9675, "train_runtime": 124406.4191, "train_tokens_per_second": 4662.74 }, { "epoch": 1.2346938775510203, "grad_norm": 0.8496378610750186, "learning_rate": 3.199122913603972e-06, "loss": 0.2577479362487793, "num_input_tokens_seen": 580362904, "step": 9680, "train_runtime": 124469.1193, "train_tokens_per_second": 4662.706 }, { "epoch": 1.2353316326530612, "grad_norm": 0.675406051927215, "learning_rate": 3.1944510766604473e-06, "loss": 0.2648852109909058, "num_input_tokens_seen": 580649824, "step": 9685, "train_runtime": 124543.1743, "train_tokens_per_second": 4662.237 }, { "epoch": 1.2359693877551021, "grad_norm": 0.6516245491378782, "learning_rate": 3.1897810517113657e-06, "loss": 0.23095903396606446, "num_input_tokens_seen": 580943592, "step": 9690, "train_runtime": 124614.8243, "train_tokens_per_second": 4661.914 }, { "epoch": 1.2366071428571428, "grad_norm": 0.6487833784761903, "learning_rate": 3.1851128434434263e-06, "loss": 0.271923828125, "num_input_tokens_seen": 581232392, "step": 9695, "train_runtime": 124673.8991, "train_tokens_per_second": 4662.021 }, { "epoch": 1.2372448979591837, "grad_norm": 0.5968849582919264, "learning_rate": 3.1804464565414993e-06, "loss": 0.23573975563049315, "num_input_tokens_seen": 581531312, "step": 9700, "train_runtime": 124738.5785, "train_tokens_per_second": 4662.0 }, { "epoch": 1.2378826530612246, "grad_norm": 0.5346215637862628, "learning_rate": 3.17578189568863e-06, "loss": 0.23364415168762206, "num_input_tokens_seen": 581835456, "step": 9705, "train_runtime": 124807.7962, "train_tokens_per_second": 4661.852 }, { "epoch": 1.2385204081632653, "grad_norm": 0.5783827962680886, "learning_rate": 3.1711191655660327e-06, "loss": 0.24957633018493652, "num_input_tokens_seen": 582138432, "step": 9710, "train_runtime": 124870.5723, "train_tokens_per_second": 4661.935 }, { "epoch": 1.2391581632653061, "grad_norm": 0.6103049110622445, "learning_rate": 3.1664582708530796e-06, "loss": 0.23300728797912598, "num_input_tokens_seen": 582440344, "step": 9715, "train_runtime": 124940.0731, "train_tokens_per_second": 4661.758 }, { "epoch": 1.239795918367347, "grad_norm": 0.6181695465068429, "learning_rate": 3.161799216227307e-06, "loss": 0.24103116989135742, "num_input_tokens_seen": 582754056, "step": 9720, "train_runtime": 125004.2274, "train_tokens_per_second": 4661.875 }, { "epoch": 1.2404336734693877, "grad_norm": 0.5879967426439205, "learning_rate": 3.157142006364401e-06, "loss": 0.22790446281433105, "num_input_tokens_seen": 583052224, "step": 9725, "train_runtime": 125059.7885, "train_tokens_per_second": 4662.188 }, { "epoch": 1.2410714285714286, "grad_norm": 0.6791849966276937, "learning_rate": 3.1524866459381966e-06, "loss": 0.2671624183654785, "num_input_tokens_seen": 583361360, "step": 9730, "train_runtime": 125122.1602, "train_tokens_per_second": 4662.334 }, { "epoch": 1.2417091836734695, "grad_norm": 0.6784696421808819, "learning_rate": 3.147833139620671e-06, "loss": 0.2518662452697754, "num_input_tokens_seen": 583658360, "step": 9735, "train_runtime": 125188.8562, "train_tokens_per_second": 4662.223 }, { "epoch": 1.2423469387755102, "grad_norm": 0.632734661193053, "learning_rate": 3.143181492081947e-06, "loss": 0.2688909530639648, "num_input_tokens_seen": 583959968, "step": 9740, "train_runtime": 125251.7817, "train_tokens_per_second": 4662.289 }, { "epoch": 1.242984693877551, "grad_norm": 0.6506809875514474, "learning_rate": 3.1385317079902743e-06, "loss": 0.24842522144317628, "num_input_tokens_seen": 584273608, "step": 9745, "train_runtime": 125319.983, "train_tokens_per_second": 4662.254 }, { "epoch": 1.243622448979592, "grad_norm": 0.6404448969075249, "learning_rate": 3.133883792012037e-06, "loss": 0.23932576179504395, "num_input_tokens_seen": 584569088, "step": 9750, "train_runtime": 125386.4018, "train_tokens_per_second": 4662.141 }, { "epoch": 1.2442602040816326, "grad_norm": 0.6622136313376177, "learning_rate": 3.1292377488117466e-06, "loss": 0.26366333961486815, "num_input_tokens_seen": 584886040, "step": 9755, "train_runtime": 125442.8655, "train_tokens_per_second": 4662.569 }, { "epoch": 1.2448979591836735, "grad_norm": 0.617229978107778, "learning_rate": 3.124593583052026e-06, "loss": 0.2389538288116455, "num_input_tokens_seen": 585186440, "step": 9760, "train_runtime": 125498.6491, "train_tokens_per_second": 4662.89 }, { "epoch": 1.2455357142857142, "grad_norm": 0.5766138574003634, "learning_rate": 3.119951299393625e-06, "loss": 0.2251434564590454, "num_input_tokens_seen": 585503184, "step": 9765, "train_runtime": 125559.3874, "train_tokens_per_second": 4663.157 }, { "epoch": 1.246173469387755, "grad_norm": 0.6146959484283944, "learning_rate": 3.115310902495396e-06, "loss": 0.24179534912109374, "num_input_tokens_seen": 585820496, "step": 9770, "train_runtime": 125606.6063, "train_tokens_per_second": 4663.931 }, { "epoch": 1.246811224489796, "grad_norm": 0.6731739894245796, "learning_rate": 3.1106723970143016e-06, "loss": 0.2561976909637451, "num_input_tokens_seen": 586120200, "step": 9775, "train_runtime": 125674.9063, "train_tokens_per_second": 4663.781 }, { "epoch": 1.2474489795918366, "grad_norm": 0.6484276544348772, "learning_rate": 3.10603578760541e-06, "loss": 0.24519357681274415, "num_input_tokens_seen": 586423160, "step": 9780, "train_runtime": 125730.5778, "train_tokens_per_second": 4664.125 }, { "epoch": 1.2480867346938775, "grad_norm": 0.713590031586681, "learning_rate": 3.101401078921878e-06, "loss": 0.23312654495239257, "num_input_tokens_seen": 586721840, "step": 9785, "train_runtime": 125787.6749, "train_tokens_per_second": 4664.383 }, { "epoch": 1.2487244897959184, "grad_norm": 0.8124111308788121, "learning_rate": 3.0967682756149607e-06, "loss": 0.2430281162261963, "num_input_tokens_seen": 587008192, "step": 9790, "train_runtime": 125845.6817, "train_tokens_per_second": 4664.508 }, { "epoch": 1.249362244897959, "grad_norm": 0.7656218296472863, "learning_rate": 3.0921373823340028e-06, "loss": 0.25926847457885743, "num_input_tokens_seen": 587306120, "step": 9795, "train_runtime": 125907.5491, "train_tokens_per_second": 4664.582 }, { "epoch": 1.25, "grad_norm": 0.6525768502255174, "learning_rate": 3.0875084037264237e-06, "loss": 0.22389230728149415, "num_input_tokens_seen": 587616640, "step": 9800, "train_runtime": 125971.5723, "train_tokens_per_second": 4664.677 }, { "epoch": 1.250637755102041, "grad_norm": 0.5941419954954219, "learning_rate": 3.0828813444377304e-06, "loss": 0.2395017623901367, "num_input_tokens_seen": 587929192, "step": 9805, "train_runtime": 126036.5653, "train_tokens_per_second": 4664.751 }, { "epoch": 1.2512755102040816, "grad_norm": 0.6360207891616095, "learning_rate": 3.0782562091114997e-06, "loss": 0.24663848876953126, "num_input_tokens_seen": 588232144, "step": 9810, "train_runtime": 126113.3717, "train_tokens_per_second": 4664.312 }, { "epoch": 1.2519132653061225, "grad_norm": 0.6308596792698608, "learning_rate": 3.0736330023893774e-06, "loss": 0.2444248914718628, "num_input_tokens_seen": 588534920, "step": 9815, "train_runtime": 126181.2622, "train_tokens_per_second": 4664.202 }, { "epoch": 1.2525510204081631, "grad_norm": 0.6706195268447501, "learning_rate": 3.0690117289110732e-06, "loss": 0.2598260879516602, "num_input_tokens_seen": 588838288, "step": 9820, "train_runtime": 126252.054, "train_tokens_per_second": 4663.99 }, { "epoch": 1.253188775510204, "grad_norm": 0.7299696350067582, "learning_rate": 3.0643923933143603e-06, "loss": 0.2867970705032349, "num_input_tokens_seen": 589134928, "step": 9825, "train_runtime": 126314.8642, "train_tokens_per_second": 4664.019 }, { "epoch": 1.253826530612245, "grad_norm": 0.6862653727619418, "learning_rate": 3.059775000235063e-06, "loss": 0.239058780670166, "num_input_tokens_seen": 589430168, "step": 9830, "train_runtime": 126393.4287, "train_tokens_per_second": 4663.456 }, { "epoch": 1.2544642857142856, "grad_norm": 0.6818486572676211, "learning_rate": 3.0551595543070567e-06, "loss": 0.25689897537231443, "num_input_tokens_seen": 589728240, "step": 9835, "train_runtime": 126468.1225, "train_tokens_per_second": 4663.058 }, { "epoch": 1.2551020408163265, "grad_norm": 0.7183256813859021, "learning_rate": 3.050546060162267e-06, "loss": 0.25381813049316404, "num_input_tokens_seen": 590026288, "step": 9840, "train_runtime": 126538.942, "train_tokens_per_second": 4662.804 }, { "epoch": 1.2557397959183674, "grad_norm": 0.6800326696163166, "learning_rate": 3.045934522430655e-06, "loss": 0.2316105842590332, "num_input_tokens_seen": 590321544, "step": 9845, "train_runtime": 126605.0016, "train_tokens_per_second": 4662.703 }, { "epoch": 1.256377551020408, "grad_norm": 0.609686847508778, "learning_rate": 3.0413249457402206e-06, "loss": 0.25052900314331056, "num_input_tokens_seen": 590609080, "step": 9850, "train_runtime": 126656.5957, "train_tokens_per_second": 4663.074 }, { "epoch": 1.257015306122449, "grad_norm": 0.6319635813899378, "learning_rate": 3.0367173347169978e-06, "loss": 0.24621901512145997, "num_input_tokens_seen": 590900952, "step": 9855, "train_runtime": 126723.2199, "train_tokens_per_second": 4662.926 }, { "epoch": 1.2576530612244898, "grad_norm": 0.6273263453820251, "learning_rate": 3.0321116939850435e-06, "loss": 0.23445494174957277, "num_input_tokens_seen": 591213904, "step": 9860, "train_runtime": 126789.5774, "train_tokens_per_second": 4662.954 }, { "epoch": 1.2582908163265305, "grad_norm": 0.63648803262082, "learning_rate": 3.0275080281664417e-06, "loss": 0.24305615425109864, "num_input_tokens_seen": 591498472, "step": 9865, "train_runtime": 126859.9434, "train_tokens_per_second": 4662.61 }, { "epoch": 1.2589285714285714, "grad_norm": 0.7284924231470784, "learning_rate": 3.0229063418812932e-06, "loss": 0.26299324035644533, "num_input_tokens_seen": 591797136, "step": 9870, "train_runtime": 126931.7558, "train_tokens_per_second": 4662.325 }, { "epoch": 1.2595663265306123, "grad_norm": 0.6795771148313055, "learning_rate": 3.0183066397477103e-06, "loss": 0.25070414543151853, "num_input_tokens_seen": 592087736, "step": 9875, "train_runtime": 126997.2662, "train_tokens_per_second": 4662.209 }, { "epoch": 1.260204081632653, "grad_norm": 0.6313372192986613, "learning_rate": 3.013708926381814e-06, "loss": 0.28244891166687014, "num_input_tokens_seen": 592391680, "step": 9880, "train_runtime": 127070.1969, "train_tokens_per_second": 4661.925 }, { "epoch": 1.2608418367346939, "grad_norm": 0.695641878360283, "learning_rate": 3.0091132063977344e-06, "loss": 0.2593372821807861, "num_input_tokens_seen": 592690432, "step": 9885, "train_runtime": 127142.576, "train_tokens_per_second": 4661.62 }, { "epoch": 1.2614795918367347, "grad_norm": 0.582783347348586, "learning_rate": 3.004519484407594e-06, "loss": 0.21239848136901857, "num_input_tokens_seen": 592998984, "step": 9890, "train_runtime": 127206.6827, "train_tokens_per_second": 4661.697 }, { "epoch": 1.2621173469387754, "grad_norm": 0.6447943995639185, "learning_rate": 2.9999277650215164e-06, "loss": 0.2596427917480469, "num_input_tokens_seen": 593285784, "step": 9895, "train_runtime": 127276.7131, "train_tokens_per_second": 4661.385 }, { "epoch": 1.2627551020408163, "grad_norm": 0.5925802211805856, "learning_rate": 2.9953380528476105e-06, "loss": 0.23733255863189698, "num_input_tokens_seen": 593594176, "step": 9900, "train_runtime": 127340.1794, "train_tokens_per_second": 4661.484 }, { "epoch": 1.2633928571428572, "grad_norm": 0.6552263140926321, "learning_rate": 2.9907503524919734e-06, "loss": 0.24280138015747071, "num_input_tokens_seen": 593895328, "step": 9905, "train_runtime": 127408.2113, "train_tokens_per_second": 4661.358 }, { "epoch": 1.2640306122448979, "grad_norm": 0.5794674407213174, "learning_rate": 2.9861646685586843e-06, "loss": 0.2521806001663208, "num_input_tokens_seen": 594176032, "step": 9910, "train_runtime": 127469.668, "train_tokens_per_second": 4661.313 }, { "epoch": 1.2646683673469388, "grad_norm": 0.6096879784672814, "learning_rate": 2.981581005649795e-06, "loss": 0.23649122714996337, "num_input_tokens_seen": 594480448, "step": 9915, "train_runtime": 127537.1602, "train_tokens_per_second": 4661.233 }, { "epoch": 1.2653061224489797, "grad_norm": 0.5472430801576244, "learning_rate": 2.9769993683653324e-06, "loss": 0.23223299980163575, "num_input_tokens_seen": 594783312, "step": 9920, "train_runtime": 127595.4696, "train_tokens_per_second": 4661.477 }, { "epoch": 1.2659438775510203, "grad_norm": 0.7011267883947306, "learning_rate": 2.9724197613032917e-06, "loss": 0.243508243560791, "num_input_tokens_seen": 595082792, "step": 9925, "train_runtime": 127663.453, "train_tokens_per_second": 4661.34 }, { "epoch": 1.2665816326530612, "grad_norm": 0.697210984126257, "learning_rate": 2.9678421890596254e-06, "loss": 0.25273904800415037, "num_input_tokens_seen": 595365824, "step": 9930, "train_runtime": 127724.9957, "train_tokens_per_second": 4661.31 }, { "epoch": 1.2672193877551021, "grad_norm": 0.667946641017842, "learning_rate": 2.9632666562282477e-06, "loss": 0.24409079551696777, "num_input_tokens_seen": 595664960, "step": 9935, "train_runtime": 127777.4952, "train_tokens_per_second": 4661.736 }, { "epoch": 1.2678571428571428, "grad_norm": 0.5915450005846132, "learning_rate": 2.9586931674010265e-06, "loss": 0.23822576999664308, "num_input_tokens_seen": 595952024, "step": 9940, "train_runtime": 127841.3064, "train_tokens_per_second": 4661.655 }, { "epoch": 1.2684948979591837, "grad_norm": 0.6275940897430338, "learning_rate": 2.9541217271677747e-06, "loss": 0.26365227699279786, "num_input_tokens_seen": 596253880, "step": 9945, "train_runtime": 127906.4577, "train_tokens_per_second": 4661.64 }, { "epoch": 1.2691326530612246, "grad_norm": 0.728477385611455, "learning_rate": 2.949552340116254e-06, "loss": 0.2271937370300293, "num_input_tokens_seen": 596557368, "step": 9950, "train_runtime": 127975.1504, "train_tokens_per_second": 4661.509 }, { "epoch": 1.2697704081632653, "grad_norm": 0.6084134412677387, "learning_rate": 2.9449850108321644e-06, "loss": 0.25845656394958494, "num_input_tokens_seen": 596855520, "step": 9955, "train_runtime": 128050.2822, "train_tokens_per_second": 4661.103 }, { "epoch": 1.2704081632653061, "grad_norm": 0.7342224938631051, "learning_rate": 2.9404197438991377e-06, "loss": 0.23968310356140138, "num_input_tokens_seen": 597154400, "step": 9960, "train_runtime": 128101.07, "train_tokens_per_second": 4661.588 }, { "epoch": 1.271045918367347, "grad_norm": 0.679852672100427, "learning_rate": 2.935856543898737e-06, "loss": 0.2415492057800293, "num_input_tokens_seen": 597437920, "step": 9965, "train_runtime": 128168.4646, "train_tokens_per_second": 4661.349 }, { "epoch": 1.2716836734693877, "grad_norm": 0.597171871665114, "learning_rate": 2.9312954154104563e-06, "loss": 0.23209569454193116, "num_input_tokens_seen": 597733832, "step": 9970, "train_runtime": 128226.6002, "train_tokens_per_second": 4661.543 }, { "epoch": 1.2723214285714286, "grad_norm": 0.6379672125616391, "learning_rate": 2.9267363630117028e-06, "loss": 0.24382576942443848, "num_input_tokens_seen": 598036272, "step": 9975, "train_runtime": 128296.5862, "train_tokens_per_second": 4661.358 }, { "epoch": 1.2729591836734695, "grad_norm": 0.6247185193777421, "learning_rate": 2.9221793912778053e-06, "loss": 0.248250150680542, "num_input_tokens_seen": 598344848, "step": 9980, "train_runtime": 128360.3081, "train_tokens_per_second": 4661.448 }, { "epoch": 1.2735969387755102, "grad_norm": 0.700121315011332, "learning_rate": 2.9176245047820064e-06, "loss": 0.2316591739654541, "num_input_tokens_seen": 598635984, "step": 9985, "train_runtime": 128425.9021, "train_tokens_per_second": 4661.334 }, { "epoch": 1.274234693877551, "grad_norm": 0.67605563420079, "learning_rate": 2.913071708095446e-06, "loss": 0.246818208694458, "num_input_tokens_seen": 598932032, "step": 9990, "train_runtime": 128490.184, "train_tokens_per_second": 4661.306 }, { "epoch": 1.274872448979592, "grad_norm": 0.6372114225203562, "learning_rate": 2.908521005787177e-06, "loss": 0.2229018211364746, "num_input_tokens_seen": 599238504, "step": 9995, "train_runtime": 128547.5302, "train_tokens_per_second": 4661.61 }, { "epoch": 1.2755102040816326, "grad_norm": 0.6774852915168257, "learning_rate": 2.903972402424151e-06, "loss": 0.24406712055206298, "num_input_tokens_seen": 599539168, "step": 10000, "train_runtime": 128600.7006, "train_tokens_per_second": 4662.021 }, { "epoch": 1.2761479591836735, "grad_norm": 0.6895370298799267, "learning_rate": 2.899425902571203e-06, "loss": 0.2546832084655762, "num_input_tokens_seen": 599831168, "step": 10005, "train_runtime": 128664.2372, "train_tokens_per_second": 4661.988 }, { "epoch": 1.2767857142857144, "grad_norm": 0.670430839752296, "learning_rate": 2.8948815107910653e-06, "loss": 0.24214091300964355, "num_input_tokens_seen": 600126312, "step": 10010, "train_runtime": 128721.48, "train_tokens_per_second": 4662.208 }, { "epoch": 1.277423469387755, "grad_norm": 0.5791025050862594, "learning_rate": 2.8903392316443534e-06, "loss": 0.2257810115814209, "num_input_tokens_seen": 600428096, "step": 10015, "train_runtime": 128785.2796, "train_tokens_per_second": 4662.242 }, { "epoch": 1.278061224489796, "grad_norm": 0.6670510559237663, "learning_rate": 2.885799069689561e-06, "loss": 0.2611087322235107, "num_input_tokens_seen": 600732176, "step": 10020, "train_runtime": 128856.5089, "train_tokens_per_second": 4662.024 }, { "epoch": 1.2786989795918369, "grad_norm": 0.6567534118948043, "learning_rate": 2.8812610294830568e-06, "loss": 0.2763176202774048, "num_input_tokens_seen": 601035232, "step": 10025, "train_runtime": 128917.9532, "train_tokens_per_second": 4662.153 }, { "epoch": 1.2793367346938775, "grad_norm": 0.6770265112304864, "learning_rate": 2.8767251155790826e-06, "loss": 0.24007635116577147, "num_input_tokens_seen": 601336112, "step": 10030, "train_runtime": 128981.0975, "train_tokens_per_second": 4662.203 }, { "epoch": 1.2799744897959184, "grad_norm": 0.6954544127397374, "learning_rate": 2.8721913325297434e-06, "loss": 0.23859257698059083, "num_input_tokens_seen": 601621800, "step": 10035, "train_runtime": 129045.5017, "train_tokens_per_second": 4662.09 }, { "epoch": 1.280612244897959, "grad_norm": 0.669167366755921, "learning_rate": 2.8676596848850084e-06, "loss": 0.2485593318939209, "num_input_tokens_seen": 601930960, "step": 10040, "train_runtime": 129104.7849, "train_tokens_per_second": 4662.344 }, { "epoch": 1.28125, "grad_norm": 0.6860955602793227, "learning_rate": 2.8631301771927024e-06, "loss": 0.2497274398803711, "num_input_tokens_seen": 602225936, "step": 10045, "train_runtime": 129164.441, "train_tokens_per_second": 4662.475 }, { "epoch": 1.281887755102041, "grad_norm": 0.6278297822403494, "learning_rate": 2.858602813998501e-06, "loss": 0.2408839702606201, "num_input_tokens_seen": 602528808, "step": 10050, "train_runtime": 129226.8313, "train_tokens_per_second": 4662.567 }, { "epoch": 1.2825255102040816, "grad_norm": 0.7195956124045154, "learning_rate": 2.8540775998459336e-06, "loss": 0.24351954460144043, "num_input_tokens_seen": 602812944, "step": 10055, "train_runtime": 129284.2969, "train_tokens_per_second": 4662.693 }, { "epoch": 1.2831632653061225, "grad_norm": 0.637166229994117, "learning_rate": 2.849554539276361e-06, "loss": 0.25557701587677, "num_input_tokens_seen": 603111072, "step": 10060, "train_runtime": 129340.9474, "train_tokens_per_second": 4662.955 }, { "epoch": 1.2838010204081631, "grad_norm": 0.6242924195871741, "learning_rate": 2.845033636828998e-06, "loss": 0.27079105377197266, "num_input_tokens_seen": 603416472, "step": 10065, "train_runtime": 129408.2548, "train_tokens_per_second": 4662.89 }, { "epoch": 1.284438775510204, "grad_norm": 0.6355558778919869, "learning_rate": 2.840514897040884e-06, "loss": 0.24806299209594726, "num_input_tokens_seen": 603706776, "step": 10070, "train_runtime": 129463.2937, "train_tokens_per_second": 4663.15 }, { "epoch": 1.285076530612245, "grad_norm": 0.6190180007774851, "learning_rate": 2.835998324446887e-06, "loss": 0.25780978202819826, "num_input_tokens_seen": 603991600, "step": 10075, "train_runtime": 129537.7133, "train_tokens_per_second": 4662.67 }, { "epoch": 1.2857142857142856, "grad_norm": 0.68576106924587, "learning_rate": 2.831483923579703e-06, "loss": 0.2651859521865845, "num_input_tokens_seen": 604272496, "step": 10080, "train_runtime": 129600.5575, "train_tokens_per_second": 4662.576 }, { "epoch": 1.2863520408163265, "grad_norm": 0.7292708466163627, "learning_rate": 2.8269716989698547e-06, "loss": 0.23357632160186767, "num_input_tokens_seen": 604576032, "step": 10085, "train_runtime": 129655.3566, "train_tokens_per_second": 4662.947 }, { "epoch": 1.2869897959183674, "grad_norm": 0.7127516238098663, "learning_rate": 2.822461655145669e-06, "loss": 0.23446400165557862, "num_input_tokens_seen": 604883880, "step": 10090, "train_runtime": 129725.2588, "train_tokens_per_second": 4662.807 }, { "epoch": 1.287627551020408, "grad_norm": 0.6253778520629037, "learning_rate": 2.817953796633289e-06, "loss": 0.2427058696746826, "num_input_tokens_seen": 605182136, "step": 10095, "train_runtime": 129781.7084, "train_tokens_per_second": 4663.077 }, { "epoch": 1.288265306122449, "grad_norm": 0.6655998352951639, "learning_rate": 2.813448127956672e-06, "loss": 0.2528971195220947, "num_input_tokens_seen": 605487416, "step": 10100, "train_runtime": 129855.7841, "train_tokens_per_second": 4662.768 }, { "epoch": 1.2889030612244898, "grad_norm": 0.6268315385907461, "learning_rate": 2.8089446536375642e-06, "loss": 0.2563582181930542, "num_input_tokens_seen": 605790784, "step": 10105, "train_runtime": 129915.9073, "train_tokens_per_second": 4662.945 }, { "epoch": 1.2895408163265305, "grad_norm": 0.6868501808514035, "learning_rate": 2.8044433781955196e-06, "loss": 0.2638521671295166, "num_input_tokens_seen": 606089200, "step": 10110, "train_runtime": 129978.0063, "train_tokens_per_second": 4663.014 }, { "epoch": 1.2901785714285714, "grad_norm": 0.6533381998889802, "learning_rate": 2.7999443061478827e-06, "loss": 0.2558642148971558, "num_input_tokens_seen": 606392880, "step": 10115, "train_runtime": 130040.8954, "train_tokens_per_second": 4663.094 }, { "epoch": 1.2908163265306123, "grad_norm": 0.603724501405975, "learning_rate": 2.795447442009786e-06, "loss": 0.2480170249938965, "num_input_tokens_seen": 606707200, "step": 10120, "train_runtime": 130108.2241, "train_tokens_per_second": 4663.096 }, { "epoch": 1.291454081632653, "grad_norm": 0.6253420037521669, "learning_rate": 2.7909527902941467e-06, "loss": 0.2574573516845703, "num_input_tokens_seen": 607015712, "step": 10125, "train_runtime": 130180.4124, "train_tokens_per_second": 4662.881 }, { "epoch": 1.2920918367346939, "grad_norm": 0.6389694583553371, "learning_rate": 2.786460355511662e-06, "loss": 0.23451039791107178, "num_input_tokens_seen": 607325304, "step": 10130, "train_runtime": 130241.697, "train_tokens_per_second": 4663.064 }, { "epoch": 1.2927295918367347, "grad_norm": 0.6737598501065684, "learning_rate": 2.7819701421708047e-06, "loss": 0.2471921443939209, "num_input_tokens_seen": 607629136, "step": 10135, "train_runtime": 130299.5059, "train_tokens_per_second": 4663.326 }, { "epoch": 1.2933673469387754, "grad_norm": 0.6231189021705574, "learning_rate": 2.7774821547778176e-06, "loss": 0.240172815322876, "num_input_tokens_seen": 607925944, "step": 10140, "train_runtime": 130358.8521, "train_tokens_per_second": 4663.48 }, { "epoch": 1.2940051020408163, "grad_norm": 0.6042268538241072, "learning_rate": 2.772996397836704e-06, "loss": 0.23002943992614747, "num_input_tokens_seen": 608223488, "step": 10145, "train_runtime": 130429.0103, "train_tokens_per_second": 4663.253 }, { "epoch": 1.2946428571428572, "grad_norm": 0.6317798878311383, "learning_rate": 2.768512875849242e-06, "loss": 0.23823139667510987, "num_input_tokens_seen": 608519144, "step": 10150, "train_runtime": 130489.7291, "train_tokens_per_second": 4663.349 }, { "epoch": 1.2952806122448979, "grad_norm": 0.6300964049422993, "learning_rate": 2.7640315933149568e-06, "loss": 0.24309196472167968, "num_input_tokens_seen": 608803176, "step": 10155, "train_runtime": 130546.3195, "train_tokens_per_second": 4663.503 }, { "epoch": 1.2959183673469388, "grad_norm": 0.6491467073046057, "learning_rate": 2.7595525547311257e-06, "loss": 0.23561034202575684, "num_input_tokens_seen": 609090424, "step": 10160, "train_runtime": 130612.8179, "train_tokens_per_second": 4663.328 }, { "epoch": 1.2965561224489797, "grad_norm": 0.6629929111370925, "learning_rate": 2.755075764592777e-06, "loss": 0.24338645935058595, "num_input_tokens_seen": 609398400, "step": 10165, "train_runtime": 130659.6588, "train_tokens_per_second": 4664.013 }, { "epoch": 1.2971938775510203, "grad_norm": 0.6547865944820238, "learning_rate": 2.750601227392687e-06, "loss": 0.24423551559448242, "num_input_tokens_seen": 609687192, "step": 10170, "train_runtime": 130713.6987, "train_tokens_per_second": 4664.295 }, { "epoch": 1.2978316326530612, "grad_norm": 0.6243956844176494, "learning_rate": 2.7461289476213617e-06, "loss": 0.2264718532562256, "num_input_tokens_seen": 609985088, "step": 10175, "train_runtime": 130779.8484, "train_tokens_per_second": 4664.213 }, { "epoch": 1.2984693877551021, "grad_norm": 0.631937100184549, "learning_rate": 2.741658929767045e-06, "loss": 0.22623286247253419, "num_input_tokens_seen": 610288152, "step": 10180, "train_runtime": 130847.9555, "train_tokens_per_second": 4664.102 }, { "epoch": 1.2991071428571428, "grad_norm": 0.6201612686743121, "learning_rate": 2.7371911783157178e-06, "loss": 0.22912931442260742, "num_input_tokens_seen": 610592400, "step": 10185, "train_runtime": 130905.1217, "train_tokens_per_second": 4664.389 }, { "epoch": 1.2997448979591837, "grad_norm": 0.5935421690630087, "learning_rate": 2.7327256977510764e-06, "loss": 0.24432737827301027, "num_input_tokens_seen": 610905200, "step": 10190, "train_runtime": 130961.7409, "train_tokens_per_second": 4664.761 }, { "epoch": 1.3003826530612246, "grad_norm": 0.7009681464172817, "learning_rate": 2.7282624925545432e-06, "loss": 0.22099885940551758, "num_input_tokens_seen": 611203784, "step": 10195, "train_runtime": 131019.5135, "train_tokens_per_second": 4664.983 }, { "epoch": 1.3010204081632653, "grad_norm": 0.6131125029672629, "learning_rate": 2.723801567205256e-06, "loss": 0.22445275783538818, "num_input_tokens_seen": 611490048, "step": 10200, "train_runtime": 131088.2208, "train_tokens_per_second": 4664.722 }, { "epoch": 1.3016581632653061, "grad_norm": 0.7160100618511935, "learning_rate": 2.7193429261800657e-06, "loss": 0.24154410362243653, "num_input_tokens_seen": 611776816, "step": 10205, "train_runtime": 131150.4569, "train_tokens_per_second": 4664.695 }, { "epoch": 1.302295918367347, "grad_norm": 0.6989238755659404, "learning_rate": 2.7148865739535303e-06, "loss": 0.20784764289855956, "num_input_tokens_seen": 612075208, "step": 10210, "train_runtime": 131213.6782, "train_tokens_per_second": 4664.721 }, { "epoch": 1.3029336734693877, "grad_norm": 0.6930432977491332, "learning_rate": 2.710432514997909e-06, "loss": 0.24748585224151612, "num_input_tokens_seen": 612367480, "step": 10215, "train_runtime": 131276.4751, "train_tokens_per_second": 4664.716 }, { "epoch": 1.3035714285714286, "grad_norm": 0.5908520343258692, "learning_rate": 2.7059807537831624e-06, "loss": 0.2211530923843384, "num_input_tokens_seen": 612670920, "step": 10220, "train_runtime": 131344.1066, "train_tokens_per_second": 4664.624 }, { "epoch": 1.3042091836734695, "grad_norm": 0.6649156510386195, "learning_rate": 2.7015312947769436e-06, "loss": 0.25975823402404785, "num_input_tokens_seen": 612973912, "step": 10225, "train_runtime": 131405.1473, "train_tokens_per_second": 4664.763 }, { "epoch": 1.3048469387755102, "grad_norm": 0.6940272303736259, "learning_rate": 2.6970841424445947e-06, "loss": 0.2528405666351318, "num_input_tokens_seen": 613260264, "step": 10230, "train_runtime": 131479.6405, "train_tokens_per_second": 4664.298 }, { "epoch": 1.305484693877551, "grad_norm": 0.6716976167451483, "learning_rate": 2.692639301249144e-06, "loss": 0.23514809608459472, "num_input_tokens_seen": 613563136, "step": 10235, "train_runtime": 131550.143, "train_tokens_per_second": 4664.101 }, { "epoch": 1.306122448979592, "grad_norm": 0.6638311072307366, "learning_rate": 2.6881967756513004e-06, "loss": 0.22921185493469237, "num_input_tokens_seen": 613870040, "step": 10240, "train_runtime": 131619.2851, "train_tokens_per_second": 4663.982 }, { "epoch": 1.3067602040816326, "grad_norm": 0.6539008630229388, "learning_rate": 2.6837565701094505e-06, "loss": 0.24595980644226073, "num_input_tokens_seen": 614171488, "step": 10245, "train_runtime": 131690.4363, "train_tokens_per_second": 4663.752 }, { "epoch": 1.3073979591836735, "grad_norm": 0.6766006041244161, "learning_rate": 2.679318689079645e-06, "loss": 0.23799505233764648, "num_input_tokens_seen": 614454400, "step": 10250, "train_runtime": 131756.9971, "train_tokens_per_second": 4663.543 }, { "epoch": 1.3080357142857144, "grad_norm": 0.7066404687080433, "learning_rate": 2.6748831370156148e-06, "loss": 0.22920284271240235, "num_input_tokens_seen": 614741568, "step": 10255, "train_runtime": 131830.9757, "train_tokens_per_second": 4663.104 }, { "epoch": 1.308673469387755, "grad_norm": 0.677234380061771, "learning_rate": 2.6704499183687404e-06, "loss": 0.24149069786071778, "num_input_tokens_seen": 615034424, "step": 10260, "train_runtime": 131902.8326, "train_tokens_per_second": 4662.784 }, { "epoch": 1.309311224489796, "grad_norm": 0.6132148524381859, "learning_rate": 2.6660190375880656e-06, "loss": 0.26289279460906984, "num_input_tokens_seen": 615344688, "step": 10265, "train_runtime": 131975.4333, "train_tokens_per_second": 4662.57 }, { "epoch": 1.3099489795918369, "grad_norm": 0.9180387390052087, "learning_rate": 2.661590499120296e-06, "loss": 0.24758877754211425, "num_input_tokens_seen": 615641624, "step": 10270, "train_runtime": 132029.5093, "train_tokens_per_second": 4662.909 }, { "epoch": 1.3105867346938775, "grad_norm": 0.6479016863042246, "learning_rate": 2.657164307409773e-06, "loss": 0.2354414939880371, "num_input_tokens_seen": 615933960, "step": 10275, "train_runtime": 132082.9803, "train_tokens_per_second": 4663.235 }, { "epoch": 1.3112244897959184, "grad_norm": 0.5807944678730947, "learning_rate": 2.6527404668984907e-06, "loss": 0.23063254356384277, "num_input_tokens_seen": 616234048, "step": 10280, "train_runtime": 132150.066, "train_tokens_per_second": 4663.138 }, { "epoch": 1.311862244897959, "grad_norm": 0.7136028083098015, "learning_rate": 2.648318982026082e-06, "loss": 0.2652731418609619, "num_input_tokens_seen": 616536328, "step": 10285, "train_runtime": 132224.6383, "train_tokens_per_second": 4662.795 }, { "epoch": 1.3125, "grad_norm": 0.6356233393225613, "learning_rate": 2.6438998572298157e-06, "loss": 0.25313777923583985, "num_input_tokens_seen": 616850912, "step": 10290, "train_runtime": 132293.9362, "train_tokens_per_second": 4662.73 }, { "epoch": 1.313137755102041, "grad_norm": 0.6442941013212176, "learning_rate": 2.639483096944593e-06, "loss": 0.25389604568481444, "num_input_tokens_seen": 617141152, "step": 10295, "train_runtime": 132361.2256, "train_tokens_per_second": 4662.552 }, { "epoch": 1.3137755102040816, "grad_norm": 0.6479525122954625, "learning_rate": 2.63506870560294e-06, "loss": 0.249885892868042, "num_input_tokens_seen": 617437848, "step": 10300, "train_runtime": 132425.0939, "train_tokens_per_second": 4662.544 }, { "epoch": 1.3144132653061225, "grad_norm": 0.5994254511342957, "learning_rate": 2.6306566876350072e-06, "loss": 0.24343361854553222, "num_input_tokens_seen": 617729280, "step": 10305, "train_runtime": 132492.0753, "train_tokens_per_second": 4662.387 }, { "epoch": 1.3150510204081631, "grad_norm": 0.7121766419687681, "learning_rate": 2.626247047468563e-06, "loss": 0.24100232124328613, "num_input_tokens_seen": 618037360, "step": 10310, "train_runtime": 132548.4205, "train_tokens_per_second": 4662.729 }, { "epoch": 1.315688775510204, "grad_norm": 0.6699447714105571, "learning_rate": 2.6218397895289893e-06, "loss": 0.25350179672241213, "num_input_tokens_seen": 618337752, "step": 10315, "train_runtime": 132611.4158, "train_tokens_per_second": 4662.779 }, { "epoch": 1.316326530612245, "grad_norm": 0.7024153498979675, "learning_rate": 2.617434918239278e-06, "loss": 0.2486175775527954, "num_input_tokens_seen": 618618520, "step": 10320, "train_runtime": 132681.8293, "train_tokens_per_second": 4662.421 }, { "epoch": 1.3169642857142856, "grad_norm": 0.6137446766230643, "learning_rate": 2.6130324380200234e-06, "loss": 0.22817761898040773, "num_input_tokens_seen": 618916832, "step": 10325, "train_runtime": 132748.6683, "train_tokens_per_second": 4662.32 }, { "epoch": 1.3176020408163265, "grad_norm": 0.7594642166546341, "learning_rate": 2.6086323532894225e-06, "loss": 0.23662309646606444, "num_input_tokens_seen": 619203704, "step": 10330, "train_runtime": 132813.1886, "train_tokens_per_second": 4662.215 }, { "epoch": 1.3182397959183674, "grad_norm": 0.5828183887503053, "learning_rate": 2.604234668463268e-06, "loss": 0.2248455047607422, "num_input_tokens_seen": 619499320, "step": 10335, "train_runtime": 132877.5761, "train_tokens_per_second": 4662.181 }, { "epoch": 1.318877551020408, "grad_norm": 0.6646006757856918, "learning_rate": 2.5998393879549444e-06, "loss": 0.2405029296875, "num_input_tokens_seen": 619778688, "step": 10340, "train_runtime": 132946.09, "train_tokens_per_second": 4661.88 }, { "epoch": 1.319515306122449, "grad_norm": 0.7006720415594211, "learning_rate": 2.5954465161754226e-06, "loss": 0.25348052978515623, "num_input_tokens_seen": 620077992, "step": 10345, "train_runtime": 133004.7128, "train_tokens_per_second": 4662.075 }, { "epoch": 1.3201530612244898, "grad_norm": 0.6607904031477573, "learning_rate": 2.5910560575332524e-06, "loss": 0.2627995491027832, "num_input_tokens_seen": 620382504, "step": 10350, "train_runtime": 133074.7034, "train_tokens_per_second": 4661.912 }, { "epoch": 1.3207908163265305, "grad_norm": 0.6634275943477552, "learning_rate": 2.5866680164345704e-06, "loss": 0.24571120738983154, "num_input_tokens_seen": 620684224, "step": 10355, "train_runtime": 133150.8163, "train_tokens_per_second": 4661.513 }, { "epoch": 1.3214285714285714, "grad_norm": 0.6313433861607889, "learning_rate": 2.5822823972830825e-06, "loss": 0.2279362201690674, "num_input_tokens_seen": 620975264, "step": 10360, "train_runtime": 133221.831, "train_tokens_per_second": 4661.212 }, { "epoch": 1.3220663265306123, "grad_norm": 0.6906529316647421, "learning_rate": 2.5778992044800597e-06, "loss": 0.2523262739181519, "num_input_tokens_seen": 621291808, "step": 10365, "train_runtime": 133291.0334, "train_tokens_per_second": 4661.167 }, { "epoch": 1.322704081632653, "grad_norm": 0.6690653556788901, "learning_rate": 2.573518442424343e-06, "loss": 0.24666938781738282, "num_input_tokens_seen": 621598720, "step": 10370, "train_runtime": 133350.6628, "train_tokens_per_second": 4661.385 }, { "epoch": 1.3233418367346939, "grad_norm": 0.6196881118927071, "learning_rate": 2.569140115512338e-06, "loss": 0.2609063148498535, "num_input_tokens_seen": 621905856, "step": 10375, "train_runtime": 133415.4702, "train_tokens_per_second": 4661.422 }, { "epoch": 1.3239795918367347, "grad_norm": 0.6112347227065951, "learning_rate": 2.564764228137996e-06, "loss": 0.26653361320495605, "num_input_tokens_seen": 622199408, "step": 10380, "train_runtime": 133478.0955, "train_tokens_per_second": 4661.435 }, { "epoch": 1.3246173469387754, "grad_norm": 0.7720781550947031, "learning_rate": 2.5603907846928277e-06, "loss": 0.2378302812576294, "num_input_tokens_seen": 622480856, "step": 10385, "train_runtime": 133546.1368, "train_tokens_per_second": 4661.167 }, { "epoch": 1.3252551020408163, "grad_norm": 0.6975726873758948, "learning_rate": 2.556019789565889e-06, "loss": 0.2469649314880371, "num_input_tokens_seen": 622788032, "step": 10390, "train_runtime": 133613.1506, "train_tokens_per_second": 4661.128 }, { "epoch": 1.3258928571428572, "grad_norm": 0.689804716227359, "learning_rate": 2.5516512471437783e-06, "loss": 0.23420460224151612, "num_input_tokens_seen": 623092288, "step": 10395, "train_runtime": 133674.9404, "train_tokens_per_second": 4661.25 }, { "epoch": 1.3265306122448979, "grad_norm": 0.6182418828390731, "learning_rate": 2.547285161810634e-06, "loss": 0.24218957424163817, "num_input_tokens_seen": 623398424, "step": 10400, "train_runtime": 133738.6364, "train_tokens_per_second": 4661.319 }, { "epoch": 1.3271683673469388, "grad_norm": 0.5704768998072005, "learning_rate": 2.5429215379481267e-06, "loss": 0.26021337509155273, "num_input_tokens_seen": 623707200, "step": 10405, "train_runtime": 133796.5872, "train_tokens_per_second": 4661.608 }, { "epoch": 1.3278061224489797, "grad_norm": 0.6628471151287494, "learning_rate": 2.5385603799354574e-06, "loss": 0.24724078178405762, "num_input_tokens_seen": 624007680, "step": 10410, "train_runtime": 133876.0981, "train_tokens_per_second": 4661.084 }, { "epoch": 1.3284438775510203, "grad_norm": 0.6670291717928468, "learning_rate": 2.534201692149354e-06, "loss": 0.245704984664917, "num_input_tokens_seen": 624311856, "step": 10415, "train_runtime": 133933.8722, "train_tokens_per_second": 4661.344 }, { "epoch": 1.3290816326530612, "grad_norm": 0.6604817818216152, "learning_rate": 2.5298454789640636e-06, "loss": 0.2439598560333252, "num_input_tokens_seen": 624609024, "step": 10420, "train_runtime": 133991.0659, "train_tokens_per_second": 4661.572 }, { "epoch": 1.3297193877551021, "grad_norm": 0.6446840990830751, "learning_rate": 2.5254917447513503e-06, "loss": 0.2502993106842041, "num_input_tokens_seen": 624917624, "step": 10425, "train_runtime": 134047.6686, "train_tokens_per_second": 4661.906 }, { "epoch": 1.3303571428571428, "grad_norm": 0.5953900030540359, "learning_rate": 2.5211404938804917e-06, "loss": 0.2397331953048706, "num_input_tokens_seen": 625217040, "step": 10430, "train_runtime": 134098.6507, "train_tokens_per_second": 4662.366 }, { "epoch": 1.3309948979591837, "grad_norm": 0.6145028923979782, "learning_rate": 2.5167917307182675e-06, "loss": 0.26725015640258787, "num_input_tokens_seen": 625517304, "step": 10435, "train_runtime": 134161.939, "train_tokens_per_second": 4662.405 }, { "epoch": 1.3316326530612246, "grad_norm": 0.7190894950304159, "learning_rate": 2.5124454596289704e-06, "loss": 0.22888376712799072, "num_input_tokens_seen": 625814712, "step": 10440, "train_runtime": 134220.795, "train_tokens_per_second": 4662.576 }, { "epoch": 1.3322704081632653, "grad_norm": 0.6073485728861909, "learning_rate": 2.508101684974387e-06, "loss": 0.22669432163238526, "num_input_tokens_seen": 626111760, "step": 10445, "train_runtime": 134280.5503, "train_tokens_per_second": 4662.714 }, { "epoch": 1.3329081632653061, "grad_norm": 0.5863204642161498, "learning_rate": 2.5037604111137935e-06, "loss": 0.25122799873352053, "num_input_tokens_seen": 626416344, "step": 10450, "train_runtime": 134337.0694, "train_tokens_per_second": 4663.019 }, { "epoch": 1.333545918367347, "grad_norm": 0.6400215793325248, "learning_rate": 2.4994216424039637e-06, "loss": 0.2533901214599609, "num_input_tokens_seen": 626702664, "step": 10455, "train_runtime": 134399.6104, "train_tokens_per_second": 4662.98 }, { "epoch": 1.3341836734693877, "grad_norm": 0.6302628166382904, "learning_rate": 2.495085383199159e-06, "loss": 0.23258514404296876, "num_input_tokens_seen": 627006184, "step": 10460, "train_runtime": 134479.1024, "train_tokens_per_second": 4662.48 }, { "epoch": 1.3348214285714286, "grad_norm": 0.650789937664513, "learning_rate": 2.4907516378511137e-06, "loss": 0.2518965005874634, "num_input_tokens_seen": 627310752, "step": 10465, "train_runtime": 134536.4031, "train_tokens_per_second": 4662.758 }, { "epoch": 1.3354591836734695, "grad_norm": 0.6174199968443884, "learning_rate": 2.486420410709043e-06, "loss": 0.2388655424118042, "num_input_tokens_seen": 627617320, "step": 10470, "train_runtime": 134602.9343, "train_tokens_per_second": 4662.731 }, { "epoch": 1.3360969387755102, "grad_norm": 0.6387655861896523, "learning_rate": 2.482091706119642e-06, "loss": 0.24844703674316407, "num_input_tokens_seen": 627911064, "step": 10475, "train_runtime": 134668.1398, "train_tokens_per_second": 4662.655 }, { "epoch": 1.336734693877551, "grad_norm": 0.6694278283384967, "learning_rate": 2.4777655284270623e-06, "loss": 0.2570790767669678, "num_input_tokens_seen": 628219896, "step": 10480, "train_runtime": 134724.0819, "train_tokens_per_second": 4663.011 }, { "epoch": 1.337372448979592, "grad_norm": 0.633413740687077, "learning_rate": 2.473441881972927e-06, "loss": 0.2255763053894043, "num_input_tokens_seen": 628507776, "step": 10485, "train_runtime": 134786.9096, "train_tokens_per_second": 4662.973 }, { "epoch": 1.3380102040816326, "grad_norm": 0.7613036807692822, "learning_rate": 2.4691207710963185e-06, "loss": 0.25465667247772217, "num_input_tokens_seen": 628810656, "step": 10490, "train_runtime": 134851.944, "train_tokens_per_second": 4662.971 }, { "epoch": 1.3386479591836735, "grad_norm": 0.6566965367313716, "learning_rate": 2.464802200133772e-06, "loss": 0.25304470062255857, "num_input_tokens_seen": 629109008, "step": 10495, "train_runtime": 134909.6987, "train_tokens_per_second": 4663.186 }, { "epoch": 1.3392857142857144, "grad_norm": 0.711865578943311, "learning_rate": 2.4604861734192755e-06, "loss": 0.24025123119354247, "num_input_tokens_seen": 629411016, "step": 10500, "train_runtime": 134983.6166, "train_tokens_per_second": 4662.87 }, { "epoch": 1.339923469387755, "grad_norm": 0.6440249213267886, "learning_rate": 2.456172695284263e-06, "loss": 0.22090387344360352, "num_input_tokens_seen": 629693256, "step": 10505, "train_runtime": 135048.5715, "train_tokens_per_second": 4662.717 }, { "epoch": 1.340561224489796, "grad_norm": 0.6416653929775141, "learning_rate": 2.4518617700576116e-06, "loss": 0.22885353565216066, "num_input_tokens_seen": 629992856, "step": 10510, "train_runtime": 135114.8606, "train_tokens_per_second": 4662.647 }, { "epoch": 1.3411989795918369, "grad_norm": 0.6815679127747125, "learning_rate": 2.447553402065637e-06, "loss": 0.22661955356597902, "num_input_tokens_seen": 630288352, "step": 10515, "train_runtime": 135181.9621, "train_tokens_per_second": 4662.518 }, { "epoch": 1.3418367346938775, "grad_norm": 0.5811742789874202, "learning_rate": 2.4432475956320824e-06, "loss": 0.23862118721008302, "num_input_tokens_seen": 630594376, "step": 10520, "train_runtime": 135247.0115, "train_tokens_per_second": 4662.538 }, { "epoch": 1.3424744897959184, "grad_norm": 0.629641888521553, "learning_rate": 2.4389443550781304e-06, "loss": 0.24364774227142333, "num_input_tokens_seen": 630908936, "step": 10525, "train_runtime": 135301.6324, "train_tokens_per_second": 4662.981 }, { "epoch": 1.343112244897959, "grad_norm": 0.6889188070778034, "learning_rate": 2.4346436847223836e-06, "loss": 0.24048988819122313, "num_input_tokens_seen": 631206888, "step": 10530, "train_runtime": 135363.3059, "train_tokens_per_second": 4663.058 }, { "epoch": 1.34375, "grad_norm": 0.5503005271499407, "learning_rate": 2.4303455888808618e-06, "loss": 0.23441269397735595, "num_input_tokens_seen": 631507840, "step": 10535, "train_runtime": 135426.053, "train_tokens_per_second": 4663.119 }, { "epoch": 1.344387755102041, "grad_norm": 0.5943642128916533, "learning_rate": 2.4260500718670036e-06, "loss": 0.21130878925323487, "num_input_tokens_seen": 631812336, "step": 10540, "train_runtime": 135487.2071, "train_tokens_per_second": 4663.262 }, { "epoch": 1.3450255102040816, "grad_norm": 0.7419471964944657, "learning_rate": 2.4217571379916673e-06, "loss": 0.24795031547546387, "num_input_tokens_seen": 632100056, "step": 10545, "train_runtime": 135556.5893, "train_tokens_per_second": 4662.998 }, { "epoch": 1.3456632653061225, "grad_norm": 0.726479295167947, "learning_rate": 2.4174667915631038e-06, "loss": 0.23710207939147948, "num_input_tokens_seen": 632371248, "step": 10550, "train_runtime": 135622.3325, "train_tokens_per_second": 4662.737 }, { "epoch": 1.3463010204081631, "grad_norm": 0.6392188009075147, "learning_rate": 2.413179036886978e-06, "loss": 0.24065628051757812, "num_input_tokens_seen": 632679304, "step": 10555, "train_runtime": 135680.8874, "train_tokens_per_second": 4662.995 }, { "epoch": 1.346938775510204, "grad_norm": 0.6288809188937013, "learning_rate": 2.408893878266355e-06, "loss": 0.23537743091583252, "num_input_tokens_seen": 632968968, "step": 10560, "train_runtime": 135736.8122, "train_tokens_per_second": 4663.208 }, { "epoch": 1.347576530612245, "grad_norm": 0.5858486552796457, "learning_rate": 2.404611320001686e-06, "loss": 0.24897806644439696, "num_input_tokens_seen": 633263232, "step": 10565, "train_runtime": 135803.3521, "train_tokens_per_second": 4663.09 }, { "epoch": 1.3482142857142856, "grad_norm": 0.6096113101348661, "learning_rate": 2.4003313663908182e-06, "loss": 0.25921201705932617, "num_input_tokens_seen": 633555128, "step": 10570, "train_runtime": 135863.5392, "train_tokens_per_second": 4663.173 }, { "epoch": 1.3488520408163265, "grad_norm": 0.7193883193154333, "learning_rate": 2.3960540217289856e-06, "loss": 0.25274574756622314, "num_input_tokens_seen": 633860472, "step": 10575, "train_runtime": 135938.6281, "train_tokens_per_second": 4662.843 }, { "epoch": 1.3494897959183674, "grad_norm": 0.6737362160482706, "learning_rate": 2.3917792903088013e-06, "loss": 0.24594407081604003, "num_input_tokens_seen": 634153200, "step": 10580, "train_runtime": 136000.8431, "train_tokens_per_second": 4662.862 }, { "epoch": 1.350127551020408, "grad_norm": 0.8204822910763974, "learning_rate": 2.387507176420256e-06, "loss": 0.22988698482513428, "num_input_tokens_seen": 634449192, "step": 10585, "train_runtime": 136061.1127, "train_tokens_per_second": 4662.972 }, { "epoch": 1.350765306122449, "grad_norm": 0.6617703724129987, "learning_rate": 2.383237684350716e-06, "loss": 0.24116842746734618, "num_input_tokens_seen": 634753368, "step": 10590, "train_runtime": 136134.8489, "train_tokens_per_second": 4662.681 }, { "epoch": 1.3514030612244898, "grad_norm": 0.6979442026854079, "learning_rate": 2.378970818384914e-06, "loss": 0.25265040397644045, "num_input_tokens_seen": 635055304, "step": 10595, "train_runtime": 136203.1716, "train_tokens_per_second": 4662.559 }, { "epoch": 1.3520408163265305, "grad_norm": 0.658357782720236, "learning_rate": 2.374706582804948e-06, "loss": 0.2619814395904541, "num_input_tokens_seen": 635363696, "step": 10600, "train_runtime": 136275.2005, "train_tokens_per_second": 4662.357 }, { "epoch": 1.3526785714285714, "grad_norm": 0.6510269641150819, "learning_rate": 2.3704449818902763e-06, "loss": 0.24418268203735352, "num_input_tokens_seen": 635657176, "step": 10605, "train_runtime": 136343.0031, "train_tokens_per_second": 4662.191 }, { "epoch": 1.3533163265306123, "grad_norm": 0.6124389034198514, "learning_rate": 2.366186019917713e-06, "loss": 0.2479926109313965, "num_input_tokens_seen": 635970392, "step": 10610, "train_runtime": 136415.4066, "train_tokens_per_second": 4662.013 }, { "epoch": 1.353954081632653, "grad_norm": 0.6788895914890781, "learning_rate": 2.3619297011614236e-06, "loss": 0.25220503807067873, "num_input_tokens_seen": 636274720, "step": 10615, "train_runtime": 136469.385, "train_tokens_per_second": 4662.399 }, { "epoch": 1.3545918367346939, "grad_norm": 0.6662601504754513, "learning_rate": 2.3576760298929236e-06, "loss": 0.2631206512451172, "num_input_tokens_seen": 636585848, "step": 10620, "train_runtime": 136540.6342, "train_tokens_per_second": 4662.245 }, { "epoch": 1.3552295918367347, "grad_norm": 0.6569193427518427, "learning_rate": 2.353425010381063e-06, "loss": 0.23456768989562987, "num_input_tokens_seen": 636902600, "step": 10625, "train_runtime": 136587.5461, "train_tokens_per_second": 4662.962 }, { "epoch": 1.3558673469387754, "grad_norm": 0.5908036238213901, "learning_rate": 2.349176646892045e-06, "loss": 0.2443864107131958, "num_input_tokens_seen": 637205080, "step": 10630, "train_runtime": 136654.3475, "train_tokens_per_second": 4662.897 }, { "epoch": 1.3565051020408163, "grad_norm": 0.6739611775553626, "learning_rate": 2.344930943689393e-06, "loss": 0.23467619419097902, "num_input_tokens_seen": 637486312, "step": 10635, "train_runtime": 136724.48, "train_tokens_per_second": 4662.562 }, { "epoch": 1.3571428571428572, "grad_norm": 0.639161234478945, "learning_rate": 2.3406879050339664e-06, "loss": 0.25684666633605957, "num_input_tokens_seen": 637788312, "step": 10640, "train_runtime": 136780.9908, "train_tokens_per_second": 4662.843 }, { "epoch": 1.3577806122448979, "grad_norm": 0.6199280486615185, "learning_rate": 2.3364475351839573e-06, "loss": 0.23010401725769042, "num_input_tokens_seen": 638080600, "step": 10645, "train_runtime": 136850.3767, "train_tokens_per_second": 4662.615 }, { "epoch": 1.3584183673469388, "grad_norm": 0.7195215166221605, "learning_rate": 2.3322098383948666e-06, "loss": 0.26816473007202146, "num_input_tokens_seen": 638383856, "step": 10650, "train_runtime": 136914.3956, "train_tokens_per_second": 4662.65 }, { "epoch": 1.3590561224489797, "grad_norm": 0.6682298338800575, "learning_rate": 2.327974818919521e-06, "loss": 0.24030332565307616, "num_input_tokens_seen": 638676280, "step": 10655, "train_runtime": 136986.5008, "train_tokens_per_second": 4662.33 }, { "epoch": 1.3596938775510203, "grad_norm": 0.6530466542090518, "learning_rate": 2.323742481008059e-06, "loss": 0.2469203233718872, "num_input_tokens_seen": 638982936, "step": 10660, "train_runtime": 137053.4071, "train_tokens_per_second": 4662.292 }, { "epoch": 1.3603316326530612, "grad_norm": 0.646929425391726, "learning_rate": 2.3195128289079265e-06, "loss": 0.2459321975708008, "num_input_tokens_seen": 639278712, "step": 10665, "train_runtime": 137127.2866, "train_tokens_per_second": 4661.937 }, { "epoch": 1.3609693877551021, "grad_norm": 0.7074087517351287, "learning_rate": 2.315285866863875e-06, "loss": 0.2579158306121826, "num_input_tokens_seen": 639577152, "step": 10670, "train_runtime": 137182.26, "train_tokens_per_second": 4662.244 }, { "epoch": 1.3616071428571428, "grad_norm": 0.6926672430737997, "learning_rate": 2.3110615991179556e-06, "loss": 0.24455657005310058, "num_input_tokens_seen": 639864128, "step": 10675, "train_runtime": 137237.5477, "train_tokens_per_second": 4662.457 }, { "epoch": 1.3622448979591837, "grad_norm": 0.6265849100101015, "learning_rate": 2.3068400299095172e-06, "loss": 0.2326984405517578, "num_input_tokens_seen": 640165968, "step": 10680, "train_runtime": 137301.6068, "train_tokens_per_second": 4662.48 }, { "epoch": 1.3628826530612246, "grad_norm": 0.5785532785540959, "learning_rate": 2.302621163475198e-06, "loss": 0.22290825843811035, "num_input_tokens_seen": 640467656, "step": 10685, "train_runtime": 137377.494, "train_tokens_per_second": 4662.1 }, { "epoch": 1.3635204081632653, "grad_norm": 0.6051768783529228, "learning_rate": 2.2984050040489266e-06, "loss": 0.2333277702331543, "num_input_tokens_seen": 640758208, "step": 10690, "train_runtime": 137446.7759, "train_tokens_per_second": 4661.864 }, { "epoch": 1.3641581632653061, "grad_norm": 0.6097162866857359, "learning_rate": 2.2941915558619123e-06, "loss": 0.24473967552185058, "num_input_tokens_seen": 641051696, "step": 10695, "train_runtime": 137513.7724, "train_tokens_per_second": 4661.727 }, { "epoch": 1.364795918367347, "grad_norm": 0.6645129467960652, "learning_rate": 2.2899808231426447e-06, "loss": 0.24537134170532227, "num_input_tokens_seen": 641360072, "step": 10700, "train_runtime": 137582.2569, "train_tokens_per_second": 4661.648 }, { "epoch": 1.3654336734693877, "grad_norm": 0.5901411951603963, "learning_rate": 2.28577281011689e-06, "loss": 0.25689105987548827, "num_input_tokens_seen": 641670816, "step": 10705, "train_runtime": 137648.1907, "train_tokens_per_second": 4661.673 }, { "epoch": 1.3660714285714286, "grad_norm": 0.6625252011700808, "learning_rate": 2.281567521007678e-06, "loss": 0.23990726470947266, "num_input_tokens_seen": 641974704, "step": 10710, "train_runtime": 137715.534, "train_tokens_per_second": 4661.6 }, { "epoch": 1.3667091836734695, "grad_norm": 0.5962854350741728, "learning_rate": 2.277364960035316e-06, "loss": 0.2552059173583984, "num_input_tokens_seen": 642271216, "step": 10715, "train_runtime": 137774.8607, "train_tokens_per_second": 4661.745 }, { "epoch": 1.3673469387755102, "grad_norm": 0.599624008965094, "learning_rate": 2.2731651314173665e-06, "loss": 0.2545493125915527, "num_input_tokens_seen": 642578080, "step": 10720, "train_runtime": 137832.0187, "train_tokens_per_second": 4662.038 }, { "epoch": 1.367984693877551, "grad_norm": 0.625085449046815, "learning_rate": 2.2689680393686457e-06, "loss": 0.2324829578399658, "num_input_tokens_seen": 642872696, "step": 10725, "train_runtime": 137903.51, "train_tokens_per_second": 4661.757 }, { "epoch": 1.368622448979592, "grad_norm": 0.5746890026603176, "learning_rate": 2.2647736881012337e-06, "loss": 0.2443406343460083, "num_input_tokens_seen": 643173696, "step": 10730, "train_runtime": 137972.705, "train_tokens_per_second": 4661.601 }, { "epoch": 1.3692602040816326, "grad_norm": 0.5818243039191208, "learning_rate": 2.2605820818244563e-06, "loss": 0.21316955089569092, "num_input_tokens_seen": 643471536, "step": 10735, "train_runtime": 138025.5767, "train_tokens_per_second": 4661.973 }, { "epoch": 1.3698979591836735, "grad_norm": 0.5937263833030431, "learning_rate": 2.256393224744878e-06, "loss": 0.27692992687225343, "num_input_tokens_seen": 643787880, "step": 10740, "train_runtime": 138088.0402, "train_tokens_per_second": 4662.155 }, { "epoch": 1.3705357142857144, "grad_norm": 0.6711663853709126, "learning_rate": 2.252207121066311e-06, "loss": 0.22586865425109864, "num_input_tokens_seen": 644091064, "step": 10745, "train_runtime": 138150.7791, "train_tokens_per_second": 4662.233 }, { "epoch": 1.371173469387755, "grad_norm": 0.6624536991372643, "learning_rate": 2.248023774989804e-06, "loss": 0.23344554901123046, "num_input_tokens_seen": 644385424, "step": 10750, "train_runtime": 138217.7475, "train_tokens_per_second": 4662.103 }, { "epoch": 1.371811224489796, "grad_norm": 0.645300765417727, "learning_rate": 2.2438431907136365e-06, "loss": 0.25888876914978026, "num_input_tokens_seen": 644697888, "step": 10755, "train_runtime": 138284.0196, "train_tokens_per_second": 4662.129 }, { "epoch": 1.3724489795918369, "grad_norm": 0.6695649211368374, "learning_rate": 2.2396653724333167e-06, "loss": 0.23562912940979003, "num_input_tokens_seen": 644996744, "step": 10760, "train_runtime": 138354.819, "train_tokens_per_second": 4661.903 }, { "epoch": 1.3730867346938775, "grad_norm": 0.7433713974810475, "learning_rate": 2.235490324341577e-06, "loss": 0.23277924060821534, "num_input_tokens_seen": 645295648, "step": 10765, "train_runtime": 138424.9162, "train_tokens_per_second": 4661.702 }, { "epoch": 1.3737244897959184, "grad_norm": 0.6513759630040247, "learning_rate": 2.2313180506283695e-06, "loss": 0.24211931228637695, "num_input_tokens_seen": 645597200, "step": 10770, "train_runtime": 138493.9833, "train_tokens_per_second": 4661.554 }, { "epoch": 1.374362244897959, "grad_norm": 0.6582279634304187, "learning_rate": 2.227148555480863e-06, "loss": 0.25272645950317385, "num_input_tokens_seen": 645908304, "step": 10775, "train_runtime": 138549.7575, "train_tokens_per_second": 4661.923 }, { "epoch": 1.375, "grad_norm": 0.703956439443315, "learning_rate": 2.222981843083436e-06, "loss": 0.25603179931640624, "num_input_tokens_seen": 646217384, "step": 10780, "train_runtime": 138610.6027, "train_tokens_per_second": 4662.106 }, { "epoch": 1.375637755102041, "grad_norm": 0.6925112911296832, "learning_rate": 2.2188179176176767e-06, "loss": 0.2590804100036621, "num_input_tokens_seen": 646527384, "step": 10785, "train_runtime": 138672.479, "train_tokens_per_second": 4662.262 }, { "epoch": 1.3762755102040816, "grad_norm": 0.6069876444123631, "learning_rate": 2.2146567832623737e-06, "loss": 0.25036039352416994, "num_input_tokens_seen": 646839656, "step": 10790, "train_runtime": 138734.7916, "train_tokens_per_second": 4662.418 }, { "epoch": 1.3769132653061225, "grad_norm": 0.7297829836920665, "learning_rate": 2.2104984441935167e-06, "loss": 0.24140830039978028, "num_input_tokens_seen": 647139928, "step": 10795, "train_runtime": 138792.1608, "train_tokens_per_second": 4662.655 }, { "epoch": 1.3775510204081631, "grad_norm": 0.6625224490748896, "learning_rate": 2.20634290458429e-06, "loss": 0.24470853805541992, "num_input_tokens_seen": 647447272, "step": 10800, "train_runtime": 138857.2637, "train_tokens_per_second": 4662.682 }, { "epoch": 1.378188775510204, "grad_norm": 0.7128958812980214, "learning_rate": 2.2021901686050684e-06, "loss": 0.23196766376495362, "num_input_tokens_seen": 647735072, "step": 10805, "train_runtime": 138921.8986, "train_tokens_per_second": 4662.584 }, { "epoch": 1.378826530612245, "grad_norm": 0.5795062646451145, "learning_rate": 2.1980402404234074e-06, "loss": 0.25746376514434816, "num_input_tokens_seen": 648041280, "step": 10810, "train_runtime": 138983.4149, "train_tokens_per_second": 4662.724 }, { "epoch": 1.3794642857142856, "grad_norm": 0.6885537391435483, "learning_rate": 2.1938931242040557e-06, "loss": 0.2460865259170532, "num_input_tokens_seen": 648341640, "step": 10815, "train_runtime": 139041.6036, "train_tokens_per_second": 4662.933 }, { "epoch": 1.3801020408163265, "grad_norm": 0.618919758545103, "learning_rate": 2.1897488241089336e-06, "loss": 0.2416177749633789, "num_input_tokens_seen": 648661488, "step": 10820, "train_runtime": 139101.7281, "train_tokens_per_second": 4663.217 }, { "epoch": 1.3807397959183674, "grad_norm": 0.7381930866970408, "learning_rate": 2.1856073442971322e-06, "loss": 0.2605881690979004, "num_input_tokens_seen": 648955528, "step": 10825, "train_runtime": 139161.4825, "train_tokens_per_second": 4663.327 }, { "epoch": 1.381377551020408, "grad_norm": 0.5969600365520998, "learning_rate": 2.181468688924916e-06, "loss": 0.23219058513641358, "num_input_tokens_seen": 649244072, "step": 10830, "train_runtime": 139228.1126, "train_tokens_per_second": 4663.168 }, { "epoch": 1.382015306122449, "grad_norm": 0.6805677768313665, "learning_rate": 2.1773328621457196e-06, "loss": 0.24557528495788575, "num_input_tokens_seen": 649529976, "step": 10835, "train_runtime": 139295.5333, "train_tokens_per_second": 4662.963 }, { "epoch": 1.3826530612244898, "grad_norm": 0.6479006672381705, "learning_rate": 2.1731998681101293e-06, "loss": 0.22532806396484376, "num_input_tokens_seen": 649833488, "step": 10840, "train_runtime": 139348.8616, "train_tokens_per_second": 4663.357 }, { "epoch": 1.3832908163265305, "grad_norm": 0.646316324356889, "learning_rate": 2.169069710965892e-06, "loss": 0.2405627727508545, "num_input_tokens_seen": 650140848, "step": 10845, "train_runtime": 139405.2632, "train_tokens_per_second": 4663.675 }, { "epoch": 1.3839285714285714, "grad_norm": 0.5367163420276531, "learning_rate": 2.1649423948579157e-06, "loss": 0.2120504379272461, "num_input_tokens_seen": 650433136, "step": 10850, "train_runtime": 139461.4156, "train_tokens_per_second": 4663.893 }, { "epoch": 1.3845663265306123, "grad_norm": 0.7034689899429091, "learning_rate": 2.160817923928244e-06, "loss": 0.24123435020446776, "num_input_tokens_seen": 650725704, "step": 10855, "train_runtime": 139528.9814, "train_tokens_per_second": 4663.731 }, { "epoch": 1.385204081632653, "grad_norm": 0.6566511350086877, "learning_rate": 2.156696302316074e-06, "loss": 0.2437469482421875, "num_input_tokens_seen": 651034544, "step": 10860, "train_runtime": 139602.7219, "train_tokens_per_second": 4663.48 }, { "epoch": 1.3858418367346939, "grad_norm": 0.6316114508662404, "learning_rate": 2.1525775341577404e-06, "loss": 0.25299577713012694, "num_input_tokens_seen": 651327096, "step": 10865, "train_runtime": 139665.5038, "train_tokens_per_second": 4663.479 }, { "epoch": 1.3864795918367347, "grad_norm": 0.6568636171902431, "learning_rate": 2.1484616235867152e-06, "loss": 0.22642965316772462, "num_input_tokens_seen": 651630216, "step": 10870, "train_runtime": 139737.9928, "train_tokens_per_second": 4663.229 }, { "epoch": 1.3871173469387754, "grad_norm": 0.7497381278526272, "learning_rate": 2.1443485747336014e-06, "loss": 0.2759822368621826, "num_input_tokens_seen": 651916104, "step": 10875, "train_runtime": 139801.0212, "train_tokens_per_second": 4663.171 }, { "epoch": 1.3877551020408163, "grad_norm": 0.6809589351702348, "learning_rate": 2.140238391726131e-06, "loss": 0.24073576927185059, "num_input_tokens_seen": 652222272, "step": 10880, "train_runtime": 139862.9104, "train_tokens_per_second": 4663.297 }, { "epoch": 1.3883928571428572, "grad_norm": 0.6546587477534579, "learning_rate": 2.1361310786891596e-06, "loss": 0.24782133102416992, "num_input_tokens_seen": 652528072, "step": 10885, "train_runtime": 139924.7952, "train_tokens_per_second": 4663.42 }, { "epoch": 1.3890306122448979, "grad_norm": 0.7041156445836272, "learning_rate": 2.1320266397446655e-06, "loss": 0.22001242637634277, "num_input_tokens_seen": 652839480, "step": 10890, "train_runtime": 139994.7978, "train_tokens_per_second": 4663.312 }, { "epoch": 1.3896683673469388, "grad_norm": 0.6044581168478713, "learning_rate": 2.1279250790117327e-06, "loss": 0.2347689151763916, "num_input_tokens_seen": 653131656, "step": 10895, "train_runtime": 140056.3181, "train_tokens_per_second": 4663.35 }, { "epoch": 1.3903061224489797, "grad_norm": 0.679840143816703, "learning_rate": 2.123826400606571e-06, "loss": 0.25978033542633056, "num_input_tokens_seen": 653444432, "step": 10900, "train_runtime": 140116.3695, "train_tokens_per_second": 4663.584 }, { "epoch": 1.3909438775510203, "grad_norm": 0.7119887067114313, "learning_rate": 2.119730608642489e-06, "loss": 0.22347233295440674, "num_input_tokens_seen": 653719088, "step": 10905, "train_runtime": 140180.1575, "train_tokens_per_second": 4663.421 }, { "epoch": 1.3915816326530612, "grad_norm": 0.6970403555829308, "learning_rate": 2.1156377072298972e-06, "loss": 0.23890743255615235, "num_input_tokens_seen": 654002784, "step": 10910, "train_runtime": 140246.4078, "train_tokens_per_second": 4663.241 }, { "epoch": 1.3922193877551021, "grad_norm": 0.7448028660534038, "learning_rate": 2.111547700476308e-06, "loss": 0.23602609634399413, "num_input_tokens_seen": 654315184, "step": 10915, "train_runtime": 140318.9851, "train_tokens_per_second": 4663.055 }, { "epoch": 1.3928571428571428, "grad_norm": 0.6584720165435018, "learning_rate": 2.107460592486333e-06, "loss": 0.2450235366821289, "num_input_tokens_seen": 654609464, "step": 10920, "train_runtime": 140376.0996, "train_tokens_per_second": 4663.254 }, { "epoch": 1.3934948979591837, "grad_norm": 0.6020681394599366, "learning_rate": 2.1033763873616675e-06, "loss": 0.23806238174438477, "num_input_tokens_seen": 654919048, "step": 10925, "train_runtime": 140451.687, "train_tokens_per_second": 4662.949 }, { "epoch": 1.3941326530612246, "grad_norm": 0.6544156838796378, "learning_rate": 2.0992950892010948e-06, "loss": 0.2461150884628296, "num_input_tokens_seen": 655220344, "step": 10930, "train_runtime": 140523.0406, "train_tokens_per_second": 4662.725 }, { "epoch": 1.3947704081632653, "grad_norm": 0.7281168804343539, "learning_rate": 2.0952167021004887e-06, "loss": 0.2532359600067139, "num_input_tokens_seen": 655510768, "step": 10935, "train_runtime": 140586.3961, "train_tokens_per_second": 4662.69 }, { "epoch": 1.3954081632653061, "grad_norm": 0.6733824759771405, "learning_rate": 2.0911412301527895e-06, "loss": 0.24455971717834474, "num_input_tokens_seen": 655818816, "step": 10940, "train_runtime": 140651.5694, "train_tokens_per_second": 4662.72 }, { "epoch": 1.396045918367347, "grad_norm": 0.6348471200624451, "learning_rate": 2.08706867744802e-06, "loss": 0.24333462715148926, "num_input_tokens_seen": 656117408, "step": 10945, "train_runtime": 140723.0535, "train_tokens_per_second": 4662.473 }, { "epoch": 1.3966836734693877, "grad_norm": 0.6655750157123884, "learning_rate": 2.0829990480732715e-06, "loss": 0.2534806251525879, "num_input_tokens_seen": 656417616, "step": 10950, "train_runtime": 140786.0205, "train_tokens_per_second": 4662.52 }, { "epoch": 1.3973214285714286, "grad_norm": 0.714398834957036, "learning_rate": 2.0789323461127015e-06, "loss": 0.23948030471801757, "num_input_tokens_seen": 656714808, "step": 10955, "train_runtime": 140854.2996, "train_tokens_per_second": 4662.37 }, { "epoch": 1.3979591836734695, "grad_norm": 0.6979327937979668, "learning_rate": 2.0748685756475286e-06, "loss": 0.2529648542404175, "num_input_tokens_seen": 657030600, "step": 10960, "train_runtime": 140901.2888, "train_tokens_per_second": 4663.056 }, { "epoch": 1.3985969387755102, "grad_norm": 0.715220965630344, "learning_rate": 2.0708077407560305e-06, "loss": 0.2523340225219727, "num_input_tokens_seen": 657334728, "step": 10965, "train_runtime": 140966.7956, "train_tokens_per_second": 4663.047 }, { "epoch": 1.399234693877551, "grad_norm": 0.6419444224663815, "learning_rate": 2.06674984551354e-06, "loss": 0.26148099899291993, "num_input_tokens_seen": 657631672, "step": 10970, "train_runtime": 141032.4216, "train_tokens_per_second": 4662.982 }, { "epoch": 1.399872448979592, "grad_norm": 0.7152631913428876, "learning_rate": 2.062694893992436e-06, "loss": 0.26262149810791013, "num_input_tokens_seen": 657947016, "step": 10975, "train_runtime": 141104.216, "train_tokens_per_second": 4662.844 }, { "epoch": 1.4005102040816326, "grad_norm": 0.6295128760306162, "learning_rate": 2.0586428902621474e-06, "loss": 0.2281444787979126, "num_input_tokens_seen": 658238832, "step": 10980, "train_runtime": 141173.076, "train_tokens_per_second": 4662.637 }, { "epoch": 1.4011479591836735, "grad_norm": 0.6108999780425177, "learning_rate": 2.0545938383891427e-06, "loss": 0.2359621524810791, "num_input_tokens_seen": 658543584, "step": 10985, "train_runtime": 141241.7291, "train_tokens_per_second": 4662.528 }, { "epoch": 1.4017857142857144, "grad_norm": 0.7402467771476116, "learning_rate": 2.050547742436929e-06, "loss": 0.23925113677978516, "num_input_tokens_seen": 658829344, "step": 10990, "train_runtime": 141307.5423, "train_tokens_per_second": 4662.379 }, { "epoch": 1.402423469387755, "grad_norm": 0.6596778939128919, "learning_rate": 2.0465046064660437e-06, "loss": 0.24088129997253419, "num_input_tokens_seen": 659133976, "step": 10995, "train_runtime": 141371.9924, "train_tokens_per_second": 4662.408 }, { "epoch": 1.403061224489796, "grad_norm": 0.6713856462192935, "learning_rate": 2.0424644345340554e-06, "loss": 0.25354528427124023, "num_input_tokens_seen": 659443248, "step": 11000, "train_runtime": 141447.1026, "train_tokens_per_second": 4662.119 }, { "epoch": 1.4036989795918369, "grad_norm": 0.707561358316077, "learning_rate": 2.038427230695565e-06, "loss": 0.2335648536682129, "num_input_tokens_seen": 659738752, "step": 11005, "train_runtime": 141518.5743, "train_tokens_per_second": 4661.853 }, { "epoch": 1.4043367346938775, "grad_norm": 0.6662093402085221, "learning_rate": 2.034392999002182e-06, "loss": 0.2513861179351807, "num_input_tokens_seen": 660044640, "step": 11010, "train_runtime": 141592.8124, "train_tokens_per_second": 4661.569 }, { "epoch": 1.4049744897959184, "grad_norm": 0.5934658664915485, "learning_rate": 2.0303617435025407e-06, "loss": 0.2568632125854492, "num_input_tokens_seen": 660343304, "step": 11015, "train_runtime": 141651.6033, "train_tokens_per_second": 4661.743 }, { "epoch": 1.405612244897959, "grad_norm": 0.6909332334251601, "learning_rate": 2.0263334682422923e-06, "loss": 0.2585726022720337, "num_input_tokens_seen": 660645536, "step": 11020, "train_runtime": 141714.1814, "train_tokens_per_second": 4661.817 }, { "epoch": 1.40625, "grad_norm": 0.6146840244682565, "learning_rate": 2.0223081772640867e-06, "loss": 0.2446803092956543, "num_input_tokens_seen": 660959280, "step": 11025, "train_runtime": 141773.005, "train_tokens_per_second": 4662.095 }, { "epoch": 1.406887755102041, "grad_norm": 0.6161975066320161, "learning_rate": 2.0182858746075873e-06, "loss": 0.23802344799041747, "num_input_tokens_seen": 661259400, "step": 11030, "train_runtime": 141844.9776, "train_tokens_per_second": 4661.846 }, { "epoch": 1.4075255102040816, "grad_norm": 0.7001020761944587, "learning_rate": 2.014266564309455e-06, "loss": 0.23745441436767578, "num_input_tokens_seen": 661554896, "step": 11035, "train_runtime": 141917.0231, "train_tokens_per_second": 4661.561 }, { "epoch": 1.4081632653061225, "grad_norm": 0.7623689546765444, "learning_rate": 2.010250250403349e-06, "loss": 0.23623900413513182, "num_input_tokens_seen": 661857168, "step": 11040, "train_runtime": 141968.1928, "train_tokens_per_second": 4662.01 }, { "epoch": 1.4088010204081631, "grad_norm": 0.6716639665075063, "learning_rate": 2.00623693691992e-06, "loss": 0.230047869682312, "num_input_tokens_seen": 662161992, "step": 11045, "train_runtime": 142023.881, "train_tokens_per_second": 4662.329 }, { "epoch": 1.409438775510204, "grad_norm": 0.6404711583431383, "learning_rate": 2.0022266278868086e-06, "loss": 0.22629778385162352, "num_input_tokens_seen": 662457600, "step": 11050, "train_runtime": 142080.0043, "train_tokens_per_second": 4662.567 }, { "epoch": 1.410076530612245, "grad_norm": 0.7615641341041465, "learning_rate": 1.9982193273286404e-06, "loss": 0.2338866949081421, "num_input_tokens_seen": 662748816, "step": 11055, "train_runtime": 142140.8984, "train_tokens_per_second": 4662.619 }, { "epoch": 1.4107142857142856, "grad_norm": 0.6127624693919943, "learning_rate": 1.9942150392670207e-06, "loss": 0.24228882789611816, "num_input_tokens_seen": 663046120, "step": 11060, "train_runtime": 142196.6147, "train_tokens_per_second": 4662.883 }, { "epoch": 1.4113520408163265, "grad_norm": 0.863624612549951, "learning_rate": 1.990213767720533e-06, "loss": 0.24905591011047362, "num_input_tokens_seen": 663346040, "step": 11065, "train_runtime": 142268.3757, "train_tokens_per_second": 4662.639 }, { "epoch": 1.4119897959183674, "grad_norm": 0.7022959171251992, "learning_rate": 1.9862155167047324e-06, "loss": 0.23888988494873048, "num_input_tokens_seen": 663647624, "step": 11070, "train_runtime": 142328.3859, "train_tokens_per_second": 4662.792 }, { "epoch": 1.412627551020408, "grad_norm": 0.6573008811431766, "learning_rate": 1.982220290232143e-06, "loss": 0.2574120044708252, "num_input_tokens_seen": 663942832, "step": 11075, "train_runtime": 142389.623, "train_tokens_per_second": 4662.86 }, { "epoch": 1.413265306122449, "grad_norm": 0.5892065478241137, "learning_rate": 1.9782280923122555e-06, "loss": 0.23816120624542236, "num_input_tokens_seen": 664233128, "step": 11080, "train_runtime": 142462.6762, "train_tokens_per_second": 4662.506 }, { "epoch": 1.4139030612244898, "grad_norm": 0.6275382672962257, "learning_rate": 1.9742389269515137e-06, "loss": 0.22530632019042968, "num_input_tokens_seen": 664539784, "step": 11085, "train_runtime": 142523.3778, "train_tokens_per_second": 4662.672 }, { "epoch": 1.4145408163265305, "grad_norm": 0.6834563719217182, "learning_rate": 1.970252798153329e-06, "loss": 0.2329627513885498, "num_input_tokens_seen": 664831808, "step": 11090, "train_runtime": 142587.9089, "train_tokens_per_second": 4662.61 }, { "epoch": 1.4151785714285714, "grad_norm": 0.627341426713708, "learning_rate": 1.9662697099180607e-06, "loss": 0.2375498056411743, "num_input_tokens_seen": 665123032, "step": 11095, "train_runtime": 142654.8248, "train_tokens_per_second": 4662.464 }, { "epoch": 1.4158163265306123, "grad_norm": 0.6226154279247583, "learning_rate": 1.9622896662430098e-06, "loss": 0.24169931411743165, "num_input_tokens_seen": 665418896, "step": 11100, "train_runtime": 142710.0802, "train_tokens_per_second": 4662.732 }, { "epoch": 1.416454081632653, "grad_norm": 0.671738072276809, "learning_rate": 1.9583126711224342e-06, "loss": 0.23000378608703614, "num_input_tokens_seen": 665694288, "step": 11105, "train_runtime": 142775.9821, "train_tokens_per_second": 4662.509 }, { "epoch": 1.4170918367346939, "grad_norm": 0.7467038466884931, "learning_rate": 1.954338728547526e-06, "loss": 0.2455808162689209, "num_input_tokens_seen": 665983488, "step": 11110, "train_runtime": 142838.2102, "train_tokens_per_second": 4662.502 }, { "epoch": 1.4177295918367347, "grad_norm": 0.7049373808422603, "learning_rate": 1.9503678425064097e-06, "loss": 0.2417128086090088, "num_input_tokens_seen": 666291952, "step": 11115, "train_runtime": 142890.7179, "train_tokens_per_second": 4662.948 }, { "epoch": 1.4183673469387754, "grad_norm": 0.658525510300182, "learning_rate": 1.9464000169841495e-06, "loss": 0.23396573066711426, "num_input_tokens_seen": 666593128, "step": 11120, "train_runtime": 142947.188, "train_tokens_per_second": 4663.213 }, { "epoch": 1.4190051020408163, "grad_norm": 0.6272706114853188, "learning_rate": 1.942435255962736e-06, "loss": 0.22563095092773439, "num_input_tokens_seen": 666904440, "step": 11125, "train_runtime": 143004.4183, "train_tokens_per_second": 4663.523 }, { "epoch": 1.4196428571428572, "grad_norm": 0.6525816640017443, "learning_rate": 1.938473563421082e-06, "loss": 0.26526608467102053, "num_input_tokens_seen": 667199696, "step": 11130, "train_runtime": 143072.3482, "train_tokens_per_second": 4663.373 }, { "epoch": 1.4202806122448979, "grad_norm": 0.6338108193389211, "learning_rate": 1.934514943335024e-06, "loss": 0.2452698230743408, "num_input_tokens_seen": 667504816, "step": 11135, "train_runtime": 143143.4247, "train_tokens_per_second": 4663.189 }, { "epoch": 1.4209183673469388, "grad_norm": 0.6479257772530378, "learning_rate": 1.930559399677313e-06, "loss": 0.25869481563568114, "num_input_tokens_seen": 667813184, "step": 11140, "train_runtime": 143200.507, "train_tokens_per_second": 4663.483 }, { "epoch": 1.4215561224489797, "grad_norm": 0.6691775461223044, "learning_rate": 1.9266069364176144e-06, "loss": 0.2564568996429443, "num_input_tokens_seen": 668122856, "step": 11145, "train_runtime": 143273.0577, "train_tokens_per_second": 4663.283 }, { "epoch": 1.4221938775510203, "grad_norm": 0.727982426741096, "learning_rate": 1.9226575575225002e-06, "loss": 0.2333740234375, "num_input_tokens_seen": 668422168, "step": 11150, "train_runtime": 143350.7584, "train_tokens_per_second": 4662.844 }, { "epoch": 1.4228316326530612, "grad_norm": 0.6397999916750352, "learning_rate": 1.918711266955448e-06, "loss": 0.24022703170776366, "num_input_tokens_seen": 668725624, "step": 11155, "train_runtime": 143412.3803, "train_tokens_per_second": 4662.956 }, { "epoch": 1.4234693877551021, "grad_norm": 0.5903023127390692, "learning_rate": 1.914768068676836e-06, "loss": 0.23648490905761718, "num_input_tokens_seen": 669025552, "step": 11160, "train_runtime": 143468.6606, "train_tokens_per_second": 4663.217 }, { "epoch": 1.4241071428571428, "grad_norm": 0.5430725423767777, "learning_rate": 1.9108279666439394e-06, "loss": 0.22266921997070313, "num_input_tokens_seen": 669328488, "step": 11165, "train_runtime": 143536.2345, "train_tokens_per_second": 4663.133 }, { "epoch": 1.4247448979591837, "grad_norm": 0.7465710670893899, "learning_rate": 1.9068909648109258e-06, "loss": 0.25256502628326416, "num_input_tokens_seen": 669619016, "step": 11170, "train_runtime": 143612.7017, "train_tokens_per_second": 4662.673 }, { "epoch": 1.4253826530612246, "grad_norm": 0.7000445712064963, "learning_rate": 1.9029570671288511e-06, "loss": 0.25914993286132815, "num_input_tokens_seen": 669913296, "step": 11175, "train_runtime": 143685.6509, "train_tokens_per_second": 4662.353 }, { "epoch": 1.4260204081632653, "grad_norm": 0.5943386482918162, "learning_rate": 1.899026277545658e-06, "loss": 0.25617499351501466, "num_input_tokens_seen": 670220176, "step": 11180, "train_runtime": 143733.4456, "train_tokens_per_second": 4662.938 }, { "epoch": 1.4266581632653061, "grad_norm": 0.6692861543609957, "learning_rate": 1.895098600006164e-06, "loss": 0.260732364654541, "num_input_tokens_seen": 670517632, "step": 11185, "train_runtime": 143791.7164, "train_tokens_per_second": 4663.117 }, { "epoch": 1.427295918367347, "grad_norm": 0.735822128187063, "learning_rate": 1.8911740384520717e-06, "loss": 0.25658307075500486, "num_input_tokens_seen": 670812056, "step": 11190, "train_runtime": 143866.8539, "train_tokens_per_second": 4662.728 }, { "epoch": 1.4279336734693877, "grad_norm": 0.6568459317765151, "learning_rate": 1.8872525968219541e-06, "loss": 0.23559768199920655, "num_input_tokens_seen": 671111464, "step": 11195, "train_runtime": 143934.053, "train_tokens_per_second": 4662.632 }, { "epoch": 1.4285714285714286, "grad_norm": 0.6042734918658409, "learning_rate": 1.8833342790512472e-06, "loss": 0.2498628616333008, "num_input_tokens_seen": 671417184, "step": 11200, "train_runtime": 144003.2302, "train_tokens_per_second": 4662.515 }, { "epoch": 1.4292091836734695, "grad_norm": 0.610036908356831, "learning_rate": 1.8794190890722575e-06, "loss": 0.23115887641906738, "num_input_tokens_seen": 671719040, "step": 11205, "train_runtime": 144075.867, "train_tokens_per_second": 4662.259 }, { "epoch": 1.4298469387755102, "grad_norm": 0.7413819535644164, "learning_rate": 1.875507030814156e-06, "loss": 0.22059884071350097, "num_input_tokens_seen": 672021136, "step": 11210, "train_runtime": 144134.4175, "train_tokens_per_second": 4662.461 }, { "epoch": 1.430484693877551, "grad_norm": 0.5871142382368951, "learning_rate": 1.871598108202961e-06, "loss": 0.23523523807525634, "num_input_tokens_seen": 672323272, "step": 11215, "train_runtime": 144196.6778, "train_tokens_per_second": 4662.543 }, { "epoch": 1.431122448979592, "grad_norm": 0.7144918772638523, "learning_rate": 1.8676923251615503e-06, "loss": 0.2446314811706543, "num_input_tokens_seen": 672618944, "step": 11220, "train_runtime": 144266.6283, "train_tokens_per_second": 4662.332 }, { "epoch": 1.4317602040816326, "grad_norm": 0.6881153338475912, "learning_rate": 1.863789685609655e-06, "loss": 0.2327864646911621, "num_input_tokens_seen": 672909344, "step": 11225, "train_runtime": 144335.4606, "train_tokens_per_second": 4662.121 }, { "epoch": 1.4323979591836735, "grad_norm": 0.6647319198471618, "learning_rate": 1.8598901934638402e-06, "loss": 0.24272985458374025, "num_input_tokens_seen": 673207768, "step": 11230, "train_runtime": 144393.4466, "train_tokens_per_second": 4662.315 }, { "epoch": 1.4330357142857144, "grad_norm": 0.6576414962394639, "learning_rate": 1.8559938526375215e-06, "loss": 0.2581766128540039, "num_input_tokens_seen": 673521112, "step": 11235, "train_runtime": 144452.7732, "train_tokens_per_second": 4662.57 }, { "epoch": 1.433673469387755, "grad_norm": 0.5675080199848578, "learning_rate": 1.8521006670409481e-06, "loss": 0.22662951946258544, "num_input_tokens_seen": 673817848, "step": 11240, "train_runtime": 144521.4786, "train_tokens_per_second": 4662.406 }, { "epoch": 1.434311224489796, "grad_norm": 0.6186972990996671, "learning_rate": 1.8482106405812046e-06, "loss": 0.25056777000427244, "num_input_tokens_seen": 674129160, "step": 11245, "train_runtime": 144594.2822, "train_tokens_per_second": 4662.212 }, { "epoch": 1.4349489795918369, "grad_norm": 0.6803632737356896, "learning_rate": 1.8443237771622037e-06, "loss": 0.2350076198577881, "num_input_tokens_seen": 674424928, "step": 11250, "train_runtime": 144654.8974, "train_tokens_per_second": 4662.303 }, { "epoch": 1.4355867346938775, "grad_norm": 0.6080045064271005, "learning_rate": 1.840440080684684e-06, "loss": 0.2515897750854492, "num_input_tokens_seen": 674722192, "step": 11255, "train_runtime": 144714.256, "train_tokens_per_second": 4662.445 }, { "epoch": 1.4362244897959184, "grad_norm": 0.6251446545007936, "learning_rate": 1.8365595550462068e-06, "loss": 0.23800618648529054, "num_input_tokens_seen": 675033784, "step": 11260, "train_runtime": 144776.9555, "train_tokens_per_second": 4662.578 }, { "epoch": 1.436862244897959, "grad_norm": 0.6363328109366876, "learning_rate": 1.8326822041411524e-06, "loss": 0.24979538917541505, "num_input_tokens_seen": 675333960, "step": 11265, "train_runtime": 144840.1081, "train_tokens_per_second": 4662.617 }, { "epoch": 1.4375, "grad_norm": 0.7408856000320213, "learning_rate": 1.828808031860707e-06, "loss": 0.2457813262939453, "num_input_tokens_seen": 675625264, "step": 11270, "train_runtime": 144907.527, "train_tokens_per_second": 4662.458 }, { "epoch": 1.438137755102041, "grad_norm": 0.6672055278745381, "learning_rate": 1.824937042092879e-06, "loss": 0.240432071685791, "num_input_tokens_seen": 675923008, "step": 11275, "train_runtime": 144975.1885, "train_tokens_per_second": 4662.336 }, { "epoch": 1.4387755102040816, "grad_norm": 0.6858424030694148, "learning_rate": 1.8210692387224776e-06, "loss": 0.23592252731323243, "num_input_tokens_seen": 676226016, "step": 11280, "train_runtime": 145039.8188, "train_tokens_per_second": 4662.347 }, { "epoch": 1.4394132653061225, "grad_norm": 0.5793406863901901, "learning_rate": 1.8172046256311087e-06, "loss": 0.23383541107177735, "num_input_tokens_seen": 676536832, "step": 11285, "train_runtime": 145098.8775, "train_tokens_per_second": 4662.592 }, { "epoch": 1.4400510204081631, "grad_norm": 0.6690683138041699, "learning_rate": 1.8133432066971823e-06, "loss": 0.24509520530700685, "num_input_tokens_seen": 676847736, "step": 11290, "train_runtime": 145171.9807, "train_tokens_per_second": 4662.385 }, { "epoch": 1.440688775510204, "grad_norm": 0.5989691395247146, "learning_rate": 1.8094849857959074e-06, "loss": 0.25073742866516113, "num_input_tokens_seen": 677149832, "step": 11295, "train_runtime": 145231.4993, "train_tokens_per_second": 4662.555 }, { "epoch": 1.441326530612245, "grad_norm": 0.619323780223799, "learning_rate": 1.8056299667992721e-06, "loss": 0.23592658042907716, "num_input_tokens_seen": 677444904, "step": 11300, "train_runtime": 145294.1911, "train_tokens_per_second": 4662.574 }, { "epoch": 1.4419642857142856, "grad_norm": 0.689840601159879, "learning_rate": 1.8017781535760581e-06, "loss": 0.26845948696136473, "num_input_tokens_seen": 677738560, "step": 11305, "train_runtime": 145348.7561, "train_tokens_per_second": 4662.844 }, { "epoch": 1.4426020408163265, "grad_norm": 0.6678270003814463, "learning_rate": 1.7979295499918338e-06, "loss": 0.25097291469573973, "num_input_tokens_seen": 678031816, "step": 11310, "train_runtime": 145409.6422, "train_tokens_per_second": 4662.908 }, { "epoch": 1.4432397959183674, "grad_norm": 0.6327321732567487, "learning_rate": 1.7940841599089364e-06, "loss": 0.24874565601348878, "num_input_tokens_seen": 678344552, "step": 11315, "train_runtime": 145477.3844, "train_tokens_per_second": 4662.887 }, { "epoch": 1.443877551020408, "grad_norm": 0.6727392456788983, "learning_rate": 1.790241987186485e-06, "loss": 0.24608402252197265, "num_input_tokens_seen": 678649048, "step": 11320, "train_runtime": 145537.4687, "train_tokens_per_second": 4663.054 }, { "epoch": 1.444515306122449, "grad_norm": 0.6632799743301652, "learning_rate": 1.7864030356803685e-06, "loss": 0.2536062240600586, "num_input_tokens_seen": 678942936, "step": 11325, "train_runtime": 145607.5696, "train_tokens_per_second": 4662.827 }, { "epoch": 1.4451530612244898, "grad_norm": 0.6491202280008166, "learning_rate": 1.7825673092432433e-06, "loss": 0.24754681587219238, "num_input_tokens_seen": 679245312, "step": 11330, "train_runtime": 145678.9847, "train_tokens_per_second": 4662.617 }, { "epoch": 1.4457908163265305, "grad_norm": 0.6619206219092385, "learning_rate": 1.7787348117245278e-06, "loss": 0.24240462779998778, "num_input_tokens_seen": 679539432, "step": 11335, "train_runtime": 145733.6449, "train_tokens_per_second": 4662.886 }, { "epoch": 1.4464285714285714, "grad_norm": 0.6689448881262019, "learning_rate": 1.7749055469704013e-06, "loss": 0.2488102436065674, "num_input_tokens_seen": 679830984, "step": 11340, "train_runtime": 145804.1031, "train_tokens_per_second": 4662.633 }, { "epoch": 1.4470663265306123, "grad_norm": 0.6076813000624108, "learning_rate": 1.771079518823799e-06, "loss": 0.23630599975585936, "num_input_tokens_seen": 680146240, "step": 11345, "train_runtime": 145858.9289, "train_tokens_per_second": 4663.042 }, { "epoch": 1.447704081632653, "grad_norm": 0.6841996950195385, "learning_rate": 1.7672567311244065e-06, "loss": 0.24865059852600097, "num_input_tokens_seen": 680448640, "step": 11350, "train_runtime": 145929.9343, "train_tokens_per_second": 4662.845 }, { "epoch": 1.4483418367346939, "grad_norm": 0.6220900760297762, "learning_rate": 1.7634371877086587e-06, "loss": 0.24988579750061035, "num_input_tokens_seen": 680757512, "step": 11355, "train_runtime": 146003.4495, "train_tokens_per_second": 4662.613 }, { "epoch": 1.4489795918367347, "grad_norm": 0.7023743281398612, "learning_rate": 1.7596208924097336e-06, "loss": 0.2530750513076782, "num_input_tokens_seen": 681058960, "step": 11360, "train_runtime": 146059.2871, "train_tokens_per_second": 4662.894 }, { "epoch": 1.4496173469387754, "grad_norm": 0.6872815302676676, "learning_rate": 1.7558078490575531e-06, "loss": 0.2638883113861084, "num_input_tokens_seen": 681353488, "step": 11365, "train_runtime": 146123.4241, "train_tokens_per_second": 4662.863 }, { "epoch": 1.4502551020408163, "grad_norm": 0.6442783314358508, "learning_rate": 1.7519980614787673e-06, "loss": 0.2459571123123169, "num_input_tokens_seen": 681651648, "step": 11370, "train_runtime": 146193.3064, "train_tokens_per_second": 4662.673 }, { "epoch": 1.4508928571428572, "grad_norm": 0.7182039323690438, "learning_rate": 1.748191533496766e-06, "loss": 0.23998775482177734, "num_input_tokens_seen": 681952928, "step": 11375, "train_runtime": 146257.6037, "train_tokens_per_second": 4662.684 }, { "epoch": 1.4515306122448979, "grad_norm": 0.6588074207114061, "learning_rate": 1.7443882689316693e-06, "loss": 0.2377242088317871, "num_input_tokens_seen": 682263008, "step": 11380, "train_runtime": 146320.5743, "train_tokens_per_second": 4662.796 }, { "epoch": 1.4521683673469388, "grad_norm": 0.7402664092565486, "learning_rate": 1.7405882716003154e-06, "loss": 0.23890118598937987, "num_input_tokens_seen": 682569416, "step": 11385, "train_runtime": 146382.9856, "train_tokens_per_second": 4662.901 }, { "epoch": 1.4528061224489797, "grad_norm": 0.6783340192705669, "learning_rate": 1.7367915453162653e-06, "loss": 0.25989651679992676, "num_input_tokens_seen": 682873896, "step": 11390, "train_runtime": 146446.7615, "train_tokens_per_second": 4662.95 }, { "epoch": 1.4534438775510203, "grad_norm": 0.6424306017085222, "learning_rate": 1.732998093889805e-06, "loss": 0.24322919845581054, "num_input_tokens_seen": 683181792, "step": 11395, "train_runtime": 146506.5491, "train_tokens_per_second": 4663.148 }, { "epoch": 1.4540816326530612, "grad_norm": 0.6450808939537568, "learning_rate": 1.7292079211279229e-06, "loss": 0.22780027389526367, "num_input_tokens_seen": 683480992, "step": 11400, "train_runtime": 146562.9645, "train_tokens_per_second": 4663.395 }, { "epoch": 1.4547193877551021, "grad_norm": 0.7228284999350758, "learning_rate": 1.7254210308343233e-06, "loss": 0.25200209617614744, "num_input_tokens_seen": 683777648, "step": 11405, "train_runtime": 146621.814, "train_tokens_per_second": 4663.547 }, { "epoch": 1.4553571428571428, "grad_norm": 0.6310647373225897, "learning_rate": 1.721637426809415e-06, "loss": 0.24065794944763183, "num_input_tokens_seen": 684081592, "step": 11410, "train_runtime": 146674.0932, "train_tokens_per_second": 4663.957 }, { "epoch": 1.4559948979591837, "grad_norm": 0.6400454895702979, "learning_rate": 1.7178571128503097e-06, "loss": 0.25054054260253905, "num_input_tokens_seen": 684365064, "step": 11415, "train_runtime": 146736.9551, "train_tokens_per_second": 4663.89 }, { "epoch": 1.4566326530612246, "grad_norm": 0.7022991364917267, "learning_rate": 1.7140800927508162e-06, "loss": 0.25025479793548583, "num_input_tokens_seen": 684660616, "step": 11420, "train_runtime": 146804.0507, "train_tokens_per_second": 4663.772 }, { "epoch": 1.4572704081632653, "grad_norm": 0.7418607704263092, "learning_rate": 1.7103063703014372e-06, "loss": 0.23921337127685546, "num_input_tokens_seen": 684961488, "step": 11425, "train_runtime": 146869.0023, "train_tokens_per_second": 4663.758 }, { "epoch": 1.4579081632653061, "grad_norm": 0.6749020113610398, "learning_rate": 1.706535949289368e-06, "loss": 0.2462780237197876, "num_input_tokens_seen": 685265784, "step": 11430, "train_runtime": 146926.5781, "train_tokens_per_second": 4664.002 }, { "epoch": 1.458545918367347, "grad_norm": 0.6738435636019064, "learning_rate": 1.7027688334984881e-06, "loss": 0.26296138763427734, "num_input_tokens_seen": 685571088, "step": 11435, "train_runtime": 146973.3196, "train_tokens_per_second": 4664.596 }, { "epoch": 1.4591836734693877, "grad_norm": 0.7166059957038663, "learning_rate": 1.6990050267093621e-06, "loss": 0.24450583457946778, "num_input_tokens_seen": 685872576, "step": 11440, "train_runtime": 147043.834, "train_tokens_per_second": 4664.409 }, { "epoch": 1.4598214285714286, "grad_norm": 0.6345409777464979, "learning_rate": 1.6952445326992327e-06, "loss": 0.23451249599456786, "num_input_tokens_seen": 686170704, "step": 11445, "train_runtime": 147107.345, "train_tokens_per_second": 4664.422 }, { "epoch": 1.4604591836734695, "grad_norm": 0.6647957595421151, "learning_rate": 1.6914873552420185e-06, "loss": 0.23938865661621095, "num_input_tokens_seen": 686471528, "step": 11450, "train_runtime": 147166.4848, "train_tokens_per_second": 4664.591 }, { "epoch": 1.4610969387755102, "grad_norm": 0.6064102890723383, "learning_rate": 1.687733498108311e-06, "loss": 0.2332664966583252, "num_input_tokens_seen": 686760360, "step": 11455, "train_runtime": 147223.8005, "train_tokens_per_second": 4664.737 }, { "epoch": 1.461734693877551, "grad_norm": 0.6355682273842634, "learning_rate": 1.6839829650653632e-06, "loss": 0.25306456089019774, "num_input_tokens_seen": 687070112, "step": 11460, "train_runtime": 147289.8375, "train_tokens_per_second": 4664.749 }, { "epoch": 1.462372448979592, "grad_norm": 0.5902718165267166, "learning_rate": 1.6802357598771014e-06, "loss": 0.23483102321624755, "num_input_tokens_seen": 687364496, "step": 11465, "train_runtime": 147352.4819, "train_tokens_per_second": 4664.764 }, { "epoch": 1.4630102040816326, "grad_norm": 0.6038581890225789, "learning_rate": 1.6764918863041079e-06, "loss": 0.24713358879089356, "num_input_tokens_seen": 687659152, "step": 11470, "train_runtime": 147407.6101, "train_tokens_per_second": 4665.018 }, { "epoch": 1.4636479591836735, "grad_norm": 0.6855517028015412, "learning_rate": 1.6727513481036167e-06, "loss": 0.25162179470062257, "num_input_tokens_seen": 687968872, "step": 11475, "train_runtime": 147464.9396, "train_tokens_per_second": 4665.305 }, { "epoch": 1.4642857142857144, "grad_norm": 0.6688300145778381, "learning_rate": 1.6690141490295259e-06, "loss": 0.22452807426452637, "num_input_tokens_seen": 688271208, "step": 11480, "train_runtime": 147530.6542, "train_tokens_per_second": 4665.276 }, { "epoch": 1.464923469387755, "grad_norm": 0.6924416393372076, "learning_rate": 1.6652802928323698e-06, "loss": 0.2321218490600586, "num_input_tokens_seen": 688573560, "step": 11485, "train_runtime": 147593.8325, "train_tokens_per_second": 4665.327 }, { "epoch": 1.465561224489796, "grad_norm": 0.6968472670839632, "learning_rate": 1.6615497832593365e-06, "loss": 0.2492440700531006, "num_input_tokens_seen": 688866760, "step": 11490, "train_runtime": 147663.5412, "train_tokens_per_second": 4665.111 }, { "epoch": 1.4661989795918369, "grad_norm": 0.7560208215184506, "learning_rate": 1.6578226240542528e-06, "loss": 0.25133914947509767, "num_input_tokens_seen": 689178576, "step": 11495, "train_runtime": 147729.2253, "train_tokens_per_second": 4665.147 }, { "epoch": 1.4668367346938775, "grad_norm": 0.665168527803295, "learning_rate": 1.6540988189575823e-06, "loss": 0.24690823554992675, "num_input_tokens_seen": 689463784, "step": 11500, "train_runtime": 147790.1147, "train_tokens_per_second": 4665.155 }, { "epoch": 1.4674744897959184, "grad_norm": 0.596987753677735, "learning_rate": 1.6503783717064247e-06, "loss": 0.2441627025604248, "num_input_tokens_seen": 689771064, "step": 11505, "train_runtime": 147862.9351, "train_tokens_per_second": 4664.936 }, { "epoch": 1.468112244897959, "grad_norm": 0.6219667258131122, "learning_rate": 1.6466612860345083e-06, "loss": 0.24189579486846924, "num_input_tokens_seen": 690056536, "step": 11510, "train_runtime": 147933.1245, "train_tokens_per_second": 4664.652 }, { "epoch": 1.46875, "grad_norm": 0.6721980454746388, "learning_rate": 1.6429475656721878e-06, "loss": 0.25978860855102537, "num_input_tokens_seen": 690365424, "step": 11515, "train_runtime": 147998.8208, "train_tokens_per_second": 4664.668 }, { "epoch": 1.469387755102041, "grad_norm": 0.6583685490789873, "learning_rate": 1.6392372143464407e-06, "loss": 0.24137365818023682, "num_input_tokens_seen": 690644680, "step": 11520, "train_runtime": 148073.4402, "train_tokens_per_second": 4664.204 }, { "epoch": 1.4700255102040816, "grad_norm": 0.6512613176517742, "learning_rate": 1.635530235780865e-06, "loss": 0.22860364913940429, "num_input_tokens_seen": 690923952, "step": 11525, "train_runtime": 148140.9507, "train_tokens_per_second": 4663.963 }, { "epoch": 1.4706632653061225, "grad_norm": 0.710859298839146, "learning_rate": 1.6318266336956713e-06, "loss": 0.22747769355773925, "num_input_tokens_seen": 691234968, "step": 11530, "train_runtime": 148204.3314, "train_tokens_per_second": 4664.067 }, { "epoch": 1.4713010204081631, "grad_norm": 0.6175456058852351, "learning_rate": 1.6281264118076833e-06, "loss": 0.2350527286529541, "num_input_tokens_seen": 691519072, "step": 11535, "train_runtime": 148256.5819, "train_tokens_per_second": 4664.34 }, { "epoch": 1.471938775510204, "grad_norm": 0.6416467457340852, "learning_rate": 1.6244295738303323e-06, "loss": 0.22203752994537354, "num_input_tokens_seen": 691816536, "step": 11540, "train_runtime": 148325.683, "train_tokens_per_second": 4664.172 }, { "epoch": 1.472576530612245, "grad_norm": 0.6682029999306813, "learning_rate": 1.6207361234736535e-06, "loss": 0.2506797552108765, "num_input_tokens_seen": 692126752, "step": 11545, "train_runtime": 148379.8864, "train_tokens_per_second": 4664.559 }, { "epoch": 1.4732142857142856, "grad_norm": 0.6975639493472159, "learning_rate": 1.6170460644442814e-06, "loss": 0.2557785987854004, "num_input_tokens_seen": 692426824, "step": 11550, "train_runtime": 148439.7907, "train_tokens_per_second": 4664.698 }, { "epoch": 1.4738520408163265, "grad_norm": 0.7181680193863293, "learning_rate": 1.6133594004454512e-06, "loss": 0.23441197872161865, "num_input_tokens_seen": 692713504, "step": 11555, "train_runtime": 148511.3149, "train_tokens_per_second": 4664.382 }, { "epoch": 1.4744897959183674, "grad_norm": 0.6459720024804818, "learning_rate": 1.6096761351769813e-06, "loss": 0.22232742309570314, "num_input_tokens_seen": 693002160, "step": 11560, "train_runtime": 148579.0408, "train_tokens_per_second": 4664.199 }, { "epoch": 1.475127551020408, "grad_norm": 0.678127980893922, "learning_rate": 1.6059962723352912e-06, "loss": 0.27894728183746337, "num_input_tokens_seen": 693315720, "step": 11565, "train_runtime": 148633.1422, "train_tokens_per_second": 4664.611 }, { "epoch": 1.475765306122449, "grad_norm": 0.6095747148965968, "learning_rate": 1.6023198156133796e-06, "loss": 0.24708163738250732, "num_input_tokens_seen": 693623040, "step": 11570, "train_runtime": 148687.3312, "train_tokens_per_second": 4664.977 }, { "epoch": 1.4764030612244898, "grad_norm": 0.6163226224096391, "learning_rate": 1.5986467687008256e-06, "loss": 0.23858215808868408, "num_input_tokens_seen": 693920448, "step": 11575, "train_runtime": 148756.2653, "train_tokens_per_second": 4664.815 }, { "epoch": 1.4770408163265305, "grad_norm": 0.6226961547586967, "learning_rate": 1.5949771352837873e-06, "loss": 0.2381221055984497, "num_input_tokens_seen": 694213632, "step": 11580, "train_runtime": 148818.0948, "train_tokens_per_second": 4664.847 }, { "epoch": 1.4776785714285714, "grad_norm": 0.7560406614750288, "learning_rate": 1.5913109190450033e-06, "loss": 0.25000662803649903, "num_input_tokens_seen": 694509360, "step": 11585, "train_runtime": 148879.4523, "train_tokens_per_second": 4664.911 }, { "epoch": 1.4783163265306123, "grad_norm": 0.580647102783899, "learning_rate": 1.5876481236637725e-06, "loss": 0.22563493251800537, "num_input_tokens_seen": 694824952, "step": 11590, "train_runtime": 148940.4976, "train_tokens_per_second": 4665.118 }, { "epoch": 1.478954081632653, "grad_norm": 0.714166697783697, "learning_rate": 1.5839887528159664e-06, "loss": 0.2413116455078125, "num_input_tokens_seen": 695137000, "step": 11595, "train_runtime": 149007.5951, "train_tokens_per_second": 4665.111 }, { "epoch": 1.4795918367346939, "grad_norm": 0.6258859637092434, "learning_rate": 1.580332810174024e-06, "loss": 0.2342731237411499, "num_input_tokens_seen": 695460296, "step": 11600, "train_runtime": 149061.999, "train_tokens_per_second": 4665.577 }, { "epoch": 1.4802295918367347, "grad_norm": 0.6801170050318642, "learning_rate": 1.5766802994069336e-06, "loss": 0.2347461223602295, "num_input_tokens_seen": 695764160, "step": 11605, "train_runtime": 149120.1798, "train_tokens_per_second": 4665.795 }, { "epoch": 1.4808673469387754, "grad_norm": 0.6262416405613398, "learning_rate": 1.573031224180247e-06, "loss": 0.2373434543609619, "num_input_tokens_seen": 696074920, "step": 11610, "train_runtime": 149188.6907, "train_tokens_per_second": 4665.735 }, { "epoch": 1.4815051020408163, "grad_norm": 0.6918457360931097, "learning_rate": 1.5693855881560654e-06, "loss": 0.2384523868560791, "num_input_tokens_seen": 696379304, "step": 11615, "train_runtime": 149263.133, "train_tokens_per_second": 4665.447 }, { "epoch": 1.4821428571428572, "grad_norm": 0.6865367278673672, "learning_rate": 1.5657433949930406e-06, "loss": 0.25263969898223876, "num_input_tokens_seen": 696681120, "step": 11620, "train_runtime": 149324.3801, "train_tokens_per_second": 4665.555 }, { "epoch": 1.4827806122448979, "grad_norm": 0.7296782473533788, "learning_rate": 1.5621046483463663e-06, "loss": 0.23917748928070068, "num_input_tokens_seen": 696991904, "step": 11625, "train_runtime": 149389.5322, "train_tokens_per_second": 4665.601 }, { "epoch": 1.4834183673469388, "grad_norm": 0.6664840276441146, "learning_rate": 1.5584693518677796e-06, "loss": 0.23252415657043457, "num_input_tokens_seen": 697283336, "step": 11630, "train_runtime": 149461.8494, "train_tokens_per_second": 4665.293 }, { "epoch": 1.4840561224489797, "grad_norm": 0.634565462518508, "learning_rate": 1.554837509205554e-06, "loss": 0.23175759315490724, "num_input_tokens_seen": 697581768, "step": 11635, "train_runtime": 149525.9994, "train_tokens_per_second": 4665.287 }, { "epoch": 1.4846938775510203, "grad_norm": 0.6221968571807043, "learning_rate": 1.5512091240044996e-06, "loss": 0.2360471487045288, "num_input_tokens_seen": 697879912, "step": 11640, "train_runtime": 149582.5311, "train_tokens_per_second": 4665.517 }, { "epoch": 1.4853316326530612, "grad_norm": 0.7540079611971362, "learning_rate": 1.5475841999059487e-06, "loss": 0.24431324005126953, "num_input_tokens_seen": 698194592, "step": 11645, "train_runtime": 149646.4544, "train_tokens_per_second": 4665.627 }, { "epoch": 1.4859693877551021, "grad_norm": 0.6705837388418601, "learning_rate": 1.5439627405477714e-06, "loss": 0.22821378707885742, "num_input_tokens_seen": 698513160, "step": 11650, "train_runtime": 149710.3094, "train_tokens_per_second": 4665.765 }, { "epoch": 1.4866071428571428, "grad_norm": 0.5772512077798021, "learning_rate": 1.5403447495643542e-06, "loss": 0.26444687843322756, "num_input_tokens_seen": 698821256, "step": 11655, "train_runtime": 149784.7413, "train_tokens_per_second": 4665.504 }, { "epoch": 1.4872448979591837, "grad_norm": 0.6237181341790158, "learning_rate": 1.5367302305866017e-06, "loss": 0.23810076713562012, "num_input_tokens_seen": 699098912, "step": 11660, "train_runtime": 149848.2229, "train_tokens_per_second": 4665.38 }, { "epoch": 1.4878826530612246, "grad_norm": 0.6226314180774907, "learning_rate": 1.5331191872419349e-06, "loss": 0.2813971757888794, "num_input_tokens_seen": 699396688, "step": 11665, "train_runtime": 149908.4462, "train_tokens_per_second": 4665.492 }, { "epoch": 1.4885204081632653, "grad_norm": 0.6437744808395093, "learning_rate": 1.5295116231542935e-06, "loss": 0.25315122604370116, "num_input_tokens_seen": 699700688, "step": 11670, "train_runtime": 149970.6227, "train_tokens_per_second": 4665.585 }, { "epoch": 1.4891581632653061, "grad_norm": 0.6235078179858374, "learning_rate": 1.5259075419441144e-06, "loss": 0.23633928298950196, "num_input_tokens_seen": 699994016, "step": 11675, "train_runtime": 150038.3311, "train_tokens_per_second": 4665.435 }, { "epoch": 1.489795918367347, "grad_norm": 0.6305730504230714, "learning_rate": 1.5223069472283464e-06, "loss": 0.24948687553405763, "num_input_tokens_seen": 700297120, "step": 11680, "train_runtime": 150104.4626, "train_tokens_per_second": 4665.398 }, { "epoch": 1.4904336734693877, "grad_norm": 0.6638784368909486, "learning_rate": 1.5187098426204411e-06, "loss": 0.22751235961914062, "num_input_tokens_seen": 700597472, "step": 11685, "train_runtime": 150160.3655, "train_tokens_per_second": 4665.662 }, { "epoch": 1.4910714285714286, "grad_norm": 0.6505087899264166, "learning_rate": 1.5151162317303398e-06, "loss": 0.24964916706085205, "num_input_tokens_seen": 700900528, "step": 11690, "train_runtime": 150231.9071, "train_tokens_per_second": 4665.457 }, { "epoch": 1.4917091836734695, "grad_norm": 0.7077708829756935, "learning_rate": 1.5115261181644842e-06, "loss": 0.21147603988647462, "num_input_tokens_seen": 701190128, "step": 11695, "train_runtime": 150294.6782, "train_tokens_per_second": 4665.436 }, { "epoch": 1.4923469387755102, "grad_norm": 0.5979843001639947, "learning_rate": 1.5079395055258027e-06, "loss": 0.2485567569732666, "num_input_tokens_seen": 701489056, "step": 11700, "train_runtime": 150362.9766, "train_tokens_per_second": 4665.304 }, { "epoch": 1.492984693877551, "grad_norm": 0.6409453647709838, "learning_rate": 1.5043563974137132e-06, "loss": 0.2364804267883301, "num_input_tokens_seen": 701786760, "step": 11705, "train_runtime": 150422.4212, "train_tokens_per_second": 4665.44 }, { "epoch": 1.493622448979592, "grad_norm": 0.641753447407374, "learning_rate": 1.5007767974241133e-06, "loss": 0.2340480089187622, "num_input_tokens_seen": 702077144, "step": 11710, "train_runtime": 150481.3884, "train_tokens_per_second": 4665.541 }, { "epoch": 1.4942602040816326, "grad_norm": 0.7290957319300447, "learning_rate": 1.497200709149383e-06, "loss": 0.25794596672058107, "num_input_tokens_seen": 702379760, "step": 11715, "train_runtime": 150545.1891, "train_tokens_per_second": 4665.574 }, { "epoch": 1.4948979591836735, "grad_norm": 0.5971458042728834, "learning_rate": 1.493628136178376e-06, "loss": 0.23512799739837648, "num_input_tokens_seen": 702679024, "step": 11720, "train_runtime": 150602.408, "train_tokens_per_second": 4665.789 }, { "epoch": 1.4955357142857144, "grad_norm": 0.6084064688795197, "learning_rate": 1.49005908209642e-06, "loss": 0.24218168258666992, "num_input_tokens_seen": 702983968, "step": 11725, "train_runtime": 150676.369, "train_tokens_per_second": 4665.522 }, { "epoch": 1.496173469387755, "grad_norm": 0.6549253711934818, "learning_rate": 1.4864935504853062e-06, "loss": 0.268617582321167, "num_input_tokens_seen": 703286088, "step": 11730, "train_runtime": 150721.7914, "train_tokens_per_second": 4666.121 }, { "epoch": 1.496811224489796, "grad_norm": 0.6262180880397928, "learning_rate": 1.4829315449232984e-06, "loss": 0.2677947521209717, "num_input_tokens_seen": 703596696, "step": 11735, "train_runtime": 150787.5204, "train_tokens_per_second": 4666.147 }, { "epoch": 1.4974489795918369, "grad_norm": 0.674671179788959, "learning_rate": 1.4793730689851187e-06, "loss": 0.2631994247436523, "num_input_tokens_seen": 703889592, "step": 11740, "train_runtime": 150858.4299, "train_tokens_per_second": 4665.895 }, { "epoch": 1.4980867346938775, "grad_norm": 0.62023577413827, "learning_rate": 1.4758181262419425e-06, "loss": 0.22229366302490233, "num_input_tokens_seen": 704193912, "step": 11745, "train_runtime": 150929.1748, "train_tokens_per_second": 4665.724 }, { "epoch": 1.4987244897959184, "grad_norm": 0.6130633296511628, "learning_rate": 1.4722667202614037e-06, "loss": 0.24085865020751954, "num_input_tokens_seen": 704498760, "step": 11750, "train_runtime": 150996.3203, "train_tokens_per_second": 4665.668 }, { "epoch": 1.499362244897959, "grad_norm": 0.6780347042669347, "learning_rate": 1.4687188546075903e-06, "loss": 0.2245311737060547, "num_input_tokens_seen": 704801800, "step": 11755, "train_runtime": 151048.7665, "train_tokens_per_second": 4666.055 }, { "epoch": 1.5, "grad_norm": 0.6642715489613907, "learning_rate": 1.4651745328410289e-06, "loss": 0.22231788635253907, "num_input_tokens_seen": 705104568, "step": 11760, "train_runtime": 151101.0487, "train_tokens_per_second": 4666.444 }, { "epoch": 1.5006377551020407, "grad_norm": 0.6590290554213085, "learning_rate": 1.4616337585186941e-06, "loss": 0.2275834083557129, "num_input_tokens_seen": 705392808, "step": 11765, "train_runtime": 151174.6671, "train_tokens_per_second": 4666.078 }, { "epoch": 1.5012755102040818, "grad_norm": 0.6242464491086078, "learning_rate": 1.4580965351940045e-06, "loss": 0.24281435012817382, "num_input_tokens_seen": 705684680, "step": 11770, "train_runtime": 151240.0255, "train_tokens_per_second": 4665.992 }, { "epoch": 1.5019132653061225, "grad_norm": 0.622983279791885, "learning_rate": 1.454562866416806e-06, "loss": 0.24083242416381836, "num_input_tokens_seen": 705972368, "step": 11775, "train_runtime": 151312.9802, "train_tokens_per_second": 4665.643 }, { "epoch": 1.5025510204081631, "grad_norm": 0.8005802415466808, "learning_rate": 1.4510327557333843e-06, "loss": 0.26150596141815186, "num_input_tokens_seen": 706267752, "step": 11780, "train_runtime": 151375.5526, "train_tokens_per_second": 4665.666 }, { "epoch": 1.5031887755102042, "grad_norm": 0.785628133606859, "learning_rate": 1.4475062066864516e-06, "loss": 0.24231288433074952, "num_input_tokens_seen": 706568992, "step": 11785, "train_runtime": 151438.4906, "train_tokens_per_second": 4665.716 }, { "epoch": 1.503826530612245, "grad_norm": 0.7498550910124094, "learning_rate": 1.4439832228151457e-06, "loss": 0.23139348030090331, "num_input_tokens_seen": 706865744, "step": 11790, "train_runtime": 151509.1242, "train_tokens_per_second": 4665.5 }, { "epoch": 1.5044642857142856, "grad_norm": 0.6264347831594215, "learning_rate": 1.4404638076550276e-06, "loss": 0.24553780555725097, "num_input_tokens_seen": 707182696, "step": 11795, "train_runtime": 151565.6277, "train_tokens_per_second": 4665.851 }, { "epoch": 1.5051020408163265, "grad_norm": 0.6780204974233415, "learning_rate": 1.4369479647380758e-06, "loss": 0.2568678617477417, "num_input_tokens_seen": 707491832, "step": 11800, "train_runtime": 151617.6307, "train_tokens_per_second": 4666.29 }, { "epoch": 1.5057397959183674, "grad_norm": 0.5700173324692831, "learning_rate": 1.4334356975926843e-06, "loss": 0.2317802667617798, "num_input_tokens_seen": 707803072, "step": 11805, "train_runtime": 151683.0667, "train_tokens_per_second": 4666.329 }, { "epoch": 1.506377551020408, "grad_norm": 0.6842625551689768, "learning_rate": 1.429927009743659e-06, "loss": 0.23446249961853027, "num_input_tokens_seen": 708095776, "step": 11810, "train_runtime": 151752.5273, "train_tokens_per_second": 4666.122 }, { "epoch": 1.507015306122449, "grad_norm": 0.5955782129102939, "learning_rate": 1.4264219047122125e-06, "loss": 0.2527336597442627, "num_input_tokens_seen": 708407072, "step": 11815, "train_runtime": 151812.5889, "train_tokens_per_second": 4666.326 }, { "epoch": 1.5076530612244898, "grad_norm": 0.6946166566371212, "learning_rate": 1.422920386015963e-06, "loss": 0.23975543975830077, "num_input_tokens_seen": 708671520, "step": 11820, "train_runtime": 151878.4488, "train_tokens_per_second": 4666.044 }, { "epoch": 1.5082908163265305, "grad_norm": 0.6760653277896207, "learning_rate": 1.4194224571689286e-06, "loss": 0.2433457612991333, "num_input_tokens_seen": 708959944, "step": 11825, "train_runtime": 151945.957, "train_tokens_per_second": 4665.869 }, { "epoch": 1.5089285714285714, "grad_norm": 0.7344592881272071, "learning_rate": 1.4159281216815269e-06, "loss": 0.24952054023742676, "num_input_tokens_seen": 709254888, "step": 11830, "train_runtime": 152009.4459, "train_tokens_per_second": 4665.861 }, { "epoch": 1.5095663265306123, "grad_norm": 0.6258526373067016, "learning_rate": 1.412437383060563e-06, "loss": 0.2232728958129883, "num_input_tokens_seen": 709553400, "step": 11835, "train_runtime": 152069.4829, "train_tokens_per_second": 4665.982 }, { "epoch": 1.510204081632653, "grad_norm": 0.7454052567193138, "learning_rate": 1.4089502448092418e-06, "loss": 0.24971485137939453, "num_input_tokens_seen": 709859344, "step": 11840, "train_runtime": 152130.0077, "train_tokens_per_second": 4666.136 }, { "epoch": 1.5108418367346939, "grad_norm": 0.6347998808876008, "learning_rate": 1.4054667104271497e-06, "loss": 0.2392899990081787, "num_input_tokens_seen": 710163112, "step": 11845, "train_runtime": 152187.6542, "train_tokens_per_second": 4666.365 }, { "epoch": 1.5114795918367347, "grad_norm": 0.6523693559173398, "learning_rate": 1.4019867834102525e-06, "loss": 0.2507919788360596, "num_input_tokens_seen": 710456184, "step": 11850, "train_runtime": 152253.9669, "train_tokens_per_second": 4666.257 }, { "epoch": 1.5121173469387754, "grad_norm": 0.5805169057728986, "learning_rate": 1.398510467250906e-06, "loss": 0.24285340309143066, "num_input_tokens_seen": 710762584, "step": 11855, "train_runtime": 152309.8344, "train_tokens_per_second": 4666.557 }, { "epoch": 1.5127551020408163, "grad_norm": 0.7401071671180456, "learning_rate": 1.3950377654378312e-06, "loss": 0.26153364181518557, "num_input_tokens_seen": 711053624, "step": 11860, "train_runtime": 152378.9013, "train_tokens_per_second": 4666.352 }, { "epoch": 1.5133928571428572, "grad_norm": 0.6592369670622877, "learning_rate": 1.3915686814561285e-06, "loss": 0.26082634925842285, "num_input_tokens_seen": 711348184, "step": 11865, "train_runtime": 152444.1182, "train_tokens_per_second": 4666.288 }, { "epoch": 1.5140306122448979, "grad_norm": 0.6072336499780252, "learning_rate": 1.3881032187872666e-06, "loss": 0.25055556297302245, "num_input_tokens_seen": 711649952, "step": 11870, "train_runtime": 152510.0835, "train_tokens_per_second": 4666.249 }, { "epoch": 1.5146683673469388, "grad_norm": 0.6569088939621313, "learning_rate": 1.3846413809090792e-06, "loss": 0.25313329696655273, "num_input_tokens_seen": 711952072, "step": 11875, "train_runtime": 152566.0547, "train_tokens_per_second": 4666.517 }, { "epoch": 1.5153061224489797, "grad_norm": 0.6614534871650628, "learning_rate": 1.381183171295762e-06, "loss": 0.24717378616333008, "num_input_tokens_seen": 712256824, "step": 11880, "train_runtime": 152629.3801, "train_tokens_per_second": 4666.577 }, { "epoch": 1.5159438775510203, "grad_norm": 0.6168401468502613, "learning_rate": 1.3777285934178697e-06, "loss": 0.25480525493621825, "num_input_tokens_seen": 712560368, "step": 11885, "train_runtime": 152705.4023, "train_tokens_per_second": 4666.242 }, { "epoch": 1.5165816326530612, "grad_norm": 0.6099653585699996, "learning_rate": 1.3742776507423127e-06, "loss": 0.23254284858703614, "num_input_tokens_seen": 712868888, "step": 11890, "train_runtime": 152765.6495, "train_tokens_per_second": 4666.421 }, { "epoch": 1.5172193877551021, "grad_norm": 0.6616464288859243, "learning_rate": 1.3708303467323536e-06, "loss": 0.24589791297912597, "num_input_tokens_seen": 713165632, "step": 11895, "train_runtime": 152823.9928, "train_tokens_per_second": 4666.582 }, { "epoch": 1.5178571428571428, "grad_norm": 0.7249096896463343, "learning_rate": 1.367386684847602e-06, "loss": 0.24876763820648193, "num_input_tokens_seen": 713461784, "step": 11900, "train_runtime": 152893.0843, "train_tokens_per_second": 4666.41 }, { "epoch": 1.5184948979591837, "grad_norm": 0.5962476856616004, "learning_rate": 1.3639466685440133e-06, "loss": 0.24852046966552735, "num_input_tokens_seen": 713773496, "step": 11905, "train_runtime": 152942.8453, "train_tokens_per_second": 4666.93 }, { "epoch": 1.5191326530612246, "grad_norm": 0.7070420796619338, "learning_rate": 1.360510301273884e-06, "loss": 0.2318204641342163, "num_input_tokens_seen": 714071696, "step": 11910, "train_runtime": 152994.1435, "train_tokens_per_second": 4667.314 }, { "epoch": 1.5197704081632653, "grad_norm": 0.6092687720393368, "learning_rate": 1.3570775864858487e-06, "loss": 0.2326336145401001, "num_input_tokens_seen": 714373072, "step": 11915, "train_runtime": 153063.8437, "train_tokens_per_second": 4667.158 }, { "epoch": 1.5204081632653061, "grad_norm": 0.7007567256576211, "learning_rate": 1.3536485276248768e-06, "loss": 0.24536890983581544, "num_input_tokens_seen": 714670808, "step": 11920, "train_runtime": 153133.9611, "train_tokens_per_second": 4666.965 }, { "epoch": 1.521045918367347, "grad_norm": 0.6340967886921898, "learning_rate": 1.350223128132268e-06, "loss": 0.23796346187591552, "num_input_tokens_seen": 714975728, "step": 11925, "train_runtime": 153188.4068, "train_tokens_per_second": 4667.297 }, { "epoch": 1.5216836734693877, "grad_norm": 0.6477653858447132, "learning_rate": 1.3468013914456518e-06, "loss": 0.24376912117004396, "num_input_tokens_seen": 715272848, "step": 11930, "train_runtime": 153244.3244, "train_tokens_per_second": 4667.532 }, { "epoch": 1.5223214285714286, "grad_norm": 0.6234235892429398, "learning_rate": 1.3433833209989743e-06, "loss": 0.2379302740097046, "num_input_tokens_seen": 715553496, "step": 11935, "train_runtime": 153308.5292, "train_tokens_per_second": 4667.408 }, { "epoch": 1.5229591836734695, "grad_norm": 0.6581030845799587, "learning_rate": 1.3399689202225136e-06, "loss": 0.2301718473434448, "num_input_tokens_seen": 715847752, "step": 11940, "train_runtime": 153372.0259, "train_tokens_per_second": 4667.395 }, { "epoch": 1.5235969387755102, "grad_norm": 0.7410182128633257, "learning_rate": 1.3365581925428594e-06, "loss": 0.23722467422485352, "num_input_tokens_seen": 716137152, "step": 11945, "train_runtime": 153434.276, "train_tokens_per_second": 4667.387 }, { "epoch": 1.524234693877551, "grad_norm": 0.6886070210738373, "learning_rate": 1.3331511413829113e-06, "loss": 0.2482837200164795, "num_input_tokens_seen": 716439560, "step": 11950, "train_runtime": 153502.5991, "train_tokens_per_second": 4667.28 }, { "epoch": 1.524872448979592, "grad_norm": 0.5673444957019642, "learning_rate": 1.3297477701618833e-06, "loss": 0.21979570388793945, "num_input_tokens_seen": 716747032, "step": 11955, "train_runtime": 153562.373, "train_tokens_per_second": 4667.465 }, { "epoch": 1.5255102040816326, "grad_norm": 0.675068128154071, "learning_rate": 1.3263480822953011e-06, "loss": 0.2448493003845215, "num_input_tokens_seen": 717052576, "step": 11960, "train_runtime": 153613.8129, "train_tokens_per_second": 4667.891 }, { "epoch": 1.5261479591836735, "grad_norm": 0.6987596997751906, "learning_rate": 1.3229520811949836e-06, "loss": 0.24974460601806642, "num_input_tokens_seen": 717354344, "step": 11965, "train_runtime": 153677.3411, "train_tokens_per_second": 4667.925 }, { "epoch": 1.5267857142857144, "grad_norm": 0.7484144778958687, "learning_rate": 1.3195597702690577e-06, "loss": 0.24799327850341796, "num_input_tokens_seen": 717648840, "step": 11970, "train_runtime": 153752.3726, "train_tokens_per_second": 4667.563 }, { "epoch": 1.527423469387755, "grad_norm": 0.6071064267657477, "learning_rate": 1.3161711529219434e-06, "loss": 0.23238167762756348, "num_input_tokens_seen": 717949184, "step": 11975, "train_runtime": 153821.8973, "train_tokens_per_second": 4667.406 }, { "epoch": 1.5280612244897958, "grad_norm": 0.6128589850855337, "learning_rate": 1.3127862325543555e-06, "loss": 0.23907299041748048, "num_input_tokens_seen": 718267512, "step": 11980, "train_runtime": 153892.8073, "train_tokens_per_second": 4667.323 }, { "epoch": 1.5286989795918369, "grad_norm": 0.622447941338741, "learning_rate": 1.3094050125632973e-06, "loss": 0.23790667057037354, "num_input_tokens_seen": 718562104, "step": 11985, "train_runtime": 153950.5398, "train_tokens_per_second": 4667.487 }, { "epoch": 1.5293367346938775, "grad_norm": 0.6253634222220107, "learning_rate": 1.30602749634206e-06, "loss": 0.24044299125671387, "num_input_tokens_seen": 718840408, "step": 11990, "train_runtime": 154015.8282, "train_tokens_per_second": 4667.315 }, { "epoch": 1.5299744897959182, "grad_norm": 0.6783952443597888, "learning_rate": 1.302653687280216e-06, "loss": 0.2323903799057007, "num_input_tokens_seen": 719130280, "step": 11995, "train_runtime": 154084.7779, "train_tokens_per_second": 4667.108 }, { "epoch": 1.5306122448979593, "grad_norm": 0.6945063615258878, "learning_rate": 1.299283588763619e-06, "loss": 0.24817018508911132, "num_input_tokens_seen": 719432752, "step": 12000, "train_runtime": 154135.898, "train_tokens_per_second": 4667.522 }, { "epoch": 1.53125, "grad_norm": 0.6329196402660104, "learning_rate": 1.2959172041743985e-06, "loss": 0.2507436990737915, "num_input_tokens_seen": 719749568, "step": 12005, "train_runtime": 154197.5307, "train_tokens_per_second": 4667.711 }, { "epoch": 1.5318877551020407, "grad_norm": 0.621708965357833, "learning_rate": 1.2925545368909558e-06, "loss": 0.2255568504333496, "num_input_tokens_seen": 720050496, "step": 12010, "train_runtime": 154250.7911, "train_tokens_per_second": 4668.051 }, { "epoch": 1.5325255102040818, "grad_norm": 0.75523776564148, "learning_rate": 1.289195590287965e-06, "loss": 0.24075818061828613, "num_input_tokens_seen": 720343552, "step": 12015, "train_runtime": 154308.762, "train_tokens_per_second": 4668.196 }, { "epoch": 1.5331632653061225, "grad_norm": 0.6733882703579561, "learning_rate": 1.285840367736358e-06, "loss": 0.24710659980773925, "num_input_tokens_seen": 720650448, "step": 12020, "train_runtime": 154379.0719, "train_tokens_per_second": 4668.058 }, { "epoch": 1.5338010204081631, "grad_norm": 0.6910433010762052, "learning_rate": 1.2824888726033391e-06, "loss": 0.243064022064209, "num_input_tokens_seen": 720955344, "step": 12025, "train_runtime": 154430.8445, "train_tokens_per_second": 4668.467 }, { "epoch": 1.5344387755102042, "grad_norm": 0.6246426595842839, "learning_rate": 1.2791411082523692e-06, "loss": 0.23680500984191893, "num_input_tokens_seen": 721246104, "step": 12030, "train_runtime": 154495.0162, "train_tokens_per_second": 4668.41 }, { "epoch": 1.535076530612245, "grad_norm": 0.7113607226927038, "learning_rate": 1.2757970780431594e-06, "loss": 0.243087100982666, "num_input_tokens_seen": 721546096, "step": 12035, "train_runtime": 154562.9343, "train_tokens_per_second": 4668.3 }, { "epoch": 1.5357142857142856, "grad_norm": 0.7032655313783374, "learning_rate": 1.2724567853316788e-06, "loss": 0.22990317344665528, "num_input_tokens_seen": 721837336, "step": 12040, "train_runtime": 154631.697, "train_tokens_per_second": 4668.107 }, { "epoch": 1.5363520408163265, "grad_norm": 0.6344855608090577, "learning_rate": 1.2691202334701474e-06, "loss": 0.25099179744720457, "num_input_tokens_seen": 722138240, "step": 12045, "train_runtime": 154702.7814, "train_tokens_per_second": 4667.907 }, { "epoch": 1.5369897959183674, "grad_norm": 0.583662349867842, "learning_rate": 1.2657874258070247e-06, "loss": 0.23311772346496581, "num_input_tokens_seen": 722452088, "step": 12050, "train_runtime": 154754.0773, "train_tokens_per_second": 4668.388 }, { "epoch": 1.537627551020408, "grad_norm": 0.7045862347703993, "learning_rate": 1.2624583656870153e-06, "loss": 0.24171760082244872, "num_input_tokens_seen": 722758192, "step": 12055, "train_runtime": 154820.0006, "train_tokens_per_second": 4668.377 }, { "epoch": 1.538265306122449, "grad_norm": 0.6739785249759156, "learning_rate": 1.2591330564510683e-06, "loss": 0.22491805553436278, "num_input_tokens_seen": 723054440, "step": 12060, "train_runtime": 154882.878, "train_tokens_per_second": 4668.395 }, { "epoch": 1.5389030612244898, "grad_norm": 0.7843959663478336, "learning_rate": 1.2558115014363592e-06, "loss": 0.2372133255004883, "num_input_tokens_seen": 723359152, "step": 12065, "train_runtime": 154943.582, "train_tokens_per_second": 4668.533 }, { "epoch": 1.5395408163265305, "grad_norm": 0.8164871100890743, "learning_rate": 1.2524937039763025e-06, "loss": 0.2527186870574951, "num_input_tokens_seen": 723654448, "step": 12070, "train_runtime": 155002.0966, "train_tokens_per_second": 4668.675 }, { "epoch": 1.5401785714285714, "grad_norm": 0.7210224573481199, "learning_rate": 1.2491796674005385e-06, "loss": 0.25359201431274414, "num_input_tokens_seen": 723963864, "step": 12075, "train_runtime": 155073.6699, "train_tokens_per_second": 4668.516 }, { "epoch": 1.5408163265306123, "grad_norm": 0.8022499591976578, "learning_rate": 1.2458693950349349e-06, "loss": 0.246889328956604, "num_input_tokens_seen": 724255576, "step": 12080, "train_runtime": 155143.0431, "train_tokens_per_second": 4668.308 }, { "epoch": 1.541454081632653, "grad_norm": 0.6603952877473191, "learning_rate": 1.2425628902015818e-06, "loss": 0.24393868446350098, "num_input_tokens_seen": 724549344, "step": 12085, "train_runtime": 155211.7265, "train_tokens_per_second": 4668.135 }, { "epoch": 1.5420918367346939, "grad_norm": 0.680804934740307, "learning_rate": 1.2392601562187867e-06, "loss": 0.24800515174865723, "num_input_tokens_seen": 724854896, "step": 12090, "train_runtime": 155282.8795, "train_tokens_per_second": 4667.964 }, { "epoch": 1.5427295918367347, "grad_norm": 0.6345715341836401, "learning_rate": 1.2359611964010747e-06, "loss": 0.2576450347900391, "num_input_tokens_seen": 725156064, "step": 12095, "train_runtime": 155345.7552, "train_tokens_per_second": 4668.013 }, { "epoch": 1.5433673469387754, "grad_norm": 0.6113492139638761, "learning_rate": 1.2326660140591835e-06, "loss": 0.23038859367370607, "num_input_tokens_seen": 725461232, "step": 12100, "train_runtime": 155419.126, "train_tokens_per_second": 4667.773 }, { "epoch": 1.5440051020408163, "grad_norm": 0.6236819131279752, "learning_rate": 1.2293746125000538e-06, "loss": 0.2277146816253662, "num_input_tokens_seen": 725754896, "step": 12105, "train_runtime": 155490.0221, "train_tokens_per_second": 4667.534 }, { "epoch": 1.5446428571428572, "grad_norm": 0.6670732652943816, "learning_rate": 1.2260869950268422e-06, "loss": 0.24714210033416747, "num_input_tokens_seen": 726057584, "step": 12110, "train_runtime": 155562.6185, "train_tokens_per_second": 4667.301 }, { "epoch": 1.5452806122448979, "grad_norm": 0.7632437554992797, "learning_rate": 1.2228031649389021e-06, "loss": 0.236268949508667, "num_input_tokens_seen": 726335360, "step": 12115, "train_runtime": 155619.6084, "train_tokens_per_second": 4667.377 }, { "epoch": 1.5459183673469388, "grad_norm": 0.7236167943503262, "learning_rate": 1.2195231255317834e-06, "loss": 0.24866657257080077, "num_input_tokens_seen": 726626968, "step": 12120, "train_runtime": 155685.8264, "train_tokens_per_second": 4667.265 }, { "epoch": 1.5465561224489797, "grad_norm": 0.8505834324878082, "learning_rate": 1.2162468800972344e-06, "loss": 0.23465731143951415, "num_input_tokens_seen": 726907752, "step": 12125, "train_runtime": 155747.1417, "train_tokens_per_second": 4667.23 }, { "epoch": 1.5471938775510203, "grad_norm": 0.6702233970780133, "learning_rate": 1.2129744319232013e-06, "loss": 0.22164678573608398, "num_input_tokens_seen": 727196712, "step": 12130, "train_runtime": 155806.6165, "train_tokens_per_second": 4667.303 }, { "epoch": 1.5478316326530612, "grad_norm": 0.6471140669180683, "learning_rate": 1.2097057842938093e-06, "loss": 0.23233861923217775, "num_input_tokens_seen": 727482832, "step": 12135, "train_runtime": 155875.9898, "train_tokens_per_second": 4667.062 }, { "epoch": 1.5484693877551021, "grad_norm": 0.6157611642938653, "learning_rate": 1.206440940489375e-06, "loss": 0.23581852912902831, "num_input_tokens_seen": 727782296, "step": 12140, "train_runtime": 155935.2833, "train_tokens_per_second": 4667.207 }, { "epoch": 1.5491071428571428, "grad_norm": 0.5963500844337734, "learning_rate": 1.203179903786401e-06, "loss": 0.22914860248565674, "num_input_tokens_seen": 728088904, "step": 12145, "train_runtime": 156004.1634, "train_tokens_per_second": 4667.112 }, { "epoch": 1.5497448979591837, "grad_norm": 0.7361686577537355, "learning_rate": 1.1999226774575618e-06, "loss": 0.21748099327087403, "num_input_tokens_seen": 728382016, "step": 12150, "train_runtime": 156068.6042, "train_tokens_per_second": 4667.063 }, { "epoch": 1.5503826530612246, "grad_norm": 0.6996395183231016, "learning_rate": 1.1966692647717127e-06, "loss": 0.24199068546295166, "num_input_tokens_seen": 728678440, "step": 12155, "train_runtime": 156132.4753, "train_tokens_per_second": 4667.052 }, { "epoch": 1.5510204081632653, "grad_norm": 0.6397591614429556, "learning_rate": 1.1934196689938804e-06, "loss": 0.23775906562805177, "num_input_tokens_seen": 728986480, "step": 12160, "train_runtime": 156199.2921, "train_tokens_per_second": 4667.028 }, { "epoch": 1.5516581632653061, "grad_norm": 0.7352359065152636, "learning_rate": 1.1901738933852608e-06, "loss": 0.2632540464401245, "num_input_tokens_seen": 729287568, "step": 12165, "train_runtime": 156256.6385, "train_tokens_per_second": 4667.242 }, { "epoch": 1.552295918367347, "grad_norm": 0.6203159734089616, "learning_rate": 1.1869319412032171e-06, "loss": 0.24134318828582763, "num_input_tokens_seen": 729580632, "step": 12170, "train_runtime": 156327.0294, "train_tokens_per_second": 4667.015 }, { "epoch": 1.5529336734693877, "grad_norm": 0.6144417798093549, "learning_rate": 1.1836938157012746e-06, "loss": 0.24182264804840087, "num_input_tokens_seen": 729885248, "step": 12175, "train_runtime": 156384.9372, "train_tokens_per_second": 4667.235 }, { "epoch": 1.5535714285714286, "grad_norm": 0.6286938807568226, "learning_rate": 1.180459520129118e-06, "loss": 0.22440452575683595, "num_input_tokens_seen": 730181648, "step": 12180, "train_runtime": 156447.3014, "train_tokens_per_second": 4667.269 }, { "epoch": 1.5542091836734695, "grad_norm": 0.6422738199085359, "learning_rate": 1.1772290577325895e-06, "loss": 0.24348549842834472, "num_input_tokens_seen": 730503360, "step": 12185, "train_runtime": 156502.6241, "train_tokens_per_second": 4667.675 }, { "epoch": 1.5548469387755102, "grad_norm": 0.6515386793597964, "learning_rate": 1.174002431753683e-06, "loss": 0.2396906852722168, "num_input_tokens_seen": 730801680, "step": 12190, "train_runtime": 156574.663, "train_tokens_per_second": 4667.433 }, { "epoch": 1.555484693877551, "grad_norm": 0.617281142350979, "learning_rate": 1.1707796454305437e-06, "loss": 0.21960153579711914, "num_input_tokens_seen": 731088968, "step": 12195, "train_runtime": 156637.9622, "train_tokens_per_second": 4667.38 }, { "epoch": 1.556122448979592, "grad_norm": 0.7140282480812199, "learning_rate": 1.167560701997462e-06, "loss": 0.24591443538665772, "num_input_tokens_seen": 731381120, "step": 12200, "train_runtime": 156700.3172, "train_tokens_per_second": 4667.388 }, { "epoch": 1.5567602040816326, "grad_norm": 0.7404723800350034, "learning_rate": 1.1643456046848745e-06, "loss": 0.24412984848022462, "num_input_tokens_seen": 731677024, "step": 12205, "train_runtime": 156757.7499, "train_tokens_per_second": 4667.565 }, { "epoch": 1.5573979591836735, "grad_norm": 0.6294267377024202, "learning_rate": 1.161134356719351e-06, "loss": 0.2619341850280762, "num_input_tokens_seen": 731960800, "step": 12210, "train_runtime": 156826.9864, "train_tokens_per_second": 4667.314 }, { "epoch": 1.5580357142857144, "grad_norm": 0.5994403997217085, "learning_rate": 1.1579269613236094e-06, "loss": 0.26063690185546873, "num_input_tokens_seen": 732276544, "step": 12215, "train_runtime": 156886.9605, "train_tokens_per_second": 4667.542 }, { "epoch": 1.558673469387755, "grad_norm": 0.6014416982113758, "learning_rate": 1.1547234217164904e-06, "loss": 0.23040192127227782, "num_input_tokens_seen": 732590184, "step": 12220, "train_runtime": 156964.2101, "train_tokens_per_second": 4667.243 }, { "epoch": 1.5593112244897958, "grad_norm": 0.6018550376268367, "learning_rate": 1.1515237411129698e-06, "loss": 0.22739155292510987, "num_input_tokens_seen": 732902512, "step": 12225, "train_runtime": 157031.2963, "train_tokens_per_second": 4667.239 }, { "epoch": 1.5599489795918369, "grad_norm": 0.6531853561303372, "learning_rate": 1.148327922724155e-06, "loss": 0.25479941368103026, "num_input_tokens_seen": 733196336, "step": 12230, "train_runtime": 157090.1437, "train_tokens_per_second": 4667.361 }, { "epoch": 1.5605867346938775, "grad_norm": 0.6792004519096303, "learning_rate": 1.1451359697572684e-06, "loss": 0.24005823135375975, "num_input_tokens_seen": 733489424, "step": 12235, "train_runtime": 157141.875, "train_tokens_per_second": 4667.689 }, { "epoch": 1.5612244897959182, "grad_norm": 0.6756138286546107, "learning_rate": 1.141947885415659e-06, "loss": 0.22763824462890625, "num_input_tokens_seen": 733796688, "step": 12240, "train_runtime": 157197.1705, "train_tokens_per_second": 4668.002 }, { "epoch": 1.5618622448979593, "grad_norm": 0.7494574512586077, "learning_rate": 1.1387636728987927e-06, "loss": 0.2540790796279907, "num_input_tokens_seen": 734080432, "step": 12245, "train_runtime": 157262.8572, "train_tokens_per_second": 4667.856 }, { "epoch": 1.5625, "grad_norm": 0.6972769493447613, "learning_rate": 1.135583335402249e-06, "loss": 0.2700526714324951, "num_input_tokens_seen": 734376320, "step": 12250, "train_runtime": 157331.3394, "train_tokens_per_second": 4667.705 }, { "epoch": 1.5631377551020407, "grad_norm": 0.6890260436067339, "learning_rate": 1.1324068761177176e-06, "loss": 0.25571448802948, "num_input_tokens_seen": 734673928, "step": 12255, "train_runtime": 157403.2433, "train_tokens_per_second": 4667.464 }, { "epoch": 1.5637755102040818, "grad_norm": 0.5984765002329604, "learning_rate": 1.129234298232999e-06, "loss": 0.22999925613403321, "num_input_tokens_seen": 734977064, "step": 12260, "train_runtime": 157474.077, "train_tokens_per_second": 4667.289 }, { "epoch": 1.5644132653061225, "grad_norm": 0.6601949929536787, "learning_rate": 1.1260656049319957e-06, "loss": 0.2365842342376709, "num_input_tokens_seen": 735279168, "step": 12265, "train_runtime": 157548.6826, "train_tokens_per_second": 4666.997 }, { "epoch": 1.5650510204081631, "grad_norm": 0.6805812610372765, "learning_rate": 1.1229007993947122e-06, "loss": 0.23756906986236573, "num_input_tokens_seen": 735583336, "step": 12270, "train_runtime": 157613.418, "train_tokens_per_second": 4667.01 }, { "epoch": 1.5656887755102042, "grad_norm": 0.6290302208737203, "learning_rate": 1.119739884797253e-06, "loss": 0.24585089683532715, "num_input_tokens_seen": 735896568, "step": 12275, "train_runtime": 157671.3166, "train_tokens_per_second": 4667.282 }, { "epoch": 1.566326530612245, "grad_norm": 0.6463052759249044, "learning_rate": 1.116582864311816e-06, "loss": 0.22634570598602294, "num_input_tokens_seen": 736199848, "step": 12280, "train_runtime": 157742.2436, "train_tokens_per_second": 4667.106 }, { "epoch": 1.5669642857142856, "grad_norm": 0.5805619461811257, "learning_rate": 1.1134297411066925e-06, "loss": 0.2247623920440674, "num_input_tokens_seen": 736505336, "step": 12285, "train_runtime": 157799.8095, "train_tokens_per_second": 4667.34 }, { "epoch": 1.5676020408163265, "grad_norm": 0.7141466447797546, "learning_rate": 1.1102805183462605e-06, "loss": 0.25339384078979493, "num_input_tokens_seen": 736797016, "step": 12290, "train_runtime": 157867.3211, "train_tokens_per_second": 4667.191 }, { "epoch": 1.5682397959183674, "grad_norm": 0.5839728980221631, "learning_rate": 1.1071351991909863e-06, "loss": 0.2568344593048096, "num_input_tokens_seen": 737111864, "step": 12295, "train_runtime": 157937.2893, "train_tokens_per_second": 4667.117 }, { "epoch": 1.568877551020408, "grad_norm": 0.6939502207995728, "learning_rate": 1.1039937867974166e-06, "loss": 0.2604703426361084, "num_input_tokens_seen": 737416048, "step": 12300, "train_runtime": 157991.5562, "train_tokens_per_second": 4667.44 }, { "epoch": 1.569515306122449, "grad_norm": 0.6999492214773526, "learning_rate": 1.1008562843181796e-06, "loss": 0.24059996604919434, "num_input_tokens_seen": 737723824, "step": 12305, "train_runtime": 158046.4973, "train_tokens_per_second": 4667.764 }, { "epoch": 1.5701530612244898, "grad_norm": 0.7321332951134449, "learning_rate": 1.0977226949019743e-06, "loss": 0.2498480796813965, "num_input_tokens_seen": 738027632, "step": 12310, "train_runtime": 158112.2063, "train_tokens_per_second": 4667.746 }, { "epoch": 1.5707908163265305, "grad_norm": 0.6633475427756443, "learning_rate": 1.09459302169358e-06, "loss": 0.2533766746520996, "num_input_tokens_seen": 738333472, "step": 12315, "train_runtime": 158180.3748, "train_tokens_per_second": 4667.668 }, { "epoch": 1.5714285714285714, "grad_norm": 0.6280044273693439, "learning_rate": 1.0914672678338434e-06, "loss": 0.23186039924621582, "num_input_tokens_seen": 738639544, "step": 12320, "train_runtime": 158248.8884, "train_tokens_per_second": 4667.581 }, { "epoch": 1.5720663265306123, "grad_norm": 0.6535015556023339, "learning_rate": 1.088345436459673e-06, "loss": 0.2551730155944824, "num_input_tokens_seen": 738947504, "step": 12325, "train_runtime": 158312.341, "train_tokens_per_second": 4667.656 }, { "epoch": 1.572704081632653, "grad_norm": 0.6392517071683543, "learning_rate": 1.0852275307040454e-06, "loss": 0.25040478706359864, "num_input_tokens_seen": 739256992, "step": 12330, "train_runtime": 158380.0934, "train_tokens_per_second": 4667.613 }, { "epoch": 1.5733418367346939, "grad_norm": 0.6530792561870343, "learning_rate": 1.082113553696001e-06, "loss": 0.25493450164794923, "num_input_tokens_seen": 739559392, "step": 12335, "train_runtime": 158444.7723, "train_tokens_per_second": 4667.616 }, { "epoch": 1.5739795918367347, "grad_norm": 0.6030977562922666, "learning_rate": 1.0790035085606282e-06, "loss": 0.2312842607498169, "num_input_tokens_seen": 739846688, "step": 12340, "train_runtime": 158497.1012, "train_tokens_per_second": 4667.888 }, { "epoch": 1.5746173469387754, "grad_norm": 0.6480304860769777, "learning_rate": 1.0758973984190764e-06, "loss": 0.24834418296813965, "num_input_tokens_seen": 740146568, "step": 12345, "train_runtime": 158570.4446, "train_tokens_per_second": 4667.62 }, { "epoch": 1.5752551020408163, "grad_norm": 0.6416794020452617, "learning_rate": 1.072795226388544e-06, "loss": 0.24527735710144044, "num_input_tokens_seen": 740451296, "step": 12350, "train_runtime": 158637.3538, "train_tokens_per_second": 4667.572 }, { "epoch": 1.5758928571428572, "grad_norm": 0.6841422613359235, "learning_rate": 1.0696969955822772e-06, "loss": 0.2373568296432495, "num_input_tokens_seen": 740740000, "step": 12355, "train_runtime": 158698.8702, "train_tokens_per_second": 4667.582 }, { "epoch": 1.5765306122448979, "grad_norm": 0.6797464373561524, "learning_rate": 1.0666027091095672e-06, "loss": 0.24493880271911622, "num_input_tokens_seen": 741042248, "step": 12360, "train_runtime": 158764.9238, "train_tokens_per_second": 4667.544 }, { "epoch": 1.5771683673469388, "grad_norm": 0.6444618107327897, "learning_rate": 1.063512370075746e-06, "loss": 0.24353444576263428, "num_input_tokens_seen": 741337520, "step": 12365, "train_runtime": 158835.3912, "train_tokens_per_second": 4667.332 }, { "epoch": 1.5778061224489797, "grad_norm": 0.6527816475387099, "learning_rate": 1.060425981582186e-06, "loss": 0.22241063117980958, "num_input_tokens_seen": 741637616, "step": 12370, "train_runtime": 158896.1148, "train_tokens_per_second": 4667.437 }, { "epoch": 1.5784438775510203, "grad_norm": 0.6355874400538328, "learning_rate": 1.0573435467262922e-06, "loss": 0.24539518356323242, "num_input_tokens_seen": 741932880, "step": 12375, "train_runtime": 158971.348, "train_tokens_per_second": 4667.086 }, { "epoch": 1.5790816326530612, "grad_norm": 0.5993159408239529, "learning_rate": 1.0542650686015039e-06, "loss": 0.21699769496917726, "num_input_tokens_seen": 742243584, "step": 12380, "train_runtime": 159033.4402, "train_tokens_per_second": 4667.217 }, { "epoch": 1.5797193877551021, "grad_norm": 0.7044253186693795, "learning_rate": 1.0511905502972885e-06, "loss": 0.24109046459197997, "num_input_tokens_seen": 742534568, "step": 12385, "train_runtime": 159105.6225, "train_tokens_per_second": 4666.929 }, { "epoch": 1.5803571428571428, "grad_norm": 0.6439837302875744, "learning_rate": 1.0481199948991416e-06, "loss": 0.2449514389038086, "num_input_tokens_seen": 742848256, "step": 12390, "train_runtime": 159172.1846, "train_tokens_per_second": 4666.948 }, { "epoch": 1.5809948979591837, "grad_norm": 0.6974978330015498, "learning_rate": 1.0450534054885765e-06, "loss": 0.21677944660186768, "num_input_tokens_seen": 743148272, "step": 12395, "train_runtime": 159234.9335, "train_tokens_per_second": 4666.993 }, { "epoch": 1.5816326530612246, "grad_norm": 0.6875081242778867, "learning_rate": 1.0419907851431321e-06, "loss": 0.2608932971954346, "num_input_tokens_seen": 743452104, "step": 12400, "train_runtime": 159299.8493, "train_tokens_per_second": 4666.998 }, { "epoch": 1.5822704081632653, "grad_norm": 0.6433749779925141, "learning_rate": 1.0389321369363636e-06, "loss": 0.23439176082611085, "num_input_tokens_seen": 743764856, "step": 12405, "train_runtime": 159363.5741, "train_tokens_per_second": 4667.094 }, { "epoch": 1.5829081632653061, "grad_norm": 0.6439855842632521, "learning_rate": 1.0358774639378344e-06, "loss": 0.23441028594970703, "num_input_tokens_seen": 744061392, "step": 12410, "train_runtime": 159427.616, "train_tokens_per_second": 4667.08 }, { "epoch": 1.583545918367347, "grad_norm": 0.6487079206891848, "learning_rate": 1.0328267692131227e-06, "loss": 0.23293354511260986, "num_input_tokens_seen": 744372808, "step": 12415, "train_runtime": 159484.9136, "train_tokens_per_second": 4667.356 }, { "epoch": 1.5841836734693877, "grad_norm": 0.6146677300144434, "learning_rate": 1.0297800558238175e-06, "loss": 0.21918458938598634, "num_input_tokens_seen": 744670928, "step": 12420, "train_runtime": 159546.6699, "train_tokens_per_second": 4667.418 }, { "epoch": 1.5848214285714286, "grad_norm": 0.6916442609320224, "learning_rate": 1.026737326827505e-06, "loss": 0.25938949584960935, "num_input_tokens_seen": 744986504, "step": 12425, "train_runtime": 159616.3739, "train_tokens_per_second": 4667.356 }, { "epoch": 1.5854591836734695, "grad_norm": 0.6367232002134973, "learning_rate": 1.0236985852777748e-06, "loss": 0.23069686889648439, "num_input_tokens_seen": 745272504, "step": 12430, "train_runtime": 159685.0408, "train_tokens_per_second": 4667.14 }, { "epoch": 1.5860969387755102, "grad_norm": 0.6880768873752653, "learning_rate": 1.020663834224222e-06, "loss": 0.23309216499328614, "num_input_tokens_seen": 745568368, "step": 12435, "train_runtime": 159757.1664, "train_tokens_per_second": 4666.885 }, { "epoch": 1.586734693877551, "grad_norm": 0.6494159907274198, "learning_rate": 1.017633076712426e-06, "loss": 0.2540991544723511, "num_input_tokens_seen": 745869248, "step": 12440, "train_runtime": 159826.122, "train_tokens_per_second": 4666.754 }, { "epoch": 1.587372448979592, "grad_norm": 0.6629497075583926, "learning_rate": 1.0146063157839653e-06, "loss": 0.22958106994628907, "num_input_tokens_seen": 746172312, "step": 12445, "train_runtime": 159885.4601, "train_tokens_per_second": 4666.918 }, { "epoch": 1.5880102040816326, "grad_norm": 0.7702819194299826, "learning_rate": 1.0115835544764063e-06, "loss": 0.2517064571380615, "num_input_tokens_seen": 746470200, "step": 12450, "train_runtime": 159951.4637, "train_tokens_per_second": 4666.854 }, { "epoch": 1.5886479591836735, "grad_norm": 0.694287201386589, "learning_rate": 1.0085647958233008e-06, "loss": 0.24434814453125, "num_input_tokens_seen": 746764984, "step": 12455, "train_runtime": 160004.2979, "train_tokens_per_second": 4667.156 }, { "epoch": 1.5892857142857144, "grad_norm": 0.613071630625283, "learning_rate": 1.0055500428541836e-06, "loss": 0.22049248218536377, "num_input_tokens_seen": 747064784, "step": 12460, "train_runtime": 160065.5375, "train_tokens_per_second": 4667.243 }, { "epoch": 1.589923469387755, "grad_norm": 0.5905878829379532, "learning_rate": 1.0025392985945703e-06, "loss": 0.2363584518432617, "num_input_tokens_seen": 747372304, "step": 12465, "train_runtime": 160120.181, "train_tokens_per_second": 4667.571 }, { "epoch": 1.5905612244897958, "grad_norm": 0.6543739192723753, "learning_rate": 9.995325660659533e-07, "loss": 0.23653178215026854, "num_input_tokens_seen": 747660040, "step": 12470, "train_runtime": 160181.4819, "train_tokens_per_second": 4667.581 }, { "epoch": 1.5911989795918369, "grad_norm": 0.580553517738533, "learning_rate": 9.965298482857993e-07, "loss": 0.24920930862426757, "num_input_tokens_seen": 747965592, "step": 12475, "train_runtime": 160249.2731, "train_tokens_per_second": 4667.513 }, { "epoch": 1.5918367346938775, "grad_norm": 0.7006306259163959, "learning_rate": 9.935311482675413e-07, "loss": 0.23427369594573974, "num_input_tokens_seen": 748239896, "step": 12480, "train_runtime": 160307.4589, "train_tokens_per_second": 4667.53 }, { "epoch": 1.5924744897959182, "grad_norm": 0.6803649036060584, "learning_rate": 9.905364690205888e-07, "loss": 0.23743538856506347, "num_input_tokens_seen": 748525640, "step": 12485, "train_runtime": 160372.5366, "train_tokens_per_second": 4667.418 }, { "epoch": 1.5931122448979593, "grad_norm": 0.6021010522647829, "learning_rate": 9.875458135503113e-07, "loss": 0.21800599098205567, "num_input_tokens_seen": 748837360, "step": 12490, "train_runtime": 160433.398, "train_tokens_per_second": 4667.59 }, { "epoch": 1.59375, "grad_norm": 0.6465303084231173, "learning_rate": 9.845591848580376e-07, "loss": 0.24465422630310057, "num_input_tokens_seen": 749125880, "step": 12495, "train_runtime": 160491.8689, "train_tokens_per_second": 4667.687 }, { "epoch": 1.5943877551020407, "grad_norm": 0.613797587978045, "learning_rate": 9.815765859410586e-07, "loss": 0.23654673099517823, "num_input_tokens_seen": 749431832, "step": 12500, "train_runtime": 160552.6619, "train_tokens_per_second": 4667.826 }, { "epoch": 1.5950255102040818, "grad_norm": 0.6863986151342331, "learning_rate": 9.785980197926242e-07, "loss": 0.2438525676727295, "num_input_tokens_seen": 749731576, "step": 12505, "train_runtime": 160614.7497, "train_tokens_per_second": 4667.887 }, { "epoch": 1.5956632653061225, "grad_norm": 0.7793642516046543, "learning_rate": 9.7562348940193e-07, "loss": 0.22856268882751465, "num_input_tokens_seen": 750026320, "step": 12510, "train_runtime": 160676.5839, "train_tokens_per_second": 4667.925 }, { "epoch": 1.5963010204081631, "grad_norm": 0.6918633876196689, "learning_rate": 9.726529977541243e-07, "loss": 0.2514913082122803, "num_input_tokens_seen": 750315040, "step": 12515, "train_runtime": 160731.9811, "train_tokens_per_second": 4668.113 }, { "epoch": 1.5969387755102042, "grad_norm": 0.6298207620096105, "learning_rate": 9.696865478303075e-07, "loss": 0.25145344734191893, "num_input_tokens_seen": 750618512, "step": 12520, "train_runtime": 160801.8338, "train_tokens_per_second": 4667.972 }, { "epoch": 1.597576530612245, "grad_norm": 0.6782354727972346, "learning_rate": 9.667241426075152e-07, "loss": 0.2843494176864624, "num_input_tokens_seen": 750934152, "step": 12525, "train_runtime": 160855.0452, "train_tokens_per_second": 4668.39 }, { "epoch": 1.5982142857142856, "grad_norm": 0.6599116171683902, "learning_rate": 9.637657850587289e-07, "loss": 0.24234216213226317, "num_input_tokens_seen": 751230872, "step": 12530, "train_runtime": 160923.4965, "train_tokens_per_second": 4668.249 }, { "epoch": 1.5988520408163265, "grad_norm": 0.671000036187092, "learning_rate": 9.608114781528671e-07, "loss": 0.2262669563293457, "num_input_tokens_seen": 751520384, "step": 12535, "train_runtime": 160981.1021, "train_tokens_per_second": 4668.376 }, { "epoch": 1.5994897959183674, "grad_norm": 0.6439374254598299, "learning_rate": 9.578612248547836e-07, "loss": 0.23630757331848146, "num_input_tokens_seen": 751811720, "step": 12540, "train_runtime": 161058.3484, "train_tokens_per_second": 4667.946 }, { "epoch": 1.600127551020408, "grad_norm": 0.6694706643664425, "learning_rate": 9.549150281252633e-07, "loss": 0.21743435859680177, "num_input_tokens_seen": 752118136, "step": 12545, "train_runtime": 161129.8272, "train_tokens_per_second": 4667.777 }, { "epoch": 1.600765306122449, "grad_norm": 0.6859891226469327, "learning_rate": 9.519728909210202e-07, "loss": 0.2244157075881958, "num_input_tokens_seen": 752412704, "step": 12550, "train_runtime": 161188.7732, "train_tokens_per_second": 4667.898 }, { "epoch": 1.6014030612244898, "grad_norm": 0.6449266735319855, "learning_rate": 9.49034816194695e-07, "loss": 0.22257812023162843, "num_input_tokens_seen": 752713704, "step": 12555, "train_runtime": 161252.8927, "train_tokens_per_second": 4667.908 }, { "epoch": 1.6020408163265305, "grad_norm": 0.7676452639078382, "learning_rate": 9.461008068948502e-07, "loss": 0.24138007164001465, "num_input_tokens_seen": 753003032, "step": 12560, "train_runtime": 161317.0235, "train_tokens_per_second": 4667.846 }, { "epoch": 1.6026785714285714, "grad_norm": 0.6130795704749278, "learning_rate": 9.431708659659694e-07, "loss": 0.22036666870117189, "num_input_tokens_seen": 753310144, "step": 12565, "train_runtime": 161380.829, "train_tokens_per_second": 4667.904 }, { "epoch": 1.6033163265306123, "grad_norm": 0.6408949066338637, "learning_rate": 9.402449963484528e-07, "loss": 0.2612826585769653, "num_input_tokens_seen": 753603880, "step": 12570, "train_runtime": 161456.0607, "train_tokens_per_second": 4667.548 }, { "epoch": 1.603954081632653, "grad_norm": 0.699654142064855, "learning_rate": 9.373232009786154e-07, "loss": 0.24999663829803467, "num_input_tokens_seen": 753892464, "step": 12575, "train_runtime": 161522.4346, "train_tokens_per_second": 4667.416 }, { "epoch": 1.6045918367346939, "grad_norm": 0.6384457950020472, "learning_rate": 9.344054827886839e-07, "loss": 0.2503360748291016, "num_input_tokens_seen": 754190928, "step": 12580, "train_runtime": 161587.9504, "train_tokens_per_second": 4667.371 }, { "epoch": 1.6052295918367347, "grad_norm": 0.737978309490727, "learning_rate": 9.314918447067877e-07, "loss": 0.21660540103912354, "num_input_tokens_seen": 754472440, "step": 12585, "train_runtime": 161660.6712, "train_tokens_per_second": 4667.013 }, { "epoch": 1.6058673469387754, "grad_norm": 0.6791704799144782, "learning_rate": 9.285822896569724e-07, "loss": 0.22802515029907228, "num_input_tokens_seen": 754761096, "step": 12590, "train_runtime": 161730.4204, "train_tokens_per_second": 4666.785 }, { "epoch": 1.6065051020408163, "grad_norm": 0.6422862658942546, "learning_rate": 9.256768205591754e-07, "loss": 0.2276700496673584, "num_input_tokens_seen": 755067464, "step": 12595, "train_runtime": 161791.3075, "train_tokens_per_second": 4666.922 }, { "epoch": 1.6071428571428572, "grad_norm": 0.5970500161006491, "learning_rate": 9.227754403292377e-07, "loss": 0.2209826946258545, "num_input_tokens_seen": 755364080, "step": 12600, "train_runtime": 161861.3277, "train_tokens_per_second": 4666.736 }, { "epoch": 1.6077806122448979, "grad_norm": 0.6395583620104077, "learning_rate": 9.198781518789007e-07, "loss": 0.25316319465637205, "num_input_tokens_seen": 755661280, "step": 12605, "train_runtime": 161918.6041, "train_tokens_per_second": 4666.921 }, { "epoch": 1.6084183673469388, "grad_norm": 0.6418346734876251, "learning_rate": 9.169849581157925e-07, "loss": 0.25020828247070315, "num_input_tokens_seen": 755980408, "step": 12610, "train_runtime": 161987.8425, "train_tokens_per_second": 4666.896 }, { "epoch": 1.6090561224489797, "grad_norm": 0.5610877522772107, "learning_rate": 9.140958619434353e-07, "loss": 0.24742977619171141, "num_input_tokens_seen": 756282560, "step": 12615, "train_runtime": 162051.1772, "train_tokens_per_second": 4666.937 }, { "epoch": 1.6096938775510203, "grad_norm": 0.6935628664099879, "learning_rate": 9.112108662612401e-07, "loss": 0.24512836933135987, "num_input_tokens_seen": 756588056, "step": 12620, "train_runtime": 162111.8387, "train_tokens_per_second": 4667.075 }, { "epoch": 1.6103316326530612, "grad_norm": 0.5612648974736708, "learning_rate": 9.083299739645007e-07, "loss": 0.22108681201934816, "num_input_tokens_seen": 756894296, "step": 12625, "train_runtime": 162183.7017, "train_tokens_per_second": 4666.895 }, { "epoch": 1.6109693877551021, "grad_norm": 0.7867473407636176, "learning_rate": 9.054531879443945e-07, "loss": 0.23173933029174804, "num_input_tokens_seen": 757199688, "step": 12630, "train_runtime": 162244.7123, "train_tokens_per_second": 4667.022 }, { "epoch": 1.6116071428571428, "grad_norm": 0.689728429677776, "learning_rate": 9.025805110879765e-07, "loss": 0.25670275688171384, "num_input_tokens_seen": 757499624, "step": 12635, "train_runtime": 162309.6087, "train_tokens_per_second": 4667.004 }, { "epoch": 1.6122448979591837, "grad_norm": 0.6108552373822652, "learning_rate": 8.997119462781784e-07, "loss": 0.24854421615600586, "num_input_tokens_seen": 757804672, "step": 12640, "train_runtime": 162369.0132, "train_tokens_per_second": 4667.175 }, { "epoch": 1.6128826530612246, "grad_norm": 0.6791550048614775, "learning_rate": 8.968474963938062e-07, "loss": 0.2311779499053955, "num_input_tokens_seen": 758105208, "step": 12645, "train_runtime": 162434.0353, "train_tokens_per_second": 4667.157 }, { "epoch": 1.6135204081632653, "grad_norm": 0.6599731643148613, "learning_rate": 8.939871643095344e-07, "loss": 0.25216753482818605, "num_input_tokens_seen": 758406120, "step": 12650, "train_runtime": 162487.0774, "train_tokens_per_second": 4667.486 }, { "epoch": 1.6141581632653061, "grad_norm": 0.6583367280408391, "learning_rate": 8.911309528959072e-07, "loss": 0.24410347938537597, "num_input_tokens_seen": 758701624, "step": 12655, "train_runtime": 162547.4265, "train_tokens_per_second": 4667.571 }, { "epoch": 1.614795918367347, "grad_norm": 0.6178294445564312, "learning_rate": 8.882788650193308e-07, "loss": 0.2473817825317383, "num_input_tokens_seen": 759014720, "step": 12660, "train_runtime": 162611.2003, "train_tokens_per_second": 4667.666 }, { "epoch": 1.6154336734693877, "grad_norm": 0.6493910949400037, "learning_rate": 8.854309035420772e-07, "loss": 0.21530449390411377, "num_input_tokens_seen": 759297760, "step": 12665, "train_runtime": 162686.0367, "train_tokens_per_second": 4667.258 }, { "epoch": 1.6160714285714286, "grad_norm": 0.6400351711700686, "learning_rate": 8.8258707132227e-07, "loss": 0.2471524477005005, "num_input_tokens_seen": 759591568, "step": 12670, "train_runtime": 162755.0653, "train_tokens_per_second": 4667.084 }, { "epoch": 1.6167091836734695, "grad_norm": 0.6115359996465839, "learning_rate": 8.797473712138976e-07, "loss": 0.23382058143615722, "num_input_tokens_seen": 759902808, "step": 12675, "train_runtime": 162810.921, "train_tokens_per_second": 4667.395 }, { "epoch": 1.6173469387755102, "grad_norm": 0.6887977770934273, "learning_rate": 8.769118060667969e-07, "loss": 0.24280138015747071, "num_input_tokens_seen": 760202816, "step": 12680, "train_runtime": 162878.1636, "train_tokens_per_second": 4667.31 }, { "epoch": 1.617984693877551, "grad_norm": 0.6529361686821481, "learning_rate": 8.740803787266522e-07, "loss": 0.23381223678588867, "num_input_tokens_seen": 760505048, "step": 12685, "train_runtime": 162936.5705, "train_tokens_per_second": 4667.491 }, { "epoch": 1.618622448979592, "grad_norm": 0.65762465735013, "learning_rate": 8.712530920350026e-07, "loss": 0.2271873712539673, "num_input_tokens_seen": 760808016, "step": 12690, "train_runtime": 163004.7719, "train_tokens_per_second": 4667.397 }, { "epoch": 1.6192602040816326, "grad_norm": 0.6924109243905973, "learning_rate": 8.684299488292275e-07, "loss": 0.22521586418151857, "num_input_tokens_seen": 761094160, "step": 12695, "train_runtime": 163071.8349, "train_tokens_per_second": 4667.232 }, { "epoch": 1.6198979591836735, "grad_norm": 0.6763067913069459, "learning_rate": 8.656109519425454e-07, "loss": 0.21990556716918946, "num_input_tokens_seen": 761391048, "step": 12700, "train_runtime": 163141.7484, "train_tokens_per_second": 4667.052 }, { "epoch": 1.6205357142857144, "grad_norm": 0.6926440670904408, "learning_rate": 8.627961042040183e-07, "loss": 0.22145428657531738, "num_input_tokens_seen": 761693320, "step": 12705, "train_runtime": 163195.8345, "train_tokens_per_second": 4667.358 }, { "epoch": 1.621173469387755, "grad_norm": 0.60466273211022, "learning_rate": 8.599854084385422e-07, "loss": 0.22990632057189941, "num_input_tokens_seen": 761997136, "step": 12710, "train_runtime": 163258.7861, "train_tokens_per_second": 4667.419 }, { "epoch": 1.6218112244897958, "grad_norm": 0.7343372763610768, "learning_rate": 8.571788674668469e-07, "loss": 0.2373216152191162, "num_input_tokens_seen": 762285056, "step": 12715, "train_runtime": 163329.7229, "train_tokens_per_second": 4667.155 }, { "epoch": 1.6224489795918369, "grad_norm": 0.6287937244240275, "learning_rate": 8.543764841054919e-07, "loss": 0.2283334493637085, "num_input_tokens_seen": 762592192, "step": 12720, "train_runtime": 163383.1502, "train_tokens_per_second": 4667.508 }, { "epoch": 1.6230867346938775, "grad_norm": 0.6521525005005768, "learning_rate": 8.515782611668649e-07, "loss": 0.23148722648620607, "num_input_tokens_seen": 762890992, "step": 12725, "train_runtime": 163449.8333, "train_tokens_per_second": 4667.432 }, { "epoch": 1.6237244897959182, "grad_norm": 0.6600663449520306, "learning_rate": 8.487842014591779e-07, "loss": 0.21741807460784912, "num_input_tokens_seen": 763193856, "step": 12730, "train_runtime": 163515.5507, "train_tokens_per_second": 4667.408 }, { "epoch": 1.6243622448979593, "grad_norm": 0.7789719798647102, "learning_rate": 8.459943077864651e-07, "loss": 0.2391869068145752, "num_input_tokens_seen": 763504336, "step": 12735, "train_runtime": 163588.0196, "train_tokens_per_second": 4667.239 }, { "epoch": 1.625, "grad_norm": 0.6134353333305429, "learning_rate": 8.432085829485792e-07, "loss": 0.2195131778717041, "num_input_tokens_seen": 763806240, "step": 12740, "train_runtime": 163647.8414, "train_tokens_per_second": 4667.377 }, { "epoch": 1.6256377551020407, "grad_norm": 0.6538388554272606, "learning_rate": 8.404270297411904e-07, "loss": 0.2050943374633789, "num_input_tokens_seen": 764107216, "step": 12745, "train_runtime": 163710.3535, "train_tokens_per_second": 4667.434 }, { "epoch": 1.6262755102040818, "grad_norm": 0.5831986692183562, "learning_rate": 8.376496509557808e-07, "loss": 0.23582563400268555, "num_input_tokens_seen": 764417856, "step": 12750, "train_runtime": 163780.9757, "train_tokens_per_second": 4667.318 }, { "epoch": 1.6269132653061225, "grad_norm": 0.7391994258303932, "learning_rate": 8.348764493796447e-07, "loss": 0.2493993043899536, "num_input_tokens_seen": 764723472, "step": 12755, "train_runtime": 163838.2995, "train_tokens_per_second": 4667.55 }, { "epoch": 1.6275510204081631, "grad_norm": 0.5893725270395765, "learning_rate": 8.321074277958835e-07, "loss": 0.2396076202392578, "num_input_tokens_seen": 765025456, "step": 12760, "train_runtime": 163904.8398, "train_tokens_per_second": 4667.498 }, { "epoch": 1.6281887755102042, "grad_norm": 0.683388506903838, "learning_rate": 8.293425889834045e-07, "loss": 0.2349012851715088, "num_input_tokens_seen": 765324376, "step": 12765, "train_runtime": 163967.0832, "train_tokens_per_second": 4667.549 }, { "epoch": 1.628826530612245, "grad_norm": 0.5994200421359469, "learning_rate": 8.265819357169124e-07, "loss": 0.22822265625, "num_input_tokens_seen": 765624400, "step": 12770, "train_runtime": 164036.2669, "train_tokens_per_second": 4667.409 }, { "epoch": 1.6294642857142856, "grad_norm": 0.6790832287384436, "learning_rate": 8.238254707669208e-07, "loss": 0.2320777177810669, "num_input_tokens_seen": 765922240, "step": 12775, "train_runtime": 164097.3783, "train_tokens_per_second": 4667.486 }, { "epoch": 1.6301020408163265, "grad_norm": 0.5237539020463818, "learning_rate": 8.210731968997331e-07, "loss": 0.22750141620635986, "num_input_tokens_seen": 766229384, "step": 12780, "train_runtime": 164166.5126, "train_tokens_per_second": 4667.391 }, { "epoch": 1.6307397959183674, "grad_norm": 0.803909351774539, "learning_rate": 8.183251168774476e-07, "loss": 0.2525877237319946, "num_input_tokens_seen": 766534376, "step": 12785, "train_runtime": 164225.4142, "train_tokens_per_second": 4667.575 }, { "epoch": 1.631377551020408, "grad_norm": 0.6228117481387875, "learning_rate": 8.155812334579532e-07, "loss": 0.24632534980773926, "num_input_tokens_seen": 766829832, "step": 12790, "train_runtime": 164288.5263, "train_tokens_per_second": 4667.58 }, { "epoch": 1.632015306122449, "grad_norm": 0.6468751335422971, "learning_rate": 8.128415493949326e-07, "loss": 0.24460504055023194, "num_input_tokens_seen": 767132728, "step": 12795, "train_runtime": 164364.9839, "train_tokens_per_second": 4667.252 }, { "epoch": 1.6326530612244898, "grad_norm": 0.7048209442808318, "learning_rate": 8.101060674378463e-07, "loss": 0.24550023078918456, "num_input_tokens_seen": 767417392, "step": 12800, "train_runtime": 164428.0565, "train_tokens_per_second": 4667.193 }, { "epoch": 1.6332908163265305, "grad_norm": 0.7051579119075166, "learning_rate": 8.073747903319418e-07, "loss": 0.22775611877441407, "num_input_tokens_seen": 767705848, "step": 12805, "train_runtime": 164500.9506, "train_tokens_per_second": 4666.878 }, { "epoch": 1.6339285714285714, "grad_norm": 0.648719003052251, "learning_rate": 8.046477208182501e-07, "loss": 0.23567018508911133, "num_input_tokens_seen": 768013696, "step": 12810, "train_runtime": 164571.091, "train_tokens_per_second": 4666.759 }, { "epoch": 1.6345663265306123, "grad_norm": 0.6773509046491577, "learning_rate": 8.019248616335717e-07, "loss": 0.23838484287261963, "num_input_tokens_seen": 768327288, "step": 12815, "train_runtime": 164641.8254, "train_tokens_per_second": 4666.659 }, { "epoch": 1.635204081632653, "grad_norm": 0.5646156572146046, "learning_rate": 7.992062155104879e-07, "loss": 0.2176501512527466, "num_input_tokens_seen": 768616768, "step": 12820, "train_runtime": 164706.7403, "train_tokens_per_second": 4666.577 }, { "epoch": 1.6358418367346939, "grad_norm": 0.6954283907400376, "learning_rate": 7.964917851773496e-07, "loss": 0.24968400001525878, "num_input_tokens_seen": 768920584, "step": 12825, "train_runtime": 164776.3047, "train_tokens_per_second": 4666.451 }, { "epoch": 1.6364795918367347, "grad_norm": 0.6214926377318728, "learning_rate": 7.937815733582771e-07, "loss": 0.23613603115081788, "num_input_tokens_seen": 769214152, "step": 12830, "train_runtime": 164840.5597, "train_tokens_per_second": 4666.413 }, { "epoch": 1.6371173469387754, "grad_norm": 0.7560759819320956, "learning_rate": 7.910755827731576e-07, "loss": 0.25022363662719727, "num_input_tokens_seen": 769499728, "step": 12835, "train_runtime": 164901.9149, "train_tokens_per_second": 4666.409 }, { "epoch": 1.6377551020408163, "grad_norm": 0.6149173034823581, "learning_rate": 7.883738161376414e-07, "loss": 0.23003995418548584, "num_input_tokens_seen": 769809576, "step": 12840, "train_runtime": 164967.6093, "train_tokens_per_second": 4666.429 }, { "epoch": 1.6383928571428572, "grad_norm": 0.7002756775623914, "learning_rate": 7.856762761631398e-07, "loss": 0.22579755783081054, "num_input_tokens_seen": 770103216, "step": 12845, "train_runtime": 165037.0297, "train_tokens_per_second": 4666.245 }, { "epoch": 1.6390306122448979, "grad_norm": 0.602518033828995, "learning_rate": 7.829829655568239e-07, "loss": 0.221382212638855, "num_input_tokens_seen": 770399288, "step": 12850, "train_runtime": 165100.3255, "train_tokens_per_second": 4666.249 }, { "epoch": 1.6396683673469388, "grad_norm": 0.6454536317219705, "learning_rate": 7.802938870216159e-07, "loss": 0.2331010103225708, "num_input_tokens_seen": 770705752, "step": 12855, "train_runtime": 165165.3793, "train_tokens_per_second": 4666.267 }, { "epoch": 1.6403061224489797, "grad_norm": 0.6313468269887681, "learning_rate": 7.776090432561967e-07, "loss": 0.2524754524230957, "num_input_tokens_seen": 771004912, "step": 12860, "train_runtime": 165239.7967, "train_tokens_per_second": 4665.976 }, { "epoch": 1.6409438775510203, "grad_norm": 0.6439996542817811, "learning_rate": 7.749284369549954e-07, "loss": 0.2454533576965332, "num_input_tokens_seen": 771297416, "step": 12865, "train_runtime": 165307.6819, "train_tokens_per_second": 4665.829 }, { "epoch": 1.6415816326530612, "grad_norm": 0.7231457912328102, "learning_rate": 7.722520708081843e-07, "loss": 0.23851680755615234, "num_input_tokens_seen": 771602160, "step": 12870, "train_runtime": 165358.9515, "train_tokens_per_second": 4666.226 }, { "epoch": 1.6422193877551021, "grad_norm": 0.6945461006719696, "learning_rate": 7.695799475016846e-07, "loss": 0.2278822898864746, "num_input_tokens_seen": 771900656, "step": 12875, "train_runtime": 165409.9536, "train_tokens_per_second": 4666.591 }, { "epoch": 1.6428571428571428, "grad_norm": 0.6459446946379738, "learning_rate": 7.669120697171617e-07, "loss": 0.23678188323974608, "num_input_tokens_seen": 772199328, "step": 12880, "train_runtime": 165475.9357, "train_tokens_per_second": 4666.535 }, { "epoch": 1.6434948979591837, "grad_norm": 0.7076929676685086, "learning_rate": 7.642484401320138e-07, "loss": 0.26769237518310546, "num_input_tokens_seen": 772488824, "step": 12885, "train_runtime": 165540.8839, "train_tokens_per_second": 4666.453 }, { "epoch": 1.6441326530612246, "grad_norm": 0.6801416091689853, "learning_rate": 7.615890614193788e-07, "loss": 0.2113205909729004, "num_input_tokens_seen": 772777152, "step": 12890, "train_runtime": 165604.5606, "train_tokens_per_second": 4666.4 }, { "epoch": 1.6447704081632653, "grad_norm": 0.6286940841455992, "learning_rate": 7.589339362481334e-07, "loss": 0.26149330139160154, "num_input_tokens_seen": 773086576, "step": 12895, "train_runtime": 165665.4672, "train_tokens_per_second": 4666.552 }, { "epoch": 1.6454081632653061, "grad_norm": 0.643186966516067, "learning_rate": 7.562830672828775e-07, "loss": 0.24932973384857177, "num_input_tokens_seen": 773394056, "step": 12900, "train_runtime": 165722.7588, "train_tokens_per_second": 4666.794 }, { "epoch": 1.646045918367347, "grad_norm": 0.768531296265755, "learning_rate": 7.536364571839439e-07, "loss": 0.24275400638580322, "num_input_tokens_seen": 773684880, "step": 12905, "train_runtime": 165780.6721, "train_tokens_per_second": 4666.918 }, { "epoch": 1.6466836734693877, "grad_norm": 0.5946491667331976, "learning_rate": 7.509941086073907e-07, "loss": 0.24175541400909423, "num_input_tokens_seen": 773966264, "step": 12910, "train_runtime": 165850.1885, "train_tokens_per_second": 4666.659 }, { "epoch": 1.6473214285714286, "grad_norm": 0.6616771306782862, "learning_rate": 7.483560242049998e-07, "loss": 0.2291048526763916, "num_input_tokens_seen": 774255256, "step": 12915, "train_runtime": 165913.8996, "train_tokens_per_second": 4666.609 }, { "epoch": 1.6479591836734695, "grad_norm": 0.637810008406539, "learning_rate": 7.457222066242725e-07, "loss": 0.2123131275177002, "num_input_tokens_seen": 774563400, "step": 12920, "train_runtime": 165970.0259, "train_tokens_per_second": 4666.887 }, { "epoch": 1.6485969387755102, "grad_norm": 0.5833980269359663, "learning_rate": 7.430926585084292e-07, "loss": 0.24314284324645996, "num_input_tokens_seen": 774865184, "step": 12925, "train_runtime": 166046.0083, "train_tokens_per_second": 4666.569 }, { "epoch": 1.649234693877551, "grad_norm": 0.6269677811841762, "learning_rate": 7.404673824964048e-07, "loss": 0.25867276191711425, "num_input_tokens_seen": 775151648, "step": 12930, "train_runtime": 166111.804, "train_tokens_per_second": 4666.445 }, { "epoch": 1.649872448979592, "grad_norm": 0.7009629658692085, "learning_rate": 7.37846381222847e-07, "loss": 0.23241810798645018, "num_input_tokens_seen": 775451920, "step": 12935, "train_runtime": 166161.0996, "train_tokens_per_second": 4666.868 }, { "epoch": 1.6505102040816326, "grad_norm": 0.6850529082515331, "learning_rate": 7.352296573181139e-07, "loss": 0.24730679988861085, "num_input_tokens_seen": 775764736, "step": 12940, "train_runtime": 166217.2646, "train_tokens_per_second": 4667.173 }, { "epoch": 1.6511479591836735, "grad_norm": 0.6800982510258878, "learning_rate": 7.326172134082704e-07, "loss": 0.23886303901672362, "num_input_tokens_seen": 776069736, "step": 12945, "train_runtime": 166278.8623, "train_tokens_per_second": 4667.278 }, { "epoch": 1.6517857142857144, "grad_norm": 0.6689264040173888, "learning_rate": 7.300090521150882e-07, "loss": 0.2485065460205078, "num_input_tokens_seen": 776357896, "step": 12950, "train_runtime": 166339.9362, "train_tokens_per_second": 4667.297 }, { "epoch": 1.652423469387755, "grad_norm": 0.681451726147646, "learning_rate": 7.274051760560364e-07, "loss": 0.22038323879241944, "num_input_tokens_seen": 776649896, "step": 12955, "train_runtime": 166401.8881, "train_tokens_per_second": 4667.314 }, { "epoch": 1.6530612244897958, "grad_norm": 0.7070238248522148, "learning_rate": 7.248055878442861e-07, "loss": 0.24848322868347167, "num_input_tokens_seen": 776949464, "step": 12960, "train_runtime": 166470.1233, "train_tokens_per_second": 4667.201 }, { "epoch": 1.6536989795918369, "grad_norm": 0.6734788082036008, "learning_rate": 7.222102900887102e-07, "loss": 0.24950251579284669, "num_input_tokens_seen": 777237288, "step": 12965, "train_runtime": 166533.3783, "train_tokens_per_second": 4667.156 }, { "epoch": 1.6543367346938775, "grad_norm": 0.6336921668653426, "learning_rate": 7.196192853938672e-07, "loss": 0.24173741340637206, "num_input_tokens_seen": 777544344, "step": 12970, "train_runtime": 166599.3719, "train_tokens_per_second": 4667.151 }, { "epoch": 1.6549744897959182, "grad_norm": 0.6225871386378725, "learning_rate": 7.170325763600106e-07, "loss": 0.2383871555328369, "num_input_tokens_seen": 777845928, "step": 12975, "train_runtime": 166671.7908, "train_tokens_per_second": 4666.932 }, { "epoch": 1.6556122448979593, "grad_norm": 0.7231042620966402, "learning_rate": 7.144501655830882e-07, "loss": 0.24619700908660888, "num_input_tokens_seen": 778148472, "step": 12980, "train_runtime": 166732.7476, "train_tokens_per_second": 4667.04 }, { "epoch": 1.65625, "grad_norm": 0.6940467107240171, "learning_rate": 7.118720556547259e-07, "loss": 0.24862949848175048, "num_input_tokens_seen": 778453920, "step": 12985, "train_runtime": 166799.4558, "train_tokens_per_second": 4667.005 }, { "epoch": 1.6568877551020407, "grad_norm": 0.5750729482589093, "learning_rate": 7.092982491622374e-07, "loss": 0.21929986476898194, "num_input_tokens_seen": 778750288, "step": 12990, "train_runtime": 166860.6477, "train_tokens_per_second": 4667.07 }, { "epoch": 1.6575255102040818, "grad_norm": 0.6489435981619424, "learning_rate": 7.067287486886181e-07, "loss": 0.23588500022888184, "num_input_tokens_seen": 779035720, "step": 12995, "train_runtime": 166922.4854, "train_tokens_per_second": 4667.051 }, { "epoch": 1.6581632653061225, "grad_norm": 0.7335545461464273, "learning_rate": 7.04163556812541e-07, "loss": 0.2200075149536133, "num_input_tokens_seen": 779323160, "step": 13000, "train_runtime": 166985.5123, "train_tokens_per_second": 4667.011 }, { "epoch": 1.6588010204081631, "grad_norm": 0.7174608148247873, "learning_rate": 7.016026761083556e-07, "loss": 0.2337871789932251, "num_input_tokens_seen": 779634368, "step": 13005, "train_runtime": 167053.8145, "train_tokens_per_second": 4666.965 }, { "epoch": 1.6594387755102042, "grad_norm": 0.6471454219871797, "learning_rate": 6.990461091460832e-07, "loss": 0.21842832565307618, "num_input_tokens_seen": 779949304, "step": 13010, "train_runtime": 167118.1744, "train_tokens_per_second": 4667.053 }, { "epoch": 1.660076530612245, "grad_norm": 0.6536762279535385, "learning_rate": 6.964938584914188e-07, "loss": 0.2667720317840576, "num_input_tokens_seen": 780251160, "step": 13015, "train_runtime": 167172.9351, "train_tokens_per_second": 4667.329 }, { "epoch": 1.6607142857142856, "grad_norm": 0.6513513980210826, "learning_rate": 6.939459267057236e-07, "loss": 0.23891825675964357, "num_input_tokens_seen": 780542248, "step": 13020, "train_runtime": 167238.6688, "train_tokens_per_second": 4667.235 }, { "epoch": 1.6613520408163265, "grad_norm": 0.6690796184761739, "learning_rate": 6.914023163460248e-07, "loss": 0.23524801731109618, "num_input_tokens_seen": 780835848, "step": 13025, "train_runtime": 167297.1518, "train_tokens_per_second": 4667.359 }, { "epoch": 1.6619897959183674, "grad_norm": 0.6494022476204548, "learning_rate": 6.888630299650134e-07, "loss": 0.23164083957672119, "num_input_tokens_seen": 781129632, "step": 13030, "train_runtime": 167368.3896, "train_tokens_per_second": 4667.128 }, { "epoch": 1.662627551020408, "grad_norm": 0.6726015289964822, "learning_rate": 6.863280701110409e-07, "loss": 0.2392362594604492, "num_input_tokens_seen": 781440616, "step": 13035, "train_runtime": 167441.0063, "train_tokens_per_second": 4666.961 }, { "epoch": 1.663265306122449, "grad_norm": 0.5515137395417501, "learning_rate": 6.837974393281171e-07, "loss": 0.23983891010284425, "num_input_tokens_seen": 781753168, "step": 13040, "train_runtime": 167500.6804, "train_tokens_per_second": 4667.164 }, { "epoch": 1.6639030612244898, "grad_norm": 0.6252944736562958, "learning_rate": 6.812711401559036e-07, "loss": 0.24457283020019532, "num_input_tokens_seen": 782054760, "step": 13045, "train_runtime": 167569.8892, "train_tokens_per_second": 4667.036 }, { "epoch": 1.6645408163265305, "grad_norm": 0.7101997830680842, "learning_rate": 6.787491751297215e-07, "loss": 0.2504986047744751, "num_input_tokens_seen": 782357888, "step": 13050, "train_runtime": 167628.6852, "train_tokens_per_second": 4667.208 }, { "epoch": 1.6651785714285714, "grad_norm": 0.6509633575539316, "learning_rate": 6.762315467805391e-07, "loss": 0.23212313652038574, "num_input_tokens_seen": 782670360, "step": 13055, "train_runtime": 167702.6376, "train_tokens_per_second": 4667.013 }, { "epoch": 1.6658163265306123, "grad_norm": 0.6520969667067783, "learning_rate": 6.737182576349682e-07, "loss": 0.2592411279678345, "num_input_tokens_seen": 782974768, "step": 13060, "train_runtime": 167771.9509, "train_tokens_per_second": 4666.899 }, { "epoch": 1.666454081632653, "grad_norm": 0.7351402048932675, "learning_rate": 6.712093102152739e-07, "loss": 0.21734251976013183, "num_input_tokens_seen": 783266480, "step": 13065, "train_runtime": 167829.777, "train_tokens_per_second": 4667.029 }, { "epoch": 1.6670918367346939, "grad_norm": 0.5915552133165983, "learning_rate": 6.687047070393599e-07, "loss": 0.2443648099899292, "num_input_tokens_seen": 783559480, "step": 13070, "train_runtime": 167880.3444, "train_tokens_per_second": 4667.369 }, { "epoch": 1.6677295918367347, "grad_norm": 0.6550876999474847, "learning_rate": 6.662044506207682e-07, "loss": 0.2329019069671631, "num_input_tokens_seen": 783856904, "step": 13075, "train_runtime": 167950.7256, "train_tokens_per_second": 4667.184 }, { "epoch": 1.6683673469387754, "grad_norm": 0.7762900714349238, "learning_rate": 6.637085434686818e-07, "loss": 0.24540672302246094, "num_input_tokens_seen": 784148840, "step": 13080, "train_runtime": 168014.4768, "train_tokens_per_second": 4667.15 }, { "epoch": 1.6690051020408163, "grad_norm": 0.5831630072297834, "learning_rate": 6.612169880879182e-07, "loss": 0.23792333602905275, "num_input_tokens_seen": 784434088, "step": 13085, "train_runtime": 168077.5178, "train_tokens_per_second": 4667.097 }, { "epoch": 1.6696428571428572, "grad_norm": 0.6974623502410974, "learning_rate": 6.587297869789267e-07, "loss": 0.25593783855438235, "num_input_tokens_seen": 784751688, "step": 13090, "train_runtime": 168129.4993, "train_tokens_per_second": 4667.543 }, { "epoch": 1.6702806122448979, "grad_norm": 0.5647333080925127, "learning_rate": 6.562469426377876e-07, "loss": 0.2372671604156494, "num_input_tokens_seen": 785058632, "step": 13095, "train_runtime": 168195.8955, "train_tokens_per_second": 4667.526 }, { "epoch": 1.6709183673469388, "grad_norm": 0.6270225616945366, "learning_rate": 6.537684575562092e-07, "loss": 0.23312408924102784, "num_input_tokens_seen": 785358784, "step": 13100, "train_runtime": 168258.5469, "train_tokens_per_second": 4667.571 }, { "epoch": 1.6715561224489797, "grad_norm": 0.6756205304063072, "learning_rate": 6.512943342215234e-07, "loss": 0.24810218811035156, "num_input_tokens_seen": 785664184, "step": 13105, "train_runtime": 168314.0596, "train_tokens_per_second": 4667.846 }, { "epoch": 1.6721938775510203, "grad_norm": 0.6922093905073984, "learning_rate": 6.48824575116686e-07, "loss": 0.2378976821899414, "num_input_tokens_seen": 785968104, "step": 13110, "train_runtime": 168379.0689, "train_tokens_per_second": 4667.849 }, { "epoch": 1.6728316326530612, "grad_norm": 0.6205064925837434, "learning_rate": 6.463591827202731e-07, "loss": 0.2181920289993286, "num_input_tokens_seen": 786276736, "step": 13115, "train_runtime": 168442.4663, "train_tokens_per_second": 4667.925 }, { "epoch": 1.6734693877551021, "grad_norm": 0.6322769862399636, "learning_rate": 6.43898159506478e-07, "loss": 0.2371192455291748, "num_input_tokens_seen": 786586048, "step": 13120, "train_runtime": 168492.2687, "train_tokens_per_second": 4668.381 }, { "epoch": 1.6741071428571428, "grad_norm": 0.6650323471277796, "learning_rate": 6.414415079451092e-07, "loss": 0.23830742835998536, "num_input_tokens_seen": 786901176, "step": 13125, "train_runtime": 168561.7027, "train_tokens_per_second": 4668.327 }, { "epoch": 1.6747448979591837, "grad_norm": 0.7764672572292787, "learning_rate": 6.389892305015882e-07, "loss": 0.2065678834915161, "num_input_tokens_seen": 787215728, "step": 13130, "train_runtime": 168625.5521, "train_tokens_per_second": 4668.425 }, { "epoch": 1.6753826530612246, "grad_norm": 0.6564512817800019, "learning_rate": 6.365413296369466e-07, "loss": 0.22998642921447754, "num_input_tokens_seen": 787527752, "step": 13135, "train_runtime": 168683.2805, "train_tokens_per_second": 4668.677 }, { "epoch": 1.6760204081632653, "grad_norm": 0.6018613749799228, "learning_rate": 6.340978078078253e-07, "loss": 0.23836636543273926, "num_input_tokens_seen": 787831184, "step": 13140, "train_runtime": 168754.1292, "train_tokens_per_second": 4668.515 }, { "epoch": 1.6766581632653061, "grad_norm": 0.6919813918443481, "learning_rate": 6.316586674664654e-07, "loss": 0.2525269269943237, "num_input_tokens_seen": 788136568, "step": 13145, "train_runtime": 168821.1967, "train_tokens_per_second": 4668.469 }, { "epoch": 1.677295918367347, "grad_norm": 0.6528782752201642, "learning_rate": 6.292239110607185e-07, "loss": 0.21977272033691406, "num_input_tokens_seen": 788439488, "step": 13150, "train_runtime": 168879.1023, "train_tokens_per_second": 4668.662 }, { "epoch": 1.6779336734693877, "grad_norm": 0.6089059934202922, "learning_rate": 6.26793541034032e-07, "loss": 0.23867287635803222, "num_input_tokens_seen": 788744384, "step": 13155, "train_runtime": 168940.4936, "train_tokens_per_second": 4668.77 }, { "epoch": 1.6785714285714286, "grad_norm": 0.6574053513640027, "learning_rate": 6.243675598254501e-07, "loss": 0.24979965686798095, "num_input_tokens_seen": 789060160, "step": 13160, "train_runtime": 168986.667, "train_tokens_per_second": 4669.363 }, { "epoch": 1.6792091836734695, "grad_norm": 0.7242613578315252, "learning_rate": 6.21945969869614e-07, "loss": 0.22568295001983643, "num_input_tokens_seen": 789333192, "step": 13165, "train_runtime": 169048.3113, "train_tokens_per_second": 4669.276 }, { "epoch": 1.6798469387755102, "grad_norm": 0.6199896905911603, "learning_rate": 6.195287735967626e-07, "loss": 0.2524087429046631, "num_input_tokens_seen": 789645128, "step": 13170, "train_runtime": 169110.1758, "train_tokens_per_second": 4669.412 }, { "epoch": 1.680484693877551, "grad_norm": 0.6120028452633463, "learning_rate": 6.171159734327164e-07, "loss": 0.2139357805252075, "num_input_tokens_seen": 789949752, "step": 13175, "train_runtime": 169181.7725, "train_tokens_per_second": 4669.237 }, { "epoch": 1.681122448979592, "grad_norm": 0.6758272900434804, "learning_rate": 6.147075717988904e-07, "loss": 0.2241701602935791, "num_input_tokens_seen": 790244912, "step": 13180, "train_runtime": 169251.2962, "train_tokens_per_second": 4669.063 }, { "epoch": 1.6817602040816326, "grad_norm": 0.6275304724163975, "learning_rate": 6.12303571112286e-07, "loss": 0.22757821083068847, "num_input_tokens_seen": 790546744, "step": 13185, "train_runtime": 169314.7937, "train_tokens_per_second": 4669.094 }, { "epoch": 1.6823979591836735, "grad_norm": 0.6270764021857508, "learning_rate": 6.099039737854834e-07, "loss": 0.25056018829345705, "num_input_tokens_seen": 790863352, "step": 13190, "train_runtime": 169370.6591, "train_tokens_per_second": 4669.424 }, { "epoch": 1.6830357142857144, "grad_norm": 0.6809793155677599, "learning_rate": 6.075087822266462e-07, "loss": 0.20741257667541504, "num_input_tokens_seen": 791171280, "step": 13195, "train_runtime": 169436.5744, "train_tokens_per_second": 4669.424 }, { "epoch": 1.683673469387755, "grad_norm": 0.5878364576150888, "learning_rate": 6.051179988395172e-07, "loss": 0.22054729461669922, "num_input_tokens_seen": 791486320, "step": 13200, "train_runtime": 169492.293, "train_tokens_per_second": 4669.748 }, { "epoch": 1.6843112244897958, "grad_norm": 0.7203585835063011, "learning_rate": 6.027316260234146e-07, "loss": 0.27373924255371096, "num_input_tokens_seen": 791793976, "step": 13205, "train_runtime": 169559.8932, "train_tokens_per_second": 4669.701 }, { "epoch": 1.6849489795918369, "grad_norm": 0.5865106613971609, "learning_rate": 6.003496661732294e-07, "loss": 0.23949275016784669, "num_input_tokens_seen": 792089672, "step": 13210, "train_runtime": 169625.1798, "train_tokens_per_second": 4669.647 }, { "epoch": 1.6855867346938775, "grad_norm": 0.7162563935397777, "learning_rate": 5.979721216794248e-07, "loss": 0.2525262594223022, "num_input_tokens_seen": 792382456, "step": 13215, "train_runtime": 169692.1822, "train_tokens_per_second": 4669.528 }, { "epoch": 1.6862244897959182, "grad_norm": 0.6748019054294158, "learning_rate": 5.955989949280339e-07, "loss": 0.23312003612518312, "num_input_tokens_seen": 792686240, "step": 13220, "train_runtime": 169752.6983, "train_tokens_per_second": 4669.653 }, { "epoch": 1.6868622448979593, "grad_norm": 0.6002767804793778, "learning_rate": 5.932302883006546e-07, "loss": 0.22830729484558104, "num_input_tokens_seen": 792990384, "step": 13225, "train_runtime": 169807.1179, "train_tokens_per_second": 4669.948 }, { "epoch": 1.6875, "grad_norm": 0.6021912915515264, "learning_rate": 5.908660041744473e-07, "loss": 0.22178337574005128, "num_input_tokens_seen": 793290664, "step": 13230, "train_runtime": 169870.3054, "train_tokens_per_second": 4669.978 }, { "epoch": 1.6881377551020407, "grad_norm": 0.6938996846206934, "learning_rate": 5.88506144922139e-07, "loss": 0.2509466171264648, "num_input_tokens_seen": 793592912, "step": 13235, "train_runtime": 169944.4774, "train_tokens_per_second": 4669.719 }, { "epoch": 1.6887755102040818, "grad_norm": 0.6052751439246761, "learning_rate": 5.861507129120136e-07, "loss": 0.2257427453994751, "num_input_tokens_seen": 793890616, "step": 13240, "train_runtime": 170005.1722, "train_tokens_per_second": 4669.803 }, { "epoch": 1.6894132653061225, "grad_norm": 0.7134737879671132, "learning_rate": 5.83799710507909e-07, "loss": 0.25400538444519044, "num_input_tokens_seen": 794185328, "step": 13245, "train_runtime": 170065.4423, "train_tokens_per_second": 4669.881 }, { "epoch": 1.6900510204081631, "grad_norm": 0.7258888105327589, "learning_rate": 5.814531400692208e-07, "loss": 0.26824064254760743, "num_input_tokens_seen": 794496184, "step": 13250, "train_runtime": 170124.3445, "train_tokens_per_second": 4670.091 }, { "epoch": 1.6906887755102042, "grad_norm": 0.6331302847597774, "learning_rate": 5.791110039508991e-07, "loss": 0.2345498561859131, "num_input_tokens_seen": 794793464, "step": 13255, "train_runtime": 170177.5113, "train_tokens_per_second": 4670.379 }, { "epoch": 1.691326530612245, "grad_norm": 0.6529794287832457, "learning_rate": 5.767733045034384e-07, "loss": 0.23070354461669923, "num_input_tokens_seen": 795101568, "step": 13260, "train_runtime": 170228.2802, "train_tokens_per_second": 4670.796 }, { "epoch": 1.6919642857142856, "grad_norm": 0.7162889014250071, "learning_rate": 5.744400440728826e-07, "loss": 0.24982943534851074, "num_input_tokens_seen": 795394008, "step": 13265, "train_runtime": 170287.2087, "train_tokens_per_second": 4670.897 }, { "epoch": 1.6926020408163265, "grad_norm": 0.7169809815043828, "learning_rate": 5.721112250008254e-07, "loss": 0.24927678108215331, "num_input_tokens_seen": 795698152, "step": 13270, "train_runtime": 170335.1968, "train_tokens_per_second": 4671.367 }, { "epoch": 1.6932397959183674, "grad_norm": 0.7229019398440883, "learning_rate": 5.697868496243958e-07, "loss": 0.2426917314529419, "num_input_tokens_seen": 795986528, "step": 13275, "train_runtime": 170403.9763, "train_tokens_per_second": 4671.173 }, { "epoch": 1.693877551020408, "grad_norm": 0.6823064047188397, "learning_rate": 5.674669202762684e-07, "loss": 0.2601162433624268, "num_input_tokens_seen": 796272320, "step": 13280, "train_runtime": 170469.4471, "train_tokens_per_second": 4671.056 }, { "epoch": 1.694515306122449, "grad_norm": 0.6795799080739466, "learning_rate": 5.651514392846535e-07, "loss": 0.22376790046691894, "num_input_tokens_seen": 796555656, "step": 13285, "train_runtime": 170540.7743, "train_tokens_per_second": 4670.764 }, { "epoch": 1.6951530612244898, "grad_norm": 0.6295307107669424, "learning_rate": 5.628404089732986e-07, "loss": 0.22962615489959717, "num_input_tokens_seen": 796856728, "step": 13290, "train_runtime": 170597.2119, "train_tokens_per_second": 4670.983 }, { "epoch": 1.6957908163265305, "grad_norm": 0.6399541549108114, "learning_rate": 5.605338316614839e-07, "loss": 0.2222541332244873, "num_input_tokens_seen": 797155856, "step": 13295, "train_runtime": 170665.2359, "train_tokens_per_second": 4670.874 }, { "epoch": 1.6964285714285714, "grad_norm": 0.6903583723354867, "learning_rate": 5.582317096640205e-07, "loss": 0.24221839904785156, "num_input_tokens_seen": 797460584, "step": 13300, "train_runtime": 170726.1599, "train_tokens_per_second": 4670.992 }, { "epoch": 1.6970663265306123, "grad_norm": 0.6184520869805074, "learning_rate": 5.559340452912488e-07, "loss": 0.23153388500213623, "num_input_tokens_seen": 797751920, "step": 13305, "train_runtime": 170790.754, "train_tokens_per_second": 4670.932 }, { "epoch": 1.697704081632653, "grad_norm": 0.7135832499278726, "learning_rate": 5.536408408490357e-07, "loss": 0.22246937751770018, "num_input_tokens_seen": 798043360, "step": 13310, "train_runtime": 170860.2489, "train_tokens_per_second": 4670.737 }, { "epoch": 1.6983418367346939, "grad_norm": 0.7078778236042537, "learning_rate": 5.513520986387721e-07, "loss": 0.24500691890716553, "num_input_tokens_seen": 798332080, "step": 13315, "train_runtime": 170927.4031, "train_tokens_per_second": 4670.592 }, { "epoch": 1.6989795918367347, "grad_norm": 0.7227787438942411, "learning_rate": 5.490678209573702e-07, "loss": 0.2364062786102295, "num_input_tokens_seen": 798607976, "step": 13320, "train_runtime": 170993.9651, "train_tokens_per_second": 4670.387 }, { "epoch": 1.6996173469387754, "grad_norm": 0.6375791863318517, "learning_rate": 5.467880100972633e-07, "loss": 0.2318039655685425, "num_input_tokens_seen": 798914928, "step": 13325, "train_runtime": 171066.7726, "train_tokens_per_second": 4670.193 }, { "epoch": 1.7002551020408163, "grad_norm": 0.7024225587032696, "learning_rate": 5.445126683463991e-07, "loss": 0.225300931930542, "num_input_tokens_seen": 799201912, "step": 13330, "train_runtime": 171136.0756, "train_tokens_per_second": 4669.979 }, { "epoch": 1.7008928571428572, "grad_norm": 0.6947061308185476, "learning_rate": 5.422417979882416e-07, "loss": 0.2390727996826172, "num_input_tokens_seen": 799500912, "step": 13335, "train_runtime": 171195.6903, "train_tokens_per_second": 4670.1 }, { "epoch": 1.7015306122448979, "grad_norm": 0.6744260978311201, "learning_rate": 5.399754013017711e-07, "loss": 0.24486470222473145, "num_input_tokens_seen": 799802056, "step": 13340, "train_runtime": 171273.9825, "train_tokens_per_second": 4669.723 }, { "epoch": 1.7021683673469388, "grad_norm": 0.6429457060308061, "learning_rate": 5.377134805614714e-07, "loss": 0.24208824634552, "num_input_tokens_seen": 800105448, "step": 13345, "train_runtime": 171335.2325, "train_tokens_per_second": 4669.824 }, { "epoch": 1.7028061224489797, "grad_norm": 0.6426895549519162, "learning_rate": 5.354560380373391e-07, "loss": 0.24773249626159669, "num_input_tokens_seen": 800402784, "step": 13350, "train_runtime": 171404.2368, "train_tokens_per_second": 4669.679 }, { "epoch": 1.7034438775510203, "grad_norm": 0.5991718681845893, "learning_rate": 5.33203075994877e-07, "loss": 0.21396217346191407, "num_input_tokens_seen": 800698176, "step": 13355, "train_runtime": 171463.7506, "train_tokens_per_second": 4669.781 }, { "epoch": 1.7040816326530612, "grad_norm": 0.6201191314297776, "learning_rate": 5.30954596695088e-07, "loss": 0.22633423805236816, "num_input_tokens_seen": 800984856, "step": 13360, "train_runtime": 171531.9766, "train_tokens_per_second": 4669.595 }, { "epoch": 1.7047193877551021, "grad_norm": 0.6999381622909089, "learning_rate": 5.287106023944782e-07, "loss": 0.23737623691558837, "num_input_tokens_seen": 801276848, "step": 13365, "train_runtime": 171595.5522, "train_tokens_per_second": 4669.567 }, { "epoch": 1.7053571428571428, "grad_norm": 0.6318852729096377, "learning_rate": 5.264710953450536e-07, "loss": 0.2482755422592163, "num_input_tokens_seen": 801596640, "step": 13370, "train_runtime": 171651.1702, "train_tokens_per_second": 4669.917 }, { "epoch": 1.7059948979591837, "grad_norm": 0.6961074086784965, "learning_rate": 5.242360777943151e-07, "loss": 0.23192543983459474, "num_input_tokens_seen": 801897464, "step": 13375, "train_runtime": 171724.8242, "train_tokens_per_second": 4669.665 }, { "epoch": 1.7066326530612246, "grad_norm": 0.5684368095853556, "learning_rate": 5.220055519852596e-07, "loss": 0.22409448623657227, "num_input_tokens_seen": 802200952, "step": 13380, "train_runtime": 171785.9245, "train_tokens_per_second": 4669.771 }, { "epoch": 1.7072704081632653, "grad_norm": 0.6515430866792863, "learning_rate": 5.197795201563744e-07, "loss": 0.2705721139907837, "num_input_tokens_seen": 802506256, "step": 13385, "train_runtime": 171849.8353, "train_tokens_per_second": 4669.811 }, { "epoch": 1.7079081632653061, "grad_norm": 0.6668819348988576, "learning_rate": 5.17557984541639e-07, "loss": 0.2662747621536255, "num_input_tokens_seen": 802805520, "step": 13390, "train_runtime": 171911.4233, "train_tokens_per_second": 4669.879 }, { "epoch": 1.708545918367347, "grad_norm": 0.6743605237110354, "learning_rate": 5.153409473705196e-07, "loss": 0.2485663652420044, "num_input_tokens_seen": 803103280, "step": 13395, "train_runtime": 171982.8737, "train_tokens_per_second": 4669.67 }, { "epoch": 1.7091836734693877, "grad_norm": 0.6440519264044283, "learning_rate": 5.131284108679669e-07, "loss": 0.2337883949279785, "num_input_tokens_seen": 803410592, "step": 13400, "train_runtime": 172056.6255, "train_tokens_per_second": 4669.455 }, { "epoch": 1.7098214285714286, "grad_norm": 0.6136284043578738, "learning_rate": 5.109203772544164e-07, "loss": 0.2468946933746338, "num_input_tokens_seen": 803694072, "step": 13405, "train_runtime": 172114.153, "train_tokens_per_second": 4669.541 }, { "epoch": 1.7104591836734695, "grad_norm": 0.6631202438302672, "learning_rate": 5.087168487457838e-07, "loss": 0.24713754653930664, "num_input_tokens_seen": 803988080, "step": 13410, "train_runtime": 172181.2472, "train_tokens_per_second": 4669.429 }, { "epoch": 1.7110969387755102, "grad_norm": 0.6270691642392973, "learning_rate": 5.065178275534649e-07, "loss": 0.24309072494506836, "num_input_tokens_seen": 804281616, "step": 13415, "train_runtime": 172243.0338, "train_tokens_per_second": 4669.458 }, { "epoch": 1.711734693877551, "grad_norm": 0.6303950881365012, "learning_rate": 5.043233158843286e-07, "loss": 0.21336078643798828, "num_input_tokens_seen": 804588296, "step": 13420, "train_runtime": 172306.2337, "train_tokens_per_second": 4669.525 }, { "epoch": 1.712372448979592, "grad_norm": 0.6823793728366182, "learning_rate": 5.021333159407232e-07, "loss": 0.21080243587493896, "num_input_tokens_seen": 804894048, "step": 13425, "train_runtime": 172376.5821, "train_tokens_per_second": 4669.393 }, { "epoch": 1.7130102040816326, "grad_norm": 0.6965415710532609, "learning_rate": 4.999478299204663e-07, "loss": 0.22796895503997802, "num_input_tokens_seen": 805181152, "step": 13430, "train_runtime": 172452.0614, "train_tokens_per_second": 4669.014 }, { "epoch": 1.7136479591836735, "grad_norm": 0.6604348579422982, "learning_rate": 4.977668600168428e-07, "loss": 0.23527843952178956, "num_input_tokens_seen": 805494080, "step": 13435, "train_runtime": 172501.7404, "train_tokens_per_second": 4669.484 }, { "epoch": 1.7142857142857144, "grad_norm": 0.676402075964292, "learning_rate": 4.95590408418613e-07, "loss": 0.24013857841491698, "num_input_tokens_seen": 805803936, "step": 13440, "train_runtime": 172567.1657, "train_tokens_per_second": 4669.509 }, { "epoch": 1.714923469387755, "grad_norm": 0.6911538717885582, "learning_rate": 4.934184773099943e-07, "loss": 0.22080633640289307, "num_input_tokens_seen": 806106240, "step": 13445, "train_runtime": 172632.8709, "train_tokens_per_second": 4669.483 }, { "epoch": 1.7155612244897958, "grad_norm": 0.6713450261422883, "learning_rate": 4.912510688706729e-07, "loss": 0.23345427513122557, "num_input_tokens_seen": 806415144, "step": 13450, "train_runtime": 172693.6075, "train_tokens_per_second": 4669.629 }, { "epoch": 1.7161989795918369, "grad_norm": 0.6415476000447592, "learning_rate": 4.89088185275794e-07, "loss": 0.2405320405960083, "num_input_tokens_seen": 806721576, "step": 13455, "train_runtime": 172753.864, "train_tokens_per_second": 4669.774 }, { "epoch": 1.7168367346938775, "grad_norm": 0.6394336288283835, "learning_rate": 4.869298286959629e-07, "loss": 0.24434318542480468, "num_input_tokens_seen": 807016592, "step": 13460, "train_runtime": 172814.3827, "train_tokens_per_second": 4669.846 }, { "epoch": 1.7174744897959182, "grad_norm": 0.7250715253066639, "learning_rate": 4.847760012972402e-07, "loss": 0.24424867630004882, "num_input_tokens_seen": 807311592, "step": 13465, "train_runtime": 172872.9505, "train_tokens_per_second": 4669.971 }, { "epoch": 1.7181122448979593, "grad_norm": 0.6743289428080376, "learning_rate": 4.826267052411432e-07, "loss": 0.24404535293579102, "num_input_tokens_seen": 807612352, "step": 13470, "train_runtime": 172930.3198, "train_tokens_per_second": 4670.161 }, { "epoch": 1.71875, "grad_norm": 0.7351586720837548, "learning_rate": 4.804819426846402e-07, "loss": 0.22565245628356934, "num_input_tokens_seen": 807897064, "step": 13475, "train_runtime": 172999.1838, "train_tokens_per_second": 4669.947 }, { "epoch": 1.7193877551020407, "grad_norm": 0.6678568236586356, "learning_rate": 4.783417157801496e-07, "loss": 0.21748955249786378, "num_input_tokens_seen": 808193664, "step": 13480, "train_runtime": 173064.7835, "train_tokens_per_second": 4669.891 }, { "epoch": 1.7200255102040818, "grad_norm": 0.6671307263692728, "learning_rate": 4.7620602667553973e-07, "loss": 0.2572862386703491, "num_input_tokens_seen": 808500880, "step": 13485, "train_runtime": 173120.8158, "train_tokens_per_second": 4670.154 }, { "epoch": 1.7206632653061225, "grad_norm": 0.6409595628558943, "learning_rate": 4.7407487751412297e-07, "loss": 0.22354741096496583, "num_input_tokens_seen": 808807400, "step": 13490, "train_runtime": 173185.3061, "train_tokens_per_second": 4670.185 }, { "epoch": 1.7213010204081631, "grad_norm": 0.6579699415119424, "learning_rate": 4.719482704346567e-07, "loss": 0.23170833587646483, "num_input_tokens_seen": 809101600, "step": 13495, "train_runtime": 173257.6534, "train_tokens_per_second": 4669.933 }, { "epoch": 1.7219387755102042, "grad_norm": 0.6774820763490025, "learning_rate": 4.6982620757133947e-07, "loss": 0.23648290634155272, "num_input_tokens_seen": 809390464, "step": 13500, "train_runtime": 173325.8921, "train_tokens_per_second": 4669.761 }, { "epoch": 1.722576530612245, "grad_norm": 0.5914618604032441, "learning_rate": 4.677086910538092e-07, "loss": 0.2374885082244873, "num_input_tokens_seen": 809689432, "step": 13505, "train_runtime": 173381.4046, "train_tokens_per_second": 4669.99 }, { "epoch": 1.7232142857142856, "grad_norm": 0.6726778635616372, "learning_rate": 4.6559572300714227e-07, "loss": 0.24542546272277832, "num_input_tokens_seen": 809969104, "step": 13510, "train_runtime": 173455.2436, "train_tokens_per_second": 4669.614 }, { "epoch": 1.7238520408163265, "grad_norm": 0.6190729925694712, "learning_rate": 4.6348730555185017e-07, "loss": 0.24277071952819823, "num_input_tokens_seen": 810286584, "step": 13515, "train_runtime": 173520.539, "train_tokens_per_second": 4669.687 }, { "epoch": 1.7244897959183674, "grad_norm": 0.617446990395065, "learning_rate": 4.6138344080387477e-07, "loss": 0.23009822368621827, "num_input_tokens_seen": 810602320, "step": 13520, "train_runtime": 173580.8412, "train_tokens_per_second": 4669.884 }, { "epoch": 1.725127551020408, "grad_norm": 0.5909057085469849, "learning_rate": 4.5928413087459325e-07, "loss": 0.23138022422790527, "num_input_tokens_seen": 810900880, "step": 13525, "train_runtime": 173646.1816, "train_tokens_per_second": 4669.846 }, { "epoch": 1.725765306122449, "grad_norm": 0.6990994921236008, "learning_rate": 4.571893778708103e-07, "loss": 0.24251241683959962, "num_input_tokens_seen": 811204872, "step": 13530, "train_runtime": 173714.0285, "train_tokens_per_second": 4669.772 }, { "epoch": 1.7264030612244898, "grad_norm": 0.691710106606899, "learning_rate": 4.550991838947555e-07, "loss": 0.2421931028366089, "num_input_tokens_seen": 811514968, "step": 13535, "train_runtime": 173769.9635, "train_tokens_per_second": 4670.053 }, { "epoch": 1.7270408163265305, "grad_norm": 0.6412155657066987, "learning_rate": 4.5301355104408364e-07, "loss": 0.2364500045776367, "num_input_tokens_seen": 811819304, "step": 13540, "train_runtime": 173834.298, "train_tokens_per_second": 4670.076 }, { "epoch": 1.7276785714285714, "grad_norm": 0.6589027866184222, "learning_rate": 4.509324814118754e-07, "loss": 0.23405904769897462, "num_input_tokens_seen": 812110048, "step": 13545, "train_runtime": 173896.7703, "train_tokens_per_second": 4670.07 }, { "epoch": 1.7283163265306123, "grad_norm": 0.6636270040091218, "learning_rate": 4.48855977086628e-07, "loss": 0.24407567977905273, "num_input_tokens_seen": 812418688, "step": 13550, "train_runtime": 173956.2348, "train_tokens_per_second": 4670.248 }, { "epoch": 1.728954081632653, "grad_norm": 0.658411946742043, "learning_rate": 4.4678404015225774e-07, "loss": 0.2599534749984741, "num_input_tokens_seen": 812723312, "step": 13555, "train_runtime": 174012.9141, "train_tokens_per_second": 4670.477 }, { "epoch": 1.7295918367346939, "grad_norm": 0.6139143066309292, "learning_rate": 4.447166726881008e-07, "loss": 0.23822329044342042, "num_input_tokens_seen": 813035912, "step": 13560, "train_runtime": 174083.1745, "train_tokens_per_second": 4670.388 }, { "epoch": 1.7302295918367347, "grad_norm": 0.6621552613210114, "learning_rate": 4.4265387676890203e-07, "loss": 0.24881305694580078, "num_input_tokens_seen": 813329208, "step": 13565, "train_runtime": 174154.5532, "train_tokens_per_second": 4670.158 }, { "epoch": 1.7308673469387754, "grad_norm": 0.626801875804379, "learning_rate": 4.4059565446482264e-07, "loss": 0.21699411869049073, "num_input_tokens_seen": 813632984, "step": 13570, "train_runtime": 174207.556, "train_tokens_per_second": 4670.48 }, { "epoch": 1.7315051020408163, "grad_norm": 0.8243709857496591, "learning_rate": 4.385420078414321e-07, "loss": 0.2210158586502075, "num_input_tokens_seen": 813920824, "step": 13575, "train_runtime": 174276.7198, "train_tokens_per_second": 4670.279 }, { "epoch": 1.7321428571428572, "grad_norm": 0.6718667392684093, "learning_rate": 4.364929389597078e-07, "loss": 0.24734091758728027, "num_input_tokens_seen": 814211728, "step": 13580, "train_runtime": 174346.4516, "train_tokens_per_second": 4670.079 }, { "epoch": 1.7327806122448979, "grad_norm": 0.7430646024505064, "learning_rate": 4.344484498760343e-07, "loss": 0.2424243211746216, "num_input_tokens_seen": 814535280, "step": 13585, "train_runtime": 174388.9031, "train_tokens_per_second": 4670.798 }, { "epoch": 1.7334183673469388, "grad_norm": 0.6676563012269507, "learning_rate": 4.324085426421981e-07, "loss": 0.25947110652923583, "num_input_tokens_seen": 814835792, "step": 13590, "train_runtime": 174457.9295, "train_tokens_per_second": 4670.672 }, { "epoch": 1.7340561224489797, "grad_norm": 0.7575342624104773, "learning_rate": 4.3037321930539e-07, "loss": 0.2515279769897461, "num_input_tokens_seen": 815155832, "step": 13595, "train_runtime": 174521.0114, "train_tokens_per_second": 4670.818 }, { "epoch": 1.7346938775510203, "grad_norm": 0.7319250653273267, "learning_rate": 4.283424819081988e-07, "loss": 0.24448864459991454, "num_input_tokens_seen": 815456800, "step": 13600, "train_runtime": 174588.2544, "train_tokens_per_second": 4670.743 }, { "epoch": 1.7353316326530612, "grad_norm": 0.6386486022394067, "learning_rate": 4.2631633248860937e-07, "loss": 0.22787261009216309, "num_input_tokens_seen": 815744312, "step": 13605, "train_runtime": 174664.7613, "train_tokens_per_second": 4670.343 }, { "epoch": 1.7359693877551021, "grad_norm": 0.6561912731197608, "learning_rate": 4.2429477308000676e-07, "loss": 0.24429092407226563, "num_input_tokens_seen": 816042632, "step": 13610, "train_runtime": 174726.5898, "train_tokens_per_second": 4670.398 }, { "epoch": 1.7366071428571428, "grad_norm": 0.7504185585120464, "learning_rate": 4.222778057111665e-07, "loss": 0.2465668201446533, "num_input_tokens_seen": 816330096, "step": 13615, "train_runtime": 174781.9564, "train_tokens_per_second": 4670.563 }, { "epoch": 1.7372448979591837, "grad_norm": 0.6378267197499972, "learning_rate": 4.202654324062544e-07, "loss": 0.23370888233184814, "num_input_tokens_seen": 816617648, "step": 13620, "train_runtime": 174851.6027, "train_tokens_per_second": 4670.347 }, { "epoch": 1.7378826530612246, "grad_norm": 0.664002130605753, "learning_rate": 4.182576551848283e-07, "loss": 0.2455160140991211, "num_input_tokens_seen": 816918360, "step": 13625, "train_runtime": 174911.2085, "train_tokens_per_second": 4670.475 }, { "epoch": 1.7385204081632653, "grad_norm": 0.61713932962022, "learning_rate": 4.1625447606183533e-07, "loss": 0.24306926727294922, "num_input_tokens_seen": 817224032, "step": 13630, "train_runtime": 174969.0144, "train_tokens_per_second": 4670.679 }, { "epoch": 1.7391581632653061, "grad_norm": 0.6178408609649475, "learning_rate": 4.142558970476024e-07, "loss": 0.22744331359863282, "num_input_tokens_seen": 817531176, "step": 13635, "train_runtime": 175035.7027, "train_tokens_per_second": 4670.654 }, { "epoch": 1.739795918367347, "grad_norm": 0.6692420345619271, "learning_rate": 4.1226192014784393e-07, "loss": 0.2176975965499878, "num_input_tokens_seen": 817805400, "step": 13640, "train_runtime": 175109.2489, "train_tokens_per_second": 4670.258 }, { "epoch": 1.7404336734693877, "grad_norm": 0.6272228440769623, "learning_rate": 4.102725473636571e-07, "loss": 0.25208315849304197, "num_input_tokens_seen": 818110408, "step": 13645, "train_runtime": 175173.8421, "train_tokens_per_second": 4670.277 }, { "epoch": 1.7410714285714286, "grad_norm": 0.6756531091745722, "learning_rate": 4.0828778069151363e-07, "loss": 0.24423251152038575, "num_input_tokens_seen": 818422504, "step": 13650, "train_runtime": 175231.7334, "train_tokens_per_second": 4670.515 }, { "epoch": 1.7417091836734695, "grad_norm": 0.7468077834189175, "learning_rate": 4.063076221232676e-07, "loss": 0.25256857872009275, "num_input_tokens_seen": 818719216, "step": 13655, "train_runtime": 175295.187, "train_tokens_per_second": 4670.517 }, { "epoch": 1.7423469387755102, "grad_norm": 0.6249208640493598, "learning_rate": 4.043320736461448e-07, "loss": 0.25737662315368653, "num_input_tokens_seen": 819022224, "step": 13660, "train_runtime": 175365.3005, "train_tokens_per_second": 4670.378 }, { "epoch": 1.742984693877551, "grad_norm": 0.6040912449091471, "learning_rate": 4.0236113724274716e-07, "loss": 0.24058666229248046, "num_input_tokens_seen": 819315192, "step": 13665, "train_runtime": 175434.7397, "train_tokens_per_second": 4670.199 }, { "epoch": 1.743622448979592, "grad_norm": 0.7164460139205696, "learning_rate": 4.0039481489104636e-07, "loss": 0.2532172203063965, "num_input_tokens_seen": 819627288, "step": 13670, "train_runtime": 175494.5877, "train_tokens_per_second": 4670.385 }, { "epoch": 1.7442602040816326, "grad_norm": 0.7226232309413686, "learning_rate": 3.98433108564385e-07, "loss": 0.2506558418273926, "num_input_tokens_seen": 819937352, "step": 13675, "train_runtime": 175555.4148, "train_tokens_per_second": 4670.533 }, { "epoch": 1.7448979591836735, "grad_norm": 0.7186342580135948, "learning_rate": 3.964760202314716e-07, "loss": 0.256072473526001, "num_input_tokens_seen": 820240232, "step": 13680, "train_runtime": 175632.523, "train_tokens_per_second": 4670.207 }, { "epoch": 1.7455357142857144, "grad_norm": 0.6704285693346819, "learning_rate": 3.9452355185638226e-07, "loss": 0.25684480667114257, "num_input_tokens_seen": 820547016, "step": 13685, "train_runtime": 175699.6846, "train_tokens_per_second": 4670.168 }, { "epoch": 1.746173469387755, "grad_norm": 0.6074480140719041, "learning_rate": 3.9257570539855237e-07, "loss": 0.23230316638946533, "num_input_tokens_seen": 820846064, "step": 13690, "train_runtime": 175772.8875, "train_tokens_per_second": 4669.924 }, { "epoch": 1.7468112244897958, "grad_norm": 0.6260795731147497, "learning_rate": 3.9063248281278555e-07, "loss": 0.2343238115310669, "num_input_tokens_seen": 821136984, "step": 13695, "train_runtime": 175842.1621, "train_tokens_per_second": 4669.739 }, { "epoch": 1.7474489795918369, "grad_norm": 0.6832923954708081, "learning_rate": 3.8869388604924007e-07, "loss": 0.2325591564178467, "num_input_tokens_seen": 821444248, "step": 13700, "train_runtime": 175904.4337, "train_tokens_per_second": 4669.833 }, { "epoch": 1.7480867346938775, "grad_norm": 0.6382970626342359, "learning_rate": 3.8675991705343197e-07, "loss": 0.24201679229736328, "num_input_tokens_seen": 821748976, "step": 13705, "train_runtime": 175969.7855, "train_tokens_per_second": 4669.83 }, { "epoch": 1.7487244897959182, "grad_norm": 0.587902063077867, "learning_rate": 3.848305777662342e-07, "loss": 0.2240581512451172, "num_input_tokens_seen": 822049696, "step": 13710, "train_runtime": 176041.5452, "train_tokens_per_second": 4669.635 }, { "epoch": 1.7493622448979593, "grad_norm": 0.6280674600029451, "learning_rate": 3.829058701238764e-07, "loss": 0.23671512603759765, "num_input_tokens_seen": 822348152, "step": 13715, "train_runtime": 176103.2596, "train_tokens_per_second": 4669.693 }, { "epoch": 1.75, "grad_norm": 0.690888298586804, "learning_rate": 3.8098579605793385e-07, "loss": 0.22222754955291749, "num_input_tokens_seen": 822648608, "step": 13720, "train_runtime": 176160.0031, "train_tokens_per_second": 4669.894 }, { "epoch": 1.7506377551020407, "grad_norm": 0.5888112153098812, "learning_rate": 3.790703574953353e-07, "loss": 0.21944701671600342, "num_input_tokens_seen": 822950904, "step": 13725, "train_runtime": 176223.4126, "train_tokens_per_second": 4669.929 }, { "epoch": 1.7512755102040818, "grad_norm": 0.6151321877697761, "learning_rate": 3.771595563583602e-07, "loss": 0.23566222190856934, "num_input_tokens_seen": 823259904, "step": 13730, "train_runtime": 176288.164, "train_tokens_per_second": 4669.967 }, { "epoch": 1.7519132653061225, "grad_norm": 0.6655558670013475, "learning_rate": 3.752533945646275e-07, "loss": 0.25287594795227053, "num_input_tokens_seen": 823565512, "step": 13735, "train_runtime": 176358.7721, "train_tokens_per_second": 4669.83 }, { "epoch": 1.7525510204081631, "grad_norm": 0.6508335845939857, "learning_rate": 3.733518740271047e-07, "loss": 0.2242781400680542, "num_input_tokens_seen": 823859624, "step": 13740, "train_runtime": 176428.4289, "train_tokens_per_second": 4669.653 }, { "epoch": 1.7531887755102042, "grad_norm": 0.6079860747794961, "learning_rate": 3.7145499665410147e-07, "loss": 0.23161578178405762, "num_input_tokens_seen": 824173752, "step": 13745, "train_runtime": 176495.3122, "train_tokens_per_second": 4669.664 }, { "epoch": 1.753826530612245, "grad_norm": 0.6504089562154073, "learning_rate": 3.695627643492655e-07, "loss": 0.24319536685943605, "num_input_tokens_seen": 824475376, "step": 13750, "train_runtime": 176557.0608, "train_tokens_per_second": 4669.739 }, { "epoch": 1.7544642857142856, "grad_norm": 0.6482203781267267, "learning_rate": 3.6767517901158455e-07, "loss": 0.23995392322540282, "num_input_tokens_seen": 824767584, "step": 13755, "train_runtime": 176626.9062, "train_tokens_per_second": 4669.547 }, { "epoch": 1.7551020408163265, "grad_norm": 0.6017165332799732, "learning_rate": 3.6579224253538213e-07, "loss": 0.2299355983734131, "num_input_tokens_seen": 825079160, "step": 13760, "train_runtime": 176691.7999, "train_tokens_per_second": 4669.595 }, { "epoch": 1.7557397959183674, "grad_norm": 0.5771062782445211, "learning_rate": 3.639139568103173e-07, "loss": 0.2594435453414917, "num_input_tokens_seen": 825395496, "step": 13765, "train_runtime": 176754.7416, "train_tokens_per_second": 4669.722 }, { "epoch": 1.756377551020408, "grad_norm": 0.6260698337351052, "learning_rate": 3.620403237213799e-07, "loss": 0.22344212532043456, "num_input_tokens_seen": 825696584, "step": 13770, "train_runtime": 176816.8389, "train_tokens_per_second": 4669.785 }, { "epoch": 1.757015306122449, "grad_norm": 0.8303140631169927, "learning_rate": 3.6017134514889196e-07, "loss": 0.22419793605804444, "num_input_tokens_seen": 825994344, "step": 13775, "train_runtime": 176876.8366, "train_tokens_per_second": 4669.884 }, { "epoch": 1.7576530612244898, "grad_norm": 0.6002592186980982, "learning_rate": 3.583070229685043e-07, "loss": 0.24105172157287597, "num_input_tokens_seen": 826291616, "step": 13780, "train_runtime": 176950.403, "train_tokens_per_second": 4669.623 }, { "epoch": 1.7582908163265305, "grad_norm": 0.615381677018483, "learning_rate": 3.564473590511941e-07, "loss": 0.2350989818572998, "num_input_tokens_seen": 826588040, "step": 13785, "train_runtime": 177000.2875, "train_tokens_per_second": 4669.981 }, { "epoch": 1.7589285714285714, "grad_norm": 0.6272890183125568, "learning_rate": 3.5459235526326464e-07, "loss": 0.21449654102325438, "num_input_tokens_seen": 826881872, "step": 13790, "train_runtime": 177063.6363, "train_tokens_per_second": 4669.97 }, { "epoch": 1.7595663265306123, "grad_norm": 0.5824579104221645, "learning_rate": 3.527420134663401e-07, "loss": 0.23701989650726318, "num_input_tokens_seen": 827181464, "step": 13795, "train_runtime": 177124.007, "train_tokens_per_second": 4670.07 }, { "epoch": 1.760204081632653, "grad_norm": 0.653381271184272, "learning_rate": 3.5089633551736946e-07, "loss": 0.24289774894714355, "num_input_tokens_seen": 827479144, "step": 13800, "train_runtime": 177177.2529, "train_tokens_per_second": 4670.346 }, { "epoch": 1.7608418367346939, "grad_norm": 0.6148624342498099, "learning_rate": 3.4905532326861946e-07, "loss": 0.23552067279815675, "num_input_tokens_seen": 827784936, "step": 13805, "train_runtime": 177233.5487, "train_tokens_per_second": 4670.588 }, { "epoch": 1.7614795918367347, "grad_norm": 0.5299110104184739, "learning_rate": 3.4721897856767275e-07, "loss": 0.21198663711547852, "num_input_tokens_seen": 828096552, "step": 13810, "train_runtime": 177287.588, "train_tokens_per_second": 4670.922 }, { "epoch": 1.7621173469387754, "grad_norm": 0.6683036540754396, "learning_rate": 3.4538730325743174e-07, "loss": 0.2555697917938232, "num_input_tokens_seen": 828385320, "step": 13815, "train_runtime": 177353.237, "train_tokens_per_second": 4670.822 }, { "epoch": 1.7627551020408163, "grad_norm": 0.685457457591933, "learning_rate": 3.4356029917610833e-07, "loss": 0.23040683269500734, "num_input_tokens_seen": 828679568, "step": 13820, "train_runtime": 177427.6049, "train_tokens_per_second": 4670.522 }, { "epoch": 1.7633928571428572, "grad_norm": 0.6940270902195277, "learning_rate": 3.417379681572297e-07, "loss": 0.25145397186279295, "num_input_tokens_seen": 828985408, "step": 13825, "train_runtime": 177501.0429, "train_tokens_per_second": 4670.313 }, { "epoch": 1.7640306122448979, "grad_norm": 0.7088989504768888, "learning_rate": 3.3992031202963293e-07, "loss": 0.23242881298065185, "num_input_tokens_seen": 829281192, "step": 13830, "train_runtime": 177561.6522, "train_tokens_per_second": 4670.385 }, { "epoch": 1.7646683673469388, "grad_norm": 0.6179773270375348, "learning_rate": 3.3810733261746167e-07, "loss": 0.2483144760131836, "num_input_tokens_seen": 829588008, "step": 13835, "train_runtime": 177620.6994, "train_tokens_per_second": 4670.559 }, { "epoch": 1.7653061224489797, "grad_norm": 0.6353823748269662, "learning_rate": 3.362990317401688e-07, "loss": 0.23761091232299805, "num_input_tokens_seen": 829874728, "step": 13840, "train_runtime": 177686.5023, "train_tokens_per_second": 4670.443 }, { "epoch": 1.7659438775510203, "grad_norm": 0.6134309097723778, "learning_rate": 3.344954112125087e-07, "loss": 0.24033880233764648, "num_input_tokens_seen": 830169128, "step": 13845, "train_runtime": 177760.5155, "train_tokens_per_second": 4670.155 }, { "epoch": 1.7665816326530612, "grad_norm": 0.6842351383304307, "learning_rate": 3.3269647284454253e-07, "loss": 0.23505787849426268, "num_input_tokens_seen": 830469976, "step": 13850, "train_runtime": 177832.828, "train_tokens_per_second": 4669.948 }, { "epoch": 1.7672193877551021, "grad_norm": 0.6362356413450317, "learning_rate": 3.309022184416288e-07, "loss": 0.2307974576950073, "num_input_tokens_seen": 830765392, "step": 13855, "train_runtime": 177886.9152, "train_tokens_per_second": 4670.188 }, { "epoch": 1.7678571428571428, "grad_norm": 0.7063557852619481, "learning_rate": 3.2911264980442834e-07, "loss": 0.24306538105010986, "num_input_tokens_seen": 831071568, "step": 13860, "train_runtime": 177949.932, "train_tokens_per_second": 4670.255 }, { "epoch": 1.7684948979591837, "grad_norm": 0.661390891296154, "learning_rate": 3.273277687288978e-07, "loss": 0.23237895965576172, "num_input_tokens_seen": 831369760, "step": 13865, "train_runtime": 178016.5951, "train_tokens_per_second": 4670.181 }, { "epoch": 1.7691326530612246, "grad_norm": 0.6898088178147898, "learning_rate": 3.255475770062899e-07, "loss": 0.26753573417663573, "num_input_tokens_seen": 831662672, "step": 13870, "train_runtime": 178085.7383, "train_tokens_per_second": 4670.013 }, { "epoch": 1.7697704081632653, "grad_norm": 0.6394911350645628, "learning_rate": 3.237720764231517e-07, "loss": 0.2302546501159668, "num_input_tokens_seen": 831963664, "step": 13875, "train_runtime": 178144.9731, "train_tokens_per_second": 4670.15 }, { "epoch": 1.7704081632653061, "grad_norm": 0.6939548195274975, "learning_rate": 3.220012687613222e-07, "loss": 0.25703885555267336, "num_input_tokens_seen": 832276272, "step": 13880, "train_runtime": 178205.6694, "train_tokens_per_second": 4670.313 }, { "epoch": 1.771045918367347, "grad_norm": 0.5628021167165467, "learning_rate": 3.2023515579793e-07, "loss": 0.24952988624572753, "num_input_tokens_seen": 832580640, "step": 13885, "train_runtime": 178260.5732, "train_tokens_per_second": 4670.582 }, { "epoch": 1.7716836734693877, "grad_norm": 0.8021529602282467, "learning_rate": 3.1847373930539326e-07, "loss": 0.2512929677963257, "num_input_tokens_seen": 832880288, "step": 13890, "train_runtime": 178326.1198, "train_tokens_per_second": 4670.546 }, { "epoch": 1.7723214285714286, "grad_norm": 0.7091388799731951, "learning_rate": 3.167170210514153e-07, "loss": 0.237908935546875, "num_input_tokens_seen": 833177360, "step": 13895, "train_runtime": 178381.3188, "train_tokens_per_second": 4670.766 }, { "epoch": 1.7729591836734695, "grad_norm": 0.6933618943436181, "learning_rate": 3.14965002798987e-07, "loss": 0.25426063537597654, "num_input_tokens_seen": 833481240, "step": 13900, "train_runtime": 178448.9426, "train_tokens_per_second": 4670.699 }, { "epoch": 1.7735969387755102, "grad_norm": 0.6825957096513657, "learning_rate": 3.1321768630638073e-07, "loss": 0.24481732845306398, "num_input_tokens_seen": 833789864, "step": 13905, "train_runtime": 178518.8869, "train_tokens_per_second": 4670.597 }, { "epoch": 1.774234693877551, "grad_norm": 0.7054173966164635, "learning_rate": 3.1147507332715044e-07, "loss": 0.2531277656555176, "num_input_tokens_seen": 834104624, "step": 13910, "train_runtime": 178586.8554, "train_tokens_per_second": 4670.582 }, { "epoch": 1.774872448979592, "grad_norm": 0.6597772456241627, "learning_rate": 3.097371656101289e-07, "loss": 0.2587900638580322, "num_input_tokens_seen": 834408072, "step": 13915, "train_runtime": 178654.1547, "train_tokens_per_second": 4670.522 }, { "epoch": 1.7755102040816326, "grad_norm": 0.6327697397211675, "learning_rate": 3.080039648994304e-07, "loss": 0.2404341220855713, "num_input_tokens_seen": 834706232, "step": 13920, "train_runtime": 178729.9973, "train_tokens_per_second": 4670.208 }, { "epoch": 1.7761479591836735, "grad_norm": 0.7293595138469602, "learning_rate": 3.062754729344408e-07, "loss": 0.25003910064697266, "num_input_tokens_seen": 835009240, "step": 13925, "train_runtime": 178791.3031, "train_tokens_per_second": 4670.301 }, { "epoch": 1.7767857142857144, "grad_norm": 0.6663773758034158, "learning_rate": 3.0455169144982257e-07, "loss": 0.24301655292510987, "num_input_tokens_seen": 835304568, "step": 13930, "train_runtime": 178858.2634, "train_tokens_per_second": 4670.204 }, { "epoch": 1.777423469387755, "grad_norm": 0.6164569733038848, "learning_rate": 3.028326221755118e-07, "loss": 0.23880252838134766, "num_input_tokens_seen": 835604696, "step": 13935, "train_runtime": 178913.5245, "train_tokens_per_second": 4670.439 }, { "epoch": 1.7780612244897958, "grad_norm": 0.6310932598969143, "learning_rate": 3.0111826683671407e-07, "loss": 0.25446553230285646, "num_input_tokens_seen": 835900296, "step": 13940, "train_runtime": 178984.3912, "train_tokens_per_second": 4670.241 }, { "epoch": 1.7786989795918369, "grad_norm": 0.6639849717106197, "learning_rate": 2.9940862715390483e-07, "loss": 0.24060540199279784, "num_input_tokens_seen": 836194792, "step": 13945, "train_runtime": 179051.944, "train_tokens_per_second": 4670.124 }, { "epoch": 1.7793367346938775, "grad_norm": 0.6559897532506478, "learning_rate": 2.9770370484282665e-07, "loss": 0.23808369636535645, "num_input_tokens_seen": 836496792, "step": 13950, "train_runtime": 179121.316, "train_tokens_per_second": 4670.001 }, { "epoch": 1.7799744897959182, "grad_norm": 0.6383602673957005, "learning_rate": 2.960035016144885e-07, "loss": 0.22525038719177246, "num_input_tokens_seen": 836782688, "step": 13955, "train_runtime": 179198.633, "train_tokens_per_second": 4669.582 }, { "epoch": 1.7806122448979593, "grad_norm": 0.7000522726804709, "learning_rate": 2.943080191751629e-07, "loss": 0.25488481521606443, "num_input_tokens_seen": 837094584, "step": 13960, "train_runtime": 179263.3355, "train_tokens_per_second": 4669.636 }, { "epoch": 1.78125, "grad_norm": 0.6994596296350564, "learning_rate": 2.9261725922638485e-07, "loss": 0.2449193477630615, "num_input_tokens_seen": 837392928, "step": 13965, "train_runtime": 179328.2157, "train_tokens_per_second": 4669.611 }, { "epoch": 1.7818877551020407, "grad_norm": 0.6513016169940382, "learning_rate": 2.9093122346494974e-07, "loss": 0.25704920291900635, "num_input_tokens_seen": 837679544, "step": 13970, "train_runtime": 179384.5775, "train_tokens_per_second": 4669.741 }, { "epoch": 1.7825255102040818, "grad_norm": 0.6833897369640713, "learning_rate": 2.8924991358291354e-07, "loss": 0.24814114570617676, "num_input_tokens_seen": 837972976, "step": 13975, "train_runtime": 179459.6037, "train_tokens_per_second": 4669.424 }, { "epoch": 1.7831632653061225, "grad_norm": 0.6194541374721899, "learning_rate": 2.875733312675855e-07, "loss": 0.23839044570922852, "num_input_tokens_seen": 838284000, "step": 13980, "train_runtime": 179531.3583, "train_tokens_per_second": 4669.29 }, { "epoch": 1.7838010204081631, "grad_norm": 0.6398052840816332, "learning_rate": 2.8590147820153513e-07, "loss": 0.2350918769836426, "num_input_tokens_seen": 838588496, "step": 13985, "train_runtime": 179586.2281, "train_tokens_per_second": 4669.559 }, { "epoch": 1.7844387755102042, "grad_norm": 0.6096802222597947, "learning_rate": 2.8423435606258485e-07, "loss": 0.24754149913787843, "num_input_tokens_seen": 838896680, "step": 13990, "train_runtime": 179654.0069, "train_tokens_per_second": 4669.513 }, { "epoch": 1.785076530612245, "grad_norm": 0.5870268496149098, "learning_rate": 2.8257196652380523e-07, "loss": 0.23757634162902833, "num_input_tokens_seen": 839199288, "step": 13995, "train_runtime": 179713.1109, "train_tokens_per_second": 4669.661 }, { "epoch": 1.7857142857142856, "grad_norm": 0.5922973135813985, "learning_rate": 2.809143112535212e-07, "loss": 0.20630648136138915, "num_input_tokens_seen": 839485064, "step": 14000, "train_runtime": 179784.4954, "train_tokens_per_second": 4669.396 }, { "epoch": 1.7863520408163265, "grad_norm": 0.6555882493386753, "learning_rate": 2.7926139191530697e-07, "loss": 0.23436861038208007, "num_input_tokens_seen": 839784112, "step": 14005, "train_runtime": 179852.9178, "train_tokens_per_second": 4669.283 }, { "epoch": 1.7869897959183674, "grad_norm": 0.7213819487431138, "learning_rate": 2.7761321016798183e-07, "loss": 0.2294372797012329, "num_input_tokens_seen": 840085248, "step": 14010, "train_runtime": 179919.0506, "train_tokens_per_second": 4669.24 }, { "epoch": 1.787627551020408, "grad_norm": 0.5780708327960133, "learning_rate": 2.7596976766560977e-07, "loss": 0.23864274024963378, "num_input_tokens_seen": 840389216, "step": 14015, "train_runtime": 179981.9428, "train_tokens_per_second": 4669.297 }, { "epoch": 1.788265306122449, "grad_norm": 0.6267420865230794, "learning_rate": 2.743310660575027e-07, "loss": 0.2206709861755371, "num_input_tokens_seen": 840684392, "step": 14020, "train_runtime": 180057.9611, "train_tokens_per_second": 4668.965 }, { "epoch": 1.7889030612244898, "grad_norm": 0.6955593023546806, "learning_rate": 2.726971069882101e-07, "loss": 0.23168370723724366, "num_input_tokens_seen": 840974992, "step": 14025, "train_runtime": 180132.6187, "train_tokens_per_second": 4668.644 }, { "epoch": 1.7895408163265305, "grad_norm": 0.5605018184777858, "learning_rate": 2.7106789209752513e-07, "loss": 0.224169921875, "num_input_tokens_seen": 841289592, "step": 14030, "train_runtime": 180180.4933, "train_tokens_per_second": 4669.149 }, { "epoch": 1.7901785714285714, "grad_norm": 0.6648559866948053, "learning_rate": 2.6944342302047785e-07, "loss": 0.2617345809936523, "num_input_tokens_seen": 841593808, "step": 14035, "train_runtime": 180239.2903, "train_tokens_per_second": 4669.314 }, { "epoch": 1.7908163265306123, "grad_norm": 0.6231065297804759, "learning_rate": 2.678237013873375e-07, "loss": 0.25885226726531985, "num_input_tokens_seen": 841895528, "step": 14040, "train_runtime": 180306.8164, "train_tokens_per_second": 4669.238 }, { "epoch": 1.791454081632653, "grad_norm": 0.6317211141544594, "learning_rate": 2.66208728823607e-07, "loss": 0.22434628009796143, "num_input_tokens_seen": 842191312, "step": 14045, "train_runtime": 180377.3203, "train_tokens_per_second": 4669.053 }, { "epoch": 1.7920918367346939, "grad_norm": 0.6571417556533412, "learning_rate": 2.6459850695002454e-07, "loss": 0.24795680046081542, "num_input_tokens_seen": 842496784, "step": 14050, "train_runtime": 180431.2072, "train_tokens_per_second": 4669.352 }, { "epoch": 1.7927295918367347, "grad_norm": 0.6598004061013982, "learning_rate": 2.629930373825595e-07, "loss": 0.22257847785949708, "num_input_tokens_seen": 842798288, "step": 14055, "train_runtime": 180488.3174, "train_tokens_per_second": 4669.545 }, { "epoch": 1.7933673469387754, "grad_norm": 0.6637345292647696, "learning_rate": 2.6139232173241434e-07, "loss": 0.2368372917175293, "num_input_tokens_seen": 843094680, "step": 14060, "train_runtime": 180550.121, "train_tokens_per_second": 4669.588 }, { "epoch": 1.7940051020408163, "grad_norm": 0.7038406559286605, "learning_rate": 2.5979636160601673e-07, "loss": 0.24609622955322266, "num_input_tokens_seen": 843407144, "step": 14065, "train_runtime": 180614.613, "train_tokens_per_second": 4669.651 }, { "epoch": 1.7946428571428572, "grad_norm": 0.6291640765271659, "learning_rate": 2.5820515860502604e-07, "loss": 0.2567103862762451, "num_input_tokens_seen": 843714272, "step": 14070, "train_runtime": 180676.5227, "train_tokens_per_second": 4669.75 }, { "epoch": 1.7952806122448979, "grad_norm": 0.6097260626734088, "learning_rate": 2.5661871432632545e-07, "loss": 0.2330172300338745, "num_input_tokens_seen": 844010616, "step": 14075, "train_runtime": 180740.3, "train_tokens_per_second": 4669.742 }, { "epoch": 1.7959183673469388, "grad_norm": 0.6801791912877365, "learning_rate": 2.550370303620214e-07, "loss": 0.2431706428527832, "num_input_tokens_seen": 844313000, "step": 14080, "train_runtime": 180805.2674, "train_tokens_per_second": 4669.737 }, { "epoch": 1.7965561224489797, "grad_norm": 0.5757820793193561, "learning_rate": 2.534601082994437e-07, "loss": 0.232086181640625, "num_input_tokens_seen": 844609600, "step": 14085, "train_runtime": 180881.9251, "train_tokens_per_second": 4669.397 }, { "epoch": 1.7971938775510203, "grad_norm": 0.6941251008293757, "learning_rate": 2.5188794972114684e-07, "loss": 0.24894967079162597, "num_input_tokens_seen": 844903104, "step": 14090, "train_runtime": 180941.835, "train_tokens_per_second": 4669.474 }, { "epoch": 1.7978316326530612, "grad_norm": 0.6892429730086918, "learning_rate": 2.503205562048994e-07, "loss": 0.23433713912963866, "num_input_tokens_seen": 845203632, "step": 14095, "train_runtime": 181000.9271, "train_tokens_per_second": 4669.609 }, { "epoch": 1.7984693877551021, "grad_norm": 0.648582833181612, "learning_rate": 2.487579293236897e-07, "loss": 0.24241786003112792, "num_input_tokens_seen": 845505776, "step": 14100, "train_runtime": 181065.5296, "train_tokens_per_second": 4669.612 }, { "epoch": 1.7991071428571428, "grad_norm": 0.6444873623587022, "learning_rate": 2.4720007064572506e-07, "loss": 0.24049158096313478, "num_input_tokens_seen": 845817520, "step": 14105, "train_runtime": 181136.9664, "train_tokens_per_second": 4669.491 }, { "epoch": 1.7997448979591837, "grad_norm": 0.6593792460663095, "learning_rate": 2.456469817344237e-07, "loss": 0.22638745307922364, "num_input_tokens_seen": 846138344, "step": 14110, "train_runtime": 181194.4118, "train_tokens_per_second": 4669.782 }, { "epoch": 1.8003826530612246, "grad_norm": 0.6286204175192706, "learning_rate": 2.4409866414841996e-07, "loss": 0.23471994400024415, "num_input_tokens_seen": 846438264, "step": 14115, "train_runtime": 181252.4813, "train_tokens_per_second": 4669.94 }, { "epoch": 1.8010204081632653, "grad_norm": 0.6523694187565792, "learning_rate": 2.4255511944155764e-07, "loss": 0.22545332908630372, "num_input_tokens_seen": 846733264, "step": 14120, "train_runtime": 181312.7442, "train_tokens_per_second": 4670.015 }, { "epoch": 1.8016581632653061, "grad_norm": 0.6733252335596946, "learning_rate": 2.410163491628925e-07, "loss": 0.21708171367645263, "num_input_tokens_seen": 847020656, "step": 14125, "train_runtime": 181377.9261, "train_tokens_per_second": 4669.921 }, { "epoch": 1.802295918367347, "grad_norm": 0.6641541846371164, "learning_rate": 2.394823548566877e-07, "loss": 0.25301213264465333, "num_input_tokens_seen": 847318328, "step": 14130, "train_runtime": 181443.0402, "train_tokens_per_second": 4669.886 }, { "epoch": 1.8029336734693877, "grad_norm": 0.6195771371319925, "learning_rate": 2.3795313806241337e-07, "loss": 0.2453226327896118, "num_input_tokens_seen": 847630544, "step": 14135, "train_runtime": 181501.4745, "train_tokens_per_second": 4670.103 }, { "epoch": 1.8035714285714286, "grad_norm": 0.5990228308868839, "learning_rate": 2.364287003147453e-07, "loss": 0.2190986156463623, "num_input_tokens_seen": 847944464, "step": 14140, "train_runtime": 181566.3767, "train_tokens_per_second": 4670.162 }, { "epoch": 1.8042091836734695, "grad_norm": 0.6912023506330887, "learning_rate": 2.3490904314356412e-07, "loss": 0.23070981502532958, "num_input_tokens_seen": 848223480, "step": 14145, "train_runtime": 181635.1823, "train_tokens_per_second": 4669.929 }, { "epoch": 1.8048469387755102, "grad_norm": 0.6258088067594457, "learning_rate": 2.3339416807395154e-07, "loss": 0.23261451721191406, "num_input_tokens_seen": 848527256, "step": 14150, "train_runtime": 181700.8442, "train_tokens_per_second": 4669.914 }, { "epoch": 1.805484693877551, "grad_norm": 0.6717797485189194, "learning_rate": 2.3188407662618983e-07, "loss": 0.23456430435180664, "num_input_tokens_seen": 848813024, "step": 14155, "train_runtime": 181766.3603, "train_tokens_per_second": 4669.803 }, { "epoch": 1.806122448979592, "grad_norm": 0.5587247419594303, "learning_rate": 2.3037877031576172e-07, "loss": 0.2323758602142334, "num_input_tokens_seen": 849121992, "step": 14160, "train_runtime": 181827.2831, "train_tokens_per_second": 4669.937 }, { "epoch": 1.8067602040816326, "grad_norm": 0.6967048187927307, "learning_rate": 2.2887825065334822e-07, "loss": 0.22853446006774902, "num_input_tokens_seen": 849428488, "step": 14165, "train_runtime": 181903.0928, "train_tokens_per_second": 4669.676 }, { "epoch": 1.8073979591836735, "grad_norm": 0.7265755754020878, "learning_rate": 2.2738251914482312e-07, "loss": 0.24710376262664796, "num_input_tokens_seen": 849726160, "step": 14170, "train_runtime": 181962.3829, "train_tokens_per_second": 4669.79 }, { "epoch": 1.8080357142857144, "grad_norm": 0.6767356092577087, "learning_rate": 2.258915772912601e-07, "loss": 0.24435906410217284, "num_input_tokens_seen": 850034112, "step": 14175, "train_runtime": 182033.5849, "train_tokens_per_second": 4669.655 }, { "epoch": 1.808673469387755, "grad_norm": 0.6072056036925845, "learning_rate": 2.2440542658892172e-07, "loss": 0.21573228836059571, "num_input_tokens_seen": 850345832, "step": 14180, "train_runtime": 182096.2068, "train_tokens_per_second": 4669.761 }, { "epoch": 1.8093112244897958, "grad_norm": 0.6051100953629287, "learning_rate": 2.2292406852926385e-07, "loss": 0.2449204444885254, "num_input_tokens_seen": 850645112, "step": 14185, "train_runtime": 182165.1754, "train_tokens_per_second": 4669.636 }, { "epoch": 1.8099489795918369, "grad_norm": 0.6962048069554118, "learning_rate": 2.214475045989345e-07, "loss": 0.2336430549621582, "num_input_tokens_seen": 850940792, "step": 14190, "train_runtime": 182240.0839, "train_tokens_per_second": 4669.339 }, { "epoch": 1.8105867346938775, "grad_norm": 0.7062951774689636, "learning_rate": 2.199757362797672e-07, "loss": 0.23945298194885253, "num_input_tokens_seen": 851231432, "step": 14195, "train_runtime": 182307.0608, "train_tokens_per_second": 4669.218 }, { "epoch": 1.8112244897959182, "grad_norm": 1.188855147983575, "learning_rate": 2.1850876504878492e-07, "loss": 0.2236766815185547, "num_input_tokens_seen": 851529712, "step": 14200, "train_runtime": 182376.9165, "train_tokens_per_second": 4669.065 }, { "epoch": 1.8118622448979593, "grad_norm": 0.6549158659499354, "learning_rate": 2.1704659237819558e-07, "loss": 0.2454591989517212, "num_input_tokens_seen": 851836424, "step": 14205, "train_runtime": 182436.9974, "train_tokens_per_second": 4669.209 }, { "epoch": 1.8125, "grad_norm": 0.6312331275412635, "learning_rate": 2.1558921973539092e-07, "loss": 0.21552486419677735, "num_input_tokens_seen": 852146744, "step": 14210, "train_runtime": 182511.4477, "train_tokens_per_second": 4669.004 }, { "epoch": 1.8131377551020407, "grad_norm": 0.6914111406413982, "learning_rate": 2.1413664858294713e-07, "loss": 0.2277005672454834, "num_input_tokens_seen": 852446456, "step": 14215, "train_runtime": 182579.4807, "train_tokens_per_second": 4668.906 }, { "epoch": 1.8137755102040818, "grad_norm": 0.623038086963682, "learning_rate": 2.126888803786209e-07, "loss": 0.23006982803344728, "num_input_tokens_seen": 852750528, "step": 14220, "train_runtime": 182641.2875, "train_tokens_per_second": 4668.991 }, { "epoch": 1.8144132653061225, "grad_norm": 0.6592848128998998, "learning_rate": 2.1124591657534776e-07, "loss": 0.21732797622680664, "num_input_tokens_seen": 853055240, "step": 14225, "train_runtime": 182707.4555, "train_tokens_per_second": 4668.968 }, { "epoch": 1.8150510204081631, "grad_norm": 0.5890391713015771, "learning_rate": 2.0980775862124326e-07, "loss": 0.2323162078857422, "num_input_tokens_seen": 853354320, "step": 14230, "train_runtime": 182782.2905, "train_tokens_per_second": 4668.693 }, { "epoch": 1.8156887755102042, "grad_norm": 0.6794000925800131, "learning_rate": 2.083744079595995e-07, "loss": 0.24140748977661133, "num_input_tokens_seen": 853663264, "step": 14235, "train_runtime": 182840.7922, "train_tokens_per_second": 4668.888 }, { "epoch": 1.816326530612245, "grad_norm": 0.6828682761767146, "learning_rate": 2.069458660288831e-07, "loss": 0.25820174217224123, "num_input_tokens_seen": 853957832, "step": 14240, "train_runtime": 182902.7662, "train_tokens_per_second": 4668.917 }, { "epoch": 1.8169642857142856, "grad_norm": 0.7150242243767747, "learning_rate": 2.0552213426273725e-07, "loss": 0.24172863960266114, "num_input_tokens_seen": 854261976, "step": 14245, "train_runtime": 182967.128, "train_tokens_per_second": 4668.937 }, { "epoch": 1.8176020408163265, "grad_norm": 0.7799388527982327, "learning_rate": 2.0410321408997459e-07, "loss": 0.2411952495574951, "num_input_tokens_seen": 854546712, "step": 14250, "train_runtime": 183036.3514, "train_tokens_per_second": 4668.727 }, { "epoch": 1.8182397959183674, "grad_norm": 0.6984524340201993, "learning_rate": 2.0268910693458154e-07, "loss": 0.24857621192932128, "num_input_tokens_seen": 854856912, "step": 14255, "train_runtime": 183090.5655, "train_tokens_per_second": 4669.039 }, { "epoch": 1.818877551020408, "grad_norm": 0.691502977060723, "learning_rate": 2.0127981421571295e-07, "loss": 0.23807902336120607, "num_input_tokens_seen": 855144504, "step": 14260, "train_runtime": 183158.5715, "train_tokens_per_second": 4668.875 }, { "epoch": 1.819515306122449, "grad_norm": 0.6683762091739054, "learning_rate": 1.998753373476936e-07, "loss": 0.2344792127609253, "num_input_tokens_seen": 855445152, "step": 14265, "train_runtime": 183218.1859, "train_tokens_per_second": 4668.997 }, { "epoch": 1.8201530612244898, "grad_norm": 0.6764785598399716, "learning_rate": 1.9847567774001153e-07, "loss": 0.24037613868713378, "num_input_tokens_seen": 855746640, "step": 14270, "train_runtime": 183285.9301, "train_tokens_per_second": 4668.916 }, { "epoch": 1.8207908163265305, "grad_norm": 0.68295919677254, "learning_rate": 1.9708083679732538e-07, "loss": 0.23158681392669678, "num_input_tokens_seen": 856050944, "step": 14275, "train_runtime": 183346.0516, "train_tokens_per_second": 4669.045 }, { "epoch": 1.8214285714285714, "grad_norm": 0.6269726263893487, "learning_rate": 1.9569081591945537e-07, "loss": 0.21793708801269532, "num_input_tokens_seen": 856361888, "step": 14280, "train_runtime": 183409.0954, "train_tokens_per_second": 4669.135 }, { "epoch": 1.8220663265306123, "grad_norm": 0.6775442090980904, "learning_rate": 1.9430561650138292e-07, "loss": 0.23641440868377686, "num_input_tokens_seen": 856656952, "step": 14285, "train_runtime": 183471.7968, "train_tokens_per_second": 4669.148 }, { "epoch": 1.822704081632653, "grad_norm": 0.694221107240311, "learning_rate": 1.9292523993325318e-07, "loss": 0.25249128341674804, "num_input_tokens_seen": 856967800, "step": 14290, "train_runtime": 183548.6432, "train_tokens_per_second": 4668.887 }, { "epoch": 1.8233418367346939, "grad_norm": 0.6539747262144159, "learning_rate": 1.9154968760037142e-07, "loss": 0.24744951725006104, "num_input_tokens_seen": 857270128, "step": 14295, "train_runtime": 183608.628, "train_tokens_per_second": 4669.008 }, { "epoch": 1.8239795918367347, "grad_norm": 0.6400158968152201, "learning_rate": 1.9017896088319888e-07, "loss": 0.2374544620513916, "num_input_tokens_seen": 857576328, "step": 14300, "train_runtime": 183673.4765, "train_tokens_per_second": 4669.026 }, { "epoch": 1.8246173469387754, "grad_norm": 0.7063594863011754, "learning_rate": 1.8881306115735632e-07, "loss": 0.24543800354003906, "num_input_tokens_seen": 857864376, "step": 14305, "train_runtime": 183741.1776, "train_tokens_per_second": 4668.874 }, { "epoch": 1.8252551020408163, "grad_norm": 0.6335893908540836, "learning_rate": 1.8745198979361944e-07, "loss": 0.23575279712677003, "num_input_tokens_seen": 858166808, "step": 14310, "train_runtime": 183802.1091, "train_tokens_per_second": 4668.971 }, { "epoch": 1.8258928571428572, "grad_norm": 0.6032855222955488, "learning_rate": 1.8609574815791843e-07, "loss": 0.23586275577545165, "num_input_tokens_seen": 858466344, "step": 14315, "train_runtime": 183865.3456, "train_tokens_per_second": 4668.995 }, { "epoch": 1.8265306122448979, "grad_norm": 0.6065067315991968, "learning_rate": 1.8474433761133614e-07, "loss": 0.22159624099731445, "num_input_tokens_seen": 858751184, "step": 14320, "train_runtime": 183930.6342, "train_tokens_per_second": 4668.886 }, { "epoch": 1.8271683673469388, "grad_norm": 0.6386792360458959, "learning_rate": 1.833977595101083e-07, "loss": 0.25848994255065916, "num_input_tokens_seen": 859064664, "step": 14325, "train_runtime": 184005.4578, "train_tokens_per_second": 4668.691 }, { "epoch": 1.8278061224489797, "grad_norm": 0.7243826811963424, "learning_rate": 1.8205601520561945e-07, "loss": 0.2323843240737915, "num_input_tokens_seen": 859362472, "step": 14330, "train_runtime": 184060.8739, "train_tokens_per_second": 4668.904 }, { "epoch": 1.8284438775510203, "grad_norm": 0.7113576316394074, "learning_rate": 1.8071910604440356e-07, "loss": 0.2448119878768921, "num_input_tokens_seen": 859662920, "step": 14335, "train_runtime": 184136.5773, "train_tokens_per_second": 4668.616 }, { "epoch": 1.8290816326530612, "grad_norm": 0.5755378370316325, "learning_rate": 1.79387033368143e-07, "loss": 0.2230464220046997, "num_input_tokens_seen": 859961152, "step": 14340, "train_runtime": 184207.2545, "train_tokens_per_second": 4668.443 }, { "epoch": 1.8297193877551021, "grad_norm": 0.6114534758619493, "learning_rate": 1.7805979851366505e-07, "loss": 0.23956425189971925, "num_input_tokens_seen": 860261560, "step": 14345, "train_runtime": 184275.2068, "train_tokens_per_second": 4668.352 }, { "epoch": 1.8303571428571428, "grad_norm": 0.6469560822067821, "learning_rate": 1.7673740281294316e-07, "loss": 0.25022525787353517, "num_input_tokens_seen": 860558928, "step": 14350, "train_runtime": 184332.7459, "train_tokens_per_second": 4668.508 }, { "epoch": 1.8309948979591837, "grad_norm": 0.6437016015002156, "learning_rate": 1.7541984759309294e-07, "loss": 0.24035637378692626, "num_input_tokens_seen": 860855480, "step": 14355, "train_runtime": 184395.2999, "train_tokens_per_second": 4668.533 }, { "epoch": 1.8316326530612246, "grad_norm": 0.6600952592336741, "learning_rate": 1.7410713417637338e-07, "loss": 0.25348525047302245, "num_input_tokens_seen": 861151800, "step": 14360, "train_runtime": 184460.4383, "train_tokens_per_second": 4668.49 }, { "epoch": 1.8322704081632653, "grad_norm": 0.6087445950838055, "learning_rate": 1.7279926388018564e-07, "loss": 0.23996715545654296, "num_input_tokens_seen": 861455912, "step": 14365, "train_runtime": 184522.8519, "train_tokens_per_second": 4668.559 }, { "epoch": 1.8329081632653061, "grad_norm": 0.6504701631415639, "learning_rate": 1.714962380170665e-07, "loss": 0.23213858604431153, "num_input_tokens_seen": 861758272, "step": 14370, "train_runtime": 184581.0034, "train_tokens_per_second": 4668.727 }, { "epoch": 1.833545918367347, "grad_norm": 0.6261043429395752, "learning_rate": 1.701980578946938e-07, "loss": 0.24935603141784668, "num_input_tokens_seen": 862063536, "step": 14375, "train_runtime": 184657.0754, "train_tokens_per_second": 4668.457 }, { "epoch": 1.8341836734693877, "grad_norm": 0.6270297807543881, "learning_rate": 1.6890472481588426e-07, "loss": 0.23564741611480713, "num_input_tokens_seen": 862356432, "step": 14380, "train_runtime": 184726.1435, "train_tokens_per_second": 4668.297 }, { "epoch": 1.8348214285714286, "grad_norm": 0.6711032745179101, "learning_rate": 1.6761624007858524e-07, "loss": 0.2496790885925293, "num_input_tokens_seen": 862663984, "step": 14385, "train_runtime": 184788.2754, "train_tokens_per_second": 4668.391 }, { "epoch": 1.8354591836734695, "grad_norm": 0.641643337265233, "learning_rate": 1.6633260497588233e-07, "loss": 0.22472338676452636, "num_input_tokens_seen": 862959176, "step": 14390, "train_runtime": 184852.6304, "train_tokens_per_second": 4668.363 }, { "epoch": 1.8360969387755102, "grad_norm": 0.5647985821520639, "learning_rate": 1.6505382079599341e-07, "loss": 0.22203531265258789, "num_input_tokens_seen": 863267536, "step": 14395, "train_runtime": 184921.6317, "train_tokens_per_second": 4668.289 }, { "epoch": 1.836734693877551, "grad_norm": 0.6576296676798646, "learning_rate": 1.6377988882226691e-07, "loss": 0.2492135286331177, "num_input_tokens_seen": 863564488, "step": 14400, "train_runtime": 184993.3183, "train_tokens_per_second": 4668.085 }, { "epoch": 1.837372448979592, "grad_norm": 0.6642034714755283, "learning_rate": 1.6251081033318294e-07, "loss": 0.2369211196899414, "num_input_tokens_seen": 863853768, "step": 14405, "train_runtime": 185060.0842, "train_tokens_per_second": 4667.964 }, { "epoch": 1.8380102040816326, "grad_norm": 0.6598234979501645, "learning_rate": 1.6124658660234993e-07, "loss": 0.22833032608032228, "num_input_tokens_seen": 864159608, "step": 14410, "train_runtime": 185115.1498, "train_tokens_per_second": 4668.227 }, { "epoch": 1.8386479591836735, "grad_norm": 0.6709623601559725, "learning_rate": 1.5998721889850577e-07, "loss": 0.22344694137573243, "num_input_tokens_seen": 864464216, "step": 14415, "train_runtime": 185172.0534, "train_tokens_per_second": 4668.438 }, { "epoch": 1.8392857142857144, "grad_norm": 0.662379928517177, "learning_rate": 1.5873270848551227e-07, "loss": 0.23959665298461913, "num_input_tokens_seen": 864761688, "step": 14420, "train_runtime": 185241.837, "train_tokens_per_second": 4668.285 }, { "epoch": 1.839923469387755, "grad_norm": 0.6046807574839765, "learning_rate": 1.5748305662236008e-07, "loss": 0.23878827095031738, "num_input_tokens_seen": 865072656, "step": 14425, "train_runtime": 185301.7857, "train_tokens_per_second": 4668.453 }, { "epoch": 1.8405612244897958, "grad_norm": 0.5907992672075336, "learning_rate": 1.562382645631605e-07, "loss": 0.24034523963928223, "num_input_tokens_seen": 865366568, "step": 14430, "train_runtime": 185374.3333, "train_tokens_per_second": 4668.211 }, { "epoch": 1.8411989795918369, "grad_norm": 0.6488857955022216, "learning_rate": 1.549983335571509e-07, "loss": 0.24318280220031738, "num_input_tokens_seen": 865673504, "step": 14435, "train_runtime": 185436.3672, "train_tokens_per_second": 4668.305 }, { "epoch": 1.8418367346938775, "grad_norm": 0.6345954947782853, "learning_rate": 1.537632648486864e-07, "loss": 0.2233747959136963, "num_input_tokens_seen": 865966584, "step": 14440, "train_runtime": 185502.4597, "train_tokens_per_second": 4668.222 }, { "epoch": 1.8424744897959182, "grad_norm": 0.6093667539618414, "learning_rate": 1.5253305967724674e-07, "loss": 0.23251943588256835, "num_input_tokens_seen": 866262616, "step": 14445, "train_runtime": 185567.1899, "train_tokens_per_second": 4668.188 }, { "epoch": 1.8431122448979593, "grad_norm": 0.6576062354450807, "learning_rate": 1.513077192774287e-07, "loss": 0.2469010829925537, "num_input_tokens_seen": 866575568, "step": 14450, "train_runtime": 185620.909, "train_tokens_per_second": 4668.523 }, { "epoch": 1.84375, "grad_norm": 0.665884965746731, "learning_rate": 1.500872448789459e-07, "loss": 0.22332825660705566, "num_input_tokens_seen": 866884552, "step": 14455, "train_runtime": 185690.0122, "train_tokens_per_second": 4668.45 }, { "epoch": 1.8443877551020407, "grad_norm": 0.6526420329302832, "learning_rate": 1.4887163770662905e-07, "loss": 0.226957368850708, "num_input_tokens_seen": 867174168, "step": 14460, "train_runtime": 185753.506, "train_tokens_per_second": 4668.413 }, { "epoch": 1.8450255102040818, "grad_norm": 0.6001558081237469, "learning_rate": 1.4766089898042678e-07, "loss": 0.2408813238143921, "num_input_tokens_seen": 867469624, "step": 14465, "train_runtime": 185821.4483, "train_tokens_per_second": 4668.297 }, { "epoch": 1.8456632653061225, "grad_norm": 0.6956641287999953, "learning_rate": 1.4645502991539883e-07, "loss": 0.23400726318359374, "num_input_tokens_seen": 867765896, "step": 14470, "train_runtime": 185880.418, "train_tokens_per_second": 4668.409 }, { "epoch": 1.8463010204081631, "grad_norm": 0.6665358852671845, "learning_rate": 1.452540317217188e-07, "loss": 0.2394644021987915, "num_input_tokens_seen": 868071176, "step": 14475, "train_runtime": 185946.7671, "train_tokens_per_second": 4668.385 }, { "epoch": 1.8469387755102042, "grad_norm": 0.7054297858351227, "learning_rate": 1.440579056046737e-07, "loss": 0.2262880563735962, "num_input_tokens_seen": 868362264, "step": 14480, "train_runtime": 186010.9837, "train_tokens_per_second": 4668.339 }, { "epoch": 1.847576530612245, "grad_norm": 0.6808849931657256, "learning_rate": 1.428666527646577e-07, "loss": 0.23255569934844972, "num_input_tokens_seen": 868646368, "step": 14485, "train_runtime": 186068.3786, "train_tokens_per_second": 4668.426 }, { "epoch": 1.8482142857142856, "grad_norm": 0.7317704340164283, "learning_rate": 1.4168027439717735e-07, "loss": 0.2767033100128174, "num_input_tokens_seen": 868964096, "step": 14490, "train_runtime": 186121.5642, "train_tokens_per_second": 4668.799 }, { "epoch": 1.8488520408163265, "grad_norm": 0.892917228411661, "learning_rate": 1.4049877169284575e-07, "loss": 0.2565030574798584, "num_input_tokens_seen": 869264864, "step": 14495, "train_runtime": 186184.094, "train_tokens_per_second": 4668.846 }, { "epoch": 1.8494897959183674, "grad_norm": 0.5994045672594449, "learning_rate": 1.3932214583738334e-07, "loss": 0.2315276861190796, "num_input_tokens_seen": 869578544, "step": 14500, "train_runtime": 186243.2777, "train_tokens_per_second": 4669.047 }, { "epoch": 1.850127551020408, "grad_norm": 0.6367895708219833, "learning_rate": 1.3815039801161723e-07, "loss": 0.25290961265563966, "num_input_tokens_seen": 869874568, "step": 14505, "train_runtime": 186309.0778, "train_tokens_per_second": 4668.986 }, { "epoch": 1.850765306122449, "grad_norm": 0.637022963753881, "learning_rate": 1.369835293914773e-07, "loss": 0.2709094524383545, "num_input_tokens_seen": 870193664, "step": 14510, "train_runtime": 186368.8791, "train_tokens_per_second": 4669.201 }, { "epoch": 1.8514030612244898, "grad_norm": 0.6272452650829071, "learning_rate": 1.358215411479974e-07, "loss": 0.2437835454940796, "num_input_tokens_seen": 870507328, "step": 14515, "train_runtime": 186441.4503, "train_tokens_per_second": 4669.065 }, { "epoch": 1.8520408163265305, "grad_norm": 0.6047628176878721, "learning_rate": 1.3466443444731525e-07, "loss": 0.23250491619110109, "num_input_tokens_seen": 870806344, "step": 14520, "train_runtime": 186512.5533, "train_tokens_per_second": 4668.889 }, { "epoch": 1.8526785714285714, "grad_norm": 0.6340814502818172, "learning_rate": 1.3351221045066698e-07, "loss": 0.23869748115539552, "num_input_tokens_seen": 871111792, "step": 14525, "train_runtime": 186578.1182, "train_tokens_per_second": 4668.885 }, { "epoch": 1.8533163265306123, "grad_norm": 0.6143465477228329, "learning_rate": 1.3236487031439037e-07, "loss": 0.23951935768127441, "num_input_tokens_seen": 871406384, "step": 14530, "train_runtime": 186646.2647, "train_tokens_per_second": 4668.759 }, { "epoch": 1.853954081632653, "grad_norm": 0.6278573970486169, "learning_rate": 1.3122241518992107e-07, "loss": 0.21364061832427977, "num_input_tokens_seen": 871696536, "step": 14535, "train_runtime": 186704.199, "train_tokens_per_second": 4668.864 }, { "epoch": 1.8545918367346939, "grad_norm": 0.6947604802332978, "learning_rate": 1.3008484622379358e-07, "loss": 0.24540648460388184, "num_input_tokens_seen": 871993096, "step": 14540, "train_runtime": 186768.0732, "train_tokens_per_second": 4668.855 }, { "epoch": 1.8552295918367347, "grad_norm": 0.6678310631928734, "learning_rate": 1.2895216455763582e-07, "loss": 0.21504359245300292, "num_input_tokens_seen": 872292056, "step": 14545, "train_runtime": 186838.1946, "train_tokens_per_second": 4668.703 }, { "epoch": 1.8558673469387754, "grad_norm": 0.6101568298619875, "learning_rate": 1.278243713281757e-07, "loss": 0.22426114082336426, "num_input_tokens_seen": 872596776, "step": 14550, "train_runtime": 186885.3811, "train_tokens_per_second": 4669.155 }, { "epoch": 1.8565051020408163, "grad_norm": 0.630720751877991, "learning_rate": 1.2670146766723013e-07, "loss": 0.24573097229003907, "num_input_tokens_seen": 872897784, "step": 14555, "train_runtime": 186946.4855, "train_tokens_per_second": 4669.239 }, { "epoch": 1.8571428571428572, "grad_norm": 0.7352603329608624, "learning_rate": 1.2558345470171153e-07, "loss": 0.22406630516052245, "num_input_tokens_seen": 873195496, "step": 14560, "train_runtime": 187015.3542, "train_tokens_per_second": 4669.111 }, { "epoch": 1.8577806122448979, "grad_norm": 0.6045920803471069, "learning_rate": 1.244703335536257e-07, "loss": 0.21021738052368164, "num_input_tokens_seen": 873510560, "step": 14565, "train_runtime": 187084.6298, "train_tokens_per_second": 4669.066 }, { "epoch": 1.8584183673469388, "grad_norm": 0.5968331843220145, "learning_rate": 1.2336210534006576e-07, "loss": 0.22899558544158935, "num_input_tokens_seen": 873811360, "step": 14570, "train_runtime": 187141.7871, "train_tokens_per_second": 4669.248 }, { "epoch": 1.8590561224489797, "grad_norm": 0.6543841944293568, "learning_rate": 1.2225877117321705e-07, "loss": 0.2300337314605713, "num_input_tokens_seen": 874115088, "step": 14575, "train_runtime": 187193.497, "train_tokens_per_second": 4669.58 }, { "epoch": 1.8596938775510203, "grad_norm": 0.7193327651779114, "learning_rate": 1.2116033216035162e-07, "loss": 0.24243698120117188, "num_input_tokens_seen": 874413560, "step": 14580, "train_runtime": 187256.3253, "train_tokens_per_second": 4669.608 }, { "epoch": 1.8603316326530612, "grad_norm": 0.605379428490787, "learning_rate": 1.20066789403831e-07, "loss": 0.2280111789703369, "num_input_tokens_seen": 874718728, "step": 14585, "train_runtime": 187312.103, "train_tokens_per_second": 4669.846 }, { "epoch": 1.8609693877551021, "grad_norm": 0.6197025506402201, "learning_rate": 1.1897814400110064e-07, "loss": 0.21057276725769042, "num_input_tokens_seen": 875021888, "step": 14590, "train_runtime": 187373.8204, "train_tokens_per_second": 4669.926 }, { "epoch": 1.8616071428571428, "grad_norm": 0.6212197732973205, "learning_rate": 1.1789439704469219e-07, "loss": 0.23755302429199218, "num_input_tokens_seen": 875319048, "step": 14595, "train_runtime": 187422.7258, "train_tokens_per_second": 4670.293 }, { "epoch": 1.8622448979591837, "grad_norm": 0.5975752241743172, "learning_rate": 1.168155496222223e-07, "loss": 0.24098501205444336, "num_input_tokens_seen": 875626728, "step": 14600, "train_runtime": 187481.5352, "train_tokens_per_second": 4670.469 }, { "epoch": 1.8628826530612246, "grad_norm": 0.6388992963446776, "learning_rate": 1.1574160281638935e-07, "loss": 0.23636155128479003, "num_input_tokens_seen": 875919600, "step": 14605, "train_runtime": 187541.4211, "train_tokens_per_second": 4670.539 }, { "epoch": 1.8635204081632653, "grad_norm": 0.7144456643858664, "learning_rate": 1.1467255770497343e-07, "loss": 0.23244943618774414, "num_input_tokens_seen": 876221560, "step": 14610, "train_runtime": 187603.397, "train_tokens_per_second": 4670.606 }, { "epoch": 1.8641581632653061, "grad_norm": 0.6817582985285732, "learning_rate": 1.1360841536083633e-07, "loss": 0.21701469421386718, "num_input_tokens_seen": 876511832, "step": 14615, "train_runtime": 187670.4552, "train_tokens_per_second": 4670.484 }, { "epoch": 1.864795918367347, "grad_norm": 0.627570811391596, "learning_rate": 1.125491768519199e-07, "loss": 0.24056625366210938, "num_input_tokens_seen": 876828424, "step": 14620, "train_runtime": 187732.5249, "train_tokens_per_second": 4670.626 }, { "epoch": 1.8654336734693877, "grad_norm": 0.7294722509912248, "learning_rate": 1.1149484324124326e-07, "loss": 0.2572359561920166, "num_input_tokens_seen": 877131488, "step": 14625, "train_runtime": 187806.3447, "train_tokens_per_second": 4670.404 }, { "epoch": 1.8660714285714286, "grad_norm": 0.693302961896091, "learning_rate": 1.1044541558690281e-07, "loss": 0.24057960510253906, "num_input_tokens_seen": 877422776, "step": 14630, "train_runtime": 187872.14, "train_tokens_per_second": 4670.319 }, { "epoch": 1.8667091836734695, "grad_norm": 0.6165680252752774, "learning_rate": 1.094008949420744e-07, "loss": 0.24250717163085939, "num_input_tokens_seen": 877722544, "step": 14635, "train_runtime": 187938.663, "train_tokens_per_second": 4670.261 }, { "epoch": 1.8673469387755102, "grad_norm": 0.6002669462477733, "learning_rate": 1.0836128235500676e-07, "loss": 0.23071460723876952, "num_input_tokens_seen": 878029288, "step": 14640, "train_runtime": 188007.6859, "train_tokens_per_second": 4670.178 }, { "epoch": 1.867984693877551, "grad_norm": 0.6771460444986078, "learning_rate": 1.0732657886902308e-07, "loss": 0.23574914932250976, "num_input_tokens_seen": 878335192, "step": 14645, "train_runtime": 188076.2415, "train_tokens_per_second": 4670.102 }, { "epoch": 1.868622448979592, "grad_norm": 0.5840827704305357, "learning_rate": 1.0629678552252109e-07, "loss": 0.21893777847290039, "num_input_tokens_seen": 878636112, "step": 14650, "train_runtime": 188143.9317, "train_tokens_per_second": 4670.021 }, { "epoch": 1.8692602040816326, "grad_norm": 0.7404579482784661, "learning_rate": 1.0527190334897076e-07, "loss": 0.246806001663208, "num_input_tokens_seen": 878933752, "step": 14655, "train_runtime": 188207.2491, "train_tokens_per_second": 4670.031 }, { "epoch": 1.8698979591836735, "grad_norm": 0.6590259305605255, "learning_rate": 1.0425193337691208e-07, "loss": 0.22685532569885253, "num_input_tokens_seen": 879246712, "step": 14660, "train_runtime": 188273.9892, "train_tokens_per_second": 4670.038 }, { "epoch": 1.8705357142857144, "grad_norm": 0.7058607713702875, "learning_rate": 1.0323687662995685e-07, "loss": 0.22674460411071778, "num_input_tokens_seen": 879549144, "step": 14665, "train_runtime": 188337.3823, "train_tokens_per_second": 4670.072 }, { "epoch": 1.871173469387755, "grad_norm": 0.6503089387113022, "learning_rate": 1.0222673412678518e-07, "loss": 0.2473440170288086, "num_input_tokens_seen": 879859696, "step": 14670, "train_runtime": 188398.9085, "train_tokens_per_second": 4670.195 }, { "epoch": 1.8718112244897958, "grad_norm": 0.5604952931271503, "learning_rate": 1.0122150688114507e-07, "loss": 0.24516563415527343, "num_input_tokens_seen": 880169896, "step": 14675, "train_runtime": 188464.7909, "train_tokens_per_second": 4670.209 }, { "epoch": 1.8724489795918369, "grad_norm": 0.6788083731679111, "learning_rate": 1.0022119590185287e-07, "loss": 0.22207980155944823, "num_input_tokens_seen": 880480736, "step": 14680, "train_runtime": 188520.1778, "train_tokens_per_second": 4670.485 }, { "epoch": 1.8730867346938775, "grad_norm": 0.6197056753863878, "learning_rate": 9.922580219279055e-08, "loss": 0.24501399993896483, "num_input_tokens_seen": 880784904, "step": 14685, "train_runtime": 188578.492, "train_tokens_per_second": 4670.654 }, { "epoch": 1.8737244897959182, "grad_norm": 0.6536242686249847, "learning_rate": 9.82353267529046e-08, "loss": 0.2373288631439209, "num_input_tokens_seen": 881082192, "step": 14690, "train_runtime": 188647.7988, "train_tokens_per_second": 4670.514 }, { "epoch": 1.8743622448979593, "grad_norm": 0.6091687376173869, "learning_rate": 9.72497705762071e-08, "loss": 0.24420948028564454, "num_input_tokens_seen": 881380784, "step": 14695, "train_runtime": 188704.9611, "train_tokens_per_second": 4670.682 }, { "epoch": 1.875, "grad_norm": 0.6559991166313782, "learning_rate": 9.626913465177246e-08, "loss": 0.25005807876586916, "num_input_tokens_seen": 881690656, "step": 14700, "train_runtime": 188762.798, "train_tokens_per_second": 4670.892 }, { "epoch": 1.8756377551020407, "grad_norm": 0.612906653695731, "learning_rate": 9.529341996373675e-08, "loss": 0.22320895195007323, "num_input_tokens_seen": 881983480, "step": 14705, "train_runtime": 188837.3232, "train_tokens_per_second": 4670.599 }, { "epoch": 1.8762755102040818, "grad_norm": 0.6738789264807418, "learning_rate": 9.432262749129784e-08, "loss": 0.23938822746276855, "num_input_tokens_seen": 882261616, "step": 14710, "train_runtime": 188903.7599, "train_tokens_per_second": 4670.429 }, { "epoch": 1.8769132653061225, "grad_norm": 0.6590420467075672, "learning_rate": 9.335675820871415e-08, "loss": 0.2600644588470459, "num_input_tokens_seen": 882559920, "step": 14715, "train_runtime": 188979.7054, "train_tokens_per_second": 4670.131 }, { "epoch": 1.8775510204081631, "grad_norm": 0.7053299947071794, "learning_rate": 9.239581308530254e-08, "loss": 0.23621573448181152, "num_input_tokens_seen": 882858320, "step": 14720, "train_runtime": 189048.0866, "train_tokens_per_second": 4670.02 }, { "epoch": 1.8781887755102042, "grad_norm": 0.6725471849133484, "learning_rate": 9.143979308543993e-08, "loss": 0.24531195163726807, "num_input_tokens_seen": 883153856, "step": 14725, "train_runtime": 189112.9534, "train_tokens_per_second": 4669.981 }, { "epoch": 1.878826530612245, "grad_norm": 0.7108238210464412, "learning_rate": 9.048869916855662e-08, "loss": 0.21591539382934571, "num_input_tokens_seen": 883437160, "step": 14730, "train_runtime": 189174.4025, "train_tokens_per_second": 4669.961 }, { "epoch": 1.8794642857142856, "grad_norm": 0.6541061455855879, "learning_rate": 8.954253228914356e-08, "loss": 0.23390002250671388, "num_input_tokens_seen": 883720000, "step": 14735, "train_runtime": 189235.0474, "train_tokens_per_second": 4669.959 }, { "epoch": 1.8801020408163265, "grad_norm": 0.7518516631614485, "learning_rate": 8.860129339674562e-08, "loss": 0.24814205169677733, "num_input_tokens_seen": 884030264, "step": 14740, "train_runtime": 189298.0993, "train_tokens_per_second": 4670.043 }, { "epoch": 1.8807397959183674, "grad_norm": 0.726048580189418, "learning_rate": 8.766498343596053e-08, "loss": 0.21693217754364014, "num_input_tokens_seen": 884318136, "step": 14745, "train_runtime": 189365.5517, "train_tokens_per_second": 4669.9 }, { "epoch": 1.881377551020408, "grad_norm": 0.6600998374561002, "learning_rate": 8.67336033464411e-08, "loss": 0.24096481800079345, "num_input_tokens_seen": 884605888, "step": 14750, "train_runtime": 189428.1347, "train_tokens_per_second": 4669.876 }, { "epoch": 1.882015306122449, "grad_norm": 0.5852704161884672, "learning_rate": 8.580715406289353e-08, "loss": 0.23575496673583984, "num_input_tokens_seen": 884905752, "step": 14755, "train_runtime": 189494.6066, "train_tokens_per_second": 4669.82 }, { "epoch": 1.8826530612244898, "grad_norm": 0.6730731304858276, "learning_rate": 8.488563651507242e-08, "loss": 0.23407430648803712, "num_input_tokens_seen": 885201480, "step": 14760, "train_runtime": 189556.2553, "train_tokens_per_second": 4669.862 }, { "epoch": 1.8832908163265305, "grad_norm": 0.6611050619633174, "learning_rate": 8.396905162778523e-08, "loss": 0.23900527954101564, "num_input_tokens_seen": 885513816, "step": 14765, "train_runtime": 189614.3506, "train_tokens_per_second": 4670.078 }, { "epoch": 1.8839285714285714, "grad_norm": 0.6575305055614173, "learning_rate": 8.305740032089116e-08, "loss": 0.2386373519897461, "num_input_tokens_seen": 885804312, "step": 14770, "train_runtime": 189674.9686, "train_tokens_per_second": 4670.117 }, { "epoch": 1.8845663265306123, "grad_norm": 0.7400761573412182, "learning_rate": 8.215068350929334e-08, "loss": 0.24945921897888185, "num_input_tokens_seen": 886090304, "step": 14775, "train_runtime": 189746.0203, "train_tokens_per_second": 4669.876 }, { "epoch": 1.885204081632653, "grad_norm": 0.650024826467964, "learning_rate": 8.124890210294667e-08, "loss": 0.23193161487579345, "num_input_tokens_seen": 886383608, "step": 14780, "train_runtime": 189812.0482, "train_tokens_per_second": 4669.796 }, { "epoch": 1.8858418367346939, "grad_norm": 0.7150616702077507, "learning_rate": 8.035205700685167e-08, "loss": 0.2643417835235596, "num_input_tokens_seen": 886684968, "step": 14785, "train_runtime": 189880.3557, "train_tokens_per_second": 4669.704 }, { "epoch": 1.8864795918367347, "grad_norm": 0.6653687091903648, "learning_rate": 7.946014912105505e-08, "loss": 0.23194210529327391, "num_input_tokens_seen": 886989336, "step": 14790, "train_runtime": 189936.09, "train_tokens_per_second": 4669.936 }, { "epoch": 1.8871173469387754, "grad_norm": 0.6347424894790333, "learning_rate": 7.857317934064857e-08, "loss": 0.23241157531738282, "num_input_tokens_seen": 887304888, "step": 14795, "train_runtime": 189989.1431, "train_tokens_per_second": 4670.293 }, { "epoch": 1.8877551020408163, "grad_norm": 0.657102108937192, "learning_rate": 7.769114855576799e-08, "loss": 0.22253942489624023, "num_input_tokens_seen": 887613072, "step": 14800, "train_runtime": 190054.016, "train_tokens_per_second": 4670.32 }, { "epoch": 1.8883928571428572, "grad_norm": 0.684282852276083, "learning_rate": 7.6814057651593e-08, "loss": 0.23771584033966064, "num_input_tokens_seen": 887915816, "step": 14805, "train_runtime": 190118.3645, "train_tokens_per_second": 4670.332 }, { "epoch": 1.8890306122448979, "grad_norm": 0.6501394834124957, "learning_rate": 7.594190750834617e-08, "loss": 0.26170597076416013, "num_input_tokens_seen": 888220584, "step": 14810, "train_runtime": 190194.9364, "train_tokens_per_second": 4670.054 }, { "epoch": 1.8896683673469388, "grad_norm": 0.6861093797898603, "learning_rate": 7.507469900129016e-08, "loss": 0.22220227718353272, "num_input_tokens_seen": 888526080, "step": 14815, "train_runtime": 190242.9994, "train_tokens_per_second": 4670.48 }, { "epoch": 1.8903061224489797, "grad_norm": 0.6730178203742853, "learning_rate": 7.421243300072989e-08, "loss": 0.2384312629699707, "num_input_tokens_seen": 888816712, "step": 14820, "train_runtime": 190301.3519, "train_tokens_per_second": 4670.575 }, { "epoch": 1.8909438775510203, "grad_norm": 0.7650803401896588, "learning_rate": 7.335511037200982e-08, "loss": 0.24442434310913086, "num_input_tokens_seen": 889113872, "step": 14825, "train_runtime": 190366.3449, "train_tokens_per_second": 4670.541 }, { "epoch": 1.8915816326530612, "grad_norm": 0.7261122563642717, "learning_rate": 7.250273197551227e-08, "loss": 0.25747177600860593, "num_input_tokens_seen": 889419088, "step": 14830, "train_runtime": 190427.6903, "train_tokens_per_second": 4670.639 }, { "epoch": 1.8922193877551021, "grad_norm": 0.6046613288996454, "learning_rate": 7.165529866665855e-08, "loss": 0.23916244506835938, "num_input_tokens_seen": 889714880, "step": 14835, "train_runtime": 190481.327, "train_tokens_per_second": 4670.877 }, { "epoch": 1.8928571428571428, "grad_norm": 0.7351870622704426, "learning_rate": 7.081281129590777e-08, "loss": 0.2395155906677246, "num_input_tokens_seen": 889996216, "step": 14840, "train_runtime": 190542.6664, "train_tokens_per_second": 4670.85 }, { "epoch": 1.8934948979591837, "grad_norm": 0.7085706373965491, "learning_rate": 6.99752707087542e-08, "loss": 0.25458741188049316, "num_input_tokens_seen": 890302536, "step": 14845, "train_runtime": 190608.7403, "train_tokens_per_second": 4670.838 }, { "epoch": 1.8941326530612246, "grad_norm": 0.7101358935326122, "learning_rate": 6.91426777457288e-08, "loss": 0.26941733360290526, "num_input_tokens_seen": 890607864, "step": 14850, "train_runtime": 190676.7186, "train_tokens_per_second": 4670.774 }, { "epoch": 1.8947704081632653, "grad_norm": 0.6953427813899536, "learning_rate": 6.831503324239707e-08, "loss": 0.24118461608886718, "num_input_tokens_seen": 890907856, "step": 14855, "train_runtime": 190730.2153, "train_tokens_per_second": 4671.037 }, { "epoch": 1.8954081632653061, "grad_norm": 0.999849336589608, "learning_rate": 6.749233802935684e-08, "loss": 0.22293548583984374, "num_input_tokens_seen": 891195896, "step": 14860, "train_runtime": 190793.986, "train_tokens_per_second": 4670.985 }, { "epoch": 1.896045918367347, "grad_norm": 0.5972988403218099, "learning_rate": 6.667459293224155e-08, "loss": 0.22655868530273438, "num_input_tokens_seen": 891502736, "step": 14865, "train_runtime": 190855.7123, "train_tokens_per_second": 4671.082 }, { "epoch": 1.8966836734693877, "grad_norm": 0.6875299488691295, "learning_rate": 6.586179877171473e-08, "loss": 0.23338775634765624, "num_input_tokens_seen": 891806256, "step": 14870, "train_runtime": 190925.9032, "train_tokens_per_second": 4670.955 }, { "epoch": 1.8973214285714286, "grad_norm": 0.6580488873267832, "learning_rate": 6.505395636347222e-08, "loss": 0.26167232990264894, "num_input_tokens_seen": 892109288, "step": 14875, "train_runtime": 190993.3851, "train_tokens_per_second": 4670.891 }, { "epoch": 1.8979591836734695, "grad_norm": 0.738698676658821, "learning_rate": 6.425106651824054e-08, "loss": 0.23957352638244628, "num_input_tokens_seen": 892408864, "step": 14880, "train_runtime": 191060.084, "train_tokens_per_second": 4670.828 }, { "epoch": 1.8985969387755102, "grad_norm": 0.6194161475157497, "learning_rate": 6.345313004177511e-08, "loss": 0.23000946044921874, "num_input_tokens_seen": 892701112, "step": 14885, "train_runtime": 191120.4848, "train_tokens_per_second": 4670.881 }, { "epoch": 1.899234693877551, "grad_norm": 0.7407638762684772, "learning_rate": 6.266014773486207e-08, "loss": 0.2402566909790039, "num_input_tokens_seen": 892990744, "step": 14890, "train_runtime": 191182.511, "train_tokens_per_second": 4670.881 }, { "epoch": 1.899872448979592, "grad_norm": 0.62624988091952, "learning_rate": 6.187212039331314e-08, "loss": 0.25193309783935547, "num_input_tokens_seen": 893301904, "step": 14895, "train_runtime": 191255.442, "train_tokens_per_second": 4670.727 }, { "epoch": 1.9005102040816326, "grad_norm": 0.7579850216336217, "learning_rate": 6.108904880797017e-08, "loss": 0.2599358081817627, "num_input_tokens_seen": 893614944, "step": 14900, "train_runtime": 191308.3724, "train_tokens_per_second": 4671.071 }, { "epoch": 1.9011479591836735, "grad_norm": 0.6862768217826825, "learning_rate": 6.031093376469899e-08, "loss": 0.250386381149292, "num_input_tokens_seen": 893909080, "step": 14905, "train_runtime": 191380.9808, "train_tokens_per_second": 4670.836 }, { "epoch": 1.9017857142857144, "grad_norm": 0.6631016851451885, "learning_rate": 5.9537776044393256e-08, "loss": 0.2259291172027588, "num_input_tokens_seen": 894216832, "step": 14910, "train_runtime": 191447.6052, "train_tokens_per_second": 4670.818 }, { "epoch": 1.902423469387755, "grad_norm": 0.6027942096396334, "learning_rate": 5.87695764229701e-08, "loss": 0.2525123834609985, "num_input_tokens_seen": 894522600, "step": 14915, "train_runtime": 191512.1418, "train_tokens_per_second": 4670.84 }, { "epoch": 1.9030612244897958, "grad_norm": 0.6092285515600385, "learning_rate": 5.80063356713717e-08, "loss": 0.24264698028564452, "num_input_tokens_seen": 894826800, "step": 14920, "train_runtime": 191580.1686, "train_tokens_per_second": 4670.769 }, { "epoch": 1.9036989795918369, "grad_norm": 0.6588368285104348, "learning_rate": 5.7248054555563704e-08, "loss": 0.24944958686828614, "num_input_tokens_seen": 895116520, "step": 14925, "train_runtime": 191638.7761, "train_tokens_per_second": 4670.853 }, { "epoch": 1.9043367346938775, "grad_norm": 0.6477524467877152, "learning_rate": 5.6494733836534035e-08, "loss": 0.225768518447876, "num_input_tokens_seen": 895401512, "step": 14930, "train_runtime": 191699.6981, "train_tokens_per_second": 4670.855 }, { "epoch": 1.9049744897959182, "grad_norm": 0.6588457990258274, "learning_rate": 5.574637427029239e-08, "loss": 0.22354941368103026, "num_input_tokens_seen": 895700776, "step": 14935, "train_runtime": 191769.6542, "train_tokens_per_second": 4670.712 }, { "epoch": 1.9056122448979593, "grad_norm": 0.6939714517067077, "learning_rate": 5.50029766078708e-08, "loss": 0.2440859317779541, "num_input_tokens_seen": 895998240, "step": 14940, "train_runtime": 191845.4352, "train_tokens_per_second": 4670.417 }, { "epoch": 1.90625, "grad_norm": 0.566132980534101, "learning_rate": 5.426454159531913e-08, "loss": 0.2135913610458374, "num_input_tokens_seen": 896314136, "step": 14945, "train_runtime": 191911.839, "train_tokens_per_second": 4670.447 }, { "epoch": 1.9068877551020407, "grad_norm": 0.6906905587473503, "learning_rate": 5.3531069973709607e-08, "loss": 0.22824203968048096, "num_input_tokens_seen": 896611744, "step": 14950, "train_runtime": 191980.4463, "train_tokens_per_second": 4670.328 }, { "epoch": 1.9075255102040818, "grad_norm": 0.6372209541472462, "learning_rate": 5.280256247913229e-08, "loss": 0.2516682863235474, "num_input_tokens_seen": 896937600, "step": 14955, "train_runtime": 192052.6662, "train_tokens_per_second": 4670.269 }, { "epoch": 1.9081632653061225, "grad_norm": 0.6464146872929862, "learning_rate": 5.207901984269459e-08, "loss": 0.23169450759887694, "num_input_tokens_seen": 897243616, "step": 14960, "train_runtime": 192118.1025, "train_tokens_per_second": 4670.271 }, { "epoch": 1.9088010204081631, "grad_norm": 0.6440297794914668, "learning_rate": 5.136044279052288e-08, "loss": 0.25643513202667234, "num_input_tokens_seen": 897550240, "step": 14965, "train_runtime": 192187.8115, "train_tokens_per_second": 4670.173 }, { "epoch": 1.9094387755102042, "grad_norm": 0.6749457211671639, "learning_rate": 5.0646832043758645e-08, "loss": 0.24692878723144532, "num_input_tokens_seen": 897847152, "step": 14970, "train_runtime": 192258.5077, "train_tokens_per_second": 4670.0 }, { "epoch": 1.910076530612245, "grad_norm": 0.6478322305302919, "learning_rate": 4.993818831856123e-08, "loss": 0.23909859657287597, "num_input_tokens_seen": 898131880, "step": 14975, "train_runtime": 192320.6567, "train_tokens_per_second": 4669.971 }, { "epoch": 1.9107142857142856, "grad_norm": 0.7018693541826305, "learning_rate": 4.923451232610288e-08, "loss": 0.25514373779296873, "num_input_tokens_seen": 898427688, "step": 14980, "train_runtime": 192380.6107, "train_tokens_per_second": 4670.053 }, { "epoch": 1.9113520408163265, "grad_norm": 0.6564444124647395, "learning_rate": 4.8535804772572024e-08, "loss": 0.2652846336364746, "num_input_tokens_seen": 898728800, "step": 14985, "train_runtime": 192443.2259, "train_tokens_per_second": 4670.098 }, { "epoch": 1.9119897959183674, "grad_norm": 0.6716127219950674, "learning_rate": 4.7842066359170544e-08, "loss": 0.25480942726135253, "num_input_tokens_seen": 899027712, "step": 14990, "train_runtime": 192510.9509, "train_tokens_per_second": 4670.008 }, { "epoch": 1.912627551020408, "grad_norm": 0.674740294633714, "learning_rate": 4.715329778211375e-08, "loss": 0.23373541831970215, "num_input_tokens_seen": 899326320, "step": 14995, "train_runtime": 192579.882, "train_tokens_per_second": 4669.887 }, { "epoch": 1.913265306122449, "grad_norm": 0.6340465402770782, "learning_rate": 4.646949973262871e-08, "loss": 0.2550114870071411, "num_input_tokens_seen": 899624928, "step": 15000, "train_runtime": 192640.1618, "train_tokens_per_second": 4669.976 }, { "epoch": 1.9139030612244898, "grad_norm": 0.6207776252521124, "learning_rate": 4.579067289695427e-08, "loss": 0.24618887901306152, "num_input_tokens_seen": 899911880, "step": 15005, "train_runtime": 192699.2674, "train_tokens_per_second": 4670.033 }, { "epoch": 1.9145408163265305, "grad_norm": 0.7526401101813818, "learning_rate": 4.511681795634049e-08, "loss": 0.22883908748626708, "num_input_tokens_seen": 900200640, "step": 15010, "train_runtime": 192767.0538, "train_tokens_per_second": 4669.888 }, { "epoch": 1.9151785714285714, "grad_norm": 0.6939288258041673, "learning_rate": 4.4447935587049185e-08, "loss": 0.23292334079742433, "num_input_tokens_seen": 900501656, "step": 15015, "train_runtime": 192825.7253, "train_tokens_per_second": 4670.029 }, { "epoch": 1.9158163265306123, "grad_norm": 0.645913207816087, "learning_rate": 4.37840264603484e-08, "loss": 0.24563350677490234, "num_input_tokens_seen": 900798080, "step": 15020, "train_runtime": 192883.2208, "train_tokens_per_second": 4670.173 }, { "epoch": 1.916454081632653, "grad_norm": 0.7211337876438396, "learning_rate": 4.312509124251907e-08, "loss": 0.25634796619415284, "num_input_tokens_seen": 901104512, "step": 15025, "train_runtime": 192954.1675, "train_tokens_per_second": 4670.044 }, { "epoch": 1.9170918367346939, "grad_norm": 0.6328512646454919, "learning_rate": 4.247113059484775e-08, "loss": 0.23440108299255372, "num_input_tokens_seen": 901396168, "step": 15030, "train_runtime": 193013.4268, "train_tokens_per_second": 4670.122 }, { "epoch": 1.9177295918367347, "grad_norm": 0.6326676759399048, "learning_rate": 4.1822145173630033e-08, "loss": 0.2312554359436035, "num_input_tokens_seen": 901702576, "step": 15035, "train_runtime": 193069.9139, "train_tokens_per_second": 4670.342 }, { "epoch": 1.9183673469387754, "grad_norm": 0.6059941073498739, "learning_rate": 4.117813563016826e-08, "loss": 0.23285727500915526, "num_input_tokens_seen": 901999496, "step": 15040, "train_runtime": 193132.6869, "train_tokens_per_second": 4670.362 }, { "epoch": 1.9190051020408163, "grad_norm": 0.5869284707146232, "learning_rate": 4.0539102610770434e-08, "loss": 0.2457603931427002, "num_input_tokens_seen": 902302920, "step": 15045, "train_runtime": 193201.8869, "train_tokens_per_second": 4670.259 }, { "epoch": 1.9196428571428572, "grad_norm": 0.5822091240848306, "learning_rate": 3.990504675675133e-08, "loss": 0.2333512306213379, "num_input_tokens_seen": 902607528, "step": 15050, "train_runtime": 193265.0667, "train_tokens_per_second": 4670.309 }, { "epoch": 1.9202806122448979, "grad_norm": 0.5942966343245862, "learning_rate": 3.927596870442973e-08, "loss": 0.2389463186264038, "num_input_tokens_seen": 902914504, "step": 15055, "train_runtime": 193323.4537, "train_tokens_per_second": 4670.486 }, { "epoch": 1.9209183673469388, "grad_norm": 0.5396680335059741, "learning_rate": 3.8651869085130076e-08, "loss": 0.24712717533111572, "num_input_tokens_seen": 903209392, "step": 15060, "train_runtime": 193390.8722, "train_tokens_per_second": 4670.383 }, { "epoch": 1.9215561224489797, "grad_norm": 0.6268102745983977, "learning_rate": 3.8032748525179684e-08, "loss": 0.22878117561340333, "num_input_tokens_seen": 903501080, "step": 15065, "train_runtime": 193456.8732, "train_tokens_per_second": 4670.297 }, { "epoch": 1.9221938775510203, "grad_norm": 0.6629009625921484, "learning_rate": 3.741860764590877e-08, "loss": 0.25066375732421875, "num_input_tokens_seen": 903822752, "step": 15070, "train_runtime": 193513.3293, "train_tokens_per_second": 4670.597 }, { "epoch": 1.9228316326530612, "grad_norm": 0.5795866770696644, "learning_rate": 3.680944706365097e-08, "loss": 0.22920804023742675, "num_input_tokens_seen": 904138144, "step": 15075, "train_runtime": 193572.0552, "train_tokens_per_second": 4670.809 }, { "epoch": 1.9234693877551021, "grad_norm": 0.6199219051878265, "learning_rate": 3.6205267389741724e-08, "loss": 0.230307674407959, "num_input_tokens_seen": 904440488, "step": 15080, "train_runtime": 193633.0442, "train_tokens_per_second": 4670.899 }, { "epoch": 1.9241071428571428, "grad_norm": 0.7081937235558688, "learning_rate": 3.560606923051768e-08, "loss": 0.2649749994277954, "num_input_tokens_seen": 904749440, "step": 15085, "train_runtime": 193691.7229, "train_tokens_per_second": 4671.08 }, { "epoch": 1.9247448979591837, "grad_norm": 0.6850531620583067, "learning_rate": 3.5011853187315035e-08, "loss": 0.232527494430542, "num_input_tokens_seen": 905040448, "step": 15090, "train_runtime": 193756.5747, "train_tokens_per_second": 4671.018 }, { "epoch": 1.9253826530612246, "grad_norm": 0.6649364094207673, "learning_rate": 3.442261985647177e-08, "loss": 0.25315489768981936, "num_input_tokens_seen": 905343480, "step": 15095, "train_runtime": 193819.7759, "train_tokens_per_second": 4671.058 }, { "epoch": 1.9260204081632653, "grad_norm": 0.7367104201106388, "learning_rate": 3.383836982932542e-08, "loss": 0.23107264041900635, "num_input_tokens_seen": 905632408, "step": 15100, "train_runtime": 193875.9655, "train_tokens_per_second": 4671.195 }, { "epoch": 1.9266581632653061, "grad_norm": 0.6422996191071108, "learning_rate": 3.325910369220975e-08, "loss": 0.2546488523483276, "num_input_tokens_seen": 905934184, "step": 15105, "train_runtime": 193947.093, "train_tokens_per_second": 4671.038 }, { "epoch": 1.927295918367347, "grad_norm": 0.6387982927830601, "learning_rate": 3.268482202646084e-08, "loss": 0.23939924240112304, "num_input_tokens_seen": 906237608, "step": 15110, "train_runtime": 194020.9974, "train_tokens_per_second": 4670.822 }, { "epoch": 1.9279336734693877, "grad_norm": 0.6809442061626129, "learning_rate": 3.211552540840934e-08, "loss": 0.2389169692993164, "num_input_tokens_seen": 906551528, "step": 15115, "train_runtime": 194093.7717, "train_tokens_per_second": 4670.688 }, { "epoch": 1.9285714285714286, "grad_norm": 0.6062182732420422, "learning_rate": 3.1551214409384355e-08, "loss": 0.2684735536575317, "num_input_tokens_seen": 906864488, "step": 15120, "train_runtime": 194147.0547, "train_tokens_per_second": 4671.019 }, { "epoch": 1.9292091836734695, "grad_norm": 0.6858638615391687, "learning_rate": 3.09918895957112e-08, "loss": 0.24612531661987305, "num_input_tokens_seen": 907132432, "step": 15125, "train_runtime": 194214.467, "train_tokens_per_second": 4670.777 }, { "epoch": 1.9298469387755102, "grad_norm": 0.688916621792478, "learning_rate": 3.0437551528711974e-08, "loss": 0.24551730155944823, "num_input_tokens_seen": 907423464, "step": 15130, "train_runtime": 194277.6119, "train_tokens_per_second": 4670.757 }, { "epoch": 1.930484693877551, "grad_norm": 0.6635125567256317, "learning_rate": 2.988820076470278e-08, "loss": 0.2580201864242554, "num_input_tokens_seen": 907719760, "step": 15135, "train_runtime": 194339.0798, "train_tokens_per_second": 4670.804 }, { "epoch": 1.931122448979592, "grad_norm": 0.814995636446256, "learning_rate": 2.934383785499595e-08, "loss": 0.23907341957092285, "num_input_tokens_seen": 908028760, "step": 15140, "train_runtime": 194403.9862, "train_tokens_per_second": 4670.834 }, { "epoch": 1.9317602040816326, "grad_norm": 0.665618420325683, "learning_rate": 2.880446334589837e-08, "loss": 0.2549652099609375, "num_input_tokens_seen": 908335864, "step": 15145, "train_runtime": 194466.2845, "train_tokens_per_second": 4670.917 }, { "epoch": 1.9323979591836735, "grad_norm": 0.640722233968815, "learning_rate": 2.8270077778708714e-08, "loss": 0.2548914909362793, "num_input_tokens_seen": 908623464, "step": 15150, "train_runtime": 194536.8756, "train_tokens_per_second": 4670.7 }, { "epoch": 1.9330357142857144, "grad_norm": 0.653741482098068, "learning_rate": 2.7740681689721327e-08, "loss": 0.2401275157928467, "num_input_tokens_seen": 908925248, "step": 15155, "train_runtime": 194603.3872, "train_tokens_per_second": 4670.655 }, { "epoch": 1.933673469387755, "grad_norm": 0.8538638590132563, "learning_rate": 2.721627561022122e-08, "loss": 0.25029151439666747, "num_input_tokens_seen": 909225024, "step": 15160, "train_runtime": 194664.7841, "train_tokens_per_second": 4670.722 }, { "epoch": 1.9343112244897958, "grad_norm": 0.6287202779561625, "learning_rate": 2.6696860066487417e-08, "loss": 0.21725854873657227, "num_input_tokens_seen": 909529280, "step": 15165, "train_runtime": 194721.458, "train_tokens_per_second": 4670.925 }, { "epoch": 1.9349489795918369, "grad_norm": 0.6622045332718416, "learning_rate": 2.6182435579789055e-08, "loss": 0.2391425371170044, "num_input_tokens_seen": 909837264, "step": 15170, "train_runtime": 194789.9301, "train_tokens_per_second": 4670.864 }, { "epoch": 1.9355867346938775, "grad_norm": 0.6455356673733826, "learning_rate": 2.567300266638706e-08, "loss": 0.25289885997772216, "num_input_tokens_seen": 910137832, "step": 15175, "train_runtime": 194862.8765, "train_tokens_per_second": 4670.658 }, { "epoch": 1.9362244897959182, "grad_norm": 0.6807299064078204, "learning_rate": 2.516856183753358e-08, "loss": 0.23154253959655763, "num_input_tokens_seen": 910455200, "step": 15180, "train_runtime": 194933.524, "train_tokens_per_second": 4670.593 }, { "epoch": 1.9368622448979593, "grad_norm": 0.7313470463205378, "learning_rate": 2.4669113599469774e-08, "loss": 0.24894938468933106, "num_input_tokens_seen": 910766760, "step": 15185, "train_runtime": 194984.5745, "train_tokens_per_second": 4670.968 }, { "epoch": 1.9375, "grad_norm": 0.6806718686332535, "learning_rate": 2.4174658453426368e-08, "loss": 0.25083222389221194, "num_input_tokens_seen": 911073496, "step": 15190, "train_runtime": 195050.2362, "train_tokens_per_second": 4670.968 }, { "epoch": 1.9381377551020407, "grad_norm": 0.6310448786168161, "learning_rate": 2.3685196895624206e-08, "loss": 0.23468017578125, "num_input_tokens_seen": 911382928, "step": 15195, "train_runtime": 195112.2691, "train_tokens_per_second": 4671.069 }, { "epoch": 1.9387755102040818, "grad_norm": 0.674200703449938, "learning_rate": 2.3200729417272028e-08, "loss": 0.22753286361694336, "num_input_tokens_seen": 911694488, "step": 15200, "train_runtime": 195183.338, "train_tokens_per_second": 4670.965 }, { "epoch": 1.9394132653061225, "grad_norm": 0.642863695602926, "learning_rate": 2.2721256504567026e-08, "loss": 0.25208315849304197, "num_input_tokens_seen": 911986016, "step": 15205, "train_runtime": 195252.5857, "train_tokens_per_second": 4670.801 }, { "epoch": 1.9400510204081631, "grad_norm": 0.6219130487996105, "learning_rate": 2.2246778638692623e-08, "loss": 0.2282183885574341, "num_input_tokens_seen": 912285512, "step": 15210, "train_runtime": 195315.6121, "train_tokens_per_second": 4670.827 }, { "epoch": 1.9406887755102042, "grad_norm": 0.6720021915213673, "learning_rate": 2.177729629582237e-08, "loss": 0.22368407249450684, "num_input_tokens_seen": 912594320, "step": 15215, "train_runtime": 195376.0522, "train_tokens_per_second": 4670.963 }, { "epoch": 1.941326530612245, "grad_norm": 0.5769656601013554, "learning_rate": 2.1312809947113267e-08, "loss": 0.21522626876831055, "num_input_tokens_seen": 912890168, "step": 15220, "train_runtime": 195437.2223, "train_tokens_per_second": 4671.015 }, { "epoch": 1.9419642857142856, "grad_norm": 0.6302180994971214, "learning_rate": 2.0853320058710214e-08, "loss": 0.23648781776428224, "num_input_tokens_seen": 913182776, "step": 15225, "train_runtime": 195494.0997, "train_tokens_per_second": 4671.153 }, { "epoch": 1.9426020408163265, "grad_norm": 0.7437601080428625, "learning_rate": 2.0398827091743234e-08, "loss": 0.2461167812347412, "num_input_tokens_seen": 913465992, "step": 15230, "train_runtime": 195559.0722, "train_tokens_per_second": 4671.049 }, { "epoch": 1.9432397959183674, "grad_norm": 0.6919033357778054, "learning_rate": 1.9949331502327475e-08, "loss": 0.22862133979797364, "num_input_tokens_seen": 913747936, "step": 15235, "train_runtime": 195621.9343, "train_tokens_per_second": 4670.989 }, { "epoch": 1.943877551020408, "grad_norm": 0.6223614709195145, "learning_rate": 1.950483374156431e-08, "loss": 0.253930401802063, "num_input_tokens_seen": 914049728, "step": 15240, "train_runtime": 195676.3182, "train_tokens_per_second": 4671.233 }, { "epoch": 1.944515306122449, "grad_norm": 0.6337973715833365, "learning_rate": 1.9065334255536916e-08, "loss": 0.24294543266296387, "num_input_tokens_seen": 914343256, "step": 15245, "train_runtime": 195744.5468, "train_tokens_per_second": 4671.105 }, { "epoch": 1.9451530612244898, "grad_norm": 0.6210057272388032, "learning_rate": 1.8630833485314693e-08, "loss": 0.2540744304656982, "num_input_tokens_seen": 914645640, "step": 15250, "train_runtime": 195809.6772, "train_tokens_per_second": 4671.095 }, { "epoch": 1.9457908163265305, "grad_norm": 0.6715394091560279, "learning_rate": 1.8201331866948834e-08, "loss": 0.23338706493377687, "num_input_tokens_seen": 914941704, "step": 15255, "train_runtime": 195874.8375, "train_tokens_per_second": 4671.053 }, { "epoch": 1.9464285714285714, "grad_norm": 0.6634502906165924, "learning_rate": 1.7776829831474553e-08, "loss": 0.24994971752166747, "num_input_tokens_seen": 915241552, "step": 15260, "train_runtime": 195942.347, "train_tokens_per_second": 4670.974 }, { "epoch": 1.9470663265306123, "grad_norm": 0.6218536804696106, "learning_rate": 1.735732780490884e-08, "loss": 0.24652099609375, "num_input_tokens_seen": 915547064, "step": 15265, "train_runtime": 195991.8415, "train_tokens_per_second": 4671.353 }, { "epoch": 1.947704081632653, "grad_norm": 0.6663908818224021, "learning_rate": 1.694282620825216e-08, "loss": 0.22615201473236085, "num_input_tokens_seen": 915860168, "step": 15270, "train_runtime": 196050.4943, "train_tokens_per_second": 4671.552 }, { "epoch": 1.9483418367346939, "grad_norm": 0.6377532593066776, "learning_rate": 1.6533325457485093e-08, "loss": 0.24736628532409669, "num_input_tokens_seen": 916178968, "step": 15275, "train_runtime": 196109.351, "train_tokens_per_second": 4671.776 }, { "epoch": 1.9489795918367347, "grad_norm": 0.6079270441622019, "learning_rate": 1.612882596357057e-08, "loss": 0.2625592231750488, "num_input_tokens_seen": 916474696, "step": 15280, "train_runtime": 196175.2937, "train_tokens_per_second": 4671.713 }, { "epoch": 1.9496173469387754, "grad_norm": 0.7086343688070547, "learning_rate": 1.5729328132452203e-08, "loss": 0.23019585609436036, "num_input_tokens_seen": 916767440, "step": 15285, "train_runtime": 196233.0518, "train_tokens_per_second": 4671.83 }, { "epoch": 1.9502551020408163, "grad_norm": 0.6864295940398258, "learning_rate": 1.533483236505373e-08, "loss": 0.23982906341552734, "num_input_tokens_seen": 917065400, "step": 15290, "train_runtime": 196290.197, "train_tokens_per_second": 4671.988 }, { "epoch": 1.9508928571428572, "grad_norm": 0.8042241709134048, "learning_rate": 1.494533905727902e-08, "loss": 0.24926409721374512, "num_input_tokens_seen": 917347400, "step": 15295, "train_runtime": 196357.3383, "train_tokens_per_second": 4671.826 }, { "epoch": 1.9515306122448979, "grad_norm": 0.6859727032503002, "learning_rate": 1.4560848600012056e-08, "loss": 0.22752974033355713, "num_input_tokens_seen": 917652104, "step": 15300, "train_runtime": 196423.9354, "train_tokens_per_second": 4671.794 }, { "epoch": 1.9521683673469388, "grad_norm": 0.6582219909764592, "learning_rate": 1.4181361379115854e-08, "loss": 0.2244406223297119, "num_input_tokens_seen": 917948512, "step": 15305, "train_runtime": 196486.1865, "train_tokens_per_second": 4671.822 }, { "epoch": 1.9528061224489797, "grad_norm": 0.614642962700177, "learning_rate": 1.3806877775432436e-08, "loss": 0.23401083946228027, "num_input_tokens_seen": 918255864, "step": 15310, "train_runtime": 196553.3965, "train_tokens_per_second": 4671.788 }, { "epoch": 1.9534438775510203, "grad_norm": 0.66017110524275, "learning_rate": 1.3437398164781734e-08, "loss": 0.24059834480285644, "num_input_tokens_seen": 918556096, "step": 15315, "train_runtime": 196611.9627, "train_tokens_per_second": 4671.924 }, { "epoch": 1.9540816326530612, "grad_norm": 0.7409477782750582, "learning_rate": 1.3072922917963249e-08, "loss": 0.2520226001739502, "num_input_tokens_seen": 918838080, "step": 15320, "train_runtime": 196668.993, "train_tokens_per_second": 4672.003 }, { "epoch": 1.9547193877551021, "grad_norm": 0.6710534884970901, "learning_rate": 1.2713452400752724e-08, "loss": 0.23367981910705565, "num_input_tokens_seen": 919142800, "step": 15325, "train_runtime": 196733.5083, "train_tokens_per_second": 4672.02 }, { "epoch": 1.9553571428571428, "grad_norm": 0.6531668013394583, "learning_rate": 1.2358986973903807e-08, "loss": 0.2511638641357422, "num_input_tokens_seen": 919424568, "step": 15330, "train_runtime": 196795.3707, "train_tokens_per_second": 4671.983 }, { "epoch": 1.9559948979591837, "grad_norm": 0.6896304841409016, "learning_rate": 1.2009526993147503e-08, "loss": 0.25591254234313965, "num_input_tokens_seen": 919716328, "step": 15335, "train_runtime": 196859.8654, "train_tokens_per_second": 4671.934 }, { "epoch": 1.9566326530612246, "grad_norm": 0.6822575203236972, "learning_rate": 1.1665072809191602e-08, "loss": 0.2302922487258911, "num_input_tokens_seen": 920002952, "step": 15340, "train_runtime": 196930.711, "train_tokens_per_second": 4671.709 }, { "epoch": 1.9572704081632653, "grad_norm": 0.5860022280306675, "learning_rate": 1.132562476771959e-08, "loss": 0.24354929924011232, "num_input_tokens_seen": 920303216, "step": 15345, "train_runtime": 196991.6172, "train_tokens_per_second": 4671.789 }, { "epoch": 1.9579081632653061, "grad_norm": 0.6499682638962776, "learning_rate": 1.0991183209391188e-08, "loss": 0.24647674560546876, "num_input_tokens_seen": 920605432, "step": 15350, "train_runtime": 197055.1354, "train_tokens_per_second": 4671.816 }, { "epoch": 1.958545918367347, "grad_norm": 0.6286218716370053, "learning_rate": 1.0661748469842359e-08, "loss": 0.25051705837249755, "num_input_tokens_seen": 920908424, "step": 15355, "train_runtime": 197109.8827, "train_tokens_per_second": 4672.056 }, { "epoch": 1.9591836734693877, "grad_norm": 0.6629175399799272, "learning_rate": 1.0337320879683087e-08, "loss": 0.25404863357543944, "num_input_tokens_seen": 921225616, "step": 15360, "train_runtime": 197177.1406, "train_tokens_per_second": 4672.071 }, { "epoch": 1.9598214285714286, "grad_norm": 0.6129552783441397, "learning_rate": 1.0017900764500155e-08, "loss": 0.22357313632965087, "num_input_tokens_seen": 921526472, "step": 15365, "train_runtime": 197245.7374, "train_tokens_per_second": 4671.972 }, { "epoch": 1.9604591836734695, "grad_norm": 0.6482298341541117, "learning_rate": 9.703488444853248e-09, "loss": 0.2499098300933838, "num_input_tokens_seen": 921837576, "step": 15370, "train_runtime": 197306.159, "train_tokens_per_second": 4672.118 }, { "epoch": 1.9610969387755102, "grad_norm": 0.6262291708987566, "learning_rate": 9.39408423627719e-09, "loss": 0.24408447742462158, "num_input_tokens_seen": 922150280, "step": 15375, "train_runtime": 197373.1285, "train_tokens_per_second": 4672.117 }, { "epoch": 1.961734693877551, "grad_norm": 0.6982328131491065, "learning_rate": 9.089688449280265e-09, "loss": 0.2181765079498291, "num_input_tokens_seen": 922423208, "step": 15380, "train_runtime": 197444.0008, "train_tokens_per_second": 4671.822 }, { "epoch": 1.962372448979592, "grad_norm": 0.7360925768701235, "learning_rate": 8.79030138934589e-09, "loss": 0.25997095108032225, "num_input_tokens_seen": 922728704, "step": 15385, "train_runtime": 197508.3757, "train_tokens_per_second": 4671.846 }, { "epoch": 1.9630102040816326, "grad_norm": 0.6554598098231311, "learning_rate": 8.49592335692928e-09, "loss": 0.22874805927276612, "num_input_tokens_seen": 923043512, "step": 15390, "train_runtime": 197575.4255, "train_tokens_per_second": 4671.854 }, { "epoch": 1.9636479591836735, "grad_norm": 0.657567910295264, "learning_rate": 8.206554647459675e-09, "loss": 0.22446055412292482, "num_input_tokens_seen": 923337928, "step": 15395, "train_runtime": 197629.3283, "train_tokens_per_second": 4672.069 }, { "epoch": 1.9642857142857144, "grad_norm": 0.5868118437814902, "learning_rate": 7.922195551338107e-09, "loss": 0.24218473434448243, "num_input_tokens_seen": 923636376, "step": 15400, "train_runtime": 197692.0939, "train_tokens_per_second": 4672.096 }, { "epoch": 1.964923469387755, "grad_norm": 0.6584794701314968, "learning_rate": 7.642846353939637e-09, "loss": 0.25373034477233886, "num_input_tokens_seen": 923946456, "step": 15405, "train_runtime": 197764.7228, "train_tokens_per_second": 4671.948 }, { "epoch": 1.9655612244897958, "grad_norm": 0.6229709246682923, "learning_rate": 7.368507335610009e-09, "loss": 0.22513649463653565, "num_input_tokens_seen": 924260824, "step": 15410, "train_runtime": 197837.2885, "train_tokens_per_second": 4671.823 }, { "epoch": 1.9661989795918369, "grad_norm": 0.6721020512127416, "learning_rate": 7.099178771668436e-09, "loss": 0.24282946586608886, "num_input_tokens_seen": 924556432, "step": 15415, "train_runtime": 197891.742, "train_tokens_per_second": 4672.031 }, { "epoch": 1.9668367346938775, "grad_norm": 0.6566852368029317, "learning_rate": 6.834860932403709e-09, "loss": 0.23992621898651123, "num_input_tokens_seen": 924853080, "step": 15420, "train_runtime": 197956.4709, "train_tokens_per_second": 4672.002 }, { "epoch": 1.9674744897959182, "grad_norm": 0.7169766079391501, "learning_rate": 6.575554083078084e-09, "loss": 0.23851332664489747, "num_input_tokens_seen": 925157776, "step": 15425, "train_runtime": 198025.9657, "train_tokens_per_second": 4671.901 }, { "epoch": 1.9681122448979593, "grad_norm": 0.7219266135535019, "learning_rate": 6.321258483924508e-09, "loss": 0.26246089935302735, "num_input_tokens_seen": 925452872, "step": 15430, "train_runtime": 198096.1079, "train_tokens_per_second": 4671.737 }, { "epoch": 1.96875, "grad_norm": 0.649961248925387, "learning_rate": 6.071974390144953e-09, "loss": 0.24496083259582518, "num_input_tokens_seen": 925750224, "step": 15435, "train_runtime": 198155.8596, "train_tokens_per_second": 4671.829 }, { "epoch": 1.9693877551020407, "grad_norm": 0.6554683356430376, "learning_rate": 5.827702051914852e-09, "loss": 0.23990488052368164, "num_input_tokens_seen": 926041384, "step": 15440, "train_runtime": 198216.2995, "train_tokens_per_second": 4671.873 }, { "epoch": 1.9700255102040818, "grad_norm": 0.654062922493736, "learning_rate": 5.5884417143775574e-09, "loss": 0.22308700084686278, "num_input_tokens_seen": 926329424, "step": 15445, "train_runtime": 198279.4839, "train_tokens_per_second": 4671.837 }, { "epoch": 1.9706632653061225, "grad_norm": 0.6365872097156556, "learning_rate": 5.354193617648218e-09, "loss": 0.24755873680114746, "num_input_tokens_seen": 926628136, "step": 15450, "train_runtime": 198341.7408, "train_tokens_per_second": 4671.877 }, { "epoch": 1.9713010204081631, "grad_norm": 0.7283488730178487, "learning_rate": 5.124957996811009e-09, "loss": 0.23184123039245605, "num_input_tokens_seen": 926921008, "step": 15455, "train_runtime": 198398.5706, "train_tokens_per_second": 4672.015 }, { "epoch": 1.9719387755102042, "grad_norm": 0.6616142170700493, "learning_rate": 4.900735081919128e-09, "loss": 0.24162561893463136, "num_input_tokens_seen": 927227984, "step": 15460, "train_runtime": 198465.786, "train_tokens_per_second": 4671.979 }, { "epoch": 1.972576530612245, "grad_norm": 0.7143983122777157, "learning_rate": 4.6815250979970195e-09, "loss": 0.24975261688232422, "num_input_tokens_seen": 927535288, "step": 15465, "train_runtime": 198535.1702, "train_tokens_per_second": 4671.894 }, { "epoch": 1.9732142857142856, "grad_norm": 0.6474965141272541, "learning_rate": 4.467328265037041e-09, "loss": 0.24119699001312256, "num_input_tokens_seen": 927841632, "step": 15470, "train_runtime": 198597.5761, "train_tokens_per_second": 4671.969 }, { "epoch": 1.9738520408163265, "grad_norm": 0.6285616866725054, "learning_rate": 4.258144798000019e-09, "loss": 0.2362743377685547, "num_input_tokens_seen": 928138384, "step": 15475, "train_runtime": 198654.2027, "train_tokens_per_second": 4672.131 }, { "epoch": 1.9744897959183674, "grad_norm": 0.6901046959151206, "learning_rate": 4.05397490681636e-09, "loss": 0.23540866374969482, "num_input_tokens_seen": 928443960, "step": 15480, "train_runtime": 198723.0405, "train_tokens_per_second": 4672.05 }, { "epoch": 1.975127551020408, "grad_norm": 0.6897354113635594, "learning_rate": 3.854818796385495e-09, "loss": 0.22936525344848632, "num_input_tokens_seen": 928722664, "step": 15485, "train_runtime": 198788.4506, "train_tokens_per_second": 4671.915 }, { "epoch": 1.975765306122449, "grad_norm": 0.5984417283572043, "learning_rate": 3.660676666573659e-09, "loss": 0.24026241302490234, "num_input_tokens_seen": 929023592, "step": 15490, "train_runtime": 198854.1961, "train_tokens_per_second": 4671.883 }, { "epoch": 1.9764030612244898, "grad_norm": 0.6105615965645449, "learning_rate": 3.4715487122161107e-09, "loss": 0.23082895278930665, "num_input_tokens_seen": 929326440, "step": 15495, "train_runtime": 198922.1289, "train_tokens_per_second": 4671.81 }, { "epoch": 1.9770408163265305, "grad_norm": 0.6720123345499762, "learning_rate": 3.287435123116578e-09, "loss": 0.2418750286102295, "num_input_tokens_seen": 929634512, "step": 15500, "train_runtime": 198989.5209, "train_tokens_per_second": 4671.776 }, { "epoch": 1.9776785714285714, "grad_norm": 0.5643089157852808, "learning_rate": 3.1083360840455935e-09, "loss": 0.24054617881774903, "num_input_tokens_seen": 929938048, "step": 15505, "train_runtime": 199054.5814, "train_tokens_per_second": 4671.774 }, { "epoch": 1.9783163265306123, "grad_norm": 0.6910800941279635, "learning_rate": 2.9342517747410482e-09, "loss": 0.2343662738800049, "num_input_tokens_seen": 930244016, "step": 15510, "train_runtime": 199122.538, "train_tokens_per_second": 4671.716 }, { "epoch": 1.978954081632653, "grad_norm": 0.8194130967587886, "learning_rate": 2.7651823699093027e-09, "loss": 0.25220522880554197, "num_input_tokens_seen": 930548096, "step": 15515, "train_runtime": 199182.2168, "train_tokens_per_second": 4671.843 }, { "epoch": 1.9795918367346939, "grad_norm": 0.6444734667559321, "learning_rate": 2.6011280392235215e-09, "loss": 0.24388303756713867, "num_input_tokens_seen": 930848856, "step": 15520, "train_runtime": 199241.7599, "train_tokens_per_second": 4671.957 }, { "epoch": 1.9802295918367347, "grad_norm": 0.6709665440148682, "learning_rate": 2.442088947323118e-09, "loss": 0.24142193794250488, "num_input_tokens_seen": 931124408, "step": 15525, "train_runtime": 199304.9027, "train_tokens_per_second": 4671.859 }, { "epoch": 1.9808673469387754, "grad_norm": 0.7106841627245938, "learning_rate": 2.288065253814864e-09, "loss": 0.2382129669189453, "num_input_tokens_seen": 931429872, "step": 15530, "train_runtime": 199369.6505, "train_tokens_per_second": 4671.874 }, { "epoch": 1.9815051020408163, "grad_norm": 0.6747427447210661, "learning_rate": 2.139057113272891e-09, "loss": 0.24044766426086425, "num_input_tokens_seen": 931723432, "step": 15535, "train_runtime": 199434.3705, "train_tokens_per_second": 4671.83 }, { "epoch": 1.9821428571428572, "grad_norm": 0.6645292262642306, "learning_rate": 1.995064675237024e-09, "loss": 0.23690540790557862, "num_input_tokens_seen": 932015016, "step": 15540, "train_runtime": 199495.9766, "train_tokens_per_second": 4671.849 }, { "epoch": 1.9827806122448979, "grad_norm": 0.6428403076400457, "learning_rate": 1.8560880842133366e-09, "loss": 0.2564822196960449, "num_input_tokens_seen": 932321664, "step": 15545, "train_runtime": 199561.703, "train_tokens_per_second": 4671.847 }, { "epoch": 1.9834183673469388, "grad_norm": 0.6590699643792678, "learning_rate": 1.7221274796752618e-09, "loss": 0.24346504211425782, "num_input_tokens_seen": 932613040, "step": 15550, "train_runtime": 199626.3384, "train_tokens_per_second": 4671.794 }, { "epoch": 1.9840561224489797, "grad_norm": 0.5929330109388921, "learning_rate": 1.5931829960608158e-09, "loss": 0.21612107753753662, "num_input_tokens_seen": 932901632, "step": 15555, "train_runtime": 199691.1884, "train_tokens_per_second": 4671.722 }, { "epoch": 1.9846938775510203, "grad_norm": 0.6927753327683915, "learning_rate": 1.469254762775374e-09, "loss": 0.23641691207885743, "num_input_tokens_seen": 933200712, "step": 15560, "train_runtime": 199762.3402, "train_tokens_per_second": 4671.555 }, { "epoch": 1.9853316326530612, "grad_norm": 0.8471620771249144, "learning_rate": 1.350342904188895e-09, "loss": 0.22833261489868165, "num_input_tokens_seen": 933486000, "step": 15565, "train_runtime": 199831.7859, "train_tokens_per_second": 4671.359 }, { "epoch": 1.9859693877551021, "grad_norm": 0.6521928183363583, "learning_rate": 1.2364475396386966e-09, "loss": 0.24839613437652588, "num_input_tokens_seen": 933799240, "step": 15570, "train_runtime": 199899.9354, "train_tokens_per_second": 4671.333 }, { "epoch": 1.9866071428571428, "grad_norm": 0.5994256520871023, "learning_rate": 1.1275687834266803e-09, "loss": 0.24686167240142823, "num_input_tokens_seen": 934119000, "step": 15575, "train_runtime": 199961.015, "train_tokens_per_second": 4671.506 }, { "epoch": 1.9872448979591837, "grad_norm": 0.6513508678236617, "learning_rate": 1.0237067448193306e-09, "loss": 0.23922209739685057, "num_input_tokens_seen": 934422016, "step": 15580, "train_runtime": 200036.8427, "train_tokens_per_second": 4671.25 }, { "epoch": 1.9878826530612246, "grad_norm": 0.7236862794639907, "learning_rate": 9.248615280499362e-10, "loss": 0.2451181411743164, "num_input_tokens_seen": 934722472, "step": 15585, "train_runtime": 200094.6839, "train_tokens_per_second": 4671.401 }, { "epoch": 1.9885204081632653, "grad_norm": 0.6585262786305752, "learning_rate": 8.310332323169246e-10, "loss": 0.22677361965179443, "num_input_tokens_seen": 935021672, "step": 15590, "train_runtime": 200164.9187, "train_tokens_per_second": 4671.256 }, { "epoch": 1.9891581632653061, "grad_norm": 0.6565613266627721, "learning_rate": 7.422219517833062e-10, "loss": 0.21729130744934083, "num_input_tokens_seen": 935339160, "step": 15595, "train_runtime": 200217.336, "train_tokens_per_second": 4671.619 }, { "epoch": 1.989795918367347, "grad_norm": 0.6493386512660779, "learning_rate": 6.584277755772306e-10, "loss": 0.21915626525878906, "num_input_tokens_seen": 935637120, "step": 15600, "train_runtime": 200282.4262, "train_tokens_per_second": 4671.589 }, { "epoch": 1.9904336734693877, "grad_norm": 0.7134473120100414, "learning_rate": 5.796507877919855e-10, "loss": 0.2331714153289795, "num_input_tokens_seen": 935934880, "step": 15605, "train_runtime": 200347.2233, "train_tokens_per_second": 4671.564 }, { "epoch": 1.9910714285714286, "grad_norm": 0.6361365769395474, "learning_rate": 5.058910674859973e-10, "loss": 0.22351865768432616, "num_input_tokens_seen": 936237184, "step": 15610, "train_runtime": 200410.6136, "train_tokens_per_second": 4671.595 }, { "epoch": 1.9917091836734695, "grad_norm": 0.64839750830652, "learning_rate": 4.371486886822762e-10, "loss": 0.2331063985824585, "num_input_tokens_seen": 936513656, "step": 15615, "train_runtime": 200465.0828, "train_tokens_per_second": 4671.705 }, { "epoch": 1.9923469387755102, "grad_norm": 0.7466120551652838, "learning_rate": 3.7342372036841546e-10, "loss": 0.232620906829834, "num_input_tokens_seen": 936814896, "step": 15620, "train_runtime": 200522.7778, "train_tokens_per_second": 4671.863 }, { "epoch": 1.992984693877551, "grad_norm": 0.6860694105968212, "learning_rate": 3.147162264971471e-10, "loss": 0.2312720537185669, "num_input_tokens_seen": 937107704, "step": 15625, "train_runtime": 200584.4207, "train_tokens_per_second": 4671.887 }, { "epoch": 1.993622448979592, "grad_norm": 0.6889309531395138, "learning_rate": 2.610262659852314e-10, "loss": 0.22203030586242675, "num_input_tokens_seen": 937400936, "step": 15630, "train_runtime": 200641.7539, "train_tokens_per_second": 4672.013 }, { "epoch": 1.9942602040816326, "grad_norm": 0.7258747239264295, "learning_rate": 2.123538927145674e-10, "loss": 0.2579025745391846, "num_input_tokens_seen": 937697776, "step": 15635, "train_runtime": 200702.7711, "train_tokens_per_second": 4672.072 }, { "epoch": 1.9948979591836735, "grad_norm": 0.7542805069702584, "learning_rate": 1.686991555310824e-10, "loss": 0.23705878257751464, "num_input_tokens_seen": 937980704, "step": 15640, "train_runtime": 200765.3389, "train_tokens_per_second": 4672.025 }, { "epoch": 1.9955357142857144, "grad_norm": 0.708619693440659, "learning_rate": 1.3006209824584226e-10, "loss": 0.22812957763671876, "num_input_tokens_seen": 938273128, "step": 15645, "train_runtime": 200836.7758, "train_tokens_per_second": 4671.819 }, { "epoch": 1.996173469387755, "grad_norm": 0.6945117523175717, "learning_rate": 9.6442759632831e-11, "loss": 0.24734277725219728, "num_input_tokens_seen": 938574952, "step": 15650, "train_runtime": 200899.4054, "train_tokens_per_second": 4671.865 }, { "epoch": 1.9968112244897958, "grad_norm": 0.6905716380218004, "learning_rate": 6.784117343228147e-11, "loss": 0.2404686689376831, "num_input_tokens_seen": 938879584, "step": 15655, "train_runtime": 200966.372, "train_tokens_per_second": 4671.824 }, { "epoch": 1.9974489795918369, "grad_norm": 0.6406483668769022, "learning_rate": 4.425736834789973e-11, "loss": 0.2283982515335083, "num_input_tokens_seen": 939182000, "step": 15660, "train_runtime": 201029.3363, "train_tokens_per_second": 4671.865 }, { "epoch": 1.9980867346938775, "grad_norm": 0.598588173441811, "learning_rate": 2.5691368046865118e-11, "loss": 0.2239130973815918, "num_input_tokens_seen": 939491240, "step": 15665, "train_runtime": 201084.494, "train_tokens_per_second": 4672.122 }, { "epoch": 1.9987244897959182, "grad_norm": 0.6020425993622818, "learning_rate": 1.214319116260576e-11, "loss": 0.23047285079956054, "num_input_tokens_seen": 939787104, "step": 15670, "train_runtime": 201150.2888, "train_tokens_per_second": 4672.064 }, { "epoch": 1.9993622448979593, "grad_norm": 0.6049905153503449, "learning_rate": 3.6128512903577105e-12, "loss": 0.24902353286743165, "num_input_tokens_seen": 940079408, "step": 15675, "train_runtime": 201220.7949, "train_tokens_per_second": 4671.88 }, { "epoch": 2.0, "grad_norm": 0.6681944838914244, "learning_rate": 1.0035699216093265e-13, "loss": 0.24981300830841063, "num_input_tokens_seen": 940386304, "step": 15680, "train_runtime": 201279.4867, "train_tokens_per_second": 4672.042 }, { "epoch": 2.0, "num_input_tokens_seen": 940386304, "step": 15680, "total_flos": 1739097771048960.0, "train_loss": 0.28079748448668695, "train_runtime": 201315.0101, "train_samples_per_second": 0.312, "train_steps_per_second": 0.078 } ], "logging_steps": 5, "max_steps": 15680, "num_input_tokens_seen": 940386304, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1739097771048960.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }