{ "best_global_step": 45000, "best_metric": 1.0206714868545532, "best_model_checkpoint": "/workspace/MT_Multilingual_En/checkpoint-45000", "epoch": 3.0, "eval_steps": 5000, "global_step": 84789, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0003538202637287791, "grad_norm": 3.90625, "learning_rate": 4.9977515176118345e-05, "loss": 2.4129154205322267, "num_input_tokens_seen": 2861504, "step": 10, "train_runtime": 107.8109, "train_tokens_per_second": 26541.883 }, { "epoch": 0.0007076405274575581, "grad_norm": 2.21875, "learning_rate": 4.9952567580506e-05, "loss": 1.739237403869629, "num_input_tokens_seen": 5659264, "step": 20, "train_runtime": 201.23, "train_tokens_per_second": 28123.361 }, { "epoch": 0.0010614607911863373, "grad_norm": 2.21875, "learning_rate": 4.992765730738634e-05, "loss": 1.6574527740478515, "num_input_tokens_seen": 8484416, "step": 30, "train_runtime": 300.0843, "train_tokens_per_second": 28273.445 }, { "epoch": 0.0014152810549151163, "grad_norm": 1.9140625, "learning_rate": 4.9902784263792476e-05, "loss": 1.6026153564453125, "num_input_tokens_seen": 11342464, "step": 40, "train_runtime": 397.2987, "train_tokens_per_second": 28548.959 }, { "epoch": 0.0017691013186438955, "grad_norm": 1.9921875, "learning_rate": 4.987794835708133e-05, "loss": 1.578458309173584, "num_input_tokens_seen": 14208000, "step": 50, "train_runtime": 495.7456, "train_tokens_per_second": 28659.86 }, { "epoch": 0.0021229215823726747, "grad_norm": 2.0625, "learning_rate": 4.985314949493234e-05, "loss": 1.5477357864379884, "num_input_tokens_seen": 17070848, "step": 60, "train_runtime": 593.7889, "train_tokens_per_second": 28749.017 }, { "epoch": 0.0024767418461014534, "grad_norm": 1.8515625, "learning_rate": 4.982838758534584e-05, "loss": 1.5277509689331055, "num_input_tokens_seen": 19876352, "step": 70, "train_runtime": 688.806, "train_tokens_per_second": 28856.24 }, { "epoch": 0.0028305621098302326, "grad_norm": 1.953125, "learning_rate": 4.980366253664179e-05, "loss": 1.5297769546508788, "num_input_tokens_seen": 22738816, "step": 80, "train_runtime": 787.0004, "train_tokens_per_second": 28893.017 }, { "epoch": 0.0031843823735590118, "grad_norm": 1.8671875, "learning_rate": 4.977897425745825e-05, "loss": 1.513206386566162, "num_input_tokens_seen": 25550720, "step": 90, "train_runtime": 885.1696, "train_tokens_per_second": 28865.337 }, { "epoch": 0.003538202637287791, "grad_norm": 2.015625, "learning_rate": 4.975432265674997e-05, "loss": 1.5171786308288575, "num_input_tokens_seen": 28315520, "step": 100, "train_runtime": 980.0312, "train_tokens_per_second": 28892.468 }, { "epoch": 0.0038920229010165697, "grad_norm": 1.7421875, "learning_rate": 4.972970764378705e-05, "loss": 1.4735165596008302, "num_input_tokens_seen": 31176512, "step": 110, "train_runtime": 1078.185, "train_tokens_per_second": 28915.734 }, { "epoch": 0.004245843164745349, "grad_norm": 1.78125, "learning_rate": 4.970512912815344e-05, "loss": 1.4906696319580077, "num_input_tokens_seen": 34090624, "step": 120, "train_runtime": 1181.1928, "train_tokens_per_second": 28861.184 }, { "epoch": 0.004599663428474128, "grad_norm": 1.7265625, "learning_rate": 4.968058701974564e-05, "loss": 1.4680511474609375, "num_input_tokens_seen": 36877632, "step": 130, "train_runtime": 1275.3019, "train_tokens_per_second": 28916.785 }, { "epoch": 0.004953483692202907, "grad_norm": 1.8203125, "learning_rate": 4.96560812287712e-05, "loss": 1.4557507514953614, "num_input_tokens_seen": 39719808, "step": 140, "train_runtime": 1374.6852, "train_tokens_per_second": 28893.748 }, { "epoch": 0.005307303955931686, "grad_norm": 1.7578125, "learning_rate": 4.963161166574748e-05, "loss": 1.4658089637756349, "num_input_tokens_seen": 42594048, "step": 150, "train_runtime": 1474.8059, "train_tokens_per_second": 28881.121 }, { "epoch": 0.005661124219660465, "grad_norm": 1.7109375, "learning_rate": 4.960717824150013e-05, "loss": 1.4383573532104492, "num_input_tokens_seen": 45422080, "step": 160, "train_runtime": 1569.9766, "train_tokens_per_second": 28931.692 }, { "epoch": 0.006014944483389244, "grad_norm": 1.8359375, "learning_rate": 4.9582780867161893e-05, "loss": 1.4379766464233399, "num_input_tokens_seen": 48225408, "step": 170, "train_runtime": 1664.588, "train_tokens_per_second": 28971.378 }, { "epoch": 0.0063687647471180235, "grad_norm": 1.71875, "learning_rate": 4.955841945417105e-05, "loss": 1.4336433410644531, "num_input_tokens_seen": 51081536, "step": 180, "train_runtime": 1760.7339, "train_tokens_per_second": 29011.503 }, { "epoch": 0.006722585010846802, "grad_norm": 1.8125, "learning_rate": 4.953409391427024e-05, "loss": 1.4460283279418946, "num_input_tokens_seen": 53934336, "step": 190, "train_runtime": 1859.4849, "train_tokens_per_second": 29004.988 }, { "epoch": 0.007076405274575582, "grad_norm": 1.78125, "learning_rate": 4.950980415950502e-05, "loss": 1.434066390991211, "num_input_tokens_seen": 56792576, "step": 200, "train_runtime": 1958.0115, "train_tokens_per_second": 29005.231 }, { "epoch": 0.007430225538304361, "grad_norm": 1.703125, "learning_rate": 4.9485550102222575e-05, "loss": 1.427436637878418, "num_input_tokens_seen": 59683840, "step": 210, "train_runtime": 2057.4491, "train_tokens_per_second": 29008.66 }, { "epoch": 0.007784045802033139, "grad_norm": 1.7109375, "learning_rate": 4.946133165507037e-05, "loss": 1.4229135513305664, "num_input_tokens_seen": 62532608, "step": 220, "train_runtime": 2156.0527, "train_tokens_per_second": 29003.284 }, { "epoch": 0.008137866065761919, "grad_norm": 1.828125, "learning_rate": 4.943714873099483e-05, "loss": 1.4132097244262696, "num_input_tokens_seen": 65382784, "step": 230, "train_runtime": 2253.0986, "train_tokens_per_second": 29019.051 }, { "epoch": 0.008491686329490699, "grad_norm": 1.7421875, "learning_rate": 4.9413001243240024e-05, "loss": 1.418577003479004, "num_input_tokens_seen": 68271488, "step": 240, "train_runtime": 2348.6142, "train_tokens_per_second": 29068.84 }, { "epoch": 0.008845506593219477, "grad_norm": 1.5703125, "learning_rate": 4.938888910534637e-05, "loss": 1.398007583618164, "num_input_tokens_seen": 71153984, "step": 250, "train_runtime": 2447.896, "train_tokens_per_second": 29067.404 }, { "epoch": 0.009199326856948256, "grad_norm": 1.765625, "learning_rate": 4.936481223114932e-05, "loss": 1.4049840927124024, "num_input_tokens_seen": 73939776, "step": 260, "train_runtime": 2544.5168, "train_tokens_per_second": 29058.475 }, { "epoch": 0.009553147120677036, "grad_norm": 1.71875, "learning_rate": 4.934077053477808e-05, "loss": 1.3924064636230469, "num_input_tokens_seen": 76772352, "step": 270, "train_runtime": 2644.1424, "train_tokens_per_second": 29034.878 }, { "epoch": 0.009906967384405814, "grad_norm": 1.7265625, "learning_rate": 4.931676393065431e-05, "loss": 1.390452766418457, "num_input_tokens_seen": 79604032, "step": 280, "train_runtime": 2743.373, "train_tokens_per_second": 29016.846 }, { "epoch": 0.010260787648134593, "grad_norm": 1.671875, "learning_rate": 4.929279233349088e-05, "loss": 1.3796944618225098, "num_input_tokens_seen": 82418560, "step": 290, "train_runtime": 2838.2774, "train_tokens_per_second": 29038.233 }, { "epoch": 0.010614607911863373, "grad_norm": 1.640625, "learning_rate": 4.926885565829051e-05, "loss": 1.385779857635498, "num_input_tokens_seen": 85216128, "step": 300, "train_runtime": 2929.6, "train_tokens_per_second": 29087.974 }, { "epoch": 0.01096842817559215, "grad_norm": 1.6796875, "learning_rate": 4.924495382034461e-05, "loss": 1.3861013412475587, "num_input_tokens_seen": 88064064, "step": 310, "train_runtime": 3028.0671, "train_tokens_per_second": 29082.599 }, { "epoch": 0.01132224843932093, "grad_norm": 1.671875, "learning_rate": 4.9221086735231975e-05, "loss": 1.3745354652404784, "num_input_tokens_seen": 90948800, "step": 320, "train_runtime": 3125.891, "train_tokens_per_second": 29095.32 }, { "epoch": 0.01167606870304971, "grad_norm": 1.7265625, "learning_rate": 4.919725431881751e-05, "loss": 1.3837973594665527, "num_input_tokens_seen": 93845760, "step": 330, "train_runtime": 3224.7228, "train_tokens_per_second": 29101.962 }, { "epoch": 0.012029888966778488, "grad_norm": 1.7109375, "learning_rate": 4.917345648725101e-05, "loss": 1.3645482063293457, "num_input_tokens_seen": 96686912, "step": 340, "train_runtime": 3321.4064, "train_tokens_per_second": 29110.232 }, { "epoch": 0.012383709230507267, "grad_norm": 1.609375, "learning_rate": 4.914969315696596e-05, "loss": 1.359701156616211, "num_input_tokens_seen": 99527552, "step": 350, "train_runtime": 3418.69, "train_tokens_per_second": 29112.774 }, { "epoch": 0.012737529494236047, "grad_norm": 1.640625, "learning_rate": 4.912596424467818e-05, "loss": 1.3707971572875977, "num_input_tokens_seen": 102450560, "step": 360, "train_runtime": 3518.6186, "train_tokens_per_second": 29116.7 }, { "epoch": 0.013091349757964827, "grad_norm": 1.609375, "learning_rate": 4.910226966738475e-05, "loss": 1.3824318885803222, "num_input_tokens_seen": 105327808, "step": 370, "train_runtime": 3616.6336, "train_tokens_per_second": 29123.163 }, { "epoch": 0.013445170021693605, "grad_norm": 1.5859375, "learning_rate": 4.9078609342362666e-05, "loss": 1.3800084114074707, "num_input_tokens_seen": 108158336, "step": 380, "train_runtime": 3713.0293, "train_tokens_per_second": 29129.405 }, { "epoch": 0.013798990285422384, "grad_norm": 1.71875, "learning_rate": 4.905498318716775e-05, "loss": 1.3636469841003418, "num_input_tokens_seen": 111012864, "step": 390, "train_runtime": 3811.3416, "train_tokens_per_second": 29126.978 }, { "epoch": 0.014152810549151164, "grad_norm": 1.6484375, "learning_rate": 4.9031391119633295e-05, "loss": 1.3595507621765137, "num_input_tokens_seen": 113838336, "step": 400, "train_runtime": 3907.2664, "train_tokens_per_second": 29135.033 }, { "epoch": 0.014506630812879942, "grad_norm": 1.6484375, "learning_rate": 4.9007833057869e-05, "loss": 1.351626205444336, "num_input_tokens_seen": 116627008, "step": 410, "train_runtime": 4002.2816, "train_tokens_per_second": 29140.13 }, { "epoch": 0.014860451076608721, "grad_norm": 1.671875, "learning_rate": 4.898430892025967e-05, "loss": 1.3616992950439453, "num_input_tokens_seen": 119470080, "step": 420, "train_runtime": 4103.089, "train_tokens_per_second": 29117.107 }, { "epoch": 0.015214271340337501, "grad_norm": 1.6484375, "learning_rate": 4.896081862546415e-05, "loss": 1.3449151992797852, "num_input_tokens_seen": 122313024, "step": 430, "train_runtime": 4200.2387, "train_tokens_per_second": 29120.494 }, { "epoch": 0.015568091604066279, "grad_norm": 1.59375, "learning_rate": 4.8937362092414e-05, "loss": 1.3649165153503418, "num_input_tokens_seen": 125125248, "step": 440, "train_runtime": 4293.6594, "train_tokens_per_second": 29141.866 }, { "epoch": 0.01592191186779506, "grad_norm": 1.671875, "learning_rate": 4.891393924031244e-05, "loss": 1.3540953636169433, "num_input_tokens_seen": 127990208, "step": 450, "train_runtime": 4391.8149, "train_tokens_per_second": 29142.897 }, { "epoch": 0.016275732131523838, "grad_norm": 1.6328125, "learning_rate": 4.8890549988633095e-05, "loss": 1.3574003219604491, "num_input_tokens_seen": 130801600, "step": 460, "train_runtime": 4485.1091, "train_tokens_per_second": 29163.527 }, { "epoch": 0.016629552395252618, "grad_norm": 1.6875, "learning_rate": 4.8867194257118907e-05, "loss": 1.3498289108276367, "num_input_tokens_seen": 133635712, "step": 470, "train_runtime": 4584.3761, "train_tokens_per_second": 29150.251 }, { "epoch": 0.016983372658981397, "grad_norm": 1.6171875, "learning_rate": 4.884387196578093e-05, "loss": 1.3534079551696778, "num_input_tokens_seen": 136496704, "step": 480, "train_runtime": 4682.6935, "train_tokens_per_second": 29149.186 }, { "epoch": 0.017337192922710173, "grad_norm": 1.609375, "learning_rate": 4.882058303489718e-05, "loss": 1.3462406158447267, "num_input_tokens_seen": 139289984, "step": 490, "train_runtime": 4774.9382, "train_tokens_per_second": 29171.055 }, { "epoch": 0.017691013186438953, "grad_norm": 1.53125, "learning_rate": 4.8797327385011496e-05, "loss": 1.3408540725708007, "num_input_tokens_seen": 142138496, "step": 500, "train_runtime": 4869.0303, "train_tokens_per_second": 29192.362 }, { "epoch": 0.018044833450167733, "grad_norm": 1.5859375, "learning_rate": 4.8774104936932425e-05, "loss": 1.3498264312744142, "num_input_tokens_seen": 144959360, "step": 510, "train_runtime": 4965.0448, "train_tokens_per_second": 29195.982 }, { "epoch": 0.018398653713896512, "grad_norm": 1.640625, "learning_rate": 4.8750915611732076e-05, "loss": 1.3357254028320313, "num_input_tokens_seen": 147701312, "step": 520, "train_runtime": 5054.7796, "train_tokens_per_second": 29220.129 }, { "epoch": 0.018752473977625292, "grad_norm": 1.515625, "learning_rate": 4.8727759330744986e-05, "loss": 1.347636890411377, "num_input_tokens_seen": 150572416, "step": 530, "train_runtime": 5154.9794, "train_tokens_per_second": 29209.121 }, { "epoch": 0.01910629424135407, "grad_norm": 1.59375, "learning_rate": 4.870463601556696e-05, "loss": 1.3421825408935546, "num_input_tokens_seen": 153366080, "step": 540, "train_runtime": 5249.816, "train_tokens_per_second": 29213.611 }, { "epoch": 0.019460114505082848, "grad_norm": 1.5703125, "learning_rate": 4.8681545588054075e-05, "loss": 1.3426931381225586, "num_input_tokens_seen": 156225920, "step": 550, "train_runtime": 5351.1457, "train_tokens_per_second": 29194.855 }, { "epoch": 0.019813934768811627, "grad_norm": 1.5234375, "learning_rate": 4.8658487970321404e-05, "loss": 1.3237018585205078, "num_input_tokens_seen": 159087552, "step": 560, "train_runtime": 5450.9745, "train_tokens_per_second": 29185.158 }, { "epoch": 0.020167755032540407, "grad_norm": 1.546875, "learning_rate": 4.863546308474209e-05, "loss": 1.3331922531127929, "num_input_tokens_seen": 161982784, "step": 570, "train_runtime": 5553.0448, "train_tokens_per_second": 29170.084 }, { "epoch": 0.020521575296269187, "grad_norm": 1.5546875, "learning_rate": 4.86124708539461e-05, "loss": 1.3306333541870117, "num_input_tokens_seen": 164782400, "step": 580, "train_runtime": 5649.7766, "train_tokens_per_second": 29166.18 }, { "epoch": 0.020875395559997966, "grad_norm": 1.625, "learning_rate": 4.8589511200819216e-05, "loss": 1.3231840133666992, "num_input_tokens_seen": 167594880, "step": 590, "train_runtime": 5742.5619, "train_tokens_per_second": 29184.689 }, { "epoch": 0.021229215823726746, "grad_norm": 1.5234375, "learning_rate": 4.8566584048501926e-05, "loss": 1.3181431770324707, "num_input_tokens_seen": 170407296, "step": 600, "train_runtime": 5838.5945, "train_tokens_per_second": 29186.356 }, { "epoch": 0.021583036087455525, "grad_norm": 1.515625, "learning_rate": 4.854368932038835e-05, "loss": 1.3116433143615722, "num_input_tokens_seen": 173246784, "step": 610, "train_runtime": 5935.3768, "train_tokens_per_second": 29188.843 }, { "epoch": 0.0219368563511843, "grad_norm": 1.6875, "learning_rate": 4.8520826940125144e-05, "loss": 1.3395931243896484, "num_input_tokens_seen": 176162112, "step": 620, "train_runtime": 6036.5162, "train_tokens_per_second": 29182.745 }, { "epoch": 0.02229067661491308, "grad_norm": 1.6484375, "learning_rate": 4.849799683161046e-05, "loss": 1.3172121047973633, "num_input_tokens_seen": 179001984, "step": 630, "train_runtime": 6132.0013, "train_tokens_per_second": 29191.446 }, { "epoch": 0.02264449687864186, "grad_norm": 1.671875, "learning_rate": 4.8475198918992835e-05, "loss": 1.3434142112731933, "num_input_tokens_seen": 181931712, "step": 640, "train_runtime": 6233.6083, "train_tokens_per_second": 29185.618 }, { "epoch": 0.02299831714237064, "grad_norm": 1.5546875, "learning_rate": 4.845243312667023e-05, "loss": 1.3180923461914062, "num_input_tokens_seen": 184767872, "step": 650, "train_runtime": 6331.407, "train_tokens_per_second": 29182.751 }, { "epoch": 0.02335213740609942, "grad_norm": 1.5390625, "learning_rate": 4.842969937928884e-05, "loss": 1.3221427917480468, "num_input_tokens_seen": 187563008, "step": 660, "train_runtime": 6426.4829, "train_tokens_per_second": 29185.95 }, { "epoch": 0.0237059576698282, "grad_norm": 1.4765625, "learning_rate": 4.840699760174217e-05, "loss": 1.3036195755004882, "num_input_tokens_seen": 190415872, "step": 670, "train_runtime": 6523.0256, "train_tokens_per_second": 29191.342 }, { "epoch": 0.024059777933556976, "grad_norm": 1.5390625, "learning_rate": 4.8384327719169906e-05, "loss": 1.3122371673583983, "num_input_tokens_seen": 193276160, "step": 680, "train_runtime": 6618.4252, "train_tokens_per_second": 29202.741 }, { "epoch": 0.024413598197285755, "grad_norm": 1.5078125, "learning_rate": 4.836168965695694e-05, "loss": 1.3263204574584961, "num_input_tokens_seen": 196100352, "step": 690, "train_runtime": 6715.4217, "train_tokens_per_second": 29201.495 }, { "epoch": 0.024767418461014535, "grad_norm": 1.515625, "learning_rate": 4.8339083340732304e-05, "loss": 1.315943717956543, "num_input_tokens_seen": 198917632, "step": 700, "train_runtime": 6812.0588, "train_tokens_per_second": 29200.81 }, { "epoch": 0.025121238724743315, "grad_norm": 1.4765625, "learning_rate": 4.8316508696368154e-05, "loss": 1.3086830139160157, "num_input_tokens_seen": 201755584, "step": 710, "train_runtime": 6908.1598, "train_tokens_per_second": 29205.402 }, { "epoch": 0.025475058988472094, "grad_norm": 1.578125, "learning_rate": 4.8293965649978714e-05, "loss": 1.3209542274475097, "num_input_tokens_seen": 204637376, "step": 720, "train_runtime": 7009.7956, "train_tokens_per_second": 29193.059 }, { "epoch": 0.025828879252200874, "grad_norm": 1.578125, "learning_rate": 4.8271454127919364e-05, "loss": 1.317988395690918, "num_input_tokens_seen": 207481920, "step": 730, "train_runtime": 7105.0533, "train_tokens_per_second": 29202.021 }, { "epoch": 0.026182699515929653, "grad_norm": 1.53125, "learning_rate": 4.824897405678549e-05, "loss": 1.3196215629577637, "num_input_tokens_seen": 210324480, "step": 740, "train_runtime": 7204.7059, "train_tokens_per_second": 29192.653 }, { "epoch": 0.02653651977965843, "grad_norm": 1.53125, "learning_rate": 4.8226525363411576e-05, "loss": 1.3075403213500976, "num_input_tokens_seen": 213174656, "step": 750, "train_runtime": 7301.4456, "train_tokens_per_second": 29196.226 }, { "epoch": 0.02689034004338721, "grad_norm": 1.53125, "learning_rate": 4.820410797487017e-05, "loss": 1.3020206451416017, "num_input_tokens_seen": 216051136, "step": 760, "train_runtime": 7402.0411, "train_tokens_per_second": 29188.049 }, { "epoch": 0.02724416030711599, "grad_norm": 1.5234375, "learning_rate": 4.818172181847091e-05, "loss": 1.308267879486084, "num_input_tokens_seen": 218912640, "step": 770, "train_runtime": 7500.902, "train_tokens_per_second": 29184.842 }, { "epoch": 0.02759798057084477, "grad_norm": 1.53125, "learning_rate": 4.81593668217595e-05, "loss": 1.3149566650390625, "num_input_tokens_seen": 221661120, "step": 780, "train_runtime": 7591.8409, "train_tokens_per_second": 29197.282 }, { "epoch": 0.027951800834573548, "grad_norm": 1.59375, "learning_rate": 4.813704291251675e-05, "loss": 1.3037477493286134, "num_input_tokens_seen": 224521408, "step": 790, "train_runtime": 7686.6362, "train_tokens_per_second": 29209.319 }, { "epoch": 0.028305621098302328, "grad_norm": 1.59375, "learning_rate": 4.811475001875759e-05, "loss": 1.2903422355651855, "num_input_tokens_seen": 227384512, "step": 800, "train_runtime": 7786.7451, "train_tokens_per_second": 29201.484 }, { "epoch": 0.028659441362031104, "grad_norm": 1.4765625, "learning_rate": 4.8092488068730105e-05, "loss": 1.2953707695007324, "num_input_tokens_seen": 230168128, "step": 810, "train_runtime": 7881.5661, "train_tokens_per_second": 29203.349 }, { "epoch": 0.029013261625759883, "grad_norm": 1.5390625, "learning_rate": 4.807025699091452e-05, "loss": 1.3137131690979005, "num_input_tokens_seen": 233010944, "step": 820, "train_runtime": 7980.0157, "train_tokens_per_second": 29199.309 }, { "epoch": 0.029367081889488663, "grad_norm": 1.5703125, "learning_rate": 4.8048056714022325e-05, "loss": 1.2995559692382812, "num_input_tokens_seen": 235868608, "step": 830, "train_runtime": 8081.6458, "train_tokens_per_second": 29185.715 }, { "epoch": 0.029720902153217443, "grad_norm": 1.46875, "learning_rate": 4.802588716699519e-05, "loss": 1.299889373779297, "num_input_tokens_seen": 238670976, "step": 840, "train_runtime": 8177.168, "train_tokens_per_second": 29187.486 }, { "epoch": 0.030074722416946222, "grad_norm": 1.5234375, "learning_rate": 4.8003748279004156e-05, "loss": 1.307916259765625, "num_input_tokens_seen": 241592064, "step": 850, "train_runtime": 8279.211, "train_tokens_per_second": 29180.566 }, { "epoch": 0.030428542680675002, "grad_norm": 1.46875, "learning_rate": 4.798163997944854e-05, "loss": 1.2924917221069336, "num_input_tokens_seen": 244417792, "step": 860, "train_runtime": 8372.8013, "train_tokens_per_second": 29191.878 }, { "epoch": 0.030782362944403778, "grad_norm": 1.484375, "learning_rate": 4.79595621979551e-05, "loss": 1.3086358070373536, "num_input_tokens_seen": 247252096, "step": 870, "train_runtime": 8469.2832, "train_tokens_per_second": 29193.981 }, { "epoch": 0.031136183208132558, "grad_norm": 1.484375, "learning_rate": 4.793751486437702e-05, "loss": 1.2793291091918946, "num_input_tokens_seen": 250084480, "step": 880, "train_runtime": 8565.5624, "train_tokens_per_second": 29196.505 }, { "epoch": 0.03149000347186134, "grad_norm": 1.484375, "learning_rate": 4.7915497908793064e-05, "loss": 1.2936951637268066, "num_input_tokens_seen": 252907136, "step": 890, "train_runtime": 8663.0229, "train_tokens_per_second": 29193.867 }, { "epoch": 0.03184382373559012, "grad_norm": 1.4921875, "learning_rate": 4.7893511261506516e-05, "loss": 1.2788345336914062, "num_input_tokens_seen": 255730432, "step": 900, "train_runtime": 8760.1548, "train_tokens_per_second": 29192.456 }, { "epoch": 0.032197643999318896, "grad_norm": 1.4921875, "learning_rate": 4.787155485304435e-05, "loss": 1.2894940376281738, "num_input_tokens_seen": 258587072, "step": 910, "train_runtime": 8857.8314, "train_tokens_per_second": 29193.045 }, { "epoch": 0.032551464263047676, "grad_norm": 1.53125, "learning_rate": 4.784962861415629e-05, "loss": 1.2983574867248535, "num_input_tokens_seen": 261403456, "step": 920, "train_runtime": 8953.832, "train_tokens_per_second": 29194.59 }, { "epoch": 0.032905284526776456, "grad_norm": 1.5703125, "learning_rate": 4.7827732475813884e-05, "loss": 1.2840347290039062, "num_input_tokens_seen": 264245888, "step": 930, "train_runtime": 9050.8908, "train_tokens_per_second": 29195.567 }, { "epoch": 0.033259104790505235, "grad_norm": 1.4765625, "learning_rate": 4.7805866369209576e-05, "loss": 1.276268768310547, "num_input_tokens_seen": 267068608, "step": 940, "train_runtime": 9147.7169, "train_tokens_per_second": 29195.111 }, { "epoch": 0.033612925054234015, "grad_norm": 1.5546875, "learning_rate": 4.778403022575583e-05, "loss": 1.2826930046081544, "num_input_tokens_seen": 269879616, "step": 950, "train_runtime": 9241.5376, "train_tokens_per_second": 29202.891 }, { "epoch": 0.033966745317962795, "grad_norm": 1.484375, "learning_rate": 4.7762223977084195e-05, "loss": 1.287209415435791, "num_input_tokens_seen": 272747456, "step": 960, "train_runtime": 9342.3445, "train_tokens_per_second": 29194.755 }, { "epoch": 0.03432056558169157, "grad_norm": 1.5, "learning_rate": 4.774044755504444e-05, "loss": 1.2790203094482422, "num_input_tokens_seen": 275555264, "step": 970, "train_runtime": 9437.9049, "train_tokens_per_second": 29196.656 }, { "epoch": 0.03467438584542035, "grad_norm": 1.46875, "learning_rate": 4.7718700891703616e-05, "loss": 1.2881513595581056, "num_input_tokens_seen": 278383808, "step": 980, "train_runtime": 9532.674, "train_tokens_per_second": 29203.118 }, { "epoch": 0.035028206109149126, "grad_norm": 1.5234375, "learning_rate": 4.7696983919345215e-05, "loss": 1.2910917282104493, "num_input_tokens_seen": 281244672, "step": 990, "train_runtime": 9633.2162, "train_tokens_per_second": 29195.304 }, { "epoch": 0.035382026372877906, "grad_norm": 1.53125, "learning_rate": 4.7675296570468216e-05, "loss": 1.2847518920898438, "num_input_tokens_seen": 284070144, "step": 1000, "train_runtime": 9730.0636, "train_tokens_per_second": 29195.096 }, { "epoch": 0.035735846636606686, "grad_norm": 1.484375, "learning_rate": 4.76536387777863e-05, "loss": 1.2603843688964844, "num_input_tokens_seen": 286892224, "step": 1010, "train_runtime": 9825.4324, "train_tokens_per_second": 29198.941 }, { "epoch": 0.036089666900335465, "grad_norm": 1.671875, "learning_rate": 4.7632010474226915e-05, "loss": 1.273622989654541, "num_input_tokens_seen": 289760768, "step": 1020, "train_runtime": 9926.6568, "train_tokens_per_second": 29190.167 }, { "epoch": 0.036443487164064245, "grad_norm": 1.546875, "learning_rate": 4.761041159293035e-05, "loss": 1.2834928512573243, "num_input_tokens_seen": 292580992, "step": 1030, "train_runtime": 10022.8105, "train_tokens_per_second": 29191.512 }, { "epoch": 0.036797307427793025, "grad_norm": 1.4921875, "learning_rate": 4.7588842067249e-05, "loss": 1.282025146484375, "num_input_tokens_seen": 295430272, "step": 1040, "train_runtime": 10122.797, "train_tokens_per_second": 29184.648 }, { "epoch": 0.037151127691521804, "grad_norm": 1.53125, "learning_rate": 4.756730183074637e-05, "loss": 1.2845125198364258, "num_input_tokens_seen": 298248704, "step": 1050, "train_runtime": 10218.0481, "train_tokens_per_second": 29188.422 }, { "epoch": 0.037504947955250584, "grad_norm": 1.5625, "learning_rate": 4.7545790817196314e-05, "loss": 1.271329116821289, "num_input_tokens_seen": 301097088, "step": 1060, "train_runtime": 10317.1547, "train_tokens_per_second": 29184.121 }, { "epoch": 0.03785876821897936, "grad_norm": 1.4609375, "learning_rate": 4.752430896058212e-05, "loss": 1.27503662109375, "num_input_tokens_seen": 303881344, "step": 1070, "train_runtime": 10410.6854, "train_tokens_per_second": 29189.369 }, { "epoch": 0.03821258848270814, "grad_norm": 1.484375, "learning_rate": 4.750285619509567e-05, "loss": 1.2855945587158204, "num_input_tokens_seen": 306701696, "step": 1080, "train_runtime": 10507.778, "train_tokens_per_second": 29188.064 }, { "epoch": 0.03856640874643692, "grad_norm": 1.5078125, "learning_rate": 4.7481432455136644e-05, "loss": 1.286431884765625, "num_input_tokens_seen": 309561344, "step": 1090, "train_runtime": 10608.7189, "train_tokens_per_second": 29179.899 }, { "epoch": 0.038920229010165695, "grad_norm": 1.484375, "learning_rate": 4.7460037675311584e-05, "loss": 1.2837228775024414, "num_input_tokens_seen": 312447872, "step": 1100, "train_runtime": 10708.76, "train_tokens_per_second": 29176.849 }, { "epoch": 0.039274049273894475, "grad_norm": 1.5625, "learning_rate": 4.7438671790433126e-05, "loss": 1.2781454086303712, "num_input_tokens_seen": 315278400, "step": 1110, "train_runtime": 10805.9579, "train_tokens_per_second": 29176.349 }, { "epoch": 0.039627869537623255, "grad_norm": 1.5078125, "learning_rate": 4.741733473551915e-05, "loss": 1.2586235046386718, "num_input_tokens_seen": 318156160, "step": 1120, "train_runtime": 10904.8312, "train_tokens_per_second": 29175.707 }, { "epoch": 0.039981689801352034, "grad_norm": 1.4765625, "learning_rate": 4.7396026445791966e-05, "loss": 1.2817815780639648, "num_input_tokens_seen": 321007808, "step": 1130, "train_runtime": 11003.2492, "train_tokens_per_second": 29173.911 }, { "epoch": 0.040335510065080814, "grad_norm": 1.578125, "learning_rate": 4.737474685667742e-05, "loss": 1.2775043487548827, "num_input_tokens_seen": 323854016, "step": 1140, "train_runtime": 11101.0407, "train_tokens_per_second": 29173.302 }, { "epoch": 0.04068933032880959, "grad_norm": 1.4921875, "learning_rate": 4.7353495903804165e-05, "loss": 1.2724164962768554, "num_input_tokens_seen": 326739072, "step": 1150, "train_runtime": 11203.2937, "train_tokens_per_second": 29164.555 }, { "epoch": 0.04104315059253837, "grad_norm": 1.546875, "learning_rate": 4.733227352300277e-05, "loss": 1.261830711364746, "num_input_tokens_seen": 329584000, "step": 1160, "train_runtime": 11300.3868, "train_tokens_per_second": 29165.727 }, { "epoch": 0.04139697085626715, "grad_norm": 1.484375, "learning_rate": 4.731107965030496e-05, "loss": 1.2604832649230957, "num_input_tokens_seen": 332447488, "step": 1170, "train_runtime": 11398.9997, "train_tokens_per_second": 29164.62 }, { "epoch": 0.04175079111999593, "grad_norm": 1.5390625, "learning_rate": 4.728991422194278e-05, "loss": 1.2686702728271484, "num_input_tokens_seen": 335291008, "step": 1180, "train_runtime": 11497.3088, "train_tokens_per_second": 29162.564 }, { "epoch": 0.04210461138372471, "grad_norm": 1.4921875, "learning_rate": 4.726877717434773e-05, "loss": 1.2504941940307617, "num_input_tokens_seen": 338140352, "step": 1190, "train_runtime": 11596.4711, "train_tokens_per_second": 29158.901 }, { "epoch": 0.04245843164745349, "grad_norm": 1.4609375, "learning_rate": 4.724766844415013e-05, "loss": 1.2769978523254395, "num_input_tokens_seen": 340990272, "step": 1200, "train_runtime": 11695.6569, "train_tokens_per_second": 29155.29 }, { "epoch": 0.04281225191118227, "grad_norm": 1.4453125, "learning_rate": 4.722658796817813e-05, "loss": 1.2674144744873046, "num_input_tokens_seen": 343838208, "step": 1210, "train_runtime": 11793.4781, "train_tokens_per_second": 29154.945 }, { "epoch": 0.04316607217491105, "grad_norm": 1.46875, "learning_rate": 4.7205535683457044e-05, "loss": 1.258150005340576, "num_input_tokens_seen": 346657792, "step": 1220, "train_runtime": 11892.3837, "train_tokens_per_second": 29149.563 }, { "epoch": 0.04351989243863982, "grad_norm": 1.4765625, "learning_rate": 4.7184511527208484e-05, "loss": 1.2677743911743165, "num_input_tokens_seen": 349406848, "step": 1230, "train_runtime": 11984.7668, "train_tokens_per_second": 29154.247 }, { "epoch": 0.0438737127023686, "grad_norm": 1.5390625, "learning_rate": 4.7163515436849644e-05, "loss": 1.2628530502319335, "num_input_tokens_seen": 352205120, "step": 1240, "train_runtime": 12077.1018, "train_tokens_per_second": 29163.05 }, { "epoch": 0.04422753296609738, "grad_norm": 1.515625, "learning_rate": 4.714254734999245e-05, "loss": 1.2550325393676758, "num_input_tokens_seen": 355032320, "step": 1250, "train_runtime": 12174.9434, "train_tokens_per_second": 29160.901 }, { "epoch": 0.04458135322982616, "grad_norm": 1.484375, "learning_rate": 4.712160720444284e-05, "loss": 1.2668527603149413, "num_input_tokens_seen": 357865728, "step": 1260, "train_runtime": 12270.6258, "train_tokens_per_second": 29164.424 }, { "epoch": 0.04493517349355494, "grad_norm": 1.5, "learning_rate": 4.710069493819992e-05, "loss": 1.273119068145752, "num_input_tokens_seen": 360726208, "step": 1270, "train_runtime": 12367.0349, "train_tokens_per_second": 29168.367 }, { "epoch": 0.04528899375728372, "grad_norm": 1.4453125, "learning_rate": 4.70798104894553e-05, "loss": 1.272770881652832, "num_input_tokens_seen": 363523776, "step": 1280, "train_runtime": 12463.0456, "train_tokens_per_second": 29168.133 }, { "epoch": 0.0456428140210125, "grad_norm": 1.484375, "learning_rate": 4.705895379659219e-05, "loss": 1.2593206405639648, "num_input_tokens_seen": 366363840, "step": 1290, "train_runtime": 12559.5297, "train_tokens_per_second": 29170.188 }, { "epoch": 0.04599663428474128, "grad_norm": 1.453125, "learning_rate": 4.7038124798184766e-05, "loss": 1.2485363006591796, "num_input_tokens_seen": 369254272, "step": 1300, "train_runtime": 12658.6132, "train_tokens_per_second": 29170.199 }, { "epoch": 0.04635045454847006, "grad_norm": 1.4296875, "learning_rate": 4.7017323432997304e-05, "loss": 1.249028778076172, "num_input_tokens_seen": 372060416, "step": 1310, "train_runtime": 12752.3333, "train_tokens_per_second": 29175.87 }, { "epoch": 0.04670427481219884, "grad_norm": 1.484375, "learning_rate": 4.6996549639983506e-05, "loss": 1.2636095046997071, "num_input_tokens_seen": 374916672, "step": 1320, "train_runtime": 12850.8931, "train_tokens_per_second": 29174.367 }, { "epoch": 0.04705809507592762, "grad_norm": 1.46875, "learning_rate": 4.697580335828569e-05, "loss": 1.2756300926208497, "num_input_tokens_seen": 377688768, "step": 1330, "train_runtime": 12944.598, "train_tokens_per_second": 29177.327 }, { "epoch": 0.0474119153396564, "grad_norm": 1.484375, "learning_rate": 4.6955084527234076e-05, "loss": 1.270100975036621, "num_input_tokens_seen": 380504704, "step": 1340, "train_runtime": 13041.89, "train_tokens_per_second": 29175.58 }, { "epoch": 0.04776573560338518, "grad_norm": 1.5390625, "learning_rate": 4.6934393086346034e-05, "loss": 1.25796537399292, "num_input_tokens_seen": 383362752, "step": 1350, "train_runtime": 13139.651, "train_tokens_per_second": 29176.022 }, { "epoch": 0.04811955586711395, "grad_norm": 1.5390625, "learning_rate": 4.6913728975325324e-05, "loss": 1.256306266784668, "num_input_tokens_seen": 386168256, "step": 1360, "train_runtime": 13235.1592, "train_tokens_per_second": 29177.455 }, { "epoch": 0.04847337613084273, "grad_norm": 1.5, "learning_rate": 4.6893092134061393e-05, "loss": 1.253044891357422, "num_input_tokens_seen": 389013440, "step": 1370, "train_runtime": 13330.0091, "train_tokens_per_second": 29183.284 }, { "epoch": 0.04882719639457151, "grad_norm": 1.390625, "learning_rate": 4.687248250262859e-05, "loss": 1.2590097427368163, "num_input_tokens_seen": 391862656, "step": 1380, "train_runtime": 13427.754, "train_tokens_per_second": 29183.038 }, { "epoch": 0.04918101665830029, "grad_norm": 1.3984375, "learning_rate": 4.685190002128548e-05, "loss": 1.2540940284729003, "num_input_tokens_seen": 394694016, "step": 1390, "train_runtime": 13524.9475, "train_tokens_per_second": 29182.665 }, { "epoch": 0.04953483692202907, "grad_norm": 1.375, "learning_rate": 4.6831344630474114e-05, "loss": 1.2662076950073242, "num_input_tokens_seen": 397559168, "step": 1400, "train_runtime": 13623.6606, "train_tokens_per_second": 29181.523 }, { "epoch": 0.04988865718575785, "grad_norm": 1.4765625, "learning_rate": 4.6810816270819276e-05, "loss": 1.2607160568237306, "num_input_tokens_seen": 400339968, "step": 1410, "train_runtime": 13716.952, "train_tokens_per_second": 29185.782 }, { "epoch": 0.05024247744948663, "grad_norm": 1.4609375, "learning_rate": 4.679031488312777e-05, "loss": 1.2524450302124024, "num_input_tokens_seen": 403147712, "step": 1420, "train_runtime": 13808.9773, "train_tokens_per_second": 29194.61 }, { "epoch": 0.05059629771321541, "grad_norm": 1.3984375, "learning_rate": 4.6769840408387717e-05, "loss": 1.2521073341369628, "num_input_tokens_seen": 405921984, "step": 1430, "train_runtime": 13902.9365, "train_tokens_per_second": 29196.852 }, { "epoch": 0.05095011797694419, "grad_norm": 1.484375, "learning_rate": 4.674939278776787e-05, "loss": 1.254897117614746, "num_input_tokens_seen": 408771328, "step": 1440, "train_runtime": 14002.5319, "train_tokens_per_second": 29192.673 }, { "epoch": 0.05130393824067297, "grad_norm": 1.453125, "learning_rate": 4.672897196261683e-05, "loss": 1.2373151779174805, "num_input_tokens_seen": 411631360, "step": 1450, "train_runtime": 14097.8673, "train_tokens_per_second": 29198.13 }, { "epoch": 0.05165775850440175, "grad_norm": 1.4609375, "learning_rate": 4.670857787446238e-05, "loss": 1.247175407409668, "num_input_tokens_seen": 414472512, "step": 1460, "train_runtime": 14195.1007, "train_tokens_per_second": 29198.279 }, { "epoch": 0.05201157876813053, "grad_norm": 1.4453125, "learning_rate": 4.668821046501082e-05, "loss": 1.262812328338623, "num_input_tokens_seen": 417288512, "step": 1470, "train_runtime": 14289.1285, "train_tokens_per_second": 29203.217 }, { "epoch": 0.05236539903185931, "grad_norm": 1.53125, "learning_rate": 4.6667869676146194e-05, "loss": 1.2526397705078125, "num_input_tokens_seen": 420114432, "step": 1480, "train_runtime": 14386.311, "train_tokens_per_second": 29202.374 }, { "epoch": 0.05271921929558808, "grad_norm": 1.4140625, "learning_rate": 4.6647555449929645e-05, "loss": 1.2694456100463867, "num_input_tokens_seen": 423016960, "step": 1490, "train_runtime": 14486.3006, "train_tokens_per_second": 29201.172 }, { "epoch": 0.05307303955931686, "grad_norm": 1.4765625, "learning_rate": 4.662726772859869e-05, "loss": 1.2332801818847656, "num_input_tokens_seen": 425864448, "step": 1500, "train_runtime": 14583.1399, "train_tokens_per_second": 29202.521 }, { "epoch": 0.05342685982304564, "grad_norm": 1.5078125, "learning_rate": 4.660700645456655e-05, "loss": 1.2506831169128418, "num_input_tokens_seen": 428695872, "step": 1510, "train_runtime": 14681.7896, "train_tokens_per_second": 29199.156 }, { "epoch": 0.05378068008677442, "grad_norm": 1.578125, "learning_rate": 4.658677157042149e-05, "loss": 1.2596900939941407, "num_input_tokens_seen": 431512576, "step": 1520, "train_runtime": 14778.0889, "train_tokens_per_second": 29199.484 }, { "epoch": 0.0541345003505032, "grad_norm": 1.4296875, "learning_rate": 4.656656301892605e-05, "loss": 1.247041893005371, "num_input_tokens_seen": 434367744, "step": 1530, "train_runtime": 14876.8818, "train_tokens_per_second": 29197.499 }, { "epoch": 0.05448832061423198, "grad_norm": 1.53125, "learning_rate": 4.6546380743016465e-05, "loss": 1.245659637451172, "num_input_tokens_seen": 437205952, "step": 1540, "train_runtime": 14975.2845, "train_tokens_per_second": 29195.168 }, { "epoch": 0.05484214087796076, "grad_norm": 1.4453125, "learning_rate": 4.652622468580193e-05, "loss": 1.2528257369995117, "num_input_tokens_seen": 440075648, "step": 1550, "train_runtime": 15075.7843, "train_tokens_per_second": 29190.896 }, { "epoch": 0.05519596114168954, "grad_norm": 1.421875, "learning_rate": 4.650609479056392e-05, "loss": 1.244206428527832, "num_input_tokens_seen": 442901888, "step": 1560, "train_runtime": 15171.8307, "train_tokens_per_second": 29192.383 }, { "epoch": 0.055549781405418316, "grad_norm": 1.4765625, "learning_rate": 4.648599100075556e-05, "loss": 1.2513113975524903, "num_input_tokens_seen": 445732352, "step": 1570, "train_runtime": 15267.9431, "train_tokens_per_second": 29194.001 }, { "epoch": 0.055903601669147096, "grad_norm": 1.4453125, "learning_rate": 4.6465913260000945e-05, "loss": 1.2245362281799317, "num_input_tokens_seen": 448596480, "step": 1580, "train_runtime": 15368.0358, "train_tokens_per_second": 29190.229 }, { "epoch": 0.056257421932875876, "grad_norm": 1.4609375, "learning_rate": 4.644586151209444e-05, "loss": 1.2394739151000977, "num_input_tokens_seen": 451430272, "step": 1590, "train_runtime": 15465.94, "train_tokens_per_second": 29188.673 }, { "epoch": 0.056611242196604655, "grad_norm": 1.375, "learning_rate": 4.6425835701000084e-05, "loss": 1.2369486808776855, "num_input_tokens_seen": 454233152, "step": 1600, "train_runtime": 15558.2509, "train_tokens_per_second": 29195.644 }, { "epoch": 0.05696506246033343, "grad_norm": 1.4375, "learning_rate": 4.640583577085084e-05, "loss": 1.2486921310424806, "num_input_tokens_seen": 457093248, "step": 1610, "train_runtime": 15655.8197, "train_tokens_per_second": 29196.379 }, { "epoch": 0.05731888272406221, "grad_norm": 1.4375, "learning_rate": 4.638586166594806e-05, "loss": 1.2466064453125, "num_input_tokens_seen": 459936448, "step": 1620, "train_runtime": 15752.8374, "train_tokens_per_second": 29197.054 }, { "epoch": 0.05767270298779099, "grad_norm": 1.4921875, "learning_rate": 4.6365913330760726e-05, "loss": 1.2378973007202148, "num_input_tokens_seen": 462743744, "step": 1630, "train_runtime": 15849.6915, "train_tokens_per_second": 29195.757 }, { "epoch": 0.05802652325151977, "grad_norm": 1.515625, "learning_rate": 4.6345990709924855e-05, "loss": 1.240572738647461, "num_input_tokens_seen": 465583680, "step": 1640, "train_runtime": 15947.1139, "train_tokens_per_second": 29195.482 }, { "epoch": 0.058380343515248546, "grad_norm": 1.390625, "learning_rate": 4.632609374824284e-05, "loss": 1.255947208404541, "num_input_tokens_seen": 468450816, "step": 1650, "train_runtime": 16046.7169, "train_tokens_per_second": 29192.938 }, { "epoch": 0.058734163778977326, "grad_norm": 1.4921875, "learning_rate": 4.630622239068285e-05, "loss": 1.2280990600585937, "num_input_tokens_seen": 471258944, "step": 1660, "train_runtime": 16143.6493, "train_tokens_per_second": 29191.599 }, { "epoch": 0.059087984042706106, "grad_norm": 1.421875, "learning_rate": 4.628637658237808e-05, "loss": 1.2365451812744142, "num_input_tokens_seen": 474096320, "step": 1670, "train_runtime": 16242.9438, "train_tokens_per_second": 29187.832 }, { "epoch": 0.059441804306434885, "grad_norm": 1.453125, "learning_rate": 4.626655626862625e-05, "loss": 1.2225577354431152, "num_input_tokens_seen": 476921472, "step": 1680, "train_runtime": 16339.6803, "train_tokens_per_second": 29187.932 }, { "epoch": 0.059795624570163665, "grad_norm": 1.484375, "learning_rate": 4.624676139488888e-05, "loss": 1.2477752685546875, "num_input_tokens_seen": 479802176, "step": 1690, "train_runtime": 16440.5262, "train_tokens_per_second": 29184.113 }, { "epoch": 0.060149444833892445, "grad_norm": 1.4375, "learning_rate": 4.6226991906790686e-05, "loss": 1.234751319885254, "num_input_tokens_seen": 482621056, "step": 1700, "train_runtime": 16536.6526, "train_tokens_per_second": 29184.931 }, { "epoch": 0.060503265097621224, "grad_norm": 1.515625, "learning_rate": 4.620724775011897e-05, "loss": 1.2388036727905274, "num_input_tokens_seen": 485433280, "step": 1710, "train_runtime": 16630.7479, "train_tokens_per_second": 29188.903 }, { "epoch": 0.060857085361350004, "grad_norm": 1.4375, "learning_rate": 4.618752887082297e-05, "loss": 1.2334161758422852, "num_input_tokens_seen": 488321600, "step": 1720, "train_runtime": 16730.6618, "train_tokens_per_second": 29187.226 }, { "epoch": 0.06121090562507878, "grad_norm": 1.4609375, "learning_rate": 4.616783521501325e-05, "loss": 1.2322227478027343, "num_input_tokens_seen": 491185728, "step": 1730, "train_runtime": 16830.5553, "train_tokens_per_second": 29184.167 }, { "epoch": 0.061564725888807556, "grad_norm": 1.546875, "learning_rate": 4.614816672896108e-05, "loss": 1.2362937927246094, "num_input_tokens_seen": 494032640, "step": 1740, "train_runtime": 16928.1548, "train_tokens_per_second": 29184.081 }, { "epoch": 0.061918546152536336, "grad_norm": 1.390625, "learning_rate": 4.612852335909782e-05, "loss": 1.2363208770751952, "num_input_tokens_seen": 496898944, "step": 1750, "train_runtime": 17024.3112, "train_tokens_per_second": 29187.609 }, { "epoch": 0.062272366416265115, "grad_norm": 1.4453125, "learning_rate": 4.6108905052014323e-05, "loss": 1.2319842338562013, "num_input_tokens_seen": 499705920, "step": 1760, "train_runtime": 17117.7506, "train_tokens_per_second": 29192.265 }, { "epoch": 0.0626261866799939, "grad_norm": 1.3984375, "learning_rate": 4.608931175446027e-05, "loss": 1.2204668045043945, "num_input_tokens_seen": 502554560, "step": 1770, "train_runtime": 17214.5734, "train_tokens_per_second": 29193.553 }, { "epoch": 0.06298000694372267, "grad_norm": 1.46875, "learning_rate": 4.606974341334367e-05, "loss": 1.2483132362365723, "num_input_tokens_seen": 505327296, "step": 1780, "train_runtime": 17309.3119, "train_tokens_per_second": 29193.956 }, { "epoch": 0.06333382720745145, "grad_norm": 1.4453125, "learning_rate": 4.605019997573011e-05, "loss": 1.2371336936950683, "num_input_tokens_seen": 508246208, "step": 1790, "train_runtime": 17410.8137, "train_tokens_per_second": 29191.41 }, { "epoch": 0.06368764747118023, "grad_norm": 1.4453125, "learning_rate": 4.603068138884229e-05, "loss": 1.2442188262939453, "num_input_tokens_seen": 511120896, "step": 1800, "train_runtime": 17510.8092, "train_tokens_per_second": 29188.879 }, { "epoch": 0.06404146773490901, "grad_norm": 1.453125, "learning_rate": 4.6011187600059345e-05, "loss": 1.2285377502441406, "num_input_tokens_seen": 513971072, "step": 1810, "train_runtime": 17606.1918, "train_tokens_per_second": 29192.632 }, { "epoch": 0.06439528799863779, "grad_norm": 1.46875, "learning_rate": 4.599171855691629e-05, "loss": 1.2315665245056153, "num_input_tokens_seen": 516781632, "step": 1820, "train_runtime": 17702.6313, "train_tokens_per_second": 29192.363 }, { "epoch": 0.06474910826236657, "grad_norm": 1.4609375, "learning_rate": 4.597227420710335e-05, "loss": 1.2157657623291016, "num_input_tokens_seen": 519587648, "step": 1830, "train_runtime": 17798.7916, "train_tokens_per_second": 29192.299 }, { "epoch": 0.06510292852609535, "grad_norm": 1.421875, "learning_rate": 4.595285449846551e-05, "loss": 1.2247900009155273, "num_input_tokens_seen": 522408064, "step": 1840, "train_runtime": 17895.1288, "train_tokens_per_second": 29192.752 }, { "epoch": 0.06545674878982413, "grad_norm": 1.4453125, "learning_rate": 4.593345937900178e-05, "loss": 1.2300881385803222, "num_input_tokens_seen": 525223808, "step": 1850, "train_runtime": 17989.5972, "train_tokens_per_second": 29195.974 }, { "epoch": 0.06581056905355291, "grad_norm": 1.46875, "learning_rate": 4.591408879686472e-05, "loss": 1.2117149353027343, "num_input_tokens_seen": 527996032, "step": 1860, "train_runtime": 18081.7914, "train_tokens_per_second": 29200.427 }, { "epoch": 0.06616438931728169, "grad_norm": 1.40625, "learning_rate": 4.5894742700359775e-05, "loss": 1.2351256370544434, "num_input_tokens_seen": 530825152, "step": 1870, "train_runtime": 18175.6858, "train_tokens_per_second": 29205.234 }, { "epoch": 0.06651820958101047, "grad_norm": 1.4140625, "learning_rate": 4.587542103794477e-05, "loss": 1.231490135192871, "num_input_tokens_seen": 533647104, "step": 1880, "train_runtime": 18273.171, "train_tokens_per_second": 29203.859 }, { "epoch": 0.06687202984473925, "grad_norm": 1.4609375, "learning_rate": 4.5856123758229247e-05, "loss": 1.2345277786254882, "num_input_tokens_seen": 536478464, "step": 1890, "train_runtime": 18368.7573, "train_tokens_per_second": 29206.029 }, { "epoch": 0.06722585010846803, "grad_norm": 1.4453125, "learning_rate": 4.5836850809973993e-05, "loss": 1.2307114601135254, "num_input_tokens_seen": 539351808, "step": 1900, "train_runtime": 18467.8843, "train_tokens_per_second": 29204.851 }, { "epoch": 0.06757967037219681, "grad_norm": 1.3984375, "learning_rate": 4.5817602142090385e-05, "loss": 1.2299392700195313, "num_input_tokens_seen": 542161408, "step": 1910, "train_runtime": 18565.5234, "train_tokens_per_second": 29202.592 }, { "epoch": 0.06793349063592559, "grad_norm": 1.5703125, "learning_rate": 4.579837770363989e-05, "loss": 1.2268086433410645, "num_input_tokens_seen": 544951744, "step": 1920, "train_runtime": 18656.9272, "train_tokens_per_second": 29209.083 }, { "epoch": 0.06828731089965437, "grad_norm": 1.40625, "learning_rate": 4.57791774438334e-05, "loss": 1.2209148406982422, "num_input_tokens_seen": 547750400, "step": 1930, "train_runtime": 18753.1179, "train_tokens_per_second": 29208.498 }, { "epoch": 0.06864113116338313, "grad_norm": 1.484375, "learning_rate": 4.576000131203078e-05, "loss": 1.2444892883300782, "num_input_tokens_seen": 550594112, "step": 1940, "train_runtime": 18851.5952, "train_tokens_per_second": 29206.765 }, { "epoch": 0.06899495142711191, "grad_norm": 1.3984375, "learning_rate": 4.574084925774023e-05, "loss": 1.2348945617675782, "num_input_tokens_seen": 553487040, "step": 1950, "train_runtime": 18952.3784, "train_tokens_per_second": 29204.094 }, { "epoch": 0.0693487716908407, "grad_norm": 1.390625, "learning_rate": 4.5721721230617795e-05, "loss": 1.2143863677978515, "num_input_tokens_seen": 556323008, "step": 1960, "train_runtime": 19051.8237, "train_tokens_per_second": 29200.512 }, { "epoch": 0.06970259195456947, "grad_norm": 1.4765625, "learning_rate": 4.57026171804667e-05, "loss": 1.22979679107666, "num_input_tokens_seen": 559121728, "step": 1970, "train_runtime": 19148.5024, "train_tokens_per_second": 29199.241 }, { "epoch": 0.07005641221829825, "grad_norm": 1.4375, "learning_rate": 4.568353705723692e-05, "loss": 1.2112942695617677, "num_input_tokens_seen": 562017152, "step": 1980, "train_runtime": 19248.202, "train_tokens_per_second": 29198.423 }, { "epoch": 0.07041023248202703, "grad_norm": 1.4375, "learning_rate": 4.566448081102455e-05, "loss": 1.210357666015625, "num_input_tokens_seen": 564825344, "step": 1990, "train_runtime": 19342.5825, "train_tokens_per_second": 29201.134 }, { "epoch": 0.07076405274575581, "grad_norm": 1.4765625, "learning_rate": 4.564544839207128e-05, "loss": 1.2312849044799805, "num_input_tokens_seen": 567674176, "step": 2000, "train_runtime": 19439.7692, "train_tokens_per_second": 29201.693 }, { "epoch": 0.07111787300948459, "grad_norm": 1.515625, "learning_rate": 4.562643975076387e-05, "loss": 1.2250823974609375, "num_input_tokens_seen": 570516160, "step": 2010, "train_runtime": 19538.3333, "train_tokens_per_second": 29199.838 }, { "epoch": 0.07147169327321337, "grad_norm": 1.5, "learning_rate": 4.560745483763357e-05, "loss": 1.2218762397766114, "num_input_tokens_seen": 573346944, "step": 2020, "train_runtime": 19636.8058, "train_tokens_per_second": 29197.567 }, { "epoch": 0.07182551353694215, "grad_norm": 1.5859375, "learning_rate": 4.5588493603355595e-05, "loss": 1.230175495147705, "num_input_tokens_seen": 576276288, "step": 2030, "train_runtime": 19740.692, "train_tokens_per_second": 29192.304 }, { "epoch": 0.07217933380067093, "grad_norm": 1.53125, "learning_rate": 4.556955599874859e-05, "loss": 1.2221302032470702, "num_input_tokens_seen": 579141184, "step": 2040, "train_runtime": 19840.7192, "train_tokens_per_second": 29189.526 }, { "epoch": 0.07253315406439971, "grad_norm": 1.4296875, "learning_rate": 4.555064197477409e-05, "loss": 1.2246397972106933, "num_input_tokens_seen": 582017088, "step": 2050, "train_runtime": 19940.8475, "train_tokens_per_second": 29187.179 }, { "epoch": 0.07288697432812849, "grad_norm": 1.4609375, "learning_rate": 4.5531751482536e-05, "loss": 1.2272417068481445, "num_input_tokens_seen": 584861632, "step": 2060, "train_runtime": 20041.7056, "train_tokens_per_second": 29182.228 }, { "epoch": 0.07324079459185727, "grad_norm": 1.40625, "learning_rate": 4.5512884473280024e-05, "loss": 1.2221508979797364, "num_input_tokens_seen": 587725440, "step": 2070, "train_runtime": 20138.1246, "train_tokens_per_second": 29184.716 }, { "epoch": 0.07359461485558605, "grad_norm": 1.421875, "learning_rate": 4.549404089839322e-05, "loss": 1.2156543731689453, "num_input_tokens_seen": 590559040, "step": 2080, "train_runtime": 20235.6956, "train_tokens_per_second": 29184.025 }, { "epoch": 0.07394843511931483, "grad_norm": 1.453125, "learning_rate": 4.547522070940335e-05, "loss": 1.2300201416015626, "num_input_tokens_seen": 593424512, "step": 2090, "train_runtime": 20334.4965, "train_tokens_per_second": 29183.143 }, { "epoch": 0.07430225538304361, "grad_norm": 1.421875, "learning_rate": 4.545642385797848e-05, "loss": 1.2280845642089844, "num_input_tokens_seen": 596225088, "step": 2100, "train_runtime": 20426.1303, "train_tokens_per_second": 29189.331 }, { "epoch": 0.07465607564677239, "grad_norm": 1.4765625, "learning_rate": 4.543765029592637e-05, "loss": 1.2405645370483398, "num_input_tokens_seen": 599054400, "step": 2110, "train_runtime": 20519.6591, "train_tokens_per_second": 29194.169 }, { "epoch": 0.07500989591050117, "grad_norm": 1.4921875, "learning_rate": 4.541889997519403e-05, "loss": 1.2238348007202149, "num_input_tokens_seen": 601905792, "step": 2120, "train_runtime": 20619.7969, "train_tokens_per_second": 29190.675 }, { "epoch": 0.07536371617422995, "grad_norm": 1.40625, "learning_rate": 4.5400172847867095e-05, "loss": 1.2187747001647948, "num_input_tokens_seen": 604781696, "step": 2130, "train_runtime": 20719.7377, "train_tokens_per_second": 29188.675 }, { "epoch": 0.07571753643795873, "grad_norm": 1.4609375, "learning_rate": 4.5381468866169466e-05, "loss": 1.2268861770629882, "num_input_tokens_seen": 607602112, "step": 2140, "train_runtime": 20813.8676, "train_tokens_per_second": 29192.177 }, { "epoch": 0.0760713567016875, "grad_norm": 1.3984375, "learning_rate": 4.5362787982462616e-05, "loss": 1.2039087295532227, "num_input_tokens_seen": 610399360, "step": 2150, "train_runtime": 20911.6496, "train_tokens_per_second": 29189.441 }, { "epoch": 0.07642517696541629, "grad_norm": 1.4765625, "learning_rate": 4.5344130149245275e-05, "loss": 1.2154084205627442, "num_input_tokens_seen": 613185408, "step": 2160, "train_runtime": 21004.4077, "train_tokens_per_second": 29193.178 }, { "epoch": 0.07677899722914507, "grad_norm": 1.4375, "learning_rate": 4.5325495319152715e-05, "loss": 1.2252399444580078, "num_input_tokens_seen": 616021440, "step": 2170, "train_runtime": 21101.0227, "train_tokens_per_second": 29193.914 }, { "epoch": 0.07713281749287385, "grad_norm": 1.46875, "learning_rate": 4.530688344495644e-05, "loss": 1.2119600296020507, "num_input_tokens_seen": 618854080, "step": 2180, "train_runtime": 21196.471, "train_tokens_per_second": 29196.09 }, { "epoch": 0.07748663775660261, "grad_norm": 1.3671875, "learning_rate": 4.528829447956357e-05, "loss": 1.213577938079834, "num_input_tokens_seen": 621675904, "step": 2190, "train_runtime": 21292.4057, "train_tokens_per_second": 29197.072 }, { "epoch": 0.07784045802033139, "grad_norm": 1.4140625, "learning_rate": 4.526972837601633e-05, "loss": 1.2243017196655273, "num_input_tokens_seen": 624492288, "step": 2200, "train_runtime": 21388.1015, "train_tokens_per_second": 29198.117 }, { "epoch": 0.07819427828406017, "grad_norm": 1.4140625, "learning_rate": 4.525118508749165e-05, "loss": 1.2132570266723632, "num_input_tokens_seen": 627315200, "step": 2210, "train_runtime": 21484.547, "train_tokens_per_second": 29198.437 }, { "epoch": 0.07854809854778895, "grad_norm": 1.4609375, "learning_rate": 4.5232664567300546e-05, "loss": 1.1953063011169434, "num_input_tokens_seen": 630126080, "step": 2220, "train_runtime": 21581.9984, "train_tokens_per_second": 29196.837 }, { "epoch": 0.07890191881151773, "grad_norm": 1.4296875, "learning_rate": 4.521416676888773e-05, "loss": 1.2052556991577148, "num_input_tokens_seen": 632958400, "step": 2230, "train_runtime": 21677.576, "train_tokens_per_second": 29198.763 }, { "epoch": 0.07925573907524651, "grad_norm": 1.40625, "learning_rate": 4.519569164583107e-05, "loss": 1.2163087844848632, "num_input_tokens_seen": 635800064, "step": 2240, "train_runtime": 21777.5008, "train_tokens_per_second": 29195.272 }, { "epoch": 0.07960955933897529, "grad_norm": 1.3671875, "learning_rate": 4.517723915184109e-05, "loss": 1.2182098388671876, "num_input_tokens_seen": 638624768, "step": 2250, "train_runtime": 21871.5979, "train_tokens_per_second": 29198.816 }, { "epoch": 0.07996337960270407, "grad_norm": 1.5546875, "learning_rate": 4.5158809240760506e-05, "loss": 1.222600269317627, "num_input_tokens_seen": 641490688, "step": 2260, "train_runtime": 21971.3813, "train_tokens_per_second": 29196.648 }, { "epoch": 0.08031719986643285, "grad_norm": 1.4375, "learning_rate": 4.514040186656375e-05, "loss": 1.2230731964111328, "num_input_tokens_seen": 644356096, "step": 2270, "train_runtime": 22066.9376, "train_tokens_per_second": 29200.069 }, { "epoch": 0.08067102013016163, "grad_norm": 1.375, "learning_rate": 4.512201698335644e-05, "loss": 1.2082666397094726, "num_input_tokens_seen": 647194560, "step": 2280, "train_runtime": 22165.6287, "train_tokens_per_second": 29198.114 }, { "epoch": 0.08102484039389041, "grad_norm": 1.3984375, "learning_rate": 4.510365454537496e-05, "loss": 1.1968767166137695, "num_input_tokens_seen": 650039296, "step": 2290, "train_runtime": 22261.5949, "train_tokens_per_second": 29200.033 }, { "epoch": 0.08137866065761919, "grad_norm": 1.5234375, "learning_rate": 4.5085314506985945e-05, "loss": 1.2200936317443847, "num_input_tokens_seen": 652945088, "step": 2300, "train_runtime": 22361.7776, "train_tokens_per_second": 29199.158 }, { "epoch": 0.08173248092134797, "grad_norm": 1.453125, "learning_rate": 4.50669968226858e-05, "loss": 1.2192657470703125, "num_input_tokens_seen": 655788096, "step": 2310, "train_runtime": 22458.7173, "train_tokens_per_second": 29199.713 }, { "epoch": 0.08208630118507675, "grad_norm": 1.359375, "learning_rate": 4.504870144710027e-05, "loss": 1.206212043762207, "num_input_tokens_seen": 658622528, "step": 2320, "train_runtime": 22555.1242, "train_tokens_per_second": 29200.572 }, { "epoch": 0.08244012144880553, "grad_norm": 1.34375, "learning_rate": 4.5030428334983884e-05, "loss": 1.208874225616455, "num_input_tokens_seen": 661542720, "step": 2330, "train_runtime": 22658.8215, "train_tokens_per_second": 29195.813 }, { "epoch": 0.0827939417125343, "grad_norm": 1.421875, "learning_rate": 4.501217744121959e-05, "loss": 1.2202801704406738, "num_input_tokens_seen": 664371264, "step": 2340, "train_runtime": 22754.4931, "train_tokens_per_second": 29197.366 }, { "epoch": 0.08314776197626308, "grad_norm": 1.4296875, "learning_rate": 4.499394872081821e-05, "loss": 1.2100823402404786, "num_input_tokens_seen": 667226688, "step": 2350, "train_runtime": 22851.286, "train_tokens_per_second": 29198.649 }, { "epoch": 0.08350158223999186, "grad_norm": 1.5, "learning_rate": 4.4975742128918e-05, "loss": 1.2218746185302733, "num_input_tokens_seen": 670128512, "step": 2360, "train_runtime": 22949.9588, "train_tokens_per_second": 29199.552 }, { "epoch": 0.08385540250372064, "grad_norm": 1.5, "learning_rate": 4.495755762078418e-05, "loss": 1.2034995079040527, "num_input_tokens_seen": 672977984, "step": 2370, "train_runtime": 23045.0625, "train_tokens_per_second": 29202.697 }, { "epoch": 0.08420922276744942, "grad_norm": 1.4609375, "learning_rate": 4.49393951518085e-05, "loss": 1.2213037490844727, "num_input_tokens_seen": 675826496, "step": 2380, "train_runtime": 23142.2101, "train_tokens_per_second": 29203.196 }, { "epoch": 0.0845630430311782, "grad_norm": 1.4921875, "learning_rate": 4.4921254677508716e-05, "loss": 1.2164669990539552, "num_input_tokens_seen": 678657856, "step": 2390, "train_runtime": 23236.586, "train_tokens_per_second": 29206.436 }, { "epoch": 0.08491686329490698, "grad_norm": 1.453125, "learning_rate": 4.490313615352821e-05, "loss": 1.2158859252929688, "num_input_tokens_seen": 681497152, "step": 2400, "train_runtime": 23331.9726, "train_tokens_per_second": 29208.724 }, { "epoch": 0.08527068355863576, "grad_norm": 1.421875, "learning_rate": 4.48850395356355e-05, "loss": 1.199061393737793, "num_input_tokens_seen": 684355968, "step": 2410, "train_runtime": 23429.1563, "train_tokens_per_second": 29209.587 }, { "epoch": 0.08562450382236454, "grad_norm": 1.4296875, "learning_rate": 4.486696477972375e-05, "loss": 1.2099312782287597, "num_input_tokens_seen": 687187904, "step": 2420, "train_runtime": 23523.5488, "train_tokens_per_second": 29212.765 }, { "epoch": 0.08597832408609332, "grad_norm": 1.40625, "learning_rate": 4.484891184181041e-05, "loss": 1.2046204566955567, "num_input_tokens_seen": 689986048, "step": 2430, "train_runtime": 23616.1301, "train_tokens_per_second": 29216.728 }, { "epoch": 0.0863321443498221, "grad_norm": 1.421875, "learning_rate": 4.483088067803662e-05, "loss": 1.210502815246582, "num_input_tokens_seen": 692802496, "step": 2440, "train_runtime": 23713.0167, "train_tokens_per_second": 29216.127 }, { "epoch": 0.08668596461355087, "grad_norm": 1.390625, "learning_rate": 4.481287124466697e-05, "loss": 1.221125030517578, "num_input_tokens_seen": 695674432, "step": 2450, "train_runtime": 23811.4503, "train_tokens_per_second": 29215.962 }, { "epoch": 0.08703978487727965, "grad_norm": 1.3984375, "learning_rate": 4.479488349808885e-05, "loss": 1.2127570152282714, "num_input_tokens_seen": 698575488, "step": 2460, "train_runtime": 23911.4328, "train_tokens_per_second": 29215.125 }, { "epoch": 0.08739360514100843, "grad_norm": 1.4453125, "learning_rate": 4.4776917394812114e-05, "loss": 1.2150564193725586, "num_input_tokens_seen": 701434496, "step": 2470, "train_runtime": 24011.2645, "train_tokens_per_second": 29212.726 }, { "epoch": 0.0877474254047372, "grad_norm": 1.421875, "learning_rate": 4.475897289146862e-05, "loss": 1.2245460510253907, "num_input_tokens_seen": 704291840, "step": 2480, "train_runtime": 24111.047, "train_tokens_per_second": 29210.338 }, { "epoch": 0.08810124566846599, "grad_norm": 1.3828125, "learning_rate": 4.4741049944811806e-05, "loss": 1.198171329498291, "num_input_tokens_seen": 707117184, "step": 2490, "train_runtime": 24207.8934, "train_tokens_per_second": 29210.191 }, { "epoch": 0.08845506593219477, "grad_norm": 1.421875, "learning_rate": 4.472314851171621e-05, "loss": 1.2186487197875977, "num_input_tokens_seen": 709938944, "step": 2500, "train_runtime": 24305.3319, "train_tokens_per_second": 29209.185 }, { "epoch": 0.08880888619592354, "grad_norm": 1.421875, "learning_rate": 4.4705268549177084e-05, "loss": 1.2124378204345703, "num_input_tokens_seen": 712816832, "step": 2510, "train_runtime": 24403.5722, "train_tokens_per_second": 29209.528 }, { "epoch": 0.08916270645965232, "grad_norm": 1.4296875, "learning_rate": 4.468741001430989e-05, "loss": 1.2078802108764648, "num_input_tokens_seen": 715680704, "step": 2520, "train_runtime": 24501.8893, "train_tokens_per_second": 29209.205 }, { "epoch": 0.0895165267233811, "grad_norm": 1.4609375, "learning_rate": 4.466957286434997e-05, "loss": 1.2123603820800781, "num_input_tokens_seen": 718503552, "step": 2530, "train_runtime": 24596.8177, "train_tokens_per_second": 29211.24 }, { "epoch": 0.08987034698710988, "grad_norm": 1.375, "learning_rate": 4.4651757056652e-05, "loss": 1.2005475997924804, "num_input_tokens_seen": 721313088, "step": 2540, "train_runtime": 24693.1613, "train_tokens_per_second": 29211.047 }, { "epoch": 0.09022416725083866, "grad_norm": 1.359375, "learning_rate": 4.463396254868968e-05, "loss": 1.2158756256103516, "num_input_tokens_seen": 724171456, "step": 2550, "train_runtime": 24793.0683, "train_tokens_per_second": 29208.626 }, { "epoch": 0.09057798751456744, "grad_norm": 1.5078125, "learning_rate": 4.461618929805519e-05, "loss": 1.2183591842651367, "num_input_tokens_seen": 727007232, "step": 2560, "train_runtime": 24891.7148, "train_tokens_per_second": 29206.796 }, { "epoch": 0.09093180777829622, "grad_norm": 1.46875, "learning_rate": 4.459843726245888e-05, "loss": 1.218313503265381, "num_input_tokens_seen": 729885696, "step": 2570, "train_runtime": 24988.5633, "train_tokens_per_second": 29208.79 }, { "epoch": 0.091285628042025, "grad_norm": 1.421875, "learning_rate": 4.458070639972875e-05, "loss": 1.2011194229125977, "num_input_tokens_seen": 732750016, "step": 2580, "train_runtime": 25085.7208, "train_tokens_per_second": 29209.845 }, { "epoch": 0.09163944830575378, "grad_norm": 1.390625, "learning_rate": 4.456299666781007e-05, "loss": 1.190675926208496, "num_input_tokens_seen": 735551168, "step": 2590, "train_runtime": 25178.9671, "train_tokens_per_second": 29212.921 }, { "epoch": 0.09199326856948256, "grad_norm": 1.390625, "learning_rate": 4.4545308024764984e-05, "loss": 1.208780288696289, "num_input_tokens_seen": 738383808, "step": 2600, "train_runtime": 25279.1051, "train_tokens_per_second": 29209.254 }, { "epoch": 0.09234708883321134, "grad_norm": 1.453125, "learning_rate": 4.452764042877207e-05, "loss": 1.2048264503479005, "num_input_tokens_seen": 741271168, "step": 2610, "train_runtime": 25377.7877, "train_tokens_per_second": 29209.448 }, { "epoch": 0.09270090909694012, "grad_norm": 1.46875, "learning_rate": 4.45099938381259e-05, "loss": 1.2072249412536622, "num_input_tokens_seen": 744088896, "step": 2620, "train_runtime": 25474.1285, "train_tokens_per_second": 29209.592 }, { "epoch": 0.0930547293606689, "grad_norm": 1.453125, "learning_rate": 4.449236821123667e-05, "loss": 1.2159435272216796, "num_input_tokens_seen": 746930688, "step": 2630, "train_runtime": 25569.9338, "train_tokens_per_second": 29211.288 }, { "epoch": 0.09340854962439768, "grad_norm": 1.3515625, "learning_rate": 4.447476350662976e-05, "loss": 1.2045675277709962, "num_input_tokens_seen": 749821440, "step": 2640, "train_runtime": 25670.1256, "train_tokens_per_second": 29209.886 }, { "epoch": 0.09376236988812646, "grad_norm": 1.3359375, "learning_rate": 4.4457179682945346e-05, "loss": 1.1950159072875977, "num_input_tokens_seen": 752690176, "step": 2650, "train_runtime": 25769.5087, "train_tokens_per_second": 29208.557 }, { "epoch": 0.09411619015185524, "grad_norm": 1.375, "learning_rate": 4.443961669893798e-05, "loss": 1.1952871322631835, "num_input_tokens_seen": 755524736, "step": 2660, "train_runtime": 25866.5417, "train_tokens_per_second": 29208.572 }, { "epoch": 0.09447001041558402, "grad_norm": 1.40625, "learning_rate": 4.4422074513476155e-05, "loss": 1.217361831665039, "num_input_tokens_seen": 758300864, "step": 2670, "train_runtime": 25960.4008, "train_tokens_per_second": 29209.906 }, { "epoch": 0.0948238306793128, "grad_norm": 1.515625, "learning_rate": 4.4404553085541955e-05, "loss": 1.183639907836914, "num_input_tokens_seen": 761173376, "step": 2680, "train_runtime": 26056.1744, "train_tokens_per_second": 29212.783 }, { "epoch": 0.09517765094304158, "grad_norm": 1.4140625, "learning_rate": 4.438705237423063e-05, "loss": 1.196107769012451, "num_input_tokens_seen": 764039808, "step": 2690, "train_runtime": 26152.4055, "train_tokens_per_second": 29214.896 }, { "epoch": 0.09553147120677036, "grad_norm": 1.4296875, "learning_rate": 4.436957233875017e-05, "loss": 1.1997604370117188, "num_input_tokens_seen": 766838592, "step": 2700, "train_runtime": 26247.4442, "train_tokens_per_second": 29215.743 }, { "epoch": 0.09588529147049912, "grad_norm": 1.4140625, "learning_rate": 4.4352112938420956e-05, "loss": 1.194338035583496, "num_input_tokens_seen": 769722496, "step": 2710, "train_runtime": 26347.254, "train_tokens_per_second": 29214.524 }, { "epoch": 0.0962391117342279, "grad_norm": 1.359375, "learning_rate": 4.433467413267529e-05, "loss": 1.214699649810791, "num_input_tokens_seen": 772516544, "step": 2720, "train_runtime": 26443.1311, "train_tokens_per_second": 29214.261 }, { "epoch": 0.09659293199795668, "grad_norm": 1.453125, "learning_rate": 4.431725588105708e-05, "loss": 1.2045160293579102, "num_input_tokens_seen": 775288064, "step": 2730, "train_runtime": 26538.1636, "train_tokens_per_second": 29214.081 }, { "epoch": 0.09694675226168546, "grad_norm": 1.453125, "learning_rate": 4.4299858143221377e-05, "loss": 1.2014851570129395, "num_input_tokens_seen": 778139008, "step": 2740, "train_runtime": 26636.0213, "train_tokens_per_second": 29213.785 }, { "epoch": 0.09730057252541424, "grad_norm": 1.421875, "learning_rate": 4.4282480878934065e-05, "loss": 1.2017187118530273, "num_input_tokens_seen": 781009600, "step": 2750, "train_runtime": 26734.791, "train_tokens_per_second": 29213.23 }, { "epoch": 0.09765439278914302, "grad_norm": 1.4453125, "learning_rate": 4.4265124048071346e-05, "loss": 1.2163751602172852, "num_input_tokens_seen": 783864896, "step": 2760, "train_runtime": 26836.8976, "train_tokens_per_second": 29208.477 }, { "epoch": 0.0980082130528718, "grad_norm": 1.421875, "learning_rate": 4.4247787610619477e-05, "loss": 1.2004958152770997, "num_input_tokens_seen": 786664128, "step": 2770, "train_runtime": 26931.3977, "train_tokens_per_second": 29209.926 }, { "epoch": 0.09836203331660058, "grad_norm": 1.4296875, "learning_rate": 4.42304715266743e-05, "loss": 1.2016335487365724, "num_input_tokens_seen": 789491136, "step": 2780, "train_runtime": 27028.9694, "train_tokens_per_second": 29209.073 }, { "epoch": 0.09871585358032936, "grad_norm": 1.421875, "learning_rate": 4.421317575644092e-05, "loss": 1.202066707611084, "num_input_tokens_seen": 792327488, "step": 2790, "train_runtime": 27126.2188, "train_tokens_per_second": 29208.918 }, { "epoch": 0.09906967384405814, "grad_norm": 1.421875, "learning_rate": 4.419590026023325e-05, "loss": 1.1856679916381836, "num_input_tokens_seen": 795147904, "step": 2800, "train_runtime": 27225.5987, "train_tokens_per_second": 29205.892 }, { "epoch": 0.09942349410778692, "grad_norm": 1.390625, "learning_rate": 4.417864499847368e-05, "loss": 1.1965105056762695, "num_input_tokens_seen": 797988288, "step": 2810, "train_runtime": 27321.0049, "train_tokens_per_second": 29207.867 }, { "epoch": 0.0997773143715157, "grad_norm": 1.4609375, "learning_rate": 4.4161409931692676e-05, "loss": 1.1999900817871094, "num_input_tokens_seen": 800824704, "step": 2820, "train_runtime": 27417.1188, "train_tokens_per_second": 29208.93 }, { "epoch": 0.10013113463524448, "grad_norm": 1.40625, "learning_rate": 4.414419502052841e-05, "loss": 1.1976238250732423, "num_input_tokens_seen": 803713152, "step": 2830, "train_runtime": 27517.7694, "train_tokens_per_second": 29207.06 }, { "epoch": 0.10048495489897326, "grad_norm": 1.3671875, "learning_rate": 4.412700022572637e-05, "loss": 1.198695182800293, "num_input_tokens_seen": 806536128, "step": 2840, "train_runtime": 27614.9268, "train_tokens_per_second": 29206.528 }, { "epoch": 0.10083877516270204, "grad_norm": 1.421875, "learning_rate": 4.410982550813902e-05, "loss": 1.1939813613891601, "num_input_tokens_seen": 809369600, "step": 2850, "train_runtime": 27710.2314, "train_tokens_per_second": 29208.331 }, { "epoch": 0.10119259542643082, "grad_norm": 1.40625, "learning_rate": 4.409267082872535e-05, "loss": 1.1966314315795898, "num_input_tokens_seen": 812267648, "step": 2860, "train_runtime": 27813.2768, "train_tokens_per_second": 29204.313 }, { "epoch": 0.1015464156901596, "grad_norm": 1.4140625, "learning_rate": 4.407553614855059e-05, "loss": 1.1915521621704102, "num_input_tokens_seen": 815092928, "step": 2870, "train_runtime": 27910.609, "train_tokens_per_second": 29203.696 }, { "epoch": 0.10190023595388838, "grad_norm": 1.5, "learning_rate": 4.405842142878579e-05, "loss": 1.1902820587158203, "num_input_tokens_seen": 817994752, "step": 2880, "train_runtime": 28010.5023, "train_tokens_per_second": 29203.145 }, { "epoch": 0.10225405621761716, "grad_norm": 1.4453125, "learning_rate": 4.404132663070745e-05, "loss": 1.1870713233947754, "num_input_tokens_seen": 820838144, "step": 2890, "train_runtime": 28105.8878, "train_tokens_per_second": 29205.202 }, { "epoch": 0.10260787648134594, "grad_norm": 1.4921875, "learning_rate": 4.402425171569716e-05, "loss": 1.1928697586059571, "num_input_tokens_seen": 823684480, "step": 2900, "train_runtime": 28204.6686, "train_tokens_per_second": 29203.835 }, { "epoch": 0.10296169674507472, "grad_norm": 1.4609375, "learning_rate": 4.400719664524127e-05, "loss": 1.197272777557373, "num_input_tokens_seen": 826506304, "step": 2910, "train_runtime": 28301.1778, "train_tokens_per_second": 29203.954 }, { "epoch": 0.1033155170088035, "grad_norm": 1.375, "learning_rate": 4.399016138093044e-05, "loss": 1.2012823104858399, "num_input_tokens_seen": 829323264, "step": 2920, "train_runtime": 28398.6908, "train_tokens_per_second": 29202.87 }, { "epoch": 0.10366933727253227, "grad_norm": 1.4609375, "learning_rate": 4.397314588445937e-05, "loss": 1.2069860458374024, "num_input_tokens_seen": 832161984, "step": 2930, "train_runtime": 28495.2588, "train_tokens_per_second": 29203.524 }, { "epoch": 0.10402315753626105, "grad_norm": 1.375, "learning_rate": 4.395615011762637e-05, "loss": 1.195295238494873, "num_input_tokens_seen": 834996416, "step": 2940, "train_runtime": 28591.0724, "train_tokens_per_second": 29204.795 }, { "epoch": 0.10437697779998983, "grad_norm": 1.3828125, "learning_rate": 4.3939174042333057e-05, "loss": 1.2002138137817382, "num_input_tokens_seen": 837916736, "step": 2950, "train_runtime": 28691.9256, "train_tokens_per_second": 29203.921 }, { "epoch": 0.10473079806371861, "grad_norm": 1.4296875, "learning_rate": 4.3922217620583904e-05, "loss": 1.203592014312744, "num_input_tokens_seen": 840767040, "step": 2960, "train_runtime": 28789.0314, "train_tokens_per_second": 29204.423 }, { "epoch": 0.10508461832744738, "grad_norm": 1.453125, "learning_rate": 4.3905280814486025e-05, "loss": 1.1943778038024901, "num_input_tokens_seen": 843630912, "step": 2970, "train_runtime": 28889.2004, "train_tokens_per_second": 29202.294 }, { "epoch": 0.10543843859117616, "grad_norm": 1.4375, "learning_rate": 4.388836358624867e-05, "loss": 1.2080059051513672, "num_input_tokens_seen": 846460864, "step": 2980, "train_runtime": 28985.7047, "train_tokens_per_second": 29202.701 }, { "epoch": 0.10579225885490494, "grad_norm": 1.3984375, "learning_rate": 4.3871465898182976e-05, "loss": 1.192498779296875, "num_input_tokens_seen": 849315712, "step": 2990, "train_runtime": 29082.8192, "train_tokens_per_second": 29203.349 }, { "epoch": 0.10614607911863372, "grad_norm": 1.4765625, "learning_rate": 4.385458771270156e-05, "loss": 1.209206771850586, "num_input_tokens_seen": 852171840, "step": 3000, "train_runtime": 29180.664, "train_tokens_per_second": 29203.305 }, { "epoch": 0.1064998993823625, "grad_norm": 1.390625, "learning_rate": 4.3837728992318205e-05, "loss": 1.181245994567871, "num_input_tokens_seen": 855081664, "step": 3010, "train_runtime": 29282.3022, "train_tokens_per_second": 29201.313 }, { "epoch": 0.10685371964609128, "grad_norm": 1.421875, "learning_rate": 4.382088969964746e-05, "loss": 1.1841010093688964, "num_input_tokens_seen": 857962944, "step": 3020, "train_runtime": 29383.1457, "train_tokens_per_second": 29199.152 }, { "epoch": 0.10720753990982006, "grad_norm": 1.359375, "learning_rate": 4.380406979740436e-05, "loss": 1.1869535446166992, "num_input_tokens_seen": 860796160, "step": 3030, "train_runtime": 29479.4075, "train_tokens_per_second": 29199.914 }, { "epoch": 0.10756136017354884, "grad_norm": 1.4375, "learning_rate": 4.3787269248403994e-05, "loss": 1.1952959060668946, "num_input_tokens_seen": 863619072, "step": 3040, "train_runtime": 29577.2786, "train_tokens_per_second": 29198.733 }, { "epoch": 0.10791518043727762, "grad_norm": 1.390625, "learning_rate": 4.377048801556126e-05, "loss": 1.1918405532836913, "num_input_tokens_seen": 866453888, "step": 3050, "train_runtime": 29673.0985, "train_tokens_per_second": 29199.98 }, { "epoch": 0.1082690007010064, "grad_norm": 1.375, "learning_rate": 4.3753726061890446e-05, "loss": 1.189606285095215, "num_input_tokens_seen": 869239744, "step": 3060, "train_runtime": 29767.6504, "train_tokens_per_second": 29200.818 }, { "epoch": 0.10862282096473518, "grad_norm": 1.4375, "learning_rate": 4.373698335050488e-05, "loss": 1.1768980026245117, "num_input_tokens_seen": 872085568, "step": 3070, "train_runtime": 29866.9994, "train_tokens_per_second": 29198.968 }, { "epoch": 0.10897664122846396, "grad_norm": 1.4609375, "learning_rate": 4.372025984461667e-05, "loss": 1.194584274291992, "num_input_tokens_seen": 874937024, "step": 3080, "train_runtime": 29966.9065, "train_tokens_per_second": 29196.775 }, { "epoch": 0.10933046149219273, "grad_norm": 1.390625, "learning_rate": 4.370355550753629e-05, "loss": 1.1898836135864257, "num_input_tokens_seen": 877781248, "step": 3090, "train_runtime": 30063.6946, "train_tokens_per_second": 29197.384 }, { "epoch": 0.10968428175592151, "grad_norm": 1.375, "learning_rate": 4.368687030267226e-05, "loss": 1.201324462890625, "num_input_tokens_seen": 880572416, "step": 3100, "train_runtime": 30155.131, "train_tokens_per_second": 29201.412 }, { "epoch": 0.1100381020196503, "grad_norm": 1.484375, "learning_rate": 4.367020419353081e-05, "loss": 1.1825067520141601, "num_input_tokens_seen": 883425984, "step": 3110, "train_runtime": 30252.9592, "train_tokens_per_second": 29201.308 }, { "epoch": 0.11039192228337907, "grad_norm": 1.359375, "learning_rate": 4.365355714371558e-05, "loss": 1.1842081069946289, "num_input_tokens_seen": 886238272, "step": 3120, "train_runtime": 30347.0201, "train_tokens_per_second": 29203.469 }, { "epoch": 0.11074574254710785, "grad_norm": 1.3671875, "learning_rate": 4.3636929116927235e-05, "loss": 1.1948518753051758, "num_input_tokens_seen": 889061760, "step": 3130, "train_runtime": 30445.2537, "train_tokens_per_second": 29201.982 }, { "epoch": 0.11109956281083663, "grad_norm": 1.4375, "learning_rate": 4.362032007696314e-05, "loss": 1.1665071487426757, "num_input_tokens_seen": 891973888, "step": 3140, "train_runtime": 30546.3933, "train_tokens_per_second": 29200.629 }, { "epoch": 0.11145338307456541, "grad_norm": 1.4765625, "learning_rate": 4.360372998771707e-05, "loss": 1.1946119308471679, "num_input_tokens_seen": 894815232, "step": 3150, "train_runtime": 30643.8524, "train_tokens_per_second": 29200.481 }, { "epoch": 0.11180720333829419, "grad_norm": 1.4140625, "learning_rate": 4.358715881317884e-05, "loss": 1.1860280990600587, "num_input_tokens_seen": 897675520, "step": 3160, "train_runtime": 30741.6034, "train_tokens_per_second": 29200.673 }, { "epoch": 0.11216102360202297, "grad_norm": 1.4140625, "learning_rate": 4.357060651743399e-05, "loss": 1.1771388053894043, "num_input_tokens_seen": 900471808, "step": 3170, "train_runtime": 30835.7744, "train_tokens_per_second": 29202.179 }, { "epoch": 0.11251484386575175, "grad_norm": 1.34375, "learning_rate": 4.3554073064663454e-05, "loss": 1.1875066757202148, "num_input_tokens_seen": 903332224, "step": 3180, "train_runtime": 30933.4199, "train_tokens_per_second": 29202.469 }, { "epoch": 0.11286866412948053, "grad_norm": 1.3671875, "learning_rate": 4.353755841914325e-05, "loss": 1.1925976753234864, "num_input_tokens_seen": 906127424, "step": 3190, "train_runtime": 31029.297, "train_tokens_per_second": 29202.319 }, { "epoch": 0.11322248439320931, "grad_norm": 1.515625, "learning_rate": 4.3521062545244116e-05, "loss": 1.1901744842529296, "num_input_tokens_seen": 908971136, "step": 3200, "train_runtime": 31127.8529, "train_tokens_per_second": 29201.215 }, { "epoch": 0.11357630465693809, "grad_norm": 1.390625, "learning_rate": 4.350458540743126e-05, "loss": 1.188551902770996, "num_input_tokens_seen": 911782080, "step": 3210, "train_runtime": 31222.2894, "train_tokens_per_second": 29202.922 }, { "epoch": 0.11393012492066686, "grad_norm": 1.40625, "learning_rate": 4.3488126970263955e-05, "loss": 1.1836232185363769, "num_input_tokens_seen": 914660992, "step": 3220, "train_runtime": 31321.8772, "train_tokens_per_second": 29201.985 }, { "epoch": 0.11428394518439564, "grad_norm": 1.4140625, "learning_rate": 4.347168719839527e-05, "loss": 1.1906529426574708, "num_input_tokens_seen": 917527296, "step": 3230, "train_runtime": 31417.5016, "train_tokens_per_second": 29204.337 }, { "epoch": 0.11463776544812442, "grad_norm": 1.40625, "learning_rate": 4.345526605657173e-05, "loss": 1.181631851196289, "num_input_tokens_seen": 920384640, "step": 3240, "train_runtime": 31516.4165, "train_tokens_per_second": 29203.34 }, { "epoch": 0.1149915857118532, "grad_norm": 1.4375, "learning_rate": 4.343886350963304e-05, "loss": 1.1828688621520995, "num_input_tokens_seen": 923238016, "step": 3250, "train_runtime": 31615.9212, "train_tokens_per_second": 29201.68 }, { "epoch": 0.11534540597558197, "grad_norm": 1.359375, "learning_rate": 4.3422479522511697e-05, "loss": 1.1837403297424316, "num_input_tokens_seen": 926139264, "step": 3260, "train_runtime": 31719.5933, "train_tokens_per_second": 29197.703 }, { "epoch": 0.11569922623931075, "grad_norm": 1.46875, "learning_rate": 4.340611406023272e-05, "loss": 1.1957791328430176, "num_input_tokens_seen": 928941120, "step": 3270, "train_runtime": 31812.4078, "train_tokens_per_second": 29200.591 }, { "epoch": 0.11605304650303953, "grad_norm": 1.4296875, "learning_rate": 4.338976708791336e-05, "loss": 1.1935272216796875, "num_input_tokens_seen": 931777472, "step": 3280, "train_runtime": 31909.518, "train_tokens_per_second": 29200.613 }, { "epoch": 0.11640686676676831, "grad_norm": 1.4921875, "learning_rate": 4.337343857076272e-05, "loss": 1.1873862266540527, "num_input_tokens_seen": 934654080, "step": 3290, "train_runtime": 32009.69, "train_tokens_per_second": 29199.098 }, { "epoch": 0.11676068703049709, "grad_norm": 1.4453125, "learning_rate": 4.33571284740815e-05, "loss": 1.1853967666625977, "num_input_tokens_seen": 937466048, "step": 3300, "train_runtime": 32105.4885, "train_tokens_per_second": 29199.557 }, { "epoch": 0.11711450729422587, "grad_norm": 1.4453125, "learning_rate": 4.3340836763261675e-05, "loss": 1.1915245056152344, "num_input_tokens_seen": 940354688, "step": 3310, "train_runtime": 32207.2972, "train_tokens_per_second": 29196.945 }, { "epoch": 0.11746832755795465, "grad_norm": 1.4609375, "learning_rate": 4.332456340378618e-05, "loss": 1.1804960250854493, "num_input_tokens_seen": 943173696, "step": 3320, "train_runtime": 32303.3354, "train_tokens_per_second": 29197.409 }, { "epoch": 0.11782214782168343, "grad_norm": 1.359375, "learning_rate": 4.3308308361228586e-05, "loss": 1.18006591796875, "num_input_tokens_seen": 946035008, "step": 3330, "train_runtime": 32402.3813, "train_tokens_per_second": 29196.466 }, { "epoch": 0.11817596808541221, "grad_norm": 1.4453125, "learning_rate": 4.329207160125282e-05, "loss": 1.1822134017944337, "num_input_tokens_seen": 948837056, "step": 3340, "train_runtime": 32496.2654, "train_tokens_per_second": 29198.342 }, { "epoch": 0.11852978834914099, "grad_norm": 1.296875, "learning_rate": 4.327585308961287e-05, "loss": 1.1795909881591797, "num_input_tokens_seen": 951684928, "step": 3350, "train_runtime": 32594.652, "train_tokens_per_second": 29197.579 }, { "epoch": 0.11888360861286977, "grad_norm": 1.4375, "learning_rate": 4.325965279215243e-05, "loss": 1.1808343887329102, "num_input_tokens_seen": 954490496, "step": 3360, "train_runtime": 32687.8398, "train_tokens_per_second": 29200.17 }, { "epoch": 0.11923742887659855, "grad_norm": 1.4609375, "learning_rate": 4.3243470674804686e-05, "loss": 1.1711687088012694, "num_input_tokens_seen": 957301120, "step": 3370, "train_runtime": 32782.7263, "train_tokens_per_second": 29201.388 }, { "epoch": 0.11959124914032733, "grad_norm": 1.359375, "learning_rate": 4.3227306703591904e-05, "loss": 1.176078987121582, "num_input_tokens_seen": 960131584, "step": 3380, "train_runtime": 32878.1754, "train_tokens_per_second": 29202.703 }, { "epoch": 0.11994506940405611, "grad_norm": 1.390625, "learning_rate": 4.32111608446252e-05, "loss": 1.1693265914916993, "num_input_tokens_seen": 962939648, "step": 3390, "train_runtime": 32970.497, "train_tokens_per_second": 29206.1 }, { "epoch": 0.12029888966778489, "grad_norm": 1.390625, "learning_rate": 4.319503306410426e-05, "loss": 1.1904790878295899, "num_input_tokens_seen": 965777408, "step": 3400, "train_runtime": 33063.1117, "train_tokens_per_second": 29210.118 }, { "epoch": 0.12065270993151367, "grad_norm": 1.4921875, "learning_rate": 4.317892332831699e-05, "loss": 1.167193603515625, "num_input_tokens_seen": 968573504, "step": 3410, "train_runtime": 33155.8555, "train_tokens_per_second": 29212.744 }, { "epoch": 0.12100653019524245, "grad_norm": 1.4375, "learning_rate": 4.316283160363922e-05, "loss": 1.1785587310791015, "num_input_tokens_seen": 971386240, "step": 3420, "train_runtime": 33249.7383, "train_tokens_per_second": 29214.854 }, { "epoch": 0.12136035045897123, "grad_norm": 1.4375, "learning_rate": 4.314675785653447e-05, "loss": 1.1811996459960938, "num_input_tokens_seen": 974241984, "step": 3430, "train_runtime": 33349.1071, "train_tokens_per_second": 29213.435 }, { "epoch": 0.12171417072270001, "grad_norm": 1.4453125, "learning_rate": 4.3130702053553606e-05, "loss": 1.1894235610961914, "num_input_tokens_seen": 977055936, "step": 3440, "train_runtime": 33442.9489, "train_tokens_per_second": 29215.604 }, { "epoch": 0.12206799098642879, "grad_norm": 1.4140625, "learning_rate": 4.3114664161334546e-05, "loss": 1.1872685432434082, "num_input_tokens_seen": 979927168, "step": 3450, "train_runtime": 33540.5123, "train_tokens_per_second": 29216.225 }, { "epoch": 0.12242181125015757, "grad_norm": 1.4140625, "learning_rate": 4.3098644146601984e-05, "loss": 1.1752504348754882, "num_input_tokens_seen": 982789760, "step": 3460, "train_runtime": 33640.5354, "train_tokens_per_second": 29214.451 }, { "epoch": 0.12277563151388635, "grad_norm": 1.40625, "learning_rate": 4.30826419761671e-05, "loss": 1.1864883422851562, "num_input_tokens_seen": 985613760, "step": 3470, "train_runtime": 33736.1035, "train_tokens_per_second": 29215.4 }, { "epoch": 0.12312945177761511, "grad_norm": 1.3828125, "learning_rate": 4.30666576169273e-05, "loss": 1.1909018516540528, "num_input_tokens_seen": 988397824, "step": 3480, "train_runtime": 33826.3807, "train_tokens_per_second": 29219.733 }, { "epoch": 0.12348327204134389, "grad_norm": 1.4140625, "learning_rate": 4.305069103586585e-05, "loss": 1.1829191207885743, "num_input_tokens_seen": 991241024, "step": 3490, "train_runtime": 33919.963, "train_tokens_per_second": 29222.939 }, { "epoch": 0.12383709230507267, "grad_norm": 1.4765625, "learning_rate": 4.303474220005164e-05, "loss": 1.1854116439819335, "num_input_tokens_seen": 994065856, "step": 3500, "train_runtime": 34013.7704, "train_tokens_per_second": 29225.394 }, { "epoch": 0.12419091256880145, "grad_norm": 1.4296875, "learning_rate": 4.3018811076638944e-05, "loss": 1.1804745674133301, "num_input_tokens_seen": 996866560, "step": 3510, "train_runtime": 34109.8402, "train_tokens_per_second": 29225.19 }, { "epoch": 0.12454473283253023, "grad_norm": 1.34375, "learning_rate": 4.300289763286704e-05, "loss": 1.177566146850586, "num_input_tokens_seen": 999720064, "step": 3520, "train_runtime": 34206.0193, "train_tokens_per_second": 29226.437 }, { "epoch": 0.12489855309625901, "grad_norm": 1.3203125, "learning_rate": 4.298700183606e-05, "loss": 1.1937307357788085, "num_input_tokens_seen": 1002563968, "step": 3530, "train_runtime": 34304.3059, "train_tokens_per_second": 29225.601 }, { "epoch": 0.1252523733599878, "grad_norm": 1.5625, "learning_rate": 4.297112365362637e-05, "loss": 1.1904770851135253, "num_input_tokens_seen": 1005402176, "step": 3540, "train_runtime": 34400.0585, "train_tokens_per_second": 29226.758 }, { "epoch": 0.12560619362371658, "grad_norm": 1.328125, "learning_rate": 4.295526305305891e-05, "loss": 1.1810283660888672, "num_input_tokens_seen": 1008258880, "step": 3550, "train_runtime": 34496.5586, "train_tokens_per_second": 29227.811 }, { "epoch": 0.12596001388744535, "grad_norm": 1.46875, "learning_rate": 4.293942000193429e-05, "loss": 1.1796077728271483, "num_input_tokens_seen": 1011047872, "step": 3560, "train_runtime": 34590.6535, "train_tokens_per_second": 29228.932 }, { "epoch": 0.12631383415117414, "grad_norm": 1.3984375, "learning_rate": 4.2923594467912866e-05, "loss": 1.1729990005493165, "num_input_tokens_seen": 1013899392, "step": 3570, "train_runtime": 34685.7749, "train_tokens_per_second": 29230.986 }, { "epoch": 0.1266676544149029, "grad_norm": 1.390625, "learning_rate": 4.290778641873832e-05, "loss": 1.202324676513672, "num_input_tokens_seen": 1016776256, "step": 3580, "train_runtime": 34783.0605, "train_tokens_per_second": 29231.938 }, { "epoch": 0.1270214746786317, "grad_norm": 1.4453125, "learning_rate": 4.2891995822237455e-05, "loss": 1.173007106781006, "num_input_tokens_seen": 1019636224, "step": 3590, "train_runtime": 34879.8305, "train_tokens_per_second": 29232.832 }, { "epoch": 0.12737529494236047, "grad_norm": 1.3828125, "learning_rate": 4.28762226463199e-05, "loss": 1.1899112701416015, "num_input_tokens_seen": 1022491264, "step": 3600, "train_runtime": 34977.4571, "train_tokens_per_second": 29232.864 }, { "epoch": 0.12772911520608923, "grad_norm": 1.3515625, "learning_rate": 4.286046685897781e-05, "loss": 1.1736169815063477, "num_input_tokens_seen": 1025290688, "step": 3610, "train_runtime": 35070.8437, "train_tokens_per_second": 29234.845 }, { "epoch": 0.12808293546981803, "grad_norm": 1.4609375, "learning_rate": 4.284472842828562e-05, "loss": 1.1902640342712403, "num_input_tokens_seen": 1028080896, "step": 3620, "train_runtime": 35162.0416, "train_tokens_per_second": 29238.373 }, { "epoch": 0.1284367557335468, "grad_norm": 1.359375, "learning_rate": 4.282900732239977e-05, "loss": 1.1653921127319335, "num_input_tokens_seen": 1030951360, "step": 3630, "train_runtime": 35258.9416, "train_tokens_per_second": 29239.43 }, { "epoch": 0.12879057599727559, "grad_norm": 1.4140625, "learning_rate": 4.281330350955845e-05, "loss": 1.1851133346557616, "num_input_tokens_seen": 1033796352, "step": 3640, "train_runtime": 35356.2581, "train_tokens_per_second": 29239.416 }, { "epoch": 0.12914439626100435, "grad_norm": 1.4765625, "learning_rate": 4.279761695808125e-05, "loss": 1.1738685607910155, "num_input_tokens_seen": 1036626624, "step": 3650, "train_runtime": 35453.2762, "train_tokens_per_second": 29239.234 }, { "epoch": 0.12949821652473315, "grad_norm": 1.421875, "learning_rate": 4.278194763636904e-05, "loss": 1.1984460830688477, "num_input_tokens_seen": 1039479552, "step": 3660, "train_runtime": 35552.3888, "train_tokens_per_second": 29237.966 }, { "epoch": 0.1298520367884619, "grad_norm": 1.421875, "learning_rate": 4.276629551290354e-05, "loss": 1.1884843826293945, "num_input_tokens_seen": 1042291904, "step": 3670, "train_runtime": 35648.7259, "train_tokens_per_second": 29237.845 }, { "epoch": 0.1302058570521907, "grad_norm": 1.46875, "learning_rate": 4.2750660556247175e-05, "loss": 1.179736042022705, "num_input_tokens_seen": 1045103104, "step": 3680, "train_runtime": 35745.796, "train_tokens_per_second": 29237.091 }, { "epoch": 0.13055967731591947, "grad_norm": 1.4296875, "learning_rate": 4.273504273504274e-05, "loss": 1.1895154953002929, "num_input_tokens_seen": 1047985280, "step": 3690, "train_runtime": 35843.7208, "train_tokens_per_second": 29237.625 }, { "epoch": 0.13091349757964826, "grad_norm": 1.40625, "learning_rate": 4.271944201801317e-05, "loss": 1.1777228355407714, "num_input_tokens_seen": 1050893376, "step": 3700, "train_runtime": 35943.6029, "train_tokens_per_second": 29237.285 }, { "epoch": 0.13126731784337703, "grad_norm": 1.4375, "learning_rate": 4.270385837396127e-05, "loss": 1.182157325744629, "num_input_tokens_seen": 1053785536, "step": 3710, "train_runtime": 36043.3147, "train_tokens_per_second": 29236.643 }, { "epoch": 0.13162113810710582, "grad_norm": 1.3984375, "learning_rate": 4.268829177176945e-05, "loss": 1.1841708183288575, "num_input_tokens_seen": 1056617280, "step": 3720, "train_runtime": 36137.0049, "train_tokens_per_second": 29239.205 }, { "epoch": 0.1319749583708346, "grad_norm": 1.40625, "learning_rate": 4.2672742180399455e-05, "loss": 1.1797069549560546, "num_input_tokens_seen": 1059486912, "step": 3730, "train_runtime": 36235.2429, "train_tokens_per_second": 29239.128 }, { "epoch": 0.13232877863456338, "grad_norm": 1.3671875, "learning_rate": 4.265720956889213e-05, "loss": 1.1824552536010742, "num_input_tokens_seen": 1062342016, "step": 3740, "train_runtime": 36332.7711, "train_tokens_per_second": 29239.224 }, { "epoch": 0.13268259889829215, "grad_norm": 1.4140625, "learning_rate": 4.2641693906367113e-05, "loss": 1.1785259246826172, "num_input_tokens_seen": 1065209920, "step": 3750, "train_runtime": 36433.6906, "train_tokens_per_second": 29236.948 }, { "epoch": 0.13303641916202094, "grad_norm": 1.3671875, "learning_rate": 4.2626195162022646e-05, "loss": 1.1788436889648437, "num_input_tokens_seen": 1068011200, "step": 3760, "train_runtime": 36527.7044, "train_tokens_per_second": 29238.388 }, { "epoch": 0.1333902394257497, "grad_norm": 1.3984375, "learning_rate": 4.2610713305135255e-05, "loss": 1.1807544708251954, "num_input_tokens_seen": 1070900608, "step": 3770, "train_runtime": 36629.5791, "train_tokens_per_second": 29235.952 }, { "epoch": 0.1337440596894785, "grad_norm": 1.359375, "learning_rate": 4.2595248305059546e-05, "loss": 1.1695978164672851, "num_input_tokens_seen": 1073795328, "step": 3780, "train_runtime": 36730.9848, "train_tokens_per_second": 29234.047 }, { "epoch": 0.13409787995320727, "grad_norm": 1.4140625, "learning_rate": 4.2579800131227916e-05, "loss": 1.1728618621826172, "num_input_tokens_seen": 1076604416, "step": 3790, "train_runtime": 36825.2397, "train_tokens_per_second": 29235.503 }, { "epoch": 0.13445170021693606, "grad_norm": 1.375, "learning_rate": 4.256436875315028e-05, "loss": 1.1714584350585937, "num_input_tokens_seen": 1079443520, "step": 3800, "train_runtime": 36918.4298, "train_tokens_per_second": 29238.609 }, { "epoch": 0.13480552048066483, "grad_norm": 1.4609375, "learning_rate": 4.2548954140413895e-05, "loss": 1.1774912834167481, "num_input_tokens_seen": 1082304064, "step": 3810, "train_runtime": 37015.0972, "train_tokens_per_second": 29239.53 }, { "epoch": 0.13515934074439362, "grad_norm": 1.4140625, "learning_rate": 4.253355626268302e-05, "loss": 1.170922088623047, "num_input_tokens_seen": 1085158976, "step": 3820, "train_runtime": 37113.0647, "train_tokens_per_second": 29239.272 }, { "epoch": 0.13551316100812238, "grad_norm": 1.3828125, "learning_rate": 4.2518175089698716e-05, "loss": 1.1693132400512696, "num_input_tokens_seen": 1088037632, "step": 3830, "train_runtime": 37213.9649, "train_tokens_per_second": 29237.348 }, { "epoch": 0.13586698127185118, "grad_norm": 1.40625, "learning_rate": 4.25028105912786e-05, "loss": 1.1835298538208008, "num_input_tokens_seen": 1090901952, "step": 3840, "train_runtime": 37316.914, "train_tokens_per_second": 29233.445 }, { "epoch": 0.13622080153557994, "grad_norm": 1.390625, "learning_rate": 4.2487462737316565e-05, "loss": 1.1862130165100098, "num_input_tokens_seen": 1093725824, "step": 3850, "train_runtime": 37413.6944, "train_tokens_per_second": 29233.302 }, { "epoch": 0.13657462179930874, "grad_norm": 1.3515625, "learning_rate": 4.2472131497782555e-05, "loss": 1.1785076141357422, "num_input_tokens_seen": 1096502720, "step": 3860, "train_runtime": 37505.278, "train_tokens_per_second": 29235.958 }, { "epoch": 0.1369284420630375, "grad_norm": 1.3671875, "learning_rate": 4.245681684272231e-05, "loss": 1.181657314300537, "num_input_tokens_seen": 1099356800, "step": 3870, "train_runtime": 37602.0285, "train_tokens_per_second": 29236.635 }, { "epoch": 0.13728226232676627, "grad_norm": 1.3984375, "learning_rate": 4.244151874225712e-05, "loss": 1.179312038421631, "num_input_tokens_seen": 1102169280, "step": 3880, "train_runtime": 37696.469, "train_tokens_per_second": 29237.998 }, { "epoch": 0.13763608259049506, "grad_norm": 1.4140625, "learning_rate": 4.2426237166583596e-05, "loss": 1.1605977058410644, "num_input_tokens_seen": 1105003328, "step": 3890, "train_runtime": 37796.0045, "train_tokens_per_second": 29235.983 }, { "epoch": 0.13798990285422383, "grad_norm": 1.375, "learning_rate": 4.241097208597339e-05, "loss": 1.1763355255126953, "num_input_tokens_seen": 1107821184, "step": 3900, "train_runtime": 37890.4228, "train_tokens_per_second": 29237.499 }, { "epoch": 0.13834372311795262, "grad_norm": 1.3828125, "learning_rate": 4.2395723470773005e-05, "loss": 1.1708013534545898, "num_input_tokens_seen": 1110715968, "step": 3910, "train_runtime": 37989.7024, "train_tokens_per_second": 29237.291 }, { "epoch": 0.1386975433816814, "grad_norm": 1.4375, "learning_rate": 4.238049129140347e-05, "loss": 1.1769329071044923, "num_input_tokens_seen": 1113568000, "step": 3920, "train_runtime": 38088.3434, "train_tokens_per_second": 29236.451 }, { "epoch": 0.13905136364541018, "grad_norm": 1.4765625, "learning_rate": 4.236527551836022e-05, "loss": 1.1631412506103516, "num_input_tokens_seen": 1116387136, "step": 3930, "train_runtime": 38183.027, "train_tokens_per_second": 29237.785 }, { "epoch": 0.13940518390913895, "grad_norm": 1.4296875, "learning_rate": 4.235007612221274e-05, "loss": 1.172716999053955, "num_input_tokens_seen": 1119228928, "step": 3940, "train_runtime": 38277.3634, "train_tokens_per_second": 29239.969 }, { "epoch": 0.13975900417286774, "grad_norm": 1.390625, "learning_rate": 4.2334893073604386e-05, "loss": 1.1742752075195313, "num_input_tokens_seen": 1122038912, "step": 3950, "train_runtime": 38370.595, "train_tokens_per_second": 29242.156 }, { "epoch": 0.1401128244365965, "grad_norm": 1.421875, "learning_rate": 4.231972634325214e-05, "loss": 1.1919352531433105, "num_input_tokens_seen": 1124911232, "step": 3960, "train_runtime": 38471.2265, "train_tokens_per_second": 29240.327 }, { "epoch": 0.1404666447003253, "grad_norm": 1.3828125, "learning_rate": 4.230457590194635e-05, "loss": 1.1724810600280762, "num_input_tokens_seen": 1127771200, "step": 3970, "train_runtime": 38569.7353, "train_tokens_per_second": 29239.796 }, { "epoch": 0.14082046496405407, "grad_norm": 1.328125, "learning_rate": 4.228944172055053e-05, "loss": 1.1805822372436523, "num_input_tokens_seen": 1130658240, "step": 3980, "train_runtime": 38669.2246, "train_tokens_per_second": 29239.227 }, { "epoch": 0.14117428522778286, "grad_norm": 1.3984375, "learning_rate": 4.22743237700011e-05, "loss": 1.1816822052001954, "num_input_tokens_seen": 1133511744, "step": 3990, "train_runtime": 38768.2346, "train_tokens_per_second": 29238.157 }, { "epoch": 0.14152810549151162, "grad_norm": 1.4453125, "learning_rate": 4.225922202130716e-05, "loss": 1.1658548355102538, "num_input_tokens_seen": 1136350848, "step": 4000, "train_runtime": 38865.4396, "train_tokens_per_second": 29238.08 }, { "epoch": 0.14188192575524042, "grad_norm": 1.375, "learning_rate": 4.224413644555024e-05, "loss": 1.1686421394348145, "num_input_tokens_seen": 1139143808, "step": 4010, "train_runtime": 38959.2863, "train_tokens_per_second": 29239.34 }, { "epoch": 0.14223574601896918, "grad_norm": 1.46875, "learning_rate": 4.222906701388411e-05, "loss": 1.1757335662841797, "num_input_tokens_seen": 1141969856, "step": 4020, "train_runtime": 39058.2066, "train_tokens_per_second": 29237.642 }, { "epoch": 0.14258956628269798, "grad_norm": 1.4375, "learning_rate": 4.2214013697534466e-05, "loss": 1.1730082511901856, "num_input_tokens_seen": 1144803136, "step": 4030, "train_runtime": 39156.5104, "train_tokens_per_second": 29236.598 }, { "epoch": 0.14294338654642674, "grad_norm": 1.3671875, "learning_rate": 4.219897646779882e-05, "loss": 1.1709014892578125, "num_input_tokens_seen": 1147692672, "step": 4040, "train_runtime": 39259.2997, "train_tokens_per_second": 29233.651 }, { "epoch": 0.14329720681015554, "grad_norm": 1.3828125, "learning_rate": 4.2183955296046145e-05, "loss": 1.1871071815490724, "num_input_tokens_seen": 1150605952, "step": 4050, "train_runtime": 39361.974, "train_tokens_per_second": 29231.409 }, { "epoch": 0.1436510270738843, "grad_norm": 1.3828125, "learning_rate": 4.2168950153716746e-05, "loss": 1.1795658111572265, "num_input_tokens_seen": 1153387008, "step": 4060, "train_runtime": 39455.367, "train_tokens_per_second": 29232.703 }, { "epoch": 0.1440048473376131, "grad_norm": 1.4296875, "learning_rate": 4.215396101232197e-05, "loss": 1.1646547317504883, "num_input_tokens_seen": 1156206208, "step": 4070, "train_runtime": 39549.8734, "train_tokens_per_second": 29234.132 }, { "epoch": 0.14435866760134186, "grad_norm": 1.515625, "learning_rate": 4.213898784344398e-05, "loss": 1.178143310546875, "num_input_tokens_seen": 1159107648, "step": 4080, "train_runtime": 39651.1204, "train_tokens_per_second": 29232.658 }, { "epoch": 0.14471248786507065, "grad_norm": 1.3671875, "learning_rate": 4.21240306187356e-05, "loss": 1.1769689559936523, "num_input_tokens_seen": 1161944576, "step": 4090, "train_runtime": 39748.7419, "train_tokens_per_second": 29232.235 }, { "epoch": 0.14506630812879942, "grad_norm": 1.4296875, "learning_rate": 4.2109089309919967e-05, "loss": 1.176289939880371, "num_input_tokens_seen": 1164828992, "step": 4100, "train_runtime": 39848.5136, "train_tokens_per_second": 29231.429 }, { "epoch": 0.14542012839252821, "grad_norm": 1.46875, "learning_rate": 4.2094163888790445e-05, "loss": 1.1834224700927733, "num_input_tokens_seen": 1167660480, "step": 4110, "train_runtime": 39944.6555, "train_tokens_per_second": 29231.958 }, { "epoch": 0.14577394865625698, "grad_norm": 1.4765625, "learning_rate": 4.2079254327210294e-05, "loss": 1.163860034942627, "num_input_tokens_seen": 1170493056, "step": 4120, "train_runtime": 40043.2845, "train_tokens_per_second": 29230.695 }, { "epoch": 0.14612776891998575, "grad_norm": 1.4453125, "learning_rate": 4.206436059711249e-05, "loss": 1.1672218322753907, "num_input_tokens_seen": 1173303936, "step": 4130, "train_runtime": 40140.6304, "train_tokens_per_second": 29229.833 }, { "epoch": 0.14648158918371454, "grad_norm": 1.3671875, "learning_rate": 4.20494826704995e-05, "loss": 1.1857643127441406, "num_input_tokens_seen": 1176151616, "step": 4140, "train_runtime": 40239.7876, "train_tokens_per_second": 29228.574 }, { "epoch": 0.1468354094474433, "grad_norm": 1.421875, "learning_rate": 4.203462051944307e-05, "loss": 1.176898193359375, "num_input_tokens_seen": 1179087552, "step": 4150, "train_runtime": 40344.3662, "train_tokens_per_second": 29225.581 }, { "epoch": 0.1471892297111721, "grad_norm": 1.4296875, "learning_rate": 4.201977411608398e-05, "loss": 1.180149459838867, "num_input_tokens_seen": 1181852160, "step": 4160, "train_runtime": 40436.6452, "train_tokens_per_second": 29227.255 }, { "epoch": 0.14754304997490086, "grad_norm": 1.375, "learning_rate": 4.200494343263185e-05, "loss": 1.180349063873291, "num_input_tokens_seen": 1184651008, "step": 4170, "train_runtime": 40531.9268, "train_tokens_per_second": 29227.602 }, { "epoch": 0.14789687023862966, "grad_norm": 1.4296875, "learning_rate": 4.1990128441364914e-05, "loss": 1.1600811004638671, "num_input_tokens_seen": 1187485120, "step": 4180, "train_runtime": 40629.2827, "train_tokens_per_second": 29227.322 }, { "epoch": 0.14825069050235842, "grad_norm": 1.4296875, "learning_rate": 4.197532911462977e-05, "loss": 1.1738241195678711, "num_input_tokens_seen": 1190325248, "step": 4190, "train_runtime": 40729.0992, "train_tokens_per_second": 29225.425 }, { "epoch": 0.14860451076608722, "grad_norm": 1.390625, "learning_rate": 4.196054542484125e-05, "loss": 1.1638025283813476, "num_input_tokens_seen": 1193193088, "step": 4200, "train_runtime": 40829.218, "train_tokens_per_second": 29224.0 }, { "epoch": 0.14895833102981598, "grad_norm": 1.4453125, "learning_rate": 4.1945777344482084e-05, "loss": 1.1518236160278321, "num_input_tokens_seen": 1196034560, "step": 4210, "train_runtime": 40925.6326, "train_tokens_per_second": 29224.583 }, { "epoch": 0.14931215129354478, "grad_norm": 1.4296875, "learning_rate": 4.19310248461028e-05, "loss": 1.1800807952880858, "num_input_tokens_seen": 1198912832, "step": 4220, "train_runtime": 41028.757, "train_tokens_per_second": 29221.281 }, { "epoch": 0.14966597155727354, "grad_norm": 1.46875, "learning_rate": 4.1916287902321405e-05, "loss": 1.1695475578308105, "num_input_tokens_seen": 1201798272, "step": 4230, "train_runtime": 41130.2756, "train_tokens_per_second": 29219.31 }, { "epoch": 0.15001979182100234, "grad_norm": 1.4765625, "learning_rate": 4.190156648582328e-05, "loss": 1.1690372467041015, "num_input_tokens_seen": 1204654784, "step": 4240, "train_runtime": 41226.3142, "train_tokens_per_second": 29220.531 }, { "epoch": 0.1503736120847311, "grad_norm": 1.4296875, "learning_rate": 4.188686056936087e-05, "loss": 1.1712785720825196, "num_input_tokens_seen": 1207475008, "step": 4250, "train_runtime": 41321.1014, "train_tokens_per_second": 29221.753 }, { "epoch": 0.1507274323484599, "grad_norm": 1.4296875, "learning_rate": 4.187217012575352e-05, "loss": 1.1590457916259767, "num_input_tokens_seen": 1210316224, "step": 4260, "train_runtime": 41417.3597, "train_tokens_per_second": 29222.438 }, { "epoch": 0.15108125261218866, "grad_norm": 1.375, "learning_rate": 4.185749512788727e-05, "loss": 1.1723502159118653, "num_input_tokens_seen": 1213199552, "step": 4270, "train_runtime": 41515.867, "train_tokens_per_second": 29222.551 }, { "epoch": 0.15143507287591745, "grad_norm": 1.4453125, "learning_rate": 4.184283554871462e-05, "loss": 1.157613182067871, "num_input_tokens_seen": 1216018816, "step": 4280, "train_runtime": 41612.7361, "train_tokens_per_second": 29222.275 }, { "epoch": 0.15178889313964622, "grad_norm": 1.4296875, "learning_rate": 4.1828191361254344e-05, "loss": 1.1705541610717773, "num_input_tokens_seen": 1218848896, "step": 4290, "train_runtime": 41707.2296, "train_tokens_per_second": 29223.924 }, { "epoch": 0.152142713403375, "grad_norm": 1.40625, "learning_rate": 4.181356253859127e-05, "loss": 1.16650447845459, "num_input_tokens_seen": 1221640448, "step": 4300, "train_runtime": 41798.0608, "train_tokens_per_second": 29227.204 }, { "epoch": 0.15249653366710378, "grad_norm": 1.34375, "learning_rate": 4.179894905387606e-05, "loss": 1.1773106575012207, "num_input_tokens_seen": 1224492544, "step": 4310, "train_runtime": 41895.5567, "train_tokens_per_second": 29227.265 }, { "epoch": 0.15285035393083257, "grad_norm": 1.3984375, "learning_rate": 4.178435088032502e-05, "loss": 1.1660337448120117, "num_input_tokens_seen": 1227310592, "step": 4320, "train_runtime": 41991.7216, "train_tokens_per_second": 29227.442 }, { "epoch": 0.15320417419456134, "grad_norm": 1.453125, "learning_rate": 4.176976799121989e-05, "loss": 1.1444032669067383, "num_input_tokens_seen": 1230119616, "step": 4330, "train_runtime": 42088.656, "train_tokens_per_second": 29226.869 }, { "epoch": 0.15355799445829013, "grad_norm": 1.3984375, "learning_rate": 4.1755200359907657e-05, "loss": 1.1619373321533204, "num_input_tokens_seen": 1232923648, "step": 4340, "train_runtime": 42183.2887, "train_tokens_per_second": 29227.774 }, { "epoch": 0.1539118147220189, "grad_norm": 1.3828125, "learning_rate": 4.174064795980028e-05, "loss": 1.1633609771728515, "num_input_tokens_seen": 1235791296, "step": 4350, "train_runtime": 42280.2091, "train_tokens_per_second": 29228.599 }, { "epoch": 0.1542656349857477, "grad_norm": 1.3984375, "learning_rate": 4.17261107643746e-05, "loss": 1.184457015991211, "num_input_tokens_seen": 1238657856, "step": 4360, "train_runtime": 42381.4408, "train_tokens_per_second": 29226.422 }, { "epoch": 0.15461945524947646, "grad_norm": 1.359375, "learning_rate": 4.171158874717204e-05, "loss": 1.167654037475586, "num_input_tokens_seen": 1241488704, "step": 4370, "train_runtime": 42477.304, "train_tokens_per_second": 29227.107 }, { "epoch": 0.15497327551320522, "grad_norm": 1.4453125, "learning_rate": 4.169708188179844e-05, "loss": 1.156892967224121, "num_input_tokens_seen": 1244296576, "step": 4380, "train_runtime": 42570.8106, "train_tokens_per_second": 29228.867 }, { "epoch": 0.15532709577693402, "grad_norm": 1.5078125, "learning_rate": 4.1682590141923846e-05, "loss": 1.1702998161315918, "num_input_tokens_seen": 1247104320, "step": 4390, "train_runtime": 42666.2003, "train_tokens_per_second": 29229.327 }, { "epoch": 0.15568091604066278, "grad_norm": 1.296875, "learning_rate": 4.1668113501282335e-05, "loss": 1.159244918823242, "num_input_tokens_seen": 1249909376, "step": 4400, "train_runtime": 42762.447, "train_tokens_per_second": 29229.136 }, { "epoch": 0.15603473630439157, "grad_norm": 1.4296875, "learning_rate": 4.165365193367178e-05, "loss": 1.165069580078125, "num_input_tokens_seen": 1252730048, "step": 4410, "train_runtime": 42858.7268, "train_tokens_per_second": 29229.287 }, { "epoch": 0.15638855656812034, "grad_norm": 1.453125, "learning_rate": 4.163920541295369e-05, "loss": 1.1761979103088378, "num_input_tokens_seen": 1255548928, "step": 4420, "train_runtime": 42954.4584, "train_tokens_per_second": 29229.77 }, { "epoch": 0.15674237683184913, "grad_norm": 1.46875, "learning_rate": 4.1624773913052946e-05, "loss": 1.1730831146240235, "num_input_tokens_seen": 1258380608, "step": 4430, "train_runtime": 43053.2889, "train_tokens_per_second": 29228.443 }, { "epoch": 0.1570961970955779, "grad_norm": 1.4453125, "learning_rate": 4.161035740795769e-05, "loss": 1.16481351852417, "num_input_tokens_seen": 1261217344, "step": 4440, "train_runtime": 43149.0754, "train_tokens_per_second": 29229.302 }, { "epoch": 0.1574500173593067, "grad_norm": 1.40625, "learning_rate": 4.1595955871719055e-05, "loss": 1.1573904037475586, "num_input_tokens_seen": 1264081024, "step": 4450, "train_runtime": 43249.3658, "train_tokens_per_second": 29227.735 }, { "epoch": 0.15780383762303546, "grad_norm": 1.40625, "learning_rate": 4.158156927845101e-05, "loss": 1.1631442070007325, "num_input_tokens_seen": 1266929920, "step": 4460, "train_runtime": 43345.5208, "train_tokens_per_second": 29228.624 }, { "epoch": 0.15815765788676425, "grad_norm": 1.421875, "learning_rate": 4.156719760233016e-05, "loss": 1.1768792152404786, "num_input_tokens_seen": 1269772864, "step": 4470, "train_runtime": 43441.6644, "train_tokens_per_second": 29229.379 }, { "epoch": 0.15851147815049302, "grad_norm": 1.4375, "learning_rate": 4.155284081759552e-05, "loss": 1.1812875747680665, "num_input_tokens_seen": 1272572224, "step": 4480, "train_runtime": 43535.9244, "train_tokens_per_second": 29230.394 }, { "epoch": 0.1588652984142218, "grad_norm": 1.3984375, "learning_rate": 4.1538498898548356e-05, "loss": 1.1645915031433105, "num_input_tokens_seen": 1275388928, "step": 4490, "train_runtime": 43633.4048, "train_tokens_per_second": 29229.645 }, { "epoch": 0.15921911867795058, "grad_norm": 1.359375, "learning_rate": 4.1524171819552e-05, "loss": 1.163807487487793, "num_input_tokens_seen": 1278251456, "step": 4500, "train_runtime": 43731.3608, "train_tokens_per_second": 29229.629 }, { "epoch": 0.15957293894167937, "grad_norm": 1.390625, "learning_rate": 4.15098595550316e-05, "loss": 1.174567413330078, "num_input_tokens_seen": 1281085120, "step": 4510, "train_runtime": 43827.8411, "train_tokens_per_second": 29229.939 }, { "epoch": 0.15992675920540814, "grad_norm": 1.390625, "learning_rate": 4.1495562079474e-05, "loss": 1.1581344604492188, "num_input_tokens_seen": 1283928256, "step": 4520, "train_runtime": 43923.7854, "train_tokens_per_second": 29230.82 }, { "epoch": 0.16028057946913693, "grad_norm": 1.4765625, "learning_rate": 4.148127936742749e-05, "loss": 1.1675923347473145, "num_input_tokens_seen": 1286786880, "step": 4530, "train_runtime": 44023.1981, "train_tokens_per_second": 29229.746 }, { "epoch": 0.1606343997328657, "grad_norm": 1.3828125, "learning_rate": 4.146701139350166e-05, "loss": 1.1774301528930664, "num_input_tokens_seen": 1289581760, "step": 4540, "train_runtime": 44119.12, "train_tokens_per_second": 29229.544 }, { "epoch": 0.1609882199965945, "grad_norm": 1.4296875, "learning_rate": 4.1452758132367196e-05, "loss": 1.165812110900879, "num_input_tokens_seen": 1292423360, "step": 4550, "train_runtime": 44216.0546, "train_tokens_per_second": 29229.731 }, { "epoch": 0.16134204026032326, "grad_norm": 1.421875, "learning_rate": 4.1438519558755656e-05, "loss": 1.1558544158935546, "num_input_tokens_seen": 1295337216, "step": 4560, "train_runtime": 44317.0703, "train_tokens_per_second": 29228.855 }, { "epoch": 0.16169586052405205, "grad_norm": 1.390625, "learning_rate": 4.1424295647459336e-05, "loss": 1.1622037887573242, "num_input_tokens_seen": 1298182656, "step": 4570, "train_runtime": 44414.7974, "train_tokens_per_second": 29228.607 }, { "epoch": 0.16204968078778081, "grad_norm": 1.359375, "learning_rate": 4.141008637333106e-05, "loss": 1.1622723579406737, "num_input_tokens_seen": 1301050048, "step": 4580, "train_runtime": 44514.1041, "train_tokens_per_second": 29227.816 }, { "epoch": 0.1624035010515096, "grad_norm": 1.4296875, "learning_rate": 4.1395891711283974e-05, "loss": 1.1522689819335938, "num_input_tokens_seen": 1303916544, "step": 4590, "train_runtime": 44613.6419, "train_tokens_per_second": 29226.857 }, { "epoch": 0.16275732131523837, "grad_norm": 1.4375, "learning_rate": 4.1381711636291395e-05, "loss": 1.1612784385681152, "num_input_tokens_seen": 1306714944, "step": 4600, "train_runtime": 44708.9977, "train_tokens_per_second": 29227.113 }, { "epoch": 0.16311114157896717, "grad_norm": 1.375, "learning_rate": 4.1367546123386604e-05, "loss": 1.152998447418213, "num_input_tokens_seen": 1309505600, "step": 4610, "train_runtime": 44805.2476, "train_tokens_per_second": 29226.612 }, { "epoch": 0.16346496184269593, "grad_norm": 1.40625, "learning_rate": 4.1353395147662673e-05, "loss": 1.1638368606567382, "num_input_tokens_seen": 1312348416, "step": 4620, "train_runtime": 44903.011, "train_tokens_per_second": 29226.29 }, { "epoch": 0.16381878210642473, "grad_norm": 1.3828125, "learning_rate": 4.133925868427225e-05, "loss": 1.1757159233093262, "num_input_tokens_seen": 1315210752, "step": 4630, "train_runtime": 45002.394, "train_tokens_per_second": 29225.351 }, { "epoch": 0.1641726023701535, "grad_norm": 1.34375, "learning_rate": 4.132513670842744e-05, "loss": 1.1579181671142578, "num_input_tokens_seen": 1318022080, "step": 4640, "train_runtime": 45096.4576, "train_tokens_per_second": 29226.732 }, { "epoch": 0.16452642263388226, "grad_norm": 1.5, "learning_rate": 4.1311029195399534e-05, "loss": 1.1574539184570312, "num_input_tokens_seen": 1320899072, "step": 4650, "train_runtime": 45198.4939, "train_tokens_per_second": 29224.405 }, { "epoch": 0.16488024289761105, "grad_norm": 1.484375, "learning_rate": 4.129693612051892e-05, "loss": 1.1614418029785156, "num_input_tokens_seen": 1323750912, "step": 4660, "train_runtime": 45296.0792, "train_tokens_per_second": 29224.404 }, { "epoch": 0.16523406316133982, "grad_norm": 1.3671875, "learning_rate": 4.1282857459174826e-05, "loss": 1.1747958183288574, "num_input_tokens_seen": 1326532416, "step": 4670, "train_runtime": 45389.6955, "train_tokens_per_second": 29225.409 }, { "epoch": 0.1655878834250686, "grad_norm": 1.453125, "learning_rate": 4.1268793186815184e-05, "loss": 1.1685308456420898, "num_input_tokens_seen": 1329344384, "step": 4680, "train_runtime": 45486.4155, "train_tokens_per_second": 29225.086 }, { "epoch": 0.16594170368879738, "grad_norm": 1.4453125, "learning_rate": 4.1254743278946456e-05, "loss": 1.1820893287658691, "num_input_tokens_seen": 1332233664, "step": 4690, "train_runtime": 45586.4255, "train_tokens_per_second": 29224.35 }, { "epoch": 0.16629552395252617, "grad_norm": 1.40625, "learning_rate": 4.1240707711133394e-05, "loss": 1.1573176383972168, "num_input_tokens_seen": 1335070720, "step": 4700, "train_runtime": 45683.4818, "train_tokens_per_second": 29224.364 }, { "epoch": 0.16664934421625494, "grad_norm": 1.3828125, "learning_rate": 4.122668645899893e-05, "loss": 1.1567338943481444, "num_input_tokens_seen": 1338002176, "step": 4710, "train_runtime": 45785.9886, "train_tokens_per_second": 29222.961 }, { "epoch": 0.16700316447998373, "grad_norm": 1.421875, "learning_rate": 4.1212679498223975e-05, "loss": 1.1683042526245118, "num_input_tokens_seen": 1340848640, "step": 4720, "train_runtime": 45883.5878, "train_tokens_per_second": 29222.838 }, { "epoch": 0.1673569847437125, "grad_norm": 1.3984375, "learning_rate": 4.1198686804547215e-05, "loss": 1.1651246070861816, "num_input_tokens_seen": 1343707776, "step": 4730, "train_runtime": 45980.2325, "train_tokens_per_second": 29223.597 }, { "epoch": 0.1677108050074413, "grad_norm": 1.390625, "learning_rate": 4.118470835376499e-05, "loss": 1.1756913185119628, "num_input_tokens_seen": 1346536704, "step": 4740, "train_runtime": 46077.4068, "train_tokens_per_second": 29223.361 }, { "epoch": 0.16806462527117005, "grad_norm": 1.375, "learning_rate": 4.117074412173107e-05, "loss": 1.1566192626953125, "num_input_tokens_seen": 1349381632, "step": 4750, "train_runtime": 46177.208, "train_tokens_per_second": 29221.811 }, { "epoch": 0.16841844553489885, "grad_norm": 1.4140625, "learning_rate": 4.115679408435648e-05, "loss": 1.1635604858398438, "num_input_tokens_seen": 1352231744, "step": 4760, "train_runtime": 46275.4368, "train_tokens_per_second": 29221.372 }, { "epoch": 0.1687722657986276, "grad_norm": 1.375, "learning_rate": 4.114285821760937e-05, "loss": 1.1621339797973633, "num_input_tokens_seen": 1355066048, "step": 4770, "train_runtime": 46368.8854, "train_tokens_per_second": 29223.606 }, { "epoch": 0.1691260860623564, "grad_norm": 1.4609375, "learning_rate": 4.11289364975148e-05, "loss": 1.175765609741211, "num_input_tokens_seen": 1357933376, "step": 4780, "train_runtime": 46466.8963, "train_tokens_per_second": 29223.673 }, { "epoch": 0.16947990632608517, "grad_norm": 1.4140625, "learning_rate": 4.111502890015456e-05, "loss": 1.1585985183715821, "num_input_tokens_seen": 1360776320, "step": 4790, "train_runtime": 46560.4075, "train_tokens_per_second": 29226.04 }, { "epoch": 0.16983372658981397, "grad_norm": 1.4609375, "learning_rate": 4.1101135401667056e-05, "loss": 1.1796425819396972, "num_input_tokens_seen": 1363593088, "step": 4800, "train_runtime": 46657.2961, "train_tokens_per_second": 29225.72 }, { "epoch": 0.17018754685354273, "grad_norm": 1.3671875, "learning_rate": 4.108725597824708e-05, "loss": 1.168414306640625, "num_input_tokens_seen": 1366410176, "step": 4810, "train_runtime": 46752.5326, "train_tokens_per_second": 29226.442 }, { "epoch": 0.17054136711727153, "grad_norm": 1.3828125, "learning_rate": 4.107339060614564e-05, "loss": 1.1621706008911132, "num_input_tokens_seen": 1369257856, "step": 4820, "train_runtime": 46849.9652, "train_tokens_per_second": 29226.443 }, { "epoch": 0.1708951873810003, "grad_norm": 1.4140625, "learning_rate": 4.1059539261669825e-05, "loss": 1.1523948669433595, "num_input_tokens_seen": 1372139584, "step": 4830, "train_runtime": 46952.0795, "train_tokens_per_second": 29224.256 }, { "epoch": 0.17124900764472908, "grad_norm": 1.4296875, "learning_rate": 4.104570192118262e-05, "loss": 1.1553438186645508, "num_input_tokens_seen": 1374939520, "step": 4840, "train_runtime": 47048.903, "train_tokens_per_second": 29223.625 }, { "epoch": 0.17160282790845785, "grad_norm": 1.4296875, "learning_rate": 4.1031878561102714e-05, "loss": 1.1646602630615235, "num_input_tokens_seen": 1377782592, "step": 4850, "train_runtime": 47144.8875, "train_tokens_per_second": 29224.433 }, { "epoch": 0.17195664817218664, "grad_norm": 1.359375, "learning_rate": 4.1018069157904385e-05, "loss": 1.1651230812072755, "num_input_tokens_seen": 1380642112, "step": 4860, "train_runtime": 47242.3557, "train_tokens_per_second": 29224.667 }, { "epoch": 0.1723104684359154, "grad_norm": 1.3984375, "learning_rate": 4.100427368811727e-05, "loss": 1.1619221687316894, "num_input_tokens_seen": 1383498688, "step": 4870, "train_runtime": 47339.9335, "train_tokens_per_second": 29224.77 }, { "epoch": 0.1726642886996442, "grad_norm": 1.421875, "learning_rate": 4.099049212832622e-05, "loss": 1.166537380218506, "num_input_tokens_seen": 1386405760, "step": 4880, "train_runtime": 47440.8473, "train_tokens_per_second": 29223.883 }, { "epoch": 0.17301810896337297, "grad_norm": 1.4140625, "learning_rate": 4.0976724455171155e-05, "loss": 1.155689525604248, "num_input_tokens_seen": 1389235520, "step": 4890, "train_runtime": 47538.2575, "train_tokens_per_second": 29223.526 }, { "epoch": 0.17337192922710173, "grad_norm": 1.375, "learning_rate": 4.096297064534688e-05, "loss": 1.1490235328674316, "num_input_tokens_seen": 1392041408, "step": 4900, "train_runtime": 47634.3289, "train_tokens_per_second": 29223.492 }, { "epoch": 0.17372574949083053, "grad_norm": 1.390625, "learning_rate": 4.0949230675602904e-05, "loss": 1.1558156967163087, "num_input_tokens_seen": 1394892672, "step": 4910, "train_runtime": 47731.0245, "train_tokens_per_second": 29224.025 }, { "epoch": 0.1740795697545593, "grad_norm": 1.3984375, "learning_rate": 4.09355045227433e-05, "loss": 1.1501849174499512, "num_input_tokens_seen": 1397753408, "step": 4920, "train_runtime": 47830.6114, "train_tokens_per_second": 29222.989 }, { "epoch": 0.1744333900182881, "grad_norm": 1.359375, "learning_rate": 4.092179216362654e-05, "loss": 1.1577836990356445, "num_input_tokens_seen": 1400560384, "step": 4930, "train_runtime": 47924.6172, "train_tokens_per_second": 29224.237 }, { "epoch": 0.17478721028201685, "grad_norm": 1.4375, "learning_rate": 4.090809357516532e-05, "loss": 1.164453887939453, "num_input_tokens_seen": 1403432320, "step": 4940, "train_runtime": 48024.1259, "train_tokens_per_second": 29223.485 }, { "epoch": 0.17514103054574565, "grad_norm": 1.4140625, "learning_rate": 4.089440873432638e-05, "loss": 1.1713566780090332, "num_input_tokens_seen": 1406244736, "step": 4950, "train_runtime": 48116.6901, "train_tokens_per_second": 29225.716 }, { "epoch": 0.1754948508094744, "grad_norm": 1.40625, "learning_rate": 4.088073761813037e-05, "loss": 1.1553348541259765, "num_input_tokens_seen": 1409138176, "step": 4960, "train_runtime": 48218.5514, "train_tokens_per_second": 29223.984 }, { "epoch": 0.1758486710732032, "grad_norm": 1.3984375, "learning_rate": 4.086708020365172e-05, "loss": 1.1524312973022461, "num_input_tokens_seen": 1412013888, "step": 4970, "train_runtime": 48319.4241, "train_tokens_per_second": 29222.49 }, { "epoch": 0.17620249133693197, "grad_norm": 1.4296875, "learning_rate": 4.0853436468018354e-05, "loss": 1.159165382385254, "num_input_tokens_seen": 1414840448, "step": 4980, "train_runtime": 48416.0872, "train_tokens_per_second": 29222.528 }, { "epoch": 0.17655631160066076, "grad_norm": 1.359375, "learning_rate": 4.0839806388411686e-05, "loss": 1.158484649658203, "num_input_tokens_seen": 1417739520, "step": 4990, "train_runtime": 48514.9025, "train_tokens_per_second": 29222.763 }, { "epoch": 0.17691013186438953, "grad_norm": 1.3828125, "learning_rate": 4.0826189942066346e-05, "loss": 1.1729397773742676, "num_input_tokens_seen": 1420613056, "step": 5000, "train_runtime": 48613.5893, "train_tokens_per_second": 29222.55 }, { "epoch": 0.17691013186438953, "eval_loss": 1.0554543733596802, "eval_runtime": 8.4538, "eval_samples_per_second": 471.739, "eval_steps_per_second": 3.785, "num_input_tokens_seen": 1420613056, "step": 5000 }, { "epoch": 0.17726395212811832, "grad_norm": 1.390625, "learning_rate": 4.081258710627008e-05, "loss": 1.1454292297363282, "num_input_tokens_seen": 1423456576, "step": 5010, "train_runtime": 48740.9535, "train_tokens_per_second": 29204.529 }, { "epoch": 0.1776177723918471, "grad_norm": 1.3515625, "learning_rate": 4.0798997858363557e-05, "loss": 1.161700439453125, "num_input_tokens_seen": 1426246848, "step": 5020, "train_runtime": 48832.8141, "train_tokens_per_second": 29206.731 }, { "epoch": 0.17797159265557588, "grad_norm": 1.40625, "learning_rate": 4.078542217574024e-05, "loss": 1.1583166122436523, "num_input_tokens_seen": 1429053568, "step": 5030, "train_runtime": 48928.9495, "train_tokens_per_second": 29206.709 }, { "epoch": 0.17832541291930465, "grad_norm": 1.3515625, "learning_rate": 4.0771860035846196e-05, "loss": 1.1529541015625, "num_input_tokens_seen": 1431894464, "step": 5040, "train_runtime": 49026.0584, "train_tokens_per_second": 29206.804 }, { "epoch": 0.17867923318303344, "grad_norm": 1.3984375, "learning_rate": 4.0758311416179965e-05, "loss": 1.1603623390197755, "num_input_tokens_seen": 1434778752, "step": 5050, "train_runtime": 49125.9649, "train_tokens_per_second": 29206.118 }, { "epoch": 0.1790330534467622, "grad_norm": 1.421875, "learning_rate": 4.0744776294292386e-05, "loss": 1.150662899017334, "num_input_tokens_seen": 1437638720, "step": 5060, "train_runtime": 49225.1784, "train_tokens_per_second": 29205.353 }, { "epoch": 0.179386873710491, "grad_norm": 1.4375, "learning_rate": 4.073125464778646e-05, "loss": 1.1515050888061524, "num_input_tokens_seen": 1440541568, "step": 5070, "train_runtime": 49328.1591, "train_tokens_per_second": 29203.23 }, { "epoch": 0.17974069397421977, "grad_norm": 1.40625, "learning_rate": 4.071774645431717e-05, "loss": 1.1444365501403808, "num_input_tokens_seen": 1443293440, "step": 5080, "train_runtime": 49423.4369, "train_tokens_per_second": 29202.612 }, { "epoch": 0.18009451423794856, "grad_norm": 1.3515625, "learning_rate": 4.070425169159135e-05, "loss": 1.1678031921386718, "num_input_tokens_seen": 1446114368, "step": 5090, "train_runtime": 49520.6974, "train_tokens_per_second": 29202.221 }, { "epoch": 0.18044833450167733, "grad_norm": 1.359375, "learning_rate": 4.069077033736751e-05, "loss": 1.1512995719909669, "num_input_tokens_seen": 1448938560, "step": 5100, "train_runtime": 49618.5831, "train_tokens_per_second": 29201.53 }, { "epoch": 0.18080215476540612, "grad_norm": 1.40625, "learning_rate": 4.06773023694557e-05, "loss": 1.1586835861206055, "num_input_tokens_seen": 1451746496, "step": 5110, "train_runtime": 49714.3736, "train_tokens_per_second": 29201.746 }, { "epoch": 0.18115597502913489, "grad_norm": 1.3828125, "learning_rate": 4.066384776571732e-05, "loss": 1.1529558181762696, "num_input_tokens_seen": 1454587072, "step": 5120, "train_runtime": 49810.6538, "train_tokens_per_second": 29202.328 }, { "epoch": 0.18150979529286368, "grad_norm": 1.5078125, "learning_rate": 4.065040650406504e-05, "loss": 1.1565089225769043, "num_input_tokens_seen": 1457448256, "step": 5130, "train_runtime": 49910.1208, "train_tokens_per_second": 29201.457 }, { "epoch": 0.18186361555659245, "grad_norm": 1.40625, "learning_rate": 4.0636978562462576e-05, "loss": 1.161362648010254, "num_input_tokens_seen": 1460298880, "step": 5140, "train_runtime": 50008.7864, "train_tokens_per_second": 29200.846 }, { "epoch": 0.1822174358203212, "grad_norm": 1.3828125, "learning_rate": 4.062356391892456e-05, "loss": 1.1447731018066407, "num_input_tokens_seen": 1463134592, "step": 5150, "train_runtime": 50108.1207, "train_tokens_per_second": 29199.55 }, { "epoch": 0.18257125608405, "grad_norm": 1.3828125, "learning_rate": 4.0610162551516395e-05, "loss": 1.1505602836608886, "num_input_tokens_seen": 1466017024, "step": 5160, "train_runtime": 50209.0531, "train_tokens_per_second": 29198.261 }, { "epoch": 0.18292507634777877, "grad_norm": 1.4609375, "learning_rate": 4.059677443835412e-05, "loss": 1.1518810272216797, "num_input_tokens_seen": 1468844032, "step": 5170, "train_runtime": 50303.6015, "train_tokens_per_second": 29199.58 }, { "epoch": 0.18327889661150756, "grad_norm": 1.359375, "learning_rate": 4.058339955760423e-05, "loss": 1.1491867065429688, "num_input_tokens_seen": 1471720064, "step": 5180, "train_runtime": 50406.047, "train_tokens_per_second": 29197.292 }, { "epoch": 0.18363271687523633, "grad_norm": 1.3515625, "learning_rate": 4.0570037887483535e-05, "loss": 1.1602293014526368, "num_input_tokens_seen": 1474620736, "step": 5190, "train_runtime": 50507.3471, "train_tokens_per_second": 29196.163 }, { "epoch": 0.18398653713896512, "grad_norm": 1.40625, "learning_rate": 4.0556689406259025e-05, "loss": 1.1516728401184082, "num_input_tokens_seen": 1477467008, "step": 5200, "train_runtime": 50604.0907, "train_tokens_per_second": 29196.592 }, { "epoch": 0.1843403574026939, "grad_norm": 1.40625, "learning_rate": 4.054335409224771e-05, "loss": 1.1603678703308105, "num_input_tokens_seen": 1480353088, "step": 5210, "train_runtime": 50703.3004, "train_tokens_per_second": 29196.385 }, { "epoch": 0.18469417766642268, "grad_norm": 1.328125, "learning_rate": 4.053003192381646e-05, "loss": 1.1358709335327148, "num_input_tokens_seen": 1483264448, "step": 5220, "train_runtime": 50803.2103, "train_tokens_per_second": 29196.274 }, { "epoch": 0.18504799793015145, "grad_norm": 1.4140625, "learning_rate": 4.051672287938189e-05, "loss": 1.1461207389831543, "num_input_tokens_seen": 1486090944, "step": 5230, "train_runtime": 50900.4302, "train_tokens_per_second": 29196.039 }, { "epoch": 0.18540181819388024, "grad_norm": 1.40625, "learning_rate": 4.050342693741019e-05, "loss": 1.1470937728881836, "num_input_tokens_seen": 1488925888, "step": 5240, "train_runtime": 50996.6361, "train_tokens_per_second": 29196.551 }, { "epoch": 0.185755638457609, "grad_norm": 1.4296875, "learning_rate": 4.049014407641699e-05, "loss": 1.1562808990478515, "num_input_tokens_seen": 1491699968, "step": 5250, "train_runtime": 51089.9572, "train_tokens_per_second": 29197.518 }, { "epoch": 0.1861094587213378, "grad_norm": 1.4453125, "learning_rate": 4.047687427496717e-05, "loss": 1.1603093147277832, "num_input_tokens_seen": 1494559296, "step": 5260, "train_runtime": 51189.7178, "train_tokens_per_second": 29196.475 }, { "epoch": 0.18646327898506657, "grad_norm": 1.375, "learning_rate": 4.046361751167479e-05, "loss": 1.1542572021484374, "num_input_tokens_seen": 1497424320, "step": 5270, "train_runtime": 51284.273, "train_tokens_per_second": 29198.509 }, { "epoch": 0.18681709924879536, "grad_norm": 1.3828125, "learning_rate": 4.045037376520292e-05, "loss": 1.1529299736022949, "num_input_tokens_seen": 1500251456, "step": 5280, "train_runtime": 51382.623, "train_tokens_per_second": 29197.642 }, { "epoch": 0.18717091951252413, "grad_norm": 1.3671875, "learning_rate": 4.043714301426344e-05, "loss": 1.1605234146118164, "num_input_tokens_seen": 1503083520, "step": 5290, "train_runtime": 51481.3425, "train_tokens_per_second": 29196.665 }, { "epoch": 0.18752473977625292, "grad_norm": 1.3515625, "learning_rate": 4.042392523761696e-05, "loss": 1.1543375968933105, "num_input_tokens_seen": 1505860864, "step": 5300, "train_runtime": 51576.1011, "train_tokens_per_second": 29196.873 }, { "epoch": 0.18787856003998168, "grad_norm": 1.3828125, "learning_rate": 4.041072041407267e-05, "loss": 1.1467929840087892, "num_input_tokens_seen": 1508762624, "step": 5310, "train_runtime": 51676.3124, "train_tokens_per_second": 29196.407 }, { "epoch": 0.18823238030371048, "grad_norm": 1.375, "learning_rate": 4.039752852248815e-05, "loss": 1.1630261421203614, "num_input_tokens_seen": 1511563328, "step": 5320, "train_runtime": 51772.2489, "train_tokens_per_second": 29196.401 }, { "epoch": 0.18858620056743924, "grad_norm": 1.3671875, "learning_rate": 4.0384349541769286e-05, "loss": 1.1554012298583984, "num_input_tokens_seen": 1514407936, "step": 5330, "train_runtime": 51869.783, "train_tokens_per_second": 29196.342 }, { "epoch": 0.18894002083116804, "grad_norm": 1.4765625, "learning_rate": 4.037118345087011e-05, "loss": 1.1593147277832032, "num_input_tokens_seen": 1517231040, "step": 5340, "train_runtime": 51967.408, "train_tokens_per_second": 29195.819 }, { "epoch": 0.1892938410948968, "grad_norm": 1.3984375, "learning_rate": 4.0358030228792636e-05, "loss": 1.1548017501831054, "num_input_tokens_seen": 1520078656, "step": 5350, "train_runtime": 52066.7486, "train_tokens_per_second": 29194.807 }, { "epoch": 0.1896476613586256, "grad_norm": 1.3671875, "learning_rate": 4.034488985458673e-05, "loss": 1.1534326553344727, "num_input_tokens_seen": 1522890176, "step": 5360, "train_runtime": 52159.9773, "train_tokens_per_second": 29196.527 }, { "epoch": 0.19000148162235436, "grad_norm": 1.4609375, "learning_rate": 4.033176230735001e-05, "loss": 1.1487655639648438, "num_input_tokens_seen": 1525755264, "step": 5370, "train_runtime": 52257.3638, "train_tokens_per_second": 29196.943 }, { "epoch": 0.19035530188608316, "grad_norm": 1.453125, "learning_rate": 4.0318647566227626e-05, "loss": 1.15179500579834, "num_input_tokens_seen": 1528616832, "step": 5380, "train_runtime": 52354.8715, "train_tokens_per_second": 29197.222 }, { "epoch": 0.19070912214981192, "grad_norm": 1.359375, "learning_rate": 4.0305545610412205e-05, "loss": 1.149301528930664, "num_input_tokens_seen": 1531522944, "step": 5390, "train_runtime": 52458.3277, "train_tokens_per_second": 29195.039 }, { "epoch": 0.19106294241354072, "grad_norm": 1.3984375, "learning_rate": 4.029245641914365e-05, "loss": 1.163567066192627, "num_input_tokens_seen": 1534331328, "step": 5400, "train_runtime": 52555.1986, "train_tokens_per_second": 29194.663 }, { "epoch": 0.19141676267726948, "grad_norm": 1.3828125, "learning_rate": 4.027937997170904e-05, "loss": 1.1477647781372071, "num_input_tokens_seen": 1537209664, "step": 5410, "train_runtime": 52654.2983, "train_tokens_per_second": 29194.381 }, { "epoch": 0.19177058294099825, "grad_norm": 1.4375, "learning_rate": 4.026631624744247e-05, "loss": 1.1594183921813965, "num_input_tokens_seen": 1540037376, "step": 5420, "train_runtime": 52752.0564, "train_tokens_per_second": 29193.883 }, { "epoch": 0.19212440320472704, "grad_norm": 1.375, "learning_rate": 4.025326522572493e-05, "loss": 1.1417713165283203, "num_input_tokens_seen": 1542879168, "step": 5430, "train_runtime": 52849.8164, "train_tokens_per_second": 29193.652 }, { "epoch": 0.1924782234684558, "grad_norm": 1.3671875, "learning_rate": 4.024022688598415e-05, "loss": 1.165010643005371, "num_input_tokens_seen": 1545750912, "step": 5440, "train_runtime": 52949.0474, "train_tokens_per_second": 29193.177 }, { "epoch": 0.1928320437321846, "grad_norm": 1.390625, "learning_rate": 4.0227201207694494e-05, "loss": 1.1466317176818848, "num_input_tokens_seen": 1548581376, "step": 5450, "train_runtime": 53045.1953, "train_tokens_per_second": 29193.622 }, { "epoch": 0.19318586399591336, "grad_norm": 1.3984375, "learning_rate": 4.021418817037677e-05, "loss": 1.1439767837524415, "num_input_tokens_seen": 1551461504, "step": 5460, "train_runtime": 53144.9877, "train_tokens_per_second": 29192.998 }, { "epoch": 0.19353968425964216, "grad_norm": 1.390625, "learning_rate": 4.0201187753598174e-05, "loss": 1.1544062614440918, "num_input_tokens_seen": 1554299584, "step": 5470, "train_runtime": 53243.1234, "train_tokens_per_second": 29192.494 }, { "epoch": 0.19389350452337092, "grad_norm": 1.4609375, "learning_rate": 4.018819993697208e-05, "loss": 1.144437026977539, "num_input_tokens_seen": 1557140416, "step": 5480, "train_runtime": 53338.0593, "train_tokens_per_second": 29193.796 }, { "epoch": 0.19424732478709972, "grad_norm": 1.359375, "learning_rate": 4.017522470015793e-05, "loss": 1.1415154457092285, "num_input_tokens_seen": 1560041024, "step": 5490, "train_runtime": 53437.1489, "train_tokens_per_second": 29193.942 }, { "epoch": 0.19460114505082848, "grad_norm": 1.40625, "learning_rate": 4.0162262022861144e-05, "loss": 1.138638687133789, "num_input_tokens_seen": 1562892608, "step": 5500, "train_runtime": 53537.1356, "train_tokens_per_second": 29192.683 }, { "epoch": 0.19495496531455728, "grad_norm": 1.375, "learning_rate": 4.0149311884832906e-05, "loss": 1.1469120979309082, "num_input_tokens_seen": 1565761536, "step": 5510, "train_runtime": 53635.3466, "train_tokens_per_second": 29192.718 }, { "epoch": 0.19530878557828604, "grad_norm": 1.390625, "learning_rate": 4.0136374265870116e-05, "loss": 1.1435979843139648, "num_input_tokens_seen": 1568601984, "step": 5520, "train_runtime": 53730.6046, "train_tokens_per_second": 29193.827 }, { "epoch": 0.19566260584201484, "grad_norm": 1.3671875, "learning_rate": 4.0123449145815174e-05, "loss": 1.1436124801635743, "num_input_tokens_seen": 1571458304, "step": 5530, "train_runtime": 53825.1891, "train_tokens_per_second": 29195.593 }, { "epoch": 0.1960164261057436, "grad_norm": 1.46875, "learning_rate": 4.011053650455592e-05, "loss": 1.1641233444213868, "num_input_tokens_seen": 1574254144, "step": 5540, "train_runtime": 53919.0228, "train_tokens_per_second": 29196.637 }, { "epoch": 0.1963702463694724, "grad_norm": 1.34375, "learning_rate": 4.0097636322025466e-05, "loss": 1.1391079902648926, "num_input_tokens_seen": 1577121152, "step": 5550, "train_runtime": 54016.4198, "train_tokens_per_second": 29197.069 }, { "epoch": 0.19672406663320116, "grad_norm": 1.4375, "learning_rate": 4.008474857820206e-05, "loss": 1.1429768562316895, "num_input_tokens_seen": 1579922944, "step": 5560, "train_runtime": 54110.6774, "train_tokens_per_second": 29197.989 }, { "epoch": 0.19707788689692995, "grad_norm": 1.5078125, "learning_rate": 4.007187325310899e-05, "loss": 1.1527151107788085, "num_input_tokens_seen": 1582776832, "step": 5570, "train_runtime": 54207.1796, "train_tokens_per_second": 29198.657 }, { "epoch": 0.19743170716065872, "grad_norm": 1.4453125, "learning_rate": 4.00590103268144e-05, "loss": 1.1505550384521483, "num_input_tokens_seen": 1585641792, "step": 5580, "train_runtime": 54307.187, "train_tokens_per_second": 29197.642 }, { "epoch": 0.19778552742438751, "grad_norm": 1.3828125, "learning_rate": 4.004615977943124e-05, "loss": 1.1448429107666016, "num_input_tokens_seen": 1588441088, "step": 5590, "train_runtime": 54401.783, "train_tokens_per_second": 29198.328 }, { "epoch": 0.19813934768811628, "grad_norm": 1.375, "learning_rate": 4.0033321591117025e-05, "loss": 1.1348305702209474, "num_input_tokens_seen": 1591290368, "step": 5600, "train_runtime": 54498.4769, "train_tokens_per_second": 29198.804 }, { "epoch": 0.19849316795184507, "grad_norm": 1.2890625, "learning_rate": 4.002049574207381e-05, "loss": 1.1528627395629882, "num_input_tokens_seen": 1594144128, "step": 5610, "train_runtime": 54596.3287, "train_tokens_per_second": 29198.742 }, { "epoch": 0.19884698821557384, "grad_norm": 1.4375, "learning_rate": 4.000768221254803e-05, "loss": 1.1378749847412108, "num_input_tokens_seen": 1597000064, "step": 5620, "train_runtime": 54692.8803, "train_tokens_per_second": 29199.414 }, { "epoch": 0.19920080847930263, "grad_norm": 1.453125, "learning_rate": 3.999488098283034e-05, "loss": 1.1557339668273925, "num_input_tokens_seen": 1599860288, "step": 5630, "train_runtime": 54793.8956, "train_tokens_per_second": 29197.783 }, { "epoch": 0.1995546287430314, "grad_norm": 1.40625, "learning_rate": 3.9982092033255506e-05, "loss": 1.1512733459472657, "num_input_tokens_seen": 1602709120, "step": 5640, "train_runtime": 54891.6999, "train_tokens_per_second": 29197.659 }, { "epoch": 0.1999084490067602, "grad_norm": 1.4140625, "learning_rate": 3.996931534420232e-05, "loss": 1.1527785301208495, "num_input_tokens_seen": 1605536384, "step": 5650, "train_runtime": 54988.336, "train_tokens_per_second": 29197.763 }, { "epoch": 0.20026226927048896, "grad_norm": 1.3515625, "learning_rate": 3.995655089609339e-05, "loss": 1.1383662223815918, "num_input_tokens_seen": 1608395072, "step": 5660, "train_runtime": 55084.7358, "train_tokens_per_second": 29198.562 }, { "epoch": 0.20061608953421772, "grad_norm": 1.3984375, "learning_rate": 3.994379866939511e-05, "loss": 1.1372873306274414, "num_input_tokens_seen": 1611246528, "step": 5670, "train_runtime": 55182.7103, "train_tokens_per_second": 29198.394 }, { "epoch": 0.20096990979794652, "grad_norm": 1.3984375, "learning_rate": 3.993105864461745e-05, "loss": 1.1518970489501954, "num_input_tokens_seen": 1614097856, "step": 5680, "train_runtime": 55281.5908, "train_tokens_per_second": 29197.746 }, { "epoch": 0.20132373006167528, "grad_norm": 1.4296875, "learning_rate": 3.9918330802313866e-05, "loss": 1.1478713989257812, "num_input_tokens_seen": 1616895488, "step": 5690, "train_runtime": 55379.7952, "train_tokens_per_second": 29196.487 }, { "epoch": 0.20167755032540408, "grad_norm": 1.421875, "learning_rate": 3.9905615123081206e-05, "loss": 1.1519228935241699, "num_input_tokens_seen": 1619738624, "step": 5700, "train_runtime": 55476.9616, "train_tokens_per_second": 29196.599 }, { "epoch": 0.20203137058913284, "grad_norm": 1.4140625, "learning_rate": 3.989291158755953e-05, "loss": 1.1645353317260743, "num_input_tokens_seen": 1622599168, "step": 5710, "train_runtime": 55577.135, "train_tokens_per_second": 29195.445 }, { "epoch": 0.20238519085286164, "grad_norm": 1.4453125, "learning_rate": 3.988022017643201e-05, "loss": 1.1464563369750977, "num_input_tokens_seen": 1625486464, "step": 5720, "train_runtime": 55677.2571, "train_tokens_per_second": 29194.801 }, { "epoch": 0.2027390111165904, "grad_norm": 1.4375, "learning_rate": 3.9867540870424826e-05, "loss": 1.1449846267700194, "num_input_tokens_seen": 1628304704, "step": 5730, "train_runtime": 55773.7572, "train_tokens_per_second": 29194.818 }, { "epoch": 0.2030928313803192, "grad_norm": 1.4296875, "learning_rate": 3.985487365030702e-05, "loss": 1.1489128112792968, "num_input_tokens_seen": 1631111616, "step": 5740, "train_runtime": 55868.4489, "train_tokens_per_second": 29195.577 }, { "epoch": 0.20344665164404796, "grad_norm": 1.453125, "learning_rate": 3.984221849689036e-05, "loss": 1.1492780685424804, "num_input_tokens_seen": 1633982144, "step": 5750, "train_runtime": 55967.4685, "train_tokens_per_second": 29195.213 }, { "epoch": 0.20380047190777675, "grad_norm": 1.453125, "learning_rate": 3.982957539102927e-05, "loss": 1.1517362594604492, "num_input_tokens_seen": 1636864512, "step": 5760, "train_runtime": 56064.5572, "train_tokens_per_second": 29196.066 }, { "epoch": 0.20415429217150552, "grad_norm": 1.3515625, "learning_rate": 3.981694431362065e-05, "loss": 1.1585161209106445, "num_input_tokens_seen": 1639718144, "step": 5770, "train_runtime": 56163.8876, "train_tokens_per_second": 29195.239 }, { "epoch": 0.2045081124352343, "grad_norm": 1.40625, "learning_rate": 3.9804325245603786e-05, "loss": 1.1651932716369628, "num_input_tokens_seen": 1642537728, "step": 5780, "train_runtime": 56264.2992, "train_tokens_per_second": 29193.25 }, { "epoch": 0.20486193269896308, "grad_norm": 1.375, "learning_rate": 3.9791718167960226e-05, "loss": 1.147236156463623, "num_input_tokens_seen": 1645398208, "step": 5790, "train_runtime": 56362.2523, "train_tokens_per_second": 29193.266 }, { "epoch": 0.20521575296269187, "grad_norm": 1.2890625, "learning_rate": 3.9779123061713665e-05, "loss": 1.1393996238708497, "num_input_tokens_seen": 1648256576, "step": 5800, "train_runtime": 56458.8542, "train_tokens_per_second": 29193.943 }, { "epoch": 0.20556957322642064, "grad_norm": 1.34375, "learning_rate": 3.976653990792979e-05, "loss": 1.1316509246826172, "num_input_tokens_seen": 1651121344, "step": 5810, "train_runtime": 56559.0913, "train_tokens_per_second": 29192.855 }, { "epoch": 0.20592339349014943, "grad_norm": 1.3671875, "learning_rate": 3.9753968687716206e-05, "loss": 1.1508367538452149, "num_input_tokens_seen": 1654019904, "step": 5820, "train_runtime": 56660.667, "train_tokens_per_second": 29191.677 }, { "epoch": 0.2062772137538782, "grad_norm": 1.390625, "learning_rate": 3.974140938222232e-05, "loss": 1.163071632385254, "num_input_tokens_seen": 1656882560, "step": 5830, "train_runtime": 56757.9602, "train_tokens_per_second": 29192.074 }, { "epoch": 0.206631034017607, "grad_norm": 1.4453125, "learning_rate": 3.972886197263915e-05, "loss": 1.1346718788146972, "num_input_tokens_seen": 1659705024, "step": 5840, "train_runtime": 56855.0025, "train_tokens_per_second": 29191.891 }, { "epoch": 0.20698485428133576, "grad_norm": 1.3203125, "learning_rate": 3.97163264401993e-05, "loss": 1.1526689529418945, "num_input_tokens_seen": 1662524416, "step": 5850, "train_runtime": 56952.7032, "train_tokens_per_second": 29191.317 }, { "epoch": 0.20733867454506455, "grad_norm": 1.4140625, "learning_rate": 3.970380276617677e-05, "loss": 1.1438655853271484, "num_input_tokens_seen": 1665339712, "step": 5860, "train_runtime": 57046.7553, "train_tokens_per_second": 29192.54 }, { "epoch": 0.20769249480879332, "grad_norm": 1.4453125, "learning_rate": 3.96912909318869e-05, "loss": 1.1559438705444336, "num_input_tokens_seen": 1668169472, "step": 5870, "train_runtime": 57143.1243, "train_tokens_per_second": 29192.829 }, { "epoch": 0.2080463150725221, "grad_norm": 1.421875, "learning_rate": 3.96787909186862e-05, "loss": 1.159921360015869, "num_input_tokens_seen": 1671030400, "step": 5880, "train_runtime": 57242.653, "train_tokens_per_second": 29192.05 }, { "epoch": 0.20840013533625087, "grad_norm": 1.421875, "learning_rate": 3.9666302707972244e-05, "loss": 1.1411149978637696, "num_input_tokens_seen": 1673912576, "step": 5890, "train_runtime": 57342.8691, "train_tokens_per_second": 29191.294 }, { "epoch": 0.20875395559997967, "grad_norm": 1.3515625, "learning_rate": 3.965382628118358e-05, "loss": 1.1569387435913085, "num_input_tokens_seen": 1676753344, "step": 5900, "train_runtime": 57442.2207, "train_tokens_per_second": 29190.26 }, { "epoch": 0.20910777586370843, "grad_norm": 1.4140625, "learning_rate": 3.964136161979959e-05, "loss": 1.1489845275878907, "num_input_tokens_seen": 1679636032, "step": 5910, "train_runtime": 57543.6342, "train_tokens_per_second": 29188.911 }, { "epoch": 0.20946159612743723, "grad_norm": 1.40625, "learning_rate": 3.9628908705340406e-05, "loss": 1.1315176010131835, "num_input_tokens_seen": 1682448960, "step": 5920, "train_runtime": 57637.531, "train_tokens_per_second": 29190.164 }, { "epoch": 0.209815416391166, "grad_norm": 1.4296875, "learning_rate": 3.961646751936673e-05, "loss": 1.154404640197754, "num_input_tokens_seen": 1685275328, "step": 5930, "train_runtime": 57735.653, "train_tokens_per_second": 29189.508 }, { "epoch": 0.21016923665489476, "grad_norm": 1.390625, "learning_rate": 3.960403804347979e-05, "loss": 1.149032974243164, "num_input_tokens_seen": 1688108032, "step": 5940, "train_runtime": 57836.2769, "train_tokens_per_second": 29187.702 }, { "epoch": 0.21052305691862355, "grad_norm": 1.375, "learning_rate": 3.959162025932119e-05, "loss": 1.1340028762817382, "num_input_tokens_seen": 1691020608, "step": 5950, "train_runtime": 57938.5232, "train_tokens_per_second": 29186.464 }, { "epoch": 0.21087687718235232, "grad_norm": 1.3203125, "learning_rate": 3.95792141485728e-05, "loss": 1.1358987808227539, "num_input_tokens_seen": 1693874496, "step": 5960, "train_runtime": 58035.898, "train_tokens_per_second": 29186.668 }, { "epoch": 0.2112306974460811, "grad_norm": 1.390625, "learning_rate": 3.956681969295664e-05, "loss": 1.1353602409362793, "num_input_tokens_seen": 1696687552, "step": 5970, "train_runtime": 58132.2615, "train_tokens_per_second": 29186.677 }, { "epoch": 0.21158451770980988, "grad_norm": 1.40625, "learning_rate": 3.955443687423479e-05, "loss": 1.1650691032409668, "num_input_tokens_seen": 1699554688, "step": 5980, "train_runtime": 58228.5775, "train_tokens_per_second": 29187.639 }, { "epoch": 0.21193833797353867, "grad_norm": 1.34375, "learning_rate": 3.954206567420924e-05, "loss": 1.1413604736328125, "num_input_tokens_seen": 1702368448, "step": 5990, "train_runtime": 58324.341, "train_tokens_per_second": 29187.959 }, { "epoch": 0.21229215823726744, "grad_norm": 1.40625, "learning_rate": 3.952970607472179e-05, "loss": 1.1468786239624023, "num_input_tokens_seen": 1705224320, "step": 6000, "train_runtime": 58421.791, "train_tokens_per_second": 29188.156 }, { "epoch": 0.21264597850099623, "grad_norm": 1.4140625, "learning_rate": 3.951735805765399e-05, "loss": 1.1585137367248535, "num_input_tokens_seen": 1708082560, "step": 6010, "train_runtime": 58522.3005, "train_tokens_per_second": 29186.866 }, { "epoch": 0.212999798764725, "grad_norm": 1.34375, "learning_rate": 3.950502160492692e-05, "loss": 1.1556333541870116, "num_input_tokens_seen": 1710936896, "step": 6020, "train_runtime": 58621.1972, "train_tokens_per_second": 29186.318 }, { "epoch": 0.2133536190284538, "grad_norm": 1.3828125, "learning_rate": 3.9492696698501205e-05, "loss": 1.1288800239562988, "num_input_tokens_seen": 1713764544, "step": 6030, "train_runtime": 58719.1419, "train_tokens_per_second": 29185.79 }, { "epoch": 0.21370743929218255, "grad_norm": 1.359375, "learning_rate": 3.9480383320376784e-05, "loss": 1.1399528503417968, "num_input_tokens_seen": 1716610688, "step": 6040, "train_runtime": 58814.2339, "train_tokens_per_second": 29186.994 }, { "epoch": 0.21406125955591135, "grad_norm": 1.421875, "learning_rate": 3.94680814525929e-05, "loss": 1.1543367385864258, "num_input_tokens_seen": 1719404096, "step": 6050, "train_runtime": 58910.3287, "train_tokens_per_second": 29186.802 }, { "epoch": 0.21441507981964011, "grad_norm": 1.421875, "learning_rate": 3.945579107722792e-05, "loss": 1.1419769287109376, "num_input_tokens_seen": 1722238400, "step": 6060, "train_runtime": 59008.5208, "train_tokens_per_second": 29186.266 }, { "epoch": 0.2147689000833689, "grad_norm": 1.390625, "learning_rate": 3.9443512176399276e-05, "loss": 1.1401005744934083, "num_input_tokens_seen": 1725054016, "step": 6070, "train_runtime": 59108.3679, "train_tokens_per_second": 29184.599 }, { "epoch": 0.21512272034709767, "grad_norm": 1.3671875, "learning_rate": 3.9431244732263307e-05, "loss": 1.1481748580932618, "num_input_tokens_seen": 1727897216, "step": 6080, "train_runtime": 59205.3681, "train_tokens_per_second": 29184.807 }, { "epoch": 0.21547654061082647, "grad_norm": 1.390625, "learning_rate": 3.941898872701519e-05, "loss": 1.1427518844604492, "num_input_tokens_seen": 1730726784, "step": 6090, "train_runtime": 59303.4314, "train_tokens_per_second": 29184.26 }, { "epoch": 0.21583036087455523, "grad_norm": 1.4140625, "learning_rate": 3.940674414288882e-05, "loss": 1.1553242683410645, "num_input_tokens_seen": 1733550144, "step": 6100, "train_runtime": 59398.42, "train_tokens_per_second": 29185.122 }, { "epoch": 0.21618418113828403, "grad_norm": 1.375, "learning_rate": 3.939451096215668e-05, "loss": 1.1446781158447266, "num_input_tokens_seen": 1736353792, "step": 6110, "train_runtime": 59490.7245, "train_tokens_per_second": 29186.967 }, { "epoch": 0.2165380014020128, "grad_norm": 1.40625, "learning_rate": 3.938228916712978e-05, "loss": 1.1400846481323241, "num_input_tokens_seen": 1739209408, "step": 6120, "train_runtime": 59588.3461, "train_tokens_per_second": 29187.073 }, { "epoch": 0.21689182166574159, "grad_norm": 1.390625, "learning_rate": 3.937007874015748e-05, "loss": 1.1396926879882812, "num_input_tokens_seen": 1742103104, "step": 6130, "train_runtime": 59688.4129, "train_tokens_per_second": 29186.621 }, { "epoch": 0.21724564192947035, "grad_norm": 1.421875, "learning_rate": 3.935787966362748e-05, "loss": 1.1415468215942384, "num_input_tokens_seen": 1744954176, "step": 6140, "train_runtime": 59786.5128, "train_tokens_per_second": 29186.418 }, { "epoch": 0.21759946219319914, "grad_norm": 1.5859375, "learning_rate": 3.9345691919965595e-05, "loss": 1.1422434806823731, "num_input_tokens_seen": 1747763136, "step": 6150, "train_runtime": 59880.6236, "train_tokens_per_second": 29187.457 }, { "epoch": 0.2179532824569279, "grad_norm": 1.4140625, "learning_rate": 3.9333515491635764e-05, "loss": 1.127164649963379, "num_input_tokens_seen": 1750596096, "step": 6160, "train_runtime": 59977.0687, "train_tokens_per_second": 29187.757 }, { "epoch": 0.2183071027206567, "grad_norm": 1.3828125, "learning_rate": 3.932135036113987e-05, "loss": 1.1408446311950684, "num_input_tokens_seen": 1753441664, "step": 6170, "train_runtime": 60074.709, "train_tokens_per_second": 29187.685 }, { "epoch": 0.21866092298438547, "grad_norm": 1.359375, "learning_rate": 3.930919651101764e-05, "loss": 1.1441112518310548, "num_input_tokens_seen": 1756270976, "step": 6180, "train_runtime": 60168.8001, "train_tokens_per_second": 29189.064 }, { "epoch": 0.21901474324811424, "grad_norm": 1.4296875, "learning_rate": 3.9297053923846576e-05, "loss": 1.139028263092041, "num_input_tokens_seen": 1759120064, "step": 6190, "train_runtime": 60266.842, "train_tokens_per_second": 29188.854 }, { "epoch": 0.21936856351184303, "grad_norm": 1.421875, "learning_rate": 3.928492258224183e-05, "loss": 1.1424497604370116, "num_input_tokens_seen": 1761969408, "step": 6200, "train_runtime": 60367.2567, "train_tokens_per_second": 29187.502 }, { "epoch": 0.2197223837755718, "grad_norm": 1.390625, "learning_rate": 3.927280246885609e-05, "loss": 1.1556337356567383, "num_input_tokens_seen": 1764794368, "step": 6210, "train_runtime": 60461.8492, "train_tokens_per_second": 29188.561 }, { "epoch": 0.2200762040393006, "grad_norm": 1.3515625, "learning_rate": 3.9260693566379486e-05, "loss": 1.1572488784790038, "num_input_tokens_seen": 1767617984, "step": 6220, "train_runtime": 60556.4517, "train_tokens_per_second": 29189.59 }, { "epoch": 0.22043002430302935, "grad_norm": 1.3671875, "learning_rate": 3.924859585753948e-05, "loss": 1.1354021072387694, "num_input_tokens_seen": 1770441920, "step": 6230, "train_runtime": 60655.5988, "train_tokens_per_second": 29188.434 }, { "epoch": 0.22078384456675815, "grad_norm": 1.484375, "learning_rate": 3.923650932510079e-05, "loss": 1.136590576171875, "num_input_tokens_seen": 1773221248, "step": 6240, "train_runtime": 60751.2281, "train_tokens_per_second": 29188.237 }, { "epoch": 0.2211376648304869, "grad_norm": 1.3828125, "learning_rate": 3.9224433951865215e-05, "loss": 1.1415470123291016, "num_input_tokens_seen": 1776083840, "step": 6250, "train_runtime": 60851.0098, "train_tokens_per_second": 29187.418 }, { "epoch": 0.2214914850942157, "grad_norm": 1.4453125, "learning_rate": 3.921236972067165e-05, "loss": 1.1432729721069337, "num_input_tokens_seen": 1778896128, "step": 6260, "train_runtime": 60947.4036, "train_tokens_per_second": 29187.398 }, { "epoch": 0.22184530535794447, "grad_norm": 1.4296875, "learning_rate": 3.920031661439585e-05, "loss": 1.1537821769714356, "num_input_tokens_seen": 1781776256, "step": 6270, "train_runtime": 61047.4585, "train_tokens_per_second": 29186.739 }, { "epoch": 0.22219912562167327, "grad_norm": 1.3828125, "learning_rate": 3.918827461595045e-05, "loss": 1.1450191497802735, "num_input_tokens_seen": 1784618432, "step": 6280, "train_runtime": 61144.8827, "train_tokens_per_second": 29186.718 }, { "epoch": 0.22255294588540203, "grad_norm": 1.4453125, "learning_rate": 3.9176243708284746e-05, "loss": 1.1388998985290528, "num_input_tokens_seen": 1787409536, "step": 6290, "train_runtime": 61238.0544, "train_tokens_per_second": 29187.889 }, { "epoch": 0.22290676614913082, "grad_norm": 1.375, "learning_rate": 3.9164223874384715e-05, "loss": 1.1438385009765626, "num_input_tokens_seen": 1790285248, "step": 6300, "train_runtime": 61337.5985, "train_tokens_per_second": 29187.404 }, { "epoch": 0.2232605864128596, "grad_norm": 1.421875, "learning_rate": 3.91522150972728e-05, "loss": 1.154564094543457, "num_input_tokens_seen": 1793080832, "step": 6310, "train_runtime": 61431.9211, "train_tokens_per_second": 29188.096 }, { "epoch": 0.22361440667658838, "grad_norm": 1.3515625, "learning_rate": 3.9140217360007896e-05, "loss": 1.143277359008789, "num_input_tokens_seen": 1795923200, "step": 6320, "train_runtime": 61531.1083, "train_tokens_per_second": 29187.24 }, { "epoch": 0.22396822694031715, "grad_norm": 1.40625, "learning_rate": 3.912823064568521e-05, "loss": 1.1513311386108398, "num_input_tokens_seen": 1798770432, "step": 6330, "train_runtime": 61627.5978, "train_tokens_per_second": 29187.742 }, { "epoch": 0.22432204720404594, "grad_norm": 1.4453125, "learning_rate": 3.9116254937436155e-05, "loss": 1.1597996711730958, "num_input_tokens_seen": 1801678912, "step": 6340, "train_runtime": 61730.9808, "train_tokens_per_second": 29185.976 }, { "epoch": 0.2246758674677747, "grad_norm": 1.4296875, "learning_rate": 3.910429021842825e-05, "loss": 1.1374059677124024, "num_input_tokens_seen": 1804571712, "step": 6350, "train_runtime": 61833.0496, "train_tokens_per_second": 29184.582 }, { "epoch": 0.2250296877315035, "grad_norm": 1.359375, "learning_rate": 3.9092336471865084e-05, "loss": 1.1346322059631349, "num_input_tokens_seen": 1807458880, "step": 6360, "train_runtime": 61932.2407, "train_tokens_per_second": 29184.458 }, { "epoch": 0.22538350799523227, "grad_norm": 1.40625, "learning_rate": 3.908039368098611e-05, "loss": 1.1326444625854493, "num_input_tokens_seen": 1810334720, "step": 6370, "train_runtime": 62032.6656, "train_tokens_per_second": 29183.571 }, { "epoch": 0.22573732825896106, "grad_norm": 1.4296875, "learning_rate": 3.9068461829066633e-05, "loss": 1.1365474700927733, "num_input_tokens_seen": 1813165248, "step": 6380, "train_runtime": 62131.792, "train_tokens_per_second": 29182.568 }, { "epoch": 0.22609114852268983, "grad_norm": 1.3984375, "learning_rate": 3.9056540899417656e-05, "loss": 1.12777099609375, "num_input_tokens_seen": 1816047488, "step": 6390, "train_runtime": 62230.2839, "train_tokens_per_second": 29182.696 }, { "epoch": 0.22644496878641862, "grad_norm": 1.4921875, "learning_rate": 3.904463087538585e-05, "loss": 1.1430343627929687, "num_input_tokens_seen": 1818968000, "step": 6400, "train_runtime": 62332.1216, "train_tokens_per_second": 29181.872 }, { "epoch": 0.2267987890501474, "grad_norm": 1.3515625, "learning_rate": 3.903273174035336e-05, "loss": 1.1484623908996583, "num_input_tokens_seen": 1821808384, "step": 6410, "train_runtime": 62427.7789, "train_tokens_per_second": 29182.656 }, { "epoch": 0.22715260931387618, "grad_norm": 1.3359375, "learning_rate": 3.902084347773779e-05, "loss": 1.1474923133850097, "num_input_tokens_seen": 1824615104, "step": 6420, "train_runtime": 62518.6878, "train_tokens_per_second": 29185.115 }, { "epoch": 0.22750642957760495, "grad_norm": 1.4375, "learning_rate": 3.900896607099207e-05, "loss": 1.143539047241211, "num_input_tokens_seen": 1827493440, "step": 6430, "train_runtime": 62616.2699, "train_tokens_per_second": 29185.601 }, { "epoch": 0.2278602498413337, "grad_norm": 1.515625, "learning_rate": 3.899709950360437e-05, "loss": 1.1556416511535645, "num_input_tokens_seen": 1830364224, "step": 6440, "train_runtime": 62720.3892, "train_tokens_per_second": 29182.922 }, { "epoch": 0.2282140701050625, "grad_norm": 1.375, "learning_rate": 3.8985243759097997e-05, "loss": 1.1459407806396484, "num_input_tokens_seen": 1833173248, "step": 6450, "train_runtime": 62818.2893, "train_tokens_per_second": 29182.158 }, { "epoch": 0.22856789036879127, "grad_norm": 1.34375, "learning_rate": 3.897339882103129e-05, "loss": 1.1415900230407714, "num_input_tokens_seen": 1836004224, "step": 6460, "train_runtime": 62914.7275, "train_tokens_per_second": 29182.424 }, { "epoch": 0.22892171063252006, "grad_norm": 1.3671875, "learning_rate": 3.8961564672997544e-05, "loss": 1.1457250595092774, "num_input_tokens_seen": 1838892288, "step": 6470, "train_runtime": 63014.2845, "train_tokens_per_second": 29182.15 }, { "epoch": 0.22927553089624883, "grad_norm": 1.4453125, "learning_rate": 3.8949741298624924e-05, "loss": 1.138191318511963, "num_input_tokens_seen": 1841783296, "step": 6480, "train_runtime": 63114.5779, "train_tokens_per_second": 29181.583 }, { "epoch": 0.22962935115997762, "grad_norm": 1.4375, "learning_rate": 3.8937928681576305e-05, "loss": 1.1177082061767578, "num_input_tokens_seen": 1844600320, "step": 6490, "train_runtime": 63212.3698, "train_tokens_per_second": 29181.002 }, { "epoch": 0.2299831714237064, "grad_norm": 1.4375, "learning_rate": 3.8926126805549276e-05, "loss": 1.136014747619629, "num_input_tokens_seen": 1847412800, "step": 6500, "train_runtime": 63309.1661, "train_tokens_per_second": 29180.811 }, { "epoch": 0.23033699168743518, "grad_norm": 1.40625, "learning_rate": 3.891433565427596e-05, "loss": 1.140073013305664, "num_input_tokens_seen": 1850266368, "step": 6510, "train_runtime": 63405.5182, "train_tokens_per_second": 29181.472 }, { "epoch": 0.23069081195116395, "grad_norm": 1.4453125, "learning_rate": 3.8902555211522964e-05, "loss": 1.1314300537109374, "num_input_tokens_seen": 1853080064, "step": 6520, "train_runtime": 63502.8761, "train_tokens_per_second": 29181.042 }, { "epoch": 0.23104463221489274, "grad_norm": 1.453125, "learning_rate": 3.889078546109127e-05, "loss": 1.1261022567749024, "num_input_tokens_seen": 1855954496, "step": 6530, "train_runtime": 63601.115, "train_tokens_per_second": 29181.163 }, { "epoch": 0.2313984524786215, "grad_norm": 1.40625, "learning_rate": 3.887902638681616e-05, "loss": 1.1435681343078614, "num_input_tokens_seen": 1858839360, "step": 6540, "train_runtime": 63703.9171, "train_tokens_per_second": 29179.357 }, { "epoch": 0.2317522727423503, "grad_norm": 1.359375, "learning_rate": 3.886727797256707e-05, "loss": 1.1449981689453126, "num_input_tokens_seen": 1861636608, "step": 6550, "train_runtime": 63797.3175, "train_tokens_per_second": 29180.484 }, { "epoch": 0.23210609300607907, "grad_norm": 1.453125, "learning_rate": 3.88555402022476e-05, "loss": 1.1497786521911622, "num_input_tokens_seen": 1864463936, "step": 6560, "train_runtime": 63893.4284, "train_tokens_per_second": 29180.84 }, { "epoch": 0.23245991326980786, "grad_norm": 1.4296875, "learning_rate": 3.884381305979528e-05, "loss": 1.1577054023742677, "num_input_tokens_seen": 1867305792, "step": 6570, "train_runtime": 63988.8544, "train_tokens_per_second": 29181.735 }, { "epoch": 0.23281373353353663, "grad_norm": 1.34375, "learning_rate": 3.883209652918163e-05, "loss": 1.152506160736084, "num_input_tokens_seen": 1870197312, "step": 6580, "train_runtime": 64090.5322, "train_tokens_per_second": 29180.555 }, { "epoch": 0.23316755379726542, "grad_norm": 1.359375, "learning_rate": 3.8820390594411935e-05, "loss": 1.135176181793213, "num_input_tokens_seen": 1873037888, "step": 6590, "train_runtime": 64186.4843, "train_tokens_per_second": 29181.188 }, { "epoch": 0.23352137406099419, "grad_norm": 1.5234375, "learning_rate": 3.880869523952524e-05, "loss": 1.146751308441162, "num_input_tokens_seen": 1875862336, "step": 6600, "train_runtime": 64282.3637, "train_tokens_per_second": 29181.602 }, { "epoch": 0.23387519432472298, "grad_norm": 1.4140625, "learning_rate": 3.879701044859422e-05, "loss": 1.1365710258483888, "num_input_tokens_seen": 1878708736, "step": 6610, "train_runtime": 64381.5086, "train_tokens_per_second": 29180.875 }, { "epoch": 0.23422901458845174, "grad_norm": 1.4453125, "learning_rate": 3.87853362057251e-05, "loss": 1.1493534088134765, "num_input_tokens_seen": 1881544192, "step": 6620, "train_runtime": 64478.8465, "train_tokens_per_second": 29180.798 }, { "epoch": 0.23458283485218054, "grad_norm": 1.3984375, "learning_rate": 3.8773672495057576e-05, "loss": 1.1299819946289062, "num_input_tokens_seen": 1884380800, "step": 6630, "train_runtime": 64576.4644, "train_tokens_per_second": 29180.613 }, { "epoch": 0.2349366551159093, "grad_norm": 1.4453125, "learning_rate": 3.8762019300764674e-05, "loss": 1.1530756950378418, "num_input_tokens_seen": 1887308288, "step": 6640, "train_runtime": 64678.532, "train_tokens_per_second": 29179.826 }, { "epoch": 0.2352904753796381, "grad_norm": 1.4296875, "learning_rate": 3.875037660705273e-05, "loss": 1.141530418395996, "num_input_tokens_seen": 1890241536, "step": 6650, "train_runtime": 64782.7117, "train_tokens_per_second": 29178.179 }, { "epoch": 0.23564429564336686, "grad_norm": 1.3828125, "learning_rate": 3.873874439816127e-05, "loss": 1.1291374206542968, "num_input_tokens_seen": 1893055168, "step": 6660, "train_runtime": 64877.9561, "train_tokens_per_second": 29178.712 }, { "epoch": 0.23599811590709566, "grad_norm": 1.421875, "learning_rate": 3.872712265836289e-05, "loss": 1.1466433525085449, "num_input_tokens_seen": 1895939264, "step": 6670, "train_runtime": 64979.0119, "train_tokens_per_second": 29177.718 }, { "epoch": 0.23635193617082442, "grad_norm": 1.421875, "learning_rate": 3.8715511371963225e-05, "loss": 1.135545253753662, "num_input_tokens_seen": 1898837952, "step": 6680, "train_runtime": 65079.8874, "train_tokens_per_second": 29177.032 }, { "epoch": 0.23670575643455322, "grad_norm": 1.3828125, "learning_rate": 3.87039105233008e-05, "loss": 1.142326545715332, "num_input_tokens_seen": 1901653440, "step": 6690, "train_runtime": 65174.2205, "train_tokens_per_second": 29178.001 }, { "epoch": 0.23705957669828198, "grad_norm": 1.3671875, "learning_rate": 3.8692320096746975e-05, "loss": 1.1339874267578125, "num_input_tokens_seen": 1904521472, "step": 6700, "train_runtime": 65273.7606, "train_tokens_per_second": 29177.444 }, { "epoch": 0.23741339696201075, "grad_norm": 1.390625, "learning_rate": 3.868074007670589e-05, "loss": 1.1387247085571288, "num_input_tokens_seen": 1907357632, "step": 6710, "train_runtime": 65367.9752, "train_tokens_per_second": 29178.778 }, { "epoch": 0.23776721722573954, "grad_norm": 1.4375, "learning_rate": 3.866917044761428e-05, "loss": 1.1407943725585938, "num_input_tokens_seen": 1910141312, "step": 6720, "train_runtime": 65462.4518, "train_tokens_per_second": 29179.19 }, { "epoch": 0.2381210374894683, "grad_norm": 1.4375, "learning_rate": 3.8657611193941486e-05, "loss": 1.1545680999755858, "num_input_tokens_seen": 1912992640, "step": 6730, "train_runtime": 65559.5331, "train_tokens_per_second": 29179.473 }, { "epoch": 0.2384748577531971, "grad_norm": 1.4140625, "learning_rate": 3.8646062300189315e-05, "loss": 1.1428878784179688, "num_input_tokens_seen": 1915814976, "step": 6740, "train_runtime": 65655.9673, "train_tokens_per_second": 29179.602 }, { "epoch": 0.23882867801692587, "grad_norm": 1.4765625, "learning_rate": 3.8634523750891984e-05, "loss": 1.134803009033203, "num_input_tokens_seen": 1918640832, "step": 6750, "train_runtime": 65751.9303, "train_tokens_per_second": 29179.992 }, { "epoch": 0.23918249828065466, "grad_norm": 1.421875, "learning_rate": 3.862299553061597e-05, "loss": 1.1285060882568358, "num_input_tokens_seen": 1921455040, "step": 6760, "train_runtime": 65848.0918, "train_tokens_per_second": 29180.117 }, { "epoch": 0.23953631854438343, "grad_norm": 1.359375, "learning_rate": 3.861147762396e-05, "loss": 1.1300186157226562, "num_input_tokens_seen": 1924308160, "step": 6770, "train_runtime": 65945.4527, "train_tokens_per_second": 29180.301 }, { "epoch": 0.23989013880811222, "grad_norm": 1.375, "learning_rate": 3.859997001555494e-05, "loss": 1.1520641326904297, "num_input_tokens_seen": 1927171840, "step": 6780, "train_runtime": 66045.4698, "train_tokens_per_second": 29179.471 }, { "epoch": 0.24024395907184098, "grad_norm": 1.4140625, "learning_rate": 3.8588472690063676e-05, "loss": 1.129981231689453, "num_input_tokens_seen": 1930048320, "step": 6790, "train_runtime": 66143.4647, "train_tokens_per_second": 29179.728 }, { "epoch": 0.24059777933556978, "grad_norm": 1.421875, "learning_rate": 3.857698563218106e-05, "loss": 1.133086585998535, "num_input_tokens_seen": 1932894976, "step": 6800, "train_runtime": 66240.003, "train_tokens_per_second": 29180.176 }, { "epoch": 0.24095159959929854, "grad_norm": 1.4140625, "learning_rate": 3.8565508826633836e-05, "loss": 1.149017906188965, "num_input_tokens_seen": 1935687936, "step": 6810, "train_runtime": 66335.2542, "train_tokens_per_second": 29180.38 }, { "epoch": 0.24130541986302734, "grad_norm": 1.4375, "learning_rate": 3.855404225818049e-05, "loss": 1.1403033256530761, "num_input_tokens_seen": 1938496576, "step": 6820, "train_runtime": 66427.9314, "train_tokens_per_second": 29181.95 }, { "epoch": 0.2416592401267561, "grad_norm": 1.484375, "learning_rate": 3.8542585911611286e-05, "loss": 1.1356518745422364, "num_input_tokens_seen": 1941282368, "step": 6830, "train_runtime": 66524.8751, "train_tokens_per_second": 29181.3 }, { "epoch": 0.2420130603904849, "grad_norm": 1.3671875, "learning_rate": 3.853113977174803e-05, "loss": 1.1438831329345702, "num_input_tokens_seen": 1944067968, "step": 6840, "train_runtime": 66618.031, "train_tokens_per_second": 29182.309 }, { "epoch": 0.24236688065421366, "grad_norm": 1.3671875, "learning_rate": 3.851970382344411e-05, "loss": 1.1441171646118165, "num_input_tokens_seen": 1946858304, "step": 6850, "train_runtime": 66712.4292, "train_tokens_per_second": 29182.842 }, { "epoch": 0.24272070091794246, "grad_norm": 1.375, "learning_rate": 3.850827805158433e-05, "loss": 1.136497402191162, "num_input_tokens_seen": 1949729472, "step": 6860, "train_runtime": 66811.8681, "train_tokens_per_second": 29182.382 }, { "epoch": 0.24307452118167122, "grad_norm": 1.4140625, "learning_rate": 3.8496862441084896e-05, "loss": 1.1479606628417969, "num_input_tokens_seen": 1952568000, "step": 6870, "train_runtime": 66910.8616, "train_tokens_per_second": 29181.63 }, { "epoch": 0.24342834144540001, "grad_norm": 1.40625, "learning_rate": 3.848545697689328e-05, "loss": 1.1422126770019532, "num_input_tokens_seen": 1955436224, "step": 6880, "train_runtime": 67010.6494, "train_tokens_per_second": 29180.977 }, { "epoch": 0.24378216170912878, "grad_norm": 1.5, "learning_rate": 3.8474061643988136e-05, "loss": 1.1392714500427246, "num_input_tokens_seen": 1958284672, "step": 6890, "train_runtime": 67107.2396, "train_tokens_per_second": 29181.422 }, { "epoch": 0.24413598197285757, "grad_norm": 1.4375, "learning_rate": 3.846267642737925e-05, "loss": 1.1346969604492188, "num_input_tokens_seen": 1961151936, "step": 6900, "train_runtime": 67206.3038, "train_tokens_per_second": 29181.071 }, { "epoch": 0.24448980223658634, "grad_norm": 1.3671875, "learning_rate": 3.8451301312107455e-05, "loss": 1.1457378387451171, "num_input_tokens_seen": 1963977536, "step": 6910, "train_runtime": 67299.259, "train_tokens_per_second": 29182.751 }, { "epoch": 0.24484362250031513, "grad_norm": 1.4296875, "learning_rate": 3.843993628324451e-05, "loss": 1.1376886367797852, "num_input_tokens_seen": 1966882304, "step": 6920, "train_runtime": 67400.1047, "train_tokens_per_second": 29182.185 }, { "epoch": 0.2451974427640439, "grad_norm": 1.40625, "learning_rate": 3.8428581325893034e-05, "loss": 1.1302379608154296, "num_input_tokens_seen": 1969747328, "step": 6930, "train_runtime": 67499.8873, "train_tokens_per_second": 29181.491 }, { "epoch": 0.2455512630277727, "grad_norm": 1.4453125, "learning_rate": 3.8417236425186484e-05, "loss": 1.1344221115112305, "num_input_tokens_seen": 1972638400, "step": 6940, "train_runtime": 67599.4762, "train_tokens_per_second": 29181.268 }, { "epoch": 0.24590508329150146, "grad_norm": 1.375, "learning_rate": 3.840590156628895e-05, "loss": 1.1475934028625487, "num_input_tokens_seen": 1975386240, "step": 6950, "train_runtime": 67691.2636, "train_tokens_per_second": 29182.292 }, { "epoch": 0.24625890355523022, "grad_norm": 1.4296875, "learning_rate": 3.8394576734395205e-05, "loss": 1.1424145698547363, "num_input_tokens_seen": 1978244864, "step": 6960, "train_runtime": 67788.0498, "train_tokens_per_second": 29182.797 }, { "epoch": 0.24661272381895902, "grad_norm": 1.3515625, "learning_rate": 3.838326191473054e-05, "loss": 1.139106845855713, "num_input_tokens_seen": 1981100288, "step": 6970, "train_runtime": 67884.3, "train_tokens_per_second": 29183.483 }, { "epoch": 0.24696654408268778, "grad_norm": 1.3515625, "learning_rate": 3.837195709255069e-05, "loss": 1.1418012619018554, "num_input_tokens_seen": 1983949504, "step": 6980, "train_runtime": 67981.7282, "train_tokens_per_second": 29183.57 }, { "epoch": 0.24732036434641658, "grad_norm": 1.4140625, "learning_rate": 3.8360662253141796e-05, "loss": 1.1349398612976074, "num_input_tokens_seen": 1986802688, "step": 6990, "train_runtime": 68080.1139, "train_tokens_per_second": 29183.304 }, { "epoch": 0.24767418461014534, "grad_norm": 1.3828125, "learning_rate": 3.834937738182029e-05, "loss": 1.146417236328125, "num_input_tokens_seen": 1989645568, "step": 7000, "train_runtime": 68178.2889, "train_tokens_per_second": 29182.979 }, { "epoch": 0.24802800487387414, "grad_norm": 1.390625, "learning_rate": 3.833810246393281e-05, "loss": 1.1256877899169921, "num_input_tokens_seen": 1992492736, "step": 7010, "train_runtime": 68275.4144, "train_tokens_per_second": 29183.166 }, { "epoch": 0.2483818251376029, "grad_norm": 1.3828125, "learning_rate": 3.832683748485616e-05, "loss": 1.1218952178955077, "num_input_tokens_seen": 1995362560, "step": 7020, "train_runtime": 68376.5348, "train_tokens_per_second": 29181.978 }, { "epoch": 0.2487356454013317, "grad_norm": 1.3359375, "learning_rate": 3.8315582429997184e-05, "loss": 1.1263322830200195, "num_input_tokens_seen": 1998209664, "step": 7030, "train_runtime": 68473.9816, "train_tokens_per_second": 29182.028 }, { "epoch": 0.24908946566506046, "grad_norm": 1.3203125, "learning_rate": 3.830433728479272e-05, "loss": 1.1397740364074707, "num_input_tokens_seen": 2001065600, "step": 7040, "train_runtime": 68572.8357, "train_tokens_per_second": 29181.608 }, { "epoch": 0.24944328592878925, "grad_norm": 1.375, "learning_rate": 3.829310203470948e-05, "loss": 1.1502744674682617, "num_input_tokens_seen": 2003880192, "step": 7050, "train_runtime": 68669.2815, "train_tokens_per_second": 29181.61 }, { "epoch": 0.24979710619251802, "grad_norm": 1.4140625, "learning_rate": 3.828187666524403e-05, "loss": 1.131840419769287, "num_input_tokens_seen": 2006683904, "step": 7060, "train_runtime": 68762.6417, "train_tokens_per_second": 29182.763 }, { "epoch": 0.2501509264562468, "grad_norm": 1.46875, "learning_rate": 3.827066116192266e-05, "loss": 1.1296314239501952, "num_input_tokens_seen": 2009511232, "step": 7070, "train_runtime": 68859.0959, "train_tokens_per_second": 29182.945 }, { "epoch": 0.2505047467199756, "grad_norm": 1.4453125, "learning_rate": 3.825945551030135e-05, "loss": 1.134183120727539, "num_input_tokens_seen": 2012319744, "step": 7080, "train_runtime": 68954.6519, "train_tokens_per_second": 29183.234 }, { "epoch": 0.25085856698370435, "grad_norm": 1.4296875, "learning_rate": 3.824825969596561e-05, "loss": 1.114000415802002, "num_input_tokens_seen": 2015164544, "step": 7090, "train_runtime": 69052.0159, "train_tokens_per_second": 29183.283 }, { "epoch": 0.25121238724743317, "grad_norm": 1.3671875, "learning_rate": 3.823707370453054e-05, "loss": 1.157622718811035, "num_input_tokens_seen": 2018028928, "step": 7100, "train_runtime": 69151.1325, "train_tokens_per_second": 29182.876 }, { "epoch": 0.25156620751116193, "grad_norm": 1.3671875, "learning_rate": 3.8225897521640614e-05, "loss": 1.1390769004821777, "num_input_tokens_seen": 2020869120, "step": 7110, "train_runtime": 69246.1316, "train_tokens_per_second": 29183.856 }, { "epoch": 0.2519200277748907, "grad_norm": 1.40625, "learning_rate": 3.8214731132969675e-05, "loss": 1.1347352981567382, "num_input_tokens_seen": 2023728320, "step": 7120, "train_runtime": 69346.0722, "train_tokens_per_second": 29183.027 }, { "epoch": 0.25227384803861946, "grad_norm": 1.3515625, "learning_rate": 3.820357452422084e-05, "loss": 1.1225122451782226, "num_input_tokens_seen": 2026488448, "step": 7130, "train_runtime": 69439.3913, "train_tokens_per_second": 29183.557 }, { "epoch": 0.2526276683023483, "grad_norm": 1.40625, "learning_rate": 3.8192427681126445e-05, "loss": 1.1339890480041503, "num_input_tokens_seen": 2029323392, "step": 7140, "train_runtime": 69536.8319, "train_tokens_per_second": 29183.432 }, { "epoch": 0.25298148856607705, "grad_norm": 1.3984375, "learning_rate": 3.818129058944793e-05, "loss": 1.1264930725097657, "num_input_tokens_seen": 2032191488, "step": 7150, "train_runtime": 69635.3811, "train_tokens_per_second": 29183.318 }, { "epoch": 0.2533353088298058, "grad_norm": 1.4375, "learning_rate": 3.817016323497578e-05, "loss": 1.1312952041625977, "num_input_tokens_seen": 2035036480, "step": 7160, "train_runtime": 69732.5297, "train_tokens_per_second": 29183.46 }, { "epoch": 0.2536891290935346, "grad_norm": 1.4140625, "learning_rate": 3.8159045603529455e-05, "loss": 1.136730670928955, "num_input_tokens_seen": 2037872896, "step": 7170, "train_runtime": 69827.7406, "train_tokens_per_second": 29184.288 }, { "epoch": 0.2540429493572634, "grad_norm": 1.40625, "learning_rate": 3.8147937680957334e-05, "loss": 1.1294061660766601, "num_input_tokens_seen": 2040756736, "step": 7180, "train_runtime": 69929.5416, "train_tokens_per_second": 29183.042 }, { "epoch": 0.25439676962099217, "grad_norm": 1.484375, "learning_rate": 3.813683945313658e-05, "loss": 1.1473760604858398, "num_input_tokens_seen": 2043658624, "step": 7190, "train_runtime": 70032.2175, "train_tokens_per_second": 29181.692 }, { "epoch": 0.25475058988472093, "grad_norm": 1.4296875, "learning_rate": 3.812575090597313e-05, "loss": 1.1357305526733399, "num_input_tokens_seen": 2046480768, "step": 7200, "train_runtime": 70126.3916, "train_tokens_per_second": 29182.747 }, { "epoch": 0.2551044101484497, "grad_norm": 1.3984375, "learning_rate": 3.811467202540156e-05, "loss": 1.1149269104003907, "num_input_tokens_seen": 2049320192, "step": 7210, "train_runtime": 70224.2848, "train_tokens_per_second": 29182.5 }, { "epoch": 0.25545823041217847, "grad_norm": 1.390625, "learning_rate": 3.810360279738507e-05, "loss": 1.1372767448425294, "num_input_tokens_seen": 2052214592, "step": 7220, "train_runtime": 70325.8296, "train_tokens_per_second": 29181.52 }, { "epoch": 0.2558120506759073, "grad_norm": 1.40625, "learning_rate": 3.809254320791535e-05, "loss": 1.1226654052734375, "num_input_tokens_seen": 2055053696, "step": 7230, "train_runtime": 70424.4302, "train_tokens_per_second": 29180.977 }, { "epoch": 0.25616587093963605, "grad_norm": 1.4140625, "learning_rate": 3.808149324301256e-05, "loss": 1.1400375366210938, "num_input_tokens_seen": 2057861696, "step": 7240, "train_runtime": 70519.6069, "train_tokens_per_second": 29181.412 }, { "epoch": 0.2565196912033648, "grad_norm": 1.40625, "learning_rate": 3.807045288872522e-05, "loss": 1.1438339233398438, "num_input_tokens_seen": 2060795840, "step": 7250, "train_runtime": 70623.2554, "train_tokens_per_second": 29180.131 }, { "epoch": 0.2568735114670936, "grad_norm": 1.46875, "learning_rate": 3.805942213113015e-05, "loss": 1.1415992736816407, "num_input_tokens_seen": 2063608512, "step": 7260, "train_runtime": 70720.183, "train_tokens_per_second": 29179.909 }, { "epoch": 0.2572273317308224, "grad_norm": 1.3984375, "learning_rate": 3.8048400956332385e-05, "loss": 1.1233534812927246, "num_input_tokens_seen": 2066395712, "step": 7270, "train_runtime": 70813.9829, "train_tokens_per_second": 29180.617 }, { "epoch": 0.25758115199455117, "grad_norm": 1.40625, "learning_rate": 3.803738935046512e-05, "loss": 1.1389616012573243, "num_input_tokens_seen": 2069224768, "step": 7280, "train_runtime": 70905.7564, "train_tokens_per_second": 29182.747 }, { "epoch": 0.25793497225827994, "grad_norm": 1.421875, "learning_rate": 3.802638729968962e-05, "loss": 1.1460859298706054, "num_input_tokens_seen": 2072058432, "step": 7290, "train_runtime": 71001.4414, "train_tokens_per_second": 29183.329 }, { "epoch": 0.2582887925220087, "grad_norm": 1.421875, "learning_rate": 3.8015394790195145e-05, "loss": 1.1346612930297852, "num_input_tokens_seen": 2074911296, "step": 7300, "train_runtime": 71098.063, "train_tokens_per_second": 29183.795 }, { "epoch": 0.2586426127857375, "grad_norm": 1.390625, "learning_rate": 3.800441180819891e-05, "loss": 1.1296041488647461, "num_input_tokens_seen": 2077735040, "step": 7310, "train_runtime": 71191.266, "train_tokens_per_second": 29185.252 }, { "epoch": 0.2589964330494663, "grad_norm": 1.4375, "learning_rate": 3.7993438339945965e-05, "loss": 1.1356515884399414, "num_input_tokens_seen": 2080523264, "step": 7320, "train_runtime": 71286.4314, "train_tokens_per_second": 29185.403 }, { "epoch": 0.25935025331319506, "grad_norm": 1.46875, "learning_rate": 3.798247437170914e-05, "loss": 1.1401887893676759, "num_input_tokens_seen": 2083436160, "step": 7330, "train_runtime": 71385.7768, "train_tokens_per_second": 29185.592 }, { "epoch": 0.2597040735769238, "grad_norm": 1.3984375, "learning_rate": 3.797151988978901e-05, "loss": 1.1248514175415039, "num_input_tokens_seen": 2086317440, "step": 7340, "train_runtime": 71486.5402, "train_tokens_per_second": 29184.759 }, { "epoch": 0.26005789384065264, "grad_norm": 1.375, "learning_rate": 3.796057488051377e-05, "loss": 1.1352010726928712, "num_input_tokens_seen": 2089149312, "step": 7350, "train_runtime": 71583.7026, "train_tokens_per_second": 29184.706 }, { "epoch": 0.2604117141043814, "grad_norm": 1.453125, "learning_rate": 3.794963933023918e-05, "loss": 1.1512141227722168, "num_input_tokens_seen": 2092033920, "step": 7360, "train_runtime": 71683.8741, "train_tokens_per_second": 29184.164 }, { "epoch": 0.2607655343681102, "grad_norm": 1.3671875, "learning_rate": 3.79387132253485e-05, "loss": 1.1262611389160155, "num_input_tokens_seen": 2094888320, "step": 7370, "train_runtime": 71779.5244, "train_tokens_per_second": 29185.04 }, { "epoch": 0.26111935463183894, "grad_norm": 1.3984375, "learning_rate": 3.792779655225243e-05, "loss": 1.129753303527832, "num_input_tokens_seen": 2097696448, "step": 7380, "train_runtime": 71874.8108, "train_tokens_per_second": 29185.419 }, { "epoch": 0.26147317489556776, "grad_norm": 1.3671875, "learning_rate": 3.791688929738902e-05, "loss": 1.1443886756896973, "num_input_tokens_seen": 2100542080, "step": 7390, "train_runtime": 71972.3708, "train_tokens_per_second": 29185.395 }, { "epoch": 0.2618269951592965, "grad_norm": 1.453125, "learning_rate": 3.79059914472236e-05, "loss": 1.1337841033935547, "num_input_tokens_seen": 2103424704, "step": 7400, "train_runtime": 72072.3082, "train_tokens_per_second": 29184.922 }, { "epoch": 0.2621808154230253, "grad_norm": 1.4375, "learning_rate": 3.7895102988248716e-05, "loss": 1.1247122764587403, "num_input_tokens_seen": 2106209600, "step": 7410, "train_runtime": 72163.0665, "train_tokens_per_second": 29186.808 }, { "epoch": 0.26253463568675406, "grad_norm": 1.390625, "learning_rate": 3.7884223906984064e-05, "loss": 1.1288507461547852, "num_input_tokens_seen": 2109084864, "step": 7420, "train_runtime": 72264.5412, "train_tokens_per_second": 29185.612 }, { "epoch": 0.2628884559504829, "grad_norm": 1.3828125, "learning_rate": 3.787335418997641e-05, "loss": 1.1154647827148438, "num_input_tokens_seen": 2111953856, "step": 7430, "train_runtime": 72362.7297, "train_tokens_per_second": 29185.658 }, { "epoch": 0.26324227621421165, "grad_norm": 1.421875, "learning_rate": 3.786249382379952e-05, "loss": 1.1302781105041504, "num_input_tokens_seen": 2114753408, "step": 7440, "train_runtime": 72457.3642, "train_tokens_per_second": 29186.176 }, { "epoch": 0.2635960964779404, "grad_norm": 1.390625, "learning_rate": 3.785164279505411e-05, "loss": 1.1366804122924805, "num_input_tokens_seen": 2117616384, "step": 7450, "train_runtime": 72556.924, "train_tokens_per_second": 29185.587 }, { "epoch": 0.2639499167416692, "grad_norm": 1.484375, "learning_rate": 3.7840801090367744e-05, "loss": 1.137161922454834, "num_input_tokens_seen": 2120492864, "step": 7460, "train_runtime": 72657.0111, "train_tokens_per_second": 29184.972 }, { "epoch": 0.26430373700539794, "grad_norm": 1.4375, "learning_rate": 3.782996869639479e-05, "loss": 1.128640365600586, "num_input_tokens_seen": 2123302848, "step": 7470, "train_runtime": 72752.7919, "train_tokens_per_second": 29185.173 }, { "epoch": 0.26465755726912676, "grad_norm": 1.40625, "learning_rate": 3.7819145599816354e-05, "loss": 1.1331095695495605, "num_input_tokens_seen": 2126127488, "step": 7480, "train_runtime": 72846.8763, "train_tokens_per_second": 29186.255 }, { "epoch": 0.26501137753285553, "grad_norm": 1.421875, "learning_rate": 3.780833178734018e-05, "loss": 1.1541515350341798, "num_input_tokens_seen": 2129004864, "step": 7490, "train_runtime": 72946.5989, "train_tokens_per_second": 29185.8 }, { "epoch": 0.2653651977965843, "grad_norm": 1.4296875, "learning_rate": 3.77975272457006e-05, "loss": 1.1398646354675293, "num_input_tokens_seen": 2131798656, "step": 7500, "train_runtime": 73040.8284, "train_tokens_per_second": 29186.398 }, { "epoch": 0.26571901806031306, "grad_norm": 1.421875, "learning_rate": 3.778673196165851e-05, "loss": 1.1274892807006835, "num_input_tokens_seen": 2134637504, "step": 7510, "train_runtime": 73138.4172, "train_tokens_per_second": 29186.269 }, { "epoch": 0.2660728383240419, "grad_norm": 1.453125, "learning_rate": 3.7775945922001186e-05, "loss": 1.1374027252197265, "num_input_tokens_seen": 2137523456, "step": 7520, "train_runtime": 73238.0, "train_tokens_per_second": 29185.989 }, { "epoch": 0.26642665858777065, "grad_norm": 1.5234375, "learning_rate": 3.776516911354236e-05, "loss": 1.150265884399414, "num_input_tokens_seen": 2140406464, "step": 7530, "train_runtime": 73333.4629, "train_tokens_per_second": 29187.309 }, { "epoch": 0.2667804788514994, "grad_norm": 1.546875, "learning_rate": 3.775440152312205e-05, "loss": 1.1447628021240235, "num_input_tokens_seen": 2143232512, "step": 7540, "train_runtime": 73428.9879, "train_tokens_per_second": 29187.826 }, { "epoch": 0.2671342991152282, "grad_norm": 1.40625, "learning_rate": 3.774364313760652e-05, "loss": 1.1404863357543946, "num_input_tokens_seen": 2146056960, "step": 7550, "train_runtime": 73524.301, "train_tokens_per_second": 29188.403 }, { "epoch": 0.267488119378957, "grad_norm": 1.4375, "learning_rate": 3.7732893943888224e-05, "loss": 1.1331168174743653, "num_input_tokens_seen": 2148890048, "step": 7560, "train_runtime": 73619.8908, "train_tokens_per_second": 29188.987 }, { "epoch": 0.26784193964268577, "grad_norm": 1.3984375, "learning_rate": 3.772215392888574e-05, "loss": 1.1341447830200195, "num_input_tokens_seen": 2151736000, "step": 7570, "train_runtime": 73715.682, "train_tokens_per_second": 29189.664 }, { "epoch": 0.26819575990641453, "grad_norm": 1.3828125, "learning_rate": 3.771142307954368e-05, "loss": 1.122310733795166, "num_input_tokens_seen": 2154576640, "step": 7580, "train_runtime": 73811.3508, "train_tokens_per_second": 29190.316 }, { "epoch": 0.2685495801701433, "grad_norm": 1.375, "learning_rate": 3.770070138283264e-05, "loss": 1.1399478912353516, "num_input_tokens_seen": 2157471680, "step": 7590, "train_runtime": 73909.106, "train_tokens_per_second": 29190.878 }, { "epoch": 0.2689034004338721, "grad_norm": 1.3828125, "learning_rate": 3.768998882574915e-05, "loss": 1.135573387145996, "num_input_tokens_seen": 2160348288, "step": 7600, "train_runtime": 74011.7396, "train_tokens_per_second": 29189.265 }, { "epoch": 0.2692572206976009, "grad_norm": 1.359375, "learning_rate": 3.767928539531557e-05, "loss": 1.137821578979492, "num_input_tokens_seen": 2163158784, "step": 7610, "train_runtime": 74106.9851, "train_tokens_per_second": 29189.675 }, { "epoch": 0.26961104096132965, "grad_norm": 1.4140625, "learning_rate": 3.7668591078580055e-05, "loss": 1.1332132339477539, "num_input_tokens_seen": 2166053632, "step": 7620, "train_runtime": 74210.6799, "train_tokens_per_second": 29187.896 }, { "epoch": 0.2699648612250584, "grad_norm": 1.4296875, "learning_rate": 3.765790586261647e-05, "loss": 1.1222350120544433, "num_input_tokens_seen": 2168858112, "step": 7630, "train_runtime": 74306.6377, "train_tokens_per_second": 29187.946 }, { "epoch": 0.27031868148878724, "grad_norm": 1.40625, "learning_rate": 3.7647229734524326e-05, "loss": 1.1288958549499513, "num_input_tokens_seen": 2171655104, "step": 7640, "train_runtime": 74400.0034, "train_tokens_per_second": 29188.911 }, { "epoch": 0.270672501752516, "grad_norm": 1.3359375, "learning_rate": 3.7636562681428744e-05, "loss": 1.1227753639221192, "num_input_tokens_seen": 2174459328, "step": 7650, "train_runtime": 74493.1176, "train_tokens_per_second": 29190.07 }, { "epoch": 0.27102632201624477, "grad_norm": 1.3515625, "learning_rate": 3.7625904690480346e-05, "loss": 1.1272872924804687, "num_input_tokens_seen": 2177253312, "step": 7660, "train_runtime": 74587.6873, "train_tokens_per_second": 29190.519 }, { "epoch": 0.27138014227997354, "grad_norm": 1.359375, "learning_rate": 3.7615255748855224e-05, "loss": 1.1400781631469727, "num_input_tokens_seen": 2180137280, "step": 7670, "train_runtime": 74686.7472, "train_tokens_per_second": 29190.417 }, { "epoch": 0.27173396254370236, "grad_norm": 1.4296875, "learning_rate": 3.7604615843754845e-05, "loss": 1.128744888305664, "num_input_tokens_seen": 2182987840, "step": 7680, "train_runtime": 74785.0198, "train_tokens_per_second": 29190.175 }, { "epoch": 0.2720877828074311, "grad_norm": 1.4296875, "learning_rate": 3.759398496240601e-05, "loss": 1.1261759757995606, "num_input_tokens_seen": 2185845312, "step": 7690, "train_runtime": 74881.1922, "train_tokens_per_second": 29190.845 }, { "epoch": 0.2724416030711599, "grad_norm": 1.3828125, "learning_rate": 3.7583363092060815e-05, "loss": 1.1218698501586915, "num_input_tokens_seen": 2188683776, "step": 7700, "train_runtime": 74978.9417, "train_tokens_per_second": 29190.646 }, { "epoch": 0.27279542333488865, "grad_norm": 1.46875, "learning_rate": 3.757275021999649e-05, "loss": 1.1364570617675782, "num_input_tokens_seen": 2191521152, "step": 7710, "train_runtime": 75077.8458, "train_tokens_per_second": 29189.984 }, { "epoch": 0.2731492435986175, "grad_norm": 1.3984375, "learning_rate": 3.7562146333515445e-05, "loss": 1.127101230621338, "num_input_tokens_seen": 2194422656, "step": 7720, "train_runtime": 75175.1254, "train_tokens_per_second": 29190.808 }, { "epoch": 0.27350306386234624, "grad_norm": 1.3359375, "learning_rate": 3.7551551419945167e-05, "loss": 1.1238965034484862, "num_input_tokens_seen": 2197244288, "step": 7730, "train_runtime": 75271.2025, "train_tokens_per_second": 29191.035 }, { "epoch": 0.273856884126075, "grad_norm": 1.4609375, "learning_rate": 3.7540965466638104e-05, "loss": 1.129817295074463, "num_input_tokens_seen": 2200139968, "step": 7740, "train_runtime": 75371.095, "train_tokens_per_second": 29190.766 }, { "epoch": 0.27421070438980377, "grad_norm": 1.4140625, "learning_rate": 3.753038846097172e-05, "loss": 1.1170234680175781, "num_input_tokens_seen": 2203025792, "step": 7750, "train_runtime": 75469.9287, "train_tokens_per_second": 29190.776 }, { "epoch": 0.27456452465353254, "grad_norm": 1.375, "learning_rate": 3.751982039034827e-05, "loss": 1.1340647697448731, "num_input_tokens_seen": 2205819776, "step": 7760, "train_runtime": 75564.5006, "train_tokens_per_second": 29191.218 }, { "epoch": 0.27491834491726136, "grad_norm": 1.390625, "learning_rate": 3.75092612421949e-05, "loss": 1.1377099990844726, "num_input_tokens_seen": 2208704192, "step": 7770, "train_runtime": 75663.8369, "train_tokens_per_second": 29191.015 }, { "epoch": 0.2752721651809901, "grad_norm": 1.484375, "learning_rate": 3.7498711003963475e-05, "loss": 1.142449188232422, "num_input_tokens_seen": 2211600192, "step": 7780, "train_runtime": 75765.5144, "train_tokens_per_second": 29190.064 }, { "epoch": 0.2756259854447189, "grad_norm": 1.4296875, "learning_rate": 3.748816966313058e-05, "loss": 1.1300529479980468, "num_input_tokens_seen": 2214473088, "step": 7790, "train_runtime": 75865.4483, "train_tokens_per_second": 29189.481 }, { "epoch": 0.27597980570844766, "grad_norm": 1.3984375, "learning_rate": 3.7477637207197374e-05, "loss": 1.1275361061096192, "num_input_tokens_seen": 2217345664, "step": 7800, "train_runtime": 75967.8682, "train_tokens_per_second": 29187.941 }, { "epoch": 0.2763336259721765, "grad_norm": 1.40625, "learning_rate": 3.7467113623689666e-05, "loss": 1.1317346572875977, "num_input_tokens_seen": 2220153792, "step": 7810, "train_runtime": 76062.9826, "train_tokens_per_second": 29188.361 }, { "epoch": 0.27668744623590524, "grad_norm": 1.3671875, "learning_rate": 3.745659890015768e-05, "loss": 1.1346624374389649, "num_input_tokens_seen": 2222968896, "step": 7820, "train_runtime": 76159.5033, "train_tokens_per_second": 29188.332 }, { "epoch": 0.277041266499634, "grad_norm": 1.4140625, "learning_rate": 3.744609302417615e-05, "loss": 1.1355717658996582, "num_input_tokens_seen": 2225786688, "step": 7830, "train_runtime": 76257.4497, "train_tokens_per_second": 29187.793 }, { "epoch": 0.2773950867633628, "grad_norm": 1.390625, "learning_rate": 3.7435595983344175e-05, "loss": 1.1183170318603515, "num_input_tokens_seen": 2228604288, "step": 7840, "train_runtime": 76355.7866, "train_tokens_per_second": 29187.104 }, { "epoch": 0.2777489070270916, "grad_norm": 1.453125, "learning_rate": 3.7425107765285155e-05, "loss": 1.1182866096496582, "num_input_tokens_seen": 2231460224, "step": 7850, "train_runtime": 76453.1884, "train_tokens_per_second": 29187.275 }, { "epoch": 0.27810272729082036, "grad_norm": 1.375, "learning_rate": 3.741462835764676e-05, "loss": 1.1316190719604493, "num_input_tokens_seen": 2234335488, "step": 7860, "train_runtime": 76551.7972, "train_tokens_per_second": 29187.238 }, { "epoch": 0.2784565475545491, "grad_norm": 1.4296875, "learning_rate": 3.740415774810088e-05, "loss": 1.143202018737793, "num_input_tokens_seen": 2237156352, "step": 7870, "train_runtime": 76646.3965, "train_tokens_per_second": 29188.017 }, { "epoch": 0.2788103678182779, "grad_norm": 1.4765625, "learning_rate": 3.739369592434351e-05, "loss": 1.1331881523132323, "num_input_tokens_seen": 2239989440, "step": 7880, "train_runtime": 76741.487, "train_tokens_per_second": 29188.768 }, { "epoch": 0.2791641880820067, "grad_norm": 1.40625, "learning_rate": 3.738324287409473e-05, "loss": 1.135151481628418, "num_input_tokens_seen": 2242795072, "step": 7890, "train_runtime": 76837.6395, "train_tokens_per_second": 29188.755 }, { "epoch": 0.2795180083457355, "grad_norm": 1.3828125, "learning_rate": 3.7372798585098644e-05, "loss": 1.1281002044677735, "num_input_tokens_seen": 2245659968, "step": 7900, "train_runtime": 76935.0665, "train_tokens_per_second": 29189.03 }, { "epoch": 0.27987182860946425, "grad_norm": 1.3984375, "learning_rate": 3.736236304512331e-05, "loss": 1.1266074180603027, "num_input_tokens_seen": 2248550016, "step": 7910, "train_runtime": 77034.3417, "train_tokens_per_second": 29188.93 }, { "epoch": 0.280225648873193, "grad_norm": 1.421875, "learning_rate": 3.735193624196067e-05, "loss": 1.1398014068603515, "num_input_tokens_seen": 2251377408, "step": 7920, "train_runtime": 77133.2243, "train_tokens_per_second": 29188.167 }, { "epoch": 0.28057946913692183, "grad_norm": 1.4140625, "learning_rate": 3.7341518163426514e-05, "loss": 1.1338825225830078, "num_input_tokens_seen": 2254267840, "step": 7930, "train_runtime": 77234.1905, "train_tokens_per_second": 29187.434 }, { "epoch": 0.2809332894006506, "grad_norm": 1.4296875, "learning_rate": 3.73311087973604e-05, "loss": 1.1300137519836426, "num_input_tokens_seen": 2257108288, "step": 7940, "train_runtime": 77331.5107, "train_tokens_per_second": 29187.433 }, { "epoch": 0.28128710966437936, "grad_norm": 1.375, "learning_rate": 3.732070813162561e-05, "loss": 1.132537841796875, "num_input_tokens_seen": 2259932288, "step": 7950, "train_runtime": 77427.511, "train_tokens_per_second": 29187.717 }, { "epoch": 0.28164092992810813, "grad_norm": 1.4453125, "learning_rate": 3.731031615410908e-05, "loss": 1.1268039703369142, "num_input_tokens_seen": 2262767296, "step": 7960, "train_runtime": 77526.9336, "train_tokens_per_second": 29186.854 }, { "epoch": 0.28199475019183695, "grad_norm": 1.421875, "learning_rate": 3.729993285272132e-05, "loss": 1.1363138198852538, "num_input_tokens_seen": 2265615168, "step": 7970, "train_runtime": 77620.9465, "train_tokens_per_second": 29188.193 }, { "epoch": 0.2823485704555657, "grad_norm": 1.4140625, "learning_rate": 3.7289558215396414e-05, "loss": 1.1310443878173828, "num_input_tokens_seen": 2268486528, "step": 7980, "train_runtime": 77721.9026, "train_tokens_per_second": 29187.223 }, { "epoch": 0.2827023907192945, "grad_norm": 1.46875, "learning_rate": 3.727919223009191e-05, "loss": 1.1291948318481446, "num_input_tokens_seen": 2271343488, "step": 7990, "train_runtime": 77819.2925, "train_tokens_per_second": 29187.409 }, { "epoch": 0.28305621098302325, "grad_norm": 1.4296875, "learning_rate": 3.726883488478877e-05, "loss": 1.1411422729492187, "num_input_tokens_seen": 2274239872, "step": 8000, "train_runtime": 77921.9153, "train_tokens_per_second": 29186.139 }, { "epoch": 0.283410031246752, "grad_norm": 1.546875, "learning_rate": 3.7258486167491323e-05, "loss": 1.1403490066528321, "num_input_tokens_seen": 2277056192, "step": 8010, "train_runtime": 78020.0687, "train_tokens_per_second": 29185.519 }, { "epoch": 0.28376385151048084, "grad_norm": 1.390625, "learning_rate": 3.724814606622721e-05, "loss": 1.124257469177246, "num_input_tokens_seen": 2279883712, "step": 8020, "train_runtime": 78116.5981, "train_tokens_per_second": 29185.65 }, { "epoch": 0.2841176717742096, "grad_norm": 1.46875, "learning_rate": 3.7237814569047294e-05, "loss": 1.1326744079589843, "num_input_tokens_seen": 2282755712, "step": 8030, "train_runtime": 78216.2185, "train_tokens_per_second": 29185.197 }, { "epoch": 0.28447149203793837, "grad_norm": 1.375, "learning_rate": 3.7227491664025656e-05, "loss": 1.13114013671875, "num_input_tokens_seen": 2285597504, "step": 8040, "train_runtime": 78313.1538, "train_tokens_per_second": 29185.359 }, { "epoch": 0.28482531230166713, "grad_norm": 1.4296875, "learning_rate": 3.721717733925948e-05, "loss": 1.1304126739501954, "num_input_tokens_seen": 2288411904, "step": 8050, "train_runtime": 78408.591, "train_tokens_per_second": 29185.729 }, { "epoch": 0.28517913256539595, "grad_norm": 1.453125, "learning_rate": 3.720687158286904e-05, "loss": 1.1453889846801757, "num_input_tokens_seen": 2291227200, "step": 8060, "train_runtime": 78506.5534, "train_tokens_per_second": 29185.171 }, { "epoch": 0.2855329528291247, "grad_norm": 1.3828125, "learning_rate": 3.719657438299762e-05, "loss": 1.1260215759277343, "num_input_tokens_seen": 2294135296, "step": 8070, "train_runtime": 78607.6359, "train_tokens_per_second": 29184.637 }, { "epoch": 0.2858867730928535, "grad_norm": 1.4140625, "learning_rate": 3.7186285727811446e-05, "loss": 1.1442317962646484, "num_input_tokens_seen": 2296980672, "step": 8080, "train_runtime": 78703.2757, "train_tokens_per_second": 29185.325 }, { "epoch": 0.28624059335658225, "grad_norm": 1.390625, "learning_rate": 3.717600560549967e-05, "loss": 1.1200284957885742, "num_input_tokens_seen": 2299847616, "step": 8090, "train_runtime": 78802.5776, "train_tokens_per_second": 29184.929 }, { "epoch": 0.2865944136203111, "grad_norm": 1.40625, "learning_rate": 3.716573400427426e-05, "loss": 1.131354522705078, "num_input_tokens_seen": 2302721024, "step": 8100, "train_runtime": 78900.441, "train_tokens_per_second": 29185.148 }, { "epoch": 0.28694823388403984, "grad_norm": 1.4453125, "learning_rate": 3.7155470912370004e-05, "loss": 1.128091049194336, "num_input_tokens_seen": 2305532864, "step": 8110, "train_runtime": 78995.9616, "train_tokens_per_second": 29185.452 }, { "epoch": 0.2873020541477686, "grad_norm": 1.4296875, "learning_rate": 3.714521631804439e-05, "loss": 1.1166316986083984, "num_input_tokens_seen": 2308429184, "step": 8120, "train_runtime": 79097.6061, "train_tokens_per_second": 29184.564 }, { "epoch": 0.28765587441149737, "grad_norm": 1.3984375, "learning_rate": 3.713497020957759e-05, "loss": 1.1284744262695312, "num_input_tokens_seen": 2311290368, "step": 8130, "train_runtime": 79195.5682, "train_tokens_per_second": 29184.592 }, { "epoch": 0.2880096946752262, "grad_norm": 1.375, "learning_rate": 3.712473257527238e-05, "loss": 1.1257888793945312, "num_input_tokens_seen": 2314154880, "step": 8140, "train_runtime": 79292.6667, "train_tokens_per_second": 29184.98 }, { "epoch": 0.28836351493895496, "grad_norm": 1.4453125, "learning_rate": 3.711450340345412e-05, "loss": 1.1286203384399414, "num_input_tokens_seen": 2316930176, "step": 8150, "train_runtime": 79385.9411, "train_tokens_per_second": 29185.649 }, { "epoch": 0.2887173352026837, "grad_norm": 1.40625, "learning_rate": 3.710428268247067e-05, "loss": 1.1332658767700194, "num_input_tokens_seen": 2319758464, "step": 8160, "train_runtime": 79481.6487, "train_tokens_per_second": 29186.089 }, { "epoch": 0.2890711554664125, "grad_norm": 1.390625, "learning_rate": 3.709407040069233e-05, "loss": 1.1342099189758301, "num_input_tokens_seen": 2322607680, "step": 8170, "train_runtime": 79576.7605, "train_tokens_per_second": 29187.01 }, { "epoch": 0.2894249757301413, "grad_norm": 1.3984375, "learning_rate": 3.708386654651179e-05, "loss": 1.1288168907165528, "num_input_tokens_seen": 2325455936, "step": 8180, "train_runtime": 79672.4626, "train_tokens_per_second": 29187.7 }, { "epoch": 0.2897787959938701, "grad_norm": 1.421875, "learning_rate": 3.707367110834409e-05, "loss": 1.1234468460083007, "num_input_tokens_seen": 2328385344, "step": 8190, "train_runtime": 79773.0415, "train_tokens_per_second": 29187.622 }, { "epoch": 0.29013261625759884, "grad_norm": 1.40625, "learning_rate": 3.7063484074626555e-05, "loss": 1.122950553894043, "num_input_tokens_seen": 2331216704, "step": 8200, "train_runtime": 79869.2063, "train_tokens_per_second": 29187.929 }, { "epoch": 0.2904864365213276, "grad_norm": 1.40625, "learning_rate": 3.7053305433818725e-05, "loss": 1.1147238731384277, "num_input_tokens_seen": 2334031296, "step": 8210, "train_runtime": 79964.6388, "train_tokens_per_second": 29188.293 }, { "epoch": 0.29084025678505643, "grad_norm": 1.40625, "learning_rate": 3.704313517440232e-05, "loss": 1.1350948333740234, "num_input_tokens_seen": 2336879680, "step": 8220, "train_runtime": 80061.6959, "train_tokens_per_second": 29188.486 }, { "epoch": 0.2911940770487852, "grad_norm": 1.421875, "learning_rate": 3.703297328488118e-05, "loss": 1.1406403541564942, "num_input_tokens_seen": 2339704960, "step": 8230, "train_runtime": 80156.6228, "train_tokens_per_second": 29189.166 }, { "epoch": 0.29154789731251396, "grad_norm": 1.421875, "learning_rate": 3.70228197537812e-05, "loss": 1.1303775787353516, "num_input_tokens_seen": 2342555712, "step": 8240, "train_runtime": 80254.772, "train_tokens_per_second": 29188.99 }, { "epoch": 0.2919017175762427, "grad_norm": 1.4609375, "learning_rate": 3.7012674569650305e-05, "loss": 1.123440933227539, "num_input_tokens_seen": 2345399232, "step": 8250, "train_runtime": 80351.869, "train_tokens_per_second": 29189.106 }, { "epoch": 0.2922555378399715, "grad_norm": 1.4296875, "learning_rate": 3.700253772105835e-05, "loss": 1.1239120483398437, "num_input_tokens_seen": 2348243328, "step": 8260, "train_runtime": 80450.6535, "train_tokens_per_second": 29188.617 }, { "epoch": 0.2926093581037003, "grad_norm": 1.3671875, "learning_rate": 3.699240919659711e-05, "loss": 1.111411190032959, "num_input_tokens_seen": 2351143808, "step": 8270, "train_runtime": 80551.2972, "train_tokens_per_second": 29188.156 }, { "epoch": 0.2929631783674291, "grad_norm": 1.484375, "learning_rate": 3.698228898488019e-05, "loss": 1.1376068115234375, "num_input_tokens_seen": 2354002048, "step": 8280, "train_runtime": 80649.9049, "train_tokens_per_second": 29187.909 }, { "epoch": 0.29331699863115784, "grad_norm": 1.3671875, "learning_rate": 3.6972177074543e-05, "loss": 1.1308083534240723, "num_input_tokens_seen": 2356863744, "step": 8290, "train_runtime": 80746.9014, "train_tokens_per_second": 29188.287 }, { "epoch": 0.2936708188948866, "grad_norm": 1.3984375, "learning_rate": 3.69620734542427e-05, "loss": 1.1193157196044923, "num_input_tokens_seen": 2359627648, "step": 8300, "train_runtime": 80841.8287, "train_tokens_per_second": 29188.202 }, { "epoch": 0.29402463915861543, "grad_norm": 1.375, "learning_rate": 3.695197811265811e-05, "loss": 1.115550422668457, "num_input_tokens_seen": 2362501568, "step": 8310, "train_runtime": 80938.7533, "train_tokens_per_second": 29188.757 }, { "epoch": 0.2943784594223442, "grad_norm": 1.359375, "learning_rate": 3.6941891038489694e-05, "loss": 1.1178993225097655, "num_input_tokens_seen": 2365346752, "step": 8320, "train_runtime": 81036.7459, "train_tokens_per_second": 29188.57 }, { "epoch": 0.29473227968607296, "grad_norm": 1.453125, "learning_rate": 3.693181222045952e-05, "loss": 1.1281351089477538, "num_input_tokens_seen": 2368080704, "step": 8330, "train_runtime": 81126.6452, "train_tokens_per_second": 29189.925 }, { "epoch": 0.29508609994980173, "grad_norm": 1.3828125, "learning_rate": 3.692174164731113e-05, "loss": 1.117399024963379, "num_input_tokens_seen": 2370936576, "step": 8340, "train_runtime": 81225.4357, "train_tokens_per_second": 29189.583 }, { "epoch": 0.29543992021353055, "grad_norm": 1.3984375, "learning_rate": 3.6911679307809595e-05, "loss": 1.1253440856933594, "num_input_tokens_seen": 2373767424, "step": 8350, "train_runtime": 81321.9177, "train_tokens_per_second": 29189.762 }, { "epoch": 0.2957937404772593, "grad_norm": 1.3828125, "learning_rate": 3.690162519074137e-05, "loss": 1.1316165924072266, "num_input_tokens_seen": 2376621184, "step": 8360, "train_runtime": 81419.481, "train_tokens_per_second": 29189.835 }, { "epoch": 0.2961475607409881, "grad_norm": 1.328125, "learning_rate": 3.689157928491431e-05, "loss": 1.1369115829467773, "num_input_tokens_seen": 2379502336, "step": 8370, "train_runtime": 81520.8032, "train_tokens_per_second": 29188.897 }, { "epoch": 0.29650138100471685, "grad_norm": 1.40625, "learning_rate": 3.6881541579157566e-05, "loss": 1.1128883361816406, "num_input_tokens_seen": 2382356224, "step": 8380, "train_runtime": 81616.7019, "train_tokens_per_second": 29189.567 }, { "epoch": 0.29685520126844567, "grad_norm": 1.3359375, "learning_rate": 3.687151206232154e-05, "loss": 1.120544147491455, "num_input_tokens_seen": 2385200640, "step": 8390, "train_runtime": 81713.5745, "train_tokens_per_second": 29189.772 }, { "epoch": 0.29720902153217443, "grad_norm": 1.390625, "learning_rate": 3.686149072327788e-05, "loss": 1.1094697952270507, "num_input_tokens_seen": 2388069312, "step": 8400, "train_runtime": 81816.5612, "train_tokens_per_second": 29188.092 }, { "epoch": 0.2975628417959032, "grad_norm": 1.40625, "learning_rate": 3.685147755091937e-05, "loss": 1.1189895629882813, "num_input_tokens_seen": 2390887552, "step": 8410, "train_runtime": 81910.9535, "train_tokens_per_second": 29188.862 }, { "epoch": 0.29791666205963196, "grad_norm": 1.3828125, "learning_rate": 3.684147253415992e-05, "loss": 1.1353343963623046, "num_input_tokens_seen": 2393791232, "step": 8420, "train_runtime": 82011.9706, "train_tokens_per_second": 29188.315 }, { "epoch": 0.2982704823233608, "grad_norm": 1.46875, "learning_rate": 3.683147566193448e-05, "loss": 1.1186967849731446, "num_input_tokens_seen": 2396629440, "step": 8430, "train_runtime": 82109.6732, "train_tokens_per_second": 29188.15 }, { "epoch": 0.29862430258708955, "grad_norm": 1.3125, "learning_rate": 3.6821486923199025e-05, "loss": 1.1169426918029786, "num_input_tokens_seen": 2399512128, "step": 8440, "train_runtime": 82206.5495, "train_tokens_per_second": 29188.819 }, { "epoch": 0.2989781228508183, "grad_norm": 1.4140625, "learning_rate": 3.681150630693046e-05, "loss": 1.1447039604187013, "num_input_tokens_seen": 2402339072, "step": 8450, "train_runtime": 82301.8774, "train_tokens_per_second": 29189.359 }, { "epoch": 0.2993319431145471, "grad_norm": 1.3984375, "learning_rate": 3.6801533802126615e-05, "loss": 1.12135009765625, "num_input_tokens_seen": 2405264896, "step": 8460, "train_runtime": 82401.4541, "train_tokens_per_second": 29189.593 }, { "epoch": 0.2996857633782759, "grad_norm": 1.4921875, "learning_rate": 3.679156939780617e-05, "loss": 1.1173569679260253, "num_input_tokens_seen": 2408088704, "step": 8470, "train_runtime": 82497.6881, "train_tokens_per_second": 29189.772 }, { "epoch": 0.30003958364200467, "grad_norm": 1.3984375, "learning_rate": 3.6781613083008594e-05, "loss": 1.1180392265319825, "num_input_tokens_seen": 2410963584, "step": 8480, "train_runtime": 82597.6625, "train_tokens_per_second": 29189.247 }, { "epoch": 0.30039340390573344, "grad_norm": 1.5078125, "learning_rate": 3.677166484679412e-05, "loss": 1.114876651763916, "num_input_tokens_seen": 2413775104, "step": 8490, "train_runtime": 82696.8962, "train_tokens_per_second": 29188.219 }, { "epoch": 0.3007472241694622, "grad_norm": 1.390625, "learning_rate": 3.676172467824368e-05, "loss": 1.1401662826538086, "num_input_tokens_seen": 2416579520, "step": 8500, "train_runtime": 82792.1291, "train_tokens_per_second": 29188.518 }, { "epoch": 0.30110104443319097, "grad_norm": 1.40625, "learning_rate": 3.675179256645885e-05, "loss": 1.115629291534424, "num_input_tokens_seen": 2419437504, "step": 8510, "train_runtime": 82889.3571, "train_tokens_per_second": 29188.759 }, { "epoch": 0.3014548646969198, "grad_norm": 1.3984375, "learning_rate": 3.674186850056181e-05, "loss": 1.1329103469848634, "num_input_tokens_seen": 2422266048, "step": 8520, "train_runtime": 82986.0424, "train_tokens_per_second": 29188.837 }, { "epoch": 0.30180868496064855, "grad_norm": 1.4921875, "learning_rate": 3.67319524696953e-05, "loss": 1.1320242881774902, "num_input_tokens_seen": 2425138624, "step": 8530, "train_runtime": 83084.2092, "train_tokens_per_second": 29188.923 }, { "epoch": 0.3021625052243773, "grad_norm": 1.4453125, "learning_rate": 3.6722044463022536e-05, "loss": 1.136598777770996, "num_input_tokens_seen": 2427948672, "step": 8540, "train_runtime": 83180.1683, "train_tokens_per_second": 29189.033 }, { "epoch": 0.3025163254881061, "grad_norm": 1.46875, "learning_rate": 3.6712144469727214e-05, "loss": 1.150098705291748, "num_input_tokens_seen": 2430787840, "step": 8550, "train_runtime": 83276.9682, "train_tokens_per_second": 29189.197 }, { "epoch": 0.3028701457518349, "grad_norm": 1.484375, "learning_rate": 3.67022524790134e-05, "loss": 1.1031455993652344, "num_input_tokens_seen": 2433624896, "step": 8560, "train_runtime": 83375.0654, "train_tokens_per_second": 29188.881 }, { "epoch": 0.3032239660155637, "grad_norm": 1.4921875, "learning_rate": 3.6692368480105546e-05, "loss": 1.130989170074463, "num_input_tokens_seen": 2436540992, "step": 8570, "train_runtime": 83479.2561, "train_tokens_per_second": 29187.383 }, { "epoch": 0.30357778627929244, "grad_norm": 1.4296875, "learning_rate": 3.6682492462248374e-05, "loss": 1.1278568267822267, "num_input_tokens_seen": 2439352320, "step": 8580, "train_runtime": 83574.551, "train_tokens_per_second": 29187.741 }, { "epoch": 0.3039316065430212, "grad_norm": 1.5078125, "learning_rate": 3.667262441470689e-05, "loss": 1.1163878440856934, "num_input_tokens_seen": 2442149504, "step": 8590, "train_runtime": 83670.1516, "train_tokens_per_second": 29187.822 }, { "epoch": 0.30428542680675, "grad_norm": 1.4140625, "learning_rate": 3.6662764326766255e-05, "loss": 1.1244693756103517, "num_input_tokens_seen": 2445011904, "step": 8600, "train_runtime": 83766.4121, "train_tokens_per_second": 29188.452 }, { "epoch": 0.3046392470704788, "grad_norm": 1.453125, "learning_rate": 3.665291218773185e-05, "loss": 1.1290009498596192, "num_input_tokens_seen": 2447813440, "step": 8610, "train_runtime": 83862.9885, "train_tokens_per_second": 29188.245 }, { "epoch": 0.30499306733420756, "grad_norm": 1.5, "learning_rate": 3.664306798692912e-05, "loss": 1.1371442794799804, "num_input_tokens_seen": 2450714688, "step": 8620, "train_runtime": 83962.659, "train_tokens_per_second": 29188.15 }, { "epoch": 0.3053468875979363, "grad_norm": 1.421875, "learning_rate": 3.6633231713703576e-05, "loss": 1.121608352661133, "num_input_tokens_seen": 2453575680, "step": 8630, "train_runtime": 84057.6491, "train_tokens_per_second": 29189.202 }, { "epoch": 0.30570070786166514, "grad_norm": 1.3671875, "learning_rate": 3.6623403357420745e-05, "loss": 1.1213171005249023, "num_input_tokens_seen": 2456404864, "step": 8640, "train_runtime": 84154.0283, "train_tokens_per_second": 29189.391 }, { "epoch": 0.3060545281253939, "grad_norm": 1.4296875, "learning_rate": 3.661358290746611e-05, "loss": 1.1265426635742188, "num_input_tokens_seen": 2459235200, "step": 8650, "train_runtime": 84248.5045, "train_tokens_per_second": 29190.253 }, { "epoch": 0.3064083483891227, "grad_norm": 1.4375, "learning_rate": 3.6603770353245056e-05, "loss": 1.1187304496765136, "num_input_tokens_seen": 2462055168, "step": 8660, "train_runtime": 84344.5661, "train_tokens_per_second": 29190.442 }, { "epoch": 0.30676216865285144, "grad_norm": 1.4140625, "learning_rate": 3.659396568418286e-05, "loss": 1.1444374084472657, "num_input_tokens_seen": 2464862528, "step": 8670, "train_runtime": 84440.05, "train_tokens_per_second": 29190.681 }, { "epoch": 0.30711598891658026, "grad_norm": 1.3671875, "learning_rate": 3.658416888972459e-05, "loss": 1.1160392761230469, "num_input_tokens_seen": 2467719744, "step": 8680, "train_runtime": 84540.8057, "train_tokens_per_second": 29189.688 }, { "epoch": 0.30746980918030903, "grad_norm": 1.3671875, "learning_rate": 3.6574379959335106e-05, "loss": 1.1155062675476075, "num_input_tokens_seen": 2470527360, "step": 8690, "train_runtime": 84638.3805, "train_tokens_per_second": 29189.209 }, { "epoch": 0.3078236294440378, "grad_norm": 1.4609375, "learning_rate": 3.6564598882498976e-05, "loss": 1.1218263626098632, "num_input_tokens_seen": 2473384512, "step": 8700, "train_runtime": 84736.0005, "train_tokens_per_second": 29189.3 }, { "epoch": 0.30817744970776656, "grad_norm": 1.4375, "learning_rate": 3.655482564872043e-05, "loss": 1.1300183296203614, "num_input_tokens_seen": 2476265920, "step": 8710, "train_runtime": 84836.943, "train_tokens_per_second": 29188.533 }, { "epoch": 0.3085312699714954, "grad_norm": 1.4296875, "learning_rate": 3.654506024752336e-05, "loss": 1.1353984832763673, "num_input_tokens_seen": 2479082048, "step": 8720, "train_runtime": 84934.0182, "train_tokens_per_second": 29188.329 }, { "epoch": 0.30888509023522415, "grad_norm": 1.4140625, "learning_rate": 3.653530266845121e-05, "loss": 1.1258880615234375, "num_input_tokens_seen": 2481906176, "step": 8730, "train_runtime": 85032.9337, "train_tokens_per_second": 29187.587 }, { "epoch": 0.3092389104989529, "grad_norm": 1.3828125, "learning_rate": 3.652555290106696e-05, "loss": 1.1230047225952149, "num_input_tokens_seen": 2484805632, "step": 8740, "train_runtime": 85134.2736, "train_tokens_per_second": 29186.901 }, { "epoch": 0.3095927307626817, "grad_norm": 1.40625, "learning_rate": 3.6515810934953084e-05, "loss": 1.1328210830688477, "num_input_tokens_seen": 2487667264, "step": 8750, "train_runtime": 85233.1649, "train_tokens_per_second": 29186.611 }, { "epoch": 0.30994655102641044, "grad_norm": 1.390625, "learning_rate": 3.650607675971151e-05, "loss": 1.134385108947754, "num_input_tokens_seen": 2490510976, "step": 8760, "train_runtime": 85329.2609, "train_tokens_per_second": 29187.068 }, { "epoch": 0.31030037129013927, "grad_norm": 1.4609375, "learning_rate": 3.649635036496351e-05, "loss": 1.119410228729248, "num_input_tokens_seen": 2493334080, "step": 8770, "train_runtime": 85426.077, "train_tokens_per_second": 29187.037 }, { "epoch": 0.31065419155386803, "grad_norm": 1.40625, "learning_rate": 3.6486631740349746e-05, "loss": 1.12426700592041, "num_input_tokens_seen": 2496189760, "step": 8780, "train_runtime": 85524.5292, "train_tokens_per_second": 29186.828 }, { "epoch": 0.3110080118175968, "grad_norm": 1.3984375, "learning_rate": 3.647692087553018e-05, "loss": 1.1201671600341796, "num_input_tokens_seen": 2499008640, "step": 8790, "train_runtime": 85621.1868, "train_tokens_per_second": 29186.802 }, { "epoch": 0.31136183208132556, "grad_norm": 1.4296875, "learning_rate": 3.6467217760184005e-05, "loss": 1.1179556846618652, "num_input_tokens_seen": 2501886848, "step": 8800, "train_runtime": 85719.996, "train_tokens_per_second": 29186.735 }, { "epoch": 0.3117156523450544, "grad_norm": 1.390625, "learning_rate": 3.6457522384009625e-05, "loss": 1.1338930130004883, "num_input_tokens_seen": 2504794944, "step": 8810, "train_runtime": 85821.2233, "train_tokens_per_second": 29186.195 }, { "epoch": 0.31206947260878315, "grad_norm": 1.453125, "learning_rate": 3.644783473672462e-05, "loss": 1.1311001777648926, "num_input_tokens_seen": 2507562112, "step": 8820, "train_runtime": 85912.1665, "train_tokens_per_second": 29187.509 }, { "epoch": 0.3124232928725119, "grad_norm": 1.4609375, "learning_rate": 3.643815480806568e-05, "loss": 1.1240288734436035, "num_input_tokens_seen": 2510362944, "step": 8830, "train_runtime": 86007.2102, "train_tokens_per_second": 29187.82 }, { "epoch": 0.3127771131362407, "grad_norm": 1.4453125, "learning_rate": 3.6428482587788555e-05, "loss": 1.1163619995117187, "num_input_tokens_seen": 2513173952, "step": 8840, "train_runtime": 86103.1347, "train_tokens_per_second": 29187.95 }, { "epoch": 0.3131309333999695, "grad_norm": 1.3984375, "learning_rate": 3.641881806566803e-05, "loss": 1.1362246513366698, "num_input_tokens_seen": 2515977600, "step": 8850, "train_runtime": 86198.5096, "train_tokens_per_second": 29188.18 }, { "epoch": 0.31348475366369827, "grad_norm": 1.359375, "learning_rate": 3.640916123149788e-05, "loss": 1.1329086303710938, "num_input_tokens_seen": 2518817344, "step": 8860, "train_runtime": 86292.4068, "train_tokens_per_second": 29189.328 }, { "epoch": 0.31383857392742703, "grad_norm": 1.453125, "learning_rate": 3.639951207509079e-05, "loss": 1.129981231689453, "num_input_tokens_seen": 2521707904, "step": 8870, "train_runtime": 86390.7016, "train_tokens_per_second": 29189.575 }, { "epoch": 0.3141923941911558, "grad_norm": 1.4296875, "learning_rate": 3.6389870586278333e-05, "loss": 1.1341193199157715, "num_input_tokens_seen": 2524563456, "step": 8880, "train_runtime": 86491.7242, "train_tokens_per_second": 29188.497 }, { "epoch": 0.3145462144548846, "grad_norm": 1.3828125, "learning_rate": 3.6380236754910965e-05, "loss": 1.1225038528442384, "num_input_tokens_seen": 2527402176, "step": 8890, "train_runtime": 86589.1681, "train_tokens_per_second": 29188.434 }, { "epoch": 0.3149000347186134, "grad_norm": 1.46875, "learning_rate": 3.6370610570857897e-05, "loss": 1.1302080154418945, "num_input_tokens_seen": 2530241984, "step": 8900, "train_runtime": 86685.1822, "train_tokens_per_second": 29188.864 }, { "epoch": 0.31525385498234215, "grad_norm": 1.4609375, "learning_rate": 3.6360992024007114e-05, "loss": 1.12758150100708, "num_input_tokens_seen": 2533102720, "step": 8910, "train_runtime": 86782.279, "train_tokens_per_second": 29189.17 }, { "epoch": 0.3156076752460709, "grad_norm": 1.4296875, "learning_rate": 3.6351381104265304e-05, "loss": 1.1178728103637696, "num_input_tokens_seen": 2535987776, "step": 8920, "train_runtime": 86885.0562, "train_tokens_per_second": 29187.848 }, { "epoch": 0.31596149550979974, "grad_norm": 1.40625, "learning_rate": 3.634177780155783e-05, "loss": 1.122505283355713, "num_input_tokens_seen": 2538791680, "step": 8930, "train_runtime": 86980.0486, "train_tokens_per_second": 29188.207 }, { "epoch": 0.3163153157735285, "grad_norm": 1.421875, "learning_rate": 3.633218210582867e-05, "loss": 1.1400506019592285, "num_input_tokens_seen": 2541619776, "step": 8940, "train_runtime": 87074.3543, "train_tokens_per_second": 29189.074 }, { "epoch": 0.31666913603725727, "grad_norm": 1.421875, "learning_rate": 3.6322594007040376e-05, "loss": 1.122921085357666, "num_input_tokens_seen": 2544407552, "step": 8950, "train_runtime": 87166.7046, "train_tokens_per_second": 29190.131 }, { "epoch": 0.31702295630098604, "grad_norm": 1.390625, "learning_rate": 3.631301349517403e-05, "loss": 1.1329333305358886, "num_input_tokens_seen": 2547242816, "step": 8960, "train_runtime": 87263.6965, "train_tokens_per_second": 29190.178 }, { "epoch": 0.31737677656471486, "grad_norm": 1.46875, "learning_rate": 3.6303440560229216e-05, "loss": 1.1296253204345703, "num_input_tokens_seen": 2550115904, "step": 8970, "train_runtime": 87363.8625, "train_tokens_per_second": 29189.597 }, { "epoch": 0.3177305968284436, "grad_norm": 1.3828125, "learning_rate": 3.629387519222395e-05, "loss": 1.1210012435913086, "num_input_tokens_seen": 2552975104, "step": 8980, "train_runtime": 87462.7185, "train_tokens_per_second": 29189.295 }, { "epoch": 0.3180844170921724, "grad_norm": 1.3359375, "learning_rate": 3.628431738119464e-05, "loss": 1.1072532653808593, "num_input_tokens_seen": 2555840832, "step": 8990, "train_runtime": 87562.6784, "train_tokens_per_second": 29188.701 }, { "epoch": 0.31843823735590115, "grad_norm": 1.3984375, "learning_rate": 3.62747671171961e-05, "loss": 1.1240053176879883, "num_input_tokens_seen": 2558715456, "step": 9000, "train_runtime": 87662.0483, "train_tokens_per_second": 29188.406 }, { "epoch": 0.3187920576196299, "grad_norm": 1.34375, "learning_rate": 3.626522439030138e-05, "loss": 1.1330659866333008, "num_input_tokens_seen": 2561515072, "step": 9010, "train_runtime": 87757.2908, "train_tokens_per_second": 29188.63 }, { "epoch": 0.31914587788335874, "grad_norm": 1.4609375, "learning_rate": 3.6255689190601863e-05, "loss": 1.1192876815795898, "num_input_tokens_seen": 2564361216, "step": 9020, "train_runtime": 87856.4234, "train_tokens_per_second": 29188.09 }, { "epoch": 0.3194996981470875, "grad_norm": 1.3671875, "learning_rate": 3.624616150820714e-05, "loss": 1.1350156784057617, "num_input_tokens_seen": 2567278592, "step": 9030, "train_runtime": 87956.0313, "train_tokens_per_second": 29188.204 }, { "epoch": 0.3198535184108163, "grad_norm": 1.421875, "learning_rate": 3.623664133324499e-05, "loss": 1.0994648933410645, "num_input_tokens_seen": 2570106688, "step": 9040, "train_runtime": 88053.7493, "train_tokens_per_second": 29187.93 }, { "epoch": 0.32020733867454504, "grad_norm": 1.3828125, "learning_rate": 3.622712865586131e-05, "loss": 1.1128053665161133, "num_input_tokens_seen": 2572995136, "step": 9050, "train_runtime": 88156.7578, "train_tokens_per_second": 29186.59 }, { "epoch": 0.32056115893827386, "grad_norm": 1.3671875, "learning_rate": 3.621762346622014e-05, "loss": 1.1269713401794434, "num_input_tokens_seen": 2575895040, "step": 9060, "train_runtime": 88256.7919, "train_tokens_per_second": 29186.366 }, { "epoch": 0.3209149792020026, "grad_norm": 1.421875, "learning_rate": 3.620812575450352e-05, "loss": 1.120786476135254, "num_input_tokens_seen": 2578794624, "step": 9070, "train_runtime": 88353.8809, "train_tokens_per_second": 29187.112 }, { "epoch": 0.3212687994657314, "grad_norm": 1.4140625, "learning_rate": 3.6198635510911556e-05, "loss": 1.1182626724243163, "num_input_tokens_seen": 2581654976, "step": 9080, "train_runtime": 88449.8693, "train_tokens_per_second": 29187.776 }, { "epoch": 0.32162261972946016, "grad_norm": 1.421875, "learning_rate": 3.618915272566228e-05, "loss": 1.100466251373291, "num_input_tokens_seen": 2584450176, "step": 9090, "train_runtime": 88541.801, "train_tokens_per_second": 29189.04 }, { "epoch": 0.321976439993189, "grad_norm": 1.3984375, "learning_rate": 3.6179677388991694e-05, "loss": 1.1356571197509766, "num_input_tokens_seen": 2587310016, "step": 9100, "train_runtime": 88639.0941, "train_tokens_per_second": 29189.265 }, { "epoch": 0.32233026025691774, "grad_norm": 1.4140625, "learning_rate": 3.617020949115366e-05, "loss": 1.1236122131347657, "num_input_tokens_seen": 2590123008, "step": 9110, "train_runtime": 88737.388, "train_tokens_per_second": 29188.632 }, { "epoch": 0.3226840805206465, "grad_norm": 1.3515625, "learning_rate": 3.6160749022419886e-05, "loss": 1.1182680130004883, "num_input_tokens_seen": 2592997760, "step": 9120, "train_runtime": 88835.5397, "train_tokens_per_second": 29188.743 }, { "epoch": 0.3230379007843753, "grad_norm": 1.4140625, "learning_rate": 3.6151295973079887e-05, "loss": 1.1226987838745117, "num_input_tokens_seen": 2595862784, "step": 9130, "train_runtime": 88934.7602, "train_tokens_per_second": 29188.394 }, { "epoch": 0.3233917210481041, "grad_norm": 1.4453125, "learning_rate": 3.6141850333440934e-05, "loss": 1.1207016944885253, "num_input_tokens_seen": 2598674112, "step": 9140, "train_runtime": 89028.5047, "train_tokens_per_second": 29189.237 }, { "epoch": 0.32374554131183286, "grad_norm": 1.4296875, "learning_rate": 3.613241209382803e-05, "loss": 1.1185750007629394, "num_input_tokens_seen": 2601500736, "step": 9150, "train_runtime": 89125.5605, "train_tokens_per_second": 29189.165 }, { "epoch": 0.32409936157556163, "grad_norm": 1.421875, "learning_rate": 3.6122981244583834e-05, "loss": 1.1150111198425292, "num_input_tokens_seen": 2604376704, "step": 9160, "train_runtime": 89225.5478, "train_tokens_per_second": 29188.688 }, { "epoch": 0.3244531818392904, "grad_norm": 1.4296875, "learning_rate": 3.6113557776068644e-05, "loss": 1.1338795661926269, "num_input_tokens_seen": 2607175040, "step": 9170, "train_runtime": 89320.727, "train_tokens_per_second": 29188.914 }, { "epoch": 0.3248070021030192, "grad_norm": 1.375, "learning_rate": 3.6104141678660386e-05, "loss": 1.1259471893310546, "num_input_tokens_seen": 2610071488, "step": 9180, "train_runtime": 89421.624, "train_tokens_per_second": 29188.37 }, { "epoch": 0.325160822366748, "grad_norm": 1.40625, "learning_rate": 3.6094732942754487e-05, "loss": 1.124881649017334, "num_input_tokens_seen": 2612900480, "step": 9190, "train_runtime": 89518.85, "train_tokens_per_second": 29188.271 }, { "epoch": 0.32551464263047675, "grad_norm": 1.4375, "learning_rate": 3.60853315587639e-05, "loss": 1.1124618530273438, "num_input_tokens_seen": 2615733952, "step": 9200, "train_runtime": 89615.4092, "train_tokens_per_second": 29188.44 }, { "epoch": 0.3258684628942055, "grad_norm": 1.34375, "learning_rate": 3.607593751711909e-05, "loss": 1.1181381225585938, "num_input_tokens_seen": 2618562688, "step": 9210, "train_runtime": 89712.4193, "train_tokens_per_second": 29188.408 }, { "epoch": 0.32622228315793433, "grad_norm": 1.3671875, "learning_rate": 3.60665508082679e-05, "loss": 1.1356059074401856, "num_input_tokens_seen": 2621396928, "step": 9220, "train_runtime": 89809.972, "train_tokens_per_second": 29188.261 }, { "epoch": 0.3265761034216631, "grad_norm": 1.4296875, "learning_rate": 3.6057171422675585e-05, "loss": 1.1214991569519044, "num_input_tokens_seen": 2624207232, "step": 9230, "train_runtime": 89902.9859, "train_tokens_per_second": 29189.322 }, { "epoch": 0.32692992368539187, "grad_norm": 1.40625, "learning_rate": 3.604779935082474e-05, "loss": 1.1198180198669434, "num_input_tokens_seen": 2627099328, "step": 9240, "train_runtime": 90003.0246, "train_tokens_per_second": 29189.012 }, { "epoch": 0.32728374394912063, "grad_norm": 1.4453125, "learning_rate": 3.603843458321526e-05, "loss": 1.1245351791381837, "num_input_tokens_seen": 2629939328, "step": 9250, "train_runtime": 90099.1411, "train_tokens_per_second": 29189.394 }, { "epoch": 0.32763756421284945, "grad_norm": 1.4921875, "learning_rate": 3.6029077110364355e-05, "loss": 1.1235692977905274, "num_input_tokens_seen": 2632770752, "step": 9260, "train_runtime": 90191.611, "train_tokens_per_second": 29190.861 }, { "epoch": 0.3279913844765782, "grad_norm": 1.4453125, "learning_rate": 3.60197269228064e-05, "loss": 1.1284940719604493, "num_input_tokens_seen": 2635556544, "step": 9270, "train_runtime": 90285.9312, "train_tokens_per_second": 29191.221 }, { "epoch": 0.328345204740307, "grad_norm": 1.3984375, "learning_rate": 3.601038401109299e-05, "loss": 1.120694351196289, "num_input_tokens_seen": 2638380544, "step": 9280, "train_runtime": 90380.0654, "train_tokens_per_second": 29192.063 }, { "epoch": 0.32869902500403575, "grad_norm": 1.4375, "learning_rate": 3.6001048365792846e-05, "loss": 1.1235492706298829, "num_input_tokens_seen": 2641256448, "step": 9290, "train_runtime": 90479.0775, "train_tokens_per_second": 29191.903 }, { "epoch": 0.3290528452677645, "grad_norm": 1.3671875, "learning_rate": 3.599171997749182e-05, "loss": 1.1138433456420898, "num_input_tokens_seen": 2644147904, "step": 9300, "train_runtime": 90578.304, "train_tokens_per_second": 29191.846 }, { "epoch": 0.32940666553149334, "grad_norm": 1.484375, "learning_rate": 3.598239883679281e-05, "loss": 1.1388039588928223, "num_input_tokens_seen": 2646989184, "step": 9310, "train_runtime": 90676.41, "train_tokens_per_second": 29191.597 }, { "epoch": 0.3297604857952221, "grad_norm": 1.4375, "learning_rate": 3.597308493431576e-05, "loss": 1.1168378829956054, "num_input_tokens_seen": 2649807872, "step": 9320, "train_runtime": 90772.6098, "train_tokens_per_second": 29191.712 }, { "epoch": 0.33011430605895087, "grad_norm": 1.4140625, "learning_rate": 3.596377826069758e-05, "loss": 1.1381750106811523, "num_input_tokens_seen": 2652620224, "step": 9330, "train_runtime": 90869.2288, "train_tokens_per_second": 29191.623 }, { "epoch": 0.33046812632267963, "grad_norm": 1.4375, "learning_rate": 3.5954478806592155e-05, "loss": 1.108255386352539, "num_input_tokens_seen": 2655494400, "step": 9340, "train_runtime": 90968.2157, "train_tokens_per_second": 29191.453 }, { "epoch": 0.33082194658640846, "grad_norm": 1.40625, "learning_rate": 3.594518656267024e-05, "loss": 1.1222249031066895, "num_input_tokens_seen": 2658351552, "step": 9350, "train_runtime": 91066.7924, "train_tokens_per_second": 29191.229 }, { "epoch": 0.3311757668501372, "grad_norm": 1.4296875, "learning_rate": 3.5935901519619496e-05, "loss": 1.124747085571289, "num_input_tokens_seen": 2661200768, "step": 9360, "train_runtime": 91161.5182, "train_tokens_per_second": 29192.151 }, { "epoch": 0.331529587113866, "grad_norm": 1.359375, "learning_rate": 3.5926623668144385e-05, "loss": 1.112786102294922, "num_input_tokens_seen": 2664068544, "step": 9370, "train_runtime": 91260.3555, "train_tokens_per_second": 29191.959 }, { "epoch": 0.33188340737759475, "grad_norm": 1.375, "learning_rate": 3.5917352998966194e-05, "loss": 1.1267093658447265, "num_input_tokens_seen": 2666974464, "step": 9380, "train_runtime": 91362.8286, "train_tokens_per_second": 29191.023 }, { "epoch": 0.3322372276413236, "grad_norm": 1.4453125, "learning_rate": 3.5908089502822914e-05, "loss": 1.1222867965698242, "num_input_tokens_seen": 2669785344, "step": 9390, "train_runtime": 91459.8959, "train_tokens_per_second": 29190.776 }, { "epoch": 0.33259104790505234, "grad_norm": 1.421875, "learning_rate": 3.589883317046929e-05, "loss": 1.1301656723022462, "num_input_tokens_seen": 2672659712, "step": 9400, "train_runtime": 91559.0917, "train_tokens_per_second": 29190.544 }, { "epoch": 0.3329448681687811, "grad_norm": 1.46875, "learning_rate": 3.5889583992676715e-05, "loss": 1.1311653137207032, "num_input_tokens_seen": 2675633856, "step": 9410, "train_runtime": 91667.8424, "train_tokens_per_second": 29188.359 }, { "epoch": 0.33329868843250987, "grad_norm": 1.4609375, "learning_rate": 3.5880341960233244e-05, "loss": 1.1145493507385253, "num_input_tokens_seen": 2678472576, "step": 9420, "train_runtime": 91764.2578, "train_tokens_per_second": 29188.626 }, { "epoch": 0.3336525086962387, "grad_norm": 1.4609375, "learning_rate": 3.58711070639435e-05, "loss": 1.1212147712707519, "num_input_tokens_seen": 2681330496, "step": 9430, "train_runtime": 91863.4098, "train_tokens_per_second": 29188.232 }, { "epoch": 0.33400632895996746, "grad_norm": 1.4140625, "learning_rate": 3.586187929462869e-05, "loss": 1.1153898239135742, "num_input_tokens_seen": 2684185664, "step": 9440, "train_runtime": 91960.56, "train_tokens_per_second": 29188.444 }, { "epoch": 0.3343601492236962, "grad_norm": 1.484375, "learning_rate": 3.585265864312651e-05, "loss": 1.1192108154296876, "num_input_tokens_seen": 2687038656, "step": 9450, "train_runtime": 92059.6866, "train_tokens_per_second": 29188.006 }, { "epoch": 0.334713969487425, "grad_norm": 1.40625, "learning_rate": 3.584344510029118e-05, "loss": 1.1284709930419923, "num_input_tokens_seen": 2689887424, "step": 9460, "train_runtime": 92162.6313, "train_tokens_per_second": 29186.313 }, { "epoch": 0.3350677897511538, "grad_norm": 1.4453125, "learning_rate": 3.583423865699333e-05, "loss": 1.1181785583496093, "num_input_tokens_seen": 2692676672, "step": 9470, "train_runtime": 92257.3222, "train_tokens_per_second": 29186.59 }, { "epoch": 0.3354216100148826, "grad_norm": 1.3828125, "learning_rate": 3.5825039304119994e-05, "loss": 1.1325632095336915, "num_input_tokens_seen": 2695477440, "step": 9480, "train_runtime": 92351.5195, "train_tokens_per_second": 29187.148 }, { "epoch": 0.33577543027861134, "grad_norm": 1.4375, "learning_rate": 3.581584703257461e-05, "loss": 1.1161925315856933, "num_input_tokens_seen": 2698277824, "step": 9490, "train_runtime": 92446.6004, "train_tokens_per_second": 29187.421 }, { "epoch": 0.3361292505423401, "grad_norm": 1.390625, "learning_rate": 3.580666183327689e-05, "loss": 1.116877555847168, "num_input_tokens_seen": 2701066624, "step": 9500, "train_runtime": 92542.0271, "train_tokens_per_second": 29187.459 }, { "epoch": 0.33648307080606893, "grad_norm": 1.40625, "learning_rate": 3.5797483697162906e-05, "loss": 1.1289949417114258, "num_input_tokens_seen": 2703923072, "step": 9510, "train_runtime": 92640.5825, "train_tokens_per_second": 29187.242 }, { "epoch": 0.3368368910697977, "grad_norm": 1.4609375, "learning_rate": 3.5788312615184936e-05, "loss": 1.1240201950073243, "num_input_tokens_seen": 2706712320, "step": 9520, "train_runtime": 92733.6628, "train_tokens_per_second": 29188.023 }, { "epoch": 0.33719071133352646, "grad_norm": 1.4375, "learning_rate": 3.5779148578311476e-05, "loss": 1.1112796783447265, "num_input_tokens_seen": 2709565248, "step": 9530, "train_runtime": 92832.2292, "train_tokens_per_second": 29187.765 }, { "epoch": 0.3375445315972552, "grad_norm": 1.3984375, "learning_rate": 3.5769991577527236e-05, "loss": 1.1177736282348634, "num_input_tokens_seen": 2712431488, "step": 9540, "train_runtime": 92932.2426, "train_tokens_per_second": 29187.195 }, { "epoch": 0.337898351860984, "grad_norm": 1.3984375, "learning_rate": 3.5760841603833034e-05, "loss": 1.1261808395385742, "num_input_tokens_seen": 2715215744, "step": 9550, "train_runtime": 93026.3533, "train_tokens_per_second": 29187.597 }, { "epoch": 0.3382521721247128, "grad_norm": 1.4375, "learning_rate": 3.5751698648245814e-05, "loss": 1.1256035804748534, "num_input_tokens_seen": 2718075904, "step": 9560, "train_runtime": 93123.8424, "train_tokens_per_second": 29187.755 }, { "epoch": 0.3386059923884416, "grad_norm": 1.390625, "learning_rate": 3.574256270179857e-05, "loss": 1.1279800415039063, "num_input_tokens_seen": 2720922240, "step": 9570, "train_runtime": 93219.2374, "train_tokens_per_second": 29188.42 }, { "epoch": 0.33895981265217034, "grad_norm": 1.3984375, "learning_rate": 3.573343375554037e-05, "loss": 1.1151175498962402, "num_input_tokens_seen": 2723745536, "step": 9580, "train_runtime": 93316.8135, "train_tokens_per_second": 29188.154 }, { "epoch": 0.3393136329158991, "grad_norm": 1.34375, "learning_rate": 3.572431180053621e-05, "loss": 1.1193756103515624, "num_input_tokens_seen": 2726585024, "step": 9590, "train_runtime": 93412.8625, "train_tokens_per_second": 29188.539 }, { "epoch": 0.33966745317962793, "grad_norm": 1.4453125, "learning_rate": 3.571519682786711e-05, "loss": 1.1256680488586426, "num_input_tokens_seen": 2729407232, "step": 9600, "train_runtime": 93508.067, "train_tokens_per_second": 29189.003 }, { "epoch": 0.3400212734433567, "grad_norm": 1.40625, "learning_rate": 3.570608882862996e-05, "loss": 1.1174805641174317, "num_input_tokens_seen": 2732339136, "step": 9610, "train_runtime": 93610.8376, "train_tokens_per_second": 29188.278 }, { "epoch": 0.34037509370708546, "grad_norm": 1.4296875, "learning_rate": 3.569698779393757e-05, "loss": 1.118931198120117, "num_input_tokens_seen": 2735181952, "step": 9620, "train_runtime": 93707.8034, "train_tokens_per_second": 29188.412 }, { "epoch": 0.34072891397081423, "grad_norm": 1.484375, "learning_rate": 3.568789371491859e-05, "loss": 1.1140660285949706, "num_input_tokens_seen": 2738008576, "step": 9630, "train_runtime": 93802.7169, "train_tokens_per_second": 29189.011 }, { "epoch": 0.34108273423454305, "grad_norm": 1.40625, "learning_rate": 3.567880658271748e-05, "loss": 1.1254289627075196, "num_input_tokens_seen": 2740840448, "step": 9640, "train_runtime": 93900.1881, "train_tokens_per_second": 29188.871 }, { "epoch": 0.3414365544982718, "grad_norm": 1.4140625, "learning_rate": 3.566972638849445e-05, "loss": 1.1219924926757812, "num_input_tokens_seen": 2743672448, "step": 9650, "train_runtime": 93997.6323, "train_tokens_per_second": 29188.74 }, { "epoch": 0.3417903747620006, "grad_norm": 1.390625, "learning_rate": 3.566065312342551e-05, "loss": 1.1299943923950195, "num_input_tokens_seen": 2746535680, "step": 9660, "train_runtime": 94095.8508, "train_tokens_per_second": 29188.701 }, { "epoch": 0.34214419502572935, "grad_norm": 1.4609375, "learning_rate": 3.565158677870231e-05, "loss": 1.1233320236206055, "num_input_tokens_seen": 2749366528, "step": 9670, "train_runtime": 94192.1831, "train_tokens_per_second": 29188.903 }, { "epoch": 0.34249801528945817, "grad_norm": 1.4453125, "learning_rate": 3.564252734553221e-05, "loss": 1.1325451850891113, "num_input_tokens_seen": 2752208512, "step": 9680, "train_runtime": 94290.1794, "train_tokens_per_second": 29188.708 }, { "epoch": 0.34285183555318693, "grad_norm": 1.40625, "learning_rate": 3.563347481513818e-05, "loss": 1.1063970565795898, "num_input_tokens_seen": 2755070656, "step": 9690, "train_runtime": 94386.5634, "train_tokens_per_second": 29189.225 }, { "epoch": 0.3432056558169157, "grad_norm": 1.3515625, "learning_rate": 3.56244291787588e-05, "loss": 1.1268686294555663, "num_input_tokens_seen": 2757961664, "step": 9700, "train_runtime": 94487.0331, "train_tokens_per_second": 29188.785 }, { "epoch": 0.34355947608064447, "grad_norm": 1.4140625, "learning_rate": 3.5615390427648216e-05, "loss": 1.121345329284668, "num_input_tokens_seen": 2760823872, "step": 9710, "train_runtime": 94585.5189, "train_tokens_per_second": 29188.653 }, { "epoch": 0.3439132963443733, "grad_norm": 1.40625, "learning_rate": 3.5606358553076075e-05, "loss": 1.1318540573120117, "num_input_tokens_seen": 2763666752, "step": 9720, "train_runtime": 94682.2458, "train_tokens_per_second": 29188.859 }, { "epoch": 0.34426711660810205, "grad_norm": 1.4140625, "learning_rate": 3.5597333546327526e-05, "loss": 1.1212841033935548, "num_input_tokens_seen": 2766528320, "step": 9730, "train_runtime": 94780.4467, "train_tokens_per_second": 29188.809 }, { "epoch": 0.3446209368718308, "grad_norm": 1.40625, "learning_rate": 3.5588315398703186e-05, "loss": 1.1235257148742677, "num_input_tokens_seen": 2769368640, "step": 9740, "train_runtime": 94879.2997, "train_tokens_per_second": 29188.333 }, { "epoch": 0.3449747571355596, "grad_norm": 1.3984375, "learning_rate": 3.557930410151907e-05, "loss": 1.125667190551758, "num_input_tokens_seen": 2772225664, "step": 9750, "train_runtime": 94977.6614, "train_tokens_per_second": 29188.186 }, { "epoch": 0.3453285773992884, "grad_norm": 1.4453125, "learning_rate": 3.5570299646106606e-05, "loss": 1.126353931427002, "num_input_tokens_seen": 2775066944, "step": 9760, "train_runtime": 95074.0334, "train_tokens_per_second": 29188.484 }, { "epoch": 0.34568239766301717, "grad_norm": 1.4921875, "learning_rate": 3.556130202381253e-05, "loss": 1.1292800903320312, "num_input_tokens_seen": 2777946752, "step": 9770, "train_runtime": 95173.1995, "train_tokens_per_second": 29188.33 }, { "epoch": 0.34603621792674594, "grad_norm": 1.3984375, "learning_rate": 3.555231122599892e-05, "loss": 1.1255942344665528, "num_input_tokens_seen": 2780791680, "step": 9780, "train_runtime": 95271.4153, "train_tokens_per_second": 29188.101 }, { "epoch": 0.3463900381904747, "grad_norm": 1.421875, "learning_rate": 3.554332724404313e-05, "loss": 1.1063140869140624, "num_input_tokens_seen": 2783628736, "step": 9790, "train_runtime": 95365.7914, "train_tokens_per_second": 29188.965 }, { "epoch": 0.34674385845420347, "grad_norm": 1.4375, "learning_rate": 3.553435006933777e-05, "loss": 1.1084149360656739, "num_input_tokens_seen": 2786429696, "step": 9800, "train_runtime": 95458.7135, "train_tokens_per_second": 29189.894 }, { "epoch": 0.3470976787179323, "grad_norm": 1.4375, "learning_rate": 3.5525379693290626e-05, "loss": 1.1316360473632812, "num_input_tokens_seen": 2789282624, "step": 9810, "train_runtime": 95558.3865, "train_tokens_per_second": 29189.302 }, { "epoch": 0.34745149898166106, "grad_norm": 1.359375, "learning_rate": 3.551641610732469e-05, "loss": 1.1189855575561523, "num_input_tokens_seen": 2792052992, "step": 9820, "train_runtime": 95649.9851, "train_tokens_per_second": 29190.313 }, { "epoch": 0.3478053192453898, "grad_norm": 1.4296875, "learning_rate": 3.55074593028781e-05, "loss": 1.1084105491638183, "num_input_tokens_seen": 2794906496, "step": 9830, "train_runtime": 95748.6092, "train_tokens_per_second": 29190.048 }, { "epoch": 0.3481591395091186, "grad_norm": 1.375, "learning_rate": 3.5498509271404065e-05, "loss": 1.1247610092163085, "num_input_tokens_seen": 2797787136, "step": 9840, "train_runtime": 95847.4016, "train_tokens_per_second": 29190.015 }, { "epoch": 0.3485129597728474, "grad_norm": 1.5234375, "learning_rate": 3.5489566004370893e-05, "loss": 1.1253646850585937, "num_input_tokens_seen": 2800681280, "step": 9850, "train_runtime": 95948.7665, "train_tokens_per_second": 29189.341 }, { "epoch": 0.3488667800365762, "grad_norm": 1.4453125, "learning_rate": 3.548062949326194e-05, "loss": 1.1148176193237305, "num_input_tokens_seen": 2803524800, "step": 9860, "train_runtime": 96044.6662, "train_tokens_per_second": 29189.802 }, { "epoch": 0.34922060030030494, "grad_norm": 1.390625, "learning_rate": 3.547169972957554e-05, "loss": 1.1202608108520509, "num_input_tokens_seen": 2806324992, "step": 9870, "train_runtime": 96140.6759, "train_tokens_per_second": 29189.778 }, { "epoch": 0.3495744205640337, "grad_norm": 1.3984375, "learning_rate": 3.5462776704825e-05, "loss": 1.1176113128662108, "num_input_tokens_seen": 2809198208, "step": 9880, "train_runtime": 96238.0425, "train_tokens_per_second": 29190.101 }, { "epoch": 0.3499282408277625, "grad_norm": 1.4609375, "learning_rate": 3.5453860410538594e-05, "loss": 1.109024429321289, "num_input_tokens_seen": 2812001408, "step": 9890, "train_runtime": 96332.733, "train_tokens_per_second": 29190.508 }, { "epoch": 0.3502820610914913, "grad_norm": 1.5703125, "learning_rate": 3.5444950838259455e-05, "loss": 1.109194278717041, "num_input_tokens_seen": 2814878784, "step": 9900, "train_runtime": 96431.8684, "train_tokens_per_second": 29190.337 }, { "epoch": 0.35063588135522006, "grad_norm": 1.4140625, "learning_rate": 3.543604797954563e-05, "loss": 1.112288761138916, "num_input_tokens_seen": 2817671616, "step": 9910, "train_runtime": 96526.1892, "train_tokens_per_second": 29190.747 }, { "epoch": 0.3509897016189488, "grad_norm": 1.4375, "learning_rate": 3.542715182596996e-05, "loss": 1.1129362106323242, "num_input_tokens_seen": 2820527872, "step": 9920, "train_runtime": 96624.0564, "train_tokens_per_second": 29190.742 }, { "epoch": 0.35134352188267765, "grad_norm": 1.421875, "learning_rate": 3.5418262369120115e-05, "loss": 1.1146570205688477, "num_input_tokens_seen": 2823372928, "step": 9930, "train_runtime": 96720.6889, "train_tokens_per_second": 29190.993 }, { "epoch": 0.3516973421464064, "grad_norm": 1.4296875, "learning_rate": 3.5409379600598526e-05, "loss": 1.1188179969787597, "num_input_tokens_seen": 2826218944, "step": 9940, "train_runtime": 96817.8747, "train_tokens_per_second": 29191.086 }, { "epoch": 0.3520511624101352, "grad_norm": 1.359375, "learning_rate": 3.540050351202235e-05, "loss": 1.1275922775268554, "num_input_tokens_seen": 2829055168, "step": 9950, "train_runtime": 96913.0701, "train_tokens_per_second": 29191.678 }, { "epoch": 0.35240498267386394, "grad_norm": 1.3984375, "learning_rate": 3.539163409502347e-05, "loss": 1.113216018676758, "num_input_tokens_seen": 2831964224, "step": 9960, "train_runtime": 97015.5726, "train_tokens_per_second": 29190.821 }, { "epoch": 0.35275880293759276, "grad_norm": 1.4375, "learning_rate": 3.5382771341248416e-05, "loss": 1.1188175201416015, "num_input_tokens_seen": 2834815616, "step": 9970, "train_runtime": 97112.6245, "train_tokens_per_second": 29191.01 }, { "epoch": 0.35311262320132153, "grad_norm": 1.4609375, "learning_rate": 3.537391524235835e-05, "loss": 1.1246353149414063, "num_input_tokens_seen": 2837725056, "step": 9980, "train_runtime": 97213.7987, "train_tokens_per_second": 29190.558 }, { "epoch": 0.3534664434650503, "grad_norm": 1.515625, "learning_rate": 3.5365065790029055e-05, "loss": 1.130160140991211, "num_input_tokens_seen": 2840564416, "step": 9990, "train_runtime": 97312.3622, "train_tokens_per_second": 29190.17 }, { "epoch": 0.35382026372877906, "grad_norm": 1.4296875, "learning_rate": 3.535622297595087e-05, "loss": 1.115757942199707, "num_input_tokens_seen": 2843412288, "step": 10000, "train_runtime": 97411.5268, "train_tokens_per_second": 29189.69 }, { "epoch": 0.35382026372877906, "eval_loss": 1.0372706651687622, "eval_runtime": 8.4453, "eval_samples_per_second": 472.214, "eval_steps_per_second": 3.789, "num_input_tokens_seen": 2843412288, "step": 10000 }, { "epoch": 0.3541740839925079, "grad_norm": 1.390625, "learning_rate": 3.534738679182869e-05, "loss": 1.1269047737121582, "num_input_tokens_seen": 2846261632, "step": 10010, "train_runtime": 97536.7678, "train_tokens_per_second": 29181.423 }, { "epoch": 0.35452790425623665, "grad_norm": 1.3828125, "learning_rate": 3.533855722938188e-05, "loss": 1.1177932739257812, "num_input_tokens_seen": 2849122752, "step": 10020, "train_runtime": 97633.9783, "train_tokens_per_second": 29181.672 }, { "epoch": 0.3548817245199654, "grad_norm": 1.4453125, "learning_rate": 3.5329734280344325e-05, "loss": 1.113227653503418, "num_input_tokens_seen": 2851970688, "step": 10030, "train_runtime": 97731.4603, "train_tokens_per_second": 29181.705 }, { "epoch": 0.3552355447836942, "grad_norm": 1.484375, "learning_rate": 3.5320917936464294e-05, "loss": 1.1225366592407227, "num_input_tokens_seen": 2854831552, "step": 10040, "train_runtime": 97831.2638, "train_tokens_per_second": 29181.178 }, { "epoch": 0.35558936504742295, "grad_norm": 1.3828125, "learning_rate": 3.5312108189504505e-05, "loss": 1.1237954139709472, "num_input_tokens_seen": 2857663424, "step": 10050, "train_runtime": 97927.6764, "train_tokens_per_second": 29181.367 }, { "epoch": 0.35594318531115177, "grad_norm": 1.3515625, "learning_rate": 3.530330503124204e-05, "loss": 1.1268199920654296, "num_input_tokens_seen": 2860553920, "step": 10060, "train_runtime": 98027.2536, "train_tokens_per_second": 29181.21 }, { "epoch": 0.35629700557488053, "grad_norm": 1.46875, "learning_rate": 3.5294508453468325e-05, "loss": 1.1216670989990234, "num_input_tokens_seen": 2863390528, "step": 10070, "train_runtime": 98127.5918, "train_tokens_per_second": 29180.279 }, { "epoch": 0.3566508258386093, "grad_norm": 1.4140625, "learning_rate": 3.528571844798908e-05, "loss": 1.1175540924072265, "num_input_tokens_seen": 2866238080, "step": 10080, "train_runtime": 98225.8852, "train_tokens_per_second": 29180.069 }, { "epoch": 0.35700464610233806, "grad_norm": 1.3515625, "learning_rate": 3.527693500662431e-05, "loss": 1.1122797012329102, "num_input_tokens_seen": 2869066944, "step": 10090, "train_runtime": 98321.6796, "train_tokens_per_second": 29180.41 }, { "epoch": 0.3573584663660669, "grad_norm": 1.4296875, "learning_rate": 3.5268158121208294e-05, "loss": 1.1270309448242188, "num_input_tokens_seen": 2871896960, "step": 10100, "train_runtime": 98419.4466, "train_tokens_per_second": 29180.178 }, { "epoch": 0.35771228662979565, "grad_norm": 1.4375, "learning_rate": 3.525938778358949e-05, "loss": 1.1095788955688477, "num_input_tokens_seen": 2874711360, "step": 10110, "train_runtime": 98513.7977, "train_tokens_per_second": 29180.799 }, { "epoch": 0.3580661068935244, "grad_norm": 1.40625, "learning_rate": 3.5250623985630537e-05, "loss": 1.1010171890258789, "num_input_tokens_seen": 2877534400, "step": 10120, "train_runtime": 98609.1326, "train_tokens_per_second": 29181.216 }, { "epoch": 0.3584199271572532, "grad_norm": 1.4609375, "learning_rate": 3.524186671920826e-05, "loss": 1.1162256240844726, "num_input_tokens_seen": 2880340160, "step": 10130, "train_runtime": 98706.5543, "train_tokens_per_second": 29180.84 }, { "epoch": 0.358773747420982, "grad_norm": 1.4453125, "learning_rate": 3.523311597621358e-05, "loss": 1.130044937133789, "num_input_tokens_seen": 2883145024, "step": 10140, "train_runtime": 98800.7358, "train_tokens_per_second": 29181.412 }, { "epoch": 0.35912756768471077, "grad_norm": 1.4609375, "learning_rate": 3.5224371748551505e-05, "loss": 1.1327491760253907, "num_input_tokens_seen": 2885943040, "step": 10150, "train_runtime": 98894.9224, "train_tokens_per_second": 29181.913 }, { "epoch": 0.35948138794843953, "grad_norm": 1.4375, "learning_rate": 3.521563402814109e-05, "loss": 1.1092525482177735, "num_input_tokens_seen": 2888792000, "step": 10160, "train_runtime": 98991.1651, "train_tokens_per_second": 29182.321 }, { "epoch": 0.3598352082121683, "grad_norm": 1.390625, "learning_rate": 3.5206902806915436e-05, "loss": 1.110850715637207, "num_input_tokens_seen": 2891615552, "step": 10170, "train_runtime": 99087.6242, "train_tokens_per_second": 29182.409 }, { "epoch": 0.3601890284758971, "grad_norm": 1.453125, "learning_rate": 3.5198178076821644e-05, "loss": 1.1072074890136718, "num_input_tokens_seen": 2894430336, "step": 10180, "train_runtime": 99186.4886, "train_tokens_per_second": 29181.7 }, { "epoch": 0.3605428487396259, "grad_norm": 1.4765625, "learning_rate": 3.5189459829820743e-05, "loss": 1.115060043334961, "num_input_tokens_seen": 2897246656, "step": 10190, "train_runtime": 99280.7205, "train_tokens_per_second": 29182.369 }, { "epoch": 0.36089666900335465, "grad_norm": 1.53125, "learning_rate": 3.5180748057887714e-05, "loss": 1.1040501594543457, "num_input_tokens_seen": 2900098944, "step": 10200, "train_runtime": 99378.4639, "train_tokens_per_second": 29182.368 }, { "epoch": 0.3612504892670834, "grad_norm": 1.4921875, "learning_rate": 3.517204275301144e-05, "loss": 1.1283758163452149, "num_input_tokens_seen": 2902918144, "step": 10210, "train_runtime": 99475.7019, "train_tokens_per_second": 29182.183 }, { "epoch": 0.36160430953081224, "grad_norm": 1.4375, "learning_rate": 3.5163343907194676e-05, "loss": 1.1114299774169922, "num_input_tokens_seen": 2905770432, "step": 10220, "train_runtime": 99571.0069, "train_tokens_per_second": 29182.897 }, { "epoch": 0.361958129794541, "grad_norm": 1.4296875, "learning_rate": 3.5154651512453995e-05, "loss": 1.1151932716369628, "num_input_tokens_seen": 2908571584, "step": 10230, "train_runtime": 99667.5395, "train_tokens_per_second": 29182.737 }, { "epoch": 0.36231195005826977, "grad_norm": 1.5078125, "learning_rate": 3.514596556081981e-05, "loss": 1.117941665649414, "num_input_tokens_seen": 2911423872, "step": 10240, "train_runtime": 99764.4732, "train_tokens_per_second": 29182.972 }, { "epoch": 0.36266577032199854, "grad_norm": 1.46875, "learning_rate": 3.513728604433628e-05, "loss": 1.1198583602905274, "num_input_tokens_seen": 2914283584, "step": 10250, "train_runtime": 99863.5919, "train_tokens_per_second": 29182.643 }, { "epoch": 0.36301959058572736, "grad_norm": 1.421875, "learning_rate": 3.5128612955061334e-05, "loss": 1.1151424407958985, "num_input_tokens_seen": 2917172096, "step": 10260, "train_runtime": 99964.7304, "train_tokens_per_second": 29182.013 }, { "epoch": 0.3633734108494561, "grad_norm": 1.4296875, "learning_rate": 3.5119946285066595e-05, "loss": 1.120326328277588, "num_input_tokens_seen": 2919902656, "step": 10270, "train_runtime": 100055.147, "train_tokens_per_second": 29182.933 }, { "epoch": 0.3637272311131849, "grad_norm": 1.421875, "learning_rate": 3.511128602643739e-05, "loss": 1.11312894821167, "num_input_tokens_seen": 2922714496, "step": 10280, "train_runtime": 100152.1783, "train_tokens_per_second": 29182.735 }, { "epoch": 0.36408105137691366, "grad_norm": 1.40625, "learning_rate": 3.510263217127269e-05, "loss": 1.1357854843139648, "num_input_tokens_seen": 2925525888, "step": 10290, "train_runtime": 100248.7699, "train_tokens_per_second": 29182.661 }, { "epoch": 0.3644348716406424, "grad_norm": 1.421875, "learning_rate": 3.50939847116851e-05, "loss": 1.122338104248047, "num_input_tokens_seen": 2928375872, "step": 10300, "train_runtime": 100345.9146, "train_tokens_per_second": 29182.811 }, { "epoch": 0.36478869190437124, "grad_norm": 1.484375, "learning_rate": 3.508534363980081e-05, "loss": 1.1127201080322267, "num_input_tokens_seen": 2931220864, "step": 10310, "train_runtime": 100443.8697, "train_tokens_per_second": 29182.676 }, { "epoch": 0.3651425121681, "grad_norm": 1.390625, "learning_rate": 3.507670894775958e-05, "loss": 1.1078279495239258, "num_input_tokens_seen": 2934116352, "step": 10320, "train_runtime": 100543.7415, "train_tokens_per_second": 29182.486 }, { "epoch": 0.3654963324318288, "grad_norm": 1.4375, "learning_rate": 3.506808062771471e-05, "loss": 1.1126413345336914, "num_input_tokens_seen": 2936979328, "step": 10330, "train_runtime": 100643.5748, "train_tokens_per_second": 29181.985 }, { "epoch": 0.36585015269555754, "grad_norm": 1.484375, "learning_rate": 3.505945867183298e-05, "loss": 1.1108901023864746, "num_input_tokens_seen": 2939864704, "step": 10340, "train_runtime": 100741.6459, "train_tokens_per_second": 29182.218 }, { "epoch": 0.36620397295928636, "grad_norm": 1.421875, "learning_rate": 3.505084307229468e-05, "loss": 1.1100027084350585, "num_input_tokens_seen": 2942764864, "step": 10350, "train_runtime": 100840.7667, "train_tokens_per_second": 29182.294 }, { "epoch": 0.3665577932230151, "grad_norm": 1.4765625, "learning_rate": 3.5042233821293525e-05, "loss": 1.1167325973510742, "num_input_tokens_seen": 2945659584, "step": 10360, "train_runtime": 100940.8964, "train_tokens_per_second": 29182.023 }, { "epoch": 0.3669116134867439, "grad_norm": 1.375, "learning_rate": 3.503363091103664e-05, "loss": 1.1093772888183593, "num_input_tokens_seen": 2948521152, "step": 10370, "train_runtime": 101039.091, "train_tokens_per_second": 29181.984 }, { "epoch": 0.36726543375047266, "grad_norm": 1.390625, "learning_rate": 3.5025034333744545e-05, "loss": 1.1222831726074218, "num_input_tokens_seen": 2951408384, "step": 10380, "train_runtime": 101140.5089, "train_tokens_per_second": 29181.269 }, { "epoch": 0.3676192540142015, "grad_norm": 1.4375, "learning_rate": 3.501644408165112e-05, "loss": 1.1212279319763183, "num_input_tokens_seen": 2954215808, "step": 10390, "train_runtime": 101236.67, "train_tokens_per_second": 29181.282 }, { "epoch": 0.36797307427793025, "grad_norm": 1.4375, "learning_rate": 3.500786014700357e-05, "loss": 1.1134011268615722, "num_input_tokens_seen": 2957086144, "step": 10400, "train_runtime": 101334.7644, "train_tokens_per_second": 29181.359 }, { "epoch": 0.368326894541659, "grad_norm": 1.375, "learning_rate": 3.499928252206237e-05, "loss": 1.1200634002685548, "num_input_tokens_seen": 2959937472, "step": 10410, "train_runtime": 101432.1888, "train_tokens_per_second": 29181.441 }, { "epoch": 0.3686807148053878, "grad_norm": 1.46875, "learning_rate": 3.499071119910131e-05, "loss": 1.1210924148559571, "num_input_tokens_seen": 2962776128, "step": 10420, "train_runtime": 101529.5345, "train_tokens_per_second": 29181.421 }, { "epoch": 0.3690345350691166, "grad_norm": 1.4453125, "learning_rate": 3.498214617040739e-05, "loss": 1.1227343559265137, "num_input_tokens_seen": 2965612416, "step": 10430, "train_runtime": 101625.5937, "train_tokens_per_second": 29181.748 }, { "epoch": 0.36938835533284536, "grad_norm": 1.421875, "learning_rate": 3.49735874282808e-05, "loss": 1.117354965209961, "num_input_tokens_seen": 2968451008, "step": 10440, "train_runtime": 101722.8542, "train_tokens_per_second": 29181.751 }, { "epoch": 0.36974217559657413, "grad_norm": 1.5859375, "learning_rate": 3.4965034965034965e-05, "loss": 1.1092388153076171, "num_input_tokens_seen": 2971281600, "step": 10450, "train_runtime": 101816.8755, "train_tokens_per_second": 29182.604 }, { "epoch": 0.3700959958603029, "grad_norm": 1.3984375, "learning_rate": 3.495648877299642e-05, "loss": 1.1116914749145508, "num_input_tokens_seen": 2974099712, "step": 10460, "train_runtime": 101912.5863, "train_tokens_per_second": 29182.85 }, { "epoch": 0.3704498161240317, "grad_norm": 1.484375, "learning_rate": 3.494794884450483e-05, "loss": 1.1130853652954102, "num_input_tokens_seen": 2976928896, "step": 10470, "train_runtime": 102009.0156, "train_tokens_per_second": 29182.998 }, { "epoch": 0.3708036363877605, "grad_norm": 1.4453125, "learning_rate": 3.4939415171912954e-05, "loss": 1.1183357238769531, "num_input_tokens_seen": 2979790336, "step": 10480, "train_runtime": 102107.4453, "train_tokens_per_second": 29182.89 }, { "epoch": 0.37115745665148925, "grad_norm": 1.3828125, "learning_rate": 3.4930887747586616e-05, "loss": 1.1139404296875, "num_input_tokens_seen": 2982652160, "step": 10490, "train_runtime": 102204.8376, "train_tokens_per_second": 29183.082 }, { "epoch": 0.371511276915218, "grad_norm": 1.421875, "learning_rate": 3.492236656390469e-05, "loss": 1.112145233154297, "num_input_tokens_seen": 2985514176, "step": 10500, "train_runtime": 102305.1865, "train_tokens_per_second": 29182.432 }, { "epoch": 0.37186509717894684, "grad_norm": 1.4375, "learning_rate": 3.4913851613259034e-05, "loss": 1.1100782394409179, "num_input_tokens_seen": 2988309056, "step": 10510, "train_runtime": 102398.8311, "train_tokens_per_second": 29183.039 }, { "epoch": 0.3722189174426756, "grad_norm": 1.4375, "learning_rate": 3.490534288805452e-05, "loss": 1.117668342590332, "num_input_tokens_seen": 2991174400, "step": 10520, "train_runtime": 102494.5793, "train_tokens_per_second": 29183.733 }, { "epoch": 0.37257273770640437, "grad_norm": 1.4296875, "learning_rate": 3.489684038070891e-05, "loss": 1.1157140731811523, "num_input_tokens_seen": 2993989824, "step": 10530, "train_runtime": 102591.1933, "train_tokens_per_second": 29183.692 }, { "epoch": 0.37292655797013313, "grad_norm": 1.40625, "learning_rate": 3.488834408365296e-05, "loss": 1.114221954345703, "num_input_tokens_seen": 2996803968, "step": 10540, "train_runtime": 102686.4276, "train_tokens_per_second": 29184.032 }, { "epoch": 0.37328037823386195, "grad_norm": 1.4609375, "learning_rate": 3.487985398933027e-05, "loss": 1.098709487915039, "num_input_tokens_seen": 2999637952, "step": 10550, "train_runtime": 102782.4254, "train_tokens_per_second": 29184.347 }, { "epoch": 0.3736341984975907, "grad_norm": 1.4609375, "learning_rate": 3.4871370090197324e-05, "loss": 1.1089361190795899, "num_input_tokens_seen": 3002435456, "step": 10560, "train_runtime": 102877.1071, "train_tokens_per_second": 29184.68 }, { "epoch": 0.3739880187613195, "grad_norm": 1.4453125, "learning_rate": 3.486289237872343e-05, "loss": 1.106496238708496, "num_input_tokens_seen": 3005268288, "step": 10570, "train_runtime": 102976.853, "train_tokens_per_second": 29183.92 }, { "epoch": 0.37434183902504825, "grad_norm": 1.53125, "learning_rate": 3.485442084739075e-05, "loss": 1.1061769485473634, "num_input_tokens_seen": 3008101568, "step": 10580, "train_runtime": 103075.6469, "train_tokens_per_second": 29183.436 }, { "epoch": 0.374695659288777, "grad_norm": 1.4140625, "learning_rate": 3.484595548869416e-05, "loss": 1.1253287315368652, "num_input_tokens_seen": 3010975040, "step": 10590, "train_runtime": 103173.0554, "train_tokens_per_second": 29183.734 }, { "epoch": 0.37504947955250584, "grad_norm": 1.40625, "learning_rate": 3.4837496295141335e-05, "loss": 1.1121050834655761, "num_input_tokens_seen": 3013859904, "step": 10600, "train_runtime": 103276.3622, "train_tokens_per_second": 29182.475 }, { "epoch": 0.3754032998162346, "grad_norm": 1.4921875, "learning_rate": 3.482904325925266e-05, "loss": 1.1130998611450196, "num_input_tokens_seen": 3016678976, "step": 10610, "train_runtime": 103374.5373, "train_tokens_per_second": 29182.031 }, { "epoch": 0.37575712007996337, "grad_norm": 1.4296875, "learning_rate": 3.482059637356124e-05, "loss": 1.1177041053771972, "num_input_tokens_seen": 3019452544, "step": 10620, "train_runtime": 103465.8853, "train_tokens_per_second": 29183.074 }, { "epoch": 0.37611094034369214, "grad_norm": 1.3984375, "learning_rate": 3.481215563061281e-05, "loss": 1.106947422027588, "num_input_tokens_seen": 3022247808, "step": 10630, "train_runtime": 103562.3545, "train_tokens_per_second": 29182.88 }, { "epoch": 0.37646476060742096, "grad_norm": 1.3984375, "learning_rate": 3.4803721022965785e-05, "loss": 1.126286506652832, "num_input_tokens_seen": 3025134272, "step": 10640, "train_runtime": 103661.2286, "train_tokens_per_second": 29182.89 }, { "epoch": 0.3768185808711497, "grad_norm": 1.4453125, "learning_rate": 3.479529254319117e-05, "loss": 1.1151983261108398, "num_input_tokens_seen": 3027994880, "step": 10650, "train_runtime": 103759.258, "train_tokens_per_second": 29182.889 }, { "epoch": 0.3771724011348785, "grad_norm": 1.421875, "learning_rate": 3.478687018387257e-05, "loss": 1.1072070121765136, "num_input_tokens_seen": 3030848064, "step": 10660, "train_runtime": 103855.3804, "train_tokens_per_second": 29183.351 }, { "epoch": 0.37752622139860725, "grad_norm": 1.390625, "learning_rate": 3.477845393760616e-05, "loss": 1.0979772567749024, "num_input_tokens_seen": 3033682752, "step": 10670, "train_runtime": 103953.7931, "train_tokens_per_second": 29182.992 }, { "epoch": 0.3778800416623361, "grad_norm": 1.421875, "learning_rate": 3.4770043797000614e-05, "loss": 1.1147751808166504, "num_input_tokens_seen": 3036544128, "step": 10680, "train_runtime": 104050.3975, "train_tokens_per_second": 29183.398 }, { "epoch": 0.37823386192606484, "grad_norm": 1.453125, "learning_rate": 3.4761639754677146e-05, "loss": 1.126236915588379, "num_input_tokens_seen": 3039454016, "step": 10690, "train_runtime": 104154.0514, "train_tokens_per_second": 29182.293 }, { "epoch": 0.3785876821897936, "grad_norm": 1.453125, "learning_rate": 3.4753241803269435e-05, "loss": 1.0952476501464843, "num_input_tokens_seen": 3042330880, "step": 10700, "train_runtime": 104253.2228, "train_tokens_per_second": 29182.128 }, { "epoch": 0.37894150245352237, "grad_norm": 1.515625, "learning_rate": 3.474484993542361e-05, "loss": 1.1179283142089844, "num_input_tokens_seen": 3045096960, "step": 10710, "train_runtime": 104346.4105, "train_tokens_per_second": 29182.575 }, { "epoch": 0.3792953227172512, "grad_norm": 1.4765625, "learning_rate": 3.473646414379822e-05, "loss": 1.1073570251464844, "num_input_tokens_seen": 3047948800, "step": 10720, "train_runtime": 104445.4612, "train_tokens_per_second": 29182.204 }, { "epoch": 0.37964914298097996, "grad_norm": 1.4375, "learning_rate": 3.472808442106422e-05, "loss": 1.10926513671875, "num_input_tokens_seen": 3050755584, "step": 10730, "train_runtime": 104541.3125, "train_tokens_per_second": 29182.297 }, { "epoch": 0.3800029632447087, "grad_norm": 1.4375, "learning_rate": 3.4719710759904936e-05, "loss": 1.1258193016052247, "num_input_tokens_seen": 3053615808, "step": 10740, "train_runtime": 104640.1521, "train_tokens_per_second": 29182.066 }, { "epoch": 0.3803567835084375, "grad_norm": 1.4140625, "learning_rate": 3.471134315301603e-05, "loss": 1.1104583740234375, "num_input_tokens_seen": 3056458816, "step": 10750, "train_runtime": 104738.2197, "train_tokens_per_second": 29181.886 }, { "epoch": 0.3807106037721663, "grad_norm": 1.3515625, "learning_rate": 3.470298159310549e-05, "loss": 1.1088730812072753, "num_input_tokens_seen": 3059267264, "step": 10760, "train_runtime": 104835.5516, "train_tokens_per_second": 29181.582 }, { "epoch": 0.3810644240358951, "grad_norm": 1.421875, "learning_rate": 3.4694626072893585e-05, "loss": 1.1143556594848634, "num_input_tokens_seen": 3062082304, "step": 10770, "train_runtime": 104931.0495, "train_tokens_per_second": 29181.852 }, { "epoch": 0.38141824429962384, "grad_norm": 1.453125, "learning_rate": 3.468627658511285e-05, "loss": 1.106454849243164, "num_input_tokens_seen": 3064864640, "step": 10780, "train_runtime": 105023.3036, "train_tokens_per_second": 29182.71 }, { "epoch": 0.3817720645633526, "grad_norm": 1.390625, "learning_rate": 3.467793312250806e-05, "loss": 1.1209445953369142, "num_input_tokens_seen": 3067711424, "step": 10790, "train_runtime": 105119.7186, "train_tokens_per_second": 29183.025 }, { "epoch": 0.38212588482708143, "grad_norm": 1.3984375, "learning_rate": 3.466959567783619e-05, "loss": 1.1158806800842285, "num_input_tokens_seen": 3070594560, "step": 10800, "train_runtime": 105218.3736, "train_tokens_per_second": 29183.064 }, { "epoch": 0.3824797050908102, "grad_norm": 1.3671875, "learning_rate": 3.466126424386642e-05, "loss": 1.1121633529663086, "num_input_tokens_seen": 3073427264, "step": 10810, "train_runtime": 105315.0952, "train_tokens_per_second": 29183.16 }, { "epoch": 0.38283352535453896, "grad_norm": 1.375, "learning_rate": 3.4652938813380056e-05, "loss": 1.100991916656494, "num_input_tokens_seen": 3076311168, "step": 10820, "train_runtime": 105412.7109, "train_tokens_per_second": 29183.494 }, { "epoch": 0.3831873456182677, "grad_norm": 1.4140625, "learning_rate": 3.464461937917057e-05, "loss": 1.1089619636535644, "num_input_tokens_seen": 3079126784, "step": 10830, "train_runtime": 105508.0077, "train_tokens_per_second": 29183.821 }, { "epoch": 0.3835411658819965, "grad_norm": 1.3984375, "learning_rate": 3.4636305934043525e-05, "loss": 1.1244887351989745, "num_input_tokens_seen": 3082002240, "step": 10840, "train_runtime": 105609.4925, "train_tokens_per_second": 29183.004 }, { "epoch": 0.3838949861457253, "grad_norm": 1.40625, "learning_rate": 3.4627998470816544e-05, "loss": 1.1102939605712892, "num_input_tokens_seen": 3084901440, "step": 10850, "train_runtime": 105706.2378, "train_tokens_per_second": 29183.722 }, { "epoch": 0.3842488064094541, "grad_norm": 1.3984375, "learning_rate": 3.4619696982319334e-05, "loss": 1.1122724533081054, "num_input_tokens_seen": 3087681536, "step": 10860, "train_runtime": 105800.493, "train_tokens_per_second": 29184.0 }, { "epoch": 0.38460262667318285, "grad_norm": 1.4296875, "learning_rate": 3.461140146139361e-05, "loss": 1.1118152618408204, "num_input_tokens_seen": 3090515008, "step": 10870, "train_runtime": 105897.9605, "train_tokens_per_second": 29183.895 }, { "epoch": 0.3849564469369116, "grad_norm": 1.4375, "learning_rate": 3.460311190089309e-05, "loss": 1.118225383758545, "num_input_tokens_seen": 3093318016, "step": 10880, "train_runtime": 105994.1743, "train_tokens_per_second": 29183.849 }, { "epoch": 0.38531026720064043, "grad_norm": 1.3671875, "learning_rate": 3.459482829368348e-05, "loss": 1.1051155090332032, "num_input_tokens_seen": 3096163776, "step": 10890, "train_runtime": 106091.6422, "train_tokens_per_second": 29183.861 }, { "epoch": 0.3856640874643692, "grad_norm": 1.4609375, "learning_rate": 3.4586550632642425e-05, "loss": 1.1158140182495118, "num_input_tokens_seen": 3099002176, "step": 10900, "train_runtime": 106188.8231, "train_tokens_per_second": 29183.883 }, { "epoch": 0.38601790772809796, "grad_norm": 1.4765625, "learning_rate": 3.457827891065949e-05, "loss": 1.1205942153930664, "num_input_tokens_seen": 3101874688, "step": 10910, "train_runtime": 106287.4492, "train_tokens_per_second": 29183.828 }, { "epoch": 0.38637172799182673, "grad_norm": 1.3984375, "learning_rate": 3.457001312063614e-05, "loss": 1.1110269546508789, "num_input_tokens_seen": 3104693824, "step": 10920, "train_runtime": 106382.5153, "train_tokens_per_second": 29184.249 }, { "epoch": 0.38672554825555555, "grad_norm": 1.34375, "learning_rate": 3.45617532554857e-05, "loss": 1.1043720245361328, "num_input_tokens_seen": 3107511360, "step": 10930, "train_runtime": 106480.3539, "train_tokens_per_second": 29183.894 }, { "epoch": 0.3870793685192843, "grad_norm": 1.546875, "learning_rate": 3.455349930813339e-05, "loss": 1.1182670593261719, "num_input_tokens_seen": 3110319744, "step": 10940, "train_runtime": 106574.8559, "train_tokens_per_second": 29184.367 }, { "epoch": 0.3874331887830131, "grad_norm": 1.359375, "learning_rate": 3.45452512715162e-05, "loss": 1.1050334930419923, "num_input_tokens_seen": 3113139328, "step": 10950, "train_runtime": 106672.0311, "train_tokens_per_second": 29184.213 }, { "epoch": 0.38778700904674185, "grad_norm": 1.421875, "learning_rate": 3.4537009138582935e-05, "loss": 1.1165643692016602, "num_input_tokens_seen": 3116035456, "step": 10960, "train_runtime": 106773.0437, "train_tokens_per_second": 29183.728 }, { "epoch": 0.38814082931047067, "grad_norm": 1.46875, "learning_rate": 3.4528772902294174e-05, "loss": 1.1053705215454102, "num_input_tokens_seen": 3118861248, "step": 10970, "train_runtime": 106866.9227, "train_tokens_per_second": 29184.533 }, { "epoch": 0.38849464957419944, "grad_norm": 1.390625, "learning_rate": 3.452054255562222e-05, "loss": 1.116770076751709, "num_input_tokens_seen": 3121694144, "step": 10980, "train_runtime": 106963.6725, "train_tokens_per_second": 29184.62 }, { "epoch": 0.3888484698379282, "grad_norm": 1.4296875, "learning_rate": 3.451231809155115e-05, "loss": 1.1107559204101562, "num_input_tokens_seen": 3124662464, "step": 10990, "train_runtime": 107073.9523, "train_tokens_per_second": 29182.284 }, { "epoch": 0.38920229010165697, "grad_norm": 1.4140625, "learning_rate": 3.450409950307666e-05, "loss": 1.113471508026123, "num_input_tokens_seen": 3127486208, "step": 11000, "train_runtime": 107171.0941, "train_tokens_per_second": 29182.18 }, { "epoch": 0.3895561103653858, "grad_norm": 1.4296875, "learning_rate": 3.449588678320619e-05, "loss": 1.1239524841308595, "num_input_tokens_seen": 3130333248, "step": 11010, "train_runtime": 107268.318, "train_tokens_per_second": 29182.272 }, { "epoch": 0.38990993062911455, "grad_norm": 1.4609375, "learning_rate": 3.4487679924958767e-05, "loss": 1.1235685348510742, "num_input_tokens_seen": 3133211840, "step": 11020, "train_runtime": 107368.3632, "train_tokens_per_second": 29181.891 }, { "epoch": 0.3902637508928433, "grad_norm": 1.4375, "learning_rate": 3.4479478921365076e-05, "loss": 1.1143548965454102, "num_input_tokens_seen": 3136050176, "step": 11030, "train_runtime": 107463.9093, "train_tokens_per_second": 29182.357 }, { "epoch": 0.3906175711565721, "grad_norm": 1.484375, "learning_rate": 3.447128376546738e-05, "loss": 1.1043270111083985, "num_input_tokens_seen": 3138931008, "step": 11040, "train_runtime": 107563.1158, "train_tokens_per_second": 29182.225 }, { "epoch": 0.3909713914203009, "grad_norm": 1.3828125, "learning_rate": 3.4463094450319505e-05, "loss": 1.1129372596740723, "num_input_tokens_seen": 3141796864, "step": 11050, "train_runtime": 107664.4772, "train_tokens_per_second": 29181.369 }, { "epoch": 0.3913252116840297, "grad_norm": 1.4140625, "learning_rate": 3.4454910968986855e-05, "loss": 1.1184050559997558, "num_input_tokens_seen": 3144613824, "step": 11060, "train_runtime": 107761.4763, "train_tokens_per_second": 29181.243 }, { "epoch": 0.39167903194775844, "grad_norm": 1.3828125, "learning_rate": 3.4446733314546336e-05, "loss": 1.1175203323364258, "num_input_tokens_seen": 3147476032, "step": 11070, "train_runtime": 107862.5838, "train_tokens_per_second": 29180.425 }, { "epoch": 0.3920328522114872, "grad_norm": 1.359375, "learning_rate": 3.443856148008633e-05, "loss": 1.104756736755371, "num_input_tokens_seen": 3150305600, "step": 11080, "train_runtime": 107958.7977, "train_tokens_per_second": 29180.629 }, { "epoch": 0.39238667247521597, "grad_norm": 1.4609375, "learning_rate": 3.443039545870672e-05, "loss": 1.1070931434631348, "num_input_tokens_seen": 3153158784, "step": 11090, "train_runtime": 108055.595, "train_tokens_per_second": 29180.893 }, { "epoch": 0.3927404927389448, "grad_norm": 1.4609375, "learning_rate": 3.442223524351883e-05, "loss": 1.1171310424804688, "num_input_tokens_seen": 3156049984, "step": 11100, "train_runtime": 108157.7549, "train_tokens_per_second": 29180.062 }, { "epoch": 0.39309431300267356, "grad_norm": 1.4453125, "learning_rate": 3.44140808276454e-05, "loss": 1.1156272888183594, "num_input_tokens_seen": 3158898944, "step": 11110, "train_runtime": 108255.6249, "train_tokens_per_second": 29179.998 }, { "epoch": 0.3934481332664023, "grad_norm": 1.4453125, "learning_rate": 3.4405932204220575e-05, "loss": 1.0975558280944824, "num_input_tokens_seen": 3161758976, "step": 11120, "train_runtime": 108353.6674, "train_tokens_per_second": 29179.99 }, { "epoch": 0.3938019535301311, "grad_norm": 1.453125, "learning_rate": 3.4397789366389876e-05, "loss": 1.113433265686035, "num_input_tokens_seen": 3164592256, "step": 11130, "train_runtime": 108448.5117, "train_tokens_per_second": 29180.596 }, { "epoch": 0.3941557737938599, "grad_norm": 1.4296875, "learning_rate": 3.438965230731016e-05, "loss": 1.1086791038513184, "num_input_tokens_seen": 3167391680, "step": 11140, "train_runtime": 108541.7124, "train_tokens_per_second": 29181.331 }, { "epoch": 0.3945095940575887, "grad_norm": 1.453125, "learning_rate": 3.438152102014964e-05, "loss": 1.1120376586914062, "num_input_tokens_seen": 3170208256, "step": 11150, "train_runtime": 108638.0519, "train_tokens_per_second": 29181.38 }, { "epoch": 0.39486341432131744, "grad_norm": 1.453125, "learning_rate": 3.437339549808778e-05, "loss": 1.1136640548706054, "num_input_tokens_seen": 3173073088, "step": 11160, "train_runtime": 108737.0464, "train_tokens_per_second": 29181.159 }, { "epoch": 0.3952172345850462, "grad_norm": 1.40625, "learning_rate": 3.43652757343154e-05, "loss": 1.1128786087036133, "num_input_tokens_seen": 3175926528, "step": 11170, "train_runtime": 108834.7908, "train_tokens_per_second": 29181.17 }, { "epoch": 0.39557105484877503, "grad_norm": 1.359375, "learning_rate": 3.435716172203449e-05, "loss": 1.1115937232971191, "num_input_tokens_seen": 3178719680, "step": 11180, "train_runtime": 108928.2575, "train_tokens_per_second": 29181.773 }, { "epoch": 0.3959248751125038, "grad_norm": 1.484375, "learning_rate": 3.434905345445833e-05, "loss": 1.1214506149291992, "num_input_tokens_seen": 3181518912, "step": 11190, "train_runtime": 109024.9094, "train_tokens_per_second": 29181.578 }, { "epoch": 0.39627869537623256, "grad_norm": 1.4375, "learning_rate": 3.4340950924811374e-05, "loss": 1.1053207397460938, "num_input_tokens_seen": 3184423232, "step": 11200, "train_runtime": 109122.9601, "train_tokens_per_second": 29181.973 }, { "epoch": 0.3966325156399613, "grad_norm": 1.4140625, "learning_rate": 3.433285412632927e-05, "loss": 1.1215445518493652, "num_input_tokens_seen": 3187193344, "step": 11210, "train_runtime": 109214.2455, "train_tokens_per_second": 29182.945 }, { "epoch": 0.39698633590369015, "grad_norm": 1.484375, "learning_rate": 3.4324763052258835e-05, "loss": 1.1018836975097657, "num_input_tokens_seen": 3190018944, "step": 11220, "train_runtime": 109308.5314, "train_tokens_per_second": 29183.623 }, { "epoch": 0.3973401561674189, "grad_norm": 1.4140625, "learning_rate": 3.4316677695858003e-05, "loss": 1.1190860748291016, "num_input_tokens_seen": 3192876288, "step": 11230, "train_runtime": 109408.6708, "train_tokens_per_second": 29183.028 }, { "epoch": 0.3976939764311477, "grad_norm": 1.40625, "learning_rate": 3.430859805039583e-05, "loss": 1.1159124374389648, "num_input_tokens_seen": 3195720640, "step": 11240, "train_runtime": 109507.207, "train_tokens_per_second": 29182.743 }, { "epoch": 0.39804779669487644, "grad_norm": 1.484375, "learning_rate": 3.430052410915246e-05, "loss": 1.104234218597412, "num_input_tokens_seen": 3198522880, "step": 11250, "train_runtime": 109600.578, "train_tokens_per_second": 29183.449 }, { "epoch": 0.39840161695860526, "grad_norm": 1.3828125, "learning_rate": 3.4292455865419086e-05, "loss": 1.1040767669677733, "num_input_tokens_seen": 3201374656, "step": 11260, "train_runtime": 109698.3929, "train_tokens_per_second": 29183.423 }, { "epoch": 0.39875543722233403, "grad_norm": 1.46875, "learning_rate": 3.4284393312497973e-05, "loss": 1.101394271850586, "num_input_tokens_seen": 3204221120, "step": 11270, "train_runtime": 109800.7182, "train_tokens_per_second": 29182.151 }, { "epoch": 0.3991092574860628, "grad_norm": 1.3984375, "learning_rate": 3.427633644370238e-05, "loss": 1.112740707397461, "num_input_tokens_seen": 3207060992, "step": 11280, "train_runtime": 109895.8818, "train_tokens_per_second": 29182.722 }, { "epoch": 0.39946307774979156, "grad_norm": 1.4296875, "learning_rate": 3.4268285252356564e-05, "loss": 1.1246959686279296, "num_input_tokens_seen": 3209919680, "step": 11290, "train_runtime": 109993.9784, "train_tokens_per_second": 29182.686 }, { "epoch": 0.3998168980135204, "grad_norm": 1.4609375, "learning_rate": 3.426023973179575e-05, "loss": 1.1174297332763672, "num_input_tokens_seen": 3212786368, "step": 11300, "train_runtime": 110095.7435, "train_tokens_per_second": 29181.749 }, { "epoch": 0.40017071827724915, "grad_norm": 1.390625, "learning_rate": 3.425219987536614e-05, "loss": 1.1124868392944336, "num_input_tokens_seen": 3215634944, "step": 11310, "train_runtime": 110192.6136, "train_tokens_per_second": 29181.946 }, { "epoch": 0.4005245385409779, "grad_norm": 1.3984375, "learning_rate": 3.4244165676424815e-05, "loss": 1.1201066970825195, "num_input_tokens_seen": 3218476672, "step": 11320, "train_runtime": 110287.328, "train_tokens_per_second": 29182.652 }, { "epoch": 0.4008783588047067, "grad_norm": 1.3984375, "learning_rate": 3.423613712833979e-05, "loss": 1.1139363288879394, "num_input_tokens_seen": 3221314432, "step": 11330, "train_runtime": 110384.8241, "train_tokens_per_second": 29182.584 }, { "epoch": 0.40123217906843545, "grad_norm": 1.4921875, "learning_rate": 3.422811422448995e-05, "loss": 1.109142780303955, "num_input_tokens_seen": 3224176704, "step": 11340, "train_runtime": 110484.0339, "train_tokens_per_second": 29182.286 }, { "epoch": 0.40158599933216427, "grad_norm": 1.5, "learning_rate": 3.422009695826503e-05, "loss": 1.1031388282775878, "num_input_tokens_seen": 3226992384, "step": 11350, "train_runtime": 110580.8312, "train_tokens_per_second": 29182.204 }, { "epoch": 0.40193981959589303, "grad_norm": 1.4453125, "learning_rate": 3.4212085323065626e-05, "loss": 1.1194723129272461, "num_input_tokens_seen": 3229866496, "step": 11360, "train_runtime": 110680.3498, "train_tokens_per_second": 29181.932 }, { "epoch": 0.4022936398596218, "grad_norm": 1.4140625, "learning_rate": 3.4204079312303103e-05, "loss": 1.1056083679199218, "num_input_tokens_seen": 3232696320, "step": 11370, "train_runtime": 110773.0782, "train_tokens_per_second": 29183.05 }, { "epoch": 0.40264746012335056, "grad_norm": 1.3984375, "learning_rate": 3.419607891939964e-05, "loss": 1.1169441223144532, "num_input_tokens_seen": 3235577024, "step": 11380, "train_runtime": 110872.7255, "train_tokens_per_second": 29182.804 }, { "epoch": 0.4030012803870794, "grad_norm": 1.421875, "learning_rate": 3.4188084137788166e-05, "loss": 1.1078732490539551, "num_input_tokens_seen": 3238419904, "step": 11390, "train_runtime": 110969.1995, "train_tokens_per_second": 29183.052 }, { "epoch": 0.40335510065080815, "grad_norm": 1.4296875, "learning_rate": 3.418009496091238e-05, "loss": 1.1268056869506835, "num_input_tokens_seen": 3241216512, "step": 11400, "train_runtime": 111062.2152, "train_tokens_per_second": 29183.791 }, { "epoch": 0.4037089209145369, "grad_norm": 1.546875, "learning_rate": 3.417211138222666e-05, "loss": 1.1081307411193848, "num_input_tokens_seen": 3244043904, "step": 11410, "train_runtime": 111158.0072, "train_tokens_per_second": 29184.078 }, { "epoch": 0.4040627411782657, "grad_norm": 1.390625, "learning_rate": 3.416413339519612e-05, "loss": 1.109385871887207, "num_input_tokens_seen": 3246944704, "step": 11420, "train_runtime": 111261.0448, "train_tokens_per_second": 29183.123 }, { "epoch": 0.4044165614419945, "grad_norm": 1.421875, "learning_rate": 3.4156160993296524e-05, "loss": 1.1223718643188476, "num_input_tokens_seen": 3249768064, "step": 11430, "train_runtime": 111357.2481, "train_tokens_per_second": 29183.265 }, { "epoch": 0.40477038170572327, "grad_norm": 1.4453125, "learning_rate": 3.4148194170014295e-05, "loss": 1.121194076538086, "num_input_tokens_seen": 3252589824, "step": 11440, "train_runtime": 111453.6271, "train_tokens_per_second": 29183.347 }, { "epoch": 0.40512420196945204, "grad_norm": 1.5546875, "learning_rate": 3.4140232918846484e-05, "loss": 1.1094854354858399, "num_input_tokens_seen": 3255463808, "step": 11450, "train_runtime": 111551.4368, "train_tokens_per_second": 29183.522 }, { "epoch": 0.4054780222331808, "grad_norm": 1.4140625, "learning_rate": 3.4132277233300753e-05, "loss": 1.088420295715332, "num_input_tokens_seen": 3258240768, "step": 11460, "train_runtime": 111642.6468, "train_tokens_per_second": 29184.553 }, { "epoch": 0.4058318424969096, "grad_norm": 1.4453125, "learning_rate": 3.4124327106895356e-05, "loss": 1.1078187942504882, "num_input_tokens_seen": 3261076992, "step": 11470, "train_runtime": 111739.1433, "train_tokens_per_second": 29184.732 }, { "epoch": 0.4061856627606384, "grad_norm": 1.40625, "learning_rate": 3.4116382533159097e-05, "loss": 1.1171884536743164, "num_input_tokens_seen": 3263949568, "step": 11480, "train_runtime": 111837.8026, "train_tokens_per_second": 29184.672 }, { "epoch": 0.40653948302436715, "grad_norm": 1.390625, "learning_rate": 3.4108443505631335e-05, "loss": 1.1110849380493164, "num_input_tokens_seen": 3266796544, "step": 11490, "train_runtime": 111935.1078, "train_tokens_per_second": 29184.736 }, { "epoch": 0.4068933032880959, "grad_norm": 1.4453125, "learning_rate": 3.410051001786192e-05, "loss": 1.1107412338256837, "num_input_tokens_seen": 3269649216, "step": 11500, "train_runtime": 112035.4055, "train_tokens_per_second": 29184.071 }, { "epoch": 0.40724712355182474, "grad_norm": 1.421875, "learning_rate": 3.409258206341124e-05, "loss": 1.110093116760254, "num_input_tokens_seen": 3272512320, "step": 11510, "train_runtime": 112134.7425, "train_tokens_per_second": 29183.75 }, { "epoch": 0.4076009438155535, "grad_norm": 1.4296875, "learning_rate": 3.4084659635850134e-05, "loss": 1.112485980987549, "num_input_tokens_seen": 3275336384, "step": 11520, "train_runtime": 112231.8412, "train_tokens_per_second": 29183.664 }, { "epoch": 0.4079547640792823, "grad_norm": 1.4453125, "learning_rate": 3.40767427287599e-05, "loss": 1.1065649032592773, "num_input_tokens_seen": 3278275648, "step": 11530, "train_runtime": 112334.4729, "train_tokens_per_second": 29183.167 }, { "epoch": 0.40830858434301104, "grad_norm": 1.3984375, "learning_rate": 3.406883133573224e-05, "loss": 1.0992963790893555, "num_input_tokens_seen": 3281109184, "step": 11540, "train_runtime": 112432.9488, "train_tokens_per_second": 29182.808 }, { "epoch": 0.40866240460673986, "grad_norm": 1.421875, "learning_rate": 3.406092545036932e-05, "loss": 1.1040657043457032, "num_input_tokens_seen": 3283960064, "step": 11550, "train_runtime": 112529.3883, "train_tokens_per_second": 29183.133 }, { "epoch": 0.4090162248704686, "grad_norm": 1.375, "learning_rate": 3.405302506628365e-05, "loss": 1.1051065444946289, "num_input_tokens_seen": 3286808128, "step": 11560, "train_runtime": 112627.3287, "train_tokens_per_second": 29183.043 }, { "epoch": 0.4093700451341974, "grad_norm": 1.453125, "learning_rate": 3.404513017709813e-05, "loss": 1.1185232162475587, "num_input_tokens_seen": 3289673792, "step": 11570, "train_runtime": 112726.0757, "train_tokens_per_second": 29182.9 }, { "epoch": 0.40972386539792616, "grad_norm": 1.5, "learning_rate": 3.403724077644598e-05, "loss": 1.0939390182495117, "num_input_tokens_seen": 3292509696, "step": 11580, "train_runtime": 112821.094, "train_tokens_per_second": 29183.458 }, { "epoch": 0.4100776856616549, "grad_norm": 1.40625, "learning_rate": 3.402935685797077e-05, "loss": 1.1304559707641602, "num_input_tokens_seen": 3295443840, "step": 11590, "train_runtime": 112925.871, "train_tokens_per_second": 29182.364 }, { "epoch": 0.41043150592538374, "grad_norm": 1.4296875, "learning_rate": 3.4021478415326355e-05, "loss": 1.1220402717590332, "num_input_tokens_seen": 3298356224, "step": 11600, "train_runtime": 113029.5744, "train_tokens_per_second": 29181.356 }, { "epoch": 0.4107853261891125, "grad_norm": 1.4609375, "learning_rate": 3.401360544217687e-05, "loss": 1.110680389404297, "num_input_tokens_seen": 3301193152, "step": 11610, "train_runtime": 113126.6515, "train_tokens_per_second": 29181.392 }, { "epoch": 0.4111391464528413, "grad_norm": 1.421875, "learning_rate": 3.400573793219672e-05, "loss": 1.1259288787841797, "num_input_tokens_seen": 3304026112, "step": 11620, "train_runtime": 113223.8508, "train_tokens_per_second": 29181.361 }, { "epoch": 0.41149296671657004, "grad_norm": 1.390625, "learning_rate": 3.3997875879070546e-05, "loss": 1.1169405937194825, "num_input_tokens_seen": 3306898304, "step": 11630, "train_runtime": 113321.0037, "train_tokens_per_second": 29181.689 }, { "epoch": 0.41184678698029886, "grad_norm": 1.375, "learning_rate": 3.399001927649318e-05, "loss": 1.113192653656006, "num_input_tokens_seen": 3309742208, "step": 11640, "train_runtime": 113420.4835, "train_tokens_per_second": 29181.168 }, { "epoch": 0.41220060724402763, "grad_norm": 1.4140625, "learning_rate": 3.398216811816968e-05, "loss": 1.1123380661010742, "num_input_tokens_seen": 3312578688, "step": 11650, "train_runtime": 113516.7655, "train_tokens_per_second": 29181.405 }, { "epoch": 0.4125544275077564, "grad_norm": 1.4453125, "learning_rate": 3.397432239781527e-05, "loss": 1.10406494140625, "num_input_tokens_seen": 3315393024, "step": 11660, "train_runtime": 113613.3214, "train_tokens_per_second": 29181.376 }, { "epoch": 0.41290824777148516, "grad_norm": 1.3828125, "learning_rate": 3.396648210915531e-05, "loss": 1.1108510971069336, "num_input_tokens_seen": 3318191872, "step": 11670, "train_runtime": 113711.055, "train_tokens_per_second": 29180.908 }, { "epoch": 0.413262068035214, "grad_norm": 1.4140625, "learning_rate": 3.3958647245925315e-05, "loss": 1.1249521255493165, "num_input_tokens_seen": 3321021888, "step": 11680, "train_runtime": 113809.5832, "train_tokens_per_second": 29180.512 }, { "epoch": 0.41361588829894275, "grad_norm": 1.3984375, "learning_rate": 3.3950817801870885e-05, "loss": 1.1151761054992675, "num_input_tokens_seen": 3323904960, "step": 11690, "train_runtime": 113911.4632, "train_tokens_per_second": 29179.723 }, { "epoch": 0.4139697085626715, "grad_norm": 1.421875, "learning_rate": 3.3942993770747735e-05, "loss": 1.1033821105957031, "num_input_tokens_seen": 3326796480, "step": 11700, "train_runtime": 114009.9968, "train_tokens_per_second": 29179.866 }, { "epoch": 0.4143235288264003, "grad_norm": 1.390625, "learning_rate": 3.3935175146321626e-05, "loss": 1.1209312438964845, "num_input_tokens_seen": 3329629056, "step": 11710, "train_runtime": 114106.7787, "train_tokens_per_second": 29179.941 }, { "epoch": 0.4146773490901291, "grad_norm": 1.4453125, "learning_rate": 3.392736192236839e-05, "loss": 1.1134897232055665, "num_input_tokens_seen": 3332476864, "step": 11720, "train_runtime": 114202.394, "train_tokens_per_second": 29180.447 }, { "epoch": 0.41503116935385787, "grad_norm": 1.421875, "learning_rate": 3.391955409267387e-05, "loss": 1.0991153717041016, "num_input_tokens_seen": 3335266304, "step": 11730, "train_runtime": 114295.592, "train_tokens_per_second": 29181.058 }, { "epoch": 0.41538498961758663, "grad_norm": 1.359375, "learning_rate": 3.3911751651033896e-05, "loss": 1.1115594863891602, "num_input_tokens_seen": 3338176256, "step": 11740, "train_runtime": 114398.5276, "train_tokens_per_second": 29180.238 }, { "epoch": 0.4157388098813154, "grad_norm": 1.4375, "learning_rate": 3.3903954591254334e-05, "loss": 1.1000202178955079, "num_input_tokens_seen": 3341021696, "step": 11750, "train_runtime": 114496.1818, "train_tokens_per_second": 29180.202 }, { "epoch": 0.4160926301450442, "grad_norm": 1.4453125, "learning_rate": 3.389616290715097e-05, "loss": 1.1059999465942383, "num_input_tokens_seen": 3343843200, "step": 11760, "train_runtime": 114593.8566, "train_tokens_per_second": 29179.952 }, { "epoch": 0.416446450408773, "grad_norm": 1.40625, "learning_rate": 3.388837659254955e-05, "loss": 1.1151594161987304, "num_input_tokens_seen": 3346653568, "step": 11770, "train_runtime": 114688.3758, "train_tokens_per_second": 29180.408 }, { "epoch": 0.41680027067250175, "grad_norm": 1.4296875, "learning_rate": 3.3880595641285746e-05, "loss": 1.1014064788818358, "num_input_tokens_seen": 3349494080, "step": 11780, "train_runtime": 114784.602, "train_tokens_per_second": 29180.692 }, { "epoch": 0.4171540909362305, "grad_norm": 1.40625, "learning_rate": 3.387282004720513e-05, "loss": 1.1034460067749023, "num_input_tokens_seen": 3352347968, "step": 11790, "train_runtime": 114882.7868, "train_tokens_per_second": 29180.594 }, { "epoch": 0.41750791119995934, "grad_norm": 1.3984375, "learning_rate": 3.386504980416316e-05, "loss": 1.1088354110717773, "num_input_tokens_seen": 3355214848, "step": 11800, "train_runtime": 114980.2265, "train_tokens_per_second": 29180.799 }, { "epoch": 0.4178617314636881, "grad_norm": 1.3671875, "learning_rate": 3.385728490602515e-05, "loss": 1.100706195831299, "num_input_tokens_seen": 3358055872, "step": 11810, "train_runtime": 115076.5158, "train_tokens_per_second": 29181.07 }, { "epoch": 0.41821555172741687, "grad_norm": 1.3984375, "learning_rate": 3.384952534666625e-05, "loss": 1.0944582939147949, "num_input_tokens_seen": 3360913728, "step": 11820, "train_runtime": 115174.112, "train_tokens_per_second": 29181.156 }, { "epoch": 0.41856937199114563, "grad_norm": 1.4609375, "learning_rate": 3.3841771119971455e-05, "loss": 1.111971092224121, "num_input_tokens_seen": 3363813568, "step": 11830, "train_runtime": 115276.4956, "train_tokens_per_second": 29180.394 }, { "epoch": 0.41892319225487445, "grad_norm": 1.4296875, "learning_rate": 3.383402221983554e-05, "loss": 1.1079582214355468, "num_input_tokens_seen": 3366657472, "step": 11840, "train_runtime": 115376.0608, "train_tokens_per_second": 29179.861 }, { "epoch": 0.4192770125186032, "grad_norm": 1.4375, "learning_rate": 3.3826278640163064e-05, "loss": 1.106375026702881, "num_input_tokens_seen": 3369497024, "step": 11850, "train_runtime": 115473.2668, "train_tokens_per_second": 29179.888 }, { "epoch": 0.419630832782332, "grad_norm": 1.484375, "learning_rate": 3.3818540374868354e-05, "loss": 1.093511199951172, "num_input_tokens_seen": 3372334208, "step": 11860, "train_runtime": 115569.4025, "train_tokens_per_second": 29180.165 }, { "epoch": 0.41998465304606075, "grad_norm": 1.4140625, "learning_rate": 3.381080741787547e-05, "loss": 1.119515323638916, "num_input_tokens_seen": 3375107712, "step": 11870, "train_runtime": 115662.963, "train_tokens_per_second": 29180.54 }, { "epoch": 0.4203384733097895, "grad_norm": 1.40625, "learning_rate": 3.38030797631182e-05, "loss": 1.1166337966918944, "num_input_tokens_seen": 3377940096, "step": 11880, "train_runtime": 115758.0986, "train_tokens_per_second": 29181.026 }, { "epoch": 0.42069229357351834, "grad_norm": 1.453125, "learning_rate": 3.379535740454003e-05, "loss": 1.0954187393188477, "num_input_tokens_seen": 3380774976, "step": 11890, "train_runtime": 115855.3595, "train_tokens_per_second": 29180.998 }, { "epoch": 0.4210461138372471, "grad_norm": 1.3984375, "learning_rate": 3.3787640336094126e-05, "loss": 1.1123652458190918, "num_input_tokens_seen": 3383618432, "step": 11900, "train_runtime": 115955.4603, "train_tokens_per_second": 29180.329 }, { "epoch": 0.42139993410097587, "grad_norm": 1.5, "learning_rate": 3.3779928551743325e-05, "loss": 1.0995706558227538, "num_input_tokens_seen": 3386487296, "step": 11910, "train_runtime": 116054.4774, "train_tokens_per_second": 29180.152 }, { "epoch": 0.42175375436470464, "grad_norm": 1.40625, "learning_rate": 3.3772222045460084e-05, "loss": 1.106417465209961, "num_input_tokens_seen": 3389325760, "step": 11920, "train_runtime": 116152.1057, "train_tokens_per_second": 29180.063 }, { "epoch": 0.42210757462843346, "grad_norm": 1.40625, "learning_rate": 3.37645208112265e-05, "loss": 1.1005504608154297, "num_input_tokens_seen": 3392209920, "step": 11930, "train_runtime": 116253.6662, "train_tokens_per_second": 29179.38 }, { "epoch": 0.4224613948921622, "grad_norm": 1.421875, "learning_rate": 3.3756824843034255e-05, "loss": 1.1013697624206542, "num_input_tokens_seen": 3395060672, "step": 11940, "train_runtime": 116349.4207, "train_tokens_per_second": 29179.867 }, { "epoch": 0.422815215155891, "grad_norm": 1.5390625, "learning_rate": 3.374913413488464e-05, "loss": 1.0898906707763671, "num_input_tokens_seen": 3397972864, "step": 11950, "train_runtime": 116451.2907, "train_tokens_per_second": 29179.349 }, { "epoch": 0.42316903541961975, "grad_norm": 1.453125, "learning_rate": 3.374144868078848e-05, "loss": 1.1230120658874512, "num_input_tokens_seen": 3400848320, "step": 11960, "train_runtime": 116552.5891, "train_tokens_per_second": 29178.66 }, { "epoch": 0.4235228556833486, "grad_norm": 1.421875, "learning_rate": 3.373376847476615e-05, "loss": 1.1154045104980468, "num_input_tokens_seen": 3403706240, "step": 11970, "train_runtime": 116652.2168, "train_tokens_per_second": 29178.239 }, { "epoch": 0.42387667594707734, "grad_norm": 1.375, "learning_rate": 3.3726093510847566e-05, "loss": 1.108010196685791, "num_input_tokens_seen": 3406595200, "step": 11980, "train_runtime": 116750.1437, "train_tokens_per_second": 29178.51 }, { "epoch": 0.4242304962108061, "grad_norm": 1.4453125, "learning_rate": 3.371842378307212e-05, "loss": 1.1087597846984862, "num_input_tokens_seen": 3409425088, "step": 11990, "train_runtime": 116845.3764, "train_tokens_per_second": 29178.947 }, { "epoch": 0.4245843164745349, "grad_norm": 1.375, "learning_rate": 3.371075928548872e-05, "loss": 1.1004678726196289, "num_input_tokens_seen": 3412251712, "step": 12000, "train_runtime": 116940.6255, "train_tokens_per_second": 29179.352 }, { "epoch": 0.4249381367382637, "grad_norm": 1.40625, "learning_rate": 3.37031000121557e-05, "loss": 1.1028223037719727, "num_input_tokens_seen": 3415124224, "step": 12010, "train_runtime": 117040.982, "train_tokens_per_second": 29178.875 }, { "epoch": 0.42529195700199246, "grad_norm": 1.34375, "learning_rate": 3.369544595714088e-05, "loss": 1.1159469604492187, "num_input_tokens_seen": 3417996992, "step": 12020, "train_runtime": 117138.9986, "train_tokens_per_second": 29178.984 }, { "epoch": 0.4256457772657212, "grad_norm": 1.5, "learning_rate": 3.368779711452148e-05, "loss": 1.1111854553222655, "num_input_tokens_seen": 3420820992, "step": 12030, "train_runtime": 117236.6156, "train_tokens_per_second": 29178.776 }, { "epoch": 0.42599959752945, "grad_norm": 1.4453125, "learning_rate": 3.368015347838413e-05, "loss": 1.107831859588623, "num_input_tokens_seen": 3423679168, "step": 12040, "train_runtime": 117333.9721, "train_tokens_per_second": 29178.925 }, { "epoch": 0.4263534177931788, "grad_norm": 1.515625, "learning_rate": 3.3672515042824855e-05, "loss": 1.1108792304992676, "num_input_tokens_seen": 3426460544, "step": 12050, "train_runtime": 117427.5155, "train_tokens_per_second": 29179.367 }, { "epoch": 0.4267072380569076, "grad_norm": 1.390625, "learning_rate": 3.366488180194904e-05, "loss": 1.1164531707763672, "num_input_tokens_seen": 3429307456, "step": 12060, "train_runtime": 117527.3214, "train_tokens_per_second": 29178.811 }, { "epoch": 0.42706105832063634, "grad_norm": 1.453125, "learning_rate": 3.365725374987143e-05, "loss": 1.1068065643310547, "num_input_tokens_seen": 3432160064, "step": 12070, "train_runtime": 117626.5912, "train_tokens_per_second": 29178.437 }, { "epoch": 0.4274148785843651, "grad_norm": 1.3828125, "learning_rate": 3.36496308807161e-05, "loss": 1.1161949157714843, "num_input_tokens_seen": 3434977472, "step": 12080, "train_runtime": 117723.264, "train_tokens_per_second": 29178.408 }, { "epoch": 0.42776869884809393, "grad_norm": 1.421875, "learning_rate": 3.3642013188616426e-05, "loss": 1.096306324005127, "num_input_tokens_seen": 3437811840, "step": 12090, "train_runtime": 117819.2614, "train_tokens_per_second": 29178.691 }, { "epoch": 0.4281225191118227, "grad_norm": 1.4921875, "learning_rate": 3.3634400667715074e-05, "loss": 1.1094569206237792, "num_input_tokens_seen": 3440651072, "step": 12100, "train_runtime": 117915.9225, "train_tokens_per_second": 29178.85 }, { "epoch": 0.42847633937555146, "grad_norm": 1.484375, "learning_rate": 3.3626793312164013e-05, "loss": 1.1037714958190918, "num_input_tokens_seen": 3443467200, "step": 12110, "train_runtime": 118012.8431, "train_tokens_per_second": 29178.75 }, { "epoch": 0.42883015963928023, "grad_norm": 1.453125, "learning_rate": 3.361919111612443e-05, "loss": 1.1099245071411132, "num_input_tokens_seen": 3446304064, "step": 12120, "train_runtime": 118111.6404, "train_tokens_per_second": 29178.361 }, { "epoch": 0.429183979903009, "grad_norm": 1.4375, "learning_rate": 3.361159407376678e-05, "loss": 1.1102795600891113, "num_input_tokens_seen": 3449141056, "step": 12130, "train_runtime": 118208.4289, "train_tokens_per_second": 29178.47 }, { "epoch": 0.4295378001667378, "grad_norm": 1.390625, "learning_rate": 3.3604002179270685e-05, "loss": 1.1166166305541991, "num_input_tokens_seen": 3451978496, "step": 12140, "train_runtime": 118305.8349, "train_tokens_per_second": 29178.43 }, { "epoch": 0.4298916204304666, "grad_norm": 1.421875, "learning_rate": 3.359641542682504e-05, "loss": 1.1043574333190918, "num_input_tokens_seen": 3454860928, "step": 12150, "train_runtime": 118404.6085, "train_tokens_per_second": 29178.433 }, { "epoch": 0.43024544069419535, "grad_norm": 1.5234375, "learning_rate": 3.3588833810627854e-05, "loss": 1.1016742706298828, "num_input_tokens_seen": 3457707904, "step": 12160, "train_runtime": 118500.8332, "train_tokens_per_second": 29178.764 }, { "epoch": 0.4305992609579241, "grad_norm": 1.40625, "learning_rate": 3.358125732488632e-05, "loss": 1.121287727355957, "num_input_tokens_seen": 3460558272, "step": 12170, "train_runtime": 118595.6527, "train_tokens_per_second": 29179.47 }, { "epoch": 0.43095308122165293, "grad_norm": 1.390625, "learning_rate": 3.357368596381679e-05, "loss": 1.1062000274658204, "num_input_tokens_seen": 3463387392, "step": 12180, "train_runtime": 118693.8105, "train_tokens_per_second": 29179.174 }, { "epoch": 0.4313069014853817, "grad_norm": 1.375, "learning_rate": 3.356611972164471e-05, "loss": 1.1084465026855468, "num_input_tokens_seen": 3466219328, "step": 12190, "train_runtime": 118787.3174, "train_tokens_per_second": 29180.046 }, { "epoch": 0.43166072174911047, "grad_norm": 1.453125, "learning_rate": 3.355855859260466e-05, "loss": 1.1182991981506347, "num_input_tokens_seen": 3469031360, "step": 12200, "train_runtime": 118880.7301, "train_tokens_per_second": 29180.771 }, { "epoch": 0.43201454201283923, "grad_norm": 1.4375, "learning_rate": 3.3551002570940285e-05, "loss": 1.116539764404297, "num_input_tokens_seen": 3471901376, "step": 12210, "train_runtime": 118980.6469, "train_tokens_per_second": 29180.387 }, { "epoch": 0.43236836227656805, "grad_norm": 1.4375, "learning_rate": 3.354345165090431e-05, "loss": 1.104250144958496, "num_input_tokens_seen": 3474786368, "step": 12220, "train_runtime": 119080.1139, "train_tokens_per_second": 29180.241 }, { "epoch": 0.4327221825402968, "grad_norm": 1.359375, "learning_rate": 3.3535905826758515e-05, "loss": 1.111336612701416, "num_input_tokens_seen": 3477614976, "step": 12230, "train_runtime": 119173.9197, "train_tokens_per_second": 29181.007 }, { "epoch": 0.4330760028040256, "grad_norm": 1.390625, "learning_rate": 3.352836509277369e-05, "loss": 1.1017717361450194, "num_input_tokens_seen": 3480460416, "step": 12240, "train_runtime": 119271.689, "train_tokens_per_second": 29180.943 }, { "epoch": 0.43342982306775435, "grad_norm": 1.4765625, "learning_rate": 3.352082944322966e-05, "loss": 1.116755485534668, "num_input_tokens_seen": 3483293248, "step": 12250, "train_runtime": 119369.2244, "train_tokens_per_second": 29180.832 }, { "epoch": 0.43378364333148317, "grad_norm": 1.453125, "learning_rate": 3.351329887241524e-05, "loss": 1.1216218948364258, "num_input_tokens_seen": 3486146176, "step": 12260, "train_runtime": 119466.2761, "train_tokens_per_second": 29181.006 }, { "epoch": 0.43413746359521194, "grad_norm": 1.453125, "learning_rate": 3.3505773374628225e-05, "loss": 1.1049503326416015, "num_input_tokens_seen": 3488975744, "step": 12270, "train_runtime": 119564.6136, "train_tokens_per_second": 29180.672 }, { "epoch": 0.4344912838589407, "grad_norm": 1.59375, "learning_rate": 3.3498252944175354e-05, "loss": 1.1079347610473633, "num_input_tokens_seen": 3491848384, "step": 12280, "train_runtime": 119665.4068, "train_tokens_per_second": 29180.099 }, { "epoch": 0.43484510412266947, "grad_norm": 1.40625, "learning_rate": 3.3490737575372326e-05, "loss": 1.1060548782348634, "num_input_tokens_seen": 3494671616, "step": 12290, "train_runtime": 119759.7638, "train_tokens_per_second": 29180.682 }, { "epoch": 0.4351989243863983, "grad_norm": 1.4765625, "learning_rate": 3.348322726254375e-05, "loss": 1.0926141738891602, "num_input_tokens_seen": 3497450944, "step": 12300, "train_runtime": 119853.4357, "train_tokens_per_second": 29181.065 }, { "epoch": 0.43555274465012705, "grad_norm": 1.4765625, "learning_rate": 3.347572200002315e-05, "loss": 1.103368091583252, "num_input_tokens_seen": 3500264704, "step": 12310, "train_runtime": 119950.3479, "train_tokens_per_second": 29180.947 }, { "epoch": 0.4359065649138558, "grad_norm": 1.421875, "learning_rate": 3.3468221782152924e-05, "loss": 1.1038829803466796, "num_input_tokens_seen": 3503073856, "step": 12320, "train_runtime": 120045.978, "train_tokens_per_second": 29181.101 }, { "epoch": 0.4362603851775846, "grad_norm": 1.4921875, "learning_rate": 3.346072660328435e-05, "loss": 1.1046785354614257, "num_input_tokens_seen": 3505961728, "step": 12330, "train_runtime": 120145.5582, "train_tokens_per_second": 29180.952 }, { "epoch": 0.4366142054413134, "grad_norm": 1.4140625, "learning_rate": 3.345323645777756e-05, "loss": 1.0987144470214845, "num_input_tokens_seen": 3508781760, "step": 12340, "train_runtime": 120240.3128, "train_tokens_per_second": 29181.409 }, { "epoch": 0.4369680257050422, "grad_norm": 1.4375, "learning_rate": 3.34457513400015e-05, "loss": 1.1068971633911133, "num_input_tokens_seen": 3511625344, "step": 12350, "train_runtime": 120336.6888, "train_tokens_per_second": 29181.668 }, { "epoch": 0.43732184596877094, "grad_norm": 1.4140625, "learning_rate": 3.343827124433396e-05, "loss": 1.1072772979736327, "num_input_tokens_seen": 3514470144, "step": 12360, "train_runtime": 120433.2515, "train_tokens_per_second": 29181.892 }, { "epoch": 0.4376756662324997, "grad_norm": 1.453125, "learning_rate": 3.343079616516151e-05, "loss": 1.1110486030578612, "num_input_tokens_seen": 3517244992, "step": 12370, "train_runtime": 120527.002, "train_tokens_per_second": 29182.216 }, { "epoch": 0.43802948649622847, "grad_norm": 1.3984375, "learning_rate": 3.3423326096879495e-05, "loss": 1.1143271446228027, "num_input_tokens_seen": 3520055808, "step": 12380, "train_runtime": 120623.1121, "train_tokens_per_second": 29182.267 }, { "epoch": 0.4383833067599573, "grad_norm": 1.5625, "learning_rate": 3.341586103389203e-05, "loss": 1.1165136337280273, "num_input_tokens_seen": 3522888384, "step": 12390, "train_runtime": 120719.4697, "train_tokens_per_second": 29182.438 }, { "epoch": 0.43873712702368606, "grad_norm": 1.4921875, "learning_rate": 3.3408400970611995e-05, "loss": 1.097696876525879, "num_input_tokens_seen": 3525718848, "step": 12400, "train_runtime": 120816.8061, "train_tokens_per_second": 29182.354 }, { "epoch": 0.4390909472874148, "grad_norm": 1.46875, "learning_rate": 3.340094590146095e-05, "loss": 1.112516212463379, "num_input_tokens_seen": 3528588416, "step": 12410, "train_runtime": 120913.7276, "train_tokens_per_second": 29182.695 }, { "epoch": 0.4394447675511436, "grad_norm": 1.4375, "learning_rate": 3.3393495820869215e-05, "loss": 1.1050718307495118, "num_input_tokens_seen": 3531412928, "step": 12420, "train_runtime": 121012.495, "train_tokens_per_second": 29182.217 }, { "epoch": 0.4397985878148724, "grad_norm": 1.453125, "learning_rate": 3.338605072327576e-05, "loss": 1.0926527023315429, "num_input_tokens_seen": 3534187904, "step": 12430, "train_runtime": 121106.9302, "train_tokens_per_second": 29182.375 }, { "epoch": 0.4401524080786012, "grad_norm": 1.4375, "learning_rate": 3.337861060312827e-05, "loss": 1.1018476486206055, "num_input_tokens_seen": 3537046400, "step": 12440, "train_runtime": 121202.5157, "train_tokens_per_second": 29182.945 }, { "epoch": 0.44050622834232994, "grad_norm": 1.46875, "learning_rate": 3.337117545488306e-05, "loss": 1.0933261871337892, "num_input_tokens_seen": 3539862400, "step": 12450, "train_runtime": 121299.602, "train_tokens_per_second": 29182.803 }, { "epoch": 0.4408600486060587, "grad_norm": 1.484375, "learning_rate": 3.33637452730051e-05, "loss": 1.1149778366088867, "num_input_tokens_seen": 3542731776, "step": 12460, "train_runtime": 121398.7915, "train_tokens_per_second": 29182.595 }, { "epoch": 0.44121386886978753, "grad_norm": 1.4140625, "learning_rate": 3.335632005196796e-05, "loss": 1.1093759536743164, "num_input_tokens_seen": 3545568832, "step": 12470, "train_runtime": 121496.1293, "train_tokens_per_second": 29182.566 }, { "epoch": 0.4415676891335163, "grad_norm": 1.453125, "learning_rate": 3.334889978625383e-05, "loss": 1.1053879737854004, "num_input_tokens_seen": 3548391872, "step": 12480, "train_runtime": 121591.375, "train_tokens_per_second": 29182.924 }, { "epoch": 0.44192150939724506, "grad_norm": 1.4296875, "learning_rate": 3.3341484470353515e-05, "loss": 1.1148277282714845, "num_input_tokens_seen": 3551287488, "step": 12490, "train_runtime": 121694.1541, "train_tokens_per_second": 29182.071 }, { "epoch": 0.4422753296609738, "grad_norm": 1.40625, "learning_rate": 3.333407409876635e-05, "loss": 1.1003576278686524, "num_input_tokens_seen": 3554146688, "step": 12500, "train_runtime": 121791.0818, "train_tokens_per_second": 29182.323 }, { "epoch": 0.44262914992470265, "grad_norm": 1.421875, "learning_rate": 3.332666866600024e-05, "loss": 1.0955620765686036, "num_input_tokens_seen": 3556976192, "step": 12510, "train_runtime": 121890.3274, "train_tokens_per_second": 29181.776 }, { "epoch": 0.4429829701884314, "grad_norm": 1.421875, "learning_rate": 3.331926816657162e-05, "loss": 1.1010419845581054, "num_input_tokens_seen": 3559771392, "step": 12520, "train_runtime": 121984.1789, "train_tokens_per_second": 29182.238 }, { "epoch": 0.4433367904521602, "grad_norm": 1.53125, "learning_rate": 3.331187259500546e-05, "loss": 1.1269894599914552, "num_input_tokens_seen": 3562673984, "step": 12530, "train_runtime": 122086.2689, "train_tokens_per_second": 29181.611 }, { "epoch": 0.44369061071588894, "grad_norm": 1.390625, "learning_rate": 3.3304481945835235e-05, "loss": 1.1217117309570312, "num_input_tokens_seen": 3565495808, "step": 12540, "train_runtime": 122181.82, "train_tokens_per_second": 29181.885 }, { "epoch": 0.44404443097961777, "grad_norm": 1.5546875, "learning_rate": 3.329709621360288e-05, "loss": 1.1079509735107422, "num_input_tokens_seen": 3568296192, "step": 12550, "train_runtime": 122274.8907, "train_tokens_per_second": 29182.575 }, { "epoch": 0.44439825124334653, "grad_norm": 1.515625, "learning_rate": 3.328971539285882e-05, "loss": 1.104273223876953, "num_input_tokens_seen": 3571137408, "step": 12560, "train_runtime": 122372.7173, "train_tokens_per_second": 29182.464 }, { "epoch": 0.4447520715070753, "grad_norm": 1.3828125, "learning_rate": 3.3282339478161935e-05, "loss": 1.0957395553588867, "num_input_tokens_seen": 3573937216, "step": 12570, "train_runtime": 122465.9734, "train_tokens_per_second": 29183.104 }, { "epoch": 0.44510589177080406, "grad_norm": 1.421875, "learning_rate": 3.327496846407953e-05, "loss": 1.1060129165649415, "num_input_tokens_seen": 3576755136, "step": 12580, "train_runtime": 122559.9881, "train_tokens_per_second": 29183.71 }, { "epoch": 0.4454597120345329, "grad_norm": 1.421875, "learning_rate": 3.3267602345187304e-05, "loss": 1.110853385925293, "num_input_tokens_seen": 3579593728, "step": 12590, "train_runtime": 122655.6954, "train_tokens_per_second": 29184.081 }, { "epoch": 0.44581353229826165, "grad_norm": 1.3984375, "learning_rate": 3.326024111606942e-05, "loss": 1.0923341751098632, "num_input_tokens_seen": 3582422016, "step": 12600, "train_runtime": 122751.342, "train_tokens_per_second": 29184.382 }, { "epoch": 0.4461673525619904, "grad_norm": 1.40625, "learning_rate": 3.325288477131839e-05, "loss": 1.1202333450317383, "num_input_tokens_seen": 3585311552, "step": 12610, "train_runtime": 122851.3861, "train_tokens_per_second": 29184.136 }, { "epoch": 0.4465211728257192, "grad_norm": 1.4140625, "learning_rate": 3.324553330553507e-05, "loss": 1.0907839775085448, "num_input_tokens_seen": 3588124352, "step": 12620, "train_runtime": 122945.8911, "train_tokens_per_second": 29184.581 }, { "epoch": 0.44687499308944795, "grad_norm": 1.484375, "learning_rate": 3.323818671332871e-05, "loss": 1.0993354797363282, "num_input_tokens_seen": 3590967936, "step": 12630, "train_runtime": 123043.7959, "train_tokens_per_second": 29184.47 }, { "epoch": 0.44722881335317677, "grad_norm": 1.4609375, "learning_rate": 3.323084498931687e-05, "loss": 1.1179710388183595, "num_input_tokens_seen": 3593794752, "step": 12640, "train_runtime": 123139.9277, "train_tokens_per_second": 29184.642 }, { "epoch": 0.44758263361690553, "grad_norm": 1.4765625, "learning_rate": 3.322350812812545e-05, "loss": 1.118307113647461, "num_input_tokens_seen": 3596652736, "step": 12650, "train_runtime": 123238.6684, "train_tokens_per_second": 29184.45 }, { "epoch": 0.4479364538806343, "grad_norm": 1.421875, "learning_rate": 3.321617612438862e-05, "loss": 1.0977344512939453, "num_input_tokens_seen": 3599468672, "step": 12660, "train_runtime": 123334.8485, "train_tokens_per_second": 29184.523 }, { "epoch": 0.44829027414436307, "grad_norm": 1.4453125, "learning_rate": 3.320884897274886e-05, "loss": 1.1174657821655274, "num_input_tokens_seen": 3602314176, "step": 12670, "train_runtime": 123432.5231, "train_tokens_per_second": 29184.481 }, { "epoch": 0.4486440944080919, "grad_norm": 1.4453125, "learning_rate": 3.320152666785692e-05, "loss": 1.1217931747436523, "num_input_tokens_seen": 3605160320, "step": 12680, "train_runtime": 123527.7602, "train_tokens_per_second": 29185.021 }, { "epoch": 0.44899791467182065, "grad_norm": 1.4296875, "learning_rate": 3.319420920437179e-05, "loss": 1.0929196357727051, "num_input_tokens_seen": 3608000448, "step": 12690, "train_runtime": 123624.1875, "train_tokens_per_second": 29185.231 }, { "epoch": 0.4493517349355494, "grad_norm": 1.453125, "learning_rate": 3.31868965769607e-05, "loss": 1.1016122817993164, "num_input_tokens_seen": 3610869056, "step": 12700, "train_runtime": 123723.7021, "train_tokens_per_second": 29184.942 }, { "epoch": 0.4497055551992782, "grad_norm": 1.3828125, "learning_rate": 3.317958878029911e-05, "loss": 1.1059175491333009, "num_input_tokens_seen": 3613746304, "step": 12710, "train_runtime": 123822.6971, "train_tokens_per_second": 29184.846 }, { "epoch": 0.450059375463007, "grad_norm": 1.40625, "learning_rate": 3.3172285809070665e-05, "loss": 1.0970277786254883, "num_input_tokens_seen": 3616641600, "step": 12720, "train_runtime": 123921.8178, "train_tokens_per_second": 29184.866 }, { "epoch": 0.45041319572673577, "grad_norm": 1.421875, "learning_rate": 3.3164987657967214e-05, "loss": 1.1279159545898438, "num_input_tokens_seen": 3619544960, "step": 12730, "train_runtime": 124024.9816, "train_tokens_per_second": 29183.999 }, { "epoch": 0.45076701599046454, "grad_norm": 1.453125, "learning_rate": 3.315769432168877e-05, "loss": 1.1084771156311035, "num_input_tokens_seen": 3622380864, "step": 12740, "train_runtime": 124120.043, "train_tokens_per_second": 29184.496 }, { "epoch": 0.4511208362541933, "grad_norm": 1.4375, "learning_rate": 3.315040579494349e-05, "loss": 1.1145353317260742, "num_input_tokens_seen": 3625226368, "step": 12750, "train_runtime": 124217.7388, "train_tokens_per_second": 29184.45 }, { "epoch": 0.4514746565179221, "grad_norm": 1.4453125, "learning_rate": 3.31431220724477e-05, "loss": 1.1009464263916016, "num_input_tokens_seen": 3628066688, "step": 12760, "train_runtime": 124312.7124, "train_tokens_per_second": 29185.001 }, { "epoch": 0.4518284767816509, "grad_norm": 1.421875, "learning_rate": 3.3135843148925834e-05, "loss": 1.1143318176269532, "num_input_tokens_seen": 3630867584, "step": 12770, "train_runtime": 124405.4721, "train_tokens_per_second": 29185.755 }, { "epoch": 0.45218229704537966, "grad_norm": 1.421875, "learning_rate": 3.3128569019110414e-05, "loss": 1.1067062377929688, "num_input_tokens_seen": 3633722176, "step": 12780, "train_runtime": 124504.1755, "train_tokens_per_second": 29185.545 }, { "epoch": 0.4525361173091084, "grad_norm": 1.3671875, "learning_rate": 3.312129967774207e-05, "loss": 1.100377655029297, "num_input_tokens_seen": 3636590208, "step": 12790, "train_runtime": 124604.4635, "train_tokens_per_second": 29185.072 }, { "epoch": 0.45288993757283724, "grad_norm": 1.4296875, "learning_rate": 3.311403511956952e-05, "loss": 1.0981801986694335, "num_input_tokens_seen": 3639380736, "step": 12800, "train_runtime": 124698.4002, "train_tokens_per_second": 29185.465 }, { "epoch": 0.453243757836566, "grad_norm": 1.4375, "learning_rate": 3.310677533934952e-05, "loss": 1.1047271728515624, "num_input_tokens_seen": 3642170816, "step": 12810, "train_runtime": 124793.4465, "train_tokens_per_second": 29185.594 }, { "epoch": 0.4535975781002948, "grad_norm": 1.453125, "learning_rate": 3.309952033184686e-05, "loss": 1.0958417892456054, "num_input_tokens_seen": 3644998592, "step": 12820, "train_runtime": 124888.3737, "train_tokens_per_second": 29186.052 }, { "epoch": 0.45395139836402354, "grad_norm": 1.3671875, "learning_rate": 3.309227009183439e-05, "loss": 1.0978492736816405, "num_input_tokens_seen": 3647778752, "step": 12830, "train_runtime": 124981.2006, "train_tokens_per_second": 29186.62 }, { "epoch": 0.45430521862775236, "grad_norm": 1.390625, "learning_rate": 3.308502461409295e-05, "loss": 1.1000548362731934, "num_input_tokens_seen": 3650677312, "step": 12840, "train_runtime": 125080.1836, "train_tokens_per_second": 29186.696 }, { "epoch": 0.4546590388914811, "grad_norm": 1.390625, "learning_rate": 3.3077783893411386e-05, "loss": 1.1006376266479492, "num_input_tokens_seen": 3653550912, "step": 12850, "train_runtime": 125180.1601, "train_tokens_per_second": 29186.342 }, { "epoch": 0.4550128591552099, "grad_norm": 1.390625, "learning_rate": 3.30705479245865e-05, "loss": 1.0956745147705078, "num_input_tokens_seen": 3656410176, "step": 12860, "train_runtime": 125278.1578, "train_tokens_per_second": 29186.334 }, { "epoch": 0.45536667941893866, "grad_norm": 1.40625, "learning_rate": 3.3063316702423094e-05, "loss": 1.10784969329834, "num_input_tokens_seen": 3659304768, "step": 12870, "train_runtime": 125379.2257, "train_tokens_per_second": 29185.894 }, { "epoch": 0.4557204996826674, "grad_norm": 1.3984375, "learning_rate": 3.305609022173388e-05, "loss": 1.1130596160888673, "num_input_tokens_seen": 3662148672, "step": 12880, "train_runtime": 125475.826, "train_tokens_per_second": 29186.089 }, { "epoch": 0.45607431994639624, "grad_norm": 1.4140625, "learning_rate": 3.304886847733954e-05, "loss": 1.1128378868103028, "num_input_tokens_seen": 3665006976, "step": 12890, "train_runtime": 125573.8038, "train_tokens_per_second": 29186.079 }, { "epoch": 0.456428140210125, "grad_norm": 1.3984375, "learning_rate": 3.304165146406865e-05, "loss": 1.0901856422424316, "num_input_tokens_seen": 3667843008, "step": 12900, "train_runtime": 125671.5831, "train_tokens_per_second": 29185.938 }, { "epoch": 0.4567819604738538, "grad_norm": 1.453125, "learning_rate": 3.30344391767577e-05, "loss": 1.1052507400512694, "num_input_tokens_seen": 3670698688, "step": 12910, "train_runtime": 125770.1597, "train_tokens_per_second": 29185.768 }, { "epoch": 0.45713578073758254, "grad_norm": 1.390625, "learning_rate": 3.302723161025104e-05, "loss": 1.1128118515014649, "num_input_tokens_seen": 3673513344, "step": 12920, "train_runtime": 125863.9831, "train_tokens_per_second": 29186.374 }, { "epoch": 0.45748960100131136, "grad_norm": 1.3828125, "learning_rate": 3.302002875940093e-05, "loss": 1.0914009094238282, "num_input_tokens_seen": 3676334272, "step": 12930, "train_runtime": 125958.9702, "train_tokens_per_second": 29186.76 }, { "epoch": 0.45784342126504013, "grad_norm": 1.453125, "learning_rate": 3.3012830619067466e-05, "loss": 1.1091476440429688, "num_input_tokens_seen": 3679143232, "step": 12940, "train_runtime": 126054.9094, "train_tokens_per_second": 29186.83 }, { "epoch": 0.4581972415287689, "grad_norm": 1.5078125, "learning_rate": 3.300563718411857e-05, "loss": 1.1056535720825196, "num_input_tokens_seen": 3681976512, "step": 12950, "train_runtime": 126151.729, "train_tokens_per_second": 29186.889 }, { "epoch": 0.45855106179249766, "grad_norm": 1.4140625, "learning_rate": 3.299844844943e-05, "loss": 1.1109651565551757, "num_input_tokens_seen": 3684819072, "step": 12960, "train_runtime": 126249.13, "train_tokens_per_second": 29186.887 }, { "epoch": 0.4589048820562265, "grad_norm": 1.3984375, "learning_rate": 3.299126440988535e-05, "loss": 1.1065553665161132, "num_input_tokens_seen": 3687670720, "step": 12970, "train_runtime": 126347.254, "train_tokens_per_second": 29186.79 }, { "epoch": 0.45925870231995525, "grad_norm": 1.390625, "learning_rate": 3.298408506037596e-05, "loss": 1.1015348434448242, "num_input_tokens_seen": 3690532032, "step": 12980, "train_runtime": 126446.7523, "train_tokens_per_second": 29186.452 }, { "epoch": 0.459612522583684, "grad_norm": 1.4296875, "learning_rate": 3.297691039580097e-05, "loss": 1.0998037338256836, "num_input_tokens_seen": 3693374976, "step": 12990, "train_runtime": 126544.4817, "train_tokens_per_second": 29186.377 }, { "epoch": 0.4599663428474128, "grad_norm": 1.3671875, "learning_rate": 3.29697404110673e-05, "loss": 1.1078229904174806, "num_input_tokens_seen": 3696248128, "step": 13000, "train_runtime": 126644.827, "train_tokens_per_second": 29185.938 }, { "epoch": 0.4603201631111416, "grad_norm": 1.4375, "learning_rate": 3.2962575101089594e-05, "loss": 1.095658302307129, "num_input_tokens_seen": 3699071680, "step": 13010, "train_runtime": 126740.3667, "train_tokens_per_second": 29186.216 }, { "epoch": 0.46067398337487037, "grad_norm": 1.5, "learning_rate": 3.295541446079024e-05, "loss": 1.103954029083252, "num_input_tokens_seen": 3701891648, "step": 13020, "train_runtime": 126836.2823, "train_tokens_per_second": 29186.378 }, { "epoch": 0.46102780363859913, "grad_norm": 1.40625, "learning_rate": 3.2948258485099336e-05, "loss": 1.1082317352294921, "num_input_tokens_seen": 3704756032, "step": 13030, "train_runtime": 126935.4757, "train_tokens_per_second": 29186.136 }, { "epoch": 0.4613816239023279, "grad_norm": 1.4609375, "learning_rate": 3.29411071689547e-05, "loss": 1.1182458877563477, "num_input_tokens_seen": 3707661952, "step": 13040, "train_runtime": 127037.1749, "train_tokens_per_second": 29185.646 }, { "epoch": 0.4617354441660567, "grad_norm": 1.40625, "learning_rate": 3.2933960507301826e-05, "loss": 1.0974594116210938, "num_input_tokens_seen": 3710518912, "step": 13050, "train_runtime": 127136.1297, "train_tokens_per_second": 29185.401 }, { "epoch": 0.4620892644297855, "grad_norm": 1.484375, "learning_rate": 3.292681849509387e-05, "loss": 1.104828453063965, "num_input_tokens_seen": 3713319168, "step": 13060, "train_runtime": 127233.9407, "train_tokens_per_second": 29184.973 }, { "epoch": 0.46244308469351425, "grad_norm": 1.4609375, "learning_rate": 3.291968112729166e-05, "loss": 1.107470417022705, "num_input_tokens_seen": 3716157248, "step": 13070, "train_runtime": 127331.0211, "train_tokens_per_second": 29185.011 }, { "epoch": 0.462796904957243, "grad_norm": 1.4453125, "learning_rate": 3.291254839886367e-05, "loss": 1.0845415115356445, "num_input_tokens_seen": 3718953728, "step": 13080, "train_runtime": 127428.3045, "train_tokens_per_second": 29184.676 }, { "epoch": 0.46315072522097184, "grad_norm": 1.4609375, "learning_rate": 3.2905420304785995e-05, "loss": 1.1077667236328126, "num_input_tokens_seen": 3721783488, "step": 13090, "train_runtime": 127524.09, "train_tokens_per_second": 29184.944 }, { "epoch": 0.4635045454847006, "grad_norm": 1.3515625, "learning_rate": 3.289829684004235e-05, "loss": 1.1112678527832032, "num_input_tokens_seen": 3724641792, "step": 13100, "train_runtime": 127621.7913, "train_tokens_per_second": 29184.999 }, { "epoch": 0.46385836574842937, "grad_norm": 1.5078125, "learning_rate": 3.289117799962402e-05, "loss": 1.1067995071411132, "num_input_tokens_seen": 3727474368, "step": 13110, "train_runtime": 127718.4072, "train_tokens_per_second": 29185.099 }, { "epoch": 0.46421218601215813, "grad_norm": 1.390625, "learning_rate": 3.2884063778529914e-05, "loss": 1.1009221076965332, "num_input_tokens_seen": 3730300608, "step": 13120, "train_runtime": 127813.8751, "train_tokens_per_second": 29185.412 }, { "epoch": 0.4645660062758869, "grad_norm": 1.4765625, "learning_rate": 3.28769541717665e-05, "loss": 1.111198616027832, "num_input_tokens_seen": 3733139328, "step": 13130, "train_runtime": 127910.1621, "train_tokens_per_second": 29185.635 }, { "epoch": 0.4649198265396157, "grad_norm": 1.3359375, "learning_rate": 3.2869849174347775e-05, "loss": 1.0902486801147462, "num_input_tokens_seen": 3736004480, "step": 13140, "train_runtime": 128007.7307, "train_tokens_per_second": 29185.772 }, { "epoch": 0.4652736468033445, "grad_norm": 1.421875, "learning_rate": 3.2862748781295294e-05, "loss": 1.0935636520385743, "num_input_tokens_seen": 3738816960, "step": 13150, "train_runtime": 128101.2633, "train_tokens_per_second": 29186.418 }, { "epoch": 0.46562746706707325, "grad_norm": 1.4140625, "learning_rate": 3.2855652987638146e-05, "loss": 1.1180343627929688, "num_input_tokens_seen": 3741696896, "step": 13160, "train_runtime": 128202.7701, "train_tokens_per_second": 29185.773 }, { "epoch": 0.465981287330802, "grad_norm": 1.453125, "learning_rate": 3.284856178841291e-05, "loss": 1.0981327056884767, "num_input_tokens_seen": 3744501888, "step": 13170, "train_runtime": 128297.2485, "train_tokens_per_second": 29186.143 }, { "epoch": 0.46633510759453084, "grad_norm": 1.4453125, "learning_rate": 3.284147517866367e-05, "loss": 1.1091805458068849, "num_input_tokens_seen": 3747355968, "step": 13180, "train_runtime": 128396.3945, "train_tokens_per_second": 29185.835 }, { "epoch": 0.4666889278582596, "grad_norm": 1.4453125, "learning_rate": 3.2834393153441976e-05, "loss": 1.1088296890258789, "num_input_tokens_seen": 3750236160, "step": 13190, "train_runtime": 128493.5587, "train_tokens_per_second": 29186.18 }, { "epoch": 0.46704274812198837, "grad_norm": 1.421875, "learning_rate": 3.282731570780689e-05, "loss": 1.101529312133789, "num_input_tokens_seen": 3753081600, "step": 13200, "train_runtime": 128589.8262, "train_tokens_per_second": 29186.458 }, { "epoch": 0.46739656838571714, "grad_norm": 1.4453125, "learning_rate": 3.2820242836824875e-05, "loss": 1.112099838256836, "num_input_tokens_seen": 3755909056, "step": 13210, "train_runtime": 128686.5275, "train_tokens_per_second": 29186.498 }, { "epoch": 0.46775038864944596, "grad_norm": 1.4453125, "learning_rate": 3.2813174535569854e-05, "loss": 1.1053627967834472, "num_input_tokens_seen": 3758709056, "step": 13220, "train_runtime": 128783.3692, "train_tokens_per_second": 29186.292 }, { "epoch": 0.4681042089131747, "grad_norm": 1.40625, "learning_rate": 3.280611079912318e-05, "loss": 1.0999862670898437, "num_input_tokens_seen": 3761523904, "step": 13230, "train_runtime": 128878.2107, "train_tokens_per_second": 29186.655 }, { "epoch": 0.4684580291769035, "grad_norm": 1.4453125, "learning_rate": 3.279905162257358e-05, "loss": 1.1103971481323243, "num_input_tokens_seen": 3764351680, "step": 13240, "train_runtime": 128972.5885, "train_tokens_per_second": 29187.223 }, { "epoch": 0.46881184944063226, "grad_norm": 1.375, "learning_rate": 3.279199700101723e-05, "loss": 1.1121068954467774, "num_input_tokens_seen": 3767180096, "step": 13250, "train_runtime": 129067.1242, "train_tokens_per_second": 29187.759 }, { "epoch": 0.4691656697043611, "grad_norm": 1.46875, "learning_rate": 3.2784946929557644e-05, "loss": 1.0980195999145508, "num_input_tokens_seen": 3769964480, "step": 13260, "train_runtime": 129162.6615, "train_tokens_per_second": 29187.727 }, { "epoch": 0.46951948996808984, "grad_norm": 1.484375, "learning_rate": 3.277790140330571e-05, "loss": 1.1119718551635742, "num_input_tokens_seen": 3772865984, "step": 13270, "train_runtime": 129261.9751, "train_tokens_per_second": 29187.748 }, { "epoch": 0.4698733102318186, "grad_norm": 1.4296875, "learning_rate": 3.277086041737968e-05, "loss": 1.1151845932006836, "num_input_tokens_seen": 3775689600, "step": 13280, "train_runtime": 129356.0989, "train_tokens_per_second": 29188.338 }, { "epoch": 0.4702271304955474, "grad_norm": 1.5234375, "learning_rate": 3.276382396690513e-05, "loss": 1.1176087379455566, "num_input_tokens_seen": 3778486464, "step": 13290, "train_runtime": 129452.96, "train_tokens_per_second": 29188.104 }, { "epoch": 0.4705809507592762, "grad_norm": 1.453125, "learning_rate": 3.275679204701496e-05, "loss": 1.1205736160278321, "num_input_tokens_seen": 3781317632, "step": 13300, "train_runtime": 129549.2862, "train_tokens_per_second": 29188.255 }, { "epoch": 0.47093477102300496, "grad_norm": 1.4453125, "learning_rate": 3.274976465284939e-05, "loss": 1.104206657409668, "num_input_tokens_seen": 3784164480, "step": 13310, "train_runtime": 129645.5724, "train_tokens_per_second": 29188.536 }, { "epoch": 0.4712885912867337, "grad_norm": 1.421875, "learning_rate": 3.274274177955593e-05, "loss": 1.1073772430419921, "num_input_tokens_seen": 3786995392, "step": 13320, "train_runtime": 129741.2091, "train_tokens_per_second": 29188.84 }, { "epoch": 0.4716424115504625, "grad_norm": 1.53125, "learning_rate": 3.273572342228937e-05, "loss": 1.09786376953125, "num_input_tokens_seen": 3789813440, "step": 13330, "train_runtime": 129837.2074, "train_tokens_per_second": 29188.963 }, { "epoch": 0.4719962318141913, "grad_norm": 1.4296875, "learning_rate": 3.272870957621176e-05, "loss": 1.09412841796875, "num_input_tokens_seen": 3792692928, "step": 13340, "train_runtime": 129934.5841, "train_tokens_per_second": 29189.249 }, { "epoch": 0.4723500520779201, "grad_norm": 1.4921875, "learning_rate": 3.2721700236492414e-05, "loss": 1.1130117416381835, "num_input_tokens_seen": 3795596096, "step": 13350, "train_runtime": 130037.7027, "train_tokens_per_second": 29188.428 }, { "epoch": 0.47270387234164885, "grad_norm": 1.4140625, "learning_rate": 3.271469539830788e-05, "loss": 1.1061529159545898, "num_input_tokens_seen": 3798444096, "step": 13360, "train_runtime": 130137.1313, "train_tokens_per_second": 29188.012 }, { "epoch": 0.4730576926053776, "grad_norm": 1.4765625, "learning_rate": 3.270769505684193e-05, "loss": 1.1145133018493651, "num_input_tokens_seen": 3801311488, "step": 13370, "train_runtime": 130236.6232, "train_tokens_per_second": 29187.731 }, { "epoch": 0.47341151286910643, "grad_norm": 1.4296875, "learning_rate": 3.2700699207285544e-05, "loss": 1.1082937240600585, "num_input_tokens_seen": 3804162368, "step": 13380, "train_runtime": 130333.3685, "train_tokens_per_second": 29187.939 }, { "epoch": 0.4737653331328352, "grad_norm": 1.46875, "learning_rate": 3.269370784483691e-05, "loss": 1.1077110290527343, "num_input_tokens_seen": 3806985664, "step": 13390, "train_runtime": 130429.0111, "train_tokens_per_second": 29188.182 }, { "epoch": 0.47411915339656396, "grad_norm": 1.3515625, "learning_rate": 3.268672096470138e-05, "loss": 1.110721492767334, "num_input_tokens_seen": 3809798528, "step": 13400, "train_runtime": 130524.2093, "train_tokens_per_second": 29188.444 }, { "epoch": 0.47447297366029273, "grad_norm": 1.4609375, "learning_rate": 3.2679738562091506e-05, "loss": 1.103311824798584, "num_input_tokens_seen": 3812646720, "step": 13410, "train_runtime": 130621.2615, "train_tokens_per_second": 29188.561 }, { "epoch": 0.4748267939240215, "grad_norm": 1.484375, "learning_rate": 3.2672760632226964e-05, "loss": 1.1058692932128906, "num_input_tokens_seen": 3815474560, "step": 13420, "train_runtime": 130719.991, "train_tokens_per_second": 29188.149 }, { "epoch": 0.4751806141877503, "grad_norm": 1.4609375, "learning_rate": 3.266578717033458e-05, "loss": 1.1080438613891601, "num_input_tokens_seen": 3818355968, "step": 13430, "train_runtime": 130820.6469, "train_tokens_per_second": 29187.717 }, { "epoch": 0.4755344344514791, "grad_norm": 1.3671875, "learning_rate": 3.265881817164833e-05, "loss": 1.0981053352355956, "num_input_tokens_seen": 3821149376, "step": 13440, "train_runtime": 130913.3979, "train_tokens_per_second": 29188.375 }, { "epoch": 0.47588825471520785, "grad_norm": 1.4921875, "learning_rate": 3.265185363140928e-05, "loss": 1.1091983795166016, "num_input_tokens_seen": 3824011584, "step": 13450, "train_runtime": 131011.044, "train_tokens_per_second": 29188.467 }, { "epoch": 0.4762420749789366, "grad_norm": 1.421875, "learning_rate": 3.26448935448656e-05, "loss": 1.0971981048583985, "num_input_tokens_seen": 3826835904, "step": 13460, "train_runtime": 131106.8447, "train_tokens_per_second": 29188.681 }, { "epoch": 0.47659589524266543, "grad_norm": 1.4609375, "learning_rate": 3.263793790727256e-05, "loss": 1.101974105834961, "num_input_tokens_seen": 3829707968, "step": 13470, "train_runtime": 131205.7862, "train_tokens_per_second": 29188.56 }, { "epoch": 0.4769497155063942, "grad_norm": 1.4765625, "learning_rate": 3.2630986713892495e-05, "loss": 1.0923451423645019, "num_input_tokens_seen": 3832545344, "step": 13480, "train_runtime": 131302.558, "train_tokens_per_second": 29188.657 }, { "epoch": 0.47730353577012297, "grad_norm": 1.3828125, "learning_rate": 3.26240399599948e-05, "loss": 1.1004320144653321, "num_input_tokens_seen": 3835377728, "step": 13490, "train_runtime": 131400.4682, "train_tokens_per_second": 29188.463 }, { "epoch": 0.47765735603385173, "grad_norm": 1.4609375, "learning_rate": 3.2617097640855914e-05, "loss": 1.1029982566833496, "num_input_tokens_seen": 3838192448, "step": 13500, "train_runtime": 131497.0135, "train_tokens_per_second": 29188.438 }, { "epoch": 0.47801117629758055, "grad_norm": 1.40625, "learning_rate": 3.2610159751759314e-05, "loss": 1.0987348556518555, "num_input_tokens_seen": 3841070848, "step": 13510, "train_runtime": 131596.9178, "train_tokens_per_second": 29188.152 }, { "epoch": 0.4783649965613093, "grad_norm": 1.4765625, "learning_rate": 3.26032262879955e-05, "loss": 1.114363956451416, "num_input_tokens_seen": 3843858048, "step": 13520, "train_runtime": 131691.8696, "train_tokens_per_second": 29188.272 }, { "epoch": 0.4787188168250381, "grad_norm": 1.40625, "learning_rate": 3.259629724486198e-05, "loss": 1.1138381958007812, "num_input_tokens_seen": 3846663040, "step": 13530, "train_runtime": 131787.4145, "train_tokens_per_second": 29188.394 }, { "epoch": 0.47907263708876685, "grad_norm": 1.390625, "learning_rate": 3.258937261766323e-05, "loss": 1.0999014854431153, "num_input_tokens_seen": 3849578240, "step": 13540, "train_runtime": 131889.5612, "train_tokens_per_second": 29187.892 }, { "epoch": 0.47942645735249567, "grad_norm": 1.53125, "learning_rate": 3.258245240171074e-05, "loss": 1.1082172393798828, "num_input_tokens_seen": 3852476672, "step": 13550, "train_runtime": 131989.0194, "train_tokens_per_second": 29187.857 }, { "epoch": 0.47978027761622444, "grad_norm": 1.453125, "learning_rate": 3.2575536592322935e-05, "loss": 1.1088698387145997, "num_input_tokens_seen": 3855333952, "step": 13560, "train_runtime": 132085.8598, "train_tokens_per_second": 29188.09 }, { "epoch": 0.4801340978799532, "grad_norm": 1.4296875, "learning_rate": 3.256862518482523e-05, "loss": 1.0957657814025878, "num_input_tokens_seen": 3858135808, "step": 13570, "train_runtime": 132180.017, "train_tokens_per_second": 29188.495 }, { "epoch": 0.48048791814368197, "grad_norm": 1.4765625, "learning_rate": 3.256171817454994e-05, "loss": 1.1019087791442872, "num_input_tokens_seen": 3860974400, "step": 13580, "train_runtime": 132276.8632, "train_tokens_per_second": 29188.585 }, { "epoch": 0.4808417384074108, "grad_norm": 1.40625, "learning_rate": 3.255481555683633e-05, "loss": 1.1147951126098632, "num_input_tokens_seen": 3863829120, "step": 13590, "train_runtime": 132375.8881, "train_tokens_per_second": 29188.315 }, { "epoch": 0.48119555867113956, "grad_norm": 1.421875, "learning_rate": 3.254791732703057e-05, "loss": 1.1057777404785156, "num_input_tokens_seen": 3866681408, "step": 13600, "train_runtime": 132474.6392, "train_tokens_per_second": 29188.088 }, { "epoch": 0.4815493789348683, "grad_norm": 1.4765625, "learning_rate": 3.254102348048575e-05, "loss": 1.1031816482543946, "num_input_tokens_seen": 3869484160, "step": 13610, "train_runtime": 132569.6644, "train_tokens_per_second": 29188.308 }, { "epoch": 0.4819031991985971, "grad_norm": 1.453125, "learning_rate": 3.25341340125618e-05, "loss": 1.102052879333496, "num_input_tokens_seen": 3872334656, "step": 13620, "train_runtime": 132665.444, "train_tokens_per_second": 29188.721 }, { "epoch": 0.4822570194623259, "grad_norm": 1.40625, "learning_rate": 3.2527248918625575e-05, "loss": 1.1104936599731445, "num_input_tokens_seen": 3875176384, "step": 13630, "train_runtime": 132761.4324, "train_tokens_per_second": 29189.022 }, { "epoch": 0.4826108397260547, "grad_norm": 1.4609375, "learning_rate": 3.252036819405075e-05, "loss": 1.1074193954467773, "num_input_tokens_seen": 3877983360, "step": 13640, "train_runtime": 132856.1478, "train_tokens_per_second": 29189.341 }, { "epoch": 0.48296465998978344, "grad_norm": 1.4765625, "learning_rate": 3.251349183421788e-05, "loss": 1.103062057495117, "num_input_tokens_seen": 3880825280, "step": 13650, "train_runtime": 132953.0926, "train_tokens_per_second": 29189.432 }, { "epoch": 0.4833184802535122, "grad_norm": 1.484375, "learning_rate": 3.250661983451434e-05, "loss": 1.101047897338867, "num_input_tokens_seen": 3883634624, "step": 13660, "train_runtime": 133047.7782, "train_tokens_per_second": 29189.774 }, { "epoch": 0.48367230051724097, "grad_norm": 1.453125, "learning_rate": 3.2499752190334326e-05, "loss": 1.1017118453979493, "num_input_tokens_seen": 3886481728, "step": 13670, "train_runtime": 133148.9144, "train_tokens_per_second": 29188.985 }, { "epoch": 0.4840261207809698, "grad_norm": 1.4140625, "learning_rate": 3.2492888897078834e-05, "loss": 1.1198915481567382, "num_input_tokens_seen": 3889359232, "step": 13680, "train_runtime": 133248.3306, "train_tokens_per_second": 29188.803 }, { "epoch": 0.48437994104469856, "grad_norm": 1.4453125, "learning_rate": 3.248602995015567e-05, "loss": 1.0979561805725098, "num_input_tokens_seen": 3892185280, "step": 13690, "train_runtime": 133343.6889, "train_tokens_per_second": 29189.123 }, { "epoch": 0.4847337613084273, "grad_norm": 1.3984375, "learning_rate": 3.247917534497943e-05, "loss": 1.0981789588928224, "num_input_tokens_seen": 3895009856, "step": 13700, "train_runtime": 133441.3657, "train_tokens_per_second": 29188.924 }, { "epoch": 0.4850875815721561, "grad_norm": 1.4609375, "learning_rate": 3.247232507697145e-05, "loss": 1.1070235252380372, "num_input_tokens_seen": 3897859200, "step": 13710, "train_runtime": 133540.0506, "train_tokens_per_second": 29188.69 }, { "epoch": 0.4854414018358849, "grad_norm": 1.4921875, "learning_rate": 3.246547914155985e-05, "loss": 1.1151971817016602, "num_input_tokens_seen": 3900682816, "step": 13720, "train_runtime": 133633.4897, "train_tokens_per_second": 29189.411 }, { "epoch": 0.4857952220996137, "grad_norm": 1.421875, "learning_rate": 3.245863753417949e-05, "loss": 1.124067783355713, "num_input_tokens_seen": 3903496256, "step": 13730, "train_runtime": 133727.4919, "train_tokens_per_second": 29189.931 }, { "epoch": 0.48614904236334244, "grad_norm": 1.40625, "learning_rate": 3.2451800250271944e-05, "loss": 1.11301851272583, "num_input_tokens_seen": 3906388864, "step": 13740, "train_runtime": 133828.7377, "train_tokens_per_second": 29189.462 }, { "epoch": 0.4865028626270712, "grad_norm": 1.5390625, "learning_rate": 3.244496728528553e-05, "loss": 1.1062323570251464, "num_input_tokens_seen": 3909218240, "step": 13750, "train_runtime": 133927.0602, "train_tokens_per_second": 29189.159 }, { "epoch": 0.48685668289080003, "grad_norm": 1.3984375, "learning_rate": 3.243813863467525e-05, "loss": 1.0976166725158691, "num_input_tokens_seen": 3912107584, "step": 13760, "train_runtime": 134027.7196, "train_tokens_per_second": 29188.795 }, { "epoch": 0.4872105031545288, "grad_norm": 1.421875, "learning_rate": 3.243131429390281e-05, "loss": 1.102048683166504, "num_input_tokens_seen": 3914896384, "step": 13770, "train_runtime": 134120.97, "train_tokens_per_second": 29189.294 }, { "epoch": 0.48756432341825756, "grad_norm": 1.40625, "learning_rate": 3.2424494258436594e-05, "loss": 1.0953975677490235, "num_input_tokens_seen": 3917735680, "step": 13780, "train_runtime": 134220.2986, "train_tokens_per_second": 29188.846 }, { "epoch": 0.4879181436819863, "grad_norm": 1.453125, "learning_rate": 3.241767852375166e-05, "loss": 1.0973093032836914, "num_input_tokens_seen": 3920528640, "step": 13790, "train_runtime": 134315.0908, "train_tokens_per_second": 29189.041 }, { "epoch": 0.48827196394571515, "grad_norm": 1.4609375, "learning_rate": 3.241086708532971e-05, "loss": 1.0930806159973145, "num_input_tokens_seen": 3923366016, "step": 13800, "train_runtime": 134411.4754, "train_tokens_per_second": 29189.219 }, { "epoch": 0.4886257842094439, "grad_norm": 1.375, "learning_rate": 3.24040599386591e-05, "loss": 1.1080178260803222, "num_input_tokens_seen": 3926291648, "step": 13810, "train_runtime": 134510.1931, "train_tokens_per_second": 29189.547 }, { "epoch": 0.4889796044731727, "grad_norm": 1.453125, "learning_rate": 3.23972570792348e-05, "loss": 1.096669578552246, "num_input_tokens_seen": 3929174336, "step": 13820, "train_runtime": 134609.8358, "train_tokens_per_second": 29189.355 }, { "epoch": 0.48933342473690145, "grad_norm": 1.4765625, "learning_rate": 3.239045850255842e-05, "loss": 1.1071681022644042, "num_input_tokens_seen": 3932069312, "step": 13830, "train_runtime": 134709.4532, "train_tokens_per_second": 29189.26 }, { "epoch": 0.48968724500063027, "grad_norm": 1.484375, "learning_rate": 3.238366420413817e-05, "loss": 1.1096026420593261, "num_input_tokens_seen": 3934879616, "step": 13840, "train_runtime": 134803.0882, "train_tokens_per_second": 29189.833 }, { "epoch": 0.49004106526435903, "grad_norm": 1.453125, "learning_rate": 3.237687417948882e-05, "loss": 1.1094367980957032, "num_input_tokens_seen": 3937755456, "step": 13850, "train_runtime": 134900.8932, "train_tokens_per_second": 29189.988 }, { "epoch": 0.4903948855280878, "grad_norm": 1.4140625, "learning_rate": 3.2370088424131776e-05, "loss": 1.1118120193481444, "num_input_tokens_seen": 3940664064, "step": 13860, "train_runtime": 135002.1294, "train_tokens_per_second": 29189.644 }, { "epoch": 0.49074870579181656, "grad_norm": 1.484375, "learning_rate": 3.236330693359497e-05, "loss": 1.0917236328125, "num_input_tokens_seen": 3943483520, "step": 13870, "train_runtime": 135097.2743, "train_tokens_per_second": 29189.956 }, { "epoch": 0.4911025260555454, "grad_norm": 1.453125, "learning_rate": 3.2356529703412894e-05, "loss": 1.1113127708435058, "num_input_tokens_seen": 3946334144, "step": 13880, "train_runtime": 135195.1216, "train_tokens_per_second": 29189.915 }, { "epoch": 0.49145634631927415, "grad_norm": 1.4921875, "learning_rate": 3.234975672912661e-05, "loss": 1.121194076538086, "num_input_tokens_seen": 3949208896, "step": 13890, "train_runtime": 135293.4259, "train_tokens_per_second": 29189.954 }, { "epoch": 0.4918101665830029, "grad_norm": 1.515625, "learning_rate": 3.234298800628368e-05, "loss": 1.107191276550293, "num_input_tokens_seen": 3952040192, "step": 13900, "train_runtime": 135390.6827, "train_tokens_per_second": 29189.898 }, { "epoch": 0.4921639868467317, "grad_norm": 1.4296875, "learning_rate": 3.2336223530438195e-05, "loss": 1.09014949798584, "num_input_tokens_seen": 3954881216, "step": 13910, "train_runtime": 135488.2664, "train_tokens_per_second": 29189.843 }, { "epoch": 0.49251780711046045, "grad_norm": 1.3828125, "learning_rate": 3.232946329715076e-05, "loss": 1.0901865005493163, "num_input_tokens_seen": 3957707456, "step": 13920, "train_runtime": 135583.9987, "train_tokens_per_second": 29190.078 }, { "epoch": 0.49287162737418927, "grad_norm": 1.484375, "learning_rate": 3.2322707301988456e-05, "loss": 1.1042044639587403, "num_input_tokens_seen": 3960528768, "step": 13930, "train_runtime": 135676.7127, "train_tokens_per_second": 29190.925 }, { "epoch": 0.49322544763791804, "grad_norm": 1.4921875, "learning_rate": 3.231595554052488e-05, "loss": 1.0973613739013672, "num_input_tokens_seen": 3963380224, "step": 13940, "train_runtime": 135774.1198, "train_tokens_per_second": 29190.984 }, { "epoch": 0.4935792679016468, "grad_norm": 1.375, "learning_rate": 3.230920800834005e-05, "loss": 1.109498882293701, "num_input_tokens_seen": 3966185728, "step": 13950, "train_runtime": 135870.4554, "train_tokens_per_second": 29190.936 }, { "epoch": 0.49393308816537557, "grad_norm": 1.46875, "learning_rate": 3.2302464701020486e-05, "loss": 1.118125820159912, "num_input_tokens_seen": 3968997120, "step": 13960, "train_runtime": 135964.7497, "train_tokens_per_second": 29191.369 }, { "epoch": 0.4942869084291044, "grad_norm": 1.4765625, "learning_rate": 3.2295725614159126e-05, "loss": 1.0873123168945313, "num_input_tokens_seen": 3971827776, "step": 13970, "train_runtime": 136060.5239, "train_tokens_per_second": 29191.625 }, { "epoch": 0.49464072869283315, "grad_norm": 1.453125, "learning_rate": 3.228899074335536e-05, "loss": 1.0985291481018067, "num_input_tokens_seen": 3974702400, "step": 13980, "train_runtime": 136162.2762, "train_tokens_per_second": 29190.922 }, { "epoch": 0.4949945489565619, "grad_norm": 1.4453125, "learning_rate": 3.228226008421498e-05, "loss": 1.109107780456543, "num_input_tokens_seen": 3977531136, "step": 13990, "train_runtime": 136257.5528, "train_tokens_per_second": 29191.271 }, { "epoch": 0.4953483692202907, "grad_norm": 1.4453125, "learning_rate": 3.2275533632350193e-05, "loss": 1.0951703071594239, "num_input_tokens_seen": 3980384000, "step": 14000, "train_runtime": 136356.6963, "train_tokens_per_second": 29190.968 }, { "epoch": 0.4957021894840195, "grad_norm": 1.421875, "learning_rate": 3.226881138337963e-05, "loss": 1.1000097274780274, "num_input_tokens_seen": 3983229632, "step": 14010, "train_runtime": 136454.7301, "train_tokens_per_second": 29190.851 }, { "epoch": 0.49605600974774827, "grad_norm": 1.4375, "learning_rate": 3.2262093332928256e-05, "loss": 1.0987120628356934, "num_input_tokens_seen": 3986041472, "step": 14020, "train_runtime": 136550.3243, "train_tokens_per_second": 29191.007 }, { "epoch": 0.49640983001147704, "grad_norm": 1.4765625, "learning_rate": 3.225537947662746e-05, "loss": 1.0936863899230957, "num_input_tokens_seen": 3988832896, "step": 14030, "train_runtime": 136641.373, "train_tokens_per_second": 29191.985 }, { "epoch": 0.4967636502752058, "grad_norm": 1.4609375, "learning_rate": 3.224866981011494e-05, "loss": 1.1051401138305663, "num_input_tokens_seen": 3991680640, "step": 14040, "train_runtime": 136737.4792, "train_tokens_per_second": 29192.294 }, { "epoch": 0.4971174705389346, "grad_norm": 1.46875, "learning_rate": 3.22419643290348e-05, "loss": 1.1136377334594727, "num_input_tokens_seen": 3994563456, "step": 14050, "train_runtime": 136835.8252, "train_tokens_per_second": 29192.38 }, { "epoch": 0.4974712908026634, "grad_norm": 1.4140625, "learning_rate": 3.2235263029037446e-05, "loss": 1.1218993186950683, "num_input_tokens_seen": 3997392256, "step": 14060, "train_runtime": 136935.7313, "train_tokens_per_second": 29191.74 }, { "epoch": 0.49782511106639216, "grad_norm": 1.4375, "learning_rate": 3.222856590577962e-05, "loss": 1.1009552001953125, "num_input_tokens_seen": 4000232832, "step": 14070, "train_runtime": 137032.8476, "train_tokens_per_second": 29191.781 }, { "epoch": 0.4981789313301209, "grad_norm": 1.4296875, "learning_rate": 3.222187295492436e-05, "loss": 1.0966402053833009, "num_input_tokens_seen": 4003073536, "step": 14080, "train_runtime": 137128.9667, "train_tokens_per_second": 29192.035 }, { "epoch": 0.49853275159384974, "grad_norm": 1.46875, "learning_rate": 3.221518417214104e-05, "loss": 1.1095767974853517, "num_input_tokens_seen": 4005809600, "step": 14090, "train_runtime": 137220.6063, "train_tokens_per_second": 29192.479 }, { "epoch": 0.4988865718575785, "grad_norm": 1.4296875, "learning_rate": 3.22084995531053e-05, "loss": 1.106474018096924, "num_input_tokens_seen": 4008653568, "step": 14100, "train_runtime": 137318.9791, "train_tokens_per_second": 29192.276 }, { "epoch": 0.4992403921213073, "grad_norm": 1.4140625, "learning_rate": 3.220181909349907e-05, "loss": 1.1004980087280274, "num_input_tokens_seen": 4011502592, "step": 14110, "train_runtime": 137417.7579, "train_tokens_per_second": 29192.025 }, { "epoch": 0.49959421238503604, "grad_norm": 1.4609375, "learning_rate": 3.219514278901053e-05, "loss": 1.0978187561035155, "num_input_tokens_seen": 4014291200, "step": 14120, "train_runtime": 137511.4612, "train_tokens_per_second": 29192.412 }, { "epoch": 0.49994803264876486, "grad_norm": 1.4375, "learning_rate": 3.218847063533413e-05, "loss": 1.097608757019043, "num_input_tokens_seen": 4017122112, "step": 14130, "train_runtime": 137606.7558, "train_tokens_per_second": 29192.768 }, { "epoch": 0.5003018529124936, "grad_norm": 1.453125, "learning_rate": 3.218180262817055e-05, "loss": 1.0966375350952149, "num_input_tokens_seen": 4019970816, "step": 14140, "train_runtime": 137704.9447, "train_tokens_per_second": 29192.64 }, { "epoch": 0.5006556731762224, "grad_norm": 1.4375, "learning_rate": 3.217513876322674e-05, "loss": 1.089796257019043, "num_input_tokens_seen": 4022749120, "step": 14150, "train_runtime": 137801.0757, "train_tokens_per_second": 29192.436 }, { "epoch": 0.5010094934399512, "grad_norm": 1.4453125, "learning_rate": 3.216847903621581e-05, "loss": 1.1036855697631835, "num_input_tokens_seen": 4025592000, "step": 14160, "train_runtime": 137897.3888, "train_tokens_per_second": 29192.663 }, { "epoch": 0.5013633137036799, "grad_norm": 1.40625, "learning_rate": 3.216182344285713e-05, "loss": 1.1118246078491212, "num_input_tokens_seen": 4028470080, "step": 14170, "train_runtime": 137996.0792, "train_tokens_per_second": 29192.642 }, { "epoch": 0.5017171339674087, "grad_norm": 1.453125, "learning_rate": 3.215517197887625e-05, "loss": 1.1060211181640625, "num_input_tokens_seen": 4031278400, "step": 14180, "train_runtime": 138091.492, "train_tokens_per_second": 29192.808 }, { "epoch": 0.5020709542311375, "grad_norm": 1.515625, "learning_rate": 3.214852464000488e-05, "loss": 1.0942562103271485, "num_input_tokens_seen": 4034128192, "step": 14190, "train_runtime": 138186.4638, "train_tokens_per_second": 29193.367 }, { "epoch": 0.5024247744948663, "grad_norm": 1.515625, "learning_rate": 3.2141881421980945e-05, "loss": 1.0967092514038086, "num_input_tokens_seen": 4036948608, "step": 14200, "train_runtime": 138282.0724, "train_tokens_per_second": 29193.579 }, { "epoch": 0.5027785947585951, "grad_norm": 1.46875, "learning_rate": 3.213524232054851e-05, "loss": 1.0930200576782227, "num_input_tokens_seen": 4039743232, "step": 14210, "train_runtime": 138375.0017, "train_tokens_per_second": 29194.169 }, { "epoch": 0.5031324150223239, "grad_norm": 1.46875, "learning_rate": 3.21286073314578e-05, "loss": 1.105172348022461, "num_input_tokens_seen": 4042558016, "step": 14220, "train_runtime": 138473.5501, "train_tokens_per_second": 29193.72 }, { "epoch": 0.5034862352860526, "grad_norm": 1.453125, "learning_rate": 3.2121976450465155e-05, "loss": 1.1135007858276367, "num_input_tokens_seen": 4045371264, "step": 14230, "train_runtime": 138568.2037, "train_tokens_per_second": 29194.08 }, { "epoch": 0.5038400555497814, "grad_norm": 1.484375, "learning_rate": 3.211534967333308e-05, "loss": 1.08929443359375, "num_input_tokens_seen": 4048218176, "step": 14240, "train_runtime": 138665.5178, "train_tokens_per_second": 29194.123 }, { "epoch": 0.5041938758135102, "grad_norm": 1.40625, "learning_rate": 3.210872699583019e-05, "loss": 1.0952016830444335, "num_input_tokens_seen": 4051051456, "step": 14250, "train_runtime": 138761.9769, "train_tokens_per_second": 29194.247 }, { "epoch": 0.5045476960772389, "grad_norm": 1.4453125, "learning_rate": 3.210210841373118e-05, "loss": 1.1050315856933595, "num_input_tokens_seen": 4053911744, "step": 14260, "train_runtime": 138861.051, "train_tokens_per_second": 29194.016 }, { "epoch": 0.5049015163409677, "grad_norm": 1.4609375, "learning_rate": 3.2095493922816855e-05, "loss": 1.1054222106933593, "num_input_tokens_seen": 4056795584, "step": 14270, "train_runtime": 138959.7546, "train_tokens_per_second": 29194.032 }, { "epoch": 0.5052553366046966, "grad_norm": 1.4375, "learning_rate": 3.2088883518874105e-05, "loss": 1.1054767608642577, "num_input_tokens_seen": 4059580480, "step": 14280, "train_runtime": 139055.2549, "train_tokens_per_second": 29194.01 }, { "epoch": 0.5056091568684253, "grad_norm": 1.4609375, "learning_rate": 3.208227719769589e-05, "loss": 1.0909000396728517, "num_input_tokens_seen": 4062394432, "step": 14290, "train_runtime": 139151.5203, "train_tokens_per_second": 29194.036 }, { "epoch": 0.5059629771321541, "grad_norm": 1.4375, "learning_rate": 3.207567495508124e-05, "loss": 1.104444408416748, "num_input_tokens_seen": 4065237184, "step": 14300, "train_runtime": 139248.055, "train_tokens_per_second": 29194.212 }, { "epoch": 0.5063167973958829, "grad_norm": 1.53125, "learning_rate": 3.2069076786835205e-05, "loss": 1.1105491638183593, "num_input_tokens_seen": 4068040320, "step": 14310, "train_runtime": 139344.5755, "train_tokens_per_second": 29194.106 }, { "epoch": 0.5066706176596116, "grad_norm": 1.4375, "learning_rate": 3.2062482688768904e-05, "loss": 1.100996971130371, "num_input_tokens_seen": 4070913536, "step": 14320, "train_runtime": 139445.4364, "train_tokens_per_second": 29193.595 }, { "epoch": 0.5070244379233404, "grad_norm": 1.3984375, "learning_rate": 3.205589265669947e-05, "loss": 1.0908689498901367, "num_input_tokens_seen": 4073779840, "step": 14330, "train_runtime": 139544.2297, "train_tokens_per_second": 29193.467 }, { "epoch": 0.5073782581870692, "grad_norm": 1.4296875, "learning_rate": 3.204930668645005e-05, "loss": 1.116949462890625, "num_input_tokens_seen": 4076619840, "step": 14340, "train_runtime": 139640.4344, "train_tokens_per_second": 29193.692 }, { "epoch": 0.5077320784507979, "grad_norm": 1.4140625, "learning_rate": 3.20427247738498e-05, "loss": 1.0988884925842286, "num_input_tokens_seen": 4079465216, "step": 14350, "train_runtime": 139739.5916, "train_tokens_per_second": 29193.339 }, { "epoch": 0.5080858987145268, "grad_norm": 1.46875, "learning_rate": 3.2036146914733854e-05, "loss": 1.1020221710205078, "num_input_tokens_seen": 4082283904, "step": 14360, "train_runtime": 139835.7909, "train_tokens_per_second": 29193.412 }, { "epoch": 0.5084397189782556, "grad_norm": 1.375, "learning_rate": 3.202957310494336e-05, "loss": 1.1072748184204102, "num_input_tokens_seen": 4085162240, "step": 14370, "train_runtime": 139933.813, "train_tokens_per_second": 29193.532 }, { "epoch": 0.5087935392419843, "grad_norm": 1.5, "learning_rate": 3.202300334032542e-05, "loss": 1.0912253379821777, "num_input_tokens_seen": 4088018432, "step": 14380, "train_runtime": 140031.6413, "train_tokens_per_second": 29193.534 }, { "epoch": 0.5091473595057131, "grad_norm": 1.453125, "learning_rate": 3.201643761673308e-05, "loss": 1.114656925201416, "num_input_tokens_seen": 4090857408, "step": 14390, "train_runtime": 140130.7342, "train_tokens_per_second": 29193.149 }, { "epoch": 0.5095011797694419, "grad_norm": 1.4609375, "learning_rate": 3.200987593002536e-05, "loss": 1.1161548614501953, "num_input_tokens_seen": 4093682816, "step": 14400, "train_runtime": 140227.1308, "train_tokens_per_second": 29193.23 }, { "epoch": 0.5098550000331706, "grad_norm": 1.3984375, "learning_rate": 3.200331827606721e-05, "loss": 1.0994593620300293, "num_input_tokens_seen": 4096522432, "step": 14410, "train_runtime": 140324.8795, "train_tokens_per_second": 29193.13 }, { "epoch": 0.5102088202968994, "grad_norm": 1.359375, "learning_rate": 3.199676465072951e-05, "loss": 1.0772233963012696, "num_input_tokens_seen": 4099334656, "step": 14420, "train_runtime": 140420.6714, "train_tokens_per_second": 29193.242 }, { "epoch": 0.5105626405606282, "grad_norm": 1.46875, "learning_rate": 3.1990215049889046e-05, "loss": 1.0929615020751953, "num_input_tokens_seen": 4102225472, "step": 14430, "train_runtime": 140520.7501, "train_tokens_per_second": 29193.023 }, { "epoch": 0.5109164608243569, "grad_norm": 1.46875, "learning_rate": 3.198366946942851e-05, "loss": 1.106859016418457, "num_input_tokens_seen": 4105131328, "step": 14440, "train_runtime": 140622.0598, "train_tokens_per_second": 29192.655 }, { "epoch": 0.5112702810880858, "grad_norm": 1.4375, "learning_rate": 3.1977127905236514e-05, "loss": 1.10336275100708, "num_input_tokens_seen": 4107939968, "step": 14450, "train_runtime": 140716.6683, "train_tokens_per_second": 29192.988 }, { "epoch": 0.5116241013518146, "grad_norm": 1.4296875, "learning_rate": 3.197059035320752e-05, "loss": 1.1046796798706056, "num_input_tokens_seen": 4110789568, "step": 14460, "train_runtime": 140816.2927, "train_tokens_per_second": 29192.571 }, { "epoch": 0.5119779216155433, "grad_norm": 1.4140625, "learning_rate": 3.196405680924189e-05, "loss": 1.0953731536865234, "num_input_tokens_seen": 4113665408, "step": 14470, "train_runtime": 140915.3778, "train_tokens_per_second": 29192.452 }, { "epoch": 0.5123317418792721, "grad_norm": 1.4453125, "learning_rate": 3.195752726924582e-05, "loss": 1.106933879852295, "num_input_tokens_seen": 4116458560, "step": 14480, "train_runtime": 141010.5413, "train_tokens_per_second": 29192.559 }, { "epoch": 0.5126855621430009, "grad_norm": 1.484375, "learning_rate": 3.195100172913139e-05, "loss": 1.1035601615905761, "num_input_tokens_seen": 4119314880, "step": 14490, "train_runtime": 141110.1157, "train_tokens_per_second": 29192.201 }, { "epoch": 0.5130393824067296, "grad_norm": 1.4140625, "learning_rate": 3.19444801848165e-05, "loss": 1.1016318321228027, "num_input_tokens_seen": 4122162112, "step": 14500, "train_runtime": 141207.486, "train_tokens_per_second": 29192.235 }, { "epoch": 0.5133932026704584, "grad_norm": 1.4453125, "learning_rate": 3.1937962632224885e-05, "loss": 1.100595188140869, "num_input_tokens_seen": 4125037696, "step": 14510, "train_runtime": 141307.1723, "train_tokens_per_second": 29191.991 }, { "epoch": 0.5137470229341872, "grad_norm": 1.4609375, "learning_rate": 3.193144906728609e-05, "loss": 1.089040756225586, "num_input_tokens_seen": 4127887424, "step": 14520, "train_runtime": 141403.0502, "train_tokens_per_second": 29192.351 }, { "epoch": 0.514100843197916, "grad_norm": 1.3984375, "learning_rate": 3.1924939485935494e-05, "loss": 1.1045886993408203, "num_input_tokens_seen": 4130725888, "step": 14530, "train_runtime": 141499.7567, "train_tokens_per_second": 29192.459 }, { "epoch": 0.5144546634616448, "grad_norm": 1.5, "learning_rate": 3.1918433884114253e-05, "loss": 1.0892650604248046, "num_input_tokens_seen": 4133562560, "step": 14540, "train_runtime": 141596.0992, "train_tokens_per_second": 29192.63 }, { "epoch": 0.5148084837253736, "grad_norm": 1.453125, "learning_rate": 3.191193225776931e-05, "loss": 1.1099250793457032, "num_input_tokens_seen": 4136477056, "step": 14550, "train_runtime": 141698.2785, "train_tokens_per_second": 29192.148 }, { "epoch": 0.5151623039891023, "grad_norm": 1.5390625, "learning_rate": 3.190543460285339e-05, "loss": 1.1154672622680664, "num_input_tokens_seen": 4139378048, "step": 14560, "train_runtime": 141801.1784, "train_tokens_per_second": 29191.422 }, { "epoch": 0.5155161242528311, "grad_norm": 1.46875, "learning_rate": 3.189894091532499e-05, "loss": 1.1032766342163085, "num_input_tokens_seen": 4142189568, "step": 14570, "train_runtime": 141896.8435, "train_tokens_per_second": 29191.555 }, { "epoch": 0.5158699445165599, "grad_norm": 1.4375, "learning_rate": 3.1892451191148346e-05, "loss": 1.1020416259765624, "num_input_tokens_seen": 4144996480, "step": 14580, "train_runtime": 141991.6749, "train_tokens_per_second": 29191.827 }, { "epoch": 0.5162237647802886, "grad_norm": 1.453125, "learning_rate": 3.1885965426293465e-05, "loss": 1.0892604827880858, "num_input_tokens_seen": 4147858752, "step": 14590, "train_runtime": 142092.2194, "train_tokens_per_second": 29191.315 }, { "epoch": 0.5165775850440174, "grad_norm": 1.453125, "learning_rate": 3.187948361673606e-05, "loss": 1.0985610961914063, "num_input_tokens_seen": 4150731072, "step": 14600, "train_runtime": 142193.5765, "train_tokens_per_second": 29190.707 }, { "epoch": 0.5169314053077463, "grad_norm": 1.4296875, "learning_rate": 3.187300575845759e-05, "loss": 1.1001857757568358, "num_input_tokens_seen": 4153606400, "step": 14610, "train_runtime": 142295.3933, "train_tokens_per_second": 29190.027 }, { "epoch": 0.517285225571475, "grad_norm": 1.4375, "learning_rate": 3.186653184744521e-05, "loss": 1.0890081405639649, "num_input_tokens_seen": 4156454976, "step": 14620, "train_runtime": 142397.1467, "train_tokens_per_second": 29189.173 }, { "epoch": 0.5176390458352038, "grad_norm": 1.4921875, "learning_rate": 3.18600618796918e-05, "loss": 1.1146483421325684, "num_input_tokens_seen": 4159297856, "step": 14630, "train_runtime": 142495.3299, "train_tokens_per_second": 29189.012 }, { "epoch": 0.5179928660989326, "grad_norm": 1.3984375, "learning_rate": 3.185359585119591e-05, "loss": 1.0927743911743164, "num_input_tokens_seen": 4162070592, "step": 14640, "train_runtime": 142588.3126, "train_tokens_per_second": 29189.423 }, { "epoch": 0.5183466863626613, "grad_norm": 1.484375, "learning_rate": 3.184713375796178e-05, "loss": 1.112596321105957, "num_input_tokens_seen": 4164963520, "step": 14650, "train_runtime": 142687.2477, "train_tokens_per_second": 29189.459 }, { "epoch": 0.5187005066263901, "grad_norm": 1.3828125, "learning_rate": 3.1840675595999344e-05, "loss": 1.1020581245422363, "num_input_tokens_seen": 4167799616, "step": 14660, "train_runtime": 142783.4036, "train_tokens_per_second": 29189.664 }, { "epoch": 0.5190543268901189, "grad_norm": 1.4921875, "learning_rate": 3.1834221361324155e-05, "loss": 1.1092158317565919, "num_input_tokens_seen": 4170638912, "step": 14670, "train_runtime": 142882.0459, "train_tokens_per_second": 29189.384 }, { "epoch": 0.5194081471538476, "grad_norm": 1.4921875, "learning_rate": 3.182777104995744e-05, "loss": 1.1136004447937011, "num_input_tokens_seen": 4173507968, "step": 14680, "train_runtime": 142982.6465, "train_tokens_per_second": 29188.913 }, { "epoch": 0.5197619674175764, "grad_norm": 1.4375, "learning_rate": 3.182132465792609e-05, "loss": 1.1088988304138183, "num_input_tokens_seen": 4176281024, "step": 14690, "train_runtime": 143076.736, "train_tokens_per_second": 29189.099 }, { "epoch": 0.5201157876813053, "grad_norm": 1.421875, "learning_rate": 3.181488218126259e-05, "loss": 1.0977745056152344, "num_input_tokens_seen": 4179121664, "step": 14700, "train_runtime": 143173.1139, "train_tokens_per_second": 29189.291 }, { "epoch": 0.520469607945034, "grad_norm": 1.4296875, "learning_rate": 3.180844361600506e-05, "loss": 1.0890690803527832, "num_input_tokens_seen": 4181968960, "step": 14710, "train_runtime": 143271.9115, "train_tokens_per_second": 29189.036 }, { "epoch": 0.5208234282087628, "grad_norm": 1.421875, "learning_rate": 3.180200895819722e-05, "loss": 1.0961807250976563, "num_input_tokens_seen": 4184813760, "step": 14720, "train_runtime": 143372.0938, "train_tokens_per_second": 29188.482 }, { "epoch": 0.5211772484724916, "grad_norm": 1.4609375, "learning_rate": 3.1795578203888424e-05, "loss": 1.1000530242919921, "num_input_tokens_seen": 4187652480, "step": 14730, "train_runtime": 143467.6217, "train_tokens_per_second": 29188.833 }, { "epoch": 0.5215310687362203, "grad_norm": 1.4296875, "learning_rate": 3.178915134913357e-05, "loss": 1.0909713745117187, "num_input_tokens_seen": 4190458368, "step": 14740, "train_runtime": 143563.7702, "train_tokens_per_second": 29188.829 }, { "epoch": 0.5218848889999491, "grad_norm": 1.453125, "learning_rate": 3.178272838999316e-05, "loss": 1.109012985229492, "num_input_tokens_seen": 4193264512, "step": 14750, "train_runtime": 143656.0229, "train_tokens_per_second": 29189.619 }, { "epoch": 0.5222387092636779, "grad_norm": 1.4453125, "learning_rate": 3.1776309322533274e-05, "loss": 1.1129315376281739, "num_input_tokens_seen": 4196158144, "step": 14760, "train_runtime": 143756.3909, "train_tokens_per_second": 29189.368 }, { "epoch": 0.5225925295274066, "grad_norm": 1.4453125, "learning_rate": 3.1769894142825536e-05, "loss": 1.0914870262145997, "num_input_tokens_seen": 4199005248, "step": 14770, "train_runtime": 143853.7149, "train_tokens_per_second": 29189.411 }, { "epoch": 0.5229463497911355, "grad_norm": 1.421875, "learning_rate": 3.176348284694712e-05, "loss": 1.095636749267578, "num_input_tokens_seen": 4201899904, "step": 14780, "train_runtime": 143951.7153, "train_tokens_per_second": 29189.648 }, { "epoch": 0.5233001700548643, "grad_norm": 1.4609375, "learning_rate": 3.175707543098075e-05, "loss": 1.086642074584961, "num_input_tokens_seen": 4204755200, "step": 14790, "train_runtime": 144048.8902, "train_tokens_per_second": 29189.779 }, { "epoch": 0.523653990318593, "grad_norm": 1.4375, "learning_rate": 3.1750671891014653e-05, "loss": 1.0990318298339843, "num_input_tokens_seen": 4207601856, "step": 14800, "train_runtime": 144144.9564, "train_tokens_per_second": 29190.073 }, { "epoch": 0.5240078105823218, "grad_norm": 1.4375, "learning_rate": 3.174427222314262e-05, "loss": 1.101422119140625, "num_input_tokens_seen": 4210502592, "step": 14810, "train_runtime": 144248.4526, "train_tokens_per_second": 29189.239 }, { "epoch": 0.5243616308460506, "grad_norm": 1.421875, "learning_rate": 3.173787642346391e-05, "loss": 1.101428508758545, "num_input_tokens_seen": 4213360320, "step": 14820, "train_runtime": 144346.3457, "train_tokens_per_second": 29189.241 }, { "epoch": 0.5247154511097794, "grad_norm": 1.3984375, "learning_rate": 3.173148448808331e-05, "loss": 1.1023262977600097, "num_input_tokens_seen": 4216256576, "step": 14830, "train_runtime": 144448.5691, "train_tokens_per_second": 29188.635 }, { "epoch": 0.5250692713735081, "grad_norm": 1.3828125, "learning_rate": 3.172509641311107e-05, "loss": 1.0945629119873046, "num_input_tokens_seen": 4219089728, "step": 14840, "train_runtime": 144545.1205, "train_tokens_per_second": 29188.739 }, { "epoch": 0.5254230916372369, "grad_norm": 1.4609375, "learning_rate": 3.171871219466293e-05, "loss": 1.0991458892822266, "num_input_tokens_seen": 4221922816, "step": 14850, "train_runtime": 144643.6275, "train_tokens_per_second": 29188.447 }, { "epoch": 0.5257769119009658, "grad_norm": 1.4921875, "learning_rate": 3.171233182886011e-05, "loss": 1.0987175941467284, "num_input_tokens_seen": 4224739520, "step": 14860, "train_runtime": 144738.0802, "train_tokens_per_second": 29188.86 }, { "epoch": 0.5261307321646945, "grad_norm": 1.4609375, "learning_rate": 3.170595531182928e-05, "loss": 1.086920928955078, "num_input_tokens_seen": 4227567616, "step": 14870, "train_runtime": 144834.4178, "train_tokens_per_second": 29188.971 }, { "epoch": 0.5264845524284233, "grad_norm": 1.4296875, "learning_rate": 3.169958263970256e-05, "loss": 1.097539520263672, "num_input_tokens_seen": 4230410944, "step": 14880, "train_runtime": 144931.2304, "train_tokens_per_second": 29189.091 }, { "epoch": 0.5268383726921521, "grad_norm": 1.5078125, "learning_rate": 3.169321380861751e-05, "loss": 1.0943305969238282, "num_input_tokens_seen": 4233268416, "step": 14890, "train_runtime": 145029.8779, "train_tokens_per_second": 29188.94 }, { "epoch": 0.5271921929558808, "grad_norm": 1.421875, "learning_rate": 3.168684881471711e-05, "loss": 1.114631175994873, "num_input_tokens_seen": 4236136320, "step": 14900, "train_runtime": 145126.9686, "train_tokens_per_second": 29189.174 }, { "epoch": 0.5275460132196096, "grad_norm": 1.484375, "learning_rate": 3.168048765414979e-05, "loss": 1.1044181823730468, "num_input_tokens_seen": 4238955776, "step": 14910, "train_runtime": 145223.7081, "train_tokens_per_second": 29189.144 }, { "epoch": 0.5278998334833384, "grad_norm": 1.5234375, "learning_rate": 3.167413032306936e-05, "loss": 1.1040070533752442, "num_input_tokens_seen": 4241815808, "step": 14920, "train_runtime": 145319.6209, "train_tokens_per_second": 29189.56 }, { "epoch": 0.5282536537470671, "grad_norm": 1.5234375, "learning_rate": 3.166777681763504e-05, "loss": 1.100289535522461, "num_input_tokens_seen": 4244648448, "step": 14930, "train_runtime": 145416.3322, "train_tokens_per_second": 29189.627 }, { "epoch": 0.5286074740107959, "grad_norm": 1.3828125, "learning_rate": 3.166142713401144e-05, "loss": 1.0983248710632325, "num_input_tokens_seen": 4247458240, "step": 14940, "train_runtime": 145510.117, "train_tokens_per_second": 29190.123 }, { "epoch": 0.5289612942745248, "grad_norm": 1.3984375, "learning_rate": 3.165508126836857e-05, "loss": 1.0990144729614257, "num_input_tokens_seen": 4250291904, "step": 14950, "train_runtime": 145607.518, "train_tokens_per_second": 29190.058 }, { "epoch": 0.5293151145382535, "grad_norm": 1.4609375, "learning_rate": 3.164873921688177e-05, "loss": 1.1041632652282716, "num_input_tokens_seen": 4253113856, "step": 14960, "train_runtime": 145703.5849, "train_tokens_per_second": 29190.18 }, { "epoch": 0.5296689348019823, "grad_norm": 1.5234375, "learning_rate": 3.164240097573178e-05, "loss": 1.106937789916992, "num_input_tokens_seen": 4255949760, "step": 14970, "train_runtime": 145800.3951, "train_tokens_per_second": 29190.248 }, { "epoch": 0.5300227550657111, "grad_norm": 1.4765625, "learning_rate": 3.163606654110467e-05, "loss": 1.0933317184448241, "num_input_tokens_seen": 4258822784, "step": 14980, "train_runtime": 145897.9241, "train_tokens_per_second": 29190.428 }, { "epoch": 0.5303765753294398, "grad_norm": 1.5234375, "learning_rate": 3.162973590919187e-05, "loss": 1.0996970176696776, "num_input_tokens_seen": 4261609088, "step": 14990, "train_runtime": 145991.9843, "train_tokens_per_second": 29190.706 }, { "epoch": 0.5307303955931686, "grad_norm": 1.40625, "learning_rate": 3.162340907619012e-05, "loss": 1.094344425201416, "num_input_tokens_seen": 4264439296, "step": 15000, "train_runtime": 146089.4406, "train_tokens_per_second": 29190.606 }, { "epoch": 0.5307303955931686, "eval_loss": 1.027906060218811, "eval_runtime": 8.4623, "eval_samples_per_second": 471.266, "eval_steps_per_second": 3.781, "num_input_tokens_seen": 4264439296, "step": 15000 }, { "epoch": 0.5310842158568974, "grad_norm": 1.453125, "learning_rate": 3.1617086038301516e-05, "loss": 1.1061349868774415, "num_input_tokens_seen": 4267301248, "step": 15010, "train_runtime": 146216.081, "train_tokens_per_second": 29184.897 }, { "epoch": 0.5314380361206261, "grad_norm": 1.5078125, "learning_rate": 3.161076679173344e-05, "loss": 1.093703842163086, "num_input_tokens_seen": 4270196416, "step": 15020, "train_runtime": 146316.0665, "train_tokens_per_second": 29184.74 }, { "epoch": 0.531791856384355, "grad_norm": 1.453125, "learning_rate": 3.1604451332698575e-05, "loss": 1.1053047180175781, "num_input_tokens_seen": 4273007872, "step": 15030, "train_runtime": 146412.4309, "train_tokens_per_second": 29184.734 }, { "epoch": 0.5321456766480838, "grad_norm": 1.5078125, "learning_rate": 3.1598139657414923e-05, "loss": 1.1073984146118163, "num_input_tokens_seen": 4275906944, "step": 15040, "train_runtime": 146512.5482, "train_tokens_per_second": 29184.578 }, { "epoch": 0.5324994969118125, "grad_norm": 1.421875, "learning_rate": 3.159183176210574e-05, "loss": 1.0986339569091796, "num_input_tokens_seen": 4278740224, "step": 15050, "train_runtime": 146609.0843, "train_tokens_per_second": 29184.687 }, { "epoch": 0.5328533171755413, "grad_norm": 1.5078125, "learning_rate": 3.1585527642999595e-05, "loss": 1.1029499053955079, "num_input_tokens_seen": 4281597824, "step": 15060, "train_runtime": 146706.8816, "train_tokens_per_second": 29184.71 }, { "epoch": 0.5332071374392701, "grad_norm": 1.46875, "learning_rate": 3.1579227296330294e-05, "loss": 1.1047273635864259, "num_input_tokens_seen": 4284404224, "step": 15070, "train_runtime": 146800.5694, "train_tokens_per_second": 29185.202 }, { "epoch": 0.5335609577029988, "grad_norm": 1.4765625, "learning_rate": 3.157293071833691e-05, "loss": 1.102030372619629, "num_input_tokens_seen": 4287281280, "step": 15080, "train_runtime": 146898.8729, "train_tokens_per_second": 29185.256 }, { "epoch": 0.5339147779667276, "grad_norm": 1.515625, "learning_rate": 3.156663790526375e-05, "loss": 1.1135922431945802, "num_input_tokens_seen": 4290095232, "step": 15090, "train_runtime": 146992.6547, "train_tokens_per_second": 29185.78 }, { "epoch": 0.5342685982304564, "grad_norm": 1.4140625, "learning_rate": 3.156034885336039e-05, "loss": 1.0953948020935058, "num_input_tokens_seen": 4292953728, "step": 15100, "train_runtime": 147090.8563, "train_tokens_per_second": 29185.728 }, { "epoch": 0.5346224184941852, "grad_norm": 1.484375, "learning_rate": 3.155406355888161e-05, "loss": 1.1062522888183595, "num_input_tokens_seen": 4295809728, "step": 15110, "train_runtime": 147187.2885, "train_tokens_per_second": 29186.01 }, { "epoch": 0.534976238757914, "grad_norm": 1.4765625, "learning_rate": 3.1547782018087407e-05, "loss": 1.1058372497558593, "num_input_tokens_seen": 4298643584, "step": 15120, "train_runtime": 147284.5594, "train_tokens_per_second": 29185.976 }, { "epoch": 0.5353300590216428, "grad_norm": 1.5, "learning_rate": 3.154150422724299e-05, "loss": 1.1000194549560547, "num_input_tokens_seen": 4301509632, "step": 15130, "train_runtime": 147381.6765, "train_tokens_per_second": 29186.19 }, { "epoch": 0.5356838792853715, "grad_norm": 1.453125, "learning_rate": 3.1535230182618783e-05, "loss": 1.094675350189209, "num_input_tokens_seen": 4304355904, "step": 15140, "train_runtime": 147480.4402, "train_tokens_per_second": 29185.944 }, { "epoch": 0.5360376995491003, "grad_norm": 1.3984375, "learning_rate": 3.1528959880490387e-05, "loss": 1.1069917678833008, "num_input_tokens_seen": 4307218112, "step": 15150, "train_runtime": 147576.8599, "train_tokens_per_second": 29186.27 }, { "epoch": 0.5363915198128291, "grad_norm": 1.421875, "learning_rate": 3.152269331713859e-05, "loss": 1.106736946105957, "num_input_tokens_seen": 4310026432, "step": 15160, "train_runtime": 147671.2128, "train_tokens_per_second": 29186.639 }, { "epoch": 0.5367453400765578, "grad_norm": 1.4296875, "learning_rate": 3.151643048884935e-05, "loss": 1.1010101318359375, "num_input_tokens_seen": 4312905856, "step": 15170, "train_runtime": 147769.9418, "train_tokens_per_second": 29186.625 }, { "epoch": 0.5370991603402866, "grad_norm": 1.3671875, "learning_rate": 3.151017139191379e-05, "loss": 1.103235912322998, "num_input_tokens_seen": 4315747840, "step": 15180, "train_runtime": 147870.437, "train_tokens_per_second": 29186.009 }, { "epoch": 0.5374529806040154, "grad_norm": 1.4140625, "learning_rate": 3.150391602262818e-05, "loss": 1.10398588180542, "num_input_tokens_seen": 4318558848, "step": 15190, "train_runtime": 147965.1964, "train_tokens_per_second": 29186.315 }, { "epoch": 0.5378068008677442, "grad_norm": 1.4375, "learning_rate": 3.149766437729394e-05, "loss": 1.1043699264526368, "num_input_tokens_seen": 4321412352, "step": 15200, "train_runtime": 148063.7926, "train_tokens_per_second": 29186.152 }, { "epoch": 0.538160621131473, "grad_norm": 1.40625, "learning_rate": 3.1491416452217635e-05, "loss": 1.10097074508667, "num_input_tokens_seen": 4324212544, "step": 15210, "train_runtime": 148157.9549, "train_tokens_per_second": 29186.503 }, { "epoch": 0.5385144413952018, "grad_norm": 1.4765625, "learning_rate": 3.1485172243710954e-05, "loss": 1.0952075958251952, "num_input_tokens_seen": 4327046656, "step": 15220, "train_runtime": 148255.6018, "train_tokens_per_second": 29186.396 }, { "epoch": 0.5388682616589305, "grad_norm": 1.5, "learning_rate": 3.1478931748090676e-05, "loss": 1.0879972457885743, "num_input_tokens_seen": 4329853184, "step": 15230, "train_runtime": 148354.2467, "train_tokens_per_second": 29185.907 }, { "epoch": 0.5392220819226593, "grad_norm": 1.3984375, "learning_rate": 3.147269496167873e-05, "loss": 1.0896201133728027, "num_input_tokens_seen": 4332705792, "step": 15240, "train_runtime": 148452.9075, "train_tokens_per_second": 29185.725 }, { "epoch": 0.5395759021863881, "grad_norm": 1.390625, "learning_rate": 3.1466461880802105e-05, "loss": 1.0955044746398925, "num_input_tokens_seen": 4335562112, "step": 15250, "train_runtime": 148553.5202, "train_tokens_per_second": 29185.186 }, { "epoch": 0.5399297224501168, "grad_norm": 1.4765625, "learning_rate": 3.146023250179291e-05, "loss": 1.10261869430542, "num_input_tokens_seen": 4338357376, "step": 15260, "train_runtime": 148648.5591, "train_tokens_per_second": 29185.331 }, { "epoch": 0.5402835427138456, "grad_norm": 1.46875, "learning_rate": 3.145400682098833e-05, "loss": 1.1063451766967773, "num_input_tokens_seen": 4341228736, "step": 15270, "train_runtime": 148747.7484, "train_tokens_per_second": 29185.173 }, { "epoch": 0.5406373629775745, "grad_norm": 1.453125, "learning_rate": 3.14477848347306e-05, "loss": 1.1046052932739259, "num_input_tokens_seen": 4344086976, "step": 15280, "train_runtime": 148845.5232, "train_tokens_per_second": 29185.204 }, { "epoch": 0.5409911832413032, "grad_norm": 1.4921875, "learning_rate": 3.144156653936703e-05, "loss": 1.0952974319458009, "num_input_tokens_seen": 4346898432, "step": 15290, "train_runtime": 148941.6375, "train_tokens_per_second": 29185.247 }, { "epoch": 0.541345003505032, "grad_norm": 1.453125, "learning_rate": 3.1435351931250004e-05, "loss": 1.0998014450073241, "num_input_tokens_seen": 4349809920, "step": 15300, "train_runtime": 149044.8744, "train_tokens_per_second": 29184.566 }, { "epoch": 0.5416988237687608, "grad_norm": 1.4140625, "learning_rate": 3.142914100673692e-05, "loss": 1.1016740798950195, "num_input_tokens_seen": 4352621696, "step": 15310, "train_runtime": 149141.073, "train_tokens_per_second": 29184.594 }, { "epoch": 0.5420526440324895, "grad_norm": 1.46875, "learning_rate": 3.1422933762190235e-05, "loss": 1.1036070823669433, "num_input_tokens_seen": 4355470784, "step": 15320, "train_runtime": 149235.5375, "train_tokens_per_second": 29185.212 }, { "epoch": 0.5424064642962183, "grad_norm": 1.515625, "learning_rate": 3.141673019397741e-05, "loss": 1.0816612243652344, "num_input_tokens_seen": 4358257216, "step": 15330, "train_runtime": 149328.6573, "train_tokens_per_second": 29185.672 }, { "epoch": 0.5427602845599471, "grad_norm": 1.4921875, "learning_rate": 3.141053029847095e-05, "loss": 1.0864892959594727, "num_input_tokens_seen": 4361099712, "step": 15340, "train_runtime": 149425.9335, "train_tokens_per_second": 29185.695 }, { "epoch": 0.5431141048236758, "grad_norm": 1.484375, "learning_rate": 3.140433407204835e-05, "loss": 1.0936277389526368, "num_input_tokens_seen": 4363925120, "step": 15350, "train_runtime": 149521.6484, "train_tokens_per_second": 29185.908 }, { "epoch": 0.5434679250874047, "grad_norm": 1.421875, "learning_rate": 3.1398141511092124e-05, "loss": 1.095210647583008, "num_input_tokens_seen": 4366730752, "step": 15360, "train_runtime": 149618.5187, "train_tokens_per_second": 29185.764 }, { "epoch": 0.5438217453511335, "grad_norm": 1.484375, "learning_rate": 3.1391952611989736e-05, "loss": 1.1034278869628906, "num_input_tokens_seen": 4369636992, "step": 15370, "train_runtime": 149719.1889, "train_tokens_per_second": 29185.551 }, { "epoch": 0.5441755656148622, "grad_norm": 1.4609375, "learning_rate": 3.138576737113369e-05, "loss": 1.097421360015869, "num_input_tokens_seen": 4372542848, "step": 15380, "train_runtime": 149821.2154, "train_tokens_per_second": 29185.071 }, { "epoch": 0.544529385878591, "grad_norm": 1.4765625, "learning_rate": 3.137958578492143e-05, "loss": 1.091389274597168, "num_input_tokens_seen": 4375380224, "step": 15390, "train_runtime": 149918.6079, "train_tokens_per_second": 29185.038 }, { "epoch": 0.5448832061423198, "grad_norm": 1.421875, "learning_rate": 3.137340784975535e-05, "loss": 1.0843572616577148, "num_input_tokens_seen": 4378217408, "step": 15400, "train_runtime": 150012.6016, "train_tokens_per_second": 29185.664 }, { "epoch": 0.5452370264060485, "grad_norm": 1.4921875, "learning_rate": 3.136723356204285e-05, "loss": 1.1028470039367675, "num_input_tokens_seen": 4381097920, "step": 15410, "train_runtime": 150111.8547, "train_tokens_per_second": 29185.556 }, { "epoch": 0.5455908466697773, "grad_norm": 1.453125, "learning_rate": 3.136106291819622e-05, "loss": 1.087200927734375, "num_input_tokens_seen": 4383983232, "step": 15420, "train_runtime": 150210.6582, "train_tokens_per_second": 29185.567 }, { "epoch": 0.5459446669335061, "grad_norm": 1.4453125, "learning_rate": 3.1354895914632736e-05, "loss": 1.0797155380249024, "num_input_tokens_seen": 4386808896, "step": 15430, "train_runtime": 150306.5815, "train_tokens_per_second": 29185.741 }, { "epoch": 0.546298487197235, "grad_norm": 1.40625, "learning_rate": 3.1348732547774575e-05, "loss": 1.1075575828552247, "num_input_tokens_seen": 4389618368, "step": 15440, "train_runtime": 150398.0833, "train_tokens_per_second": 29186.664 }, { "epoch": 0.5466523074609637, "grad_norm": 1.5078125, "learning_rate": 3.134257281404883e-05, "loss": 1.0977468490600586, "num_input_tokens_seen": 4392389376, "step": 15450, "train_runtime": 150491.3618, "train_tokens_per_second": 29186.987 }, { "epoch": 0.5470061277246925, "grad_norm": 1.5234375, "learning_rate": 3.133641670988755e-05, "loss": 1.1008666038513184, "num_input_tokens_seen": 4395211200, "step": 15460, "train_runtime": 150589.836, "train_tokens_per_second": 29186.639 }, { "epoch": 0.5473599479884212, "grad_norm": 1.3828125, "learning_rate": 3.133026423172764e-05, "loss": 1.0695835113525392, "num_input_tokens_seen": 4398042880, "step": 15470, "train_runtime": 150686.2214, "train_tokens_per_second": 29186.762 }, { "epoch": 0.54771376825215, "grad_norm": 1.5, "learning_rate": 3.1324115376010897e-05, "loss": 1.1110475540161133, "num_input_tokens_seen": 4400883648, "step": 15480, "train_runtime": 150783.6344, "train_tokens_per_second": 29186.746 }, { "epoch": 0.5480675885158788, "grad_norm": 1.4296875, "learning_rate": 3.131797013918406e-05, "loss": 1.1030634880065917, "num_input_tokens_seen": 4403774336, "step": 15490, "train_runtime": 150883.8632, "train_tokens_per_second": 29186.516 }, { "epoch": 0.5484214087796075, "grad_norm": 1.453125, "learning_rate": 3.13118285176987e-05, "loss": 1.0888117790222167, "num_input_tokens_seen": 4406650432, "step": 15500, "train_runtime": 150985.6229, "train_tokens_per_second": 29185.894 }, { "epoch": 0.5487752290433363, "grad_norm": 1.421875, "learning_rate": 3.130569050801126e-05, "loss": 1.1040544509887695, "num_input_tokens_seen": 4409492992, "step": 15510, "train_runtime": 151088.099, "train_tokens_per_second": 29184.913 }, { "epoch": 0.5491290493070651, "grad_norm": 1.40625, "learning_rate": 3.129955610658306e-05, "loss": 1.0858856201171876, "num_input_tokens_seen": 4412328704, "step": 15520, "train_runtime": 151185.1827, "train_tokens_per_second": 29184.928 }, { "epoch": 0.549482869570794, "grad_norm": 1.421875, "learning_rate": 3.129342530988025e-05, "loss": 1.1064414978027344, "num_input_tokens_seen": 4415215616, "step": 15530, "train_runtime": 151285.3065, "train_tokens_per_second": 29184.696 }, { "epoch": 0.5498366898345227, "grad_norm": 1.40625, "learning_rate": 3.128729811437385e-05, "loss": 1.096492862701416, "num_input_tokens_seen": 4418009344, "step": 15540, "train_runtime": 151378.4056, "train_tokens_per_second": 29185.202 }, { "epoch": 0.5501905100982515, "grad_norm": 1.4375, "learning_rate": 3.12811745165397e-05, "loss": 1.0954319000244142, "num_input_tokens_seen": 4420809344, "step": 15550, "train_runtime": 151474.0058, "train_tokens_per_second": 29185.267 }, { "epoch": 0.5505443303619802, "grad_norm": 1.4453125, "learning_rate": 3.127505451285846e-05, "loss": 1.0932269096374512, "num_input_tokens_seen": 4423656192, "step": 15560, "train_runtime": 151569.806, "train_tokens_per_second": 29185.603 }, { "epoch": 0.550898150625709, "grad_norm": 1.5, "learning_rate": 3.126893809981563e-05, "loss": 1.0970354080200195, "num_input_tokens_seen": 4426493120, "step": 15570, "train_runtime": 151665.5511, "train_tokens_per_second": 29185.884 }, { "epoch": 0.5512519708894378, "grad_norm": 1.4609375, "learning_rate": 3.126282527390149e-05, "loss": 1.087992286682129, "num_input_tokens_seen": 4429351104, "step": 15580, "train_runtime": 151763.6139, "train_tokens_per_second": 29185.857 }, { "epoch": 0.5516057911531665, "grad_norm": 1.4609375, "learning_rate": 3.1256716031611146e-05, "loss": 1.10123872756958, "num_input_tokens_seen": 4432209088, "step": 15590, "train_runtime": 151862.7628, "train_tokens_per_second": 29185.621 }, { "epoch": 0.5519596114168953, "grad_norm": 1.5234375, "learning_rate": 3.1250610369444475e-05, "loss": 1.0992961883544923, "num_input_tokens_seen": 4435005440, "step": 15600, "train_runtime": 151957.2331, "train_tokens_per_second": 29185.879 }, { "epoch": 0.5523134316806242, "grad_norm": 1.3984375, "learning_rate": 3.124450828390616e-05, "loss": 1.0977477073669433, "num_input_tokens_seen": 4437808960, "step": 15610, "train_runtime": 152051.4416, "train_tokens_per_second": 29186.234 }, { "epoch": 0.552667251944353, "grad_norm": 1.46875, "learning_rate": 3.123840977150566e-05, "loss": 1.0966440200805665, "num_input_tokens_seen": 4440682112, "step": 15620, "train_runtime": 152150.0325, "train_tokens_per_second": 29186.205 }, { "epoch": 0.5530210722080817, "grad_norm": 1.453125, "learning_rate": 3.123231482875717e-05, "loss": 1.1073192596435546, "num_input_tokens_seen": 4443432064, "step": 15630, "train_runtime": 152243.4503, "train_tokens_per_second": 29186.359 }, { "epoch": 0.5533748924718105, "grad_norm": 1.4765625, "learning_rate": 3.122622345217967e-05, "loss": 1.101778793334961, "num_input_tokens_seen": 4446262656, "step": 15640, "train_runtime": 152338.9995, "train_tokens_per_second": 29186.634 }, { "epoch": 0.5537287127355393, "grad_norm": 1.4140625, "learning_rate": 3.12201356382969e-05, "loss": 1.100726318359375, "num_input_tokens_seen": 4449059968, "step": 15650, "train_runtime": 152431.9496, "train_tokens_per_second": 29187.188 }, { "epoch": 0.554082532999268, "grad_norm": 1.3984375, "learning_rate": 3.1214051383637304e-05, "loss": 1.0887067794799805, "num_input_tokens_seen": 4451883072, "step": 15660, "train_runtime": 152529.2713, "train_tokens_per_second": 29187.074 }, { "epoch": 0.5544363532629968, "grad_norm": 1.4765625, "learning_rate": 3.1207970684734104e-05, "loss": 1.1054166793823241, "num_input_tokens_seen": 4454731648, "step": 15670, "train_runtime": 152627.8194, "train_tokens_per_second": 29186.892 }, { "epoch": 0.5547901735267255, "grad_norm": 1.484375, "learning_rate": 3.120189353812521e-05, "loss": 1.1081710815429688, "num_input_tokens_seen": 4457504576, "step": 15680, "train_runtime": 152722.3296, "train_tokens_per_second": 29186.987 }, { "epoch": 0.5551439937904544, "grad_norm": 1.484375, "learning_rate": 3.1195819940353294e-05, "loss": 1.1078763961791993, "num_input_tokens_seen": 4460403072, "step": 15690, "train_runtime": 152823.112, "train_tokens_per_second": 29186.705 }, { "epoch": 0.5554978140541832, "grad_norm": 1.359375, "learning_rate": 3.1189749887965684e-05, "loss": 1.0896400451660155, "num_input_tokens_seen": 4463253248, "step": 15700, "train_runtime": 152920.9078, "train_tokens_per_second": 29186.678 }, { "epoch": 0.555851634317912, "grad_norm": 1.5, "learning_rate": 3.118368337751443e-05, "loss": 1.0881017684936523, "num_input_tokens_seen": 4466122112, "step": 15710, "train_runtime": 153019.3007, "train_tokens_per_second": 29186.659 }, { "epoch": 0.5562054545816407, "grad_norm": 1.5, "learning_rate": 3.1177620405556305e-05, "loss": 1.0928945541381836, "num_input_tokens_seen": 4468945472, "step": 15720, "train_runtime": 153112.8285, "train_tokens_per_second": 29187.27 }, { "epoch": 0.5565592748453695, "grad_norm": 1.4765625, "learning_rate": 3.117156096865272e-05, "loss": 1.083473014831543, "num_input_tokens_seen": 4471820544, "step": 15730, "train_runtime": 153210.3466, "train_tokens_per_second": 29187.458 }, { "epoch": 0.5569130951090983, "grad_norm": 1.546875, "learning_rate": 3.116550506336979e-05, "loss": 1.0952303886413575, "num_input_tokens_seen": 4474630848, "step": 15740, "train_runtime": 153304.2605, "train_tokens_per_second": 29187.909 }, { "epoch": 0.557266915372827, "grad_norm": 1.40625, "learning_rate": 3.11594526862783e-05, "loss": 1.093082809448242, "num_input_tokens_seen": 4477449344, "step": 15750, "train_runtime": 153400.8369, "train_tokens_per_second": 29187.907 }, { "epoch": 0.5576207356365558, "grad_norm": 1.4453125, "learning_rate": 3.115340383395367e-05, "loss": 1.1097824096679687, "num_input_tokens_seen": 4480296448, "step": 15760, "train_runtime": 153498.266, "train_tokens_per_second": 29187.929 }, { "epoch": 0.5579745559002846, "grad_norm": 1.46875, "learning_rate": 3.1147358502975995e-05, "loss": 1.090419387817383, "num_input_tokens_seen": 4483132544, "step": 15770, "train_runtime": 153593.2888, "train_tokens_per_second": 29188.336 }, { "epoch": 0.5583283761640134, "grad_norm": 1.453125, "learning_rate": 3.114131668993e-05, "loss": 1.0836040496826171, "num_input_tokens_seen": 4486022528, "step": 15780, "train_runtime": 153694.966, "train_tokens_per_second": 29187.83 }, { "epoch": 0.5586821964277422, "grad_norm": 1.421875, "learning_rate": 3.113527839140507e-05, "loss": 1.0928377151489257, "num_input_tokens_seen": 4488831680, "step": 15790, "train_runtime": 153789.6718, "train_tokens_per_second": 29188.122 }, { "epoch": 0.559036016691471, "grad_norm": 1.5, "learning_rate": 3.112924360399517e-05, "loss": 1.0948768615722657, "num_input_tokens_seen": 4491701632, "step": 15800, "train_runtime": 153885.8063, "train_tokens_per_second": 29188.538 }, { "epoch": 0.5593898369551997, "grad_norm": 1.4140625, "learning_rate": 3.112321232429894e-05, "loss": 1.0950164794921875, "num_input_tokens_seen": 4494555328, "step": 15810, "train_runtime": 153984.9977, "train_tokens_per_second": 29188.268 }, { "epoch": 0.5597436572189285, "grad_norm": 1.4296875, "learning_rate": 3.11171845489196e-05, "loss": 1.1019578933715821, "num_input_tokens_seen": 4497396288, "step": 15820, "train_runtime": 154085.0991, "train_tokens_per_second": 29187.743 }, { "epoch": 0.5600974774826573, "grad_norm": 1.4921875, "learning_rate": 3.1111160274464965e-05, "loss": 1.1111499786376953, "num_input_tokens_seen": 4500270336, "step": 15830, "train_runtime": 154182.4537, "train_tokens_per_second": 29187.954 }, { "epoch": 0.560451297746386, "grad_norm": 1.4609375, "learning_rate": 3.1105139497547466e-05, "loss": 1.0959906578063965, "num_input_tokens_seen": 4503136000, "step": 15840, "train_runtime": 154281.0117, "train_tokens_per_second": 29187.882 }, { "epoch": 0.5608051180101148, "grad_norm": 1.3828125, "learning_rate": 3.109912221478411e-05, "loss": 1.1004793167114257, "num_input_tokens_seen": 4505967552, "step": 15850, "train_runtime": 154374.0107, "train_tokens_per_second": 29188.641 }, { "epoch": 0.5611589382738437, "grad_norm": 1.421875, "learning_rate": 3.10931084227965e-05, "loss": 1.111363983154297, "num_input_tokens_seen": 4508822272, "step": 15860, "train_runtime": 154472.6551, "train_tokens_per_second": 29188.482 }, { "epoch": 0.5615127585375724, "grad_norm": 1.3984375, "learning_rate": 3.108709811821079e-05, "loss": 1.093797492980957, "num_input_tokens_seen": 4511687872, "step": 15870, "train_runtime": 154568.6383, "train_tokens_per_second": 29188.896 }, { "epoch": 0.5618665788013012, "grad_norm": 1.5, "learning_rate": 3.1081091297657696e-05, "loss": 1.102625560760498, "num_input_tokens_seen": 4514513728, "step": 15880, "train_runtime": 154664.7529, "train_tokens_per_second": 29189.028 }, { "epoch": 0.56222039906503, "grad_norm": 1.421875, "learning_rate": 3.107508795777251e-05, "loss": 1.1006938934326171, "num_input_tokens_seen": 4517418432, "step": 15890, "train_runtime": 154765.1946, "train_tokens_per_second": 29188.852 }, { "epoch": 0.5625742193287587, "grad_norm": 1.421875, "learning_rate": 3.1069088095195056e-05, "loss": 1.0954530715942383, "num_input_tokens_seen": 4520242240, "step": 15900, "train_runtime": 154861.7181, "train_tokens_per_second": 29188.894 }, { "epoch": 0.5629280395924875, "grad_norm": 1.4375, "learning_rate": 3.1063091706569703e-05, "loss": 1.1035541534423827, "num_input_tokens_seen": 4523114112, "step": 15910, "train_runtime": 154961.8216, "train_tokens_per_second": 29188.571 }, { "epoch": 0.5632818598562163, "grad_norm": 1.453125, "learning_rate": 3.105709878854535e-05, "loss": 1.0915435791015624, "num_input_tokens_seen": 4525934080, "step": 15920, "train_runtime": 155055.8094, "train_tokens_per_second": 29189.065 }, { "epoch": 0.563635680119945, "grad_norm": 1.4375, "learning_rate": 3.105110933777541e-05, "loss": 1.1024755477905273, "num_input_tokens_seen": 4528804608, "step": 15930, "train_runtime": 155155.5647, "train_tokens_per_second": 29188.799 }, { "epoch": 0.5639895003836739, "grad_norm": 1.4375, "learning_rate": 3.104512335091783e-05, "loss": 1.0822784423828125, "num_input_tokens_seen": 4531621824, "step": 15940, "train_runtime": 155251.2849, "train_tokens_per_second": 29188.949 }, { "epoch": 0.5643433206474027, "grad_norm": 1.4375, "learning_rate": 3.1039140824635074e-05, "loss": 1.100897216796875, "num_input_tokens_seen": 4534456960, "step": 15950, "train_runtime": 155347.3771, "train_tokens_per_second": 29189.144 }, { "epoch": 0.5646971409111314, "grad_norm": 1.4375, "learning_rate": 3.103316175559406e-05, "loss": 1.0912737846374512, "num_input_tokens_seen": 4537251712, "step": 15960, "train_runtime": 155439.4289, "train_tokens_per_second": 29189.838 }, { "epoch": 0.5650509611748602, "grad_norm": 1.4140625, "learning_rate": 3.102718614046624e-05, "loss": 1.0967851638793946, "num_input_tokens_seen": 4540102528, "step": 15970, "train_runtime": 155539.6172, "train_tokens_per_second": 29189.364 }, { "epoch": 0.565404781438589, "grad_norm": 1.484375, "learning_rate": 3.1021213975927546e-05, "loss": 1.0907953262329102, "num_input_tokens_seen": 4542922176, "step": 15980, "train_runtime": 155635.8547, "train_tokens_per_second": 29189.432 }, { "epoch": 0.5657586017023177, "grad_norm": 1.4453125, "learning_rate": 3.1015245258658374e-05, "loss": 1.0972389221191405, "num_input_tokens_seen": 4545801856, "step": 15990, "train_runtime": 155735.5036, "train_tokens_per_second": 29189.246 }, { "epoch": 0.5661124219660465, "grad_norm": 1.46875, "learning_rate": 3.1009279985343606e-05, "loss": 1.1026800155639649, "num_input_tokens_seen": 4548607936, "step": 16000, "train_runtime": 155829.477, "train_tokens_per_second": 29189.65 }, { "epoch": 0.5664662422297753, "grad_norm": 1.4609375, "learning_rate": 3.100331815267255e-05, "loss": 1.083327865600586, "num_input_tokens_seen": 4551433344, "step": 16010, "train_runtime": 155925.7021, "train_tokens_per_second": 29189.757 }, { "epoch": 0.566820062493504, "grad_norm": 1.4375, "learning_rate": 3.099735975733902e-05, "loss": 1.103782844543457, "num_input_tokens_seen": 4554319296, "step": 16020, "train_runtime": 156024.8979, "train_tokens_per_second": 29189.696 }, { "epoch": 0.5671738827572329, "grad_norm": 1.4765625, "learning_rate": 3.099140479604123e-05, "loss": 1.1188199996948243, "num_input_tokens_seen": 4557161024, "step": 16030, "train_runtime": 156122.2412, "train_tokens_per_second": 29189.698 }, { "epoch": 0.5675277030209617, "grad_norm": 1.4375, "learning_rate": 3.098545326548186e-05, "loss": 1.0935213088989257, "num_input_tokens_seen": 4559967424, "step": 16040, "train_runtime": 156219.2943, "train_tokens_per_second": 29189.528 }, { "epoch": 0.5678815232846904, "grad_norm": 1.4140625, "learning_rate": 3.0979505162368014e-05, "loss": 1.0943670272827148, "num_input_tokens_seen": 4562896704, "step": 16050, "train_runtime": 156322.85, "train_tokens_per_second": 29188.93 }, { "epoch": 0.5682353435484192, "grad_norm": 1.4140625, "learning_rate": 3.097356048341121e-05, "loss": 1.091106128692627, "num_input_tokens_seen": 4565749120, "step": 16060, "train_runtime": 156421.1992, "train_tokens_per_second": 29188.813 }, { "epoch": 0.568589163812148, "grad_norm": 1.4296875, "learning_rate": 3.0967619225327396e-05, "loss": 1.089901065826416, "num_input_tokens_seen": 4568584384, "step": 16070, "train_runtime": 156516.5518, "train_tokens_per_second": 29189.145 }, { "epoch": 0.5689429840758767, "grad_norm": 1.4453125, "learning_rate": 3.0961681384836924e-05, "loss": 1.1129552841186523, "num_input_tokens_seen": 4571418688, "step": 16080, "train_runtime": 156610.8427, "train_tokens_per_second": 29189.669 }, { "epoch": 0.5692968043396055, "grad_norm": 1.4296875, "learning_rate": 3.095574695866453e-05, "loss": 1.0970922470092774, "num_input_tokens_seen": 4574281664, "step": 16090, "train_runtime": 156709.3855, "train_tokens_per_second": 29189.583 }, { "epoch": 0.5696506246033343, "grad_norm": 1.4609375, "learning_rate": 3.0949815943539355e-05, "loss": 1.0968297004699707, "num_input_tokens_seen": 4577187776, "step": 16100, "train_runtime": 156811.5678, "train_tokens_per_second": 29189.095 }, { "epoch": 0.5700044448670631, "grad_norm": 1.46875, "learning_rate": 3.094388833619495e-05, "loss": 1.0999921798706054, "num_input_tokens_seen": 4580032448, "step": 16110, "train_runtime": 156907.1198, "train_tokens_per_second": 29189.449 }, { "epoch": 0.5703582651307919, "grad_norm": 1.484375, "learning_rate": 3.0937964133369196e-05, "loss": 1.1031403541564941, "num_input_tokens_seen": 4582878016, "step": 16120, "train_runtime": 157004.9988, "train_tokens_per_second": 29189.376 }, { "epoch": 0.5707120853945207, "grad_norm": 1.46875, "learning_rate": 3.093204333180437e-05, "loss": 1.0962789535522461, "num_input_tokens_seen": 4585753088, "step": 16130, "train_runtime": 157102.9379, "train_tokens_per_second": 29189.48 }, { "epoch": 0.5710659056582494, "grad_norm": 1.4765625, "learning_rate": 3.0926125928247114e-05, "loss": 1.0988807678222656, "num_input_tokens_seen": 4588563328, "step": 16140, "train_runtime": 157195.551, "train_tokens_per_second": 29190.16 }, { "epoch": 0.5714197259219782, "grad_norm": 1.5234375, "learning_rate": 3.092021191944842e-05, "loss": 1.0988398551940919, "num_input_tokens_seen": 4591463744, "step": 16150, "train_runtime": 157295.0003, "train_tokens_per_second": 29190.144 }, { "epoch": 0.571773546185707, "grad_norm": 1.4609375, "learning_rate": 3.091430130216363e-05, "loss": 1.122174072265625, "num_input_tokens_seen": 4594273024, "step": 16160, "train_runtime": 157391.4572, "train_tokens_per_second": 29190.104 }, { "epoch": 0.5721273664494357, "grad_norm": 1.453125, "learning_rate": 3.090839407315242e-05, "loss": 1.0839764595031738, "num_input_tokens_seen": 4597126080, "step": 16170, "train_runtime": 157490.7133, "train_tokens_per_second": 29189.823 }, { "epoch": 0.5724811867131645, "grad_norm": 1.4453125, "learning_rate": 3.0902490229178794e-05, "loss": 1.0895937919616698, "num_input_tokens_seen": 4600000640, "step": 16180, "train_runtime": 157588.204, "train_tokens_per_second": 29190.006 }, { "epoch": 0.5728350069768934, "grad_norm": 1.4765625, "learning_rate": 3.0896589767011104e-05, "loss": 1.1022708892822266, "num_input_tokens_seen": 4602910592, "step": 16190, "train_runtime": 157690.9027, "train_tokens_per_second": 29189.449 }, { "epoch": 0.5731888272406221, "grad_norm": 1.4609375, "learning_rate": 3.0890692683421985e-05, "loss": 1.0977823257446289, "num_input_tokens_seen": 4605728704, "step": 16200, "train_runtime": 157788.1273, "train_tokens_per_second": 29189.324 }, { "epoch": 0.5735426475043509, "grad_norm": 1.453125, "learning_rate": 3.088479897518843e-05, "loss": 1.0876147270202636, "num_input_tokens_seen": 4608575232, "step": 16210, "train_runtime": 157887.3794, "train_tokens_per_second": 29189.003 }, { "epoch": 0.5738964677680797, "grad_norm": 1.4140625, "learning_rate": 3.087890863909168e-05, "loss": 1.0891738891601563, "num_input_tokens_seen": 4611442048, "step": 16220, "train_runtime": 157986.347, "train_tokens_per_second": 29188.864 }, { "epoch": 0.5742502880318084, "grad_norm": 1.4140625, "learning_rate": 3.087302167191732e-05, "loss": 1.0904061317443847, "num_input_tokens_seen": 4614256512, "step": 16230, "train_runtime": 158081.2465, "train_tokens_per_second": 29189.146 }, { "epoch": 0.5746041082955372, "grad_norm": 1.484375, "learning_rate": 3.086713807045518e-05, "loss": 1.0983211517333984, "num_input_tokens_seen": 4617124736, "step": 16240, "train_runtime": 158178.841, "train_tokens_per_second": 29189.269 }, { "epoch": 0.574957928559266, "grad_norm": 1.40625, "learning_rate": 3.086125783149941e-05, "loss": 1.1054360389709472, "num_input_tokens_seen": 4620004160, "step": 16250, "train_runtime": 158280.7379, "train_tokens_per_second": 29188.67 }, { "epoch": 0.5753117488229947, "grad_norm": 1.453125, "learning_rate": 3.0855380951848404e-05, "loss": 1.0865482330322265, "num_input_tokens_seen": 4622785792, "step": 16260, "train_runtime": 158373.3303, "train_tokens_per_second": 29189.168 }, { "epoch": 0.5756655690867235, "grad_norm": 1.4375, "learning_rate": 3.084950742830484e-05, "loss": 1.0817226409912108, "num_input_tokens_seen": 4625604160, "step": 16270, "train_runtime": 158468.545, "train_tokens_per_second": 29189.415 }, { "epoch": 0.5760193893504524, "grad_norm": 1.4140625, "learning_rate": 3.0843637257675654e-05, "loss": 1.0987147331237792, "num_input_tokens_seen": 4628437632, "step": 16280, "train_runtime": 158565.669, "train_tokens_per_second": 29189.406 }, { "epoch": 0.5763732096141811, "grad_norm": 1.4375, "learning_rate": 3.083777043677202e-05, "loss": 1.0940322875976562, "num_input_tokens_seen": 4631296000, "step": 16290, "train_runtime": 158666.2514, "train_tokens_per_second": 29188.917 }, { "epoch": 0.5767270298779099, "grad_norm": 1.4609375, "learning_rate": 3.083190696240936e-05, "loss": 1.0987180709838866, "num_input_tokens_seen": 4634136512, "step": 16300, "train_runtime": 158762.912, "train_tokens_per_second": 29189.037 }, { "epoch": 0.5770808501416387, "grad_norm": 1.4375, "learning_rate": 3.082604683140735e-05, "loss": 1.104232406616211, "num_input_tokens_seen": 4636912320, "step": 16310, "train_runtime": 158856.2223, "train_tokens_per_second": 29189.365 }, { "epoch": 0.5774346704053674, "grad_norm": 1.421875, "learning_rate": 3.082019004058987e-05, "loss": 1.091866683959961, "num_input_tokens_seen": 4639789184, "step": 16320, "train_runtime": 158954.7447, "train_tokens_per_second": 29189.372 }, { "epoch": 0.5777884906690962, "grad_norm": 1.453125, "learning_rate": 3.081433658678505e-05, "loss": 1.1110514640808105, "num_input_tokens_seen": 4642627456, "step": 16330, "train_runtime": 159054.1179, "train_tokens_per_second": 29188.98 }, { "epoch": 0.578142310932825, "grad_norm": 1.5, "learning_rate": 3.080848646682521e-05, "loss": 1.0920642852783202, "num_input_tokens_seen": 4645507840, "step": 16340, "train_runtime": 159154.262, "train_tokens_per_second": 29188.712 }, { "epoch": 0.5784961311965537, "grad_norm": 1.5625, "learning_rate": 3.080263967754689e-05, "loss": 1.0935344696044922, "num_input_tokens_seen": 4648344960, "step": 16350, "train_runtime": 159250.2561, "train_tokens_per_second": 29188.932 }, { "epoch": 0.5788499514602826, "grad_norm": 1.515625, "learning_rate": 3.079679621579083e-05, "loss": 1.0941923141479493, "num_input_tokens_seen": 4651201088, "step": 16360, "train_runtime": 159346.0958, "train_tokens_per_second": 29189.301 }, { "epoch": 0.5792037717240114, "grad_norm": 1.3828125, "learning_rate": 3.079095607840197e-05, "loss": 1.1140329360961914, "num_input_tokens_seen": 4654067008, "step": 16370, "train_runtime": 159444.6865, "train_tokens_per_second": 29189.226 }, { "epoch": 0.5795575919877402, "grad_norm": 1.4609375, "learning_rate": 3.0785119262229416e-05, "loss": 1.1076531410217285, "num_input_tokens_seen": 4656871680, "step": 16380, "train_runtime": 159537.9012, "train_tokens_per_second": 29189.751 }, { "epoch": 0.5799114122514689, "grad_norm": 1.40625, "learning_rate": 3.0779285764126485e-05, "loss": 1.0871011734008789, "num_input_tokens_seen": 4659745472, "step": 16390, "train_runtime": 159634.5113, "train_tokens_per_second": 29190.088 }, { "epoch": 0.5802652325151977, "grad_norm": 1.484375, "learning_rate": 3.077345558095064e-05, "loss": 1.082573699951172, "num_input_tokens_seen": 4662502656, "step": 16400, "train_runtime": 159724.0189, "train_tokens_per_second": 29190.993 }, { "epoch": 0.5806190527789264, "grad_norm": 1.46875, "learning_rate": 3.076762870956352e-05, "loss": 1.092704963684082, "num_input_tokens_seen": 4665291584, "step": 16410, "train_runtime": 159819.8018, "train_tokens_per_second": 29190.948 }, { "epoch": 0.5809728730426552, "grad_norm": 1.46875, "learning_rate": 3.076180514683092e-05, "loss": 1.0958224296569825, "num_input_tokens_seen": 4668126080, "step": 16420, "train_runtime": 159918.4421, "train_tokens_per_second": 29190.668 }, { "epoch": 0.581326693306384, "grad_norm": 1.3984375, "learning_rate": 3.075598488962278e-05, "loss": 1.0964084625244142, "num_input_tokens_seen": 4670958656, "step": 16430, "train_runtime": 160015.9544, "train_tokens_per_second": 29190.581 }, { "epoch": 0.5816805135701129, "grad_norm": 1.4921875, "learning_rate": 3.0750167934813207e-05, "loss": 1.0976393699645997, "num_input_tokens_seen": 4673823552, "step": 16440, "train_runtime": 160116.9374, "train_tokens_per_second": 29190.063 }, { "epoch": 0.5820343338338416, "grad_norm": 1.4296875, "learning_rate": 3.074435427928041e-05, "loss": 1.1124701499938965, "num_input_tokens_seen": 4676659520, "step": 16450, "train_runtime": 160213.6744, "train_tokens_per_second": 29190.14 }, { "epoch": 0.5823881540975704, "grad_norm": 1.4765625, "learning_rate": 3.073854391990675e-05, "loss": 1.0831924438476563, "num_input_tokens_seen": 4679561536, "step": 16460, "train_runtime": 160312.8935, "train_tokens_per_second": 29190.176 }, { "epoch": 0.5827419743612992, "grad_norm": 1.4140625, "learning_rate": 3.073273685357871e-05, "loss": 1.0927404403686523, "num_input_tokens_seen": 4682363072, "step": 16470, "train_runtime": 160407.3232, "train_tokens_per_second": 29190.457 }, { "epoch": 0.5830957946250279, "grad_norm": 1.4453125, "learning_rate": 3.072693307718689e-05, "loss": 1.0950761795043946, "num_input_tokens_seen": 4685215616, "step": 16480, "train_runtime": 160505.6131, "train_tokens_per_second": 29190.354 }, { "epoch": 0.5834496148887567, "grad_norm": 1.3984375, "learning_rate": 3.0721132587626e-05, "loss": 1.1046653747558595, "num_input_tokens_seen": 4687993344, "step": 16490, "train_runtime": 160598.0263, "train_tokens_per_second": 29190.853 }, { "epoch": 0.5838034351524855, "grad_norm": 1.4140625, "learning_rate": 3.071533538179482e-05, "loss": 1.113405418395996, "num_input_tokens_seen": 4690838592, "step": 16500, "train_runtime": 160697.2545, "train_tokens_per_second": 29190.534 }, { "epoch": 0.5841572554162142, "grad_norm": 1.4375, "learning_rate": 3.070954145659627e-05, "loss": 1.0783203125, "num_input_tokens_seen": 4693651456, "step": 16510, "train_runtime": 160792.1861, "train_tokens_per_second": 29190.793 }, { "epoch": 0.584511075679943, "grad_norm": 1.4453125, "learning_rate": 3.070375080893734e-05, "loss": 1.1018409729003906, "num_input_tokens_seen": 4696469440, "step": 16520, "train_runtime": 160884.5834, "train_tokens_per_second": 29191.544 }, { "epoch": 0.5848648959436719, "grad_norm": 1.4375, "learning_rate": 3.06979634357291e-05, "loss": 1.0934564590454101, "num_input_tokens_seen": 4699296576, "step": 16530, "train_runtime": 160981.4188, "train_tokens_per_second": 29191.547 }, { "epoch": 0.5852187162074006, "grad_norm": 1.4609375, "learning_rate": 3.0692179333886686e-05, "loss": 1.0985864639282226, "num_input_tokens_seen": 4702138112, "step": 16540, "train_runtime": 161076.2394, "train_tokens_per_second": 29192.003 }, { "epoch": 0.5855725364711294, "grad_norm": 1.4140625, "learning_rate": 3.068639850032933e-05, "loss": 1.0992287635803222, "num_input_tokens_seen": 4705041280, "step": 16550, "train_runtime": 161177.5383, "train_tokens_per_second": 29191.669 }, { "epoch": 0.5859263567348582, "grad_norm": 1.5078125, "learning_rate": 3.068062093198028e-05, "loss": 1.0850433349609374, "num_input_tokens_seen": 4707861184, "step": 16560, "train_runtime": 161274.4075, "train_tokens_per_second": 29191.62 }, { "epoch": 0.5862801769985869, "grad_norm": 1.4765625, "learning_rate": 3.067484662576687e-05, "loss": 1.0919729232788087, "num_input_tokens_seen": 4710654208, "step": 16570, "train_runtime": 161368.3874, "train_tokens_per_second": 29191.927 }, { "epoch": 0.5866339972623157, "grad_norm": 1.4921875, "learning_rate": 3.066907557862048e-05, "loss": 1.1082036972045899, "num_input_tokens_seen": 4713473728, "step": 16580, "train_runtime": 161465.2313, "train_tokens_per_second": 29191.88 }, { "epoch": 0.5869878175260445, "grad_norm": 1.421875, "learning_rate": 3.066330778747651e-05, "loss": 1.0777200698852538, "num_input_tokens_seen": 4716275520, "step": 16590, "train_runtime": 161561.6525, "train_tokens_per_second": 29191.8 }, { "epoch": 0.5873416377897732, "grad_norm": 1.453125, "learning_rate": 3.065754324927441e-05, "loss": 1.0964981079101563, "num_input_tokens_seen": 4719098112, "step": 16600, "train_runtime": 161659.212, "train_tokens_per_second": 29191.644 }, { "epoch": 0.5876954580535021, "grad_norm": 1.4921875, "learning_rate": 3.065178196095765e-05, "loss": 1.0978200912475586, "num_input_tokens_seen": 4721976000, "step": 16610, "train_runtime": 161758.1394, "train_tokens_per_second": 29191.582 }, { "epoch": 0.5880492783172309, "grad_norm": 1.53125, "learning_rate": 3.064602391947372e-05, "loss": 1.0874610900878907, "num_input_tokens_seen": 4724850880, "step": 16620, "train_runtime": 161857.3038, "train_tokens_per_second": 29191.459 }, { "epoch": 0.5884030985809596, "grad_norm": 1.5859375, "learning_rate": 3.0640269121774126e-05, "loss": 1.103624153137207, "num_input_tokens_seen": 4727732864, "step": 16630, "train_runtime": 161957.2067, "train_tokens_per_second": 29191.247 }, { "epoch": 0.5887569188446884, "grad_norm": 1.4609375, "learning_rate": 3.063451756481437e-05, "loss": 1.096430778503418, "num_input_tokens_seen": 4730596480, "step": 16640, "train_runtime": 162056.1642, "train_tokens_per_second": 29191.092 }, { "epoch": 0.5891107391084172, "grad_norm": 1.40625, "learning_rate": 3.062876924555396e-05, "loss": 1.0871400833129883, "num_input_tokens_seen": 4733436416, "step": 16650, "train_runtime": 162152.2593, "train_tokens_per_second": 29191.307 }, { "epoch": 0.5894645593721459, "grad_norm": 1.421875, "learning_rate": 3.06230241609564e-05, "loss": 1.0895965576171875, "num_input_tokens_seen": 4736315712, "step": 16660, "train_runtime": 162250.9113, "train_tokens_per_second": 29191.304 }, { "epoch": 0.5898183796358747, "grad_norm": 1.4609375, "learning_rate": 3.061728230798916e-05, "loss": 1.0916547775268555, "num_input_tokens_seen": 4739207104, "step": 16670, "train_runtime": 162350.2769, "train_tokens_per_second": 29191.247 }, { "epoch": 0.5901721998996035, "grad_norm": 1.4375, "learning_rate": 3.061154368362373e-05, "loss": 1.102214527130127, "num_input_tokens_seen": 4742024256, "step": 16680, "train_runtime": 162447.3676, "train_tokens_per_second": 29191.143 }, { "epoch": 0.5905260201633323, "grad_norm": 1.4296875, "learning_rate": 3.060580828483552e-05, "loss": 1.1019763946533203, "num_input_tokens_seen": 4744898496, "step": 16690, "train_runtime": 162547.0219, "train_tokens_per_second": 29190.929 }, { "epoch": 0.5908798404270611, "grad_norm": 1.3828125, "learning_rate": 3.060007610860395e-05, "loss": 1.0941965103149414, "num_input_tokens_seen": 4747769280, "step": 16700, "train_runtime": 162644.4956, "train_tokens_per_second": 29191.085 }, { "epoch": 0.5912336606907899, "grad_norm": 1.5, "learning_rate": 3.059434715191236e-05, "loss": 1.0862497329711913, "num_input_tokens_seen": 4750639936, "step": 16710, "train_runtime": 162743.4136, "train_tokens_per_second": 29190.981 }, { "epoch": 0.5915874809545186, "grad_norm": 1.4921875, "learning_rate": 3.0588621411748074e-05, "loss": 1.0978269577026367, "num_input_tokens_seen": 4753437632, "step": 16720, "train_runtime": 162835.5379, "train_tokens_per_second": 29191.648 }, { "epoch": 0.5919413012182474, "grad_norm": 1.40625, "learning_rate": 3.0582898885102344e-05, "loss": 1.0986330032348632, "num_input_tokens_seen": 4756237120, "step": 16730, "train_runtime": 162926.9518, "train_tokens_per_second": 29192.451 }, { "epoch": 0.5922951214819762, "grad_norm": 1.5625, "learning_rate": 3.0577179568970366e-05, "loss": 1.0953177452087401, "num_input_tokens_seen": 4759045184, "step": 16740, "train_runtime": 163022.3496, "train_tokens_per_second": 29192.594 }, { "epoch": 0.5926489417457049, "grad_norm": 1.5, "learning_rate": 3.057146346035127e-05, "loss": 1.0803657531738282, "num_input_tokens_seen": 4761911616, "step": 16750, "train_runtime": 163120.1687, "train_tokens_per_second": 29192.66 }, { "epoch": 0.5930027620094337, "grad_norm": 1.40625, "learning_rate": 3.056575055624811e-05, "loss": 1.0998851776123046, "num_input_tokens_seen": 4764743872, "step": 16760, "train_runtime": 163215.051, "train_tokens_per_second": 29193.042 }, { "epoch": 0.5933565822731625, "grad_norm": 1.4609375, "learning_rate": 3.0560040853667846e-05, "loss": 1.0969873428344727, "num_input_tokens_seen": 4767652416, "step": 16770, "train_runtime": 163319.6484, "train_tokens_per_second": 29192.155 }, { "epoch": 0.5937104025368913, "grad_norm": 1.3515625, "learning_rate": 3.0554334349621366e-05, "loss": 1.092568302154541, "num_input_tokens_seen": 4770495296, "step": 16780, "train_runtime": 163417.5826, "train_tokens_per_second": 29192.056 }, { "epoch": 0.5940642228006201, "grad_norm": 1.453125, "learning_rate": 3.054863104112347e-05, "loss": 1.0889858245849608, "num_input_tokens_seen": 4773229056, "step": 16790, "train_runtime": 163511.1766, "train_tokens_per_second": 29192.066 }, { "epoch": 0.5944180430643489, "grad_norm": 1.4609375, "learning_rate": 3.0542930925192835e-05, "loss": 1.0896934509277343, "num_input_tokens_seen": 4776024960, "step": 16800, "train_runtime": 163605.1201, "train_tokens_per_second": 29192.393 }, { "epoch": 0.5947718633280776, "grad_norm": 1.53125, "learning_rate": 3.053723399885205e-05, "loss": 1.1006757736206054, "num_input_tokens_seen": 4778855936, "step": 16810, "train_runtime": 163703.3256, "train_tokens_per_second": 29192.174 }, { "epoch": 0.5951256835918064, "grad_norm": 1.5078125, "learning_rate": 3.0531540259127565e-05, "loss": 1.0932408332824708, "num_input_tokens_seen": 4781725888, "step": 16820, "train_runtime": 163800.7865, "train_tokens_per_second": 29192.326 }, { "epoch": 0.5954795038555352, "grad_norm": 1.546875, "learning_rate": 3.052584970304976e-05, "loss": 1.103687858581543, "num_input_tokens_seen": 4784632384, "step": 16830, "train_runtime": 163902.5704, "train_tokens_per_second": 29191.93 }, { "epoch": 0.5958333241192639, "grad_norm": 1.4609375, "learning_rate": 3.052016232765282e-05, "loss": 1.0926210403442382, "num_input_tokens_seen": 4787526400, "step": 16840, "train_runtime": 164003.5975, "train_tokens_per_second": 29191.594 }, { "epoch": 0.5961871443829927, "grad_norm": 1.5390625, "learning_rate": 3.0514478129974845e-05, "loss": 1.1001875877380372, "num_input_tokens_seen": 4790408000, "step": 16850, "train_runtime": 164104.3717, "train_tokens_per_second": 29191.227 }, { "epoch": 0.5965409646467216, "grad_norm": 1.4296875, "learning_rate": 3.0508797107057785e-05, "loss": 1.1003700256347657, "num_input_tokens_seen": 4793291904, "step": 16860, "train_runtime": 164202.677, "train_tokens_per_second": 29191.314 }, { "epoch": 0.5968947849104503, "grad_norm": 1.4921875, "learning_rate": 3.0503119255947432e-05, "loss": 1.0925004005432128, "num_input_tokens_seen": 4796120448, "step": 16870, "train_runtime": 164300.2393, "train_tokens_per_second": 29191.196 }, { "epoch": 0.5972486051741791, "grad_norm": 1.5234375, "learning_rate": 3.049744457369344e-05, "loss": 1.0863349914550782, "num_input_tokens_seen": 4798935680, "step": 16880, "train_runtime": 164397.9617, "train_tokens_per_second": 29190.968 }, { "epoch": 0.5976024254379079, "grad_norm": 1.40625, "learning_rate": 3.049177305734929e-05, "loss": 1.1031753540039062, "num_input_tokens_seen": 4801809088, "step": 16890, "train_runtime": 164499.0426, "train_tokens_per_second": 29190.499 }, { "epoch": 0.5979562457016366, "grad_norm": 1.5, "learning_rate": 3.04861047039723e-05, "loss": 1.0945579528808593, "num_input_tokens_seen": 4804642752, "step": 16900, "train_runtime": 164595.3738, "train_tokens_per_second": 29190.631 }, { "epoch": 0.5983100659653654, "grad_norm": 1.4609375, "learning_rate": 3.0480439510623638e-05, "loss": 1.0884976387023926, "num_input_tokens_seen": 4807497472, "step": 16910, "train_runtime": 164691.6342, "train_tokens_per_second": 29190.903 }, { "epoch": 0.5986638862290942, "grad_norm": 1.484375, "learning_rate": 3.0474777474368255e-05, "loss": 1.0983901977539063, "num_input_tokens_seen": 4810281792, "step": 16920, "train_runtime": 164783.4129, "train_tokens_per_second": 29191.541 }, { "epoch": 0.5990177064928229, "grad_norm": 1.421875, "learning_rate": 3.046911859227495e-05, "loss": 1.0942093849182128, "num_input_tokens_seen": 4813188032, "step": 16930, "train_runtime": 164881.0774, "train_tokens_per_second": 29191.876 }, { "epoch": 0.5993715267565518, "grad_norm": 1.5, "learning_rate": 3.0463462861416302e-05, "loss": 1.102155876159668, "num_input_tokens_seen": 4816004416, "step": 16940, "train_runtime": 164976.999, "train_tokens_per_second": 29191.975 }, { "epoch": 0.5997253470202806, "grad_norm": 1.453125, "learning_rate": 3.045781027886873e-05, "loss": 1.1043055534362793, "num_input_tokens_seen": 4818798528, "step": 16950, "train_runtime": 165069.2818, "train_tokens_per_second": 29192.582 }, { "epoch": 0.6000791672840093, "grad_norm": 1.4453125, "learning_rate": 3.0452160841712408e-05, "loss": 1.0920918464660645, "num_input_tokens_seen": 4821652480, "step": 16960, "train_runtime": 165170.3979, "train_tokens_per_second": 29191.989 }, { "epoch": 0.6004329875477381, "grad_norm": 1.4609375, "learning_rate": 3.044651454703133e-05, "loss": 1.0912130355834961, "num_input_tokens_seen": 4824476672, "step": 16970, "train_runtime": 165268.614, "train_tokens_per_second": 29191.729 }, { "epoch": 0.6007868078114669, "grad_norm": 1.5078125, "learning_rate": 3.0440871391913257e-05, "loss": 1.0945262908935547, "num_input_tokens_seen": 4827343616, "step": 16980, "train_runtime": 165365.0015, "train_tokens_per_second": 29192.051 }, { "epoch": 0.6011406280751956, "grad_norm": 1.421875, "learning_rate": 3.043523137344973e-05, "loss": 1.0904662132263183, "num_input_tokens_seen": 4830190848, "step": 16990, "train_runtime": 165462.0301, "train_tokens_per_second": 29192.141 }, { "epoch": 0.6014944483389244, "grad_norm": 1.4765625, "learning_rate": 3.0429594488736074e-05, "loss": 1.0914529800415038, "num_input_tokens_seen": 4833028416, "step": 17000, "train_runtime": 165559.2298, "train_tokens_per_second": 29192.141 }, { "epoch": 0.6018482686026532, "grad_norm": 1.453125, "learning_rate": 3.0423960734871348e-05, "loss": 1.0862038612365723, "num_input_tokens_seen": 4835902656, "step": 17010, "train_runtime": 165657.6504, "train_tokens_per_second": 29192.148 }, { "epoch": 0.6022020888663819, "grad_norm": 1.4921875, "learning_rate": 3.0418330108958404e-05, "loss": 1.1011293411254883, "num_input_tokens_seen": 4838743168, "step": 17020, "train_runtime": 165754.348, "train_tokens_per_second": 29192.255 }, { "epoch": 0.6025559091301108, "grad_norm": 1.5234375, "learning_rate": 3.0412702608103828e-05, "loss": 1.0982834815979003, "num_input_tokens_seen": 4841615808, "step": 17030, "train_runtime": 165853.4018, "train_tokens_per_second": 29192.14 }, { "epoch": 0.6029097293938396, "grad_norm": 1.4453125, "learning_rate": 3.0407078229417944e-05, "loss": 1.0963294982910157, "num_input_tokens_seen": 4844434816, "step": 17040, "train_runtime": 165949.2732, "train_tokens_per_second": 29192.263 }, { "epoch": 0.6032635496575683, "grad_norm": 1.4609375, "learning_rate": 3.0401456970014836e-05, "loss": 1.1030233383178711, "num_input_tokens_seen": 4847282624, "step": 17050, "train_runtime": 166046.9135, "train_tokens_per_second": 29192.248 }, { "epoch": 0.6036173699212971, "grad_norm": 1.4609375, "learning_rate": 3.039583882701231e-05, "loss": 1.101303768157959, "num_input_tokens_seen": 4850112192, "step": 17060, "train_runtime": 166145.1997, "train_tokens_per_second": 29192.009 }, { "epoch": 0.6039711901850259, "grad_norm": 1.4140625, "learning_rate": 3.0390223797531887e-05, "loss": 1.0827056884765625, "num_input_tokens_seen": 4852995648, "step": 17070, "train_runtime": 166245.0838, "train_tokens_per_second": 29191.815 }, { "epoch": 0.6043250104487546, "grad_norm": 1.46875, "learning_rate": 3.0384611878698837e-05, "loss": 1.0955751419067383, "num_input_tokens_seen": 4855845952, "step": 17080, "train_runtime": 166343.3742, "train_tokens_per_second": 29191.7 }, { "epoch": 0.6046788307124834, "grad_norm": 1.46875, "learning_rate": 3.0379003067642113e-05, "loss": 1.1060341835021972, "num_input_tokens_seen": 4858639744, "step": 17090, "train_runtime": 166436.3358, "train_tokens_per_second": 29192.182 }, { "epoch": 0.6050326509762122, "grad_norm": 1.4453125, "learning_rate": 3.037339736149441e-05, "loss": 1.0828195571899415, "num_input_tokens_seen": 4861526848, "step": 17100, "train_runtime": 166536.1505, "train_tokens_per_second": 29192.021 }, { "epoch": 0.605386471239941, "grad_norm": 1.4765625, "learning_rate": 3.0367794757392092e-05, "loss": 1.0872723579406738, "num_input_tokens_seen": 4864316736, "step": 17110, "train_runtime": 166630.3133, "train_tokens_per_second": 29192.268 }, { "epoch": 0.6057402915036698, "grad_norm": 1.453125, "learning_rate": 3.0362195252475245e-05, "loss": 1.0839508056640625, "num_input_tokens_seen": 4867139456, "step": 17120, "train_runtime": 166726.4425, "train_tokens_per_second": 29192.367 }, { "epoch": 0.6060941117673986, "grad_norm": 1.4921875, "learning_rate": 3.0356598843887634e-05, "loss": 1.0889789581298828, "num_input_tokens_seen": 4869951104, "step": 17130, "train_runtime": 166822.0911, "train_tokens_per_second": 29192.483 }, { "epoch": 0.6064479320311273, "grad_norm": 1.4765625, "learning_rate": 3.03510055287767e-05, "loss": 1.097985076904297, "num_input_tokens_seen": 4872733760, "step": 17140, "train_runtime": 166915.5678, "train_tokens_per_second": 29192.806 }, { "epoch": 0.6068017522948561, "grad_norm": 1.4921875, "learning_rate": 3.0345415304293578e-05, "loss": 1.0952084541320801, "num_input_tokens_seen": 4875590400, "step": 17150, "train_runtime": 167014.2401, "train_tokens_per_second": 29192.663 }, { "epoch": 0.6071555725585849, "grad_norm": 1.4921875, "learning_rate": 3.0339828167593065e-05, "loss": 1.0912042617797852, "num_input_tokens_seen": 4878444224, "step": 17160, "train_runtime": 167114.136, "train_tokens_per_second": 29192.289 }, { "epoch": 0.6075093928223136, "grad_norm": 1.515625, "learning_rate": 3.033424411583363e-05, "loss": 1.0914927482604981, "num_input_tokens_seen": 4881299392, "step": 17170, "train_runtime": 167209.6986, "train_tokens_per_second": 29192.681 }, { "epoch": 0.6078632130860424, "grad_norm": 1.4921875, "learning_rate": 3.0328663146177387e-05, "loss": 1.1041365623474122, "num_input_tokens_seen": 4884182528, "step": 17180, "train_runtime": 167309.9021, "train_tokens_per_second": 29192.43 }, { "epoch": 0.6082170333497713, "grad_norm": 1.484375, "learning_rate": 3.032308525579013e-05, "loss": 1.0896267890930176, "num_input_tokens_seen": 4887034048, "step": 17190, "train_runtime": 167410.0078, "train_tokens_per_second": 29192.007 }, { "epoch": 0.6085708536135, "grad_norm": 1.484375, "learning_rate": 3.031751044184127e-05, "loss": 1.076206588745117, "num_input_tokens_seen": 4889851008, "step": 17200, "train_runtime": 167506.114, "train_tokens_per_second": 29192.075 }, { "epoch": 0.6089246738772288, "grad_norm": 1.4375, "learning_rate": 3.0311938701503872e-05, "loss": 1.0827105522155762, "num_input_tokens_seen": 4892737344, "step": 17210, "train_runtime": 167604.1311, "train_tokens_per_second": 29192.224 }, { "epoch": 0.6092784941409576, "grad_norm": 1.4453125, "learning_rate": 3.0306370031954646e-05, "loss": 1.0833229064941405, "num_input_tokens_seen": 4895623744, "step": 17220, "train_runtime": 167704.6688, "train_tokens_per_second": 29191.935 }, { "epoch": 0.6096323144046863, "grad_norm": 1.4921875, "learning_rate": 3.030080443037393e-05, "loss": 1.0984199523925782, "num_input_tokens_seen": 4898499072, "step": 17230, "train_runtime": 167801.7973, "train_tokens_per_second": 29192.173 }, { "epoch": 0.6099861346684151, "grad_norm": 1.4453125, "learning_rate": 3.0295241893945663e-05, "loss": 1.1059236526489258, "num_input_tokens_seen": 4901417472, "step": 17240, "train_runtime": 167905.4916, "train_tokens_per_second": 29191.526 }, { "epoch": 0.6103399549321439, "grad_norm": 1.453125, "learning_rate": 3.028968241985743e-05, "loss": 1.0986146926879883, "num_input_tokens_seen": 4904288448, "step": 17250, "train_runtime": 168004.9424, "train_tokens_per_second": 29191.334 }, { "epoch": 0.6106937751958726, "grad_norm": 1.4609375, "learning_rate": 3.0284126005300405e-05, "loss": 1.0951709747314453, "num_input_tokens_seen": 4907094080, "step": 17260, "train_runtime": 168102.0963, "train_tokens_per_second": 29191.153 }, { "epoch": 0.6110475954596014, "grad_norm": 1.4140625, "learning_rate": 3.0278572647469385e-05, "loss": 1.0993926048278808, "num_input_tokens_seen": 4909941952, "step": 17270, "train_runtime": 168202.1115, "train_tokens_per_second": 29190.727 }, { "epoch": 0.6114014157233303, "grad_norm": 1.5234375, "learning_rate": 3.027302234356275e-05, "loss": 1.0908631324768066, "num_input_tokens_seen": 4912768192, "step": 17280, "train_runtime": 168297.2355, "train_tokens_per_second": 29191.021 }, { "epoch": 0.611755235987059, "grad_norm": 1.4453125, "learning_rate": 3.0267475090782494e-05, "loss": 1.0866449356079102, "num_input_tokens_seen": 4915623744, "step": 17290, "train_runtime": 168393.6697, "train_tokens_per_second": 29191.262 }, { "epoch": 0.6121090562507878, "grad_norm": 1.5, "learning_rate": 3.026193088633418e-05, "loss": 1.1042341232299804, "num_input_tokens_seen": 4918438208, "step": 17300, "train_runtime": 168488.9128, "train_tokens_per_second": 29191.465 }, { "epoch": 0.6124628765145166, "grad_norm": 1.4375, "learning_rate": 3.0256389727426952e-05, "loss": 1.0890140533447266, "num_input_tokens_seen": 4921316352, "step": 17310, "train_runtime": 168588.1916, "train_tokens_per_second": 29191.347 }, { "epoch": 0.6128166967782454, "grad_norm": 1.4609375, "learning_rate": 3.0250851611273555e-05, "loss": 1.096203899383545, "num_input_tokens_seen": 4924200896, "step": 17320, "train_runtime": 168688.9609, "train_tokens_per_second": 29191.009 }, { "epoch": 0.6131705170419741, "grad_norm": 1.4296875, "learning_rate": 3.0245316535090273e-05, "loss": 1.0928457260131836, "num_input_tokens_seen": 4927030016, "step": 17330, "train_runtime": 168783.2432, "train_tokens_per_second": 29191.464 }, { "epoch": 0.6135243373057029, "grad_norm": 1.4765625, "learning_rate": 3.023978449609697e-05, "loss": 1.0842462539672852, "num_input_tokens_seen": 4929834496, "step": 17340, "train_runtime": 168878.6244, "train_tokens_per_second": 29191.584 }, { "epoch": 0.6138781575694316, "grad_norm": 1.4609375, "learning_rate": 3.023425549151707e-05, "loss": 1.1089102745056152, "num_input_tokens_seen": 4932647296, "step": 17350, "train_runtime": 168974.7087, "train_tokens_per_second": 29191.631 }, { "epoch": 0.6142319778331605, "grad_norm": 1.4609375, "learning_rate": 3.022872951857754e-05, "loss": 1.0797795295715331, "num_input_tokens_seen": 4935509440, "step": 17360, "train_runtime": 169075.2307, "train_tokens_per_second": 29191.203 }, { "epoch": 0.6145857980968893, "grad_norm": 1.5078125, "learning_rate": 3.0223206574508904e-05, "loss": 1.089653491973877, "num_input_tokens_seen": 4938350144, "step": 17370, "train_runtime": 169171.783, "train_tokens_per_second": 29191.335 }, { "epoch": 0.6149396183606181, "grad_norm": 1.453125, "learning_rate": 3.0217686656545224e-05, "loss": 1.0938947677612305, "num_input_tokens_seen": 4941242176, "step": 17380, "train_runtime": 169272.5752, "train_tokens_per_second": 29191.038 }, { "epoch": 0.6152934386243468, "grad_norm": 1.4609375, "learning_rate": 3.0212169761924077e-05, "loss": 1.0758726119995117, "num_input_tokens_seen": 4944175168, "step": 17390, "train_runtime": 169375.4072, "train_tokens_per_second": 29190.632 }, { "epoch": 0.6156472588880756, "grad_norm": 1.390625, "learning_rate": 3.0206655887886604e-05, "loss": 1.1010332107543945, "num_input_tokens_seen": 4947047616, "step": 17400, "train_runtime": 169474.9204, "train_tokens_per_second": 29190.441 }, { "epoch": 0.6160010791518044, "grad_norm": 1.765625, "learning_rate": 3.0201145031677448e-05, "loss": 1.1021709442138672, "num_input_tokens_seen": 4949891200, "step": 17410, "train_runtime": 169572.5651, "train_tokens_per_second": 29190.401 }, { "epoch": 0.6163548994155331, "grad_norm": 1.46875, "learning_rate": 3.019563719054477e-05, "loss": 1.092070960998535, "num_input_tokens_seen": 4952743552, "step": 17420, "train_runtime": 169671.376, "train_tokens_per_second": 29190.213 }, { "epoch": 0.6167087196792619, "grad_norm": 1.4609375, "learning_rate": 3.019013236174025e-05, "loss": 1.092387580871582, "num_input_tokens_seen": 4955594368, "step": 17430, "train_runtime": 169770.9245, "train_tokens_per_second": 29189.889 }, { "epoch": 0.6170625399429908, "grad_norm": 1.4453125, "learning_rate": 3.018463054251906e-05, "loss": 1.0892486572265625, "num_input_tokens_seen": 4958432448, "step": 17440, "train_runtime": 169865.4199, "train_tokens_per_second": 29190.358 }, { "epoch": 0.6174163602067195, "grad_norm": 1.40625, "learning_rate": 3.017913173013989e-05, "loss": 1.0922076225280761, "num_input_tokens_seen": 4961316288, "step": 17450, "train_runtime": 169963.4036, "train_tokens_per_second": 29190.497 }, { "epoch": 0.6177701804704483, "grad_norm": 1.4765625, "learning_rate": 3.017363592186491e-05, "loss": 1.0945773124694824, "num_input_tokens_seen": 4964150016, "step": 17460, "train_runtime": 170060.7718, "train_tokens_per_second": 29190.447 }, { "epoch": 0.6181240007341771, "grad_norm": 1.40625, "learning_rate": 3.0168143114959797e-05, "loss": 1.083472728729248, "num_input_tokens_seen": 4966970816, "step": 17470, "train_runtime": 170157.728, "train_tokens_per_second": 29190.392 }, { "epoch": 0.6184778209979058, "grad_norm": 1.4296875, "learning_rate": 3.016265330669369e-05, "loss": 1.1022187232971192, "num_input_tokens_seen": 4969811584, "step": 17480, "train_runtime": 170254.9485, "train_tokens_per_second": 29190.409 }, { "epoch": 0.6188316412616346, "grad_norm": 1.453125, "learning_rate": 3.0157166494339223e-05, "loss": 1.1012327194213867, "num_input_tokens_seen": 4972673536, "step": 17490, "train_runtime": 170354.5556, "train_tokens_per_second": 29190.141 }, { "epoch": 0.6191854615253634, "grad_norm": 1.4296875, "learning_rate": 3.0151682675172482e-05, "loss": 1.0924217224121093, "num_input_tokens_seen": 4975483200, "step": 17500, "train_runtime": 170451.3342, "train_tokens_per_second": 29190.051 }, { "epoch": 0.6195392817890921, "grad_norm": 1.4921875, "learning_rate": 3.0146201846473034e-05, "loss": 1.072235679626465, "num_input_tokens_seen": 4978340736, "step": 17510, "train_runtime": 170550.1157, "train_tokens_per_second": 29189.899 }, { "epoch": 0.6198931020528209, "grad_norm": 1.4375, "learning_rate": 3.01407240055239e-05, "loss": 1.1102373123168945, "num_input_tokens_seen": 4981153600, "step": 17520, "train_runtime": 170645.6815, "train_tokens_per_second": 29190.036 }, { "epoch": 0.6202469223165498, "grad_norm": 1.46875, "learning_rate": 3.013524914961157e-05, "loss": 1.0981882095336915, "num_input_tokens_seen": 4983947264, "step": 17530, "train_runtime": 170738.3057, "train_tokens_per_second": 29190.563 }, { "epoch": 0.6206007425802785, "grad_norm": 1.4765625, "learning_rate": 3.012977727602596e-05, "loss": 1.085178756713867, "num_input_tokens_seen": 4986762560, "step": 17540, "train_runtime": 170832.8027, "train_tokens_per_second": 29190.896 }, { "epoch": 0.6209545628440073, "grad_norm": 1.4609375, "learning_rate": 3.0124308382060446e-05, "loss": 1.1066741943359375, "num_input_tokens_seen": 4989534656, "step": 17550, "train_runtime": 170928.6516, "train_tokens_per_second": 29190.745 }, { "epoch": 0.6213083831077361, "grad_norm": 1.4609375, "learning_rate": 3.011884246501183e-05, "loss": 1.0930465698242187, "num_input_tokens_seen": 4992401984, "step": 17560, "train_runtime": 171028.0332, "train_tokens_per_second": 29190.548 }, { "epoch": 0.6216622033714648, "grad_norm": 1.4921875, "learning_rate": 3.0113379522180363e-05, "loss": 1.1016223907470704, "num_input_tokens_seen": 4995281408, "step": 17570, "train_runtime": 171127.275, "train_tokens_per_second": 29190.446 }, { "epoch": 0.6220160236351936, "grad_norm": 1.5078125, "learning_rate": 3.0107919550869702e-05, "loss": 1.092971134185791, "num_input_tokens_seen": 4998074432, "step": 17580, "train_runtime": 171218.8557, "train_tokens_per_second": 29191.145 }, { "epoch": 0.6223698438989224, "grad_norm": 1.4765625, "learning_rate": 3.0102462548386933e-05, "loss": 1.0873563766479493, "num_input_tokens_seen": 5000884480, "step": 17590, "train_runtime": 171313.6407, "train_tokens_per_second": 29191.397 }, { "epoch": 0.6227236641626511, "grad_norm": 1.4140625, "learning_rate": 3.0097008512042572e-05, "loss": 1.093904685974121, "num_input_tokens_seen": 5003696768, "step": 17600, "train_runtime": 171409.448, "train_tokens_per_second": 29191.488 }, { "epoch": 0.62307748442638, "grad_norm": 1.453125, "learning_rate": 3.009155743915052e-05, "loss": 1.1052436828613281, "num_input_tokens_seen": 5006511936, "step": 17610, "train_runtime": 171505.8189, "train_tokens_per_second": 29191.499 }, { "epoch": 0.6234313046901088, "grad_norm": 1.4296875, "learning_rate": 3.00861093270281e-05, "loss": 1.0873170852661134, "num_input_tokens_seen": 5009304512, "step": 17620, "train_runtime": 171601.1368, "train_tokens_per_second": 29191.558 }, { "epoch": 0.6237851249538375, "grad_norm": 1.453125, "learning_rate": 3.008066417299602e-05, "loss": 1.08282527923584, "num_input_tokens_seen": 5012144896, "step": 17630, "train_runtime": 171695.8218, "train_tokens_per_second": 29192.003 }, { "epoch": 0.6241389452175663, "grad_norm": 1.515625, "learning_rate": 3.00752219743784e-05, "loss": 1.0912040710449218, "num_input_tokens_seen": 5015010432, "step": 17640, "train_runtime": 171793.8096, "train_tokens_per_second": 29192.032 }, { "epoch": 0.6244927654812951, "grad_norm": 1.515625, "learning_rate": 3.0069782728502737e-05, "loss": 1.0895211219787597, "num_input_tokens_seen": 5017832512, "step": 17650, "train_runtime": 171889.4482, "train_tokens_per_second": 29192.208 }, { "epoch": 0.6248465857450238, "grad_norm": 1.4375, "learning_rate": 3.00643464326999e-05, "loss": 1.0778526306152343, "num_input_tokens_seen": 5020703808, "step": 17660, "train_runtime": 171988.6396, "train_tokens_per_second": 29192.067 }, { "epoch": 0.6252004060087526, "grad_norm": 1.4921875, "learning_rate": 3.0058913084304146e-05, "loss": 1.0848018646240234, "num_input_tokens_seen": 5023488640, "step": 17670, "train_runtime": 172082.5195, "train_tokens_per_second": 29192.324 }, { "epoch": 0.6255542262724814, "grad_norm": 1.4375, "learning_rate": 3.0053482680653112e-05, "loss": 1.0912198066711425, "num_input_tokens_seen": 5026346880, "step": 17680, "train_runtime": 172180.1147, "train_tokens_per_second": 29192.377 }, { "epoch": 0.6259080465362102, "grad_norm": 1.484375, "learning_rate": 3.0048055219087777e-05, "loss": 1.0929868698120118, "num_input_tokens_seen": 5029180480, "step": 17690, "train_runtime": 172276.9616, "train_tokens_per_second": 29192.415 }, { "epoch": 0.626261866799939, "grad_norm": 1.4609375, "learning_rate": 3.0042630696952507e-05, "loss": 1.0932377815246581, "num_input_tokens_seen": 5032037952, "step": 17700, "train_runtime": 172373.6311, "train_tokens_per_second": 29192.62 }, { "epoch": 0.6266156870636678, "grad_norm": 1.453125, "learning_rate": 3.0037209111594994e-05, "loss": 1.1029495239257812, "num_input_tokens_seen": 5034930752, "step": 17710, "train_runtime": 172474.0978, "train_tokens_per_second": 29192.388 }, { "epoch": 0.6269695073273965, "grad_norm": 1.484375, "learning_rate": 3.0031790460366305e-05, "loss": 1.090860939025879, "num_input_tokens_seen": 5037810368, "step": 17720, "train_runtime": 172572.479, "train_tokens_per_second": 29192.432 }, { "epoch": 0.6273233275911253, "grad_norm": 1.5, "learning_rate": 3.002637474062083e-05, "loss": 1.101734733581543, "num_input_tokens_seen": 5040589760, "step": 17730, "train_runtime": 172664.3444, "train_tokens_per_second": 29192.997 }, { "epoch": 0.6276771478548541, "grad_norm": 1.4609375, "learning_rate": 3.0020961949716325e-05, "loss": 1.0864606857299806, "num_input_tokens_seen": 5043435904, "step": 17740, "train_runtime": 172763.5063, "train_tokens_per_second": 29192.716 }, { "epoch": 0.6280309681185828, "grad_norm": 1.484375, "learning_rate": 3.0015552085013847e-05, "loss": 1.093165683746338, "num_input_tokens_seen": 5046189184, "step": 17750, "train_runtime": 172854.2283, "train_tokens_per_second": 29193.322 }, { "epoch": 0.6283847883823116, "grad_norm": 1.4375, "learning_rate": 3.0010145143877805e-05, "loss": 1.1060758590698243, "num_input_tokens_seen": 5048981696, "step": 17760, "train_runtime": 172947.7576, "train_tokens_per_second": 29193.681 }, { "epoch": 0.6287386086460404, "grad_norm": 1.3984375, "learning_rate": 3.0004741123675907e-05, "loss": 1.0958579063415528, "num_input_tokens_seen": 5051770688, "step": 17770, "train_runtime": 173043.1493, "train_tokens_per_second": 29193.705 }, { "epoch": 0.6290924289097692, "grad_norm": 1.484375, "learning_rate": 2.9999340021779205e-05, "loss": 1.0740983963012696, "num_input_tokens_seen": 5054588800, "step": 17780, "train_runtime": 173139.303, "train_tokens_per_second": 29193.769 }, { "epoch": 0.629446249173498, "grad_norm": 1.3828125, "learning_rate": 2.999394183556204e-05, "loss": 1.0861684799194335, "num_input_tokens_seen": 5057500672, "step": 17790, "train_runtime": 173239.8046, "train_tokens_per_second": 29193.641 }, { "epoch": 0.6298000694372268, "grad_norm": 1.4921875, "learning_rate": 2.998854656240207e-05, "loss": 1.094163990020752, "num_input_tokens_seen": 5060324160, "step": 17800, "train_runtime": 173334.4305, "train_tokens_per_second": 29193.993 }, { "epoch": 0.6301538897009555, "grad_norm": 1.4609375, "learning_rate": 2.9983154199680257e-05, "loss": 1.1063013076782227, "num_input_tokens_seen": 5063190336, "step": 17810, "train_runtime": 173431.0982, "train_tokens_per_second": 29194.247 }, { "epoch": 0.6305077099646843, "grad_norm": 1.4296875, "learning_rate": 2.9977764744780845e-05, "loss": 1.0933140754699706, "num_input_tokens_seen": 5065999168, "step": 17820, "train_runtime": 173527.565, "train_tokens_per_second": 29194.204 }, { "epoch": 0.6308615302284131, "grad_norm": 1.578125, "learning_rate": 2.9972378195091384e-05, "loss": 1.0691737174987792, "num_input_tokens_seen": 5068796416, "step": 17830, "train_runtime": 173625.1881, "train_tokens_per_second": 29193.9 }, { "epoch": 0.6312153504921418, "grad_norm": 1.390625, "learning_rate": 2.996699454800269e-05, "loss": 1.1059783935546874, "num_input_tokens_seen": 5071733952, "step": 17840, "train_runtime": 173726.4859, "train_tokens_per_second": 29193.787 }, { "epoch": 0.6315691707558706, "grad_norm": 1.453125, "learning_rate": 2.9961613800908883e-05, "loss": 1.0885400772094727, "num_input_tokens_seen": 5074574912, "step": 17850, "train_runtime": 173823.5559, "train_tokens_per_second": 29193.828 }, { "epoch": 0.6319229910195995, "grad_norm": 1.390625, "learning_rate": 2.995623595120733e-05, "loss": 1.0917795181274415, "num_input_tokens_seen": 5077408448, "step": 17860, "train_runtime": 173921.5166, "train_tokens_per_second": 29193.676 }, { "epoch": 0.6322768112833282, "grad_norm": 1.4296875, "learning_rate": 2.995086099629869e-05, "loss": 1.1009288787841798, "num_input_tokens_seen": 5080244672, "step": 17870, "train_runtime": 174018.047, "train_tokens_per_second": 29193.781 }, { "epoch": 0.632630631547057, "grad_norm": 1.5, "learning_rate": 2.9945488933586867e-05, "loss": 1.0865049362182617, "num_input_tokens_seen": 5083104384, "step": 17880, "train_runtime": 174118.5249, "train_tokens_per_second": 29193.358 }, { "epoch": 0.6329844518107858, "grad_norm": 1.4375, "learning_rate": 2.9940119760479045e-05, "loss": 1.0965476036071777, "num_input_tokens_seen": 5085932736, "step": 17890, "train_runtime": 174214.2296, "train_tokens_per_second": 29193.555 }, { "epoch": 0.6333382720745145, "grad_norm": 1.484375, "learning_rate": 2.9934753474385635e-05, "loss": 1.0934578895568847, "num_input_tokens_seen": 5088743936, "step": 17900, "train_runtime": 174309.3472, "train_tokens_per_second": 29193.752 }, { "epoch": 0.6336920923382433, "grad_norm": 1.515625, "learning_rate": 2.9929390072720314e-05, "loss": 1.0994976043701172, "num_input_tokens_seen": 5091568960, "step": 17910, "train_runtime": 174406.7168, "train_tokens_per_second": 29193.652 }, { "epoch": 0.6340459126019721, "grad_norm": 1.40625, "learning_rate": 2.99240295529e-05, "loss": 1.0884819030761719, "num_input_tokens_seen": 5094457088, "step": 17920, "train_runtime": 174503.6363, "train_tokens_per_second": 29193.988 }, { "epoch": 0.6343997328657008, "grad_norm": 1.4609375, "learning_rate": 2.991867191234484e-05, "loss": 1.0861394882202149, "num_input_tokens_seen": 5097324736, "step": 17930, "train_runtime": 174603.033, "train_tokens_per_second": 29193.793 }, { "epoch": 0.6347535531294297, "grad_norm": 1.421875, "learning_rate": 2.991331714847822e-05, "loss": 1.0968965530395507, "num_input_tokens_seen": 5100176512, "step": 17940, "train_runtime": 174699.976, "train_tokens_per_second": 29193.916 }, { "epoch": 0.6351073733931585, "grad_norm": 1.4765625, "learning_rate": 2.990796525872675e-05, "loss": 1.1063126564025878, "num_input_tokens_seen": 5103029248, "step": 17950, "train_runtime": 174796.4361, "train_tokens_per_second": 29194.126 }, { "epoch": 0.6354611936568872, "grad_norm": 1.4921875, "learning_rate": 2.990261624052027e-05, "loss": 1.1037614822387696, "num_input_tokens_seen": 5105830400, "step": 17960, "train_runtime": 174892.5169, "train_tokens_per_second": 29194.104 }, { "epoch": 0.635815013920616, "grad_norm": 1.453125, "learning_rate": 2.989727009129182e-05, "loss": 1.0944622039794922, "num_input_tokens_seen": 5108736064, "step": 17970, "train_runtime": 174988.7355, "train_tokens_per_second": 29194.657 }, { "epoch": 0.6361688341843448, "grad_norm": 1.46875, "learning_rate": 2.989192680847766e-05, "loss": 1.1029019355773926, "num_input_tokens_seen": 5111624448, "step": 17980, "train_runtime": 175089.8964, "train_tokens_per_second": 29194.286 }, { "epoch": 0.6365226544480735, "grad_norm": 1.421875, "learning_rate": 2.9886586389517267e-05, "loss": 1.0914192199707031, "num_input_tokens_seen": 5114494144, "step": 17990, "train_runtime": 175187.3023, "train_tokens_per_second": 29194.434 }, { "epoch": 0.6368764747118023, "grad_norm": 1.4140625, "learning_rate": 2.98812488318533e-05, "loss": 1.091372013092041, "num_input_tokens_seen": 5117328640, "step": 18000, "train_runtime": 175283.8196, "train_tokens_per_second": 29194.529 }, { "epoch": 0.6372302949755311, "grad_norm": 1.484375, "learning_rate": 2.987591413293162e-05, "loss": 1.0850393295288085, "num_input_tokens_seen": 5120165696, "step": 18010, "train_runtime": 175379.0616, "train_tokens_per_second": 29194.852 }, { "epoch": 0.6375841152392598, "grad_norm": 1.4921875, "learning_rate": 2.98705822902013e-05, "loss": 1.0896478652954102, "num_input_tokens_seen": 5123009728, "step": 18020, "train_runtime": 175478.2863, "train_tokens_per_second": 29194.551 }, { "epoch": 0.6379379355029887, "grad_norm": 1.4375, "learning_rate": 2.9865253301114553e-05, "loss": 1.088956642150879, "num_input_tokens_seen": 5125901824, "step": 18030, "train_runtime": 175578.9358, "train_tokens_per_second": 29194.287 }, { "epoch": 0.6382917557667175, "grad_norm": 1.5078125, "learning_rate": 2.985992716312683e-05, "loss": 1.0927720069885254, "num_input_tokens_seen": 5128786752, "step": 18040, "train_runtime": 175677.101, "train_tokens_per_second": 29194.395 }, { "epoch": 0.6386455760304462, "grad_norm": 1.3984375, "learning_rate": 2.9854603873696703e-05, "loss": 1.0811944961547852, "num_input_tokens_seen": 5131620736, "step": 18050, "train_runtime": 175773.3321, "train_tokens_per_second": 29194.535 }, { "epoch": 0.638999396294175, "grad_norm": 1.4609375, "learning_rate": 2.9849283430285947e-05, "loss": 1.10753173828125, "num_input_tokens_seen": 5134488384, "step": 18060, "train_runtime": 175873.4498, "train_tokens_per_second": 29194.221 }, { "epoch": 0.6393532165579038, "grad_norm": 1.515625, "learning_rate": 2.98439658303595e-05, "loss": 1.0945836067199708, "num_input_tokens_seen": 5137327488, "step": 18070, "train_runtime": 175970.9049, "train_tokens_per_second": 29194.187 }, { "epoch": 0.6397070368216325, "grad_norm": 1.5, "learning_rate": 2.9838651071385442e-05, "loss": 1.0856395721435548, "num_input_tokens_seen": 5140219712, "step": 18080, "train_runtime": 176073.6686, "train_tokens_per_second": 29193.574 }, { "epoch": 0.6400608570853613, "grad_norm": 1.484375, "learning_rate": 2.9833339150835037e-05, "loss": 1.0879490852355957, "num_input_tokens_seen": 5143062656, "step": 18090, "train_runtime": 176171.1003, "train_tokens_per_second": 29193.566 }, { "epoch": 0.6404146773490901, "grad_norm": 1.4921875, "learning_rate": 2.982803006618267e-05, "loss": 1.095631217956543, "num_input_tokens_seen": 5145871104, "step": 18100, "train_runtime": 176266.9958, "train_tokens_per_second": 29193.617 }, { "epoch": 0.640768497612819, "grad_norm": 1.484375, "learning_rate": 2.982272381490588e-05, "loss": 1.093402099609375, "num_input_tokens_seen": 5148714880, "step": 18110, "train_runtime": 176362.3532, "train_tokens_per_second": 29193.957 }, { "epoch": 0.6411223178765477, "grad_norm": 1.5078125, "learning_rate": 2.9817420394485363e-05, "loss": 1.076893138885498, "num_input_tokens_seen": 5151576832, "step": 18120, "train_runtime": 176458.5029, "train_tokens_per_second": 29194.268 }, { "epoch": 0.6414761381402765, "grad_norm": 1.484375, "learning_rate": 2.9812119802404927e-05, "loss": 1.0914627075195313, "num_input_tokens_seen": 5154438400, "step": 18130, "train_runtime": 176556.9636, "train_tokens_per_second": 29194.195 }, { "epoch": 0.6418299584040053, "grad_norm": 1.4296875, "learning_rate": 2.9806822036151523e-05, "loss": 1.090593147277832, "num_input_tokens_seen": 5157314816, "step": 18140, "train_runtime": 176655.4461, "train_tokens_per_second": 29194.202 }, { "epoch": 0.642183778667734, "grad_norm": 1.4609375, "learning_rate": 2.980152709321522e-05, "loss": 1.1043086051940918, "num_input_tokens_seen": 5160157824, "step": 18150, "train_runtime": 176750.9139, "train_tokens_per_second": 29194.518 }, { "epoch": 0.6425375989314628, "grad_norm": 1.421875, "learning_rate": 2.9796234971089214e-05, "loss": 1.0932493209838867, "num_input_tokens_seen": 5163078912, "step": 18160, "train_runtime": 176851.2355, "train_tokens_per_second": 29194.475 }, { "epoch": 0.6428914191951915, "grad_norm": 1.484375, "learning_rate": 2.979094566726981e-05, "loss": 1.0833987236022948, "num_input_tokens_seen": 5165915968, "step": 18170, "train_runtime": 176948.6607, "train_tokens_per_second": 29194.434 }, { "epoch": 0.6432452394589203, "grad_norm": 1.4296875, "learning_rate": 2.9785659179256427e-05, "loss": 1.0705631256103516, "num_input_tokens_seen": 5168756928, "step": 18180, "train_runtime": 177045.3861, "train_tokens_per_second": 29194.531 }, { "epoch": 0.6435990597226492, "grad_norm": 1.59375, "learning_rate": 2.978037550455159e-05, "loss": 1.0914487838745117, "num_input_tokens_seen": 5171592320, "step": 18190, "train_runtime": 177143.7771, "train_tokens_per_second": 29194.321 }, { "epoch": 0.643952879986378, "grad_norm": 1.421875, "learning_rate": 2.977509464066091e-05, "loss": 1.0922799110412598, "num_input_tokens_seen": 5174435520, "step": 18200, "train_runtime": 177242.0846, "train_tokens_per_second": 29194.17 }, { "epoch": 0.6443067002501067, "grad_norm": 1.5, "learning_rate": 2.9769816585093126e-05, "loss": 1.0937393188476563, "num_input_tokens_seen": 5177222080, "step": 18210, "train_runtime": 177338.4738, "train_tokens_per_second": 29194.015 }, { "epoch": 0.6446605205138355, "grad_norm": 1.4765625, "learning_rate": 2.9764541335360024e-05, "loss": 1.0992071151733398, "num_input_tokens_seen": 5180071744, "step": 18220, "train_runtime": 177435.6535, "train_tokens_per_second": 29194.086 }, { "epoch": 0.6450143407775643, "grad_norm": 1.3984375, "learning_rate": 2.9759268888976505e-05, "loss": 1.0768861770629883, "num_input_tokens_seen": 5182936768, "step": 18230, "train_runtime": 177537.2114, "train_tokens_per_second": 29193.524 }, { "epoch": 0.645368161041293, "grad_norm": 1.4609375, "learning_rate": 2.9753999243460546e-05, "loss": 1.0919095993041992, "num_input_tokens_seen": 5185806016, "step": 18240, "train_runtime": 177635.9218, "train_tokens_per_second": 29193.453 }, { "epoch": 0.6457219813050218, "grad_norm": 1.5390625, "learning_rate": 2.974873239633319e-05, "loss": 1.0921977043151856, "num_input_tokens_seen": 5188599488, "step": 18250, "train_runtime": 177730.9001, "train_tokens_per_second": 29193.57 }, { "epoch": 0.6460758015687506, "grad_norm": 1.46875, "learning_rate": 2.9743468345118563e-05, "loss": 1.0843795776367187, "num_input_tokens_seen": 5191436992, "step": 18260, "train_runtime": 177829.7727, "train_tokens_per_second": 29193.295 }, { "epoch": 0.6464296218324794, "grad_norm": 1.5078125, "learning_rate": 2.9738207087343844e-05, "loss": 1.1045127868652345, "num_input_tokens_seen": 5194292288, "step": 18270, "train_runtime": 177927.1568, "train_tokens_per_second": 29193.364 }, { "epoch": 0.6467834420962082, "grad_norm": 1.3828125, "learning_rate": 2.9732948620539287e-05, "loss": 1.0811529159545898, "num_input_tokens_seen": 5197122944, "step": 18280, "train_runtime": 178022.2839, "train_tokens_per_second": 29193.665 }, { "epoch": 0.647137262359937, "grad_norm": 1.515625, "learning_rate": 2.9727692942238188e-05, "loss": 1.0792274475097656, "num_input_tokens_seen": 5199970304, "step": 18290, "train_runtime": 178115.6842, "train_tokens_per_second": 29194.343 }, { "epoch": 0.6474910826236657, "grad_norm": 1.4375, "learning_rate": 2.97224400499769e-05, "loss": 1.1003503799438477, "num_input_tokens_seen": 5202848960, "step": 18300, "train_runtime": 178216.2598, "train_tokens_per_second": 29194.019 }, { "epoch": 0.6478449028873945, "grad_norm": 1.4140625, "learning_rate": 2.9717189941294826e-05, "loss": 1.0977008819580079, "num_input_tokens_seen": 5205752704, "step": 18310, "train_runtime": 178316.5849, "train_tokens_per_second": 29193.878 }, { "epoch": 0.6481987231511233, "grad_norm": 1.53125, "learning_rate": 2.97119426137344e-05, "loss": 1.0840436935424804, "num_input_tokens_seen": 5208582144, "step": 18320, "train_runtime": 178414.9225, "train_tokens_per_second": 29193.646 }, { "epoch": 0.648552543414852, "grad_norm": 1.4453125, "learning_rate": 2.9706698064841103e-05, "loss": 1.0948871612548827, "num_input_tokens_seen": 5211359552, "step": 18330, "train_runtime": 178507.3672, "train_tokens_per_second": 29194.087 }, { "epoch": 0.6489063636785808, "grad_norm": 1.5078125, "learning_rate": 2.970145629216345e-05, "loss": 1.1049657821655274, "num_input_tokens_seen": 5214195008, "step": 18340, "train_runtime": 178603.9511, "train_tokens_per_second": 29194.175 }, { "epoch": 0.6492601839423096, "grad_norm": 1.46875, "learning_rate": 2.969621729325296e-05, "loss": 1.0939626693725586, "num_input_tokens_seen": 5217021248, "step": 18350, "train_runtime": 178701.0722, "train_tokens_per_second": 29194.124 }, { "epoch": 0.6496140042060384, "grad_norm": 1.4375, "learning_rate": 2.969098106566421e-05, "loss": 1.092513370513916, "num_input_tokens_seen": 5219914240, "step": 18360, "train_runtime": 178803.0361, "train_tokens_per_second": 29193.656 }, { "epoch": 0.6499678244697672, "grad_norm": 1.46875, "learning_rate": 2.968574760695476e-05, "loss": 1.0998994827270507, "num_input_tokens_seen": 5222842560, "step": 18370, "train_runtime": 178906.5538, "train_tokens_per_second": 29193.132 }, { "epoch": 0.650321644733496, "grad_norm": 1.46875, "learning_rate": 2.9680516914685206e-05, "loss": 1.0877735137939453, "num_input_tokens_seen": 5225691136, "step": 18380, "train_runtime": 179003.2837, "train_tokens_per_second": 29193.27 }, { "epoch": 0.6506754649972247, "grad_norm": 1.515625, "learning_rate": 2.9675288986419148e-05, "loss": 1.0872085571289063, "num_input_tokens_seen": 5228528256, "step": 18390, "train_runtime": 179100.9875, "train_tokens_per_second": 29193.185 }, { "epoch": 0.6510292852609535, "grad_norm": 1.453125, "learning_rate": 2.967006381972317e-05, "loss": 1.0903966903686524, "num_input_tokens_seen": 5231359040, "step": 18400, "train_runtime": 179199.3576, "train_tokens_per_second": 29192.956 }, { "epoch": 0.6513831055246823, "grad_norm": 1.4375, "learning_rate": 2.9664841412166882e-05, "loss": 1.089061450958252, "num_input_tokens_seen": 5234193408, "step": 18410, "train_runtime": 179297.6035, "train_tokens_per_second": 29192.768 }, { "epoch": 0.651736925788411, "grad_norm": 1.421875, "learning_rate": 2.965962176132287e-05, "loss": 1.0873963356018066, "num_input_tokens_seen": 5237039872, "step": 18420, "train_runtime": 179395.3124, "train_tokens_per_second": 29192.735 }, { "epoch": 0.6520907460521398, "grad_norm": 1.4375, "learning_rate": 2.9654404864766706e-05, "loss": 1.0846607208251953, "num_input_tokens_seen": 5239866176, "step": 18430, "train_runtime": 179490.4234, "train_tokens_per_second": 29193.013 }, { "epoch": 0.6524445663158687, "grad_norm": 1.484375, "learning_rate": 2.9649190720076962e-05, "loss": 1.0934024810791017, "num_input_tokens_seen": 5242772352, "step": 18440, "train_runtime": 179592.2532, "train_tokens_per_second": 29192.642 }, { "epoch": 0.6527983865795974, "grad_norm": 1.4921875, "learning_rate": 2.9643979324835176e-05, "loss": 1.0942916870117188, "num_input_tokens_seen": 5245648320, "step": 18450, "train_runtime": 179693.6135, "train_tokens_per_second": 29192.18 }, { "epoch": 0.6531522068433262, "grad_norm": 1.484375, "learning_rate": 2.9638770676625866e-05, "loss": 1.081151294708252, "num_input_tokens_seen": 5248480512, "step": 18460, "train_runtime": 179794.2649, "train_tokens_per_second": 29191.59 }, { "epoch": 0.653506027107055, "grad_norm": 1.484375, "learning_rate": 2.9633564773036517e-05, "loss": 1.0827617645263672, "num_input_tokens_seen": 5251268608, "step": 18470, "train_runtime": 179887.5313, "train_tokens_per_second": 29191.954 }, { "epoch": 0.6538598473707837, "grad_norm": 1.4140625, "learning_rate": 2.9628361611657578e-05, "loss": 1.0874143600463868, "num_input_tokens_seen": 5254129984, "step": 18480, "train_runtime": 179988.4168, "train_tokens_per_second": 29191.49 }, { "epoch": 0.6542136676345125, "grad_norm": 1.484375, "learning_rate": 2.9623161190082472e-05, "loss": 1.1064335823059082, "num_input_tokens_seen": 5256959360, "step": 18490, "train_runtime": 180088.4742, "train_tokens_per_second": 29190.982 }, { "epoch": 0.6545674878982413, "grad_norm": 1.4921875, "learning_rate": 2.9617963505907554e-05, "loss": 1.0842641830444335, "num_input_tokens_seen": 5259849216, "step": 18500, "train_runtime": 180191.5962, "train_tokens_per_second": 29190.314 }, { "epoch": 0.65492130816197, "grad_norm": 1.4765625, "learning_rate": 2.9612768556732145e-05, "loss": 1.0885549545288087, "num_input_tokens_seen": 5262726208, "step": 18510, "train_runtime": 180289.508, "train_tokens_per_second": 29190.419 }, { "epoch": 0.6552751284256989, "grad_norm": 1.4609375, "learning_rate": 2.960757634015852e-05, "loss": 1.081289291381836, "num_input_tokens_seen": 5265541184, "step": 18520, "train_runtime": 180385.9793, "train_tokens_per_second": 29190.413 }, { "epoch": 0.6556289486894277, "grad_norm": 1.390625, "learning_rate": 2.9602386853791885e-05, "loss": 1.0903072357177734, "num_input_tokens_seen": 5268363008, "step": 18530, "train_runtime": 180478.5022, "train_tokens_per_second": 29191.083 }, { "epoch": 0.6559827689531564, "grad_norm": 1.4609375, "learning_rate": 2.959720009524038e-05, "loss": 1.0963611602783203, "num_input_tokens_seen": 5271242496, "step": 18540, "train_runtime": 180579.5244, "train_tokens_per_second": 29190.699 }, { "epoch": 0.6563365892168852, "grad_norm": 1.484375, "learning_rate": 2.9592016062115085e-05, "loss": 1.0904500961303711, "num_input_tokens_seen": 5274129024, "step": 18550, "train_runtime": 180676.8974, "train_tokens_per_second": 29190.943 }, { "epoch": 0.656690409480614, "grad_norm": 1.484375, "learning_rate": 2.9586834752030002e-05, "loss": 1.0924099922180175, "num_input_tokens_seen": 5277002112, "step": 18560, "train_runtime": 180774.8022, "train_tokens_per_second": 29191.027 }, { "epoch": 0.6570442297443427, "grad_norm": 1.453125, "learning_rate": 2.958165616260206e-05, "loss": 1.0979349136352539, "num_input_tokens_seen": 5279807488, "step": 18570, "train_runtime": 180867.7661, "train_tokens_per_second": 29191.534 }, { "epoch": 0.6573980500080715, "grad_norm": 1.4453125, "learning_rate": 2.9576480291451114e-05, "loss": 1.0780704498291016, "num_input_tokens_seen": 5282667136, "step": 18580, "train_runtime": 180965.3503, "train_tokens_per_second": 29191.595 }, { "epoch": 0.6577518702718003, "grad_norm": 1.4375, "learning_rate": 2.957130713619991e-05, "loss": 1.080467414855957, "num_input_tokens_seen": 5285451392, "step": 18590, "train_runtime": 181059.2849, "train_tokens_per_second": 29191.827 }, { "epoch": 0.658105690535529, "grad_norm": 1.4609375, "learning_rate": 2.9566136694474138e-05, "loss": 1.0925837516784669, "num_input_tokens_seen": 5288344704, "step": 18600, "train_runtime": 181157.395, "train_tokens_per_second": 29191.989 }, { "epoch": 0.6584595107992579, "grad_norm": 1.4765625, "learning_rate": 2.9560968963902365e-05, "loss": 1.0902776718139648, "num_input_tokens_seen": 5291221376, "step": 18610, "train_runtime": 181255.453, "train_tokens_per_second": 29192.067 }, { "epoch": 0.6588133310629867, "grad_norm": 1.4921875, "learning_rate": 2.9555803942116062e-05, "loss": 1.0930139541625976, "num_input_tokens_seen": 5294061632, "step": 18620, "train_runtime": 181349.5866, "train_tokens_per_second": 29192.576 }, { "epoch": 0.6591671513267154, "grad_norm": 1.453125, "learning_rate": 2.955064162674961e-05, "loss": 1.0928016662597657, "num_input_tokens_seen": 5296885440, "step": 18630, "train_runtime": 181445.2004, "train_tokens_per_second": 29192.756 }, { "epoch": 0.6595209715904442, "grad_norm": 1.546875, "learning_rate": 2.9545482015440266e-05, "loss": 1.0867008209228515, "num_input_tokens_seen": 5299739584, "step": 18640, "train_runtime": 181543.1924, "train_tokens_per_second": 29192.72 }, { "epoch": 0.659874791854173, "grad_norm": 1.4765625, "learning_rate": 2.954032510582819e-05, "loss": 1.0938479423522949, "num_input_tokens_seen": 5302608896, "step": 18650, "train_runtime": 181644.1586, "train_tokens_per_second": 29192.29 }, { "epoch": 0.6602286121179017, "grad_norm": 1.421875, "learning_rate": 2.95351708955564e-05, "loss": 1.0895544052124024, "num_input_tokens_seen": 5305451584, "step": 18660, "train_runtime": 181739.5908, "train_tokens_per_second": 29192.602 }, { "epoch": 0.6605824323816305, "grad_norm": 1.4609375, "learning_rate": 2.9530019382270823e-05, "loss": 1.0963059425354005, "num_input_tokens_seen": 5308258240, "step": 18670, "train_runtime": 181835.071, "train_tokens_per_second": 29192.709 }, { "epoch": 0.6609362526453593, "grad_norm": 1.4296875, "learning_rate": 2.9524870563620233e-05, "loss": 1.0789520263671875, "num_input_tokens_seen": 5311137216, "step": 18680, "train_runtime": 181936.6169, "train_tokens_per_second": 29192.239 }, { "epoch": 0.6612900729090881, "grad_norm": 1.4765625, "learning_rate": 2.9519724437256287e-05, "loss": 1.1076924324035644, "num_input_tokens_seen": 5314011520, "step": 18690, "train_runtime": 182036.1582, "train_tokens_per_second": 29192.066 }, { "epoch": 0.6616438931728169, "grad_norm": 1.390625, "learning_rate": 2.9514581000833496e-05, "loss": 1.0936838150024415, "num_input_tokens_seen": 5316814848, "step": 18700, "train_runtime": 182129.8169, "train_tokens_per_second": 29192.446 }, { "epoch": 0.6619977134365457, "grad_norm": 1.46875, "learning_rate": 2.950944025200924e-05, "loss": 1.0819818496704101, "num_input_tokens_seen": 5319664256, "step": 18710, "train_runtime": 182226.0389, "train_tokens_per_second": 29192.668 }, { "epoch": 0.6623515337002744, "grad_norm": 1.5390625, "learning_rate": 2.950430218844375e-05, "loss": 1.0942863464355468, "num_input_tokens_seen": 5322458624, "step": 18720, "train_runtime": 182319.1659, "train_tokens_per_second": 29193.083 }, { "epoch": 0.6627053539640032, "grad_norm": 1.40625, "learning_rate": 2.9499166807800106e-05, "loss": 1.0859619140625, "num_input_tokens_seen": 5325399872, "step": 18730, "train_runtime": 182422.1745, "train_tokens_per_second": 29192.722 }, { "epoch": 0.663059174227732, "grad_norm": 1.453125, "learning_rate": 2.949403410774424e-05, "loss": 1.0927477836608888, "num_input_tokens_seen": 5328314432, "step": 18740, "train_runtime": 182524.5124, "train_tokens_per_second": 29192.323 }, { "epoch": 0.6634129944914607, "grad_norm": 1.3828125, "learning_rate": 2.948890408594492e-05, "loss": 1.0970878601074219, "num_input_tokens_seen": 5331233920, "step": 18750, "train_runtime": 182626.7291, "train_tokens_per_second": 29191.97 }, { "epoch": 0.6637668147551895, "grad_norm": 1.46875, "learning_rate": 2.9483776740073748e-05, "loss": 1.0828668594360351, "num_input_tokens_seen": 5334099904, "step": 18760, "train_runtime": 182725.1574, "train_tokens_per_second": 29191.929 }, { "epoch": 0.6641206350189184, "grad_norm": 1.4609375, "learning_rate": 2.947865206780518e-05, "loss": 1.097357177734375, "num_input_tokens_seen": 5336928320, "step": 18770, "train_runtime": 182823.5492, "train_tokens_per_second": 29191.69 }, { "epoch": 0.6644744552826471, "grad_norm": 1.4609375, "learning_rate": 2.947353006681647e-05, "loss": 1.0987221717834472, "num_input_tokens_seen": 5339757504, "step": 18780, "train_runtime": 182921.9824, "train_tokens_per_second": 29191.448 }, { "epoch": 0.6648282755463759, "grad_norm": 1.5, "learning_rate": 2.9468410734787717e-05, "loss": 1.0904268264770507, "num_input_tokens_seen": 5342539648, "step": 18790, "train_runtime": 183015.0258, "train_tokens_per_second": 29191.809 }, { "epoch": 0.6651820958101047, "grad_norm": 1.4765625, "learning_rate": 2.9463294069401838e-05, "loss": 1.0936807632446288, "num_input_tokens_seen": 5345349760, "step": 18800, "train_runtime": 183112.2276, "train_tokens_per_second": 29191.659 }, { "epoch": 0.6655359160738334, "grad_norm": 1.5, "learning_rate": 2.9458180068344555e-05, "loss": 1.0877982139587403, "num_input_tokens_seen": 5348219840, "step": 18810, "train_runtime": 183209.4026, "train_tokens_per_second": 29191.841 }, { "epoch": 0.6658897363375622, "grad_norm": 1.453125, "learning_rate": 2.9453068729304407e-05, "loss": 1.1054519653320312, "num_input_tokens_seen": 5351087040, "step": 18820, "train_runtime": 183307.6863, "train_tokens_per_second": 29191.831 }, { "epoch": 0.666243556601291, "grad_norm": 1.4765625, "learning_rate": 2.944796004997274e-05, "loss": 1.085451316833496, "num_input_tokens_seen": 5353951744, "step": 18830, "train_runtime": 183407.224, "train_tokens_per_second": 29191.608 }, { "epoch": 0.6665973768650197, "grad_norm": 1.4609375, "learning_rate": 2.94428540280437e-05, "loss": 1.0862783432006835, "num_input_tokens_seen": 5356777280, "step": 18840, "train_runtime": 183503.9527, "train_tokens_per_second": 29191.618 }, { "epoch": 0.6669511971287485, "grad_norm": 1.4765625, "learning_rate": 2.9437750661214242e-05, "loss": 1.101036548614502, "num_input_tokens_seen": 5359628992, "step": 18850, "train_runtime": 183602.508, "train_tokens_per_second": 29191.48 }, { "epoch": 0.6673050173924774, "grad_norm": 1.4765625, "learning_rate": 2.9432649947184094e-05, "loss": 1.0907785415649414, "num_input_tokens_seen": 5362466496, "step": 18860, "train_runtime": 183699.7633, "train_tokens_per_second": 29191.472 }, { "epoch": 0.6676588376562061, "grad_norm": 1.4765625, "learning_rate": 2.942755188365579e-05, "loss": 1.0816029548645019, "num_input_tokens_seen": 5365309760, "step": 18870, "train_runtime": 183794.2455, "train_tokens_per_second": 29191.935 }, { "epoch": 0.6680126579199349, "grad_norm": 1.4921875, "learning_rate": 2.9422456468334635e-05, "loss": 1.0955357551574707, "num_input_tokens_seen": 5368185728, "step": 18880, "train_runtime": 183893.2717, "train_tokens_per_second": 29191.855 }, { "epoch": 0.6683664781836637, "grad_norm": 1.4765625, "learning_rate": 2.9417363698928734e-05, "loss": 1.0994853019714355, "num_input_tokens_seen": 5371068544, "step": 18890, "train_runtime": 183992.0101, "train_tokens_per_second": 29191.858 }, { "epoch": 0.6687202984473924, "grad_norm": 1.484375, "learning_rate": 2.9412273573148946e-05, "loss": 1.0925383567810059, "num_input_tokens_seen": 5373968000, "step": 18900, "train_runtime": 184090.5312, "train_tokens_per_second": 29191.985 }, { "epoch": 0.6690741187111212, "grad_norm": 1.46875, "learning_rate": 2.940718608870891e-05, "loss": 1.0968799591064453, "num_input_tokens_seen": 5376826432, "step": 18910, "train_runtime": 184186.995, "train_tokens_per_second": 29192.215 }, { "epoch": 0.66942793897485, "grad_norm": 1.453125, "learning_rate": 2.940210124332504e-05, "loss": 1.0887353897094727, "num_input_tokens_seen": 5379688192, "step": 18920, "train_runtime": 184284.8861, "train_tokens_per_second": 29192.238 }, { "epoch": 0.6697817592385787, "grad_norm": 1.484375, "learning_rate": 2.9397019034716504e-05, "loss": 1.084455966949463, "num_input_tokens_seen": 5382474368, "step": 18930, "train_runtime": 184377.7708, "train_tokens_per_second": 29192.643 }, { "epoch": 0.6701355795023076, "grad_norm": 1.4609375, "learning_rate": 2.9391939460605233e-05, "loss": 1.1016748428344727, "num_input_tokens_seen": 5385377792, "step": 18940, "train_runtime": 184479.4524, "train_tokens_per_second": 29192.291 }, { "epoch": 0.6704893997660364, "grad_norm": 1.40625, "learning_rate": 2.9386862518715914e-05, "loss": 1.0882539749145508, "num_input_tokens_seen": 5388224832, "step": 18950, "train_runtime": 184576.7722, "train_tokens_per_second": 29192.323 }, { "epoch": 0.6708432200297652, "grad_norm": 1.4921875, "learning_rate": 2.9381788206775966e-05, "loss": 1.0915789604187012, "num_input_tokens_seen": 5391128576, "step": 18960, "train_runtime": 184676.4331, "train_tokens_per_second": 29192.293 }, { "epoch": 0.6711970402934939, "grad_norm": 1.4375, "learning_rate": 2.937671652251559e-05, "loss": 1.0947673797607422, "num_input_tokens_seen": 5393952960, "step": 18970, "train_runtime": 184772.0976, "train_tokens_per_second": 29192.465 }, { "epoch": 0.6715508605572227, "grad_norm": 1.4375, "learning_rate": 2.9371647463667696e-05, "loss": 1.09671049118042, "num_input_tokens_seen": 5396779968, "step": 18980, "train_runtime": 184867.6518, "train_tokens_per_second": 29192.668 }, { "epoch": 0.6719046808209514, "grad_norm": 1.4140625, "learning_rate": 2.9366581027967943e-05, "loss": 1.091103458404541, "num_input_tokens_seen": 5399650560, "step": 18990, "train_runtime": 184966.3119, "train_tokens_per_second": 29192.616 }, { "epoch": 0.6722585010846802, "grad_norm": 1.4375, "learning_rate": 2.9361517213154726e-05, "loss": 1.0908233642578125, "num_input_tokens_seen": 5402479168, "step": 19000, "train_runtime": 185063.7875, "train_tokens_per_second": 29192.525 }, { "epoch": 0.672612321348409, "grad_norm": 1.5234375, "learning_rate": 2.935645601696917e-05, "loss": 1.091437530517578, "num_input_tokens_seen": 5405312896, "step": 19010, "train_runtime": 185160.0886, "train_tokens_per_second": 29192.646 }, { "epoch": 0.6729661416121379, "grad_norm": 1.4453125, "learning_rate": 2.9351397437155114e-05, "loss": 1.0892853736877441, "num_input_tokens_seen": 5408159488, "step": 19020, "train_runtime": 185259.0436, "train_tokens_per_second": 29192.418 }, { "epoch": 0.6733199618758666, "grad_norm": 1.4140625, "learning_rate": 2.934634147145913e-05, "loss": 1.0914436340332032, "num_input_tokens_seen": 5411064832, "step": 19030, "train_runtime": 185362.7922, "train_tokens_per_second": 29191.753 }, { "epoch": 0.6736737821395954, "grad_norm": 1.5390625, "learning_rate": 2.9341288117630495e-05, "loss": 1.089668083190918, "num_input_tokens_seen": 5413963968, "step": 19040, "train_runtime": 185465.6532, "train_tokens_per_second": 29191.195 }, { "epoch": 0.6740276024033242, "grad_norm": 1.4609375, "learning_rate": 2.933623737342121e-05, "loss": 1.099471092224121, "num_input_tokens_seen": 5416799744, "step": 19050, "train_runtime": 185562.9908, "train_tokens_per_second": 29191.164 }, { "epoch": 0.6743814226670529, "grad_norm": 1.421875, "learning_rate": 2.9331189236585977e-05, "loss": 1.0768820762634277, "num_input_tokens_seen": 5419656768, "step": 19060, "train_runtime": 185661.2006, "train_tokens_per_second": 29191.111 }, { "epoch": 0.6747352429307817, "grad_norm": 1.421875, "learning_rate": 2.9326143704882192e-05, "loss": 1.0833656311035156, "num_input_tokens_seen": 5422565120, "step": 19070, "train_runtime": 185761.9342, "train_tokens_per_second": 29190.938 }, { "epoch": 0.6750890631945105, "grad_norm": 1.484375, "learning_rate": 2.932110077606997e-05, "loss": 1.1005870819091796, "num_input_tokens_seen": 5425444800, "step": 19080, "train_runtime": 185858.9366, "train_tokens_per_second": 29191.197 }, { "epoch": 0.6754428834582392, "grad_norm": 1.46875, "learning_rate": 2.931606044791212e-05, "loss": 1.0951419830322267, "num_input_tokens_seen": 5428307008, "step": 19090, "train_runtime": 185955.8984, "train_tokens_per_second": 29191.368 }, { "epoch": 0.675796703721968, "grad_norm": 1.46875, "learning_rate": 2.9311022718174114e-05, "loss": 1.0833753585815429, "num_input_tokens_seen": 5431148672, "step": 19100, "train_runtime": 186051.9164, "train_tokens_per_second": 29191.576 }, { "epoch": 0.6761505239856969, "grad_norm": 1.46875, "learning_rate": 2.930598758462415e-05, "loss": 1.0919424057006837, "num_input_tokens_seen": 5433984128, "step": 19110, "train_runtime": 186148.4115, "train_tokens_per_second": 29191.676 }, { "epoch": 0.6765043442494256, "grad_norm": 1.4765625, "learning_rate": 2.9300955045033072e-05, "loss": 1.091560173034668, "num_input_tokens_seen": 5436845760, "step": 19120, "train_runtime": 186246.6845, "train_tokens_per_second": 29191.638 }, { "epoch": 0.6768581645131544, "grad_norm": 1.5078125, "learning_rate": 2.9295925097174435e-05, "loss": 1.092702865600586, "num_input_tokens_seen": 5439687872, "step": 19130, "train_runtime": 186343.686, "train_tokens_per_second": 29191.694 }, { "epoch": 0.6772119847768832, "grad_norm": 1.484375, "learning_rate": 2.929089773882445e-05, "loss": 1.0795379638671876, "num_input_tokens_seen": 5442598016, "step": 19140, "train_runtime": 186443.5976, "train_tokens_per_second": 29191.659 }, { "epoch": 0.6775658050406119, "grad_norm": 1.4765625, "learning_rate": 2.9285872967762007e-05, "loss": 1.0872017860412597, "num_input_tokens_seen": 5445430784, "step": 19150, "train_runtime": 186541.2136, "train_tokens_per_second": 29191.569 }, { "epoch": 0.6779196253043407, "grad_norm": 1.4453125, "learning_rate": 2.9280850781768638e-05, "loss": 1.0945188522338867, "num_input_tokens_seen": 5448254016, "step": 19160, "train_runtime": 186636.6447, "train_tokens_per_second": 29191.77 }, { "epoch": 0.6782734455680695, "grad_norm": 1.484375, "learning_rate": 2.9275831178628576e-05, "loss": 1.1001896858215332, "num_input_tokens_seen": 5451079232, "step": 19170, "train_runtime": 186734.4365, "train_tokens_per_second": 29191.612 }, { "epoch": 0.6786272658317982, "grad_norm": 1.359375, "learning_rate": 2.927081415612869e-05, "loss": 1.0868235588073731, "num_input_tokens_seen": 5453943552, "step": 19180, "train_runtime": 186831.1071, "train_tokens_per_second": 29191.839 }, { "epoch": 0.6789810860955271, "grad_norm": 1.4609375, "learning_rate": 2.9265799712058505e-05, "loss": 1.0899572372436523, "num_input_tokens_seen": 5456769984, "step": 19190, "train_runtime": 186928.818, "train_tokens_per_second": 29191.7 }, { "epoch": 0.6793349063592559, "grad_norm": 1.40625, "learning_rate": 2.926078784421019e-05, "loss": 1.088314151763916, "num_input_tokens_seen": 5459565120, "step": 19200, "train_runtime": 187025.1999, "train_tokens_per_second": 29191.602 }, { "epoch": 0.6796887266229846, "grad_norm": 1.4296875, "learning_rate": 2.9255778550378575e-05, "loss": 1.09413423538208, "num_input_tokens_seen": 5462365376, "step": 19210, "train_runtime": 187119.7468, "train_tokens_per_second": 29191.817 }, { "epoch": 0.6800425468867134, "grad_norm": 1.484375, "learning_rate": 2.9250771828361118e-05, "loss": 1.099820899963379, "num_input_tokens_seen": 5465167104, "step": 19220, "train_runtime": 187214.3196, "train_tokens_per_second": 29192.036 }, { "epoch": 0.6803963671504422, "grad_norm": 1.4609375, "learning_rate": 2.9245767675957923e-05, "loss": 1.088345432281494, "num_input_tokens_seen": 5468045760, "step": 19230, "train_runtime": 187315.3967, "train_tokens_per_second": 29191.651 }, { "epoch": 0.6807501874141709, "grad_norm": 1.5, "learning_rate": 2.924076609097172e-05, "loss": 1.0848025321960448, "num_input_tokens_seen": 5470898304, "step": 19240, "train_runtime": 187412.0854, "train_tokens_per_second": 29191.812 }, { "epoch": 0.6811040076778997, "grad_norm": 1.390625, "learning_rate": 2.9235767071207876e-05, "loss": 1.0876169204711914, "num_input_tokens_seen": 5473720128, "step": 19250, "train_runtime": 187510.3437, "train_tokens_per_second": 29191.564 }, { "epoch": 0.6814578279416285, "grad_norm": 1.3984375, "learning_rate": 2.9230770614474383e-05, "loss": 1.083964729309082, "num_input_tokens_seen": 5476543296, "step": 19260, "train_runtime": 187604.4355, "train_tokens_per_second": 29191.971 }, { "epoch": 0.6818116482053573, "grad_norm": 1.4296875, "learning_rate": 2.9225776718581842e-05, "loss": 1.0896371841430663, "num_input_tokens_seen": 5479396800, "step": 19270, "train_runtime": 187704.9121, "train_tokens_per_second": 29191.547 }, { "epoch": 0.6821654684690861, "grad_norm": 1.578125, "learning_rate": 2.9220785381343495e-05, "loss": 1.082411003112793, "num_input_tokens_seen": 5482251968, "step": 19280, "train_runtime": 187800.92, "train_tokens_per_second": 29191.827 }, { "epoch": 0.6825192887328149, "grad_norm": 1.4375, "learning_rate": 2.9215796600575174e-05, "loss": 1.100215530395508, "num_input_tokens_seen": 5485147520, "step": 19290, "train_runtime": 187900.1281, "train_tokens_per_second": 29191.824 }, { "epoch": 0.6828731089965436, "grad_norm": 1.4765625, "learning_rate": 2.9210810374095332e-05, "loss": 1.0939317703247071, "num_input_tokens_seen": 5488081408, "step": 19300, "train_runtime": 188004.1669, "train_tokens_per_second": 29191.275 }, { "epoch": 0.6832269292602724, "grad_norm": 1.46875, "learning_rate": 2.9205826699725026e-05, "loss": 1.0846552848815918, "num_input_tokens_seen": 5490922368, "step": 19310, "train_runtime": 188101.1667, "train_tokens_per_second": 29191.325 }, { "epoch": 0.6835807495240012, "grad_norm": 1.3984375, "learning_rate": 2.920084557528791e-05, "loss": 1.0832067489624024, "num_input_tokens_seen": 5493779520, "step": 19320, "train_runtime": 188199.2343, "train_tokens_per_second": 29191.296 }, { "epoch": 0.6839345697877299, "grad_norm": 1.46875, "learning_rate": 2.9195866998610245e-05, "loss": 1.0840791702270507, "num_input_tokens_seen": 5496683584, "step": 19330, "train_runtime": 188299.4467, "train_tokens_per_second": 29191.183 }, { "epoch": 0.6842883900514587, "grad_norm": 1.453125, "learning_rate": 2.9190890967520878e-05, "loss": 1.1022411346435548, "num_input_tokens_seen": 5499504832, "step": 19340, "train_runtime": 188395.2866, "train_tokens_per_second": 29191.308 }, { "epoch": 0.6846422103151875, "grad_norm": 1.421875, "learning_rate": 2.9185917479851243e-05, "loss": 1.0856489181518554, "num_input_tokens_seen": 5502320448, "step": 19350, "train_runtime": 188489.1529, "train_tokens_per_second": 29191.709 }, { "epoch": 0.6849960305789163, "grad_norm": 1.4375, "learning_rate": 2.9180946533435366e-05, "loss": 1.0901593208312987, "num_input_tokens_seen": 5505159232, "step": 19360, "train_runtime": 188587.6478, "train_tokens_per_second": 29191.515 }, { "epoch": 0.6853498508426451, "grad_norm": 1.453125, "learning_rate": 2.9175978126109853e-05, "loss": 1.0906315803527833, "num_input_tokens_seen": 5508060096, "step": 19370, "train_runtime": 188686.6545, "train_tokens_per_second": 29191.572 }, { "epoch": 0.6857036711063739, "grad_norm": 1.515625, "learning_rate": 2.9171012255713885e-05, "loss": 1.0797996520996094, "num_input_tokens_seen": 5510877184, "step": 19380, "train_runtime": 188781.1867, "train_tokens_per_second": 29191.877 }, { "epoch": 0.6860574913701026, "grad_norm": 1.46875, "learning_rate": 2.9166048920089217e-05, "loss": 1.0906700134277343, "num_input_tokens_seen": 5513754944, "step": 19390, "train_runtime": 188880.392, "train_tokens_per_second": 29191.781 }, { "epoch": 0.6864113116338314, "grad_norm": 1.421875, "learning_rate": 2.9161088117080175e-05, "loss": 1.08398494720459, "num_input_tokens_seen": 5516608448, "step": 19400, "train_runtime": 188977.526, "train_tokens_per_second": 29191.876 }, { "epoch": 0.6867651318975602, "grad_norm": 1.4609375, "learning_rate": 2.9156129844533658e-05, "loss": 1.1016504287719726, "num_input_tokens_seen": 5519425216, "step": 19410, "train_runtime": 189073.5648, "train_tokens_per_second": 29191.946 }, { "epoch": 0.6871189521612889, "grad_norm": 1.5, "learning_rate": 2.9151174100299104e-05, "loss": 1.0955078125, "num_input_tokens_seen": 5522282560, "step": 19420, "train_runtime": 189171.022, "train_tokens_per_second": 29192.011 }, { "epoch": 0.6874727724250177, "grad_norm": 1.4453125, "learning_rate": 2.9146220882228535e-05, "loss": 1.092181396484375, "num_input_tokens_seen": 5525120704, "step": 19430, "train_runtime": 189267.205, "train_tokens_per_second": 29192.171 }, { "epoch": 0.6878265926887466, "grad_norm": 1.421875, "learning_rate": 2.914127018817651e-05, "loss": 1.0844809532165527, "num_input_tokens_seen": 5527968768, "step": 19440, "train_runtime": 189363.597, "train_tokens_per_second": 29192.352 }, { "epoch": 0.6881804129524753, "grad_norm": 1.4765625, "learning_rate": 2.9136322016000152e-05, "loss": 1.094071388244629, "num_input_tokens_seen": 5530816640, "step": 19450, "train_runtime": 189460.134, "train_tokens_per_second": 29192.509 }, { "epoch": 0.6885342332162041, "grad_norm": 1.4765625, "learning_rate": 2.9131376363559116e-05, "loss": 1.0853330612182617, "num_input_tokens_seen": 5533670784, "step": 19460, "train_runtime": 189558.8665, "train_tokens_per_second": 29192.361 }, { "epoch": 0.6888880534799329, "grad_norm": 1.3828125, "learning_rate": 2.9126433228715606e-05, "loss": 1.0917522430419921, "num_input_tokens_seen": 5536528192, "step": 19470, "train_runtime": 189656.5566, "train_tokens_per_second": 29192.39 }, { "epoch": 0.6892418737436616, "grad_norm": 1.453125, "learning_rate": 2.9121492609334354e-05, "loss": 1.0888936996459961, "num_input_tokens_seen": 5539371584, "step": 19480, "train_runtime": 189755.0936, "train_tokens_per_second": 29192.215 }, { "epoch": 0.6895956940073904, "grad_norm": 1.53125, "learning_rate": 2.9116554503282656e-05, "loss": 1.1009056091308593, "num_input_tokens_seen": 5542197632, "step": 19490, "train_runtime": 189852.9602, "train_tokens_per_second": 29192.053 }, { "epoch": 0.6899495142711192, "grad_norm": 1.4375, "learning_rate": 2.9111618908430303e-05, "loss": 1.1005096435546875, "num_input_tokens_seen": 5545063616, "step": 19500, "train_runtime": 189950.3237, "train_tokens_per_second": 29192.178 }, { "epoch": 0.6903033345348479, "grad_norm": 1.4765625, "learning_rate": 2.9106685822649643e-05, "loss": 1.0799062728881836, "num_input_tokens_seen": 5547930752, "step": 19510, "train_runtime": 190050.5956, "train_tokens_per_second": 29191.862 }, { "epoch": 0.6906571547985768, "grad_norm": 1.5078125, "learning_rate": 2.910175524381552e-05, "loss": 1.0904115676879882, "num_input_tokens_seen": 5550838656, "step": 19520, "train_runtime": 190152.5324, "train_tokens_per_second": 29191.505 }, { "epoch": 0.6910109750623056, "grad_norm": 1.4453125, "learning_rate": 2.9096827169805318e-05, "loss": 1.1013668060302735, "num_input_tokens_seen": 5553703552, "step": 19530, "train_runtime": 190249.9517, "train_tokens_per_second": 29191.616 }, { "epoch": 0.6913647953260343, "grad_norm": 1.3984375, "learning_rate": 2.9091901598498923e-05, "loss": 1.0842442512512207, "num_input_tokens_seen": 5556544960, "step": 19540, "train_runtime": 190345.4545, "train_tokens_per_second": 29191.897 }, { "epoch": 0.6917186155897631, "grad_norm": 1.515625, "learning_rate": 2.9086978527778736e-05, "loss": 1.0904832839965821, "num_input_tokens_seen": 5559399936, "step": 19550, "train_runtime": 190445.6296, "train_tokens_per_second": 29191.533 }, { "epoch": 0.6920724358534919, "grad_norm": 1.5078125, "learning_rate": 2.9082057955529668e-05, "loss": 1.0956499099731445, "num_input_tokens_seen": 5562200832, "step": 19560, "train_runtime": 190541.0884, "train_tokens_per_second": 29191.608 }, { "epoch": 0.6924262561172206, "grad_norm": 1.453125, "learning_rate": 2.907713987963914e-05, "loss": 1.0887033462524414, "num_input_tokens_seen": 5565021952, "step": 19570, "train_runtime": 190636.6222, "train_tokens_per_second": 29191.778 }, { "epoch": 0.6927800763809494, "grad_norm": 1.4453125, "learning_rate": 2.9072224297997058e-05, "loss": 1.0784814834594727, "num_input_tokens_seen": 5567839552, "step": 19580, "train_runtime": 190731.9377, "train_tokens_per_second": 29191.962 }, { "epoch": 0.6931338966446782, "grad_norm": 1.4921875, "learning_rate": 2.9067311208495834e-05, "loss": 1.096353530883789, "num_input_tokens_seen": 5570708480, "step": 19590, "train_runtime": 190830.4026, "train_tokens_per_second": 29191.934 }, { "epoch": 0.6934877169084069, "grad_norm": 1.578125, "learning_rate": 2.9062400609030372e-05, "loss": 1.0887290954589843, "num_input_tokens_seen": 5573613440, "step": 19600, "train_runtime": 190935.4069, "train_tokens_per_second": 29191.094 }, { "epoch": 0.6938415371721358, "grad_norm": 1.5390625, "learning_rate": 2.905749249749806e-05, "loss": 1.0947599411010742, "num_input_tokens_seen": 5576448704, "step": 19610, "train_runtime": 191031.4505, "train_tokens_per_second": 29191.26 }, { "epoch": 0.6941953574358646, "grad_norm": 1.5078125, "learning_rate": 2.905258687179878e-05, "loss": 1.0950462341308593, "num_input_tokens_seen": 5579299264, "step": 19620, "train_runtime": 191129.8609, "train_tokens_per_second": 29191.144 }, { "epoch": 0.6945491776995933, "grad_norm": 1.4140625, "learning_rate": 2.904768372983488e-05, "loss": 1.0760307312011719, "num_input_tokens_seen": 5582173632, "step": 19630, "train_runtime": 191229.0088, "train_tokens_per_second": 29191.04 }, { "epoch": 0.6949029979633221, "grad_norm": 1.4609375, "learning_rate": 2.90427830695112e-05, "loss": 1.0803937911987305, "num_input_tokens_seen": 5585031104, "step": 19640, "train_runtime": 191325.9687, "train_tokens_per_second": 29191.182 }, { "epoch": 0.6952568182270509, "grad_norm": 1.46875, "learning_rate": 2.9037884888735044e-05, "loss": 1.0880586624145507, "num_input_tokens_seen": 5587897024, "step": 19650, "train_runtime": 191423.5523, "train_tokens_per_second": 29191.272 }, { "epoch": 0.6956106384907796, "grad_norm": 1.4921875, "learning_rate": 2.9032989185416194e-05, "loss": 1.0889060020446777, "num_input_tokens_seen": 5590733440, "step": 19660, "train_runtime": 191518.7222, "train_tokens_per_second": 29191.577 }, { "epoch": 0.6959644587545084, "grad_norm": 1.484375, "learning_rate": 2.9028095957466888e-05, "loss": 1.0846498489379883, "num_input_tokens_seen": 5593578688, "step": 19670, "train_runtime": 191618.6324, "train_tokens_per_second": 29191.205 }, { "epoch": 0.6963182790182372, "grad_norm": 1.4296875, "learning_rate": 2.9023205202801833e-05, "loss": 1.1014820098876954, "num_input_tokens_seen": 5596428224, "step": 19680, "train_runtime": 191718.9395, "train_tokens_per_second": 29190.795 }, { "epoch": 0.696672099281966, "grad_norm": 1.4453125, "learning_rate": 2.90183169193382e-05, "loss": 1.086155891418457, "num_input_tokens_seen": 5599307520, "step": 19690, "train_runtime": 191818.0104, "train_tokens_per_second": 29190.729 }, { "epoch": 0.6970259195456948, "grad_norm": 1.4453125, "learning_rate": 2.90134311049956e-05, "loss": 1.0921913146972657, "num_input_tokens_seen": 5602154304, "step": 19700, "train_runtime": 191916.7749, "train_tokens_per_second": 29190.54 }, { "epoch": 0.6973797398094236, "grad_norm": 1.4765625, "learning_rate": 2.90085477576961e-05, "loss": 1.0807540893554688, "num_input_tokens_seen": 5605031168, "step": 19710, "train_runtime": 192016.6811, "train_tokens_per_second": 29190.335 }, { "epoch": 0.6977335600731523, "grad_norm": 1.4375, "learning_rate": 2.9003666875364226e-05, "loss": 1.087117862701416, "num_input_tokens_seen": 5607879552, "step": 19720, "train_runtime": 192117.1118, "train_tokens_per_second": 29189.901 }, { "epoch": 0.6980873803368811, "grad_norm": 1.484375, "learning_rate": 2.899878845592694e-05, "loss": 1.0962993621826171, "num_input_tokens_seen": 5610736960, "step": 19730, "train_runtime": 192214.2101, "train_tokens_per_second": 29190.022 }, { "epoch": 0.6984412006006099, "grad_norm": 1.4765625, "learning_rate": 2.8993912497313636e-05, "loss": 1.1015631675720214, "num_input_tokens_seen": 5613547520, "step": 19740, "train_runtime": 192309.7418, "train_tokens_per_second": 29190.136 }, { "epoch": 0.6987950208643386, "grad_norm": 1.5234375, "learning_rate": 2.8989038997456153e-05, "loss": 1.1008919715881347, "num_input_tokens_seen": 5616413824, "step": 19750, "train_runtime": 192409.5395, "train_tokens_per_second": 29189.893 }, { "epoch": 0.6991488411280674, "grad_norm": 1.5234375, "learning_rate": 2.898416795428876e-05, "loss": 1.0842368125915527, "num_input_tokens_seen": 5619273088, "step": 19760, "train_runtime": 192508.2407, "train_tokens_per_second": 29189.779 }, { "epoch": 0.6995026613917963, "grad_norm": 1.4453125, "learning_rate": 2.897929936574816e-05, "loss": 1.0945915222167968, "num_input_tokens_seen": 5622143360, "step": 19770, "train_runtime": 192607.0722, "train_tokens_per_second": 29189.704 }, { "epoch": 0.699856481655525, "grad_norm": 1.4609375, "learning_rate": 2.8974433229773478e-05, "loss": 1.0760332107543946, "num_input_tokens_seen": 5624978304, "step": 19780, "train_runtime": 192704.4175, "train_tokens_per_second": 29189.67 }, { "epoch": 0.7002103019192538, "grad_norm": 1.484375, "learning_rate": 2.896956954430625e-05, "loss": 1.0991595268249512, "num_input_tokens_seen": 5627826944, "step": 19790, "train_runtime": 192800.5018, "train_tokens_per_second": 29189.898 }, { "epoch": 0.7005641221829826, "grad_norm": 1.484375, "learning_rate": 2.896470830729045e-05, "loss": 1.0913871765136718, "num_input_tokens_seen": 5630693376, "step": 19800, "train_runtime": 192899.3496, "train_tokens_per_second": 29189.8 }, { "epoch": 0.7009179424467114, "grad_norm": 1.4453125, "learning_rate": 2.895984951667245e-05, "loss": 1.074981689453125, "num_input_tokens_seen": 5633505024, "step": 19810, "train_runtime": 192995.857, "train_tokens_per_second": 29189.772 }, { "epoch": 0.7012717627104401, "grad_norm": 1.4453125, "learning_rate": 2.8954993170401047e-05, "loss": 1.103561019897461, "num_input_tokens_seen": 5636371072, "step": 19820, "train_runtime": 193095.3345, "train_tokens_per_second": 29189.577 }, { "epoch": 0.7016255829741689, "grad_norm": 1.546875, "learning_rate": 2.8950139266427423e-05, "loss": 1.0803226470947265, "num_input_tokens_seen": 5639171712, "step": 19830, "train_runtime": 193195.1816, "train_tokens_per_second": 29188.987 }, { "epoch": 0.7019794032378976, "grad_norm": 1.453125, "learning_rate": 2.8945287802705186e-05, "loss": 1.0966381072998046, "num_input_tokens_seen": 5642090560, "step": 19840, "train_runtime": 193299.5293, "train_tokens_per_second": 29188.331 }, { "epoch": 0.7023332235016264, "grad_norm": 1.4921875, "learning_rate": 2.8940438777190336e-05, "loss": 1.0877382278442382, "num_input_tokens_seen": 5644966464, "step": 19850, "train_runtime": 193397.4449, "train_tokens_per_second": 29188.423 }, { "epoch": 0.7026870437653553, "grad_norm": 1.5234375, "learning_rate": 2.8935592187841265e-05, "loss": 1.0996005058288574, "num_input_tokens_seen": 5647789632, "step": 19860, "train_runtime": 193493.9888, "train_tokens_per_second": 29188.45 }, { "epoch": 0.7030408640290841, "grad_norm": 1.4765625, "learning_rate": 2.893074803261876e-05, "loss": 1.1107070922851563, "num_input_tokens_seen": 5650654400, "step": 19870, "train_runtime": 193592.5673, "train_tokens_per_second": 29188.385 }, { "epoch": 0.7033946842928128, "grad_norm": 1.453125, "learning_rate": 2.8925906309485995e-05, "loss": 1.1060708999633788, "num_input_tokens_seen": 5653547328, "step": 19880, "train_runtime": 193691.9477, "train_tokens_per_second": 29188.345 }, { "epoch": 0.7037485045565416, "grad_norm": 1.46875, "learning_rate": 2.8921067016408532e-05, "loss": 1.0840373992919923, "num_input_tokens_seen": 5656377152, "step": 19890, "train_runtime": 193786.0592, "train_tokens_per_second": 29188.772 }, { "epoch": 0.7041023248202704, "grad_norm": 1.46875, "learning_rate": 2.8916230151354316e-05, "loss": 1.09478816986084, "num_input_tokens_seen": 5659159808, "step": 19900, "train_runtime": 193880.5657, "train_tokens_per_second": 29188.897 }, { "epoch": 0.7044561450839991, "grad_norm": 1.4609375, "learning_rate": 2.8911395712293677e-05, "loss": 1.0978190422058105, "num_input_tokens_seen": 5661991040, "step": 19910, "train_runtime": 193977.3448, "train_tokens_per_second": 29188.929 }, { "epoch": 0.7048099653477279, "grad_norm": 1.515625, "learning_rate": 2.8906563697199294e-05, "loss": 1.0917061805725097, "num_input_tokens_seen": 5664812992, "step": 19920, "train_runtime": 194072.7129, "train_tokens_per_second": 29189.127 }, { "epoch": 0.7051637856114567, "grad_norm": 1.4375, "learning_rate": 2.8901734104046245e-05, "loss": 1.0856008529663086, "num_input_tokens_seen": 5667594496, "step": 19930, "train_runtime": 194167.5294, "train_tokens_per_second": 29189.198 }, { "epoch": 0.7055176058751855, "grad_norm": 1.4921875, "learning_rate": 2.8896906930811964e-05, "loss": 1.0891366958618165, "num_input_tokens_seen": 5670416896, "step": 19940, "train_runtime": 194261.7956, "train_tokens_per_second": 29189.563 }, { "epoch": 0.7058714261389143, "grad_norm": 1.53125, "learning_rate": 2.8892082175476243e-05, "loss": 1.0832382202148438, "num_input_tokens_seen": 5673184896, "step": 19950, "train_runtime": 194353.1425, "train_tokens_per_second": 29190.086 }, { "epoch": 0.7062252464026431, "grad_norm": 1.484375, "learning_rate": 2.8887259836021246e-05, "loss": 1.07581787109375, "num_input_tokens_seen": 5676008320, "step": 19960, "train_runtime": 194448.4622, "train_tokens_per_second": 29190.297 }, { "epoch": 0.7065790666663718, "grad_norm": 1.4609375, "learning_rate": 2.8882439910431493e-05, "loss": 1.0983402252197265, "num_input_tokens_seen": 5678878592, "step": 19970, "train_runtime": 194548.7966, "train_tokens_per_second": 29189.996 }, { "epoch": 0.7069328869301006, "grad_norm": 1.46875, "learning_rate": 2.8877622396693843e-05, "loss": 1.0802966117858888, "num_input_tokens_seen": 5681686336, "step": 19980, "train_runtime": 194643.0368, "train_tokens_per_second": 29190.288 }, { "epoch": 0.7072867071938294, "grad_norm": 1.4375, "learning_rate": 2.8872807292797516e-05, "loss": 1.0902936935424805, "num_input_tokens_seen": 5684484224, "step": 19990, "train_runtime": 194736.8987, "train_tokens_per_second": 29190.586 }, { "epoch": 0.7076405274575581, "grad_norm": 1.3984375, "learning_rate": 2.8867994596734084e-05, "loss": 1.0697978019714356, "num_input_tokens_seen": 5687337600, "step": 20000, "train_runtime": 194834.3094, "train_tokens_per_second": 29190.637 }, { "epoch": 0.7076405274575581, "eval_loss": 1.0228816270828247, "eval_runtime": 8.4427, "eval_samples_per_second": 472.363, "eval_steps_per_second": 3.79, "num_input_tokens_seen": 5687337600, "step": 20000 }, { "epoch": 0.7079943477212869, "grad_norm": 1.4296875, "learning_rate": 2.8863184306497437e-05, "loss": 1.0925306320190429, "num_input_tokens_seen": 5690213376, "step": 20010, "train_runtime": 194965.6015, "train_tokens_per_second": 29185.73 }, { "epoch": 0.7083481679850158, "grad_norm": 1.4765625, "learning_rate": 2.8858376420083848e-05, "loss": 1.0952974319458009, "num_input_tokens_seen": 5693051008, "step": 20020, "train_runtime": 195061.0169, "train_tokens_per_second": 29186.001 }, { "epoch": 0.7087019882487445, "grad_norm": 1.4765625, "learning_rate": 2.8853570935491873e-05, "loss": 1.0926799774169922, "num_input_tokens_seen": 5695909696, "step": 20030, "train_runtime": 195158.4023, "train_tokens_per_second": 29186.085 }, { "epoch": 0.7090558085124733, "grad_norm": 1.4453125, "learning_rate": 2.8848767850722447e-05, "loss": 1.0882314682006835, "num_input_tokens_seen": 5698707008, "step": 20040, "train_runtime": 195251.1642, "train_tokens_per_second": 29186.546 }, { "epoch": 0.7094096287762021, "grad_norm": 1.4921875, "learning_rate": 2.88439671637788e-05, "loss": 1.0749954223632812, "num_input_tokens_seen": 5701546880, "step": 20050, "train_runtime": 195345.0275, "train_tokens_per_second": 29187.059 }, { "epoch": 0.7097634490399308, "grad_norm": 1.453125, "learning_rate": 2.8839168872666505e-05, "loss": 1.0942911148071288, "num_input_tokens_seen": 5704427968, "step": 20060, "train_runtime": 195444.3986, "train_tokens_per_second": 29186.961 }, { "epoch": 0.7101172693036596, "grad_norm": 1.46875, "learning_rate": 2.8834372975393448e-05, "loss": 1.0947986602783204, "num_input_tokens_seen": 5707261696, "step": 20070, "train_runtime": 195543.1737, "train_tokens_per_second": 29186.709 }, { "epoch": 0.7104710895673884, "grad_norm": 1.4765625, "learning_rate": 2.8829579469969843e-05, "loss": 1.0881196975708007, "num_input_tokens_seen": 5710143360, "step": 20080, "train_runtime": 195644.2279, "train_tokens_per_second": 29186.363 }, { "epoch": 0.7108249098311171, "grad_norm": 1.5, "learning_rate": 2.88247883544082e-05, "loss": 1.0811176300048828, "num_input_tokens_seen": 5712987712, "step": 20090, "train_runtime": 195739.4787, "train_tokens_per_second": 29186.691 }, { "epoch": 0.7111787300948459, "grad_norm": 1.46875, "learning_rate": 2.8819999626723366e-05, "loss": 1.0837835311889648, "num_input_tokens_seen": 5715797888, "step": 20100, "train_runtime": 195837.1104, "train_tokens_per_second": 29186.49 }, { "epoch": 0.7115325503585748, "grad_norm": 1.5, "learning_rate": 2.881521328493248e-05, "loss": 1.094403076171875, "num_input_tokens_seen": 5718698624, "step": 20110, "train_runtime": 195940.1735, "train_tokens_per_second": 29185.942 }, { "epoch": 0.7118863706223035, "grad_norm": 1.4921875, "learning_rate": 2.881042932705499e-05, "loss": 1.0817872047424317, "num_input_tokens_seen": 5721542016, "step": 20120, "train_runtime": 196038.5884, "train_tokens_per_second": 29185.795 }, { "epoch": 0.7122401908860323, "grad_norm": 1.4375, "learning_rate": 2.8805647751112635e-05, "loss": 1.0949193954467773, "num_input_tokens_seen": 5724366592, "step": 20130, "train_runtime": 196134.4216, "train_tokens_per_second": 29185.936 }, { "epoch": 0.7125940111497611, "grad_norm": 1.515625, "learning_rate": 2.8800868555129462e-05, "loss": 1.080448818206787, "num_input_tokens_seen": 5727242496, "step": 20140, "train_runtime": 196233.8922, "train_tokens_per_second": 29185.797 }, { "epoch": 0.7129478314134898, "grad_norm": 1.5, "learning_rate": 2.8796091737131814e-05, "loss": 1.0960376739501954, "num_input_tokens_seen": 5730071552, "step": 20150, "train_runtime": 196334.6362, "train_tokens_per_second": 29185.23 }, { "epoch": 0.7133016516772186, "grad_norm": 1.453125, "learning_rate": 2.8791317295148322e-05, "loss": 1.0841053009033204, "num_input_tokens_seen": 5732937792, "step": 20160, "train_runtime": 196432.9402, "train_tokens_per_second": 29185.216 }, { "epoch": 0.7136554719409474, "grad_norm": 1.40625, "learning_rate": 2.8786545227209893e-05, "loss": 1.0891578674316407, "num_input_tokens_seen": 5735873920, "step": 20170, "train_runtime": 196535.513, "train_tokens_per_second": 29184.924 }, { "epoch": 0.7140092922046761, "grad_norm": 1.4609375, "learning_rate": 2.8781775531349742e-05, "loss": 1.0758840560913085, "num_input_tokens_seen": 5738691328, "step": 20180, "train_runtime": 196632.2626, "train_tokens_per_second": 29184.892 }, { "epoch": 0.714363112468405, "grad_norm": 1.4609375, "learning_rate": 2.8777008205603334e-05, "loss": 1.080224609375, "num_input_tokens_seen": 5741575872, "step": 20190, "train_runtime": 196731.0299, "train_tokens_per_second": 29184.902 }, { "epoch": 0.7147169327321338, "grad_norm": 1.5078125, "learning_rate": 2.877224324800844e-05, "loss": 1.0910663604736328, "num_input_tokens_seen": 5744369344, "step": 20200, "train_runtime": 196826.0572, "train_tokens_per_second": 29185.004 }, { "epoch": 0.7150707529958625, "grad_norm": 1.53125, "learning_rate": 2.8767480656605078e-05, "loss": 1.0980361938476562, "num_input_tokens_seen": 5747209984, "step": 20210, "train_runtime": 196921.5211, "train_tokens_per_second": 29185.281 }, { "epoch": 0.7154245732595913, "grad_norm": 1.4609375, "learning_rate": 2.8762720429435556e-05, "loss": 1.0987638473510741, "num_input_tokens_seen": 5750020864, "step": 20220, "train_runtime": 197017.2893, "train_tokens_per_second": 29185.362 }, { "epoch": 0.7157783935233201, "grad_norm": 1.4765625, "learning_rate": 2.8757962564544448e-05, "loss": 1.0891666412353516, "num_input_tokens_seen": 5752873536, "step": 20230, "train_runtime": 197115.1965, "train_tokens_per_second": 29185.338 }, { "epoch": 0.7161322137870488, "grad_norm": 1.4296875, "learning_rate": 2.8753207059978586e-05, "loss": 1.0760698318481445, "num_input_tokens_seen": 5755677440, "step": 20240, "train_runtime": 197209.8521, "train_tokens_per_second": 29185.547 }, { "epoch": 0.7164860340507776, "grad_norm": 1.4296875, "learning_rate": 2.874845391378706e-05, "loss": 1.0904196739196776, "num_input_tokens_seen": 5758570688, "step": 20250, "train_runtime": 197309.8637, "train_tokens_per_second": 29185.417 }, { "epoch": 0.7168398543145064, "grad_norm": 1.4375, "learning_rate": 2.874370312402121e-05, "loss": 1.0977852821350098, "num_input_tokens_seen": 5761387904, "step": 20260, "train_runtime": 197404.6991, "train_tokens_per_second": 29185.667 }, { "epoch": 0.7171936745782352, "grad_norm": 1.4921875, "learning_rate": 2.8738954688734647e-05, "loss": 1.0906200408935547, "num_input_tokens_seen": 5764247104, "step": 20270, "train_runtime": 197505.1961, "train_tokens_per_second": 29185.293 }, { "epoch": 0.717547494841964, "grad_norm": 1.4375, "learning_rate": 2.8734208605983226e-05, "loss": 1.0951306343078613, "num_input_tokens_seen": 5767154432, "step": 20280, "train_runtime": 197608.0578, "train_tokens_per_second": 29184.814 }, { "epoch": 0.7179013151056928, "grad_norm": 1.5, "learning_rate": 2.8729464873825035e-05, "loss": 1.0831586837768554, "num_input_tokens_seen": 5769997696, "step": 20290, "train_runtime": 197708.2035, "train_tokens_per_second": 29184.412 }, { "epoch": 0.7182551353694215, "grad_norm": 1.4609375, "learning_rate": 2.8724723490320427e-05, "loss": 1.0909561157226562, "num_input_tokens_seen": 5772786240, "step": 20300, "train_runtime": 197802.7165, "train_tokens_per_second": 29184.565 }, { "epoch": 0.7186089556331503, "grad_norm": 1.3984375, "learning_rate": 2.8719984453531983e-05, "loss": 1.0886833190917968, "num_input_tokens_seen": 5775593920, "step": 20310, "train_runtime": 197896.3895, "train_tokens_per_second": 29184.938 }, { "epoch": 0.7189627758968791, "grad_norm": 1.4375, "learning_rate": 2.871524776152452e-05, "loss": 1.0860897064208985, "num_input_tokens_seen": 5778514880, "step": 20320, "train_runtime": 198000.1728, "train_tokens_per_second": 29184.393 }, { "epoch": 0.7193165961606078, "grad_norm": 1.4453125, "learning_rate": 2.8710513412365093e-05, "loss": 1.1019561767578125, "num_input_tokens_seen": 5781344768, "step": 20330, "train_runtime": 198097.5728, "train_tokens_per_second": 29184.329 }, { "epoch": 0.7196704164243366, "grad_norm": 1.4453125, "learning_rate": 2.8705781404122977e-05, "loss": 1.0983673095703126, "num_input_tokens_seen": 5784193728, "step": 20340, "train_runtime": 198196.4053, "train_tokens_per_second": 29184.151 }, { "epoch": 0.7200242366880654, "grad_norm": 1.4921875, "learning_rate": 2.87010517348697e-05, "loss": 1.0921268463134766, "num_input_tokens_seen": 5787004928, "step": 20350, "train_runtime": 198289.2752, "train_tokens_per_second": 29184.659 }, { "epoch": 0.7203780569517942, "grad_norm": 1.5234375, "learning_rate": 2.8696324402678976e-05, "loss": 1.0820493698120117, "num_input_tokens_seen": 5789859136, "step": 20360, "train_runtime": 198387.9519, "train_tokens_per_second": 29184.53 }, { "epoch": 0.720731877215523, "grad_norm": 1.453125, "learning_rate": 2.8691599405626764e-05, "loss": 1.0730117797851562, "num_input_tokens_seen": 5792650304, "step": 20370, "train_runtime": 198480.455, "train_tokens_per_second": 29184.991 }, { "epoch": 0.7210856974792518, "grad_norm": 1.5078125, "learning_rate": 2.8686876741791234e-05, "loss": 1.075141143798828, "num_input_tokens_seen": 5795493184, "step": 20380, "train_runtime": 198575.8295, "train_tokens_per_second": 29185.29 }, { "epoch": 0.7214395177429805, "grad_norm": 1.4765625, "learning_rate": 2.8682156409252775e-05, "loss": 1.0916683197021484, "num_input_tokens_seen": 5798369408, "step": 20390, "train_runtime": 198678.0561, "train_tokens_per_second": 29184.75 }, { "epoch": 0.7217933380067093, "grad_norm": 1.4140625, "learning_rate": 2.8677438406093976e-05, "loss": 1.0880443572998046, "num_input_tokens_seen": 5801295872, "step": 20400, "train_runtime": 198780.1186, "train_tokens_per_second": 29184.487 }, { "epoch": 0.7221471582704381, "grad_norm": 1.4375, "learning_rate": 2.867272273039964e-05, "loss": 1.0962202072143554, "num_input_tokens_seen": 5804118912, "step": 20410, "train_runtime": 198878.4957, "train_tokens_per_second": 29184.246 }, { "epoch": 0.7225009785341668, "grad_norm": 1.46875, "learning_rate": 2.8668009380256765e-05, "loss": 1.0831769943237304, "num_input_tokens_seen": 5806953088, "step": 20420, "train_runtime": 198975.6041, "train_tokens_per_second": 29184.247 }, { "epoch": 0.7228547987978956, "grad_norm": 1.46875, "learning_rate": 2.8663298353754574e-05, "loss": 1.0717395782470702, "num_input_tokens_seen": 5809839424, "step": 20430, "train_runtime": 199073.4705, "train_tokens_per_second": 29184.398 }, { "epoch": 0.7232086190616245, "grad_norm": 1.5078125, "learning_rate": 2.865858964898445e-05, "loss": 1.067544651031494, "num_input_tokens_seen": 5812671488, "step": 20440, "train_runtime": 199171.2854, "train_tokens_per_second": 29184.285 }, { "epoch": 0.7235624393253532, "grad_norm": 1.5234375, "learning_rate": 2.8653883264040004e-05, "loss": 1.0977293014526368, "num_input_tokens_seen": 5815518528, "step": 20450, "train_runtime": 199270.2613, "train_tokens_per_second": 29184.076 }, { "epoch": 0.723916259589082, "grad_norm": 1.4375, "learning_rate": 2.8649179197017017e-05, "loss": 1.074941349029541, "num_input_tokens_seen": 5818345600, "step": 20460, "train_runtime": 199364.8499, "train_tokens_per_second": 29184.41 }, { "epoch": 0.7242700798528108, "grad_norm": 1.484375, "learning_rate": 2.864447744601347e-05, "loss": 1.0839223861694336, "num_input_tokens_seen": 5821212608, "step": 20470, "train_runtime": 199465.5614, "train_tokens_per_second": 29184.048 }, { "epoch": 0.7246239001165395, "grad_norm": 1.453125, "learning_rate": 2.8639778009129507e-05, "loss": 1.0871542930603026, "num_input_tokens_seen": 5824051264, "step": 20480, "train_runtime": 199561.9693, "train_tokens_per_second": 29184.174 }, { "epoch": 0.7249777203802683, "grad_norm": 1.5546875, "learning_rate": 2.8635080884467492e-05, "loss": 1.1037616729736328, "num_input_tokens_seen": 5826942080, "step": 20490, "train_runtime": 199662.534, "train_tokens_per_second": 29183.953 }, { "epoch": 0.7253315406439971, "grad_norm": 1.546875, "learning_rate": 2.8630386070131927e-05, "loss": 1.0879095077514649, "num_input_tokens_seen": 5829822528, "step": 20500, "train_runtime": 199760.2839, "train_tokens_per_second": 29184.092 }, { "epoch": 0.7256853609077258, "grad_norm": 1.4453125, "learning_rate": 2.8625693564229507e-05, "loss": 1.0806976318359376, "num_input_tokens_seen": 5832641408, "step": 20510, "train_runtime": 199856.8314, "train_tokens_per_second": 29184.098 }, { "epoch": 0.7260391811714547, "grad_norm": 1.46875, "learning_rate": 2.8621003364869102e-05, "loss": 1.1008872985839844, "num_input_tokens_seen": 5835486976, "step": 20520, "train_runtime": 199955.4398, "train_tokens_per_second": 29183.937 }, { "epoch": 0.7263930014351835, "grad_norm": 1.5078125, "learning_rate": 2.8616315470161738e-05, "loss": 1.0980289459228516, "num_input_tokens_seen": 5838337664, "step": 20530, "train_runtime": 200049.8944, "train_tokens_per_second": 29184.408 }, { "epoch": 0.7267468216989122, "grad_norm": 1.4375, "learning_rate": 2.8611629878220624e-05, "loss": 1.0838214874267578, "num_input_tokens_seen": 5841176896, "step": 20540, "train_runtime": 200143.8794, "train_tokens_per_second": 29184.889 }, { "epoch": 0.727100641962641, "grad_norm": 1.5234375, "learning_rate": 2.8606946587161116e-05, "loss": 1.0899641036987304, "num_input_tokens_seen": 5844045184, "step": 20550, "train_runtime": 200239.7846, "train_tokens_per_second": 29185.235 }, { "epoch": 0.7274544622263698, "grad_norm": 1.484375, "learning_rate": 2.860226559510072e-05, "loss": 1.086819839477539, "num_input_tokens_seen": 5846909568, "step": 20560, "train_runtime": 200337.0593, "train_tokens_per_second": 29185.362 }, { "epoch": 0.7278082824900985, "grad_norm": 1.4296875, "learning_rate": 2.859758690015913e-05, "loss": 1.0753935813903808, "num_input_tokens_seen": 5849704832, "step": 20570, "train_runtime": 200433.6118, "train_tokens_per_second": 29185.249 }, { "epoch": 0.7281621027538273, "grad_norm": 1.4453125, "learning_rate": 2.8592910500458154e-05, "loss": 1.0973416328430177, "num_input_tokens_seen": 5852570432, "step": 20580, "train_runtime": 200529.0901, "train_tokens_per_second": 29185.643 }, { "epoch": 0.7285159230175561, "grad_norm": 1.421875, "learning_rate": 2.858823639412178e-05, "loss": 1.0996490478515626, "num_input_tokens_seen": 5855476864, "step": 20590, "train_runtime": 200631.3745, "train_tokens_per_second": 29185.25 }, { "epoch": 0.7288697432812848, "grad_norm": 1.4453125, "learning_rate": 2.858356457927613e-05, "loss": 1.0959861755371094, "num_input_tokens_seen": 5858295936, "step": 20600, "train_runtime": 200727.9582, "train_tokens_per_second": 29185.251 }, { "epoch": 0.7292235635450137, "grad_norm": 1.5, "learning_rate": 2.857889505404946e-05, "loss": 1.094660186767578, "num_input_tokens_seen": 5861133632, "step": 20610, "train_runtime": 200827.9127, "train_tokens_per_second": 29184.856 }, { "epoch": 0.7295773838087425, "grad_norm": 1.390625, "learning_rate": 2.8574227816572184e-05, "loss": 1.070242214202881, "num_input_tokens_seen": 5863989568, "step": 20620, "train_runtime": 200927.2653, "train_tokens_per_second": 29184.638 }, { "epoch": 0.7299312040724713, "grad_norm": 1.53125, "learning_rate": 2.856956286497684e-05, "loss": 1.0797122955322265, "num_input_tokens_seen": 5866803392, "step": 20630, "train_runtime": 201021.5821, "train_tokens_per_second": 29184.943 }, { "epoch": 0.7302850243362, "grad_norm": 1.421875, "learning_rate": 2.85649001973981e-05, "loss": 1.0852837562561035, "num_input_tokens_seen": 5869583616, "step": 20640, "train_runtime": 201116.799, "train_tokens_per_second": 29184.949 }, { "epoch": 0.7306388445999288, "grad_norm": 1.4609375, "learning_rate": 2.8560239811972754e-05, "loss": 1.0829025268554688, "num_input_tokens_seen": 5872449152, "step": 20650, "train_runtime": 201214.4393, "train_tokens_per_second": 29185.029 }, { "epoch": 0.7309926648636575, "grad_norm": 1.4375, "learning_rate": 2.855558170683976e-05, "loss": 1.085296630859375, "num_input_tokens_seen": 5875205056, "step": 20660, "train_runtime": 201305.5004, "train_tokens_per_second": 29185.517 }, { "epoch": 0.7313464851273863, "grad_norm": 1.3984375, "learning_rate": 2.855092588014017e-05, "loss": 1.0773494720458985, "num_input_tokens_seen": 5878038464, "step": 20670, "train_runtime": 201401.1528, "train_tokens_per_second": 29185.724 }, { "epoch": 0.7317003053911151, "grad_norm": 1.4609375, "learning_rate": 2.854627233001715e-05, "loss": 1.0850372314453125, "num_input_tokens_seen": 5880880256, "step": 20680, "train_runtime": 201498.3317, "train_tokens_per_second": 29185.752 }, { "epoch": 0.732054125654844, "grad_norm": 1.4765625, "learning_rate": 2.8541621054615992e-05, "loss": 1.090677261352539, "num_input_tokens_seen": 5883739392, "step": 20690, "train_runtime": 201596.9171, "train_tokens_per_second": 29185.662 }, { "epoch": 0.7324079459185727, "grad_norm": 1.4921875, "learning_rate": 2.8536972052084122e-05, "loss": 1.087679100036621, "num_input_tokens_seen": 5886572544, "step": 20700, "train_runtime": 201692.7934, "train_tokens_per_second": 29185.835 }, { "epoch": 0.7327617661823015, "grad_norm": 1.4765625, "learning_rate": 2.853232532057104e-05, "loss": 1.0921354293823242, "num_input_tokens_seen": 5889413760, "step": 20710, "train_runtime": 201793.1629, "train_tokens_per_second": 29185.398 }, { "epoch": 0.7331155864460303, "grad_norm": 1.4921875, "learning_rate": 2.8527680858228395e-05, "loss": 1.083078956604004, "num_input_tokens_seen": 5892251136, "step": 20720, "train_runtime": 201890.0336, "train_tokens_per_second": 29185.448 }, { "epoch": 0.733469406709759, "grad_norm": 1.4375, "learning_rate": 2.8523038663209906e-05, "loss": 1.1056851387023925, "num_input_tokens_seen": 5895028096, "step": 20730, "train_runtime": 201982.8335, "train_tokens_per_second": 29185.788 }, { "epoch": 0.7338232269734878, "grad_norm": 1.4609375, "learning_rate": 2.8518398733671427e-05, "loss": 1.0864974975585937, "num_input_tokens_seen": 5897904192, "step": 20740, "train_runtime": 202081.8973, "train_tokens_per_second": 29185.713 }, { "epoch": 0.7341770472372166, "grad_norm": 1.5078125, "learning_rate": 2.8513761067770877e-05, "loss": 1.0926448822021484, "num_input_tokens_seen": 5900780160, "step": 20750, "train_runtime": 202179.4711, "train_tokens_per_second": 29185.852 }, { "epoch": 0.7345308675009453, "grad_norm": 1.453125, "learning_rate": 2.85091256636683e-05, "loss": 1.0929207801818848, "num_input_tokens_seen": 5903594944, "step": 20760, "train_runtime": 202275.0756, "train_tokens_per_second": 29185.973 }, { "epoch": 0.7348846877646742, "grad_norm": 1.4375, "learning_rate": 2.850449251952582e-05, "loss": 1.104050064086914, "num_input_tokens_seen": 5906506368, "step": 20770, "train_runtime": 202375.6254, "train_tokens_per_second": 29185.858 }, { "epoch": 0.735238508028403, "grad_norm": 1.5234375, "learning_rate": 2.849986163350766e-05, "loss": 1.086974811553955, "num_input_tokens_seen": 5909345856, "step": 20780, "train_runtime": 202473.9834, "train_tokens_per_second": 29185.705 }, { "epoch": 0.7355923282921317, "grad_norm": 1.5625, "learning_rate": 2.8495233003780103e-05, "loss": 1.0867299079895019, "num_input_tokens_seen": 5912204480, "step": 20790, "train_runtime": 202570.7248, "train_tokens_per_second": 29185.878 }, { "epoch": 0.7359461485558605, "grad_norm": 1.4765625, "learning_rate": 2.8490606628511557e-05, "loss": 1.0714550971984864, "num_input_tokens_seen": 5915059072, "step": 20800, "train_runtime": 202669.4962, "train_tokens_per_second": 29185.739 }, { "epoch": 0.7362999688195893, "grad_norm": 1.5, "learning_rate": 2.8485982505872476e-05, "loss": 1.0838314056396485, "num_input_tokens_seen": 5917924608, "step": 20810, "train_runtime": 202768.8889, "train_tokens_per_second": 29185.565 }, { "epoch": 0.736653789083318, "grad_norm": 1.4375, "learning_rate": 2.8481360634035415e-05, "loss": 1.0970909118652343, "num_input_tokens_seen": 5920770944, "step": 20820, "train_runtime": 202865.3995, "train_tokens_per_second": 29185.711 }, { "epoch": 0.7370076093470468, "grad_norm": 1.453125, "learning_rate": 2.847674101117499e-05, "loss": 1.087839698791504, "num_input_tokens_seen": 5923643264, "step": 20830, "train_runtime": 202961.5031, "train_tokens_per_second": 29186.044 }, { "epoch": 0.7373614296107756, "grad_norm": 1.4375, "learning_rate": 2.8472123635467896e-05, "loss": 1.0966964721679688, "num_input_tokens_seen": 5926487104, "step": 20840, "train_runtime": 203058.9049, "train_tokens_per_second": 29186.049 }, { "epoch": 0.7377152498745044, "grad_norm": 1.4609375, "learning_rate": 2.846750850509289e-05, "loss": 1.094930362701416, "num_input_tokens_seen": 5929334592, "step": 20850, "train_runtime": 203153.8148, "train_tokens_per_second": 29186.43 }, { "epoch": 0.7380690701382332, "grad_norm": 1.46875, "learning_rate": 2.8462895618230813e-05, "loss": 1.092931079864502, "num_input_tokens_seen": 5932241536, "step": 20860, "train_runtime": 203253.7407, "train_tokens_per_second": 29186.383 }, { "epoch": 0.738422890401962, "grad_norm": 1.453125, "learning_rate": 2.845828497306453e-05, "loss": 1.082656478881836, "num_input_tokens_seen": 5935053632, "step": 20870, "train_runtime": 203350.7096, "train_tokens_per_second": 29186.294 }, { "epoch": 0.7387767106656907, "grad_norm": 1.515625, "learning_rate": 2.8453676567779018e-05, "loss": 1.0924680709838868, "num_input_tokens_seen": 5937934784, "step": 20880, "train_runtime": 203448.0758, "train_tokens_per_second": 29186.488 }, { "epoch": 0.7391305309294195, "grad_norm": 1.5078125, "learning_rate": 2.8449070400561267e-05, "loss": 1.0883349418640136, "num_input_tokens_seen": 5940800320, "step": 20890, "train_runtime": 203547.7452, "train_tokens_per_second": 29186.274 }, { "epoch": 0.7394843511931483, "grad_norm": 1.4453125, "learning_rate": 2.8444466469600343e-05, "loss": 1.089867115020752, "num_input_tokens_seen": 5943635072, "step": 20900, "train_runtime": 203644.7724, "train_tokens_per_second": 29186.288 }, { "epoch": 0.739838171456877, "grad_norm": 1.4921875, "learning_rate": 2.8439864773087354e-05, "loss": 1.0746932983398438, "num_input_tokens_seen": 5946503040, "step": 20910, "train_runtime": 203744.6279, "train_tokens_per_second": 29186.061 }, { "epoch": 0.7401919917206058, "grad_norm": 1.484375, "learning_rate": 2.8435265309215465e-05, "loss": 1.0746275901794433, "num_input_tokens_seen": 5949331712, "step": 20920, "train_runtime": 203841.3424, "train_tokens_per_second": 29186.09 }, { "epoch": 0.7405458119843346, "grad_norm": 1.390625, "learning_rate": 2.843066807617987e-05, "loss": 1.1065662384033204, "num_input_tokens_seen": 5952235008, "step": 20930, "train_runtime": 203941.7084, "train_tokens_per_second": 29185.962 }, { "epoch": 0.7408996322480634, "grad_norm": 1.4453125, "learning_rate": 2.8426073072177827e-05, "loss": 1.102370548248291, "num_input_tokens_seen": 5955103680, "step": 20940, "train_runtime": 204038.711, "train_tokens_per_second": 29186.146 }, { "epoch": 0.7412534525117922, "grad_norm": 1.4609375, "learning_rate": 2.8421480295408616e-05, "loss": 1.0794326782226562, "num_input_tokens_seen": 5957967168, "step": 20950, "train_runtime": 204138.396, "train_tokens_per_second": 29185.921 }, { "epoch": 0.741607272775521, "grad_norm": 1.5390625, "learning_rate": 2.841688974407355e-05, "loss": 1.0891324996948242, "num_input_tokens_seen": 5960793536, "step": 20960, "train_runtime": 204235.9234, "train_tokens_per_second": 29185.823 }, { "epoch": 0.7419610930392497, "grad_norm": 1.4140625, "learning_rate": 2.8412301416375984e-05, "loss": 1.0865235328674316, "num_input_tokens_seen": 5963631616, "step": 20970, "train_runtime": 204332.9588, "train_tokens_per_second": 29185.853 }, { "epoch": 0.7423149133029785, "grad_norm": 1.4765625, "learning_rate": 2.840771531052131e-05, "loss": 1.0937984466552735, "num_input_tokens_seen": 5966481920, "step": 20980, "train_runtime": 204433.6912, "train_tokens_per_second": 29185.414 }, { "epoch": 0.7426687335667073, "grad_norm": 1.4375, "learning_rate": 2.840313142471694e-05, "loss": 1.0782765388488769, "num_input_tokens_seen": 5969371072, "step": 20990, "train_runtime": 204536.4966, "train_tokens_per_second": 29184.87 }, { "epoch": 0.743022553830436, "grad_norm": 1.4609375, "learning_rate": 2.83985497571723e-05, "loss": 1.095046615600586, "num_input_tokens_seen": 5972228032, "step": 21000, "train_runtime": 204632.5437, "train_tokens_per_second": 29185.133 }, { "epoch": 0.7433763740941648, "grad_norm": 1.40625, "learning_rate": 2.8393970306098843e-05, "loss": 1.0785394668579102, "num_input_tokens_seen": 5975085504, "step": 21010, "train_runtime": 204729.9215, "train_tokens_per_second": 29185.209 }, { "epoch": 0.7437301943578937, "grad_norm": 1.46875, "learning_rate": 2.8389393069710053e-05, "loss": 1.1014423370361328, "num_input_tokens_seen": 5977922240, "step": 21020, "train_runtime": 204828.4314, "train_tokens_per_second": 29185.022 }, { "epoch": 0.7440840146216224, "grad_norm": 1.4609375, "learning_rate": 2.8384818046221418e-05, "loss": 1.0986970901489257, "num_input_tokens_seen": 5980802240, "step": 21030, "train_runtime": 204932.0416, "train_tokens_per_second": 29184.32 }, { "epoch": 0.7444378348853512, "grad_norm": 1.4609375, "learning_rate": 2.8380245233850434e-05, "loss": 1.1003684997558594, "num_input_tokens_seen": 5983692864, "step": 21040, "train_runtime": 205031.3093, "train_tokens_per_second": 29184.288 }, { "epoch": 0.74479165514908, "grad_norm": 1.4609375, "learning_rate": 2.837567463081662e-05, "loss": 1.0922761917114259, "num_input_tokens_seen": 5986513920, "step": 21050, "train_runtime": 205128.0219, "train_tokens_per_second": 29184.281 }, { "epoch": 0.7451454754128087, "grad_norm": 1.421875, "learning_rate": 2.8371106235341477e-05, "loss": 1.0713348388671875, "num_input_tokens_seen": 5989338944, "step": 21060, "train_runtime": 205222.2288, "train_tokens_per_second": 29184.65 }, { "epoch": 0.7454992956765375, "grad_norm": 1.5546875, "learning_rate": 2.836654004564855e-05, "loss": 1.0853272438049317, "num_input_tokens_seen": 5992180160, "step": 21070, "train_runtime": 205319.2402, "train_tokens_per_second": 29184.699 }, { "epoch": 0.7458531159402663, "grad_norm": 1.4921875, "learning_rate": 2.8361976059963348e-05, "loss": 1.090385913848877, "num_input_tokens_seen": 5995003712, "step": 21080, "train_runtime": 205413.8481, "train_tokens_per_second": 29185.003 }, { "epoch": 0.746206936203995, "grad_norm": 1.4375, "learning_rate": 2.835741427651339e-05, "loss": 1.093421745300293, "num_input_tokens_seen": 5997859648, "step": 21090, "train_runtime": 205514.2558, "train_tokens_per_second": 29184.64 }, { "epoch": 0.7465607564677239, "grad_norm": 1.390625, "learning_rate": 2.8352854693528197e-05, "loss": 1.0894065856933595, "num_input_tokens_seen": 6000715712, "step": 21100, "train_runtime": 205612.4937, "train_tokens_per_second": 29184.587 }, { "epoch": 0.7469145767314527, "grad_norm": 1.4296875, "learning_rate": 2.8348297309239274e-05, "loss": 1.0839420318603517, "num_input_tokens_seen": 6003573504, "step": 21110, "train_runtime": 205708.5214, "train_tokens_per_second": 29184.856 }, { "epoch": 0.7472683969951814, "grad_norm": 1.46875, "learning_rate": 2.834374212188012e-05, "loss": 1.081197166442871, "num_input_tokens_seen": 6006483328, "step": 21120, "train_runtime": 205808.8246, "train_tokens_per_second": 29184.771 }, { "epoch": 0.7476222172589102, "grad_norm": 1.421875, "learning_rate": 2.833918912968621e-05, "loss": 1.0791766166687011, "num_input_tokens_seen": 6009366272, "step": 21130, "train_runtime": 205908.9856, "train_tokens_per_second": 29184.575 }, { "epoch": 0.747976037522639, "grad_norm": 1.5078125, "learning_rate": 2.833463833089502e-05, "loss": 1.0813014030456543, "num_input_tokens_seen": 6012217152, "step": 21140, "train_runtime": 206007.2449, "train_tokens_per_second": 29184.494 }, { "epoch": 0.7483298577863677, "grad_norm": 1.5078125, "learning_rate": 2.8330089723745985e-05, "loss": 1.0820041656494142, "num_input_tokens_seen": 6015078784, "step": 21150, "train_runtime": 206107.3156, "train_tokens_per_second": 29184.208 }, { "epoch": 0.7486836780500965, "grad_norm": 1.421875, "learning_rate": 2.8325543306480538e-05, "loss": 1.0813280105590821, "num_input_tokens_seen": 6017903040, "step": 21160, "train_runtime": 206204.9631, "train_tokens_per_second": 29184.084 }, { "epoch": 0.7490374983138253, "grad_norm": 1.4140625, "learning_rate": 2.832099907734208e-05, "loss": 1.0904282569885253, "num_input_tokens_seen": 6020737728, "step": 21170, "train_runtime": 206299.6566, "train_tokens_per_second": 29184.429 }, { "epoch": 0.749391318577554, "grad_norm": 1.46875, "learning_rate": 2.831645703457598e-05, "loss": 1.0923046112060546, "num_input_tokens_seen": 6023592192, "step": 21180, "train_runtime": 206398.8206, "train_tokens_per_second": 29184.237 }, { "epoch": 0.7497451388412829, "grad_norm": 1.390625, "learning_rate": 2.8311917176429582e-05, "loss": 1.0897808074951172, "num_input_tokens_seen": 6026465792, "step": 21190, "train_runtime": 206496.9128, "train_tokens_per_second": 29184.29 }, { "epoch": 0.7500989591050117, "grad_norm": 1.4765625, "learning_rate": 2.830737950115218e-05, "loss": 1.0916244506835937, "num_input_tokens_seen": 6029296384, "step": 21200, "train_runtime": 206590.9171, "train_tokens_per_second": 29184.712 }, { "epoch": 0.7504527793687404, "grad_norm": 1.4765625, "learning_rate": 2.8302844006995062e-05, "loss": 1.0757956504821777, "num_input_tokens_seen": 6032204928, "step": 21210, "train_runtime": 206692.8857, "train_tokens_per_second": 29184.386 }, { "epoch": 0.7508065996324692, "grad_norm": 1.46875, "learning_rate": 2.829831069221145e-05, "loss": 1.0937291145324708, "num_input_tokens_seen": 6035024960, "step": 21220, "train_runtime": 206786.3884, "train_tokens_per_second": 29184.827 }, { "epoch": 0.751160419896198, "grad_norm": 1.515625, "learning_rate": 2.8293779555056532e-05, "loss": 1.0911020278930663, "num_input_tokens_seen": 6037872512, "step": 21230, "train_runtime": 206887.2391, "train_tokens_per_second": 29184.364 }, { "epoch": 0.7515142401599267, "grad_norm": 1.5, "learning_rate": 2.8289250593787454e-05, "loss": 1.090523910522461, "num_input_tokens_seen": 6040666880, "step": 21240, "train_runtime": 206979.7239, "train_tokens_per_second": 29184.824 }, { "epoch": 0.7518680604236555, "grad_norm": 1.453125, "learning_rate": 2.8284723806663316e-05, "loss": 1.0765873908996582, "num_input_tokens_seen": 6043495232, "step": 21250, "train_runtime": 207077.159, "train_tokens_per_second": 29184.751 }, { "epoch": 0.7522218806873843, "grad_norm": 1.5078125, "learning_rate": 2.828019919194515e-05, "loss": 1.08115234375, "num_input_tokens_seen": 6046314368, "step": 21260, "train_runtime": 207175.0045, "train_tokens_per_second": 29184.575 }, { "epoch": 0.7525757009511131, "grad_norm": 1.4140625, "learning_rate": 2.827567674789597e-05, "loss": 1.0994600296020507, "num_input_tokens_seen": 6049228096, "step": 21270, "train_runtime": 207273.7765, "train_tokens_per_second": 29184.725 }, { "epoch": 0.7529295212148419, "grad_norm": 1.5, "learning_rate": 2.8271156472780697e-05, "loss": 1.0828849792480468, "num_input_tokens_seen": 6052079168, "step": 21280, "train_runtime": 207374.6388, "train_tokens_per_second": 29184.278 }, { "epoch": 0.7532833414785707, "grad_norm": 1.46875, "learning_rate": 2.826663836486621e-05, "loss": 1.0879409790039063, "num_input_tokens_seen": 6054953216, "step": 21290, "train_runtime": 207473.6822, "train_tokens_per_second": 29184.199 }, { "epoch": 0.7536371617422994, "grad_norm": 1.4609375, "learning_rate": 2.8262122422421326e-05, "loss": 1.093393898010254, "num_input_tokens_seen": 6057801984, "step": 21300, "train_runtime": 207569.5803, "train_tokens_per_second": 29184.44 }, { "epoch": 0.7539909820060282, "grad_norm": 1.3828125, "learning_rate": 2.8257608643716797e-05, "loss": 1.06944580078125, "num_input_tokens_seen": 6060640320, "step": 21310, "train_runtime": 207667.5081, "train_tokens_per_second": 29184.346 }, { "epoch": 0.754344802269757, "grad_norm": 1.4765625, "learning_rate": 2.8253097027025312e-05, "loss": 1.0926382064819335, "num_input_tokens_seen": 6063462656, "step": 21320, "train_runtime": 207762.4624, "train_tokens_per_second": 29184.592 }, { "epoch": 0.7546986225334857, "grad_norm": 1.4921875, "learning_rate": 2.8248587570621472e-05, "loss": 1.0897224426269532, "num_input_tokens_seen": 6066305152, "step": 21330, "train_runtime": 207859.2088, "train_tokens_per_second": 29184.683 }, { "epoch": 0.7550524427972145, "grad_norm": 1.546875, "learning_rate": 2.824408027278182e-05, "loss": 1.0880735397338868, "num_input_tokens_seen": 6069158208, "step": 21340, "train_runtime": 207955.7887, "train_tokens_per_second": 29184.849 }, { "epoch": 0.7554062630609434, "grad_norm": 1.5234375, "learning_rate": 2.823957513178483e-05, "loss": 1.0897762298583984, "num_input_tokens_seen": 6071980864, "step": 21350, "train_runtime": 208049.9718, "train_tokens_per_second": 29185.204 }, { "epoch": 0.7557600833246721, "grad_norm": 1.40625, "learning_rate": 2.8235072145910878e-05, "loss": 1.0912284851074219, "num_input_tokens_seen": 6074852992, "step": 21360, "train_runtime": 208150.3177, "train_tokens_per_second": 29184.933 }, { "epoch": 0.7561139035884009, "grad_norm": 1.5234375, "learning_rate": 2.8230571313442273e-05, "loss": 1.0704248428344727, "num_input_tokens_seen": 6077675520, "step": 21370, "train_runtime": 208246.0597, "train_tokens_per_second": 29185.069 }, { "epoch": 0.7564677238521297, "grad_norm": 1.46875, "learning_rate": 2.822607263266324e-05, "loss": 1.083498191833496, "num_input_tokens_seen": 6080512448, "step": 21380, "train_runtime": 208340.9109, "train_tokens_per_second": 29185.398 }, { "epoch": 0.7568215441158584, "grad_norm": 1.4296875, "learning_rate": 2.822157610185991e-05, "loss": 1.0689991950988769, "num_input_tokens_seen": 6083380992, "step": 21390, "train_runtime": 208436.9376, "train_tokens_per_second": 29185.715 }, { "epoch": 0.7571753643795872, "grad_norm": 1.484375, "learning_rate": 2.821708171932032e-05, "loss": 1.090031623840332, "num_input_tokens_seen": 6086255040, "step": 21400, "train_runtime": 208536.4264, "train_tokens_per_second": 29185.573 }, { "epoch": 0.757529184643316, "grad_norm": 1.421875, "learning_rate": 2.821258948333444e-05, "loss": 1.0873319625854492, "num_input_tokens_seen": 6089119296, "step": 21410, "train_runtime": 208635.2545, "train_tokens_per_second": 29185.476 }, { "epoch": 0.7578830049070447, "grad_norm": 1.4375, "learning_rate": 2.8208099392194116e-05, "loss": 1.0775225639343262, "num_input_tokens_seen": 6091926080, "step": 21420, "train_runtime": 208730.6425, "train_tokens_per_second": 29185.586 }, { "epoch": 0.7582368251707735, "grad_norm": 1.4765625, "learning_rate": 2.8203611444193113e-05, "loss": 1.0895069122314454, "num_input_tokens_seen": 6094779584, "step": 21430, "train_runtime": 208826.5034, "train_tokens_per_second": 29185.853 }, { "epoch": 0.7585906454345024, "grad_norm": 1.4296875, "learning_rate": 2.8199125637627084e-05, "loss": 1.0830517768859864, "num_input_tokens_seen": 6097571456, "step": 21440, "train_runtime": 208920.5238, "train_tokens_per_second": 29186.082 }, { "epoch": 0.7589444656982312, "grad_norm": 1.546875, "learning_rate": 2.8194641970793593e-05, "loss": 1.0836994171142578, "num_input_tokens_seen": 6100396672, "step": 21450, "train_runtime": 209015.4517, "train_tokens_per_second": 29186.343 }, { "epoch": 0.7592982859619599, "grad_norm": 1.5390625, "learning_rate": 2.8190160441992092e-05, "loss": 1.106247329711914, "num_input_tokens_seen": 6103225152, "step": 21460, "train_runtime": 209113.6944, "train_tokens_per_second": 29186.157 }, { "epoch": 0.7596521062256887, "grad_norm": 1.46875, "learning_rate": 2.818568104952392e-05, "loss": 1.0901400566101074, "num_input_tokens_seen": 6106011520, "step": 21470, "train_runtime": 209205.4401, "train_tokens_per_second": 29186.677 }, { "epoch": 0.7600059264894174, "grad_norm": 1.5390625, "learning_rate": 2.8181203791692306e-05, "loss": 1.080908966064453, "num_input_tokens_seen": 6108848960, "step": 21480, "train_runtime": 209300.4021, "train_tokens_per_second": 29186.991 }, { "epoch": 0.7603597467531462, "grad_norm": 1.53125, "learning_rate": 2.8176728666802375e-05, "loss": 1.082099723815918, "num_input_tokens_seen": 6111702336, "step": 21490, "train_runtime": 209399.0236, "train_tokens_per_second": 29186.871 }, { "epoch": 0.760713567016875, "grad_norm": 1.4375, "learning_rate": 2.8172255673161124e-05, "loss": 1.083989429473877, "num_input_tokens_seen": 6114556160, "step": 21500, "train_runtime": 209496.3187, "train_tokens_per_second": 29186.938 }, { "epoch": 0.7610673872806037, "grad_norm": 1.5078125, "learning_rate": 2.8167784809077436e-05, "loss": 1.0908090591430664, "num_input_tokens_seen": 6117416192, "step": 21510, "train_runtime": 209592.5871, "train_tokens_per_second": 29187.178 }, { "epoch": 0.7614212075443326, "grad_norm": 1.390625, "learning_rate": 2.816331607286207e-05, "loss": 1.0711624145507812, "num_input_tokens_seen": 6120260224, "step": 21520, "train_runtime": 209690.4009, "train_tokens_per_second": 29187.126 }, { "epoch": 0.7617750278080614, "grad_norm": 1.4765625, "learning_rate": 2.815884946282766e-05, "loss": 1.091764545440674, "num_input_tokens_seen": 6123067136, "step": 21530, "train_runtime": 209786.4549, "train_tokens_per_second": 29187.142 }, { "epoch": 0.7621288480717902, "grad_norm": 1.484375, "learning_rate": 2.815438497728871e-05, "loss": 1.085133171081543, "num_input_tokens_seen": 6125931520, "step": 21540, "train_runtime": 209887.4066, "train_tokens_per_second": 29186.751 }, { "epoch": 0.7624826683355189, "grad_norm": 1.5078125, "learning_rate": 2.8149922614561607e-05, "loss": 1.0899795532226562, "num_input_tokens_seen": 6128745536, "step": 21550, "train_runtime": 209985.8777, "train_tokens_per_second": 29186.465 }, { "epoch": 0.7628364885992477, "grad_norm": 1.4921875, "learning_rate": 2.8145462372964588e-05, "loss": 1.0814544677734375, "num_input_tokens_seen": 6131573312, "step": 21560, "train_runtime": 210083.2531, "train_tokens_per_second": 29186.397 }, { "epoch": 0.7631903088629765, "grad_norm": 1.5078125, "learning_rate": 2.814100425081777e-05, "loss": 1.0850869178771974, "num_input_tokens_seen": 6134375040, "step": 21570, "train_runtime": 210178.8549, "train_tokens_per_second": 29186.452 }, { "epoch": 0.7635441291267052, "grad_norm": 1.421875, "learning_rate": 2.8136548246443117e-05, "loss": 1.0924762725830077, "num_input_tokens_seen": 6137264960, "step": 21580, "train_runtime": 210280.1616, "train_tokens_per_second": 29186.134 }, { "epoch": 0.763897949390434, "grad_norm": 1.4453125, "learning_rate": 2.8132094358164468e-05, "loss": 1.0981695175170898, "num_input_tokens_seen": 6140138816, "step": 21590, "train_runtime": 210377.8484, "train_tokens_per_second": 29186.242 }, { "epoch": 0.7642517696541629, "grad_norm": 1.453125, "learning_rate": 2.8127642584307508e-05, "loss": 1.0990865707397461, "num_input_tokens_seen": 6142984064, "step": 21600, "train_runtime": 210476.3098, "train_tokens_per_second": 29186.107 }, { "epoch": 0.7646055899178916, "grad_norm": 1.5, "learning_rate": 2.8123192923199776e-05, "loss": 1.0925244331359862, "num_input_tokens_seen": 6145847488, "step": 21610, "train_runtime": 210573.3467, "train_tokens_per_second": 29186.255 }, { "epoch": 0.7649594101816204, "grad_norm": 1.5234375, "learning_rate": 2.8118745373170667e-05, "loss": 1.0959525108337402, "num_input_tokens_seen": 6148713792, "step": 21620, "train_runtime": 210672.2077, "train_tokens_per_second": 29186.165 }, { "epoch": 0.7653132304453492, "grad_norm": 1.46875, "learning_rate": 2.8114299932551423e-05, "loss": 1.0885591506958008, "num_input_tokens_seen": 6151501696, "step": 21630, "train_runtime": 210765.0913, "train_tokens_per_second": 29186.53 }, { "epoch": 0.7656670507090779, "grad_norm": 1.5078125, "learning_rate": 2.8109856599675145e-05, "loss": 1.0907438278198243, "num_input_tokens_seen": 6154360064, "step": 21640, "train_runtime": 210864.698, "train_tokens_per_second": 29186.299 }, { "epoch": 0.7660208709728067, "grad_norm": 1.5234375, "learning_rate": 2.8105415372876742e-05, "loss": 1.0830144882202148, "num_input_tokens_seen": 6157238080, "step": 21650, "train_runtime": 210964.4834, "train_tokens_per_second": 29186.136 }, { "epoch": 0.7663746912365355, "grad_norm": 1.5625, "learning_rate": 2.8100976250493e-05, "loss": 1.0706307411193847, "num_input_tokens_seen": 6160097728, "step": 21660, "train_runtime": 211065.0002, "train_tokens_per_second": 29185.785 }, { "epoch": 0.7667285115002642, "grad_norm": 1.4140625, "learning_rate": 2.8096539230862527e-05, "loss": 1.1098913192749023, "num_input_tokens_seen": 6162970048, "step": 21670, "train_runtime": 211164.9839, "train_tokens_per_second": 29185.568 }, { "epoch": 0.767082331763993, "grad_norm": 1.453125, "learning_rate": 2.809210431232578e-05, "loss": 1.0804973602294923, "num_input_tokens_seen": 6165827072, "step": 21680, "train_runtime": 211263.4865, "train_tokens_per_second": 29185.484 }, { "epoch": 0.7674361520277219, "grad_norm": 1.515625, "learning_rate": 2.8087671493225025e-05, "loss": 1.0761798858642577, "num_input_tokens_seen": 6168667520, "step": 21690, "train_runtime": 211359.9955, "train_tokens_per_second": 29185.596 }, { "epoch": 0.7677899722914506, "grad_norm": 1.4296875, "learning_rate": 2.808324077190438e-05, "loss": 1.088958168029785, "num_input_tokens_seen": 6171544384, "step": 21700, "train_runtime": 211460.2329, "train_tokens_per_second": 29185.366 }, { "epoch": 0.7681437925551794, "grad_norm": 1.4921875, "learning_rate": 2.807881214670978e-05, "loss": 1.0673308372497559, "num_input_tokens_seen": 6174348288, "step": 21710, "train_runtime": 211554.6896, "train_tokens_per_second": 29185.589 }, { "epoch": 0.7684976128189082, "grad_norm": 1.453125, "learning_rate": 2.8074385615988996e-05, "loss": 1.089615249633789, "num_input_tokens_seen": 6177181760, "step": 21720, "train_runtime": 211651.3135, "train_tokens_per_second": 29185.653 }, { "epoch": 0.7688514330826369, "grad_norm": 1.515625, "learning_rate": 2.8069961178091602e-05, "loss": 1.0905158996582032, "num_input_tokens_seen": 6180022592, "step": 21730, "train_runtime": 211748.0846, "train_tokens_per_second": 29185.731 }, { "epoch": 0.7692052533463657, "grad_norm": 1.5078125, "learning_rate": 2.806553883136901e-05, "loss": 1.0859285354614259, "num_input_tokens_seen": 6182888576, "step": 21740, "train_runtime": 211847.3082, "train_tokens_per_second": 29185.59 }, { "epoch": 0.7695590736100945, "grad_norm": 1.453125, "learning_rate": 2.806111857417445e-05, "loss": 1.0836685180664063, "num_input_tokens_seen": 6185731200, "step": 21750, "train_runtime": 211944.7372, "train_tokens_per_second": 29185.585 }, { "epoch": 0.7699128938738232, "grad_norm": 1.4765625, "learning_rate": 2.8056700404862957e-05, "loss": 1.0907863616943358, "num_input_tokens_seen": 6188538752, "step": 21760, "train_runtime": 212039.7668, "train_tokens_per_second": 29185.746 }, { "epoch": 0.7702667141375521, "grad_norm": 1.484375, "learning_rate": 2.8052284321791383e-05, "loss": 1.0798266410827637, "num_input_tokens_seen": 6191344448, "step": 21770, "train_runtime": 212134.0477, "train_tokens_per_second": 29186.001 }, { "epoch": 0.7706205344012809, "grad_norm": 1.484375, "learning_rate": 2.8047870323318382e-05, "loss": 1.0769691467285156, "num_input_tokens_seen": 6194210752, "step": 21780, "train_runtime": 212233.3352, "train_tokens_per_second": 29185.852 }, { "epoch": 0.7709743546650096, "grad_norm": 1.46875, "learning_rate": 2.8043458407804428e-05, "loss": 1.0874345779418946, "num_input_tokens_seen": 6197046656, "step": 21790, "train_runtime": 212330.7806, "train_tokens_per_second": 29185.814 }, { "epoch": 0.7713281749287384, "grad_norm": 1.5390625, "learning_rate": 2.8039048573611805e-05, "loss": 1.0784727096557618, "num_input_tokens_seen": 6199852800, "step": 21800, "train_runtime": 212426.4179, "train_tokens_per_second": 29185.884 }, { "epoch": 0.7716819951924672, "grad_norm": 1.4765625, "learning_rate": 2.8034640819104574e-05, "loss": 1.0917928695678711, "num_input_tokens_seen": 6202663808, "step": 21810, "train_runtime": 212521.0331, "train_tokens_per_second": 29186.117 }, { "epoch": 0.7720358154561959, "grad_norm": 1.5546875, "learning_rate": 2.803023514264861e-05, "loss": 1.0851006507873535, "num_input_tokens_seen": 6205479296, "step": 21820, "train_runtime": 212619.0134, "train_tokens_per_second": 29185.91 }, { "epoch": 0.7723896357199247, "grad_norm": 1.515625, "learning_rate": 2.8025831542611596e-05, "loss": 1.0765792846679687, "num_input_tokens_seen": 6208357056, "step": 21830, "train_runtime": 212717.6969, "train_tokens_per_second": 29185.898 }, { "epoch": 0.7727434559836535, "grad_norm": 1.5234375, "learning_rate": 2.8021430017362994e-05, "loss": 1.0935245513916017, "num_input_tokens_seen": 6211215936, "step": 21840, "train_runtime": 212814.3643, "train_tokens_per_second": 29186.075 }, { "epoch": 0.7730972762473823, "grad_norm": 1.5390625, "learning_rate": 2.801703056527406e-05, "loss": 1.092359733581543, "num_input_tokens_seen": 6214038720, "step": 21850, "train_runtime": 212909.657, "train_tokens_per_second": 29186.27 }, { "epoch": 0.7734510965111111, "grad_norm": 1.5625, "learning_rate": 2.801263318471784e-05, "loss": 1.0896340370178224, "num_input_tokens_seen": 6216856064, "step": 21860, "train_runtime": 213002.9695, "train_tokens_per_second": 29186.711 }, { "epoch": 0.7738049167748399, "grad_norm": 1.5234375, "learning_rate": 2.800823787406917e-05, "loss": 1.0854398727416992, "num_input_tokens_seen": 6219774528, "step": 21870, "train_runtime": 213105.0584, "train_tokens_per_second": 29186.424 }, { "epoch": 0.7741587370385686, "grad_norm": 1.5234375, "learning_rate": 2.8003844631704678e-05, "loss": 1.0930980682373046, "num_input_tokens_seen": 6222680512, "step": 21880, "train_runtime": 213206.1058, "train_tokens_per_second": 29186.221 }, { "epoch": 0.7745125573022974, "grad_norm": 1.5, "learning_rate": 2.7999453456002755e-05, "loss": 1.1009612083435059, "num_input_tokens_seen": 6225528896, "step": 21890, "train_runtime": 213304.4556, "train_tokens_per_second": 29186.117 }, { "epoch": 0.7748663775660262, "grad_norm": 1.4140625, "learning_rate": 2.799506434534359e-05, "loss": 1.0871479034423828, "num_input_tokens_seen": 6228382528, "step": 21900, "train_runtime": 213403.6381, "train_tokens_per_second": 29185.925 }, { "epoch": 0.7752201978297549, "grad_norm": 1.5, "learning_rate": 2.7990677298109136e-05, "loss": 1.088340950012207, "num_input_tokens_seen": 6231212864, "step": 21910, "train_runtime": 213500.2966, "train_tokens_per_second": 29185.968 }, { "epoch": 0.7755740180934837, "grad_norm": 1.5546875, "learning_rate": 2.7986292312683125e-05, "loss": 1.0889883041381836, "num_input_tokens_seen": 6233996096, "step": 21920, "train_runtime": 213592.3052, "train_tokens_per_second": 29186.426 }, { "epoch": 0.7759278383572125, "grad_norm": 1.453125, "learning_rate": 2.798190938745106e-05, "loss": 1.0929086685180665, "num_input_tokens_seen": 6236845568, "step": 21930, "train_runtime": 213687.8018, "train_tokens_per_second": 29186.718 }, { "epoch": 0.7762816586209413, "grad_norm": 1.453125, "learning_rate": 2.7977528520800218e-05, "loss": 1.0870466232299805, "num_input_tokens_seen": 6239686912, "step": 21940, "train_runtime": 213782.4399, "train_tokens_per_second": 29187.088 }, { "epoch": 0.7766354788846701, "grad_norm": 1.4375, "learning_rate": 2.7973149711119635e-05, "loss": 1.0926259994506835, "num_input_tokens_seen": 6242501824, "step": 21950, "train_runtime": 213877.7648, "train_tokens_per_second": 29187.241 }, { "epoch": 0.7769892991483989, "grad_norm": 1.515625, "learning_rate": 2.7968772956800115e-05, "loss": 1.0902044296264648, "num_input_tokens_seen": 6245323904, "step": 21960, "train_runtime": 213973.7852, "train_tokens_per_second": 29187.332 }, { "epoch": 0.7773431194121276, "grad_norm": 1.53125, "learning_rate": 2.796439825623423e-05, "loss": 1.0715646743774414, "num_input_tokens_seen": 6248202496, "step": 21970, "train_runtime": 214076.1497, "train_tokens_per_second": 29186.822 }, { "epoch": 0.7776969396758564, "grad_norm": 1.421875, "learning_rate": 2.79600256078163e-05, "loss": 1.0818517684936524, "num_input_tokens_seen": 6251015872, "step": 21980, "train_runtime": 214173.7298, "train_tokens_per_second": 29186.66 }, { "epoch": 0.7780507599395852, "grad_norm": 1.4453125, "learning_rate": 2.7955655009942416e-05, "loss": 1.0870773315429687, "num_input_tokens_seen": 6253897536, "step": 21990, "train_runtime": 214273.0143, "train_tokens_per_second": 29186.585 }, { "epoch": 0.7784045802033139, "grad_norm": 1.5, "learning_rate": 2.79512864610104e-05, "loss": 1.0889597892761231, "num_input_tokens_seen": 6256718016, "step": 22000, "train_runtime": 214369.8021, "train_tokens_per_second": 29186.564 }, { "epoch": 0.7787584004670427, "grad_norm": 1.4765625, "learning_rate": 2.794691995941986e-05, "loss": 1.0722615242004394, "num_input_tokens_seen": 6259563648, "step": 22010, "train_runtime": 214467.1256, "train_tokens_per_second": 29186.588 }, { "epoch": 0.7791122207307716, "grad_norm": 1.5234375, "learning_rate": 2.7942555503572115e-05, "loss": 1.089272403717041, "num_input_tokens_seen": 6262393408, "step": 22020, "train_runtime": 214564.61, "train_tokens_per_second": 29186.516 }, { "epoch": 0.7794660409945003, "grad_norm": 1.4609375, "learning_rate": 2.7938193091870268e-05, "loss": 1.0903002738952636, "num_input_tokens_seen": 6265231040, "step": 22030, "train_runtime": 214661.4457, "train_tokens_per_second": 29186.569 }, { "epoch": 0.7798198612582291, "grad_norm": 1.5078125, "learning_rate": 2.793383272271914e-05, "loss": 1.0818592071533204, "num_input_tokens_seen": 6268078272, "step": 22040, "train_runtime": 214758.0991, "train_tokens_per_second": 29186.691 }, { "epoch": 0.7801736815219579, "grad_norm": 1.4921875, "learning_rate": 2.7929474394525307e-05, "loss": 1.088098907470703, "num_input_tokens_seen": 6270969152, "step": 22050, "train_runtime": 214858.8045, "train_tokens_per_second": 29186.466 }, { "epoch": 0.7805275017856866, "grad_norm": 1.46875, "learning_rate": 2.7925118105697078e-05, "loss": 1.0991410255432128, "num_input_tokens_seen": 6273804032, "step": 22060, "train_runtime": 214955.2365, "train_tokens_per_second": 29186.561 }, { "epoch": 0.7808813220494154, "grad_norm": 1.5078125, "learning_rate": 2.792076385464451e-05, "loss": 1.094899559020996, "num_input_tokens_seen": 6276699200, "step": 22070, "train_runtime": 215055.5087, "train_tokens_per_second": 29186.414 }, { "epoch": 0.7812351423131442, "grad_norm": 1.46875, "learning_rate": 2.7916411639779383e-05, "loss": 1.0877613067626952, "num_input_tokens_seen": 6279558528, "step": 22080, "train_runtime": 215156.2774, "train_tokens_per_second": 29186.034 }, { "epoch": 0.7815889625768729, "grad_norm": 1.4296875, "learning_rate": 2.7912061459515215e-05, "loss": 1.0898740768432618, "num_input_tokens_seen": 6282408320, "step": 22090, "train_runtime": 215256.6063, "train_tokens_per_second": 29185.67 }, { "epoch": 0.7819427828406018, "grad_norm": 1.5, "learning_rate": 2.7907713312267247e-05, "loss": 1.0837122917175293, "num_input_tokens_seen": 6285253888, "step": 22100, "train_runtime": 215353.7608, "train_tokens_per_second": 29185.717 }, { "epoch": 0.7822966031043306, "grad_norm": 1.4765625, "learning_rate": 2.7903367196452457e-05, "loss": 1.1006884574890137, "num_input_tokens_seen": 6288175424, "step": 22110, "train_runtime": 215453.8621, "train_tokens_per_second": 29185.717 }, { "epoch": 0.7826504233680593, "grad_norm": 1.46875, "learning_rate": 2.7899023110489554e-05, "loss": 1.0890989303588867, "num_input_tokens_seen": 6291064832, "step": 22120, "train_runtime": 215552.3823, "train_tokens_per_second": 29185.782 }, { "epoch": 0.7830042436317881, "grad_norm": 1.421875, "learning_rate": 2.789468105279895e-05, "loss": 1.0702329635620118, "num_input_tokens_seen": 6293907776, "step": 22130, "train_runtime": 215649.1166, "train_tokens_per_second": 29185.873 }, { "epoch": 0.7833580638955169, "grad_norm": 1.4609375, "learning_rate": 2.7890341021802786e-05, "loss": 1.089697265625, "num_input_tokens_seen": 6296731904, "step": 22140, "train_runtime": 215745.7221, "train_tokens_per_second": 29185.895 }, { "epoch": 0.7837118841592456, "grad_norm": 1.484375, "learning_rate": 2.7886003015924933e-05, "loss": 1.0803797721862793, "num_input_tokens_seen": 6299597952, "step": 22150, "train_runtime": 215843.66, "train_tokens_per_second": 29185.93 }, { "epoch": 0.7840657044229744, "grad_norm": 1.4453125, "learning_rate": 2.788166703359096e-05, "loss": 1.0752176284790038, "num_input_tokens_seen": 6302420160, "step": 22160, "train_runtime": 215937.9367, "train_tokens_per_second": 29186.257 }, { "epoch": 0.7844195246867032, "grad_norm": 1.3984375, "learning_rate": 2.787733307322816e-05, "loss": 1.1016907691955566, "num_input_tokens_seen": 6305252352, "step": 22170, "train_runtime": 216033.4285, "train_tokens_per_second": 29186.466 }, { "epoch": 0.7847733449504319, "grad_norm": 1.46875, "learning_rate": 2.7873001133265518e-05, "loss": 1.0844686508178711, "num_input_tokens_seen": 6308094464, "step": 22180, "train_runtime": 216130.7985, "train_tokens_per_second": 29186.467 }, { "epoch": 0.7851271652141608, "grad_norm": 1.4375, "learning_rate": 2.7868671212133768e-05, "loss": 1.0852106094360352, "num_input_tokens_seen": 6311009408, "step": 22190, "train_runtime": 216233.3525, "train_tokens_per_second": 29186.105 }, { "epoch": 0.7854809854778896, "grad_norm": 1.390625, "learning_rate": 2.7864343308265313e-05, "loss": 1.0717653274536132, "num_input_tokens_seen": 6313870208, "step": 22200, "train_runtime": 216330.0587, "train_tokens_per_second": 29186.283 }, { "epoch": 0.7858348057416183, "grad_norm": 1.375, "learning_rate": 2.7860017420094258e-05, "loss": 1.0739994049072266, "num_input_tokens_seen": 6316758400, "step": 22210, "train_runtime": 216429.0445, "train_tokens_per_second": 29186.279 }, { "epoch": 0.7861886260053471, "grad_norm": 1.484375, "learning_rate": 2.7855693546056445e-05, "loss": 1.0957128524780273, "num_input_tokens_seen": 6319635136, "step": 22220, "train_runtime": 216528.6347, "train_tokens_per_second": 29186.14 }, { "epoch": 0.7865424462690759, "grad_norm": 1.421875, "learning_rate": 2.785137168458937e-05, "loss": 1.0915746688842773, "num_input_tokens_seen": 6322477056, "step": 22230, "train_runtime": 216623.0773, "train_tokens_per_second": 29186.535 }, { "epoch": 0.7868962665328046, "grad_norm": 1.46875, "learning_rate": 2.7847051834132265e-05, "loss": 1.0820093154907227, "num_input_tokens_seen": 6325317824, "step": 22240, "train_runtime": 216720.5364, "train_tokens_per_second": 29186.518 }, { "epoch": 0.7872500867965334, "grad_norm": 1.4921875, "learning_rate": 2.784273399312603e-05, "loss": 1.0895115852355957, "num_input_tokens_seen": 6328111424, "step": 22250, "train_runtime": 216813.8603, "train_tokens_per_second": 29186.84 }, { "epoch": 0.7876039070602622, "grad_norm": 1.4765625, "learning_rate": 2.783841816001326e-05, "loss": 1.0801700592041015, "num_input_tokens_seen": 6330975616, "step": 22260, "train_runtime": 216913.1992, "train_tokens_per_second": 29186.678 }, { "epoch": 0.787957727323991, "grad_norm": 1.5, "learning_rate": 2.7834104333238255e-05, "loss": 1.0837890625, "num_input_tokens_seen": 6333824768, "step": 22270, "train_runtime": 217009.3876, "train_tokens_per_second": 29186.87 }, { "epoch": 0.7883115475877198, "grad_norm": 1.421875, "learning_rate": 2.7829792511246987e-05, "loss": 1.087213897705078, "num_input_tokens_seen": 6336694208, "step": 22280, "train_runtime": 217109.4294, "train_tokens_per_second": 29186.637 }, { "epoch": 0.7886653678514486, "grad_norm": 1.484375, "learning_rate": 2.7825482692487114e-05, "loss": 1.0931692123413086, "num_input_tokens_seen": 6339521664, "step": 22290, "train_runtime": 217205.5884, "train_tokens_per_second": 29186.734 }, { "epoch": 0.7890191881151774, "grad_norm": 1.5, "learning_rate": 2.7821174875407985e-05, "loss": 1.0911617279052734, "num_input_tokens_seen": 6342405632, "step": 22300, "train_runtime": 217307.167, "train_tokens_per_second": 29186.362 }, { "epoch": 0.7893730083789061, "grad_norm": 1.515625, "learning_rate": 2.781686905846062e-05, "loss": 1.0833774566650392, "num_input_tokens_seen": 6345213056, "step": 22310, "train_runtime": 217402.6911, "train_tokens_per_second": 29186.451 }, { "epoch": 0.7897268286426349, "grad_norm": 1.5078125, "learning_rate": 2.7812565240097716e-05, "loss": 1.0764126777648926, "num_input_tokens_seen": 6348006400, "step": 22320, "train_runtime": 217497.343, "train_tokens_per_second": 29186.593 }, { "epoch": 0.7900806489063636, "grad_norm": 1.3828125, "learning_rate": 2.7808263418773656e-05, "loss": 1.092008113861084, "num_input_tokens_seen": 6350875264, "step": 22330, "train_runtime": 217594.684, "train_tokens_per_second": 29186.721 }, { "epoch": 0.7904344691700924, "grad_norm": 1.4921875, "learning_rate": 2.7803963592944482e-05, "loss": 1.0686561584472656, "num_input_tokens_seen": 6353698624, "step": 22340, "train_runtime": 217690.405, "train_tokens_per_second": 29186.857 }, { "epoch": 0.7907882894338213, "grad_norm": 1.5, "learning_rate": 2.779966576106792e-05, "loss": 1.0854507446289063, "num_input_tokens_seen": 6356481472, "step": 22350, "train_runtime": 217783.5379, "train_tokens_per_second": 29187.153 }, { "epoch": 0.7911421096975501, "grad_norm": 1.453125, "learning_rate": 2.779536992160336e-05, "loss": 1.0927342414855956, "num_input_tokens_seen": 6359324096, "step": 22360, "train_runtime": 217881.4989, "train_tokens_per_second": 29187.077 }, { "epoch": 0.7914959299612788, "grad_norm": 1.5078125, "learning_rate": 2.7791076073011845e-05, "loss": 1.08468017578125, "num_input_tokens_seen": 6362175808, "step": 22370, "train_runtime": 217980.0217, "train_tokens_per_second": 29186.967 }, { "epoch": 0.7918497502250076, "grad_norm": 1.4609375, "learning_rate": 2.7786784213756102e-05, "loss": 1.0837465286254884, "num_input_tokens_seen": 6365002496, "step": 22380, "train_runtime": 218076.8825, "train_tokens_per_second": 29186.966 }, { "epoch": 0.7922035704887364, "grad_norm": 1.5390625, "learning_rate": 2.7782494342300502e-05, "loss": 1.092539405822754, "num_input_tokens_seen": 6367800384, "step": 22390, "train_runtime": 218167.685, "train_tokens_per_second": 29187.642 }, { "epoch": 0.7925573907524651, "grad_norm": 1.4765625, "learning_rate": 2.777820645711109e-05, "loss": 1.0881843566894531, "num_input_tokens_seen": 6370698624, "step": 22400, "train_runtime": 218268.0469, "train_tokens_per_second": 29187.5 }, { "epoch": 0.7929112110161939, "grad_norm": 1.5234375, "learning_rate": 2.777392055665556e-05, "loss": 1.0867594718933105, "num_input_tokens_seen": 6373549824, "step": 22410, "train_runtime": 218366.4292, "train_tokens_per_second": 29187.407 }, { "epoch": 0.7932650312799226, "grad_norm": 1.46875, "learning_rate": 2.7769636639403252e-05, "loss": 1.0758161544799805, "num_input_tokens_seen": 6376342400, "step": 22420, "train_runtime": 218460.7629, "train_tokens_per_second": 29187.586 }, { "epoch": 0.7936188515436514, "grad_norm": 1.5234375, "learning_rate": 2.776535470382518e-05, "loss": 1.0880653381347656, "num_input_tokens_seen": 6379187776, "step": 22430, "train_runtime": 218559.0245, "train_tokens_per_second": 29187.483 }, { "epoch": 0.7939726718073803, "grad_norm": 1.4609375, "learning_rate": 2.776107474839399e-05, "loss": 1.0953195571899415, "num_input_tokens_seen": 6382054144, "step": 22440, "train_runtime": 218659.6236, "train_tokens_per_second": 29187.163 }, { "epoch": 0.7943264920711091, "grad_norm": 1.421875, "learning_rate": 2.7756796771583976e-05, "loss": 1.0886566162109375, "num_input_tokens_seen": 6384900416, "step": 22450, "train_runtime": 218755.672, "train_tokens_per_second": 29187.359 }, { "epoch": 0.7946803123348378, "grad_norm": 1.4453125, "learning_rate": 2.775252077187109e-05, "loss": 1.073645782470703, "num_input_tokens_seen": 6387747456, "step": 22460, "train_runtime": 218852.7602, "train_tokens_per_second": 29187.42 }, { "epoch": 0.7950341325985666, "grad_norm": 1.5, "learning_rate": 2.7748246747732902e-05, "loss": 1.100697135925293, "num_input_tokens_seen": 6390513600, "step": 22470, "train_runtime": 218947.0941, "train_tokens_per_second": 29187.478 }, { "epoch": 0.7953879528622954, "grad_norm": 1.46875, "learning_rate": 2.774397469764866e-05, "loss": 1.0823389053344727, "num_input_tokens_seen": 6393333760, "step": 22480, "train_runtime": 219041.902, "train_tokens_per_second": 29187.72 }, { "epoch": 0.7957417731260241, "grad_norm": 1.453125, "learning_rate": 2.7739704620099226e-05, "loss": 1.0799068450927733, "num_input_tokens_seen": 6396174656, "step": 22490, "train_runtime": 219141.017, "train_tokens_per_second": 29187.483 }, { "epoch": 0.7960955933897529, "grad_norm": 1.5, "learning_rate": 2.7735436513567098e-05, "loss": 1.0778932571411133, "num_input_tokens_seen": 6399009600, "step": 22500, "train_runtime": 219239.3533, "train_tokens_per_second": 29187.322 }, { "epoch": 0.7964494136534817, "grad_norm": 1.4296875, "learning_rate": 2.7731170376536402e-05, "loss": 1.0846778869628906, "num_input_tokens_seen": 6401880448, "step": 22510, "train_runtime": 219337.5787, "train_tokens_per_second": 29187.34 }, { "epoch": 0.7968032339172105, "grad_norm": 1.46875, "learning_rate": 2.7726906207492925e-05, "loss": 1.0940632820129395, "num_input_tokens_seen": 6404782144, "step": 22520, "train_runtime": 219438.7903, "train_tokens_per_second": 29187.101 }, { "epoch": 0.7971570541809393, "grad_norm": 1.5859375, "learning_rate": 2.7722644004924048e-05, "loss": 1.0905357360839845, "num_input_tokens_seen": 6407612544, "step": 22530, "train_runtime": 219536.8433, "train_tokens_per_second": 29186.958 }, { "epoch": 0.7975108744446681, "grad_norm": 1.5078125, "learning_rate": 2.77183837673188e-05, "loss": 1.079473876953125, "num_input_tokens_seen": 6410450176, "step": 22540, "train_runtime": 219635.56, "train_tokens_per_second": 29186.759 }, { "epoch": 0.7978646947083968, "grad_norm": 1.4296875, "learning_rate": 2.7714125493167835e-05, "loss": 1.0797595977783203, "num_input_tokens_seen": 6413332416, "step": 22550, "train_runtime": 219738.0091, "train_tokens_per_second": 29186.268 }, { "epoch": 0.7982185149721256, "grad_norm": 1.515625, "learning_rate": 2.770986918096342e-05, "loss": 1.0850589752197266, "num_input_tokens_seen": 6416186432, "step": 22560, "train_runtime": 219836.6644, "train_tokens_per_second": 29186.153 }, { "epoch": 0.7985723352358544, "grad_norm": 1.4609375, "learning_rate": 2.7705614829199454e-05, "loss": 1.08462495803833, "num_input_tokens_seen": 6418982848, "step": 22570, "train_runtime": 219931.623, "train_tokens_per_second": 29186.266 }, { "epoch": 0.7989261554995831, "grad_norm": 1.4375, "learning_rate": 2.7701362436371437e-05, "loss": 1.0859682083129882, "num_input_tokens_seen": 6421845056, "step": 22580, "train_runtime": 220031.0337, "train_tokens_per_second": 29186.088 }, { "epoch": 0.7992799757633119, "grad_norm": 1.5078125, "learning_rate": 2.7697112000976492e-05, "loss": 1.060536766052246, "num_input_tokens_seen": 6424694080, "step": 22590, "train_runtime": 220127.394, "train_tokens_per_second": 29186.254 }, { "epoch": 0.7996337960270408, "grad_norm": 1.4140625, "learning_rate": 2.769286352151338e-05, "loss": 1.0825712203979492, "num_input_tokens_seen": 6427556096, "step": 22600, "train_runtime": 220225.7843, "train_tokens_per_second": 29186.21 }, { "epoch": 0.7999876162907695, "grad_norm": 1.46875, "learning_rate": 2.768861699648243e-05, "loss": 1.0818939208984375, "num_input_tokens_seen": 6430488064, "step": 22610, "train_runtime": 220325.6519, "train_tokens_per_second": 29186.289 }, { "epoch": 0.8003414365544983, "grad_norm": 1.4453125, "learning_rate": 2.7684372424385613e-05, "loss": 1.0833845138549805, "num_input_tokens_seen": 6433337280, "step": 22620, "train_runtime": 220422.4011, "train_tokens_per_second": 29186.404 }, { "epoch": 0.8006952568182271, "grad_norm": 1.5, "learning_rate": 2.7680129803726496e-05, "loss": 1.0743524551391601, "num_input_tokens_seen": 6436162176, "step": 22630, "train_runtime": 220520.1282, "train_tokens_per_second": 29186.28 }, { "epoch": 0.8010490770819558, "grad_norm": 1.4453125, "learning_rate": 2.767588913301025e-05, "loss": 1.0982215881347657, "num_input_tokens_seen": 6439001344, "step": 22640, "train_runtime": 220616.3687, "train_tokens_per_second": 29186.417 }, { "epoch": 0.8014028973456846, "grad_norm": 1.5, "learning_rate": 2.767165041074365e-05, "loss": 1.0816495895385743, "num_input_tokens_seen": 6441841536, "step": 22650, "train_runtime": 220712.0151, "train_tokens_per_second": 29186.637 }, { "epoch": 0.8017567176094134, "grad_norm": 1.4296875, "learning_rate": 2.766741363543507e-05, "loss": 1.0748140335083007, "num_input_tokens_seen": 6444707584, "step": 22660, "train_runtime": 220810.6789, "train_tokens_per_second": 29186.576 }, { "epoch": 0.8021105378731421, "grad_norm": 1.4609375, "learning_rate": 2.7663178805594482e-05, "loss": 1.068247413635254, "num_input_tokens_seen": 6447578112, "step": 22670, "train_runtime": 220908.3467, "train_tokens_per_second": 29186.666 }, { "epoch": 0.8024643581368709, "grad_norm": 1.484375, "learning_rate": 2.7658945919733463e-05, "loss": 1.0890165328979493, "num_input_tokens_seen": 6450483520, "step": 22680, "train_runtime": 221011.6993, "train_tokens_per_second": 29186.163 }, { "epoch": 0.8028181784005998, "grad_norm": 1.4765625, "learning_rate": 2.7654714976365164e-05, "loss": 1.075960350036621, "num_input_tokens_seen": 6453366400, "step": 22690, "train_runtime": 221109.0118, "train_tokens_per_second": 29186.356 }, { "epoch": 0.8031719986643285, "grad_norm": 1.4375, "learning_rate": 2.765048597400436e-05, "loss": 1.0807207107543946, "num_input_tokens_seen": 6456204928, "step": 22700, "train_runtime": 221205.2463, "train_tokens_per_second": 29186.491 }, { "epoch": 0.8035258189280573, "grad_norm": 1.453125, "learning_rate": 2.7646258911167373e-05, "loss": 1.0858779907226563, "num_input_tokens_seen": 6459031936, "step": 22710, "train_runtime": 221302.3505, "train_tokens_per_second": 29186.459 }, { "epoch": 0.8038796391917861, "grad_norm": 1.4453125, "learning_rate": 2.7642033786372145e-05, "loss": 1.0899287223815919, "num_input_tokens_seen": 6461922624, "step": 22720, "train_runtime": 221399.4719, "train_tokens_per_second": 29186.712 }, { "epoch": 0.8042334594555148, "grad_norm": 1.53125, "learning_rate": 2.7637810598138193e-05, "loss": 1.078603172302246, "num_input_tokens_seen": 6464810112, "step": 22730, "train_runtime": 221496.2168, "train_tokens_per_second": 29187.0 }, { "epoch": 0.8045872797192436, "grad_norm": 1.5, "learning_rate": 2.7633589344986615e-05, "loss": 1.0724714279174805, "num_input_tokens_seen": 6467718464, "step": 22740, "train_runtime": 221598.5992, "train_tokens_per_second": 29186.64 }, { "epoch": 0.8049410999829724, "grad_norm": 1.5, "learning_rate": 2.7629370025440087e-05, "loss": 1.0867698669433594, "num_input_tokens_seen": 6470567360, "step": 22750, "train_runtime": 221698.3856, "train_tokens_per_second": 29186.353 }, { "epoch": 0.8052949202467011, "grad_norm": 1.4296875, "learning_rate": 2.762515263802287e-05, "loss": 1.0704718589782716, "num_input_tokens_seen": 6473497920, "step": 22760, "train_runtime": 221798.8459, "train_tokens_per_second": 29186.346 }, { "epoch": 0.80564874051043, "grad_norm": 1.453125, "learning_rate": 2.762093718126081e-05, "loss": 1.0814133644104005, "num_input_tokens_seen": 6476327488, "step": 22770, "train_runtime": 221891.8858, "train_tokens_per_second": 29186.86 }, { "epoch": 0.8060025607741588, "grad_norm": 1.4765625, "learning_rate": 2.7616723653681298e-05, "loss": 1.0889326095581056, "num_input_tokens_seen": 6479164608, "step": 22780, "train_runtime": 221988.188, "train_tokens_per_second": 29186.979 }, { "epoch": 0.8063563810378875, "grad_norm": 1.4921875, "learning_rate": 2.761251205381332e-05, "loss": 1.0868659973144532, "num_input_tokens_seen": 6482004800, "step": 22790, "train_runtime": 222085.1636, "train_tokens_per_second": 29187.023 }, { "epoch": 0.8067102013016163, "grad_norm": 1.5234375, "learning_rate": 2.760830238018744e-05, "loss": 1.084191131591797, "num_input_tokens_seen": 6484838592, "step": 22800, "train_runtime": 222183.111, "train_tokens_per_second": 29186.911 }, { "epoch": 0.8070640215653451, "grad_norm": 1.453125, "learning_rate": 2.760409463133576e-05, "loss": 1.0698507308959961, "num_input_tokens_seen": 6487655488, "step": 22810, "train_runtime": 222276.9424, "train_tokens_per_second": 29187.263 }, { "epoch": 0.8074178418290738, "grad_norm": 1.625, "learning_rate": 2.7599888805791967e-05, "loss": 1.086565113067627, "num_input_tokens_seen": 6490529792, "step": 22820, "train_runtime": 222378.5886, "train_tokens_per_second": 29186.847 }, { "epoch": 0.8077716620928026, "grad_norm": 1.4453125, "learning_rate": 2.759568490209132e-05, "loss": 1.0623001098632812, "num_input_tokens_seen": 6493384512, "step": 22830, "train_runtime": 222476.3897, "train_tokens_per_second": 29186.848 }, { "epoch": 0.8081254823565314, "grad_norm": 1.46875, "learning_rate": 2.7591482918770613e-05, "loss": 1.0803041458129883, "num_input_tokens_seen": 6496235776, "step": 22840, "train_runtime": 222573.3827, "train_tokens_per_second": 29186.939 }, { "epoch": 0.8084793026202602, "grad_norm": 1.5078125, "learning_rate": 2.7587282854368222e-05, "loss": 1.0806642532348634, "num_input_tokens_seen": 6499074240, "step": 22850, "train_runtime": 222671.9021, "train_tokens_per_second": 29186.773 }, { "epoch": 0.808833122883989, "grad_norm": 1.4609375, "learning_rate": 2.7583084707424072e-05, "loss": 1.069394874572754, "num_input_tokens_seen": 6501894272, "step": 22860, "train_runtime": 222768.0564, "train_tokens_per_second": 29186.834 }, { "epoch": 0.8091869431477178, "grad_norm": 1.53125, "learning_rate": 2.7578888476479643e-05, "loss": 1.086017894744873, "num_input_tokens_seen": 6504719232, "step": 22870, "train_runtime": 222865.6993, "train_tokens_per_second": 29186.722 }, { "epoch": 0.8095407634114465, "grad_norm": 1.609375, "learning_rate": 2.7574694160077964e-05, "loss": 1.0745489120483398, "num_input_tokens_seen": 6507529088, "step": 22880, "train_runtime": 222961.0441, "train_tokens_per_second": 29186.843 }, { "epoch": 0.8098945836751753, "grad_norm": 1.4296875, "learning_rate": 2.757050175676362e-05, "loss": 1.0779829025268555, "num_input_tokens_seen": 6510378048, "step": 22890, "train_runtime": 223060.7285, "train_tokens_per_second": 29186.572 }, { "epoch": 0.8102484039389041, "grad_norm": 1.484375, "learning_rate": 2.756631126508274e-05, "loss": 1.0801769256591798, "num_input_tokens_seen": 6513212288, "step": 22900, "train_runtime": 223154.846, "train_tokens_per_second": 29186.963 }, { "epoch": 0.8106022242026328, "grad_norm": 1.5078125, "learning_rate": 2.7562122683583004e-05, "loss": 1.0808786392211913, "num_input_tokens_seen": 6516022976, "step": 22910, "train_runtime": 223253.5888, "train_tokens_per_second": 29186.644 }, { "epoch": 0.8109560444663616, "grad_norm": 1.484375, "learning_rate": 2.7557936010813634e-05, "loss": 1.0762039184570313, "num_input_tokens_seen": 6518820352, "step": 22920, "train_runtime": 223348.5547, "train_tokens_per_second": 29186.759 }, { "epoch": 0.8113098647300904, "grad_norm": 1.4453125, "learning_rate": 2.75537512453254e-05, "loss": 1.0891626358032227, "num_input_tokens_seen": 6521648768, "step": 22930, "train_runtime": 223447.3114, "train_tokens_per_second": 29186.517 }, { "epoch": 0.8116636849938192, "grad_norm": 1.5390625, "learning_rate": 2.7549568385670595e-05, "loss": 1.0772696495056153, "num_input_tokens_seen": 6524491072, "step": 22940, "train_runtime": 223545.5487, "train_tokens_per_second": 29186.406 }, { "epoch": 0.812017505257548, "grad_norm": 1.5546875, "learning_rate": 2.754538743040307e-05, "loss": 1.0925559043884276, "num_input_tokens_seen": 6527338176, "step": 22950, "train_runtime": 223642.946, "train_tokens_per_second": 29186.425 }, { "epoch": 0.8123713255212768, "grad_norm": 1.5234375, "learning_rate": 2.75412083780782e-05, "loss": 1.0778794288635254, "num_input_tokens_seen": 6530195456, "step": 22960, "train_runtime": 223740.4807, "train_tokens_per_second": 29186.473 }, { "epoch": 0.8127251457850055, "grad_norm": 1.46875, "learning_rate": 2.7537031227252898e-05, "loss": 1.082054328918457, "num_input_tokens_seen": 6533060800, "step": 22970, "train_runtime": 223840.7978, "train_tokens_per_second": 29186.193 }, { "epoch": 0.8130789660487343, "grad_norm": 1.421875, "learning_rate": 2.75328559764856e-05, "loss": 1.0906583786010742, "num_input_tokens_seen": 6535907968, "step": 22980, "train_runtime": 223936.8598, "train_tokens_per_second": 29186.388 }, { "epoch": 0.8134327863124631, "grad_norm": 1.453125, "learning_rate": 2.752868262433629e-05, "loss": 1.0815360069274902, "num_input_tokens_seen": 6538782976, "step": 22990, "train_runtime": 224036.8667, "train_tokens_per_second": 29186.192 }, { "epoch": 0.8137866065761918, "grad_norm": 1.46875, "learning_rate": 2.752451116936646e-05, "loss": 1.075191116333008, "num_input_tokens_seen": 6541612096, "step": 23000, "train_runtime": 224132.5556, "train_tokens_per_second": 29186.354 }, { "epoch": 0.8141404268399206, "grad_norm": 1.5234375, "learning_rate": 2.752034161013915e-05, "loss": 1.0768547058105469, "num_input_tokens_seen": 6544474112, "step": 23010, "train_runtime": 224233.1456, "train_tokens_per_second": 29186.025 }, { "epoch": 0.8144942471036495, "grad_norm": 1.4921875, "learning_rate": 2.7516173945218888e-05, "loss": 1.0830118179321289, "num_input_tokens_seen": 6547316608, "step": 23020, "train_runtime": 224327.398, "train_tokens_per_second": 29186.433 }, { "epoch": 0.8148480673673782, "grad_norm": 1.53125, "learning_rate": 2.751200817317176e-05, "loss": 1.0963520050048827, "num_input_tokens_seen": 6550139776, "step": 23030, "train_runtime": 224424.3539, "train_tokens_per_second": 29186.404 }, { "epoch": 0.815201887631107, "grad_norm": 1.4375, "learning_rate": 2.7507844292565354e-05, "loss": 1.068218994140625, "num_input_tokens_seen": 6552959808, "step": 23040, "train_runtime": 224521.6797, "train_tokens_per_second": 29186.312 }, { "epoch": 0.8155557078948358, "grad_norm": 1.5078125, "learning_rate": 2.7503682301968763e-05, "loss": 1.0791427612304687, "num_input_tokens_seen": 6555845696, "step": 23050, "train_runtime": 224622.7318, "train_tokens_per_second": 29186.03 }, { "epoch": 0.8159095281585645, "grad_norm": 1.546875, "learning_rate": 2.7499522199952627e-05, "loss": 1.0884111404418946, "num_input_tokens_seen": 6558741824, "step": 23060, "train_runtime": 224725.9057, "train_tokens_per_second": 29185.517 }, { "epoch": 0.8162633484222933, "grad_norm": 1.5, "learning_rate": 2.7495363985089072e-05, "loss": 1.080415630340576, "num_input_tokens_seen": 6561577408, "step": 23070, "train_runtime": 224823.8569, "train_tokens_per_second": 29185.414 }, { "epoch": 0.8166171686860221, "grad_norm": 1.5, "learning_rate": 2.7491207655951745e-05, "loss": 1.0804697036743165, "num_input_tokens_seen": 6564394368, "step": 23080, "train_runtime": 224919.485, "train_tokens_per_second": 29185.53 }, { "epoch": 0.8169709889497508, "grad_norm": 1.4921875, "learning_rate": 2.7487053211115797e-05, "loss": 1.077825927734375, "num_input_tokens_seen": 6567258048, "step": 23090, "train_runtime": 225020.8964, "train_tokens_per_second": 29185.103 }, { "epoch": 0.8173248092134797, "grad_norm": 1.5234375, "learning_rate": 2.748290064915789e-05, "loss": 1.0958138465881349, "num_input_tokens_seen": 6570109760, "step": 23100, "train_runtime": 225118.6605, "train_tokens_per_second": 29185.096 }, { "epoch": 0.8176786294772085, "grad_norm": 1.5078125, "learning_rate": 2.747874996865619e-05, "loss": 1.0759672164916991, "num_input_tokens_seen": 6572910400, "step": 23110, "train_runtime": 225214.9084, "train_tokens_per_second": 29185.059 }, { "epoch": 0.8180324497409373, "grad_norm": 1.4765625, "learning_rate": 2.747460116819037e-05, "loss": 1.0935222625732421, "num_input_tokens_seen": 6575717312, "step": 23120, "train_runtime": 225308.3959, "train_tokens_per_second": 29185.407 }, { "epoch": 0.818386270004666, "grad_norm": 1.46875, "learning_rate": 2.7470454246341597e-05, "loss": 1.0940135955810546, "num_input_tokens_seen": 6578460416, "step": 23130, "train_runtime": 225400.0272, "train_tokens_per_second": 29185.713 }, { "epoch": 0.8187400902683948, "grad_norm": 1.4765625, "learning_rate": 2.746630920169254e-05, "loss": 1.078403854370117, "num_input_tokens_seen": 6581277248, "step": 23140, "train_runtime": 225498.2749, "train_tokens_per_second": 29185.488 }, { "epoch": 0.8190939105321235, "grad_norm": 1.5, "learning_rate": 2.7462166032827358e-05, "loss": 1.0915197372436523, "num_input_tokens_seen": 6584125312, "step": 23150, "train_runtime": 225597.8471, "train_tokens_per_second": 29185.231 }, { "epoch": 0.8194477307958523, "grad_norm": 1.4609375, "learning_rate": 2.745802473833171e-05, "loss": 1.0811795234680175, "num_input_tokens_seen": 6586948032, "step": 23160, "train_runtime": 225693.9878, "train_tokens_per_second": 29185.306 }, { "epoch": 0.8198015510595811, "grad_norm": 1.4609375, "learning_rate": 2.7453885316792755e-05, "loss": 1.0730777740478517, "num_input_tokens_seen": 6589785408, "step": 23170, "train_runtime": 225791.104, "train_tokens_per_second": 29185.319 }, { "epoch": 0.8201553713233098, "grad_norm": 1.4765625, "learning_rate": 2.7449747766799135e-05, "loss": 1.0770389556884765, "num_input_tokens_seen": 6592632320, "step": 23180, "train_runtime": 225890.8482, "train_tokens_per_second": 29185.035 }, { "epoch": 0.8205091915870387, "grad_norm": 1.46875, "learning_rate": 2.744561208694097e-05, "loss": 1.0897814750671386, "num_input_tokens_seen": 6595490112, "step": 23190, "train_runtime": 225987.8959, "train_tokens_per_second": 29185.148 }, { "epoch": 0.8208630118507675, "grad_norm": 1.4921875, "learning_rate": 2.7441478275809884e-05, "loss": 1.0790255546569825, "num_input_tokens_seen": 6598388416, "step": 23200, "train_runtime": 226089.1662, "train_tokens_per_second": 29184.894 }, { "epoch": 0.8212168321144963, "grad_norm": 1.453125, "learning_rate": 2.743734633199898e-05, "loss": 1.0959592819213868, "num_input_tokens_seen": 6601239296, "step": 23210, "train_runtime": 226187.6752, "train_tokens_per_second": 29184.788 }, { "epoch": 0.821570652378225, "grad_norm": 1.4921875, "learning_rate": 2.743321625410284e-05, "loss": 1.0892959594726563, "num_input_tokens_seen": 6604035840, "step": 23220, "train_runtime": 226280.6314, "train_tokens_per_second": 29185.157 }, { "epoch": 0.8219244726419538, "grad_norm": 1.4765625, "learning_rate": 2.7429088040717526e-05, "loss": 1.096724796295166, "num_input_tokens_seen": 6606898432, "step": 23230, "train_runtime": 226378.024, "train_tokens_per_second": 29185.246 }, { "epoch": 0.8222782929056826, "grad_norm": 1.4921875, "learning_rate": 2.7424961690440586e-05, "loss": 1.0844781875610352, "num_input_tokens_seen": 6609739008, "step": 23240, "train_runtime": 226472.1124, "train_tokens_per_second": 29185.664 }, { "epoch": 0.8226321131694113, "grad_norm": 1.4921875, "learning_rate": 2.742083720187103e-05, "loss": 1.0861766815185547, "num_input_tokens_seen": 6612523008, "step": 23250, "train_runtime": 226564.1338, "train_tokens_per_second": 29186.098 }, { "epoch": 0.8229859334331401, "grad_norm": 1.5234375, "learning_rate": 2.7416714573609363e-05, "loss": 1.076883316040039, "num_input_tokens_seen": 6615339584, "step": 23260, "train_runtime": 226660.995, "train_tokens_per_second": 29186.052 }, { "epoch": 0.823339753696869, "grad_norm": 1.4765625, "learning_rate": 2.7412593804257543e-05, "loss": 1.0979621887207032, "num_input_tokens_seen": 6618179392, "step": 23270, "train_runtime": 226755.7336, "train_tokens_per_second": 29186.382 }, { "epoch": 0.8236935739605977, "grad_norm": 1.453125, "learning_rate": 2.740847489241901e-05, "loss": 1.0813051223754884, "num_input_tokens_seen": 6621007104, "step": 23280, "train_runtime": 226853.9951, "train_tokens_per_second": 29186.205 }, { "epoch": 0.8240473942243265, "grad_norm": 1.4609375, "learning_rate": 2.7404357836698668e-05, "loss": 1.0965773582458496, "num_input_tokens_seen": 6623822912, "step": 23290, "train_runtime": 226949.1809, "train_tokens_per_second": 29186.371 }, { "epoch": 0.8244012144880553, "grad_norm": 1.4609375, "learning_rate": 2.740024263570289e-05, "loss": 1.0745887756347656, "num_input_tokens_seen": 6626688576, "step": 23300, "train_runtime": 227047.2126, "train_tokens_per_second": 29186.39 }, { "epoch": 0.824755034751784, "grad_norm": 1.484375, "learning_rate": 2.7396129288039503e-05, "loss": 1.0811769485473632, "num_input_tokens_seen": 6629458304, "step": 23310, "train_runtime": 227139.6555, "train_tokens_per_second": 29186.706 }, { "epoch": 0.8251088550155128, "grad_norm": 1.453125, "learning_rate": 2.739201779231782e-05, "loss": 1.0905887603759765, "num_input_tokens_seen": 6632267136, "step": 23320, "train_runtime": 227233.2296, "train_tokens_per_second": 29187.048 }, { "epoch": 0.8254626752792416, "grad_norm": 1.5, "learning_rate": 2.7387908147148587e-05, "loss": 1.0939032554626464, "num_input_tokens_seen": 6635163584, "step": 23330, "train_runtime": 227333.4696, "train_tokens_per_second": 29186.919 }, { "epoch": 0.8258164955429703, "grad_norm": 1.546875, "learning_rate": 2.7383800351144027e-05, "loss": 1.088741397857666, "num_input_tokens_seen": 6638039808, "step": 23340, "train_runtime": 227429.2755, "train_tokens_per_second": 29187.271 }, { "epoch": 0.8261703158066992, "grad_norm": 1.453125, "learning_rate": 2.737969440291782e-05, "loss": 1.0957265853881837, "num_input_tokens_seen": 6640829056, "step": 23350, "train_runtime": 227523.7353, "train_tokens_per_second": 29187.412 }, { "epoch": 0.826524136070428, "grad_norm": 1.4453125, "learning_rate": 2.7375590301085087e-05, "loss": 1.070406723022461, "num_input_tokens_seen": 6643602688, "step": 23360, "train_runtime": 227618.3698, "train_tokens_per_second": 29187.463 }, { "epoch": 0.8268779563341567, "grad_norm": 1.53125, "learning_rate": 2.7371488044262406e-05, "loss": 1.0714908599853517, "num_input_tokens_seen": 6646403584, "step": 23370, "train_runtime": 227710.793, "train_tokens_per_second": 29187.916 }, { "epoch": 0.8272317765978855, "grad_norm": 1.4765625, "learning_rate": 2.7367387631067816e-05, "loss": 1.0696182250976562, "num_input_tokens_seen": 6649190208, "step": 23380, "train_runtime": 227805.6425, "train_tokens_per_second": 29187.996 }, { "epoch": 0.8275855968616143, "grad_norm": 1.4765625, "learning_rate": 2.73632890601208e-05, "loss": 1.0714986801147461, "num_input_tokens_seen": 6651995392, "step": 23390, "train_runtime": 227900.7377, "train_tokens_per_second": 29188.126 }, { "epoch": 0.827939417125343, "grad_norm": 1.453125, "learning_rate": 2.7359192330042277e-05, "loss": 1.0810748100280763, "num_input_tokens_seen": 6654835136, "step": 23400, "train_runtime": 227998.3007, "train_tokens_per_second": 29188.091 }, { "epoch": 0.8282932373890718, "grad_norm": 1.53125, "learning_rate": 2.7355097439454625e-05, "loss": 1.106581211090088, "num_input_tokens_seen": 6657648832, "step": 23410, "train_runtime": 228092.8054, "train_tokens_per_second": 29188.333 }, { "epoch": 0.8286470576528006, "grad_norm": 1.46875, "learning_rate": 2.735100438698166e-05, "loss": 1.0827984809875488, "num_input_tokens_seen": 6660510272, "step": 23420, "train_runtime": 228192.2342, "train_tokens_per_second": 29188.155 }, { "epoch": 0.8290008779165293, "grad_norm": 1.65625, "learning_rate": 2.7346913171248635e-05, "loss": 1.074754810333252, "num_input_tokens_seen": 6663379200, "step": 23430, "train_runtime": 228294.8726, "train_tokens_per_second": 29187.599 }, { "epoch": 0.8293546981802582, "grad_norm": 1.4609375, "learning_rate": 2.734282379088225e-05, "loss": 1.0844354629516602, "num_input_tokens_seen": 6666237120, "step": 23440, "train_runtime": 228395.6905, "train_tokens_per_second": 29187.228 }, { "epoch": 0.829708518443987, "grad_norm": 1.453125, "learning_rate": 2.733873624451063e-05, "loss": 1.081937026977539, "num_input_tokens_seen": 6669092544, "step": 23450, "train_runtime": 228494.4185, "train_tokens_per_second": 29187.114 }, { "epoch": 0.8300623387077157, "grad_norm": 1.5546875, "learning_rate": 2.733465053076335e-05, "loss": 1.07940673828125, "num_input_tokens_seen": 6671894848, "step": 23460, "train_runtime": 228590.2873, "train_tokens_per_second": 29187.132 }, { "epoch": 0.8304161589714445, "grad_norm": 1.4453125, "learning_rate": 2.733056664827141e-05, "loss": 1.0755454063415528, "num_input_tokens_seen": 6674719872, "step": 23470, "train_runtime": 228684.5172, "train_tokens_per_second": 29187.459 }, { "epoch": 0.8307699792351733, "grad_norm": 1.53125, "learning_rate": 2.732648459566724e-05, "loss": 1.0861963272094726, "num_input_tokens_seen": 6677592960, "step": 23480, "train_runtime": 228784.5293, "train_tokens_per_second": 29187.257 }, { "epoch": 0.831123799498902, "grad_norm": 1.5390625, "learning_rate": 2.73224043715847e-05, "loss": 1.0914776802062989, "num_input_tokens_seen": 6680380736, "step": 23490, "train_runtime": 228877.2885, "train_tokens_per_second": 29187.609 }, { "epoch": 0.8314776197626308, "grad_norm": 1.453125, "learning_rate": 2.731832597465908e-05, "loss": 1.0868388175964356, "num_input_tokens_seen": 6683200000, "step": 23500, "train_runtime": 228974.4052, "train_tokens_per_second": 29187.542 }, { "epoch": 0.8318314400263596, "grad_norm": 1.4609375, "learning_rate": 2.7314249403527097e-05, "loss": 1.0788534164428711, "num_input_tokens_seen": 6686038400, "step": 23510, "train_runtime": 229073.8299, "train_tokens_per_second": 29187.264 }, { "epoch": 0.8321852602900884, "grad_norm": 1.5, "learning_rate": 2.731017465682689e-05, "loss": 1.0865266799926758, "num_input_tokens_seen": 6688851328, "step": 23520, "train_runtime": 229169.6674, "train_tokens_per_second": 29187.333 }, { "epoch": 0.8325390805538172, "grad_norm": 1.484375, "learning_rate": 2.730610173319802e-05, "loss": 1.0864070892333983, "num_input_tokens_seen": 6691664960, "step": 23530, "train_runtime": 229264.0118, "train_tokens_per_second": 29187.594 }, { "epoch": 0.832892900817546, "grad_norm": 1.4609375, "learning_rate": 2.7302030631281454e-05, "loss": 1.0914388656616212, "num_input_tokens_seen": 6694520128, "step": 23540, "train_runtime": 229361.4796, "train_tokens_per_second": 29187.639 }, { "epoch": 0.8332467210812747, "grad_norm": 1.4765625, "learning_rate": 2.7297961349719608e-05, "loss": 1.0835803985595702, "num_input_tokens_seen": 6697419392, "step": 23550, "train_runtime": 229463.8819, "train_tokens_per_second": 29187.249 }, { "epoch": 0.8336005413450035, "grad_norm": 1.5234375, "learning_rate": 2.729389388715628e-05, "loss": 1.0846891403198242, "num_input_tokens_seen": 6700298176, "step": 23560, "train_runtime": 229564.6438, "train_tokens_per_second": 29186.978 }, { "epoch": 0.8339543616087323, "grad_norm": 1.5625, "learning_rate": 2.728982824223671e-05, "loss": 1.0953842163085938, "num_input_tokens_seen": 6703155264, "step": 23570, "train_runtime": 229660.6212, "train_tokens_per_second": 29187.221 }, { "epoch": 0.834308181872461, "grad_norm": 1.4921875, "learning_rate": 2.7285764413607527e-05, "loss": 1.0790843963623047, "num_input_tokens_seen": 6706059072, "step": 23580, "train_runtime": 229759.6279, "train_tokens_per_second": 29187.282 }, { "epoch": 0.8346620021361898, "grad_norm": 1.4765625, "learning_rate": 2.7281702399916786e-05, "loss": 1.0800951957702636, "num_input_tokens_seen": 6708845440, "step": 23590, "train_runtime": 229853.7703, "train_tokens_per_second": 29187.45 }, { "epoch": 0.8350158223999187, "grad_norm": 1.5546875, "learning_rate": 2.7277642199813954e-05, "loss": 1.0798261642456055, "num_input_tokens_seen": 6711675456, "step": 23600, "train_runtime": 229950.7569, "train_tokens_per_second": 29187.447 }, { "epoch": 0.8353696426636474, "grad_norm": 1.5390625, "learning_rate": 2.7273583811949882e-05, "loss": 1.0819452285766602, "num_input_tokens_seen": 6714522112, "step": 23610, "train_runtime": 230046.4123, "train_tokens_per_second": 29187.685 }, { "epoch": 0.8357234629273762, "grad_norm": 1.4921875, "learning_rate": 2.7269527234976844e-05, "loss": 1.0799477577209473, "num_input_tokens_seen": 6717364800, "step": 23620, "train_runtime": 230142.4622, "train_tokens_per_second": 29187.855 }, { "epoch": 0.836077283191105, "grad_norm": 1.46875, "learning_rate": 2.726547246754852e-05, "loss": 1.0844985961914062, "num_input_tokens_seen": 6720234496, "step": 23630, "train_runtime": 230242.8303, "train_tokens_per_second": 29187.595 }, { "epoch": 0.8364311034548337, "grad_norm": 1.4921875, "learning_rate": 2.726141950831998e-05, "loss": 1.0818479537963868, "num_input_tokens_seen": 6723101184, "step": 23640, "train_runtime": 230337.4883, "train_tokens_per_second": 29188.046 }, { "epoch": 0.8367849237185625, "grad_norm": 1.484375, "learning_rate": 2.7257368355947686e-05, "loss": 1.0719627380371093, "num_input_tokens_seen": 6725948544, "step": 23650, "train_runtime": 230435.5083, "train_tokens_per_second": 29187.987 }, { "epoch": 0.8371387439822913, "grad_norm": 1.484375, "learning_rate": 2.7253319009089528e-05, "loss": 1.1059932708740234, "num_input_tokens_seen": 6728794496, "step": 23660, "train_runtime": 230530.8522, "train_tokens_per_second": 29188.26 }, { "epoch": 0.83749256424602, "grad_norm": 1.453125, "learning_rate": 2.7249271466404758e-05, "loss": 1.0806312561035156, "num_input_tokens_seen": 6731619392, "step": 23670, "train_runtime": 230628.1144, "train_tokens_per_second": 29188.199 }, { "epoch": 0.8378463845097489, "grad_norm": 1.4453125, "learning_rate": 2.724522572655403e-05, "loss": 1.0931632041931152, "num_input_tokens_seen": 6734455360, "step": 23680, "train_runtime": 230727.0472, "train_tokens_per_second": 29187.975 }, { "epoch": 0.8382002047734777, "grad_norm": 1.5, "learning_rate": 2.7241181788199405e-05, "loss": 1.0595630645751952, "num_input_tokens_seen": 6737257792, "step": 23690, "train_runtime": 230820.5579, "train_tokens_per_second": 29188.292 }, { "epoch": 0.8385540250372064, "grad_norm": 1.453125, "learning_rate": 2.7237139650004316e-05, "loss": 1.0887943267822267, "num_input_tokens_seen": 6740072256, "step": 23700, "train_runtime": 230915.9002, "train_tokens_per_second": 29188.429 }, { "epoch": 0.8389078453009352, "grad_norm": 1.4375, "learning_rate": 2.7233099310633598e-05, "loss": 1.0827318191528321, "num_input_tokens_seen": 6742937472, "step": 23710, "train_runtime": 231014.1756, "train_tokens_per_second": 29188.414 }, { "epoch": 0.839261665564664, "grad_norm": 1.46875, "learning_rate": 2.722906076875345e-05, "loss": 1.091862678527832, "num_input_tokens_seen": 6745802560, "step": 23720, "train_runtime": 231110.8685, "train_tokens_per_second": 29188.599 }, { "epoch": 0.8396154858283927, "grad_norm": 1.5546875, "learning_rate": 2.7225024023031487e-05, "loss": 1.0906465530395508, "num_input_tokens_seen": 6748624448, "step": 23730, "train_runtime": 231206.9539, "train_tokens_per_second": 29188.674 }, { "epoch": 0.8399693060921215, "grad_norm": 1.4609375, "learning_rate": 2.7220989072136676e-05, "loss": 1.0838644981384278, "num_input_tokens_seen": 6751487104, "step": 23740, "train_runtime": 231304.6279, "train_tokens_per_second": 29188.725 }, { "epoch": 0.8403231263558503, "grad_norm": 1.5078125, "learning_rate": 2.7216955914739385e-05, "loss": 1.091843032836914, "num_input_tokens_seen": 6754324864, "step": 23750, "train_runtime": 231402.0658, "train_tokens_per_second": 29188.697 }, { "epoch": 0.840676946619579, "grad_norm": 1.4765625, "learning_rate": 2.7212924549511348e-05, "loss": 1.0811660766601563, "num_input_tokens_seen": 6757160064, "step": 23760, "train_runtime": 231499.0573, "train_tokens_per_second": 29188.715 }, { "epoch": 0.8410307668833079, "grad_norm": 1.4453125, "learning_rate": 2.7208894975125688e-05, "loss": 1.1039216995239258, "num_input_tokens_seen": 6759985152, "step": 23770, "train_runtime": 231595.025, "train_tokens_per_second": 29188.819 }, { "epoch": 0.8413845871470367, "grad_norm": 1.4765625, "learning_rate": 2.720486719025689e-05, "loss": 1.0820953369140625, "num_input_tokens_seen": 6762899520, "step": 23780, "train_runtime": 231698.0318, "train_tokens_per_second": 29188.42 }, { "epoch": 0.8417384074107654, "grad_norm": 1.5390625, "learning_rate": 2.7200841193580816e-05, "loss": 1.0918209075927734, "num_input_tokens_seen": 6765737088, "step": 23790, "train_runtime": 231793.7778, "train_tokens_per_second": 29188.605 }, { "epoch": 0.8420922276744942, "grad_norm": 1.4453125, "learning_rate": 2.7196816983774708e-05, "loss": 1.0905494689941406, "num_input_tokens_seen": 6768535104, "step": 23800, "train_runtime": 231889.6833, "train_tokens_per_second": 29188.6 }, { "epoch": 0.842446047938223, "grad_norm": 1.4921875, "learning_rate": 2.7192794559517166e-05, "loss": 1.0850044250488282, "num_input_tokens_seen": 6771360384, "step": 23810, "train_runtime": 231985.3505, "train_tokens_per_second": 29188.741 }, { "epoch": 0.8427998682019517, "grad_norm": 1.453125, "learning_rate": 2.7188773919488165e-05, "loss": 1.0747900009155273, "num_input_tokens_seen": 6774220352, "step": 23820, "train_runtime": 232085.2691, "train_tokens_per_second": 29188.498 }, { "epoch": 0.8431536884656805, "grad_norm": 1.484375, "learning_rate": 2.7184755062369043e-05, "loss": 1.0913869857788085, "num_input_tokens_seen": 6777075840, "step": 23830, "train_runtime": 232185.0854, "train_tokens_per_second": 29188.248 }, { "epoch": 0.8435075087294093, "grad_norm": 1.484375, "learning_rate": 2.7180737986842498e-05, "loss": 1.0834657669067382, "num_input_tokens_seen": 6779957440, "step": 23840, "train_runtime": 232283.3646, "train_tokens_per_second": 29188.304 }, { "epoch": 0.8438613289931381, "grad_norm": 1.4921875, "learning_rate": 2.71767226915926e-05, "loss": 1.0889476776123046, "num_input_tokens_seen": 6782824192, "step": 23850, "train_runtime": 232382.1699, "train_tokens_per_second": 29188.23 }, { "epoch": 0.8442151492568669, "grad_norm": 1.4296875, "learning_rate": 2.7172709175304767e-05, "loss": 1.0833987236022948, "num_input_tokens_seen": 6785715776, "step": 23860, "train_runtime": 232479.9756, "train_tokens_per_second": 29188.388 }, { "epoch": 0.8445689695205957, "grad_norm": 1.5546875, "learning_rate": 2.716869743666579e-05, "loss": 1.0783214569091797, "num_input_tokens_seen": 6788554176, "step": 23870, "train_runtime": 232574.2907, "train_tokens_per_second": 29188.756 }, { "epoch": 0.8449227897843244, "grad_norm": 1.4453125, "learning_rate": 2.7164687474363803e-05, "loss": 1.0737434387207032, "num_input_tokens_seen": 6791387200, "step": 23880, "train_runtime": 232672.5081, "train_tokens_per_second": 29188.61 }, { "epoch": 0.8452766100480532, "grad_norm": 1.4765625, "learning_rate": 2.7160679287088307e-05, "loss": 1.0815143585205078, "num_input_tokens_seen": 6794182400, "step": 23890, "train_runtime": 232768.1337, "train_tokens_per_second": 29188.628 }, { "epoch": 0.845630430311782, "grad_norm": 1.5234375, "learning_rate": 2.7156672873530147e-05, "loss": 1.072005844116211, "num_input_tokens_seen": 6797066368, "step": 23900, "train_runtime": 232869.1749, "train_tokens_per_second": 29188.347 }, { "epoch": 0.8459842505755107, "grad_norm": 1.484375, "learning_rate": 2.715266823238152e-05, "loss": 1.0908548355102539, "num_input_tokens_seen": 6799884352, "step": 23910, "train_runtime": 232965.8717, "train_tokens_per_second": 29188.328 }, { "epoch": 0.8463380708392395, "grad_norm": 1.5390625, "learning_rate": 2.714866536233598e-05, "loss": 1.0767156600952148, "num_input_tokens_seen": 6802746560, "step": 23920, "train_runtime": 233064.4784, "train_tokens_per_second": 29188.26 }, { "epoch": 0.8466918911029684, "grad_norm": 1.4140625, "learning_rate": 2.7144664262088422e-05, "loss": 1.0972530364990234, "num_input_tokens_seen": 6805556800, "step": 23930, "train_runtime": 233159.2158, "train_tokens_per_second": 29188.453 }, { "epoch": 0.8470457113666972, "grad_norm": 1.4453125, "learning_rate": 2.7140664930335084e-05, "loss": 1.0831727027893066, "num_input_tokens_seen": 6808367872, "step": 23940, "train_runtime": 233254.4973, "train_tokens_per_second": 29188.581 }, { "epoch": 0.8473995316304259, "grad_norm": 1.46875, "learning_rate": 2.713666736577356e-05, "loss": 1.0744585037231444, "num_input_tokens_seen": 6811223296, "step": 23950, "train_runtime": 233352.4767, "train_tokens_per_second": 29188.562 }, { "epoch": 0.8477533518941547, "grad_norm": 1.546875, "learning_rate": 2.713267156710278e-05, "loss": 1.0840402603149415, "num_input_tokens_seen": 6814095104, "step": 23960, "train_runtime": 233450.3355, "train_tokens_per_second": 29188.628 }, { "epoch": 0.8481071721578834, "grad_norm": 1.4453125, "learning_rate": 2.712867753302301e-05, "loss": 1.081430149078369, "num_input_tokens_seen": 6816930432, "step": 23970, "train_runtime": 233547.7574, "train_tokens_per_second": 29188.593 }, { "epoch": 0.8484609924216122, "grad_norm": 1.4609375, "learning_rate": 2.7124685262235865e-05, "loss": 1.0756324768066405, "num_input_tokens_seen": 6819820480, "step": 23980, "train_runtime": 233649.2415, "train_tokens_per_second": 29188.284 }, { "epoch": 0.848814812685341, "grad_norm": 1.546875, "learning_rate": 2.7120694753444287e-05, "loss": 1.0659494400024414, "num_input_tokens_seen": 6822655680, "step": 23990, "train_runtime": 233747.7772, "train_tokens_per_second": 29188.109 }, { "epoch": 0.8491686329490697, "grad_norm": 1.5703125, "learning_rate": 2.7116706005352547e-05, "loss": 1.0928373336791992, "num_input_tokens_seen": 6825531264, "step": 24000, "train_runtime": 233846.7193, "train_tokens_per_second": 29188.057 }, { "epoch": 0.8495224532127985, "grad_norm": 1.4609375, "learning_rate": 2.7112719016666282e-05, "loss": 1.0766069412231445, "num_input_tokens_seen": 6828340608, "step": 24010, "train_runtime": 233943.377, "train_tokens_per_second": 29188.006 }, { "epoch": 0.8498762734765274, "grad_norm": 1.453125, "learning_rate": 2.7108733786092427e-05, "loss": 1.0779426574707032, "num_input_tokens_seen": 6831119424, "step": 24020, "train_runtime": 234038.7183, "train_tokens_per_second": 29187.989 }, { "epoch": 0.8502300937402562, "grad_norm": 1.4375, "learning_rate": 2.7104750312339254e-05, "loss": 1.0757341384887695, "num_input_tokens_seen": 6833910272, "step": 24030, "train_runtime": 234129.4955, "train_tokens_per_second": 29188.592 }, { "epoch": 0.8505839140039849, "grad_norm": 1.515625, "learning_rate": 2.7100768594116382e-05, "loss": 1.0879364013671875, "num_input_tokens_seen": 6836786432, "step": 24040, "train_runtime": 234226.2272, "train_tokens_per_second": 29188.817 }, { "epoch": 0.8509377342677137, "grad_norm": 1.4921875, "learning_rate": 2.709678863013473e-05, "loss": 1.0813230514526366, "num_input_tokens_seen": 6839663232, "step": 24050, "train_runtime": 234324.8211, "train_tokens_per_second": 29188.812 }, { "epoch": 0.8512915545314425, "grad_norm": 1.5, "learning_rate": 2.7092810419106562e-05, "loss": 1.0850580215454102, "num_input_tokens_seen": 6842474688, "step": 24060, "train_runtime": 234421.1302, "train_tokens_per_second": 29188.814 }, { "epoch": 0.8516453747951712, "grad_norm": 1.4453125, "learning_rate": 2.7088833959745457e-05, "loss": 1.068478775024414, "num_input_tokens_seen": 6845340864, "step": 24070, "train_runtime": 234521.1324, "train_tokens_per_second": 29188.589 }, { "epoch": 0.8519991950589, "grad_norm": 1.5, "learning_rate": 2.708485925076631e-05, "loss": 1.079576301574707, "num_input_tokens_seen": 6848187072, "step": 24080, "train_runtime": 234618.5427, "train_tokens_per_second": 29188.601 }, { "epoch": 0.8523530153226287, "grad_norm": 1.4609375, "learning_rate": 2.708088629088535e-05, "loss": 1.0959550857543945, "num_input_tokens_seen": 6851030336, "step": 24090, "train_runtime": 234714.019, "train_tokens_per_second": 29188.842 }, { "epoch": 0.8527068355863576, "grad_norm": 1.5703125, "learning_rate": 2.7076915078820115e-05, "loss": 1.0947162628173828, "num_input_tokens_seen": 6853932416, "step": 24100, "train_runtime": 234812.7552, "train_tokens_per_second": 29188.927 }, { "epoch": 0.8530606558500864, "grad_norm": 1.46875, "learning_rate": 2.707294561328945e-05, "loss": 1.0949834823608398, "num_input_tokens_seen": 6856750656, "step": 24110, "train_runtime": 234908.6978, "train_tokens_per_second": 29189.003 }, { "epoch": 0.8534144761138152, "grad_norm": 1.46875, "learning_rate": 2.706897789301353e-05, "loss": 1.0991998672485352, "num_input_tokens_seen": 6859575616, "step": 24120, "train_runtime": 235006.471, "train_tokens_per_second": 29188.88 }, { "epoch": 0.8537682963775439, "grad_norm": 1.4921875, "learning_rate": 2.706501191671384e-05, "loss": 1.0824554443359375, "num_input_tokens_seen": 6862452608, "step": 24130, "train_runtime": 235109.2691, "train_tokens_per_second": 29188.354 }, { "epoch": 0.8541221166412727, "grad_norm": 1.5078125, "learning_rate": 2.7061047683113165e-05, "loss": 1.075168991088867, "num_input_tokens_seen": 6865240064, "step": 24140, "train_runtime": 235203.2334, "train_tokens_per_second": 29188.545 }, { "epoch": 0.8544759369050015, "grad_norm": 1.46875, "learning_rate": 2.705708519093561e-05, "loss": 1.0751630783081054, "num_input_tokens_seen": 6868096128, "step": 24150, "train_runtime": 235298.3579, "train_tokens_per_second": 29188.883 }, { "epoch": 0.8548297571687302, "grad_norm": 1.4921875, "learning_rate": 2.705312443890658e-05, "loss": 1.0913986206054687, "num_input_tokens_seen": 6870921280, "step": 24160, "train_runtime": 235394.4129, "train_tokens_per_second": 29188.974 }, { "epoch": 0.855183577432459, "grad_norm": 1.4765625, "learning_rate": 2.70491654257528e-05, "loss": 1.0760330200195312, "num_input_tokens_seen": 6873722496, "step": 24170, "train_runtime": 235488.1594, "train_tokens_per_second": 29189.249 }, { "epoch": 0.8555373976961879, "grad_norm": 1.4609375, "learning_rate": 2.7045208150202274e-05, "loss": 1.0862226486206055, "num_input_tokens_seen": 6876630144, "step": 24180, "train_runtime": 235588.1074, "train_tokens_per_second": 29189.207 }, { "epoch": 0.8558912179599166, "grad_norm": 1.484375, "learning_rate": 2.704125261098433e-05, "loss": 1.0711069107055664, "num_input_tokens_seen": 6879503168, "step": 24190, "train_runtime": 235686.1825, "train_tokens_per_second": 29189.251 }, { "epoch": 0.8562450382236454, "grad_norm": 1.4921875, "learning_rate": 2.7037298806829586e-05, "loss": 1.0709022521972655, "num_input_tokens_seen": 6882324928, "step": 24200, "train_runtime": 235783.2484, "train_tokens_per_second": 29189.202 }, { "epoch": 0.8565988584873742, "grad_norm": 1.484375, "learning_rate": 2.7033346736469967e-05, "loss": 1.0856159210205079, "num_input_tokens_seen": 6885142784, "step": 24210, "train_runtime": 235879.7707, "train_tokens_per_second": 29189.204 }, { "epoch": 0.8569526787511029, "grad_norm": 1.484375, "learning_rate": 2.702939639863869e-05, "loss": 1.098006820678711, "num_input_tokens_seen": 6888005184, "step": 24220, "train_runtime": 235978.0144, "train_tokens_per_second": 29189.182 }, { "epoch": 0.8573064990148317, "grad_norm": 1.4453125, "learning_rate": 2.7025447792070262e-05, "loss": 1.0786596298217774, "num_input_tokens_seen": 6890802816, "step": 24230, "train_runtime": 236072.4919, "train_tokens_per_second": 29189.351 }, { "epoch": 0.8576603192785605, "grad_norm": 1.484375, "learning_rate": 2.7021500915500493e-05, "loss": 1.0907440185546875, "num_input_tokens_seen": 6893650624, "step": 24240, "train_runtime": 236168.2666, "train_tokens_per_second": 29189.572 }, { "epoch": 0.8580141395422892, "grad_norm": 1.5, "learning_rate": 2.701755576766648e-05, "loss": 1.0735344886779785, "num_input_tokens_seen": 6896463104, "step": 24250, "train_runtime": 236263.0594, "train_tokens_per_second": 29189.765 }, { "epoch": 0.858367959806018, "grad_norm": 1.4609375, "learning_rate": 2.701361234730661e-05, "loss": 1.0826171875, "num_input_tokens_seen": 6899282112, "step": 24260, "train_runtime": 236360.0342, "train_tokens_per_second": 29189.715 }, { "epoch": 0.8587217800697469, "grad_norm": 1.4296875, "learning_rate": 2.700967065316056e-05, "loss": 1.0902681350708008, "num_input_tokens_seen": 6902066688, "step": 24270, "train_runtime": 236452.9146, "train_tokens_per_second": 29190.026 }, { "epoch": 0.8590756003334756, "grad_norm": 1.4921875, "learning_rate": 2.70057306839693e-05, "loss": 1.0699932098388671, "num_input_tokens_seen": 6904942080, "step": 24280, "train_runtime": 236549.7838, "train_tokens_per_second": 29190.228 }, { "epoch": 0.8594294205972044, "grad_norm": 1.421875, "learning_rate": 2.7001792438475076e-05, "loss": 1.081153678894043, "num_input_tokens_seen": 6907759808, "step": 24290, "train_runtime": 236647.7366, "train_tokens_per_second": 29190.052 }, { "epoch": 0.8597832408609332, "grad_norm": 1.5078125, "learning_rate": 2.6997855915421416e-05, "loss": 1.088338565826416, "num_input_tokens_seen": 6910643456, "step": 24300, "train_runtime": 236747.3366, "train_tokens_per_second": 29189.952 }, { "epoch": 0.8601370611246619, "grad_norm": 1.4921875, "learning_rate": 2.6993921113553145e-05, "loss": 1.0780616760253907, "num_input_tokens_seen": 6913510976, "step": 24310, "train_runtime": 236847.6791, "train_tokens_per_second": 29189.693 }, { "epoch": 0.8604908813883907, "grad_norm": 1.5234375, "learning_rate": 2.6989988031616343e-05, "loss": 1.092308521270752, "num_input_tokens_seen": 6916365952, "step": 24320, "train_runtime": 236946.1861, "train_tokens_per_second": 29189.607 }, { "epoch": 0.8608447016521195, "grad_norm": 1.59375, "learning_rate": 2.6986056668358396e-05, "loss": 1.082712745666504, "num_input_tokens_seen": 6919160512, "step": 24330, "train_runtime": 237039.8672, "train_tokens_per_second": 29189.86 }, { "epoch": 0.8611985219158482, "grad_norm": 1.4765625, "learning_rate": 2.6982127022527947e-05, "loss": 1.086615753173828, "num_input_tokens_seen": 6921967232, "step": 24340, "train_runtime": 237133.169, "train_tokens_per_second": 29190.211 }, { "epoch": 0.8615523421795771, "grad_norm": 1.5078125, "learning_rate": 2.697819909287493e-05, "loss": 1.0909248352050782, "num_input_tokens_seen": 6924779200, "step": 24350, "train_runtime": 237228.649, "train_tokens_per_second": 29190.316 }, { "epoch": 0.8619061624433059, "grad_norm": 1.515625, "learning_rate": 2.697427287815053e-05, "loss": 1.0873506546020508, "num_input_tokens_seen": 6927630272, "step": 24360, "train_runtime": 237326.2851, "train_tokens_per_second": 29190.32 }, { "epoch": 0.8622599827070346, "grad_norm": 1.5078125, "learning_rate": 2.6970348377107236e-05, "loss": 1.0783419609069824, "num_input_tokens_seen": 6930432384, "step": 24370, "train_runtime": 237421.5578, "train_tokens_per_second": 29190.409 }, { "epoch": 0.8626138029707634, "grad_norm": 1.4609375, "learning_rate": 2.696642558849877e-05, "loss": 1.0671567916870117, "num_input_tokens_seen": 6933254400, "step": 24380, "train_runtime": 237518.7061, "train_tokens_per_second": 29190.351 }, { "epoch": 0.8629676232344922, "grad_norm": 1.5703125, "learning_rate": 2.696250451108016e-05, "loss": 1.0788722038269043, "num_input_tokens_seen": 6936082688, "step": 24390, "train_runtime": 237614.6022, "train_tokens_per_second": 29190.473 }, { "epoch": 0.8633214434982209, "grad_norm": 1.46875, "learning_rate": 2.6958585143607662e-05, "loss": 1.0786075592041016, "num_input_tokens_seen": 6938952640, "step": 24400, "train_runtime": 237714.6555, "train_tokens_per_second": 29190.26 }, { "epoch": 0.8636752637619497, "grad_norm": 1.53125, "learning_rate": 2.695466748483883e-05, "loss": 1.0840526580810548, "num_input_tokens_seen": 6941816064, "step": 24410, "train_runtime": 237813.728, "train_tokens_per_second": 29190.14 }, { "epoch": 0.8640290840256785, "grad_norm": 1.5, "learning_rate": 2.695075153353247e-05, "loss": 1.0835630416870117, "num_input_tokens_seen": 6944680640, "step": 24420, "train_runtime": 237912.617, "train_tokens_per_second": 29190.048 }, { "epoch": 0.8643829042894073, "grad_norm": 1.546875, "learning_rate": 2.6946837288448646e-05, "loss": 1.098896598815918, "num_input_tokens_seen": 6947518400, "step": 24430, "train_runtime": 238010.1948, "train_tokens_per_second": 29190.003 }, { "epoch": 0.8647367245531361, "grad_norm": 1.515625, "learning_rate": 2.6942924748348684e-05, "loss": 1.069491481781006, "num_input_tokens_seen": 6950360640, "step": 24440, "train_runtime": 238108.9322, "train_tokens_per_second": 29189.836 }, { "epoch": 0.8650905448168649, "grad_norm": 1.4921875, "learning_rate": 2.693901391199517e-05, "loss": 1.087900733947754, "num_input_tokens_seen": 6953204544, "step": 24450, "train_runtime": 238208.6282, "train_tokens_per_second": 29189.558 }, { "epoch": 0.8654443650805936, "grad_norm": 1.4921875, "learning_rate": 2.6935104778151943e-05, "loss": 1.0837324142456055, "num_input_tokens_seen": 6956102976, "step": 24460, "train_runtime": 238308.1457, "train_tokens_per_second": 29189.531 }, { "epoch": 0.8657981853443224, "grad_norm": 1.5078125, "learning_rate": 2.6931197345584102e-05, "loss": 1.0930782318115235, "num_input_tokens_seen": 6958895232, "step": 24470, "train_runtime": 238402.9365, "train_tokens_per_second": 29189.637 }, { "epoch": 0.8661520056080512, "grad_norm": 1.4375, "learning_rate": 2.6927291613058003e-05, "loss": 1.0754700660705567, "num_input_tokens_seen": 6961713088, "step": 24480, "train_runtime": 238498.4904, "train_tokens_per_second": 29189.757 }, { "epoch": 0.8665058258717799, "grad_norm": 1.484375, "learning_rate": 2.6923387579341254e-05, "loss": 1.074538516998291, "num_input_tokens_seen": 6964551872, "step": 24490, "train_runtime": 238592.1189, "train_tokens_per_second": 29190.201 }, { "epoch": 0.8668596461355087, "grad_norm": 1.4921875, "learning_rate": 2.6919485243202693e-05, "loss": 1.075462245941162, "num_input_tokens_seen": 6967388480, "step": 24500, "train_runtime": 238689.6123, "train_tokens_per_second": 29190.162 }, { "epoch": 0.8672134663992375, "grad_norm": 1.4140625, "learning_rate": 2.6915584603412434e-05, "loss": 1.0740318298339844, "num_input_tokens_seen": 6970218048, "step": 24510, "train_runtime": 238785.345, "train_tokens_per_second": 29190.309 }, { "epoch": 0.8675672866629663, "grad_norm": 1.5234375, "learning_rate": 2.6911685658741827e-05, "loss": 1.092128086090088, "num_input_tokens_seen": 6973067072, "step": 24520, "train_runtime": 238884.1443, "train_tokens_per_second": 29190.163 }, { "epoch": 0.8679211069266951, "grad_norm": 1.4765625, "learning_rate": 2.690778840796346e-05, "loss": 1.0855809211730958, "num_input_tokens_seen": 6975971712, "step": 24530, "train_runtime": 238983.7427, "train_tokens_per_second": 29190.152 }, { "epoch": 0.8682749271904239, "grad_norm": 1.46875, "learning_rate": 2.6903892849851175e-05, "loss": 1.0914899826049804, "num_input_tokens_seen": 6978857408, "step": 24540, "train_runtime": 239082.9346, "train_tokens_per_second": 29190.111 }, { "epoch": 0.8686287474541526, "grad_norm": 1.46875, "learning_rate": 2.6899998983180057e-05, "loss": 1.0806451797485352, "num_input_tokens_seen": 6981693952, "step": 24550, "train_runtime": 239179.7049, "train_tokens_per_second": 29190.16 }, { "epoch": 0.8689825677178814, "grad_norm": 1.5078125, "learning_rate": 2.689610680672642e-05, "loss": 1.0807291984558105, "num_input_tokens_seen": 6984531072, "step": 24560, "train_runtime": 239276.1369, "train_tokens_per_second": 29190.253 }, { "epoch": 0.8693363879816102, "grad_norm": 1.4921875, "learning_rate": 2.6892216319267843e-05, "loss": 1.0879636764526368, "num_input_tokens_seen": 6987390016, "step": 24570, "train_runtime": 239374.7435, "train_tokens_per_second": 29190.172 }, { "epoch": 0.8696902082453389, "grad_norm": 1.515625, "learning_rate": 2.6888327519583107e-05, "loss": 1.0862504959106445, "num_input_tokens_seen": 6990256832, "step": 24580, "train_runtime": 239474.2903, "train_tokens_per_second": 29190.01 }, { "epoch": 0.8700440285090677, "grad_norm": 1.46875, "learning_rate": 2.688444040645225e-05, "loss": 1.0749689102172852, "num_input_tokens_seen": 6993125056, "step": 24590, "train_runtime": 239573.6276, "train_tokens_per_second": 29189.878 }, { "epoch": 0.8703978487727966, "grad_norm": 1.4140625, "learning_rate": 2.688055497865654e-05, "loss": 1.09580078125, "num_input_tokens_seen": 6995943936, "step": 24600, "train_runtime": 239668.9823, "train_tokens_per_second": 29190.026 }, { "epoch": 0.8707516690365253, "grad_norm": 1.484375, "learning_rate": 2.6876671234978483e-05, "loss": 1.0815733909606933, "num_input_tokens_seen": 6998836736, "step": 24610, "train_runtime": 239771.7174, "train_tokens_per_second": 29189.584 }, { "epoch": 0.8711054893002541, "grad_norm": 1.4453125, "learning_rate": 2.6872789174201807e-05, "loss": 1.0890100479125977, "num_input_tokens_seen": 7001703360, "step": 24620, "train_runtime": 239871.773, "train_tokens_per_second": 29189.359 }, { "epoch": 0.8714593095639829, "grad_norm": 1.53125, "learning_rate": 2.686890879511147e-05, "loss": 1.0821913719177245, "num_input_tokens_seen": 7004562624, "step": 24630, "train_runtime": 239972.4569, "train_tokens_per_second": 29189.027 }, { "epoch": 0.8718131298277116, "grad_norm": 1.5, "learning_rate": 2.6865030096493665e-05, "loss": 1.0964225769042968, "num_input_tokens_seen": 7007431616, "step": 24640, "train_runtime": 240071.8713, "train_tokens_per_second": 29188.891 }, { "epoch": 0.8721669500914404, "grad_norm": 1.5390625, "learning_rate": 2.6861153077135815e-05, "loss": 1.0850180625915526, "num_input_tokens_seen": 7010275584, "step": 24650, "train_runtime": 240169.036, "train_tokens_per_second": 29188.923 }, { "epoch": 0.8725207703551692, "grad_norm": 1.484375, "learning_rate": 2.6857277735826545e-05, "loss": 1.0880144119262696, "num_input_tokens_seen": 7013106304, "step": 24660, "train_runtime": 240265.1603, "train_tokens_per_second": 29189.027 }, { "epoch": 0.8728745906188979, "grad_norm": 1.46875, "learning_rate": 2.685340407135573e-05, "loss": 1.080960178375244, "num_input_tokens_seen": 7016033600, "step": 24670, "train_runtime": 240368.0185, "train_tokens_per_second": 29188.715 }, { "epoch": 0.8732284108826268, "grad_norm": 1.515625, "learning_rate": 2.6849532082514445e-05, "loss": 1.076182746887207, "num_input_tokens_seen": 7018875776, "step": 24680, "train_runtime": 240465.6459, "train_tokens_per_second": 29188.684 }, { "epoch": 0.8735822311463556, "grad_norm": 1.4921875, "learning_rate": 2.6845661768095005e-05, "loss": 1.075659942626953, "num_input_tokens_seen": 7021816512, "step": 24690, "train_runtime": 240568.7628, "train_tokens_per_second": 29188.397 }, { "epoch": 0.8739360514100843, "grad_norm": 1.5, "learning_rate": 2.6841793126890925e-05, "loss": 1.0824756622314453, "num_input_tokens_seen": 7024625344, "step": 24700, "train_runtime": 240661.7039, "train_tokens_per_second": 29188.796 }, { "epoch": 0.8742898716738131, "grad_norm": 1.4609375, "learning_rate": 2.6837926157696946e-05, "loss": 1.0706636428833007, "num_input_tokens_seen": 7027444544, "step": 24710, "train_runtime": 240760.9186, "train_tokens_per_second": 29188.477 }, { "epoch": 0.8746436919375419, "grad_norm": 1.53125, "learning_rate": 2.6834060859309018e-05, "loss": 1.0804738044738769, "num_input_tokens_seen": 7030291968, "step": 24720, "train_runtime": 240857.1844, "train_tokens_per_second": 29188.633 }, { "epoch": 0.8749975122012706, "grad_norm": 1.4375, "learning_rate": 2.6830197230524317e-05, "loss": 1.0731182098388672, "num_input_tokens_seen": 7033122624, "step": 24730, "train_runtime": 240950.6518, "train_tokens_per_second": 29189.058 }, { "epoch": 0.8753513324649994, "grad_norm": 1.453125, "learning_rate": 2.6826335270141216e-05, "loss": 1.0789525985717774, "num_input_tokens_seen": 7036029120, "step": 24740, "train_runtime": 241053.5898, "train_tokens_per_second": 29188.651 }, { "epoch": 0.8757051527287282, "grad_norm": 1.46875, "learning_rate": 2.6822474976959312e-05, "loss": 1.0889410018920898, "num_input_tokens_seen": 7038888256, "step": 24750, "train_runtime": 241152.9983, "train_tokens_per_second": 29188.475 }, { "epoch": 0.8760589729924569, "grad_norm": 1.515625, "learning_rate": 2.6818616349779397e-05, "loss": 1.0873723030090332, "num_input_tokens_seen": 7041737792, "step": 24760, "train_runtime": 241250.3633, "train_tokens_per_second": 29188.506 }, { "epoch": 0.8764127932561858, "grad_norm": 1.515625, "learning_rate": 2.6814759387403482e-05, "loss": 1.0853837966918944, "num_input_tokens_seen": 7044557952, "step": 24770, "train_runtime": 241349.1278, "train_tokens_per_second": 29188.247 }, { "epoch": 0.8767666135199146, "grad_norm": 1.5078125, "learning_rate": 2.681090408863477e-05, "loss": 1.0883296966552733, "num_input_tokens_seen": 7047406528, "step": 24780, "train_runtime": 241449.3234, "train_tokens_per_second": 29187.932 }, { "epoch": 0.8771204337836433, "grad_norm": 1.4765625, "learning_rate": 2.6807050452277694e-05, "loss": 1.0750125885009765, "num_input_tokens_seen": 7050232384, "step": 24790, "train_runtime": 241544.1102, "train_tokens_per_second": 29188.178 }, { "epoch": 0.8774742540473721, "grad_norm": 1.5, "learning_rate": 2.6803198477137853e-05, "loss": 1.073841667175293, "num_input_tokens_seen": 7053055232, "step": 24800, "train_runtime": 241639.5396, "train_tokens_per_second": 29188.333 }, { "epoch": 0.8778280743111009, "grad_norm": 1.4921875, "learning_rate": 2.6799348162022082e-05, "loss": 1.0776921272277833, "num_input_tokens_seen": 7055884096, "step": 24810, "train_runtime": 241735.9141, "train_tokens_per_second": 29188.398 }, { "epoch": 0.8781818945748296, "grad_norm": 1.46875, "learning_rate": 2.6795499505738397e-05, "loss": 1.0809947013854981, "num_input_tokens_seen": 7058721152, "step": 24820, "train_runtime": 241832.6971, "train_tokens_per_second": 29188.448 }, { "epoch": 0.8785357148385584, "grad_norm": 1.546875, "learning_rate": 2.679165250709601e-05, "loss": 1.0843608856201172, "num_input_tokens_seen": 7061523712, "step": 24830, "train_runtime": 241929.2114, "train_tokens_per_second": 29188.388 }, { "epoch": 0.8788895351022872, "grad_norm": 1.4765625, "learning_rate": 2.678780716490533e-05, "loss": 1.083354377746582, "num_input_tokens_seen": 7064400064, "step": 24840, "train_runtime": 242030.1901, "train_tokens_per_second": 29188.095 }, { "epoch": 0.879243355366016, "grad_norm": 1.484375, "learning_rate": 2.678396347797798e-05, "loss": 1.0801756858825684, "num_input_tokens_seen": 7067241536, "step": 24850, "train_runtime": 242125.585, "train_tokens_per_second": 29188.33 }, { "epoch": 0.8795971756297448, "grad_norm": 1.453125, "learning_rate": 2.6780121445126756e-05, "loss": 1.083262825012207, "num_input_tokens_seen": 7070086080, "step": 24860, "train_runtime": 242222.8888, "train_tokens_per_second": 29188.348 }, { "epoch": 0.8799509958934736, "grad_norm": 1.484375, "learning_rate": 2.6776281065165644e-05, "loss": 1.0719333648681642, "num_input_tokens_seen": 7072959040, "step": 24870, "train_runtime": 242321.6707, "train_tokens_per_second": 29188.306 }, { "epoch": 0.8803048161572024, "grad_norm": 1.4453125, "learning_rate": 2.677244233690983e-05, "loss": 1.083949661254883, "num_input_tokens_seen": 7075815808, "step": 24880, "train_runtime": 242420.6619, "train_tokens_per_second": 29188.171 }, { "epoch": 0.8806586364209311, "grad_norm": 1.53125, "learning_rate": 2.6768605259175694e-05, "loss": 1.080158805847168, "num_input_tokens_seen": 7078660800, "step": 24890, "train_runtime": 242520.2304, "train_tokens_per_second": 29187.919 }, { "epoch": 0.8810124566846599, "grad_norm": 1.5078125, "learning_rate": 2.6764769830780784e-05, "loss": 1.0854487419128418, "num_input_tokens_seen": 7081475520, "step": 24900, "train_runtime": 242613.439, "train_tokens_per_second": 29188.307 }, { "epoch": 0.8813662769483886, "grad_norm": 1.4921875, "learning_rate": 2.6760936050543857e-05, "loss": 1.0771869659423827, "num_input_tokens_seen": 7084299776, "step": 24910, "train_runtime": 242708.6528, "train_tokens_per_second": 29188.493 }, { "epoch": 0.8817200972121174, "grad_norm": 1.5, "learning_rate": 2.675710391728483e-05, "loss": 1.0804795265197753, "num_input_tokens_seen": 7087195264, "step": 24920, "train_runtime": 242808.9221, "train_tokens_per_second": 29188.364 }, { "epoch": 0.8820739174758463, "grad_norm": 1.4921875, "learning_rate": 2.6753273429824822e-05, "loss": 1.090805435180664, "num_input_tokens_seen": 7090094592, "step": 24930, "train_runtime": 242907.5836, "train_tokens_per_second": 29188.445 }, { "epoch": 0.8824277377395751, "grad_norm": 1.5, "learning_rate": 2.6749444586986127e-05, "loss": 1.086817455291748, "num_input_tokens_seen": 7092936384, "step": 24940, "train_runtime": 243004.393, "train_tokens_per_second": 29188.511 }, { "epoch": 0.8827815580033038, "grad_norm": 1.515625, "learning_rate": 2.6745617387592214e-05, "loss": 1.081374168395996, "num_input_tokens_seen": 7095776448, "step": 24950, "train_runtime": 243099.6345, "train_tokens_per_second": 29188.758 }, { "epoch": 0.8831353782670326, "grad_norm": 1.515625, "learning_rate": 2.6741791830467728e-05, "loss": 1.0765195846557618, "num_input_tokens_seen": 7098612160, "step": 24960, "train_runtime": 243196.0411, "train_tokens_per_second": 29188.848 }, { "epoch": 0.8834891985307614, "grad_norm": 1.4140625, "learning_rate": 2.67379679144385e-05, "loss": 1.066823959350586, "num_input_tokens_seen": 7101494464, "step": 24970, "train_runtime": 243294.953, "train_tokens_per_second": 29188.828 }, { "epoch": 0.8838430187944901, "grad_norm": 1.453125, "learning_rate": 2.6734145638331536e-05, "loss": 1.0808423995971679, "num_input_tokens_seen": 7104353216, "step": 24980, "train_runtime": 243394.3763, "train_tokens_per_second": 29188.65 }, { "epoch": 0.8841968390582189, "grad_norm": 1.4765625, "learning_rate": 2.673032500097501e-05, "loss": 1.0944605827331544, "num_input_tokens_seen": 7107186624, "step": 24990, "train_runtime": 243490.1142, "train_tokens_per_second": 29188.81 }, { "epoch": 0.8845506593219477, "grad_norm": 1.5078125, "learning_rate": 2.672650600119826e-05, "loss": 1.0927881240844726, "num_input_tokens_seen": 7110093696, "step": 25000, "train_runtime": 243591.6987, "train_tokens_per_second": 29188.571 }, { "epoch": 0.8845506593219477, "eval_loss": 1.023461103439331, "eval_runtime": 8.4538, "eval_samples_per_second": 471.741, "eval_steps_per_second": 3.785, "num_input_tokens_seen": 7110093696, "step": 25000 }, { "epoch": 0.8849044795856764, "grad_norm": 1.515625, "learning_rate": 2.672268863783181e-05, "loss": 1.0820868492126465, "num_input_tokens_seen": 7112954752, "step": 25010, "train_runtime": 243720.1139, "train_tokens_per_second": 29184.931 }, { "epoch": 0.8852582998494053, "grad_norm": 1.46875, "learning_rate": 2.6718872909707347e-05, "loss": 1.0855422019958496, "num_input_tokens_seen": 7115726848, "step": 25020, "train_runtime": 243811.1186, "train_tokens_per_second": 29185.407 }, { "epoch": 0.8856121201131341, "grad_norm": 1.5, "learning_rate": 2.671505881565772e-05, "loss": 1.0735036849975585, "num_input_tokens_seen": 7118565376, "step": 25030, "train_runtime": 243909.476, "train_tokens_per_second": 29185.276 }, { "epoch": 0.8859659403768628, "grad_norm": 1.5390625, "learning_rate": 2.671124635451696e-05, "loss": 1.0760697364807128, "num_input_tokens_seen": 7121407552, "step": 25040, "train_runtime": 244005.8084, "train_tokens_per_second": 29185.402 }, { "epoch": 0.8863197606405916, "grad_norm": 1.4765625, "learning_rate": 2.6707435525120237e-05, "loss": 1.087644386291504, "num_input_tokens_seen": 7124235968, "step": 25050, "train_runtime": 244103.4799, "train_tokens_per_second": 29185.311 }, { "epoch": 0.8866735809043204, "grad_norm": 1.5078125, "learning_rate": 2.6703626326303906e-05, "loss": 1.0907632827758789, "num_input_tokens_seen": 7127074624, "step": 25060, "train_runtime": 244201.7598, "train_tokens_per_second": 29185.189 }, { "epoch": 0.8870274011680491, "grad_norm": 1.515625, "learning_rate": 2.669981875690547e-05, "loss": 1.084065055847168, "num_input_tokens_seen": 7129976704, "step": 25070, "train_runtime": 244301.3048, "train_tokens_per_second": 29185.177 }, { "epoch": 0.8873812214317779, "grad_norm": 1.453125, "learning_rate": 2.6696012815763604e-05, "loss": 1.0855453491210938, "num_input_tokens_seen": 7132845120, "step": 25080, "train_runtime": 244402.9778, "train_tokens_per_second": 29184.772 }, { "epoch": 0.8877350416955067, "grad_norm": 1.4921875, "learning_rate": 2.669220850171813e-05, "loss": 1.0917444229125977, "num_input_tokens_seen": 7135742464, "step": 25090, "train_runtime": 244502.0565, "train_tokens_per_second": 29184.795 }, { "epoch": 0.8880888619592355, "grad_norm": 1.5, "learning_rate": 2.668840581361003e-05, "loss": 1.0945510864257812, "num_input_tokens_seen": 7138578432, "step": 25100, "train_runtime": 244597.8626, "train_tokens_per_second": 29184.958 }, { "epoch": 0.8884426822229643, "grad_norm": 1.4921875, "learning_rate": 2.668460475028145e-05, "loss": 1.0809709548950195, "num_input_tokens_seen": 7141411008, "step": 25110, "train_runtime": 244694.9135, "train_tokens_per_second": 29184.959 }, { "epoch": 0.8887965024866931, "grad_norm": 1.546875, "learning_rate": 2.6680805310575686e-05, "loss": 1.0810720443725585, "num_input_tokens_seen": 7144279872, "step": 25120, "train_runtime": 244795.5105, "train_tokens_per_second": 29184.685 }, { "epoch": 0.8891503227504218, "grad_norm": 1.515625, "learning_rate": 2.6677007493337164e-05, "loss": 1.075914192199707, "num_input_tokens_seen": 7147075776, "step": 25130, "train_runtime": 244889.5229, "train_tokens_per_second": 29184.898 }, { "epoch": 0.8895041430141506, "grad_norm": 1.5, "learning_rate": 2.6673211297411503e-05, "loss": 1.0719465255737304, "num_input_tokens_seen": 7149911360, "step": 25140, "train_runtime": 244986.1548, "train_tokens_per_second": 29184.961 }, { "epoch": 0.8898579632778794, "grad_norm": 1.546875, "learning_rate": 2.6669416721645447e-05, "loss": 1.0775411605834961, "num_input_tokens_seen": 7152746304, "step": 25150, "train_runtime": 245081.8446, "train_tokens_per_second": 29185.133 }, { "epoch": 0.8902117835416081, "grad_norm": 1.484375, "learning_rate": 2.6665623764886876e-05, "loss": 1.0747762680053712, "num_input_tokens_seen": 7155609408, "step": 25160, "train_runtime": 245181.4255, "train_tokens_per_second": 29184.957 }, { "epoch": 0.8905656038053369, "grad_norm": 1.546875, "learning_rate": 2.6661832425984847e-05, "loss": 1.0630716323852538, "num_input_tokens_seen": 7158470784, "step": 25170, "train_runtime": 245281.5406, "train_tokens_per_second": 29184.711 }, { "epoch": 0.8909194240690658, "grad_norm": 1.4921875, "learning_rate": 2.665804270378953e-05, "loss": 1.0947274208068847, "num_input_tokens_seen": 7161297344, "step": 25180, "train_runtime": 245379.6795, "train_tokens_per_second": 29184.557 }, { "epoch": 0.8912732443327945, "grad_norm": 1.4609375, "learning_rate": 2.665425459715228e-05, "loss": 1.0680038452148437, "num_input_tokens_seen": 7164144192, "step": 25190, "train_runtime": 245478.0936, "train_tokens_per_second": 29184.454 }, { "epoch": 0.8916270645965233, "grad_norm": 1.4140625, "learning_rate": 2.6650468104925547e-05, "loss": 1.0844810485839844, "num_input_tokens_seen": 7167005376, "step": 25200, "train_runtime": 245575.9154, "train_tokens_per_second": 29184.48 }, { "epoch": 0.8919808848602521, "grad_norm": 1.4453125, "learning_rate": 2.664668322596295e-05, "loss": 1.0924552917480468, "num_input_tokens_seen": 7169872000, "step": 25210, "train_runtime": 245676.5425, "train_tokens_per_second": 29184.194 }, { "epoch": 0.8923347051239808, "grad_norm": 1.4609375, "learning_rate": 2.664289995911925e-05, "loss": 1.0814663887023925, "num_input_tokens_seen": 7172743232, "step": 25220, "train_runtime": 245774.7289, "train_tokens_per_second": 29184.218 }, { "epoch": 0.8926885253877096, "grad_norm": 1.5, "learning_rate": 2.6639118303250328e-05, "loss": 1.0901309967041015, "num_input_tokens_seen": 7175549440, "step": 25230, "train_runtime": 245870.464, "train_tokens_per_second": 29184.268 }, { "epoch": 0.8930423456514384, "grad_norm": 1.484375, "learning_rate": 2.663533825721321e-05, "loss": 1.0798226356506349, "num_input_tokens_seen": 7178427264, "step": 25240, "train_runtime": 245973.191, "train_tokens_per_second": 29183.779 }, { "epoch": 0.8933961659151671, "grad_norm": 1.5234375, "learning_rate": 2.6631559819866065e-05, "loss": 1.0817352294921876, "num_input_tokens_seen": 7181239232, "step": 25250, "train_runtime": 246068.3741, "train_tokens_per_second": 29183.918 }, { "epoch": 0.8937499861788959, "grad_norm": 1.4921875, "learning_rate": 2.662778299006819e-05, "loss": 1.0886592864990234, "num_input_tokens_seen": 7184113536, "step": 25260, "train_runtime": 246166.7593, "train_tokens_per_second": 29183.93 }, { "epoch": 0.8941038064426248, "grad_norm": 1.515625, "learning_rate": 2.6624007766680004e-05, "loss": 1.0795515060424805, "num_input_tokens_seen": 7186963200, "step": 25270, "train_runtime": 246262.8267, "train_tokens_per_second": 29184.117 }, { "epoch": 0.8944576267063535, "grad_norm": 1.4765625, "learning_rate": 2.6620234148563066e-05, "loss": 1.0838384628295898, "num_input_tokens_seen": 7189763328, "step": 25280, "train_runtime": 246357.9389, "train_tokens_per_second": 29184.216 }, { "epoch": 0.8948114469700823, "grad_norm": 1.4140625, "learning_rate": 2.6616462134580072e-05, "loss": 1.065964698791504, "num_input_tokens_seen": 7192593280, "step": 25290, "train_runtime": 246455.5212, "train_tokens_per_second": 29184.143 }, { "epoch": 0.8951652672338111, "grad_norm": 1.46875, "learning_rate": 2.6612691723594835e-05, "loss": 1.0664762496948241, "num_input_tokens_seen": 7195397888, "step": 25300, "train_runtime": 246550.8968, "train_tokens_per_second": 29184.229 }, { "epoch": 0.8955190874975398, "grad_norm": 1.484375, "learning_rate": 2.6608922914472283e-05, "loss": 1.0739008903503418, "num_input_tokens_seen": 7198229056, "step": 25310, "train_runtime": 246647.4637, "train_tokens_per_second": 29184.282 }, { "epoch": 0.8958729077612686, "grad_norm": 1.453125, "learning_rate": 2.66051557060785e-05, "loss": 1.0971456527709962, "num_input_tokens_seen": 7200989056, "step": 25320, "train_runtime": 246739.0074, "train_tokens_per_second": 29184.64 }, { "epoch": 0.8962267280249974, "grad_norm": 1.484375, "learning_rate": 2.6601390097280665e-05, "loss": 1.0726150512695312, "num_input_tokens_seen": 7203796608, "step": 25330, "train_runtime": 246835.5655, "train_tokens_per_second": 29184.597 }, { "epoch": 0.8965805482887261, "grad_norm": 1.4453125, "learning_rate": 2.6597626086947097e-05, "loss": 1.0842613220214843, "num_input_tokens_seen": 7206658048, "step": 25340, "train_runtime": 246934.1662, "train_tokens_per_second": 29184.532 }, { "epoch": 0.896934368552455, "grad_norm": 1.4765625, "learning_rate": 2.659386367394722e-05, "loss": 1.0856489181518554, "num_input_tokens_seen": 7209520704, "step": 25350, "train_runtime": 247032.273, "train_tokens_per_second": 29184.53 }, { "epoch": 0.8972881888161838, "grad_norm": 1.5, "learning_rate": 2.65901028571516e-05, "loss": 1.0777853012084961, "num_input_tokens_seen": 7212382976, "step": 25360, "train_runtime": 247130.7074, "train_tokens_per_second": 29184.487 }, { "epoch": 0.8976420090799125, "grad_norm": 1.46875, "learning_rate": 2.6586343635431887e-05, "loss": 1.0753351211547852, "num_input_tokens_seen": 7215223936, "step": 25370, "train_runtime": 247226.8554, "train_tokens_per_second": 29184.629 }, { "epoch": 0.8979958293436413, "grad_norm": 1.5390625, "learning_rate": 2.658258600766088e-05, "loss": 1.0863506317138671, "num_input_tokens_seen": 7218056128, "step": 25380, "train_runtime": 247322.1342, "train_tokens_per_second": 29184.837 }, { "epoch": 0.8983496496073701, "grad_norm": 1.515625, "learning_rate": 2.657882997271247e-05, "loss": 1.0970540046691895, "num_input_tokens_seen": 7220825728, "step": 25390, "train_runtime": 247413.596, "train_tokens_per_second": 29185.242 }, { "epoch": 0.8987034698710988, "grad_norm": 1.453125, "learning_rate": 2.6575075529461685e-05, "loss": 1.0809480667114257, "num_input_tokens_seen": 7223679360, "step": 25400, "train_runtime": 247513.4826, "train_tokens_per_second": 29184.993 }, { "epoch": 0.8990572901348276, "grad_norm": 1.5, "learning_rate": 2.657132267678464e-05, "loss": 1.0871879577636718, "num_input_tokens_seen": 7226557696, "step": 25410, "train_runtime": 247613.1079, "train_tokens_per_second": 29184.875 }, { "epoch": 0.8994111103985564, "grad_norm": 1.484375, "learning_rate": 2.656757141355857e-05, "loss": 1.0866841316223144, "num_input_tokens_seen": 7229419072, "step": 25420, "train_runtime": 247713.6701, "train_tokens_per_second": 29184.579 }, { "epoch": 0.8997649306622852, "grad_norm": 1.4375, "learning_rate": 2.6563821738661833e-05, "loss": 1.076329803466797, "num_input_tokens_seen": 7232323200, "step": 25430, "train_runtime": 247812.5539, "train_tokens_per_second": 29184.652 }, { "epoch": 0.900118750926014, "grad_norm": 1.4296875, "learning_rate": 2.6560073650973873e-05, "loss": 1.0857110023498535, "num_input_tokens_seen": 7235181440, "step": 25440, "train_runtime": 247908.9608, "train_tokens_per_second": 29184.832 }, { "epoch": 0.9004725711897428, "grad_norm": 1.484375, "learning_rate": 2.655632714937525e-05, "loss": 1.0765920639038087, "num_input_tokens_seen": 7238069568, "step": 25450, "train_runtime": 248008.5125, "train_tokens_per_second": 29184.763 }, { "epoch": 0.9008263914534715, "grad_norm": 1.5234375, "learning_rate": 2.6552582232747637e-05, "loss": 1.0810518264770508, "num_input_tokens_seen": 7240984192, "step": 25460, "train_runtime": 248109.8195, "train_tokens_per_second": 29184.593 }, { "epoch": 0.9011802117172003, "grad_norm": 1.53125, "learning_rate": 2.6548838899973794e-05, "loss": 1.082456398010254, "num_input_tokens_seen": 7243801856, "step": 25470, "train_runtime": 248205.6738, "train_tokens_per_second": 29184.675 }, { "epoch": 0.9015340319809291, "grad_norm": 1.5078125, "learning_rate": 2.6545097149937598e-05, "loss": 1.0678675651550293, "num_input_tokens_seen": 7246685504, "step": 25480, "train_runtime": 248307.6994, "train_tokens_per_second": 29184.296 }, { "epoch": 0.9018878522446578, "grad_norm": 1.53125, "learning_rate": 2.6541356981524018e-05, "loss": 1.082634162902832, "num_input_tokens_seen": 7249484288, "step": 25490, "train_runtime": 248403.2319, "train_tokens_per_second": 29184.34 }, { "epoch": 0.9022416725083866, "grad_norm": 1.5703125, "learning_rate": 2.653761839361913e-05, "loss": 1.079379940032959, "num_input_tokens_seen": 7252360000, "step": 25500, "train_runtime": 248502.5914, "train_tokens_per_second": 29184.243 }, { "epoch": 0.9025954927721154, "grad_norm": 1.5, "learning_rate": 2.6533881385110097e-05, "loss": 1.076802635192871, "num_input_tokens_seen": 7255188736, "step": 25510, "train_runtime": 248598.4963, "train_tokens_per_second": 29184.363 }, { "epoch": 0.9029493130358442, "grad_norm": 1.5546875, "learning_rate": 2.6530145954885187e-05, "loss": 1.0867416381835937, "num_input_tokens_seen": 7258065280, "step": 25520, "train_runtime": 248697.0814, "train_tokens_per_second": 29184.361 }, { "epoch": 0.903303133299573, "grad_norm": 1.5078125, "learning_rate": 2.6526412101833764e-05, "loss": 1.087068748474121, "num_input_tokens_seen": 7260926016, "step": 25530, "train_runtime": 248794.1386, "train_tokens_per_second": 29184.474 }, { "epoch": 0.9036569535633018, "grad_norm": 1.46875, "learning_rate": 2.6522679824846287e-05, "loss": 1.0725414276123046, "num_input_tokens_seen": 7263808640, "step": 25540, "train_runtime": 248892.3637, "train_tokens_per_second": 29184.538 }, { "epoch": 0.9040107738270305, "grad_norm": 1.4609375, "learning_rate": 2.6518949122814297e-05, "loss": 1.064630889892578, "num_input_tokens_seen": 7266746560, "step": 25550, "train_runtime": 248993.3164, "train_tokens_per_second": 29184.504 }, { "epoch": 0.9043645940907593, "grad_norm": 1.4609375, "learning_rate": 2.651521999463043e-05, "loss": 1.0855447769165039, "num_input_tokens_seen": 7269593280, "step": 25560, "train_runtime": 249093.0018, "train_tokens_per_second": 29184.253 }, { "epoch": 0.9047184143544881, "grad_norm": 1.5234375, "learning_rate": 2.651149243918842e-05, "loss": 1.0834228515625, "num_input_tokens_seen": 7272358272, "step": 25570, "train_runtime": 249183.6601, "train_tokens_per_second": 29184.732 }, { "epoch": 0.9050722346182168, "grad_norm": 1.453125, "learning_rate": 2.650776645538308e-05, "loss": 1.083333396911621, "num_input_tokens_seen": 7275191680, "step": 25580, "train_runtime": 249279.9882, "train_tokens_per_second": 29184.82 }, { "epoch": 0.9054260548819456, "grad_norm": 1.46875, "learning_rate": 2.650404204211032e-05, "loss": 1.0843095779418945, "num_input_tokens_seen": 7278065728, "step": 25590, "train_runtime": 249378.1278, "train_tokens_per_second": 29184.86 }, { "epoch": 0.9057798751456745, "grad_norm": 1.484375, "learning_rate": 2.6500319198267126e-05, "loss": 1.0793691635131837, "num_input_tokens_seen": 7280872960, "step": 25600, "train_runtime": 249474.7743, "train_tokens_per_second": 29184.806 }, { "epoch": 0.9061336954094033, "grad_norm": 1.5625, "learning_rate": 2.6496597922751572e-05, "loss": 1.091477394104004, "num_input_tokens_seen": 7283647360, "step": 25610, "train_runtime": 249567.9253, "train_tokens_per_second": 29185.03 }, { "epoch": 0.906487515673132, "grad_norm": 1.5234375, "learning_rate": 2.6492878214462818e-05, "loss": 1.077634048461914, "num_input_tokens_seen": 7286489344, "step": 25620, "train_runtime": 249666.6195, "train_tokens_per_second": 29184.876 }, { "epoch": 0.9068413359368608, "grad_norm": 1.453125, "learning_rate": 2.648916007230109e-05, "loss": 1.0741587638854981, "num_input_tokens_seen": 7289338816, "step": 25630, "train_runtime": 249760.3702, "train_tokens_per_second": 29185.33 }, { "epoch": 0.9071951562005895, "grad_norm": 1.53125, "learning_rate": 2.6485443495167722e-05, "loss": 1.0661139488220215, "num_input_tokens_seen": 7292164416, "step": 25640, "train_runtime": 249855.4223, "train_tokens_per_second": 29185.536 }, { "epoch": 0.9075489764643183, "grad_norm": 1.53125, "learning_rate": 2.6481728481965102e-05, "loss": 1.0773960113525392, "num_input_tokens_seen": 7295053952, "step": 25650, "train_runtime": 249957.271, "train_tokens_per_second": 29185.204 }, { "epoch": 0.9079027967280471, "grad_norm": 1.5078125, "learning_rate": 2.6478015031596705e-05, "loss": 1.0822235107421876, "num_input_tokens_seen": 7297896512, "step": 25660, "train_runtime": 250054.115, "train_tokens_per_second": 29185.269 }, { "epoch": 0.9082566169917758, "grad_norm": 1.515625, "learning_rate": 2.6474303142967076e-05, "loss": 1.0850409507751464, "num_input_tokens_seen": 7300728320, "step": 25670, "train_runtime": 250150.6804, "train_tokens_per_second": 29185.323 }, { "epoch": 0.9086104372555047, "grad_norm": 1.46875, "learning_rate": 2.6470592814981852e-05, "loss": 1.0878046989440917, "num_input_tokens_seen": 7303594368, "step": 25680, "train_runtime": 250250.4739, "train_tokens_per_second": 29185.137 }, { "epoch": 0.9089642575192335, "grad_norm": 1.5390625, "learning_rate": 2.6466884046547725e-05, "loss": 1.0865326881408692, "num_input_tokens_seen": 7306414336, "step": 25690, "train_runtime": 250346.8912, "train_tokens_per_second": 29185.161 }, { "epoch": 0.9093180777829623, "grad_norm": 1.46875, "learning_rate": 2.646317683657247e-05, "loss": 1.087425708770752, "num_input_tokens_seen": 7309275328, "step": 25700, "train_runtime": 250445.6595, "train_tokens_per_second": 29185.075 }, { "epoch": 0.909671898046691, "grad_norm": 1.546875, "learning_rate": 2.645947118396491e-05, "loss": 1.0775270462036133, "num_input_tokens_seen": 7312084864, "step": 25710, "train_runtime": 250540.256, "train_tokens_per_second": 29185.269 }, { "epoch": 0.9100257183104198, "grad_norm": 1.5703125, "learning_rate": 2.6455767087634982e-05, "loss": 1.0788516998291016, "num_input_tokens_seen": 7314917504, "step": 25720, "train_runtime": 250638.7772, "train_tokens_per_second": 29185.099 }, { "epoch": 0.9103795385741486, "grad_norm": 1.5625, "learning_rate": 2.6452064546493642e-05, "loss": 1.0912677764892578, "num_input_tokens_seen": 7317741568, "step": 25730, "train_runtime": 250736.0017, "train_tokens_per_second": 29185.045 }, { "epoch": 0.9107333588378773, "grad_norm": 1.4765625, "learning_rate": 2.644836355945295e-05, "loss": 1.0868235588073731, "num_input_tokens_seen": 7320575360, "step": 25740, "train_runtime": 250831.9924, "train_tokens_per_second": 29185.174 }, { "epoch": 0.9110871791016061, "grad_norm": 1.453125, "learning_rate": 2.6444664125426012e-05, "loss": 1.0838855743408202, "num_input_tokens_seen": 7323435072, "step": 25750, "train_runtime": 250929.8307, "train_tokens_per_second": 29185.191 }, { "epoch": 0.9114409993653348, "grad_norm": 1.515625, "learning_rate": 2.6440966243326985e-05, "loss": 1.0764616966247558, "num_input_tokens_seen": 7326340928, "step": 25760, "train_runtime": 251029.6234, "train_tokens_per_second": 29185.165 }, { "epoch": 0.9117948196290637, "grad_norm": 1.4296875, "learning_rate": 2.6437269912071132e-05, "loss": 1.0859882354736328, "num_input_tokens_seen": 7329211904, "step": 25770, "train_runtime": 251130.7837, "train_tokens_per_second": 29184.841 }, { "epoch": 0.9121486398927925, "grad_norm": 1.3984375, "learning_rate": 2.6433575130574732e-05, "loss": 1.0698867797851563, "num_input_tokens_seen": 7332064704, "step": 25780, "train_runtime": 251230.9046, "train_tokens_per_second": 29184.565 }, { "epoch": 0.9125024601565213, "grad_norm": 1.4453125, "learning_rate": 2.6429881897755154e-05, "loss": 1.0742000579833983, "num_input_tokens_seen": 7334932160, "step": 25790, "train_runtime": 251327.6775, "train_tokens_per_second": 29184.737 }, { "epoch": 0.91285628042025, "grad_norm": 1.453125, "learning_rate": 2.6426190212530806e-05, "loss": 1.0767349243164062, "num_input_tokens_seen": 7337747072, "step": 25800, "train_runtime": 251422.4495, "train_tokens_per_second": 29184.932 }, { "epoch": 0.9132101006839788, "grad_norm": 1.4609375, "learning_rate": 2.6422500073821168e-05, "loss": 1.0791378021240234, "num_input_tokens_seen": 7340579904, "step": 25810, "train_runtime": 251518.8808, "train_tokens_per_second": 29185.005 }, { "epoch": 0.9135639209477076, "grad_norm": 1.515625, "learning_rate": 2.6418811480546757e-05, "loss": 1.0746797561645507, "num_input_tokens_seen": 7343382400, "step": 25820, "train_runtime": 251615.3851, "train_tokens_per_second": 29184.95 }, { "epoch": 0.9139177412114363, "grad_norm": 1.46875, "learning_rate": 2.641512443162917e-05, "loss": 1.083230209350586, "num_input_tokens_seen": 7346285056, "step": 25830, "train_runtime": 251716.8142, "train_tokens_per_second": 29184.721 }, { "epoch": 0.9142715614751651, "grad_norm": 1.4765625, "learning_rate": 2.6411438925991034e-05, "loss": 1.0928114891052245, "num_input_tokens_seen": 7349125248, "step": 25840, "train_runtime": 251815.6639, "train_tokens_per_second": 29184.544 }, { "epoch": 0.914625381738894, "grad_norm": 1.5390625, "learning_rate": 2.6407754962556046e-05, "loss": 1.0763283729553224, "num_input_tokens_seen": 7351978560, "step": 25850, "train_runtime": 251910.7933, "train_tokens_per_second": 29184.849 }, { "epoch": 0.9149792020026227, "grad_norm": 1.5390625, "learning_rate": 2.640407254024894e-05, "loss": 1.0778742790222169, "num_input_tokens_seen": 7354887424, "step": 25860, "train_runtime": 252011.3396, "train_tokens_per_second": 29184.748 }, { "epoch": 0.9153330222663515, "grad_norm": 1.5546875, "learning_rate": 2.640039165799551e-05, "loss": 1.0742226600646974, "num_input_tokens_seen": 7357754112, "step": 25870, "train_runtime": 252109.3592, "train_tokens_per_second": 29184.772 }, { "epoch": 0.9156868425300803, "grad_norm": 1.5546875, "learning_rate": 2.6396712314722586e-05, "loss": 1.0778573989868163, "num_input_tokens_seen": 7360567936, "step": 25880, "train_runtime": 252206.5726, "train_tokens_per_second": 29184.679 }, { "epoch": 0.916040662793809, "grad_norm": 1.453125, "learning_rate": 2.6393034509358054e-05, "loss": 1.076102066040039, "num_input_tokens_seen": 7363417344, "step": 25890, "train_runtime": 252305.5533, "train_tokens_per_second": 29184.523 }, { "epoch": 0.9163944830575378, "grad_norm": 1.46875, "learning_rate": 2.6389358240830854e-05, "loss": 1.0896738052368165, "num_input_tokens_seen": 7366247552, "step": 25900, "train_runtime": 252400.7703, "train_tokens_per_second": 29184.727 }, { "epoch": 0.9167483033212666, "grad_norm": 1.5078125, "learning_rate": 2.6385683508070942e-05, "loss": 1.0849623680114746, "num_input_tokens_seen": 7369084736, "step": 25910, "train_runtime": 252497.4335, "train_tokens_per_second": 29184.791 }, { "epoch": 0.9171021235849953, "grad_norm": 1.4609375, "learning_rate": 2.6382010310009335e-05, "loss": 1.0704755783081055, "num_input_tokens_seen": 7371948800, "step": 25920, "train_runtime": 252596.0576, "train_tokens_per_second": 29184.734 }, { "epoch": 0.9174559438487242, "grad_norm": 1.46875, "learning_rate": 2.63783386455781e-05, "loss": 1.0822740554809571, "num_input_tokens_seen": 7374769472, "step": 25930, "train_runtime": 252690.7873, "train_tokens_per_second": 29184.956 }, { "epoch": 0.917809764112453, "grad_norm": 1.5546875, "learning_rate": 2.637466851371032e-05, "loss": 1.0856513023376464, "num_input_tokens_seen": 7377641152, "step": 25940, "train_runtime": 252790.7288, "train_tokens_per_second": 29184.777 }, { "epoch": 0.9181635843761817, "grad_norm": 1.5, "learning_rate": 2.637099991334015e-05, "loss": 1.0730134963989257, "num_input_tokens_seen": 7380539456, "step": 25950, "train_runtime": 252891.9438, "train_tokens_per_second": 29184.557 }, { "epoch": 0.9185174046399105, "grad_norm": 1.5078125, "learning_rate": 2.636733284340275e-05, "loss": 1.0824790000915527, "num_input_tokens_seen": 7383350272, "step": 25960, "train_runtime": 252986.7885, "train_tokens_per_second": 29184.727 }, { "epoch": 0.9188712249036393, "grad_norm": 1.40625, "learning_rate": 2.6363667302834326e-05, "loss": 1.071113681793213, "num_input_tokens_seen": 7386183232, "step": 25970, "train_runtime": 253083.3117, "train_tokens_per_second": 29184.79 }, { "epoch": 0.919225045167368, "grad_norm": 1.515625, "learning_rate": 2.636000329057214e-05, "loss": 1.0770376205444336, "num_input_tokens_seen": 7389062656, "step": 25980, "train_runtime": 253183.5693, "train_tokens_per_second": 29184.606 }, { "epoch": 0.9195788654310968, "grad_norm": 1.46875, "learning_rate": 2.6356340805554452e-05, "loss": 1.0821327209472655, "num_input_tokens_seen": 7391905792, "step": 25990, "train_runtime": 253281.6365, "train_tokens_per_second": 29184.531 }, { "epoch": 0.9199326856948256, "grad_norm": 1.53125, "learning_rate": 2.635267984672058e-05, "loss": 1.0727310180664062, "num_input_tokens_seen": 7394704704, "step": 26000, "train_runtime": 253375.7886, "train_tokens_per_second": 29184.733 }, { "epoch": 0.9202865059585543, "grad_norm": 1.5078125, "learning_rate": 2.6349020413010862e-05, "loss": 1.085969829559326, "num_input_tokens_seen": 7397520192, "step": 26010, "train_runtime": 253472.108, "train_tokens_per_second": 29184.75 }, { "epoch": 0.9206403262222832, "grad_norm": 1.4453125, "learning_rate": 2.6345362503366676e-05, "loss": 1.0866451263427734, "num_input_tokens_seen": 7400370176, "step": 26020, "train_runtime": 253572.4413, "train_tokens_per_second": 29184.442 }, { "epoch": 0.920994146486012, "grad_norm": 1.546875, "learning_rate": 2.634170611673042e-05, "loss": 1.0759344100952148, "num_input_tokens_seen": 7403118144, "step": 26030, "train_runtime": 253665.2455, "train_tokens_per_second": 29184.598 }, { "epoch": 0.9213479667497407, "grad_norm": 1.546875, "learning_rate": 2.6338051252045516e-05, "loss": 1.064386749267578, "num_input_tokens_seen": 7405969792, "step": 26040, "train_runtime": 253764.8145, "train_tokens_per_second": 29184.384 }, { "epoch": 0.9217017870134695, "grad_norm": 1.4609375, "learning_rate": 2.6334397908256412e-05, "loss": 1.0717890739440918, "num_input_tokens_seen": 7408837952, "step": 26050, "train_runtime": 253861.1274, "train_tokens_per_second": 29184.61 }, { "epoch": 0.9220556072771983, "grad_norm": 1.5390625, "learning_rate": 2.63307460843086e-05, "loss": 1.0824569702148437, "num_input_tokens_seen": 7411620864, "step": 26060, "train_runtime": 253954.7688, "train_tokens_per_second": 29184.807 }, { "epoch": 0.922409427540927, "grad_norm": 1.4140625, "learning_rate": 2.6327095779148576e-05, "loss": 1.0916525840759277, "num_input_tokens_seen": 7414539200, "step": 26070, "train_runtime": 254057.2273, "train_tokens_per_second": 29184.524 }, { "epoch": 0.9227632478046558, "grad_norm": 1.5, "learning_rate": 2.6323446991723856e-05, "loss": 1.0695180892944336, "num_input_tokens_seen": 7417369856, "step": 26080, "train_runtime": 254150.8479, "train_tokens_per_second": 29184.911 }, { "epoch": 0.9231170680683846, "grad_norm": 1.5390625, "learning_rate": 2.6319799720982985e-05, "loss": 1.0762442588806151, "num_input_tokens_seen": 7420172992, "step": 26090, "train_runtime": 254246.8087, "train_tokens_per_second": 29184.921 }, { "epoch": 0.9234708883321134, "grad_norm": 1.4921875, "learning_rate": 2.6316153965875527e-05, "loss": 1.0815706253051758, "num_input_tokens_seen": 7422991104, "step": 26100, "train_runtime": 254342.3119, "train_tokens_per_second": 29185.042 }, { "epoch": 0.9238247085958422, "grad_norm": 1.5234375, "learning_rate": 2.6312509725352074e-05, "loss": 1.082437515258789, "num_input_tokens_seen": 7425821120, "step": 26110, "train_runtime": 254440.5942, "train_tokens_per_second": 29184.891 }, { "epoch": 0.924178528859571, "grad_norm": 1.46875, "learning_rate": 2.6308866998364208e-05, "loss": 1.0699711799621583, "num_input_tokens_seen": 7428651392, "step": 26120, "train_runtime": 254535.9423, "train_tokens_per_second": 29185.078 }, { "epoch": 0.9245323491232997, "grad_norm": 1.484375, "learning_rate": 2.6305225783864556e-05, "loss": 1.0834810256958007, "num_input_tokens_seen": 7431515456, "step": 26130, "train_runtime": 254633.8743, "train_tokens_per_second": 29185.101 }, { "epoch": 0.9248861693870285, "grad_norm": 1.5078125, "learning_rate": 2.6301586080806734e-05, "loss": 1.0833247184753418, "num_input_tokens_seen": 7434345792, "step": 26140, "train_runtime": 254733.6062, "train_tokens_per_second": 29184.786 }, { "epoch": 0.9252399896507573, "grad_norm": 1.546875, "learning_rate": 2.6297947888145395e-05, "loss": 1.0645605087280274, "num_input_tokens_seen": 7437112960, "step": 26150, "train_runtime": 254826.4131, "train_tokens_per_second": 29185.016 }, { "epoch": 0.925593809914486, "grad_norm": 1.4609375, "learning_rate": 2.6294311204836185e-05, "loss": 1.080024814605713, "num_input_tokens_seen": 7440015104, "step": 26160, "train_runtime": 254926.1042, "train_tokens_per_second": 29184.987 }, { "epoch": 0.9259476301782148, "grad_norm": 1.4765625, "learning_rate": 2.6290676029835777e-05, "loss": 1.0686896324157715, "num_input_tokens_seen": 7442824320, "step": 26170, "train_runtime": 255021.3657, "train_tokens_per_second": 29185.101 }, { "epoch": 0.9263014504419437, "grad_norm": 1.4609375, "learning_rate": 2.6287042362101834e-05, "loss": 1.0828365325927733, "num_input_tokens_seen": 7445649280, "step": 26180, "train_runtime": 255116.0164, "train_tokens_per_second": 29185.346 }, { "epoch": 0.9266552707056724, "grad_norm": 1.3984375, "learning_rate": 2.628341020059304e-05, "loss": 1.0752599716186524, "num_input_tokens_seen": 7448544256, "step": 26190, "train_runtime": 255218.2302, "train_tokens_per_second": 29185.001 }, { "epoch": 0.9270090909694012, "grad_norm": 1.484375, "learning_rate": 2.627977954426909e-05, "loss": 1.0848546981811524, "num_input_tokens_seen": 7451411648, "step": 26200, "train_runtime": 255317.9095, "train_tokens_per_second": 29184.837 }, { "epoch": 0.92736291123313, "grad_norm": 1.515625, "learning_rate": 2.627615039209067e-05, "loss": 1.085745906829834, "num_input_tokens_seen": 7454233792, "step": 26210, "train_runtime": 255413.6951, "train_tokens_per_second": 29184.942 }, { "epoch": 0.9277167314968587, "grad_norm": 1.4921875, "learning_rate": 2.6272522743019483e-05, "loss": 1.0798236846923828, "num_input_tokens_seen": 7457067968, "step": 26220, "train_runtime": 255512.8286, "train_tokens_per_second": 29184.711 }, { "epoch": 0.9280705517605875, "grad_norm": 1.4609375, "learning_rate": 2.6268896596018234e-05, "loss": 1.068924903869629, "num_input_tokens_seen": 7459882048, "step": 26230, "train_runtime": 255606.4221, "train_tokens_per_second": 29185.034 }, { "epoch": 0.9284243720243163, "grad_norm": 1.484375, "learning_rate": 2.6265271950050624e-05, "loss": 1.0713335990905761, "num_input_tokens_seen": 7462726464, "step": 26240, "train_runtime": 255703.6777, "train_tokens_per_second": 29185.057 }, { "epoch": 0.928778192288045, "grad_norm": 1.5, "learning_rate": 2.626164880408136e-05, "loss": 1.073418426513672, "num_input_tokens_seen": 7465592512, "step": 26250, "train_runtime": 255801.7036, "train_tokens_per_second": 29185.077 }, { "epoch": 0.9291320125517738, "grad_norm": 1.484375, "learning_rate": 2.6258027157076137e-05, "loss": 1.078279685974121, "num_input_tokens_seen": 7468436288, "step": 26260, "train_runtime": 255900.3095, "train_tokens_per_second": 29184.944 }, { "epoch": 0.9294858328155027, "grad_norm": 1.53125, "learning_rate": 2.625440700800167e-05, "loss": 1.0788238525390625, "num_input_tokens_seen": 7471270400, "step": 26270, "train_runtime": 255998.3517, "train_tokens_per_second": 29184.838 }, { "epoch": 0.9298396530792314, "grad_norm": 1.5, "learning_rate": 2.6250788355825646e-05, "loss": 1.0796710968017578, "num_input_tokens_seen": 7474175040, "step": 26280, "train_runtime": 256099.8839, "train_tokens_per_second": 29184.609 }, { "epoch": 0.9301934733429602, "grad_norm": 1.4765625, "learning_rate": 2.6247171199516767e-05, "loss": 1.0876428604125976, "num_input_tokens_seen": 7477086272, "step": 26290, "train_runtime": 256201.0517, "train_tokens_per_second": 29184.448 }, { "epoch": 0.930547293606689, "grad_norm": 1.4296875, "learning_rate": 2.6243555538044717e-05, "loss": 1.081110382080078, "num_input_tokens_seen": 7479947072, "step": 26300, "train_runtime": 256299.7458, "train_tokens_per_second": 29184.372 }, { "epoch": 0.9309011138704177, "grad_norm": 1.4921875, "learning_rate": 2.6239941370380184e-05, "loss": 1.0841760635375977, "num_input_tokens_seen": 7482773952, "step": 26310, "train_runtime": 256396.3876, "train_tokens_per_second": 29184.397 }, { "epoch": 0.9312549341341465, "grad_norm": 1.5546875, "learning_rate": 2.6236328695494834e-05, "loss": 1.0706096649169923, "num_input_tokens_seen": 7485591360, "step": 26320, "train_runtime": 256490.795, "train_tokens_per_second": 29184.639 }, { "epoch": 0.9316087543978753, "grad_norm": 1.5078125, "learning_rate": 2.6232717512361343e-05, "loss": 1.0788137435913085, "num_input_tokens_seen": 7488479360, "step": 26330, "train_runtime": 256590.7314, "train_tokens_per_second": 29184.528 }, { "epoch": 0.931962574661604, "grad_norm": 1.5234375, "learning_rate": 2.6229107819953357e-05, "loss": 1.0879730224609374, "num_input_tokens_seen": 7491326208, "step": 26340, "train_runtime": 256687.8165, "train_tokens_per_second": 29184.58 }, { "epoch": 0.9323163949253329, "grad_norm": 1.46875, "learning_rate": 2.6225499617245525e-05, "loss": 1.0781933784484863, "num_input_tokens_seen": 7494171328, "step": 26350, "train_runtime": 256782.7283, "train_tokens_per_second": 29184.873 }, { "epoch": 0.9326702151890617, "grad_norm": 1.4609375, "learning_rate": 2.6221892903213473e-05, "loss": 1.0975550651550292, "num_input_tokens_seen": 7496991168, "step": 26360, "train_runtime": 256878.9263, "train_tokens_per_second": 29184.921 }, { "epoch": 0.9330240354527904, "grad_norm": 1.5859375, "learning_rate": 2.621828767683382e-05, "loss": 1.0849864959716797, "num_input_tokens_seen": 7499831552, "step": 26370, "train_runtime": 256977.6567, "train_tokens_per_second": 29184.761 }, { "epoch": 0.9333778557165192, "grad_norm": 1.515625, "learning_rate": 2.6214683937084162e-05, "loss": 1.0859233856201171, "num_input_tokens_seen": 7502663936, "step": 26380, "train_runtime": 257073.1286, "train_tokens_per_second": 29184.94 }, { "epoch": 0.933731675980248, "grad_norm": 1.53125, "learning_rate": 2.621108168294309e-05, "loss": 1.0787812232971192, "num_input_tokens_seen": 7505471744, "step": 26390, "train_runtime": 257167.4091, "train_tokens_per_second": 29185.159 }, { "epoch": 0.9340854962439767, "grad_norm": 1.46875, "learning_rate": 2.620748091339016e-05, "loss": 1.0715045928955078, "num_input_tokens_seen": 7508353152, "step": 26400, "train_runtime": 257261.9127, "train_tokens_per_second": 29185.638 }, { "epoch": 0.9344393165077055, "grad_norm": 1.5390625, "learning_rate": 2.620388162740593e-05, "loss": 1.0859477043151855, "num_input_tokens_seen": 7511148928, "step": 26410, "train_runtime": 257356.6009, "train_tokens_per_second": 29185.764 }, { "epoch": 0.9347931367714343, "grad_norm": 1.5234375, "learning_rate": 2.620028382397192e-05, "loss": 1.0769970893859864, "num_input_tokens_seen": 7514030912, "step": 26420, "train_runtime": 257455.7774, "train_tokens_per_second": 29185.715 }, { "epoch": 0.9351469570351632, "grad_norm": 1.515625, "learning_rate": 2.6196687502070645e-05, "loss": 1.0977009773254394, "num_input_tokens_seen": 7516908224, "step": 26430, "train_runtime": 257553.8307, "train_tokens_per_second": 29185.775 }, { "epoch": 0.9355007772988919, "grad_norm": 1.453125, "learning_rate": 2.6193092660685577e-05, "loss": 1.0683977127075195, "num_input_tokens_seen": 7519726528, "step": 26440, "train_runtime": 257646.3918, "train_tokens_per_second": 29186.229 }, { "epoch": 0.9358545975626207, "grad_norm": 1.6484375, "learning_rate": 2.618949929880118e-05, "loss": 1.076093578338623, "num_input_tokens_seen": 7522534016, "step": 26450, "train_runtime": 257742.7845, "train_tokens_per_second": 29186.206 }, { "epoch": 0.9362084178263494, "grad_norm": 1.46875, "learning_rate": 2.618590741540289e-05, "loss": 1.0674578666687011, "num_input_tokens_seen": 7525328512, "step": 26460, "train_runtime": 257835.0832, "train_tokens_per_second": 29186.596 }, { "epoch": 0.9365622380900782, "grad_norm": 1.453125, "learning_rate": 2.6182317009477104e-05, "loss": 1.0867802619934082, "num_input_tokens_seen": 7528202048, "step": 26470, "train_runtime": 257933.6429, "train_tokens_per_second": 29186.584 }, { "epoch": 0.936916058353807, "grad_norm": 1.5, "learning_rate": 2.617872808001122e-05, "loss": 1.0810303688049316, "num_input_tokens_seen": 7531066304, "step": 26480, "train_runtime": 258031.5273, "train_tokens_per_second": 29186.613 }, { "epoch": 0.9372698786175357, "grad_norm": 1.4765625, "learning_rate": 2.6175140625993583e-05, "loss": 1.077030849456787, "num_input_tokens_seen": 7533873984, "step": 26490, "train_runtime": 258126.6617, "train_tokens_per_second": 29186.733 }, { "epoch": 0.9376236988812645, "grad_norm": 1.4453125, "learning_rate": 2.6171554646413508e-05, "loss": 1.067174243927002, "num_input_tokens_seen": 7536732416, "step": 26500, "train_runtime": 258224.9788, "train_tokens_per_second": 29186.69 }, { "epoch": 0.9379775191449934, "grad_norm": 1.5234375, "learning_rate": 2.61679701402613e-05, "loss": 1.080540084838867, "num_input_tokens_seen": 7539570496, "step": 26510, "train_runtime": 258323.5943, "train_tokens_per_second": 29186.534 }, { "epoch": 0.9383313394087222, "grad_norm": 1.546875, "learning_rate": 2.6164387106528197e-05, "loss": 1.0905363082885742, "num_input_tokens_seen": 7542419776, "step": 26520, "train_runtime": 258423.1647, "train_tokens_per_second": 29186.315 }, { "epoch": 0.9386851596724509, "grad_norm": 1.46875, "learning_rate": 2.6160805544206447e-05, "loss": 1.076739501953125, "num_input_tokens_seen": 7545247616, "step": 26530, "train_runtime": 258520.7841, "train_tokens_per_second": 29186.232 }, { "epoch": 0.9390389799361797, "grad_norm": 1.5390625, "learning_rate": 2.6157225452289223e-05, "loss": 1.0900687217712401, "num_input_tokens_seen": 7548103680, "step": 26540, "train_runtime": 258616.2377, "train_tokens_per_second": 29186.503 }, { "epoch": 0.9393928001999085, "grad_norm": 1.5078125, "learning_rate": 2.6153646829770696e-05, "loss": 1.064324188232422, "num_input_tokens_seen": 7550937152, "step": 26550, "train_runtime": 258713.8921, "train_tokens_per_second": 29186.439 }, { "epoch": 0.9397466204636372, "grad_norm": 1.4609375, "learning_rate": 2.6150069675645972e-05, "loss": 1.0771010398864747, "num_input_tokens_seen": 7553826304, "step": 26560, "train_runtime": 258814.7094, "train_tokens_per_second": 29186.233 }, { "epoch": 0.940100440727366, "grad_norm": 1.4921875, "learning_rate": 2.6146493988911137e-05, "loss": 1.0769364356994628, "num_input_tokens_seen": 7556638656, "step": 26570, "train_runtime": 258909.1224, "train_tokens_per_second": 29186.452 }, { "epoch": 0.9404542609910947, "grad_norm": 1.5625, "learning_rate": 2.6142919768563224e-05, "loss": 1.0838316917419433, "num_input_tokens_seen": 7559477248, "step": 26580, "train_runtime": 259005.4121, "train_tokens_per_second": 29186.561 }, { "epoch": 0.9408080812548235, "grad_norm": 1.421875, "learning_rate": 2.613934701360024e-05, "loss": 1.085238552093506, "num_input_tokens_seen": 7562282368, "step": 26590, "train_runtime": 259098.7449, "train_tokens_per_second": 29186.874 }, { "epoch": 0.9411619015185524, "grad_norm": 1.546875, "learning_rate": 2.6135775723021143e-05, "loss": 1.077366542816162, "num_input_tokens_seen": 7565127424, "step": 26600, "train_runtime": 259195.1194, "train_tokens_per_second": 29186.998 }, { "epoch": 0.9415157217822812, "grad_norm": 1.546875, "learning_rate": 2.613220589582585e-05, "loss": 1.0844367027282715, "num_input_tokens_seen": 7568018496, "step": 26610, "train_runtime": 259295.2024, "train_tokens_per_second": 29186.882 }, { "epoch": 0.9418695420460099, "grad_norm": 1.5546875, "learning_rate": 2.612863753101522e-05, "loss": 1.0768617630004882, "num_input_tokens_seen": 7570843008, "step": 26620, "train_runtime": 259389.3927, "train_tokens_per_second": 29187.173 }, { "epoch": 0.9422233623097387, "grad_norm": 1.421875, "learning_rate": 2.612507062759109e-05, "loss": 1.08292236328125, "num_input_tokens_seen": 7573606592, "step": 26630, "train_runtime": 259480.588, "train_tokens_per_second": 29187.565 }, { "epoch": 0.9425771825734675, "grad_norm": 1.453125, "learning_rate": 2.612150518455625e-05, "loss": 1.0820573806762694, "num_input_tokens_seen": 7576424576, "step": 26640, "train_runtime": 259578.2444, "train_tokens_per_second": 29187.441 }, { "epoch": 0.9429310028371962, "grad_norm": 1.4609375, "learning_rate": 2.6117941200914407e-05, "loss": 1.085733985900879, "num_input_tokens_seen": 7579285376, "step": 26650, "train_runtime": 259673.528, "train_tokens_per_second": 29187.748 }, { "epoch": 0.943284823100925, "grad_norm": 1.46875, "learning_rate": 2.6114378675670266e-05, "loss": 1.0861295700073241, "num_input_tokens_seen": 7582086912, "step": 26660, "train_runtime": 259767.0666, "train_tokens_per_second": 29188.022 }, { "epoch": 0.9436386433646538, "grad_norm": 1.5, "learning_rate": 2.611081760782944e-05, "loss": 1.0760425567626952, "num_input_tokens_seen": 7584917376, "step": 26670, "train_runtime": 259863.2204, "train_tokens_per_second": 29188.114 }, { "epoch": 0.9439924636283826, "grad_norm": 1.5, "learning_rate": 2.6107257996398533e-05, "loss": 1.0788305282592774, "num_input_tokens_seen": 7587733568, "step": 26680, "train_runtime": 259959.7449, "train_tokens_per_second": 29188.11 }, { "epoch": 0.9443462838921114, "grad_norm": 1.46875, "learning_rate": 2.610369984038506e-05, "loss": 1.0764963150024414, "num_input_tokens_seen": 7590547328, "step": 26690, "train_runtime": 260053.8163, "train_tokens_per_second": 29188.371 }, { "epoch": 0.9447001041558402, "grad_norm": 1.4921875, "learning_rate": 2.6100143138797508e-05, "loss": 1.0734793663024902, "num_input_tokens_seen": 7593391104, "step": 26700, "train_runtime": 260150.3458, "train_tokens_per_second": 29188.472 }, { "epoch": 0.9450539244195689, "grad_norm": 1.484375, "learning_rate": 2.6096587890645286e-05, "loss": 1.0645111083984375, "num_input_tokens_seen": 7596243136, "step": 26710, "train_runtime": 260248.8905, "train_tokens_per_second": 29188.379 }, { "epoch": 0.9454077446832977, "grad_norm": 1.5234375, "learning_rate": 2.6093034094938772e-05, "loss": 1.0891409873962403, "num_input_tokens_seen": 7599072192, "step": 26720, "train_runtime": 260345.6814, "train_tokens_per_second": 29188.393 }, { "epoch": 0.9457615649470265, "grad_norm": 1.46875, "learning_rate": 2.608948175068927e-05, "loss": 1.0813072204589844, "num_input_tokens_seen": 7601949120, "step": 26730, "train_runtime": 260442.8863, "train_tokens_per_second": 29188.546 }, { "epoch": 0.9461153852107552, "grad_norm": 1.5625, "learning_rate": 2.6085930856909035e-05, "loss": 1.0803549766540528, "num_input_tokens_seen": 7604805952, "step": 26740, "train_runtime": 260538.8755, "train_tokens_per_second": 29188.757 }, { "epoch": 0.946469205474484, "grad_norm": 1.515625, "learning_rate": 2.608238141261126e-05, "loss": 1.0850915908813477, "num_input_tokens_seen": 7607641280, "step": 26750, "train_runtime": 260634.0829, "train_tokens_per_second": 29188.973 }, { "epoch": 0.9468230257382129, "grad_norm": 1.5390625, "learning_rate": 2.6078833416810072e-05, "loss": 1.0891590118408203, "num_input_tokens_seen": 7610425536, "step": 26760, "train_runtime": 260727.9224, "train_tokens_per_second": 29189.147 }, { "epoch": 0.9471768460019416, "grad_norm": 1.46875, "learning_rate": 2.6075286868520543e-05, "loss": 1.0819381713867187, "num_input_tokens_seen": 7613237632, "step": 26770, "train_runtime": 260821.5482, "train_tokens_per_second": 29189.45 }, { "epoch": 0.9475306662656704, "grad_norm": 1.484375, "learning_rate": 2.6071741766758678e-05, "loss": 1.0874982833862306, "num_input_tokens_seen": 7616021312, "step": 26780, "train_runtime": 260916.3586, "train_tokens_per_second": 29189.512 }, { "epoch": 0.9478844865293992, "grad_norm": 1.4921875, "learning_rate": 2.6068198110541432e-05, "loss": 1.0767423629760742, "num_input_tokens_seen": 7618848512, "step": 26790, "train_runtime": 261013.4491, "train_tokens_per_second": 29189.486 }, { "epoch": 0.9482383067931279, "grad_norm": 1.53125, "learning_rate": 2.606465589888667e-05, "loss": 1.092358112335205, "num_input_tokens_seen": 7621735040, "step": 26800, "train_runtime": 261112.5893, "train_tokens_per_second": 29189.458 }, { "epoch": 0.9485921270568567, "grad_norm": 1.484375, "learning_rate": 2.606111513081321e-05, "loss": 1.074544906616211, "num_input_tokens_seen": 7624568320, "step": 26810, "train_runtime": 261208.4494, "train_tokens_per_second": 29189.593 }, { "epoch": 0.9489459473205855, "grad_norm": 1.5625, "learning_rate": 2.60575758053408e-05, "loss": 1.0646194458007812, "num_input_tokens_seen": 7627436160, "step": 26820, "train_runtime": 261307.5589, "train_tokens_per_second": 29189.497 }, { "epoch": 0.9492997675843142, "grad_norm": 1.5, "learning_rate": 2.605403792149012e-05, "loss": 1.079594326019287, "num_input_tokens_seen": 7630342400, "step": 26830, "train_runtime": 261407.989, "train_tokens_per_second": 29189.4 }, { "epoch": 0.949653587848043, "grad_norm": 1.4921875, "learning_rate": 2.6050501478282775e-05, "loss": 1.072446346282959, "num_input_tokens_seen": 7633210560, "step": 26840, "train_runtime": 261507.8011, "train_tokens_per_second": 29189.227 }, { "epoch": 0.9500074081117719, "grad_norm": 1.46875, "learning_rate": 2.6046966474741293e-05, "loss": 1.0824260711669922, "num_input_tokens_seen": 7636083072, "step": 26850, "train_runtime": 261604.1435, "train_tokens_per_second": 29189.458 }, { "epoch": 0.9503612283755006, "grad_norm": 1.453125, "learning_rate": 2.6043432909889148e-05, "loss": 1.088757038116455, "num_input_tokens_seen": 7638949888, "step": 26860, "train_runtime": 261700.4961, "train_tokens_per_second": 29189.665 }, { "epoch": 0.9507150486392294, "grad_norm": 1.46875, "learning_rate": 2.6039900782750737e-05, "loss": 1.0757373809814452, "num_input_tokens_seen": 7641783168, "step": 26870, "train_runtime": 261796.748, "train_tokens_per_second": 29189.756 }, { "epoch": 0.9510688689029582, "grad_norm": 1.5234375, "learning_rate": 2.6036370092351377e-05, "loss": 1.071635913848877, "num_input_tokens_seen": 7644615424, "step": 26880, "train_runtime": 261894.8357, "train_tokens_per_second": 29189.638 }, { "epoch": 0.9514226891666869, "grad_norm": 1.546875, "learning_rate": 2.6032840837717298e-05, "loss": 1.0655144691467284, "num_input_tokens_seen": 7647469376, "step": 26890, "train_runtime": 261993.1857, "train_tokens_per_second": 29189.574 }, { "epoch": 0.9517765094304157, "grad_norm": 1.5078125, "learning_rate": 2.6029313017875682e-05, "loss": 1.0876749992370605, "num_input_tokens_seen": 7650284608, "step": 26900, "train_runtime": 262087.5444, "train_tokens_per_second": 29189.806 }, { "epoch": 0.9521303296941445, "grad_norm": 1.484375, "learning_rate": 2.602578663185461e-05, "loss": 1.0852800369262696, "num_input_tokens_seen": 7653107456, "step": 26910, "train_runtime": 262186.8198, "train_tokens_per_second": 29189.52 }, { "epoch": 0.9524841499578732, "grad_norm": 1.5, "learning_rate": 2.6022261678683102e-05, "loss": 1.077920913696289, "num_input_tokens_seen": 7655948864, "step": 26920, "train_runtime": 262284.6289, "train_tokens_per_second": 29189.468 }, { "epoch": 0.9528379702216021, "grad_norm": 1.5078125, "learning_rate": 2.601873815739108e-05, "loss": 1.0815540313720704, "num_input_tokens_seen": 7658779392, "step": 26930, "train_runtime": 262381.8249, "train_tokens_per_second": 29189.443 }, { "epoch": 0.9531917904853309, "grad_norm": 1.46875, "learning_rate": 2.6015216067009395e-05, "loss": 1.0645343780517578, "num_input_tokens_seen": 7661614784, "step": 26940, "train_runtime": 262476.6997, "train_tokens_per_second": 29189.695 }, { "epoch": 0.9535456107490596, "grad_norm": 1.5078125, "learning_rate": 2.6011695406569824e-05, "loss": 1.0704078674316406, "num_input_tokens_seen": 7664483008, "step": 26950, "train_runtime": 262575.5553, "train_tokens_per_second": 29189.629 }, { "epoch": 0.9538994310127884, "grad_norm": 1.484375, "learning_rate": 2.6008176175105048e-05, "loss": 1.0725948333740234, "num_input_tokens_seen": 7667332416, "step": 26960, "train_runtime": 262670.3161, "train_tokens_per_second": 29189.946 }, { "epoch": 0.9542532512765172, "grad_norm": 1.5, "learning_rate": 2.6004658371648672e-05, "loss": 1.0794626235961915, "num_input_tokens_seen": 7670159680, "step": 26970, "train_runtime": 262766.5782, "train_tokens_per_second": 29190.012 }, { "epoch": 0.9546070715402459, "grad_norm": 1.515625, "learning_rate": 2.6001141995235195e-05, "loss": 1.0818564414978027, "num_input_tokens_seen": 7673056704, "step": 26980, "train_runtime": 262865.6503, "train_tokens_per_second": 29190.032 }, { "epoch": 0.9549608918039747, "grad_norm": 1.4453125, "learning_rate": 2.599762704490007e-05, "loss": 1.0796282768249512, "num_input_tokens_seen": 7675956352, "step": 26990, "train_runtime": 262967.2762, "train_tokens_per_second": 29189.778 }, { "epoch": 0.9553147120677035, "grad_norm": 1.53125, "learning_rate": 2.599411351967963e-05, "loss": 1.0778749465942383, "num_input_tokens_seen": 7678770112, "step": 27000, "train_runtime": 263064.2965, "train_tokens_per_second": 29189.708 }, { "epoch": 0.9556685323314323, "grad_norm": 1.4765625, "learning_rate": 2.5990601418611127e-05, "loss": 1.0656103134155273, "num_input_tokens_seen": 7681633920, "step": 27010, "train_runtime": 263164.3479, "train_tokens_per_second": 29189.493 }, { "epoch": 0.9560223525951611, "grad_norm": 1.5078125, "learning_rate": 2.598709074073272e-05, "loss": 1.0797760009765625, "num_input_tokens_seen": 7684447104, "step": 27020, "train_runtime": 263258.8387, "train_tokens_per_second": 29189.702 }, { "epoch": 0.9563761728588899, "grad_norm": 1.4765625, "learning_rate": 2.5983581485083498e-05, "loss": 1.0836926460266114, "num_input_tokens_seen": 7687253632, "step": 27030, "train_runtime": 263355.3457, "train_tokens_per_second": 29189.662 }, { "epoch": 0.9567299931226186, "grad_norm": 1.484375, "learning_rate": 2.598007365070343e-05, "loss": 1.084663200378418, "num_input_tokens_seen": 7690112640, "step": 27040, "train_runtime": 263455.25, "train_tokens_per_second": 29189.445 }, { "epoch": 0.9570838133863474, "grad_norm": 1.4921875, "learning_rate": 2.5976567236633403e-05, "loss": 1.0982830047607421, "num_input_tokens_seen": 7692974400, "step": 27050, "train_runtime": 263554.4651, "train_tokens_per_second": 29189.315 }, { "epoch": 0.9574376336500762, "grad_norm": 1.5, "learning_rate": 2.5973062241915225e-05, "loss": 1.0604990005493165, "num_input_tokens_seen": 7695779648, "step": 27060, "train_runtime": 263651.545, "train_tokens_per_second": 29189.207 }, { "epoch": 0.9577914539138049, "grad_norm": 1.4609375, "learning_rate": 2.5969558665591576e-05, "loss": 1.0921756744384765, "num_input_tokens_seen": 7698627264, "step": 27070, "train_runtime": 263749.4617, "train_tokens_per_second": 29189.168 }, { "epoch": 0.9581452741775337, "grad_norm": 1.546875, "learning_rate": 2.5966056506706078e-05, "loss": 1.0763803482055665, "num_input_tokens_seen": 7701469120, "step": 27080, "train_runtime": 263848.0735, "train_tokens_per_second": 29189.029 }, { "epoch": 0.9584990944412625, "grad_norm": 1.4609375, "learning_rate": 2.596255576430322e-05, "loss": 1.0933831214904786, "num_input_tokens_seen": 7704293632, "step": 27090, "train_runtime": 263943.1038, "train_tokens_per_second": 29189.221 }, { "epoch": 0.9588529147049913, "grad_norm": 1.4609375, "learning_rate": 2.5959056437428414e-05, "loss": 1.08085298538208, "num_input_tokens_seen": 7707106816, "step": 27100, "train_runtime": 264039.1825, "train_tokens_per_second": 29189.254 }, { "epoch": 0.9592067349687201, "grad_norm": 1.5625, "learning_rate": 2.5955558525127977e-05, "loss": 1.0727056503295898, "num_input_tokens_seen": 7709932096, "step": 27110, "train_runtime": 264134.0475, "train_tokens_per_second": 29189.467 }, { "epoch": 0.9595605552324489, "grad_norm": 1.4375, "learning_rate": 2.5952062026449096e-05, "loss": 1.0823779106140137, "num_input_tokens_seen": 7712776768, "step": 27120, "train_runtime": 264232.0709, "train_tokens_per_second": 29189.404 }, { "epoch": 0.9599143754961776, "grad_norm": 1.546875, "learning_rate": 2.59485669404399e-05, "loss": 1.0806731224060058, "num_input_tokens_seen": 7715607616, "step": 27130, "train_runtime": 264327.6129, "train_tokens_per_second": 29189.563 }, { "epoch": 0.9602681957599064, "grad_norm": 1.546875, "learning_rate": 2.5945073266149366e-05, "loss": 1.0666584014892577, "num_input_tokens_seen": 7718424512, "step": 27140, "train_runtime": 264422.9603, "train_tokens_per_second": 29189.691 }, { "epoch": 0.9606220160236352, "grad_norm": 1.484375, "learning_rate": 2.594158100262741e-05, "loss": 1.0793862342834473, "num_input_tokens_seen": 7721271360, "step": 27150, "train_runtime": 264519.1368, "train_tokens_per_second": 29189.84 }, { "epoch": 0.9609758362873639, "grad_norm": 1.4609375, "learning_rate": 2.5938090148924815e-05, "loss": 1.0912773132324218, "num_input_tokens_seen": 7724100992, "step": 27160, "train_runtime": 264615.4779, "train_tokens_per_second": 29189.906 }, { "epoch": 0.9613296565510927, "grad_norm": 1.5234375, "learning_rate": 2.5934600704093282e-05, "loss": 1.0855581283569335, "num_input_tokens_seen": 7726932160, "step": 27170, "train_runtime": 264711.61, "train_tokens_per_second": 29190.001 }, { "epoch": 0.9616834768148216, "grad_norm": 1.5703125, "learning_rate": 2.5931112667185365e-05, "loss": 1.084220790863037, "num_input_tokens_seen": 7729738432, "step": 27180, "train_runtime": 264807.2364, "train_tokens_per_second": 29190.057 }, { "epoch": 0.9620372970785503, "grad_norm": 1.53125, "learning_rate": 2.592762603725456e-05, "loss": 1.0891904830932617, "num_input_tokens_seen": 7732588608, "step": 27190, "train_runtime": 264903.1288, "train_tokens_per_second": 29190.25 }, { "epoch": 0.9623911173422791, "grad_norm": 1.4921875, "learning_rate": 2.592414081335522e-05, "loss": 1.0743358612060547, "num_input_tokens_seen": 7735442176, "step": 27200, "train_runtime": 264998.4065, "train_tokens_per_second": 29190.523 }, { "epoch": 0.9627449376060079, "grad_norm": 1.4296875, "learning_rate": 2.592065699454259e-05, "loss": 1.083421802520752, "num_input_tokens_seen": 7738321792, "step": 27210, "train_runtime": 265098.3717, "train_tokens_per_second": 29190.378 }, { "epoch": 0.9630987578697366, "grad_norm": 1.421875, "learning_rate": 2.5917174579872815e-05, "loss": 1.0821763038635255, "num_input_tokens_seen": 7741176000, "step": 27220, "train_runtime": 265194.8742, "train_tokens_per_second": 29190.519 }, { "epoch": 0.9634525781334654, "grad_norm": 1.5, "learning_rate": 2.5913693568402926e-05, "loss": 1.067593765258789, "num_input_tokens_seen": 7744038848, "step": 27230, "train_runtime": 265293.0473, "train_tokens_per_second": 29190.508 }, { "epoch": 0.9638063983971942, "grad_norm": 1.53125, "learning_rate": 2.5910213959190833e-05, "loss": 1.0845775604248047, "num_input_tokens_seen": 7746888704, "step": 27240, "train_runtime": 265391.857, "train_tokens_per_second": 29190.378 }, { "epoch": 0.9641602186609229, "grad_norm": 1.4765625, "learning_rate": 2.590673575129534e-05, "loss": 1.0790922164916992, "num_input_tokens_seen": 7749687296, "step": 27250, "train_runtime": 265485.8201, "train_tokens_per_second": 29190.588 }, { "epoch": 0.9645140389246518, "grad_norm": 1.46875, "learning_rate": 2.5903258943776116e-05, "loss": 1.0659368515014649, "num_input_tokens_seen": 7752568768, "step": 27260, "train_runtime": 265587.6225, "train_tokens_per_second": 29190.249 }, { "epoch": 0.9648678591883806, "grad_norm": 1.5234375, "learning_rate": 2.5899783535693745e-05, "loss": 1.051686668395996, "num_input_tokens_seen": 7755390336, "step": 27270, "train_runtime": 265683.4082, "train_tokens_per_second": 29190.345 }, { "epoch": 0.9652216794521093, "grad_norm": 1.5, "learning_rate": 2.5896309526109663e-05, "loss": 1.0772632598876952, "num_input_tokens_seen": 7758272320, "step": 27280, "train_runtime": 265783.898, "train_tokens_per_second": 29190.152 }, { "epoch": 0.9655754997158381, "grad_norm": 1.515625, "learning_rate": 2.589283691408621e-05, "loss": 1.0933277130126953, "num_input_tokens_seen": 7761131648, "step": 27290, "train_runtime": 265882.2405, "train_tokens_per_second": 29190.109 }, { "epoch": 0.9659293199795669, "grad_norm": 1.5078125, "learning_rate": 2.588936569868658e-05, "loss": 1.0769664764404296, "num_input_tokens_seen": 7763973760, "step": 27300, "train_runtime": 265980.3944, "train_tokens_per_second": 29190.023 }, { "epoch": 0.9662831402432956, "grad_norm": 1.421875, "learning_rate": 2.5885895878974877e-05, "loss": 1.0858171463012696, "num_input_tokens_seen": 7766862464, "step": 27310, "train_runtime": 266081.2809, "train_tokens_per_second": 29189.812 }, { "epoch": 0.9666369605070244, "grad_norm": 1.4375, "learning_rate": 2.5882427454016055e-05, "loss": 1.0894524574279785, "num_input_tokens_seen": 7769708480, "step": 27320, "train_runtime": 266180.0344, "train_tokens_per_second": 29189.674 }, { "epoch": 0.9669907807707532, "grad_norm": 1.5078125, "learning_rate": 2.587896042287596e-05, "loss": 1.0776158332824708, "num_input_tokens_seen": 7772516544, "step": 27330, "train_runtime": 266276.6718, "train_tokens_per_second": 29189.626 }, { "epoch": 0.9673446010344819, "grad_norm": 1.484375, "learning_rate": 2.5875494784621317e-05, "loss": 1.069560718536377, "num_input_tokens_seen": 7775338240, "step": 27340, "train_runtime": 266372.8184, "train_tokens_per_second": 29189.683 }, { "epoch": 0.9676984212982108, "grad_norm": 1.5703125, "learning_rate": 2.587203053831971e-05, "loss": 1.0834737777709962, "num_input_tokens_seen": 7778188160, "step": 27350, "train_runtime": 266471.8531, "train_tokens_per_second": 29189.53 }, { "epoch": 0.9680522415619396, "grad_norm": 1.4609375, "learning_rate": 2.586856768303961e-05, "loss": 1.085575485229492, "num_input_tokens_seen": 7781007616, "step": 27360, "train_runtime": 266568.9186, "train_tokens_per_second": 29189.478 }, { "epoch": 0.9684060618256684, "grad_norm": 1.5234375, "learning_rate": 2.586510621785036e-05, "loss": 1.0810811996459961, "num_input_tokens_seen": 7783851840, "step": 27370, "train_runtime": 266663.3712, "train_tokens_per_second": 29189.805 }, { "epoch": 0.9687598820893971, "grad_norm": 1.546875, "learning_rate": 2.5861646141822164e-05, "loss": 1.0886645317077637, "num_input_tokens_seen": 7786691392, "step": 27380, "train_runtime": 266763.4786, "train_tokens_per_second": 29189.496 }, { "epoch": 0.9691137023531259, "grad_norm": 1.5234375, "learning_rate": 2.5858187454026106e-05, "loss": 1.0835071563720704, "num_input_tokens_seen": 7789517312, "step": 27390, "train_runtime": 266858.215, "train_tokens_per_second": 29189.723 }, { "epoch": 0.9694675226168546, "grad_norm": 1.4765625, "learning_rate": 2.5854730153534134e-05, "loss": 1.0840339660644531, "num_input_tokens_seen": 7792367616, "step": 27400, "train_runtime": 266957.3884, "train_tokens_per_second": 29189.556 }, { "epoch": 0.9698213428805834, "grad_norm": 1.53125, "learning_rate": 2.585127423941907e-05, "loss": 1.0763545989990235, "num_input_tokens_seen": 7795244736, "step": 27410, "train_runtime": 267058.4155, "train_tokens_per_second": 29189.287 }, { "epoch": 0.9701751631443122, "grad_norm": 1.5078125, "learning_rate": 2.58478197107546e-05, "loss": 1.0793272018432618, "num_input_tokens_seen": 7798101888, "step": 27420, "train_runtime": 267155.1714, "train_tokens_per_second": 29189.41 }, { "epoch": 0.9705289834080411, "grad_norm": 1.53125, "learning_rate": 2.5844366566615273e-05, "loss": 1.080540657043457, "num_input_tokens_seen": 7801014976, "step": 27430, "train_runtime": 267255.7067, "train_tokens_per_second": 29189.33 }, { "epoch": 0.9708828036717698, "grad_norm": 1.5234375, "learning_rate": 2.584091480607651e-05, "loss": 1.0805315017700194, "num_input_tokens_seen": 7803891904, "step": 27440, "train_runtime": 267355.6663, "train_tokens_per_second": 29189.177 }, { "epoch": 0.9712366239354986, "grad_norm": 1.4375, "learning_rate": 2.5837464428214592e-05, "loss": 1.0856252670288087, "num_input_tokens_seen": 7806784704, "step": 27450, "train_runtime": 267456.3388, "train_tokens_per_second": 29189.006 }, { "epoch": 0.9715904441992274, "grad_norm": 1.5078125, "learning_rate": 2.5834015432106666e-05, "loss": 1.0732501983642577, "num_input_tokens_seen": 7809631744, "step": 27460, "train_runtime": 267552.8006, "train_tokens_per_second": 29189.124 }, { "epoch": 0.9719442644629561, "grad_norm": 1.5078125, "learning_rate": 2.5830567816830737e-05, "loss": 1.0684146881103516, "num_input_tokens_seen": 7812457856, "step": 27470, "train_runtime": 267649.2058, "train_tokens_per_second": 29189.169 }, { "epoch": 0.9722980847266849, "grad_norm": 1.4609375, "learning_rate": 2.5827121581465668e-05, "loss": 1.0824934005737306, "num_input_tokens_seen": 7815289536, "step": 27480, "train_runtime": 267748.0132, "train_tokens_per_second": 29188.973 }, { "epoch": 0.9726519049904137, "grad_norm": 1.4609375, "learning_rate": 2.5823676725091193e-05, "loss": 1.0845535278320313, "num_input_tokens_seen": 7818122176, "step": 27490, "train_runtime": 267845.5235, "train_tokens_per_second": 29188.922 }, { "epoch": 0.9730057252541424, "grad_norm": 1.5, "learning_rate": 2.5820233246787902e-05, "loss": 1.0888787269592286, "num_input_tokens_seen": 7820980032, "step": 27500, "train_runtime": 267942.3272, "train_tokens_per_second": 29189.043 }, { "epoch": 0.9733595455178713, "grad_norm": 1.53125, "learning_rate": 2.581679114563723e-05, "loss": 1.074323844909668, "num_input_tokens_seen": 7823928128, "step": 27510, "train_runtime": 268046.6643, "train_tokens_per_second": 29188.679 }, { "epoch": 0.9737133657816001, "grad_norm": 1.4921875, "learning_rate": 2.5813350420721488e-05, "loss": 1.0770124435424804, "num_input_tokens_seen": 7826748928, "step": 27520, "train_runtime": 268141.2039, "train_tokens_per_second": 29188.908 }, { "epoch": 0.9740671860453288, "grad_norm": 1.4765625, "learning_rate": 2.5809911071123834e-05, "loss": 1.0684118270874023, "num_input_tokens_seen": 7829627584, "step": 27530, "train_runtime": 268241.1902, "train_tokens_per_second": 29188.759 }, { "epoch": 0.9744210063090576, "grad_norm": 1.5625, "learning_rate": 2.5806473095928274e-05, "loss": 1.0669201850891112, "num_input_tokens_seen": 7832470336, "step": 27540, "train_runtime": 268336.2613, "train_tokens_per_second": 29189.012 }, { "epoch": 0.9747748265727864, "grad_norm": 1.546875, "learning_rate": 2.5803036494219678e-05, "loss": 1.066395378112793, "num_input_tokens_seen": 7835371520, "step": 27550, "train_runtime": 268437.6271, "train_tokens_per_second": 29188.797 }, { "epoch": 0.9751286468365151, "grad_norm": 1.5, "learning_rate": 2.5799601265083767e-05, "loss": 1.0989919662475587, "num_input_tokens_seen": 7838242752, "step": 27560, "train_runtime": 268536.3828, "train_tokens_per_second": 29188.755 }, { "epoch": 0.9754824671002439, "grad_norm": 1.5078125, "learning_rate": 2.5796167407607113e-05, "loss": 1.0709043502807618, "num_input_tokens_seen": 7841110848, "step": 27570, "train_runtime": 268633.4605, "train_tokens_per_second": 29188.884 }, { "epoch": 0.9758362873639727, "grad_norm": 1.515625, "learning_rate": 2.5792734920877138e-05, "loss": 1.0698806762695312, "num_input_tokens_seen": 7843947392, "step": 27580, "train_runtime": 268730.1294, "train_tokens_per_second": 29188.939 }, { "epoch": 0.9761901076277014, "grad_norm": 1.5078125, "learning_rate": 2.5789303803982114e-05, "loss": 1.0741756439208985, "num_input_tokens_seen": 7846760832, "step": 27590, "train_runtime": 268825.3028, "train_tokens_per_second": 29189.071 }, { "epoch": 0.9765439278914303, "grad_norm": 1.53125, "learning_rate": 2.578587405601115e-05, "loss": 1.0901464462280273, "num_input_tokens_seen": 7849578048, "step": 27600, "train_runtime": 268921.4639, "train_tokens_per_second": 29189.109 }, { "epoch": 0.9768977481551591, "grad_norm": 1.5, "learning_rate": 2.5782445676054233e-05, "loss": 1.0760123252868652, "num_input_tokens_seen": 7852493312, "step": 27610, "train_runtime": 269021.685, "train_tokens_per_second": 29189.072 }, { "epoch": 0.9772515684188878, "grad_norm": 1.5, "learning_rate": 2.577901866320217e-05, "loss": 1.0806961059570312, "num_input_tokens_seen": 7855302656, "step": 27620, "train_runtime": 269116.7043, "train_tokens_per_second": 29189.205 }, { "epoch": 0.9776053886826166, "grad_norm": 1.53125, "learning_rate": 2.5775593016546618e-05, "loss": 1.0667445182800293, "num_input_tokens_seen": 7858197760, "step": 27630, "train_runtime": 269217.8684, "train_tokens_per_second": 29188.99 }, { "epoch": 0.9779592089463454, "grad_norm": 1.5078125, "learning_rate": 2.5772168735180084e-05, "loss": 1.0754318237304688, "num_input_tokens_seen": 7861040896, "step": 27640, "train_runtime": 269315.9781, "train_tokens_per_second": 29188.914 }, { "epoch": 0.9783130292100741, "grad_norm": 1.4765625, "learning_rate": 2.5768745818195927e-05, "loss": 1.0721765518188477, "num_input_tokens_seen": 7863913856, "step": 27650, "train_runtime": 269414.8174, "train_tokens_per_second": 29188.869 }, { "epoch": 0.9786668494738029, "grad_norm": 1.4453125, "learning_rate": 2.5765324264688327e-05, "loss": 1.0786039352416992, "num_input_tokens_seen": 7866820160, "step": 27660, "train_runtime": 269514.7675, "train_tokens_per_second": 29188.828 }, { "epoch": 0.9790206697375317, "grad_norm": 1.4921875, "learning_rate": 2.5761904073752323e-05, "loss": 1.0736366271972657, "num_input_tokens_seen": 7869606464, "step": 27670, "train_runtime": 269607.0216, "train_tokens_per_second": 29189.175 }, { "epoch": 0.9793744900012605, "grad_norm": 1.515625, "learning_rate": 2.5758485244483788e-05, "loss": 1.079141616821289, "num_input_tokens_seen": 7872438336, "step": 27680, "train_runtime": 269704.4539, "train_tokens_per_second": 29189.13 }, { "epoch": 0.9797283102649893, "grad_norm": 1.5, "learning_rate": 2.5755067775979443e-05, "loss": 1.0794377326965332, "num_input_tokens_seen": 7875197248, "step": 27690, "train_runtime": 269795.6957, "train_tokens_per_second": 29189.484 }, { "epoch": 0.9800821305287181, "grad_norm": 1.53125, "learning_rate": 2.5751651667336824e-05, "loss": 1.0809971809387207, "num_input_tokens_seen": 7878105984, "step": 27700, "train_runtime": 269896.9846, "train_tokens_per_second": 29189.307 }, { "epoch": 0.9804359507924468, "grad_norm": 1.484375, "learning_rate": 2.5748236917654333e-05, "loss": 1.0715396881103516, "num_input_tokens_seen": 7880935232, "step": 27710, "train_runtime": 269990.5836, "train_tokens_per_second": 29189.667 }, { "epoch": 0.9807897710561756, "grad_norm": 1.5390625, "learning_rate": 2.5744823526031202e-05, "loss": 1.0838909149169922, "num_input_tokens_seen": 7883814720, "step": 27720, "train_runtime": 270088.4354, "train_tokens_per_second": 29189.753 }, { "epoch": 0.9811435913199044, "grad_norm": 1.4765625, "learning_rate": 2.5741411491567484e-05, "loss": 1.0846062660217286, "num_input_tokens_seen": 7886692032, "step": 27730, "train_runtime": 270187.4806, "train_tokens_per_second": 29189.702 }, { "epoch": 0.9814974115836331, "grad_norm": 1.4609375, "learning_rate": 2.573800081336408e-05, "loss": 1.077780532836914, "num_input_tokens_seen": 7889550912, "step": 27740, "train_runtime": 270285.32, "train_tokens_per_second": 29189.713 }, { "epoch": 0.9818512318473619, "grad_norm": 1.5546875, "learning_rate": 2.573459149052272e-05, "loss": 1.0764476776123046, "num_input_tokens_seen": 7892358528, "step": 27750, "train_runtime": 270378.5473, "train_tokens_per_second": 29190.032 }, { "epoch": 0.9822050521110908, "grad_norm": 1.5078125, "learning_rate": 2.5731183522145968e-05, "loss": 1.0945233345031737, "num_input_tokens_seen": 7895227200, "step": 27760, "train_runtime": 270479.5364, "train_tokens_per_second": 29189.739 }, { "epoch": 0.9825588723748195, "grad_norm": 1.4140625, "learning_rate": 2.5727776907337226e-05, "loss": 1.0698240280151368, "num_input_tokens_seen": 7898030208, "step": 27770, "train_runtime": 270573.2773, "train_tokens_per_second": 29189.986 }, { "epoch": 0.9829126926385483, "grad_norm": 1.5078125, "learning_rate": 2.5724371645200708e-05, "loss": 1.0922103881835938, "num_input_tokens_seen": 7900816960, "step": 27780, "train_runtime": 270670.7337, "train_tokens_per_second": 29189.772 }, { "epoch": 0.9832665129022771, "grad_norm": 1.53125, "learning_rate": 2.572096773484147e-05, "loss": 1.0953201293945312, "num_input_tokens_seen": 7903646848, "step": 27790, "train_runtime": 270766.7707, "train_tokens_per_second": 29189.87 }, { "epoch": 0.9836203331660058, "grad_norm": 1.5, "learning_rate": 2.5717565175365416e-05, "loss": 1.0674108505249023, "num_input_tokens_seen": 7906475520, "step": 27800, "train_runtime": 270861.5972, "train_tokens_per_second": 29190.094 }, { "epoch": 0.9839741534297346, "grad_norm": 1.53125, "learning_rate": 2.571416396587924e-05, "loss": 1.0883499145507813, "num_input_tokens_seen": 7909321216, "step": 27810, "train_runtime": 270959.919, "train_tokens_per_second": 29190.004 }, { "epoch": 0.9843279736934634, "grad_norm": 1.5703125, "learning_rate": 2.5710764105490486e-05, "loss": 1.0881172180175782, "num_input_tokens_seen": 7912120320, "step": 27820, "train_runtime": 271053.8938, "train_tokens_per_second": 29190.211 }, { "epoch": 0.9846817939571921, "grad_norm": 1.46875, "learning_rate": 2.570736559330752e-05, "loss": 1.0804701805114747, "num_input_tokens_seen": 7914969536, "step": 27830, "train_runtime": 271151.2861, "train_tokens_per_second": 29190.234 }, { "epoch": 0.9850356142209209, "grad_norm": 1.5390625, "learning_rate": 2.570396842843953e-05, "loss": 1.0784674644470216, "num_input_tokens_seen": 7917792064, "step": 27840, "train_runtime": 271247.0839, "train_tokens_per_second": 29190.331 }, { "epoch": 0.9853894344846498, "grad_norm": 1.4921875, "learning_rate": 2.5700572609996526e-05, "loss": 1.0708795547485352, "num_input_tokens_seen": 7920633152, "step": 27850, "train_runtime": 271345.5165, "train_tokens_per_second": 29190.212 }, { "epoch": 0.9857432547483785, "grad_norm": 1.4765625, "learning_rate": 2.5697178137089357e-05, "loss": 1.068554973602295, "num_input_tokens_seen": 7923523520, "step": 27860, "train_runtime": 271443.0465, "train_tokens_per_second": 29190.372 }, { "epoch": 0.9860970750121073, "grad_norm": 1.390625, "learning_rate": 2.569378500882966e-05, "loss": 1.077509880065918, "num_input_tokens_seen": 7926298176, "step": 27870, "train_runtime": 271539.0512, "train_tokens_per_second": 29190.27 }, { "epoch": 0.9864508952758361, "grad_norm": 1.5078125, "learning_rate": 2.569039322432994e-05, "loss": 1.0904461860656738, "num_input_tokens_seen": 7929133824, "step": 27880, "train_runtime": 271634.703, "train_tokens_per_second": 29190.43 }, { "epoch": 0.9868047155395648, "grad_norm": 1.5546875, "learning_rate": 2.5687002782703474e-05, "loss": 1.0774654388427733, "num_input_tokens_seen": 7931983168, "step": 27890, "train_runtime": 271733.0054, "train_tokens_per_second": 29190.356 }, { "epoch": 0.9871585358032936, "grad_norm": 1.53125, "learning_rate": 2.568361368306439e-05, "loss": 1.0760505676269532, "num_input_tokens_seen": 7934843328, "step": 27900, "train_runtime": 271832.6524, "train_tokens_per_second": 29190.177 }, { "epoch": 0.9875123560670224, "grad_norm": 1.515625, "learning_rate": 2.5680225924527623e-05, "loss": 1.0733545303344727, "num_input_tokens_seen": 7937700352, "step": 27910, "train_runtime": 271930.15, "train_tokens_per_second": 29190.218 }, { "epoch": 0.9878661763307511, "grad_norm": 1.609375, "learning_rate": 2.5676839506208927e-05, "loss": 1.0811322212219239, "num_input_tokens_seen": 7940547648, "step": 27920, "train_runtime": 272027.0864, "train_tokens_per_second": 29190.283 }, { "epoch": 0.98821999659448, "grad_norm": 1.5078125, "learning_rate": 2.567345442722487e-05, "loss": 1.0765664100646972, "num_input_tokens_seen": 7943389504, "step": 27930, "train_runtime": 272122.5577, "train_tokens_per_second": 29190.485 }, { "epoch": 0.9885738168582088, "grad_norm": 1.484375, "learning_rate": 2.567007068669283e-05, "loss": 1.0716974258422851, "num_input_tokens_seen": 7946204800, "step": 27940, "train_runtime": 272216.2076, "train_tokens_per_second": 29190.785 }, { "epoch": 0.9889276371219375, "grad_norm": 1.4921875, "learning_rate": 2.5666688283731016e-05, "loss": 1.074761199951172, "num_input_tokens_seen": 7948974080, "step": 27950, "train_runtime": 272306.8401, "train_tokens_per_second": 29191.239 }, { "epoch": 0.9892814573856663, "grad_norm": 1.421875, "learning_rate": 2.5663307217458428e-05, "loss": 1.0852390289306642, "num_input_tokens_seen": 7951878912, "step": 27960, "train_runtime": 272406.1756, "train_tokens_per_second": 29191.258 }, { "epoch": 0.9896352776493951, "grad_norm": 1.4921875, "learning_rate": 2.5659927486994893e-05, "loss": 1.075189971923828, "num_input_tokens_seen": 7954701824, "step": 27970, "train_runtime": 272502.0673, "train_tokens_per_second": 29191.345 }, { "epoch": 0.9899890979131238, "grad_norm": 1.515625, "learning_rate": 2.565654909146105e-05, "loss": 1.0853957176208495, "num_input_tokens_seen": 7957524096, "step": 27980, "train_runtime": 272599.2147, "train_tokens_per_second": 29191.295 }, { "epoch": 0.9903429181768526, "grad_norm": 1.609375, "learning_rate": 2.5653172029978346e-05, "loss": 1.094355010986328, "num_input_tokens_seen": 7960404800, "step": 27990, "train_runtime": 272696.3696, "train_tokens_per_second": 29191.459 }, { "epoch": 0.9906967384405814, "grad_norm": 1.453125, "learning_rate": 2.5649796301669014e-05, "loss": 1.0694226264953612, "num_input_tokens_seen": 7963204224, "step": 28000, "train_runtime": 272792.0419, "train_tokens_per_second": 29191.483 }, { "epoch": 0.9910505587043102, "grad_norm": 1.4921875, "learning_rate": 2.5646421905656148e-05, "loss": 1.0809826850891113, "num_input_tokens_seen": 7966060928, "step": 28010, "train_runtime": 272888.7173, "train_tokens_per_second": 29191.61 }, { "epoch": 0.991404378968039, "grad_norm": 1.5234375, "learning_rate": 2.5643048841063587e-05, "loss": 1.0588871955871582, "num_input_tokens_seen": 7968937280, "step": 28020, "train_runtime": 272987.0521, "train_tokens_per_second": 29191.631 }, { "epoch": 0.9917581992317678, "grad_norm": 1.5234375, "learning_rate": 2.563967710701603e-05, "loss": 1.0705137252807617, "num_input_tokens_seen": 7971751104, "step": 28030, "train_runtime": 273082.9606, "train_tokens_per_second": 29191.683 }, { "epoch": 0.9921120194954965, "grad_norm": 1.5234375, "learning_rate": 2.5636306702638946e-05, "loss": 1.0820624351501464, "num_input_tokens_seen": 7974506944, "step": 28040, "train_runtime": 273175.4305, "train_tokens_per_second": 29191.889 }, { "epoch": 0.9924658397592253, "grad_norm": 1.515625, "learning_rate": 2.5632937627058624e-05, "loss": 1.0849373817443848, "num_input_tokens_seen": 7977336320, "step": 28050, "train_runtime": 273271.1204, "train_tokens_per_second": 29192.021 }, { "epoch": 0.9928196600229541, "grad_norm": 1.546875, "learning_rate": 2.562956987940216e-05, "loss": 1.0767066955566407, "num_input_tokens_seen": 7980157952, "step": 28060, "train_runtime": 273366.2609, "train_tokens_per_second": 29192.183 }, { "epoch": 0.9931734802866828, "grad_norm": 1.515625, "learning_rate": 2.5626203458797432e-05, "loss": 1.081617546081543, "num_input_tokens_seen": 7983067456, "step": 28070, "train_runtime": 273467.7376, "train_tokens_per_second": 29191.99 }, { "epoch": 0.9935273005504116, "grad_norm": 1.4453125, "learning_rate": 2.562283836437315e-05, "loss": 1.0542971611022949, "num_input_tokens_seen": 7985969856, "step": 28080, "train_runtime": 273567.9491, "train_tokens_per_second": 29191.906 }, { "epoch": 0.9938811208141404, "grad_norm": 1.5546875, "learning_rate": 2.561947459525879e-05, "loss": 1.0764500617980957, "num_input_tokens_seen": 7988810048, "step": 28090, "train_runtime": 273663.805, "train_tokens_per_second": 29192.059 }, { "epoch": 0.9942349410778692, "grad_norm": 1.546875, "learning_rate": 2.561611215058466e-05, "loss": 1.0756690979003907, "num_input_tokens_seen": 7991675072, "step": 28100, "train_runtime": 273762.467, "train_tokens_per_second": 29192.004 }, { "epoch": 0.994588761341598, "grad_norm": 1.453125, "learning_rate": 2.5612751029481845e-05, "loss": 1.0747888565063477, "num_input_tokens_seen": 7994518144, "step": 28110, "train_runtime": 273858.9846, "train_tokens_per_second": 29192.097 }, { "epoch": 0.9949425816053268, "grad_norm": 1.4765625, "learning_rate": 2.560939123108225e-05, "loss": 1.064966583251953, "num_input_tokens_seen": 7997373312, "step": 28120, "train_runtime": 273959.6891, "train_tokens_per_second": 29191.789 }, { "epoch": 0.9952964018690555, "grad_norm": 1.5078125, "learning_rate": 2.560603275451855e-05, "loss": 1.0838247299194337, "num_input_tokens_seen": 8000276352, "step": 28130, "train_runtime": 274061.7482, "train_tokens_per_second": 29191.51 }, { "epoch": 0.9956502221327843, "grad_norm": 1.5703125, "learning_rate": 2.5602675598924227e-05, "loss": 1.0842864036560058, "num_input_tokens_seen": 8003102528, "step": 28140, "train_runtime": 274154.7946, "train_tokens_per_second": 29191.912 }, { "epoch": 0.9960040423965131, "grad_norm": 1.515625, "learning_rate": 2.5599319763433566e-05, "loss": 1.0867082595825195, "num_input_tokens_seen": 8005923840, "step": 28150, "train_runtime": 274252.3358, "train_tokens_per_second": 29191.816 }, { "epoch": 0.9963578626602418, "grad_norm": 1.515625, "learning_rate": 2.559596524718164e-05, "loss": 1.0674554824829101, "num_input_tokens_seen": 8008785664, "step": 28160, "train_runtime": 274349.5547, "train_tokens_per_second": 29191.903 }, { "epoch": 0.9967116829239706, "grad_norm": 1.4609375, "learning_rate": 2.559261204930431e-05, "loss": 1.091507911682129, "num_input_tokens_seen": 8011625856, "step": 28170, "train_runtime": 274446.9892, "train_tokens_per_second": 29191.888 }, { "epoch": 0.9970655031876995, "grad_norm": 1.4765625, "learning_rate": 2.558926016893824e-05, "loss": 1.0768211364746094, "num_input_tokens_seen": 8014461440, "step": 28180, "train_runtime": 274542.2935, "train_tokens_per_second": 29192.083 }, { "epoch": 0.9974193234514283, "grad_norm": 1.5234375, "learning_rate": 2.5585909605220877e-05, "loss": 1.0855039596557616, "num_input_tokens_seen": 8017315840, "step": 28190, "train_runtime": 274641.2073, "train_tokens_per_second": 29191.963 }, { "epoch": 0.997773143715157, "grad_norm": 1.5078125, "learning_rate": 2.558256035729046e-05, "loss": 1.0816872596740723, "num_input_tokens_seen": 8020148032, "step": 28200, "train_runtime": 274736.4116, "train_tokens_per_second": 29192.155 }, { "epoch": 0.9981269639788858, "grad_norm": 1.453125, "learning_rate": 2.557921242428602e-05, "loss": 1.086631679534912, "num_input_tokens_seen": 8022949056, "step": 28210, "train_runtime": 274831.3067, "train_tokens_per_second": 29192.268 }, { "epoch": 0.9984807842426145, "grad_norm": 1.4765625, "learning_rate": 2.557586580534737e-05, "loss": 1.056513500213623, "num_input_tokens_seen": 8025749568, "step": 28220, "train_runtime": 274925.6151, "train_tokens_per_second": 29192.44 }, { "epoch": 0.9988346045063433, "grad_norm": 1.5234375, "learning_rate": 2.5572520499615127e-05, "loss": 1.0795278549194336, "num_input_tokens_seen": 8028631680, "step": 28230, "train_runtime": 275025.6763, "train_tokens_per_second": 29192.299 }, { "epoch": 0.9991884247700721, "grad_norm": 1.4609375, "learning_rate": 2.5569176506230667e-05, "loss": 1.08691463470459, "num_input_tokens_seen": 8031430592, "step": 28240, "train_runtime": 275121.853, "train_tokens_per_second": 29192.267 }, { "epoch": 0.9995422450338008, "grad_norm": 1.390625, "learning_rate": 2.5565833824336183e-05, "loss": 1.0855924606323242, "num_input_tokens_seen": 8034253696, "step": 28250, "train_runtime": 275215.4158, "train_tokens_per_second": 29192.601 }, { "epoch": 0.9998960652975297, "grad_norm": 1.5, "learning_rate": 2.5562492453074633e-05, "loss": 1.0761659622192383, "num_input_tokens_seen": 8037056512, "step": 28260, "train_runtime": 275307.6235, "train_tokens_per_second": 29193.004 }, { "epoch": 1.0002476741846102, "grad_norm": 1.5078125, "learning_rate": 2.555915239158976e-05, "loss": 1.0461535453796387, "num_input_tokens_seen": 8039909376, "step": 28270, "train_runtime": 275416.9825, "train_tokens_per_second": 29191.771 }, { "epoch": 1.000601494448339, "grad_norm": 1.5234375, "learning_rate": 2.5555813639026093e-05, "loss": 1.0417590141296387, "num_input_tokens_seen": 8042756800, "step": 28280, "train_runtime": 275517.5656, "train_tokens_per_second": 29191.448 }, { "epoch": 1.0009553147120678, "grad_norm": 1.4375, "learning_rate": 2.5552476194528947e-05, "loss": 1.0575657844543458, "num_input_tokens_seen": 8045619328, "step": 28290, "train_runtime": 275616.865, "train_tokens_per_second": 29191.317 }, { "epoch": 1.0013091349757965, "grad_norm": 1.5078125, "learning_rate": 2.5549140057244413e-05, "loss": 1.0269801139831543, "num_input_tokens_seen": 8048455744, "step": 28300, "train_runtime": 275715.9639, "train_tokens_per_second": 29191.113 }, { "epoch": 1.0016629552395253, "grad_norm": 1.484375, "learning_rate": 2.5545805226319362e-05, "loss": 1.0488599777221679, "num_input_tokens_seen": 8051281152, "step": 28310, "train_runtime": 275813.2384, "train_tokens_per_second": 29191.061 }, { "epoch": 1.002016775503254, "grad_norm": 1.4609375, "learning_rate": 2.5542471700901453e-05, "loss": 1.0414800643920898, "num_input_tokens_seen": 8054102272, "step": 28320, "train_runtime": 275908.1793, "train_tokens_per_second": 29191.241 }, { "epoch": 1.0023705957669828, "grad_norm": 1.5859375, "learning_rate": 2.5539139480139113e-05, "loss": 1.052264404296875, "num_input_tokens_seen": 8056987648, "step": 28330, "train_runtime": 276008.6164, "train_tokens_per_second": 29191.073 }, { "epoch": 1.0027244160307116, "grad_norm": 1.4609375, "learning_rate": 2.5535808563181546e-05, "loss": 1.049784278869629, "num_input_tokens_seen": 8059853504, "step": 28340, "train_runtime": 276105.2063, "train_tokens_per_second": 29191.241 }, { "epoch": 1.0030782362944404, "grad_norm": 1.4296875, "learning_rate": 2.553247894917874e-05, "loss": 1.041153335571289, "num_input_tokens_seen": 8062724288, "step": 28350, "train_runtime": 276203.152, "train_tokens_per_second": 29191.283 }, { "epoch": 1.0034320565581691, "grad_norm": 1.4765625, "learning_rate": 2.5529150637281453e-05, "loss": 1.0391952514648437, "num_input_tokens_seen": 8065563840, "step": 28360, "train_runtime": 276302.6845, "train_tokens_per_second": 29191.044 }, { "epoch": 1.003785876821898, "grad_norm": 1.484375, "learning_rate": 2.552582362664122e-05, "loss": 1.0343010902404786, "num_input_tokens_seen": 8068325568, "step": 28370, "train_runtime": 276395.1137, "train_tokens_per_second": 29191.274 }, { "epoch": 1.0041396970856267, "grad_norm": 1.5078125, "learning_rate": 2.5522497916410353e-05, "loss": 1.0336405754089355, "num_input_tokens_seen": 8071166848, "step": 28380, "train_runtime": 276491.7165, "train_tokens_per_second": 29191.351 }, { "epoch": 1.0044935173493554, "grad_norm": 1.46875, "learning_rate": 2.5519173505741933e-05, "loss": 1.0573418617248536, "num_input_tokens_seen": 8074037760, "step": 28390, "train_runtime": 276592.852, "train_tokens_per_second": 29191.057 }, { "epoch": 1.0048473376130842, "grad_norm": 1.546875, "learning_rate": 2.551585039378981e-05, "loss": 1.048826026916504, "num_input_tokens_seen": 8076849536, "step": 28400, "train_runtime": 276688.5907, "train_tokens_per_second": 29191.119 }, { "epoch": 1.005201157876813, "grad_norm": 1.5078125, "learning_rate": 2.551252857970861e-05, "loss": 1.0556368827819824, "num_input_tokens_seen": 8079745472, "step": 28410, "train_runtime": 276788.3542, "train_tokens_per_second": 29191.06 }, { "epoch": 1.0055549781405417, "grad_norm": 1.6171875, "learning_rate": 2.5509208062653734e-05, "loss": 1.046487045288086, "num_input_tokens_seen": 8082548672, "step": 28420, "train_runtime": 276883.6851, "train_tokens_per_second": 29191.134 }, { "epoch": 1.0059087984042707, "grad_norm": 1.4765625, "learning_rate": 2.5505888841781333e-05, "loss": 1.0456127166748046, "num_input_tokens_seen": 8085400384, "step": 28430, "train_runtime": 276981.9673, "train_tokens_per_second": 29191.071 }, { "epoch": 1.0062626186679995, "grad_norm": 1.546875, "learning_rate": 2.5502570916248353e-05, "loss": 1.0565091133117677, "num_input_tokens_seen": 8088302272, "step": 28440, "train_runtime": 277083.7319, "train_tokens_per_second": 29190.823 }, { "epoch": 1.0066164389317283, "grad_norm": 1.5390625, "learning_rate": 2.5499254285212486e-05, "loss": 1.0428768157958985, "num_input_tokens_seen": 8091105088, "step": 28450, "train_runtime": 277177.3537, "train_tokens_per_second": 29191.076 }, { "epoch": 1.006970259195457, "grad_norm": 1.4921875, "learning_rate": 2.5495938947832204e-05, "loss": 1.0437034606933593, "num_input_tokens_seen": 8093894528, "step": 28460, "train_runtime": 277273.3659, "train_tokens_per_second": 29191.028 }, { "epoch": 1.0073240794591858, "grad_norm": 1.5078125, "learning_rate": 2.5492624903266732e-05, "loss": 1.0500662803649903, "num_input_tokens_seen": 8096779008, "step": 28470, "train_runtime": 277371.8951, "train_tokens_per_second": 29191.058 }, { "epoch": 1.0076778997229145, "grad_norm": 1.515625, "learning_rate": 2.548931215067607e-05, "loss": 1.058894157409668, "num_input_tokens_seen": 8099626048, "step": 28480, "train_runtime": 277469.7007, "train_tokens_per_second": 29191.029 }, { "epoch": 1.0080317199866433, "grad_norm": 1.5234375, "learning_rate": 2.5486000689220985e-05, "loss": 1.0497917175292968, "num_input_tokens_seen": 8102472448, "step": 28490, "train_runtime": 277565.7006, "train_tokens_per_second": 29191.188 }, { "epoch": 1.008385540250372, "grad_norm": 1.5625, "learning_rate": 2.5482690518062994e-05, "loss": 1.0561471939086915, "num_input_tokens_seen": 8105298176, "step": 28500, "train_runtime": 277663.5394, "train_tokens_per_second": 29191.078 }, { "epoch": 1.0087393605141008, "grad_norm": 1.578125, "learning_rate": 2.547938163636439e-05, "loss": 1.034977912902832, "num_input_tokens_seen": 8108137024, "step": 28510, "train_runtime": 277760.1941, "train_tokens_per_second": 29191.141 }, { "epoch": 1.0090931807778296, "grad_norm": 1.46875, "learning_rate": 2.5476074043288212e-05, "loss": 1.0483784675598145, "num_input_tokens_seen": 8110957248, "step": 28520, "train_runtime": 277854.8922, "train_tokens_per_second": 29191.342 }, { "epoch": 1.0094470010415584, "grad_norm": 1.5390625, "learning_rate": 2.547276773799827e-05, "loss": 1.052114486694336, "num_input_tokens_seen": 8113789056, "step": 28530, "train_runtime": 277949.4019, "train_tokens_per_second": 29191.605 }, { "epoch": 1.0098008213052871, "grad_norm": 1.5078125, "learning_rate": 2.5469462719659138e-05, "loss": 1.0433934211730957, "num_input_tokens_seen": 8116633408, "step": 28540, "train_runtime": 278049.5238, "train_tokens_per_second": 29191.323 }, { "epoch": 1.010154641569016, "grad_norm": 1.53125, "learning_rate": 2.5466158987436135e-05, "loss": 1.0439754486083985, "num_input_tokens_seen": 8119549888, "step": 28550, "train_runtime": 278151.2818, "train_tokens_per_second": 29191.129 }, { "epoch": 1.0105084618327447, "grad_norm": 1.4921875, "learning_rate": 2.5462856540495345e-05, "loss": 1.0415685653686524, "num_input_tokens_seen": 8122393088, "step": 28560, "train_runtime": 278248.9951, "train_tokens_per_second": 29191.096 }, { "epoch": 1.0108622820964734, "grad_norm": 1.5390625, "learning_rate": 2.5459555378003607e-05, "loss": 1.0535131454467774, "num_input_tokens_seen": 8125268992, "step": 28570, "train_runtime": 278351.2624, "train_tokens_per_second": 29190.703 }, { "epoch": 1.0112161023602022, "grad_norm": 1.4453125, "learning_rate": 2.545625549912853e-05, "loss": 1.0525379180908203, "num_input_tokens_seen": 8128035648, "step": 28580, "train_runtime": 278445.0144, "train_tokens_per_second": 29190.81 }, { "epoch": 1.011569922623931, "grad_norm": 1.53125, "learning_rate": 2.5452956903038445e-05, "loss": 1.047139549255371, "num_input_tokens_seen": 8130815040, "step": 28590, "train_runtime": 278538.075, "train_tokens_per_second": 29191.036 }, { "epoch": 1.01192374288766, "grad_norm": 1.5, "learning_rate": 2.5449659588902468e-05, "loss": 1.043433952331543, "num_input_tokens_seen": 8133671872, "step": 28600, "train_runtime": 278637.0429, "train_tokens_per_second": 29190.921 }, { "epoch": 1.0122775631513887, "grad_norm": 1.5078125, "learning_rate": 2.5446363555890464e-05, "loss": 1.0490514755249023, "num_input_tokens_seen": 8136553088, "step": 28610, "train_runtime": 278734.772, "train_tokens_per_second": 29191.023 }, { "epoch": 1.0126313834151175, "grad_norm": 1.5078125, "learning_rate": 2.5443068803173025e-05, "loss": 1.0465084075927735, "num_input_tokens_seen": 8139360896, "step": 28620, "train_runtime": 278829.9859, "train_tokens_per_second": 29191.125 }, { "epoch": 1.0129852036788463, "grad_norm": 1.453125, "learning_rate": 2.5439775329921533e-05, "loss": 1.0498362541198731, "num_input_tokens_seen": 8142155072, "step": 28630, "train_runtime": 278923.2515, "train_tokens_per_second": 29191.382 }, { "epoch": 1.013339023942575, "grad_norm": 1.6015625, "learning_rate": 2.5436483135308092e-05, "loss": 1.0487951278686523, "num_input_tokens_seen": 8144966400, "step": 28640, "train_runtime": 279019.0008, "train_tokens_per_second": 29191.44 }, { "epoch": 1.0136928442063038, "grad_norm": 1.453125, "learning_rate": 2.543319221850557e-05, "loss": 1.0545931816101075, "num_input_tokens_seen": 8147819264, "step": 28650, "train_runtime": 279115.6656, "train_tokens_per_second": 29191.551 }, { "epoch": 1.0140466644700326, "grad_norm": 1.5390625, "learning_rate": 2.542990257868757e-05, "loss": 1.0500198364257813, "num_input_tokens_seen": 8150625984, "step": 28660, "train_runtime": 279211.676, "train_tokens_per_second": 29191.566 }, { "epoch": 1.0144004847337613, "grad_norm": 1.5, "learning_rate": 2.542661421502846e-05, "loss": 1.0482884407043458, "num_input_tokens_seen": 8153499264, "step": 28670, "train_runtime": 279309.5145, "train_tokens_per_second": 29191.627 }, { "epoch": 1.01475430499749, "grad_norm": 1.5, "learning_rate": 2.5423327126703344e-05, "loss": 1.048494529724121, "num_input_tokens_seen": 8156353152, "step": 28680, "train_runtime": 279406.7758, "train_tokens_per_second": 29191.68 }, { "epoch": 1.0151081252612189, "grad_norm": 1.5, "learning_rate": 2.5420041312888078e-05, "loss": 1.0693546295166017, "num_input_tokens_seen": 8159211072, "step": 28690, "train_runtime": 279503.9132, "train_tokens_per_second": 29191.76 }, { "epoch": 1.0154619455249476, "grad_norm": 1.5703125, "learning_rate": 2.5416756772759254e-05, "loss": 1.04472074508667, "num_input_tokens_seen": 8162032448, "step": 28700, "train_runtime": 279597.2143, "train_tokens_per_second": 29192.109 }, { "epoch": 1.0158157657886764, "grad_norm": 1.5390625, "learning_rate": 2.5413473505494222e-05, "loss": 1.05493221282959, "num_input_tokens_seen": 8164826816, "step": 28710, "train_runtime": 279694.5835, "train_tokens_per_second": 29191.938 }, { "epoch": 1.0161695860524051, "grad_norm": 1.4609375, "learning_rate": 2.5410191510271063e-05, "loss": 1.036782455444336, "num_input_tokens_seen": 8167666688, "step": 28720, "train_runtime": 279790.8071, "train_tokens_per_second": 29192.048 }, { "epoch": 1.016523406316134, "grad_norm": 1.484375, "learning_rate": 2.5406910786268613e-05, "loss": 1.0539432525634767, "num_input_tokens_seen": 8170509952, "step": 28730, "train_runtime": 279889.4772, "train_tokens_per_second": 29191.915 }, { "epoch": 1.0168772265798627, "grad_norm": 1.4921875, "learning_rate": 2.5403631332666444e-05, "loss": 1.06082763671875, "num_input_tokens_seen": 8173393088, "step": 28740, "train_runtime": 279987.6446, "train_tokens_per_second": 29191.978 }, { "epoch": 1.0172310468435914, "grad_norm": 1.5546875, "learning_rate": 2.5400353148644863e-05, "loss": 1.0518483161926269, "num_input_tokens_seen": 8176212416, "step": 28750, "train_runtime": 280084.6557, "train_tokens_per_second": 29191.933 }, { "epoch": 1.0175848671073202, "grad_norm": 1.546875, "learning_rate": 2.5397076233384925e-05, "loss": 1.0547897338867187, "num_input_tokens_seen": 8179049152, "step": 28760, "train_runtime": 280180.7249, "train_tokens_per_second": 29192.048 }, { "epoch": 1.0179386873710492, "grad_norm": 1.5, "learning_rate": 2.539380058606843e-05, "loss": 1.0515294075012207, "num_input_tokens_seen": 8181930752, "step": 28770, "train_runtime": 280279.034, "train_tokens_per_second": 29192.09 }, { "epoch": 1.018292507634778, "grad_norm": 1.5703125, "learning_rate": 2.5390526205877895e-05, "loss": 1.0550987243652343, "num_input_tokens_seen": 8184747072, "step": 28780, "train_runtime": 280374.1012, "train_tokens_per_second": 29192.237 }, { "epoch": 1.0186463278985067, "grad_norm": 1.546875, "learning_rate": 2.53872530919966e-05, "loss": 1.0469552993774414, "num_input_tokens_seen": 8187612480, "step": 28790, "train_runtime": 280474.4117, "train_tokens_per_second": 29192.012 }, { "epoch": 1.0190001481622355, "grad_norm": 1.46875, "learning_rate": 2.5383981243608547e-05, "loss": 1.0461732864379882, "num_input_tokens_seen": 8190449536, "step": 28800, "train_runtime": 280571.5129, "train_tokens_per_second": 29192.021 }, { "epoch": 1.0193539684259643, "grad_norm": 1.5234375, "learning_rate": 2.5380710659898476e-05, "loss": 1.0500362396240235, "num_input_tokens_seen": 8193309440, "step": 28810, "train_runtime": 280669.6368, "train_tokens_per_second": 29192.005 }, { "epoch": 1.019707788689693, "grad_norm": 1.4765625, "learning_rate": 2.537744134005187e-05, "loss": 1.0477670669555663, "num_input_tokens_seen": 8196130880, "step": 28820, "train_runtime": 280766.7364, "train_tokens_per_second": 29191.958 }, { "epoch": 1.0200616089534218, "grad_norm": 1.5859375, "learning_rate": 2.537417328325493e-05, "loss": 1.0487887382507324, "num_input_tokens_seen": 8198935744, "step": 28830, "train_runtime": 280860.5953, "train_tokens_per_second": 29192.19 }, { "epoch": 1.0204154292171506, "grad_norm": 1.453125, "learning_rate": 2.5370906488694606e-05, "loss": 1.0366425514221191, "num_input_tokens_seen": 8201811456, "step": 28840, "train_runtime": 280959.9854, "train_tokens_per_second": 29192.098 }, { "epoch": 1.0207692494808793, "grad_norm": 1.5, "learning_rate": 2.536764095555857e-05, "loss": 1.043288803100586, "num_input_tokens_seen": 8204692032, "step": 28850, "train_runtime": 281059.1685, "train_tokens_per_second": 29192.045 }, { "epoch": 1.021123069744608, "grad_norm": 1.5546875, "learning_rate": 2.536437668303524e-05, "loss": 1.0415903091430665, "num_input_tokens_seen": 8207528256, "step": 28860, "train_runtime": 281157.7158, "train_tokens_per_second": 29191.901 }, { "epoch": 1.0214768900083369, "grad_norm": 1.46875, "learning_rate": 2.5361113670313745e-05, "loss": 1.0549073219299316, "num_input_tokens_seen": 8210386176, "step": 28870, "train_runtime": 281256.8691, "train_tokens_per_second": 29191.771 }, { "epoch": 1.0218307102720656, "grad_norm": 1.5078125, "learning_rate": 2.5357851916583964e-05, "loss": 1.052191162109375, "num_input_tokens_seen": 8213194304, "step": 28880, "train_runtime": 281351.9924, "train_tokens_per_second": 29191.883 }, { "epoch": 1.0221845305357944, "grad_norm": 1.5703125, "learning_rate": 2.5354591421036485e-05, "loss": 1.042929458618164, "num_input_tokens_seen": 8216071488, "step": 28890, "train_runtime": 281450.8002, "train_tokens_per_second": 29191.857 }, { "epoch": 1.0225383507995232, "grad_norm": 1.5390625, "learning_rate": 2.5351332182862643e-05, "loss": 1.049736785888672, "num_input_tokens_seen": 8218899968, "step": 28900, "train_runtime": 281546.6597, "train_tokens_per_second": 29191.964 }, { "epoch": 1.022892171063252, "grad_norm": 1.5625, "learning_rate": 2.5348074201254484e-05, "loss": 1.0518577575683594, "num_input_tokens_seen": 8221649344, "step": 28910, "train_runtime": 281637.9698, "train_tokens_per_second": 29192.262 }, { "epoch": 1.0232459913269807, "grad_norm": 1.5390625, "learning_rate": 2.53448174754048e-05, "loss": 1.0536100387573242, "num_input_tokens_seen": 8224446976, "step": 28920, "train_runtime": 281731.1291, "train_tokens_per_second": 29192.539 }, { "epoch": 1.0235998115907097, "grad_norm": 1.5703125, "learning_rate": 2.5341562004507087e-05, "loss": 1.0543691635131835, "num_input_tokens_seen": 8227288704, "step": 28930, "train_runtime": 281826.1467, "train_tokens_per_second": 29192.78 }, { "epoch": 1.0239536318544384, "grad_norm": 1.6171875, "learning_rate": 2.5338307787755583e-05, "loss": 1.0539840698242187, "num_input_tokens_seen": 8230196608, "step": 28940, "train_runtime": 281927.6811, "train_tokens_per_second": 29192.581 }, { "epoch": 1.0243074521181672, "grad_norm": 1.53125, "learning_rate": 2.533505482434524e-05, "loss": 1.0509790420532226, "num_input_tokens_seen": 8233026688, "step": 28950, "train_runtime": 282024.9214, "train_tokens_per_second": 29192.55 }, { "epoch": 1.024661272381896, "grad_norm": 1.5546875, "learning_rate": 2.533180311347174e-05, "loss": 1.049030876159668, "num_input_tokens_seen": 8235850176, "step": 28960, "train_runtime": 282119.1461, "train_tokens_per_second": 29192.808 }, { "epoch": 1.0250150926456247, "grad_norm": 1.5390625, "learning_rate": 2.532855265433149e-05, "loss": 1.0446240425109863, "num_input_tokens_seen": 8238641280, "step": 28970, "train_runtime": 282215.9284, "train_tokens_per_second": 29192.687 }, { "epoch": 1.0253689129093535, "grad_norm": 1.515625, "learning_rate": 2.5325303446121602e-05, "loss": 1.0574220657348632, "num_input_tokens_seen": 8241520448, "step": 28980, "train_runtime": 282317.7652, "train_tokens_per_second": 29192.355 }, { "epoch": 1.0257227331730823, "grad_norm": 1.515625, "learning_rate": 2.532205548803992e-05, "loss": 1.0444223403930664, "num_input_tokens_seen": 8244379776, "step": 28990, "train_runtime": 282416.3548, "train_tokens_per_second": 29192.289 }, { "epoch": 1.026076553436811, "grad_norm": 1.4609375, "learning_rate": 2.531880877928502e-05, "loss": 1.0516919136047362, "num_input_tokens_seen": 8247211264, "step": 29000, "train_runtime": 282511.9789, "train_tokens_per_second": 29192.43 }, { "epoch": 1.0264303737005398, "grad_norm": 1.4921875, "learning_rate": 2.5315563319056173e-05, "loss": 1.0510659217834473, "num_input_tokens_seen": 8250072320, "step": 29010, "train_runtime": 282611.1781, "train_tokens_per_second": 29192.307 }, { "epoch": 1.0267841939642686, "grad_norm": 1.4375, "learning_rate": 2.5312319106553384e-05, "loss": 1.04381103515625, "num_input_tokens_seen": 8252970432, "step": 29020, "train_runtime": 282709.0952, "train_tokens_per_second": 29192.448 }, { "epoch": 1.0271380142279973, "grad_norm": 1.5390625, "learning_rate": 2.5309076140977378e-05, "loss": 1.0518154144287108, "num_input_tokens_seen": 8255750656, "step": 29030, "train_runtime": 282802.0084, "train_tokens_per_second": 29192.688 }, { "epoch": 1.027491834491726, "grad_norm": 1.5, "learning_rate": 2.530583442152958e-05, "loss": 1.0532559394836425, "num_input_tokens_seen": 8258627008, "step": 29040, "train_runtime": 282902.0275, "train_tokens_per_second": 29192.534 }, { "epoch": 1.0278456547554549, "grad_norm": 1.515625, "learning_rate": 2.5302593947412147e-05, "loss": 1.0552700996398925, "num_input_tokens_seen": 8261513408, "step": 29050, "train_runtime": 283000.5129, "train_tokens_per_second": 29192.574 }, { "epoch": 1.0281994750191836, "grad_norm": 1.609375, "learning_rate": 2.529935471782794e-05, "loss": 1.0474486351013184, "num_input_tokens_seen": 8264319104, "step": 29060, "train_runtime": 283097.2607, "train_tokens_per_second": 29192.508 }, { "epoch": 1.0285532952829124, "grad_norm": 1.5078125, "learning_rate": 2.5296116731980547e-05, "loss": 1.046504020690918, "num_input_tokens_seen": 8267183424, "step": 29070, "train_runtime": 283196.3407, "train_tokens_per_second": 29192.409 }, { "epoch": 1.0289071155466412, "grad_norm": 1.546875, "learning_rate": 2.529287998907426e-05, "loss": 1.0457409858703612, "num_input_tokens_seen": 8270033920, "step": 29080, "train_runtime": 283293.893, "train_tokens_per_second": 29192.419 }, { "epoch": 1.02926093581037, "grad_norm": 1.515625, "learning_rate": 2.528964448831408e-05, "loss": 1.04161376953125, "num_input_tokens_seen": 8272901376, "step": 29090, "train_runtime": 283388.9958, "train_tokens_per_second": 29192.74 }, { "epoch": 1.029614756074099, "grad_norm": 1.5625, "learning_rate": 2.5286410228905727e-05, "loss": 1.0571967124938966, "num_input_tokens_seen": 8275804544, "step": 29100, "train_runtime": 283490.7586, "train_tokens_per_second": 29192.502 }, { "epoch": 1.0299685763378277, "grad_norm": 1.421875, "learning_rate": 2.5283177210055632e-05, "loss": 1.057651901245117, "num_input_tokens_seen": 8278685440, "step": 29110, "train_runtime": 283588.2622, "train_tokens_per_second": 29192.624 }, { "epoch": 1.0303223966015564, "grad_norm": 1.53125, "learning_rate": 2.527994543097093e-05, "loss": 1.0562969207763673, "num_input_tokens_seen": 8281519168, "step": 29120, "train_runtime": 283682.8297, "train_tokens_per_second": 29192.881 }, { "epoch": 1.0306762168652852, "grad_norm": 1.53125, "learning_rate": 2.5276714890859472e-05, "loss": 1.033643913269043, "num_input_tokens_seen": 8284398976, "step": 29130, "train_runtime": 283781.6278, "train_tokens_per_second": 29192.866 }, { "epoch": 1.031030037129014, "grad_norm": 1.4609375, "learning_rate": 2.527348558892981e-05, "loss": 1.0283584594726562, "num_input_tokens_seen": 8287274432, "step": 29140, "train_runtime": 283881.0966, "train_tokens_per_second": 29192.766 }, { "epoch": 1.0313838573927427, "grad_norm": 1.515625, "learning_rate": 2.5270257524391223e-05, "loss": 1.0556285858154297, "num_input_tokens_seen": 8290079808, "step": 29150, "train_runtime": 283977.7187, "train_tokens_per_second": 29192.712 }, { "epoch": 1.0317376776564715, "grad_norm": 1.53125, "learning_rate": 2.526703069645366e-05, "loss": 1.054032325744629, "num_input_tokens_seen": 8292949888, "step": 29160, "train_runtime": 284077.3842, "train_tokens_per_second": 29192.573 }, { "epoch": 1.0320914979202003, "grad_norm": 1.453125, "learning_rate": 2.5263805104327815e-05, "loss": 1.0340589523315429, "num_input_tokens_seen": 8295789568, "step": 29170, "train_runtime": 284174.5491, "train_tokens_per_second": 29192.585 }, { "epoch": 1.032445318183929, "grad_norm": 1.4921875, "learning_rate": 2.526058074722506e-05, "loss": 1.0599351882934571, "num_input_tokens_seen": 8298608576, "step": 29180, "train_runtime": 284268.5552, "train_tokens_per_second": 29192.847 }, { "epoch": 1.0327991384476578, "grad_norm": 1.453125, "learning_rate": 2.5257357624357485e-05, "loss": 1.0520073890686035, "num_input_tokens_seen": 8301422400, "step": 29190, "train_runtime": 284364.9755, "train_tokens_per_second": 29192.844 }, { "epoch": 1.0331529587113866, "grad_norm": 1.484375, "learning_rate": 2.525413573493788e-05, "loss": 1.0312509536743164, "num_input_tokens_seen": 8304241792, "step": 29200, "train_runtime": 284460.9569, "train_tokens_per_second": 29192.905 }, { "epoch": 1.0335067789751153, "grad_norm": 1.4921875, "learning_rate": 2.525091507817974e-05, "loss": 1.0496007919311523, "num_input_tokens_seen": 8307077248, "step": 29210, "train_runtime": 284557.768, "train_tokens_per_second": 29192.938 }, { "epoch": 1.033860599238844, "grad_norm": 1.5234375, "learning_rate": 2.524769565329725e-05, "loss": 1.0554866790771484, "num_input_tokens_seen": 8309927040, "step": 29220, "train_runtime": 284655.4133, "train_tokens_per_second": 29192.935 }, { "epoch": 1.0342144195025729, "grad_norm": 1.4921875, "learning_rate": 2.5244477459505317e-05, "loss": 1.055649185180664, "num_input_tokens_seen": 8312778944, "step": 29230, "train_runtime": 284756.1336, "train_tokens_per_second": 29192.625 }, { "epoch": 1.0345682397663016, "grad_norm": 1.5234375, "learning_rate": 2.524126049601953e-05, "loss": 1.0521562576293946, "num_input_tokens_seen": 8315668160, "step": 29240, "train_runtime": 284855.8212, "train_tokens_per_second": 29192.551 }, { "epoch": 1.0349220600300304, "grad_norm": 1.6015625, "learning_rate": 2.523804476205619e-05, "loss": 1.048072910308838, "num_input_tokens_seen": 8318459328, "step": 29250, "train_runtime": 284949.3712, "train_tokens_per_second": 29192.763 }, { "epoch": 1.0352758802937592, "grad_norm": 1.5625, "learning_rate": 2.5234830256832292e-05, "loss": 1.048440933227539, "num_input_tokens_seen": 8321299904, "step": 29260, "train_runtime": 285048.8669, "train_tokens_per_second": 29192.538 }, { "epoch": 1.0356297005574882, "grad_norm": 1.46875, "learning_rate": 2.523161697956552e-05, "loss": 1.0441511154174805, "num_input_tokens_seen": 8324117120, "step": 29270, "train_runtime": 285143.902, "train_tokens_per_second": 29192.689 }, { "epoch": 1.035983520821217, "grad_norm": 1.53125, "learning_rate": 2.522840492947427e-05, "loss": 1.0370633125305175, "num_input_tokens_seen": 8326990528, "step": 29280, "train_runtime": 285243.335, "train_tokens_per_second": 29192.586 }, { "epoch": 1.0363373410849457, "grad_norm": 1.5078125, "learning_rate": 2.5225194105777628e-05, "loss": 1.0461969375610352, "num_input_tokens_seen": 8329845760, "step": 29290, "train_runtime": 285341.7318, "train_tokens_per_second": 29192.525 }, { "epoch": 1.0366911613486745, "grad_norm": 1.4921875, "learning_rate": 2.5221984507695367e-05, "loss": 1.0469532012939453, "num_input_tokens_seen": 8332707136, "step": 29300, "train_runtime": 285437.741, "train_tokens_per_second": 29192.731 }, { "epoch": 1.0370449816124032, "grad_norm": 1.53125, "learning_rate": 2.5218776134447975e-05, "loss": 1.0551328659057617, "num_input_tokens_seen": 8335544064, "step": 29310, "train_runtime": 285535.4016, "train_tokens_per_second": 29192.682 }, { "epoch": 1.037398801876132, "grad_norm": 1.4609375, "learning_rate": 2.5215568985256617e-05, "loss": 1.0431121826171874, "num_input_tokens_seen": 8338327616, "step": 29320, "train_runtime": 285628.1199, "train_tokens_per_second": 29192.951 }, { "epoch": 1.0377526221398607, "grad_norm": 1.484375, "learning_rate": 2.5212363059343154e-05, "loss": 1.0485538482666015, "num_input_tokens_seen": 8341245440, "step": 29330, "train_runtime": 285729.3202, "train_tokens_per_second": 29192.823 }, { "epoch": 1.0381064424035895, "grad_norm": 1.5859375, "learning_rate": 2.520915835593014e-05, "loss": 1.0576911926269532, "num_input_tokens_seen": 8344038784, "step": 29340, "train_runtime": 285822.911, "train_tokens_per_second": 29193.037 }, { "epoch": 1.0384602626673183, "grad_norm": 1.4921875, "learning_rate": 2.5205954874240828e-05, "loss": 1.0524527549743652, "num_input_tokens_seen": 8346882368, "step": 29350, "train_runtime": 285918.9176, "train_tokens_per_second": 29193.18 }, { "epoch": 1.038814082931047, "grad_norm": 1.4375, "learning_rate": 2.5202752613499154e-05, "loss": 1.0630861282348634, "num_input_tokens_seen": 8349779264, "step": 29360, "train_runtime": 286018.5129, "train_tokens_per_second": 29193.143 }, { "epoch": 1.0391679031947758, "grad_norm": 1.4609375, "learning_rate": 2.5199551572929743e-05, "loss": 1.0630492210388183, "num_input_tokens_seen": 8352670208, "step": 29370, "train_runtime": 286119.9668, "train_tokens_per_second": 29192.895 }, { "epoch": 1.0395217234585046, "grad_norm": 1.6015625, "learning_rate": 2.5196351751757913e-05, "loss": 1.0535256385803222, "num_input_tokens_seen": 8355529344, "step": 29380, "train_runtime": 286217.5474, "train_tokens_per_second": 29192.932 }, { "epoch": 1.0398755437222333, "grad_norm": 1.640625, "learning_rate": 2.5193153149209664e-05, "loss": 1.048048210144043, "num_input_tokens_seen": 8358456000, "step": 29390, "train_runtime": 286322.1492, "train_tokens_per_second": 29192.488 }, { "epoch": 1.040229363985962, "grad_norm": 1.5234375, "learning_rate": 2.5189955764511702e-05, "loss": 1.034145450592041, "num_input_tokens_seen": 8361291264, "step": 29400, "train_runtime": 286419.7113, "train_tokens_per_second": 29192.444 }, { "epoch": 1.0405831842496909, "grad_norm": 1.4921875, "learning_rate": 2.5186759596891398e-05, "loss": 1.0371543884277343, "num_input_tokens_seen": 8364111616, "step": 29410, "train_runtime": 286516.0903, "train_tokens_per_second": 29192.467 }, { "epoch": 1.0409370045134196, "grad_norm": 1.546875, "learning_rate": 2.518356464557682e-05, "loss": 1.0476859092712403, "num_input_tokens_seen": 8366962112, "step": 29420, "train_runtime": 286613.6514, "train_tokens_per_second": 29192.476 }, { "epoch": 1.0412908247771484, "grad_norm": 1.5234375, "learning_rate": 2.5180370909796718e-05, "loss": 1.0342678070068358, "num_input_tokens_seen": 8369782848, "step": 29430, "train_runtime": 286707.073, "train_tokens_per_second": 29192.802 }, { "epoch": 1.0416446450408774, "grad_norm": 1.5, "learning_rate": 2.5177178388780527e-05, "loss": 1.0435821533203125, "num_input_tokens_seen": 8372579840, "step": 29440, "train_runtime": 286799.8777, "train_tokens_per_second": 29193.108 }, { "epoch": 1.0419984653046062, "grad_norm": 1.515625, "learning_rate": 2.5173987081758372e-05, "loss": 1.055179977416992, "num_input_tokens_seen": 8375406144, "step": 29450, "train_runtime": 286895.2872, "train_tokens_per_second": 29193.251 }, { "epoch": 1.042352285568335, "grad_norm": 1.5390625, "learning_rate": 2.5170796987961044e-05, "loss": 1.054011344909668, "num_input_tokens_seen": 8378244928, "step": 29460, "train_runtime": 286990.2973, "train_tokens_per_second": 29193.478 }, { "epoch": 1.0427061058320637, "grad_norm": 1.5625, "learning_rate": 2.516760810662004e-05, "loss": 1.041065788269043, "num_input_tokens_seen": 8381078592, "step": 29470, "train_runtime": 287087.1308, "train_tokens_per_second": 29193.502 }, { "epoch": 1.0430599260957925, "grad_norm": 1.4765625, "learning_rate": 2.5164420436967517e-05, "loss": 1.044297218322754, "num_input_tokens_seen": 8383939776, "step": 29480, "train_runtime": 287185.443, "train_tokens_per_second": 29193.471 }, { "epoch": 1.0434137463595212, "grad_norm": 1.4765625, "learning_rate": 2.516123397823632e-05, "loss": 1.046547031402588, "num_input_tokens_seen": 8386789760, "step": 29490, "train_runtime": 287283.4915, "train_tokens_per_second": 29193.427 }, { "epoch": 1.04376756662325, "grad_norm": 1.5, "learning_rate": 2.5158048729659988e-05, "loss": 1.0549219131469727, "num_input_tokens_seen": 8389647168, "step": 29500, "train_runtime": 287381.562, "train_tokens_per_second": 29193.408 }, { "epoch": 1.0441213868869788, "grad_norm": 1.5234375, "learning_rate": 2.5154864690472714e-05, "loss": 1.0541885375976563, "num_input_tokens_seen": 8392480128, "step": 29510, "train_runtime": 287478.7503, "train_tokens_per_second": 29193.393 }, { "epoch": 1.0444752071507075, "grad_norm": 1.53125, "learning_rate": 2.5151681859909383e-05, "loss": 1.0468287467956543, "num_input_tokens_seen": 8395303808, "step": 29520, "train_runtime": 287575.499, "train_tokens_per_second": 29193.39 }, { "epoch": 1.0448290274144363, "grad_norm": 1.4921875, "learning_rate": 2.5148500237205564e-05, "loss": 1.047328567504883, "num_input_tokens_seen": 8398207104, "step": 29530, "train_runtime": 287677.9103, "train_tokens_per_second": 29193.09 }, { "epoch": 1.045182847678165, "grad_norm": 1.5, "learning_rate": 2.514531982159748e-05, "loss": 1.0507135391235352, "num_input_tokens_seen": 8401092352, "step": 29540, "train_runtime": 287777.3632, "train_tokens_per_second": 29193.027 }, { "epoch": 1.0455366679418938, "grad_norm": 1.546875, "learning_rate": 2.5142140612322056e-05, "loss": 1.042203712463379, "num_input_tokens_seen": 8403973376, "step": 29550, "train_runtime": 287876.823, "train_tokens_per_second": 29192.949 }, { "epoch": 1.0458904882056226, "grad_norm": 1.5078125, "learning_rate": 2.5138962608616883e-05, "loss": 1.0546101570129394, "num_input_tokens_seen": 8406783168, "step": 29560, "train_runtime": 287970.1057, "train_tokens_per_second": 29193.25 }, { "epoch": 1.0462443084693513, "grad_norm": 1.5390625, "learning_rate": 2.513578580972022e-05, "loss": 1.0395442962646484, "num_input_tokens_seen": 8409632128, "step": 29570, "train_runtime": 288066.8315, "train_tokens_per_second": 29193.337 }, { "epoch": 1.0465981287330801, "grad_norm": 1.5390625, "learning_rate": 2.5132610214871e-05, "loss": 1.0510801315307616, "num_input_tokens_seen": 8412488576, "step": 29580, "train_runtime": 288164.4564, "train_tokens_per_second": 29193.36 }, { "epoch": 1.0469519489968089, "grad_norm": 1.53125, "learning_rate": 2.5129435823308835e-05, "loss": 1.0485179901123047, "num_input_tokens_seen": 8415376256, "step": 29590, "train_runtime": 288262.9087, "train_tokens_per_second": 29193.406 }, { "epoch": 1.0473057692605379, "grad_norm": 1.46875, "learning_rate": 2.5126262634274012e-05, "loss": 1.0595196723937987, "num_input_tokens_seen": 8418174016, "step": 29600, "train_runtime": 288359.3351, "train_tokens_per_second": 29193.347 }, { "epoch": 1.0476595895242666, "grad_norm": 1.5703125, "learning_rate": 2.512309064700748e-05, "loss": 1.042276954650879, "num_input_tokens_seen": 8420998912, "step": 29610, "train_runtime": 288456.3795, "train_tokens_per_second": 29193.318 }, { "epoch": 1.0480134097879954, "grad_norm": 1.4609375, "learning_rate": 2.511991986075086e-05, "loss": 1.0346954345703125, "num_input_tokens_seen": 8423861184, "step": 29620, "train_runtime": 288553.7079, "train_tokens_per_second": 29193.391 }, { "epoch": 1.0483672300517242, "grad_norm": 1.546875, "learning_rate": 2.511675027474645e-05, "loss": 1.0535845756530762, "num_input_tokens_seen": 8426761344, "step": 29630, "train_runtime": 288652.5121, "train_tokens_per_second": 29193.445 }, { "epoch": 1.048721050315453, "grad_norm": 1.578125, "learning_rate": 2.5113581888237215e-05, "loss": 1.0491786003112793, "num_input_tokens_seen": 8429587008, "step": 29640, "train_runtime": 288748.2343, "train_tokens_per_second": 29193.553 }, { "epoch": 1.0490748705791817, "grad_norm": 1.5703125, "learning_rate": 2.5110414700466782e-05, "loss": 1.0429922103881837, "num_input_tokens_seen": 8432394048, "step": 29650, "train_runtime": 288844.8743, "train_tokens_per_second": 29193.504 }, { "epoch": 1.0494286908429105, "grad_norm": 1.515625, "learning_rate": 2.5107248710679447e-05, "loss": 1.041240119934082, "num_input_tokens_seen": 8435300096, "step": 29660, "train_runtime": 288944.605, "train_tokens_per_second": 29193.485 }, { "epoch": 1.0497825111066392, "grad_norm": 1.5703125, "learning_rate": 2.5104083918120187e-05, "loss": 1.0659772872924804, "num_input_tokens_seen": 8438190336, "step": 29670, "train_runtime": 289045.2337, "train_tokens_per_second": 29193.321 }, { "epoch": 1.050136331370368, "grad_norm": 1.484375, "learning_rate": 2.5100920322034615e-05, "loss": 1.0506914138793946, "num_input_tokens_seen": 8441038080, "step": 29680, "train_runtime": 289144.1649, "train_tokens_per_second": 29193.181 }, { "epoch": 1.0504901516340968, "grad_norm": 1.5078125, "learning_rate": 2.5097757921669047e-05, "loss": 1.0402145385742188, "num_input_tokens_seen": 8443878784, "step": 29690, "train_runtime": 289242.1086, "train_tokens_per_second": 29193.117 }, { "epoch": 1.0508439718978255, "grad_norm": 1.5546875, "learning_rate": 2.509459671627043e-05, "loss": 1.0512310028076173, "num_input_tokens_seen": 8446693824, "step": 29700, "train_runtime": 289336.745, "train_tokens_per_second": 29193.298 }, { "epoch": 1.0511977921615543, "grad_norm": 1.4296875, "learning_rate": 2.50914367050864e-05, "loss": 1.048554039001465, "num_input_tokens_seen": 8449562112, "step": 29710, "train_runtime": 289434.8572, "train_tokens_per_second": 29193.312 }, { "epoch": 1.051551612425283, "grad_norm": 1.5078125, "learning_rate": 2.5088277887365236e-05, "loss": 1.0454522132873536, "num_input_tokens_seen": 8452375104, "step": 29720, "train_runtime": 289529.9637, "train_tokens_per_second": 29193.438 }, { "epoch": 1.0519054326890118, "grad_norm": 1.515625, "learning_rate": 2.5085120262355895e-05, "loss": 1.0414667129516602, "num_input_tokens_seen": 8455174848, "step": 29730, "train_runtime": 289623.5498, "train_tokens_per_second": 29193.672 }, { "epoch": 1.0522592529527406, "grad_norm": 1.453125, "learning_rate": 2.5081963829307987e-05, "loss": 1.0501920700073242, "num_input_tokens_seen": 8458032256, "step": 29740, "train_runtime": 289723.9768, "train_tokens_per_second": 29193.415 }, { "epoch": 1.0526130732164694, "grad_norm": 1.546875, "learning_rate": 2.507880858747178e-05, "loss": 1.0454265594482421, "num_input_tokens_seen": 8460895680, "step": 29750, "train_runtime": 289820.1731, "train_tokens_per_second": 29193.605 }, { "epoch": 1.0529668934801983, "grad_norm": 1.6015625, "learning_rate": 2.5075654536098213e-05, "loss": 1.0526483535766602, "num_input_tokens_seen": 8463737536, "step": 29760, "train_runtime": 289916.4064, "train_tokens_per_second": 29193.717 }, { "epoch": 1.053320713743927, "grad_norm": 1.5703125, "learning_rate": 2.5072501674438875e-05, "loss": 1.0564079284667969, "num_input_tokens_seen": 8466601408, "step": 29770, "train_runtime": 290016.9172, "train_tokens_per_second": 29193.474 }, { "epoch": 1.0536745340076559, "grad_norm": 1.5078125, "learning_rate": 2.5069350001746017e-05, "loss": 1.054703140258789, "num_input_tokens_seen": 8469489536, "step": 29780, "train_runtime": 290119.8698, "train_tokens_per_second": 29193.07 }, { "epoch": 1.0540283542713846, "grad_norm": 1.5625, "learning_rate": 2.506619951727255e-05, "loss": 1.0509763717651368, "num_input_tokens_seen": 8472355136, "step": 29790, "train_runtime": 290220.2752, "train_tokens_per_second": 29192.844 }, { "epoch": 1.0543821745351134, "grad_norm": 1.515625, "learning_rate": 2.5063050220272033e-05, "loss": 1.0431835174560546, "num_input_tokens_seen": 8475185664, "step": 29800, "train_runtime": 290315.7879, "train_tokens_per_second": 29192.989 }, { "epoch": 1.0547359947988422, "grad_norm": 1.5390625, "learning_rate": 2.5059902109998696e-05, "loss": 1.039987564086914, "num_input_tokens_seen": 8478013504, "step": 29810, "train_runtime": 290410.6227, "train_tokens_per_second": 29193.194 }, { "epoch": 1.055089815062571, "grad_norm": 1.484375, "learning_rate": 2.505675518570741e-05, "loss": 1.03611421585083, "num_input_tokens_seen": 8480837376, "step": 29820, "train_runtime": 290507.0359, "train_tokens_per_second": 29193.225 }, { "epoch": 1.0554436353262997, "grad_norm": 1.5703125, "learning_rate": 2.505360944665371e-05, "loss": 1.0449862480163574, "num_input_tokens_seen": 8483714496, "step": 29830, "train_runtime": 290607.6559, "train_tokens_per_second": 29193.018 }, { "epoch": 1.0557974555900285, "grad_norm": 1.53125, "learning_rate": 2.5050464892093777e-05, "loss": 1.0410438537597657, "num_input_tokens_seen": 8486601152, "step": 29840, "train_runtime": 290707.6858, "train_tokens_per_second": 29192.903 }, { "epoch": 1.0561512758537572, "grad_norm": 1.625, "learning_rate": 2.5047321521284463e-05, "loss": 1.053577995300293, "num_input_tokens_seen": 8489445376, "step": 29850, "train_runtime": 290806.0966, "train_tokens_per_second": 29192.804 }, { "epoch": 1.056505096117486, "grad_norm": 1.5703125, "learning_rate": 2.5044179333483243e-05, "loss": 1.0501842498779297, "num_input_tokens_seen": 8492256192, "step": 29860, "train_runtime": 290901.0884, "train_tokens_per_second": 29192.934 }, { "epoch": 1.0568589163812148, "grad_norm": 1.4921875, "learning_rate": 2.5041038327948274e-05, "loss": 1.038751220703125, "num_input_tokens_seen": 8495081984, "step": 29870, "train_runtime": 290997.3531, "train_tokens_per_second": 29192.987 }, { "epoch": 1.0572127366449435, "grad_norm": 1.53125, "learning_rate": 2.5037898503938346e-05, "loss": 1.0530385017395019, "num_input_tokens_seen": 8497885824, "step": 29880, "train_runtime": 291092.1869, "train_tokens_per_second": 29193.109 }, { "epoch": 1.0575665569086723, "grad_norm": 1.5390625, "learning_rate": 2.5034759860712903e-05, "loss": 1.0458839416503907, "num_input_tokens_seen": 8500759808, "step": 29890, "train_runtime": 291190.678, "train_tokens_per_second": 29193.104 }, { "epoch": 1.057920377172401, "grad_norm": 1.5078125, "learning_rate": 2.5031622397532047e-05, "loss": 1.0505592346191406, "num_input_tokens_seen": 8503626176, "step": 29900, "train_runtime": 291286.2858, "train_tokens_per_second": 29193.363 }, { "epoch": 1.0582741974361298, "grad_norm": 1.5, "learning_rate": 2.502848611365651e-05, "loss": 1.0517515182495116, "num_input_tokens_seen": 8506471488, "step": 29910, "train_runtime": 291386.256, "train_tokens_per_second": 29193.112 }, { "epoch": 1.0586280176998586, "grad_norm": 1.4765625, "learning_rate": 2.50253510083477e-05, "loss": 1.0337539672851563, "num_input_tokens_seen": 8509321664, "step": 29920, "train_runtime": 291481.034, "train_tokens_per_second": 29193.397 }, { "epoch": 1.0589818379635876, "grad_norm": 1.53125, "learning_rate": 2.502221708086765e-05, "loss": 1.0613242149353028, "num_input_tokens_seen": 8512201600, "step": 29930, "train_runtime": 291579.3382, "train_tokens_per_second": 29193.432 }, { "epoch": 1.0593356582273163, "grad_norm": 1.5859375, "learning_rate": 2.501908433047904e-05, "loss": 1.0454280853271485, "num_input_tokens_seen": 8515051712, "step": 29940, "train_runtime": 291677.0492, "train_tokens_per_second": 29193.424 }, { "epoch": 1.0596894784910451, "grad_norm": 1.5234375, "learning_rate": 2.501595275644521e-05, "loss": 1.0531499862670899, "num_input_tokens_seen": 8517857344, "step": 29950, "train_runtime": 291771.1597, "train_tokens_per_second": 29193.623 }, { "epoch": 1.0600432987547739, "grad_norm": 1.484375, "learning_rate": 2.5012822358030136e-05, "loss": 1.0593780517578124, "num_input_tokens_seen": 8520674944, "step": 29960, "train_runtime": 291865.3755, "train_tokens_per_second": 29193.853 }, { "epoch": 1.0603971190185026, "grad_norm": 1.5078125, "learning_rate": 2.500969313449844e-05, "loss": 1.0549972534179688, "num_input_tokens_seen": 8523534848, "step": 29970, "train_runtime": 291964.1425, "train_tokens_per_second": 29193.773 }, { "epoch": 1.0607509392822314, "grad_norm": 1.546875, "learning_rate": 2.500656508511539e-05, "loss": 1.040264892578125, "num_input_tokens_seen": 8526372224, "step": 29980, "train_runtime": 292060.5278, "train_tokens_per_second": 29193.853 }, { "epoch": 1.0611047595459602, "grad_norm": 1.5546875, "learning_rate": 2.500343820914689e-05, "loss": 1.0484054565429688, "num_input_tokens_seen": 8529185856, "step": 29990, "train_runtime": 292157.4674, "train_tokens_per_second": 29193.797 }, { "epoch": 1.061458579809689, "grad_norm": 1.5625, "learning_rate": 2.5000312505859502e-05, "loss": 1.046640968322754, "num_input_tokens_seen": 8532056576, "step": 30000, "train_runtime": 292257.5228, "train_tokens_per_second": 29193.625 }, { "epoch": 1.061458579809689, "eval_loss": 1.0210896730422974, "eval_runtime": 8.447, "eval_samples_per_second": 472.12, "eval_steps_per_second": 3.788, "num_input_tokens_seen": 8532056576, "step": 30000 }, { "epoch": 1.0618124000734177, "grad_norm": 1.5625, "learning_rate": 2.4997187974520408e-05, "loss": 1.0460805892944336, "num_input_tokens_seen": 8534891904, "step": 30010, "train_runtime": 292386.7088, "train_tokens_per_second": 29190.424 }, { "epoch": 1.0621662203371465, "grad_norm": 1.4765625, "learning_rate": 2.4994064614397442e-05, "loss": 1.0540008544921875, "num_input_tokens_seen": 8537737984, "step": 30020, "train_runtime": 292484.2251, "train_tokens_per_second": 29190.422 }, { "epoch": 1.0625200406008752, "grad_norm": 1.59375, "learning_rate": 2.499094242475909e-05, "loss": 1.0457609176635743, "num_input_tokens_seen": 8540617600, "step": 30030, "train_runtime": 292585.6751, "train_tokens_per_second": 29190.143 }, { "epoch": 1.062873860864604, "grad_norm": 1.5234375, "learning_rate": 2.4987821404874463e-05, "loss": 1.05477933883667, "num_input_tokens_seen": 8543440512, "step": 30040, "train_runtime": 292683.0358, "train_tokens_per_second": 29190.078 }, { "epoch": 1.0632276811283328, "grad_norm": 1.53125, "learning_rate": 2.49847015540133e-05, "loss": 1.0480039596557618, "num_input_tokens_seen": 8546294080, "step": 30050, "train_runtime": 292780.3147, "train_tokens_per_second": 29190.125 }, { "epoch": 1.0635815013920615, "grad_norm": 1.5390625, "learning_rate": 2.498158287144601e-05, "loss": 1.0439905166625976, "num_input_tokens_seen": 8549108480, "step": 30060, "train_runtime": 292875.7644, "train_tokens_per_second": 29190.222 }, { "epoch": 1.0639353216557903, "grad_norm": 1.5546875, "learning_rate": 2.4978465356443613e-05, "loss": 1.0514918327331544, "num_input_tokens_seen": 8551931200, "step": 30070, "train_runtime": 292972.628, "train_tokens_per_second": 29190.205 }, { "epoch": 1.064289141919519, "grad_norm": 1.4765625, "learning_rate": 2.4975349008277774e-05, "loss": 1.037200927734375, "num_input_tokens_seen": 8554742592, "step": 30080, "train_runtime": 293069.8207, "train_tokens_per_second": 29190.118 }, { "epoch": 1.0646429621832478, "grad_norm": 1.5234375, "learning_rate": 2.4972233826220794e-05, "loss": 1.0489699363708496, "num_input_tokens_seen": 8557563520, "step": 30090, "train_runtime": 293167.6382, "train_tokens_per_second": 29190.001 }, { "epoch": 1.0649967824469768, "grad_norm": 1.5390625, "learning_rate": 2.496911980954561e-05, "loss": 1.038052749633789, "num_input_tokens_seen": 8560374208, "step": 30100, "train_runtime": 293263.1792, "train_tokens_per_second": 29190.075 }, { "epoch": 1.0653506027107056, "grad_norm": 1.53125, "learning_rate": 2.496600695752579e-05, "loss": 1.0519622802734374, "num_input_tokens_seen": 8563199168, "step": 30110, "train_runtime": 293359.5516, "train_tokens_per_second": 29190.115 }, { "epoch": 1.0657044229744344, "grad_norm": 1.5546875, "learning_rate": 2.4962895269435543e-05, "loss": 1.0428800582885742, "num_input_tokens_seen": 8566012160, "step": 30120, "train_runtime": 293456.0629, "train_tokens_per_second": 29190.101 }, { "epoch": 1.0660582432381631, "grad_norm": 1.5234375, "learning_rate": 2.49597847445497e-05, "loss": 1.0345462799072265, "num_input_tokens_seen": 8568842368, "step": 30130, "train_runtime": 293553.8092, "train_tokens_per_second": 29190.023 }, { "epoch": 1.0664120635018919, "grad_norm": 1.46875, "learning_rate": 2.495667538214374e-05, "loss": 1.047976303100586, "num_input_tokens_seen": 8571620096, "step": 30140, "train_runtime": 293646.1542, "train_tokens_per_second": 29190.303 }, { "epoch": 1.0667658837656206, "grad_norm": 1.5859375, "learning_rate": 2.4953567181493754e-05, "loss": 1.05532808303833, "num_input_tokens_seen": 8574470656, "step": 30150, "train_runtime": 293745.2682, "train_tokens_per_second": 29190.158 }, { "epoch": 1.0671197040293494, "grad_norm": 1.53125, "learning_rate": 2.495046014187648e-05, "loss": 1.0400854110717774, "num_input_tokens_seen": 8577330752, "step": 30160, "train_runtime": 293846.441, "train_tokens_per_second": 29189.841 }, { "epoch": 1.0674735242930782, "grad_norm": 1.5078125, "learning_rate": 2.494735426256928e-05, "loss": 1.0402067184448243, "num_input_tokens_seen": 8580153856, "step": 30170, "train_runtime": 293941.7454, "train_tokens_per_second": 29189.981 }, { "epoch": 1.067827344556807, "grad_norm": 1.4765625, "learning_rate": 2.4944249542850143e-05, "loss": 1.0450834274291991, "num_input_tokens_seen": 8582978368, "step": 30180, "train_runtime": 294038.6103, "train_tokens_per_second": 29189.971 }, { "epoch": 1.0681811648205357, "grad_norm": 1.5078125, "learning_rate": 2.494114598199769e-05, "loss": 1.0636441230773925, "num_input_tokens_seen": 8585800064, "step": 30190, "train_runtime": 294131.6847, "train_tokens_per_second": 29190.327 }, { "epoch": 1.0685349850842645, "grad_norm": 1.46875, "learning_rate": 2.493804357929118e-05, "loss": 1.0470794677734374, "num_input_tokens_seen": 8588638464, "step": 30200, "train_runtime": 294228.8358, "train_tokens_per_second": 29190.336 }, { "epoch": 1.0688888053479932, "grad_norm": 1.515625, "learning_rate": 2.4934942334010474e-05, "loss": 1.0458884239196777, "num_input_tokens_seen": 8591515776, "step": 30210, "train_runtime": 294326.0642, "train_tokens_per_second": 29190.469 }, { "epoch": 1.069242625611722, "grad_norm": 1.4921875, "learning_rate": 2.493184224543609e-05, "loss": 1.0448594093322754, "num_input_tokens_seen": 8594383872, "step": 30220, "train_runtime": 294426.1964, "train_tokens_per_second": 29190.283 }, { "epoch": 1.0695964458754508, "grad_norm": 1.609375, "learning_rate": 2.4928743312849144e-05, "loss": 1.038890266418457, "num_input_tokens_seen": 8597279040, "step": 30230, "train_runtime": 294525.4017, "train_tokens_per_second": 29190.28 }, { "epoch": 1.0699502661391795, "grad_norm": 1.5, "learning_rate": 2.4925645535531404e-05, "loss": 1.0495343208312988, "num_input_tokens_seen": 8600124544, "step": 30240, "train_runtime": 294623.5399, "train_tokens_per_second": 29190.215 }, { "epoch": 1.0703040864029083, "grad_norm": 1.515625, "learning_rate": 2.4922548912765234e-05, "loss": 1.0418855667114257, "num_input_tokens_seen": 8603017472, "step": 30250, "train_runtime": 294722.653, "train_tokens_per_second": 29190.215 }, { "epoch": 1.070657906666637, "grad_norm": 1.484375, "learning_rate": 2.4919453443833642e-05, "loss": 1.0531468391418457, "num_input_tokens_seen": 8605882240, "step": 30260, "train_runtime": 294819.7566, "train_tokens_per_second": 29190.317 }, { "epoch": 1.071011726930366, "grad_norm": 1.53125, "learning_rate": 2.4916359128020264e-05, "loss": 1.0358877182006836, "num_input_tokens_seen": 8608732864, "step": 30270, "train_runtime": 294920.114, "train_tokens_per_second": 29190.05 }, { "epoch": 1.0713655471940948, "grad_norm": 1.5078125, "learning_rate": 2.4913265964609342e-05, "loss": 1.0475775718688964, "num_input_tokens_seen": 8611570944, "step": 30280, "train_runtime": 295016.8556, "train_tokens_per_second": 29190.098 }, { "epoch": 1.0717193674578236, "grad_norm": 1.546875, "learning_rate": 2.4910173952885737e-05, "loss": 1.0310024261474608, "num_input_tokens_seen": 8614446272, "step": 30290, "train_runtime": 295114.1289, "train_tokens_per_second": 29190.22 }, { "epoch": 1.0720731877215524, "grad_norm": 1.5390625, "learning_rate": 2.490708309213496e-05, "loss": 1.0560443878173829, "num_input_tokens_seen": 8617270976, "step": 30300, "train_runtime": 295210.7714, "train_tokens_per_second": 29190.232 }, { "epoch": 1.0724270079852811, "grad_norm": 1.53125, "learning_rate": 2.4903993381643107e-05, "loss": 1.038797378540039, "num_input_tokens_seen": 8620095744, "step": 30310, "train_runtime": 295306.9363, "train_tokens_per_second": 29190.292 }, { "epoch": 1.0727808282490099, "grad_norm": 1.484375, "learning_rate": 2.4900904820696916e-05, "loss": 1.0457059860229492, "num_input_tokens_seen": 8622953920, "step": 30320, "train_runtime": 295406.7993, "train_tokens_per_second": 29190.1 }, { "epoch": 1.0731346485127387, "grad_norm": 1.515625, "learning_rate": 2.489781740858374e-05, "loss": 1.0438735961914063, "num_input_tokens_seen": 8625767808, "step": 30330, "train_runtime": 295503.9469, "train_tokens_per_second": 29190.026 }, { "epoch": 1.0734884687764674, "grad_norm": 1.546875, "learning_rate": 2.4894731144591545e-05, "loss": 1.0542779922485352, "num_input_tokens_seen": 8628583552, "step": 30340, "train_runtime": 295599.7813, "train_tokens_per_second": 29190.088 }, { "epoch": 1.0738422890401962, "grad_norm": 1.4921875, "learning_rate": 2.4891646028008923e-05, "loss": 1.0325572967529297, "num_input_tokens_seen": 8631424640, "step": 30350, "train_runtime": 295698.3045, "train_tokens_per_second": 29189.97 }, { "epoch": 1.074196109303925, "grad_norm": 1.5, "learning_rate": 2.4888562058125068e-05, "loss": 1.0446797370910645, "num_input_tokens_seen": 8634254720, "step": 30360, "train_runtime": 295794.5655, "train_tokens_per_second": 29190.038 }, { "epoch": 1.0745499295676537, "grad_norm": 1.484375, "learning_rate": 2.488547923422981e-05, "loss": 1.0506183624267578, "num_input_tokens_seen": 8637137792, "step": 30370, "train_runtime": 295894.3293, "train_tokens_per_second": 29189.94 }, { "epoch": 1.0749037498313825, "grad_norm": 1.5625, "learning_rate": 2.4882397555613582e-05, "loss": 1.0563552856445313, "num_input_tokens_seen": 8639975552, "step": 30380, "train_runtime": 295990.1277, "train_tokens_per_second": 29190.08 }, { "epoch": 1.0752575700951112, "grad_norm": 1.4765625, "learning_rate": 2.487931702156743e-05, "loss": 1.04453763961792, "num_input_tokens_seen": 8642767680, "step": 30390, "train_runtime": 296085.1998, "train_tokens_per_second": 29190.137 }, { "epoch": 1.07561139035884, "grad_norm": 1.5078125, "learning_rate": 2.4876237631383026e-05, "loss": 1.047821617126465, "num_input_tokens_seen": 8645595200, "step": 30400, "train_runtime": 296180.1265, "train_tokens_per_second": 29190.329 }, { "epoch": 1.0759652106225688, "grad_norm": 1.5, "learning_rate": 2.4873159384352647e-05, "loss": 1.051121139526367, "num_input_tokens_seen": 8648428928, "step": 30410, "train_runtime": 296275.8518, "train_tokens_per_second": 29190.462 }, { "epoch": 1.0763190308862975, "grad_norm": 1.5078125, "learning_rate": 2.487008227976918e-05, "loss": 1.0485450744628906, "num_input_tokens_seen": 8651207872, "step": 30420, "train_runtime": 296368.2732, "train_tokens_per_second": 29190.735 }, { "epoch": 1.0766728511500263, "grad_norm": 1.5625, "learning_rate": 2.486700631692613e-05, "loss": 1.0437174797058106, "num_input_tokens_seen": 8654055616, "step": 30430, "train_runtime": 296465.1544, "train_tokens_per_second": 29190.802 }, { "epoch": 1.0770266714137553, "grad_norm": 1.5546875, "learning_rate": 2.486393149511762e-05, "loss": 1.056033992767334, "num_input_tokens_seen": 8656875840, "step": 30440, "train_runtime": 296561.5934, "train_tokens_per_second": 29190.819 }, { "epoch": 1.077380491677484, "grad_norm": 1.5625, "learning_rate": 2.4860857813638365e-05, "loss": 1.0636586189270019, "num_input_tokens_seen": 8659703808, "step": 30450, "train_runtime": 296658.6774, "train_tokens_per_second": 29190.799 }, { "epoch": 1.0777343119412128, "grad_norm": 1.5078125, "learning_rate": 2.485778527178371e-05, "loss": 1.042108154296875, "num_input_tokens_seen": 8662570112, "step": 30460, "train_runtime": 296756.5371, "train_tokens_per_second": 29190.832 }, { "epoch": 1.0780881322049416, "grad_norm": 1.484375, "learning_rate": 2.48547138688496e-05, "loss": 1.0412103652954101, "num_input_tokens_seen": 8665451456, "step": 30470, "train_runtime": 296858.6448, "train_tokens_per_second": 29190.497 }, { "epoch": 1.0784419524686704, "grad_norm": 1.5703125, "learning_rate": 2.485164360413258e-05, "loss": 1.0650873184204102, "num_input_tokens_seen": 8668232768, "step": 30480, "train_runtime": 296954.7419, "train_tokens_per_second": 29190.417 }, { "epoch": 1.0787957727323991, "grad_norm": 1.5390625, "learning_rate": 2.4848574476929823e-05, "loss": 1.0396809577941895, "num_input_tokens_seen": 8671091072, "step": 30490, "train_runtime": 297055.7673, "train_tokens_per_second": 29190.112 }, { "epoch": 1.079149592996128, "grad_norm": 1.5625, "learning_rate": 2.484550648653909e-05, "loss": 1.0381423950195312, "num_input_tokens_seen": 8673882240, "step": 30500, "train_runtime": 297148.834, "train_tokens_per_second": 29190.363 }, { "epoch": 1.0795034132598567, "grad_norm": 1.4609375, "learning_rate": 2.484243963225877e-05, "loss": 1.047877597808838, "num_input_tokens_seen": 8676791552, "step": 30510, "train_runtime": 297248.4347, "train_tokens_per_second": 29190.369 }, { "epoch": 1.0798572335235854, "grad_norm": 1.46875, "learning_rate": 2.4839373913387835e-05, "loss": 1.0318588256835937, "num_input_tokens_seen": 8679678208, "step": 30520, "train_runtime": 297345.8992, "train_tokens_per_second": 29190.509 }, { "epoch": 1.0802110537873142, "grad_norm": 1.4609375, "learning_rate": 2.4836309329225873e-05, "loss": 1.0531158447265625, "num_input_tokens_seen": 8682504064, "step": 30530, "train_runtime": 297444.989, "train_tokens_per_second": 29190.285 }, { "epoch": 1.080564874051043, "grad_norm": 1.484375, "learning_rate": 2.483324587907309e-05, "loss": 1.0509878158569337, "num_input_tokens_seen": 8685337408, "step": 30540, "train_runtime": 297543.294, "train_tokens_per_second": 29190.164 }, { "epoch": 1.0809186943147717, "grad_norm": 1.59375, "learning_rate": 2.483018356223027e-05, "loss": 1.0492218017578125, "num_input_tokens_seen": 8688214592, "step": 30550, "train_runtime": 297641.9107, "train_tokens_per_second": 29190.159 }, { "epoch": 1.0812725145785005, "grad_norm": 1.5234375, "learning_rate": 2.4827122377998815e-05, "loss": 1.0370466232299804, "num_input_tokens_seen": 8691076224, "step": 30560, "train_runtime": 297738.7063, "train_tokens_per_second": 29190.28 }, { "epoch": 1.0816263348422293, "grad_norm": 1.5703125, "learning_rate": 2.4824062325680737e-05, "loss": 1.038159465789795, "num_input_tokens_seen": 8693898432, "step": 30570, "train_runtime": 297835.8317, "train_tokens_per_second": 29190.237 }, { "epoch": 1.081980155105958, "grad_norm": 1.5078125, "learning_rate": 2.4821003404578623e-05, "loss": 1.0451680183410645, "num_input_tokens_seen": 8696720704, "step": 30580, "train_runtime": 297930.6687, "train_tokens_per_second": 29190.418 }, { "epoch": 1.082333975369687, "grad_norm": 1.5546875, "learning_rate": 2.4817945613995703e-05, "loss": 1.0363076210021973, "num_input_tokens_seen": 8699545408, "step": 30590, "train_runtime": 298024.4018, "train_tokens_per_second": 29190.715 }, { "epoch": 1.0826877956334158, "grad_norm": 1.515625, "learning_rate": 2.481488895323577e-05, "loss": 1.0608390808105468, "num_input_tokens_seen": 8702389504, "step": 30600, "train_runtime": 298119.8471, "train_tokens_per_second": 29190.91 }, { "epoch": 1.0830416158971445, "grad_norm": 1.5, "learning_rate": 2.481183342160324e-05, "loss": 1.0562709808349608, "num_input_tokens_seen": 8705240000, "step": 30610, "train_runtime": 298218.1932, "train_tokens_per_second": 29190.841 }, { "epoch": 1.0833954361608733, "grad_norm": 1.578125, "learning_rate": 2.4808779018403107e-05, "loss": 1.044337844848633, "num_input_tokens_seen": 8708054656, "step": 30620, "train_runtime": 298315.3686, "train_tokens_per_second": 29190.768 }, { "epoch": 1.083749256424602, "grad_norm": 1.5078125, "learning_rate": 2.4805725742940987e-05, "loss": 1.0405929565429688, "num_input_tokens_seen": 8710902016, "step": 30630, "train_runtime": 298413.6176, "train_tokens_per_second": 29190.699 }, { "epoch": 1.0841030766883308, "grad_norm": 1.5390625, "learning_rate": 2.4802673594523086e-05, "loss": 1.0613485336303712, "num_input_tokens_seen": 8713767680, "step": 30640, "train_runtime": 298515.1001, "train_tokens_per_second": 29190.375 }, { "epoch": 1.0844568969520596, "grad_norm": 1.4765625, "learning_rate": 2.4799622572456198e-05, "loss": 1.0447149276733398, "num_input_tokens_seen": 8716583552, "step": 30650, "train_runtime": 298609.1483, "train_tokens_per_second": 29190.611 }, { "epoch": 1.0848107172157884, "grad_norm": 1.515625, "learning_rate": 2.479657267604772e-05, "loss": 1.0446485519409179, "num_input_tokens_seen": 8719445056, "step": 30660, "train_runtime": 298705.5966, "train_tokens_per_second": 29190.766 }, { "epoch": 1.0851645374795171, "grad_norm": 1.5078125, "learning_rate": 2.4793523904605657e-05, "loss": 1.0459712028503418, "num_input_tokens_seen": 8722262400, "step": 30670, "train_runtime": 298800.0204, "train_tokens_per_second": 29190.97 }, { "epoch": 1.085518357743246, "grad_norm": 1.46875, "learning_rate": 2.479047625743859e-05, "loss": 1.0515359878540038, "num_input_tokens_seen": 8725083008, "step": 30680, "train_runtime": 298896.4016, "train_tokens_per_second": 29190.994 }, { "epoch": 1.0858721780069747, "grad_norm": 1.546875, "learning_rate": 2.4787429733855697e-05, "loss": 1.0492181777954102, "num_input_tokens_seen": 8727941952, "step": 30690, "train_runtime": 298994.9556, "train_tokens_per_second": 29190.934 }, { "epoch": 1.0862259982707034, "grad_norm": 1.5, "learning_rate": 2.478438433316677e-05, "loss": 1.0382863998413085, "num_input_tokens_seen": 8730815872, "step": 30700, "train_runtime": 299094.5214, "train_tokens_per_second": 29190.825 }, { "epoch": 1.0865798185344322, "grad_norm": 1.4609375, "learning_rate": 2.478134005468217e-05, "loss": 1.0530181884765626, "num_input_tokens_seen": 8733630720, "step": 30710, "train_runtime": 299190.7199, "train_tokens_per_second": 29190.848 }, { "epoch": 1.086933638798161, "grad_norm": 1.53125, "learning_rate": 2.4778296897712865e-05, "loss": 1.044699001312256, "num_input_tokens_seen": 8736459968, "step": 30720, "train_runtime": 299286.1103, "train_tokens_per_second": 29190.997 }, { "epoch": 1.0872874590618897, "grad_norm": 1.578125, "learning_rate": 2.4775254861570422e-05, "loss": 1.0501251220703125, "num_input_tokens_seen": 8739337600, "step": 30730, "train_runtime": 299384.3463, "train_tokens_per_second": 29191.031 }, { "epoch": 1.0876412793256185, "grad_norm": 1.5625, "learning_rate": 2.4772213945566974e-05, "loss": 1.0486842155456544, "num_input_tokens_seen": 8742197120, "step": 30740, "train_runtime": 299482.7554, "train_tokens_per_second": 29190.987 }, { "epoch": 1.0879950995893473, "grad_norm": 1.5703125, "learning_rate": 2.4769174149015266e-05, "loss": 1.0486906051635743, "num_input_tokens_seen": 8745038464, "step": 30750, "train_runtime": 299578.9517, "train_tokens_per_second": 29191.098 }, { "epoch": 1.0883489198530762, "grad_norm": 1.5234375, "learning_rate": 2.476613547122863e-05, "loss": 1.039016056060791, "num_input_tokens_seen": 8747859200, "step": 30760, "train_runtime": 299672.0653, "train_tokens_per_second": 29191.44 }, { "epoch": 1.088702740116805, "grad_norm": 1.5, "learning_rate": 2.476309791152098e-05, "loss": 1.0504534721374512, "num_input_tokens_seen": 8750696064, "step": 30770, "train_runtime": 299770.9669, "train_tokens_per_second": 29191.273 }, { "epoch": 1.0890565603805338, "grad_norm": 1.5625, "learning_rate": 2.4760061469206827e-05, "loss": 1.0460838317871093, "num_input_tokens_seen": 8753561088, "step": 30780, "train_runtime": 299870.4998, "train_tokens_per_second": 29191.138 }, { "epoch": 1.0894103806442625, "grad_norm": 1.53125, "learning_rate": 2.4757026143601268e-05, "loss": 1.0525848388671875, "num_input_tokens_seen": 8756371328, "step": 30790, "train_runtime": 299962.3874, "train_tokens_per_second": 29191.564 }, { "epoch": 1.0897642009079913, "grad_norm": 1.484375, "learning_rate": 2.475399193401998e-05, "loss": 1.05786190032959, "num_input_tokens_seen": 8759267776, "step": 30800, "train_runtime": 300063.1715, "train_tokens_per_second": 29191.412 }, { "epoch": 1.09011802117172, "grad_norm": 1.5234375, "learning_rate": 2.475095883977924e-05, "loss": 1.0509421348571777, "num_input_tokens_seen": 8762098944, "step": 30810, "train_runtime": 300160.8754, "train_tokens_per_second": 29191.343 }, { "epoch": 1.0904718414354488, "grad_norm": 1.5625, "learning_rate": 2.474792686019591e-05, "loss": 1.058945083618164, "num_input_tokens_seen": 8764981312, "step": 30820, "train_runtime": 300261.7557, "train_tokens_per_second": 29191.135 }, { "epoch": 1.0908256616991776, "grad_norm": 1.5, "learning_rate": 2.474489599458742e-05, "loss": 1.0421622276306153, "num_input_tokens_seen": 8767852096, "step": 30830, "train_runtime": 300359.1119, "train_tokens_per_second": 29191.231 }, { "epoch": 1.0911794819629064, "grad_norm": 1.5234375, "learning_rate": 2.4741866242271804e-05, "loss": 1.0410686492919923, "num_input_tokens_seen": 8770695360, "step": 30840, "train_runtime": 300456.183, "train_tokens_per_second": 29191.263 }, { "epoch": 1.0915333022266351, "grad_norm": 1.5625, "learning_rate": 2.473883760256767e-05, "loss": 1.0436766624450684, "num_input_tokens_seen": 8773544896, "step": 30850, "train_runtime": 300554.7256, "train_tokens_per_second": 29191.173 }, { "epoch": 1.091887122490364, "grad_norm": 1.5078125, "learning_rate": 2.4735810074794217e-05, "loss": 1.0514400482177735, "num_input_tokens_seen": 8776427072, "step": 30860, "train_runtime": 300656.3635, "train_tokens_per_second": 29190.891 }, { "epoch": 1.0922409427540927, "grad_norm": 1.578125, "learning_rate": 2.473278365827123e-05, "loss": 1.0523329734802247, "num_input_tokens_seen": 8779285632, "step": 30870, "train_runtime": 300754.7594, "train_tokens_per_second": 29190.845 }, { "epoch": 1.0925947630178214, "grad_norm": 1.46875, "learning_rate": 2.472975835231906e-05, "loss": 1.03155574798584, "num_input_tokens_seen": 8782105792, "step": 30880, "train_runtime": 300850.7221, "train_tokens_per_second": 29190.908 }, { "epoch": 1.0929485832815502, "grad_norm": 1.5234375, "learning_rate": 2.4726734156258647e-05, "loss": 1.0517875671386718, "num_input_tokens_seen": 8784940160, "step": 30890, "train_runtime": 300948.0247, "train_tokens_per_second": 29190.888 }, { "epoch": 1.093302403545279, "grad_norm": 1.453125, "learning_rate": 2.4723711069411526e-05, "loss": 1.045181655883789, "num_input_tokens_seen": 8787793280, "step": 30900, "train_runtime": 301045.5653, "train_tokens_per_second": 29190.908 }, { "epoch": 1.0936562238090077, "grad_norm": 1.5390625, "learning_rate": 2.472068909109979e-05, "loss": 1.0326014518737794, "num_input_tokens_seen": 8790602368, "step": 30910, "train_runtime": 301143.3034, "train_tokens_per_second": 29190.762 }, { "epoch": 1.0940100440727365, "grad_norm": 1.4609375, "learning_rate": 2.471766822064614e-05, "loss": 1.0526304244995117, "num_input_tokens_seen": 8793475968, "step": 30920, "train_runtime": 301242.9576, "train_tokens_per_second": 29190.644 }, { "epoch": 1.0943638643364655, "grad_norm": 1.4921875, "learning_rate": 2.4714648457373824e-05, "loss": 1.061772918701172, "num_input_tokens_seen": 8796281344, "step": 30930, "train_runtime": 301338.0831, "train_tokens_per_second": 29190.739 }, { "epoch": 1.0947176846001943, "grad_norm": 1.5234375, "learning_rate": 2.4711629800606694e-05, "loss": 1.0545734405517577, "num_input_tokens_seen": 8799133248, "step": 30940, "train_runtime": 301435.9162, "train_tokens_per_second": 29190.726 }, { "epoch": 1.095071504863923, "grad_norm": 1.5546875, "learning_rate": 2.4708612249669157e-05, "loss": 1.029511070251465, "num_input_tokens_seen": 8801989376, "step": 30950, "train_runtime": 301534.5957, "train_tokens_per_second": 29190.645 }, { "epoch": 1.0954253251276518, "grad_norm": 1.5546875, "learning_rate": 2.4705595803886223e-05, "loss": 1.0471227645874024, "num_input_tokens_seen": 8804858112, "step": 30960, "train_runtime": 301634.612, "train_tokens_per_second": 29190.477 }, { "epoch": 1.0957791453913805, "grad_norm": 1.515625, "learning_rate": 2.4702580462583468e-05, "loss": 1.0468629837036132, "num_input_tokens_seen": 8807736384, "step": 30970, "train_runtime": 301732.889, "train_tokens_per_second": 29190.508 }, { "epoch": 1.0961329656551093, "grad_norm": 1.5, "learning_rate": 2.4699566225087032e-05, "loss": 1.0527093887329102, "num_input_tokens_seen": 8810558976, "step": 30980, "train_runtime": 301826.8997, "train_tokens_per_second": 29190.768 }, { "epoch": 1.096486785918838, "grad_norm": 1.5234375, "learning_rate": 2.4696553090723644e-05, "loss": 1.04113826751709, "num_input_tokens_seen": 8813443392, "step": 30990, "train_runtime": 301925.9443, "train_tokens_per_second": 29190.745 }, { "epoch": 1.0968406061825668, "grad_norm": 1.5078125, "learning_rate": 2.4693541058820606e-05, "loss": 1.054214096069336, "num_input_tokens_seen": 8816337728, "step": 31000, "train_runtime": 302025.6837, "train_tokens_per_second": 29190.689 }, { "epoch": 1.0971944264462956, "grad_norm": 1.53125, "learning_rate": 2.4690530128705798e-05, "loss": 1.045550537109375, "num_input_tokens_seen": 8819114624, "step": 31010, "train_runtime": 302117.1336, "train_tokens_per_second": 29191.044 }, { "epoch": 1.0975482467100244, "grad_norm": 1.53125, "learning_rate": 2.4687520299707655e-05, "loss": 1.0659130096435547, "num_input_tokens_seen": 8821949056, "step": 31020, "train_runtime": 302214.9256, "train_tokens_per_second": 29190.977 }, { "epoch": 1.0979020669737531, "grad_norm": 1.5546875, "learning_rate": 2.4684511571155208e-05, "loss": 1.0533631324768067, "num_input_tokens_seen": 8824721216, "step": 31030, "train_runtime": 302310.5652, "train_tokens_per_second": 29190.912 }, { "epoch": 1.098255887237482, "grad_norm": 1.578125, "learning_rate": 2.4681503942378048e-05, "loss": 1.0494016647338866, "num_input_tokens_seen": 8827554688, "step": 31040, "train_runtime": 302407.507, "train_tokens_per_second": 29190.924 }, { "epoch": 1.0986097075012107, "grad_norm": 1.515625, "learning_rate": 2.4678497412706344e-05, "loss": 1.0470052719116212, "num_input_tokens_seen": 8830366976, "step": 31050, "train_runtime": 302505.6869, "train_tokens_per_second": 29190.747 }, { "epoch": 1.0989635277649394, "grad_norm": 1.515625, "learning_rate": 2.4675491981470825e-05, "loss": 1.0486572265625, "num_input_tokens_seen": 8833177664, "step": 31060, "train_runtime": 302600.7043, "train_tokens_per_second": 29190.869 }, { "epoch": 1.0993173480286682, "grad_norm": 1.5078125, "learning_rate": 2.4672487648002803e-05, "loss": 1.0364870071411132, "num_input_tokens_seen": 8835960448, "step": 31070, "train_runtime": 302697.3773, "train_tokens_per_second": 29190.74 }, { "epoch": 1.099671168292397, "grad_norm": 1.578125, "learning_rate": 2.4669484411634147e-05, "loss": 1.0433317184448243, "num_input_tokens_seen": 8838765440, "step": 31080, "train_runtime": 302794.6868, "train_tokens_per_second": 29190.623 }, { "epoch": 1.1000249885561257, "grad_norm": 1.5390625, "learning_rate": 2.466648227169731e-05, "loss": 1.0406436920166016, "num_input_tokens_seen": 8841659136, "step": 31090, "train_runtime": 302894.5805, "train_tokens_per_second": 29190.549 }, { "epoch": 1.1003788088198547, "grad_norm": 1.53125, "learning_rate": 2.4663481227525304e-05, "loss": 1.0454859733581543, "num_input_tokens_seen": 8844499712, "step": 31100, "train_runtime": 302992.4831, "train_tokens_per_second": 29190.492 }, { "epoch": 1.1007326290835835, "grad_norm": 1.4296875, "learning_rate": 2.4660481278451704e-05, "loss": 1.041936492919922, "num_input_tokens_seen": 8847438720, "step": 31110, "train_runtime": 303096.5202, "train_tokens_per_second": 29190.169 }, { "epoch": 1.1010864493473123, "grad_norm": 1.546875, "learning_rate": 2.465748242381067e-05, "loss": 1.0427564620971679, "num_input_tokens_seen": 8850241344, "step": 31120, "train_runtime": 303191.1789, "train_tokens_per_second": 29190.3 }, { "epoch": 1.101440269611041, "grad_norm": 1.5390625, "learning_rate": 2.4654484662936915e-05, "loss": 1.0541624069213866, "num_input_tokens_seen": 8853025600, "step": 31130, "train_runtime": 303286.0314, "train_tokens_per_second": 29190.351 }, { "epoch": 1.1017940898747698, "grad_norm": 1.4921875, "learning_rate": 2.4651487995165712e-05, "loss": 1.0453739166259766, "num_input_tokens_seen": 8855847872, "step": 31140, "train_runtime": 303381.8347, "train_tokens_per_second": 29190.435 }, { "epoch": 1.1021479101384986, "grad_norm": 1.5546875, "learning_rate": 2.4648492419832915e-05, "loss": 1.0470635414123535, "num_input_tokens_seen": 8858661760, "step": 31150, "train_runtime": 303477.5497, "train_tokens_per_second": 29190.501 }, { "epoch": 1.1025017304022273, "grad_norm": 1.5234375, "learning_rate": 2.4645497936274937e-05, "loss": 1.0383598327636718, "num_input_tokens_seen": 8861430016, "step": 31160, "train_runtime": 303569.942, "train_tokens_per_second": 29190.736 }, { "epoch": 1.102855550665956, "grad_norm": 1.5390625, "learning_rate": 2.4642504543828753e-05, "loss": 1.0553249359130858, "num_input_tokens_seen": 8864291968, "step": 31170, "train_runtime": 303667.1459, "train_tokens_per_second": 29190.817 }, { "epoch": 1.1032093709296849, "grad_norm": 1.484375, "learning_rate": 2.4639512241831904e-05, "loss": 1.0555017471313477, "num_input_tokens_seen": 8867147392, "step": 31180, "train_runtime": 303767.6686, "train_tokens_per_second": 29190.557 }, { "epoch": 1.1035631911934136, "grad_norm": 1.5234375, "learning_rate": 2.4636521029622485e-05, "loss": 1.049258041381836, "num_input_tokens_seen": 8869901376, "step": 31190, "train_runtime": 303858.6513, "train_tokens_per_second": 29190.88 }, { "epoch": 1.1039170114571424, "grad_norm": 1.5078125, "learning_rate": 2.463353090653917e-05, "loss": 1.0552886962890624, "num_input_tokens_seen": 8872737920, "step": 31200, "train_runtime": 303955.9923, "train_tokens_per_second": 29190.864 }, { "epoch": 1.1042708317208711, "grad_norm": 1.5, "learning_rate": 2.4630541871921187e-05, "loss": 1.0535228729248047, "num_input_tokens_seen": 8875596736, "step": 31210, "train_runtime": 304055.1752, "train_tokens_per_second": 29190.744 }, { "epoch": 1.1046246519846, "grad_norm": 1.484375, "learning_rate": 2.4627553925108313e-05, "loss": 1.0456931114196777, "num_input_tokens_seen": 8878420480, "step": 31220, "train_runtime": 304152.9035, "train_tokens_per_second": 29190.648 }, { "epoch": 1.1049784722483287, "grad_norm": 1.53125, "learning_rate": 2.4624567065440906e-05, "loss": 1.0231801986694335, "num_input_tokens_seen": 8881234816, "step": 31230, "train_runtime": 304248.3569, "train_tokens_per_second": 29190.74 }, { "epoch": 1.1053322925120574, "grad_norm": 1.5625, "learning_rate": 2.4621581292259868e-05, "loss": 1.0556482315063476, "num_input_tokens_seen": 8883989888, "step": 31240, "train_runtime": 304342.0799, "train_tokens_per_second": 29190.804 }, { "epoch": 1.1056861127757862, "grad_norm": 1.5, "learning_rate": 2.4618596604906673e-05, "loss": 1.0458615303039551, "num_input_tokens_seen": 8886794368, "step": 31250, "train_runtime": 304437.0651, "train_tokens_per_second": 29190.908 }, { "epoch": 1.106039933039515, "grad_norm": 1.53125, "learning_rate": 2.4615613002723347e-05, "loss": 1.0497917175292968, "num_input_tokens_seen": 8889625600, "step": 31260, "train_runtime": 304530.4194, "train_tokens_per_second": 29191.257 }, { "epoch": 1.106393753303244, "grad_norm": 1.515625, "learning_rate": 2.4612630485052466e-05, "loss": 1.067885398864746, "num_input_tokens_seen": 8892476480, "step": 31270, "train_runtime": 304628.6883, "train_tokens_per_second": 29191.198 }, { "epoch": 1.1067475735669727, "grad_norm": 1.5625, "learning_rate": 2.4609649051237175e-05, "loss": 1.0575736045837403, "num_input_tokens_seen": 8895300608, "step": 31280, "train_runtime": 304722.7593, "train_tokens_per_second": 29191.455 }, { "epoch": 1.1071013938307015, "grad_norm": 1.5703125, "learning_rate": 2.460666870062118e-05, "loss": 1.0464168548583985, "num_input_tokens_seen": 8898108736, "step": 31290, "train_runtime": 304818.0323, "train_tokens_per_second": 29191.543 }, { "epoch": 1.1074552140944303, "grad_norm": 1.5078125, "learning_rate": 2.4603689432548728e-05, "loss": 1.0408933639526368, "num_input_tokens_seen": 8900946240, "step": 31300, "train_runtime": 304915.5895, "train_tokens_per_second": 29191.509 }, { "epoch": 1.107809034358159, "grad_norm": 1.5234375, "learning_rate": 2.460071124636463e-05, "loss": 1.0459248542785644, "num_input_tokens_seen": 8903786752, "step": 31310, "train_runtime": 305013.361, "train_tokens_per_second": 29191.465 }, { "epoch": 1.1081628546218878, "grad_norm": 1.5546875, "learning_rate": 2.4597734141414254e-05, "loss": 1.0534470558166504, "num_input_tokens_seen": 8906625472, "step": 31320, "train_runtime": 305111.6807, "train_tokens_per_second": 29191.362 }, { "epoch": 1.1085166748856166, "grad_norm": 1.5390625, "learning_rate": 2.4594758117043516e-05, "loss": 1.0427116394042968, "num_input_tokens_seen": 8909447808, "step": 31330, "train_runtime": 305207.5283, "train_tokens_per_second": 29191.442 }, { "epoch": 1.1088704951493453, "grad_norm": 1.4609375, "learning_rate": 2.4591783172598898e-05, "loss": 1.0386438369750977, "num_input_tokens_seen": 8912378432, "step": 31340, "train_runtime": 305312.2238, "train_tokens_per_second": 29191.03 }, { "epoch": 1.109224315413074, "grad_norm": 1.484375, "learning_rate": 2.458880930742742e-05, "loss": 1.0455702781677245, "num_input_tokens_seen": 8915198144, "step": 31350, "train_runtime": 305407.68, "train_tokens_per_second": 29191.139 }, { "epoch": 1.1095781356768029, "grad_norm": 1.5, "learning_rate": 2.458583652087666e-05, "loss": 1.04412841796875, "num_input_tokens_seen": 8918044992, "step": 31360, "train_runtime": 305503.5699, "train_tokens_per_second": 29191.296 }, { "epoch": 1.1099319559405316, "grad_norm": 1.4765625, "learning_rate": 2.4582864812294757e-05, "loss": 1.044855499267578, "num_input_tokens_seen": 8920859072, "step": 31370, "train_runtime": 305599.4905, "train_tokens_per_second": 29191.341 }, { "epoch": 1.1102857762042604, "grad_norm": 1.578125, "learning_rate": 2.4579894181030387e-05, "loss": 1.0475560188293458, "num_input_tokens_seen": 8923675840, "step": 31380, "train_runtime": 305694.711, "train_tokens_per_second": 29191.463 }, { "epoch": 1.1106395964679892, "grad_norm": 1.484375, "learning_rate": 2.457692462643279e-05, "loss": 1.0380531311035157, "num_input_tokens_seen": 8926519936, "step": 31390, "train_runtime": 305791.9212, "train_tokens_per_second": 29191.484 }, { "epoch": 1.110993416731718, "grad_norm": 1.5625, "learning_rate": 2.4573956147851734e-05, "loss": 1.046290969848633, "num_input_tokens_seen": 8929360768, "step": 31400, "train_runtime": 305889.2544, "train_tokens_per_second": 29191.482 }, { "epoch": 1.1113472369954467, "grad_norm": 1.546875, "learning_rate": 2.4570988744637573e-05, "loss": 1.0340972900390626, "num_input_tokens_seen": 8932176064, "step": 31410, "train_runtime": 305983.6071, "train_tokens_per_second": 29191.682 }, { "epoch": 1.1117010572591755, "grad_norm": 1.546875, "learning_rate": 2.4568022416141178e-05, "loss": 1.0471845626831056, "num_input_tokens_seen": 8935036928, "step": 31420, "train_runtime": 306080.1689, "train_tokens_per_second": 29191.819 }, { "epoch": 1.1120548775229042, "grad_norm": 1.4375, "learning_rate": 2.4565057161713987e-05, "loss": 1.0552879333496095, "num_input_tokens_seen": 8937931264, "step": 31430, "train_runtime": 306181.0071, "train_tokens_per_second": 29191.658 }, { "epoch": 1.1124086977866332, "grad_norm": 1.53125, "learning_rate": 2.4562092980707975e-05, "loss": 1.0414106369018554, "num_input_tokens_seen": 8940802240, "step": 31440, "train_runtime": 306278.2142, "train_tokens_per_second": 29191.767 }, { "epoch": 1.112762518050362, "grad_norm": 1.546875, "learning_rate": 2.455912987247566e-05, "loss": 1.047684383392334, "num_input_tokens_seen": 8943665088, "step": 31450, "train_runtime": 306376.259, "train_tokens_per_second": 29191.769 }, { "epoch": 1.1131163383140907, "grad_norm": 1.4921875, "learning_rate": 2.455616783637013e-05, "loss": 1.0307809829711914, "num_input_tokens_seen": 8946493184, "step": 31460, "train_runtime": 306475.0425, "train_tokens_per_second": 29191.588 }, { "epoch": 1.1134701585778195, "grad_norm": 1.53125, "learning_rate": 2.4553206871745e-05, "loss": 1.0528751373291017, "num_input_tokens_seen": 8949372224, "step": 31470, "train_runtime": 306574.6036, "train_tokens_per_second": 29191.499 }, { "epoch": 1.1138239788415483, "grad_norm": 1.4765625, "learning_rate": 2.4550246977954422e-05, "loss": 1.0489970207214356, "num_input_tokens_seen": 8952211392, "step": 31480, "train_runtime": 306671.4842, "train_tokens_per_second": 29191.535 }, { "epoch": 1.114177799105277, "grad_norm": 1.5703125, "learning_rate": 2.454728815435312e-05, "loss": 1.0605897903442383, "num_input_tokens_seen": 8955083968, "step": 31490, "train_runtime": 306771.9897, "train_tokens_per_second": 29191.335 }, { "epoch": 1.1145316193690058, "grad_norm": 1.546875, "learning_rate": 2.4544330400296333e-05, "loss": 1.061956787109375, "num_input_tokens_seen": 8957897152, "step": 31500, "train_runtime": 306866.4948, "train_tokens_per_second": 29191.513 }, { "epoch": 1.1148854396327346, "grad_norm": 1.5625, "learning_rate": 2.4541373715139876e-05, "loss": 1.0594853401184081, "num_input_tokens_seen": 8960745408, "step": 31510, "train_runtime": 306966.8663, "train_tokens_per_second": 29191.246 }, { "epoch": 1.1152392598964633, "grad_norm": 1.5390625, "learning_rate": 2.453841809824007e-05, "loss": 1.0405210494995116, "num_input_tokens_seen": 8963585856, "step": 31520, "train_runtime": 307065.1845, "train_tokens_per_second": 29191.15 }, { "epoch": 1.115593080160192, "grad_norm": 1.5234375, "learning_rate": 2.4535463548953808e-05, "loss": 1.0429888725280763, "num_input_tokens_seen": 8966380032, "step": 31530, "train_runtime": 307158.5428, "train_tokens_per_second": 29191.374 }, { "epoch": 1.1159469004239209, "grad_norm": 1.5, "learning_rate": 2.4532510066638515e-05, "loss": 1.0548622131347656, "num_input_tokens_seen": 8969227840, "step": 31540, "train_runtime": 307259.5212, "train_tokens_per_second": 29191.049 }, { "epoch": 1.1163007206876496, "grad_norm": 1.5234375, "learning_rate": 2.452955765065216e-05, "loss": 1.044530487060547, "num_input_tokens_seen": 8972045184, "step": 31550, "train_runtime": 307355.1375, "train_tokens_per_second": 29191.135 }, { "epoch": 1.1166545409513784, "grad_norm": 1.53125, "learning_rate": 2.4526606300353234e-05, "loss": 1.0411452293395995, "num_input_tokens_seen": 8974774208, "step": 31560, "train_runtime": 307444.1593, "train_tokens_per_second": 29191.559 }, { "epoch": 1.1170083612151072, "grad_norm": 1.5390625, "learning_rate": 2.4523656015100795e-05, "loss": 1.0385894775390625, "num_input_tokens_seen": 8977614272, "step": 31570, "train_runtime": 307543.0173, "train_tokens_per_second": 29191.41 }, { "epoch": 1.117362181478836, "grad_norm": 1.4921875, "learning_rate": 2.4520706794254433e-05, "loss": 1.0645389556884766, "num_input_tokens_seen": 8980489344, "step": 31580, "train_runtime": 307643.2607, "train_tokens_per_second": 29191.244 }, { "epoch": 1.117716001742565, "grad_norm": 1.5078125, "learning_rate": 2.4517758637174266e-05, "loss": 1.0459966659545898, "num_input_tokens_seen": 8983301248, "step": 31590, "train_runtime": 307735.8503, "train_tokens_per_second": 29191.598 }, { "epoch": 1.1180698220062937, "grad_norm": 1.4921875, "learning_rate": 2.4514811543220957e-05, "loss": 1.0456958770751954, "num_input_tokens_seen": 8986166976, "step": 31600, "train_runtime": 307833.4767, "train_tokens_per_second": 29191.65 }, { "epoch": 1.1184236422700224, "grad_norm": 1.5546875, "learning_rate": 2.4511865511755717e-05, "loss": 1.048631477355957, "num_input_tokens_seen": 8989008256, "step": 31610, "train_runtime": 307929.248, "train_tokens_per_second": 29191.798 }, { "epoch": 1.1187774625337512, "grad_norm": 1.59375, "learning_rate": 2.4508920542140266e-05, "loss": 1.06162109375, "num_input_tokens_seen": 8991880064, "step": 31620, "train_runtime": 308026.4464, "train_tokens_per_second": 29191.909 }, { "epoch": 1.11913128279748, "grad_norm": 1.5234375, "learning_rate": 2.4505976633736905e-05, "loss": 1.049001407623291, "num_input_tokens_seen": 8994712896, "step": 31630, "train_runtime": 308122.6184, "train_tokens_per_second": 29191.992 }, { "epoch": 1.1194851030612087, "grad_norm": 1.515625, "learning_rate": 2.4503033785908423e-05, "loss": 1.0532272338867188, "num_input_tokens_seen": 8997562816, "step": 31640, "train_runtime": 308220.5335, "train_tokens_per_second": 29191.964 }, { "epoch": 1.1198389233249375, "grad_norm": 1.515625, "learning_rate": 2.4500091998018178e-05, "loss": 1.0328126907348634, "num_input_tokens_seen": 9000375744, "step": 31650, "train_runtime": 308315.0323, "train_tokens_per_second": 29192.141 }, { "epoch": 1.1201927435886663, "grad_norm": 1.578125, "learning_rate": 2.4497151269430056e-05, "loss": 1.0480571746826173, "num_input_tokens_seen": 9003194944, "step": 31660, "train_runtime": 308409.0779, "train_tokens_per_second": 29192.38 }, { "epoch": 1.120546563852395, "grad_norm": 1.5703125, "learning_rate": 2.4494211599508456e-05, "loss": 1.0557334899902344, "num_input_tokens_seen": 9006043008, "step": 31670, "train_runtime": 308506.3339, "train_tokens_per_second": 29192.409 }, { "epoch": 1.1209003841161238, "grad_norm": 1.5, "learning_rate": 2.4491272987618343e-05, "loss": 1.0364778518676758, "num_input_tokens_seen": 9008929856, "step": 31680, "train_runtime": 308608.2548, "train_tokens_per_second": 29192.122 }, { "epoch": 1.1212542043798526, "grad_norm": 1.5234375, "learning_rate": 2.44883354331252e-05, "loss": 1.0408843994140624, "num_input_tokens_seen": 9011756992, "step": 31690, "train_runtime": 308704.7115, "train_tokens_per_second": 29192.159 }, { "epoch": 1.1216080246435813, "grad_norm": 1.5546875, "learning_rate": 2.4485398935395037e-05, "loss": 1.041062068939209, "num_input_tokens_seen": 9014561344, "step": 31700, "train_runtime": 308802.1414, "train_tokens_per_second": 29192.03 }, { "epoch": 1.12196184490731, "grad_norm": 1.5, "learning_rate": 2.44824634937944e-05, "loss": 1.0443008422851563, "num_input_tokens_seen": 9017416320, "step": 31710, "train_runtime": 308898.6514, "train_tokens_per_second": 29192.152 }, { "epoch": 1.1223156651710389, "grad_norm": 1.5234375, "learning_rate": 2.4479529107690374e-05, "loss": 1.0452661514282227, "num_input_tokens_seen": 9020226688, "step": 31720, "train_runtime": 308992.2753, "train_tokens_per_second": 29192.402 }, { "epoch": 1.1226694854347676, "grad_norm": 1.5078125, "learning_rate": 2.4476595776450564e-05, "loss": 1.0426406860351562, "num_input_tokens_seen": 9023073728, "step": 31730, "train_runtime": 309090.8384, "train_tokens_per_second": 29192.304 }, { "epoch": 1.1230233056984964, "grad_norm": 1.5546875, "learning_rate": 2.4473663499443112e-05, "loss": 1.0516764640808105, "num_input_tokens_seen": 9025939264, "step": 31740, "train_runtime": 309189.0717, "train_tokens_per_second": 29192.297 }, { "epoch": 1.1233771259622252, "grad_norm": 1.484375, "learning_rate": 2.4470732276036698e-05, "loss": 1.0516112327575684, "num_input_tokens_seen": 9028742144, "step": 31750, "train_runtime": 309283.5716, "train_tokens_per_second": 29192.44 }, { "epoch": 1.1237309462259542, "grad_norm": 1.5234375, "learning_rate": 2.4467802105600504e-05, "loss": 1.0575088500976562, "num_input_tokens_seen": 9031582592, "step": 31760, "train_runtime": 309381.4844, "train_tokens_per_second": 29192.382 }, { "epoch": 1.124084766489683, "grad_norm": 1.515625, "learning_rate": 2.4464872987504275e-05, "loss": 1.0502893447875976, "num_input_tokens_seen": 9034511360, "step": 31770, "train_runtime": 309484.4073, "train_tokens_per_second": 29192.137 }, { "epoch": 1.1244385867534117, "grad_norm": 1.5546875, "learning_rate": 2.446194492111825e-05, "loss": 1.0474067687988282, "num_input_tokens_seen": 9037327936, "step": 31780, "train_runtime": 309580.808, "train_tokens_per_second": 29192.145 }, { "epoch": 1.1247924070171404, "grad_norm": 1.6171875, "learning_rate": 2.445901790581323e-05, "loss": 1.0419821739196777, "num_input_tokens_seen": 9040213888, "step": 31790, "train_runtime": 309678.1126, "train_tokens_per_second": 29192.292 }, { "epoch": 1.1251462272808692, "grad_norm": 1.5546875, "learning_rate": 2.445609194096051e-05, "loss": 1.0498111724853516, "num_input_tokens_seen": 9043037632, "step": 31800, "train_runtime": 309772.7052, "train_tokens_per_second": 29192.493 }, { "epoch": 1.125500047544598, "grad_norm": 1.625, "learning_rate": 2.4453167025931932e-05, "loss": 1.050590419769287, "num_input_tokens_seen": 9045867008, "step": 31810, "train_runtime": 309867.4145, "train_tokens_per_second": 29192.702 }, { "epoch": 1.1258538678083267, "grad_norm": 1.4453125, "learning_rate": 2.445024316009987e-05, "loss": 1.0657878875732423, "num_input_tokens_seen": 9048692928, "step": 31820, "train_runtime": 309964.4458, "train_tokens_per_second": 29192.68 }, { "epoch": 1.1262076880720555, "grad_norm": 1.5234375, "learning_rate": 2.4447320342837192e-05, "loss": 1.0538702964782716, "num_input_tokens_seen": 9051539264, "step": 31830, "train_runtime": 310060.8247, "train_tokens_per_second": 29192.786 }, { "epoch": 1.1265615083357843, "grad_norm": 1.515625, "learning_rate": 2.444439857351732e-05, "loss": 1.0472599983215332, "num_input_tokens_seen": 9054397632, "step": 31840, "train_runtime": 310159.7546, "train_tokens_per_second": 29192.69 }, { "epoch": 1.126915328599513, "grad_norm": 1.53125, "learning_rate": 2.4441477851514195e-05, "loss": 1.0469745635986327, "num_input_tokens_seen": 9057182848, "step": 31850, "train_runtime": 310255.0787, "train_tokens_per_second": 29192.698 }, { "epoch": 1.1272691488632418, "grad_norm": 1.5, "learning_rate": 2.443855817620227e-05, "loss": 1.0439446449279786, "num_input_tokens_seen": 9060000320, "step": 31860, "train_runtime": 310354.0321, "train_tokens_per_second": 29192.469 }, { "epoch": 1.1276229691269706, "grad_norm": 1.4921875, "learning_rate": 2.4435639546956534e-05, "loss": 1.0508008003234863, "num_input_tokens_seen": 9062860096, "step": 31870, "train_runtime": 310452.7968, "train_tokens_per_second": 29192.393 }, { "epoch": 1.1279767893906993, "grad_norm": 1.5625, "learning_rate": 2.4432721963152482e-05, "loss": 1.0317928314208984, "num_input_tokens_seen": 9065692160, "step": 31880, "train_runtime": 310547.8618, "train_tokens_per_second": 29192.576 }, { "epoch": 1.128330609654428, "grad_norm": 1.5234375, "learning_rate": 2.442980542416615e-05, "loss": 1.0434582710266114, "num_input_tokens_seen": 9068529280, "step": 31890, "train_runtime": 310641.0875, "train_tokens_per_second": 29192.949 }, { "epoch": 1.1286844299181569, "grad_norm": 1.53125, "learning_rate": 2.4426889929374085e-05, "loss": 1.0450094223022461, "num_input_tokens_seen": 9071363904, "step": 31900, "train_runtime": 310734.785, "train_tokens_per_second": 29193.268 }, { "epoch": 1.1290382501818856, "grad_norm": 1.5625, "learning_rate": 2.442397547815336e-05, "loss": 1.034642219543457, "num_input_tokens_seen": 9074169152, "step": 31910, "train_runtime": 310830.9006, "train_tokens_per_second": 29193.266 }, { "epoch": 1.1293920704456144, "grad_norm": 1.6171875, "learning_rate": 2.4421062069881545e-05, "loss": 1.0458524703979493, "num_input_tokens_seen": 9077015808, "step": 31920, "train_runtime": 310930.3143, "train_tokens_per_second": 29193.087 }, { "epoch": 1.1297458907093434, "grad_norm": 1.5390625, "learning_rate": 2.4418149703936773e-05, "loss": 1.0533014297485352, "num_input_tokens_seen": 9079837120, "step": 31930, "train_runtime": 311028.1308, "train_tokens_per_second": 29192.977 }, { "epoch": 1.1300997109730722, "grad_norm": 1.59375, "learning_rate": 2.4415238379697657e-05, "loss": 1.0463518142700194, "num_input_tokens_seen": 9082718400, "step": 31940, "train_runtime": 311126.8154, "train_tokens_per_second": 29192.978 }, { "epoch": 1.130453531236801, "grad_norm": 1.5078125, "learning_rate": 2.4412328096543355e-05, "loss": 1.056227207183838, "num_input_tokens_seen": 9085524160, "step": 31950, "train_runtime": 311222.8179, "train_tokens_per_second": 29192.989 }, { "epoch": 1.1308073515005297, "grad_norm": 1.5234375, "learning_rate": 2.4409418853853517e-05, "loss": 1.050007438659668, "num_input_tokens_seen": 9088371776, "step": 31960, "train_runtime": 311321.4328, "train_tokens_per_second": 29192.888 }, { "epoch": 1.1311611717642585, "grad_norm": 1.5859375, "learning_rate": 2.440651065100833e-05, "loss": 1.049050521850586, "num_input_tokens_seen": 9091224704, "step": 31970, "train_runtime": 311420.5427, "train_tokens_per_second": 29192.759 }, { "epoch": 1.1315149920279872, "grad_norm": 1.53125, "learning_rate": 2.44036034873885e-05, "loss": 1.0518720626831055, "num_input_tokens_seen": 9094091584, "step": 31980, "train_runtime": 311518.9739, "train_tokens_per_second": 29192.737 }, { "epoch": 1.131868812291716, "grad_norm": 1.5625, "learning_rate": 2.440069736237523e-05, "loss": 1.0541970252990722, "num_input_tokens_seen": 9096930752, "step": 31990, "train_runtime": 311612.7942, "train_tokens_per_second": 29193.059 }, { "epoch": 1.1322226325554448, "grad_norm": 1.515625, "learning_rate": 2.439779227535026e-05, "loss": 1.0437821388244628, "num_input_tokens_seen": 9099779968, "step": 32000, "train_runtime": 311709.8301, "train_tokens_per_second": 29193.112 }, { "epoch": 1.1325764528191735, "grad_norm": 1.5078125, "learning_rate": 2.439488822569583e-05, "loss": 1.0526975631713866, "num_input_tokens_seen": 9102639104, "step": 32010, "train_runtime": 311805.9603, "train_tokens_per_second": 29193.281 }, { "epoch": 1.1329302730829023, "grad_norm": 1.5625, "learning_rate": 2.4391985212794695e-05, "loss": 1.0390093803405762, "num_input_tokens_seen": 9105475008, "step": 32020, "train_runtime": 311904.7411, "train_tokens_per_second": 29193.128 }, { "epoch": 1.133284093346631, "grad_norm": 1.609375, "learning_rate": 2.4389083236030146e-05, "loss": 1.0508566856384278, "num_input_tokens_seen": 9108276032, "step": 32030, "train_runtime": 312000.297, "train_tokens_per_second": 29193.165 }, { "epoch": 1.1336379136103598, "grad_norm": 1.515625, "learning_rate": 2.4386182294785952e-05, "loss": 1.0429948806762694, "num_input_tokens_seen": 9111154176, "step": 32040, "train_runtime": 312100.3361, "train_tokens_per_second": 29193.029 }, { "epoch": 1.1339917338740886, "grad_norm": 1.5390625, "learning_rate": 2.438328238844642e-05, "loss": 1.0432381629943848, "num_input_tokens_seen": 9113959488, "step": 32050, "train_runtime": 312193.8207, "train_tokens_per_second": 29193.273 }, { "epoch": 1.1343455541378173, "grad_norm": 1.5390625, "learning_rate": 2.4380383516396372e-05, "loss": 1.0511786460876464, "num_input_tokens_seen": 9116817472, "step": 32060, "train_runtime": 312289.3377, "train_tokens_per_second": 29193.496 }, { "epoch": 1.1346993744015461, "grad_norm": 1.578125, "learning_rate": 2.4377485678021113e-05, "loss": 1.0442041397094726, "num_input_tokens_seen": 9119695808, "step": 32070, "train_runtime": 312387.1321, "train_tokens_per_second": 29193.571 }, { "epoch": 1.1350531946652749, "grad_norm": 1.46875, "learning_rate": 2.4374588872706498e-05, "loss": 1.0452404022216797, "num_input_tokens_seen": 9122551872, "step": 32080, "train_runtime": 312485.8575, "train_tokens_per_second": 29193.487 }, { "epoch": 1.1354070149290036, "grad_norm": 1.5, "learning_rate": 2.4371693099838865e-05, "loss": 1.0455184936523438, "num_input_tokens_seen": 9125410176, "step": 32090, "train_runtime": 312587.1207, "train_tokens_per_second": 29193.174 }, { "epoch": 1.1357608351927326, "grad_norm": 1.59375, "learning_rate": 2.4368798358805075e-05, "loss": 1.055732536315918, "num_input_tokens_seen": 9128252480, "step": 32100, "train_runtime": 312684.294, "train_tokens_per_second": 29193.192 }, { "epoch": 1.1361146554564614, "grad_norm": 1.5234375, "learning_rate": 2.4365904648992495e-05, "loss": 1.0638261795043946, "num_input_tokens_seen": 9131125248, "step": 32110, "train_runtime": 312779.8344, "train_tokens_per_second": 29193.459 }, { "epoch": 1.1364684757201902, "grad_norm": 1.578125, "learning_rate": 2.436301196978899e-05, "loss": 1.0604118347167968, "num_input_tokens_seen": 9133973888, "step": 32120, "train_runtime": 312878.9014, "train_tokens_per_second": 29193.32 }, { "epoch": 1.136822295983919, "grad_norm": 1.546875, "learning_rate": 2.436012032058296e-05, "loss": 1.048573875427246, "num_input_tokens_seen": 9136808640, "step": 32130, "train_runtime": 312974.9982, "train_tokens_per_second": 29193.414 }, { "epoch": 1.1371761162476477, "grad_norm": 1.5234375, "learning_rate": 2.4357229700763283e-05, "loss": 1.048323631286621, "num_input_tokens_seen": 9139679488, "step": 32140, "train_runtime": 313071.3479, "train_tokens_per_second": 29193.599 }, { "epoch": 1.1375299365113765, "grad_norm": 1.53125, "learning_rate": 2.435434010971937e-05, "loss": 1.0625919342041015, "num_input_tokens_seen": 9142476992, "step": 32150, "train_runtime": 313165.4838, "train_tokens_per_second": 29193.757 }, { "epoch": 1.1378837567751052, "grad_norm": 1.515625, "learning_rate": 2.4351451546841118e-05, "loss": 1.050563907623291, "num_input_tokens_seen": 9145374272, "step": 32160, "train_runtime": 313266.4301, "train_tokens_per_second": 29193.598 }, { "epoch": 1.138237577038834, "grad_norm": 1.578125, "learning_rate": 2.434856401151895e-05, "loss": 1.063033390045166, "num_input_tokens_seen": 9148207488, "step": 32170, "train_runtime": 313364.9698, "train_tokens_per_second": 29193.459 }, { "epoch": 1.1385913973025628, "grad_norm": 1.5, "learning_rate": 2.4345677503143778e-05, "loss": 1.0455703735351562, "num_input_tokens_seen": 9151062912, "step": 32180, "train_runtime": 313463.3372, "train_tokens_per_second": 29193.407 }, { "epoch": 1.1389452175662915, "grad_norm": 1.5234375, "learning_rate": 2.4342792021107033e-05, "loss": 1.0594691276550292, "num_input_tokens_seen": 9153943872, "step": 32190, "train_runtime": 313561.4083, "train_tokens_per_second": 29193.465 }, { "epoch": 1.1392990378300203, "grad_norm": 1.4765625, "learning_rate": 2.433990756480064e-05, "loss": 1.0457569122314454, "num_input_tokens_seen": 9156787648, "step": 32200, "train_runtime": 313658.5607, "train_tokens_per_second": 29193.489 }, { "epoch": 1.139652858093749, "grad_norm": 1.5625, "learning_rate": 2.433702413361703e-05, "loss": 1.054711151123047, "num_input_tokens_seen": 9159608000, "step": 32210, "train_runtime": 313754.6676, "train_tokens_per_second": 29193.535 }, { "epoch": 1.1400066783574778, "grad_norm": 1.515625, "learning_rate": 2.4334141726949147e-05, "loss": 1.0411535263061524, "num_input_tokens_seen": 9162429568, "step": 32220, "train_runtime": 313850.3719, "train_tokens_per_second": 29193.623 }, { "epoch": 1.1403604986212066, "grad_norm": 1.546875, "learning_rate": 2.433126034419042e-05, "loss": 1.041477108001709, "num_input_tokens_seen": 9165374848, "step": 32230, "train_runtime": 313952.8415, "train_tokens_per_second": 29193.476 }, { "epoch": 1.1407143188849354, "grad_norm": 1.5078125, "learning_rate": 2.4328379984734804e-05, "loss": 1.0271110534667969, "num_input_tokens_seen": 9168251840, "step": 32240, "train_runtime": 314053.0184, "train_tokens_per_second": 29193.325 }, { "epoch": 1.1410681391486643, "grad_norm": 1.5078125, "learning_rate": 2.4325500647976738e-05, "loss": 1.0625797271728517, "num_input_tokens_seen": 9171082368, "step": 32250, "train_runtime": 314148.7918, "train_tokens_per_second": 29193.435 }, { "epoch": 1.1414219594123929, "grad_norm": 1.5625, "learning_rate": 2.4322622333311165e-05, "loss": 1.0457557678222655, "num_input_tokens_seen": 9173994176, "step": 32260, "train_runtime": 314247.5124, "train_tokens_per_second": 29193.53 }, { "epoch": 1.1417757796761219, "grad_norm": 1.484375, "learning_rate": 2.4319745040133543e-05, "loss": 1.0398128509521485, "num_input_tokens_seen": 9176779456, "step": 32270, "train_runtime": 314343.5929, "train_tokens_per_second": 29193.467 }, { "epoch": 1.1421295999398506, "grad_norm": 1.515625, "learning_rate": 2.431686876783981e-05, "loss": 1.0560508728027345, "num_input_tokens_seen": 9179582464, "step": 32280, "train_runtime": 314440.686, "train_tokens_per_second": 29193.367 }, { "epoch": 1.1424834202035794, "grad_norm": 1.5078125, "learning_rate": 2.431399351582642e-05, "loss": 1.0500800132751464, "num_input_tokens_seen": 9182380544, "step": 32290, "train_runtime": 314536.8008, "train_tokens_per_second": 29193.342 }, { "epoch": 1.1428372404673082, "grad_norm": 1.4453125, "learning_rate": 2.431111928349032e-05, "loss": 1.035835075378418, "num_input_tokens_seen": 9185219008, "step": 32300, "train_runtime": 314635.0955, "train_tokens_per_second": 29193.244 }, { "epoch": 1.143191060731037, "grad_norm": 1.5625, "learning_rate": 2.4308246070228956e-05, "loss": 1.0359127044677734, "num_input_tokens_seen": 9188072448, "step": 32310, "train_runtime": 314733.1277, "train_tokens_per_second": 29193.217 }, { "epoch": 1.1435448809947657, "grad_norm": 1.5703125, "learning_rate": 2.430537387544027e-05, "loss": 1.0430099487304687, "num_input_tokens_seen": 9190898560, "step": 32320, "train_runtime": 314830.6093, "train_tokens_per_second": 29193.154 }, { "epoch": 1.1438987012584945, "grad_norm": 1.5859375, "learning_rate": 2.4302502698522707e-05, "loss": 1.0741775512695313, "num_input_tokens_seen": 9193738752, "step": 32330, "train_runtime": 314928.9703, "train_tokens_per_second": 29193.055 }, { "epoch": 1.1442525215222232, "grad_norm": 1.5859375, "learning_rate": 2.429963253887521e-05, "loss": 1.0395607948303223, "num_input_tokens_seen": 9196551616, "step": 32340, "train_runtime": 315024.8354, "train_tokens_per_second": 29193.1 }, { "epoch": 1.144606341785952, "grad_norm": 1.5078125, "learning_rate": 2.4296763395897212e-05, "loss": 1.032814884185791, "num_input_tokens_seen": 9199440448, "step": 32350, "train_runtime": 315123.9614, "train_tokens_per_second": 29193.085 }, { "epoch": 1.1449601620496808, "grad_norm": 1.5390625, "learning_rate": 2.4293895268988646e-05, "loss": 1.0513600349426269, "num_input_tokens_seen": 9202239616, "step": 32360, "train_runtime": 315218.7343, "train_tokens_per_second": 29193.188 }, { "epoch": 1.1453139823134095, "grad_norm": 1.5625, "learning_rate": 2.429102815754994e-05, "loss": 1.0378034591674805, "num_input_tokens_seen": 9205112192, "step": 32370, "train_runtime": 315319.4919, "train_tokens_per_second": 29192.969 }, { "epoch": 1.1456678025771383, "grad_norm": 1.5625, "learning_rate": 2.428816206098202e-05, "loss": 1.036593246459961, "num_input_tokens_seen": 9208002176, "step": 32380, "train_runtime": 315418.946, "train_tokens_per_second": 29192.927 }, { "epoch": 1.146021622840867, "grad_norm": 1.484375, "learning_rate": 2.42852969786863e-05, "loss": 1.0576810836791992, "num_input_tokens_seen": 9210931712, "step": 32390, "train_runtime": 315520.4814, "train_tokens_per_second": 29192.817 }, { "epoch": 1.1463754431045958, "grad_norm": 1.5625, "learning_rate": 2.42824329100647e-05, "loss": 1.0560544967651366, "num_input_tokens_seen": 9213806912, "step": 32400, "train_runtime": 315618.1033, "train_tokens_per_second": 29192.897 }, { "epoch": 1.1467292633683246, "grad_norm": 1.5703125, "learning_rate": 2.4279569854519623e-05, "loss": 1.0520299911499023, "num_input_tokens_seen": 9216752256, "step": 32410, "train_runtime": 315726.149, "train_tokens_per_second": 29192.236 }, { "epoch": 1.1470830836320536, "grad_norm": 1.5234375, "learning_rate": 2.427670781145397e-05, "loss": 1.0443252563476562, "num_input_tokens_seen": 9219542528, "step": 32420, "train_runtime": 315819.6952, "train_tokens_per_second": 29192.424 }, { "epoch": 1.1474369038957821, "grad_norm": 1.53125, "learning_rate": 2.4273846780271132e-05, "loss": 1.0557531356811523, "num_input_tokens_seen": 9222449664, "step": 32430, "train_runtime": 315922.045, "train_tokens_per_second": 29192.169 }, { "epoch": 1.147790724159511, "grad_norm": 1.671875, "learning_rate": 2.4270986760374985e-05, "loss": 1.0323116302490234, "num_input_tokens_seen": 9225259136, "step": 32440, "train_runtime": 316018.7977, "train_tokens_per_second": 29192.121 }, { "epoch": 1.1481445444232399, "grad_norm": 1.5234375, "learning_rate": 2.4268127751169922e-05, "loss": 1.0515762329101563, "num_input_tokens_seen": 9228095808, "step": 32450, "train_runtime": 316116.1598, "train_tokens_per_second": 29192.104 }, { "epoch": 1.1484983646869686, "grad_norm": 1.4921875, "learning_rate": 2.4265269752060792e-05, "loss": 1.0592628479003907, "num_input_tokens_seen": 9230960960, "step": 32460, "train_runtime": 316215.0486, "train_tokens_per_second": 29192.036 }, { "epoch": 1.1488521849506974, "grad_norm": 1.5078125, "learning_rate": 2.4262412762452966e-05, "loss": 1.037183952331543, "num_input_tokens_seen": 9233762240, "step": 32470, "train_runtime": 316308.8794, "train_tokens_per_second": 29192.232 }, { "epoch": 1.1492060052144262, "grad_norm": 1.5703125, "learning_rate": 2.4259556781752288e-05, "loss": 1.046483039855957, "num_input_tokens_seen": 9236616256, "step": 32480, "train_runtime": 316405.4809, "train_tokens_per_second": 29192.34 }, { "epoch": 1.149559825478155, "grad_norm": 1.59375, "learning_rate": 2.4256701809365084e-05, "loss": 1.0437725067138672, "num_input_tokens_seen": 9239468160, "step": 32490, "train_runtime": 316504.3086, "train_tokens_per_second": 29192.235 }, { "epoch": 1.1499136457418837, "grad_norm": 1.53125, "learning_rate": 2.4253847844698192e-05, "loss": 1.037636947631836, "num_input_tokens_seen": 9242305792, "step": 32500, "train_runtime": 316598.0295, "train_tokens_per_second": 29192.556 }, { "epoch": 1.1502674660056125, "grad_norm": 1.53125, "learning_rate": 2.4250994887158923e-05, "loss": 1.0476924896240234, "num_input_tokens_seen": 9245208512, "step": 32510, "train_runtime": 316699.04, "train_tokens_per_second": 29192.411 }, { "epoch": 1.1506212862693412, "grad_norm": 1.5234375, "learning_rate": 2.4248142936155078e-05, "loss": 1.0538250923156738, "num_input_tokens_seen": 9248095040, "step": 32520, "train_runtime": 316799.6536, "train_tokens_per_second": 29192.251 }, { "epoch": 1.15097510653307, "grad_norm": 1.546875, "learning_rate": 2.424529199109494e-05, "loss": 1.0363734245300293, "num_input_tokens_seen": 9250908736, "step": 32530, "train_runtime": 316893.853, "train_tokens_per_second": 29192.452 }, { "epoch": 1.1513289267967988, "grad_norm": 1.4609375, "learning_rate": 2.42424420513873e-05, "loss": 1.0496133804321288, "num_input_tokens_seen": 9253798272, "step": 32540, "train_runtime": 316993.2595, "train_tokens_per_second": 29192.413 }, { "epoch": 1.1516827470605275, "grad_norm": 1.484375, "learning_rate": 2.4239593116441407e-05, "loss": 1.055825901031494, "num_input_tokens_seen": 9256601152, "step": 32550, "train_runtime": 317089.6771, "train_tokens_per_second": 29192.376 }, { "epoch": 1.1520365673242563, "grad_norm": 1.5078125, "learning_rate": 2.423674518566701e-05, "loss": 1.0431286811828613, "num_input_tokens_seen": 9259409984, "step": 32560, "train_runtime": 317184.306, "train_tokens_per_second": 29192.522 }, { "epoch": 1.152390387587985, "grad_norm": 1.5234375, "learning_rate": 2.4233898258474347e-05, "loss": 1.0527082443237306, "num_input_tokens_seen": 9262257600, "step": 32570, "train_runtime": 317283.6518, "train_tokens_per_second": 29192.357 }, { "epoch": 1.1527442078517138, "grad_norm": 1.5234375, "learning_rate": 2.4231052334274144e-05, "loss": 1.0527776718139648, "num_input_tokens_seen": 9265102848, "step": 32580, "train_runtime": 317379.1271, "train_tokens_per_second": 29192.54 }, { "epoch": 1.1530980281154428, "grad_norm": 1.578125, "learning_rate": 2.4228207412477587e-05, "loss": 1.0542076110839844, "num_input_tokens_seen": 9267959744, "step": 32590, "train_runtime": 317476.6132, "train_tokens_per_second": 29192.575 }, { "epoch": 1.1534518483791714, "grad_norm": 1.515625, "learning_rate": 2.4225363492496376e-05, "loss": 1.0584444046020507, "num_input_tokens_seen": 9270835776, "step": 32600, "train_runtime": 317576.4598, "train_tokens_per_second": 29192.453 }, { "epoch": 1.1538056686429004, "grad_norm": 1.5390625, "learning_rate": 2.422252057374267e-05, "loss": 1.0436830520629883, "num_input_tokens_seen": 9273656704, "step": 32610, "train_runtime": 317671.6494, "train_tokens_per_second": 29192.585 }, { "epoch": 1.1541594889066291, "grad_norm": 1.4921875, "learning_rate": 2.421967865562914e-05, "loss": 1.0404401779174806, "num_input_tokens_seen": 9276506176, "step": 32620, "train_runtime": 317770.5632, "train_tokens_per_second": 29192.465 }, { "epoch": 1.1545133091703579, "grad_norm": 1.609375, "learning_rate": 2.42168377375689e-05, "loss": 1.041179370880127, "num_input_tokens_seen": 9279303040, "step": 32630, "train_runtime": 317866.0312, "train_tokens_per_second": 29192.497 }, { "epoch": 1.1548671294340866, "grad_norm": 1.484375, "learning_rate": 2.421399781897558e-05, "loss": 1.0554627418518066, "num_input_tokens_seen": 9282128768, "step": 32640, "train_runtime": 317961.729, "train_tokens_per_second": 29192.597 }, { "epoch": 1.1552209496978154, "grad_norm": 1.5859375, "learning_rate": 2.421115889926327e-05, "loss": 1.0332971572875977, "num_input_tokens_seen": 9284994944, "step": 32650, "train_runtime": 318057.4652, "train_tokens_per_second": 29192.822 }, { "epoch": 1.1555747699615442, "grad_norm": 1.578125, "learning_rate": 2.4208320977846555e-05, "loss": 1.0540093421936034, "num_input_tokens_seen": 9287864128, "step": 32660, "train_runtime": 318160.2763, "train_tokens_per_second": 29192.407 }, { "epoch": 1.155928590225273, "grad_norm": 1.5078125, "learning_rate": 2.4205484054140493e-05, "loss": 1.0434331893920898, "num_input_tokens_seen": 9290722688, "step": 32670, "train_runtime": 318254.7732, "train_tokens_per_second": 29192.721 }, { "epoch": 1.1562824104890017, "grad_norm": 1.5390625, "learning_rate": 2.4202648127560616e-05, "loss": 1.0429251670837403, "num_input_tokens_seen": 9293619328, "step": 32680, "train_runtime": 318354.5927, "train_tokens_per_second": 29192.666 }, { "epoch": 1.1566362307527305, "grad_norm": 1.4921875, "learning_rate": 2.4199813197522947e-05, "loss": 1.0462181091308593, "num_input_tokens_seen": 9296439552, "step": 32690, "train_runtime": 318449.3515, "train_tokens_per_second": 29192.836 }, { "epoch": 1.1569900510164592, "grad_norm": 1.546875, "learning_rate": 2.4196979263443985e-05, "loss": 1.0607258796691894, "num_input_tokens_seen": 9299260096, "step": 32700, "train_runtime": 318544.6935, "train_tokens_per_second": 29192.952 }, { "epoch": 1.157343871280188, "grad_norm": 1.5546875, "learning_rate": 2.4194146324740697e-05, "loss": 1.0570894241333009, "num_input_tokens_seen": 9302155392, "step": 32710, "train_runtime": 318643.9295, "train_tokens_per_second": 29192.947 }, { "epoch": 1.1576976915439168, "grad_norm": 1.53125, "learning_rate": 2.4191314380830545e-05, "loss": 1.0498271942138673, "num_input_tokens_seen": 9305032704, "step": 32720, "train_runtime": 318744.065, "train_tokens_per_second": 29192.803 }, { "epoch": 1.1580515118076455, "grad_norm": 1.5078125, "learning_rate": 2.4188483431131453e-05, "loss": 1.03955135345459, "num_input_tokens_seen": 9307922176, "step": 32730, "train_runtime": 318844.0745, "train_tokens_per_second": 29192.709 }, { "epoch": 1.1584053320713743, "grad_norm": 1.5625, "learning_rate": 2.4185653475061826e-05, "loss": 1.0597930908203126, "num_input_tokens_seen": 9310772928, "step": 32740, "train_runtime": 318942.0228, "train_tokens_per_second": 29192.682 }, { "epoch": 1.158759152335103, "grad_norm": 1.53125, "learning_rate": 2.418282451204055e-05, "loss": 1.0491201400756835, "num_input_tokens_seen": 9313617920, "step": 32750, "train_runtime": 319038.0671, "train_tokens_per_second": 29192.811 }, { "epoch": 1.159112972598832, "grad_norm": 1.5703125, "learning_rate": 2.417999654148698e-05, "loss": 1.0376638412475585, "num_input_tokens_seen": 9316380864, "step": 32760, "train_runtime": 319132.1817, "train_tokens_per_second": 29192.859 }, { "epoch": 1.1594667928625608, "grad_norm": 1.4921875, "learning_rate": 2.4177169562820957e-05, "loss": 1.0466375350952148, "num_input_tokens_seen": 9319236608, "step": 32770, "train_runtime": 319228.6595, "train_tokens_per_second": 29192.982 }, { "epoch": 1.1598206131262896, "grad_norm": 1.5625, "learning_rate": 2.417434357546278e-05, "loss": 1.048301601409912, "num_input_tokens_seen": 9322090112, "step": 32780, "train_runtime": 319327.5124, "train_tokens_per_second": 29192.881 }, { "epoch": 1.1601744333900184, "grad_norm": 1.53125, "learning_rate": 2.417151857883324e-05, "loss": 1.0443024635314941, "num_input_tokens_seen": 9324975552, "step": 32790, "train_runtime": 319428.1631, "train_tokens_per_second": 29192.716 }, { "epoch": 1.1605282536537471, "grad_norm": 1.53125, "learning_rate": 2.416869457235358e-05, "loss": 1.0508749961853028, "num_input_tokens_seen": 9327805440, "step": 32800, "train_runtime": 319527.3024, "train_tokens_per_second": 29192.515 }, { "epoch": 1.1608820739174759, "grad_norm": 1.5078125, "learning_rate": 2.416587155544554e-05, "loss": 1.042680549621582, "num_input_tokens_seen": 9330690368, "step": 32810, "train_runtime": 319629.8267, "train_tokens_per_second": 29192.177 }, { "epoch": 1.1612358941812047, "grad_norm": 1.46875, "learning_rate": 2.416304952753132e-05, "loss": 1.0420875549316406, "num_input_tokens_seen": 9333535360, "step": 32820, "train_runtime": 319729.4394, "train_tokens_per_second": 29191.98 }, { "epoch": 1.1615897144449334, "grad_norm": 1.53125, "learning_rate": 2.4160228488033597e-05, "loss": 1.0510334014892577, "num_input_tokens_seen": 9336407552, "step": 32830, "train_runtime": 319827.0853, "train_tokens_per_second": 29192.048 }, { "epoch": 1.1619435347086622, "grad_norm": 1.546875, "learning_rate": 2.415740843637551e-05, "loss": 1.0462615966796875, "num_input_tokens_seen": 9339243968, "step": 32840, "train_runtime": 319923.506, "train_tokens_per_second": 29192.116 }, { "epoch": 1.162297354972391, "grad_norm": 1.5078125, "learning_rate": 2.4154589371980672e-05, "loss": 1.0432231903076172, "num_input_tokens_seen": 9342061376, "step": 32850, "train_runtime": 320020.392, "train_tokens_per_second": 29192.082 }, { "epoch": 1.1626511752361197, "grad_norm": 1.4765625, "learning_rate": 2.415177129427319e-05, "loss": 1.0435205459594727, "num_input_tokens_seen": 9344861312, "step": 32860, "train_runtime": 320114.5634, "train_tokens_per_second": 29192.24 }, { "epoch": 1.1630049954998485, "grad_norm": 1.5234375, "learning_rate": 2.414895420267761e-05, "loss": 1.037504291534424, "num_input_tokens_seen": 9347685952, "step": 32870, "train_runtime": 320211.7764, "train_tokens_per_second": 29192.199 }, { "epoch": 1.1633588157635772, "grad_norm": 1.5078125, "learning_rate": 2.414613809661895e-05, "loss": 1.037369728088379, "num_input_tokens_seen": 9350535936, "step": 32880, "train_runtime": 320306.1323, "train_tokens_per_second": 29192.497 }, { "epoch": 1.163712636027306, "grad_norm": 1.59375, "learning_rate": 2.4143322975522726e-05, "loss": 1.0578983306884766, "num_input_tokens_seen": 9353344832, "step": 32890, "train_runtime": 320402.3921, "train_tokens_per_second": 29192.494 }, { "epoch": 1.1640664562910348, "grad_norm": 1.5234375, "learning_rate": 2.414050883881489e-05, "loss": 1.0586021423339844, "num_input_tokens_seen": 9356229248, "step": 32900, "train_runtime": 320501.8902, "train_tokens_per_second": 29192.431 }, { "epoch": 1.1644202765547635, "grad_norm": 1.5390625, "learning_rate": 2.413769568592188e-05, "loss": 1.0394105911254883, "num_input_tokens_seen": 9359088832, "step": 32910, "train_runtime": 320599.3888, "train_tokens_per_second": 29192.472 }, { "epoch": 1.1647740968184923, "grad_norm": 1.53125, "learning_rate": 2.41348835162706e-05, "loss": 1.0404560089111328, "num_input_tokens_seen": 9361896832, "step": 32920, "train_runtime": 320690.9863, "train_tokens_per_second": 29192.89 }, { "epoch": 1.1651279170822213, "grad_norm": 1.5546875, "learning_rate": 2.4132072329288414e-05, "loss": 1.0524593353271485, "num_input_tokens_seen": 9364762048, "step": 32930, "train_runtime": 320789.2124, "train_tokens_per_second": 29192.883 }, { "epoch": 1.16548173734595, "grad_norm": 1.484375, "learning_rate": 2.4129262124403165e-05, "loss": 1.0528087615966797, "num_input_tokens_seen": 9367664576, "step": 32940, "train_runtime": 320892.2813, "train_tokens_per_second": 29192.552 }, { "epoch": 1.1658355576096788, "grad_norm": 1.5703125, "learning_rate": 2.4126452901043155e-05, "loss": 1.0578031539916992, "num_input_tokens_seen": 9370459584, "step": 32950, "train_runtime": 320988.6864, "train_tokens_per_second": 29192.492 }, { "epoch": 1.1661893778734076, "grad_norm": 1.5234375, "learning_rate": 2.412364465863714e-05, "loss": 1.0421407699584961, "num_input_tokens_seen": 9373308352, "step": 32960, "train_runtime": 321087.833, "train_tokens_per_second": 29192.35 }, { "epoch": 1.1665431981371364, "grad_norm": 1.546875, "learning_rate": 2.4120837396614367e-05, "loss": 1.0504817008972167, "num_input_tokens_seen": 9376113856, "step": 32970, "train_runtime": 321181.8857, "train_tokens_per_second": 29192.536 }, { "epoch": 1.1668970184008651, "grad_norm": 1.53125, "learning_rate": 2.4118031114404525e-05, "loss": 1.0418380737304687, "num_input_tokens_seen": 9378983360, "step": 32980, "train_runtime": 321279.8609, "train_tokens_per_second": 29192.565 }, { "epoch": 1.167250838664594, "grad_norm": 1.5234375, "learning_rate": 2.411522581143778e-05, "loss": 1.0419570922851562, "num_input_tokens_seen": 9381851328, "step": 32990, "train_runtime": 321378.0665, "train_tokens_per_second": 29192.569 }, { "epoch": 1.1676046589283227, "grad_norm": 1.515625, "learning_rate": 2.4112421487144762e-05, "loss": 1.0477673530578613, "num_input_tokens_seen": 9384704960, "step": 33000, "train_runtime": 321476.0676, "train_tokens_per_second": 29192.546 }, { "epoch": 1.1679584791920514, "grad_norm": 1.5390625, "learning_rate": 2.410961814095655e-05, "loss": 1.0445474624633788, "num_input_tokens_seen": 9387591232, "step": 33010, "train_runtime": 321575.4434, "train_tokens_per_second": 29192.5 }, { "epoch": 1.1683122994557802, "grad_norm": 1.4765625, "learning_rate": 2.410681577230471e-05, "loss": 1.0470449447631835, "num_input_tokens_seen": 9390438848, "step": 33020, "train_runtime": 321674.6138, "train_tokens_per_second": 29192.353 }, { "epoch": 1.168666119719509, "grad_norm": 1.546875, "learning_rate": 2.410401438062125e-05, "loss": 1.0504799842834474, "num_input_tokens_seen": 9393268608, "step": 33030, "train_runtime": 321771.5331, "train_tokens_per_second": 29192.354 }, { "epoch": 1.1690199399832377, "grad_norm": 1.5078125, "learning_rate": 2.4101213965338647e-05, "loss": 1.052176284790039, "num_input_tokens_seen": 9396069120, "step": 33040, "train_runtime": 321865.3779, "train_tokens_per_second": 29192.544 }, { "epoch": 1.1693737602469665, "grad_norm": 1.5, "learning_rate": 2.4098414525889836e-05, "loss": 1.0376056671142577, "num_input_tokens_seen": 9398898688, "step": 33050, "train_runtime": 321962.7058, "train_tokens_per_second": 29192.507 }, { "epoch": 1.1697275805106953, "grad_norm": 1.5390625, "learning_rate": 2.4095616061708218e-05, "loss": 1.0475838661193848, "num_input_tokens_seen": 9401752448, "step": 33060, "train_runtime": 322059.1035, "train_tokens_per_second": 29192.631 }, { "epoch": 1.170081400774424, "grad_norm": 1.59375, "learning_rate": 2.4092818572227663e-05, "loss": 1.049431610107422, "num_input_tokens_seen": 9404559936, "step": 33070, "train_runtime": 322157.2328, "train_tokens_per_second": 29192.453 }, { "epoch": 1.1704352210381528, "grad_norm": 1.46875, "learning_rate": 2.4090022056882475e-05, "loss": 1.0546879768371582, "num_input_tokens_seen": 9407359360, "step": 33080, "train_runtime": 322253.326, "train_tokens_per_second": 29192.435 }, { "epoch": 1.1707890413018816, "grad_norm": 1.5859375, "learning_rate": 2.408722651510744e-05, "loss": 1.056777286529541, "num_input_tokens_seen": 9410227264, "step": 33090, "train_runtime": 322354.4818, "train_tokens_per_second": 29192.171 }, { "epoch": 1.1711428615656105, "grad_norm": 1.5390625, "learning_rate": 2.40844319463378e-05, "loss": 1.061662769317627, "num_input_tokens_seen": 9413071936, "step": 33100, "train_runtime": 322453.3029, "train_tokens_per_second": 29192.047 }, { "epoch": 1.1714966818293393, "grad_norm": 1.5859375, "learning_rate": 2.4081638350009247e-05, "loss": 1.047011947631836, "num_input_tokens_seen": 9415914944, "step": 33110, "train_runtime": 322548.9801, "train_tokens_per_second": 29192.202 }, { "epoch": 1.171850502093068, "grad_norm": 1.578125, "learning_rate": 2.407884572555794e-05, "loss": 1.0410253524780273, "num_input_tokens_seen": 9418758016, "step": 33120, "train_runtime": 322647.6684, "train_tokens_per_second": 29192.085 }, { "epoch": 1.1722043223567968, "grad_norm": 1.5234375, "learning_rate": 2.4076054072420486e-05, "loss": 1.045882511138916, "num_input_tokens_seen": 9421605568, "step": 33130, "train_runtime": 322744.6669, "train_tokens_per_second": 29192.134 }, { "epoch": 1.1725581426205256, "grad_norm": 1.515625, "learning_rate": 2.4073263390033957e-05, "loss": 1.044580078125, "num_input_tokens_seen": 9424470656, "step": 33140, "train_runtime": 322841.5336, "train_tokens_per_second": 29192.25 }, { "epoch": 1.1729119628842544, "grad_norm": 1.6015625, "learning_rate": 2.407047367783588e-05, "loss": 1.0418977737426758, "num_input_tokens_seen": 9427328064, "step": 33150, "train_runtime": 322939.5539, "train_tokens_per_second": 29192.237 }, { "epoch": 1.1732657831479831, "grad_norm": 1.53125, "learning_rate": 2.406768493526424e-05, "loss": 1.0422359466552735, "num_input_tokens_seen": 9430267776, "step": 33160, "train_runtime": 323041.8965, "train_tokens_per_second": 29192.089 }, { "epoch": 1.173619603411712, "grad_norm": 1.484375, "learning_rate": 2.4064897161757468e-05, "loss": 1.0466090202331544, "num_input_tokens_seen": 9433076864, "step": 33170, "train_runtime": 323134.5161, "train_tokens_per_second": 29192.415 }, { "epoch": 1.1739734236754407, "grad_norm": 1.484375, "learning_rate": 2.4062110356754464e-05, "loss": 1.0432160377502442, "num_input_tokens_seen": 9435879104, "step": 33180, "train_runtime": 323229.2541, "train_tokens_per_second": 29192.528 }, { "epoch": 1.1743272439391694, "grad_norm": 1.5, "learning_rate": 2.4059324519694572e-05, "loss": 1.041322898864746, "num_input_tokens_seen": 9438735936, "step": 33190, "train_runtime": 323325.9152, "train_tokens_per_second": 29192.637 }, { "epoch": 1.1746810642028982, "grad_norm": 1.53125, "learning_rate": 2.40565396500176e-05, "loss": 1.0426311492919922, "num_input_tokens_seen": 9441674880, "step": 33200, "train_runtime": 323428.9636, "train_tokens_per_second": 29192.422 }, { "epoch": 1.175034884466627, "grad_norm": 1.515625, "learning_rate": 2.40537557471638e-05, "loss": 1.0483665466308594, "num_input_tokens_seen": 9444507392, "step": 33210, "train_runtime": 323526.1822, "train_tokens_per_second": 29192.405 }, { "epoch": 1.1753887047303557, "grad_norm": 1.609375, "learning_rate": 2.4050972810573875e-05, "loss": 1.054740810394287, "num_input_tokens_seen": 9447403584, "step": 33220, "train_runtime": 323628.1224, "train_tokens_per_second": 29192.159 }, { "epoch": 1.1757425249940845, "grad_norm": 1.5234375, "learning_rate": 2.4048190839689003e-05, "loss": 1.0511341094970703, "num_input_tokens_seen": 9450276032, "step": 33230, "train_runtime": 323725.6822, "train_tokens_per_second": 29192.235 }, { "epoch": 1.1760963452578133, "grad_norm": 1.5625, "learning_rate": 2.404540983395078e-05, "loss": 1.061384677886963, "num_input_tokens_seen": 9453128704, "step": 33240, "train_runtime": 323822.7719, "train_tokens_per_second": 29192.291 }, { "epoch": 1.1764501655215422, "grad_norm": 1.546875, "learning_rate": 2.404262979280129e-05, "loss": 1.0401178359985352, "num_input_tokens_seen": 9455938816, "step": 33250, "train_runtime": 323919.1172, "train_tokens_per_second": 29192.284 }, { "epoch": 1.1768039857852708, "grad_norm": 1.5625, "learning_rate": 2.403985071568304e-05, "loss": 1.0605267524719237, "num_input_tokens_seen": 9458846912, "step": 33260, "train_runtime": 324021.0063, "train_tokens_per_second": 29192.079 }, { "epoch": 1.1771578060489998, "grad_norm": 1.515625, "learning_rate": 2.4037072602039002e-05, "loss": 1.038251781463623, "num_input_tokens_seen": 9461655808, "step": 33270, "train_runtime": 324117.2406, "train_tokens_per_second": 29192.078 }, { "epoch": 1.1775116263127285, "grad_norm": 1.53125, "learning_rate": 2.4034295451312596e-05, "loss": 1.038266944885254, "num_input_tokens_seen": 9464510336, "step": 33280, "train_runtime": 324214.811, "train_tokens_per_second": 29192.097 }, { "epoch": 1.1778654465764573, "grad_norm": 1.4765625, "learning_rate": 2.403151926294769e-05, "loss": 1.0397583961486816, "num_input_tokens_seen": 9467379904, "step": 33290, "train_runtime": 324311.7911, "train_tokens_per_second": 29192.216 }, { "epoch": 1.178219266840186, "grad_norm": 1.5625, "learning_rate": 2.4028744036388606e-05, "loss": 1.0602401733398437, "num_input_tokens_seen": 9470173248, "step": 33300, "train_runtime": 324405.4836, "train_tokens_per_second": 29192.396 }, { "epoch": 1.1785730871039148, "grad_norm": 1.5078125, "learning_rate": 2.4025969771080115e-05, "loss": 1.051076889038086, "num_input_tokens_seen": 9473054848, "step": 33310, "train_runtime": 324505.9537, "train_tokens_per_second": 29192.237 }, { "epoch": 1.1789269073676436, "grad_norm": 1.5390625, "learning_rate": 2.402319646646742e-05, "loss": 1.0372862815856934, "num_input_tokens_seen": 9475877696, "step": 33320, "train_runtime": 324601.8597, "train_tokens_per_second": 29192.309 }, { "epoch": 1.1792807276313724, "grad_norm": 1.5625, "learning_rate": 2.40204241219962e-05, "loss": 1.0379487991333007, "num_input_tokens_seen": 9478680000, "step": 33330, "train_runtime": 324695.7327, "train_tokens_per_second": 29192.499 }, { "epoch": 1.1796345478951011, "grad_norm": 1.5546875, "learning_rate": 2.4017652737112568e-05, "loss": 1.0590753555297852, "num_input_tokens_seen": 9481559616, "step": 33340, "train_runtime": 324795.5859, "train_tokens_per_second": 29192.391 }, { "epoch": 1.17998836815883, "grad_norm": 1.5546875, "learning_rate": 2.4014882311263073e-05, "loss": 1.0555908203125, "num_input_tokens_seen": 9484425536, "step": 33350, "train_runtime": 324895.0845, "train_tokens_per_second": 29192.272 }, { "epoch": 1.1803421884225587, "grad_norm": 1.5859375, "learning_rate": 2.4012112843894734e-05, "loss": 1.065989112854004, "num_input_tokens_seen": 9487289024, "step": 33360, "train_runtime": 324993.0493, "train_tokens_per_second": 29192.283 }, { "epoch": 1.1806960086862874, "grad_norm": 1.5703125, "learning_rate": 2.400934433445499e-05, "loss": 1.0564004898071289, "num_input_tokens_seen": 9490138112, "step": 33370, "train_runtime": 325089.9557, "train_tokens_per_second": 29192.345 }, { "epoch": 1.1810498289500162, "grad_norm": 1.609375, "learning_rate": 2.4006576782391752e-05, "loss": 1.0383302688598632, "num_input_tokens_seen": 9492945728, "step": 33380, "train_runtime": 325183.3903, "train_tokens_per_second": 29192.591 }, { "epoch": 1.181403649213745, "grad_norm": 1.4921875, "learning_rate": 2.400381018715336e-05, "loss": 1.044392204284668, "num_input_tokens_seen": 9495778368, "step": 33390, "train_runtime": 325279.0154, "train_tokens_per_second": 29192.717 }, { "epoch": 1.1817574694774737, "grad_norm": 1.5234375, "learning_rate": 2.40010445481886e-05, "loss": 1.0480578422546387, "num_input_tokens_seen": 9498635840, "step": 33400, "train_runtime": 325376.9453, "train_tokens_per_second": 29192.713 }, { "epoch": 1.1821112897412025, "grad_norm": 1.6015625, "learning_rate": 2.399827986494671e-05, "loss": 1.0429742813110352, "num_input_tokens_seen": 9501464128, "step": 33410, "train_runtime": 325471.5144, "train_tokens_per_second": 29192.921 }, { "epoch": 1.1824651100049315, "grad_norm": 1.5546875, "learning_rate": 2.3995516136877368e-05, "loss": 1.0429563522338867, "num_input_tokens_seen": 9504287872, "step": 33420, "train_runtime": 325566.4248, "train_tokens_per_second": 29193.084 }, { "epoch": 1.18281893026866, "grad_norm": 1.5703125, "learning_rate": 2.3992753363430694e-05, "loss": 1.049850082397461, "num_input_tokens_seen": 9507071424, "step": 33430, "train_runtime": 325659.1939, "train_tokens_per_second": 29193.315 }, { "epoch": 1.183172750532389, "grad_norm": 1.4921875, "learning_rate": 2.3989991544057252e-05, "loss": 1.0475232124328613, "num_input_tokens_seen": 9509908096, "step": 33440, "train_runtime": 325753.2426, "train_tokens_per_second": 29193.595 }, { "epoch": 1.1835265707961178, "grad_norm": 1.515625, "learning_rate": 2.3987230678208044e-05, "loss": 1.0477602005004882, "num_input_tokens_seen": 9512749568, "step": 33450, "train_runtime": 325850.2626, "train_tokens_per_second": 29193.623 }, { "epoch": 1.1838803910598465, "grad_norm": 1.5390625, "learning_rate": 2.3984470765334527e-05, "loss": 1.0219315528869628, "num_input_tokens_seen": 9515630272, "step": 33460, "train_runtime": 325950.0632, "train_tokens_per_second": 29193.522 }, { "epoch": 1.1842342113235753, "grad_norm": 1.5390625, "learning_rate": 2.398171180488859e-05, "loss": 1.0671205520629883, "num_input_tokens_seen": 9518488256, "step": 33470, "train_runtime": 326049.4024, "train_tokens_per_second": 29193.393 }, { "epoch": 1.184588031587304, "grad_norm": 1.5546875, "learning_rate": 2.3978953796322565e-05, "loss": 1.0545934677124023, "num_input_tokens_seen": 9521336768, "step": 33480, "train_runtime": 326147.5605, "train_tokens_per_second": 29193.34 }, { "epoch": 1.1849418518510328, "grad_norm": 1.546875, "learning_rate": 2.3976196739089218e-05, "loss": 1.0505924224853516, "num_input_tokens_seen": 9524181696, "step": 33490, "train_runtime": 326246.1526, "train_tokens_per_second": 29193.238 }, { "epoch": 1.1852956721147616, "grad_norm": 1.53125, "learning_rate": 2.397344063264177e-05, "loss": 1.0547115325927734, "num_input_tokens_seen": 9527027968, "step": 33500, "train_runtime": 326344.0253, "train_tokens_per_second": 29193.205 }, { "epoch": 1.1856494923784904, "grad_norm": 1.6015625, "learning_rate": 2.3970685476433867e-05, "loss": 1.0371501922607422, "num_input_tokens_seen": 9529800960, "step": 33510, "train_runtime": 326436.5714, "train_tokens_per_second": 29193.423 }, { "epoch": 1.1860033126422191, "grad_norm": 1.5078125, "learning_rate": 2.396793126991961e-05, "loss": 1.048904800415039, "num_input_tokens_seen": 9532695360, "step": 33520, "train_runtime": 326537.0411, "train_tokens_per_second": 29193.305 }, { "epoch": 1.186357132905948, "grad_norm": 1.5546875, "learning_rate": 2.396517801255352e-05, "loss": 1.0349294662475585, "num_input_tokens_seen": 9535536512, "step": 33530, "train_runtime": 326633.3564, "train_tokens_per_second": 29193.395 }, { "epoch": 1.1867109531696767, "grad_norm": 1.53125, "learning_rate": 2.3962425703790577e-05, "loss": 1.0505560874938964, "num_input_tokens_seen": 9538409280, "step": 33540, "train_runtime": 326730.6436, "train_tokens_per_second": 29193.495 }, { "epoch": 1.1870647734334054, "grad_norm": 1.5234375, "learning_rate": 2.395967434308618e-05, "loss": 1.040046501159668, "num_input_tokens_seen": 9541272320, "step": 33550, "train_runtime": 326827.5586, "train_tokens_per_second": 29193.598 }, { "epoch": 1.1874185936971342, "grad_norm": 1.546875, "learning_rate": 2.395692392989619e-05, "loss": 1.0439062118530273, "num_input_tokens_seen": 9544064320, "step": 33560, "train_runtime": 326922.8118, "train_tokens_per_second": 29193.632 }, { "epoch": 1.187772413960863, "grad_norm": 1.59375, "learning_rate": 2.3954174463676868e-05, "loss": 1.0508002281188964, "num_input_tokens_seen": 9546886080, "step": 33570, "train_runtime": 327020.9833, "train_tokens_per_second": 29193.497 }, { "epoch": 1.1881262342245917, "grad_norm": 1.484375, "learning_rate": 2.395142594388495e-05, "loss": 1.0431723594665527, "num_input_tokens_seen": 9549726336, "step": 33580, "train_runtime": 327115.9228, "train_tokens_per_second": 29193.707 }, { "epoch": 1.1884800544883207, "grad_norm": 1.546875, "learning_rate": 2.3948678369977577e-05, "loss": 1.0509469985961915, "num_input_tokens_seen": 9552575936, "step": 33590, "train_runtime": 327214.1763, "train_tokens_per_second": 29193.649 }, { "epoch": 1.1888338747520493, "grad_norm": 1.5078125, "learning_rate": 2.3945931741412362e-05, "loss": 1.0630071640014649, "num_input_tokens_seen": 9555412928, "step": 33600, "train_runtime": 327312.2521, "train_tokens_per_second": 29193.569 }, { "epoch": 1.1891876950157783, "grad_norm": 1.578125, "learning_rate": 2.394318605764731e-05, "loss": 1.0547370910644531, "num_input_tokens_seen": 9558267328, "step": 33610, "train_runtime": 327410.8004, "train_tokens_per_second": 29193.5 }, { "epoch": 1.189541515279507, "grad_norm": 1.53125, "learning_rate": 2.3940441318140893e-05, "loss": 1.0457229614257812, "num_input_tokens_seen": 9561136192, "step": 33620, "train_runtime": 327510.9084, "train_tokens_per_second": 29193.337 }, { "epoch": 1.1898953355432358, "grad_norm": 1.515625, "learning_rate": 2.3937697522352013e-05, "loss": 1.0475440979003907, "num_input_tokens_seen": 9564021504, "step": 33630, "train_runtime": 327612.2147, "train_tokens_per_second": 29193.116 }, { "epoch": 1.1902491558069646, "grad_norm": 1.5234375, "learning_rate": 2.3934954669739984e-05, "loss": 1.0458075523376464, "num_input_tokens_seen": 9566898944, "step": 33640, "train_runtime": 327712.4137, "train_tokens_per_second": 29192.971 }, { "epoch": 1.1906029760706933, "grad_norm": 1.5390625, "learning_rate": 2.3932212759764587e-05, "loss": 1.0440912246704102, "num_input_tokens_seen": 9569715968, "step": 33650, "train_runtime": 327807.2247, "train_tokens_per_second": 29193.121 }, { "epoch": 1.190956796334422, "grad_norm": 1.5390625, "learning_rate": 2.3929471791886006e-05, "loss": 1.043346118927002, "num_input_tokens_seen": 9572561984, "step": 33660, "train_runtime": 327905.26, "train_tokens_per_second": 29193.072 }, { "epoch": 1.1913106165981509, "grad_norm": 1.5390625, "learning_rate": 2.3926731765564872e-05, "loss": 1.0547977447509767, "num_input_tokens_seen": 9575418432, "step": 33670, "train_runtime": 328004.6034, "train_tokens_per_second": 29192.939 }, { "epoch": 1.1916644368618796, "grad_norm": 1.4609375, "learning_rate": 2.3923992680262258e-05, "loss": 1.064218521118164, "num_input_tokens_seen": 9578277056, "step": 33680, "train_runtime": 328103.3864, "train_tokens_per_second": 29192.863 }, { "epoch": 1.1920182571256084, "grad_norm": 1.546875, "learning_rate": 2.3921254535439645e-05, "loss": 1.0444768905639648, "num_input_tokens_seen": 9581097408, "step": 33690, "train_runtime": 328197.9103, "train_tokens_per_second": 29193.048 }, { "epoch": 1.1923720773893371, "grad_norm": 1.5, "learning_rate": 2.391851733055896e-05, "loss": 1.0381498336791992, "num_input_tokens_seen": 9583940608, "step": 33700, "train_runtime": 328296.3157, "train_tokens_per_second": 29192.958 }, { "epoch": 1.192725897653066, "grad_norm": 1.59375, "learning_rate": 2.3915781065082566e-05, "loss": 1.036000633239746, "num_input_tokens_seen": 9586741440, "step": 33710, "train_runtime": 328389.3966, "train_tokens_per_second": 29193.213 }, { "epoch": 1.1930797179167947, "grad_norm": 1.515625, "learning_rate": 2.391304573847324e-05, "loss": 1.0411787033081055, "num_input_tokens_seen": 9589594176, "step": 33720, "train_runtime": 328487.2119, "train_tokens_per_second": 29193.204 }, { "epoch": 1.1934335381805234, "grad_norm": 1.484375, "learning_rate": 2.3910311350194205e-05, "loss": 1.0503351211547851, "num_input_tokens_seen": 9592433600, "step": 33730, "train_runtime": 328585.6562, "train_tokens_per_second": 29193.099 }, { "epoch": 1.1937873584442522, "grad_norm": 1.5234375, "learning_rate": 2.39075778997091e-05, "loss": 1.046432876586914, "num_input_tokens_seen": 9595292032, "step": 33740, "train_runtime": 328682.0973, "train_tokens_per_second": 29193.23 }, { "epoch": 1.194141178707981, "grad_norm": 1.5546875, "learning_rate": 2.390484538648201e-05, "loss": 1.0224493026733399, "num_input_tokens_seen": 9598131072, "step": 33750, "train_runtime": 328779.624, "train_tokens_per_second": 29193.205 }, { "epoch": 1.19449499897171, "grad_norm": 1.5, "learning_rate": 2.3902113809977433e-05, "loss": 1.0521577835083007, "num_input_tokens_seen": 9601000896, "step": 33760, "train_runtime": 328879.157, "train_tokens_per_second": 29193.096 }, { "epoch": 1.1948488192354387, "grad_norm": 1.59375, "learning_rate": 2.3899383169660297e-05, "loss": 1.0468816757202148, "num_input_tokens_seen": 9603877632, "step": 33770, "train_runtime": 328977.2869, "train_tokens_per_second": 29193.133 }, { "epoch": 1.1952026394991675, "grad_norm": 1.515625, "learning_rate": 2.3896653464995968e-05, "loss": 1.0482233047485352, "num_input_tokens_seen": 9606686784, "step": 33780, "train_runtime": 329069.321, "train_tokens_per_second": 29193.505 }, { "epoch": 1.1955564597628963, "grad_norm": 1.5546875, "learning_rate": 2.3893924695450232e-05, "loss": 1.0563304901123047, "num_input_tokens_seen": 9609472128, "step": 33790, "train_runtime": 329164.4276, "train_tokens_per_second": 29193.532 }, { "epoch": 1.195910280026625, "grad_norm": 1.5234375, "learning_rate": 2.3891196860489297e-05, "loss": 1.0408262252807616, "num_input_tokens_seen": 9612316480, "step": 33800, "train_runtime": 329259.2368, "train_tokens_per_second": 29193.764 }, { "epoch": 1.1962641002903538, "grad_norm": 1.6640625, "learning_rate": 2.3888469959579813e-05, "loss": 1.0598806381225585, "num_input_tokens_seen": 9615149248, "step": 33810, "train_runtime": 329355.2162, "train_tokens_per_second": 29193.857 }, { "epoch": 1.1966179205540826, "grad_norm": 1.5546875, "learning_rate": 2.388574399218883e-05, "loss": 1.058354377746582, "num_input_tokens_seen": 9618028096, "step": 33820, "train_runtime": 329453.7767, "train_tokens_per_second": 29193.862 }, { "epoch": 1.1969717408178113, "grad_norm": 1.546875, "learning_rate": 2.3883018957783854e-05, "loss": 1.040217399597168, "num_input_tokens_seen": 9620882880, "step": 33830, "train_runtime": 329553.3623, "train_tokens_per_second": 29193.703 }, { "epoch": 1.19732556108154, "grad_norm": 1.6875, "learning_rate": 2.3880294855832802e-05, "loss": 1.0426069259643556, "num_input_tokens_seen": 9623748352, "step": 33840, "train_runtime": 329652.7941, "train_tokens_per_second": 29193.59 }, { "epoch": 1.1976793813452689, "grad_norm": 1.5625, "learning_rate": 2.387757168580401e-05, "loss": 1.0550308227539062, "num_input_tokens_seen": 9626657536, "step": 33850, "train_runtime": 329755.987, "train_tokens_per_second": 29193.276 }, { "epoch": 1.1980332016089976, "grad_norm": 1.546875, "learning_rate": 2.387484944716625e-05, "loss": 1.043130874633789, "num_input_tokens_seen": 9629524736, "step": 33860, "train_runtime": 329853.5976, "train_tokens_per_second": 29193.329 }, { "epoch": 1.1983870218727264, "grad_norm": 1.546875, "learning_rate": 2.387212813938871e-05, "loss": 1.0468429565429687, "num_input_tokens_seen": 9632425664, "step": 33870, "train_runtime": 329953.3697, "train_tokens_per_second": 29193.294 }, { "epoch": 1.1987408421364552, "grad_norm": 1.4921875, "learning_rate": 2.3869407761940998e-05, "loss": 1.053243637084961, "num_input_tokens_seen": 9635266304, "step": 33880, "train_runtime": 330049.0357, "train_tokens_per_second": 29193.439 }, { "epoch": 1.199094662400184, "grad_norm": 1.546875, "learning_rate": 2.3866688314293158e-05, "loss": 1.0454025268554688, "num_input_tokens_seen": 9638069824, "step": 33890, "train_runtime": 330142.561, "train_tokens_per_second": 29193.66 }, { "epoch": 1.1994484826639127, "grad_norm": 1.5390625, "learning_rate": 2.3863969795915643e-05, "loss": 1.035744857788086, "num_input_tokens_seen": 9640934016, "step": 33900, "train_runtime": 330241.7728, "train_tokens_per_second": 29193.563 }, { "epoch": 1.1998023029276415, "grad_norm": 1.4921875, "learning_rate": 2.3861252206279336e-05, "loss": 1.0417303085327148, "num_input_tokens_seen": 9643792320, "step": 33910, "train_runtime": 330339.474, "train_tokens_per_second": 29193.581 }, { "epoch": 1.2001561231913702, "grad_norm": 1.5546875, "learning_rate": 2.3858535544855544e-05, "loss": 1.0378734588623046, "num_input_tokens_seen": 9646623424, "step": 33920, "train_runtime": 330436.9759, "train_tokens_per_second": 29193.535 }, { "epoch": 1.2005099434550992, "grad_norm": 1.5390625, "learning_rate": 2.3855819811115987e-05, "loss": 1.0467106819152832, "num_input_tokens_seen": 9649468544, "step": 33930, "train_runtime": 330531.9018, "train_tokens_per_second": 29193.759 }, { "epoch": 1.200863763718828, "grad_norm": 1.546875, "learning_rate": 2.385310500453281e-05, "loss": 1.060910129547119, "num_input_tokens_seen": 9652265792, "step": 33940, "train_runtime": 330629.3641, "train_tokens_per_second": 29193.613 }, { "epoch": 1.2012175839825567, "grad_norm": 1.4609375, "learning_rate": 2.3850391124578573e-05, "loss": 1.044386100769043, "num_input_tokens_seen": 9655174464, "step": 33950, "train_runtime": 330728.319, "train_tokens_per_second": 29193.673 }, { "epoch": 1.2015714042462855, "grad_norm": 1.5625, "learning_rate": 2.3847678170726275e-05, "loss": 1.0542067527770995, "num_input_tokens_seen": 9658019648, "step": 33960, "train_runtime": 330824.7249, "train_tokens_per_second": 29193.766 }, { "epoch": 1.2019252245100143, "grad_norm": 1.46875, "learning_rate": 2.3844966142449312e-05, "loss": 1.0422491073608398, "num_input_tokens_seen": 9660785984, "step": 33970, "train_runtime": 330917.4801, "train_tokens_per_second": 29193.943 }, { "epoch": 1.202279044773743, "grad_norm": 1.5, "learning_rate": 2.384225503922151e-05, "loss": 1.0566981315612793, "num_input_tokens_seen": 9663646464, "step": 33980, "train_runtime": 331015.419, "train_tokens_per_second": 29193.947 }, { "epoch": 1.2026328650374718, "grad_norm": 1.546875, "learning_rate": 2.3839544860517103e-05, "loss": 1.0488442420959472, "num_input_tokens_seen": 9666481280, "step": 33990, "train_runtime": 331112.3314, "train_tokens_per_second": 29193.963 }, { "epoch": 1.2029866853012006, "grad_norm": 1.578125, "learning_rate": 2.3836835605810765e-05, "loss": 1.0545729637145995, "num_input_tokens_seen": 9669289216, "step": 34000, "train_runtime": 331208.864, "train_tokens_per_second": 29193.932 }, { "epoch": 1.2033405055649293, "grad_norm": 1.4765625, "learning_rate": 2.3834127274577564e-05, "loss": 1.0484482765197753, "num_input_tokens_seen": 9672089728, "step": 34010, "train_runtime": 331302.0211, "train_tokens_per_second": 29194.177 }, { "epoch": 1.203694325828658, "grad_norm": 1.453125, "learning_rate": 2.3831419866293005e-05, "loss": 1.0506410598754883, "num_input_tokens_seen": 9674950272, "step": 34020, "train_runtime": 331399.6784, "train_tokens_per_second": 29194.205 }, { "epoch": 1.2040481460923869, "grad_norm": 1.609375, "learning_rate": 2.3828713380432997e-05, "loss": 1.046139907836914, "num_input_tokens_seen": 9677808448, "step": 34030, "train_runtime": 331498.9901, "train_tokens_per_second": 29194.081 }, { "epoch": 1.2044019663561156, "grad_norm": 1.5703125, "learning_rate": 2.3826007816473866e-05, "loss": 1.0537068367004394, "num_input_tokens_seen": 9680670464, "step": 34040, "train_runtime": 331599.0792, "train_tokens_per_second": 29193.9 }, { "epoch": 1.2047557866198444, "grad_norm": 1.6015625, "learning_rate": 2.3823303173892365e-05, "loss": 1.0411800384521483, "num_input_tokens_seen": 9683566656, "step": 34050, "train_runtime": 331699.4626, "train_tokens_per_second": 29193.797 }, { "epoch": 1.2051096068835732, "grad_norm": 1.5546875, "learning_rate": 2.382059945216565e-05, "loss": 1.04378662109375, "num_input_tokens_seen": 9686376832, "step": 34060, "train_runtime": 331795.0556, "train_tokens_per_second": 29193.855 }, { "epoch": 1.205463427147302, "grad_norm": 1.5546875, "learning_rate": 2.3817896650771297e-05, "loss": 1.050713348388672, "num_input_tokens_seen": 9689171392, "step": 34070, "train_runtime": 331889.7397, "train_tokens_per_second": 29193.947 }, { "epoch": 1.205817247411031, "grad_norm": 1.5625, "learning_rate": 2.38151947691873e-05, "loss": 1.0462234497070313, "num_input_tokens_seen": 9692054784, "step": 34080, "train_runtime": 331987.3721, "train_tokens_per_second": 29194.047 }, { "epoch": 1.2061710676747595, "grad_norm": 1.5703125, "learning_rate": 2.3812493806892066e-05, "loss": 1.0486331939697267, "num_input_tokens_seen": 9694916736, "step": 34090, "train_runtime": 332085.5828, "train_tokens_per_second": 29194.031 }, { "epoch": 1.2065248879384884, "grad_norm": 1.5625, "learning_rate": 2.3809793763364406e-05, "loss": 1.0600369453430176, "num_input_tokens_seen": 9697683648, "step": 34100, "train_runtime": 332176.848, "train_tokens_per_second": 29194.339 }, { "epoch": 1.2068787082022172, "grad_norm": 1.46875, "learning_rate": 2.3807094638083575e-05, "loss": 1.037211799621582, "num_input_tokens_seen": 9700529856, "step": 34110, "train_runtime": 332276.0993, "train_tokens_per_second": 29194.185 }, { "epoch": 1.207232528465946, "grad_norm": 1.6484375, "learning_rate": 2.3804396430529196e-05, "loss": 1.0461621284484863, "num_input_tokens_seen": 9703314112, "step": 34120, "train_runtime": 332366.0512, "train_tokens_per_second": 29194.661 }, { "epoch": 1.2075863487296747, "grad_norm": 1.5390625, "learning_rate": 2.380169914018134e-05, "loss": 1.0311933517456056, "num_input_tokens_seen": 9706138560, "step": 34130, "train_runtime": 332461.4211, "train_tokens_per_second": 29194.782 }, { "epoch": 1.2079401689934035, "grad_norm": 1.5546875, "learning_rate": 2.3799002766520473e-05, "loss": 1.060780906677246, "num_input_tokens_seen": 9708987008, "step": 34140, "train_runtime": 332557.2372, "train_tokens_per_second": 29194.935 }, { "epoch": 1.2082939892571323, "grad_norm": 1.484375, "learning_rate": 2.379630730902749e-05, "loss": 1.0365987777709962, "num_input_tokens_seen": 9711806784, "step": 34150, "train_runtime": 332655.1865, "train_tokens_per_second": 29194.815 }, { "epoch": 1.208647809520861, "grad_norm": 1.5, "learning_rate": 2.3793612767183668e-05, "loss": 1.0393068313598632, "num_input_tokens_seen": 9714642624, "step": 34160, "train_runtime": 332750.8299, "train_tokens_per_second": 29194.946 }, { "epoch": 1.2090016297845898, "grad_norm": 1.5078125, "learning_rate": 2.3790919140470726e-05, "loss": 1.0314400672912598, "num_input_tokens_seen": 9717448704, "step": 34170, "train_runtime": 332844.9093, "train_tokens_per_second": 29195.125 }, { "epoch": 1.2093554500483186, "grad_norm": 1.53125, "learning_rate": 2.3788226428370774e-05, "loss": 1.0527836799621582, "num_input_tokens_seen": 9720349056, "step": 34180, "train_runtime": 332945.3032, "train_tokens_per_second": 29195.033 }, { "epoch": 1.2097092703120473, "grad_norm": 1.5234375, "learning_rate": 2.3785534630366355e-05, "loss": 1.0481876373291015, "num_input_tokens_seen": 9723184512, "step": 34190, "train_runtime": 333040.602, "train_tokens_per_second": 29195.193 }, { "epoch": 1.210063090575776, "grad_norm": 1.5, "learning_rate": 2.378284374594038e-05, "loss": 1.0418161392211913, "num_input_tokens_seen": 9726001856, "step": 34200, "train_runtime": 333135.529, "train_tokens_per_second": 29195.33 }, { "epoch": 1.2104169108395049, "grad_norm": 1.515625, "learning_rate": 2.3780153774576215e-05, "loss": 1.0523595809936523, "num_input_tokens_seen": 9728830720, "step": 34210, "train_runtime": 333228.02, "train_tokens_per_second": 29195.716 }, { "epoch": 1.2107707311032336, "grad_norm": 1.515625, "learning_rate": 2.3777464715757608e-05, "loss": 1.055731201171875, "num_input_tokens_seen": 9731613632, "step": 34220, "train_runtime": 333322.0123, "train_tokens_per_second": 29195.832 }, { "epoch": 1.2111245513669624, "grad_norm": 1.5546875, "learning_rate": 2.3774776568968716e-05, "loss": 1.0354131698608398, "num_input_tokens_seen": 9734413504, "step": 34230, "train_runtime": 333417.2383, "train_tokens_per_second": 29195.891 }, { "epoch": 1.2114783716306912, "grad_norm": 1.4921875, "learning_rate": 2.377208933369413e-05, "loss": 1.0449087142944335, "num_input_tokens_seen": 9737197568, "step": 34240, "train_runtime": 333511.4503, "train_tokens_per_second": 29195.992 }, { "epoch": 1.2118321918944202, "grad_norm": 1.5234375, "learning_rate": 2.3769403009418808e-05, "loss": 1.0436315536499023, "num_input_tokens_seen": 9740070400, "step": 34250, "train_runtime": 333611.026, "train_tokens_per_second": 29195.889 }, { "epoch": 1.2121860121581487, "grad_norm": 1.6015625, "learning_rate": 2.3766717595628145e-05, "loss": 1.0474668502807618, "num_input_tokens_seen": 9742856832, "step": 34260, "train_runtime": 333706.7563, "train_tokens_per_second": 29195.863 }, { "epoch": 1.2125398324218777, "grad_norm": 1.5859375, "learning_rate": 2.376403309180794e-05, "loss": 1.0425712585449218, "num_input_tokens_seen": 9745677376, "step": 34270, "train_runtime": 333801.7284, "train_tokens_per_second": 29196.006 }, { "epoch": 1.2128936526856064, "grad_norm": 1.5, "learning_rate": 2.3761349497444387e-05, "loss": 1.0322124481201171, "num_input_tokens_seen": 9748482816, "step": 34280, "train_runtime": 333896.7713, "train_tokens_per_second": 29196.098 }, { "epoch": 1.2132474729493352, "grad_norm": 1.5234375, "learning_rate": 2.3758666812024093e-05, "loss": 1.0425240516662597, "num_input_tokens_seen": 9751270656, "step": 34290, "train_runtime": 333988.7433, "train_tokens_per_second": 29196.405 }, { "epoch": 1.213601293213064, "grad_norm": 1.5859375, "learning_rate": 2.3755985035034072e-05, "loss": 1.04284610748291, "num_input_tokens_seen": 9754067584, "step": 34300, "train_runtime": 334080.6888, "train_tokens_per_second": 29196.742 }, { "epoch": 1.2139551134767927, "grad_norm": 1.5703125, "learning_rate": 2.3753304165961733e-05, "loss": 1.0384990692138671, "num_input_tokens_seen": 9756888192, "step": 34310, "train_runtime": 334178.4749, "train_tokens_per_second": 29196.639 }, { "epoch": 1.2143089337405215, "grad_norm": 1.5546875, "learning_rate": 2.3750624204294913e-05, "loss": 1.0635936737060547, "num_input_tokens_seen": 9759714240, "step": 34320, "train_runtime": 334276.0436, "train_tokens_per_second": 29196.571 }, { "epoch": 1.2146627540042503, "grad_norm": 1.515625, "learning_rate": 2.3747945149521823e-05, "loss": 1.0456748962402345, "num_input_tokens_seen": 9762568192, "step": 34330, "train_runtime": 334372.9975, "train_tokens_per_second": 29196.64 }, { "epoch": 1.215016574267979, "grad_norm": 1.5703125, "learning_rate": 2.374526700113111e-05, "loss": 1.0479136466979981, "num_input_tokens_seen": 9765409216, "step": 34340, "train_runtime": 334470.4833, "train_tokens_per_second": 29196.625 }, { "epoch": 1.2153703945317078, "grad_norm": 1.484375, "learning_rate": 2.374258975861179e-05, "loss": 1.0496002197265626, "num_input_tokens_seen": 9768232192, "step": 34350, "train_runtime": 334563.6324, "train_tokens_per_second": 29196.934 }, { "epoch": 1.2157242147954366, "grad_norm": 1.484375, "learning_rate": 2.3739913421453303e-05, "loss": 1.050473117828369, "num_input_tokens_seen": 9771099072, "step": 34360, "train_runtime": 334660.7355, "train_tokens_per_second": 29197.029 }, { "epoch": 1.2160780350591653, "grad_norm": 1.515625, "learning_rate": 2.37372379891455e-05, "loss": 1.0564163208007813, "num_input_tokens_seen": 9773976512, "step": 34370, "train_runtime": 334763.2741, "train_tokens_per_second": 29196.681 }, { "epoch": 1.216431855322894, "grad_norm": 1.546875, "learning_rate": 2.3734563461178615e-05, "loss": 1.0495073318481445, "num_input_tokens_seen": 9776848576, "step": 34380, "train_runtime": 334866.4662, "train_tokens_per_second": 29196.26 }, { "epoch": 1.2167856755866229, "grad_norm": 1.5234375, "learning_rate": 2.3731889837043294e-05, "loss": 1.0609786987304688, "num_input_tokens_seen": 9779679808, "step": 34390, "train_runtime": 334964.1719, "train_tokens_per_second": 29196.197 }, { "epoch": 1.2171394958503516, "grad_norm": 1.609375, "learning_rate": 2.3729217116230586e-05, "loss": 1.0397884368896484, "num_input_tokens_seen": 9782507968, "step": 34400, "train_runtime": 335059.0737, "train_tokens_per_second": 29196.368 }, { "epoch": 1.2174933161140804, "grad_norm": 1.5390625, "learning_rate": 2.3726545298231932e-05, "loss": 1.0494367599487304, "num_input_tokens_seen": 9785377728, "step": 34410, "train_runtime": 335159.231, "train_tokens_per_second": 29196.205 }, { "epoch": 1.2178471363778094, "grad_norm": 1.4609375, "learning_rate": 2.3723874382539182e-05, "loss": 1.0413763046264648, "num_input_tokens_seen": 9788234496, "step": 34420, "train_runtime": 335255.7368, "train_tokens_per_second": 29196.322 }, { "epoch": 1.218200956641538, "grad_norm": 1.5625, "learning_rate": 2.3721204368644585e-05, "loss": 1.0489760398864747, "num_input_tokens_seen": 9791061312, "step": 34430, "train_runtime": 335353.8568, "train_tokens_per_second": 29196.209 }, { "epoch": 1.218554776905267, "grad_norm": 1.5234375, "learning_rate": 2.371853525604079e-05, "loss": 1.0461412429809571, "num_input_tokens_seen": 9793960000, "step": 34440, "train_runtime": 335455.0368, "train_tokens_per_second": 29196.044 }, { "epoch": 1.2189085971689957, "grad_norm": 1.5, "learning_rate": 2.371586704422084e-05, "loss": 1.0428497314453125, "num_input_tokens_seen": 9796792448, "step": 34450, "train_runtime": 335553.8787, "train_tokens_per_second": 29195.885 }, { "epoch": 1.2192624174327245, "grad_norm": 1.5703125, "learning_rate": 2.3713199732678183e-05, "loss": 1.0350074768066406, "num_input_tokens_seen": 9799579008, "step": 34460, "train_runtime": 335647.6225, "train_tokens_per_second": 29196.033 }, { "epoch": 1.2196162376964532, "grad_norm": 1.515625, "learning_rate": 2.371053332090666e-05, "loss": 1.0548994064331054, "num_input_tokens_seen": 9802470912, "step": 34470, "train_runtime": 335747.8525, "train_tokens_per_second": 29195.93 }, { "epoch": 1.219970057960182, "grad_norm": 1.5234375, "learning_rate": 2.3707867808400527e-05, "loss": 1.049970817565918, "num_input_tokens_seen": 9805286080, "step": 34480, "train_runtime": 335842.2428, "train_tokens_per_second": 29196.107 }, { "epoch": 1.2203238782239108, "grad_norm": 1.5859375, "learning_rate": 2.370520319465442e-05, "loss": 1.0524154663085938, "num_input_tokens_seen": 9808145920, "step": 34490, "train_runtime": 335940.4863, "train_tokens_per_second": 29196.082 }, { "epoch": 1.2206776984876395, "grad_norm": 1.515625, "learning_rate": 2.370253947916337e-05, "loss": 1.0469653129577636, "num_input_tokens_seen": 9810961536, "step": 34500, "train_runtime": 336040.5577, "train_tokens_per_second": 29195.766 }, { "epoch": 1.2210315187513683, "grad_norm": 1.453125, "learning_rate": 2.369987666142282e-05, "loss": 1.041243553161621, "num_input_tokens_seen": 9813835456, "step": 34510, "train_runtime": 336139.8792, "train_tokens_per_second": 29195.689 }, { "epoch": 1.221385339015097, "grad_norm": 1.5859375, "learning_rate": 2.36972147409286e-05, "loss": 1.0468326568603517, "num_input_tokens_seen": 9816663680, "step": 34520, "train_runtime": 336235.8066, "train_tokens_per_second": 29195.771 }, { "epoch": 1.2217391592788258, "grad_norm": 1.546875, "learning_rate": 2.3694553717176945e-05, "loss": 1.0382003784179688, "num_input_tokens_seen": 9819550080, "step": 34530, "train_runtime": 336337.7512, "train_tokens_per_second": 29195.504 }, { "epoch": 1.2220929795425546, "grad_norm": 1.5, "learning_rate": 2.369189358966447e-05, "loss": 1.0429319381713866, "num_input_tokens_seen": 9822366336, "step": 34540, "train_runtime": 336433.0374, "train_tokens_per_second": 29195.606 }, { "epoch": 1.2224467998062833, "grad_norm": 1.5, "learning_rate": 2.3689234357888205e-05, "loss": 1.061648178100586, "num_input_tokens_seen": 9825223488, "step": 34550, "train_runtime": 336530.9466, "train_tokens_per_second": 29195.602 }, { "epoch": 1.2228006200700121, "grad_norm": 1.5390625, "learning_rate": 2.368657602134556e-05, "loss": 1.0461462020874024, "num_input_tokens_seen": 9828064064, "step": 34560, "train_runtime": 336625.9852, "train_tokens_per_second": 29195.797 }, { "epoch": 1.2231544403337409, "grad_norm": 1.515625, "learning_rate": 2.3683918579534347e-05, "loss": 1.0494418144226074, "num_input_tokens_seen": 9830890048, "step": 34570, "train_runtime": 336723.6422, "train_tokens_per_second": 29195.723 }, { "epoch": 1.2235082605974696, "grad_norm": 1.515625, "learning_rate": 2.368126203195277e-05, "loss": 1.0356925964355468, "num_input_tokens_seen": 9833731520, "step": 34580, "train_runtime": 336821.0276, "train_tokens_per_second": 29195.717 }, { "epoch": 1.2238620808611986, "grad_norm": 1.4765625, "learning_rate": 2.3678606378099428e-05, "loss": 1.0287874221801758, "num_input_tokens_seen": 9836584960, "step": 34590, "train_runtime": 336921.9186, "train_tokens_per_second": 29195.444 }, { "epoch": 1.2242159011249274, "grad_norm": 1.53125, "learning_rate": 2.3675951617473315e-05, "loss": 1.051163387298584, "num_input_tokens_seen": 9839436032, "step": 34600, "train_runtime": 337019.341, "train_tokens_per_second": 29195.464 }, { "epoch": 1.2245697213886562, "grad_norm": 1.4921875, "learning_rate": 2.3673297749573805e-05, "loss": 1.038036823272705, "num_input_tokens_seen": 9842257152, "step": 34610, "train_runtime": 337114.8367, "train_tokens_per_second": 29195.562 }, { "epoch": 1.224923541652385, "grad_norm": 1.5078125, "learning_rate": 2.3670644773900692e-05, "loss": 1.048990821838379, "num_input_tokens_seen": 9845072128, "step": 34620, "train_runtime": 337210.96, "train_tokens_per_second": 29195.588 }, { "epoch": 1.2252773619161137, "grad_norm": 1.59375, "learning_rate": 2.3667992689954135e-05, "loss": 1.0513466835021972, "num_input_tokens_seen": 9847911808, "step": 34630, "train_runtime": 337307.029, "train_tokens_per_second": 29195.691 }, { "epoch": 1.2256311821798425, "grad_norm": 1.53125, "learning_rate": 2.3665341497234704e-05, "loss": 1.0437068939208984, "num_input_tokens_seen": 9850730624, "step": 34640, "train_runtime": 337404.3879, "train_tokens_per_second": 29195.621 }, { "epoch": 1.2259850024435712, "grad_norm": 1.53125, "learning_rate": 2.3662691195243346e-05, "loss": 1.04404296875, "num_input_tokens_seen": 9853537408, "step": 34650, "train_runtime": 337498.7256, "train_tokens_per_second": 29195.777 }, { "epoch": 1.2263388227073, "grad_norm": 1.515625, "learning_rate": 2.3660041783481403e-05, "loss": 1.0487115859985352, "num_input_tokens_seen": 9856290560, "step": 34660, "train_runtime": 337588.2097, "train_tokens_per_second": 29196.193 }, { "epoch": 1.2266926429710288, "grad_norm": 1.484375, "learning_rate": 2.365739326145062e-05, "loss": 1.041053009033203, "num_input_tokens_seen": 9859116416, "step": 34670, "train_runtime": 337685.1457, "train_tokens_per_second": 29196.18 }, { "epoch": 1.2270464632347575, "grad_norm": 1.6171875, "learning_rate": 2.3654745628653117e-05, "loss": 1.0450716018676758, "num_input_tokens_seen": 9861939776, "step": 34680, "train_runtime": 337782.3199, "train_tokens_per_second": 29196.14 }, { "epoch": 1.2274002834984863, "grad_norm": 1.4765625, "learning_rate": 2.3652098884591413e-05, "loss": 1.0455732345581055, "num_input_tokens_seen": 9864776704, "step": 34690, "train_runtime": 337879.0092, "train_tokens_per_second": 29196.181 }, { "epoch": 1.227754103762215, "grad_norm": 1.546875, "learning_rate": 2.3649453028768406e-05, "loss": 1.0550278663635253, "num_input_tokens_seen": 9867605056, "step": 34700, "train_runtime": 337973.0465, "train_tokens_per_second": 29196.426 }, { "epoch": 1.2281079240259438, "grad_norm": 1.53125, "learning_rate": 2.3646808060687397e-05, "loss": 1.0549308776855468, "num_input_tokens_seen": 9870411776, "step": 34710, "train_runtime": 338066.6367, "train_tokens_per_second": 29196.646 }, { "epoch": 1.2284617442896726, "grad_norm": 1.5625, "learning_rate": 2.364416397985207e-05, "loss": 1.0530141830444335, "num_input_tokens_seen": 9873246208, "step": 34720, "train_runtime": 338162.2504, "train_tokens_per_second": 29196.772 }, { "epoch": 1.2288155645534014, "grad_norm": 1.53125, "learning_rate": 2.3641520785766487e-05, "loss": 1.0283068656921386, "num_input_tokens_seen": 9876161920, "step": 34730, "train_runtime": 338265.1522, "train_tokens_per_second": 29196.51 }, { "epoch": 1.2291693848171301, "grad_norm": 1.5078125, "learning_rate": 2.363887847793512e-05, "loss": 1.052764892578125, "num_input_tokens_seen": 9878980416, "step": 34740, "train_runtime": 338361.4464, "train_tokens_per_second": 29196.531 }, { "epoch": 1.2295232050808589, "grad_norm": 1.5234375, "learning_rate": 2.363623705586281e-05, "loss": 1.0538837432861328, "num_input_tokens_seen": 9881828992, "step": 34750, "train_runtime": 338460.6894, "train_tokens_per_second": 29196.386 }, { "epoch": 1.2298770253445879, "grad_norm": 1.546875, "learning_rate": 2.363359651905479e-05, "loss": 1.0590595245361327, "num_input_tokens_seen": 9884673792, "step": 34760, "train_runtime": 338557.5671, "train_tokens_per_second": 29196.434 }, { "epoch": 1.2302308456083166, "grad_norm": 1.546875, "learning_rate": 2.3630956867016688e-05, "loss": 1.0451095581054688, "num_input_tokens_seen": 9887490688, "step": 34770, "train_runtime": 338652.4789, "train_tokens_per_second": 29196.57 }, { "epoch": 1.2305846658720454, "grad_norm": 1.546875, "learning_rate": 2.3628318099254506e-05, "loss": 1.0444417953491212, "num_input_tokens_seen": 9890319040, "step": 34780, "train_runtime": 338747.0135, "train_tokens_per_second": 29196.771 }, { "epoch": 1.2309384861357742, "grad_norm": 1.46875, "learning_rate": 2.3625680215274635e-05, "loss": 1.0326299667358398, "num_input_tokens_seen": 9893143104, "step": 34790, "train_runtime": 338845.4517, "train_tokens_per_second": 29196.624 }, { "epoch": 1.231292306399503, "grad_norm": 1.5625, "learning_rate": 2.362304321458386e-05, "loss": 1.0454606056213378, "num_input_tokens_seen": 9896034752, "step": 34800, "train_runtime": 338947.182, "train_tokens_per_second": 29196.392 }, { "epoch": 1.2316461266632317, "grad_norm": 1.578125, "learning_rate": 2.362040709668934e-05, "loss": 1.054949951171875, "num_input_tokens_seen": 9898863040, "step": 34810, "train_runtime": 339044.6517, "train_tokens_per_second": 29196.34 }, { "epoch": 1.2319999469269605, "grad_norm": 1.5546875, "learning_rate": 2.361777186109863e-05, "loss": 1.0335612297058105, "num_input_tokens_seen": 9901685696, "step": 34820, "train_runtime": 339138.9828, "train_tokens_per_second": 29196.542 }, { "epoch": 1.2323537671906892, "grad_norm": 1.5546875, "learning_rate": 2.3615137507319672e-05, "loss": 1.044585609436035, "num_input_tokens_seen": 9904598208, "step": 34830, "train_runtime": 339240.9308, "train_tokens_per_second": 29196.354 }, { "epoch": 1.232707587454418, "grad_norm": 1.5546875, "learning_rate": 2.361250403486076e-05, "loss": 1.04913272857666, "num_input_tokens_seen": 9907452864, "step": 34840, "train_runtime": 339338.5954, "train_tokens_per_second": 29196.363 }, { "epoch": 1.2330614077181468, "grad_norm": 1.5625, "learning_rate": 2.360987144323062e-05, "loss": 1.0436088562011718, "num_input_tokens_seen": 9910414720, "step": 34850, "train_runtime": 339441.2594, "train_tokens_per_second": 29196.258 }, { "epoch": 1.2334152279818755, "grad_norm": 1.578125, "learning_rate": 2.3607239731938324e-05, "loss": 1.0461825370788573, "num_input_tokens_seen": 9913257856, "step": 34860, "train_runtime": 339539.4414, "train_tokens_per_second": 29196.189 }, { "epoch": 1.2337690482456043, "grad_norm": 1.609375, "learning_rate": 2.3604608900493343e-05, "loss": 1.0470144271850585, "num_input_tokens_seen": 9916116224, "step": 34870, "train_runtime": 339638.044, "train_tokens_per_second": 29196.129 }, { "epoch": 1.234122868509333, "grad_norm": 1.46875, "learning_rate": 2.360197894840553e-05, "loss": 1.0448129653930665, "num_input_tokens_seen": 9918965312, "step": 34880, "train_runtime": 339735.0607, "train_tokens_per_second": 29196.178 }, { "epoch": 1.2344766887730618, "grad_norm": 1.5625, "learning_rate": 2.3599349875185117e-05, "loss": 1.0460649490356446, "num_input_tokens_seen": 9921834944, "step": 34890, "train_runtime": 339833.411, "train_tokens_per_second": 29196.173 }, { "epoch": 1.2348305090367906, "grad_norm": 1.53125, "learning_rate": 2.359672168034272e-05, "loss": 1.0505395889282227, "num_input_tokens_seen": 9924674240, "step": 34900, "train_runtime": 339932.6594, "train_tokens_per_second": 29196.001 }, { "epoch": 1.2351843293005194, "grad_norm": 1.4765625, "learning_rate": 2.3594094363389327e-05, "loss": 1.0440752029418945, "num_input_tokens_seen": 9927486080, "step": 34910, "train_runtime": 340026.9274, "train_tokens_per_second": 29196.176 }, { "epoch": 1.2355381495642481, "grad_norm": 1.6171875, "learning_rate": 2.3591467923836324e-05, "loss": 1.0381940841674804, "num_input_tokens_seen": 9930325312, "step": 34920, "train_runtime": 340127.4052, "train_tokens_per_second": 29195.899 }, { "epoch": 1.235891969827977, "grad_norm": 1.484375, "learning_rate": 2.3588842361195467e-05, "loss": 1.0517271041870118, "num_input_tokens_seen": 9933175360, "step": 34930, "train_runtime": 340224.5636, "train_tokens_per_second": 29195.938 }, { "epoch": 1.2362457900917059, "grad_norm": 1.4609375, "learning_rate": 2.3586217674978893e-05, "loss": 1.0489501953125, "num_input_tokens_seen": 9936098560, "step": 34940, "train_runtime": 340326.6596, "train_tokens_per_second": 29195.769 }, { "epoch": 1.2365996103554346, "grad_norm": 1.53125, "learning_rate": 2.358359386469912e-05, "loss": 1.0448589324951172, "num_input_tokens_seen": 9938961792, "step": 34950, "train_runtime": 340424.5394, "train_tokens_per_second": 29195.785 }, { "epoch": 1.2369534306191634, "grad_norm": 1.5234375, "learning_rate": 2.3580970929869047e-05, "loss": 1.0518791198730468, "num_input_tokens_seen": 9941761600, "step": 34960, "train_runtime": 340517.3195, "train_tokens_per_second": 29196.053 }, { "epoch": 1.2373072508828922, "grad_norm": 1.609375, "learning_rate": 2.3578348870001952e-05, "loss": 1.0555269241333007, "num_input_tokens_seen": 9944624256, "step": 34970, "train_runtime": 340616.7984, "train_tokens_per_second": 29195.93 }, { "epoch": 1.237661071146621, "grad_norm": 1.6015625, "learning_rate": 2.357572768461149e-05, "loss": 1.042059326171875, "num_input_tokens_seen": 9947495936, "step": 34980, "train_runtime": 340717.5742, "train_tokens_per_second": 29195.723 }, { "epoch": 1.2380148914103497, "grad_norm": 1.5546875, "learning_rate": 2.3573107373211687e-05, "loss": 1.0555862426757812, "num_input_tokens_seen": 9950286144, "step": 34990, "train_runtime": 340808.4745, "train_tokens_per_second": 29196.123 }, { "epoch": 1.2383687116740785, "grad_norm": 1.5, "learning_rate": 2.3570487935316964e-05, "loss": 1.050098991394043, "num_input_tokens_seen": 9953103872, "step": 35000, "train_runtime": 340906.0818, "train_tokens_per_second": 29196.029 }, { "epoch": 1.2383687116740785, "eval_loss": 1.022186517715454, "eval_runtime": 8.4373, "eval_samples_per_second": 472.662, "eval_steps_per_second": 3.793, "num_input_tokens_seen": 9953103872, "step": 35000 }, { "epoch": 1.2387225319378072, "grad_norm": 1.5390625, "learning_rate": 2.3567869370442104e-05, "loss": 1.0379037857055664, "num_input_tokens_seen": 9955961216, "step": 35010, "train_runtime": 341033.8247, "train_tokens_per_second": 29193.471 }, { "epoch": 1.239076352201536, "grad_norm": 1.5, "learning_rate": 2.356525167810228e-05, "loss": 1.0494878768920899, "num_input_tokens_seen": 9958810304, "step": 35020, "train_runtime": 341134.6746, "train_tokens_per_second": 29193.193 }, { "epoch": 1.2394301724652648, "grad_norm": 1.5546875, "learning_rate": 2.3562634857813034e-05, "loss": 1.0683238983154297, "num_input_tokens_seen": 9961596352, "step": 35030, "train_runtime": 341229.4685, "train_tokens_per_second": 29193.248 }, { "epoch": 1.2397839927289935, "grad_norm": 1.53125, "learning_rate": 2.3560018909090288e-05, "loss": 1.0537175178527831, "num_input_tokens_seen": 9964467392, "step": 35040, "train_runtime": 341328.333, "train_tokens_per_second": 29193.203 }, { "epoch": 1.2401378129927223, "grad_norm": 1.6015625, "learning_rate": 2.355740383145033e-05, "loss": 1.0476181030273437, "num_input_tokens_seen": 9967367488, "step": 35050, "train_runtime": 341429.2103, "train_tokens_per_second": 29193.072 }, { "epoch": 1.240491633256451, "grad_norm": 1.4765625, "learning_rate": 2.3554789624409836e-05, "loss": 1.063364315032959, "num_input_tokens_seen": 9970211264, "step": 35060, "train_runtime": 341525.4929, "train_tokens_per_second": 29193.169 }, { "epoch": 1.2408454535201798, "grad_norm": 1.5234375, "learning_rate": 2.355217628748586e-05, "loss": 1.0372730255126954, "num_input_tokens_seen": 9973072000, "step": 35070, "train_runtime": 341621.9655, "train_tokens_per_second": 29193.298 }, { "epoch": 1.2411992737839088, "grad_norm": 1.6484375, "learning_rate": 2.354956382019581e-05, "loss": 1.051537322998047, "num_input_tokens_seen": 9975927488, "step": 35080, "train_runtime": 341718.711, "train_tokens_per_second": 29193.39 }, { "epoch": 1.2415530940476374, "grad_norm": 1.578125, "learning_rate": 2.35469522220575e-05, "loss": 1.05850191116333, "num_input_tokens_seen": 9978769408, "step": 35090, "train_runtime": 341812.6127, "train_tokens_per_second": 29193.684 }, { "epoch": 1.2419069143113664, "grad_norm": 1.53125, "learning_rate": 2.3544341492589096e-05, "loss": 1.057568359375, "num_input_tokens_seen": 9981646080, "step": 35100, "train_runtime": 341912.2972, "train_tokens_per_second": 29193.586 }, { "epoch": 1.2422607345750951, "grad_norm": 1.5625, "learning_rate": 2.3541731631309126e-05, "loss": 1.0560384750366212, "num_input_tokens_seen": 9984491392, "step": 35110, "train_runtime": 342010.5964, "train_tokens_per_second": 29193.515 }, { "epoch": 1.2426145548388239, "grad_norm": 1.515625, "learning_rate": 2.3539122637736537e-05, "loss": 1.0476004600524902, "num_input_tokens_seen": 9987369216, "step": 35120, "train_runtime": 342108.8054, "train_tokens_per_second": 29193.546 }, { "epoch": 1.2429683751025526, "grad_norm": 1.5234375, "learning_rate": 2.35365145113906e-05, "loss": 1.0363781929016114, "num_input_tokens_seen": 9990212224, "step": 35130, "train_runtime": 342205.7277, "train_tokens_per_second": 29193.586 }, { "epoch": 1.2433221953662814, "grad_norm": 1.6171875, "learning_rate": 2.3533907251790983e-05, "loss": 1.0540312767028808, "num_input_tokens_seen": 9993065216, "step": 35140, "train_runtime": 342304.8287, "train_tokens_per_second": 29193.468 }, { "epoch": 1.2436760156300102, "grad_norm": 1.4921875, "learning_rate": 2.3531300858457727e-05, "loss": 1.0373088836669921, "num_input_tokens_seen": 9995957056, "step": 35150, "train_runtime": 342407.4004, "train_tokens_per_second": 29193.169 }, { "epoch": 1.244029835893739, "grad_norm": 1.546875, "learning_rate": 2.352869533091124e-05, "loss": 1.050804901123047, "num_input_tokens_seen": 9998854080, "step": 35160, "train_runtime": 342508.3408, "train_tokens_per_second": 29193.024 }, { "epoch": 1.2443836561574677, "grad_norm": 1.609375, "learning_rate": 2.3526090668672306e-05, "loss": 1.0617940902709961, "num_input_tokens_seen": 10001740096, "step": 35170, "train_runtime": 342609.6539, "train_tokens_per_second": 29192.815 }, { "epoch": 1.2447374764211965, "grad_norm": 1.5234375, "learning_rate": 2.3523486871262068e-05, "loss": 1.0579568862915039, "num_input_tokens_seen": 10004669440, "step": 35180, "train_runtime": 342710.4438, "train_tokens_per_second": 29192.777 }, { "epoch": 1.2450912966849252, "grad_norm": 1.578125, "learning_rate": 2.3520883938202048e-05, "loss": 1.0430191993713378, "num_input_tokens_seen": 10007498176, "step": 35190, "train_runtime": 342806.8788, "train_tokens_per_second": 29192.816 }, { "epoch": 1.245445116948654, "grad_norm": 1.6484375, "learning_rate": 2.3518281869014153e-05, "loss": 1.0434306144714356, "num_input_tokens_seen": 10010338560, "step": 35200, "train_runtime": 342902.2307, "train_tokens_per_second": 29192.982 }, { "epoch": 1.2457989372123828, "grad_norm": 1.5546875, "learning_rate": 2.3515680663220632e-05, "loss": 1.056950283050537, "num_input_tokens_seen": 10013225984, "step": 35210, "train_runtime": 343004.834, "train_tokens_per_second": 29192.667 }, { "epoch": 1.2461527574761115, "grad_norm": 1.53125, "learning_rate": 2.351308032034413e-05, "loss": 1.0369938850402831, "num_input_tokens_seen": 10016053440, "step": 35220, "train_runtime": 343101.0257, "train_tokens_per_second": 29192.724 }, { "epoch": 1.2465065777398403, "grad_norm": 1.59375, "learning_rate": 2.3510480839907635e-05, "loss": 1.0479074478149415, "num_input_tokens_seen": 10018930112, "step": 35230, "train_runtime": 343202.489, "train_tokens_per_second": 29192.475 }, { "epoch": 1.246860398003569, "grad_norm": 1.578125, "learning_rate": 2.350788222143453e-05, "loss": 1.0474456787109374, "num_input_tokens_seen": 10021760448, "step": 35240, "train_runtime": 343299.6052, "train_tokens_per_second": 29192.461 }, { "epoch": 1.247214218267298, "grad_norm": 1.5, "learning_rate": 2.3505284464448558e-05, "loss": 1.0391267776489257, "num_input_tokens_seen": 10024582720, "step": 35250, "train_runtime": 343396.3395, "train_tokens_per_second": 29192.457 }, { "epoch": 1.2475680385310266, "grad_norm": 1.5625, "learning_rate": 2.3502687568473815e-05, "loss": 1.060915756225586, "num_input_tokens_seen": 10027407872, "step": 35260, "train_runtime": 343493.3662, "train_tokens_per_second": 29192.435 }, { "epoch": 1.2479218587947556, "grad_norm": 1.5234375, "learning_rate": 2.3500091533034785e-05, "loss": 1.0523077964782714, "num_input_tokens_seen": 10030243520, "step": 35270, "train_runtime": 343590.4599, "train_tokens_per_second": 29192.439 }, { "epoch": 1.2482756790584844, "grad_norm": 1.546875, "learning_rate": 2.3497496357656313e-05, "loss": 1.0498737335205077, "num_input_tokens_seen": 10033080960, "step": 35280, "train_runtime": 343688.3072, "train_tokens_per_second": 29192.384 }, { "epoch": 1.2486294993222131, "grad_norm": 1.6015625, "learning_rate": 2.3494902041863607e-05, "loss": 1.0472888946533203, "num_input_tokens_seen": 10035942016, "step": 35290, "train_runtime": 343785.0122, "train_tokens_per_second": 29192.494 }, { "epoch": 1.2489833195859419, "grad_norm": 1.5703125, "learning_rate": 2.349230858518225e-05, "loss": 1.0496798515319825, "num_input_tokens_seen": 10038792768, "step": 35300, "train_runtime": 343881.9716, "train_tokens_per_second": 29192.553 }, { "epoch": 1.2493371398496707, "grad_norm": 1.53125, "learning_rate": 2.3489715987138178e-05, "loss": 1.0443727493286132, "num_input_tokens_seen": 10041574528, "step": 35310, "train_runtime": 343976.7355, "train_tokens_per_second": 29192.598 }, { "epoch": 1.2496909601133994, "grad_norm": 1.515625, "learning_rate": 2.348712424725771e-05, "loss": 1.051421546936035, "num_input_tokens_seen": 10044415808, "step": 35320, "train_runtime": 344075.6255, "train_tokens_per_second": 29192.465 }, { "epoch": 1.2500447803771282, "grad_norm": 1.546875, "learning_rate": 2.3484533365067526e-05, "loss": 1.0535319328308106, "num_input_tokens_seen": 10047284864, "step": 35330, "train_runtime": 344177.6259, "train_tokens_per_second": 29192.15 }, { "epoch": 1.250398600640857, "grad_norm": 1.5234375, "learning_rate": 2.3481943340094656e-05, "loss": 1.0444052696228028, "num_input_tokens_seen": 10050130944, "step": 35340, "train_runtime": 344273.7368, "train_tokens_per_second": 29192.267 }, { "epoch": 1.2507524209045857, "grad_norm": 1.484375, "learning_rate": 2.3479354171866517e-05, "loss": 1.0486770629882813, "num_input_tokens_seen": 10052974080, "step": 35350, "train_runtime": 344369.9278, "train_tokens_per_second": 29192.369 }, { "epoch": 1.2511062411683145, "grad_norm": 1.5546875, "learning_rate": 2.3476765859910877e-05, "loss": 1.0445372581481933, "num_input_tokens_seen": 10055788288, "step": 35360, "train_runtime": 344464.3196, "train_tokens_per_second": 29192.54 }, { "epoch": 1.2514600614320432, "grad_norm": 1.5078125, "learning_rate": 2.347417840375587e-05, "loss": 1.046097183227539, "num_input_tokens_seen": 10058621248, "step": 35370, "train_runtime": 344562.4226, "train_tokens_per_second": 29192.45 }, { "epoch": 1.251813881695772, "grad_norm": 1.6015625, "learning_rate": 2.347159180293e-05, "loss": 1.0351703643798829, "num_input_tokens_seen": 10061456640, "step": 35380, "train_runtime": 344658.0097, "train_tokens_per_second": 29192.58 }, { "epoch": 1.2521677019595008, "grad_norm": 1.6015625, "learning_rate": 2.346900605696213e-05, "loss": 1.0489368438720703, "num_input_tokens_seen": 10064292736, "step": 35390, "train_runtime": 344752.9148, "train_tokens_per_second": 29192.771 }, { "epoch": 1.2525215222232295, "grad_norm": 1.5078125, "learning_rate": 2.3466421165381486e-05, "loss": 1.0433351516723632, "num_input_tokens_seen": 10067125568, "step": 35400, "train_runtime": 344849.2694, "train_tokens_per_second": 29192.828 }, { "epoch": 1.2528753424869583, "grad_norm": 1.5859375, "learning_rate": 2.346383712771766e-05, "loss": 1.0557622909545898, "num_input_tokens_seen": 10069973440, "step": 35410, "train_runtime": 344945.6496, "train_tokens_per_second": 29192.928 }, { "epoch": 1.2532291627506873, "grad_norm": 1.5546875, "learning_rate": 2.3461253943500598e-05, "loss": 1.0483509063720704, "num_input_tokens_seen": 10072860544, "step": 35420, "train_runtime": 345044.9417, "train_tokens_per_second": 29192.894 }, { "epoch": 1.2535829830144158, "grad_norm": 1.53125, "learning_rate": 2.345867161226062e-05, "loss": 1.0492051124572754, "num_input_tokens_seen": 10075716096, "step": 35430, "train_runtime": 345142.7525, "train_tokens_per_second": 29192.895 }, { "epoch": 1.2539368032781448, "grad_norm": 1.6171875, "learning_rate": 2.34560901335284e-05, "loss": 1.0399688720703124, "num_input_tokens_seen": 10078532096, "step": 35440, "train_runtime": 345238.5874, "train_tokens_per_second": 29192.948 }, { "epoch": 1.2542906235418736, "grad_norm": 1.53125, "learning_rate": 2.3453509506834984e-05, "loss": 1.0498522758483886, "num_input_tokens_seen": 10081347968, "step": 35450, "train_runtime": 345337.7363, "train_tokens_per_second": 29192.72 }, { "epoch": 1.2546444438056024, "grad_norm": 1.53125, "learning_rate": 2.345092973171176e-05, "loss": 1.035527515411377, "num_input_tokens_seen": 10084213888, "step": 35460, "train_runtime": 345437.4566, "train_tokens_per_second": 29192.59 }, { "epoch": 1.2549982640693311, "grad_norm": 1.6171875, "learning_rate": 2.3448350807690487e-05, "loss": 1.0342901229858399, "num_input_tokens_seen": 10087038336, "step": 35470, "train_runtime": 345534.2121, "train_tokens_per_second": 29192.589 }, { "epoch": 1.25535208433306, "grad_norm": 1.4921875, "learning_rate": 2.3445772734303292e-05, "loss": 1.0608578681945802, "num_input_tokens_seen": 10089841024, "step": 35480, "train_runtime": 345629.5796, "train_tokens_per_second": 29192.643 }, { "epoch": 1.2557059045967887, "grad_norm": 1.6015625, "learning_rate": 2.344319551108265e-05, "loss": 1.050887107849121, "num_input_tokens_seen": 10092678848, "step": 35490, "train_runtime": 345722.2101, "train_tokens_per_second": 29193.03 }, { "epoch": 1.2560597248605174, "grad_norm": 1.53125, "learning_rate": 2.3440619137561402e-05, "loss": 1.0496967315673829, "num_input_tokens_seen": 10095558208, "step": 35500, "train_runtime": 345825.52, "train_tokens_per_second": 29192.635 }, { "epoch": 1.2564135451242462, "grad_norm": 1.546875, "learning_rate": 2.343804361327275e-05, "loss": 1.0381778717041015, "num_input_tokens_seen": 10098391104, "step": 35510, "train_runtime": 345920.4675, "train_tokens_per_second": 29192.812 }, { "epoch": 1.256767365387975, "grad_norm": 1.6171875, "learning_rate": 2.3435468937750252e-05, "loss": 1.0526269912719726, "num_input_tokens_seen": 10101243008, "step": 35520, "train_runtime": 346016.4749, "train_tokens_per_second": 29192.954 }, { "epoch": 1.2571211856517037, "grad_norm": 1.5703125, "learning_rate": 2.3432895110527815e-05, "loss": 1.052810287475586, "num_input_tokens_seen": 10104065792, "step": 35530, "train_runtime": 346112.1064, "train_tokens_per_second": 29193.044 }, { "epoch": 1.2574750059154325, "grad_norm": 1.5078125, "learning_rate": 2.3430322131139726e-05, "loss": 1.040468978881836, "num_input_tokens_seen": 10106898368, "step": 35540, "train_runtime": 346210.5427, "train_tokens_per_second": 29192.925 }, { "epoch": 1.2578288261791613, "grad_norm": 1.5625, "learning_rate": 2.342774999912061e-05, "loss": 1.0462255477905273, "num_input_tokens_seen": 10109664512, "step": 35550, "train_runtime": 346302.423, "train_tokens_per_second": 29193.167 }, { "epoch": 1.25818264644289, "grad_norm": 1.5703125, "learning_rate": 2.342517871400546e-05, "loss": 1.0593046188354491, "num_input_tokens_seen": 10112520512, "step": 35560, "train_runtime": 346399.8001, "train_tokens_per_second": 29193.205 }, { "epoch": 1.258536466706619, "grad_norm": 1.546875, "learning_rate": 2.342260827532962e-05, "loss": 1.048978614807129, "num_input_tokens_seen": 10115328000, "step": 35570, "train_runtime": 346497.4929, "train_tokens_per_second": 29193.077 }, { "epoch": 1.2588902869703475, "grad_norm": 1.5859375, "learning_rate": 2.34200386826288e-05, "loss": 1.0493156433105468, "num_input_tokens_seen": 10118209472, "step": 35580, "train_runtime": 346596.438, "train_tokens_per_second": 29193.057 }, { "epoch": 1.2592441072340765, "grad_norm": 1.5703125, "learning_rate": 2.3417469935439052e-05, "loss": 1.0535624504089356, "num_input_tokens_seen": 10121055488, "step": 35590, "train_runtime": 346694.5435, "train_tokens_per_second": 29193.005 }, { "epoch": 1.259597927497805, "grad_norm": 1.5234375, "learning_rate": 2.34149020332968e-05, "loss": 1.0508821487426758, "num_input_tokens_seen": 10123917824, "step": 35600, "train_runtime": 346793.3066, "train_tokens_per_second": 29192.945 }, { "epoch": 1.259951747761534, "grad_norm": 1.6015625, "learning_rate": 2.3412334975738813e-05, "loss": 1.0557462692260742, "num_input_tokens_seen": 10126750016, "step": 35610, "train_runtime": 346891.1305, "train_tokens_per_second": 29192.877 }, { "epoch": 1.2603055680252628, "grad_norm": 1.5078125, "learning_rate": 2.3409768762302222e-05, "loss": 1.033669662475586, "num_input_tokens_seen": 10129580608, "step": 35620, "train_runtime": 346989.5281, "train_tokens_per_second": 29192.756 }, { "epoch": 1.2606593882889916, "grad_norm": 1.6015625, "learning_rate": 2.340720339252451e-05, "loss": 1.0552188873291015, "num_input_tokens_seen": 10132420992, "step": 35630, "train_runtime": 347087.1683, "train_tokens_per_second": 29192.727 }, { "epoch": 1.2610132085527204, "grad_norm": 1.515625, "learning_rate": 2.3404638865943507e-05, "loss": 1.0387256622314454, "num_input_tokens_seen": 10135264512, "step": 35640, "train_runtime": 347182.6921, "train_tokens_per_second": 29192.885 }, { "epoch": 1.2613670288164491, "grad_norm": 1.5234375, "learning_rate": 2.3402075182097412e-05, "loss": 1.0667291641235352, "num_input_tokens_seen": 10138134912, "step": 35650, "train_runtime": 347282.4493, "train_tokens_per_second": 29192.765 }, { "epoch": 1.261720849080178, "grad_norm": 1.484375, "learning_rate": 2.339951234052477e-05, "loss": 1.0387666702270508, "num_input_tokens_seen": 10140988224, "step": 35660, "train_runtime": 347382.1504, "train_tokens_per_second": 29192.6 }, { "epoch": 1.2620746693439067, "grad_norm": 1.546875, "learning_rate": 2.3396950340764478e-05, "loss": 1.0389020919799805, "num_input_tokens_seen": 10143858304, "step": 35670, "train_runtime": 347483.5017, "train_tokens_per_second": 29192.345 }, { "epoch": 1.2624284896076354, "grad_norm": 1.5625, "learning_rate": 2.3394389182355793e-05, "loss": 1.0320611953735352, "num_input_tokens_seen": 10146706752, "step": 35680, "train_runtime": 347582.7934, "train_tokens_per_second": 29192.201 }, { "epoch": 1.2627823098713642, "grad_norm": 1.5234375, "learning_rate": 2.339182886483832e-05, "loss": 1.0480488777160644, "num_input_tokens_seen": 10149506048, "step": 35690, "train_runtime": 347676.9738, "train_tokens_per_second": 29192.345 }, { "epoch": 1.263136130135093, "grad_norm": 1.546875, "learning_rate": 2.3389269387752017e-05, "loss": 1.0477913856506347, "num_input_tokens_seen": 10152397888, "step": 35700, "train_runtime": 347776.5258, "train_tokens_per_second": 29192.303 }, { "epoch": 1.2634899503988217, "grad_norm": 1.5546875, "learning_rate": 2.3386710750637194e-05, "loss": 1.0533632278442382, "num_input_tokens_seen": 10155230208, "step": 35710, "train_runtime": 347873.7436, "train_tokens_per_second": 29192.287 }, { "epoch": 1.2638437706625505, "grad_norm": 1.5078125, "learning_rate": 2.3384152953034514e-05, "loss": 1.0542146682739257, "num_input_tokens_seen": 10158070912, "step": 35720, "train_runtime": 347972.5801, "train_tokens_per_second": 29192.159 }, { "epoch": 1.2641975909262793, "grad_norm": 1.453125, "learning_rate": 2.338159599448499e-05, "loss": 1.0429905891418456, "num_input_tokens_seen": 10160917056, "step": 35730, "train_runtime": 348069.8664, "train_tokens_per_second": 29192.177 }, { "epoch": 1.2645514111900082, "grad_norm": 1.5546875, "learning_rate": 2.3379039874529996e-05, "loss": 1.040936279296875, "num_input_tokens_seen": 10163797952, "step": 35740, "train_runtime": 348168.0129, "train_tokens_per_second": 29192.222 }, { "epoch": 1.2649052314537368, "grad_norm": 1.515625, "learning_rate": 2.337648459271124e-05, "loss": 1.035550880432129, "num_input_tokens_seen": 10166626048, "step": 35750, "train_runtime": 348265.7225, "train_tokens_per_second": 29192.152 }, { "epoch": 1.2652590517174658, "grad_norm": 1.5859375, "learning_rate": 2.3373930148570787e-05, "loss": 1.0582223892211915, "num_input_tokens_seen": 10169436416, "step": 35760, "train_runtime": 348362.2433, "train_tokens_per_second": 29192.132 }, { "epoch": 1.2656128719811943, "grad_norm": 1.6171875, "learning_rate": 2.3371376541651063e-05, "loss": 1.0647600173950196, "num_input_tokens_seen": 10172264768, "step": 35770, "train_runtime": 348457.3947, "train_tokens_per_second": 29192.277 }, { "epoch": 1.2659666922449233, "grad_norm": 1.5625, "learning_rate": 2.336882377149483e-05, "loss": 1.052362823486328, "num_input_tokens_seen": 10175120896, "step": 35780, "train_runtime": 348555.5991, "train_tokens_per_second": 29192.246 }, { "epoch": 1.266320512508652, "grad_norm": 1.53125, "learning_rate": 2.3366271837645207e-05, "loss": 1.0560431480407715, "num_input_tokens_seen": 10178012672, "step": 35790, "train_runtime": 348654.2094, "train_tokens_per_second": 29192.284 }, { "epoch": 1.2666743327723808, "grad_norm": 1.5859375, "learning_rate": 2.3363720739645652e-05, "loss": 1.0467076301574707, "num_input_tokens_seen": 10180854720, "step": 35800, "train_runtime": 348751.3984, "train_tokens_per_second": 29192.298 }, { "epoch": 1.2670281530361096, "grad_norm": 1.515625, "learning_rate": 2.3361170477039995e-05, "loss": 1.0449387550354003, "num_input_tokens_seen": 10183678464, "step": 35810, "train_runtime": 348847.0621, "train_tokens_per_second": 29192.387 }, { "epoch": 1.2673819732998384, "grad_norm": 1.5859375, "learning_rate": 2.3358621049372383e-05, "loss": 1.0527238845825195, "num_input_tokens_seen": 10186474624, "step": 35820, "train_runtime": 348943.7547, "train_tokens_per_second": 29192.311 }, { "epoch": 1.2677357935635671, "grad_norm": 1.5546875, "learning_rate": 2.3356072456187336e-05, "loss": 1.0483879089355468, "num_input_tokens_seen": 10189268608, "step": 35830, "train_runtime": 349037.7649, "train_tokens_per_second": 29192.453 }, { "epoch": 1.268089613827296, "grad_norm": 1.5, "learning_rate": 2.335352469702972e-05, "loss": 1.0454856872558593, "num_input_tokens_seen": 10192053568, "step": 35840, "train_runtime": 349132.9995, "train_tokens_per_second": 29192.467 }, { "epoch": 1.2684434340910247, "grad_norm": 1.5703125, "learning_rate": 2.3350977771444724e-05, "loss": 1.0411387443542481, "num_input_tokens_seen": 10194905920, "step": 35850, "train_runtime": 349233.1365, "train_tokens_per_second": 29192.264 }, { "epoch": 1.2687972543547534, "grad_norm": 1.5078125, "learning_rate": 2.3348431678977914e-05, "loss": 1.045221710205078, "num_input_tokens_seen": 10197752832, "step": 35860, "train_runtime": 349330.1158, "train_tokens_per_second": 29192.309 }, { "epoch": 1.2691510746184822, "grad_norm": 1.546875, "learning_rate": 2.334588641917519e-05, "loss": 1.0437467575073243, "num_input_tokens_seen": 10200570048, "step": 35870, "train_runtime": 349423.947, "train_tokens_per_second": 29192.533 }, { "epoch": 1.269504894882211, "grad_norm": 1.5234375, "learning_rate": 2.3343341991582792e-05, "loss": 1.047953987121582, "num_input_tokens_seen": 10203438656, "step": 35880, "train_runtime": 349524.4337, "train_tokens_per_second": 29192.347 }, { "epoch": 1.2698587151459397, "grad_norm": 1.4609375, "learning_rate": 2.334079839574732e-05, "loss": 1.0267410278320312, "num_input_tokens_seen": 10206278592, "step": 35890, "train_runtime": 349619.6906, "train_tokens_per_second": 29192.517 }, { "epoch": 1.2702125354096685, "grad_norm": 1.5859375, "learning_rate": 2.333825563121571e-05, "loss": 1.0556390762329102, "num_input_tokens_seen": 10209164416, "step": 35900, "train_runtime": 349718.3815, "train_tokens_per_second": 29192.53 }, { "epoch": 1.2705663556733975, "grad_norm": 1.53125, "learning_rate": 2.333571369753525e-05, "loss": 1.047159194946289, "num_input_tokens_seen": 10212010368, "step": 35910, "train_runtime": 349816.9482, "train_tokens_per_second": 29192.44 }, { "epoch": 1.270920175937126, "grad_norm": 1.59375, "learning_rate": 2.3333172594253564e-05, "loss": 1.0545637130737304, "num_input_tokens_seen": 10214850176, "step": 35920, "train_runtime": 349914.0217, "train_tokens_per_second": 29192.457 }, { "epoch": 1.271273996200855, "grad_norm": 1.4765625, "learning_rate": 2.3330632320918626e-05, "loss": 1.057828426361084, "num_input_tokens_seen": 10217684864, "step": 35930, "train_runtime": 350011.3174, "train_tokens_per_second": 29192.441 }, { "epoch": 1.2716278164645836, "grad_norm": 1.578125, "learning_rate": 2.3328092877078757e-05, "loss": 1.0525793075561523, "num_input_tokens_seen": 10220489984, "step": 35940, "train_runtime": 350106.7227, "train_tokens_per_second": 29192.499 }, { "epoch": 1.2719816367283125, "grad_norm": 1.5390625, "learning_rate": 2.3325554262282617e-05, "loss": 1.0531472206115722, "num_input_tokens_seen": 10223374272, "step": 35950, "train_runtime": 350205.037, "train_tokens_per_second": 29192.539 }, { "epoch": 1.2723354569920413, "grad_norm": 1.53125, "learning_rate": 2.332301647607922e-05, "loss": 1.0415127754211426, "num_input_tokens_seen": 10226270016, "step": 35960, "train_runtime": 350304.5862, "train_tokens_per_second": 29192.51 }, { "epoch": 1.27268927725577, "grad_norm": 1.4609375, "learning_rate": 2.3320479518017907e-05, "loss": 1.0368799209594726, "num_input_tokens_seen": 10229135040, "step": 35970, "train_runtime": 350400.8981, "train_tokens_per_second": 29192.662 }, { "epoch": 1.2730430975194988, "grad_norm": 1.53125, "learning_rate": 2.3317943387648372e-05, "loss": 1.0461764335632324, "num_input_tokens_seen": 10232022784, "step": 35980, "train_runtime": 350503.8323, "train_tokens_per_second": 29192.328 }, { "epoch": 1.2733969177832276, "grad_norm": 1.546875, "learning_rate": 2.3315408084520653e-05, "loss": 1.0449687957763671, "num_input_tokens_seen": 10234852992, "step": 35990, "train_runtime": 350601.298, "train_tokens_per_second": 29192.285 }, { "epoch": 1.2737507380469564, "grad_norm": 1.5390625, "learning_rate": 2.3312873608185128e-05, "loss": 1.031435203552246, "num_input_tokens_seen": 10237701504, "step": 36000, "train_runtime": 350699.1236, "train_tokens_per_second": 29192.264 }, { "epoch": 1.2741045583106851, "grad_norm": 1.4765625, "learning_rate": 2.3310339958192516e-05, "loss": 1.0394020080566406, "num_input_tokens_seen": 10240542208, "step": 36010, "train_runtime": 350796.3553, "train_tokens_per_second": 29192.271 }, { "epoch": 1.274458378574414, "grad_norm": 1.453125, "learning_rate": 2.3307807134093877e-05, "loss": 1.035683822631836, "num_input_tokens_seen": 10243427712, "step": 36020, "train_runtime": 350896.4206, "train_tokens_per_second": 29192.169 }, { "epoch": 1.2748121988381427, "grad_norm": 1.59375, "learning_rate": 2.3305275135440616e-05, "loss": 1.0510623931884766, "num_input_tokens_seen": 10246277184, "step": 36030, "train_runtime": 350993.8491, "train_tokens_per_second": 29192.184 }, { "epoch": 1.2751660191018714, "grad_norm": 1.53125, "learning_rate": 2.3302743961784472e-05, "loss": 1.0356892585754394, "num_input_tokens_seen": 10249089600, "step": 36040, "train_runtime": 351089.4252, "train_tokens_per_second": 29192.248 }, { "epoch": 1.2755198393656002, "grad_norm": 1.4765625, "learning_rate": 2.3300213612677545e-05, "loss": 1.0561676025390625, "num_input_tokens_seen": 10252022528, "step": 36050, "train_runtime": 351190.5342, "train_tokens_per_second": 29192.195 }, { "epoch": 1.275873659629329, "grad_norm": 1.5, "learning_rate": 2.3297684087672242e-05, "loss": 1.0552453994750977, "num_input_tokens_seen": 10254893120, "step": 36060, "train_runtime": 351286.5997, "train_tokens_per_second": 29192.383 }, { "epoch": 1.2762274798930577, "grad_norm": 1.640625, "learning_rate": 2.3295155386321336e-05, "loss": 1.049654197692871, "num_input_tokens_seen": 10257762624, "step": 36070, "train_runtime": 351384.6384, "train_tokens_per_second": 29192.405 }, { "epoch": 1.2765813001567867, "grad_norm": 1.4765625, "learning_rate": 2.3292627508177933e-05, "loss": 1.0412948608398438, "num_input_tokens_seen": 10260627968, "step": 36080, "train_runtime": 351481.0546, "train_tokens_per_second": 29192.549 }, { "epoch": 1.2769351204205153, "grad_norm": 1.53125, "learning_rate": 2.3290100452795474e-05, "loss": 1.060901165008545, "num_input_tokens_seen": 10263424576, "step": 36090, "train_runtime": 351576.484, "train_tokens_per_second": 29192.58 }, { "epoch": 1.2772889406842443, "grad_norm": 1.5546875, "learning_rate": 2.3287574219727752e-05, "loss": 1.0422266960144042, "num_input_tokens_seen": 10266299072, "step": 36100, "train_runtime": 351679.023, "train_tokens_per_second": 29192.242 }, { "epoch": 1.277642760947973, "grad_norm": 1.609375, "learning_rate": 2.3285048808528872e-05, "loss": 1.0456802368164062, "num_input_tokens_seen": 10269100928, "step": 36110, "train_runtime": 351774.3474, "train_tokens_per_second": 29192.296 }, { "epoch": 1.2779965812117018, "grad_norm": 1.53125, "learning_rate": 2.3282524218753308e-05, "loss": 1.0575891494750977, "num_input_tokens_seen": 10271921792, "step": 36120, "train_runtime": 351870.0429, "train_tokens_per_second": 29192.374 }, { "epoch": 1.2783504014754306, "grad_norm": 1.5234375, "learning_rate": 2.328000044995586e-05, "loss": 1.046957302093506, "num_input_tokens_seen": 10274797312, "step": 36130, "train_runtime": 351966.9009, "train_tokens_per_second": 29192.51 }, { "epoch": 1.2787042217391593, "grad_norm": 1.625, "learning_rate": 2.3277477501691647e-05, "loss": 1.0440662384033204, "num_input_tokens_seen": 10277620416, "step": 36140, "train_runtime": 352063.2155, "train_tokens_per_second": 29192.543 }, { "epoch": 1.279058042002888, "grad_norm": 1.515625, "learning_rate": 2.3274955373516163e-05, "loss": 1.0550686836242675, "num_input_tokens_seen": 10280484224, "step": 36150, "train_runtime": 352160.464, "train_tokens_per_second": 29192.613 }, { "epoch": 1.2794118622666169, "grad_norm": 1.53125, "learning_rate": 2.3272434064985205e-05, "loss": 1.050411319732666, "num_input_tokens_seen": 10283366336, "step": 36160, "train_runtime": 352258.4835, "train_tokens_per_second": 29192.672 }, { "epoch": 1.2797656825303456, "grad_norm": 1.46875, "learning_rate": 2.3269913575654932e-05, "loss": 1.0474621772766113, "num_input_tokens_seen": 10286268288, "step": 36170, "train_runtime": 352358.5875, "train_tokens_per_second": 29192.614 }, { "epoch": 1.2801195027940744, "grad_norm": 1.5078125, "learning_rate": 2.326739390508182e-05, "loss": 1.0358003616333007, "num_input_tokens_seen": 10289162304, "step": 36180, "train_runtime": 352460.982, "train_tokens_per_second": 29192.344 }, { "epoch": 1.2804733230578031, "grad_norm": 1.6171875, "learning_rate": 2.326487505282269e-05, "loss": 1.0526773452758789, "num_input_tokens_seen": 10291963072, "step": 36190, "train_runtime": 352554.5786, "train_tokens_per_second": 29192.538 }, { "epoch": 1.280827143321532, "grad_norm": 1.5546875, "learning_rate": 2.3262357018434698e-05, "loss": 1.0549711227416991, "num_input_tokens_seen": 10294793920, "step": 36200, "train_runtime": 352650.8065, "train_tokens_per_second": 29192.6 }, { "epoch": 1.2811809635852607, "grad_norm": 1.578125, "learning_rate": 2.3259839801475338e-05, "loss": 1.0471868515014648, "num_input_tokens_seen": 10297646528, "step": 36210, "train_runtime": 352748.7297, "train_tokens_per_second": 29192.583 }, { "epoch": 1.2815347838489894, "grad_norm": 1.4765625, "learning_rate": 2.325732340150243e-05, "loss": 1.0624814987182618, "num_input_tokens_seen": 10300463360, "step": 36220, "train_runtime": 352845.0855, "train_tokens_per_second": 29192.594 }, { "epoch": 1.2818886041127182, "grad_norm": 1.5859375, "learning_rate": 2.325480781807415e-05, "loss": 1.05201416015625, "num_input_tokens_seen": 10303317952, "step": 36230, "train_runtime": 352945.8606, "train_tokens_per_second": 29192.347 }, { "epoch": 1.282242424376447, "grad_norm": 1.5234375, "learning_rate": 2.3252293050748975e-05, "loss": 1.0428884506225586, "num_input_tokens_seen": 10306168768, "step": 36240, "train_runtime": 353042.5725, "train_tokens_per_second": 29192.425 }, { "epoch": 1.282596244640176, "grad_norm": 1.5390625, "learning_rate": 2.324977909908575e-05, "loss": 1.0578889846801758, "num_input_tokens_seen": 10308941952, "step": 36250, "train_runtime": 353137.9522, "train_tokens_per_second": 29192.393 }, { "epoch": 1.2829500649039045, "grad_norm": 1.546875, "learning_rate": 2.3247265962643632e-05, "loss": 1.0350717544555663, "num_input_tokens_seen": 10311799040, "step": 36260, "train_runtime": 353237.1889, "train_tokens_per_second": 29192.28 }, { "epoch": 1.2833038851676335, "grad_norm": 1.484375, "learning_rate": 2.3244753640982106e-05, "loss": 1.0512584686279296, "num_input_tokens_seen": 10314670976, "step": 36270, "train_runtime": 353337.8415, "train_tokens_per_second": 29192.093 }, { "epoch": 1.2836577054313623, "grad_norm": 1.5078125, "learning_rate": 2.324224213366102e-05, "loss": 1.0635036468505858, "num_input_tokens_seen": 10317556096, "step": 36280, "train_runtime": 353437.9517, "train_tokens_per_second": 29191.987 }, { "epoch": 1.284011525695091, "grad_norm": 1.5390625, "learning_rate": 2.3239731440240538e-05, "loss": 1.0386905670166016, "num_input_tokens_seen": 10320370240, "step": 36290, "train_runtime": 353533.8443, "train_tokens_per_second": 29192.029 }, { "epoch": 1.2843653459588198, "grad_norm": 1.5546875, "learning_rate": 2.3237221560281143e-05, "loss": 1.0551176071166992, "num_input_tokens_seen": 10323213696, "step": 36300, "train_runtime": 353633.8103, "train_tokens_per_second": 29191.818 }, { "epoch": 1.2847191662225486, "grad_norm": 1.53125, "learning_rate": 2.3234712493343673e-05, "loss": 1.0369672775268555, "num_input_tokens_seen": 10326142016, "step": 36310, "train_runtime": 353734.0188, "train_tokens_per_second": 29191.826 }, { "epoch": 1.2850729864862773, "grad_norm": 1.5859375, "learning_rate": 2.323220423898928e-05, "loss": 1.0476274490356445, "num_input_tokens_seen": 10329028416, "step": 36320, "train_runtime": 353833.0712, "train_tokens_per_second": 29191.812 }, { "epoch": 1.285426806750006, "grad_norm": 1.515625, "learning_rate": 2.3229696796779456e-05, "loss": 1.0520745277404786, "num_input_tokens_seen": 10331877632, "step": 36330, "train_runtime": 353929.8137, "train_tokens_per_second": 29191.883 }, { "epoch": 1.2857806270137349, "grad_norm": 1.5390625, "learning_rate": 2.3227190166276033e-05, "loss": 1.064095687866211, "num_input_tokens_seen": 10334730560, "step": 36340, "train_runtime": 354025.2963, "train_tokens_per_second": 29192.068 }, { "epoch": 1.2861344472774636, "grad_norm": 1.5625, "learning_rate": 2.3224684347041153e-05, "loss": 1.0499074935913086, "num_input_tokens_seen": 10337580928, "step": 36350, "train_runtime": 354122.5456, "train_tokens_per_second": 29192.1 }, { "epoch": 1.2864882675411924, "grad_norm": 1.59375, "learning_rate": 2.3222179338637306e-05, "loss": 1.0515209197998048, "num_input_tokens_seen": 10340425472, "step": 36360, "train_runtime": 354219.5206, "train_tokens_per_second": 29192.139 }, { "epoch": 1.2868420878049212, "grad_norm": 1.5234375, "learning_rate": 2.3219675140627302e-05, "loss": 1.0561207771301269, "num_input_tokens_seen": 10343287040, "step": 36370, "train_runtime": 354315.9595, "train_tokens_per_second": 29192.27 }, { "epoch": 1.28719590806865, "grad_norm": 1.5703125, "learning_rate": 2.3217171752574292e-05, "loss": 1.0493478775024414, "num_input_tokens_seen": 10346137920, "step": 36380, "train_runtime": 354413.1693, "train_tokens_per_second": 29192.307 }, { "epoch": 1.2875497283323787, "grad_norm": 1.5, "learning_rate": 2.3214669174041745e-05, "loss": 1.0583698272705078, "num_input_tokens_seen": 10348913664, "step": 36390, "train_runtime": 354505.3245, "train_tokens_per_second": 29192.548 }, { "epoch": 1.2879035485961077, "grad_norm": 1.5625, "learning_rate": 2.321216740459346e-05, "loss": 1.0367016792297363, "num_input_tokens_seen": 10351740544, "step": 36400, "train_runtime": 354600.6063, "train_tokens_per_second": 29192.676 }, { "epoch": 1.2882573688598362, "grad_norm": 1.5234375, "learning_rate": 2.3209666443793578e-05, "loss": 1.0508742332458496, "num_input_tokens_seen": 10354564224, "step": 36410, "train_runtime": 354698.6685, "train_tokens_per_second": 29192.566 }, { "epoch": 1.2886111891235652, "grad_norm": 1.59375, "learning_rate": 2.3207166291206553e-05, "loss": 1.041246223449707, "num_input_tokens_seen": 10357410304, "step": 36420, "train_runtime": 354796.1143, "train_tokens_per_second": 29192.57 }, { "epoch": 1.2889650093872937, "grad_norm": 1.59375, "learning_rate": 2.3204666946397175e-05, "loss": 1.0406181335449218, "num_input_tokens_seen": 10360279296, "step": 36430, "train_runtime": 354894.7119, "train_tokens_per_second": 29192.543 }, { "epoch": 1.2893188296510227, "grad_norm": 1.65625, "learning_rate": 2.3202168408930565e-05, "loss": 1.0501867294311524, "num_input_tokens_seen": 10363111616, "step": 36440, "train_runtime": 354991.2767, "train_tokens_per_second": 29192.581 }, { "epoch": 1.2896726499147515, "grad_norm": 1.5703125, "learning_rate": 2.3199670678372166e-05, "loss": 1.051297950744629, "num_input_tokens_seen": 10365997312, "step": 36450, "train_runtime": 355090.3381, "train_tokens_per_second": 29192.564 }, { "epoch": 1.2900264701784803, "grad_norm": 1.484375, "learning_rate": 2.3197173754287747e-05, "loss": 1.0366804122924804, "num_input_tokens_seen": 10368827776, "step": 36460, "train_runtime": 355183.6405, "train_tokens_per_second": 29192.864 }, { "epoch": 1.290380290442209, "grad_norm": 1.59375, "learning_rate": 2.319467763624341e-05, "loss": 1.041246223449707, "num_input_tokens_seen": 10371667456, "step": 36470, "train_runtime": 355279.7515, "train_tokens_per_second": 29192.96 }, { "epoch": 1.2907341107059378, "grad_norm": 1.5625, "learning_rate": 2.3192182323805577e-05, "loss": 1.0443979263305665, "num_input_tokens_seen": 10374532864, "step": 36480, "train_runtime": 355379.2188, "train_tokens_per_second": 29192.852 }, { "epoch": 1.2910879309696666, "grad_norm": 1.59375, "learning_rate": 2.318968781654101e-05, "loss": 1.0467546463012696, "num_input_tokens_seen": 10377353600, "step": 36490, "train_runtime": 355473.3924, "train_tokens_per_second": 29193.053 }, { "epoch": 1.2914417512333953, "grad_norm": 1.5859375, "learning_rate": 2.3187194114016778e-05, "loss": 1.0610313415527344, "num_input_tokens_seen": 10380203328, "step": 36500, "train_runtime": 355569.8065, "train_tokens_per_second": 29193.152 }, { "epoch": 1.291795571497124, "grad_norm": 1.515625, "learning_rate": 2.318470121580029e-05, "loss": 1.048283004760742, "num_input_tokens_seen": 10383002688, "step": 36510, "train_runtime": 355665.7253, "train_tokens_per_second": 29193.149 }, { "epoch": 1.2921493917608529, "grad_norm": 1.4609375, "learning_rate": 2.318220912145927e-05, "loss": 1.0514901161193848, "num_input_tokens_seen": 10385819840, "step": 36520, "train_runtime": 355762.9526, "train_tokens_per_second": 29193.09 }, { "epoch": 1.2925032120245816, "grad_norm": 1.5625, "learning_rate": 2.3179717830561783e-05, "loss": 1.0465136528015138, "num_input_tokens_seen": 10388652800, "step": 36530, "train_runtime": 355857.989, "train_tokens_per_second": 29193.254 }, { "epoch": 1.2928570322883104, "grad_norm": 1.59375, "learning_rate": 2.3177227342676204e-05, "loss": 1.0370139122009276, "num_input_tokens_seen": 10391493696, "step": 36540, "train_runtime": 355955.8484, "train_tokens_per_second": 29193.21 }, { "epoch": 1.2932108525520392, "grad_norm": 1.5, "learning_rate": 2.317473765737124e-05, "loss": 1.0567922592163086, "num_input_tokens_seen": 10394314816, "step": 36550, "train_runtime": 356052.06, "train_tokens_per_second": 29193.244 }, { "epoch": 1.293564672815768, "grad_norm": 1.4609375, "learning_rate": 2.317224877421591e-05, "loss": 1.0522394180297852, "num_input_tokens_seen": 10397156672, "step": 36560, "train_runtime": 356148.7977, "train_tokens_per_second": 29193.294 }, { "epoch": 1.293918493079497, "grad_norm": 1.484375, "learning_rate": 2.3169760692779578e-05, "loss": 1.0532241821289063, "num_input_tokens_seen": 10400008960, "step": 36570, "train_runtime": 356247.167, "train_tokens_per_second": 29193.24 }, { "epoch": 1.2942723133432255, "grad_norm": 1.5703125, "learning_rate": 2.316727341263191e-05, "loss": 1.0459787368774414, "num_input_tokens_seen": 10402812224, "step": 36580, "train_runtime": 356344.7186, "train_tokens_per_second": 29193.115 }, { "epoch": 1.2946261336069544, "grad_norm": 1.578125, "learning_rate": 2.3164786933342915e-05, "loss": 1.0656368255615234, "num_input_tokens_seen": 10405665600, "step": 36590, "train_runtime": 356442.5288, "train_tokens_per_second": 29193.109 }, { "epoch": 1.294979953870683, "grad_norm": 1.5234375, "learning_rate": 2.3162301254482914e-05, "loss": 1.0501174926757812, "num_input_tokens_seen": 10408514944, "step": 36600, "train_runtime": 356540.2004, "train_tokens_per_second": 29193.103 }, { "epoch": 1.295333774134412, "grad_norm": 1.515625, "learning_rate": 2.3159816375622546e-05, "loss": 1.0399152755737304, "num_input_tokens_seen": 10411365760, "step": 36610, "train_runtime": 356638.1673, "train_tokens_per_second": 29193.078 }, { "epoch": 1.2956875943981407, "grad_norm": 1.5234375, "learning_rate": 2.3157332296332783e-05, "loss": 1.056624698638916, "num_input_tokens_seen": 10414225920, "step": 36620, "train_runtime": 356736.4946, "train_tokens_per_second": 29193.049 }, { "epoch": 1.2960414146618695, "grad_norm": 1.4765625, "learning_rate": 2.3154849016184914e-05, "loss": 1.0495917320251464, "num_input_tokens_seen": 10417155072, "step": 36630, "train_runtime": 356839.1533, "train_tokens_per_second": 29192.859 }, { "epoch": 1.2963952349255983, "grad_norm": 1.546875, "learning_rate": 2.3152366534750554e-05, "loss": 1.0446695327758788, "num_input_tokens_seen": 10420005760, "step": 36640, "train_runtime": 356936.3959, "train_tokens_per_second": 29192.892 }, { "epoch": 1.296749055189327, "grad_norm": 1.5234375, "learning_rate": 2.3149884851601633e-05, "loss": 1.0270333290100098, "num_input_tokens_seen": 10422820672, "step": 36650, "train_runtime": 357033.1975, "train_tokens_per_second": 29192.861 }, { "epoch": 1.2971028754530558, "grad_norm": 1.5625, "learning_rate": 2.31474039663104e-05, "loss": 1.0441347122192384, "num_input_tokens_seen": 10425622016, "step": 36660, "train_runtime": 357126.8002, "train_tokens_per_second": 29193.054 }, { "epoch": 1.2974566957167846, "grad_norm": 1.625, "learning_rate": 2.314492387844944e-05, "loss": 1.0503193855285644, "num_input_tokens_seen": 10428388224, "step": 36670, "train_runtime": 357223.9592, "train_tokens_per_second": 29192.858 }, { "epoch": 1.2978105159805133, "grad_norm": 1.5703125, "learning_rate": 2.314244458759163e-05, "loss": 1.052667999267578, "num_input_tokens_seen": 10431217152, "step": 36680, "train_runtime": 357322.8441, "train_tokens_per_second": 29192.696 }, { "epoch": 1.298164336244242, "grad_norm": 1.53125, "learning_rate": 2.3139966093310202e-05, "loss": 1.0420839309692382, "num_input_tokens_seen": 10434115456, "step": 36690, "train_runtime": 357419.7419, "train_tokens_per_second": 29192.891 }, { "epoch": 1.2985181565079709, "grad_norm": 1.59375, "learning_rate": 2.3137488395178695e-05, "loss": 1.0467926025390626, "num_input_tokens_seen": 10436962176, "step": 36700, "train_runtime": 357516.5408, "train_tokens_per_second": 29192.949 }, { "epoch": 1.2988719767716996, "grad_norm": 1.5078125, "learning_rate": 2.313501149277095e-05, "loss": 1.0565263748168945, "num_input_tokens_seen": 10439813568, "step": 36710, "train_runtime": 357612.4305, "train_tokens_per_second": 29193.095 }, { "epoch": 1.2992257970354284, "grad_norm": 1.5390625, "learning_rate": 2.3132535385661143e-05, "loss": 1.0378105163574218, "num_input_tokens_seen": 10442624128, "step": 36720, "train_runtime": 357708.4198, "train_tokens_per_second": 29193.118 }, { "epoch": 1.2995796172991572, "grad_norm": 1.578125, "learning_rate": 2.313006007342377e-05, "loss": 1.0547441482543944, "num_input_tokens_seen": 10445464384, "step": 36730, "train_runtime": 357804.4516, "train_tokens_per_second": 29193.221 }, { "epoch": 1.2999334375628862, "grad_norm": 1.5546875, "learning_rate": 2.312758555563365e-05, "loss": 1.0556913375854493, "num_input_tokens_seen": 10448279744, "step": 36740, "train_runtime": 357900.0712, "train_tokens_per_second": 29193.288 }, { "epoch": 1.3002872578266147, "grad_norm": 1.515625, "learning_rate": 2.3125111831865908e-05, "loss": 1.0528488159179688, "num_input_tokens_seen": 10451154112, "step": 36750, "train_runtime": 357999.7628, "train_tokens_per_second": 29193.187 }, { "epoch": 1.3006410780903437, "grad_norm": 1.578125, "learning_rate": 2.3122638901695983e-05, "loss": 1.0508752822875977, "num_input_tokens_seen": 10454018944, "step": 36760, "train_runtime": 358100.6159, "train_tokens_per_second": 29192.966 }, { "epoch": 1.3009948983540722, "grad_norm": 1.5546875, "learning_rate": 2.3120166764699654e-05, "loss": 1.0481758117675781, "num_input_tokens_seen": 10456844672, "step": 36770, "train_runtime": 358198.2409, "train_tokens_per_second": 29192.898 }, { "epoch": 1.3013487186178012, "grad_norm": 1.5546875, "learning_rate": 2.3117695420453e-05, "loss": 1.0499849319458008, "num_input_tokens_seen": 10459667520, "step": 36780, "train_runtime": 358294.4614, "train_tokens_per_second": 29192.937 }, { "epoch": 1.30170253888153, "grad_norm": 1.515625, "learning_rate": 2.3115224868532416e-05, "loss": 1.0536531448364257, "num_input_tokens_seen": 10462504000, "step": 36790, "train_runtime": 358389.767, "train_tokens_per_second": 29193.088 }, { "epoch": 1.3020563591452587, "grad_norm": 1.53125, "learning_rate": 2.3112755108514628e-05, "loss": 1.0406072616577149, "num_input_tokens_seen": 10465319296, "step": 36800, "train_runtime": 358484.5859, "train_tokens_per_second": 29193.22 }, { "epoch": 1.3024101794089875, "grad_norm": 1.5546875, "learning_rate": 2.311028613997666e-05, "loss": 1.0578908920288086, "num_input_tokens_seen": 10468055424, "step": 36810, "train_runtime": 358576.4696, "train_tokens_per_second": 29193.37 }, { "epoch": 1.3027639996727163, "grad_norm": 1.609375, "learning_rate": 2.3107817962495873e-05, "loss": 1.0372175216674804, "num_input_tokens_seen": 10470895104, "step": 36820, "train_runtime": 358672.9144, "train_tokens_per_second": 29193.437 }, { "epoch": 1.303117819936445, "grad_norm": 1.546875, "learning_rate": 2.3105350575649924e-05, "loss": 1.0335363388061523, "num_input_tokens_seen": 10473714944, "step": 36830, "train_runtime": 358768.3805, "train_tokens_per_second": 29193.529 }, { "epoch": 1.3034716402001738, "grad_norm": 1.5234375, "learning_rate": 2.31028839790168e-05, "loss": 1.0454877853393554, "num_input_tokens_seen": 10476587264, "step": 36840, "train_runtime": 358864.2343, "train_tokens_per_second": 29193.735 }, { "epoch": 1.3038254604639026, "grad_norm": 1.515625, "learning_rate": 2.310041817217479e-05, "loss": 1.0510156631469727, "num_input_tokens_seen": 10479458496, "step": 36850, "train_runtime": 358961.9824, "train_tokens_per_second": 29193.784 }, { "epoch": 1.3041792807276313, "grad_norm": 1.515625, "learning_rate": 2.3097953154702514e-05, "loss": 1.037264347076416, "num_input_tokens_seen": 10482322368, "step": 36860, "train_runtime": 359059.1948, "train_tokens_per_second": 29193.856 }, { "epoch": 1.30453310099136, "grad_norm": 1.53125, "learning_rate": 2.3095488926178896e-05, "loss": 1.0494277954101563, "num_input_tokens_seen": 10485198720, "step": 36870, "train_runtime": 359157.6535, "train_tokens_per_second": 29193.861 }, { "epoch": 1.3048869212550889, "grad_norm": 1.5390625, "learning_rate": 2.3093025486183175e-05, "loss": 1.0465604782104492, "num_input_tokens_seen": 10488079168, "step": 36880, "train_runtime": 359255.2734, "train_tokens_per_second": 29193.946 }, { "epoch": 1.3052407415188176, "grad_norm": 1.5390625, "learning_rate": 2.3090562834294908e-05, "loss": 1.0376805305480956, "num_input_tokens_seen": 10490917376, "step": 36890, "train_runtime": 359353.3229, "train_tokens_per_second": 29193.879 }, { "epoch": 1.3055945617825464, "grad_norm": 1.5, "learning_rate": 2.3088100970093966e-05, "loss": 1.0495441436767579, "num_input_tokens_seen": 10493685440, "step": 36900, "train_runtime": 359447.878, "train_tokens_per_second": 29193.9 }, { "epoch": 1.3059483820462754, "grad_norm": 1.5390625, "learning_rate": 2.3085639893160527e-05, "loss": 1.0380681037902832, "num_input_tokens_seen": 10496578880, "step": 36910, "train_runtime": 359549.4819, "train_tokens_per_second": 29193.698 }, { "epoch": 1.306302202310004, "grad_norm": 1.609375, "learning_rate": 2.3083179603075084e-05, "loss": 1.0462970733642578, "num_input_tokens_seen": 10499381056, "step": 36920, "train_runtime": 359645.8663, "train_tokens_per_second": 29193.665 }, { "epoch": 1.306656022573733, "grad_norm": 1.484375, "learning_rate": 2.308072009941845e-05, "loss": 1.0414505004882812, "num_input_tokens_seen": 10502223168, "step": 36930, "train_runtime": 359742.3527, "train_tokens_per_second": 29193.736 }, { "epoch": 1.3070098428374615, "grad_norm": 1.53125, "learning_rate": 2.3078261381771748e-05, "loss": 1.0640272140502929, "num_input_tokens_seen": 10505056384, "step": 36940, "train_runtime": 359841.468, "train_tokens_per_second": 29193.568 }, { "epoch": 1.3073636631011905, "grad_norm": 1.453125, "learning_rate": 2.3075803449716407e-05, "loss": 1.0454618453979492, "num_input_tokens_seen": 10507953088, "step": 36950, "train_runtime": 359942.0, "train_tokens_per_second": 29193.462 }, { "epoch": 1.3077174833649192, "grad_norm": 1.53125, "learning_rate": 2.3073346302834174e-05, "loss": 1.0460451126098633, "num_input_tokens_seen": 10510797760, "step": 36960, "train_runtime": 360038.7672, "train_tokens_per_second": 29193.517 }, { "epoch": 1.308071303628648, "grad_norm": 1.5078125, "learning_rate": 2.3070889940707103e-05, "loss": 1.0400960922241211, "num_input_tokens_seen": 10513629440, "step": 36970, "train_runtime": 360133.4219, "train_tokens_per_second": 29193.707 }, { "epoch": 1.3084251238923768, "grad_norm": 1.5390625, "learning_rate": 2.3068434362917562e-05, "loss": 1.0526330947875977, "num_input_tokens_seen": 10516463040, "step": 36980, "train_runtime": 360231.1379, "train_tokens_per_second": 29193.654 }, { "epoch": 1.3087789441561055, "grad_norm": 1.5390625, "learning_rate": 2.3065979569048235e-05, "loss": 1.0522574424743651, "num_input_tokens_seen": 10519315840, "step": 36990, "train_runtime": 360330.1459, "train_tokens_per_second": 29193.549 }, { "epoch": 1.3091327644198343, "grad_norm": 1.5703125, "learning_rate": 2.306352555868211e-05, "loss": 1.0494985580444336, "num_input_tokens_seen": 10522161280, "step": 37000, "train_runtime": 360431.9766, "train_tokens_per_second": 29193.196 }, { "epoch": 1.309486584683563, "grad_norm": 1.578125, "learning_rate": 2.3061072331402486e-05, "loss": 1.0393866539001464, "num_input_tokens_seen": 10525001856, "step": 37010, "train_runtime": 360529.6753, "train_tokens_per_second": 29193.164 }, { "epoch": 1.3098404049472918, "grad_norm": 1.484375, "learning_rate": 2.3058619886792977e-05, "loss": 1.056252670288086, "num_input_tokens_seen": 10527894912, "step": 37020, "train_runtime": 360631.0474, "train_tokens_per_second": 29192.98 }, { "epoch": 1.3101942252110206, "grad_norm": 1.5234375, "learning_rate": 2.30561682244375e-05, "loss": 1.0535904884338378, "num_input_tokens_seen": 10530746304, "step": 37030, "train_runtime": 360728.3462, "train_tokens_per_second": 29193.01 }, { "epoch": 1.3105480454747493, "grad_norm": 1.5234375, "learning_rate": 2.3053717343920285e-05, "loss": 1.0243169784545898, "num_input_tokens_seen": 10533536064, "step": 37040, "train_runtime": 360820.2445, "train_tokens_per_second": 29193.307 }, { "epoch": 1.3109018657384781, "grad_norm": 1.5546875, "learning_rate": 2.3051267244825882e-05, "loss": 1.0444095611572266, "num_input_tokens_seen": 10536402112, "step": 37050, "train_runtime": 360920.2751, "train_tokens_per_second": 29193.157 }, { "epoch": 1.3112556860022069, "grad_norm": 1.5546875, "learning_rate": 2.3048817926739122e-05, "loss": 1.0551862716674805, "num_input_tokens_seen": 10539198208, "step": 37060, "train_runtime": 361015.5745, "train_tokens_per_second": 29193.195 }, { "epoch": 1.3116095062659356, "grad_norm": 1.609375, "learning_rate": 2.3046369389245177e-05, "loss": 1.0470331192016602, "num_input_tokens_seen": 10542040704, "step": 37070, "train_runtime": 361112.5169, "train_tokens_per_second": 29193.23 }, { "epoch": 1.3119633265296646, "grad_norm": 1.53125, "learning_rate": 2.3043921631929502e-05, "loss": 1.0484514236450195, "num_input_tokens_seen": 10544857600, "step": 37080, "train_runtime": 361207.7265, "train_tokens_per_second": 29193.333 }, { "epoch": 1.3123171467933932, "grad_norm": 1.546875, "learning_rate": 2.304147465437788e-05, "loss": 1.0424309730529786, "num_input_tokens_seen": 10547648128, "step": 37090, "train_runtime": 361304.6019, "train_tokens_per_second": 29193.229 }, { "epoch": 1.3126709670571222, "grad_norm": 1.46875, "learning_rate": 2.3039028456176388e-05, "loss": 1.060536003112793, "num_input_tokens_seen": 10550496320, "step": 37100, "train_runtime": 361403.2622, "train_tokens_per_second": 29193.141 }, { "epoch": 1.313024787320851, "grad_norm": 1.515625, "learning_rate": 2.3036583036911418e-05, "loss": 1.049647331237793, "num_input_tokens_seen": 10553359488, "step": 37110, "train_runtime": 361502.7992, "train_tokens_per_second": 29193.023 }, { "epoch": 1.3133786075845797, "grad_norm": 1.53125, "learning_rate": 2.3034138396169667e-05, "loss": 1.0355438232421874, "num_input_tokens_seen": 10556238080, "step": 37120, "train_runtime": 361603.0356, "train_tokens_per_second": 29192.891 }, { "epoch": 1.3137324278483085, "grad_norm": 1.5625, "learning_rate": 2.3031694533538127e-05, "loss": 1.0470772743225099, "num_input_tokens_seen": 10559099584, "step": 37130, "train_runtime": 361699.7392, "train_tokens_per_second": 29192.998 }, { "epoch": 1.3140862481120372, "grad_norm": 1.453125, "learning_rate": 2.302925144860413e-05, "loss": 1.0470949172973634, "num_input_tokens_seen": 10561887616, "step": 37140, "train_runtime": 361791.5918, "train_tokens_per_second": 29193.292 }, { "epoch": 1.314440068375766, "grad_norm": 1.53125, "learning_rate": 2.302680914095527e-05, "loss": 1.0452104568481446, "num_input_tokens_seen": 10564708288, "step": 37150, "train_runtime": 361887.7339, "train_tokens_per_second": 29193.331 }, { "epoch": 1.3147938886394948, "grad_norm": 1.5390625, "learning_rate": 2.3024367610179485e-05, "loss": 1.0486051559448242, "num_input_tokens_seen": 10567546368, "step": 37160, "train_runtime": 361984.4615, "train_tokens_per_second": 29193.37 }, { "epoch": 1.3151477089032235, "grad_norm": 1.5390625, "learning_rate": 2.3021926855864995e-05, "loss": 1.0471332550048829, "num_input_tokens_seen": 10570346432, "step": 37170, "train_runtime": 362078.2656, "train_tokens_per_second": 29193.54 }, { "epoch": 1.3155015291669523, "grad_norm": 1.5234375, "learning_rate": 2.3019486877600337e-05, "loss": 1.0480123519897462, "num_input_tokens_seen": 10573251008, "step": 37180, "train_runtime": 362180.6668, "train_tokens_per_second": 29193.306 }, { "epoch": 1.315855349430681, "grad_norm": 1.6015625, "learning_rate": 2.3017047674974354e-05, "loss": 1.0487049102783204, "num_input_tokens_seen": 10576018752, "step": 37190, "train_runtime": 362275.3999, "train_tokens_per_second": 29193.312 }, { "epoch": 1.3162091696944098, "grad_norm": 1.5859375, "learning_rate": 2.301460924757618e-05, "loss": 1.040346622467041, "num_input_tokens_seen": 10578802304, "step": 37200, "train_runtime": 362367.6879, "train_tokens_per_second": 29193.559 }, { "epoch": 1.3165629899581386, "grad_norm": 1.6015625, "learning_rate": 2.3012171594995272e-05, "loss": 1.059952735900879, "num_input_tokens_seen": 10581651136, "step": 37210, "train_runtime": 362466.1534, "train_tokens_per_second": 29193.488 }, { "epoch": 1.3169168102218674, "grad_norm": 1.5625, "learning_rate": 2.3009734716821385e-05, "loss": 1.0498506546020507, "num_input_tokens_seen": 10584571264, "step": 37220, "train_runtime": 362567.7144, "train_tokens_per_second": 29193.364 }, { "epoch": 1.3172706304855961, "grad_norm": 1.5625, "learning_rate": 2.3007298612644562e-05, "loss": 1.0539627075195312, "num_input_tokens_seen": 10587413376, "step": 37230, "train_runtime": 362663.781, "train_tokens_per_second": 29193.468 }, { "epoch": 1.3176244507493249, "grad_norm": 1.515625, "learning_rate": 2.3004863282055178e-05, "loss": 1.0466215133666992, "num_input_tokens_seen": 10590196160, "step": 37240, "train_runtime": 362758.2299, "train_tokens_per_second": 29193.538 }, { "epoch": 1.3179782710130539, "grad_norm": 1.5546875, "learning_rate": 2.300242872464389e-05, "loss": 1.0482284545898437, "num_input_tokens_seen": 10593082240, "step": 37250, "train_runtime": 362857.7112, "train_tokens_per_second": 29193.488 }, { "epoch": 1.3183320912767824, "grad_norm": 1.484375, "learning_rate": 2.299999494000167e-05, "loss": 1.0472142219543457, "num_input_tokens_seen": 10595914944, "step": 37260, "train_runtime": 362955.8532, "train_tokens_per_second": 29193.399 }, { "epoch": 1.3186859115405114, "grad_norm": 1.5, "learning_rate": 2.299756192771979e-05, "loss": 1.039475917816162, "num_input_tokens_seen": 10598733952, "step": 37270, "train_runtime": 363050.1718, "train_tokens_per_second": 29193.579 }, { "epoch": 1.3190397318042402, "grad_norm": 1.5546875, "learning_rate": 2.299512968738981e-05, "loss": 1.0451589584350587, "num_input_tokens_seen": 10601590592, "step": 37280, "train_runtime": 363149.8771, "train_tokens_per_second": 29193.43 }, { "epoch": 1.319393552067969, "grad_norm": 1.625, "learning_rate": 2.2992698218603617e-05, "loss": 1.0418299674987792, "num_input_tokens_seen": 10604454208, "step": 37290, "train_runtime": 363247.5556, "train_tokens_per_second": 29193.463 }, { "epoch": 1.3197473723316977, "grad_norm": 1.5234375, "learning_rate": 2.2990267520953383e-05, "loss": 1.0479687690734862, "num_input_tokens_seen": 10607281792, "step": 37300, "train_runtime": 363345.4716, "train_tokens_per_second": 29193.378 }, { "epoch": 1.3201011925954265, "grad_norm": 1.5546875, "learning_rate": 2.2987837594031587e-05, "loss": 1.0511348724365235, "num_input_tokens_seen": 10610142208, "step": 37310, "train_runtime": 363444.6193, "train_tokens_per_second": 29193.285 }, { "epoch": 1.3204550128591552, "grad_norm": 1.5, "learning_rate": 2.2985408437431016e-05, "loss": 1.0417060852050781, "num_input_tokens_seen": 10613000000, "step": 37320, "train_runtime": 363540.8964, "train_tokens_per_second": 29193.414 }, { "epoch": 1.320808833122884, "grad_norm": 1.4609375, "learning_rate": 2.2982980050744743e-05, "loss": 1.0559803009033204, "num_input_tokens_seen": 10615812480, "step": 37330, "train_runtime": 363637.1474, "train_tokens_per_second": 29193.421 }, { "epoch": 1.3211626533866128, "grad_norm": 1.4765625, "learning_rate": 2.2980552433566154e-05, "loss": 1.0329368591308594, "num_input_tokens_seen": 10618701824, "step": 37340, "train_runtime": 363738.4774, "train_tokens_per_second": 29193.232 }, { "epoch": 1.3215164736503415, "grad_norm": 1.53125, "learning_rate": 2.297812558548893e-05, "loss": 1.04880952835083, "num_input_tokens_seen": 10621494208, "step": 37350, "train_runtime": 363831.1856, "train_tokens_per_second": 29193.468 }, { "epoch": 1.3218702939140703, "grad_norm": 1.5859375, "learning_rate": 2.2975699506107056e-05, "loss": 1.067913818359375, "num_input_tokens_seen": 10624335168, "step": 37360, "train_runtime": 363930.6256, "train_tokens_per_second": 29193.298 }, { "epoch": 1.322224114177799, "grad_norm": 1.5859375, "learning_rate": 2.2973274195014816e-05, "loss": 1.0308109283447267, "num_input_tokens_seen": 10627284608, "step": 37370, "train_runtime": 364035.4673, "train_tokens_per_second": 29192.992 }, { "epoch": 1.3225779344415278, "grad_norm": 1.484375, "learning_rate": 2.2970849651806796e-05, "loss": 1.049750518798828, "num_input_tokens_seen": 10630163712, "step": 37380, "train_runtime": 364132.7308, "train_tokens_per_second": 29193.101 }, { "epoch": 1.3229317547052566, "grad_norm": 1.5234375, "learning_rate": 2.2968425876077866e-05, "loss": 1.049171543121338, "num_input_tokens_seen": 10633005760, "step": 37390, "train_runtime": 364229.1151, "train_tokens_per_second": 29193.179 }, { "epoch": 1.3232855749689856, "grad_norm": 1.578125, "learning_rate": 2.2966002867423225e-05, "loss": 1.0560935974121093, "num_input_tokens_seen": 10635808064, "step": 37400, "train_runtime": 364326.6627, "train_tokens_per_second": 29193.054 }, { "epoch": 1.3236393952327141, "grad_norm": 1.53125, "learning_rate": 2.296358062543834e-05, "loss": 1.0479181289672852, "num_input_tokens_seen": 10638664576, "step": 37410, "train_runtime": 364426.5396, "train_tokens_per_second": 29192.892 }, { "epoch": 1.323993215496443, "grad_norm": 1.53125, "learning_rate": 2.2961159149718993e-05, "loss": 1.0485272407531738, "num_input_tokens_seen": 10641406976, "step": 37420, "train_runtime": 364518.9866, "train_tokens_per_second": 29193.012 }, { "epoch": 1.3243470357601717, "grad_norm": 1.625, "learning_rate": 2.295873843986126e-05, "loss": 1.052652931213379, "num_input_tokens_seen": 10644213824, "step": 37430, "train_runtime": 364615.4912, "train_tokens_per_second": 29192.983 }, { "epoch": 1.3247008560239006, "grad_norm": 1.5703125, "learning_rate": 2.2956318495461526e-05, "loss": 1.0435104370117188, "num_input_tokens_seen": 10647067776, "step": 37440, "train_runtime": 364714.4911, "train_tokens_per_second": 29192.884 }, { "epoch": 1.3250546762876294, "grad_norm": 1.5859375, "learning_rate": 2.295389931611645e-05, "loss": 1.0460174560546875, "num_input_tokens_seen": 10649914880, "step": 37450, "train_runtime": 364810.0318, "train_tokens_per_second": 29193.043 }, { "epoch": 1.3254084965513582, "grad_norm": 1.5234375, "learning_rate": 2.2951480901423017e-05, "loss": 1.0481403350830079, "num_input_tokens_seen": 10652834368, "step": 37460, "train_runtime": 364912.1996, "train_tokens_per_second": 29192.87 }, { "epoch": 1.325762316815087, "grad_norm": 1.5625, "learning_rate": 2.294906325097848e-05, "loss": 1.0586639404296876, "num_input_tokens_seen": 10655695232, "step": 37470, "train_runtime": 365009.8971, "train_tokens_per_second": 29192.894 }, { "epoch": 1.3261161370788157, "grad_norm": 1.5234375, "learning_rate": 2.2946646364380415e-05, "loss": 1.0358417510986329, "num_input_tokens_seen": 10658500800, "step": 37480, "train_runtime": 365106.6769, "train_tokens_per_second": 29192.84 }, { "epoch": 1.3264699573425445, "grad_norm": 1.5859375, "learning_rate": 2.294423024122668e-05, "loss": 1.0429515838623047, "num_input_tokens_seen": 10661347136, "step": 37490, "train_runtime": 365204.6142, "train_tokens_per_second": 29192.805 }, { "epoch": 1.3268237776062732, "grad_norm": 1.6171875, "learning_rate": 2.2941814881115428e-05, "loss": 1.0570093154907227, "num_input_tokens_seen": 10664161344, "step": 37500, "train_runtime": 365301.5558, "train_tokens_per_second": 29192.762 }, { "epoch": 1.327177597870002, "grad_norm": 1.46875, "learning_rate": 2.293940028364512e-05, "loss": 1.0468643188476563, "num_input_tokens_seen": 10666978752, "step": 37510, "train_runtime": 365399.3638, "train_tokens_per_second": 29192.658 }, { "epoch": 1.3275314181337308, "grad_norm": 1.5546875, "learning_rate": 2.2936986448414498e-05, "loss": 1.0379514694213867, "num_input_tokens_seen": 10669854080, "step": 37520, "train_runtime": 365496.4374, "train_tokens_per_second": 29192.772 }, { "epoch": 1.3278852383974595, "grad_norm": 1.5859375, "learning_rate": 2.2934573375022613e-05, "loss": 1.0594658851623535, "num_input_tokens_seen": 10672654272, "step": 37530, "train_runtime": 365593.325, "train_tokens_per_second": 29192.695 }, { "epoch": 1.3282390586611883, "grad_norm": 1.5546875, "learning_rate": 2.2932161063068803e-05, "loss": 1.0419137954711915, "num_input_tokens_seen": 10675512896, "step": 37540, "train_runtime": 365691.8176, "train_tokens_per_second": 29192.649 }, { "epoch": 1.328592878924917, "grad_norm": 1.59375, "learning_rate": 2.29297495121527e-05, "loss": 1.0442682266235352, "num_input_tokens_seen": 10678393792, "step": 37550, "train_runtime": 365790.8259, "train_tokens_per_second": 29192.623 }, { "epoch": 1.3289466991886458, "grad_norm": 1.5078125, "learning_rate": 2.2927338721874245e-05, "loss": 1.0362014770507812, "num_input_tokens_seen": 10681257408, "step": 37560, "train_runtime": 365889.998, "train_tokens_per_second": 29192.537 }, { "epoch": 1.3293005194523748, "grad_norm": 1.6171875, "learning_rate": 2.2924928691833646e-05, "loss": 1.0445623397827148, "num_input_tokens_seen": 10684109248, "step": 37570, "train_runtime": 365986.626, "train_tokens_per_second": 29192.622 }, { "epoch": 1.3296543397161034, "grad_norm": 1.5625, "learning_rate": 2.292251942163143e-05, "loss": 1.0484098434448241, "num_input_tokens_seen": 10686949504, "step": 37580, "train_runtime": 366087.4075, "train_tokens_per_second": 29192.344 }, { "epoch": 1.3300081599798323, "grad_norm": 1.4921875, "learning_rate": 2.292011091086841e-05, "loss": 1.0334796905517578, "num_input_tokens_seen": 10689757504, "step": 37590, "train_runtime": 366181.5396, "train_tokens_per_second": 29192.508 }, { "epoch": 1.330361980243561, "grad_norm": 1.5078125, "learning_rate": 2.291770315914569e-05, "loss": 1.0423398971557618, "num_input_tokens_seen": 10692563456, "step": 37600, "train_runtime": 366277.8288, "train_tokens_per_second": 29192.494 }, { "epoch": 1.3307158005072899, "grad_norm": 1.4921875, "learning_rate": 2.291529616606466e-05, "loss": 1.0493038177490235, "num_input_tokens_seen": 10695440576, "step": 37610, "train_runtime": 366376.3963, "train_tokens_per_second": 29192.494 }, { "epoch": 1.3310696207710186, "grad_norm": 1.4921875, "learning_rate": 2.291288993122703e-05, "loss": 1.0501667976379394, "num_input_tokens_seen": 10698309440, "step": 37620, "train_runtime": 366472.7048, "train_tokens_per_second": 29192.65 }, { "epoch": 1.3314234410347474, "grad_norm": 1.5625, "learning_rate": 2.291048445423477e-05, "loss": 1.048077392578125, "num_input_tokens_seen": 10701123648, "step": 37630, "train_runtime": 366568.6515, "train_tokens_per_second": 29192.686 }, { "epoch": 1.3317772612984762, "grad_norm": 1.484375, "learning_rate": 2.2908079734690165e-05, "loss": 1.0443392753601075, "num_input_tokens_seen": 10704008128, "step": 37640, "train_runtime": 366670.0941, "train_tokens_per_second": 29192.477 }, { "epoch": 1.332131081562205, "grad_norm": 1.6171875, "learning_rate": 2.290567577219578e-05, "loss": 1.0704610824584961, "num_input_tokens_seen": 10706837312, "step": 37650, "train_runtime": 366769.1874, "train_tokens_per_second": 29192.303 }, { "epoch": 1.3324849018259337, "grad_norm": 1.5234375, "learning_rate": 2.2903272566354474e-05, "loss": 1.042983627319336, "num_input_tokens_seen": 10709667584, "step": 37660, "train_runtime": 366865.0044, "train_tokens_per_second": 29192.394 }, { "epoch": 1.3328387220896625, "grad_norm": 1.46875, "learning_rate": 2.2900870116769398e-05, "loss": 1.0343786239624024, "num_input_tokens_seen": 10712546048, "step": 37670, "train_runtime": 366964.9715, "train_tokens_per_second": 29192.285 }, { "epoch": 1.3331925423533912, "grad_norm": 1.5546875, "learning_rate": 2.289846842304401e-05, "loss": 1.043423557281494, "num_input_tokens_seen": 10715385920, "step": 37680, "train_runtime": 367057.8568, "train_tokens_per_second": 29192.635 }, { "epoch": 1.33354636261712, "grad_norm": 1.5546875, "learning_rate": 2.2896067484782027e-05, "loss": 1.050009822845459, "num_input_tokens_seen": 10718208256, "step": 37690, "train_runtime": 367154.1342, "train_tokens_per_second": 29192.667 }, { "epoch": 1.3339001828808488, "grad_norm": 1.578125, "learning_rate": 2.2893667301587484e-05, "loss": 1.0511722564697266, "num_input_tokens_seen": 10721053248, "step": 37700, "train_runtime": 367249.7636, "train_tokens_per_second": 29192.812 }, { "epoch": 1.3342540031445775, "grad_norm": 1.5078125, "learning_rate": 2.28912678730647e-05, "loss": 1.0508247375488282, "num_input_tokens_seen": 10723918528, "step": 37710, "train_runtime": 367347.8904, "train_tokens_per_second": 29192.814 }, { "epoch": 1.3346078234083063, "grad_norm": 1.5859375, "learning_rate": 2.2888869198818276e-05, "loss": 1.0328415870666503, "num_input_tokens_seen": 10726782400, "step": 37720, "train_runtime": 367446.9201, "train_tokens_per_second": 29192.74 }, { "epoch": 1.334961643672035, "grad_norm": 1.578125, "learning_rate": 2.288647127845311e-05, "loss": 1.0424562454223634, "num_input_tokens_seen": 10729592704, "step": 37730, "train_runtime": 367541.9129, "train_tokens_per_second": 29192.841 }, { "epoch": 1.335315463935764, "grad_norm": 1.5234375, "learning_rate": 2.2884074111574384e-05, "loss": 1.0430944442749024, "num_input_tokens_seen": 10732409408, "step": 37740, "train_runtime": 367636.6224, "train_tokens_per_second": 29192.982 }, { "epoch": 1.3356692841994926, "grad_norm": 1.515625, "learning_rate": 2.2881677697787584e-05, "loss": 1.0337045669555665, "num_input_tokens_seen": 10735275520, "step": 37750, "train_runtime": 367736.6107, "train_tokens_per_second": 29192.839 }, { "epoch": 1.3360231044632216, "grad_norm": 1.5546875, "learning_rate": 2.2879282036698465e-05, "loss": 1.049667739868164, "num_input_tokens_seen": 10738120000, "step": 37760, "train_runtime": 367832.9363, "train_tokens_per_second": 29192.927 }, { "epoch": 1.3363769247269501, "grad_norm": 1.5703125, "learning_rate": 2.2876887127913084e-05, "loss": 1.0456581115722656, "num_input_tokens_seen": 10740943936, "step": 37770, "train_runtime": 367931.2216, "train_tokens_per_second": 29192.804 }, { "epoch": 1.3367307449906791, "grad_norm": 1.6015625, "learning_rate": 2.2874492971037785e-05, "loss": 1.0321878433227538, "num_input_tokens_seen": 10743787392, "step": 37780, "train_runtime": 368027.5706, "train_tokens_per_second": 29192.887 }, { "epoch": 1.3370845652544079, "grad_norm": 1.515625, "learning_rate": 2.2872099565679195e-05, "loss": 1.0337953567504883, "num_input_tokens_seen": 10746590016, "step": 37790, "train_runtime": 368121.1745, "train_tokens_per_second": 29193.078 }, { "epoch": 1.3374383855181367, "grad_norm": 1.5625, "learning_rate": 2.2869706911444235e-05, "loss": 1.0514656066894532, "num_input_tokens_seen": 10749435136, "step": 37800, "train_runtime": 368216.9394, "train_tokens_per_second": 29193.212 }, { "epoch": 1.3377922057818654, "grad_norm": 1.5625, "learning_rate": 2.286731500794011e-05, "loss": 1.0550714492797852, "num_input_tokens_seen": 10752276416, "step": 37810, "train_runtime": 368317.9765, "train_tokens_per_second": 29192.918 }, { "epoch": 1.3381460260455942, "grad_norm": 1.5234375, "learning_rate": 2.2864923854774315e-05, "loss": 1.0470369338989258, "num_input_tokens_seen": 10755136384, "step": 37820, "train_runtime": 368413.7625, "train_tokens_per_second": 29193.091 }, { "epoch": 1.338499846309323, "grad_norm": 1.5859375, "learning_rate": 2.286253345155463e-05, "loss": 1.053567886352539, "num_input_tokens_seen": 10758000256, "step": 37830, "train_runtime": 368510.5016, "train_tokens_per_second": 29193.199 }, { "epoch": 1.3388536665730517, "grad_norm": 1.484375, "learning_rate": 2.286014379788912e-05, "loss": 1.0579944610595704, "num_input_tokens_seen": 10760865920, "step": 37840, "train_runtime": 368609.1138, "train_tokens_per_second": 29193.163 }, { "epoch": 1.3392074868367805, "grad_norm": 1.53125, "learning_rate": 2.285775489338615e-05, "loss": 1.0434446334838867, "num_input_tokens_seen": 10763731520, "step": 37850, "train_runtime": 368709.1949, "train_tokens_per_second": 29193.011 }, { "epoch": 1.3395613071005092, "grad_norm": 1.5625, "learning_rate": 2.285536673765435e-05, "loss": 1.0287858963012695, "num_input_tokens_seen": 10766653312, "step": 37860, "train_runtime": 368811.8285, "train_tokens_per_second": 29192.809 }, { "epoch": 1.339915127364238, "grad_norm": 1.546875, "learning_rate": 2.285297933030265e-05, "loss": 1.0378787994384766, "num_input_tokens_seen": 10769527616, "step": 37870, "train_runtime": 368910.9243, "train_tokens_per_second": 29192.759 }, { "epoch": 1.3402689476279668, "grad_norm": 1.6015625, "learning_rate": 2.2850592670940272e-05, "loss": 1.0429025650024415, "num_input_tokens_seen": 10772364544, "step": 37880, "train_runtime": 369007.365, "train_tokens_per_second": 29192.817 }, { "epoch": 1.3406227678916955, "grad_norm": 1.53125, "learning_rate": 2.2848206759176703e-05, "loss": 1.0434407234191894, "num_input_tokens_seen": 10775186496, "step": 37890, "train_runtime": 369100.4314, "train_tokens_per_second": 29193.102 }, { "epoch": 1.3409765881554243, "grad_norm": 1.5078125, "learning_rate": 2.284582159462173e-05, "loss": 1.0480441093444823, "num_input_tokens_seen": 10778001152, "step": 37900, "train_runtime": 369195.2968, "train_tokens_per_second": 29193.224 }, { "epoch": 1.3413304084191533, "grad_norm": 1.546875, "learning_rate": 2.284343717688543e-05, "loss": 1.0453269958496094, "num_input_tokens_seen": 10780771584, "step": 37910, "train_runtime": 369287.2883, "train_tokens_per_second": 29193.454 }, { "epoch": 1.3416842286828818, "grad_norm": 1.5078125, "learning_rate": 2.284105350557815e-05, "loss": 1.0328609466552734, "num_input_tokens_seen": 10783595904, "step": 37920, "train_runtime": 369383.1361, "train_tokens_per_second": 29193.525 }, { "epoch": 1.3420380489466108, "grad_norm": 1.515625, "learning_rate": 2.2838670580310526e-05, "loss": 1.039613914489746, "num_input_tokens_seen": 10786434432, "step": 37930, "train_runtime": 369481.2058, "train_tokens_per_second": 29193.459 }, { "epoch": 1.3423918692103396, "grad_norm": 1.5546875, "learning_rate": 2.283628840069349e-05, "loss": 1.0377912521362305, "num_input_tokens_seen": 10789229440, "step": 37940, "train_runtime": 369579.1883, "train_tokens_per_second": 29193.282 }, { "epoch": 1.3427456894740684, "grad_norm": 1.53125, "learning_rate": 2.2833906966338237e-05, "loss": 1.0440091133117675, "num_input_tokens_seen": 10792035136, "step": 37950, "train_runtime": 369672.9616, "train_tokens_per_second": 29193.466 }, { "epoch": 1.3430995097377971, "grad_norm": 1.578125, "learning_rate": 2.2831526276856274e-05, "loss": 1.037813663482666, "num_input_tokens_seen": 10794873920, "step": 37960, "train_runtime": 369770.0977, "train_tokens_per_second": 29193.475 }, { "epoch": 1.343453330001526, "grad_norm": 1.5, "learning_rate": 2.282914633185936e-05, "loss": 1.061992359161377, "num_input_tokens_seen": 10797723776, "step": 37970, "train_runtime": 369866.8627, "train_tokens_per_second": 29193.542 }, { "epoch": 1.3438071502652547, "grad_norm": 1.6015625, "learning_rate": 2.282676713095956e-05, "loss": 1.044581127166748, "num_input_tokens_seen": 10800582464, "step": 37980, "train_runtime": 369964.185, "train_tokens_per_second": 29193.589 }, { "epoch": 1.3441609705289834, "grad_norm": 1.59375, "learning_rate": 2.2824388673769212e-05, "loss": 1.0455829620361328, "num_input_tokens_seen": 10803405056, "step": 37990, "train_runtime": 370061.1766, "train_tokens_per_second": 29193.565 }, { "epoch": 1.3445147907927122, "grad_norm": 1.5234375, "learning_rate": 2.282201095990094e-05, "loss": 1.0459413528442383, "num_input_tokens_seen": 10806262080, "step": 38000, "train_runtime": 370157.6813, "train_tokens_per_second": 29193.672 }, { "epoch": 1.344868611056441, "grad_norm": 1.546875, "learning_rate": 2.281963398896765e-05, "loss": 1.048223114013672, "num_input_tokens_seen": 10809123968, "step": 38010, "train_runtime": 370256.9081, "train_tokens_per_second": 29193.578 }, { "epoch": 1.3452224313201697, "grad_norm": 1.6015625, "learning_rate": 2.281725776058253e-05, "loss": 1.0246917724609375, "num_input_tokens_seen": 10812005120, "step": 38020, "train_runtime": 370357.3558, "train_tokens_per_second": 29193.44 }, { "epoch": 1.3455762515838985, "grad_norm": 1.5390625, "learning_rate": 2.2814882274359045e-05, "loss": 1.0537096977233886, "num_input_tokens_seen": 10814812608, "step": 38030, "train_runtime": 370452.8941, "train_tokens_per_second": 29193.489 }, { "epoch": 1.3459300718476273, "grad_norm": 1.46875, "learning_rate": 2.2812507529910955e-05, "loss": 1.0459613800048828, "num_input_tokens_seen": 10817676160, "step": 38040, "train_runtime": 370554.17, "train_tokens_per_second": 29193.238 }, { "epoch": 1.346283892111356, "grad_norm": 1.5, "learning_rate": 2.2810133526852288e-05, "loss": 1.0511150360107422, "num_input_tokens_seen": 10820531584, "step": 38050, "train_runtime": 370649.4579, "train_tokens_per_second": 29193.437 }, { "epoch": 1.3466377123750848, "grad_norm": 1.5390625, "learning_rate": 2.2807760264797352e-05, "loss": 1.0667016983032227, "num_input_tokens_seen": 10823374656, "step": 38060, "train_runtime": 370744.4697, "train_tokens_per_second": 29193.624 }, { "epoch": 1.3469915326388135, "grad_norm": 1.4921875, "learning_rate": 2.280538774336075e-05, "loss": 1.0343782424926757, "num_input_tokens_seen": 10826221568, "step": 38070, "train_runtime": 370840.817, "train_tokens_per_second": 29193.716 }, { "epoch": 1.3473453529025425, "grad_norm": 1.5859375, "learning_rate": 2.280301596215735e-05, "loss": 1.0547415733337402, "num_input_tokens_seen": 10829106240, "step": 38080, "train_runtime": 370939.8092, "train_tokens_per_second": 29193.702 }, { "epoch": 1.347699173166271, "grad_norm": 1.53125, "learning_rate": 2.280064492080231e-05, "loss": 1.0488555908203125, "num_input_tokens_seen": 10831973376, "step": 38090, "train_runtime": 371041.1952, "train_tokens_per_second": 29193.452 }, { "epoch": 1.34805299343, "grad_norm": 1.5390625, "learning_rate": 2.2798274618911075e-05, "loss": 1.0483903884887695, "num_input_tokens_seen": 10834827968, "step": 38100, "train_runtime": 371140.0945, "train_tokens_per_second": 29193.364 }, { "epoch": 1.3484068136937288, "grad_norm": 1.5859375, "learning_rate": 2.2795905056099345e-05, "loss": 1.051621913909912, "num_input_tokens_seen": 10837663360, "step": 38110, "train_runtime": 371233.7794, "train_tokens_per_second": 29193.635 }, { "epoch": 1.3487606339574576, "grad_norm": 1.546875, "learning_rate": 2.2793536231983123e-05, "loss": 1.0459112167358398, "num_input_tokens_seen": 10840504384, "step": 38120, "train_runtime": 371331.5169, "train_tokens_per_second": 29193.602 }, { "epoch": 1.3491144542211864, "grad_norm": 1.59375, "learning_rate": 2.279116814617868e-05, "loss": 1.0426649093627929, "num_input_tokens_seen": 10843375552, "step": 38130, "train_runtime": 371430.7151, "train_tokens_per_second": 29193.535 }, { "epoch": 1.3494682744849151, "grad_norm": 1.578125, "learning_rate": 2.278880079830257e-05, "loss": 1.0565378189086914, "num_input_tokens_seen": 10846235072, "step": 38140, "train_runtime": 371525.0632, "train_tokens_per_second": 29193.818 }, { "epoch": 1.349822094748644, "grad_norm": 1.578125, "learning_rate": 2.278643418797163e-05, "loss": 1.0484249114990234, "num_input_tokens_seen": 10849056384, "step": 38150, "train_runtime": 371619.5522, "train_tokens_per_second": 29193.987 }, { "epoch": 1.3501759150123727, "grad_norm": 1.6171875, "learning_rate": 2.2784068314802963e-05, "loss": 1.0410048484802246, "num_input_tokens_seen": 10851937984, "step": 38160, "train_runtime": 371721.2599, "train_tokens_per_second": 29193.751 }, { "epoch": 1.3505297352761014, "grad_norm": 1.5546875, "learning_rate": 2.278170317841396e-05, "loss": 1.0485618591308594, "num_input_tokens_seen": 10854759168, "step": 38170, "train_runtime": 371816.2537, "train_tokens_per_second": 29193.88 }, { "epoch": 1.3508835555398302, "grad_norm": 1.5234375, "learning_rate": 2.2779338778422287e-05, "loss": 1.0510879516601563, "num_input_tokens_seen": 10857565568, "step": 38180, "train_runtime": 371913.2779, "train_tokens_per_second": 29193.81 }, { "epoch": 1.351237375803559, "grad_norm": 1.5859375, "learning_rate": 2.2776975114445885e-05, "loss": 1.0606042861938476, "num_input_tokens_seen": 10860431872, "step": 38190, "train_runtime": 372013.3595, "train_tokens_per_second": 29193.661 }, { "epoch": 1.3515911960672877, "grad_norm": 1.5234375, "learning_rate": 2.2774612186102988e-05, "loss": 1.0492417335510253, "num_input_tokens_seen": 10863265536, "step": 38200, "train_runtime": 372109.4626, "train_tokens_per_second": 29193.736 }, { "epoch": 1.3519450163310165, "grad_norm": 1.578125, "learning_rate": 2.277224999301208e-05, "loss": 1.0515697479248047, "num_input_tokens_seen": 10866100608, "step": 38210, "train_runtime": 372207.8186, "train_tokens_per_second": 29193.639 }, { "epoch": 1.3522988365947453, "grad_norm": 1.5078125, "learning_rate": 2.276988853479194e-05, "loss": 1.0494285583496095, "num_input_tokens_seen": 10868931328, "step": 38220, "train_runtime": 372308.2573, "train_tokens_per_second": 29193.366 }, { "epoch": 1.352652656858474, "grad_norm": 1.6484375, "learning_rate": 2.2767527811061636e-05, "loss": 1.0398226737976075, "num_input_tokens_seen": 10871714048, "step": 38230, "train_runtime": 372401.8912, "train_tokens_per_second": 29193.498 }, { "epoch": 1.3530064771222028, "grad_norm": 1.5625, "learning_rate": 2.2765167821440473e-05, "loss": 1.0515054702758788, "num_input_tokens_seen": 10874593664, "step": 38240, "train_runtime": 372500.9422, "train_tokens_per_second": 29193.466 }, { "epoch": 1.3533602973859318, "grad_norm": 1.5625, "learning_rate": 2.2762808565548063e-05, "loss": 1.0365448951721192, "num_input_tokens_seen": 10877424960, "step": 38250, "train_runtime": 372598.4795, "train_tokens_per_second": 29193.423 }, { "epoch": 1.3537141176496603, "grad_norm": 1.484375, "learning_rate": 2.2760450043004303e-05, "loss": 1.0534202575683593, "num_input_tokens_seen": 10880254464, "step": 38260, "train_runtime": 372696.0432, "train_tokens_per_second": 29193.373 }, { "epoch": 1.3540679379133893, "grad_norm": 1.5546875, "learning_rate": 2.2758092253429327e-05, "loss": 1.0417467117309571, "num_input_tokens_seen": 10883046016, "step": 38270, "train_runtime": 372789.3301, "train_tokens_per_second": 29193.556 }, { "epoch": 1.354421758177118, "grad_norm": 1.5, "learning_rate": 2.2755735196443585e-05, "loss": 1.0656957626342773, "num_input_tokens_seen": 10885894336, "step": 38280, "train_runtime": 372887.323, "train_tokens_per_second": 29193.522 }, { "epoch": 1.3547755784408468, "grad_norm": 1.5234375, "learning_rate": 2.2753378871667773e-05, "loss": 1.0613719940185546, "num_input_tokens_seen": 10888731584, "step": 38290, "train_runtime": 372984.4191, "train_tokens_per_second": 29193.529 }, { "epoch": 1.3551293987045756, "grad_norm": 1.6171875, "learning_rate": 2.275102327872288e-05, "loss": 1.0681971549987792, "num_input_tokens_seen": 10891600512, "step": 38300, "train_runtime": 373082.1422, "train_tokens_per_second": 29193.572 }, { "epoch": 1.3554832189683044, "grad_norm": 1.5234375, "learning_rate": 2.274866841723015e-05, "loss": 1.0517045974731445, "num_input_tokens_seen": 10894444864, "step": 38310, "train_runtime": 373176.4523, "train_tokens_per_second": 29193.816 }, { "epoch": 1.3558370392320331, "grad_norm": 1.515625, "learning_rate": 2.2746314286811134e-05, "loss": 1.052298355102539, "num_input_tokens_seen": 10897268608, "step": 38320, "train_runtime": 373274.0634, "train_tokens_per_second": 29193.747 }, { "epoch": 1.356190859495762, "grad_norm": 1.5703125, "learning_rate": 2.2743960887087616e-05, "loss": 1.0525511741638183, "num_input_tokens_seen": 10900054720, "step": 38330, "train_runtime": 373368.1292, "train_tokens_per_second": 29193.854 }, { "epoch": 1.3565446797594907, "grad_norm": 1.625, "learning_rate": 2.274160821768169e-05, "loss": 1.053469181060791, "num_input_tokens_seen": 10902898240, "step": 38340, "train_runtime": 373467.0976, "train_tokens_per_second": 29193.732 }, { "epoch": 1.3568985000232194, "grad_norm": 1.6328125, "learning_rate": 2.2739256278215697e-05, "loss": 1.0391500473022461, "num_input_tokens_seen": 10905727360, "step": 38350, "train_runtime": 373564.9207, "train_tokens_per_second": 29193.66 }, { "epoch": 1.3572523202869482, "grad_norm": 1.609375, "learning_rate": 2.273690506831227e-05, "loss": 1.0450399398803711, "num_input_tokens_seen": 10908560768, "step": 38360, "train_runtime": 373663.0007, "train_tokens_per_second": 29193.58 }, { "epoch": 1.357606140550677, "grad_norm": 1.53125, "learning_rate": 2.273455458759431e-05, "loss": 1.0413854598999024, "num_input_tokens_seen": 10911420800, "step": 38370, "train_runtime": 373759.5785, "train_tokens_per_second": 29193.689 }, { "epoch": 1.3579599608144057, "grad_norm": 1.5703125, "learning_rate": 2.2732204835684982e-05, "loss": 1.0510250091552735, "num_input_tokens_seen": 10914297472, "step": 38380, "train_runtime": 373858.6826, "train_tokens_per_second": 29193.644 }, { "epoch": 1.3583137810781345, "grad_norm": 1.6171875, "learning_rate": 2.2729855812207737e-05, "loss": 1.0506999015808105, "num_input_tokens_seen": 10917116480, "step": 38390, "train_runtime": 373955.0688, "train_tokens_per_second": 29193.658 }, { "epoch": 1.3586676013418635, "grad_norm": 1.5703125, "learning_rate": 2.272750751678628e-05, "loss": 1.0377120971679688, "num_input_tokens_seen": 10919937344, "step": 38400, "train_runtime": 374051.3085, "train_tokens_per_second": 29193.688 }, { "epoch": 1.359021421605592, "grad_norm": 1.5, "learning_rate": 2.2725159949044613e-05, "loss": 1.047859001159668, "num_input_tokens_seen": 10922721856, "step": 38410, "train_runtime": 374145.1381, "train_tokens_per_second": 29193.809 }, { "epoch": 1.359375241869321, "grad_norm": 1.515625, "learning_rate": 2.2722813108606992e-05, "loss": 1.0343412399291991, "num_input_tokens_seen": 10925587264, "step": 38420, "train_runtime": 374242.3586, "train_tokens_per_second": 29193.882 }, { "epoch": 1.3597290621330496, "grad_norm": 1.4921875, "learning_rate": 2.2720466995097943e-05, "loss": 1.0416072845458983, "num_input_tokens_seen": 10928521728, "step": 38430, "train_runtime": 374347.2622, "train_tokens_per_second": 29193.54 }, { "epoch": 1.3600828823967785, "grad_norm": 1.59375, "learning_rate": 2.271812160814228e-05, "loss": 1.0476009368896484, "num_input_tokens_seen": 10931379456, "step": 38440, "train_runtime": 374447.9188, "train_tokens_per_second": 29193.324 }, { "epoch": 1.3604367026605073, "grad_norm": 1.5546875, "learning_rate": 2.2715776947365065e-05, "loss": 1.0585382461547852, "num_input_tokens_seen": 10934192128, "step": 38450, "train_runtime": 374539.358, "train_tokens_per_second": 29193.707 }, { "epoch": 1.360790522924236, "grad_norm": 1.4921875, "learning_rate": 2.2713433012391654e-05, "loss": 1.0478019714355469, "num_input_tokens_seen": 10936995136, "step": 38460, "train_runtime": 374633.7215, "train_tokens_per_second": 29193.835 }, { "epoch": 1.3611443431879648, "grad_norm": 1.5625, "learning_rate": 2.2711089802847657e-05, "loss": 1.0317276000976563, "num_input_tokens_seen": 10939837696, "step": 38470, "train_runtime": 374732.4047, "train_tokens_per_second": 29193.733 }, { "epoch": 1.3614981634516936, "grad_norm": 1.5859375, "learning_rate": 2.270874731835896e-05, "loss": 1.0454461097717285, "num_input_tokens_seen": 10942637888, "step": 38480, "train_runtime": 374828.7685, "train_tokens_per_second": 29193.698 }, { "epoch": 1.3618519837154224, "grad_norm": 1.609375, "learning_rate": 2.270640555855172e-05, "loss": 1.0558258056640626, "num_input_tokens_seen": 10945469248, "step": 38490, "train_runtime": 374925.7918, "train_tokens_per_second": 29193.695 }, { "epoch": 1.3622058039791511, "grad_norm": 1.578125, "learning_rate": 2.2704064523052372e-05, "loss": 1.0441680908203126, "num_input_tokens_seen": 10948361600, "step": 38500, "train_runtime": 375029.288, "train_tokens_per_second": 29193.351 }, { "epoch": 1.36255962424288, "grad_norm": 1.59375, "learning_rate": 2.270172421148759e-05, "loss": 1.0511001586914062, "num_input_tokens_seen": 10951189440, "step": 38510, "train_runtime": 375126.0481, "train_tokens_per_second": 29193.359 }, { "epoch": 1.3629134445066087, "grad_norm": 1.5625, "learning_rate": 2.269938462348436e-05, "loss": 1.056480598449707, "num_input_tokens_seen": 10954091712, "step": 38520, "train_runtime": 375224.5522, "train_tokens_per_second": 29193.43 }, { "epoch": 1.3632672647703374, "grad_norm": 1.5390625, "learning_rate": 2.26970457586699e-05, "loss": 1.0521228790283204, "num_input_tokens_seen": 10956958592, "step": 38530, "train_runtime": 375321.4768, "train_tokens_per_second": 29193.529 }, { "epoch": 1.3636210850340662, "grad_norm": 1.5234375, "learning_rate": 2.2694707616671726e-05, "loss": 1.0505373001098632, "num_input_tokens_seen": 10959828992, "step": 38540, "train_runtime": 375419.0815, "train_tokens_per_second": 29193.585 }, { "epoch": 1.363974905297795, "grad_norm": 1.609375, "learning_rate": 2.2692370197117605e-05, "loss": 1.0515336990356445, "num_input_tokens_seen": 10962646848, "step": 38550, "train_runtime": 375515.2586, "train_tokens_per_second": 29193.612 }, { "epoch": 1.3643287255615237, "grad_norm": 1.5, "learning_rate": 2.269003349963557e-05, "loss": 1.0415372848510742, "num_input_tokens_seen": 10965488256, "step": 38560, "train_runtime": 375609.6036, "train_tokens_per_second": 29193.844 }, { "epoch": 1.3646825458252527, "grad_norm": 1.53125, "learning_rate": 2.268769752385393e-05, "loss": 1.0393760681152344, "num_input_tokens_seen": 10968309696, "step": 38570, "train_runtime": 375704.4204, "train_tokens_per_second": 29193.986 }, { "epoch": 1.3650363660889813, "grad_norm": 1.578125, "learning_rate": 2.2685362269401272e-05, "loss": 1.0394875526428222, "num_input_tokens_seen": 10971198272, "step": 38580, "train_runtime": 375801.7905, "train_tokens_per_second": 29194.109 }, { "epoch": 1.3653901863527103, "grad_norm": 1.53125, "learning_rate": 2.268302773590643e-05, "loss": 1.0530092239379882, "num_input_tokens_seen": 10974057664, "step": 38590, "train_runtime": 375900.1359, "train_tokens_per_second": 29194.077 }, { "epoch": 1.3657440066164388, "grad_norm": 1.4921875, "learning_rate": 2.268069392299851e-05, "loss": 1.0489792823791504, "num_input_tokens_seen": 10976914496, "step": 38600, "train_runtime": 375998.6722, "train_tokens_per_second": 29194.025 }, { "epoch": 1.3660978268801678, "grad_norm": 1.59375, "learning_rate": 2.267836083030689e-05, "loss": 1.0627403259277344, "num_input_tokens_seen": 10979768960, "step": 38610, "train_runtime": 376097.7373, "train_tokens_per_second": 29193.925 }, { "epoch": 1.3664516471438966, "grad_norm": 1.484375, "learning_rate": 2.2676028457461225e-05, "loss": 1.0449098587036132, "num_input_tokens_seen": 10982613952, "step": 38620, "train_runtime": 376194.9781, "train_tokens_per_second": 29193.941 }, { "epoch": 1.3668054674076253, "grad_norm": 1.5390625, "learning_rate": 2.2673696804091418e-05, "loss": 1.0404308319091797, "num_input_tokens_seen": 10985410048, "step": 38630, "train_runtime": 376288.0843, "train_tokens_per_second": 29194.148 }, { "epoch": 1.367159287671354, "grad_norm": 1.546875, "learning_rate": 2.267136586982764e-05, "loss": 1.0431385040283203, "num_input_tokens_seen": 10988300032, "step": 38640, "train_runtime": 376386.8052, "train_tokens_per_second": 29194.169 }, { "epoch": 1.3675131079350829, "grad_norm": 1.625, "learning_rate": 2.2669035654300346e-05, "loss": 1.0358546257019043, "num_input_tokens_seen": 10991144128, "step": 38650, "train_runtime": 376486.0268, "train_tokens_per_second": 29194.029 }, { "epoch": 1.3678669281988116, "grad_norm": 1.5625, "learning_rate": 2.2666706157140242e-05, "loss": 1.027207374572754, "num_input_tokens_seen": 10994020800, "step": 38660, "train_runtime": 376585.362, "train_tokens_per_second": 29193.967 }, { "epoch": 1.3682207484625404, "grad_norm": 1.5234375, "learning_rate": 2.2664377377978295e-05, "loss": 1.0363803863525392, "num_input_tokens_seen": 10996851072, "step": 38670, "train_runtime": 376682.111, "train_tokens_per_second": 29193.983 }, { "epoch": 1.3685745687262691, "grad_norm": 1.59375, "learning_rate": 2.2662049316445754e-05, "loss": 1.0493412017822266, "num_input_tokens_seen": 10999660864, "step": 38680, "train_runtime": 376776.5831, "train_tokens_per_second": 29194.12 }, { "epoch": 1.368928388989998, "grad_norm": 1.5234375, "learning_rate": 2.2659721972174117e-05, "loss": 1.0513843536376952, "num_input_tokens_seen": 11002482368, "step": 38690, "train_runtime": 376873.9076, "train_tokens_per_second": 29194.068 }, { "epoch": 1.3692822092537267, "grad_norm": 1.546875, "learning_rate": 2.2657395344795153e-05, "loss": 1.055150604248047, "num_input_tokens_seen": 11005339264, "step": 38700, "train_runtime": 376971.9183, "train_tokens_per_second": 29194.056 }, { "epoch": 1.3696360295174554, "grad_norm": 1.53125, "learning_rate": 2.265506943394091e-05, "loss": 1.0429594039916992, "num_input_tokens_seen": 11008131072, "step": 38710, "train_runtime": 377063.3051, "train_tokens_per_second": 29194.384 }, { "epoch": 1.3699898497811842, "grad_norm": 1.5546875, "learning_rate": 2.2652744239243668e-05, "loss": 1.0332805633544921, "num_input_tokens_seen": 11010988160, "step": 38720, "train_runtime": 377160.7785, "train_tokens_per_second": 29194.415 }, { "epoch": 1.370343670044913, "grad_norm": 1.578125, "learning_rate": 2.2650419760336006e-05, "loss": 1.0375531196594239, "num_input_tokens_seen": 11013866176, "step": 38730, "train_runtime": 377260.9304, "train_tokens_per_second": 29194.293 }, { "epoch": 1.370697490308642, "grad_norm": 1.609375, "learning_rate": 2.2648095996850735e-05, "loss": 1.0343402862548827, "num_input_tokens_seen": 11016722496, "step": 38740, "train_runtime": 377358.7664, "train_tokens_per_second": 29194.293 }, { "epoch": 1.3710513105723705, "grad_norm": 1.5390625, "learning_rate": 2.2645772948420957e-05, "loss": 1.0320053100585938, "num_input_tokens_seen": 11019531904, "step": 38750, "train_runtime": 377453.6236, "train_tokens_per_second": 29194.4 }, { "epoch": 1.3714051308360995, "grad_norm": 1.5078125, "learning_rate": 2.264345061468003e-05, "loss": 1.0510149002075195, "num_input_tokens_seen": 11022393792, "step": 38760, "train_runtime": 377553.0145, "train_tokens_per_second": 29194.294 }, { "epoch": 1.371758951099828, "grad_norm": 1.5859375, "learning_rate": 2.2641128995261554e-05, "loss": 1.0567310333251954, "num_input_tokens_seen": 11025283008, "step": 38770, "train_runtime": 377653.4506, "train_tokens_per_second": 29194.181 }, { "epoch": 1.372112771363557, "grad_norm": 1.6015625, "learning_rate": 2.2638808089799417e-05, "loss": 1.0332561492919923, "num_input_tokens_seen": 11028088128, "step": 38780, "train_runtime": 377749.0305, "train_tokens_per_second": 29194.22 }, { "epoch": 1.3724665916272858, "grad_norm": 1.4609375, "learning_rate": 2.2636487897927773e-05, "loss": 1.0421150207519532, "num_input_tokens_seen": 11030944000, "step": 38790, "train_runtime": 377849.8904, "train_tokens_per_second": 29193.985 }, { "epoch": 1.3728204118910146, "grad_norm": 1.53125, "learning_rate": 2.2634168419281007e-05, "loss": 1.0385971069335938, "num_input_tokens_seen": 11033770048, "step": 38800, "train_runtime": 377945.4882, "train_tokens_per_second": 29194.078 }, { "epoch": 1.3731742321547433, "grad_norm": 1.4765625, "learning_rate": 2.2631849653493803e-05, "loss": 1.0461700439453125, "num_input_tokens_seen": 11036662784, "step": 38810, "train_runtime": 378042.208, "train_tokens_per_second": 29194.261 }, { "epoch": 1.373528052418472, "grad_norm": 1.546875, "learning_rate": 2.2629531600201077e-05, "loss": 1.052126407623291, "num_input_tokens_seen": 11039528064, "step": 38820, "train_runtime": 378139.5734, "train_tokens_per_second": 29194.321 }, { "epoch": 1.3738818726822009, "grad_norm": 1.546875, "learning_rate": 2.2627214259038028e-05, "loss": 1.052404022216797, "num_input_tokens_seen": 11042412992, "step": 38830, "train_runtime": 378238.8953, "train_tokens_per_second": 29194.282 }, { "epoch": 1.3742356929459296, "grad_norm": 1.4765625, "learning_rate": 2.2624897629640108e-05, "loss": 1.0393418312072753, "num_input_tokens_seen": 11045297216, "step": 38840, "train_runtime": 378338.4779, "train_tokens_per_second": 29194.221 }, { "epoch": 1.3745895132096584, "grad_norm": 1.53125, "learning_rate": 2.2622581711643022e-05, "loss": 1.054104995727539, "num_input_tokens_seen": 11048189056, "step": 38850, "train_runtime": 378438.9056, "train_tokens_per_second": 29194.115 }, { "epoch": 1.3749433334733872, "grad_norm": 1.5390625, "learning_rate": 2.262026650468275e-05, "loss": 1.0449606895446777, "num_input_tokens_seen": 11051043840, "step": 38860, "train_runtime": 378536.9587, "train_tokens_per_second": 29194.095 }, { "epoch": 1.375297153737116, "grad_norm": 1.59375, "learning_rate": 2.261795200839553e-05, "loss": 1.0522755622863769, "num_input_tokens_seen": 11053920512, "step": 38870, "train_runtime": 378637.2655, "train_tokens_per_second": 29193.958 }, { "epoch": 1.3756509740008447, "grad_norm": 1.5234375, "learning_rate": 2.2615638222417856e-05, "loss": 1.0605039596557617, "num_input_tokens_seen": 11056773632, "step": 38880, "train_runtime": 378739.0313, "train_tokens_per_second": 29193.647 }, { "epoch": 1.3760047942645734, "grad_norm": 1.5390625, "learning_rate": 2.261332514638648e-05, "loss": 1.042280387878418, "num_input_tokens_seen": 11059602944, "step": 38890, "train_runtime": 378835.7355, "train_tokens_per_second": 29193.663 }, { "epoch": 1.3763586145283022, "grad_norm": 1.5234375, "learning_rate": 2.261101277993842e-05, "loss": 1.044830894470215, "num_input_tokens_seen": 11062481856, "step": 38900, "train_runtime": 378934.7615, "train_tokens_per_second": 29193.632 }, { "epoch": 1.3767124347920312, "grad_norm": 1.53125, "learning_rate": 2.2608701122710953e-05, "loss": 1.0554269790649413, "num_input_tokens_seen": 11065335296, "step": 38910, "train_runtime": 379031.0473, "train_tokens_per_second": 29193.744 }, { "epoch": 1.3770662550557597, "grad_norm": 1.5, "learning_rate": 2.2606390174341617e-05, "loss": 1.0572389602661132, "num_input_tokens_seen": 11068160768, "step": 38920, "train_runtime": 379126.8252, "train_tokens_per_second": 29193.821 }, { "epoch": 1.3774200753194887, "grad_norm": 1.6171875, "learning_rate": 2.2604079934468193e-05, "loss": 1.049103355407715, "num_input_tokens_seen": 11070971520, "step": 38930, "train_runtime": 379222.0315, "train_tokens_per_second": 29193.904 }, { "epoch": 1.3777738955832175, "grad_norm": 1.4921875, "learning_rate": 2.260177040272875e-05, "loss": 1.0430784225463867, "num_input_tokens_seen": 11073798144, "step": 38940, "train_runtime": 379317.8006, "train_tokens_per_second": 29193.985 }, { "epoch": 1.3781277158469463, "grad_norm": 1.5390625, "learning_rate": 2.2599461578761593e-05, "loss": 1.043807315826416, "num_input_tokens_seen": 11076636224, "step": 38950, "train_runtime": 379415.225, "train_tokens_per_second": 29193.969 }, { "epoch": 1.378481536110675, "grad_norm": 1.578125, "learning_rate": 2.2597153462205292e-05, "loss": 1.0592025756835937, "num_input_tokens_seen": 11079494464, "step": 38960, "train_runtime": 379513.8802, "train_tokens_per_second": 29193.911 }, { "epoch": 1.3788353563744038, "grad_norm": 1.4921875, "learning_rate": 2.259484605269868e-05, "loss": 1.0388696670532227, "num_input_tokens_seen": 11082340352, "step": 38970, "train_runtime": 379612.4336, "train_tokens_per_second": 29193.829 }, { "epoch": 1.3791891766381326, "grad_norm": 1.5234375, "learning_rate": 2.259253934988084e-05, "loss": 1.0601749420166016, "num_input_tokens_seen": 11085170816, "step": 38980, "train_runtime": 379710.0881, "train_tokens_per_second": 29193.775 }, { "epoch": 1.3795429969018613, "grad_norm": 1.5078125, "learning_rate": 2.2590233353391124e-05, "loss": 1.040640163421631, "num_input_tokens_seen": 11087992192, "step": 38990, "train_runtime": 379805.6008, "train_tokens_per_second": 29193.862 }, { "epoch": 1.37989681716559, "grad_norm": 1.4765625, "learning_rate": 2.2587928062869124e-05, "loss": 1.0615262031555175, "num_input_tokens_seen": 11090834624, "step": 39000, "train_runtime": 379902.6594, "train_tokens_per_second": 29193.885 }, { "epoch": 1.3802506374293189, "grad_norm": 1.484375, "learning_rate": 2.258562347795471e-05, "loss": 1.0302799224853516, "num_input_tokens_seen": 11093671168, "step": 39010, "train_runtime": 380000.3997, "train_tokens_per_second": 29193.841 }, { "epoch": 1.3806044576930476, "grad_norm": 1.6171875, "learning_rate": 2.2583319598287993e-05, "loss": 1.037026596069336, "num_input_tokens_seen": 11096512000, "step": 39020, "train_runtime": 380101.6439, "train_tokens_per_second": 29193.539 }, { "epoch": 1.3809582779567764, "grad_norm": 1.484375, "learning_rate": 2.258101642350935e-05, "loss": 1.0541017532348633, "num_input_tokens_seen": 11099313280, "step": 39030, "train_runtime": 380195.1016, "train_tokens_per_second": 29193.73 }, { "epoch": 1.3813120982205052, "grad_norm": 1.5546875, "learning_rate": 2.2578713953259414e-05, "loss": 1.0390743255615233, "num_input_tokens_seen": 11102135744, "step": 39040, "train_runtime": 380292.3038, "train_tokens_per_second": 29193.69 }, { "epoch": 1.381665918484234, "grad_norm": 1.6015625, "learning_rate": 2.2576412187179074e-05, "loss": 1.0446849822998048, "num_input_tokens_seen": 11104966592, "step": 39050, "train_runtime": 380390.5681, "train_tokens_per_second": 29193.591 }, { "epoch": 1.3820197387479627, "grad_norm": 1.4921875, "learning_rate": 2.257411112490946e-05, "loss": 1.0373998641967774, "num_input_tokens_seen": 11107825536, "step": 39060, "train_runtime": 380490.4442, "train_tokens_per_second": 29193.442 }, { "epoch": 1.3823735590116915, "grad_norm": 1.4921875, "learning_rate": 2.257181076609199e-05, "loss": 1.0539454460144042, "num_input_tokens_seen": 11110701056, "step": 39070, "train_runtime": 380588.8607, "train_tokens_per_second": 29193.448 }, { "epoch": 1.3827273792754204, "grad_norm": 1.5078125, "learning_rate": 2.2569511110368306e-05, "loss": 1.0503253936767578, "num_input_tokens_seen": 11113572480, "step": 39080, "train_runtime": 380685.1271, "train_tokens_per_second": 29193.608 }, { "epoch": 1.383081199539149, "grad_norm": 1.578125, "learning_rate": 2.256721215738032e-05, "loss": 1.0612279891967773, "num_input_tokens_seen": 11116431744, "step": 39090, "train_runtime": 380785.1104, "train_tokens_per_second": 29193.452 }, { "epoch": 1.383435019802878, "grad_norm": 1.5546875, "learning_rate": 2.2564913906770207e-05, "loss": 1.0342654228210448, "num_input_tokens_seen": 11119239296, "step": 39100, "train_runtime": 380878.4819, "train_tokens_per_second": 29193.666 }, { "epoch": 1.3837888400666067, "grad_norm": 1.5625, "learning_rate": 2.2562616358180384e-05, "loss": 1.0499846458435058, "num_input_tokens_seen": 11122072192, "step": 39110, "train_runtime": 380972.6946, "train_tokens_per_second": 29193.883 }, { "epoch": 1.3841426603303355, "grad_norm": 1.4921875, "learning_rate": 2.2560319511253522e-05, "loss": 1.0567741394042969, "num_input_tokens_seen": 11124964864, "step": 39120, "train_runtime": 381072.3018, "train_tokens_per_second": 29193.843 }, { "epoch": 1.3844964805940643, "grad_norm": 1.515625, "learning_rate": 2.255802336563256e-05, "loss": 1.0532445907592773, "num_input_tokens_seen": 11127832384, "step": 39130, "train_runtime": 381169.9882, "train_tokens_per_second": 29193.884 }, { "epoch": 1.384850300857793, "grad_norm": 1.5703125, "learning_rate": 2.255572792096067e-05, "loss": 1.04498291015625, "num_input_tokens_seen": 11130690944, "step": 39140, "train_runtime": 381272.0187, "train_tokens_per_second": 29193.569 }, { "epoch": 1.3852041211215218, "grad_norm": 1.546875, "learning_rate": 2.2553433176881303e-05, "loss": 1.0420803070068358, "num_input_tokens_seen": 11133547840, "step": 39150, "train_runtime": 381371.2767, "train_tokens_per_second": 29193.462 }, { "epoch": 1.3855579413852506, "grad_norm": 1.5, "learning_rate": 2.2551139133038147e-05, "loss": 1.040702724456787, "num_input_tokens_seen": 11136403328, "step": 39160, "train_runtime": 381469.9362, "train_tokens_per_second": 29193.397 }, { "epoch": 1.3859117616489793, "grad_norm": 1.4921875, "learning_rate": 2.2548845789075145e-05, "loss": 1.045588493347168, "num_input_tokens_seen": 11139264832, "step": 39170, "train_runtime": 381568.4827, "train_tokens_per_second": 29193.357 }, { "epoch": 1.386265581912708, "grad_norm": 1.53125, "learning_rate": 2.2546553144636503e-05, "loss": 1.042722797393799, "num_input_tokens_seen": 11142194368, "step": 39180, "train_runtime": 381673.7176, "train_tokens_per_second": 29192.983 }, { "epoch": 1.3866194021764369, "grad_norm": 1.5390625, "learning_rate": 2.254426119936668e-05, "loss": 1.0345090866088866, "num_input_tokens_seen": 11145013632, "step": 39190, "train_runtime": 381769.42, "train_tokens_per_second": 29193.05 }, { "epoch": 1.3869732224401656, "grad_norm": 1.515625, "learning_rate": 2.2541969952910365e-05, "loss": 1.0423244476318358, "num_input_tokens_seen": 11147898752, "step": 39200, "train_runtime": 381868.4082, "train_tokens_per_second": 29193.037 }, { "epoch": 1.3873270427038944, "grad_norm": 1.5, "learning_rate": 2.2539679404912533e-05, "loss": 1.0376026153564453, "num_input_tokens_seen": 11150699776, "step": 39210, "train_runtime": 381964.6975, "train_tokens_per_second": 29193.011 }, { "epoch": 1.3876808629676232, "grad_norm": 1.53125, "learning_rate": 2.253738955501838e-05, "loss": 1.0511850357055663, "num_input_tokens_seen": 11153533632, "step": 39220, "train_runtime": 382061.8244, "train_tokens_per_second": 29193.007 }, { "epoch": 1.3880346832313522, "grad_norm": 1.9140625, "learning_rate": 2.2535100402873383e-05, "loss": 1.0417304992675782, "num_input_tokens_seen": 11156396864, "step": 39230, "train_runtime": 382158.705, "train_tokens_per_second": 29193.099 }, { "epoch": 1.3883885034950807, "grad_norm": 1.5234375, "learning_rate": 2.2532811948123252e-05, "loss": 1.0417596817016601, "num_input_tokens_seen": 11159236160, "step": 39240, "train_runtime": 382258.1862, "train_tokens_per_second": 29192.929 }, { "epoch": 1.3887423237588097, "grad_norm": 1.6484375, "learning_rate": 2.2530524190413955e-05, "loss": 1.0316246032714844, "num_input_tokens_seen": 11162052224, "step": 39250, "train_runtime": 382352.4595, "train_tokens_per_second": 29193.096 }, { "epoch": 1.3890961440225382, "grad_norm": 1.6015625, "learning_rate": 2.2528237129391706e-05, "loss": 1.0439836502075195, "num_input_tokens_seen": 11164892736, "step": 39260, "train_runtime": 382451.4834, "train_tokens_per_second": 29192.965 }, { "epoch": 1.3894499642862672, "grad_norm": 1.5, "learning_rate": 2.2525950764702985e-05, "loss": 1.0512356758117676, "num_input_tokens_seen": 11167730112, "step": 39270, "train_runtime": 382548.1049, "train_tokens_per_second": 29193.009 }, { "epoch": 1.389803784549996, "grad_norm": 1.5625, "learning_rate": 2.2523665095994505e-05, "loss": 1.0410776138305664, "num_input_tokens_seen": 11170539264, "step": 39280, "train_runtime": 382642.4035, "train_tokens_per_second": 29193.156 }, { "epoch": 1.3901576048137247, "grad_norm": 1.6015625, "learning_rate": 2.252138012291324e-05, "loss": 1.0410516738891602, "num_input_tokens_seen": 11173406528, "step": 39290, "train_runtime": 382743.2944, "train_tokens_per_second": 29192.952 }, { "epoch": 1.3905114250774535, "grad_norm": 1.4921875, "learning_rate": 2.2519095845106414e-05, "loss": 1.051633358001709, "num_input_tokens_seen": 11176267392, "step": 39300, "train_runtime": 382841.2982, "train_tokens_per_second": 29192.951 }, { "epoch": 1.3908652453411823, "grad_norm": 1.5, "learning_rate": 2.25168122622215e-05, "loss": 1.0403926849365235, "num_input_tokens_seen": 11179142976, "step": 39310, "train_runtime": 382940.4189, "train_tokens_per_second": 29192.904 }, { "epoch": 1.391219065604911, "grad_norm": 1.515625, "learning_rate": 2.2514529373906217e-05, "loss": 1.0471771240234375, "num_input_tokens_seen": 11181973504, "step": 39320, "train_runtime": 383034.965, "train_tokens_per_second": 29193.088 }, { "epoch": 1.3915728858686398, "grad_norm": 1.59375, "learning_rate": 2.251224717980855e-05, "loss": 1.049705696105957, "num_input_tokens_seen": 11184771456, "step": 39330, "train_runtime": 383127.6075, "train_tokens_per_second": 29193.332 }, { "epoch": 1.3919267061323686, "grad_norm": 1.5390625, "learning_rate": 2.2509965679576713e-05, "loss": 1.0376442909240722, "num_input_tokens_seen": 11187658048, "step": 39340, "train_runtime": 383227.958, "train_tokens_per_second": 29193.22 }, { "epoch": 1.3922805263960973, "grad_norm": 1.578125, "learning_rate": 2.250768487285918e-05, "loss": 1.0393450736999512, "num_input_tokens_seen": 11190528448, "step": 39350, "train_runtime": 383327.0196, "train_tokens_per_second": 29193.164 }, { "epoch": 1.392634346659826, "grad_norm": 1.546875, "learning_rate": 2.250540475930467e-05, "loss": 1.0546005249023438, "num_input_tokens_seen": 11193331648, "step": 39360, "train_runtime": 383422.5045, "train_tokens_per_second": 29193.205 }, { "epoch": 1.3929881669235549, "grad_norm": 1.5390625, "learning_rate": 2.2503125338562166e-05, "loss": 1.0360166549682617, "num_input_tokens_seen": 11196209024, "step": 39370, "train_runtime": 383521.4834, "train_tokens_per_second": 29193.173 }, { "epoch": 1.3933419871872836, "grad_norm": 1.5546875, "learning_rate": 2.2500846610280868e-05, "loss": 1.056164264678955, "num_input_tokens_seen": 11199065536, "step": 39380, "train_runtime": 383621.9867, "train_tokens_per_second": 29192.971 }, { "epoch": 1.3936958074510124, "grad_norm": 1.5625, "learning_rate": 2.2498568574110262e-05, "loss": 1.043155574798584, "num_input_tokens_seen": 11201837056, "step": 39390, "train_runtime": 383714.7791, "train_tokens_per_second": 29193.134 }, { "epoch": 1.3940496277147414, "grad_norm": 1.546875, "learning_rate": 2.249629122970006e-05, "loss": 1.0327795028686524, "num_input_tokens_seen": 11204617408, "step": 39400, "train_runtime": 383808.2285, "train_tokens_per_second": 29193.27 }, { "epoch": 1.39440344797847, "grad_norm": 1.5546875, "learning_rate": 2.2494014576700217e-05, "loss": 1.048772144317627, "num_input_tokens_seen": 11207412032, "step": 39410, "train_runtime": 383902.789, "train_tokens_per_second": 29193.359 }, { "epoch": 1.394757268242199, "grad_norm": 1.5625, "learning_rate": 2.2491738614760956e-05, "loss": 1.0413206100463868, "num_input_tokens_seen": 11210267648, "step": 39420, "train_runtime": 384001.4965, "train_tokens_per_second": 29193.292 }, { "epoch": 1.3951110885059275, "grad_norm": 1.5625, "learning_rate": 2.2489463343532742e-05, "loss": 1.048126792907715, "num_input_tokens_seen": 11213072064, "step": 39430, "train_runtime": 384096.7809, "train_tokens_per_second": 29193.351 }, { "epoch": 1.3954649087696565, "grad_norm": 1.546875, "learning_rate": 2.2487188762666268e-05, "loss": 1.0392765998840332, "num_input_tokens_seen": 11215926144, "step": 39440, "train_runtime": 384195.716, "train_tokens_per_second": 29193.262 }, { "epoch": 1.3958187290333852, "grad_norm": 1.5, "learning_rate": 2.2484914871812504e-05, "loss": 1.035966396331787, "num_input_tokens_seen": 11218763200, "step": 39450, "train_runtime": 384293.2613, "train_tokens_per_second": 29193.234 }, { "epoch": 1.396172549297114, "grad_norm": 1.515625, "learning_rate": 2.248264167062264e-05, "loss": 1.0366376876831054, "num_input_tokens_seen": 11221601472, "step": 39460, "train_runtime": 384387.848, "train_tokens_per_second": 29193.435 }, { "epoch": 1.3965263695608428, "grad_norm": 1.5390625, "learning_rate": 2.2480369158748138e-05, "loss": 1.0312374114990235, "num_input_tokens_seen": 11224429952, "step": 39470, "train_runtime": 384486.1267, "train_tokens_per_second": 29193.329 }, { "epoch": 1.3968801898245715, "grad_norm": 1.5546875, "learning_rate": 2.2478097335840682e-05, "loss": 1.0563644409179687, "num_input_tokens_seen": 11227295360, "step": 39480, "train_runtime": 384586.6823, "train_tokens_per_second": 29193.147 }, { "epoch": 1.3972340100883003, "grad_norm": 1.515625, "learning_rate": 2.2475826201552215e-05, "loss": 1.0611684799194336, "num_input_tokens_seen": 11230140864, "step": 39490, "train_runtime": 384683.5924, "train_tokens_per_second": 29193.189 }, { "epoch": 1.397587830352029, "grad_norm": 1.5859375, "learning_rate": 2.2473555755534935e-05, "loss": 1.0420080184936524, "num_input_tokens_seen": 11232961856, "step": 39500, "train_runtime": 384780.3619, "train_tokens_per_second": 29193.179 }, { "epoch": 1.3979416506157578, "grad_norm": 1.515625, "learning_rate": 2.2471285997441267e-05, "loss": 1.0478855133056642, "num_input_tokens_seen": 11235836672, "step": 39510, "train_runtime": 384879.253, "train_tokens_per_second": 29193.147 }, { "epoch": 1.3982954708794866, "grad_norm": 1.625, "learning_rate": 2.246901692692389e-05, "loss": 1.0322057723999023, "num_input_tokens_seen": 11238604864, "step": 39520, "train_runtime": 384971.9265, "train_tokens_per_second": 29193.31 }, { "epoch": 1.3986492911432153, "grad_norm": 1.484375, "learning_rate": 2.2466748543635735e-05, "loss": 1.0475372314453124, "num_input_tokens_seen": 11241440704, "step": 39530, "train_runtime": 385066.7152, "train_tokens_per_second": 29193.488 }, { "epoch": 1.399003111406944, "grad_norm": 1.6171875, "learning_rate": 2.2464480847229967e-05, "loss": 1.0377182006835937, "num_input_tokens_seen": 11244246336, "step": 39540, "train_runtime": 385162.9319, "train_tokens_per_second": 29193.48 }, { "epoch": 1.3993569316706729, "grad_norm": 1.6015625, "learning_rate": 2.2462213837360003e-05, "loss": 1.0449495315551758, "num_input_tokens_seen": 11247100608, "step": 39550, "train_runtime": 385257.5317, "train_tokens_per_second": 29193.72 }, { "epoch": 1.3997107519344016, "grad_norm": 1.5390625, "learning_rate": 2.2459947513679502e-05, "loss": 1.0441871643066407, "num_input_tokens_seen": 11249952448, "step": 39560, "train_runtime": 385355.4952, "train_tokens_per_second": 29193.699 }, { "epoch": 1.4000645721981306, "grad_norm": 1.53125, "learning_rate": 2.2457681875842372e-05, "loss": 1.033175563812256, "num_input_tokens_seen": 11252786880, "step": 39570, "train_runtime": 385450.6222, "train_tokens_per_second": 29193.848 }, { "epoch": 1.4004183924618592, "grad_norm": 1.4921875, "learning_rate": 2.245541692350276e-05, "loss": 1.0449872970581056, "num_input_tokens_seen": 11255565824, "step": 39580, "train_runtime": 385542.9018, "train_tokens_per_second": 29194.068 }, { "epoch": 1.4007722127255882, "grad_norm": 1.515625, "learning_rate": 2.245315265631506e-05, "loss": 1.060658073425293, "num_input_tokens_seen": 11258436608, "step": 39590, "train_runtime": 385643.1489, "train_tokens_per_second": 29193.924 }, { "epoch": 1.4011260329893167, "grad_norm": 1.5625, "learning_rate": 2.2450889073933906e-05, "loss": 1.0500158309936523, "num_input_tokens_seen": 11261232640, "step": 39600, "train_runtime": 385735.9626, "train_tokens_per_second": 29194.148 }, { "epoch": 1.4014798532530457, "grad_norm": 1.546875, "learning_rate": 2.2448626176014187e-05, "loss": 1.0530572891235352, "num_input_tokens_seen": 11264059072, "step": 39610, "train_runtime": 385833.6685, "train_tokens_per_second": 29194.08 }, { "epoch": 1.4018336735167745, "grad_norm": 1.6796875, "learning_rate": 2.2446363962211015e-05, "loss": 1.0422932624816894, "num_input_tokens_seen": 11266859392, "step": 39620, "train_runtime": 385929.9726, "train_tokens_per_second": 29194.051 }, { "epoch": 1.4021874937805032, "grad_norm": 1.4921875, "learning_rate": 2.244410243217976e-05, "loss": 1.0377328872680665, "num_input_tokens_seen": 11269693120, "step": 39630, "train_runtime": 386026.231, "train_tokens_per_second": 29194.112 }, { "epoch": 1.402541314044232, "grad_norm": 1.5078125, "learning_rate": 2.2441841585576043e-05, "loss": 1.0665373802185059, "num_input_tokens_seen": 11272529792, "step": 39640, "train_runtime": 386124.0272, "train_tokens_per_second": 29194.065 }, { "epoch": 1.4028951343079608, "grad_norm": 1.546875, "learning_rate": 2.2439581422055703e-05, "loss": 1.052358627319336, "num_input_tokens_seen": 11275426048, "step": 39650, "train_runtime": 386224.7586, "train_tokens_per_second": 29193.949 }, { "epoch": 1.4032489545716895, "grad_norm": 1.546875, "learning_rate": 2.2437321941274843e-05, "loss": 1.0522232055664062, "num_input_tokens_seen": 11278256192, "step": 39660, "train_runtime": 386323.3386, "train_tokens_per_second": 29193.826 }, { "epoch": 1.4036027748354183, "grad_norm": 1.5390625, "learning_rate": 2.2435063142889803e-05, "loss": 1.0450531005859376, "num_input_tokens_seen": 11281119616, "step": 39670, "train_runtime": 386421.988, "train_tokens_per_second": 29193.783 }, { "epoch": 1.403956595099147, "grad_norm": 1.5703125, "learning_rate": 2.2432805026557163e-05, "loss": 1.0515355110168456, "num_input_tokens_seen": 11284013440, "step": 39680, "train_runtime": 386523.1815, "train_tokens_per_second": 29193.627 }, { "epoch": 1.4043104153628758, "grad_norm": 1.5390625, "learning_rate": 2.243054759193374e-05, "loss": 1.0554115295410156, "num_input_tokens_seen": 11286918848, "step": 39690, "train_runtime": 386626.38, "train_tokens_per_second": 29193.349 }, { "epoch": 1.4046642356266046, "grad_norm": 1.578125, "learning_rate": 2.2428290838676597e-05, "loss": 1.0513277053833008, "num_input_tokens_seen": 11289822400, "step": 39700, "train_runtime": 386724.9854, "train_tokens_per_second": 29193.413 }, { "epoch": 1.4050180558903334, "grad_norm": 1.53125, "learning_rate": 2.2426034766443042e-05, "loss": 1.0250278472900392, "num_input_tokens_seen": 11292672064, "step": 39710, "train_runtime": 386822.1631, "train_tokens_per_second": 29193.446 }, { "epoch": 1.4053718761540621, "grad_norm": 1.640625, "learning_rate": 2.2423779374890626e-05, "loss": 1.0511338233947753, "num_input_tokens_seen": 11295548544, "step": 39720, "train_runtime": 386924.1449, "train_tokens_per_second": 29193.186 }, { "epoch": 1.4057256964177909, "grad_norm": 1.578125, "learning_rate": 2.2421524663677132e-05, "loss": 1.0543429374694824, "num_input_tokens_seen": 11298352256, "step": 39730, "train_runtime": 387019.0663, "train_tokens_per_second": 29193.27 }, { "epoch": 1.4060795166815199, "grad_norm": 1.6796875, "learning_rate": 2.2419270632460588e-05, "loss": 1.0396318435668945, "num_input_tokens_seen": 11301168896, "step": 39740, "train_runtime": 387114.4175, "train_tokens_per_second": 29193.356 }, { "epoch": 1.4064333369452484, "grad_norm": 1.5, "learning_rate": 2.2417017280899265e-05, "loss": 1.0545123100280762, "num_input_tokens_seen": 11303974528, "step": 39750, "train_runtime": 387211.2257, "train_tokens_per_second": 29193.303 }, { "epoch": 1.4067871572089774, "grad_norm": 1.5234375, "learning_rate": 2.2414764608651668e-05, "loss": 1.0452911376953125, "num_input_tokens_seen": 11306792128, "step": 39760, "train_runtime": 387309.9705, "train_tokens_per_second": 29193.135 }, { "epoch": 1.407140977472706, "grad_norm": 1.5234375, "learning_rate": 2.241251261537655e-05, "loss": 1.0543917655944823, "num_input_tokens_seen": 11309587840, "step": 39770, "train_runtime": 387404.476, "train_tokens_per_second": 29193.23 }, { "epoch": 1.407494797736435, "grad_norm": 1.6171875, "learning_rate": 2.2410261300732903e-05, "loss": 1.0523942947387694, "num_input_tokens_seen": 11312487232, "step": 39780, "train_runtime": 387507.5437, "train_tokens_per_second": 29192.947 }, { "epoch": 1.4078486180001637, "grad_norm": 1.53125, "learning_rate": 2.240801066437995e-05, "loss": 1.0520904541015625, "num_input_tokens_seen": 11315314880, "step": 39790, "train_runtime": 387602.246, "train_tokens_per_second": 29193.11 }, { "epoch": 1.4082024382638925, "grad_norm": 1.515625, "learning_rate": 2.2405760705977166e-05, "loss": 1.0449533462524414, "num_input_tokens_seen": 11318206912, "step": 39800, "train_runtime": 387701.5398, "train_tokens_per_second": 29193.092 }, { "epoch": 1.4085562585276212, "grad_norm": 1.546875, "learning_rate": 2.240351142518425e-05, "loss": 1.047023868560791, "num_input_tokens_seen": 11321046528, "step": 39810, "train_runtime": 387798.3967, "train_tokens_per_second": 29193.124 }, { "epoch": 1.40891007879135, "grad_norm": 1.5390625, "learning_rate": 2.240126282166116e-05, "loss": 1.0461925506591796, "num_input_tokens_seen": 11323874880, "step": 39820, "train_runtime": 387896.454, "train_tokens_per_second": 29193.035 }, { "epoch": 1.4092638990550788, "grad_norm": 1.5390625, "learning_rate": 2.239901489506808e-05, "loss": 1.0345829010009766, "num_input_tokens_seen": 11326753280, "step": 39830, "train_runtime": 387997.3316, "train_tokens_per_second": 29192.864 }, { "epoch": 1.4096177193188075, "grad_norm": 1.5703125, "learning_rate": 2.2396767645065424e-05, "loss": 1.054257869720459, "num_input_tokens_seen": 11329605440, "step": 39840, "train_runtime": 388094.6909, "train_tokens_per_second": 29192.89 }, { "epoch": 1.4099715395825363, "grad_norm": 1.5625, "learning_rate": 2.239452107131387e-05, "loss": 1.047704315185547, "num_input_tokens_seen": 11332447360, "step": 39850, "train_runtime": 388191.5665, "train_tokens_per_second": 29192.925 }, { "epoch": 1.410325359846265, "grad_norm": 1.5859375, "learning_rate": 2.239227517347431e-05, "loss": 1.0488602638244628, "num_input_tokens_seen": 11335302336, "step": 39860, "train_runtime": 388289.6492, "train_tokens_per_second": 29192.904 }, { "epoch": 1.4106791801099938, "grad_norm": 1.5546875, "learning_rate": 2.2390029951207876e-05, "loss": 1.0532964706420898, "num_input_tokens_seen": 11338120000, "step": 39870, "train_runtime": 388383.1738, "train_tokens_per_second": 29193.129 }, { "epoch": 1.4110330003737226, "grad_norm": 1.59375, "learning_rate": 2.2387785404175965e-05, "loss": 1.0511537551879884, "num_input_tokens_seen": 11340983232, "step": 39880, "train_runtime": 388482.0117, "train_tokens_per_second": 29193.072 }, { "epoch": 1.4113868206374514, "grad_norm": 1.546875, "learning_rate": 2.2385541532040178e-05, "loss": 1.0491630554199218, "num_input_tokens_seen": 11343874368, "step": 39890, "train_runtime": 388582.4644, "train_tokens_per_second": 29192.965 }, { "epoch": 1.4117406409011801, "grad_norm": 1.5859375, "learning_rate": 2.2383298334462368e-05, "loss": 1.0500043869018554, "num_input_tokens_seen": 11346669056, "step": 39900, "train_runtime": 388676.998, "train_tokens_per_second": 29193.055 }, { "epoch": 1.412094461164909, "grad_norm": 1.5625, "learning_rate": 2.2381055811104627e-05, "loss": 1.043359375, "num_input_tokens_seen": 11349581440, "step": 39910, "train_runtime": 388779.1986, "train_tokens_per_second": 29192.872 }, { "epoch": 1.4124482814286377, "grad_norm": 1.59375, "learning_rate": 2.2378813961629274e-05, "loss": 1.0477094650268555, "num_input_tokens_seen": 11352445824, "step": 39920, "train_runtime": 388879.0793, "train_tokens_per_second": 29192.74 }, { "epoch": 1.4128021016923666, "grad_norm": 1.578125, "learning_rate": 2.2376572785698884e-05, "loss": 1.0501890182495117, "num_input_tokens_seen": 11355256192, "step": 39930, "train_runtime": 388974.0483, "train_tokens_per_second": 29192.838 }, { "epoch": 1.4131559219560954, "grad_norm": 1.5390625, "learning_rate": 2.237433228297625e-05, "loss": 1.0471805572509765, "num_input_tokens_seen": 11358158912, "step": 39940, "train_runtime": 389073.1656, "train_tokens_per_second": 29192.861 }, { "epoch": 1.4135097422198242, "grad_norm": 1.4921875, "learning_rate": 2.2372092453124402e-05, "loss": 1.0440771102905273, "num_input_tokens_seen": 11360970368, "step": 39950, "train_runtime": 389169.0617, "train_tokens_per_second": 29192.892 }, { "epoch": 1.413863562483553, "grad_norm": 1.546875, "learning_rate": 2.236985329580662e-05, "loss": 1.0517522811889648, "num_input_tokens_seen": 11363792768, "step": 39960, "train_runtime": 389262.7078, "train_tokens_per_second": 29193.12 }, { "epoch": 1.4142173827472817, "grad_norm": 1.609375, "learning_rate": 2.236761481068641e-05, "loss": 1.0224111557006836, "num_input_tokens_seen": 11366586624, "step": 39970, "train_runtime": 389358.9769, "train_tokens_per_second": 29193.077 }, { "epoch": 1.4145712030110105, "grad_norm": 1.6171875, "learning_rate": 2.2365376997427508e-05, "loss": 1.049896240234375, "num_input_tokens_seen": 11369383424, "step": 39980, "train_runtime": 389452.3435, "train_tokens_per_second": 29193.26 }, { "epoch": 1.4149250232747392, "grad_norm": 1.5625, "learning_rate": 2.2363139855693906e-05, "loss": 1.0384031295776368, "num_input_tokens_seen": 11372213504, "step": 39990, "train_runtime": 389550.512, "train_tokens_per_second": 29193.168 }, { "epoch": 1.415278843538468, "grad_norm": 1.546875, "learning_rate": 2.2360903385149807e-05, "loss": 1.0415538787841796, "num_input_tokens_seen": 11374996992, "step": 40000, "train_runtime": 389643.852, "train_tokens_per_second": 29193.318 }, { "epoch": 1.415278843538468, "eval_loss": 1.0212212800979614, "eval_runtime": 8.4446, "eval_samples_per_second": 472.254, "eval_steps_per_second": 3.789, "num_input_tokens_seen": 11374996992, "step": 40000 }, { "epoch": 1.4156326638021968, "grad_norm": 1.53125, "learning_rate": 2.2358667585459662e-05, "loss": 1.044675636291504, "num_input_tokens_seen": 11377803456, "step": 40010, "train_runtime": 389770.1984, "train_tokens_per_second": 29191.055 }, { "epoch": 1.4159864840659255, "grad_norm": 1.5859375, "learning_rate": 2.2356432456288154e-05, "loss": 1.0501034736633301, "num_input_tokens_seen": 11380581760, "step": 40020, "train_runtime": 389862.1276, "train_tokens_per_second": 29191.299 }, { "epoch": 1.4163403043296543, "grad_norm": 1.5234375, "learning_rate": 2.235419799730021e-05, "loss": 1.0443290710449218, "num_input_tokens_seen": 11383398080, "step": 40030, "train_runtime": 389957.4993, "train_tokens_per_second": 29191.381 }, { "epoch": 1.416694124593383, "grad_norm": 1.53125, "learning_rate": 2.2351964208160966e-05, "loss": 1.05822811126709, "num_input_tokens_seen": 11386258048, "step": 40040, "train_runtime": 390054.6812, "train_tokens_per_second": 29191.441 }, { "epoch": 1.4170479448571118, "grad_norm": 1.578125, "learning_rate": 2.2349731088535826e-05, "loss": 1.0480676651000977, "num_input_tokens_seen": 11389134464, "step": 40050, "train_runtime": 390152.9132, "train_tokens_per_second": 29191.463 }, { "epoch": 1.4174017651208406, "grad_norm": 1.6171875, "learning_rate": 2.2347498638090404e-05, "loss": 1.046462631225586, "num_input_tokens_seen": 11391962304, "step": 40060, "train_runtime": 390248.5152, "train_tokens_per_second": 29191.558 }, { "epoch": 1.4177555853845694, "grad_norm": 1.546875, "learning_rate": 2.234526685649055e-05, "loss": 1.0428226470947266, "num_input_tokens_seen": 11394846720, "step": 40070, "train_runtime": 390346.881, "train_tokens_per_second": 29191.592 }, { "epoch": 1.4181094056482983, "grad_norm": 1.5390625, "learning_rate": 2.234303574340235e-05, "loss": 1.055576992034912, "num_input_tokens_seen": 11397669696, "step": 40080, "train_runtime": 390442.264, "train_tokens_per_second": 29191.69 }, { "epoch": 1.418463225912027, "grad_norm": 1.53125, "learning_rate": 2.234080529849214e-05, "loss": 1.044771385192871, "num_input_tokens_seen": 11400518080, "step": 40090, "train_runtime": 390541.7946, "train_tokens_per_second": 29191.544 }, { "epoch": 1.4188170461757559, "grad_norm": 1.59375, "learning_rate": 2.2338575521426467e-05, "loss": 1.045384120941162, "num_input_tokens_seen": 11403364352, "step": 40100, "train_runtime": 390640.9999, "train_tokens_per_second": 29191.417 }, { "epoch": 1.4191708664394846, "grad_norm": 1.546875, "learning_rate": 2.2336346411872113e-05, "loss": 1.0332416534423827, "num_input_tokens_seen": 11406277248, "step": 40110, "train_runtime": 390740.7292, "train_tokens_per_second": 29191.421 }, { "epoch": 1.4195246867032134, "grad_norm": 1.515625, "learning_rate": 2.2334117969496103e-05, "loss": 1.05528564453125, "num_input_tokens_seen": 11409132672, "step": 40120, "train_runtime": 390835.6925, "train_tokens_per_second": 29191.634 }, { "epoch": 1.4198785069669422, "grad_norm": 1.5, "learning_rate": 2.2331890193965688e-05, "loss": 1.0416860580444336, "num_input_tokens_seen": 11411977280, "step": 40130, "train_runtime": 390934.7157, "train_tokens_per_second": 29191.517 }, { "epoch": 1.420232327230671, "grad_norm": 1.46875, "learning_rate": 2.2329663084948358e-05, "loss": 1.0484854698181152, "num_input_tokens_seen": 11414848768, "step": 40140, "train_runtime": 391032.0986, "train_tokens_per_second": 29191.59 }, { "epoch": 1.4205861474943997, "grad_norm": 1.578125, "learning_rate": 2.2327436642111822e-05, "loss": 1.037376308441162, "num_input_tokens_seen": 11417682944, "step": 40150, "train_runtime": 391127.4374, "train_tokens_per_second": 29191.721 }, { "epoch": 1.4209399677581285, "grad_norm": 1.5390625, "learning_rate": 2.2325210865124034e-05, "loss": 1.057407760620117, "num_input_tokens_seen": 11420514240, "step": 40160, "train_runtime": 391225.2514, "train_tokens_per_second": 29191.659 }, { "epoch": 1.4212937880218572, "grad_norm": 1.546875, "learning_rate": 2.2322985753653177e-05, "loss": 1.050730323791504, "num_input_tokens_seen": 11423375296, "step": 40170, "train_runtime": 391320.5525, "train_tokens_per_second": 29191.861 }, { "epoch": 1.421647608285586, "grad_norm": 1.5234375, "learning_rate": 2.2320761307367658e-05, "loss": 1.0421464920043946, "num_input_tokens_seen": 11426219264, "step": 40180, "train_runtime": 391418.6507, "train_tokens_per_second": 29191.811 }, { "epoch": 1.4220014285493148, "grad_norm": 1.5390625, "learning_rate": 2.2318537525936124e-05, "loss": 1.0467681884765625, "num_input_tokens_seen": 11429033600, "step": 40190, "train_runtime": 391515.2475, "train_tokens_per_second": 29191.797 }, { "epoch": 1.4223552488130435, "grad_norm": 1.5390625, "learning_rate": 2.2316314409027443e-05, "loss": 1.0425706863403321, "num_input_tokens_seen": 11431858624, "step": 40200, "train_runtime": 391613.4077, "train_tokens_per_second": 29191.694 }, { "epoch": 1.4227090690767723, "grad_norm": 1.6171875, "learning_rate": 2.2314091956310723e-05, "loss": 1.0442602157592773, "num_input_tokens_seen": 11434702080, "step": 40210, "train_runtime": 391711.022, "train_tokens_per_second": 29191.678 }, { "epoch": 1.423062889340501, "grad_norm": 1.5078125, "learning_rate": 2.231187016745531e-05, "loss": 1.051041316986084, "num_input_tokens_seen": 11437572544, "step": 40220, "train_runtime": 391812.1681, "train_tokens_per_second": 29191.468 }, { "epoch": 1.42341670960423, "grad_norm": 1.5078125, "learning_rate": 2.2309649042130753e-05, "loss": 1.0279705047607421, "num_input_tokens_seen": 11440431808, "step": 40230, "train_runtime": 391911.6743, "train_tokens_per_second": 29191.352 }, { "epoch": 1.4237705298679586, "grad_norm": 1.5703125, "learning_rate": 2.2307428580006863e-05, "loss": 1.034186553955078, "num_input_tokens_seen": 11443291968, "step": 40240, "train_runtime": 392009.7479, "train_tokens_per_second": 29191.345 }, { "epoch": 1.4241243501316876, "grad_norm": 1.5390625, "learning_rate": 2.230520878075366e-05, "loss": 1.0449962615966797, "num_input_tokens_seen": 11446056000, "step": 40250, "train_runtime": 392101.4276, "train_tokens_per_second": 29191.569 }, { "epoch": 1.4244781703954161, "grad_norm": 1.5078125, "learning_rate": 2.2302989644041396e-05, "loss": 1.0418746948242188, "num_input_tokens_seen": 11448894656, "step": 40260, "train_runtime": 392197.0003, "train_tokens_per_second": 29191.694 }, { "epoch": 1.4248319906591451, "grad_norm": 1.5859375, "learning_rate": 2.2300771169540562e-05, "loss": 1.0475712776184083, "num_input_tokens_seen": 11451740096, "step": 40270, "train_runtime": 392292.4986, "train_tokens_per_second": 29191.841 }, { "epoch": 1.4251858109228739, "grad_norm": 1.5234375, "learning_rate": 2.2298553356921874e-05, "loss": 1.0458477020263672, "num_input_tokens_seen": 11454567040, "step": 40280, "train_runtime": 392386.8516, "train_tokens_per_second": 29192.026 }, { "epoch": 1.4255396311866027, "grad_norm": 1.6484375, "learning_rate": 2.2296336205856278e-05, "loss": 1.0575248718261718, "num_input_tokens_seen": 11457382976, "step": 40290, "train_runtime": 392481.4958, "train_tokens_per_second": 29192.161 }, { "epoch": 1.4258934514503314, "grad_norm": 1.5078125, "learning_rate": 2.2294119716014944e-05, "loss": 1.038258171081543, "num_input_tokens_seen": 11460279872, "step": 40300, "train_runtime": 392585.1201, "train_tokens_per_second": 29191.835 }, { "epoch": 1.4262472717140602, "grad_norm": 1.5859375, "learning_rate": 2.2291903887069275e-05, "loss": 1.0444435119628905, "num_input_tokens_seen": 11463110400, "step": 40310, "train_runtime": 392680.752, "train_tokens_per_second": 29191.934 }, { "epoch": 1.426601091977789, "grad_norm": 1.5390625, "learning_rate": 2.22896887186909e-05, "loss": 1.0557172775268555, "num_input_tokens_seen": 11465984384, "step": 40320, "train_runtime": 392781.1389, "train_tokens_per_second": 29191.79 }, { "epoch": 1.4269549122415177, "grad_norm": 1.53125, "learning_rate": 2.2287474210551678e-05, "loss": 1.0416687965393066, "num_input_tokens_seen": 11468849600, "step": 40330, "train_runtime": 392881.5545, "train_tokens_per_second": 29191.621 }, { "epoch": 1.4273087325052465, "grad_norm": 1.5859375, "learning_rate": 2.22852603623237e-05, "loss": 1.0503323554992676, "num_input_tokens_seen": 11471715584, "step": 40340, "train_runtime": 392979.2461, "train_tokens_per_second": 29191.658 }, { "epoch": 1.4276625527689752, "grad_norm": 1.515625, "learning_rate": 2.2283047173679276e-05, "loss": 1.0425731658935546, "num_input_tokens_seen": 11474555008, "step": 40350, "train_runtime": 393076.632, "train_tokens_per_second": 29191.649 }, { "epoch": 1.428016373032704, "grad_norm": 1.46875, "learning_rate": 2.2280834644290958e-05, "loss": 1.035398292541504, "num_input_tokens_seen": 11477404096, "step": 40360, "train_runtime": 393175.0416, "train_tokens_per_second": 29191.589 }, { "epoch": 1.4283701932964328, "grad_norm": 1.5390625, "learning_rate": 2.2278622773831507e-05, "loss": 1.04400691986084, "num_input_tokens_seen": 11480238592, "step": 40370, "train_runtime": 393270.5724, "train_tokens_per_second": 29191.705 }, { "epoch": 1.4287240135601615, "grad_norm": 1.5703125, "learning_rate": 2.227641156197392e-05, "loss": 1.0421079635620116, "num_input_tokens_seen": 11483001536, "step": 40380, "train_runtime": 393362.1955, "train_tokens_per_second": 29191.93 }, { "epoch": 1.4290778338238903, "grad_norm": 1.609375, "learning_rate": 2.227420100839143e-05, "loss": 1.0457950592041017, "num_input_tokens_seen": 11485833152, "step": 40390, "train_runtime": 393458.233, "train_tokens_per_second": 29192.001 }, { "epoch": 1.4294316540876193, "grad_norm": 1.5, "learning_rate": 2.227199111275749e-05, "loss": 1.0480183601379394, "num_input_tokens_seen": 11488681728, "step": 40400, "train_runtime": 393556.1217, "train_tokens_per_second": 29191.978 }, { "epoch": 1.4297854743513478, "grad_norm": 1.625, "learning_rate": 2.226978187474577e-05, "loss": 1.0503217697143554, "num_input_tokens_seen": 11491614080, "step": 40410, "train_runtime": 393658.2634, "train_tokens_per_second": 29191.853 }, { "epoch": 1.4301392946150768, "grad_norm": 1.578125, "learning_rate": 2.226757329403018e-05, "loss": 1.0462230682373046, "num_input_tokens_seen": 11494459264, "step": 40420, "train_runtime": 393754.8116, "train_tokens_per_second": 29191.921 }, { "epoch": 1.4304931148788054, "grad_norm": 1.5703125, "learning_rate": 2.226536537028485e-05, "loss": 1.050889778137207, "num_input_tokens_seen": 11497338880, "step": 40430, "train_runtime": 393854.2034, "train_tokens_per_second": 29191.865 }, { "epoch": 1.4308469351425344, "grad_norm": 1.5, "learning_rate": 2.2263158103184143e-05, "loss": 1.0412408828735351, "num_input_tokens_seen": 11500204352, "step": 40440, "train_runtime": 393951.8686, "train_tokens_per_second": 29191.902 }, { "epoch": 1.4312007554062631, "grad_norm": 1.515625, "learning_rate": 2.2260951492402636e-05, "loss": 1.0434948921203613, "num_input_tokens_seen": 11502991680, "step": 40450, "train_runtime": 394045.4041, "train_tokens_per_second": 29192.046 }, { "epoch": 1.431554575669992, "grad_norm": 1.5234375, "learning_rate": 2.225874553761514e-05, "loss": 1.0416189193725587, "num_input_tokens_seen": 11505850112, "step": 40460, "train_runtime": 394140.8536, "train_tokens_per_second": 29192.229 }, { "epoch": 1.4319083959337207, "grad_norm": 1.6015625, "learning_rate": 2.2256540238496687e-05, "loss": 1.0286125183105468, "num_input_tokens_seen": 11508674048, "step": 40470, "train_runtime": 394236.8393, "train_tokens_per_second": 29192.285 }, { "epoch": 1.4322622161974494, "grad_norm": 1.5390625, "learning_rate": 2.225433559472255e-05, "loss": 1.0434803009033202, "num_input_tokens_seen": 11511497024, "step": 40480, "train_runtime": 394334.5857, "train_tokens_per_second": 29192.207 }, { "epoch": 1.4326160364611782, "grad_norm": 1.578125, "learning_rate": 2.22521316059682e-05, "loss": 1.037852954864502, "num_input_tokens_seen": 11514339264, "step": 40490, "train_runtime": 394430.6602, "train_tokens_per_second": 29192.303 }, { "epoch": 1.432969856724907, "grad_norm": 1.4921875, "learning_rate": 2.224992827190935e-05, "loss": 1.0581388473510742, "num_input_tokens_seen": 11517171136, "step": 40500, "train_runtime": 394527.5537, "train_tokens_per_second": 29192.311 }, { "epoch": 1.4333236769886357, "grad_norm": 1.5390625, "learning_rate": 2.2247725592221942e-05, "loss": 1.0539109230041503, "num_input_tokens_seen": 11520055104, "step": 40510, "train_runtime": 394627.7421, "train_tokens_per_second": 29192.208 }, { "epoch": 1.4336774972523645, "grad_norm": 1.5703125, "learning_rate": 2.224552356658213e-05, "loss": 1.0471458435058594, "num_input_tokens_seen": 11522938176, "step": 40520, "train_runtime": 394729.7138, "train_tokens_per_second": 29191.971 }, { "epoch": 1.4340313175160933, "grad_norm": 1.546875, "learning_rate": 2.2243322194666296e-05, "loss": 1.0536922454833983, "num_input_tokens_seen": 11525780544, "step": 40530, "train_runtime": 394826.9752, "train_tokens_per_second": 29191.978 }, { "epoch": 1.434385137779822, "grad_norm": 1.6171875, "learning_rate": 2.2241121476151057e-05, "loss": 1.0487850189208985, "num_input_tokens_seen": 11528624000, "step": 40540, "train_runtime": 394922.7891, "train_tokens_per_second": 29192.096 }, { "epoch": 1.4347389580435508, "grad_norm": 1.4921875, "learning_rate": 2.2238921410713234e-05, "loss": 1.0326763153076173, "num_input_tokens_seen": 11531470016, "step": 40550, "train_runtime": 395019.6787, "train_tokens_per_second": 29192.141 }, { "epoch": 1.4350927783072795, "grad_norm": 1.546875, "learning_rate": 2.223672199802989e-05, "loss": 1.0505352020263672, "num_input_tokens_seen": 11534291712, "step": 40560, "train_runtime": 395117.1501, "train_tokens_per_second": 29192.081 }, { "epoch": 1.4354465985710085, "grad_norm": 1.5625, "learning_rate": 2.2234523237778308e-05, "loss": 1.0437631607055664, "num_input_tokens_seen": 11537152192, "step": 40570, "train_runtime": 395218.1203, "train_tokens_per_second": 29191.86 }, { "epoch": 1.435800418834737, "grad_norm": 1.609375, "learning_rate": 2.2232325129635972e-05, "loss": 1.0477143287658692, "num_input_tokens_seen": 11539980224, "step": 40580, "train_runtime": 395315.0069, "train_tokens_per_second": 29191.86 }, { "epoch": 1.436154239098466, "grad_norm": 1.546875, "learning_rate": 2.2230127673280628e-05, "loss": 1.0545995712280274, "num_input_tokens_seen": 11542885888, "step": 40590, "train_runtime": 395417.5701, "train_tokens_per_second": 29191.636 }, { "epoch": 1.4365080593621946, "grad_norm": 1.515625, "learning_rate": 2.222793086839022e-05, "loss": 1.0390766143798829, "num_input_tokens_seen": 11545725440, "step": 40600, "train_runtime": 395518.1609, "train_tokens_per_second": 29191.391 }, { "epoch": 1.4368618796259236, "grad_norm": 1.6328125, "learning_rate": 2.222573471464291e-05, "loss": 1.0442255020141602, "num_input_tokens_seen": 11548548416, "step": 40610, "train_runtime": 395616.5321, "train_tokens_per_second": 29191.269 }, { "epoch": 1.4372156998896524, "grad_norm": 1.546875, "learning_rate": 2.22235392117171e-05, "loss": 1.0517688751220704, "num_input_tokens_seen": 11551403648, "step": 40620, "train_runtime": 395714.6795, "train_tokens_per_second": 29191.244 }, { "epoch": 1.4375695201533811, "grad_norm": 1.59375, "learning_rate": 2.22213443592914e-05, "loss": 1.0470075607299805, "num_input_tokens_seen": 11554256640, "step": 40630, "train_runtime": 395813.0091, "train_tokens_per_second": 29191.2 }, { "epoch": 1.43792334041711, "grad_norm": 1.5625, "learning_rate": 2.221915015704465e-05, "loss": 1.049504280090332, "num_input_tokens_seen": 11557072000, "step": 40640, "train_runtime": 395907.3491, "train_tokens_per_second": 29191.355 }, { "epoch": 1.4382771606808387, "grad_norm": 1.546875, "learning_rate": 2.221695660465592e-05, "loss": 1.0337453842163087, "num_input_tokens_seen": 11559902336, "step": 40650, "train_runtime": 396006.9965, "train_tokens_per_second": 29191.157 }, { "epoch": 1.4386309809445674, "grad_norm": 1.5703125, "learning_rate": 2.2214763701804485e-05, "loss": 1.0419260025024415, "num_input_tokens_seen": 11562712000, "step": 40660, "train_runtime": 396102.2832, "train_tokens_per_second": 29191.228 }, { "epoch": 1.4389848012082962, "grad_norm": 1.5078125, "learning_rate": 2.221257144816984e-05, "loss": 1.0503210067749023, "num_input_tokens_seen": 11565586112, "step": 40670, "train_runtime": 396199.855, "train_tokens_per_second": 29191.293 }, { "epoch": 1.439338621472025, "grad_norm": 1.4609375, "learning_rate": 2.2210379843431728e-05, "loss": 1.038141632080078, "num_input_tokens_seen": 11568444672, "step": 40680, "train_runtime": 396296.8045, "train_tokens_per_second": 29191.365 }, { "epoch": 1.4396924417357537, "grad_norm": 1.515625, "learning_rate": 2.220818888727008e-05, "loss": 1.054074764251709, "num_input_tokens_seen": 11571286464, "step": 40690, "train_runtime": 396393.1427, "train_tokens_per_second": 29191.44 }, { "epoch": 1.4400462619994825, "grad_norm": 1.578125, "learning_rate": 2.2205998579365066e-05, "loss": 1.0525421142578124, "num_input_tokens_seen": 11574163904, "step": 40700, "train_runtime": 396490.5742, "train_tokens_per_second": 29191.523 }, { "epoch": 1.4404000822632113, "grad_norm": 1.5078125, "learning_rate": 2.220380891939708e-05, "loss": 1.0468564987182618, "num_input_tokens_seen": 11577004992, "step": 40710, "train_runtime": 396585.6953, "train_tokens_per_second": 29191.686 }, { "epoch": 1.44075390252694, "grad_norm": 1.53125, "learning_rate": 2.220161990704673e-05, "loss": 1.0383939743041992, "num_input_tokens_seen": 11579829248, "step": 40720, "train_runtime": 396681.9254, "train_tokens_per_second": 29191.724 }, { "epoch": 1.4411077227906688, "grad_norm": 1.578125, "learning_rate": 2.2199431541994836e-05, "loss": 1.0423402786254883, "num_input_tokens_seen": 11582653632, "step": 40730, "train_runtime": 396779.8476, "train_tokens_per_second": 29191.638 }, { "epoch": 1.4414615430543978, "grad_norm": 1.5625, "learning_rate": 2.2197243823922452e-05, "loss": 1.0414833068847655, "num_input_tokens_seen": 11585477120, "step": 40740, "train_runtime": 396876.5162, "train_tokens_per_second": 29191.642 }, { "epoch": 1.4418153633181263, "grad_norm": 1.6875, "learning_rate": 2.2195056752510847e-05, "loss": 1.0374091148376465, "num_input_tokens_seen": 11588314752, "step": 40750, "train_runtime": 396973.5863, "train_tokens_per_second": 29191.652 }, { "epoch": 1.4421691835818553, "grad_norm": 1.546875, "learning_rate": 2.2192870327441508e-05, "loss": 1.051079559326172, "num_input_tokens_seen": 11591223168, "step": 40760, "train_runtime": 397074.504, "train_tokens_per_second": 29191.557 }, { "epoch": 1.442523003845584, "grad_norm": 1.5, "learning_rate": 2.219068454839615e-05, "loss": 1.0459545135498047, "num_input_tokens_seen": 11594067584, "step": 40770, "train_runtime": 397169.5584, "train_tokens_per_second": 29191.733 }, { "epoch": 1.4428768241093128, "grad_norm": 1.578125, "learning_rate": 2.218849941505669e-05, "loss": 1.0319475173950194, "num_input_tokens_seen": 11596892352, "step": 40780, "train_runtime": 397266.2794, "train_tokens_per_second": 29191.736 }, { "epoch": 1.4432306443730416, "grad_norm": 1.4921875, "learning_rate": 2.2186314927105285e-05, "loss": 1.0504606246948243, "num_input_tokens_seen": 11599698048, "step": 40790, "train_runtime": 397360.5588, "train_tokens_per_second": 29191.871 }, { "epoch": 1.4435844646367704, "grad_norm": 1.5546875, "learning_rate": 2.2184131084224292e-05, "loss": 1.0436793327331544, "num_input_tokens_seen": 11602548928, "step": 40800, "train_runtime": 397458.9574, "train_tokens_per_second": 29191.816 }, { "epoch": 1.4439382849004991, "grad_norm": 1.484375, "learning_rate": 2.2181947886096305e-05, "loss": 1.0282968521118163, "num_input_tokens_seen": 11605396096, "step": 40810, "train_runtime": 397555.4879, "train_tokens_per_second": 29191.89 }, { "epoch": 1.444292105164228, "grad_norm": 1.53125, "learning_rate": 2.217976533240412e-05, "loss": 1.0415470123291015, "num_input_tokens_seen": 11608202496, "step": 40820, "train_runtime": 397650.8477, "train_tokens_per_second": 29191.947 }, { "epoch": 1.4446459254279567, "grad_norm": 1.5390625, "learning_rate": 2.217758342283076e-05, "loss": 1.0513572692871094, "num_input_tokens_seen": 11611019392, "step": 40830, "train_runtime": 397746.4464, "train_tokens_per_second": 29192.013 }, { "epoch": 1.4449997456916854, "grad_norm": 1.5390625, "learning_rate": 2.2175402157059465e-05, "loss": 1.0468131065368653, "num_input_tokens_seen": 11613865792, "step": 40840, "train_runtime": 397843.95, "train_tokens_per_second": 29192.013 }, { "epoch": 1.4453535659554142, "grad_norm": 1.4921875, "learning_rate": 2.2173221534773696e-05, "loss": 1.0407327651977538, "num_input_tokens_seen": 11616688384, "step": 40850, "train_runtime": 397937.9655, "train_tokens_per_second": 29192.209 }, { "epoch": 1.445707386219143, "grad_norm": 1.625, "learning_rate": 2.217104155565713e-05, "loss": 1.0378256797790528, "num_input_tokens_seen": 11619584704, "step": 40860, "train_runtime": 398041.1481, "train_tokens_per_second": 29191.918 }, { "epoch": 1.4460612064828717, "grad_norm": 1.53125, "learning_rate": 2.2168862219393656e-05, "loss": 1.0306124687194824, "num_input_tokens_seen": 11622397504, "step": 40870, "train_runtime": 398135.42, "train_tokens_per_second": 29192.071 }, { "epoch": 1.4464150267466005, "grad_norm": 1.5390625, "learning_rate": 2.2166683525667382e-05, "loss": 1.0399761199951172, "num_input_tokens_seen": 11625274112, "step": 40880, "train_runtime": 398234.7382, "train_tokens_per_second": 29192.014 }, { "epoch": 1.4467688470103293, "grad_norm": 1.609375, "learning_rate": 2.2164505474162645e-05, "loss": 1.054448127746582, "num_input_tokens_seen": 11628109952, "step": 40890, "train_runtime": 398330.0975, "train_tokens_per_second": 29192.145 }, { "epoch": 1.447122667274058, "grad_norm": 1.5625, "learning_rate": 2.216232806456398e-05, "loss": 1.0595831871032715, "num_input_tokens_seen": 11630886720, "step": 40900, "train_runtime": 398422.5725, "train_tokens_per_second": 29192.339 }, { "epoch": 1.447476487537787, "grad_norm": 1.5234375, "learning_rate": 2.2160151296556163e-05, "loss": 1.046468162536621, "num_input_tokens_seen": 11633691392, "step": 40910, "train_runtime": 398517.3564, "train_tokens_per_second": 29192.433 }, { "epoch": 1.4478303078015156, "grad_norm": 1.546875, "learning_rate": 2.2157975169824165e-05, "loss": 1.0486946105957031, "num_input_tokens_seen": 11636556800, "step": 40920, "train_runtime": 398615.812, "train_tokens_per_second": 29192.411 }, { "epoch": 1.4481841280652445, "grad_norm": 1.578125, "learning_rate": 2.2155799684053176e-05, "loss": 1.056875991821289, "num_input_tokens_seen": 11639413632, "step": 40930, "train_runtime": 398713.7253, "train_tokens_per_second": 29192.408 }, { "epoch": 1.4485379483289733, "grad_norm": 1.5625, "learning_rate": 2.215362483892862e-05, "loss": 1.0640172958374023, "num_input_tokens_seen": 11642220480, "step": 40940, "train_runtime": 398808.0418, "train_tokens_per_second": 29192.542 }, { "epoch": 1.448891768592702, "grad_norm": 1.5390625, "learning_rate": 2.2151450634136108e-05, "loss": 1.0391796112060547, "num_input_tokens_seen": 11645031872, "step": 40950, "train_runtime": 398904.0311, "train_tokens_per_second": 29192.565 }, { "epoch": 1.4492455888564308, "grad_norm": 1.5703125, "learning_rate": 2.2149277069361504e-05, "loss": 1.0368310928344726, "num_input_tokens_seen": 11647837376, "step": 40960, "train_runtime": 398999.1426, "train_tokens_per_second": 29192.638 }, { "epoch": 1.4495994091201596, "grad_norm": 1.609375, "learning_rate": 2.2147104144290857e-05, "loss": 1.0468981742858887, "num_input_tokens_seen": 11650645696, "step": 40970, "train_runtime": 399095.3002, "train_tokens_per_second": 29192.641 }, { "epoch": 1.4499532293838884, "grad_norm": 1.5859375, "learning_rate": 2.2144931858610438e-05, "loss": 1.0457931518554688, "num_input_tokens_seen": 11653494912, "step": 40980, "train_runtime": 399195.3604, "train_tokens_per_second": 29192.461 }, { "epoch": 1.4503070496476171, "grad_norm": 1.5546875, "learning_rate": 2.214276021200674e-05, "loss": 1.0330873489379884, "num_input_tokens_seen": 11656305984, "step": 40990, "train_runtime": 399291.6867, "train_tokens_per_second": 29192.458 }, { "epoch": 1.450660869911346, "grad_norm": 1.65625, "learning_rate": 2.2140589204166476e-05, "loss": 1.0439936637878418, "num_input_tokens_seen": 11659153792, "step": 41000, "train_runtime": 399388.3846, "train_tokens_per_second": 29192.521 }, { "epoch": 1.4510146901750747, "grad_norm": 1.515625, "learning_rate": 2.2138418834776557e-05, "loss": 1.0346403121948242, "num_input_tokens_seen": 11661997248, "step": 41010, "train_runtime": 399487.5561, "train_tokens_per_second": 29192.392 }, { "epoch": 1.4513685104388034, "grad_norm": 1.5, "learning_rate": 2.213624910352413e-05, "loss": 1.0374399185180665, "num_input_tokens_seen": 11664893056, "step": 41020, "train_runtime": 399588.6646, "train_tokens_per_second": 29192.252 }, { "epoch": 1.4517223307025322, "grad_norm": 1.546875, "learning_rate": 2.2134080010096532e-05, "loss": 1.0471195220947265, "num_input_tokens_seen": 11667749184, "step": 41030, "train_runtime": 399689.934, "train_tokens_per_second": 29192.002 }, { "epoch": 1.452076150966261, "grad_norm": 1.609375, "learning_rate": 2.213191155418133e-05, "loss": 1.0537670135498047, "num_input_tokens_seen": 11670609856, "step": 41040, "train_runtime": 399788.5285, "train_tokens_per_second": 29191.958 }, { "epoch": 1.4524299712299897, "grad_norm": 1.5234375, "learning_rate": 2.212974373546631e-05, "loss": 1.0435978889465332, "num_input_tokens_seen": 11673447424, "step": 41050, "train_runtime": 399886.7424, "train_tokens_per_second": 29191.884 }, { "epoch": 1.4527837914937185, "grad_norm": 1.59375, "learning_rate": 2.212757655363946e-05, "loss": 1.0325845718383788, "num_input_tokens_seen": 11676262784, "step": 41060, "train_runtime": 399981.5869, "train_tokens_per_second": 29192.001 }, { "epoch": 1.4531376117574473, "grad_norm": 1.5859375, "learning_rate": 2.2125410008388984e-05, "loss": 1.0372783660888671, "num_input_tokens_seen": 11679105472, "step": 41070, "train_runtime": 400080.8304, "train_tokens_per_second": 29191.865 }, { "epoch": 1.4534914320211763, "grad_norm": 1.6015625, "learning_rate": 2.2123244099403306e-05, "loss": 1.0257381439208983, "num_input_tokens_seen": 11681939456, "step": 41080, "train_runtime": 400176.7445, "train_tokens_per_second": 29191.95 }, { "epoch": 1.4538452522849048, "grad_norm": 1.609375, "learning_rate": 2.2121078826371056e-05, "loss": 1.0472345352172852, "num_input_tokens_seen": 11684796032, "step": 41090, "train_runtime": 400273.4513, "train_tokens_per_second": 29192.034 }, { "epoch": 1.4541990725486338, "grad_norm": 1.5546875, "learning_rate": 2.2118914188981088e-05, "loss": 1.0358465194702149, "num_input_tokens_seen": 11687639744, "step": 41100, "train_runtime": 400371.9194, "train_tokens_per_second": 29191.957 }, { "epoch": 1.4545528928123626, "grad_norm": 1.515625, "learning_rate": 2.2116750186922453e-05, "loss": 1.0474271774291992, "num_input_tokens_seen": 11690419520, "step": 41110, "train_runtime": 400465.3486, "train_tokens_per_second": 29192.088 }, { "epoch": 1.4549067130760913, "grad_norm": 1.5703125, "learning_rate": 2.2114586819884432e-05, "loss": 1.0510454177856445, "num_input_tokens_seen": 11693284544, "step": 41120, "train_runtime": 400566.0689, "train_tokens_per_second": 29191.9 }, { "epoch": 1.45526053333982, "grad_norm": 1.546875, "learning_rate": 2.21124240875565e-05, "loss": 1.0660600662231445, "num_input_tokens_seen": 11696187968, "step": 41130, "train_runtime": 400667.5123, "train_tokens_per_second": 29191.755 }, { "epoch": 1.4556143536035488, "grad_norm": 1.5234375, "learning_rate": 2.2110261989628366e-05, "loss": 1.0360647201538087, "num_input_tokens_seen": 11699114240, "step": 41140, "train_runtime": 400772.8859, "train_tokens_per_second": 29191.382 }, { "epoch": 1.4559681738672776, "grad_norm": 1.5078125, "learning_rate": 2.210810052578994e-05, "loss": 1.044085693359375, "num_input_tokens_seen": 11701960832, "step": 41150, "train_runtime": 400871.1346, "train_tokens_per_second": 29191.328 }, { "epoch": 1.4563219941310064, "grad_norm": 1.5078125, "learning_rate": 2.2105939695731333e-05, "loss": 1.0406719207763673, "num_input_tokens_seen": 11704807872, "step": 41160, "train_runtime": 400968.2915, "train_tokens_per_second": 29191.355 }, { "epoch": 1.4566758143947351, "grad_norm": 1.59375, "learning_rate": 2.210377949914289e-05, "loss": 1.0352442741394043, "num_input_tokens_seen": 11707594944, "step": 41170, "train_runtime": 401062.0598, "train_tokens_per_second": 29191.48 }, { "epoch": 1.457029634658464, "grad_norm": 1.4921875, "learning_rate": 2.2101619935715153e-05, "loss": 1.0453128814697266, "num_input_tokens_seen": 11710382912, "step": 41180, "train_runtime": 401154.8746, "train_tokens_per_second": 29191.675 }, { "epoch": 1.4573834549221927, "grad_norm": 1.4765625, "learning_rate": 2.2099461005138885e-05, "loss": 1.0396349906921387, "num_input_tokens_seen": 11713193856, "step": 41190, "train_runtime": 401250.8707, "train_tokens_per_second": 29191.697 }, { "epoch": 1.4577372751859214, "grad_norm": 1.5625, "learning_rate": 2.2097302707105054e-05, "loss": 1.037434196472168, "num_input_tokens_seen": 11715963584, "step": 41200, "train_runtime": 401342.6474, "train_tokens_per_second": 29191.923 }, { "epoch": 1.4580910954496502, "grad_norm": 1.5703125, "learning_rate": 2.209514504130483e-05, "loss": 1.0567068099975585, "num_input_tokens_seen": 11718841600, "step": 41210, "train_runtime": 401443.7862, "train_tokens_per_second": 29191.737 }, { "epoch": 1.458444915713379, "grad_norm": 1.609375, "learning_rate": 2.2092988007429625e-05, "loss": 1.0624927520751952, "num_input_tokens_seen": 11721698304, "step": 41220, "train_runtime": 401542.7923, "train_tokens_per_second": 29191.654 }, { "epoch": 1.458798735977108, "grad_norm": 1.5703125, "learning_rate": 2.209083160517102e-05, "loss": 1.046692180633545, "num_input_tokens_seen": 11724616320, "step": 41230, "train_runtime": 401646.6804, "train_tokens_per_second": 29191.369 }, { "epoch": 1.4591525562408365, "grad_norm": 1.578125, "learning_rate": 2.208867583422084e-05, "loss": 1.0482171058654786, "num_input_tokens_seen": 11727516416, "step": 41240, "train_runtime": 401747.6655, "train_tokens_per_second": 29191.25 }, { "epoch": 1.4595063765045655, "grad_norm": 1.59375, "learning_rate": 2.2086520694271108e-05, "loss": 1.0550015449523926, "num_input_tokens_seen": 11730358784, "step": 41250, "train_runtime": 401846.8133, "train_tokens_per_second": 29191.121 }, { "epoch": 1.459860196768294, "grad_norm": 1.5234375, "learning_rate": 2.2084366185014058e-05, "loss": 1.0345678329467773, "num_input_tokens_seen": 11733238336, "step": 41260, "train_runtime": 401946.5463, "train_tokens_per_second": 29191.042 }, { "epoch": 1.460214017032023, "grad_norm": 1.53125, "learning_rate": 2.208221230614213e-05, "loss": 1.0363618850708007, "num_input_tokens_seen": 11736064640, "step": 41270, "train_runtime": 402042.9497, "train_tokens_per_second": 29191.072 }, { "epoch": 1.4605678372957518, "grad_norm": 1.6171875, "learning_rate": 2.208005905734798e-05, "loss": 1.0393327713012694, "num_input_tokens_seen": 11738981952, "step": 41280, "train_runtime": 402142.2306, "train_tokens_per_second": 29191.12 }, { "epoch": 1.4609216575594806, "grad_norm": 1.734375, "learning_rate": 2.2077906438324474e-05, "loss": 1.061495876312256, "num_input_tokens_seen": 11741814272, "step": 41290, "train_runtime": 402237.8789, "train_tokens_per_second": 29191.22 }, { "epoch": 1.4612754778232093, "grad_norm": 1.578125, "learning_rate": 2.2075754448764683e-05, "loss": 1.0450518608093262, "num_input_tokens_seen": 11744600640, "step": 41300, "train_runtime": 402331.7763, "train_tokens_per_second": 29191.332 }, { "epoch": 1.461629298086938, "grad_norm": 1.546875, "learning_rate": 2.2073603088361887e-05, "loss": 1.052476406097412, "num_input_tokens_seen": 11747479040, "step": 41310, "train_runtime": 402431.6748, "train_tokens_per_second": 29191.239 }, { "epoch": 1.4619831183506669, "grad_norm": 1.625, "learning_rate": 2.2071452356809586e-05, "loss": 1.0523114204406738, "num_input_tokens_seen": 11750318720, "step": 41320, "train_runtime": 402527.7311, "train_tokens_per_second": 29191.327 }, { "epoch": 1.4623369386143956, "grad_norm": 1.5703125, "learning_rate": 2.2069302253801474e-05, "loss": 1.046518898010254, "num_input_tokens_seen": 11753198720, "step": 41330, "train_runtime": 402624.8541, "train_tokens_per_second": 29191.439 }, { "epoch": 1.4626907588781244, "grad_norm": 1.6171875, "learning_rate": 2.2067152779031465e-05, "loss": 1.0492050170898437, "num_input_tokens_seen": 11756035008, "step": 41340, "train_runtime": 402719.6634, "train_tokens_per_second": 29191.609 }, { "epoch": 1.4630445791418532, "grad_norm": 1.5546875, "learning_rate": 2.206500393219367e-05, "loss": 1.0442693710327149, "num_input_tokens_seen": 11758838976, "step": 41350, "train_runtime": 402814.2002, "train_tokens_per_second": 29191.719 }, { "epoch": 1.463398399405582, "grad_norm": 1.5859375, "learning_rate": 2.206285571298242e-05, "loss": 1.0590126037597656, "num_input_tokens_seen": 11761715328, "step": 41360, "train_runtime": 402912.9124, "train_tokens_per_second": 29191.706 }, { "epoch": 1.4637522196693107, "grad_norm": 1.5234375, "learning_rate": 2.206070812109226e-05, "loss": 1.0465780258178712, "num_input_tokens_seen": 11764582592, "step": 41370, "train_runtime": 403010.6777, "train_tokens_per_second": 29191.739 }, { "epoch": 1.4641060399330394, "grad_norm": 1.578125, "learning_rate": 2.2058561156217913e-05, "loss": 1.0461875915527343, "num_input_tokens_seen": 11767450752, "step": 41380, "train_runtime": 403108.3868, "train_tokens_per_second": 29191.779 }, { "epoch": 1.4644598601967682, "grad_norm": 1.5078125, "learning_rate": 2.2056414818054347e-05, "loss": 1.025762939453125, "num_input_tokens_seen": 11770238464, "step": 41390, "train_runtime": 403200.3197, "train_tokens_per_second": 29192.037 }, { "epoch": 1.4648136804604972, "grad_norm": 1.53125, "learning_rate": 2.2054269106296714e-05, "loss": 1.0426716804504395, "num_input_tokens_seen": 11773071424, "step": 41400, "train_runtime": 403296.76, "train_tokens_per_second": 29192.08 }, { "epoch": 1.4651675007242257, "grad_norm": 1.6796875, "learning_rate": 2.205212402064038e-05, "loss": 1.0465368270874023, "num_input_tokens_seen": 11775928576, "step": 41410, "train_runtime": 403392.0175, "train_tokens_per_second": 29192.27 }, { "epoch": 1.4655213209879547, "grad_norm": 1.5703125, "learning_rate": 2.204997956078092e-05, "loss": 1.0456119537353517, "num_input_tokens_seen": 11778787136, "step": 41420, "train_runtime": 403489.5029, "train_tokens_per_second": 29192.301 }, { "epoch": 1.4658751412516833, "grad_norm": 1.6171875, "learning_rate": 2.2047835726414116e-05, "loss": 1.044627857208252, "num_input_tokens_seen": 11781597376, "step": 41430, "train_runtime": 403584.7964, "train_tokens_per_second": 29192.372 }, { "epoch": 1.4662289615154123, "grad_norm": 1.515625, "learning_rate": 2.2045692517235952e-05, "loss": 1.0564058303833008, "num_input_tokens_seen": 11784486528, "step": 41440, "train_runtime": 403687.0094, "train_tokens_per_second": 29192.137 }, { "epoch": 1.466582781779141, "grad_norm": 1.5703125, "learning_rate": 2.204354993294263e-05, "loss": 1.025999164581299, "num_input_tokens_seen": 11787246976, "step": 41450, "train_runtime": 403780.8217, "train_tokens_per_second": 29192.191 }, { "epoch": 1.4669366020428698, "grad_norm": 1.59375, "learning_rate": 2.2041407973230548e-05, "loss": 1.0323284149169922, "num_input_tokens_seen": 11790027328, "step": 41460, "train_runtime": 403874.8085, "train_tokens_per_second": 29192.282 }, { "epoch": 1.4672904223065986, "grad_norm": 1.546875, "learning_rate": 2.203926663779631e-05, "loss": 1.0368988037109375, "num_input_tokens_seen": 11792876288, "step": 41470, "train_runtime": 403971.8962, "train_tokens_per_second": 29192.319 }, { "epoch": 1.4676442425703273, "grad_norm": 1.515625, "learning_rate": 2.2037125926336733e-05, "loss": 1.0433948516845704, "num_input_tokens_seen": 11795772096, "step": 41480, "train_runtime": 404074.3439, "train_tokens_per_second": 29192.084 }, { "epoch": 1.467998062834056, "grad_norm": 1.515625, "learning_rate": 2.2034985838548835e-05, "loss": 1.0308919906616212, "num_input_tokens_seen": 11798590080, "step": 41490, "train_runtime": 404171.8253, "train_tokens_per_second": 29192.015 }, { "epoch": 1.4683518830977849, "grad_norm": 1.578125, "learning_rate": 2.2032846374129848e-05, "loss": 1.0398931503295898, "num_input_tokens_seen": 11801416064, "step": 41500, "train_runtime": 404269.4697, "train_tokens_per_second": 29191.955 }, { "epoch": 1.4687057033615136, "grad_norm": 1.5390625, "learning_rate": 2.2030707532777196e-05, "loss": 1.0588146209716798, "num_input_tokens_seen": 11804203456, "step": 41510, "train_runtime": 404363.6303, "train_tokens_per_second": 29192.05 }, { "epoch": 1.4690595236252424, "grad_norm": 1.5390625, "learning_rate": 2.2028569314188528e-05, "loss": 1.0482805252075196, "num_input_tokens_seen": 11807072768, "step": 41520, "train_runtime": 404462.0527, "train_tokens_per_second": 29192.041 }, { "epoch": 1.4694133438889712, "grad_norm": 1.578125, "learning_rate": 2.2026431718061676e-05, "loss": 1.039259433746338, "num_input_tokens_seen": 11809909504, "step": 41530, "train_runtime": 404559.8033, "train_tokens_per_second": 29191.999 }, { "epoch": 1.4697671641527, "grad_norm": 1.5859375, "learning_rate": 2.202429474409469e-05, "loss": 1.0508792877197266, "num_input_tokens_seen": 11812725696, "step": 41540, "train_runtime": 404655.2554, "train_tokens_per_second": 29192.073 }, { "epoch": 1.4701209844164287, "grad_norm": 1.53125, "learning_rate": 2.202215839198583e-05, "loss": 1.0438759803771973, "num_input_tokens_seen": 11815580224, "step": 41550, "train_runtime": 404752.9507, "train_tokens_per_second": 29192.079 }, { "epoch": 1.4704748046801575, "grad_norm": 1.546875, "learning_rate": 2.2020022661433544e-05, "loss": 1.0374098777770997, "num_input_tokens_seen": 11818447168, "step": 41560, "train_runtime": 404850.7085, "train_tokens_per_second": 29192.112 }, { "epoch": 1.4708286249438864, "grad_norm": 1.546875, "learning_rate": 2.20178875521365e-05, "loss": 1.040067768096924, "num_input_tokens_seen": 11821257664, "step": 41570, "train_runtime": 404948.0684, "train_tokens_per_second": 29192.034 }, { "epoch": 1.471182445207615, "grad_norm": 1.59375, "learning_rate": 2.2015753063793566e-05, "loss": 1.0494681358337403, "num_input_tokens_seen": 11824069248, "step": 41580, "train_runtime": 405040.4456, "train_tokens_per_second": 29192.317 }, { "epoch": 1.471536265471344, "grad_norm": 1.5703125, "learning_rate": 2.2013619196103812e-05, "loss": 1.0467537879943847, "num_input_tokens_seen": 11826916096, "step": 41590, "train_runtime": 405138.9522, "train_tokens_per_second": 29192.246 }, { "epoch": 1.4718900857350725, "grad_norm": 1.5234375, "learning_rate": 2.2011485948766514e-05, "loss": 1.0413759231567383, "num_input_tokens_seen": 11829774080, "step": 41600, "train_runtime": 405236.7062, "train_tokens_per_second": 29192.257 }, { "epoch": 1.4722439059988015, "grad_norm": 1.5859375, "learning_rate": 2.2009353321481148e-05, "loss": 1.031088924407959, "num_input_tokens_seen": 11832622592, "step": 41610, "train_runtime": 405332.2654, "train_tokens_per_second": 29192.402 }, { "epoch": 1.4725977262625303, "grad_norm": 1.59375, "learning_rate": 2.2007221313947404e-05, "loss": 1.0509910583496094, "num_input_tokens_seen": 11835515584, "step": 41620, "train_runtime": 405432.1363, "train_tokens_per_second": 29192.347 }, { "epoch": 1.472951546526259, "grad_norm": 1.625, "learning_rate": 2.2005089925865162e-05, "loss": 1.042337131500244, "num_input_tokens_seen": 11838331520, "step": 41630, "train_runtime": 405529.0386, "train_tokens_per_second": 29192.315 }, { "epoch": 1.4733053667899878, "grad_norm": 1.5234375, "learning_rate": 2.2002959156934518e-05, "loss": 1.042196273803711, "num_input_tokens_seen": 11841169152, "step": 41640, "train_runtime": 405623.1734, "train_tokens_per_second": 29192.536 }, { "epoch": 1.4736591870537166, "grad_norm": 1.5546875, "learning_rate": 2.2000829006855763e-05, "loss": 1.0566818237304687, "num_input_tokens_seen": 11844018688, "step": 41650, "train_runtime": 405720.1591, "train_tokens_per_second": 29192.581 }, { "epoch": 1.4740130073174453, "grad_norm": 1.53125, "learning_rate": 2.199869947532939e-05, "loss": 1.0388776779174804, "num_input_tokens_seen": 11846870592, "step": 41660, "train_runtime": 405815.9284, "train_tokens_per_second": 29192.72 }, { "epoch": 1.474366827581174, "grad_norm": 1.5625, "learning_rate": 2.199657056205611e-05, "loss": 1.0442949295043946, "num_input_tokens_seen": 11849697280, "step": 41670, "train_runtime": 405911.6893, "train_tokens_per_second": 29192.796 }, { "epoch": 1.4747206478449029, "grad_norm": 1.53125, "learning_rate": 2.1994442266736807e-05, "loss": 1.0557119369506835, "num_input_tokens_seen": 11852599104, "step": 41680, "train_runtime": 406010.1776, "train_tokens_per_second": 29192.862 }, { "epoch": 1.4750744681086316, "grad_norm": 1.59375, "learning_rate": 2.1992314589072605e-05, "loss": 1.0498502731323243, "num_input_tokens_seen": 11855496576, "step": 41690, "train_runtime": 406112.1147, "train_tokens_per_second": 29192.669 }, { "epoch": 1.4754282883723604, "grad_norm": 1.453125, "learning_rate": 2.1990187528764796e-05, "loss": 1.0423704147338868, "num_input_tokens_seen": 11858326784, "step": 41700, "train_runtime": 406207.4612, "train_tokens_per_second": 29192.784 }, { "epoch": 1.4757821086360892, "grad_norm": 1.609375, "learning_rate": 2.19880610855149e-05, "loss": 1.0341442108154297, "num_input_tokens_seen": 11861230528, "step": 41710, "train_runtime": 406304.5466, "train_tokens_per_second": 29192.955 }, { "epoch": 1.476135928899818, "grad_norm": 1.5625, "learning_rate": 2.1985935259024618e-05, "loss": 1.0339225769042968, "num_input_tokens_seen": 11864121472, "step": 41720, "train_runtime": 406404.3474, "train_tokens_per_second": 29192.9 }, { "epoch": 1.4764897491635467, "grad_norm": 1.6171875, "learning_rate": 2.1983810048995874e-05, "loss": 1.0435525894165039, "num_input_tokens_seen": 11866918208, "step": 41730, "train_runtime": 406499.6782, "train_tokens_per_second": 29192.934 }, { "epoch": 1.4768435694272757, "grad_norm": 1.5546875, "learning_rate": 2.1981685455130778e-05, "loss": 1.062387180328369, "num_input_tokens_seen": 11869772224, "step": 41740, "train_runtime": 406599.945, "train_tokens_per_second": 29192.754 }, { "epoch": 1.4771973896910042, "grad_norm": 1.5234375, "learning_rate": 2.1979561477131642e-05, "loss": 1.0386247634887695, "num_input_tokens_seen": 11872650752, "step": 41750, "train_runtime": 406700.3702, "train_tokens_per_second": 29192.623 }, { "epoch": 1.4775512099547332, "grad_norm": 1.59375, "learning_rate": 2.197743811470099e-05, "loss": 1.0492256164550782, "num_input_tokens_seen": 11875491328, "step": 41760, "train_runtime": 406796.9918, "train_tokens_per_second": 29192.672 }, { "epoch": 1.477905030218462, "grad_norm": 1.5703125, "learning_rate": 2.197531536754154e-05, "loss": 1.0409231185913086, "num_input_tokens_seen": 11878366272, "step": 41770, "train_runtime": 406897.0638, "train_tokens_per_second": 29192.558 }, { "epoch": 1.4782588504821907, "grad_norm": 1.546875, "learning_rate": 2.1973193235356205e-05, "loss": 1.037760353088379, "num_input_tokens_seen": 11881177856, "step": 41780, "train_runtime": 406994.199, "train_tokens_per_second": 29192.499 }, { "epoch": 1.4786126707459195, "grad_norm": 1.59375, "learning_rate": 2.197107171784811e-05, "loss": 1.0423807144165038, "num_input_tokens_seen": 11884000640, "step": 41790, "train_runtime": 407086.5214, "train_tokens_per_second": 29192.813 }, { "epoch": 1.4789664910096483, "grad_norm": 1.53125, "learning_rate": 2.196895081472058e-05, "loss": 1.032763671875, "num_input_tokens_seen": 11886802112, "step": 41800, "train_runtime": 407183.9525, "train_tokens_per_second": 29192.708 }, { "epoch": 1.479320311273377, "grad_norm": 1.578125, "learning_rate": 2.196683052567713e-05, "loss": 1.034012794494629, "num_input_tokens_seen": 11889605760, "step": 41810, "train_runtime": 407281.2312, "train_tokens_per_second": 29192.619 }, { "epoch": 1.4796741315371058, "grad_norm": 1.59375, "learning_rate": 2.1964710850421486e-05, "loss": 1.0540048599243164, "num_input_tokens_seen": 11892479424, "step": 41820, "train_runtime": 407377.7839, "train_tokens_per_second": 29192.754 }, { "epoch": 1.4800279518008346, "grad_norm": 1.546875, "learning_rate": 2.196259178865757e-05, "loss": 1.047801399230957, "num_input_tokens_seen": 11895332288, "step": 41830, "train_runtime": 407475.0464, "train_tokens_per_second": 29192.787 }, { "epoch": 1.4803817720645633, "grad_norm": 1.6328125, "learning_rate": 2.1960473340089502e-05, "loss": 1.0426290512084961, "num_input_tokens_seen": 11898161408, "step": 41840, "train_runtime": 407572.7828, "train_tokens_per_second": 29192.728 }, { "epoch": 1.480735592328292, "grad_norm": 1.5703125, "learning_rate": 2.19583555044216e-05, "loss": 1.0480476379394532, "num_input_tokens_seen": 11900976064, "step": 41850, "train_runtime": 407668.7041, "train_tokens_per_second": 29192.763 }, { "epoch": 1.4810894125920209, "grad_norm": 1.5390625, "learning_rate": 2.1956238281358394e-05, "loss": 1.0446859359741212, "num_input_tokens_seen": 11903796608, "step": 41860, "train_runtime": 407762.2055, "train_tokens_per_second": 29192.987 }, { "epoch": 1.4814432328557496, "grad_norm": 1.6171875, "learning_rate": 2.1954121670604595e-05, "loss": 1.0473766326904297, "num_input_tokens_seen": 11906668864, "step": 41870, "train_runtime": 407861.1203, "train_tokens_per_second": 29192.949 }, { "epoch": 1.4817970531194784, "grad_norm": 1.578125, "learning_rate": 2.1952005671865124e-05, "loss": 1.0395652770996093, "num_input_tokens_seen": 11909509120, "step": 41880, "train_runtime": 407957.0914, "train_tokens_per_second": 29193.044 }, { "epoch": 1.4821508733832072, "grad_norm": 1.59375, "learning_rate": 2.194989028484511e-05, "loss": 1.0352354049682617, "num_input_tokens_seen": 11912281088, "step": 41890, "train_runtime": 408051.088, "train_tokens_per_second": 29193.112 }, { "epoch": 1.482504693646936, "grad_norm": 1.5234375, "learning_rate": 2.1947775509249857e-05, "loss": 1.0341602325439454, "num_input_tokens_seen": 11915101440, "step": 41900, "train_runtime": 408147.8931, "train_tokens_per_second": 29193.098 }, { "epoch": 1.482858513910665, "grad_norm": 1.5, "learning_rate": 2.194566134478489e-05, "loss": 1.0491454124450683, "num_input_tokens_seen": 11917887168, "step": 41910, "train_runtime": 408239.6565, "train_tokens_per_second": 29193.36 }, { "epoch": 1.4832123341743935, "grad_norm": 1.625, "learning_rate": 2.1943547791155918e-05, "loss": 1.0488490104675292, "num_input_tokens_seen": 11920766592, "step": 41920, "train_runtime": 408336.6398, "train_tokens_per_second": 29193.478 }, { "epoch": 1.4835661544381225, "grad_norm": 1.5625, "learning_rate": 2.1941434848068865e-05, "loss": 1.0422578811645509, "num_input_tokens_seen": 11923626560, "step": 41930, "train_runtime": 408432.5021, "train_tokens_per_second": 29193.628 }, { "epoch": 1.4839199747018512, "grad_norm": 1.5546875, "learning_rate": 2.193932251522983e-05, "loss": 1.026353359222412, "num_input_tokens_seen": 11926494080, "step": 41940, "train_runtime": 408533.287, "train_tokens_per_second": 29193.445 }, { "epoch": 1.48427379496558, "grad_norm": 1.578125, "learning_rate": 2.1937210792345127e-05, "loss": 1.0463303565979003, "num_input_tokens_seen": 11929369280, "step": 41950, "train_runtime": 408633.6282, "train_tokens_per_second": 29193.313 }, { "epoch": 1.4846276152293088, "grad_norm": 1.578125, "learning_rate": 2.193509967912126e-05, "loss": 1.0381989479064941, "num_input_tokens_seen": 11932191616, "step": 41960, "train_runtime": 408730.6604, "train_tokens_per_second": 29193.287 }, { "epoch": 1.4849814354930375, "grad_norm": 1.5546875, "learning_rate": 2.193298917526494e-05, "loss": 1.0350196838378907, "num_input_tokens_seen": 11935069632, "step": 41970, "train_runtime": 408829.5725, "train_tokens_per_second": 29193.264 }, { "epoch": 1.4853352557567663, "grad_norm": 1.5, "learning_rate": 2.1930879280483068e-05, "loss": 1.0481773376464845, "num_input_tokens_seen": 11937905984, "step": 41980, "train_runtime": 408926.3808, "train_tokens_per_second": 29193.289 }, { "epoch": 1.485689076020495, "grad_norm": 1.5, "learning_rate": 2.1928769994482743e-05, "loss": 1.0512334823608398, "num_input_tokens_seen": 11940753536, "step": 41990, "train_runtime": 409024.4082, "train_tokens_per_second": 29193.254 }, { "epoch": 1.4860428962842238, "grad_norm": 1.5078125, "learning_rate": 2.1926661316971257e-05, "loss": 1.0553668975830077, "num_input_tokens_seen": 11943568640, "step": 42000, "train_runtime": 409117.9687, "train_tokens_per_second": 29193.459 }, { "epoch": 1.4863967165479526, "grad_norm": 1.5859375, "learning_rate": 2.192455324765611e-05, "loss": 1.0476322174072266, "num_input_tokens_seen": 11946471296, "step": 42010, "train_runtime": 409222.609, "train_tokens_per_second": 29193.087 }, { "epoch": 1.4867505368116813, "grad_norm": 1.6171875, "learning_rate": 2.192244578624499e-05, "loss": 1.047531509399414, "num_input_tokens_seen": 11949288896, "step": 42020, "train_runtime": 409318.3913, "train_tokens_per_second": 29193.139 }, { "epoch": 1.48710435707541, "grad_norm": 1.546875, "learning_rate": 2.1920338932445783e-05, "loss": 1.0479537963867187, "num_input_tokens_seen": 11952160768, "step": 42030, "train_runtime": 409417.4394, "train_tokens_per_second": 29193.091 }, { "epoch": 1.4874581773391389, "grad_norm": 1.5078125, "learning_rate": 2.191823268596658e-05, "loss": 1.0573183059692384, "num_input_tokens_seen": 11955001600, "step": 42040, "train_runtime": 409515.7302, "train_tokens_per_second": 29193.022 }, { "epoch": 1.4878119976028676, "grad_norm": 1.625, "learning_rate": 2.191612704651565e-05, "loss": 1.0413215637207032, "num_input_tokens_seen": 11957859520, "step": 42050, "train_runtime": 409614.7208, "train_tokens_per_second": 29192.944 }, { "epoch": 1.4881658178665966, "grad_norm": 1.625, "learning_rate": 2.191402201380148e-05, "loss": 1.047816848754883, "num_input_tokens_seen": 11960717312, "step": 42060, "train_runtime": 409711.0821, "train_tokens_per_second": 29193.053 }, { "epoch": 1.4885196381303252, "grad_norm": 1.5390625, "learning_rate": 2.191191758753273e-05, "loss": 1.0452162742614746, "num_input_tokens_seen": 11963604416, "step": 42070, "train_runtime": 409808.7145, "train_tokens_per_second": 29193.143 }, { "epoch": 1.4888734583940542, "grad_norm": 1.5625, "learning_rate": 2.190981376741828e-05, "loss": 1.034780502319336, "num_input_tokens_seen": 11966445696, "step": 42080, "train_runtime": 409906.2744, "train_tokens_per_second": 29193.126 }, { "epoch": 1.4892272786577827, "grad_norm": 1.53125, "learning_rate": 2.190771055316719e-05, "loss": 1.0443185806274413, "num_input_tokens_seen": 11969239296, "step": 42090, "train_runtime": 410000.8354, "train_tokens_per_second": 29193.207 }, { "epoch": 1.4895810989215117, "grad_norm": 1.5859375, "learning_rate": 2.1905607944488718e-05, "loss": 1.056391143798828, "num_input_tokens_seen": 11972024704, "step": 42100, "train_runtime": 410095.1891, "train_tokens_per_second": 29193.282 }, { "epoch": 1.4899349191852405, "grad_norm": 1.53125, "learning_rate": 2.1903505941092315e-05, "loss": 1.0540189743041992, "num_input_tokens_seen": 11974864512, "step": 42110, "train_runtime": 410196.259, "train_tokens_per_second": 29193.012 }, { "epoch": 1.4902887394489692, "grad_norm": 1.5078125, "learning_rate": 2.1901404542687634e-05, "loss": 1.036434268951416, "num_input_tokens_seen": 11977747904, "step": 42120, "train_runtime": 410294.9798, "train_tokens_per_second": 29193.016 }, { "epoch": 1.490642559712698, "grad_norm": 1.6015625, "learning_rate": 2.189930374898452e-05, "loss": 1.0434698104858398, "num_input_tokens_seen": 11980582336, "step": 42130, "train_runtime": 410390.9941, "train_tokens_per_second": 29193.093 }, { "epoch": 1.4909963799764268, "grad_norm": 1.5234375, "learning_rate": 2.1897203559693018e-05, "loss": 1.0390192031860352, "num_input_tokens_seen": 11983450432, "step": 42140, "train_runtime": 410492.5106, "train_tokens_per_second": 29192.86 }, { "epoch": 1.4913502002401555, "grad_norm": 1.46875, "learning_rate": 2.1895103974523347e-05, "loss": 1.0304597854614257, "num_input_tokens_seen": 11986294720, "step": 42150, "train_runtime": 410590.6493, "train_tokens_per_second": 29192.81 }, { "epoch": 1.4917040205038843, "grad_norm": 1.5625, "learning_rate": 2.1893004993185944e-05, "loss": 1.0278430938720704, "num_input_tokens_seen": 11989119424, "step": 42160, "train_runtime": 410684.979, "train_tokens_per_second": 29192.983 }, { "epoch": 1.492057840767613, "grad_norm": 1.59375, "learning_rate": 2.189090661539144e-05, "loss": 1.0518048286437989, "num_input_tokens_seen": 11991940736, "step": 42170, "train_runtime": 410781.3006, "train_tokens_per_second": 29193.005 }, { "epoch": 1.4924116610313418, "grad_norm": 1.6171875, "learning_rate": 2.188880884085063e-05, "loss": 1.0379878997802734, "num_input_tokens_seen": 11994823424, "step": 42180, "train_runtime": 410879.0538, "train_tokens_per_second": 29193.076 }, { "epoch": 1.4927654812950706, "grad_norm": 1.515625, "learning_rate": 2.1886711669274547e-05, "loss": 1.0607930183410645, "num_input_tokens_seen": 11997691712, "step": 42190, "train_runtime": 410977.6487, "train_tokens_per_second": 29193.052 }, { "epoch": 1.4931193015587994, "grad_norm": 1.6953125, "learning_rate": 2.188461510037438e-05, "loss": 1.0382171630859376, "num_input_tokens_seen": 12000527232, "step": 42200, "train_runtime": 411073.165, "train_tokens_per_second": 29193.166 }, { "epoch": 1.4934731218225281, "grad_norm": 1.5390625, "learning_rate": 2.1882519133861538e-05, "loss": 1.053349208831787, "num_input_tokens_seen": 12003381312, "step": 42210, "train_runtime": 411171.334, "train_tokens_per_second": 29193.138 }, { "epoch": 1.4938269420862569, "grad_norm": 1.5546875, "learning_rate": 2.1880423769447607e-05, "loss": 1.0464336395263671, "num_input_tokens_seen": 12006237440, "step": 42220, "train_runtime": 411268.7057, "train_tokens_per_second": 29193.17 }, { "epoch": 1.4941807623499859, "grad_norm": 1.4609375, "learning_rate": 2.1878329006844368e-05, "loss": 1.0412126541137696, "num_input_tokens_seen": 12009064128, "step": 42230, "train_runtime": 411367.4846, "train_tokens_per_second": 29193.032 }, { "epoch": 1.4945345826137144, "grad_norm": 1.5390625, "learning_rate": 2.1876234845763806e-05, "loss": 1.0450308799743653, "num_input_tokens_seen": 12011854592, "step": 42240, "train_runtime": 411463.0188, "train_tokens_per_second": 29193.036 }, { "epoch": 1.4948884028774434, "grad_norm": 1.5703125, "learning_rate": 2.1874141285918086e-05, "loss": 1.0267714500427245, "num_input_tokens_seen": 12014750016, "step": 42250, "train_runtime": 411565.5982, "train_tokens_per_second": 29192.795 }, { "epoch": 1.495242223141172, "grad_norm": 1.578125, "learning_rate": 2.1872048327019575e-05, "loss": 1.0476985931396485, "num_input_tokens_seen": 12017579008, "step": 42260, "train_runtime": 411661.1129, "train_tokens_per_second": 29192.893 }, { "epoch": 1.495596043404901, "grad_norm": 1.578125, "learning_rate": 2.1869955968780834e-05, "loss": 1.0531655311584474, "num_input_tokens_seen": 12020409536, "step": 42270, "train_runtime": 411755.668, "train_tokens_per_second": 29193.064 }, { "epoch": 1.4959498636686297, "grad_norm": 1.5859375, "learning_rate": 2.1867864210914605e-05, "loss": 1.044987106323242, "num_input_tokens_seen": 12023295872, "step": 42280, "train_runtime": 411857.4663, "train_tokens_per_second": 29192.856 }, { "epoch": 1.4963036839323585, "grad_norm": 1.5234375, "learning_rate": 2.1865773053133827e-05, "loss": 1.0359729766845702, "num_input_tokens_seen": 12026124864, "step": 42290, "train_runtime": 411953.7778, "train_tokens_per_second": 29192.899 }, { "epoch": 1.4966575041960872, "grad_norm": 1.640625, "learning_rate": 2.186368249515164e-05, "loss": 1.0432865142822265, "num_input_tokens_seen": 12028913472, "step": 42300, "train_runtime": 412048.1428, "train_tokens_per_second": 29192.981 }, { "epoch": 1.497011324459816, "grad_norm": 1.53125, "learning_rate": 2.1861592536681362e-05, "loss": 1.0423819541931152, "num_input_tokens_seen": 12031675968, "step": 42310, "train_runtime": 412142.3687, "train_tokens_per_second": 29193.009 }, { "epoch": 1.4973651447235448, "grad_norm": 1.515625, "learning_rate": 2.1859503177436517e-05, "loss": 1.0461089134216308, "num_input_tokens_seen": 12034532864, "step": 42320, "train_runtime": 412242.3, "train_tokens_per_second": 29192.863 }, { "epoch": 1.4977189649872735, "grad_norm": 1.546875, "learning_rate": 2.1857414417130808e-05, "loss": 1.0397977828979492, "num_input_tokens_seen": 12037375104, "step": 42330, "train_runtime": 412340.1499, "train_tokens_per_second": 29192.828 }, { "epoch": 1.4980727852510023, "grad_norm": 1.546875, "learning_rate": 2.1855326255478136e-05, "loss": 1.047746467590332, "num_input_tokens_seen": 12040229696, "step": 42340, "train_runtime": 412438.9995, "train_tokens_per_second": 29192.753 }, { "epoch": 1.498426605514731, "grad_norm": 1.5234375, "learning_rate": 2.1853238692192597e-05, "loss": 1.0540481567382813, "num_input_tokens_seen": 12043131968, "step": 42350, "train_runtime": 412541.087, "train_tokens_per_second": 29192.564 }, { "epoch": 1.4987804257784598, "grad_norm": 1.59375, "learning_rate": 2.185115172698846e-05, "loss": 1.0551654815673828, "num_input_tokens_seen": 12045978368, "step": 42360, "train_runtime": 412638.3751, "train_tokens_per_second": 29192.579 }, { "epoch": 1.4991342460421886, "grad_norm": 1.6328125, "learning_rate": 2.1849065359580216e-05, "loss": 1.056142234802246, "num_input_tokens_seen": 12048829120, "step": 42370, "train_runtime": 412736.0112, "train_tokens_per_second": 29192.58 }, { "epoch": 1.4994880663059174, "grad_norm": 1.609375, "learning_rate": 2.1846979589682517e-05, "loss": 1.042633056640625, "num_input_tokens_seen": 12051688192, "step": 42380, "train_runtime": 412833.8281, "train_tokens_per_second": 29192.589 }, { "epoch": 1.4998418865696461, "grad_norm": 1.59375, "learning_rate": 2.184489441701022e-05, "loss": 1.0316919326782226, "num_input_tokens_seen": 12054501504, "step": 42390, "train_runtime": 412929.5533, "train_tokens_per_second": 29192.634 }, { "epoch": 1.500195706833375, "grad_norm": 1.578125, "learning_rate": 2.1842809841278376e-05, "loss": 1.0452521324157715, "num_input_tokens_seen": 12057332352, "step": 42400, "train_runtime": 413025.816, "train_tokens_per_second": 29192.685 }, { "epoch": 1.5005495270971037, "grad_norm": 1.578125, "learning_rate": 2.1840725862202214e-05, "loss": 1.037149429321289, "num_input_tokens_seen": 12060198464, "step": 42410, "train_runtime": 413125.1564, "train_tokens_per_second": 29192.602 }, { "epoch": 1.5009033473608326, "grad_norm": 1.484375, "learning_rate": 2.183864247949716e-05, "loss": 1.0300870895385743, "num_input_tokens_seen": 12063074496, "step": 42420, "train_runtime": 413226.9285, "train_tokens_per_second": 29192.373 }, { "epoch": 1.5012571676245612, "grad_norm": 1.609375, "learning_rate": 2.183655969287883e-05, "loss": 1.0460521697998046, "num_input_tokens_seen": 12065890304, "step": 42430, "train_runtime": 413321.5463, "train_tokens_per_second": 29192.503 }, { "epoch": 1.5016109878882902, "grad_norm": 1.609375, "learning_rate": 2.1834477502063034e-05, "loss": 1.0378887176513671, "num_input_tokens_seen": 12068698816, "step": 42440, "train_runtime": 413417.8118, "train_tokens_per_second": 29192.498 }, { "epoch": 1.5019648081520187, "grad_norm": 1.5546875, "learning_rate": 2.183239590676576e-05, "loss": 1.037282371520996, "num_input_tokens_seen": 12071541632, "step": 42450, "train_runtime": 413516.8409, "train_tokens_per_second": 29192.382 }, { "epoch": 1.5023186284157477, "grad_norm": 1.546875, "learning_rate": 2.1830314906703198e-05, "loss": 1.0383455276489257, "num_input_tokens_seen": 12074359232, "step": 42460, "train_runtime": 413611.3353, "train_tokens_per_second": 29192.525 }, { "epoch": 1.5026724486794765, "grad_norm": 1.5078125, "learning_rate": 2.1828234501591717e-05, "loss": 1.0513297080993653, "num_input_tokens_seen": 12077214400, "step": 42470, "train_runtime": 413710.0004, "train_tokens_per_second": 29192.464 }, { "epoch": 1.5030262689432052, "grad_norm": 1.5390625, "learning_rate": 2.182615469114789e-05, "loss": 1.0450010299682617, "num_input_tokens_seen": 12079984256, "step": 42480, "train_runtime": 413803.1038, "train_tokens_per_second": 29192.59 }, { "epoch": 1.503380089206934, "grad_norm": 1.546875, "learning_rate": 2.182407547508846e-05, "loss": 1.065173053741455, "num_input_tokens_seen": 12082777152, "step": 42490, "train_runtime": 413896.2561, "train_tokens_per_second": 29192.767 }, { "epoch": 1.5037339094706628, "grad_norm": 1.5546875, "learning_rate": 2.1821996853130363e-05, "loss": 1.04293212890625, "num_input_tokens_seen": 12085594880, "step": 42500, "train_runtime": 413990.9459, "train_tokens_per_second": 29192.897 }, { "epoch": 1.5040877297343915, "grad_norm": 1.5234375, "learning_rate": 2.1819918824990745e-05, "loss": 1.0379575729370116, "num_input_tokens_seen": 12088394176, "step": 42510, "train_runtime": 414086.6367, "train_tokens_per_second": 29192.911 }, { "epoch": 1.5044415499981203, "grad_norm": 1.5390625, "learning_rate": 2.1817841390386913e-05, "loss": 1.0347934722900392, "num_input_tokens_seen": 12091286464, "step": 42520, "train_runtime": 414189.0236, "train_tokens_per_second": 29192.677 }, { "epoch": 1.504795370261849, "grad_norm": 1.515625, "learning_rate": 2.1815764549036372e-05, "loss": 1.0424234390258789, "num_input_tokens_seen": 12094099776, "step": 42530, "train_runtime": 414283.7345, "train_tokens_per_second": 29192.794 }, { "epoch": 1.5051491905255778, "grad_norm": 1.5234375, "learning_rate": 2.1813688300656823e-05, "loss": 1.0475288391113282, "num_input_tokens_seen": 12096892544, "step": 42540, "train_runtime": 414377.4291, "train_tokens_per_second": 29192.933 }, { "epoch": 1.5055030107893068, "grad_norm": 1.578125, "learning_rate": 2.181161264496615e-05, "loss": 1.0440555572509767, "num_input_tokens_seen": 12099722304, "step": 42550, "train_runtime": 414476.7732, "train_tokens_per_second": 29192.763 }, { "epoch": 1.5058568310530354, "grad_norm": 1.5625, "learning_rate": 2.1809537581682414e-05, "loss": 1.0527608871459961, "num_input_tokens_seen": 12102568576, "step": 42560, "train_runtime": 414576.9224, "train_tokens_per_second": 29192.577 }, { "epoch": 1.5062106513167643, "grad_norm": 1.5859375, "learning_rate": 2.1807463110523877e-05, "loss": 1.0559452056884766, "num_input_tokens_seen": 12105425984, "step": 42570, "train_runtime": 414676.4146, "train_tokens_per_second": 29192.463 }, { "epoch": 1.506564471580493, "grad_norm": 1.640625, "learning_rate": 2.1805389231208993e-05, "loss": 1.045664405822754, "num_input_tokens_seen": 12108240576, "step": 42580, "train_runtime": 414771.4796, "train_tokens_per_second": 29192.558 }, { "epoch": 1.5069182918442219, "grad_norm": 1.5546875, "learning_rate": 2.1803315943456386e-05, "loss": 1.0540199279785156, "num_input_tokens_seen": 12111070208, "step": 42590, "train_runtime": 414870.1096, "train_tokens_per_second": 29192.439 }, { "epoch": 1.5072721121079504, "grad_norm": 1.59375, "learning_rate": 2.180124324698488e-05, "loss": 1.0544292449951171, "num_input_tokens_seen": 12113892736, "step": 42600, "train_runtime": 414965.3684, "train_tokens_per_second": 29192.539 }, { "epoch": 1.5076259323716794, "grad_norm": 1.609375, "learning_rate": 2.1799171141513476e-05, "loss": 1.046010684967041, "num_input_tokens_seen": 12116740160, "step": 42610, "train_runtime": 415063.8281, "train_tokens_per_second": 29192.474 }, { "epoch": 1.507979752635408, "grad_norm": 1.6171875, "learning_rate": 2.1797099626761385e-05, "loss": 1.047665786743164, "num_input_tokens_seen": 12119576064, "step": 42620, "train_runtime": 415161.2845, "train_tokens_per_second": 29192.452 }, { "epoch": 1.508333572899137, "grad_norm": 1.53125, "learning_rate": 2.179502870244797e-05, "loss": 1.0463827133178711, "num_input_tokens_seen": 12122361472, "step": 42630, "train_runtime": 415256.5711, "train_tokens_per_second": 29192.462 }, { "epoch": 1.5086873931628657, "grad_norm": 1.53125, "learning_rate": 2.1792958368292814e-05, "loss": 1.0368387222290039, "num_input_tokens_seen": 12125185728, "step": 42640, "train_runtime": 415350.7856, "train_tokens_per_second": 29192.639 }, { "epoch": 1.5090412134265945, "grad_norm": 1.53125, "learning_rate": 2.1790888624015656e-05, "loss": 1.047996711730957, "num_input_tokens_seen": 12128054336, "step": 42650, "train_runtime": 415446.6081, "train_tokens_per_second": 29192.811 }, { "epoch": 1.5093950336903232, "grad_norm": 1.5234375, "learning_rate": 2.1788819469336452e-05, "loss": 1.036382293701172, "num_input_tokens_seen": 12130873984, "step": 42660, "train_runtime": 415541.5522, "train_tokens_per_second": 29192.926 }, { "epoch": 1.509748853954052, "grad_norm": 1.53125, "learning_rate": 2.1786750903975316e-05, "loss": 1.0466689109802245, "num_input_tokens_seen": 12133724032, "step": 42670, "train_runtime": 415639.8312, "train_tokens_per_second": 29192.881 }, { "epoch": 1.5101026742177808, "grad_norm": 1.5546875, "learning_rate": 2.178468292765257e-05, "loss": 1.0254417419433595, "num_input_tokens_seen": 12136596352, "step": 42680, "train_runtime": 415738.4127, "train_tokens_per_second": 29192.867 }, { "epoch": 1.5104564944815095, "grad_norm": 1.6640625, "learning_rate": 2.1782615540088703e-05, "loss": 1.034085178375244, "num_input_tokens_seen": 12139420544, "step": 42690, "train_runtime": 415836.4486, "train_tokens_per_second": 29192.777 }, { "epoch": 1.5108103147452383, "grad_norm": 1.546875, "learning_rate": 2.178054874100441e-05, "loss": 1.0588154792785645, "num_input_tokens_seen": 12142253632, "step": 42700, "train_runtime": 415933.7704, "train_tokens_per_second": 29192.757 }, { "epoch": 1.511164135008967, "grad_norm": 1.4921875, "learning_rate": 2.177848253012055e-05, "loss": 1.046395492553711, "num_input_tokens_seen": 12145089920, "step": 42710, "train_runtime": 416030.6338, "train_tokens_per_second": 29192.778 }, { "epoch": 1.511517955272696, "grad_norm": 1.5859375, "learning_rate": 2.177641690715819e-05, "loss": 1.0572474479675293, "num_input_tokens_seen": 12148039232, "step": 42720, "train_runtime": 416134.5092, "train_tokens_per_second": 29192.578 }, { "epoch": 1.5118717755364246, "grad_norm": 1.609375, "learning_rate": 2.1774351871838557e-05, "loss": 1.0362068176269532, "num_input_tokens_seen": 12150827264, "step": 42730, "train_runtime": 416228.3345, "train_tokens_per_second": 29192.696 }, { "epoch": 1.5122255958001536, "grad_norm": 1.5234375, "learning_rate": 2.177228742388308e-05, "loss": 1.0352916717529297, "num_input_tokens_seen": 12153618240, "step": 42740, "train_runtime": 416323.82, "train_tokens_per_second": 29192.704 }, { "epoch": 1.5125794160638821, "grad_norm": 1.5078125, "learning_rate": 2.1770223563013374e-05, "loss": 1.0551420211791993, "num_input_tokens_seen": 12156494272, "step": 42750, "train_runtime": 416422.5607, "train_tokens_per_second": 29192.689 }, { "epoch": 1.5129332363276111, "grad_norm": 1.5, "learning_rate": 2.176816028895123e-05, "loss": 1.0372543334960938, "num_input_tokens_seen": 12159317760, "step": 42760, "train_runtime": 416516.8143, "train_tokens_per_second": 29192.862 }, { "epoch": 1.5132870565913397, "grad_norm": 1.4765625, "learning_rate": 2.1766097601418624e-05, "loss": 1.062789535522461, "num_input_tokens_seen": 12162160128, "step": 42770, "train_runtime": 416612.76, "train_tokens_per_second": 29192.961 }, { "epoch": 1.5136408768550687, "grad_norm": 1.7734375, "learning_rate": 2.176403550013773e-05, "loss": 1.0416414260864257, "num_input_tokens_seen": 12164983872, "step": 42780, "train_runtime": 416709.5207, "train_tokens_per_second": 29192.959 }, { "epoch": 1.5139946971187974, "grad_norm": 1.5078125, "learning_rate": 2.176197398483088e-05, "loss": 1.0398242950439454, "num_input_tokens_seen": 12167836288, "step": 42790, "train_runtime": 416806.3917, "train_tokens_per_second": 29193.017 }, { "epoch": 1.5143485173825262, "grad_norm": 1.5859375, "learning_rate": 2.1759913055220623e-05, "loss": 1.040786361694336, "num_input_tokens_seen": 12170711296, "step": 42800, "train_runtime": 416903.1154, "train_tokens_per_second": 29193.141 }, { "epoch": 1.514702337646255, "grad_norm": 1.6015625, "learning_rate": 2.1757852711029664e-05, "loss": 1.0440271377563477, "num_input_tokens_seen": 12173560000, "step": 42810, "train_runtime": 417001.5546, "train_tokens_per_second": 29193.081 }, { "epoch": 1.5150561579099837, "grad_norm": 1.5546875, "learning_rate": 2.1755792951980896e-05, "loss": 1.0461885452270507, "num_input_tokens_seen": 12176367744, "step": 42820, "train_runtime": 417098.556, "train_tokens_per_second": 29193.023 }, { "epoch": 1.5154099781737125, "grad_norm": 1.578125, "learning_rate": 2.175373377779742e-05, "loss": 1.0404053688049317, "num_input_tokens_seen": 12179276928, "step": 42830, "train_runtime": 417198.6669, "train_tokens_per_second": 29192.991 }, { "epoch": 1.5157637984374412, "grad_norm": 1.53125, "learning_rate": 2.1751675188202493e-05, "loss": 1.0439472198486328, "num_input_tokens_seen": 12182130112, "step": 42840, "train_runtime": 417293.7685, "train_tokens_per_second": 29193.175 }, { "epoch": 1.51611761870117, "grad_norm": 1.59375, "learning_rate": 2.174961718291956e-05, "loss": 1.0283014297485351, "num_input_tokens_seen": 12184963072, "step": 42850, "train_runtime": 417389.1862, "train_tokens_per_second": 29193.289 }, { "epoch": 1.5164714389648988, "grad_norm": 1.5234375, "learning_rate": 2.174755976167226e-05, "loss": 1.0475403785705566, "num_input_tokens_seen": 12187821696, "step": 42860, "train_runtime": 417486.1684, "train_tokens_per_second": 29193.354 }, { "epoch": 1.5168252592286275, "grad_norm": 1.53125, "learning_rate": 2.1745502924184407e-05, "loss": 1.058966064453125, "num_input_tokens_seen": 12190711616, "step": 42870, "train_runtime": 417582.581, "train_tokens_per_second": 29193.535 }, { "epoch": 1.5171790794923563, "grad_norm": 1.5, "learning_rate": 2.1743446670180005e-05, "loss": 1.0328614234924316, "num_input_tokens_seen": 12193600256, "step": 42880, "train_runtime": 417678.5843, "train_tokens_per_second": 29193.741 }, { "epoch": 1.5175328997560853, "grad_norm": 1.59375, "learning_rate": 2.1741390999383225e-05, "loss": 1.0563753128051758, "num_input_tokens_seen": 12196479168, "step": 42890, "train_runtime": 417777.2178, "train_tokens_per_second": 29193.739 }, { "epoch": 1.5178867200198138, "grad_norm": 1.5234375, "learning_rate": 2.1739335911518432e-05, "loss": 1.0326037406921387, "num_input_tokens_seen": 12199325632, "step": 42900, "train_runtime": 417872.28, "train_tokens_per_second": 29193.91 }, { "epoch": 1.5182405402835428, "grad_norm": 1.5390625, "learning_rate": 2.1737281406310186e-05, "loss": 1.0542548179626465, "num_input_tokens_seen": 12202148992, "step": 42910, "train_runtime": 417970.6545, "train_tokens_per_second": 29193.794 }, { "epoch": 1.5185943605472714, "grad_norm": 1.53125, "learning_rate": 2.17352274834832e-05, "loss": 1.0400730133056642, "num_input_tokens_seen": 12204924544, "step": 42920, "train_runtime": 418064.755, "train_tokens_per_second": 29193.861 }, { "epoch": 1.5189481808110004, "grad_norm": 1.546875, "learning_rate": 2.1733174142762388e-05, "loss": 1.0398210525512694, "num_input_tokens_seen": 12207786432, "step": 42930, "train_runtime": 418162.5356, "train_tokens_per_second": 29193.879 }, { "epoch": 1.519302001074729, "grad_norm": 1.59375, "learning_rate": 2.1731121383872852e-05, "loss": 1.0391586303710938, "num_input_tokens_seen": 12210541632, "step": 42940, "train_runtime": 418253.9241, "train_tokens_per_second": 29194.087 }, { "epoch": 1.519655821338458, "grad_norm": 1.5546875, "learning_rate": 2.1729069206539847e-05, "loss": 1.0596964836120606, "num_input_tokens_seen": 12213365440, "step": 42950, "train_runtime": 418351.5407, "train_tokens_per_second": 29194.025 }, { "epoch": 1.5200096416021867, "grad_norm": 1.5703125, "learning_rate": 2.172701761048885e-05, "loss": 1.040212059020996, "num_input_tokens_seen": 12216205056, "step": 42960, "train_runtime": 418450.0997, "train_tokens_per_second": 29193.935 }, { "epoch": 1.5203634618659154, "grad_norm": 1.515625, "learning_rate": 2.1724966595445483e-05, "loss": 1.0396663665771484, "num_input_tokens_seen": 12219023168, "step": 42970, "train_runtime": 418545.2175, "train_tokens_per_second": 29194.034 }, { "epoch": 1.5207172821296442, "grad_norm": 1.5625, "learning_rate": 2.172291616113557e-05, "loss": 1.0443694114685058, "num_input_tokens_seen": 12221892480, "step": 42980, "train_runtime": 418645.7244, "train_tokens_per_second": 29193.879 }, { "epoch": 1.521071102393373, "grad_norm": 1.4609375, "learning_rate": 2.172086630728511e-05, "loss": 1.0352608680725097, "num_input_tokens_seen": 12224784640, "step": 42990, "train_runtime": 418745.8379, "train_tokens_per_second": 29193.806 }, { "epoch": 1.5214249226571017, "grad_norm": 1.515625, "learning_rate": 2.171881703362028e-05, "loss": 1.0279292106628417, "num_input_tokens_seen": 12227680960, "step": 43000, "train_runtime": 418846.1632, "train_tokens_per_second": 29193.728 }, { "epoch": 1.5217787429208305, "grad_norm": 1.515625, "learning_rate": 2.1716768339867445e-05, "loss": 1.0479794502258302, "num_input_tokens_seen": 12230492544, "step": 43010, "train_runtime": 418940.6561, "train_tokens_per_second": 29193.854 }, { "epoch": 1.5221325631845593, "grad_norm": 1.5625, "learning_rate": 2.1714720225753148e-05, "loss": 1.051537036895752, "num_input_tokens_seen": 12233338944, "step": 43020, "train_runtime": 419035.3543, "train_tokens_per_second": 29194.05 }, { "epoch": 1.522486383448288, "grad_norm": 1.5546875, "learning_rate": 2.1712672691004098e-05, "loss": 1.0505584716796874, "num_input_tokens_seen": 12236178880, "step": 43030, "train_runtime": 419134.3926, "train_tokens_per_second": 29193.927 }, { "epoch": 1.522840203712017, "grad_norm": 1.5390625, "learning_rate": 2.171062573534722e-05, "loss": 1.0368742942810059, "num_input_tokens_seen": 12238977280, "step": 43040, "train_runtime": 419229.5784, "train_tokens_per_second": 29193.974 }, { "epoch": 1.5231940239757455, "grad_norm": 1.6015625, "learning_rate": 2.1708579358509578e-05, "loss": 1.0479641914367677, "num_input_tokens_seen": 12241750400, "step": 43050, "train_runtime": 419324.152, "train_tokens_per_second": 29194.003 }, { "epoch": 1.5235478442394745, "grad_norm": 1.5, "learning_rate": 2.1706533560218447e-05, "loss": 1.042159080505371, "num_input_tokens_seen": 12244605504, "step": 43060, "train_runtime": 419421.5721, "train_tokens_per_second": 29194.029 }, { "epoch": 1.523901664503203, "grad_norm": 1.59375, "learning_rate": 2.1704488340201262e-05, "loss": 1.0577176094055176, "num_input_tokens_seen": 12247415680, "step": 43070, "train_runtime": 419517.9375, "train_tokens_per_second": 29194.021 }, { "epoch": 1.524255484766932, "grad_norm": 1.5, "learning_rate": 2.170244369818564e-05, "loss": 1.031463050842285, "num_input_tokens_seen": 12250276096, "step": 43080, "train_runtime": 419613.7672, "train_tokens_per_second": 29194.171 }, { "epoch": 1.5246093050306606, "grad_norm": 1.546875, "learning_rate": 2.17003996338994e-05, "loss": 1.034702682495117, "num_input_tokens_seen": 12253115968, "step": 43090, "train_runtime": 419711.2986, "train_tokens_per_second": 29194.153 }, { "epoch": 1.5249631252943896, "grad_norm": 1.5234375, "learning_rate": 2.1698356147070515e-05, "loss": 1.0415021896362304, "num_input_tokens_seen": 12255938880, "step": 43100, "train_runtime": 419804.6666, "train_tokens_per_second": 29194.385 }, { "epoch": 1.5253169455581181, "grad_norm": 1.546875, "learning_rate": 2.169631323742714e-05, "loss": 1.0493538856506348, "num_input_tokens_seen": 12258805568, "step": 43110, "train_runtime": 419900.5082, "train_tokens_per_second": 29194.548 }, { "epoch": 1.5256707658218471, "grad_norm": 1.5625, "learning_rate": 2.1694270904697623e-05, "loss": 1.04089412689209, "num_input_tokens_seen": 12261658944, "step": 43120, "train_runtime": 419996.967, "train_tokens_per_second": 29194.637 }, { "epoch": 1.526024586085576, "grad_norm": 1.625, "learning_rate": 2.169222914861048e-05, "loss": 1.0408832550048828, "num_input_tokens_seen": 12264533888, "step": 43130, "train_runtime": 420095.2484, "train_tokens_per_second": 29194.65 }, { "epoch": 1.5263784063493047, "grad_norm": 1.5390625, "learning_rate": 2.1690187968894404e-05, "loss": 1.0360333442687988, "num_input_tokens_seen": 12267309504, "step": 43140, "train_runtime": 420187.6432, "train_tokens_per_second": 29194.836 }, { "epoch": 1.5267322266130334, "grad_norm": 1.546875, "learning_rate": 2.168814736527828e-05, "loss": 1.0442935943603515, "num_input_tokens_seen": 12270153472, "step": 43150, "train_runtime": 420285.7195, "train_tokens_per_second": 29194.79 }, { "epoch": 1.5270860468767622, "grad_norm": 1.5390625, "learning_rate": 2.1686107337491155e-05, "loss": 1.0598824501037598, "num_input_tokens_seen": 12272988096, "step": 43160, "train_runtime": 420381.7686, "train_tokens_per_second": 29194.863 }, { "epoch": 1.527439867140491, "grad_norm": 1.515625, "learning_rate": 2.1684067885262266e-05, "loss": 1.0544626235961914, "num_input_tokens_seen": 12275819520, "step": 43170, "train_runtime": 420478.0983, "train_tokens_per_second": 29194.908 }, { "epoch": 1.5277936874042197, "grad_norm": 1.5390625, "learning_rate": 2.1682029008321024e-05, "loss": 1.0444058418273925, "num_input_tokens_seen": 12278695552, "step": 43180, "train_runtime": 420577.9048, "train_tokens_per_second": 29194.818 }, { "epoch": 1.5281475076679485, "grad_norm": 1.59375, "learning_rate": 2.167999070639702e-05, "loss": 1.0490710258483886, "num_input_tokens_seen": 12281526208, "step": 43190, "train_runtime": 420676.5867, "train_tokens_per_second": 29194.699 }, { "epoch": 1.5285013279316773, "grad_norm": 1.53125, "learning_rate": 2.1677952979220015e-05, "loss": 1.0391048431396483, "num_input_tokens_seen": 12284343616, "step": 43200, "train_runtime": 420772.9571, "train_tokens_per_second": 29194.708 }, { "epoch": 1.5288551481954062, "grad_norm": 1.53125, "learning_rate": 2.167591582651996e-05, "loss": 1.0537946701049805, "num_input_tokens_seen": 12287138176, "step": 43210, "train_runtime": 420868.9598, "train_tokens_per_second": 29194.688 }, { "epoch": 1.5292089684591348, "grad_norm": 1.5625, "learning_rate": 2.1673879248026977e-05, "loss": 1.0563127517700195, "num_input_tokens_seen": 12289980992, "step": 43220, "train_runtime": 420966.0616, "train_tokens_per_second": 29194.707 }, { "epoch": 1.5295627887228638, "grad_norm": 1.640625, "learning_rate": 2.1671843243471366e-05, "loss": 1.0555213928222655, "num_input_tokens_seen": 12292877440, "step": 43230, "train_runtime": 421065.1127, "train_tokens_per_second": 29194.719 }, { "epoch": 1.5299166089865923, "grad_norm": 1.578125, "learning_rate": 2.1669807812583602e-05, "loss": 1.0501736640930175, "num_input_tokens_seen": 12295747712, "step": 43240, "train_runtime": 421165.1097, "train_tokens_per_second": 29194.602 }, { "epoch": 1.5302704292503213, "grad_norm": 1.65625, "learning_rate": 2.1667772955094347e-05, "loss": 1.0316579818725586, "num_input_tokens_seen": 12298618496, "step": 43250, "train_runtime": 421262.419, "train_tokens_per_second": 29194.673 }, { "epoch": 1.5306242495140499, "grad_norm": 1.6328125, "learning_rate": 2.1665738670734422e-05, "loss": 1.0505202293395997, "num_input_tokens_seen": 12301503552, "step": 43260, "train_runtime": 421364.4653, "train_tokens_per_second": 29194.449 }, { "epoch": 1.5309780697777788, "grad_norm": 1.5859375, "learning_rate": 2.166370495923485e-05, "loss": 1.0442238807678224, "num_input_tokens_seen": 12304304192, "step": 43270, "train_runtime": 421457.8542, "train_tokens_per_second": 29194.625 }, { "epoch": 1.5313318900415074, "grad_norm": 1.5078125, "learning_rate": 2.16616718203268e-05, "loss": 1.0508591651916503, "num_input_tokens_seen": 12307178752, "step": 43280, "train_runtime": 421555.7308, "train_tokens_per_second": 29194.666 }, { "epoch": 1.5316857103052364, "grad_norm": 1.5703125, "learning_rate": 2.1659639253741637e-05, "loss": 1.0491396903991699, "num_input_tokens_seen": 12310115008, "step": 43290, "train_runtime": 421660.404, "train_tokens_per_second": 29194.382 }, { "epoch": 1.5320395305689651, "grad_norm": 1.5, "learning_rate": 2.1657607259210906e-05, "loss": 1.0359157562255858, "num_input_tokens_seen": 12312915904, "step": 43300, "train_runtime": 421754.138, "train_tokens_per_second": 29194.535 }, { "epoch": 1.532393350832694, "grad_norm": 1.5546875, "learning_rate": 2.1655575836466328e-05, "loss": 1.0286699295043946, "num_input_tokens_seen": 12315801152, "step": 43310, "train_runtime": 421850.7504, "train_tokens_per_second": 29194.688 }, { "epoch": 1.5327471710964227, "grad_norm": 1.5703125, "learning_rate": 2.1653544985239775e-05, "loss": 1.0502691268920898, "num_input_tokens_seen": 12318612608, "step": 43320, "train_runtime": 421946.4108, "train_tokens_per_second": 29194.733 }, { "epoch": 1.5331009913601514, "grad_norm": 1.5390625, "learning_rate": 2.1651514705263324e-05, "loss": 1.0324738502502442, "num_input_tokens_seen": 12321439360, "step": 43330, "train_runtime": 422043.3891, "train_tokens_per_second": 29194.722 }, { "epoch": 1.5334548116238802, "grad_norm": 1.4921875, "learning_rate": 2.164948499626922e-05, "loss": 1.0371762275695802, "num_input_tokens_seen": 12324267840, "step": 43340, "train_runtime": 422139.3144, "train_tokens_per_second": 29194.788 }, { "epoch": 1.533808631887609, "grad_norm": 1.53125, "learning_rate": 2.1647455857989867e-05, "loss": 1.0468305587768554, "num_input_tokens_seen": 12327083776, "step": 43350, "train_runtime": 422237.1323, "train_tokens_per_second": 29194.694 }, { "epoch": 1.5341624521513377, "grad_norm": 1.515625, "learning_rate": 2.164542729015788e-05, "loss": 1.0604291915893556, "num_input_tokens_seen": 12329918656, "step": 43360, "train_runtime": 422332.4121, "train_tokens_per_second": 29194.82 }, { "epoch": 1.5345162724150665, "grad_norm": 1.546875, "learning_rate": 2.1643399292506014e-05, "loss": 1.041202926635742, "num_input_tokens_seen": 12332732800, "step": 43370, "train_runtime": 422427.1519, "train_tokens_per_second": 29194.934 }, { "epoch": 1.5348700926787955, "grad_norm": 1.5390625, "learning_rate": 2.164137186476722e-05, "loss": 1.0472566604614257, "num_input_tokens_seen": 12335606464, "step": 43380, "train_runtime": 422524.3422, "train_tokens_per_second": 29195.02 }, { "epoch": 1.535223912942524, "grad_norm": 1.59375, "learning_rate": 2.1639345006674607e-05, "loss": 1.0419801712036132, "num_input_tokens_seen": 12338514496, "step": 43390, "train_runtime": 422624.1145, "train_tokens_per_second": 29195.008 }, { "epoch": 1.535577733206253, "grad_norm": 1.5234375, "learning_rate": 2.1637318717961477e-05, "loss": 1.0485687255859375, "num_input_tokens_seen": 12341371840, "step": 43400, "train_runtime": 422721.5974, "train_tokens_per_second": 29195.035 }, { "epoch": 1.5359315534699816, "grad_norm": 1.5625, "learning_rate": 2.16352929983613e-05, "loss": 1.04600248336792, "num_input_tokens_seen": 12344204800, "step": 43410, "train_runtime": 422816.7219, "train_tokens_per_second": 29195.167 }, { "epoch": 1.5362853737337105, "grad_norm": 1.53125, "learning_rate": 2.1633267847607718e-05, "loss": 1.0444555282592773, "num_input_tokens_seen": 12347099648, "step": 43420, "train_runtime": 422918.9801, "train_tokens_per_second": 29194.953 }, { "epoch": 1.536639193997439, "grad_norm": 1.5390625, "learning_rate": 2.1631243265434543e-05, "loss": 1.0559234619140625, "num_input_tokens_seen": 12349994944, "step": 43430, "train_runtime": 423016.1553, "train_tokens_per_second": 29195.091 }, { "epoch": 1.536993014261168, "grad_norm": 1.609375, "learning_rate": 2.1629219251575783e-05, "loss": 1.056288719177246, "num_input_tokens_seen": 12352848384, "step": 43440, "train_runtime": 423112.3279, "train_tokens_per_second": 29195.198 }, { "epoch": 1.5373468345248966, "grad_norm": 1.5703125, "learning_rate": 2.1627195805765592e-05, "loss": 1.0437440872192383, "num_input_tokens_seen": 12355717632, "step": 43450, "train_runtime": 423211.9966, "train_tokens_per_second": 29195.103 }, { "epoch": 1.5377006547886256, "grad_norm": 1.5234375, "learning_rate": 2.162517292773831e-05, "loss": 1.0504669189453124, "num_input_tokens_seen": 12358574016, "step": 43460, "train_runtime": 423309.1987, "train_tokens_per_second": 29195.146 }, { "epoch": 1.5380544750523544, "grad_norm": 1.4921875, "learning_rate": 2.1623150617228456e-05, "loss": 1.0412670135498048, "num_input_tokens_seen": 12361382976, "step": 43470, "train_runtime": 423404.9539, "train_tokens_per_second": 29195.178 }, { "epoch": 1.5384082953160831, "grad_norm": 1.59375, "learning_rate": 2.1621128873970715e-05, "loss": 1.0383896827697754, "num_input_tokens_seen": 12364179456, "step": 43480, "train_runtime": 423499.5818, "train_tokens_per_second": 29195.258 }, { "epoch": 1.538762115579812, "grad_norm": 1.4453125, "learning_rate": 2.1619107697699955e-05, "loss": 1.0356176376342774, "num_input_tokens_seen": 12367064192, "step": 43490, "train_runtime": 423598.0425, "train_tokens_per_second": 29195.282 }, { "epoch": 1.5391159358435407, "grad_norm": 1.5703125, "learning_rate": 2.1617087088151208e-05, "loss": 1.0627592086791993, "num_input_tokens_seen": 12369846336, "step": 43500, "train_runtime": 423689.4189, "train_tokens_per_second": 29195.552 }, { "epoch": 1.5394697561072694, "grad_norm": 1.578125, "learning_rate": 2.1615067045059685e-05, "loss": 1.0589136123657226, "num_input_tokens_seen": 12372748672, "step": 43510, "train_runtime": 423792.5135, "train_tokens_per_second": 29195.298 }, { "epoch": 1.5398235763709982, "grad_norm": 1.5546875, "learning_rate": 2.161304756816076e-05, "loss": 1.0461523056030273, "num_input_tokens_seen": 12375564032, "step": 43520, "train_runtime": 423886.8529, "train_tokens_per_second": 29195.442 }, { "epoch": 1.540177396634727, "grad_norm": 1.578125, "learning_rate": 2.1611028657189997e-05, "loss": 1.0475812911987306, "num_input_tokens_seen": 12378426496, "step": 43530, "train_runtime": 423984.8066, "train_tokens_per_second": 29195.448 }, { "epoch": 1.5405312168984557, "grad_norm": 1.578125, "learning_rate": 2.160901031188312e-05, "loss": 1.0542695999145508, "num_input_tokens_seen": 12381221568, "step": 43540, "train_runtime": 424078.8232, "train_tokens_per_second": 29195.567 }, { "epoch": 1.5408850371621847, "grad_norm": 1.5859375, "learning_rate": 2.1606992531976027e-05, "loss": 1.042238140106201, "num_input_tokens_seen": 12384109184, "step": 43550, "train_runtime": 424179.319, "train_tokens_per_second": 29195.457 }, { "epoch": 1.5412388574259133, "grad_norm": 1.546875, "learning_rate": 2.1604975317204805e-05, "loss": 1.0426836013793945, "num_input_tokens_seen": 12386943936, "step": 43560, "train_runtime": 424275.723, "train_tokens_per_second": 29195.505 }, { "epoch": 1.5415926776896423, "grad_norm": 1.5234375, "learning_rate": 2.160295866730568e-05, "loss": 1.0295053482055665, "num_input_tokens_seen": 12389767488, "step": 43570, "train_runtime": 424372.8634, "train_tokens_per_second": 29195.475 }, { "epoch": 1.5419464979533708, "grad_norm": 1.5703125, "learning_rate": 2.160094258201508e-05, "loss": 1.0637248039245606, "num_input_tokens_seen": 12392641280, "step": 43580, "train_runtime": 424472.3734, "train_tokens_per_second": 29195.401 }, { "epoch": 1.5423003182170998, "grad_norm": 1.5546875, "learning_rate": 2.1598927061069596e-05, "loss": 1.0461264610290528, "num_input_tokens_seen": 12395480384, "step": 43590, "train_runtime": 424568.6398, "train_tokens_per_second": 29195.469 }, { "epoch": 1.5426541384808283, "grad_norm": 1.5390625, "learning_rate": 2.159691210420599e-05, "loss": 1.0489859580993652, "num_input_tokens_seen": 12398313600, "step": 43600, "train_runtime": 424666.1858, "train_tokens_per_second": 29195.434 }, { "epoch": 1.5430079587445573, "grad_norm": 1.5625, "learning_rate": 2.1594897711161196e-05, "loss": 1.0430309295654296, "num_input_tokens_seen": 12401137984, "step": 43610, "train_runtime": 424763.7164, "train_tokens_per_second": 29195.38 }, { "epoch": 1.543361779008286, "grad_norm": 1.5546875, "learning_rate": 2.1592883881672317e-05, "loss": 1.0336658477783203, "num_input_tokens_seen": 12403944384, "step": 43620, "train_runtime": 424859.5892, "train_tokens_per_second": 29195.397 }, { "epoch": 1.5437155992720148, "grad_norm": 1.609375, "learning_rate": 2.1590870615476628e-05, "loss": 1.0417205810546875, "num_input_tokens_seen": 12406708288, "step": 43630, "train_runtime": 424951.5157, "train_tokens_per_second": 29195.585 }, { "epoch": 1.5440694195357436, "grad_norm": 1.484375, "learning_rate": 2.158885791231158e-05, "loss": 1.0469600677490234, "num_input_tokens_seen": 12409582400, "step": 43640, "train_runtime": 425052.6828, "train_tokens_per_second": 29195.398 }, { "epoch": 1.5444232397994724, "grad_norm": 1.6015625, "learning_rate": 2.15868457719148e-05, "loss": 1.0430903434753418, "num_input_tokens_seen": 12412413120, "step": 43650, "train_runtime": 425149.8215, "train_tokens_per_second": 29195.386 }, { "epoch": 1.5447770600632011, "grad_norm": 1.546875, "learning_rate": 2.158483419402407e-05, "loss": 1.0475128173828125, "num_input_tokens_seen": 12415259136, "step": 43660, "train_runtime": 425245.5321, "train_tokens_per_second": 29195.508 }, { "epoch": 1.54513088032693, "grad_norm": 1.5546875, "learning_rate": 2.158282317837736e-05, "loss": 1.0455371856689453, "num_input_tokens_seen": 12418113728, "step": 43670, "train_runtime": 425344.4959, "train_tokens_per_second": 29195.426 }, { "epoch": 1.5454847005906587, "grad_norm": 1.5078125, "learning_rate": 2.1580812724712792e-05, "loss": 1.0389822006225586, "num_input_tokens_seen": 12420983232, "step": 43680, "train_runtime": 425442.5918, "train_tokens_per_second": 29195.439 }, { "epoch": 1.5458385208543874, "grad_norm": 1.4296875, "learning_rate": 2.157880283276868e-05, "loss": 1.0300063133239745, "num_input_tokens_seen": 12423910528, "step": 43690, "train_runtime": 425547.5032, "train_tokens_per_second": 29195.12 }, { "epoch": 1.5461923411181162, "grad_norm": 1.5625, "learning_rate": 2.1576793502283494e-05, "loss": 1.0402565956115724, "num_input_tokens_seen": 12426757504, "step": 43700, "train_runtime": 425646.2978, "train_tokens_per_second": 29195.033 }, { "epoch": 1.546546161381845, "grad_norm": 1.578125, "learning_rate": 2.1574784732995884e-05, "loss": 1.0457696914672852, "num_input_tokens_seen": 12429555392, "step": 43710, "train_runtime": 425740.1585, "train_tokens_per_second": 29195.168 }, { "epoch": 1.546899981645574, "grad_norm": 1.6171875, "learning_rate": 2.1572776524644658e-05, "loss": 1.039921188354492, "num_input_tokens_seen": 12432411840, "step": 43720, "train_runtime": 425841.5584, "train_tokens_per_second": 29194.924 }, { "epoch": 1.5472538019093025, "grad_norm": 1.59375, "learning_rate": 2.1570768876968802e-05, "loss": 1.039276695251465, "num_input_tokens_seen": 12435229312, "step": 43730, "train_runtime": 425936.6784, "train_tokens_per_second": 29195.019 }, { "epoch": 1.5476076221730315, "grad_norm": 1.546875, "learning_rate": 2.1568761789707474e-05, "loss": 1.0489606857299805, "num_input_tokens_seen": 12438057088, "step": 43740, "train_runtime": 426032.5596, "train_tokens_per_second": 29195.086 }, { "epoch": 1.54796144243676, "grad_norm": 1.5859375, "learning_rate": 2.15667552626e-05, "loss": 1.0413787841796875, "num_input_tokens_seen": 12440882112, "step": 43750, "train_runtime": 426129.7919, "train_tokens_per_second": 29195.054 }, { "epoch": 1.548315262700489, "grad_norm": 1.5234375, "learning_rate": 2.1564749295385872e-05, "loss": 1.051457977294922, "num_input_tokens_seen": 12443744384, "step": 43760, "train_runtime": 426228.2363, "train_tokens_per_second": 29195.026 }, { "epoch": 1.5486690829642176, "grad_norm": 1.6015625, "learning_rate": 2.1562743887804757e-05, "loss": 1.053226852416992, "num_input_tokens_seen": 12446624256, "step": 43770, "train_runtime": 426328.5979, "train_tokens_per_second": 29194.908 }, { "epoch": 1.5490229032279466, "grad_norm": 1.4765625, "learning_rate": 2.1560739039596485e-05, "loss": 1.0394094467163086, "num_input_tokens_seen": 12449464896, "step": 43780, "train_runtime": 426426.9263, "train_tokens_per_second": 29194.838 }, { "epoch": 1.5493767234916753, "grad_norm": 1.5234375, "learning_rate": 2.1558734750501068e-05, "loss": 1.039376449584961, "num_input_tokens_seen": 12452267776, "step": 43790, "train_runtime": 426522.3152, "train_tokens_per_second": 29194.88 }, { "epoch": 1.549730543755404, "grad_norm": 1.5625, "learning_rate": 2.1556731020258664e-05, "loss": 1.0416500091552734, "num_input_tokens_seen": 12455164288, "step": 43800, "train_runtime": 426622.3669, "train_tokens_per_second": 29194.823 }, { "epoch": 1.5500843640191329, "grad_norm": 1.5234375, "learning_rate": 2.1554727848609627e-05, "loss": 1.039046287536621, "num_input_tokens_seen": 12458012544, "step": 43810, "train_runtime": 426718.4193, "train_tokens_per_second": 29194.926 }, { "epoch": 1.5504381842828616, "grad_norm": 1.578125, "learning_rate": 2.155272523529446e-05, "loss": 1.0542257308959961, "num_input_tokens_seen": 12460797376, "step": 43820, "train_runtime": 426814.9971, "train_tokens_per_second": 29194.844 }, { "epoch": 1.5507920045465904, "grad_norm": 1.59375, "learning_rate": 2.1550723180053844e-05, "loss": 1.0441154479980468, "num_input_tokens_seen": 12463622784, "step": 43830, "train_runtime": 426913.4158, "train_tokens_per_second": 29194.732 }, { "epoch": 1.5511458248103192, "grad_norm": 1.5859375, "learning_rate": 2.154872168262863e-05, "loss": 1.0531270980834961, "num_input_tokens_seen": 12466459840, "step": 43840, "train_runtime": 427010.8291, "train_tokens_per_second": 29194.716 }, { "epoch": 1.551499645074048, "grad_norm": 1.59375, "learning_rate": 2.1546720742759827e-05, "loss": 1.0457523345947266, "num_input_tokens_seen": 12469283840, "step": 43850, "train_runtime": 427110.183, "train_tokens_per_second": 29194.537 }, { "epoch": 1.5518534653377767, "grad_norm": 1.59375, "learning_rate": 2.1544720360188627e-05, "loss": 1.0378005027770996, "num_input_tokens_seen": 12472106944, "step": 43860, "train_runtime": 427206.7736, "train_tokens_per_second": 29194.544 }, { "epoch": 1.5522072856015057, "grad_norm": 1.6171875, "learning_rate": 2.1542720534656376e-05, "loss": 1.0333465576171874, "num_input_tokens_seen": 12474971072, "step": 43870, "train_runtime": 427307.1717, "train_tokens_per_second": 29194.387 }, { "epoch": 1.5525611058652342, "grad_norm": 1.546875, "learning_rate": 2.1540721265904594e-05, "loss": 1.0362982749938965, "num_input_tokens_seen": 12477812096, "step": 43880, "train_runtime": 427403.432, "train_tokens_per_second": 29194.459 }, { "epoch": 1.5529149261289632, "grad_norm": 1.515625, "learning_rate": 2.153872255367498e-05, "loss": 1.0396611213684082, "num_input_tokens_seen": 12480686400, "step": 43890, "train_runtime": 427502.2978, "train_tokens_per_second": 29194.431 }, { "epoch": 1.5532687463926917, "grad_norm": 1.5859375, "learning_rate": 2.1536724397709374e-05, "loss": 1.0510746002197267, "num_input_tokens_seen": 12483482560, "step": 43900, "train_runtime": 427596.3897, "train_tokens_per_second": 29194.546 }, { "epoch": 1.5536225666564207, "grad_norm": 1.5703125, "learning_rate": 2.1534726797749813e-05, "loss": 1.0677972793579102, "num_input_tokens_seen": 12486327744, "step": 43910, "train_runtime": 427691.4493, "train_tokens_per_second": 29194.71 }, { "epoch": 1.5539763869201493, "grad_norm": 1.5703125, "learning_rate": 2.153272975353848e-05, "loss": 1.0305341720581054, "num_input_tokens_seen": 12489117760, "step": 43920, "train_runtime": 427786.8053, "train_tokens_per_second": 29194.724 }, { "epoch": 1.5543302071838783, "grad_norm": 1.5546875, "learning_rate": 2.1530733264817737e-05, "loss": 1.0405635833740234, "num_input_tokens_seen": 12491962432, "step": 43930, "train_runtime": 427884.0641, "train_tokens_per_second": 29194.736 }, { "epoch": 1.5546840274476068, "grad_norm": 1.515625, "learning_rate": 2.152873733133011e-05, "loss": 1.0432016372680664, "num_input_tokens_seen": 12494818688, "step": 43940, "train_runtime": 427982.7358, "train_tokens_per_second": 29194.679 }, { "epoch": 1.5550378477113358, "grad_norm": 1.6171875, "learning_rate": 2.1526741952818296e-05, "loss": 1.0429587364196777, "num_input_tokens_seen": 12497623616, "step": 43950, "train_runtime": 428078.8085, "train_tokens_per_second": 29194.68 }, { "epoch": 1.5553916679750646, "grad_norm": 1.53125, "learning_rate": 2.152474712902514e-05, "loss": 1.0428516387939453, "num_input_tokens_seen": 12500495488, "step": 43960, "train_runtime": 428177.0438, "train_tokens_per_second": 29194.689 }, { "epoch": 1.5557454882387933, "grad_norm": 1.546875, "learning_rate": 2.1522752859693686e-05, "loss": 1.0450689315795898, "num_input_tokens_seen": 12503396544, "step": 43970, "train_runtime": 428275.3307, "train_tokens_per_second": 29194.762 }, { "epoch": 1.556099308502522, "grad_norm": 1.4296875, "learning_rate": 2.152075914456711e-05, "loss": 1.0359740257263184, "num_input_tokens_seen": 12506165056, "step": 43980, "train_runtime": 428369.0549, "train_tokens_per_second": 29194.838 }, { "epoch": 1.5564531287662509, "grad_norm": 1.53125, "learning_rate": 2.1518765983388788e-05, "loss": 1.0476415634155274, "num_input_tokens_seen": 12508950272, "step": 43990, "train_runtime": 428463.596, "train_tokens_per_second": 29194.896 }, { "epoch": 1.5568069490299796, "grad_norm": 1.5234375, "learning_rate": 2.1516773375902238e-05, "loss": 1.0386534690856934, "num_input_tokens_seen": 12511763648, "step": 44000, "train_runtime": 428559.0501, "train_tokens_per_second": 29194.958 }, { "epoch": 1.5571607692937084, "grad_norm": 1.6171875, "learning_rate": 2.1514781321851152e-05, "loss": 1.0571907997131347, "num_input_tokens_seen": 12514606592, "step": 44010, "train_runtime": 428653.7401, "train_tokens_per_second": 29195.141 }, { "epoch": 1.5575145895574372, "grad_norm": 1.46875, "learning_rate": 2.1512789820979384e-05, "loss": 1.0358988761901855, "num_input_tokens_seen": 12517426304, "step": 44020, "train_runtime": 428748.709, "train_tokens_per_second": 29195.251 }, { "epoch": 1.557868409821166, "grad_norm": 1.5703125, "learning_rate": 2.1510798873030965e-05, "loss": 1.056374740600586, "num_input_tokens_seen": 12520287168, "step": 44030, "train_runtime": 428845.5862, "train_tokens_per_second": 29195.327 }, { "epoch": 1.558222230084895, "grad_norm": 1.5234375, "learning_rate": 2.1508808477750084e-05, "loss": 1.0577253341674804, "num_input_tokens_seen": 12523135232, "step": 44040, "train_runtime": 428941.2479, "train_tokens_per_second": 29195.456 }, { "epoch": 1.5585760503486235, "grad_norm": 1.515625, "learning_rate": 2.1506818634881096e-05, "loss": 1.0331825256347655, "num_input_tokens_seen": 12525946816, "step": 44050, "train_runtime": 429035.8043, "train_tokens_per_second": 29195.575 }, { "epoch": 1.5589298706123524, "grad_norm": 1.5625, "learning_rate": 2.1504829344168518e-05, "loss": 1.0354949951171875, "num_input_tokens_seen": 12528793280, "step": 44060, "train_runtime": 429134.8158, "train_tokens_per_second": 29195.471 }, { "epoch": 1.559283690876081, "grad_norm": 1.5078125, "learning_rate": 2.1502840605357042e-05, "loss": 1.0373895645141602, "num_input_tokens_seen": 12531591424, "step": 44070, "train_runtime": 429230.4733, "train_tokens_per_second": 29195.484 }, { "epoch": 1.55963751113981, "grad_norm": 1.578125, "learning_rate": 2.1500852418191518e-05, "loss": 1.0414798736572266, "num_input_tokens_seen": 12534477184, "step": 44080, "train_runtime": 429332.8976, "train_tokens_per_second": 29195.24 }, { "epoch": 1.5599913314035385, "grad_norm": 1.578125, "learning_rate": 2.1498864782416958e-05, "loss": 1.0361026763916015, "num_input_tokens_seen": 12537293888, "step": 44090, "train_runtime": 429427.1601, "train_tokens_per_second": 29195.391 }, { "epoch": 1.5603451516672675, "grad_norm": 1.5703125, "learning_rate": 2.1496877697778547e-05, "loss": 1.045965576171875, "num_input_tokens_seen": 12540124032, "step": 44100, "train_runtime": 429522.7224, "train_tokens_per_second": 29195.485 }, { "epoch": 1.560698971930996, "grad_norm": 1.5390625, "learning_rate": 2.1494891164021637e-05, "loss": 1.0534655570983886, "num_input_tokens_seen": 12542967296, "step": 44110, "train_runtime": 429620.2897, "train_tokens_per_second": 29195.472 }, { "epoch": 1.561052792194725, "grad_norm": 1.5546875, "learning_rate": 2.149290518089173e-05, "loss": 1.0562336921691895, "num_input_tokens_seen": 12545837312, "step": 44120, "train_runtime": 429719.3938, "train_tokens_per_second": 29195.418 }, { "epoch": 1.5614066124584538, "grad_norm": 1.6328125, "learning_rate": 2.1490919748134512e-05, "loss": 1.0469095230102539, "num_input_tokens_seen": 12548620288, "step": 44130, "train_runtime": 429814.3738, "train_tokens_per_second": 29195.441 }, { "epoch": 1.5617604327221826, "grad_norm": 1.5546875, "learning_rate": 2.1488934865495812e-05, "loss": 1.0596696853637695, "num_input_tokens_seen": 12551454720, "step": 44140, "train_runtime": 429908.59, "train_tokens_per_second": 29195.636 }, { "epoch": 1.5621142529859113, "grad_norm": 1.5703125, "learning_rate": 2.1486950532721642e-05, "loss": 1.047023391723633, "num_input_tokens_seen": 12554275392, "step": 44150, "train_runtime": 430004.0307, "train_tokens_per_second": 29195.716 }, { "epoch": 1.56246807324964, "grad_norm": 1.546875, "learning_rate": 2.1484966749558173e-05, "loss": 1.0512585639953613, "num_input_tokens_seen": 12557107904, "step": 44160, "train_runtime": 430098.3346, "train_tokens_per_second": 29195.9 }, { "epoch": 1.5628218935133689, "grad_norm": 1.6171875, "learning_rate": 2.1482983515751732e-05, "loss": 1.0472970962524415, "num_input_tokens_seen": 12559961920, "step": 44170, "train_runtime": 430194.6214, "train_tokens_per_second": 29195.999 }, { "epoch": 1.5631757137770976, "grad_norm": 1.5703125, "learning_rate": 2.1481000831048812e-05, "loss": 1.061131477355957, "num_input_tokens_seen": 12562849856, "step": 44180, "train_runtime": 430289.7902, "train_tokens_per_second": 29196.254 }, { "epoch": 1.5635295340408264, "grad_norm": 1.515625, "learning_rate": 2.147901869519609e-05, "loss": 1.0481048583984376, "num_input_tokens_seen": 12565730240, "step": 44190, "train_runtime": 430390.6847, "train_tokens_per_second": 29196.102 }, { "epoch": 1.5638833543045552, "grad_norm": 1.5, "learning_rate": 2.147703710794037e-05, "loss": 1.0524595260620118, "num_input_tokens_seen": 12568560064, "step": 44200, "train_runtime": 430484.8898, "train_tokens_per_second": 29196.286 }, { "epoch": 1.5642371745682841, "grad_norm": 1.59375, "learning_rate": 2.147505606902865e-05, "loss": 1.0452356338500977, "num_input_tokens_seen": 12571387584, "step": 44210, "train_runtime": 430580.361, "train_tokens_per_second": 29196.379 }, { "epoch": 1.5645909948320127, "grad_norm": 1.5625, "learning_rate": 2.147307557820808e-05, "loss": 1.036658477783203, "num_input_tokens_seen": 12574206720, "step": 44220, "train_runtime": 430676.4645, "train_tokens_per_second": 29196.41 }, { "epoch": 1.5649448150957417, "grad_norm": 1.59375, "learning_rate": 2.147109563522597e-05, "loss": 1.0526797294616699, "num_input_tokens_seen": 12577028288, "step": 44230, "train_runtime": 430769.3209, "train_tokens_per_second": 29196.667 }, { "epoch": 1.5652986353594702, "grad_norm": 1.546875, "learning_rate": 2.1469116239829804e-05, "loss": 1.046884250640869, "num_input_tokens_seen": 12579834816, "step": 44240, "train_runtime": 430862.5779, "train_tokens_per_second": 29196.861 }, { "epoch": 1.5656524556231992, "grad_norm": 1.640625, "learning_rate": 2.1467137391767213e-05, "loss": 1.0525732040405273, "num_input_tokens_seen": 12582689984, "step": 44250, "train_runtime": 430959.7349, "train_tokens_per_second": 29196.904 }, { "epoch": 1.5660062758869278, "grad_norm": 1.515625, "learning_rate": 2.146515909078601e-05, "loss": 1.0342742919921875, "num_input_tokens_seen": 12585563968, "step": 44260, "train_runtime": 431061.0219, "train_tokens_per_second": 29196.711 }, { "epoch": 1.5663600961506567, "grad_norm": 1.515625, "learning_rate": 2.1463181336634156e-05, "loss": 1.0630790710449218, "num_input_tokens_seen": 12588414528, "step": 44270, "train_runtime": 431158.3226, "train_tokens_per_second": 29196.733 }, { "epoch": 1.5667139164143853, "grad_norm": 1.515625, "learning_rate": 2.1461204129059776e-05, "loss": 1.057823657989502, "num_input_tokens_seen": 12591275648, "step": 44280, "train_runtime": 431256.6585, "train_tokens_per_second": 29196.71 }, { "epoch": 1.5670677366781143, "grad_norm": 1.5625, "learning_rate": 2.145922746781116e-05, "loss": 1.0354292869567872, "num_input_tokens_seen": 12594127680, "step": 44290, "train_runtime": 431352.0516, "train_tokens_per_second": 29196.865 }, { "epoch": 1.567421556941843, "grad_norm": 1.5390625, "learning_rate": 2.1457251352636765e-05, "loss": 1.039517879486084, "num_input_tokens_seen": 12596940032, "step": 44300, "train_runtime": 431444.7041, "train_tokens_per_second": 29197.114 }, { "epoch": 1.5677753772055718, "grad_norm": 1.5546875, "learning_rate": 2.1455275783285203e-05, "loss": 1.0428491592407227, "num_input_tokens_seen": 12599772992, "step": 44310, "train_runtime": 431542.2623, "train_tokens_per_second": 29197.078 }, { "epoch": 1.5681291974693006, "grad_norm": 1.5390625, "learning_rate": 2.1453300759505255e-05, "loss": 1.0480964660644532, "num_input_tokens_seen": 12602666496, "step": 44320, "train_runtime": 431640.9839, "train_tokens_per_second": 29197.104 }, { "epoch": 1.5684830177330293, "grad_norm": 1.5390625, "learning_rate": 2.145132628104585e-05, "loss": 1.0417550086975098, "num_input_tokens_seen": 12605518912, "step": 44330, "train_runtime": 431738.8117, "train_tokens_per_second": 29197.095 }, { "epoch": 1.568836837996758, "grad_norm": 1.65625, "learning_rate": 2.1449352347656098e-05, "loss": 1.043064785003662, "num_input_tokens_seen": 12608373696, "step": 44340, "train_runtime": 431838.3409, "train_tokens_per_second": 29196.976 }, { "epoch": 1.5691906582604869, "grad_norm": 1.5390625, "learning_rate": 2.1447378959085256e-05, "loss": 1.0404104232788085, "num_input_tokens_seen": 12611231296, "step": 44350, "train_runtime": 431935.6324, "train_tokens_per_second": 29197.015 }, { "epoch": 1.5695444785242156, "grad_norm": 1.546875, "learning_rate": 2.1445406115082747e-05, "loss": 1.0478376388549804, "num_input_tokens_seen": 12614064960, "step": 44360, "train_runtime": 432033.5355, "train_tokens_per_second": 29196.958 }, { "epoch": 1.5698982987879444, "grad_norm": 1.5859375, "learning_rate": 2.1443433815398163e-05, "loss": 1.0358861923217773, "num_input_tokens_seen": 12616857728, "step": 44370, "train_runtime": 432129.3037, "train_tokens_per_second": 29196.95 }, { "epoch": 1.5702521190516734, "grad_norm": 1.515625, "learning_rate": 2.1441462059781238e-05, "loss": 1.0468219757080077, "num_input_tokens_seen": 12619720000, "step": 44380, "train_runtime": 432228.1974, "train_tokens_per_second": 29196.892 }, { "epoch": 1.570605939315402, "grad_norm": 1.640625, "learning_rate": 2.1439490847981885e-05, "loss": 1.0535453796386718, "num_input_tokens_seen": 12622584512, "step": 44390, "train_runtime": 432327.7116, "train_tokens_per_second": 29196.797 }, { "epoch": 1.570959759579131, "grad_norm": 1.59375, "learning_rate": 2.1437520179750174e-05, "loss": 1.0479585647583007, "num_input_tokens_seen": 12625504576, "step": 44400, "train_runtime": 432430.632, "train_tokens_per_second": 29196.601 }, { "epoch": 1.5713135798428595, "grad_norm": 1.5625, "learning_rate": 2.1435550054836332e-05, "loss": 1.0353968620300293, "num_input_tokens_seen": 12628376768, "step": 44410, "train_runtime": 432531.4068, "train_tokens_per_second": 29196.439 }, { "epoch": 1.5716674001065885, "grad_norm": 1.5390625, "learning_rate": 2.1433580472990743e-05, "loss": 1.0461334228515624, "num_input_tokens_seen": 12631232192, "step": 44420, "train_runtime": 432628.817, "train_tokens_per_second": 29196.465 }, { "epoch": 1.572021220370317, "grad_norm": 1.515625, "learning_rate": 2.1431611433963964e-05, "loss": 1.0468220710754395, "num_input_tokens_seen": 12634029568, "step": 44430, "train_runtime": 432724.5745, "train_tokens_per_second": 29196.469 }, { "epoch": 1.572375040634046, "grad_norm": 1.578125, "learning_rate": 2.14296429375067e-05, "loss": 1.0458183288574219, "num_input_tokens_seen": 12636909120, "step": 44440, "train_runtime": 432825.2015, "train_tokens_per_second": 29196.334 }, { "epoch": 1.5727288608977745, "grad_norm": 1.5546875, "learning_rate": 2.1427674983369826e-05, "loss": 1.0403324127197267, "num_input_tokens_seen": 12639779136, "step": 44450, "train_runtime": 432926.1433, "train_tokens_per_second": 29196.156 }, { "epoch": 1.5730826811615035, "grad_norm": 1.5, "learning_rate": 2.1425707571304366e-05, "loss": 1.0453529357910156, "num_input_tokens_seen": 12642660672, "step": 44460, "train_runtime": 433027.1443, "train_tokens_per_second": 29196.0 }, { "epoch": 1.5734365014252323, "grad_norm": 1.5546875, "learning_rate": 2.1423740701061512e-05, "loss": 1.0526577949523925, "num_input_tokens_seen": 12645494208, "step": 44470, "train_runtime": 433125.2304, "train_tokens_per_second": 29195.931 }, { "epoch": 1.573790321688961, "grad_norm": 1.4921875, "learning_rate": 2.1421774372392622e-05, "loss": 1.052344512939453, "num_input_tokens_seen": 12648281280, "step": 44480, "train_runtime": 433218.0439, "train_tokens_per_second": 29196.109 }, { "epoch": 1.5741441419526898, "grad_norm": 1.5546875, "learning_rate": 2.1419808585049194e-05, "loss": 1.041238784790039, "num_input_tokens_seen": 12651189952, "step": 44490, "train_runtime": 433317.8228, "train_tokens_per_second": 29196.099 }, { "epoch": 1.5744979622164186, "grad_norm": 1.5625, "learning_rate": 2.1417843338782907e-05, "loss": 1.0470590591430664, "num_input_tokens_seen": 12654037952, "step": 44500, "train_runtime": 433415.2045, "train_tokens_per_second": 29196.11 }, { "epoch": 1.5748517824801473, "grad_norm": 1.5234375, "learning_rate": 2.1415878633345592e-05, "loss": 1.0562950134277345, "num_input_tokens_seen": 12656910592, "step": 44510, "train_runtime": 433516.133, "train_tokens_per_second": 29195.939 }, { "epoch": 1.575205602743876, "grad_norm": 1.53125, "learning_rate": 2.1413914468489227e-05, "loss": 1.0463618278503417, "num_input_tokens_seen": 12659733376, "step": 44520, "train_runtime": 433614.0243, "train_tokens_per_second": 29195.858 }, { "epoch": 1.5755594230076049, "grad_norm": 1.5390625, "learning_rate": 2.141195084396597e-05, "loss": 1.0385541915893555, "num_input_tokens_seen": 12662600768, "step": 44530, "train_runtime": 433709.9989, "train_tokens_per_second": 29196.008 }, { "epoch": 1.5759132432713336, "grad_norm": 1.6328125, "learning_rate": 2.140998775952812e-05, "loss": 1.0457186698913574, "num_input_tokens_seen": 12665407296, "step": 44540, "train_runtime": 433806.3701, "train_tokens_per_second": 29195.992 }, { "epoch": 1.5762670635350626, "grad_norm": 1.5859375, "learning_rate": 2.140802521492814e-05, "loss": 1.044708824157715, "num_input_tokens_seen": 12668250752, "step": 44550, "train_runtime": 433902.7786, "train_tokens_per_second": 29196.058 }, { "epoch": 1.5766208837987912, "grad_norm": 1.546875, "learning_rate": 2.140606320991867e-05, "loss": 1.0513051986694335, "num_input_tokens_seen": 12671056320, "step": 44560, "train_runtime": 434000.8048, "train_tokens_per_second": 29195.928 }, { "epoch": 1.5769747040625202, "grad_norm": 1.515625, "learning_rate": 2.140410174425248e-05, "loss": 1.0528629302978516, "num_input_tokens_seen": 12673875200, "step": 44570, "train_runtime": 434097.1981, "train_tokens_per_second": 29195.939 }, { "epoch": 1.5773285243262487, "grad_norm": 1.5, "learning_rate": 2.140214081768251e-05, "loss": 1.031651496887207, "num_input_tokens_seen": 12676647872, "step": 44580, "train_runtime": 434193.0344, "train_tokens_per_second": 29195.88 }, { "epoch": 1.5776823445899777, "grad_norm": 1.6015625, "learning_rate": 2.140018042996187e-05, "loss": 1.0336088180541991, "num_input_tokens_seen": 12679409024, "step": 44590, "train_runtime": 434284.7739, "train_tokens_per_second": 29196.071 }, { "epoch": 1.5780361648537062, "grad_norm": 1.546875, "learning_rate": 2.1398220580843807e-05, "loss": 1.0407217025756836, "num_input_tokens_seen": 12682261504, "step": 44600, "train_runtime": 434382.3721, "train_tokens_per_second": 29196.078 }, { "epoch": 1.5783899851174352, "grad_norm": 1.5859375, "learning_rate": 2.1396261270081748e-05, "loss": 1.0556010246276855, "num_input_tokens_seen": 12685153856, "step": 44610, "train_runtime": 434483.1764, "train_tokens_per_second": 29195.961 }, { "epoch": 1.578743805381164, "grad_norm": 1.515625, "learning_rate": 2.1394302497429258e-05, "loss": 1.052020263671875, "num_input_tokens_seen": 12688015296, "step": 44620, "train_runtime": 434580.4244, "train_tokens_per_second": 29196.012 }, { "epoch": 1.5790976256448928, "grad_norm": 1.6328125, "learning_rate": 2.1392344262640077e-05, "loss": 1.0391345977783204, "num_input_tokens_seen": 12690933824, "step": 44630, "train_runtime": 434680.5884, "train_tokens_per_second": 29195.999 }, { "epoch": 1.5794514459086215, "grad_norm": 1.609375, "learning_rate": 2.139038656546809e-05, "loss": 1.0532212257385254, "num_input_tokens_seen": 12693750144, "step": 44640, "train_runtime": 434773.5827, "train_tokens_per_second": 29196.231 }, { "epoch": 1.5798052661723503, "grad_norm": 1.6015625, "learning_rate": 2.138842940566735e-05, "loss": 1.0623306274414062, "num_input_tokens_seen": 12696573056, "step": 44650, "train_runtime": 434868.2404, "train_tokens_per_second": 29196.368 }, { "epoch": 1.580159086436079, "grad_norm": 1.578125, "learning_rate": 2.1386472782992055e-05, "loss": 1.0404582977294923, "num_input_tokens_seen": 12699389568, "step": 44660, "train_runtime": 434964.2352, "train_tokens_per_second": 29196.399 }, { "epoch": 1.5805129066998078, "grad_norm": 1.609375, "learning_rate": 2.138451669719658e-05, "loss": 1.0526749610900878, "num_input_tokens_seen": 12702281792, "step": 44670, "train_runtime": 435065.79, "train_tokens_per_second": 29196.232 }, { "epoch": 1.5808667269635366, "grad_norm": 1.5546875, "learning_rate": 2.138256114803543e-05, "loss": 1.054495620727539, "num_input_tokens_seen": 12705152832, "step": 44680, "train_runtime": 435163.372, "train_tokens_per_second": 29196.283 }, { "epoch": 1.5812205472272653, "grad_norm": 1.5625, "learning_rate": 2.138060613526329e-05, "loss": 1.0472589492797852, "num_input_tokens_seen": 12707983872, "step": 44690, "train_runtime": 435260.9977, "train_tokens_per_second": 29196.238 }, { "epoch": 1.5815743674909941, "grad_norm": 1.609375, "learning_rate": 2.1378651658634993e-05, "loss": 1.0411848068237304, "num_input_tokens_seen": 12710842048, "step": 44700, "train_runtime": 435360.6603, "train_tokens_per_second": 29196.12 }, { "epoch": 1.5819281877547229, "grad_norm": 1.59375, "learning_rate": 2.137669771790553e-05, "loss": 1.0305139541625976, "num_input_tokens_seen": 12713751936, "step": 44710, "train_runtime": 435461.5363, "train_tokens_per_second": 29196.039 }, { "epoch": 1.5822820080184519, "grad_norm": 1.5703125, "learning_rate": 2.1374744312830048e-05, "loss": 1.042025375366211, "num_input_tokens_seen": 12716627776, "step": 44720, "train_runtime": 435561.7119, "train_tokens_per_second": 29195.927 }, { "epoch": 1.5826358282821804, "grad_norm": 1.5859375, "learning_rate": 2.137279144316385e-05, "loss": 1.0512571334838867, "num_input_tokens_seen": 12719462592, "step": 44730, "train_runtime": 435654.7801, "train_tokens_per_second": 29196.197 }, { "epoch": 1.5829896485459094, "grad_norm": 1.5859375, "learning_rate": 2.1370839108662393e-05, "loss": 1.0432860374450683, "num_input_tokens_seen": 12722289728, "step": 44740, "train_runtime": 435751.0818, "train_tokens_per_second": 29196.232 }, { "epoch": 1.583343468809638, "grad_norm": 1.578125, "learning_rate": 2.1368887309081305e-05, "loss": 1.0352720260620116, "num_input_tokens_seen": 12725142528, "step": 44750, "train_runtime": 435849.0201, "train_tokens_per_second": 29196.217 }, { "epoch": 1.583697289073367, "grad_norm": 1.6875, "learning_rate": 2.136693604417635e-05, "loss": 1.041702651977539, "num_input_tokens_seen": 12727975808, "step": 44760, "train_runtime": 435946.7291, "train_tokens_per_second": 29196.172 }, { "epoch": 1.5840511093370955, "grad_norm": 1.5625, "learning_rate": 2.1364985313703465e-05, "loss": 1.0502321243286132, "num_input_tokens_seen": 12730808960, "step": 44770, "train_runtime": 436042.5893, "train_tokens_per_second": 29196.251 }, { "epoch": 1.5844049296008245, "grad_norm": 1.5625, "learning_rate": 2.1363035117418724e-05, "loss": 1.042138671875, "num_input_tokens_seen": 12733634816, "step": 44780, "train_runtime": 436138.6279, "train_tokens_per_second": 29196.301 }, { "epoch": 1.5847587498645532, "grad_norm": 1.6171875, "learning_rate": 2.1361085455078375e-05, "loss": 1.0468841552734376, "num_input_tokens_seen": 12736443904, "step": 44790, "train_runtime": 436235.0886, "train_tokens_per_second": 29196.285 }, { "epoch": 1.585112570128282, "grad_norm": 1.546875, "learning_rate": 2.1359136326438812e-05, "loss": 1.054422950744629, "num_input_tokens_seen": 12739237568, "step": 44800, "train_runtime": 436329.1128, "train_tokens_per_second": 29196.396 }, { "epoch": 1.5854663903920108, "grad_norm": 1.5234375, "learning_rate": 2.1357187731256588e-05, "loss": 1.0375128746032716, "num_input_tokens_seen": 12742100800, "step": 44810, "train_runtime": 436428.0668, "train_tokens_per_second": 29196.337 }, { "epoch": 1.5858202106557395, "grad_norm": 1.5078125, "learning_rate": 2.1355239669288418e-05, "loss": 1.0519845962524415, "num_input_tokens_seen": 12745032448, "step": 44820, "train_runtime": 436528.0433, "train_tokens_per_second": 29196.366 }, { "epoch": 1.5861740309194683, "grad_norm": 1.5390625, "learning_rate": 2.1353292140291152e-05, "loss": 1.056899070739746, "num_input_tokens_seen": 12747848768, "step": 44830, "train_runtime": 436625.8006, "train_tokens_per_second": 29196.279 }, { "epoch": 1.586527851183197, "grad_norm": 1.5390625, "learning_rate": 2.1351345144021818e-05, "loss": 1.0399456024169922, "num_input_tokens_seen": 12750732672, "step": 44840, "train_runtime": 436727.8906, "train_tokens_per_second": 29196.058 }, { "epoch": 1.5868816714469258, "grad_norm": 1.5625, "learning_rate": 2.1349398680237585e-05, "loss": 1.0559812545776368, "num_input_tokens_seen": 12753564352, "step": 44850, "train_runtime": 436824.6898, "train_tokens_per_second": 29196.07 }, { "epoch": 1.5872354917106546, "grad_norm": 1.5078125, "learning_rate": 2.1347452748695784e-05, "loss": 1.040593433380127, "num_input_tokens_seen": 12756367616, "step": 44860, "train_runtime": 436920.0619, "train_tokens_per_second": 29196.113 }, { "epoch": 1.5875893119743836, "grad_norm": 1.484375, "learning_rate": 2.1345507349153896e-05, "loss": 1.052777099609375, "num_input_tokens_seen": 12759225088, "step": 44870, "train_runtime": 437015.2269, "train_tokens_per_second": 29196.294 }, { "epoch": 1.5879431322381121, "grad_norm": 1.546875, "learning_rate": 2.1343562481369555e-05, "loss": 1.0363547325134277, "num_input_tokens_seen": 12762026688, "step": 44880, "train_runtime": 437109.7645, "train_tokens_per_second": 29196.389 }, { "epoch": 1.588296952501841, "grad_norm": 1.5234375, "learning_rate": 2.1341618145100557e-05, "loss": 1.042843723297119, "num_input_tokens_seen": 12764949504, "step": 44890, "train_runtime": 437211.5973, "train_tokens_per_second": 29196.274 }, { "epoch": 1.5886507727655697, "grad_norm": 1.6171875, "learning_rate": 2.133967434010485e-05, "loss": 1.041438102722168, "num_input_tokens_seen": 12767798144, "step": 44900, "train_runtime": 437311.1767, "train_tokens_per_second": 29196.14 }, { "epoch": 1.5890045930292986, "grad_norm": 1.53125, "learning_rate": 2.1337731066140536e-05, "loss": 1.0319658279418946, "num_input_tokens_seen": 12770677440, "step": 44910, "train_runtime": 437407.631, "train_tokens_per_second": 29196.284 }, { "epoch": 1.5893584132930272, "grad_norm": 1.546875, "learning_rate": 2.1335788322965864e-05, "loss": 1.0552289962768555, "num_input_tokens_seen": 12773505792, "step": 44920, "train_runtime": 437500.2493, "train_tokens_per_second": 29196.568 }, { "epoch": 1.5897122335567562, "grad_norm": 1.5703125, "learning_rate": 2.1333846110339246e-05, "loss": 1.0312393188476563, "num_input_tokens_seen": 12776366080, "step": 44930, "train_runtime": 437597.2159, "train_tokens_per_second": 29196.635 }, { "epoch": 1.5900660538204847, "grad_norm": 1.5078125, "learning_rate": 2.133190442801925e-05, "loss": 1.0461433410644532, "num_input_tokens_seen": 12779222592, "step": 44940, "train_runtime": 437696.5461, "train_tokens_per_second": 29196.535 }, { "epoch": 1.5904198740842137, "grad_norm": 1.5546875, "learning_rate": 2.1329963275764586e-05, "loss": 1.0408315658569336, "num_input_tokens_seen": 12782075776, "step": 44950, "train_runtime": 437792.9036, "train_tokens_per_second": 29196.626 }, { "epoch": 1.5907736943479425, "grad_norm": 1.5078125, "learning_rate": 2.1328022653334127e-05, "loss": 1.067591953277588, "num_input_tokens_seen": 12784884160, "step": 44960, "train_runtime": 437884.9429, "train_tokens_per_second": 29196.903 }, { "epoch": 1.5911275146116712, "grad_norm": 1.609375, "learning_rate": 2.1326082560486895e-05, "loss": 1.0391206741333008, "num_input_tokens_seen": 12787754624, "step": 44970, "train_runtime": 437979.7424, "train_tokens_per_second": 29197.137 }, { "epoch": 1.5914813348754, "grad_norm": 1.6328125, "learning_rate": 2.132414299698207e-05, "loss": 1.0396652221679688, "num_input_tokens_seen": 12790593216, "step": 44980, "train_runtime": 438075.4153, "train_tokens_per_second": 29197.24 }, { "epoch": 1.5918351551391288, "grad_norm": 1.59375, "learning_rate": 2.1322203962578984e-05, "loss": 1.0236476898193358, "num_input_tokens_seen": 12793465920, "step": 44990, "train_runtime": 438173.0949, "train_tokens_per_second": 29197.288 }, { "epoch": 1.5921889754028575, "grad_norm": 1.640625, "learning_rate": 2.1320265457037115e-05, "loss": 1.0456605911254884, "num_input_tokens_seen": 12796284416, "step": 45000, "train_runtime": 438271.6469, "train_tokens_per_second": 29197.153 }, { "epoch": 1.5921889754028575, "eval_loss": 1.0206714868545532, "eval_runtime": 8.4397, "eval_samples_per_second": 472.531, "eval_steps_per_second": 3.792, "num_input_tokens_seen": 12796284416, "step": 45000 }, { "epoch": 1.5925427956665863, "grad_norm": 1.609375, "learning_rate": 2.1318327480116112e-05, "loss": 1.045743751525879, "num_input_tokens_seen": 12799080832, "step": 45010, "train_runtime": 438394.532, "train_tokens_per_second": 29195.348 }, { "epoch": 1.592896615930315, "grad_norm": 1.5546875, "learning_rate": 2.131639003157575e-05, "loss": 1.0450422286987304, "num_input_tokens_seen": 12801917888, "step": 45020, "train_runtime": 438493.4646, "train_tokens_per_second": 29195.231 }, { "epoch": 1.5932504361940438, "grad_norm": 1.6171875, "learning_rate": 2.1314453111175983e-05, "loss": 1.0441603660583496, "num_input_tokens_seen": 12804813248, "step": 45030, "train_runtime": 438591.8902, "train_tokens_per_second": 29195.28 }, { "epoch": 1.5936042564577728, "grad_norm": 1.4453125, "learning_rate": 2.13125167186769e-05, "loss": 1.044929027557373, "num_input_tokens_seen": 12807639168, "step": 45040, "train_runtime": 438686.5846, "train_tokens_per_second": 29195.42 }, { "epoch": 1.5939580767215014, "grad_norm": 1.578125, "learning_rate": 2.131058085383875e-05, "loss": 1.0534921646118165, "num_input_tokens_seen": 12810487744, "step": 45050, "train_runtime": 438785.8513, "train_tokens_per_second": 29195.307 }, { "epoch": 1.5943118969852303, "grad_norm": 1.6171875, "learning_rate": 2.1308645516421935e-05, "loss": 1.041093349456787, "num_input_tokens_seen": 12813344448, "step": 45060, "train_runtime": 438882.017, "train_tokens_per_second": 29195.419 }, { "epoch": 1.594665717248959, "grad_norm": 1.6328125, "learning_rate": 2.1306710706187006e-05, "loss": 1.0549644470214843, "num_input_tokens_seen": 12816212480, "step": 45070, "train_runtime": 438980.089, "train_tokens_per_second": 29195.43 }, { "epoch": 1.5950195375126879, "grad_norm": 1.5234375, "learning_rate": 2.1304776422894667e-05, "loss": 1.055319595336914, "num_input_tokens_seen": 12819068672, "step": 45080, "train_runtime": 439075.8093, "train_tokens_per_second": 29195.57 }, { "epoch": 1.5953733577764164, "grad_norm": 1.546875, "learning_rate": 2.1302842666305776e-05, "loss": 1.0458061218261718, "num_input_tokens_seen": 12821913664, "step": 45090, "train_runtime": 439171.1883, "train_tokens_per_second": 29195.708 }, { "epoch": 1.5957271780401454, "grad_norm": 1.53125, "learning_rate": 2.1300909436181343e-05, "loss": 1.050140953063965, "num_input_tokens_seen": 12824738816, "step": 45100, "train_runtime": 439268.5403, "train_tokens_per_second": 29195.669 }, { "epoch": 1.596080998303874, "grad_norm": 1.515625, "learning_rate": 2.129897673228253e-05, "loss": 1.0492334365844727, "num_input_tokens_seen": 12827594304, "step": 45110, "train_runtime": 439368.4347, "train_tokens_per_second": 29195.53 }, { "epoch": 1.596434818567603, "grad_norm": 1.53125, "learning_rate": 2.1297044554370643e-05, "loss": 1.0443814277648926, "num_input_tokens_seen": 12830426944, "step": 45120, "train_runtime": 439464.7386, "train_tokens_per_second": 29195.578 }, { "epoch": 1.5967886388313317, "grad_norm": 1.6015625, "learning_rate": 2.1295112902207147e-05, "loss": 1.0439817428588867, "num_input_tokens_seen": 12833234624, "step": 45130, "train_runtime": 439558.9835, "train_tokens_per_second": 29195.705 }, { "epoch": 1.5971424590950605, "grad_norm": 1.5234375, "learning_rate": 2.1293181775553662e-05, "loss": 1.033648681640625, "num_input_tokens_seen": 12836122624, "step": 45140, "train_runtime": 439659.0337, "train_tokens_per_second": 29195.63 }, { "epoch": 1.5974962793587892, "grad_norm": 1.546875, "learning_rate": 2.1291251174171946e-05, "loss": 1.0342557907104493, "num_input_tokens_seen": 12838963712, "step": 45150, "train_runtime": 439756.2228, "train_tokens_per_second": 29195.639 }, { "epoch": 1.597850099622518, "grad_norm": 1.6328125, "learning_rate": 2.128932109782393e-05, "loss": 1.0384085655212403, "num_input_tokens_seen": 12841800960, "step": 45160, "train_runtime": 439849.7728, "train_tokens_per_second": 29195.879 }, { "epoch": 1.5982039198862468, "grad_norm": 1.5390625, "learning_rate": 2.128739154627167e-05, "loss": 1.0540500640869142, "num_input_tokens_seen": 12844650624, "step": 45170, "train_runtime": 439948.3787, "train_tokens_per_second": 29195.813 }, { "epoch": 1.5985577401499755, "grad_norm": 1.5859375, "learning_rate": 2.128546251927739e-05, "loss": 1.0372386932373048, "num_input_tokens_seen": 12847525312, "step": 45180, "train_runtime": 440045.3117, "train_tokens_per_second": 29195.915 }, { "epoch": 1.5989115604137043, "grad_norm": 1.6328125, "learning_rate": 2.128353401660346e-05, "loss": 1.0490705490112304, "num_input_tokens_seen": 12850308864, "step": 45190, "train_runtime": 440138.7147, "train_tokens_per_second": 29196.043 }, { "epoch": 1.599265380677433, "grad_norm": 1.484375, "learning_rate": 2.1281606038012402e-05, "loss": 1.0497625350952149, "num_input_tokens_seen": 12853207808, "step": 45200, "train_runtime": 440240.0119, "train_tokens_per_second": 29195.91 }, { "epoch": 1.599619200941162, "grad_norm": 1.515625, "learning_rate": 2.1279678583266886e-05, "loss": 1.0485101699829102, "num_input_tokens_seen": 12856019520, "step": 45210, "train_runtime": 440337.7613, "train_tokens_per_second": 29195.814 }, { "epoch": 1.5999730212048906, "grad_norm": 1.5625, "learning_rate": 2.127775165212974e-05, "loss": 1.0389598846435546, "num_input_tokens_seen": 12858788544, "step": 45220, "train_runtime": 440428.9636, "train_tokens_per_second": 29196.056 }, { "epoch": 1.6003268414686196, "grad_norm": 1.546875, "learning_rate": 2.1275825244363922e-05, "loss": 1.053035831451416, "num_input_tokens_seen": 12861605056, "step": 45230, "train_runtime": 440526.4916, "train_tokens_per_second": 29195.985 }, { "epoch": 1.6006806617323481, "grad_norm": 1.546875, "learning_rate": 2.127389935973257e-05, "loss": 1.0308696746826171, "num_input_tokens_seen": 12864459136, "step": 45240, "train_runtime": 440624.6148, "train_tokens_per_second": 29195.961 }, { "epoch": 1.6010344819960771, "grad_norm": 1.59375, "learning_rate": 2.1271973997998947e-05, "loss": 1.045677375793457, "num_input_tokens_seen": 12867307072, "step": 45250, "train_runtime": 440720.9821, "train_tokens_per_second": 29196.039 }, { "epoch": 1.6013883022598057, "grad_norm": 1.578125, "learning_rate": 2.1270049158926483e-05, "loss": 1.057631492614746, "num_input_tokens_seen": 12870160896, "step": 45260, "train_runtime": 440816.523, "train_tokens_per_second": 29196.185 }, { "epoch": 1.6017421225235347, "grad_norm": 1.6015625, "learning_rate": 2.1268124842278744e-05, "loss": 1.057645034790039, "num_input_tokens_seen": 12873036864, "step": 45270, "train_runtime": 440915.43, "train_tokens_per_second": 29196.159 }, { "epoch": 1.6020959427872632, "grad_norm": 1.625, "learning_rate": 2.1266201047819458e-05, "loss": 1.042458724975586, "num_input_tokens_seen": 12875860800, "step": 45280, "train_runtime": 441011.1517, "train_tokens_per_second": 29196.225 }, { "epoch": 1.6024497630509922, "grad_norm": 1.5625, "learning_rate": 2.126427777531249e-05, "loss": 1.0422024726867676, "num_input_tokens_seen": 12878672064, "step": 45290, "train_runtime": 441108.1195, "train_tokens_per_second": 29196.18 }, { "epoch": 1.602803583314721, "grad_norm": 1.5625, "learning_rate": 2.126235502452186e-05, "loss": 1.0468622207641602, "num_input_tokens_seen": 12881511680, "step": 45300, "train_runtime": 441206.624, "train_tokens_per_second": 29196.098 }, { "epoch": 1.6031574035784497, "grad_norm": 1.5546875, "learning_rate": 2.1260432795211747e-05, "loss": 1.0394622802734375, "num_input_tokens_seen": 12884358464, "step": 45310, "train_runtime": 441302.012, "train_tokens_per_second": 29196.238 }, { "epoch": 1.6035112238421785, "grad_norm": 1.6328125, "learning_rate": 2.1258511087146463e-05, "loss": 1.0437772750854493, "num_input_tokens_seen": 12887202048, "step": 45320, "train_runtime": 441399.7289, "train_tokens_per_second": 29196.217 }, { "epoch": 1.6038650441059072, "grad_norm": 1.5625, "learning_rate": 2.125658990009048e-05, "loss": 1.0609143257141114, "num_input_tokens_seen": 12890055360, "step": 45330, "train_runtime": 441497.0485, "train_tokens_per_second": 29196.244 }, { "epoch": 1.604218864369636, "grad_norm": 1.5625, "learning_rate": 2.125466923380842e-05, "loss": 1.0305564880371094, "num_input_tokens_seen": 12892913984, "step": 45340, "train_runtime": 441590.8471, "train_tokens_per_second": 29196.515 }, { "epoch": 1.6045726846333648, "grad_norm": 1.53125, "learning_rate": 2.1252749088065038e-05, "loss": 1.0546951293945312, "num_input_tokens_seen": 12895766784, "step": 45350, "train_runtime": 441687.4746, "train_tokens_per_second": 29196.587 }, { "epoch": 1.6049265048970935, "grad_norm": 1.5546875, "learning_rate": 2.125082946262526e-05, "loss": 1.0414019584655763, "num_input_tokens_seen": 12898648448, "step": 45360, "train_runtime": 441787.5486, "train_tokens_per_second": 29196.496 }, { "epoch": 1.6052803251608223, "grad_norm": 1.5546875, "learning_rate": 2.1248910357254146e-05, "loss": 1.0513697624206544, "num_input_tokens_seen": 12901506176, "step": 45370, "train_runtime": 441884.5443, "train_tokens_per_second": 29196.554 }, { "epoch": 1.6056341454245513, "grad_norm": 1.5703125, "learning_rate": 2.1246991771716913e-05, "loss": 1.052490234375, "num_input_tokens_seen": 12904395392, "step": 45380, "train_runtime": 441984.7823, "train_tokens_per_second": 29196.47 }, { "epoch": 1.6059879656882798, "grad_norm": 1.515625, "learning_rate": 2.124507370577891e-05, "loss": 1.0545053482055664, "num_input_tokens_seen": 12907297152, "step": 45390, "train_runtime": 442085.4629, "train_tokens_per_second": 29196.384 }, { "epoch": 1.6063417859520088, "grad_norm": 1.4765625, "learning_rate": 2.1243156159205653e-05, "loss": 1.0311254501342773, "num_input_tokens_seen": 12910122304, "step": 45400, "train_runtime": 442181.2968, "train_tokens_per_second": 29196.446 }, { "epoch": 1.6066956062157374, "grad_norm": 1.625, "learning_rate": 2.1241239131762808e-05, "loss": 1.0413692474365235, "num_input_tokens_seen": 12912981696, "step": 45410, "train_runtime": 442276.7025, "train_tokens_per_second": 29196.613 }, { "epoch": 1.6070494264794664, "grad_norm": 1.5234375, "learning_rate": 2.1239322623216165e-05, "loss": 1.0384191513061523, "num_input_tokens_seen": 12915846144, "step": 45420, "train_runtime": 442375.2362, "train_tokens_per_second": 29196.585 }, { "epoch": 1.607403246743195, "grad_norm": 1.578125, "learning_rate": 2.1237406633331682e-05, "loss": 1.044264030456543, "num_input_tokens_seen": 12918590592, "step": 45430, "train_runtime": 442468.7083, "train_tokens_per_second": 29196.62 }, { "epoch": 1.607757067006924, "grad_norm": 1.609375, "learning_rate": 2.1235491161875466e-05, "loss": 1.0461427688598632, "num_input_tokens_seen": 12921430848, "step": 45440, "train_runtime": 442565.912, "train_tokens_per_second": 29196.625 }, { "epoch": 1.6081108872706524, "grad_norm": 1.546875, "learning_rate": 2.123357620861376e-05, "loss": 1.0455726623535155, "num_input_tokens_seen": 12924311040, "step": 45450, "train_runtime": 442665.4921, "train_tokens_per_second": 29196.563 }, { "epoch": 1.6084647075343814, "grad_norm": 1.4921875, "learning_rate": 2.1231661773312958e-05, "loss": 1.046687126159668, "num_input_tokens_seen": 12927140416, "step": 45460, "train_runtime": 442760.9398, "train_tokens_per_second": 29196.66 }, { "epoch": 1.6088185277981102, "grad_norm": 1.5546875, "learning_rate": 2.122974785573961e-05, "loss": 1.0214195251464844, "num_input_tokens_seen": 12929985536, "step": 45470, "train_runtime": 442857.8228, "train_tokens_per_second": 29196.697 }, { "epoch": 1.609172348061839, "grad_norm": 1.59375, "learning_rate": 2.12278344556604e-05, "loss": 1.0417657852172852, "num_input_tokens_seen": 12932874688, "step": 45480, "train_runtime": 442959.2239, "train_tokens_per_second": 29196.535 }, { "epoch": 1.6095261683255677, "grad_norm": 1.5, "learning_rate": 2.1225921572842165e-05, "loss": 1.0569036483764649, "num_input_tokens_seen": 12935733760, "step": 45490, "train_runtime": 443057.4794, "train_tokens_per_second": 29196.514 }, { "epoch": 1.6098799885892965, "grad_norm": 1.5, "learning_rate": 2.12240092070519e-05, "loss": 1.044008445739746, "num_input_tokens_seen": 12938590528, "step": 45500, "train_runtime": 443154.2466, "train_tokens_per_second": 29196.585 }, { "epoch": 1.6102338088530253, "grad_norm": 1.5546875, "learning_rate": 2.1222097358056727e-05, "loss": 1.0410192489624024, "num_input_tokens_seen": 12941407296, "step": 45510, "train_runtime": 443249.8895, "train_tokens_per_second": 29196.64 }, { "epoch": 1.610587629116754, "grad_norm": 1.4921875, "learning_rate": 2.122018602562393e-05, "loss": 1.0308902740478516, "num_input_tokens_seen": 12944279360, "step": 45520, "train_runtime": 443345.8522, "train_tokens_per_second": 29196.798 }, { "epoch": 1.6109414493804828, "grad_norm": 1.6171875, "learning_rate": 2.1218275209520926e-05, "loss": 1.0359943389892579, "num_input_tokens_seen": 12947076288, "step": 45530, "train_runtime": 443440.7642, "train_tokens_per_second": 29196.856 }, { "epoch": 1.6112952696442115, "grad_norm": 1.5625, "learning_rate": 2.1216364909515306e-05, "loss": 1.042301559448242, "num_input_tokens_seen": 12949908672, "step": 45540, "train_runtime": 443536.9233, "train_tokens_per_second": 29196.912 }, { "epoch": 1.6116490899079405, "grad_norm": 1.6015625, "learning_rate": 2.1214455125374763e-05, "loss": 1.04135160446167, "num_input_tokens_seen": 12952833728, "step": 45550, "train_runtime": 443640.0693, "train_tokens_per_second": 29196.717 }, { "epoch": 1.612002910171669, "grad_norm": 1.5703125, "learning_rate": 2.1212545856867176e-05, "loss": 1.0375239372253418, "num_input_tokens_seen": 12955658368, "step": 45560, "train_runtime": 443735.2554, "train_tokens_per_second": 29196.82 }, { "epoch": 1.612356730435398, "grad_norm": 1.5390625, "learning_rate": 2.1210637103760558e-05, "loss": 1.0502585411071776, "num_input_tokens_seen": 12958541632, "step": 45570, "train_runtime": 443836.5436, "train_tokens_per_second": 29196.653 }, { "epoch": 1.6127105506991266, "grad_norm": 1.53125, "learning_rate": 2.1208728865823054e-05, "loss": 1.0434927940368652, "num_input_tokens_seen": 12961378560, "step": 45580, "train_runtime": 443930.8658, "train_tokens_per_second": 29196.84 }, { "epoch": 1.6130643709628556, "grad_norm": 1.5625, "learning_rate": 2.120682114282298e-05, "loss": 1.0383832931518555, "num_input_tokens_seen": 12964219904, "step": 45590, "train_runtime": 444026.9219, "train_tokens_per_second": 29196.923 }, { "epoch": 1.6134181912265841, "grad_norm": 1.6015625, "learning_rate": 2.1204913934528784e-05, "loss": 1.041362190246582, "num_input_tokens_seen": 12967115520, "step": 45600, "train_runtime": 444127.4128, "train_tokens_per_second": 29196.837 }, { "epoch": 1.6137720114903131, "grad_norm": 1.578125, "learning_rate": 2.120300724070905e-05, "loss": 1.0473427772521973, "num_input_tokens_seen": 12969981824, "step": 45610, "train_runtime": 444223.7077, "train_tokens_per_second": 29196.96 }, { "epoch": 1.614125831754042, "grad_norm": 1.640625, "learning_rate": 2.1201101061132525e-05, "loss": 1.0513710021972655, "num_input_tokens_seen": 12972808768, "step": 45620, "train_runtime": 444317.9338, "train_tokens_per_second": 29197.131 }, { "epoch": 1.6144796520177707, "grad_norm": 1.6640625, "learning_rate": 2.1199195395568095e-05, "loss": 1.0483999252319336, "num_input_tokens_seen": 12975654144, "step": 45630, "train_runtime": 444413.245, "train_tokens_per_second": 29197.271 }, { "epoch": 1.6148334722814994, "grad_norm": 1.5546875, "learning_rate": 2.119729024378479e-05, "loss": 1.061457061767578, "num_input_tokens_seen": 12978517376, "step": 45640, "train_runtime": 444510.4704, "train_tokens_per_second": 29197.327 }, { "epoch": 1.6151872925452282, "grad_norm": 1.4453125, "learning_rate": 2.119538560555179e-05, "loss": 1.0518308639526368, "num_input_tokens_seen": 12981345408, "step": 45650, "train_runtime": 444606.4216, "train_tokens_per_second": 29197.386 }, { "epoch": 1.615541112808957, "grad_norm": 1.6171875, "learning_rate": 2.1193481480638405e-05, "loss": 1.0580204963684081, "num_input_tokens_seen": 12984199744, "step": 45660, "train_runtime": 444704.5574, "train_tokens_per_second": 29197.362 }, { "epoch": 1.6158949330726857, "grad_norm": 1.5078125, "learning_rate": 2.119157786881411e-05, "loss": 1.035477066040039, "num_input_tokens_seen": 12986996160, "step": 45670, "train_runtime": 444799.7774, "train_tokens_per_second": 29197.398 }, { "epoch": 1.6162487533364145, "grad_norm": 1.6484375, "learning_rate": 2.118967476984852e-05, "loss": 1.0476390838623046, "num_input_tokens_seen": 12989805504, "step": 45680, "train_runtime": 444897.2758, "train_tokens_per_second": 29197.314 }, { "epoch": 1.6166025736001433, "grad_norm": 1.5703125, "learning_rate": 2.118777218351139e-05, "loss": 1.043496322631836, "num_input_tokens_seen": 12992623296, "step": 45690, "train_runtime": 444994.6827, "train_tokens_per_second": 29197.255 }, { "epoch": 1.616956393863872, "grad_norm": 1.5546875, "learning_rate": 2.1185870109572614e-05, "loss": 1.0510296821594238, "num_input_tokens_seen": 12995437504, "step": 45700, "train_runtime": 445090.2523, "train_tokens_per_second": 29197.309 }, { "epoch": 1.6173102141276008, "grad_norm": 1.5234375, "learning_rate": 2.1183968547802243e-05, "loss": 1.0419703483581544, "num_input_tokens_seen": 12998207936, "step": 45710, "train_runtime": 445187.3383, "train_tokens_per_second": 29197.164 }, { "epoch": 1.6176640343913298, "grad_norm": 1.546875, "learning_rate": 2.1182067497970464e-05, "loss": 1.047741413116455, "num_input_tokens_seen": 13001048000, "step": 45720, "train_runtime": 445285.3991, "train_tokens_per_second": 29197.113 }, { "epoch": 1.6180178546550583, "grad_norm": 1.5234375, "learning_rate": 2.1180166959847613e-05, "loss": 1.027329444885254, "num_input_tokens_seen": 13003955456, "step": 45730, "train_runtime": 445389.5992, "train_tokens_per_second": 29196.81 }, { "epoch": 1.6183716749187873, "grad_norm": 1.53125, "learning_rate": 2.1178266933204168e-05, "loss": 1.0437131881713868, "num_input_tokens_seen": 13006771584, "step": 45740, "train_runtime": 445486.4624, "train_tokens_per_second": 29196.783 }, { "epoch": 1.6187254951825158, "grad_norm": 1.5, "learning_rate": 2.1176367417810754e-05, "loss": 1.059103012084961, "num_input_tokens_seen": 13009608512, "step": 45750, "train_runtime": 445583.934, "train_tokens_per_second": 29196.763 }, { "epoch": 1.6190793154462448, "grad_norm": 1.5625, "learning_rate": 2.1174468413438138e-05, "loss": 1.058873748779297, "num_input_tokens_seen": 13012532928, "step": 45760, "train_runtime": 445687.3452, "train_tokens_per_second": 29196.55 }, { "epoch": 1.6194331357099734, "grad_norm": 1.609375, "learning_rate": 2.1172569919857225e-05, "loss": 1.04759521484375, "num_input_tokens_seen": 13015375424, "step": 45770, "train_runtime": 445784.3132, "train_tokens_per_second": 29196.576 }, { "epoch": 1.6197869559737024, "grad_norm": 1.5625, "learning_rate": 2.117067193683907e-05, "loss": 1.0393503189086915, "num_input_tokens_seen": 13018198976, "step": 45780, "train_runtime": 445879.6933, "train_tokens_per_second": 29196.663 }, { "epoch": 1.6201407762374311, "grad_norm": 1.578125, "learning_rate": 2.1168774464154877e-05, "loss": 1.0540716171264648, "num_input_tokens_seen": 13021067456, "step": 45790, "train_runtime": 445978.0124, "train_tokens_per_second": 29196.658 }, { "epoch": 1.62049459650116, "grad_norm": 1.6171875, "learning_rate": 2.116687750157598e-05, "loss": 1.0280941009521485, "num_input_tokens_seen": 13023915008, "step": 45800, "train_runtime": 446077.9779, "train_tokens_per_second": 29196.498 }, { "epoch": 1.6208484167648887, "grad_norm": 1.5703125, "learning_rate": 2.116498104887387e-05, "loss": 1.0313157081604003, "num_input_tokens_seen": 13026771648, "step": 45810, "train_runtime": 446176.6892, "train_tokens_per_second": 29196.442 }, { "epoch": 1.6212022370286174, "grad_norm": 1.5078125, "learning_rate": 2.1163085105820175e-05, "loss": 1.0493535041809081, "num_input_tokens_seen": 13029592256, "step": 45820, "train_runtime": 446272.2649, "train_tokens_per_second": 29196.509 }, { "epoch": 1.6215560572923462, "grad_norm": 1.53125, "learning_rate": 2.116118967218666e-05, "loss": 1.041722297668457, "num_input_tokens_seen": 13032440768, "step": 45830, "train_runtime": 446369.6234, "train_tokens_per_second": 29196.523 }, { "epoch": 1.621909877556075, "grad_norm": 1.59375, "learning_rate": 2.115929474774525e-05, "loss": 1.0371341705322266, "num_input_tokens_seen": 13035298816, "step": 45840, "train_runtime": 446465.2198, "train_tokens_per_second": 29196.673 }, { "epoch": 1.6222636978198037, "grad_norm": 1.59375, "learning_rate": 2.1157400332267988e-05, "loss": 1.0379834175109863, "num_input_tokens_seen": 13038126784, "step": 45850, "train_runtime": 446561.3237, "train_tokens_per_second": 29196.722 }, { "epoch": 1.6226175180835325, "grad_norm": 1.5234375, "learning_rate": 2.1155506425527083e-05, "loss": 1.0553869247436523, "num_input_tokens_seen": 13040989568, "step": 45860, "train_runtime": 446657.7286, "train_tokens_per_second": 29196.83 }, { "epoch": 1.6229713383472615, "grad_norm": 1.5625, "learning_rate": 2.115361302729488e-05, "loss": 1.0496926307678223, "num_input_tokens_seen": 13043850432, "step": 45870, "train_runtime": 446756.7032, "train_tokens_per_second": 29196.765 }, { "epoch": 1.62332515861099, "grad_norm": 1.5625, "learning_rate": 2.115172013734386e-05, "loss": 1.0443217277526855, "num_input_tokens_seen": 13046672512, "step": 45880, "train_runtime": 446851.6897, "train_tokens_per_second": 29196.874 }, { "epoch": 1.623678978874719, "grad_norm": 1.515625, "learning_rate": 2.1149827755446652e-05, "loss": 1.028960609436035, "num_input_tokens_seen": 13049484224, "step": 45890, "train_runtime": 446950.2868, "train_tokens_per_second": 29196.724 }, { "epoch": 1.6240327991384476, "grad_norm": 1.59375, "learning_rate": 2.1147935881376024e-05, "loss": 1.0520562171936034, "num_input_tokens_seen": 13052268352, "step": 45900, "train_runtime": 447041.0164, "train_tokens_per_second": 29197.026 }, { "epoch": 1.6243866194021765, "grad_norm": 1.546875, "learning_rate": 2.114604451490489e-05, "loss": 1.043747901916504, "num_input_tokens_seen": 13055154752, "step": 45910, "train_runtime": 447139.1045, "train_tokens_per_second": 29197.077 }, { "epoch": 1.624740439665905, "grad_norm": 1.546875, "learning_rate": 2.1144153655806313e-05, "loss": 1.0399864196777344, "num_input_tokens_seen": 13058002880, "step": 45920, "train_runtime": 447235.7241, "train_tokens_per_second": 29197.137 }, { "epoch": 1.625094259929634, "grad_norm": 1.5234375, "learning_rate": 2.114226330385347e-05, "loss": 1.0345932006835938, "num_input_tokens_seen": 13060896256, "step": 45930, "train_runtime": 447337.6349, "train_tokens_per_second": 29196.954 }, { "epoch": 1.6254480801933626, "grad_norm": 1.5, "learning_rate": 2.1140373458819724e-05, "loss": 1.0480596542358398, "num_input_tokens_seen": 13063714752, "step": 45940, "train_runtime": 447437.0597, "train_tokens_per_second": 29196.765 }, { "epoch": 1.6258019004570916, "grad_norm": 1.5625, "learning_rate": 2.1138484120478535e-05, "loss": 1.0573106765747071, "num_input_tokens_seen": 13066550336, "step": 45950, "train_runtime": 447531.6258, "train_tokens_per_second": 29196.932 }, { "epoch": 1.6261557207208204, "grad_norm": 1.5625, "learning_rate": 2.1136595288603532e-05, "loss": 1.046173667907715, "num_input_tokens_seen": 13069404032, "step": 45960, "train_runtime": 447633.7344, "train_tokens_per_second": 29196.647 }, { "epoch": 1.6265095409845491, "grad_norm": 1.6015625, "learning_rate": 2.113470696296849e-05, "loss": 1.0373607635498048, "num_input_tokens_seen": 13072281472, "step": 45970, "train_runtime": 447731.9296, "train_tokens_per_second": 29196.67 }, { "epoch": 1.626863361248278, "grad_norm": 1.65625, "learning_rate": 2.1132819143347296e-05, "loss": 1.0497488975524902, "num_input_tokens_seen": 13075117376, "step": 45980, "train_runtime": 447830.3899, "train_tokens_per_second": 29196.584 }, { "epoch": 1.6272171815120067, "grad_norm": 1.5703125, "learning_rate": 2.1130931829514005e-05, "loss": 1.043372344970703, "num_input_tokens_seen": 13077915200, "step": 45990, "train_runtime": 447924.3973, "train_tokens_per_second": 29196.702 }, { "epoch": 1.6275710017757354, "grad_norm": 1.59375, "learning_rate": 2.112904502124281e-05, "loss": 1.0511838912963867, "num_input_tokens_seen": 13080718592, "step": 46000, "train_runtime": 448018.6169, "train_tokens_per_second": 29196.819 }, { "epoch": 1.6279248220394642, "grad_norm": 1.5390625, "learning_rate": 2.112715871830803e-05, "loss": 1.0444914817810058, "num_input_tokens_seen": 13083587968, "step": 46010, "train_runtime": 448117.3861, "train_tokens_per_second": 29196.787 }, { "epoch": 1.628278642303193, "grad_norm": 1.5625, "learning_rate": 2.112527292048414e-05, "loss": 1.068752384185791, "num_input_tokens_seen": 13086399744, "step": 46020, "train_runtime": 448213.4201, "train_tokens_per_second": 29196.805 }, { "epoch": 1.6286324625669217, "grad_norm": 1.5546875, "learning_rate": 2.1123387627545748e-05, "loss": 1.0460834503173828, "num_input_tokens_seen": 13089255104, "step": 46030, "train_runtime": 448311.5016, "train_tokens_per_second": 29196.786 }, { "epoch": 1.6289862828306507, "grad_norm": 1.5703125, "learning_rate": 2.112150283926761e-05, "loss": 1.0375429153442384, "num_input_tokens_seen": 13092094592, "step": 46040, "train_runtime": 448409.7565, "train_tokens_per_second": 29196.721 }, { "epoch": 1.6293401030943793, "grad_norm": 1.5859375, "learning_rate": 2.1119618555424612e-05, "loss": 1.054412841796875, "num_input_tokens_seen": 13094937920, "step": 46050, "train_runtime": 448506.6047, "train_tokens_per_second": 29196.756 }, { "epoch": 1.6296939233581083, "grad_norm": 1.53125, "learning_rate": 2.1117734775791794e-05, "loss": 1.041779136657715, "num_input_tokens_seen": 13097787008, "step": 46060, "train_runtime": 448606.8987, "train_tokens_per_second": 29196.58 }, { "epoch": 1.6300477436218368, "grad_norm": 1.609375, "learning_rate": 2.1115851500144324e-05, "loss": 1.0425216674804687, "num_input_tokens_seen": 13100669632, "step": 46070, "train_runtime": 448708.8638, "train_tokens_per_second": 29196.369 }, { "epoch": 1.6304015638855658, "grad_norm": 1.546875, "learning_rate": 2.1113968728257516e-05, "loss": 1.0390350341796875, "num_input_tokens_seen": 13103485440, "step": 46080, "train_runtime": 448802.4448, "train_tokens_per_second": 29196.555 }, { "epoch": 1.6307553841492943, "grad_norm": 1.546875, "learning_rate": 2.1112086459906828e-05, "loss": 1.0471569061279298, "num_input_tokens_seen": 13106362880, "step": 46090, "train_runtime": 448900.8036, "train_tokens_per_second": 29196.568 }, { "epoch": 1.6311092044130233, "grad_norm": 1.53125, "learning_rate": 2.1110204694867846e-05, "loss": 1.041170310974121, "num_input_tokens_seen": 13109184320, "step": 46100, "train_runtime": 448997.5476, "train_tokens_per_second": 29196.561 }, { "epoch": 1.6314630246767519, "grad_norm": 1.5703125, "learning_rate": 2.1108323432916305e-05, "loss": 1.040970802307129, "num_input_tokens_seen": 13111998528, "step": 46110, "train_runtime": 449092.1592, "train_tokens_per_second": 29196.677 }, { "epoch": 1.6318168449404808, "grad_norm": 1.6015625, "learning_rate": 2.1106442673828086e-05, "loss": 1.028834915161133, "num_input_tokens_seen": 13114796928, "step": 46120, "train_runtime": 449188.2111, "train_tokens_per_second": 29196.663 }, { "epoch": 1.6321706652042096, "grad_norm": 1.578125, "learning_rate": 2.1104562417379202e-05, "loss": 1.0417366981506349, "num_input_tokens_seen": 13117667904, "step": 46130, "train_runtime": 449286.4307, "train_tokens_per_second": 29196.671 }, { "epoch": 1.6325244854679384, "grad_norm": 1.5703125, "learning_rate": 2.1102682663345797e-05, "loss": 1.0517852783203125, "num_input_tokens_seen": 13120485824, "step": 46140, "train_runtime": 449385.0701, "train_tokens_per_second": 29196.533 }, { "epoch": 1.6328783057316671, "grad_norm": 1.5625, "learning_rate": 2.110080341150417e-05, "loss": 1.0380425453186035, "num_input_tokens_seen": 13123296384, "step": 46150, "train_runtime": 449481.9051, "train_tokens_per_second": 29196.495 }, { "epoch": 1.633232125995396, "grad_norm": 1.5859375, "learning_rate": 2.1098924661630748e-05, "loss": 1.0318406105041504, "num_input_tokens_seen": 13126158592, "step": 46160, "train_runtime": 449579.8944, "train_tokens_per_second": 29196.498 }, { "epoch": 1.6335859462591247, "grad_norm": 1.5390625, "learning_rate": 2.109704641350211e-05, "loss": 1.0515216827392577, "num_input_tokens_seen": 13128961920, "step": 46170, "train_runtime": 449675.1117, "train_tokens_per_second": 29196.55 }, { "epoch": 1.6339397665228534, "grad_norm": 1.5703125, "learning_rate": 2.1095168666894962e-05, "loss": 1.0501476287841798, "num_input_tokens_seen": 13131829312, "step": 46180, "train_runtime": 449771.1415, "train_tokens_per_second": 29196.692 }, { "epoch": 1.6342935867865822, "grad_norm": 1.546875, "learning_rate": 2.1093291421586156e-05, "loss": 1.0344221115112304, "num_input_tokens_seen": 13134680704, "step": 46190, "train_runtime": 449870.5922, "train_tokens_per_second": 29196.575 }, { "epoch": 1.634647407050311, "grad_norm": 1.578125, "learning_rate": 2.1091414677352676e-05, "loss": 1.0517990112304687, "num_input_tokens_seen": 13137536192, "step": 46200, "train_runtime": 449969.798, "train_tokens_per_second": 29196.484 }, { "epoch": 1.63500122731404, "grad_norm": 1.6015625, "learning_rate": 2.1089538433971655e-05, "loss": 1.0370164871215821, "num_input_tokens_seen": 13140289920, "step": 46210, "train_runtime": 450059.3008, "train_tokens_per_second": 29196.797 }, { "epoch": 1.6353550475777685, "grad_norm": 1.546875, "learning_rate": 2.1087662691220356e-05, "loss": 1.0414294242858886, "num_input_tokens_seen": 13143133696, "step": 46220, "train_runtime": 450159.3889, "train_tokens_per_second": 29196.622 }, { "epoch": 1.6357088678414975, "grad_norm": 1.5625, "learning_rate": 2.1085787448876184e-05, "loss": 1.0402842521667481, "num_input_tokens_seen": 13145959488, "step": 46230, "train_runtime": 450254.5317, "train_tokens_per_second": 29196.729 }, { "epoch": 1.636062688105226, "grad_norm": 1.546875, "learning_rate": 2.1083912706716684e-05, "loss": 1.0508570671081543, "num_input_tokens_seen": 13148823552, "step": 46240, "train_runtime": 450353.4895, "train_tokens_per_second": 29196.673 }, { "epoch": 1.636416508368955, "grad_norm": 1.609375, "learning_rate": 2.108203846451954e-05, "loss": 1.0438257217407227, "num_input_tokens_seen": 13151654272, "step": 46250, "train_runtime": 450448.7057, "train_tokens_per_second": 29196.786 }, { "epoch": 1.6367703286326836, "grad_norm": 1.5703125, "learning_rate": 2.1080164722062563e-05, "loss": 1.0453462600708008, "num_input_tokens_seen": 13154499264, "step": 46260, "train_runtime": 450547.2926, "train_tokens_per_second": 29196.711 }, { "epoch": 1.6371241488964126, "grad_norm": 1.4921875, "learning_rate": 2.107829147912372e-05, "loss": 1.0453277587890626, "num_input_tokens_seen": 13157342336, "step": 46270, "train_runtime": 450641.8004, "train_tokens_per_second": 29196.897 }, { "epoch": 1.637477969160141, "grad_norm": 1.5234375, "learning_rate": 2.1076418735481103e-05, "loss": 1.0486770629882813, "num_input_tokens_seen": 13160202240, "step": 46280, "train_runtime": 450739.1009, "train_tokens_per_second": 29196.939 }, { "epoch": 1.63783178942387, "grad_norm": 1.5625, "learning_rate": 2.1074546490912953e-05, "loss": 1.0393259048461914, "num_input_tokens_seen": 13163059008, "step": 46290, "train_runtime": 450833.7334, "train_tokens_per_second": 29197.147 }, { "epoch": 1.6381856096875989, "grad_norm": 1.6171875, "learning_rate": 2.1072674745197633e-05, "loss": 1.0415185928344726, "num_input_tokens_seen": 13165887680, "step": 46300, "train_runtime": 450929.4295, "train_tokens_per_second": 29197.224 }, { "epoch": 1.6385394299513276, "grad_norm": 1.6015625, "learning_rate": 2.1070803498113666e-05, "loss": 1.0281451225280762, "num_input_tokens_seen": 13168763136, "step": 46310, "train_runtime": 451026.1118, "train_tokens_per_second": 29197.341 }, { "epoch": 1.6388932502150564, "grad_norm": 1.53125, "learning_rate": 2.1068932749439683e-05, "loss": 1.040757942199707, "num_input_tokens_seen": 13171664704, "step": 46320, "train_runtime": 451125.7541, "train_tokens_per_second": 29197.324 }, { "epoch": 1.6392470704787852, "grad_norm": 1.578125, "learning_rate": 2.106706249895448e-05, "loss": 1.0481891632080078, "num_input_tokens_seen": 13174498368, "step": 46330, "train_runtime": 451219.4048, "train_tokens_per_second": 29197.544 }, { "epoch": 1.639600890742514, "grad_norm": 1.6171875, "learning_rate": 2.1065192746436978e-05, "loss": 1.0490798950195312, "num_input_tokens_seen": 13177369472, "step": 46340, "train_runtime": 451318.3687, "train_tokens_per_second": 29197.503 }, { "epoch": 1.6399547110062427, "grad_norm": 1.6015625, "learning_rate": 2.1063323491666236e-05, "loss": 1.0412813186645509, "num_input_tokens_seen": 13180198144, "step": 46350, "train_runtime": 451414.4927, "train_tokens_per_second": 29197.552 }, { "epoch": 1.6403085312699714, "grad_norm": 1.484375, "learning_rate": 2.1061454734421454e-05, "loss": 1.0397573471069337, "num_input_tokens_seen": 13183083840, "step": 46360, "train_runtime": 451515.9887, "train_tokens_per_second": 29197.38 }, { "epoch": 1.6406623515337002, "grad_norm": 1.6171875, "learning_rate": 2.1059586474481964e-05, "loss": 1.0464710235595702, "num_input_tokens_seen": 13185916928, "step": 46370, "train_runtime": 451614.328, "train_tokens_per_second": 29197.295 }, { "epoch": 1.6410161717974292, "grad_norm": 1.484375, "learning_rate": 2.1057718711627242e-05, "loss": 1.0438583374023438, "num_input_tokens_seen": 13188786176, "step": 46380, "train_runtime": 451712.3017, "train_tokens_per_second": 29197.315 }, { "epoch": 1.6413699920611577, "grad_norm": 1.5859375, "learning_rate": 2.1055851445636883e-05, "loss": 1.0410429000854493, "num_input_tokens_seen": 13191628032, "step": 46390, "train_runtime": 451815.1615, "train_tokens_per_second": 29196.957 }, { "epoch": 1.6417238123248867, "grad_norm": 1.5390625, "learning_rate": 2.105398467629065e-05, "loss": 1.058316993713379, "num_input_tokens_seen": 13194503104, "step": 46400, "train_runtime": 451913.9365, "train_tokens_per_second": 29196.938 }, { "epoch": 1.6420776325886153, "grad_norm": 1.625, "learning_rate": 2.105211840336841e-05, "loss": 1.0347240447998047, "num_input_tokens_seen": 13197430976, "step": 46410, "train_runtime": 452019.206, "train_tokens_per_second": 29196.616 }, { "epoch": 1.6424314528523443, "grad_norm": 1.75, "learning_rate": 2.1050252626650186e-05, "loss": 1.0519929885864259, "num_input_tokens_seen": 13200295744, "step": 46420, "train_runtime": 452118.3533, "train_tokens_per_second": 29196.549 }, { "epoch": 1.6427852731160728, "grad_norm": 1.5078125, "learning_rate": 2.104838734591614e-05, "loss": 1.0457836151123048, "num_input_tokens_seen": 13203172032, "step": 46430, "train_runtime": 452217.7775, "train_tokens_per_second": 29196.49 }, { "epoch": 1.6431390933798018, "grad_norm": 1.546875, "learning_rate": 2.1046522560946552e-05, "loss": 1.051173210144043, "num_input_tokens_seen": 13206040256, "step": 46440, "train_runtime": 452317.5407, "train_tokens_per_second": 29196.392 }, { "epoch": 1.6434929136435306, "grad_norm": 1.5390625, "learning_rate": 2.1044658271521856e-05, "loss": 1.0393603324890137, "num_input_tokens_seen": 13208871616, "step": 46450, "train_runtime": 452413.4982, "train_tokens_per_second": 29196.458 }, { "epoch": 1.6438467339072593, "grad_norm": 1.5625, "learning_rate": 2.1042794477422607e-05, "loss": 1.0537090301513672, "num_input_tokens_seen": 13211724224, "step": 46460, "train_runtime": 452511.737, "train_tokens_per_second": 29196.423 }, { "epoch": 1.644200554170988, "grad_norm": 1.578125, "learning_rate": 2.104093117842952e-05, "loss": 1.0456012725830077, "num_input_tokens_seen": 13214587840, "step": 46470, "train_runtime": 452610.323, "train_tokens_per_second": 29196.391 }, { "epoch": 1.6445543744347169, "grad_norm": 1.609375, "learning_rate": 2.1039068374323418e-05, "loss": 1.0417285919189454, "num_input_tokens_seen": 13217446528, "step": 46480, "train_runtime": 452708.1493, "train_tokens_per_second": 29196.396 }, { "epoch": 1.6449081946984456, "grad_norm": 1.53125, "learning_rate": 2.1037206064885274e-05, "loss": 1.050992202758789, "num_input_tokens_seen": 13220312960, "step": 46490, "train_runtime": 452808.3346, "train_tokens_per_second": 29196.267 }, { "epoch": 1.6452620149621744, "grad_norm": 1.6015625, "learning_rate": 2.1035344249896195e-05, "loss": 1.0359968185424804, "num_input_tokens_seen": 13223205056, "step": 46500, "train_runtime": 452907.9758, "train_tokens_per_second": 29196.229 }, { "epoch": 1.6456158352259032, "grad_norm": 1.5859375, "learning_rate": 2.1033482929137428e-05, "loss": 1.0434438705444335, "num_input_tokens_seen": 13226083584, "step": 46510, "train_runtime": 453009.1769, "train_tokens_per_second": 29196.061 }, { "epoch": 1.645969655489632, "grad_norm": 1.578125, "learning_rate": 2.1031622102390343e-05, "loss": 1.0472466468811035, "num_input_tokens_seen": 13228925952, "step": 46520, "train_runtime": 453105.2479, "train_tokens_per_second": 29196.144 }, { "epoch": 1.6463234757533607, "grad_norm": 1.5546875, "learning_rate": 2.1029761769436462e-05, "loss": 1.054567527770996, "num_input_tokens_seen": 13231716608, "step": 46530, "train_runtime": 453200.4771, "train_tokens_per_second": 29196.167 }, { "epoch": 1.6466772960170895, "grad_norm": 1.609375, "learning_rate": 2.1027901930057424e-05, "loss": 1.0405843734741211, "num_input_tokens_seen": 13234541632, "step": 46540, "train_runtime": 453296.6358, "train_tokens_per_second": 29196.205 }, { "epoch": 1.6470311162808184, "grad_norm": 1.5625, "learning_rate": 2.1026042584035024e-05, "loss": 1.0536142349243165, "num_input_tokens_seen": 13237397568, "step": 46550, "train_runtime": 453394.6308, "train_tokens_per_second": 29196.194 }, { "epoch": 1.647384936544547, "grad_norm": 1.546875, "learning_rate": 2.102418373115117e-05, "loss": 1.0409521102905273, "num_input_tokens_seen": 13240272896, "step": 46560, "train_runtime": 453493.6649, "train_tokens_per_second": 29196.158 }, { "epoch": 1.647738756808276, "grad_norm": 1.6015625, "learning_rate": 2.1022325371187922e-05, "loss": 1.03292236328125, "num_input_tokens_seen": 13243127168, "step": 46570, "train_runtime": 453590.7672, "train_tokens_per_second": 29196.201 }, { "epoch": 1.6480925770720045, "grad_norm": 1.53125, "learning_rate": 2.102046750392747e-05, "loss": 1.0524033546447753, "num_input_tokens_seen": 13245971712, "step": 46580, "train_runtime": 453687.8774, "train_tokens_per_second": 29196.221 }, { "epoch": 1.6484463973357335, "grad_norm": 1.53125, "learning_rate": 2.1018610129152124e-05, "loss": 1.0444852828979492, "num_input_tokens_seen": 13248825600, "step": 46590, "train_runtime": 453788.1898, "train_tokens_per_second": 29196.056 }, { "epoch": 1.648800217599462, "grad_norm": 1.4921875, "learning_rate": 2.101675324664436e-05, "loss": 1.035674476623535, "num_input_tokens_seen": 13251676864, "step": 46600, "train_runtime": 453883.6559, "train_tokens_per_second": 29196.198 }, { "epoch": 1.649154037863191, "grad_norm": 1.6171875, "learning_rate": 2.101489685618676e-05, "loss": 1.042851448059082, "num_input_tokens_seen": 13254531008, "step": 46610, "train_runtime": 453981.2854, "train_tokens_per_second": 29196.206 }, { "epoch": 1.6495078581269198, "grad_norm": 1.578125, "learning_rate": 2.1013040957562053e-05, "loss": 1.0516764640808105, "num_input_tokens_seen": 13257378880, "step": 46620, "train_runtime": 454078.885, "train_tokens_per_second": 29196.202 }, { "epoch": 1.6498616783906486, "grad_norm": 1.578125, "learning_rate": 2.1011185550553098e-05, "loss": 1.0474960327148437, "num_input_tokens_seen": 13260264704, "step": 46630, "train_runtime": 454176.3858, "train_tokens_per_second": 29196.288 }, { "epoch": 1.6502154986543773, "grad_norm": 1.6015625, "learning_rate": 2.1009330634942888e-05, "loss": 1.0495420455932618, "num_input_tokens_seen": 13263092864, "step": 46640, "train_runtime": 454271.7108, "train_tokens_per_second": 29196.387 }, { "epoch": 1.650569318918106, "grad_norm": 1.5390625, "learning_rate": 2.1007476210514558e-05, "loss": 1.0578771591186524, "num_input_tokens_seen": 13265986880, "step": 46650, "train_runtime": 454371.0557, "train_tokens_per_second": 29196.373 }, { "epoch": 1.6509231391818349, "grad_norm": 1.59375, "learning_rate": 2.1005622277051373e-05, "loss": 1.0405420303344726, "num_input_tokens_seen": 13268831936, "step": 46660, "train_runtime": 454468.2262, "train_tokens_per_second": 29196.391 }, { "epoch": 1.6512769594455636, "grad_norm": 1.578125, "learning_rate": 2.1003768834336722e-05, "loss": 1.034939956665039, "num_input_tokens_seen": 13271678208, "step": 46670, "train_runtime": 454567.1969, "train_tokens_per_second": 29196.296 }, { "epoch": 1.6516307797092924, "grad_norm": 1.6015625, "learning_rate": 2.100191588215414e-05, "loss": 1.042933177947998, "num_input_tokens_seen": 13274531392, "step": 46680, "train_runtime": 454666.3151, "train_tokens_per_second": 29196.206 }, { "epoch": 1.6519845999730212, "grad_norm": 1.5390625, "learning_rate": 2.1000063420287294e-05, "loss": 1.048354148864746, "num_input_tokens_seen": 13277452096, "step": 46690, "train_runtime": 454767.5276, "train_tokens_per_second": 29196.131 }, { "epoch": 1.6523384202367501, "grad_norm": 1.53125, "learning_rate": 2.0998211448519977e-05, "loss": 1.0457612991333007, "num_input_tokens_seen": 13280262400, "step": 46700, "train_runtime": 454862.6518, "train_tokens_per_second": 29196.203 }, { "epoch": 1.6526922405004787, "grad_norm": 1.53125, "learning_rate": 2.0996359966636126e-05, "loss": 1.0481047630310059, "num_input_tokens_seen": 13283095104, "step": 46710, "train_runtime": 454959.1776, "train_tokens_per_second": 29196.235 }, { "epoch": 1.6530460607642077, "grad_norm": 1.6015625, "learning_rate": 2.0994508974419803e-05, "loss": 1.0480422019958495, "num_input_tokens_seen": 13285955648, "step": 46720, "train_runtime": 455059.003, "train_tokens_per_second": 29196.116 }, { "epoch": 1.6533998810279362, "grad_norm": 1.578125, "learning_rate": 2.0992658471655204e-05, "loss": 1.0436612129211427, "num_input_tokens_seen": 13288854080, "step": 46730, "train_runtime": 455158.672, "train_tokens_per_second": 29196.091 }, { "epoch": 1.6537537012916652, "grad_norm": 1.609375, "learning_rate": 2.099080845812666e-05, "loss": 1.034919261932373, "num_input_tokens_seen": 13291678272, "step": 46740, "train_runtime": 455255.1077, "train_tokens_per_second": 29196.11 }, { "epoch": 1.6541075215553938, "grad_norm": 1.59375, "learning_rate": 2.0988958933618644e-05, "loss": 1.0450848579406737, "num_input_tokens_seen": 13294490624, "step": 46750, "train_runtime": 455348.9459, "train_tokens_per_second": 29196.27 }, { "epoch": 1.6544613418191227, "grad_norm": 1.5625, "learning_rate": 2.0987109897915743e-05, "loss": 1.0262994766235352, "num_input_tokens_seen": 13297313344, "step": 46760, "train_runtime": 455443.0541, "train_tokens_per_second": 29196.435 }, { "epoch": 1.6548151620828513, "grad_norm": 1.5625, "learning_rate": 2.098526135080269e-05, "loss": 1.043727970123291, "num_input_tokens_seen": 13300200448, "step": 46770, "train_runtime": 455545.7237, "train_tokens_per_second": 29196.192 }, { "epoch": 1.6551689823465803, "grad_norm": 1.6796875, "learning_rate": 2.098341329206435e-05, "loss": 1.0367565155029297, "num_input_tokens_seen": 13303008704, "step": 46780, "train_runtime": 455642.1439, "train_tokens_per_second": 29196.177 }, { "epoch": 1.655522802610309, "grad_norm": 1.6171875, "learning_rate": 2.0981565721485717e-05, "loss": 1.0436342239379883, "num_input_tokens_seen": 13305876544, "step": 46790, "train_runtime": 455741.123, "train_tokens_per_second": 29196.129 }, { "epoch": 1.6558766228740378, "grad_norm": 1.5625, "learning_rate": 2.097971863885191e-05, "loss": 1.049390697479248, "num_input_tokens_seen": 13308730368, "step": 46800, "train_runtime": 455839.0035, "train_tokens_per_second": 29196.12 }, { "epoch": 1.6562304431377666, "grad_norm": 1.5234375, "learning_rate": 2.0977872043948204e-05, "loss": 1.043410873413086, "num_input_tokens_seen": 13311532672, "step": 46810, "train_runtime": 455933.5458, "train_tokens_per_second": 29196.212 }, { "epoch": 1.6565842634014953, "grad_norm": 1.53125, "learning_rate": 2.0976025936559985e-05, "loss": 1.050224494934082, "num_input_tokens_seen": 13314393216, "step": 46820, "train_runtime": 456031.7654, "train_tokens_per_second": 29196.197 }, { "epoch": 1.656938083665224, "grad_norm": 1.578125, "learning_rate": 2.0974180316472775e-05, "loss": 1.0492095947265625, "num_input_tokens_seen": 13317245120, "step": 46830, "train_runtime": 456129.9987, "train_tokens_per_second": 29196.162 }, { "epoch": 1.6572919039289529, "grad_norm": 1.6484375, "learning_rate": 2.097233518347223e-05, "loss": 1.0414523124694823, "num_input_tokens_seen": 13320087360, "step": 46840, "train_runtime": 456224.6387, "train_tokens_per_second": 29196.335 }, { "epoch": 1.6576457241926816, "grad_norm": 1.5546875, "learning_rate": 2.0970490537344147e-05, "loss": 1.041114616394043, "num_input_tokens_seen": 13322951360, "step": 46850, "train_runtime": 456323.3271, "train_tokens_per_second": 29196.297 }, { "epoch": 1.6579995444564104, "grad_norm": 1.546875, "learning_rate": 2.096864637787444e-05, "loss": 1.0383722305297851, "num_input_tokens_seen": 13325792384, "step": 46860, "train_runtime": 456423.3829, "train_tokens_per_second": 29196.121 }, { "epoch": 1.6583533647201394, "grad_norm": 1.5703125, "learning_rate": 2.0966802704849163e-05, "loss": 1.044740867614746, "num_input_tokens_seen": 13328666816, "step": 46870, "train_runtime": 456523.1392, "train_tokens_per_second": 29196.038 }, { "epoch": 1.658707184983868, "grad_norm": 1.609375, "learning_rate": 2.0964959518054493e-05, "loss": 1.0436692237854004, "num_input_tokens_seen": 13331439104, "step": 46880, "train_runtime": 456615.544, "train_tokens_per_second": 29196.201 }, { "epoch": 1.659061005247597, "grad_norm": 1.515625, "learning_rate": 2.0963116817276757e-05, "loss": 1.0431354522705079, "num_input_tokens_seen": 13334280384, "step": 46890, "train_runtime": 456714.6153, "train_tokens_per_second": 29196.089 }, { "epoch": 1.6594148255113255, "grad_norm": 1.578125, "learning_rate": 2.09612746023024e-05, "loss": 1.055609893798828, "num_input_tokens_seen": 13337033728, "step": 46900, "train_runtime": 456805.7556, "train_tokens_per_second": 29196.291 }, { "epoch": 1.6597686457750545, "grad_norm": 1.5625, "learning_rate": 2.095943287291799e-05, "loss": 1.0302774429321289, "num_input_tokens_seen": 13339911232, "step": 46910, "train_runtime": 456905.6602, "train_tokens_per_second": 29196.205 }, { "epoch": 1.660122466038783, "grad_norm": 1.5546875, "learning_rate": 2.0957591628910243e-05, "loss": 1.0479881286621093, "num_input_tokens_seen": 13342779200, "step": 46920, "train_runtime": 457004.0384, "train_tokens_per_second": 29196.195 }, { "epoch": 1.660476286302512, "grad_norm": 1.578125, "learning_rate": 2.0955750870066006e-05, "loss": 1.0544830322265626, "num_input_tokens_seen": 13345669440, "step": 46930, "train_runtime": 457102.9238, "train_tokens_per_second": 29196.202 }, { "epoch": 1.6608301065662405, "grad_norm": 1.5390625, "learning_rate": 2.0953910596172238e-05, "loss": 1.0262856483459473, "num_input_tokens_seen": 13348459328, "step": 46940, "train_runtime": 457197.9955, "train_tokens_per_second": 29196.233 }, { "epoch": 1.6611839268299695, "grad_norm": 1.515625, "learning_rate": 2.095207080701605e-05, "loss": 1.0338899612426757, "num_input_tokens_seen": 13351299712, "step": 46950, "train_runtime": 457298.2516, "train_tokens_per_second": 29196.044 }, { "epoch": 1.6615377470936983, "grad_norm": 1.546875, "learning_rate": 2.095023150238468e-05, "loss": 1.0509410858154298, "num_input_tokens_seen": 13354214464, "step": 46960, "train_runtime": 457397.4501, "train_tokens_per_second": 29196.084 }, { "epoch": 1.661891567357427, "grad_norm": 1.609375, "learning_rate": 2.094839268206548e-05, "loss": 1.047112274169922, "num_input_tokens_seen": 13357048896, "step": 46970, "train_runtime": 457493.0668, "train_tokens_per_second": 29196.178 }, { "epoch": 1.6622453876211558, "grad_norm": 1.5078125, "learning_rate": 2.094655434584595e-05, "loss": 1.0434722900390625, "num_input_tokens_seen": 13359905216, "step": 46980, "train_runtime": 457589.1288, "train_tokens_per_second": 29196.291 }, { "epoch": 1.6625992078848846, "grad_norm": 1.5625, "learning_rate": 2.0944716493513714e-05, "loss": 1.0429104804992675, "num_input_tokens_seen": 13362752320, "step": 46990, "train_runtime": 457689.6381, "train_tokens_per_second": 29196.1 }, { "epoch": 1.6629530281486133, "grad_norm": 1.59375, "learning_rate": 2.0942879124856534e-05, "loss": 1.0438237190246582, "num_input_tokens_seen": 13365596352, "step": 47000, "train_runtime": 457787.0839, "train_tokens_per_second": 29196.098 }, { "epoch": 1.663306848412342, "grad_norm": 1.5234375, "learning_rate": 2.094104223966229e-05, "loss": 1.05397367477417, "num_input_tokens_seen": 13368435264, "step": 47010, "train_runtime": 457887.3056, "train_tokens_per_second": 29195.907 }, { "epoch": 1.6636606686760709, "grad_norm": 1.546875, "learning_rate": 2.0939205837719e-05, "loss": 1.0470624923706056, "num_input_tokens_seen": 13371336128, "step": 47020, "train_runtime": 457988.023, "train_tokens_per_second": 29195.821 }, { "epoch": 1.6640144889397996, "grad_norm": 1.625, "learning_rate": 2.093736991881481e-05, "loss": 1.0530908584594727, "num_input_tokens_seen": 13374194624, "step": 47030, "train_runtime": 458085.4751, "train_tokens_per_second": 29195.85 }, { "epoch": 1.6643683092035286, "grad_norm": 1.5234375, "learning_rate": 2.0935534482737994e-05, "loss": 1.0404083251953125, "num_input_tokens_seen": 13377049408, "step": 47040, "train_runtime": 458184.6808, "train_tokens_per_second": 29195.759 }, { "epoch": 1.6647221294672572, "grad_norm": 1.609375, "learning_rate": 2.0933699529276963e-05, "loss": 1.0439571380615233, "num_input_tokens_seen": 13379879360, "step": 47050, "train_runtime": 458283.6731, "train_tokens_per_second": 29195.627 }, { "epoch": 1.6650759497309862, "grad_norm": 1.6015625, "learning_rate": 2.093186505822025e-05, "loss": 1.0417221069335938, "num_input_tokens_seen": 13382698880, "step": 47060, "train_runtime": 458378.27, "train_tokens_per_second": 29195.753 }, { "epoch": 1.6654297699947147, "grad_norm": 1.59375, "learning_rate": 2.093003106935652e-05, "loss": 1.0277709007263183, "num_input_tokens_seen": 13385529024, "step": 47070, "train_runtime": 458472.769, "train_tokens_per_second": 29195.909 }, { "epoch": 1.6657835902584437, "grad_norm": 1.578125, "learning_rate": 2.0928197562474576e-05, "loss": 1.0528524398803711, "num_input_tokens_seen": 13388344192, "step": 47080, "train_runtime": 458568.8932, "train_tokens_per_second": 29195.928 }, { "epoch": 1.6661374105221722, "grad_norm": 1.5625, "learning_rate": 2.0926364537363328e-05, "loss": 1.0390199661254882, "num_input_tokens_seen": 13391186560, "step": 47090, "train_runtime": 458665.013, "train_tokens_per_second": 29196.006 }, { "epoch": 1.6664912307859012, "grad_norm": 1.578125, "learning_rate": 2.0924531993811842e-05, "loss": 1.0489742279052734, "num_input_tokens_seen": 13393996416, "step": 47100, "train_runtime": 458758.5445, "train_tokens_per_second": 29196.179 }, { "epoch": 1.6668450510496298, "grad_norm": 1.578125, "learning_rate": 2.0922699931609298e-05, "loss": 1.0449716567993164, "num_input_tokens_seen": 13396853760, "step": 47110, "train_runtime": 458858.2973, "train_tokens_per_second": 29196.059 }, { "epoch": 1.6671988713133588, "grad_norm": 1.6484375, "learning_rate": 2.092086835054501e-05, "loss": 1.0386228561401367, "num_input_tokens_seen": 13399712064, "step": 47120, "train_runtime": 458959.7016, "train_tokens_per_second": 29195.836 }, { "epoch": 1.6675526915770875, "grad_norm": 1.5625, "learning_rate": 2.0919037250408417e-05, "loss": 1.061539649963379, "num_input_tokens_seen": 13402605056, "step": 47130, "train_runtime": 459062.1069, "train_tokens_per_second": 29195.625 }, { "epoch": 1.6679065118408163, "grad_norm": 1.53125, "learning_rate": 2.0917206630989093e-05, "loss": 1.0274774551391601, "num_input_tokens_seen": 13405434112, "step": 47140, "train_runtime": 459157.6139, "train_tokens_per_second": 29195.713 }, { "epoch": 1.668260332104545, "grad_norm": 1.625, "learning_rate": 2.0915376492076734e-05, "loss": 1.0601457595825194, "num_input_tokens_seen": 13408317248, "step": 47150, "train_runtime": 459257.1859, "train_tokens_per_second": 29195.661 }, { "epoch": 1.6686141523682738, "grad_norm": 1.59375, "learning_rate": 2.0913546833461167e-05, "loss": 1.0459922790527343, "num_input_tokens_seen": 13411214528, "step": 47160, "train_runtime": 459355.9211, "train_tokens_per_second": 29195.693 }, { "epoch": 1.6689679726320026, "grad_norm": 1.546875, "learning_rate": 2.0911717654932358e-05, "loss": 1.0506868362426758, "num_input_tokens_seen": 13414142848, "step": 47170, "train_runtime": 459457.6723, "train_tokens_per_second": 29195.601 }, { "epoch": 1.6693217928957313, "grad_norm": 1.5859375, "learning_rate": 2.0909888956280382e-05, "loss": 1.0442222595214843, "num_input_tokens_seen": 13416974656, "step": 47180, "train_runtime": 459556.2284, "train_tokens_per_second": 29195.502 }, { "epoch": 1.6696756131594601, "grad_norm": 1.578125, "learning_rate": 2.0908060737295463e-05, "loss": 1.0459659576416016, "num_input_tokens_seen": 13419807360, "step": 47190, "train_runtime": 459654.922, "train_tokens_per_second": 29195.396 }, { "epoch": 1.6700294334231889, "grad_norm": 1.5234375, "learning_rate": 2.0906232997767933e-05, "loss": 1.046407127380371, "num_input_tokens_seen": 13422652160, "step": 47200, "train_runtime": 459753.5346, "train_tokens_per_second": 29195.321 }, { "epoch": 1.6703832536869179, "grad_norm": 1.5390625, "learning_rate": 2.0904405737488273e-05, "loss": 1.0499863624572754, "num_input_tokens_seen": 13425501952, "step": 47210, "train_runtime": 459852.2304, "train_tokens_per_second": 29195.252 }, { "epoch": 1.6707370739506464, "grad_norm": 1.59375, "learning_rate": 2.0902578956247073e-05, "loss": 1.0427212715148926, "num_input_tokens_seen": 13428351808, "step": 47220, "train_runtime": 459948.4449, "train_tokens_per_second": 29195.341 }, { "epoch": 1.6710908942143754, "grad_norm": 1.5390625, "learning_rate": 2.090075265383507e-05, "loss": 1.0481599807739257, "num_input_tokens_seen": 13431173376, "step": 47230, "train_runtime": 460043.0176, "train_tokens_per_second": 29195.473 }, { "epoch": 1.671444714478104, "grad_norm": 1.578125, "learning_rate": 2.0898926830043105e-05, "loss": 1.0492734909057617, "num_input_tokens_seen": 13434019200, "step": 47240, "train_runtime": 460143.0516, "train_tokens_per_second": 29195.31 }, { "epoch": 1.671798534741833, "grad_norm": 1.5546875, "learning_rate": 2.0897101484662172e-05, "loss": 1.0275311470031738, "num_input_tokens_seen": 13436852224, "step": 47250, "train_runtime": 460239.3385, "train_tokens_per_second": 29195.358 }, { "epoch": 1.6721523550055615, "grad_norm": 1.546875, "learning_rate": 2.0895276617483384e-05, "loss": 1.0409951210021973, "num_input_tokens_seen": 13439749248, "step": 47260, "train_runtime": 460340.9623, "train_tokens_per_second": 29195.206 }, { "epoch": 1.6725061752692905, "grad_norm": 1.5625, "learning_rate": 2.089345222829797e-05, "loss": 1.0670215606689453, "num_input_tokens_seen": 13442612416, "step": 47270, "train_runtime": 460443.593, "train_tokens_per_second": 29194.917 }, { "epoch": 1.672859995533019, "grad_norm": 1.484375, "learning_rate": 2.0891628316897297e-05, "loss": 1.0492310523986816, "num_input_tokens_seen": 13445467136, "step": 47280, "train_runtime": 460541.1391, "train_tokens_per_second": 29194.932 }, { "epoch": 1.673213815796748, "grad_norm": 1.59375, "learning_rate": 2.0889804883072863e-05, "loss": 1.0431037902832032, "num_input_tokens_seen": 13448285184, "step": 47290, "train_runtime": 460634.195, "train_tokens_per_second": 29195.152 }, { "epoch": 1.6735676360604768, "grad_norm": 1.53125, "learning_rate": 2.088798192661629e-05, "loss": 1.0487661361694336, "num_input_tokens_seen": 13451164352, "step": 47300, "train_runtime": 460735.4841, "train_tokens_per_second": 29194.982 }, { "epoch": 1.6739214563242055, "grad_norm": 1.5546875, "learning_rate": 2.0886159447319314e-05, "loss": 1.0385402679443358, "num_input_tokens_seen": 13453996416, "step": 47310, "train_runtime": 460828.8895, "train_tokens_per_second": 29195.21 }, { "epoch": 1.6742752765879343, "grad_norm": 1.609375, "learning_rate": 2.0884337444973824e-05, "loss": 1.0444768905639648, "num_input_tokens_seen": 13456834240, "step": 47320, "train_runtime": 460928.5045, "train_tokens_per_second": 29195.058 }, { "epoch": 1.674629096851663, "grad_norm": 1.5859375, "learning_rate": 2.088251591937182e-05, "loss": 1.04348783493042, "num_input_tokens_seen": 13459677824, "step": 47330, "train_runtime": 461023.3058, "train_tokens_per_second": 29195.222 }, { "epoch": 1.6749829171153918, "grad_norm": 1.5234375, "learning_rate": 2.0880694870305427e-05, "loss": 1.0553012847900392, "num_input_tokens_seen": 13462523200, "step": 47340, "train_runtime": 461118.4519, "train_tokens_per_second": 29195.369 }, { "epoch": 1.6753367373791206, "grad_norm": 1.5625, "learning_rate": 2.08788742975669e-05, "loss": 1.0575847625732422, "num_input_tokens_seen": 13465363840, "step": 47350, "train_runtime": 461214.9731, "train_tokens_per_second": 29195.418 }, { "epoch": 1.6756905576428494, "grad_norm": 1.515625, "learning_rate": 2.0877054200948624e-05, "loss": 1.0414051055908202, "num_input_tokens_seen": 13468191488, "step": 47360, "train_runtime": 461310.5018, "train_tokens_per_second": 29195.502 }, { "epoch": 1.6760443779065781, "grad_norm": 1.5, "learning_rate": 2.08752345802431e-05, "loss": 1.0467647552490233, "num_input_tokens_seen": 13471042048, "step": 47370, "train_runtime": 461408.0476, "train_tokens_per_second": 29195.507 }, { "epoch": 1.676398198170307, "grad_norm": 1.5625, "learning_rate": 2.0873415435242988e-05, "loss": 1.0510597229003906, "num_input_tokens_seen": 13473888448, "step": 47380, "train_runtime": 461504.9358, "train_tokens_per_second": 29195.546 }, { "epoch": 1.6767520184340357, "grad_norm": 1.5390625, "learning_rate": 2.087159676574102e-05, "loss": 1.0448269844055176, "num_input_tokens_seen": 13476737984, "step": 47390, "train_runtime": 461602.18, "train_tokens_per_second": 29195.568 }, { "epoch": 1.6771058386977646, "grad_norm": 1.5390625, "learning_rate": 2.086977857153011e-05, "loss": 1.0441213607788087, "num_input_tokens_seen": 13479566400, "step": 47400, "train_runtime": 461699.0362, "train_tokens_per_second": 29195.57 }, { "epoch": 1.6774596589614932, "grad_norm": 1.53125, "learning_rate": 2.086796085240326e-05, "loss": 1.02572603225708, "num_input_tokens_seen": 13482357696, "step": 47410, "train_runtime": 461794.9778, "train_tokens_per_second": 29195.549 }, { "epoch": 1.6778134792252222, "grad_norm": 1.5546875, "learning_rate": 2.0866143608153614e-05, "loss": 1.0397144317626954, "num_input_tokens_seen": 13485198336, "step": 47420, "train_runtime": 461893.4857, "train_tokens_per_second": 29195.472 }, { "epoch": 1.6781672994889507, "grad_norm": 1.6015625, "learning_rate": 2.086432683857444e-05, "loss": 1.0513761520385743, "num_input_tokens_seen": 13488037952, "step": 47430, "train_runtime": 461990.7485, "train_tokens_per_second": 29195.472 }, { "epoch": 1.6785211197526797, "grad_norm": 1.5625, "learning_rate": 2.0862510543459127e-05, "loss": 1.040067195892334, "num_input_tokens_seen": 13490893952, "step": 47440, "train_runtime": 462087.104, "train_tokens_per_second": 29195.565 }, { "epoch": 1.6788749400164085, "grad_norm": 1.546875, "learning_rate": 2.0860694722601197e-05, "loss": 1.0471364974975585, "num_input_tokens_seen": 13493688384, "step": 47450, "train_runtime": 462182.0053, "train_tokens_per_second": 29195.616 }, { "epoch": 1.6792287602801372, "grad_norm": 1.515625, "learning_rate": 2.0858879375794306e-05, "loss": 1.0379494667053222, "num_input_tokens_seen": 13496522752, "step": 47460, "train_runtime": 462279.2851, "train_tokens_per_second": 29195.604 }, { "epoch": 1.679582580543866, "grad_norm": 1.5078125, "learning_rate": 2.0857064502832207e-05, "loss": 1.056376838684082, "num_input_tokens_seen": 13499400384, "step": 47470, "train_runtime": 462381.2319, "train_tokens_per_second": 29195.39 }, { "epoch": 1.6799364008075948, "grad_norm": 1.5703125, "learning_rate": 2.0855250103508805e-05, "loss": 1.0333965301513672, "num_input_tokens_seen": 13502198976, "step": 47480, "train_runtime": 462474.8422, "train_tokens_per_second": 29195.532 }, { "epoch": 1.6802902210713235, "grad_norm": 1.5859375, "learning_rate": 2.085343617761812e-05, "loss": 1.0535968780517577, "num_input_tokens_seen": 13505095424, "step": 47490, "train_runtime": 462576.4348, "train_tokens_per_second": 29195.381 }, { "epoch": 1.6806440413350523, "grad_norm": 1.5703125, "learning_rate": 2.08516227249543e-05, "loss": 1.0447009086608887, "num_input_tokens_seen": 13507979072, "step": 47500, "train_runtime": 462675.6046, "train_tokens_per_second": 29195.356 }, { "epoch": 1.680997861598781, "grad_norm": 1.5859375, "learning_rate": 2.084980974531162e-05, "loss": 1.0551579475402832, "num_input_tokens_seen": 13510811264, "step": 47510, "train_runtime": 462774.2356, "train_tokens_per_second": 29195.254 }, { "epoch": 1.6813516818625098, "grad_norm": 1.5703125, "learning_rate": 2.0847997238484477e-05, "loss": 1.04492244720459, "num_input_tokens_seen": 13513655808, "step": 47520, "train_runtime": 462867.9451, "train_tokens_per_second": 29195.489 }, { "epoch": 1.6817055021262386, "grad_norm": 1.5546875, "learning_rate": 2.084618520426739e-05, "loss": 1.0321231842041017, "num_input_tokens_seen": 13516457088, "step": 47530, "train_runtime": 462963.576, "train_tokens_per_second": 29195.509 }, { "epoch": 1.6820593223899674, "grad_norm": 1.6328125, "learning_rate": 2.0844373642455005e-05, "loss": 1.0554420471191406, "num_input_tokens_seen": 13519269760, "step": 47540, "train_runtime": 463061.5658, "train_tokens_per_second": 29195.405 }, { "epoch": 1.6824131426536963, "grad_norm": 1.515625, "learning_rate": 2.0842562552842103e-05, "loss": 1.0388916015625, "num_input_tokens_seen": 13522149376, "step": 47550, "train_runtime": 463158.9585, "train_tokens_per_second": 29195.483 }, { "epoch": 1.682766962917425, "grad_norm": 1.5546875, "learning_rate": 2.0840751935223573e-05, "loss": 1.0513490676879882, "num_input_tokens_seen": 13525025600, "step": 47560, "train_runtime": 463256.1095, "train_tokens_per_second": 29195.569 }, { "epoch": 1.6831207831811539, "grad_norm": 1.53125, "learning_rate": 2.0838941789394442e-05, "loss": 1.0462310791015625, "num_input_tokens_seen": 13527870528, "step": 47570, "train_runtime": 463352.1806, "train_tokens_per_second": 29195.655 }, { "epoch": 1.6834746034448824, "grad_norm": 1.5234375, "learning_rate": 2.083713211514986e-05, "loss": 1.0376806259155273, "num_input_tokens_seen": 13530731712, "step": 47580, "train_runtime": 463452.7968, "train_tokens_per_second": 29195.49 }, { "epoch": 1.6838284237086114, "grad_norm": 1.5546875, "learning_rate": 2.083532291228509e-05, "loss": 1.0448654174804688, "num_input_tokens_seen": 13533541440, "step": 47590, "train_runtime": 463547.5185, "train_tokens_per_second": 29195.586 }, { "epoch": 1.68418224397234, "grad_norm": 1.53125, "learning_rate": 2.0833514180595527e-05, "loss": 1.0375941276550293, "num_input_tokens_seen": 13536369920, "step": 47600, "train_runtime": 463645.8791, "train_tokens_per_second": 29195.493 }, { "epoch": 1.684536064236069, "grad_norm": 1.515625, "learning_rate": 2.08317059198767e-05, "loss": 1.0529433250427247, "num_input_tokens_seen": 13539229248, "step": 47610, "train_runtime": 463743.4026, "train_tokens_per_second": 29195.519 }, { "epoch": 1.6848898844997977, "grad_norm": 1.53125, "learning_rate": 2.0829898129924246e-05, "loss": 1.0403919219970703, "num_input_tokens_seen": 13542116416, "step": 47620, "train_runtime": 463843.9651, "train_tokens_per_second": 29195.414 }, { "epoch": 1.6852437047635265, "grad_norm": 1.6484375, "learning_rate": 2.0828090810533936e-05, "loss": 1.0451854705810546, "num_input_tokens_seen": 13544968064, "step": 47630, "train_runtime": 463942.5191, "train_tokens_per_second": 29195.358 }, { "epoch": 1.6855975250272552, "grad_norm": 1.5859375, "learning_rate": 2.0826283961501665e-05, "loss": 1.0454134941101074, "num_input_tokens_seen": 13547780288, "step": 47640, "train_runtime": 464038.7261, "train_tokens_per_second": 29195.366 }, { "epoch": 1.685951345290984, "grad_norm": 1.546875, "learning_rate": 2.0824477582623445e-05, "loss": 1.0439224243164062, "num_input_tokens_seen": 13550642496, "step": 47650, "train_runtime": 464136.1614, "train_tokens_per_second": 29195.403 }, { "epoch": 1.6863051655547128, "grad_norm": 1.5625, "learning_rate": 2.0822671673695414e-05, "loss": 1.054850196838379, "num_input_tokens_seen": 13553570048, "step": 47660, "train_runtime": 464236.5271, "train_tokens_per_second": 29195.398 }, { "epoch": 1.6866589858184415, "grad_norm": 1.5, "learning_rate": 2.0820866234513844e-05, "loss": 1.0565918922424316, "num_input_tokens_seen": 13556407616, "step": 47670, "train_runtime": 464335.1491, "train_tokens_per_second": 29195.308 }, { "epoch": 1.6870128060821703, "grad_norm": 1.5234375, "learning_rate": 2.0819061264875116e-05, "loss": 1.0543604850769044, "num_input_tokens_seen": 13559210688, "step": 47680, "train_runtime": 464427.835, "train_tokens_per_second": 29195.517 }, { "epoch": 1.687366626345899, "grad_norm": 1.4921875, "learning_rate": 2.0817256764575738e-05, "loss": 1.0420949935913086, "num_input_tokens_seen": 13561989696, "step": 47690, "train_runtime": 464523.2772, "train_tokens_per_second": 29195.501 }, { "epoch": 1.687720446609628, "grad_norm": 1.5, "learning_rate": 2.0815452733412354e-05, "loss": 1.0442051887512207, "num_input_tokens_seen": 13564833792, "step": 47700, "train_runtime": 464618.5704, "train_tokens_per_second": 29195.634 }, { "epoch": 1.6880742668733566, "grad_norm": 1.5625, "learning_rate": 2.081364917118171e-05, "loss": 1.0418291091918945, "num_input_tokens_seen": 13567649856, "step": 47710, "train_runtime": 464712.9509, "train_tokens_per_second": 29195.764 }, { "epoch": 1.6884280871370856, "grad_norm": 1.5390625, "learning_rate": 2.08118460776807e-05, "loss": 1.0447476387023926, "num_input_tokens_seen": 13570492544, "step": 47720, "train_runtime": 464808.5861, "train_tokens_per_second": 29195.873 }, { "epoch": 1.6887819074008141, "grad_norm": 1.546875, "learning_rate": 2.0810043452706317e-05, "loss": 1.0467083930969239, "num_input_tokens_seen": 13573312896, "step": 47730, "train_runtime": 464903.8846, "train_tokens_per_second": 29195.955 }, { "epoch": 1.6891357276645431, "grad_norm": 1.53125, "learning_rate": 2.08082412960557e-05, "loss": 1.0457755088806153, "num_input_tokens_seen": 13576127424, "step": 47740, "train_runtime": 464998.157, "train_tokens_per_second": 29196.089 }, { "epoch": 1.6894895479282717, "grad_norm": 1.6171875, "learning_rate": 2.0806439607526085e-05, "loss": 1.0554765701293944, "num_input_tokens_seen": 13578962368, "step": 47750, "train_runtime": 465092.9708, "train_tokens_per_second": 29196.232 }, { "epoch": 1.6898433681920006, "grad_norm": 1.6328125, "learning_rate": 2.0804638386914853e-05, "loss": 1.0475746154785157, "num_input_tokens_seen": 13581805696, "step": 47760, "train_runtime": 465190.6014, "train_tokens_per_second": 29196.217 }, { "epoch": 1.6901971884557292, "grad_norm": 1.5703125, "learning_rate": 2.0802837634019497e-05, "loss": 1.0468786239624024, "num_input_tokens_seen": 13584596864, "step": 47770, "train_runtime": 465285.636, "train_tokens_per_second": 29196.252 }, { "epoch": 1.6905510087194582, "grad_norm": 1.5546875, "learning_rate": 2.080103734863764e-05, "loss": 1.0477848052978516, "num_input_tokens_seen": 13587456064, "step": 47780, "train_runtime": 465384.5809, "train_tokens_per_second": 29196.189 }, { "epoch": 1.690904828983187, "grad_norm": 1.546875, "learning_rate": 2.0799237530567022e-05, "loss": 1.0498855590820313, "num_input_tokens_seen": 13590344512, "step": 47790, "train_runtime": 465481.9338, "train_tokens_per_second": 29196.288 }, { "epoch": 1.6912586492469157, "grad_norm": 1.5078125, "learning_rate": 2.079743817960551e-05, "loss": 1.0415288925170898, "num_input_tokens_seen": 13593122368, "step": 47800, "train_runtime": 465578.3119, "train_tokens_per_second": 29196.21 }, { "epoch": 1.6916124695106445, "grad_norm": 1.5, "learning_rate": 2.0795639295551074e-05, "loss": 1.0545483589172364, "num_input_tokens_seen": 13596015680, "step": 47810, "train_runtime": 465677.1929, "train_tokens_per_second": 29196.224 }, { "epoch": 1.6919662897743732, "grad_norm": 1.5859375, "learning_rate": 2.0793840878201835e-05, "loss": 1.0294765472412108, "num_input_tokens_seen": 13598832384, "step": 47820, "train_runtime": 465772.1076, "train_tokens_per_second": 29196.322 }, { "epoch": 1.692320110038102, "grad_norm": 1.5859375, "learning_rate": 2.0792042927356023e-05, "loss": 1.0374161720275878, "num_input_tokens_seen": 13601646720, "step": 47830, "train_runtime": 465868.358, "train_tokens_per_second": 29196.331 }, { "epoch": 1.6926739303018308, "grad_norm": 1.53125, "learning_rate": 2.079024544281199e-05, "loss": 1.0482377052307128, "num_input_tokens_seen": 13604438848, "step": 47840, "train_runtime": 465963.5646, "train_tokens_per_second": 29196.358 }, { "epoch": 1.6930277505655595, "grad_norm": 1.65625, "learning_rate": 2.078844842436821e-05, "loss": 1.0437973022460938, "num_input_tokens_seen": 13607228928, "step": 47850, "train_runtime": 466057.9138, "train_tokens_per_second": 29196.434 }, { "epoch": 1.6933815708292883, "grad_norm": 1.625, "learning_rate": 2.0786651871823272e-05, "loss": 1.038986587524414, "num_input_tokens_seen": 13610089280, "step": 47860, "train_runtime": 466157.8318, "train_tokens_per_second": 29196.312 }, { "epoch": 1.6937353910930173, "grad_norm": 1.59375, "learning_rate": 2.0784855784975907e-05, "loss": 1.0401915550231933, "num_input_tokens_seen": 13612907328, "step": 47870, "train_runtime": 466252.4636, "train_tokens_per_second": 29196.43 }, { "epoch": 1.6940892113567458, "grad_norm": 1.546875, "learning_rate": 2.078306016362495e-05, "loss": 1.0373383522033692, "num_input_tokens_seen": 13615737856, "step": 47880, "train_runtime": 466349.3174, "train_tokens_per_second": 29196.436 }, { "epoch": 1.6944430316204748, "grad_norm": 1.59375, "learning_rate": 2.0781265007569355e-05, "loss": 1.0413772583007812, "num_input_tokens_seen": 13618588352, "step": 47890, "train_runtime": 466446.225, "train_tokens_per_second": 29196.481 }, { "epoch": 1.6947968518842034, "grad_norm": 1.5625, "learning_rate": 2.0779470316608218e-05, "loss": 1.0577576637268067, "num_input_tokens_seen": 13621466304, "step": 47900, "train_runtime": 466544.1411, "train_tokens_per_second": 29196.522 }, { "epoch": 1.6951506721479324, "grad_norm": 1.53125, "learning_rate": 2.0777676090540738e-05, "loss": 1.0431707382202149, "num_input_tokens_seen": 13624274496, "step": 47910, "train_runtime": 466638.1767, "train_tokens_per_second": 29196.656 }, { "epoch": 1.695504492411661, "grad_norm": 1.6171875, "learning_rate": 2.0775882329166235e-05, "loss": 1.059424877166748, "num_input_tokens_seen": 13627144192, "step": 47920, "train_runtime": 466733.9718, "train_tokens_per_second": 29196.812 }, { "epoch": 1.69585831267539, "grad_norm": 1.6484375, "learning_rate": 2.0774089032284164e-05, "loss": 1.0579084396362304, "num_input_tokens_seen": 13629971648, "step": 47930, "train_runtime": 466827.3692, "train_tokens_per_second": 29197.028 }, { "epoch": 1.6962121329391184, "grad_norm": 1.5703125, "learning_rate": 2.0772296199694092e-05, "loss": 1.0509796142578125, "num_input_tokens_seen": 13632793792, "step": 47940, "train_runtime": 466923.5463, "train_tokens_per_second": 29197.058 }, { "epoch": 1.6965659532028474, "grad_norm": 1.5703125, "learning_rate": 2.0770503831195703e-05, "loss": 1.039320182800293, "num_input_tokens_seen": 13635600512, "step": 47950, "train_runtime": 467019.4387, "train_tokens_per_second": 29197.073 }, { "epoch": 1.6969197734665762, "grad_norm": 1.515625, "learning_rate": 2.0768711926588813e-05, "loss": 1.071627140045166, "num_input_tokens_seen": 13638457728, "step": 47960, "train_runtime": 467120.5229, "train_tokens_per_second": 29196.871 }, { "epoch": 1.697273593730305, "grad_norm": 1.5078125, "learning_rate": 2.076692048567335e-05, "loss": 1.0387510299682616, "num_input_tokens_seen": 13641345664, "step": 47970, "train_runtime": 467217.7414, "train_tokens_per_second": 29196.977 }, { "epoch": 1.6976274139940337, "grad_norm": 1.546875, "learning_rate": 2.076512950824937e-05, "loss": 1.0363213539123535, "num_input_tokens_seen": 13644170176, "step": 47980, "train_runtime": 467312.4609, "train_tokens_per_second": 29197.103 }, { "epoch": 1.6979812342577625, "grad_norm": 1.59375, "learning_rate": 2.0763338994117043e-05, "loss": 1.0325971603393556, "num_input_tokens_seen": 13647034688, "step": 47990, "train_runtime": 467408.4893, "train_tokens_per_second": 29197.233 }, { "epoch": 1.6983350545214912, "grad_norm": 1.5234375, "learning_rate": 2.0761548943076657e-05, "loss": 1.0379398345947266, "num_input_tokens_seen": 13649907456, "step": 48000, "train_runtime": 467509.9631, "train_tokens_per_second": 29197.041 }, { "epoch": 1.69868887478522, "grad_norm": 1.53125, "learning_rate": 2.0759759354928637e-05, "loss": 1.0252336502075194, "num_input_tokens_seen": 13652747200, "step": 48010, "train_runtime": 467608.1638, "train_tokens_per_second": 29196.982 }, { "epoch": 1.6990426950489488, "grad_norm": 1.53125, "learning_rate": 2.0757970229473512e-05, "loss": 1.0471942901611329, "num_input_tokens_seen": 13655570176, "step": 48020, "train_runtime": 467705.199, "train_tokens_per_second": 29196.96 }, { "epoch": 1.6993965153126775, "grad_norm": 1.5078125, "learning_rate": 2.0756181566511933e-05, "loss": 1.0526710510253907, "num_input_tokens_seen": 13658403008, "step": 48030, "train_runtime": 467801.0439, "train_tokens_per_second": 29197.034 }, { "epoch": 1.6997503355764065, "grad_norm": 1.5859375, "learning_rate": 2.0754393365844677e-05, "loss": 1.0546140670776367, "num_input_tokens_seen": 13661246656, "step": 48040, "train_runtime": 467899.1564, "train_tokens_per_second": 29196.989 }, { "epoch": 1.700104155840135, "grad_norm": 1.6015625, "learning_rate": 2.075260562727264e-05, "loss": 1.0283187866210937, "num_input_tokens_seen": 13664068160, "step": 48050, "train_runtime": 467994.4987, "train_tokens_per_second": 29197.07 }, { "epoch": 1.700457976103864, "grad_norm": 1.5625, "learning_rate": 2.0750818350596838e-05, "loss": 1.0443769454956056, "num_input_tokens_seen": 13666918592, "step": 48060, "train_runtime": 468094.2825, "train_tokens_per_second": 29196.936 }, { "epoch": 1.7008117963675926, "grad_norm": 1.5390625, "learning_rate": 2.0749031535618403e-05, "loss": 1.039093017578125, "num_input_tokens_seen": 13669768384, "step": 48070, "train_runtime": 468188.6178, "train_tokens_per_second": 29197.139 }, { "epoch": 1.7011656166313216, "grad_norm": 1.5546875, "learning_rate": 2.074724518213859e-05, "loss": 1.0362802505493165, "num_input_tokens_seen": 13672655936, "step": 48080, "train_runtime": 468290.0713, "train_tokens_per_second": 29196.98 }, { "epoch": 1.7015194368950501, "grad_norm": 1.6015625, "learning_rate": 2.0745459289958773e-05, "loss": 1.0392768859863282, "num_input_tokens_seen": 13675506176, "step": 48090, "train_runtime": 468388.0911, "train_tokens_per_second": 29196.955 }, { "epoch": 1.7018732571587791, "grad_norm": 1.5234375, "learning_rate": 2.0743673858880447e-05, "loss": 1.047902488708496, "num_input_tokens_seen": 13678392192, "step": 48100, "train_runtime": 468488.9157, "train_tokens_per_second": 29196.832 }, { "epoch": 1.7022270774225077, "grad_norm": 1.625, "learning_rate": 2.074188888870523e-05, "loss": 1.040693759918213, "num_input_tokens_seen": 13681223040, "step": 48110, "train_runtime": 468586.7138, "train_tokens_per_second": 29196.78 }, { "epoch": 1.7025808976862367, "grad_norm": 1.546875, "learning_rate": 2.0740104379234847e-05, "loss": 1.0504280090332032, "num_input_tokens_seen": 13684064896, "step": 48120, "train_runtime": 468683.9512, "train_tokens_per_second": 29196.786 }, { "epoch": 1.7029347179499654, "grad_norm": 1.546875, "learning_rate": 2.073832033027116e-05, "loss": 1.04351806640625, "num_input_tokens_seen": 13686884928, "step": 48130, "train_runtime": 468778.3339, "train_tokens_per_second": 29196.923 }, { "epoch": 1.7032885382136942, "grad_norm": 1.5, "learning_rate": 2.0736536741616128e-05, "loss": 1.0345563888549805, "num_input_tokens_seen": 13689754880, "step": 48140, "train_runtime": 468874.4155, "train_tokens_per_second": 29197.061 }, { "epoch": 1.703642358477423, "grad_norm": 1.5703125, "learning_rate": 2.073475361307185e-05, "loss": 1.0466058731079102, "num_input_tokens_seen": 13692595840, "step": 48150, "train_runtime": 468970.2353, "train_tokens_per_second": 29197.153 }, { "epoch": 1.7039961787411517, "grad_norm": 1.6015625, "learning_rate": 2.0732970944440534e-05, "loss": 1.038508415222168, "num_input_tokens_seen": 13695499712, "step": 48160, "train_runtime": 469069.2391, "train_tokens_per_second": 29197.182 }, { "epoch": 1.7043499990048805, "grad_norm": 1.546875, "learning_rate": 2.073118873552452e-05, "loss": 1.032989501953125, "num_input_tokens_seen": 13698357888, "step": 48170, "train_runtime": 469168.1216, "train_tokens_per_second": 29197.12 }, { "epoch": 1.7047038192686093, "grad_norm": 1.546875, "learning_rate": 2.0729406986126238e-05, "loss": 1.0547128677368165, "num_input_tokens_seen": 13701224064, "step": 48180, "train_runtime": 469267.1181, "train_tokens_per_second": 29197.068 }, { "epoch": 1.705057639532338, "grad_norm": 1.546875, "learning_rate": 2.0727625696048264e-05, "loss": 1.0474655151367187, "num_input_tokens_seen": 13704029888, "step": 48190, "train_runtime": 469363.4881, "train_tokens_per_second": 29197.051 }, { "epoch": 1.7054114597960668, "grad_norm": 1.5234375, "learning_rate": 2.0725844865093287e-05, "loss": 1.0476907730102538, "num_input_tokens_seen": 13706867200, "step": 48200, "train_runtime": 469458.5914, "train_tokens_per_second": 29197.18 }, { "epoch": 1.7057652800597958, "grad_norm": 1.5390625, "learning_rate": 2.07240644930641e-05, "loss": 1.040272045135498, "num_input_tokens_seen": 13709739264, "step": 48210, "train_runtime": 469557.7052, "train_tokens_per_second": 29197.134 }, { "epoch": 1.7061191003235243, "grad_norm": 1.6171875, "learning_rate": 2.0722284579763633e-05, "loss": 1.0462236404418945, "num_input_tokens_seen": 13712579456, "step": 48220, "train_runtime": 469655.1765, "train_tokens_per_second": 29197.122 }, { "epoch": 1.7064729205872533, "grad_norm": 1.6015625, "learning_rate": 2.0720505124994934e-05, "loss": 1.0380185127258301, "num_input_tokens_seen": 13715411648, "step": 48230, "train_runtime": 469751.9403, "train_tokens_per_second": 29197.137 }, { "epoch": 1.7068267408509818, "grad_norm": 1.5, "learning_rate": 2.0718726128561156e-05, "loss": 1.0448797225952149, "num_input_tokens_seen": 13718270848, "step": 48240, "train_runtime": 469848.8401, "train_tokens_per_second": 29197.201 }, { "epoch": 1.7071805611147108, "grad_norm": 1.484375, "learning_rate": 2.0716947590265572e-05, "loss": 1.0532607078552245, "num_input_tokens_seen": 13721091776, "step": 48250, "train_runtime": 469944.8196, "train_tokens_per_second": 29197.24 }, { "epoch": 1.7075343813784394, "grad_norm": 1.4921875, "learning_rate": 2.0715169509911588e-05, "loss": 1.0432819366455077, "num_input_tokens_seen": 13723950912, "step": 48260, "train_runtime": 470042.6813, "train_tokens_per_second": 29197.244 }, { "epoch": 1.7078882016421684, "grad_norm": 1.4765625, "learning_rate": 2.0713391887302706e-05, "loss": 1.0455898284912108, "num_input_tokens_seen": 13726796736, "step": 48270, "train_runtime": 470141.4976, "train_tokens_per_second": 29197.16 }, { "epoch": 1.708242021905897, "grad_norm": 1.578125, "learning_rate": 2.0711614722242566e-05, "loss": 1.054796314239502, "num_input_tokens_seen": 13729610496, "step": 48280, "train_runtime": 470238.4266, "train_tokens_per_second": 29197.126 }, { "epoch": 1.708595842169626, "grad_norm": 1.5546875, "learning_rate": 2.0709838014534923e-05, "loss": 1.040621566772461, "num_input_tokens_seen": 13732433536, "step": 48290, "train_runtime": 470335.3354, "train_tokens_per_second": 29197.112 }, { "epoch": 1.7089496624333547, "grad_norm": 1.5078125, "learning_rate": 2.0708061763983633e-05, "loss": 1.0442960739135743, "num_input_tokens_seen": 13735299264, "step": 48300, "train_runtime": 470433.6907, "train_tokens_per_second": 29197.099 }, { "epoch": 1.7093034826970834, "grad_norm": 1.609375, "learning_rate": 2.070628597039269e-05, "loss": 1.0369464874267578, "num_input_tokens_seen": 13738148736, "step": 48310, "train_runtime": 470527.0862, "train_tokens_per_second": 29197.36 }, { "epoch": 1.7096573029608122, "grad_norm": 1.5859375, "learning_rate": 2.07045106335662e-05, "loss": 1.0347278594970704, "num_input_tokens_seen": 13741024576, "step": 48320, "train_runtime": 470625.9429, "train_tokens_per_second": 29197.338 }, { "epoch": 1.710011123224541, "grad_norm": 1.5546875, "learning_rate": 2.0702735753308372e-05, "loss": 1.0356561660766601, "num_input_tokens_seen": 13743871680, "step": 48330, "train_runtime": 470721.5453, "train_tokens_per_second": 29197.456 }, { "epoch": 1.7103649434882697, "grad_norm": 1.515625, "learning_rate": 2.0700961329423558e-05, "loss": 1.04902925491333, "num_input_tokens_seen": 13746730624, "step": 48340, "train_runtime": 470820.0719, "train_tokens_per_second": 29197.418 }, { "epoch": 1.7107187637519985, "grad_norm": 1.578125, "learning_rate": 2.06991873617162e-05, "loss": 1.0557451248168945, "num_input_tokens_seen": 13749591872, "step": 48350, "train_runtime": 470919.8034, "train_tokens_per_second": 29197.311 }, { "epoch": 1.7110725840157273, "grad_norm": 1.5625, "learning_rate": 2.0697413849990883e-05, "loss": 1.0538095474243163, "num_input_tokens_seen": 13752402496, "step": 48360, "train_runtime": 471015.599, "train_tokens_per_second": 29197.34 }, { "epoch": 1.711426404279456, "grad_norm": 1.59375, "learning_rate": 2.0695640794052288e-05, "loss": 1.0530920028686523, "num_input_tokens_seen": 13755270592, "step": 48370, "train_runtime": 471117.4845, "train_tokens_per_second": 29197.113 }, { "epoch": 1.711780224543185, "grad_norm": 1.6328125, "learning_rate": 2.0693868193705228e-05, "loss": 1.0418710708618164, "num_input_tokens_seen": 13758136064, "step": 48380, "train_runtime": 471218.2489, "train_tokens_per_second": 29196.951 }, { "epoch": 1.7121340448069136, "grad_norm": 1.5234375, "learning_rate": 2.069209604875463e-05, "loss": 1.0257854461669922, "num_input_tokens_seen": 13761048000, "step": 48390, "train_runtime": 471319.6827, "train_tokens_per_second": 29196.846 }, { "epoch": 1.7124878650706425, "grad_norm": 1.5625, "learning_rate": 2.069032435900553e-05, "loss": 1.0533125877380372, "num_input_tokens_seen": 13763955520, "step": 48400, "train_runtime": 471423.1266, "train_tokens_per_second": 29196.606 }, { "epoch": 1.712841685334371, "grad_norm": 1.5859375, "learning_rate": 2.0688553124263086e-05, "loss": 1.0532243728637696, "num_input_tokens_seen": 13766769280, "step": 48410, "train_runtime": 471519.0769, "train_tokens_per_second": 29196.633 }, { "epoch": 1.7131955055981, "grad_norm": 1.546875, "learning_rate": 2.068678234433257e-05, "loss": 1.035375213623047, "num_input_tokens_seen": 13769620032, "step": 48420, "train_runtime": 471616.5294, "train_tokens_per_second": 29196.644 }, { "epoch": 1.7135493258618286, "grad_norm": 1.625, "learning_rate": 2.0685012019019385e-05, "loss": 1.0479228019714355, "num_input_tokens_seen": 13772479168, "step": 48430, "train_runtime": 471713.0964, "train_tokens_per_second": 29196.728 }, { "epoch": 1.7139031461255576, "grad_norm": 1.6015625, "learning_rate": 2.0683242148129027e-05, "loss": 1.0387092590332032, "num_input_tokens_seen": 13775317824, "step": 48440, "train_runtime": 471808.4508, "train_tokens_per_second": 29196.844 }, { "epoch": 1.7142569663892864, "grad_norm": 1.5390625, "learning_rate": 2.068147273146712e-05, "loss": 1.0448718070983887, "num_input_tokens_seen": 13778182400, "step": 48450, "train_runtime": 471906.4376, "train_tokens_per_second": 29196.852 }, { "epoch": 1.7146107866530151, "grad_norm": 1.546875, "learning_rate": 2.067970376883942e-05, "loss": 1.0333721160888671, "num_input_tokens_seen": 13781024832, "step": 48460, "train_runtime": 472004.4178, "train_tokens_per_second": 29196.813 }, { "epoch": 1.714964606916744, "grad_norm": 1.578125, "learning_rate": 2.0677935260051766e-05, "loss": 1.0551851272583008, "num_input_tokens_seen": 13783832896, "step": 48470, "train_runtime": 472098.437, "train_tokens_per_second": 29196.947 }, { "epoch": 1.7153184271804727, "grad_norm": 1.546875, "learning_rate": 2.0676167204910145e-05, "loss": 1.0528467178344727, "num_input_tokens_seen": 13786695424, "step": 48480, "train_runtime": 472194.4309, "train_tokens_per_second": 29197.073 }, { "epoch": 1.7156722474442014, "grad_norm": 1.609375, "learning_rate": 2.067439960322063e-05, "loss": 1.0395853996276856, "num_input_tokens_seen": 13789540672, "step": 48490, "train_runtime": 472292.3232, "train_tokens_per_second": 29197.046 }, { "epoch": 1.7160260677079302, "grad_norm": 1.59375, "learning_rate": 2.067263245478945e-05, "loss": 1.050419235229492, "num_input_tokens_seen": 13792359680, "step": 48500, "train_runtime": 472389.6654, "train_tokens_per_second": 29196.997 }, { "epoch": 1.716379887971659, "grad_norm": 1.5546875, "learning_rate": 2.06708657594229e-05, "loss": 1.0478198051452636, "num_input_tokens_seen": 13795189312, "step": 48510, "train_runtime": 472485.0945, "train_tokens_per_second": 29197.089 }, { "epoch": 1.7167337082353877, "grad_norm": 1.640625, "learning_rate": 2.066909951692744e-05, "loss": 1.050819206237793, "num_input_tokens_seen": 13798056320, "step": 48520, "train_runtime": 472585.2177, "train_tokens_per_second": 29196.97 }, { "epoch": 1.7170875284991165, "grad_norm": 1.59375, "learning_rate": 2.0667333727109607e-05, "loss": 1.0315229415893554, "num_input_tokens_seen": 13800873792, "step": 48530, "train_runtime": 472680.8053, "train_tokens_per_second": 29197.026 }, { "epoch": 1.7174413487628453, "grad_norm": 1.5703125, "learning_rate": 2.066556838977608e-05, "loss": 1.0307050704956056, "num_input_tokens_seen": 13803753728, "step": 48540, "train_runtime": 472781.4947, "train_tokens_per_second": 29196.899 }, { "epoch": 1.7177951690265743, "grad_norm": 1.625, "learning_rate": 2.0663803504733643e-05, "loss": 1.0403037071228027, "num_input_tokens_seen": 13806596224, "step": 48550, "train_runtime": 472877.2343, "train_tokens_per_second": 29196.999 }, { "epoch": 1.7181489892903028, "grad_norm": 1.53125, "learning_rate": 2.0662039071789186e-05, "loss": 1.0480350494384765, "num_input_tokens_seen": 13809494848, "step": 48560, "train_runtime": 472978.7893, "train_tokens_per_second": 29196.859 }, { "epoch": 1.7185028095540318, "grad_norm": 1.5859375, "learning_rate": 2.066027509074973e-05, "loss": 1.0463435173034668, "num_input_tokens_seen": 13812316224, "step": 48570, "train_runtime": 473072.4371, "train_tokens_per_second": 29197.043 }, { "epoch": 1.7188566298177603, "grad_norm": 1.5859375, "learning_rate": 2.0658511561422408e-05, "loss": 1.0436429977416992, "num_input_tokens_seen": 13815134080, "step": 48580, "train_runtime": 473168.8854, "train_tokens_per_second": 29197.047 }, { "epoch": 1.7192104500814893, "grad_norm": 1.578125, "learning_rate": 2.0656748483614464e-05, "loss": 1.041421890258789, "num_input_tokens_seen": 13818018304, "step": 48590, "train_runtime": 473267.7718, "train_tokens_per_second": 29197.041 }, { "epoch": 1.7195642703452179, "grad_norm": 1.546875, "learning_rate": 2.0654985857133256e-05, "loss": 1.051570224761963, "num_input_tokens_seen": 13820798656, "step": 48600, "train_runtime": 473361.4137, "train_tokens_per_second": 29197.138 }, { "epoch": 1.7199180906089468, "grad_norm": 1.625, "learning_rate": 2.065322368178626e-05, "loss": 1.0513435363769532, "num_input_tokens_seen": 13823666880, "step": 48610, "train_runtime": 473458.1954, "train_tokens_per_second": 29197.228 }, { "epoch": 1.7202719108726756, "grad_norm": 1.515625, "learning_rate": 2.0651461957381073e-05, "loss": 1.051394271850586, "num_input_tokens_seen": 13826486272, "step": 48620, "train_runtime": 473553.8688, "train_tokens_per_second": 29197.283 }, { "epoch": 1.7206257311364044, "grad_norm": 1.53125, "learning_rate": 2.064970068372539e-05, "loss": 1.0701923370361328, "num_input_tokens_seen": 13829337600, "step": 48630, "train_runtime": 473651.6269, "train_tokens_per_second": 29197.277 }, { "epoch": 1.7209795514001331, "grad_norm": 1.5859375, "learning_rate": 2.0647939860627043e-05, "loss": 1.0580183029174806, "num_input_tokens_seen": 13832139200, "step": 48640, "train_runtime": 473747.1725, "train_tokens_per_second": 29197.302 }, { "epoch": 1.721333371663862, "grad_norm": 1.5703125, "learning_rate": 2.0646179487893964e-05, "loss": 1.053616428375244, "num_input_tokens_seen": 13835023680, "step": 48650, "train_runtime": 473847.3854, "train_tokens_per_second": 29197.214 }, { "epoch": 1.7216871919275907, "grad_norm": 1.5859375, "learning_rate": 2.0644419565334194e-05, "loss": 1.0409774780273438, "num_input_tokens_seen": 13837870400, "step": 48660, "train_runtime": 473946.4473, "train_tokens_per_second": 29197.118 }, { "epoch": 1.7220410121913194, "grad_norm": 1.5078125, "learning_rate": 2.0642660092755907e-05, "loss": 1.0438819885253907, "num_input_tokens_seen": 13840713216, "step": 48670, "train_runtime": 474042.677, "train_tokens_per_second": 29197.188 }, { "epoch": 1.7223948324550482, "grad_norm": 1.5625, "learning_rate": 2.0640901069967375e-05, "loss": 1.042196273803711, "num_input_tokens_seen": 13843563264, "step": 48680, "train_runtime": 474138.3577, "train_tokens_per_second": 29197.307 }, { "epoch": 1.722748652718777, "grad_norm": 1.546875, "learning_rate": 2.0639142496777e-05, "loss": 1.0360612869262695, "num_input_tokens_seen": 13846371072, "step": 48690, "train_runtime": 474234.5726, "train_tokens_per_second": 29197.304 }, { "epoch": 1.723102472982506, "grad_norm": 1.6171875, "learning_rate": 2.0637384372993275e-05, "loss": 1.0482637405395507, "num_input_tokens_seen": 13849165696, "step": 48700, "train_runtime": 474327.5951, "train_tokens_per_second": 29197.47 }, { "epoch": 1.7234562932462345, "grad_norm": 1.515625, "learning_rate": 2.0635626698424836e-05, "loss": 1.036379051208496, "num_input_tokens_seen": 13851974848, "step": 48710, "train_runtime": 474423.1242, "train_tokens_per_second": 29197.512 }, { "epoch": 1.7238101135099635, "grad_norm": 1.59375, "learning_rate": 2.0633869472880413e-05, "loss": 1.0425637245178223, "num_input_tokens_seen": 13854800512, "step": 48720, "train_runtime": 474516.87, "train_tokens_per_second": 29197.699 }, { "epoch": 1.724163933773692, "grad_norm": 1.53125, "learning_rate": 2.0632112696168856e-05, "loss": 1.0267884254455566, "num_input_tokens_seen": 13857649536, "step": 48730, "train_runtime": 474613.8739, "train_tokens_per_second": 29197.734 }, { "epoch": 1.724517754037421, "grad_norm": 1.609375, "learning_rate": 2.0630356368099127e-05, "loss": 1.0543734550476074, "num_input_tokens_seen": 13860484224, "step": 48740, "train_runtime": 474708.1315, "train_tokens_per_second": 29197.908 }, { "epoch": 1.7248715743011496, "grad_norm": 1.53125, "learning_rate": 2.06286004884803e-05, "loss": 1.0459514617919923, "num_input_tokens_seen": 13863294144, "step": 48750, "train_runtime": 474802.2797, "train_tokens_per_second": 29198.036 }, { "epoch": 1.7252253945648786, "grad_norm": 1.5703125, "learning_rate": 2.062684505712157e-05, "loss": 1.0446882247924805, "num_input_tokens_seen": 13866109632, "step": 48760, "train_runtime": 474895.8284, "train_tokens_per_second": 29198.213 }, { "epoch": 1.725579214828607, "grad_norm": 1.5703125, "learning_rate": 2.0625090073832243e-05, "loss": 1.0386396408081056, "num_input_tokens_seen": 13868989440, "step": 48770, "train_runtime": 474995.8105, "train_tokens_per_second": 29198.13 }, { "epoch": 1.725933035092336, "grad_norm": 1.5546875, "learning_rate": 2.0623335538421733e-05, "loss": 1.0466388702392577, "num_input_tokens_seen": 13871900992, "step": 48780, "train_runtime": 475096.573, "train_tokens_per_second": 29198.066 }, { "epoch": 1.7262868553560649, "grad_norm": 1.5546875, "learning_rate": 2.0621581450699574e-05, "loss": 1.0408769607543946, "num_input_tokens_seen": 13874715264, "step": 48790, "train_runtime": 475193.8519, "train_tokens_per_second": 29198.011 }, { "epoch": 1.7266406756197936, "grad_norm": 1.578125, "learning_rate": 2.0619827810475418e-05, "loss": 1.0410490036010742, "num_input_tokens_seen": 13877607872, "step": 48800, "train_runtime": 475292.2553, "train_tokens_per_second": 29198.052 }, { "epoch": 1.7269944958835224, "grad_norm": 1.609375, "learning_rate": 2.0618074617559007e-05, "loss": 1.0360124588012696, "num_input_tokens_seen": 13880471104, "step": 48810, "train_runtime": 475390.8144, "train_tokens_per_second": 29198.021 }, { "epoch": 1.7273483161472512, "grad_norm": 1.5859375, "learning_rate": 2.0616321871760226e-05, "loss": 1.0540721893310547, "num_input_tokens_seen": 13883314176, "step": 48820, "train_runtime": 475486.6453, "train_tokens_per_second": 29198.116 }, { "epoch": 1.72770213641098, "grad_norm": 1.546875, "learning_rate": 2.0614569572889056e-05, "loss": 1.0346625328063965, "num_input_tokens_seen": 13886184000, "step": 48830, "train_runtime": 475584.162, "train_tokens_per_second": 29198.163 }, { "epoch": 1.7280559566747087, "grad_norm": 1.515625, "learning_rate": 2.061281772075559e-05, "loss": 1.0431413650512695, "num_input_tokens_seen": 13888998912, "step": 48840, "train_runtime": 475680.1868, "train_tokens_per_second": 29198.187 }, { "epoch": 1.7284097769384374, "grad_norm": 1.5390625, "learning_rate": 2.0611066315170047e-05, "loss": 1.024100399017334, "num_input_tokens_seen": 13891844032, "step": 48850, "train_runtime": 475777.1041, "train_tokens_per_second": 29198.219 }, { "epoch": 1.7287635972021662, "grad_norm": 1.578125, "learning_rate": 2.0609315355942744e-05, "loss": 1.0514487266540526, "num_input_tokens_seen": 13894653056, "step": 48860, "train_runtime": 475871.2165, "train_tokens_per_second": 29198.347 }, { "epoch": 1.7291174174658952, "grad_norm": 1.546875, "learning_rate": 2.0607564842884116e-05, "loss": 1.0382627487182616, "num_input_tokens_seen": 13897499200, "step": 48870, "train_runtime": 475968.1835, "train_tokens_per_second": 29198.379 }, { "epoch": 1.7294712377296237, "grad_norm": 1.5703125, "learning_rate": 2.0605814775804717e-05, "loss": 1.0404762268066405, "num_input_tokens_seen": 13900315904, "step": 48880, "train_runtime": 476065.678, "train_tokens_per_second": 29198.316 }, { "epoch": 1.7298250579933527, "grad_norm": 1.53125, "learning_rate": 2.0604065154515207e-05, "loss": 1.0355974197387696, "num_input_tokens_seen": 13903188096, "step": 48890, "train_runtime": 476169.0108, "train_tokens_per_second": 29198.011 }, { "epoch": 1.7301788782570813, "grad_norm": 1.484375, "learning_rate": 2.0602315978826363e-05, "loss": 1.0339536666870117, "num_input_tokens_seen": 13906031168, "step": 48900, "train_runtime": 476264.6223, "train_tokens_per_second": 29198.119 }, { "epoch": 1.7305326985208103, "grad_norm": 1.53125, "learning_rate": 2.0600567248549062e-05, "loss": 1.0224604606628418, "num_input_tokens_seen": 13908900416, "step": 48910, "train_runtime": 476363.9456, "train_tokens_per_second": 29198.054 }, { "epoch": 1.7308865187845388, "grad_norm": 1.5390625, "learning_rate": 2.0598818963494312e-05, "loss": 1.041419506072998, "num_input_tokens_seen": 13911761984, "step": 48920, "train_runtime": 476461.9537, "train_tokens_per_second": 29198.054 }, { "epoch": 1.7312403390482678, "grad_norm": 1.5859375, "learning_rate": 2.0597071123473223e-05, "loss": 1.0342070579528808, "num_input_tokens_seen": 13914586048, "step": 48930, "train_runtime": 476558.9906, "train_tokens_per_second": 29198.035 }, { "epoch": 1.7315941593119963, "grad_norm": 1.5390625, "learning_rate": 2.0595323728297013e-05, "loss": 1.0391162872314452, "num_input_tokens_seen": 13917437120, "step": 48940, "train_runtime": 476657.0566, "train_tokens_per_second": 29198.009 }, { "epoch": 1.7319479795757253, "grad_norm": 1.59375, "learning_rate": 2.059357677777702e-05, "loss": 1.0502416610717773, "num_input_tokens_seen": 13920332864, "step": 48950, "train_runtime": 476758.4667, "train_tokens_per_second": 29197.872 }, { "epoch": 1.732301799839454, "grad_norm": 1.546875, "learning_rate": 2.0591830271724687e-05, "loss": 1.0514039039611816, "num_input_tokens_seen": 13923163072, "step": 48960, "train_runtime": 476853.3703, "train_tokens_per_second": 29197.997 }, { "epoch": 1.7326556201031829, "grad_norm": 1.4921875, "learning_rate": 2.0590084209951588e-05, "loss": 1.0414766311645507, "num_input_tokens_seen": 13926025600, "step": 48970, "train_runtime": 476949.5068, "train_tokens_per_second": 29198.113 }, { "epoch": 1.7330094403669116, "grad_norm": 1.5625, "learning_rate": 2.0588338592269375e-05, "loss": 1.048966121673584, "num_input_tokens_seen": 13928862016, "step": 48980, "train_runtime": 477046.0383, "train_tokens_per_second": 29198.15 }, { "epoch": 1.7333632606306404, "grad_norm": 1.5, "learning_rate": 2.0586593418489846e-05, "loss": 1.0327461242675782, "num_input_tokens_seen": 13931706304, "step": 48990, "train_runtime": 477142.4779, "train_tokens_per_second": 29198.21 }, { "epoch": 1.7337170808943692, "grad_norm": 1.5703125, "learning_rate": 2.0584848688424894e-05, "loss": 1.0469164848327637, "num_input_tokens_seen": 13934492032, "step": 49000, "train_runtime": 477235.8661, "train_tokens_per_second": 29198.334 }, { "epoch": 1.734070901158098, "grad_norm": 1.515625, "learning_rate": 2.0583104401886512e-05, "loss": 1.0373330116271973, "num_input_tokens_seen": 13937352640, "step": 49010, "train_runtime": 477333.1974, "train_tokens_per_second": 29198.373 }, { "epoch": 1.7344247214218267, "grad_norm": 1.6171875, "learning_rate": 2.0581360558686828e-05, "loss": 1.0462541580200195, "num_input_tokens_seen": 13940169664, "step": 49020, "train_runtime": 477430.5141, "train_tokens_per_second": 29198.322 }, { "epoch": 1.7347785416855555, "grad_norm": 1.53125, "learning_rate": 2.057961715863807e-05, "loss": 1.0577322006225587, "num_input_tokens_seen": 13942974080, "step": 49030, "train_runtime": 477528.1572, "train_tokens_per_second": 29198.224 }, { "epoch": 1.7351323619492844, "grad_norm": 1.5546875, "learning_rate": 2.0577874201552578e-05, "loss": 1.0335983276367187, "num_input_tokens_seen": 13945876096, "step": 49040, "train_runtime": 477628.4343, "train_tokens_per_second": 29198.17 }, { "epoch": 1.735486182213013, "grad_norm": 1.609375, "learning_rate": 2.0576131687242803e-05, "loss": 1.052004623413086, "num_input_tokens_seen": 13948727552, "step": 49050, "train_runtime": 477725.0005, "train_tokens_per_second": 29198.237 }, { "epoch": 1.735840002476742, "grad_norm": 1.53125, "learning_rate": 2.0574389615521303e-05, "loss": 1.0471911430358887, "num_input_tokens_seen": 13951510016, "step": 49060, "train_runtime": 477819.1865, "train_tokens_per_second": 29198.304 }, { "epoch": 1.7361938227404705, "grad_norm": 1.53125, "learning_rate": 2.0572647986200757e-05, "loss": 1.0375133514404298, "num_input_tokens_seen": 13954370496, "step": 49070, "train_runtime": 477917.0954, "train_tokens_per_second": 29198.308 }, { "epoch": 1.7365476430041995, "grad_norm": 1.546875, "learning_rate": 2.057090679909395e-05, "loss": 1.0506306648254395, "num_input_tokens_seen": 13957226688, "step": 49080, "train_runtime": 478014.419, "train_tokens_per_second": 29198.338 }, { "epoch": 1.736901463267928, "grad_norm": 1.578125, "learning_rate": 2.056916605401378e-05, "loss": 1.0379024505615235, "num_input_tokens_seen": 13960103168, "step": 49090, "train_runtime": 478110.9201, "train_tokens_per_second": 29198.461 }, { "epoch": 1.737255283531657, "grad_norm": 1.6328125, "learning_rate": 2.0567425750773247e-05, "loss": 1.0387723922729493, "num_input_tokens_seen": 13962869504, "step": 49100, "train_runtime": 478204.8248, "train_tokens_per_second": 29198.512 }, { "epoch": 1.7376091037953856, "grad_norm": 1.515625, "learning_rate": 2.056568588918547e-05, "loss": 1.0447329521179198, "num_input_tokens_seen": 13965735744, "step": 49110, "train_runtime": 478301.3469, "train_tokens_per_second": 29198.613 }, { "epoch": 1.7379629240591146, "grad_norm": 1.5625, "learning_rate": 2.056394646906368e-05, "loss": 1.0494123458862306, "num_input_tokens_seen": 13968618560, "step": 49120, "train_runtime": 478401.7977, "train_tokens_per_second": 29198.508 }, { "epoch": 1.7383167443228433, "grad_norm": 1.59375, "learning_rate": 2.0562207490221216e-05, "loss": 1.056183433532715, "num_input_tokens_seen": 13971409984, "step": 49130, "train_runtime": 478498.0476, "train_tokens_per_second": 29198.468 }, { "epoch": 1.738670564586572, "grad_norm": 1.53125, "learning_rate": 2.056046895247152e-05, "loss": 1.0337942123413086, "num_input_tokens_seen": 13974325824, "step": 49140, "train_runtime": 478600.5157, "train_tokens_per_second": 29198.309 }, { "epoch": 1.7390243848503009, "grad_norm": 1.546875, "learning_rate": 2.0558730855628155e-05, "loss": 1.0294963836669921, "num_input_tokens_seen": 13977164992, "step": 49150, "train_runtime": 478698.1206, "train_tokens_per_second": 29198.287 }, { "epoch": 1.7393782051140296, "grad_norm": 1.546875, "learning_rate": 2.055699319950479e-05, "loss": 1.0346454620361327, "num_input_tokens_seen": 13980006592, "step": 49160, "train_runtime": 478795.8667, "train_tokens_per_second": 29198.261 }, { "epoch": 1.7397320253777584, "grad_norm": 1.625, "learning_rate": 2.055525598391521e-05, "loss": 1.0476339340209961, "num_input_tokens_seen": 13982844032, "step": 49170, "train_runtime": 478890.139, "train_tokens_per_second": 29198.438 }, { "epoch": 1.7400858456414872, "grad_norm": 1.59375, "learning_rate": 2.0553519208673293e-05, "loss": 1.0363340377807617, "num_input_tokens_seen": 13985742656, "step": 49180, "train_runtime": 478990.0942, "train_tokens_per_second": 29198.396 }, { "epoch": 1.740439665905216, "grad_norm": 1.53125, "learning_rate": 2.0551782873593057e-05, "loss": 1.0457462310791015, "num_input_tokens_seen": 13988579712, "step": 49190, "train_runtime": 479086.5108, "train_tokens_per_second": 29198.442 }, { "epoch": 1.7407934861689447, "grad_norm": 1.5546875, "learning_rate": 2.0550046978488592e-05, "loss": 1.0352367401123046, "num_input_tokens_seen": 13991383168, "step": 49200, "train_runtime": 479183.0376, "train_tokens_per_second": 29198.411 }, { "epoch": 1.7411473064326737, "grad_norm": 1.5546875, "learning_rate": 2.0548311523174133e-05, "loss": 1.0488887786865235, "num_input_tokens_seen": 13994221952, "step": 49210, "train_runtime": 479282.2296, "train_tokens_per_second": 29198.291 }, { "epoch": 1.7415011266964022, "grad_norm": 1.625, "learning_rate": 2.0546576507464003e-05, "loss": 1.0279927253723145, "num_input_tokens_seen": 13997047232, "step": 49220, "train_runtime": 479377.0136, "train_tokens_per_second": 29198.411 }, { "epoch": 1.7418549469601312, "grad_norm": 1.578125, "learning_rate": 2.054484193117264e-05, "loss": 1.0450519561767577, "num_input_tokens_seen": 13999908032, "step": 49230, "train_runtime": 479476.7231, "train_tokens_per_second": 29198.306 }, { "epoch": 1.7422087672238598, "grad_norm": 1.546875, "learning_rate": 2.0543107794114597e-05, "loss": 1.0506264686584472, "num_input_tokens_seen": 14002766016, "step": 49240, "train_runtime": 479574.9874, "train_tokens_per_second": 29198.283 }, { "epoch": 1.7425625874875887, "grad_norm": 1.6953125, "learning_rate": 2.0541374096104523e-05, "loss": 1.0401939392089843, "num_input_tokens_seen": 14005568576, "step": 49250, "train_runtime": 479669.4077, "train_tokens_per_second": 29198.378 }, { "epoch": 1.7429164077513173, "grad_norm": 1.5390625, "learning_rate": 2.05396408369572e-05, "loss": 1.0356176376342774, "num_input_tokens_seen": 14008406912, "step": 49260, "train_runtime": 479766.9693, "train_tokens_per_second": 29198.356 }, { "epoch": 1.7432702280150463, "grad_norm": 1.6015625, "learning_rate": 2.05379080164875e-05, "loss": 1.0442070007324218, "num_input_tokens_seen": 14011195456, "step": 49270, "train_runtime": 479861.6656, "train_tokens_per_second": 29198.405 }, { "epoch": 1.743624048278775, "grad_norm": 1.578125, "learning_rate": 2.053617563451041e-05, "loss": 1.0491275787353516, "num_input_tokens_seen": 14014009280, "step": 49280, "train_runtime": 479957.0554, "train_tokens_per_second": 29198.465 }, { "epoch": 1.7439778685425038, "grad_norm": 1.5390625, "learning_rate": 2.0534443690841026e-05, "loss": 1.051888656616211, "num_input_tokens_seen": 14016871680, "step": 49290, "train_runtime": 480053.2705, "train_tokens_per_second": 29198.576 }, { "epoch": 1.7443316888062326, "grad_norm": 1.5703125, "learning_rate": 2.0532712185294546e-05, "loss": 1.0419275283813476, "num_input_tokens_seen": 14019706496, "step": 49300, "train_runtime": 480149.7696, "train_tokens_per_second": 29198.611 }, { "epoch": 1.7446855090699613, "grad_norm": 1.546875, "learning_rate": 2.0530981117686292e-05, "loss": 1.0337262153625488, "num_input_tokens_seen": 14022544512, "step": 49310, "train_runtime": 480246.7632, "train_tokens_per_second": 29198.624 }, { "epoch": 1.74503932933369, "grad_norm": 1.5859375, "learning_rate": 2.0529250487831685e-05, "loss": 1.0391016960144044, "num_input_tokens_seen": 14025402624, "step": 49320, "train_runtime": 480344.1786, "train_tokens_per_second": 29198.652 }, { "epoch": 1.7453931495974189, "grad_norm": 1.5859375, "learning_rate": 2.0527520295546256e-05, "loss": 1.046268844604492, "num_input_tokens_seen": 14028195008, "step": 49330, "train_runtime": 480439.1016, "train_tokens_per_second": 29198.695 }, { "epoch": 1.7457469698611476, "grad_norm": 1.484375, "learning_rate": 2.052579054064565e-05, "loss": 1.0352148056030273, "num_input_tokens_seen": 14031070592, "step": 49340, "train_runtime": 480538.318, "train_tokens_per_second": 29198.651 }, { "epoch": 1.7461007901248764, "grad_norm": 1.59375, "learning_rate": 2.052406122294561e-05, "loss": 1.0393878936767578, "num_input_tokens_seen": 14033917056, "step": 49350, "train_runtime": 480636.8911, "train_tokens_per_second": 29198.585 }, { "epoch": 1.7464546103886052, "grad_norm": 1.546875, "learning_rate": 2.0522332342261998e-05, "loss": 1.0309988975524902, "num_input_tokens_seen": 14036744256, "step": 49360, "train_runtime": 480733.268, "train_tokens_per_second": 29198.612 }, { "epoch": 1.746808430652334, "grad_norm": 1.5859375, "learning_rate": 2.052060389841078e-05, "loss": 1.0485136032104492, "num_input_tokens_seen": 14039614784, "step": 49370, "train_runtime": 480831.881, "train_tokens_per_second": 29198.594 }, { "epoch": 1.747162250916063, "grad_norm": 1.6640625, "learning_rate": 2.0518875891208032e-05, "loss": 1.0527847290039063, "num_input_tokens_seen": 14042505024, "step": 49380, "train_runtime": 480929.443, "train_tokens_per_second": 29198.68 }, { "epoch": 1.7475160711797915, "grad_norm": 1.609375, "learning_rate": 2.051714832046994e-05, "loss": 1.0364698410034179, "num_input_tokens_seen": 14045327680, "step": 49390, "train_runtime": 481024.0881, "train_tokens_per_second": 29198.803 }, { "epoch": 1.7478698914435205, "grad_norm": 1.5703125, "learning_rate": 2.051542118601279e-05, "loss": 1.0604217529296875, "num_input_tokens_seen": 14048168320, "step": 49400, "train_runtime": 481121.7219, "train_tokens_per_second": 29198.782 }, { "epoch": 1.748223711707249, "grad_norm": 1.640625, "learning_rate": 2.0513694487652985e-05, "loss": 1.0384990692138671, "num_input_tokens_seen": 14050945984, "step": 49410, "train_runtime": 481215.2371, "train_tokens_per_second": 29198.88 }, { "epoch": 1.748577531970978, "grad_norm": 1.59375, "learning_rate": 2.051196822520703e-05, "loss": 1.0549892425537108, "num_input_tokens_seen": 14053775424, "step": 49420, "train_runtime": 481309.2135, "train_tokens_per_second": 29199.058 }, { "epoch": 1.7489313522347065, "grad_norm": 1.546875, "learning_rate": 2.0510242398491553e-05, "loss": 1.0484639167785645, "num_input_tokens_seen": 14056553600, "step": 49430, "train_runtime": 481404.3522, "train_tokens_per_second": 29199.058 }, { "epoch": 1.7492851724984355, "grad_norm": 1.65625, "learning_rate": 2.0508517007323266e-05, "loss": 1.0476638793945312, "num_input_tokens_seen": 14059430400, "step": 49440, "train_runtime": 481502.6083, "train_tokens_per_second": 29199.074 }, { "epoch": 1.7496389927621643, "grad_norm": 1.5859375, "learning_rate": 2.0506792051519007e-05, "loss": 1.0458457946777344, "num_input_tokens_seen": 14062304448, "step": 49450, "train_runtime": 481602.3122, "train_tokens_per_second": 29198.997 }, { "epoch": 1.749992813025893, "grad_norm": 1.5234375, "learning_rate": 2.050506753089571e-05, "loss": 1.044095516204834, "num_input_tokens_seen": 14065174720, "step": 49460, "train_runtime": 481702.3966, "train_tokens_per_second": 29198.889 }, { "epoch": 1.7503466332896218, "grad_norm": 1.6171875, "learning_rate": 2.050334344527043e-05, "loss": 1.0397148132324219, "num_input_tokens_seen": 14067993536, "step": 49470, "train_runtime": 481797.0595, "train_tokens_per_second": 29199.002 }, { "epoch": 1.7507004535533506, "grad_norm": 1.5, "learning_rate": 2.0501619794460322e-05, "loss": 1.0371423721313477, "num_input_tokens_seen": 14070812992, "step": 49480, "train_runtime": 481891.877, "train_tokens_per_second": 29199.108 }, { "epoch": 1.7510542738170793, "grad_norm": 1.5625, "learning_rate": 2.0499896578282647e-05, "loss": 1.0353283882141113, "num_input_tokens_seen": 14073621120, "step": 49490, "train_runtime": 481987.1479, "train_tokens_per_second": 29199.163 }, { "epoch": 1.751408094080808, "grad_norm": 1.5859375, "learning_rate": 2.049817379655477e-05, "loss": 1.0405938148498535, "num_input_tokens_seen": 14076485120, "step": 49500, "train_runtime": 482085.399, "train_tokens_per_second": 29199.153 }, { "epoch": 1.7517619143445369, "grad_norm": 1.5, "learning_rate": 2.049645144909418e-05, "loss": 1.0486406326293944, "num_input_tokens_seen": 14079344448, "step": 49510, "train_runtime": 482183.186, "train_tokens_per_second": 29199.161 }, { "epoch": 1.7521157346082656, "grad_norm": 1.5625, "learning_rate": 2.0494729535718454e-05, "loss": 1.054590892791748, "num_input_tokens_seen": 14082116544, "step": 49520, "train_runtime": 482278.4688, "train_tokens_per_second": 29199.14 }, { "epoch": 1.7524695548719946, "grad_norm": 1.5859375, "learning_rate": 2.0493008056245292e-05, "loss": 1.0536883354187012, "num_input_tokens_seen": 14085002496, "step": 49530, "train_runtime": 482377.502, "train_tokens_per_second": 29199.128 }, { "epoch": 1.7528233751357232, "grad_norm": 1.53125, "learning_rate": 2.0491287010492484e-05, "loss": 1.040531063079834, "num_input_tokens_seen": 14087823168, "step": 49540, "train_runtime": 482474.1638, "train_tokens_per_second": 29199.124 }, { "epoch": 1.7531771953994522, "grad_norm": 1.640625, "learning_rate": 2.0489566398277943e-05, "loss": 1.0404985427856446, "num_input_tokens_seen": 14090702016, "step": 49550, "train_runtime": 482571.7636, "train_tokens_per_second": 29199.185 }, { "epoch": 1.7535310156631807, "grad_norm": 1.5546875, "learning_rate": 2.0487846219419683e-05, "loss": 1.0284334182739259, "num_input_tokens_seen": 14093561536, "step": 49560, "train_runtime": 482668.1857, "train_tokens_per_second": 29199.276 }, { "epoch": 1.7538848359269097, "grad_norm": 1.5390625, "learning_rate": 2.048612647373583e-05, "loss": 1.0421756744384765, "num_input_tokens_seen": 14096403200, "step": 49570, "train_runtime": 482764.1746, "train_tokens_per_second": 29199.356 }, { "epoch": 1.7542386561906382, "grad_norm": 1.59375, "learning_rate": 2.0484407161044598e-05, "loss": 1.0391937255859376, "num_input_tokens_seen": 14099277248, "step": 49580, "train_runtime": 482868.2732, "train_tokens_per_second": 29199.014 }, { "epoch": 1.7545924764543672, "grad_norm": 1.4921875, "learning_rate": 2.0482688281164333e-05, "loss": 1.029792594909668, "num_input_tokens_seen": 14102163968, "step": 49590, "train_runtime": 482966.4412, "train_tokens_per_second": 29199.056 }, { "epoch": 1.7549462967180958, "grad_norm": 1.6328125, "learning_rate": 2.048096983391347e-05, "loss": 1.0432671546936034, "num_input_tokens_seen": 14104997632, "step": 49600, "train_runtime": 483061.3176, "train_tokens_per_second": 29199.187 }, { "epoch": 1.7553001169818248, "grad_norm": 1.53125, "learning_rate": 2.047925181911056e-05, "loss": 1.035003089904785, "num_input_tokens_seen": 14107825920, "step": 49610, "train_runtime": 483157.8585, "train_tokens_per_second": 29199.206 }, { "epoch": 1.7556539372455535, "grad_norm": 1.546875, "learning_rate": 2.0477534236574254e-05, "loss": 1.0351346969604491, "num_input_tokens_seen": 14110684672, "step": 49620, "train_runtime": 483255.226, "train_tokens_per_second": 29199.239 }, { "epoch": 1.7560077575092823, "grad_norm": 1.59375, "learning_rate": 2.0475817086123313e-05, "loss": 1.035903549194336, "num_input_tokens_seen": 14113532736, "step": 49630, "train_runtime": 483354.7374, "train_tokens_per_second": 29199.119 }, { "epoch": 1.756361577773011, "grad_norm": 1.546875, "learning_rate": 2.047410036757661e-05, "loss": 1.0369736671447753, "num_input_tokens_seen": 14116398912, "step": 49640, "train_runtime": 483452.6755, "train_tokens_per_second": 29199.133 }, { "epoch": 1.7567153980367398, "grad_norm": 1.6015625, "learning_rate": 2.0472384080753113e-05, "loss": 1.0273098945617676, "num_input_tokens_seen": 14119203904, "step": 49650, "train_runtime": 483547.0572, "train_tokens_per_second": 29199.234 }, { "epoch": 1.7570692183004686, "grad_norm": 1.625, "learning_rate": 2.04706682254719e-05, "loss": 1.035970687866211, "num_input_tokens_seen": 14122062720, "step": 49660, "train_runtime": 483645.8289, "train_tokens_per_second": 29199.182 }, { "epoch": 1.7574230385641973, "grad_norm": 1.609375, "learning_rate": 2.0468952801552166e-05, "loss": 1.0512178421020508, "num_input_tokens_seen": 14124929664, "step": 49670, "train_runtime": 483745.8198, "train_tokens_per_second": 29199.073 }, { "epoch": 1.7577768588279261, "grad_norm": 1.6015625, "learning_rate": 2.046723780881319e-05, "loss": 1.046142864227295, "num_input_tokens_seen": 14127732224, "step": 49680, "train_runtime": 483843.2025, "train_tokens_per_second": 29198.989 }, { "epoch": 1.7581306790916549, "grad_norm": 1.515625, "learning_rate": 2.0465523247074376e-05, "loss": 1.026993179321289, "num_input_tokens_seen": 14130582720, "step": 49690, "train_runtime": 483939.0294, "train_tokens_per_second": 29199.097 }, { "epoch": 1.7584844993553839, "grad_norm": 1.484375, "learning_rate": 2.046380911615523e-05, "loss": 1.0374319076538085, "num_input_tokens_seen": 14133457536, "step": 49700, "train_runtime": 484037.0433, "train_tokens_per_second": 29199.124 }, { "epoch": 1.7588383196191124, "grad_norm": 1.671875, "learning_rate": 2.0462095415875357e-05, "loss": 1.0421133041381836, "num_input_tokens_seen": 14136300352, "step": 49710, "train_runtime": 484133.5263, "train_tokens_per_second": 29199.177 }, { "epoch": 1.7591921398828414, "grad_norm": 1.4765625, "learning_rate": 2.046038214605448e-05, "loss": 1.0453826904296875, "num_input_tokens_seen": 14139115072, "step": 49720, "train_runtime": 484227.5369, "train_tokens_per_second": 29199.321 }, { "epoch": 1.75954596014657, "grad_norm": 1.53125, "learning_rate": 2.0458669306512404e-05, "loss": 1.0337961196899415, "num_input_tokens_seen": 14141986880, "step": 49730, "train_runtime": 484327.0461, "train_tokens_per_second": 29199.251 }, { "epoch": 1.759899780410299, "grad_norm": 1.65625, "learning_rate": 2.045695689706907e-05, "loss": 1.0395074844360352, "num_input_tokens_seen": 14144775616, "step": 49740, "train_runtime": 484419.9994, "train_tokens_per_second": 29199.405 }, { "epoch": 1.7602536006740275, "grad_norm": 1.5625, "learning_rate": 2.0455244917544507e-05, "loss": 1.0431678771972657, "num_input_tokens_seen": 14147649088, "step": 49750, "train_runtime": 484516.88, "train_tokens_per_second": 29199.497 }, { "epoch": 1.7606074209377565, "grad_norm": 1.5078125, "learning_rate": 2.0453533367758846e-05, "loss": 1.056477165222168, "num_input_tokens_seen": 14150497472, "step": 49760, "train_runtime": 484615.4264, "train_tokens_per_second": 29199.437 }, { "epoch": 1.760961241201485, "grad_norm": 1.546875, "learning_rate": 2.0451822247532338e-05, "loss": 1.0475886344909668, "num_input_tokens_seen": 14153397504, "step": 49770, "train_runtime": 484715.4174, "train_tokens_per_second": 29199.396 }, { "epoch": 1.761315061465214, "grad_norm": 1.59375, "learning_rate": 2.0450111556685323e-05, "loss": 1.037252426147461, "num_input_tokens_seen": 14156242496, "step": 49780, "train_runtime": 484813.4751, "train_tokens_per_second": 29199.359 }, { "epoch": 1.7616688817289428, "grad_norm": 1.609375, "learning_rate": 2.0448401295038257e-05, "loss": 1.0535497665405273, "num_input_tokens_seen": 14159148352, "step": 49790, "train_runtime": 484910.6163, "train_tokens_per_second": 29199.502 }, { "epoch": 1.7620227019926715, "grad_norm": 1.59375, "learning_rate": 2.04466914624117e-05, "loss": 1.0464811325073242, "num_input_tokens_seen": 14162018816, "step": 49800, "train_runtime": 485006.7762, "train_tokens_per_second": 29199.631 }, { "epoch": 1.7623765222564003, "grad_norm": 1.578125, "learning_rate": 2.0444982058626314e-05, "loss": 1.0456256866455078, "num_input_tokens_seen": 14164775744, "step": 49810, "train_runtime": 485097.5514, "train_tokens_per_second": 29199.85 }, { "epoch": 1.762730342520129, "grad_norm": 1.5859375, "learning_rate": 2.0443273083502863e-05, "loss": 1.048194122314453, "num_input_tokens_seen": 14167685312, "step": 49820, "train_runtime": 485196.9786, "train_tokens_per_second": 29199.863 }, { "epoch": 1.7630841627838578, "grad_norm": 1.546875, "learning_rate": 2.044156453686223e-05, "loss": 1.0465474128723145, "num_input_tokens_seen": 14170503936, "step": 49830, "train_runtime": 485291.1105, "train_tokens_per_second": 29200.007 }, { "epoch": 1.7634379830475866, "grad_norm": 1.65625, "learning_rate": 2.0439856418525386e-05, "loss": 1.0460803985595704, "num_input_tokens_seen": 14173361536, "step": 49840, "train_runtime": 485386.4781, "train_tokens_per_second": 29200.157 }, { "epoch": 1.7637918033113154, "grad_norm": 1.515625, "learning_rate": 2.043814872831341e-05, "loss": 1.0394889831542968, "num_input_tokens_seen": 14176290624, "step": 49850, "train_runtime": 485486.2268, "train_tokens_per_second": 29200.191 }, { "epoch": 1.7641456235750441, "grad_norm": 1.609375, "learning_rate": 2.0436441466047494e-05, "loss": 1.0546134948730468, "num_input_tokens_seen": 14179099648, "step": 49860, "train_runtime": 485580.1396, "train_tokens_per_second": 29200.329 }, { "epoch": 1.764499443838773, "grad_norm": 1.578125, "learning_rate": 2.0434734631548927e-05, "loss": 1.0247303009033204, "num_input_tokens_seen": 14181980544, "step": 49870, "train_runtime": 485683.2143, "train_tokens_per_second": 29200.063 }, { "epoch": 1.7648532641025017, "grad_norm": 1.578125, "learning_rate": 2.0433028224639106e-05, "loss": 1.0453105926513673, "num_input_tokens_seen": 14184771008, "step": 49880, "train_runtime": 485774.5797, "train_tokens_per_second": 29200.316 }, { "epoch": 1.7652070843662306, "grad_norm": 1.53125, "learning_rate": 2.0431322245139533e-05, "loss": 1.03680419921875, "num_input_tokens_seen": 14187629440, "step": 49890, "train_runtime": 485872.6208, "train_tokens_per_second": 29200.306 }, { "epoch": 1.7655609046299592, "grad_norm": 1.5625, "learning_rate": 2.0429616692871808e-05, "loss": 1.0536304473876954, "num_input_tokens_seen": 14190438336, "step": 49900, "train_runtime": 485969.4994, "train_tokens_per_second": 29200.265 }, { "epoch": 1.7659147248936882, "grad_norm": 1.546875, "learning_rate": 2.0427911567657644e-05, "loss": 1.0393367767333985, "num_input_tokens_seen": 14193285184, "step": 49910, "train_runtime": 486068.9931, "train_tokens_per_second": 29200.145 }, { "epoch": 1.7662685451574167, "grad_norm": 1.625, "learning_rate": 2.0426206869318852e-05, "loss": 1.0441725730895997, "num_input_tokens_seen": 14196087936, "step": 49920, "train_runtime": 486162.6151, "train_tokens_per_second": 29200.287 }, { "epoch": 1.7666223654211457, "grad_norm": 1.59375, "learning_rate": 2.0424502597677357e-05, "loss": 1.0534631729125976, "num_input_tokens_seen": 14198965376, "step": 49930, "train_runtime": 486264.5689, "train_tokens_per_second": 29200.082 }, { "epoch": 1.7669761856848742, "grad_norm": 1.578125, "learning_rate": 2.042279875255517e-05, "loss": 1.0427358627319336, "num_input_tokens_seen": 14201795712, "step": 49940, "train_runtime": 486362.7876, "train_tokens_per_second": 29200.005 }, { "epoch": 1.7673300059486032, "grad_norm": 1.609375, "learning_rate": 2.0421095333774413e-05, "loss": 1.0370229721069335, "num_input_tokens_seen": 14204625984, "step": 49950, "train_runtime": 486458.8386, "train_tokens_per_second": 29200.057 }, { "epoch": 1.767683826212332, "grad_norm": 1.5703125, "learning_rate": 2.0419392341157327e-05, "loss": 1.0327394485473633, "num_input_tokens_seen": 14207496960, "step": 49960, "train_runtime": 486560.3849, "train_tokens_per_second": 29199.864 }, { "epoch": 1.7680376464760608, "grad_norm": 1.5703125, "learning_rate": 2.0417689774526235e-05, "loss": 1.02719087600708, "num_input_tokens_seen": 14210322496, "step": 49970, "train_runtime": 486657.8858, "train_tokens_per_second": 29199.82 }, { "epoch": 1.7683914667397895, "grad_norm": 1.5546875, "learning_rate": 2.0415987633703583e-05, "loss": 1.0395299911499023, "num_input_tokens_seen": 14213167616, "step": 49980, "train_runtime": 486756.5346, "train_tokens_per_second": 29199.747 }, { "epoch": 1.7687452870035183, "grad_norm": 1.609375, "learning_rate": 2.04142859185119e-05, "loss": 1.0352636337280274, "num_input_tokens_seen": 14216049408, "step": 49990, "train_runtime": 486856.4982, "train_tokens_per_second": 29199.671 }, { "epoch": 1.769099107267247, "grad_norm": 1.5859375, "learning_rate": 2.0412584628773835e-05, "loss": 1.056472110748291, "num_input_tokens_seen": 14218881984, "step": 50000, "train_runtime": 486955.1314, "train_tokens_per_second": 29199.573 }, { "epoch": 1.769099107267247, "eval_loss": 1.0212867259979248, "eval_runtime": 8.4506, "eval_samples_per_second": 471.917, "eval_steps_per_second": 3.787, "num_input_tokens_seen": 14218881984, "step": 50000 }, { "epoch": 1.7694529275309758, "grad_norm": 1.609375, "learning_rate": 2.0410883764312135e-05, "loss": 1.0360840797424316, "num_input_tokens_seen": 14221693248, "step": 50010, "train_runtime": 487078.4178, "train_tokens_per_second": 29197.954 }, { "epoch": 1.7698067477947046, "grad_norm": 1.6171875, "learning_rate": 2.0409183324949646e-05, "loss": 1.0517303466796875, "num_input_tokens_seen": 14224536320, "step": 50020, "train_runtime": 487178.398, "train_tokens_per_second": 29197.798 }, { "epoch": 1.7701605680584334, "grad_norm": 1.5078125, "learning_rate": 2.0407483310509333e-05, "loss": 1.049877643585205, "num_input_tokens_seen": 14227418304, "step": 50030, "train_runtime": 487280.2087, "train_tokens_per_second": 29197.612 }, { "epoch": 1.7705143883221623, "grad_norm": 1.640625, "learning_rate": 2.040578372081424e-05, "loss": 1.0502395629882812, "num_input_tokens_seen": 14230233536, "step": 50040, "train_runtime": 487375.8501, "train_tokens_per_second": 29197.658 }, { "epoch": 1.770868208585891, "grad_norm": 1.625, "learning_rate": 2.0404084555687525e-05, "loss": 1.0314266204833984, "num_input_tokens_seen": 14233023552, "step": 50050, "train_runtime": 487468.8366, "train_tokens_per_second": 29197.812 }, { "epoch": 1.7712220288496199, "grad_norm": 1.578125, "learning_rate": 2.0402385814952464e-05, "loss": 1.0299631118774415, "num_input_tokens_seen": 14235863680, "step": 50060, "train_runtime": 487565.0515, "train_tokens_per_second": 29197.876 }, { "epoch": 1.7715758491133484, "grad_norm": 1.6015625, "learning_rate": 2.0400687498432415e-05, "loss": 1.035188865661621, "num_input_tokens_seen": 14238697344, "step": 50070, "train_runtime": 487661.3434, "train_tokens_per_second": 29197.921 }, { "epoch": 1.7719296693770774, "grad_norm": 1.65625, "learning_rate": 2.039898960595085e-05, "loss": 1.037077045440674, "num_input_tokens_seen": 14241492992, "step": 50080, "train_runtime": 487757.6321, "train_tokens_per_second": 29197.889 }, { "epoch": 1.772283489640806, "grad_norm": 1.546875, "learning_rate": 2.039729213733134e-05, "loss": 1.0450297355651856, "num_input_tokens_seen": 14244341760, "step": 50090, "train_runtime": 487856.6919, "train_tokens_per_second": 29197.799 }, { "epoch": 1.772637309904535, "grad_norm": 1.546875, "learning_rate": 2.0395595092397554e-05, "loss": 1.0408285140991211, "num_input_tokens_seen": 14247171968, "step": 50100, "train_runtime": 487955.9187, "train_tokens_per_second": 29197.662 }, { "epoch": 1.7729911301682635, "grad_norm": 1.640625, "learning_rate": 2.0393898470973276e-05, "loss": 1.0585382461547852, "num_input_tokens_seen": 14249991808, "step": 50110, "train_runtime": 488054.7777, "train_tokens_per_second": 29197.525 }, { "epoch": 1.7733449504319925, "grad_norm": 1.609375, "learning_rate": 2.0392202272882384e-05, "loss": 1.044197177886963, "num_input_tokens_seen": 14252898176, "step": 50120, "train_runtime": 488155.5534, "train_tokens_per_second": 29197.452 }, { "epoch": 1.7736987706957212, "grad_norm": 1.53125, "learning_rate": 2.0390506497948854e-05, "loss": 1.0573487281799316, "num_input_tokens_seen": 14255738752, "step": 50130, "train_runtime": 488254.153, "train_tokens_per_second": 29197.373 }, { "epoch": 1.77405259095945, "grad_norm": 1.5546875, "learning_rate": 2.038881114599678e-05, "loss": 1.0294795036315918, "num_input_tokens_seen": 14258539840, "step": 50140, "train_runtime": 488347.9311, "train_tokens_per_second": 29197.502 }, { "epoch": 1.7744064112231788, "grad_norm": 1.5703125, "learning_rate": 2.0387116216850345e-05, "loss": 1.0442691802978517, "num_input_tokens_seen": 14261400064, "step": 50150, "train_runtime": 488443.5884, "train_tokens_per_second": 29197.64 }, { "epoch": 1.7747602314869075, "grad_norm": 1.53125, "learning_rate": 2.0385421710333838e-05, "loss": 1.038187313079834, "num_input_tokens_seen": 14264280128, "step": 50160, "train_runtime": 488540.8907, "train_tokens_per_second": 29197.72 }, { "epoch": 1.7751140517506363, "grad_norm": 1.6015625, "learning_rate": 2.0383727626271648e-05, "loss": 1.0440409660339356, "num_input_tokens_seen": 14267157120, "step": 50170, "train_runtime": 488639.6854, "train_tokens_per_second": 29197.704 }, { "epoch": 1.775467872014365, "grad_norm": 1.5703125, "learning_rate": 2.0382033964488274e-05, "loss": 1.0581318855285644, "num_input_tokens_seen": 14270035136, "step": 50180, "train_runtime": 488737.846, "train_tokens_per_second": 29197.729 }, { "epoch": 1.7758216922780938, "grad_norm": 1.5703125, "learning_rate": 2.0380340724808307e-05, "loss": 1.0410472869873046, "num_input_tokens_seen": 14272912768, "step": 50190, "train_runtime": 488838.2035, "train_tokens_per_second": 29197.621 }, { "epoch": 1.7761755125418226, "grad_norm": 1.578125, "learning_rate": 2.0378647907056447e-05, "loss": 1.0410990715026855, "num_input_tokens_seen": 14275817984, "step": 50200, "train_runtime": 488938.441, "train_tokens_per_second": 29197.577 }, { "epoch": 1.7765293328055516, "grad_norm": 1.546875, "learning_rate": 2.0376955511057493e-05, "loss": 1.034639835357666, "num_input_tokens_seen": 14278631360, "step": 50210, "train_runtime": 489037.1933, "train_tokens_per_second": 29197.434 }, { "epoch": 1.7768831530692801, "grad_norm": 1.53125, "learning_rate": 2.0375263536636348e-05, "loss": 1.039046859741211, "num_input_tokens_seen": 14281497792, "step": 50220, "train_runtime": 489134.6329, "train_tokens_per_second": 29197.478 }, { "epoch": 1.7772369733330091, "grad_norm": 1.609375, "learning_rate": 2.0373571983618014e-05, "loss": 1.049449348449707, "num_input_tokens_seen": 14284357120, "step": 50230, "train_runtime": 489234.1636, "train_tokens_per_second": 29197.383 }, { "epoch": 1.7775907935967377, "grad_norm": 1.5625, "learning_rate": 2.0371880851827597e-05, "loss": 1.0400571823120117, "num_input_tokens_seen": 14287188160, "step": 50240, "train_runtime": 489329.9614, "train_tokens_per_second": 29197.452 }, { "epoch": 1.7779446138604666, "grad_norm": 1.6171875, "learning_rate": 2.0370190141090298e-05, "loss": 1.0454938888549805, "num_input_tokens_seen": 14290047232, "step": 50250, "train_runtime": 489426.2897, "train_tokens_per_second": 29197.547 }, { "epoch": 1.7782984341241952, "grad_norm": 1.5703125, "learning_rate": 2.0368499851231433e-05, "loss": 1.0445655822753905, "num_input_tokens_seen": 14292963264, "step": 50260, "train_runtime": 489526.9316, "train_tokens_per_second": 29197.501 }, { "epoch": 1.7786522543879242, "grad_norm": 1.578125, "learning_rate": 2.0366809982076404e-05, "loss": 1.0426286697387694, "num_input_tokens_seen": 14295811392, "step": 50270, "train_runtime": 489626.293, "train_tokens_per_second": 29197.393 }, { "epoch": 1.779006074651653, "grad_norm": 1.578125, "learning_rate": 2.0365120533450732e-05, "loss": 1.0470451354980468, "num_input_tokens_seen": 14298666560, "step": 50280, "train_runtime": 489722.6788, "train_tokens_per_second": 29197.477 }, { "epoch": 1.7793598949153817, "grad_norm": 1.5234375, "learning_rate": 2.0363431505180018e-05, "loss": 1.0330720901489259, "num_input_tokens_seen": 14301523264, "step": 50290, "train_runtime": 489824.2876, "train_tokens_per_second": 29197.252 }, { "epoch": 1.7797137151791105, "grad_norm": 1.5234375, "learning_rate": 2.036174289708998e-05, "loss": 1.044950294494629, "num_input_tokens_seen": 14304374016, "step": 50300, "train_runtime": 489923.0941, "train_tokens_per_second": 29197.183 }, { "epoch": 1.7800675354428392, "grad_norm": 1.5390625, "learning_rate": 2.036005470900643e-05, "loss": 1.0390226364135742, "num_input_tokens_seen": 14307237504, "step": 50310, "train_runtime": 490021.6151, "train_tokens_per_second": 29197.156 }, { "epoch": 1.780421355706568, "grad_norm": 1.6015625, "learning_rate": 2.035836694075529e-05, "loss": 1.0313528060913086, "num_input_tokens_seen": 14310040896, "step": 50320, "train_runtime": 490113.7838, "train_tokens_per_second": 29197.385 }, { "epoch": 1.7807751759702968, "grad_norm": 1.578125, "learning_rate": 2.0356679592162574e-05, "loss": 1.0422174453735351, "num_input_tokens_seen": 14312854592, "step": 50330, "train_runtime": 490208.6826, "train_tokens_per_second": 29197.473 }, { "epoch": 1.7811289962340255, "grad_norm": 1.546875, "learning_rate": 2.0354992663054395e-05, "loss": 1.0405973434448241, "num_input_tokens_seen": 14315676736, "step": 50340, "train_runtime": 490305.6438, "train_tokens_per_second": 29197.455 }, { "epoch": 1.7814828164977543, "grad_norm": 1.6171875, "learning_rate": 2.0353306153256975e-05, "loss": 1.0566287994384767, "num_input_tokens_seen": 14318516544, "step": 50350, "train_runtime": 490408.1881, "train_tokens_per_second": 29197.14 }, { "epoch": 1.781836636761483, "grad_norm": 1.4921875, "learning_rate": 2.0351620062596634e-05, "loss": 1.043938446044922, "num_input_tokens_seen": 14321402944, "step": 50360, "train_runtime": 490508.768, "train_tokens_per_second": 29197.038 }, { "epoch": 1.7821904570252118, "grad_norm": 1.5625, "learning_rate": 2.0349934390899796e-05, "loss": 1.0397371292114257, "num_input_tokens_seen": 14324217408, "step": 50370, "train_runtime": 490603.3791, "train_tokens_per_second": 29197.144 }, { "epoch": 1.7825442772889408, "grad_norm": 1.6015625, "learning_rate": 2.0348249137992967e-05, "loss": 1.0405067443847655, "num_input_tokens_seen": 14327077504, "step": 50380, "train_runtime": 490700.4536, "train_tokens_per_second": 29197.196 }, { "epoch": 1.7828980975526694, "grad_norm": 1.640625, "learning_rate": 2.034656430370278e-05, "loss": 1.0518203735351563, "num_input_tokens_seen": 14329920000, "step": 50390, "train_runtime": 490798.0187, "train_tokens_per_second": 29197.184 }, { "epoch": 1.7832519178163984, "grad_norm": 1.5625, "learning_rate": 2.0344879887855952e-05, "loss": 1.0539262771606446, "num_input_tokens_seen": 14332805952, "step": 50400, "train_runtime": 490897.486, "train_tokens_per_second": 29197.147 }, { "epoch": 1.783605738080127, "grad_norm": 1.640625, "learning_rate": 2.0343195890279314e-05, "loss": 1.0491648674011231, "num_input_tokens_seen": 14335667776, "step": 50410, "train_runtime": 490995.3454, "train_tokens_per_second": 29197.156 }, { "epoch": 1.783959558343856, "grad_norm": 1.5078125, "learning_rate": 2.034151231079977e-05, "loss": 1.0401899337768554, "num_input_tokens_seen": 14338499456, "step": 50420, "train_runtime": 491092.1586, "train_tokens_per_second": 29197.166 }, { "epoch": 1.7843133786075844, "grad_norm": 1.546875, "learning_rate": 2.033982914924436e-05, "loss": 1.0654169082641602, "num_input_tokens_seen": 14341356736, "step": 50430, "train_runtime": 491192.26, "train_tokens_per_second": 29197.033 }, { "epoch": 1.7846671988713134, "grad_norm": 1.5078125, "learning_rate": 2.0338146405440198e-05, "loss": 1.0430665016174316, "num_input_tokens_seen": 14344204160, "step": 50440, "train_runtime": 491289.4995, "train_tokens_per_second": 29197.05 }, { "epoch": 1.7850210191350422, "grad_norm": 1.5390625, "learning_rate": 2.0336464079214507e-05, "loss": 1.0326311111450195, "num_input_tokens_seen": 14347045632, "step": 50450, "train_runtime": 491386.7174, "train_tokens_per_second": 29197.056 }, { "epoch": 1.785374839398771, "grad_norm": 1.5546875, "learning_rate": 2.033478217039461e-05, "loss": 1.0404419898986816, "num_input_tokens_seen": 14349957440, "step": 50460, "train_runtime": 491488.7559, "train_tokens_per_second": 29196.919 }, { "epoch": 1.7857286596624997, "grad_norm": 1.515625, "learning_rate": 2.033310067880794e-05, "loss": 1.0385892868041993, "num_input_tokens_seen": 14352851520, "step": 50470, "train_runtime": 491587.4846, "train_tokens_per_second": 29196.942 }, { "epoch": 1.7860824799262285, "grad_norm": 1.5234375, "learning_rate": 2.0331419604282e-05, "loss": 1.0431005477905273, "num_input_tokens_seen": 14355658304, "step": 50480, "train_runtime": 491682.3156, "train_tokens_per_second": 29197.02 }, { "epoch": 1.7864363001899572, "grad_norm": 1.6328125, "learning_rate": 2.0329738946644425e-05, "loss": 1.0313123703002929, "num_input_tokens_seen": 14358490496, "step": 50490, "train_runtime": 491780.2141, "train_tokens_per_second": 29196.967 }, { "epoch": 1.786790120453686, "grad_norm": 1.59375, "learning_rate": 2.0328058705722937e-05, "loss": 1.045037841796875, "num_input_tokens_seen": 14361369600, "step": 50500, "train_runtime": 491879.5976, "train_tokens_per_second": 29196.921 }, { "epoch": 1.7871439407174148, "grad_norm": 1.53125, "learning_rate": 2.0326378881345356e-05, "loss": 1.0443553924560547, "num_input_tokens_seen": 14364233472, "step": 50510, "train_runtime": 491975.6469, "train_tokens_per_second": 29197.042 }, { "epoch": 1.7874977609811435, "grad_norm": 1.5390625, "learning_rate": 2.0324699473339605e-05, "loss": 1.0371468544006348, "num_input_tokens_seen": 14367140736, "step": 50520, "train_runtime": 492076.3174, "train_tokens_per_second": 29196.977 }, { "epoch": 1.7878515812448725, "grad_norm": 1.53125, "learning_rate": 2.0323020481533697e-05, "loss": 1.0320363998413087, "num_input_tokens_seen": 14369975680, "step": 50530, "train_runtime": 492177.9953, "train_tokens_per_second": 29196.705 }, { "epoch": 1.788205401508601, "grad_norm": 1.625, "learning_rate": 2.0321341905755763e-05, "loss": 1.0426502227783203, "num_input_tokens_seen": 14372866816, "step": 50540, "train_runtime": 492277.3846, "train_tokens_per_second": 29196.683 }, { "epoch": 1.78855922177233, "grad_norm": 1.5078125, "learning_rate": 2.0319663745834018e-05, "loss": 1.0454934120178223, "num_input_tokens_seen": 14375748352, "step": 50550, "train_runtime": 492378.0506, "train_tokens_per_second": 29196.566 }, { "epoch": 1.7889130420360586, "grad_norm": 1.5546875, "learning_rate": 2.031798600159678e-05, "loss": 1.042333984375, "num_input_tokens_seen": 14378604800, "step": 50560, "train_runtime": 492476.263, "train_tokens_per_second": 29196.544 }, { "epoch": 1.7892668622997876, "grad_norm": 1.59375, "learning_rate": 2.0316308672872466e-05, "loss": 1.042057991027832, "num_input_tokens_seen": 14381446144, "step": 50570, "train_runtime": 492571.2659, "train_tokens_per_second": 29196.681 }, { "epoch": 1.7896206825635161, "grad_norm": 1.5078125, "learning_rate": 2.0314631759489597e-05, "loss": 1.0495368003845216, "num_input_tokens_seen": 14384275968, "step": 50580, "train_runtime": 492668.7761, "train_tokens_per_second": 29196.646 }, { "epoch": 1.7899745028272451, "grad_norm": 1.515625, "learning_rate": 2.0312955261276783e-05, "loss": 1.0322505950927734, "num_input_tokens_seen": 14387086464, "step": 50590, "train_runtime": 492764.3369, "train_tokens_per_second": 29196.688 }, { "epoch": 1.7903283230909737, "grad_norm": 1.5390625, "learning_rate": 2.0311279178062754e-05, "loss": 1.048440933227539, "num_input_tokens_seen": 14389862144, "step": 50600, "train_runtime": 492855.9002, "train_tokens_per_second": 29196.895 }, { "epoch": 1.7906821433547027, "grad_norm": 1.6328125, "learning_rate": 2.0309603509676307e-05, "loss": 1.056524658203125, "num_input_tokens_seen": 14392652352, "step": 50610, "train_runtime": 492948.3348, "train_tokens_per_second": 29197.081 }, { "epoch": 1.7910359636184314, "grad_norm": 1.6328125, "learning_rate": 2.0307928255946362e-05, "loss": 1.0436988830566407, "num_input_tokens_seen": 14395532992, "step": 50620, "train_runtime": 493046.2876, "train_tokens_per_second": 29197.123 }, { "epoch": 1.7913897838821602, "grad_norm": 1.5625, "learning_rate": 2.0306253416701935e-05, "loss": 1.0413457870483398, "num_input_tokens_seen": 14398337088, "step": 50630, "train_runtime": 493140.4398, "train_tokens_per_second": 29197.235 }, { "epoch": 1.791743604145889, "grad_norm": 1.5546875, "learning_rate": 2.0304578991772127e-05, "loss": 1.0323431968688965, "num_input_tokens_seen": 14401125888, "step": 50640, "train_runtime": 493233.4919, "train_tokens_per_second": 29197.38 }, { "epoch": 1.7920974244096177, "grad_norm": 1.5703125, "learning_rate": 2.030290498098616e-05, "loss": 1.0564096450805665, "num_input_tokens_seen": 14403993088, "step": 50650, "train_runtime": 493332.5436, "train_tokens_per_second": 29197.33 }, { "epoch": 1.7924512446733465, "grad_norm": 1.5625, "learning_rate": 2.0301231384173324e-05, "loss": 1.0411944389343262, "num_input_tokens_seen": 14406857472, "step": 50660, "train_runtime": 493429.6924, "train_tokens_per_second": 29197.387 }, { "epoch": 1.7928050649370753, "grad_norm": 1.625, "learning_rate": 2.0299558201163047e-05, "loss": 1.0244243621826172, "num_input_tokens_seen": 14409669824, "step": 50670, "train_runtime": 493525.059, "train_tokens_per_second": 29197.443 }, { "epoch": 1.793158885200804, "grad_norm": 1.578125, "learning_rate": 2.0297885431784816e-05, "loss": 1.0476810455322265, "num_input_tokens_seen": 14412567104, "step": 50680, "train_runtime": 493623.7596, "train_tokens_per_second": 29197.474 }, { "epoch": 1.7935127054645328, "grad_norm": 1.546875, "learning_rate": 2.0296213075868243e-05, "loss": 1.0351078987121582, "num_input_tokens_seen": 14415413184, "step": 50690, "train_runtime": 493721.2109, "train_tokens_per_second": 29197.476 }, { "epoch": 1.7938665257282618, "grad_norm": 1.625, "learning_rate": 2.0294541133243025e-05, "loss": 1.0443912506103517, "num_input_tokens_seen": 14418257472, "step": 50700, "train_runtime": 493817.1349, "train_tokens_per_second": 29197.564 }, { "epoch": 1.7942203459919903, "grad_norm": 1.484375, "learning_rate": 2.0292869603738964e-05, "loss": 1.045097827911377, "num_input_tokens_seen": 14421087296, "step": 50710, "train_runtime": 493914.0543, "train_tokens_per_second": 29197.564 }, { "epoch": 1.7945741662557193, "grad_norm": 1.5, "learning_rate": 2.0291198487185956e-05, "loss": 1.0387515068054198, "num_input_tokens_seen": 14423951360, "step": 50720, "train_runtime": 494012.137, "train_tokens_per_second": 29197.565 }, { "epoch": 1.7949279865194478, "grad_norm": 1.5703125, "learning_rate": 2.0289527783413993e-05, "loss": 1.0363192558288574, "num_input_tokens_seen": 14426803840, "step": 50730, "train_runtime": 494106.9869, "train_tokens_per_second": 29197.733 }, { "epoch": 1.7952818067831768, "grad_norm": 1.53125, "learning_rate": 2.0287857492253182e-05, "loss": 1.065131950378418, "num_input_tokens_seen": 14429652032, "step": 50740, "train_runtime": 494202.8229, "train_tokens_per_second": 29197.834 }, { "epoch": 1.7956356270469054, "grad_norm": 1.546875, "learning_rate": 2.0286187613533696e-05, "loss": 1.0385104179382325, "num_input_tokens_seen": 14432463744, "step": 50750, "train_runtime": 494297.6439, "train_tokens_per_second": 29197.921 }, { "epoch": 1.7959894473106344, "grad_norm": 1.5546875, "learning_rate": 2.0284518147085836e-05, "loss": 1.0438802719116211, "num_input_tokens_seen": 14435292544, "step": 50760, "train_runtime": 494395.0652, "train_tokens_per_second": 29197.89 }, { "epoch": 1.796343267574363, "grad_norm": 1.5546875, "learning_rate": 2.0282849092739986e-05, "loss": 1.0564435958862304, "num_input_tokens_seen": 14438149312, "step": 50770, "train_runtime": 494494.0064, "train_tokens_per_second": 29197.825 }, { "epoch": 1.796697087838092, "grad_norm": 1.5625, "learning_rate": 2.0281180450326632e-05, "loss": 1.0487442016601562, "num_input_tokens_seen": 14441028352, "step": 50780, "train_runtime": 494595.1058, "train_tokens_per_second": 29197.677 }, { "epoch": 1.7970509081018207, "grad_norm": 1.5859375, "learning_rate": 2.0279512219676352e-05, "loss": 1.055472183227539, "num_input_tokens_seen": 14443823424, "step": 50790, "train_runtime": 494688.4535, "train_tokens_per_second": 29197.818 }, { "epoch": 1.7974047283655494, "grad_norm": 1.4921875, "learning_rate": 2.027784440061983e-05, "loss": 1.0422065734863282, "num_input_tokens_seen": 14446639488, "step": 50800, "train_runtime": 494785.9472, "train_tokens_per_second": 29197.756 }, { "epoch": 1.7977585486292782, "grad_norm": 1.59375, "learning_rate": 2.0276176992987846e-05, "loss": 1.0303110122680663, "num_input_tokens_seen": 14449491200, "step": 50810, "train_runtime": 494884.7099, "train_tokens_per_second": 29197.692 }, { "epoch": 1.798112368893007, "grad_norm": 1.5703125, "learning_rate": 2.027450999661126e-05, "loss": 1.0373829841613769, "num_input_tokens_seen": 14452334592, "step": 50820, "train_runtime": 494980.2948, "train_tokens_per_second": 29197.798 }, { "epoch": 1.7984661891567357, "grad_norm": 1.546875, "learning_rate": 2.027284341132106e-05, "loss": 1.0487239837646485, "num_input_tokens_seen": 14455210944, "step": 50830, "train_runtime": 495080.7379, "train_tokens_per_second": 29197.684 }, { "epoch": 1.7988200094204645, "grad_norm": 1.5078125, "learning_rate": 2.0271177236948313e-05, "loss": 1.0419292449951172, "num_input_tokens_seen": 14458058048, "step": 50840, "train_runtime": 495177.8516, "train_tokens_per_second": 29197.707 }, { "epoch": 1.7991738296841933, "grad_norm": 1.5390625, "learning_rate": 2.0269511473324176e-05, "loss": 1.0383618354797364, "num_input_tokens_seen": 14460942528, "step": 50850, "train_runtime": 495278.0757, "train_tokens_per_second": 29197.623 }, { "epoch": 1.799527649947922, "grad_norm": 1.5234375, "learning_rate": 2.0267846120279927e-05, "loss": 1.0358762741088867, "num_input_tokens_seen": 14463786432, "step": 50860, "train_runtime": 495373.7086, "train_tokens_per_second": 29197.727 }, { "epoch": 1.799881470211651, "grad_norm": 1.578125, "learning_rate": 2.0266181177646913e-05, "loss": 1.0555421829223632, "num_input_tokens_seen": 14466568000, "step": 50870, "train_runtime": 495466.2406, "train_tokens_per_second": 29197.888 }, { "epoch": 1.8002352904753796, "grad_norm": 1.6015625, "learning_rate": 2.0264516645256593e-05, "loss": 1.0385346412658691, "num_input_tokens_seen": 14469439616, "step": 50880, "train_runtime": 495565.1752, "train_tokens_per_second": 29197.854 }, { "epoch": 1.8005891107391085, "grad_norm": 1.515625, "learning_rate": 2.0262852522940528e-05, "loss": 1.0360372543334961, "num_input_tokens_seen": 14472290816, "step": 50890, "train_runtime": 495657.9219, "train_tokens_per_second": 29198.143 }, { "epoch": 1.800942931002837, "grad_norm": 1.5234375, "learning_rate": 2.0261188810530366e-05, "loss": 1.0383338928222656, "num_input_tokens_seen": 14475117760, "step": 50900, "train_runtime": 495755.2593, "train_tokens_per_second": 29198.112 }, { "epoch": 1.801296751266566, "grad_norm": 1.5234375, "learning_rate": 2.025952550785785e-05, "loss": 1.0498991012573242, "num_input_tokens_seen": 14478041856, "step": 50910, "train_runtime": 495859.7928, "train_tokens_per_second": 29197.854 }, { "epoch": 1.8016505715302946, "grad_norm": 1.5625, "learning_rate": 2.0257862614754837e-05, "loss": 1.043105697631836, "num_input_tokens_seen": 14480872128, "step": 50920, "train_runtime": 495958.8654, "train_tokens_per_second": 29197.728 }, { "epoch": 1.8020043917940236, "grad_norm": 1.6484375, "learning_rate": 2.0256200131053257e-05, "loss": 1.0473910331726075, "num_input_tokens_seen": 14483709056, "step": 50930, "train_runtime": 496054.5917, "train_tokens_per_second": 29197.813 }, { "epoch": 1.8023582120577522, "grad_norm": 1.5546875, "learning_rate": 2.025453805658515e-05, "loss": 1.0524008750915528, "num_input_tokens_seen": 14486550784, "step": 50940, "train_runtime": 496151.7081, "train_tokens_per_second": 29197.825 }, { "epoch": 1.8027120323214811, "grad_norm": 1.5625, "learning_rate": 2.0252876391182653e-05, "loss": 1.0378385543823243, "num_input_tokens_seen": 14489419584, "step": 50950, "train_runtime": 496248.831, "train_tokens_per_second": 29197.892 }, { "epoch": 1.80306585258521, "grad_norm": 1.6015625, "learning_rate": 2.0251215134677996e-05, "loss": 1.0409759521484374, "num_input_tokens_seen": 14492228352, "step": 50960, "train_runtime": 496342.7554, "train_tokens_per_second": 29198.025 }, { "epoch": 1.8034196728489387, "grad_norm": 1.6015625, "learning_rate": 2.02495542869035e-05, "loss": 1.0407875061035157, "num_input_tokens_seen": 14495119616, "step": 50970, "train_runtime": 496441.3516, "train_tokens_per_second": 29198.05 }, { "epoch": 1.8037734931126674, "grad_norm": 1.6015625, "learning_rate": 2.0247893847691597e-05, "loss": 1.0456952095031737, "num_input_tokens_seen": 14497977664, "step": 50980, "train_runtime": 496540.1198, "train_tokens_per_second": 29197.998 }, { "epoch": 1.8041273133763962, "grad_norm": 1.59375, "learning_rate": 2.02462338168748e-05, "loss": 1.0488187789916992, "num_input_tokens_seen": 14500845632, "step": 50990, "train_runtime": 496638.3003, "train_tokens_per_second": 29198.001 }, { "epoch": 1.804481133640125, "grad_norm": 1.625, "learning_rate": 2.0244574194285724e-05, "loss": 1.0329582214355468, "num_input_tokens_seen": 14503726720, "step": 51000, "train_runtime": 496737.2443, "train_tokens_per_second": 29197.985 }, { "epoch": 1.8048349539038537, "grad_norm": 1.5390625, "learning_rate": 2.0242914979757085e-05, "loss": 1.0491451263427733, "num_input_tokens_seen": 14506607104, "step": 51010, "train_runtime": 496837.1653, "train_tokens_per_second": 29197.911 }, { "epoch": 1.8051887741675825, "grad_norm": 1.5390625, "learning_rate": 2.024125617312169e-05, "loss": 1.0352978706359863, "num_input_tokens_seen": 14509458560, "step": 51020, "train_runtime": 496934.1051, "train_tokens_per_second": 29197.953 }, { "epoch": 1.8055425944313113, "grad_norm": 1.5390625, "learning_rate": 2.0239597774212434e-05, "loss": 1.0428482055664063, "num_input_tokens_seen": 14512300352, "step": 51030, "train_runtime": 497031.4295, "train_tokens_per_second": 29197.953 }, { "epoch": 1.8058964146950403, "grad_norm": 1.578125, "learning_rate": 2.023793978286233e-05, "loss": 1.044601058959961, "num_input_tokens_seen": 14515180032, "step": 51040, "train_runtime": 497130.9174, "train_tokens_per_second": 29197.902 }, { "epoch": 1.8062502349587688, "grad_norm": 1.5625, "learning_rate": 2.023628219890446e-05, "loss": 1.042293167114258, "num_input_tokens_seen": 14518073408, "step": 51050, "train_runtime": 497231.1661, "train_tokens_per_second": 29197.835 }, { "epoch": 1.8066040552224978, "grad_norm": 1.5859375, "learning_rate": 2.0234625022172022e-05, "loss": 1.0376708984375, "num_input_tokens_seen": 14520882176, "step": 51060, "train_runtime": 497327.4748, "train_tokens_per_second": 29197.828 }, { "epoch": 1.8069578754862263, "grad_norm": 1.5625, "learning_rate": 2.0232968252498296e-05, "loss": 1.0467042922973633, "num_input_tokens_seen": 14523785792, "step": 51070, "train_runtime": 497428.378, "train_tokens_per_second": 29197.743 }, { "epoch": 1.8073116957499553, "grad_norm": 1.5546875, "learning_rate": 2.0231311889716673e-05, "loss": 1.0369575500488282, "num_input_tokens_seen": 14526678976, "step": 51080, "train_runtime": 497529.6735, "train_tokens_per_second": 29197.613 }, { "epoch": 1.8076655160136839, "grad_norm": 1.59375, "learning_rate": 2.022965593366062e-05, "loss": 1.048073959350586, "num_input_tokens_seen": 14529515904, "step": 51090, "train_runtime": 497626.6446, "train_tokens_per_second": 29197.624 }, { "epoch": 1.8080193362774128, "grad_norm": 1.609375, "learning_rate": 2.0228000384163716e-05, "loss": 1.0357088088989257, "num_input_tokens_seen": 14532425728, "step": 51100, "train_runtime": 497725.6107, "train_tokens_per_second": 29197.665 }, { "epoch": 1.8083731565411414, "grad_norm": 1.59375, "learning_rate": 2.0226345241059623e-05, "loss": 1.0365728378295898, "num_input_tokens_seen": 14535256000, "step": 51110, "train_runtime": 497820.8259, "train_tokens_per_second": 29197.766 }, { "epoch": 1.8087269768048704, "grad_norm": 1.5625, "learning_rate": 2.022469050418211e-05, "loss": 1.0466348648071289, "num_input_tokens_seen": 14538068928, "step": 51120, "train_runtime": 497916.0634, "train_tokens_per_second": 29197.831 }, { "epoch": 1.8090807970685991, "grad_norm": 1.578125, "learning_rate": 2.0223036173365033e-05, "loss": 1.0418018341064452, "num_input_tokens_seen": 14540915776, "step": 51130, "train_runtime": 498013.094, "train_tokens_per_second": 29197.858 }, { "epoch": 1.809434617332328, "grad_norm": 1.578125, "learning_rate": 2.0221382248442346e-05, "loss": 1.0480876922607423, "num_input_tokens_seen": 14543712704, "step": 51140, "train_runtime": 498107.8148, "train_tokens_per_second": 29197.921 }, { "epoch": 1.8097884375960567, "grad_norm": 1.703125, "learning_rate": 2.0219728729248095e-05, "loss": 1.0362838745117187, "num_input_tokens_seen": 14546570112, "step": 51150, "train_runtime": 498205.8487, "train_tokens_per_second": 29197.911 }, { "epoch": 1.8101422578597854, "grad_norm": 1.4921875, "learning_rate": 2.0218075615616425e-05, "loss": 1.05155029296875, "num_input_tokens_seen": 14549390400, "step": 51160, "train_runtime": 498301.9508, "train_tokens_per_second": 29197.94 }, { "epoch": 1.8104960781235142, "grad_norm": 1.53125, "learning_rate": 2.0216422907381577e-05, "loss": 1.056875228881836, "num_input_tokens_seen": 14552233984, "step": 51170, "train_runtime": 498398.7393, "train_tokens_per_second": 29197.975 }, { "epoch": 1.810849898387243, "grad_norm": 1.53125, "learning_rate": 2.021477060437788e-05, "loss": 1.0404655456542968, "num_input_tokens_seen": 14555083712, "step": 51180, "train_runtime": 498496.2025, "train_tokens_per_second": 29197.983 }, { "epoch": 1.8112037186509717, "grad_norm": 1.8203125, "learning_rate": 2.021311870643976e-05, "loss": 1.0440263748168945, "num_input_tokens_seen": 14557916544, "step": 51190, "train_runtime": 498591.8218, "train_tokens_per_second": 29198.065 }, { "epoch": 1.8115575389147005, "grad_norm": 1.5546875, "learning_rate": 2.0211467213401743e-05, "loss": 1.0642189025878905, "num_input_tokens_seen": 14560795200, "step": 51200, "train_runtime": 498692.8226, "train_tokens_per_second": 29197.924 }, { "epoch": 1.8119113591784295, "grad_norm": 1.515625, "learning_rate": 2.0209816125098453e-05, "loss": 1.0294891357421876, "num_input_tokens_seen": 14563599168, "step": 51210, "train_runtime": 498787.5493, "train_tokens_per_second": 29198.001 }, { "epoch": 1.812265179442158, "grad_norm": 1.5703125, "learning_rate": 2.020816544136459e-05, "loss": 1.0365999221801758, "num_input_tokens_seen": 14566429632, "step": 51220, "train_runtime": 498883.0826, "train_tokens_per_second": 29198.083 }, { "epoch": 1.812618999705887, "grad_norm": 1.5546875, "learning_rate": 2.0206515162034965e-05, "loss": 1.0311760902404785, "num_input_tokens_seen": 14569262720, "step": 51230, "train_runtime": 498979.4813, "train_tokens_per_second": 29198.12 }, { "epoch": 1.8129728199696156, "grad_norm": 1.5625, "learning_rate": 2.0204865286944477e-05, "loss": 1.0443012237548828, "num_input_tokens_seen": 14572097408, "step": 51240, "train_runtime": 499078.6412, "train_tokens_per_second": 29197.998 }, { "epoch": 1.8133266402333446, "grad_norm": 1.6015625, "learning_rate": 2.0203215815928123e-05, "loss": 1.0509981155395507, "num_input_tokens_seen": 14574926208, "step": 51250, "train_runtime": 499175.7432, "train_tokens_per_second": 29197.986 }, { "epoch": 1.813680460497073, "grad_norm": 1.625, "learning_rate": 2.0201566748820995e-05, "loss": 1.038629913330078, "num_input_tokens_seen": 14577741888, "step": 51260, "train_runtime": 499270.9927, "train_tokens_per_second": 29198.055 }, { "epoch": 1.814034280760802, "grad_norm": 1.5390625, "learning_rate": 2.019991808545827e-05, "loss": 1.0356837272644044, "num_input_tokens_seen": 14580565376, "step": 51270, "train_runtime": 499368.2589, "train_tokens_per_second": 29198.022 }, { "epoch": 1.8143881010245309, "grad_norm": 1.5859375, "learning_rate": 2.019826982567523e-05, "loss": 1.0412332534790039, "num_input_tokens_seen": 14583456704, "step": 51280, "train_runtime": 499469.7744, "train_tokens_per_second": 29197.876 }, { "epoch": 1.8147419212882596, "grad_norm": 1.5390625, "learning_rate": 2.019662196930725e-05, "loss": 1.0636192321777345, "num_input_tokens_seen": 14586282368, "step": 51290, "train_runtime": 499569.1937, "train_tokens_per_second": 29197.722 }, { "epoch": 1.8150957415519884, "grad_norm": 1.5625, "learning_rate": 2.0194974516189784e-05, "loss": 1.038242721557617, "num_input_tokens_seen": 14589166144, "step": 51300, "train_runtime": 499669.0478, "train_tokens_per_second": 29197.658 }, { "epoch": 1.8154495618157171, "grad_norm": 1.640625, "learning_rate": 2.019332746615841e-05, "loss": 1.0383970260620117, "num_input_tokens_seen": 14592027904, "step": 51310, "train_runtime": 499767.3185, "train_tokens_per_second": 29197.643 }, { "epoch": 1.815803382079446, "grad_norm": 1.640625, "learning_rate": 2.0191680819048758e-05, "loss": 1.0508296966552735, "num_input_tokens_seen": 14594885632, "step": 51320, "train_runtime": 499864.944, "train_tokens_per_second": 29197.658 }, { "epoch": 1.8161572023431747, "grad_norm": 1.6953125, "learning_rate": 2.0190034574696592e-05, "loss": 1.0378774642944335, "num_input_tokens_seen": 14597692416, "step": 51330, "train_runtime": 499959.606, "train_tokens_per_second": 29197.744 }, { "epoch": 1.8165110226069034, "grad_norm": 1.5625, "learning_rate": 2.0188388732937753e-05, "loss": 1.0439323425292968, "num_input_tokens_seen": 14600551936, "step": 51340, "train_runtime": 500059.1372, "train_tokens_per_second": 29197.651 }, { "epoch": 1.8168648428706322, "grad_norm": 1.609375, "learning_rate": 2.0186743293608164e-05, "loss": 1.057363510131836, "num_input_tokens_seen": 14603393216, "step": 51350, "train_runtime": 500155.0712, "train_tokens_per_second": 29197.731 }, { "epoch": 1.817218663134361, "grad_norm": 1.625, "learning_rate": 2.0185098256543866e-05, "loss": 1.0470507621765137, "num_input_tokens_seen": 14606230912, "step": 51360, "train_runtime": 500253.918, "train_tokens_per_second": 29197.634 }, { "epoch": 1.8175724833980897, "grad_norm": 1.6015625, "learning_rate": 2.018345362158098e-05, "loss": 1.052962875366211, "num_input_tokens_seen": 14609116672, "step": 51370, "train_runtime": 500351.9405, "train_tokens_per_second": 29197.682 }, { "epoch": 1.8179263036618187, "grad_norm": 1.5078125, "learning_rate": 2.018180938855571e-05, "loss": 1.0452037811279298, "num_input_tokens_seen": 14611964800, "step": 51380, "train_runtime": 500449.6435, "train_tokens_per_second": 29197.673 }, { "epoch": 1.8182801239255473, "grad_norm": 1.625, "learning_rate": 2.0180165557304377e-05, "loss": 1.0401094436645508, "num_input_tokens_seen": 14614870656, "step": 51390, "train_runtime": 500548.4537, "train_tokens_per_second": 29197.714 }, { "epoch": 1.8186339441892763, "grad_norm": 1.59375, "learning_rate": 2.0178522127663373e-05, "loss": 1.0510944366455077, "num_input_tokens_seen": 14617749760, "step": 51400, "train_runtime": 500646.2984, "train_tokens_per_second": 29197.759 }, { "epoch": 1.8189877644530048, "grad_norm": 1.46875, "learning_rate": 2.0176879099469196e-05, "loss": 1.0417635917663575, "num_input_tokens_seen": 14620598784, "step": 51410, "train_runtime": 500744.27, "train_tokens_per_second": 29197.736 }, { "epoch": 1.8193415847167338, "grad_norm": 1.5625, "learning_rate": 2.0175236472558443e-05, "loss": 1.0548954963684083, "num_input_tokens_seen": 14623430720, "step": 51420, "train_runtime": 500840.5475, "train_tokens_per_second": 29197.777 }, { "epoch": 1.8196954049804623, "grad_norm": 1.578125, "learning_rate": 2.017359424676778e-05, "loss": 1.0520763397216797, "num_input_tokens_seen": 14626291456, "step": 51430, "train_runtime": 500938.8916, "train_tokens_per_second": 29197.756 }, { "epoch": 1.8200492252441913, "grad_norm": 1.578125, "learning_rate": 2.0171952421933997e-05, "loss": 1.0492498397827148, "num_input_tokens_seen": 14629185536, "step": 51440, "train_runtime": 501039.4479, "train_tokens_per_second": 29197.672 }, { "epoch": 1.82040304550792, "grad_norm": 1.5, "learning_rate": 2.017031099789395e-05, "loss": 1.0346683502197265, "num_input_tokens_seen": 14631982272, "step": 51450, "train_runtime": 501136.2791, "train_tokens_per_second": 29197.611 }, { "epoch": 1.8207568657716489, "grad_norm": 1.5234375, "learning_rate": 2.0168669974484606e-05, "loss": 1.0459463119506835, "num_input_tokens_seen": 14634767872, "step": 51460, "train_runtime": 501227.8464, "train_tokens_per_second": 29197.835 }, { "epoch": 1.8211106860353776, "grad_norm": 1.5703125, "learning_rate": 2.0167029351543015e-05, "loss": 1.0462090492248535, "num_input_tokens_seen": 14637595008, "step": 51470, "train_runtime": 501324.8891, "train_tokens_per_second": 29197.822 }, { "epoch": 1.8214645062991064, "grad_norm": 1.546875, "learning_rate": 2.0165389128906324e-05, "loss": 1.0340088844299316, "num_input_tokens_seen": 14640451712, "step": 51480, "train_runtime": 501422.454, "train_tokens_per_second": 29197.838 }, { "epoch": 1.8218183265628352, "grad_norm": 1.5625, "learning_rate": 2.0163749306411775e-05, "loss": 1.0535844802856444, "num_input_tokens_seen": 14643309056, "step": 51490, "train_runtime": 501523.8447, "train_tokens_per_second": 29197.633 }, { "epoch": 1.822172146826564, "grad_norm": 1.5390625, "learning_rate": 2.0162109883896694e-05, "loss": 1.0409570693969727, "num_input_tokens_seen": 14646130432, "step": 51500, "train_runtime": 501621.4637, "train_tokens_per_second": 29197.575 }, { "epoch": 1.8225259670902927, "grad_norm": 1.5, "learning_rate": 2.016047086119851e-05, "loss": 1.0397847175598145, "num_input_tokens_seen": 14649022720, "step": 51510, "train_runtime": 501721.2547, "train_tokens_per_second": 29197.533 }, { "epoch": 1.8228797873540215, "grad_norm": 1.546875, "learning_rate": 2.015883223815473e-05, "loss": 1.0342705726623536, "num_input_tokens_seen": 14651866240, "step": 51520, "train_runtime": 501818.1134, "train_tokens_per_second": 29197.564 }, { "epoch": 1.8232336076177504, "grad_norm": 1.53125, "learning_rate": 2.0157194014602974e-05, "loss": 1.0436864852905274, "num_input_tokens_seen": 14654656192, "step": 51530, "train_runtime": 501913.8893, "train_tokens_per_second": 29197.551 }, { "epoch": 1.823587427881479, "grad_norm": 1.5, "learning_rate": 2.0155556190380938e-05, "loss": 1.0517480850219727, "num_input_tokens_seen": 14657508992, "step": 51540, "train_runtime": 502012.2289, "train_tokens_per_second": 29197.514 }, { "epoch": 1.823941248145208, "grad_norm": 1.5859375, "learning_rate": 2.0153918765326414e-05, "loss": 1.0439971923828124, "num_input_tokens_seen": 14660358720, "step": 51550, "train_runtime": 502112.3169, "train_tokens_per_second": 29197.369 }, { "epoch": 1.8242950684089365, "grad_norm": 1.65625, "learning_rate": 2.0152281739277286e-05, "loss": 1.0467494964599608, "num_input_tokens_seen": 14663172096, "step": 51560, "train_runtime": 502207.7565, "train_tokens_per_second": 29197.423 }, { "epoch": 1.8246488886726655, "grad_norm": 1.6171875, "learning_rate": 2.0150645112071542e-05, "loss": 1.0431316375732422, "num_input_tokens_seen": 14666016192, "step": 51570, "train_runtime": 502305.9387, "train_tokens_per_second": 29197.378 }, { "epoch": 1.825002708936394, "grad_norm": 1.5703125, "learning_rate": 2.0149008883547245e-05, "loss": 1.0314371109008789, "num_input_tokens_seen": 14668849408, "step": 51580, "train_runtime": 502403.4196, "train_tokens_per_second": 29197.352 }, { "epoch": 1.825356529200123, "grad_norm": 1.59375, "learning_rate": 2.0147373053542558e-05, "loss": 1.028524112701416, "num_input_tokens_seen": 14671720320, "step": 51590, "train_runtime": 502502.6348, "train_tokens_per_second": 29197.3 }, { "epoch": 1.8257103494638516, "grad_norm": 1.5859375, "learning_rate": 2.014573762189573e-05, "loss": 1.0491708755493163, "num_input_tokens_seen": 14674547072, "step": 51600, "train_runtime": 502597.6644, "train_tokens_per_second": 29197.404 }, { "epoch": 1.8260641697275806, "grad_norm": 1.578125, "learning_rate": 2.0144102588445116e-05, "loss": 1.0468650817871095, "num_input_tokens_seen": 14677419392, "step": 51610, "train_runtime": 502697.9296, "train_tokens_per_second": 29197.294 }, { "epoch": 1.8264179899913093, "grad_norm": 1.5703125, "learning_rate": 2.014246795302915e-05, "loss": 1.0587779998779296, "num_input_tokens_seen": 14680263424, "step": 51620, "train_runtime": 502797.2572, "train_tokens_per_second": 29197.183 }, { "epoch": 1.826771810255038, "grad_norm": 1.53125, "learning_rate": 2.0140833715486358e-05, "loss": 1.0538188934326171, "num_input_tokens_seen": 14683072576, "step": 51630, "train_runtime": 502891.4476, "train_tokens_per_second": 29197.3 }, { "epoch": 1.8271256305187669, "grad_norm": 1.5703125, "learning_rate": 2.013919987565536e-05, "loss": 1.0453543663024902, "num_input_tokens_seen": 14685962816, "step": 51640, "train_runtime": 502992.8032, "train_tokens_per_second": 29197.163 }, { "epoch": 1.8274794507824956, "grad_norm": 1.5703125, "learning_rate": 2.0137566433374875e-05, "loss": 1.0611413955688476, "num_input_tokens_seen": 14688814784, "step": 51650, "train_runtime": 503089.3726, "train_tokens_per_second": 29197.227 }, { "epoch": 1.8278332710462244, "grad_norm": 1.6484375, "learning_rate": 2.0135933388483708e-05, "loss": 1.0337538719177246, "num_input_tokens_seen": 14691624512, "step": 51660, "train_runtime": 503184.4293, "train_tokens_per_second": 29197.296 }, { "epoch": 1.8281870913099532, "grad_norm": 1.453125, "learning_rate": 2.0134300740820746e-05, "loss": 1.0425182342529298, "num_input_tokens_seen": 14694446016, "step": 51670, "train_runtime": 503280.003, "train_tokens_per_second": 29197.357 }, { "epoch": 1.828540911573682, "grad_norm": 1.5625, "learning_rate": 2.0132668490224984e-05, "loss": 1.034316635131836, "num_input_tokens_seen": 14697304640, "step": 51680, "train_runtime": 503377.4958, "train_tokens_per_second": 29197.381 }, { "epoch": 1.8288947318374107, "grad_norm": 1.484375, "learning_rate": 2.0131036636535498e-05, "loss": 1.0368898391723633, "num_input_tokens_seen": 14700168192, "step": 51690, "train_runtime": 503476.3983, "train_tokens_per_second": 29197.333 }, { "epoch": 1.8292485521011397, "grad_norm": 1.5625, "learning_rate": 2.012940517959146e-05, "loss": 1.0418512344360351, "num_input_tokens_seen": 14703018816, "step": 51700, "train_runtime": 503571.9849, "train_tokens_per_second": 29197.452 }, { "epoch": 1.8296023723648682, "grad_norm": 1.609375, "learning_rate": 2.0127774119232128e-05, "loss": 1.0547548294067384, "num_input_tokens_seen": 14705870720, "step": 51710, "train_runtime": 503668.7778, "train_tokens_per_second": 29197.503 }, { "epoch": 1.8299561926285972, "grad_norm": 1.59375, "learning_rate": 2.0126143455296853e-05, "loss": 1.0333142280578613, "num_input_tokens_seen": 14708772032, "step": 51720, "train_runtime": 503769.4174, "train_tokens_per_second": 29197.429 }, { "epoch": 1.8303100128923258, "grad_norm": 1.609375, "learning_rate": 2.012451318762508e-05, "loss": 1.0409263610839843, "num_input_tokens_seen": 14711634496, "step": 51730, "train_runtime": 503867.1251, "train_tokens_per_second": 29197.449 }, { "epoch": 1.8306638331560547, "grad_norm": 1.546875, "learning_rate": 2.0122883316056348e-05, "loss": 1.04263916015625, "num_input_tokens_seen": 14714460160, "step": 51740, "train_runtime": 503963.4873, "train_tokens_per_second": 29197.473 }, { "epoch": 1.8310176534197833, "grad_norm": 1.5, "learning_rate": 2.0121253840430276e-05, "loss": 1.0307008743286132, "num_input_tokens_seen": 14717380800, "step": 51750, "train_runtime": 504065.9683, "train_tokens_per_second": 29197.331 }, { "epoch": 1.8313714736835123, "grad_norm": 1.5234375, "learning_rate": 2.0119624760586583e-05, "loss": 1.047711181640625, "num_input_tokens_seen": 14720253952, "step": 51760, "train_runtime": 504164.8552, "train_tokens_per_second": 29197.303 }, { "epoch": 1.8317252939472408, "grad_norm": 1.5625, "learning_rate": 2.0117996076365077e-05, "loss": 1.0437042236328125, "num_input_tokens_seen": 14723105536, "step": 51770, "train_runtime": 504262.3586, "train_tokens_per_second": 29197.312 }, { "epoch": 1.8320791142109698, "grad_norm": 1.5390625, "learning_rate": 2.0116367787605653e-05, "loss": 1.0339778900146483, "num_input_tokens_seen": 14725951360, "step": 51780, "train_runtime": 504360.3145, "train_tokens_per_second": 29197.284 }, { "epoch": 1.8324329344746986, "grad_norm": 1.6171875, "learning_rate": 2.01147398941483e-05, "loss": 1.0321468353271483, "num_input_tokens_seen": 14728826624, "step": 51790, "train_runtime": 504458.8143, "train_tokens_per_second": 29197.283 }, { "epoch": 1.8327867547384273, "grad_norm": 1.6015625, "learning_rate": 2.01131123958331e-05, "loss": 1.0399364471435546, "num_input_tokens_seen": 14731645760, "step": 51800, "train_runtime": 504551.2647, "train_tokens_per_second": 29197.52 }, { "epoch": 1.833140575002156, "grad_norm": 1.5078125, "learning_rate": 2.0111485292500217e-05, "loss": 1.0426036834716796, "num_input_tokens_seen": 14734529472, "step": 51810, "train_runtime": 504649.8135, "train_tokens_per_second": 29197.533 }, { "epoch": 1.8334943952658849, "grad_norm": 1.5390625, "learning_rate": 2.010985858398992e-05, "loss": 1.043788528442383, "num_input_tokens_seen": 14737382208, "step": 51820, "train_runtime": 504746.6455, "train_tokens_per_second": 29197.583 }, { "epoch": 1.8338482155296136, "grad_norm": 1.6640625, "learning_rate": 2.0108232270142547e-05, "loss": 1.0479053497314452, "num_input_tokens_seen": 14740214656, "step": 51830, "train_runtime": 504844.2525, "train_tokens_per_second": 29197.549 }, { "epoch": 1.8342020357933424, "grad_norm": 1.546875, "learning_rate": 2.0106606350798547e-05, "loss": 1.0432571411132812, "num_input_tokens_seen": 14743062976, "step": 51840, "train_runtime": 504943.255, "train_tokens_per_second": 29197.465 }, { "epoch": 1.8345558560570712, "grad_norm": 1.53125, "learning_rate": 2.0104980825798458e-05, "loss": 1.0279623985290527, "num_input_tokens_seen": 14745890688, "step": 51850, "train_runtime": 505036.816, "train_tokens_per_second": 29197.655 }, { "epoch": 1.8349096763208, "grad_norm": 1.609375, "learning_rate": 2.0103355694982888e-05, "loss": 1.045193576812744, "num_input_tokens_seen": 14748708992, "step": 51860, "train_runtime": 505131.4694, "train_tokens_per_second": 29197.763 }, { "epoch": 1.835263496584529, "grad_norm": 1.5234375, "learning_rate": 2.010173095819256e-05, "loss": 1.0485448837280273, "num_input_tokens_seen": 14751567872, "step": 51870, "train_runtime": 505232.1501, "train_tokens_per_second": 29197.603 }, { "epoch": 1.8356173168482575, "grad_norm": 1.5859375, "learning_rate": 2.0100106615268267e-05, "loss": 1.0435639381408692, "num_input_tokens_seen": 14754377344, "step": 51880, "train_runtime": 505328.7227, "train_tokens_per_second": 29197.583 }, { "epoch": 1.8359711371119865, "grad_norm": 1.578125, "learning_rate": 2.0098482666050902e-05, "loss": 1.048586368560791, "num_input_tokens_seen": 14757212480, "step": 51890, "train_runtime": 505428.6674, "train_tokens_per_second": 29197.419 }, { "epoch": 1.836324957375715, "grad_norm": 1.5625, "learning_rate": 2.009685911038145e-05, "loss": 1.0303977966308593, "num_input_tokens_seen": 14760058624, "step": 51900, "train_runtime": 505525.2278, "train_tokens_per_second": 29197.472 }, { "epoch": 1.836678777639444, "grad_norm": 1.5625, "learning_rate": 2.0095235948100982e-05, "loss": 1.0451906204223633, "num_input_tokens_seen": 14762878976, "step": 51910, "train_runtime": 505619.859, "train_tokens_per_second": 29197.585 }, { "epoch": 1.8370325979031725, "grad_norm": 1.6484375, "learning_rate": 2.0093613179050662e-05, "loss": 1.046688938140869, "num_input_tokens_seen": 14765716864, "step": 51920, "train_runtime": 505716.7726, "train_tokens_per_second": 29197.602 }, { "epoch": 1.8373864181669015, "grad_norm": 1.5390625, "learning_rate": 2.0091990803071733e-05, "loss": 1.0450884819030761, "num_input_tokens_seen": 14768661952, "step": 51930, "train_runtime": 505820.8839, "train_tokens_per_second": 29197.414 }, { "epoch": 1.83774023843063, "grad_norm": 1.6015625, "learning_rate": 2.009036882000554e-05, "loss": 1.0423538208007812, "num_input_tokens_seen": 14771459328, "step": 51940, "train_runtime": 505914.1719, "train_tokens_per_second": 29197.56 }, { "epoch": 1.838094058694359, "grad_norm": 1.5859375, "learning_rate": 2.008874722969352e-05, "loss": 1.0451613426208497, "num_input_tokens_seen": 14774306688, "step": 51950, "train_runtime": 506014.2802, "train_tokens_per_second": 29197.411 }, { "epoch": 1.8384478789580878, "grad_norm": 1.5625, "learning_rate": 2.0087126031977192e-05, "loss": 1.05203218460083, "num_input_tokens_seen": 14777162176, "step": 51960, "train_runtime": 506111.3558, "train_tokens_per_second": 29197.452 }, { "epoch": 1.8388016992218166, "grad_norm": 1.5625, "learning_rate": 2.008550522669815e-05, "loss": 1.0339105606079102, "num_input_tokens_seen": 14779979264, "step": 51970, "train_runtime": 506208.0553, "train_tokens_per_second": 29197.44 }, { "epoch": 1.8391555194855453, "grad_norm": 1.640625, "learning_rate": 2.0083884813698114e-05, "loss": 1.0527472496032715, "num_input_tokens_seen": 14782824768, "step": 51980, "train_runtime": 506304.6854, "train_tokens_per_second": 29197.488 }, { "epoch": 1.839509339749274, "grad_norm": 1.578125, "learning_rate": 2.008226479281886e-05, "loss": 1.0303709983825684, "num_input_tokens_seen": 14785633472, "step": 51990, "train_runtime": 506400.5495, "train_tokens_per_second": 29197.507 }, { "epoch": 1.8398631600130029, "grad_norm": 1.5625, "learning_rate": 2.008064516390227e-05, "loss": 1.0445036888122559, "num_input_tokens_seen": 14788486272, "step": 52000, "train_runtime": 506497.2499, "train_tokens_per_second": 29197.565 }, { "epoch": 1.8402169802767316, "grad_norm": 1.578125, "learning_rate": 2.0079025926790312e-05, "loss": 1.0370040893554688, "num_input_tokens_seen": 14791354112, "step": 52010, "train_runtime": 506595.112, "train_tokens_per_second": 29197.586 }, { "epoch": 1.8405708005404604, "grad_norm": 1.625, "learning_rate": 2.007740708132504e-05, "loss": 1.0363029479980468, "num_input_tokens_seen": 14794183552, "step": 52020, "train_runtime": 506694.5507, "train_tokens_per_second": 29197.44 }, { "epoch": 1.8409246208041892, "grad_norm": 1.640625, "learning_rate": 2.0075788627348595e-05, "loss": 1.0445004463195802, "num_input_tokens_seen": 14797066048, "step": 52030, "train_runtime": 506793.5188, "train_tokens_per_second": 29197.426 }, { "epoch": 1.8412784410679182, "grad_norm": 1.5859375, "learning_rate": 2.007417056470322e-05, "loss": 1.0487873077392578, "num_input_tokens_seen": 14799977664, "step": 52040, "train_runtime": 506894.0107, "train_tokens_per_second": 29197.381 }, { "epoch": 1.8416322613316467, "grad_norm": 1.5859375, "learning_rate": 2.0072552893231236e-05, "loss": 1.0380552291870118, "num_input_tokens_seen": 14802843776, "step": 52050, "train_runtime": 506992.4511, "train_tokens_per_second": 29197.365 }, { "epoch": 1.8419860815953757, "grad_norm": 1.53125, "learning_rate": 2.0070935612775056e-05, "loss": 1.0303022384643554, "num_input_tokens_seen": 14805666496, "step": 52060, "train_runtime": 507088.0139, "train_tokens_per_second": 29197.429 }, { "epoch": 1.8423399018591042, "grad_norm": 1.578125, "learning_rate": 2.006931872317718e-05, "loss": 1.045656108856201, "num_input_tokens_seen": 14808541888, "step": 52070, "train_runtime": 507189.2107, "train_tokens_per_second": 29197.273 }, { "epoch": 1.8426937221228332, "grad_norm": 1.640625, "learning_rate": 2.0067702224280192e-05, "loss": 1.043748950958252, "num_input_tokens_seen": 14811345728, "step": 52080, "train_runtime": 507282.502, "train_tokens_per_second": 29197.431 }, { "epoch": 1.8430475423865618, "grad_norm": 1.5703125, "learning_rate": 2.0066086115926782e-05, "loss": 1.034750747680664, "num_input_tokens_seen": 14814217152, "step": 52090, "train_runtime": 507380.3484, "train_tokens_per_second": 29197.459 }, { "epoch": 1.8434013626502908, "grad_norm": 1.625, "learning_rate": 2.0064470397959713e-05, "loss": 1.0458473205566405, "num_input_tokens_seen": 14817025984, "step": 52100, "train_runtime": 507475.8014, "train_tokens_per_second": 29197.503 }, { "epoch": 1.8437551829140195, "grad_norm": 1.5625, "learning_rate": 2.0062855070221834e-05, "loss": 1.0320871353149415, "num_input_tokens_seen": 14819859648, "step": 52110, "train_runtime": 507572.8711, "train_tokens_per_second": 29197.501 }, { "epoch": 1.8441090031777483, "grad_norm": 1.578125, "learning_rate": 2.0061240132556102e-05, "loss": 1.0385744094848632, "num_input_tokens_seen": 14822672128, "step": 52120, "train_runtime": 507669.1589, "train_tokens_per_second": 29197.504 }, { "epoch": 1.844462823441477, "grad_norm": 1.515625, "learning_rate": 2.0059625584805542e-05, "loss": 1.0346109390258789, "num_input_tokens_seen": 14825601920, "step": 52130, "train_runtime": 507772.9094, "train_tokens_per_second": 29197.308 }, { "epoch": 1.8448166437052058, "grad_norm": 1.546875, "learning_rate": 2.0058011426813275e-05, "loss": 1.0366310119628905, "num_input_tokens_seen": 14828473088, "step": 52140, "train_runtime": 507874.2741, "train_tokens_per_second": 29197.134 }, { "epoch": 1.8451704639689346, "grad_norm": 1.59375, "learning_rate": 2.0056397658422517e-05, "loss": 1.0524778366088867, "num_input_tokens_seen": 14831337536, "step": 52150, "train_runtime": 507973.2337, "train_tokens_per_second": 29197.085 }, { "epoch": 1.8455242842326633, "grad_norm": 1.625, "learning_rate": 2.005478427947656e-05, "loss": 1.0503826141357422, "num_input_tokens_seen": 14834190336, "step": 52160, "train_runtime": 508070.3556, "train_tokens_per_second": 29197.118 }, { "epoch": 1.8458781044963921, "grad_norm": 1.5390625, "learning_rate": 2.005317128981879e-05, "loss": 1.0673009872436523, "num_input_tokens_seen": 14837054976, "step": 52170, "train_runtime": 508171.5615, "train_tokens_per_second": 29196.941 }, { "epoch": 1.8462319247601209, "grad_norm": 1.6015625, "learning_rate": 2.005155868929269e-05, "loss": 1.0425497055053712, "num_input_tokens_seen": 14839866816, "step": 52180, "train_runtime": 508267.3256, "train_tokens_per_second": 29196.972 }, { "epoch": 1.8465857450238496, "grad_norm": 1.5859375, "learning_rate": 2.0049946477741817e-05, "loss": 1.037805938720703, "num_input_tokens_seen": 14842770944, "step": 52190, "train_runtime": 508368.043, "train_tokens_per_second": 29196.9 }, { "epoch": 1.8469395652875784, "grad_norm": 1.53125, "learning_rate": 2.0048334655009818e-05, "loss": 1.0417848587036134, "num_input_tokens_seen": 14845628288, "step": 52200, "train_runtime": 508463.0235, "train_tokens_per_second": 29197.066 }, { "epoch": 1.8472933855513074, "grad_norm": 1.5625, "learning_rate": 2.004672322094043e-05, "loss": 1.0489841461181642, "num_input_tokens_seen": 14848459520, "step": 52210, "train_runtime": 508557.2734, "train_tokens_per_second": 29197.222 }, { "epoch": 1.847647205815036, "grad_norm": 1.6171875, "learning_rate": 2.00451121753775e-05, "loss": 1.0454236030578614, "num_input_tokens_seen": 14851264192, "step": 52220, "train_runtime": 508652.0865, "train_tokens_per_second": 29197.293 }, { "epoch": 1.848001026078765, "grad_norm": 1.5703125, "learning_rate": 2.0043501518164916e-05, "loss": 1.0397187232971192, "num_input_tokens_seen": 14854066368, "step": 52230, "train_runtime": 508745.8713, "train_tokens_per_second": 29197.419 }, { "epoch": 1.8483548463424935, "grad_norm": 1.5390625, "learning_rate": 2.0041891249146692e-05, "loss": 1.0382884979248046, "num_input_tokens_seen": 14856942720, "step": 52240, "train_runtime": 508845.8719, "train_tokens_per_second": 29197.334 }, { "epoch": 1.8487086666062225, "grad_norm": 1.6328125, "learning_rate": 2.0040281368166923e-05, "loss": 1.0552717208862306, "num_input_tokens_seen": 14859740992, "step": 52250, "train_runtime": 508940.7851, "train_tokens_per_second": 29197.387 }, { "epoch": 1.849062486869951, "grad_norm": 1.609375, "learning_rate": 2.0038671875069774e-05, "loss": 1.0455099105834962, "num_input_tokens_seen": 14862599808, "step": 52260, "train_runtime": 509041.1939, "train_tokens_per_second": 29197.244 }, { "epoch": 1.84941630713368, "grad_norm": 1.59375, "learning_rate": 2.0037062769699525e-05, "loss": 1.0445660591125487, "num_input_tokens_seen": 14865442304, "step": 52270, "train_runtime": 509139.4289, "train_tokens_per_second": 29197.193 }, { "epoch": 1.8497701273974088, "grad_norm": 1.546875, "learning_rate": 2.0035454051900516e-05, "loss": 1.0431885719299316, "num_input_tokens_seen": 14868314304, "step": 52280, "train_runtime": 509238.0069, "train_tokens_per_second": 29197.181 }, { "epoch": 1.8501239476611375, "grad_norm": 1.5234375, "learning_rate": 2.003384572151719e-05, "loss": 1.0481454849243164, "num_input_tokens_seen": 14871239232, "step": 52290, "train_runtime": 509338.6177, "train_tokens_per_second": 29197.156 }, { "epoch": 1.8504777679248663, "grad_norm": 1.5703125, "learning_rate": 2.0032237778394082e-05, "loss": 1.0423768997192382, "num_input_tokens_seen": 14874111104, "step": 52300, "train_runtime": 509435.6785, "train_tokens_per_second": 29197.231 }, { "epoch": 1.850831588188595, "grad_norm": 1.6015625, "learning_rate": 2.0030630222375794e-05, "loss": 1.0550924301147462, "num_input_tokens_seen": 14876953088, "step": 52310, "train_runtime": 509533.6353, "train_tokens_per_second": 29197.195 }, { "epoch": 1.8511854084523238, "grad_norm": 1.5625, "learning_rate": 2.0029023053307043e-05, "loss": 1.0483924865722656, "num_input_tokens_seen": 14879821632, "step": 52320, "train_runtime": 509633.4089, "train_tokens_per_second": 29197.108 }, { "epoch": 1.8515392287160526, "grad_norm": 1.4765625, "learning_rate": 2.0027416271032604e-05, "loss": 1.0359944343566894, "num_input_tokens_seen": 14882681024, "step": 52330, "train_runtime": 509730.7759, "train_tokens_per_second": 29197.14 }, { "epoch": 1.8518930489797814, "grad_norm": 1.6015625, "learning_rate": 2.0025809875397362e-05, "loss": 1.0570131301879884, "num_input_tokens_seen": 14885498688, "step": 52340, "train_runtime": 509828.037, "train_tokens_per_second": 29197.097 }, { "epoch": 1.8522468692435101, "grad_norm": 1.53125, "learning_rate": 2.002420386624628e-05, "loss": 1.064437198638916, "num_input_tokens_seen": 14888316288, "step": 52350, "train_runtime": 509923.4993, "train_tokens_per_second": 29197.157 }, { "epoch": 1.852600689507239, "grad_norm": 1.625, "learning_rate": 2.0022598243424406e-05, "loss": 1.0421026229858399, "num_input_tokens_seen": 14891132864, "step": 52360, "train_runtime": 510018.5921, "train_tokens_per_second": 29197.235 }, { "epoch": 1.8529545097709677, "grad_norm": 1.578125, "learning_rate": 2.0020993006776878e-05, "loss": 1.0399102210998534, "num_input_tokens_seen": 14893995456, "step": 52370, "train_runtime": 510117.2599, "train_tokens_per_second": 29197.2 }, { "epoch": 1.8533083300346966, "grad_norm": 1.4921875, "learning_rate": 2.0019388156148922e-05, "loss": 1.0542527198791505, "num_input_tokens_seen": 14896844864, "step": 52380, "train_runtime": 510213.3919, "train_tokens_per_second": 29197.283 }, { "epoch": 1.8536621502984252, "grad_norm": 1.5625, "learning_rate": 2.001778369138585e-05, "loss": 1.0476877212524414, "num_input_tokens_seen": 14899698176, "step": 52390, "train_runtime": 510310.4664, "train_tokens_per_second": 29197.32 }, { "epoch": 1.8540159705621542, "grad_norm": 1.53125, "learning_rate": 2.001617961233306e-05, "loss": 1.0468734741210937, "num_input_tokens_seen": 14902509760, "step": 52400, "train_runtime": 510408.6807, "train_tokens_per_second": 29197.211 }, { "epoch": 1.8543697908258827, "grad_norm": 1.5390625, "learning_rate": 2.0014575918836026e-05, "loss": 1.0497058868408202, "num_input_tokens_seen": 14905346752, "step": 52410, "train_runtime": 510503.2478, "train_tokens_per_second": 29197.359 }, { "epoch": 1.8547236110896117, "grad_norm": 1.5625, "learning_rate": 2.0012972610740336e-05, "loss": 1.0388196945190429, "num_input_tokens_seen": 14908187008, "step": 52420, "train_runtime": 510599.4398, "train_tokens_per_second": 29197.421 }, { "epoch": 1.8550774313533402, "grad_norm": 1.5703125, "learning_rate": 2.001136968789164e-05, "loss": 1.0317584037780763, "num_input_tokens_seen": 14911065536, "step": 52430, "train_runtime": 510697.828, "train_tokens_per_second": 29197.433 }, { "epoch": 1.8554312516170692, "grad_norm": 1.5390625, "learning_rate": 2.000976715013568e-05, "loss": 1.0462995529174806, "num_input_tokens_seen": 14913905792, "step": 52440, "train_runtime": 510793.649, "train_tokens_per_second": 29197.516 }, { "epoch": 1.855785071880798, "grad_norm": 1.53125, "learning_rate": 2.0008164997318294e-05, "loss": 1.0523185729980469, "num_input_tokens_seen": 14916731520, "step": 52450, "train_runtime": 510889.9194, "train_tokens_per_second": 29197.545 }, { "epoch": 1.8561388921445268, "grad_norm": 1.5625, "learning_rate": 2.000656322928539e-05, "loss": 1.0413409233093263, "num_input_tokens_seen": 14919531776, "step": 52460, "train_runtime": 510985.1243, "train_tokens_per_second": 29197.585 }, { "epoch": 1.8564927124082555, "grad_norm": 1.5390625, "learning_rate": 2.000496184588298e-05, "loss": 1.043079662322998, "num_input_tokens_seen": 14922358592, "step": 52470, "train_runtime": 511084.2011, "train_tokens_per_second": 29197.456 }, { "epoch": 1.8568465326719843, "grad_norm": 1.5703125, "learning_rate": 2.0003360846957154e-05, "loss": 1.0452932357788085, "num_input_tokens_seen": 14925212928, "step": 52480, "train_runtime": 511182.4988, "train_tokens_per_second": 29197.426 }, { "epoch": 1.857200352935713, "grad_norm": 1.5390625, "learning_rate": 2.0001760232354076e-05, "loss": 1.0442402839660645, "num_input_tokens_seen": 14928026944, "step": 52490, "train_runtime": 511275.7474, "train_tokens_per_second": 29197.604 }, { "epoch": 1.8575541731994418, "grad_norm": 1.5078125, "learning_rate": 2.0000160001920026e-05, "loss": 1.0527508735656739, "num_input_tokens_seen": 14930867008, "step": 52500, "train_runtime": 511372.3867, "train_tokens_per_second": 29197.64 }, { "epoch": 1.8579079934631706, "grad_norm": 1.5859375, "learning_rate": 1.9998560155501343e-05, "loss": 1.0397061347961425, "num_input_tokens_seen": 14933773568, "step": 52510, "train_runtime": 511476.2425, "train_tokens_per_second": 29197.394 }, { "epoch": 1.8582618137268994, "grad_norm": 1.53125, "learning_rate": 1.9996960692944456e-05, "loss": 1.044118881225586, "num_input_tokens_seen": 14936665216, "step": 52520, "train_runtime": 511577.123, "train_tokens_per_second": 29197.289 }, { "epoch": 1.8586156339906283, "grad_norm": 1.59375, "learning_rate": 1.9995361614095893e-05, "loss": 1.0353090286254882, "num_input_tokens_seen": 14939450240, "step": 52530, "train_runtime": 511672.7221, "train_tokens_per_second": 29197.277 }, { "epoch": 1.858969454254357, "grad_norm": 1.546875, "learning_rate": 1.9993762918802263e-05, "loss": 1.0530210494995118, "num_input_tokens_seen": 14942286464, "step": 52540, "train_runtime": 511769.1059, "train_tokens_per_second": 29197.32 }, { "epoch": 1.8593232745180859, "grad_norm": 1.59375, "learning_rate": 1.9992164606910253e-05, "loss": 1.0539814949035644, "num_input_tokens_seen": 14945110144, "step": 52550, "train_runtime": 511863.0419, "train_tokens_per_second": 29197.478 }, { "epoch": 1.8596770947818144, "grad_norm": 1.6015625, "learning_rate": 1.999056667826664e-05, "loss": 1.0307307243347168, "num_input_tokens_seen": 14947939904, "step": 52560, "train_runtime": 511958.7727, "train_tokens_per_second": 29197.546 }, { "epoch": 1.8600309150455434, "grad_norm": 1.6015625, "learning_rate": 1.9988969132718285e-05, "loss": 1.0452447891235352, "num_input_tokens_seen": 14950793920, "step": 52570, "train_runtime": 512055.261, "train_tokens_per_second": 29197.618 }, { "epoch": 1.860384735309272, "grad_norm": 1.5234375, "learning_rate": 1.9987371970112145e-05, "loss": 1.034015941619873, "num_input_tokens_seen": 14953684864, "step": 52580, "train_runtime": 512154.8245, "train_tokens_per_second": 29197.587 }, { "epoch": 1.860738555573001, "grad_norm": 1.5625, "learning_rate": 1.998577519029525e-05, "loss": 1.0378585815429688, "num_input_tokens_seen": 14956571904, "step": 52590, "train_runtime": 512255.173, "train_tokens_per_second": 29197.503 }, { "epoch": 1.8610923758367295, "grad_norm": 1.625, "learning_rate": 1.9984178793114727e-05, "loss": 1.0414339065551759, "num_input_tokens_seen": 14959440576, "step": 52600, "train_runtime": 512353.9287, "train_tokens_per_second": 29197.474 }, { "epoch": 1.8614461961004585, "grad_norm": 1.546875, "learning_rate": 1.9982582778417768e-05, "loss": 1.0509407997131348, "num_input_tokens_seen": 14962240768, "step": 52610, "train_runtime": 512449.1819, "train_tokens_per_second": 29197.511 }, { "epoch": 1.8618000163641872, "grad_norm": 1.5234375, "learning_rate": 1.9980987146051677e-05, "loss": 1.0383895874023437, "num_input_tokens_seen": 14965126656, "step": 52620, "train_runtime": 512550.815, "train_tokens_per_second": 29197.352 }, { "epoch": 1.862153836627916, "grad_norm": 1.5625, "learning_rate": 1.9979391895863827e-05, "loss": 1.0555732727050782, "num_input_tokens_seen": 14967964416, "step": 52630, "train_runtime": 512645.8905, "train_tokens_per_second": 29197.473 }, { "epoch": 1.8625076568916448, "grad_norm": 1.5703125, "learning_rate": 1.997779702770168e-05, "loss": 1.040258026123047, "num_input_tokens_seen": 14970794816, "step": 52640, "train_runtime": 512741.7674, "train_tokens_per_second": 29197.533 }, { "epoch": 1.8628614771553735, "grad_norm": 1.53125, "learning_rate": 1.997620254141278e-05, "loss": 1.0489641189575196, "num_input_tokens_seen": 14973588160, "step": 52650, "train_runtime": 512835.02, "train_tokens_per_second": 29197.671 }, { "epoch": 1.8632152974191023, "grad_norm": 1.578125, "learning_rate": 1.997460843684476e-05, "loss": 1.0352008819580079, "num_input_tokens_seen": 14976479104, "step": 52660, "train_runtime": 512935.4777, "train_tokens_per_second": 29197.589 }, { "epoch": 1.863569117682831, "grad_norm": 1.5703125, "learning_rate": 1.997301471384534e-05, "loss": 1.0511030197143554, "num_input_tokens_seen": 14979315392, "step": 52670, "train_runtime": 513032.6538, "train_tokens_per_second": 29197.587 }, { "epoch": 1.8639229379465598, "grad_norm": 1.59375, "learning_rate": 1.997142137226232e-05, "loss": 1.0293703079223633, "num_input_tokens_seen": 14982132672, "step": 52680, "train_runtime": 513126.0189, "train_tokens_per_second": 29197.765 }, { "epoch": 1.8642767582102886, "grad_norm": 1.5859375, "learning_rate": 1.9969828411943588e-05, "loss": 1.0369377136230469, "num_input_tokens_seen": 14984967808, "step": 52690, "train_runtime": 513221.2946, "train_tokens_per_second": 29197.868 }, { "epoch": 1.8646305784740176, "grad_norm": 1.609375, "learning_rate": 1.9968235832737117e-05, "loss": 1.0452211380004883, "num_input_tokens_seen": 14987848256, "step": 52700, "train_runtime": 513320.2832, "train_tokens_per_second": 29197.849 }, { "epoch": 1.8649843987377461, "grad_norm": 1.6328125, "learning_rate": 1.9966643634490965e-05, "loss": 1.0504636764526367, "num_input_tokens_seen": 14990697344, "step": 52710, "train_runtime": 513417.8358, "train_tokens_per_second": 29197.851 }, { "epoch": 1.8653382190014751, "grad_norm": 1.5390625, "learning_rate": 1.9965051817053272e-05, "loss": 1.0321514129638671, "num_input_tokens_seen": 14993497344, "step": 52720, "train_runtime": 513515.5204, "train_tokens_per_second": 29197.749 }, { "epoch": 1.8656920392652037, "grad_norm": 1.5859375, "learning_rate": 1.9963460380272264e-05, "loss": 1.0420095443725585, "num_input_tokens_seen": 14996344832, "step": 52730, "train_runtime": 513612.8711, "train_tokens_per_second": 29197.759 }, { "epoch": 1.8660458595289326, "grad_norm": 1.5859375, "learning_rate": 1.9961869323996253e-05, "loss": 1.0237188339233398, "num_input_tokens_seen": 14999178816, "step": 52740, "train_runtime": 513708.1459, "train_tokens_per_second": 29197.861 }, { "epoch": 1.8663996797926612, "grad_norm": 1.65625, "learning_rate": 1.996027864807364e-05, "loss": 1.0382715225219727, "num_input_tokens_seen": 15002017408, "step": 52750, "train_runtime": 513804.4794, "train_tokens_per_second": 29197.911 }, { "epoch": 1.8667535000563902, "grad_norm": 1.6171875, "learning_rate": 1.9958688352352895e-05, "loss": 1.0614127159118651, "num_input_tokens_seen": 15004853824, "step": 52760, "train_runtime": 513902.6096, "train_tokens_per_second": 29197.855 }, { "epoch": 1.8671073203201187, "grad_norm": 1.578125, "learning_rate": 1.995709843668259e-05, "loss": 1.0335342407226562, "num_input_tokens_seen": 15007682048, "step": 52770, "train_runtime": 513999.3624, "train_tokens_per_second": 29197.861 }, { "epoch": 1.8674611405838477, "grad_norm": 1.5390625, "learning_rate": 1.995550890091138e-05, "loss": 1.0511831283569335, "num_input_tokens_seen": 15010514304, "step": 52780, "train_runtime": 514095.1809, "train_tokens_per_second": 29197.928 }, { "epoch": 1.8678149608475765, "grad_norm": 1.5859375, "learning_rate": 1.9953919744887985e-05, "loss": 1.055367660522461, "num_input_tokens_seen": 15013325632, "step": 52790, "train_runtime": 514191.6865, "train_tokens_per_second": 29197.916 }, { "epoch": 1.8681687811113052, "grad_norm": 1.5390625, "learning_rate": 1.9952330968461233e-05, "loss": 1.0340347290039062, "num_input_tokens_seen": 15016185792, "step": 52800, "train_runtime": 514289.1651, "train_tokens_per_second": 29197.943 }, { "epoch": 1.868522601375034, "grad_norm": 1.65625, "learning_rate": 1.995074257148002e-05, "loss": 1.0472915649414063, "num_input_tokens_seen": 15019031040, "step": 52810, "train_runtime": 514385.8, "train_tokens_per_second": 29197.989 }, { "epoch": 1.8688764216387628, "grad_norm": 1.59375, "learning_rate": 1.9949154553793342e-05, "loss": 1.033731746673584, "num_input_tokens_seen": 15021916736, "step": 52820, "train_runtime": 514486.3398, "train_tokens_per_second": 29197.892 }, { "epoch": 1.8692302419024915, "grad_norm": 1.5546875, "learning_rate": 1.994756691525026e-05, "loss": 1.0458511352539062, "num_input_tokens_seen": 15024798208, "step": 52830, "train_runtime": 514587.1763, "train_tokens_per_second": 29197.77 }, { "epoch": 1.8695840621662203, "grad_norm": 1.6015625, "learning_rate": 1.9945979655699932e-05, "loss": 1.0440725326538085, "num_input_tokens_seen": 15027600960, "step": 52840, "train_runtime": 514678.7218, "train_tokens_per_second": 29198.023 }, { "epoch": 1.869937882429949, "grad_norm": 1.5703125, "learning_rate": 1.99443927749916e-05, "loss": 1.0341585159301758, "num_input_tokens_seen": 15030380544, "step": 52850, "train_runtime": 514775.4708, "train_tokens_per_second": 29197.935 }, { "epoch": 1.8702917026936778, "grad_norm": 1.53125, "learning_rate": 1.994280627297458e-05, "loss": 1.0424995422363281, "num_input_tokens_seen": 15033159424, "step": 52860, "train_runtime": 514868.1487, "train_tokens_per_second": 29198.076 }, { "epoch": 1.8706455229574068, "grad_norm": 1.5625, "learning_rate": 1.9941220149498282e-05, "loss": 1.0405799865722656, "num_input_tokens_seen": 15035982464, "step": 52870, "train_runtime": 514966.2047, "train_tokens_per_second": 29197.998 }, { "epoch": 1.8709993432211354, "grad_norm": 1.5390625, "learning_rate": 1.99396344044122e-05, "loss": 1.04142427444458, "num_input_tokens_seen": 15038833600, "step": 52880, "train_runtime": 515063.2978, "train_tokens_per_second": 29198.03 }, { "epoch": 1.8713531634848644, "grad_norm": 1.5703125, "learning_rate": 1.9938049037565903e-05, "loss": 1.0353654861450194, "num_input_tokens_seen": 15041661824, "step": 52890, "train_runtime": 515160.172, "train_tokens_per_second": 29198.029 }, { "epoch": 1.871706983748593, "grad_norm": 1.59375, "learning_rate": 1.993646404880905e-05, "loss": 1.0471607208251954, "num_input_tokens_seen": 15044500672, "step": 52900, "train_runtime": 515258.2459, "train_tokens_per_second": 29197.981 }, { "epoch": 1.8720608040123219, "grad_norm": 1.5546875, "learning_rate": 1.993487943799139e-05, "loss": 1.0443610191345214, "num_input_tokens_seen": 15047343552, "step": 52910, "train_runtime": 515353.1297, "train_tokens_per_second": 29198.122 }, { "epoch": 1.8724146242760504, "grad_norm": 1.578125, "learning_rate": 1.9933295204962733e-05, "loss": 1.039942741394043, "num_input_tokens_seen": 15050183808, "step": 52920, "train_runtime": 515450.7645, "train_tokens_per_second": 29198.102 }, { "epoch": 1.8727684445397794, "grad_norm": 1.5703125, "learning_rate": 1.9931711349572995e-05, "loss": 1.0339216232299804, "num_input_tokens_seen": 15053017280, "step": 52930, "train_runtime": 515548.5573, "train_tokens_per_second": 29198.059 }, { "epoch": 1.873122264803508, "grad_norm": 1.5703125, "learning_rate": 1.9930127871672175e-05, "loss": 1.0475444793701172, "num_input_tokens_seen": 15055880320, "step": 52940, "train_runtime": 515647.6823, "train_tokens_per_second": 29197.999 }, { "epoch": 1.873476085067237, "grad_norm": 1.578125, "learning_rate": 1.992854477111034e-05, "loss": 1.0461475372314453, "num_input_tokens_seen": 15058738560, "step": 52950, "train_runtime": 515744.4016, "train_tokens_per_second": 29198.065 }, { "epoch": 1.8738299053309657, "grad_norm": 1.59375, "learning_rate": 1.9926962047737652e-05, "loss": 1.0350165367126465, "num_input_tokens_seen": 15061586240, "step": 52960, "train_runtime": 515842.3738, "train_tokens_per_second": 29198.04 }, { "epoch": 1.8741837255946945, "grad_norm": 1.5, "learning_rate": 1.992537970140435e-05, "loss": 1.0413796424865722, "num_input_tokens_seen": 15064406464, "step": 52970, "train_runtime": 515935.6584, "train_tokens_per_second": 29198.227 }, { "epoch": 1.8745375458584232, "grad_norm": 1.578125, "learning_rate": 1.9923797731960762e-05, "loss": 1.046365737915039, "num_input_tokens_seen": 15067219712, "step": 52980, "train_runtime": 516030.0879, "train_tokens_per_second": 29198.336 }, { "epoch": 1.874891366122152, "grad_norm": 1.578125, "learning_rate": 1.9922216139257303e-05, "loss": 1.0428776741027832, "num_input_tokens_seen": 15070048576, "step": 52990, "train_runtime": 516127.3372, "train_tokens_per_second": 29198.315 }, { "epoch": 1.8752451863858808, "grad_norm": 1.6015625, "learning_rate": 1.9920634923144448e-05, "loss": 1.0358384132385254, "num_input_tokens_seen": 15072914944, "step": 53000, "train_runtime": 516223.6377, "train_tokens_per_second": 29198.421 }, { "epoch": 1.8755990066496095, "grad_norm": 1.5703125, "learning_rate": 1.9919054083472788e-05, "loss": 1.0324202537536622, "num_input_tokens_seen": 15075765440, "step": 53010, "train_runtime": 516320.3123, "train_tokens_per_second": 29198.474 }, { "epoch": 1.8759528269133383, "grad_norm": 1.5703125, "learning_rate": 1.9917473620092976e-05, "loss": 1.039243507385254, "num_input_tokens_seen": 15078580992, "step": 53020, "train_runtime": 516413.5367, "train_tokens_per_second": 29198.656 }, { "epoch": 1.876306647177067, "grad_norm": 1.578125, "learning_rate": 1.9915893532855746e-05, "loss": 1.0500545501708984, "num_input_tokens_seen": 15081389120, "step": 53030, "train_runtime": 516507.62, "train_tokens_per_second": 29198.774 }, { "epoch": 1.876660467440796, "grad_norm": 1.5, "learning_rate": 1.9914313821611926e-05, "loss": 1.0438434600830078, "num_input_tokens_seen": 15084214336, "step": 53040, "train_runtime": 516601.3371, "train_tokens_per_second": 29198.946 }, { "epoch": 1.8770142877045246, "grad_norm": 1.578125, "learning_rate": 1.9912734486212426e-05, "loss": 1.0411837577819825, "num_input_tokens_seen": 15087038464, "step": 53050, "train_runtime": 516699.1081, "train_tokens_per_second": 29198.886 }, { "epoch": 1.8773681079682536, "grad_norm": 1.578125, "learning_rate": 1.9911155526508233e-05, "loss": 1.0391999244689942, "num_input_tokens_seen": 15089893760, "step": 53060, "train_runtime": 516796.3658, "train_tokens_per_second": 29198.916 }, { "epoch": 1.8777219282319821, "grad_norm": 1.484375, "learning_rate": 1.9909576942350416e-05, "loss": 1.0618062973022462, "num_input_tokens_seen": 15092741632, "step": 53070, "train_runtime": 516896.2887, "train_tokens_per_second": 29198.781 }, { "epoch": 1.8780757484957111, "grad_norm": 1.6171875, "learning_rate": 1.9907998733590127e-05, "loss": 1.039078140258789, "num_input_tokens_seen": 15095558784, "step": 53080, "train_runtime": 516991.705, "train_tokens_per_second": 29198.841 }, { "epoch": 1.8784295687594397, "grad_norm": 1.484375, "learning_rate": 1.9906420900078614e-05, "loss": 1.0455076217651367, "num_input_tokens_seen": 15098389696, "step": 53090, "train_runtime": 517086.6485, "train_tokens_per_second": 29198.955 }, { "epoch": 1.8787833890231687, "grad_norm": 1.6171875, "learning_rate": 1.9904843441667184e-05, "loss": 1.044952964782715, "num_input_tokens_seen": 15101230144, "step": 53100, "train_runtime": 517186.691, "train_tokens_per_second": 29198.799 }, { "epoch": 1.8791372092868974, "grad_norm": 1.6015625, "learning_rate": 1.990326635820725e-05, "loss": 1.0527901649475098, "num_input_tokens_seen": 15104124416, "step": 53110, "train_runtime": 517285.0234, "train_tokens_per_second": 29198.843 }, { "epoch": 1.8794910295506262, "grad_norm": 1.515625, "learning_rate": 1.9901689649550285e-05, "loss": 1.038181972503662, "num_input_tokens_seen": 15106953216, "step": 53120, "train_runtime": 517381.4692, "train_tokens_per_second": 29198.868 }, { "epoch": 1.879844849814355, "grad_norm": 1.546875, "learning_rate": 1.9900113315547862e-05, "loss": 1.0390201568603517, "num_input_tokens_seen": 15109785728, "step": 53130, "train_runtime": 517477.6137, "train_tokens_per_second": 29198.917 }, { "epoch": 1.8801986700780837, "grad_norm": 1.5390625, "learning_rate": 1.9898537356051635e-05, "loss": 1.0423640251159667, "num_input_tokens_seen": 15112611712, "step": 53140, "train_runtime": 517576.8188, "train_tokens_per_second": 29198.78 }, { "epoch": 1.8805524903418125, "grad_norm": 1.6640625, "learning_rate": 1.9896961770913325e-05, "loss": 1.0438544273376464, "num_input_tokens_seen": 15115498368, "step": 53150, "train_runtime": 517679.5134, "train_tokens_per_second": 29198.564 }, { "epoch": 1.8809063106055413, "grad_norm": 1.578125, "learning_rate": 1.989538655998475e-05, "loss": 1.0327787399291992, "num_input_tokens_seen": 15118345792, "step": 53160, "train_runtime": 517778.4665, "train_tokens_per_second": 29198.483 }, { "epoch": 1.88126013086927, "grad_norm": 1.609375, "learning_rate": 1.989381172311781e-05, "loss": 1.031819725036621, "num_input_tokens_seen": 15121195328, "step": 53170, "train_runtime": 517873.3254, "train_tokens_per_second": 29198.637 }, { "epoch": 1.8816139511329988, "grad_norm": 1.5390625, "learning_rate": 1.9892237260164473e-05, "loss": 1.041791820526123, "num_input_tokens_seen": 15123988544, "step": 53180, "train_runtime": 517967.9132, "train_tokens_per_second": 29198.698 }, { "epoch": 1.8819677713967276, "grad_norm": 1.5390625, "learning_rate": 1.9890663170976807e-05, "loss": 1.0493701934814452, "num_input_tokens_seen": 15126827200, "step": 53190, "train_runtime": 518063.8658, "train_tokens_per_second": 29198.769 }, { "epoch": 1.8823215916604563, "grad_norm": 1.5546875, "learning_rate": 1.9889089455406948e-05, "loss": 1.043891716003418, "num_input_tokens_seen": 15129682240, "step": 53200, "train_runtime": 518159.7581, "train_tokens_per_second": 29198.875 }, { "epoch": 1.8826754119241853, "grad_norm": 1.5625, "learning_rate": 1.9887516113307126e-05, "loss": 1.0514963150024415, "num_input_tokens_seen": 15132541760, "step": 53210, "train_runtime": 518257.9663, "train_tokens_per_second": 29198.86 }, { "epoch": 1.8830292321879138, "grad_norm": 1.5625, "learning_rate": 1.9885943144529635e-05, "loss": 1.0334545135498048, "num_input_tokens_seen": 15135366592, "step": 53220, "train_runtime": 518353.1064, "train_tokens_per_second": 29198.95 }, { "epoch": 1.8833830524516428, "grad_norm": 1.609375, "learning_rate": 1.9884370548926874e-05, "loss": 1.0295021057128906, "num_input_tokens_seen": 15138289152, "step": 53230, "train_runtime": 518453.5214, "train_tokens_per_second": 29198.932 }, { "epoch": 1.8837368727153714, "grad_norm": 1.53125, "learning_rate": 1.9882798326351305e-05, "loss": 1.0414121627807618, "num_input_tokens_seen": 15141172672, "step": 53240, "train_runtime": 518554.6762, "train_tokens_per_second": 29198.797 }, { "epoch": 1.8840906929791004, "grad_norm": 1.578125, "learning_rate": 1.9881226476655475e-05, "loss": 1.0378078460693358, "num_input_tokens_seen": 15144026176, "step": 53250, "train_runtime": 518651.7549, "train_tokens_per_second": 29198.833 }, { "epoch": 1.884444513242829, "grad_norm": 1.5234375, "learning_rate": 1.9879654999692028e-05, "loss": 1.0480581283569337, "num_input_tokens_seen": 15146872384, "step": 53260, "train_runtime": 518752.6084, "train_tokens_per_second": 29198.643 }, { "epoch": 1.884798333506558, "grad_norm": 1.6171875, "learning_rate": 1.987808389531366e-05, "loss": 1.0405941009521484, "num_input_tokens_seen": 15149702272, "step": 53270, "train_runtime": 518850.0919, "train_tokens_per_second": 29198.612 }, { "epoch": 1.8851521537702867, "grad_norm": 1.5625, "learning_rate": 1.987651316337318e-05, "loss": 1.0401514053344727, "num_input_tokens_seen": 15152548288, "step": 53280, "train_runtime": 518947.6243, "train_tokens_per_second": 29198.608 }, { "epoch": 1.8855059740340154, "grad_norm": 1.5546875, "learning_rate": 1.9874942803723465e-05, "loss": 1.0519044876098633, "num_input_tokens_seen": 15155368576, "step": 53290, "train_runtime": 519040.4972, "train_tokens_per_second": 29198.817 }, { "epoch": 1.8858597942977442, "grad_norm": 1.5390625, "learning_rate": 1.987337281621746e-05, "loss": 1.0356197357177734, "num_input_tokens_seen": 15158285760, "step": 53300, "train_runtime": 519138.1145, "train_tokens_per_second": 29198.946 }, { "epoch": 1.886213614561473, "grad_norm": 1.5546875, "learning_rate": 1.9871803200708214e-05, "loss": 1.0419928550720214, "num_input_tokens_seen": 15161112320, "step": 53310, "train_runtime": 519231.2866, "train_tokens_per_second": 29199.15 }, { "epoch": 1.8865674348252017, "grad_norm": 1.5625, "learning_rate": 1.9870233957048844e-05, "loss": 1.0307758331298829, "num_input_tokens_seen": 15163967936, "step": 53320, "train_runtime": 519328.7672, "train_tokens_per_second": 29199.168 }, { "epoch": 1.8869212550889305, "grad_norm": 1.5, "learning_rate": 1.9868665085092556e-05, "loss": 1.0403764724731446, "num_input_tokens_seen": 15166826496, "step": 53330, "train_runtime": 519427.3639, "train_tokens_per_second": 29199.129 }, { "epoch": 1.8872750753526593, "grad_norm": 1.5859375, "learning_rate": 1.9867096584692624e-05, "loss": 1.042405891418457, "num_input_tokens_seen": 15169662656, "step": 53340, "train_runtime": 519523.3621, "train_tokens_per_second": 29199.192 }, { "epoch": 1.887628895616388, "grad_norm": 1.6328125, "learning_rate": 1.9865528455702416e-05, "loss": 1.0508646965026855, "num_input_tokens_seen": 15172499712, "step": 53350, "train_runtime": 519621.0718, "train_tokens_per_second": 29199.162 }, { "epoch": 1.887982715880117, "grad_norm": 1.546875, "learning_rate": 1.9863960697975378e-05, "loss": 1.0372345924377442, "num_input_tokens_seen": 15175370112, "step": 53360, "train_runtime": 519720.6627, "train_tokens_per_second": 29199.089 }, { "epoch": 1.8883365361438456, "grad_norm": 1.5234375, "learning_rate": 1.986239331136503e-05, "loss": 1.0476030349731444, "num_input_tokens_seen": 15178147008, "step": 53370, "train_runtime": 519813.0948, "train_tokens_per_second": 29199.239 }, { "epoch": 1.8886903564075745, "grad_norm": 1.59375, "learning_rate": 1.9860826295724985e-05, "loss": 1.026973819732666, "num_input_tokens_seen": 15181014080, "step": 53380, "train_runtime": 519915.1026, "train_tokens_per_second": 29199.025 }, { "epoch": 1.889044176671303, "grad_norm": 1.53125, "learning_rate": 1.985925965090893e-05, "loss": 1.0540546417236327, "num_input_tokens_seen": 15183882944, "step": 53390, "train_runtime": 520012.9325, "train_tokens_per_second": 29199.049 }, { "epoch": 1.889397996935032, "grad_norm": 1.609375, "learning_rate": 1.9857693376770625e-05, "loss": 1.050197219848633, "num_input_tokens_seen": 15186685824, "step": 53400, "train_runtime": 520108.8119, "train_tokens_per_second": 29199.055 }, { "epoch": 1.8897518171987606, "grad_norm": 1.5546875, "learning_rate": 1.9856127473163922e-05, "loss": 1.049802017211914, "num_input_tokens_seen": 15189505536, "step": 53410, "train_runtime": 520203.7912, "train_tokens_per_second": 29199.144 }, { "epoch": 1.8901056374624896, "grad_norm": 1.5625, "learning_rate": 1.9854561939942756e-05, "loss": 1.032862091064453, "num_input_tokens_seen": 15192307968, "step": 53420, "train_runtime": 520300.9281, "train_tokens_per_second": 29199.079 }, { "epoch": 1.8904594577262182, "grad_norm": 1.5625, "learning_rate": 1.985299677696113e-05, "loss": 1.0359228134155274, "num_input_tokens_seen": 15195184448, "step": 53430, "train_runtime": 520398.7095, "train_tokens_per_second": 29199.12 }, { "epoch": 1.8908132779899471, "grad_norm": 1.546875, "learning_rate": 1.9851431984073143e-05, "loss": 1.0315203666687012, "num_input_tokens_seen": 15198006784, "step": 53440, "train_runtime": 520493.2648, "train_tokens_per_second": 29199.238 }, { "epoch": 1.891167098253676, "grad_norm": 1.640625, "learning_rate": 1.9849867561132955e-05, "loss": 1.0527069091796875, "num_input_tokens_seen": 15200875904, "step": 53450, "train_runtime": 520590.3136, "train_tokens_per_second": 29199.306 }, { "epoch": 1.8915209185174047, "grad_norm": 1.578125, "learning_rate": 1.9848303507994826e-05, "loss": 1.0399028778076171, "num_input_tokens_seen": 15203784192, "step": 53460, "train_runtime": 520692.5356, "train_tokens_per_second": 29199.159 }, { "epoch": 1.8918747387811334, "grad_norm": 1.5625, "learning_rate": 1.9846739824513087e-05, "loss": 1.0577550888061524, "num_input_tokens_seen": 15206600512, "step": 53470, "train_runtime": 520786.9983, "train_tokens_per_second": 29199.271 }, { "epoch": 1.8922285590448622, "grad_norm": 1.578125, "learning_rate": 1.9845176510542145e-05, "loss": 1.0266995429992676, "num_input_tokens_seen": 15209420352, "step": 53480, "train_runtime": 520881.8668, "train_tokens_per_second": 29199.366 }, { "epoch": 1.892582379308591, "grad_norm": 1.5390625, "learning_rate": 1.9843613565936495e-05, "loss": 1.0459341049194335, "num_input_tokens_seen": 15212237376, "step": 53490, "train_runtime": 520977.2835, "train_tokens_per_second": 29199.425 }, { "epoch": 1.8929361995723197, "grad_norm": 1.5390625, "learning_rate": 1.9842050990550707e-05, "loss": 1.031562900543213, "num_input_tokens_seen": 15215105664, "step": 53500, "train_runtime": 521076.1249, "train_tokens_per_second": 29199.391 }, { "epoch": 1.8932900198360485, "grad_norm": 1.546875, "learning_rate": 1.9840488784239442e-05, "loss": 1.0388352394104003, "num_input_tokens_seen": 15217921088, "step": 53510, "train_runtime": 521170.3275, "train_tokens_per_second": 29199.516 }, { "epoch": 1.8936438400997773, "grad_norm": 1.5859375, "learning_rate": 1.983892694685743e-05, "loss": 1.0502792358398438, "num_input_tokens_seen": 15220754240, "step": 53520, "train_runtime": 521267.1786, "train_tokens_per_second": 29199.525 }, { "epoch": 1.8939976603635063, "grad_norm": 1.609375, "learning_rate": 1.983736547825947e-05, "loss": 1.0360902786254882, "num_input_tokens_seen": 15223586240, "step": 53530, "train_runtime": 521363.5944, "train_tokens_per_second": 29199.557 }, { "epoch": 1.8943514806272348, "grad_norm": 1.546875, "learning_rate": 1.983580437830047e-05, "loss": 1.0490608215332031, "num_input_tokens_seen": 15226450176, "step": 53540, "train_runtime": 521461.5897, "train_tokens_per_second": 29199.562 }, { "epoch": 1.8947053008909638, "grad_norm": 1.5390625, "learning_rate": 1.9834243646835407e-05, "loss": 1.0239006996154785, "num_input_tokens_seen": 15229264320, "step": 53550, "train_runtime": 521557.3554, "train_tokens_per_second": 29199.596 }, { "epoch": 1.8950591211546923, "grad_norm": 1.5625, "learning_rate": 1.9832683283719318e-05, "loss": 1.0635089874267578, "num_input_tokens_seen": 15232128128, "step": 53560, "train_runtime": 521658.1878, "train_tokens_per_second": 29199.442 }, { "epoch": 1.8954129414184213, "grad_norm": 1.484375, "learning_rate": 1.9831123288807342e-05, "loss": 1.0329875946044922, "num_input_tokens_seen": 15234941632, "step": 53570, "train_runtime": 521755.8698, "train_tokens_per_second": 29199.368 }, { "epoch": 1.8957667616821499, "grad_norm": 1.5703125, "learning_rate": 1.9829563661954696e-05, "loss": 1.02885160446167, "num_input_tokens_seen": 15237821568, "step": 53580, "train_runtime": 521857.0135, "train_tokens_per_second": 29199.227 }, { "epoch": 1.8961205819458788, "grad_norm": 1.5625, "learning_rate": 1.9828004403016665e-05, "loss": 1.0391828536987304, "num_input_tokens_seen": 15240696384, "step": 53590, "train_runtime": 521955.9789, "train_tokens_per_second": 29199.199 }, { "epoch": 1.8964744022096074, "grad_norm": 1.5625, "learning_rate": 1.9826445511848627e-05, "loss": 1.060126781463623, "num_input_tokens_seen": 15243539328, "step": 53600, "train_runtime": 522051.0271, "train_tokens_per_second": 29199.328 }, { "epoch": 1.8968282224733364, "grad_norm": 1.5625, "learning_rate": 1.9824886988306024e-05, "loss": 1.0260886192321776, "num_input_tokens_seen": 15246413888, "step": 53610, "train_runtime": 522148.9507, "train_tokens_per_second": 29199.358 }, { "epoch": 1.8971820427370651, "grad_norm": 1.5625, "learning_rate": 1.9823328832244396e-05, "loss": 1.039914608001709, "num_input_tokens_seen": 15249245376, "step": 53620, "train_runtime": 522246.9005, "train_tokens_per_second": 29199.303 }, { "epoch": 1.897535863000794, "grad_norm": 1.546875, "learning_rate": 1.9821771043519348e-05, "loss": 1.041110897064209, "num_input_tokens_seen": 15252124224, "step": 53630, "train_runtime": 522346.4513, "train_tokens_per_second": 29199.249 }, { "epoch": 1.8978896832645227, "grad_norm": 1.578125, "learning_rate": 1.9820213621986572e-05, "loss": 1.0495532035827637, "num_input_tokens_seen": 15254925440, "step": 53640, "train_runtime": 522440.3372, "train_tokens_per_second": 29199.364 }, { "epoch": 1.8982435035282514, "grad_norm": 1.625, "learning_rate": 1.9818656567501832e-05, "loss": 1.037358283996582, "num_input_tokens_seen": 15257742528, "step": 53650, "train_runtime": 522537.3361, "train_tokens_per_second": 29199.335 }, { "epoch": 1.8985973237919802, "grad_norm": 1.5625, "learning_rate": 1.9817099879920984e-05, "loss": 1.0442892074584962, "num_input_tokens_seen": 15260600320, "step": 53660, "train_runtime": 522634.9213, "train_tokens_per_second": 29199.351 }, { "epoch": 1.898951144055709, "grad_norm": 1.5625, "learning_rate": 1.981554355909995e-05, "loss": 1.046921157836914, "num_input_tokens_seen": 15263387648, "step": 53670, "train_runtime": 522730.0105, "train_tokens_per_second": 29199.371 }, { "epoch": 1.8993049643194377, "grad_norm": 1.546875, "learning_rate": 1.9813987604894733e-05, "loss": 1.0375445365905762, "num_input_tokens_seen": 15266260160, "step": 53680, "train_runtime": 522830.4441, "train_tokens_per_second": 29199.256 }, { "epoch": 1.8996587845831665, "grad_norm": 1.6015625, "learning_rate": 1.981243201716143e-05, "loss": 1.0256319999694825, "num_input_tokens_seen": 15269102656, "step": 53690, "train_runtime": 522928.4416, "train_tokens_per_second": 29199.22 }, { "epoch": 1.9000126048468955, "grad_norm": 1.546875, "learning_rate": 1.98108767957562e-05, "loss": 1.0496192932128907, "num_input_tokens_seen": 15271902464, "step": 53700, "train_runtime": 523020.8395, "train_tokens_per_second": 29199.415 }, { "epoch": 1.900366425110624, "grad_norm": 1.5703125, "learning_rate": 1.9809321940535282e-05, "loss": 1.0359999656677246, "num_input_tokens_seen": 15274761856, "step": 53710, "train_runtime": 523119.2567, "train_tokens_per_second": 29199.387 }, { "epoch": 1.900720245374353, "grad_norm": 1.5390625, "learning_rate": 1.9807767451355004e-05, "loss": 1.0280059814453124, "num_input_tokens_seen": 15277596800, "step": 53720, "train_runtime": 523215.2255, "train_tokens_per_second": 29199.45 }, { "epoch": 1.9010740656380816, "grad_norm": 1.609375, "learning_rate": 1.9806213328071767e-05, "loss": 1.0353303909301759, "num_input_tokens_seen": 15280457344, "step": 53730, "train_runtime": 523311.9963, "train_tokens_per_second": 29199.517 }, { "epoch": 1.9014278859018106, "grad_norm": 1.640625, "learning_rate": 1.980465957054205e-05, "loss": 1.0233169555664063, "num_input_tokens_seen": 15283255808, "step": 53740, "train_runtime": 523408.078, "train_tokens_per_second": 29199.503 }, { "epoch": 1.901781706165539, "grad_norm": 1.609375, "learning_rate": 1.980310617862242e-05, "loss": 1.0535359382629395, "num_input_tokens_seen": 15286074816, "step": 53750, "train_runtime": 523506.028, "train_tokens_per_second": 29199.425 }, { "epoch": 1.902135526429268, "grad_norm": 1.6171875, "learning_rate": 1.98015531521695e-05, "loss": 1.0434648513793945, "num_input_tokens_seen": 15288933504, "step": 53760, "train_runtime": 523602.7554, "train_tokens_per_second": 29199.49 }, { "epoch": 1.9024893466929966, "grad_norm": 1.625, "learning_rate": 1.980000049104002e-05, "loss": 1.035345458984375, "num_input_tokens_seen": 15291791680, "step": 53770, "train_runtime": 523701.4095, "train_tokens_per_second": 29199.447 }, { "epoch": 1.9028431669567256, "grad_norm": 1.578125, "learning_rate": 1.979844819509077e-05, "loss": 1.03832950592041, "num_input_tokens_seen": 15294617856, "step": 53780, "train_runtime": 523798.8669, "train_tokens_per_second": 29199.41 }, { "epoch": 1.9031969872204544, "grad_norm": 1.6015625, "learning_rate": 1.979689626417863e-05, "loss": 1.0421913146972657, "num_input_tokens_seen": 15297405056, "step": 53790, "train_runtime": 523892.8754, "train_tokens_per_second": 29199.491 }, { "epoch": 1.9035508074841831, "grad_norm": 1.6171875, "learning_rate": 1.9795344698160537e-05, "loss": 1.0433399200439453, "num_input_tokens_seen": 15300277568, "step": 53800, "train_runtime": 523990.7901, "train_tokens_per_second": 29199.516 }, { "epoch": 1.903904627747912, "grad_norm": 1.578125, "learning_rate": 1.979379349689354e-05, "loss": 1.0185476303100587, "num_input_tokens_seen": 15303062272, "step": 53810, "train_runtime": 524084.3701, "train_tokens_per_second": 29199.616 }, { "epoch": 1.9042584480116407, "grad_norm": 1.5703125, "learning_rate": 1.979224266023474e-05, "loss": 1.0528945922851562, "num_input_tokens_seen": 15305852416, "step": 53820, "train_runtime": 524180.7343, "train_tokens_per_second": 29199.571 }, { "epoch": 1.9046122682753694, "grad_norm": 1.546875, "learning_rate": 1.9790692188041323e-05, "loss": 1.0445027351379395, "num_input_tokens_seen": 15308687872, "step": 53830, "train_runtime": 524276.4618, "train_tokens_per_second": 29199.647 }, { "epoch": 1.9049660885390982, "grad_norm": 1.5625, "learning_rate": 1.9789142080170562e-05, "loss": 1.0530653953552247, "num_input_tokens_seen": 15311520832, "step": 53840, "train_runtime": 524372.1716, "train_tokens_per_second": 29199.72 }, { "epoch": 1.905319908802827, "grad_norm": 1.5625, "learning_rate": 1.9787592336479794e-05, "loss": 1.0464700698852538, "num_input_tokens_seen": 15314368448, "step": 53850, "train_runtime": 524468.5014, "train_tokens_per_second": 29199.787 }, { "epoch": 1.9056737290665557, "grad_norm": 1.6328125, "learning_rate": 1.9786042956826444e-05, "loss": 1.0527534484863281, "num_input_tokens_seen": 15317277248, "step": 53860, "train_runtime": 524570.3946, "train_tokens_per_second": 29199.66 }, { "epoch": 1.9060275493302847, "grad_norm": 1.6015625, "learning_rate": 1.9784493941068015e-05, "loss": 1.0427188873291016, "num_input_tokens_seen": 15320099968, "step": 53870, "train_runtime": 524664.1774, "train_tokens_per_second": 29199.821 }, { "epoch": 1.9063813695940133, "grad_norm": 1.5, "learning_rate": 1.9782945289062085e-05, "loss": 1.0574268341064452, "num_input_tokens_seen": 15322939968, "step": 53880, "train_runtime": 524761.0812, "train_tokens_per_second": 29199.841 }, { "epoch": 1.9067351898577423, "grad_norm": 1.625, "learning_rate": 1.978139700066631e-05, "loss": 1.049966049194336, "num_input_tokens_seen": 15325730816, "step": 53890, "train_runtime": 524853.7516, "train_tokens_per_second": 29200.002 }, { "epoch": 1.9070890101214708, "grad_norm": 1.53125, "learning_rate": 1.977984907573842e-05, "loss": 1.0292572021484374, "num_input_tokens_seen": 15328558592, "step": 53900, "train_runtime": 524949.196, "train_tokens_per_second": 29200.08 }, { "epoch": 1.9074428303851998, "grad_norm": 1.515625, "learning_rate": 1.9778301514136232e-05, "loss": 1.031935214996338, "num_input_tokens_seen": 15331444736, "step": 53910, "train_runtime": 525049.891, "train_tokens_per_second": 29199.977 }, { "epoch": 1.9077966506489283, "grad_norm": 1.5859375, "learning_rate": 1.977675431571764e-05, "loss": 1.0459724426269532, "num_input_tokens_seen": 15334280256, "step": 53920, "train_runtime": 525148.384, "train_tokens_per_second": 29199.9 }, { "epoch": 1.9081504709126573, "grad_norm": 1.5546875, "learning_rate": 1.977520748034061e-05, "loss": 1.0390378952026367, "num_input_tokens_seen": 15337088064, "step": 53930, "train_runtime": 525244.154, "train_tokens_per_second": 29199.921 }, { "epoch": 1.9085042911763859, "grad_norm": 1.5859375, "learning_rate": 1.9773661007863183e-05, "loss": 1.0487327575683594, "num_input_tokens_seen": 15339925120, "step": 53940, "train_runtime": 525343.7616, "train_tokens_per_second": 29199.785 }, { "epoch": 1.9088581114401149, "grad_norm": 1.6171875, "learning_rate": 1.977211489814349e-05, "loss": 1.0404623031616211, "num_input_tokens_seen": 15342791616, "step": 53950, "train_runtime": 525444.0114, "train_tokens_per_second": 29199.67 }, { "epoch": 1.9092119317038436, "grad_norm": 1.5859375, "learning_rate": 1.977056915103973e-05, "loss": 1.0452077865600586, "num_input_tokens_seen": 15345632192, "step": 53960, "train_runtime": 525539.9678, "train_tokens_per_second": 29199.743 }, { "epoch": 1.9095657519675724, "grad_norm": 1.53125, "learning_rate": 1.9769023766410176e-05, "loss": 1.0267130851745605, "num_input_tokens_seen": 15348445056, "step": 53970, "train_runtime": 525637.3096, "train_tokens_per_second": 29199.687 }, { "epoch": 1.9099195722313012, "grad_norm": 1.5703125, "learning_rate": 1.9767478744113192e-05, "loss": 1.0535240173339844, "num_input_tokens_seen": 15351364864, "step": 53980, "train_runtime": 525738.2552, "train_tokens_per_second": 29199.634 }, { "epoch": 1.91027339249503, "grad_norm": 1.5625, "learning_rate": 1.976593408400721e-05, "loss": 1.0603821754455567, "num_input_tokens_seen": 15354176640, "step": 53990, "train_runtime": 525833.4837, "train_tokens_per_second": 29199.694 }, { "epoch": 1.9106272127587587, "grad_norm": 1.625, "learning_rate": 1.976438978595074e-05, "loss": 1.0571113586425782, "num_input_tokens_seen": 15357006080, "step": 54000, "train_runtime": 525929.4374, "train_tokens_per_second": 29199.746 }, { "epoch": 1.9109810330224875, "grad_norm": 1.4140625, "learning_rate": 1.9762845849802375e-05, "loss": 1.0201444625854492, "num_input_tokens_seen": 15359838528, "step": 54010, "train_runtime": 526024.6252, "train_tokens_per_second": 29199.847 }, { "epoch": 1.9113348532862162, "grad_norm": 1.6484375, "learning_rate": 1.9761302275420775e-05, "loss": 1.033356285095215, "num_input_tokens_seen": 15362698240, "step": 54020, "train_runtime": 526122.158, "train_tokens_per_second": 29199.869 }, { "epoch": 1.911688673549945, "grad_norm": 1.5546875, "learning_rate": 1.9759759062664685e-05, "loss": 1.0496872901916503, "num_input_tokens_seen": 15365653056, "step": 54030, "train_runtime": 526227.7252, "train_tokens_per_second": 29199.627 }, { "epoch": 1.912042493813674, "grad_norm": 1.671875, "learning_rate": 1.9758216211392925e-05, "loss": 1.04419002532959, "num_input_tokens_seen": 15368471552, "step": 54040, "train_runtime": 526324.9727, "train_tokens_per_second": 29199.586 }, { "epoch": 1.9123963140774025, "grad_norm": 1.5, "learning_rate": 1.97566737214644e-05, "loss": 1.0562522888183594, "num_input_tokens_seen": 15371287040, "step": 54050, "train_runtime": 526418.7078, "train_tokens_per_second": 29199.736 }, { "epoch": 1.9127501343411315, "grad_norm": 1.5859375, "learning_rate": 1.9755131592738073e-05, "loss": 1.0433542251586914, "num_input_tokens_seen": 15374138880, "step": 54060, "train_runtime": 526516.3015, "train_tokens_per_second": 29199.74 }, { "epoch": 1.91310395460486, "grad_norm": 1.53125, "learning_rate": 1.9753589825073005e-05, "loss": 1.0321563720703124, "num_input_tokens_seen": 15376968384, "step": 54070, "train_runtime": 526610.0617, "train_tokens_per_second": 29199.914 }, { "epoch": 1.913457774868589, "grad_norm": 1.546875, "learning_rate": 1.975204841832832e-05, "loss": 1.0385703086853026, "num_input_tokens_seen": 15379848192, "step": 54080, "train_runtime": 526708.8071, "train_tokens_per_second": 29199.907 }, { "epoch": 1.9138115951323176, "grad_norm": 1.5859375, "learning_rate": 1.9750507372363228e-05, "loss": 1.0447673797607422, "num_input_tokens_seen": 15382733440, "step": 54090, "train_runtime": 526806.7673, "train_tokens_per_second": 29199.954 }, { "epoch": 1.9141654153960466, "grad_norm": 1.5625, "learning_rate": 1.9748966687037003e-05, "loss": 1.0399428367614747, "num_input_tokens_seen": 15385608064, "step": 54100, "train_runtime": 526907.595, "train_tokens_per_second": 29199.822 }, { "epoch": 1.9145192356597753, "grad_norm": 1.578125, "learning_rate": 1.974742636220902e-05, "loss": 1.036163902282715, "num_input_tokens_seen": 15388443712, "step": 54110, "train_runtime": 527004.8683, "train_tokens_per_second": 29199.813 }, { "epoch": 1.914873055923504, "grad_norm": 1.5859375, "learning_rate": 1.97458863977387e-05, "loss": 1.0516206741333007, "num_input_tokens_seen": 15391288576, "step": 54120, "train_runtime": 527099.9639, "train_tokens_per_second": 29199.942 }, { "epoch": 1.9152268761872329, "grad_norm": 1.5625, "learning_rate": 1.9744346793485567e-05, "loss": 1.0406282424926758, "num_input_tokens_seen": 15394125504, "step": 54130, "train_runtime": 527195.6601, "train_tokens_per_second": 29200.023 }, { "epoch": 1.9155806964509616, "grad_norm": 1.578125, "learning_rate": 1.97428075493092e-05, "loss": 1.0409584045410156, "num_input_tokens_seen": 15396968256, "step": 54140, "train_runtime": 527294.3409, "train_tokens_per_second": 29199.95 }, { "epoch": 1.9159345167146904, "grad_norm": 1.6171875, "learning_rate": 1.9741268665069273e-05, "loss": 1.049799346923828, "num_input_tokens_seen": 15399818176, "step": 54150, "train_runtime": 527390.1053, "train_tokens_per_second": 29200.051 }, { "epoch": 1.9162883369784192, "grad_norm": 1.6015625, "learning_rate": 1.9739730140625527e-05, "loss": 1.037711238861084, "num_input_tokens_seen": 15402693504, "step": 54160, "train_runtime": 527488.3814, "train_tokens_per_second": 29200.062 }, { "epoch": 1.916642157242148, "grad_norm": 1.53125, "learning_rate": 1.9738191975837777e-05, "loss": 1.0408974647521974, "num_input_tokens_seen": 15405510592, "step": 54170, "train_runtime": 527583.3279, "train_tokens_per_second": 29200.147 }, { "epoch": 1.9169959775058767, "grad_norm": 1.6484375, "learning_rate": 1.9736654170565928e-05, "loss": 1.0330016136169433, "num_input_tokens_seen": 15408342016, "step": 54180, "train_runtime": 527679.6672, "train_tokens_per_second": 29200.181 }, { "epoch": 1.9173497977696055, "grad_norm": 1.546875, "learning_rate": 1.9735116724669948e-05, "loss": 1.0335532188415528, "num_input_tokens_seen": 15411184448, "step": 54190, "train_runtime": 527779.5017, "train_tokens_per_second": 29200.044 }, { "epoch": 1.9177036180333342, "grad_norm": 1.5546875, "learning_rate": 1.9733579638009878e-05, "loss": 1.0513883590698243, "num_input_tokens_seen": 15414026560, "step": 54200, "train_runtime": 527875.6176, "train_tokens_per_second": 29200.111 }, { "epoch": 1.9180574382970632, "grad_norm": 1.6640625, "learning_rate": 1.973204291044585e-05, "loss": 1.0368818283081054, "num_input_tokens_seen": 15416833152, "step": 54210, "train_runtime": 527970.2881, "train_tokens_per_second": 29200.191 }, { "epoch": 1.9184112585607918, "grad_norm": 1.6015625, "learning_rate": 1.973050654183807e-05, "loss": 1.0405729293823243, "num_input_tokens_seen": 15419706752, "step": 54220, "train_runtime": 528069.3507, "train_tokens_per_second": 29200.155 }, { "epoch": 1.9187650788245207, "grad_norm": 1.6484375, "learning_rate": 1.97289705320468e-05, "loss": 1.041118049621582, "num_input_tokens_seen": 15422575872, "step": 54230, "train_runtime": 528166.6873, "train_tokens_per_second": 29200.206 }, { "epoch": 1.9191188990882493, "grad_norm": 1.515625, "learning_rate": 1.9727434880932412e-05, "loss": 1.0453954696655274, "num_input_tokens_seen": 15425396160, "step": 54240, "train_runtime": 528264.8222, "train_tokens_per_second": 29200.12 }, { "epoch": 1.9194727193519783, "grad_norm": 1.59375, "learning_rate": 1.972589958835532e-05, "loss": 1.0476540565490722, "num_input_tokens_seen": 15428272832, "step": 54250, "train_runtime": 528364.7472, "train_tokens_per_second": 29200.042 }, { "epoch": 1.9198265396157068, "grad_norm": 1.6171875, "learning_rate": 1.9724364654176036e-05, "loss": 1.0476078987121582, "num_input_tokens_seen": 15431049664, "step": 54260, "train_runtime": 528458.1459, "train_tokens_per_second": 29200.136 }, { "epoch": 1.9201803598794358, "grad_norm": 1.6640625, "learning_rate": 1.9722830078255144e-05, "loss": 1.050948715209961, "num_input_tokens_seen": 15433842304, "step": 54270, "train_runtime": 528553.3546, "train_tokens_per_second": 29200.16 }, { "epoch": 1.9205341801431646, "grad_norm": 1.53125, "learning_rate": 1.9721295860453297e-05, "loss": 1.0488189697265624, "num_input_tokens_seen": 15436725376, "step": 54280, "train_runtime": 528654.9709, "train_tokens_per_second": 29200.0 }, { "epoch": 1.9208880004068933, "grad_norm": 1.59375, "learning_rate": 1.971976200063123e-05, "loss": 1.0513479232788085, "num_input_tokens_seen": 15439570304, "step": 54290, "train_runtime": 528751.1134, "train_tokens_per_second": 29200.071 }, { "epoch": 1.921241820670622, "grad_norm": 1.5390625, "learning_rate": 1.9718228498649746e-05, "loss": 1.0436861038208007, "num_input_tokens_seen": 15442452736, "step": 54300, "train_runtime": 528853.5105, "train_tokens_per_second": 29199.868 }, { "epoch": 1.9215956409343509, "grad_norm": 1.5859375, "learning_rate": 1.9716695354369742e-05, "loss": 1.0611928939819335, "num_input_tokens_seen": 15445309888, "step": 54310, "train_runtime": 528951.8121, "train_tokens_per_second": 29199.843 }, { "epoch": 1.9219494611980796, "grad_norm": 1.5859375, "learning_rate": 1.9715162567652167e-05, "loss": 1.0502029418945313, "num_input_tokens_seen": 15448118336, "step": 54320, "train_runtime": 529048.528, "train_tokens_per_second": 29199.813 }, { "epoch": 1.9223032814618084, "grad_norm": 1.578125, "learning_rate": 1.9713630138358067e-05, "loss": 1.0395776748657226, "num_input_tokens_seen": 15450951168, "step": 54330, "train_runtime": 529147.3706, "train_tokens_per_second": 29199.713 }, { "epoch": 1.9226571017255372, "grad_norm": 1.6171875, "learning_rate": 1.9712098066348543e-05, "loss": 1.055473804473877, "num_input_tokens_seen": 15453823552, "step": 54340, "train_runtime": 529246.3711, "train_tokens_per_second": 29199.678 }, { "epoch": 1.923010921989266, "grad_norm": 1.6171875, "learning_rate": 1.971056635148479e-05, "loss": 1.0320868492126465, "num_input_tokens_seen": 15456641280, "step": 54350, "train_runtime": 529342.9127, "train_tokens_per_second": 29199.676 }, { "epoch": 1.923364742252995, "grad_norm": 1.5390625, "learning_rate": 1.9709034993628065e-05, "loss": 1.0372796058654785, "num_input_tokens_seen": 15459451392, "step": 54360, "train_runtime": 529438.65, "train_tokens_per_second": 29199.703 }, { "epoch": 1.9237185625167235, "grad_norm": 1.6015625, "learning_rate": 1.9707503992639716e-05, "loss": 1.046279525756836, "num_input_tokens_seen": 15462280512, "step": 54370, "train_runtime": 529535.5227, "train_tokens_per_second": 29199.704 }, { "epoch": 1.9240723827804525, "grad_norm": 1.5703125, "learning_rate": 1.9705973348381145e-05, "loss": 1.0353227615356446, "num_input_tokens_seen": 15465139904, "step": 54380, "train_runtime": 529632.2458, "train_tokens_per_second": 29199.77 }, { "epoch": 1.924426203044181, "grad_norm": 1.5546875, "learning_rate": 1.9704443060713846e-05, "loss": 1.029578971862793, "num_input_tokens_seen": 15467953216, "step": 54390, "train_runtime": 529728.088, "train_tokens_per_second": 29199.798 }, { "epoch": 1.92478002330791, "grad_norm": 1.5546875, "learning_rate": 1.9702913129499384e-05, "loss": 1.056861972808838, "num_input_tokens_seen": 15470823872, "step": 54400, "train_runtime": 529823.2767, "train_tokens_per_second": 29199.97 }, { "epoch": 1.9251338435716385, "grad_norm": 1.59375, "learning_rate": 1.9701383554599397e-05, "loss": 1.0509902954101562, "num_input_tokens_seen": 15473629376, "step": 54410, "train_runtime": 529921.9003, "train_tokens_per_second": 29199.83 }, { "epoch": 1.9254876638353675, "grad_norm": 1.5859375, "learning_rate": 1.9699854335875603e-05, "loss": 1.0375782012939454, "num_input_tokens_seen": 15476444864, "step": 54420, "train_runtime": 530016.9905, "train_tokens_per_second": 29199.903 }, { "epoch": 1.925841484099096, "grad_norm": 1.546875, "learning_rate": 1.9698325473189788e-05, "loss": 1.0370683670043945, "num_input_tokens_seen": 15479297408, "step": 54430, "train_runtime": 530114.1425, "train_tokens_per_second": 29199.933 }, { "epoch": 1.926195304362825, "grad_norm": 1.5859375, "learning_rate": 1.969679696640382e-05, "loss": 1.0302406311035157, "num_input_tokens_seen": 15482150528, "step": 54440, "train_runtime": 530210.5908, "train_tokens_per_second": 29200.002 }, { "epoch": 1.9265491246265538, "grad_norm": 1.59375, "learning_rate": 1.9695268815379634e-05, "loss": 1.02738676071167, "num_input_tokens_seen": 15485021312, "step": 54450, "train_runtime": 530311.4203, "train_tokens_per_second": 29199.864 }, { "epoch": 1.9269029448902826, "grad_norm": 1.640625, "learning_rate": 1.9693741019979244e-05, "loss": 1.0425247192382812, "num_input_tokens_seen": 15487830080, "step": 54460, "train_runtime": 530405.2893, "train_tokens_per_second": 29199.992 }, { "epoch": 1.9272567651540113, "grad_norm": 1.5546875, "learning_rate": 1.9692213580064744e-05, "loss": 1.04449520111084, "num_input_tokens_seen": 15490663424, "step": 54470, "train_runtime": 530505.3813, "train_tokens_per_second": 29199.823 }, { "epoch": 1.92761058541774, "grad_norm": 1.609375, "learning_rate": 1.9690686495498302e-05, "loss": 1.0304500579833984, "num_input_tokens_seen": 15493534464, "step": 54480, "train_runtime": 530604.8153, "train_tokens_per_second": 29199.762 }, { "epoch": 1.9279644056814689, "grad_norm": 1.625, "learning_rate": 1.9689159766142147e-05, "loss": 1.0417848587036134, "num_input_tokens_seen": 15496378368, "step": 54490, "train_runtime": 530701.6709, "train_tokens_per_second": 29199.792 }, { "epoch": 1.9283182259451976, "grad_norm": 1.6328125, "learning_rate": 1.9687633391858605e-05, "loss": 1.0525657653808593, "num_input_tokens_seen": 15499240064, "step": 54500, "train_runtime": 530800.8593, "train_tokens_per_second": 29199.727 }, { "epoch": 1.9286720462089264, "grad_norm": 1.5859375, "learning_rate": 1.9686107372510057e-05, "loss": 1.0589433670043946, "num_input_tokens_seen": 15502129664, "step": 54510, "train_runtime": 530898.5879, "train_tokens_per_second": 29199.794 }, { "epoch": 1.9290258664726552, "grad_norm": 1.6484375, "learning_rate": 1.9684581707958966e-05, "loss": 1.0395743370056152, "num_input_tokens_seen": 15504955584, "step": 54520, "train_runtime": 530994.2147, "train_tokens_per_second": 29199.858 }, { "epoch": 1.9293796867363842, "grad_norm": 1.59375, "learning_rate": 1.9683056398067875e-05, "loss": 1.0612245559692384, "num_input_tokens_seen": 15507822912, "step": 54530, "train_runtime": 531094.5644, "train_tokens_per_second": 29199.739 }, { "epoch": 1.9297335070001127, "grad_norm": 1.5390625, "learning_rate": 1.9681531442699394e-05, "loss": 1.0379860877990723, "num_input_tokens_seen": 15510617088, "step": 54540, "train_runtime": 531191.8027, "train_tokens_per_second": 29199.654 }, { "epoch": 1.9300873272638417, "grad_norm": 1.578125, "learning_rate": 1.9680006841716207e-05, "loss": 1.0390233993530273, "num_input_tokens_seen": 15513424640, "step": 54550, "train_runtime": 531289.7801, "train_tokens_per_second": 29199.554 }, { "epoch": 1.9304411475275702, "grad_norm": 1.515625, "learning_rate": 1.967848259498108e-05, "loss": 1.0409663200378418, "num_input_tokens_seen": 15516254272, "step": 54560, "train_runtime": 531385.5698, "train_tokens_per_second": 29199.615 }, { "epoch": 1.9307949677912992, "grad_norm": 1.59375, "learning_rate": 1.967695870235685e-05, "loss": 1.0425911903381349, "num_input_tokens_seen": 15519045440, "step": 54570, "train_runtime": 531482.8683, "train_tokens_per_second": 29199.521 }, { "epoch": 1.9311487880550278, "grad_norm": 1.6171875, "learning_rate": 1.9675435163706427e-05, "loss": 1.0364057540893554, "num_input_tokens_seen": 15521874368, "step": 54580, "train_runtime": 531577.8382, "train_tokens_per_second": 29199.627 }, { "epoch": 1.9315026083187568, "grad_norm": 1.59375, "learning_rate": 1.967391197889279e-05, "loss": 1.0448822021484374, "num_input_tokens_seen": 15524670592, "step": 54590, "train_runtime": 531671.6045, "train_tokens_per_second": 29199.736 }, { "epoch": 1.9318564285824853, "grad_norm": 1.6015625, "learning_rate": 1.9672389147779e-05, "loss": 1.0451793670654297, "num_input_tokens_seen": 15527475904, "step": 54600, "train_runtime": 531765.824, "train_tokens_per_second": 29199.838 }, { "epoch": 1.9322102488462143, "grad_norm": 1.6015625, "learning_rate": 1.9670866670228194e-05, "loss": 1.0351902008056642, "num_input_tokens_seen": 15530364736, "step": 54610, "train_runtime": 531863.4297, "train_tokens_per_second": 29199.911 }, { "epoch": 1.932564069109943, "grad_norm": 1.59375, "learning_rate": 1.9669344546103576e-05, "loss": 1.0437545776367188, "num_input_tokens_seen": 15533226624, "step": 54620, "train_runtime": 531963.3311, "train_tokens_per_second": 29199.807 }, { "epoch": 1.9329178893736718, "grad_norm": 1.578125, "learning_rate": 1.9667822775268428e-05, "loss": 1.0456543922424317, "num_input_tokens_seen": 15536062208, "step": 54630, "train_runtime": 532057.6358, "train_tokens_per_second": 29199.961 }, { "epoch": 1.9332717096374006, "grad_norm": 1.5859375, "learning_rate": 1.9666301357586107e-05, "loss": 1.0550376892089843, "num_input_tokens_seen": 15538880256, "step": 54640, "train_runtime": 532152.8703, "train_tokens_per_second": 29200.031 }, { "epoch": 1.9336255299011293, "grad_norm": 1.4921875, "learning_rate": 1.9664780292920036e-05, "loss": 1.0527334213256836, "num_input_tokens_seen": 15541767296, "step": 54650, "train_runtime": 532253.1634, "train_tokens_per_second": 29199.953 }, { "epoch": 1.9339793501648581, "grad_norm": 1.640625, "learning_rate": 1.9663259581133726e-05, "loss": 1.039912796020508, "num_input_tokens_seen": 15544632128, "step": 54660, "train_runtime": 532350.7064, "train_tokens_per_second": 29199.984 }, { "epoch": 1.9343331704285869, "grad_norm": 1.546875, "learning_rate": 1.9661739222090753e-05, "loss": 1.0293249130249023, "num_input_tokens_seen": 15547487360, "step": 54670, "train_runtime": 532448.8058, "train_tokens_per_second": 29199.967 }, { "epoch": 1.9346869906923156, "grad_norm": 1.6171875, "learning_rate": 1.966021921565476e-05, "loss": 1.0374914169311524, "num_input_tokens_seen": 15550336384, "step": 54680, "train_runtime": 532546.7905, "train_tokens_per_second": 29199.944 }, { "epoch": 1.9350408109560444, "grad_norm": 1.59375, "learning_rate": 1.965869956168948e-05, "loss": 1.0398994445800782, "num_input_tokens_seen": 15553125504, "step": 54690, "train_runtime": 532639.3779, "train_tokens_per_second": 29200.105 }, { "epoch": 1.9353946312197734, "grad_norm": 1.6171875, "learning_rate": 1.965718026005871e-05, "loss": 1.0417970657348632, "num_input_tokens_seen": 15555997760, "step": 54700, "train_runtime": 532737.1151, "train_tokens_per_second": 29200.139 }, { "epoch": 1.935748451483502, "grad_norm": 1.5546875, "learning_rate": 1.9655661310626317e-05, "loss": 1.045709991455078, "num_input_tokens_seen": 15558850560, "step": 54710, "train_runtime": 532835.0994, "train_tokens_per_second": 29200.123 }, { "epoch": 1.936102271747231, "grad_norm": 1.5078125, "learning_rate": 1.965414271325625e-05, "loss": 1.0322181701660156, "num_input_tokens_seen": 15561740672, "step": 54720, "train_runtime": 532933.5401, "train_tokens_per_second": 29200.153 }, { "epoch": 1.9364560920109595, "grad_norm": 1.609375, "learning_rate": 1.9652624467812534e-05, "loss": 1.048725414276123, "num_input_tokens_seen": 15564547840, "step": 54730, "train_runtime": 533029.1909, "train_tokens_per_second": 29200.179 }, { "epoch": 1.9368099122746885, "grad_norm": 1.5703125, "learning_rate": 1.965110657415925e-05, "loss": 1.0480867385864259, "num_input_tokens_seen": 15567381760, "step": 54740, "train_runtime": 533124.1841, "train_tokens_per_second": 29200.292 }, { "epoch": 1.937163732538417, "grad_norm": 1.5546875, "learning_rate": 1.9649589032160576e-05, "loss": 1.0289634704589843, "num_input_tokens_seen": 15570193216, "step": 54750, "train_runtime": 533219.1935, "train_tokens_per_second": 29200.362 }, { "epoch": 1.937517552802146, "grad_norm": 1.6015625, "learning_rate": 1.9648071841680746e-05, "loss": 1.0393794059753418, "num_input_tokens_seen": 15573023872, "step": 54760, "train_runtime": 533315.0343, "train_tokens_per_second": 29200.422 }, { "epoch": 1.9378713730658745, "grad_norm": 1.609375, "learning_rate": 1.964655500258407e-05, "loss": 1.029646873474121, "num_input_tokens_seen": 15575857152, "step": 54770, "train_runtime": 533410.6613, "train_tokens_per_second": 29200.498 }, { "epoch": 1.9382251933296035, "grad_norm": 1.609375, "learning_rate": 1.964503851473494e-05, "loss": 1.0473951339721679, "num_input_tokens_seen": 15578714112, "step": 54780, "train_runtime": 533511.6268, "train_tokens_per_second": 29200.327 }, { "epoch": 1.9385790135933323, "grad_norm": 1.546875, "learning_rate": 1.9643522377997807e-05, "loss": 1.0294897079467773, "num_input_tokens_seen": 15581578688, "step": 54790, "train_runtime": 533612.7742, "train_tokens_per_second": 29200.161 }, { "epoch": 1.938932833857061, "grad_norm": 1.546875, "learning_rate": 1.9642006592237216e-05, "loss": 1.0482364654541017, "num_input_tokens_seen": 15584446336, "step": 54800, "train_runtime": 533716.7361, "train_tokens_per_second": 29199.846 }, { "epoch": 1.9392866541207898, "grad_norm": 1.5625, "learning_rate": 1.9640491157317767e-05, "loss": 1.0503828048706054, "num_input_tokens_seen": 15587297472, "step": 54810, "train_runtime": 533814.4477, "train_tokens_per_second": 29199.842 }, { "epoch": 1.9396404743845186, "grad_norm": 1.5546875, "learning_rate": 1.9638976073104138e-05, "loss": 1.0451245307922363, "num_input_tokens_seen": 15590176064, "step": 54820, "train_runtime": 533916.127, "train_tokens_per_second": 29199.673 }, { "epoch": 1.9399942946482474, "grad_norm": 1.609375, "learning_rate": 1.9637461339461084e-05, "loss": 1.0450533866882323, "num_input_tokens_seen": 15593021568, "step": 54830, "train_runtime": 534014.5382, "train_tokens_per_second": 29199.62 }, { "epoch": 1.9403481149119761, "grad_norm": 1.5625, "learning_rate": 1.9635946956253426e-05, "loss": 1.0469465255737305, "num_input_tokens_seen": 15595863488, "step": 54840, "train_runtime": 534111.7495, "train_tokens_per_second": 29199.626 }, { "epoch": 1.9407019351757049, "grad_norm": 1.5390625, "learning_rate": 1.9634432923346063e-05, "loss": 1.0235488891601563, "num_input_tokens_seen": 15598663552, "step": 54850, "train_runtime": 534206.8058, "train_tokens_per_second": 29199.672 }, { "epoch": 1.9410557554394336, "grad_norm": 1.6015625, "learning_rate": 1.963291924060397e-05, "loss": 1.0349287033081054, "num_input_tokens_seen": 15601518336, "step": 54860, "train_runtime": 534306.1896, "train_tokens_per_second": 29199.584 }, { "epoch": 1.9414095757031626, "grad_norm": 1.6171875, "learning_rate": 1.963140590789219e-05, "loss": 1.0345143318176269, "num_input_tokens_seen": 15604354688, "step": 54870, "train_runtime": 534401.8732, "train_tokens_per_second": 29199.663 }, { "epoch": 1.9417633959668912, "grad_norm": 1.609375, "learning_rate": 1.9629892925075834e-05, "loss": 1.0430522918701173, "num_input_tokens_seen": 15607185728, "step": 54880, "train_runtime": 534498.5598, "train_tokens_per_second": 29199.678 }, { "epoch": 1.9421172162306202, "grad_norm": 1.609375, "learning_rate": 1.9628380292020093e-05, "loss": 1.0457717895507812, "num_input_tokens_seen": 15609983744, "step": 54890, "train_runtime": 534592.0577, "train_tokens_per_second": 29199.805 }, { "epoch": 1.9424710364943487, "grad_norm": 1.5390625, "learning_rate": 1.9626868008590238e-05, "loss": 1.0413256645202638, "num_input_tokens_seen": 15612857152, "step": 54900, "train_runtime": 534690.5749, "train_tokens_per_second": 29199.799 }, { "epoch": 1.9428248567580777, "grad_norm": 1.6328125, "learning_rate": 1.9625356074651595e-05, "loss": 1.0460908889770508, "num_input_tokens_seen": 15615759808, "step": 54910, "train_runtime": 534790.8535, "train_tokens_per_second": 29199.751 }, { "epoch": 1.9431786770218062, "grad_norm": 1.5703125, "learning_rate": 1.9623844490069577e-05, "loss": 1.0443761825561524, "num_input_tokens_seen": 15618584640, "step": 54920, "train_runtime": 534886.3594, "train_tokens_per_second": 29199.819 }, { "epoch": 1.9435324972855352, "grad_norm": 1.6640625, "learning_rate": 1.9622333254709655e-05, "loss": 1.0493027687072753, "num_input_tokens_seen": 15621465664, "step": 54930, "train_runtime": 534985.6484, "train_tokens_per_second": 29199.785 }, { "epoch": 1.943886317549264, "grad_norm": 1.609375, "learning_rate": 1.9620822368437388e-05, "loss": 1.0479966163635255, "num_input_tokens_seen": 15624342592, "step": 54940, "train_runtime": 535084.5082, "train_tokens_per_second": 29199.766 }, { "epoch": 1.9442401378129928, "grad_norm": 1.5859375, "learning_rate": 1.9619311831118405e-05, "loss": 1.0443848609924316, "num_input_tokens_seen": 15627171520, "step": 54950, "train_runtime": 535181.5305, "train_tokens_per_second": 29199.759 }, { "epoch": 1.9445939580767215, "grad_norm": 1.609375, "learning_rate": 1.961780164261839e-05, "loss": 1.0547679901123046, "num_input_tokens_seen": 15629987008, "step": 54960, "train_runtime": 535276.2349, "train_tokens_per_second": 29199.852 }, { "epoch": 1.9449477783404503, "grad_norm": 1.5703125, "learning_rate": 1.961629180280313e-05, "loss": 1.0513189315795899, "num_input_tokens_seen": 15632884096, "step": 54970, "train_runtime": 535379.0372, "train_tokens_per_second": 29199.657 }, { "epoch": 1.945301598604179, "grad_norm": 1.59375, "learning_rate": 1.9614782311538455e-05, "loss": 1.0418792724609376, "num_input_tokens_seen": 15635758080, "step": 54980, "train_runtime": 535476.3452, "train_tokens_per_second": 29199.718 }, { "epoch": 1.9456554188679078, "grad_norm": 1.6484375, "learning_rate": 1.9613273168690278e-05, "loss": 1.0422185897827148, "num_input_tokens_seen": 15638642944, "step": 54990, "train_runtime": 535574.2466, "train_tokens_per_second": 29199.766 }, { "epoch": 1.9460092391316366, "grad_norm": 1.515625, "learning_rate": 1.9611764374124592e-05, "loss": 1.0568193435668944, "num_input_tokens_seen": 15641534336, "step": 55000, "train_runtime": 535675.691, "train_tokens_per_second": 29199.634 }, { "epoch": 1.9460092391316366, "eval_loss": 1.0222429037094116, "eval_runtime": 8.4352, "eval_samples_per_second": 472.781, "eval_steps_per_second": 3.794, "num_input_tokens_seen": 15641534336, "step": 55000 }, { "epoch": 1.9463630593953654, "grad_norm": 1.515625, "learning_rate": 1.9610255927707456e-05, "loss": 1.0446903228759765, "num_input_tokens_seen": 15644404544, "step": 55010, "train_runtime": 535803.417, "train_tokens_per_second": 29198.031 }, { "epoch": 1.9467168796590941, "grad_norm": 1.5703125, "learning_rate": 1.9608747829304998e-05, "loss": 1.0423757553100585, "num_input_tokens_seen": 15647263296, "step": 55020, "train_runtime": 535903.3634, "train_tokens_per_second": 29197.92 }, { "epoch": 1.947070699922823, "grad_norm": 1.5546875, "learning_rate": 1.9607240078783416e-05, "loss": 1.034714126586914, "num_input_tokens_seen": 15650120320, "step": 55030, "train_runtime": 536000.7648, "train_tokens_per_second": 29197.944 }, { "epoch": 1.9474245201865519, "grad_norm": 1.5546875, "learning_rate": 1.960573267600899e-05, "loss": 1.029018020629883, "num_input_tokens_seen": 15652989696, "step": 55040, "train_runtime": 536099.7843, "train_tokens_per_second": 29197.903 }, { "epoch": 1.9477783404502804, "grad_norm": 1.6328125, "learning_rate": 1.9604225620848072e-05, "loss": 1.0611921310424806, "num_input_tokens_seen": 15655835264, "step": 55050, "train_runtime": 536198.6656, "train_tokens_per_second": 29197.826 }, { "epoch": 1.9481321607140094, "grad_norm": 1.5390625, "learning_rate": 1.9602718913167075e-05, "loss": 1.04208345413208, "num_input_tokens_seen": 15658645696, "step": 55060, "train_runtime": 536293.97, "train_tokens_per_second": 29197.878 }, { "epoch": 1.948485980977738, "grad_norm": 1.6171875, "learning_rate": 1.9601212552832483e-05, "loss": 1.031881046295166, "num_input_tokens_seen": 15661494656, "step": 55070, "train_runtime": 536393.4246, "train_tokens_per_second": 29197.775 }, { "epoch": 1.948839801241467, "grad_norm": 1.59375, "learning_rate": 1.959970653971087e-05, "loss": 1.0476322174072266, "num_input_tokens_seen": 15664384128, "step": 55080, "train_runtime": 536494.1733, "train_tokens_per_second": 29197.678 }, { "epoch": 1.9491936215051955, "grad_norm": 1.625, "learning_rate": 1.9598200873668862e-05, "loss": 1.0531925201416015, "num_input_tokens_seen": 15667203200, "step": 55090, "train_runtime": 536589.4855, "train_tokens_per_second": 29197.745 }, { "epoch": 1.9495474417689245, "grad_norm": 1.6015625, "learning_rate": 1.9596695554573167e-05, "loss": 1.0471609115600586, "num_input_tokens_seen": 15670068224, "step": 55100, "train_runtime": 536691.9341, "train_tokens_per_second": 29197.51 }, { "epoch": 1.9499012620326532, "grad_norm": 1.5546875, "learning_rate": 1.959519058229056e-05, "loss": 1.0371974945068358, "num_input_tokens_seen": 15672869056, "step": 55110, "train_runtime": 536787.8014, "train_tokens_per_second": 29197.513 }, { "epoch": 1.950255082296382, "grad_norm": 1.6328125, "learning_rate": 1.9593685956687895e-05, "loss": 1.0472349166870116, "num_input_tokens_seen": 15675753984, "step": 55120, "train_runtime": 536885.7258, "train_tokens_per_second": 29197.561 }, { "epoch": 1.9506089025601108, "grad_norm": 1.6796875, "learning_rate": 1.9592181677632094e-05, "loss": 1.04056978225708, "num_input_tokens_seen": 15678597760, "step": 55130, "train_runtime": 536984.1014, "train_tokens_per_second": 29197.508 }, { "epoch": 1.9509627228238395, "grad_norm": 1.6015625, "learning_rate": 1.9590677744990145e-05, "loss": 1.0431629180908204, "num_input_tokens_seen": 15681442496, "step": 55140, "train_runtime": 537082.4304, "train_tokens_per_second": 29197.459 }, { "epoch": 1.9513165430875683, "grad_norm": 1.6015625, "learning_rate": 1.9589174158629106e-05, "loss": 1.0493209838867188, "num_input_tokens_seen": 15684275456, "step": 55150, "train_runtime": 537179.8813, "train_tokens_per_second": 29197.436 }, { "epoch": 1.951670363351297, "grad_norm": 1.546875, "learning_rate": 1.958767091841612e-05, "loss": 1.0450294494628907, "num_input_tokens_seen": 15687186944, "step": 55160, "train_runtime": 537278.8794, "train_tokens_per_second": 29197.476 }, { "epoch": 1.9520241836150258, "grad_norm": 1.6328125, "learning_rate": 1.9586168024218395e-05, "loss": 1.0342535972595215, "num_input_tokens_seen": 15690080128, "step": 55170, "train_runtime": 537379.6619, "train_tokens_per_second": 29197.384 }, { "epoch": 1.9523780038787546, "grad_norm": 1.5078125, "learning_rate": 1.9584665475903198e-05, "loss": 1.0479907989501953, "num_input_tokens_seen": 15692963840, "step": 55180, "train_runtime": 537480.3119, "train_tokens_per_second": 29197.281 }, { "epoch": 1.9527318241424836, "grad_norm": 1.578125, "learning_rate": 1.9583163273337892e-05, "loss": 1.050635528564453, "num_input_tokens_seen": 15695856960, "step": 55190, "train_runtime": 537581.3326, "train_tokens_per_second": 29197.176 }, { "epoch": 1.9530856444062121, "grad_norm": 1.578125, "learning_rate": 1.9581661416389887e-05, "loss": 1.0435422897338866, "num_input_tokens_seen": 15698729088, "step": 55200, "train_runtime": 537681.9812, "train_tokens_per_second": 29197.053 }, { "epoch": 1.9534394646699411, "grad_norm": 1.59375, "learning_rate": 1.9580159904926674e-05, "loss": 1.0374542236328126, "num_input_tokens_seen": 15701555520, "step": 55210, "train_runtime": 537776.408, "train_tokens_per_second": 29197.182 }, { "epoch": 1.9537932849336697, "grad_norm": 1.59375, "learning_rate": 1.9578658738815823e-05, "loss": 1.0452468872070313, "num_input_tokens_seen": 15704386112, "step": 55220, "train_runtime": 537875.098, "train_tokens_per_second": 29197.087 }, { "epoch": 1.9541471051973986, "grad_norm": 1.53125, "learning_rate": 1.957715791792496e-05, "loss": 1.0392741203308105, "num_input_tokens_seen": 15707238720, "step": 55230, "train_runtime": 537974.4391, "train_tokens_per_second": 29196.998 }, { "epoch": 1.9545009254611272, "grad_norm": 1.5234375, "learning_rate": 1.9575657442121788e-05, "loss": 1.0332864761352538, "num_input_tokens_seen": 15710040640, "step": 55240, "train_runtime": 538069.3769, "train_tokens_per_second": 29197.054 }, { "epoch": 1.9548547457248562, "grad_norm": 1.640625, "learning_rate": 1.957415731127409e-05, "loss": 1.0490318298339845, "num_input_tokens_seen": 15712885248, "step": 55250, "train_runtime": 538167.692, "train_tokens_per_second": 29197.006 }, { "epoch": 1.9552085659885847, "grad_norm": 1.6328125, "learning_rate": 1.957265752524971e-05, "loss": 1.0403959274291992, "num_input_tokens_seen": 15715707648, "step": 55260, "train_runtime": 538262.7725, "train_tokens_per_second": 29197.092 }, { "epoch": 1.9555623862523137, "grad_norm": 1.578125, "learning_rate": 1.9571158083916562e-05, "loss": 1.0560995101928712, "num_input_tokens_seen": 15718585024, "step": 55270, "train_runtime": 538362.5059, "train_tokens_per_second": 29197.028 }, { "epoch": 1.9559162065160425, "grad_norm": 1.578125, "learning_rate": 1.9569658987142637e-05, "loss": 1.0561267852783203, "num_input_tokens_seen": 15721424576, "step": 55280, "train_runtime": 538458.573, "train_tokens_per_second": 29197.092 }, { "epoch": 1.9562700267797712, "grad_norm": 1.515625, "learning_rate": 1.9568160234795992e-05, "loss": 1.051699447631836, "num_input_tokens_seen": 15724310208, "step": 55290, "train_runtime": 538558.7796, "train_tokens_per_second": 29197.018 }, { "epoch": 1.9566238470435, "grad_norm": 1.546875, "learning_rate": 1.956666182674476e-05, "loss": 1.0442497253417968, "num_input_tokens_seen": 15727165312, "step": 55300, "train_runtime": 538658.3119, "train_tokens_per_second": 29196.923 }, { "epoch": 1.9569776673072288, "grad_norm": 1.546875, "learning_rate": 1.9565163762857133e-05, "loss": 1.049232578277588, "num_input_tokens_seen": 15730059968, "step": 55310, "train_runtime": 538759.7281, "train_tokens_per_second": 29196.8 }, { "epoch": 1.9573314875709575, "grad_norm": 1.5546875, "learning_rate": 1.9563666043001394e-05, "loss": 1.037040901184082, "num_input_tokens_seen": 15732864960, "step": 55320, "train_runtime": 538855.9043, "train_tokens_per_second": 29196.794 }, { "epoch": 1.9576853078346863, "grad_norm": 1.546875, "learning_rate": 1.9562168667045876e-05, "loss": 1.042534351348877, "num_input_tokens_seen": 15735718464, "step": 55330, "train_runtime": 538953.0891, "train_tokens_per_second": 29196.824 }, { "epoch": 1.958039128098415, "grad_norm": 1.5546875, "learning_rate": 1.9560671634858988e-05, "loss": 1.0477263450622558, "num_input_tokens_seen": 15738593088, "step": 55340, "train_runtime": 539051.3222, "train_tokens_per_second": 29196.836 }, { "epoch": 1.9583929483621438, "grad_norm": 1.5625, "learning_rate": 1.9559174946309216e-05, "loss": 1.0423012733459474, "num_input_tokens_seen": 15741446784, "step": 55350, "train_runtime": 539146.8776, "train_tokens_per_second": 29196.954 }, { "epoch": 1.9587467686258728, "grad_norm": 1.53125, "learning_rate": 1.955767860126512e-05, "loss": 1.0428354263305664, "num_input_tokens_seen": 15744336704, "step": 55360, "train_runtime": 539245.6882, "train_tokens_per_second": 29196.964 }, { "epoch": 1.9591005888896014, "grad_norm": 1.6484375, "learning_rate": 1.9556182599595313e-05, "loss": 1.045893096923828, "num_input_tokens_seen": 15747229056, "step": 55370, "train_runtime": 539343.7466, "train_tokens_per_second": 29197.018 }, { "epoch": 1.9594544091533304, "grad_norm": 1.515625, "learning_rate": 1.95546869411685e-05, "loss": 1.0294374465942382, "num_input_tokens_seen": 15750091136, "step": 55380, "train_runtime": 539440.1005, "train_tokens_per_second": 29197.108 }, { "epoch": 1.959808229417059, "grad_norm": 1.609375, "learning_rate": 1.9553191625853427e-05, "loss": 1.0479812622070312, "num_input_tokens_seen": 15752914624, "step": 55390, "train_runtime": 539537.1526, "train_tokens_per_second": 29197.09 }, { "epoch": 1.9601620496807879, "grad_norm": 1.5859375, "learning_rate": 1.9551696653518943e-05, "loss": 1.0463621139526367, "num_input_tokens_seen": 15755769664, "step": 55400, "train_runtime": 539635.544, "train_tokens_per_second": 29197.057 }, { "epoch": 1.9605158699445164, "grad_norm": 1.59375, "learning_rate": 1.9550202024033947e-05, "loss": 1.0471301078796387, "num_input_tokens_seen": 15758620224, "step": 55410, "train_runtime": 539731.7235, "train_tokens_per_second": 29197.135 }, { "epoch": 1.9608696902082454, "grad_norm": 1.59375, "learning_rate": 1.9548707737267412e-05, "loss": 1.0317166328430176, "num_input_tokens_seen": 15761456640, "step": 55420, "train_runtime": 539828.2251, "train_tokens_per_second": 29197.17 }, { "epoch": 1.961223510471974, "grad_norm": 1.609375, "learning_rate": 1.9547213793088384e-05, "loss": 1.0495126724243165, "num_input_tokens_seen": 15764266944, "step": 55430, "train_runtime": 539923.5763, "train_tokens_per_second": 29197.219 }, { "epoch": 1.961577330735703, "grad_norm": 1.5703125, "learning_rate": 1.9545720191365983e-05, "loss": 1.0511842727661134, "num_input_tokens_seen": 15767081344, "step": 55440, "train_runtime": 540018.5058, "train_tokens_per_second": 29197.298 }, { "epoch": 1.9619311509994317, "grad_norm": 1.578125, "learning_rate": 1.9544226931969382e-05, "loss": 1.0500625610351562, "num_input_tokens_seen": 15769919872, "step": 55450, "train_runtime": 540115.8197, "train_tokens_per_second": 29197.293 }, { "epoch": 1.9622849712631605, "grad_norm": 1.5078125, "learning_rate": 1.9542734014767848e-05, "loss": 1.0513444900512696, "num_input_tokens_seen": 15772834752, "step": 55460, "train_runtime": 540216.8062, "train_tokens_per_second": 29197.231 }, { "epoch": 1.9626387915268892, "grad_norm": 1.578125, "learning_rate": 1.9541241439630693e-05, "loss": 1.0314319610595704, "num_input_tokens_seen": 15775712128, "step": 55470, "train_runtime": 540318.655, "train_tokens_per_second": 29197.052 }, { "epoch": 1.962992611790618, "grad_norm": 1.5703125, "learning_rate": 1.9539749206427322e-05, "loss": 1.0449155807495116, "num_input_tokens_seen": 15778560000, "step": 55480, "train_runtime": 540416.6275, "train_tokens_per_second": 29197.029 }, { "epoch": 1.9633464320543468, "grad_norm": 1.5234375, "learning_rate": 1.9538257315027194e-05, "loss": 1.0404851913452149, "num_input_tokens_seen": 15781436992, "step": 55490, "train_runtime": 540517.0907, "train_tokens_per_second": 29196.925 }, { "epoch": 1.9637002523180755, "grad_norm": 1.59375, "learning_rate": 1.953676576529984e-05, "loss": 1.042249870300293, "num_input_tokens_seen": 15784325056, "step": 55500, "train_runtime": 540616.8595, "train_tokens_per_second": 29196.879 }, { "epoch": 1.9640540725818043, "grad_norm": 1.5546875, "learning_rate": 1.953527455711487e-05, "loss": 1.037540817260742, "num_input_tokens_seen": 15787178496, "step": 55510, "train_runtime": 540713.8364, "train_tokens_per_second": 29196.92 }, { "epoch": 1.964407892845533, "grad_norm": 1.453125, "learning_rate": 1.9533783690341955e-05, "loss": 1.035866641998291, "num_input_tokens_seen": 15790024832, "step": 55520, "train_runtime": 540810.4558, "train_tokens_per_second": 29196.967 }, { "epoch": 1.964761713109262, "grad_norm": 1.59375, "learning_rate": 1.9532293164850833e-05, "loss": 1.0474421501159668, "num_input_tokens_seen": 15792909888, "step": 55530, "train_runtime": 540909.689, "train_tokens_per_second": 29196.944 }, { "epoch": 1.9651155333729906, "grad_norm": 1.59375, "learning_rate": 1.9530802980511325e-05, "loss": 1.044530200958252, "num_input_tokens_seen": 15795838272, "step": 55540, "train_runtime": 541011.2952, "train_tokens_per_second": 29196.873 }, { "epoch": 1.9654693536367196, "grad_norm": 1.53125, "learning_rate": 1.95293131371933e-05, "loss": 1.0464086532592773, "num_input_tokens_seen": 15798662848, "step": 55550, "train_runtime": 541106.3148, "train_tokens_per_second": 29196.966 }, { "epoch": 1.9658231739004481, "grad_norm": 1.5625, "learning_rate": 1.9527823634766724e-05, "loss": 1.048734474182129, "num_input_tokens_seen": 15801563648, "step": 55560, "train_runtime": 541206.6832, "train_tokens_per_second": 29196.912 }, { "epoch": 1.9661769941641771, "grad_norm": 1.4765625, "learning_rate": 1.952633447310161e-05, "loss": 1.039445972442627, "num_input_tokens_seen": 15804382336, "step": 55570, "train_runtime": 541302.5859, "train_tokens_per_second": 29196.946 }, { "epoch": 1.9665308144279057, "grad_norm": 1.5546875, "learning_rate": 1.9524845652068046e-05, "loss": 1.044840145111084, "num_input_tokens_seen": 15807244096, "step": 55580, "train_runtime": 541399.3088, "train_tokens_per_second": 29197.016 }, { "epoch": 1.9668846346916347, "grad_norm": 1.578125, "learning_rate": 1.9523357171536195e-05, "loss": 1.0635669708251954, "num_input_tokens_seen": 15810162048, "step": 55590, "train_runtime": 541502.2489, "train_tokens_per_second": 29196.854 }, { "epoch": 1.9672384549553632, "grad_norm": 1.6015625, "learning_rate": 1.9521869031376288e-05, "loss": 1.0399156570434571, "num_input_tokens_seen": 15813060352, "step": 55600, "train_runtime": 541601.0209, "train_tokens_per_second": 29196.881 }, { "epoch": 1.9675922752190922, "grad_norm": 1.578125, "learning_rate": 1.9520381231458616e-05, "loss": 1.0474230766296386, "num_input_tokens_seen": 15815886656, "step": 55610, "train_runtime": 541696.1407, "train_tokens_per_second": 29196.971 }, { "epoch": 1.967946095482821, "grad_norm": 1.6484375, "learning_rate": 1.9518893771653555e-05, "loss": 1.062067985534668, "num_input_tokens_seen": 15818718272, "step": 55620, "train_runtime": 541790.6724, "train_tokens_per_second": 29197.103 }, { "epoch": 1.9682999157465497, "grad_norm": 1.5078125, "learning_rate": 1.951740665183153e-05, "loss": 1.0537633895874023, "num_input_tokens_seen": 15821595008, "step": 55630, "train_runtime": 541891.3751, "train_tokens_per_second": 29196.986 }, { "epoch": 1.9686537360102785, "grad_norm": 1.5703125, "learning_rate": 1.9515919871863057e-05, "loss": 1.0433271408081055, "num_input_tokens_seen": 15824438784, "step": 55640, "train_runtime": 541990.594, "train_tokens_per_second": 29196.888 }, { "epoch": 1.9690075562740073, "grad_norm": 1.515625, "learning_rate": 1.9514433431618707e-05, "loss": 1.0533550262451172, "num_input_tokens_seen": 15827281600, "step": 55650, "train_runtime": 542086.8524, "train_tokens_per_second": 29196.948 }, { "epoch": 1.969361376537736, "grad_norm": 1.5625, "learning_rate": 1.951294733096912e-05, "loss": 1.0477264404296875, "num_input_tokens_seen": 15830160896, "step": 55660, "train_runtime": 542187.4931, "train_tokens_per_second": 29196.839 }, { "epoch": 1.9697151968014648, "grad_norm": 1.59375, "learning_rate": 1.951146156978501e-05, "loss": 1.0417309761047364, "num_input_tokens_seen": 15833006400, "step": 55670, "train_runtime": 542286.2506, "train_tokens_per_second": 29196.769 }, { "epoch": 1.9700690170651936, "grad_norm": 1.5546875, "learning_rate": 1.9509976147937163e-05, "loss": 1.0411740303039552, "num_input_tokens_seen": 15835852608, "step": 55680, "train_runtime": 542381.8543, "train_tokens_per_second": 29196.87 }, { "epoch": 1.9704228373289223, "grad_norm": 1.6171875, "learning_rate": 1.950849106529642e-05, "loss": 1.0576465606689454, "num_input_tokens_seen": 15838724736, "step": 55690, "train_runtime": 542481.6922, "train_tokens_per_second": 29196.791 }, { "epoch": 1.9707766575926513, "grad_norm": 1.5234375, "learning_rate": 1.950700632173371e-05, "loss": 1.0506330490112306, "num_input_tokens_seen": 15841599232, "step": 55700, "train_runtime": 542582.2559, "train_tokens_per_second": 29196.678 }, { "epoch": 1.9711304778563798, "grad_norm": 1.6171875, "learning_rate": 1.9505521917120013e-05, "loss": 1.0375028610229493, "num_input_tokens_seen": 15844439424, "step": 55710, "train_runtime": 542680.5209, "train_tokens_per_second": 29196.625 }, { "epoch": 1.9714842981201088, "grad_norm": 1.6484375, "learning_rate": 1.9504037851326387e-05, "loss": 1.0327905654907226, "num_input_tokens_seen": 15847310976, "step": 55720, "train_runtime": 542781.644, "train_tokens_per_second": 29196.476 }, { "epoch": 1.9718381183838374, "grad_norm": 1.5703125, "learning_rate": 1.950255412422396e-05, "loss": 1.0480710983276367, "num_input_tokens_seen": 15850160768, "step": 55730, "train_runtime": 542877.7406, "train_tokens_per_second": 29196.557 }, { "epoch": 1.9721919386475664, "grad_norm": 1.5390625, "learning_rate": 1.9501070735683924e-05, "loss": 1.0358631134033203, "num_input_tokens_seen": 15853018368, "step": 55740, "train_runtime": 542973.9981, "train_tokens_per_second": 29196.644 }, { "epoch": 1.972545758911295, "grad_norm": 1.5703125, "learning_rate": 1.9499587685577537e-05, "loss": 1.0422815322875976, "num_input_tokens_seen": 15855846528, "step": 55750, "train_runtime": 543069.1942, "train_tokens_per_second": 29196.733 }, { "epoch": 1.972899579175024, "grad_norm": 1.5546875, "learning_rate": 1.9498104973776137e-05, "loss": 1.0407340049743652, "num_input_tokens_seen": 15858727552, "step": 55760, "train_runtime": 543169.008, "train_tokens_per_second": 29196.672 }, { "epoch": 1.9732533994387524, "grad_norm": 1.59375, "learning_rate": 1.949662260015112e-05, "loss": 1.0303277969360352, "num_input_tokens_seen": 15861522944, "step": 55770, "train_runtime": 543263.7616, "train_tokens_per_second": 29196.726 }, { "epoch": 1.9736072197024814, "grad_norm": 1.578125, "learning_rate": 1.9495140564573953e-05, "loss": 1.0293807983398438, "num_input_tokens_seen": 15864311616, "step": 55780, "train_runtime": 543357.7736, "train_tokens_per_second": 29196.806 }, { "epoch": 1.9739610399662102, "grad_norm": 1.625, "learning_rate": 1.9493658866916166e-05, "loss": 1.044095230102539, "num_input_tokens_seen": 15867128704, "step": 55790, "train_runtime": 543453.9254, "train_tokens_per_second": 29196.824 }, { "epoch": 1.974314860229939, "grad_norm": 1.5078125, "learning_rate": 1.9492177507049375e-05, "loss": 1.0370759963989258, "num_input_tokens_seen": 15869987776, "step": 55800, "train_runtime": 543549.5924, "train_tokens_per_second": 29196.945 }, { "epoch": 1.9746686804936677, "grad_norm": 1.6328125, "learning_rate": 1.9490696484845252e-05, "loss": 1.0403377532958984, "num_input_tokens_seen": 15872832768, "step": 55810, "train_runtime": 543645.4228, "train_tokens_per_second": 29197.032 }, { "epoch": 1.9750225007573965, "grad_norm": 1.578125, "learning_rate": 1.948921580017553e-05, "loss": 1.0487008094787598, "num_input_tokens_seen": 15875630080, "step": 55820, "train_runtime": 543742.1569, "train_tokens_per_second": 29196.982 }, { "epoch": 1.9753763210211253, "grad_norm": 1.5703125, "learning_rate": 1.948773545291202e-05, "loss": 1.0314671516418457, "num_input_tokens_seen": 15878497024, "step": 55830, "train_runtime": 543840.2257, "train_tokens_per_second": 29196.989 }, { "epoch": 1.975730141284854, "grad_norm": 1.6015625, "learning_rate": 1.94862554429266e-05, "loss": 1.0417680740356445, "num_input_tokens_seen": 15881281920, "step": 55840, "train_runtime": 543934.4551, "train_tokens_per_second": 29197.051 }, { "epoch": 1.9760839615485828, "grad_norm": 1.609375, "learning_rate": 1.9484775770091214e-05, "loss": 1.0384207725524903, "num_input_tokens_seen": 15884091584, "step": 55850, "train_runtime": 544030.114, "train_tokens_per_second": 29197.082 }, { "epoch": 1.9764377818123116, "grad_norm": 1.609375, "learning_rate": 1.9483296434277877e-05, "loss": 1.0393089294433593, "num_input_tokens_seen": 15886903616, "step": 55860, "train_runtime": 544126.3737, "train_tokens_per_second": 29197.084 }, { "epoch": 1.9767916020760405, "grad_norm": 1.5703125, "learning_rate": 1.9481817435358675e-05, "loss": 1.0491540908813477, "num_input_tokens_seen": 15889770048, "step": 55870, "train_runtime": 544224.3946, "train_tokens_per_second": 29197.093 }, { "epoch": 1.977145422339769, "grad_norm": 1.5859375, "learning_rate": 1.9480338773205753e-05, "loss": 1.0505325317382812, "num_input_tokens_seen": 15892611776, "step": 55880, "train_runtime": 544320.5325, "train_tokens_per_second": 29197.157 }, { "epoch": 1.977499242603498, "grad_norm": 1.5078125, "learning_rate": 1.9478860447691327e-05, "loss": 1.0428837776184081, "num_input_tokens_seen": 15895480896, "step": 55890, "train_runtime": 544417.8169, "train_tokens_per_second": 29197.209 }, { "epoch": 1.9778530628672266, "grad_norm": 1.6171875, "learning_rate": 1.9477382458687682e-05, "loss": 1.0344646453857422, "num_input_tokens_seen": 15898312192, "step": 55900, "train_runtime": 544512.0031, "train_tokens_per_second": 29197.359 }, { "epoch": 1.9782068831309556, "grad_norm": 1.546875, "learning_rate": 1.9475904806067173e-05, "loss": 1.0549846649169923, "num_input_tokens_seen": 15901135168, "step": 55910, "train_runtime": 544607.7994, "train_tokens_per_second": 29197.406 }, { "epoch": 1.9785607033946842, "grad_norm": 1.5078125, "learning_rate": 1.947442748970222e-05, "loss": 1.0392529487609863, "num_input_tokens_seen": 15904008320, "step": 55920, "train_runtime": 544708.3466, "train_tokens_per_second": 29197.291 }, { "epoch": 1.9789145236584131, "grad_norm": 1.6171875, "learning_rate": 1.947295050946531e-05, "loss": 1.045662021636963, "num_input_tokens_seen": 15906858176, "step": 55930, "train_runtime": 544806.8257, "train_tokens_per_second": 29197.245 }, { "epoch": 1.979268343922142, "grad_norm": 1.578125, "learning_rate": 1.9471473865229005e-05, "loss": 1.0393863677978517, "num_input_tokens_seen": 15909717376, "step": 55940, "train_runtime": 544904.19, "train_tokens_per_second": 29197.275 }, { "epoch": 1.9796221641858707, "grad_norm": 1.6171875, "learning_rate": 1.946999755686592e-05, "loss": 1.0470576286315918, "num_input_tokens_seen": 15912560960, "step": 55950, "train_runtime": 545000.6249, "train_tokens_per_second": 29197.326 }, { "epoch": 1.9799759844495994, "grad_norm": 1.609375, "learning_rate": 1.9468521584248754e-05, "loss": 1.04337739944458, "num_input_tokens_seen": 15915391488, "step": 55960, "train_runtime": 545096.8298, "train_tokens_per_second": 29197.366 }, { "epoch": 1.9803298047133282, "grad_norm": 1.5078125, "learning_rate": 1.9467045947250262e-05, "loss": 1.0404128074645995, "num_input_tokens_seen": 15918301120, "step": 55970, "train_runtime": 545200.5664, "train_tokens_per_second": 29197.147 }, { "epoch": 1.980683624977057, "grad_norm": 1.5390625, "learning_rate": 1.9465570645743265e-05, "loss": 1.0403247833251954, "num_input_tokens_seen": 15921138688, "step": 55980, "train_runtime": 545296.0549, "train_tokens_per_second": 29197.238 }, { "epoch": 1.9810374452407857, "grad_norm": 1.578125, "learning_rate": 1.946409567960067e-05, "loss": 1.0466753959655761, "num_input_tokens_seen": 15923974144, "step": 55990, "train_runtime": 545391.797, "train_tokens_per_second": 29197.311 }, { "epoch": 1.9813912655045145, "grad_norm": 1.5625, "learning_rate": 1.9462621048695433e-05, "loss": 1.0458283424377441, "num_input_tokens_seen": 15926836800, "step": 56000, "train_runtime": 545490.4467, "train_tokens_per_second": 29197.279 }, { "epoch": 1.9817450857682433, "grad_norm": 1.5078125, "learning_rate": 1.9461146752900578e-05, "loss": 1.0453773498535157, "num_input_tokens_seen": 15929623360, "step": 56010, "train_runtime": 545585.0222, "train_tokens_per_second": 29197.325 }, { "epoch": 1.982098906031972, "grad_norm": 1.6015625, "learning_rate": 1.9459672792089206e-05, "loss": 1.0351547241210937, "num_input_tokens_seen": 15932404736, "step": 56020, "train_runtime": 545678.5278, "train_tokens_per_second": 29197.419 }, { "epoch": 1.9824527262957008, "grad_norm": 1.53125, "learning_rate": 1.9458199166134474e-05, "loss": 1.0419797897338867, "num_input_tokens_seen": 15935241664, "step": 56030, "train_runtime": 545776.2353, "train_tokens_per_second": 29197.39 }, { "epoch": 1.9828065465594298, "grad_norm": 1.5625, "learning_rate": 1.945672587490962e-05, "loss": 1.0385124206542968, "num_input_tokens_seen": 15938158144, "step": 56040, "train_runtime": 545876.9029, "train_tokens_per_second": 29197.348 }, { "epoch": 1.9831603668231583, "grad_norm": 1.6484375, "learning_rate": 1.945525291828794e-05, "loss": 1.0410585403442383, "num_input_tokens_seen": 15941030912, "step": 56050, "train_runtime": 545975.4885, "train_tokens_per_second": 29197.338 }, { "epoch": 1.9835141870868873, "grad_norm": 1.625, "learning_rate": 1.945378029614279e-05, "loss": 1.0410298347473144, "num_input_tokens_seen": 15943890688, "step": 56060, "train_runtime": 546073.4605, "train_tokens_per_second": 29197.337 }, { "epoch": 1.9838680073506159, "grad_norm": 1.6484375, "learning_rate": 1.9452308008347617e-05, "loss": 1.0405838012695312, "num_input_tokens_seen": 15946700800, "step": 56070, "train_runtime": 546166.4823, "train_tokens_per_second": 29197.509 }, { "epoch": 1.9842218276143448, "grad_norm": 1.5546875, "learning_rate": 1.945083605477591e-05, "loss": 1.036156177520752, "num_input_tokens_seen": 15949568640, "step": 56080, "train_runtime": 546265.0942, "train_tokens_per_second": 29197.488 }, { "epoch": 1.9845756478780734, "grad_norm": 1.609375, "learning_rate": 1.9449364435301235e-05, "loss": 1.0450976371765137, "num_input_tokens_seen": 15952373440, "step": 56090, "train_runtime": 546360.5179, "train_tokens_per_second": 29197.522 }, { "epoch": 1.9849294681418024, "grad_norm": 1.6171875, "learning_rate": 1.944789314979723e-05, "loss": 1.0563013076782226, "num_input_tokens_seen": 15955251264, "step": 56100, "train_runtime": 546457.5223, "train_tokens_per_second": 29197.606 }, { "epoch": 1.9852832884055311, "grad_norm": 1.578125, "learning_rate": 1.944642219813759e-05, "loss": 1.041473960876465, "num_input_tokens_seen": 15958147520, "step": 56110, "train_runtime": 546557.2619, "train_tokens_per_second": 29197.577 }, { "epoch": 1.98563710866926, "grad_norm": 1.609375, "learning_rate": 1.944495158019608e-05, "loss": 1.0570634841918944, "num_input_tokens_seen": 15960998592, "step": 56120, "train_runtime": 546655.9929, "train_tokens_per_second": 29197.519 }, { "epoch": 1.9859909289329887, "grad_norm": 1.546875, "learning_rate": 1.9443481295846537e-05, "loss": 1.047287368774414, "num_input_tokens_seen": 15963850880, "step": 56130, "train_runtime": 546753.0485, "train_tokens_per_second": 29197.553 }, { "epoch": 1.9863447491967174, "grad_norm": 1.609375, "learning_rate": 1.9442011344962863e-05, "loss": 1.0553226470947266, "num_input_tokens_seen": 15966651520, "step": 56140, "train_runtime": 546846.0797, "train_tokens_per_second": 29197.707 }, { "epoch": 1.9866985694604462, "grad_norm": 1.515625, "learning_rate": 1.9440541727419024e-05, "loss": 1.0430308341979981, "num_input_tokens_seen": 15969476416, "step": 56150, "train_runtime": 546942.4513, "train_tokens_per_second": 29197.727 }, { "epoch": 1.987052389724175, "grad_norm": 1.546875, "learning_rate": 1.9439072443089045e-05, "loss": 1.0419475555419921, "num_input_tokens_seen": 15972270208, "step": 56160, "train_runtime": 547038.0483, "train_tokens_per_second": 29197.732 }, { "epoch": 1.9874062099879037, "grad_norm": 1.515625, "learning_rate": 1.9437603491847038e-05, "loss": 1.0381108283996583, "num_input_tokens_seen": 15975082880, "step": 56170, "train_runtime": 547131.3434, "train_tokens_per_second": 29197.894 }, { "epoch": 1.9877600302516325, "grad_norm": 1.625, "learning_rate": 1.943613487356717e-05, "loss": 1.0550914764404298, "num_input_tokens_seen": 15977881472, "step": 56180, "train_runtime": 547226.4726, "train_tokens_per_second": 29197.932 }, { "epoch": 1.9881138505153615, "grad_norm": 1.5703125, "learning_rate": 1.9434666588123665e-05, "loss": 1.0478021621704101, "num_input_tokens_seen": 15980732160, "step": 56190, "train_runtime": 547325.1695, "train_tokens_per_second": 29197.876 }, { "epoch": 1.98846767077909, "grad_norm": 1.546875, "learning_rate": 1.943319863539083e-05, "loss": 1.043342399597168, "num_input_tokens_seen": 15983606720, "step": 56200, "train_runtime": 547425.2793, "train_tokens_per_second": 29197.787 }, { "epoch": 1.988821491042819, "grad_norm": 1.5625, "learning_rate": 1.9431731015243026e-05, "loss": 1.0441316604614257, "num_input_tokens_seen": 15986437888, "step": 56210, "train_runtime": 547522.4892, "train_tokens_per_second": 29197.774 }, { "epoch": 1.9891753113065476, "grad_norm": 1.4921875, "learning_rate": 1.943026372755469e-05, "loss": 1.0373734474182128, "num_input_tokens_seen": 15989271872, "step": 56220, "train_runtime": 547616.5274, "train_tokens_per_second": 29197.935 }, { "epoch": 1.9895291315702766, "grad_norm": 1.640625, "learning_rate": 1.942879677220032e-05, "loss": 1.0415738105773926, "num_input_tokens_seen": 15992126080, "step": 56230, "train_runtime": 547714.4012, "train_tokens_per_second": 29197.929 }, { "epoch": 1.989882951834005, "grad_norm": 1.5703125, "learning_rate": 1.942733014905448e-05, "loss": 1.0319334030151368, "num_input_tokens_seen": 15994999744, "step": 56240, "train_runtime": 547813.5996, "train_tokens_per_second": 29197.887 }, { "epoch": 1.990236772097734, "grad_norm": 1.5703125, "learning_rate": 1.9425863857991804e-05, "loss": 1.0422107696533203, "num_input_tokens_seen": 15997838912, "step": 56250, "train_runtime": 547909.9279, "train_tokens_per_second": 29197.936 }, { "epoch": 1.9905905923614626, "grad_norm": 1.6171875, "learning_rate": 1.9424397898886988e-05, "loss": 1.0517634391784667, "num_input_tokens_seen": 16000681920, "step": 56260, "train_runtime": 548008.3448, "train_tokens_per_second": 29197.88 }, { "epoch": 1.9909444126251916, "grad_norm": 1.6015625, "learning_rate": 1.9422932271614797e-05, "loss": 1.0335149765014648, "num_input_tokens_seen": 16003485632, "step": 56270, "train_runtime": 548104.7475, "train_tokens_per_second": 29197.86 }, { "epoch": 1.9912982328889204, "grad_norm": 1.5625, "learning_rate": 1.942146697605006e-05, "loss": 1.0403701782226562, "num_input_tokens_seen": 16006271936, "step": 56280, "train_runtime": 548197.6742, "train_tokens_per_second": 29197.993 }, { "epoch": 1.9916520531526491, "grad_norm": 1.5234375, "learning_rate": 1.9420002012067674e-05, "loss": 1.0422462463378905, "num_input_tokens_seen": 16009110784, "step": 56290, "train_runtime": 548293.7827, "train_tokens_per_second": 29198.053 }, { "epoch": 1.992005873416378, "grad_norm": 1.59375, "learning_rate": 1.94185373795426e-05, "loss": 1.0433788299560547, "num_input_tokens_seen": 16011932416, "step": 56300, "train_runtime": 548389.1728, "train_tokens_per_second": 29198.119 }, { "epoch": 1.9923596936801067, "grad_norm": 1.5546875, "learning_rate": 1.9417073078349874e-05, "loss": 1.033375358581543, "num_input_tokens_seen": 16014766144, "step": 56310, "train_runtime": 548486.6901, "train_tokens_per_second": 29198.094 }, { "epoch": 1.9927135139438354, "grad_norm": 1.625, "learning_rate": 1.9415609108364576e-05, "loss": 1.0364065170288086, "num_input_tokens_seen": 16017600256, "step": 56320, "train_runtime": 548583.3324, "train_tokens_per_second": 29198.117 }, { "epoch": 1.9930673342075642, "grad_norm": 1.5625, "learning_rate": 1.941414546946188e-05, "loss": 1.0341419219970702, "num_input_tokens_seen": 16020442688, "step": 56330, "train_runtime": 548677.9724, "train_tokens_per_second": 29198.261 }, { "epoch": 1.993421154471293, "grad_norm": 1.6171875, "learning_rate": 1.9412682161517005e-05, "loss": 1.0380456924438477, "num_input_tokens_seen": 16023284992, "step": 56340, "train_runtime": 548777.9175, "train_tokens_per_second": 29198.123 }, { "epoch": 1.9937749747350217, "grad_norm": 1.5703125, "learning_rate": 1.9411219184405246e-05, "loss": 1.0330841064453125, "num_input_tokens_seen": 16026120832, "step": 56350, "train_runtime": 548874.6847, "train_tokens_per_second": 29198.142 }, { "epoch": 1.9941287949987507, "grad_norm": 1.578125, "learning_rate": 1.9409756538001956e-05, "loss": 1.0528324127197266, "num_input_tokens_seen": 16028994240, "step": 56360, "train_runtime": 548972.4027, "train_tokens_per_second": 29198.179 }, { "epoch": 1.9944826152624793, "grad_norm": 1.609375, "learning_rate": 1.940829422218256e-05, "loss": 1.0527910232543944, "num_input_tokens_seen": 16031783040, "step": 56370, "train_runtime": 549065.4786, "train_tokens_per_second": 29198.308 }, { "epoch": 1.9948364355262083, "grad_norm": 1.5546875, "learning_rate": 1.9406832236822554e-05, "loss": 1.042885971069336, "num_input_tokens_seen": 16034585152, "step": 56380, "train_runtime": 549161.7927, "train_tokens_per_second": 29198.29 }, { "epoch": 1.9951902557899368, "grad_norm": 1.609375, "learning_rate": 1.940537058179749e-05, "loss": 1.0451224327087403, "num_input_tokens_seen": 16037380736, "step": 56390, "train_runtime": 549257.346, "train_tokens_per_second": 29198.3 }, { "epoch": 1.9955440760536658, "grad_norm": 1.5703125, "learning_rate": 1.9403909256982976e-05, "loss": 1.0402108192443849, "num_input_tokens_seen": 16040219648, "step": 56400, "train_runtime": 549355.3627, "train_tokens_per_second": 29198.258 }, { "epoch": 1.9958978963173943, "grad_norm": 1.609375, "learning_rate": 1.9402448262254713e-05, "loss": 1.0390225410461427, "num_input_tokens_seen": 16043105216, "step": 56410, "train_runtime": 549453.8141, "train_tokens_per_second": 29198.278 }, { "epoch": 1.9962517165811233, "grad_norm": 1.5234375, "learning_rate": 1.940098759748845e-05, "loss": 1.033859634399414, "num_input_tokens_seen": 16045917184, "step": 56420, "train_runtime": 549547.277, "train_tokens_per_second": 29198.429 }, { "epoch": 1.9966055368448519, "grad_norm": 1.609375, "learning_rate": 1.9399527262559997e-05, "loss": 1.0577059745788575, "num_input_tokens_seen": 16048747712, "step": 56430, "train_runtime": 549645.693, "train_tokens_per_second": 29198.351 }, { "epoch": 1.9969593571085809, "grad_norm": 1.6484375, "learning_rate": 1.939806725734524e-05, "loss": 1.0487089157104492, "num_input_tokens_seen": 16051591232, "step": 56440, "train_runtime": 549745.537, "train_tokens_per_second": 29198.22 }, { "epoch": 1.9973131773723096, "grad_norm": 1.6171875, "learning_rate": 1.9396607581720126e-05, "loss": 1.0381735801696776, "num_input_tokens_seen": 16054406464, "step": 56450, "train_runtime": 549843.2844, "train_tokens_per_second": 29198.15 }, { "epoch": 1.9976669976360384, "grad_norm": 1.5546875, "learning_rate": 1.9395148235560674e-05, "loss": 1.043528175354004, "num_input_tokens_seen": 16057303168, "step": 56460, "train_runtime": 549945.068, "train_tokens_per_second": 29198.013 }, { "epoch": 1.9980208178997672, "grad_norm": 1.59375, "learning_rate": 1.9393689218742955e-05, "loss": 1.0393731117248535, "num_input_tokens_seen": 16060162496, "step": 56470, "train_runtime": 550041.6147, "train_tokens_per_second": 29198.086 }, { "epoch": 1.998374638163496, "grad_norm": 1.546875, "learning_rate": 1.939223053114311e-05, "loss": 1.0188589096069336, "num_input_tokens_seen": 16062997696, "step": 56480, "train_runtime": 550138.5908, "train_tokens_per_second": 29198.093 }, { "epoch": 1.9987284584272247, "grad_norm": 1.5703125, "learning_rate": 1.939077217263736e-05, "loss": 1.0475128173828125, "num_input_tokens_seen": 16065828288, "step": 56490, "train_runtime": 550236.3908, "train_tokens_per_second": 29198.048 }, { "epoch": 1.9990822786909535, "grad_norm": 1.640625, "learning_rate": 1.9389314143101967e-05, "loss": 1.0484414100646973, "num_input_tokens_seen": 16068675392, "step": 56500, "train_runtime": 550333.4164, "train_tokens_per_second": 29198.073 }, { "epoch": 1.9994360989546822, "grad_norm": 1.578125, "learning_rate": 1.938785644241327e-05, "loss": 1.0566619873046874, "num_input_tokens_seen": 16071454080, "step": 56510, "train_runtime": 550426.6337, "train_tokens_per_second": 29198.177 }, { "epoch": 1.999789919218411, "grad_norm": 1.6171875, "learning_rate": 1.9386399070447685e-05, "loss": 1.0367640495300292, "num_input_tokens_seen": 16074315392, "step": 56520, "train_runtime": 550525.4524, "train_tokens_per_second": 29198.133 }, { "epoch": 2.0001415281054915, "grad_norm": 1.5546875, "learning_rate": 1.938494202708167e-05, "loss": 1.039323616027832, "num_input_tokens_seen": 16077140928, "step": 56530, "train_runtime": 550630.6014, "train_tokens_per_second": 29197.689 }, { "epoch": 2.0004953483692205, "grad_norm": 1.5859375, "learning_rate": 1.9383485312191764e-05, "loss": 1.030522918701172, "num_input_tokens_seen": 16079929728, "step": 56540, "train_runtime": 550724.896, "train_tokens_per_second": 29197.753 }, { "epoch": 2.000849168632949, "grad_norm": 1.546875, "learning_rate": 1.9382028925654567e-05, "loss": 1.0193578720092773, "num_input_tokens_seen": 16082804608, "step": 56550, "train_runtime": 550822.946, "train_tokens_per_second": 29197.775 }, { "epoch": 2.001202988896678, "grad_norm": 1.5234375, "learning_rate": 1.9380572867346734e-05, "loss": 1.02852783203125, "num_input_tokens_seen": 16085644544, "step": 56560, "train_runtime": 550920.2209, "train_tokens_per_second": 29197.775 }, { "epoch": 2.0015568091604066, "grad_norm": 1.578125, "learning_rate": 1.9379117137145007e-05, "loss": 1.0394320487976074, "num_input_tokens_seen": 16088528128, "step": 56570, "train_runtime": 551017.9164, "train_tokens_per_second": 29197.831 }, { "epoch": 2.0019106294241356, "grad_norm": 1.5390625, "learning_rate": 1.937766173492617e-05, "loss": 1.0304534912109375, "num_input_tokens_seen": 16091350208, "step": 56580, "train_runtime": 551114.9839, "train_tokens_per_second": 29197.809 }, { "epoch": 2.002264449687864, "grad_norm": 1.5234375, "learning_rate": 1.9376206660567083e-05, "loss": 1.0398508071899415, "num_input_tokens_seen": 16094200960, "step": 56590, "train_runtime": 551213.9996, "train_tokens_per_second": 29197.736 }, { "epoch": 2.002618269951593, "grad_norm": 1.5546875, "learning_rate": 1.9374751913944676e-05, "loss": 1.0114702224731444, "num_input_tokens_seen": 16097080832, "step": 56600, "train_runtime": 551316.3104, "train_tokens_per_second": 29197.541 }, { "epoch": 2.0029720902153216, "grad_norm": 1.5625, "learning_rate": 1.9373297494935928e-05, "loss": 1.034390640258789, "num_input_tokens_seen": 16099895808, "step": 56610, "train_runtime": 551411.5785, "train_tokens_per_second": 29197.602 }, { "epoch": 2.0033259104790506, "grad_norm": 1.515625, "learning_rate": 1.9371843403417894e-05, "loss": 1.0322214126586915, "num_input_tokens_seen": 16102718208, "step": 56620, "train_runtime": 551506.9541, "train_tokens_per_second": 29197.67 }, { "epoch": 2.003679730742779, "grad_norm": 1.53125, "learning_rate": 1.937038963926769e-05, "loss": 1.0309642791748046, "num_input_tokens_seen": 16105603008, "step": 56630, "train_runtime": 551606.8051, "train_tokens_per_second": 29197.615 }, { "epoch": 2.004033551006508, "grad_norm": 1.5625, "learning_rate": 1.93689362023625e-05, "loss": 1.049201202392578, "num_input_tokens_seen": 16108478784, "step": 56640, "train_runtime": 551707.6332, "train_tokens_per_second": 29197.491 }, { "epoch": 2.0043873712702367, "grad_norm": 1.609375, "learning_rate": 1.936748309257957e-05, "loss": 1.0523618698120116, "num_input_tokens_seen": 16111278848, "step": 56650, "train_runtime": 551800.2233, "train_tokens_per_second": 29197.666 }, { "epoch": 2.0047411915339657, "grad_norm": 1.53125, "learning_rate": 1.9366030309796208e-05, "loss": 1.0334495544433593, "num_input_tokens_seen": 16114109696, "step": 56660, "train_runtime": 551892.9402, "train_tokens_per_second": 29197.891 }, { "epoch": 2.0050950117976942, "grad_norm": 1.5078125, "learning_rate": 1.936457785388979e-05, "loss": 1.018702507019043, "num_input_tokens_seen": 16116990336, "step": 56670, "train_runtime": 551992.7113, "train_tokens_per_second": 29197.832 }, { "epoch": 2.005448832061423, "grad_norm": 1.609375, "learning_rate": 1.9363125724737757e-05, "loss": 1.0243990898132325, "num_input_tokens_seen": 16119840448, "step": 56680, "train_runtime": 552089.1057, "train_tokens_per_second": 29197.896 }, { "epoch": 2.0058026523251518, "grad_norm": 1.546875, "learning_rate": 1.9361673922217612e-05, "loss": 1.0367053985595702, "num_input_tokens_seen": 16122732800, "step": 56690, "train_runtime": 552187.1841, "train_tokens_per_second": 29197.948 }, { "epoch": 2.0061564725888807, "grad_norm": 1.59375, "learning_rate": 1.9360222446206923e-05, "loss": 1.0436555862426757, "num_input_tokens_seen": 16125596480, "step": 56700, "train_runtime": 552285.5299, "train_tokens_per_second": 29197.934 }, { "epoch": 2.0065102928526097, "grad_norm": 1.5546875, "learning_rate": 1.9358771296583317e-05, "loss": 1.0321487426757812, "num_input_tokens_seen": 16128472704, "step": 56710, "train_runtime": 552384.5975, "train_tokens_per_second": 29197.904 }, { "epoch": 2.0068641131163383, "grad_norm": 1.5546875, "learning_rate": 1.935732047322449e-05, "loss": 1.0434242248535157, "num_input_tokens_seen": 16131364864, "step": 56720, "train_runtime": 552484.1659, "train_tokens_per_second": 29197.877 }, { "epoch": 2.0072179333800673, "grad_norm": 1.6484375, "learning_rate": 1.9355869976008212e-05, "loss": 1.0419513702392578, "num_input_tokens_seen": 16134208448, "step": 56730, "train_runtime": 552582.9572, "train_tokens_per_second": 29197.803 }, { "epoch": 2.007571753643796, "grad_norm": 1.6015625, "learning_rate": 1.9354419804812303e-05, "loss": 1.0251714706420898, "num_input_tokens_seen": 16137034688, "step": 56740, "train_runtime": 552679.6126, "train_tokens_per_second": 29197.811 }, { "epoch": 2.007925573907525, "grad_norm": 1.578125, "learning_rate": 1.935296995951465e-05, "loss": 1.0267827987670899, "num_input_tokens_seen": 16139858944, "step": 56750, "train_runtime": 552774.4816, "train_tokens_per_second": 29197.909 }, { "epoch": 2.0082793941712533, "grad_norm": 1.5625, "learning_rate": 1.9351520439993207e-05, "loss": 1.039373016357422, "num_input_tokens_seen": 16142652160, "step": 56760, "train_runtime": 552870.8323, "train_tokens_per_second": 29197.873 }, { "epoch": 2.0086332144349823, "grad_norm": 1.53125, "learning_rate": 1.935007124612599e-05, "loss": 1.0390923500061036, "num_input_tokens_seen": 16145533824, "step": 56770, "train_runtime": 552969.5437, "train_tokens_per_second": 29197.872 }, { "epoch": 2.008987034698711, "grad_norm": 1.59375, "learning_rate": 1.9348622377791077e-05, "loss": 1.0399500846862793, "num_input_tokens_seen": 16148411392, "step": 56780, "train_runtime": 553066.7294, "train_tokens_per_second": 29197.944 }, { "epoch": 2.00934085496244, "grad_norm": 1.6015625, "learning_rate": 1.9347173834866616e-05, "loss": 1.0342112541198731, "num_input_tokens_seen": 16151261248, "step": 56790, "train_runtime": 553166.2346, "train_tokens_per_second": 29197.844 }, { "epoch": 2.0096946752261684, "grad_norm": 1.671875, "learning_rate": 1.9345725617230813e-05, "loss": 1.0423255920410157, "num_input_tokens_seen": 16154109568, "step": 56800, "train_runtime": 553264.4239, "train_tokens_per_second": 29197.81 }, { "epoch": 2.0100484954898974, "grad_norm": 1.6328125, "learning_rate": 1.9344277724761943e-05, "loss": 1.0389098167419433, "num_input_tokens_seen": 16156944128, "step": 56810, "train_runtime": 553364.1404, "train_tokens_per_second": 29197.671 }, { "epoch": 2.010402315753626, "grad_norm": 1.5859375, "learning_rate": 1.9342830157338338e-05, "loss": 1.0416364669799805, "num_input_tokens_seen": 16159769408, "step": 56820, "train_runtime": 553459.4295, "train_tokens_per_second": 29197.749 }, { "epoch": 2.010756136017355, "grad_norm": 1.5703125, "learning_rate": 1.93413829148384e-05, "loss": 1.0283872604370117, "num_input_tokens_seen": 16162587264, "step": 56830, "train_runtime": 553555.7524, "train_tokens_per_second": 29197.759 }, { "epoch": 2.0111099562810835, "grad_norm": 1.546875, "learning_rate": 1.9339935997140592e-05, "loss": 1.0338361740112305, "num_input_tokens_seen": 16165395328, "step": 56840, "train_runtime": 553650.6382, "train_tokens_per_second": 29197.827 }, { "epoch": 2.0114637765448125, "grad_norm": 1.578125, "learning_rate": 1.9338489404123445e-05, "loss": 1.0248441696166992, "num_input_tokens_seen": 16168253568, "step": 56850, "train_runtime": 553751.2029, "train_tokens_per_second": 29197.686 }, { "epoch": 2.0118175968085414, "grad_norm": 1.609375, "learning_rate": 1.933704313566554e-05, "loss": 1.0317646980285644, "num_input_tokens_seen": 16171069824, "step": 56860, "train_runtime": 553846.7515, "train_tokens_per_second": 29197.733 }, { "epoch": 2.01217141707227, "grad_norm": 1.5625, "learning_rate": 1.9335597191645538e-05, "loss": 1.0321277618408202, "num_input_tokens_seen": 16173874944, "step": 56870, "train_runtime": 553943.4209, "train_tokens_per_second": 29197.702 }, { "epoch": 2.012525237335999, "grad_norm": 1.6484375, "learning_rate": 1.9334151571942157e-05, "loss": 1.0297174453735352, "num_input_tokens_seen": 16176671680, "step": 56880, "train_runtime": 554037.8833, "train_tokens_per_second": 29197.772 }, { "epoch": 2.0128790575997275, "grad_norm": 1.5703125, "learning_rate": 1.933270627643417e-05, "loss": 1.03871431350708, "num_input_tokens_seen": 16179527232, "step": 56890, "train_runtime": 554136.3095, "train_tokens_per_second": 29197.739 }, { "epoch": 2.0132328778634565, "grad_norm": 1.6328125, "learning_rate": 1.9331261305000432e-05, "loss": 1.041410255432129, "num_input_tokens_seen": 16182371008, "step": 56900, "train_runtime": 554233.2251, "train_tokens_per_second": 29197.764 }, { "epoch": 2.013586698127185, "grad_norm": 1.53125, "learning_rate": 1.9329816657519845e-05, "loss": 1.0393573760986328, "num_input_tokens_seen": 16185209088, "step": 56910, "train_runtime": 554328.0916, "train_tokens_per_second": 29197.887 }, { "epoch": 2.013940518390914, "grad_norm": 1.546875, "learning_rate": 1.9328372333871378e-05, "loss": 1.0407936096191406, "num_input_tokens_seen": 16187992576, "step": 56920, "train_runtime": 554423.2398, "train_tokens_per_second": 29197.897 }, { "epoch": 2.0142943386546426, "grad_norm": 1.53125, "learning_rate": 1.9326928333934072e-05, "loss": 1.0164061546325684, "num_input_tokens_seen": 16190857664, "step": 56930, "train_runtime": 554521.8496, "train_tokens_per_second": 29197.871 }, { "epoch": 2.0146481589183716, "grad_norm": 1.5625, "learning_rate": 1.9325484657587018e-05, "loss": 1.035902976989746, "num_input_tokens_seen": 16193695104, "step": 56940, "train_runtime": 554619.6086, "train_tokens_per_second": 29197.841 }, { "epoch": 2.0150019791821, "grad_norm": 1.5703125, "learning_rate": 1.932404130470938e-05, "loss": 1.0491472244262696, "num_input_tokens_seen": 16196511360, "step": 56950, "train_runtime": 554714.288, "train_tokens_per_second": 29197.934 }, { "epoch": 2.015355799445829, "grad_norm": 1.59375, "learning_rate": 1.9322598275180383e-05, "loss": 1.058040237426758, "num_input_tokens_seen": 16199365248, "step": 56960, "train_runtime": 554813.2757, "train_tokens_per_second": 29197.869 }, { "epoch": 2.0157096197095576, "grad_norm": 1.53125, "learning_rate": 1.9321155568879315e-05, "loss": 1.031581497192383, "num_input_tokens_seen": 16202188288, "step": 56970, "train_runtime": 554910.0131, "train_tokens_per_second": 29197.866 }, { "epoch": 2.0160634399732866, "grad_norm": 1.5703125, "learning_rate": 1.9319713185685522e-05, "loss": 1.0329961776733398, "num_input_tokens_seen": 16205015936, "step": 56980, "train_runtime": 555008.627, "train_tokens_per_second": 29197.773 }, { "epoch": 2.016417260237015, "grad_norm": 1.53125, "learning_rate": 1.9318271125478422e-05, "loss": 1.0511350631713867, "num_input_tokens_seen": 16207861376, "step": 56990, "train_runtime": 555103.3151, "train_tokens_per_second": 29197.919 }, { "epoch": 2.016771080500744, "grad_norm": 1.6015625, "learning_rate": 1.9316829388137487e-05, "loss": 1.0269742965698243, "num_input_tokens_seen": 16210714240, "step": 57000, "train_runtime": 555201.9953, "train_tokens_per_second": 29197.867 }, { "epoch": 2.0171249007644727, "grad_norm": 1.6171875, "learning_rate": 1.931538797354226e-05, "loss": 1.0312090873718263, "num_input_tokens_seen": 16213538688, "step": 57010, "train_runtime": 555298.8778, "train_tokens_per_second": 29197.86 }, { "epoch": 2.0174787210282017, "grad_norm": 1.546875, "learning_rate": 1.931394688157234e-05, "loss": 1.0363161087036132, "num_input_tokens_seen": 16216409728, "step": 57020, "train_runtime": 555398.7132, "train_tokens_per_second": 29197.781 }, { "epoch": 2.0178325412919307, "grad_norm": 1.609375, "learning_rate": 1.9312506112107394e-05, "loss": 1.0370423316955566, "num_input_tokens_seen": 16219295360, "step": 57030, "train_runtime": 555498.6534, "train_tokens_per_second": 29197.722 }, { "epoch": 2.0181863615556592, "grad_norm": 1.6953125, "learning_rate": 1.931106566502715e-05, "loss": 1.0489347457885743, "num_input_tokens_seen": 16222161216, "step": 57040, "train_runtime": 555601.7965, "train_tokens_per_second": 29197.46 }, { "epoch": 2.018540181819388, "grad_norm": 1.5859375, "learning_rate": 1.9309625540211397e-05, "loss": 1.027577018737793, "num_input_tokens_seen": 16224984512, "step": 57050, "train_runtime": 555699.4019, "train_tokens_per_second": 29197.412 }, { "epoch": 2.0188940020831168, "grad_norm": 1.609375, "learning_rate": 1.9308185737539988e-05, "loss": 1.0412328720092774, "num_input_tokens_seen": 16227826048, "step": 57060, "train_runtime": 555796.663, "train_tokens_per_second": 29197.415 }, { "epoch": 2.0192478223468457, "grad_norm": 1.5390625, "learning_rate": 1.930674625689284e-05, "loss": 1.0316909790039062, "num_input_tokens_seen": 16230663616, "step": 57070, "train_runtime": 555893.2895, "train_tokens_per_second": 29197.445 }, { "epoch": 2.0196016426105743, "grad_norm": 1.671875, "learning_rate": 1.9305307098149935e-05, "loss": 1.030612087249756, "num_input_tokens_seen": 16233473984, "step": 57080, "train_runtime": 555988.4967, "train_tokens_per_second": 29197.5 }, { "epoch": 2.0199554628743033, "grad_norm": 1.59375, "learning_rate": 1.930386826119131e-05, "loss": 1.0328634262084961, "num_input_tokens_seen": 16236298688, "step": 57090, "train_runtime": 556082.9147, "train_tokens_per_second": 29197.622 }, { "epoch": 2.020309283138032, "grad_norm": 1.5546875, "learning_rate": 1.930242974589707e-05, "loss": 1.0448840141296387, "num_input_tokens_seen": 16239094976, "step": 57100, "train_runtime": 556177.5589, "train_tokens_per_second": 29197.681 }, { "epoch": 2.020663103401761, "grad_norm": 1.6171875, "learning_rate": 1.9300991552147384e-05, "loss": 1.0360559463500976, "num_input_tokens_seen": 16241963392, "step": 57110, "train_runtime": 556277.8862, "train_tokens_per_second": 29197.572 }, { "epoch": 2.0210169236654894, "grad_norm": 1.609375, "learning_rate": 1.9299553679822472e-05, "loss": 1.0412565231323243, "num_input_tokens_seen": 16244818176, "step": 57120, "train_runtime": 556375.2239, "train_tokens_per_second": 29197.595 }, { "epoch": 2.0213707439292183, "grad_norm": 1.5390625, "learning_rate": 1.929811612880264e-05, "loss": 1.0242237091064452, "num_input_tokens_seen": 16247708736, "step": 57130, "train_runtime": 556475.4151, "train_tokens_per_second": 29197.532 }, { "epoch": 2.021724564192947, "grad_norm": 1.5625, "learning_rate": 1.929667889896823e-05, "loss": 1.0251242637634277, "num_input_tokens_seen": 16250485120, "step": 57140, "train_runtime": 556568.6974, "train_tokens_per_second": 29197.627 }, { "epoch": 2.022078384456676, "grad_norm": 1.6328125, "learning_rate": 1.9295241990199666e-05, "loss": 1.0256052017211914, "num_input_tokens_seen": 16253317120, "step": 57150, "train_runtime": 556664.351, "train_tokens_per_second": 29197.697 }, { "epoch": 2.0224322047204044, "grad_norm": 1.6171875, "learning_rate": 1.9293805402377416e-05, "loss": 1.0394763946533203, "num_input_tokens_seen": 16256130560, "step": 57160, "train_runtime": 556757.7506, "train_tokens_per_second": 29197.852 }, { "epoch": 2.0227860249841334, "grad_norm": 1.578125, "learning_rate": 1.9292369135382035e-05, "loss": 1.0331123352050782, "num_input_tokens_seen": 16258945856, "step": 57170, "train_runtime": 556854.5002, "train_tokens_per_second": 29197.835 }, { "epoch": 2.023139845247862, "grad_norm": 1.6171875, "learning_rate": 1.9290933189094114e-05, "loss": 1.0376168251037599, "num_input_tokens_seen": 16261732672, "step": 57180, "train_runtime": 556948.3211, "train_tokens_per_second": 29197.92 }, { "epoch": 2.023493665511591, "grad_norm": 1.6015625, "learning_rate": 1.928949756339432e-05, "loss": 1.0413609504699708, "num_input_tokens_seen": 16264601152, "step": 57190, "train_runtime": 557048.6956, "train_tokens_per_second": 29197.809 }, { "epoch": 2.02384748577532, "grad_norm": 1.625, "learning_rate": 1.9288062258163386e-05, "loss": 1.0321037292480468, "num_input_tokens_seen": 16267415296, "step": 57200, "train_runtime": 557142.8497, "train_tokens_per_second": 29197.925 }, { "epoch": 2.0242013060390485, "grad_norm": 1.5859375, "learning_rate": 1.92866272732821e-05, "loss": 1.0269018173217774, "num_input_tokens_seen": 16270270080, "step": 57210, "train_runtime": 557242.4565, "train_tokens_per_second": 29197.829 }, { "epoch": 2.0245551263027775, "grad_norm": 1.5703125, "learning_rate": 1.928519260863131e-05, "loss": 1.0355012893676758, "num_input_tokens_seen": 16273134592, "step": 57220, "train_runtime": 557340.7299, "train_tokens_per_second": 29197.821 }, { "epoch": 2.024908946566506, "grad_norm": 1.609375, "learning_rate": 1.9283758264091932e-05, "loss": 1.0505844116210938, "num_input_tokens_seen": 16275985856, "step": 57230, "train_runtime": 557437.0142, "train_tokens_per_second": 29197.892 }, { "epoch": 2.025262766830235, "grad_norm": 1.5390625, "learning_rate": 1.9282324239544938e-05, "loss": 1.0407686233520508, "num_input_tokens_seen": 16278872896, "step": 57240, "train_runtime": 557538.8864, "train_tokens_per_second": 29197.735 }, { "epoch": 2.0256165870939635, "grad_norm": 1.625, "learning_rate": 1.9280890534871375e-05, "loss": 1.03466854095459, "num_input_tokens_seen": 16281744064, "step": 57250, "train_runtime": 557637.7775, "train_tokens_per_second": 29197.706 }, { "epoch": 2.0259704073576925, "grad_norm": 1.59375, "learning_rate": 1.9279457149952333e-05, "loss": 1.0320151329040528, "num_input_tokens_seen": 16284558848, "step": 57260, "train_runtime": 557733.7053, "train_tokens_per_second": 29197.731 }, { "epoch": 2.026324227621421, "grad_norm": 1.578125, "learning_rate": 1.9278024084668976e-05, "loss": 1.0376224517822266, "num_input_tokens_seen": 16287411648, "step": 57270, "train_runtime": 557832.0414, "train_tokens_per_second": 29197.698 }, { "epoch": 2.02667804788515, "grad_norm": 1.5234375, "learning_rate": 1.9276591338902524e-05, "loss": 1.0234363555908204, "num_input_tokens_seen": 16290273344, "step": 57280, "train_runtime": 557930.2274, "train_tokens_per_second": 29197.689 }, { "epoch": 2.0270318681488786, "grad_norm": 1.578125, "learning_rate": 1.9275158912534273e-05, "loss": 1.0486383438110352, "num_input_tokens_seen": 16293120320, "step": 57290, "train_runtime": 558027.9399, "train_tokens_per_second": 29197.678 }, { "epoch": 2.0273856884126076, "grad_norm": 1.625, "learning_rate": 1.9273726805445557e-05, "loss": 1.0428855895996094, "num_input_tokens_seen": 16295982912, "step": 57300, "train_runtime": 558125.3116, "train_tokens_per_second": 29197.713 }, { "epoch": 2.027739508676336, "grad_norm": 1.5625, "learning_rate": 1.927229501751779e-05, "loss": 1.0253484725952149, "num_input_tokens_seen": 16298892096, "step": 57310, "train_runtime": 558227.8805, "train_tokens_per_second": 29197.56 }, { "epoch": 2.028093328940065, "grad_norm": 1.6015625, "learning_rate": 1.9270863548632443e-05, "loss": 1.0397038459777832, "num_input_tokens_seen": 16301703744, "step": 57320, "train_runtime": 558320.2741, "train_tokens_per_second": 29197.764 }, { "epoch": 2.0284471492037937, "grad_norm": 1.6484375, "learning_rate": 1.9269432398671045e-05, "loss": 1.0432754516601563, "num_input_tokens_seen": 16304540672, "step": 57330, "train_runtime": 558419.0604, "train_tokens_per_second": 29197.679 }, { "epoch": 2.0288009694675226, "grad_norm": 1.5703125, "learning_rate": 1.926800156751519e-05, "loss": 1.038361167907715, "num_input_tokens_seen": 16307324480, "step": 57340, "train_runtime": 558513.3936, "train_tokens_per_second": 29197.732 }, { "epoch": 2.029154789731251, "grad_norm": 1.5703125, "learning_rate": 1.9266571055046537e-05, "loss": 1.0277355194091797, "num_input_tokens_seen": 16310174400, "step": 57350, "train_runtime": 558611.3636, "train_tokens_per_second": 29197.713 }, { "epoch": 2.02950860999498, "grad_norm": 1.71875, "learning_rate": 1.9265140861146795e-05, "loss": 1.0390813827514649, "num_input_tokens_seen": 16313056256, "step": 57360, "train_runtime": 558712.2934, "train_tokens_per_second": 29197.597 }, { "epoch": 2.029862430258709, "grad_norm": 1.5703125, "learning_rate": 1.9263710985697744e-05, "loss": 1.0354751586914062, "num_input_tokens_seen": 16315897216, "step": 57370, "train_runtime": 558808.464, "train_tokens_per_second": 29197.656 }, { "epoch": 2.0302162505224377, "grad_norm": 1.6171875, "learning_rate": 1.9262281428581227e-05, "loss": 1.0366113662719727, "num_input_tokens_seen": 16318746432, "step": 57380, "train_runtime": 558905.2477, "train_tokens_per_second": 29197.698 }, { "epoch": 2.0305700707861667, "grad_norm": 1.578125, "learning_rate": 1.926085218967914e-05, "loss": 1.0358667373657227, "num_input_tokens_seen": 16321615360, "step": 57390, "train_runtime": 559002.1008, "train_tokens_per_second": 29197.771 }, { "epoch": 2.0309238910498952, "grad_norm": 1.546875, "learning_rate": 1.925942326887345e-05, "loss": 1.0259176254272462, "num_input_tokens_seen": 16324460160, "step": 57400, "train_runtime": 559102.5191, "train_tokens_per_second": 29197.615 }, { "epoch": 2.0312777113136242, "grad_norm": 1.59375, "learning_rate": 1.925799466604617e-05, "loss": 1.0319955825805665, "num_input_tokens_seen": 16327308032, "step": 57410, "train_runtime": 559200.3824, "train_tokens_per_second": 29197.598 }, { "epoch": 2.0316315315773528, "grad_norm": 1.609375, "learning_rate": 1.9256566381079393e-05, "loss": 1.0251970291137695, "num_input_tokens_seen": 16330159360, "step": 57420, "train_runtime": 559298.9444, "train_tokens_per_second": 29197.551 }, { "epoch": 2.0319853518410818, "grad_norm": 1.609375, "learning_rate": 1.9255138413855265e-05, "loss": 1.0355701446533203, "num_input_tokens_seen": 16333020608, "step": 57430, "train_runtime": 559398.6009, "train_tokens_per_second": 29197.464 }, { "epoch": 2.0323391721048103, "grad_norm": 1.5546875, "learning_rate": 1.9253710764255987e-05, "loss": 1.0507987976074218, "num_input_tokens_seen": 16335876224, "step": 57440, "train_runtime": 559494.5774, "train_tokens_per_second": 29197.56 }, { "epoch": 2.0326929923685393, "grad_norm": 1.625, "learning_rate": 1.925228343216383e-05, "loss": 1.041071319580078, "num_input_tokens_seen": 16338737920, "step": 57450, "train_runtime": 559591.3703, "train_tokens_per_second": 29197.623 }, { "epoch": 2.033046812632268, "grad_norm": 1.609375, "learning_rate": 1.925085641746113e-05, "loss": 1.029276466369629, "num_input_tokens_seen": 16341589632, "step": 57460, "train_runtime": 559685.3211, "train_tokens_per_second": 29197.817 }, { "epoch": 2.033400632895997, "grad_norm": 1.5703125, "learning_rate": 1.9249429720030262e-05, "loss": 1.0252897262573242, "num_input_tokens_seen": 16344415744, "step": 57470, "train_runtime": 559779.3407, "train_tokens_per_second": 29197.962 }, { "epoch": 2.0337544531597254, "grad_norm": 1.59375, "learning_rate": 1.9248003339753688e-05, "loss": 1.0281572341918945, "num_input_tokens_seen": 16347214720, "step": 57480, "train_runtime": 559874.0953, "train_tokens_per_second": 29198.019 }, { "epoch": 2.0341082734234543, "grad_norm": 1.578125, "learning_rate": 1.9246577276513916e-05, "loss": 1.0357099533081056, "num_input_tokens_seen": 16350015872, "step": 57490, "train_runtime": 559972.4165, "train_tokens_per_second": 29197.895 }, { "epoch": 2.034462093687183, "grad_norm": 1.703125, "learning_rate": 1.9245151530193517e-05, "loss": 1.030306625366211, "num_input_tokens_seen": 16352839488, "step": 57500, "train_runtime": 560069.9038, "train_tokens_per_second": 29197.854 }, { "epoch": 2.034815913950912, "grad_norm": 1.5546875, "learning_rate": 1.9243726100675132e-05, "loss": 1.0379362106323242, "num_input_tokens_seen": 16355633728, "step": 57510, "train_runtime": 560164.9437, "train_tokens_per_second": 29197.889 }, { "epoch": 2.0351697342146404, "grad_norm": 1.671875, "learning_rate": 1.924230098784145e-05, "loss": 1.0375543594360352, "num_input_tokens_seen": 16358462400, "step": 57520, "train_runtime": 560261.2931, "train_tokens_per_second": 29197.916 }, { "epoch": 2.0355235544783694, "grad_norm": 1.5390625, "learning_rate": 1.9240876191575226e-05, "loss": 1.0434162139892578, "num_input_tokens_seen": 16361296448, "step": 57530, "train_runtime": 560356.6113, "train_tokens_per_second": 29198.007 }, { "epoch": 2.0358773747420984, "grad_norm": 1.578125, "learning_rate": 1.923945171175928e-05, "loss": 1.042367935180664, "num_input_tokens_seen": 16364104640, "step": 57540, "train_runtime": 560453.6306, "train_tokens_per_second": 29197.963 }, { "epoch": 2.036231195005827, "grad_norm": 1.6875, "learning_rate": 1.9238027548276487e-05, "loss": 1.0249635696411132, "num_input_tokens_seen": 16366969344, "step": 57550, "train_runtime": 560550.7113, "train_tokens_per_second": 29198.017 }, { "epoch": 2.036585015269556, "grad_norm": 1.6171875, "learning_rate": 1.923660370100978e-05, "loss": 1.0290655136108398, "num_input_tokens_seen": 16369761984, "step": 57560, "train_runtime": 560644.8206, "train_tokens_per_second": 29198.097 }, { "epoch": 2.0369388355332845, "grad_norm": 1.578125, "learning_rate": 1.9235180169842168e-05, "loss": 1.0353506088256836, "num_input_tokens_seen": 16372637952, "step": 57570, "train_runtime": 560743.8269, "train_tokens_per_second": 29198.071 }, { "epoch": 2.0372926557970135, "grad_norm": 1.5546875, "learning_rate": 1.9233756954656694e-05, "loss": 1.0397926330566407, "num_input_tokens_seen": 16375454912, "step": 57580, "train_runtime": 560840.2624, "train_tokens_per_second": 29198.073 }, { "epoch": 2.037646476060742, "grad_norm": 1.6328125, "learning_rate": 1.9232334055336495e-05, "loss": 1.0434465408325195, "num_input_tokens_seen": 16378272576, "step": 57590, "train_runtime": 560936.6753, "train_tokens_per_second": 29198.078 }, { "epoch": 2.038000296324471, "grad_norm": 1.609375, "learning_rate": 1.923091147176474e-05, "loss": 1.0623882293701172, "num_input_tokens_seen": 16381104576, "step": 57600, "train_runtime": 561034.3121, "train_tokens_per_second": 29198.044 }, { "epoch": 2.0383541165881995, "grad_norm": 1.6875, "learning_rate": 1.9229489203824668e-05, "loss": 1.0376337051391602, "num_input_tokens_seen": 16383972736, "step": 57610, "train_runtime": 561134.5172, "train_tokens_per_second": 29197.941 }, { "epoch": 2.0387079368519285, "grad_norm": 1.59375, "learning_rate": 1.9228067251399588e-05, "loss": 1.0407288551330567, "num_input_tokens_seen": 16386880320, "step": 57620, "train_runtime": 561239.1045, "train_tokens_per_second": 29197.681 }, { "epoch": 2.039061757115657, "grad_norm": 1.609375, "learning_rate": 1.9226645614372854e-05, "loss": 1.0470693588256836, "num_input_tokens_seen": 16389696512, "step": 57630, "train_runtime": 561336.9563, "train_tokens_per_second": 29197.608 }, { "epoch": 2.039415577379386, "grad_norm": 1.6015625, "learning_rate": 1.922522429262789e-05, "loss": 1.0495182991027832, "num_input_tokens_seen": 16392534016, "step": 57640, "train_runtime": 561432.6841, "train_tokens_per_second": 29197.684 }, { "epoch": 2.0397693976431146, "grad_norm": 1.6015625, "learning_rate": 1.9223803286048182e-05, "loss": 1.037602996826172, "num_input_tokens_seen": 16395392576, "step": 57650, "train_runtime": 561532.3332, "train_tokens_per_second": 29197.593 }, { "epoch": 2.0401232179068436, "grad_norm": 1.59375, "learning_rate": 1.9222382594517262e-05, "loss": 1.0308095932006835, "num_input_tokens_seen": 16398186176, "step": 57660, "train_runtime": 561624.0543, "train_tokens_per_second": 29197.799 }, { "epoch": 2.040477038170572, "grad_norm": 1.59375, "learning_rate": 1.9220962217918742e-05, "loss": 1.0377174377441407, "num_input_tokens_seen": 16400999424, "step": 57670, "train_runtime": 561719.6221, "train_tokens_per_second": 29197.84 }, { "epoch": 2.040830858434301, "grad_norm": 1.6484375, "learning_rate": 1.921954215613628e-05, "loss": 1.0292688369750977, "num_input_tokens_seen": 16403853632, "step": 57680, "train_runtime": 561813.395, "train_tokens_per_second": 29198.047 }, { "epoch": 2.0411846786980297, "grad_norm": 1.4921875, "learning_rate": 1.92181224090536e-05, "loss": 1.0292903900146484, "num_input_tokens_seen": 16406737536, "step": 57690, "train_runtime": 561913.0241, "train_tokens_per_second": 29198.002 }, { "epoch": 2.0415384989617587, "grad_norm": 1.5546875, "learning_rate": 1.9216702976554487e-05, "loss": 1.0307950973510742, "num_input_tokens_seen": 16409616320, "step": 57700, "train_runtime": 562012.5703, "train_tokens_per_second": 29197.952 }, { "epoch": 2.0418923192254876, "grad_norm": 1.515625, "learning_rate": 1.9215283858522782e-05, "loss": 1.0250868797302246, "num_input_tokens_seen": 16412478848, "step": 57710, "train_runtime": 562110.8505, "train_tokens_per_second": 29197.94 }, { "epoch": 2.042246139489216, "grad_norm": 1.5625, "learning_rate": 1.9213865054842385e-05, "loss": 1.0454872131347657, "num_input_tokens_seen": 16415389632, "step": 57720, "train_runtime": 562211.0865, "train_tokens_per_second": 29197.912 }, { "epoch": 2.042599959752945, "grad_norm": 1.6171875, "learning_rate": 1.921244656539726e-05, "loss": 1.0276055335998535, "num_input_tokens_seen": 16418210240, "step": 57730, "train_runtime": 562306.2075, "train_tokens_per_second": 29197.989 }, { "epoch": 2.0429537800166737, "grad_norm": 1.6484375, "learning_rate": 1.9211028390071435e-05, "loss": 1.0251496315002442, "num_input_tokens_seen": 16421070208, "step": 57740, "train_runtime": 562405.7733, "train_tokens_per_second": 29197.905 }, { "epoch": 2.0433076002804027, "grad_norm": 1.6328125, "learning_rate": 1.9209610528748988e-05, "loss": 1.0321998596191406, "num_input_tokens_seen": 16423968064, "step": 57750, "train_runtime": 562506.5226, "train_tokens_per_second": 29197.827 }, { "epoch": 2.0436614205441312, "grad_norm": 1.546875, "learning_rate": 1.9208192981314058e-05, "loss": 1.0351585388183593, "num_input_tokens_seen": 16426784896, "step": 57760, "train_runtime": 562604.0032, "train_tokens_per_second": 29197.775 }, { "epoch": 2.0440152408078602, "grad_norm": 1.65625, "learning_rate": 1.9206775747650858e-05, "loss": 1.0321237564086914, "num_input_tokens_seen": 16429569536, "step": 57770, "train_runtime": 562697.5344, "train_tokens_per_second": 29197.87 }, { "epoch": 2.0443690610715888, "grad_norm": 1.65625, "learning_rate": 1.9205358827643647e-05, "loss": 1.0443476676940917, "num_input_tokens_seen": 16432386752, "step": 57780, "train_runtime": 562790.9124, "train_tokens_per_second": 29198.031 }, { "epoch": 2.0447228813353178, "grad_norm": 1.578125, "learning_rate": 1.9203942221176744e-05, "loss": 1.0332571029663087, "num_input_tokens_seen": 16435227136, "step": 57790, "train_runtime": 562887.3073, "train_tokens_per_second": 29198.077 }, { "epoch": 2.0450767015990463, "grad_norm": 1.578125, "learning_rate": 1.9202525928134525e-05, "loss": 1.0320326805114746, "num_input_tokens_seen": 16438072832, "step": 57800, "train_runtime": 562986.6099, "train_tokens_per_second": 29197.982 }, { "epoch": 2.0454305218627753, "grad_norm": 1.5859375, "learning_rate": 1.9201109948401445e-05, "loss": 1.027937889099121, "num_input_tokens_seen": 16440924416, "step": 57810, "train_runtime": 563085.3359, "train_tokens_per_second": 29197.927 }, { "epoch": 2.045784342126504, "grad_norm": 1.5546875, "learning_rate": 1.9199694281861996e-05, "loss": 1.0226592063903808, "num_input_tokens_seen": 16443785088, "step": 57820, "train_runtime": 563182.799, "train_tokens_per_second": 29197.953 }, { "epoch": 2.046138162390233, "grad_norm": 1.65625, "learning_rate": 1.9198278928400747e-05, "loss": 1.0281595230102538, "num_input_tokens_seen": 16446580032, "step": 57830, "train_runtime": 563277.8071, "train_tokens_per_second": 29197.99 }, { "epoch": 2.0464919826539614, "grad_norm": 1.5625, "learning_rate": 1.9196863887902305e-05, "loss": 1.0325189590454102, "num_input_tokens_seen": 16449394368, "step": 57840, "train_runtime": 563373.0008, "train_tokens_per_second": 29198.052 }, { "epoch": 2.0468458029176904, "grad_norm": 1.53125, "learning_rate": 1.919544916025136e-05, "loss": 1.0355110168457031, "num_input_tokens_seen": 16452250240, "step": 57850, "train_runtime": 563469.5077, "train_tokens_per_second": 29198.12 }, { "epoch": 2.0471996231814193, "grad_norm": 1.59375, "learning_rate": 1.919403474533265e-05, "loss": 1.0211763381958008, "num_input_tokens_seen": 16455117440, "step": 57860, "train_runtime": 563569.5881, "train_tokens_per_second": 29198.022 }, { "epoch": 2.047553443445148, "grad_norm": 1.609375, "learning_rate": 1.919262064303097e-05, "loss": 1.0576353073120117, "num_input_tokens_seen": 16457974784, "step": 57870, "train_runtime": 563667.7081, "train_tokens_per_second": 29198.009 }, { "epoch": 2.047907263708877, "grad_norm": 1.578125, "learning_rate": 1.9191206853231182e-05, "loss": 1.0389991760253907, "num_input_tokens_seen": 16460806592, "step": 57880, "train_runtime": 563763.3907, "train_tokens_per_second": 29198.076 }, { "epoch": 2.0482610839726054, "grad_norm": 1.53125, "learning_rate": 1.9189793375818203e-05, "loss": 1.0339197158813476, "num_input_tokens_seen": 16463637056, "step": 57890, "train_runtime": 563864.2336, "train_tokens_per_second": 29197.874 }, { "epoch": 2.0486149042363344, "grad_norm": 1.546875, "learning_rate": 1.9188380210677005e-05, "loss": 1.04565372467041, "num_input_tokens_seen": 16466482944, "step": 57900, "train_runtime": 563959.4225, "train_tokens_per_second": 29197.992 }, { "epoch": 2.048968724500063, "grad_norm": 1.53125, "learning_rate": 1.9186967357692633e-05, "loss": 1.043147659301758, "num_input_tokens_seen": 16469398272, "step": 57910, "train_runtime": 564062.497, "train_tokens_per_second": 29197.825 }, { "epoch": 2.049322544763792, "grad_norm": 1.5625, "learning_rate": 1.918555481675017e-05, "loss": 1.0221847534179687, "num_input_tokens_seen": 16472209088, "step": 57920, "train_runtime": 564159.9423, "train_tokens_per_second": 29197.764 }, { "epoch": 2.0496763650275205, "grad_norm": 1.625, "learning_rate": 1.9184142587734786e-05, "loss": 1.0383444786071778, "num_input_tokens_seen": 16475035968, "step": 57930, "train_runtime": 564258.0903, "train_tokens_per_second": 29197.696 }, { "epoch": 2.0500301852912495, "grad_norm": 1.5859375, "learning_rate": 1.918273067053168e-05, "loss": 1.0323399543762206, "num_input_tokens_seen": 16477834560, "step": 57940, "train_runtime": 564352.4261, "train_tokens_per_second": 29197.774 }, { "epoch": 2.050384005554978, "grad_norm": 1.6171875, "learning_rate": 1.9181319065026137e-05, "loss": 1.0297275543212892, "num_input_tokens_seen": 16480694144, "step": 57950, "train_runtime": 564450.7869, "train_tokens_per_second": 29197.752 }, { "epoch": 2.050737825818707, "grad_norm": 1.5625, "learning_rate": 1.9179907771103482e-05, "loss": 1.049105453491211, "num_input_tokens_seen": 16483574144, "step": 57960, "train_runtime": 564553.6352, "train_tokens_per_second": 29197.534 }, { "epoch": 2.0510916460824355, "grad_norm": 1.53125, "learning_rate": 1.9178496788649106e-05, "loss": 1.026939868927002, "num_input_tokens_seen": 16486465920, "step": 57970, "train_runtime": 564650.3181, "train_tokens_per_second": 29197.656 }, { "epoch": 2.0514454663461645, "grad_norm": 1.5625, "learning_rate": 1.9177086117548462e-05, "loss": 1.0285067558288574, "num_input_tokens_seen": 16489395392, "step": 57980, "train_runtime": 564754.1466, "train_tokens_per_second": 29197.476 }, { "epoch": 2.051799286609893, "grad_norm": 1.609375, "learning_rate": 1.917567575768706e-05, "loss": 1.0358930587768556, "num_input_tokens_seen": 16492230464, "step": 57990, "train_runtime": 564850.5637, "train_tokens_per_second": 29197.511 }, { "epoch": 2.052153106873622, "grad_norm": 1.6171875, "learning_rate": 1.9174265708950457e-05, "loss": 1.0296175956726075, "num_input_tokens_seen": 16495102592, "step": 58000, "train_runtime": 564951.1727, "train_tokens_per_second": 29197.395 }, { "epoch": 2.0525069271373506, "grad_norm": 1.5859375, "learning_rate": 1.91728559712243e-05, "loss": 1.0306512832641601, "num_input_tokens_seen": 16497938880, "step": 58010, "train_runtime": 565049.7448, "train_tokens_per_second": 29197.321 }, { "epoch": 2.0528607474010796, "grad_norm": 1.609375, "learning_rate": 1.9171446544394252e-05, "loss": 1.0348872184753417, "num_input_tokens_seen": 16500778368, "step": 58020, "train_runtime": 565146.3757, "train_tokens_per_second": 29197.353 }, { "epoch": 2.0532145676648086, "grad_norm": 1.5859375, "learning_rate": 1.9170037428346075e-05, "loss": 1.026598072052002, "num_input_tokens_seen": 16503592896, "step": 58030, "train_runtime": 565243.7715, "train_tokens_per_second": 29197.302 }, { "epoch": 2.053568387928537, "grad_norm": 1.5703125, "learning_rate": 1.9168628622965565e-05, "loss": 1.0263011932373047, "num_input_tokens_seen": 16506471616, "step": 58040, "train_runtime": 565343.6128, "train_tokens_per_second": 29197.237 }, { "epoch": 2.053922208192266, "grad_norm": 1.609375, "learning_rate": 1.916722012813858e-05, "loss": 1.040518569946289, "num_input_tokens_seen": 16509271680, "step": 58050, "train_runtime": 565439.2616, "train_tokens_per_second": 29197.25 }, { "epoch": 2.0542760284559947, "grad_norm": 1.6328125, "learning_rate": 1.916581194375105e-05, "loss": 1.0373828887939454, "num_input_tokens_seen": 16512101888, "step": 58060, "train_runtime": 565531.5951, "train_tokens_per_second": 29197.488 }, { "epoch": 2.0546298487197237, "grad_norm": 1.5625, "learning_rate": 1.916440406968895e-05, "loss": 1.0361350059509278, "num_input_tokens_seen": 16514964032, "step": 58070, "train_runtime": 565629.402, "train_tokens_per_second": 29197.499 }, { "epoch": 2.054983668983452, "grad_norm": 1.546875, "learning_rate": 1.9162996505838317e-05, "loss": 1.0231544494628906, "num_input_tokens_seen": 16517902080, "step": 58080, "train_runtime": 565731.6661, "train_tokens_per_second": 29197.415 }, { "epoch": 2.055337489247181, "grad_norm": 1.5703125, "learning_rate": 1.9161589252085248e-05, "loss": 1.029248046875, "num_input_tokens_seen": 16520802944, "step": 58090, "train_runtime": 565833.4604, "train_tokens_per_second": 29197.289 }, { "epoch": 2.0556913095109097, "grad_norm": 1.515625, "learning_rate": 1.9160182308315897e-05, "loss": 1.0270279884338378, "num_input_tokens_seen": 16523652480, "step": 58100, "train_runtime": 565932.863, "train_tokens_per_second": 29197.196 }, { "epoch": 2.0560451297746387, "grad_norm": 1.59375, "learning_rate": 1.9158775674416478e-05, "loss": 1.0436508178710937, "num_input_tokens_seen": 16526456192, "step": 58110, "train_runtime": 566024.6098, "train_tokens_per_second": 29197.416 }, { "epoch": 2.0563989500383673, "grad_norm": 1.65625, "learning_rate": 1.9157369350273266e-05, "loss": 1.043671226501465, "num_input_tokens_seen": 16529326656, "step": 58120, "train_runtime": 566124.6475, "train_tokens_per_second": 29197.327 }, { "epoch": 2.0567527703020962, "grad_norm": 1.6171875, "learning_rate": 1.9155963335772588e-05, "loss": 1.0381614685058593, "num_input_tokens_seen": 16532169472, "step": 58130, "train_runtime": 566220.7078, "train_tokens_per_second": 29197.395 }, { "epoch": 2.057106590565825, "grad_norm": 1.5703125, "learning_rate": 1.9154557630800835e-05, "loss": 1.0427223205566407, "num_input_tokens_seen": 16535058240, "step": 58140, "train_runtime": 566319.8123, "train_tokens_per_second": 29197.386 }, { "epoch": 2.0574604108295538, "grad_norm": 1.5859375, "learning_rate": 1.9153152235244455e-05, "loss": 1.020967674255371, "num_input_tokens_seen": 16537861632, "step": 58150, "train_runtime": 566416.8155, "train_tokens_per_second": 29197.335 }, { "epoch": 2.0578142310932823, "grad_norm": 1.5625, "learning_rate": 1.9151747148989955e-05, "loss": 1.0378662109375, "num_input_tokens_seen": 16540702272, "step": 58160, "train_runtime": 566514.8055, "train_tokens_per_second": 29197.299 }, { "epoch": 2.0581680513570113, "grad_norm": 1.671875, "learning_rate": 1.915034237192389e-05, "loss": 1.0468915939331054, "num_input_tokens_seen": 16543565632, "step": 58170, "train_runtime": 566613.8922, "train_tokens_per_second": 29197.247 }, { "epoch": 2.05852187162074, "grad_norm": 1.5859375, "learning_rate": 1.9148937903932894e-05, "loss": 1.0389482498168945, "num_input_tokens_seen": 16546400960, "step": 58180, "train_runtime": 566710.1844, "train_tokens_per_second": 29197.289 }, { "epoch": 2.058875691884469, "grad_norm": 1.625, "learning_rate": 1.9147533744903633e-05, "loss": 1.0334646224975585, "num_input_tokens_seen": 16549215936, "step": 58190, "train_runtime": 566804.0591, "train_tokens_per_second": 29197.42 }, { "epoch": 2.059229512148198, "grad_norm": 1.5546875, "learning_rate": 1.9146129894722863e-05, "loss": 1.0363191604614257, "num_input_tokens_seen": 16552081728, "step": 58200, "train_runtime": 566901.0766, "train_tokens_per_second": 29197.478 }, { "epoch": 2.0595833324119264, "grad_norm": 1.65625, "learning_rate": 1.9144726353277365e-05, "loss": 1.0166563034057616, "num_input_tokens_seen": 16554895168, "step": 58210, "train_runtime": 566998.4619, "train_tokens_per_second": 29197.425 }, { "epoch": 2.0599371526756554, "grad_norm": 1.53125, "learning_rate": 1.9143323120453997e-05, "loss": 1.0348012924194336, "num_input_tokens_seen": 16557778880, "step": 58220, "train_runtime": 567100.7628, "train_tokens_per_second": 29197.243 }, { "epoch": 2.060290972939384, "grad_norm": 1.6328125, "learning_rate": 1.9141920196139683e-05, "loss": 1.045072364807129, "num_input_tokens_seen": 16560576960, "step": 58230, "train_runtime": 567195.5528, "train_tokens_per_second": 29197.297 }, { "epoch": 2.060644793203113, "grad_norm": 1.5859375, "learning_rate": 1.914051758022138e-05, "loss": 1.0280696868896484, "num_input_tokens_seen": 16563413696, "step": 58240, "train_runtime": 567294.7905, "train_tokens_per_second": 29197.19 }, { "epoch": 2.0609986134668414, "grad_norm": 1.5625, "learning_rate": 1.9139115272586125e-05, "loss": 1.0366331100463868, "num_input_tokens_seen": 16566302912, "step": 58250, "train_runtime": 567392.6032, "train_tokens_per_second": 29197.249 }, { "epoch": 2.0613524337305704, "grad_norm": 1.59375, "learning_rate": 1.9137713273121004e-05, "loss": 1.0313226699829101, "num_input_tokens_seen": 16569132608, "step": 58260, "train_runtime": 567488.8508, "train_tokens_per_second": 29197.283 }, { "epoch": 2.061706253994299, "grad_norm": 1.5625, "learning_rate": 1.913631158171315e-05, "loss": 1.0396224021911622, "num_input_tokens_seen": 16571966016, "step": 58270, "train_runtime": 567585.9006, "train_tokens_per_second": 29197.283 }, { "epoch": 2.062060074258028, "grad_norm": 1.609375, "learning_rate": 1.9134910198249782e-05, "loss": 1.0302993774414062, "num_input_tokens_seen": 16574814464, "step": 58280, "train_runtime": 567685.1079, "train_tokens_per_second": 29197.198 }, { "epoch": 2.0624138945217565, "grad_norm": 1.609375, "learning_rate": 1.9133509122618147e-05, "loss": 1.0295278549194335, "num_input_tokens_seen": 16577656832, "step": 58290, "train_runtime": 567782.8833, "train_tokens_per_second": 29197.176 }, { "epoch": 2.0627677147854855, "grad_norm": 1.5625, "learning_rate": 1.913210835470557e-05, "loss": 1.030609703063965, "num_input_tokens_seen": 16580464512, "step": 58300, "train_runtime": 567879.5413, "train_tokens_per_second": 29197.151 }, { "epoch": 2.063121535049214, "grad_norm": 1.59375, "learning_rate": 1.9130707894399428e-05, "loss": 1.0418007850646973, "num_input_tokens_seen": 16583327232, "step": 58310, "train_runtime": 567978.6074, "train_tokens_per_second": 29197.098 }, { "epoch": 2.063475355312943, "grad_norm": 1.5703125, "learning_rate": 1.9129307741587146e-05, "loss": 1.039077377319336, "num_input_tokens_seen": 16586220096, "step": 58320, "train_runtime": 568079.5673, "train_tokens_per_second": 29197.002 }, { "epoch": 2.0638291755766716, "grad_norm": 1.625, "learning_rate": 1.9127907896156226e-05, "loss": 1.0387752532958985, "num_input_tokens_seen": 16589100800, "step": 58330, "train_runtime": 568179.6997, "train_tokens_per_second": 29196.926 }, { "epoch": 2.0641829958404005, "grad_norm": 1.5546875, "learning_rate": 1.9126508357994205e-05, "loss": 1.0419276237487793, "num_input_tokens_seen": 16591993792, "step": 58340, "train_runtime": 568280.2712, "train_tokens_per_second": 29196.85 }, { "epoch": 2.064536816104129, "grad_norm": 1.578125, "learning_rate": 1.9125109126988696e-05, "loss": 1.0233539581298827, "num_input_tokens_seen": 16594866560, "step": 58350, "train_runtime": 568378.7984, "train_tokens_per_second": 29196.843 }, { "epoch": 2.064890636367858, "grad_norm": 1.6328125, "learning_rate": 1.9123710203027365e-05, "loss": 1.0337127685546874, "num_input_tokens_seen": 16597712704, "step": 58360, "train_runtime": 568477.5158, "train_tokens_per_second": 29196.78 }, { "epoch": 2.065244456631587, "grad_norm": 1.5859375, "learning_rate": 1.9122311585997927e-05, "loss": 1.030392837524414, "num_input_tokens_seen": 16600563392, "step": 58370, "train_runtime": 568574.7859, "train_tokens_per_second": 29196.798 }, { "epoch": 2.0655982768953156, "grad_norm": 1.5546875, "learning_rate": 1.9120913275788162e-05, "loss": 1.0501530647277832, "num_input_tokens_seen": 16603433600, "step": 58380, "train_runtime": 568674.0587, "train_tokens_per_second": 29196.749 }, { "epoch": 2.0659520971590446, "grad_norm": 1.578125, "learning_rate": 1.9119515272285913e-05, "loss": 1.0417156219482422, "num_input_tokens_seen": 16606308032, "step": 58390, "train_runtime": 568775.1947, "train_tokens_per_second": 29196.611 }, { "epoch": 2.066305917422773, "grad_norm": 1.59375, "learning_rate": 1.9118117575379065e-05, "loss": 1.0251537322998048, "num_input_tokens_seen": 16609180992, "step": 58400, "train_runtime": 568874.5186, "train_tokens_per_second": 29196.563 }, { "epoch": 2.066659737686502, "grad_norm": 1.6015625, "learning_rate": 1.9116720184955574e-05, "loss": 1.0392258644104004, "num_input_tokens_seen": 16612066880, "step": 58410, "train_runtime": 568973.5894, "train_tokens_per_second": 29196.552 }, { "epoch": 2.0670135579502307, "grad_norm": 1.5625, "learning_rate": 1.9115323100903446e-05, "loss": 1.0334272384643555, "num_input_tokens_seen": 16614880960, "step": 58420, "train_runtime": 569070.7166, "train_tokens_per_second": 29196.514 }, { "epoch": 2.0673673782139597, "grad_norm": 1.6484375, "learning_rate": 1.9113926323110748e-05, "loss": 1.032242774963379, "num_input_tokens_seen": 16617709824, "step": 58430, "train_runtime": 569165.8198, "train_tokens_per_second": 29196.605 }, { "epoch": 2.067721198477688, "grad_norm": 1.59375, "learning_rate": 1.9112529851465603e-05, "loss": 1.023686122894287, "num_input_tokens_seen": 16620580800, "step": 58440, "train_runtime": 569262.9724, "train_tokens_per_second": 29196.666 }, { "epoch": 2.068075018741417, "grad_norm": 1.6015625, "learning_rate": 1.911113368585619e-05, "loss": 1.0176047325134276, "num_input_tokens_seen": 16623380800, "step": 58450, "train_runtime": 569357.8083, "train_tokens_per_second": 29196.721 }, { "epoch": 2.0684288390051457, "grad_norm": 1.546875, "learning_rate": 1.910973782617074e-05, "loss": 1.0211217880249024, "num_input_tokens_seen": 16626224128, "step": 58460, "train_runtime": 569457.7301, "train_tokens_per_second": 29196.59 }, { "epoch": 2.0687826592688747, "grad_norm": 1.5859375, "learning_rate": 1.9108342272297558e-05, "loss": 1.0257566452026368, "num_input_tokens_seen": 16629075392, "step": 58470, "train_runtime": 569555.6044, "train_tokens_per_second": 29196.579 }, { "epoch": 2.0691364795326033, "grad_norm": 1.6171875, "learning_rate": 1.910694702412499e-05, "loss": 1.0228387832641601, "num_input_tokens_seen": 16631960256, "step": 58480, "train_runtime": 569654.5486, "train_tokens_per_second": 29196.572 }, { "epoch": 2.0694902997963323, "grad_norm": 1.6484375, "learning_rate": 1.9105552081541444e-05, "loss": 1.0398197174072266, "num_input_tokens_seen": 16634859328, "step": 58490, "train_runtime": 569754.8445, "train_tokens_per_second": 29196.521 }, { "epoch": 2.069844120060061, "grad_norm": 1.6328125, "learning_rate": 1.910415744443539e-05, "loss": 1.0222100257873534, "num_input_tokens_seen": 16637724160, "step": 58500, "train_runtime": 569852.2777, "train_tokens_per_second": 29196.556 }, { "epoch": 2.07019794032379, "grad_norm": 1.6015625, "learning_rate": 1.9102763112695343e-05, "loss": 1.0228023529052734, "num_input_tokens_seen": 16640587520, "step": 58510, "train_runtime": 569953.1059, "train_tokens_per_second": 29196.415 }, { "epoch": 2.0705517605875183, "grad_norm": 1.5546875, "learning_rate": 1.910136908620989e-05, "loss": 1.039698600769043, "num_input_tokens_seen": 16643402432, "step": 58520, "train_runtime": 570048.6619, "train_tokens_per_second": 29196.459 }, { "epoch": 2.0709055808512473, "grad_norm": 1.5625, "learning_rate": 1.9099975364867663e-05, "loss": 1.0320343017578124, "num_input_tokens_seen": 16646235200, "step": 58530, "train_runtime": 570147.7393, "train_tokens_per_second": 29196.354 }, { "epoch": 2.0712594011149763, "grad_norm": 1.625, "learning_rate": 1.9098581948557356e-05, "loss": 1.0392239570617676, "num_input_tokens_seen": 16649072384, "step": 58540, "train_runtime": 570244.9086, "train_tokens_per_second": 29196.354 }, { "epoch": 2.071613221378705, "grad_norm": 1.625, "learning_rate": 1.909718883716772e-05, "loss": 1.0333748817443849, "num_input_tokens_seen": 16651890624, "step": 58550, "train_runtime": 570342.9052, "train_tokens_per_second": 29196.279 }, { "epoch": 2.071967041642434, "grad_norm": 1.65625, "learning_rate": 1.9095796030587556e-05, "loss": 1.0344162940979005, "num_input_tokens_seen": 16654746560, "step": 58560, "train_runtime": 570442.2426, "train_tokens_per_second": 29196.201 }, { "epoch": 2.0723208619061624, "grad_norm": 1.53125, "learning_rate": 1.9094403528705734e-05, "loss": 1.0420707702636718, "num_input_tokens_seen": 16657629760, "step": 58570, "train_runtime": 570544.2953, "train_tokens_per_second": 29196.032 }, { "epoch": 2.0726746821698914, "grad_norm": 1.65625, "learning_rate": 1.9093011331411173e-05, "loss": 1.0428474426269532, "num_input_tokens_seen": 16660483520, "step": 58580, "train_runtime": 570641.5384, "train_tokens_per_second": 29196.058 }, { "epoch": 2.07302850243362, "grad_norm": 1.546875, "learning_rate": 1.9091619438592854e-05, "loss": 1.0476306915283202, "num_input_tokens_seen": 16663353984, "step": 58590, "train_runtime": 570739.6821, "train_tokens_per_second": 29196.067 }, { "epoch": 2.073382322697349, "grad_norm": 1.5390625, "learning_rate": 1.90902278501398e-05, "loss": 1.0440097808837892, "num_input_tokens_seen": 16666182080, "step": 58600, "train_runtime": 570833.441, "train_tokens_per_second": 29196.226 }, { "epoch": 2.0737361429610774, "grad_norm": 1.65625, "learning_rate": 1.908883656594111e-05, "loss": 1.0377010345458983, "num_input_tokens_seen": 16669053312, "step": 58610, "train_runtime": 570932.1076, "train_tokens_per_second": 29196.209 }, { "epoch": 2.0740899632248064, "grad_norm": 1.59375, "learning_rate": 1.9087445585885926e-05, "loss": 1.0255504608154298, "num_input_tokens_seen": 16671956672, "step": 58620, "train_runtime": 571034.4507, "train_tokens_per_second": 29196.061 }, { "epoch": 2.074443783488535, "grad_norm": 1.59375, "learning_rate": 1.9086054909863457e-05, "loss": 1.038637924194336, "num_input_tokens_seen": 16674774464, "step": 58630, "train_runtime": 571130.2524, "train_tokens_per_second": 29196.097 }, { "epoch": 2.074797603752264, "grad_norm": 1.625, "learning_rate": 1.9084664537762958e-05, "loss": 1.0371227264404297, "num_input_tokens_seen": 16677654784, "step": 58640, "train_runtime": 571230.3412, "train_tokens_per_second": 29196.024 }, { "epoch": 2.0751514240159925, "grad_norm": 1.5703125, "learning_rate": 1.9083274469473747e-05, "loss": 1.0381196975708007, "num_input_tokens_seen": 16680489984, "step": 58650, "train_runtime": 571328.8064, "train_tokens_per_second": 29195.955 }, { "epoch": 2.0755052442797215, "grad_norm": 1.578125, "learning_rate": 1.9081884704885193e-05, "loss": 1.0182079315185546, "num_input_tokens_seen": 16683313088, "step": 58660, "train_runtime": 571425.517, "train_tokens_per_second": 29195.954 }, { "epoch": 2.07585906454345, "grad_norm": 1.5859375, "learning_rate": 1.9080495243886733e-05, "loss": 1.0345094680786133, "num_input_tokens_seen": 16686174720, "step": 58670, "train_runtime": 571525.4325, "train_tokens_per_second": 29195.857 }, { "epoch": 2.076212884807179, "grad_norm": 1.5234375, "learning_rate": 1.9079106086367845e-05, "loss": 1.0424606323242187, "num_input_tokens_seen": 16689068864, "step": 58680, "train_runtime": 571626.147, "train_tokens_per_second": 29195.776 }, { "epoch": 2.076566705070908, "grad_norm": 1.671875, "learning_rate": 1.9077717232218072e-05, "loss": 1.0309646606445313, "num_input_tokens_seen": 16691909440, "step": 58690, "train_runtime": 571724.3104, "train_tokens_per_second": 29195.731 }, { "epoch": 2.0769205253346366, "grad_norm": 1.546875, "learning_rate": 1.9076328681327017e-05, "loss": 1.040402317047119, "num_input_tokens_seen": 16694771648, "step": 58700, "train_runtime": 571822.3247, "train_tokens_per_second": 29195.733 }, { "epoch": 2.0772743455983655, "grad_norm": 1.640625, "learning_rate": 1.907494043358433e-05, "loss": 1.0152390480041504, "num_input_tokens_seen": 16697627008, "step": 58710, "train_runtime": 571919.9663, "train_tokens_per_second": 29195.741 }, { "epoch": 2.077628165862094, "grad_norm": 1.53125, "learning_rate": 1.9073552488879724e-05, "loss": 1.0357354164123536, "num_input_tokens_seen": 16700488768, "step": 58720, "train_runtime": 572019.5804, "train_tokens_per_second": 29195.659 }, { "epoch": 2.077981986125823, "grad_norm": 1.640625, "learning_rate": 1.907216484710296e-05, "loss": 1.0501632690429688, "num_input_tokens_seen": 16703329920, "step": 58730, "train_runtime": 572114.3139, "train_tokens_per_second": 29195.791 }, { "epoch": 2.0783358063895516, "grad_norm": 1.609375, "learning_rate": 1.9070777508143868e-05, "loss": 1.0495062828063966, "num_input_tokens_seen": 16706194816, "step": 58740, "train_runtime": 572214.6387, "train_tokens_per_second": 29195.679 }, { "epoch": 2.0786896266532806, "grad_norm": 1.5390625, "learning_rate": 1.9069390471892324e-05, "loss": 1.0361085891723634, "num_input_tokens_seen": 16708993728, "step": 58750, "train_runtime": 572308.581, "train_tokens_per_second": 29195.777 }, { "epoch": 2.079043446917009, "grad_norm": 1.640625, "learning_rate": 1.9068003738238263e-05, "loss": 1.045902919769287, "num_input_tokens_seen": 16711879168, "step": 58760, "train_runtime": 572406.8268, "train_tokens_per_second": 29195.807 }, { "epoch": 2.079397267180738, "grad_norm": 1.609375, "learning_rate": 1.9066617307071674e-05, "loss": 1.0319135665893555, "num_input_tokens_seen": 16714695232, "step": 58770, "train_runtime": 572505.9832, "train_tokens_per_second": 29195.669 }, { "epoch": 2.0797510874444667, "grad_norm": 1.546875, "learning_rate": 1.9065231178282607e-05, "loss": 1.0334832191467285, "num_input_tokens_seen": 16717574208, "step": 58780, "train_runtime": 572603.3838, "train_tokens_per_second": 29195.731 }, { "epoch": 2.0801049077081957, "grad_norm": 1.7109375, "learning_rate": 1.906384535176116e-05, "loss": 1.0423397064208983, "num_input_tokens_seen": 16720437760, "step": 58790, "train_runtime": 572703.1353, "train_tokens_per_second": 29195.646 }, { "epoch": 2.080458727971924, "grad_norm": 1.59375, "learning_rate": 1.90624598273975e-05, "loss": 1.0292854309082031, "num_input_tokens_seen": 16723306368, "step": 58800, "train_runtime": 572803.1776, "train_tokens_per_second": 29195.554 }, { "epoch": 2.080812548235653, "grad_norm": 1.546875, "learning_rate": 1.9061074605081837e-05, "loss": 1.0343957901000977, "num_input_tokens_seen": 16726129088, "step": 58810, "train_runtime": 572898.5029, "train_tokens_per_second": 29195.624 }, { "epoch": 2.0811663684993817, "grad_norm": 1.5, "learning_rate": 1.905968968470444e-05, "loss": 1.0237627029418945, "num_input_tokens_seen": 16728959232, "step": 58820, "train_runtime": 572993.7791, "train_tokens_per_second": 29195.708 }, { "epoch": 2.0815201887631107, "grad_norm": 1.609375, "learning_rate": 1.9058305066155632e-05, "loss": 1.0353080749511718, "num_input_tokens_seen": 16731800960, "step": 58830, "train_runtime": 573091.854, "train_tokens_per_second": 29195.671 }, { "epoch": 2.0818740090268393, "grad_norm": 1.59375, "learning_rate": 1.9056920749325805e-05, "loss": 1.0300054550170898, "num_input_tokens_seen": 16734670592, "step": 58840, "train_runtime": 573191.0311, "train_tokens_per_second": 29195.625 }, { "epoch": 2.0822278292905683, "grad_norm": 1.578125, "learning_rate": 1.905553673410539e-05, "loss": 1.0317919731140137, "num_input_tokens_seen": 16737600256, "step": 58850, "train_runtime": 573293.6328, "train_tokens_per_second": 29195.51 }, { "epoch": 2.082581649554297, "grad_norm": 1.6015625, "learning_rate": 1.905415302038488e-05, "loss": 1.0526699066162108, "num_input_tokens_seen": 16740470080, "step": 58860, "train_runtime": 573394.1052, "train_tokens_per_second": 29195.4 }, { "epoch": 2.082935469818026, "grad_norm": 1.546875, "learning_rate": 1.905276960805483e-05, "loss": 1.0458488464355469, "num_input_tokens_seen": 16743316864, "step": 58870, "train_runtime": 573491.6808, "train_tokens_per_second": 29195.396 }, { "epoch": 2.083289290081755, "grad_norm": 1.546875, "learning_rate": 1.9051386497005842e-05, "loss": 1.0391807556152344, "num_input_tokens_seen": 16746192640, "step": 58880, "train_runtime": 573591.0269, "train_tokens_per_second": 29195.353 }, { "epoch": 2.0836431103454833, "grad_norm": 1.578125, "learning_rate": 1.9050003687128574e-05, "loss": 1.0295869827270507, "num_input_tokens_seen": 16749062784, "step": 58890, "train_runtime": 573690.7322, "train_tokens_per_second": 29195.282 }, { "epoch": 2.0839969306092123, "grad_norm": 1.53125, "learning_rate": 1.9048621178313737e-05, "loss": 1.0254077911376953, "num_input_tokens_seen": 16751884544, "step": 58900, "train_runtime": 573789.1677, "train_tokens_per_second": 29195.191 }, { "epoch": 2.084350750872941, "grad_norm": 1.59375, "learning_rate": 1.9047238970452116e-05, "loss": 1.032361125946045, "num_input_tokens_seen": 16754719872, "step": 58910, "train_runtime": 573886.5541, "train_tokens_per_second": 29195.178 }, { "epoch": 2.08470457113667, "grad_norm": 1.5859375, "learning_rate": 1.904585706343453e-05, "loss": 1.0383284568786622, "num_input_tokens_seen": 16757534656, "step": 58920, "train_runtime": 573983.0281, "train_tokens_per_second": 29195.174 }, { "epoch": 2.0850583914003984, "grad_norm": 1.46875, "learning_rate": 1.904447545715186e-05, "loss": 1.0260854721069337, "num_input_tokens_seen": 16760392192, "step": 58930, "train_runtime": 574081.5183, "train_tokens_per_second": 29195.143 }, { "epoch": 2.0854122116641274, "grad_norm": 1.625, "learning_rate": 1.9043094151495045e-05, "loss": 1.0292816162109375, "num_input_tokens_seen": 16763251072, "step": 58940, "train_runtime": 574177.3014, "train_tokens_per_second": 29195.252 }, { "epoch": 2.085766031927856, "grad_norm": 1.6796875, "learning_rate": 1.904171314635508e-05, "loss": 1.0356107711791993, "num_input_tokens_seen": 16766037888, "step": 58950, "train_runtime": 574270.7905, "train_tokens_per_second": 29195.352 }, { "epoch": 2.086119852191585, "grad_norm": 1.5859375, "learning_rate": 1.904033244162301e-05, "loss": 1.0431496620178222, "num_input_tokens_seen": 16768900480, "step": 58960, "train_runtime": 574369.2007, "train_tokens_per_second": 29195.334 }, { "epoch": 2.0864736724553135, "grad_norm": 1.546875, "learning_rate": 1.903895203718994e-05, "loss": 1.0342815399169922, "num_input_tokens_seen": 16771760064, "step": 58970, "train_runtime": 574464.9016, "train_tokens_per_second": 29195.448 }, { "epoch": 2.0868274927190424, "grad_norm": 1.5859375, "learning_rate": 1.903757193294703e-05, "loss": 1.042623805999756, "num_input_tokens_seen": 16774568384, "step": 58980, "train_runtime": 574559.2281, "train_tokens_per_second": 29195.543 }, { "epoch": 2.087181312982771, "grad_norm": 1.5546875, "learning_rate": 1.9036192128785495e-05, "loss": 1.0449088096618653, "num_input_tokens_seen": 16777428352, "step": 58990, "train_runtime": 574660.3652, "train_tokens_per_second": 29195.381 }, { "epoch": 2.0875351332465, "grad_norm": 1.5859375, "learning_rate": 1.9034812624596605e-05, "loss": 1.0398799896240234, "num_input_tokens_seen": 16780237632, "step": 59000, "train_runtime": 574756.5396, "train_tokens_per_second": 29195.384 }, { "epoch": 2.0878889535102285, "grad_norm": 1.5703125, "learning_rate": 1.903343342027168e-05, "loss": 1.0310200691223144, "num_input_tokens_seen": 16783086208, "step": 59010, "train_runtime": 574853.7615, "train_tokens_per_second": 29195.401 }, { "epoch": 2.0882427737739575, "grad_norm": 1.6015625, "learning_rate": 1.9032054515702103e-05, "loss": 1.037808609008789, "num_input_tokens_seen": 16785940544, "step": 59020, "train_runtime": 574951.6936, "train_tokens_per_second": 29195.393 }, { "epoch": 2.0885965940376865, "grad_norm": 1.6015625, "learning_rate": 1.9030675910779307e-05, "loss": 1.0465572357177735, "num_input_tokens_seen": 16788787776, "step": 59030, "train_runtime": 575051.6673, "train_tokens_per_second": 29195.268 }, { "epoch": 2.088950414301415, "grad_norm": 1.578125, "learning_rate": 1.9029297605394782e-05, "loss": 1.0396917343139649, "num_input_tokens_seen": 16791682304, "step": 59040, "train_runtime": 575152.9535, "train_tokens_per_second": 29195.16 }, { "epoch": 2.089304234565144, "grad_norm": 1.640625, "learning_rate": 1.9027919599440077e-05, "loss": 1.039310836791992, "num_input_tokens_seen": 16794538944, "step": 59050, "train_runtime": 575252.5118, "train_tokens_per_second": 29195.073 }, { "epoch": 2.0896580548288726, "grad_norm": 1.5234375, "learning_rate": 1.9026541892806784e-05, "loss": 1.0404403686523438, "num_input_tokens_seen": 16797344256, "step": 59060, "train_runtime": 575346.4316, "train_tokens_per_second": 29195.183 }, { "epoch": 2.0900118750926016, "grad_norm": 1.59375, "learning_rate": 1.9025164485386562e-05, "loss": 1.0368450164794922, "num_input_tokens_seen": 16800192256, "step": 59070, "train_runtime": 575442.6378, "train_tokens_per_second": 29195.251 }, { "epoch": 2.09036569535633, "grad_norm": 1.5390625, "learning_rate": 1.9023787377071123e-05, "loss": 1.0284730911254882, "num_input_tokens_seen": 16803091072, "step": 59080, "train_runtime": 575543.1738, "train_tokens_per_second": 29195.188 }, { "epoch": 2.090719515620059, "grad_norm": 1.6328125, "learning_rate": 1.902241056775223e-05, "loss": 1.0286778450012206, "num_input_tokens_seen": 16805860032, "step": 59090, "train_runtime": 575638.3303, "train_tokens_per_second": 29195.172 }, { "epoch": 2.0910733358837876, "grad_norm": 1.515625, "learning_rate": 1.9021034057321694e-05, "loss": 1.0246595382690429, "num_input_tokens_seen": 16808715520, "step": 59100, "train_runtime": 575735.3968, "train_tokens_per_second": 29195.209 }, { "epoch": 2.0914271561475166, "grad_norm": 1.6484375, "learning_rate": 1.90196578456714e-05, "loss": 1.0300943374633789, "num_input_tokens_seen": 16811623104, "step": 59110, "train_runtime": 575835.7643, "train_tokens_per_second": 29195.17 }, { "epoch": 2.091780976411245, "grad_norm": 1.6328125, "learning_rate": 1.9018281932693273e-05, "loss": 1.0270252227783203, "num_input_tokens_seen": 16814509888, "step": 59120, "train_runtime": 575934.569, "train_tokens_per_second": 29195.174 }, { "epoch": 2.092134796674974, "grad_norm": 1.59375, "learning_rate": 1.9016906318279295e-05, "loss": 1.036483383178711, "num_input_tokens_seen": 16817333248, "step": 59130, "train_runtime": 576030.7045, "train_tokens_per_second": 29195.203 }, { "epoch": 2.0924886169387027, "grad_norm": 1.5859375, "learning_rate": 1.9015531002321503e-05, "loss": 1.0350326538085937, "num_input_tokens_seen": 16820180224, "step": 59140, "train_runtime": 576129.2538, "train_tokens_per_second": 29195.15 }, { "epoch": 2.0928424372024317, "grad_norm": 1.6875, "learning_rate": 1.9014155984711995e-05, "loss": 1.0415462493896483, "num_input_tokens_seen": 16823024000, "step": 59150, "train_runtime": 576227.6183, "train_tokens_per_second": 29195.102 }, { "epoch": 2.0931962574661602, "grad_norm": 1.6015625, "learning_rate": 1.9012781265342913e-05, "loss": 1.0399368286132813, "num_input_tokens_seen": 16825902592, "step": 59160, "train_runtime": 576328.4074, "train_tokens_per_second": 29194.991 }, { "epoch": 2.093550077729889, "grad_norm": 1.5234375, "learning_rate": 1.9011406844106467e-05, "loss": 1.044339942932129, "num_input_tokens_seen": 16828736576, "step": 59170, "train_runtime": 576424.9429, "train_tokens_per_second": 29195.018 }, { "epoch": 2.0939038979936178, "grad_norm": 1.5390625, "learning_rate": 1.90100327208949e-05, "loss": 1.0350798606872558, "num_input_tokens_seen": 16831600000, "step": 59180, "train_runtime": 576523.1295, "train_tokens_per_second": 29195.013 }, { "epoch": 2.0942577182573467, "grad_norm": 1.578125, "learning_rate": 1.9008658895600537e-05, "loss": 1.034314250946045, "num_input_tokens_seen": 16834408512, "step": 59190, "train_runtime": 576616.9104, "train_tokens_per_second": 29195.135 }, { "epoch": 2.0946115385210757, "grad_norm": 1.6796875, "learning_rate": 1.9007285368115737e-05, "loss": 1.0465892791748046, "num_input_tokens_seen": 16837252480, "step": 59200, "train_runtime": 576714.7084, "train_tokens_per_second": 29195.115 }, { "epoch": 2.0949653587848043, "grad_norm": 1.5546875, "learning_rate": 1.9005912138332918e-05, "loss": 1.0424636840820312, "num_input_tokens_seen": 16840087232, "step": 59210, "train_runtime": 576813.504, "train_tokens_per_second": 29195.029 }, { "epoch": 2.0953191790485333, "grad_norm": 1.609375, "learning_rate": 1.9004539206144557e-05, "loss": 1.038732147216797, "num_input_tokens_seen": 16842959360, "step": 59220, "train_runtime": 576914.6727, "train_tokens_per_second": 29194.888 }, { "epoch": 2.095672999312262, "grad_norm": 1.5078125, "learning_rate": 1.9003166571443183e-05, "loss": 1.044095802307129, "num_input_tokens_seen": 16845817536, "step": 59230, "train_runtime": 577015.9457, "train_tokens_per_second": 29194.718 }, { "epoch": 2.096026819575991, "grad_norm": 1.59375, "learning_rate": 1.900179423412138e-05, "loss": 1.0454885482788085, "num_input_tokens_seen": 16848680640, "step": 59240, "train_runtime": 577115.5509, "train_tokens_per_second": 29194.64 }, { "epoch": 2.0963806398397193, "grad_norm": 1.5859375, "learning_rate": 1.900042219407178e-05, "loss": 1.0347824096679688, "num_input_tokens_seen": 16851506560, "step": 59250, "train_runtime": 577210.9167, "train_tokens_per_second": 29194.712 }, { "epoch": 2.0967344601034483, "grad_norm": 1.5390625, "learning_rate": 1.8999050451187084e-05, "loss": 1.0254575729370117, "num_input_tokens_seen": 16854356672, "step": 59260, "train_runtime": 577308.2093, "train_tokens_per_second": 29194.729 }, { "epoch": 2.097088280367177, "grad_norm": 1.515625, "learning_rate": 1.8997679005360026e-05, "loss": 1.0408082008361816, "num_input_tokens_seen": 16857248256, "step": 59270, "train_runtime": 577410.2266, "train_tokens_per_second": 29194.579 }, { "epoch": 2.097442100630906, "grad_norm": 1.609375, "learning_rate": 1.8996307856483418e-05, "loss": 1.0188914299011231, "num_input_tokens_seen": 16860063168, "step": 59280, "train_runtime": 577505.2504, "train_tokens_per_second": 29194.649 }, { "epoch": 2.0977959208946344, "grad_norm": 1.6328125, "learning_rate": 1.8994937004450106e-05, "loss": 1.0434076309204101, "num_input_tokens_seen": 16862879744, "step": 59290, "train_runtime": 577600.5797, "train_tokens_per_second": 29194.707 }, { "epoch": 2.0981497411583634, "grad_norm": 1.640625, "learning_rate": 1.8993566449153e-05, "loss": 1.04630765914917, "num_input_tokens_seen": 16865706624, "step": 59300, "train_runtime": 577695.1115, "train_tokens_per_second": 29194.823 }, { "epoch": 2.098503561422092, "grad_norm": 1.640625, "learning_rate": 1.8992196190485065e-05, "loss": 1.0474128723144531, "num_input_tokens_seen": 16868554560, "step": 59310, "train_runtime": 577793.9304, "train_tokens_per_second": 29194.759 }, { "epoch": 2.098857381685821, "grad_norm": 1.5859375, "learning_rate": 1.8990826228339316e-05, "loss": 1.0336784362792968, "num_input_tokens_seen": 16871385536, "step": 59320, "train_runtime": 577888.6582, "train_tokens_per_second": 29194.872 }, { "epoch": 2.0992112019495495, "grad_norm": 1.5546875, "learning_rate": 1.898945656260882e-05, "loss": 1.0314553260803223, "num_input_tokens_seen": 16874222016, "step": 59330, "train_runtime": 577986.4545, "train_tokens_per_second": 29194.84 }, { "epoch": 2.0995650222132785, "grad_norm": 1.546875, "learning_rate": 1.89880871931867e-05, "loss": 1.0358341217041016, "num_input_tokens_seen": 16877072512, "step": 59340, "train_runtime": 578086.9856, "train_tokens_per_second": 29194.694 }, { "epoch": 2.099918842477007, "grad_norm": 1.5625, "learning_rate": 1.8986718119966142e-05, "loss": 1.0321263313293456, "num_input_tokens_seen": 16879917504, "step": 59350, "train_runtime": 578185.0649, "train_tokens_per_second": 29194.662 }, { "epoch": 2.100272662740736, "grad_norm": 1.5234375, "learning_rate": 1.898534934284038e-05, "loss": 1.0339673042297364, "num_input_tokens_seen": 16882767488, "step": 59360, "train_runtime": 578283.917, "train_tokens_per_second": 29194.6 }, { "epoch": 2.100626483004465, "grad_norm": 1.6875, "learning_rate": 1.8983980861702692e-05, "loss": 1.0358073234558105, "num_input_tokens_seen": 16885574272, "step": 59370, "train_runtime": 578377.2593, "train_tokens_per_second": 29194.741 }, { "epoch": 2.1009803032681935, "grad_norm": 1.609375, "learning_rate": 1.8982612676446417e-05, "loss": 1.0256349563598632, "num_input_tokens_seen": 16888400384, "step": 59380, "train_runtime": 578470.7366, "train_tokens_per_second": 29194.909 }, { "epoch": 2.1013341235319225, "grad_norm": 1.5546875, "learning_rate": 1.898124478696496e-05, "loss": 1.029093360900879, "num_input_tokens_seen": 16891245568, "step": 59390, "train_runtime": 578568.7671, "train_tokens_per_second": 29194.88 }, { "epoch": 2.101687943795651, "grad_norm": 1.640625, "learning_rate": 1.897987719315175e-05, "loss": 1.038186740875244, "num_input_tokens_seen": 16894094848, "step": 59400, "train_runtime": 578667.0468, "train_tokens_per_second": 29194.845 }, { "epoch": 2.10204176405938, "grad_norm": 1.5859375, "learning_rate": 1.8978509894900306e-05, "loss": 1.0382584571838378, "num_input_tokens_seen": 16896904000, "step": 59410, "train_runtime": 578763.1531, "train_tokens_per_second": 29194.851 }, { "epoch": 2.1023955843231086, "grad_norm": 1.6015625, "learning_rate": 1.8977142892104177e-05, "loss": 1.0443181991577148, "num_input_tokens_seen": 16899750528, "step": 59420, "train_runtime": 578859.9888, "train_tokens_per_second": 29194.885 }, { "epoch": 2.1027494045868376, "grad_norm": 1.6328125, "learning_rate": 1.897577618465697e-05, "loss": 1.035562801361084, "num_input_tokens_seen": 16902604160, "step": 59430, "train_runtime": 578959.9191, "train_tokens_per_second": 29194.774 }, { "epoch": 2.103103224850566, "grad_norm": 1.625, "learning_rate": 1.8974409772452347e-05, "loss": 1.0553621292114257, "num_input_tokens_seen": 16905459840, "step": 59440, "train_runtime": 579055.3283, "train_tokens_per_second": 29194.896 }, { "epoch": 2.103457045114295, "grad_norm": 1.640625, "learning_rate": 1.8973043655384025e-05, "loss": 1.0500066757202149, "num_input_tokens_seen": 16908293312, "step": 59450, "train_runtime": 579150.6751, "train_tokens_per_second": 29194.982 }, { "epoch": 2.1038108653780236, "grad_norm": 1.5703125, "learning_rate": 1.8971677833345776e-05, "loss": 1.0355939865112305, "num_input_tokens_seen": 16911197632, "step": 59460, "train_runtime": 579248.7042, "train_tokens_per_second": 29195.055 }, { "epoch": 2.1041646856417526, "grad_norm": 1.6015625, "learning_rate": 1.8970312306231413e-05, "loss": 1.0279977798461915, "num_input_tokens_seen": 16914028416, "step": 59470, "train_runtime": 579345.8018, "train_tokens_per_second": 29195.048 }, { "epoch": 2.104518505905481, "grad_norm": 1.609375, "learning_rate": 1.896894707393483e-05, "loss": 1.0282773971557617, "num_input_tokens_seen": 16916836288, "step": 59480, "train_runtime": 579443.559, "train_tokens_per_second": 29194.968 }, { "epoch": 2.10487232616921, "grad_norm": 1.5546875, "learning_rate": 1.8967582136349938e-05, "loss": 1.028620433807373, "num_input_tokens_seen": 16919666560, "step": 59490, "train_runtime": 579540.791, "train_tokens_per_second": 29194.954 }, { "epoch": 2.1052261464329387, "grad_norm": 1.6640625, "learning_rate": 1.8966217493370726e-05, "loss": 1.0447427749633789, "num_input_tokens_seen": 16922553664, "step": 59500, "train_runtime": 579639.8299, "train_tokens_per_second": 29194.946 }, { "epoch": 2.1055799666966677, "grad_norm": 1.578125, "learning_rate": 1.896485314489124e-05, "loss": 1.0220476150512696, "num_input_tokens_seen": 16925391424, "step": 59510, "train_runtime": 579737.14, "train_tokens_per_second": 29194.941 }, { "epoch": 2.1059337869603967, "grad_norm": 1.578125, "learning_rate": 1.8963489090805563e-05, "loss": 1.0251884460449219, "num_input_tokens_seen": 16928190656, "step": 59520, "train_runtime": 579831.0236, "train_tokens_per_second": 29195.041 }, { "epoch": 2.1062876072241252, "grad_norm": 1.5859375, "learning_rate": 1.896212533100784e-05, "loss": 1.047891616821289, "num_input_tokens_seen": 16931077696, "step": 59530, "train_runtime": 579929.1273, "train_tokens_per_second": 29195.081 }, { "epoch": 2.106641427487854, "grad_norm": 1.625, "learning_rate": 1.8960761865392257e-05, "loss": 1.0365489959716796, "num_input_tokens_seen": 16933905408, "step": 59540, "train_runtime": 580025.0696, "train_tokens_per_second": 29195.127 }, { "epoch": 2.1069952477515828, "grad_norm": 1.546875, "learning_rate": 1.895939869385308e-05, "loss": 1.0453784942626954, "num_input_tokens_seen": 16936739008, "step": 59550, "train_runtime": 580123.1494, "train_tokens_per_second": 29195.075 }, { "epoch": 2.1073490680153117, "grad_norm": 1.6328125, "learning_rate": 1.8958035816284607e-05, "loss": 1.039588737487793, "num_input_tokens_seen": 16939603072, "step": 59560, "train_runtime": 580219.9101, "train_tokens_per_second": 29195.143 }, { "epoch": 2.1077028882790403, "grad_norm": 1.5703125, "learning_rate": 1.8956673232581184e-05, "loss": 1.0341199874877929, "num_input_tokens_seen": 16942526144, "step": 59570, "train_runtime": 580322.1203, "train_tokens_per_second": 29195.038 }, { "epoch": 2.1080567085427693, "grad_norm": 1.5703125, "learning_rate": 1.8955310942637233e-05, "loss": 1.0413262367248535, "num_input_tokens_seen": 16945340224, "step": 59580, "train_runtime": 580417.2322, "train_tokens_per_second": 29195.102 }, { "epoch": 2.108410528806498, "grad_norm": 1.59375, "learning_rate": 1.8953948946347214e-05, "loss": 1.0448229789733887, "num_input_tokens_seen": 16948140032, "step": 59590, "train_runtime": 580511.4575, "train_tokens_per_second": 29195.186 }, { "epoch": 2.108764349070227, "grad_norm": 1.546875, "learning_rate": 1.895258724360564e-05, "loss": 1.0257333755493163, "num_input_tokens_seen": 16950946176, "step": 59600, "train_runtime": 580605.4592, "train_tokens_per_second": 29195.292 }, { "epoch": 2.1091181693339554, "grad_norm": 1.5625, "learning_rate": 1.8951225834307078e-05, "loss": 1.024862575531006, "num_input_tokens_seen": 16953736832, "step": 59610, "train_runtime": 580698.4687, "train_tokens_per_second": 29195.422 }, { "epoch": 2.1094719895976843, "grad_norm": 1.5859375, "learning_rate": 1.8949864718346153e-05, "loss": 1.028562068939209, "num_input_tokens_seen": 16956575488, "step": 59620, "train_runtime": 580792.5507, "train_tokens_per_second": 29195.58 }, { "epoch": 2.109825809861413, "grad_norm": 1.515625, "learning_rate": 1.894850389561754e-05, "loss": 1.0362640380859376, "num_input_tokens_seen": 16959433536, "step": 59630, "train_runtime": 580889.4839, "train_tokens_per_second": 29195.628 }, { "epoch": 2.110179630125142, "grad_norm": 1.609375, "learning_rate": 1.8947143366015962e-05, "loss": 1.0382478713989258, "num_input_tokens_seen": 16962239424, "step": 59640, "train_runtime": 580986.0247, "train_tokens_per_second": 29195.607 }, { "epoch": 2.1105334503888704, "grad_norm": 1.6328125, "learning_rate": 1.89457831294362e-05, "loss": 1.0340330123901367, "num_input_tokens_seen": 16965117632, "step": 59650, "train_runtime": 581086.3062, "train_tokens_per_second": 29195.521 }, { "epoch": 2.1108872706525994, "grad_norm": 1.6796875, "learning_rate": 1.8944423185773093e-05, "loss": 1.0391199111938476, "num_input_tokens_seen": 16967958464, "step": 59660, "train_runtime": 581182.2244, "train_tokens_per_second": 29195.591 }, { "epoch": 2.111241090916328, "grad_norm": 1.640625, "learning_rate": 1.894306353492153e-05, "loss": 1.0306358337402344, "num_input_tokens_seen": 16970785600, "step": 59670, "train_runtime": 581280.4201, "train_tokens_per_second": 29195.523 }, { "epoch": 2.111594911180057, "grad_norm": 1.5703125, "learning_rate": 1.8941704176776433e-05, "loss": 1.0408948898315429, "num_input_tokens_seen": 16973653568, "step": 59680, "train_runtime": 581380.1447, "train_tokens_per_second": 29195.448 }, { "epoch": 2.1119487314437855, "grad_norm": 1.578125, "learning_rate": 1.8940345111232806e-05, "loss": 1.027516746520996, "num_input_tokens_seen": 16976514752, "step": 59690, "train_runtime": 581477.1185, "train_tokens_per_second": 29195.499 }, { "epoch": 2.1123025517075145, "grad_norm": 1.6015625, "learning_rate": 1.8938986338185695e-05, "loss": 1.032382869720459, "num_input_tokens_seen": 16979358528, "step": 59700, "train_runtime": 581576.2154, "train_tokens_per_second": 29195.414 }, { "epoch": 2.1126563719712435, "grad_norm": 1.6328125, "learning_rate": 1.8937627857530196e-05, "loss": 1.0356276512145997, "num_input_tokens_seen": 16982169344, "step": 59710, "train_runtime": 581673.0412, "train_tokens_per_second": 29195.387 }, { "epoch": 2.113010192234972, "grad_norm": 1.53125, "learning_rate": 1.8936269669161455e-05, "loss": 1.0315041542053223, "num_input_tokens_seen": 16985047168, "step": 59720, "train_runtime": 581772.1088, "train_tokens_per_second": 29195.362 }, { "epoch": 2.113364012498701, "grad_norm": 1.6015625, "learning_rate": 1.8934911772974672e-05, "loss": 1.0270893096923828, "num_input_tokens_seen": 16987827264, "step": 59730, "train_runtime": 581865.1144, "train_tokens_per_second": 29195.473 }, { "epoch": 2.1137178327624295, "grad_norm": 1.6484375, "learning_rate": 1.893355416886511e-05, "loss": 1.0246037483215331, "num_input_tokens_seen": 16990676416, "step": 59740, "train_runtime": 581963.3627, "train_tokens_per_second": 29195.44 }, { "epoch": 2.1140716530261585, "grad_norm": 1.609375, "learning_rate": 1.893219685672807e-05, "loss": 1.032501220703125, "num_input_tokens_seen": 16993544704, "step": 59750, "train_runtime": 582059.3393, "train_tokens_per_second": 29195.554 }, { "epoch": 2.114425473289887, "grad_norm": 1.59375, "learning_rate": 1.893083983645892e-05, "loss": 1.0422328948974608, "num_input_tokens_seen": 16996417024, "step": 59760, "train_runtime": 582155.2642, "train_tokens_per_second": 29195.677 }, { "epoch": 2.114779293553616, "grad_norm": 1.609375, "learning_rate": 1.8929483107953064e-05, "loss": 1.0315608978271484, "num_input_tokens_seen": 16999229504, "step": 59770, "train_runtime": 582251.1196, "train_tokens_per_second": 29195.701 }, { "epoch": 2.1151331138173446, "grad_norm": 1.6875, "learning_rate": 1.892812667110597e-05, "loss": 1.0280136108398437, "num_input_tokens_seen": 17002028224, "step": 59780, "train_runtime": 582347.6279, "train_tokens_per_second": 29195.668 }, { "epoch": 2.1154869340810736, "grad_norm": 1.6171875, "learning_rate": 1.8926770525813152e-05, "loss": 1.024853801727295, "num_input_tokens_seen": 17004890368, "step": 59790, "train_runtime": 582448.7428, "train_tokens_per_second": 29195.514 }, { "epoch": 2.115840754344802, "grad_norm": 1.546875, "learning_rate": 1.892541467197019e-05, "loss": 1.0388214111328125, "num_input_tokens_seen": 17007705856, "step": 59800, "train_runtime": 582545.1479, "train_tokens_per_second": 29195.515 }, { "epoch": 2.116194574608531, "grad_norm": 1.6171875, "learning_rate": 1.8924059109472695e-05, "loss": 1.0264229774475098, "num_input_tokens_seen": 17010587200, "step": 59810, "train_runtime": 582648.6507, "train_tokens_per_second": 29195.274 }, { "epoch": 2.1165483948722597, "grad_norm": 1.5859375, "learning_rate": 1.892270383821635e-05, "loss": 1.0387274742126464, "num_input_tokens_seen": 17013437824, "step": 59820, "train_runtime": 582745.7073, "train_tokens_per_second": 29195.304 }, { "epoch": 2.1169022151359886, "grad_norm": 1.5703125, "learning_rate": 1.8921348858096877e-05, "loss": 1.0293859481811523, "num_input_tokens_seen": 17016261568, "step": 59830, "train_runtime": 582842.5682, "train_tokens_per_second": 29195.296 }, { "epoch": 2.117256035399717, "grad_norm": 1.625, "learning_rate": 1.8919994169010055e-05, "loss": 1.0324931144714355, "num_input_tokens_seen": 17019096064, "step": 59840, "train_runtime": 582938.1752, "train_tokens_per_second": 29195.371 }, { "epoch": 2.117609855663446, "grad_norm": 1.6484375, "learning_rate": 1.891863977085172e-05, "loss": 1.0334905624389648, "num_input_tokens_seen": 17021946176, "step": 59850, "train_runtime": 583032.7487, "train_tokens_per_second": 29195.523 }, { "epoch": 2.117963675927175, "grad_norm": 1.5078125, "learning_rate": 1.8917285663517752e-05, "loss": 1.024088478088379, "num_input_tokens_seen": 17024808960, "step": 59860, "train_runtime": 583129.6919, "train_tokens_per_second": 29195.579 }, { "epoch": 2.1183174961909037, "grad_norm": 1.625, "learning_rate": 1.8915931846904088e-05, "loss": 1.0294410705566406, "num_input_tokens_seen": 17027647168, "step": 59870, "train_runtime": 583223.8663, "train_tokens_per_second": 29195.731 }, { "epoch": 2.1186713164546327, "grad_norm": 1.625, "learning_rate": 1.8914578320906713e-05, "loss": 1.0182849884033203, "num_input_tokens_seen": 17030481664, "step": 59880, "train_runtime": 583321.0908, "train_tokens_per_second": 29195.724 }, { "epoch": 2.1190251367183612, "grad_norm": 1.640625, "learning_rate": 1.8913225085421666e-05, "loss": 1.0368324279785157, "num_input_tokens_seen": 17033372480, "step": 59890, "train_runtime": 583423.8645, "train_tokens_per_second": 29195.536 }, { "epoch": 2.1193789569820902, "grad_norm": 1.609375, "learning_rate": 1.8911872140345043e-05, "loss": 1.02109375, "num_input_tokens_seen": 17036237568, "step": 59900, "train_runtime": 583523.0967, "train_tokens_per_second": 29195.481 }, { "epoch": 2.1197327772458188, "grad_norm": 1.578125, "learning_rate": 1.891051948557299e-05, "loss": 1.0203328132629395, "num_input_tokens_seen": 17039136448, "step": 59910, "train_runtime": 583625.2006, "train_tokens_per_second": 29195.34 }, { "epoch": 2.1200865975095478, "grad_norm": 1.6171875, "learning_rate": 1.8909167121001694e-05, "loss": 1.037367343902588, "num_input_tokens_seen": 17042093504, "step": 59920, "train_runtime": 583732.9881, "train_tokens_per_second": 29195.015 }, { "epoch": 2.1204404177732763, "grad_norm": 1.53125, "learning_rate": 1.8907815046527415e-05, "loss": 1.0321079254150392, "num_input_tokens_seen": 17044966144, "step": 59930, "train_runtime": 583830.0612, "train_tokens_per_second": 29195.081 }, { "epoch": 2.1207942380370053, "grad_norm": 1.6015625, "learning_rate": 1.8906463262046445e-05, "loss": 1.0249567031860352, "num_input_tokens_seen": 17047717120, "step": 59940, "train_runtime": 583921.5587, "train_tokens_per_second": 29195.218 }, { "epoch": 2.121148058300734, "grad_norm": 1.609375, "learning_rate": 1.8905111767455133e-05, "loss": 1.035243606567383, "num_input_tokens_seen": 17050561792, "step": 59950, "train_runtime": 584019.2148, "train_tokens_per_second": 29195.207 }, { "epoch": 2.121501878564463, "grad_norm": 1.671875, "learning_rate": 1.890376056264989e-05, "loss": 1.032937240600586, "num_input_tokens_seen": 17053431360, "step": 59960, "train_runtime": 584116.7294, "train_tokens_per_second": 29195.246 }, { "epoch": 2.1218556988281914, "grad_norm": 1.65625, "learning_rate": 1.890240964752717e-05, "loss": 1.0399270057678223, "num_input_tokens_seen": 17056203904, "step": 59970, "train_runtime": 584209.6004, "train_tokens_per_second": 29195.35 }, { "epoch": 2.1222095190919203, "grad_norm": 1.59375, "learning_rate": 1.890105902198348e-05, "loss": 1.032931137084961, "num_input_tokens_seen": 17059085696, "step": 59980, "train_runtime": 584307.5793, "train_tokens_per_second": 29195.387 }, { "epoch": 2.122563339355649, "grad_norm": 1.6015625, "learning_rate": 1.889970868591537e-05, "loss": 1.0395191192626954, "num_input_tokens_seen": 17061870464, "step": 59990, "train_runtime": 584402.029, "train_tokens_per_second": 29195.433 }, { "epoch": 2.122917159619378, "grad_norm": 1.6015625, "learning_rate": 1.8898358639219462e-05, "loss": 1.0294286727905273, "num_input_tokens_seen": 17064681856, "step": 60000, "train_runtime": 584496.9519, "train_tokens_per_second": 29195.502 }, { "epoch": 2.122917159619378, "eval_loss": 1.0220143795013428, "eval_runtime": 8.4515, "eval_samples_per_second": 471.871, "eval_steps_per_second": 3.786, "num_input_tokens_seen": 17064681856, "step": 60000 }, { "epoch": 2.1232709798831064, "grad_norm": 1.625, "learning_rate": 1.8897008881792415e-05, "loss": 1.0294008255004883, "num_input_tokens_seen": 17067488128, "step": 60010, "train_runtime": 584623.352, "train_tokens_per_second": 29193.99 }, { "epoch": 2.1236248001468354, "grad_norm": 1.5234375, "learning_rate": 1.889565941353094e-05, "loss": 1.03782377243042, "num_input_tokens_seen": 17070313344, "step": 60020, "train_runtime": 584719.4914, "train_tokens_per_second": 29194.021 }, { "epoch": 2.1239786204105644, "grad_norm": 1.5703125, "learning_rate": 1.8894310234331808e-05, "loss": 1.034225845336914, "num_input_tokens_seen": 17073132480, "step": 60030, "train_runtime": 584815.5585, "train_tokens_per_second": 29194.046 }, { "epoch": 2.124332440674293, "grad_norm": 1.609375, "learning_rate": 1.889296134409183e-05, "loss": 1.0413177490234375, "num_input_tokens_seen": 17075946112, "step": 60040, "train_runtime": 584911.8036, "train_tokens_per_second": 29194.053 }, { "epoch": 2.124686260938022, "grad_norm": 1.546875, "learning_rate": 1.8891612742707884e-05, "loss": 1.0224228858947755, "num_input_tokens_seen": 17078730368, "step": 60050, "train_runtime": 585006.9283, "train_tokens_per_second": 29194.065 }, { "epoch": 2.1250400812017505, "grad_norm": 1.5546875, "learning_rate": 1.8890264430076882e-05, "loss": 1.0457534790039062, "num_input_tokens_seen": 17081572864, "step": 60060, "train_runtime": 585103.6931, "train_tokens_per_second": 29194.095 }, { "epoch": 2.1253939014654795, "grad_norm": 1.609375, "learning_rate": 1.8888916406095796e-05, "loss": 1.0485193252563476, "num_input_tokens_seen": 17084360576, "step": 60070, "train_runtime": 585196.32, "train_tokens_per_second": 29194.238 }, { "epoch": 2.125747721729208, "grad_norm": 1.5625, "learning_rate": 1.8887568670661654e-05, "loss": 1.0248265266418457, "num_input_tokens_seen": 17087122496, "step": 60080, "train_runtime": 585286.8037, "train_tokens_per_second": 29194.443 }, { "epoch": 2.126101541992937, "grad_norm": 1.6015625, "learning_rate": 1.888622122367153e-05, "loss": 1.0254801750183105, "num_input_tokens_seen": 17089951680, "step": 60090, "train_runtime": 585385.0402, "train_tokens_per_second": 29194.377 }, { "epoch": 2.1264553622566655, "grad_norm": 1.6015625, "learning_rate": 1.8884874065022547e-05, "loss": 1.0297637939453126, "num_input_tokens_seen": 17092807680, "step": 60100, "train_runtime": 585485.743, "train_tokens_per_second": 29194.234 }, { "epoch": 2.1268091825203945, "grad_norm": 1.625, "learning_rate": 1.888352719461188e-05, "loss": 1.032573127746582, "num_input_tokens_seen": 17095697664, "step": 60110, "train_runtime": 585587.9775, "train_tokens_per_second": 29194.072 }, { "epoch": 2.127163002784123, "grad_norm": 1.578125, "learning_rate": 1.8882180612336762e-05, "loss": 1.0472108840942382, "num_input_tokens_seen": 17098565440, "step": 60120, "train_runtime": 585686.6931, "train_tokens_per_second": 29194.048 }, { "epoch": 2.127516823047852, "grad_norm": 1.5546875, "learning_rate": 1.8880834318094482e-05, "loss": 1.047338104248047, "num_input_tokens_seen": 17101441408, "step": 60130, "train_runtime": 585783.481, "train_tokens_per_second": 29194.134 }, { "epoch": 2.1278706433115806, "grad_norm": 1.640625, "learning_rate": 1.8879488311782353e-05, "loss": 1.0444744110107422, "num_input_tokens_seen": 17104317184, "step": 60140, "train_runtime": 585880.8157, "train_tokens_per_second": 29194.192 }, { "epoch": 2.1282244635753096, "grad_norm": 1.609375, "learning_rate": 1.887814259329777e-05, "loss": 1.0517255783081054, "num_input_tokens_seen": 17107165504, "step": 60150, "train_runtime": 585977.8256, "train_tokens_per_second": 29194.22 }, { "epoch": 2.128578283839038, "grad_norm": 1.5703125, "learning_rate": 1.8876797162538166e-05, "loss": 1.040097141265869, "num_input_tokens_seen": 17110032832, "step": 60160, "train_runtime": 586075.9761, "train_tokens_per_second": 29194.223 }, { "epoch": 2.128932104102767, "grad_norm": 1.5859375, "learning_rate": 1.887545201940102e-05, "loss": 1.0317014694213866, "num_input_tokens_seen": 17112893568, "step": 60170, "train_runtime": 586172.4602, "train_tokens_per_second": 29194.298 }, { "epoch": 2.1292859243664957, "grad_norm": 1.5859375, "learning_rate": 1.887410716378387e-05, "loss": 1.029020404815674, "num_input_tokens_seen": 17115758336, "step": 60180, "train_runtime": 586271.8137, "train_tokens_per_second": 29194.237 }, { "epoch": 2.1296397446302247, "grad_norm": 1.5859375, "learning_rate": 1.8872762595584308e-05, "loss": 1.0479400634765625, "num_input_tokens_seen": 17118615232, "step": 60190, "train_runtime": 586371.0, "train_tokens_per_second": 29194.171 }, { "epoch": 2.1299935648939536, "grad_norm": 1.6015625, "learning_rate": 1.8871418314699966e-05, "loss": 1.0370405197143555, "num_input_tokens_seen": 17121483968, "step": 60200, "train_runtime": 586470.1494, "train_tokens_per_second": 29194.127 }, { "epoch": 2.130347385157682, "grad_norm": 1.5546875, "learning_rate": 1.887007432102854e-05, "loss": 1.0422412872314453, "num_input_tokens_seen": 17124333696, "step": 60210, "train_runtime": 586567.8927, "train_tokens_per_second": 29194.12 }, { "epoch": 2.130701205421411, "grad_norm": 1.5625, "learning_rate": 1.8868730614467763e-05, "loss": 1.0444755554199219, "num_input_tokens_seen": 17127250240, "step": 60220, "train_runtime": 586666.4418, "train_tokens_per_second": 29194.188 }, { "epoch": 2.1310550256851397, "grad_norm": 1.6796875, "learning_rate": 1.886738719491543e-05, "loss": 1.0309707641601562, "num_input_tokens_seen": 17130068096, "step": 60230, "train_runtime": 586763.969, "train_tokens_per_second": 29194.138 }, { "epoch": 2.1314088459488687, "grad_norm": 1.59375, "learning_rate": 1.8866044062269382e-05, "loss": 1.0333799362182616, "num_input_tokens_seen": 17132911360, "step": 60240, "train_runtime": 586861.278, "train_tokens_per_second": 29194.142 }, { "epoch": 2.1317626662125972, "grad_norm": 1.6015625, "learning_rate": 1.8864701216427515e-05, "loss": 1.0232383728027343, "num_input_tokens_seen": 17135699264, "step": 60250, "train_runtime": 586953.6545, "train_tokens_per_second": 29194.297 }, { "epoch": 2.1321164864763262, "grad_norm": 1.5546875, "learning_rate": 1.8863358657287767e-05, "loss": 1.0357827186584472, "num_input_tokens_seen": 17138549440, "step": 60260, "train_runtime": 587051.1554, "train_tokens_per_second": 29194.303 }, { "epoch": 2.1324703067400548, "grad_norm": 1.609375, "learning_rate": 1.886201638474814e-05, "loss": 1.0332340240478515, "num_input_tokens_seen": 17141375680, "step": 60270, "train_runtime": 587147.8294, "train_tokens_per_second": 29194.31 }, { "epoch": 2.1328241270037838, "grad_norm": 1.5625, "learning_rate": 1.886067439870667e-05, "loss": 1.0334027290344239, "num_input_tokens_seen": 17144211968, "step": 60280, "train_runtime": 587245.9747, "train_tokens_per_second": 29194.261 }, { "epoch": 2.1331779472675123, "grad_norm": 1.515625, "learning_rate": 1.8859332699061463e-05, "loss": 1.0290438652038574, "num_input_tokens_seen": 17147082240, "step": 60290, "train_runtime": 587343.0096, "train_tokens_per_second": 29194.324 }, { "epoch": 2.1335317675312413, "grad_norm": 1.5703125, "learning_rate": 1.8857991285710668e-05, "loss": 1.0250091552734375, "num_input_tokens_seen": 17149895104, "step": 60300, "train_runtime": 587439.7316, "train_tokens_per_second": 29194.306 }, { "epoch": 2.13388558779497, "grad_norm": 1.5703125, "learning_rate": 1.8856650158552467e-05, "loss": 1.047140121459961, "num_input_tokens_seen": 17152704384, "step": 60310, "train_runtime": 587533.97, "train_tokens_per_second": 29194.405 }, { "epoch": 2.134239408058699, "grad_norm": 1.5546875, "learning_rate": 1.8855309317485123e-05, "loss": 1.0425759315490724, "num_input_tokens_seen": 17155585408, "step": 60320, "train_runtime": 587633.8234, "train_tokens_per_second": 29194.346 }, { "epoch": 2.1345932283224274, "grad_norm": 1.609375, "learning_rate": 1.8853968762406928e-05, "loss": 1.0268064498901368, "num_input_tokens_seen": 17158439360, "step": 60330, "train_runtime": 587730.1773, "train_tokens_per_second": 29194.416 }, { "epoch": 2.1349470485861564, "grad_norm": 1.5546875, "learning_rate": 1.8852628493216236e-05, "loss": 1.0200824737548828, "num_input_tokens_seen": 17161269120, "step": 60340, "train_runtime": 587826.7326, "train_tokens_per_second": 29194.435 }, { "epoch": 2.1353008688498853, "grad_norm": 1.6328125, "learning_rate": 1.8851288509811446e-05, "loss": 1.0430803298950195, "num_input_tokens_seen": 17164128000, "step": 60350, "train_runtime": 587924.0665, "train_tokens_per_second": 29194.464 }, { "epoch": 2.135654689113614, "grad_norm": 1.5703125, "learning_rate": 1.8849948812091007e-05, "loss": 1.0370073318481445, "num_input_tokens_seen": 17166980032, "step": 60360, "train_runtime": 588021.5634, "train_tokens_per_second": 29194.474 }, { "epoch": 2.136008509377343, "grad_norm": 1.546875, "learning_rate": 1.884860939995342e-05, "loss": 1.044865608215332, "num_input_tokens_seen": 17169832896, "step": 60370, "train_runtime": 588119.6852, "train_tokens_per_second": 29194.454 }, { "epoch": 2.1363623296410714, "grad_norm": 1.5390625, "learning_rate": 1.884727027329724e-05, "loss": 1.0488460540771485, "num_input_tokens_seen": 17172664512, "step": 60380, "train_runtime": 588215.9092, "train_tokens_per_second": 29194.492 }, { "epoch": 2.1367161499048004, "grad_norm": 1.5546875, "learning_rate": 1.8845931432021067e-05, "loss": 1.0419288635253907, "num_input_tokens_seen": 17175466560, "step": 60390, "train_runtime": 588309.3258, "train_tokens_per_second": 29194.619 }, { "epoch": 2.137069970168529, "grad_norm": 1.6015625, "learning_rate": 1.8844592876023555e-05, "loss": 1.0288740158081056, "num_input_tokens_seen": 17178302656, "step": 60400, "train_runtime": 588406.2827, "train_tokens_per_second": 29194.628 }, { "epoch": 2.137423790432258, "grad_norm": 1.5859375, "learning_rate": 1.88432546052034e-05, "loss": 1.0271461486816407, "num_input_tokens_seen": 17181206528, "step": 60410, "train_runtime": 588505.7937, "train_tokens_per_second": 29194.626 }, { "epoch": 2.1377776106959865, "grad_norm": 1.640625, "learning_rate": 1.884191661945937e-05, "loss": 1.0140506744384765, "num_input_tokens_seen": 17184034752, "step": 60420, "train_runtime": 588600.3113, "train_tokens_per_second": 29194.743 }, { "epoch": 2.1381314309597155, "grad_norm": 1.6640625, "learning_rate": 1.884057891869025e-05, "loss": 1.039503288269043, "num_input_tokens_seen": 17186925248, "step": 60430, "train_runtime": 588701.6915, "train_tokens_per_second": 29194.625 }, { "epoch": 2.138485251223444, "grad_norm": 1.5234375, "learning_rate": 1.883924150279491e-05, "loss": 1.0446317672729493, "num_input_tokens_seen": 17189764032, "step": 60440, "train_runtime": 588796.5169, "train_tokens_per_second": 29194.745 }, { "epoch": 2.138839071487173, "grad_norm": 1.59375, "learning_rate": 1.8837904371672252e-05, "loss": 1.035522747039795, "num_input_tokens_seen": 17192595904, "step": 60450, "train_runtime": 588893.5035, "train_tokens_per_second": 29194.745 }, { "epoch": 2.1391928917509015, "grad_norm": 1.5625, "learning_rate": 1.8836567525221222e-05, "loss": 1.0260725021362305, "num_input_tokens_seen": 17195496768, "step": 60460, "train_runtime": 588993.2992, "train_tokens_per_second": 29194.724 }, { "epoch": 2.1395467120146305, "grad_norm": 1.6015625, "learning_rate": 1.8835230963340828e-05, "loss": 1.043486976623535, "num_input_tokens_seen": 17198369216, "step": 60470, "train_runtime": 589092.1673, "train_tokens_per_second": 29194.7 }, { "epoch": 2.139900532278359, "grad_norm": 1.59375, "learning_rate": 1.883389468593013e-05, "loss": 1.026930809020996, "num_input_tokens_seen": 17201179520, "step": 60480, "train_runtime": 589186.3199, "train_tokens_per_second": 29194.805 }, { "epoch": 2.140254352542088, "grad_norm": 1.640625, "learning_rate": 1.8832558692888226e-05, "loss": 1.0295698165893554, "num_input_tokens_seen": 17204054720, "step": 60490, "train_runtime": 589287.0263, "train_tokens_per_second": 29194.695 }, { "epoch": 2.1406081728058166, "grad_norm": 1.625, "learning_rate": 1.8831222984114276e-05, "loss": 1.0314491271972657, "num_input_tokens_seen": 17206879424, "step": 60500, "train_runtime": 589383.3367, "train_tokens_per_second": 29194.716 }, { "epoch": 2.1409619930695456, "grad_norm": 1.6015625, "learning_rate": 1.882988755950748e-05, "loss": 1.0502490997314453, "num_input_tokens_seen": 17209693952, "step": 60510, "train_runtime": 589478.6433, "train_tokens_per_second": 29194.771 }, { "epoch": 2.141315813333274, "grad_norm": 1.53125, "learning_rate": 1.88285524189671e-05, "loss": 1.040369415283203, "num_input_tokens_seen": 17212594368, "step": 60520, "train_runtime": 589584.5704, "train_tokens_per_second": 29194.445 }, { "epoch": 2.141669633597003, "grad_norm": 1.6328125, "learning_rate": 1.8827217562392433e-05, "loss": 1.029594326019287, "num_input_tokens_seen": 17215391488, "step": 60530, "train_runtime": 589678.9546, "train_tokens_per_second": 29194.516 }, { "epoch": 2.142023453860732, "grad_norm": 1.578125, "learning_rate": 1.8825882989682843e-05, "loss": 1.0330682754516602, "num_input_tokens_seen": 17218271232, "step": 60540, "train_runtime": 589778.9255, "train_tokens_per_second": 29194.45 }, { "epoch": 2.1423772741244607, "grad_norm": 1.6328125, "learning_rate": 1.8824548700737723e-05, "loss": 1.0306315422058105, "num_input_tokens_seen": 17221112832, "step": 60550, "train_runtime": 589874.5459, "train_tokens_per_second": 29194.535 }, { "epoch": 2.1427310943881896, "grad_norm": 1.578125, "learning_rate": 1.8823214695456538e-05, "loss": 1.031066608428955, "num_input_tokens_seen": 17223947904, "step": 60560, "train_runtime": 589969.13, "train_tokens_per_second": 29194.66 }, { "epoch": 2.143084914651918, "grad_norm": 1.5625, "learning_rate": 1.8821880973738792e-05, "loss": 1.035140609741211, "num_input_tokens_seen": 17226748480, "step": 60570, "train_runtime": 590062.9687, "train_tokens_per_second": 29194.763 }, { "epoch": 2.143438734915647, "grad_norm": 1.6328125, "learning_rate": 1.8820547535484033e-05, "loss": 1.0229914665222168, "num_input_tokens_seen": 17229556736, "step": 60580, "train_runtime": 590158.6114, "train_tokens_per_second": 29194.79 }, { "epoch": 2.1437925551793757, "grad_norm": 1.5703125, "learning_rate": 1.8819214380591876e-05, "loss": 1.0418058395385743, "num_input_tokens_seen": 17232463680, "step": 60590, "train_runtime": 590258.8674, "train_tokens_per_second": 29194.756 }, { "epoch": 2.1441463754431047, "grad_norm": 1.5390625, "learning_rate": 1.8817881508961965e-05, "loss": 1.033818244934082, "num_input_tokens_seen": 17235324608, "step": 60600, "train_runtime": 590354.603, "train_tokens_per_second": 29194.868 }, { "epoch": 2.1445001957068333, "grad_norm": 1.5, "learning_rate": 1.881654892049401e-05, "loss": 1.047764205932617, "num_input_tokens_seen": 17238223424, "step": 60610, "train_runtime": 590457.9582, "train_tokens_per_second": 29194.667 }, { "epoch": 2.1448540159705622, "grad_norm": 1.5625, "learning_rate": 1.881521661508776e-05, "loss": 1.042230987548828, "num_input_tokens_seen": 17241020416, "step": 60620, "train_runtime": 590552.4922, "train_tokens_per_second": 29194.73 }, { "epoch": 2.145207836234291, "grad_norm": 1.625, "learning_rate": 1.8813884592643023e-05, "loss": 1.0310903549194337, "num_input_tokens_seen": 17243888512, "step": 60630, "train_runtime": 590654.682, "train_tokens_per_second": 29194.535 }, { "epoch": 2.1455616564980198, "grad_norm": 1.6015625, "learning_rate": 1.8812552853059646e-05, "loss": 1.0413289070129395, "num_input_tokens_seen": 17246744000, "step": 60640, "train_runtime": 590750.5089, "train_tokens_per_second": 29194.632 }, { "epoch": 2.1459154767617483, "grad_norm": 1.59375, "learning_rate": 1.881122139623754e-05, "loss": 1.0297426223754882, "num_input_tokens_seen": 17249580224, "step": 60650, "train_runtime": 590849.7268, "train_tokens_per_second": 29194.53 }, { "epoch": 2.1462692970254773, "grad_norm": 1.5703125, "learning_rate": 1.8809890222076647e-05, "loss": 1.031959056854248, "num_input_tokens_seen": 17252459328, "step": 60660, "train_runtime": 590947.3147, "train_tokens_per_second": 29194.581 }, { "epoch": 2.146623117289206, "grad_norm": 1.5625, "learning_rate": 1.8808559330476978e-05, "loss": 1.0241632461547852, "num_input_tokens_seen": 17255289664, "step": 60670, "train_runtime": 591043.233, "train_tokens_per_second": 29194.632 }, { "epoch": 2.146976937552935, "grad_norm": 1.6328125, "learning_rate": 1.880722872133858e-05, "loss": 1.037790298461914, "num_input_tokens_seen": 17258201984, "step": 60680, "train_runtime": 591140.567, "train_tokens_per_second": 29194.752 }, { "epoch": 2.147330757816664, "grad_norm": 1.5703125, "learning_rate": 1.8805898394561554e-05, "loss": 1.0330011367797851, "num_input_tokens_seen": 17261048000, "step": 60690, "train_runtime": 591237.7499, "train_tokens_per_second": 29194.766 }, { "epoch": 2.1476845780803924, "grad_norm": 1.5859375, "learning_rate": 1.8804568350046047e-05, "loss": 1.0419105529785155, "num_input_tokens_seen": 17263837120, "step": 60700, "train_runtime": 591332.8345, "train_tokens_per_second": 29194.789 }, { "epoch": 2.1480383983441214, "grad_norm": 1.53125, "learning_rate": 1.8803238587692266e-05, "loss": 1.034127902984619, "num_input_tokens_seen": 17266761024, "step": 60710, "train_runtime": 591436.6215, "train_tokens_per_second": 29194.609 }, { "epoch": 2.14839221860785, "grad_norm": 1.6484375, "learning_rate": 1.880190910740045e-05, "loss": 1.0453107833862305, "num_input_tokens_seen": 17269636992, "step": 60720, "train_runtime": 591536.7214, "train_tokens_per_second": 29194.531 }, { "epoch": 2.148746038871579, "grad_norm": 1.578125, "learning_rate": 1.8800579909070908e-05, "loss": 1.0241546630859375, "num_input_tokens_seen": 17272521472, "step": 60730, "train_runtime": 591635.9415, "train_tokens_per_second": 29194.51 }, { "epoch": 2.1490998591353074, "grad_norm": 1.625, "learning_rate": 1.879925099260398e-05, "loss": 1.04627685546875, "num_input_tokens_seen": 17275307584, "step": 60740, "train_runtime": 591727.1324, "train_tokens_per_second": 29194.719 }, { "epoch": 2.1494536793990364, "grad_norm": 1.5234375, "learning_rate": 1.879792235790007e-05, "loss": 1.0326631546020508, "num_input_tokens_seen": 17278189248, "step": 60750, "train_runtime": 591828.7098, "train_tokens_per_second": 29194.578 }, { "epoch": 2.149807499662765, "grad_norm": 1.5859375, "learning_rate": 1.8796594004859614e-05, "loss": 1.0478696823120117, "num_input_tokens_seen": 17281056064, "step": 60760, "train_runtime": 591925.9749, "train_tokens_per_second": 29194.624 }, { "epoch": 2.150161319926494, "grad_norm": 1.625, "learning_rate": 1.8795265933383115e-05, "loss": 1.028242301940918, "num_input_tokens_seen": 17283865152, "step": 60770, "train_runtime": 592023.2569, "train_tokens_per_second": 29194.571 }, { "epoch": 2.1505151401902225, "grad_norm": 1.5546875, "learning_rate": 1.8793938143371118e-05, "loss": 1.0257099151611329, "num_input_tokens_seen": 17286665344, "step": 60780, "train_runtime": 592116.8968, "train_tokens_per_second": 29194.683 }, { "epoch": 2.1508689604539515, "grad_norm": 1.5546875, "learning_rate": 1.8792610634724215e-05, "loss": 1.0289459228515625, "num_input_tokens_seen": 17289489664, "step": 60790, "train_runtime": 592212.4486, "train_tokens_per_second": 29194.742 }, { "epoch": 2.15122278071768, "grad_norm": 1.5703125, "learning_rate": 1.8791283407343048e-05, "loss": 1.0328706741333007, "num_input_tokens_seen": 17292283776, "step": 60800, "train_runtime": 592306.1958, "train_tokens_per_second": 29194.839 }, { "epoch": 2.151576600981409, "grad_norm": 1.6328125, "learning_rate": 1.8789956461128312e-05, "loss": 1.044647789001465, "num_input_tokens_seen": 17295177216, "step": 60810, "train_runtime": 592405.4072, "train_tokens_per_second": 29194.833 }, { "epoch": 2.1519304212451376, "grad_norm": 1.5546875, "learning_rate": 1.878862979598074e-05, "loss": 1.034940528869629, "num_input_tokens_seen": 17297993216, "step": 60820, "train_runtime": 592501.2542, "train_tokens_per_second": 29194.863 }, { "epoch": 2.1522842415088665, "grad_norm": 1.578125, "learning_rate": 1.8787303411801134e-05, "loss": 1.0383743286132812, "num_input_tokens_seen": 17300816320, "step": 60830, "train_runtime": 592595.4851, "train_tokens_per_second": 29194.985 }, { "epoch": 2.152638061772595, "grad_norm": 1.5234375, "learning_rate": 1.8785977308490328e-05, "loss": 1.0318321228027343, "num_input_tokens_seen": 17303713856, "step": 60840, "train_runtime": 592692.7197, "train_tokens_per_second": 29195.084 }, { "epoch": 2.152991882036324, "grad_norm": 1.59375, "learning_rate": 1.8784651485949205e-05, "loss": 1.0455472946166993, "num_input_tokens_seen": 17306572992, "step": 60850, "train_runtime": 592790.6347, "train_tokens_per_second": 29195.085 }, { "epoch": 2.1533457023000526, "grad_norm": 1.546875, "learning_rate": 1.8783325944078713e-05, "loss": 1.0372384071350098, "num_input_tokens_seen": 17309422016, "step": 60860, "train_runtime": 592888.006, "train_tokens_per_second": 29195.096 }, { "epoch": 2.1536995225637816, "grad_norm": 1.5859375, "learning_rate": 1.878200068277983e-05, "loss": 1.040329360961914, "num_input_tokens_seen": 17312235456, "step": 60870, "train_runtime": 592983.7445, "train_tokens_per_second": 29195.127 }, { "epoch": 2.1540533428275106, "grad_norm": 1.5625, "learning_rate": 1.8780675701953594e-05, "loss": 1.032847023010254, "num_input_tokens_seen": 17315097280, "step": 60880, "train_runtime": 593081.83, "train_tokens_per_second": 29195.124 }, { "epoch": 2.154407163091239, "grad_norm": 1.6015625, "learning_rate": 1.877935100150109e-05, "loss": 1.0489488601684571, "num_input_tokens_seen": 17317914176, "step": 60890, "train_runtime": 593179.1501, "train_tokens_per_second": 29195.082 }, { "epoch": 2.154760983354968, "grad_norm": 1.5546875, "learning_rate": 1.8778026581323445e-05, "loss": 1.038891315460205, "num_input_tokens_seen": 17320673664, "step": 60900, "train_runtime": 593272.0842, "train_tokens_per_second": 29195.16 }, { "epoch": 2.1551148036186967, "grad_norm": 1.59375, "learning_rate": 1.8776702441321843e-05, "loss": 1.036592674255371, "num_input_tokens_seen": 17323522560, "step": 60910, "train_runtime": 593367.3689, "train_tokens_per_second": 29195.273 }, { "epoch": 2.1554686238824257, "grad_norm": 1.578125, "learning_rate": 1.8775378581397523e-05, "loss": 1.033740234375, "num_input_tokens_seen": 17326356480, "step": 60920, "train_runtime": 593467.4587, "train_tokens_per_second": 29195.125 }, { "epoch": 2.155822444146154, "grad_norm": 1.6171875, "learning_rate": 1.8774055001451754e-05, "loss": 1.0454917907714845, "num_input_tokens_seen": 17329271552, "step": 60930, "train_runtime": 593569.4911, "train_tokens_per_second": 29195.017 }, { "epoch": 2.156176264409883, "grad_norm": 1.5859375, "learning_rate": 1.8772731701385865e-05, "loss": 1.0318553924560547, "num_input_tokens_seen": 17332025280, "step": 60940, "train_runtime": 593661.9173, "train_tokens_per_second": 29195.111 }, { "epoch": 2.1565300846736117, "grad_norm": 1.625, "learning_rate": 1.8771408681101236e-05, "loss": 1.0262277603149415, "num_input_tokens_seen": 17334866112, "step": 60950, "train_runtime": 593759.0774, "train_tokens_per_second": 29195.118 }, { "epoch": 2.1568839049373407, "grad_norm": 1.625, "learning_rate": 1.877008594049929e-05, "loss": 1.0352832794189453, "num_input_tokens_seen": 17337678848, "step": 60960, "train_runtime": 593854.144, "train_tokens_per_second": 29195.18 }, { "epoch": 2.1572377252010693, "grad_norm": 1.578125, "learning_rate": 1.87687634794815e-05, "loss": 1.0220256805419923, "num_input_tokens_seen": 17340461952, "step": 60970, "train_runtime": 593948.8721, "train_tokens_per_second": 29195.21 }, { "epoch": 2.1575915454647983, "grad_norm": 1.640625, "learning_rate": 1.876744129794939e-05, "loss": 1.0388761520385743, "num_input_tokens_seen": 17343278528, "step": 60980, "train_runtime": 594044.9947, "train_tokens_per_second": 29195.227 }, { "epoch": 2.157945365728527, "grad_norm": 1.515625, "learning_rate": 1.8766119395804525e-05, "loss": 1.0292222023010253, "num_input_tokens_seen": 17346139328, "step": 60990, "train_runtime": 594144.7204, "train_tokens_per_second": 29195.142 }, { "epoch": 2.158299185992256, "grad_norm": 1.6796875, "learning_rate": 1.8764797772948537e-05, "loss": 1.0289913177490235, "num_input_tokens_seen": 17348953856, "step": 61000, "train_runtime": 594240.53, "train_tokens_per_second": 29195.171 }, { "epoch": 2.1586530062559843, "grad_norm": 1.578125, "learning_rate": 1.8763476429283083e-05, "loss": 1.0367042541503906, "num_input_tokens_seen": 17351814208, "step": 61010, "train_runtime": 594337.8807, "train_tokens_per_second": 29195.202 }, { "epoch": 2.1590068265197133, "grad_norm": 1.6171875, "learning_rate": 1.8762155364709885e-05, "loss": 1.0466423034667969, "num_input_tokens_seen": 17354639808, "step": 61020, "train_runtime": 594435.2993, "train_tokens_per_second": 29195.17 }, { "epoch": 2.1593606467834423, "grad_norm": 1.7109375, "learning_rate": 1.8760834579130705e-05, "loss": 1.0350506782531739, "num_input_tokens_seen": 17357488192, "step": 61030, "train_runtime": 594531.7547, "train_tokens_per_second": 29195.225 }, { "epoch": 2.159714467047171, "grad_norm": 1.6015625, "learning_rate": 1.8759514072447352e-05, "loss": 1.023944091796875, "num_input_tokens_seen": 17360398464, "step": 61040, "train_runtime": 594630.5037, "train_tokens_per_second": 29195.271 }, { "epoch": 2.1600682873109, "grad_norm": 1.6953125, "learning_rate": 1.8758193844561695e-05, "loss": 1.026142406463623, "num_input_tokens_seen": 17363253888, "step": 61050, "train_runtime": 594730.2848, "train_tokens_per_second": 29195.174 }, { "epoch": 2.1604221075746284, "grad_norm": 1.6640625, "learning_rate": 1.875687389537564e-05, "loss": 1.0328672409057618, "num_input_tokens_seen": 17366058752, "step": 61060, "train_runtime": 594824.3712, "train_tokens_per_second": 29195.271 }, { "epoch": 2.1607759278383574, "grad_norm": 1.515625, "learning_rate": 1.8755554224791144e-05, "loss": 1.035115623474121, "num_input_tokens_seen": 17368965504, "step": 61070, "train_runtime": 594925.4221, "train_tokens_per_second": 29195.198 }, { "epoch": 2.161129748102086, "grad_norm": 1.578125, "learning_rate": 1.8754234832710217e-05, "loss": 1.037948226928711, "num_input_tokens_seen": 17371842752, "step": 61080, "train_runtime": 595025.418, "train_tokens_per_second": 29195.127 }, { "epoch": 2.161483568365815, "grad_norm": 1.5390625, "learning_rate": 1.8752915719034914e-05, "loss": 1.0561432838439941, "num_input_tokens_seen": 17374629824, "step": 61090, "train_runtime": 595118.8783, "train_tokens_per_second": 29195.225 }, { "epoch": 2.1618373886295434, "grad_norm": 1.578125, "learning_rate": 1.8751596883667337e-05, "loss": 1.0417718887329102, "num_input_tokens_seen": 17377418176, "step": 61100, "train_runtime": 595214.0814, "train_tokens_per_second": 29195.24 }, { "epoch": 2.1621912088932724, "grad_norm": 1.6171875, "learning_rate": 1.8750278326509628e-05, "loss": 1.0338545799255372, "num_input_tokens_seen": 17380196800, "step": 61110, "train_runtime": 595304.4671, "train_tokens_per_second": 29195.475 }, { "epoch": 2.162545029157001, "grad_norm": 1.5859375, "learning_rate": 1.8748960047464e-05, "loss": 1.0371318817138673, "num_input_tokens_seen": 17383017792, "step": 61120, "train_runtime": 595399.7906, "train_tokens_per_second": 29195.539 }, { "epoch": 2.16289884942073, "grad_norm": 1.5625, "learning_rate": 1.8747642046432698e-05, "loss": 1.0294586181640626, "num_input_tokens_seen": 17385819328, "step": 61130, "train_runtime": 595491.7098, "train_tokens_per_second": 29195.737 }, { "epoch": 2.1632526696844585, "grad_norm": 1.5859375, "learning_rate": 1.8746324323318008e-05, "loss": 1.0414617538452149, "num_input_tokens_seen": 17388649984, "step": 61140, "train_runtime": 595587.2955, "train_tokens_per_second": 29195.804 }, { "epoch": 2.1636064899481875, "grad_norm": 1.578125, "learning_rate": 1.8745006878022285e-05, "loss": 1.050356960296631, "num_input_tokens_seen": 17391516032, "step": 61150, "train_runtime": 595684.9374, "train_tokens_per_second": 29195.83 }, { "epoch": 2.163960310211916, "grad_norm": 1.6171875, "learning_rate": 1.8743689710447914e-05, "loss": 1.0338499069213867, "num_input_tokens_seen": 17394293696, "step": 61160, "train_runtime": 595780.9742, "train_tokens_per_second": 29195.786 }, { "epoch": 2.164314130475645, "grad_norm": 1.578125, "learning_rate": 1.8742372820497335e-05, "loss": 1.041832160949707, "num_input_tokens_seen": 17397146880, "step": 61170, "train_runtime": 595878.7888, "train_tokens_per_second": 29195.781 }, { "epoch": 2.164667950739374, "grad_norm": 1.5703125, "learning_rate": 1.8741056208073036e-05, "loss": 1.0438559532165528, "num_input_tokens_seen": 17400026752, "step": 61180, "train_runtime": 595978.3858, "train_tokens_per_second": 29195.735 }, { "epoch": 2.1650217710031026, "grad_norm": 1.6015625, "learning_rate": 1.873973987307755e-05, "loss": 1.032145118713379, "num_input_tokens_seen": 17402869504, "step": 61190, "train_runtime": 596076.1336, "train_tokens_per_second": 29195.716 }, { "epoch": 2.1653755912668315, "grad_norm": 1.65625, "learning_rate": 1.8738423815413468e-05, "loss": 1.0353187561035155, "num_input_tokens_seen": 17405652992, "step": 61200, "train_runtime": 596169.6968, "train_tokens_per_second": 29195.803 }, { "epoch": 2.16572941153056, "grad_norm": 1.5234375, "learning_rate": 1.8737108034983415e-05, "loss": 1.0613261222839356, "num_input_tokens_seen": 17408465152, "step": 61210, "train_runtime": 596265.5133, "train_tokens_per_second": 29195.828 }, { "epoch": 2.166083231794289, "grad_norm": 1.53125, "learning_rate": 1.873579253169007e-05, "loss": 1.0227901458740234, "num_input_tokens_seen": 17411338880, "step": 61220, "train_runtime": 596360.5625, "train_tokens_per_second": 29195.993 }, { "epoch": 2.1664370520580176, "grad_norm": 1.6015625, "learning_rate": 1.8734477305436166e-05, "loss": 1.029444122314453, "num_input_tokens_seen": 17414242496, "step": 61230, "train_runtime": 596461.5299, "train_tokens_per_second": 29195.919 }, { "epoch": 2.1667908723217466, "grad_norm": 1.5390625, "learning_rate": 1.873316235612447e-05, "loss": 1.0498411178588867, "num_input_tokens_seen": 17417080704, "step": 61240, "train_runtime": 596559.581, "train_tokens_per_second": 29195.878 }, { "epoch": 2.167144692585475, "grad_norm": 1.6171875, "learning_rate": 1.873184768365781e-05, "loss": 1.0404541015625, "num_input_tokens_seen": 17419943680, "step": 61250, "train_runtime": 596660.6015, "train_tokens_per_second": 29195.733 }, { "epoch": 2.167498512849204, "grad_norm": 1.5703125, "learning_rate": 1.8730533287939052e-05, "loss": 1.034581184387207, "num_input_tokens_seen": 17422755584, "step": 61260, "train_runtime": 596754.5567, "train_tokens_per_second": 29195.848 }, { "epoch": 2.1678523331129327, "grad_norm": 1.5625, "learning_rate": 1.8729219168871118e-05, "loss": 1.0320608139038085, "num_input_tokens_seen": 17425571776, "step": 61270, "train_runtime": 596850.6508, "train_tokens_per_second": 29195.866 }, { "epoch": 2.1682061533766617, "grad_norm": 1.625, "learning_rate": 1.872790532635697e-05, "loss": 1.0320653915405273, "num_input_tokens_seen": 17428384256, "step": 61280, "train_runtime": 596947.4963, "train_tokens_per_second": 29195.841 }, { "epoch": 2.16855997364039, "grad_norm": 1.609375, "learning_rate": 1.8726591760299626e-05, "loss": 1.0348188400268554, "num_input_tokens_seen": 17431207488, "step": 61290, "train_runtime": 597041.4685, "train_tokens_per_second": 29195.974 }, { "epoch": 2.168913793904119, "grad_norm": 1.4921875, "learning_rate": 1.8725278470602142e-05, "loss": 1.0393118858337402, "num_input_tokens_seen": 17434045888, "step": 61300, "train_runtime": 597139.1483, "train_tokens_per_second": 29195.952 }, { "epoch": 2.1692676141678477, "grad_norm": 1.5859375, "learning_rate": 1.872396545716763e-05, "loss": 1.0466660499572753, "num_input_tokens_seen": 17436891264, "step": 61310, "train_runtime": 597236.5743, "train_tokens_per_second": 29195.954 }, { "epoch": 2.1696214344315767, "grad_norm": 1.53125, "learning_rate": 1.8722652719899246e-05, "loss": 1.023768997192383, "num_input_tokens_seen": 17439702144, "step": 61320, "train_runtime": 597332.8739, "train_tokens_per_second": 29195.952 }, { "epoch": 2.1699752546953053, "grad_norm": 1.5625, "learning_rate": 1.872134025870019e-05, "loss": 1.0210708618164062, "num_input_tokens_seen": 17442579904, "step": 61330, "train_runtime": 597432.2863, "train_tokens_per_second": 29195.911 }, { "epoch": 2.1703290749590343, "grad_norm": 1.5625, "learning_rate": 1.872002807347371e-05, "loss": 1.0349971771240234, "num_input_tokens_seen": 17445395392, "step": 61340, "train_runtime": 597526.7302, "train_tokens_per_second": 29196.008 }, { "epoch": 2.170682895222763, "grad_norm": 1.5546875, "learning_rate": 1.8718716164123114e-05, "loss": 1.0319562911987306, "num_input_tokens_seen": 17448275072, "step": 61350, "train_runtime": 597626.7326, "train_tokens_per_second": 29195.941 }, { "epoch": 2.171036715486492, "grad_norm": 1.6328125, "learning_rate": 1.8717404530551747e-05, "loss": 1.0223904609680177, "num_input_tokens_seen": 17451117248, "step": 61360, "train_runtime": 597724.7231, "train_tokens_per_second": 29195.91 }, { "epoch": 2.171390535750221, "grad_norm": 1.671875, "learning_rate": 1.8716093172662993e-05, "loss": 1.0331365585327148, "num_input_tokens_seen": 17453973312, "step": 61370, "train_runtime": 597823.239, "train_tokens_per_second": 29195.876 }, { "epoch": 2.1717443560139493, "grad_norm": 1.6171875, "learning_rate": 1.87147820903603e-05, "loss": 1.0322481155395509, "num_input_tokens_seen": 17456835520, "step": 61380, "train_runtime": 597923.9263, "train_tokens_per_second": 29195.747 }, { "epoch": 2.1720981762776783, "grad_norm": 1.5546875, "learning_rate": 1.8713471283547156e-05, "loss": 1.0435593605041504, "num_input_tokens_seen": 17459705216, "step": 61390, "train_runtime": 598024.8863, "train_tokens_per_second": 29195.616 }, { "epoch": 2.172451996541407, "grad_norm": 1.515625, "learning_rate": 1.8712160752127094e-05, "loss": 1.036268424987793, "num_input_tokens_seen": 17462594880, "step": 61400, "train_runtime": 598125.1853, "train_tokens_per_second": 29195.552 }, { "epoch": 2.172805816805136, "grad_norm": 1.640625, "learning_rate": 1.8710850496003697e-05, "loss": 1.0414047241210938, "num_input_tokens_seen": 17465466816, "step": 61410, "train_runtime": 598225.2157, "train_tokens_per_second": 29195.471 }, { "epoch": 2.1731596370688644, "grad_norm": 1.6015625, "learning_rate": 1.8709540515080597e-05, "loss": 1.0279056549072265, "num_input_tokens_seen": 17468312512, "step": 61420, "train_runtime": 598323.0584, "train_tokens_per_second": 29195.453 }, { "epoch": 2.1735134573325934, "grad_norm": 1.515625, "learning_rate": 1.8708230809261465e-05, "loss": 1.0324644088745116, "num_input_tokens_seen": 17471146880, "step": 61430, "train_runtime": 598418.3536, "train_tokens_per_second": 29195.54 }, { "epoch": 2.173867277596322, "grad_norm": 1.53125, "learning_rate": 1.8706921378450034e-05, "loss": 1.0243822097778321, "num_input_tokens_seen": 17473970816, "step": 61440, "train_runtime": 598519.1514, "train_tokens_per_second": 29195.341 }, { "epoch": 2.174221097860051, "grad_norm": 1.640625, "learning_rate": 1.870561222255007e-05, "loss": 1.0333621025085449, "num_input_tokens_seen": 17476795328, "step": 61450, "train_runtime": 598614.4838, "train_tokens_per_second": 29195.41 }, { "epoch": 2.1745749181237795, "grad_norm": 1.578125, "learning_rate": 1.8704303341465393e-05, "loss": 1.0324178695678712, "num_input_tokens_seen": 17479608960, "step": 61460, "train_runtime": 598709.3019, "train_tokens_per_second": 29195.486 }, { "epoch": 2.1749287383875084, "grad_norm": 1.5546875, "learning_rate": 1.8702994735099868e-05, "loss": 1.041243839263916, "num_input_tokens_seen": 17482478592, "step": 61470, "train_runtime": 598805.0729, "train_tokens_per_second": 29195.609 }, { "epoch": 2.175282558651237, "grad_norm": 1.6875, "learning_rate": 1.8701686403357407e-05, "loss": 1.0407357215881348, "num_input_tokens_seen": 17485279424, "step": 61480, "train_runtime": 598901.8839, "train_tokens_per_second": 29195.566 }, { "epoch": 2.175636378914966, "grad_norm": 1.6171875, "learning_rate": 1.8700378346141973e-05, "loss": 1.034457015991211, "num_input_tokens_seen": 17488142464, "step": 61490, "train_runtime": 599001.1563, "train_tokens_per_second": 29195.507 }, { "epoch": 2.1759901991786945, "grad_norm": 1.6015625, "learning_rate": 1.8699070563357574e-05, "loss": 1.0467189788818358, "num_input_tokens_seen": 17490942848, "step": 61500, "train_runtime": 599095.9732, "train_tokens_per_second": 29195.561 }, { "epoch": 2.1763440194424235, "grad_norm": 1.671875, "learning_rate": 1.8697763054908255e-05, "loss": 1.0322153091430664, "num_input_tokens_seen": 17493765120, "step": 61510, "train_runtime": 599192.9038, "train_tokens_per_second": 29195.548 }, { "epoch": 2.1766978397061525, "grad_norm": 1.671875, "learning_rate": 1.8696455820698124e-05, "loss": 1.038115882873535, "num_input_tokens_seen": 17496527616, "step": 61520, "train_runtime": 599286.7481, "train_tokens_per_second": 29195.586 }, { "epoch": 2.177051659969881, "grad_norm": 1.546875, "learning_rate": 1.8695148860631327e-05, "loss": 1.0433521270751953, "num_input_tokens_seen": 17499360960, "step": 61530, "train_runtime": 599381.2159, "train_tokens_per_second": 29195.711 }, { "epoch": 2.17740548023361, "grad_norm": 1.5859375, "learning_rate": 1.869384217461206e-05, "loss": 1.0533103942871094, "num_input_tokens_seen": 17502238720, "step": 61540, "train_runtime": 599483.4199, "train_tokens_per_second": 29195.534 }, { "epoch": 2.1777593004973386, "grad_norm": 1.609375, "learning_rate": 1.8692535762544565e-05, "loss": 1.036928367614746, "num_input_tokens_seen": 17505065216, "step": 61550, "train_runtime": 599581.4842, "train_tokens_per_second": 29195.473 }, { "epoch": 2.1781131207610676, "grad_norm": 1.5859375, "learning_rate": 1.8691229624333126e-05, "loss": 1.0354942321777343, "num_input_tokens_seen": 17507923456, "step": 61560, "train_runtime": 599680.642, "train_tokens_per_second": 29195.412 }, { "epoch": 2.178466941024796, "grad_norm": 1.6328125, "learning_rate": 1.8689923759882078e-05, "loss": 1.025139617919922, "num_input_tokens_seen": 17510774400, "step": 61570, "train_runtime": 599775.8903, "train_tokens_per_second": 29195.529 }, { "epoch": 2.178820761288525, "grad_norm": 1.5703125, "learning_rate": 1.868861816909581e-05, "loss": 1.0326663970947265, "num_input_tokens_seen": 17513635840, "step": 61580, "train_runtime": 599871.6964, "train_tokens_per_second": 29195.636 }, { "epoch": 2.1791745815522536, "grad_norm": 1.5859375, "learning_rate": 1.8687312851878747e-05, "loss": 1.043799877166748, "num_input_tokens_seen": 17516477248, "step": 61590, "train_runtime": 599967.5734, "train_tokens_per_second": 29195.707 }, { "epoch": 2.1795284018159826, "grad_norm": 1.5546875, "learning_rate": 1.868600780813536e-05, "loss": 1.0415350914001464, "num_input_tokens_seen": 17519313344, "step": 61600, "train_runtime": 600062.0917, "train_tokens_per_second": 29195.834 }, { "epoch": 2.179882222079711, "grad_norm": 1.515625, "learning_rate": 1.8684703037770177e-05, "loss": 1.0295090675354004, "num_input_tokens_seen": 17522141632, "step": 61610, "train_runtime": 600158.7309, "train_tokens_per_second": 29195.846 }, { "epoch": 2.18023604234344, "grad_norm": 1.609375, "learning_rate": 1.868339854068776e-05, "loss": 1.0311452865600585, "num_input_tokens_seen": 17525007360, "step": 61620, "train_runtime": 600257.9011, "train_tokens_per_second": 29195.796 }, { "epoch": 2.1805898626071687, "grad_norm": 1.5234375, "learning_rate": 1.8682094316792737e-05, "loss": 1.0359119415283202, "num_input_tokens_seen": 17527868992, "step": 61630, "train_runtime": 600355.6136, "train_tokens_per_second": 29195.811 }, { "epoch": 2.1809436828708977, "grad_norm": 1.59375, "learning_rate": 1.868079036598975e-05, "loss": 1.0254598617553712, "num_input_tokens_seen": 17530742272, "step": 61640, "train_runtime": 600456.5247, "train_tokens_per_second": 29195.69 }, { "epoch": 2.1812975031346262, "grad_norm": 1.5546875, "learning_rate": 1.8679486688183527e-05, "loss": 1.0265083312988281, "num_input_tokens_seen": 17533594048, "step": 61650, "train_runtime": 600555.1642, "train_tokens_per_second": 29195.643 }, { "epoch": 2.181651323398355, "grad_norm": 1.578125, "learning_rate": 1.8678183283278816e-05, "loss": 1.027509880065918, "num_input_tokens_seen": 17536464256, "step": 61660, "train_runtime": 600653.1376, "train_tokens_per_second": 29195.659 }, { "epoch": 2.1820051436620838, "grad_norm": 1.6328125, "learning_rate": 1.8676880151180415e-05, "loss": 1.017686367034912, "num_input_tokens_seen": 17539378816, "step": 61670, "train_runtime": 600753.2635, "train_tokens_per_second": 29195.645 }, { "epoch": 2.1823589639258127, "grad_norm": 1.609375, "learning_rate": 1.8675577291793172e-05, "loss": 1.0239133834838867, "num_input_tokens_seen": 17542225280, "step": 61680, "train_runtime": 600849.5313, "train_tokens_per_second": 29195.704 }, { "epoch": 2.1827127841895413, "grad_norm": 1.53125, "learning_rate": 1.867427470502199e-05, "loss": 1.0345226287841798, "num_input_tokens_seen": 17545053888, "step": 61690, "train_runtime": 600946.616, "train_tokens_per_second": 29195.695 }, { "epoch": 2.1830666044532703, "grad_norm": 1.5546875, "learning_rate": 1.86729723907718e-05, "loss": 1.0400017738342284, "num_input_tokens_seen": 17547918080, "step": 61700, "train_runtime": 601044.1407, "train_tokens_per_second": 29195.723 }, { "epoch": 2.1834204247169993, "grad_norm": 1.5390625, "learning_rate": 1.8671670348947597e-05, "loss": 1.0336851119995116, "num_input_tokens_seen": 17550791040, "step": 61710, "train_runtime": 601142.5741, "train_tokens_per_second": 29195.721 }, { "epoch": 2.183774244980728, "grad_norm": 1.5859375, "learning_rate": 1.8670368579454405e-05, "loss": 1.0389968872070312, "num_input_tokens_seen": 17553607104, "step": 61720, "train_runtime": 601239.8796, "train_tokens_per_second": 29195.68 }, { "epoch": 2.184128065244457, "grad_norm": 1.53125, "learning_rate": 1.8669067082197318e-05, "loss": 1.035944938659668, "num_input_tokens_seen": 17556536064, "step": 61730, "train_runtime": 601342.4339, "train_tokens_per_second": 29195.572 }, { "epoch": 2.1844818855081853, "grad_norm": 1.6875, "learning_rate": 1.866776585708145e-05, "loss": 1.0309480667114257, "num_input_tokens_seen": 17559385856, "step": 61740, "train_runtime": 601436.3512, "train_tokens_per_second": 29195.751 }, { "epoch": 2.1848357057719143, "grad_norm": 1.5546875, "learning_rate": 1.8666464904011983e-05, "loss": 1.0252955436706543, "num_input_tokens_seen": 17562246080, "step": 61750, "train_runtime": 601536.2738, "train_tokens_per_second": 29195.656 }, { "epoch": 2.185189526035643, "grad_norm": 1.578125, "learning_rate": 1.8665164222894125e-05, "loss": 1.0456543922424317, "num_input_tokens_seen": 17565140800, "step": 61760, "train_runtime": 601635.3742, "train_tokens_per_second": 29195.658 }, { "epoch": 2.185543346299372, "grad_norm": 1.5546875, "learning_rate": 1.8663863813633152e-05, "loss": 1.0315608978271484, "num_input_tokens_seen": 17567945856, "step": 61770, "train_runtime": 601729.0222, "train_tokens_per_second": 29195.776 }, { "epoch": 2.1858971665631004, "grad_norm": 1.640625, "learning_rate": 1.866256367613437e-05, "loss": 1.0364339828491211, "num_input_tokens_seen": 17570781184, "step": 61780, "train_runtime": 601826.378, "train_tokens_per_second": 29195.764 }, { "epoch": 2.1862509868268294, "grad_norm": 1.59375, "learning_rate": 1.8661263810303138e-05, "loss": 1.0412982940673827, "num_input_tokens_seen": 17573646208, "step": 61790, "train_runtime": 601923.8692, "train_tokens_per_second": 29195.796 }, { "epoch": 2.186604807090558, "grad_norm": 1.578125, "learning_rate": 1.8659964216044853e-05, "loss": 1.0393583297729492, "num_input_tokens_seen": 17576526592, "step": 61800, "train_runtime": 602023.2115, "train_tokens_per_second": 29195.762 }, { "epoch": 2.186958627354287, "grad_norm": 1.5703125, "learning_rate": 1.8658664893264978e-05, "loss": 1.0269815444946289, "num_input_tokens_seen": 17579403136, "step": 61810, "train_runtime": 602125.2337, "train_tokens_per_second": 29195.593 }, { "epoch": 2.1873124476180155, "grad_norm": 1.5390625, "learning_rate": 1.8657365841868997e-05, "loss": 1.0229013442993165, "num_input_tokens_seen": 17582272640, "step": 61820, "train_runtime": 602222.5742, "train_tokens_per_second": 29195.639 }, { "epoch": 2.1876662678817445, "grad_norm": 1.625, "learning_rate": 1.865606706176246e-05, "loss": 1.0298029899597168, "num_input_tokens_seen": 17585155648, "step": 61830, "train_runtime": 602321.7097, "train_tokens_per_second": 29195.62 }, { "epoch": 2.188020088145473, "grad_norm": 1.6640625, "learning_rate": 1.8654768552850943e-05, "loss": 1.0325407981872559, "num_input_tokens_seen": 17588005056, "step": 61840, "train_runtime": 602417.5787, "train_tokens_per_second": 29195.704 }, { "epoch": 2.188373908409202, "grad_norm": 1.5859375, "learning_rate": 1.8653470315040096e-05, "loss": 1.0392494201660156, "num_input_tokens_seen": 17590807744, "step": 61850, "train_runtime": 602512.3576, "train_tokens_per_second": 29195.763 }, { "epoch": 2.188727728672931, "grad_norm": 1.609375, "learning_rate": 1.8652172348235588e-05, "loss": 1.0315486907958984, "num_input_tokens_seen": 17593702784, "step": 61860, "train_runtime": 602610.1775, "train_tokens_per_second": 29195.827 }, { "epoch": 2.1890815489366595, "grad_norm": 1.6171875, "learning_rate": 1.8650874652343146e-05, "loss": 1.0366020202636719, "num_input_tokens_seen": 17596551360, "step": 61870, "train_runtime": 602706.6393, "train_tokens_per_second": 29195.881 }, { "epoch": 2.1894353692003885, "grad_norm": 1.6484375, "learning_rate": 1.864957722726855e-05, "loss": 1.0170689582824708, "num_input_tokens_seen": 17599421888, "step": 61880, "train_runtime": 602806.221, "train_tokens_per_second": 29195.82 }, { "epoch": 2.189789189464117, "grad_norm": 1.6015625, "learning_rate": 1.8648280072917605e-05, "loss": 1.044498825073242, "num_input_tokens_seen": 17602278592, "step": 61890, "train_runtime": 602901.6762, "train_tokens_per_second": 29195.936 }, { "epoch": 2.190143009727846, "grad_norm": 1.546875, "learning_rate": 1.864698318919618e-05, "loss": 1.0406606674194336, "num_input_tokens_seen": 17605110528, "step": 61900, "train_runtime": 602997.1602, "train_tokens_per_second": 29196.009 }, { "epoch": 2.1904968299915746, "grad_norm": 1.546875, "learning_rate": 1.8645686576010185e-05, "loss": 1.0333731651306153, "num_input_tokens_seen": 17607923200, "step": 61910, "train_runtime": 603095.0599, "train_tokens_per_second": 29195.933 }, { "epoch": 2.1908506502553036, "grad_norm": 1.5703125, "learning_rate": 1.8644390233265576e-05, "loss": 1.0354606628417968, "num_input_tokens_seen": 17610732992, "step": 61920, "train_runtime": 603190.1333, "train_tokens_per_second": 29195.99 }, { "epoch": 2.191204470519032, "grad_norm": 1.5546875, "learning_rate": 1.8643094160868353e-05, "loss": 1.032284927368164, "num_input_tokens_seen": 17613603008, "step": 61930, "train_runtime": 603287.1595, "train_tokens_per_second": 29196.052 }, { "epoch": 2.191558290782761, "grad_norm": 1.59375, "learning_rate": 1.864179835872456e-05, "loss": 1.0242864608764648, "num_input_tokens_seen": 17616494016, "step": 61940, "train_runtime": 603387.9176, "train_tokens_per_second": 29195.967 }, { "epoch": 2.1919121110464896, "grad_norm": 1.6015625, "learning_rate": 1.8640502826740292e-05, "loss": 1.0320741653442382, "num_input_tokens_seen": 17619335488, "step": 61950, "train_runtime": 603484.304, "train_tokens_per_second": 29196.013 }, { "epoch": 2.1922659313102186, "grad_norm": 1.53125, "learning_rate": 1.8639207564821686e-05, "loss": 1.0297990798950196, "num_input_tokens_seen": 17622172864, "step": 61960, "train_runtime": 603580.0926, "train_tokens_per_second": 29196.08 }, { "epoch": 2.192619751573947, "grad_norm": 1.5546875, "learning_rate": 1.8637912572874924e-05, "loss": 1.0415176391601562, "num_input_tokens_seen": 17625011712, "step": 61970, "train_runtime": 603675.2437, "train_tokens_per_second": 29196.181 }, { "epoch": 2.192973571837676, "grad_norm": 1.6171875, "learning_rate": 1.863661785080624e-05, "loss": 1.0399425506591797, "num_input_tokens_seen": 17627814336, "step": 61980, "train_runtime": 603770.9954, "train_tokens_per_second": 29196.193 }, { "epoch": 2.1933273921014047, "grad_norm": 1.65625, "learning_rate": 1.86353233985219e-05, "loss": 1.0482044219970703, "num_input_tokens_seen": 17630649280, "step": 61990, "train_runtime": 603869.433, "train_tokens_per_second": 29196.128 }, { "epoch": 2.1936812123651337, "grad_norm": 1.5390625, "learning_rate": 1.8634029215928235e-05, "loss": 1.0341508865356446, "num_input_tokens_seen": 17633497792, "step": 62000, "train_runtime": 603966.2359, "train_tokens_per_second": 29196.165 }, { "epoch": 2.1940350326288627, "grad_norm": 1.5625, "learning_rate": 1.8632735302931604e-05, "loss": 1.037165069580078, "num_input_tokens_seen": 17636320640, "step": 62010, "train_runtime": 604062.4466, "train_tokens_per_second": 29196.188 }, { "epoch": 2.1943888528925912, "grad_norm": 1.59375, "learning_rate": 1.8631441659438417e-05, "loss": 1.0354007720947265, "num_input_tokens_seen": 17639196672, "step": 62020, "train_runtime": 604159.2353, "train_tokens_per_second": 29196.271 }, { "epoch": 2.19474267315632, "grad_norm": 1.5703125, "learning_rate": 1.863014828535514e-05, "loss": 1.0331151008605957, "num_input_tokens_seen": 17642081216, "step": 62030, "train_runtime": 604257.669, "train_tokens_per_second": 29196.288 }, { "epoch": 2.1950964934200488, "grad_norm": 1.5625, "learning_rate": 1.8628855180588262e-05, "loss": 1.042378044128418, "num_input_tokens_seen": 17644976064, "step": 62040, "train_runtime": 604357.0187, "train_tokens_per_second": 29196.279 }, { "epoch": 2.1954503136837777, "grad_norm": 1.59375, "learning_rate": 1.862756234504434e-05, "loss": 1.0557915687561035, "num_input_tokens_seen": 17647833216, "step": 62050, "train_runtime": 604453.689, "train_tokens_per_second": 29196.336 }, { "epoch": 2.1958041339475063, "grad_norm": 1.6015625, "learning_rate": 1.8626269778629965e-05, "loss": 1.0349488258361816, "num_input_tokens_seen": 17650638208, "step": 62060, "train_runtime": 604548.0874, "train_tokens_per_second": 29196.417 }, { "epoch": 2.1961579542112353, "grad_norm": 1.6171875, "learning_rate": 1.8624977481251777e-05, "loss": 1.0277597427368164, "num_input_tokens_seen": 17653478400, "step": 62070, "train_runtime": 604645.2465, "train_tokens_per_second": 29196.423 }, { "epoch": 2.196511774474964, "grad_norm": 1.5390625, "learning_rate": 1.862368545281646e-05, "loss": 1.033428955078125, "num_input_tokens_seen": 17656320896, "step": 62080, "train_runtime": 604741.2959, "train_tokens_per_second": 29196.486 }, { "epoch": 2.196865594738693, "grad_norm": 1.6328125, "learning_rate": 1.8622393693230738e-05, "loss": 1.0331455230712892, "num_input_tokens_seen": 17659203712, "step": 62090, "train_runtime": 604842.9192, "train_tokens_per_second": 29196.347 }, { "epoch": 2.1972194150024213, "grad_norm": 1.6171875, "learning_rate": 1.8621102202401388e-05, "loss": 1.042647361755371, "num_input_tokens_seen": 17662076288, "step": 62100, "train_runtime": 604941.1555, "train_tokens_per_second": 29196.354 }, { "epoch": 2.1975732352661503, "grad_norm": 1.6484375, "learning_rate": 1.8619810980235236e-05, "loss": 1.0368070602416992, "num_input_tokens_seen": 17664887296, "step": 62110, "train_runtime": 605033.0511, "train_tokens_per_second": 29196.566 }, { "epoch": 2.197927055529879, "grad_norm": 1.578125, "learning_rate": 1.861852002663913e-05, "loss": 1.0344112396240235, "num_input_tokens_seen": 17667683200, "step": 62120, "train_runtime": 605126.9479, "train_tokens_per_second": 29196.656 }, { "epoch": 2.198280875793608, "grad_norm": 1.640625, "learning_rate": 1.8617229341520003e-05, "loss": 1.03271484375, "num_input_tokens_seen": 17670567744, "step": 62130, "train_runtime": 605223.5778, "train_tokens_per_second": 29196.76 }, { "epoch": 2.1986346960573364, "grad_norm": 1.6328125, "learning_rate": 1.861593892478479e-05, "loss": 1.0349559783935547, "num_input_tokens_seen": 17673351808, "step": 62140, "train_runtime": 605314.1736, "train_tokens_per_second": 29196.99 }, { "epoch": 2.1989885163210654, "grad_norm": 1.5546875, "learning_rate": 1.861464877634051e-05, "loss": 1.038050079345703, "num_input_tokens_seen": 17676174976, "step": 62150, "train_runtime": 605411.4305, "train_tokens_per_second": 29196.963 }, { "epoch": 2.199342336584794, "grad_norm": 1.5859375, "learning_rate": 1.861335889609419e-05, "loss": 1.0267320632934571, "num_input_tokens_seen": 17679012096, "step": 62160, "train_runtime": 605509.7641, "train_tokens_per_second": 29196.907 }, { "epoch": 2.199696156848523, "grad_norm": 1.5625, "learning_rate": 1.861206928395293e-05, "loss": 1.028369140625, "num_input_tokens_seen": 17681857024, "step": 62170, "train_runtime": 605608.6589, "train_tokens_per_second": 29196.837 }, { "epoch": 2.2000499771122515, "grad_norm": 1.59375, "learning_rate": 1.8610779939823866e-05, "loss": 1.0324415206909179, "num_input_tokens_seen": 17684691456, "step": 62180, "train_runtime": 605707.3917, "train_tokens_per_second": 29196.757 }, { "epoch": 2.2004037973759805, "grad_norm": 1.6484375, "learning_rate": 1.8609490863614178e-05, "loss": 1.0506168365478517, "num_input_tokens_seen": 17687516544, "step": 62190, "train_runtime": 605802.4534, "train_tokens_per_second": 29196.839 }, { "epoch": 2.2007576176397095, "grad_norm": 1.6484375, "learning_rate": 1.860820205523109e-05, "loss": 1.0250724792480468, "num_input_tokens_seen": 17690320320, "step": 62200, "train_runtime": 605897.4965, "train_tokens_per_second": 29196.886 }, { "epoch": 2.201111437903438, "grad_norm": 1.625, "learning_rate": 1.860691351458187e-05, "loss": 1.0261665344238282, "num_input_tokens_seen": 17693185216, "step": 62210, "train_runtime": 605997.5535, "train_tokens_per_second": 29196.793 }, { "epoch": 2.201465258167167, "grad_norm": 1.5546875, "learning_rate": 1.8605625241573843e-05, "loss": 1.037122917175293, "num_input_tokens_seen": 17696017216, "step": 62220, "train_runtime": 606094.8899, "train_tokens_per_second": 29196.777 }, { "epoch": 2.2018190784308955, "grad_norm": 1.6328125, "learning_rate": 1.860433723611436e-05, "loss": 1.0384132385253906, "num_input_tokens_seen": 17698888960, "step": 62230, "train_runtime": 606191.9777, "train_tokens_per_second": 29196.838 }, { "epoch": 2.2021728986946245, "grad_norm": 1.640625, "learning_rate": 1.860304949811083e-05, "loss": 1.0161128997802735, "num_input_tokens_seen": 17701728960, "step": 62240, "train_runtime": 606292.5496, "train_tokens_per_second": 29196.679 }, { "epoch": 2.202526718958353, "grad_norm": 1.59375, "learning_rate": 1.8601762027470703e-05, "loss": 1.039572811126709, "num_input_tokens_seen": 17704541120, "step": 62250, "train_runtime": 606390.1043, "train_tokens_per_second": 29196.619 }, { "epoch": 2.202880539222082, "grad_norm": 1.578125, "learning_rate": 1.8600474824101473e-05, "loss": 1.035677719116211, "num_input_tokens_seen": 17707415232, "step": 62260, "train_runtime": 606488.8369, "train_tokens_per_second": 29196.605 }, { "epoch": 2.2032343594858106, "grad_norm": 1.625, "learning_rate": 1.8599187887910684e-05, "loss": 1.0380376815795898, "num_input_tokens_seen": 17710243136, "step": 62270, "train_runtime": 606586.9317, "train_tokens_per_second": 29196.546 }, { "epoch": 2.2035881797495396, "grad_norm": 1.5078125, "learning_rate": 1.8597901218805913e-05, "loss": 1.0464062690734863, "num_input_tokens_seen": 17713073152, "step": 62280, "train_runtime": 606683.0377, "train_tokens_per_second": 29196.585 }, { "epoch": 2.203942000013268, "grad_norm": 1.6484375, "learning_rate": 1.8596614816694798e-05, "loss": 1.0464081764221191, "num_input_tokens_seen": 17715918400, "step": 62290, "train_runtime": 606779.8825, "train_tokens_per_second": 29196.615 }, { "epoch": 2.204295820276997, "grad_norm": 1.5703125, "learning_rate": 1.8595328681485004e-05, "loss": 1.0373023986816405, "num_input_tokens_seen": 17718743104, "step": 62300, "train_runtime": 606877.4962, "train_tokens_per_second": 29196.573 }, { "epoch": 2.2046496405407257, "grad_norm": 1.5703125, "learning_rate": 1.8594042813084256e-05, "loss": 1.0293991088867187, "num_input_tokens_seen": 17721597248, "step": 62310, "train_runtime": 606977.2579, "train_tokens_per_second": 29196.477 }, { "epoch": 2.2050034608044546, "grad_norm": 1.640625, "learning_rate": 1.859275721140032e-05, "loss": 1.0247962951660157, "num_input_tokens_seen": 17724442304, "step": 62320, "train_runtime": 607074.4223, "train_tokens_per_second": 29196.49 }, { "epoch": 2.205357281068183, "grad_norm": 1.5625, "learning_rate": 1.8591471876341e-05, "loss": 1.0365991592407227, "num_input_tokens_seen": 17727305152, "step": 62330, "train_runtime": 607169.8118, "train_tokens_per_second": 29196.618 }, { "epoch": 2.205711101331912, "grad_norm": 1.4765625, "learning_rate": 1.859018680781414e-05, "loss": 1.0345233917236327, "num_input_tokens_seen": 17730153856, "step": 62340, "train_runtime": 607265.894, "train_tokens_per_second": 29196.69 }, { "epoch": 2.206064921595641, "grad_norm": 1.625, "learning_rate": 1.8588902005727657e-05, "loss": 1.0383614540100097, "num_input_tokens_seen": 17732989184, "step": 62350, "train_runtime": 607361.2008, "train_tokens_per_second": 29196.776 }, { "epoch": 2.2064187418593697, "grad_norm": 1.6015625, "learning_rate": 1.8587617469989476e-05, "loss": 1.0330827713012696, "num_input_tokens_seen": 17735848512, "step": 62360, "train_runtime": 607461.3975, "train_tokens_per_second": 29196.668 }, { "epoch": 2.2067725621230987, "grad_norm": 1.609375, "learning_rate": 1.8586333200507588e-05, "loss": 1.0304414749145507, "num_input_tokens_seen": 17738637504, "step": 62370, "train_runtime": 607556.4466, "train_tokens_per_second": 29196.69 }, { "epoch": 2.2071263823868272, "grad_norm": 1.5703125, "learning_rate": 1.858504919719003e-05, "loss": 1.0402921676635741, "num_input_tokens_seen": 17741497344, "step": 62380, "train_runtime": 607654.663, "train_tokens_per_second": 29196.678 }, { "epoch": 2.2074802026505562, "grad_norm": 1.578125, "learning_rate": 1.858376545994487e-05, "loss": 1.0380632400512695, "num_input_tokens_seen": 17744365440, "step": 62390, "train_runtime": 607754.0307, "train_tokens_per_second": 29196.623 }, { "epoch": 2.2078340229142848, "grad_norm": 1.6484375, "learning_rate": 1.858248198868023e-05, "loss": 1.0395071029663085, "num_input_tokens_seen": 17747151168, "step": 62400, "train_runtime": 607848.7902, "train_tokens_per_second": 29196.655 }, { "epoch": 2.2081878431780138, "grad_norm": 1.609375, "learning_rate": 1.8581198783304274e-05, "loss": 1.0322110176086425, "num_input_tokens_seen": 17749970624, "step": 62410, "train_runtime": 607943.9537, "train_tokens_per_second": 29196.722 }, { "epoch": 2.2085416634417423, "grad_norm": 1.578125, "learning_rate": 1.8579915843725208e-05, "loss": 1.0338438987731933, "num_input_tokens_seen": 17752786432, "step": 62420, "train_runtime": 608042.1862, "train_tokens_per_second": 29196.636 }, { "epoch": 2.2088954837054713, "grad_norm": 1.5625, "learning_rate": 1.857863316985129e-05, "loss": 1.0273969650268555, "num_input_tokens_seen": 17755608000, "step": 62430, "train_runtime": 608135.6416, "train_tokens_per_second": 29196.789 }, { "epoch": 2.2092493039692, "grad_norm": 1.6015625, "learning_rate": 1.857735076159082e-05, "loss": 1.040304183959961, "num_input_tokens_seen": 17758458496, "step": 62440, "train_runtime": 608234.1207, "train_tokens_per_second": 29196.748 }, { "epoch": 2.209603124232929, "grad_norm": 1.6171875, "learning_rate": 1.8576068618852123e-05, "loss": 1.032697868347168, "num_input_tokens_seen": 17761298176, "step": 62450, "train_runtime": 608332.7384, "train_tokens_per_second": 29196.683 }, { "epoch": 2.2099569444966574, "grad_norm": 1.5625, "learning_rate": 1.8574786741543605e-05, "loss": 1.0207687377929688, "num_input_tokens_seen": 17764157248, "step": 62460, "train_runtime": 608430.7057, "train_tokens_per_second": 29196.681 }, { "epoch": 2.2103107647603863, "grad_norm": 1.5703125, "learning_rate": 1.8573505129573684e-05, "loss": 1.0311878204345704, "num_input_tokens_seen": 17766932928, "step": 62470, "train_runtime": 608523.1597, "train_tokens_per_second": 29196.806 }, { "epoch": 2.210664585024115, "grad_norm": 1.5703125, "learning_rate": 1.857222378285084e-05, "loss": 1.0336832046508788, "num_input_tokens_seen": 17769756160, "step": 62480, "train_runtime": 608618.1834, "train_tokens_per_second": 29196.887 }, { "epoch": 2.211018405287844, "grad_norm": 1.53125, "learning_rate": 1.8570942701283585e-05, "loss": 1.0314796447753907, "num_input_tokens_seen": 17772630336, "step": 62490, "train_runtime": 608716.356, "train_tokens_per_second": 29196.9 }, { "epoch": 2.2113722255515724, "grad_norm": 1.640625, "learning_rate": 1.8569661884780485e-05, "loss": 1.0482921600341797, "num_input_tokens_seen": 17775517248, "step": 62500, "train_runtime": 608816.6751, "train_tokens_per_second": 29196.83 }, { "epoch": 2.2117260458153014, "grad_norm": 1.59375, "learning_rate": 1.8568381333250152e-05, "loss": 1.0401954650878906, "num_input_tokens_seen": 17778377984, "step": 62510, "train_runtime": 608913.5105, "train_tokens_per_second": 29196.885 }, { "epoch": 2.21207986607903, "grad_norm": 1.6015625, "learning_rate": 1.856710104660123e-05, "loss": 1.0236482620239258, "num_input_tokens_seen": 17781199488, "step": 62520, "train_runtime": 609010.6037, "train_tokens_per_second": 29196.864 }, { "epoch": 2.212433686342759, "grad_norm": 1.578125, "learning_rate": 1.8565821024742414e-05, "loss": 1.0427706718444825, "num_input_tokens_seen": 17784016896, "step": 62530, "train_runtime": 609106.1358, "train_tokens_per_second": 29196.91 }, { "epoch": 2.212787506606488, "grad_norm": 1.5703125, "learning_rate": 1.856454126758245e-05, "loss": 1.0355745315551759, "num_input_tokens_seen": 17786886592, "step": 62540, "train_runtime": 609205.4588, "train_tokens_per_second": 29196.86 }, { "epoch": 2.2131413268702165, "grad_norm": 1.671875, "learning_rate": 1.8563261775030108e-05, "loss": 1.044036293029785, "num_input_tokens_seen": 17789750720, "step": 62550, "train_runtime": 609305.2359, "train_tokens_per_second": 29196.78 }, { "epoch": 2.2134951471339455, "grad_norm": 1.5390625, "learning_rate": 1.856198254699423e-05, "loss": 1.0357852935791017, "num_input_tokens_seen": 17792588096, "step": 62560, "train_runtime": 609404.0811, "train_tokens_per_second": 29196.7 }, { "epoch": 2.213848967397674, "grad_norm": 1.59375, "learning_rate": 1.8560703583383675e-05, "loss": 1.031400775909424, "num_input_tokens_seen": 17795441536, "step": 62570, "train_runtime": 609500.5288, "train_tokens_per_second": 29196.761 }, { "epoch": 2.214202787661403, "grad_norm": 1.578125, "learning_rate": 1.855942488410737e-05, "loss": 1.0412686347961426, "num_input_tokens_seen": 17798296512, "step": 62580, "train_runtime": 609598.9173, "train_tokens_per_second": 29196.732 }, { "epoch": 2.2145566079251315, "grad_norm": 1.6171875, "learning_rate": 1.855814644907426e-05, "loss": 1.0430171012878418, "num_input_tokens_seen": 17801200640, "step": 62590, "train_runtime": 609700.9613, "train_tokens_per_second": 29196.609 }, { "epoch": 2.2149104281888605, "grad_norm": 1.6171875, "learning_rate": 1.855686827819336e-05, "loss": 1.0205448150634766, "num_input_tokens_seen": 17804031872, "step": 62600, "train_runtime": 609797.9895, "train_tokens_per_second": 29196.606 }, { "epoch": 2.215264248452589, "grad_norm": 1.6171875, "learning_rate": 1.855559037137371e-05, "loss": 1.044449806213379, "num_input_tokens_seen": 17806885504, "step": 62610, "train_runtime": 609894.6313, "train_tokens_per_second": 29196.659 }, { "epoch": 2.215618068716318, "grad_norm": 1.6484375, "learning_rate": 1.85543127285244e-05, "loss": 1.0466630935668946, "num_input_tokens_seen": 17809684032, "step": 62620, "train_runtime": 609991.0518, "train_tokens_per_second": 29196.632 }, { "epoch": 2.2159718889800466, "grad_norm": 1.546875, "learning_rate": 1.8553035349554565e-05, "loss": 1.0315136909484863, "num_input_tokens_seen": 17812522176, "step": 62630, "train_runtime": 610086.6069, "train_tokens_per_second": 29196.711 }, { "epoch": 2.2163257092437756, "grad_norm": 1.5859375, "learning_rate": 1.855175823437339e-05, "loss": 1.0362170219421387, "num_input_tokens_seen": 17815373440, "step": 62640, "train_runtime": 610184.453, "train_tokens_per_second": 29196.702 }, { "epoch": 2.216679529507504, "grad_norm": 1.578125, "learning_rate": 1.8550481382890086e-05, "loss": 1.0235048294067384, "num_input_tokens_seen": 17818197824, "step": 62650, "train_runtime": 610279.0236, "train_tokens_per_second": 29196.805 }, { "epoch": 2.217033349771233, "grad_norm": 1.515625, "learning_rate": 1.8549204795013926e-05, "loss": 1.050114631652832, "num_input_tokens_seen": 17821069632, "step": 62660, "train_runtime": 610377.323, "train_tokens_per_second": 29196.808 }, { "epoch": 2.2173871700349617, "grad_norm": 1.5859375, "learning_rate": 1.8547928470654215e-05, "loss": 1.031122589111328, "num_input_tokens_seen": 17823951168, "step": 62670, "train_runtime": 610478.6477, "train_tokens_per_second": 29196.682 }, { "epoch": 2.2177409902986907, "grad_norm": 1.609375, "learning_rate": 1.854665240972031e-05, "loss": 1.0282096862792969, "num_input_tokens_seen": 17826824576, "step": 62680, "train_runtime": 610577.3496, "train_tokens_per_second": 29196.669 }, { "epoch": 2.2180948105624196, "grad_norm": 1.640625, "learning_rate": 1.8545376612121605e-05, "loss": 1.0419161796569825, "num_input_tokens_seen": 17829648384, "step": 62690, "train_runtime": 610675.06, "train_tokens_per_second": 29196.621 }, { "epoch": 2.218448630826148, "grad_norm": 1.625, "learning_rate": 1.854410107776754e-05, "loss": 1.0522695541381837, "num_input_tokens_seen": 17832494912, "step": 62700, "train_runtime": 610772.1332, "train_tokens_per_second": 29196.641 }, { "epoch": 2.218802451089877, "grad_norm": 1.6015625, "learning_rate": 1.8542825806567598e-05, "loss": 1.0436452865600585, "num_input_tokens_seen": 17835344064, "step": 62710, "train_runtime": 610867.9468, "train_tokens_per_second": 29196.726 }, { "epoch": 2.2191562713536057, "grad_norm": 1.640625, "learning_rate": 1.854155079843131e-05, "loss": 1.049454116821289, "num_input_tokens_seen": 17838160576, "step": 62720, "train_runtime": 610963.2025, "train_tokens_per_second": 29196.784 }, { "epoch": 2.2195100916173347, "grad_norm": 1.640625, "learning_rate": 1.8540276053268246e-05, "loss": 1.027310562133789, "num_input_tokens_seen": 17840954304, "step": 62730, "train_runtime": 611059.5239, "train_tokens_per_second": 29196.754 }, { "epoch": 2.2198639118810632, "grad_norm": 1.609375, "learning_rate": 1.8539001570988016e-05, "loss": 1.033111000061035, "num_input_tokens_seen": 17843745280, "step": 62740, "train_runtime": 611154.5073, "train_tokens_per_second": 29196.783 }, { "epoch": 2.2202177321447922, "grad_norm": 1.59375, "learning_rate": 1.8537727351500283e-05, "loss": 1.0474322319030762, "num_input_tokens_seen": 17846575936, "step": 62750, "train_runtime": 611251.3814, "train_tokens_per_second": 29196.786 }, { "epoch": 2.2205715524085208, "grad_norm": 1.65625, "learning_rate": 1.8536453394714744e-05, "loss": 1.042524814605713, "num_input_tokens_seen": 17849360512, "step": 62760, "train_runtime": 611344.7343, "train_tokens_per_second": 29196.883 }, { "epoch": 2.2209253726722498, "grad_norm": 1.65625, "learning_rate": 1.8535179700541148e-05, "loss": 1.04327392578125, "num_input_tokens_seen": 17852226816, "step": 62770, "train_runtime": 611443.9077, "train_tokens_per_second": 29196.835 }, { "epoch": 2.2212791929359783, "grad_norm": 1.53125, "learning_rate": 1.853390626888928e-05, "loss": 1.0360421180725097, "num_input_tokens_seen": 17855051712, "step": 62780, "train_runtime": 611542.45, "train_tokens_per_second": 29196.749 }, { "epoch": 2.2216330131997073, "grad_norm": 1.5703125, "learning_rate": 1.8532633099668977e-05, "loss": 1.0402423858642578, "num_input_tokens_seen": 17857865280, "step": 62790, "train_runtime": 611638.22, "train_tokens_per_second": 29196.778 }, { "epoch": 2.221986833463436, "grad_norm": 1.5859375, "learning_rate": 1.8531360192790107e-05, "loss": 1.0318503379821777, "num_input_tokens_seen": 17860658048, "step": 62800, "train_runtime": 611730.8922, "train_tokens_per_second": 29196.92 }, { "epoch": 2.222340653727165, "grad_norm": 1.6640625, "learning_rate": 1.853008754816259e-05, "loss": 1.0265142440795898, "num_input_tokens_seen": 17863485696, "step": 62810, "train_runtime": 611827.2516, "train_tokens_per_second": 29196.944 }, { "epoch": 2.2226944739908934, "grad_norm": 1.6484375, "learning_rate": 1.852881516569639e-05, "loss": 1.0433298110961915, "num_input_tokens_seen": 17866356800, "step": 62820, "train_runtime": 611929.0099, "train_tokens_per_second": 29196.78 }, { "epoch": 2.2230482942546224, "grad_norm": 1.609375, "learning_rate": 1.8527543045301513e-05, "loss": 1.0384368896484375, "num_input_tokens_seen": 17869209344, "step": 62830, "train_runtime": 612023.7695, "train_tokens_per_second": 29196.921 }, { "epoch": 2.223402114518351, "grad_norm": 1.5625, "learning_rate": 1.8526271186888e-05, "loss": 1.0359642028808593, "num_input_tokens_seen": 17872057152, "step": 62840, "train_runtime": 612121.434, "train_tokens_per_second": 29196.914 }, { "epoch": 2.22375593478208, "grad_norm": 1.6171875, "learning_rate": 1.852499959036595e-05, "loss": 1.022753620147705, "num_input_tokens_seen": 17874869568, "step": 62850, "train_runtime": 612214.594, "train_tokens_per_second": 29197.065 }, { "epoch": 2.2241097550458084, "grad_norm": 1.578125, "learning_rate": 1.8523728255645494e-05, "loss": 1.0331228256225586, "num_input_tokens_seen": 17877708864, "step": 62860, "train_runtime": 612311.5853, "train_tokens_per_second": 29197.078 }, { "epoch": 2.2244635753095374, "grad_norm": 1.5234375, "learning_rate": 1.8522457182636814e-05, "loss": 1.0438164710998534, "num_input_tokens_seen": 17880557632, "step": 62870, "train_runtime": 612409.9366, "train_tokens_per_second": 29197.04 }, { "epoch": 2.2248173955732664, "grad_norm": 1.5234375, "learning_rate": 1.8521186371250122e-05, "loss": 1.0419047355651856, "num_input_tokens_seen": 17883430784, "step": 62880, "train_runtime": 612504.618, "train_tokens_per_second": 29197.218 }, { "epoch": 2.225171215836995, "grad_norm": 1.578125, "learning_rate": 1.851991582139569e-05, "loss": 1.058720016479492, "num_input_tokens_seen": 17886279104, "step": 62890, "train_runtime": 612598.5522, "train_tokens_per_second": 29197.39 }, { "epoch": 2.225525036100724, "grad_norm": 1.546875, "learning_rate": 1.8518645532983816e-05, "loss": 1.035905647277832, "num_input_tokens_seen": 17889097344, "step": 62900, "train_runtime": 612694.7356, "train_tokens_per_second": 29197.407 }, { "epoch": 2.2258788563644525, "grad_norm": 1.59375, "learning_rate": 1.851737550592486e-05, "loss": 1.0216590881347656, "num_input_tokens_seen": 17891929792, "step": 62910, "train_runtime": 612791.0316, "train_tokens_per_second": 29197.441 }, { "epoch": 2.2262326766281815, "grad_norm": 1.5078125, "learning_rate": 1.8516105740129215e-05, "loss": 1.0440673828125, "num_input_tokens_seen": 17894842304, "step": 62920, "train_runtime": 612891.5579, "train_tokens_per_second": 29197.404 }, { "epoch": 2.22658649689191, "grad_norm": 1.59375, "learning_rate": 1.8514836235507305e-05, "loss": 1.057785701751709, "num_input_tokens_seen": 17897694336, "step": 62930, "train_runtime": 612988.9752, "train_tokens_per_second": 29197.416 }, { "epoch": 2.226940317155639, "grad_norm": 1.5390625, "learning_rate": 1.8513566991969618e-05, "loss": 1.0113880157470703, "num_input_tokens_seen": 17900512064, "step": 62940, "train_runtime": 613084.3956, "train_tokens_per_second": 29197.468 }, { "epoch": 2.2272941374193675, "grad_norm": 1.65625, "learning_rate": 1.851229800942668e-05, "loss": 1.052680778503418, "num_input_tokens_seen": 17903365056, "step": 62950, "train_runtime": 613179.793, "train_tokens_per_second": 29197.578 }, { "epoch": 2.2276479576830965, "grad_norm": 1.6171875, "learning_rate": 1.851102928778905e-05, "loss": 1.0455453872680665, "num_input_tokens_seen": 17906207488, "step": 62960, "train_runtime": 613276.3994, "train_tokens_per_second": 29197.614 }, { "epoch": 2.228001777946825, "grad_norm": 1.703125, "learning_rate": 1.8509760826967337e-05, "loss": 1.0478303909301758, "num_input_tokens_seen": 17909064768, "step": 62970, "train_runtime": 613374.6259, "train_tokens_per_second": 29197.596 }, { "epoch": 2.228355598210554, "grad_norm": 1.6328125, "learning_rate": 1.850849262687219e-05, "loss": 1.0386860847473145, "num_input_tokens_seen": 17911911680, "step": 62980, "train_runtime": 613469.3414, "train_tokens_per_second": 29197.729 }, { "epoch": 2.2287094184742826, "grad_norm": 1.6171875, "learning_rate": 1.8507224687414308e-05, "loss": 1.0417236328125, "num_input_tokens_seen": 17914744320, "step": 62990, "train_runtime": 613566.0129, "train_tokens_per_second": 29197.746 }, { "epoch": 2.2290632387380116, "grad_norm": 1.5703125, "learning_rate": 1.8505957008504415e-05, "loss": 1.0322514533996583, "num_input_tokens_seen": 17917577600, "step": 63000, "train_runtime": 613660.418, "train_tokens_per_second": 29197.871 }, { "epoch": 2.22941705900174, "grad_norm": 1.546875, "learning_rate": 1.8504689590053308e-05, "loss": 1.038742733001709, "num_input_tokens_seen": 17920431744, "step": 63010, "train_runtime": 613760.1458, "train_tokens_per_second": 29197.777 }, { "epoch": 2.229770879265469, "grad_norm": 1.5859375, "learning_rate": 1.8503422431971794e-05, "loss": 1.0285913467407226, "num_input_tokens_seen": 17923229248, "step": 63020, "train_runtime": 613857.141, "train_tokens_per_second": 29197.721 }, { "epoch": 2.230124699529198, "grad_norm": 1.515625, "learning_rate": 1.850215553417074e-05, "loss": 1.0401494026184082, "num_input_tokens_seen": 17926048128, "step": 63030, "train_runtime": 613951.9278, "train_tokens_per_second": 29197.804 }, { "epoch": 2.2304785197929267, "grad_norm": 1.6015625, "learning_rate": 1.8500888896561066e-05, "loss": 1.0449932098388672, "num_input_tokens_seen": 17928859264, "step": 63040, "train_runtime": 614048.814, "train_tokens_per_second": 29197.775 }, { "epoch": 2.2308323400566556, "grad_norm": 1.6171875, "learning_rate": 1.8499622519053708e-05, "loss": 1.0341005325317383, "num_input_tokens_seen": 17931673024, "step": 63050, "train_runtime": 614144.8377, "train_tokens_per_second": 29197.792 }, { "epoch": 2.231186160320384, "grad_norm": 1.59375, "learning_rate": 1.8498356401559667e-05, "loss": 1.0336530685424805, "num_input_tokens_seen": 17934523840, "step": 63060, "train_runtime": 614242.1178, "train_tokens_per_second": 29197.809 }, { "epoch": 2.231539980584113, "grad_norm": 1.6171875, "learning_rate": 1.8497090543989972e-05, "loss": 1.0366477966308594, "num_input_tokens_seen": 17937379968, "step": 63070, "train_runtime": 614338.7863, "train_tokens_per_second": 29197.863 }, { "epoch": 2.2318938008478417, "grad_norm": 1.703125, "learning_rate": 1.8495824946255704e-05, "loss": 1.0416396141052247, "num_input_tokens_seen": 17940220032, "step": 63080, "train_runtime": 614435.3803, "train_tokens_per_second": 29197.896 }, { "epoch": 2.2322476211115707, "grad_norm": 1.6015625, "learning_rate": 1.8494559608267985e-05, "loss": 1.0371956825256348, "num_input_tokens_seen": 17943035136, "step": 63090, "train_runtime": 614530.7638, "train_tokens_per_second": 29197.944 }, { "epoch": 2.2326014413752993, "grad_norm": 1.578125, "learning_rate": 1.8493294529937976e-05, "loss": 1.0345140457153321, "num_input_tokens_seen": 17945947456, "step": 63100, "train_runtime": 614633.3577, "train_tokens_per_second": 29197.809 }, { "epoch": 2.2329552616390282, "grad_norm": 1.59375, "learning_rate": 1.849202971117688e-05, "loss": 1.032081413269043, "num_input_tokens_seen": 17948796544, "step": 63110, "train_runtime": 614729.9876, "train_tokens_per_second": 29197.854 }, { "epoch": 2.233309081902757, "grad_norm": 1.59375, "learning_rate": 1.8490765151895952e-05, "loss": 1.0353840827941894, "num_input_tokens_seen": 17951693056, "step": 63120, "train_runtime": 614828.2723, "train_tokens_per_second": 29197.898 }, { "epoch": 2.2336629021664858, "grad_norm": 1.578125, "learning_rate": 1.8489500852006484e-05, "loss": 1.0363322257995606, "num_input_tokens_seen": 17954511552, "step": 63130, "train_runtime": 614925.0674, "train_tokens_per_second": 29197.885 }, { "epoch": 2.2340167224302143, "grad_norm": 1.6015625, "learning_rate": 1.8488236811419795e-05, "loss": 1.0454951286315919, "num_input_tokens_seen": 17957332800, "step": 63140, "train_runtime": 615018.2598, "train_tokens_per_second": 29198.048 }, { "epoch": 2.2343705426939433, "grad_norm": 1.53125, "learning_rate": 1.8486973030047278e-05, "loss": 1.0266526222229004, "num_input_tokens_seen": 17960199232, "step": 63150, "train_runtime": 615116.8471, "train_tokens_per_second": 29198.028 }, { "epoch": 2.234724362957672, "grad_norm": 1.6328125, "learning_rate": 1.8485709507800337e-05, "loss": 1.0463420867919921, "num_input_tokens_seen": 17963042176, "step": 63160, "train_runtime": 615215.1078, "train_tokens_per_second": 29197.986 }, { "epoch": 2.235078183221401, "grad_norm": 1.6328125, "learning_rate": 1.8484446244590438e-05, "loss": 1.0274453163146973, "num_input_tokens_seen": 17965905216, "step": 63170, "train_runtime": 615317.5954, "train_tokens_per_second": 29197.776 }, { "epoch": 2.23543200348513, "grad_norm": 1.6171875, "learning_rate": 1.848318324032909e-05, "loss": 1.0283151626586915, "num_input_tokens_seen": 17968737600, "step": 63180, "train_runtime": 615415.1261, "train_tokens_per_second": 29197.751 }, { "epoch": 2.2357858237488584, "grad_norm": 1.6640625, "learning_rate": 1.8481920494927827e-05, "loss": 1.0407233238220215, "num_input_tokens_seen": 17971527744, "step": 63190, "train_runtime": 615510.1866, "train_tokens_per_second": 29197.775 }, { "epoch": 2.2361396440125874, "grad_norm": 1.6328125, "learning_rate": 1.8480658008298242e-05, "loss": 1.0547028541564942, "num_input_tokens_seen": 17974361408, "step": 63200, "train_runtime": 615610.6637, "train_tokens_per_second": 29197.612 }, { "epoch": 2.236493464276316, "grad_norm": 1.5390625, "learning_rate": 1.8479395780351963e-05, "loss": 1.0347110748291015, "num_input_tokens_seen": 17977231808, "step": 63210, "train_runtime": 615708.1187, "train_tokens_per_second": 29197.653 }, { "epoch": 2.236847284540045, "grad_norm": 1.5390625, "learning_rate": 1.8478133811000662e-05, "loss": 1.0292227745056153, "num_input_tokens_seen": 17980107904, "step": 63220, "train_runtime": 615806.2609, "train_tokens_per_second": 29197.67 }, { "epoch": 2.2372011048037734, "grad_norm": 1.578125, "learning_rate": 1.8476872100156055e-05, "loss": 1.0385347366333009, "num_input_tokens_seen": 17982972992, "step": 63230, "train_runtime": 615902.8533, "train_tokens_per_second": 29197.743 }, { "epoch": 2.2375549250675024, "grad_norm": 1.59375, "learning_rate": 1.8475610647729893e-05, "loss": 1.0353388786315918, "num_input_tokens_seen": 17985832064, "step": 63240, "train_runtime": 616002.0782, "train_tokens_per_second": 29197.681 }, { "epoch": 2.237908745331231, "grad_norm": 1.5859375, "learning_rate": 1.8474349453633978e-05, "loss": 1.0347203254699706, "num_input_tokens_seen": 17988681024, "step": 63250, "train_runtime": 616100.4836, "train_tokens_per_second": 29197.641 }, { "epoch": 2.23826256559496, "grad_norm": 1.578125, "learning_rate": 1.8473088517780156e-05, "loss": 1.0321243286132813, "num_input_tokens_seen": 17991489792, "step": 63260, "train_runtime": 616195.2093, "train_tokens_per_second": 29197.711 }, { "epoch": 2.2386163858586885, "grad_norm": 1.671875, "learning_rate": 1.84718278400803e-05, "loss": 1.0438150405883788, "num_input_tokens_seen": 17994283456, "step": 63270, "train_runtime": 616289.3249, "train_tokens_per_second": 29197.785 }, { "epoch": 2.2389702061224175, "grad_norm": 1.578125, "learning_rate": 1.847056742044634e-05, "loss": 1.023946475982666, "num_input_tokens_seen": 17997138560, "step": 63280, "train_runtime": 616387.5643, "train_tokens_per_second": 29197.764 }, { "epoch": 2.239324026386146, "grad_norm": 1.6484375, "learning_rate": 1.8469307258790238e-05, "loss": 1.038642978668213, "num_input_tokens_seen": 18000014592, "step": 63290, "train_runtime": 616489.217, "train_tokens_per_second": 29197.615 }, { "epoch": 2.239677846649875, "grad_norm": 1.5703125, "learning_rate": 1.8468047355024013e-05, "loss": 1.0281539916992188, "num_input_tokens_seen": 18002834944, "step": 63300, "train_runtime": 616585.5937, "train_tokens_per_second": 29197.625 }, { "epoch": 2.2400316669136036, "grad_norm": 1.6015625, "learning_rate": 1.8466787709059705e-05, "loss": 1.0520421981811523, "num_input_tokens_seen": 18005689024, "step": 63310, "train_runtime": 616684.292, "train_tokens_per_second": 29197.58 }, { "epoch": 2.2403854871773325, "grad_norm": 1.625, "learning_rate": 1.846552832080941e-05, "loss": 1.0466800689697267, "num_input_tokens_seen": 18008566912, "step": 63320, "train_runtime": 616785.8556, "train_tokens_per_second": 29197.438 }, { "epoch": 2.240739307441061, "grad_norm": 1.5859375, "learning_rate": 1.8464269190185267e-05, "loss": 1.0350932121276855, "num_input_tokens_seen": 18011385536, "step": 63330, "train_runtime": 616881.4109, "train_tokens_per_second": 29197.485 }, { "epoch": 2.24109312770479, "grad_norm": 1.65625, "learning_rate": 1.8463010317099445e-05, "loss": 1.0414432525634765, "num_input_tokens_seen": 18014273600, "step": 63340, "train_runtime": 616980.6267, "train_tokens_per_second": 29197.47 }, { "epoch": 2.2414469479685186, "grad_norm": 1.6328125, "learning_rate": 1.8461751701464168e-05, "loss": 1.0393269538879395, "num_input_tokens_seen": 18017111104, "step": 63350, "train_runtime": 617075.0436, "train_tokens_per_second": 29197.601 }, { "epoch": 2.2418007682322476, "grad_norm": 1.578125, "learning_rate": 1.8460493343191697e-05, "loss": 1.0393078804016114, "num_input_tokens_seen": 18019982592, "step": 63360, "train_runtime": 617174.3325, "train_tokens_per_second": 29197.557 }, { "epoch": 2.2421545884959766, "grad_norm": 1.578125, "learning_rate": 1.8459235242194336e-05, "loss": 1.052144718170166, "num_input_tokens_seen": 18022809728, "step": 63370, "train_runtime": 617271.1555, "train_tokens_per_second": 29197.557 }, { "epoch": 2.242508408759705, "grad_norm": 1.578125, "learning_rate": 1.8457977398384422e-05, "loss": 1.0257415771484375, "num_input_tokens_seen": 18025575296, "step": 63380, "train_runtime": 617366.1053, "train_tokens_per_second": 29197.546 }, { "epoch": 2.242862229023434, "grad_norm": 1.5, "learning_rate": 1.8456719811674344e-05, "loss": 1.0248476028442384, "num_input_tokens_seen": 18028389056, "step": 63390, "train_runtime": 617460.8339, "train_tokens_per_second": 29197.624 }, { "epoch": 2.2432160492871627, "grad_norm": 1.5546875, "learning_rate": 1.8455462481976532e-05, "loss": 1.0307409286499023, "num_input_tokens_seen": 18031265984, "step": 63400, "train_runtime": 617558.3876, "train_tokens_per_second": 29197.67 }, { "epoch": 2.2435698695508917, "grad_norm": 1.5859375, "learning_rate": 1.8454205409203457e-05, "loss": 1.0327302932739257, "num_input_tokens_seen": 18034121600, "step": 63410, "train_runtime": 617659.818, "train_tokens_per_second": 29197.498 }, { "epoch": 2.24392368981462, "grad_norm": 1.609375, "learning_rate": 1.8452948593267625e-05, "loss": 1.0383750915527343, "num_input_tokens_seen": 18037002880, "step": 63420, "train_runtime": 617760.0095, "train_tokens_per_second": 29197.427 }, { "epoch": 2.244277510078349, "grad_norm": 1.5078125, "learning_rate": 1.845169203408159e-05, "loss": 1.026041603088379, "num_input_tokens_seen": 18039850752, "step": 63430, "train_runtime": 617857.5266, "train_tokens_per_second": 29197.428 }, { "epoch": 2.2446313303420777, "grad_norm": 1.6015625, "learning_rate": 1.845043573155795e-05, "loss": 1.0251968383789063, "num_input_tokens_seen": 18042645056, "step": 63440, "train_runtime": 617954.821, "train_tokens_per_second": 29197.353 }, { "epoch": 2.2449851506058067, "grad_norm": 1.671875, "learning_rate": 1.8449179685609337e-05, "loss": 1.0266098022460937, "num_input_tokens_seen": 18045479104, "step": 63450, "train_runtime": 618049.4714, "train_tokens_per_second": 29197.467 }, { "epoch": 2.2453389708695353, "grad_norm": 1.5625, "learning_rate": 1.8447923896148434e-05, "loss": 1.0275009155273438, "num_input_tokens_seen": 18048314304, "step": 63460, "train_runtime": 618145.5556, "train_tokens_per_second": 29197.515 }, { "epoch": 2.2456927911332643, "grad_norm": 1.5546875, "learning_rate": 1.8446668363087957e-05, "loss": 1.0360755920410156, "num_input_tokens_seen": 18051161152, "step": 63470, "train_runtime": 618245.0398, "train_tokens_per_second": 29197.422 }, { "epoch": 2.246046611396993, "grad_norm": 1.546875, "learning_rate": 1.8445413086340664e-05, "loss": 1.0508489608764648, "num_input_tokens_seen": 18054002368, "step": 63480, "train_runtime": 618341.8015, "train_tokens_per_second": 29197.448 }, { "epoch": 2.246400431660722, "grad_norm": 1.6015625, "learning_rate": 1.8444158065819366e-05, "loss": 1.0261276245117188, "num_input_tokens_seen": 18056809152, "step": 63490, "train_runtime": 618438.0892, "train_tokens_per_second": 29197.44 }, { "epoch": 2.2467542519244503, "grad_norm": 1.546875, "learning_rate": 1.8442903301436902e-05, "loss": 1.0409505844116211, "num_input_tokens_seen": 18059634944, "step": 63500, "train_runtime": 618536.8982, "train_tokens_per_second": 29197.345 }, { "epoch": 2.2471080721881793, "grad_norm": 1.578125, "learning_rate": 1.844164879310616e-05, "loss": 1.0414392471313476, "num_input_tokens_seen": 18062452928, "step": 63510, "train_runtime": 618632.174, "train_tokens_per_second": 29197.403 }, { "epoch": 2.2474618924519083, "grad_norm": 1.5703125, "learning_rate": 1.844039454074006e-05, "loss": 1.0403059005737305, "num_input_tokens_seen": 18065313152, "step": 63520, "train_runtime": 618730.1091, "train_tokens_per_second": 29197.404 }, { "epoch": 2.247815712715637, "grad_norm": 1.6953125, "learning_rate": 1.8439140544251578e-05, "loss": 1.031533145904541, "num_input_tokens_seen": 18068128896, "step": 63530, "train_runtime": 618827.9646, "train_tokens_per_second": 29197.337 }, { "epoch": 2.248169532979366, "grad_norm": 1.59375, "learning_rate": 1.8437886803553726e-05, "loss": 1.0483896255493164, "num_input_tokens_seen": 18070927296, "step": 63540, "train_runtime": 618919.3138, "train_tokens_per_second": 29197.549 }, { "epoch": 2.2485233532430944, "grad_norm": 1.53125, "learning_rate": 1.843663331855955e-05, "loss": 1.0343040466308593, "num_input_tokens_seen": 18073789568, "step": 63550, "train_runtime": 619019.5699, "train_tokens_per_second": 29197.445 }, { "epoch": 2.2488771735068234, "grad_norm": 1.5625, "learning_rate": 1.8435380089182142e-05, "loss": 1.0425338745117188, "num_input_tokens_seen": 18076627072, "step": 63560, "train_runtime": 619117.8813, "train_tokens_per_second": 29197.391 }, { "epoch": 2.249230993770552, "grad_norm": 1.5546875, "learning_rate": 1.8434127115334636e-05, "loss": 1.0201240539550782, "num_input_tokens_seen": 18079494784, "step": 63570, "train_runtime": 619216.5061, "train_tokens_per_second": 29197.372 }, { "epoch": 2.249584814034281, "grad_norm": 1.578125, "learning_rate": 1.843287439693021e-05, "loss": 1.0294544219970703, "num_input_tokens_seen": 18082270528, "step": 63580, "train_runtime": 619309.588, "train_tokens_per_second": 29197.466 }, { "epoch": 2.2499386342980094, "grad_norm": 1.625, "learning_rate": 1.8431621933882087e-05, "loss": 1.0418066024780273, "num_input_tokens_seen": 18085124736, "step": 63590, "train_runtime": 619407.9635, "train_tokens_per_second": 29197.437 }, { "epoch": 2.2502924545617384, "grad_norm": 1.65625, "learning_rate": 1.8430369726103514e-05, "loss": 1.0399689674377441, "num_input_tokens_seen": 18087948160, "step": 63600, "train_runtime": 619504.989, "train_tokens_per_second": 29197.421 }, { "epoch": 2.250646274825467, "grad_norm": 1.5703125, "learning_rate": 1.8429117773507797e-05, "loss": 1.0339451789855958, "num_input_tokens_seen": 18090803840, "step": 63610, "train_runtime": 619602.3771, "train_tokens_per_second": 29197.441 }, { "epoch": 2.251000095089196, "grad_norm": 1.625, "learning_rate": 1.8427866076008265e-05, "loss": 1.0347336769104003, "num_input_tokens_seen": 18093636864, "step": 63620, "train_runtime": 619697.2606, "train_tokens_per_second": 29197.542 }, { "epoch": 2.2513539153529245, "grad_norm": 1.6640625, "learning_rate": 1.842661463351832e-05, "loss": 1.03631591796875, "num_input_tokens_seen": 18096458176, "step": 63630, "train_runtime": 619793.2649, "train_tokens_per_second": 29197.572 }, { "epoch": 2.2517077356166535, "grad_norm": 1.5390625, "learning_rate": 1.8425363445951368e-05, "loss": 1.0282306671142578, "num_input_tokens_seen": 18099305088, "step": 63640, "train_runtime": 619891.7065, "train_tokens_per_second": 29197.527 }, { "epoch": 2.252061555880382, "grad_norm": 1.5546875, "learning_rate": 1.842411251322088e-05, "loss": 1.0304922103881835, "num_input_tokens_seen": 18102157248, "step": 63650, "train_runtime": 619991.0008, "train_tokens_per_second": 29197.452 }, { "epoch": 2.252415376144111, "grad_norm": 1.515625, "learning_rate": 1.8422861835240357e-05, "loss": 1.0515201568603516, "num_input_tokens_seen": 18105021696, "step": 63660, "train_runtime": 620087.9779, "train_tokens_per_second": 29197.505 }, { "epoch": 2.25276919640784, "grad_norm": 1.578125, "learning_rate": 1.842161141192335e-05, "loss": 1.0258378982543945, "num_input_tokens_seen": 18107910592, "step": 63670, "train_runtime": 620187.376, "train_tokens_per_second": 29197.483 }, { "epoch": 2.2531230166715686, "grad_norm": 1.625, "learning_rate": 1.8420361243183444e-05, "loss": 1.0289522171020509, "num_input_tokens_seen": 18110765696, "step": 63680, "train_runtime": 620283.2911, "train_tokens_per_second": 29197.571 }, { "epoch": 2.253476836935297, "grad_norm": 1.5234375, "learning_rate": 1.841911132893427e-05, "loss": 1.0291211128234863, "num_input_tokens_seen": 18113634752, "step": 63690, "train_runtime": 620382.598, "train_tokens_per_second": 29197.522 }, { "epoch": 2.253830657199026, "grad_norm": 1.6171875, "learning_rate": 1.841786166908949e-05, "loss": 1.0349963188171387, "num_input_tokens_seen": 18116427968, "step": 63700, "train_runtime": 620475.9732, "train_tokens_per_second": 29197.63 }, { "epoch": 2.254184477462755, "grad_norm": 1.609375, "learning_rate": 1.841661226356282e-05, "loss": 1.0285568237304688, "num_input_tokens_seen": 18119236352, "step": 63710, "train_runtime": 620571.5672, "train_tokens_per_second": 29197.658 }, { "epoch": 2.2545382977264836, "grad_norm": 1.5078125, "learning_rate": 1.8415363112268012e-05, "loss": 1.0465338706970215, "num_input_tokens_seen": 18122137728, "step": 63720, "train_runtime": 620672.4157, "train_tokens_per_second": 29197.588 }, { "epoch": 2.2548921179902126, "grad_norm": 1.5859375, "learning_rate": 1.841411421511886e-05, "loss": 1.0396684646606444, "num_input_tokens_seen": 18124975104, "step": 63730, "train_runtime": 620768.3078, "train_tokens_per_second": 29197.649 }, { "epoch": 2.255245938253941, "grad_norm": 1.546875, "learning_rate": 1.841286557202919e-05, "loss": 1.0462173461914062, "num_input_tokens_seen": 18127781952, "step": 63740, "train_runtime": 620863.985, "train_tokens_per_second": 29197.67 }, { "epoch": 2.25559975851767, "grad_norm": 1.5859375, "learning_rate": 1.841161718291288e-05, "loss": 1.0254095077514649, "num_input_tokens_seen": 18130655552, "step": 63750, "train_runtime": 620962.9387, "train_tokens_per_second": 29197.645 }, { "epoch": 2.2559535787813987, "grad_norm": 1.546875, "learning_rate": 1.8410369047683846e-05, "loss": 1.0365596771240235, "num_input_tokens_seen": 18133477952, "step": 63760, "train_runtime": 621059.6241, "train_tokens_per_second": 29197.644 }, { "epoch": 2.2563073990451277, "grad_norm": 1.5546875, "learning_rate": 1.8409121166256037e-05, "loss": 1.0397085189819335, "num_input_tokens_seen": 18136394880, "step": 63770, "train_runtime": 621159.6448, "train_tokens_per_second": 29197.639 }, { "epoch": 2.256661219308856, "grad_norm": 1.65625, "learning_rate": 1.840787353854346e-05, "loss": 1.039761734008789, "num_input_tokens_seen": 18139277696, "step": 63780, "train_runtime": 621257.583, "train_tokens_per_second": 29197.676 }, { "epoch": 2.257015039572585, "grad_norm": 1.6171875, "learning_rate": 1.840662616446015e-05, "loss": 1.0228913307189942, "num_input_tokens_seen": 18142099264, "step": 63790, "train_runtime": 621351.5049, "train_tokens_per_second": 29197.804 }, { "epoch": 2.2573688598363137, "grad_norm": 1.578125, "learning_rate": 1.8405379043920177e-05, "loss": 1.0467246055603028, "num_input_tokens_seen": 18144960192, "step": 63800, "train_runtime": 621449.8475, "train_tokens_per_second": 29197.787 }, { "epoch": 2.2577226801000427, "grad_norm": 1.6171875, "learning_rate": 1.8404132176837667e-05, "loss": 1.0339645385742187, "num_input_tokens_seen": 18147823744, "step": 63810, "train_runtime": 621546.1001, "train_tokens_per_second": 29197.872 }, { "epoch": 2.2580765003637713, "grad_norm": 1.578125, "learning_rate": 1.840288556312678e-05, "loss": 1.03076114654541, "num_input_tokens_seen": 18150667328, "step": 63820, "train_runtime": 621644.965, "train_tokens_per_second": 29197.803 }, { "epoch": 2.2584303206275003, "grad_norm": 1.5859375, "learning_rate": 1.8401639202701713e-05, "loss": 1.0513643264770507, "num_input_tokens_seen": 18153507776, "step": 63830, "train_runtime": 621742.7308, "train_tokens_per_second": 29197.78 }, { "epoch": 2.258784140891229, "grad_norm": 1.625, "learning_rate": 1.8400393095476712e-05, "loss": 1.0398809432983398, "num_input_tokens_seen": 18156356992, "step": 63840, "train_runtime": 621839.3175, "train_tokens_per_second": 29197.827 }, { "epoch": 2.259137961154958, "grad_norm": 1.609375, "learning_rate": 1.8399147241366053e-05, "loss": 1.0168328285217285, "num_input_tokens_seen": 18159206912, "step": 63850, "train_runtime": 621937.5671, "train_tokens_per_second": 29197.797 }, { "epoch": 2.259491781418687, "grad_norm": 1.609375, "learning_rate": 1.8397901640284058e-05, "loss": 1.037716007232666, "num_input_tokens_seen": 18162015296, "step": 63860, "train_runtime": 622032.2623, "train_tokens_per_second": 29197.867 }, { "epoch": 2.2598456016824153, "grad_norm": 1.625, "learning_rate": 1.8396656292145095e-05, "loss": 1.0450238227844237, "num_input_tokens_seen": 18164865728, "step": 63870, "train_runtime": 622129.6627, "train_tokens_per_second": 29197.878 }, { "epoch": 2.2601994219461443, "grad_norm": 1.5390625, "learning_rate": 1.8395411196863562e-05, "loss": 1.0361207962036132, "num_input_tokens_seen": 18167747456, "step": 63880, "train_runtime": 622229.7243, "train_tokens_per_second": 29197.814 }, { "epoch": 2.260553242209873, "grad_norm": 1.5546875, "learning_rate": 1.839416635435391e-05, "loss": 1.0308193206787108, "num_input_tokens_seen": 18170612736, "step": 63890, "train_runtime": 622328.2918, "train_tokens_per_second": 29197.793 }, { "epoch": 2.260907062473602, "grad_norm": 1.6171875, "learning_rate": 1.8392921764530616e-05, "loss": 1.0465408325195313, "num_input_tokens_seen": 18173508032, "step": 63900, "train_runtime": 622426.328, "train_tokens_per_second": 29197.846 }, { "epoch": 2.2612608827373304, "grad_norm": 1.6015625, "learning_rate": 1.8391677427308206e-05, "loss": 1.0435256958007812, "num_input_tokens_seen": 18176356672, "step": 63910, "train_runtime": 622523.5507, "train_tokens_per_second": 29197.862 }, { "epoch": 2.2616147030010594, "grad_norm": 1.578125, "learning_rate": 1.8390433342601252e-05, "loss": 1.028120994567871, "num_input_tokens_seen": 18179242432, "step": 63920, "train_runtime": 622622.3606, "train_tokens_per_second": 29197.863 }, { "epoch": 2.261968523264788, "grad_norm": 1.5625, "learning_rate": 1.838918951032435e-05, "loss": 1.0301898002624512, "num_input_tokens_seen": 18182086272, "step": 63930, "train_runtime": 622723.7012, "train_tokens_per_second": 29197.678 }, { "epoch": 2.262322343528517, "grad_norm": 1.625, "learning_rate": 1.8387945930392157e-05, "loss": 1.0318767547607421, "num_input_tokens_seen": 18184978560, "step": 63940, "train_runtime": 622824.8443, "train_tokens_per_second": 29197.581 }, { "epoch": 2.2626761637922455, "grad_norm": 1.7265625, "learning_rate": 1.838670260271935e-05, "loss": 1.028726577758789, "num_input_tokens_seen": 18187870912, "step": 63950, "train_runtime": 622924.2773, "train_tokens_per_second": 29197.563 }, { "epoch": 2.2630299840559744, "grad_norm": 1.625, "learning_rate": 1.8385459527220665e-05, "loss": 1.0095151901245116, "num_input_tokens_seen": 18190690944, "step": 63960, "train_runtime": 623022.849, "train_tokens_per_second": 29197.47 }, { "epoch": 2.263383804319703, "grad_norm": 1.65625, "learning_rate": 1.838421670381086e-05, "loss": 1.0391574859619142, "num_input_tokens_seen": 18193527552, "step": 63970, "train_runtime": 623118.6856, "train_tokens_per_second": 29197.532 }, { "epoch": 2.263737624583432, "grad_norm": 1.6015625, "learning_rate": 1.838297413240475e-05, "loss": 1.0406129837036133, "num_input_tokens_seen": 18196320960, "step": 63980, "train_runtime": 623214.4762, "train_tokens_per_second": 29197.526 }, { "epoch": 2.2640914448471605, "grad_norm": 1.5546875, "learning_rate": 1.8381731812917183e-05, "loss": 1.0221141815185546, "num_input_tokens_seen": 18199177536, "step": 63990, "train_runtime": 623311.4231, "train_tokens_per_second": 29197.568 }, { "epoch": 2.2644452651108895, "grad_norm": 1.546875, "learning_rate": 1.8380489745263044e-05, "loss": 1.0434159278869628, "num_input_tokens_seen": 18202115584, "step": 64000, "train_runtime": 623415.0751, "train_tokens_per_second": 29197.426 }, { "epoch": 2.2647990853746185, "grad_norm": 1.6171875, "learning_rate": 1.8379247929357262e-05, "loss": 1.046522331237793, "num_input_tokens_seen": 18204937984, "step": 64010, "train_runtime": 623511.2073, "train_tokens_per_second": 29197.451 }, { "epoch": 2.265152905638347, "grad_norm": 1.625, "learning_rate": 1.8378006365114808e-05, "loss": 1.020125675201416, "num_input_tokens_seen": 18207782784, "step": 64020, "train_runtime": 623610.175, "train_tokens_per_second": 29197.379 }, { "epoch": 2.2655067259020756, "grad_norm": 1.515625, "learning_rate": 1.8376765052450693e-05, "loss": 1.0354833602905273, "num_input_tokens_seen": 18210612032, "step": 64030, "train_runtime": 623706.0717, "train_tokens_per_second": 29197.426 }, { "epoch": 2.2658605461658046, "grad_norm": 1.6171875, "learning_rate": 1.8375523991279958e-05, "loss": 1.0354298591613769, "num_input_tokens_seen": 18213459136, "step": 64040, "train_runtime": 623803.9096, "train_tokens_per_second": 29197.411 }, { "epoch": 2.2662143664295336, "grad_norm": 1.6640625, "learning_rate": 1.83742831815177e-05, "loss": 1.0357027053833008, "num_input_tokens_seen": 18216316096, "step": 64050, "train_runtime": 623901.6238, "train_tokens_per_second": 29197.417 }, { "epoch": 2.266568186693262, "grad_norm": 1.6015625, "learning_rate": 1.8373042623079042e-05, "loss": 1.042828369140625, "num_input_tokens_seen": 18219144064, "step": 64060, "train_runtime": 623996.2964, "train_tokens_per_second": 29197.52 }, { "epoch": 2.266922006956991, "grad_norm": 1.5859375, "learning_rate": 1.8371802315879157e-05, "loss": 1.0347795486450195, "num_input_tokens_seen": 18222026368, "step": 64070, "train_runtime": 624096.1725, "train_tokens_per_second": 29197.465 }, { "epoch": 2.2672758272207196, "grad_norm": 1.6015625, "learning_rate": 1.837056225983326e-05, "loss": 1.0481571197509765, "num_input_tokens_seen": 18224849856, "step": 64080, "train_runtime": 624192.9876, "train_tokens_per_second": 29197.46 }, { "epoch": 2.2676296474844486, "grad_norm": 1.59375, "learning_rate": 1.8369322454856595e-05, "loss": 1.0413642883300782, "num_input_tokens_seen": 18227699200, "step": 64090, "train_runtime": 624291.3457, "train_tokens_per_second": 29197.424 }, { "epoch": 2.267983467748177, "grad_norm": 1.625, "learning_rate": 1.8368082900864454e-05, "loss": 1.0392223358154298, "num_input_tokens_seen": 18230607296, "step": 64100, "train_runtime": 624391.8998, "train_tokens_per_second": 29197.38 }, { "epoch": 2.268337288011906, "grad_norm": 1.5625, "learning_rate": 1.8366843597772163e-05, "loss": 1.0338793754577638, "num_input_tokens_seen": 18233416512, "step": 64110, "train_runtime": 624486.4015, "train_tokens_per_second": 29197.46 }, { "epoch": 2.2686911082756347, "grad_norm": 1.5078125, "learning_rate": 1.8365604545495093e-05, "loss": 1.022924041748047, "num_input_tokens_seen": 18236270336, "step": 64120, "train_runtime": 624584.2321, "train_tokens_per_second": 29197.456 }, { "epoch": 2.2690449285393637, "grad_norm": 1.6015625, "learning_rate": 1.8364365743948656e-05, "loss": 1.031276798248291, "num_input_tokens_seen": 18239149376, "step": 64130, "train_runtime": 624682.1929, "train_tokens_per_second": 29197.486 }, { "epoch": 2.2693987488030922, "grad_norm": 1.5546875, "learning_rate": 1.8363127193048303e-05, "loss": 1.0460419654846191, "num_input_tokens_seen": 18241989056, "step": 64140, "train_runtime": 624779.7546, "train_tokens_per_second": 29197.471 }, { "epoch": 2.269752569066821, "grad_norm": 1.7265625, "learning_rate": 1.836188889270952e-05, "loss": 1.0462946891784668, "num_input_tokens_seen": 18244820672, "step": 64150, "train_runtime": 624878.6675, "train_tokens_per_second": 29197.381 }, { "epoch": 2.2701063893305498, "grad_norm": 1.6484375, "learning_rate": 1.8360650842847834e-05, "loss": 1.0404623031616211, "num_input_tokens_seen": 18247666816, "step": 64160, "train_runtime": 624978.3232, "train_tokens_per_second": 29197.28 }, { "epoch": 2.2704602095942787, "grad_norm": 1.578125, "learning_rate": 1.8359413043378822e-05, "loss": 1.0416048049926758, "num_input_tokens_seen": 18250471552, "step": 64170, "train_runtime": 625075.5277, "train_tokens_per_second": 29197.226 }, { "epoch": 2.2708140298580073, "grad_norm": 1.578125, "learning_rate": 1.8358175494218088e-05, "loss": 1.024864959716797, "num_input_tokens_seen": 18253279872, "step": 64180, "train_runtime": 625169.0613, "train_tokens_per_second": 29197.35 }, { "epoch": 2.2711678501217363, "grad_norm": 1.578125, "learning_rate": 1.8356938195281282e-05, "loss": 1.0446632385253907, "num_input_tokens_seen": 18256188672, "step": 64190, "train_runtime": 625271.8121, "train_tokens_per_second": 29197.204 }, { "epoch": 2.2715216703854653, "grad_norm": 1.5546875, "learning_rate": 1.8355701146484093e-05, "loss": 1.03402099609375, "num_input_tokens_seen": 18258988480, "step": 64200, "train_runtime": 625367.3255, "train_tokens_per_second": 29197.222 }, { "epoch": 2.271875490649194, "grad_norm": 1.53125, "learning_rate": 1.835446434774225e-05, "loss": 1.0459038734436035, "num_input_tokens_seen": 18261761728, "step": 64210, "train_runtime": 625459.269, "train_tokens_per_second": 29197.364 }, { "epoch": 2.272229310912923, "grad_norm": 1.546875, "learning_rate": 1.835322779897152e-05, "loss": 1.0082343101501465, "num_input_tokens_seen": 18264589440, "step": 64220, "train_runtime": 625557.3095, "train_tokens_per_second": 29197.308 }, { "epoch": 2.2725831311766513, "grad_norm": 1.6328125, "learning_rate": 1.8351991500087712e-05, "loss": 1.0329509735107423, "num_input_tokens_seen": 18267451840, "step": 64230, "train_runtime": 625653.8283, "train_tokens_per_second": 29197.379 }, { "epoch": 2.2729369514403803, "grad_norm": 1.6171875, "learning_rate": 1.8350755451006675e-05, "loss": 1.0398679733276368, "num_input_tokens_seen": 18270272704, "step": 64240, "train_runtime": 625751.8161, "train_tokens_per_second": 29197.315 }, { "epoch": 2.273290771704109, "grad_norm": 1.546875, "learning_rate": 1.8349519651644293e-05, "loss": 1.0330918312072754, "num_input_tokens_seen": 18273148800, "step": 64250, "train_runtime": 625850.9974, "train_tokens_per_second": 29197.283 }, { "epoch": 2.273644591967838, "grad_norm": 1.609375, "learning_rate": 1.8348284101916496e-05, "loss": 1.0290111541748046, "num_input_tokens_seen": 18275962176, "step": 64260, "train_runtime": 625945.8427, "train_tokens_per_second": 29197.354 }, { "epoch": 2.2739984122315664, "grad_norm": 1.6328125, "learning_rate": 1.8347048801739246e-05, "loss": 1.0446077346801759, "num_input_tokens_seen": 18278836416, "step": 64270, "train_runtime": 626042.0491, "train_tokens_per_second": 29197.458 }, { "epoch": 2.2743522324952954, "grad_norm": 1.625, "learning_rate": 1.8345813751028558e-05, "loss": 1.0254140853881837, "num_input_tokens_seen": 18281634432, "step": 64280, "train_runtime": 626135.5545, "train_tokens_per_second": 29197.566 }, { "epoch": 2.274706052759024, "grad_norm": 1.6328125, "learning_rate": 1.834457894970047e-05, "loss": 1.039866828918457, "num_input_tokens_seen": 18284517248, "step": 64290, "train_runtime": 626236.6148, "train_tokens_per_second": 29197.458 }, { "epoch": 2.275059873022753, "grad_norm": 1.609375, "learning_rate": 1.834334439767107e-05, "loss": 1.043266201019287, "num_input_tokens_seen": 18287369728, "step": 64300, "train_runtime": 626336.222, "train_tokens_per_second": 29197.369 }, { "epoch": 2.2754136932864815, "grad_norm": 1.59375, "learning_rate": 1.8342110094856478e-05, "loss": 1.0364429473876953, "num_input_tokens_seen": 18290188480, "step": 64310, "train_runtime": 626432.8932, "train_tokens_per_second": 29197.363 }, { "epoch": 2.2757675135502105, "grad_norm": 1.7109375, "learning_rate": 1.834087604117287e-05, "loss": 1.0412542343139648, "num_input_tokens_seen": 18293081152, "step": 64320, "train_runtime": 626532.2632, "train_tokens_per_second": 29197.349 }, { "epoch": 2.276121333813939, "grad_norm": 1.578125, "learning_rate": 1.833964223653644e-05, "loss": 1.0314523696899414, "num_input_tokens_seen": 18295940352, "step": 64330, "train_runtime": 626630.1005, "train_tokens_per_second": 29197.353 }, { "epoch": 2.276475154077668, "grad_norm": 1.609375, "learning_rate": 1.8338408680863432e-05, "loss": 1.0374682426452637, "num_input_tokens_seen": 18298808640, "step": 64340, "train_runtime": 626727.0085, "train_tokens_per_second": 29197.415 }, { "epoch": 2.276828974341397, "grad_norm": 1.6015625, "learning_rate": 1.8337175374070135e-05, "loss": 1.0267463684082032, "num_input_tokens_seen": 18301680768, "step": 64350, "train_runtime": 626824.3356, "train_tokens_per_second": 29197.464 }, { "epoch": 2.2771827946051255, "grad_norm": 1.5625, "learning_rate": 1.8335942316072865e-05, "loss": 1.0374742507934571, "num_input_tokens_seen": 18304524160, "step": 64360, "train_runtime": 626921.2791, "train_tokens_per_second": 29197.484 }, { "epoch": 2.277536614868854, "grad_norm": 1.6171875, "learning_rate": 1.8334709506787985e-05, "loss": 1.031332778930664, "num_input_tokens_seen": 18307434048, "step": 64370, "train_runtime": 627022.7785, "train_tokens_per_second": 29197.399 }, { "epoch": 2.277890435132583, "grad_norm": 1.671875, "learning_rate": 1.8333476946131896e-05, "loss": 1.0254192352294922, "num_input_tokens_seen": 18310294400, "step": 64380, "train_runtime": 627121.6147, "train_tokens_per_second": 29197.358 }, { "epoch": 2.278244255396312, "grad_norm": 1.609375, "learning_rate": 1.833224463402104e-05, "loss": 1.0401155471801757, "num_input_tokens_seen": 18313157696, "step": 64390, "train_runtime": 627220.5511, "train_tokens_per_second": 29197.318 }, { "epoch": 2.2785980756600406, "grad_norm": 1.609375, "learning_rate": 1.8331012570371896e-05, "loss": 1.0457454681396485, "num_input_tokens_seen": 18316027776, "step": 64400, "train_runtime": 627317.5793, "train_tokens_per_second": 29197.377 }, { "epoch": 2.2789518959237696, "grad_norm": 1.5859375, "learning_rate": 1.8329780755100982e-05, "loss": 1.0439123153686523, "num_input_tokens_seen": 18318848320, "step": 64410, "train_runtime": 627411.5672, "train_tokens_per_second": 29197.499 }, { "epoch": 2.279305716187498, "grad_norm": 1.65625, "learning_rate": 1.8328549188124855e-05, "loss": 1.043769073486328, "num_input_tokens_seen": 18321744320, "step": 64420, "train_runtime": 627513.8923, "train_tokens_per_second": 29197.353 }, { "epoch": 2.279659536451227, "grad_norm": 1.578125, "learning_rate": 1.8327317869360112e-05, "loss": 1.0141810417175292, "num_input_tokens_seen": 18324578176, "step": 64430, "train_runtime": 627610.8161, "train_tokens_per_second": 29197.359 }, { "epoch": 2.2800133567149556, "grad_norm": 1.6171875, "learning_rate": 1.8326086798723394e-05, "loss": 1.0207132339477538, "num_input_tokens_seen": 18327486656, "step": 64440, "train_runtime": 627711.2992, "train_tokens_per_second": 29197.318 }, { "epoch": 2.2803671769786846, "grad_norm": 1.625, "learning_rate": 1.832485597613137e-05, "loss": 1.0384506225585937, "num_input_tokens_seen": 18330381120, "step": 64450, "train_runtime": 627811.6926, "train_tokens_per_second": 29197.26 }, { "epoch": 2.280720997242413, "grad_norm": 1.5859375, "learning_rate": 1.8323625401500763e-05, "loss": 1.0421475410461425, "num_input_tokens_seen": 18333246272, "step": 64460, "train_runtime": 627910.4712, "train_tokens_per_second": 29197.23 }, { "epoch": 2.281074817506142, "grad_norm": 1.5859375, "learning_rate": 1.832239507474832e-05, "loss": 1.0280970573425292, "num_input_tokens_seen": 18336156800, "step": 64470, "train_runtime": 628012.4818, "train_tokens_per_second": 29197.122 }, { "epoch": 2.2814286377698707, "grad_norm": 1.6171875, "learning_rate": 1.8321164995790837e-05, "loss": 1.0427358627319336, "num_input_tokens_seen": 18339035840, "step": 64480, "train_runtime": 628111.6357, "train_tokens_per_second": 29197.096 }, { "epoch": 2.2817824580335997, "grad_norm": 1.5234375, "learning_rate": 1.831993516454515e-05, "loss": 1.0380359649658204, "num_input_tokens_seen": 18341846016, "step": 64490, "train_runtime": 628208.5688, "train_tokens_per_second": 29197.064 }, { "epoch": 2.2821362782973287, "grad_norm": 1.5859375, "learning_rate": 1.8318705580928116e-05, "loss": 1.0348947525024415, "num_input_tokens_seen": 18344666752, "step": 64500, "train_runtime": 628304.5724, "train_tokens_per_second": 29197.093 }, { "epoch": 2.2824900985610572, "grad_norm": 1.6484375, "learning_rate": 1.8317476244856666e-05, "loss": 1.033930778503418, "num_input_tokens_seen": 18347492224, "step": 64510, "train_runtime": 628400.0894, "train_tokens_per_second": 29197.151 }, { "epoch": 2.2828439188247858, "grad_norm": 1.6171875, "learning_rate": 1.8316247156247734e-05, "loss": 1.0285585403442383, "num_input_tokens_seen": 18350386304, "step": 64520, "train_runtime": 628499.6995, "train_tokens_per_second": 29197.128 }, { "epoch": 2.2831977390885148, "grad_norm": 1.6171875, "learning_rate": 1.8315018315018315e-05, "loss": 1.0467044830322265, "num_input_tokens_seen": 18353217600, "step": 64530, "train_runtime": 628597.5557, "train_tokens_per_second": 29197.087 }, { "epoch": 2.2835515593522437, "grad_norm": 1.5234375, "learning_rate": 1.8313789721085437e-05, "loss": 1.0134990692138672, "num_input_tokens_seen": 18356073664, "step": 64540, "train_runtime": 628694.4822, "train_tokens_per_second": 29197.129 }, { "epoch": 2.2839053796159723, "grad_norm": 1.6484375, "learning_rate": 1.8312561374366162e-05, "loss": 1.0387868881225586, "num_input_tokens_seen": 18358872704, "step": 64550, "train_runtime": 628788.6716, "train_tokens_per_second": 29197.207 }, { "epoch": 2.2842591998797013, "grad_norm": 1.65625, "learning_rate": 1.83113332747776e-05, "loss": 1.038320541381836, "num_input_tokens_seen": 18361735744, "step": 64560, "train_runtime": 628889.1265, "train_tokens_per_second": 29197.095 }, { "epoch": 2.28461302014343, "grad_norm": 1.6640625, "learning_rate": 1.8310105422236888e-05, "loss": 1.024345588684082, "num_input_tokens_seen": 18364562880, "step": 64570, "train_runtime": 628986.9309, "train_tokens_per_second": 29197.05 }, { "epoch": 2.284966840407159, "grad_norm": 1.5625, "learning_rate": 1.8308877816661216e-05, "loss": 1.0377293586730958, "num_input_tokens_seen": 18367401024, "step": 64580, "train_runtime": 629085.2566, "train_tokens_per_second": 29196.998 }, { "epoch": 2.2853206606708873, "grad_norm": 1.6015625, "learning_rate": 1.8307650457967805e-05, "loss": 1.0366357803344726, "num_input_tokens_seen": 18370255744, "step": 64590, "train_runtime": 629185.8636, "train_tokens_per_second": 29196.867 }, { "epoch": 2.2856744809346163, "grad_norm": 1.6328125, "learning_rate": 1.8306423346073912e-05, "loss": 1.0456771850585938, "num_input_tokens_seen": 18373099648, "step": 64600, "train_runtime": 629281.1296, "train_tokens_per_second": 29196.966 }, { "epoch": 2.286028301198345, "grad_norm": 1.609375, "learning_rate": 1.830519648089684e-05, "loss": 1.0351470947265624, "num_input_tokens_seen": 18375949440, "step": 64610, "train_runtime": 629375.1676, "train_tokens_per_second": 29197.131 }, { "epoch": 2.286382121462074, "grad_norm": 1.609375, "learning_rate": 1.8303969862353928e-05, "loss": 1.0320655822753906, "num_input_tokens_seen": 18378796160, "step": 64620, "train_runtime": 629470.9671, "train_tokens_per_second": 29197.21 }, { "epoch": 2.2867359417258024, "grad_norm": 1.6171875, "learning_rate": 1.830274349036255e-05, "loss": 1.0561960220336915, "num_input_tokens_seen": 18381682240, "step": 64630, "train_runtime": 629572.2057, "train_tokens_per_second": 29197.099 }, { "epoch": 2.2870897619895314, "grad_norm": 1.6328125, "learning_rate": 1.830151736484013e-05, "loss": 1.0282472610473632, "num_input_tokens_seen": 18384510848, "step": 64640, "train_runtime": 629670.9423, "train_tokens_per_second": 29197.013 }, { "epoch": 2.28744358225326, "grad_norm": 1.578125, "learning_rate": 1.830029148570411e-05, "loss": 1.0292570114135742, "num_input_tokens_seen": 18387382016, "step": 64650, "train_runtime": 629770.9928, "train_tokens_per_second": 29196.934 }, { "epoch": 2.287797402516989, "grad_norm": 1.5703125, "learning_rate": 1.829906585287199e-05, "loss": 1.044973659515381, "num_input_tokens_seen": 18390254336, "step": 64660, "train_runtime": 629868.8903, "train_tokens_per_second": 29196.956 }, { "epoch": 2.2881512227807175, "grad_norm": 1.625, "learning_rate": 1.8297840466261302e-05, "loss": 1.0455560684204102, "num_input_tokens_seen": 18393092352, "step": 64670, "train_runtime": 629967.6508, "train_tokens_per_second": 29196.884 }, { "epoch": 2.2885050430444465, "grad_norm": 1.59375, "learning_rate": 1.8296615325789615e-05, "loss": 1.048040771484375, "num_input_tokens_seen": 18395909632, "step": 64680, "train_runtime": 630061.2908, "train_tokens_per_second": 29197.016 }, { "epoch": 2.2888588633081755, "grad_norm": 1.5703125, "learning_rate": 1.829539043137454e-05, "loss": 1.0449575424194335, "num_input_tokens_seen": 18398797824, "step": 64690, "train_runtime": 630158.7639, "train_tokens_per_second": 29197.083 }, { "epoch": 2.289212683571904, "grad_norm": 1.59375, "learning_rate": 1.8294165782933725e-05, "loss": 1.029738998413086, "num_input_tokens_seen": 18401685376, "step": 64700, "train_runtime": 630259.9672, "train_tokens_per_second": 29196.976 }, { "epoch": 2.289566503835633, "grad_norm": 1.59375, "learning_rate": 1.8292941380384852e-05, "loss": 1.0258625030517579, "num_input_tokens_seen": 18404513216, "step": 64710, "train_runtime": 630356.6601, "train_tokens_per_second": 29196.984 }, { "epoch": 2.2899203240993615, "grad_norm": 1.5859375, "learning_rate": 1.8291717223645656e-05, "loss": 1.033228302001953, "num_input_tokens_seen": 18407399104, "step": 64720, "train_runtime": 630456.828, "train_tokens_per_second": 29196.922 }, { "epoch": 2.2902741443630905, "grad_norm": 1.53125, "learning_rate": 1.8290493312633896e-05, "loss": 1.0421640396118164, "num_input_tokens_seen": 18410233344, "step": 64730, "train_runtime": 630553.2668, "train_tokens_per_second": 29196.952 }, { "epoch": 2.290627964626819, "grad_norm": 1.6015625, "learning_rate": 1.8289269647267365e-05, "loss": 1.028494167327881, "num_input_tokens_seen": 18413004224, "step": 64740, "train_runtime": 630647.0612, "train_tokens_per_second": 29197.003 }, { "epoch": 2.290981784890548, "grad_norm": 1.6328125, "learning_rate": 1.8288046227463916e-05, "loss": 1.0369249343872071, "num_input_tokens_seen": 18415917824, "step": 64750, "train_runtime": 630748.2963, "train_tokens_per_second": 29196.936 }, { "epoch": 2.2913356051542766, "grad_norm": 1.5703125, "learning_rate": 1.828682305314142e-05, "loss": 1.032666015625, "num_input_tokens_seen": 18418796032, "step": 64760, "train_runtime": 630846.0598, "train_tokens_per_second": 29196.974 }, { "epoch": 2.2916894254180056, "grad_norm": 1.5859375, "learning_rate": 1.82856001242178e-05, "loss": 1.0364411354064942, "num_input_tokens_seen": 18421703296, "step": 64770, "train_runtime": 630948.3843, "train_tokens_per_second": 29196.847 }, { "epoch": 2.292043245681734, "grad_norm": 1.609375, "learning_rate": 1.8284377440611006e-05, "loss": 1.0370383262634277, "num_input_tokens_seen": 18424564416, "step": 64780, "train_runtime": 631046.1282, "train_tokens_per_second": 29196.858 }, { "epoch": 2.292397065945463, "grad_norm": 1.5390625, "learning_rate": 1.828315500223904e-05, "loss": 1.0400867462158203, "num_input_tokens_seen": 18427471424, "step": 64790, "train_runtime": 631145.3279, "train_tokens_per_second": 29196.875 }, { "epoch": 2.2927508862091917, "grad_norm": 1.609375, "learning_rate": 1.8281932809019927e-05, "loss": 1.0253150939941407, "num_input_tokens_seen": 18430335168, "step": 64800, "train_runtime": 631240.1039, "train_tokens_per_second": 29197.028 }, { "epoch": 2.2931047064729206, "grad_norm": 1.6015625, "learning_rate": 1.828071086087174e-05, "loss": 1.0349834442138672, "num_input_tokens_seen": 18433147648, "step": 64810, "train_runtime": 631337.0844, "train_tokens_per_second": 29196.998 }, { "epoch": 2.293458526736649, "grad_norm": 1.5546875, "learning_rate": 1.827948915771259e-05, "loss": 1.0476248741149903, "num_input_tokens_seen": 18436049856, "step": 64820, "train_runtime": 631436.3839, "train_tokens_per_second": 29197.003 }, { "epoch": 2.293812347000378, "grad_norm": 1.578125, "learning_rate": 1.827826769946063e-05, "loss": 1.039565372467041, "num_input_tokens_seen": 18438903360, "step": 64830, "train_runtime": 631536.3526, "train_tokens_per_second": 29196.899 }, { "epoch": 2.294166167264107, "grad_norm": 1.5390625, "learning_rate": 1.8277046486034035e-05, "loss": 1.0273591995239257, "num_input_tokens_seen": 18441781184, "step": 64840, "train_runtime": 631636.2799, "train_tokens_per_second": 29196.836 }, { "epoch": 2.2945199875278357, "grad_norm": 1.578125, "learning_rate": 1.8275825517351035e-05, "loss": 1.0401777267456054, "num_input_tokens_seen": 18444648704, "step": 64850, "train_runtime": 631735.1406, "train_tokens_per_second": 29196.807 }, { "epoch": 2.2948738077915642, "grad_norm": 1.5546875, "learning_rate": 1.827460479332989e-05, "loss": 1.0224387168884277, "num_input_tokens_seen": 18447546560, "step": 64860, "train_runtime": 631835.5094, "train_tokens_per_second": 29196.755 }, { "epoch": 2.2952276280552932, "grad_norm": 1.5859375, "learning_rate": 1.827338431388891e-05, "loss": 1.0415216445922852, "num_input_tokens_seen": 18450421440, "step": 64870, "train_runtime": 631938.0701, "train_tokens_per_second": 29196.566 }, { "epoch": 2.295581448319022, "grad_norm": 1.5625, "learning_rate": 1.8272164078946418e-05, "loss": 1.0378936767578124, "num_input_tokens_seen": 18453212928, "step": 64880, "train_runtime": 632029.8043, "train_tokens_per_second": 29196.745 }, { "epoch": 2.2959352685827508, "grad_norm": 1.640625, "learning_rate": 1.82709440884208e-05, "loss": 1.0377042770385743, "num_input_tokens_seen": 18456091264, "step": 64890, "train_runtime": 632128.9348, "train_tokens_per_second": 29196.72 }, { "epoch": 2.2962890888464798, "grad_norm": 1.5625, "learning_rate": 1.8269724342230474e-05, "loss": 1.0219600677490235, "num_input_tokens_seen": 18458993792, "step": 64900, "train_runtime": 632227.8367, "train_tokens_per_second": 29196.743 }, { "epoch": 2.2966429091102083, "grad_norm": 1.5703125, "learning_rate": 1.8268504840293886e-05, "loss": 1.0450669288635255, "num_input_tokens_seen": 18461815168, "step": 64910, "train_runtime": 632322.2493, "train_tokens_per_second": 29196.846 }, { "epoch": 2.2969967293739373, "grad_norm": 1.5625, "learning_rate": 1.8267285582529535e-05, "loss": 1.0436393737792968, "num_input_tokens_seen": 18464662144, "step": 64920, "train_runtime": 632417.4905, "train_tokens_per_second": 29196.95 }, { "epoch": 2.297350549637666, "grad_norm": 1.6484375, "learning_rate": 1.826606656885594e-05, "loss": 1.0366973876953125, "num_input_tokens_seen": 18467464896, "step": 64930, "train_runtime": 632512.8779, "train_tokens_per_second": 29196.978 }, { "epoch": 2.297704369901395, "grad_norm": 1.6328125, "learning_rate": 1.826484779919168e-05, "loss": 1.0373764991760255, "num_input_tokens_seen": 18470356672, "step": 64940, "train_runtime": 632613.3148, "train_tokens_per_second": 29196.914 }, { "epoch": 2.2980581901651234, "grad_norm": 1.6015625, "learning_rate": 1.8263629273455353e-05, "loss": 1.0451536178588867, "num_input_tokens_seen": 18473203840, "step": 64950, "train_runtime": 632713.4759, "train_tokens_per_second": 29196.792 }, { "epoch": 2.2984120104288523, "grad_norm": 1.53125, "learning_rate": 1.8262410991565605e-05, "loss": 1.0363346099853517, "num_input_tokens_seen": 18476093120, "step": 64960, "train_runtime": 632816.7672, "train_tokens_per_second": 29196.592 }, { "epoch": 2.298765830692581, "grad_norm": 1.578125, "learning_rate": 1.826119295344112e-05, "loss": 1.0332185745239257, "num_input_tokens_seen": 18478951936, "step": 64970, "train_runtime": 632915.7945, "train_tokens_per_second": 29196.541 }, { "epoch": 2.29911965095631, "grad_norm": 1.5625, "learning_rate": 1.8259975159000613e-05, "loss": 1.037625217437744, "num_input_tokens_seen": 18481807872, "step": 64980, "train_runtime": 633012.5718, "train_tokens_per_second": 29196.589 }, { "epoch": 2.2994734712200384, "grad_norm": 1.5625, "learning_rate": 1.825875760816284e-05, "loss": 1.0380874633789063, "num_input_tokens_seen": 18484662720, "step": 64990, "train_runtime": 633108.8602, "train_tokens_per_second": 29196.658 }, { "epoch": 2.2998272914837674, "grad_norm": 1.625, "learning_rate": 1.8257540300846603e-05, "loss": 1.030609703063965, "num_input_tokens_seen": 18487515328, "step": 65000, "train_runtime": 633209.3845, "train_tokens_per_second": 29196.528 }, { "epoch": 2.2998272914837674, "eval_loss": 1.0217957496643066, "eval_runtime": 8.4425, "eval_samples_per_second": 472.37, "eval_steps_per_second": 3.79, "num_input_tokens_seen": 18487515328, "step": 65000 }, { "epoch": 2.300181111747496, "grad_norm": 1.6484375, "learning_rate": 1.825632323697073e-05, "loss": 1.0229268074035645, "num_input_tokens_seen": 18490398528, "step": 65010, "train_runtime": 633337.7732, "train_tokens_per_second": 29195.161 }, { "epoch": 2.300534932011225, "grad_norm": 1.578125, "learning_rate": 1.8255106416454093e-05, "loss": 1.0366459846496583, "num_input_tokens_seen": 18493255488, "step": 65020, "train_runtime": 633435.1971, "train_tokens_per_second": 29195.181 }, { "epoch": 2.300888752274954, "grad_norm": 1.671875, "learning_rate": 1.82538898392156e-05, "loss": 1.0396026611328124, "num_input_tokens_seen": 18496091968, "step": 65030, "train_runtime": 633534.8279, "train_tokens_per_second": 29195.067 }, { "epoch": 2.3012425725386825, "grad_norm": 1.5859375, "learning_rate": 1.8252673505174206e-05, "loss": 1.0393798828125, "num_input_tokens_seen": 18498931456, "step": 65040, "train_runtime": 633632.0104, "train_tokens_per_second": 29195.071 }, { "epoch": 2.3015963928024115, "grad_norm": 1.703125, "learning_rate": 1.825145741424888e-05, "loss": 1.0458796501159668, "num_input_tokens_seen": 18501787392, "step": 65050, "train_runtime": 633732.3105, "train_tokens_per_second": 29194.957 }, { "epoch": 2.30195021306614, "grad_norm": 1.6015625, "learning_rate": 1.8250241566358662e-05, "loss": 1.0302570343017579, "num_input_tokens_seen": 18504658240, "step": 65060, "train_runtime": 633832.5729, "train_tokens_per_second": 29194.868 }, { "epoch": 2.302304033329869, "grad_norm": 1.59375, "learning_rate": 1.8249025961422598e-05, "loss": 1.0455583572387694, "num_input_tokens_seen": 18507565504, "step": 65070, "train_runtime": 633933.0913, "train_tokens_per_second": 29194.825 }, { "epoch": 2.3026578535935975, "grad_norm": 1.6875, "learning_rate": 1.824781059935979e-05, "loss": 1.0493395805358887, "num_input_tokens_seen": 18510434112, "step": 65080, "train_runtime": 634033.0666, "train_tokens_per_second": 29194.746 }, { "epoch": 2.3030116738573265, "grad_norm": 1.640625, "learning_rate": 1.8246595480089376e-05, "loss": 1.0372772216796875, "num_input_tokens_seen": 18513277376, "step": 65090, "train_runtime": 634129.9972, "train_tokens_per_second": 29194.767 }, { "epoch": 2.303365494121055, "grad_norm": 1.5703125, "learning_rate": 1.8245380603530526e-05, "loss": 1.0383846282958984, "num_input_tokens_seen": 18516184256, "step": 65100, "train_runtime": 634229.5608, "train_tokens_per_second": 29194.767 }, { "epoch": 2.303719314384784, "grad_norm": 1.609375, "learning_rate": 1.8244165969602455e-05, "loss": 1.035775375366211, "num_input_tokens_seen": 18519012096, "step": 65110, "train_runtime": 634326.1239, "train_tokens_per_second": 29194.781 }, { "epoch": 2.3040731346485126, "grad_norm": 1.609375, "learning_rate": 1.824295157822441e-05, "loss": 1.051549243927002, "num_input_tokens_seen": 18521816896, "step": 65120, "train_runtime": 634420.2949, "train_tokens_per_second": 29194.868 }, { "epoch": 2.3044269549122416, "grad_norm": 1.625, "learning_rate": 1.8241737429315674e-05, "loss": 1.0504838943481445, "num_input_tokens_seen": 18524689920, "step": 65130, "train_runtime": 634520.368, "train_tokens_per_second": 29194.792 }, { "epoch": 2.30478077517597, "grad_norm": 1.5703125, "learning_rate": 1.8240523522795575e-05, "loss": 1.0351264953613282, "num_input_tokens_seen": 18527584000, "step": 65140, "train_runtime": 634625.4872, "train_tokens_per_second": 29194.516 }, { "epoch": 2.305134595439699, "grad_norm": 1.6328125, "learning_rate": 1.8239309858583466e-05, "loss": 1.0427067756652832, "num_input_tokens_seen": 18530475648, "step": 65150, "train_runtime": 634723.5119, "train_tokens_per_second": 29194.563 }, { "epoch": 2.3054884157034277, "grad_norm": 1.5234375, "learning_rate": 1.8238096436598755e-05, "loss": 1.0311473846435546, "num_input_tokens_seen": 18533333888, "step": 65160, "train_runtime": 634822.1385, "train_tokens_per_second": 29194.53 }, { "epoch": 2.3058422359671567, "grad_norm": 1.5703125, "learning_rate": 1.8236883256760882e-05, "loss": 1.0339998245239257, "num_input_tokens_seen": 18536214272, "step": 65170, "train_runtime": 634922.3519, "train_tokens_per_second": 29194.459 }, { "epoch": 2.3061960562308856, "grad_norm": 1.6640625, "learning_rate": 1.8235670318989305e-05, "loss": 1.0396757125854492, "num_input_tokens_seen": 18539085120, "step": 65180, "train_runtime": 635020.2009, "train_tokens_per_second": 29194.481 }, { "epoch": 2.306549876494614, "grad_norm": 1.5625, "learning_rate": 1.8234457623203548e-05, "loss": 1.0299694061279296, "num_input_tokens_seen": 18541982144, "step": 65190, "train_runtime": 635118.3014, "train_tokens_per_second": 29194.533 }, { "epoch": 2.3069036967583427, "grad_norm": 1.78125, "learning_rate": 1.8233245169323163e-05, "loss": 1.0411277770996095, "num_input_tokens_seen": 18544886080, "step": 65200, "train_runtime": 635219.4226, "train_tokens_per_second": 29194.457 }, { "epoch": 2.3072575170220717, "grad_norm": 1.5078125, "learning_rate": 1.823203295726772e-05, "loss": 1.0397773742675782, "num_input_tokens_seen": 18547720512, "step": 65210, "train_runtime": 635314.1117, "train_tokens_per_second": 29194.567 }, { "epoch": 2.3076113372858007, "grad_norm": 1.5703125, "learning_rate": 1.823082098695686e-05, "loss": 1.042841911315918, "num_input_tokens_seen": 18550568192, "step": 65220, "train_runtime": 635413.6803, "train_tokens_per_second": 29194.474 }, { "epoch": 2.3079651575495292, "grad_norm": 1.5703125, "learning_rate": 1.8229609258310233e-05, "loss": 1.0319224357604981, "num_input_tokens_seen": 18553420544, "step": 65230, "train_runtime": 635511.5974, "train_tokens_per_second": 29194.464 }, { "epoch": 2.3083189778132582, "grad_norm": 1.5859375, "learning_rate": 1.8228397771247542e-05, "loss": 1.0429303169250488, "num_input_tokens_seen": 18556261376, "step": 65240, "train_runtime": 635609.77, "train_tokens_per_second": 29194.424 }, { "epoch": 2.3086727980769868, "grad_norm": 1.6171875, "learning_rate": 1.822718652568852e-05, "loss": 1.0485212326049804, "num_input_tokens_seen": 18559124864, "step": 65250, "train_runtime": 635704.6007, "train_tokens_per_second": 29194.574 }, { "epoch": 2.3090266183407158, "grad_norm": 1.546875, "learning_rate": 1.8225975521552944e-05, "loss": 1.0395598411560059, "num_input_tokens_seen": 18561957888, "step": 65260, "train_runtime": 635800.6228, "train_tokens_per_second": 29194.62 }, { "epoch": 2.3093804386044443, "grad_norm": 1.5703125, "learning_rate": 1.8224764758760622e-05, "loss": 1.043720817565918, "num_input_tokens_seen": 18564790272, "step": 65270, "train_runtime": 635897.9345, "train_tokens_per_second": 29194.607 }, { "epoch": 2.3097342588681733, "grad_norm": 1.609375, "learning_rate": 1.8223554237231398e-05, "loss": 1.047821044921875, "num_input_tokens_seen": 18567663936, "step": 65280, "train_runtime": 635998.3623, "train_tokens_per_second": 29194.515 }, { "epoch": 2.310088079131902, "grad_norm": 1.5859375, "learning_rate": 1.822234395688517e-05, "loss": 1.0426538467407227, "num_input_tokens_seen": 18570522944, "step": 65290, "train_runtime": 636097.7239, "train_tokens_per_second": 29194.45 }, { "epoch": 2.310441899395631, "grad_norm": 1.578125, "learning_rate": 1.8221133917641845e-05, "loss": 1.021619701385498, "num_input_tokens_seen": 18573323968, "step": 65300, "train_runtime": 636190.3419, "train_tokens_per_second": 29194.602 }, { "epoch": 2.3107957196593594, "grad_norm": 1.6015625, "learning_rate": 1.821992411942139e-05, "loss": 1.041017723083496, "num_input_tokens_seen": 18576142400, "step": 65310, "train_runtime": 636286.5782, "train_tokens_per_second": 29194.616 }, { "epoch": 2.3111495399230884, "grad_norm": 1.53125, "learning_rate": 1.8218714562143804e-05, "loss": 1.0422449111938477, "num_input_tokens_seen": 18578974528, "step": 65320, "train_runtime": 636383.0338, "train_tokens_per_second": 29194.641 }, { "epoch": 2.3115033601868173, "grad_norm": 1.59375, "learning_rate": 1.8217505245729113e-05, "loss": 1.0307751655578614, "num_input_tokens_seen": 18581874560, "step": 65330, "train_runtime": 636483.2041, "train_tokens_per_second": 29194.603 }, { "epoch": 2.311857180450546, "grad_norm": 1.640625, "learning_rate": 1.8216296170097395e-05, "loss": 1.0481264114379882, "num_input_tokens_seen": 18584736768, "step": 65340, "train_runtime": 636584.5421, "train_tokens_per_second": 29194.452 }, { "epoch": 2.3122110007142744, "grad_norm": 1.6328125, "learning_rate": 1.8215087335168758e-05, "loss": 1.0404241561889649, "num_input_tokens_seen": 18587584192, "step": 65350, "train_runtime": 636681.2033, "train_tokens_per_second": 29194.492 }, { "epoch": 2.3125648209780034, "grad_norm": 1.59375, "learning_rate": 1.8213878740863342e-05, "loss": 1.0382518768310547, "num_input_tokens_seen": 18590437696, "step": 65360, "train_runtime": 636779.251, "train_tokens_per_second": 29194.478 }, { "epoch": 2.3129186412417324, "grad_norm": 1.6171875, "learning_rate": 1.821267038710133e-05, "loss": 1.0545601844787598, "num_input_tokens_seen": 18593262144, "step": 65370, "train_runtime": 636872.9649, "train_tokens_per_second": 29194.617 }, { "epoch": 2.313272461505461, "grad_norm": 1.6328125, "learning_rate": 1.8211462273802946e-05, "loss": 1.036918544769287, "num_input_tokens_seen": 18596127232, "step": 65380, "train_runtime": 636973.5019, "train_tokens_per_second": 29194.507 }, { "epoch": 2.31362628176919, "grad_norm": 1.59375, "learning_rate": 1.821025440088844e-05, "loss": 1.0232006072998048, "num_input_tokens_seen": 18598984320, "step": 65390, "train_runtime": 637072.4411, "train_tokens_per_second": 29194.458 }, { "epoch": 2.3139801020329185, "grad_norm": 1.5390625, "learning_rate": 1.8209046768278115e-05, "loss": 1.0324426651000977, "num_input_tokens_seen": 18601814464, "step": 65400, "train_runtime": 637169.9669, "train_tokens_per_second": 29194.431 }, { "epoch": 2.3143339222966475, "grad_norm": 1.671875, "learning_rate": 1.8207839375892292e-05, "loss": 1.0417671203613281, "num_input_tokens_seen": 18604680256, "step": 65410, "train_runtime": 637269.6279, "train_tokens_per_second": 29194.362 }, { "epoch": 2.314687742560376, "grad_norm": 1.59375, "learning_rate": 1.8206632223651342e-05, "loss": 1.0272227287292481, "num_input_tokens_seen": 18607483072, "step": 65420, "train_runtime": 637363.0407, "train_tokens_per_second": 29194.481 }, { "epoch": 2.315041562824105, "grad_norm": 1.5625, "learning_rate": 1.8205425311475674e-05, "loss": 1.0361154556274415, "num_input_tokens_seen": 18610298048, "step": 65430, "train_runtime": 637457.704, "train_tokens_per_second": 29194.561 }, { "epoch": 2.3153953830878335, "grad_norm": 1.6328125, "learning_rate": 1.820421863928572e-05, "loss": 1.0453486442565918, "num_input_tokens_seen": 18613147456, "step": 65440, "train_runtime": 637558.0189, "train_tokens_per_second": 29194.437 }, { "epoch": 2.3157492033515625, "grad_norm": 1.6171875, "learning_rate": 1.8203012207001965e-05, "loss": 1.0388654708862304, "num_input_tokens_seen": 18616037376, "step": 65450, "train_runtime": 637660.1718, "train_tokens_per_second": 29194.292 }, { "epoch": 2.316103023615291, "grad_norm": 1.5703125, "learning_rate": 1.8201806014544923e-05, "loss": 1.0443506240844727, "num_input_tokens_seen": 18618861184, "step": 65460, "train_runtime": 637753.5988, "train_tokens_per_second": 29194.443 }, { "epoch": 2.31645684387902, "grad_norm": 1.578125, "learning_rate": 1.8200600061835143e-05, "loss": 1.0519091606140136, "num_input_tokens_seen": 18621689664, "step": 65470, "train_runtime": 637850.2664, "train_tokens_per_second": 29194.453 }, { "epoch": 2.3168106641427486, "grad_norm": 1.5703125, "learning_rate": 1.8199394348793213e-05, "loss": 1.0428619384765625, "num_input_tokens_seen": 18624549248, "step": 65480, "train_runtime": 637947.7675, "train_tokens_per_second": 29194.474 }, { "epoch": 2.3171644844064776, "grad_norm": 1.59375, "learning_rate": 1.8198188875339767e-05, "loss": 1.0486169815063477, "num_input_tokens_seen": 18627419968, "step": 65490, "train_runtime": 638044.9453, "train_tokens_per_second": 29194.526 }, { "epoch": 2.317518304670206, "grad_norm": 1.6171875, "learning_rate": 1.8196983641395458e-05, "loss": 1.0388744354248047, "num_input_tokens_seen": 18630259328, "step": 65500, "train_runtime": 638140.0148, "train_tokens_per_second": 29194.626 }, { "epoch": 2.317872124933935, "grad_norm": 1.625, "learning_rate": 1.819577864688099e-05, "loss": 1.0508481025695802, "num_input_tokens_seen": 18633127296, "step": 65510, "train_runtime": 638237.1523, "train_tokens_per_second": 29194.677 }, { "epoch": 2.318225945197664, "grad_norm": 1.4765625, "learning_rate": 1.8194573891717096e-05, "loss": 1.041521167755127, "num_input_tokens_seen": 18635986944, "step": 65520, "train_runtime": 638333.8506, "train_tokens_per_second": 29194.734 }, { "epoch": 2.3185797654613927, "grad_norm": 1.6171875, "learning_rate": 1.819336937582455e-05, "loss": 1.0501035690307616, "num_input_tokens_seen": 18638905088, "step": 65530, "train_runtime": 638436.7715, "train_tokens_per_second": 29194.598 }, { "epoch": 2.3189335857251216, "grad_norm": 1.609375, "learning_rate": 1.8192165099124165e-05, "loss": 1.0338028907775878, "num_input_tokens_seen": 18641765184, "step": 65540, "train_runtime": 638535.3494, "train_tokens_per_second": 29194.57 }, { "epoch": 2.31928740598885, "grad_norm": 1.6484375, "learning_rate": 1.8190961061536783e-05, "loss": 1.0423393249511719, "num_input_tokens_seen": 18644563072, "step": 65550, "train_runtime": 638629.7637, "train_tokens_per_second": 29194.635 }, { "epoch": 2.319641226252579, "grad_norm": 1.53125, "learning_rate": 1.8189757262983285e-05, "loss": 1.0432945251464845, "num_input_tokens_seen": 18647349824, "step": 65560, "train_runtime": 638722.5952, "train_tokens_per_second": 29194.755 }, { "epoch": 2.3199950465163077, "grad_norm": 1.625, "learning_rate": 1.818855370338459e-05, "loss": 1.0450042724609374, "num_input_tokens_seen": 18650167424, "step": 65570, "train_runtime": 638818.1839, "train_tokens_per_second": 29194.797 }, { "epoch": 2.3203488667800367, "grad_norm": 1.71875, "learning_rate": 1.8187350382661664e-05, "loss": 1.0318404197692872, "num_input_tokens_seen": 18653026496, "step": 65580, "train_runtime": 638915.5335, "train_tokens_per_second": 29194.824 }, { "epoch": 2.3207026870437653, "grad_norm": 1.6015625, "learning_rate": 1.818614730073549e-05, "loss": 1.0348509788513183, "num_input_tokens_seen": 18655831808, "step": 65590, "train_runtime": 639009.5781, "train_tokens_per_second": 29194.917 }, { "epoch": 2.3210565073074942, "grad_norm": 1.6171875, "learning_rate": 1.81849444575271e-05, "loss": 1.029323196411133, "num_input_tokens_seen": 18658701440, "step": 65600, "train_runtime": 639107.7652, "train_tokens_per_second": 29194.922 }, { "epoch": 2.321410327571223, "grad_norm": 1.578125, "learning_rate": 1.818374185295756e-05, "loss": 1.042348575592041, "num_input_tokens_seen": 18661548544, "step": 65610, "train_runtime": 639203.1483, "train_tokens_per_second": 29195.02 }, { "epoch": 2.3217641478349518, "grad_norm": 1.625, "learning_rate": 1.8182539486947967e-05, "loss": 1.0297676086425782, "num_input_tokens_seen": 18664386688, "step": 65620, "train_runtime": 639297.9584, "train_tokens_per_second": 29195.13 }, { "epoch": 2.3221179680986803, "grad_norm": 1.578125, "learning_rate": 1.8181337359419467e-05, "loss": 1.0351337432861327, "num_input_tokens_seen": 18667199936, "step": 65630, "train_runtime": 639392.7489, "train_tokens_per_second": 29195.201 }, { "epoch": 2.3224717883624093, "grad_norm": 1.6015625, "learning_rate": 1.8180135470293233e-05, "loss": 1.0372797012329102, "num_input_tokens_seen": 18670070528, "step": 65640, "train_runtime": 639493.633, "train_tokens_per_second": 29195.084 }, { "epoch": 2.322825608626138, "grad_norm": 1.578125, "learning_rate": 1.817893381949048e-05, "loss": 1.021463394165039, "num_input_tokens_seen": 18672928768, "step": 65650, "train_runtime": 639590.9739, "train_tokens_per_second": 29195.11 }, { "epoch": 2.323179428889867, "grad_norm": 1.6171875, "learning_rate": 1.8177732406932444e-05, "loss": 1.0444185256958007, "num_input_tokens_seen": 18675744448, "step": 65660, "train_runtime": 639683.8936, "train_tokens_per_second": 29195.271 }, { "epoch": 2.323533249153596, "grad_norm": 1.5859375, "learning_rate": 1.8176531232540427e-05, "loss": 1.042653751373291, "num_input_tokens_seen": 18678559424, "step": 65670, "train_runtime": 639778.3116, "train_tokens_per_second": 29195.362 }, { "epoch": 2.3238870694173244, "grad_norm": 1.6015625, "learning_rate": 1.8175330296235734e-05, "loss": 1.0215051651000977, "num_input_tokens_seen": 18681412992, "step": 65680, "train_runtime": 639876.2104, "train_tokens_per_second": 29195.355 }, { "epoch": 2.324240889681053, "grad_norm": 1.5625, "learning_rate": 1.8174129597939733e-05, "loss": 1.0381223678588867, "num_input_tokens_seen": 18684223744, "step": 65690, "train_runtime": 639971.9146, "train_tokens_per_second": 29195.381 }, { "epoch": 2.324594709944782, "grad_norm": 1.6796875, "learning_rate": 1.8172929137573813e-05, "loss": 1.0431167602539062, "num_input_tokens_seen": 18687058176, "step": 65700, "train_runtime": 640070.6064, "train_tokens_per_second": 29195.308 }, { "epoch": 2.324948530208511, "grad_norm": 1.6015625, "learning_rate": 1.8171728915059404e-05, "loss": 1.0456758499145509, "num_input_tokens_seen": 18689947136, "step": 65710, "train_runtime": 640169.7904, "train_tokens_per_second": 29195.297 }, { "epoch": 2.3253023504722394, "grad_norm": 1.5859375, "learning_rate": 1.817052893031798e-05, "loss": 1.0348082542419434, "num_input_tokens_seen": 18692801856, "step": 65720, "train_runtime": 640265.5766, "train_tokens_per_second": 29195.388 }, { "epoch": 2.3256561707359684, "grad_norm": 1.5546875, "learning_rate": 1.816932918327103e-05, "loss": 1.0332138061523437, "num_input_tokens_seen": 18695612672, "step": 65730, "train_runtime": 640361.4709, "train_tokens_per_second": 29195.405 }, { "epoch": 2.326009990999697, "grad_norm": 1.609375, "learning_rate": 1.8168129673840103e-05, "loss": 1.0494257926940918, "num_input_tokens_seen": 18698471744, "step": 65740, "train_runtime": 640459.3339, "train_tokens_per_second": 29195.408 }, { "epoch": 2.326363811263426, "grad_norm": 1.5703125, "learning_rate": 1.8166930401946775e-05, "loss": 1.0381599426269532, "num_input_tokens_seen": 18701272576, "step": 65750, "train_runtime": 640552.5318, "train_tokens_per_second": 29195.533 }, { "epoch": 2.3267176315271545, "grad_norm": 1.640625, "learning_rate": 1.816573136751265e-05, "loss": 1.038637065887451, "num_input_tokens_seen": 18704139328, "step": 65760, "train_runtime": 640648.7868, "train_tokens_per_second": 29195.621 }, { "epoch": 2.3270714517908835, "grad_norm": 1.5859375, "learning_rate": 1.8164532570459383e-05, "loss": 1.0320422172546386, "num_input_tokens_seen": 18707006848, "step": 65770, "train_runtime": 640746.4757, "train_tokens_per_second": 29195.645 }, { "epoch": 2.327425272054612, "grad_norm": 1.6171875, "learning_rate": 1.8163334010708654e-05, "loss": 1.0366893768310548, "num_input_tokens_seen": 18709892928, "step": 65780, "train_runtime": 640844.1234, "train_tokens_per_second": 29195.7 }, { "epoch": 2.327779092318341, "grad_norm": 1.6484375, "learning_rate": 1.8162135688182183e-05, "loss": 1.0350963592529296, "num_input_tokens_seen": 18712777408, "step": 65790, "train_runtime": 640942.7868, "train_tokens_per_second": 29195.706 }, { "epoch": 2.3281329125820696, "grad_norm": 1.5546875, "learning_rate": 1.8160937602801726e-05, "loss": 1.020425796508789, "num_input_tokens_seen": 18715626432, "step": 65800, "train_runtime": 641041.0764, "train_tokens_per_second": 29195.674 }, { "epoch": 2.3284867328457985, "grad_norm": 1.59375, "learning_rate": 1.815973975448908e-05, "loss": 1.031758689880371, "num_input_tokens_seen": 18718445888, "step": 65810, "train_runtime": 641137.455, "train_tokens_per_second": 29195.683 }, { "epoch": 2.328840553109527, "grad_norm": 1.6328125, "learning_rate": 1.8158542143166065e-05, "loss": 1.020189094543457, "num_input_tokens_seen": 18721253184, "step": 65820, "train_runtime": 641232.9577, "train_tokens_per_second": 29195.713 }, { "epoch": 2.329194373373256, "grad_norm": 1.59375, "learning_rate": 1.8157344768754553e-05, "loss": 1.040908432006836, "num_input_tokens_seen": 18724112320, "step": 65830, "train_runtime": 641330.5112, "train_tokens_per_second": 29195.73 }, { "epoch": 2.3295481936369846, "grad_norm": 1.625, "learning_rate": 1.8156147631176442e-05, "loss": 1.0478226661682128, "num_input_tokens_seen": 18726930880, "step": 65840, "train_runtime": 641424.883, "train_tokens_per_second": 29195.829 }, { "epoch": 2.3299020139007136, "grad_norm": 1.6171875, "learning_rate": 1.815495073035367e-05, "loss": 1.046358299255371, "num_input_tokens_seen": 18729769408, "step": 65850, "train_runtime": 641521.5589, "train_tokens_per_second": 29195.853 }, { "epoch": 2.3302558341644426, "grad_norm": 1.5859375, "learning_rate": 1.8153754066208205e-05, "loss": 1.0229454040527344, "num_input_tokens_seen": 18732633152, "step": 65860, "train_runtime": 641618.6648, "train_tokens_per_second": 29195.898 }, { "epoch": 2.330609654428171, "grad_norm": 1.53125, "learning_rate": 1.815255763866206e-05, "loss": 1.0375890731811523, "num_input_tokens_seen": 18735486784, "step": 65870, "train_runtime": 641716.5318, "train_tokens_per_second": 29195.892 }, { "epoch": 2.3309634746919, "grad_norm": 1.5703125, "learning_rate": 1.815136144763728e-05, "loss": 1.028489112854004, "num_input_tokens_seen": 18738361472, "step": 65880, "train_runtime": 641816.0087, "train_tokens_per_second": 29195.846 }, { "epoch": 2.3313172949556287, "grad_norm": 1.6171875, "learning_rate": 1.815016549305594e-05, "loss": 1.0424678802490235, "num_input_tokens_seen": 18741237696, "step": 65890, "train_runtime": 641918.2448, "train_tokens_per_second": 29195.677 }, { "epoch": 2.3316711152193577, "grad_norm": 1.5703125, "learning_rate": 1.8148969774840164e-05, "loss": 1.024123764038086, "num_input_tokens_seen": 18744061760, "step": 65900, "train_runtime": 642011.4367, "train_tokens_per_second": 29195.838 }, { "epoch": 2.332024935483086, "grad_norm": 1.6171875, "learning_rate": 1.81477742929121e-05, "loss": 1.0257047653198241, "num_input_tokens_seen": 18746900800, "step": 65910, "train_runtime": 642106.8929, "train_tokens_per_second": 29195.919 }, { "epoch": 2.332378755746815, "grad_norm": 1.703125, "learning_rate": 1.8146579047193934e-05, "loss": 1.0409255027770996, "num_input_tokens_seen": 18749736960, "step": 65920, "train_runtime": 642201.8331, "train_tokens_per_second": 29196.019 }, { "epoch": 2.3327325760105437, "grad_norm": 1.5859375, "learning_rate": 1.8145384037607897e-05, "loss": 1.0407175064086913, "num_input_tokens_seen": 18752535488, "step": 65930, "train_runtime": 642296.1034, "train_tokens_per_second": 29196.091 }, { "epoch": 2.3330863962742727, "grad_norm": 1.625, "learning_rate": 1.814418926407624e-05, "loss": 1.0438365936279297, "num_input_tokens_seen": 18755344768, "step": 65940, "train_runtime": 642393.2608, "train_tokens_per_second": 29196.048 }, { "epoch": 2.3334402165380013, "grad_norm": 1.6640625, "learning_rate": 1.814299472652127e-05, "loss": 1.03980712890625, "num_input_tokens_seen": 18758153088, "step": 65950, "train_runtime": 642488.0, "train_tokens_per_second": 29196.114 }, { "epoch": 2.3337940368017303, "grad_norm": 1.59375, "learning_rate": 1.8141800424865312e-05, "loss": 1.035262680053711, "num_input_tokens_seen": 18761029760, "step": 65960, "train_runtime": 642590.1055, "train_tokens_per_second": 29195.952 }, { "epoch": 2.334147857065459, "grad_norm": 1.75, "learning_rate": 1.814060635903073e-05, "loss": 1.04500093460083, "num_input_tokens_seen": 18763859392, "step": 65970, "train_runtime": 642686.2129, "train_tokens_per_second": 29195.989 }, { "epoch": 2.334501677329188, "grad_norm": 1.5625, "learning_rate": 1.8139412528939936e-05, "loss": 1.049753761291504, "num_input_tokens_seen": 18766739456, "step": 65980, "train_runtime": 642783.3253, "train_tokens_per_second": 29196.058 }, { "epoch": 2.3348554975929163, "grad_norm": 1.59375, "learning_rate": 1.8138218934515365e-05, "loss": 1.0277958869934083, "num_input_tokens_seen": 18769582080, "step": 65990, "train_runtime": 642877.9403, "train_tokens_per_second": 29196.183 }, { "epoch": 2.3352093178566453, "grad_norm": 1.5625, "learning_rate": 1.8137025575679486e-05, "loss": 1.0216602325439452, "num_input_tokens_seen": 18772463872, "step": 66000, "train_runtime": 642979.1397, "train_tokens_per_second": 29196.07 }, { "epoch": 2.3355631381203743, "grad_norm": 1.578125, "learning_rate": 1.8135832452354816e-05, "loss": 1.0328174591064454, "num_input_tokens_seen": 18775306816, "step": 66010, "train_runtime": 643078.4375, "train_tokens_per_second": 29195.983 }, { "epoch": 2.335916958384103, "grad_norm": 1.53125, "learning_rate": 1.8134639564463902e-05, "loss": 1.040322494506836, "num_input_tokens_seen": 18778154816, "step": 66020, "train_runtime": 643173.499, "train_tokens_per_second": 29196.095 }, { "epoch": 2.3362707786478314, "grad_norm": 1.6015625, "learning_rate": 1.8133446911929316e-05, "loss": 1.023731803894043, "num_input_tokens_seen": 18781012096, "step": 66030, "train_runtime": 643272.2242, "train_tokens_per_second": 29196.056 }, { "epoch": 2.3366245989115604, "grad_norm": 1.59375, "learning_rate": 1.813225449467369e-05, "loss": 1.0389450073242188, "num_input_tokens_seen": 18783775872, "step": 66040, "train_runtime": 643365.4979, "train_tokens_per_second": 29196.119 }, { "epoch": 2.3369784191752894, "grad_norm": 1.65625, "learning_rate": 1.8131062312619663e-05, "loss": 1.0501955032348633, "num_input_tokens_seen": 18786629696, "step": 66050, "train_runtime": 643464.5788, "train_tokens_per_second": 29196.059 }, { "epoch": 2.337332239439018, "grad_norm": 1.6640625, "learning_rate": 1.8129870365689933e-05, "loss": 1.0326604843139648, "num_input_tokens_seen": 18789471104, "step": 66060, "train_runtime": 643562.8102, "train_tokens_per_second": 29196.018 }, { "epoch": 2.337686059702747, "grad_norm": 1.609375, "learning_rate": 1.812867865380722e-05, "loss": 1.020165252685547, "num_input_tokens_seen": 18792219776, "step": 66070, "train_runtime": 643652.4786, "train_tokens_per_second": 29196.221 }, { "epoch": 2.3380398799664754, "grad_norm": 1.59375, "learning_rate": 1.8127487176894286e-05, "loss": 1.0396703720092773, "num_input_tokens_seen": 18795002688, "step": 66080, "train_runtime": 643747.0621, "train_tokens_per_second": 29196.254 }, { "epoch": 2.3383937002302044, "grad_norm": 1.578125, "learning_rate": 1.8126295934873926e-05, "loss": 1.035307025909424, "num_input_tokens_seen": 18797805056, "step": 66090, "train_runtime": 643841.9735, "train_tokens_per_second": 29196.303 }, { "epoch": 2.338747520493933, "grad_norm": 1.65625, "learning_rate": 1.8125104927668964e-05, "loss": 1.032102108001709, "num_input_tokens_seen": 18800643456, "step": 66100, "train_runtime": 643940.389, "train_tokens_per_second": 29196.248 }, { "epoch": 2.339101340757662, "grad_norm": 1.484375, "learning_rate": 1.8123914155202273e-05, "loss": 1.0147523880004883, "num_input_tokens_seen": 18803516992, "step": 66110, "train_runtime": 644040.1525, "train_tokens_per_second": 29196.187 }, { "epoch": 2.3394551610213905, "grad_norm": 1.578125, "learning_rate": 1.8122723617396757e-05, "loss": 1.0244878768920898, "num_input_tokens_seen": 18806350144, "step": 66120, "train_runtime": 644137.6248, "train_tokens_per_second": 29196.168 }, { "epoch": 2.3398089812851195, "grad_norm": 1.671875, "learning_rate": 1.8121533314175345e-05, "loss": 1.029740810394287, "num_input_tokens_seen": 18809254528, "step": 66130, "train_runtime": 644236.2757, "train_tokens_per_second": 29196.205 }, { "epoch": 2.340162801548848, "grad_norm": 1.5703125, "learning_rate": 1.8120343245461015e-05, "loss": 1.043163776397705, "num_input_tokens_seen": 18812083584, "step": 66140, "train_runtime": 644331.3163, "train_tokens_per_second": 29196.289 }, { "epoch": 2.340516621812577, "grad_norm": 1.6015625, "learning_rate": 1.8119153411176775e-05, "loss": 1.0486584663391114, "num_input_tokens_seen": 18814965056, "step": 66150, "train_runtime": 644429.8956, "train_tokens_per_second": 29196.295 }, { "epoch": 2.3408704420763056, "grad_norm": 1.5859375, "learning_rate": 1.8117963811245663e-05, "loss": 1.0507564544677734, "num_input_tokens_seen": 18817774016, "step": 66160, "train_runtime": 644526.9889, "train_tokens_per_second": 29196.255 }, { "epoch": 2.3412242623400346, "grad_norm": 1.640625, "learning_rate": 1.8116774445590763e-05, "loss": 1.0382383346557618, "num_input_tokens_seen": 18820576064, "step": 66170, "train_runtime": 644621.1616, "train_tokens_per_second": 29196.336 }, { "epoch": 2.341578082603763, "grad_norm": 1.5078125, "learning_rate": 1.811558531413519e-05, "loss": 1.0310840606689453, "num_input_tokens_seen": 18823359872, "step": 66180, "train_runtime": 644716.0792, "train_tokens_per_second": 29196.356 }, { "epoch": 2.341931902867492, "grad_norm": 1.5625, "learning_rate": 1.8114396416802094e-05, "loss": 1.0374882698059082, "num_input_tokens_seen": 18826234368, "step": 66190, "train_runtime": 644815.258, "train_tokens_per_second": 29196.323 }, { "epoch": 2.342285723131221, "grad_norm": 1.59375, "learning_rate": 1.8113207753514652e-05, "loss": 1.0533061027526855, "num_input_tokens_seen": 18829086336, "step": 66200, "train_runtime": 644912.1594, "train_tokens_per_second": 29196.358 }, { "epoch": 2.3426395433949496, "grad_norm": 1.546875, "learning_rate": 1.8112019324196088e-05, "loss": 1.0432257652282715, "num_input_tokens_seen": 18831936704, "step": 66210, "train_runtime": 645008.9355, "train_tokens_per_second": 29196.397 }, { "epoch": 2.3429933636586786, "grad_norm": 1.5859375, "learning_rate": 1.811083112876966e-05, "loss": 1.0352489471435546, "num_input_tokens_seen": 18834722496, "step": 66220, "train_runtime": 645101.8027, "train_tokens_per_second": 29196.512 }, { "epoch": 2.343347183922407, "grad_norm": 1.5390625, "learning_rate": 1.8109643167158653e-05, "loss": 1.0364683151245118, "num_input_tokens_seen": 18837561088, "step": 66230, "train_runtime": 645198.9444, "train_tokens_per_second": 29196.516 }, { "epoch": 2.343701004186136, "grad_norm": 1.59375, "learning_rate": 1.8108455439286402e-05, "loss": 1.0390121459960937, "num_input_tokens_seen": 18840350976, "step": 66240, "train_runtime": 645291.9406, "train_tokens_per_second": 29196.631 }, { "epoch": 2.3440548244498647, "grad_norm": 1.6015625, "learning_rate": 1.8107267945076254e-05, "loss": 1.0240438461303711, "num_input_tokens_seen": 18843199936, "step": 66250, "train_runtime": 645389.6554, "train_tokens_per_second": 29196.625 }, { "epoch": 2.3444086447135937, "grad_norm": 1.5703125, "learning_rate": 1.810608068445162e-05, "loss": 1.040040874481201, "num_input_tokens_seen": 18846032704, "step": 66260, "train_runtime": 645483.8665, "train_tokens_per_second": 29196.753 }, { "epoch": 2.344762464977322, "grad_norm": 1.5546875, "learning_rate": 1.8104893657335918e-05, "loss": 1.037527084350586, "num_input_tokens_seen": 18848898560, "step": 66270, "train_runtime": 645581.4065, "train_tokens_per_second": 29196.78 }, { "epoch": 2.345116285241051, "grad_norm": 1.5625, "learning_rate": 1.810370686365262e-05, "loss": 1.0184425354003905, "num_input_tokens_seen": 18851771072, "step": 66280, "train_runtime": 645681.6215, "train_tokens_per_second": 29196.698 }, { "epoch": 2.3454701055047797, "grad_norm": 1.546875, "learning_rate": 1.810252030332523e-05, "loss": 1.0474827766418457, "num_input_tokens_seen": 18854587648, "step": 66290, "train_runtime": 645778.3523, "train_tokens_per_second": 29196.686 }, { "epoch": 2.3458239257685087, "grad_norm": 1.609375, "learning_rate": 1.8101333976277282e-05, "loss": 1.029682731628418, "num_input_tokens_seen": 18857386176, "step": 66300, "train_runtime": 645874.1707, "train_tokens_per_second": 29196.687 }, { "epoch": 2.3461777460322373, "grad_norm": 1.6015625, "learning_rate": 1.8100147882432346e-05, "loss": 1.029153537750244, "num_input_tokens_seen": 18860248448, "step": 66310, "train_runtime": 645973.1312, "train_tokens_per_second": 29196.645 }, { "epoch": 2.3465315662959663, "grad_norm": 1.6015625, "learning_rate": 1.8098962021714032e-05, "loss": 1.0405263900756836, "num_input_tokens_seen": 18863064320, "step": 66320, "train_runtime": 646069.5021, "train_tokens_per_second": 29196.649 }, { "epoch": 2.346885386559695, "grad_norm": 1.578125, "learning_rate": 1.8097776394045977e-05, "loss": 1.0277963638305665, "num_input_tokens_seen": 18865859712, "step": 66330, "train_runtime": 646162.6569, "train_tokens_per_second": 29196.766 }, { "epoch": 2.347239206823424, "grad_norm": 1.59375, "learning_rate": 1.8096590999351865e-05, "loss": 1.0426666259765625, "num_input_tokens_seen": 18868693952, "step": 66340, "train_runtime": 646257.9765, "train_tokens_per_second": 29196.845 }, { "epoch": 2.347593027087153, "grad_norm": 1.6640625, "learning_rate": 1.8095405837555397e-05, "loss": 1.0357634544372558, "num_input_tokens_seen": 18871519552, "step": 66350, "train_runtime": 646356.8167, "train_tokens_per_second": 29196.752 }, { "epoch": 2.3479468473508813, "grad_norm": 1.578125, "learning_rate": 1.809422090858033e-05, "loss": 1.043788528442383, "num_input_tokens_seen": 18874326400, "step": 66360, "train_runtime": 646455.939, "train_tokens_per_second": 29196.617 }, { "epoch": 2.3483006676146103, "grad_norm": 1.625, "learning_rate": 1.809303621235044e-05, "loss": 1.0341991424560546, "num_input_tokens_seen": 18877182784, "step": 66370, "train_runtime": 646555.3948, "train_tokens_per_second": 29196.544 }, { "epoch": 2.348654487878339, "grad_norm": 1.5703125, "learning_rate": 1.8091851748789548e-05, "loss": 1.0270216941833497, "num_input_tokens_seen": 18880003776, "step": 66380, "train_runtime": 646652.3715, "train_tokens_per_second": 29196.528 }, { "epoch": 2.349008308142068, "grad_norm": 1.6015625, "learning_rate": 1.80906675178215e-05, "loss": 1.0425743103027343, "num_input_tokens_seen": 18882870144, "step": 66390, "train_runtime": 646749.584, "train_tokens_per_second": 29196.571 }, { "epoch": 2.3493621284057964, "grad_norm": 1.59375, "learning_rate": 1.808948351937018e-05, "loss": 1.0361618041992187, "num_input_tokens_seen": 18885742848, "step": 66400, "train_runtime": 646849.9212, "train_tokens_per_second": 29196.483 }, { "epoch": 2.3497159486695254, "grad_norm": 1.5625, "learning_rate": 1.808829975335952e-05, "loss": 1.030990219116211, "num_input_tokens_seen": 18888581888, "step": 66410, "train_runtime": 646946.2284, "train_tokens_per_second": 29196.525 }, { "epoch": 2.350069768933254, "grad_norm": 1.6796875, "learning_rate": 1.8087116219713467e-05, "loss": 1.0359463691711426, "num_input_tokens_seen": 18891465728, "step": 66420, "train_runtime": 647048.0298, "train_tokens_per_second": 29196.389 }, { "epoch": 2.350423589196983, "grad_norm": 1.6328125, "learning_rate": 1.8085932918356015e-05, "loss": 1.051318359375, "num_input_tokens_seen": 18894308736, "step": 66430, "train_runtime": 647144.238, "train_tokens_per_second": 29196.441 }, { "epoch": 2.3507774094607115, "grad_norm": 1.5859375, "learning_rate": 1.8084749849211188e-05, "loss": 1.0455533981323242, "num_input_tokens_seen": 18897165888, "step": 66440, "train_runtime": 647239.3283, "train_tokens_per_second": 29196.566 }, { "epoch": 2.3511312297244404, "grad_norm": 1.6171875, "learning_rate": 1.8083567012203052e-05, "loss": 1.0394617080688477, "num_input_tokens_seen": 18900017216, "step": 66450, "train_runtime": 647338.7275, "train_tokens_per_second": 29196.488 }, { "epoch": 2.351485049988169, "grad_norm": 1.59375, "learning_rate": 1.808238440725569e-05, "loss": 1.0177885055541993, "num_input_tokens_seen": 18902877056, "step": 66460, "train_runtime": 647435.7274, "train_tokens_per_second": 29196.531 }, { "epoch": 2.351838870251898, "grad_norm": 1.6640625, "learning_rate": 1.8081202034293245e-05, "loss": 1.0389205932617187, "num_input_tokens_seen": 18905723136, "step": 66470, "train_runtime": 647533.761, "train_tokens_per_second": 29196.506 }, { "epoch": 2.3521926905156265, "grad_norm": 1.6484375, "learning_rate": 1.808001989323987e-05, "loss": 1.0428040504455567, "num_input_tokens_seen": 18908575936, "step": 66480, "train_runtime": 647630.0863, "train_tokens_per_second": 29196.568 }, { "epoch": 2.3525465107793555, "grad_norm": 1.6484375, "learning_rate": 1.807883798401978e-05, "loss": 1.039106559753418, "num_input_tokens_seen": 18911356288, "step": 66490, "train_runtime": 647723.3112, "train_tokens_per_second": 29196.658 }, { "epoch": 2.3529003310430845, "grad_norm": 1.5859375, "learning_rate": 1.8077656306557196e-05, "loss": 1.0409401893615722, "num_input_tokens_seen": 18914208448, "step": 66500, "train_runtime": 647822.2523, "train_tokens_per_second": 29196.602 }, { "epoch": 2.353254151306813, "grad_norm": 1.5546875, "learning_rate": 1.8076474860776387e-05, "loss": 1.029317569732666, "num_input_tokens_seen": 18917053952, "step": 66510, "train_runtime": 647918.529, "train_tokens_per_second": 29196.655 }, { "epoch": 2.3536079715705416, "grad_norm": 1.640625, "learning_rate": 1.807529364660166e-05, "loss": 1.0431474685668944, "num_input_tokens_seen": 18919881536, "step": 66520, "train_runtime": 648016.9299, "train_tokens_per_second": 29196.585 }, { "epoch": 2.3539617918342706, "grad_norm": 1.6328125, "learning_rate": 1.8074112663957353e-05, "loss": 1.0420499801635743, "num_input_tokens_seen": 18922675456, "step": 66530, "train_runtime": 648111.354, "train_tokens_per_second": 29196.642 }, { "epoch": 2.3543156120979996, "grad_norm": 1.5546875, "learning_rate": 1.8072931912767843e-05, "loss": 1.0233688354492188, "num_input_tokens_seen": 18925517760, "step": 66540, "train_runtime": 648207.9246, "train_tokens_per_second": 29196.678 }, { "epoch": 2.354669432361728, "grad_norm": 1.5859375, "learning_rate": 1.807175139295753e-05, "loss": 1.0185602188110352, "num_input_tokens_seen": 18928376128, "step": 66550, "train_runtime": 648308.2607, "train_tokens_per_second": 29196.568 }, { "epoch": 2.355023252625457, "grad_norm": 1.5625, "learning_rate": 1.8070571104450855e-05, "loss": 1.0308652877807618, "num_input_tokens_seen": 18931240256, "step": 66560, "train_runtime": 648408.7066, "train_tokens_per_second": 29196.462 }, { "epoch": 2.3553770728891856, "grad_norm": 1.65625, "learning_rate": 1.8069391047172297e-05, "loss": 1.0437036514282227, "num_input_tokens_seen": 18934033152, "step": 66570, "train_runtime": 648503.4193, "train_tokens_per_second": 29196.505 }, { "epoch": 2.3557308931529146, "grad_norm": 1.640625, "learning_rate": 1.8068211221046367e-05, "loss": 1.0314538955688477, "num_input_tokens_seen": 18936829376, "step": 66580, "train_runtime": 648597.0876, "train_tokens_per_second": 29196.599 }, { "epoch": 2.356084713416643, "grad_norm": 1.578125, "learning_rate": 1.8067031625997616e-05, "loss": 1.0379018783569336, "num_input_tokens_seen": 18939639552, "step": 66590, "train_runtime": 648690.9219, "train_tokens_per_second": 29196.708 }, { "epoch": 2.356438533680372, "grad_norm": 1.5859375, "learning_rate": 1.8065852261950612e-05, "loss": 1.0267288208007812, "num_input_tokens_seen": 18942461440, "step": 66600, "train_runtime": 648785.5521, "train_tokens_per_second": 29196.799 }, { "epoch": 2.3567923539441007, "grad_norm": 1.59375, "learning_rate": 1.8064673128829977e-05, "loss": 1.0454681396484375, "num_input_tokens_seen": 18945258304, "step": 66610, "train_runtime": 648879.3854, "train_tokens_per_second": 29196.887 }, { "epoch": 2.3571461742078297, "grad_norm": 1.5625, "learning_rate": 1.8063494226560355e-05, "loss": 1.0351696014404297, "num_input_tokens_seen": 18948082688, "step": 66620, "train_runtime": 648974.5438, "train_tokens_per_second": 29196.958 }, { "epoch": 2.3574999944715582, "grad_norm": 1.5078125, "learning_rate": 1.8062315555066432e-05, "loss": 1.039164161682129, "num_input_tokens_seen": 18950908864, "step": 66630, "train_runtime": 649069.6508, "train_tokens_per_second": 29197.034 }, { "epoch": 2.357853814735287, "grad_norm": 1.5625, "learning_rate": 1.8061137114272934e-05, "loss": 1.039458656311035, "num_input_tokens_seen": 18953769920, "step": 66640, "train_runtime": 649168.4708, "train_tokens_per_second": 29196.997 }, { "epoch": 2.3582076349990158, "grad_norm": 1.59375, "learning_rate": 1.8059958904104592e-05, "loss": 1.0271575927734375, "num_input_tokens_seen": 18956558976, "step": 66650, "train_runtime": 649260.235, "train_tokens_per_second": 29197.166 }, { "epoch": 2.3585614552627447, "grad_norm": 1.5625, "learning_rate": 1.8058780924486212e-05, "loss": 1.0409416198730468, "num_input_tokens_seen": 18959454272, "step": 66660, "train_runtime": 649361.4199, "train_tokens_per_second": 29197.075 }, { "epoch": 2.3589152755264733, "grad_norm": 1.5625, "learning_rate": 1.8057603175342603e-05, "loss": 1.02748384475708, "num_input_tokens_seen": 18962273984, "step": 66670, "train_runtime": 649456.9257, "train_tokens_per_second": 29197.123 }, { "epoch": 2.3592690957902023, "grad_norm": 1.5, "learning_rate": 1.8056425656598623e-05, "loss": 1.0309016227722168, "num_input_tokens_seen": 18965111808, "step": 66680, "train_runtime": 649551.811, "train_tokens_per_second": 29197.227 }, { "epoch": 2.3596229160539313, "grad_norm": 1.6875, "learning_rate": 1.805524836817916e-05, "loss": 1.045396900177002, "num_input_tokens_seen": 18967973248, "step": 66690, "train_runtime": 649651.3816, "train_tokens_per_second": 29197.157 }, { "epoch": 2.35997673631766, "grad_norm": 1.59375, "learning_rate": 1.8054071310009144e-05, "loss": 1.0322769165039063, "num_input_tokens_seen": 18970783296, "step": 66700, "train_runtime": 649748.2691, "train_tokens_per_second": 29197.128 }, { "epoch": 2.360330556581389, "grad_norm": 1.5546875, "learning_rate": 1.8052894482013526e-05, "loss": 1.027587890625, "num_input_tokens_seen": 18973634560, "step": 66710, "train_runtime": 649847.2571, "train_tokens_per_second": 29197.068 }, { "epoch": 2.3606843768451173, "grad_norm": 1.65625, "learning_rate": 1.80517178841173e-05, "loss": 1.0380279541015625, "num_input_tokens_seen": 18976445888, "step": 66720, "train_runtime": 649942.126, "train_tokens_per_second": 29197.132 }, { "epoch": 2.3610381971088463, "grad_norm": 1.6015625, "learning_rate": 1.805054151624549e-05, "loss": 1.0326272010803224, "num_input_tokens_seen": 18979350976, "step": 66730, "train_runtime": 650042.8997, "train_tokens_per_second": 29197.075 }, { "epoch": 2.361392017372575, "grad_norm": 1.59375, "learning_rate": 1.8049365378323154e-05, "loss": 1.034350299835205, "num_input_tokens_seen": 18982182400, "step": 66740, "train_runtime": 650139.5881, "train_tokens_per_second": 29197.087 }, { "epoch": 2.361745837636304, "grad_norm": 1.5390625, "learning_rate": 1.8048189470275397e-05, "loss": 1.0354164123535157, "num_input_tokens_seen": 18985068800, "step": 66750, "train_runtime": 650236.9692, "train_tokens_per_second": 29197.154 }, { "epoch": 2.3620996579000324, "grad_norm": 1.5859375, "learning_rate": 1.804701379202734e-05, "loss": 1.0331238746643066, "num_input_tokens_seen": 18987914560, "step": 66760, "train_runtime": 650334.6872, "train_tokens_per_second": 29197.143 }, { "epoch": 2.3624534781637614, "grad_norm": 1.5859375, "learning_rate": 1.8045838343504142e-05, "loss": 1.0215399742126465, "num_input_tokens_seen": 18990767360, "step": 66770, "train_runtime": 650432.3966, "train_tokens_per_second": 29197.142 }, { "epoch": 2.36280729842749, "grad_norm": 1.5390625, "learning_rate": 1.8044663124631007e-05, "loss": 1.0403265953063965, "num_input_tokens_seen": 18993610112, "step": 66780, "train_runtime": 650532.5794, "train_tokens_per_second": 29197.016 }, { "epoch": 2.363161118691219, "grad_norm": 1.6015625, "learning_rate": 1.8043488135333166e-05, "loss": 1.0225337982177733, "num_input_tokens_seen": 18996413312, "step": 66790, "train_runtime": 650627.8264, "train_tokens_per_second": 29197.05 }, { "epoch": 2.3635149389549475, "grad_norm": 1.59375, "learning_rate": 1.804231337553588e-05, "loss": 1.0296518325805664, "num_input_tokens_seen": 18999240960, "step": 66800, "train_runtime": 650723.9082, "train_tokens_per_second": 29197.085 }, { "epoch": 2.3638687592186765, "grad_norm": 1.5703125, "learning_rate": 1.804113884516445e-05, "loss": 1.0442829132080078, "num_input_tokens_seen": 19002115392, "step": 66810, "train_runtime": 650820.8181, "train_tokens_per_second": 29197.154 }, { "epoch": 2.364222579482405, "grad_norm": 1.5546875, "learning_rate": 1.803996454414421e-05, "loss": 1.0412076950073241, "num_input_tokens_seen": 19004939456, "step": 66820, "train_runtime": 650916.0735, "train_tokens_per_second": 29197.219 }, { "epoch": 2.364576399746134, "grad_norm": 1.578125, "learning_rate": 1.803879047240052e-05, "loss": 1.0318403244018555, "num_input_tokens_seen": 19007806976, "step": 66830, "train_runtime": 651015.3563, "train_tokens_per_second": 29197.171 }, { "epoch": 2.364930220009863, "grad_norm": 1.6171875, "learning_rate": 1.8037616629858794e-05, "loss": 1.0364686012268067, "num_input_tokens_seen": 19010648704, "step": 66840, "train_runtime": 651113.5774, "train_tokens_per_second": 29197.131 }, { "epoch": 2.3652840402735915, "grad_norm": 1.5859375, "learning_rate": 1.803644301644446e-05, "loss": 1.0440656661987304, "num_input_tokens_seen": 19013491520, "step": 66850, "train_runtime": 651206.6687, "train_tokens_per_second": 29197.323 }, { "epoch": 2.36563786053732, "grad_norm": 1.5546875, "learning_rate": 1.8035269632082984e-05, "loss": 1.0359214782714843, "num_input_tokens_seen": 19016368320, "step": 66860, "train_runtime": 651306.7548, "train_tokens_per_second": 29197.253 }, { "epoch": 2.365991680801049, "grad_norm": 1.671875, "learning_rate": 1.8034096476699873e-05, "loss": 1.0434577941894532, "num_input_tokens_seen": 19019231680, "step": 66870, "train_runtime": 651406.2693, "train_tokens_per_second": 29197.189 }, { "epoch": 2.366345501064778, "grad_norm": 1.5390625, "learning_rate": 1.8032923550220667e-05, "loss": 1.01727294921875, "num_input_tokens_seen": 19022032128, "step": 66880, "train_runtime": 651502.5852, "train_tokens_per_second": 29197.171 }, { "epoch": 2.3666993213285066, "grad_norm": 1.6015625, "learning_rate": 1.803175085257093e-05, "loss": 1.0339614868164062, "num_input_tokens_seen": 19024924416, "step": 66890, "train_runtime": 651603.1515, "train_tokens_per_second": 29197.103 }, { "epoch": 2.3670531415922356, "grad_norm": 1.5546875, "learning_rate": 1.8030578383676272e-05, "loss": 1.0255003929138184, "num_input_tokens_seen": 19027770240, "step": 66900, "train_runtime": 651702.3915, "train_tokens_per_second": 29197.024 }, { "epoch": 2.367406961855964, "grad_norm": 1.6328125, "learning_rate": 1.8029406143462326e-05, "loss": 1.0408638000488282, "num_input_tokens_seen": 19030609344, "step": 66910, "train_runtime": 651799.1937, "train_tokens_per_second": 29197.043 }, { "epoch": 2.367760782119693, "grad_norm": 1.5703125, "learning_rate": 1.8028234131854774e-05, "loss": 1.0262052536010742, "num_input_tokens_seen": 19033486464, "step": 66920, "train_runtime": 651896.7173, "train_tokens_per_second": 29197.089 }, { "epoch": 2.3681146023834216, "grad_norm": 1.6328125, "learning_rate": 1.8027062348779313e-05, "loss": 1.0260032653808593, "num_input_tokens_seen": 19036277568, "step": 66930, "train_runtime": 651992.7925, "train_tokens_per_second": 29197.067 }, { "epoch": 2.3684684226471506, "grad_norm": 1.609375, "learning_rate": 1.802589079416168e-05, "loss": 1.034390640258789, "num_input_tokens_seen": 19039119552, "step": 66940, "train_runtime": 652086.3326, "train_tokens_per_second": 29197.238 }, { "epoch": 2.368822242910879, "grad_norm": 1.53125, "learning_rate": 1.8024719467927664e-05, "loss": 1.046706199645996, "num_input_tokens_seen": 19042012416, "step": 66950, "train_runtime": 652189.349, "train_tokens_per_second": 29197.061 }, { "epoch": 2.369176063174608, "grad_norm": 1.6328125, "learning_rate": 1.8023548370003062e-05, "loss": 1.0305341720581054, "num_input_tokens_seen": 19044805184, "step": 66960, "train_runtime": 652283.1316, "train_tokens_per_second": 29197.145 }, { "epoch": 2.3695298834383367, "grad_norm": 1.6015625, "learning_rate": 1.8022377500313714e-05, "loss": 1.0341482162475586, "num_input_tokens_seen": 19047623872, "step": 66970, "train_runtime": 652377.8243, "train_tokens_per_second": 29197.228 }, { "epoch": 2.3698837037020657, "grad_norm": 1.609375, "learning_rate": 1.80212068587855e-05, "loss": 1.0355841636657714, "num_input_tokens_seen": 19050525824, "step": 66980, "train_runtime": 652478.1365, "train_tokens_per_second": 29197.186 }, { "epoch": 2.3702375239657942, "grad_norm": 1.53125, "learning_rate": 1.8020036445344325e-05, "loss": 1.0338769912719727, "num_input_tokens_seen": 19053351168, "step": 66990, "train_runtime": 652575.2165, "train_tokens_per_second": 29197.173 }, { "epoch": 2.3705913442295232, "grad_norm": 1.609375, "learning_rate": 1.8018866259916134e-05, "loss": 1.0486441612243653, "num_input_tokens_seen": 19056236480, "step": 67000, "train_runtime": 652673.154, "train_tokens_per_second": 29197.212 }, { "epoch": 2.3709451644932518, "grad_norm": 1.53125, "learning_rate": 1.8017696302426904e-05, "loss": 1.0326087951660157, "num_input_tokens_seen": 19059105792, "step": 67010, "train_runtime": 652770.8836, "train_tokens_per_second": 29197.236 }, { "epoch": 2.3712989847569808, "grad_norm": 1.6484375, "learning_rate": 1.801652657280264e-05, "loss": 1.0221431732177735, "num_input_tokens_seen": 19061936128, "step": 67020, "train_runtime": 652866.6296, "train_tokens_per_second": 29197.29 }, { "epoch": 2.3716528050207097, "grad_norm": 1.65625, "learning_rate": 1.8015357070969387e-05, "loss": 1.0389217376708983, "num_input_tokens_seen": 19064763584, "step": 67030, "train_runtime": 652962.8654, "train_tokens_per_second": 29197.317 }, { "epoch": 2.3720066252844383, "grad_norm": 1.59375, "learning_rate": 1.801418779685323e-05, "loss": 1.0314453125, "num_input_tokens_seen": 19067641472, "step": 67040, "train_runtime": 653060.3314, "train_tokens_per_second": 29197.366 }, { "epoch": 2.3723604455481673, "grad_norm": 1.65625, "learning_rate": 1.8013018750380265e-05, "loss": 1.0375774383544922, "num_input_tokens_seen": 19070533248, "step": 67050, "train_runtime": 653161.6294, "train_tokens_per_second": 29197.265 }, { "epoch": 2.372714265811896, "grad_norm": 1.625, "learning_rate": 1.8011849931476647e-05, "loss": 1.0497207641601562, "num_input_tokens_seen": 19073411136, "step": 67060, "train_runtime": 653262.0769, "train_tokens_per_second": 29197.181 }, { "epoch": 2.373068086075625, "grad_norm": 1.6015625, "learning_rate": 1.8010681340068548e-05, "loss": 1.0245656013488769, "num_input_tokens_seen": 19076215360, "step": 67070, "train_runtime": 653360.5327, "train_tokens_per_second": 29197.073 }, { "epoch": 2.3734219063393533, "grad_norm": 1.5546875, "learning_rate": 1.800951297608218e-05, "loss": 1.0293115615844726, "num_input_tokens_seen": 19079047936, "step": 67080, "train_runtime": 653455.2711, "train_tokens_per_second": 29197.175 }, { "epoch": 2.3737757266030823, "grad_norm": 1.609375, "learning_rate": 1.8008344839443795e-05, "loss": 1.0224365234375, "num_input_tokens_seen": 19081876416, "step": 67090, "train_runtime": 653553.1131, "train_tokens_per_second": 29197.132 }, { "epoch": 2.374129546866811, "grad_norm": 1.578125, "learning_rate": 1.8007176930079663e-05, "loss": 1.0180472373962401, "num_input_tokens_seen": 19084723968, "step": 67100, "train_runtime": 653648.1577, "train_tokens_per_second": 29197.243 }, { "epoch": 2.37448336713054, "grad_norm": 1.5625, "learning_rate": 1.8006009247916096e-05, "loss": 1.0434990882873536, "num_input_tokens_seen": 19087596672, "step": 67110, "train_runtime": 653745.6756, "train_tokens_per_second": 29197.282 }, { "epoch": 2.3748371873942684, "grad_norm": 1.546875, "learning_rate": 1.800484179287944e-05, "loss": 1.0326407432556153, "num_input_tokens_seen": 19090493248, "step": 67120, "train_runtime": 653846.0876, "train_tokens_per_second": 29197.228 }, { "epoch": 2.3751910076579974, "grad_norm": 1.6015625, "learning_rate": 1.8003674564896075e-05, "loss": 1.0351058006286622, "num_input_tokens_seen": 19093306240, "step": 67130, "train_runtime": 653941.1002, "train_tokens_per_second": 29197.287 }, { "epoch": 2.375544827921726, "grad_norm": 1.625, "learning_rate": 1.8002507563892413e-05, "loss": 1.0301342010498047, "num_input_tokens_seen": 19096105600, "step": 67140, "train_runtime": 654035.0945, "train_tokens_per_second": 29197.371 }, { "epoch": 2.375898648185455, "grad_norm": 1.578125, "learning_rate": 1.8001340789794895e-05, "loss": 1.056152629852295, "num_input_tokens_seen": 19098944000, "step": 67150, "train_runtime": 654132.1336, "train_tokens_per_second": 29197.379 }, { "epoch": 2.3762524684491835, "grad_norm": 1.6171875, "learning_rate": 1.800017424253001e-05, "loss": 1.028088092803955, "num_input_tokens_seen": 19101779264, "step": 67160, "train_runtime": 654233.0662, "train_tokens_per_second": 29197.209 }, { "epoch": 2.3766062887129125, "grad_norm": 1.671875, "learning_rate": 1.7999007922024254e-05, "loss": 1.0408269882202148, "num_input_tokens_seen": 19104616576, "step": 67170, "train_runtime": 654328.5876, "train_tokens_per_second": 29197.282 }, { "epoch": 2.3769601089766415, "grad_norm": 1.578125, "learning_rate": 1.7997841828204185e-05, "loss": 1.0332897186279297, "num_input_tokens_seen": 19107457088, "step": 67180, "train_runtime": 654424.1293, "train_tokens_per_second": 29197.36 }, { "epoch": 2.37731392924037, "grad_norm": 1.640625, "learning_rate": 1.799667596099638e-05, "loss": 1.0439233779907227, "num_input_tokens_seen": 19110291264, "step": 67190, "train_runtime": 654519.0102, "train_tokens_per_second": 29197.458 }, { "epoch": 2.3776677495040985, "grad_norm": 1.625, "learning_rate": 1.7995510320327445e-05, "loss": 1.02845458984375, "num_input_tokens_seen": 19113143040, "step": 67200, "train_runtime": 654615.0857, "train_tokens_per_second": 29197.529 }, { "epoch": 2.3780215697678275, "grad_norm": 1.5234375, "learning_rate": 1.7994344906124028e-05, "loss": 1.0471319198608398, "num_input_tokens_seen": 19115954752, "step": 67210, "train_runtime": 654713.8126, "train_tokens_per_second": 29197.421 }, { "epoch": 2.3783753900315565, "grad_norm": 1.6796875, "learning_rate": 1.799317971831281e-05, "loss": 1.04210205078125, "num_input_tokens_seen": 19118786944, "step": 67220, "train_runtime": 654811.2055, "train_tokens_per_second": 29197.403 }, { "epoch": 2.378729210295285, "grad_norm": 1.6171875, "learning_rate": 1.79920147568205e-05, "loss": 1.0325956344604492, "num_input_tokens_seen": 19121651968, "step": 67230, "train_runtime": 654909.9473, "train_tokens_per_second": 29197.376 }, { "epoch": 2.379083030559014, "grad_norm": 1.5703125, "learning_rate": 1.7990850021573845e-05, "loss": 1.0383377075195312, "num_input_tokens_seen": 19124483200, "step": 67240, "train_runtime": 655006.4261, "train_tokens_per_second": 29197.398 }, { "epoch": 2.3794368508227426, "grad_norm": 1.5625, "learning_rate": 1.798968551249962e-05, "loss": 1.0416743278503418, "num_input_tokens_seen": 19127322624, "step": 67250, "train_runtime": 655103.1187, "train_tokens_per_second": 29197.423 }, { "epoch": 2.3797906710864716, "grad_norm": 1.59375, "learning_rate": 1.7988521229524637e-05, "loss": 1.0380262374877929, "num_input_tokens_seen": 19130141760, "step": 67260, "train_runtime": 655196.8306, "train_tokens_per_second": 29197.549 }, { "epoch": 2.3801444913502, "grad_norm": 1.609375, "learning_rate": 1.7987357172575745e-05, "loss": 1.032976245880127, "num_input_tokens_seen": 19132988224, "step": 67270, "train_runtime": 655294.388, "train_tokens_per_second": 29197.546 }, { "epoch": 2.380498311613929, "grad_norm": 1.65625, "learning_rate": 1.7986193341579814e-05, "loss": 1.0309293746948243, "num_input_tokens_seen": 19135846528, "step": 67280, "train_runtime": 655392.6776, "train_tokens_per_second": 29197.529 }, { "epoch": 2.3808521318776577, "grad_norm": 1.65625, "learning_rate": 1.7985029736463757e-05, "loss": 1.0364151000976562, "num_input_tokens_seen": 19138757312, "step": 67290, "train_runtime": 655497.2608, "train_tokens_per_second": 29197.311 }, { "epoch": 2.3812059521413866, "grad_norm": 1.625, "learning_rate": 1.798386635715452e-05, "loss": 1.0323609352111816, "num_input_tokens_seen": 19141531136, "step": 67300, "train_runtime": 655589.4322, "train_tokens_per_second": 29197.437 }, { "epoch": 2.381559772405115, "grad_norm": 1.6171875, "learning_rate": 1.798270320357908e-05, "loss": 1.0205324172973633, "num_input_tokens_seen": 19144349440, "step": 67310, "train_runtime": 655687.8085, "train_tokens_per_second": 29197.355 }, { "epoch": 2.381913592668844, "grad_norm": 1.546875, "learning_rate": 1.7981540275664447e-05, "loss": 1.030990982055664, "num_input_tokens_seen": 19147203008, "step": 67320, "train_runtime": 655784.5304, "train_tokens_per_second": 29197.4 }, { "epoch": 2.382267412932573, "grad_norm": 1.6328125, "learning_rate": 1.7980377573337658e-05, "loss": 1.0355592727661134, "num_input_tokens_seen": 19150074432, "step": 67330, "train_runtime": 655882.3867, "train_tokens_per_second": 29197.421 }, { "epoch": 2.3826212331963017, "grad_norm": 1.6484375, "learning_rate": 1.7979215096525794e-05, "loss": 1.042961597442627, "num_input_tokens_seen": 19152964736, "step": 67340, "train_runtime": 655981.2613, "train_tokens_per_second": 29197.427 }, { "epoch": 2.3829750534600302, "grad_norm": 1.5625, "learning_rate": 1.7978052845155965e-05, "loss": 1.0270118713378906, "num_input_tokens_seen": 19155801792, "step": 67350, "train_runtime": 656080.0164, "train_tokens_per_second": 29197.356 }, { "epoch": 2.3833288737237592, "grad_norm": 1.6640625, "learning_rate": 1.797689081915531e-05, "loss": 1.0278014183044433, "num_input_tokens_seen": 19158648192, "step": 67360, "train_runtime": 656177.656, "train_tokens_per_second": 29197.349 }, { "epoch": 2.383682693987488, "grad_norm": 1.59375, "learning_rate": 1.7975729018451004e-05, "loss": 1.0376891136169433, "num_input_tokens_seen": 19161527488, "step": 67370, "train_runtime": 656279.8353, "train_tokens_per_second": 29197.191 }, { "epoch": 2.3840365142512168, "grad_norm": 1.65625, "learning_rate": 1.7974567442970254e-05, "loss": 1.0438356399536133, "num_input_tokens_seen": 19164337920, "step": 67380, "train_runtime": 656374.2644, "train_tokens_per_second": 29197.272 }, { "epoch": 2.3843903345149458, "grad_norm": 1.6328125, "learning_rate": 1.7973406092640308e-05, "loss": 1.0472169876098634, "num_input_tokens_seen": 19167200960, "step": 67390, "train_runtime": 656473.8766, "train_tokens_per_second": 29197.203 }, { "epoch": 2.3847441547786743, "grad_norm": 1.5625, "learning_rate": 1.797224496738843e-05, "loss": 1.030417251586914, "num_input_tokens_seen": 19170035712, "step": 67400, "train_runtime": 656572.4514, "train_tokens_per_second": 29197.137 }, { "epoch": 2.3850979750424033, "grad_norm": 1.609375, "learning_rate": 1.797108406714193e-05, "loss": 1.030099582672119, "num_input_tokens_seen": 19172876992, "step": 67410, "train_runtime": 656669.4133, "train_tokens_per_second": 29197.152 }, { "epoch": 2.385451795306132, "grad_norm": 1.6328125, "learning_rate": 1.7969923391828146e-05, "loss": 1.0458013534545898, "num_input_tokens_seen": 19175719744, "step": 67420, "train_runtime": 656765.5594, "train_tokens_per_second": 29197.207 }, { "epoch": 2.385805615569861, "grad_norm": 1.6640625, "learning_rate": 1.7968762941374456e-05, "loss": 1.0360552787780761, "num_input_tokens_seen": 19178526016, "step": 67430, "train_runtime": 656863.1307, "train_tokens_per_second": 29197.142 }, { "epoch": 2.3861594358335894, "grad_norm": 1.5546875, "learning_rate": 1.7967602715708257e-05, "loss": 1.0375307083129883, "num_input_tokens_seen": 19181360832, "step": 67440, "train_runtime": 656959.0015, "train_tokens_per_second": 29197.196 }, { "epoch": 2.3865132560973183, "grad_norm": 1.5859375, "learning_rate": 1.7966442714756992e-05, "loss": 1.0304872512817382, "num_input_tokens_seen": 19184188736, "step": 67450, "train_runtime": 657053.9462, "train_tokens_per_second": 29197.281 }, { "epoch": 2.386867076361047, "grad_norm": 1.640625, "learning_rate": 1.7965282938448134e-05, "loss": 1.0263973236083985, "num_input_tokens_seen": 19186973888, "step": 67460, "train_runtime": 657145.5575, "train_tokens_per_second": 29197.449 }, { "epoch": 2.387220896624776, "grad_norm": 1.6015625, "learning_rate": 1.7964123386709175e-05, "loss": 1.035407829284668, "num_input_tokens_seen": 19189801984, "step": 67470, "train_runtime": 657241.2974, "train_tokens_per_second": 29197.499 }, { "epoch": 2.3875747168885044, "grad_norm": 1.640625, "learning_rate": 1.796296405946766e-05, "loss": 1.0412323951721192, "num_input_tokens_seen": 19192624448, "step": 67480, "train_runtime": 657335.597, "train_tokens_per_second": 29197.604 }, { "epoch": 2.3879285371522334, "grad_norm": 1.6015625, "learning_rate": 1.796180495665116e-05, "loss": 1.0300722122192383, "num_input_tokens_seen": 19195485120, "step": 67490, "train_runtime": 657433.3285, "train_tokens_per_second": 29197.615 }, { "epoch": 2.388282357415962, "grad_norm": 1.5859375, "learning_rate": 1.796064607818727e-05, "loss": 1.0262359619140624, "num_input_tokens_seen": 19198248000, "step": 67500, "train_runtime": 657528.5922, "train_tokens_per_second": 29197.587 }, { "epoch": 2.388636177679691, "grad_norm": 1.625, "learning_rate": 1.795948742400363e-05, "loss": 1.0323685646057128, "num_input_tokens_seen": 19201038656, "step": 67510, "train_runtime": 657621.6356, "train_tokens_per_second": 29197.699 }, { "epoch": 2.38898999794342, "grad_norm": 1.6171875, "learning_rate": 1.7958328994027903e-05, "loss": 1.0443204879760741, "num_input_tokens_seen": 19203872192, "step": 67520, "train_runtime": 657715.2283, "train_tokens_per_second": 29197.852 }, { "epoch": 2.3893438182071485, "grad_norm": 1.5703125, "learning_rate": 1.7957170788187792e-05, "loss": 1.0398640632629395, "num_input_tokens_seen": 19206691648, "step": 67530, "train_runtime": 657810.682, "train_tokens_per_second": 29197.902 }, { "epoch": 2.3896976384708775, "grad_norm": 1.6796875, "learning_rate": 1.7956012806411028e-05, "loss": 1.0244104385375976, "num_input_tokens_seen": 19209527552, "step": 67540, "train_runtime": 657912.4778, "train_tokens_per_second": 29197.695 }, { "epoch": 2.390051458734606, "grad_norm": 1.65625, "learning_rate": 1.795485504862537e-05, "loss": 1.0277759552001953, "num_input_tokens_seen": 19212346624, "step": 67550, "train_runtime": 658008.9791, "train_tokens_per_second": 29197.697 }, { "epoch": 2.390405278998335, "grad_norm": 1.5625, "learning_rate": 1.795369751475862e-05, "loss": 1.037470245361328, "num_input_tokens_seen": 19215182976, "step": 67560, "train_runtime": 658104.3592, "train_tokens_per_second": 29197.775 }, { "epoch": 2.3907590992620635, "grad_norm": 1.703125, "learning_rate": 1.795254020473861e-05, "loss": 1.042388343811035, "num_input_tokens_seen": 19218037120, "step": 67570, "train_runtime": 658203.5453, "train_tokens_per_second": 29197.711 }, { "epoch": 2.3911129195257925, "grad_norm": 1.5546875, "learning_rate": 1.7951383118493203e-05, "loss": 1.0339637756347657, "num_input_tokens_seen": 19220905088, "step": 67580, "train_runtime": 658306.0829, "train_tokens_per_second": 29197.52 }, { "epoch": 2.391466739789521, "grad_norm": 1.6015625, "learning_rate": 1.795022625595029e-05, "loss": 1.025121021270752, "num_input_tokens_seen": 19223711296, "step": 67590, "train_runtime": 658401.0061, "train_tokens_per_second": 29197.573 }, { "epoch": 2.39182056005325, "grad_norm": 1.59375, "learning_rate": 1.79490696170378e-05, "loss": 1.0445737838745117, "num_input_tokens_seen": 19226493888, "step": 67600, "train_runtime": 658493.7162, "train_tokens_per_second": 29197.688 }, { "epoch": 2.3921743803169786, "grad_norm": 1.625, "learning_rate": 1.79479132016837e-05, "loss": 1.0409154891967773, "num_input_tokens_seen": 19229300800, "step": 67610, "train_runtime": 658587.2065, "train_tokens_per_second": 29197.805 }, { "epoch": 2.3925282005807076, "grad_norm": 1.625, "learning_rate": 1.794675700981597e-05, "loss": 1.0388486862182618, "num_input_tokens_seen": 19232120256, "step": 67620, "train_runtime": 658685.4374, "train_tokens_per_second": 29197.731 }, { "epoch": 2.392882020844436, "grad_norm": 1.6015625, "learning_rate": 1.794560104136264e-05, "loss": 1.040609645843506, "num_input_tokens_seen": 19234951936, "step": 67630, "train_runtime": 658780.1504, "train_tokens_per_second": 29197.832 }, { "epoch": 2.393235841108165, "grad_norm": 1.6484375, "learning_rate": 1.7944445296251776e-05, "loss": 1.0288999557495118, "num_input_tokens_seen": 19237797504, "step": 67640, "train_runtime": 658878.1588, "train_tokens_per_second": 29197.807 }, { "epoch": 2.3935896613718937, "grad_norm": 1.578125, "learning_rate": 1.794328977441146e-05, "loss": 1.0368385314941406, "num_input_tokens_seen": 19240642304, "step": 67650, "train_runtime": 658973.43, "train_tokens_per_second": 29197.903 }, { "epoch": 2.3939434816356226, "grad_norm": 1.5390625, "learning_rate": 1.7942134475769813e-05, "loss": 1.0347375869750977, "num_input_tokens_seen": 19243497152, "step": 67660, "train_runtime": 659074.1903, "train_tokens_per_second": 29197.771 }, { "epoch": 2.3942973018993516, "grad_norm": 1.6875, "learning_rate": 1.794097940025499e-05, "loss": 1.020726776123047, "num_input_tokens_seen": 19246382720, "step": 67670, "train_runtime": 659173.894, "train_tokens_per_second": 29197.732 }, { "epoch": 2.39465112216308, "grad_norm": 1.65625, "learning_rate": 1.7939824547795183e-05, "loss": 1.037057590484619, "num_input_tokens_seen": 19249216896, "step": 67680, "train_runtime": 659269.5959, "train_tokens_per_second": 29197.793 }, { "epoch": 2.3950049424268087, "grad_norm": 1.609375, "learning_rate": 1.793866991831861e-05, "loss": 1.0411869049072267, "num_input_tokens_seen": 19252052992, "step": 67690, "train_runtime": 659362.9019, "train_tokens_per_second": 29197.962 }, { "epoch": 2.3953587626905377, "grad_norm": 1.6484375, "learning_rate": 1.793751551175352e-05, "loss": 1.0219942092895509, "num_input_tokens_seen": 19254910272, "step": 67700, "train_runtime": 659458.9297, "train_tokens_per_second": 29198.043 }, { "epoch": 2.3957125829542667, "grad_norm": 1.5703125, "learning_rate": 1.7936361328028196e-05, "loss": 1.026258659362793, "num_input_tokens_seen": 19257707904, "step": 67710, "train_runtime": 659551.3324, "train_tokens_per_second": 29198.194 }, { "epoch": 2.3960664032179952, "grad_norm": 1.5625, "learning_rate": 1.7935207367070964e-05, "loss": 1.0348807334899903, "num_input_tokens_seen": 19260580096, "step": 67720, "train_runtime": 659649.0679, "train_tokens_per_second": 29198.222 }, { "epoch": 2.3964202234817242, "grad_norm": 1.6015625, "learning_rate": 1.793405362881016e-05, "loss": 1.0370976448059082, "num_input_tokens_seen": 19263461888, "step": 67730, "train_runtime": 659748.9445, "train_tokens_per_second": 29198.17 }, { "epoch": 2.3967740437454528, "grad_norm": 1.5625, "learning_rate": 1.7932900113174182e-05, "loss": 1.0424583435058594, "num_input_tokens_seen": 19266301248, "step": 67740, "train_runtime": 659845.2618, "train_tokens_per_second": 29198.211 }, { "epoch": 2.3971278640091818, "grad_norm": 1.6640625, "learning_rate": 1.7931746820091423e-05, "loss": 1.0405729293823243, "num_input_tokens_seen": 19269187200, "step": 67750, "train_runtime": 659946.6246, "train_tokens_per_second": 29198.099 }, { "epoch": 2.3974816842729103, "grad_norm": 1.609375, "learning_rate": 1.793059374949034e-05, "loss": 1.0329941749572753, "num_input_tokens_seen": 19272044224, "step": 67760, "train_runtime": 660043.9187, "train_tokens_per_second": 29198.124 }, { "epoch": 2.3978355045366393, "grad_norm": 1.546875, "learning_rate": 1.7929440901299405e-05, "loss": 1.0383519172668456, "num_input_tokens_seen": 19274895168, "step": 67770, "train_runtime": 660140.7281, "train_tokens_per_second": 29198.161 }, { "epoch": 2.398189324800368, "grad_norm": 1.59375, "learning_rate": 1.7928288275447135e-05, "loss": 1.0262335777282714, "num_input_tokens_seen": 19277718016, "step": 67780, "train_runtime": 660237.4754, "train_tokens_per_second": 29198.158 }, { "epoch": 2.398543145064097, "grad_norm": 1.578125, "learning_rate": 1.792713587186207e-05, "loss": 1.0466070175170898, "num_input_tokens_seen": 19280601024, "step": 67790, "train_runtime": 660337.81, "train_tokens_per_second": 29198.087 }, { "epoch": 2.3988969653278254, "grad_norm": 1.609375, "learning_rate": 1.7925983690472782e-05, "loss": 1.0523872375488281, "num_input_tokens_seen": 19283403200, "step": 67800, "train_runtime": 660432.2045, "train_tokens_per_second": 29198.157 }, { "epoch": 2.3992507855915544, "grad_norm": 1.5546875, "learning_rate": 1.7924831731207873e-05, "loss": 1.0378917694091796, "num_input_tokens_seen": 19286276032, "step": 67810, "train_runtime": 660532.0786, "train_tokens_per_second": 29198.091 }, { "epoch": 2.399604605855283, "grad_norm": 1.5703125, "learning_rate": 1.7923679993995988e-05, "loss": 1.0290794372558594, "num_input_tokens_seen": 19289053632, "step": 67820, "train_runtime": 660624.4159, "train_tokens_per_second": 29198.215 }, { "epoch": 2.399958426119012, "grad_norm": 1.65625, "learning_rate": 1.79225284787658e-05, "loss": 1.0453547477722167, "num_input_tokens_seen": 19291869760, "step": 67830, "train_runtime": 660719.7503, "train_tokens_per_second": 29198.264 }, { "epoch": 2.4003122463827404, "grad_norm": 1.65625, "learning_rate": 1.7921377185446003e-05, "loss": 1.0173507690429688, "num_input_tokens_seen": 19294748224, "step": 67840, "train_runtime": 660820.0753, "train_tokens_per_second": 29198.187 }, { "epoch": 2.4006660666464694, "grad_norm": 1.6171875, "learning_rate": 1.7920226113965338e-05, "loss": 1.043630599975586, "num_input_tokens_seen": 19297604224, "step": 67850, "train_runtime": 660917.2079, "train_tokens_per_second": 29198.217 }, { "epoch": 2.4010198869101984, "grad_norm": 1.6171875, "learning_rate": 1.791907526425257e-05, "loss": 1.0321243286132813, "num_input_tokens_seen": 19300442624, "step": 67860, "train_runtime": 661014.7546, "train_tokens_per_second": 29198.202 }, { "epoch": 2.401373707173927, "grad_norm": 1.6484375, "learning_rate": 1.7917924636236495e-05, "loss": 1.0487638473510743, "num_input_tokens_seen": 19303286912, "step": 67870, "train_runtime": 661111.9982, "train_tokens_per_second": 29198.21 }, { "epoch": 2.401727527437656, "grad_norm": 1.609375, "learning_rate": 1.7916774229845944e-05, "loss": 1.0420937538146973, "num_input_tokens_seen": 19306127872, "step": 67880, "train_runtime": 661209.6237, "train_tokens_per_second": 29198.196 }, { "epoch": 2.4020813477013845, "grad_norm": 1.6328125, "learning_rate": 1.7915624045009787e-05, "loss": 1.0452825546264648, "num_input_tokens_seen": 19308988352, "step": 67890, "train_runtime": 661309.9748, "train_tokens_per_second": 29198.09 }, { "epoch": 2.4024351679651135, "grad_norm": 1.65625, "learning_rate": 1.791447408165691e-05, "loss": 1.044661521911621, "num_input_tokens_seen": 19311830400, "step": 67900, "train_runtime": 661406.7861, "train_tokens_per_second": 29198.113 }, { "epoch": 2.402788988228842, "grad_norm": 1.578125, "learning_rate": 1.7913324339716244e-05, "loss": 1.0360885620117188, "num_input_tokens_seen": 19314628096, "step": 67910, "train_runtime": 661504.7456, "train_tokens_per_second": 29198.019 }, { "epoch": 2.403142808492571, "grad_norm": 1.5859375, "learning_rate": 1.7912174819116744e-05, "loss": 1.044959831237793, "num_input_tokens_seen": 19317486464, "step": 67920, "train_runtime": 661599.9006, "train_tokens_per_second": 29198.14 }, { "epoch": 2.4034966287562995, "grad_norm": 1.6484375, "learning_rate": 1.7911025519787406e-05, "loss": 1.0345386505126952, "num_input_tokens_seen": 19320343936, "step": 67930, "train_runtime": 661698.5436, "train_tokens_per_second": 29198.106 }, { "epoch": 2.4038504490200285, "grad_norm": 1.6171875, "learning_rate": 1.7909876441657247e-05, "loss": 1.0365507125854492, "num_input_tokens_seen": 19323255232, "step": 67940, "train_runtime": 661799.1738, "train_tokens_per_second": 29198.065 }, { "epoch": 2.404204269283757, "grad_norm": 1.609375, "learning_rate": 1.7908727584655324e-05, "loss": 1.0426183700561524, "num_input_tokens_seen": 19326011456, "step": 67950, "train_runtime": 661891.9453, "train_tokens_per_second": 29198.137 }, { "epoch": 2.404558089547486, "grad_norm": 1.6328125, "learning_rate": 1.7907578948710722e-05, "loss": 1.0322011947631835, "num_input_tokens_seen": 19328812416, "step": 67960, "train_runtime": 661986.6681, "train_tokens_per_second": 29198.19 }, { "epoch": 2.4049119098112146, "grad_norm": 1.65625, "learning_rate": 1.790643053375256e-05, "loss": 1.038454818725586, "num_input_tokens_seen": 19331645056, "step": 67970, "train_runtime": 662081.8622, "train_tokens_per_second": 29198.27 }, { "epoch": 2.4052657300749436, "grad_norm": 1.5234375, "learning_rate": 1.7905282339709987e-05, "loss": 1.0464975357055664, "num_input_tokens_seen": 19334499904, "step": 67980, "train_runtime": 662178.4251, "train_tokens_per_second": 29198.324 }, { "epoch": 2.405619550338672, "grad_norm": 1.6875, "learning_rate": 1.7904134366512183e-05, "loss": 1.0257089614868165, "num_input_tokens_seen": 19337347840, "step": 67990, "train_runtime": 662274.4121, "train_tokens_per_second": 29198.392 }, { "epoch": 2.405973370602401, "grad_norm": 1.5625, "learning_rate": 1.790298661408836e-05, "loss": 1.0383018493652343, "num_input_tokens_seen": 19340199680, "step": 68000, "train_runtime": 662369.6484, "train_tokens_per_second": 29198.499 }, { "epoch": 2.40632719086613, "grad_norm": 1.578125, "learning_rate": 1.7901839082367766e-05, "loss": 1.027627944946289, "num_input_tokens_seen": 19343053632, "step": 68010, "train_runtime": 662467.1076, "train_tokens_per_second": 29198.512 }, { "epoch": 2.4066810111298587, "grad_norm": 1.6484375, "learning_rate": 1.7900691771279682e-05, "loss": 1.0331575393676757, "num_input_tokens_seen": 19345908864, "step": 68020, "train_runtime": 662562.808, "train_tokens_per_second": 29198.604 }, { "epoch": 2.407034831393587, "grad_norm": 1.5625, "learning_rate": 1.7899544680753404e-05, "loss": 1.0392854690551758, "num_input_tokens_seen": 19348721856, "step": 68030, "train_runtime": 662659.0464, "train_tokens_per_second": 29198.608 }, { "epoch": 2.407388651657316, "grad_norm": 1.6875, "learning_rate": 1.7898397810718286e-05, "loss": 1.0480867385864259, "num_input_tokens_seen": 19351526976, "step": 68040, "train_runtime": 662756.6154, "train_tokens_per_second": 29198.542 }, { "epoch": 2.407742471921045, "grad_norm": 1.6015625, "learning_rate": 1.7897251161103693e-05, "loss": 1.0350421905517577, "num_input_tokens_seen": 19354386368, "step": 68050, "train_runtime": 662853.7247, "train_tokens_per_second": 29198.578 }, { "epoch": 2.4080962921847737, "grad_norm": 1.59375, "learning_rate": 1.789610473183903e-05, "loss": 1.0397065162658692, "num_input_tokens_seen": 19357238848, "step": 68060, "train_runtime": 662948.7487, "train_tokens_per_second": 29198.696 }, { "epoch": 2.4084501124485027, "grad_norm": 1.703125, "learning_rate": 1.789495852285373e-05, "loss": 1.0351788520812988, "num_input_tokens_seen": 19360095936, "step": 68070, "train_runtime": 663046.6788, "train_tokens_per_second": 29198.692 }, { "epoch": 2.4088039327122313, "grad_norm": 1.6796875, "learning_rate": 1.789381253407726e-05, "loss": 1.0286617279052734, "num_input_tokens_seen": 19362983168, "step": 68080, "train_runtime": 663146.3837, "train_tokens_per_second": 29198.656 }, { "epoch": 2.4091577529759602, "grad_norm": 1.6640625, "learning_rate": 1.7892666765439117e-05, "loss": 1.0390830039978027, "num_input_tokens_seen": 19365830400, "step": 68090, "train_runtime": 663242.114, "train_tokens_per_second": 29198.735 }, { "epoch": 2.409511573239689, "grad_norm": 1.53125, "learning_rate": 1.789152121686884e-05, "loss": 1.0402548789978028, "num_input_tokens_seen": 19368627456, "step": 68100, "train_runtime": 663334.294, "train_tokens_per_second": 29198.894 }, { "epoch": 2.4098653935034178, "grad_norm": 1.5703125, "learning_rate": 1.789037588829598e-05, "loss": 1.0401814460754395, "num_input_tokens_seen": 19371494976, "step": 68110, "train_runtime": 663433.1741, "train_tokens_per_second": 29198.864 }, { "epoch": 2.4102192137671463, "grad_norm": 1.5390625, "learning_rate": 1.7889230779650135e-05, "loss": 1.0371888160705567, "num_input_tokens_seen": 19374391936, "step": 68120, "train_runtime": 663534.7294, "train_tokens_per_second": 29198.761 }, { "epoch": 2.4105730340308753, "grad_norm": 1.6328125, "learning_rate": 1.7888085890860927e-05, "loss": 1.0203709602355957, "num_input_tokens_seen": 19377238656, "step": 68130, "train_runtime": 663631.0346, "train_tokens_per_second": 29198.813 }, { "epoch": 2.410926854294604, "grad_norm": 1.5625, "learning_rate": 1.7886941221858022e-05, "loss": 1.034256362915039, "num_input_tokens_seen": 19380071296, "step": 68140, "train_runtime": 663728.6403, "train_tokens_per_second": 29198.787 }, { "epoch": 2.411280674558333, "grad_norm": 1.6171875, "learning_rate": 1.7885796772571094e-05, "loss": 1.0326120376586914, "num_input_tokens_seen": 19382972800, "step": 68150, "train_runtime": 663830.9672, "train_tokens_per_second": 29198.657 }, { "epoch": 2.411634494822062, "grad_norm": 1.71875, "learning_rate": 1.788465254292987e-05, "loss": 1.03338680267334, "num_input_tokens_seen": 19385770304, "step": 68160, "train_runtime": 663926.8457, "train_tokens_per_second": 29198.654 }, { "epoch": 2.4119883150857904, "grad_norm": 1.6328125, "learning_rate": 1.7883508532864095e-05, "loss": 1.035634708404541, "num_input_tokens_seen": 19388657024, "step": 68170, "train_runtime": 664027.3181, "train_tokens_per_second": 29198.583 }, { "epoch": 2.412342135349519, "grad_norm": 1.5625, "learning_rate": 1.7882364742303563e-05, "loss": 1.0460302352905273, "num_input_tokens_seen": 19391486080, "step": 68180, "train_runtime": 664124.1337, "train_tokens_per_second": 29198.587 }, { "epoch": 2.412695955613248, "grad_norm": 1.5546875, "learning_rate": 1.7881221171178072e-05, "loss": 1.0430177688598632, "num_input_tokens_seen": 19394326528, "step": 68190, "train_runtime": 664220.6156, "train_tokens_per_second": 29198.622 }, { "epoch": 2.413049775876977, "grad_norm": 1.609375, "learning_rate": 1.7880077819417483e-05, "loss": 1.0353623390197755, "num_input_tokens_seen": 19397190464, "step": 68200, "train_runtime": 664318.6907, "train_tokens_per_second": 29198.622 }, { "epoch": 2.4134035961407054, "grad_norm": 1.6640625, "learning_rate": 1.7878934686951657e-05, "loss": 1.041202926635742, "num_input_tokens_seen": 19399980352, "step": 68210, "train_runtime": 664410.8341, "train_tokens_per_second": 29198.772 }, { "epoch": 2.4137574164044344, "grad_norm": 1.5390625, "learning_rate": 1.787779177371051e-05, "loss": 1.0399333000183106, "num_input_tokens_seen": 19402815616, "step": 68220, "train_runtime": 664509.0832, "train_tokens_per_second": 29198.721 }, { "epoch": 2.414111236668163, "grad_norm": 1.578125, "learning_rate": 1.7876649079623982e-05, "loss": 1.0327028274536132, "num_input_tokens_seen": 19405657088, "step": 68230, "train_runtime": 664606.2012, "train_tokens_per_second": 29198.73 }, { "epoch": 2.414465056931892, "grad_norm": 1.6640625, "learning_rate": 1.787550660462204e-05, "loss": 1.0403755187988282, "num_input_tokens_seen": 19408556928, "step": 68240, "train_runtime": 664708.5896, "train_tokens_per_second": 29198.595 }, { "epoch": 2.4148188771956205, "grad_norm": 1.59375, "learning_rate": 1.7874364348634686e-05, "loss": 1.0333271026611328, "num_input_tokens_seen": 19411388096, "step": 68250, "train_runtime": 664803.9917, "train_tokens_per_second": 29198.664 }, { "epoch": 2.4151726974593495, "grad_norm": 1.6796875, "learning_rate": 1.787322231159196e-05, "loss": 1.0401830673217773, "num_input_tokens_seen": 19414268544, "step": 68260, "train_runtime": 664903.1876, "train_tokens_per_second": 29198.64 }, { "epoch": 2.415526517723078, "grad_norm": 1.6171875, "learning_rate": 1.7872080493423915e-05, "loss": 1.0143505096435548, "num_input_tokens_seen": 19417073856, "step": 68270, "train_runtime": 664999.6934, "train_tokens_per_second": 29198.621 }, { "epoch": 2.415880337986807, "grad_norm": 1.671875, "learning_rate": 1.7870938894060653e-05, "loss": 1.03094425201416, "num_input_tokens_seen": 19419968512, "step": 68280, "train_runtime": 665097.7039, "train_tokens_per_second": 29198.67 }, { "epoch": 2.4162341582505356, "grad_norm": 1.578125, "learning_rate": 1.7869797513432305e-05, "loss": 1.0439214706420898, "num_input_tokens_seen": 19422819328, "step": 68290, "train_runtime": 665194.9596, "train_tokens_per_second": 29198.687 }, { "epoch": 2.4165879785142645, "grad_norm": 1.5625, "learning_rate": 1.7868656351469017e-05, "loss": 1.02906494140625, "num_input_tokens_seen": 19425674496, "step": 68300, "train_runtime": 665294.0221, "train_tokens_per_second": 29198.631 }, { "epoch": 2.416941798777993, "grad_norm": 1.578125, "learning_rate": 1.786751540810099e-05, "loss": 1.0496397018432617, "num_input_tokens_seen": 19428499456, "step": 68310, "train_runtime": 665389.9725, "train_tokens_per_second": 29198.666 }, { "epoch": 2.417295619041722, "grad_norm": 1.59375, "learning_rate": 1.786637468325844e-05, "loss": 1.039009952545166, "num_input_tokens_seen": 19431315072, "step": 68320, "train_runtime": 665482.6345, "train_tokens_per_second": 29198.831 }, { "epoch": 2.4176494393054506, "grad_norm": 1.65625, "learning_rate": 1.786523417687162e-05, "loss": 1.0510046005249023, "num_input_tokens_seen": 19434190656, "step": 68330, "train_runtime": 665585.73, "train_tokens_per_second": 29198.629 }, { "epoch": 2.4180032595691796, "grad_norm": 1.5703125, "learning_rate": 1.7864093888870813e-05, "loss": 1.0226861953735351, "num_input_tokens_seen": 19437104192, "step": 68340, "train_runtime": 665691.4448, "train_tokens_per_second": 29198.369 }, { "epoch": 2.4183570798329086, "grad_norm": 1.625, "learning_rate": 1.7862953819186332e-05, "loss": 1.0432785034179688, "num_input_tokens_seen": 19439931200, "step": 68350, "train_runtime": 665789.554, "train_tokens_per_second": 29198.312 }, { "epoch": 2.418710900096637, "grad_norm": 1.5625, "learning_rate": 1.786181396774852e-05, "loss": 1.0352023124694825, "num_input_tokens_seen": 19442805888, "step": 68360, "train_runtime": 665886.0249, "train_tokens_per_second": 29198.399 }, { "epoch": 2.419064720360366, "grad_norm": 1.671875, "learning_rate": 1.7860674334487757e-05, "loss": 1.0329362869262695, "num_input_tokens_seen": 19445669952, "step": 68370, "train_runtime": 665983.8492, "train_tokens_per_second": 29198.411 }, { "epoch": 2.4194185406240947, "grad_norm": 1.578125, "learning_rate": 1.7859534919334447e-05, "loss": 1.025977325439453, "num_input_tokens_seen": 19448465280, "step": 68380, "train_runtime": 666076.3627, "train_tokens_per_second": 29198.552 }, { "epoch": 2.4197723608878237, "grad_norm": 1.5859375, "learning_rate": 1.7858395722219032e-05, "loss": 1.0505538940429688, "num_input_tokens_seen": 19451290176, "step": 68390, "train_runtime": 666172.8782, "train_tokens_per_second": 29198.562 }, { "epoch": 2.420126181151552, "grad_norm": 1.640625, "learning_rate": 1.7857256743071978e-05, "loss": 1.0248251914978028, "num_input_tokens_seen": 19454168704, "step": 68400, "train_runtime": 666273.511, "train_tokens_per_second": 29198.472 }, { "epoch": 2.420480001415281, "grad_norm": 1.6171875, "learning_rate": 1.785611798182379e-05, "loss": 1.0329280853271485, "num_input_tokens_seen": 19456994560, "step": 68410, "train_runtime": 666368.5625, "train_tokens_per_second": 29198.548 }, { "epoch": 2.4208338216790097, "grad_norm": 1.625, "learning_rate": 1.7854979438405e-05, "loss": 1.017113494873047, "num_input_tokens_seen": 19459841792, "step": 68420, "train_runtime": 666463.4686, "train_tokens_per_second": 29198.662 }, { "epoch": 2.4211876419427387, "grad_norm": 1.5078125, "learning_rate": 1.7853841112746157e-05, "loss": 1.0391107559204102, "num_input_tokens_seen": 19462673920, "step": 68430, "train_runtime": 666560.428, "train_tokens_per_second": 29198.664 }, { "epoch": 2.4215414622064673, "grad_norm": 1.59375, "learning_rate": 1.7852703004777873e-05, "loss": 1.0446707725524902, "num_input_tokens_seen": 19465500608, "step": 68440, "train_runtime": 666655.8567, "train_tokens_per_second": 29198.724 }, { "epoch": 2.4218952824701963, "grad_norm": 1.6171875, "learning_rate": 1.7851565114430764e-05, "loss": 1.0335012435913087, "num_input_tokens_seen": 19468332288, "step": 68450, "train_runtime": 666754.5175, "train_tokens_per_second": 29198.651 }, { "epoch": 2.422249102733925, "grad_norm": 1.625, "learning_rate": 1.7850427441635482e-05, "loss": 1.0351312637329102, "num_input_tokens_seen": 19471153856, "step": 68460, "train_runtime": 666849.0598, "train_tokens_per_second": 29198.742 }, { "epoch": 2.422602922997654, "grad_norm": 1.6328125, "learning_rate": 1.7849289986322723e-05, "loss": 1.045156192779541, "num_input_tokens_seen": 19473960384, "step": 68470, "train_runtime": 666943.3888, "train_tokens_per_second": 29198.821 }, { "epoch": 2.4229567432613823, "grad_norm": 1.6015625, "learning_rate": 1.7848152748423196e-05, "loss": 1.0287800788879395, "num_input_tokens_seen": 19476810240, "step": 68480, "train_runtime": 667041.4239, "train_tokens_per_second": 29198.802 }, { "epoch": 2.4233105635251113, "grad_norm": 1.5703125, "learning_rate": 1.784701572786765e-05, "loss": 1.048683261871338, "num_input_tokens_seen": 19479679872, "step": 68490, "train_runtime": 667137.2271, "train_tokens_per_second": 29198.91 }, { "epoch": 2.4236643837888403, "grad_norm": 1.5859375, "learning_rate": 1.7845878924586875e-05, "loss": 1.0333450317382813, "num_input_tokens_seen": 19482488192, "step": 68500, "train_runtime": 667231.9014, "train_tokens_per_second": 29198.976 }, { "epoch": 2.424018204052569, "grad_norm": 1.59375, "learning_rate": 1.7844742338511663e-05, "loss": 1.0348918914794922, "num_input_tokens_seen": 19485348736, "step": 68510, "train_runtime": 667331.2738, "train_tokens_per_second": 29198.914 }, { "epoch": 2.4243720243162974, "grad_norm": 1.609375, "learning_rate": 1.7843605969572865e-05, "loss": 1.0312030792236329, "num_input_tokens_seen": 19488182592, "step": 68520, "train_runtime": 667427.6793, "train_tokens_per_second": 29198.943 }, { "epoch": 2.4247258445800264, "grad_norm": 1.5546875, "learning_rate": 1.7842469817701354e-05, "loss": 1.0313251495361329, "num_input_tokens_seen": 19491078592, "step": 68530, "train_runtime": 667526.9319, "train_tokens_per_second": 29198.94 }, { "epoch": 2.4250796648437554, "grad_norm": 1.5859375, "learning_rate": 1.7841333882828033e-05, "loss": 1.0276253700256348, "num_input_tokens_seen": 19493887616, "step": 68540, "train_runtime": 667623.7942, "train_tokens_per_second": 29198.911 }, { "epoch": 2.425433485107484, "grad_norm": 1.6875, "learning_rate": 1.7840198164883827e-05, "loss": 1.035160732269287, "num_input_tokens_seen": 19496733952, "step": 68550, "train_runtime": 667719.3575, "train_tokens_per_second": 29198.995 }, { "epoch": 2.425787305371213, "grad_norm": 1.6328125, "learning_rate": 1.7839062663799703e-05, "loss": 1.0562235832214355, "num_input_tokens_seen": 19499576576, "step": 68560, "train_runtime": 667817.7979, "train_tokens_per_second": 29198.947 }, { "epoch": 2.4261411256349414, "grad_norm": 1.65625, "learning_rate": 1.7837927379506662e-05, "loss": 1.0372554779052734, "num_input_tokens_seen": 19502451520, "step": 68570, "train_runtime": 667915.0204, "train_tokens_per_second": 29199.001 }, { "epoch": 2.4264949458986704, "grad_norm": 1.6171875, "learning_rate": 1.7836792311935722e-05, "loss": 1.0365077018737794, "num_input_tokens_seen": 19505334848, "step": 68580, "train_runtime": 668015.5075, "train_tokens_per_second": 29198.925 }, { "epoch": 2.426848766162399, "grad_norm": 1.6875, "learning_rate": 1.7835657461017948e-05, "loss": 1.0361645698547364, "num_input_tokens_seen": 19508146112, "step": 68590, "train_runtime": 668112.6033, "train_tokens_per_second": 29198.89 }, { "epoch": 2.427202586426128, "grad_norm": 1.625, "learning_rate": 1.7834522826684414e-05, "loss": 1.0384063720703125, "num_input_tokens_seen": 19511018624, "step": 68600, "train_runtime": 668210.4127, "train_tokens_per_second": 29198.914 }, { "epoch": 2.4275564066898565, "grad_norm": 1.578125, "learning_rate": 1.783338840886625e-05, "loss": 1.0379545211791992, "num_input_tokens_seen": 19513878080, "step": 68610, "train_runtime": 668307.4512, "train_tokens_per_second": 29198.953 }, { "epoch": 2.4279102269535855, "grad_norm": 1.5625, "learning_rate": 1.7832254207494598e-05, "loss": 1.0298705101013184, "num_input_tokens_seen": 19516727616, "step": 68620, "train_runtime": 668408.8036, "train_tokens_per_second": 29198.789 }, { "epoch": 2.428264047217314, "grad_norm": 1.5546875, "learning_rate": 1.7831120222500635e-05, "loss": 1.0583419799804688, "num_input_tokens_seen": 19519535680, "step": 68630, "train_runtime": 668505.0539, "train_tokens_per_second": 29198.786 }, { "epoch": 2.428617867481043, "grad_norm": 1.5234375, "learning_rate": 1.782998645381558e-05, "loss": 1.0343798637390136, "num_input_tokens_seen": 19522431680, "step": 68640, "train_runtime": 668604.4186, "train_tokens_per_second": 29198.778 }, { "epoch": 2.4289716877447716, "grad_norm": 1.6015625, "learning_rate": 1.7828852901370663e-05, "loss": 1.0251478195190429, "num_input_tokens_seen": 19525270144, "step": 68650, "train_runtime": 668701.3058, "train_tokens_per_second": 29198.792 }, { "epoch": 2.4293255080085006, "grad_norm": 1.625, "learning_rate": 1.7827719565097157e-05, "loss": 1.026251220703125, "num_input_tokens_seen": 19528156928, "step": 68660, "train_runtime": 668801.4105, "train_tokens_per_second": 29198.738 }, { "epoch": 2.429679328272229, "grad_norm": 1.59375, "learning_rate": 1.7826586444926364e-05, "loss": 1.0340392112731933, "num_input_tokens_seen": 19531035392, "step": 68670, "train_runtime": 668899.449, "train_tokens_per_second": 29198.761 }, { "epoch": 2.430033148535958, "grad_norm": 1.640625, "learning_rate": 1.782545354078962e-05, "loss": 1.0374011993408203, "num_input_tokens_seen": 19533874624, "step": 68680, "train_runtime": 668996.418, "train_tokens_per_second": 29198.773 }, { "epoch": 2.430386968799687, "grad_norm": 1.59375, "learning_rate": 1.7824320852618285e-05, "loss": 1.0233301162719726, "num_input_tokens_seen": 19536690112, "step": 68690, "train_runtime": 669093.4902, "train_tokens_per_second": 29198.745 }, { "epoch": 2.4307407890634156, "grad_norm": 1.6171875, "learning_rate": 1.7823188380343746e-05, "loss": 1.049265480041504, "num_input_tokens_seen": 19539581504, "step": 68700, "train_runtime": 669192.7962, "train_tokens_per_second": 29198.733 }, { "epoch": 2.4310946093271446, "grad_norm": 1.5390625, "learning_rate": 1.7822056123897433e-05, "loss": 1.0305707931518555, "num_input_tokens_seen": 19542478080, "step": 68710, "train_runtime": 669294.2259, "train_tokens_per_second": 29198.635 }, { "epoch": 2.431448429590873, "grad_norm": 1.625, "learning_rate": 1.7820924083210802e-05, "loss": 1.0336406707763672, "num_input_tokens_seen": 19545280320, "step": 68720, "train_runtime": 669386.7181, "train_tokens_per_second": 29198.787 }, { "epoch": 2.431802249854602, "grad_norm": 1.5546875, "learning_rate": 1.781979225821533e-05, "loss": 1.0193326950073243, "num_input_tokens_seen": 19548097024, "step": 68730, "train_runtime": 669484.3212, "train_tokens_per_second": 29198.738 }, { "epoch": 2.4321560701183307, "grad_norm": 1.6875, "learning_rate": 1.781866064884254e-05, "loss": 1.0487627029418944, "num_input_tokens_seen": 19550942208, "step": 68740, "train_runtime": 669580.4688, "train_tokens_per_second": 29198.794 }, { "epoch": 2.4325098903820597, "grad_norm": 1.6640625, "learning_rate": 1.7817529255023968e-05, "loss": 1.0418296813964845, "num_input_tokens_seen": 19553779264, "step": 68750, "train_runtime": 669675.26, "train_tokens_per_second": 29198.897 }, { "epoch": 2.432863710645788, "grad_norm": 1.6015625, "learning_rate": 1.78163980766912e-05, "loss": 1.0393393516540528, "num_input_tokens_seen": 19556599360, "step": 68760, "train_runtime": 669772.8133, "train_tokens_per_second": 29198.855 }, { "epoch": 2.433217530909517, "grad_norm": 1.4921875, "learning_rate": 1.7815267113775832e-05, "loss": 1.03318510055542, "num_input_tokens_seen": 19559495680, "step": 68770, "train_runtime": 669875.2808, "train_tokens_per_second": 29198.712 }, { "epoch": 2.4335713511732457, "grad_norm": 1.734375, "learning_rate": 1.781413636620951e-05, "loss": 1.0419466018676757, "num_input_tokens_seen": 19562304384, "step": 68780, "train_runtime": 669970.054, "train_tokens_per_second": 29198.774 }, { "epoch": 2.4339251714369747, "grad_norm": 1.5703125, "learning_rate": 1.781300583392389e-05, "loss": 1.0437986373901367, "num_input_tokens_seen": 19565156416, "step": 68790, "train_runtime": 670068.4442, "train_tokens_per_second": 29198.743 }, { "epoch": 2.4342789917007033, "grad_norm": 1.5546875, "learning_rate": 1.7811875516850678e-05, "loss": 1.0376073837280273, "num_input_tokens_seen": 19568039168, "step": 68800, "train_runtime": 670168.266, "train_tokens_per_second": 29198.696 }, { "epoch": 2.4346328119644323, "grad_norm": 1.5703125, "learning_rate": 1.7810745414921605e-05, "loss": 1.0499457359313964, "num_input_tokens_seen": 19570895680, "step": 68810, "train_runtime": 670266.2435, "train_tokens_per_second": 29198.689 }, { "epoch": 2.434986632228161, "grad_norm": 1.5234375, "learning_rate": 1.7809615528068414e-05, "loss": 1.027841281890869, "num_input_tokens_seen": 19573712576, "step": 68820, "train_runtime": 670361.6078, "train_tokens_per_second": 29198.737 }, { "epoch": 2.43534045249189, "grad_norm": 1.59375, "learning_rate": 1.7808485856222905e-05, "loss": 1.0338020324707031, "num_input_tokens_seen": 19576527808, "step": 68830, "train_runtime": 670456.9424, "train_tokens_per_second": 29198.785 }, { "epoch": 2.435694272755619, "grad_norm": 1.6015625, "learning_rate": 1.7807356399316896e-05, "loss": 1.0221359252929687, "num_input_tokens_seen": 19579367232, "step": 68840, "train_runtime": 670554.5688, "train_tokens_per_second": 29198.768 }, { "epoch": 2.4360480930193473, "grad_norm": 1.59375, "learning_rate": 1.780622715728223e-05, "loss": 1.0493825912475585, "num_input_tokens_seen": 19582191040, "step": 68850, "train_runtime": 670650.0023, "train_tokens_per_second": 29198.823 }, { "epoch": 2.436401913283076, "grad_norm": 1.5234375, "learning_rate": 1.7805098130050797e-05, "loss": 1.0368536949157714, "num_input_tokens_seen": 19585090240, "step": 68860, "train_runtime": 670751.0452, "train_tokens_per_second": 29198.747 }, { "epoch": 2.436755733546805, "grad_norm": 1.6640625, "learning_rate": 1.780396931755449e-05, "loss": 1.0542387008666991, "num_input_tokens_seen": 19587910144, "step": 68870, "train_runtime": 670846.9476, "train_tokens_per_second": 29198.777 }, { "epoch": 2.437109553810534, "grad_norm": 1.5703125, "learning_rate": 1.7802840719725262e-05, "loss": 1.0143828392028809, "num_input_tokens_seen": 19590721216, "step": 68880, "train_runtime": 670943.2607, "train_tokens_per_second": 29198.775 }, { "epoch": 2.4374633740742624, "grad_norm": 1.5703125, "learning_rate": 1.7801712336495076e-05, "loss": 1.0203460693359374, "num_input_tokens_seen": 19593571584, "step": 68890, "train_runtime": 671042.8979, "train_tokens_per_second": 29198.687 }, { "epoch": 2.4378171943379914, "grad_norm": 1.65625, "learning_rate": 1.7800584167795936e-05, "loss": 1.037510585784912, "num_input_tokens_seen": 19596410624, "step": 68900, "train_runtime": 671140.6423, "train_tokens_per_second": 29198.665 }, { "epoch": 2.43817101460172, "grad_norm": 1.578125, "learning_rate": 1.7799456213559863e-05, "loss": 1.0304201126098633, "num_input_tokens_seen": 19599232384, "step": 68910, "train_runtime": 671237.6225, "train_tokens_per_second": 29198.65 }, { "epoch": 2.438524834865449, "grad_norm": 1.625, "learning_rate": 1.7798328473718933e-05, "loss": 1.037412452697754, "num_input_tokens_seen": 19602052352, "step": 68920, "train_runtime": 671334.0955, "train_tokens_per_second": 29198.655 }, { "epoch": 2.4388786551291775, "grad_norm": 1.671875, "learning_rate": 1.779720094820522e-05, "loss": 1.0413493156433105, "num_input_tokens_seen": 19604874368, "step": 68930, "train_runtime": 671427.9576, "train_tokens_per_second": 29198.776 }, { "epoch": 2.4392324753929064, "grad_norm": 1.578125, "learning_rate": 1.7796073636950857e-05, "loss": 1.033941650390625, "num_input_tokens_seen": 19607754176, "step": 68940, "train_runtime": 671527.2545, "train_tokens_per_second": 29198.747 }, { "epoch": 2.439586295656635, "grad_norm": 1.6796875, "learning_rate": 1.7794946539887983e-05, "loss": 1.0341178894042968, "num_input_tokens_seen": 19610550208, "step": 68950, "train_runtime": 671623.4503, "train_tokens_per_second": 29198.728 }, { "epoch": 2.439940115920364, "grad_norm": 1.578125, "learning_rate": 1.7793819656948787e-05, "loss": 1.0428680419921874, "num_input_tokens_seen": 19613431296, "step": 68960, "train_runtime": 671720.0044, "train_tokens_per_second": 29198.82 }, { "epoch": 2.4402939361840925, "grad_norm": 1.65625, "learning_rate": 1.7792692988065476e-05, "loss": 1.0438711166381835, "num_input_tokens_seen": 19616247744, "step": 68970, "train_runtime": 671816.564, "train_tokens_per_second": 29198.815 }, { "epoch": 2.4406477564478215, "grad_norm": 1.6171875, "learning_rate": 1.7791566533170294e-05, "loss": 1.029484176635742, "num_input_tokens_seen": 19619128000, "step": 68980, "train_runtime": 671916.6921, "train_tokens_per_second": 29198.751 }, { "epoch": 2.44100157671155, "grad_norm": 1.5859375, "learning_rate": 1.7790440292195505e-05, "loss": 1.0431220054626464, "num_input_tokens_seen": 19621999168, "step": 68990, "train_runtime": 672015.6473, "train_tokens_per_second": 29198.724 }, { "epoch": 2.441355396975279, "grad_norm": 1.6015625, "learning_rate": 1.778931426507342e-05, "loss": 1.0394121170043946, "num_input_tokens_seen": 19624835136, "step": 69000, "train_runtime": 672113.8285, "train_tokens_per_second": 29198.678 }, { "epoch": 2.4417092172390076, "grad_norm": 1.5390625, "learning_rate": 1.778818845173636e-05, "loss": 1.029822826385498, "num_input_tokens_seen": 19627691904, "step": 69010, "train_runtime": 672211.6646, "train_tokens_per_second": 29198.678 }, { "epoch": 2.4420630375027366, "grad_norm": 1.59375, "learning_rate": 1.7787062852116687e-05, "loss": 1.0254796028137207, "num_input_tokens_seen": 19630551680, "step": 69020, "train_runtime": 672309.3358, "train_tokens_per_second": 29198.69 }, { "epoch": 2.4424168577664656, "grad_norm": 1.6328125, "learning_rate": 1.7785937466146795e-05, "loss": 1.0420955657958983, "num_input_tokens_seen": 19633376384, "step": 69030, "train_runtime": 672405.6075, "train_tokens_per_second": 29198.71 }, { "epoch": 2.442770678030194, "grad_norm": 1.5625, "learning_rate": 1.7784812293759106e-05, "loss": 1.0351673126220704, "num_input_tokens_seen": 19636211712, "step": 69040, "train_runtime": 672501.5609, "train_tokens_per_second": 29198.76 }, { "epoch": 2.443124498293923, "grad_norm": 1.5390625, "learning_rate": 1.7783687334886065e-05, "loss": 1.030184555053711, "num_input_tokens_seen": 19639016256, "step": 69050, "train_runtime": 672596.3569, "train_tokens_per_second": 29198.814 }, { "epoch": 2.4434783185576516, "grad_norm": 1.578125, "learning_rate": 1.7782562589460156e-05, "loss": 1.027071475982666, "num_input_tokens_seen": 19641962752, "step": 69060, "train_runtime": 672700.2521, "train_tokens_per_second": 29198.685 }, { "epoch": 2.4438321388213806, "grad_norm": 1.546875, "learning_rate": 1.778143805741389e-05, "loss": 1.0340648651123048, "num_input_tokens_seen": 19644806592, "step": 69070, "train_runtime": 672799.7622, "train_tokens_per_second": 29198.593 }, { "epoch": 2.444185959085109, "grad_norm": 1.53125, "learning_rate": 1.7780313738679804e-05, "loss": 1.0302449226379395, "num_input_tokens_seen": 19647662272, "step": 69080, "train_runtime": 672894.9189, "train_tokens_per_second": 29198.708 }, { "epoch": 2.444539779348838, "grad_norm": 1.578125, "learning_rate": 1.777918963319047e-05, "loss": 1.0389592170715332, "num_input_tokens_seen": 19650563968, "step": 69090, "train_runtime": 672994.1607, "train_tokens_per_second": 29198.714 }, { "epoch": 2.4448935996125667, "grad_norm": 1.5859375, "learning_rate": 1.7778065740878485e-05, "loss": 1.0505677223205567, "num_input_tokens_seen": 19653403136, "step": 69100, "train_runtime": 673093.1921, "train_tokens_per_second": 29198.636 }, { "epoch": 2.4452474198762957, "grad_norm": 1.5859375, "learning_rate": 1.7776942061676485e-05, "loss": 1.0419110298156737, "num_input_tokens_seen": 19656230784, "step": 69110, "train_runtime": 673190.7915, "train_tokens_per_second": 29198.603 }, { "epoch": 2.4456012401400242, "grad_norm": 1.609375, "learning_rate": 1.7775818595517125e-05, "loss": 1.028173065185547, "num_input_tokens_seen": 19659065408, "step": 69120, "train_runtime": 673286.879, "train_tokens_per_second": 29198.646 }, { "epoch": 2.445955060403753, "grad_norm": 1.546875, "learning_rate": 1.7774695342333093e-05, "loss": 1.0467111587524414, "num_input_tokens_seen": 19661943488, "step": 69130, "train_runtime": 673384.4195, "train_tokens_per_second": 29198.691 }, { "epoch": 2.4463088806674818, "grad_norm": 1.6328125, "learning_rate": 1.7773572302057108e-05, "loss": 1.0229506492614746, "num_input_tokens_seen": 19664729728, "step": 69140, "train_runtime": 673476.5201, "train_tokens_per_second": 29198.835 }, { "epoch": 2.4466627009312107, "grad_norm": 1.6796875, "learning_rate": 1.777244947462192e-05, "loss": 1.034883689880371, "num_input_tokens_seen": 19667571456, "step": 69150, "train_runtime": 673575.1176, "train_tokens_per_second": 29198.78 }, { "epoch": 2.4470165211949393, "grad_norm": 1.578125, "learning_rate": 1.777132685996031e-05, "loss": 1.0457597732543946, "num_input_tokens_seen": 19670420928, "step": 69160, "train_runtime": 673671.9366, "train_tokens_per_second": 29198.813 }, { "epoch": 2.4473703414586683, "grad_norm": 1.640625, "learning_rate": 1.7770204458005086e-05, "loss": 1.0310590744018555, "num_input_tokens_seen": 19673216000, "step": 69170, "train_runtime": 673765.9179, "train_tokens_per_second": 29198.889 }, { "epoch": 2.4477241617223973, "grad_norm": 1.546875, "learning_rate": 1.776908226868908e-05, "loss": 1.0549046516418457, "num_input_tokens_seen": 19676064512, "step": 69180, "train_runtime": 673864.3985, "train_tokens_per_second": 29198.849 }, { "epoch": 2.448077981986126, "grad_norm": 1.640625, "learning_rate": 1.776796029194517e-05, "loss": 1.0252192497253418, "num_input_tokens_seen": 19678938944, "step": 69190, "train_runtime": 673962.3185, "train_tokens_per_second": 29198.871 }, { "epoch": 2.448431802249855, "grad_norm": 1.59375, "learning_rate": 1.776683852770624e-05, "loss": 1.0427411079406739, "num_input_tokens_seen": 19681750464, "step": 69200, "train_runtime": 674058.4663, "train_tokens_per_second": 29198.877 }, { "epoch": 2.4487856225135833, "grad_norm": 1.640625, "learning_rate": 1.7765716975905224e-05, "loss": 1.0385528564453126, "num_input_tokens_seen": 19684566592, "step": 69210, "train_runtime": 674155.4192, "train_tokens_per_second": 29198.855 }, { "epoch": 2.4491394427773123, "grad_norm": 1.5625, "learning_rate": 1.776459563647508e-05, "loss": 1.0360111236572265, "num_input_tokens_seen": 19687365696, "step": 69220, "train_runtime": 674248.7865, "train_tokens_per_second": 29198.963 }, { "epoch": 2.449493263041041, "grad_norm": 1.5703125, "learning_rate": 1.7763474509348795e-05, "loss": 1.0354524612426759, "num_input_tokens_seen": 19690192640, "step": 69230, "train_runtime": 674344.8043, "train_tokens_per_second": 29198.998 }, { "epoch": 2.44984708330477, "grad_norm": 1.5546875, "learning_rate": 1.7762353594459377e-05, "loss": 1.0363286972045898, "num_input_tokens_seen": 19693018944, "step": 69240, "train_runtime": 674439.4662, "train_tokens_per_second": 29199.09 }, { "epoch": 2.4502009035684984, "grad_norm": 1.640625, "learning_rate": 1.7761232891739878e-05, "loss": 1.0454733848571778, "num_input_tokens_seen": 19695877760, "step": 69250, "train_runtime": 674539.5739, "train_tokens_per_second": 29198.995 }, { "epoch": 2.4505547238322274, "grad_norm": 1.609375, "learning_rate": 1.776011240112337e-05, "loss": 1.026791477203369, "num_input_tokens_seen": 19698677056, "step": 69260, "train_runtime": 674637.2276, "train_tokens_per_second": 29198.918 }, { "epoch": 2.450908544095956, "grad_norm": 1.5546875, "learning_rate": 1.7758992122542966e-05, "loss": 1.0298766136169433, "num_input_tokens_seen": 19701504960, "step": 69270, "train_runtime": 674733.5474, "train_tokens_per_second": 29198.941 }, { "epoch": 2.451262364359685, "grad_norm": 1.6484375, "learning_rate": 1.7757872055931786e-05, "loss": 1.0340000152587892, "num_input_tokens_seen": 19704340224, "step": 69280, "train_runtime": 674829.54, "train_tokens_per_second": 29198.989 }, { "epoch": 2.4516161846234135, "grad_norm": 1.625, "learning_rate": 1.7756752201223005e-05, "loss": 1.0470769882202149, "num_input_tokens_seen": 19707155328, "step": 69290, "train_runtime": 674923.8634, "train_tokens_per_second": 29199.079 }, { "epoch": 2.4519700048871425, "grad_norm": 1.6953125, "learning_rate": 1.7755632558349808e-05, "loss": 1.0521994590759278, "num_input_tokens_seen": 19710033664, "step": 69300, "train_runtime": 675023.1792, "train_tokens_per_second": 29199.047 }, { "epoch": 2.452323825150871, "grad_norm": 1.6484375, "learning_rate": 1.7754513127245423e-05, "loss": 1.036869716644287, "num_input_tokens_seen": 19712820608, "step": 69310, "train_runtime": 675116.0672, "train_tokens_per_second": 29199.158 }, { "epoch": 2.4526776454146, "grad_norm": 1.5546875, "learning_rate": 1.77533939078431e-05, "loss": 1.0346519470214843, "num_input_tokens_seen": 19715692160, "step": 69320, "train_runtime": 675213.5053, "train_tokens_per_second": 29199.197 }, { "epoch": 2.453031465678329, "grad_norm": 1.65625, "learning_rate": 1.7752274900076117e-05, "loss": 1.0308061599731446, "num_input_tokens_seen": 19718515712, "step": 69330, "train_runtime": 675310.4293, "train_tokens_per_second": 29199.187 }, { "epoch": 2.4533852859420575, "grad_norm": 1.5703125, "learning_rate": 1.775115610387779e-05, "loss": 1.020094108581543, "num_input_tokens_seen": 19721335040, "step": 69340, "train_runtime": 675404.7546, "train_tokens_per_second": 29199.284 }, { "epoch": 2.453739106205786, "grad_norm": 1.5625, "learning_rate": 1.7750037519181458e-05, "loss": 1.0232133865356445, "num_input_tokens_seen": 19724223744, "step": 69350, "train_runtime": 675506.1573, "train_tokens_per_second": 29199.177 }, { "epoch": 2.454092926469515, "grad_norm": 1.6171875, "learning_rate": 1.774891914592049e-05, "loss": 1.033740520477295, "num_input_tokens_seen": 19727068800, "step": 69360, "train_runtime": 675603.9085, "train_tokens_per_second": 29199.163 }, { "epoch": 2.454446746733244, "grad_norm": 1.640625, "learning_rate": 1.7747800984028288e-05, "loss": 1.0410243034362794, "num_input_tokens_seen": 19729890368, "step": 69370, "train_runtime": 675700.9089, "train_tokens_per_second": 29199.147 }, { "epoch": 2.4548005669969726, "grad_norm": 1.484375, "learning_rate": 1.7746683033438273e-05, "loss": 1.0381586074829101, "num_input_tokens_seen": 19732693376, "step": 69380, "train_runtime": 675799.1686, "train_tokens_per_second": 29199.05 }, { "epoch": 2.4551543872607016, "grad_norm": 1.6015625, "learning_rate": 1.7745565294083913e-05, "loss": 1.0432146072387696, "num_input_tokens_seen": 19735536192, "step": 69390, "train_runtime": 675897.432, "train_tokens_per_second": 29199.01 }, { "epoch": 2.45550820752443, "grad_norm": 35.5, "learning_rate": 1.7744447765898684e-05, "loss": 1.0501142501831056, "num_input_tokens_seen": 19738395840, "step": 69400, "train_runtime": 675994.7283, "train_tokens_per_second": 29199.038 }, { "epoch": 2.455862027788159, "grad_norm": 1.6640625, "learning_rate": 1.774333044881611e-05, "loss": 1.0364815711975097, "num_input_tokens_seen": 19741271552, "step": 69410, "train_runtime": 676092.9228, "train_tokens_per_second": 29199.051 }, { "epoch": 2.4562158480518876, "grad_norm": 1.609375, "learning_rate": 1.7742213342769734e-05, "loss": 1.0386528015136718, "num_input_tokens_seen": 19744131584, "step": 69420, "train_runtime": 676190.251, "train_tokens_per_second": 29199.078 }, { "epoch": 2.4565696683156166, "grad_norm": 1.5859375, "learning_rate": 1.7741096447693133e-05, "loss": 1.027775764465332, "num_input_tokens_seen": 19747028800, "step": 69430, "train_runtime": 676291.3157, "train_tokens_per_second": 29198.998 }, { "epoch": 2.456923488579345, "grad_norm": 1.6015625, "learning_rate": 1.7739979763519905e-05, "loss": 1.0348522186279296, "num_input_tokens_seen": 19749886016, "step": 69440, "train_runtime": 676386.6441, "train_tokens_per_second": 29199.107 }, { "epoch": 2.457277308843074, "grad_norm": 1.6328125, "learning_rate": 1.7738863290183695e-05, "loss": 1.0279630661010741, "num_input_tokens_seen": 19752744512, "step": 69450, "train_runtime": 676486.1685, "train_tokens_per_second": 29199.037 }, { "epoch": 2.4576311291068027, "grad_norm": 1.5625, "learning_rate": 1.7737747027618156e-05, "loss": 1.0369864463806153, "num_input_tokens_seen": 19755592768, "step": 69460, "train_runtime": 676583.3278, "train_tokens_per_second": 29199.053 }, { "epoch": 2.4579849493705317, "grad_norm": 1.59375, "learning_rate": 1.7736630975756982e-05, "loss": 1.046706771850586, "num_input_tokens_seen": 19758432768, "step": 69470, "train_runtime": 676681.509, "train_tokens_per_second": 29199.014 }, { "epoch": 2.4583387696342602, "grad_norm": 1.59375, "learning_rate": 1.7735515134533902e-05, "loss": 1.0388235092163085, "num_input_tokens_seen": 19761284928, "step": 69480, "train_runtime": 676781.4224, "train_tokens_per_second": 29198.918 }, { "epoch": 2.4586925898979892, "grad_norm": 1.625, "learning_rate": 1.773439950388265e-05, "loss": 1.034647274017334, "num_input_tokens_seen": 19764132992, "step": 69490, "train_runtime": 676878.9903, "train_tokens_per_second": 29198.916 }, { "epoch": 2.4590464101617178, "grad_norm": 1.59375, "learning_rate": 1.773328408373702e-05, "loss": 1.0314868927001952, "num_input_tokens_seen": 19766993728, "step": 69500, "train_runtime": 676977.6439, "train_tokens_per_second": 29198.887 }, { "epoch": 2.4594002304254468, "grad_norm": 1.640625, "learning_rate": 1.7732168874030813e-05, "loss": 1.0230062484741211, "num_input_tokens_seen": 19769818432, "step": 69510, "train_runtime": 677072.6822, "train_tokens_per_second": 29198.96 }, { "epoch": 2.4597540506891757, "grad_norm": 1.65625, "learning_rate": 1.7731053874697875e-05, "loss": 1.0479019165039063, "num_input_tokens_seen": 19772655424, "step": 69520, "train_runtime": 677170.5569, "train_tokens_per_second": 29198.93 }, { "epoch": 2.4601078709529043, "grad_norm": 1.59375, "learning_rate": 1.7729939085672064e-05, "loss": 1.0357666015625, "num_input_tokens_seen": 19775456576, "step": 69530, "train_runtime": 677265.2946, "train_tokens_per_second": 29198.981 }, { "epoch": 2.4604616912166333, "grad_norm": 1.6484375, "learning_rate": 1.7728824506887278e-05, "loss": 1.0381930351257325, "num_input_tokens_seen": 19778306176, "step": 69540, "train_runtime": 677362.398, "train_tokens_per_second": 29199.002 }, { "epoch": 2.460815511480362, "grad_norm": 1.625, "learning_rate": 1.7727710138277448e-05, "loss": 1.0315091133117675, "num_input_tokens_seen": 19781158528, "step": 69550, "train_runtime": 677459.3219, "train_tokens_per_second": 29199.035 }, { "epoch": 2.461169331744091, "grad_norm": 1.6171875, "learning_rate": 1.7726595979776522e-05, "loss": 1.025179100036621, "num_input_tokens_seen": 19783951744, "step": 69560, "train_runtime": 677553.2443, "train_tokens_per_second": 29199.11 }, { "epoch": 2.4615231520078193, "grad_norm": 1.625, "learning_rate": 1.7725482031318487e-05, "loss": 1.047089195251465, "num_input_tokens_seen": 19786827456, "step": 69570, "train_runtime": 677655.5759, "train_tokens_per_second": 29198.944 }, { "epoch": 2.4618769722715483, "grad_norm": 1.546875, "learning_rate": 1.772436829283735e-05, "loss": 1.0311185836791992, "num_input_tokens_seen": 19789700992, "step": 69580, "train_runtime": 677754.876, "train_tokens_per_second": 29198.906 }, { "epoch": 2.462230792535277, "grad_norm": 1.59375, "learning_rate": 1.7723254764267157e-05, "loss": 1.0366227149963378, "num_input_tokens_seen": 19792513024, "step": 69590, "train_runtime": 677851.015, "train_tokens_per_second": 29198.913 }, { "epoch": 2.462584612799006, "grad_norm": 1.53125, "learning_rate": 1.772214144554198e-05, "loss": 1.039426326751709, "num_input_tokens_seen": 19795376896, "step": 69600, "train_runtime": 677948.5443, "train_tokens_per_second": 29198.937 }, { "epoch": 2.4629384330627344, "grad_norm": 1.5625, "learning_rate": 1.772102833659591e-05, "loss": 1.049594783782959, "num_input_tokens_seen": 19798204352, "step": 69610, "train_runtime": 678045.333, "train_tokens_per_second": 29198.939 }, { "epoch": 2.4632922533264634, "grad_norm": 1.5625, "learning_rate": 1.771991543736308e-05, "loss": 1.0267019271850586, "num_input_tokens_seen": 19801081152, "step": 69620, "train_runtime": 678143.0539, "train_tokens_per_second": 29198.974 }, { "epoch": 2.463646073590192, "grad_norm": 1.671875, "learning_rate": 1.7718802747777656e-05, "loss": 1.0491281509399415, "num_input_tokens_seen": 19803958720, "step": 69630, "train_runtime": 678243.7204, "train_tokens_per_second": 29198.883 }, { "epoch": 2.463999893853921, "grad_norm": 1.59375, "learning_rate": 1.771769026777381e-05, "loss": 1.0378268241882325, "num_input_tokens_seen": 19806807360, "step": 69640, "train_runtime": 678340.4732, "train_tokens_per_second": 29198.917 }, { "epoch": 2.4643537141176495, "grad_norm": 1.59375, "learning_rate": 1.7716577997285763e-05, "loss": 1.036257266998291, "num_input_tokens_seen": 19809599360, "step": 69650, "train_runtime": 678436.6671, "train_tokens_per_second": 29198.893 }, { "epoch": 2.4647075343813785, "grad_norm": 1.53125, "learning_rate": 1.771546593624776e-05, "loss": 1.045534324645996, "num_input_tokens_seen": 19812505984, "step": 69660, "train_runtime": 678534.8685, "train_tokens_per_second": 29198.95 }, { "epoch": 2.4650613546451074, "grad_norm": 1.6171875, "learning_rate": 1.7714354084594077e-05, "loss": 1.031464195251465, "num_input_tokens_seen": 19815300608, "step": 69670, "train_runtime": 678627.9062, "train_tokens_per_second": 29199.065 }, { "epoch": 2.465415174908836, "grad_norm": 1.640625, "learning_rate": 1.7713242442259005e-05, "loss": 1.0380437850952149, "num_input_tokens_seen": 19818156096, "step": 69680, "train_runtime": 678725.6092, "train_tokens_per_second": 29199.069 }, { "epoch": 2.4657689951725645, "grad_norm": 1.6328125, "learning_rate": 1.771213100917688e-05, "loss": 1.0372909545898437, "num_input_tokens_seen": 19821056256, "step": 69690, "train_runtime": 678825.9105, "train_tokens_per_second": 29199.027 }, { "epoch": 2.4661228154362935, "grad_norm": 1.6484375, "learning_rate": 1.771101978528207e-05, "loss": 1.037991428375244, "num_input_tokens_seen": 19823867648, "step": 69700, "train_runtime": 678920.365, "train_tokens_per_second": 29199.106 }, { "epoch": 2.4664766357000225, "grad_norm": 1.6171875, "learning_rate": 1.770990877050895e-05, "loss": 1.0336776733398438, "num_input_tokens_seen": 19826690560, "step": 69710, "train_runtime": 679017.341, "train_tokens_per_second": 29199.093 }, { "epoch": 2.466830455963751, "grad_norm": 1.6171875, "learning_rate": 1.7708797964791944e-05, "loss": 1.0350730895996094, "num_input_tokens_seen": 19829525056, "step": 69720, "train_runtime": 679113.693, "train_tokens_per_second": 29199.124 }, { "epoch": 2.46718427622748, "grad_norm": 1.65625, "learning_rate": 1.7707687368065497e-05, "loss": 1.0426039695739746, "num_input_tokens_seen": 19832363904, "step": 69730, "train_runtime": 679212.5046, "train_tokens_per_second": 29199.056 }, { "epoch": 2.4675380964912086, "grad_norm": 1.6171875, "learning_rate": 1.7706576980264086e-05, "loss": 1.0232948303222655, "num_input_tokens_seen": 19835189952, "step": 69740, "train_runtime": 679307.8997, "train_tokens_per_second": 29199.116 }, { "epoch": 2.4678919167549376, "grad_norm": 1.6328125, "learning_rate": 1.770546680132221e-05, "loss": 1.0410656929016113, "num_input_tokens_seen": 19838050304, "step": 69750, "train_runtime": 679406.8258, "train_tokens_per_second": 29199.074 }, { "epoch": 2.468245737018666, "grad_norm": 1.5625, "learning_rate": 1.7704356831174402e-05, "loss": 1.0339242935180664, "num_input_tokens_seen": 19840935616, "step": 69760, "train_runtime": 679505.7306, "train_tokens_per_second": 29199.07 }, { "epoch": 2.468599557282395, "grad_norm": 1.59375, "learning_rate": 1.770324706975523e-05, "loss": 1.0415584564208984, "num_input_tokens_seen": 19843782208, "step": 69770, "train_runtime": 679601.2726, "train_tokens_per_second": 29199.154 }, { "epoch": 2.4689533775461237, "grad_norm": 1.5234375, "learning_rate": 1.7702137516999267e-05, "loss": 1.0258638381958007, "num_input_tokens_seen": 19846603840, "step": 69780, "train_runtime": 679696.7962, "train_tokens_per_second": 29199.202 }, { "epoch": 2.4693071978098526, "grad_norm": 1.6171875, "learning_rate": 1.7701028172841147e-05, "loss": 1.036543846130371, "num_input_tokens_seen": 19849473472, "step": 69790, "train_runtime": 679798.006, "train_tokens_per_second": 29199.076 }, { "epoch": 2.469661018073581, "grad_norm": 1.703125, "learning_rate": 1.7699919037215512e-05, "loss": 1.0313720703125, "num_input_tokens_seen": 19852302208, "step": 69800, "train_runtime": 679893.2666, "train_tokens_per_second": 29199.145 }, { "epoch": 2.47001483833731, "grad_norm": 1.65625, "learning_rate": 1.7698810110057035e-05, "loss": 1.031489944458008, "num_input_tokens_seen": 19855086656, "step": 69810, "train_runtime": 679988.7572, "train_tokens_per_second": 29199.14 }, { "epoch": 2.4703686586010387, "grad_norm": 1.5859375, "learning_rate": 1.769770139130042e-05, "loss": 1.053888702392578, "num_input_tokens_seen": 19857882560, "step": 69820, "train_runtime": 680084.9221, "train_tokens_per_second": 29199.122 }, { "epoch": 2.4707224788647677, "grad_norm": 1.609375, "learning_rate": 1.7696592880880408e-05, "loss": 1.0403172492980957, "num_input_tokens_seen": 19860724608, "step": 69830, "train_runtime": 680183.1492, "train_tokens_per_second": 29199.084 }, { "epoch": 2.4710762991284962, "grad_norm": 1.671875, "learning_rate": 1.769548457873175e-05, "loss": 1.0328142166137695, "num_input_tokens_seen": 19863600896, "step": 69840, "train_runtime": 680282.8928, "train_tokens_per_second": 29199.03 }, { "epoch": 2.4714301193922252, "grad_norm": 1.5546875, "learning_rate": 1.7694376484789247e-05, "loss": 1.0438216209411622, "num_input_tokens_seen": 19866412352, "step": 69850, "train_runtime": 680378.8865, "train_tokens_per_second": 29199.043 }, { "epoch": 2.471783939655954, "grad_norm": 1.5546875, "learning_rate": 1.7693268598987705e-05, "loss": 1.027155303955078, "num_input_tokens_seen": 19869221248, "step": 69860, "train_runtime": 680476.9559, "train_tokens_per_second": 29198.963 }, { "epoch": 2.4721377599196828, "grad_norm": 1.609375, "learning_rate": 1.769216092126198e-05, "loss": 1.020984935760498, "num_input_tokens_seen": 19872089536, "step": 69870, "train_runtime": 680575.0149, "train_tokens_per_second": 29198.97 }, { "epoch": 2.4724915801834118, "grad_norm": 1.609375, "learning_rate": 1.7691053451546948e-05, "loss": 1.039038848876953, "num_input_tokens_seen": 19874967808, "step": 69880, "train_runtime": 680673.9498, "train_tokens_per_second": 29198.955 }, { "epoch": 2.4728454004471403, "grad_norm": 1.6328125, "learning_rate": 1.7689946189777502e-05, "loss": 1.0243235588073731, "num_input_tokens_seen": 19877793088, "step": 69890, "train_runtime": 680767.8022, "train_tokens_per_second": 29199.079 }, { "epoch": 2.4731992207108693, "grad_norm": 1.6015625, "learning_rate": 1.7688839135888594e-05, "loss": 1.0419851303100587, "num_input_tokens_seen": 19880589376, "step": 69900, "train_runtime": 680866.5707, "train_tokens_per_second": 29198.951 }, { "epoch": 2.473553040974598, "grad_norm": 1.5625, "learning_rate": 1.768773228981517e-05, "loss": 1.041335105895996, "num_input_tokens_seen": 19883474944, "step": 69910, "train_runtime": 680964.1077, "train_tokens_per_second": 29199.006 }, { "epoch": 2.473906861238327, "grad_norm": 1.625, "learning_rate": 1.7686625651492226e-05, "loss": 1.027377986907959, "num_input_tokens_seen": 19886367424, "step": 69920, "train_runtime": 681061.8519, "train_tokens_per_second": 29199.062 }, { "epoch": 2.4742606815020554, "grad_norm": 1.578125, "learning_rate": 1.7685519220854775e-05, "loss": 1.0351346969604491, "num_input_tokens_seen": 19889233600, "step": 69930, "train_runtime": 681163.1441, "train_tokens_per_second": 29198.928 }, { "epoch": 2.4746145017657843, "grad_norm": 1.5703125, "learning_rate": 1.7684412997837872e-05, "loss": 1.0309329986572267, "num_input_tokens_seen": 19892081472, "step": 69940, "train_runtime": 681262.7337, "train_tokens_per_second": 29198.84 }, { "epoch": 2.474968322029513, "grad_norm": 1.5546875, "learning_rate": 1.7683306982376585e-05, "loss": 1.023515796661377, "num_input_tokens_seen": 19894934656, "step": 69950, "train_runtime": 681361.5654, "train_tokens_per_second": 29198.792 }, { "epoch": 2.475322142293242, "grad_norm": 1.578125, "learning_rate": 1.7682201174406023e-05, "loss": 1.0204511642456056, "num_input_tokens_seen": 19897847616, "step": 69960, "train_runtime": 681462.9426, "train_tokens_per_second": 29198.723 }, { "epoch": 2.4756759625569704, "grad_norm": 1.640625, "learning_rate": 1.7681095573861314e-05, "loss": 1.0379213333129882, "num_input_tokens_seen": 19900666432, "step": 69970, "train_runtime": 681559.5715, "train_tokens_per_second": 29198.719 }, { "epoch": 2.4760297828206994, "grad_norm": 1.671875, "learning_rate": 1.7679990180677623e-05, "loss": 1.0398656845092773, "num_input_tokens_seen": 19903458944, "step": 69980, "train_runtime": 681653.2424, "train_tokens_per_second": 29198.803 }, { "epoch": 2.476383603084428, "grad_norm": 1.578125, "learning_rate": 1.767888499479013e-05, "loss": 1.0422216415405274, "num_input_tokens_seen": 19906279488, "step": 69990, "train_runtime": 681749.8171, "train_tokens_per_second": 29198.804 }, { "epoch": 2.476737423348157, "grad_norm": 1.5390625, "learning_rate": 1.767778001613406e-05, "loss": 1.0271638870239257, "num_input_tokens_seen": 19909106304, "step": 70000, "train_runtime": 681847.4155, "train_tokens_per_second": 29198.771 }, { "epoch": 2.476737423348157, "eval_loss": 1.0226019620895386, "eval_runtime": 8.438, "eval_samples_per_second": 472.624, "eval_steps_per_second": 3.792, "num_input_tokens_seen": 19909106304, "step": 70000 }, { "epoch": 2.477091243611886, "grad_norm": 1.5546875, "learning_rate": 1.7676675244644658e-05, "loss": 1.043246078491211, "num_input_tokens_seen": 19911947520, "step": 70010, "train_runtime": 681973.0097, "train_tokens_per_second": 29197.559 }, { "epoch": 2.4774450638756145, "grad_norm": 1.6796875, "learning_rate": 1.7675570680257193e-05, "loss": 1.033086395263672, "num_input_tokens_seen": 19914752768, "step": 70020, "train_runtime": 682067.9238, "train_tokens_per_second": 29197.609 }, { "epoch": 2.477798884139343, "grad_norm": 1.671875, "learning_rate": 1.7674466322906973e-05, "loss": 1.032648468017578, "num_input_tokens_seen": 19917633088, "step": 70030, "train_runtime": 682167.6405, "train_tokens_per_second": 29197.564 }, { "epoch": 2.478152704403072, "grad_norm": 1.6171875, "learning_rate": 1.7673362172529324e-05, "loss": 1.049037551879883, "num_input_tokens_seen": 19920416832, "step": 70040, "train_runtime": 682260.3028, "train_tokens_per_second": 29197.678 }, { "epoch": 2.478506524666801, "grad_norm": 1.5703125, "learning_rate": 1.7672258229059605e-05, "loss": 1.0461451530456543, "num_input_tokens_seen": 19923288640, "step": 70050, "train_runtime": 682355.2529, "train_tokens_per_second": 29197.824 }, { "epoch": 2.4788603449305295, "grad_norm": 1.59375, "learning_rate": 1.76711544924332e-05, "loss": 1.0544964790344238, "num_input_tokens_seen": 19926118016, "step": 70060, "train_runtime": 682449.4575, "train_tokens_per_second": 29197.94 }, { "epoch": 2.4792141651942585, "grad_norm": 1.59375, "learning_rate": 1.7670050962585536e-05, "loss": 1.0319511413574218, "num_input_tokens_seen": 19928952320, "step": 70070, "train_runtime": 682546.6688, "train_tokens_per_second": 29197.934 }, { "epoch": 2.479567985457987, "grad_norm": 1.6015625, "learning_rate": 1.7668947639452045e-05, "loss": 1.0358685493469237, "num_input_tokens_seen": 19931790464, "step": 70080, "train_runtime": 682644.3682, "train_tokens_per_second": 29197.912 }, { "epoch": 2.479921805721716, "grad_norm": 1.6015625, "learning_rate": 1.76678445229682e-05, "loss": 1.038547897338867, "num_input_tokens_seen": 19934580160, "step": 70090, "train_runtime": 682737.9695, "train_tokens_per_second": 29197.995 }, { "epoch": 2.4802756259854446, "grad_norm": 1.609375, "learning_rate": 1.7666741613069505e-05, "loss": 1.042399024963379, "num_input_tokens_seen": 19937440128, "step": 70100, "train_runtime": 682834.9493, "train_tokens_per_second": 29198.037 }, { "epoch": 2.4806294462491736, "grad_norm": 1.7109375, "learning_rate": 1.7665638909691484e-05, "loss": 1.0448123931884765, "num_input_tokens_seen": 19940313664, "step": 70110, "train_runtime": 682935.8255, "train_tokens_per_second": 29197.932 }, { "epoch": 2.480983266512902, "grad_norm": 1.59375, "learning_rate": 1.766453641276969e-05, "loss": 1.0446372985839845, "num_input_tokens_seen": 19943147776, "step": 70120, "train_runtime": 683034.3905, "train_tokens_per_second": 29197.868 }, { "epoch": 2.481337086776631, "grad_norm": 1.625, "learning_rate": 1.7663434122239723e-05, "loss": 1.0311466217041017, "num_input_tokens_seen": 19945951232, "step": 70130, "train_runtime": 683130.5559, "train_tokens_per_second": 29197.861 }, { "epoch": 2.4816909070403597, "grad_norm": 1.5703125, "learning_rate": 1.7662332038037176e-05, "loss": 1.0424449920654297, "num_input_tokens_seen": 19948818112, "step": 70140, "train_runtime": 683230.3647, "train_tokens_per_second": 29197.792 }, { "epoch": 2.4820447273040886, "grad_norm": 1.59375, "learning_rate": 1.76612301600977e-05, "loss": 1.047245407104492, "num_input_tokens_seen": 19951633920, "step": 70150, "train_runtime": 683324.8136, "train_tokens_per_second": 29197.877 }, { "epoch": 2.4823985475678176, "grad_norm": 1.5625, "learning_rate": 1.7660128488356968e-05, "loss": 1.0316501617431642, "num_input_tokens_seen": 19954501632, "step": 70160, "train_runtime": 683423.1756, "train_tokens_per_second": 29197.871 }, { "epoch": 2.482752367831546, "grad_norm": 1.6484375, "learning_rate": 1.7659027022750667e-05, "loss": 1.0387092590332032, "num_input_tokens_seen": 19957396288, "step": 70170, "train_runtime": 683522.8728, "train_tokens_per_second": 29197.847 }, { "epoch": 2.4831061880952747, "grad_norm": 1.6015625, "learning_rate": 1.765792576321452e-05, "loss": 1.0438535690307618, "num_input_tokens_seen": 19960188992, "step": 70180, "train_runtime": 683618.0569, "train_tokens_per_second": 29197.867 }, { "epoch": 2.4834600083590037, "grad_norm": 1.6171875, "learning_rate": 1.7656824709684287e-05, "loss": 1.0361352920532227, "num_input_tokens_seen": 19963016256, "step": 70190, "train_runtime": 683712.3143, "train_tokens_per_second": 29197.977 }, { "epoch": 2.4838138286227327, "grad_norm": 1.59375, "learning_rate": 1.765572386209575e-05, "loss": 1.0365182876586914, "num_input_tokens_seen": 19965854144, "step": 70200, "train_runtime": 683810.4899, "train_tokens_per_second": 29197.935 }, { "epoch": 2.4841676488864612, "grad_norm": 1.546875, "learning_rate": 1.7654623220384713e-05, "loss": 1.0543792724609375, "num_input_tokens_seen": 19968755072, "step": 70210, "train_runtime": 683910.2937, "train_tokens_per_second": 29197.916 }, { "epoch": 2.4845214691501902, "grad_norm": 1.5625, "learning_rate": 1.7653522784487014e-05, "loss": 1.0445202827453612, "num_input_tokens_seen": 19971626880, "step": 70220, "train_runtime": 684011.966, "train_tokens_per_second": 29197.774 }, { "epoch": 2.4848752894139188, "grad_norm": 1.6875, "learning_rate": 1.765242255433852e-05, "loss": 1.0328493118286133, "num_input_tokens_seen": 19974504704, "step": 70230, "train_runtime": 684110.0125, "train_tokens_per_second": 29197.796 }, { "epoch": 2.4852291096776478, "grad_norm": 1.640625, "learning_rate": 1.7651322529875126e-05, "loss": 1.048323631286621, "num_input_tokens_seen": 19977307968, "step": 70240, "train_runtime": 684205.2071, "train_tokens_per_second": 29197.831 }, { "epoch": 2.4855829299413763, "grad_norm": 1.6484375, "learning_rate": 1.7650222711032744e-05, "loss": 1.030902099609375, "num_input_tokens_seen": 19980154560, "step": 70250, "train_runtime": 684302.3924, "train_tokens_per_second": 29197.844 }, { "epoch": 2.4859367502051053, "grad_norm": 1.6484375, "learning_rate": 1.764912309774733e-05, "loss": 1.0417071342468263, "num_input_tokens_seen": 19982925312, "step": 70260, "train_runtime": 684394.7065, "train_tokens_per_second": 29197.954 }, { "epoch": 2.486290570468834, "grad_norm": 1.65625, "learning_rate": 1.764802368995486e-05, "loss": 1.041130828857422, "num_input_tokens_seen": 19985811008, "step": 70270, "train_runtime": 684492.5197, "train_tokens_per_second": 29197.998 }, { "epoch": 2.486644390732563, "grad_norm": 1.5859375, "learning_rate": 1.764692448759134e-05, "loss": 1.0390267372131348, "num_input_tokens_seen": 19988728576, "step": 70280, "train_runtime": 684592.6906, "train_tokens_per_second": 29197.987 }, { "epoch": 2.4869982109962914, "grad_norm": 1.6171875, "learning_rate": 1.7645825490592797e-05, "loss": 1.0377613067626954, "num_input_tokens_seen": 19991587584, "step": 70290, "train_runtime": 684693.9364, "train_tokens_per_second": 29197.845 }, { "epoch": 2.4873520312600204, "grad_norm": 1.609375, "learning_rate": 1.7644726698895296e-05, "loss": 1.0483118057250977, "num_input_tokens_seen": 19994424064, "step": 70300, "train_runtime": 684790.117, "train_tokens_per_second": 29197.886 }, { "epoch": 2.487705851523749, "grad_norm": 1.625, "learning_rate": 1.7643628112434918e-05, "loss": 1.0363382339477538, "num_input_tokens_seen": 19997281344, "step": 70310, "train_runtime": 684887.2003, "train_tokens_per_second": 29197.92 }, { "epoch": 2.488059671787478, "grad_norm": 1.5546875, "learning_rate": 1.764252973114779e-05, "loss": 1.0319355964660644, "num_input_tokens_seen": 20000128448, "step": 70320, "train_runtime": 684984.5186, "train_tokens_per_second": 29197.928 }, { "epoch": 2.4884134920512064, "grad_norm": 1.5703125, "learning_rate": 1.764143155497005e-05, "loss": 1.0354350090026856, "num_input_tokens_seen": 20002925120, "step": 70330, "train_runtime": 685079.2223, "train_tokens_per_second": 29197.974 }, { "epoch": 2.4887673123149354, "grad_norm": 1.6484375, "learning_rate": 1.7640333583837874e-05, "loss": 1.0348269462585449, "num_input_tokens_seen": 20005764160, "step": 70340, "train_runtime": 685176.8558, "train_tokens_per_second": 29197.957 }, { "epoch": 2.4891211325786644, "grad_norm": 1.5625, "learning_rate": 1.7639235817687455e-05, "loss": 1.0241846084594726, "num_input_tokens_seen": 20008615616, "step": 70350, "train_runtime": 685275.074, "train_tokens_per_second": 29197.933 }, { "epoch": 2.489474952842393, "grad_norm": 1.546875, "learning_rate": 1.7638138256455024e-05, "loss": 1.0346773147583008, "num_input_tokens_seen": 20011465024, "step": 70360, "train_runtime": 685372.3395, "train_tokens_per_second": 29197.947 }, { "epoch": 2.489828773106122, "grad_norm": 1.578125, "learning_rate": 1.7637040900076837e-05, "loss": 1.0406438827514648, "num_input_tokens_seen": 20014335744, "step": 70370, "train_runtime": 685469.813, "train_tokens_per_second": 29197.983 }, { "epoch": 2.4901825933698505, "grad_norm": 1.625, "learning_rate": 1.7635943748489174e-05, "loss": 1.0471635818481446, "num_input_tokens_seen": 20017177792, "step": 70380, "train_runtime": 685568.3659, "train_tokens_per_second": 29197.931 }, { "epoch": 2.4905364136335795, "grad_norm": 1.5390625, "learning_rate": 1.7634846801628348e-05, "loss": 1.021799087524414, "num_input_tokens_seen": 20020005760, "step": 70390, "train_runtime": 685664.1113, "train_tokens_per_second": 29197.978 }, { "epoch": 2.490890233897308, "grad_norm": 1.609375, "learning_rate": 1.7633750059430698e-05, "loss": 1.0402362823486329, "num_input_tokens_seen": 20022855936, "step": 70400, "train_runtime": 685761.1154, "train_tokens_per_second": 29198.004 }, { "epoch": 2.491244054161037, "grad_norm": 1.59375, "learning_rate": 1.763265352183259e-05, "loss": 1.044804573059082, "num_input_tokens_seen": 20025694464, "step": 70410, "train_runtime": 685855.2611, "train_tokens_per_second": 29198.135 }, { "epoch": 2.4915978744247655, "grad_norm": 1.5703125, "learning_rate": 1.7631557188770415e-05, "loss": 1.030923080444336, "num_input_tokens_seen": 20028502272, "step": 70420, "train_runtime": 685949.4533, "train_tokens_per_second": 29198.219 }, { "epoch": 2.4919516946884945, "grad_norm": 1.5703125, "learning_rate": 1.7630461060180593e-05, "loss": 1.0222898483276368, "num_input_tokens_seen": 20031350080, "step": 70430, "train_runtime": 686044.1223, "train_tokens_per_second": 29198.341 }, { "epoch": 2.492305514952223, "grad_norm": 1.5703125, "learning_rate": 1.762936513599958e-05, "loss": 1.033487606048584, "num_input_tokens_seen": 20034196416, "step": 70440, "train_runtime": 686143.2053, "train_tokens_per_second": 29198.273 }, { "epoch": 2.492659335215952, "grad_norm": 1.5234375, "learning_rate": 1.7628269416163852e-05, "loss": 1.0257003784179688, "num_input_tokens_seen": 20036979200, "step": 70450, "train_runtime": 686238.0707, "train_tokens_per_second": 29198.291 }, { "epoch": 2.4930131554796806, "grad_norm": 1.6328125, "learning_rate": 1.7627173900609905e-05, "loss": 1.0411569595336914, "num_input_tokens_seen": 20039828608, "step": 70460, "train_runtime": 686337.47, "train_tokens_per_second": 29198.214 }, { "epoch": 2.4933669757434096, "grad_norm": 1.609375, "learning_rate": 1.762607858927428e-05, "loss": 1.0392009735107421, "num_input_tokens_seen": 20042683840, "step": 70470, "train_runtime": 686434.4994, "train_tokens_per_second": 29198.247 }, { "epoch": 2.493720796007138, "grad_norm": 1.6171875, "learning_rate": 1.7624983482093533e-05, "loss": 1.0470592498779296, "num_input_tokens_seen": 20045562304, "step": 70480, "train_runtime": 686535.9857, "train_tokens_per_second": 29198.123 }, { "epoch": 2.494074616270867, "grad_norm": 1.6484375, "learning_rate": 1.762388857900425e-05, "loss": 1.0241777420043945, "num_input_tokens_seen": 20048406016, "step": 70490, "train_runtime": 686633.3673, "train_tokens_per_second": 29198.124 }, { "epoch": 2.494428436534596, "grad_norm": 1.6171875, "learning_rate": 1.762279387994305e-05, "loss": 1.0401315689086914, "num_input_tokens_seen": 20051217472, "step": 70500, "train_runtime": 686727.136, "train_tokens_per_second": 29198.231 }, { "epoch": 2.4947822567983247, "grad_norm": 1.65625, "learning_rate": 1.7621699384846572e-05, "loss": 1.0325753211975097, "num_input_tokens_seen": 20054047872, "step": 70510, "train_runtime": 686822.5113, "train_tokens_per_second": 29198.297 }, { "epoch": 2.495136077062053, "grad_norm": 1.5390625, "learning_rate": 1.7620605093651485e-05, "loss": 1.041620635986328, "num_input_tokens_seen": 20056927616, "step": 70520, "train_runtime": 686924.4465, "train_tokens_per_second": 29198.157 }, { "epoch": 2.495489897325782, "grad_norm": 1.5546875, "learning_rate": 1.761951100629449e-05, "loss": 1.034763717651367, "num_input_tokens_seen": 20059779904, "step": 70530, "train_runtime": 687022.1922, "train_tokens_per_second": 29198.154 }, { "epoch": 2.495843717589511, "grad_norm": 1.65625, "learning_rate": 1.7618417122712306e-05, "loss": 1.0382463455200195, "num_input_tokens_seen": 20062643328, "step": 70540, "train_runtime": 687119.9065, "train_tokens_per_second": 29198.169 }, { "epoch": 2.4961975378532397, "grad_norm": 1.5625, "learning_rate": 1.7617323442841694e-05, "loss": 1.0441109657287597, "num_input_tokens_seen": 20065479360, "step": 70550, "train_runtime": 687216.7542, "train_tokens_per_second": 29198.181 }, { "epoch": 2.4965513581169687, "grad_norm": 1.5859375, "learning_rate": 1.7616229966619426e-05, "loss": 1.0254087448120117, "num_input_tokens_seen": 20068353216, "step": 70560, "train_runtime": 687316.954, "train_tokens_per_second": 29198.106 }, { "epoch": 2.4969051783806973, "grad_norm": 1.5859375, "learning_rate": 1.7615136693982312e-05, "loss": 1.0500760078430176, "num_input_tokens_seen": 20071205120, "step": 70570, "train_runtime": 687417.1253, "train_tokens_per_second": 29198.0 }, { "epoch": 2.4972589986444262, "grad_norm": 1.6015625, "learning_rate": 1.761404362486719e-05, "loss": 1.039862823486328, "num_input_tokens_seen": 20073973632, "step": 70580, "train_runtime": 687510.4001, "train_tokens_per_second": 29198.065 }, { "epoch": 2.497612818908155, "grad_norm": 1.5859375, "learning_rate": 1.761295075921092e-05, "loss": 1.0207703590393067, "num_input_tokens_seen": 20076802560, "step": 70590, "train_runtime": 687608.2284, "train_tokens_per_second": 29198.025 }, { "epoch": 2.4979666391718838, "grad_norm": 1.625, "learning_rate": 1.761185809695039e-05, "loss": 1.0327105522155762, "num_input_tokens_seen": 20079634944, "step": 70600, "train_runtime": 687710.321, "train_tokens_per_second": 29197.81 }, { "epoch": 2.4983204594356123, "grad_norm": 1.53125, "learning_rate": 1.7610765638022518e-05, "loss": 1.03543062210083, "num_input_tokens_seen": 20082539520, "step": 70610, "train_runtime": 687812.0971, "train_tokens_per_second": 29197.712 }, { "epoch": 2.4986742796993413, "grad_norm": 1.734375, "learning_rate": 1.760967338236425e-05, "loss": 1.0199213981628419, "num_input_tokens_seen": 20085392384, "step": 70620, "train_runtime": 687909.1177, "train_tokens_per_second": 29197.741 }, { "epoch": 2.49902809996307, "grad_norm": 1.65625, "learning_rate": 1.7608581329912554e-05, "loss": 1.0372910499572754, "num_input_tokens_seen": 20088244544, "step": 70630, "train_runtime": 688006.1822, "train_tokens_per_second": 29197.767 }, { "epoch": 2.499381920226799, "grad_norm": 1.6171875, "learning_rate": 1.7607489480604435e-05, "loss": 1.0385788917541503, "num_input_tokens_seen": 20091088832, "step": 70640, "train_runtime": 688104.2388, "train_tokens_per_second": 29197.74 }, { "epoch": 2.4997357404905274, "grad_norm": 1.59375, "learning_rate": 1.760639783437692e-05, "loss": 1.037490463256836, "num_input_tokens_seen": 20093947968, "step": 70650, "train_runtime": 688203.229, "train_tokens_per_second": 29197.695 }, { "epoch": 2.5000895607542564, "grad_norm": 1.578125, "learning_rate": 1.7605306391167054e-05, "loss": 1.031712245941162, "num_input_tokens_seen": 20096796864, "step": 70660, "train_runtime": 688302.7, "train_tokens_per_second": 29197.614 }, { "epoch": 2.500443381017985, "grad_norm": 1.59375, "learning_rate": 1.7604215150911924e-05, "loss": 1.034970760345459, "num_input_tokens_seen": 20099653888, "step": 70670, "train_runtime": 688402.7513, "train_tokens_per_second": 29197.521 }, { "epoch": 2.500797201281714, "grad_norm": 1.671875, "learning_rate": 1.7603124113548636e-05, "loss": 1.0453186988830567, "num_input_tokens_seen": 20102535744, "step": 70680, "train_runtime": 688503.4902, "train_tokens_per_second": 29197.435 }, { "epoch": 2.501151021545443, "grad_norm": 1.578125, "learning_rate": 1.7602033279014336e-05, "loss": 1.0359989166259767, "num_input_tokens_seen": 20105282176, "step": 70690, "train_runtime": 688595.7878, "train_tokens_per_second": 29197.51 }, { "epoch": 2.5015048418091714, "grad_norm": 1.6484375, "learning_rate": 1.7600942647246167e-05, "loss": 1.0444388389587402, "num_input_tokens_seen": 20108109184, "step": 70700, "train_runtime": 688693.2213, "train_tokens_per_second": 29197.484 }, { "epoch": 2.5018586620729, "grad_norm": 1.6171875, "learning_rate": 1.759985221818134e-05, "loss": 1.0374637603759767, "num_input_tokens_seen": 20110959168, "step": 70710, "train_runtime": 688788.0572, "train_tokens_per_second": 29197.601 }, { "epoch": 2.502212482336629, "grad_norm": 1.6796875, "learning_rate": 1.7598761991757063e-05, "loss": 1.0434428215026856, "num_input_tokens_seen": 20113792832, "step": 70720, "train_runtime": 688882.5548, "train_tokens_per_second": 29197.71 }, { "epoch": 2.502566302600358, "grad_norm": 1.59375, "learning_rate": 1.7597671967910576e-05, "loss": 1.018665885925293, "num_input_tokens_seen": 20116706048, "step": 70730, "train_runtime": 688984.1147, "train_tokens_per_second": 29197.634 }, { "epoch": 2.5029201228640865, "grad_norm": 1.5625, "learning_rate": 1.7596582146579158e-05, "loss": 1.0275723457336425, "num_input_tokens_seen": 20119553664, "step": 70740, "train_runtime": 689082.6994, "train_tokens_per_second": 29197.589 }, { "epoch": 2.5032739431278155, "grad_norm": 1.59375, "learning_rate": 1.7595492527700113e-05, "loss": 1.030484390258789, "num_input_tokens_seen": 20122383680, "step": 70750, "train_runtime": 689180.5165, "train_tokens_per_second": 29197.552 }, { "epoch": 2.503627763391544, "grad_norm": 1.5859375, "learning_rate": 1.7594403111210754e-05, "loss": 1.041122817993164, "num_input_tokens_seen": 20125241664, "step": 70760, "train_runtime": 689277.4017, "train_tokens_per_second": 29197.594 }, { "epoch": 2.503981583655273, "grad_norm": 1.625, "learning_rate": 1.759331389704844e-05, "loss": 1.0335031509399415, "num_input_tokens_seen": 20128067520, "step": 70770, "train_runtime": 689372.5785, "train_tokens_per_second": 29197.662 }, { "epoch": 2.5043354039190016, "grad_norm": 1.6015625, "learning_rate": 1.7592224885150554e-05, "loss": 1.03505859375, "num_input_tokens_seen": 20130945472, "step": 70780, "train_runtime": 689469.667, "train_tokens_per_second": 29197.725 }, { "epoch": 2.5046892241827305, "grad_norm": 1.6328125, "learning_rate": 1.7591136075454505e-05, "loss": 1.038192367553711, "num_input_tokens_seen": 20133811840, "step": 70790, "train_runtime": 689568.1758, "train_tokens_per_second": 29197.71 }, { "epoch": 2.505043044446459, "grad_norm": 1.5390625, "learning_rate": 1.759004746789772e-05, "loss": 1.0300588607788086, "num_input_tokens_seen": 20136662016, "step": 70800, "train_runtime": 689665.4817, "train_tokens_per_second": 29197.723 }, { "epoch": 2.505396864710188, "grad_norm": 1.59375, "learning_rate": 1.7588959062417677e-05, "loss": 1.0384530067443847, "num_input_tokens_seen": 20139489600, "step": 70810, "train_runtime": 689761.3083, "train_tokens_per_second": 29197.766 }, { "epoch": 2.5057506849739166, "grad_norm": 1.5703125, "learning_rate": 1.7587870858951845e-05, "loss": 1.0325246810913087, "num_input_tokens_seen": 20142356672, "step": 70820, "train_runtime": 689859.2127, "train_tokens_per_second": 29197.779 }, { "epoch": 2.5061045052376456, "grad_norm": 1.6171875, "learning_rate": 1.7586782857437747e-05, "loss": 1.045950698852539, "num_input_tokens_seen": 20145186560, "step": 70830, "train_runtime": 689956.5574, "train_tokens_per_second": 29197.761 }, { "epoch": 2.5064583255013746, "grad_norm": 1.59375, "learning_rate": 1.7585695057812936e-05, "loss": 1.0364270210266113, "num_input_tokens_seen": 20148037056, "step": 70840, "train_runtime": 690056.3917, "train_tokens_per_second": 29197.667 }, { "epoch": 2.506812145765103, "grad_norm": 1.6484375, "learning_rate": 1.7584607460014974e-05, "loss": 1.0485967636108398, "num_input_tokens_seen": 20150856640, "step": 70850, "train_runtime": 690154.6411, "train_tokens_per_second": 29197.596 }, { "epoch": 2.5071659660288317, "grad_norm": 1.59375, "learning_rate": 1.7583520063981454e-05, "loss": 1.046253490447998, "num_input_tokens_seen": 20153722560, "step": 70860, "train_runtime": 690251.6926, "train_tokens_per_second": 29197.643 }, { "epoch": 2.5075197862925607, "grad_norm": 1.609375, "learning_rate": 1.7582432869650005e-05, "loss": 1.0410200119018556, "num_input_tokens_seen": 20156559872, "step": 70870, "train_runtime": 690350.5954, "train_tokens_per_second": 29197.57 }, { "epoch": 2.5078736065562897, "grad_norm": 1.625, "learning_rate": 1.7581345876958283e-05, "loss": 1.048954391479492, "num_input_tokens_seen": 20159407296, "step": 70880, "train_runtime": 690448.3527, "train_tokens_per_second": 29197.56 }, { "epoch": 2.508227426820018, "grad_norm": 1.5703125, "learning_rate": 1.758025908584396e-05, "loss": 1.0226085662841797, "num_input_tokens_seen": 20162231168, "step": 70890, "train_runtime": 690546.054, "train_tokens_per_second": 29197.518 }, { "epoch": 2.508581247083747, "grad_norm": 1.6171875, "learning_rate": 1.7579172496244738e-05, "loss": 1.0261170387268066, "num_input_tokens_seen": 20165083776, "step": 70900, "train_runtime": 690641.5897, "train_tokens_per_second": 29197.61 }, { "epoch": 2.5089350673474757, "grad_norm": 1.578125, "learning_rate": 1.7578086108098357e-05, "loss": 1.0440559387207031, "num_input_tokens_seen": 20167938752, "step": 70910, "train_runtime": 690736.6927, "train_tokens_per_second": 29197.723 }, { "epoch": 2.5092888876112047, "grad_norm": 1.5546875, "learning_rate": 1.7576999921342574e-05, "loss": 1.0330398559570313, "num_input_tokens_seen": 20170824000, "step": 70920, "train_runtime": 690836.1298, "train_tokens_per_second": 29197.697 }, { "epoch": 2.5096427078749333, "grad_norm": 1.5703125, "learning_rate": 1.757591393591517e-05, "loss": 1.0293724060058593, "num_input_tokens_seen": 20173757184, "step": 70930, "train_runtime": 690940.234, "train_tokens_per_second": 29197.543 }, { "epoch": 2.5099965281386623, "grad_norm": 1.65625, "learning_rate": 1.757482815175397e-05, "loss": 1.0517236709594726, "num_input_tokens_seen": 20176624384, "step": 70940, "train_runtime": 691041.2118, "train_tokens_per_second": 29197.426 }, { "epoch": 2.510350348402391, "grad_norm": 1.6015625, "learning_rate": 1.7573742568796796e-05, "loss": 1.0335943222045898, "num_input_tokens_seen": 20179397632, "step": 70950, "train_runtime": 691131.318, "train_tokens_per_second": 29197.632 }, { "epoch": 2.51070416866612, "grad_norm": 1.6328125, "learning_rate": 1.7572657186981528e-05, "loss": 1.027177619934082, "num_input_tokens_seen": 20182239744, "step": 70960, "train_runtime": 691227.3914, "train_tokens_per_second": 29197.685 }, { "epoch": 2.5110579889298483, "grad_norm": 1.640625, "learning_rate": 1.7571572006246058e-05, "loss": 1.03250150680542, "num_input_tokens_seen": 20185052096, "step": 70970, "train_runtime": 691323.8023, "train_tokens_per_second": 29197.681 }, { "epoch": 2.5114118091935773, "grad_norm": 1.625, "learning_rate": 1.7570487026528298e-05, "loss": 1.0265772819519043, "num_input_tokens_seen": 20187876608, "step": 70980, "train_runtime": 691417.697, "train_tokens_per_second": 29197.801 }, { "epoch": 2.5117656294573063, "grad_norm": 1.6484375, "learning_rate": 1.7569402247766204e-05, "loss": 1.0365100860595704, "num_input_tokens_seen": 20190655872, "step": 70990, "train_runtime": 691514.2284, "train_tokens_per_second": 29197.745 }, { "epoch": 2.512119449721035, "grad_norm": 1.6328125, "learning_rate": 1.756831766989775e-05, "loss": 1.0467074394226075, "num_input_tokens_seen": 20193493696, "step": 71000, "train_runtime": 691609.6931, "train_tokens_per_second": 29197.818 }, { "epoch": 2.5124732699847634, "grad_norm": 1.640625, "learning_rate": 1.7567233292860927e-05, "loss": 1.0239517211914062, "num_input_tokens_seen": 20196396096, "step": 71010, "train_runtime": 691709.8686, "train_tokens_per_second": 29197.785 }, { "epoch": 2.5128270902484924, "grad_norm": 1.65625, "learning_rate": 1.7566149116593772e-05, "loss": 1.050065040588379, "num_input_tokens_seen": 20199170688, "step": 71020, "train_runtime": 691801.7534, "train_tokens_per_second": 29197.918 }, { "epoch": 2.5131809105122214, "grad_norm": 1.59375, "learning_rate": 1.7565065141034336e-05, "loss": 1.0370341300964356, "num_input_tokens_seen": 20202050368, "step": 71030, "train_runtime": 691901.4207, "train_tokens_per_second": 29197.874 }, { "epoch": 2.51353473077595, "grad_norm": 1.59375, "learning_rate": 1.7563981366120702e-05, "loss": 1.0450572967529297, "num_input_tokens_seen": 20204947520, "step": 71040, "train_runtime": 692005.6867, "train_tokens_per_second": 29197.661 }, { "epoch": 2.5138885510396785, "grad_norm": 1.6015625, "learning_rate": 1.7562897791790976e-05, "loss": 1.0492069244384765, "num_input_tokens_seen": 20207766720, "step": 71050, "train_runtime": 692101.2889, "train_tokens_per_second": 29197.701 }, { "epoch": 2.5142423713034074, "grad_norm": 1.6796875, "learning_rate": 1.7561814417983292e-05, "loss": 1.042871856689453, "num_input_tokens_seen": 20210606912, "step": 71060, "train_runtime": 692196.8092, "train_tokens_per_second": 29197.775 }, { "epoch": 2.5145961915671364, "grad_norm": 1.6015625, "learning_rate": 1.756073124463581e-05, "loss": 1.0326969146728515, "num_input_tokens_seen": 20213471168, "step": 71070, "train_runtime": 692296.938, "train_tokens_per_second": 29197.69 }, { "epoch": 2.514950011830865, "grad_norm": 1.65625, "learning_rate": 1.7559648271686728e-05, "loss": 1.037348747253418, "num_input_tokens_seen": 20216309632, "step": 71080, "train_runtime": 692392.5679, "train_tokens_per_second": 29197.757 }, { "epoch": 2.515303832094594, "grad_norm": 1.6171875, "learning_rate": 1.7558565499074244e-05, "loss": 1.0345145225524903, "num_input_tokens_seen": 20219150528, "step": 71090, "train_runtime": 692489.3643, "train_tokens_per_second": 29197.778 }, { "epoch": 2.5156576523583225, "grad_norm": 1.609375, "learning_rate": 1.7557482926736613e-05, "loss": 1.0384387969970703, "num_input_tokens_seen": 20221969920, "step": 71100, "train_runtime": 692586.6985, "train_tokens_per_second": 29197.745 }, { "epoch": 2.5160114726220515, "grad_norm": 1.5703125, "learning_rate": 1.7556400554612095e-05, "loss": 1.0301805496215821, "num_input_tokens_seen": 20224859456, "step": 71110, "train_runtime": 692685.5132, "train_tokens_per_second": 29197.751 }, { "epoch": 2.51636529288578, "grad_norm": 1.59375, "learning_rate": 1.755531838263899e-05, "loss": 1.036323070526123, "num_input_tokens_seen": 20227731328, "step": 71120, "train_runtime": 692783.2792, "train_tokens_per_second": 29197.776 }, { "epoch": 2.516719113149509, "grad_norm": 1.6953125, "learning_rate": 1.7554236410755618e-05, "loss": 1.0391746520996095, "num_input_tokens_seen": 20230561728, "step": 71130, "train_runtime": 692879.5892, "train_tokens_per_second": 29197.803 }, { "epoch": 2.517072933413238, "grad_norm": 1.6640625, "learning_rate": 1.7553154638900324e-05, "loss": 1.0417469024658204, "num_input_tokens_seen": 20233369024, "step": 71140, "train_runtime": 692975.0718, "train_tokens_per_second": 29197.831 }, { "epoch": 2.5174267536769666, "grad_norm": 1.59375, "learning_rate": 1.755207306701148e-05, "loss": 1.048625373840332, "num_input_tokens_seen": 20236241920, "step": 71150, "train_runtime": 693074.1408, "train_tokens_per_second": 29197.803 }, { "epoch": 2.517780573940695, "grad_norm": 1.6640625, "learning_rate": 1.7550991695027495e-05, "loss": 1.0389785766601562, "num_input_tokens_seen": 20239093888, "step": 71160, "train_runtime": 693170.0446, "train_tokens_per_second": 29197.877 }, { "epoch": 2.518134394204424, "grad_norm": 1.6015625, "learning_rate": 1.754991052288679e-05, "loss": 1.03898286819458, "num_input_tokens_seen": 20241943488, "step": 71170, "train_runtime": 693266.0725, "train_tokens_per_second": 29197.943 }, { "epoch": 2.518488214468153, "grad_norm": 1.59375, "learning_rate": 1.7548829550527827e-05, "loss": 1.031207275390625, "num_input_tokens_seen": 20244810752, "step": 71180, "train_runtime": 693362.913, "train_tokens_per_second": 29198.001 }, { "epoch": 2.5188420347318816, "grad_norm": 1.6875, "learning_rate": 1.7547748777889075e-05, "loss": 1.0265087127685546, "num_input_tokens_seen": 20247703104, "step": 71190, "train_runtime": 693463.2856, "train_tokens_per_second": 29197.945 }, { "epoch": 2.51919585499561, "grad_norm": 1.6015625, "learning_rate": 1.7546668204909052e-05, "loss": 1.0409708976745606, "num_input_tokens_seen": 20250545472, "step": 71200, "train_runtime": 693561.4509, "train_tokens_per_second": 29197.911 }, { "epoch": 2.519549675259339, "grad_norm": 1.6015625, "learning_rate": 1.7545587831526283e-05, "loss": 1.0401552200317383, "num_input_tokens_seen": 20253413440, "step": 71210, "train_runtime": 693660.6938, "train_tokens_per_second": 29197.868 }, { "epoch": 2.519903495523068, "grad_norm": 1.578125, "learning_rate": 1.7544507657679332e-05, "loss": 1.0350618362426758, "num_input_tokens_seen": 20256302592, "step": 71220, "train_runtime": 693760.1123, "train_tokens_per_second": 29197.848 }, { "epoch": 2.5202573157867967, "grad_norm": 1.59375, "learning_rate": 1.754342768330679e-05, "loss": 1.0174758911132813, "num_input_tokens_seen": 20259174336, "step": 71230, "train_runtime": 693858.6305, "train_tokens_per_second": 29197.842 }, { "epoch": 2.5206111360505257, "grad_norm": 1.6015625, "learning_rate": 1.7542347908347262e-05, "loss": 1.0332990646362306, "num_input_tokens_seen": 20262036224, "step": 71240, "train_runtime": 693957.5386, "train_tokens_per_second": 29197.804 }, { "epoch": 2.520964956314254, "grad_norm": 1.609375, "learning_rate": 1.7541268332739394e-05, "loss": 1.0180647850036622, "num_input_tokens_seen": 20264869056, "step": 71250, "train_runtime": 694056.5769, "train_tokens_per_second": 29197.719 }, { "epoch": 2.521318776577983, "grad_norm": 1.6484375, "learning_rate": 1.7540188956421847e-05, "loss": 1.0314628601074218, "num_input_tokens_seen": 20267714688, "step": 71260, "train_runtime": 694152.4908, "train_tokens_per_second": 29197.784 }, { "epoch": 2.5216725968417117, "grad_norm": 1.6171875, "learning_rate": 1.7539109779333315e-05, "loss": 1.0321144104003905, "num_input_tokens_seen": 20270540288, "step": 71270, "train_runtime": 694249.3057, "train_tokens_per_second": 29197.783 }, { "epoch": 2.5220264171054407, "grad_norm": 1.5625, "learning_rate": 1.753803080141252e-05, "loss": 1.0246649742126466, "num_input_tokens_seen": 20273355968, "step": 71280, "train_runtime": 694343.0262, "train_tokens_per_second": 29197.897 }, { "epoch": 2.5223802373691693, "grad_norm": 1.5390625, "learning_rate": 1.7536952022598202e-05, "loss": 1.0357545852661132, "num_input_tokens_seen": 20276167552, "step": 71290, "train_runtime": 694439.6762, "train_tokens_per_second": 29197.882 }, { "epoch": 2.5227340576328983, "grad_norm": 1.6328125, "learning_rate": 1.7535873442829135e-05, "loss": 1.0417398452758788, "num_input_tokens_seen": 20278973056, "step": 71300, "train_runtime": 694534.2772, "train_tokens_per_second": 29197.944 }, { "epoch": 2.523087877896627, "grad_norm": 1.6171875, "learning_rate": 1.753479506204412e-05, "loss": 1.0368605613708497, "num_input_tokens_seen": 20281819072, "step": 71310, "train_runtime": 694629.4611, "train_tokens_per_second": 29198.04 }, { "epoch": 2.523441698160356, "grad_norm": 1.6484375, "learning_rate": 1.7533716880181973e-05, "loss": 1.0197439193725586, "num_input_tokens_seen": 20284649920, "step": 71320, "train_runtime": 694724.8197, "train_tokens_per_second": 29198.107 }, { "epoch": 2.523795518424085, "grad_norm": 1.6640625, "learning_rate": 1.753263889718155e-05, "loss": 1.0345342636108399, "num_input_tokens_seen": 20287518336, "step": 71330, "train_runtime": 694825.9001, "train_tokens_per_second": 29197.988 }, { "epoch": 2.5241493386878133, "grad_norm": 1.6328125, "learning_rate": 1.753156111298173e-05, "loss": 1.0333967208862305, "num_input_tokens_seen": 20290399488, "step": 71340, "train_runtime": 694923.6986, "train_tokens_per_second": 29198.025 }, { "epoch": 2.524503158951542, "grad_norm": 1.5625, "learning_rate": 1.7530483527521414e-05, "loss": 1.0378395080566407, "num_input_tokens_seen": 20293213312, "step": 71350, "train_runtime": 695018.5855, "train_tokens_per_second": 29198.087 }, { "epoch": 2.524856979215271, "grad_norm": 1.6796875, "learning_rate": 1.752940614073953e-05, "loss": 1.040757942199707, "num_input_tokens_seen": 20295999424, "step": 71360, "train_runtime": 695114.8837, "train_tokens_per_second": 29198.05 }, { "epoch": 2.525210799479, "grad_norm": 1.6015625, "learning_rate": 1.752832895257503e-05, "loss": 1.0367169380187988, "num_input_tokens_seen": 20298866944, "step": 71370, "train_runtime": 695213.6236, "train_tokens_per_second": 29198.028 }, { "epoch": 2.5255646197427284, "grad_norm": 1.5703125, "learning_rate": 1.752725196296691e-05, "loss": 1.0465580940246582, "num_input_tokens_seen": 20301717888, "step": 71380, "train_runtime": 695309.5151, "train_tokens_per_second": 29198.102 }, { "epoch": 2.5259184400064574, "grad_norm": 1.609375, "learning_rate": 1.7526175171854162e-05, "loss": 1.0258728981018066, "num_input_tokens_seen": 20304618112, "step": 71390, "train_runtime": 695409.6758, "train_tokens_per_second": 29198.067 }, { "epoch": 2.526272260270186, "grad_norm": 1.6328125, "learning_rate": 1.7525098579175827e-05, "loss": 1.041765022277832, "num_input_tokens_seen": 20307481920, "step": 71400, "train_runtime": 695511.0265, "train_tokens_per_second": 29197.93 }, { "epoch": 2.526626080533915, "grad_norm": 1.59375, "learning_rate": 1.752402218487097e-05, "loss": 1.028568649291992, "num_input_tokens_seen": 20310337024, "step": 71410, "train_runtime": 695607.5728, "train_tokens_per_second": 29197.981 }, { "epoch": 2.5269799007976435, "grad_norm": 1.546875, "learning_rate": 1.752294598887867e-05, "loss": 1.0274955749511718, "num_input_tokens_seen": 20313203264, "step": 71420, "train_runtime": 695703.2562, "train_tokens_per_second": 29198.086 }, { "epoch": 2.5273337210613724, "grad_norm": 1.6171875, "learning_rate": 1.7521869991138047e-05, "loss": 1.0215212821960449, "num_input_tokens_seen": 20316021696, "step": 71430, "train_runtime": 695799.3673, "train_tokens_per_second": 29198.103 }, { "epoch": 2.527687541325101, "grad_norm": 1.6171875, "learning_rate": 1.7520794191588235e-05, "loss": 1.0449066162109375, "num_input_tokens_seen": 20318850752, "step": 71440, "train_runtime": 695893.1669, "train_tokens_per_second": 29198.233 }, { "epoch": 2.52804136158883, "grad_norm": 1.578125, "learning_rate": 1.75197185901684e-05, "loss": 1.0238967895507813, "num_input_tokens_seen": 20321689920, "step": 71450, "train_runtime": 695989.4692, "train_tokens_per_second": 29198.272 }, { "epoch": 2.5283951818525585, "grad_norm": 1.65625, "learning_rate": 1.7518643186817734e-05, "loss": 1.0428394317626952, "num_input_tokens_seen": 20324493056, "step": 71460, "train_runtime": 696084.2421, "train_tokens_per_second": 29198.324 }, { "epoch": 2.5287490021162875, "grad_norm": 1.59375, "learning_rate": 1.751756798147546e-05, "loss": 1.0362817764282226, "num_input_tokens_seen": 20327357952, "step": 71470, "train_runtime": 696182.1634, "train_tokens_per_second": 29198.332 }, { "epoch": 2.5291028223800165, "grad_norm": 1.5859375, "learning_rate": 1.7516492974080814e-05, "loss": 1.0162363052368164, "num_input_tokens_seen": 20330247104, "step": 71480, "train_runtime": 696282.0954, "train_tokens_per_second": 29198.291 }, { "epoch": 2.529456642643745, "grad_norm": 1.59375, "learning_rate": 1.7515418164573068e-05, "loss": 1.036035919189453, "num_input_tokens_seen": 20333112576, "step": 71490, "train_runtime": 696380.349, "train_tokens_per_second": 29198.286 }, { "epoch": 2.5298104629074736, "grad_norm": 1.640625, "learning_rate": 1.751434355289152e-05, "loss": 1.0453762054443358, "num_input_tokens_seen": 20335925760, "step": 71500, "train_runtime": 696473.5825, "train_tokens_per_second": 29198.417 }, { "epoch": 2.5301642831712026, "grad_norm": 1.6328125, "learning_rate": 1.751326913897549e-05, "loss": 1.032444667816162, "num_input_tokens_seen": 20338758848, "step": 71510, "train_runtime": 696570.6248, "train_tokens_per_second": 29198.416 }, { "epoch": 2.5305181034349316, "grad_norm": 1.625, "learning_rate": 1.751219492276433e-05, "loss": 1.0384626388549805, "num_input_tokens_seen": 20341625664, "step": 71520, "train_runtime": 696667.9121, "train_tokens_per_second": 29198.454 }, { "epoch": 2.53087192369866, "grad_norm": 1.640625, "learning_rate": 1.7511120904197406e-05, "loss": 1.0360041618347169, "num_input_tokens_seen": 20344459520, "step": 71530, "train_runtime": 696764.6947, "train_tokens_per_second": 29198.465 }, { "epoch": 2.5312257439623886, "grad_norm": 1.6015625, "learning_rate": 1.7510047083214125e-05, "loss": 1.035093116760254, "num_input_tokens_seen": 20347315264, "step": 71540, "train_runtime": 696860.2285, "train_tokens_per_second": 29198.56 }, { "epoch": 2.5315795642261176, "grad_norm": 1.5703125, "learning_rate": 1.750897345975391e-05, "loss": 1.0355972290039062, "num_input_tokens_seen": 20350156416, "step": 71550, "train_runtime": 696958.1486, "train_tokens_per_second": 29198.534 }, { "epoch": 2.5319333844898466, "grad_norm": 1.625, "learning_rate": 1.7507900033756213e-05, "loss": 1.0303318977355957, "num_input_tokens_seen": 20352940096, "step": 71560, "train_runtime": 697051.7122, "train_tokens_per_second": 29198.609 }, { "epoch": 2.532287204753575, "grad_norm": 1.703125, "learning_rate": 1.750682680516052e-05, "loss": 1.0332200050354003, "num_input_tokens_seen": 20355880000, "step": 71570, "train_runtime": 697153.9754, "train_tokens_per_second": 29198.543 }, { "epoch": 2.532641025017304, "grad_norm": 1.6796875, "learning_rate": 1.7505753773906322e-05, "loss": 1.033493995666504, "num_input_tokens_seen": 20358729344, "step": 71580, "train_runtime": 697253.7571, "train_tokens_per_second": 29198.451 }, { "epoch": 2.5329948452810327, "grad_norm": 1.5703125, "learning_rate": 1.7504680939933153e-05, "loss": 1.043874740600586, "num_input_tokens_seen": 20361543488, "step": 71590, "train_runtime": 697348.8601, "train_tokens_per_second": 29198.504 }, { "epoch": 2.5333486655447617, "grad_norm": 1.609375, "learning_rate": 1.7503608303180574e-05, "loss": 1.0362807273864747, "num_input_tokens_seen": 20364404352, "step": 71600, "train_runtime": 697448.279, "train_tokens_per_second": 29198.444 }, { "epoch": 2.5337024858084902, "grad_norm": 1.5625, "learning_rate": 1.7502535863588165e-05, "loss": 1.0355775833129883, "num_input_tokens_seen": 20367230016, "step": 71610, "train_runtime": 697543.862, "train_tokens_per_second": 29198.494 }, { "epoch": 2.534056306072219, "grad_norm": 1.578125, "learning_rate": 1.7501463621095532e-05, "loss": 1.0407910346984863, "num_input_tokens_seen": 20370069696, "step": 71620, "train_runtime": 697644.366, "train_tokens_per_second": 29198.358 }, { "epoch": 2.5344101263359478, "grad_norm": 1.65625, "learning_rate": 1.7500391575642305e-05, "loss": 1.0467127799987792, "num_input_tokens_seen": 20372935360, "step": 71630, "train_runtime": 697742.5803, "train_tokens_per_second": 29198.355 }, { "epoch": 2.5347639465996767, "grad_norm": 1.5703125, "learning_rate": 1.7499319727168155e-05, "loss": 1.025866413116455, "num_input_tokens_seen": 20375760320, "step": 71640, "train_runtime": 697840.8651, "train_tokens_per_second": 29198.291 }, { "epoch": 2.5351177668634053, "grad_norm": 1.5390625, "learning_rate": 1.7498248075612753e-05, "loss": 1.0277240753173829, "num_input_tokens_seen": 20378570176, "step": 71650, "train_runtime": 697935.5514, "train_tokens_per_second": 29198.355 }, { "epoch": 2.5354715871271343, "grad_norm": 1.6328125, "learning_rate": 1.749717662091582e-05, "loss": 1.0335241317749024, "num_input_tokens_seen": 20381461056, "step": 71660, "train_runtime": 698032.6602, "train_tokens_per_second": 29198.435 }, { "epoch": 2.5358254073908633, "grad_norm": 1.6015625, "learning_rate": 1.749610536301709e-05, "loss": 1.041363525390625, "num_input_tokens_seen": 20384278976, "step": 71670, "train_runtime": 698128.7666, "train_tokens_per_second": 29198.452 }, { "epoch": 2.536179227654592, "grad_norm": 1.625, "learning_rate": 1.749503430185633e-05, "loss": 1.0340948104858398, "num_input_tokens_seen": 20387070080, "step": 71680, "train_runtime": 698226.0531, "train_tokens_per_second": 29198.381 }, { "epoch": 2.5365330479183203, "grad_norm": 1.5546875, "learning_rate": 1.749396343737332e-05, "loss": 1.042078399658203, "num_input_tokens_seen": 20389926656, "step": 71690, "train_runtime": 698325.7759, "train_tokens_per_second": 29198.302 }, { "epoch": 2.5368868681820493, "grad_norm": 1.65625, "learning_rate": 1.7492892769507885e-05, "loss": 1.0463653564453126, "num_input_tokens_seen": 20392709184, "step": 71700, "train_runtime": 698419.739, "train_tokens_per_second": 29198.357 }, { "epoch": 2.5372406884457783, "grad_norm": 1.5859375, "learning_rate": 1.7491822298199854e-05, "loss": 1.0376474380493164, "num_input_tokens_seen": 20395600960, "step": 71710, "train_runtime": 698520.7792, "train_tokens_per_second": 29198.274 }, { "epoch": 2.537594508709507, "grad_norm": 1.5859375, "learning_rate": 1.74907520233891e-05, "loss": 1.025615119934082, "num_input_tokens_seen": 20398470400, "step": 71720, "train_runtime": 698620.1, "train_tokens_per_second": 29198.23 }, { "epoch": 2.537948328973236, "grad_norm": 1.6328125, "learning_rate": 1.7489681945015517e-05, "loss": 1.0429603576660156, "num_input_tokens_seen": 20401296832, "step": 71730, "train_runtime": 698715.3157, "train_tokens_per_second": 29198.296 }, { "epoch": 2.5383021492369644, "grad_norm": 1.609375, "learning_rate": 1.7488612063019018e-05, "loss": 1.0396735191345214, "num_input_tokens_seen": 20404107264, "step": 71740, "train_runtime": 698809.5712, "train_tokens_per_second": 29198.38 }, { "epoch": 2.5386559695006934, "grad_norm": 1.6484375, "learning_rate": 1.7487542377339547e-05, "loss": 1.0324188232421876, "num_input_tokens_seen": 20406953792, "step": 71750, "train_runtime": 698905.7766, "train_tokens_per_second": 29198.433 }, { "epoch": 2.539009789764422, "grad_norm": 1.6171875, "learning_rate": 1.7486472887917072e-05, "loss": 1.0397804260253907, "num_input_tokens_seen": 20409816768, "step": 71760, "train_runtime": 699003.6728, "train_tokens_per_second": 29198.44 }, { "epoch": 2.539363610028151, "grad_norm": 1.609375, "learning_rate": 1.7485403594691592e-05, "loss": 1.0357054710388183, "num_input_tokens_seen": 20412693888, "step": 71770, "train_runtime": 699103.5315, "train_tokens_per_second": 29198.385 }, { "epoch": 2.5397174302918795, "grad_norm": 1.640625, "learning_rate": 1.7484334497603126e-05, "loss": 1.0205920219421387, "num_input_tokens_seen": 20415487872, "step": 71780, "train_runtime": 699199.0802, "train_tokens_per_second": 29198.391 }, { "epoch": 2.5400712505556085, "grad_norm": 1.6640625, "learning_rate": 1.7483265596591712e-05, "loss": 1.036037540435791, "num_input_tokens_seen": 20418321472, "step": 71790, "train_runtime": 699295.499, "train_tokens_per_second": 29198.417 }, { "epoch": 2.540425070819337, "grad_norm": 1.6015625, "learning_rate": 1.7482196891597433e-05, "loss": 1.0330844879150392, "num_input_tokens_seen": 20421154816, "step": 71800, "train_runtime": 699391.5602, "train_tokens_per_second": 29198.458 }, { "epoch": 2.540778891083066, "grad_norm": 1.578125, "learning_rate": 1.7481128382560382e-05, "loss": 1.0288825035095215, "num_input_tokens_seen": 20423964608, "step": 71810, "train_runtime": 699490.3043, "train_tokens_per_second": 29198.353 }, { "epoch": 2.541132711346795, "grad_norm": 1.515625, "learning_rate": 1.748006006942068e-05, "loss": 1.0379628181457519, "num_input_tokens_seen": 20426861632, "step": 71820, "train_runtime": 699589.3987, "train_tokens_per_second": 29198.358 }, { "epoch": 2.5414865316105235, "grad_norm": 1.6640625, "learning_rate": 1.7478991952118476e-05, "loss": 1.0244562149047851, "num_input_tokens_seen": 20429681792, "step": 71830, "train_runtime": 699685.192, "train_tokens_per_second": 29198.391 }, { "epoch": 2.541840351874252, "grad_norm": 1.703125, "learning_rate": 1.747792403059395e-05, "loss": 1.0292970657348632, "num_input_tokens_seen": 20432497280, "step": 71840, "train_runtime": 699779.7054, "train_tokens_per_second": 29198.471 }, { "epoch": 2.542194172137981, "grad_norm": 1.671875, "learning_rate": 1.747685630478729e-05, "loss": 1.0418409347534179, "num_input_tokens_seen": 20435354624, "step": 71850, "train_runtime": 699876.9002, "train_tokens_per_second": 29198.499 }, { "epoch": 2.54254799240171, "grad_norm": 1.5859375, "learning_rate": 1.7475788774638732e-05, "loss": 1.030650806427002, "num_input_tokens_seen": 20438161600, "step": 71860, "train_runtime": 699969.9271, "train_tokens_per_second": 29198.628 }, { "epoch": 2.5429018126654386, "grad_norm": 1.5703125, "learning_rate": 1.7474721440088522e-05, "loss": 1.0224766731262207, "num_input_tokens_seen": 20441053888, "step": 71870, "train_runtime": 700069.2104, "train_tokens_per_second": 29198.619 }, { "epoch": 2.543255632929167, "grad_norm": 1.578125, "learning_rate": 1.747365430107694e-05, "loss": 1.0329282760620118, "num_input_tokens_seen": 20443936192, "step": 71880, "train_runtime": 700167.8489, "train_tokens_per_second": 29198.622 }, { "epoch": 2.543609453192896, "grad_norm": 1.6484375, "learning_rate": 1.7472587357544283e-05, "loss": 1.0190404891967773, "num_input_tokens_seen": 20446803712, "step": 71890, "train_runtime": 700263.945, "train_tokens_per_second": 29198.71 }, { "epoch": 2.543963273456625, "grad_norm": 1.65625, "learning_rate": 1.7471520609430883e-05, "loss": 1.0399824142456056, "num_input_tokens_seen": 20449636224, "step": 71900, "train_runtime": 700359.4857, "train_tokens_per_second": 29198.771 }, { "epoch": 2.5443170937203536, "grad_norm": 1.5625, "learning_rate": 1.747045405667709e-05, "loss": 1.0353170394897462, "num_input_tokens_seen": 20452428224, "step": 71910, "train_runtime": 700452.8783, "train_tokens_per_second": 29198.864 }, { "epoch": 2.5446709139840826, "grad_norm": 1.6328125, "learning_rate": 1.7469387699223282e-05, "loss": 1.022813606262207, "num_input_tokens_seen": 20455261440, "step": 71920, "train_runtime": 700548.0605, "train_tokens_per_second": 29198.941 }, { "epoch": 2.545024734247811, "grad_norm": 1.671875, "learning_rate": 1.7468321537009867e-05, "loss": 1.0237547874450683, "num_input_tokens_seen": 20458134784, "step": 71930, "train_runtime": 700647.6666, "train_tokens_per_second": 29198.891 }, { "epoch": 2.54537855451154, "grad_norm": 1.5546875, "learning_rate": 1.746725556997727e-05, "loss": 1.0489091873168945, "num_input_tokens_seen": 20460955776, "step": 71940, "train_runtime": 700745.769, "train_tokens_per_second": 29198.829 }, { "epoch": 2.5457323747752687, "grad_norm": 1.640625, "learning_rate": 1.7466189798065948e-05, "loss": 1.044600486755371, "num_input_tokens_seen": 20463774080, "step": 71950, "train_runtime": 700843.2395, "train_tokens_per_second": 29198.789 }, { "epoch": 2.5460861950389977, "grad_norm": 1.6328125, "learning_rate": 1.7465124221216382e-05, "loss": 1.0505943298339844, "num_input_tokens_seen": 20466610112, "step": 71960, "train_runtime": 700938.093, "train_tokens_per_second": 29198.884 }, { "epoch": 2.5464400153027267, "grad_norm": 1.640625, "learning_rate": 1.7464058839369074e-05, "loss": 1.0336755752563476, "num_input_tokens_seen": 20469394560, "step": 71970, "train_runtime": 701032.6918, "train_tokens_per_second": 29198.916 }, { "epoch": 2.546793835566455, "grad_norm": 1.5625, "learning_rate": 1.7462993652464556e-05, "loss": 1.0302765846252442, "num_input_tokens_seen": 20472254144, "step": 71980, "train_runtime": 701130.8187, "train_tokens_per_second": 29198.908 }, { "epoch": 2.5471476558301838, "grad_norm": 1.5546875, "learning_rate": 1.746192866044339e-05, "loss": 1.0410104751586915, "num_input_tokens_seen": 20475150016, "step": 71990, "train_runtime": 701231.5431, "train_tokens_per_second": 29198.843 }, { "epoch": 2.5475014760939128, "grad_norm": 1.578125, "learning_rate": 1.746086386324615e-05, "loss": 1.0391339302062987, "num_input_tokens_seen": 20477997248, "step": 72000, "train_runtime": 701328.5613, "train_tokens_per_second": 29198.864 }, { "epoch": 2.5478552963576417, "grad_norm": 1.6015625, "learning_rate": 1.7459799260813448e-05, "loss": 1.0276718139648438, "num_input_tokens_seen": 20480808576, "step": 72010, "train_runtime": 701424.3063, "train_tokens_per_second": 29198.886 }, { "epoch": 2.5482091166213703, "grad_norm": 1.6171875, "learning_rate": 1.7458734853085918e-05, "loss": 1.041015625, "num_input_tokens_seen": 20483689472, "step": 72020, "train_runtime": 701523.9275, "train_tokens_per_second": 29198.846 }, { "epoch": 2.548562936885099, "grad_norm": 1.546875, "learning_rate": 1.7457670640004212e-05, "loss": 1.0435802459716796, "num_input_tokens_seen": 20486498944, "step": 72030, "train_runtime": 701617.679, "train_tokens_per_second": 29198.949 }, { "epoch": 2.548916757148828, "grad_norm": 1.6484375, "learning_rate": 1.7456606621509013e-05, "loss": 1.0313965797424316, "num_input_tokens_seen": 20489338176, "step": 72040, "train_runtime": 701716.0024, "train_tokens_per_second": 29198.904 }, { "epoch": 2.549270577412557, "grad_norm": 1.6640625, "learning_rate": 1.745554279754104e-05, "loss": 1.0269933700561524, "num_input_tokens_seen": 20492240576, "step": 72050, "train_runtime": 701817.6169, "train_tokens_per_second": 29198.812 }, { "epoch": 2.5496243976762853, "grad_norm": 1.5546875, "learning_rate": 1.7454479168041013e-05, "loss": 1.0311915397644043, "num_input_tokens_seen": 20495117568, "step": 72060, "train_runtime": 701917.6645, "train_tokens_per_second": 29198.749 }, { "epoch": 2.5499782179400143, "grad_norm": 1.6171875, "learning_rate": 1.74534157329497e-05, "loss": 1.0363428115844726, "num_input_tokens_seen": 20497946432, "step": 72070, "train_runtime": 702012.9335, "train_tokens_per_second": 29198.816 }, { "epoch": 2.550332038203743, "grad_norm": 1.5703125, "learning_rate": 1.7452352492207886e-05, "loss": 1.0437593460083008, "num_input_tokens_seen": 20500781440, "step": 72080, "train_runtime": 702107.8568, "train_tokens_per_second": 29198.906 }, { "epoch": 2.550685858467472, "grad_norm": 1.5625, "learning_rate": 1.7451289445756374e-05, "loss": 1.0296886444091797, "num_input_tokens_seen": 20503619904, "step": 72090, "train_runtime": 702205.8271, "train_tokens_per_second": 29198.875 }, { "epoch": 2.5510396787312004, "grad_norm": 1.6171875, "learning_rate": 1.7450226593536005e-05, "loss": 1.035538101196289, "num_input_tokens_seen": 20506504192, "step": 72100, "train_runtime": 702304.1965, "train_tokens_per_second": 29198.892 }, { "epoch": 2.5513934989949294, "grad_norm": 1.5859375, "learning_rate": 1.744916393548763e-05, "loss": 1.022240161895752, "num_input_tokens_seen": 20509361536, "step": 72110, "train_runtime": 702404.1514, "train_tokens_per_second": 29198.805 }, { "epoch": 2.551747319258658, "grad_norm": 1.625, "learning_rate": 1.744810147155215e-05, "loss": 1.0434225082397461, "num_input_tokens_seen": 20512159936, "step": 72120, "train_runtime": 702502.6546, "train_tokens_per_second": 29198.694 }, { "epoch": 2.552101139522387, "grad_norm": 1.5625, "learning_rate": 1.7447039201670458e-05, "loss": 1.0254053115844726, "num_input_tokens_seen": 20515013056, "step": 72130, "train_runtime": 702600.2116, "train_tokens_per_second": 29198.7 }, { "epoch": 2.5524549597861155, "grad_norm": 1.625, "learning_rate": 1.7445977125783497e-05, "loss": 1.0449935913085937, "num_input_tokens_seen": 20517825984, "step": 72140, "train_runtime": 702697.6623, "train_tokens_per_second": 29198.654 }, { "epoch": 2.5528087800498445, "grad_norm": 1.671875, "learning_rate": 1.7444915243832234e-05, "loss": 1.046217155456543, "num_input_tokens_seen": 20520697984, "step": 72150, "train_runtime": 702798.6154, "train_tokens_per_second": 29198.546 }, { "epoch": 2.5531626003135734, "grad_norm": 1.5703125, "learning_rate": 1.7443853555757645e-05, "loss": 1.0400374412536622, "num_input_tokens_seen": 20523585344, "step": 72160, "train_runtime": 702896.9358, "train_tokens_per_second": 29198.57 }, { "epoch": 2.553516420577302, "grad_norm": 1.6171875, "learning_rate": 1.744279206150074e-05, "loss": 1.0370914459228515, "num_input_tokens_seen": 20526424384, "step": 72170, "train_runtime": 702994.3148, "train_tokens_per_second": 29198.564 }, { "epoch": 2.5538702408410305, "grad_norm": 1.546875, "learning_rate": 1.7441730761002567e-05, "loss": 1.0510648727416991, "num_input_tokens_seen": 20529302208, "step": 72180, "train_runtime": 703094.4898, "train_tokens_per_second": 29198.497 }, { "epoch": 2.5542240611047595, "grad_norm": 1.625, "learning_rate": 1.7440669654204185e-05, "loss": 1.0239250183105468, "num_input_tokens_seen": 20532160512, "step": 72190, "train_runtime": 703193.1467, "train_tokens_per_second": 29198.465 }, { "epoch": 2.5545778813684885, "grad_norm": 1.59375, "learning_rate": 1.7439608741046666e-05, "loss": 1.0344970703125, "num_input_tokens_seen": 20535015680, "step": 72200, "train_runtime": 703291.9118, "train_tokens_per_second": 29198.424 }, { "epoch": 2.554931701632217, "grad_norm": 1.671875, "learning_rate": 1.7438548021471134e-05, "loss": 1.057102108001709, "num_input_tokens_seen": 20537910336, "step": 72210, "train_runtime": 703393.6672, "train_tokens_per_second": 29198.316 }, { "epoch": 2.555285521895946, "grad_norm": 1.6328125, "learning_rate": 1.7437487495418724e-05, "loss": 1.0356021881103517, "num_input_tokens_seen": 20540782016, "step": 72220, "train_runtime": 703491.3387, "train_tokens_per_second": 29198.344 }, { "epoch": 2.5556393421596746, "grad_norm": 1.671875, "learning_rate": 1.7436427162830597e-05, "loss": 1.0510616302490234, "num_input_tokens_seen": 20543592128, "step": 72230, "train_runtime": 703588.8141, "train_tokens_per_second": 29198.293 }, { "epoch": 2.5559931624234036, "grad_norm": 1.6484375, "learning_rate": 1.743536702364794e-05, "loss": 1.0230504989624023, "num_input_tokens_seen": 20546470208, "step": 72240, "train_runtime": 703688.0779, "train_tokens_per_second": 29198.264 }, { "epoch": 2.556346982687132, "grad_norm": 1.5625, "learning_rate": 1.743430707781196e-05, "loss": 1.0468578338623047, "num_input_tokens_seen": 20549301952, "step": 72250, "train_runtime": 703787.7289, "train_tokens_per_second": 29198.153 }, { "epoch": 2.556700802950861, "grad_norm": 1.6015625, "learning_rate": 1.74332473252639e-05, "loss": 1.0369295120239257, "num_input_tokens_seen": 20552154176, "step": 72260, "train_runtime": 703885.3517, "train_tokens_per_second": 29198.156 }, { "epoch": 2.5570546232145897, "grad_norm": 1.6328125, "learning_rate": 1.7432187765945016e-05, "loss": 1.0443584442138671, "num_input_tokens_seen": 20554992704, "step": 72270, "train_runtime": 703984.2374, "train_tokens_per_second": 29198.087 }, { "epoch": 2.5574084434783186, "grad_norm": 1.6640625, "learning_rate": 1.74311283997966e-05, "loss": 1.0297391891479493, "num_input_tokens_seen": 20557903744, "step": 72280, "train_runtime": 704084.2314, "train_tokens_per_second": 29198.074 }, { "epoch": 2.557762263742047, "grad_norm": 1.6640625, "learning_rate": 1.7430069226759962e-05, "loss": 1.0356757164001464, "num_input_tokens_seen": 20560747520, "step": 72290, "train_runtime": 704179.3706, "train_tokens_per_second": 29198.168 }, { "epoch": 2.558116084005776, "grad_norm": 1.5546875, "learning_rate": 1.7429010246776435e-05, "loss": 1.0354219436645509, "num_input_tokens_seen": 20563542208, "step": 72300, "train_runtime": 704272.1855, "train_tokens_per_second": 29198.288 }, { "epoch": 2.558469904269505, "grad_norm": 1.5859375, "learning_rate": 1.7427951459787386e-05, "loss": 1.036043357849121, "num_input_tokens_seen": 20566405568, "step": 72310, "train_runtime": 704370.6759, "train_tokens_per_second": 29198.271 }, { "epoch": 2.5588237245332337, "grad_norm": 1.671875, "learning_rate": 1.7426892865734197e-05, "loss": 1.033118438720703, "num_input_tokens_seen": 20569259520, "step": 72320, "train_runtime": 704469.8845, "train_tokens_per_second": 29198.21 }, { "epoch": 2.5591775447969622, "grad_norm": 1.5625, "learning_rate": 1.742583446455828e-05, "loss": 1.0214186668395997, "num_input_tokens_seen": 20572132544, "step": 72330, "train_runtime": 704564.6872, "train_tokens_per_second": 29198.359 }, { "epoch": 2.5595313650606912, "grad_norm": 1.671875, "learning_rate": 1.7424776256201074e-05, "loss": 1.0500652313232421, "num_input_tokens_seen": 20574947520, "step": 72340, "train_runtime": 704659.804, "train_tokens_per_second": 29198.412 }, { "epoch": 2.55988518532442, "grad_norm": 1.6875, "learning_rate": 1.7423718240604035e-05, "loss": 1.0336706161499023, "num_input_tokens_seen": 20577857664, "step": 72350, "train_runtime": 704762.809, "train_tokens_per_second": 29198.274 }, { "epoch": 2.5602390055881488, "grad_norm": 1.6171875, "learning_rate": 1.7422660417708656e-05, "loss": 1.024794578552246, "num_input_tokens_seen": 20580678912, "step": 72360, "train_runtime": 704859.9137, "train_tokens_per_second": 29198.254 }, { "epoch": 2.5605928258518773, "grad_norm": 1.53125, "learning_rate": 1.7421602787456446e-05, "loss": 1.0418370246887207, "num_input_tokens_seen": 20583452032, "step": 72370, "train_runtime": 704951.9186, "train_tokens_per_second": 29198.377 }, { "epoch": 2.5609466461156063, "grad_norm": 1.578125, "learning_rate": 1.7420545349788937e-05, "loss": 1.0303762435913086, "num_input_tokens_seen": 20586235200, "step": 72380, "train_runtime": 705046.6858, "train_tokens_per_second": 29198.4 }, { "epoch": 2.5613004663793353, "grad_norm": 1.6015625, "learning_rate": 1.7419488104647694e-05, "loss": 1.028137493133545, "num_input_tokens_seen": 20589092928, "step": 72390, "train_runtime": 705147.0089, "train_tokens_per_second": 29198.299 }, { "epoch": 2.561654286643064, "grad_norm": 1.7109375, "learning_rate": 1.7418431051974298e-05, "loss": 1.0226737976074218, "num_input_tokens_seen": 20591972160, "step": 72400, "train_runtime": 705244.1237, "train_tokens_per_second": 29198.36 }, { "epoch": 2.562008106906793, "grad_norm": 1.5625, "learning_rate": 1.7417374191710362e-05, "loss": 1.0430026054382324, "num_input_tokens_seen": 20594829568, "step": 72410, "train_runtime": 705341.1678, "train_tokens_per_second": 29198.394 }, { "epoch": 2.5623619271705214, "grad_norm": 1.6484375, "learning_rate": 1.7416317523797522e-05, "loss": 1.0357673645019532, "num_input_tokens_seen": 20597679360, "step": 72420, "train_runtime": 705435.7107, "train_tokens_per_second": 29198.521 }, { "epoch": 2.5627157474342503, "grad_norm": 1.5625, "learning_rate": 1.7415261048177434e-05, "loss": 1.0370598793029786, "num_input_tokens_seen": 20600511872, "step": 72430, "train_runtime": 705532.1114, "train_tokens_per_second": 29198.546 }, { "epoch": 2.563069567697979, "grad_norm": 1.671875, "learning_rate": 1.7414204764791785e-05, "loss": 1.027860736846924, "num_input_tokens_seen": 20603403456, "step": 72440, "train_runtime": 705631.3561, "train_tokens_per_second": 29198.537 }, { "epoch": 2.563423387961708, "grad_norm": 1.6328125, "learning_rate": 1.741314867358229e-05, "loss": 1.0518159866333008, "num_input_tokens_seen": 20606216256, "step": 72450, "train_runtime": 705725.9633, "train_tokens_per_second": 29198.609 }, { "epoch": 2.5637772082254364, "grad_norm": 1.5625, "learning_rate": 1.7412092774490668e-05, "loss": 1.0540843963623048, "num_input_tokens_seen": 20609104064, "step": 72460, "train_runtime": 705827.7581, "train_tokens_per_second": 29198.489 }, { "epoch": 2.5641310284891654, "grad_norm": 1.5703125, "learning_rate": 1.741103706745869e-05, "loss": 1.0275188446044923, "num_input_tokens_seen": 20611943552, "step": 72470, "train_runtime": 705928.9262, "train_tokens_per_second": 29198.327 }, { "epoch": 2.564484848752894, "grad_norm": 1.65625, "learning_rate": 1.740998155242814e-05, "loss": 1.0316118240356444, "num_input_tokens_seen": 20614718400, "step": 72480, "train_runtime": 706022.8671, "train_tokens_per_second": 29198.372 }, { "epoch": 2.564838669016623, "grad_norm": 1.625, "learning_rate": 1.740892622934082e-05, "loss": 1.0425684928894043, "num_input_tokens_seen": 20617540800, "step": 72490, "train_runtime": 706117.5801, "train_tokens_per_second": 29198.453 }, { "epoch": 2.565192489280352, "grad_norm": 1.6328125, "learning_rate": 1.740787109813857e-05, "loss": 1.027834415435791, "num_input_tokens_seen": 20620348352, "step": 72500, "train_runtime": 706212.3624, "train_tokens_per_second": 29198.509 }, { "epoch": 2.5655463095440805, "grad_norm": 1.578125, "learning_rate": 1.7406816158763242e-05, "loss": 1.041705322265625, "num_input_tokens_seen": 20623187264, "step": 72510, "train_runtime": 706310.0854, "train_tokens_per_second": 29198.489 }, { "epoch": 2.565900129807809, "grad_norm": 1.546875, "learning_rate": 1.7405761411156717e-05, "loss": 1.0276119232177734, "num_input_tokens_seen": 20626035456, "step": 72520, "train_runtime": 706406.698, "train_tokens_per_second": 29198.528 }, { "epoch": 2.566253950071538, "grad_norm": 1.6484375, "learning_rate": 1.7404706855260906e-05, "loss": 1.034765625, "num_input_tokens_seen": 20628858880, "step": 72530, "train_runtime": 706503.4884, "train_tokens_per_second": 29198.524 }, { "epoch": 2.566607770335267, "grad_norm": 1.5390625, "learning_rate": 1.7403652491017738e-05, "loss": 1.0468368530273438, "num_input_tokens_seen": 20631688512, "step": 72540, "train_runtime": 706599.7292, "train_tokens_per_second": 29198.551 }, { "epoch": 2.5669615905989955, "grad_norm": 1.5703125, "learning_rate": 1.7402598318369174e-05, "loss": 1.0289791107177735, "num_input_tokens_seen": 20634507200, "step": 72550, "train_runtime": 706693.4328, "train_tokens_per_second": 29198.668 }, { "epoch": 2.5673154108627245, "grad_norm": 1.53125, "learning_rate": 1.7401544337257186e-05, "loss": 1.0413643836975097, "num_input_tokens_seen": 20637348352, "step": 72560, "train_runtime": 706791.2089, "train_tokens_per_second": 29198.649 }, { "epoch": 2.567669231126453, "grad_norm": 1.65625, "learning_rate": 1.740049054762379e-05, "loss": 1.0230756759643556, "num_input_tokens_seen": 20640215424, "step": 72570, "train_runtime": 706889.2226, "train_tokens_per_second": 29198.656 }, { "epoch": 2.568023051390182, "grad_norm": 1.5390625, "learning_rate": 1.7399436949411007e-05, "loss": 1.0395191192626954, "num_input_tokens_seen": 20643027648, "step": 72580, "train_runtime": 706982.1028, "train_tokens_per_second": 29198.798 }, { "epoch": 2.5683768716539106, "grad_norm": 1.671875, "learning_rate": 1.7398383542560892e-05, "loss": 1.037757110595703, "num_input_tokens_seen": 20645891072, "step": 72590, "train_runtime": 707080.7439, "train_tokens_per_second": 29198.774 }, { "epoch": 2.5687306919176396, "grad_norm": 1.6328125, "learning_rate": 1.739733032701553e-05, "loss": 1.0374832153320312, "num_input_tokens_seen": 20648709120, "step": 72600, "train_runtime": 707176.2178, "train_tokens_per_second": 29198.817 }, { "epoch": 2.569084512181368, "grad_norm": 1.5859375, "learning_rate": 1.7396277302717024e-05, "loss": 1.049748134613037, "num_input_tokens_seen": 20651559168, "step": 72610, "train_runtime": 707273.5348, "train_tokens_per_second": 29198.829 }, { "epoch": 2.569438332445097, "grad_norm": 1.578125, "learning_rate": 1.7395224469607495e-05, "loss": 1.049699592590332, "num_input_tokens_seen": 20654400000, "step": 72620, "train_runtime": 707371.9859, "train_tokens_per_second": 29198.781 }, { "epoch": 2.5697921527088257, "grad_norm": 1.6015625, "learning_rate": 1.73941718276291e-05, "loss": 1.0341974258422852, "num_input_tokens_seen": 20657272192, "step": 72630, "train_runtime": 707472.5033, "train_tokens_per_second": 29198.693 }, { "epoch": 2.5701459729725546, "grad_norm": 1.4921875, "learning_rate": 1.7393119376724022e-05, "loss": 1.043117141723633, "num_input_tokens_seen": 20660119040, "step": 72640, "train_runtime": 707568.2361, "train_tokens_per_second": 29198.766 }, { "epoch": 2.5704997932362836, "grad_norm": 1.5703125, "learning_rate": 1.739206711683445e-05, "loss": 1.0322357177734376, "num_input_tokens_seen": 20662932928, "step": 72650, "train_runtime": 707665.937, "train_tokens_per_second": 29198.711 }, { "epoch": 2.570853613500012, "grad_norm": 1.5, "learning_rate": 1.739101504790262e-05, "loss": 1.0297353744506836, "num_input_tokens_seen": 20665755456, "step": 72660, "train_runtime": 707761.3897, "train_tokens_per_second": 29198.761 }, { "epoch": 2.5712074337637407, "grad_norm": 1.6015625, "learning_rate": 1.7389963169870784e-05, "loss": 1.0215118408203125, "num_input_tokens_seen": 20668651456, "step": 72670, "train_runtime": 707861.5672, "train_tokens_per_second": 29198.72 }, { "epoch": 2.5715612540274697, "grad_norm": 1.5859375, "learning_rate": 1.7388911482681212e-05, "loss": 1.0224244117736816, "num_input_tokens_seen": 20671458752, "step": 72680, "train_runtime": 707956.7233, "train_tokens_per_second": 29198.76 }, { "epoch": 2.5719150742911987, "grad_norm": 1.5546875, "learning_rate": 1.7387859986276197e-05, "loss": 1.044388771057129, "num_input_tokens_seen": 20674322048, "step": 72690, "train_runtime": 708055.9553, "train_tokens_per_second": 29198.712 }, { "epoch": 2.5722688945549272, "grad_norm": 1.6015625, "learning_rate": 1.7386808680598078e-05, "loss": 1.0288274765014649, "num_input_tokens_seen": 20677222848, "step": 72700, "train_runtime": 708156.4744, "train_tokens_per_second": 29198.664 }, { "epoch": 2.572622714818656, "grad_norm": 1.6171875, "learning_rate": 1.7385757565589192e-05, "loss": 1.0333978652954101, "num_input_tokens_seen": 20680008704, "step": 72710, "train_runtime": 708252.1373, "train_tokens_per_second": 29198.653 }, { "epoch": 2.5729765350823848, "grad_norm": 1.765625, "learning_rate": 1.7384706641191913e-05, "loss": 1.0302373886108398, "num_input_tokens_seen": 20682933632, "step": 72720, "train_runtime": 708355.9267, "train_tokens_per_second": 29198.504 }, { "epoch": 2.5733303553461138, "grad_norm": 1.578125, "learning_rate": 1.7383655907348643e-05, "loss": 1.036936378479004, "num_input_tokens_seen": 20685755072, "step": 72730, "train_runtime": 708452.5719, "train_tokens_per_second": 29198.504 }, { "epoch": 2.5736841756098423, "grad_norm": 1.59375, "learning_rate": 1.7382605364001803e-05, "loss": 1.0349697113037108, "num_input_tokens_seen": 20688576000, "step": 72740, "train_runtime": 708550.595, "train_tokens_per_second": 29198.446 }, { "epoch": 2.5740379958735713, "grad_norm": 1.59375, "learning_rate": 1.738155501109383e-05, "loss": 1.042165184020996, "num_input_tokens_seen": 20691433728, "step": 72750, "train_runtime": 708648.6997, "train_tokens_per_second": 29198.436 }, { "epoch": 2.5743918161373, "grad_norm": 1.59375, "learning_rate": 1.7380504848567207e-05, "loss": 1.0357250213623046, "num_input_tokens_seen": 20694294400, "step": 72760, "train_runtime": 708744.9915, "train_tokens_per_second": 29198.505 }, { "epoch": 2.574745636401029, "grad_norm": 1.5859375, "learning_rate": 1.7379454876364413e-05, "loss": 1.0319669723510743, "num_input_tokens_seen": 20697143680, "step": 72770, "train_runtime": 708841.7411, "train_tokens_per_second": 29198.54 }, { "epoch": 2.5750994566647574, "grad_norm": 1.5703125, "learning_rate": 1.7378405094427978e-05, "loss": 1.041044044494629, "num_input_tokens_seen": 20700026816, "step": 72780, "train_runtime": 708942.4451, "train_tokens_per_second": 29198.459 }, { "epoch": 2.5754532769284864, "grad_norm": 1.625, "learning_rate": 1.737735550270045e-05, "loss": 1.0463923454284667, "num_input_tokens_seen": 20702885952, "step": 72790, "train_runtime": 709040.7306, "train_tokens_per_second": 29198.444 }, { "epoch": 2.5758070971922153, "grad_norm": 1.6015625, "learning_rate": 1.7376306101124385e-05, "loss": 1.0326871871948242, "num_input_tokens_seen": 20705759360, "step": 72800, "train_runtime": 709137.7127, "train_tokens_per_second": 29198.503 }, { "epoch": 2.576160917455944, "grad_norm": 1.609375, "learning_rate": 1.7375256889642376e-05, "loss": 1.0417254447937012, "num_input_tokens_seen": 20708582592, "step": 72810, "train_runtime": 709234.139, "train_tokens_per_second": 29198.514 }, { "epoch": 2.5765147377196724, "grad_norm": 1.6015625, "learning_rate": 1.7374207868197044e-05, "loss": 1.0423618316650392, "num_input_tokens_seen": 20711415936, "step": 72820, "train_runtime": 709330.8314, "train_tokens_per_second": 29198.528 }, { "epoch": 2.5768685579834014, "grad_norm": 1.6015625, "learning_rate": 1.7373159036731028e-05, "loss": 1.036679458618164, "num_input_tokens_seen": 20714234880, "step": 72830, "train_runtime": 709426.6846, "train_tokens_per_second": 29198.556 }, { "epoch": 2.5772223782471304, "grad_norm": 1.609375, "learning_rate": 1.737211039518699e-05, "loss": 1.0506651878356934, "num_input_tokens_seen": 20717062464, "step": 72840, "train_runtime": 709525.088, "train_tokens_per_second": 29198.492 }, { "epoch": 2.577576198510859, "grad_norm": 1.640625, "learning_rate": 1.7371061943507615e-05, "loss": 1.0361663818359375, "num_input_tokens_seen": 20719861312, "step": 72850, "train_runtime": 709618.3512, "train_tokens_per_second": 29198.598 }, { "epoch": 2.5779300187745875, "grad_norm": 1.6171875, "learning_rate": 1.7370013681635626e-05, "loss": 1.0345247268676758, "num_input_tokens_seen": 20722699136, "step": 72860, "train_runtime": 709715.8532, "train_tokens_per_second": 29198.586 }, { "epoch": 2.5782838390383165, "grad_norm": 1.6171875, "learning_rate": 1.7368965609513755e-05, "loss": 1.0188274383544922, "num_input_tokens_seen": 20725508736, "step": 72870, "train_runtime": 709814.6258, "train_tokens_per_second": 29198.481 }, { "epoch": 2.5786376593020455, "grad_norm": 1.65625, "learning_rate": 1.736791772708476e-05, "loss": 1.0423794746398927, "num_input_tokens_seen": 20728335552, "step": 72880, "train_runtime": 709910.842, "train_tokens_per_second": 29198.505 }, { "epoch": 2.578991479565774, "grad_norm": 1.6171875, "learning_rate": 1.7366870034291427e-05, "loss": 1.0295652389526366, "num_input_tokens_seen": 20731187840, "step": 72890, "train_runtime": 710008.4624, "train_tokens_per_second": 29198.508 }, { "epoch": 2.579345299829503, "grad_norm": 1.6796875, "learning_rate": 1.736582253107657e-05, "loss": 1.0413851737976074, "num_input_tokens_seen": 20733978560, "step": 72900, "train_runtime": 710101.919, "train_tokens_per_second": 29198.595 }, { "epoch": 2.5796991200932315, "grad_norm": 1.625, "learning_rate": 1.736477521738302e-05, "loss": 1.0245348930358886, "num_input_tokens_seen": 20736831488, "step": 72910, "train_runtime": 710199.6798, "train_tokens_per_second": 29198.593 }, { "epoch": 2.5800529403569605, "grad_norm": 1.5703125, "learning_rate": 1.7363728093153632e-05, "loss": 1.0384122848510742, "num_input_tokens_seen": 20739722624, "step": 72920, "train_runtime": 710301.1868, "train_tokens_per_second": 29198.491 }, { "epoch": 2.580406760620689, "grad_norm": 1.609375, "learning_rate": 1.7362681158331295e-05, "loss": 1.0458061218261718, "num_input_tokens_seen": 20742627072, "step": 72930, "train_runtime": 710400.706, "train_tokens_per_second": 29198.489 }, { "epoch": 2.580760580884418, "grad_norm": 1.6484375, "learning_rate": 1.7361634412858908e-05, "loss": 1.0299225807189942, "num_input_tokens_seen": 20745470464, "step": 72940, "train_runtime": 710500.1152, "train_tokens_per_second": 29198.405 }, { "epoch": 2.5811144011481466, "grad_norm": 1.5625, "learning_rate": 1.7360587856679405e-05, "loss": 1.0393754959106445, "num_input_tokens_seen": 20748280128, "step": 72950, "train_runtime": 710595.5348, "train_tokens_per_second": 29198.439 }, { "epoch": 2.5814682214118756, "grad_norm": 1.640625, "learning_rate": 1.735954148973574e-05, "loss": 1.0427716255187989, "num_input_tokens_seen": 20751092480, "step": 72960, "train_runtime": 710691.2214, "train_tokens_per_second": 29198.465 }, { "epoch": 2.581822041675604, "grad_norm": 1.640625, "learning_rate": 1.7358495311970887e-05, "loss": 1.0366731643676759, "num_input_tokens_seen": 20753923712, "step": 72970, "train_runtime": 710785.1643, "train_tokens_per_second": 29198.589 }, { "epoch": 2.582175861939333, "grad_norm": 1.609375, "learning_rate": 1.7357449323327853e-05, "loss": 1.0247762680053711, "num_input_tokens_seen": 20756733696, "step": 72980, "train_runtime": 710881.9543, "train_tokens_per_second": 29198.566 }, { "epoch": 2.582529682203062, "grad_norm": 1.59375, "learning_rate": 1.7356403523749667e-05, "loss": 1.033622932434082, "num_input_tokens_seen": 20759522816, "step": 72990, "train_runtime": 710976.345, "train_tokens_per_second": 29198.613 }, { "epoch": 2.5828835024667907, "grad_norm": 1.5625, "learning_rate": 1.7355357913179375e-05, "loss": 1.031148338317871, "num_input_tokens_seen": 20762470848, "step": 73000, "train_runtime": 711078.1505, "train_tokens_per_second": 29198.578 }, { "epoch": 2.583237322730519, "grad_norm": 1.578125, "learning_rate": 1.7354312491560043e-05, "loss": 1.0321311950683594, "num_input_tokens_seen": 20765296640, "step": 73010, "train_runtime": 711172.6475, "train_tokens_per_second": 29198.672 }, { "epoch": 2.583591142994248, "grad_norm": 1.546875, "learning_rate": 1.7353267258834785e-05, "loss": 1.0340192794799805, "num_input_tokens_seen": 20768109120, "step": 73020, "train_runtime": 711268.4268, "train_tokens_per_second": 29198.694 }, { "epoch": 2.583944963257977, "grad_norm": 1.640625, "learning_rate": 1.7352222214946716e-05, "loss": 1.0239102363586425, "num_input_tokens_seen": 20770975936, "step": 73030, "train_runtime": 711368.5127, "train_tokens_per_second": 29198.616 }, { "epoch": 2.5842987835217057, "grad_norm": 1.6015625, "learning_rate": 1.735117735983898e-05, "loss": 1.0171987533569335, "num_input_tokens_seen": 20773825472, "step": 73040, "train_runtime": 711470.3829, "train_tokens_per_second": 29198.44 }, { "epoch": 2.5846526037854347, "grad_norm": 1.6015625, "learning_rate": 1.735013269345475e-05, "loss": 1.0353946685791016, "num_input_tokens_seen": 20776646144, "step": 73050, "train_runtime": 711567.0892, "train_tokens_per_second": 29198.436 }, { "epoch": 2.5850064240491633, "grad_norm": 1.6328125, "learning_rate": 1.7349088215737225e-05, "loss": 1.0437808990478517, "num_input_tokens_seen": 20779489664, "step": 73060, "train_runtime": 711665.4993, "train_tokens_per_second": 29198.394 }, { "epoch": 2.5853602443128922, "grad_norm": 1.5703125, "learning_rate": 1.7348043926629614e-05, "loss": 1.0264128684997558, "num_input_tokens_seen": 20782366720, "step": 73070, "train_runtime": 711763.2076, "train_tokens_per_second": 29198.428 }, { "epoch": 2.585714064576621, "grad_norm": 1.5859375, "learning_rate": 1.7346999826075162e-05, "loss": 1.0286325454711913, "num_input_tokens_seen": 20785225088, "step": 73080, "train_runtime": 711862.0889, "train_tokens_per_second": 29198.387 }, { "epoch": 2.5860678848403498, "grad_norm": 1.5625, "learning_rate": 1.7345955914017143e-05, "loss": 1.0439311981201171, "num_input_tokens_seen": 20788115840, "step": 73090, "train_runtime": 711960.9867, "train_tokens_per_second": 29198.392 }, { "epoch": 2.5864217051040783, "grad_norm": 1.625, "learning_rate": 1.7344912190398834e-05, "loss": 1.032898235321045, "num_input_tokens_seen": 20790963584, "step": 73100, "train_runtime": 712058.5534, "train_tokens_per_second": 29198.39 }, { "epoch": 2.5867755253678073, "grad_norm": 1.6015625, "learning_rate": 1.734386865516356e-05, "loss": 1.0273544311523437, "num_input_tokens_seen": 20793819776, "step": 73110, "train_runtime": 712154.462, "train_tokens_per_second": 29198.469 }, { "epoch": 2.587129345631536, "grad_norm": 1.65625, "learning_rate": 1.734282530825465e-05, "loss": 1.043428611755371, "num_input_tokens_seen": 20796683840, "step": 73120, "train_runtime": 712255.3479, "train_tokens_per_second": 29198.354 }, { "epoch": 2.587483165895265, "grad_norm": 1.578125, "learning_rate": 1.734178214961547e-05, "loss": 1.0394826889038087, "num_input_tokens_seen": 20799500928, "step": 73130, "train_runtime": 712349.9177, "train_tokens_per_second": 29198.432 }, { "epoch": 2.587836986158994, "grad_norm": 1.546875, "learning_rate": 1.7340739179189408e-05, "loss": 1.0423120498657226, "num_input_tokens_seen": 20802316864, "step": 73140, "train_runtime": 712445.3065, "train_tokens_per_second": 29198.476 }, { "epoch": 2.5881908064227224, "grad_norm": 1.5234375, "learning_rate": 1.7339696396919868e-05, "loss": 1.0517769813537599, "num_input_tokens_seen": 20805153536, "step": 73150, "train_runtime": 712544.0323, "train_tokens_per_second": 29198.411 }, { "epoch": 2.588544626686451, "grad_norm": 1.6796875, "learning_rate": 1.7338653802750284e-05, "loss": 1.0347846031188965, "num_input_tokens_seen": 20808015808, "step": 73160, "train_runtime": 712641.1927, "train_tokens_per_second": 29198.447 }, { "epoch": 2.58889844695018, "grad_norm": 1.5703125, "learning_rate": 1.7337611396624114e-05, "loss": 1.0490592956542968, "num_input_tokens_seen": 20810881280, "step": 73170, "train_runtime": 712739.6703, "train_tokens_per_second": 29198.433 }, { "epoch": 2.589252267213909, "grad_norm": 1.625, "learning_rate": 1.733656917848484e-05, "loss": 1.0402219772338868, "num_input_tokens_seen": 20813741248, "step": 73180, "train_runtime": 712835.0628, "train_tokens_per_second": 29198.537 }, { "epoch": 2.5896060874776374, "grad_norm": 1.6171875, "learning_rate": 1.733552714827596e-05, "loss": 1.0287700653076173, "num_input_tokens_seen": 20816625088, "step": 73190, "train_runtime": 712937.0565, "train_tokens_per_second": 29198.405 }, { "epoch": 2.589959907741366, "grad_norm": 1.6171875, "learning_rate": 1.7334485305941013e-05, "loss": 1.0370455741882325, "num_input_tokens_seen": 20819518080, "step": 73200, "train_runtime": 713039.2872, "train_tokens_per_second": 29198.276 }, { "epoch": 2.590313728005095, "grad_norm": 1.5859375, "learning_rate": 1.7333443651423543e-05, "loss": 1.0338541984558105, "num_input_tokens_seen": 20822403584, "step": 73210, "train_runtime": 713139.2186, "train_tokens_per_second": 29198.231 }, { "epoch": 2.590667548268824, "grad_norm": 1.625, "learning_rate": 1.7332402184667127e-05, "loss": 1.0232536315917968, "num_input_tokens_seen": 20825248640, "step": 73220, "train_runtime": 713235.2681, "train_tokens_per_second": 29198.288 }, { "epoch": 2.5910213685325525, "grad_norm": 1.640625, "learning_rate": 1.7331360905615364e-05, "loss": 1.0454533576965332, "num_input_tokens_seen": 20828073856, "step": 73230, "train_runtime": 713332.246, "train_tokens_per_second": 29198.279 }, { "epoch": 2.5913751887962815, "grad_norm": 1.6484375, "learning_rate": 1.733031981421188e-05, "loss": 1.0475595474243165, "num_input_tokens_seen": 20830918720, "step": 73240, "train_runtime": 713431.3348, "train_tokens_per_second": 29198.211 }, { "epoch": 2.59172900906001, "grad_norm": 1.6171875, "learning_rate": 1.7329278910400316e-05, "loss": 1.0433822631835938, "num_input_tokens_seen": 20833775936, "step": 73250, "train_runtime": 713528.0676, "train_tokens_per_second": 29198.257 }, { "epoch": 2.592082829323739, "grad_norm": 1.59375, "learning_rate": 1.7328238194124348e-05, "loss": 1.0364750862121581, "num_input_tokens_seen": 20836626816, "step": 73260, "train_runtime": 713626.1837, "train_tokens_per_second": 29198.238 }, { "epoch": 2.5924366495874676, "grad_norm": 1.625, "learning_rate": 1.7327197665327667e-05, "loss": 1.039337158203125, "num_input_tokens_seen": 20839408512, "step": 73270, "train_runtime": 713719.0802, "train_tokens_per_second": 29198.335 }, { "epoch": 2.5927904698511965, "grad_norm": 1.6015625, "learning_rate": 1.7326157323953994e-05, "loss": 1.0355443954467773, "num_input_tokens_seen": 20842184896, "step": 73280, "train_runtime": 713810.2321, "train_tokens_per_second": 29198.496 }, { "epoch": 2.593144290114925, "grad_norm": 1.609375, "learning_rate": 1.732511716994707e-05, "loss": 1.0382380485534668, "num_input_tokens_seen": 20845055808, "step": 73290, "train_runtime": 713907.7317, "train_tokens_per_second": 29198.529 }, { "epoch": 2.593498110378654, "grad_norm": 1.625, "learning_rate": 1.7324077203250654e-05, "loss": 1.0443264961242675, "num_input_tokens_seen": 20847931264, "step": 73300, "train_runtime": 714006.0929, "train_tokens_per_second": 29198.534 }, { "epoch": 2.5938519306423826, "grad_norm": 1.5625, "learning_rate": 1.7323037423808545e-05, "loss": 1.0297700881958007, "num_input_tokens_seen": 20850769152, "step": 73310, "train_runtime": 714101.004, "train_tokens_per_second": 29198.627 }, { "epoch": 2.5942057509061116, "grad_norm": 1.609375, "learning_rate": 1.7321997831564546e-05, "loss": 1.0318084716796876, "num_input_tokens_seen": 20853610880, "step": 73320, "train_runtime": 714198.2506, "train_tokens_per_second": 29198.631 }, { "epoch": 2.5945595711698406, "grad_norm": 1.625, "learning_rate": 1.7320958426462496e-05, "loss": 1.0394277572631836, "num_input_tokens_seen": 20856452352, "step": 73330, "train_runtime": 714294.5115, "train_tokens_per_second": 29198.674 }, { "epoch": 2.594913391433569, "grad_norm": 1.5546875, "learning_rate": 1.731991920844626e-05, "loss": 1.0471017837524415, "num_input_tokens_seen": 20859311808, "step": 73340, "train_runtime": 714393.4686, "train_tokens_per_second": 29198.632 }, { "epoch": 2.5952672116972977, "grad_norm": 1.515625, "learning_rate": 1.7318880177459714e-05, "loss": 1.0351833343505858, "num_input_tokens_seen": 20862189568, "step": 73350, "train_runtime": 714493.1783, "train_tokens_per_second": 29198.585 }, { "epoch": 2.5956210319610267, "grad_norm": 1.5234375, "learning_rate": 1.7317841333446765e-05, "loss": 1.0270872116088867, "num_input_tokens_seen": 20865010560, "step": 73360, "train_runtime": 714588.7861, "train_tokens_per_second": 29198.626 }, { "epoch": 2.5959748522247557, "grad_norm": 1.6171875, "learning_rate": 1.731680267635135e-05, "loss": 1.0363285064697265, "num_input_tokens_seen": 20867867264, "step": 73370, "train_runtime": 714686.6109, "train_tokens_per_second": 29198.626 }, { "epoch": 2.596328672488484, "grad_norm": 1.625, "learning_rate": 1.7315764206117417e-05, "loss": 1.0529472351074218, "num_input_tokens_seen": 20870682048, "step": 73380, "train_runtime": 714782.1991, "train_tokens_per_second": 29198.659 }, { "epoch": 2.596682492752213, "grad_norm": 1.625, "learning_rate": 1.7314725922688945e-05, "loss": 1.0343170166015625, "num_input_tokens_seen": 20873590400, "step": 73390, "train_runtime": 714882.2334, "train_tokens_per_second": 29198.642 }, { "epoch": 2.5970363130159417, "grad_norm": 1.5859375, "learning_rate": 1.731368782600993e-05, "loss": 1.0487605094909669, "num_input_tokens_seen": 20876455424, "step": 73400, "train_runtime": 714979.0356, "train_tokens_per_second": 29198.696 }, { "epoch": 2.5973901332796707, "grad_norm": 1.625, "learning_rate": 1.7312649916024402e-05, "loss": 1.0372756958007812, "num_input_tokens_seen": 20879320896, "step": 73410, "train_runtime": 715076.205, "train_tokens_per_second": 29198.735 }, { "epoch": 2.5977439535433993, "grad_norm": 1.5703125, "learning_rate": 1.731161219267641e-05, "loss": 1.0378450393676757, "num_input_tokens_seen": 20882183040, "step": 73420, "train_runtime": 715173.7538, "train_tokens_per_second": 29198.755 }, { "epoch": 2.5980977738071283, "grad_norm": 1.65625, "learning_rate": 1.731057465591002e-05, "loss": 1.0260846138000488, "num_input_tokens_seen": 20885040192, "step": 73430, "train_runtime": 715275.6616, "train_tokens_per_second": 29198.589 }, { "epoch": 2.598451594070857, "grad_norm": 1.609375, "learning_rate": 1.7309537305669334e-05, "loss": 1.0425134658813477, "num_input_tokens_seen": 20887862656, "step": 73440, "train_runtime": 715369.1997, "train_tokens_per_second": 29198.717 }, { "epoch": 2.598805414334586, "grad_norm": 1.6484375, "learning_rate": 1.7308500141898458e-05, "loss": 1.0399380683898927, "num_input_tokens_seen": 20890725696, "step": 73450, "train_runtime": 715464.0468, "train_tokens_per_second": 29198.848 }, { "epoch": 2.5991592345983143, "grad_norm": 1.671875, "learning_rate": 1.730746316454155e-05, "loss": 1.0241090774536132, "num_input_tokens_seen": 20893585792, "step": 73460, "train_runtime": 715564.3244, "train_tokens_per_second": 29198.753 }, { "epoch": 2.5995130548620433, "grad_norm": 1.5859375, "learning_rate": 1.730642637354276e-05, "loss": 1.0393680572509765, "num_input_tokens_seen": 20896413568, "step": 73470, "train_runtime": 715659.0887, "train_tokens_per_second": 29198.838 }, { "epoch": 2.5998668751257723, "grad_norm": 1.6796875, "learning_rate": 1.7305389768846286e-05, "loss": 1.0236593246459962, "num_input_tokens_seen": 20899254592, "step": 73480, "train_runtime": 715755.4581, "train_tokens_per_second": 29198.876 }, { "epoch": 2.600220695389501, "grad_norm": 1.6484375, "learning_rate": 1.7304353350396332e-05, "loss": 1.024784469604492, "num_input_tokens_seen": 20902064384, "step": 73490, "train_runtime": 715850.4488, "train_tokens_per_second": 29198.926 }, { "epoch": 2.6005745156532294, "grad_norm": 1.640625, "learning_rate": 1.7303317118137143e-05, "loss": 1.03966064453125, "num_input_tokens_seen": 20904853440, "step": 73500, "train_runtime": 715944.4085, "train_tokens_per_second": 29198.99 }, { "epoch": 2.6009283359169584, "grad_norm": 1.625, "learning_rate": 1.7302281072012973e-05, "loss": 1.0359983444213867, "num_input_tokens_seen": 20907649664, "step": 73510, "train_runtime": 716037.3171, "train_tokens_per_second": 29199.106 }, { "epoch": 2.6012821561806874, "grad_norm": 1.640625, "learning_rate": 1.7301245211968094e-05, "loss": 1.0287960052490235, "num_input_tokens_seen": 20910440256, "step": 73520, "train_runtime": 716132.335, "train_tokens_per_second": 29199.129 }, { "epoch": 2.601635976444416, "grad_norm": 1.609375, "learning_rate": 1.7300209537946832e-05, "loss": 1.0358367919921876, "num_input_tokens_seen": 20913234880, "step": 73530, "train_runtime": 716225.5339, "train_tokens_per_second": 29199.231 }, { "epoch": 2.6019897967081445, "grad_norm": 1.65625, "learning_rate": 1.7299174049893497e-05, "loss": 1.0366092681884767, "num_input_tokens_seen": 20916057088, "step": 73540, "train_runtime": 716323.0109, "train_tokens_per_second": 29199.198 }, { "epoch": 2.6023436169718734, "grad_norm": 1.65625, "learning_rate": 1.7298138747752453e-05, "loss": 1.025697612762451, "num_input_tokens_seen": 20918907264, "step": 73550, "train_runtime": 716421.3321, "train_tokens_per_second": 29199.169 }, { "epoch": 2.6026974372356024, "grad_norm": 1.5859375, "learning_rate": 1.729710363146807e-05, "loss": 1.0462289810180665, "num_input_tokens_seen": 20921776704, "step": 73560, "train_runtime": 716521.0379, "train_tokens_per_second": 29199.11 }, { "epoch": 2.603051257499331, "grad_norm": 1.625, "learning_rate": 1.7296068700984743e-05, "loss": 1.0359846115112306, "num_input_tokens_seen": 20924649920, "step": 73570, "train_runtime": 716619.255, "train_tokens_per_second": 29199.118 }, { "epoch": 2.60340507776306, "grad_norm": 1.609375, "learning_rate": 1.7295033956246902e-05, "loss": 1.043634033203125, "num_input_tokens_seen": 20927540288, "step": 73580, "train_runtime": 716719.94, "train_tokens_per_second": 29199.048 }, { "epoch": 2.6037588980267885, "grad_norm": 1.5390625, "learning_rate": 1.7293999397198985e-05, "loss": 1.0188390731811523, "num_input_tokens_seen": 20930353536, "step": 73590, "train_runtime": 716815.0286, "train_tokens_per_second": 29199.1 }, { "epoch": 2.6041127182905175, "grad_norm": 1.5859375, "learning_rate": 1.7292965023785464e-05, "loss": 1.0415985107421875, "num_input_tokens_seen": 20933269120, "step": 73600, "train_runtime": 716915.3705, "train_tokens_per_second": 29199.08 }, { "epoch": 2.604466538554246, "grad_norm": 1.5546875, "learning_rate": 1.7291930835950827e-05, "loss": 1.028214454650879, "num_input_tokens_seen": 20936127552, "step": 73610, "train_runtime": 717012.6937, "train_tokens_per_second": 29199.103 }, { "epoch": 2.604820358817975, "grad_norm": 1.640625, "learning_rate": 1.72908968336396e-05, "loss": 1.0446977615356445, "num_input_tokens_seen": 20938932160, "step": 73620, "train_runtime": 717111.8576, "train_tokens_per_second": 29198.976 }, { "epoch": 2.6051741790817036, "grad_norm": 1.640625, "learning_rate": 1.728986301679631e-05, "loss": 1.0375707626342774, "num_input_tokens_seen": 20941741568, "step": 73630, "train_runtime": 717206.7736, "train_tokens_per_second": 29199.029 }, { "epoch": 2.6055279993454326, "grad_norm": 1.6015625, "learning_rate": 1.7288829385365522e-05, "loss": 1.0406131744384766, "num_input_tokens_seen": 20944624768, "step": 73640, "train_runtime": 717306.9878, "train_tokens_per_second": 29198.969 }, { "epoch": 2.605881819609161, "grad_norm": 1.6171875, "learning_rate": 1.7287795939291814e-05, "loss": 1.042018508911133, "num_input_tokens_seen": 20947419776, "step": 73650, "train_runtime": 717402.871, "train_tokens_per_second": 29198.963 }, { "epoch": 2.60623563987289, "grad_norm": 1.59375, "learning_rate": 1.728676267851981e-05, "loss": 1.0453001022338868, "num_input_tokens_seen": 20950244352, "step": 73660, "train_runtime": 717499.9354, "train_tokens_per_second": 29198.949 }, { "epoch": 2.606589460136619, "grad_norm": 1.5703125, "learning_rate": 1.728572960299412e-05, "loss": 1.028050994873047, "num_input_tokens_seen": 20953037376, "step": 73670, "train_runtime": 717593.897, "train_tokens_per_second": 29199.018 }, { "epoch": 2.6069432804003476, "grad_norm": 1.6640625, "learning_rate": 1.7284696712659413e-05, "loss": 1.0415597915649415, "num_input_tokens_seen": 20955934848, "step": 73680, "train_runtime": 717693.8117, "train_tokens_per_second": 29198.991 }, { "epoch": 2.607297100664076, "grad_norm": 1.5703125, "learning_rate": 1.728366400746036e-05, "loss": 1.0307459831237793, "num_input_tokens_seen": 20958793728, "step": 73690, "train_runtime": 717791.4721, "train_tokens_per_second": 29199.001 }, { "epoch": 2.607650920927805, "grad_norm": 1.6171875, "learning_rate": 1.7282631487341668e-05, "loss": 1.0376344680786134, "num_input_tokens_seen": 20961629568, "step": 73700, "train_runtime": 717887.5523, "train_tokens_per_second": 29199.043 }, { "epoch": 2.608004741191534, "grad_norm": 1.6484375, "learning_rate": 1.728159915224805e-05, "loss": 1.049967098236084, "num_input_tokens_seen": 20964455104, "step": 73710, "train_runtime": 717983.9662, "train_tokens_per_second": 29199.057 }, { "epoch": 2.6083585614552627, "grad_norm": 1.5625, "learning_rate": 1.728056700212426e-05, "loss": 1.0371708869934082, "num_input_tokens_seen": 20967304832, "step": 73720, "train_runtime": 718080.292, "train_tokens_per_second": 29199.109 }, { "epoch": 2.6087123817189917, "grad_norm": 1.6796875, "learning_rate": 1.7279535036915067e-05, "loss": 1.0324953079223633, "num_input_tokens_seen": 20970106624, "step": 73730, "train_runtime": 718175.5644, "train_tokens_per_second": 29199.137 }, { "epoch": 2.60906620198272, "grad_norm": 1.6171875, "learning_rate": 1.727850325656526e-05, "loss": 1.0304928779602052, "num_input_tokens_seen": 20972956032, "step": 73740, "train_runtime": 718271.1502, "train_tokens_per_second": 29199.218 }, { "epoch": 2.609420022246449, "grad_norm": 1.609375, "learning_rate": 1.7277471661019656e-05, "loss": 1.036383056640625, "num_input_tokens_seen": 20975826112, "step": 73750, "train_runtime": 718370.2301, "train_tokens_per_second": 29199.186 }, { "epoch": 2.6097738425101777, "grad_norm": 1.5703125, "learning_rate": 1.7276440250223096e-05, "loss": 1.0376932144165039, "num_input_tokens_seen": 20978662528, "step": 73760, "train_runtime": 718467.4619, "train_tokens_per_second": 29199.182 }, { "epoch": 2.6101276627739067, "grad_norm": 1.640625, "learning_rate": 1.727540902412044e-05, "loss": 1.0252016067504883, "num_input_tokens_seen": 20981486208, "step": 73770, "train_runtime": 718562.312, "train_tokens_per_second": 29199.258 }, { "epoch": 2.6104814830376353, "grad_norm": 1.6171875, "learning_rate": 1.7274377982656575e-05, "loss": 1.0442005157470704, "num_input_tokens_seen": 20984376768, "step": 73780, "train_runtime": 718660.5852, "train_tokens_per_second": 29199.287 }, { "epoch": 2.6108353033013643, "grad_norm": 1.5859375, "learning_rate": 1.7273347125776408e-05, "loss": 1.0230806350708008, "num_input_tokens_seen": 20987196416, "step": 73790, "train_runtime": 718758.1953, "train_tokens_per_second": 29199.245 }, { "epoch": 2.611189123565093, "grad_norm": 1.5390625, "learning_rate": 1.727231645342487e-05, "loss": 1.0253418922424316, "num_input_tokens_seen": 20990048384, "step": 73800, "train_runtime": 718856.626, "train_tokens_per_second": 29199.214 }, { "epoch": 2.611542943828822, "grad_norm": 1.59375, "learning_rate": 1.727128596554691e-05, "loss": 1.0244155883789063, "num_input_tokens_seen": 20992882624, "step": 73810, "train_runtime": 718954.6303, "train_tokens_per_second": 29199.176 }, { "epoch": 2.611896764092551, "grad_norm": 1.6640625, "learning_rate": 1.7270255662087515e-05, "loss": 1.032984447479248, "num_input_tokens_seen": 20995766208, "step": 73820, "train_runtime": 719053.6397, "train_tokens_per_second": 29199.165 }, { "epoch": 2.6122505843562793, "grad_norm": 1.5078125, "learning_rate": 1.7269225542991676e-05, "loss": 1.0242673873901367, "num_input_tokens_seen": 20998585920, "step": 73830, "train_runtime": 719148.2073, "train_tokens_per_second": 29199.247 }, { "epoch": 2.612604404620008, "grad_norm": 1.578125, "learning_rate": 1.726819560820442e-05, "loss": 1.039299774169922, "num_input_tokens_seen": 21001371392, "step": 73840, "train_runtime": 719241.1253, "train_tokens_per_second": 29199.347 }, { "epoch": 2.612958224883737, "grad_norm": 1.625, "learning_rate": 1.7267165857670794e-05, "loss": 1.0338326454162599, "num_input_tokens_seen": 21004203648, "step": 73850, "train_runtime": 719340.1325, "train_tokens_per_second": 29199.266 }, { "epoch": 2.613312045147466, "grad_norm": 1.5625, "learning_rate": 1.7266136291335867e-05, "loss": 1.0424266815185548, "num_input_tokens_seen": 21007036032, "step": 73860, "train_runtime": 719435.1436, "train_tokens_per_second": 29199.346 }, { "epoch": 2.6136658654111944, "grad_norm": 1.6328125, "learning_rate": 1.726510690914472e-05, "loss": 1.0373186111450194, "num_input_tokens_seen": 21009850816, "step": 73870, "train_runtime": 719529.2785, "train_tokens_per_second": 29199.438 }, { "epoch": 2.614019685674923, "grad_norm": 1.6484375, "learning_rate": 1.7264077711042482e-05, "loss": 1.0241134643554688, "num_input_tokens_seen": 21012699328, "step": 73880, "train_runtime": 719628.5507, "train_tokens_per_second": 29199.369 }, { "epoch": 2.614373505938652, "grad_norm": 1.640625, "learning_rate": 1.7263048696974286e-05, "loss": 1.0393528938293457, "num_input_tokens_seen": 21015604288, "step": 73890, "train_runtime": 719728.6768, "train_tokens_per_second": 29199.343 }, { "epoch": 2.614727326202381, "grad_norm": 1.5859375, "learning_rate": 1.7262019866885286e-05, "loss": 1.04998836517334, "num_input_tokens_seen": 21018489536, "step": 73900, "train_runtime": 719826.7672, "train_tokens_per_second": 29199.372 }, { "epoch": 2.6150811464661095, "grad_norm": 1.59375, "learning_rate": 1.7260991220720677e-05, "loss": 1.0311408042907715, "num_input_tokens_seen": 21021335488, "step": 73910, "train_runtime": 719921.3844, "train_tokens_per_second": 29199.488 }, { "epoch": 2.6154349667298384, "grad_norm": 1.609375, "learning_rate": 1.7259962758425654e-05, "loss": 1.0251912117004394, "num_input_tokens_seen": 21024135552, "step": 73920, "train_runtime": 720014.3039, "train_tokens_per_second": 29199.608 }, { "epoch": 2.615788786993567, "grad_norm": 1.6484375, "learning_rate": 1.725893447994545e-05, "loss": 1.02861328125, "num_input_tokens_seen": 21026949824, "step": 73930, "train_runtime": 720108.6876, "train_tokens_per_second": 29199.689 }, { "epoch": 2.616142607257296, "grad_norm": 1.625, "learning_rate": 1.725790638522532e-05, "loss": 1.035659408569336, "num_input_tokens_seen": 21029835200, "step": 73940, "train_runtime": 720208.9361, "train_tokens_per_second": 29199.631 }, { "epoch": 2.6164964275210245, "grad_norm": 1.5703125, "learning_rate": 1.7256878474210535e-05, "loss": 1.035560131072998, "num_input_tokens_seen": 21032660032, "step": 73950, "train_runtime": 720305.3489, "train_tokens_per_second": 29199.644 }, { "epoch": 2.6168502477847535, "grad_norm": 1.6171875, "learning_rate": 1.7255850746846394e-05, "loss": 1.0434463500976563, "num_input_tokens_seen": 21035511104, "step": 73960, "train_runtime": 720404.1238, "train_tokens_per_second": 29199.598 }, { "epoch": 2.6172040680484825, "grad_norm": 1.59375, "learning_rate": 1.7254823203078215e-05, "loss": 1.0365983963012695, "num_input_tokens_seen": 21038345728, "step": 73970, "train_runtime": 720505.7835, "train_tokens_per_second": 29199.413 }, { "epoch": 2.617557888312211, "grad_norm": 1.6796875, "learning_rate": 1.7253795842851346e-05, "loss": 1.0441009521484375, "num_input_tokens_seen": 21041184256, "step": 73980, "train_runtime": 720601.0707, "train_tokens_per_second": 29199.491 }, { "epoch": 2.6179117085759396, "grad_norm": 1.5390625, "learning_rate": 1.7252768666111146e-05, "loss": 1.0465215682983398, "num_input_tokens_seen": 21044001600, "step": 73990, "train_runtime": 720697.1523, "train_tokens_per_second": 29199.507 }, { "epoch": 2.6182655288396686, "grad_norm": 1.6484375, "learning_rate": 1.725174167280301e-05, "loss": 1.0304261207580567, "num_input_tokens_seen": 21046825920, "step": 74000, "train_runtime": 720794.0376, "train_tokens_per_second": 29199.501 }, { "epoch": 2.6186193491033976, "grad_norm": 1.578125, "learning_rate": 1.7250714862872344e-05, "loss": 1.044468307495117, "num_input_tokens_seen": 21049622976, "step": 74010, "train_runtime": 720885.9618, "train_tokens_per_second": 29199.657 }, { "epoch": 2.618973169367126, "grad_norm": 1.5859375, "learning_rate": 1.7249688236264586e-05, "loss": 1.0491365432739257, "num_input_tokens_seen": 21052515648, "step": 74020, "train_runtime": 720982.4094, "train_tokens_per_second": 29199.763 }, { "epoch": 2.6193269896308546, "grad_norm": 1.5546875, "learning_rate": 1.7248661792925187e-05, "loss": 1.0313045501708984, "num_input_tokens_seen": 21055384128, "step": 74030, "train_runtime": 721079.7161, "train_tokens_per_second": 29199.801 }, { "epoch": 2.6196808098945836, "grad_norm": 1.5859375, "learning_rate": 1.7247635532799638e-05, "loss": 1.0591121673583985, "num_input_tokens_seen": 21058265024, "step": 74040, "train_runtime": 721180.0187, "train_tokens_per_second": 29199.734 }, { "epoch": 2.6200346301583126, "grad_norm": 1.6015625, "learning_rate": 1.7246609455833433e-05, "loss": 1.0504627227783203, "num_input_tokens_seen": 21061118592, "step": 74050, "train_runtime": 721278.7323, "train_tokens_per_second": 29199.694 }, { "epoch": 2.620388450422041, "grad_norm": 1.5234375, "learning_rate": 1.7245583561972093e-05, "loss": 1.0431556701660156, "num_input_tokens_seen": 21063940864, "step": 74060, "train_runtime": 721373.6164, "train_tokens_per_second": 29199.766 }, { "epoch": 2.62074227068577, "grad_norm": 1.59375, "learning_rate": 1.724455785116118e-05, "loss": 1.0296178817749024, "num_input_tokens_seen": 21066691904, "step": 74070, "train_runtime": 721463.8437, "train_tokens_per_second": 29199.927 }, { "epoch": 2.6210960909494987, "grad_norm": 1.53125, "learning_rate": 1.7243532323346245e-05, "loss": 1.0335490226745605, "num_input_tokens_seen": 21069529344, "step": 74080, "train_runtime": 721562.0348, "train_tokens_per_second": 29199.886 }, { "epoch": 2.6214499112132277, "grad_norm": 1.609375, "learning_rate": 1.7242506978472894e-05, "loss": 1.035957145690918, "num_input_tokens_seen": 21072362368, "step": 74090, "train_runtime": 721660.9655, "train_tokens_per_second": 29199.809 }, { "epoch": 2.6218037314769562, "grad_norm": 1.625, "learning_rate": 1.724148181648674e-05, "loss": 1.031332015991211, "num_input_tokens_seen": 21075212032, "step": 74100, "train_runtime": 721759.466, "train_tokens_per_second": 29199.772 }, { "epoch": 2.622157551740685, "grad_norm": 1.65625, "learning_rate": 1.7240456837333422e-05, "loss": 1.0312532424926757, "num_input_tokens_seen": 21078059712, "step": 74110, "train_runtime": 721858.2957, "train_tokens_per_second": 29199.719 }, { "epoch": 2.6225113720044138, "grad_norm": 1.65625, "learning_rate": 1.72394320409586e-05, "loss": 1.026190185546875, "num_input_tokens_seen": 21080842944, "step": 74120, "train_runtime": 721951.8409, "train_tokens_per_second": 29199.791 }, { "epoch": 2.6228651922681427, "grad_norm": 1.59375, "learning_rate": 1.7238407427307952e-05, "loss": 1.048473834991455, "num_input_tokens_seen": 21083691840, "step": 74130, "train_runtime": 722049.6095, "train_tokens_per_second": 29199.783 }, { "epoch": 2.6232190125318713, "grad_norm": 1.6328125, "learning_rate": 1.7237382996327196e-05, "loss": 1.0365747451782226, "num_input_tokens_seen": 21086498176, "step": 74140, "train_runtime": 722145.556, "train_tokens_per_second": 29199.789 }, { "epoch": 2.6235728327956003, "grad_norm": 1.5390625, "learning_rate": 1.7236358747962054e-05, "loss": 1.034881591796875, "num_input_tokens_seen": 21089361856, "step": 74150, "train_runtime": 722245.9049, "train_tokens_per_second": 29199.697 }, { "epoch": 2.6239266530593293, "grad_norm": 1.6484375, "learning_rate": 1.723533468215827e-05, "loss": 1.0393529891967774, "num_input_tokens_seen": 21092201920, "step": 74160, "train_runtime": 722342.9705, "train_tokens_per_second": 29199.705 }, { "epoch": 2.624280473323058, "grad_norm": 1.5546875, "learning_rate": 1.7234310798861627e-05, "loss": 1.0304763793945313, "num_input_tokens_seen": 21095045888, "step": 74170, "train_runtime": 722441.9564, "train_tokens_per_second": 29199.641 }, { "epoch": 2.6246342935867863, "grad_norm": 1.5703125, "learning_rate": 1.723328709801792e-05, "loss": 1.029227066040039, "num_input_tokens_seen": 21097907136, "step": 74180, "train_runtime": 722538.778, "train_tokens_per_second": 29199.688 }, { "epoch": 2.6249881138505153, "grad_norm": 1.6171875, "learning_rate": 1.7232263579572966e-05, "loss": 1.0462636947631836, "num_input_tokens_seen": 21100776960, "step": 74190, "train_runtime": 722635.0065, "train_tokens_per_second": 29199.771 }, { "epoch": 2.6253419341142443, "grad_norm": 1.5625, "learning_rate": 1.723124024347261e-05, "loss": 1.0322845458984375, "num_input_tokens_seen": 21103612416, "step": 74200, "train_runtime": 722733.6798, "train_tokens_per_second": 29199.708 }, { "epoch": 2.625695754377973, "grad_norm": 1.6640625, "learning_rate": 1.723021708966271e-05, "loss": 1.0425363540649415, "num_input_tokens_seen": 21106506368, "step": 74210, "train_runtime": 722835.2299, "train_tokens_per_second": 29199.609 }, { "epoch": 2.626049574641702, "grad_norm": 1.65625, "learning_rate": 1.7229194118089154e-05, "loss": 1.0427579879760742, "num_input_tokens_seen": 21109353856, "step": 74220, "train_runtime": 722935.5759, "train_tokens_per_second": 29199.495 }, { "epoch": 2.6264033949054304, "grad_norm": 1.6171875, "learning_rate": 1.7228171328697853e-05, "loss": 1.0292658805847168, "num_input_tokens_seen": 21112211456, "step": 74230, "train_runtime": 723033.1067, "train_tokens_per_second": 29199.509 }, { "epoch": 2.6267572151691594, "grad_norm": 1.6171875, "learning_rate": 1.7227148721434737e-05, "loss": 1.0247881889343262, "num_input_tokens_seen": 21115057344, "step": 74240, "train_runtime": 723128.9698, "train_tokens_per_second": 29199.573 }, { "epoch": 2.627111035432888, "grad_norm": 1.59375, "learning_rate": 1.7226126296245764e-05, "loss": 1.0402429580688477, "num_input_tokens_seen": 21117978752, "step": 74250, "train_runtime": 723232.2662, "train_tokens_per_second": 29199.442 }, { "epoch": 2.627464855696617, "grad_norm": 1.5859375, "learning_rate": 1.7225104053076904e-05, "loss": 1.0497488021850585, "num_input_tokens_seen": 21120835712, "step": 74260, "train_runtime": 723331.0984, "train_tokens_per_second": 29199.402 }, { "epoch": 2.6278186759603455, "grad_norm": 1.5625, "learning_rate": 1.722408199187416e-05, "loss": 1.0302837371826172, "num_input_tokens_seen": 21123661312, "step": 74270, "train_runtime": 723428.0854, "train_tokens_per_second": 29199.393 }, { "epoch": 2.6281724962240745, "grad_norm": 1.6171875, "learning_rate": 1.722306011258355e-05, "loss": 1.0460431098937988, "num_input_tokens_seen": 21126457792, "step": 74280, "train_runtime": 723523.2487, "train_tokens_per_second": 29199.418 }, { "epoch": 2.628526316487803, "grad_norm": 1.640625, "learning_rate": 1.7222038415151115e-05, "loss": 1.0201163291931152, "num_input_tokens_seen": 21129291136, "step": 74290, "train_runtime": 723620.8537, "train_tokens_per_second": 29199.395 }, { "epoch": 2.628880136751532, "grad_norm": 1.5625, "learning_rate": 1.7221016899522925e-05, "loss": 1.0347099304199219, "num_input_tokens_seen": 21132155264, "step": 74300, "train_runtime": 723718.9605, "train_tokens_per_second": 29199.394 }, { "epoch": 2.629233957015261, "grad_norm": 1.578125, "learning_rate": 1.7219995565645076e-05, "loss": 1.0411623001098633, "num_input_tokens_seen": 21135021504, "step": 74310, "train_runtime": 723816.8073, "train_tokens_per_second": 29199.407 }, { "epoch": 2.6295877772789895, "grad_norm": 1.5859375, "learning_rate": 1.721897441346366e-05, "loss": 1.030312728881836, "num_input_tokens_seen": 21137851712, "step": 74320, "train_runtime": 723911.1569, "train_tokens_per_second": 29199.511 }, { "epoch": 2.629941597542718, "grad_norm": 1.6171875, "learning_rate": 1.721795344292483e-05, "loss": 1.036593246459961, "num_input_tokens_seen": 21140660928, "step": 74330, "train_runtime": 724006.5529, "train_tokens_per_second": 29199.544 }, { "epoch": 2.630295417806447, "grad_norm": 1.609375, "learning_rate": 1.7216932653974727e-05, "loss": 1.0361680030822753, "num_input_tokens_seen": 21143533184, "step": 74340, "train_runtime": 724104.2379, "train_tokens_per_second": 29199.571 }, { "epoch": 2.630649238070176, "grad_norm": 1.59375, "learning_rate": 1.7215912046559533e-05, "loss": 1.0328497886657715, "num_input_tokens_seen": 21146320576, "step": 74350, "train_runtime": 724200.5488, "train_tokens_per_second": 29199.537 }, { "epoch": 2.6310030583339046, "grad_norm": 1.59375, "learning_rate": 1.7214891620625454e-05, "loss": 1.048986053466797, "num_input_tokens_seen": 21149176960, "step": 74360, "train_runtime": 724297.9381, "train_tokens_per_second": 29199.554 }, { "epoch": 2.631356878597633, "grad_norm": 1.6171875, "learning_rate": 1.7213871376118704e-05, "loss": 1.041756820678711, "num_input_tokens_seen": 21152039488, "step": 74370, "train_runtime": 724393.7982, "train_tokens_per_second": 29199.642 }, { "epoch": 2.631710698861362, "grad_norm": 1.734375, "learning_rate": 1.721285131298553e-05, "loss": 1.050881576538086, "num_input_tokens_seen": 21154890176, "step": 74380, "train_runtime": 724490.4371, "train_tokens_per_second": 29199.682 }, { "epoch": 2.632064519125091, "grad_norm": 1.609375, "learning_rate": 1.72118314311722e-05, "loss": 1.0407476425170898, "num_input_tokens_seen": 21157692672, "step": 74390, "train_runtime": 724586.1303, "train_tokens_per_second": 29199.693 }, { "epoch": 2.6324183393888196, "grad_norm": 1.6015625, "learning_rate": 1.7210811730625004e-05, "loss": 1.0424415588378906, "num_input_tokens_seen": 21160574016, "step": 74400, "train_runtime": 724685.8502, "train_tokens_per_second": 29199.651 }, { "epoch": 2.6327721596525486, "grad_norm": 1.609375, "learning_rate": 1.720979221129026e-05, "loss": 1.0314376831054688, "num_input_tokens_seen": 21163414784, "step": 74410, "train_runtime": 724781.8073, "train_tokens_per_second": 29199.705 }, { "epoch": 2.633125979916277, "grad_norm": 1.7265625, "learning_rate": 1.7208772873114285e-05, "loss": 1.0495695114135741, "num_input_tokens_seen": 21166249216, "step": 74420, "train_runtime": 724877.0093, "train_tokens_per_second": 29199.78 }, { "epoch": 2.633479800180006, "grad_norm": 1.5625, "learning_rate": 1.720775371604345e-05, "loss": 1.0367534637451172, "num_input_tokens_seen": 21169072000, "step": 74430, "train_runtime": 724972.4333, "train_tokens_per_second": 29199.83 }, { "epoch": 2.6338336204437347, "grad_norm": 1.59375, "learning_rate": 1.7206734740024123e-05, "loss": 1.0510353088378905, "num_input_tokens_seen": 21171826496, "step": 74440, "train_runtime": 725067.7745, "train_tokens_per_second": 29199.79 }, { "epoch": 2.6341874407074637, "grad_norm": 1.59375, "learning_rate": 1.7205715945002714e-05, "loss": 1.0388142585754394, "num_input_tokens_seen": 21174732928, "step": 74450, "train_runtime": 725168.8324, "train_tokens_per_second": 29199.728 }, { "epoch": 2.6345412609711922, "grad_norm": 1.6328125, "learning_rate": 1.720469733092564e-05, "loss": 1.0323932647705079, "num_input_tokens_seen": 21177572160, "step": 74460, "train_runtime": 725262.3191, "train_tokens_per_second": 29199.879 }, { "epoch": 2.634895081234921, "grad_norm": 1.578125, "learning_rate": 1.7203678897739344e-05, "loss": 1.0400453567504884, "num_input_tokens_seen": 21180421568, "step": 74470, "train_runtime": 725361.6561, "train_tokens_per_second": 29199.809 }, { "epoch": 2.6352489014986498, "grad_norm": 1.671875, "learning_rate": 1.72026606453903e-05, "loss": 1.0249276161193848, "num_input_tokens_seen": 21183226624, "step": 74480, "train_runtime": 725457.8868, "train_tokens_per_second": 29199.802 }, { "epoch": 2.6356027217623788, "grad_norm": 1.609375, "learning_rate": 1.7201642573824997e-05, "loss": 1.038792324066162, "num_input_tokens_seen": 21186133120, "step": 74490, "train_runtime": 725556.983, "train_tokens_per_second": 29199.82 }, { "epoch": 2.6359565420261077, "grad_norm": 1.5859375, "learning_rate": 1.7200624682989938e-05, "loss": 1.026932430267334, "num_input_tokens_seen": 21188933696, "step": 74500, "train_runtime": 725653.0895, "train_tokens_per_second": 29199.812 }, { "epoch": 2.6363103622898363, "grad_norm": 1.6015625, "learning_rate": 1.7199606972831665e-05, "loss": 1.0308568000793457, "num_input_tokens_seen": 21191812480, "step": 74510, "train_runtime": 725751.258, "train_tokens_per_second": 29199.829 }, { "epoch": 2.636664182553565, "grad_norm": 1.625, "learning_rate": 1.7198589443296727e-05, "loss": 1.0433834075927735, "num_input_tokens_seen": 21194666944, "step": 74520, "train_runtime": 725849.0859, "train_tokens_per_second": 29199.826 }, { "epoch": 2.637018002817294, "grad_norm": 1.625, "learning_rate": 1.7197572094331708e-05, "loss": 1.0306610107421874, "num_input_tokens_seen": 21197567488, "step": 74530, "train_runtime": 725950.0252, "train_tokens_per_second": 29199.761 }, { "epoch": 2.637371823081023, "grad_norm": 1.6171875, "learning_rate": 1.7196554925883205e-05, "loss": 1.034794235229492, "num_input_tokens_seen": 21200438720, "step": 74540, "train_runtime": 726049.6604, "train_tokens_per_second": 29199.709 }, { "epoch": 2.6377256433447513, "grad_norm": 1.6328125, "learning_rate": 1.719553793789784e-05, "loss": 1.018881893157959, "num_input_tokens_seen": 21203302528, "step": 74550, "train_runtime": 726148.7516, "train_tokens_per_second": 29199.668 }, { "epoch": 2.6380794636084803, "grad_norm": 1.6328125, "learning_rate": 1.7194521130322257e-05, "loss": 1.032090950012207, "num_input_tokens_seen": 21206112320, "step": 74560, "train_runtime": 726244.9481, "train_tokens_per_second": 29199.669 }, { "epoch": 2.638433283872209, "grad_norm": 1.6796875, "learning_rate": 1.719350450310313e-05, "loss": 1.0204669952392578, "num_input_tokens_seen": 21208951360, "step": 74570, "train_runtime": 726342.0291, "train_tokens_per_second": 29199.675 }, { "epoch": 2.638787104135938, "grad_norm": 1.6484375, "learning_rate": 1.719248805618713e-05, "loss": 1.0472336769104005, "num_input_tokens_seen": 21211793536, "step": 74580, "train_runtime": 726437.0486, "train_tokens_per_second": 29199.768 }, { "epoch": 2.6391409243996664, "grad_norm": 1.546875, "learning_rate": 1.7191471789520986e-05, "loss": 1.047210693359375, "num_input_tokens_seen": 21214634752, "step": 74590, "train_runtime": 726534.8444, "train_tokens_per_second": 29199.749 }, { "epoch": 2.6394947446633954, "grad_norm": 1.640625, "learning_rate": 1.7190455703051418e-05, "loss": 1.043419647216797, "num_input_tokens_seen": 21217478016, "step": 74600, "train_runtime": 726632.3109, "train_tokens_per_second": 29199.745 }, { "epoch": 2.639848564927124, "grad_norm": 1.5546875, "learning_rate": 1.718943979672519e-05, "loss": 1.0348834991455078, "num_input_tokens_seen": 21220320320, "step": 74610, "train_runtime": 726729.9157, "train_tokens_per_second": 29199.734 }, { "epoch": 2.640202385190853, "grad_norm": 1.625, "learning_rate": 1.7188424070489067e-05, "loss": 1.0420114517211914, "num_input_tokens_seen": 21223128576, "step": 74620, "train_runtime": 726826.1247, "train_tokens_per_second": 29199.733 }, { "epoch": 2.6405562054545815, "grad_norm": 1.640625, "learning_rate": 1.718740852428986e-05, "loss": 1.0460393905639649, "num_input_tokens_seen": 21226022720, "step": 74630, "train_runtime": 726924.6718, "train_tokens_per_second": 29199.756 }, { "epoch": 2.6409100257183105, "grad_norm": 1.640625, "learning_rate": 1.7186393158074376e-05, "loss": 1.0293766021728517, "num_input_tokens_seen": 21228902464, "step": 74640, "train_runtime": 727025.7648, "train_tokens_per_second": 29199.656 }, { "epoch": 2.6412638459820394, "grad_norm": 1.5703125, "learning_rate": 1.7185377971789472e-05, "loss": 1.041979694366455, "num_input_tokens_seen": 21231730240, "step": 74650, "train_runtime": 727120.7565, "train_tokens_per_second": 29199.731 }, { "epoch": 2.641617666245768, "grad_norm": 1.6328125, "learning_rate": 1.7184362965382004e-05, "loss": 1.031626319885254, "num_input_tokens_seen": 21234550016, "step": 74660, "train_runtime": 727214.8759, "train_tokens_per_second": 29199.829 }, { "epoch": 2.6419714865094965, "grad_norm": 1.609375, "learning_rate": 1.7183348138798857e-05, "loss": 1.0462791442871093, "num_input_tokens_seen": 21237429248, "step": 74670, "train_runtime": 727313.7568, "train_tokens_per_second": 29199.818 }, { "epoch": 2.6423253067732255, "grad_norm": 1.5546875, "learning_rate": 1.7182333491986944e-05, "loss": 1.0363322257995606, "num_input_tokens_seen": 21240264064, "step": 74680, "train_runtime": 727411.2577, "train_tokens_per_second": 29199.801 }, { "epoch": 2.6426791270369545, "grad_norm": 1.5859375, "learning_rate": 1.7181319024893197e-05, "loss": 1.0504075050354005, "num_input_tokens_seen": 21243128064, "step": 74690, "train_runtime": 727509.9125, "train_tokens_per_second": 29199.778 }, { "epoch": 2.643032947300683, "grad_norm": 1.6328125, "learning_rate": 1.7180304737464563e-05, "loss": 1.026515579223633, "num_input_tokens_seen": 21245930688, "step": 74700, "train_runtime": 727606.6252, "train_tokens_per_second": 29199.749 }, { "epoch": 2.6433867675644116, "grad_norm": 1.578125, "learning_rate": 1.717929062964802e-05, "loss": 1.0485559463500977, "num_input_tokens_seen": 21248833792, "step": 74710, "train_runtime": 727708.4474, "train_tokens_per_second": 29199.653 }, { "epoch": 2.6437405878281406, "grad_norm": 1.6640625, "learning_rate": 1.7178276701390557e-05, "loss": 1.0422436714172363, "num_input_tokens_seen": 21251690944, "step": 74720, "train_runtime": 727805.41, "train_tokens_per_second": 29199.688 }, { "epoch": 2.6440944080918696, "grad_norm": 1.59375, "learning_rate": 1.7177262952639204e-05, "loss": 1.0311418533325196, "num_input_tokens_seen": 21254541952, "step": 74730, "train_runtime": 727904.8917, "train_tokens_per_second": 29199.614 }, { "epoch": 2.644448228355598, "grad_norm": 1.5859375, "learning_rate": 1.7176249383340994e-05, "loss": 1.0247024536132812, "num_input_tokens_seen": 21257403136, "step": 74740, "train_runtime": 728002.3932, "train_tokens_per_second": 29199.634 }, { "epoch": 2.644802048619327, "grad_norm": 1.59375, "learning_rate": 1.7175235993442985e-05, "loss": 1.0401777267456054, "num_input_tokens_seen": 21260179008, "step": 74750, "train_runtime": 728093.3756, "train_tokens_per_second": 29199.797 }, { "epoch": 2.6451558688830556, "grad_norm": 1.5859375, "learning_rate": 1.7174222782892264e-05, "loss": 1.0415636062622071, "num_input_tokens_seen": 21262949312, "step": 74760, "train_runtime": 728188.3887, "train_tokens_per_second": 29199.792 }, { "epoch": 2.6455096891467846, "grad_norm": 1.5859375, "learning_rate": 1.717320975163594e-05, "loss": 1.0264537811279297, "num_input_tokens_seen": 21265767488, "step": 74770, "train_runtime": 728283.9994, "train_tokens_per_second": 29199.828 }, { "epoch": 2.645863509410513, "grad_norm": 1.5625, "learning_rate": 1.717219689962114e-05, "loss": 1.046554183959961, "num_input_tokens_seen": 21268573504, "step": 74780, "train_runtime": 728379.2885, "train_tokens_per_second": 29199.86 }, { "epoch": 2.646217329674242, "grad_norm": 1.625, "learning_rate": 1.717118422679501e-05, "loss": 1.0348100662231445, "num_input_tokens_seen": 21271434688, "step": 74790, "train_runtime": 728475.4318, "train_tokens_per_second": 29199.934 }, { "epoch": 2.646571149937971, "grad_norm": 1.609375, "learning_rate": 1.7170171733104716e-05, "loss": 1.0371975898742676, "num_input_tokens_seen": 21274258048, "step": 74800, "train_runtime": 728571.622, "train_tokens_per_second": 29199.954 }, { "epoch": 2.6469249702016997, "grad_norm": 1.578125, "learning_rate": 1.7169159418497464e-05, "loss": 1.036684799194336, "num_input_tokens_seen": 21277078912, "step": 74810, "train_runtime": 728668.3679, "train_tokens_per_second": 29199.949 }, { "epoch": 2.6472787904654282, "grad_norm": 1.609375, "learning_rate": 1.716814728292046e-05, "loss": 1.0544466018676757, "num_input_tokens_seen": 21279938368, "step": 74820, "train_runtime": 728764.7516, "train_tokens_per_second": 29200.01 }, { "epoch": 2.6476326107291572, "grad_norm": 1.578125, "learning_rate": 1.716713532632094e-05, "loss": 1.045415496826172, "num_input_tokens_seen": 21282810560, "step": 74830, "train_runtime": 728863.4154, "train_tokens_per_second": 29199.998 }, { "epoch": 2.647986430992886, "grad_norm": 1.53125, "learning_rate": 1.7166123548646162e-05, "loss": 1.0398288726806642, "num_input_tokens_seen": 21285690624, "step": 74840, "train_runtime": 728964.6349, "train_tokens_per_second": 29199.895 }, { "epoch": 2.6483402512566148, "grad_norm": 1.6640625, "learning_rate": 1.7165111949843414e-05, "loss": 1.0555944442749023, "num_input_tokens_seen": 21288509504, "step": 74850, "train_runtime": 729062.868, "train_tokens_per_second": 29199.827 }, { "epoch": 2.6486940715203433, "grad_norm": 1.5703125, "learning_rate": 1.7164100529859983e-05, "loss": 1.035882568359375, "num_input_tokens_seen": 21291339008, "step": 74860, "train_runtime": 729158.5095, "train_tokens_per_second": 29199.877 }, { "epoch": 2.6490478917840723, "grad_norm": 1.5859375, "learning_rate": 1.7163089288643202e-05, "loss": 1.030413818359375, "num_input_tokens_seen": 21294160896, "step": 74870, "train_runtime": 729256.7594, "train_tokens_per_second": 29199.813 }, { "epoch": 2.6494017120478013, "grad_norm": 1.5390625, "learning_rate": 1.716207822614042e-05, "loss": 1.037015151977539, "num_input_tokens_seen": 21296970304, "step": 74880, "train_runtime": 729352.4204, "train_tokens_per_second": 29199.835 }, { "epoch": 2.64975553231153, "grad_norm": 1.640625, "learning_rate": 1.7161067342298994e-05, "loss": 1.0456188201904297, "num_input_tokens_seen": 21299887296, "step": 74890, "train_runtime": 729453.983, "train_tokens_per_second": 29199.768 }, { "epoch": 2.650109352575259, "grad_norm": 1.546875, "learning_rate": 1.716005663706632e-05, "loss": 1.0318016052246093, "num_input_tokens_seen": 21302715392, "step": 74900, "train_runtime": 729550.8831, "train_tokens_per_second": 29199.766 }, { "epoch": 2.6504631728389874, "grad_norm": 1.6171875, "learning_rate": 1.71590461103898e-05, "loss": 1.03843994140625, "num_input_tokens_seen": 21305607168, "step": 74910, "train_runtime": 729650.1633, "train_tokens_per_second": 29199.757 }, { "epoch": 2.6508169931027163, "grad_norm": 1.6953125, "learning_rate": 1.7158035762216875e-05, "loss": 1.0395072937011718, "num_input_tokens_seen": 21308404736, "step": 74920, "train_runtime": 729744.8729, "train_tokens_per_second": 29199.801 }, { "epoch": 2.651170813366445, "grad_norm": 1.515625, "learning_rate": 1.715702559249499e-05, "loss": 1.045435619354248, "num_input_tokens_seen": 21311278016, "step": 74930, "train_runtime": 729843.5751, "train_tokens_per_second": 29199.788 }, { "epoch": 2.651524633630174, "grad_norm": 1.6015625, "learning_rate": 1.715601560117163e-05, "loss": 1.020213508605957, "num_input_tokens_seen": 21314162560, "step": 74940, "train_runtime": 729945.6729, "train_tokens_per_second": 29199.656 }, { "epoch": 2.6518784538939024, "grad_norm": 1.5859375, "learning_rate": 1.7155005788194283e-05, "loss": 1.0411531448364257, "num_input_tokens_seen": 21317031872, "step": 74950, "train_runtime": 730045.9934, "train_tokens_per_second": 29199.574 }, { "epoch": 2.6522322741576314, "grad_norm": 1.59375, "learning_rate": 1.7153996153510472e-05, "loss": 1.0370901107788086, "num_input_tokens_seen": 21319871040, "step": 74960, "train_runtime": 730144.5606, "train_tokens_per_second": 29199.52 }, { "epoch": 2.65258609442136, "grad_norm": 1.6328125, "learning_rate": 1.7152986697067734e-05, "loss": 1.0224742889404297, "num_input_tokens_seen": 21322697536, "step": 74970, "train_runtime": 730242.7001, "train_tokens_per_second": 29199.467 }, { "epoch": 2.652939914685089, "grad_norm": 1.546875, "learning_rate": 1.7151977418813636e-05, "loss": 1.036501979827881, "num_input_tokens_seen": 21325580480, "step": 74980, "train_runtime": 730342.232, "train_tokens_per_second": 29199.435 }, { "epoch": 2.653293734948818, "grad_norm": 1.65625, "learning_rate": 1.7150968318695755e-05, "loss": 1.0359375, "num_input_tokens_seen": 21328386432, "step": 74990, "train_runtime": 730437.573, "train_tokens_per_second": 29199.465 }, { "epoch": 2.6536475552125465, "grad_norm": 1.5078125, "learning_rate": 1.7149959396661695e-05, "loss": 1.032864475250244, "num_input_tokens_seen": 21331230016, "step": 75000, "train_runtime": 730533.9359, "train_tokens_per_second": 29199.506 }, { "epoch": 2.6536475552125465, "eval_loss": 1.0215721130371094, "eval_runtime": 8.4404, "eval_samples_per_second": 472.491, "eval_steps_per_second": 3.791, "num_input_tokens_seen": 21331230016, "step": 75000 }, { "epoch": 2.654001375476275, "grad_norm": 1.6171875, "learning_rate": 1.714895065265909e-05, "loss": 1.0244102478027344, "num_input_tokens_seen": 21334045504, "step": 75010, "train_runtime": 730659.0807, "train_tokens_per_second": 29198.358 }, { "epoch": 2.654355195740004, "grad_norm": 1.609375, "learning_rate": 1.7147942086635584e-05, "loss": 1.0343477249145507, "num_input_tokens_seen": 21336892864, "step": 75020, "train_runtime": 730757.5976, "train_tokens_per_second": 29198.318 }, { "epoch": 2.654709016003733, "grad_norm": 1.609375, "learning_rate": 1.7146933698538846e-05, "loss": 1.0260223388671874, "num_input_tokens_seen": 21339728320, "step": 75030, "train_runtime": 730851.7002, "train_tokens_per_second": 29198.438 }, { "epoch": 2.6550628362674615, "grad_norm": 1.6328125, "learning_rate": 1.714592548831657e-05, "loss": 1.043216609954834, "num_input_tokens_seen": 21342609664, "step": 75040, "train_runtime": 730951.8551, "train_tokens_per_second": 29198.38 }, { "epoch": 2.6554166565311905, "grad_norm": 1.578125, "learning_rate": 1.7144917455916462e-05, "loss": 1.0269176483154296, "num_input_tokens_seen": 21345477696, "step": 75050, "train_runtime": 731050.7073, "train_tokens_per_second": 29198.354 }, { "epoch": 2.655770476794919, "grad_norm": 1.6484375, "learning_rate": 1.7143909601286258e-05, "loss": 1.0375288009643555, "num_input_tokens_seen": 21348371520, "step": 75060, "train_runtime": 731151.7534, "train_tokens_per_second": 29198.277 }, { "epoch": 2.656124297058648, "grad_norm": 1.4921875, "learning_rate": 1.714290192437372e-05, "loss": 1.0346717834472656, "num_input_tokens_seen": 21351214976, "step": 75070, "train_runtime": 731251.7975, "train_tokens_per_second": 29198.171 }, { "epoch": 2.6564781173223766, "grad_norm": 1.6171875, "learning_rate": 1.7141894425126622e-05, "loss": 1.0467147827148438, "num_input_tokens_seen": 21354111424, "step": 75080, "train_runtime": 731353.1498, "train_tokens_per_second": 29198.085 }, { "epoch": 2.6568319375861056, "grad_norm": 1.65625, "learning_rate": 1.714088710349276e-05, "loss": 1.0321643829345704, "num_input_tokens_seen": 21356917824, "step": 75090, "train_runtime": 731447.2206, "train_tokens_per_second": 29198.167 }, { "epoch": 2.657185757849834, "grad_norm": 1.546875, "learning_rate": 1.7139879959419956e-05, "loss": 1.0531591415405273, "num_input_tokens_seen": 21359767360, "step": 75100, "train_runtime": 731543.8536, "train_tokens_per_second": 29198.205 }, { "epoch": 2.657539578113563, "grad_norm": 1.5625, "learning_rate": 1.7138872992856052e-05, "loss": 1.031565284729004, "num_input_tokens_seen": 21362590848, "step": 75110, "train_runtime": 731640.5693, "train_tokens_per_second": 29198.204 }, { "epoch": 2.6578933983772917, "grad_norm": 1.6015625, "learning_rate": 1.7137866203748908e-05, "loss": 1.0386063575744628, "num_input_tokens_seen": 21365424768, "step": 75120, "train_runtime": 731735.6473, "train_tokens_per_second": 29198.283 }, { "epoch": 2.6582472186410206, "grad_norm": 1.6015625, "learning_rate": 1.7136859592046407e-05, "loss": 1.030996322631836, "num_input_tokens_seen": 21368230656, "step": 75130, "train_runtime": 731831.1075, "train_tokens_per_second": 29198.309 }, { "epoch": 2.6586010389047496, "grad_norm": 1.5703125, "learning_rate": 1.7135853157696462e-05, "loss": 1.0491019248962403, "num_input_tokens_seen": 21371087424, "step": 75140, "train_runtime": 731931.5813, "train_tokens_per_second": 29198.204 }, { "epoch": 2.658954859168478, "grad_norm": 1.6328125, "learning_rate": 1.7134846900647e-05, "loss": 1.0347311973571778, "num_input_tokens_seen": 21373933824, "step": 75150, "train_runtime": 732027.58, "train_tokens_per_second": 29198.263 }, { "epoch": 2.6593086794322067, "grad_norm": 1.5859375, "learning_rate": 1.713384082084596e-05, "loss": 1.0353900909423828, "num_input_tokens_seen": 21376792704, "step": 75160, "train_runtime": 732124.3031, "train_tokens_per_second": 29198.31 }, { "epoch": 2.6596624996959357, "grad_norm": 1.6015625, "learning_rate": 1.713283491824132e-05, "loss": 1.0560933113098145, "num_input_tokens_seen": 21379616256, "step": 75170, "train_runtime": 732217.4212, "train_tokens_per_second": 29198.453 }, { "epoch": 2.6600163199596647, "grad_norm": 1.625, "learning_rate": 1.713182919278107e-05, "loss": 1.0321111679077148, "num_input_tokens_seen": 21382498624, "step": 75180, "train_runtime": 732319.4378, "train_tokens_per_second": 29198.322 }, { "epoch": 2.6603701402233932, "grad_norm": 1.546875, "learning_rate": 1.7130823644413222e-05, "loss": 1.0435989379882813, "num_input_tokens_seen": 21385420160, "step": 75190, "train_runtime": 732419.9259, "train_tokens_per_second": 29198.305 }, { "epoch": 2.660723960487122, "grad_norm": 1.6328125, "learning_rate": 1.712981827308581e-05, "loss": 1.0277837753295898, "num_input_tokens_seen": 21388258624, "step": 75200, "train_runtime": 732516.6042, "train_tokens_per_second": 29198.326 }, { "epoch": 2.6610777807508508, "grad_norm": 1.65625, "learning_rate": 1.712881307874689e-05, "loss": 1.0300518035888673, "num_input_tokens_seen": 21391087168, "step": 75210, "train_runtime": 732615.1944, "train_tokens_per_second": 29198.258 }, { "epoch": 2.6614316010145798, "grad_norm": 1.6171875, "learning_rate": 1.712780806134454e-05, "loss": 1.031192684173584, "num_input_tokens_seen": 21393891648, "step": 75220, "train_runtime": 732709.0888, "train_tokens_per_second": 29198.343 }, { "epoch": 2.6617854212783083, "grad_norm": 1.640625, "learning_rate": 1.7126803220826854e-05, "loss": 1.0347548484802247, "num_input_tokens_seen": 21396704512, "step": 75230, "train_runtime": 732805.2466, "train_tokens_per_second": 29198.351 }, { "epoch": 2.6621392415420373, "grad_norm": 1.5625, "learning_rate": 1.7125798557141954e-05, "loss": 1.03814697265625, "num_input_tokens_seen": 21399525952, "step": 75240, "train_runtime": 732901.1809, "train_tokens_per_second": 29198.378 }, { "epoch": 2.662493061805766, "grad_norm": 1.6328125, "learning_rate": 1.7124794070237987e-05, "loss": 1.0328025817871094, "num_input_tokens_seen": 21402350976, "step": 75250, "train_runtime": 732995.2922, "train_tokens_per_second": 29198.484 }, { "epoch": 2.662846882069495, "grad_norm": 1.609375, "learning_rate": 1.71237897600631e-05, "loss": 1.0326838493347168, "num_input_tokens_seen": 21405216576, "step": 75260, "train_runtime": 733093.2473, "train_tokens_per_second": 29198.491 }, { "epoch": 2.6632007023332234, "grad_norm": 1.5703125, "learning_rate": 1.7122785626565498e-05, "loss": 1.0329131126403808, "num_input_tokens_seen": 21408015360, "step": 75270, "train_runtime": 733187.9017, "train_tokens_per_second": 29198.539 }, { "epoch": 2.6635545225969524, "grad_norm": 1.640625, "learning_rate": 1.7121781669693363e-05, "loss": 1.0332388877868652, "num_input_tokens_seen": 21410867392, "step": 75280, "train_runtime": 733286.7728, "train_tokens_per_second": 29198.491 }, { "epoch": 2.663908342860681, "grad_norm": 1.5703125, "learning_rate": 1.7120777889394933e-05, "loss": 1.0310681343078614, "num_input_tokens_seen": 21413760192, "step": 75290, "train_runtime": 733385.29, "train_tokens_per_second": 29198.513 }, { "epoch": 2.66426216312441, "grad_norm": 1.6015625, "learning_rate": 1.711977428561845e-05, "loss": 1.039668655395508, "num_input_tokens_seen": 21416683264, "step": 75300, "train_runtime": 733487.7983, "train_tokens_per_second": 29198.418 }, { "epoch": 2.6646159833881384, "grad_norm": 1.578125, "learning_rate": 1.7118770858312188e-05, "loss": 1.0372652053833007, "num_input_tokens_seen": 21419519360, "step": 75310, "train_runtime": 733585.8413, "train_tokens_per_second": 29198.382 }, { "epoch": 2.6649698036518674, "grad_norm": 1.5625, "learning_rate": 1.7117767607424434e-05, "loss": 1.0280562400817872, "num_input_tokens_seen": 21422421760, "step": 75320, "train_runtime": 733685.1008, "train_tokens_per_second": 29198.387 }, { "epoch": 2.6653236239155964, "grad_norm": 1.5625, "learning_rate": 1.71167645329035e-05, "loss": 1.0272883415222167, "num_input_tokens_seen": 21425259456, "step": 75330, "train_runtime": 733779.1391, "train_tokens_per_second": 29198.513 }, { "epoch": 2.665677444179325, "grad_norm": 1.640625, "learning_rate": 1.7115761634697715e-05, "loss": 1.0500532150268556, "num_input_tokens_seen": 21428091328, "step": 75340, "train_runtime": 733876.3489, "train_tokens_per_second": 29198.504 }, { "epoch": 2.6660312644430535, "grad_norm": 1.6171875, "learning_rate": 1.7114758912755432e-05, "loss": 1.025968360900879, "num_input_tokens_seen": 21430920960, "step": 75350, "train_runtime": 733975.8902, "train_tokens_per_second": 29198.399 }, { "epoch": 2.6663850847067825, "grad_norm": 1.6015625, "learning_rate": 1.7113756367025033e-05, "loss": 1.0315526008605957, "num_input_tokens_seen": 21433734336, "step": 75360, "train_runtime": 734070.3819, "train_tokens_per_second": 29198.473 }, { "epoch": 2.6667389049705115, "grad_norm": 1.578125, "learning_rate": 1.71127539974549e-05, "loss": 1.043890380859375, "num_input_tokens_seen": 21436544064, "step": 75370, "train_runtime": 734165.0859, "train_tokens_per_second": 29198.534 }, { "epoch": 2.66709272523424, "grad_norm": 1.6484375, "learning_rate": 1.711175180399346e-05, "loss": 1.030762004852295, "num_input_tokens_seen": 21439364224, "step": 75380, "train_runtime": 734258.2684, "train_tokens_per_second": 29198.669 }, { "epoch": 2.667446545497969, "grad_norm": 1.6328125, "learning_rate": 1.7110749786589146e-05, "loss": 1.043888473510742, "num_input_tokens_seen": 21442223744, "step": 75390, "train_runtime": 734358.6626, "train_tokens_per_second": 29198.571 }, { "epoch": 2.6678003657616975, "grad_norm": 1.6328125, "learning_rate": 1.7109747945190424e-05, "loss": 1.0323155403137207, "num_input_tokens_seen": 21445103360, "step": 75400, "train_runtime": 734460.4135, "train_tokens_per_second": 29198.447 }, { "epoch": 2.6681541860254265, "grad_norm": 1.6171875, "learning_rate": 1.7108746279745763e-05, "loss": 1.026235866546631, "num_input_tokens_seen": 21447920640, "step": 75410, "train_runtime": 734556.3555, "train_tokens_per_second": 29198.469 }, { "epoch": 2.668508006289155, "grad_norm": 1.5703125, "learning_rate": 1.7107744790203676e-05, "loss": 1.0344736099243164, "num_input_tokens_seen": 21450836416, "step": 75420, "train_runtime": 734659.2517, "train_tokens_per_second": 29198.348 }, { "epoch": 2.668861826552884, "grad_norm": 1.640625, "learning_rate": 1.7106743476512673e-05, "loss": 1.0468305587768554, "num_input_tokens_seen": 21453674560, "step": 75430, "train_runtime": 734754.2177, "train_tokens_per_second": 29198.437 }, { "epoch": 2.6692156468166126, "grad_norm": 1.6796875, "learning_rate": 1.71057423386213e-05, "loss": 1.0296573638916016, "num_input_tokens_seen": 21456513792, "step": 75440, "train_runtime": 734848.1369, "train_tokens_per_second": 29198.569 }, { "epoch": 2.6695694670803416, "grad_norm": 1.546875, "learning_rate": 1.7104741376478137e-05, "loss": 1.0540922164916993, "num_input_tokens_seen": 21459358976, "step": 75450, "train_runtime": 734945.9334, "train_tokens_per_second": 29198.555 }, { "epoch": 2.66992328734407, "grad_norm": 1.6015625, "learning_rate": 1.710374059003175e-05, "loss": 1.037712287902832, "num_input_tokens_seen": 21462132352, "step": 75460, "train_runtime": 735039.7489, "train_tokens_per_second": 29198.601 }, { "epoch": 2.670277107607799, "grad_norm": 1.6328125, "learning_rate": 1.7102739979230753e-05, "loss": 1.0446080207824706, "num_input_tokens_seen": 21464969152, "step": 75470, "train_runtime": 735138.5454, "train_tokens_per_second": 29198.536 }, { "epoch": 2.670630927871528, "grad_norm": 1.5390625, "learning_rate": 1.7101739544023772e-05, "loss": 1.0497421264648437, "num_input_tokens_seen": 21467774336, "step": 75480, "train_runtime": 735232.2639, "train_tokens_per_second": 29198.629 }, { "epoch": 2.6709847481352567, "grad_norm": 1.5859375, "learning_rate": 1.7100739284359464e-05, "loss": 1.0534069061279296, "num_input_tokens_seen": 21470656000, "step": 75490, "train_runtime": 735330.9288, "train_tokens_per_second": 29198.63 }, { "epoch": 2.671338568398985, "grad_norm": 1.640625, "learning_rate": 1.7099739200186484e-05, "loss": 1.0326498031616211, "num_input_tokens_seen": 21473521728, "step": 75500, "train_runtime": 735426.9008, "train_tokens_per_second": 29198.717 }, { "epoch": 2.671692388662714, "grad_norm": 1.59375, "learning_rate": 1.7098739291453537e-05, "loss": 1.0296855926513673, "num_input_tokens_seen": 21476320704, "step": 75510, "train_runtime": 735521.555, "train_tokens_per_second": 29198.765 }, { "epoch": 2.672046208926443, "grad_norm": 1.6484375, "learning_rate": 1.7097739558109325e-05, "loss": 1.0396528244018555, "num_input_tokens_seen": 21479090432, "step": 75520, "train_runtime": 735614.5323, "train_tokens_per_second": 29198.839 }, { "epoch": 2.6724000291901717, "grad_norm": 1.578125, "learning_rate": 1.709674000010258e-05, "loss": 1.0329484939575195, "num_input_tokens_seen": 21482007488, "step": 75530, "train_runtime": 735718.8601, "train_tokens_per_second": 29198.664 }, { "epoch": 2.6727538494539003, "grad_norm": 1.671875, "learning_rate": 1.7095740617382063e-05, "loss": 1.0410003662109375, "num_input_tokens_seen": 21484823488, "step": 75540, "train_runtime": 735812.6114, "train_tokens_per_second": 29198.77 }, { "epoch": 2.6731076697176293, "grad_norm": 1.671875, "learning_rate": 1.7094741409896546e-05, "loss": 1.0504890441894532, "num_input_tokens_seen": 21487602816, "step": 75550, "train_runtime": 735905.7696, "train_tokens_per_second": 29198.851 }, { "epoch": 2.6734614899813582, "grad_norm": 1.59375, "learning_rate": 1.709374237759482e-05, "loss": 1.0339191436767579, "num_input_tokens_seen": 21490430208, "step": 75560, "train_runtime": 736003.2658, "train_tokens_per_second": 29198.825 }, { "epoch": 2.673815310245087, "grad_norm": 1.5546875, "learning_rate": 1.7092743520425707e-05, "loss": 1.023002815246582, "num_input_tokens_seen": 21493338944, "step": 75570, "train_runtime": 736105.3967, "train_tokens_per_second": 29198.725 }, { "epoch": 2.6741691305088158, "grad_norm": 1.5390625, "learning_rate": 1.709174483833804e-05, "loss": 1.0542022705078125, "num_input_tokens_seen": 21496185408, "step": 75580, "train_runtime": 736201.1582, "train_tokens_per_second": 29198.793 }, { "epoch": 2.6745229507725443, "grad_norm": 1.6328125, "learning_rate": 1.7090746331280686e-05, "loss": 1.0258445739746094, "num_input_tokens_seen": 21499051008, "step": 75590, "train_runtime": 736298.8177, "train_tokens_per_second": 29198.812 }, { "epoch": 2.6748767710362733, "grad_norm": 1.609375, "learning_rate": 1.708974799920251e-05, "loss": 1.0424688339233399, "num_input_tokens_seen": 21501881216, "step": 75600, "train_runtime": 736396.0454, "train_tokens_per_second": 29198.8 }, { "epoch": 2.675230591300002, "grad_norm": 1.640625, "learning_rate": 1.7088749842052426e-05, "loss": 1.0431360244750976, "num_input_tokens_seen": 21504745920, "step": 75610, "train_runtime": 736495.8717, "train_tokens_per_second": 29198.732 }, { "epoch": 2.675584411563731, "grad_norm": 1.5546875, "learning_rate": 1.708775185977935e-05, "loss": 1.0325456619262696, "num_input_tokens_seen": 21507583360, "step": 75620, "train_runtime": 736592.5257, "train_tokens_per_second": 29198.753 }, { "epoch": 2.67593823182746, "grad_norm": 1.5625, "learning_rate": 1.7086754052332214e-05, "loss": 1.0330854415893556, "num_input_tokens_seen": 21510452928, "step": 75630, "train_runtime": 736690.9686, "train_tokens_per_second": 29198.747 }, { "epoch": 2.6762920520911884, "grad_norm": 1.671875, "learning_rate": 1.7085756419659995e-05, "loss": 1.0495521545410156, "num_input_tokens_seen": 21513343104, "step": 75640, "train_runtime": 736787.7777, "train_tokens_per_second": 29198.833 }, { "epoch": 2.676645872354917, "grad_norm": 1.6015625, "learning_rate": 1.7084758961711672e-05, "loss": 1.0358688354492187, "num_input_tokens_seen": 21516211328, "step": 75650, "train_runtime": 736886.5456, "train_tokens_per_second": 29198.811 }, { "epoch": 2.676999692618646, "grad_norm": 1.6484375, "learning_rate": 1.708376167843625e-05, "loss": 1.0378828048706055, "num_input_tokens_seen": 21519057920, "step": 75660, "train_runtime": 736983.0284, "train_tokens_per_second": 29198.851 }, { "epoch": 2.677353512882375, "grad_norm": 1.59375, "learning_rate": 1.708276456978275e-05, "loss": 1.032766342163086, "num_input_tokens_seen": 21521913728, "step": 75670, "train_runtime": 737079.7494, "train_tokens_per_second": 29198.894 }, { "epoch": 2.6777073331461034, "grad_norm": 1.609375, "learning_rate": 1.7081767635700222e-05, "loss": 1.0293581008911132, "num_input_tokens_seen": 21524808512, "step": 75680, "train_runtime": 737179.1145, "train_tokens_per_second": 29198.885 }, { "epoch": 2.678061153409832, "grad_norm": 1.59375, "learning_rate": 1.7080770876137737e-05, "loss": 1.033340072631836, "num_input_tokens_seen": 21527647104, "step": 75690, "train_runtime": 737275.8589, "train_tokens_per_second": 29198.904 }, { "epoch": 2.678414973673561, "grad_norm": 1.625, "learning_rate": 1.707977429104437e-05, "loss": 1.0170310974121093, "num_input_tokens_seen": 21530510784, "step": 75700, "train_runtime": 737373.0219, "train_tokens_per_second": 29198.94 }, { "epoch": 2.67876879393729, "grad_norm": 1.6171875, "learning_rate": 1.7078777880369244e-05, "loss": 1.0363851547241212, "num_input_tokens_seen": 21533340544, "step": 75710, "train_runtime": 737467.1289, "train_tokens_per_second": 29199.051 }, { "epoch": 2.6791226142010185, "grad_norm": 1.65625, "learning_rate": 1.7077781644061477e-05, "loss": 1.0364976882934571, "num_input_tokens_seen": 21536198336, "step": 75720, "train_runtime": 737563.0735, "train_tokens_per_second": 29199.128 }, { "epoch": 2.6794764344647475, "grad_norm": 1.5703125, "learning_rate": 1.7076785582070228e-05, "loss": 1.0350483894348144, "num_input_tokens_seen": 21539043904, "step": 75730, "train_runtime": 737659.8744, "train_tokens_per_second": 29199.154 }, { "epoch": 2.679830254728476, "grad_norm": 1.578125, "learning_rate": 1.7075789694344664e-05, "loss": 1.0489768028259276, "num_input_tokens_seen": 21541908672, "step": 75740, "train_runtime": 737756.9898, "train_tokens_per_second": 29199.193 }, { "epoch": 2.680184074992205, "grad_norm": 1.625, "learning_rate": 1.7074793980833974e-05, "loss": 1.0458626747131348, "num_input_tokens_seen": 21544763392, "step": 75750, "train_runtime": 737856.175, "train_tokens_per_second": 29199.137 }, { "epoch": 2.6805378952559336, "grad_norm": 1.609375, "learning_rate": 1.7073798441487372e-05, "loss": 1.0405797958374023, "num_input_tokens_seen": 21547567424, "step": 75760, "train_runtime": 737949.8769, "train_tokens_per_second": 29199.229 }, { "epoch": 2.6808917155196625, "grad_norm": 1.5859375, "learning_rate": 1.7072803076254092e-05, "loss": 1.0399297714233398, "num_input_tokens_seen": 21550345856, "step": 75770, "train_runtime": 738042.3357, "train_tokens_per_second": 29199.336 }, { "epoch": 2.681245535783391, "grad_norm": 1.6328125, "learning_rate": 1.707180788508339e-05, "loss": 1.0301517486572265, "num_input_tokens_seen": 21553202816, "step": 75780, "train_runtime": 738139.5367, "train_tokens_per_second": 29199.361 }, { "epoch": 2.68159935604712, "grad_norm": 1.6015625, "learning_rate": 1.707081286792454e-05, "loss": 1.0292243003845214, "num_input_tokens_seen": 21556086656, "step": 75790, "train_runtime": 738239.1521, "train_tokens_per_second": 29199.327 }, { "epoch": 2.6819531763108486, "grad_norm": 1.640625, "learning_rate": 1.7069818024726833e-05, "loss": 1.0302600860595703, "num_input_tokens_seen": 21558929152, "step": 75800, "train_runtime": 738337.2175, "train_tokens_per_second": 29199.299 }, { "epoch": 2.6823069965745776, "grad_norm": 1.671875, "learning_rate": 1.7068823355439583e-05, "loss": 1.0395679473876953, "num_input_tokens_seen": 21561794176, "step": 75810, "train_runtime": 738432.939, "train_tokens_per_second": 29199.394 }, { "epoch": 2.6826608168383066, "grad_norm": 1.609375, "learning_rate": 1.7067828860012138e-05, "loss": 1.0311152458190918, "num_input_tokens_seen": 21564658624, "step": 75820, "train_runtime": 738533.316, "train_tokens_per_second": 29199.304 }, { "epoch": 2.683014637102035, "grad_norm": 1.6171875, "learning_rate": 1.7066834538393844e-05, "loss": 1.0284954071044923, "num_input_tokens_seen": 21567477376, "step": 75830, "train_runtime": 738630.334, "train_tokens_per_second": 29199.285 }, { "epoch": 2.6833684573657637, "grad_norm": 1.625, "learning_rate": 1.7065840390534083e-05, "loss": 1.035334300994873, "num_input_tokens_seen": 21570292608, "step": 75840, "train_runtime": 738726.7679, "train_tokens_per_second": 29199.284 }, { "epoch": 2.6837222776294927, "grad_norm": 1.6796875, "learning_rate": 1.7064846416382256e-05, "loss": 1.0461501121520995, "num_input_tokens_seen": 21573104320, "step": 75850, "train_runtime": 738822.0795, "train_tokens_per_second": 29199.323 }, { "epoch": 2.6840760978932217, "grad_norm": 1.6328125, "learning_rate": 1.7063852615887773e-05, "loss": 1.0253961563110352, "num_input_tokens_seen": 21575921984, "step": 75860, "train_runtime": 738917.2108, "train_tokens_per_second": 29199.377 }, { "epoch": 2.68442991815695, "grad_norm": 1.5859375, "learning_rate": 1.7062858989000085e-05, "loss": 1.052175521850586, "num_input_tokens_seen": 21578773568, "step": 75870, "train_runtime": 739015.2728, "train_tokens_per_second": 29199.361 }, { "epoch": 2.684783738420679, "grad_norm": 1.5703125, "learning_rate": 1.7061865535668645e-05, "loss": 1.0315242767333985, "num_input_tokens_seen": 21581601600, "step": 75880, "train_runtime": 739109.9073, "train_tokens_per_second": 29199.448 }, { "epoch": 2.6851375586844077, "grad_norm": 1.5625, "learning_rate": 1.706087225584294e-05, "loss": 1.0265794754028321, "num_input_tokens_seen": 21584469952, "step": 75890, "train_runtime": 739209.3313, "train_tokens_per_second": 29199.401 }, { "epoch": 2.6854913789481367, "grad_norm": 1.609375, "learning_rate": 1.7059879149472464e-05, "loss": 1.0242912292480468, "num_input_tokens_seen": 21587296640, "step": 75900, "train_runtime": 739305.0129, "train_tokens_per_second": 29199.446 }, { "epoch": 2.6858451992118653, "grad_norm": 1.5703125, "learning_rate": 1.7058886216506746e-05, "loss": 1.047739028930664, "num_input_tokens_seen": 21590111808, "step": 75910, "train_runtime": 739398.8002, "train_tokens_per_second": 29199.549 }, { "epoch": 2.6861990194755943, "grad_norm": 1.5625, "learning_rate": 1.705789345689532e-05, "loss": 1.0411389350891114, "num_input_tokens_seen": 21592972352, "step": 75920, "train_runtime": 739498.0828, "train_tokens_per_second": 29199.497 }, { "epoch": 2.686552839739323, "grad_norm": 1.6640625, "learning_rate": 1.705690087058776e-05, "loss": 1.0306855201721192, "num_input_tokens_seen": 21595827328, "step": 75930, "train_runtime": 739595.954, "train_tokens_per_second": 29199.494 }, { "epoch": 2.686906660003052, "grad_norm": 1.65625, "learning_rate": 1.7055908457533644e-05, "loss": 1.039632797241211, "num_input_tokens_seen": 21598685184, "step": 75940, "train_runtime": 739696.3524, "train_tokens_per_second": 29199.394 }, { "epoch": 2.6872604802667803, "grad_norm": 1.5546875, "learning_rate": 1.7054916217682577e-05, "loss": 1.02457857131958, "num_input_tokens_seen": 21601495360, "step": 75950, "train_runtime": 739793.3806, "train_tokens_per_second": 29199.363 }, { "epoch": 2.6876143005305093, "grad_norm": 1.6328125, "learning_rate": 1.7053924150984184e-05, "loss": 1.0355435371398927, "num_input_tokens_seen": 21604312000, "step": 75960, "train_runtime": 739890.285, "train_tokens_per_second": 29199.345 }, { "epoch": 2.6879681207942383, "grad_norm": 1.625, "learning_rate": 1.7052932257388107e-05, "loss": 1.0442063331604003, "num_input_tokens_seen": 21607158528, "step": 75970, "train_runtime": 739987.6315, "train_tokens_per_second": 29199.351 }, { "epoch": 2.688321941057967, "grad_norm": 1.6875, "learning_rate": 1.7051940536844015e-05, "loss": 1.0448694229125977, "num_input_tokens_seen": 21609980864, "step": 75980, "train_runtime": 740083.7625, "train_tokens_per_second": 29199.372 }, { "epoch": 2.6886757613216954, "grad_norm": 1.609375, "learning_rate": 1.7050948989301595e-05, "loss": 1.0301618576049805, "num_input_tokens_seen": 21612790976, "step": 75990, "train_runtime": 740180.6212, "train_tokens_per_second": 29199.347 }, { "epoch": 2.6890295815854244, "grad_norm": 1.6015625, "learning_rate": 1.7049957614710553e-05, "loss": 1.0429344177246094, "num_input_tokens_seen": 21615594560, "step": 76000, "train_runtime": 740275.1678, "train_tokens_per_second": 29199.405 }, { "epoch": 2.6893834018491534, "grad_norm": 1.640625, "learning_rate": 1.7048966413020613e-05, "loss": 1.036581802368164, "num_input_tokens_seen": 21618415616, "step": 76010, "train_runtime": 740372.1947, "train_tokens_per_second": 29199.389 }, { "epoch": 2.689737222112882, "grad_norm": 1.6015625, "learning_rate": 1.704797538418153e-05, "loss": 1.0299457550048827, "num_input_tokens_seen": 21621306880, "step": 76020, "train_runtime": 740469.7776, "train_tokens_per_second": 29199.445 }, { "epoch": 2.6900910423766105, "grad_norm": 1.59375, "learning_rate": 1.7046984528143065e-05, "loss": 1.048173999786377, "num_input_tokens_seen": 21624121792, "step": 76030, "train_runtime": 740564.0418, "train_tokens_per_second": 29199.53 }, { "epoch": 2.6904448626403394, "grad_norm": 1.6484375, "learning_rate": 1.7045993844855012e-05, "loss": 1.0444411277770995, "num_input_tokens_seen": 21626982592, "step": 76040, "train_runtime": 740660.0937, "train_tokens_per_second": 29199.606 }, { "epoch": 2.6907986829040684, "grad_norm": 1.5546875, "learning_rate": 1.7045003334267175e-05, "loss": 1.027272605895996, "num_input_tokens_seen": 21629820416, "step": 76050, "train_runtime": 740757.7846, "train_tokens_per_second": 29199.586 }, { "epoch": 2.691152503167797, "grad_norm": 1.6171875, "learning_rate": 1.704401299632939e-05, "loss": 1.0389467239379884, "num_input_tokens_seen": 21632654976, "step": 76060, "train_runtime": 740855.4655, "train_tokens_per_second": 29199.562 }, { "epoch": 2.691506323431526, "grad_norm": 1.65625, "learning_rate": 1.7043022830991498e-05, "loss": 1.0218398094177246, "num_input_tokens_seen": 21635567616, "step": 76070, "train_runtime": 740956.9148, "train_tokens_per_second": 29199.495 }, { "epoch": 2.6918601436952545, "grad_norm": 1.609375, "learning_rate": 1.7042032838203372e-05, "loss": 1.0409164428710938, "num_input_tokens_seen": 21638366592, "step": 76080, "train_runtime": 741052.5226, "train_tokens_per_second": 29199.505 }, { "epoch": 2.6922139639589835, "grad_norm": 1.5859375, "learning_rate": 1.7041043017914912e-05, "loss": 1.0369022369384766, "num_input_tokens_seen": 21641229952, "step": 76090, "train_runtime": 741151.0973, "train_tokens_per_second": 29199.484 }, { "epoch": 2.692567784222712, "grad_norm": 1.59375, "learning_rate": 1.7040053370076014e-05, "loss": 1.0342833518981933, "num_input_tokens_seen": 21644022464, "step": 76100, "train_runtime": 741246.833, "train_tokens_per_second": 29199.481 }, { "epoch": 2.692921604486441, "grad_norm": 1.6484375, "learning_rate": 1.703906389463662e-05, "loss": 1.0399560928344727, "num_input_tokens_seen": 21646869952, "step": 76110, "train_runtime": 741345.143, "train_tokens_per_second": 29199.449 }, { "epoch": 2.6932754247501696, "grad_norm": 1.5703125, "learning_rate": 1.703807459154668e-05, "loss": 1.0323552131652831, "num_input_tokens_seen": 21649738432, "step": 76120, "train_runtime": 741446.0438, "train_tokens_per_second": 29199.344 }, { "epoch": 2.6936292450138986, "grad_norm": 1.609375, "learning_rate": 1.703708546075616e-05, "loss": 1.0432754516601563, "num_input_tokens_seen": 21652608960, "step": 76130, "train_runtime": 741544.676, "train_tokens_per_second": 29199.332 }, { "epoch": 2.693983065277627, "grad_norm": 1.65625, "learning_rate": 1.7036096502215064e-05, "loss": 1.0469511032104493, "num_input_tokens_seen": 21655470272, "step": 76140, "train_runtime": 741641.0291, "train_tokens_per_second": 29199.396 }, { "epoch": 2.694336885541356, "grad_norm": 1.6484375, "learning_rate": 1.703510771587339e-05, "loss": 1.0536516189575196, "num_input_tokens_seen": 21658332672, "step": 76150, "train_runtime": 741736.7949, "train_tokens_per_second": 29199.485 }, { "epoch": 2.694690705805085, "grad_norm": 1.609375, "learning_rate": 1.703411910168118e-05, "loss": 1.0378475189208984, "num_input_tokens_seen": 21661167552, "step": 76160, "train_runtime": 741831.2548, "train_tokens_per_second": 29199.589 }, { "epoch": 2.6950445260688136, "grad_norm": 1.6171875, "learning_rate": 1.7033130659588486e-05, "loss": 1.032486915588379, "num_input_tokens_seen": 21663979008, "step": 76170, "train_runtime": 741926.0764, "train_tokens_per_second": 29199.646 }, { "epoch": 2.695398346332542, "grad_norm": 1.578125, "learning_rate": 1.703214238954538e-05, "loss": 1.0255840301513672, "num_input_tokens_seen": 21666785984, "step": 76180, "train_runtime": 742019.6855, "train_tokens_per_second": 29199.746 }, { "epoch": 2.695752166596271, "grad_norm": 1.65625, "learning_rate": 1.7031154291501962e-05, "loss": 1.049422836303711, "num_input_tokens_seen": 21669590656, "step": 76190, "train_runtime": 742113.7143, "train_tokens_per_second": 29199.825 }, { "epoch": 2.69610598686, "grad_norm": 1.6328125, "learning_rate": 1.7030166365408335e-05, "loss": 1.0423591613769532, "num_input_tokens_seen": 21672408704, "step": 76200, "train_runtime": 742207.663, "train_tokens_per_second": 29199.926 }, { "epoch": 2.6964598071237287, "grad_norm": 1.59375, "learning_rate": 1.702917861121464e-05, "loss": 1.0369071960449219, "num_input_tokens_seen": 21675227200, "step": 76210, "train_runtime": 742301.0713, "train_tokens_per_second": 29200.048 }, { "epoch": 2.6968136273874577, "grad_norm": 1.625, "learning_rate": 1.7028191028871033e-05, "loss": 1.036498737335205, "num_input_tokens_seen": 21678019072, "step": 76220, "train_runtime": 742394.7442, "train_tokens_per_second": 29200.125 }, { "epoch": 2.697167447651186, "grad_norm": 1.6640625, "learning_rate": 1.7027203618327685e-05, "loss": 1.0316251754760741, "num_input_tokens_seen": 21680876416, "step": 76230, "train_runtime": 742494.4591, "train_tokens_per_second": 29200.051 }, { "epoch": 2.697521267914915, "grad_norm": 1.6875, "learning_rate": 1.7026216379534793e-05, "loss": 1.033745002746582, "num_input_tokens_seen": 21683763584, "step": 76240, "train_runtime": 742595.8819, "train_tokens_per_second": 29199.951 }, { "epoch": 2.6978750881786437, "grad_norm": 1.59375, "learning_rate": 1.7025229312442577e-05, "loss": 1.0383378982543945, "num_input_tokens_seen": 21686638080, "step": 76250, "train_runtime": 742695.8467, "train_tokens_per_second": 29199.891 }, { "epoch": 2.6982289084423727, "grad_norm": 1.6640625, "learning_rate": 1.702424241700126e-05, "loss": 1.0436262130737304, "num_input_tokens_seen": 21689497024, "step": 76260, "train_runtime": 742793.8432, "train_tokens_per_second": 29199.888 }, { "epoch": 2.6985827287061013, "grad_norm": 1.5625, "learning_rate": 1.702325569316111e-05, "loss": 1.0276781082153321, "num_input_tokens_seen": 21692301504, "step": 76270, "train_runtime": 742889.0464, "train_tokens_per_second": 29199.921 }, { "epoch": 2.6989365489698303, "grad_norm": 1.640625, "learning_rate": 1.702226914087239e-05, "loss": 1.034851360321045, "num_input_tokens_seen": 21695201088, "step": 76280, "train_runtime": 742990.3155, "train_tokens_per_second": 29199.844 }, { "epoch": 2.699290369233559, "grad_norm": 1.6171875, "learning_rate": 1.7021282760085415e-05, "loss": 1.032474899291992, "num_input_tokens_seen": 21698053248, "step": 76290, "train_runtime": 743092.2209, "train_tokens_per_second": 29199.678 }, { "epoch": 2.699644189497288, "grad_norm": 1.6640625, "learning_rate": 1.7020296550750485e-05, "loss": 1.0346038818359375, "num_input_tokens_seen": 21700865984, "step": 76300, "train_runtime": 743188.5437, "train_tokens_per_second": 29199.678 }, { "epoch": 2.699998009761017, "grad_norm": 1.609375, "learning_rate": 1.7019310512817936e-05, "loss": 1.0329483032226563, "num_input_tokens_seen": 21703666688, "step": 76310, "train_runtime": 743284.3757, "train_tokens_per_second": 29199.681 }, { "epoch": 2.7003518300247453, "grad_norm": 1.6484375, "learning_rate": 1.7018324646238134e-05, "loss": 1.028021240234375, "num_input_tokens_seen": 21706505600, "step": 76320, "train_runtime": 743382.1003, "train_tokens_per_second": 29199.661 }, { "epoch": 2.700705650288474, "grad_norm": 1.578125, "learning_rate": 1.7017338950961455e-05, "loss": 1.050076389312744, "num_input_tokens_seen": 21709358976, "step": 76330, "train_runtime": 743480.171, "train_tokens_per_second": 29199.648 }, { "epoch": 2.701059470552203, "grad_norm": 1.609375, "learning_rate": 1.7016353426938287e-05, "loss": 1.0373003005981445, "num_input_tokens_seen": 21712215616, "step": 76340, "train_runtime": 743579.3662, "train_tokens_per_second": 29199.594 }, { "epoch": 2.701413290815932, "grad_norm": 1.640625, "learning_rate": 1.701536807411905e-05, "loss": 1.0228207588195801, "num_input_tokens_seen": 21715044352, "step": 76350, "train_runtime": 743676.2157, "train_tokens_per_second": 29199.595 }, { "epoch": 2.7017671110796604, "grad_norm": 1.5625, "learning_rate": 1.7014382892454186e-05, "loss": 1.043057918548584, "num_input_tokens_seen": 21717864448, "step": 76360, "train_runtime": 743770.8085, "train_tokens_per_second": 29199.673 }, { "epoch": 2.702120931343389, "grad_norm": 1.5703125, "learning_rate": 1.7013397881894147e-05, "loss": 1.0498950004577636, "num_input_tokens_seen": 21720737600, "step": 76370, "train_runtime": 743870.2714, "train_tokens_per_second": 29199.631 }, { "epoch": 2.702474751607118, "grad_norm": 1.5625, "learning_rate": 1.701241304238941e-05, "loss": 1.0266778945922852, "num_input_tokens_seen": 21723578752, "step": 76380, "train_runtime": 743970.8812, "train_tokens_per_second": 29199.501 }, { "epoch": 2.702828571870847, "grad_norm": 1.6015625, "learning_rate": 1.7011428373890478e-05, "loss": 1.0336106300354004, "num_input_tokens_seen": 21726396992, "step": 76390, "train_runtime": 744066.9439, "train_tokens_per_second": 29199.519 }, { "epoch": 2.7031823921345755, "grad_norm": 1.6953125, "learning_rate": 1.7010443876347863e-05, "loss": 1.0420209884643554, "num_input_tokens_seen": 21729171008, "step": 76400, "train_runtime": 744160.6157, "train_tokens_per_second": 29199.571 }, { "epoch": 2.7035362123983044, "grad_norm": 1.6015625, "learning_rate": 1.70094595497121e-05, "loss": 1.0338743209838868, "num_input_tokens_seen": 21731987520, "step": 76410, "train_runtime": 744257.1997, "train_tokens_per_second": 29199.566 }, { "epoch": 2.703890032662033, "grad_norm": 1.578125, "learning_rate": 1.700847539393375e-05, "loss": 1.0431564331054688, "num_input_tokens_seen": 21734839360, "step": 76420, "train_runtime": 744357.5053, "train_tokens_per_second": 29199.463 }, { "epoch": 2.704243852925762, "grad_norm": 1.625, "learning_rate": 1.7007491408963392e-05, "loss": 1.0525484085083008, "num_input_tokens_seen": 21737673280, "step": 76430, "train_runtime": 744453.8354, "train_tokens_per_second": 29199.491 }, { "epoch": 2.7045976731894905, "grad_norm": 1.609375, "learning_rate": 1.7006507594751617e-05, "loss": 1.033160400390625, "num_input_tokens_seen": 21740469248, "step": 76440, "train_runtime": 744547.804, "train_tokens_per_second": 29199.561 }, { "epoch": 2.7049514934532195, "grad_norm": 1.6171875, "learning_rate": 1.7005523951249047e-05, "loss": 1.0297947883605958, "num_input_tokens_seen": 21743335360, "step": 76450, "train_runtime": 744644.4561, "train_tokens_per_second": 29199.62 }, { "epoch": 2.705305313716948, "grad_norm": 1.578125, "learning_rate": 1.700454047840632e-05, "loss": 1.0360895156860352, "num_input_tokens_seen": 21746228608, "step": 76460, "train_runtime": 744747.2681, "train_tokens_per_second": 29199.474 }, { "epoch": 2.705659133980677, "grad_norm": 1.5703125, "learning_rate": 1.700355717617409e-05, "loss": 1.0420401573181153, "num_input_tokens_seen": 21749065088, "step": 76470, "train_runtime": 744845.0351, "train_tokens_per_second": 29199.45 }, { "epoch": 2.7060129542444056, "grad_norm": 1.609375, "learning_rate": 1.7002574044503038e-05, "loss": 1.0384427070617677, "num_input_tokens_seen": 21751911296, "step": 76480, "train_runtime": 744943.4958, "train_tokens_per_second": 29199.411 }, { "epoch": 2.7063667745081346, "grad_norm": 1.6171875, "learning_rate": 1.7001591083343853e-05, "loss": 1.0449153900146484, "num_input_tokens_seen": 21754742208, "step": 76490, "train_runtime": 745040.9336, "train_tokens_per_second": 29199.392 }, { "epoch": 2.7067205947718636, "grad_norm": 1.59375, "learning_rate": 1.700060829264726e-05, "loss": 1.0282995223999023, "num_input_tokens_seen": 21757582848, "step": 76500, "train_runtime": 745137.4794, "train_tokens_per_second": 29199.421 }, { "epoch": 2.707074415035592, "grad_norm": 1.6015625, "learning_rate": 1.6999625672363997e-05, "loss": 1.0365151405334472, "num_input_tokens_seen": 21760409728, "step": 76510, "train_runtime": 745234.4034, "train_tokens_per_second": 29199.416 }, { "epoch": 2.7074282352993206, "grad_norm": 1.625, "learning_rate": 1.699864322244482e-05, "loss": 1.031969928741455, "num_input_tokens_seen": 21763204672, "step": 76520, "train_runtime": 745329.3794, "train_tokens_per_second": 29199.446 }, { "epoch": 2.7077820555630496, "grad_norm": 1.578125, "learning_rate": 1.6997660942840497e-05, "loss": 1.0243657112121582, "num_input_tokens_seen": 21766003712, "step": 76530, "train_runtime": 745422.0275, "train_tokens_per_second": 29199.571 }, { "epoch": 2.7081358758267786, "grad_norm": 1.6171875, "learning_rate": 1.6996678833501832e-05, "loss": 1.035759162902832, "num_input_tokens_seen": 21768833600, "step": 76540, "train_runtime": 745518.855, "train_tokens_per_second": 29199.575 }, { "epoch": 2.708489696090507, "grad_norm": 1.6015625, "learning_rate": 1.699569689437965e-05, "loss": 1.0384992599487304, "num_input_tokens_seen": 21771657984, "step": 76550, "train_runtime": 745615.0364, "train_tokens_per_second": 29199.596 }, { "epoch": 2.708843516354236, "grad_norm": 1.5390625, "learning_rate": 1.699471512542477e-05, "loss": 1.0281932830810547, "num_input_tokens_seen": 21774478912, "step": 76560, "train_runtime": 745711.7168, "train_tokens_per_second": 29199.593 }, { "epoch": 2.7091973366179647, "grad_norm": 1.71875, "learning_rate": 1.6993733526588064e-05, "loss": 1.0381028175354003, "num_input_tokens_seen": 21777322304, "step": 76570, "train_runtime": 745809.2045, "train_tokens_per_second": 29199.589 }, { "epoch": 2.7095511568816937, "grad_norm": 1.6171875, "learning_rate": 1.6992752097820396e-05, "loss": 1.0340736389160157, "num_input_tokens_seen": 21780193088, "step": 76580, "train_runtime": 745907.7903, "train_tokens_per_second": 29199.579 }, { "epoch": 2.7099049771454222, "grad_norm": 1.5546875, "learning_rate": 1.699177083907267e-05, "loss": 1.0392833709716798, "num_input_tokens_seen": 21783066048, "step": 76590, "train_runtime": 746005.4943, "train_tokens_per_second": 29199.605 }, { "epoch": 2.710258797409151, "grad_norm": 1.5625, "learning_rate": 1.6990789750295798e-05, "loss": 1.0290023803710937, "num_input_tokens_seen": 21785906688, "step": 76600, "train_runtime": 746101.7867, "train_tokens_per_second": 29199.644 }, { "epoch": 2.7106126176728798, "grad_norm": 1.671875, "learning_rate": 1.6989808831440724e-05, "loss": 1.0462963104248046, "num_input_tokens_seen": 21788675264, "step": 76610, "train_runtime": 746195.0022, "train_tokens_per_second": 29199.707 }, { "epoch": 2.7109664379366087, "grad_norm": 1.6171875, "learning_rate": 1.6988828082458395e-05, "loss": 1.0390210151672363, "num_input_tokens_seen": 21791558400, "step": 76620, "train_runtime": 746293.3764, "train_tokens_per_second": 29199.721 }, { "epoch": 2.7113202582003373, "grad_norm": 1.59375, "learning_rate": 1.6987847503299786e-05, "loss": 1.048428440093994, "num_input_tokens_seen": 21794476480, "step": 76630, "train_runtime": 746394.6297, "train_tokens_per_second": 29199.669 }, { "epoch": 2.7116740784640663, "grad_norm": 1.6171875, "learning_rate": 1.6986867093915897e-05, "loss": 1.0435577392578126, "num_input_tokens_seen": 21797305600, "step": 76640, "train_runtime": 746490.3257, "train_tokens_per_second": 29199.716 }, { "epoch": 2.7120278987277953, "grad_norm": 1.640625, "learning_rate": 1.6985886854257746e-05, "loss": 1.0305185317993164, "num_input_tokens_seen": 21800140032, "step": 76650, "train_runtime": 746587.301, "train_tokens_per_second": 29199.72 }, { "epoch": 2.712381718991524, "grad_norm": 1.6953125, "learning_rate": 1.6984906784276358e-05, "loss": 1.0359444618225098, "num_input_tokens_seen": 21802975936, "step": 76660, "train_runtime": 746683.4846, "train_tokens_per_second": 29199.757 }, { "epoch": 2.7127355392552523, "grad_norm": 1.6015625, "learning_rate": 1.6983926883922794e-05, "loss": 1.030405616760254, "num_input_tokens_seen": 21805830272, "step": 76670, "train_runtime": 746779.1115, "train_tokens_per_second": 29199.84 }, { "epoch": 2.7130893595189813, "grad_norm": 1.5703125, "learning_rate": 1.698294715314813e-05, "loss": 1.046832275390625, "num_input_tokens_seen": 21808682048, "step": 76680, "train_runtime": 746878.5209, "train_tokens_per_second": 29199.771 }, { "epoch": 2.7134431797827103, "grad_norm": 1.5703125, "learning_rate": 1.6981967591903456e-05, "loss": 1.0256492614746093, "num_input_tokens_seen": 21811552832, "step": 76690, "train_runtime": 746977.4839, "train_tokens_per_second": 29199.746 }, { "epoch": 2.713797000046439, "grad_norm": 1.6640625, "learning_rate": 1.6980988200139892e-05, "loss": 1.0317070960998536, "num_input_tokens_seen": 21814358976, "step": 76700, "train_runtime": 747069.7583, "train_tokens_per_second": 29199.896 }, { "epoch": 2.7141508203101674, "grad_norm": 1.6015625, "learning_rate": 1.698000897780856e-05, "loss": 1.0546156883239746, "num_input_tokens_seen": 21817212736, "step": 76710, "train_runtime": 747167.6475, "train_tokens_per_second": 29199.889 }, { "epoch": 2.7145046405738964, "grad_norm": 1.6484375, "learning_rate": 1.6979029924860625e-05, "loss": 1.0517955780029298, "num_input_tokens_seen": 21820037248, "step": 76720, "train_runtime": 747264.3065, "train_tokens_per_second": 29199.892 }, { "epoch": 2.7148584608376254, "grad_norm": 1.6640625, "learning_rate": 1.6978051041247257e-05, "loss": 1.0421335220336914, "num_input_tokens_seen": 21822866944, "step": 76730, "train_runtime": 747359.304, "train_tokens_per_second": 29199.967 }, { "epoch": 2.715212281101354, "grad_norm": 1.609375, "learning_rate": 1.6977072326919648e-05, "loss": 1.0271671295166016, "num_input_tokens_seen": 21825739008, "step": 76740, "train_runtime": 747458.508, "train_tokens_per_second": 29199.934 }, { "epoch": 2.715566101365083, "grad_norm": 1.609375, "learning_rate": 1.6976093781829007e-05, "loss": 1.0535451889038085, "num_input_tokens_seen": 21828614784, "step": 76750, "train_runtime": 747558.4088, "train_tokens_per_second": 29199.879 }, { "epoch": 2.7159199216288115, "grad_norm": 1.6015625, "learning_rate": 1.697511540592657e-05, "loss": 1.0340782165527345, "num_input_tokens_seen": 21831440576, "step": 76760, "train_runtime": 747657.67, "train_tokens_per_second": 29199.781 }, { "epoch": 2.7162737418925404, "grad_norm": 1.65625, "learning_rate": 1.6974137199163594e-05, "loss": 1.0348898887634277, "num_input_tokens_seen": 21834287296, "step": 76770, "train_runtime": 747755.4973, "train_tokens_per_second": 29199.768 }, { "epoch": 2.716627562156269, "grad_norm": 1.609375, "learning_rate": 1.697315916149134e-05, "loss": 1.0303754806518555, "num_input_tokens_seen": 21837165440, "step": 76780, "train_runtime": 747857.2483, "train_tokens_per_second": 29199.644 }, { "epoch": 2.716981382419998, "grad_norm": 1.6171875, "learning_rate": 1.6972181292861104e-05, "loss": 1.0183255195617675, "num_input_tokens_seen": 21839997568, "step": 76790, "train_runtime": 747953.6817, "train_tokens_per_second": 29199.666 }, { "epoch": 2.717335202683727, "grad_norm": 1.5390625, "learning_rate": 1.6971203593224196e-05, "loss": 1.0293447494506835, "num_input_tokens_seen": 21842827200, "step": 76800, "train_runtime": 748049.2193, "train_tokens_per_second": 29199.719 }, { "epoch": 2.7176890229474555, "grad_norm": 1.59375, "learning_rate": 1.6970226062531953e-05, "loss": 1.0314170837402343, "num_input_tokens_seen": 21845663168, "step": 76810, "train_runtime": 748143.5435, "train_tokens_per_second": 29199.829 }, { "epoch": 2.718042843211184, "grad_norm": 1.578125, "learning_rate": 1.6969248700735715e-05, "loss": 1.0409141540527345, "num_input_tokens_seen": 21848520832, "step": 76820, "train_runtime": 748244.0763, "train_tokens_per_second": 29199.724 }, { "epoch": 2.718396663474913, "grad_norm": 1.59375, "learning_rate": 1.6968271507786855e-05, "loss": 1.037938690185547, "num_input_tokens_seen": 21851369344, "step": 76830, "train_runtime": 748343.4337, "train_tokens_per_second": 29199.654 }, { "epoch": 2.718750483738642, "grad_norm": 1.65625, "learning_rate": 1.696729448363677e-05, "loss": 1.0392114639282226, "num_input_tokens_seen": 21854241984, "step": 76840, "train_runtime": 748440.6308, "train_tokens_per_second": 29199.7 }, { "epoch": 2.7191043040023706, "grad_norm": 1.65625, "learning_rate": 1.6966317628236856e-05, "loss": 1.034537124633789, "num_input_tokens_seen": 21857128640, "step": 76850, "train_runtime": 748539.401, "train_tokens_per_second": 29199.704 }, { "epoch": 2.719458124266099, "grad_norm": 1.6484375, "learning_rate": 1.6965340941538545e-05, "loss": 1.0269306182861329, "num_input_tokens_seen": 21860015104, "step": 76860, "train_runtime": 748638.9982, "train_tokens_per_second": 29199.675 }, { "epoch": 2.719811944529828, "grad_norm": 1.5234375, "learning_rate": 1.6964364423493297e-05, "loss": 1.0343852043151855, "num_input_tokens_seen": 21862857920, "step": 76870, "train_runtime": 748736.6903, "train_tokens_per_second": 29199.662 }, { "epoch": 2.720165764793557, "grad_norm": 1.5859375, "learning_rate": 1.6963388074052565e-05, "loss": 1.0279793739318848, "num_input_tokens_seen": 21865689920, "step": 76880, "train_runtime": 748833.5042, "train_tokens_per_second": 29199.668 }, { "epoch": 2.7205195850572856, "grad_norm": 1.515625, "learning_rate": 1.696241189316784e-05, "loss": 1.0380186080932616, "num_input_tokens_seen": 21868568512, "step": 76890, "train_runtime": 748933.1054, "train_tokens_per_second": 29199.629 }, { "epoch": 2.7208734053210146, "grad_norm": 1.5859375, "learning_rate": 1.696143588079063e-05, "loss": 1.0345788955688477, "num_input_tokens_seen": 21871420864, "step": 76900, "train_runtime": 749033.0913, "train_tokens_per_second": 29199.539 }, { "epoch": 2.721227225584743, "grad_norm": 1.53125, "learning_rate": 1.6960460036872468e-05, "loss": 1.0365086555480958, "num_input_tokens_seen": 21874252096, "step": 76910, "train_runtime": 749127.2028, "train_tokens_per_second": 29199.65 }, { "epoch": 2.721581045848472, "grad_norm": 1.5234375, "learning_rate": 1.6959484361364888e-05, "loss": 1.0338808059692384, "num_input_tokens_seen": 21877093760, "step": 76920, "train_runtime": 749223.2137, "train_tokens_per_second": 29199.701 }, { "epoch": 2.7219348661122007, "grad_norm": 1.5390625, "learning_rate": 1.6958508854219458e-05, "loss": 1.027717399597168, "num_input_tokens_seen": 21879918656, "step": 76930, "train_runtime": 749320.3583, "train_tokens_per_second": 29199.685 }, { "epoch": 2.7222886863759297, "grad_norm": 1.5859375, "learning_rate": 1.6957533515387773e-05, "loss": 1.0405205726623534, "num_input_tokens_seen": 21882779904, "step": 76940, "train_runtime": 749417.939, "train_tokens_per_second": 29199.701 }, { "epoch": 2.7226425066396582, "grad_norm": 1.65625, "learning_rate": 1.6956558344821422e-05, "loss": 1.0352829933166503, "num_input_tokens_seen": 21885640960, "step": 76950, "train_runtime": 749516.3235, "train_tokens_per_second": 29199.686 }, { "epoch": 2.722996326903387, "grad_norm": 1.640625, "learning_rate": 1.695558334247204e-05, "loss": 1.035008430480957, "num_input_tokens_seen": 21888424064, "step": 76960, "train_runtime": 749609.7048, "train_tokens_per_second": 29199.761 }, { "epoch": 2.7233501471671158, "grad_norm": 1.5546875, "learning_rate": 1.6954608508291262e-05, "loss": 1.033052349090576, "num_input_tokens_seen": 21891334464, "step": 76970, "train_runtime": 749712.8831, "train_tokens_per_second": 29199.624 }, { "epoch": 2.7237039674308448, "grad_norm": 1.578125, "learning_rate": 1.6953633842230755e-05, "loss": 1.0521023750305176, "num_input_tokens_seen": 21894168512, "step": 76980, "train_runtime": 749808.3577, "train_tokens_per_second": 29199.686 }, { "epoch": 2.7240577876945737, "grad_norm": 1.59375, "learning_rate": 1.6952659344242205e-05, "loss": 1.0476419448852539, "num_input_tokens_seen": 21896982784, "step": 76990, "train_runtime": 749905.9147, "train_tokens_per_second": 29199.64 }, { "epoch": 2.7244116079583023, "grad_norm": 1.609375, "learning_rate": 1.6951685014277307e-05, "loss": 1.0367165565490724, "num_input_tokens_seen": 21899842432, "step": 77000, "train_runtime": 750005.6231, "train_tokens_per_second": 29199.571 }, { "epoch": 2.724765428222031, "grad_norm": 1.578125, "learning_rate": 1.6950710852287785e-05, "loss": 1.0342987060546875, "num_input_tokens_seen": 21902723712, "step": 77010, "train_runtime": 750105.5536, "train_tokens_per_second": 29199.522 }, { "epoch": 2.72511924848576, "grad_norm": 1.59375, "learning_rate": 1.694973685822538e-05, "loss": 1.0449722290039063, "num_input_tokens_seen": 21905556736, "step": 77020, "train_runtime": 750206.037, "train_tokens_per_second": 29199.387 }, { "epoch": 2.725473068749489, "grad_norm": 1.609375, "learning_rate": 1.694876303204185e-05, "loss": 1.0455759048461915, "num_input_tokens_seen": 21908415424, "step": 77030, "train_runtime": 750303.0593, "train_tokens_per_second": 29199.422 }, { "epoch": 2.7258268890132173, "grad_norm": 1.5703125, "learning_rate": 1.694778937368897e-05, "loss": 1.0404438018798827, "num_input_tokens_seen": 21911277504, "step": 77040, "train_runtime": 750402.5725, "train_tokens_per_second": 29199.364 }, { "epoch": 2.7261807092769463, "grad_norm": 1.6015625, "learning_rate": 1.694681588311855e-05, "loss": 1.0524599075317382, "num_input_tokens_seen": 21914132480, "step": 77050, "train_runtime": 750500.4586, "train_tokens_per_second": 29199.359 }, { "epoch": 2.726534529540675, "grad_norm": 1.6328125, "learning_rate": 1.69458425602824e-05, "loss": 1.0411909103393555, "num_input_tokens_seen": 21917014848, "step": 77060, "train_runtime": 750599.8558, "train_tokens_per_second": 29199.333 }, { "epoch": 2.726888349804404, "grad_norm": 1.59375, "learning_rate": 1.6944869405132355e-05, "loss": 1.0255498886108398, "num_input_tokens_seen": 21919817088, "step": 77070, "train_runtime": 750695.1924, "train_tokens_per_second": 29199.357 }, { "epoch": 2.7272421700681324, "grad_norm": 1.625, "learning_rate": 1.6943896417620272e-05, "loss": 1.036949348449707, "num_input_tokens_seen": 21922673088, "step": 77080, "train_runtime": 750794.9938, "train_tokens_per_second": 29199.28 }, { "epoch": 2.7275959903318614, "grad_norm": 1.546875, "learning_rate": 1.6942923597698035e-05, "loss": 1.0369297027587892, "num_input_tokens_seen": 21925522880, "step": 77090, "train_runtime": 750891.3239, "train_tokens_per_second": 29199.329 }, { "epoch": 2.72794981059559, "grad_norm": 1.6015625, "learning_rate": 1.6941950945317536e-05, "loss": 1.0427448272705078, "num_input_tokens_seen": 21928275456, "step": 77100, "train_runtime": 750981.753, "train_tokens_per_second": 29199.478 }, { "epoch": 2.728303630859319, "grad_norm": 1.640625, "learning_rate": 1.6940978460430684e-05, "loss": 1.0525982856750489, "num_input_tokens_seen": 21931067648, "step": 77110, "train_runtime": 751075.0683, "train_tokens_per_second": 29199.568 }, { "epoch": 2.7286574511230475, "grad_norm": 1.65625, "learning_rate": 1.694000614298942e-05, "loss": 1.0271966934204102, "num_input_tokens_seen": 21933895808, "step": 77120, "train_runtime": 751169.8166, "train_tokens_per_second": 29199.65 }, { "epoch": 2.7290112713867765, "grad_norm": 1.671875, "learning_rate": 1.6939033992945697e-05, "loss": 1.0243898391723634, "num_input_tokens_seen": 21936745856, "step": 77130, "train_runtime": 751266.719, "train_tokens_per_second": 29199.677 }, { "epoch": 2.7293650916505054, "grad_norm": 1.5390625, "learning_rate": 1.6938062010251483e-05, "loss": 1.0478816032409668, "num_input_tokens_seen": 21939569088, "step": 77140, "train_runtime": 751362.6374, "train_tokens_per_second": 29199.707 }, { "epoch": 2.729718911914234, "grad_norm": 1.59375, "learning_rate": 1.693709019485877e-05, "loss": 1.028091812133789, "num_input_tokens_seen": 21942403072, "step": 77150, "train_runtime": 751457.8593, "train_tokens_per_second": 29199.779 }, { "epoch": 2.7300727321779625, "grad_norm": 1.703125, "learning_rate": 1.6936118546719572e-05, "loss": 1.0413694381713867, "num_input_tokens_seen": 21945177536, "step": 77160, "train_runtime": 751551.3482, "train_tokens_per_second": 29199.838 }, { "epoch": 2.7304265524416915, "grad_norm": 1.546875, "learning_rate": 1.6935147065785917e-05, "loss": 1.0388131141662598, "num_input_tokens_seen": 21948041216, "step": 77170, "train_runtime": 751648.6933, "train_tokens_per_second": 29199.866 }, { "epoch": 2.7307803727054205, "grad_norm": 1.71875, "learning_rate": 1.693417575200986e-05, "loss": 1.028806495666504, "num_input_tokens_seen": 21950913408, "step": 77180, "train_runtime": 751745.9489, "train_tokens_per_second": 29199.909 }, { "epoch": 2.731134192969149, "grad_norm": 1.5390625, "learning_rate": 1.6933204605343466e-05, "loss": 1.0345026969909668, "num_input_tokens_seen": 21953740544, "step": 77190, "train_runtime": 751843.1826, "train_tokens_per_second": 29199.893 }, { "epoch": 2.7314880132328776, "grad_norm": 1.6015625, "learning_rate": 1.693223362573882e-05, "loss": 1.0410938262939453, "num_input_tokens_seen": 21956518336, "step": 77200, "train_runtime": 751935.6464, "train_tokens_per_second": 29199.997 }, { "epoch": 2.7318418334966066, "grad_norm": 1.671875, "learning_rate": 1.6931262813148036e-05, "loss": 1.040059471130371, "num_input_tokens_seen": 21959352768, "step": 77210, "train_runtime": 752033.9334, "train_tokens_per_second": 29199.949 }, { "epoch": 2.7321956537603356, "grad_norm": 1.5859375, "learning_rate": 1.6930292167523236e-05, "loss": 1.0253015518188477, "num_input_tokens_seen": 21962230144, "step": 77220, "train_runtime": 752133.0698, "train_tokens_per_second": 29199.926 }, { "epoch": 2.732549474024064, "grad_norm": 1.625, "learning_rate": 1.6929321688816573e-05, "loss": 1.0230438232421875, "num_input_tokens_seen": 21965091328, "step": 77230, "train_runtime": 752227.0208, "train_tokens_per_second": 29200.083 }, { "epoch": 2.732903294287793, "grad_norm": 1.65625, "learning_rate": 1.6928351376980197e-05, "loss": 1.0273933410644531, "num_input_tokens_seen": 21967972992, "step": 77240, "train_runtime": 752325.1505, "train_tokens_per_second": 29200.104 }, { "epoch": 2.7332571145515216, "grad_norm": 1.578125, "learning_rate": 1.692738123196631e-05, "loss": 1.0298395156860352, "num_input_tokens_seen": 21970800576, "step": 77250, "train_runtime": 752422.2158, "train_tokens_per_second": 29200.096 }, { "epoch": 2.7336109348152506, "grad_norm": 1.59375, "learning_rate": 1.6926411253727104e-05, "loss": 1.0399215698242188, "num_input_tokens_seen": 21973649280, "step": 77260, "train_runtime": 752518.8628, "train_tokens_per_second": 29200.131 }, { "epoch": 2.733964755078979, "grad_norm": 1.609375, "learning_rate": 1.69254414422148e-05, "loss": 1.0352811813354492, "num_input_tokens_seen": 21976449216, "step": 77270, "train_runtime": 752612.7139, "train_tokens_per_second": 29200.21 }, { "epoch": 2.734318575342708, "grad_norm": 1.5703125, "learning_rate": 1.6924471797381652e-05, "loss": 1.0239381790161133, "num_input_tokens_seen": 21979263296, "step": 77280, "train_runtime": 752708.4059, "train_tokens_per_second": 29200.236 }, { "epoch": 2.7346723956064367, "grad_norm": 1.6484375, "learning_rate": 1.692350231917991e-05, "loss": 1.0358606338500977, "num_input_tokens_seen": 21982126528, "step": 77290, "train_runtime": 752804.7602, "train_tokens_per_second": 29200.302 }, { "epoch": 2.7350262158701657, "grad_norm": 1.5625, "learning_rate": 1.692253300756186e-05, "loss": 1.033787727355957, "num_input_tokens_seen": 21985036480, "step": 77300, "train_runtime": 752905.6452, "train_tokens_per_second": 29200.255 }, { "epoch": 2.7353800361338942, "grad_norm": 1.6328125, "learning_rate": 1.6921563862479795e-05, "loss": 1.0382116317749024, "num_input_tokens_seen": 21987895872, "step": 77310, "train_runtime": 753001.5138, "train_tokens_per_second": 29200.334 }, { "epoch": 2.7357338563976232, "grad_norm": 1.6953125, "learning_rate": 1.692059488388604e-05, "loss": 1.029775333404541, "num_input_tokens_seen": 21990741056, "step": 77320, "train_runtime": 753097.7873, "train_tokens_per_second": 29200.379 }, { "epoch": 2.736087676661352, "grad_norm": 1.6328125, "learning_rate": 1.6919626071732924e-05, "loss": 1.0358288764953614, "num_input_tokens_seen": 21993612672, "step": 77330, "train_runtime": 753197.5032, "train_tokens_per_second": 29200.326 }, { "epoch": 2.7364414969250808, "grad_norm": 1.5703125, "learning_rate": 1.6918657425972812e-05, "loss": 1.0407492637634277, "num_input_tokens_seen": 21996454272, "step": 77340, "train_runtime": 753295.5325, "train_tokens_per_second": 29200.298 }, { "epoch": 2.7367953171888093, "grad_norm": 1.6015625, "learning_rate": 1.6917688946558078e-05, "loss": 1.037459373474121, "num_input_tokens_seen": 21999303488, "step": 77350, "train_runtime": 753393.1217, "train_tokens_per_second": 29200.298 }, { "epoch": 2.7371491374525383, "grad_norm": 1.6171875, "learning_rate": 1.6916720633441113e-05, "loss": 1.0311447143554688, "num_input_tokens_seen": 22002172608, "step": 77360, "train_runtime": 753490.5321, "train_tokens_per_second": 29200.331 }, { "epoch": 2.7375029577162673, "grad_norm": 1.625, "learning_rate": 1.6915752486574336e-05, "loss": 1.0316404342651366, "num_input_tokens_seen": 22005088576, "step": 77370, "train_runtime": 753589.6505, "train_tokens_per_second": 29200.359 }, { "epoch": 2.737856777979996, "grad_norm": 1.578125, "learning_rate": 1.6914784505910173e-05, "loss": 1.029127311706543, "num_input_tokens_seen": 22007950400, "step": 77380, "train_runtime": 753683.7007, "train_tokens_per_second": 29200.513 }, { "epoch": 2.738210598243725, "grad_norm": 1.5625, "learning_rate": 1.6913816691401083e-05, "loss": 1.0060611724853517, "num_input_tokens_seen": 22010779520, "step": 77390, "train_runtime": 753779.1978, "train_tokens_per_second": 29200.566 }, { "epoch": 2.7385644185074534, "grad_norm": 1.59375, "learning_rate": 1.691284904299953e-05, "loss": 1.0296453475952148, "num_input_tokens_seen": 22013619264, "step": 77400, "train_runtime": 753874.045, "train_tokens_per_second": 29200.659 }, { "epoch": 2.7389182387711823, "grad_norm": 1.59375, "learning_rate": 1.6911881560658007e-05, "loss": 1.0385475158691406, "num_input_tokens_seen": 22016483264, "step": 77410, "train_runtime": 753972.0355, "train_tokens_per_second": 29200.663 }, { "epoch": 2.739272059034911, "grad_norm": 1.59375, "learning_rate": 1.6910914244329028e-05, "loss": 1.0315587043762207, "num_input_tokens_seen": 22019272000, "step": 77420, "train_runtime": 754066.5677, "train_tokens_per_second": 29200.7 }, { "epoch": 2.73962587929864, "grad_norm": 1.59375, "learning_rate": 1.690994709396511e-05, "loss": 1.0386127471923827, "num_input_tokens_seen": 22022173440, "step": 77430, "train_runtime": 754168.8651, "train_tokens_per_second": 29200.587 }, { "epoch": 2.7399796995623684, "grad_norm": 1.6171875, "learning_rate": 1.690898010951881e-05, "loss": 1.0369446754455567, "num_input_tokens_seen": 22024978752, "step": 77440, "train_runtime": 754264.465, "train_tokens_per_second": 29200.605 }, { "epoch": 2.7403335198260974, "grad_norm": 1.5546875, "learning_rate": 1.690801329094269e-05, "loss": 1.0497906684875489, "num_input_tokens_seen": 22027876416, "step": 77450, "train_runtime": 754362.9811, "train_tokens_per_second": 29200.633 }, { "epoch": 2.740687340089826, "grad_norm": 1.59375, "learning_rate": 1.6907046638189336e-05, "loss": 1.0211292266845704, "num_input_tokens_seen": 22030670016, "step": 77460, "train_runtime": 754457.5628, "train_tokens_per_second": 29200.675 }, { "epoch": 2.741041160353555, "grad_norm": 1.5859375, "learning_rate": 1.6906080151211352e-05, "loss": 1.020215129852295, "num_input_tokens_seen": 22033492032, "step": 77470, "train_runtime": 754554.4364, "train_tokens_per_second": 29200.666 }, { "epoch": 2.741394980617284, "grad_norm": 1.5703125, "learning_rate": 1.6905113829961355e-05, "loss": 1.0405159950256349, "num_input_tokens_seen": 22036393792, "step": 77480, "train_runtime": 754656.0236, "train_tokens_per_second": 29200.58 }, { "epoch": 2.7417488008810125, "grad_norm": 1.59375, "learning_rate": 1.6904147674391995e-05, "loss": 1.0426615715026855, "num_input_tokens_seen": 22039244224, "step": 77490, "train_runtime": 754753.2516, "train_tokens_per_second": 29200.595 }, { "epoch": 2.742102621144741, "grad_norm": 1.5703125, "learning_rate": 1.690318168445593e-05, "loss": 1.034453773498535, "num_input_tokens_seen": 22042118848, "step": 77500, "train_runtime": 754853.4032, "train_tokens_per_second": 29200.529 }, { "epoch": 2.74245644140847, "grad_norm": 1.625, "learning_rate": 1.6902215860105837e-05, "loss": 1.0449695587158203, "num_input_tokens_seen": 22044959296, "step": 77510, "train_runtime": 754947.9406, "train_tokens_per_second": 29200.635 }, { "epoch": 2.742810261672199, "grad_norm": 1.640625, "learning_rate": 1.6901250201294422e-05, "loss": 1.0425844192504883, "num_input_tokens_seen": 22047794688, "step": 77520, "train_runtime": 755045.6288, "train_tokens_per_second": 29200.612 }, { "epoch": 2.7431640819359275, "grad_norm": 1.6171875, "learning_rate": 1.6900284707974394e-05, "loss": 1.0231382369995117, "num_input_tokens_seen": 22050627136, "step": 77530, "train_runtime": 755142.0406, "train_tokens_per_second": 29200.635 }, { "epoch": 2.743517902199656, "grad_norm": 1.6484375, "learning_rate": 1.689931938009849e-05, "loss": 1.0557575225830078, "num_input_tokens_seen": 22053482688, "step": 77540, "train_runtime": 755238.1041, "train_tokens_per_second": 29200.702 }, { "epoch": 2.743871722463385, "grad_norm": 1.6328125, "learning_rate": 1.6898354217619476e-05, "loss": 1.0448843955993652, "num_input_tokens_seen": 22056334528, "step": 77550, "train_runtime": 755333.698, "train_tokens_per_second": 29200.782 }, { "epoch": 2.744225542727114, "grad_norm": 1.5625, "learning_rate": 1.689738922049011e-05, "loss": 1.035269069671631, "num_input_tokens_seen": 22059175488, "step": 77560, "train_runtime": 755432.3164, "train_tokens_per_second": 29200.731 }, { "epoch": 2.7445793629908426, "grad_norm": 1.6171875, "learning_rate": 1.6896424388663198e-05, "loss": 1.0409799575805665, "num_input_tokens_seen": 22061974016, "step": 77570, "train_runtime": 755528.4558, "train_tokens_per_second": 29200.719 }, { "epoch": 2.7449331832545716, "grad_norm": 1.6171875, "learning_rate": 1.6895459722091548e-05, "loss": 1.031081199645996, "num_input_tokens_seen": 22064835392, "step": 77580, "train_runtime": 755626.6601, "train_tokens_per_second": 29200.711 }, { "epoch": 2.7452870035183, "grad_norm": 1.5859375, "learning_rate": 1.689449522072799e-05, "loss": 1.0393082618713378, "num_input_tokens_seen": 22067711104, "step": 77590, "train_runtime": 755724.6048, "train_tokens_per_second": 29200.731 }, { "epoch": 2.745640823782029, "grad_norm": 1.6171875, "learning_rate": 1.6893530884525372e-05, "loss": 1.0436410903930664, "num_input_tokens_seen": 22070538496, "step": 77600, "train_runtime": 755819.0623, "train_tokens_per_second": 29200.823 }, { "epoch": 2.7459946440457577, "grad_norm": 1.6328125, "learning_rate": 1.6892566713436568e-05, "loss": 1.0397705078125, "num_input_tokens_seen": 22073471424, "step": 77610, "train_runtime": 755924.6126, "train_tokens_per_second": 29200.625 }, { "epoch": 2.7463484643094866, "grad_norm": 1.5546875, "learning_rate": 1.6891602707414458e-05, "loss": 1.0292543411254882, "num_input_tokens_seen": 22076286656, "step": 77620, "train_runtime": 756019.7619, "train_tokens_per_second": 29200.674 }, { "epoch": 2.7467022845732156, "grad_norm": 1.5234375, "learning_rate": 1.6890638866411958e-05, "loss": 1.0453036308288575, "num_input_tokens_seen": 22079122304, "step": 77630, "train_runtime": 756117.4285, "train_tokens_per_second": 29200.653 }, { "epoch": 2.747056104836944, "grad_norm": 1.5625, "learning_rate": 1.6889675190381985e-05, "loss": 1.0436043739318848, "num_input_tokens_seen": 22081886336, "step": 77640, "train_runtime": 756209.8189, "train_tokens_per_second": 29200.74 }, { "epoch": 2.7474099251006727, "grad_norm": 1.5625, "learning_rate": 1.6888711679277482e-05, "loss": 1.0332523345947267, "num_input_tokens_seen": 22084674624, "step": 77650, "train_runtime": 756306.5111, "train_tokens_per_second": 29200.694 }, { "epoch": 2.7477637453644017, "grad_norm": 1.609375, "learning_rate": 1.688774833305142e-05, "loss": 1.031964111328125, "num_input_tokens_seen": 22087477760, "step": 77660, "train_runtime": 756400.9428, "train_tokens_per_second": 29200.754 }, { "epoch": 2.7481175656281307, "grad_norm": 1.59375, "learning_rate": 1.688678515165677e-05, "loss": 1.037259006500244, "num_input_tokens_seen": 22090309504, "step": 77670, "train_runtime": 756498.3948, "train_tokens_per_second": 29200.735 }, { "epoch": 2.7484713858918592, "grad_norm": 1.578125, "learning_rate": 1.6885822135046542e-05, "loss": 1.0400027275085448, "num_input_tokens_seen": 22093155520, "step": 77680, "train_runtime": 756597.9403, "train_tokens_per_second": 29200.655 }, { "epoch": 2.748825206155588, "grad_norm": 1.640625, "learning_rate": 1.6884859283173742e-05, "loss": 1.0416351318359376, "num_input_tokens_seen": 22095957504, "step": 77690, "train_runtime": 756690.9283, "train_tokens_per_second": 29200.77 }, { "epoch": 2.7491790264193168, "grad_norm": 1.6484375, "learning_rate": 1.688389659599142e-05, "loss": 1.0313817977905273, "num_input_tokens_seen": 22098825664, "step": 77700, "train_runtime": 756791.507, "train_tokens_per_second": 29200.679 }, { "epoch": 2.7495328466830458, "grad_norm": 1.6015625, "learning_rate": 1.688293407345263e-05, "loss": 1.0248108863830567, "num_input_tokens_seen": 22101652608, "step": 77710, "train_runtime": 756889.6945, "train_tokens_per_second": 29200.626 }, { "epoch": 2.7498866669467743, "grad_norm": 1.671875, "learning_rate": 1.688197171551044e-05, "loss": 1.0193477630615235, "num_input_tokens_seen": 22104494784, "step": 77720, "train_runtime": 756987.4765, "train_tokens_per_second": 29200.608 }, { "epoch": 2.7502404872105033, "grad_norm": 1.6171875, "learning_rate": 1.6881009522117954e-05, "loss": 1.0322214126586915, "num_input_tokens_seen": 22107361344, "step": 77730, "train_runtime": 757088.8238, "train_tokens_per_second": 29200.486 }, { "epoch": 2.750594307474232, "grad_norm": 1.640625, "learning_rate": 1.688004749322828e-05, "loss": 1.0334153175354004, "num_input_tokens_seen": 22110234624, "step": 77740, "train_runtime": 757188.5594, "train_tokens_per_second": 29200.434 }, { "epoch": 2.750948127737961, "grad_norm": 1.65625, "learning_rate": 1.6879085628794544e-05, "loss": 1.0506589889526368, "num_input_tokens_seen": 22113058496, "step": 77750, "train_runtime": 757287.9966, "train_tokens_per_second": 29200.329 }, { "epoch": 2.7513019480016894, "grad_norm": 1.5546875, "learning_rate": 1.6878123928769905e-05, "loss": 1.0295150756835938, "num_input_tokens_seen": 22115896384, "step": 77760, "train_runtime": 757384.8961, "train_tokens_per_second": 29200.34 }, { "epoch": 2.7516557682654184, "grad_norm": 1.609375, "learning_rate": 1.6877162393107524e-05, "loss": 1.0298801422119142, "num_input_tokens_seen": 22118697984, "step": 77770, "train_runtime": 757479.6418, "train_tokens_per_second": 29200.386 }, { "epoch": 2.752009588529147, "grad_norm": 1.625, "learning_rate": 1.687620102176059e-05, "loss": 1.024642562866211, "num_input_tokens_seen": 22121535360, "step": 77780, "train_runtime": 757577.1028, "train_tokens_per_second": 29200.375 }, { "epoch": 2.752363408792876, "grad_norm": 1.6015625, "learning_rate": 1.6875239814682313e-05, "loss": 1.0370899200439454, "num_input_tokens_seen": 22124367936, "step": 77790, "train_runtime": 757675.1454, "train_tokens_per_second": 29200.335 }, { "epoch": 2.7527172290566044, "grad_norm": 1.6015625, "learning_rate": 1.6874278771825917e-05, "loss": 1.0465311050415038, "num_input_tokens_seen": 22127225408, "step": 77800, "train_runtime": 757773.9767, "train_tokens_per_second": 29200.297 }, { "epoch": 2.7530710493203334, "grad_norm": 1.5625, "learning_rate": 1.6873317893144635e-05, "loss": 1.0439983367919923, "num_input_tokens_seen": 22130098176, "step": 77810, "train_runtime": 757875.564, "train_tokens_per_second": 29200.174 }, { "epoch": 2.7534248695840624, "grad_norm": 1.6171875, "learning_rate": 1.6872357178591744e-05, "loss": 1.0354196548461914, "num_input_tokens_seen": 22132897664, "step": 77820, "train_runtime": 757968.2652, "train_tokens_per_second": 29200.296 }, { "epoch": 2.753778689847791, "grad_norm": 1.6015625, "learning_rate": 1.6871396628120516e-05, "loss": 1.040496253967285, "num_input_tokens_seen": 22135731520, "step": 77830, "train_runtime": 758067.5578, "train_tokens_per_second": 29200.21 }, { "epoch": 2.7541325101115195, "grad_norm": 1.671875, "learning_rate": 1.6870436241684255e-05, "loss": 1.0316450119018554, "num_input_tokens_seen": 22138625280, "step": 77840, "train_runtime": 758167.172, "train_tokens_per_second": 29200.19 }, { "epoch": 2.7544863303752485, "grad_norm": 1.6328125, "learning_rate": 1.6869476019236267e-05, "loss": 1.04425048828125, "num_input_tokens_seen": 22141391040, "step": 77850, "train_runtime": 758261.2229, "train_tokens_per_second": 29200.215 }, { "epoch": 2.7548401506389775, "grad_norm": 1.5234375, "learning_rate": 1.6868515960729903e-05, "loss": 1.0301612854003905, "num_input_tokens_seen": 22144226176, "step": 77860, "train_runtime": 758355.8439, "train_tokens_per_second": 29200.311 }, { "epoch": 2.755193970902706, "grad_norm": 1.5625, "learning_rate": 1.686755606611851e-05, "loss": 1.0335573196411132, "num_input_tokens_seen": 22147074304, "step": 77870, "train_runtime": 758450.6357, "train_tokens_per_second": 29200.416 }, { "epoch": 2.755547791166435, "grad_norm": 1.625, "learning_rate": 1.6866596335355463e-05, "loss": 1.0312722206115723, "num_input_tokens_seen": 22149905152, "step": 77880, "train_runtime": 758547.4021, "train_tokens_per_second": 29200.423 }, { "epoch": 2.7559016114301635, "grad_norm": 1.6640625, "learning_rate": 1.6865636768394156e-05, "loss": 1.0460906028747559, "num_input_tokens_seen": 22152753536, "step": 77890, "train_runtime": 758645.2846, "train_tokens_per_second": 29200.41 }, { "epoch": 2.7562554316938925, "grad_norm": 1.640625, "learning_rate": 1.6864677365187998e-05, "loss": 1.0282997131347655, "num_input_tokens_seen": 22155593856, "step": 77900, "train_runtime": 758742.4448, "train_tokens_per_second": 29200.414 }, { "epoch": 2.756609251957621, "grad_norm": 1.5703125, "learning_rate": 1.6863718125690418e-05, "loss": 1.040975284576416, "num_input_tokens_seen": 22158424960, "step": 77910, "train_runtime": 758837.833, "train_tokens_per_second": 29200.475 }, { "epoch": 2.75696307222135, "grad_norm": 1.671875, "learning_rate": 1.686275904985486e-05, "loss": 1.0217095375061036, "num_input_tokens_seen": 22161254208, "step": 77920, "train_runtime": 758935.1302, "train_tokens_per_second": 29200.459 }, { "epoch": 2.7573168924850786, "grad_norm": 1.5546875, "learning_rate": 1.6861800137634795e-05, "loss": 1.0400981903076172, "num_input_tokens_seen": 22164182720, "step": 77930, "train_runtime": 759037.6816, "train_tokens_per_second": 29200.372 }, { "epoch": 2.7576707127488076, "grad_norm": 1.6796875, "learning_rate": 1.6860841388983708e-05, "loss": 1.0293962478637695, "num_input_tokens_seen": 22167008064, "step": 77940, "train_runtime": 759132.283, "train_tokens_per_second": 29200.455 }, { "epoch": 2.758024533012536, "grad_norm": 1.5703125, "learning_rate": 1.6859882803855102e-05, "loss": 1.04813232421875, "num_input_tokens_seen": 22169825856, "step": 77950, "train_runtime": 759226.5107, "train_tokens_per_second": 29200.542 }, { "epoch": 2.758378353276265, "grad_norm": 1.6171875, "learning_rate": 1.6858924382202497e-05, "loss": 1.0265396118164063, "num_input_tokens_seen": 22172692160, "step": 77960, "train_runtime": 759325.3136, "train_tokens_per_second": 29200.518 }, { "epoch": 2.758732173539994, "grad_norm": 1.609375, "learning_rate": 1.6857966123979434e-05, "loss": 1.0341054916381835, "num_input_tokens_seen": 22175520448, "step": 77970, "train_runtime": 759421.2432, "train_tokens_per_second": 29200.553 }, { "epoch": 2.7590859938037227, "grad_norm": 1.5703125, "learning_rate": 1.685700802913947e-05, "loss": 1.0466272354125976, "num_input_tokens_seen": 22178426944, "step": 77980, "train_runtime": 759520.4564, "train_tokens_per_second": 29200.566 }, { "epoch": 2.759439814067451, "grad_norm": 1.6328125, "learning_rate": 1.6856050097636186e-05, "loss": 1.057492446899414, "num_input_tokens_seen": 22181314688, "step": 77990, "train_runtime": 759622.5106, "train_tokens_per_second": 29200.444 }, { "epoch": 2.75979363433118, "grad_norm": 1.6328125, "learning_rate": 1.6855092329423174e-05, "loss": 1.0317235946655274, "num_input_tokens_seen": 22184108224, "step": 78000, "train_runtime": 759714.1784, "train_tokens_per_second": 29200.598 }, { "epoch": 2.760147454594909, "grad_norm": 1.578125, "learning_rate": 1.685413472445405e-05, "loss": 1.0371011734008788, "num_input_tokens_seen": 22186936768, "step": 78010, "train_runtime": 759810.803, "train_tokens_per_second": 29200.607 }, { "epoch": 2.7605012748586377, "grad_norm": 1.625, "learning_rate": 1.685317728268245e-05, "loss": 1.0319923400878905, "num_input_tokens_seen": 22189785280, "step": 78020, "train_runtime": 759911.5652, "train_tokens_per_second": 29200.484 }, { "epoch": 2.7608550951223663, "grad_norm": 1.6328125, "learning_rate": 1.685222000406202e-05, "loss": 1.0465873718261718, "num_input_tokens_seen": 22192593792, "step": 78030, "train_runtime": 760008.0103, "train_tokens_per_second": 29200.474 }, { "epoch": 2.7612089153860953, "grad_norm": 1.5078125, "learning_rate": 1.685126288854643e-05, "loss": 1.0314863204956055, "num_input_tokens_seen": 22195471872, "step": 78040, "train_runtime": 760106.9698, "train_tokens_per_second": 29200.458 }, { "epoch": 2.7615627356498242, "grad_norm": 1.59375, "learning_rate": 1.6850305936089365e-05, "loss": 1.0279099464416503, "num_input_tokens_seen": 22198294656, "step": 78050, "train_runtime": 760202.0147, "train_tokens_per_second": 29200.521 }, { "epoch": 2.761916555913553, "grad_norm": 1.578125, "learning_rate": 1.6849349146644543e-05, "loss": 1.0338947296142578, "num_input_tokens_seen": 22201098240, "step": 78060, "train_runtime": 760297.5686, "train_tokens_per_second": 29200.538 }, { "epoch": 2.7622703761772818, "grad_norm": 1.59375, "learning_rate": 1.6848392520165675e-05, "loss": 1.0385046005249023, "num_input_tokens_seen": 22203973952, "step": 78070, "train_runtime": 760395.7484, "train_tokens_per_second": 29200.55 }, { "epoch": 2.7626241964410103, "grad_norm": 1.5859375, "learning_rate": 1.684743605660651e-05, "loss": 1.0270936965942383, "num_input_tokens_seen": 22206807104, "step": 78080, "train_runtime": 760497.4225, "train_tokens_per_second": 29200.371 }, { "epoch": 2.7629780167047393, "grad_norm": 1.640625, "learning_rate": 1.684647975592081e-05, "loss": 1.0257631301879884, "num_input_tokens_seen": 22209710528, "step": 78090, "train_runtime": 760595.5912, "train_tokens_per_second": 29200.42 }, { "epoch": 2.763331836968468, "grad_norm": 1.5390625, "learning_rate": 1.6845523618062353e-05, "loss": 1.0324773788452148, "num_input_tokens_seen": 22212573568, "step": 78100, "train_runtime": 760693.2745, "train_tokens_per_second": 29200.434 }, { "epoch": 2.763685657232197, "grad_norm": 1.609375, "learning_rate": 1.684456764298494e-05, "loss": 1.0421674728393555, "num_input_tokens_seen": 22215399360, "step": 78110, "train_runtime": 760790.0075, "train_tokens_per_second": 29200.435 }, { "epoch": 2.7640394774959254, "grad_norm": 1.6484375, "learning_rate": 1.6843611830642385e-05, "loss": 1.025580596923828, "num_input_tokens_seen": 22218234368, "step": 78120, "train_runtime": 760887.0516, "train_tokens_per_second": 29200.437 }, { "epoch": 2.7643932977596544, "grad_norm": 1.6328125, "learning_rate": 1.6842656180988522e-05, "loss": 1.0471729278564452, "num_input_tokens_seen": 22221042496, "step": 78130, "train_runtime": 760983.5764, "train_tokens_per_second": 29200.423 }, { "epoch": 2.764747118023383, "grad_norm": 1.609375, "learning_rate": 1.6841700693977213e-05, "loss": 1.0397962570190429, "num_input_tokens_seen": 22223843904, "step": 78140, "train_runtime": 761078.2509, "train_tokens_per_second": 29200.472 }, { "epoch": 2.765100938287112, "grad_norm": 1.6328125, "learning_rate": 1.6840745369562314e-05, "loss": 1.0255697250366211, "num_input_tokens_seen": 22226673472, "step": 78150, "train_runtime": 761172.9123, "train_tokens_per_second": 29200.558 }, { "epoch": 2.765454758550841, "grad_norm": 1.609375, "learning_rate": 1.6839790207697727e-05, "loss": 1.0177677154541016, "num_input_tokens_seen": 22229570880, "step": 78160, "train_runtime": 761273.0832, "train_tokens_per_second": 29200.521 }, { "epoch": 2.7658085788145694, "grad_norm": 1.53125, "learning_rate": 1.6838835208337357e-05, "loss": 1.034083938598633, "num_input_tokens_seen": 22232420608, "step": 78170, "train_runtime": 761369.3756, "train_tokens_per_second": 29200.571 }, { "epoch": 2.766162399078298, "grad_norm": 1.640625, "learning_rate": 1.6837880371435127e-05, "loss": 1.0238880157470702, "num_input_tokens_seen": 22235267136, "step": 78180, "train_runtime": 761467.8782, "train_tokens_per_second": 29200.532 }, { "epoch": 2.766516219342027, "grad_norm": 1.6171875, "learning_rate": 1.6836925696944987e-05, "loss": 1.0508018493652345, "num_input_tokens_seen": 22238079104, "step": 78190, "train_runtime": 761562.7354, "train_tokens_per_second": 29200.587 }, { "epoch": 2.766870039605756, "grad_norm": 1.6171875, "learning_rate": 1.6835971184820895e-05, "loss": 1.0402687072753907, "num_input_tokens_seen": 22240920832, "step": 78200, "train_runtime": 761658.4597, "train_tokens_per_second": 29200.648 }, { "epoch": 2.7672238598694845, "grad_norm": 1.671875, "learning_rate": 1.6835016835016834e-05, "loss": 1.0383331298828125, "num_input_tokens_seen": 22243733824, "step": 78210, "train_runtime": 761753.8143, "train_tokens_per_second": 29200.686 }, { "epoch": 2.7675776801332135, "grad_norm": 1.5859375, "learning_rate": 1.683406264748681e-05, "loss": 1.028543186187744, "num_input_tokens_seen": 22246553728, "step": 78220, "train_runtime": 761848.1517, "train_tokens_per_second": 29200.771 }, { "epoch": 2.767931500396942, "grad_norm": 1.5703125, "learning_rate": 1.6833108622184828e-05, "loss": 1.056753158569336, "num_input_tokens_seen": 22249420352, "step": 78230, "train_runtime": 761948.9455, "train_tokens_per_second": 29200.671 }, { "epoch": 2.768285320660671, "grad_norm": 1.625, "learning_rate": 1.6832154759064936e-05, "loss": 1.045571517944336, "num_input_tokens_seen": 22252240832, "step": 78240, "train_runtime": 762045.1599, "train_tokens_per_second": 29200.685 }, { "epoch": 2.7686391409243996, "grad_norm": 1.71875, "learning_rate": 1.6831201058081183e-05, "loss": 1.0426578521728516, "num_input_tokens_seen": 22255082176, "step": 78250, "train_runtime": 762140.944, "train_tokens_per_second": 29200.743 }, { "epoch": 2.7689929611881285, "grad_norm": 1.5625, "learning_rate": 1.6830247519187638e-05, "loss": 1.0339637756347657, "num_input_tokens_seen": 22257962304, "step": 78260, "train_runtime": 762239.9919, "train_tokens_per_second": 29200.728 }, { "epoch": 2.769346781451857, "grad_norm": 1.65625, "learning_rate": 1.68292941423384e-05, "loss": 1.0424501419067382, "num_input_tokens_seen": 22260806144, "step": 78270, "train_runtime": 762338.8324, "train_tokens_per_second": 29200.672 }, { "epoch": 2.769700601715586, "grad_norm": 1.6015625, "learning_rate": 1.682834092748757e-05, "loss": 1.0182760238647461, "num_input_tokens_seen": 22263636032, "step": 78280, "train_runtime": 762434.9717, "train_tokens_per_second": 29200.702 }, { "epoch": 2.7700544219793146, "grad_norm": 1.5703125, "learning_rate": 1.682738787458928e-05, "loss": 1.0279247283935546, "num_input_tokens_seen": 22266491520, "step": 78290, "train_runtime": 762531.8361, "train_tokens_per_second": 29200.737 }, { "epoch": 2.7704082422430436, "grad_norm": 1.609375, "learning_rate": 1.6826434983597672e-05, "loss": 1.0421895027160644, "num_input_tokens_seen": 22269292672, "step": 78300, "train_runtime": 762625.174, "train_tokens_per_second": 29200.836 }, { "epoch": 2.7707620625067726, "grad_norm": 1.5703125, "learning_rate": 1.6825482254466916e-05, "loss": 1.0415054321289063, "num_input_tokens_seen": 22272114496, "step": 78310, "train_runtime": 762721.7945, "train_tokens_per_second": 29200.837 }, { "epoch": 2.771115882770501, "grad_norm": 1.609375, "learning_rate": 1.6824529687151183e-05, "loss": 1.0404348373413086, "num_input_tokens_seen": 22274962176, "step": 78320, "train_runtime": 762819.4189, "train_tokens_per_second": 29200.833 }, { "epoch": 2.7714697030342297, "grad_norm": 1.578125, "learning_rate": 1.682357728160468e-05, "loss": 1.0567041397094727, "num_input_tokens_seen": 22277834496, "step": 78330, "train_runtime": 762919.1317, "train_tokens_per_second": 29200.781 }, { "epoch": 2.7718235232979587, "grad_norm": 1.6015625, "learning_rate": 1.6822625037781626e-05, "loss": 1.045063591003418, "num_input_tokens_seen": 22280728768, "step": 78340, "train_runtime": 763019.4845, "train_tokens_per_second": 29200.734 }, { "epoch": 2.7721773435616877, "grad_norm": 1.53125, "learning_rate": 1.6821672955636254e-05, "loss": 1.0316388130187988, "num_input_tokens_seen": 22283664064, "step": 78350, "train_runtime": 763123.7184, "train_tokens_per_second": 29200.592 }, { "epoch": 2.772531163825416, "grad_norm": 1.625, "learning_rate": 1.6820721035122815e-05, "loss": 1.0297891616821289, "num_input_tokens_seen": 22286453632, "step": 78360, "train_runtime": 763215.5521, "train_tokens_per_second": 29200.733 }, { "epoch": 2.7728849840891447, "grad_norm": 1.59375, "learning_rate": 1.6819769276195584e-05, "loss": 1.0312591552734376, "num_input_tokens_seen": 22289323072, "step": 78370, "train_runtime": 763313.5241, "train_tokens_per_second": 29200.744 }, { "epoch": 2.7732388043528737, "grad_norm": 1.578125, "learning_rate": 1.6818817678808855e-05, "loss": 1.0421823501586913, "num_input_tokens_seen": 22292172864, "step": 78380, "train_runtime": 763409.7858, "train_tokens_per_second": 29200.795 }, { "epoch": 2.7735926246166027, "grad_norm": 1.6484375, "learning_rate": 1.6817866242916934e-05, "loss": 1.0434464454650878, "num_input_tokens_seen": 22295007808, "step": 78390, "train_runtime": 763507.0593, "train_tokens_per_second": 29200.788 }, { "epoch": 2.7739464448803313, "grad_norm": 1.6171875, "learning_rate": 1.6816914968474148e-05, "loss": 1.03793306350708, "num_input_tokens_seen": 22297791168, "step": 78400, "train_runtime": 763599.8369, "train_tokens_per_second": 29200.885 }, { "epoch": 2.7743002651440603, "grad_norm": 1.5859375, "learning_rate": 1.6815963855434838e-05, "loss": 1.0423437118530274, "num_input_tokens_seen": 22300622016, "step": 78410, "train_runtime": 763694.9987, "train_tokens_per_second": 29200.953 }, { "epoch": 2.774654085407789, "grad_norm": 1.6796875, "learning_rate": 1.681501290375337e-05, "loss": 1.0273399353027344, "num_input_tokens_seen": 22303400320, "step": 78420, "train_runtime": 763787.9508, "train_tokens_per_second": 29201.037 }, { "epoch": 2.775007905671518, "grad_norm": 1.546875, "learning_rate": 1.6814062113384127e-05, "loss": 1.0374479293823242, "num_input_tokens_seen": 22306210880, "step": 78430, "train_runtime": 763884.6273, "train_tokens_per_second": 29201.021 }, { "epoch": 2.7753617259352463, "grad_norm": 1.6171875, "learning_rate": 1.6813111484281506e-05, "loss": 1.042191982269287, "num_input_tokens_seen": 22309084032, "step": 78440, "train_runtime": 763987.5244, "train_tokens_per_second": 29200.849 }, { "epoch": 2.7757155461989753, "grad_norm": 1.59375, "learning_rate": 1.6812161016399918e-05, "loss": 1.0244480133056642, "num_input_tokens_seen": 22311947648, "step": 78450, "train_runtime": 764087.5827, "train_tokens_per_second": 29200.772 }, { "epoch": 2.7760693664627043, "grad_norm": 1.6171875, "learning_rate": 1.681121070969381e-05, "loss": 1.0299898147583009, "num_input_tokens_seen": 22314863168, "step": 78460, "train_runtime": 764188.8169, "train_tokens_per_second": 29200.719 }, { "epoch": 2.776423186726433, "grad_norm": 1.6640625, "learning_rate": 1.6810260564117625e-05, "loss": 1.0283088684082031, "num_input_tokens_seen": 22317715904, "step": 78470, "train_runtime": 764288.616, "train_tokens_per_second": 29200.639 }, { "epoch": 2.7767770069901614, "grad_norm": 1.6796875, "learning_rate": 1.6809310579625838e-05, "loss": 1.0412121772766114, "num_input_tokens_seen": 22320463168, "step": 78480, "train_runtime": 764380.9968, "train_tokens_per_second": 29200.704 }, { "epoch": 2.7771308272538904, "grad_norm": 1.5859375, "learning_rate": 1.680836075617293e-05, "loss": 1.0414365768432616, "num_input_tokens_seen": 22323344384, "step": 78490, "train_runtime": 764480.6657, "train_tokens_per_second": 29200.666 }, { "epoch": 2.7774846475176194, "grad_norm": 1.5703125, "learning_rate": 1.6807411093713423e-05, "loss": 1.0258904457092286, "num_input_tokens_seen": 22326178176, "step": 78500, "train_runtime": 764579.5866, "train_tokens_per_second": 29200.594 }, { "epoch": 2.777838467781348, "grad_norm": 1.59375, "learning_rate": 1.6806461592201837e-05, "loss": 1.0158932685852051, "num_input_tokens_seen": 22329054592, "step": 78510, "train_runtime": 764680.0089, "train_tokens_per_second": 29200.521 }, { "epoch": 2.7781922880450765, "grad_norm": 1.671875, "learning_rate": 1.6805512251592702e-05, "loss": 1.0426855087280273, "num_input_tokens_seen": 22331912768, "step": 78520, "train_runtime": 764778.8492, "train_tokens_per_second": 29200.484 }, { "epoch": 2.7785461083088054, "grad_norm": 1.6640625, "learning_rate": 1.6804563071840595e-05, "loss": 1.027762508392334, "num_input_tokens_seen": 22334710336, "step": 78530, "train_runtime": 764874.4049, "train_tokens_per_second": 29200.494 }, { "epoch": 2.7788999285725344, "grad_norm": 1.6484375, "learning_rate": 1.680361405290009e-05, "loss": 1.0424509048461914, "num_input_tokens_seen": 22337572160, "step": 78540, "train_runtime": 764972.9259, "train_tokens_per_second": 29200.474 }, { "epoch": 2.779253748836263, "grad_norm": 1.5390625, "learning_rate": 1.6802665194725778e-05, "loss": 1.0509458541870118, "num_input_tokens_seen": 22340434496, "step": 78550, "train_runtime": 765069.7464, "train_tokens_per_second": 29200.52 }, { "epoch": 2.779607569099992, "grad_norm": 1.578125, "learning_rate": 1.6801716497272283e-05, "loss": 1.0310098648071289, "num_input_tokens_seen": 22343290432, "step": 78560, "train_runtime": 765166.1589, "train_tokens_per_second": 29200.573 }, { "epoch": 2.7799613893637205, "grad_norm": 1.5546875, "learning_rate": 1.6800767960494234e-05, "loss": 1.0226579666137696, "num_input_tokens_seen": 22346138368, "step": 78570, "train_runtime": 765262.3869, "train_tokens_per_second": 29200.623 }, { "epoch": 2.7803152096274495, "grad_norm": 1.59375, "learning_rate": 1.6799819584346275e-05, "loss": 1.0368896484375, "num_input_tokens_seen": 22348997440, "step": 78580, "train_runtime": 765358.4431, "train_tokens_per_second": 29200.694 }, { "epoch": 2.780669029891178, "grad_norm": 1.6015625, "learning_rate": 1.6798871368783085e-05, "loss": 1.032035732269287, "num_input_tokens_seen": 22351825024, "step": 78590, "train_runtime": 765453.1556, "train_tokens_per_second": 29200.775 }, { "epoch": 2.781022850154907, "grad_norm": 1.578125, "learning_rate": 1.6797923313759344e-05, "loss": 1.0324738502502442, "num_input_tokens_seen": 22354714048, "step": 78600, "train_runtime": 765552.4537, "train_tokens_per_second": 29200.761 }, { "epoch": 2.7813766704186356, "grad_norm": 1.5703125, "learning_rate": 1.679697541922976e-05, "loss": 1.0181628227233888, "num_input_tokens_seen": 22357579840, "step": 78610, "train_runtime": 765651.9125, "train_tokens_per_second": 29200.711 }, { "epoch": 2.7817304906823646, "grad_norm": 1.609375, "learning_rate": 1.679602768514905e-05, "loss": 1.0437126159667969, "num_input_tokens_seen": 22360363328, "step": 78620, "train_runtime": 765746.1006, "train_tokens_per_second": 29200.754 }, { "epoch": 2.782084310946093, "grad_norm": 1.59375, "learning_rate": 1.679508011147196e-05, "loss": 1.0406976699829102, "num_input_tokens_seen": 22363190912, "step": 78630, "train_runtime": 765842.049, "train_tokens_per_second": 29200.787 }, { "epoch": 2.782438131209822, "grad_norm": 1.59375, "learning_rate": 1.679413269815325e-05, "loss": 1.036379051208496, "num_input_tokens_seen": 22366037632, "step": 78640, "train_runtime": 765938.3899, "train_tokens_per_second": 29200.831 }, { "epoch": 2.782791951473551, "grad_norm": 1.546875, "learning_rate": 1.679318544514769e-05, "loss": 1.0345842361450195, "num_input_tokens_seen": 22368912640, "step": 78650, "train_runtime": 766037.6452, "train_tokens_per_second": 29200.801 }, { "epoch": 2.7831457717372796, "grad_norm": 1.6328125, "learning_rate": 1.679223835241007e-05, "loss": 1.041607666015625, "num_input_tokens_seen": 22371757440, "step": 78660, "train_runtime": 766134.6748, "train_tokens_per_second": 29200.816 }, { "epoch": 2.783499592001008, "grad_norm": 1.6328125, "learning_rate": 1.679129141989521e-05, "loss": 1.0324914932250977, "num_input_tokens_seen": 22374578816, "step": 78670, "train_runtime": 766230.004, "train_tokens_per_second": 29200.865 }, { "epoch": 2.783853412264737, "grad_norm": 1.5859375, "learning_rate": 1.6790344647557936e-05, "loss": 1.024125862121582, "num_input_tokens_seen": 22377440960, "step": 78680, "train_runtime": 766329.6606, "train_tokens_per_second": 29200.802 }, { "epoch": 2.784207232528466, "grad_norm": 1.6328125, "learning_rate": 1.6789398035353095e-05, "loss": 1.0376310348510742, "num_input_tokens_seen": 22380344832, "step": 78690, "train_runtime": 766429.6488, "train_tokens_per_second": 29200.782 }, { "epoch": 2.7845610527921947, "grad_norm": 1.578125, "learning_rate": 1.6788451583235557e-05, "loss": 1.0235712051391601, "num_input_tokens_seen": 22383213120, "step": 78700, "train_runtime": 766528.1996, "train_tokens_per_second": 29200.769 }, { "epoch": 2.7849148730559237, "grad_norm": 1.5390625, "learning_rate": 1.6787505291160198e-05, "loss": 1.0341009140014648, "num_input_tokens_seen": 22386001152, "step": 78710, "train_runtime": 766619.0003, "train_tokens_per_second": 29200.947 }, { "epoch": 2.785268693319652, "grad_norm": 1.59375, "learning_rate": 1.6786559159081923e-05, "loss": 1.027538013458252, "num_input_tokens_seen": 22388851200, "step": 78720, "train_runtime": 766717.9988, "train_tokens_per_second": 29200.894 }, { "epoch": 2.785622513583381, "grad_norm": 1.6328125, "learning_rate": 1.6785613186955645e-05, "loss": 1.0448867797851562, "num_input_tokens_seen": 22391718272, "step": 78730, "train_runtime": 766816.6326, "train_tokens_per_second": 29200.877 }, { "epoch": 2.7859763338471097, "grad_norm": 1.5546875, "learning_rate": 1.6784667374736305e-05, "loss": 1.0274223327636718, "num_input_tokens_seen": 22394603136, "step": 78740, "train_runtime": 766916.8656, "train_tokens_per_second": 29200.822 }, { "epoch": 2.7863301541108387, "grad_norm": 1.5859375, "learning_rate": 1.678372172237886e-05, "loss": 1.040988826751709, "num_input_tokens_seen": 22397408832, "step": 78750, "train_runtime": 767013.0303, "train_tokens_per_second": 29200.819 }, { "epoch": 2.7866839743745673, "grad_norm": 1.7421875, "learning_rate": 1.678277622983827e-05, "loss": 1.0438885688781738, "num_input_tokens_seen": 22400283968, "step": 78760, "train_runtime": 767113.1525, "train_tokens_per_second": 29200.756 }, { "epoch": 2.7870377946382963, "grad_norm": 1.5625, "learning_rate": 1.678183089706954e-05, "loss": 1.038498306274414, "num_input_tokens_seen": 22403159552, "step": 78770, "train_runtime": 767211.7968, "train_tokens_per_second": 29200.75 }, { "epoch": 2.787391614902025, "grad_norm": 1.6640625, "learning_rate": 1.6780885724027666e-05, "loss": 1.0388550758361816, "num_input_tokens_seen": 22405994944, "step": 78780, "train_runtime": 767310.2212, "train_tokens_per_second": 29200.699 }, { "epoch": 2.787745435165754, "grad_norm": 1.625, "learning_rate": 1.6779940710667678e-05, "loss": 1.0492558479309082, "num_input_tokens_seen": 22408906560, "step": 78790, "train_runtime": 767411.6266, "train_tokens_per_second": 29200.635 }, { "epoch": 2.788099255429483, "grad_norm": 1.609375, "learning_rate": 1.677899585694461e-05, "loss": 1.0364137649536134, "num_input_tokens_seen": 22411748224, "step": 78800, "train_runtime": 767507.7748, "train_tokens_per_second": 29200.679 }, { "epoch": 2.7884530756932113, "grad_norm": 1.5703125, "learning_rate": 1.677805116281354e-05, "loss": 1.034420108795166, "num_input_tokens_seen": 22414616128, "step": 78810, "train_runtime": 767607.7412, "train_tokens_per_second": 29200.612 }, { "epoch": 2.78880689595694, "grad_norm": 1.640625, "learning_rate": 1.6777106628229533e-05, "loss": 1.0425487518310548, "num_input_tokens_seen": 22417387840, "step": 78820, "train_runtime": 767702.0171, "train_tokens_per_second": 29200.637 }, { "epoch": 2.789160716220669, "grad_norm": 1.6015625, "learning_rate": 1.677616225314769e-05, "loss": 1.0390522003173828, "num_input_tokens_seen": 22420179392, "step": 78830, "train_runtime": 767795.9362, "train_tokens_per_second": 29200.701 }, { "epoch": 2.789514536484398, "grad_norm": 1.6484375, "learning_rate": 1.6775218037523117e-05, "loss": 1.0310272216796874, "num_input_tokens_seen": 22423023808, "step": 78840, "train_runtime": 767892.4051, "train_tokens_per_second": 29200.737 }, { "epoch": 2.7898683567481264, "grad_norm": 1.625, "learning_rate": 1.6774273981310952e-05, "loss": 1.0331769943237306, "num_input_tokens_seen": 22425856768, "step": 78850, "train_runtime": 767990.0932, "train_tokens_per_second": 29200.711 }, { "epoch": 2.790222177011855, "grad_norm": 1.5625, "learning_rate": 1.6773330084466342e-05, "loss": 1.0359731674194337, "num_input_tokens_seen": 22428683712, "step": 78860, "train_runtime": 768088.123, "train_tokens_per_second": 29200.665 }, { "epoch": 2.790575997275584, "grad_norm": 1.625, "learning_rate": 1.6772386346944455e-05, "loss": 1.0385757446289063, "num_input_tokens_seen": 22431505600, "step": 78870, "train_runtime": 768183.1599, "train_tokens_per_second": 29200.726 }, { "epoch": 2.790929817539313, "grad_norm": 1.5390625, "learning_rate": 1.6771442768700477e-05, "loss": 1.0342417716979981, "num_input_tokens_seen": 22434373568, "step": 78880, "train_runtime": 768279.8276, "train_tokens_per_second": 29200.784 }, { "epoch": 2.7912836378030415, "grad_norm": 1.640625, "learning_rate": 1.6770499349689606e-05, "loss": 1.0319907188415527, "num_input_tokens_seen": 22437308160, "step": 78890, "train_runtime": 768380.691, "train_tokens_per_second": 29200.77 }, { "epoch": 2.7916374580667704, "grad_norm": 1.625, "learning_rate": 1.676955608986706e-05, "loss": 1.025151538848877, "num_input_tokens_seen": 22440142976, "step": 78900, "train_runtime": 768475.9325, "train_tokens_per_second": 29200.84 }, { "epoch": 2.791991278330499, "grad_norm": 1.59375, "learning_rate": 1.676861298918808e-05, "loss": 1.0387285232543946, "num_input_tokens_seen": 22442945728, "step": 78910, "train_runtime": 768570.6319, "train_tokens_per_second": 29200.889 }, { "epoch": 2.792345098594228, "grad_norm": 1.546875, "learning_rate": 1.6767670047607924e-05, "loss": 1.0349979400634766, "num_input_tokens_seen": 22445788992, "step": 78920, "train_runtime": 768668.7382, "train_tokens_per_second": 29200.861 }, { "epoch": 2.7926989188579565, "grad_norm": 1.5703125, "learning_rate": 1.6766727265081858e-05, "loss": 1.0273520469665527, "num_input_tokens_seen": 22448639232, "step": 78930, "train_runtime": 768767.3205, "train_tokens_per_second": 29200.824 }, { "epoch": 2.7930527391216855, "grad_norm": 1.625, "learning_rate": 1.676578464156517e-05, "loss": 1.0417093276977538, "num_input_tokens_seen": 22451453376, "step": 78940, "train_runtime": 768863.3193, "train_tokens_per_second": 29200.838 }, { "epoch": 2.793406559385414, "grad_norm": 1.625, "learning_rate": 1.6764842177013176e-05, "loss": 1.034782886505127, "num_input_tokens_seen": 22454338048, "step": 78950, "train_runtime": 768964.8239, "train_tokens_per_second": 29200.735 }, { "epoch": 2.793760379649143, "grad_norm": 1.5546875, "learning_rate": 1.67638998713812e-05, "loss": 1.0416025161743163, "num_input_tokens_seen": 22457192384, "step": 78960, "train_runtime": 769060.5437, "train_tokens_per_second": 29200.812 }, { "epoch": 2.7941141999128716, "grad_norm": 1.609375, "learning_rate": 1.676295772462457e-05, "loss": 1.0250621795654298, "num_input_tokens_seen": 22460072896, "step": 78970, "train_runtime": 769162.2442, "train_tokens_per_second": 29200.696 }, { "epoch": 2.7944680201766006, "grad_norm": 1.609375, "learning_rate": 1.6762015736698667e-05, "loss": 1.0459904670715332, "num_input_tokens_seen": 22462947456, "step": 78980, "train_runtime": 769262.9762, "train_tokens_per_second": 29200.609 }, { "epoch": 2.7948218404403296, "grad_norm": 1.578125, "learning_rate": 1.676107390755886e-05, "loss": 1.0297903060913085, "num_input_tokens_seen": 22465819968, "step": 78990, "train_runtime": 769363.2508, "train_tokens_per_second": 29200.537 }, { "epoch": 2.795175660704058, "grad_norm": 1.5859375, "learning_rate": 1.6760132237160538e-05, "loss": 1.0294001579284668, "num_input_tokens_seen": 22468670784, "step": 79000, "train_runtime": 769459.5651, "train_tokens_per_second": 29200.587 }, { "epoch": 2.7955294809677866, "grad_norm": 1.625, "learning_rate": 1.6759190725459125e-05, "loss": 1.0272762298583984, "num_input_tokens_seen": 22471500608, "step": 79010, "train_runtime": 769557.2681, "train_tokens_per_second": 29200.557 }, { "epoch": 2.7958833012315156, "grad_norm": 1.6796875, "learning_rate": 1.675824937241005e-05, "loss": 1.0256433486938477, "num_input_tokens_seen": 22474348096, "step": 79020, "train_runtime": 769655.3504, "train_tokens_per_second": 29200.535 }, { "epoch": 2.7962371214952446, "grad_norm": 1.59375, "learning_rate": 1.675730817796875e-05, "loss": 1.0421129226684571, "num_input_tokens_seen": 22477195520, "step": 79030, "train_runtime": 769751.528, "train_tokens_per_second": 29200.586 }, { "epoch": 2.796590941758973, "grad_norm": 1.5703125, "learning_rate": 1.67563671420907e-05, "loss": 1.0367191314697266, "num_input_tokens_seen": 22480027648, "step": 79040, "train_runtime": 769848.6608, "train_tokens_per_second": 29200.58 }, { "epoch": 2.796944762022702, "grad_norm": 1.59375, "learning_rate": 1.6755426264731383e-05, "loss": 1.0395885467529298, "num_input_tokens_seen": 22482931776, "step": 79050, "train_runtime": 769948.6356, "train_tokens_per_second": 29200.561 }, { "epoch": 2.7972985822864307, "grad_norm": 1.640625, "learning_rate": 1.6754485545846296e-05, "loss": 1.029010009765625, "num_input_tokens_seen": 22485762688, "step": 79060, "train_runtime": 770045.6867, "train_tokens_per_second": 29200.557 }, { "epoch": 2.7976524025501597, "grad_norm": 1.5625, "learning_rate": 1.675354498539096e-05, "loss": 1.033984661102295, "num_input_tokens_seen": 22488650496, "step": 79070, "train_runtime": 770143.8171, "train_tokens_per_second": 29200.586 }, { "epoch": 2.798006222813888, "grad_norm": 1.6796875, "learning_rate": 1.675260458332091e-05, "loss": 1.0408400535583495, "num_input_tokens_seen": 22491476864, "step": 79080, "train_runtime": 770242.4786, "train_tokens_per_second": 29200.515 }, { "epoch": 2.798360043077617, "grad_norm": 1.6484375, "learning_rate": 1.6751664339591696e-05, "loss": 1.0310531616210938, "num_input_tokens_seen": 22494350720, "step": 79090, "train_runtime": 770343.8139, "train_tokens_per_second": 29200.404 }, { "epoch": 2.7987138633413458, "grad_norm": 1.578125, "learning_rate": 1.6750724254158888e-05, "loss": 1.031711483001709, "num_input_tokens_seen": 22497189248, "step": 79100, "train_runtime": 770441.4164, "train_tokens_per_second": 29200.389 }, { "epoch": 2.7990676836050747, "grad_norm": 1.5859375, "learning_rate": 1.674978432697808e-05, "loss": 1.0335887908935546, "num_input_tokens_seen": 22500000512, "step": 79110, "train_runtime": 770536.6314, "train_tokens_per_second": 29200.429 }, { "epoch": 2.7994215038688033, "grad_norm": 1.6171875, "learning_rate": 1.6748844558004877e-05, "loss": 1.0389722824096679, "num_input_tokens_seen": 22502837696, "step": 79120, "train_runtime": 770632.8517, "train_tokens_per_second": 29200.465 }, { "epoch": 2.7997753241325323, "grad_norm": 1.625, "learning_rate": 1.6747904947194892e-05, "loss": 1.0459507942199706, "num_input_tokens_seen": 22505659008, "step": 79130, "train_runtime": 770730.5204, "train_tokens_per_second": 29200.425 }, { "epoch": 2.8001291443962613, "grad_norm": 1.65625, "learning_rate": 1.6746965494503776e-05, "loss": 1.0330518722534179, "num_input_tokens_seen": 22508518272, "step": 79140, "train_runtime": 770832.8795, "train_tokens_per_second": 29200.257 }, { "epoch": 2.80048296465999, "grad_norm": 1.640625, "learning_rate": 1.6746026199887178e-05, "loss": 1.021514320373535, "num_input_tokens_seen": 22511400896, "step": 79150, "train_runtime": 770932.6566, "train_tokens_per_second": 29200.217 }, { "epoch": 2.8008367849237183, "grad_norm": 1.6875, "learning_rate": 1.674508706330078e-05, "loss": 1.0297744750976563, "num_input_tokens_seen": 22514250368, "step": 79160, "train_runtime": 771030.0685, "train_tokens_per_second": 29200.224 }, { "epoch": 2.8011906051874473, "grad_norm": 1.6015625, "learning_rate": 1.674414808470027e-05, "loss": 1.0259479522705077, "num_input_tokens_seen": 22517091392, "step": 79170, "train_runtime": 771126.5486, "train_tokens_per_second": 29200.254 }, { "epoch": 2.8015444254511763, "grad_norm": 1.625, "learning_rate": 1.674320926404136e-05, "loss": 1.039177703857422, "num_input_tokens_seen": 22519973952, "step": 79180, "train_runtime": 771228.352, "train_tokens_per_second": 29200.138 }, { "epoch": 2.801898245714905, "grad_norm": 1.5703125, "learning_rate": 1.6742270601279773e-05, "loss": 1.0355941772460937, "num_input_tokens_seen": 22522788032, "step": 79190, "train_runtime": 771323.59, "train_tokens_per_second": 29200.18 }, { "epoch": 2.8022520659786334, "grad_norm": 1.5859375, "learning_rate": 1.674133209637126e-05, "loss": 1.0276732444763184, "num_input_tokens_seen": 22525527232, "step": 79200, "train_runtime": 771416.1694, "train_tokens_per_second": 29200.227 }, { "epoch": 2.8026058862423624, "grad_norm": 1.5546875, "learning_rate": 1.6740393749271583e-05, "loss": 1.0273798942565917, "num_input_tokens_seen": 22528348864, "step": 79210, "train_runtime": 771512.1975, "train_tokens_per_second": 29200.25 }, { "epoch": 2.8029597065060914, "grad_norm": 1.59375, "learning_rate": 1.6739455559936515e-05, "loss": 1.0279330253601073, "num_input_tokens_seen": 22531238848, "step": 79220, "train_runtime": 771613.9657, "train_tokens_per_second": 29200.144 }, { "epoch": 2.80331352676982, "grad_norm": 1.6484375, "learning_rate": 1.6738517528321858e-05, "loss": 1.0308595657348634, "num_input_tokens_seen": 22534054976, "step": 79230, "train_runtime": 771708.0486, "train_tokens_per_second": 29200.233 }, { "epoch": 2.803667347033549, "grad_norm": 1.5390625, "learning_rate": 1.673757965438342e-05, "loss": 1.038060188293457, "num_input_tokens_seen": 22536885504, "step": 79240, "train_runtime": 771802.9332, "train_tokens_per_second": 29200.311 }, { "epoch": 2.8040211672972775, "grad_norm": 1.609375, "learning_rate": 1.6736641938077036e-05, "loss": 1.0232739448547363, "num_input_tokens_seen": 22539703424, "step": 79250, "train_runtime": 771899.7107, "train_tokens_per_second": 29200.3 }, { "epoch": 2.8043749875610064, "grad_norm": 1.6015625, "learning_rate": 1.6735704379358556e-05, "loss": 1.0274675369262696, "num_input_tokens_seen": 22542576768, "step": 79260, "train_runtime": 771997.4157, "train_tokens_per_second": 29200.327 }, { "epoch": 2.804728807824735, "grad_norm": 1.6015625, "learning_rate": 1.6734766978183844e-05, "loss": 1.0376950263977052, "num_input_tokens_seen": 22545414400, "step": 79270, "train_runtime": 772095.3964, "train_tokens_per_second": 29200.296 }, { "epoch": 2.805082628088464, "grad_norm": 1.5390625, "learning_rate": 1.6733829734508786e-05, "loss": 1.0474204063415526, "num_input_tokens_seen": 22548244032, "step": 79280, "train_runtime": 772190.2691, "train_tokens_per_second": 29200.373 }, { "epoch": 2.8054364483521925, "grad_norm": 1.5625, "learning_rate": 1.6732892648289272e-05, "loss": 1.0465702056884765, "num_input_tokens_seen": 22551078080, "step": 79290, "train_runtime": 772286.5298, "train_tokens_per_second": 29200.403 }, { "epoch": 2.8057902686159215, "grad_norm": 1.6171875, "learning_rate": 1.6731955719481236e-05, "loss": 1.0349903106689453, "num_input_tokens_seen": 22553890176, "step": 79300, "train_runtime": 772380.4965, "train_tokens_per_second": 29200.492 }, { "epoch": 2.80614408887965, "grad_norm": 1.6015625, "learning_rate": 1.6731018948040602e-05, "loss": 1.0348207473754882, "num_input_tokens_seen": 22556735360, "step": 79310, "train_runtime": 772478.8663, "train_tokens_per_second": 29200.456 }, { "epoch": 2.806497909143379, "grad_norm": 1.609375, "learning_rate": 1.6730082333923324e-05, "loss": 1.0304140090942382, "num_input_tokens_seen": 22559638784, "step": 79320, "train_runtime": 772581.3229, "train_tokens_per_second": 29200.342 }, { "epoch": 2.806851729407108, "grad_norm": 1.5859375, "learning_rate": 1.6729145877085377e-05, "loss": 1.029456615447998, "num_input_tokens_seen": 22562438080, "step": 79330, "train_runtime": 772675.1437, "train_tokens_per_second": 29200.419 }, { "epoch": 2.8072055496708366, "grad_norm": 1.625, "learning_rate": 1.6728209577482738e-05, "loss": 1.0435773849487304, "num_input_tokens_seen": 22565311872, "step": 79340, "train_runtime": 772772.4287, "train_tokens_per_second": 29200.462 }, { "epoch": 2.807559369934565, "grad_norm": 1.625, "learning_rate": 1.672727343507142e-05, "loss": 1.024774169921875, "num_input_tokens_seen": 22568143872, "step": 79350, "train_runtime": 772869.3907, "train_tokens_per_second": 29200.463 }, { "epoch": 2.807913190198294, "grad_norm": 1.6796875, "learning_rate": 1.6726337449807442e-05, "loss": 1.0179197311401367, "num_input_tokens_seen": 22570998912, "step": 79360, "train_runtime": 772966.1939, "train_tokens_per_second": 29200.499 }, { "epoch": 2.808267010462023, "grad_norm": 1.625, "learning_rate": 1.6725401621646838e-05, "loss": 1.037172222137451, "num_input_tokens_seen": 22573867392, "step": 79370, "train_runtime": 773064.7586, "train_tokens_per_second": 29200.487 }, { "epoch": 2.8086208307257516, "grad_norm": 1.625, "learning_rate": 1.672446595054567e-05, "loss": 1.037921142578125, "num_input_tokens_seen": 22576701120, "step": 79380, "train_runtime": 773161.2511, "train_tokens_per_second": 29200.508 }, { "epoch": 2.8089746509894806, "grad_norm": 1.6015625, "learning_rate": 1.6723530436460007e-05, "loss": 1.0508163452148438, "num_input_tokens_seen": 22579582016, "step": 79390, "train_runtime": 773261.3043, "train_tokens_per_second": 29200.455 }, { "epoch": 2.809328471253209, "grad_norm": 1.5, "learning_rate": 1.6722595079345938e-05, "loss": 1.0305066108703613, "num_input_tokens_seen": 22582426944, "step": 79400, "train_runtime": 773357.5584, "train_tokens_per_second": 29200.499 }, { "epoch": 2.809682291516938, "grad_norm": 1.6328125, "learning_rate": 1.6721659879159576e-05, "loss": 1.0415762901306151, "num_input_tokens_seen": 22585227584, "step": 79410, "train_runtime": 773451.1572, "train_tokens_per_second": 29200.587 }, { "epoch": 2.8100361117806667, "grad_norm": 1.6015625, "learning_rate": 1.672072483585704e-05, "loss": 1.0397422790527344, "num_input_tokens_seen": 22588139392, "step": 79420, "train_runtime": 773551.0842, "train_tokens_per_second": 29200.579 }, { "epoch": 2.8103899320443957, "grad_norm": 1.6015625, "learning_rate": 1.6719789949394475e-05, "loss": 1.033463478088379, "num_input_tokens_seen": 22590980032, "step": 79430, "train_runtime": 773650.7954, "train_tokens_per_second": 29200.487 }, { "epoch": 2.8107437523081242, "grad_norm": 1.6015625, "learning_rate": 1.6718855219728038e-05, "loss": 1.038078498840332, "num_input_tokens_seen": 22593824960, "step": 79440, "train_runtime": 773747.761, "train_tokens_per_second": 29200.504 }, { "epoch": 2.811097572571853, "grad_norm": 1.5390625, "learning_rate": 1.6717920646813904e-05, "loss": 1.0373571395874024, "num_input_tokens_seen": 22596675008, "step": 79450, "train_runtime": 773844.1537, "train_tokens_per_second": 29200.55 }, { "epoch": 2.8114513928355818, "grad_norm": 1.640625, "learning_rate": 1.671698623060827e-05, "loss": 1.0321333885192872, "num_input_tokens_seen": 22599531776, "step": 79460, "train_runtime": 773943.1503, "train_tokens_per_second": 29200.506 }, { "epoch": 2.8118052130993108, "grad_norm": 1.671875, "learning_rate": 1.6716051971067343e-05, "loss": 1.0351702690124511, "num_input_tokens_seen": 22602311936, "step": 79470, "train_runtime": 774036.1573, "train_tokens_per_second": 29200.589 }, { "epoch": 2.8121590333630397, "grad_norm": 1.71875, "learning_rate": 1.671511786814735e-05, "loss": 1.0404480934143066, "num_input_tokens_seen": 22605161536, "step": 79480, "train_runtime": 774135.7743, "train_tokens_per_second": 29200.513 }, { "epoch": 2.8125128536267683, "grad_norm": 1.59375, "learning_rate": 1.671418392180454e-05, "loss": 1.0398025512695312, "num_input_tokens_seen": 22608042176, "step": 79490, "train_runtime": 774237.0329, "train_tokens_per_second": 29200.414 }, { "epoch": 2.812866673890497, "grad_norm": 1.6015625, "learning_rate": 1.671325013199517e-05, "loss": 1.0447395324707032, "num_input_tokens_seen": 22610894592, "step": 79500, "train_runtime": 774333.584, "train_tokens_per_second": 29200.457 }, { "epoch": 2.813220494154226, "grad_norm": 1.609375, "learning_rate": 1.671231649867552e-05, "loss": 1.0558664321899414, "num_input_tokens_seen": 22613708032, "step": 79510, "train_runtime": 774431.412, "train_tokens_per_second": 29200.401 }, { "epoch": 2.813574314417955, "grad_norm": 1.578125, "learning_rate": 1.671138302180189e-05, "loss": 1.0389620780944824, "num_input_tokens_seen": 22616538560, "step": 79520, "train_runtime": 774528.5864, "train_tokens_per_second": 29200.392 }, { "epoch": 2.8139281346816833, "grad_norm": 1.6484375, "learning_rate": 1.6710449701330584e-05, "loss": 1.0267772674560547, "num_input_tokens_seen": 22619327744, "step": 79530, "train_runtime": 774620.4407, "train_tokens_per_second": 29200.53 }, { "epoch": 2.814281954945412, "grad_norm": 1.5859375, "learning_rate": 1.670951653721794e-05, "loss": 1.0322991371154786, "num_input_tokens_seen": 22622145408, "step": 79540, "train_runtime": 774715.6603, "train_tokens_per_second": 29200.578 }, { "epoch": 2.814635775209141, "grad_norm": 1.5859375, "learning_rate": 1.6708583529420303e-05, "loss": 1.0457352638244628, "num_input_tokens_seen": 22624937088, "step": 79550, "train_runtime": 774809.5215, "train_tokens_per_second": 29200.644 }, { "epoch": 2.81498959547287, "grad_norm": 1.6640625, "learning_rate": 1.6707650677894036e-05, "loss": 1.0355209350585937, "num_input_tokens_seen": 22627746688, "step": 79560, "train_runtime": 774903.8606, "train_tokens_per_second": 29200.715 }, { "epoch": 2.8153434157365984, "grad_norm": 1.59375, "learning_rate": 1.670671798259552e-05, "loss": 1.0329557418823243, "num_input_tokens_seen": 22630539840, "step": 79570, "train_runtime": 774998.982, "train_tokens_per_second": 29200.735 }, { "epoch": 2.8156972360003274, "grad_norm": 1.546875, "learning_rate": 1.6705785443481153e-05, "loss": 1.0242696762084962, "num_input_tokens_seen": 22633376000, "step": 79580, "train_runtime": 775092.7212, "train_tokens_per_second": 29200.863 }, { "epoch": 2.816051056264056, "grad_norm": 1.625, "learning_rate": 1.6704853060507353e-05, "loss": 1.0221620559692384, "num_input_tokens_seen": 22636252992, "step": 79590, "train_runtime": 775192.5933, "train_tokens_per_second": 29200.812 }, { "epoch": 2.816404876527785, "grad_norm": 1.640625, "learning_rate": 1.6703920833630547e-05, "loss": 1.013923454284668, "num_input_tokens_seen": 22639025728, "step": 79600, "train_runtime": 775285.6076, "train_tokens_per_second": 29200.885 }, { "epoch": 2.8167586967915135, "grad_norm": 1.6171875, "learning_rate": 1.670298876280719e-05, "loss": 1.0309035301208496, "num_input_tokens_seen": 22641890048, "step": 79610, "train_runtime": 775382.8945, "train_tokens_per_second": 29200.915 }, { "epoch": 2.8171125170552425, "grad_norm": 1.640625, "learning_rate": 1.6702056847993747e-05, "loss": 1.0482139587402344, "num_input_tokens_seen": 22644749760, "step": 79620, "train_runtime": 775479.897, "train_tokens_per_second": 29200.95 }, { "epoch": 2.8174663373189714, "grad_norm": 1.5703125, "learning_rate": 1.6701125089146698e-05, "loss": 1.0564154624938964, "num_input_tokens_seen": 22647593088, "step": 79630, "train_runtime": 775577.0595, "train_tokens_per_second": 29200.958 }, { "epoch": 2.8178201575827, "grad_norm": 1.59375, "learning_rate": 1.6700193486222547e-05, "loss": 1.044890785217285, "num_input_tokens_seen": 22650394176, "step": 79640, "train_runtime": 775671.6789, "train_tokens_per_second": 29201.007 }, { "epoch": 2.8181739778464285, "grad_norm": 1.59375, "learning_rate": 1.669926203917781e-05, "loss": 1.0315406799316407, "num_input_tokens_seen": 22653288576, "step": 79650, "train_runtime": 775768.0544, "train_tokens_per_second": 29201.11 }, { "epoch": 2.8185277981101575, "grad_norm": 1.5859375, "learning_rate": 1.669833074796902e-05, "loss": 1.024192714691162, "num_input_tokens_seen": 22656080832, "step": 79660, "train_runtime": 775862.3975, "train_tokens_per_second": 29201.158 }, { "epoch": 2.8188816183738865, "grad_norm": 1.6328125, "learning_rate": 1.669739961255273e-05, "loss": 1.0299896240234374, "num_input_tokens_seen": 22658895168, "step": 79670, "train_runtime": 775959.1688, "train_tokens_per_second": 29201.144 }, { "epoch": 2.819235438637615, "grad_norm": 1.6328125, "learning_rate": 1.669646863288551e-05, "loss": 1.0404972076416015, "num_input_tokens_seen": 22661759104, "step": 79680, "train_runtime": 776055.6778, "train_tokens_per_second": 29201.203 }, { "epoch": 2.8195892589013436, "grad_norm": 1.6328125, "learning_rate": 1.669553780892394e-05, "loss": 1.0407751083374024, "num_input_tokens_seen": 22664598336, "step": 79690, "train_runtime": 776154.9702, "train_tokens_per_second": 29201.125 }, { "epoch": 2.8199430791650726, "grad_norm": 1.609375, "learning_rate": 1.6694607140624624e-05, "loss": 1.036793327331543, "num_input_tokens_seen": 22667450240, "step": 79700, "train_runtime": 776252.7726, "train_tokens_per_second": 29201.12 }, { "epoch": 2.8202968994288016, "grad_norm": 1.703125, "learning_rate": 1.6693676627944183e-05, "loss": 1.0411174774169922, "num_input_tokens_seen": 22670263360, "step": 79710, "train_runtime": 776349.2006, "train_tokens_per_second": 29201.116 }, { "epoch": 2.82065071969253, "grad_norm": 1.609375, "learning_rate": 1.6692746270839252e-05, "loss": 1.0489755630493165, "num_input_tokens_seen": 22673060800, "step": 79720, "train_runtime": 776445.0372, "train_tokens_per_second": 29201.115 }, { "epoch": 2.821004539956259, "grad_norm": 1.5625, "learning_rate": 1.6691816069266487e-05, "loss": 1.0361312866210937, "num_input_tokens_seen": 22675910144, "step": 79730, "train_runtime": 776542.7485, "train_tokens_per_second": 29201.11 }, { "epoch": 2.8213583602199876, "grad_norm": 1.6484375, "learning_rate": 1.6690886023182548e-05, "loss": 1.0229256629943848, "num_input_tokens_seen": 22678804544, "step": 79740, "train_runtime": 776640.6078, "train_tokens_per_second": 29201.157 }, { "epoch": 2.8217121804837166, "grad_norm": 1.6796875, "learning_rate": 1.6689956132544133e-05, "loss": 1.0272525787353515, "num_input_tokens_seen": 22681628544, "step": 79750, "train_runtime": 776739.3221, "train_tokens_per_second": 29201.082 }, { "epoch": 2.822066000747445, "grad_norm": 1.53125, "learning_rate": 1.6689026397307936e-05, "loss": 1.0263747215270995, "num_input_tokens_seen": 22684480640, "step": 79760, "train_runtime": 776836.2433, "train_tokens_per_second": 29201.11 }, { "epoch": 2.822419821011174, "grad_norm": 1.6328125, "learning_rate": 1.6688096817430687e-05, "loss": 1.0362535476684571, "num_input_tokens_seen": 22687366912, "step": 79770, "train_runtime": 776935.9583, "train_tokens_per_second": 29201.077 }, { "epoch": 2.8227736412749027, "grad_norm": 1.6484375, "learning_rate": 1.6687167392869115e-05, "loss": 1.0204397201538087, "num_input_tokens_seen": 22690203008, "step": 79780, "train_runtime": 777032.7363, "train_tokens_per_second": 29201.09 }, { "epoch": 2.8231274615386317, "grad_norm": 1.59375, "learning_rate": 1.668623812357998e-05, "loss": 1.0296805381774903, "num_input_tokens_seen": 22693049152, "step": 79790, "train_runtime": 777127.9507, "train_tokens_per_second": 29201.175 }, { "epoch": 2.8234812818023602, "grad_norm": 1.609375, "learning_rate": 1.6685309009520046e-05, "loss": 1.0385083198547362, "num_input_tokens_seen": 22695839424, "step": 79800, "train_runtime": 777221.8049, "train_tokens_per_second": 29201.239 }, { "epoch": 2.8238351020660892, "grad_norm": 1.5703125, "learning_rate": 1.668438005064611e-05, "loss": 1.0321401596069335, "num_input_tokens_seen": 22698688832, "step": 79810, "train_runtime": 777322.6951, "train_tokens_per_second": 29201.114 }, { "epoch": 2.824188922329818, "grad_norm": 1.578125, "learning_rate": 1.6683451246914973e-05, "loss": 1.0327841758728027, "num_input_tokens_seen": 22701506496, "step": 79820, "train_runtime": 777418.2367, "train_tokens_per_second": 29201.15 }, { "epoch": 2.8245427425935468, "grad_norm": 1.625, "learning_rate": 1.6682522598283452e-05, "loss": 1.057236385345459, "num_input_tokens_seen": 22704423808, "step": 79830, "train_runtime": 777518.2537, "train_tokens_per_second": 29201.146 }, { "epoch": 2.8248965628572753, "grad_norm": 1.609375, "learning_rate": 1.6681594104708393e-05, "loss": 1.032967758178711, "num_input_tokens_seen": 22707222912, "step": 79840, "train_runtime": 777613.4443, "train_tokens_per_second": 29201.171 }, { "epoch": 2.8252503831210043, "grad_norm": 1.5625, "learning_rate": 1.6680665766146643e-05, "loss": 1.0514030456542969, "num_input_tokens_seen": 22710062464, "step": 79850, "train_runtime": 777710.9267, "train_tokens_per_second": 29201.162 }, { "epoch": 2.8256042033847333, "grad_norm": 1.6328125, "learning_rate": 1.667973758255508e-05, "loss": 1.032219123840332, "num_input_tokens_seen": 22712959424, "step": 79860, "train_runtime": 777810.5131, "train_tokens_per_second": 29201.147 }, { "epoch": 2.825958023648462, "grad_norm": 1.6171875, "learning_rate": 1.667880955389059e-05, "loss": 1.0339744567871094, "num_input_tokens_seen": 22715825792, "step": 79870, "train_runtime": 777909.651, "train_tokens_per_second": 29201.111 }, { "epoch": 2.826311843912191, "grad_norm": 1.5703125, "learning_rate": 1.6677881680110082e-05, "loss": 1.041092300415039, "num_input_tokens_seen": 22718702272, "step": 79880, "train_runtime": 778008.7479, "train_tokens_per_second": 29201.088 }, { "epoch": 2.8266656641759194, "grad_norm": 1.59375, "learning_rate": 1.6676953961170472e-05, "loss": 1.0323168754577636, "num_input_tokens_seen": 22721534784, "step": 79890, "train_runtime": 778104.9894, "train_tokens_per_second": 29201.117 }, { "epoch": 2.8270194844396483, "grad_norm": 1.625, "learning_rate": 1.6676026397028705e-05, "loss": 1.035478401184082, "num_input_tokens_seen": 22724360256, "step": 79900, "train_runtime": 778201.2639, "train_tokens_per_second": 29201.135 }, { "epoch": 2.827373304703377, "grad_norm": 1.5625, "learning_rate": 1.6675098987641735e-05, "loss": 1.0395593643188477, "num_input_tokens_seen": 22727262016, "step": 79910, "train_runtime": 778305.5986, "train_tokens_per_second": 29200.949 }, { "epoch": 2.827727124967106, "grad_norm": 1.671875, "learning_rate": 1.6674171732966538e-05, "loss": 1.0355644226074219, "num_input_tokens_seen": 22730093376, "step": 79920, "train_runtime": 778401.9676, "train_tokens_per_second": 29200.971 }, { "epoch": 2.8280809452308344, "grad_norm": 1.609375, "learning_rate": 1.6673244632960093e-05, "loss": 1.0340763092041017, "num_input_tokens_seen": 22732973632, "step": 79930, "train_runtime": 778504.4297, "train_tokens_per_second": 29200.828 }, { "epoch": 2.8284347654945634, "grad_norm": 1.6640625, "learning_rate": 1.6672317687579418e-05, "loss": 1.0296091079711913, "num_input_tokens_seen": 22735793600, "step": 79940, "train_runtime": 778599.6236, "train_tokens_per_second": 29200.879 }, { "epoch": 2.828788585758292, "grad_norm": 1.65625, "learning_rate": 1.6671390896781527e-05, "loss": 1.0396522521972655, "num_input_tokens_seen": 22738639808, "step": 79950, "train_runtime": 778696.342, "train_tokens_per_second": 29200.907 }, { "epoch": 2.829142406022021, "grad_norm": 1.59375, "learning_rate": 1.6670464260523466e-05, "loss": 1.0409607887268066, "num_input_tokens_seen": 22741458816, "step": 79960, "train_runtime": 778788.2541, "train_tokens_per_second": 29201.081 }, { "epoch": 2.82949622628575, "grad_norm": 1.5546875, "learning_rate": 1.666953777876229e-05, "loss": 1.034112548828125, "num_input_tokens_seen": 22744280000, "step": 79970, "train_runtime": 778882.6255, "train_tokens_per_second": 29201.165 }, { "epoch": 2.8298500465494785, "grad_norm": 1.578125, "learning_rate": 1.6668611451455068e-05, "loss": 1.025139045715332, "num_input_tokens_seen": 22747096128, "step": 79980, "train_runtime": 778978.8721, "train_tokens_per_second": 29201.172 }, { "epoch": 2.830203866813207, "grad_norm": 1.546875, "learning_rate": 1.6667685278558893e-05, "loss": 1.042760467529297, "num_input_tokens_seen": 22749936704, "step": 79990, "train_runtime": 779076.9504, "train_tokens_per_second": 29201.142 }, { "epoch": 2.830557687076936, "grad_norm": 1.6484375, "learning_rate": 1.666675926003087e-05, "loss": 1.0351173400878906, "num_input_tokens_seen": 22752762176, "step": 80000, "train_runtime": 779175.3398, "train_tokens_per_second": 29201.081 }, { "epoch": 2.830557687076936, "eval_loss": 1.0218605995178223, "eval_runtime": 8.4506, "eval_samples_per_second": 471.918, "eval_steps_per_second": 3.787, "num_input_tokens_seen": 22752762176, "step": 80000 }, { "epoch": 2.830911507340665, "grad_norm": 1.6796875, "learning_rate": 1.6665833395828124e-05, "loss": 1.0323559761047363, "num_input_tokens_seen": 22755631936, "step": 80010, "train_runtime": 779303.7064, "train_tokens_per_second": 29199.953 }, { "epoch": 2.8312653276043935, "grad_norm": 1.6484375, "learning_rate": 1.6664907685907795e-05, "loss": 1.046002197265625, "num_input_tokens_seen": 22758462976, "step": 80020, "train_runtime": 779402.1696, "train_tokens_per_second": 29199.897 }, { "epoch": 2.831619147868122, "grad_norm": 1.6171875, "learning_rate": 1.666398213022704e-05, "loss": 1.0349205017089844, "num_input_tokens_seen": 22761258944, "step": 80030, "train_runtime": 779495.249, "train_tokens_per_second": 29199.997 }, { "epoch": 2.831972968131851, "grad_norm": 1.59375, "learning_rate": 1.6663056728743024e-05, "loss": 1.0328171730041504, "num_input_tokens_seen": 22764086592, "step": 80040, "train_runtime": 779592.0914, "train_tokens_per_second": 29199.997 }, { "epoch": 2.83232678839558, "grad_norm": 1.6328125, "learning_rate": 1.6662131481412947e-05, "loss": 1.036666488647461, "num_input_tokens_seen": 22766929536, "step": 80050, "train_runtime": 779690.424, "train_tokens_per_second": 29199.96 }, { "epoch": 2.8326806086593086, "grad_norm": 1.6015625, "learning_rate": 1.6661206388194006e-05, "loss": 1.023030662536621, "num_input_tokens_seen": 22769697472, "step": 80060, "train_runtime": 779785.5356, "train_tokens_per_second": 29199.948 }, { "epoch": 2.8330344289230376, "grad_norm": 1.6015625, "learning_rate": 1.6660281449043436e-05, "loss": 1.0272648811340332, "num_input_tokens_seen": 22772522304, "step": 80070, "train_runtime": 779883.9537, "train_tokens_per_second": 29199.886 }, { "epoch": 2.833388249186766, "grad_norm": 1.5859375, "learning_rate": 1.6659356663918466e-05, "loss": 1.0347506523132324, "num_input_tokens_seen": 22775296320, "step": 80080, "train_runtime": 779976.497, "train_tokens_per_second": 29199.978 }, { "epoch": 2.833742069450495, "grad_norm": 1.6640625, "learning_rate": 1.6658432032776354e-05, "loss": 1.0472360610961915, "num_input_tokens_seen": 22778134208, "step": 80090, "train_runtime": 780072.8102, "train_tokens_per_second": 29200.01 }, { "epoch": 2.8340958897142237, "grad_norm": 1.5859375, "learning_rate": 1.6657507555574375e-05, "loss": 1.0317363739013672, "num_input_tokens_seen": 22780978304, "step": 80100, "train_runtime": 780168.8945, "train_tokens_per_second": 29200.06 }, { "epoch": 2.8344497099779526, "grad_norm": 1.609375, "learning_rate": 1.6656583232269816e-05, "loss": 1.0367139816284179, "num_input_tokens_seen": 22783811328, "step": 80110, "train_runtime": 780262.8487, "train_tokens_per_second": 29200.174 }, { "epoch": 2.834803530241681, "grad_norm": 1.65625, "learning_rate": 1.665565906281999e-05, "loss": 1.0183178901672363, "num_input_tokens_seen": 22786625408, "step": 80120, "train_runtime": 780357.9983, "train_tokens_per_second": 29200.22 }, { "epoch": 2.83515735050541, "grad_norm": 1.59375, "learning_rate": 1.6654735047182213e-05, "loss": 1.0287519454956056, "num_input_tokens_seen": 22789406720, "step": 80130, "train_runtime": 780453.3894, "train_tokens_per_second": 29200.215 }, { "epoch": 2.8355111707691387, "grad_norm": 1.4921875, "learning_rate": 1.6653811185313824e-05, "loss": 1.0330543518066406, "num_input_tokens_seen": 22792252736, "step": 80140, "train_runtime": 780550.2869, "train_tokens_per_second": 29200.236 }, { "epoch": 2.8358649910328677, "grad_norm": 1.6015625, "learning_rate": 1.665288747717218e-05, "loss": 1.0447502136230469, "num_input_tokens_seen": 22795048704, "step": 80150, "train_runtime": 780643.5143, "train_tokens_per_second": 29200.331 }, { "epoch": 2.8362188112965967, "grad_norm": 1.5703125, "learning_rate": 1.6651963922714655e-05, "loss": 1.036759376525879, "num_input_tokens_seen": 22797884928, "step": 80160, "train_runtime": 780741.412, "train_tokens_per_second": 29200.302 }, { "epoch": 2.8365726315603252, "grad_norm": 1.5546875, "learning_rate": 1.6651040521898635e-05, "loss": 1.0344396591186524, "num_input_tokens_seen": 22800727424, "step": 80170, "train_runtime": 780836.8625, "train_tokens_per_second": 29200.373 }, { "epoch": 2.836926451824054, "grad_norm": 1.59375, "learning_rate": 1.6650117274681528e-05, "loss": 1.0404803276062011, "num_input_tokens_seen": 22803598144, "step": 80180, "train_runtime": 780933.4789, "train_tokens_per_second": 29200.436 }, { "epoch": 2.8372802720877828, "grad_norm": 1.5703125, "learning_rate": 1.6649194181020756e-05, "loss": 1.0317547798156739, "num_input_tokens_seen": 22806523392, "step": 80190, "train_runtime": 781035.5054, "train_tokens_per_second": 29200.367 }, { "epoch": 2.8376340923515118, "grad_norm": 1.609375, "learning_rate": 1.6648271240873753e-05, "loss": 1.0424488067626954, "num_input_tokens_seen": 22809368256, "step": 80200, "train_runtime": 781133.8014, "train_tokens_per_second": 29200.334 }, { "epoch": 2.8379879126152403, "grad_norm": 1.59375, "learning_rate": 1.664734845419798e-05, "loss": 1.0092010498046875, "num_input_tokens_seen": 22812157952, "step": 80210, "train_runtime": 781225.6033, "train_tokens_per_second": 29200.474 }, { "epoch": 2.8383417328789693, "grad_norm": 1.6015625, "learning_rate": 1.66464258209509e-05, "loss": 1.048866367340088, "num_input_tokens_seen": 22815019264, "step": 80220, "train_runtime": 781324.8043, "train_tokens_per_second": 29200.429 }, { "epoch": 2.838695553142698, "grad_norm": 1.5703125, "learning_rate": 1.664550334109001e-05, "loss": 1.0418125152587892, "num_input_tokens_seen": 22817832448, "step": 80230, "train_runtime": 781420.9027, "train_tokens_per_second": 29200.438 }, { "epoch": 2.839049373406427, "grad_norm": 1.640625, "learning_rate": 1.664458101457281e-05, "loss": 1.0309842109680176, "num_input_tokens_seen": 22820726848, "step": 80240, "train_runtime": 781522.3056, "train_tokens_per_second": 29200.353 }, { "epoch": 2.8394031936701554, "grad_norm": 1.6171875, "learning_rate": 1.664365884135682e-05, "loss": 1.0547696113586427, "num_input_tokens_seen": 22823606464, "step": 80250, "train_runtime": 781620.4793, "train_tokens_per_second": 29200.369 }, { "epoch": 2.8397570139338844, "grad_norm": 1.59375, "learning_rate": 1.6642736821399583e-05, "loss": 1.048665428161621, "num_input_tokens_seen": 22826425216, "step": 80260, "train_runtime": 781715.8714, "train_tokens_per_second": 29200.412 }, { "epoch": 2.840110834197613, "grad_norm": 1.65625, "learning_rate": 1.6641814954658643e-05, "loss": 1.0321236610412599, "num_input_tokens_seen": 22829255552, "step": 80270, "train_runtime": 781811.4184, "train_tokens_per_second": 29200.463 }, { "epoch": 2.840464654461342, "grad_norm": 1.609375, "learning_rate": 1.664089324109158e-05, "loss": 1.0476900100708009, "num_input_tokens_seen": 22832113664, "step": 80280, "train_runtime": 781909.7553, "train_tokens_per_second": 29200.446 }, { "epoch": 2.8408184747250704, "grad_norm": 1.625, "learning_rate": 1.6639971680655975e-05, "loss": 1.043871021270752, "num_input_tokens_seen": 22834964416, "step": 80290, "train_runtime": 782006.6723, "train_tokens_per_second": 29200.473 }, { "epoch": 2.8411722949887994, "grad_norm": 1.5859375, "learning_rate": 1.6639050273309432e-05, "loss": 1.0197729110717773, "num_input_tokens_seen": 22837856320, "step": 80300, "train_runtime": 782106.8313, "train_tokens_per_second": 29200.431 }, { "epoch": 2.8415261152525284, "grad_norm": 1.59375, "learning_rate": 1.6638129019009573e-05, "loss": 1.040507984161377, "num_input_tokens_seen": 22840750912, "step": 80310, "train_runtime": 782208.529, "train_tokens_per_second": 29200.335 }, { "epoch": 2.841879935516257, "grad_norm": 1.6171875, "learning_rate": 1.663720791771403e-05, "loss": 1.033221435546875, "num_input_tokens_seen": 22843562560, "step": 80320, "train_runtime": 782307.1684, "train_tokens_per_second": 29200.247 }, { "epoch": 2.8422337557799855, "grad_norm": 1.5859375, "learning_rate": 1.663628696938046e-05, "loss": 1.0516000747680665, "num_input_tokens_seen": 22846482752, "step": 80330, "train_runtime": 782409.4706, "train_tokens_per_second": 29200.161 }, { "epoch": 2.8425875760437145, "grad_norm": 1.578125, "learning_rate": 1.663536617396653e-05, "loss": 1.0329723358154297, "num_input_tokens_seen": 22849334080, "step": 80340, "train_runtime": 782510.8815, "train_tokens_per_second": 29200.021 }, { "epoch": 2.8429413963074435, "grad_norm": 1.65625, "learning_rate": 1.6634445531429922e-05, "loss": 1.0408260345458984, "num_input_tokens_seen": 22852179392, "step": 80350, "train_runtime": 782608.7549, "train_tokens_per_second": 29200.005 }, { "epoch": 2.843295216571172, "grad_norm": 1.6328125, "learning_rate": 1.663352504172834e-05, "loss": 1.0457895278930665, "num_input_tokens_seen": 22854962240, "step": 80360, "train_runtime": 782701.4196, "train_tokens_per_second": 29200.103 }, { "epoch": 2.8436490368349006, "grad_norm": 1.578125, "learning_rate": 1.663260470481951e-05, "loss": 1.0390413284301758, "num_input_tokens_seen": 22857796608, "step": 80370, "train_runtime": 782798.1697, "train_tokens_per_second": 29200.115 }, { "epoch": 2.8440028570986295, "grad_norm": 1.515625, "learning_rate": 1.663168452066115e-05, "loss": 1.0397710800170898, "num_input_tokens_seen": 22860663616, "step": 80380, "train_runtime": 782896.0498, "train_tokens_per_second": 29200.126 }, { "epoch": 2.8443566773623585, "grad_norm": 1.609375, "learning_rate": 1.663076448921102e-05, "loss": 1.0263717651367188, "num_input_tokens_seen": 22863503296, "step": 80390, "train_runtime": 782992.2633, "train_tokens_per_second": 29200.165 }, { "epoch": 2.844710497626087, "grad_norm": 1.6484375, "learning_rate": 1.6629844610426892e-05, "loss": 1.043206024169922, "num_input_tokens_seen": 22866358464, "step": 80400, "train_runtime": 783091.698, "train_tokens_per_second": 29200.103 }, { "epoch": 2.845064317889816, "grad_norm": 1.6328125, "learning_rate": 1.6628924884266542e-05, "loss": 1.048374080657959, "num_input_tokens_seen": 22869242816, "step": 80410, "train_runtime": 783190.8953, "train_tokens_per_second": 29200.088 }, { "epoch": 2.8454181381535446, "grad_norm": 1.578125, "learning_rate": 1.6628005310687773e-05, "loss": 1.0357446670532227, "num_input_tokens_seen": 22872063808, "step": 80420, "train_runtime": 783285.778, "train_tokens_per_second": 29200.152 }, { "epoch": 2.8457719584172736, "grad_norm": 1.6484375, "learning_rate": 1.6627085889648396e-05, "loss": 1.042096996307373, "num_input_tokens_seen": 22874942272, "step": 80430, "train_runtime": 783381.8339, "train_tokens_per_second": 29200.246 }, { "epoch": 2.846125778681002, "grad_norm": 1.5703125, "learning_rate": 1.6626166621106252e-05, "loss": 1.0323066711425781, "num_input_tokens_seen": 22877804864, "step": 80440, "train_runtime": 783479.3622, "train_tokens_per_second": 29200.265 }, { "epoch": 2.846479598944731, "grad_norm": 1.609375, "learning_rate": 1.6625247505019183e-05, "loss": 1.035548496246338, "num_input_tokens_seen": 22880627520, "step": 80450, "train_runtime": 783573.7371, "train_tokens_per_second": 29200.35 }, { "epoch": 2.84683341920846, "grad_norm": 1.5546875, "learning_rate": 1.6624328541345054e-05, "loss": 1.035201644897461, "num_input_tokens_seen": 22883450304, "step": 80460, "train_runtime": 783668.9869, "train_tokens_per_second": 29200.403 }, { "epoch": 2.8471872394721887, "grad_norm": 1.625, "learning_rate": 1.662340973004175e-05, "loss": 1.0444052696228028, "num_input_tokens_seen": 22886343104, "step": 80470, "train_runtime": 783769.7832, "train_tokens_per_second": 29200.339 }, { "epoch": 2.847541059735917, "grad_norm": 1.5703125, "learning_rate": 1.6622491071067173e-05, "loss": 1.0478404998779296, "num_input_tokens_seen": 22889160512, "step": 80480, "train_runtime": 783863.9402, "train_tokens_per_second": 29200.425 }, { "epoch": 2.847894879999646, "grad_norm": 1.640625, "learning_rate": 1.662157256437923e-05, "loss": 1.0283281326293945, "num_input_tokens_seen": 22892025600, "step": 80490, "train_runtime": 783962.2773, "train_tokens_per_second": 29200.417 }, { "epoch": 2.848248700263375, "grad_norm": 1.625, "learning_rate": 1.6620654209935848e-05, "loss": 1.040452003479004, "num_input_tokens_seen": 22894854976, "step": 80500, "train_runtime": 784059.227, "train_tokens_per_second": 29200.415 }, { "epoch": 2.8486025205271037, "grad_norm": 1.6796875, "learning_rate": 1.661973600769498e-05, "loss": 1.0361530303955078, "num_input_tokens_seen": 22897708736, "step": 80510, "train_runtime": 784158.4942, "train_tokens_per_second": 29200.358 }, { "epoch": 2.8489563407908323, "grad_norm": 1.5546875, "learning_rate": 1.6618817957614587e-05, "loss": 1.043104362487793, "num_input_tokens_seen": 22900593600, "step": 80520, "train_runtime": 784258.0592, "train_tokens_per_second": 29200.329 }, { "epoch": 2.8493101610545613, "grad_norm": 1.6015625, "learning_rate": 1.661790005965265e-05, "loss": 1.0335250854492188, "num_input_tokens_seen": 22903405696, "step": 80530, "train_runtime": 784354.0986, "train_tokens_per_second": 29200.339 }, { "epoch": 2.8496639813182902, "grad_norm": 1.6328125, "learning_rate": 1.6616982313767158e-05, "loss": 1.027759075164795, "num_input_tokens_seen": 22906273536, "step": 80540, "train_runtime": 784453.0012, "train_tokens_per_second": 29200.313 }, { "epoch": 2.850017801582019, "grad_norm": 1.640625, "learning_rate": 1.661606471991613e-05, "loss": 1.0343889236450194, "num_input_tokens_seen": 22909100416, "step": 80550, "train_runtime": 784547.9039, "train_tokens_per_second": 29200.384 }, { "epoch": 2.8503716218457478, "grad_norm": 1.6796875, "learning_rate": 1.661514727805759e-05, "loss": 1.0448912620544433, "num_input_tokens_seen": 22911954944, "step": 80560, "train_runtime": 784648.0056, "train_tokens_per_second": 29200.297 }, { "epoch": 2.8507254421094763, "grad_norm": 1.5546875, "learning_rate": 1.6614229988149582e-05, "loss": 1.0320121765136718, "num_input_tokens_seen": 22914805888, "step": 80570, "train_runtime": 784745.0473, "train_tokens_per_second": 29200.319 }, { "epoch": 2.8510792623732053, "grad_norm": 1.5546875, "learning_rate": 1.6613312850150166e-05, "loss": 1.043410587310791, "num_input_tokens_seen": 22917642432, "step": 80580, "train_runtime": 784840.6334, "train_tokens_per_second": 29200.377 }, { "epoch": 2.851433082636934, "grad_norm": 1.6015625, "learning_rate": 1.661239586401742e-05, "loss": 1.0322134971618653, "num_input_tokens_seen": 22920466432, "step": 80590, "train_runtime": 784938.3236, "train_tokens_per_second": 29200.341 }, { "epoch": 2.851786902900663, "grad_norm": 1.6171875, "learning_rate": 1.6611479029709438e-05, "loss": 1.04379243850708, "num_input_tokens_seen": 22923306688, "step": 80600, "train_runtime": 785033.0714, "train_tokens_per_second": 29200.434 }, { "epoch": 2.8521407231643914, "grad_norm": 1.640625, "learning_rate": 1.6610562347184323e-05, "loss": 1.0454593658447267, "num_input_tokens_seen": 22926170240, "step": 80610, "train_runtime": 785129.6609, "train_tokens_per_second": 29200.489 }, { "epoch": 2.8524945434281204, "grad_norm": 1.578125, "learning_rate": 1.66096458164002e-05, "loss": 1.0244400024414062, "num_input_tokens_seen": 22928970432, "step": 80620, "train_runtime": 785226.168, "train_tokens_per_second": 29200.467 }, { "epoch": 2.852848363691849, "grad_norm": 1.640625, "learning_rate": 1.6608729437315218e-05, "loss": 1.0343225479125977, "num_input_tokens_seen": 22931792896, "step": 80630, "train_runtime": 785322.2037, "train_tokens_per_second": 29200.49 }, { "epoch": 2.853202183955578, "grad_norm": 1.625, "learning_rate": 1.660781320988753e-05, "loss": 1.0353330612182616, "num_input_tokens_seen": 22934705536, "step": 80640, "train_runtime": 785423.8471, "train_tokens_per_second": 29200.419 }, { "epoch": 2.853556004219307, "grad_norm": 1.6875, "learning_rate": 1.6606897134075307e-05, "loss": 1.0372068405151367, "num_input_tokens_seen": 22937512192, "step": 80650, "train_runtime": 785518.2264, "train_tokens_per_second": 29200.484 }, { "epoch": 2.8539098244830354, "grad_norm": 1.640625, "learning_rate": 1.660598120983674e-05, "loss": 1.0422983169555664, "num_input_tokens_seen": 22940352448, "step": 80660, "train_runtime": 785614.9788, "train_tokens_per_second": 29200.503 }, { "epoch": 2.854263644746764, "grad_norm": 1.59375, "learning_rate": 1.660506543713004e-05, "loss": 1.0379693984985352, "num_input_tokens_seen": 22943216320, "step": 80670, "train_runtime": 785713.9613, "train_tokens_per_second": 29200.469 }, { "epoch": 2.854617465010493, "grad_norm": 1.5859375, "learning_rate": 1.660414981591342e-05, "loss": 1.0329832077026366, "num_input_tokens_seen": 22946051328, "step": 80680, "train_runtime": 785811.5584, "train_tokens_per_second": 29200.45 }, { "epoch": 2.854971285274222, "grad_norm": 1.515625, "learning_rate": 1.6603234346145123e-05, "loss": 1.035323429107666, "num_input_tokens_seen": 22948868032, "step": 80690, "train_runtime": 785905.485, "train_tokens_per_second": 29200.544 }, { "epoch": 2.8553251055379505, "grad_norm": 1.5703125, "learning_rate": 1.6602319027783403e-05, "loss": 1.0245865821838378, "num_input_tokens_seen": 22951708672, "step": 80700, "train_runtime": 786000.9355, "train_tokens_per_second": 29200.612 }, { "epoch": 2.8556789258016795, "grad_norm": 1.6796875, "learning_rate": 1.6601403860786528e-05, "loss": 1.035319709777832, "num_input_tokens_seen": 22954602496, "step": 80710, "train_runtime": 786099.8604, "train_tokens_per_second": 29200.619 }, { "epoch": 2.856032746065408, "grad_norm": 1.6328125, "learning_rate": 1.660048884511279e-05, "loss": 1.0315517425537108, "num_input_tokens_seen": 22957379648, "step": 80720, "train_runtime": 786193.8895, "train_tokens_per_second": 29200.659 }, { "epoch": 2.856386566329137, "grad_norm": 1.5234375, "learning_rate": 1.6599573980720478e-05, "loss": 1.043848419189453, "num_input_tokens_seen": 22960240256, "step": 80730, "train_runtime": 786289.6652, "train_tokens_per_second": 29200.74 }, { "epoch": 2.8567403865928656, "grad_norm": 1.59375, "learning_rate": 1.6598659267567925e-05, "loss": 1.0380939483642577, "num_input_tokens_seen": 22963055232, "step": 80740, "train_runtime": 786386.1779, "train_tokens_per_second": 29200.736 }, { "epoch": 2.8570942068565945, "grad_norm": 1.5390625, "learning_rate": 1.6597744705613464e-05, "loss": 1.0320858001708983, "num_input_tokens_seen": 22965878144, "step": 80750, "train_runtime": 786484.0455, "train_tokens_per_second": 29200.692 }, { "epoch": 2.857448027120323, "grad_norm": 1.6328125, "learning_rate": 1.6596830294815434e-05, "loss": 1.0376737594604493, "num_input_tokens_seen": 22968705728, "step": 80760, "train_runtime": 786581.0959, "train_tokens_per_second": 29200.684 }, { "epoch": 2.857801847384052, "grad_norm": 1.6015625, "learning_rate": 1.6595916035132218e-05, "loss": 1.0475418090820312, "num_input_tokens_seen": 22971548928, "step": 80770, "train_runtime": 786680.9112, "train_tokens_per_second": 29200.593 }, { "epoch": 2.8581556676477806, "grad_norm": 1.578125, "learning_rate": 1.6595001926522184e-05, "loss": 1.0299690246582032, "num_input_tokens_seen": 22974430848, "step": 80780, "train_runtime": 786781.3615, "train_tokens_per_second": 29200.528 }, { "epoch": 2.8585094879115096, "grad_norm": 1.6484375, "learning_rate": 1.6594087968943735e-05, "loss": 1.0284738540649414, "num_input_tokens_seen": 22977273280, "step": 80790, "train_runtime": 786877.5378, "train_tokens_per_second": 29200.571 }, { "epoch": 2.8588633081752386, "grad_norm": 1.6015625, "learning_rate": 1.6593174162355295e-05, "loss": 1.0406036376953125, "num_input_tokens_seen": 22980155840, "step": 80800, "train_runtime": 786976.3388, "train_tokens_per_second": 29200.568 }, { "epoch": 2.859217128438967, "grad_norm": 1.625, "learning_rate": 1.6592260506715286e-05, "loss": 1.0246242523193358, "num_input_tokens_seen": 22983013056, "step": 80810, "train_runtime": 787074.1871, "train_tokens_per_second": 29200.568 }, { "epoch": 2.8595709487026957, "grad_norm": 1.5859375, "learning_rate": 1.6591347001982155e-05, "loss": 1.0344379425048829, "num_input_tokens_seen": 22985856384, "step": 80820, "train_runtime": 787171.4994, "train_tokens_per_second": 29200.57 }, { "epoch": 2.8599247689664247, "grad_norm": 1.640625, "learning_rate": 1.659043364811436e-05, "loss": 1.0432378768920898, "num_input_tokens_seen": 22988643200, "step": 80830, "train_runtime": 787265.6984, "train_tokens_per_second": 29200.616 }, { "epoch": 2.8602785892301537, "grad_norm": 1.671875, "learning_rate": 1.6589520445070395e-05, "loss": 1.0230390548706054, "num_input_tokens_seen": 22991561792, "step": 80840, "train_runtime": 787363.4775, "train_tokens_per_second": 29200.696 }, { "epoch": 2.860632409493882, "grad_norm": 1.609375, "learning_rate": 1.6588607392808746e-05, "loss": 1.032874870300293, "num_input_tokens_seen": 22994382656, "step": 80850, "train_runtime": 787459.2108, "train_tokens_per_second": 29200.729 }, { "epoch": 2.8609862297576107, "grad_norm": 1.5390625, "learning_rate": 1.658769449128792e-05, "loss": 1.0213472366333007, "num_input_tokens_seen": 22997277952, "step": 80860, "train_runtime": 787561.7525, "train_tokens_per_second": 29200.603 }, { "epoch": 2.8613400500213397, "grad_norm": 1.7421875, "learning_rate": 1.6586781740466448e-05, "loss": 1.0343477249145507, "num_input_tokens_seen": 23000124160, "step": 80870, "train_runtime": 787659.1013, "train_tokens_per_second": 29200.607 }, { "epoch": 2.8616938702850687, "grad_norm": 1.6328125, "learning_rate": 1.6585869140302875e-05, "loss": 1.0354864120483398, "num_input_tokens_seen": 23002947008, "step": 80880, "train_runtime": 787754.9394, "train_tokens_per_second": 29200.638 }, { "epoch": 2.8620476905487973, "grad_norm": 1.609375, "learning_rate": 1.6584956690755752e-05, "loss": 1.0454496383666991, "num_input_tokens_seen": 23005774592, "step": 80890, "train_runtime": 787852.7824, "train_tokens_per_second": 29200.601 }, { "epoch": 2.8624015108125263, "grad_norm": 1.6953125, "learning_rate": 1.658404439178366e-05, "loss": 1.0439382553100587, "num_input_tokens_seen": 23008555840, "step": 80900, "train_runtime": 787945.356, "train_tokens_per_second": 29200.7 }, { "epoch": 2.862755331076255, "grad_norm": 1.578125, "learning_rate": 1.6583132243345195e-05, "loss": 1.0365544319152833, "num_input_tokens_seen": 23011404608, "step": 80910, "train_runtime": 788041.4872, "train_tokens_per_second": 29200.753 }, { "epoch": 2.863109151339984, "grad_norm": 1.609375, "learning_rate": 1.6582220245398953e-05, "loss": 1.037847137451172, "num_input_tokens_seen": 23014274560, "step": 80920, "train_runtime": 788139.9323, "train_tokens_per_second": 29200.747 }, { "epoch": 2.8634629716037123, "grad_norm": 1.609375, "learning_rate": 1.658130839790356e-05, "loss": 1.0516275405883788, "num_input_tokens_seen": 23017134336, "step": 80930, "train_runtime": 788236.4337, "train_tokens_per_second": 29200.8 }, { "epoch": 2.8638167918674413, "grad_norm": 1.609375, "learning_rate": 1.658039670081766e-05, "loss": 1.0313149452209474, "num_input_tokens_seen": 23019984512, "step": 80940, "train_runtime": 788334.0255, "train_tokens_per_second": 29200.8 }, { "epoch": 2.86417061213117, "grad_norm": 1.5625, "learning_rate": 1.65794851540999e-05, "loss": 1.0307487487792968, "num_input_tokens_seen": 23022766400, "step": 80950, "train_runtime": 788427.0837, "train_tokens_per_second": 29200.882 }, { "epoch": 2.864524432394899, "grad_norm": 1.609375, "learning_rate": 1.6578573757708953e-05, "loss": 1.038377571105957, "num_input_tokens_seen": 23025656960, "step": 80960, "train_runtime": 788527.1977, "train_tokens_per_second": 29200.841 }, { "epoch": 2.8648782526586274, "grad_norm": 1.6328125, "learning_rate": 1.6577662511603507e-05, "loss": 1.0301566123962402, "num_input_tokens_seen": 23028472640, "step": 80970, "train_runtime": 788622.5905, "train_tokens_per_second": 29200.879 }, { "epoch": 2.8652320729223564, "grad_norm": 1.5703125, "learning_rate": 1.6576751415742262e-05, "loss": 1.0512137413024902, "num_input_tokens_seen": 23031304192, "step": 80980, "train_runtime": 788716.3925, "train_tokens_per_second": 29200.996 }, { "epoch": 2.8655858931860854, "grad_norm": 1.640625, "learning_rate": 1.6575840470083934e-05, "loss": 1.0471799850463868, "num_input_tokens_seen": 23034158272, "step": 80990, "train_runtime": 788813.18, "train_tokens_per_second": 29201.031 }, { "epoch": 2.865939713449814, "grad_norm": 1.5546875, "learning_rate": 1.6574929674587263e-05, "loss": 1.0507784843444825, "num_input_tokens_seen": 23037005184, "step": 81000, "train_runtime": 788911.5043, "train_tokens_per_second": 29201.0 }, { "epoch": 2.8662935337135425, "grad_norm": 1.640625, "learning_rate": 1.6574019029210995e-05, "loss": 1.0329381942749023, "num_input_tokens_seen": 23039829248, "step": 81010, "train_runtime": 789007.4987, "train_tokens_per_second": 29201.027 }, { "epoch": 2.8666473539772714, "grad_norm": 1.5859375, "learning_rate": 1.6573108533913894e-05, "loss": 1.0286808013916016, "num_input_tokens_seen": 23042716608, "step": 81020, "train_runtime": 789108.6973, "train_tokens_per_second": 29200.941 }, { "epoch": 2.8670011742410004, "grad_norm": 1.5546875, "learning_rate": 1.657219818865474e-05, "loss": 1.0306102752685546, "num_input_tokens_seen": 23045577920, "step": 81030, "train_runtime": 789206.6759, "train_tokens_per_second": 29200.941 }, { "epoch": 2.867354994504729, "grad_norm": 1.640625, "learning_rate": 1.6571287993392336e-05, "loss": 1.028251838684082, "num_input_tokens_seen": 23048399296, "step": 81040, "train_runtime": 789302.1543, "train_tokens_per_second": 29200.984 }, { "epoch": 2.867708814768458, "grad_norm": 1.71875, "learning_rate": 1.6570377948085496e-05, "loss": 1.0416295051574707, "num_input_tokens_seen": 23051287040, "step": 81050, "train_runtime": 789400.3118, "train_tokens_per_second": 29201.011 }, { "epoch": 2.8680626350321865, "grad_norm": 1.65625, "learning_rate": 1.6569468052693042e-05, "loss": 1.0420572280883789, "num_input_tokens_seen": 23054120704, "step": 81060, "train_runtime": 789498.0917, "train_tokens_per_second": 29200.983 }, { "epoch": 2.8684164552959155, "grad_norm": 1.578125, "learning_rate": 1.6568558307173823e-05, "loss": 1.0375555992126464, "num_input_tokens_seen": 23056946880, "step": 81070, "train_runtime": 789596.5174, "train_tokens_per_second": 29200.923 }, { "epoch": 2.868770275559644, "grad_norm": 1.5703125, "learning_rate": 1.65676487114867e-05, "loss": 1.0291165351867675, "num_input_tokens_seen": 23059841856, "step": 81080, "train_runtime": 789696.4538, "train_tokens_per_second": 29200.893 }, { "epoch": 2.869124095823373, "grad_norm": 1.6328125, "learning_rate": 1.6566739265590547e-05, "loss": 1.037203598022461, "num_input_tokens_seen": 23062668928, "step": 81090, "train_runtime": 789793.195, "train_tokens_per_second": 29200.896 }, { "epoch": 2.8694779160871016, "grad_norm": 1.5703125, "learning_rate": 1.656582996944426e-05, "loss": 1.035593318939209, "num_input_tokens_seen": 23065522304, "step": 81100, "train_runtime": 789890.5214, "train_tokens_per_second": 29200.91 }, { "epoch": 2.8698317363508306, "grad_norm": 1.578125, "learning_rate": 1.6564920823006745e-05, "loss": 1.0275936126708984, "num_input_tokens_seen": 23068403328, "step": 81110, "train_runtime": 789989.2571, "train_tokens_per_second": 29200.908 }, { "epoch": 2.870185556614559, "grad_norm": 1.6328125, "learning_rate": 1.6564011826236926e-05, "loss": 1.0375207901000976, "num_input_tokens_seen": 23071303168, "step": 81120, "train_runtime": 790090.44, "train_tokens_per_second": 29200.838 }, { "epoch": 2.870539376878288, "grad_norm": 1.640625, "learning_rate": 1.656310297909374e-05, "loss": 1.0457921028137207, "num_input_tokens_seen": 23074100224, "step": 81130, "train_runtime": 790186.1679, "train_tokens_per_second": 29200.84 }, { "epoch": 2.870893197142017, "grad_norm": 1.6328125, "learning_rate": 1.6562194281536146e-05, "loss": 1.045921802520752, "num_input_tokens_seen": 23076961088, "step": 81140, "train_runtime": 790284.2285, "train_tokens_per_second": 29200.837 }, { "epoch": 2.8712470174057456, "grad_norm": 1.59375, "learning_rate": 1.6561285733523108e-05, "loss": 1.044546127319336, "num_input_tokens_seen": 23079791232, "step": 81150, "train_runtime": 790381.4225, "train_tokens_per_second": 29200.827 }, { "epoch": 2.871600837669474, "grad_norm": 1.6328125, "learning_rate": 1.6560377335013625e-05, "loss": 1.027407169342041, "num_input_tokens_seen": 23082620160, "step": 81160, "train_runtime": 790475.9828, "train_tokens_per_second": 29200.913 }, { "epoch": 2.871954657933203, "grad_norm": 1.6484375, "learning_rate": 1.655946908596669e-05, "loss": 1.035403060913086, "num_input_tokens_seen": 23085475136, "step": 81170, "train_runtime": 790575.3234, "train_tokens_per_second": 29200.855 }, { "epoch": 2.872308478196932, "grad_norm": 1.7109375, "learning_rate": 1.6558560986341324e-05, "loss": 1.0394344329833984, "num_input_tokens_seen": 23088293056, "step": 81180, "train_runtime": 790670.5455, "train_tokens_per_second": 29200.902 }, { "epoch": 2.8726622984606607, "grad_norm": 1.6875, "learning_rate": 1.6557653036096564e-05, "loss": 1.0486452102661132, "num_input_tokens_seen": 23091135424, "step": 81190, "train_runtime": 790767.6096, "train_tokens_per_second": 29200.912 }, { "epoch": 2.8730161187243892, "grad_norm": 1.625, "learning_rate": 1.6556745235191454e-05, "loss": 1.0372606277465821, "num_input_tokens_seen": 23093985664, "step": 81200, "train_runtime": 790863.0951, "train_tokens_per_second": 29200.99 }, { "epoch": 2.873369938988118, "grad_norm": 1.640625, "learning_rate": 1.6555837583585066e-05, "loss": 1.0517115592956543, "num_input_tokens_seen": 23096877056, "step": 81210, "train_runtime": 790963.5844, "train_tokens_per_second": 29200.936 }, { "epoch": 2.873723759251847, "grad_norm": 1.65625, "learning_rate": 1.6554930081236475e-05, "loss": 1.0369503021240234, "num_input_tokens_seen": 23099723456, "step": 81220, "train_runtime": 791061.3631, "train_tokens_per_second": 29200.925 }, { "epoch": 2.8740775795155757, "grad_norm": 1.59375, "learning_rate": 1.6554022728104783e-05, "loss": 1.0300237655639648, "num_input_tokens_seen": 23102569664, "step": 81230, "train_runtime": 791159.071, "train_tokens_per_second": 29200.916 }, { "epoch": 2.8744313997793047, "grad_norm": 1.6328125, "learning_rate": 1.65531155241491e-05, "loss": 1.0319210052490235, "num_input_tokens_seen": 23105362432, "step": 81240, "train_runtime": 791252.7274, "train_tokens_per_second": 29200.989 }, { "epoch": 2.8747852200430333, "grad_norm": 1.5859375, "learning_rate": 1.6552208469328555e-05, "loss": 1.0427913665771484, "num_input_tokens_seen": 23108133120, "step": 81250, "train_runtime": 791344.3315, "train_tokens_per_second": 29201.11 }, { "epoch": 2.8751390403067623, "grad_norm": 1.6171875, "learning_rate": 1.6551301563602294e-05, "loss": 1.022377872467041, "num_input_tokens_seen": 23110986048, "step": 81260, "train_runtime": 791443.124, "train_tokens_per_second": 29201.07 }, { "epoch": 2.875492860570491, "grad_norm": 1.59375, "learning_rate": 1.655039480692947e-05, "loss": 1.0495617866516114, "num_input_tokens_seen": 23113758464, "step": 81270, "train_runtime": 791535.4646, "train_tokens_per_second": 29201.166 }, { "epoch": 2.87584668083422, "grad_norm": 1.6328125, "learning_rate": 1.6549488199269263e-05, "loss": 1.0309659957885742, "num_input_tokens_seen": 23116559744, "step": 81280, "train_runtime": 791630.1226, "train_tokens_per_second": 29201.213 }, { "epoch": 2.876200501097949, "grad_norm": 1.5859375, "learning_rate": 1.654858174058087e-05, "loss": 1.0382278442382813, "num_input_tokens_seen": 23119414528, "step": 81290, "train_runtime": 791728.3983, "train_tokens_per_second": 29201.194 }, { "epoch": 2.8765543213616773, "grad_norm": 1.640625, "learning_rate": 1.6547675430823484e-05, "loss": 1.0466912269592286, "num_input_tokens_seen": 23122306944, "step": 81300, "train_runtime": 791827.8095, "train_tokens_per_second": 29201.181 }, { "epoch": 2.876908141625406, "grad_norm": 1.5625, "learning_rate": 1.6546769269956337e-05, "loss": 1.0330430030822755, "num_input_tokens_seen": 23125164416, "step": 81310, "train_runtime": 791927.183, "train_tokens_per_second": 29201.125 }, { "epoch": 2.877261961889135, "grad_norm": 1.5859375, "learning_rate": 1.6545863257938662e-05, "loss": 1.0302630424499513, "num_input_tokens_seen": 23128015424, "step": 81320, "train_runtime": 792023.706, "train_tokens_per_second": 29201.166 }, { "epoch": 2.877615782152864, "grad_norm": 1.5859375, "learning_rate": 1.654495739472972e-05, "loss": 1.0363154411315918, "num_input_tokens_seen": 23130818240, "step": 81330, "train_runtime": 792120.2857, "train_tokens_per_second": 29201.144 }, { "epoch": 2.8779696024165924, "grad_norm": 1.59375, "learning_rate": 1.654405168028877e-05, "loss": 1.0354799270629882, "num_input_tokens_seen": 23133666240, "step": 81340, "train_runtime": 792218.7958, "train_tokens_per_second": 29201.108 }, { "epoch": 2.878323422680321, "grad_norm": 1.6015625, "learning_rate": 1.6543146114575108e-05, "loss": 1.0285295486450194, "num_input_tokens_seen": 23136511360, "step": 81350, "train_runtime": 792315.3986, "train_tokens_per_second": 29201.138 }, { "epoch": 2.87867724294405, "grad_norm": 1.546875, "learning_rate": 1.6542240697548022e-05, "loss": 1.029501247406006, "num_input_tokens_seen": 23139309760, "step": 81360, "train_runtime": 792410.9168, "train_tokens_per_second": 29201.15 }, { "epoch": 2.879031063207779, "grad_norm": 1.6171875, "learning_rate": 1.6541335429166833e-05, "loss": 1.0373859405517578, "num_input_tokens_seen": 23142062976, "step": 81370, "train_runtime": 792501.1835, "train_tokens_per_second": 29201.298 }, { "epoch": 2.8793848834715075, "grad_norm": 1.59375, "learning_rate": 1.6540430309390877e-05, "loss": 1.0180582046508788, "num_input_tokens_seen": 23144899776, "step": 81380, "train_runtime": 792598.5561, "train_tokens_per_second": 29201.289 }, { "epoch": 2.8797387037352364, "grad_norm": 1.5546875, "learning_rate": 1.6539525338179495e-05, "loss": 1.0333572387695313, "num_input_tokens_seen": 23147722432, "step": 81390, "train_runtime": 792696.417, "train_tokens_per_second": 29201.245 }, { "epoch": 2.880092523998965, "grad_norm": 1.6171875, "learning_rate": 1.6538620515492054e-05, "loss": 1.0398573875427246, "num_input_tokens_seen": 23150635136, "step": 81400, "train_runtime": 792800.9877, "train_tokens_per_second": 29201.067 }, { "epoch": 2.880446344262694, "grad_norm": 1.59375, "learning_rate": 1.6537715841287933e-05, "loss": 1.034147357940674, "num_input_tokens_seen": 23153445824, "step": 81410, "train_runtime": 792899.6815, "train_tokens_per_second": 29200.978 }, { "epoch": 2.8808001645264225, "grad_norm": 1.5859375, "learning_rate": 1.6536811315526516e-05, "loss": 1.053011417388916, "num_input_tokens_seen": 23156338304, "step": 81420, "train_runtime": 792999.8637, "train_tokens_per_second": 29200.936 }, { "epoch": 2.8811539847901515, "grad_norm": 1.640625, "learning_rate": 1.6535906938167223e-05, "loss": 1.0440032958984375, "num_input_tokens_seen": 23159170432, "step": 81430, "train_runtime": 793096.9215, "train_tokens_per_second": 29200.933 }, { "epoch": 2.88150780505388, "grad_norm": 1.65625, "learning_rate": 1.6535002709169474e-05, "loss": 1.0418243408203125, "num_input_tokens_seen": 23162008640, "step": 81440, "train_runtime": 793190.4702, "train_tokens_per_second": 29201.068 }, { "epoch": 2.881861625317609, "grad_norm": 1.578125, "learning_rate": 1.653409862849271e-05, "loss": 1.0364418983459474, "num_input_tokens_seen": 23164825472, "step": 81450, "train_runtime": 793287.885, "train_tokens_per_second": 29201.033 }, { "epoch": 2.8822154455813376, "grad_norm": 1.578125, "learning_rate": 1.653319469609639e-05, "loss": 1.0379003524780273, "num_input_tokens_seen": 23167639168, "step": 81460, "train_runtime": 793382.9957, "train_tokens_per_second": 29201.079 }, { "epoch": 2.8825692658450666, "grad_norm": 1.6640625, "learning_rate": 1.6532290911939978e-05, "loss": 1.0384090423583985, "num_input_tokens_seen": 23170475456, "step": 81470, "train_runtime": 793478.9905, "train_tokens_per_second": 29201.12 }, { "epoch": 2.8829230861087956, "grad_norm": 1.640625, "learning_rate": 1.6531387275982972e-05, "loss": 1.0368953704833985, "num_input_tokens_seen": 23173259136, "step": 81480, "train_runtime": 793574.4237, "train_tokens_per_second": 29201.116 }, { "epoch": 2.883276906372524, "grad_norm": 1.578125, "learning_rate": 1.6530483788184863e-05, "loss": 1.0396878242492675, "num_input_tokens_seen": 23176068160, "step": 81490, "train_runtime": 793668.808, "train_tokens_per_second": 29201.183 }, { "epoch": 2.8836307266362526, "grad_norm": 1.6484375, "learning_rate": 1.6529580448505172e-05, "loss": 1.0473644256591796, "num_input_tokens_seen": 23178903680, "step": 81500, "train_runtime": 793764.146, "train_tokens_per_second": 29201.248 }, { "epoch": 2.8839845468999816, "grad_norm": 1.609375, "learning_rate": 1.6528677256903436e-05, "loss": 1.041646957397461, "num_input_tokens_seen": 23181723136, "step": 81510, "train_runtime": 793860.4713, "train_tokens_per_second": 29201.256 }, { "epoch": 2.8843383671637106, "grad_norm": 1.59375, "learning_rate": 1.6527774213339204e-05, "loss": 1.044781494140625, "num_input_tokens_seen": 23184502272, "step": 81520, "train_runtime": 793953.0985, "train_tokens_per_second": 29201.35 }, { "epoch": 2.884692187427439, "grad_norm": 1.609375, "learning_rate": 1.6526871317772037e-05, "loss": 1.0308469772338866, "num_input_tokens_seen": 23187387136, "step": 81530, "train_runtime": 794048.7404, "train_tokens_per_second": 29201.466 }, { "epoch": 2.885046007691168, "grad_norm": 1.65625, "learning_rate": 1.6525968570161512e-05, "loss": 1.0453777313232422, "num_input_tokens_seen": 23190172480, "step": 81540, "train_runtime": 794143.749, "train_tokens_per_second": 29201.48 }, { "epoch": 2.8853998279548967, "grad_norm": 1.625, "learning_rate": 1.6525065970467236e-05, "loss": 1.031926727294922, "num_input_tokens_seen": 23193086080, "step": 81550, "train_runtime": 794247.5797, "train_tokens_per_second": 29201.331 }, { "epoch": 2.8857536482186257, "grad_norm": 1.546875, "learning_rate": 1.6524163518648803e-05, "loss": 1.0329414367675782, "num_input_tokens_seen": 23195886528, "step": 81560, "train_runtime": 794343.0235, "train_tokens_per_second": 29201.347 }, { "epoch": 2.886107468482354, "grad_norm": 1.734375, "learning_rate": 1.6523261214665855e-05, "loss": 1.0284431457519532, "num_input_tokens_seen": 23198753536, "step": 81570, "train_runtime": 794441.2649, "train_tokens_per_second": 29201.345 }, { "epoch": 2.886461288746083, "grad_norm": 1.5703125, "learning_rate": 1.6522359058478024e-05, "loss": 1.036871337890625, "num_input_tokens_seen": 23201578240, "step": 81580, "train_runtime": 794535.4176, "train_tokens_per_second": 29201.44 }, { "epoch": 2.8868151090098118, "grad_norm": 1.6171875, "learning_rate": 1.652145705004497e-05, "loss": 1.0340182304382324, "num_input_tokens_seen": 23204418304, "step": 81590, "train_runtime": 794631.2703, "train_tokens_per_second": 29201.492 }, { "epoch": 2.8871689292735407, "grad_norm": 1.6484375, "learning_rate": 1.652055518932636e-05, "loss": 1.031052589416504, "num_input_tokens_seen": 23207239872, "step": 81600, "train_runtime": 794726.7811, "train_tokens_per_second": 29201.532 }, { "epoch": 2.8875227495372693, "grad_norm": 1.6484375, "learning_rate": 1.6519653476281895e-05, "loss": 1.0439897537231446, "num_input_tokens_seen": 23210166912, "step": 81610, "train_runtime": 794828.0784, "train_tokens_per_second": 29201.493 }, { "epoch": 2.8878765698009983, "grad_norm": 1.6015625, "learning_rate": 1.6518751910871267e-05, "loss": 1.034339714050293, "num_input_tokens_seen": 23212979328, "step": 81620, "train_runtime": 794922.0886, "train_tokens_per_second": 29201.578 }, { "epoch": 2.8882303900647273, "grad_norm": 1.5859375, "learning_rate": 1.6517850493054192e-05, "loss": 1.0341724395751952, "num_input_tokens_seen": 23215794752, "step": 81630, "train_runtime": 795014.5942, "train_tokens_per_second": 29201.721 }, { "epoch": 2.888584210328456, "grad_norm": 1.5859375, "learning_rate": 1.6516949222790416e-05, "loss": 1.0343653678894043, "num_input_tokens_seen": 23218609280, "step": 81640, "train_runtime": 795112.066, "train_tokens_per_second": 29201.681 }, { "epoch": 2.8889380305921843, "grad_norm": 1.6796875, "learning_rate": 1.651604810003968e-05, "loss": 1.043610191345215, "num_input_tokens_seen": 23221403840, "step": 81650, "train_runtime": 795206.3468, "train_tokens_per_second": 29201.734 }, { "epoch": 2.8892918508559133, "grad_norm": 1.6875, "learning_rate": 1.6515147124761745e-05, "loss": 1.0444480895996093, "num_input_tokens_seen": 23224249472, "step": 81660, "train_runtime": 795302.5884, "train_tokens_per_second": 29201.778 }, { "epoch": 2.8896456711196423, "grad_norm": 1.59375, "learning_rate": 1.6514246296916406e-05, "loss": 1.0476489067077637, "num_input_tokens_seen": 23227105728, "step": 81670, "train_runtime": 795399.1364, "train_tokens_per_second": 29201.824 }, { "epoch": 2.889999491383371, "grad_norm": 1.6328125, "learning_rate": 1.6513345616463443e-05, "loss": 1.0399064064025878, "num_input_tokens_seen": 23229927488, "step": 81680, "train_runtime": 795497.0329, "train_tokens_per_second": 29201.778 }, { "epoch": 2.8903533116470994, "grad_norm": 1.5859375, "learning_rate": 1.651244508336267e-05, "loss": 1.0377567291259766, "num_input_tokens_seen": 23232781248, "step": 81690, "train_runtime": 795592.6456, "train_tokens_per_second": 29201.855 }, { "epoch": 2.8907071319108284, "grad_norm": 1.5859375, "learning_rate": 1.651154469757392e-05, "loss": 1.0356073379516602, "num_input_tokens_seen": 23235630400, "step": 81700, "train_runtime": 795688.5258, "train_tokens_per_second": 29201.917 }, { "epoch": 2.8910609521745574, "grad_norm": 1.625, "learning_rate": 1.6510644459057032e-05, "loss": 1.0302897453308106, "num_input_tokens_seen": 23238496384, "step": 81710, "train_runtime": 795786.9858, "train_tokens_per_second": 29201.906 }, { "epoch": 2.891414772438286, "grad_norm": 1.6640625, "learning_rate": 1.6509744367771856e-05, "loss": 1.0419872283935547, "num_input_tokens_seen": 23241361984, "step": 81720, "train_runtime": 795889.8943, "train_tokens_per_second": 29201.73 }, { "epoch": 2.891768592702015, "grad_norm": 1.609375, "learning_rate": 1.650884442367827e-05, "loss": 1.0418277740478517, "num_input_tokens_seen": 23244226048, "step": 81730, "train_runtime": 795987.1105, "train_tokens_per_second": 29201.762 }, { "epoch": 2.8921224129657435, "grad_norm": 1.6015625, "learning_rate": 1.6507944626736166e-05, "loss": 1.0353635787963866, "num_input_tokens_seen": 23247043072, "step": 81740, "train_runtime": 796081.6736, "train_tokens_per_second": 29201.832 }, { "epoch": 2.8924762332294724, "grad_norm": 1.5859375, "learning_rate": 1.6507044976905436e-05, "loss": 1.0370108604431152, "num_input_tokens_seen": 23249923328, "step": 81750, "train_runtime": 796180.8039, "train_tokens_per_second": 29201.813 }, { "epoch": 2.892830053493201, "grad_norm": 1.53125, "learning_rate": 1.6506145474146002e-05, "loss": 1.0417546272277831, "num_input_tokens_seen": 23252808448, "step": 81760, "train_runtime": 796281.1212, "train_tokens_per_second": 29201.758 }, { "epoch": 2.89318387375693, "grad_norm": 1.5625, "learning_rate": 1.6505246118417803e-05, "loss": 1.0345733642578125, "num_input_tokens_seen": 23255655424, "step": 81770, "train_runtime": 796376.6207, "train_tokens_per_second": 29201.831 }, { "epoch": 2.8935376940206585, "grad_norm": 1.6015625, "learning_rate": 1.650434690968078e-05, "loss": 1.0338716506958008, "num_input_tokens_seen": 23258495040, "step": 81780, "train_runtime": 796472.292, "train_tokens_per_second": 29201.888 }, { "epoch": 2.8938915142843875, "grad_norm": 1.6015625, "learning_rate": 1.6503447847894902e-05, "loss": 1.0342218399047851, "num_input_tokens_seen": 23261335040, "step": 81790, "train_runtime": 796567.029, "train_tokens_per_second": 29201.981 }, { "epoch": 2.894245334548116, "grad_norm": 1.6484375, "learning_rate": 1.6502548933020142e-05, "loss": 1.0327499389648438, "num_input_tokens_seen": 23264181824, "step": 81800, "train_runtime": 796664.8247, "train_tokens_per_second": 29201.969 }, { "epoch": 2.894599154811845, "grad_norm": 1.6171875, "learning_rate": 1.6501650165016504e-05, "loss": 1.0299384117126464, "num_input_tokens_seen": 23267051008, "step": 81810, "train_runtime": 796766.7557, "train_tokens_per_second": 29201.835 }, { "epoch": 2.894952975075574, "grad_norm": 1.6015625, "learning_rate": 1.6500751543843988e-05, "loss": 1.038261604309082, "num_input_tokens_seen": 23269968704, "step": 81820, "train_runtime": 796867.6779, "train_tokens_per_second": 29201.798 }, { "epoch": 2.8953067953393026, "grad_norm": 1.609375, "learning_rate": 1.6499853069462623e-05, "loss": 1.0340678215026855, "num_input_tokens_seen": 23272819136, "step": 81830, "train_runtime": 796966.5682, "train_tokens_per_second": 29201.751 }, { "epoch": 2.895660615603031, "grad_norm": 1.5078125, "learning_rate": 1.649895474183245e-05, "loss": 1.0278254508972169, "num_input_tokens_seen": 23275730752, "step": 81840, "train_runtime": 797064.8674, "train_tokens_per_second": 29201.802 }, { "epoch": 2.89601443586676, "grad_norm": 1.5859375, "learning_rate": 1.649805656091352e-05, "loss": 1.0536632537841797, "num_input_tokens_seen": 23278545536, "step": 81850, "train_runtime": 797160.7082, "train_tokens_per_second": 29201.823 }, { "epoch": 2.896368256130489, "grad_norm": 1.609375, "learning_rate": 1.649715852666591e-05, "loss": 1.0208560943603515, "num_input_tokens_seen": 23281337024, "step": 81860, "train_runtime": 797255.521, "train_tokens_per_second": 29201.851 }, { "epoch": 2.8967220763942176, "grad_norm": 1.6171875, "learning_rate": 1.6496260639049703e-05, "loss": 1.034883403778076, "num_input_tokens_seen": 23284166976, "step": 81870, "train_runtime": 797352.6218, "train_tokens_per_second": 29201.844 }, { "epoch": 2.8970758966579466, "grad_norm": 1.65625, "learning_rate": 1.6495362898024995e-05, "loss": 1.0236222267150878, "num_input_tokens_seen": 23286988288, "step": 81880, "train_runtime": 797448.8015, "train_tokens_per_second": 29201.86 }, { "epoch": 2.897429716921675, "grad_norm": 1.59375, "learning_rate": 1.649446530355191e-05, "loss": 1.0408872604370116, "num_input_tokens_seen": 23289779840, "step": 81890, "train_runtime": 797545.2116, "train_tokens_per_second": 29201.83 }, { "epoch": 2.897783537185404, "grad_norm": 1.5546875, "learning_rate": 1.6493567855590576e-05, "loss": 1.0385618209838867, "num_input_tokens_seen": 23292648000, "step": 81900, "train_runtime": 797640.409, "train_tokens_per_second": 29201.941 }, { "epoch": 2.8981373574491327, "grad_norm": 1.609375, "learning_rate": 1.649267055410114e-05, "loss": 1.0398298263549806, "num_input_tokens_seen": 23295458304, "step": 81910, "train_runtime": 797735.1371, "train_tokens_per_second": 29201.996 }, { "epoch": 2.8984911777128617, "grad_norm": 1.6015625, "learning_rate": 1.649177339904376e-05, "loss": 1.0287906646728515, "num_input_tokens_seen": 23298307712, "step": 81920, "train_runtime": 797831.0019, "train_tokens_per_second": 29202.059 }, { "epoch": 2.8988449979765902, "grad_norm": 1.6328125, "learning_rate": 1.649087639037862e-05, "loss": 1.0294256210327148, "num_input_tokens_seen": 23301108992, "step": 81930, "train_runtime": 797923.0489, "train_tokens_per_second": 29202.201 }, { "epoch": 2.899198818240319, "grad_norm": 1.625, "learning_rate": 1.6489979528065905e-05, "loss": 1.0255126953125, "num_input_tokens_seen": 23303952384, "step": 81940, "train_runtime": 798021.2765, "train_tokens_per_second": 29202.169 }, { "epoch": 2.8995526385040478, "grad_norm": 1.5859375, "learning_rate": 1.6489082812065826e-05, "loss": 1.0414183616638184, "num_input_tokens_seen": 23306748480, "step": 81950, "train_runtime": 798117.8849, "train_tokens_per_second": 29202.138 }, { "epoch": 2.8999064587677768, "grad_norm": 1.578125, "learning_rate": 1.64881862423386e-05, "loss": 1.0533702850341797, "num_input_tokens_seen": 23309584064, "step": 81960, "train_runtime": 798213.0109, "train_tokens_per_second": 29202.21 }, { "epoch": 2.9002602790315057, "grad_norm": 1.578125, "learning_rate": 1.6487289818844477e-05, "loss": 1.0271595001220704, "num_input_tokens_seen": 23312365312, "step": 81970, "train_runtime": 798306.3229, "train_tokens_per_second": 29202.281 }, { "epoch": 2.9006140992952343, "grad_norm": 1.6796875, "learning_rate": 1.6486393541543697e-05, "loss": 1.0262845993041991, "num_input_tokens_seen": 23315219072, "step": 81980, "train_runtime": 798409.0664, "train_tokens_per_second": 29202.097 }, { "epoch": 2.900967919558963, "grad_norm": 1.6015625, "learning_rate": 1.6485497410396535e-05, "loss": 1.0358407020568847, "num_input_tokens_seen": 23318028480, "step": 81990, "train_runtime": 798501.6696, "train_tokens_per_second": 29202.229 }, { "epoch": 2.901321739822692, "grad_norm": 1.671875, "learning_rate": 1.6484601425363267e-05, "loss": 1.0435805320739746, "num_input_tokens_seen": 23320873664, "step": 82000, "train_runtime": 798598.9142, "train_tokens_per_second": 29202.236 }, { "epoch": 2.901675560086421, "grad_norm": 1.5703125, "learning_rate": 1.6483705586404196e-05, "loss": 1.034358596801758, "num_input_tokens_seen": 23323738368, "step": 82010, "train_runtime": 798695.2528, "train_tokens_per_second": 29202.3 }, { "epoch": 2.9020293803501493, "grad_norm": 1.5859375, "learning_rate": 1.6482809893479635e-05, "loss": 1.027450942993164, "num_input_tokens_seen": 23326582464, "step": 82020, "train_runtime": 798793.654, "train_tokens_per_second": 29202.263 }, { "epoch": 2.902383200613878, "grad_norm": 1.6171875, "learning_rate": 1.648191434654991e-05, "loss": 1.0448732376098633, "num_input_tokens_seen": 23329444608, "step": 82030, "train_runtime": 798893.0439, "train_tokens_per_second": 29202.213 }, { "epoch": 2.902737020877607, "grad_norm": 1.578125, "learning_rate": 1.6481018945575367e-05, "loss": 1.0368382453918457, "num_input_tokens_seen": 23332333568, "step": 82040, "train_runtime": 798994.7451, "train_tokens_per_second": 29202.111 }, { "epoch": 2.903090841141336, "grad_norm": 1.5625, "learning_rate": 1.6480123690516364e-05, "loss": 1.036186981201172, "num_input_tokens_seen": 23335177600, "step": 82050, "train_runtime": 799093.2528, "train_tokens_per_second": 29202.071 }, { "epoch": 2.9034446614050644, "grad_norm": 1.6484375, "learning_rate": 1.6479228581333274e-05, "loss": 1.0387323379516602, "num_input_tokens_seen": 23338055424, "step": 82060, "train_runtime": 799193.1876, "train_tokens_per_second": 29202.02 }, { "epoch": 2.9037984816687934, "grad_norm": 1.65625, "learning_rate": 1.647833361798648e-05, "loss": 1.0484508514404296, "num_input_tokens_seen": 23340829952, "step": 82070, "train_runtime": 799287.5113, "train_tokens_per_second": 29202.045 }, { "epoch": 2.904152301932522, "grad_norm": 1.5859375, "learning_rate": 1.6477438800436394e-05, "loss": 1.0314799308776856, "num_input_tokens_seen": 23343640960, "step": 82080, "train_runtime": 799381.7614, "train_tokens_per_second": 29202.119 }, { "epoch": 2.904506122196251, "grad_norm": 1.625, "learning_rate": 1.6476544128643425e-05, "loss": 1.0453567504882812, "num_input_tokens_seen": 23346495808, "step": 82090, "train_runtime": 799480.5097, "train_tokens_per_second": 29202.083 }, { "epoch": 2.9048599424599795, "grad_norm": 1.6015625, "learning_rate": 1.6475649602568016e-05, "loss": 1.0362819671630858, "num_input_tokens_seen": 23349385728, "step": 82100, "train_runtime": 799583.8589, "train_tokens_per_second": 29201.922 }, { "epoch": 2.9052137627237085, "grad_norm": 1.6328125, "learning_rate": 1.6474755222170613e-05, "loss": 1.0411346435546875, "num_input_tokens_seen": 23352194688, "step": 82110, "train_runtime": 799679.6278, "train_tokens_per_second": 29201.938 }, { "epoch": 2.905567582987437, "grad_norm": 1.6171875, "learning_rate": 1.6473860987411676e-05, "loss": 1.0373552322387696, "num_input_tokens_seen": 23355018176, "step": 82120, "train_runtime": 799775.453, "train_tokens_per_second": 29201.969 }, { "epoch": 2.905921403251166, "grad_norm": 1.6015625, "learning_rate": 1.6472966898251688e-05, "loss": 1.0439065933227538, "num_input_tokens_seen": 23357856768, "step": 82130, "train_runtime": 799871.2319, "train_tokens_per_second": 29202.021 }, { "epoch": 2.9062752235148945, "grad_norm": 1.625, "learning_rate": 1.647207295465114e-05, "loss": 1.034780502319336, "num_input_tokens_seen": 23360679424, "step": 82140, "train_runtime": 799966.7541, "train_tokens_per_second": 29202.063 }, { "epoch": 2.9066290437786235, "grad_norm": 1.5390625, "learning_rate": 1.647117915657054e-05, "loss": 1.0428266525268555, "num_input_tokens_seen": 23363557888, "step": 82150, "train_runtime": 800064.5954, "train_tokens_per_second": 29202.089 }, { "epoch": 2.9069828640423525, "grad_norm": 1.5625, "learning_rate": 1.6470285503970414e-05, "loss": 1.049283790588379, "num_input_tokens_seen": 23366426304, "step": 82160, "train_runtime": 800166.0149, "train_tokens_per_second": 29201.973 }, { "epoch": 2.907336684306081, "grad_norm": 1.6171875, "learning_rate": 1.64693919968113e-05, "loss": 1.0376446723937989, "num_input_tokens_seen": 23369299520, "step": 82170, "train_runtime": 800266.476, "train_tokens_per_second": 29201.897 }, { "epoch": 2.9076905045698096, "grad_norm": 1.59375, "learning_rate": 1.646849863505375e-05, "loss": 1.0471147537231444, "num_input_tokens_seen": 23372104064, "step": 82180, "train_runtime": 800362.1654, "train_tokens_per_second": 29201.91 }, { "epoch": 2.9080443248335386, "grad_norm": 1.546875, "learning_rate": 1.646760541865834e-05, "loss": 1.038701629638672, "num_input_tokens_seen": 23374971840, "step": 82190, "train_runtime": 800459.4958, "train_tokens_per_second": 29201.942 }, { "epoch": 2.9083981450972676, "grad_norm": 1.59375, "learning_rate": 1.6466712347585644e-05, "loss": 1.0466977119445802, "num_input_tokens_seen": 23377801472, "step": 82200, "train_runtime": 800555.7725, "train_tokens_per_second": 29201.965 }, { "epoch": 2.908751965360996, "grad_norm": 1.6640625, "learning_rate": 1.6465819421796264e-05, "loss": 1.0389780044555663, "num_input_tokens_seen": 23380662528, "step": 82210, "train_runtime": 800656.0313, "train_tokens_per_second": 29201.881 }, { "epoch": 2.909105785624725, "grad_norm": 1.5625, "learning_rate": 1.6464926641250812e-05, "loss": 1.0378755569458007, "num_input_tokens_seen": 23383518848, "step": 82220, "train_runtime": 800754.7439, "train_tokens_per_second": 29201.849 }, { "epoch": 2.9094596058884536, "grad_norm": 1.6171875, "learning_rate": 1.646403400590992e-05, "loss": 1.0260343551635742, "num_input_tokens_seen": 23386361024, "step": 82230, "train_runtime": 800850.959, "train_tokens_per_second": 29201.889 }, { "epoch": 2.9098134261521826, "grad_norm": 1.59375, "learning_rate": 1.6463141515734232e-05, "loss": 1.0451658248901368, "num_input_tokens_seen": 23389224576, "step": 82240, "train_runtime": 800951.0361, "train_tokens_per_second": 29201.816 }, { "epoch": 2.910167246415911, "grad_norm": 1.703125, "learning_rate": 1.6462249170684403e-05, "loss": 1.042930793762207, "num_input_tokens_seen": 23392087744, "step": 82250, "train_runtime": 801048.7298, "train_tokens_per_second": 29201.829 }, { "epoch": 2.91052106667964, "grad_norm": 1.6796875, "learning_rate": 1.6461356970721107e-05, "loss": 1.0268678665161133, "num_input_tokens_seen": 23394902336, "step": 82260, "train_runtime": 801143.1698, "train_tokens_per_second": 29201.9 }, { "epoch": 2.9108748869433687, "grad_norm": 1.6640625, "learning_rate": 1.646046491580503e-05, "loss": 1.0245210647583007, "num_input_tokens_seen": 23397752896, "step": 82270, "train_runtime": 801240.8077, "train_tokens_per_second": 29201.899 }, { "epoch": 2.9112287072070977, "grad_norm": 1.6640625, "learning_rate": 1.645957300589688e-05, "loss": 1.0315054893493651, "num_input_tokens_seen": 23400557440, "step": 82280, "train_runtime": 801338.2876, "train_tokens_per_second": 29201.846 }, { "epoch": 2.9115825274708262, "grad_norm": 1.5546875, "learning_rate": 1.6458681240957374e-05, "loss": 1.0308526039123536, "num_input_tokens_seen": 23403410944, "step": 82290, "train_runtime": 801436.2181, "train_tokens_per_second": 29201.838 }, { "epoch": 2.9119363477345552, "grad_norm": 1.5859375, "learning_rate": 1.645778962094724e-05, "loss": 1.0425003051757813, "num_input_tokens_seen": 23406277184, "step": 82300, "train_runtime": 801535.2022, "train_tokens_per_second": 29201.808 }, { "epoch": 2.912290167998284, "grad_norm": 1.546875, "learning_rate": 1.645689814582723e-05, "loss": 1.0414790153503417, "num_input_tokens_seen": 23409114752, "step": 82310, "train_runtime": 801632.7168, "train_tokens_per_second": 29201.796 }, { "epoch": 2.9126439882620128, "grad_norm": 1.6328125, "learning_rate": 1.645600681555811e-05, "loss": 1.0364343643188476, "num_input_tokens_seen": 23411988544, "step": 82320, "train_runtime": 801733.3433, "train_tokens_per_second": 29201.715 }, { "epoch": 2.9129978085257413, "grad_norm": 1.5703125, "learning_rate": 1.645511563010065e-05, "loss": 1.0193931579589843, "num_input_tokens_seen": 23414833600, "step": 82330, "train_runtime": 801828.0123, "train_tokens_per_second": 29201.815 }, { "epoch": 2.9133516287894703, "grad_norm": 1.6796875, "learning_rate": 1.6454224589415647e-05, "loss": 1.0287192344665528, "num_input_tokens_seen": 23417700224, "step": 82340, "train_runtime": 801931.2084, "train_tokens_per_second": 29201.632 }, { "epoch": 2.9137054490531993, "grad_norm": 1.5625, "learning_rate": 1.6453333693463906e-05, "loss": 1.0384401321411132, "num_input_tokens_seen": 23420516672, "step": 82350, "train_runtime": 802026.9148, "train_tokens_per_second": 29201.659 }, { "epoch": 2.914059269316928, "grad_norm": 1.59375, "learning_rate": 1.645244294220625e-05, "loss": 1.0306867599487304, "num_input_tokens_seen": 23423308992, "step": 82360, "train_runtime": 802121.1385, "train_tokens_per_second": 29201.71 }, { "epoch": 2.914413089580657, "grad_norm": 1.6640625, "learning_rate": 1.645155233560352e-05, "loss": 1.0426767349243165, "num_input_tokens_seen": 23426087808, "step": 82370, "train_runtime": 802215.0333, "train_tokens_per_second": 29201.756 }, { "epoch": 2.9147669098443854, "grad_norm": 1.609375, "learning_rate": 1.645066187361656e-05, "loss": 1.0385237693786622, "num_input_tokens_seen": 23428857280, "step": 82380, "train_runtime": 802308.4974, "train_tokens_per_second": 29201.806 }, { "epoch": 2.9151207301081143, "grad_norm": 1.6171875, "learning_rate": 1.6449771556206242e-05, "loss": 1.0501800537109376, "num_input_tokens_seen": 23431687424, "step": 82390, "train_runtime": 802407.3446, "train_tokens_per_second": 29201.736 }, { "epoch": 2.915474550371843, "grad_norm": 1.6171875, "learning_rate": 1.6448881383333446e-05, "loss": 1.03688325881958, "num_input_tokens_seen": 23434521024, "step": 82400, "train_runtime": 802501.599, "train_tokens_per_second": 29201.837 }, { "epoch": 2.915828370635572, "grad_norm": 1.65625, "learning_rate": 1.644799135495907e-05, "loss": 1.037541389465332, "num_input_tokens_seen": 23437367872, "step": 82410, "train_runtime": 802600.4116, "train_tokens_per_second": 29201.789 }, { "epoch": 2.9161821908993004, "grad_norm": 1.5703125, "learning_rate": 1.644710147104402e-05, "loss": 1.0276203155517578, "num_input_tokens_seen": 23440213440, "step": 82420, "train_runtime": 802699.8237, "train_tokens_per_second": 29201.717 }, { "epoch": 2.9165360111630294, "grad_norm": 1.578125, "learning_rate": 1.644621173154923e-05, "loss": 1.0274230003356934, "num_input_tokens_seen": 23443040192, "step": 82430, "train_runtime": 802797.0822, "train_tokens_per_second": 29201.701 }, { "epoch": 2.916889831426758, "grad_norm": 1.5625, "learning_rate": 1.6445322136435636e-05, "loss": 1.027376365661621, "num_input_tokens_seen": 23445897728, "step": 82440, "train_runtime": 802894.815, "train_tokens_per_second": 29201.705 }, { "epoch": 2.917243651690487, "grad_norm": 1.5703125, "learning_rate": 1.644443268566419e-05, "loss": 1.0313352584838866, "num_input_tokens_seen": 23448717952, "step": 82450, "train_runtime": 802989.9098, "train_tokens_per_second": 29201.759 }, { "epoch": 2.917597471954216, "grad_norm": 1.59375, "learning_rate": 1.6443543379195868e-05, "loss": 1.0223358154296875, "num_input_tokens_seen": 23451563712, "step": 82460, "train_runtime": 803087.281, "train_tokens_per_second": 29201.762 }, { "epoch": 2.9179512922179445, "grad_norm": 1.5390625, "learning_rate": 1.6442654216991655e-05, "loss": 1.0424938201904297, "num_input_tokens_seen": 23454397248, "step": 82470, "train_runtime": 803183.9498, "train_tokens_per_second": 29201.775 }, { "epoch": 2.918305112481673, "grad_norm": 1.59375, "learning_rate": 1.6441765199012542e-05, "loss": 1.0375866889953613, "num_input_tokens_seen": 23457219136, "step": 82480, "train_runtime": 803279.1174, "train_tokens_per_second": 29201.829 }, { "epoch": 2.918658932745402, "grad_norm": 1.6171875, "learning_rate": 1.6440876325219555e-05, "loss": 1.0376762390136718, "num_input_tokens_seen": 23460053376, "step": 82490, "train_runtime": 803377.8722, "train_tokens_per_second": 29201.767 }, { "epoch": 2.919012753009131, "grad_norm": 1.671875, "learning_rate": 1.643998759557372e-05, "loss": 1.0407905578613281, "num_input_tokens_seen": 23462918400, "step": 82500, "train_runtime": 803478.4591, "train_tokens_per_second": 29201.677 }, { "epoch": 2.9193665732728595, "grad_norm": 1.5703125, "learning_rate": 1.6439099010036077e-05, "loss": 1.0334360122680664, "num_input_tokens_seen": 23465773888, "step": 82510, "train_runtime": 803579.0367, "train_tokens_per_second": 29201.575 }, { "epoch": 2.919720393536588, "grad_norm": 1.6171875, "learning_rate": 1.643821056856769e-05, "loss": 1.043668556213379, "num_input_tokens_seen": 23468648320, "step": 82520, "train_runtime": 803677.4092, "train_tokens_per_second": 29201.578 }, { "epoch": 2.920074213800317, "grad_norm": 1.5703125, "learning_rate": 1.6437322271129625e-05, "loss": 1.037771224975586, "num_input_tokens_seen": 23471500992, "step": 82530, "train_runtime": 803777.4924, "train_tokens_per_second": 29201.491 }, { "epoch": 2.920428034064046, "grad_norm": 1.578125, "learning_rate": 1.6436434117682977e-05, "loss": 1.0240306854248047, "num_input_tokens_seen": 23474317632, "step": 82540, "train_runtime": 803873.6207, "train_tokens_per_second": 29201.503 }, { "epoch": 2.9207818543277746, "grad_norm": 1.640625, "learning_rate": 1.643554610818885e-05, "loss": 1.0379066467285156, "num_input_tokens_seen": 23477154112, "step": 82550, "train_runtime": 803971.1754, "train_tokens_per_second": 29201.487 }, { "epoch": 2.9211356745915036, "grad_norm": 1.640625, "learning_rate": 1.6434658242608358e-05, "loss": 1.0424989700317382, "num_input_tokens_seen": 23479999040, "step": 82560, "train_runtime": 804069.373, "train_tokens_per_second": 29201.459 }, { "epoch": 2.921489494855232, "grad_norm": 1.609375, "learning_rate": 1.6433770520902633e-05, "loss": 1.0274450302124023, "num_input_tokens_seen": 23482883584, "step": 82570, "train_runtime": 804166.5287, "train_tokens_per_second": 29201.518 }, { "epoch": 2.921843315118961, "grad_norm": 1.6328125, "learning_rate": 1.6432882943032823e-05, "loss": 1.0244965553283691, "num_input_tokens_seen": 23485719744, "step": 82580, "train_runtime": 804263.4444, "train_tokens_per_second": 29201.526 }, { "epoch": 2.9221971353826897, "grad_norm": 1.59375, "learning_rate": 1.643199550896009e-05, "loss": 1.0335446357727052, "num_input_tokens_seen": 23488491712, "step": 82590, "train_runtime": 804356.1855, "train_tokens_per_second": 29201.605 }, { "epoch": 2.9225509556464186, "grad_norm": 1.6171875, "learning_rate": 1.6431108218645612e-05, "loss": 1.0197903633117675, "num_input_tokens_seen": 23491391424, "step": 82600, "train_runtime": 804457.2417, "train_tokens_per_second": 29201.541 }, { "epoch": 2.922904775910147, "grad_norm": 1.6171875, "learning_rate": 1.643022107205058e-05, "loss": 1.0353784561157227, "num_input_tokens_seen": 23494246912, "step": 82610, "train_runtime": 804557.2295, "train_tokens_per_second": 29201.461 }, { "epoch": 2.923258596173876, "grad_norm": 1.640625, "learning_rate": 1.6429334069136193e-05, "loss": 1.0300652503967285, "num_input_tokens_seen": 23497134400, "step": 82620, "train_runtime": 804656.2261, "train_tokens_per_second": 29201.457 }, { "epoch": 2.9236124164376047, "grad_norm": 1.5546875, "learning_rate": 1.642844720986368e-05, "loss": 1.0273927688598632, "num_input_tokens_seen": 23499930368, "step": 82630, "train_runtime": 804749.3238, "train_tokens_per_second": 29201.553 }, { "epoch": 2.9239662367013337, "grad_norm": 1.6015625, "learning_rate": 1.642756049419427e-05, "loss": 1.0347605705261231, "num_input_tokens_seen": 23502771072, "step": 82640, "train_runtime": 804845.6019, "train_tokens_per_second": 29201.59 }, { "epoch": 2.9243200569650627, "grad_norm": 1.65625, "learning_rate": 1.6426673922089217e-05, "loss": 1.04333553314209, "num_input_tokens_seen": 23505573696, "step": 82650, "train_runtime": 804939.8628, "train_tokens_per_second": 29201.652 }, { "epoch": 2.9246738772287912, "grad_norm": 1.6015625, "learning_rate": 1.6425787493509783e-05, "loss": 1.028804874420166, "num_input_tokens_seen": 23508397952, "step": 82660, "train_runtime": 805036.7898, "train_tokens_per_second": 29201.644 }, { "epoch": 2.92502769749252, "grad_norm": 1.5859375, "learning_rate": 1.642490120841725e-05, "loss": 1.0479217529296876, "num_input_tokens_seen": 23511237120, "step": 82670, "train_runtime": 805134.0633, "train_tokens_per_second": 29201.643 }, { "epoch": 2.9253815177562488, "grad_norm": 1.6015625, "learning_rate": 1.6424015066772907e-05, "loss": 1.0232019424438477, "num_input_tokens_seen": 23514068032, "step": 82680, "train_runtime": 805229.8037, "train_tokens_per_second": 29201.686 }, { "epoch": 2.9257353380199778, "grad_norm": 1.6171875, "learning_rate": 1.6423129068538065e-05, "loss": 1.04473819732666, "num_input_tokens_seen": 23516875840, "step": 82690, "train_runtime": 805322.6391, "train_tokens_per_second": 29201.806 }, { "epoch": 2.9260891582837063, "grad_norm": 1.625, "learning_rate": 1.642224321367405e-05, "loss": 1.028672981262207, "num_input_tokens_seen": 23519660288, "step": 82700, "train_runtime": 805419.5846, "train_tokens_per_second": 29201.749 }, { "epoch": 2.9264429785474353, "grad_norm": 1.6640625, "learning_rate": 1.6421357502142192e-05, "loss": 1.031590175628662, "num_input_tokens_seen": 23522507648, "step": 82710, "train_runtime": 805518.8437, "train_tokens_per_second": 29201.685 }, { "epoch": 2.926796798811164, "grad_norm": 1.65625, "learning_rate": 1.6420471933903847e-05, "loss": 1.0406122207641602, "num_input_tokens_seen": 23525359104, "step": 82720, "train_runtime": 805616.9574, "train_tokens_per_second": 29201.668 }, { "epoch": 2.927150619074893, "grad_norm": 1.6171875, "learning_rate": 1.6419586508920383e-05, "loss": 1.0263463020324708, "num_input_tokens_seen": 23528215360, "step": 82730, "train_runtime": 805714.642, "train_tokens_per_second": 29201.673 }, { "epoch": 2.9275044393386214, "grad_norm": 1.59375, "learning_rate": 1.641870122715318e-05, "loss": 1.0184555053710938, "num_input_tokens_seen": 23531081984, "step": 82740, "train_runtime": 805813.8614, "train_tokens_per_second": 29201.635 }, { "epoch": 2.9278582596023504, "grad_norm": 1.7109375, "learning_rate": 1.641781608856363e-05, "loss": 1.038747787475586, "num_input_tokens_seen": 23533993408, "step": 82750, "train_runtime": 805918.4707, "train_tokens_per_second": 29201.457 }, { "epoch": 2.928212079866079, "grad_norm": 1.6328125, "learning_rate": 1.6416931093113156e-05, "loss": 1.022183895111084, "num_input_tokens_seen": 23536830208, "step": 82760, "train_runtime": 806016.3323, "train_tokens_per_second": 29201.431 }, { "epoch": 2.928565900129808, "grad_norm": 1.6328125, "learning_rate": 1.6416046240763165e-05, "loss": 1.0428789138793946, "num_input_tokens_seen": 23539626496, "step": 82770, "train_runtime": 806110.7673, "train_tokens_per_second": 29201.479 }, { "epoch": 2.9289197203935364, "grad_norm": 1.6953125, "learning_rate": 1.641516153147511e-05, "loss": 1.0486883163452148, "num_input_tokens_seen": 23542492032, "step": 82780, "train_runtime": 806209.4407, "train_tokens_per_second": 29201.459 }, { "epoch": 2.9292735406572654, "grad_norm": 1.625, "learning_rate": 1.6414276965210436e-05, "loss": 1.0230631828308105, "num_input_tokens_seen": 23545410752, "step": 82790, "train_runtime": 806308.9349, "train_tokens_per_second": 29201.476 }, { "epoch": 2.9296273609209944, "grad_norm": 1.59375, "learning_rate": 1.641339254193062e-05, "loss": 1.023196315765381, "num_input_tokens_seen": 23548268608, "step": 82800, "train_runtime": 806407.8321, "train_tokens_per_second": 29201.438 }, { "epoch": 2.929981181184723, "grad_norm": 1.609375, "learning_rate": 1.6412508261597135e-05, "loss": 1.0337226867675782, "num_input_tokens_seen": 23551140928, "step": 82810, "train_runtime": 806506.7116, "train_tokens_per_second": 29201.42 }, { "epoch": 2.9303350014484515, "grad_norm": 1.609375, "learning_rate": 1.641162412417149e-05, "loss": 1.0280645370483399, "num_input_tokens_seen": 23554037248, "step": 82820, "train_runtime": 806606.2958, "train_tokens_per_second": 29201.405 }, { "epoch": 2.9306888217121805, "grad_norm": 1.5390625, "learning_rate": 1.641074012961519e-05, "loss": 1.0302412986755372, "num_input_tokens_seen": 23556947584, "step": 82830, "train_runtime": 806708.2653, "train_tokens_per_second": 29201.322 }, { "epoch": 2.9310426419759095, "grad_norm": 1.6171875, "learning_rate": 1.6409856277889765e-05, "loss": 1.0429987907409668, "num_input_tokens_seen": 23559806400, "step": 82840, "train_runtime": 806803.9229, "train_tokens_per_second": 29201.403 }, { "epoch": 2.931396462239638, "grad_norm": 1.7578125, "learning_rate": 1.6408972568956752e-05, "loss": 1.0425691604614258, "num_input_tokens_seen": 23562656192, "step": 82850, "train_runtime": 806902.3325, "train_tokens_per_second": 29201.373 }, { "epoch": 2.9317502825033666, "grad_norm": 1.625, "learning_rate": 1.640808900277771e-05, "loss": 1.0348703384399414, "num_input_tokens_seen": 23565470976, "step": 82860, "train_runtime": 806999.3286, "train_tokens_per_second": 29201.351 }, { "epoch": 2.9321041027670955, "grad_norm": 1.6484375, "learning_rate": 1.6407205579314206e-05, "loss": 1.049706268310547, "num_input_tokens_seen": 23568335808, "step": 82870, "train_runtime": 807097.7969, "train_tokens_per_second": 29201.338 }, { "epoch": 2.9324579230308245, "grad_norm": 1.609375, "learning_rate": 1.640632229852783e-05, "loss": 1.0388547897338867, "num_input_tokens_seen": 23571196224, "step": 82880, "train_runtime": 807198.328, "train_tokens_per_second": 29201.245 }, { "epoch": 2.932811743294553, "grad_norm": 1.59375, "learning_rate": 1.6405439160380177e-05, "loss": 1.039502239227295, "num_input_tokens_seen": 23574055680, "step": 82890, "train_runtime": 807298.0631, "train_tokens_per_second": 29201.18 }, { "epoch": 2.933165563558282, "grad_norm": 1.6171875, "learning_rate": 1.640455616483286e-05, "loss": 1.0378055572509766, "num_input_tokens_seen": 23576903680, "step": 82900, "train_runtime": 807394.3625, "train_tokens_per_second": 29201.224 }, { "epoch": 2.9335193838220106, "grad_norm": 1.6328125, "learning_rate": 1.6403673311847505e-05, "loss": 1.0379903793334961, "num_input_tokens_seen": 23579735552, "step": 82910, "train_runtime": 807488.9517, "train_tokens_per_second": 29201.31 }, { "epoch": 2.9338732040857396, "grad_norm": 1.6328125, "learning_rate": 1.6402790601385763e-05, "loss": 1.0442813873291015, "num_input_tokens_seen": 23582601088, "step": 82920, "train_runtime": 807585.7718, "train_tokens_per_second": 29201.358 }, { "epoch": 2.934227024349468, "grad_norm": 1.65625, "learning_rate": 1.6401908033409285e-05, "loss": 1.0352426528930665, "num_input_tokens_seen": 23585431296, "step": 82930, "train_runtime": 807679.4303, "train_tokens_per_second": 29201.476 }, { "epoch": 2.934580844613197, "grad_norm": 1.6015625, "learning_rate": 1.640102560787974e-05, "loss": 1.0472219467163086, "num_input_tokens_seen": 23588249344, "step": 82940, "train_runtime": 807777.2876, "train_tokens_per_second": 29201.427 }, { "epoch": 2.9349346648769257, "grad_norm": 1.6484375, "learning_rate": 1.640014332475882e-05, "loss": 1.0261850357055664, "num_input_tokens_seen": 23591092352, "step": 82950, "train_runtime": 807873.5082, "train_tokens_per_second": 29201.468 }, { "epoch": 2.9352884851406547, "grad_norm": 1.5859375, "learning_rate": 1.639926118400822e-05, "loss": 1.0508545875549316, "num_input_tokens_seen": 23593946496, "step": 82960, "train_runtime": 807971.2623, "train_tokens_per_second": 29201.467 }, { "epoch": 2.935642305404383, "grad_norm": 1.59375, "learning_rate": 1.6398379185589653e-05, "loss": 1.0354289054870605, "num_input_tokens_seen": 23596771136, "step": 82970, "train_runtime": 808067.6675, "train_tokens_per_second": 29201.479 }, { "epoch": 2.935996125668112, "grad_norm": 1.640625, "learning_rate": 1.6397497329464858e-05, "loss": 1.0426487922668457, "num_input_tokens_seen": 23599582208, "step": 82980, "train_runtime": 808165.4333, "train_tokens_per_second": 29201.425 }, { "epoch": 2.936349945931841, "grad_norm": 1.6328125, "learning_rate": 1.639661561559557e-05, "loss": 1.039994716644287, "num_input_tokens_seen": 23602429056, "step": 82990, "train_runtime": 808266.1608, "train_tokens_per_second": 29201.308 }, { "epoch": 2.9367037661955697, "grad_norm": 1.5390625, "learning_rate": 1.639573404394355e-05, "loss": 1.0282909393310546, "num_input_tokens_seen": 23605236096, "step": 83000, "train_runtime": 808360.6589, "train_tokens_per_second": 29201.367 }, { "epoch": 2.9370575864592983, "grad_norm": 1.6328125, "learning_rate": 1.6394852614470568e-05, "loss": 1.0318000793457032, "num_input_tokens_seen": 23608039360, "step": 83010, "train_runtime": 808455.231, "train_tokens_per_second": 29201.418 }, { "epoch": 2.9374114067230273, "grad_norm": 1.6015625, "learning_rate": 1.6393971327138412e-05, "loss": 1.0403034210205078, "num_input_tokens_seen": 23610894848, "step": 83020, "train_runtime": 808553.1459, "train_tokens_per_second": 29201.414 }, { "epoch": 2.9377652269867562, "grad_norm": 1.5859375, "learning_rate": 1.639309018190888e-05, "loss": 1.0262086868286133, "num_input_tokens_seen": 23613715840, "step": 83030, "train_runtime": 808651.3124, "train_tokens_per_second": 29201.357 }, { "epoch": 2.938119047250485, "grad_norm": 1.5859375, "learning_rate": 1.6392209178743793e-05, "loss": 1.0176182746887208, "num_input_tokens_seen": 23616599040, "step": 83040, "train_runtime": 808750.7229, "train_tokens_per_second": 29201.333 }, { "epoch": 2.9384728675142138, "grad_norm": 1.59375, "learning_rate": 1.639132831760497e-05, "loss": 1.050097370147705, "num_input_tokens_seen": 23619449024, "step": 83050, "train_runtime": 808847.4093, "train_tokens_per_second": 29201.366 }, { "epoch": 2.9388266877779423, "grad_norm": 1.546875, "learning_rate": 1.6390447598454276e-05, "loss": 1.041276741027832, "num_input_tokens_seen": 23622251072, "step": 83060, "train_runtime": 808939.7425, "train_tokens_per_second": 29201.497 }, { "epoch": 2.9391805080416713, "grad_norm": 1.6484375, "learning_rate": 1.6389567021253547e-05, "loss": 1.0392881393432618, "num_input_tokens_seen": 23625106624, "step": 83070, "train_runtime": 809034.3986, "train_tokens_per_second": 29201.61 }, { "epoch": 2.9395343283054, "grad_norm": 1.5859375, "learning_rate": 1.6388686585964667e-05, "loss": 1.0344202041625976, "num_input_tokens_seen": 23627990528, "step": 83080, "train_runtime": 809135.1449, "train_tokens_per_second": 29201.538 }, { "epoch": 2.939888148569129, "grad_norm": 1.640625, "learning_rate": 1.6387806292549522e-05, "loss": 1.0498573303222656, "num_input_tokens_seen": 23630893568, "step": 83090, "train_runtime": 809236.0622, "train_tokens_per_second": 29201.484 }, { "epoch": 2.9402419688328574, "grad_norm": 1.5234375, "learning_rate": 1.6386926140970015e-05, "loss": 1.0250654220581055, "num_input_tokens_seen": 23633754176, "step": 83100, "train_runtime": 809333.2534, "train_tokens_per_second": 29201.511 }, { "epoch": 2.9405957890965864, "grad_norm": 1.65625, "learning_rate": 1.6386046131188054e-05, "loss": 1.0363791465759278, "num_input_tokens_seen": 23636573824, "step": 83110, "train_runtime": 809428.2446, "train_tokens_per_second": 29201.568 }, { "epoch": 2.940949609360315, "grad_norm": 1.640625, "learning_rate": 1.638516626316558e-05, "loss": 1.032752227783203, "num_input_tokens_seen": 23639506816, "step": 83120, "train_runtime": 809531.7466, "train_tokens_per_second": 29201.457 }, { "epoch": 2.941303429624044, "grad_norm": 1.609375, "learning_rate": 1.6384286536864525e-05, "loss": 1.033646583557129, "num_input_tokens_seen": 23642375104, "step": 83130, "train_runtime": 809630.7281, "train_tokens_per_second": 29201.43 }, { "epoch": 2.941657249887773, "grad_norm": 1.6796875, "learning_rate": 1.6383406952246856e-05, "loss": 1.031043815612793, "num_input_tokens_seen": 23645265600, "step": 83140, "train_runtime": 809732.7498, "train_tokens_per_second": 29201.321 }, { "epoch": 2.9420110701515014, "grad_norm": 1.6015625, "learning_rate": 1.638252750927455e-05, "loss": 1.0491025924682618, "num_input_tokens_seen": 23648169152, "step": 83150, "train_runtime": 809836.1244, "train_tokens_per_second": 29201.178 }, { "epoch": 2.94236489041523, "grad_norm": 1.640625, "learning_rate": 1.6381648207909584e-05, "loss": 1.035498046875, "num_input_tokens_seen": 23651006656, "step": 83160, "train_runtime": 809934.6078, "train_tokens_per_second": 29201.131 }, { "epoch": 2.942718710678959, "grad_norm": 1.5546875, "learning_rate": 1.6380769048113964e-05, "loss": 1.0369665145874023, "num_input_tokens_seen": 23653862656, "step": 83170, "train_runtime": 810033.1101, "train_tokens_per_second": 29201.106 }, { "epoch": 2.943072530942688, "grad_norm": 1.5859375, "learning_rate": 1.6379890029849707e-05, "loss": 1.0251930236816407, "num_input_tokens_seen": 23656685696, "step": 83180, "train_runtime": 810127.5635, "train_tokens_per_second": 29201.186 }, { "epoch": 2.9434263512064165, "grad_norm": 1.546875, "learning_rate": 1.6379011153078844e-05, "loss": 1.0345199584960938, "num_input_tokens_seen": 23659521088, "step": 83190, "train_runtime": 810225.5275, "train_tokens_per_second": 29201.155 }, { "epoch": 2.943780171470145, "grad_norm": 1.6015625, "learning_rate": 1.6378132417763415e-05, "loss": 1.0429896354675292, "num_input_tokens_seen": 23662329792, "step": 83200, "train_runtime": 810318.5551, "train_tokens_per_second": 29201.269 }, { "epoch": 2.944133991733874, "grad_norm": 1.640625, "learning_rate": 1.637725382386548e-05, "loss": 1.04199161529541, "num_input_tokens_seen": 23665161344, "step": 83210, "train_runtime": 810414.418, "train_tokens_per_second": 29201.308 }, { "epoch": 2.944487811997603, "grad_norm": 1.5859375, "learning_rate": 1.6376375371347118e-05, "loss": 1.0399656295776367, "num_input_tokens_seen": 23668013440, "step": 83220, "train_runtime": 810511.2748, "train_tokens_per_second": 29201.338 }, { "epoch": 2.9448416322613316, "grad_norm": 1.6953125, "learning_rate": 1.6375497060170403e-05, "loss": 1.0407147407531738, "num_input_tokens_seen": 23670866432, "step": 83230, "train_runtime": 810609.4099, "train_tokens_per_second": 29201.322 }, { "epoch": 2.9451954525250605, "grad_norm": 1.6171875, "learning_rate": 1.637461889029745e-05, "loss": 1.0501070022583008, "num_input_tokens_seen": 23673660032, "step": 83240, "train_runtime": 810703.4842, "train_tokens_per_second": 29201.379 }, { "epoch": 2.945549272788789, "grad_norm": 1.671875, "learning_rate": 1.637374086169037e-05, "loss": 1.0400890350341796, "num_input_tokens_seen": 23676509120, "step": 83250, "train_runtime": 810802.8829, "train_tokens_per_second": 29201.313 }, { "epoch": 2.945903093052518, "grad_norm": 1.546875, "learning_rate": 1.6372862974311286e-05, "loss": 1.0551732063293457, "num_input_tokens_seen": 23679353472, "step": 83260, "train_runtime": 810900.3995, "train_tokens_per_second": 29201.309 }, { "epoch": 2.9462569133162466, "grad_norm": 1.6875, "learning_rate": 1.637198522812235e-05, "loss": 1.0175580978393555, "num_input_tokens_seen": 23682166592, "step": 83270, "train_runtime": 810995.2322, "train_tokens_per_second": 29201.364 }, { "epoch": 2.9466107335799756, "grad_norm": 1.6796875, "learning_rate": 1.6371107623085722e-05, "loss": 1.0290751457214355, "num_input_tokens_seen": 23684986752, "step": 83280, "train_runtime": 811088.9562, "train_tokens_per_second": 29201.466 }, { "epoch": 2.9469645538437046, "grad_norm": 1.671875, "learning_rate": 1.637023015916356e-05, "loss": 1.0330411911010742, "num_input_tokens_seen": 23687790464, "step": 83290, "train_runtime": 811184.4892, "train_tokens_per_second": 29201.483 }, { "epoch": 2.947318374107433, "grad_norm": 1.6328125, "learning_rate": 1.636935283631807e-05, "loss": 1.0419689178466798, "num_input_tokens_seen": 23690656576, "step": 83300, "train_runtime": 811283.966, "train_tokens_per_second": 29201.436 }, { "epoch": 2.9476721943711617, "grad_norm": 1.6484375, "learning_rate": 1.6368475654511438e-05, "loss": 1.0391867637634278, "num_input_tokens_seen": 23693496896, "step": 83310, "train_runtime": 811382.3216, "train_tokens_per_second": 29201.397 }, { "epoch": 2.9480260146348907, "grad_norm": 1.5703125, "learning_rate": 1.6367598613705887e-05, "loss": 1.0370962142944335, "num_input_tokens_seen": 23696350464, "step": 83320, "train_runtime": 811482.2133, "train_tokens_per_second": 29201.318 }, { "epoch": 2.9483798348986197, "grad_norm": 1.6328125, "learning_rate": 1.636672171386364e-05, "loss": 1.0474227905273437, "num_input_tokens_seen": 23699161920, "step": 83330, "train_runtime": 811576.3861, "train_tokens_per_second": 29201.394 }, { "epoch": 2.948733655162348, "grad_norm": 1.6328125, "learning_rate": 1.6365844954946946e-05, "loss": 1.027945613861084, "num_input_tokens_seen": 23702015040, "step": 83340, "train_runtime": 811674.7638, "train_tokens_per_second": 29201.37 }, { "epoch": 2.9490874754260767, "grad_norm": 1.546875, "learning_rate": 1.6364968336918064e-05, "loss": 1.0290781021118165, "num_input_tokens_seen": 23704874816, "step": 83350, "train_runtime": 811772.1334, "train_tokens_per_second": 29201.39 }, { "epoch": 2.9494412956898057, "grad_norm": 1.5859375, "learning_rate": 1.636409185973925e-05, "loss": 1.0323095321655273, "num_input_tokens_seen": 23707676672, "step": 83360, "train_runtime": 811867.7582, "train_tokens_per_second": 29201.402 }, { "epoch": 2.9497951159535347, "grad_norm": 1.546875, "learning_rate": 1.6363215523372812e-05, "loss": 1.0296506881713867, "num_input_tokens_seen": 23710491712, "step": 83370, "train_runtime": 811962.9451, "train_tokens_per_second": 29201.446 }, { "epoch": 2.9501489362172633, "grad_norm": 1.625, "learning_rate": 1.6362339327781036e-05, "loss": 1.0371984481811523, "num_input_tokens_seen": 23713341312, "step": 83380, "train_runtime": 812060.5783, "train_tokens_per_second": 29201.444 }, { "epoch": 2.9505027564809923, "grad_norm": 1.625, "learning_rate": 1.6361463272926238e-05, "loss": 1.0407882690429688, "num_input_tokens_seen": 23716154880, "step": 83390, "train_runtime": 812156.77, "train_tokens_per_second": 29201.449 }, { "epoch": 2.950856576744721, "grad_norm": 1.578125, "learning_rate": 1.6360587358770747e-05, "loss": 1.040146255493164, "num_input_tokens_seen": 23719030144, "step": 83400, "train_runtime": 812255.7319, "train_tokens_per_second": 29201.432 }, { "epoch": 2.95121039700845, "grad_norm": 1.625, "learning_rate": 1.635971158527691e-05, "loss": 1.0358320236206056, "num_input_tokens_seen": 23721824896, "step": 83410, "train_runtime": 812350.3448, "train_tokens_per_second": 29201.471 }, { "epoch": 2.9515642172721783, "grad_norm": 1.6640625, "learning_rate": 1.6358835952407074e-05, "loss": 1.047813606262207, "num_input_tokens_seen": 23724640000, "step": 83420, "train_runtime": 812446.3442, "train_tokens_per_second": 29201.485 }, { "epoch": 2.9519180375359073, "grad_norm": 1.515625, "learning_rate": 1.6357960460123614e-05, "loss": 1.0337163925170898, "num_input_tokens_seen": 23727508160, "step": 83430, "train_runtime": 812543.4344, "train_tokens_per_second": 29201.526 }, { "epoch": 2.952271857799636, "grad_norm": 1.609375, "learning_rate": 1.6357085108388913e-05, "loss": 1.0336053848266602, "num_input_tokens_seen": 23730346240, "step": 83440, "train_runtime": 812641.6113, "train_tokens_per_second": 29201.49 }, { "epoch": 2.952625678063365, "grad_norm": 1.671875, "learning_rate": 1.6356209897165374e-05, "loss": 1.0407537460327148, "num_input_tokens_seen": 23733172224, "step": 83450, "train_runtime": 812738.597, "train_tokens_per_second": 29201.483 }, { "epoch": 2.9529794983270934, "grad_norm": 1.5234375, "learning_rate": 1.635533482641541e-05, "loss": 1.0320850372314454, "num_input_tokens_seen": 23736043904, "step": 83460, "train_runtime": 812838.3508, "train_tokens_per_second": 29201.432 }, { "epoch": 2.9533333185908224, "grad_norm": 1.6484375, "learning_rate": 1.6354459896101436e-05, "loss": 1.0169832229614257, "num_input_tokens_seen": 23738905920, "step": 83470, "train_runtime": 812939.6017, "train_tokens_per_second": 29201.316 }, { "epoch": 2.9536871388545514, "grad_norm": 1.640625, "learning_rate": 1.6353585106185908e-05, "loss": 1.031891441345215, "num_input_tokens_seen": 23741739648, "step": 83480, "train_runtime": 813037.6555, "train_tokens_per_second": 29201.279 }, { "epoch": 2.95404095911828, "grad_norm": 1.5546875, "learning_rate": 1.6352710456631275e-05, "loss": 1.0437505722045899, "num_input_tokens_seen": 23744573248, "step": 83490, "train_runtime": 813132.5993, "train_tokens_per_second": 29201.354 }, { "epoch": 2.9543947793820085, "grad_norm": 1.6171875, "learning_rate": 1.6351835947400003e-05, "loss": 1.0244093894958497, "num_input_tokens_seen": 23747442240, "step": 83500, "train_runtime": 813230.6265, "train_tokens_per_second": 29201.362 }, { "epoch": 2.9547485996457374, "grad_norm": 1.59375, "learning_rate": 1.6350961578454578e-05, "loss": 1.031100082397461, "num_input_tokens_seen": 23750253312, "step": 83510, "train_runtime": 813324.1048, "train_tokens_per_second": 29201.462 }, { "epoch": 2.9551024199094664, "grad_norm": 1.6171875, "learning_rate": 1.6350087349757494e-05, "loss": 1.0316301345825196, "num_input_tokens_seen": 23752986560, "step": 83520, "train_runtime": 813416.2332, "train_tokens_per_second": 29201.515 }, { "epoch": 2.955456240173195, "grad_norm": 1.671875, "learning_rate": 1.6349213261271268e-05, "loss": 1.0535274505615235, "num_input_tokens_seen": 23755793728, "step": 83530, "train_runtime": 813510.0248, "train_tokens_per_second": 29201.599 }, { "epoch": 2.955810060436924, "grad_norm": 1.6484375, "learning_rate": 1.634833931295842e-05, "loss": 1.0426877975463866, "num_input_tokens_seen": 23758717696, "step": 83540, "train_runtime": 813612.8274, "train_tokens_per_second": 29201.503 }, { "epoch": 2.9561638807006525, "grad_norm": 1.65625, "learning_rate": 1.6347465504781485e-05, "loss": 1.0429293632507324, "num_input_tokens_seen": 23761537792, "step": 83550, "train_runtime": 813707.2172, "train_tokens_per_second": 29201.582 }, { "epoch": 2.9565177009643815, "grad_norm": 1.625, "learning_rate": 1.634659183670303e-05, "loss": 1.0380303382873535, "num_input_tokens_seen": 23764342720, "step": 83560, "train_runtime": 813802.0589, "train_tokens_per_second": 29201.625 }, { "epoch": 2.95687152122811, "grad_norm": 1.609375, "learning_rate": 1.634571830868561e-05, "loss": 1.0393528938293457, "num_input_tokens_seen": 23767170432, "step": 83570, "train_runtime": 813898.3201, "train_tokens_per_second": 29201.646 }, { "epoch": 2.957225341491839, "grad_norm": 1.6015625, "learning_rate": 1.634484492069181e-05, "loss": 1.0295408248901368, "num_input_tokens_seen": 23770029248, "step": 83580, "train_runtime": 813998.704, "train_tokens_per_second": 29201.557 }, { "epoch": 2.9575791617555676, "grad_norm": 1.59375, "learning_rate": 1.6343971672684228e-05, "loss": 1.0261205673217773, "num_input_tokens_seen": 23772902400, "step": 83590, "train_runtime": 814097.1023, "train_tokens_per_second": 29201.556 }, { "epoch": 2.9579329820192966, "grad_norm": 1.734375, "learning_rate": 1.634309856462547e-05, "loss": 1.0408454895019532, "num_input_tokens_seen": 23775763584, "step": 83600, "train_runtime": 814196.6963, "train_tokens_per_second": 29201.498 }, { "epoch": 2.958286802283025, "grad_norm": 1.6328125, "learning_rate": 1.6342225596478154e-05, "loss": 1.0440988540649414, "num_input_tokens_seen": 23778612032, "step": 83610, "train_runtime": 814292.569, "train_tokens_per_second": 29201.558 }, { "epoch": 2.958640622546754, "grad_norm": 1.5703125, "learning_rate": 1.6341352768204925e-05, "loss": 1.034379768371582, "num_input_tokens_seen": 23781454720, "step": 83620, "train_runtime": 814391.7196, "train_tokens_per_second": 29201.494 }, { "epoch": 2.958994442810483, "grad_norm": 1.6640625, "learning_rate": 1.6340480079768432e-05, "loss": 1.0396920204162599, "num_input_tokens_seen": 23784243904, "step": 83630, "train_runtime": 814488.6613, "train_tokens_per_second": 29201.443 }, { "epoch": 2.9593482630742116, "grad_norm": 1.5703125, "learning_rate": 1.6339607531131343e-05, "loss": 1.0407211303710937, "num_input_tokens_seen": 23787060416, "step": 83640, "train_runtime": 814586.1707, "train_tokens_per_second": 29201.405 }, { "epoch": 2.95970208333794, "grad_norm": 1.53125, "learning_rate": 1.633873512225633e-05, "loss": 1.0280614852905274, "num_input_tokens_seen": 23789838016, "step": 83650, "train_runtime": 814680.1885, "train_tokens_per_second": 29201.444 }, { "epoch": 2.960055903601669, "grad_norm": 1.6171875, "learning_rate": 1.6337862853106086e-05, "loss": 1.0407819747924805, "num_input_tokens_seen": 23792624640, "step": 83660, "train_runtime": 814774.8348, "train_tokens_per_second": 29201.472 }, { "epoch": 2.960409723865398, "grad_norm": 1.6171875, "learning_rate": 1.633699072364333e-05, "loss": 1.0313257217407226, "num_input_tokens_seen": 23795411712, "step": 83670, "train_runtime": 814869.6431, "train_tokens_per_second": 29201.495 }, { "epoch": 2.9607635441291267, "grad_norm": 1.625, "learning_rate": 1.6336118733830765e-05, "loss": 1.0471054077148438, "num_input_tokens_seen": 23798338304, "step": 83680, "train_runtime": 814971.4828, "train_tokens_per_second": 29201.437 }, { "epoch": 2.9611173643928552, "grad_norm": 1.53125, "learning_rate": 1.633524688363114e-05, "loss": 1.0382051467895508, "num_input_tokens_seen": 23801185152, "step": 83690, "train_runtime": 815069.0282, "train_tokens_per_second": 29201.435 }, { "epoch": 2.961471184656584, "grad_norm": 1.546875, "learning_rate": 1.6334375173007193e-05, "loss": 1.020213508605957, "num_input_tokens_seen": 23804061376, "step": 83700, "train_runtime": 815167.6045, "train_tokens_per_second": 29201.432 }, { "epoch": 2.961825004920313, "grad_norm": 1.671875, "learning_rate": 1.6333503601921697e-05, "loss": 1.030905055999756, "num_input_tokens_seen": 23806873920, "step": 83710, "train_runtime": 815266.434, "train_tokens_per_second": 29201.342 }, { "epoch": 2.9621788251840417, "grad_norm": 1.5703125, "learning_rate": 1.6332632170337422e-05, "loss": 1.0365280151367187, "num_input_tokens_seen": 23809774912, "step": 83720, "train_runtime": 815369.3529, "train_tokens_per_second": 29201.214 }, { "epoch": 2.9625326454477707, "grad_norm": 1.6484375, "learning_rate": 1.6331760878217162e-05, "loss": 1.0395414352416992, "num_input_tokens_seen": 23812611520, "step": 83730, "train_runtime": 815463.3186, "train_tokens_per_second": 29201.328 }, { "epoch": 2.9628864657114993, "grad_norm": 1.5859375, "learning_rate": 1.6330889725523713e-05, "loss": 1.033464241027832, "num_input_tokens_seen": 23815486784, "step": 83740, "train_runtime": 815563.8022, "train_tokens_per_second": 29201.255 }, { "epoch": 2.9632402859752283, "grad_norm": 1.6015625, "learning_rate": 1.6330018712219902e-05, "loss": 1.037591552734375, "num_input_tokens_seen": 23818351040, "step": 83750, "train_runtime": 815660.8058, "train_tokens_per_second": 29201.294 }, { "epoch": 2.963594106238957, "grad_norm": 1.6171875, "learning_rate": 1.632914783826856e-05, "loss": 1.0326713562011718, "num_input_tokens_seen": 23821142784, "step": 83760, "train_runtime": 815754.1138, "train_tokens_per_second": 29201.376 }, { "epoch": 2.963947926502686, "grad_norm": 1.578125, "learning_rate": 1.632827710363253e-05, "loss": 1.0370306015014648, "num_input_tokens_seen": 23823973440, "step": 83770, "train_runtime": 815852.3666, "train_tokens_per_second": 29201.329 }, { "epoch": 2.9643017467664143, "grad_norm": 1.6796875, "learning_rate": 1.632740650827467e-05, "loss": 1.0479924201965332, "num_input_tokens_seen": 23826783360, "step": 83780, "train_runtime": 815947.1019, "train_tokens_per_second": 29201.382 }, { "epoch": 2.9646555670301433, "grad_norm": 1.6953125, "learning_rate": 1.632653605215786e-05, "loss": 1.023562240600586, "num_input_tokens_seen": 23829662080, "step": 83790, "train_runtime": 816048.3115, "train_tokens_per_second": 29201.288 }, { "epoch": 2.965009387293872, "grad_norm": 1.6484375, "learning_rate": 1.6325665735244984e-05, "loss": 1.0211713790893555, "num_input_tokens_seen": 23832484480, "step": 83800, "train_runtime": 816145.0025, "train_tokens_per_second": 29201.287 }, { "epoch": 2.965363207557601, "grad_norm": 1.5546875, "learning_rate": 1.6324795557498935e-05, "loss": 1.0427845954895019, "num_input_tokens_seen": 23835282624, "step": 83810, "train_runtime": 816239.0129, "train_tokens_per_second": 29201.352 }, { "epoch": 2.96571702782133, "grad_norm": 1.6328125, "learning_rate": 1.6323925518882646e-05, "loss": 1.0471160888671875, "num_input_tokens_seen": 23838149952, "step": 83820, "train_runtime": 816338.1456, "train_tokens_per_second": 29201.318 }, { "epoch": 2.9660708480850584, "grad_norm": 1.625, "learning_rate": 1.632305561935903e-05, "loss": 1.0438769340515137, "num_input_tokens_seen": 23840988480, "step": 83830, "train_runtime": 816436.6775, "train_tokens_per_second": 29201.271 }, { "epoch": 2.966424668348787, "grad_norm": 1.65625, "learning_rate": 1.632218585889104e-05, "loss": 1.0327733993530273, "num_input_tokens_seen": 23843888640, "step": 83840, "train_runtime": 816536.7651, "train_tokens_per_second": 29201.243 }, { "epoch": 2.966778488612516, "grad_norm": 1.59375, "learning_rate": 1.6321316237441624e-05, "loss": 1.038883113861084, "num_input_tokens_seen": 23846769472, "step": 83850, "train_runtime": 816636.8666, "train_tokens_per_second": 29201.191 }, { "epoch": 2.967132308876245, "grad_norm": 1.6875, "learning_rate": 1.632044675497376e-05, "loss": 1.0322915077209474, "num_input_tokens_seen": 23849633408, "step": 83860, "train_runtime": 816734.2909, "train_tokens_per_second": 29201.215 }, { "epoch": 2.9674861291399734, "grad_norm": 1.6640625, "learning_rate": 1.6319577411450427e-05, "loss": 1.0376972198486327, "num_input_tokens_seen": 23852474496, "step": 83870, "train_runtime": 816833.3151, "train_tokens_per_second": 29201.153 }, { "epoch": 2.9678399494037024, "grad_norm": 1.625, "learning_rate": 1.631870820683463e-05, "loss": 1.036899948120117, "num_input_tokens_seen": 23855295936, "step": 83880, "train_runtime": 816928.0384, "train_tokens_per_second": 29201.221 }, { "epoch": 2.968193769667431, "grad_norm": 1.65625, "learning_rate": 1.6317839141089375e-05, "loss": 1.0414960861206055, "num_input_tokens_seen": 23858154432, "step": 83890, "train_runtime": 817027.2403, "train_tokens_per_second": 29201.174 }, { "epoch": 2.96854758993116, "grad_norm": 1.609375, "learning_rate": 1.6316970214177686e-05, "loss": 1.0340216636657715, "num_input_tokens_seen": 23861043520, "step": 83900, "train_runtime": 817126.8337, "train_tokens_per_second": 29201.15 }, { "epoch": 2.9689014101948885, "grad_norm": 1.546875, "learning_rate": 1.6316101426062604e-05, "loss": 1.0428642272949218, "num_input_tokens_seen": 23863870976, "step": 83910, "train_runtime": 817225.9734, "train_tokens_per_second": 29201.068 }, { "epoch": 2.9692552304586175, "grad_norm": 1.6640625, "learning_rate": 1.6315232776707187e-05, "loss": 1.0439083099365234, "num_input_tokens_seen": 23866709632, "step": 83920, "train_runtime": 817321.2793, "train_tokens_per_second": 29201.136 }, { "epoch": 2.969609050722346, "grad_norm": 1.59375, "learning_rate": 1.63143642660745e-05, "loss": 1.0401698112487794, "num_input_tokens_seen": 23869575552, "step": 83930, "train_runtime": 817419.0257, "train_tokens_per_second": 29201.15 }, { "epoch": 2.969962870986075, "grad_norm": 1.6171875, "learning_rate": 1.631349589412762e-05, "loss": 1.0308097839355468, "num_input_tokens_seen": 23872414336, "step": 83940, "train_runtime": 817516.4469, "train_tokens_per_second": 29201.143 }, { "epoch": 2.9703166912498036, "grad_norm": 1.5703125, "learning_rate": 1.631262766082964e-05, "loss": 1.0370325088500976, "num_input_tokens_seen": 23875271040, "step": 83950, "train_runtime": 817613.9917, "train_tokens_per_second": 29201.153 }, { "epoch": 2.9706705115135326, "grad_norm": 1.71875, "learning_rate": 1.631175956614368e-05, "loss": 1.0424533843994142, "num_input_tokens_seen": 23878081408, "step": 83960, "train_runtime": 817710.6585, "train_tokens_per_second": 29201.138 }, { "epoch": 2.9710243317772616, "grad_norm": 1.671875, "learning_rate": 1.6310891610032843e-05, "loss": 1.0304970741271973, "num_input_tokens_seen": 23880967424, "step": 83970, "train_runtime": 817809.2136, "train_tokens_per_second": 29201.147 }, { "epoch": 2.97137815204099, "grad_norm": 1.6171875, "learning_rate": 1.6310023792460282e-05, "loss": 1.035243034362793, "num_input_tokens_seen": 23883809984, "step": 83980, "train_runtime": 817903.8494, "train_tokens_per_second": 29201.244 }, { "epoch": 2.9717319723047186, "grad_norm": 1.5703125, "learning_rate": 1.630915611338914e-05, "loss": 1.0332615852355957, "num_input_tokens_seen": 23886686784, "step": 83990, "train_runtime": 818005.1137, "train_tokens_per_second": 29201.146 }, { "epoch": 2.9720857925684476, "grad_norm": 1.578125, "learning_rate": 1.6308288572782576e-05, "loss": 1.0409120559692382, "num_input_tokens_seen": 23889513152, "step": 84000, "train_runtime": 818103.0032, "train_tokens_per_second": 29201.107 }, { "epoch": 2.9724396128321766, "grad_norm": 1.53125, "learning_rate": 1.6307421170603776e-05, "loss": 1.0313928604125977, "num_input_tokens_seen": 23892358592, "step": 84010, "train_runtime": 818200.3783, "train_tokens_per_second": 29201.109 }, { "epoch": 2.972793433095905, "grad_norm": 1.65625, "learning_rate": 1.630655390681592e-05, "loss": 1.0481962203979491, "num_input_tokens_seen": 23895242368, "step": 84020, "train_runtime": 818298.8259, "train_tokens_per_second": 29201.12 }, { "epoch": 2.9731472533596337, "grad_norm": 1.609375, "learning_rate": 1.6305686781382223e-05, "loss": 1.0338308334350585, "num_input_tokens_seen": 23898074240, "step": 84030, "train_runtime": 818393.3536, "train_tokens_per_second": 29201.208 }, { "epoch": 2.9735010736233627, "grad_norm": 1.5625, "learning_rate": 1.6304819794265894e-05, "loss": 1.0428453445434571, "num_input_tokens_seen": 23900947776, "step": 84040, "train_runtime": 818493.7128, "train_tokens_per_second": 29201.138 }, { "epoch": 2.9738548938870917, "grad_norm": 1.5625, "learning_rate": 1.630395294543017e-05, "loss": 1.0501089096069336, "num_input_tokens_seen": 23903795648, "step": 84050, "train_runtime": 818591.6396, "train_tokens_per_second": 29201.124 }, { "epoch": 2.97420871415082, "grad_norm": 1.59375, "learning_rate": 1.6303086234838297e-05, "loss": 1.0355937004089355, "num_input_tokens_seen": 23906608384, "step": 84060, "train_runtime": 818688.7845, "train_tokens_per_second": 29201.094 }, { "epoch": 2.974562534414549, "grad_norm": 1.6484375, "learning_rate": 1.6302219662453528e-05, "loss": 1.0426020622253418, "num_input_tokens_seen": 23909471936, "step": 84070, "train_runtime": 818786.2443, "train_tokens_per_second": 29201.116 }, { "epoch": 2.9749163546782778, "grad_norm": 1.671875, "learning_rate": 1.6301353228239137e-05, "loss": 1.0484376907348634, "num_input_tokens_seen": 23912263040, "step": 84080, "train_runtime": 818880.8979, "train_tokens_per_second": 29201.149 }, { "epoch": 2.9752701749420067, "grad_norm": 1.6484375, "learning_rate": 1.630048693215842e-05, "loss": 1.0321388244628906, "num_input_tokens_seen": 23915095168, "step": 84090, "train_runtime": 818979.1326, "train_tokens_per_second": 29201.104 }, { "epoch": 2.9756239952057353, "grad_norm": 1.578125, "learning_rate": 1.6299620774174663e-05, "loss": 1.0377731323242188, "num_input_tokens_seen": 23917917952, "step": 84100, "train_runtime": 819072.5947, "train_tokens_per_second": 29201.219 }, { "epoch": 2.9759778154694643, "grad_norm": 1.6484375, "learning_rate": 1.6298754754251192e-05, "loss": 1.0273590087890625, "num_input_tokens_seen": 23920775040, "step": 84110, "train_runtime": 819172.6021, "train_tokens_per_second": 29201.141 }, { "epoch": 2.9763316357331933, "grad_norm": 1.671875, "learning_rate": 1.6297888872351324e-05, "loss": 1.0324262619018554, "num_input_tokens_seen": 23923597440, "step": 84120, "train_runtime": 819267.9632, "train_tokens_per_second": 29201.188 }, { "epoch": 2.976685455996922, "grad_norm": 1.640625, "learning_rate": 1.6297023128438407e-05, "loss": 1.0222408294677734, "num_input_tokens_seen": 23926424320, "step": 84130, "train_runtime": 819362.5536, "train_tokens_per_second": 29201.267 }, { "epoch": 2.9770392762606503, "grad_norm": 1.6484375, "learning_rate": 1.6296157522475794e-05, "loss": 1.0209815979003907, "num_input_tokens_seen": 23929324800, "step": 84140, "train_runtime": 819464.9014, "train_tokens_per_second": 29201.159 }, { "epoch": 2.9773930965243793, "grad_norm": 1.6875, "learning_rate": 1.629529205442685e-05, "loss": 1.0476024627685547, "num_input_tokens_seen": 23932135424, "step": 84150, "train_runtime": 819558.5141, "train_tokens_per_second": 29201.253 }, { "epoch": 2.9777469167881083, "grad_norm": 1.6484375, "learning_rate": 1.629442672425496e-05, "loss": 1.0290684700012207, "num_input_tokens_seen": 23934969664, "step": 84160, "train_runtime": 819656.7552, "train_tokens_per_second": 29201.211 }, { "epoch": 2.978100737051837, "grad_norm": 1.5859375, "learning_rate": 1.6293561531923517e-05, "loss": 1.029268455505371, "num_input_tokens_seen": 23937865792, "step": 84170, "train_runtime": 819757.9142, "train_tokens_per_second": 29201.14 }, { "epoch": 2.9784545573155654, "grad_norm": 1.5546875, "learning_rate": 1.6292696477395934e-05, "loss": 1.0444313049316407, "num_input_tokens_seen": 23940704256, "step": 84180, "train_runtime": 819852.2512, "train_tokens_per_second": 29201.242 }, { "epoch": 2.9788083775792944, "grad_norm": 1.5546875, "learning_rate": 1.6291831560635628e-05, "loss": 1.0373075485229493, "num_input_tokens_seen": 23943607104, "step": 84190, "train_runtime": 819954.4493, "train_tokens_per_second": 29201.143 }, { "epoch": 2.9791621978430234, "grad_norm": 1.625, "learning_rate": 1.6290966781606043e-05, "loss": 1.040273952484131, "num_input_tokens_seen": 23946468992, "step": 84200, "train_runtime": 820054.3418, "train_tokens_per_second": 29201.076 }, { "epoch": 2.979516018106752, "grad_norm": 1.6171875, "learning_rate": 1.6290102140270622e-05, "loss": 1.0225068092346192, "num_input_tokens_seen": 23949304768, "step": 84210, "train_runtime": 820152.2878, "train_tokens_per_second": 29201.046 }, { "epoch": 2.979869838370481, "grad_norm": 1.5859375, "learning_rate": 1.6289237636592827e-05, "loss": 1.0325600624084472, "num_input_tokens_seen": 23952142016, "step": 84220, "train_runtime": 820250.9879, "train_tokens_per_second": 29200.991 }, { "epoch": 2.9802236586342095, "grad_norm": 1.6171875, "learning_rate": 1.628837327053614e-05, "loss": 1.0378568649291993, "num_input_tokens_seen": 23955013248, "step": 84230, "train_runtime": 820349.6948, "train_tokens_per_second": 29200.978 }, { "epoch": 2.9805774788979384, "grad_norm": 1.6328125, "learning_rate": 1.6287509042064053e-05, "loss": 1.021855640411377, "num_input_tokens_seen": 23957892288, "step": 84240, "train_runtime": 820451.2877, "train_tokens_per_second": 29200.871 }, { "epoch": 2.980931299161667, "grad_norm": 1.640625, "learning_rate": 1.6286644951140067e-05, "loss": 1.036000633239746, "num_input_tokens_seen": 23960771200, "step": 84250, "train_runtime": 820549.8239, "train_tokens_per_second": 29200.873 }, { "epoch": 2.981285119425396, "grad_norm": 1.5859375, "learning_rate": 1.6285780997727696e-05, "loss": 1.039645290374756, "num_input_tokens_seen": 23963668736, "step": 84260, "train_runtime": 820647.454, "train_tokens_per_second": 29200.93 }, { "epoch": 2.9816389396891245, "grad_norm": 1.6015625, "learning_rate": 1.6284917181790476e-05, "loss": 1.037799072265625, "num_input_tokens_seen": 23966484160, "step": 84270, "train_runtime": 820742.6188, "train_tokens_per_second": 29200.974 }, { "epoch": 2.9819927599528535, "grad_norm": 1.5859375, "learning_rate": 1.628405350329195e-05, "loss": 1.0435062408447267, "num_input_tokens_seen": 23969362176, "step": 84280, "train_runtime": 820841.3804, "train_tokens_per_second": 29200.967 }, { "epoch": 2.982346580216582, "grad_norm": 1.625, "learning_rate": 1.628318996219568e-05, "loss": 1.0404690742492675, "num_input_tokens_seen": 23972235456, "step": 84290, "train_runtime": 820941.4159, "train_tokens_per_second": 29200.909 }, { "epoch": 2.982700400480311, "grad_norm": 1.6875, "learning_rate": 1.628232655846523e-05, "loss": 1.0426322937011718, "num_input_tokens_seen": 23975004352, "step": 84300, "train_runtime": 821037.4587, "train_tokens_per_second": 29200.865 }, { "epoch": 2.98305422074404, "grad_norm": 1.671875, "learning_rate": 1.6281463292064193e-05, "loss": 1.0507189750671386, "num_input_tokens_seen": 23977789120, "step": 84310, "train_runtime": 821132.1187, "train_tokens_per_second": 29200.891 }, { "epoch": 2.9834080410077686, "grad_norm": 1.578125, "learning_rate": 1.628060016295616e-05, "loss": 1.0124247550964356, "num_input_tokens_seen": 23980638016, "step": 84320, "train_runtime": 821233.089, "train_tokens_per_second": 29200.769 }, { "epoch": 2.983761861271497, "grad_norm": 1.59375, "learning_rate": 1.6279737171104752e-05, "loss": 1.0482660293579102, "num_input_tokens_seen": 23983545536, "step": 84330, "train_runtime": 821332.3071, "train_tokens_per_second": 29200.782 }, { "epoch": 2.984115681535226, "grad_norm": 1.65625, "learning_rate": 1.6278874316473593e-05, "loss": 1.0426139831542969, "num_input_tokens_seen": 23986342400, "step": 84340, "train_runtime": 821427.3751, "train_tokens_per_second": 29200.807 }, { "epoch": 2.984469501798955, "grad_norm": 1.5703125, "learning_rate": 1.6278011599026314e-05, "loss": 1.037677001953125, "num_input_tokens_seen": 23989209536, "step": 84350, "train_runtime": 821526.6637, "train_tokens_per_second": 29200.768 }, { "epoch": 2.9848233220626836, "grad_norm": 1.6171875, "learning_rate": 1.627714901872657e-05, "loss": 1.0412812232971191, "num_input_tokens_seen": 23992052352, "step": 84360, "train_runtime": 821621.2517, "train_tokens_per_second": 29200.866 }, { "epoch": 2.9851771423264126, "grad_norm": 1.578125, "learning_rate": 1.627628657553804e-05, "loss": 1.0412015914916992, "num_input_tokens_seen": 23994967104, "step": 84370, "train_runtime": 821724.3638, "train_tokens_per_second": 29200.749 }, { "epoch": 2.985530962590141, "grad_norm": 1.5625, "learning_rate": 1.627542426942439e-05, "loss": 1.0342002868652345, "num_input_tokens_seen": 23997814592, "step": 84380, "train_runtime": 821819.8224, "train_tokens_per_second": 29200.822 }, { "epoch": 2.98588478285387, "grad_norm": 1.5859375, "learning_rate": 1.627456210034932e-05, "loss": 1.0339414596557617, "num_input_tokens_seen": 24000678208, "step": 84390, "train_runtime": 821918.0364, "train_tokens_per_second": 29200.817 }, { "epoch": 2.9862386031175987, "grad_norm": 1.6171875, "learning_rate": 1.6273700068276534e-05, "loss": 1.0284908294677735, "num_input_tokens_seen": 24003519680, "step": 84400, "train_runtime": 822016.1954, "train_tokens_per_second": 29200.787 }, { "epoch": 2.9865924233813277, "grad_norm": 1.6015625, "learning_rate": 1.6272838173169752e-05, "loss": 1.0417510986328125, "num_input_tokens_seen": 24006336896, "step": 84410, "train_runtime": 822107.1646, "train_tokens_per_second": 29200.982 }, { "epoch": 2.9869462436450562, "grad_norm": 1.59375, "learning_rate": 1.627197641499271e-05, "loss": 1.0412151336669921, "num_input_tokens_seen": 24009124224, "step": 84420, "train_runtime": 822201.7038, "train_tokens_per_second": 29201.015 }, { "epoch": 2.987300063908785, "grad_norm": 1.640625, "learning_rate": 1.6271114793709146e-05, "loss": 1.0387316703796388, "num_input_tokens_seen": 24011981888, "step": 84430, "train_runtime": 822297.6252, "train_tokens_per_second": 29201.084 }, { "epoch": 2.9876538841725138, "grad_norm": 1.6171875, "learning_rate": 1.6270253309282836e-05, "loss": 1.0334922790527343, "num_input_tokens_seen": 24014828672, "step": 84440, "train_runtime": 822395.2338, "train_tokens_per_second": 29201.08 }, { "epoch": 2.9880077044362428, "grad_norm": 1.578125, "learning_rate": 1.626939196167754e-05, "loss": 1.0276421546936034, "num_input_tokens_seen": 24017713280, "step": 84450, "train_runtime": 822494.0673, "train_tokens_per_second": 29201.078 }, { "epoch": 2.9883615246999717, "grad_norm": 1.796875, "learning_rate": 1.6268530750857053e-05, "loss": 1.0436725616455078, "num_input_tokens_seen": 24020520128, "step": 84460, "train_runtime": 822589.5058, "train_tokens_per_second": 29201.102 }, { "epoch": 2.9887153449637003, "grad_norm": 1.609375, "learning_rate": 1.6267669676785175e-05, "loss": 1.029702854156494, "num_input_tokens_seen": 24023329728, "step": 84470, "train_runtime": 822685.6995, "train_tokens_per_second": 29201.103 }, { "epoch": 2.989069165227429, "grad_norm": 1.625, "learning_rate": 1.6266808739425716e-05, "loss": 1.0219280242919921, "num_input_tokens_seen": 24026236160, "step": 84480, "train_runtime": 822788.4264, "train_tokens_per_second": 29200.989 }, { "epoch": 2.989422985491158, "grad_norm": 1.6015625, "learning_rate": 1.6265947938742507e-05, "loss": 1.0317282676696777, "num_input_tokens_seen": 24029062336, "step": 84490, "train_runtime": 822886.7261, "train_tokens_per_second": 29200.936 }, { "epoch": 2.989776805754887, "grad_norm": 1.6015625, "learning_rate": 1.6265087274699387e-05, "loss": 1.0504442214965821, "num_input_tokens_seen": 24031888384, "step": 84500, "train_runtime": 822986.9948, "train_tokens_per_second": 29200.812 }, { "epoch": 2.9901306260186153, "grad_norm": 1.625, "learning_rate": 1.626422674726021e-05, "loss": 1.033837890625, "num_input_tokens_seen": 24034728064, "step": 84510, "train_runtime": 823083.1907, "train_tokens_per_second": 29200.849 }, { "epoch": 2.990484446282344, "grad_norm": 1.5390625, "learning_rate": 1.6263366356388846e-05, "loss": 1.0366727828979492, "num_input_tokens_seen": 24037534720, "step": 84520, "train_runtime": 823179.209, "train_tokens_per_second": 29200.853 }, { "epoch": 2.990838266546073, "grad_norm": 1.6484375, "learning_rate": 1.626250610204918e-05, "loss": 1.0387153625488281, "num_input_tokens_seen": 24040405760, "step": 84530, "train_runtime": 823279.2355, "train_tokens_per_second": 29200.792 }, { "epoch": 2.991192086809802, "grad_norm": 1.625, "learning_rate": 1.6261645984205095e-05, "loss": 1.033730697631836, "num_input_tokens_seen": 24043297024, "step": 84540, "train_runtime": 823382.027, "train_tokens_per_second": 29200.658 }, { "epoch": 2.9915459070735304, "grad_norm": 1.6328125, "learning_rate": 1.6260786002820508e-05, "loss": 1.0389947891235352, "num_input_tokens_seen": 24046108160, "step": 84550, "train_runtime": 823478.479, "train_tokens_per_second": 29200.652 }, { "epoch": 2.9918997273372594, "grad_norm": 1.5703125, "learning_rate": 1.6259926157859336e-05, "loss": 1.0464378356933595, "num_input_tokens_seen": 24049044672, "step": 84560, "train_runtime": 823580.6675, "train_tokens_per_second": 29200.594 }, { "epoch": 2.992253547600988, "grad_norm": 1.6484375, "learning_rate": 1.625906644928552e-05, "loss": 1.0460453033447266, "num_input_tokens_seen": 24051938048, "step": 84570, "train_runtime": 823682.3684, "train_tokens_per_second": 29200.501 }, { "epoch": 2.992607367864717, "grad_norm": 1.5703125, "learning_rate": 1.6258206877062995e-05, "loss": 1.03430118560791, "num_input_tokens_seen": 24054786176, "step": 84580, "train_runtime": 823779.2201, "train_tokens_per_second": 29200.526 }, { "epoch": 2.9929611881284455, "grad_norm": 1.5859375, "learning_rate": 1.6257347441155738e-05, "loss": 1.046249008178711, "num_input_tokens_seen": 24057639360, "step": 84590, "train_runtime": 823876.2804, "train_tokens_per_second": 29200.549 }, { "epoch": 2.9933150083921745, "grad_norm": 1.6171875, "learning_rate": 1.625648814152771e-05, "loss": 1.031470489501953, "num_input_tokens_seen": 24060529600, "step": 84600, "train_runtime": 823977.1976, "train_tokens_per_second": 29200.48 }, { "epoch": 2.993668828655903, "grad_norm": 1.6953125, "learning_rate": 1.6255628978142908e-05, "loss": 1.0271507263183595, "num_input_tokens_seen": 24063329024, "step": 84610, "train_runtime": 824069.6227, "train_tokens_per_second": 29200.602 }, { "epoch": 2.994022648919632, "grad_norm": 1.734375, "learning_rate": 1.6254769950965327e-05, "loss": 1.0327853202819823, "num_input_tokens_seen": 24066189824, "step": 84620, "train_runtime": 824166.7065, "train_tokens_per_second": 29200.633 }, { "epoch": 2.9943764691833605, "grad_norm": 1.625, "learning_rate": 1.6253911059958986e-05, "loss": 1.0484712600708008, "num_input_tokens_seen": 24069068992, "step": 84630, "train_runtime": 824265.576, "train_tokens_per_second": 29200.624 }, { "epoch": 2.9947302894470895, "grad_norm": 1.578125, "learning_rate": 1.625305230508791e-05, "loss": 1.034200096130371, "num_input_tokens_seen": 24071887808, "step": 84640, "train_runtime": 824359.5993, "train_tokens_per_second": 29200.713 }, { "epoch": 2.9950841097108185, "grad_norm": 1.75, "learning_rate": 1.625219368631614e-05, "loss": 1.0386927604675293, "num_input_tokens_seen": 24074699776, "step": 84650, "train_runtime": 824454.4296, "train_tokens_per_second": 29200.765 }, { "epoch": 2.995437929974547, "grad_norm": 1.6015625, "learning_rate": 1.6251335203607734e-05, "loss": 1.0473630905151368, "num_input_tokens_seen": 24077558400, "step": 84660, "train_runtime": 824553.7407, "train_tokens_per_second": 29200.715 }, { "epoch": 2.9957917502382756, "grad_norm": 1.5390625, "learning_rate": 1.6250476856926757e-05, "loss": 1.0421865463256836, "num_input_tokens_seen": 24080440832, "step": 84670, "train_runtime": 824653.543, "train_tokens_per_second": 29200.676 }, { "epoch": 2.9961455705020046, "grad_norm": 1.65625, "learning_rate": 1.6249618646237292e-05, "loss": 1.0359792709350586, "num_input_tokens_seen": 24083276032, "step": 84680, "train_runtime": 824752.48, "train_tokens_per_second": 29200.611 }, { "epoch": 2.9964993907657336, "grad_norm": 1.6015625, "learning_rate": 1.624876057150343e-05, "loss": 1.0325206756591796, "num_input_tokens_seen": 24086081344, "step": 84690, "train_runtime": 824847.5024, "train_tokens_per_second": 29200.648 }, { "epoch": 2.996853211029462, "grad_norm": 1.65625, "learning_rate": 1.624790263268928e-05, "loss": 1.0359966278076171, "num_input_tokens_seen": 24088907200, "step": 84700, "train_runtime": 824942.1467, "train_tokens_per_second": 29200.723 }, { "epoch": 2.997207031293191, "grad_norm": 1.625, "learning_rate": 1.6247044829758963e-05, "loss": 1.027275276184082, "num_input_tokens_seen": 24091731584, "step": 84710, "train_runtime": 825038.2099, "train_tokens_per_second": 29200.746 }, { "epoch": 2.9975608515569196, "grad_norm": 1.609375, "learning_rate": 1.6246187162676616e-05, "loss": 1.0346318244934083, "num_input_tokens_seen": 24094547328, "step": 84720, "train_runtime": 825131.2872, "train_tokens_per_second": 29200.865 }, { "epoch": 2.9979146718206486, "grad_norm": 1.546875, "learning_rate": 1.624532963140638e-05, "loss": 1.0331748008728028, "num_input_tokens_seen": 24097437120, "step": 84730, "train_runtime": 825233.6004, "train_tokens_per_second": 29200.746 }, { "epoch": 2.998268492084377, "grad_norm": 1.5546875, "learning_rate": 1.6244472235912418e-05, "loss": 1.0209616661071776, "num_input_tokens_seen": 24100316032, "step": 84740, "train_runtime": 825332.9529, "train_tokens_per_second": 29200.719 }, { "epoch": 2.998622312348106, "grad_norm": 1.546875, "learning_rate": 1.624361497615891e-05, "loss": 1.0485048294067383, "num_input_tokens_seen": 24103207808, "step": 84750, "train_runtime": 825434.7476, "train_tokens_per_second": 29200.622 }, { "epoch": 2.9989761326118347, "grad_norm": 1.6171875, "learning_rate": 1.624275785211003e-05, "loss": 1.046034049987793, "num_input_tokens_seen": 24106077248, "step": 84760, "train_runtime": 825534.5905, "train_tokens_per_second": 29200.566 }, { "epoch": 2.9993299528755637, "grad_norm": 1.6484375, "learning_rate": 1.624190086372999e-05, "loss": 1.0432168960571289, "num_input_tokens_seen": 24108912320, "step": 84770, "train_runtime": 825630.5476, "train_tokens_per_second": 29200.606 }, { "epoch": 2.9996837731392922, "grad_norm": 1.59375, "learning_rate": 1.6241044010982998e-05, "loss": 1.0395265579223634, "num_input_tokens_seen": 24111758528, "step": 84780, "train_runtime": 825726.0656, "train_tokens_per_second": 29200.675 }, { "epoch": 3.0, "eval_loss": 1.02244234085083, "eval_runtime": 8.4934, "eval_samples_per_second": 469.541, "eval_steps_per_second": 3.768, "num_input_tokens_seen": 24114289216, "step": 84789 }, { "epoch": 3.0, "num_input_tokens_seen": 24114289216, "step": 84789, "total_flos": 4.014701818973667e+20, "train_loss": 1.068974989199425, "train_runtime": 825845.889, "train_samples_per_second": 105.133, "train_steps_per_second": 0.103 } ], "logging_steps": 10, "max_steps": 84789, "num_input_tokens_seen": 24114289216, "num_train_epochs": 3, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.014701818973667e+20, "train_batch_size": 8, "trial_name": null, "trial_params": null }