{ "best_global_step": 75000, "best_metric": 0.33609068393707275, "best_model_checkpoint": "/workspace/MT_En_Multilingual/checkpoint-75000", "epoch": 3.0, "eval_steps": 5000, "global_step": 84789, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0003538202637287791, "grad_norm": 1.5, "learning_rate": 4.9977515176118345e-05, "loss": 1.0859756469726562, "num_input_tokens_seen": 2861504, "step": 10, "train_runtime": 106.9904, "train_tokens_per_second": 26745.424 }, { "epoch": 0.0007076405274575581, "grad_norm": 0.90625, "learning_rate": 4.9952567580506e-05, "loss": 0.8924098968505859, "num_input_tokens_seen": 5659264, "step": 20, "train_runtime": 200.1545, "train_tokens_per_second": 28274.476 }, { "epoch": 0.0010614607911863373, "grad_norm": 0.828125, "learning_rate": 4.992765730738634e-05, "loss": 0.8380861282348633, "num_input_tokens_seen": 8484416, "step": 30, "train_runtime": 298.1801, "train_tokens_per_second": 28453.997 }, { "epoch": 0.0014152810549151163, "grad_norm": 0.76953125, "learning_rate": 4.9902784263792476e-05, "loss": 0.8041961669921875, "num_input_tokens_seen": 11342464, "step": 40, "train_runtime": 395.2287, "train_tokens_per_second": 28698.484 }, { "epoch": 0.0017691013186438955, "grad_norm": 0.796875, "learning_rate": 4.987794835708133e-05, "loss": 0.7847923755645752, "num_input_tokens_seen": 14208000, "step": 50, "train_runtime": 492.4151, "train_tokens_per_second": 28853.703 }, { "epoch": 0.0021229215823726747, "grad_norm": 0.80859375, "learning_rate": 4.985314949493234e-05, "loss": 0.761699104309082, "num_input_tokens_seen": 17070848, "step": 60, "train_runtime": 590.3487, "train_tokens_per_second": 28916.55 }, { "epoch": 0.0024767418461014534, "grad_norm": 0.80078125, "learning_rate": 4.982838758534584e-05, "loss": 0.7455968856811523, "num_input_tokens_seen": 19876352, "step": 70, "train_runtime": 685.2112, "train_tokens_per_second": 29007.628 }, { "epoch": 0.0028305621098302326, "grad_norm": 0.73828125, "learning_rate": 4.980366253664179e-05, "loss": 0.7417703628540039, "num_input_tokens_seen": 22738816, "step": 80, "train_runtime": 783.207, "train_tokens_per_second": 29032.959 }, { "epoch": 0.0031843823735590118, "grad_norm": 0.76953125, "learning_rate": 4.977897425745825e-05, "loss": 0.7280791759490967, "num_input_tokens_seen": 25550720, "step": 90, "train_runtime": 882.6487, "train_tokens_per_second": 28947.778 }, { "epoch": 0.003538202637287791, "grad_norm": 0.84375, "learning_rate": 4.975432265674997e-05, "loss": 0.7208812713623047, "num_input_tokens_seen": 28315520, "step": 100, "train_runtime": 977.2817, "train_tokens_per_second": 28973.755 }, { "epoch": 0.0038920229010165697, "grad_norm": 0.76171875, "learning_rate": 4.972970764378705e-05, "loss": 0.7049215316772461, "num_input_tokens_seen": 31176512, "step": 110, "train_runtime": 1074.9122, "train_tokens_per_second": 29003.774 }, { "epoch": 0.004245843164745349, "grad_norm": 0.72265625, "learning_rate": 4.970512912815344e-05, "loss": 0.6969927787780762, "num_input_tokens_seen": 34090624, "step": 120, "train_runtime": 1177.7235, "train_tokens_per_second": 28946.205 }, { "epoch": 0.004599663428474128, "grad_norm": 0.78125, "learning_rate": 4.968058701974564e-05, "loss": 0.6911009311676025, "num_input_tokens_seen": 36877632, "step": 130, "train_runtime": 1272.0223, "train_tokens_per_second": 28991.34 }, { "epoch": 0.004953483692202907, "grad_norm": 0.7578125, "learning_rate": 4.96560812287712e-05, "loss": 0.6851213455200196, "num_input_tokens_seen": 39719808, "step": 140, "train_runtime": 1371.1951, "train_tokens_per_second": 28967.291 }, { "epoch": 0.005307303955931686, "grad_norm": 0.703125, "learning_rate": 4.963161166574748e-05, "loss": 0.6843182563781738, "num_input_tokens_seen": 42594048, "step": 150, "train_runtime": 1471.095, "train_tokens_per_second": 28953.976 }, { "epoch": 0.005661124219660465, "grad_norm": 0.75390625, "learning_rate": 4.960717824150013e-05, "loss": 0.6695240020751954, "num_input_tokens_seen": 45422080, "step": 160, "train_runtime": 1566.1419, "train_tokens_per_second": 29002.532 }, { "epoch": 0.006014944483389244, "grad_norm": 0.765625, "learning_rate": 4.9582780867161893e-05, "loss": 0.6712607383728028, "num_input_tokens_seen": 48225408, "step": 170, "train_runtime": 1660.613, "train_tokens_per_second": 29040.727 }, { "epoch": 0.0063687647471180235, "grad_norm": 0.703125, "learning_rate": 4.955841945417105e-05, "loss": 0.6608043670654297, "num_input_tokens_seen": 51081536, "step": 180, "train_runtime": 1756.5585, "train_tokens_per_second": 29080.465 }, { "epoch": 0.006722585010846802, "grad_norm": 0.7421875, "learning_rate": 4.953409391427024e-05, "loss": 0.6619660377502441, "num_input_tokens_seen": 53934336, "step": 190, "train_runtime": 1855.1051, "train_tokens_per_second": 29073.466 }, { "epoch": 0.007076405274575582, "grad_norm": 0.81640625, "learning_rate": 4.950980415950502e-05, "loss": 0.6573782444000245, "num_input_tokens_seen": 56792576, "step": 200, "train_runtime": 1952.6485, "train_tokens_per_second": 29084.894 }, { "epoch": 0.007430225538304361, "grad_norm": 0.74609375, "learning_rate": 4.9485550102222575e-05, "loss": 0.6446058273315429, "num_input_tokens_seen": 59683840, "step": 210, "train_runtime": 2051.8374, "train_tokens_per_second": 29087.997 }, { "epoch": 0.007784045802033139, "grad_norm": 0.734375, "learning_rate": 4.946133165507037e-05, "loss": 0.647282075881958, "num_input_tokens_seen": 62532608, "step": 220, "train_runtime": 2150.2306, "train_tokens_per_second": 29081.815 }, { "epoch": 0.008137866065761919, "grad_norm": 0.76171875, "learning_rate": 4.943714873099483e-05, "loss": 0.6425490379333496, "num_input_tokens_seen": 65382784, "step": 230, "train_runtime": 2247.0233, "train_tokens_per_second": 29097.51 }, { "epoch": 0.008491686329490699, "grad_norm": 0.72265625, "learning_rate": 4.9413001243240024e-05, "loss": 0.6406509399414062, "num_input_tokens_seen": 68271488, "step": 240, "train_runtime": 2342.3839, "train_tokens_per_second": 29146.157 }, { "epoch": 0.008845506593219477, "grad_norm": 0.703125, "learning_rate": 4.938888910534637e-05, "loss": 0.6345381736755371, "num_input_tokens_seen": 71153984, "step": 250, "train_runtime": 2441.4613, "train_tokens_per_second": 29144.014 }, { "epoch": 0.009199326856948256, "grad_norm": 0.7421875, "learning_rate": 4.936481223114932e-05, "loss": 0.6321357727050781, "num_input_tokens_seen": 73939776, "step": 260, "train_runtime": 2537.8979, "train_tokens_per_second": 29134.26 }, { "epoch": 0.009553147120677036, "grad_norm": 0.69921875, "learning_rate": 4.934077053477808e-05, "loss": 0.6258403778076171, "num_input_tokens_seen": 76772352, "step": 270, "train_runtime": 2637.1103, "train_tokens_per_second": 29112.302 }, { "epoch": 0.009906967384405814, "grad_norm": 0.70703125, "learning_rate": 4.931676393065431e-05, "loss": 0.6268699645996094, "num_input_tokens_seen": 79604032, "step": 280, "train_runtime": 2736.7819, "train_tokens_per_second": 29086.728 }, { "epoch": 0.010260787648134593, "grad_norm": 0.68359375, "learning_rate": 4.929279233349088e-05, "loss": 0.6168413162231445, "num_input_tokens_seen": 82418560, "step": 290, "train_runtime": 2831.5158, "train_tokens_per_second": 29107.576 }, { "epoch": 0.010614607911863373, "grad_norm": 0.73046875, "learning_rate": 4.926885565829051e-05, "loss": 0.619741678237915, "num_input_tokens_seen": 85216128, "step": 300, "train_runtime": 2922.6967, "train_tokens_per_second": 29156.679 }, { "epoch": 0.01096842817559215, "grad_norm": 0.69921875, "learning_rate": 4.924495382034461e-05, "loss": 0.6142029762268066, "num_input_tokens_seen": 88064064, "step": 310, "train_runtime": 3021.69, "train_tokens_per_second": 29143.977 }, { "epoch": 0.01132224843932093, "grad_norm": 0.7109375, "learning_rate": 4.9221086735231975e-05, "loss": 0.614790391921997, "num_input_tokens_seen": 90948800, "step": 320, "train_runtime": 3119.3955, "train_tokens_per_second": 29155.905 }, { "epoch": 0.01167606870304971, "grad_norm": 0.73046875, "learning_rate": 4.919725431881751e-05, "loss": 0.6131664276123047, "num_input_tokens_seen": 93845760, "step": 330, "train_runtime": 3218.1563, "train_tokens_per_second": 29161.343 }, { "epoch": 0.012029888966778488, "grad_norm": 0.70703125, "learning_rate": 4.917345648725101e-05, "loss": 0.6082728862762451, "num_input_tokens_seen": 96686912, "step": 340, "train_runtime": 3314.7421, "train_tokens_per_second": 29168.758 }, { "epoch": 0.012383709230507267, "grad_norm": 0.7265625, "learning_rate": 4.914969315696596e-05, "loss": 0.5998101711273194, "num_input_tokens_seen": 99527552, "step": 350, "train_runtime": 3411.9304, "train_tokens_per_second": 29170.452 }, { "epoch": 0.012737529494236047, "grad_norm": 0.72265625, "learning_rate": 4.912596424467818e-05, "loss": 0.6033230304718018, "num_input_tokens_seen": 102450560, "step": 360, "train_runtime": 3511.7131, "train_tokens_per_second": 29173.955 }, { "epoch": 0.013091349757964827, "grad_norm": 0.703125, "learning_rate": 4.910226966738475e-05, "loss": 0.5978434562683106, "num_input_tokens_seen": 105327808, "step": 370, "train_runtime": 3609.5991, "train_tokens_per_second": 29179.919 }, { "epoch": 0.013445170021693605, "grad_norm": 0.734375, "learning_rate": 4.9078609342362666e-05, "loss": 0.6012052536010742, "num_input_tokens_seen": 108158336, "step": 380, "train_runtime": 3705.6403, "train_tokens_per_second": 29187.489 }, { "epoch": 0.013798990285422384, "grad_norm": 0.7265625, "learning_rate": 4.905498318716775e-05, "loss": 0.596697187423706, "num_input_tokens_seen": 111012864, "step": 390, "train_runtime": 3803.8255, "train_tokens_per_second": 29184.531 }, { "epoch": 0.014152810549151164, "grad_norm": 0.69921875, "learning_rate": 4.9031391119633295e-05, "loss": 0.5964305400848389, "num_input_tokens_seen": 113838336, "step": 400, "train_runtime": 3899.6622, "train_tokens_per_second": 29191.846 }, { "epoch": 0.014506630812879942, "grad_norm": 0.72265625, "learning_rate": 4.9007833057869e-05, "loss": 0.5897239685058594, "num_input_tokens_seen": 116627008, "step": 410, "train_runtime": 3994.5521, "train_tokens_per_second": 29196.517 }, { "epoch": 0.014860451076608721, "grad_norm": 0.73046875, "learning_rate": 4.898430892025967e-05, "loss": 0.595780897140503, "num_input_tokens_seen": 119470080, "step": 420, "train_runtime": 4095.1828, "train_tokens_per_second": 29173.32 }, { "epoch": 0.015214271340337501, "grad_norm": 0.71484375, "learning_rate": 4.896081862546415e-05, "loss": 0.5898738861083984, "num_input_tokens_seen": 122313024, "step": 430, "train_runtime": 4192.2419, "train_tokens_per_second": 29176.042 }, { "epoch": 0.015568091604066279, "grad_norm": 0.71484375, "learning_rate": 4.8937362092414e-05, "loss": 0.5900569915771484, "num_input_tokens_seen": 125125248, "step": 440, "train_runtime": 4285.5509, "train_tokens_per_second": 29197.004 }, { "epoch": 0.01592191186779506, "grad_norm": 0.69921875, "learning_rate": 4.891393924031244e-05, "loss": 0.5830600738525391, "num_input_tokens_seen": 127990208, "step": 450, "train_runtime": 4383.6017, "train_tokens_per_second": 29197.5 }, { "epoch": 0.016275732131523838, "grad_norm": 0.70703125, "learning_rate": 4.8890549988633095e-05, "loss": 0.5887485027313233, "num_input_tokens_seen": 130801600, "step": 460, "train_runtime": 4476.705, "train_tokens_per_second": 29218.275 }, { "epoch": 0.016629552395252618, "grad_norm": 0.74609375, "learning_rate": 4.8867194257118907e-05, "loss": 0.5799453258514404, "num_input_tokens_seen": 133635712, "step": 470, "train_runtime": 4575.8324, "train_tokens_per_second": 29204.678 }, { "epoch": 0.016983372658981397, "grad_norm": 0.6640625, "learning_rate": 4.884387196578093e-05, "loss": 0.5826944828033447, "num_input_tokens_seen": 136496704, "step": 480, "train_runtime": 4674.0084, "train_tokens_per_second": 29203.35 }, { "epoch": 0.017337192922710173, "grad_norm": 0.69140625, "learning_rate": 4.882058303489718e-05, "loss": 0.5787400245666504, "num_input_tokens_seen": 139289984, "step": 490, "train_runtime": 4766.2023, "train_tokens_per_second": 29224.522 }, { "epoch": 0.017691013186438953, "grad_norm": 0.73046875, "learning_rate": 4.8797327385011496e-05, "loss": 0.5779561042785645, "num_input_tokens_seen": 142138496, "step": 500, "train_runtime": 4860.1689, "train_tokens_per_second": 29245.588 }, { "epoch": 0.018044833450167733, "grad_norm": 0.671875, "learning_rate": 4.8774104936932425e-05, "loss": 0.5814637184143067, "num_input_tokens_seen": 144959360, "step": 510, "train_runtime": 4956.0697, "train_tokens_per_second": 29248.854 }, { "epoch": 0.018398653713896512, "grad_norm": 0.71875, "learning_rate": 4.8750915611732076e-05, "loss": 0.5717947006225585, "num_input_tokens_seen": 147701312, "step": 520, "train_runtime": 5045.6694, "train_tokens_per_second": 29272.887 }, { "epoch": 0.018752473977625292, "grad_norm": 0.6796875, "learning_rate": 4.8727759330744986e-05, "loss": 0.57232666015625, "num_input_tokens_seen": 150572416, "step": 530, "train_runtime": 5145.6734, "train_tokens_per_second": 29261.946 }, { "epoch": 0.01910629424135407, "grad_norm": 0.6796875, "learning_rate": 4.870463601556696e-05, "loss": 0.5723038673400879, "num_input_tokens_seen": 153366080, "step": 540, "train_runtime": 5240.2786, "train_tokens_per_second": 29266.78 }, { "epoch": 0.019460114505082848, "grad_norm": 0.72265625, "learning_rate": 4.8681545588054075e-05, "loss": 0.5722018241882324, "num_input_tokens_seen": 156225920, "step": 550, "train_runtime": 5341.4112, "train_tokens_per_second": 29248.061 }, { "epoch": 0.019813934768811627, "grad_norm": 0.671875, "learning_rate": 4.8658487970321404e-05, "loss": 0.5680769920349121, "num_input_tokens_seen": 159087552, "step": 560, "train_runtime": 5441.0533, "train_tokens_per_second": 29238.374 }, { "epoch": 0.020167755032540407, "grad_norm": 0.68359375, "learning_rate": 4.863546308474209e-05, "loss": 0.5642250061035157, "num_input_tokens_seen": 161982784, "step": 570, "train_runtime": 5543.0086, "train_tokens_per_second": 29222.9 }, { "epoch": 0.020521575296269187, "grad_norm": 0.69921875, "learning_rate": 4.86124708539461e-05, "loss": 0.566973876953125, "num_input_tokens_seen": 164782400, "step": 580, "train_runtime": 5639.5169, "train_tokens_per_second": 29219.24 }, { "epoch": 0.020875395559997966, "grad_norm": 0.68359375, "learning_rate": 4.8589511200819216e-05, "loss": 0.5642753601074219, "num_input_tokens_seen": 167594880, "step": 590, "train_runtime": 5732.1297, "train_tokens_per_second": 29237.803 }, { "epoch": 0.021229215823726746, "grad_norm": 0.65234375, "learning_rate": 4.8566584048501926e-05, "loss": 0.5602854728698731, "num_input_tokens_seen": 170407296, "step": 600, "train_runtime": 5828.0015, "train_tokens_per_second": 29239.405 }, { "epoch": 0.021583036087455525, "grad_norm": 0.68359375, "learning_rate": 4.854368932038835e-05, "loss": 0.5584062576293946, "num_input_tokens_seen": 173246784, "step": 610, "train_runtime": 5924.6438, "train_tokens_per_second": 29241.721 }, { "epoch": 0.0219368563511843, "grad_norm": 0.70703125, "learning_rate": 4.8520826940125144e-05, "loss": 0.5647170066833496, "num_input_tokens_seen": 176162112, "step": 620, "train_runtime": 6025.6359, "train_tokens_per_second": 29235.439 }, { "epoch": 0.02229067661491308, "grad_norm": 0.6875, "learning_rate": 4.849799683161046e-05, "loss": 0.5587602615356445, "num_input_tokens_seen": 179001984, "step": 630, "train_runtime": 6120.8074, "train_tokens_per_second": 29244.832 }, { "epoch": 0.02264449687864186, "grad_norm": 0.6640625, "learning_rate": 4.8475198918992835e-05, "loss": 0.5582832813262939, "num_input_tokens_seen": 181931712, "step": 640, "train_runtime": 6222.1443, "train_tokens_per_second": 29239.391 }, { "epoch": 0.02299831714237064, "grad_norm": 0.69140625, "learning_rate": 4.845243312667023e-05, "loss": 0.5552670001983643, "num_input_tokens_seen": 184767872, "step": 650, "train_runtime": 6319.7456, "train_tokens_per_second": 29236.6 }, { "epoch": 0.02335213740609942, "grad_norm": 0.68359375, "learning_rate": 4.842969937928884e-05, "loss": 0.554955005645752, "num_input_tokens_seen": 187563008, "step": 660, "train_runtime": 6414.6287, "train_tokens_per_second": 29239.885 }, { "epoch": 0.0237059576698282, "grad_norm": 0.6484375, "learning_rate": 4.840699760174217e-05, "loss": 0.5562273979187011, "num_input_tokens_seen": 190415872, "step": 670, "train_runtime": 6511.0319, "train_tokens_per_second": 29245.114 }, { "epoch": 0.024059777933556976, "grad_norm": 0.62109375, "learning_rate": 4.8384327719169906e-05, "loss": 0.548237419128418, "num_input_tokens_seen": 193276160, "step": 680, "train_runtime": 6606.2242, "train_tokens_per_second": 29256.676 }, { "epoch": 0.024413598197285755, "grad_norm": 0.6953125, "learning_rate": 4.836168965695694e-05, "loss": 0.5568647384643555, "num_input_tokens_seen": 196100352, "step": 690, "train_runtime": 6703.1311, "train_tokens_per_second": 29255.038 }, { "epoch": 0.024767418461014535, "grad_norm": 0.703125, "learning_rate": 4.8339083340732304e-05, "loss": 0.5538945674896241, "num_input_tokens_seen": 198917632, "step": 700, "train_runtime": 6799.7012, "train_tokens_per_second": 29253.878 }, { "epoch": 0.025121238724743315, "grad_norm": 0.65234375, "learning_rate": 4.8316508696368154e-05, "loss": 0.5495064735412598, "num_input_tokens_seen": 201755584, "step": 710, "train_runtime": 6895.5809, "train_tokens_per_second": 29258.678 }, { "epoch": 0.025475058988472094, "grad_norm": 0.67578125, "learning_rate": 4.8293965649978714e-05, "loss": 0.5516688346862793, "num_input_tokens_seen": 204637376, "step": 720, "train_runtime": 6997.0307, "train_tokens_per_second": 29246.317 }, { "epoch": 0.025828879252200874, "grad_norm": 0.6953125, "learning_rate": 4.8271454127919364e-05, "loss": 0.5563485145568847, "num_input_tokens_seen": 207481920, "step": 730, "train_runtime": 7092.1158, "train_tokens_per_second": 29255.292 }, { "epoch": 0.026182699515929653, "grad_norm": 0.6640625, "learning_rate": 4.824897405678549e-05, "loss": 0.5479368209838867, "num_input_tokens_seen": 210324480, "step": 740, "train_runtime": 7191.5445, "train_tokens_per_second": 29246.079 }, { "epoch": 0.02653651977965843, "grad_norm": 0.66015625, "learning_rate": 4.8226525363411576e-05, "loss": 0.5478935718536377, "num_input_tokens_seen": 213174656, "step": 750, "train_runtime": 7288.099, "train_tokens_per_second": 29249.693 }, { "epoch": 0.02689034004338721, "grad_norm": 0.63671875, "learning_rate": 4.820410797487017e-05, "loss": 0.544947624206543, "num_input_tokens_seen": 216051136, "step": 760, "train_runtime": 7388.5322, "train_tokens_per_second": 29241.415 }, { "epoch": 0.02724416030711599, "grad_norm": 0.6640625, "learning_rate": 4.818172181847091e-05, "loss": 0.5453941345214843, "num_input_tokens_seen": 218912640, "step": 770, "train_runtime": 7487.1763, "train_tokens_per_second": 29238.344 }, { "epoch": 0.02759798057084477, "grad_norm": 0.68359375, "learning_rate": 4.81593668217595e-05, "loss": 0.5468230724334717, "num_input_tokens_seen": 221661120, "step": 780, "train_runtime": 7577.9253, "train_tokens_per_second": 29250.898 }, { "epoch": 0.027951800834573548, "grad_norm": 0.671875, "learning_rate": 4.813704291251675e-05, "loss": 0.5402215957641602, "num_input_tokens_seen": 224521408, "step": 790, "train_runtime": 7672.5981, "train_tokens_per_second": 29262.761 }, { "epoch": 0.028305621098302328, "grad_norm": 0.625, "learning_rate": 4.811475001875759e-05, "loss": 0.5399605751037597, "num_input_tokens_seen": 227384512, "step": 800, "train_runtime": 7772.4854, "train_tokens_per_second": 29255.058 }, { "epoch": 0.028659441362031104, "grad_norm": 0.65234375, "learning_rate": 4.8092488068730105e-05, "loss": 0.5373763561248779, "num_input_tokens_seen": 230168128, "step": 810, "train_runtime": 7867.1237, "train_tokens_per_second": 29256.961 }, { "epoch": 0.029013261625759883, "grad_norm": 0.68359375, "learning_rate": 4.807025699091452e-05, "loss": 0.5417660713195801, "num_input_tokens_seen": 233010944, "step": 820, "train_runtime": 7965.4807, "train_tokens_per_second": 29252.59 }, { "epoch": 0.029367081889488663, "grad_norm": 0.67578125, "learning_rate": 4.8048056714022325e-05, "loss": 0.5361145973205567, "num_input_tokens_seen": 235868608, "step": 830, "train_runtime": 8067.1626, "train_tokens_per_second": 29238.112 }, { "epoch": 0.029720902153217443, "grad_norm": 0.6328125, "learning_rate": 4.802588716699519e-05, "loss": 0.5446301460266113, "num_input_tokens_seen": 238670976, "step": 840, "train_runtime": 8162.6467, "train_tokens_per_second": 29239.41 }, { "epoch": 0.030074722416946222, "grad_norm": 0.6640625, "learning_rate": 4.8003748279004156e-05, "loss": 0.5387370109558105, "num_input_tokens_seen": 241592064, "step": 850, "train_runtime": 8264.6103, "train_tokens_per_second": 29232.118 }, { "epoch": 0.030428542680675002, "grad_norm": 0.67578125, "learning_rate": 4.798163997944854e-05, "loss": 0.5372297286987304, "num_input_tokens_seen": 244417792, "step": 860, "train_runtime": 8358.1194, "train_tokens_per_second": 29243.156 }, { "epoch": 0.030782362944403778, "grad_norm": 0.62890625, "learning_rate": 4.79595621979551e-05, "loss": 0.5457850933074951, "num_input_tokens_seen": 247252096, "step": 870, "train_runtime": 8454.4824, "train_tokens_per_second": 29245.09 }, { "epoch": 0.031136183208132558, "grad_norm": 0.65625, "learning_rate": 4.793751486437702e-05, "loss": 0.5330609321594239, "num_input_tokens_seen": 250084480, "step": 880, "train_runtime": 8550.6343, "train_tokens_per_second": 29247.477 }, { "epoch": 0.03149000347186134, "grad_norm": 0.6640625, "learning_rate": 4.7915497908793064e-05, "loss": 0.5324831962585449, "num_input_tokens_seen": 252907136, "step": 890, "train_runtime": 8647.9808, "train_tokens_per_second": 29244.646 }, { "epoch": 0.03184382373559012, "grad_norm": 0.66796875, "learning_rate": 4.7893511261506516e-05, "loss": 0.5301326751708985, "num_input_tokens_seen": 255730432, "step": 900, "train_runtime": 8745.0541, "train_tokens_per_second": 29242.865 }, { "epoch": 0.032197643999318896, "grad_norm": 0.6328125, "learning_rate": 4.787155485304435e-05, "loss": 0.5360992908477783, "num_input_tokens_seen": 258587072, "step": 910, "train_runtime": 8842.4166, "train_tokens_per_second": 29243.937 }, { "epoch": 0.032551464263047676, "grad_norm": 0.71484375, "learning_rate": 4.784962861415629e-05, "loss": 0.5338759422302246, "num_input_tokens_seen": 261403456, "step": 920, "train_runtime": 8938.3531, "train_tokens_per_second": 29245.148 }, { "epoch": 0.032905284526776456, "grad_norm": 0.69140625, "learning_rate": 4.7827732475813884e-05, "loss": 0.5312234878540039, "num_input_tokens_seen": 264245888, "step": 930, "train_runtime": 9035.3917, "train_tokens_per_second": 29245.648 }, { "epoch": 0.033259104790505235, "grad_norm": 0.66796875, "learning_rate": 4.7805866369209576e-05, "loss": 0.5281752109527588, "num_input_tokens_seen": 267068608, "step": 940, "train_runtime": 9132.2426, "train_tokens_per_second": 29244.581 }, { "epoch": 0.033612925054234015, "grad_norm": 0.6328125, "learning_rate": 4.778403022575583e-05, "loss": 0.530787992477417, "num_input_tokens_seen": 269879616, "step": 950, "train_runtime": 9226.0258, "train_tokens_per_second": 29251.99 }, { "epoch": 0.033966745317962795, "grad_norm": 0.640625, "learning_rate": 4.7762223977084195e-05, "loss": 0.5359733581542969, "num_input_tokens_seen": 272747456, "step": 960, "train_runtime": 9326.7801, "train_tokens_per_second": 29243.474 }, { "epoch": 0.03432056558169157, "grad_norm": 0.65625, "learning_rate": 4.774044755504444e-05, "loss": 0.5251823902130127, "num_input_tokens_seen": 275555264, "step": 970, "train_runtime": 9422.2686, "train_tokens_per_second": 29245.108 }, { "epoch": 0.03467438584542035, "grad_norm": 0.58984375, "learning_rate": 4.7718700891703616e-05, "loss": 0.5232102870941162, "num_input_tokens_seen": 278383808, "step": 980, "train_runtime": 9516.932, "train_tokens_per_second": 29251.423 }, { "epoch": 0.035028206109149126, "grad_norm": 0.65234375, "learning_rate": 4.7696983919345215e-05, "loss": 0.5289015769958496, "num_input_tokens_seen": 281244672, "step": 990, "train_runtime": 9617.3733, "train_tokens_per_second": 29243.398 }, { "epoch": 0.035382026372877906, "grad_norm": 0.6328125, "learning_rate": 4.7675296570468216e-05, "loss": 0.5262557029724121, "num_input_tokens_seen": 284070144, "step": 1000, "train_runtime": 9714.088, "train_tokens_per_second": 29243.11 }, { "epoch": 0.035735846636606686, "grad_norm": 0.609375, "learning_rate": 4.76536387777863e-05, "loss": 0.5245723724365234, "num_input_tokens_seen": 286892224, "step": 1010, "train_runtime": 9809.3995, "train_tokens_per_second": 29246.665 }, { "epoch": 0.036089666900335465, "grad_norm": 0.640625, "learning_rate": 4.7632010474226915e-05, "loss": 0.5246537685394287, "num_input_tokens_seen": 289760768, "step": 1020, "train_runtime": 9910.5607, "train_tokens_per_second": 29237.576 }, { "epoch": 0.036443487164064245, "grad_norm": 0.65234375, "learning_rate": 4.761041159293035e-05, "loss": 0.5270932197570801, "num_input_tokens_seen": 292580992, "step": 1030, "train_runtime": 10006.494, "train_tokens_per_second": 29239.111 }, { "epoch": 0.036797307427793025, "grad_norm": 0.625, "learning_rate": 4.7588842067249e-05, "loss": 0.524391508102417, "num_input_tokens_seen": 295430272, "step": 1040, "train_runtime": 10106.4067, "train_tokens_per_second": 29231.979 }, { "epoch": 0.037151127691521804, "grad_norm": 0.63671875, "learning_rate": 4.756730183074637e-05, "loss": 0.5262633323669433, "num_input_tokens_seen": 298248704, "step": 1050, "train_runtime": 10201.3863, "train_tokens_per_second": 29236.095 }, { "epoch": 0.037504947955250584, "grad_norm": 0.64453125, "learning_rate": 4.7545790817196314e-05, "loss": 0.5237319946289063, "num_input_tokens_seen": 301097088, "step": 1060, "train_runtime": 10300.4084, "train_tokens_per_second": 29231.568 }, { "epoch": 0.03785876821897936, "grad_norm": 0.66015625, "learning_rate": 4.752430896058212e-05, "loss": 0.5183588027954101, "num_input_tokens_seen": 303881344, "step": 1070, "train_runtime": 10393.8696, "train_tokens_per_second": 29236.594 }, { "epoch": 0.03821258848270814, "grad_norm": 0.640625, "learning_rate": 4.750285619509567e-05, "loss": 0.5271801471710205, "num_input_tokens_seen": 306701696, "step": 1080, "train_runtime": 10490.9209, "train_tokens_per_second": 29234.964 }, { "epoch": 0.03856640874643692, "grad_norm": 0.6484375, "learning_rate": 4.7481432455136644e-05, "loss": 0.5265097618103027, "num_input_tokens_seen": 309561344, "step": 1090, "train_runtime": 10590.9189, "train_tokens_per_second": 29228.941 }, { "epoch": 0.038920229010165695, "grad_norm": 0.63671875, "learning_rate": 4.7460037675311584e-05, "loss": 0.52159423828125, "num_input_tokens_seen": 312447872, "step": 1100, "train_runtime": 10691.3702, "train_tokens_per_second": 29224.306 }, { "epoch": 0.039274049273894475, "grad_norm": 0.62890625, "learning_rate": 4.7438671790433126e-05, "loss": 0.5192754745483399, "num_input_tokens_seen": 315278400, "step": 1110, "train_runtime": 10788.4584, "train_tokens_per_second": 29223.675 }, { "epoch": 0.039627869537623255, "grad_norm": 0.609375, "learning_rate": 4.741733473551915e-05, "loss": 0.5120278835296631, "num_input_tokens_seen": 318156160, "step": 1120, "train_runtime": 10887.3016, "train_tokens_per_second": 29222.683 }, { "epoch": 0.039981689801352034, "grad_norm": 0.65625, "learning_rate": 4.7396026445791966e-05, "loss": 0.5187259674072265, "num_input_tokens_seen": 321007808, "step": 1130, "train_runtime": 10985.723, "train_tokens_per_second": 29220.454 }, { "epoch": 0.040335510065080814, "grad_norm": 0.671875, "learning_rate": 4.737474685667742e-05, "loss": 0.5205765724182129, "num_input_tokens_seen": 323854016, "step": 1140, "train_runtime": 11083.4517, "train_tokens_per_second": 29219.599 }, { "epoch": 0.04068933032880959, "grad_norm": 0.65234375, "learning_rate": 4.7353495903804165e-05, "loss": 0.5147505760192871, "num_input_tokens_seen": 326739072, "step": 1150, "train_runtime": 11185.6144, "train_tokens_per_second": 29210.651 }, { "epoch": 0.04104315059253837, "grad_norm": 0.66015625, "learning_rate": 4.733227352300277e-05, "loss": 0.5157520294189453, "num_input_tokens_seen": 329584000, "step": 1160, "train_runtime": 11282.661, "train_tokens_per_second": 29211.549 }, { "epoch": 0.04139697085626715, "grad_norm": 0.63671875, "learning_rate": 4.731107965030496e-05, "loss": 0.5139248847961426, "num_input_tokens_seen": 332447488, "step": 1170, "train_runtime": 11381.2166, "train_tokens_per_second": 29210.189 }, { "epoch": 0.04175079111999593, "grad_norm": 0.65234375, "learning_rate": 4.728991422194278e-05, "loss": 0.5168056488037109, "num_input_tokens_seen": 335291008, "step": 1180, "train_runtime": 11479.3888, "train_tokens_per_second": 29208.089 }, { "epoch": 0.04210461138372471, "grad_norm": 0.65625, "learning_rate": 4.726877717434773e-05, "loss": 0.5130697250366211, "num_input_tokens_seen": 338140352, "step": 1190, "train_runtime": 11578.4203, "train_tokens_per_second": 29204.36 }, { "epoch": 0.04245843164745349, "grad_norm": 0.62890625, "learning_rate": 4.724766844415013e-05, "loss": 0.515099573135376, "num_input_tokens_seen": 340990272, "step": 1200, "train_runtime": 11677.4394, "train_tokens_per_second": 29200.774 }, { "epoch": 0.04281225191118227, "grad_norm": 0.66015625, "learning_rate": 4.722658796817813e-05, "loss": 0.5136539936065674, "num_input_tokens_seen": 343838208, "step": 1210, "train_runtime": 11775.0554, "train_tokens_per_second": 29200.56 }, { "epoch": 0.04316607217491105, "grad_norm": 0.65234375, "learning_rate": 4.7205535683457044e-05, "loss": 0.5174936294555664, "num_input_tokens_seen": 346657792, "step": 1220, "train_runtime": 11873.8516, "train_tokens_per_second": 29195.059 }, { "epoch": 0.04351989243863982, "grad_norm": 0.62109375, "learning_rate": 4.7184511527208484e-05, "loss": 0.5219906806945801, "num_input_tokens_seen": 349406848, "step": 1230, "train_runtime": 11966.1139, "train_tokens_per_second": 29199.693 }, { "epoch": 0.0438737127023686, "grad_norm": 0.61328125, "learning_rate": 4.7163515436849644e-05, "loss": 0.5125075817108155, "num_input_tokens_seen": 352205120, "step": 1240, "train_runtime": 12058.3514, "train_tokens_per_second": 29208.397 }, { "epoch": 0.04422753296609738, "grad_norm": 0.625, "learning_rate": 4.714254734999245e-05, "loss": 0.5103229999542236, "num_input_tokens_seen": 355032320, "step": 1250, "train_runtime": 12156.101, "train_tokens_per_second": 29206.101 }, { "epoch": 0.04458135322982616, "grad_norm": 0.62109375, "learning_rate": 4.712160720444284e-05, "loss": 0.5108553886413574, "num_input_tokens_seen": 357865728, "step": 1260, "train_runtime": 12251.671, "train_tokens_per_second": 29209.544 }, { "epoch": 0.04493517349355494, "grad_norm": 0.6015625, "learning_rate": 4.710069493819992e-05, "loss": 0.511588191986084, "num_input_tokens_seen": 360726208, "step": 1270, "train_runtime": 12347.9074, "train_tokens_per_second": 29213.55 }, { "epoch": 0.04528899375728372, "grad_norm": 0.6328125, "learning_rate": 4.70798104894553e-05, "loss": 0.5121116638183594, "num_input_tokens_seen": 363523776, "step": 1280, "train_runtime": 12443.8328, "train_tokens_per_second": 29213.168 }, { "epoch": 0.0456428140210125, "grad_norm": 0.6015625, "learning_rate": 4.705895379659219e-05, "loss": 0.5085021495819092, "num_input_tokens_seen": 366363840, "step": 1290, "train_runtime": 12540.1612, "train_tokens_per_second": 29215.242 }, { "epoch": 0.04599663428474128, "grad_norm": 0.62109375, "learning_rate": 4.7038124798184766e-05, "loss": 0.5098957061767578, "num_input_tokens_seen": 369254272, "step": 1300, "train_runtime": 12639.1347, "train_tokens_per_second": 29215.155 }, { "epoch": 0.04635045454847006, "grad_norm": 0.66015625, "learning_rate": 4.7017323432997304e-05, "loss": 0.5119119167327881, "num_input_tokens_seen": 372060416, "step": 1310, "train_runtime": 12732.7391, "train_tokens_per_second": 29220.768 }, { "epoch": 0.04670427481219884, "grad_norm": 0.6171875, "learning_rate": 4.6996549639983506e-05, "loss": 0.5074324607849121, "num_input_tokens_seen": 374916672, "step": 1320, "train_runtime": 12831.2097, "train_tokens_per_second": 29219.121 }, { "epoch": 0.04705809507592762, "grad_norm": 0.63671875, "learning_rate": 4.697580335828569e-05, "loss": 0.5119407653808594, "num_input_tokens_seen": 377688768, "step": 1330, "train_runtime": 12924.7716, "train_tokens_per_second": 29222.084 }, { "epoch": 0.0474119153396564, "grad_norm": 0.60546875, "learning_rate": 4.6955084527234076e-05, "loss": 0.5067808151245117, "num_input_tokens_seen": 380504704, "step": 1340, "train_runtime": 13021.8795, "train_tokens_per_second": 29220.414 }, { "epoch": 0.04776573560338518, "grad_norm": 0.62109375, "learning_rate": 4.6934393086346034e-05, "loss": 0.5052962303161621, "num_input_tokens_seen": 383362752, "step": 1350, "train_runtime": 13119.4099, "train_tokens_per_second": 29221.036 }, { "epoch": 0.04811955586711395, "grad_norm": 0.6328125, "learning_rate": 4.6913728975325324e-05, "loss": 0.5087544441223144, "num_input_tokens_seen": 386168256, "step": 1360, "train_runtime": 13214.8992, "train_tokens_per_second": 29222.187 }, { "epoch": 0.04847337613084273, "grad_norm": 0.6171875, "learning_rate": 4.6893092134061393e-05, "loss": 0.5076364517211914, "num_input_tokens_seen": 389013440, "step": 1370, "train_runtime": 13309.6751, "train_tokens_per_second": 29227.869 }, { "epoch": 0.04882719639457151, "grad_norm": 0.63671875, "learning_rate": 4.687248250262859e-05, "loss": 0.5082167625427246, "num_input_tokens_seen": 391862656, "step": 1380, "train_runtime": 13407.5273, "train_tokens_per_second": 29227.064 }, { "epoch": 0.04918101665830029, "grad_norm": 0.6484375, "learning_rate": 4.685190002128548e-05, "loss": 0.5068390846252442, "num_input_tokens_seen": 394694016, "step": 1390, "train_runtime": 13504.5689, "train_tokens_per_second": 29226.702 }, { "epoch": 0.04953483692202907, "grad_norm": 0.61328125, "learning_rate": 4.6831344630474114e-05, "loss": 0.5044609546661377, "num_input_tokens_seen": 397559168, "step": 1400, "train_runtime": 13603.1765, "train_tokens_per_second": 29225.466 }, { "epoch": 0.04988865718575785, "grad_norm": 0.63671875, "learning_rate": 4.6810816270819276e-05, "loss": 0.5071157455444336, "num_input_tokens_seen": 400339968, "step": 1410, "train_runtime": 13696.3087, "train_tokens_per_second": 29229.771 }, { "epoch": 0.05024247744948663, "grad_norm": 0.61328125, "learning_rate": 4.679031488312777e-05, "loss": 0.503534984588623, "num_input_tokens_seen": 403147712, "step": 1420, "train_runtime": 13788.2059, "train_tokens_per_second": 29238.591 }, { "epoch": 0.05059629771321541, "grad_norm": 0.6015625, "learning_rate": 4.6769840408387717e-05, "loss": 0.50531005859375, "num_input_tokens_seen": 405921984, "step": 1430, "train_runtime": 13882.0958, "train_tokens_per_second": 29240.685 }, { "epoch": 0.05095011797694419, "grad_norm": 0.609375, "learning_rate": 4.674939278776787e-05, "loss": 0.5033230781555176, "num_input_tokens_seen": 408771328, "step": 1440, "train_runtime": 13981.6214, "train_tokens_per_second": 29236.332 }, { "epoch": 0.05130393824067297, "grad_norm": 0.61328125, "learning_rate": 4.672897196261683e-05, "loss": 0.497056770324707, "num_input_tokens_seen": 411631360, "step": 1450, "train_runtime": 14076.8573, "train_tokens_per_second": 29241.709 }, { "epoch": 0.05165775850440175, "grad_norm": 0.60546875, "learning_rate": 4.670857787446238e-05, "loss": 0.5002260208129883, "num_input_tokens_seen": 414472512, "step": 1460, "train_runtime": 14174.0097, "train_tokens_per_second": 29241.726 }, { "epoch": 0.05201157876813053, "grad_norm": 0.60546875, "learning_rate": 4.668821046501082e-05, "loss": 0.5049727439880372, "num_input_tokens_seen": 417288512, "step": 1470, "train_runtime": 14267.9159, "train_tokens_per_second": 29246.634 }, { "epoch": 0.05236539903185931, "grad_norm": 0.6171875, "learning_rate": 4.6667869676146194e-05, "loss": 0.5048169136047364, "num_input_tokens_seen": 420114432, "step": 1480, "train_runtime": 14364.9711, "train_tokens_per_second": 29245.755 }, { "epoch": 0.05271921929558808, "grad_norm": 0.62890625, "learning_rate": 4.6647555449929645e-05, "loss": 0.5045809268951416, "num_input_tokens_seen": 423016960, "step": 1490, "train_runtime": 14464.8637, "train_tokens_per_second": 29244.448 }, { "epoch": 0.05307303955931686, "grad_norm": 0.625, "learning_rate": 4.662726772859869e-05, "loss": 0.5020414352416992, "num_input_tokens_seen": 425864448, "step": 1500, "train_runtime": 14561.586, "train_tokens_per_second": 29245.746 }, { "epoch": 0.05342685982304564, "grad_norm": 0.6015625, "learning_rate": 4.660700645456655e-05, "loss": 0.5014071941375733, "num_input_tokens_seen": 428695872, "step": 1510, "train_runtime": 14660.0558, "train_tokens_per_second": 29242.445 }, { "epoch": 0.05378068008677442, "grad_norm": 0.6484375, "learning_rate": 4.658677157042149e-05, "loss": 0.5045583724975586, "num_input_tokens_seen": 431512576, "step": 1520, "train_runtime": 14756.1916, "train_tokens_per_second": 29242.815 }, { "epoch": 0.0541345003505032, "grad_norm": 0.609375, "learning_rate": 4.656656301892605e-05, "loss": 0.5063568592071533, "num_input_tokens_seen": 434367744, "step": 1530, "train_runtime": 14854.9388, "train_tokens_per_second": 29240.628 }, { "epoch": 0.05448832061423198, "grad_norm": 0.62890625, "learning_rate": 4.6546380743016465e-05, "loss": 0.5017670631408692, "num_input_tokens_seen": 437205952, "step": 1540, "train_runtime": 14953.2632, "train_tokens_per_second": 29238.163 }, { "epoch": 0.05484214087796076, "grad_norm": 0.62890625, "learning_rate": 4.652622468580193e-05, "loss": 0.4997280120849609, "num_input_tokens_seen": 440075648, "step": 1550, "train_runtime": 15053.6898, "train_tokens_per_second": 29233.74 }, { "epoch": 0.05519596114168954, "grad_norm": 0.625, "learning_rate": 4.650609479056392e-05, "loss": 0.4976215839385986, "num_input_tokens_seen": 442901888, "step": 1560, "train_runtime": 15149.6237, "train_tokens_per_second": 29235.174 }, { "epoch": 0.055549781405418316, "grad_norm": 0.60546875, "learning_rate": 4.648599100075556e-05, "loss": 0.5020614624023437, "num_input_tokens_seen": 445732352, "step": 1570, "train_runtime": 15245.6944, "train_tokens_per_second": 29236.605 }, { "epoch": 0.055903601669147096, "grad_norm": 0.5859375, "learning_rate": 4.6465913260000945e-05, "loss": 0.4983253002166748, "num_input_tokens_seen": 448596480, "step": 1580, "train_runtime": 15345.71, "train_tokens_per_second": 29232.696 }, { "epoch": 0.056257421932875876, "grad_norm": 0.625, "learning_rate": 4.644586151209444e-05, "loss": 0.4939885139465332, "num_input_tokens_seen": 451430272, "step": 1590, "train_runtime": 15443.4348, "train_tokens_per_second": 29231.209 }, { "epoch": 0.056611242196604655, "grad_norm": 0.609375, "learning_rate": 4.6425835701000084e-05, "loss": 0.49611196517944334, "num_input_tokens_seen": 454233152, "step": 1600, "train_runtime": 15535.6015, "train_tokens_per_second": 29238.208 }, { "epoch": 0.05696506246033343, "grad_norm": 0.6484375, "learning_rate": 4.640583577085084e-05, "loss": 0.4994488716125488, "num_input_tokens_seen": 457093248, "step": 1610, "train_runtime": 15632.9592, "train_tokens_per_second": 29239.074 }, { "epoch": 0.05731888272406221, "grad_norm": 0.625, "learning_rate": 4.638586166594806e-05, "loss": 0.4968722343444824, "num_input_tokens_seen": 459936448, "step": 1620, "train_runtime": 15729.9043, "train_tokens_per_second": 29239.622 }, { "epoch": 0.05767270298779099, "grad_norm": 0.578125, "learning_rate": 4.6365913330760726e-05, "loss": 0.49298572540283203, "num_input_tokens_seen": 462743744, "step": 1630, "train_runtime": 15826.5709, "train_tokens_per_second": 29238.408 }, { "epoch": 0.05802652325151977, "grad_norm": 0.62890625, "learning_rate": 4.6345990709924855e-05, "loss": 0.498442554473877, "num_input_tokens_seen": 465583680, "step": 1640, "train_runtime": 15923.9936, "train_tokens_per_second": 29237.872 }, { "epoch": 0.058380343515248546, "grad_norm": 0.609375, "learning_rate": 4.632609374824284e-05, "loss": 0.49790544509887696, "num_input_tokens_seen": 468450816, "step": 1650, "train_runtime": 16022.7153, "train_tokens_per_second": 29236.668 }, { "epoch": 0.058734163778977326, "grad_norm": 0.6015625, "learning_rate": 4.630622239068285e-05, "loss": 0.49540348052978517, "num_input_tokens_seen": 471258944, "step": 1660, "train_runtime": 16119.9432, "train_tokens_per_second": 29234.529 }, { "epoch": 0.059087984042706106, "grad_norm": 0.578125, "learning_rate": 4.628637658237808e-05, "loss": 0.4915264129638672, "num_input_tokens_seen": 474096320, "step": 1670, "train_runtime": 16219.2057, "train_tokens_per_second": 29230.551 }, { "epoch": 0.059441804306434885, "grad_norm": 0.609375, "learning_rate": 4.626655626862625e-05, "loss": 0.49178447723388674, "num_input_tokens_seen": 476921472, "step": 1680, "train_runtime": 16315.9306, "train_tokens_per_second": 29230.418 }, { "epoch": 0.059795624570163665, "grad_norm": 0.59375, "learning_rate": 4.624676139488888e-05, "loss": 0.49329314231872556, "num_input_tokens_seen": 479802176, "step": 1690, "train_runtime": 16416.7699, "train_tokens_per_second": 29226.345 }, { "epoch": 0.060149444833892445, "grad_norm": 0.609375, "learning_rate": 4.6226991906790686e-05, "loss": 0.49400696754455564, "num_input_tokens_seen": 482621056, "step": 1700, "train_runtime": 16512.7673, "train_tokens_per_second": 29227.146 }, { "epoch": 0.060503265097621224, "grad_norm": 0.61328125, "learning_rate": 4.620724775011897e-05, "loss": 0.49402532577514646, "num_input_tokens_seen": 485433280, "step": 1710, "train_runtime": 16606.7295, "train_tokens_per_second": 29231.119 }, { "epoch": 0.060857085361350004, "grad_norm": 0.59375, "learning_rate": 4.618752887082297e-05, "loss": 0.48993425369262694, "num_input_tokens_seen": 488321600, "step": 1720, "train_runtime": 16706.35, "train_tokens_per_second": 29229.7 }, { "epoch": 0.06121090562507878, "grad_norm": 0.63671875, "learning_rate": 4.616783521501325e-05, "loss": 0.4922123908996582, "num_input_tokens_seen": 491185728, "step": 1730, "train_runtime": 16806.1119, "train_tokens_per_second": 29226.613 }, { "epoch": 0.061564725888807556, "grad_norm": 0.6171875, "learning_rate": 4.614816672896108e-05, "loss": 0.49462089538574217, "num_input_tokens_seen": 494032640, "step": 1740, "train_runtime": 16903.6141, "train_tokens_per_second": 29226.45 }, { "epoch": 0.061918546152536336, "grad_norm": 0.6015625, "learning_rate": 4.612852335909782e-05, "loss": 0.49348812103271483, "num_input_tokens_seen": 496898944, "step": 1750, "train_runtime": 16999.5825, "train_tokens_per_second": 29230.067 }, { "epoch": 0.062272366416265115, "grad_norm": 0.60546875, "learning_rate": 4.6108905052014323e-05, "loss": 0.49039106369018554, "num_input_tokens_seen": 499705920, "step": 1760, "train_runtime": 17092.9555, "train_tokens_per_second": 29234.612 }, { "epoch": 0.0626261866799939, "grad_norm": 0.609375, "learning_rate": 4.608931175446027e-05, "loss": 0.48816871643066406, "num_input_tokens_seen": 502554560, "step": 1770, "train_runtime": 17189.6723, "train_tokens_per_second": 29235.843 }, { "epoch": 0.06298000694372267, "grad_norm": 0.62109375, "learning_rate": 4.606974341334367e-05, "loss": 0.4953399658203125, "num_input_tokens_seen": 505327296, "step": 1780, "train_runtime": 17284.2912, "train_tokens_per_second": 29236.217 }, { "epoch": 0.06333382720745145, "grad_norm": 0.60546875, "learning_rate": 4.605019997573011e-05, "loss": 0.48953962326049805, "num_input_tokens_seen": 508246208, "step": 1790, "train_runtime": 17385.6776, "train_tokens_per_second": 29233.615 }, { "epoch": 0.06368764747118023, "grad_norm": 0.6015625, "learning_rate": 4.603068138884229e-05, "loss": 0.4889236927032471, "num_input_tokens_seen": 511120896, "step": 1800, "train_runtime": 17485.6064, "train_tokens_per_second": 29230.95 }, { "epoch": 0.06404146773490901, "grad_norm": 0.6171875, "learning_rate": 4.6011187600059345e-05, "loss": 0.49122133255004885, "num_input_tokens_seen": 513971072, "step": 1810, "train_runtime": 17580.9085, "train_tokens_per_second": 29234.614 }, { "epoch": 0.06439528799863779, "grad_norm": 0.62109375, "learning_rate": 4.599171855691629e-05, "loss": 0.4832293510437012, "num_input_tokens_seen": 516781632, "step": 1820, "train_runtime": 17677.2972, "train_tokens_per_second": 29234.199 }, { "epoch": 0.06474910826236657, "grad_norm": 0.6015625, "learning_rate": 4.597227420710335e-05, "loss": 0.48655948638916013, "num_input_tokens_seen": 519587648, "step": 1830, "train_runtime": 17773.3819, "train_tokens_per_second": 29234.034 }, { "epoch": 0.06510292852609535, "grad_norm": 0.609375, "learning_rate": 4.595285449846551e-05, "loss": 0.4880838394165039, "num_input_tokens_seen": 522408064, "step": 1840, "train_runtime": 17869.6001, "train_tokens_per_second": 29234.458 }, { "epoch": 0.06545674878982413, "grad_norm": 0.60546875, "learning_rate": 4.593345937900178e-05, "loss": 0.48679656982421876, "num_input_tokens_seen": 525223808, "step": 1850, "train_runtime": 17963.8289, "train_tokens_per_second": 29237.854 }, { "epoch": 0.06581056905355291, "grad_norm": 0.609375, "learning_rate": 4.591408879686472e-05, "loss": 0.4835360050201416, "num_input_tokens_seen": 527996032, "step": 1860, "train_runtime": 18055.9966, "train_tokens_per_second": 29242.143 }, { "epoch": 0.06616438931728169, "grad_norm": 0.58984375, "learning_rate": 4.5894742700359775e-05, "loss": 0.48793563842773435, "num_input_tokens_seen": 530825152, "step": 1870, "train_runtime": 18149.8895, "train_tokens_per_second": 29246.743 }, { "epoch": 0.06651820958101047, "grad_norm": 0.625, "learning_rate": 4.587542103794477e-05, "loss": 0.48436679840087893, "num_input_tokens_seen": 533647104, "step": 1880, "train_runtime": 18247.2758, "train_tokens_per_second": 29245.303 }, { "epoch": 0.06687202984473925, "grad_norm": 0.62109375, "learning_rate": 4.5856123758229247e-05, "loss": 0.48836069107055663, "num_input_tokens_seen": 536478464, "step": 1890, "train_runtime": 18342.7489, "train_tokens_per_second": 29247.441 }, { "epoch": 0.06722585010846803, "grad_norm": 0.6171875, "learning_rate": 4.5836850809973993e-05, "loss": 0.4861155033111572, "num_input_tokens_seen": 539351808, "step": 1900, "train_runtime": 18441.8215, "train_tokens_per_second": 29246.124 }, { "epoch": 0.06757967037219681, "grad_norm": 0.625, "learning_rate": 4.5817602142090385e-05, "loss": 0.4900822639465332, "num_input_tokens_seen": 542161408, "step": 1910, "train_runtime": 18539.2971, "train_tokens_per_second": 29243.903 }, { "epoch": 0.06793349063592559, "grad_norm": 0.60546875, "learning_rate": 4.579837770363989e-05, "loss": 0.48744726181030273, "num_input_tokens_seen": 544951744, "step": 1920, "train_runtime": 18630.5695, "train_tokens_per_second": 29250.407 }, { "epoch": 0.06828731089965437, "grad_norm": 0.6015625, "learning_rate": 4.57791774438334e-05, "loss": 0.4854752063751221, "num_input_tokens_seen": 547750400, "step": 1930, "train_runtime": 18726.7333, "train_tokens_per_second": 29249.65 }, { "epoch": 0.06864113116338313, "grad_norm": 0.58984375, "learning_rate": 4.576000131203078e-05, "loss": 0.49063758850097655, "num_input_tokens_seen": 550594112, "step": 1940, "train_runtime": 18825.4178, "train_tokens_per_second": 29247.378 }, { "epoch": 0.06899495142711191, "grad_norm": 0.59765625, "learning_rate": 4.574084925774023e-05, "loss": 0.4877795696258545, "num_input_tokens_seen": 553487040, "step": 1950, "train_runtime": 18926.0416, "train_tokens_per_second": 29244.733 }, { "epoch": 0.0693487716908407, "grad_norm": 0.609375, "learning_rate": 4.5721721230617795e-05, "loss": 0.4819538116455078, "num_input_tokens_seen": 556323008, "step": 1960, "train_runtime": 19025.3704, "train_tokens_per_second": 29241.113 }, { "epoch": 0.06970259195456947, "grad_norm": 0.625, "learning_rate": 4.57026171804667e-05, "loss": 0.48713436126708987, "num_input_tokens_seen": 559121728, "step": 1970, "train_runtime": 19121.9829, "train_tokens_per_second": 29239.736 }, { "epoch": 0.07005641221829825, "grad_norm": 0.63671875, "learning_rate": 4.568353705723692e-05, "loss": 0.47935781478881834, "num_input_tokens_seen": 562017152, "step": 1980, "train_runtime": 19221.5884, "train_tokens_per_second": 29238.851 }, { "epoch": 0.07041023248202703, "grad_norm": 0.6171875, "learning_rate": 4.566448081102455e-05, "loss": 0.48120651245117185, "num_input_tokens_seen": 564825344, "step": 1990, "train_runtime": 19315.8829, "train_tokens_per_second": 29241.498 }, { "epoch": 0.07076405274575581, "grad_norm": 0.59765625, "learning_rate": 4.564544839207128e-05, "loss": 0.47998952865600586, "num_input_tokens_seen": 567674176, "step": 2000, "train_runtime": 19412.9958, "train_tokens_per_second": 29241.967 }, { "epoch": 0.07111787300948459, "grad_norm": 0.60546875, "learning_rate": 4.562643975076387e-05, "loss": 0.48445773124694824, "num_input_tokens_seen": 570516160, "step": 2010, "train_runtime": 19511.5222, "train_tokens_per_second": 29239.962 }, { "epoch": 0.07147169327321337, "grad_norm": 0.6171875, "learning_rate": 4.560745483763357e-05, "loss": 0.48499622344970705, "num_input_tokens_seen": 573346944, "step": 2020, "train_runtime": 19609.9296, "train_tokens_per_second": 29237.583 }, { "epoch": 0.07182551353694215, "grad_norm": 0.62109375, "learning_rate": 4.5588493603355595e-05, "loss": 0.4852696418762207, "num_input_tokens_seen": 576276288, "step": 2030, "train_runtime": 19713.7756, "train_tokens_per_second": 29232.162 }, { "epoch": 0.07217933380067093, "grad_norm": 0.59375, "learning_rate": 4.556955599874859e-05, "loss": 0.48374109268188475, "num_input_tokens_seen": 579141184, "step": 2040, "train_runtime": 19813.6656, "train_tokens_per_second": 29229.381 }, { "epoch": 0.07253315406439971, "grad_norm": 0.60546875, "learning_rate": 4.555064197477409e-05, "loss": 0.48391122817993165, "num_input_tokens_seen": 582017088, "step": 2050, "train_runtime": 19913.7142, "train_tokens_per_second": 29226.948 }, { "epoch": 0.07288697432812849, "grad_norm": 0.6171875, "learning_rate": 4.5531751482536e-05, "loss": 0.4845563888549805, "num_input_tokens_seen": 584861632, "step": 2060, "train_runtime": 20014.4872, "train_tokens_per_second": 29221.914 }, { "epoch": 0.07324079459185727, "grad_norm": 0.62109375, "learning_rate": 4.5512884473280024e-05, "loss": 0.48123531341552733, "num_input_tokens_seen": 587725440, "step": 2070, "train_runtime": 20110.808, "train_tokens_per_second": 29224.357 }, { "epoch": 0.07359461485558605, "grad_norm": 0.6015625, "learning_rate": 4.549404089839322e-05, "loss": 0.48112030029296876, "num_input_tokens_seen": 590559040, "step": 2080, "train_runtime": 20208.3055, "train_tokens_per_second": 29223.58 }, { "epoch": 0.07394843511931483, "grad_norm": 0.6015625, "learning_rate": 4.547522070940335e-05, "loss": 0.4818718433380127, "num_input_tokens_seen": 593424512, "step": 2090, "train_runtime": 20307.0415, "train_tokens_per_second": 29222.598 }, { "epoch": 0.07430225538304361, "grad_norm": 0.59375, "learning_rate": 4.545642385797848e-05, "loss": 0.4805013656616211, "num_input_tokens_seen": 596225088, "step": 2100, "train_runtime": 20398.6211, "train_tokens_per_second": 29228.696 }, { "epoch": 0.07465607564677239, "grad_norm": 0.5859375, "learning_rate": 4.543765029592637e-05, "loss": 0.48232307434082033, "num_input_tokens_seen": 599054400, "step": 2110, "train_runtime": 20492.0291, "train_tokens_per_second": 29233.533 }, { "epoch": 0.07500989591050117, "grad_norm": 0.6328125, "learning_rate": 4.541889997519403e-05, "loss": 0.478058910369873, "num_input_tokens_seen": 601905792, "step": 2120, "train_runtime": 20592.0345, "train_tokens_per_second": 29230.03 }, { "epoch": 0.07536371617422995, "grad_norm": 0.58203125, "learning_rate": 4.5400172847867095e-05, "loss": 0.48308491706848145, "num_input_tokens_seen": 604781696, "step": 2130, "train_runtime": 20691.8944, "train_tokens_per_second": 29227.952 }, { "epoch": 0.07571753643795873, "grad_norm": 0.6015625, "learning_rate": 4.5381468866169466e-05, "loss": 0.4799912929534912, "num_input_tokens_seen": 607602112, "step": 2140, "train_runtime": 20785.9732, "train_tokens_per_second": 29231.353 }, { "epoch": 0.0760713567016875, "grad_norm": 0.6171875, "learning_rate": 4.5362787982462616e-05, "loss": 0.4795804023742676, "num_input_tokens_seen": 610399360, "step": 2150, "train_runtime": 20883.6315, "train_tokens_per_second": 29228.602 }, { "epoch": 0.07642517696541629, "grad_norm": 0.6171875, "learning_rate": 4.5344130149245275e-05, "loss": 0.47710742950439455, "num_input_tokens_seen": 613185408, "step": 2160, "train_runtime": 20976.3577, "train_tokens_per_second": 29232.215 }, { "epoch": 0.07677899722914507, "grad_norm": 0.60546875, "learning_rate": 4.5325495319152715e-05, "loss": 0.4809116363525391, "num_input_tokens_seen": 616021440, "step": 2170, "train_runtime": 21072.8929, "train_tokens_per_second": 29232.884 }, { "epoch": 0.07713281749287385, "grad_norm": 0.59375, "learning_rate": 4.530688344495644e-05, "loss": 0.47991437911987306, "num_input_tokens_seen": 618854080, "step": 2180, "train_runtime": 21168.2486, "train_tokens_per_second": 29235.016 }, { "epoch": 0.07748663775660261, "grad_norm": 0.6328125, "learning_rate": 4.528829447956357e-05, "loss": 0.48104305267333985, "num_input_tokens_seen": 621675904, "step": 2190, "train_runtime": 21264.1246, "train_tokens_per_second": 29235.904 }, { "epoch": 0.07784045802033139, "grad_norm": 0.59375, "learning_rate": 4.526972837601633e-05, "loss": 0.47821741104125975, "num_input_tokens_seen": 624492288, "step": 2200, "train_runtime": 21359.2133, "train_tokens_per_second": 29237.607 }, { "epoch": 0.07819427828406017, "grad_norm": 0.609375, "learning_rate": 4.525118508749165e-05, "loss": 0.48128366470336914, "num_input_tokens_seen": 627315200, "step": 2210, "train_runtime": 21456.7457, "train_tokens_per_second": 29236.269 }, { "epoch": 0.07854809854778895, "grad_norm": 0.58203125, "learning_rate": 4.5232664567300546e-05, "loss": 0.4781455993652344, "num_input_tokens_seen": 630126080, "step": 2220, "train_runtime": 21554.1663, "train_tokens_per_second": 29234.537 }, { "epoch": 0.07890191881151773, "grad_norm": 0.60546875, "learning_rate": 4.521416676888773e-05, "loss": 0.47599353790283205, "num_input_tokens_seen": 632958400, "step": 2230, "train_runtime": 21649.7073, "train_tokens_per_second": 29236.349 }, { "epoch": 0.07925573907524651, "grad_norm": 0.61328125, "learning_rate": 4.519569164583107e-05, "loss": 0.47762494087219237, "num_input_tokens_seen": 635800064, "step": 2240, "train_runtime": 21749.5715, "train_tokens_per_second": 29232.763 }, { "epoch": 0.07960955933897529, "grad_norm": 0.5859375, "learning_rate": 4.517723915184109e-05, "loss": 0.47615938186645507, "num_input_tokens_seen": 638624768, "step": 2250, "train_runtime": 21843.5959, "train_tokens_per_second": 29236.247 }, { "epoch": 0.07996337960270407, "grad_norm": 0.6171875, "learning_rate": 4.5158809240760506e-05, "loss": 0.47748804092407227, "num_input_tokens_seen": 641490688, "step": 2260, "train_runtime": 21943.3106, "train_tokens_per_second": 29233.998 }, { "epoch": 0.08031719986643285, "grad_norm": 0.5859375, "learning_rate": 4.514040186656375e-05, "loss": 0.4740769863128662, "num_input_tokens_seen": 644356096, "step": 2270, "train_runtime": 22038.8263, "train_tokens_per_second": 29237.314 }, { "epoch": 0.08067102013016163, "grad_norm": 0.60546875, "learning_rate": 4.512201698335644e-05, "loss": 0.4734847068786621, "num_input_tokens_seen": 647194560, "step": 2280, "train_runtime": 22137.4514, "train_tokens_per_second": 29235.279 }, { "epoch": 0.08102484039389041, "grad_norm": 0.59765625, "learning_rate": 4.510365454537496e-05, "loss": 0.4742901802062988, "num_input_tokens_seen": 650039296, "step": 2290, "train_runtime": 22233.3403, "train_tokens_per_second": 29237.141 }, { "epoch": 0.08137866065761919, "grad_norm": 0.58984375, "learning_rate": 4.5085314506985945e-05, "loss": 0.4732800483703613, "num_input_tokens_seen": 652945088, "step": 2300, "train_runtime": 22333.4529, "train_tokens_per_second": 29236.191 }, { "epoch": 0.08173248092134797, "grad_norm": 0.6015625, "learning_rate": 4.50669968226858e-05, "loss": 0.47473607063293455, "num_input_tokens_seen": 655788096, "step": 2310, "train_runtime": 22430.2258, "train_tokens_per_second": 29236.803 }, { "epoch": 0.08208630118507675, "grad_norm": 0.6015625, "learning_rate": 4.504870144710027e-05, "loss": 0.4761085510253906, "num_input_tokens_seen": 658622528, "step": 2320, "train_runtime": 22526.6623, "train_tokens_per_second": 29237.466 }, { "epoch": 0.08244012144880553, "grad_norm": 0.61328125, "learning_rate": 4.5030428334983884e-05, "loss": 0.478547477722168, "num_input_tokens_seen": 661542720, "step": 2330, "train_runtime": 22630.0996, "train_tokens_per_second": 29232.868 }, { "epoch": 0.0827939417125343, "grad_norm": 0.578125, "learning_rate": 4.501217744121959e-05, "loss": 0.4752105712890625, "num_input_tokens_seen": 664371264, "step": 2340, "train_runtime": 22725.6682, "train_tokens_per_second": 29234.4 }, { "epoch": 0.08314776197626308, "grad_norm": 0.5703125, "learning_rate": 4.499394872081821e-05, "loss": 0.47428164482116697, "num_input_tokens_seen": 667226688, "step": 2350, "train_runtime": 22822.4492, "train_tokens_per_second": 29235.543 }, { "epoch": 0.08350158223999186, "grad_norm": 0.60546875, "learning_rate": 4.4975742128918e-05, "loss": 0.4785414695739746, "num_input_tokens_seen": 670128512, "step": 2360, "train_runtime": 22921.1048, "train_tokens_per_second": 29236.309 }, { "epoch": 0.08385540250372064, "grad_norm": 0.59765625, "learning_rate": 4.495755762078418e-05, "loss": 0.47456836700439453, "num_input_tokens_seen": 672977984, "step": 2370, "train_runtime": 23016.0796, "train_tokens_per_second": 29239.471 }, { "epoch": 0.08420922276744942, "grad_norm": 0.63671875, "learning_rate": 4.49393951518085e-05, "loss": 0.47785263061523436, "num_input_tokens_seen": 675826496, "step": 2380, "train_runtime": 23113.1051, "train_tokens_per_second": 29239.97 }, { "epoch": 0.0845630430311782, "grad_norm": 0.5859375, "learning_rate": 4.4921254677508716e-05, "loss": 0.47466516494750977, "num_input_tokens_seen": 678657856, "step": 2390, "train_runtime": 23207.4088, "train_tokens_per_second": 29243.155 }, { "epoch": 0.08491686329490698, "grad_norm": 0.61328125, "learning_rate": 4.490313615352821e-05, "loss": 0.47445173263549806, "num_input_tokens_seen": 681497152, "step": 2400, "train_runtime": 23302.754, "train_tokens_per_second": 29245.348 }, { "epoch": 0.08527068355863576, "grad_norm": 0.609375, "learning_rate": 4.48850395356355e-05, "loss": 0.4685967445373535, "num_input_tokens_seen": 684355968, "step": 2410, "train_runtime": 23399.8478, "train_tokens_per_second": 29246.172 }, { "epoch": 0.08562450382236454, "grad_norm": 0.625, "learning_rate": 4.486696477972375e-05, "loss": 0.4712062358856201, "num_input_tokens_seen": 687187904, "step": 2420, "train_runtime": 23494.1246, "train_tokens_per_second": 29249.351 }, { "epoch": 0.08597832408609332, "grad_norm": 0.6015625, "learning_rate": 4.484891184181041e-05, "loss": 0.47417125701904295, "num_input_tokens_seen": 689986048, "step": 2430, "train_runtime": 23586.5638, "train_tokens_per_second": 29253.352 }, { "epoch": 0.0863321443498221, "grad_norm": 0.60546875, "learning_rate": 4.483088067803662e-05, "loss": 0.47461824417114257, "num_input_tokens_seen": 692802496, "step": 2440, "train_runtime": 23683.4359, "train_tokens_per_second": 29252.618 }, { "epoch": 0.08668596461355087, "grad_norm": 0.58203125, "learning_rate": 4.481287124466697e-05, "loss": 0.47368178367614744, "num_input_tokens_seen": 695674432, "step": 2450, "train_runtime": 23781.7637, "train_tokens_per_second": 29252.432 }, { "epoch": 0.08703978487727965, "grad_norm": 0.56640625, "learning_rate": 4.479488349808885e-05, "loss": 0.4781245231628418, "num_input_tokens_seen": 698575488, "step": 2460, "train_runtime": 23881.6686, "train_tokens_per_second": 29251.536 }, { "epoch": 0.08739360514100843, "grad_norm": 0.578125, "learning_rate": 4.4776917394812114e-05, "loss": 0.47491955757141113, "num_input_tokens_seen": 701434496, "step": 2470, "train_runtime": 23981.4477, "train_tokens_per_second": 29249.047 }, { "epoch": 0.0877474254047372, "grad_norm": 0.58203125, "learning_rate": 4.475897289146862e-05, "loss": 0.4757704734802246, "num_input_tokens_seen": 704291840, "step": 2480, "train_runtime": 24081.307, "train_tokens_per_second": 29246.413 }, { "epoch": 0.08810124566846599, "grad_norm": 0.58203125, "learning_rate": 4.4741049944811806e-05, "loss": 0.47130985260009767, "num_input_tokens_seen": 707117184, "step": 2490, "train_runtime": 24178.3855, "train_tokens_per_second": 29245.84 }, { "epoch": 0.08845506593219477, "grad_norm": 0.61328125, "learning_rate": 4.472314851171621e-05, "loss": 0.47155261039733887, "num_input_tokens_seen": 709938944, "step": 2500, "train_runtime": 24275.8201, "train_tokens_per_second": 29244.695 }, { "epoch": 0.08880888619592354, "grad_norm": 0.57421875, "learning_rate": 4.4705268549177084e-05, "loss": 0.46933469772338865, "num_input_tokens_seen": 712816832, "step": 2510, "train_runtime": 24374.0398, "train_tokens_per_second": 29244.919 }, { "epoch": 0.08916270645965232, "grad_norm": 0.60546875, "learning_rate": 4.468741001430989e-05, "loss": 0.4701040267944336, "num_input_tokens_seen": 715680704, "step": 2520, "train_runtime": 24472.2469, "train_tokens_per_second": 29244.585 }, { "epoch": 0.0895165267233811, "grad_norm": 0.59765625, "learning_rate": 4.466957286434997e-05, "loss": 0.4729485511779785, "num_input_tokens_seen": 718503552, "step": 2530, "train_runtime": 24567.1367, "train_tokens_per_second": 29246.532 }, { "epoch": 0.08987034698710988, "grad_norm": 0.59375, "learning_rate": 4.4651757056652e-05, "loss": 0.47142491340637205, "num_input_tokens_seen": 721313088, "step": 2540, "train_runtime": 24663.3361, "train_tokens_per_second": 29246.371 }, { "epoch": 0.09022416725083866, "grad_norm": 0.5859375, "learning_rate": 4.463396254868968e-05, "loss": 0.47236042022705077, "num_input_tokens_seen": 724171456, "step": 2550, "train_runtime": 24762.8515, "train_tokens_per_second": 29244.268 }, { "epoch": 0.09057798751456744, "grad_norm": 0.6171875, "learning_rate": 4.461618929805519e-05, "loss": 0.4721323013305664, "num_input_tokens_seen": 727007232, "step": 2560, "train_runtime": 24861.3916, "train_tokens_per_second": 29242.419 }, { "epoch": 0.09093180777829622, "grad_norm": 0.58984375, "learning_rate": 4.459843726245888e-05, "loss": 0.47497129440307617, "num_input_tokens_seen": 729885696, "step": 2570, "train_runtime": 24958.1264, "train_tokens_per_second": 29244.411 }, { "epoch": 0.091285628042025, "grad_norm": 0.57421875, "learning_rate": 4.458070639972875e-05, "loss": 0.4680130958557129, "num_input_tokens_seen": 732750016, "step": 2580, "train_runtime": 25055.1221, "train_tokens_per_second": 29245.518 }, { "epoch": 0.09163944830575378, "grad_norm": 0.578125, "learning_rate": 4.456299666781007e-05, "loss": 0.47108659744262693, "num_input_tokens_seen": 735551168, "step": 2590, "train_runtime": 25148.25, "train_tokens_per_second": 29248.603 }, { "epoch": 0.09199326856948256, "grad_norm": 0.58984375, "learning_rate": 4.4545308024764984e-05, "loss": 0.4726726531982422, "num_input_tokens_seen": 738383808, "step": 2600, "train_runtime": 25248.3029, "train_tokens_per_second": 29244.889 }, { "epoch": 0.09234708883321134, "grad_norm": 0.58984375, "learning_rate": 4.452764042877207e-05, "loss": 0.4747706413269043, "num_input_tokens_seen": 741271168, "step": 2610, "train_runtime": 25346.8555, "train_tokens_per_second": 29245.094 }, { "epoch": 0.09270090909694012, "grad_norm": 0.61328125, "learning_rate": 4.45099938381259e-05, "loss": 0.4734789848327637, "num_input_tokens_seen": 744088896, "step": 2620, "train_runtime": 25443.0629, "train_tokens_per_second": 29245.256 }, { "epoch": 0.0930547293606689, "grad_norm": 0.59375, "learning_rate": 4.449236821123667e-05, "loss": 0.47025070190429685, "num_input_tokens_seen": 746930688, "step": 2630, "train_runtime": 25538.782, "train_tokens_per_second": 29246.919 }, { "epoch": 0.09340854962439768, "grad_norm": 0.56640625, "learning_rate": 4.447476350662976e-05, "loss": 0.4715579032897949, "num_input_tokens_seen": 749821440, "step": 2640, "train_runtime": 25638.5953, "train_tokens_per_second": 29245.808 }, { "epoch": 0.09376236988812646, "grad_norm": 0.5703125, "learning_rate": 4.4457179682945346e-05, "loss": 0.4647881031036377, "num_input_tokens_seen": 752690176, "step": 2650, "train_runtime": 25737.8341, "train_tokens_per_second": 29244.503 }, { "epoch": 0.09411619015185524, "grad_norm": 0.5703125, "learning_rate": 4.443961669893798e-05, "loss": 0.46997499465942383, "num_input_tokens_seen": 755524736, "step": 2660, "train_runtime": 25834.6908, "train_tokens_per_second": 29244.582 }, { "epoch": 0.09447001041558402, "grad_norm": 0.6015625, "learning_rate": 4.4422074513476155e-05, "loss": 0.47669157981872556, "num_input_tokens_seen": 758300864, "step": 2670, "train_runtime": 25928.472, "train_tokens_per_second": 29245.875 }, { "epoch": 0.0948238306793128, "grad_norm": 0.59375, "learning_rate": 4.4404553085541955e-05, "loss": 0.465960693359375, "num_input_tokens_seen": 761173376, "step": 2680, "train_runtime": 26024.1535, "train_tokens_per_second": 29248.728 }, { "epoch": 0.09517765094304158, "grad_norm": 0.58984375, "learning_rate": 4.438705237423063e-05, "loss": 0.4664862632751465, "num_input_tokens_seen": 764039808, "step": 2690, "train_runtime": 26119.9455, "train_tokens_per_second": 29251.202 }, { "epoch": 0.09553147120677036, "grad_norm": 0.57421875, "learning_rate": 4.436957233875017e-05, "loss": 0.4669026374816895, "num_input_tokens_seen": 766838592, "step": 2700, "train_runtime": 26214.9104, "train_tokens_per_second": 29252.001 }, { "epoch": 0.09588529147049912, "grad_norm": 0.5859375, "learning_rate": 4.4352112938420956e-05, "loss": 0.47040748596191406, "num_input_tokens_seen": 769722496, "step": 2710, "train_runtime": 26314.5255, "train_tokens_per_second": 29250.86 }, { "epoch": 0.0962391117342279, "grad_norm": 0.59765625, "learning_rate": 4.433467413267529e-05, "loss": 0.46546106338500975, "num_input_tokens_seen": 772516544, "step": 2720, "train_runtime": 26410.2051, "train_tokens_per_second": 29250.683 }, { "epoch": 0.09659293199795668, "grad_norm": 0.59765625, "learning_rate": 4.431725588105708e-05, "loss": 0.4701519966125488, "num_input_tokens_seen": 775288064, "step": 2730, "train_runtime": 26505.124, "train_tokens_per_second": 29250.498 }, { "epoch": 0.09694675226168546, "grad_norm": 0.6015625, "learning_rate": 4.4299858143221377e-05, "loss": 0.467894458770752, "num_input_tokens_seen": 778139008, "step": 2740, "train_runtime": 26602.7883, "train_tokens_per_second": 29250.28 }, { "epoch": 0.09730057252541424, "grad_norm": 0.59765625, "learning_rate": 4.4282480878934065e-05, "loss": 0.47024030685424806, "num_input_tokens_seen": 781009600, "step": 2750, "train_runtime": 26700.9732, "train_tokens_per_second": 29250.23 }, { "epoch": 0.09765439278914302, "grad_norm": 0.58984375, "learning_rate": 4.4265124048071346e-05, "loss": 0.4699270248413086, "num_input_tokens_seen": 783864896, "step": 2760, "train_runtime": 26803.2228, "train_tokens_per_second": 29245.173 }, { "epoch": 0.0980082130528718, "grad_norm": 0.56640625, "learning_rate": 4.4247787610619477e-05, "loss": 0.4677596092224121, "num_input_tokens_seen": 786664128, "step": 2770, "train_runtime": 26897.5824, "train_tokens_per_second": 29246.648 }, { "epoch": 0.09836203331660058, "grad_norm": 0.60546875, "learning_rate": 4.42304715266743e-05, "loss": 0.4651189804077148, "num_input_tokens_seen": 789491136, "step": 2780, "train_runtime": 26994.9562, "train_tokens_per_second": 29245.876 }, { "epoch": 0.09871585358032936, "grad_norm": 0.57421875, "learning_rate": 4.421317575644092e-05, "loss": 0.46714029312133787, "num_input_tokens_seen": 792327488, "step": 2790, "train_runtime": 27092.0228, "train_tokens_per_second": 29245.786 }, { "epoch": 0.09906967384405814, "grad_norm": 0.5859375, "learning_rate": 4.419590026023325e-05, "loss": 0.46109347343444823, "num_input_tokens_seen": 795147904, "step": 2800, "train_runtime": 27191.1165, "train_tokens_per_second": 29242.93 }, { "epoch": 0.09942349410778692, "grad_norm": 0.56640625, "learning_rate": 4.417864499847368e-05, "loss": 0.46106829643249514, "num_input_tokens_seen": 797988288, "step": 2810, "train_runtime": 27286.3586, "train_tokens_per_second": 29244.954 }, { "epoch": 0.0997773143715157, "grad_norm": 0.5859375, "learning_rate": 4.4161409931692676e-05, "loss": 0.4673023223876953, "num_input_tokens_seen": 800824704, "step": 2820, "train_runtime": 27382.2401, "train_tokens_per_second": 29246.136 }, { "epoch": 0.10013113463524448, "grad_norm": 0.63671875, "learning_rate": 4.414419502052841e-05, "loss": 0.4656674861907959, "num_input_tokens_seen": 803713152, "step": 2830, "train_runtime": 27482.7755, "train_tokens_per_second": 29244.25 }, { "epoch": 0.10048495489897326, "grad_norm": 0.6171875, "learning_rate": 4.412700022572637e-05, "loss": 0.4688971996307373, "num_input_tokens_seen": 806536128, "step": 2840, "train_runtime": 27579.6745, "train_tokens_per_second": 29243.86 }, { "epoch": 0.10083877516270204, "grad_norm": 0.61328125, "learning_rate": 4.410982550813902e-05, "loss": 0.46872291564941404, "num_input_tokens_seen": 809369600, "step": 2850, "train_runtime": 27674.8775, "train_tokens_per_second": 29245.643 }, { "epoch": 0.10119259542643082, "grad_norm": 0.57421875, "learning_rate": 4.409267082872535e-05, "loss": 0.4665546417236328, "num_input_tokens_seen": 812267648, "step": 2860, "train_runtime": 27777.6491, "train_tokens_per_second": 29241.771 }, { "epoch": 0.1015464156901596, "grad_norm": 0.5859375, "learning_rate": 4.407553614855059e-05, "loss": 0.4677140712738037, "num_input_tokens_seen": 815092928, "step": 2870, "train_runtime": 27874.7343, "train_tokens_per_second": 29241.281 }, { "epoch": 0.10190023595388838, "grad_norm": 0.609375, "learning_rate": 4.405842142878579e-05, "loss": 0.4661547183990479, "num_input_tokens_seen": 817994752, "step": 2880, "train_runtime": 27974.3735, "train_tokens_per_second": 29240.86 }, { "epoch": 0.10225405621761716, "grad_norm": 0.5859375, "learning_rate": 4.404132663070745e-05, "loss": 0.4628773212432861, "num_input_tokens_seen": 820838144, "step": 2890, "train_runtime": 28069.5642, "train_tokens_per_second": 29242.996 }, { "epoch": 0.10260787648134594, "grad_norm": 0.58203125, "learning_rate": 4.402425171569716e-05, "loss": 0.4591650485992432, "num_input_tokens_seen": 823684480, "step": 2900, "train_runtime": 28168.1984, "train_tokens_per_second": 29241.646 }, { "epoch": 0.10296169674507472, "grad_norm": 0.5703125, "learning_rate": 4.400719664524127e-05, "loss": 0.46363110542297364, "num_input_tokens_seen": 826506304, "step": 2910, "train_runtime": 28264.666, "train_tokens_per_second": 29241.68 }, { "epoch": 0.1033155170088035, "grad_norm": 0.5859375, "learning_rate": 4.399016138093044e-05, "loss": 0.4681601047515869, "num_input_tokens_seen": 829323264, "step": 2920, "train_runtime": 28362.069, "train_tokens_per_second": 29240.577 }, { "epoch": 0.10366933727253227, "grad_norm": 0.5703125, "learning_rate": 4.397314588445937e-05, "loss": 0.46255884170532224, "num_input_tokens_seen": 832161984, "step": 2930, "train_runtime": 28458.5227, "train_tokens_per_second": 29241.222 }, { "epoch": 0.10402315753626105, "grad_norm": 0.578125, "learning_rate": 4.395615011762637e-05, "loss": 0.4611948013305664, "num_input_tokens_seen": 834996416, "step": 2940, "train_runtime": 28554.2134, "train_tokens_per_second": 29242.494 }, { "epoch": 0.10437697779998983, "grad_norm": 0.578125, "learning_rate": 4.3939174042333057e-05, "loss": 0.4690437316894531, "num_input_tokens_seen": 837916736, "step": 2950, "train_runtime": 28654.9799, "train_tokens_per_second": 29241.575 }, { "epoch": 0.10473079806371861, "grad_norm": 0.609375, "learning_rate": 4.3922217620583904e-05, "loss": 0.4671497821807861, "num_input_tokens_seen": 840767040, "step": 2960, "train_runtime": 28751.904, "train_tokens_per_second": 29242.134 }, { "epoch": 0.10508461832744738, "grad_norm": 0.59765625, "learning_rate": 4.3905280814486025e-05, "loss": 0.4650600433349609, "num_input_tokens_seen": 843630912, "step": 2970, "train_runtime": 28851.8868, "train_tokens_per_second": 29240.06 }, { "epoch": 0.10543843859117616, "grad_norm": 0.6015625, "learning_rate": 4.388836358624867e-05, "loss": 0.46319026947021485, "num_input_tokens_seen": 846460864, "step": 2980, "train_runtime": 28948.2457, "train_tokens_per_second": 29240.489 }, { "epoch": 0.10579225885490494, "grad_norm": 0.5859375, "learning_rate": 4.3871465898182976e-05, "loss": 0.46334037780761717, "num_input_tokens_seen": 849315712, "step": 2990, "train_runtime": 29045.2387, "train_tokens_per_second": 29241.134 }, { "epoch": 0.10614607911863372, "grad_norm": 0.58984375, "learning_rate": 4.385458771270156e-05, "loss": 0.4656219005584717, "num_input_tokens_seen": 852171840, "step": 3000, "train_runtime": 29142.881, "train_tokens_per_second": 29241.167 }, { "epoch": 0.1064998993823625, "grad_norm": 0.58203125, "learning_rate": 4.3837728992318205e-05, "loss": 0.4621277332305908, "num_input_tokens_seen": 855081664, "step": 3010, "train_runtime": 29244.2836, "train_tokens_per_second": 29239.275 }, { "epoch": 0.10685371964609128, "grad_norm": 0.578125, "learning_rate": 4.382088969964746e-05, "loss": 0.4653298377990723, "num_input_tokens_seen": 857962944, "step": 3020, "train_runtime": 29345.035, "train_tokens_per_second": 29237.073 }, { "epoch": 0.10720753990982006, "grad_norm": 0.56640625, "learning_rate": 4.380406979740436e-05, "loss": 0.4639897346496582, "num_input_tokens_seen": 860796160, "step": 3030, "train_runtime": 29440.6292, "train_tokens_per_second": 29238.375 }, { "epoch": 0.10756136017354884, "grad_norm": 0.60546875, "learning_rate": 4.3787269248403994e-05, "loss": 0.4654397487640381, "num_input_tokens_seen": 863619072, "step": 3040, "train_runtime": 29539.103, "train_tokens_per_second": 29236.469 }, { "epoch": 0.10791518043727762, "grad_norm": 0.57421875, "learning_rate": 4.377048801556126e-05, "loss": 0.4612120628356934, "num_input_tokens_seen": 866453888, "step": 3050, "train_runtime": 29634.7419, "train_tokens_per_second": 29237.774 }, { "epoch": 0.1082690007010064, "grad_norm": 0.5859375, "learning_rate": 4.3753726061890446e-05, "loss": 0.4632655143737793, "num_input_tokens_seen": 869239744, "step": 3060, "train_runtime": 29729.1417, "train_tokens_per_second": 29238.642 }, { "epoch": 0.10862282096473518, "grad_norm": 0.58203125, "learning_rate": 4.373698335050488e-05, "loss": 0.4609369277954102, "num_input_tokens_seen": 872085568, "step": 3070, "train_runtime": 29828.317, "train_tokens_per_second": 29236.834 }, { "epoch": 0.10897664122846396, "grad_norm": 0.6015625, "learning_rate": 4.372025984461667e-05, "loss": 0.4588226318359375, "num_input_tokens_seen": 874937024, "step": 3080, "train_runtime": 29928.0732, "train_tokens_per_second": 29234.659 }, { "epoch": 0.10933046149219273, "grad_norm": 0.58984375, "learning_rate": 4.370355550753629e-05, "loss": 0.4575453281402588, "num_input_tokens_seen": 877781248, "step": 3090, "train_runtime": 30024.6702, "train_tokens_per_second": 29235.334 }, { "epoch": 0.10968428175592151, "grad_norm": 0.58203125, "learning_rate": 4.368687030267226e-05, "loss": 0.4613487720489502, "num_input_tokens_seen": 880572416, "step": 3100, "train_runtime": 30115.8335, "train_tokens_per_second": 29239.517 }, { "epoch": 0.1100381020196503, "grad_norm": 0.5625, "learning_rate": 4.367020419353081e-05, "loss": 0.4559629440307617, "num_input_tokens_seen": 883425984, "step": 3110, "train_runtime": 30213.5201, "train_tokens_per_second": 29239.426 }, { "epoch": 0.11039192228337907, "grad_norm": 0.5625, "learning_rate": 4.365355714371558e-05, "loss": 0.4625598430633545, "num_input_tokens_seen": 886238272, "step": 3120, "train_runtime": 30307.4264, "train_tokens_per_second": 29241.621 }, { "epoch": 0.11074574254710785, "grad_norm": 0.55078125, "learning_rate": 4.3636929116927235e-05, "loss": 0.4601325988769531, "num_input_tokens_seen": 889061760, "step": 3130, "train_runtime": 30405.4857, "train_tokens_per_second": 29240.176 }, { "epoch": 0.11109956281083663, "grad_norm": 0.5859375, "learning_rate": 4.362032007696314e-05, "loss": 0.45470199584960935, "num_input_tokens_seen": 891973888, "step": 3140, "train_runtime": 30506.5573, "train_tokens_per_second": 29238.759 }, { "epoch": 0.11145338307456541, "grad_norm": 0.578125, "learning_rate": 4.360372998771707e-05, "loss": 0.46184520721435546, "num_input_tokens_seen": 894815232, "step": 3150, "train_runtime": 30603.8801, "train_tokens_per_second": 29238.62 }, { "epoch": 0.11180720333829419, "grad_norm": 0.58203125, "learning_rate": 4.358715881317884e-05, "loss": 0.4563714027404785, "num_input_tokens_seen": 897675520, "step": 3160, "train_runtime": 30701.5098, "train_tokens_per_second": 29238.807 }, { "epoch": 0.11216102360202297, "grad_norm": 0.59765625, "learning_rate": 4.357060651743399e-05, "loss": 0.4601877212524414, "num_input_tokens_seen": 900471808, "step": 3170, "train_runtime": 30795.4976, "train_tokens_per_second": 29240.372 }, { "epoch": 0.11251484386575175, "grad_norm": 0.55859375, "learning_rate": 4.3554073064663454e-05, "loss": 0.45745162963867186, "num_input_tokens_seen": 903332224, "step": 3180, "train_runtime": 30893.007, "train_tokens_per_second": 29240.67 }, { "epoch": 0.11286866412948053, "grad_norm": 0.57421875, "learning_rate": 4.353755841914325e-05, "loss": 0.46396403312683104, "num_input_tokens_seen": 906127424, "step": 3190, "train_runtime": 30988.7253, "train_tokens_per_second": 29240.552 }, { "epoch": 0.11322248439320931, "grad_norm": 0.56640625, "learning_rate": 4.3521062545244116e-05, "loss": 0.46085448265075685, "num_input_tokens_seen": 908971136, "step": 3200, "train_runtime": 31087.1403, "train_tokens_per_second": 29239.458 }, { "epoch": 0.11357630465693809, "grad_norm": 0.56640625, "learning_rate": 4.350458540743126e-05, "loss": 0.4626326560974121, "num_input_tokens_seen": 911782080, "step": 3210, "train_runtime": 31181.442, "train_tokens_per_second": 29241.178 }, { "epoch": 0.11393012492066686, "grad_norm": 0.578125, "learning_rate": 4.3488126970263955e-05, "loss": 0.459613561630249, "num_input_tokens_seen": 914660992, "step": 3220, "train_runtime": 31280.785, "train_tokens_per_second": 29240.347 }, { "epoch": 0.11428394518439564, "grad_norm": 0.56640625, "learning_rate": 4.347168719839527e-05, "loss": 0.456086254119873, "num_input_tokens_seen": 917527296, "step": 3230, "train_runtime": 31376.2338, "train_tokens_per_second": 29242.748 }, { "epoch": 0.11463776544812442, "grad_norm": 0.578125, "learning_rate": 4.345526605657173e-05, "loss": 0.45608949661254883, "num_input_tokens_seen": 920384640, "step": 3240, "train_runtime": 31474.9727, "train_tokens_per_second": 29241.793 }, { "epoch": 0.1149915857118532, "grad_norm": 0.5703125, "learning_rate": 4.343886350963304e-05, "loss": 0.460129451751709, "num_input_tokens_seen": 923238016, "step": 3250, "train_runtime": 31574.2738, "train_tokens_per_second": 29240.198 }, { "epoch": 0.11534540597558197, "grad_norm": 0.58203125, "learning_rate": 4.3422479522511697e-05, "loss": 0.4605868339538574, "num_input_tokens_seen": 926139264, "step": 3260, "train_runtime": 31677.8043, "train_tokens_per_second": 29236.22 }, { "epoch": 0.11569922623931075, "grad_norm": 0.59375, "learning_rate": 4.340611406023272e-05, "loss": 0.4636395454406738, "num_input_tokens_seen": 928941120, "step": 3270, "train_runtime": 31770.5738, "train_tokens_per_second": 29239.041 }, { "epoch": 0.11605304650303953, "grad_norm": 0.58984375, "learning_rate": 4.338976708791336e-05, "loss": 0.45813422203063964, "num_input_tokens_seen": 931777472, "step": 3280, "train_runtime": 31867.5449, "train_tokens_per_second": 29239.073 }, { "epoch": 0.11640686676676831, "grad_norm": 0.5703125, "learning_rate": 4.337343857076272e-05, "loss": 0.45672240257263186, "num_input_tokens_seen": 934654080, "step": 3290, "train_runtime": 31967.5512, "train_tokens_per_second": 29237.588 }, { "epoch": 0.11676068703049709, "grad_norm": 0.578125, "learning_rate": 4.33571284740815e-05, "loss": 0.4613646984100342, "num_input_tokens_seen": 937466048, "step": 3300, "train_runtime": 32062.7104, "train_tokens_per_second": 29238.515 }, { "epoch": 0.11711450729422587, "grad_norm": 0.5859375, "learning_rate": 4.3340836763261675e-05, "loss": 0.46317329406738283, "num_input_tokens_seen": 940354688, "step": 3310, "train_runtime": 32165.0962, "train_tokens_per_second": 29235.252 }, { "epoch": 0.11746832755795465, "grad_norm": 0.59375, "learning_rate": 4.332456340378618e-05, "loss": 0.45850648880004885, "num_input_tokens_seen": 943173696, "step": 3320, "train_runtime": 32260.9528, "train_tokens_per_second": 29235.767 }, { "epoch": 0.11782214782168343, "grad_norm": 0.58203125, "learning_rate": 4.3308308361228586e-05, "loss": 0.4607564926147461, "num_input_tokens_seen": 946035008, "step": 3330, "train_runtime": 32359.7855, "train_tokens_per_second": 29234.897 }, { "epoch": 0.11817596808541221, "grad_norm": 0.609375, "learning_rate": 4.329207160125282e-05, "loss": 0.45890512466430666, "num_input_tokens_seen": 948837056, "step": 3340, "train_runtime": 32453.4983, "train_tokens_per_second": 29236.819 }, { "epoch": 0.11852978834914099, "grad_norm": 0.56640625, "learning_rate": 4.327585308961287e-05, "loss": 0.4617131233215332, "num_input_tokens_seen": 951684928, "step": 3350, "train_runtime": 32551.7129, "train_tokens_per_second": 29236.094 }, { "epoch": 0.11888360861286977, "grad_norm": 0.55078125, "learning_rate": 4.325965279215243e-05, "loss": 0.4547280311584473, "num_input_tokens_seen": 954490496, "step": 3360, "train_runtime": 32644.7359, "train_tokens_per_second": 29238.726 }, { "epoch": 0.11923742887659855, "grad_norm": 0.57421875, "learning_rate": 4.3243470674804686e-05, "loss": 0.45595827102661135, "num_input_tokens_seen": 957301120, "step": 3370, "train_runtime": 32739.4169, "train_tokens_per_second": 29240.017 }, { "epoch": 0.11959124914032733, "grad_norm": 0.59375, "learning_rate": 4.3227306703591904e-05, "loss": 0.4553481101989746, "num_input_tokens_seen": 960131584, "step": 3380, "train_runtime": 32834.606, "train_tokens_per_second": 29241.453 }, { "epoch": 0.11994506940405611, "grad_norm": 0.5546875, "learning_rate": 4.32111608446252e-05, "loss": 0.454563045501709, "num_input_tokens_seen": 962939648, "step": 3390, "train_runtime": 32926.6867, "train_tokens_per_second": 29244.96 }, { "epoch": 0.12029888966778489, "grad_norm": 0.55859375, "learning_rate": 4.319503306410426e-05, "loss": 0.4604179382324219, "num_input_tokens_seen": 965777408, "step": 3400, "train_runtime": 33019.0209, "train_tokens_per_second": 29249.123 }, { "epoch": 0.12065270993151367, "grad_norm": 0.58984375, "learning_rate": 4.317892332831699e-05, "loss": 0.4535073280334473, "num_input_tokens_seen": 968573504, "step": 3410, "train_runtime": 33111.6067, "train_tokens_per_second": 29251.782 }, { "epoch": 0.12100653019524245, "grad_norm": 0.58984375, "learning_rate": 4.316283160363922e-05, "loss": 0.4528909683227539, "num_input_tokens_seen": 971386240, "step": 3420, "train_runtime": 33205.2318, "train_tokens_per_second": 29254.012 }, { "epoch": 0.12136035045897123, "grad_norm": 0.5703125, "learning_rate": 4.314675785653447e-05, "loss": 0.4609466552734375, "num_input_tokens_seen": 974241984, "step": 3430, "train_runtime": 33304.4337, "train_tokens_per_second": 29252.621 }, { "epoch": 0.12171417072270001, "grad_norm": 0.55859375, "learning_rate": 4.3130702053553606e-05, "loss": 0.4554624557495117, "num_input_tokens_seen": 977055936, "step": 3440, "train_runtime": 33398.0832, "train_tokens_per_second": 29254.851 }, { "epoch": 0.12206799098642879, "grad_norm": 0.5703125, "learning_rate": 4.3114664161334546e-05, "loss": 0.45702285766601564, "num_input_tokens_seen": 979927168, "step": 3450, "train_runtime": 33495.4348, "train_tokens_per_second": 29255.544 }, { "epoch": 0.12242181125015757, "grad_norm": 0.58984375, "learning_rate": 4.3098644146601984e-05, "loss": 0.4516008377075195, "num_input_tokens_seen": 982789760, "step": 3460, "train_runtime": 33595.244, "train_tokens_per_second": 29253.836 }, { "epoch": 0.12277563151388635, "grad_norm": 0.5703125, "learning_rate": 4.30826419761671e-05, "loss": 0.4585239410400391, "num_input_tokens_seen": 985613760, "step": 3470, "train_runtime": 33690.508, "train_tokens_per_second": 29254.939 }, { "epoch": 0.12312945177761511, "grad_norm": 0.59375, "learning_rate": 4.30666576169273e-05, "loss": 0.4601104259490967, "num_input_tokens_seen": 988397824, "step": 3480, "train_runtime": 33780.5111, "train_tokens_per_second": 29259.41 }, { "epoch": 0.12348327204134389, "grad_norm": 0.65625, "learning_rate": 4.305069103586585e-05, "loss": 0.4570477485656738, "num_input_tokens_seen": 991241024, "step": 3490, "train_runtime": 33873.8417, "train_tokens_per_second": 29262.728 }, { "epoch": 0.12383709230507267, "grad_norm": 0.6015625, "learning_rate": 4.303474220005164e-05, "loss": 0.45610885620117186, "num_input_tokens_seen": 994065856, "step": 3500, "train_runtime": 33967.4752, "train_tokens_per_second": 29265.227 }, { "epoch": 0.12419091256880145, "grad_norm": 0.58203125, "learning_rate": 4.3018811076638944e-05, "loss": 0.4574295997619629, "num_input_tokens_seen": 996866560, "step": 3510, "train_runtime": 34063.3403, "train_tokens_per_second": 29265.085 }, { "epoch": 0.12454473283253023, "grad_norm": 0.5859375, "learning_rate": 4.300289763286704e-05, "loss": 0.45502915382385256, "num_input_tokens_seen": 999720064, "step": 3520, "train_runtime": 34159.3455, "train_tokens_per_second": 29266.371 }, { "epoch": 0.12489855309625901, "grad_norm": 0.6015625, "learning_rate": 4.298700183606e-05, "loss": 0.4610752105712891, "num_input_tokens_seen": 1002563968, "step": 3530, "train_runtime": 34257.4393, "train_tokens_per_second": 29265.584 }, { "epoch": 0.1252523733599878, "grad_norm": 0.58203125, "learning_rate": 4.297112365362637e-05, "loss": 0.4594162940979004, "num_input_tokens_seen": 1005402176, "step": 3540, "train_runtime": 34353.0211, "train_tokens_per_second": 29266.776 }, { "epoch": 0.12560619362371658, "grad_norm": 0.55078125, "learning_rate": 4.295526305305891e-05, "loss": 0.45300869941711425, "num_input_tokens_seen": 1008258880, "step": 3550, "train_runtime": 34449.2917, "train_tokens_per_second": 29267.913 }, { "epoch": 0.12596001388744535, "grad_norm": 0.6015625, "learning_rate": 4.293942000193429e-05, "loss": 0.45346708297729493, "num_input_tokens_seen": 1011047872, "step": 3560, "train_runtime": 34544.805, "train_tokens_per_second": 29267.726 }, { "epoch": 0.12631383415117414, "grad_norm": 0.58984375, "learning_rate": 4.2923594467912866e-05, "loss": 0.45587739944458006, "num_input_tokens_seen": 1013899392, "step": 3570, "train_runtime": 34639.7096, "train_tokens_per_second": 29269.858 }, { "epoch": 0.1266676544149029, "grad_norm": 0.578125, "learning_rate": 4.290778641873832e-05, "loss": 0.45630655288696287, "num_input_tokens_seen": 1016776256, "step": 3580, "train_runtime": 34736.7158, "train_tokens_per_second": 29270.938 }, { "epoch": 0.1270214746786317, "grad_norm": 0.5625, "learning_rate": 4.2891995822237455e-05, "loss": 0.45297880172729493, "num_input_tokens_seen": 1019636224, "step": 3590, "train_runtime": 34833.7922, "train_tokens_per_second": 29271.468 }, { "epoch": 0.12737529494236047, "grad_norm": 0.578125, "learning_rate": 4.28762226463199e-05, "loss": 0.45767717361450194, "num_input_tokens_seen": 1022491264, "step": 3600, "train_runtime": 34931.1145, "train_tokens_per_second": 29271.647 }, { "epoch": 0.12772911520608923, "grad_norm": 0.59375, "learning_rate": 4.286046685897781e-05, "loss": 0.4487922191619873, "num_input_tokens_seen": 1025290688, "step": 3610, "train_runtime": 35024.2945, "train_tokens_per_second": 29273.7 }, { "epoch": 0.12808293546981803, "grad_norm": 0.57421875, "learning_rate": 4.284472842828562e-05, "loss": 0.4598641872406006, "num_input_tokens_seen": 1028080896, "step": 3620, "train_runtime": 35115.3025, "train_tokens_per_second": 29277.29 }, { "epoch": 0.1284367557335468, "grad_norm": 0.5546875, "learning_rate": 4.282900732239977e-05, "loss": 0.45454702377319334, "num_input_tokens_seen": 1030951360, "step": 3630, "train_runtime": 35212.0358, "train_tokens_per_second": 29278.38 }, { "epoch": 0.12879057599727559, "grad_norm": 0.57421875, "learning_rate": 4.281330350955845e-05, "loss": 0.45328598022460936, "num_input_tokens_seen": 1033796352, "step": 3640, "train_runtime": 35309.0996, "train_tokens_per_second": 29278.468 }, { "epoch": 0.12914439626100435, "grad_norm": 0.578125, "learning_rate": 4.279761695808125e-05, "loss": 0.45642919540405275, "num_input_tokens_seen": 1036626624, "step": 3650, "train_runtime": 35405.8836, "train_tokens_per_second": 29278.372 }, { "epoch": 0.12949821652473315, "grad_norm": 0.56640625, "learning_rate": 4.278194763636904e-05, "loss": 0.45912914276123046, "num_input_tokens_seen": 1039479552, "step": 3660, "train_runtime": 35504.7294, "train_tokens_per_second": 29277.214 }, { "epoch": 0.1298520367884619, "grad_norm": 0.58984375, "learning_rate": 4.276629551290354e-05, "loss": 0.4563636779785156, "num_input_tokens_seen": 1042291904, "step": 3670, "train_runtime": 35600.895, "train_tokens_per_second": 29277.126 }, { "epoch": 0.1302058570521907, "grad_norm": 0.5703125, "learning_rate": 4.2750660556247175e-05, "loss": 0.45493526458740235, "num_input_tokens_seen": 1045103104, "step": 3680, "train_runtime": 35697.7762, "train_tokens_per_second": 29276.42 }, { "epoch": 0.13055967731591947, "grad_norm": 0.5703125, "learning_rate": 4.273504273504274e-05, "loss": 0.4566159725189209, "num_input_tokens_seen": 1047985280, "step": 3690, "train_runtime": 35795.4584, "train_tokens_per_second": 29277.046 }, { "epoch": 0.13091349757964826, "grad_norm": 0.5859375, "learning_rate": 4.271944201801317e-05, "loss": 0.4487285614013672, "num_input_tokens_seen": 1050893376, "step": 3700, "train_runtime": 35895.123, "train_tokens_per_second": 29276.773 }, { "epoch": 0.13126731784337703, "grad_norm": 0.57421875, "learning_rate": 4.270385837396127e-05, "loss": 0.4545039176940918, "num_input_tokens_seen": 1053785536, "step": 3710, "train_runtime": 35994.6059, "train_tokens_per_second": 29276.207 }, { "epoch": 0.13162113810710582, "grad_norm": 0.5859375, "learning_rate": 4.268829177176945e-05, "loss": 0.45177464485168456, "num_input_tokens_seen": 1056617280, "step": 3720, "train_runtime": 36088.1237, "train_tokens_per_second": 29278.809 }, { "epoch": 0.1319749583708346, "grad_norm": 0.5703125, "learning_rate": 4.2672742180399455e-05, "loss": 0.4510002136230469, "num_input_tokens_seen": 1059486912, "step": 3730, "train_runtime": 36186.0883, "train_tokens_per_second": 29278.846 }, { "epoch": 0.13232877863456338, "grad_norm": 0.58203125, "learning_rate": 4.265720956889213e-05, "loss": 0.4509366512298584, "num_input_tokens_seen": 1062342016, "step": 3740, "train_runtime": 36283.4094, "train_tokens_per_second": 29279.002 }, { "epoch": 0.13268259889829215, "grad_norm": 0.59375, "learning_rate": 4.2641693906367113e-05, "loss": 0.45595321655273435, "num_input_tokens_seen": 1065209920, "step": 3750, "train_runtime": 36384.0012, "train_tokens_per_second": 29276.877 }, { "epoch": 0.13303641916202094, "grad_norm": 0.57421875, "learning_rate": 4.2626195162022646e-05, "loss": 0.4538719654083252, "num_input_tokens_seen": 1068011200, "step": 3760, "train_runtime": 36477.8307, "train_tokens_per_second": 29278.364 }, { "epoch": 0.1333902394257497, "grad_norm": 0.5625, "learning_rate": 4.2610713305135255e-05, "loss": 0.45287380218505857, "num_input_tokens_seen": 1070900608, "step": 3770, "train_runtime": 36579.4611, "train_tokens_per_second": 29276.008 }, { "epoch": 0.1337440596894785, "grad_norm": 0.55078125, "learning_rate": 4.2595248305059546e-05, "loss": 0.4500288009643555, "num_input_tokens_seen": 1073795328, "step": 3780, "train_runtime": 36680.6327, "train_tokens_per_second": 29274.177 }, { "epoch": 0.13409787995320727, "grad_norm": 0.58203125, "learning_rate": 4.2579800131227916e-05, "loss": 0.4546367645263672, "num_input_tokens_seen": 1076604416, "step": 3790, "train_runtime": 36774.6455, "train_tokens_per_second": 29275.725 }, { "epoch": 0.13445170021693606, "grad_norm": 0.5703125, "learning_rate": 4.256436875315028e-05, "loss": 0.45539026260375975, "num_input_tokens_seen": 1079443520, "step": 3800, "train_runtime": 36867.7115, "train_tokens_per_second": 29278.832 }, { "epoch": 0.13480552048066483, "grad_norm": 0.58203125, "learning_rate": 4.2548954140413895e-05, "loss": 0.4538921356201172, "num_input_tokens_seen": 1082304064, "step": 3810, "train_runtime": 36964.165, "train_tokens_per_second": 29279.819 }, { "epoch": 0.13515934074439362, "grad_norm": 0.5703125, "learning_rate": 4.253355626268302e-05, "loss": 0.4505466938018799, "num_input_tokens_seen": 1085158976, "step": 3820, "train_runtime": 37061.8534, "train_tokens_per_second": 29279.674 }, { "epoch": 0.13551316100812238, "grad_norm": 0.609375, "learning_rate": 4.2518175089698716e-05, "loss": 0.4554553508758545, "num_input_tokens_seen": 1088037632, "step": 3830, "train_runtime": 37162.5735, "train_tokens_per_second": 29277.779 }, { "epoch": 0.13586698127185118, "grad_norm": 0.57421875, "learning_rate": 4.25028105912786e-05, "loss": 0.45158748626708983, "num_input_tokens_seen": 1090901952, "step": 3840, "train_runtime": 37265.3789, "train_tokens_per_second": 29273.873 }, { "epoch": 0.13622080153557994, "grad_norm": 0.59765625, "learning_rate": 4.2487462737316565e-05, "loss": 0.45415143966674804, "num_input_tokens_seen": 1093725824, "step": 3850, "train_runtime": 37362.0133, "train_tokens_per_second": 29273.739 }, { "epoch": 0.13657462179930874, "grad_norm": 0.5859375, "learning_rate": 4.2472131497782555e-05, "loss": 0.4521495819091797, "num_input_tokens_seen": 1096502720, "step": 3860, "train_runtime": 37453.3127, "train_tokens_per_second": 29276.522 }, { "epoch": 0.1369284420630375, "grad_norm": 0.58203125, "learning_rate": 4.245681684272231e-05, "loss": 0.4537048816680908, "num_input_tokens_seen": 1099356800, "step": 3870, "train_runtime": 37549.847, "train_tokens_per_second": 29277.264 }, { "epoch": 0.13728226232676627, "grad_norm": 0.57421875, "learning_rate": 4.244151874225712e-05, "loss": 0.45152950286865234, "num_input_tokens_seen": 1102169280, "step": 3880, "train_runtime": 37644.0084, "train_tokens_per_second": 29278.744 }, { "epoch": 0.13763608259049506, "grad_norm": 0.58984375, "learning_rate": 4.2426237166583596e-05, "loss": 0.44892234802246095, "num_input_tokens_seen": 1105003328, "step": 3890, "train_runtime": 37743.2785, "train_tokens_per_second": 29276.824 }, { "epoch": 0.13798990285422383, "grad_norm": 0.56640625, "learning_rate": 4.241097208597339e-05, "loss": 0.44681386947631835, "num_input_tokens_seen": 1107821184, "step": 3900, "train_runtime": 37837.5494, "train_tokens_per_second": 29278.354 }, { "epoch": 0.13834372311795262, "grad_norm": 0.5390625, "learning_rate": 4.2395723470773005e-05, "loss": 0.45065946578979493, "num_input_tokens_seen": 1110715968, "step": 3910, "train_runtime": 37936.5788, "train_tokens_per_second": 29278.232 }, { "epoch": 0.1386975433816814, "grad_norm": 0.5390625, "learning_rate": 4.238049129140347e-05, "loss": 0.45148382186889646, "num_input_tokens_seen": 1113568000, "step": 3920, "train_runtime": 38035.0983, "train_tokens_per_second": 29277.379 }, { "epoch": 0.13905136364541018, "grad_norm": 0.59765625, "learning_rate": 4.236527551836022e-05, "loss": 0.4460158348083496, "num_input_tokens_seen": 1116387136, "step": 3930, "train_runtime": 38129.4486, "train_tokens_per_second": 29278.869 }, { "epoch": 0.13940518390913895, "grad_norm": 0.5859375, "learning_rate": 4.235007612221274e-05, "loss": 0.447994327545166, "num_input_tokens_seen": 1119228928, "step": 3940, "train_runtime": 38223.5096, "train_tokens_per_second": 29281.166 }, { "epoch": 0.13975900417286774, "grad_norm": 0.56640625, "learning_rate": 4.2334893073604386e-05, "loss": 0.44850983619689944, "num_input_tokens_seen": 1122038912, "step": 3950, "train_runtime": 38316.52, "train_tokens_per_second": 29283.424 }, { "epoch": 0.1401128244365965, "grad_norm": 0.55859375, "learning_rate": 4.231972634325214e-05, "loss": 0.45399012565612795, "num_input_tokens_seen": 1124911232, "step": 3960, "train_runtime": 38416.7375, "train_tokens_per_second": 29281.8 }, { "epoch": 0.1404666447003253, "grad_norm": 0.55859375, "learning_rate": 4.230457590194635e-05, "loss": 0.4500166893005371, "num_input_tokens_seen": 1127771200, "step": 3970, "train_runtime": 38514.8297, "train_tokens_per_second": 29281.48 }, { "epoch": 0.14082046496405407, "grad_norm": 0.53125, "learning_rate": 4.228944172055053e-05, "loss": 0.4504100799560547, "num_input_tokens_seen": 1130658240, "step": 3980, "train_runtime": 38614.1783, "train_tokens_per_second": 29280.909 }, { "epoch": 0.14117428522778286, "grad_norm": 0.609375, "learning_rate": 4.22743237700011e-05, "loss": 0.451992130279541, "num_input_tokens_seen": 1133511744, "step": 3990, "train_runtime": 38712.8516, "train_tokens_per_second": 29279.986 }, { "epoch": 0.14152810549151162, "grad_norm": 0.5859375, "learning_rate": 4.225922202130716e-05, "loss": 0.4450711727142334, "num_input_tokens_seen": 1136350848, "step": 4000, "train_runtime": 38809.7896, "train_tokens_per_second": 29280.005 }, { "epoch": 0.14188192575524042, "grad_norm": 0.57421875, "learning_rate": 4.224413644555024e-05, "loss": 0.4510810375213623, "num_input_tokens_seen": 1139143808, "step": 4010, "train_runtime": 38903.4318, "train_tokens_per_second": 29281.319 }, { "epoch": 0.14223574601896918, "grad_norm": 0.625, "learning_rate": 4.222906701388411e-05, "loss": 0.45055713653564455, "num_input_tokens_seen": 1141969856, "step": 4020, "train_runtime": 39002.1782, "train_tokens_per_second": 29279.643 }, { "epoch": 0.14258956628269798, "grad_norm": 0.58984375, "learning_rate": 4.2214013697534466e-05, "loss": 0.45257959365844724, "num_input_tokens_seen": 1144803136, "step": 4030, "train_runtime": 39100.3578, "train_tokens_per_second": 29278.585 }, { "epoch": 0.14294338654642674, "grad_norm": 0.58203125, "learning_rate": 4.219897646779882e-05, "loss": 0.4558560371398926, "num_input_tokens_seen": 1147692672, "step": 4040, "train_runtime": 39202.9539, "train_tokens_per_second": 29275.668 }, { "epoch": 0.14329720681015554, "grad_norm": 0.55078125, "learning_rate": 4.2183955296046145e-05, "loss": 0.45154776573181155, "num_input_tokens_seen": 1150605952, "step": 4050, "train_runtime": 39305.4902, "train_tokens_per_second": 29273.416 }, { "epoch": 0.1436510270738843, "grad_norm": 0.55859375, "learning_rate": 4.2168950153716746e-05, "loss": 0.4491125106811523, "num_input_tokens_seen": 1153387008, "step": 4060, "train_runtime": 39398.6764, "train_tokens_per_second": 29274.765 }, { "epoch": 0.1440048473376131, "grad_norm": 0.5625, "learning_rate": 4.215396101232197e-05, "loss": 0.44748859405517577, "num_input_tokens_seen": 1156206208, "step": 4070, "train_runtime": 39492.9816, "train_tokens_per_second": 29276.245 }, { "epoch": 0.14435866760134186, "grad_norm": 0.58984375, "learning_rate": 4.213898784344398e-05, "loss": 0.4471442699432373, "num_input_tokens_seen": 1159107648, "step": 4080, "train_runtime": 39594.0109, "train_tokens_per_second": 29274.823 }, { "epoch": 0.14471248786507065, "grad_norm": 0.55859375, "learning_rate": 4.21240306187356e-05, "loss": 0.44981160163879397, "num_input_tokens_seen": 1161944576, "step": 4090, "train_runtime": 39691.417, "train_tokens_per_second": 29274.454 }, { "epoch": 0.14506630812879942, "grad_norm": 0.55859375, "learning_rate": 4.2109089309919967e-05, "loss": 0.4546297550201416, "num_input_tokens_seen": 1164828992, "step": 4100, "train_runtime": 39790.9805, "train_tokens_per_second": 29273.694 }, { "epoch": 0.14542012839252821, "grad_norm": 0.57421875, "learning_rate": 4.2094163888790445e-05, "loss": 0.4490847110748291, "num_input_tokens_seen": 1167660480, "step": 4110, "train_runtime": 39886.9364, "train_tokens_per_second": 29274.258 }, { "epoch": 0.14577394865625698, "grad_norm": 0.55859375, "learning_rate": 4.2079254327210294e-05, "loss": 0.445095157623291, "num_input_tokens_seen": 1170493056, "step": 4120, "train_runtime": 39985.3671, "train_tokens_per_second": 29273.035 }, { "epoch": 0.14612776891998575, "grad_norm": 0.57421875, "learning_rate": 4.206436059711249e-05, "loss": 0.45116581916809084, "num_input_tokens_seen": 1173303936, "step": 4130, "train_runtime": 40081.9337, "train_tokens_per_second": 29272.638 }, { "epoch": 0.14648158918371454, "grad_norm": 0.57421875, "learning_rate": 4.20494826704995e-05, "loss": 0.4513398170471191, "num_input_tokens_seen": 1176151616, "step": 4140, "train_runtime": 40181.3332, "train_tokens_per_second": 29271.095 }, { "epoch": 0.1468354094474433, "grad_norm": 0.578125, "learning_rate": 4.203462051944307e-05, "loss": 0.44718356132507325, "num_input_tokens_seen": 1179087552, "step": 4150, "train_runtime": 40285.7438, "train_tokens_per_second": 29268.109 }, { "epoch": 0.1471892297111721, "grad_norm": 0.57421875, "learning_rate": 4.201977411608398e-05, "loss": 0.4508021354675293, "num_input_tokens_seen": 1181852160, "step": 4160, "train_runtime": 40377.9135, "train_tokens_per_second": 29269.768 }, { "epoch": 0.14754304997490086, "grad_norm": 0.58203125, "learning_rate": 4.200494343263185e-05, "loss": 0.4480936527252197, "num_input_tokens_seen": 1184651008, "step": 4170, "train_runtime": 40473.0686, "train_tokens_per_second": 29270.106 }, { "epoch": 0.14789687023862966, "grad_norm": 0.5546875, "learning_rate": 4.1990128441364914e-05, "loss": 0.4518306732177734, "num_input_tokens_seen": 1187485120, "step": 4180, "train_runtime": 40570.2833, "train_tokens_per_second": 29269.826 }, { "epoch": 0.14825069050235842, "grad_norm": 0.59375, "learning_rate": 4.197532911462977e-05, "loss": 0.44388160705566404, "num_input_tokens_seen": 1190325248, "step": 4190, "train_runtime": 40669.8782, "train_tokens_per_second": 29267.982 }, { "epoch": 0.14860451076608722, "grad_norm": 0.58203125, "learning_rate": 4.196054542484125e-05, "loss": 0.4475285530090332, "num_input_tokens_seen": 1193193088, "step": 4200, "train_runtime": 40769.9021, "train_tokens_per_second": 29266.518 }, { "epoch": 0.14895833102981598, "grad_norm": 0.546875, "learning_rate": 4.1945777344482084e-05, "loss": 0.44704599380493165, "num_input_tokens_seen": 1196034560, "step": 4210, "train_runtime": 40866.0938, "train_tokens_per_second": 29267.161 }, { "epoch": 0.14931215129354478, "grad_norm": 0.5859375, "learning_rate": 4.19310248461028e-05, "loss": 0.44858689308166505, "num_input_tokens_seen": 1198912832, "step": 4220, "train_runtime": 40968.5924, "train_tokens_per_second": 29264.194 }, { "epoch": 0.14966597155727354, "grad_norm": 0.59375, "learning_rate": 4.1916287902321405e-05, "loss": 0.44658374786376953, "num_input_tokens_seen": 1201798272, "step": 4230, "train_runtime": 41069.8206, "train_tokens_per_second": 29262.321 }, { "epoch": 0.15001979182100234, "grad_norm": 0.59375, "learning_rate": 4.190156648582328e-05, "loss": 0.4517244338989258, "num_input_tokens_seen": 1204654784, "step": 4240, "train_runtime": 41165.7084, "train_tokens_per_second": 29263.55 }, { "epoch": 0.1503736120847311, "grad_norm": 0.6328125, "learning_rate": 4.188686056936087e-05, "loss": 0.447774600982666, "num_input_tokens_seen": 1207475008, "step": 4250, "train_runtime": 41260.3545, "train_tokens_per_second": 29264.775 }, { "epoch": 0.1507274323484599, "grad_norm": 0.5859375, "learning_rate": 4.187217012575352e-05, "loss": 0.4460301399230957, "num_input_tokens_seen": 1210316224, "step": 4260, "train_runtime": 41356.4397, "train_tokens_per_second": 29265.484 }, { "epoch": 0.15108125261218866, "grad_norm": 0.5703125, "learning_rate": 4.185749512788727e-05, "loss": 0.44805269241333007, "num_input_tokens_seen": 1213199552, "step": 4270, "train_runtime": 41454.8152, "train_tokens_per_second": 29265.588 }, { "epoch": 0.15143507287591745, "grad_norm": 0.6015625, "learning_rate": 4.184283554871462e-05, "loss": 0.4456193923950195, "num_input_tokens_seen": 1216018816, "step": 4280, "train_runtime": 41551.5081, "train_tokens_per_second": 29265.335 }, { "epoch": 0.15178889313964622, "grad_norm": 0.5859375, "learning_rate": 4.1828191361254344e-05, "loss": 0.4457979202270508, "num_input_tokens_seen": 1218848896, "step": 4290, "train_runtime": 41645.8463, "train_tokens_per_second": 29266.998 }, { "epoch": 0.152142713403375, "grad_norm": 0.5859375, "learning_rate": 4.181356253859127e-05, "loss": 0.4439018726348877, "num_input_tokens_seen": 1221640448, "step": 4300, "train_runtime": 41736.532, "train_tokens_per_second": 29270.291 }, { "epoch": 0.15249653366710378, "grad_norm": 0.578125, "learning_rate": 4.179894905387606e-05, "loss": 0.4440751075744629, "num_input_tokens_seen": 1224492544, "step": 4310, "train_runtime": 41833.8649, "train_tokens_per_second": 29270.366 }, { "epoch": 0.15285035393083257, "grad_norm": 0.5703125, "learning_rate": 4.178435088032502e-05, "loss": 0.4444403171539307, "num_input_tokens_seen": 1227310592, "step": 4320, "train_runtime": 41929.8447, "train_tokens_per_second": 29270.573 }, { "epoch": 0.15320417419456134, "grad_norm": 0.58984375, "learning_rate": 4.176976799121989e-05, "loss": 0.4419120788574219, "num_input_tokens_seen": 1230119616, "step": 4330, "train_runtime": 42026.5755, "train_tokens_per_second": 29270.042 }, { "epoch": 0.15355799445829013, "grad_norm": 0.59765625, "learning_rate": 4.1755200359907657e-05, "loss": 0.4464087009429932, "num_input_tokens_seen": 1232923648, "step": 4340, "train_runtime": 42120.9797, "train_tokens_per_second": 29271.011 }, { "epoch": 0.1539118147220189, "grad_norm": 0.55859375, "learning_rate": 4.174064795980028e-05, "loss": 0.4458340644836426, "num_input_tokens_seen": 1235791296, "step": 4350, "train_runtime": 42217.6846, "train_tokens_per_second": 29271.887 }, { "epoch": 0.1542656349857477, "grad_norm": 0.58984375, "learning_rate": 4.17261107643746e-05, "loss": 0.45078067779541015, "num_input_tokens_seen": 1238657856, "step": 4360, "train_runtime": 42318.7128, "train_tokens_per_second": 29269.743 }, { "epoch": 0.15461945524947646, "grad_norm": 0.5703125, "learning_rate": 4.171158874717204e-05, "loss": 0.4443507671356201, "num_input_tokens_seen": 1241488704, "step": 4370, "train_runtime": 42414.3771, "train_tokens_per_second": 29270.469 }, { "epoch": 0.15497327551320522, "grad_norm": 0.5703125, "learning_rate": 4.169708188179844e-05, "loss": 0.44482998847961425, "num_input_tokens_seen": 1244296576, "step": 4380, "train_runtime": 42507.6357, "train_tokens_per_second": 29272.307 }, { "epoch": 0.15532709577693402, "grad_norm": 0.58203125, "learning_rate": 4.1682590141923846e-05, "loss": 0.44451127052307127, "num_input_tokens_seen": 1247104320, "step": 4390, "train_runtime": 42602.7056, "train_tokens_per_second": 29272.89 }, { "epoch": 0.15568091604066278, "grad_norm": 0.57421875, "learning_rate": 4.1668113501282335e-05, "loss": 0.4432711601257324, "num_input_tokens_seen": 1249909376, "step": 4400, "train_runtime": 42698.7455, "train_tokens_per_second": 29272.742 }, { "epoch": 0.15603473630439157, "grad_norm": 0.578125, "learning_rate": 4.165365193367178e-05, "loss": 0.4427494049072266, "num_input_tokens_seen": 1252730048, "step": 4410, "train_runtime": 42794.217, "train_tokens_per_second": 29273.349 }, { "epoch": 0.15638855656812034, "grad_norm": 0.5859375, "learning_rate": 4.163920541295369e-05, "loss": 0.44465007781982424, "num_input_tokens_seen": 1255548928, "step": 4420, "train_runtime": 42890.1209, "train_tokens_per_second": 29273.616 }, { "epoch": 0.15674237683184913, "grad_norm": 0.5703125, "learning_rate": 4.1624773913052946e-05, "loss": 0.44714765548706054, "num_input_tokens_seen": 1258380608, "step": 4430, "train_runtime": 42988.7589, "train_tokens_per_second": 29272.318 }, { "epoch": 0.1570961970955779, "grad_norm": 0.6171875, "learning_rate": 4.161035740795769e-05, "loss": 0.4462038516998291, "num_input_tokens_seen": 1261217344, "step": 4440, "train_runtime": 43084.4082, "train_tokens_per_second": 29273.173 }, { "epoch": 0.1574500173593067, "grad_norm": 0.5859375, "learning_rate": 4.1595955871719055e-05, "loss": 0.44342823028564454, "num_input_tokens_seen": 1264081024, "step": 4450, "train_runtime": 43184.5049, "train_tokens_per_second": 29271.634 }, { "epoch": 0.15780383762303546, "grad_norm": 0.6015625, "learning_rate": 4.158156927845101e-05, "loss": 0.4425454616546631, "num_input_tokens_seen": 1266929920, "step": 4460, "train_runtime": 43280.4797, "train_tokens_per_second": 29272.548 }, { "epoch": 0.15815765788676425, "grad_norm": 0.56640625, "learning_rate": 4.156719760233016e-05, "loss": 0.44738616943359377, "num_input_tokens_seen": 1269772864, "step": 4470, "train_runtime": 43376.465, "train_tokens_per_second": 29273.314 }, { "epoch": 0.15851147815049302, "grad_norm": 0.5703125, "learning_rate": 4.155284081759552e-05, "loss": 0.4473750114440918, "num_input_tokens_seen": 1272572224, "step": 4480, "train_runtime": 43470.5255, "train_tokens_per_second": 29274.369 }, { "epoch": 0.1588652984142218, "grad_norm": 0.60546875, "learning_rate": 4.1538498898548356e-05, "loss": 0.44532470703125, "num_input_tokens_seen": 1275388928, "step": 4490, "train_runtime": 43567.8188, "train_tokens_per_second": 29273.647 }, { "epoch": 0.15921911867795058, "grad_norm": 0.5859375, "learning_rate": 4.1524171819552e-05, "loss": 0.4446286201477051, "num_input_tokens_seen": 1278251456, "step": 4500, "train_runtime": 43665.5674, "train_tokens_per_second": 29273.671 }, { "epoch": 0.15957293894167937, "grad_norm": 0.58203125, "learning_rate": 4.15098595550316e-05, "loss": 0.44756202697753905, "num_input_tokens_seen": 1281085120, "step": 4510, "train_runtime": 43761.8508, "train_tokens_per_second": 29274.016 }, { "epoch": 0.15992675920540814, "grad_norm": 0.58203125, "learning_rate": 4.1495562079474e-05, "loss": 0.44554719924926756, "num_input_tokens_seen": 1283928256, "step": 4520, "train_runtime": 43857.6516, "train_tokens_per_second": 29274.898 }, { "epoch": 0.16028057946913693, "grad_norm": 0.5546875, "learning_rate": 4.148127936742749e-05, "loss": 0.4479020118713379, "num_input_tokens_seen": 1286786880, "step": 4530, "train_runtime": 43956.8482, "train_tokens_per_second": 29273.866 }, { "epoch": 0.1606343997328657, "grad_norm": 0.5859375, "learning_rate": 4.146701139350166e-05, "loss": 0.4463022232055664, "num_input_tokens_seen": 1289581760, "step": 4540, "train_runtime": 44052.4808, "train_tokens_per_second": 29273.76 }, { "epoch": 0.1609882199965945, "grad_norm": 0.56640625, "learning_rate": 4.1452758132367196e-05, "loss": 0.4495826721191406, "num_input_tokens_seen": 1292423360, "step": 4550, "train_runtime": 44149.2431, "train_tokens_per_second": 29273.964 }, { "epoch": 0.16134204026032326, "grad_norm": 0.56640625, "learning_rate": 4.1438519558755656e-05, "loss": 0.44225711822509767, "num_input_tokens_seen": 1295337216, "step": 4560, "train_runtime": 44250.0336, "train_tokens_per_second": 29273.135 }, { "epoch": 0.16169586052405205, "grad_norm": 0.60546875, "learning_rate": 4.1424295647459336e-05, "loss": 0.43920583724975587, "num_input_tokens_seen": 1298182656, "step": 4570, "train_runtime": 44347.5545, "train_tokens_per_second": 29272.925 }, { "epoch": 0.16204968078778081, "grad_norm": 0.578125, "learning_rate": 4.141008637333106e-05, "loss": 0.4452220916748047, "num_input_tokens_seen": 1301050048, "step": 4580, "train_runtime": 44446.4972, "train_tokens_per_second": 29272.274 }, { "epoch": 0.1624035010515096, "grad_norm": 0.55078125, "learning_rate": 4.1395891711283974e-05, "loss": 0.4469286918640137, "num_input_tokens_seen": 1303916544, "step": 4590, "train_runtime": 44545.9198, "train_tokens_per_second": 29271.29 }, { "epoch": 0.16275732131523837, "grad_norm": 0.5859375, "learning_rate": 4.1381711636291395e-05, "loss": 0.44227113723754885, "num_input_tokens_seen": 1306714944, "step": 4600, "train_runtime": 44641.1509, "train_tokens_per_second": 29271.533 }, { "epoch": 0.16311114157896717, "grad_norm": 0.57421875, "learning_rate": 4.1367546123386604e-05, "loss": 0.4420786380767822, "num_input_tokens_seen": 1309505600, "step": 4610, "train_runtime": 44737.226, "train_tokens_per_second": 29271.05 }, { "epoch": 0.16346496184269593, "grad_norm": 0.546875, "learning_rate": 4.1353395147662673e-05, "loss": 0.4446345329284668, "num_input_tokens_seen": 1312348416, "step": 4620, "train_runtime": 44834.9468, "train_tokens_per_second": 29270.658 }, { "epoch": 0.16381878210642473, "grad_norm": 0.56640625, "learning_rate": 4.133925868427225e-05, "loss": 0.44669132232666015, "num_input_tokens_seen": 1315210752, "step": 4630, "train_runtime": 44934.1588, "train_tokens_per_second": 29269.731 }, { "epoch": 0.1641726023701535, "grad_norm": 0.59765625, "learning_rate": 4.132513670842744e-05, "loss": 0.44263653755187987, "num_input_tokens_seen": 1318022080, "step": 4640, "train_runtime": 45027.9453, "train_tokens_per_second": 29271.202 }, { "epoch": 0.16452642263388226, "grad_norm": 0.57421875, "learning_rate": 4.1311029195399534e-05, "loss": 0.4447168350219727, "num_input_tokens_seen": 1320899072, "step": 4650, "train_runtime": 45129.8031, "train_tokens_per_second": 29268.886 }, { "epoch": 0.16488024289761105, "grad_norm": 0.59375, "learning_rate": 4.129693612051892e-05, "loss": 0.44136433601379393, "num_input_tokens_seen": 1323750912, "step": 4660, "train_runtime": 45227.172, "train_tokens_per_second": 29268.93 }, { "epoch": 0.16523406316133982, "grad_norm": 0.59765625, "learning_rate": 4.1282857459174826e-05, "loss": 0.4422027587890625, "num_input_tokens_seen": 1326532416, "step": 4670, "train_runtime": 45320.6147, "train_tokens_per_second": 29269.956 }, { "epoch": 0.1655878834250686, "grad_norm": 0.6015625, "learning_rate": 4.1268793186815184e-05, "loss": 0.44470810890197754, "num_input_tokens_seen": 1329344384, "step": 4680, "train_runtime": 45416.7577, "train_tokens_per_second": 29269.909 }, { "epoch": 0.16594170368879738, "grad_norm": 0.58203125, "learning_rate": 4.1254743278946456e-05, "loss": 0.4466115951538086, "num_input_tokens_seen": 1332233664, "step": 4690, "train_runtime": 45517.0491, "train_tokens_per_second": 29268.894 }, { "epoch": 0.16629552395252617, "grad_norm": 0.56640625, "learning_rate": 4.1240707711133394e-05, "loss": 0.44083662033081056, "num_input_tokens_seen": 1335070720, "step": 4700, "train_runtime": 45613.8844, "train_tokens_per_second": 29268.955 }, { "epoch": 0.16664934421625494, "grad_norm": 0.56640625, "learning_rate": 4.122668645899893e-05, "loss": 0.4424298286437988, "num_input_tokens_seen": 1338002176, "step": 4710, "train_runtime": 45716.1136, "train_tokens_per_second": 29267.627 }, { "epoch": 0.16700316447998373, "grad_norm": 0.55859375, "learning_rate": 4.1212679498223975e-05, "loss": 0.4458757400512695, "num_input_tokens_seen": 1340848640, "step": 4720, "train_runtime": 45813.5276, "train_tokens_per_second": 29267.527 }, { "epoch": 0.1673569847437125, "grad_norm": 0.5625, "learning_rate": 4.1198686804547215e-05, "loss": 0.4416823387145996, "num_input_tokens_seen": 1343707776, "step": 4730, "train_runtime": 45910.019, "train_tokens_per_second": 29268.291 }, { "epoch": 0.1677108050074413, "grad_norm": 0.609375, "learning_rate": 4.118470835376499e-05, "loss": 0.44687299728393554, "num_input_tokens_seen": 1346536704, "step": 4740, "train_runtime": 46006.9392, "train_tokens_per_second": 29268.122 }, { "epoch": 0.16806462527117005, "grad_norm": 0.578125, "learning_rate": 4.117074412173107e-05, "loss": 0.4451130867004395, "num_input_tokens_seen": 1349381632, "step": 4750, "train_runtime": 46106.5344, "train_tokens_per_second": 29266.603 }, { "epoch": 0.16841844553489885, "grad_norm": 0.59765625, "learning_rate": 4.115679408435648e-05, "loss": 0.44522705078125, "num_input_tokens_seen": 1352231744, "step": 4760, "train_runtime": 46204.559, "train_tokens_per_second": 29266.197 }, { "epoch": 0.1687722657986276, "grad_norm": 0.54296875, "learning_rate": 4.114285821760937e-05, "loss": 0.4441199779510498, "num_input_tokens_seen": 1355066048, "step": 4770, "train_runtime": 46297.5464, "train_tokens_per_second": 29268.636 }, { "epoch": 0.1691260860623564, "grad_norm": 0.59375, "learning_rate": 4.11289364975148e-05, "loss": 0.4475994110107422, "num_input_tokens_seen": 1357933376, "step": 4780, "train_runtime": 46395.4123, "train_tokens_per_second": 29268.699 }, { "epoch": 0.16947990632608517, "grad_norm": 0.58203125, "learning_rate": 4.111502890015456e-05, "loss": 0.4435115337371826, "num_input_tokens_seen": 1360776320, "step": 4790, "train_runtime": 46488.6889, "train_tokens_per_second": 29271.127 }, { "epoch": 0.16983372658981397, "grad_norm": 0.55078125, "learning_rate": 4.1101135401667056e-05, "loss": 0.4493249893188477, "num_input_tokens_seen": 1363593088, "step": 4800, "train_runtime": 46585.3372, "train_tokens_per_second": 29270.864 }, { "epoch": 0.17018754685354273, "grad_norm": 0.56640625, "learning_rate": 4.108725597824708e-05, "loss": 0.4432815074920654, "num_input_tokens_seen": 1366410176, "step": 4810, "train_runtime": 46680.3784, "train_tokens_per_second": 29271.617 }, { "epoch": 0.17054136711727153, "grad_norm": 0.58203125, "learning_rate": 4.107339060614564e-05, "loss": 0.44433069229125977, "num_input_tokens_seen": 1369257856, "step": 4820, "train_runtime": 46777.5863, "train_tokens_per_second": 29271.665 }, { "epoch": 0.1708951873810003, "grad_norm": 0.6328125, "learning_rate": 4.1059539261669825e-05, "loss": 0.43774995803833006, "num_input_tokens_seen": 1372139584, "step": 4830, "train_runtime": 46879.2941, "train_tokens_per_second": 29269.63 }, { "epoch": 0.17124900764472908, "grad_norm": 0.58203125, "learning_rate": 4.104570192118262e-05, "loss": 0.4434209823608398, "num_input_tokens_seen": 1374939520, "step": 4840, "train_runtime": 46975.9637, "train_tokens_per_second": 29269.001 }, { "epoch": 0.17160282790845785, "grad_norm": 0.56640625, "learning_rate": 4.1031878561102714e-05, "loss": 0.44222288131713866, "num_input_tokens_seen": 1377782592, "step": 4850, "train_runtime": 47071.7365, "train_tokens_per_second": 29269.848 }, { "epoch": 0.17195664817218664, "grad_norm": 0.59765625, "learning_rate": 4.1018069157904385e-05, "loss": 0.4392059326171875, "num_input_tokens_seen": 1380642112, "step": 4860, "train_runtime": 47168.9594, "train_tokens_per_second": 29270.141 }, { "epoch": 0.1723104684359154, "grad_norm": 0.55859375, "learning_rate": 4.100427368811727e-05, "loss": 0.440401554107666, "num_input_tokens_seen": 1383498688, "step": 4870, "train_runtime": 47266.3978, "train_tokens_per_second": 29270.237 }, { "epoch": 0.1726642886996442, "grad_norm": 0.5703125, "learning_rate": 4.099049212832622e-05, "loss": 0.444883918762207, "num_input_tokens_seen": 1386405760, "step": 4880, "train_runtime": 47367.0689, "train_tokens_per_second": 29269.402 }, { "epoch": 0.17301810896337297, "grad_norm": 0.56640625, "learning_rate": 4.0976724455171155e-05, "loss": 0.4421547412872314, "num_input_tokens_seen": 1389235520, "step": 4890, "train_runtime": 47464.2533, "train_tokens_per_second": 29269.09 }, { "epoch": 0.17337192922710173, "grad_norm": 0.5859375, "learning_rate": 4.096297064534688e-05, "loss": 0.4385939598083496, "num_input_tokens_seen": 1392041408, "step": 4900, "train_runtime": 47560.1357, "train_tokens_per_second": 29269.08 }, { "epoch": 0.17372574949083053, "grad_norm": 0.55078125, "learning_rate": 4.0949230675602904e-05, "loss": 0.4424541473388672, "num_input_tokens_seen": 1394892672, "step": 4910, "train_runtime": 47656.6316, "train_tokens_per_second": 29269.645 }, { "epoch": 0.1740795697545593, "grad_norm": 0.5703125, "learning_rate": 4.09355045227433e-05, "loss": 0.4425206184387207, "num_input_tokens_seen": 1397753408, "step": 4920, "train_runtime": 47755.9347, "train_tokens_per_second": 29268.685 }, { "epoch": 0.1744333900182881, "grad_norm": 0.55078125, "learning_rate": 4.092179216362654e-05, "loss": 0.44448113441467285, "num_input_tokens_seen": 1400560384, "step": 4930, "train_runtime": 47849.8214, "train_tokens_per_second": 29269.919 }, { "epoch": 0.17478721028201685, "grad_norm": 0.6015625, "learning_rate": 4.090809357516532e-05, "loss": 0.4441685199737549, "num_input_tokens_seen": 1403432320, "step": 4940, "train_runtime": 47949.1995, "train_tokens_per_second": 29269.15 }, { "epoch": 0.17514103054574565, "grad_norm": 0.58203125, "learning_rate": 4.089440873432638e-05, "loss": 0.4443987846374512, "num_input_tokens_seen": 1406244736, "step": 4950, "train_runtime": 48041.564, "train_tokens_per_second": 29271.419 }, { "epoch": 0.1754948508094744, "grad_norm": 0.59765625, "learning_rate": 4.088073761813037e-05, "loss": 0.43969202041625977, "num_input_tokens_seen": 1409138176, "step": 4960, "train_runtime": 48142.9848, "train_tokens_per_second": 29269.855 }, { "epoch": 0.1758486710732032, "grad_norm": 0.57421875, "learning_rate": 4.086708020365172e-05, "loss": 0.4387206077575684, "num_input_tokens_seen": 1412013888, "step": 4970, "train_runtime": 48244.0273, "train_tokens_per_second": 29268.16 }, { "epoch": 0.17620249133693197, "grad_norm": 0.578125, "learning_rate": 4.0853436468018354e-05, "loss": 0.44150686264038086, "num_input_tokens_seen": 1414840448, "step": 4980, "train_runtime": 48340.4585, "train_tokens_per_second": 29268.246 }, { "epoch": 0.17655631160066076, "grad_norm": 0.55859375, "learning_rate": 4.0839806388411686e-05, "loss": 0.4403355598449707, "num_input_tokens_seen": 1417739520, "step": 4990, "train_runtime": 48439.1089, "train_tokens_per_second": 29268.489 }, { "epoch": 0.17691013186438953, "grad_norm": 0.5546875, "learning_rate": 4.0826189942066346e-05, "loss": 0.44421892166137694, "num_input_tokens_seen": 1420613056, "step": 5000, "train_runtime": 48537.5967, "train_tokens_per_second": 29268.302 }, { "epoch": 0.17691013186438953, "eval_loss": 0.36652371287345886, "eval_runtime": 8.4272, "eval_samples_per_second": 473.231, "eval_steps_per_second": 3.797, "num_input_tokens_seen": 1420613056, "step": 5000 }, { "epoch": 0.17726395212811832, "grad_norm": 0.5625, "learning_rate": 4.081258710627008e-05, "loss": 0.43889927864074707, "num_input_tokens_seen": 1423456576, "step": 5010, "train_runtime": 48665.0882, "train_tokens_per_second": 29250.056 }, { "epoch": 0.1776177723918471, "grad_norm": 0.5546875, "learning_rate": 4.0798997858363557e-05, "loss": 0.4373011589050293, "num_input_tokens_seen": 1426246848, "step": 5020, "train_runtime": 48756.7438, "train_tokens_per_second": 29252.299 }, { "epoch": 0.17797159265557588, "grad_norm": 0.578125, "learning_rate": 4.078542217574024e-05, "loss": 0.43915085792541503, "num_input_tokens_seen": 1429053568, "step": 5030, "train_runtime": 48852.5806, "train_tokens_per_second": 29252.366 }, { "epoch": 0.17832541291930465, "grad_norm": 0.56640625, "learning_rate": 4.0771860035846196e-05, "loss": 0.44334979057312013, "num_input_tokens_seen": 1431894464, "step": 5040, "train_runtime": 48949.4283, "train_tokens_per_second": 29252.527 }, { "epoch": 0.17867923318303344, "grad_norm": 0.58984375, "learning_rate": 4.0758311416179965e-05, "loss": 0.4382296562194824, "num_input_tokens_seen": 1434778752, "step": 5050, "train_runtime": 49049.0857, "train_tokens_per_second": 29251.896 }, { "epoch": 0.1790330534467622, "grad_norm": 0.57421875, "learning_rate": 4.0744776294292386e-05, "loss": 0.43564801216125487, "num_input_tokens_seen": 1437638720, "step": 5060, "train_runtime": 49148.0198, "train_tokens_per_second": 29251.203 }, { "epoch": 0.179386873710491, "grad_norm": 0.59375, "learning_rate": 4.073125464778646e-05, "loss": 0.44344005584716795, "num_input_tokens_seen": 1440541568, "step": 5070, "train_runtime": 49250.8401, "train_tokens_per_second": 29249.076 }, { "epoch": 0.17974069397421977, "grad_norm": 0.5859375, "learning_rate": 4.071774645431717e-05, "loss": 0.43868389129638674, "num_input_tokens_seen": 1443293440, "step": 5080, "train_runtime": 49345.8647, "train_tokens_per_second": 29248.519 }, { "epoch": 0.18009451423794856, "grad_norm": 0.57421875, "learning_rate": 4.070425169159135e-05, "loss": 0.44031376838684083, "num_input_tokens_seen": 1446114368, "step": 5090, "train_runtime": 49442.8729, "train_tokens_per_second": 29248.187 }, { "epoch": 0.18044833450167733, "grad_norm": 0.57421875, "learning_rate": 4.069077033736751e-05, "loss": 0.437284517288208, "num_input_tokens_seen": 1448938560, "step": 5100, "train_runtime": 49540.5367, "train_tokens_per_second": 29247.535 }, { "epoch": 0.18080215476540612, "grad_norm": 0.5859375, "learning_rate": 4.06773023694557e-05, "loss": 0.4442091941833496, "num_input_tokens_seen": 1451746496, "step": 5110, "train_runtime": 49636.0598, "train_tokens_per_second": 29247.819 }, { "epoch": 0.18115597502913489, "grad_norm": 0.58984375, "learning_rate": 4.066384776571732e-05, "loss": 0.4413691520690918, "num_input_tokens_seen": 1454587072, "step": 5120, "train_runtime": 49732.0646, "train_tokens_per_second": 29248.475 }, { "epoch": 0.18150979529286368, "grad_norm": 0.60546875, "learning_rate": 4.065040650406504e-05, "loss": 0.44220633506774903, "num_input_tokens_seen": 1457448256, "step": 5130, "train_runtime": 49831.3365, "train_tokens_per_second": 29247.625 }, { "epoch": 0.18186361555659245, "grad_norm": 0.60546875, "learning_rate": 4.0636978562462576e-05, "loss": 0.44106149673461914, "num_input_tokens_seen": 1460298880, "step": 5140, "train_runtime": 49929.737, "train_tokens_per_second": 29247.077 }, { "epoch": 0.1822174358203212, "grad_norm": 0.56640625, "learning_rate": 4.062356391892456e-05, "loss": 0.44039249420166016, "num_input_tokens_seen": 1463134592, "step": 5150, "train_runtime": 50028.8472, "train_tokens_per_second": 29245.819 }, { "epoch": 0.18257125608405, "grad_norm": 0.578125, "learning_rate": 4.0610162551516395e-05, "loss": 0.43768110275268557, "num_input_tokens_seen": 1466017024, "step": 5160, "train_runtime": 50129.5574, "train_tokens_per_second": 29244.563 }, { "epoch": 0.18292507634777877, "grad_norm": 0.5625, "learning_rate": 4.059677443835412e-05, "loss": 0.4380631923675537, "num_input_tokens_seen": 1468844032, "step": 5170, "train_runtime": 50223.7226, "train_tokens_per_second": 29246.021 }, { "epoch": 0.18327889661150756, "grad_norm": 0.578125, "learning_rate": 4.058339955760423e-05, "loss": 0.44063806533813477, "num_input_tokens_seen": 1471720064, "step": 5180, "train_runtime": 50325.8734, "train_tokens_per_second": 29243.806 }, { "epoch": 0.18363271687523633, "grad_norm": 0.5546875, "learning_rate": 4.0570037887483535e-05, "loss": 0.4378070831298828, "num_input_tokens_seen": 1474620736, "step": 5190, "train_runtime": 50426.891, "train_tokens_per_second": 29242.745 }, { "epoch": 0.18398653713896512, "grad_norm": 0.56640625, "learning_rate": 4.0556689406259025e-05, "loss": 0.4409457206726074, "num_input_tokens_seen": 1477467008, "step": 5200, "train_runtime": 50523.3874, "train_tokens_per_second": 29243.229 }, { "epoch": 0.1843403574026939, "grad_norm": 0.58203125, "learning_rate": 4.054335409224771e-05, "loss": 0.43840694427490234, "num_input_tokens_seen": 1480353088, "step": 5210, "train_runtime": 50622.3633, "train_tokens_per_second": 29243.066 }, { "epoch": 0.18469417766642268, "grad_norm": 0.55859375, "learning_rate": 4.053003192381646e-05, "loss": 0.43650293350219727, "num_input_tokens_seen": 1483264448, "step": 5220, "train_runtime": 50721.6647, "train_tokens_per_second": 29243.213 }, { "epoch": 0.18504799793015145, "grad_norm": 0.61328125, "learning_rate": 4.051672287938189e-05, "loss": 0.4394537925720215, "num_input_tokens_seen": 1486090944, "step": 5230, "train_runtime": 50818.5913, "train_tokens_per_second": 29243.057 }, { "epoch": 0.18540181819388024, "grad_norm": 0.5703125, "learning_rate": 4.050342693741019e-05, "loss": 0.43662214279174805, "num_input_tokens_seen": 1488925888, "step": 5240, "train_runtime": 50914.7782, "train_tokens_per_second": 29243.492 }, { "epoch": 0.185755638457609, "grad_norm": 0.57421875, "learning_rate": 4.049014407641699e-05, "loss": 0.44120097160339355, "num_input_tokens_seen": 1491699968, "step": 5250, "train_runtime": 51007.8139, "train_tokens_per_second": 29244.538 }, { "epoch": 0.1861094587213378, "grad_norm": 0.55859375, "learning_rate": 4.047687427496717e-05, "loss": 0.43669471740722654, "num_input_tokens_seen": 1494559296, "step": 5260, "train_runtime": 51107.3415, "train_tokens_per_second": 29243.534 }, { "epoch": 0.18646327898506657, "grad_norm": 0.5546875, "learning_rate": 4.046361751167479e-05, "loss": 0.43963027000427246, "num_input_tokens_seen": 1497424320, "step": 5270, "train_runtime": 51201.6252, "train_tokens_per_second": 29245.64 }, { "epoch": 0.18681709924879536, "grad_norm": 0.5703125, "learning_rate": 4.045037376520292e-05, "loss": 0.4410958766937256, "num_input_tokens_seen": 1500251456, "step": 5280, "train_runtime": 51299.4315, "train_tokens_per_second": 29244.992 }, { "epoch": 0.18717091951252413, "grad_norm": 0.58203125, "learning_rate": 4.043714301426344e-05, "loss": 0.44168972969055176, "num_input_tokens_seen": 1503083520, "step": 5290, "train_runtime": 51397.8517, "train_tokens_per_second": 29244.092 }, { "epoch": 0.18752473977625292, "grad_norm": 0.5546875, "learning_rate": 4.042392523761696e-05, "loss": 0.43744945526123047, "num_input_tokens_seen": 1505860864, "step": 5300, "train_runtime": 51492.3483, "train_tokens_per_second": 29244.362 }, { "epoch": 0.18787856003998168, "grad_norm": 0.5625, "learning_rate": 4.041072041407267e-05, "loss": 0.4394649028778076, "num_input_tokens_seen": 1508762624, "step": 5310, "train_runtime": 51592.3092, "train_tokens_per_second": 29243.944 }, { "epoch": 0.18823238030371048, "grad_norm": 0.59765625, "learning_rate": 4.039752852248815e-05, "loss": 0.43597002029418946, "num_input_tokens_seen": 1511563328, "step": 5320, "train_runtime": 51688.0104, "train_tokens_per_second": 29243.984 }, { "epoch": 0.18858620056743924, "grad_norm": 0.546875, "learning_rate": 4.0384349541769286e-05, "loss": 0.4423725128173828, "num_input_tokens_seen": 1514407936, "step": 5330, "train_runtime": 51785.3292, "train_tokens_per_second": 29243.957 }, { "epoch": 0.18894002083116804, "grad_norm": 0.59375, "learning_rate": 4.037118345087011e-05, "loss": 0.4436190605163574, "num_input_tokens_seen": 1517231040, "step": 5340, "train_runtime": 51882.7902, "train_tokens_per_second": 29243.436 }, { "epoch": 0.1892938410948968, "grad_norm": 0.578125, "learning_rate": 4.0358030228792636e-05, "loss": 0.4411949157714844, "num_input_tokens_seen": 1520078656, "step": 5350, "train_runtime": 51981.5454, "train_tokens_per_second": 29242.66 }, { "epoch": 0.1896476613586256, "grad_norm": 0.5859375, "learning_rate": 4.034488985458673e-05, "loss": 0.4380805492401123, "num_input_tokens_seen": 1522890176, "step": 5360, "train_runtime": 52074.5408, "train_tokens_per_second": 29244.428 }, { "epoch": 0.19000148162235436, "grad_norm": 0.5625, "learning_rate": 4.033176230735001e-05, "loss": 0.4371777057647705, "num_input_tokens_seen": 1525755264, "step": 5370, "train_runtime": 52171.7969, "train_tokens_per_second": 29244.829 }, { "epoch": 0.19035530188608316, "grad_norm": 0.5703125, "learning_rate": 4.0318647566227626e-05, "loss": 0.44295578002929686, "num_input_tokens_seen": 1528616832, "step": 5380, "train_runtime": 52268.8176, "train_tokens_per_second": 29245.292 }, { "epoch": 0.19070912214981192, "grad_norm": 0.59375, "learning_rate": 4.0305545610412205e-05, "loss": 0.4352247714996338, "num_input_tokens_seen": 1531522944, "step": 5390, "train_runtime": 52371.9608, "train_tokens_per_second": 29243.185 }, { "epoch": 0.19106294241354072, "grad_norm": 0.578125, "learning_rate": 4.029245641914365e-05, "loss": 0.44030084609985354, "num_input_tokens_seen": 1534331328, "step": 5400, "train_runtime": 52468.6826, "train_tokens_per_second": 29242.803 }, { "epoch": 0.19141676267726948, "grad_norm": 0.5703125, "learning_rate": 4.027937997170904e-05, "loss": 0.4353508949279785, "num_input_tokens_seen": 1537209664, "step": 5410, "train_runtime": 52567.6264, "train_tokens_per_second": 29242.516 }, { "epoch": 0.19177058294099825, "grad_norm": 0.55859375, "learning_rate": 4.026631624744247e-05, "loss": 0.43828487396240234, "num_input_tokens_seen": 1540037376, "step": 5420, "train_runtime": 52665.1925, "train_tokens_per_second": 29242.035 }, { "epoch": 0.19212440320472704, "grad_norm": 0.56640625, "learning_rate": 4.025326522572493e-05, "loss": 0.4378074645996094, "num_input_tokens_seen": 1542879168, "step": 5430, "train_runtime": 52762.7136, "train_tokens_per_second": 29241.846 }, { "epoch": 0.1924782234684558, "grad_norm": 0.56640625, "learning_rate": 4.024022688598415e-05, "loss": 0.4380806922912598, "num_input_tokens_seen": 1545750912, "step": 5440, "train_runtime": 52861.7227, "train_tokens_per_second": 29241.403 }, { "epoch": 0.1928320437321846, "grad_norm": 0.578125, "learning_rate": 4.0227201207694494e-05, "loss": 0.43492374420166013, "num_input_tokens_seen": 1548581376, "step": 5450, "train_runtime": 52957.6312, "train_tokens_per_second": 29241.893 }, { "epoch": 0.19318586399591336, "grad_norm": 0.58203125, "learning_rate": 4.021418817037677e-05, "loss": 0.4354818344116211, "num_input_tokens_seen": 1551461504, "step": 5460, "train_runtime": 53057.2016, "train_tokens_per_second": 29241.299 }, { "epoch": 0.19353968425964216, "grad_norm": 0.6015625, "learning_rate": 4.0201187753598174e-05, "loss": 0.4353951454162598, "num_input_tokens_seen": 1554299584, "step": 5470, "train_runtime": 53155.0779, "train_tokens_per_second": 29240.849 }, { "epoch": 0.19389350452337092, "grad_norm": 0.59765625, "learning_rate": 4.018819993697208e-05, "loss": 0.43374977111816404, "num_input_tokens_seen": 1557140416, "step": 5480, "train_runtime": 53249.8961, "train_tokens_per_second": 29242.131 }, { "epoch": 0.19424732478709972, "grad_norm": 0.5703125, "learning_rate": 4.017522470015793e-05, "loss": 0.43536815643310545, "num_input_tokens_seen": 1560041024, "step": 5490, "train_runtime": 53348.7549, "train_tokens_per_second": 29242.314 }, { "epoch": 0.19460114505082848, "grad_norm": 0.625, "learning_rate": 4.0162262022861144e-05, "loss": 0.4359905242919922, "num_input_tokens_seen": 1562892608, "step": 5500, "train_runtime": 53448.1659, "train_tokens_per_second": 29241.277 }, { "epoch": 0.19495496531455728, "grad_norm": 0.5625, "learning_rate": 4.0149311884832906e-05, "loss": 0.4387944221496582, "num_input_tokens_seen": 1565761536, "step": 5510, "train_runtime": 53546.1226, "train_tokens_per_second": 29241.362 }, { "epoch": 0.19530878557828604, "grad_norm": 0.55078125, "learning_rate": 4.0136374265870116e-05, "loss": 0.4379259586334229, "num_input_tokens_seen": 1568601984, "step": 5520, "train_runtime": 53641.3977, "train_tokens_per_second": 29242.377 }, { "epoch": 0.19566260584201484, "grad_norm": 0.58984375, "learning_rate": 4.0123449145815174e-05, "loss": 0.4340057849884033, "num_input_tokens_seen": 1571458304, "step": 5530, "train_runtime": 53735.775, "train_tokens_per_second": 29244.173 }, { "epoch": 0.1960164261057436, "grad_norm": 0.56640625, "learning_rate": 4.011053650455592e-05, "loss": 0.44149117469787597, "num_input_tokens_seen": 1574254144, "step": 5540, "train_runtime": 53829.3976, "train_tokens_per_second": 29245.249 }, { "epoch": 0.1963702463694724, "grad_norm": 0.5546875, "learning_rate": 4.0097636322025466e-05, "loss": 0.4321294784545898, "num_input_tokens_seen": 1577121152, "step": 5550, "train_runtime": 53926.6045, "train_tokens_per_second": 29245.697 }, { "epoch": 0.19672406663320116, "grad_norm": 0.58203125, "learning_rate": 4.008474857820206e-05, "loss": 0.43638410568237307, "num_input_tokens_seen": 1579922944, "step": 5560, "train_runtime": 54020.6927, "train_tokens_per_second": 29246.625 }, { "epoch": 0.19707788689692995, "grad_norm": 0.58203125, "learning_rate": 4.007187325310899e-05, "loss": 0.43534650802612307, "num_input_tokens_seen": 1582776832, "step": 5570, "train_runtime": 54117.0354, "train_tokens_per_second": 29247.294 }, { "epoch": 0.19743170716065872, "grad_norm": 0.54296875, "learning_rate": 4.00590103268144e-05, "loss": 0.4353529453277588, "num_input_tokens_seen": 1585641792, "step": 5580, "train_runtime": 54216.7602, "train_tokens_per_second": 29246.34 }, { "epoch": 0.19778552742438751, "grad_norm": 0.56640625, "learning_rate": 4.004615977943124e-05, "loss": 0.43984546661376955, "num_input_tokens_seen": 1588441088, "step": 5590, "train_runtime": 54311.1466, "train_tokens_per_second": 29247.055 }, { "epoch": 0.19813934768811628, "grad_norm": 0.58203125, "learning_rate": 4.0033321591117025e-05, "loss": 0.4320873260498047, "num_input_tokens_seen": 1591290368, "step": 5600, "train_runtime": 54407.6745, "train_tokens_per_second": 29247.535 }, { "epoch": 0.19849316795184507, "grad_norm": 0.5859375, "learning_rate": 4.002049574207381e-05, "loss": 0.4366870880126953, "num_input_tokens_seen": 1594144128, "step": 5610, "train_runtime": 54505.3077, "train_tokens_per_second": 29247.503 }, { "epoch": 0.19884698821557384, "grad_norm": 0.56640625, "learning_rate": 4.000768221254803e-05, "loss": 0.43494539260864257, "num_input_tokens_seen": 1597000064, "step": 5620, "train_runtime": 54601.603, "train_tokens_per_second": 29248.227 }, { "epoch": 0.19920080847930263, "grad_norm": 0.57421875, "learning_rate": 3.999488098283034e-05, "loss": 0.43576898574829104, "num_input_tokens_seen": 1599860288, "step": 5630, "train_runtime": 54702.1675, "train_tokens_per_second": 29246.744 }, { "epoch": 0.1995546287430314, "grad_norm": 0.55859375, "learning_rate": 3.9982092033255506e-05, "loss": 0.4365368366241455, "num_input_tokens_seen": 1602709120, "step": 5640, "train_runtime": 54799.7285, "train_tokens_per_second": 29246.662 }, { "epoch": 0.1999084490067602, "grad_norm": 0.55078125, "learning_rate": 3.996931534420232e-05, "loss": 0.43445682525634766, "num_input_tokens_seen": 1605536384, "step": 5650, "train_runtime": 54896.1811, "train_tokens_per_second": 29246.777 }, { "epoch": 0.20026226927048896, "grad_norm": 0.56640625, "learning_rate": 3.995655089609339e-05, "loss": 0.43600945472717284, "num_input_tokens_seen": 1608395072, "step": 5660, "train_runtime": 54992.376, "train_tokens_per_second": 29247.601 }, { "epoch": 0.20061608953421772, "grad_norm": 0.59765625, "learning_rate": 3.994379866939511e-05, "loss": 0.4321427345275879, "num_input_tokens_seen": 1611246528, "step": 5670, "train_runtime": 55090.1326, "train_tokens_per_second": 29247.461 }, { "epoch": 0.20096990979794652, "grad_norm": 0.58203125, "learning_rate": 3.993105864461745e-05, "loss": 0.43267669677734377, "num_input_tokens_seen": 1614097856, "step": 5680, "train_runtime": 55188.8137, "train_tokens_per_second": 29246.83 }, { "epoch": 0.20132373006167528, "grad_norm": 0.5703125, "learning_rate": 3.9918330802313866e-05, "loss": 0.4402439117431641, "num_input_tokens_seen": 1616895488, "step": 5690, "train_runtime": 55286.8025, "train_tokens_per_second": 29245.596 }, { "epoch": 0.20167755032540408, "grad_norm": 0.5625, "learning_rate": 3.9905615123081206e-05, "loss": 0.4373167991638184, "num_input_tokens_seen": 1619738624, "step": 5700, "train_runtime": 55383.7084, "train_tokens_per_second": 29245.76 }, { "epoch": 0.20203137058913284, "grad_norm": 0.57421875, "learning_rate": 3.989291158755953e-05, "loss": 0.43944807052612306, "num_input_tokens_seen": 1622599168, "step": 5710, "train_runtime": 55483.6791, "train_tokens_per_second": 29244.621 }, { "epoch": 0.20238519085286164, "grad_norm": 0.58984375, "learning_rate": 3.988022017643201e-05, "loss": 0.4356792449951172, "num_input_tokens_seen": 1625486464, "step": 5720, "train_runtime": 55583.5851, "train_tokens_per_second": 29244.002 }, { "epoch": 0.2027390111165904, "grad_norm": 0.578125, "learning_rate": 3.9867540870424826e-05, "loss": 0.4399091720581055, "num_input_tokens_seen": 1628304704, "step": 5730, "train_runtime": 55679.8726, "train_tokens_per_second": 29244.045 }, { "epoch": 0.2030928313803192, "grad_norm": 0.59765625, "learning_rate": 3.985487365030702e-05, "loss": 0.43842029571533203, "num_input_tokens_seen": 1631111616, "step": 5740, "train_runtime": 55774.3747, "train_tokens_per_second": 29244.821 }, { "epoch": 0.20344665164404796, "grad_norm": 0.55078125, "learning_rate": 3.984221849689036e-05, "loss": 0.43639116287231444, "num_input_tokens_seen": 1633982144, "step": 5750, "train_runtime": 55873.2106, "train_tokens_per_second": 29244.465 }, { "epoch": 0.20380047190777675, "grad_norm": 0.59765625, "learning_rate": 3.982957539102927e-05, "loss": 0.43750653266906736, "num_input_tokens_seen": 1636864512, "step": 5760, "train_runtime": 55970.1344, "train_tokens_per_second": 29245.32 }, { "epoch": 0.20415429217150552, "grad_norm": 0.57421875, "learning_rate": 3.981694431362065e-05, "loss": 0.43770227432250974, "num_input_tokens_seen": 1639718144, "step": 5770, "train_runtime": 56068.2638, "train_tokens_per_second": 29245.032 }, { "epoch": 0.2045081124352343, "grad_norm": 0.6015625, "learning_rate": 3.9804325245603786e-05, "loss": 0.44153947830200196, "num_input_tokens_seen": 1642537728, "step": 5780, "train_runtime": 56168.3941, "train_tokens_per_second": 29243.096 }, { "epoch": 0.20486193269896308, "grad_norm": 0.57421875, "learning_rate": 3.9791718167960226e-05, "loss": 0.4355274200439453, "num_input_tokens_seen": 1645398208, "step": 5790, "train_runtime": 56266.1962, "train_tokens_per_second": 29243.104 }, { "epoch": 0.20521575296269187, "grad_norm": 0.5625, "learning_rate": 3.9779123061713665e-05, "loss": 0.433730936050415, "num_input_tokens_seen": 1648256576, "step": 5800, "train_runtime": 56362.4708, "train_tokens_per_second": 29243.867 }, { "epoch": 0.20556957322642064, "grad_norm": 0.55859375, "learning_rate": 3.976653990792979e-05, "loss": 0.43136072158813477, "num_input_tokens_seen": 1651121344, "step": 5810, "train_runtime": 56462.3938, "train_tokens_per_second": 29242.851 }, { "epoch": 0.20592339349014943, "grad_norm": 0.5625, "learning_rate": 3.9753968687716206e-05, "loss": 0.4295208930969238, "num_input_tokens_seen": 1654019904, "step": 5820, "train_runtime": 56563.7663, "train_tokens_per_second": 29241.686 }, { "epoch": 0.2062772137538782, "grad_norm": 0.55078125, "learning_rate": 3.974140938222232e-05, "loss": 0.4371951580047607, "num_input_tokens_seen": 1656882560, "step": 5830, "train_runtime": 56660.9753, "train_tokens_per_second": 29242.041 }, { "epoch": 0.206631034017607, "grad_norm": 0.5859375, "learning_rate": 3.972886197263915e-05, "loss": 0.4320386409759521, "num_input_tokens_seen": 1659705024, "step": 5840, "train_runtime": 56757.8905, "train_tokens_per_second": 29241.838 }, { "epoch": 0.20698485428133576, "grad_norm": 0.578125, "learning_rate": 3.97163264401993e-05, "loss": 0.43626089096069337, "num_input_tokens_seen": 1662524416, "step": 5850, "train_runtime": 56855.4501, "train_tokens_per_second": 29241.25 }, { "epoch": 0.20733867454506455, "grad_norm": 0.578125, "learning_rate": 3.970380276617677e-05, "loss": 0.43509936332702637, "num_input_tokens_seen": 1665339712, "step": 5860, "train_runtime": 56949.3076, "train_tokens_per_second": 29242.493 }, { "epoch": 0.20769249480879332, "grad_norm": 0.57421875, "learning_rate": 3.96912909318869e-05, "loss": 0.4371882438659668, "num_input_tokens_seen": 1668169472, "step": 5870, "train_runtime": 57045.2908, "train_tokens_per_second": 29242.895 }, { "epoch": 0.2080463150725221, "grad_norm": 0.5859375, "learning_rate": 3.96787909186862e-05, "loss": 0.43482317924499514, "num_input_tokens_seen": 1671030400, "step": 5880, "train_runtime": 57144.5523, "train_tokens_per_second": 29242.165 }, { "epoch": 0.20840013533625087, "grad_norm": 0.5703125, "learning_rate": 3.9666302707972244e-05, "loss": 0.43056726455688477, "num_input_tokens_seen": 1673912576, "step": 5890, "train_runtime": 57244.6049, "train_tokens_per_second": 29241.403 }, { "epoch": 0.20875395559997967, "grad_norm": 0.5546875, "learning_rate": 3.965382628118358e-05, "loss": 0.43903384208679197, "num_input_tokens_seen": 1676753344, "step": 5900, "train_runtime": 57343.7692, "train_tokens_per_second": 29240.376 }, { "epoch": 0.20910777586370843, "grad_norm": 0.578125, "learning_rate": 3.964136161979959e-05, "loss": 0.4356219291687012, "num_input_tokens_seen": 1679636032, "step": 5910, "train_runtime": 57444.8029, "train_tokens_per_second": 29239.13 }, { "epoch": 0.20946159612743723, "grad_norm": 0.56640625, "learning_rate": 3.9628908705340406e-05, "loss": 0.42699484825134276, "num_input_tokens_seen": 1682448960, "step": 5920, "train_runtime": 57538.5227, "train_tokens_per_second": 29240.392 }, { "epoch": 0.209815416391166, "grad_norm": 0.578125, "learning_rate": 3.961646751936673e-05, "loss": 0.4383396625518799, "num_input_tokens_seen": 1685275328, "step": 5930, "train_runtime": 57636.5192, "train_tokens_per_second": 29239.714 }, { "epoch": 0.21016923665489476, "grad_norm": 0.5703125, "learning_rate": 3.960403804347979e-05, "loss": 0.43402700424194335, "num_input_tokens_seen": 1688108032, "step": 5940, "train_runtime": 57736.8732, "train_tokens_per_second": 29237.954 }, { "epoch": 0.21052305691862355, "grad_norm": 0.5703125, "learning_rate": 3.959162025932119e-05, "loss": 0.435057258605957, "num_input_tokens_seen": 1691020608, "step": 5950, "train_runtime": 57838.9724, "train_tokens_per_second": 29236.699 }, { "epoch": 0.21087687718235232, "grad_norm": 0.59375, "learning_rate": 3.95792141485728e-05, "loss": 0.43424162864685056, "num_input_tokens_seen": 1693874496, "step": 5960, "train_runtime": 57936.219, "train_tokens_per_second": 29236.884 }, { "epoch": 0.2112306974460811, "grad_norm": 0.55859375, "learning_rate": 3.956681969295664e-05, "loss": 0.4301346778869629, "num_input_tokens_seen": 1696687552, "step": 5970, "train_runtime": 58032.3767, "train_tokens_per_second": 29236.913 }, { "epoch": 0.21158451770980988, "grad_norm": 0.5625, "learning_rate": 3.955443687423479e-05, "loss": 0.43507919311523435, "num_input_tokens_seen": 1699554688, "step": 5980, "train_runtime": 58128.4636, "train_tokens_per_second": 29237.908 }, { "epoch": 0.21193833797353867, "grad_norm": 0.5625, "learning_rate": 3.954206567420924e-05, "loss": 0.4325693130493164, "num_input_tokens_seen": 1702368448, "step": 5990, "train_runtime": 58224.0348, "train_tokens_per_second": 29238.243 }, { "epoch": 0.21229215823726744, "grad_norm": 0.56640625, "learning_rate": 3.952970607472179e-05, "loss": 0.4390561103820801, "num_input_tokens_seen": 1705224320, "step": 6000, "train_runtime": 58321.2372, "train_tokens_per_second": 29238.48 }, { "epoch": 0.21264597850099623, "grad_norm": 0.59375, "learning_rate": 3.951735805765399e-05, "loss": 0.4354909896850586, "num_input_tokens_seen": 1708082560, "step": 6010, "train_runtime": 58421.3306, "train_tokens_per_second": 29237.31 }, { "epoch": 0.212999798764725, "grad_norm": 0.54296875, "learning_rate": 3.950502160492692e-05, "loss": 0.43860807418823244, "num_input_tokens_seen": 1710936896, "step": 6020, "train_runtime": 58520.0155, "train_tokens_per_second": 29236.781 }, { "epoch": 0.2133536190284538, "grad_norm": 0.58984375, "learning_rate": 3.9492696698501205e-05, "loss": 0.4326430320739746, "num_input_tokens_seen": 1713764544, "step": 6030, "train_runtime": 58617.7727, "train_tokens_per_second": 29236.262 }, { "epoch": 0.21370743929218255, "grad_norm": 0.54296875, "learning_rate": 3.9480383320376784e-05, "loss": 0.43421192169189454, "num_input_tokens_seen": 1716610688, "step": 6040, "train_runtime": 58712.4979, "train_tokens_per_second": 29237.569 }, { "epoch": 0.21406125955591135, "grad_norm": 0.57421875, "learning_rate": 3.94680814525929e-05, "loss": 0.4363199234008789, "num_input_tokens_seen": 1719404096, "step": 6050, "train_runtime": 58807.8177, "train_tokens_per_second": 29237.679 }, { "epoch": 0.21441507981964011, "grad_norm": 0.57421875, "learning_rate": 3.945579107722792e-05, "loss": 0.433974027633667, "num_input_tokens_seen": 1722238400, "step": 6060, "train_runtime": 58905.901, "train_tokens_per_second": 29237.112 }, { "epoch": 0.2147689000833689, "grad_norm": 0.60546875, "learning_rate": 3.9443512176399276e-05, "loss": 0.4350698947906494, "num_input_tokens_seen": 1725054016, "step": 6070, "train_runtime": 59005.6392, "train_tokens_per_second": 29235.409 }, { "epoch": 0.21512272034709767, "grad_norm": 0.5703125, "learning_rate": 3.9431244732263307e-05, "loss": 0.433062744140625, "num_input_tokens_seen": 1727897216, "step": 6080, "train_runtime": 59102.3186, "train_tokens_per_second": 29235.693 }, { "epoch": 0.21547654061082647, "grad_norm": 0.59375, "learning_rate": 3.941898872701519e-05, "loss": 0.43312692642211914, "num_input_tokens_seen": 1730726784, "step": 6090, "train_runtime": 59200.119, "train_tokens_per_second": 29235.191 }, { "epoch": 0.21583036087455523, "grad_norm": 0.578125, "learning_rate": 3.940674414288882e-05, "loss": 0.43694748878479006, "num_input_tokens_seen": 1733550144, "step": 6100, "train_runtime": 59294.8004, "train_tokens_per_second": 29236.124 }, { "epoch": 0.21618418113828403, "grad_norm": 0.55859375, "learning_rate": 3.939451096215668e-05, "loss": 0.43339242935180666, "num_input_tokens_seen": 1736353792, "step": 6110, "train_runtime": 59386.953, "train_tokens_per_second": 29237.967 }, { "epoch": 0.2165380014020128, "grad_norm": 0.5703125, "learning_rate": 3.938228916712978e-05, "loss": 0.43361706733703614, "num_input_tokens_seen": 1739209408, "step": 6120, "train_runtime": 59484.3381, "train_tokens_per_second": 29238.106 }, { "epoch": 0.21689182166574159, "grad_norm": 0.57421875, "learning_rate": 3.937007874015748e-05, "loss": 0.4330623626708984, "num_input_tokens_seen": 1742103104, "step": 6130, "train_runtime": 59584.1619, "train_tokens_per_second": 29237.687 }, { "epoch": 0.21724564192947035, "grad_norm": 0.546875, "learning_rate": 3.935787966362748e-05, "loss": 0.4316445827484131, "num_input_tokens_seen": 1744954176, "step": 6140, "train_runtime": 59682.0509, "train_tokens_per_second": 29237.504 }, { "epoch": 0.21759946219319914, "grad_norm": 0.578125, "learning_rate": 3.9345691919965595e-05, "loss": 0.4371340751647949, "num_input_tokens_seen": 1747763136, "step": 6150, "train_runtime": 59775.9221, "train_tokens_per_second": 29238.581 }, { "epoch": 0.2179532824569279, "grad_norm": 0.5625, "learning_rate": 3.9333515491635764e-05, "loss": 0.42518091201782227, "num_input_tokens_seen": 1750596096, "step": 6160, "train_runtime": 59872.1007, "train_tokens_per_second": 29238.929 }, { "epoch": 0.2183071027206567, "grad_norm": 0.6015625, "learning_rate": 3.932135036113987e-05, "loss": 0.4350085735321045, "num_input_tokens_seen": 1753441664, "step": 6170, "train_runtime": 59969.5217, "train_tokens_per_second": 29238.88 }, { "epoch": 0.21866092298438547, "grad_norm": 0.5703125, "learning_rate": 3.930919651101764e-05, "loss": 0.4320687770843506, "num_input_tokens_seen": 1756270976, "step": 6180, "train_runtime": 60063.3769, "train_tokens_per_second": 29240.297 }, { "epoch": 0.21901474324811424, "grad_norm": 0.5625, "learning_rate": 3.9297053923846576e-05, "loss": 0.42859630584716796, "num_input_tokens_seen": 1759120064, "step": 6190, "train_runtime": 60161.1552, "train_tokens_per_second": 29240.131 }, { "epoch": 0.21936856351184303, "grad_norm": 0.578125, "learning_rate": 3.928492258224183e-05, "loss": 0.4324918270111084, "num_input_tokens_seen": 1761969408, "step": 6200, "train_runtime": 60261.3726, "train_tokens_per_second": 29238.787 }, { "epoch": 0.2197223837755718, "grad_norm": 0.578125, "learning_rate": 3.927280246885609e-05, "loss": 0.4357311248779297, "num_input_tokens_seen": 1764794368, "step": 6210, "train_runtime": 60355.7351, "train_tokens_per_second": 29239.879 }, { "epoch": 0.2200762040393006, "grad_norm": 0.578125, "learning_rate": 3.9260693566379486e-05, "loss": 0.4329801559448242, "num_input_tokens_seen": 1767617984, "step": 6220, "train_runtime": 60450.1228, "train_tokens_per_second": 29240.933 }, { "epoch": 0.22043002430302935, "grad_norm": 0.5703125, "learning_rate": 3.924859585753948e-05, "loss": 0.43080663681030273, "num_input_tokens_seen": 1770441920, "step": 6230, "train_runtime": 60549.0, "train_tokens_per_second": 29239.821 }, { "epoch": 0.22078384456675815, "grad_norm": 0.57421875, "learning_rate": 3.923650932510079e-05, "loss": 0.42781476974487304, "num_input_tokens_seen": 1773221248, "step": 6240, "train_runtime": 60644.4675, "train_tokens_per_second": 29239.621 }, { "epoch": 0.2211376648304869, "grad_norm": 0.55859375, "learning_rate": 3.9224433951865215e-05, "loss": 0.43264055252075195, "num_input_tokens_seen": 1776083840, "step": 6250, "train_runtime": 60744.0645, "train_tokens_per_second": 29238.805 }, { "epoch": 0.2214914850942157, "grad_norm": 0.6015625, "learning_rate": 3.921236972067165e-05, "loss": 0.4291335105895996, "num_input_tokens_seen": 1778896128, "step": 6260, "train_runtime": 60840.254, "train_tokens_per_second": 29238.802 }, { "epoch": 0.22184530535794447, "grad_norm": 0.59765625, "learning_rate": 3.920031661439585e-05, "loss": 0.43102331161499025, "num_input_tokens_seen": 1781776256, "step": 6270, "train_runtime": 60940.0491, "train_tokens_per_second": 29238.182 }, { "epoch": 0.22219912562167327, "grad_norm": 0.5546875, "learning_rate": 3.918827461595045e-05, "loss": 0.43372297286987305, "num_input_tokens_seen": 1784618432, "step": 6280, "train_runtime": 61037.3337, "train_tokens_per_second": 29238.145 }, { "epoch": 0.22255294588540203, "grad_norm": 0.5703125, "learning_rate": 3.9176243708284746e-05, "loss": 0.430194616317749, "num_input_tokens_seen": 1787409536, "step": 6290, "train_runtime": 61130.3131, "train_tokens_per_second": 29239.332 }, { "epoch": 0.22290676614913082, "grad_norm": 0.5703125, "learning_rate": 3.9164223874384715e-05, "loss": 0.4324221134185791, "num_input_tokens_seen": 1790285248, "step": 6300, "train_runtime": 61229.6622, "train_tokens_per_second": 29238.856 }, { "epoch": 0.2232605864128596, "grad_norm": 0.57421875, "learning_rate": 3.91522150972728e-05, "loss": 0.4361156463623047, "num_input_tokens_seen": 1793080832, "step": 6310, "train_runtime": 61323.7765, "train_tokens_per_second": 29239.57 }, { "epoch": 0.22361440667658838, "grad_norm": 0.55859375, "learning_rate": 3.9140217360007896e-05, "loss": 0.4314689636230469, "num_input_tokens_seen": 1795923200, "step": 6320, "train_runtime": 61422.0999, "train_tokens_per_second": 29239.039 }, { "epoch": 0.22396822694031715, "grad_norm": 0.56640625, "learning_rate": 3.912823064568521e-05, "loss": 0.43456201553344725, "num_input_tokens_seen": 1798770432, "step": 6330, "train_runtime": 61518.3987, "train_tokens_per_second": 29239.552 }, { "epoch": 0.22432204720404594, "grad_norm": 0.5625, "learning_rate": 3.9116254937436155e-05, "loss": 0.43364620208740234, "num_input_tokens_seen": 1801678912, "step": 6340, "train_runtime": 61621.3967, "train_tokens_per_second": 29237.879 }, { "epoch": 0.2246758674677747, "grad_norm": 0.55859375, "learning_rate": 3.910429021842825e-05, "loss": 0.4326483726501465, "num_input_tokens_seen": 1804571712, "step": 6350, "train_runtime": 61723.6682, "train_tokens_per_second": 29236.301 }, { "epoch": 0.2250296877315035, "grad_norm": 0.57421875, "learning_rate": 3.9092336471865084e-05, "loss": 0.4279055595397949, "num_input_tokens_seen": 1807458880, "step": 6360, "train_runtime": 61822.638, "train_tokens_per_second": 29236.198 }, { "epoch": 0.22538350799523227, "grad_norm": 0.60546875, "learning_rate": 3.908039368098611e-05, "loss": 0.42912998199462893, "num_input_tokens_seen": 1810334720, "step": 6370, "train_runtime": 61922.865, "train_tokens_per_second": 29235.319 }, { "epoch": 0.22573732825896106, "grad_norm": 0.58203125, "learning_rate": 3.9068461829066633e-05, "loss": 0.42847251892089844, "num_input_tokens_seen": 1813165248, "step": 6380, "train_runtime": 62021.7351, "train_tokens_per_second": 29234.352 }, { "epoch": 0.22609114852268983, "grad_norm": 0.58984375, "learning_rate": 3.9056540899417656e-05, "loss": 0.43103508949279784, "num_input_tokens_seen": 1816047488, "step": 6390, "train_runtime": 62120.0229, "train_tokens_per_second": 29234.495 }, { "epoch": 0.22644496878641862, "grad_norm": 0.57421875, "learning_rate": 3.904463087538585e-05, "loss": 0.43492941856384276, "num_input_tokens_seen": 1818968000, "step": 6400, "train_runtime": 62221.6787, "train_tokens_per_second": 29233.67 }, { "epoch": 0.2267987890501474, "grad_norm": 0.5703125, "learning_rate": 3.903273174035336e-05, "loss": 0.4328557014465332, "num_input_tokens_seen": 1821808384, "step": 6410, "train_runtime": 62317.2662, "train_tokens_per_second": 29234.408 }, { "epoch": 0.22715260931387618, "grad_norm": 0.5546875, "learning_rate": 3.902084347773779e-05, "loss": 0.4325701236724854, "num_input_tokens_seen": 1824615104, "step": 6420, "train_runtime": 62407.9526, "train_tokens_per_second": 29236.901 }, { "epoch": 0.22750642957760495, "grad_norm": 0.56640625, "learning_rate": 3.900896607099207e-05, "loss": 0.4290501594543457, "num_input_tokens_seen": 1827493440, "step": 6430, "train_runtime": 62505.29, "train_tokens_per_second": 29237.42 }, { "epoch": 0.2278602498413337, "grad_norm": 0.58203125, "learning_rate": 3.899709950360437e-05, "loss": 0.43046369552612307, "num_input_tokens_seen": 1830364224, "step": 6440, "train_runtime": 62609.1841, "train_tokens_per_second": 29234.756 }, { "epoch": 0.2282140701050625, "grad_norm": 0.55859375, "learning_rate": 3.8985243759097997e-05, "loss": 0.4359885215759277, "num_input_tokens_seen": 1833173248, "step": 6450, "train_runtime": 62706.9275, "train_tokens_per_second": 29233.983 }, { "epoch": 0.22856789036879127, "grad_norm": 0.5625, "learning_rate": 3.897339882103129e-05, "loss": 0.4279576301574707, "num_input_tokens_seen": 1836004224, "step": 6460, "train_runtime": 62803.2408, "train_tokens_per_second": 29234.227 }, { "epoch": 0.22892171063252006, "grad_norm": 0.57421875, "learning_rate": 3.8961564672997544e-05, "loss": 0.4297611713409424, "num_input_tokens_seen": 1838892288, "step": 6470, "train_runtime": 62902.6571, "train_tokens_per_second": 29233.937 }, { "epoch": 0.22927553089624883, "grad_norm": 0.5859375, "learning_rate": 3.8949741298624924e-05, "loss": 0.43323631286621095, "num_input_tokens_seen": 1841783296, "step": 6480, "train_runtime": 63002.8296, "train_tokens_per_second": 29233.342 }, { "epoch": 0.22962935115997762, "grad_norm": 0.55859375, "learning_rate": 3.8937928681576305e-05, "loss": 0.4244824409484863, "num_input_tokens_seen": 1844600320, "step": 6490, "train_runtime": 63100.2299, "train_tokens_per_second": 29232.862 }, { "epoch": 0.2299831714237064, "grad_norm": 0.578125, "learning_rate": 3.8926126805549276e-05, "loss": 0.42909870147705076, "num_input_tokens_seen": 1847412800, "step": 6500, "train_runtime": 63196.8007, "train_tokens_per_second": 29232.695 }, { "epoch": 0.23033699168743518, "grad_norm": 0.57421875, "learning_rate": 3.891433565427596e-05, "loss": 0.42655296325683595, "num_input_tokens_seen": 1850266368, "step": 6510, "train_runtime": 63293.0039, "train_tokens_per_second": 29233.347 }, { "epoch": 0.23069081195116395, "grad_norm": 0.58203125, "learning_rate": 3.8902555211522964e-05, "loss": 0.4330574035644531, "num_input_tokens_seen": 1853080064, "step": 6520, "train_runtime": 63390.1764, "train_tokens_per_second": 29232.922 }, { "epoch": 0.23104463221489274, "grad_norm": 0.58984375, "learning_rate": 3.889078546109127e-05, "loss": 0.42397561073303225, "num_input_tokens_seen": 1855954496, "step": 6530, "train_runtime": 63488.2576, "train_tokens_per_second": 29233.036 }, { "epoch": 0.2313984524786215, "grad_norm": 0.5703125, "learning_rate": 3.887902638681616e-05, "loss": 0.434549617767334, "num_input_tokens_seen": 1858839360, "step": 6540, "train_runtime": 63590.8332, "train_tokens_per_second": 29231.247 }, { "epoch": 0.2317522727423503, "grad_norm": 0.5546875, "learning_rate": 3.886727797256707e-05, "loss": 0.4277657032012939, "num_input_tokens_seen": 1861636608, "step": 6550, "train_runtime": 63684.0417, "train_tokens_per_second": 29232.388 }, { "epoch": 0.23210609300607907, "grad_norm": 0.58203125, "learning_rate": 3.88555402022476e-05, "loss": 0.4328862190246582, "num_input_tokens_seen": 1864463936, "step": 6560, "train_runtime": 63779.9879, "train_tokens_per_second": 29232.742 }, { "epoch": 0.23245991326980786, "grad_norm": 0.59765625, "learning_rate": 3.884381305979528e-05, "loss": 0.43508000373840333, "num_input_tokens_seen": 1867305792, "step": 6570, "train_runtime": 63875.2377, "train_tokens_per_second": 29233.641 }, { "epoch": 0.23281373353353663, "grad_norm": 0.54296875, "learning_rate": 3.883209652918163e-05, "loss": 0.4378073692321777, "num_input_tokens_seen": 1870197312, "step": 6580, "train_runtime": 63976.6842, "train_tokens_per_second": 29232.483 }, { "epoch": 0.23316755379726542, "grad_norm": 0.546875, "learning_rate": 3.8820390594411935e-05, "loss": 0.43173627853393554, "num_input_tokens_seen": 1873037888, "step": 6590, "train_runtime": 64072.3747, "train_tokens_per_second": 29233.159 }, { "epoch": 0.23352137406099419, "grad_norm": 0.578125, "learning_rate": 3.880869523952524e-05, "loss": 0.43375453948974607, "num_input_tokens_seen": 1875862336, "step": 6600, "train_runtime": 64167.7465, "train_tokens_per_second": 29233.726 }, { "epoch": 0.23387519432472298, "grad_norm": 0.5625, "learning_rate": 3.879701044859422e-05, "loss": 0.4325495719909668, "num_input_tokens_seen": 1878708736, "step": 6610, "train_runtime": 64266.6201, "train_tokens_per_second": 29233.041 }, { "epoch": 0.23422901458845174, "grad_norm": 0.5859375, "learning_rate": 3.87853362057251e-05, "loss": 0.4317276954650879, "num_input_tokens_seen": 1881544192, "step": 6620, "train_runtime": 64363.588, "train_tokens_per_second": 29233.053 }, { "epoch": 0.23458283485218054, "grad_norm": 0.578125, "learning_rate": 3.8773672495057576e-05, "loss": 0.4251361846923828, "num_input_tokens_seen": 1884380800, "step": 6630, "train_runtime": 64461.4269, "train_tokens_per_second": 29232.688 }, { "epoch": 0.2349366551159093, "grad_norm": 0.578125, "learning_rate": 3.8762019300764674e-05, "loss": 0.43528404235839846, "num_input_tokens_seen": 1887308288, "step": 6640, "train_runtime": 64563.214, "train_tokens_per_second": 29231.945 }, { "epoch": 0.2352904753796381, "grad_norm": 0.5625, "learning_rate": 3.875037660705273e-05, "loss": 0.4310269832611084, "num_input_tokens_seen": 1890241536, "step": 6650, "train_runtime": 64667.2865, "train_tokens_per_second": 29230.259 }, { "epoch": 0.23564429564336686, "grad_norm": 0.5703125, "learning_rate": 3.873874439816127e-05, "loss": 0.43013877868652345, "num_input_tokens_seen": 1893055168, "step": 6660, "train_runtime": 64762.2709, "train_tokens_per_second": 29230.834 }, { "epoch": 0.23599811590709566, "grad_norm": 0.5703125, "learning_rate": 3.872712265836289e-05, "loss": 0.42960572242736816, "num_input_tokens_seen": 1895939264, "step": 6670, "train_runtime": 64863.0824, "train_tokens_per_second": 29229.867 }, { "epoch": 0.23635193617082442, "grad_norm": 0.5703125, "learning_rate": 3.8715511371963225e-05, "loss": 0.4291656494140625, "num_input_tokens_seen": 1898837952, "step": 6680, "train_runtime": 64963.6927, "train_tokens_per_second": 29229.218 }, { "epoch": 0.23670575643455322, "grad_norm": 0.55859375, "learning_rate": 3.87039105233008e-05, "loss": 0.4306159973144531, "num_input_tokens_seen": 1901653440, "step": 6690, "train_runtime": 65057.7854, "train_tokens_per_second": 29230.221 }, { "epoch": 0.23705957669828198, "grad_norm": 0.59375, "learning_rate": 3.8692320096746975e-05, "loss": 0.42613606452941893, "num_input_tokens_seen": 1904521472, "step": 6700, "train_runtime": 65157.0992, "train_tokens_per_second": 29229.685 }, { "epoch": 0.23741339696201075, "grad_norm": 0.5703125, "learning_rate": 3.868074007670589e-05, "loss": 0.4319624900817871, "num_input_tokens_seen": 1907357632, "step": 6710, "train_runtime": 65251.0927, "train_tokens_per_second": 29231.045 }, { "epoch": 0.23776721722573954, "grad_norm": 0.5859375, "learning_rate": 3.866917044761428e-05, "loss": 0.435207462310791, "num_input_tokens_seen": 1910141312, "step": 6720, "train_runtime": 65345.4286, "train_tokens_per_second": 29231.445 }, { "epoch": 0.2381210374894683, "grad_norm": 0.61328125, "learning_rate": 3.8657611193941486e-05, "loss": 0.42978782653808595, "num_input_tokens_seen": 1912992640, "step": 6730, "train_runtime": 65442.3277, "train_tokens_per_second": 29231.733 }, { "epoch": 0.2384748577531971, "grad_norm": 0.56640625, "learning_rate": 3.8646062300189315e-05, "loss": 0.43167934417724607, "num_input_tokens_seen": 1915814976, "step": 6740, "train_runtime": 65538.7604, "train_tokens_per_second": 29231.785 }, { "epoch": 0.23882867801692587, "grad_norm": 0.57421875, "learning_rate": 3.8634523750891984e-05, "loss": 0.43164815902709963, "num_input_tokens_seen": 1918640832, "step": 6750, "train_runtime": 65634.5568, "train_tokens_per_second": 29232.175 }, { "epoch": 0.23918249828065466, "grad_norm": 0.5703125, "learning_rate": 3.862299553061597e-05, "loss": 0.4300533294677734, "num_input_tokens_seen": 1921455040, "step": 6760, "train_runtime": 65730.437, "train_tokens_per_second": 29232.348 }, { "epoch": 0.23953631854438343, "grad_norm": 0.56640625, "learning_rate": 3.861147762396e-05, "loss": 0.42687139511108396, "num_input_tokens_seen": 1924308160, "step": 6770, "train_runtime": 65827.6392, "train_tokens_per_second": 29232.526 }, { "epoch": 0.23989013880811222, "grad_norm": 0.58203125, "learning_rate": 3.859997001555494e-05, "loss": 0.43641343116760256, "num_input_tokens_seen": 1927171840, "step": 6780, "train_runtime": 65927.4964, "train_tokens_per_second": 29231.686 }, { "epoch": 0.24024395907184098, "grad_norm": 0.55859375, "learning_rate": 3.8588472690063676e-05, "loss": 0.424938440322876, "num_input_tokens_seen": 1930048320, "step": 6790, "train_runtime": 66025.3438, "train_tokens_per_second": 29231.931 }, { "epoch": 0.24059777933556978, "grad_norm": 0.58203125, "learning_rate": 3.857698563218106e-05, "loss": 0.426741886138916, "num_input_tokens_seen": 1932894976, "step": 6800, "train_runtime": 66121.7659, "train_tokens_per_second": 29232.356 }, { "epoch": 0.24095159959929854, "grad_norm": 0.57421875, "learning_rate": 3.8565508826633836e-05, "loss": 0.43222684860229493, "num_input_tokens_seen": 1935687936, "step": 6810, "train_runtime": 66216.8666, "train_tokens_per_second": 29232.551 }, { "epoch": 0.24130541986302734, "grad_norm": 0.58203125, "learning_rate": 3.855404225818049e-05, "loss": 0.4261011600494385, "num_input_tokens_seen": 1938496576, "step": 6820, "train_runtime": 66309.3366, "train_tokens_per_second": 29234.142 }, { "epoch": 0.2416592401267561, "grad_norm": 0.57421875, "learning_rate": 3.8542585911611286e-05, "loss": 0.43096199035644533, "num_input_tokens_seen": 1941282368, "step": 6830, "train_runtime": 66406.0347, "train_tokens_per_second": 29233.523 }, { "epoch": 0.2420130603904849, "grad_norm": 0.55859375, "learning_rate": 3.853113977174803e-05, "loss": 0.43064117431640625, "num_input_tokens_seen": 1944067968, "step": 6840, "train_runtime": 66499.026, "train_tokens_per_second": 29234.533 }, { "epoch": 0.24236688065421366, "grad_norm": 0.5859375, "learning_rate": 3.851970382344411e-05, "loss": 0.4254364013671875, "num_input_tokens_seen": 1946858304, "step": 6850, "train_runtime": 66593.1838, "train_tokens_per_second": 29235.099 }, { "epoch": 0.24272070091794246, "grad_norm": 0.5859375, "learning_rate": 3.850827805158433e-05, "loss": 0.42681407928466797, "num_input_tokens_seen": 1949729472, "step": 6860, "train_runtime": 66692.3552, "train_tokens_per_second": 29234.677 }, { "epoch": 0.24307452118167122, "grad_norm": 0.57421875, "learning_rate": 3.8496862441084896e-05, "loss": 0.4354985237121582, "num_input_tokens_seen": 1952568000, "step": 6870, "train_runtime": 66791.1525, "train_tokens_per_second": 29233.932 }, { "epoch": 0.24342834144540001, "grad_norm": 0.5859375, "learning_rate": 3.848545697689328e-05, "loss": 0.43179874420166015, "num_input_tokens_seen": 1955436224, "step": 6880, "train_runtime": 66890.0468, "train_tokens_per_second": 29233.59 }, { "epoch": 0.24378216170912878, "grad_norm": 0.58984375, "learning_rate": 3.8474061643988136e-05, "loss": 0.43176898956298826, "num_input_tokens_seen": 1958284672, "step": 6890, "train_runtime": 66986.404, "train_tokens_per_second": 29234.062 }, { "epoch": 0.24413598197285757, "grad_norm": 0.578125, "learning_rate": 3.846267642737925e-05, "loss": 0.429611873626709, "num_input_tokens_seen": 1961151936, "step": 6900, "train_runtime": 67085.6245, "train_tokens_per_second": 29233.565 }, { "epoch": 0.24448980223658634, "grad_norm": 0.578125, "learning_rate": 3.8451301312107455e-05, "loss": 0.4352381706237793, "num_input_tokens_seen": 1963977536, "step": 6910, "train_runtime": 67178.4117, "train_tokens_per_second": 29235.248 }, { "epoch": 0.24484362250031513, "grad_norm": 0.6640625, "learning_rate": 3.843993628324451e-05, "loss": 0.43280868530273436, "num_input_tokens_seen": 1966882304, "step": 6920, "train_runtime": 67279.0431, "train_tokens_per_second": 29234.695 }, { "epoch": 0.2451974427640439, "grad_norm": 0.58203125, "learning_rate": 3.8428581325893034e-05, "loss": 0.42553396224975587, "num_input_tokens_seen": 1969747328, "step": 6930, "train_runtime": 67378.6292, "train_tokens_per_second": 29234.007 }, { "epoch": 0.2455512630277727, "grad_norm": 0.578125, "learning_rate": 3.8417236425186484e-05, "loss": 0.4305004119873047, "num_input_tokens_seen": 1972638400, "step": 6940, "train_runtime": 67478.0472, "train_tokens_per_second": 29233.78 }, { "epoch": 0.24590508329150146, "grad_norm": 0.55078125, "learning_rate": 3.840590156628895e-05, "loss": 0.4329527854919434, "num_input_tokens_seen": 1975386240, "step": 6950, "train_runtime": 67569.6218, "train_tokens_per_second": 29234.828 }, { "epoch": 0.24625890355523022, "grad_norm": 0.59765625, "learning_rate": 3.8394576734395205e-05, "loss": 0.4306673049926758, "num_input_tokens_seen": 1978244864, "step": 6960, "train_runtime": 67666.1616, "train_tokens_per_second": 29235.364 }, { "epoch": 0.24661272381895902, "grad_norm": 0.59375, "learning_rate": 3.838326191473054e-05, "loss": 0.4305530548095703, "num_input_tokens_seen": 1981100288, "step": 6970, "train_runtime": 67762.2022, "train_tokens_per_second": 29236.067 }, { "epoch": 0.24696654408268778, "grad_norm": 0.5625, "learning_rate": 3.837195709255069e-05, "loss": 0.4284849166870117, "num_input_tokens_seen": 1983949504, "step": 6980, "train_runtime": 67859.4366, "train_tokens_per_second": 29236.162 }, { "epoch": 0.24732036434641658, "grad_norm": 0.5703125, "learning_rate": 3.8360662253141796e-05, "loss": 0.4298586368560791, "num_input_tokens_seen": 1986802688, "step": 6990, "train_runtime": 67957.57, "train_tokens_per_second": 29235.929 }, { "epoch": 0.24767418461014534, "grad_norm": 0.58203125, "learning_rate": 3.834937738182029e-05, "loss": 0.4331483840942383, "num_input_tokens_seen": 1989645568, "step": 7000, "train_runtime": 68055.4779, "train_tokens_per_second": 29235.642 }, { "epoch": 0.24802800487387414, "grad_norm": 0.546875, "learning_rate": 3.833810246393281e-05, "loss": 0.4273562431335449, "num_input_tokens_seen": 1992492736, "step": 7010, "train_runtime": 68152.3788, "train_tokens_per_second": 29235.85 }, { "epoch": 0.2483818251376029, "grad_norm": 0.5703125, "learning_rate": 3.832683748485616e-05, "loss": 0.4271261215209961, "num_input_tokens_seen": 1995362560, "step": 7020, "train_runtime": 68253.171, "train_tokens_per_second": 29234.723 }, { "epoch": 0.2487356454013317, "grad_norm": 0.5546875, "learning_rate": 3.8315582429997184e-05, "loss": 0.42997045516967775, "num_input_tokens_seen": 1998209664, "step": 7030, "train_runtime": 68350.3865, "train_tokens_per_second": 29234.797 }, { "epoch": 0.24908946566506046, "grad_norm": 0.5625, "learning_rate": 3.830433728479272e-05, "loss": 0.43201465606689454, "num_input_tokens_seen": 2001065600, "step": 7040, "train_runtime": 68448.9739, "train_tokens_per_second": 29234.413 }, { "epoch": 0.24944328592878925, "grad_norm": 0.53515625, "learning_rate": 3.829310203470948e-05, "loss": 0.42966575622558595, "num_input_tokens_seen": 2003880192, "step": 7050, "train_runtime": 68545.3122, "train_tokens_per_second": 29234.387 }, { "epoch": 0.24979710619251802, "grad_norm": 0.59375, "learning_rate": 3.828187666524403e-05, "loss": 0.4268825531005859, "num_input_tokens_seen": 2006683904, "step": 7060, "train_runtime": 68638.518, "train_tokens_per_second": 29235.537 }, { "epoch": 0.2501509264562468, "grad_norm": 0.5859375, "learning_rate": 3.827066116192266e-05, "loss": 0.4267873764038086, "num_input_tokens_seen": 2009511232, "step": 7070, "train_runtime": 68734.7504, "train_tokens_per_second": 29235.739 }, { "epoch": 0.2505047467199756, "grad_norm": 0.59765625, "learning_rate": 3.825945551030135e-05, "loss": 0.4300816535949707, "num_input_tokens_seen": 2012319744, "step": 7080, "train_runtime": 68830.1799, "train_tokens_per_second": 29236.009 }, { "epoch": 0.25085856698370435, "grad_norm": 0.578125, "learning_rate": 3.824825969596561e-05, "loss": 0.4281140327453613, "num_input_tokens_seen": 2015164544, "step": 7090, "train_runtime": 68927.3037, "train_tokens_per_second": 29236.085 }, { "epoch": 0.25121238724743317, "grad_norm": 0.57421875, "learning_rate": 3.823707370453054e-05, "loss": 0.43103675842285155, "num_input_tokens_seen": 2018028928, "step": 7100, "train_runtime": 69026.2347, "train_tokens_per_second": 29235.68 }, { "epoch": 0.25156620751116193, "grad_norm": 0.56640625, "learning_rate": 3.8225897521640614e-05, "loss": 0.42860612869262693, "num_input_tokens_seen": 2020869120, "step": 7110, "train_runtime": 69121.0515, "train_tokens_per_second": 29236.666 }, { "epoch": 0.2519200277748907, "grad_norm": 0.5625, "learning_rate": 3.8214731132969675e-05, "loss": 0.429230785369873, "num_input_tokens_seen": 2023728320, "step": 7120, "train_runtime": 69220.8027, "train_tokens_per_second": 29235.84 }, { "epoch": 0.25227384803861946, "grad_norm": 0.56640625, "learning_rate": 3.820357452422084e-05, "loss": 0.4243276596069336, "num_input_tokens_seen": 2026488448, "step": 7130, "train_runtime": 69313.8973, "train_tokens_per_second": 29236.395 }, { "epoch": 0.2526276683023483, "grad_norm": 0.5703125, "learning_rate": 3.8192427681126445e-05, "loss": 0.42637834548950193, "num_input_tokens_seen": 2029323392, "step": 7140, "train_runtime": 69411.0809, "train_tokens_per_second": 29236.303 }, { "epoch": 0.25298148856607705, "grad_norm": 0.5703125, "learning_rate": 3.818129058944793e-05, "loss": 0.4294004440307617, "num_input_tokens_seen": 2032191488, "step": 7150, "train_runtime": 69508.8643, "train_tokens_per_second": 29236.436 }, { "epoch": 0.2533353088298058, "grad_norm": 0.55078125, "learning_rate": 3.817016323497578e-05, "loss": 0.42581949234008787, "num_input_tokens_seen": 2035036480, "step": 7160, "train_runtime": 69605.8708, "train_tokens_per_second": 29236.564 }, { "epoch": 0.2536891290935346, "grad_norm": 0.5859375, "learning_rate": 3.8159045603529455e-05, "loss": 0.42792572975158694, "num_input_tokens_seen": 2037872896, "step": 7170, "train_runtime": 69700.9018, "train_tokens_per_second": 29237.396 }, { "epoch": 0.2540429493572634, "grad_norm": 0.58203125, "learning_rate": 3.8147937680957334e-05, "loss": 0.42626428604125977, "num_input_tokens_seen": 2040756736, "step": 7180, "train_runtime": 69802.394, "train_tokens_per_second": 29236.2 }, { "epoch": 0.25439676962099217, "grad_norm": 0.56640625, "learning_rate": 3.813683945313658e-05, "loss": 0.4278706550598145, "num_input_tokens_seen": 2043658624, "step": 7190, "train_runtime": 69904.8704, "train_tokens_per_second": 29234.853 }, { "epoch": 0.25475058988472093, "grad_norm": 0.58984375, "learning_rate": 3.812575090597313e-05, "loss": 0.4257061004638672, "num_input_tokens_seen": 2046480768, "step": 7200, "train_runtime": 69998.9083, "train_tokens_per_second": 29235.896 }, { "epoch": 0.2551044101484497, "grad_norm": 0.56640625, "learning_rate": 3.811467202540156e-05, "loss": 0.4267751693725586, "num_input_tokens_seen": 2049320192, "step": 7210, "train_runtime": 70096.5692, "train_tokens_per_second": 29235.67 }, { "epoch": 0.25545823041217847, "grad_norm": 0.5703125, "learning_rate": 3.810360279738507e-05, "loss": 0.4266937732696533, "num_input_tokens_seen": 2052214592, "step": 7220, "train_runtime": 70197.7757, "train_tokens_per_second": 29234.752 }, { "epoch": 0.2558120506759073, "grad_norm": 0.60546875, "learning_rate": 3.809254320791535e-05, "loss": 0.42996883392333984, "num_input_tokens_seen": 2055053696, "step": 7230, "train_runtime": 70296.1801, "train_tokens_per_second": 29234.216 }, { "epoch": 0.25616587093963605, "grad_norm": 0.56640625, "learning_rate": 3.808149324301256e-05, "loss": 0.4278991222381592, "num_input_tokens_seen": 2057861696, "step": 7240, "train_runtime": 70391.1548, "train_tokens_per_second": 29234.663 }, { "epoch": 0.2565196912033648, "grad_norm": 0.57421875, "learning_rate": 3.807045288872522e-05, "loss": 0.43072357177734377, "num_input_tokens_seen": 2060795840, "step": 7250, "train_runtime": 70494.545, "train_tokens_per_second": 29233.409 }, { "epoch": 0.2568735114670936, "grad_norm": 0.578125, "learning_rate": 3.805942213113015e-05, "loss": 0.4289708137512207, "num_input_tokens_seen": 2063608512, "step": 7260, "train_runtime": 70591.2357, "train_tokens_per_second": 29233.211 }, { "epoch": 0.2572273317308224, "grad_norm": 0.5703125, "learning_rate": 3.8048400956332385e-05, "loss": 0.42472009658813475, "num_input_tokens_seen": 2066395712, "step": 7270, "train_runtime": 70684.7815, "train_tokens_per_second": 29233.955 }, { "epoch": 0.25758115199455117, "grad_norm": 0.58984375, "learning_rate": 3.803738935046512e-05, "loss": 0.42498350143432617, "num_input_tokens_seen": 2069224768, "step": 7280, "train_runtime": 70776.3714, "train_tokens_per_second": 29236.096 }, { "epoch": 0.25793497225827994, "grad_norm": 0.5859375, "learning_rate": 3.802638729968962e-05, "loss": 0.4275249481201172, "num_input_tokens_seen": 2072058432, "step": 7290, "train_runtime": 70871.7768, "train_tokens_per_second": 29236.722 }, { "epoch": 0.2582887925220087, "grad_norm": 0.59375, "learning_rate": 3.8015394790195145e-05, "loss": 0.4259969234466553, "num_input_tokens_seen": 2074911296, "step": 7300, "train_runtime": 70968.1521, "train_tokens_per_second": 29237.217 }, { "epoch": 0.2586426127857375, "grad_norm": 0.55078125, "learning_rate": 3.800441180819891e-05, "loss": 0.42400274276733396, "num_input_tokens_seen": 2077735040, "step": 7310, "train_runtime": 71061.1667, "train_tokens_per_second": 29238.685 }, { "epoch": 0.2589964330494663, "grad_norm": 0.546875, "learning_rate": 3.7993438339945965e-05, "loss": 0.4285571098327637, "num_input_tokens_seen": 2080523264, "step": 7320, "train_runtime": 71156.1282, "train_tokens_per_second": 29238.849 }, { "epoch": 0.25935025331319506, "grad_norm": 0.5703125, "learning_rate": 3.798247437170914e-05, "loss": 0.4280029296875, "num_input_tokens_seen": 2083436160, "step": 7330, "train_runtime": 71255.2592, "train_tokens_per_second": 29239.051 }, { "epoch": 0.2597040735769238, "grad_norm": 0.55859375, "learning_rate": 3.797151988978901e-05, "loss": 0.4295159339904785, "num_input_tokens_seen": 2086317440, "step": 7340, "train_runtime": 71355.8136, "train_tokens_per_second": 29238.226 }, { "epoch": 0.26005789384065264, "grad_norm": 0.5703125, "learning_rate": 3.796057488051377e-05, "loss": 0.4264115810394287, "num_input_tokens_seen": 2089149312, "step": 7350, "train_runtime": 71452.8076, "train_tokens_per_second": 29238.17 }, { "epoch": 0.2604117141043814, "grad_norm": 0.578125, "learning_rate": 3.794963933023918e-05, "loss": 0.43225893974304197, "num_input_tokens_seen": 2092033920, "step": 7360, "train_runtime": 71552.6994, "train_tokens_per_second": 29237.666 }, { "epoch": 0.2607655343681102, "grad_norm": 0.5703125, "learning_rate": 3.79387132253485e-05, "loss": 0.42646141052246095, "num_input_tokens_seen": 2094888320, "step": 7370, "train_runtime": 71648.1577, "train_tokens_per_second": 29238.551 }, { "epoch": 0.26111935463183894, "grad_norm": 0.5859375, "learning_rate": 3.792779655225243e-05, "loss": 0.4248672962188721, "num_input_tokens_seen": 2097696448, "step": 7380, "train_runtime": 71743.1746, "train_tokens_per_second": 29238.969 }, { "epoch": 0.26147317489556776, "grad_norm": 0.56640625, "learning_rate": 3.791688929738902e-05, "loss": 0.4293975830078125, "num_input_tokens_seen": 2100542080, "step": 7390, "train_runtime": 71840.467, "train_tokens_per_second": 29238.981 }, { "epoch": 0.2618269951592965, "grad_norm": 0.55859375, "learning_rate": 3.79059914472236e-05, "loss": 0.4282999515533447, "num_input_tokens_seen": 2103424704, "step": 7400, "train_runtime": 71939.9939, "train_tokens_per_second": 29238.6 }, { "epoch": 0.2621808154230253, "grad_norm": 0.5703125, "learning_rate": 3.7895102988248716e-05, "loss": 0.4268609046936035, "num_input_tokens_seen": 2106209600, "step": 7410, "train_runtime": 72030.6012, "train_tokens_per_second": 29240.483 }, { "epoch": 0.26253463568675406, "grad_norm": 0.55078125, "learning_rate": 3.7884223906984064e-05, "loss": 0.428282356262207, "num_input_tokens_seen": 2109084864, "step": 7420, "train_runtime": 72131.8065, "train_tokens_per_second": 29239.318 }, { "epoch": 0.2628884559504829, "grad_norm": 0.56640625, "learning_rate": 3.787335418997641e-05, "loss": 0.42298011779785155, "num_input_tokens_seen": 2111953856, "step": 7430, "train_runtime": 72229.0755, "train_tokens_per_second": 29239.663 }, { "epoch": 0.26324227621421165, "grad_norm": 0.55078125, "learning_rate": 3.786249382379952e-05, "loss": 0.42200241088867185, "num_input_tokens_seen": 2114753408, "step": 7440, "train_runtime": 72323.5023, "train_tokens_per_second": 29240.196 }, { "epoch": 0.2635960964779404, "grad_norm": 0.56640625, "learning_rate": 3.785164279505411e-05, "loss": 0.4272355556488037, "num_input_tokens_seen": 2117616384, "step": 7450, "train_runtime": 72422.6944, "train_tokens_per_second": 29239.68 }, { "epoch": 0.2639499167416692, "grad_norm": 0.55859375, "learning_rate": 3.7840801090367744e-05, "loss": 0.4236455917358398, "num_input_tokens_seen": 2120492864, "step": 7460, "train_runtime": 72522.5693, "train_tokens_per_second": 29239.075 }, { "epoch": 0.26430373700539794, "grad_norm": 0.55078125, "learning_rate": 3.782996869639479e-05, "loss": 0.42912778854370115, "num_input_tokens_seen": 2123302848, "step": 7470, "train_runtime": 72618.1433, "train_tokens_per_second": 29239.289 }, { "epoch": 0.26465755726912676, "grad_norm": 0.58203125, "learning_rate": 3.7819145599816354e-05, "loss": 0.42866220474243166, "num_input_tokens_seen": 2126127488, "step": 7480, "train_runtime": 72712.092, "train_tokens_per_second": 29240.356 }, { "epoch": 0.26501137753285553, "grad_norm": 0.59375, "learning_rate": 3.780833178734018e-05, "loss": 0.43070359230041505, "num_input_tokens_seen": 2129004864, "step": 7490, "train_runtime": 72811.6123, "train_tokens_per_second": 29239.908 }, { "epoch": 0.2653651977965843, "grad_norm": 0.56640625, "learning_rate": 3.77975272457006e-05, "loss": 0.4281341552734375, "num_input_tokens_seen": 2131798656, "step": 7500, "train_runtime": 72905.6241, "train_tokens_per_second": 29240.524 }, { "epoch": 0.26571901806031306, "grad_norm": 0.56640625, "learning_rate": 3.778673196165851e-05, "loss": 0.4266397476196289, "num_input_tokens_seen": 2134637504, "step": 7510, "train_runtime": 73002.9886, "train_tokens_per_second": 29240.413 }, { "epoch": 0.2660728383240419, "grad_norm": 0.58203125, "learning_rate": 3.7775945922001186e-05, "loss": 0.4280815601348877, "num_input_tokens_seen": 2137523456, "step": 7520, "train_runtime": 73102.4027, "train_tokens_per_second": 29240.126 }, { "epoch": 0.26642665858777065, "grad_norm": 0.5859375, "learning_rate": 3.776516911354236e-05, "loss": 0.42893023490905763, "num_input_tokens_seen": 2140406464, "step": 7530, "train_runtime": 73197.5663, "train_tokens_per_second": 29241.498 }, { "epoch": 0.2667804788514994, "grad_norm": 0.5703125, "learning_rate": 3.775440152312205e-05, "loss": 0.4321183204650879, "num_input_tokens_seen": 2143232512, "step": 7540, "train_runtime": 73292.9331, "train_tokens_per_second": 29242.008 }, { "epoch": 0.2671342991152282, "grad_norm": 0.5703125, "learning_rate": 3.774364313760652e-05, "loss": 0.42190303802490237, "num_input_tokens_seen": 2146056960, "step": 7550, "train_runtime": 73387.9673, "train_tokens_per_second": 29242.627 }, { "epoch": 0.267488119378957, "grad_norm": 0.57421875, "learning_rate": 3.7732893943888224e-05, "loss": 0.42957496643066406, "num_input_tokens_seen": 2148890048, "step": 7560, "train_runtime": 73483.3392, "train_tokens_per_second": 29243.228 }, { "epoch": 0.26784193964268577, "grad_norm": 0.56640625, "learning_rate": 3.772215392888574e-05, "loss": 0.42708258628845214, "num_input_tokens_seen": 2151736000, "step": 7570, "train_runtime": 73578.9924, "train_tokens_per_second": 29243.891 }, { "epoch": 0.26819575990641453, "grad_norm": 0.5859375, "learning_rate": 3.771142307954368e-05, "loss": 0.42136316299438475, "num_input_tokens_seen": 2154576640, "step": 7580, "train_runtime": 73674.3327, "train_tokens_per_second": 29244.603 }, { "epoch": 0.2685495801701433, "grad_norm": 0.57421875, "learning_rate": 3.770070138283264e-05, "loss": 0.42917208671569823, "num_input_tokens_seen": 2157471680, "step": 7590, "train_runtime": 73771.8775, "train_tokens_per_second": 29245.178 }, { "epoch": 0.2689034004338721, "grad_norm": 0.54296875, "learning_rate": 3.768998882574915e-05, "loss": 0.4248990058898926, "num_input_tokens_seen": 2160348288, "step": 7600, "train_runtime": 73874.2149, "train_tokens_per_second": 29243.604 }, { "epoch": 0.2692572206976009, "grad_norm": 0.578125, "learning_rate": 3.767928539531557e-05, "loss": 0.43067193031311035, "num_input_tokens_seen": 2163158784, "step": 7610, "train_runtime": 73969.3217, "train_tokens_per_second": 29243.999 }, { "epoch": 0.26961104096132965, "grad_norm": 0.57421875, "learning_rate": 3.7668591078580055e-05, "loss": 0.4271222114562988, "num_input_tokens_seen": 2166053632, "step": 7620, "train_runtime": 74072.7674, "train_tokens_per_second": 29242.24 }, { "epoch": 0.2699648612250584, "grad_norm": 0.5703125, "learning_rate": 3.765790586261647e-05, "loss": 0.42212657928466796, "num_input_tokens_seen": 2168858112, "step": 7630, "train_runtime": 74168.5013, "train_tokens_per_second": 29242.307 }, { "epoch": 0.27031868148878724, "grad_norm": 0.53125, "learning_rate": 3.7647229734524326e-05, "loss": 0.42572507858276365, "num_input_tokens_seen": 2171655104, "step": 7640, "train_runtime": 74261.4714, "train_tokens_per_second": 29243.362 }, { "epoch": 0.270672501752516, "grad_norm": 0.5859375, "learning_rate": 3.7636562681428744e-05, "loss": 0.42652573585510256, "num_input_tokens_seen": 2174459328, "step": 7650, "train_runtime": 74354.356, "train_tokens_per_second": 29244.545 }, { "epoch": 0.27102632201624477, "grad_norm": 0.56640625, "learning_rate": 3.7625904690480346e-05, "loss": 0.4243968963623047, "num_input_tokens_seen": 2177253312, "step": 7660, "train_runtime": 74448.7434, "train_tokens_per_second": 29244.997 }, { "epoch": 0.27138014227997354, "grad_norm": 0.5625, "learning_rate": 3.7615255748855224e-05, "loss": 0.42897806167602537, "num_input_tokens_seen": 2180137280, "step": 7670, "train_runtime": 74547.5464, "train_tokens_per_second": 29244.923 }, { "epoch": 0.27173396254370236, "grad_norm": 0.578125, "learning_rate": 3.7604615843754845e-05, "loss": 0.42595462799072265, "num_input_tokens_seen": 2182987840, "step": 7680, "train_runtime": 74645.6274, "train_tokens_per_second": 29244.685 }, { "epoch": 0.2720877828074311, "grad_norm": 0.578125, "learning_rate": 3.759398496240601e-05, "loss": 0.42676386833190916, "num_input_tokens_seen": 2185845312, "step": 7690, "train_runtime": 74741.6041, "train_tokens_per_second": 29245.363 }, { "epoch": 0.2724416030711599, "grad_norm": 0.55859375, "learning_rate": 3.7583363092060815e-05, "loss": 0.424839448928833, "num_input_tokens_seen": 2188683776, "step": 7700, "train_runtime": 74838.4827, "train_tokens_per_second": 29245.432 }, { "epoch": 0.27279542333488865, "grad_norm": 0.60546875, "learning_rate": 3.757275021999649e-05, "loss": 0.426145076751709, "num_input_tokens_seen": 2191521152, "step": 7710, "train_runtime": 74937.1507, "train_tokens_per_second": 29244.789 }, { "epoch": 0.2731492435986175, "grad_norm": 0.56640625, "learning_rate": 3.7562146333515445e-05, "loss": 0.43163356781005857, "num_input_tokens_seen": 2194422656, "step": 7720, "train_runtime": 75034.2576, "train_tokens_per_second": 29245.61 }, { "epoch": 0.27350306386234624, "grad_norm": 0.55859375, "learning_rate": 3.7551551419945167e-05, "loss": 0.42371454238891604, "num_input_tokens_seen": 2197244288, "step": 7730, "train_runtime": 75130.2214, "train_tokens_per_second": 29245.811 }, { "epoch": 0.273856884126075, "grad_norm": 0.5703125, "learning_rate": 3.7540965466638104e-05, "loss": 0.424973201751709, "num_input_tokens_seen": 2200139968, "step": 7740, "train_runtime": 75229.9568, "train_tokens_per_second": 29245.53 }, { "epoch": 0.27421070438980377, "grad_norm": 0.57421875, "learning_rate": 3.753038846097172e-05, "loss": 0.4214158058166504, "num_input_tokens_seen": 2203025792, "step": 7750, "train_runtime": 75328.5743, "train_tokens_per_second": 29245.553 }, { "epoch": 0.27456452465353254, "grad_norm": 0.5859375, "learning_rate": 3.751982039034827e-05, "loss": 0.42480859756469724, "num_input_tokens_seen": 2205819776, "step": 7760, "train_runtime": 75422.9713, "train_tokens_per_second": 29245.994 }, { "epoch": 0.27491834491726136, "grad_norm": 0.55078125, "learning_rate": 3.75092612421949e-05, "loss": 0.42972517013549805, "num_input_tokens_seen": 2208704192, "step": 7770, "train_runtime": 75522.0637, "train_tokens_per_second": 29245.814 }, { "epoch": 0.2752721651809901, "grad_norm": 0.578125, "learning_rate": 3.7498711003963475e-05, "loss": 0.43226261138916017, "num_input_tokens_seen": 2211600192, "step": 7780, "train_runtime": 75623.5631, "train_tokens_per_second": 29244.856 }, { "epoch": 0.2756259854447189, "grad_norm": 0.55078125, "learning_rate": 3.748816966313058e-05, "loss": 0.4253261566162109, "num_input_tokens_seen": 2214473088, "step": 7790, "train_runtime": 75723.3439, "train_tokens_per_second": 29244.259 }, { "epoch": 0.27597980570844766, "grad_norm": 0.5703125, "learning_rate": 3.7477637207197374e-05, "loss": 0.42342290878295896, "num_input_tokens_seen": 2217345664, "step": 7800, "train_runtime": 75825.6471, "train_tokens_per_second": 29242.687 }, { "epoch": 0.2763336259721765, "grad_norm": 0.5859375, "learning_rate": 3.7467113623689666e-05, "loss": 0.4228833198547363, "num_input_tokens_seen": 2220153792, "step": 7810, "train_runtime": 75920.6525, "train_tokens_per_second": 29243.081 }, { "epoch": 0.27668744623590524, "grad_norm": 0.58203125, "learning_rate": 3.745659890015768e-05, "loss": 0.419264030456543, "num_input_tokens_seen": 2222968896, "step": 7820, "train_runtime": 76017.0949, "train_tokens_per_second": 29243.013 }, { "epoch": 0.277041266499634, "grad_norm": 0.5859375, "learning_rate": 3.744609302417615e-05, "loss": 0.42331132888793943, "num_input_tokens_seen": 2225786688, "step": 7830, "train_runtime": 76114.9431, "train_tokens_per_second": 29242.44 }, { "epoch": 0.2773950867633628, "grad_norm": 0.58984375, "learning_rate": 3.7435595983344175e-05, "loss": 0.42845883369445803, "num_input_tokens_seen": 2228604288, "step": 7840, "train_runtime": 76213.185, "train_tokens_per_second": 29241.716 }, { "epoch": 0.2777489070270916, "grad_norm": 0.5625, "learning_rate": 3.7425107765285155e-05, "loss": 0.4245955467224121, "num_input_tokens_seen": 2231460224, "step": 7850, "train_runtime": 76310.4332, "train_tokens_per_second": 29241.876 }, { "epoch": 0.27810272729082036, "grad_norm": 0.58984375, "learning_rate": 3.741462835764676e-05, "loss": 0.4287534713745117, "num_input_tokens_seen": 2234335488, "step": 7860, "train_runtime": 76408.8776, "train_tokens_per_second": 29241.831 }, { "epoch": 0.2784565475545491, "grad_norm": 0.578125, "learning_rate": 3.740415774810088e-05, "loss": 0.4283725738525391, "num_input_tokens_seen": 2237156352, "step": 7870, "train_runtime": 76503.359, "train_tokens_per_second": 29242.59 }, { "epoch": 0.2788103678182779, "grad_norm": 0.55078125, "learning_rate": 3.739369592434351e-05, "loss": 0.42887067794799805, "num_input_tokens_seen": 2239989440, "step": 7880, "train_runtime": 76598.2932, "train_tokens_per_second": 29243.334 }, { "epoch": 0.2791641880820067, "grad_norm": 0.56640625, "learning_rate": 3.738324287409473e-05, "loss": 0.42405362129211427, "num_input_tokens_seen": 2242795072, "step": 7890, "train_runtime": 76694.3023, "train_tokens_per_second": 29243.308 }, { "epoch": 0.2795180083457355, "grad_norm": 0.5625, "learning_rate": 3.7372798585098644e-05, "loss": 0.4241333961486816, "num_input_tokens_seen": 2245659968, "step": 7900, "train_runtime": 76791.5857, "train_tokens_per_second": 29243.568 }, { "epoch": 0.27987182860946425, "grad_norm": 0.57421875, "learning_rate": 3.736236304512331e-05, "loss": 0.42028160095214845, "num_input_tokens_seen": 2248550016, "step": 7910, "train_runtime": 76890.7189, "train_tokens_per_second": 29243.452 }, { "epoch": 0.280225648873193, "grad_norm": 0.57421875, "learning_rate": 3.735193624196067e-05, "loss": 0.43004746437072755, "num_input_tokens_seen": 2251377408, "step": 7920, "train_runtime": 76989.4668, "train_tokens_per_second": 29242.668 }, { "epoch": 0.28057946913692183, "grad_norm": 0.57421875, "learning_rate": 3.7341518163426514e-05, "loss": 0.42587881088256835, "num_input_tokens_seen": 2254267840, "step": 7930, "train_runtime": 77090.1855, "train_tokens_per_second": 29241.956 }, { "epoch": 0.2809332894006506, "grad_norm": 0.5859375, "learning_rate": 3.73311087973604e-05, "loss": 0.42616939544677734, "num_input_tokens_seen": 2257108288, "step": 7940, "train_runtime": 77187.29, "train_tokens_per_second": 29241.968 }, { "epoch": 0.28128710966437936, "grad_norm": 0.57421875, "learning_rate": 3.732070813162561e-05, "loss": 0.42601823806762695, "num_input_tokens_seen": 2259932288, "step": 7950, "train_runtime": 77283.1284, "train_tokens_per_second": 29242.246 }, { "epoch": 0.28164092992810813, "grad_norm": 0.58203125, "learning_rate": 3.731031615410908e-05, "loss": 0.42812113761901854, "num_input_tokens_seen": 2262767296, "step": 7960, "train_runtime": 77382.4329, "train_tokens_per_second": 29241.356 }, { "epoch": 0.28199475019183695, "grad_norm": 0.5859375, "learning_rate": 3.729993285272132e-05, "loss": 0.4210846424102783, "num_input_tokens_seen": 2265615168, "step": 7970, "train_runtime": 77476.3212, "train_tokens_per_second": 29242.679 }, { "epoch": 0.2823485704555657, "grad_norm": 0.56640625, "learning_rate": 3.7289558215396414e-05, "loss": 0.426118278503418, "num_input_tokens_seen": 2268486528, "step": 7980, "train_runtime": 77576.4042, "train_tokens_per_second": 29241.965 }, { "epoch": 0.2827023907192945, "grad_norm": 0.58203125, "learning_rate": 3.727919223009191e-05, "loss": 0.4243349552154541, "num_input_tokens_seen": 2271343488, "step": 7990, "train_runtime": 77673.6338, "train_tokens_per_second": 29242.143 }, { "epoch": 0.28305621098302325, "grad_norm": 0.5859375, "learning_rate": 3.726883488478877e-05, "loss": 0.4312952995300293, "num_input_tokens_seen": 2274239872, "step": 8000, "train_runtime": 77775.909, "train_tokens_per_second": 29240.929 }, { "epoch": 0.283410031246752, "grad_norm": 0.58984375, "learning_rate": 3.7258486167491323e-05, "loss": 0.42570013999938966, "num_input_tokens_seen": 2277056192, "step": 8010, "train_runtime": 77874.6188, "train_tokens_per_second": 29240.03 }, { "epoch": 0.28376385151048084, "grad_norm": 0.56640625, "learning_rate": 3.724814606622721e-05, "loss": 0.4266170024871826, "num_input_tokens_seen": 2279883712, "step": 8020, "train_runtime": 77970.9895, "train_tokens_per_second": 29240.154 }, { "epoch": 0.2841176717742096, "grad_norm": 0.58984375, "learning_rate": 3.7237814569047294e-05, "loss": 0.42457008361816406, "num_input_tokens_seen": 2282755712, "step": 8030, "train_runtime": 78070.525, "train_tokens_per_second": 29239.661 }, { "epoch": 0.28447149203793837, "grad_norm": 0.5625, "learning_rate": 3.7227491664025656e-05, "loss": 0.42130188941955565, "num_input_tokens_seen": 2285597504, "step": 8040, "train_runtime": 78167.2235, "train_tokens_per_second": 29239.845 }, { "epoch": 0.28482531230166713, "grad_norm": 0.55859375, "learning_rate": 3.721717733925948e-05, "loss": 0.42447624206542967, "num_input_tokens_seen": 2288411904, "step": 8050, "train_runtime": 78262.5135, "train_tokens_per_second": 29240.205 }, { "epoch": 0.28517913256539595, "grad_norm": 0.59765625, "learning_rate": 3.720687158286904e-05, "loss": 0.42598509788513184, "num_input_tokens_seen": 2291227200, "step": 8060, "train_runtime": 78360.3018, "train_tokens_per_second": 29239.642 }, { "epoch": 0.2855329528291247, "grad_norm": 0.56640625, "learning_rate": 3.719657438299762e-05, "loss": 0.4228774070739746, "num_input_tokens_seen": 2294135296, "step": 8070, "train_runtime": 78461.2151, "train_tokens_per_second": 29239.1 }, { "epoch": 0.2858867730928535, "grad_norm": 0.57421875, "learning_rate": 3.7186285727811446e-05, "loss": 0.42594180107116697, "num_input_tokens_seen": 2296980672, "step": 8080, "train_runtime": 78556.6979, "train_tokens_per_second": 29239.781 }, { "epoch": 0.28624059335658225, "grad_norm": 0.57421875, "learning_rate": 3.717600560549967e-05, "loss": 0.42366781234741213, "num_input_tokens_seen": 2299847616, "step": 8090, "train_runtime": 78655.8803, "train_tokens_per_second": 29239.36 }, { "epoch": 0.2865944136203111, "grad_norm": 0.5625, "learning_rate": 3.716573400427426e-05, "loss": 0.42875213623046876, "num_input_tokens_seen": 2302721024, "step": 8100, "train_runtime": 78753.5738, "train_tokens_per_second": 29239.575 }, { "epoch": 0.28694823388403984, "grad_norm": 0.58203125, "learning_rate": 3.7155470912370004e-05, "loss": 0.42367944717407224, "num_input_tokens_seen": 2305532864, "step": 8110, "train_runtime": 78848.8859, "train_tokens_per_second": 29239.891 }, { "epoch": 0.2873020541477686, "grad_norm": 0.55859375, "learning_rate": 3.714521631804439e-05, "loss": 0.42185335159301757, "num_input_tokens_seen": 2308429184, "step": 8120, "train_runtime": 78950.3109, "train_tokens_per_second": 29239.013 }, { "epoch": 0.28765587441149737, "grad_norm": 0.546875, "learning_rate": 3.713497020957759e-05, "loss": 0.42450857162475586, "num_input_tokens_seen": 2311290368, "step": 8130, "train_runtime": 79048.0564, "train_tokens_per_second": 29239.054 }, { "epoch": 0.2880096946752262, "grad_norm": 0.546875, "learning_rate": 3.712473257527238e-05, "loss": 0.42467265129089354, "num_input_tokens_seen": 2314154880, "step": 8140, "train_runtime": 79144.97, "train_tokens_per_second": 29239.444 }, { "epoch": 0.28836351493895496, "grad_norm": 0.5625, "learning_rate": 3.711450340345412e-05, "loss": 0.4224575042724609, "num_input_tokens_seen": 2316930176, "step": 8150, "train_runtime": 79238.0483, "train_tokens_per_second": 29240.122 }, { "epoch": 0.2887173352026837, "grad_norm": 0.5625, "learning_rate": 3.710428268247067e-05, "loss": 0.4255655288696289, "num_input_tokens_seen": 2319758464, "step": 8160, "train_runtime": 79333.6058, "train_tokens_per_second": 29240.552 }, { "epoch": 0.2890711554664125, "grad_norm": 0.55078125, "learning_rate": 3.709407040069233e-05, "loss": 0.42122840881347656, "num_input_tokens_seen": 2322607680, "step": 8170, "train_runtime": 79428.5859, "train_tokens_per_second": 29241.458 }, { "epoch": 0.2894249757301413, "grad_norm": 0.5625, "learning_rate": 3.708386654651179e-05, "loss": 0.4254447460174561, "num_input_tokens_seen": 2325455936, "step": 8180, "train_runtime": 79524.0691, "train_tokens_per_second": 29242.165 }, { "epoch": 0.2897787959938701, "grad_norm": 0.59765625, "learning_rate": 3.707367110834409e-05, "loss": 0.42529659271240233, "num_input_tokens_seen": 2328385344, "step": 8190, "train_runtime": 79624.4541, "train_tokens_per_second": 29242.089 }, { "epoch": 0.29013261625759884, "grad_norm": 0.58203125, "learning_rate": 3.7063484074626555e-05, "loss": 0.42379035949707033, "num_input_tokens_seen": 2331216704, "step": 8200, "train_runtime": 79720.2646, "train_tokens_per_second": 29242.461 }, { "epoch": 0.2904864365213276, "grad_norm": 0.5703125, "learning_rate": 3.7053305433818725e-05, "loss": 0.419068717956543, "num_input_tokens_seen": 2334031296, "step": 8210, "train_runtime": 79815.4855, "train_tokens_per_second": 29242.838 }, { "epoch": 0.29084025678505643, "grad_norm": 0.58984375, "learning_rate": 3.704313517440232e-05, "loss": 0.4278595447540283, "num_input_tokens_seen": 2336879680, "step": 8220, "train_runtime": 79912.3628, "train_tokens_per_second": 29243.031 }, { "epoch": 0.2911940770487852, "grad_norm": 0.5703125, "learning_rate": 3.703297328488118e-05, "loss": 0.4246028423309326, "num_input_tokens_seen": 2339704960, "step": 8230, "train_runtime": 80007.126, "train_tokens_per_second": 29243.707 }, { "epoch": 0.29154789731251396, "grad_norm": 0.57421875, "learning_rate": 3.70228197537812e-05, "loss": 0.4211237907409668, "num_input_tokens_seen": 2342555712, "step": 8240, "train_runtime": 80105.1256, "train_tokens_per_second": 29243.518 }, { "epoch": 0.2919017175762427, "grad_norm": 0.57421875, "learning_rate": 3.7012674569650305e-05, "loss": 0.4255837917327881, "num_input_tokens_seen": 2345399232, "step": 8250, "train_runtime": 80202.132, "train_tokens_per_second": 29243.602 }, { "epoch": 0.2922555378399715, "grad_norm": 0.578125, "learning_rate": 3.700253772105835e-05, "loss": 0.4239809036254883, "num_input_tokens_seen": 2348243328, "step": 8260, "train_runtime": 80300.1518, "train_tokens_per_second": 29243.324 }, { "epoch": 0.2926093581037003, "grad_norm": 0.578125, "learning_rate": 3.699240919659711e-05, "loss": 0.42288665771484374, "num_input_tokens_seen": 2351143808, "step": 8270, "train_runtime": 80400.6049, "train_tokens_per_second": 29242.862 }, { "epoch": 0.2929631783674291, "grad_norm": 0.55078125, "learning_rate": 3.698228898488019e-05, "loss": 0.42441229820251464, "num_input_tokens_seen": 2354002048, "step": 8280, "train_runtime": 80498.8028, "train_tokens_per_second": 29242.696 }, { "epoch": 0.29331699863115784, "grad_norm": 0.54296875, "learning_rate": 3.6972177074543e-05, "loss": 0.4221537113189697, "num_input_tokens_seen": 2356863744, "step": 8290, "train_runtime": 80595.8715, "train_tokens_per_second": 29242.984 }, { "epoch": 0.2936708188948866, "grad_norm": 0.5703125, "learning_rate": 3.69620734542427e-05, "loss": 0.4187718391418457, "num_input_tokens_seen": 2359627648, "step": 8300, "train_runtime": 80690.6118, "train_tokens_per_second": 29242.902 }, { "epoch": 0.29402463915861543, "grad_norm": 0.5859375, "learning_rate": 3.695197811265811e-05, "loss": 0.4208488941192627, "num_input_tokens_seen": 2362501568, "step": 8310, "train_runtime": 80787.3404, "train_tokens_per_second": 29243.463 }, { "epoch": 0.2943784594223442, "grad_norm": 0.5625, "learning_rate": 3.6941891038489694e-05, "loss": 0.415517520904541, "num_input_tokens_seen": 2365346752, "step": 8320, "train_runtime": 80885.1793, "train_tokens_per_second": 29243.265 }, { "epoch": 0.29473227968607296, "grad_norm": 0.5546875, "learning_rate": 3.693181222045952e-05, "loss": 0.4225395679473877, "num_input_tokens_seen": 2368080704, "step": 8330, "train_runtime": 80974.9028, "train_tokens_per_second": 29244.625 }, { "epoch": 0.29508609994980173, "grad_norm": 0.56640625, "learning_rate": 3.692174164731113e-05, "loss": 0.42214412689208985, "num_input_tokens_seen": 2370936576, "step": 8340, "train_runtime": 81073.5741, "train_tokens_per_second": 29244.259 }, { "epoch": 0.29543992021353055, "grad_norm": 0.5625, "learning_rate": 3.6911679307809595e-05, "loss": 0.42295150756835936, "num_input_tokens_seen": 2373767424, "step": 8350, "train_runtime": 81169.8705, "train_tokens_per_second": 29244.44 }, { "epoch": 0.2957937404772593, "grad_norm": 0.5625, "learning_rate": 3.690162519074137e-05, "loss": 0.4286691665649414, "num_input_tokens_seen": 2376621184, "step": 8360, "train_runtime": 81267.2114, "train_tokens_per_second": 29244.527 }, { "epoch": 0.2961475607409881, "grad_norm": 0.5703125, "learning_rate": 3.689157928491431e-05, "loss": 0.4271433353424072, "num_input_tokens_seen": 2379502336, "step": 8370, "train_runtime": 81368.4083, "train_tokens_per_second": 29243.565 }, { "epoch": 0.29650138100471685, "grad_norm": 0.55859375, "learning_rate": 3.6881541579157566e-05, "loss": 0.42048940658569334, "num_input_tokens_seen": 2382356224, "step": 8380, "train_runtime": 81464.17, "train_tokens_per_second": 29244.221 }, { "epoch": 0.29685520126844567, "grad_norm": 0.57421875, "learning_rate": 3.687151206232154e-05, "loss": 0.4218634605407715, "num_input_tokens_seen": 2385200640, "step": 8390, "train_runtime": 81560.8545, "train_tokens_per_second": 29244.429 }, { "epoch": 0.29720902153217443, "grad_norm": 0.58984375, "learning_rate": 3.686149072327788e-05, "loss": 0.4210012435913086, "num_input_tokens_seen": 2388069312, "step": 8400, "train_runtime": 81663.6296, "train_tokens_per_second": 29242.753 }, { "epoch": 0.2975628417959032, "grad_norm": 0.59375, "learning_rate": 3.685147755091937e-05, "loss": 0.42243032455444335, "num_input_tokens_seen": 2390887552, "step": 8410, "train_runtime": 81757.8026, "train_tokens_per_second": 29243.54 }, { "epoch": 0.29791666205963196, "grad_norm": 0.56640625, "learning_rate": 3.684147253415992e-05, "loss": 0.4245555877685547, "num_input_tokens_seen": 2393791232, "step": 8420, "train_runtime": 81858.638, "train_tokens_per_second": 29242.989 }, { "epoch": 0.2982704823233608, "grad_norm": 0.609375, "learning_rate": 3.683147566193448e-05, "loss": 0.42319154739379883, "num_input_tokens_seen": 2396629440, "step": 8430, "train_runtime": 81956.1035, "train_tokens_per_second": 29242.843 }, { "epoch": 0.29862430258708955, "grad_norm": 0.55078125, "learning_rate": 3.6821486923199025e-05, "loss": 0.41884260177612304, "num_input_tokens_seen": 2399512128, "step": 8440, "train_runtime": 82052.7973, "train_tokens_per_second": 29243.514 }, { "epoch": 0.2989781228508183, "grad_norm": 0.55859375, "learning_rate": 3.681150630693046e-05, "loss": 0.42299470901489256, "num_input_tokens_seen": 2402339072, "step": 8450, "train_runtime": 82147.952, "train_tokens_per_second": 29244.053 }, { "epoch": 0.2993319431145471, "grad_norm": 0.57421875, "learning_rate": 3.6801533802126615e-05, "loss": 0.4188076972961426, "num_input_tokens_seen": 2405264896, "step": 8460, "train_runtime": 82247.3543, "train_tokens_per_second": 29244.283 }, { "epoch": 0.2996857633782759, "grad_norm": 0.58984375, "learning_rate": 3.679156939780617e-05, "loss": 0.4195985794067383, "num_input_tokens_seen": 2408088704, "step": 8470, "train_runtime": 82343.2734, "train_tokens_per_second": 29244.51 }, { "epoch": 0.30003958364200467, "grad_norm": 0.5703125, "learning_rate": 3.6781613083008594e-05, "loss": 0.42058448791503905, "num_input_tokens_seen": 2410963584, "step": 8480, "train_runtime": 82443.0464, "train_tokens_per_second": 29243.99 }, { "epoch": 0.30039340390573344, "grad_norm": 0.57421875, "learning_rate": 3.677166484679412e-05, "loss": 0.42074432373046877, "num_input_tokens_seen": 2413775104, "step": 8490, "train_runtime": 82542.0792, "train_tokens_per_second": 29242.965 }, { "epoch": 0.3007472241694622, "grad_norm": 0.56640625, "learning_rate": 3.676172467824368e-05, "loss": 0.4243292808532715, "num_input_tokens_seen": 2416579520, "step": 8500, "train_runtime": 82637.1342, "train_tokens_per_second": 29243.264 }, { "epoch": 0.30110104443319097, "grad_norm": 0.55859375, "learning_rate": 3.675179256645885e-05, "loss": 0.42053852081298826, "num_input_tokens_seen": 2419437504, "step": 8510, "train_runtime": 82734.1879, "train_tokens_per_second": 29243.503 }, { "epoch": 0.3014548646969198, "grad_norm": 0.56640625, "learning_rate": 3.674186850056181e-05, "loss": 0.42450647354125975, "num_input_tokens_seen": 2422266048, "step": 8520, "train_runtime": 82830.6654, "train_tokens_per_second": 29243.59 }, { "epoch": 0.30180868496064855, "grad_norm": 0.59375, "learning_rate": 3.67319524696953e-05, "loss": 0.42336201667785645, "num_input_tokens_seen": 2425138624, "step": 8530, "train_runtime": 82928.0559, "train_tokens_per_second": 29243.886 }, { "epoch": 0.3021625052243773, "grad_norm": 0.609375, "learning_rate": 3.6722044463022536e-05, "loss": 0.422471809387207, "num_input_tokens_seen": 2427948672, "step": 8540, "train_runtime": 83023.8189, "train_tokens_per_second": 29244.001 }, { "epoch": 0.3025163254881061, "grad_norm": 0.55859375, "learning_rate": 3.6712144469727214e-05, "loss": 0.4284646987915039, "num_input_tokens_seen": 2430787840, "step": 8550, "train_runtime": 83120.4144, "train_tokens_per_second": 29244.174 }, { "epoch": 0.3028701457518349, "grad_norm": 0.578125, "learning_rate": 3.67022524790134e-05, "loss": 0.42098326683044435, "num_input_tokens_seen": 2433624896, "step": 8560, "train_runtime": 83218.6414, "train_tokens_per_second": 29243.747 }, { "epoch": 0.3032239660155637, "grad_norm": 0.5546875, "learning_rate": 3.6692368480105546e-05, "loss": 0.4222285270690918, "num_input_tokens_seen": 2436540992, "step": 8570, "train_runtime": 83322.6143, "train_tokens_per_second": 29242.253 }, { "epoch": 0.30357778627929244, "grad_norm": 0.59375, "learning_rate": 3.6682492462248374e-05, "loss": 0.42070865631103516, "num_input_tokens_seen": 2439352320, "step": 8580, "train_runtime": 83418.0476, "train_tokens_per_second": 29242.501 }, { "epoch": 0.3039316065430212, "grad_norm": 0.58203125, "learning_rate": 3.667262441470689e-05, "loss": 0.41478118896484373, "num_input_tokens_seen": 2442149504, "step": 8590, "train_runtime": 83513.4444, "train_tokens_per_second": 29242.591 }, { "epoch": 0.30428542680675, "grad_norm": 0.5703125, "learning_rate": 3.6662764326766255e-05, "loss": 0.4226981163024902, "num_input_tokens_seen": 2445011904, "step": 8600, "train_runtime": 83609.2664, "train_tokens_per_second": 29243.312 }, { "epoch": 0.3046392470704788, "grad_norm": 0.5703125, "learning_rate": 3.665291218773185e-05, "loss": 0.4245340347290039, "num_input_tokens_seen": 2447813440, "step": 8610, "train_runtime": 83705.7213, "train_tokens_per_second": 29243.084 }, { "epoch": 0.30499306733420756, "grad_norm": 0.5859375, "learning_rate": 3.664306798692912e-05, "loss": 0.4257809638977051, "num_input_tokens_seen": 2450714688, "step": 8620, "train_runtime": 83805.2216, "train_tokens_per_second": 29242.983 }, { "epoch": 0.3053468875979363, "grad_norm": 0.5859375, "learning_rate": 3.6633231713703576e-05, "loss": 0.420089054107666, "num_input_tokens_seen": 2453575680, "step": 8630, "train_runtime": 83900.0412, "train_tokens_per_second": 29244.034 }, { "epoch": 0.30570070786166514, "grad_norm": 0.54296875, "learning_rate": 3.6623403357420745e-05, "loss": 0.41765193939208983, "num_input_tokens_seen": 2456404864, "step": 8640, "train_runtime": 83996.1649, "train_tokens_per_second": 29244.25 }, { "epoch": 0.3060545281253939, "grad_norm": 0.5859375, "learning_rate": 3.661358290746611e-05, "loss": 0.4180574893951416, "num_input_tokens_seen": 2459235200, "step": 8650, "train_runtime": 84090.3856, "train_tokens_per_second": 29245.141 }, { "epoch": 0.3064083483891227, "grad_norm": 0.55859375, "learning_rate": 3.6603770353245056e-05, "loss": 0.4231413841247559, "num_input_tokens_seen": 2462055168, "step": 8660, "train_runtime": 84186.2322, "train_tokens_per_second": 29245.342 }, { "epoch": 0.30676216865285144, "grad_norm": 0.61328125, "learning_rate": 3.659396568418286e-05, "loss": 0.4267998695373535, "num_input_tokens_seen": 2464862528, "step": 8670, "train_runtime": 84281.5514, "train_tokens_per_second": 29245.576 }, { "epoch": 0.30711598891658026, "grad_norm": 0.546875, "learning_rate": 3.658416888972459e-05, "loss": 0.42171216011047363, "num_input_tokens_seen": 2467719744, "step": 8680, "train_runtime": 84382.1167, "train_tokens_per_second": 29244.582 }, { "epoch": 0.30746980918030903, "grad_norm": 0.55078125, "learning_rate": 3.6574379959335106e-05, "loss": 0.42200021743774413, "num_input_tokens_seen": 2470527360, "step": 8690, "train_runtime": 84479.4688, "train_tokens_per_second": 29244.116 }, { "epoch": 0.3078236294440378, "grad_norm": 0.578125, "learning_rate": 3.6564598882498976e-05, "loss": 0.4245904922485352, "num_input_tokens_seen": 2473384512, "step": 8700, "train_runtime": 84576.925, "train_tokens_per_second": 29244.2 }, { "epoch": 0.30817744970776656, "grad_norm": 0.578125, "learning_rate": 3.655482564872043e-05, "loss": 0.4238411903381348, "num_input_tokens_seen": 2476265920, "step": 8710, "train_runtime": 84677.5276, "train_tokens_per_second": 29243.484 }, { "epoch": 0.3085312699714954, "grad_norm": 0.5859375, "learning_rate": 3.654506024752336e-05, "loss": 0.4213128566741943, "num_input_tokens_seen": 2479082048, "step": 8720, "train_runtime": 84774.4262, "train_tokens_per_second": 29243.277 }, { "epoch": 0.30888509023522415, "grad_norm": 0.5703125, "learning_rate": 3.653530266845121e-05, "loss": 0.4259797096252441, "num_input_tokens_seen": 2481906176, "step": 8730, "train_runtime": 84873.2286, "train_tokens_per_second": 29242.509 }, { "epoch": 0.3092389104989529, "grad_norm": 0.58203125, "learning_rate": 3.652555290106696e-05, "loss": 0.41959848403930666, "num_input_tokens_seen": 2484805632, "step": 8740, "train_runtime": 84974.4492, "train_tokens_per_second": 29241.797 }, { "epoch": 0.3095927307626817, "grad_norm": 0.6015625, "learning_rate": 3.6515810934953084e-05, "loss": 0.425579833984375, "num_input_tokens_seen": 2487667264, "step": 8750, "train_runtime": 85073.1587, "train_tokens_per_second": 29241.506 }, { "epoch": 0.30994655102641044, "grad_norm": 0.58984375, "learning_rate": 3.650607675971151e-05, "loss": 0.4237998962402344, "num_input_tokens_seen": 2490510976, "step": 8760, "train_runtime": 85169.1173, "train_tokens_per_second": 29241.949 }, { "epoch": 0.31030037129013927, "grad_norm": 0.5859375, "learning_rate": 3.649635036496351e-05, "loss": 0.42565183639526366, "num_input_tokens_seen": 2493334080, "step": 8770, "train_runtime": 85265.7504, "train_tokens_per_second": 29241.918 }, { "epoch": 0.31065419155386803, "grad_norm": 0.55859375, "learning_rate": 3.6486631740349746e-05, "loss": 0.420766544342041, "num_input_tokens_seen": 2496189760, "step": 8780, "train_runtime": 85364.0648, "train_tokens_per_second": 29241.693 }, { "epoch": 0.3110080118175968, "grad_norm": 0.5703125, "learning_rate": 3.647692087553018e-05, "loss": 0.4212955474853516, "num_input_tokens_seen": 2499008640, "step": 8790, "train_runtime": 85460.6011, "train_tokens_per_second": 29241.646 }, { "epoch": 0.31136183208132556, "grad_norm": 0.55859375, "learning_rate": 3.6467217760184005e-05, "loss": 0.41483302116394044, "num_input_tokens_seen": 2501886848, "step": 8800, "train_runtime": 85559.127, "train_tokens_per_second": 29241.613 }, { "epoch": 0.3117156523450544, "grad_norm": 0.5546875, "learning_rate": 3.6457522384009625e-05, "loss": 0.42199859619140623, "num_input_tokens_seen": 2504794944, "step": 8810, "train_runtime": 85659.5596, "train_tokens_per_second": 29241.277 }, { "epoch": 0.31206947260878315, "grad_norm": 0.59765625, "learning_rate": 3.644783473672462e-05, "loss": 0.4206065654754639, "num_input_tokens_seen": 2507562112, "step": 8820, "train_runtime": 85750.3248, "train_tokens_per_second": 29242.596 }, { "epoch": 0.3124232928725119, "grad_norm": 0.5625, "learning_rate": 3.643815480806568e-05, "loss": 0.42336406707763674, "num_input_tokens_seen": 2510362944, "step": 8830, "train_runtime": 85844.9471, "train_tokens_per_second": 29242.99 }, { "epoch": 0.3127771131362407, "grad_norm": 0.578125, "learning_rate": 3.6428482587788555e-05, "loss": 0.42230544090270994, "num_input_tokens_seen": 2513173952, "step": 8840, "train_runtime": 85941.2457, "train_tokens_per_second": 29242.931 }, { "epoch": 0.3131309333999695, "grad_norm": 0.58203125, "learning_rate": 3.641881806566803e-05, "loss": 0.42572808265686035, "num_input_tokens_seen": 2515977600, "step": 8850, "train_runtime": 86036.4721, "train_tokens_per_second": 29243.152 }, { "epoch": 0.31348475366369827, "grad_norm": 0.5703125, "learning_rate": 3.640916123149788e-05, "loss": 0.4210675239562988, "num_input_tokens_seen": 2518817344, "step": 8860, "train_runtime": 86130.2049, "train_tokens_per_second": 29244.298 }, { "epoch": 0.31383857392742703, "grad_norm": 0.5703125, "learning_rate": 3.639951207509079e-05, "loss": 0.42089319229125977, "num_input_tokens_seen": 2521707904, "step": 8870, "train_runtime": 86228.309, "train_tokens_per_second": 29244.548 }, { "epoch": 0.3141923941911558, "grad_norm": 0.57421875, "learning_rate": 3.6389870586278333e-05, "loss": 0.4201314926147461, "num_input_tokens_seen": 2524563456, "step": 8880, "train_runtime": 86329.0894, "train_tokens_per_second": 29243.485 }, { "epoch": 0.3145462144548846, "grad_norm": 0.56640625, "learning_rate": 3.6380236754910965e-05, "loss": 0.4212482452392578, "num_input_tokens_seen": 2527402176, "step": 8890, "train_runtime": 86426.2919, "train_tokens_per_second": 29243.441 }, { "epoch": 0.3149000347186134, "grad_norm": 0.55859375, "learning_rate": 3.6370610570857897e-05, "loss": 0.4239944934844971, "num_input_tokens_seen": 2530241984, "step": 8900, "train_runtime": 86522.0646, "train_tokens_per_second": 29243.893 }, { "epoch": 0.31525385498234215, "grad_norm": 0.59765625, "learning_rate": 3.6360992024007114e-05, "loss": 0.4248338222503662, "num_input_tokens_seen": 2533102720, "step": 8910, "train_runtime": 86618.7894, "train_tokens_per_second": 29244.264 }, { "epoch": 0.3156076752460709, "grad_norm": 0.56640625, "learning_rate": 3.6351381104265304e-05, "loss": 0.4176307678222656, "num_input_tokens_seen": 2535987776, "step": 8920, "train_runtime": 86721.3802, "train_tokens_per_second": 29242.936 }, { "epoch": 0.31596149550979974, "grad_norm": 0.5859375, "learning_rate": 3.634177780155783e-05, "loss": 0.42096424102783203, "num_input_tokens_seen": 2538791680, "step": 8930, "train_runtime": 86816.1753, "train_tokens_per_second": 29243.303 }, { "epoch": 0.3163153157735285, "grad_norm": 0.57421875, "learning_rate": 3.633218210582867e-05, "loss": 0.42520437240600584, "num_input_tokens_seen": 2541619776, "step": 8940, "train_runtime": 86910.3608, "train_tokens_per_second": 29244.152 }, { "epoch": 0.31666913603725727, "grad_norm": 0.5703125, "learning_rate": 3.6322594007040376e-05, "loss": 0.4216555118560791, "num_input_tokens_seen": 2544407552, "step": 8950, "train_runtime": 87002.4994, "train_tokens_per_second": 29245.224 }, { "epoch": 0.31702295630098604, "grad_norm": 0.5546875, "learning_rate": 3.631301349517403e-05, "loss": 0.41985092163085935, "num_input_tokens_seen": 2547242816, "step": 8960, "train_runtime": 87099.3623, "train_tokens_per_second": 29245.252 }, { "epoch": 0.31737677656471486, "grad_norm": 0.57421875, "learning_rate": 3.6303440560229216e-05, "loss": 0.42310395240783694, "num_input_tokens_seen": 2550115904, "step": 8970, "train_runtime": 87199.3646, "train_tokens_per_second": 29244.662 }, { "epoch": 0.3177305968284436, "grad_norm": 0.578125, "learning_rate": 3.629387519222395e-05, "loss": 0.41895322799682616, "num_input_tokens_seen": 2552975104, "step": 8980, "train_runtime": 87298.0183, "train_tokens_per_second": 29244.365 }, { "epoch": 0.3180844170921724, "grad_norm": 0.55859375, "learning_rate": 3.628431738119464e-05, "loss": 0.41408486366271974, "num_input_tokens_seen": 2555840832, "step": 8990, "train_runtime": 87397.4846, "train_tokens_per_second": 29243.872 }, { "epoch": 0.31843823735590115, "grad_norm": 0.5546875, "learning_rate": 3.62747671171961e-05, "loss": 0.42155799865722654, "num_input_tokens_seen": 2558715456, "step": 9000, "train_runtime": 87496.6752, "train_tokens_per_second": 29243.574 }, { "epoch": 0.3187920576196299, "grad_norm": 0.5703125, "learning_rate": 3.626522439030138e-05, "loss": 0.4224367618560791, "num_input_tokens_seen": 2561515072, "step": 9010, "train_runtime": 87591.7546, "train_tokens_per_second": 29243.792 }, { "epoch": 0.31914587788335874, "grad_norm": 0.578125, "learning_rate": 3.6255689190601863e-05, "loss": 0.42210540771484373, "num_input_tokens_seen": 2564361216, "step": 9020, "train_runtime": 87690.6392, "train_tokens_per_second": 29243.272 }, { "epoch": 0.3194996981470875, "grad_norm": 0.5546875, "learning_rate": 3.624616150820714e-05, "loss": 0.4253790855407715, "num_input_tokens_seen": 2567278592, "step": 9030, "train_runtime": 87790.0637, "train_tokens_per_second": 29243.385 }, { "epoch": 0.3198535184108163, "grad_norm": 0.5625, "learning_rate": 3.623664133324499e-05, "loss": 0.4170662879943848, "num_input_tokens_seen": 2570106688, "step": 9040, "train_runtime": 87887.6359, "train_tokens_per_second": 29243.097 }, { "epoch": 0.32020733867454504, "grad_norm": 0.57421875, "learning_rate": 3.622712865586131e-05, "loss": 0.4181173801422119, "num_input_tokens_seen": 2572995136, "step": 9050, "train_runtime": 87990.5347, "train_tokens_per_second": 29241.726 }, { "epoch": 0.32056115893827386, "grad_norm": 0.5625, "learning_rate": 3.621762346622014e-05, "loss": 0.4182613372802734, "num_input_tokens_seen": 2575895040, "step": 9060, "train_runtime": 88090.3509, "train_tokens_per_second": 29241.512 }, { "epoch": 0.3209149792020026, "grad_norm": 0.57421875, "learning_rate": 3.620812575450352e-05, "loss": 0.4163680553436279, "num_input_tokens_seen": 2578794624, "step": 9070, "train_runtime": 88187.2731, "train_tokens_per_second": 29242.254 }, { "epoch": 0.3212687994657314, "grad_norm": 0.57421875, "learning_rate": 3.6198635510911556e-05, "loss": 0.4187276840209961, "num_input_tokens_seen": 2581654976, "step": 9080, "train_runtime": 88282.4337, "train_tokens_per_second": 29243.133 }, { "epoch": 0.32162261972946016, "grad_norm": 0.55859375, "learning_rate": 3.618915272566228e-05, "loss": 0.414417028427124, "num_input_tokens_seen": 2584450176, "step": 9090, "train_runtime": 88374.169, "train_tokens_per_second": 29244.407 }, { "epoch": 0.321976439993189, "grad_norm": 0.55859375, "learning_rate": 3.6179677388991694e-05, "loss": 0.42461519241333007, "num_input_tokens_seen": 2587310016, "step": 9100, "train_runtime": 88471.3462, "train_tokens_per_second": 29244.61 }, { "epoch": 0.32233026025691774, "grad_norm": 0.57421875, "learning_rate": 3.617020949115366e-05, "loss": 0.4204258918762207, "num_input_tokens_seen": 2590123008, "step": 9110, "train_runtime": 88569.3179, "train_tokens_per_second": 29244.021 }, { "epoch": 0.3226840805206465, "grad_norm": 0.55078125, "learning_rate": 3.6160749022419886e-05, "loss": 0.41892280578613283, "num_input_tokens_seen": 2592997760, "step": 9120, "train_runtime": 88667.9342, "train_tokens_per_second": 29243.918 }, { "epoch": 0.3230379007843753, "grad_norm": 0.56640625, "learning_rate": 3.6151295973079887e-05, "loss": 0.41943182945251467, "num_input_tokens_seen": 2595862784, "step": 9130, "train_runtime": 88766.9948, "train_tokens_per_second": 29243.558 }, { "epoch": 0.3233917210481041, "grad_norm": 0.56640625, "learning_rate": 3.6141850333440934e-05, "loss": 0.42088727951049804, "num_input_tokens_seen": 2598674112, "step": 9140, "train_runtime": 88860.6608, "train_tokens_per_second": 29244.371 }, { "epoch": 0.32374554131183286, "grad_norm": 0.5625, "learning_rate": 3.613241209382803e-05, "loss": 0.42317800521850585, "num_input_tokens_seen": 2601500736, "step": 9150, "train_runtime": 88957.5696, "train_tokens_per_second": 29244.287 }, { "epoch": 0.32409936157556163, "grad_norm": 0.56640625, "learning_rate": 3.6122981244583834e-05, "loss": 0.42010927200317383, "num_input_tokens_seen": 2604376704, "step": 9160, "train_runtime": 89057.4102, "train_tokens_per_second": 29243.796 }, { "epoch": 0.3244531818392904, "grad_norm": 0.5546875, "learning_rate": 3.6113557776068644e-05, "loss": 0.42517943382263185, "num_input_tokens_seen": 2607175040, "step": 9170, "train_runtime": 89152.4463, "train_tokens_per_second": 29244.01 }, { "epoch": 0.3248070021030192, "grad_norm": 0.56640625, "learning_rate": 3.6104141678660386e-05, "loss": 0.4233957290649414, "num_input_tokens_seen": 2610071488, "step": 9180, "train_runtime": 89253.2289, "train_tokens_per_second": 29243.441 }, { "epoch": 0.325160822366748, "grad_norm": 0.58203125, "learning_rate": 3.6094732942754487e-05, "loss": 0.41938085556030275, "num_input_tokens_seen": 2612900480, "step": 9190, "train_runtime": 89350.3305, "train_tokens_per_second": 29243.322 }, { "epoch": 0.32551464263047675, "grad_norm": 0.578125, "learning_rate": 3.60853315587639e-05, "loss": 0.41816225051879885, "num_input_tokens_seen": 2615733952, "step": 9200, "train_runtime": 89446.7603, "train_tokens_per_second": 29243.473 }, { "epoch": 0.3258684628942055, "grad_norm": 0.55078125, "learning_rate": 3.607593751711909e-05, "loss": 0.41954669952392576, "num_input_tokens_seen": 2618562688, "step": 9210, "train_runtime": 89543.6609, "train_tokens_per_second": 29243.418 }, { "epoch": 0.32622228315793433, "grad_norm": 0.5703125, "learning_rate": 3.60665508082679e-05, "loss": 0.4246511459350586, "num_input_tokens_seen": 2621396928, "step": 9220, "train_runtime": 89641.0703, "train_tokens_per_second": 29243.258 }, { "epoch": 0.3265761034216631, "grad_norm": 0.57421875, "learning_rate": 3.6057171422675585e-05, "loss": 0.42350406646728517, "num_input_tokens_seen": 2624207232, "step": 9230, "train_runtime": 89733.9363, "train_tokens_per_second": 29244.312 }, { "epoch": 0.32692992368539187, "grad_norm": 0.578125, "learning_rate": 3.604779935082474e-05, "loss": 0.41873812675476074, "num_input_tokens_seen": 2627099328, "step": 9240, "train_runtime": 89833.7127, "train_tokens_per_second": 29244.025 }, { "epoch": 0.32728374394912063, "grad_norm": 0.58203125, "learning_rate": 3.603843458321526e-05, "loss": 0.4257979393005371, "num_input_tokens_seen": 2629939328, "step": 9250, "train_runtime": 89929.7697, "train_tokens_per_second": 29244.369 }, { "epoch": 0.32763756421284945, "grad_norm": 0.6328125, "learning_rate": 3.6029077110364355e-05, "loss": 0.42142295837402344, "num_input_tokens_seen": 2632770752, "step": 9260, "train_runtime": 90022.0638, "train_tokens_per_second": 29245.839 }, { "epoch": 0.3279913844765782, "grad_norm": 0.5859375, "learning_rate": 3.60197269228064e-05, "loss": 0.42386627197265625, "num_input_tokens_seen": 2635556544, "step": 9270, "train_runtime": 90116.2517, "train_tokens_per_second": 29246.185 }, { "epoch": 0.328345204740307, "grad_norm": 0.59765625, "learning_rate": 3.601038401109299e-05, "loss": 0.4232340812683105, "num_input_tokens_seen": 2638380544, "step": 9280, "train_runtime": 90210.204, "train_tokens_per_second": 29247.03 }, { "epoch": 0.32869902500403575, "grad_norm": 0.546875, "learning_rate": 3.6001048365792846e-05, "loss": 0.4203153133392334, "num_input_tokens_seen": 2641256448, "step": 9290, "train_runtime": 90309.1023, "train_tokens_per_second": 29246.846 }, { "epoch": 0.3290528452677645, "grad_norm": 0.57421875, "learning_rate": 3.599171997749182e-05, "loss": 0.4207463264465332, "num_input_tokens_seen": 2644147904, "step": 9300, "train_runtime": 90408.1626, "train_tokens_per_second": 29246.783 }, { "epoch": 0.32940666553149334, "grad_norm": 0.57421875, "learning_rate": 3.598239883679281e-05, "loss": 0.4229604721069336, "num_input_tokens_seen": 2646989184, "step": 9310, "train_runtime": 90505.9811, "train_tokens_per_second": 29246.566 }, { "epoch": 0.3297604857952221, "grad_norm": 0.578125, "learning_rate": 3.597308493431576e-05, "loss": 0.4221336364746094, "num_input_tokens_seen": 2649807872, "step": 9320, "train_runtime": 90601.9413, "train_tokens_per_second": 29246.701 }, { "epoch": 0.33011430605895087, "grad_norm": 0.58203125, "learning_rate": 3.596377826069758e-05, "loss": 0.4223775863647461, "num_input_tokens_seen": 2652620224, "step": 9330, "train_runtime": 90698.3669, "train_tokens_per_second": 29246.615 }, { "epoch": 0.33046812632267963, "grad_norm": 0.58984375, "learning_rate": 3.5954478806592155e-05, "loss": 0.42059326171875, "num_input_tokens_seen": 2655494400, "step": 9340, "train_runtime": 90797.1484, "train_tokens_per_second": 29246.452 }, { "epoch": 0.33082194658640846, "grad_norm": 0.56640625, "learning_rate": 3.594518656267024e-05, "loss": 0.4238277912139893, "num_input_tokens_seen": 2658351552, "step": 9350, "train_runtime": 90895.6542, "train_tokens_per_second": 29246.19 }, { "epoch": 0.3311757668501372, "grad_norm": 0.56640625, "learning_rate": 3.5935901519619496e-05, "loss": 0.42474069595336916, "num_input_tokens_seen": 2661200768, "step": 9360, "train_runtime": 90989.6174, "train_tokens_per_second": 29247.301 }, { "epoch": 0.331529587113866, "grad_norm": 0.58203125, "learning_rate": 3.5926623668144385e-05, "loss": 0.41840200424194335, "num_input_tokens_seen": 2664068544, "step": 9370, "train_runtime": 91088.3122, "train_tokens_per_second": 29247.095 }, { "epoch": 0.33188340737759475, "grad_norm": 0.57421875, "learning_rate": 3.5917352998966194e-05, "loss": 0.42109098434448244, "num_input_tokens_seen": 2666974464, "step": 9380, "train_runtime": 91190.4753, "train_tokens_per_second": 29246.195 }, { "epoch": 0.3322372276413236, "grad_norm": 0.55078125, "learning_rate": 3.5908089502822914e-05, "loss": 0.420253324508667, "num_input_tokens_seen": 2669785344, "step": 9390, "train_runtime": 91287.8546, "train_tokens_per_second": 29245.789 }, { "epoch": 0.33259104790505234, "grad_norm": 0.56640625, "learning_rate": 3.589883317046929e-05, "loss": 0.42046523094177246, "num_input_tokens_seen": 2672659712, "step": 9400, "train_runtime": 91386.8261, "train_tokens_per_second": 29245.569 }, { "epoch": 0.3329448681687811, "grad_norm": 0.57421875, "learning_rate": 3.5889583992676715e-05, "loss": 0.41854071617126465, "num_input_tokens_seen": 2675633856, "step": 9410, "train_runtime": 91495.4341, "train_tokens_per_second": 29243.359 }, { "epoch": 0.33329868843250987, "grad_norm": 0.5703125, "learning_rate": 3.5880341960233244e-05, "loss": 0.4192509651184082, "num_input_tokens_seen": 2678472576, "step": 9420, "train_runtime": 91591.6497, "train_tokens_per_second": 29243.633 }, { "epoch": 0.3336525086962387, "grad_norm": 0.58203125, "learning_rate": 3.58711070639435e-05, "loss": 0.4218461513519287, "num_input_tokens_seen": 2681330496, "step": 9430, "train_runtime": 91690.4315, "train_tokens_per_second": 29243.297 }, { "epoch": 0.33400632895996746, "grad_norm": 0.56640625, "learning_rate": 3.586187929462869e-05, "loss": 0.41759138107299804, "num_input_tokens_seen": 2684185664, "step": 9440, "train_runtime": 91787.4542, "train_tokens_per_second": 29243.492 }, { "epoch": 0.3343601492236962, "grad_norm": 0.57421875, "learning_rate": 3.585265864312651e-05, "loss": 0.42147026062011717, "num_input_tokens_seen": 2687038656, "step": 9450, "train_runtime": 91886.4182, "train_tokens_per_second": 29243.045 }, { "epoch": 0.334713969487425, "grad_norm": 0.5859375, "learning_rate": 3.584344510029118e-05, "loss": 0.4218087673187256, "num_input_tokens_seen": 2689887424, "step": 9460, "train_runtime": 91989.1945, "train_tokens_per_second": 29241.341 }, { "epoch": 0.3350677897511538, "grad_norm": 0.57421875, "learning_rate": 3.583423865699333e-05, "loss": 0.41876797676086425, "num_input_tokens_seen": 2692676672, "step": 9470, "train_runtime": 92083.7605, "train_tokens_per_second": 29241.602 }, { "epoch": 0.3354216100148826, "grad_norm": 0.58203125, "learning_rate": 3.5825039304119994e-05, "loss": 0.41921253204345704, "num_input_tokens_seen": 2695477440, "step": 9480, "train_runtime": 92177.7653, "train_tokens_per_second": 29242.165 }, { "epoch": 0.33577543027861134, "grad_norm": 0.59765625, "learning_rate": 3.581584703257461e-05, "loss": 0.4214989185333252, "num_input_tokens_seen": 2698277824, "step": 9490, "train_runtime": 92272.7061, "train_tokens_per_second": 29242.426 }, { "epoch": 0.3361292505423401, "grad_norm": 0.58203125, "learning_rate": 3.580666183327689e-05, "loss": 0.4211748123168945, "num_input_tokens_seen": 2701066624, "step": 9500, "train_runtime": 92368.0489, "train_tokens_per_second": 29242.435 }, { "epoch": 0.33648307080606893, "grad_norm": 0.57421875, "learning_rate": 3.5797483697162906e-05, "loss": 0.4170060157775879, "num_input_tokens_seen": 2703923072, "step": 9510, "train_runtime": 92466.5316, "train_tokens_per_second": 29242.181 }, { "epoch": 0.3368368910697977, "grad_norm": 0.6015625, "learning_rate": 3.5788312615184936e-05, "loss": 0.42041454315185545, "num_input_tokens_seen": 2706712320, "step": 9520, "train_runtime": 92559.468, "train_tokens_per_second": 29242.955 }, { "epoch": 0.33719071133352646, "grad_norm": 0.57421875, "learning_rate": 3.5779148578311476e-05, "loss": 0.4195714950561523, "num_input_tokens_seen": 2709565248, "step": 9530, "train_runtime": 92657.9203, "train_tokens_per_second": 29242.673 }, { "epoch": 0.3375445315972552, "grad_norm": 0.578125, "learning_rate": 3.5769991577527236e-05, "loss": 0.4205338001251221, "num_input_tokens_seen": 2712431488, "step": 9540, "train_runtime": 92757.7818, "train_tokens_per_second": 29242.091 }, { "epoch": 0.337898351860984, "grad_norm": 0.57421875, "learning_rate": 3.5760841603833034e-05, "loss": 0.4251713752746582, "num_input_tokens_seen": 2715215744, "step": 9550, "train_runtime": 92851.7507, "train_tokens_per_second": 29242.483 }, { "epoch": 0.3382521721247128, "grad_norm": 0.5859375, "learning_rate": 3.5751698648245814e-05, "loss": 0.42135062217712405, "num_input_tokens_seen": 2718075904, "step": 9560, "train_runtime": 92949.1261, "train_tokens_per_second": 29242.619 }, { "epoch": 0.3386059923884416, "grad_norm": 0.55859375, "learning_rate": 3.574256270179857e-05, "loss": 0.4234762191772461, "num_input_tokens_seen": 2720922240, "step": 9570, "train_runtime": 93044.3913, "train_tokens_per_second": 29243.27 }, { "epoch": 0.33895981265217034, "grad_norm": 0.5625, "learning_rate": 3.573343375554037e-05, "loss": 0.4181545257568359, "num_input_tokens_seen": 2723745536, "step": 9580, "train_runtime": 93141.7502, "train_tokens_per_second": 29243.014 }, { "epoch": 0.3393136329158991, "grad_norm": 0.5625, "learning_rate": 3.572431180053621e-05, "loss": 0.4175090789794922, "num_input_tokens_seen": 2726585024, "step": 9590, "train_runtime": 93237.7146, "train_tokens_per_second": 29243.37 }, { "epoch": 0.33966745317962793, "grad_norm": 0.58203125, "learning_rate": 3.571519682786711e-05, "loss": 0.42274131774902346, "num_input_tokens_seen": 2729407232, "step": 9600, "train_runtime": 93332.8181, "train_tokens_per_second": 29243.81 }, { "epoch": 0.3400212734433567, "grad_norm": 0.58203125, "learning_rate": 3.570608882862996e-05, "loss": 0.4224428653717041, "num_input_tokens_seen": 2732339136, "step": 9610, "train_runtime": 93435.4146, "train_tokens_per_second": 29243.078 }, { "epoch": 0.34037509370708546, "grad_norm": 0.56640625, "learning_rate": 3.569698779393757e-05, "loss": 0.41882858276367185, "num_input_tokens_seen": 2735181952, "step": 9620, "train_runtime": 93532.1919, "train_tokens_per_second": 29243.215 }, { "epoch": 0.34072891397081423, "grad_norm": 0.59375, "learning_rate": 3.568789371491859e-05, "loss": 0.4197474479675293, "num_input_tokens_seen": 2738008576, "step": 9630, "train_runtime": 93626.9676, "train_tokens_per_second": 29243.803 }, { "epoch": 0.34108273423454305, "grad_norm": 0.5703125, "learning_rate": 3.567880658271748e-05, "loss": 0.4182888031005859, "num_input_tokens_seen": 2740840448, "step": 9640, "train_runtime": 93723.6938, "train_tokens_per_second": 29243.837 }, { "epoch": 0.3414365544982718, "grad_norm": 0.5859375, "learning_rate": 3.566972638849445e-05, "loss": 0.41817731857299806, "num_input_tokens_seen": 2743672448, "step": 9650, "train_runtime": 93821.0805, "train_tokens_per_second": 29243.667 }, { "epoch": 0.3417903747620006, "grad_norm": 0.58203125, "learning_rate": 3.566065312342551e-05, "loss": 0.423507022857666, "num_input_tokens_seen": 2746535680, "step": 9660, "train_runtime": 93919.0339, "train_tokens_per_second": 29243.653 }, { "epoch": 0.34214419502572935, "grad_norm": 0.56640625, "learning_rate": 3.565158677870231e-05, "loss": 0.41780638694763184, "num_input_tokens_seen": 2749366528, "step": 9670, "train_runtime": 94015.7725, "train_tokens_per_second": 29243.673 }, { "epoch": 0.34249801528945817, "grad_norm": 0.5546875, "learning_rate": 3.564252734553221e-05, "loss": 0.41854009628295896, "num_input_tokens_seen": 2752208512, "step": 9680, "train_runtime": 94113.4013, "train_tokens_per_second": 29243.535 }, { "epoch": 0.34285183555318693, "grad_norm": 0.5859375, "learning_rate": 3.563347481513818e-05, "loss": 0.4183374881744385, "num_input_tokens_seen": 2755070656, "step": 9690, "train_runtime": 94209.6232, "train_tokens_per_second": 29244.047 }, { "epoch": 0.3432056558169157, "grad_norm": 0.57421875, "learning_rate": 3.56244291787588e-05, "loss": 0.4214652061462402, "num_input_tokens_seen": 2757961664, "step": 9700, "train_runtime": 94309.9007, "train_tokens_per_second": 29243.607 }, { "epoch": 0.34355947608064447, "grad_norm": 0.5703125, "learning_rate": 3.5615390427648216e-05, "loss": 0.4174685478210449, "num_input_tokens_seen": 2760823872, "step": 9710, "train_runtime": 94408.1485, "train_tokens_per_second": 29243.491 }, { "epoch": 0.3439132963443733, "grad_norm": 0.5703125, "learning_rate": 3.5606358553076075e-05, "loss": 0.4220565319061279, "num_input_tokens_seen": 2763666752, "step": 9720, "train_runtime": 94504.633, "train_tokens_per_second": 29243.717 }, { "epoch": 0.34426711660810205, "grad_norm": 0.58203125, "learning_rate": 3.5597333546327526e-05, "loss": 0.41991047859191893, "num_input_tokens_seen": 2766528320, "step": 9730, "train_runtime": 94602.6884, "train_tokens_per_second": 29243.654 }, { "epoch": 0.3446209368718308, "grad_norm": 0.5703125, "learning_rate": 3.5588315398703186e-05, "loss": 0.42338099479675295, "num_input_tokens_seen": 2769368640, "step": 9740, "train_runtime": 94701.3428, "train_tokens_per_second": 29243.182 }, { "epoch": 0.3449747571355596, "grad_norm": 0.58984375, "learning_rate": 3.557930410151907e-05, "loss": 0.4177273750305176, "num_input_tokens_seen": 2772225664, "step": 9750, "train_runtime": 94799.6095, "train_tokens_per_second": 29243.007 }, { "epoch": 0.3453285773992884, "grad_norm": 0.59375, "learning_rate": 3.5570299646106606e-05, "loss": 0.42409625053405764, "num_input_tokens_seen": 2775066944, "step": 9760, "train_runtime": 94895.8299, "train_tokens_per_second": 29243.297 }, { "epoch": 0.34568239766301717, "grad_norm": 0.578125, "learning_rate": 3.556130202381253e-05, "loss": 0.4192185401916504, "num_input_tokens_seen": 2777946752, "step": 9770, "train_runtime": 94994.7965, "train_tokens_per_second": 29243.147 }, { "epoch": 0.34603621792674594, "grad_norm": 0.546875, "learning_rate": 3.555231122599892e-05, "loss": 0.42435202598571775, "num_input_tokens_seen": 2780791680, "step": 9780, "train_runtime": 95092.8774, "train_tokens_per_second": 29242.902 }, { "epoch": 0.3463900381904747, "grad_norm": 0.53515625, "learning_rate": 3.554332724404313e-05, "loss": 0.4149494171142578, "num_input_tokens_seen": 2783628736, "step": 9790, "train_runtime": 95187.0591, "train_tokens_per_second": 29243.773 }, { "epoch": 0.34674385845420347, "grad_norm": 0.56640625, "learning_rate": 3.553435006933777e-05, "loss": 0.418074893951416, "num_input_tokens_seen": 2786429696, "step": 9800, "train_runtime": 95279.7489, "train_tokens_per_second": 29244.721 }, { "epoch": 0.3470976787179323, "grad_norm": 0.57421875, "learning_rate": 3.5525379693290626e-05, "loss": 0.41746997833251953, "num_input_tokens_seen": 2789282624, "step": 9810, "train_runtime": 95379.2067, "train_tokens_per_second": 29244.137 }, { "epoch": 0.34745149898166106, "grad_norm": 0.5625, "learning_rate": 3.551641610732469e-05, "loss": 0.41968517303466796, "num_input_tokens_seen": 2792052992, "step": 9820, "train_runtime": 95470.6265, "train_tokens_per_second": 29245.152 }, { "epoch": 0.3478053192453898, "grad_norm": 0.56640625, "learning_rate": 3.55074593028781e-05, "loss": 0.4130645751953125, "num_input_tokens_seen": 2794906496, "step": 9830, "train_runtime": 95569.0365, "train_tokens_per_second": 29244.896 }, { "epoch": 0.3481591395091186, "grad_norm": 0.55859375, "learning_rate": 3.5498509271404065e-05, "loss": 0.417772102355957, "num_input_tokens_seen": 2797787136, "step": 9840, "train_runtime": 95667.64, "train_tokens_per_second": 29244.864 }, { "epoch": 0.3485129597728474, "grad_norm": 0.58203125, "learning_rate": 3.5489566004370893e-05, "loss": 0.42011446952819825, "num_input_tokens_seen": 2800681280, "step": 9850, "train_runtime": 95768.89, "train_tokens_per_second": 29244.166 }, { "epoch": 0.3488667800365762, "grad_norm": 0.578125, "learning_rate": 3.548062949326194e-05, "loss": 0.41987051963806155, "num_input_tokens_seen": 2803524800, "step": 9860, "train_runtime": 95864.6644, "train_tokens_per_second": 29244.611 }, { "epoch": 0.34922060030030494, "grad_norm": 0.58203125, "learning_rate": 3.547169972957554e-05, "loss": 0.41800456047058104, "num_input_tokens_seen": 2806324992, "step": 9870, "train_runtime": 95960.5651, "train_tokens_per_second": 29244.565 }, { "epoch": 0.3495744205640337, "grad_norm": 0.57421875, "learning_rate": 3.5462776704825e-05, "loss": 0.4154806137084961, "num_input_tokens_seen": 2809198208, "step": 9880, "train_runtime": 96057.7906, "train_tokens_per_second": 29244.876 }, { "epoch": 0.3499282408277625, "grad_norm": 0.56640625, "learning_rate": 3.5453860410538594e-05, "loss": 0.41528568267822263, "num_input_tokens_seen": 2812001408, "step": 9890, "train_runtime": 96152.2745, "train_tokens_per_second": 29245.293 }, { "epoch": 0.3502820610914913, "grad_norm": 0.56640625, "learning_rate": 3.5444950838259455e-05, "loss": 0.4201637268066406, "num_input_tokens_seen": 2814878784, "step": 9900, "train_runtime": 96251.1093, "train_tokens_per_second": 29245.157 }, { "epoch": 0.35063588135522006, "grad_norm": 0.5703125, "learning_rate": 3.543604797954563e-05, "loss": 0.41726150512695315, "num_input_tokens_seen": 2817671616, "step": 9910, "train_runtime": 96344.644, "train_tokens_per_second": 29245.753 }, { "epoch": 0.3509897016189488, "grad_norm": 0.56640625, "learning_rate": 3.542715182596996e-05, "loss": 0.4191440105438232, "num_input_tokens_seen": 2820527872, "step": 9920, "train_runtime": 96442.3233, "train_tokens_per_second": 29245.748 }, { "epoch": 0.35134352188267765, "grad_norm": 0.58984375, "learning_rate": 3.5418262369120115e-05, "loss": 0.41490631103515624, "num_input_tokens_seen": 2823372928, "step": 9930, "train_runtime": 96538.8388, "train_tokens_per_second": 29245.98 }, { "epoch": 0.3516973421464064, "grad_norm": 0.55859375, "learning_rate": 3.5409379600598526e-05, "loss": 0.4175734519958496, "num_input_tokens_seen": 2826218944, "step": 9940, "train_runtime": 96635.6595, "train_tokens_per_second": 29246.129 }, { "epoch": 0.3520511624101352, "grad_norm": 0.55078125, "learning_rate": 3.540050351202235e-05, "loss": 0.41604318618774416, "num_input_tokens_seen": 2829055168, "step": 9950, "train_runtime": 96731.1434, "train_tokens_per_second": 29246.58 }, { "epoch": 0.35240498267386394, "grad_norm": 0.57421875, "learning_rate": 3.539163409502347e-05, "loss": 0.4203804492950439, "num_input_tokens_seen": 2831964224, "step": 9960, "train_runtime": 96833.5116, "train_tokens_per_second": 29245.704 }, { "epoch": 0.35275880293759276, "grad_norm": 0.6015625, "learning_rate": 3.5382771341248416e-05, "loss": 0.41888136863708497, "num_input_tokens_seen": 2834815616, "step": 9970, "train_runtime": 96930.2101, "train_tokens_per_second": 29245.945 }, { "epoch": 0.35311262320132153, "grad_norm": 0.578125, "learning_rate": 3.537391524235835e-05, "loss": 0.4221469879150391, "num_input_tokens_seen": 2837725056, "step": 9980, "train_runtime": 97031.2377, "train_tokens_per_second": 29245.479 }, { "epoch": 0.3534664434650503, "grad_norm": 0.58203125, "learning_rate": 3.5365065790029055e-05, "loss": 0.4223515510559082, "num_input_tokens_seen": 2840564416, "step": 9990, "train_runtime": 97129.6719, "train_tokens_per_second": 29245.074 }, { "epoch": 0.35382026372877906, "grad_norm": 0.58984375, "learning_rate": 3.535622297595087e-05, "loss": 0.4175906181335449, "num_input_tokens_seen": 2843412288, "step": 10000, "train_runtime": 97228.6885, "train_tokens_per_second": 29244.581 }, { "epoch": 0.35382026372877906, "eval_loss": 0.34943389892578125, "eval_runtime": 8.4325, "eval_samples_per_second": 472.932, "eval_steps_per_second": 3.795, "num_input_tokens_seen": 2843412288, "step": 10000 }, { "epoch": 0.3541740839925079, "grad_norm": 0.5546875, "learning_rate": 3.534738679182869e-05, "loss": 0.4168993949890137, "num_input_tokens_seen": 2846261632, "step": 10010, "train_runtime": 97352.9319, "train_tokens_per_second": 29236.527 }, { "epoch": 0.35452790425623665, "grad_norm": 0.59765625, "learning_rate": 3.533855722938188e-05, "loss": 0.4144249439239502, "num_input_tokens_seen": 2849122752, "step": 10020, "train_runtime": 97450.0178, "train_tokens_per_second": 29236.76 }, { "epoch": 0.3548817245199654, "grad_norm": 0.5859375, "learning_rate": 3.5329734280344325e-05, "loss": 0.4126617908477783, "num_input_tokens_seen": 2851970688, "step": 10030, "train_runtime": 97547.3978, "train_tokens_per_second": 29236.769 }, { "epoch": 0.3552355447836942, "grad_norm": 0.6328125, "learning_rate": 3.5320917936464294e-05, "loss": 0.42274885177612304, "num_input_tokens_seen": 2854831552, "step": 10040, "train_runtime": 97647.0374, "train_tokens_per_second": 29236.233 }, { "epoch": 0.35558936504742295, "grad_norm": 0.5859375, "learning_rate": 3.5312108189504505e-05, "loss": 0.41487321853637693, "num_input_tokens_seen": 2857663424, "step": 10050, "train_runtime": 97743.3384, "train_tokens_per_second": 29236.401 }, { "epoch": 0.35594318531115177, "grad_norm": 0.5703125, "learning_rate": 3.530330503124204e-05, "loss": 0.41655702590942384, "num_input_tokens_seen": 2860553920, "step": 10060, "train_runtime": 97842.8148, "train_tokens_per_second": 29236.219 }, { "epoch": 0.35629700557488053, "grad_norm": 0.5859375, "learning_rate": 3.5294508453468325e-05, "loss": 0.41977386474609374, "num_input_tokens_seen": 2863390528, "step": 10070, "train_runtime": 97942.9849, "train_tokens_per_second": 29235.279 }, { "epoch": 0.3566508258386093, "grad_norm": 0.61328125, "learning_rate": 3.528571844798908e-05, "loss": 0.42212538719177245, "num_input_tokens_seen": 2866238080, "step": 10080, "train_runtime": 98041.0984, "train_tokens_per_second": 29235.067 }, { "epoch": 0.35700464610233806, "grad_norm": 0.5859375, "learning_rate": 3.527693500662431e-05, "loss": 0.4170633316040039, "num_input_tokens_seen": 2869066944, "step": 10090, "train_runtime": 98136.6826, "train_tokens_per_second": 29235.418 }, { "epoch": 0.3573584663660669, "grad_norm": 0.57421875, "learning_rate": 3.5268158121208294e-05, "loss": 0.42119512557983396, "num_input_tokens_seen": 2871896960, "step": 10100, "train_runtime": 98234.3211, "train_tokens_per_second": 29235.169 }, { "epoch": 0.35771228662979565, "grad_norm": 0.6015625, "learning_rate": 3.525938778358949e-05, "loss": 0.4142122268676758, "num_input_tokens_seen": 2874711360, "step": 10110, "train_runtime": 98328.5837, "train_tokens_per_second": 29235.765 }, { "epoch": 0.3580661068935244, "grad_norm": 0.6015625, "learning_rate": 3.5250623985630537e-05, "loss": 0.41509456634521485, "num_input_tokens_seen": 2877534400, "step": 10120, "train_runtime": 98423.8529, "train_tokens_per_second": 29236.149 }, { "epoch": 0.3584199271572532, "grad_norm": 0.578125, "learning_rate": 3.524186671920826e-05, "loss": 0.4168394565582275, "num_input_tokens_seen": 2880340160, "step": 10130, "train_runtime": 98521.0819, "train_tokens_per_second": 29235.775 }, { "epoch": 0.358773747420982, "grad_norm": 0.60546875, "learning_rate": 3.523311597621358e-05, "loss": 0.42333388328552246, "num_input_tokens_seen": 2883145024, "step": 10140, "train_runtime": 98614.8419, "train_tokens_per_second": 29236.421 }, { "epoch": 0.35912756768471077, "grad_norm": 0.57421875, "learning_rate": 3.5224371748551505e-05, "loss": 0.42003836631774905, "num_input_tokens_seen": 2885943040, "step": 10150, "train_runtime": 98708.8884, "train_tokens_per_second": 29236.912 }, { "epoch": 0.35948138794843953, "grad_norm": 0.578125, "learning_rate": 3.521563402814109e-05, "loss": 0.4177816390991211, "num_input_tokens_seen": 2888792000, "step": 10160, "train_runtime": 98805.0323, "train_tokens_per_second": 29237.296 }, { "epoch": 0.3598352082121683, "grad_norm": 0.59375, "learning_rate": 3.5206902806915436e-05, "loss": 0.4176754951477051, "num_input_tokens_seen": 2891615552, "step": 10170, "train_runtime": 98901.3469, "train_tokens_per_second": 29237.373 }, { "epoch": 0.3601890284758971, "grad_norm": 0.578125, "learning_rate": 3.5198178076821644e-05, "loss": 0.41602187156677245, "num_input_tokens_seen": 2894430336, "step": 10180, "train_runtime": 98999.4892, "train_tokens_per_second": 29236.821 }, { "epoch": 0.3605428487396259, "grad_norm": 0.58984375, "learning_rate": 3.5189459829820743e-05, "loss": 0.41626224517822263, "num_input_tokens_seen": 2897246656, "step": 10190, "train_runtime": 99093.5887, "train_tokens_per_second": 29237.478 }, { "epoch": 0.36089666900335465, "grad_norm": 0.578125, "learning_rate": 3.5180748057887714e-05, "loss": 0.417949914932251, "num_input_tokens_seen": 2900098944, "step": 10200, "train_runtime": 99191.2792, "train_tokens_per_second": 29237.439 }, { "epoch": 0.3612504892670834, "grad_norm": 0.58203125, "learning_rate": 3.517204275301144e-05, "loss": 0.42154669761657715, "num_input_tokens_seen": 2902918144, "step": 10210, "train_runtime": 99288.2768, "train_tokens_per_second": 29237.27 }, { "epoch": 0.36160430953081224, "grad_norm": 0.6015625, "learning_rate": 3.5163343907194676e-05, "loss": 0.41838760375976564, "num_input_tokens_seen": 2905770432, "step": 10220, "train_runtime": 99384.0492, "train_tokens_per_second": 29237.795 }, { "epoch": 0.361958129794541, "grad_norm": 0.62890625, "learning_rate": 3.5154651512453995e-05, "loss": 0.41790127754211426, "num_input_tokens_seen": 2908571584, "step": 10230, "train_runtime": 99480.4201, "train_tokens_per_second": 29237.629 }, { "epoch": 0.36231195005826977, "grad_norm": 0.56640625, "learning_rate": 3.514596556081981e-05, "loss": 0.4139357566833496, "num_input_tokens_seen": 2911423872, "step": 10240, "train_runtime": 99577.2086, "train_tokens_per_second": 29237.854 }, { "epoch": 0.36266577032199854, "grad_norm": 0.5703125, "learning_rate": 3.513728604433628e-05, "loss": 0.42030978202819824, "num_input_tokens_seen": 2914283584, "step": 10250, "train_runtime": 99676.1521, "train_tokens_per_second": 29237.521 }, { "epoch": 0.36301959058572736, "grad_norm": 0.5625, "learning_rate": 3.5128612955061334e-05, "loss": 0.419094181060791, "num_input_tokens_seen": 2917172096, "step": 10260, "train_runtime": 99776.8519, "train_tokens_per_second": 29236.963 }, { "epoch": 0.3633734108494561, "grad_norm": 0.56640625, "learning_rate": 3.5119946285066595e-05, "loss": 0.4205984115600586, "num_input_tokens_seen": 2919902656, "step": 10270, "train_runtime": 99867.1355, "train_tokens_per_second": 29237.873 }, { "epoch": 0.3637272311131849, "grad_norm": 0.6015625, "learning_rate": 3.511128602643739e-05, "loss": 0.41779866218566897, "num_input_tokens_seen": 2922714496, "step": 10280, "train_runtime": 99963.6776, "train_tokens_per_second": 29237.765 }, { "epoch": 0.36408105137691366, "grad_norm": 0.5859375, "learning_rate": 3.510263217127269e-05, "loss": 0.4193439483642578, "num_input_tokens_seen": 2925525888, "step": 10290, "train_runtime": 100060.0874, "train_tokens_per_second": 29237.691 }, { "epoch": 0.3644348716406424, "grad_norm": 0.55859375, "learning_rate": 3.50939847116851e-05, "loss": 0.4167616367340088, "num_input_tokens_seen": 2928375872, "step": 10300, "train_runtime": 100156.8983, "train_tokens_per_second": 29237.885 }, { "epoch": 0.36478869190437124, "grad_norm": 0.58203125, "learning_rate": 3.508534363980081e-05, "loss": 0.4129524230957031, "num_input_tokens_seen": 2931220864, "step": 10310, "train_runtime": 100254.7491, "train_tokens_per_second": 29237.726 }, { "epoch": 0.3651425121681, "grad_norm": 0.57421875, "learning_rate": 3.507670894775958e-05, "loss": 0.4148233413696289, "num_input_tokens_seen": 2934116352, "step": 10320, "train_runtime": 100354.399, "train_tokens_per_second": 29237.546 }, { "epoch": 0.3654963324318288, "grad_norm": 0.59375, "learning_rate": 3.506808062771471e-05, "loss": 0.41765766143798827, "num_input_tokens_seen": 2936979328, "step": 10330, "train_runtime": 100454.047, "train_tokens_per_second": 29237.043 }, { "epoch": 0.36585015269555754, "grad_norm": 0.5625, "learning_rate": 3.505945867183298e-05, "loss": 0.41604223251342776, "num_input_tokens_seen": 2939864704, "step": 10340, "train_runtime": 100551.7199, "train_tokens_per_second": 29237.339 }, { "epoch": 0.36620397295928636, "grad_norm": 0.55859375, "learning_rate": 3.505084307229468e-05, "loss": 0.41513447761535643, "num_input_tokens_seen": 2942764864, "step": 10350, "train_runtime": 100650.5847, "train_tokens_per_second": 29237.434 }, { "epoch": 0.3665577932230151, "grad_norm": 0.58984375, "learning_rate": 3.5042233821293525e-05, "loss": 0.4170383453369141, "num_input_tokens_seen": 2945659584, "step": 10360, "train_runtime": 100750.4682, "train_tokens_per_second": 29237.18 }, { "epoch": 0.3669116134867439, "grad_norm": 0.5703125, "learning_rate": 3.503363091103664e-05, "loss": 0.41117086410522463, "num_input_tokens_seen": 2948521152, "step": 10370, "train_runtime": 100848.4551, "train_tokens_per_second": 29237.147 }, { "epoch": 0.36726543375047266, "grad_norm": 0.5546875, "learning_rate": 3.5025034333744545e-05, "loss": 0.414675235748291, "num_input_tokens_seen": 2951408384, "step": 10380, "train_runtime": 100949.5538, "train_tokens_per_second": 29236.468 }, { "epoch": 0.3676192540142015, "grad_norm": 0.5625, "learning_rate": 3.501644408165112e-05, "loss": 0.4157355308532715, "num_input_tokens_seen": 2954215808, "step": 10390, "train_runtime": 101045.5959, "train_tokens_per_second": 29236.463 }, { "epoch": 0.36797307427793025, "grad_norm": 0.5546875, "learning_rate": 3.500786014700357e-05, "loss": 0.41501941680908205, "num_input_tokens_seen": 2957086144, "step": 10400, "train_runtime": 101143.5927, "train_tokens_per_second": 29236.515 }, { "epoch": 0.368326894541659, "grad_norm": 0.5546875, "learning_rate": 3.499928252206237e-05, "loss": 0.41730828285217286, "num_input_tokens_seen": 2959937472, "step": 10410, "train_runtime": 101240.8443, "train_tokens_per_second": 29236.594 }, { "epoch": 0.3686807148053878, "grad_norm": 0.56640625, "learning_rate": 3.499071119910131e-05, "loss": 0.42185797691345217, "num_input_tokens_seen": 2962776128, "step": 10420, "train_runtime": 101338.0601, "train_tokens_per_second": 29236.559 }, { "epoch": 0.3690345350691166, "grad_norm": 0.57421875, "learning_rate": 3.498214617040739e-05, "loss": 0.41416540145874026, "num_input_tokens_seen": 2965612416, "step": 10430, "train_runtime": 101433.8272, "train_tokens_per_second": 29236.917 }, { "epoch": 0.36938835533284536, "grad_norm": 0.5703125, "learning_rate": 3.49735874282808e-05, "loss": 0.4203587532043457, "num_input_tokens_seen": 2968451008, "step": 10440, "train_runtime": 101530.9591, "train_tokens_per_second": 29236.905 }, { "epoch": 0.36974217559657413, "grad_norm": 0.56640625, "learning_rate": 3.4965034965034965e-05, "loss": 0.4138647079467773, "num_input_tokens_seen": 2971281600, "step": 10450, "train_runtime": 101624.8098, "train_tokens_per_second": 29237.758 }, { "epoch": 0.3700959958603029, "grad_norm": 0.59375, "learning_rate": 3.495648877299642e-05, "loss": 0.4175432205200195, "num_input_tokens_seen": 2974099712, "step": 10460, "train_runtime": 101720.1437, "train_tokens_per_second": 29238.06 }, { "epoch": 0.3704498161240317, "grad_norm": 0.6171875, "learning_rate": 3.494794884450483e-05, "loss": 0.41556100845336913, "num_input_tokens_seen": 2976928896, "step": 10470, "train_runtime": 101816.4647, "train_tokens_per_second": 29238.188 }, { "epoch": 0.3708036363877605, "grad_norm": 0.55859375, "learning_rate": 3.4939415171912954e-05, "loss": 0.4166508674621582, "num_input_tokens_seen": 2979790336, "step": 10480, "train_runtime": 101914.7493, "train_tokens_per_second": 29238.068 }, { "epoch": 0.37115745665148925, "grad_norm": 0.55859375, "learning_rate": 3.4930887747586616e-05, "loss": 0.41992530822753904, "num_input_tokens_seen": 2982652160, "step": 10490, "train_runtime": 102012.4065, "train_tokens_per_second": 29238.132 }, { "epoch": 0.371511276915218, "grad_norm": 0.56640625, "learning_rate": 3.492236656390469e-05, "loss": 0.420231294631958, "num_input_tokens_seen": 2985514176, "step": 10500, "train_runtime": 102112.612, "train_tokens_per_second": 29237.468 }, { "epoch": 0.37186509717894684, "grad_norm": 0.55859375, "learning_rate": 3.4913851613259034e-05, "loss": 0.41298365592956543, "num_input_tokens_seen": 2988309056, "step": 10510, "train_runtime": 102206.1399, "train_tokens_per_second": 29238.058 }, { "epoch": 0.3722189174426756, "grad_norm": 0.5703125, "learning_rate": 3.490534288805452e-05, "loss": 0.417043399810791, "num_input_tokens_seen": 2991174400, "step": 10520, "train_runtime": 102301.7758, "train_tokens_per_second": 29238.734 }, { "epoch": 0.37257273770640437, "grad_norm": 0.55859375, "learning_rate": 3.489684038070891e-05, "loss": 0.41370220184326173, "num_input_tokens_seen": 2993989824, "step": 10530, "train_runtime": 102398.3344, "train_tokens_per_second": 29238.657 }, { "epoch": 0.37292655797013313, "grad_norm": 0.6015625, "learning_rate": 3.488834408365296e-05, "loss": 0.423077392578125, "num_input_tokens_seen": 2996803968, "step": 10540, "train_runtime": 102493.5396, "train_tokens_per_second": 29238.955 }, { "epoch": 0.37328037823386195, "grad_norm": 0.61328125, "learning_rate": 3.487985398933027e-05, "loss": 0.416903018951416, "num_input_tokens_seen": 2999637952, "step": 10550, "train_runtime": 102589.4619, "train_tokens_per_second": 29239.241 }, { "epoch": 0.3736341984975907, "grad_norm": 0.58203125, "learning_rate": 3.4871370090197324e-05, "loss": 0.4210418701171875, "num_input_tokens_seen": 3002435456, "step": 10560, "train_runtime": 102683.9946, "train_tokens_per_second": 29239.566 }, { "epoch": 0.3739880187613195, "grad_norm": 0.5859375, "learning_rate": 3.486289237872343e-05, "loss": 0.4146622657775879, "num_input_tokens_seen": 3005268288, "step": 10570, "train_runtime": 102783.2083, "train_tokens_per_second": 29238.903 }, { "epoch": 0.37434183902504825, "grad_norm": 0.55859375, "learning_rate": 3.485442084739075e-05, "loss": 0.41399445533752444, "num_input_tokens_seen": 3008101568, "step": 10580, "train_runtime": 102881.8175, "train_tokens_per_second": 29238.418 }, { "epoch": 0.374695659288777, "grad_norm": 0.59765625, "learning_rate": 3.484595548869416e-05, "loss": 0.41747174263000486, "num_input_tokens_seen": 3010975040, "step": 10590, "train_runtime": 102979.1068, "train_tokens_per_second": 29238.698 }, { "epoch": 0.37504947955250584, "grad_norm": 0.55859375, "learning_rate": 3.4837496295141335e-05, "loss": 0.4180622100830078, "num_input_tokens_seen": 3013859904, "step": 10600, "train_runtime": 103082.2913, "train_tokens_per_second": 29237.417 }, { "epoch": 0.3754032998162346, "grad_norm": 0.57421875, "learning_rate": 3.482904325925266e-05, "loss": 0.41494026184082033, "num_input_tokens_seen": 3016678976, "step": 10610, "train_runtime": 103180.3196, "train_tokens_per_second": 29236.961 }, { "epoch": 0.37575712007996337, "grad_norm": 0.5625, "learning_rate": 3.482059637356124e-05, "loss": 0.41609535217285154, "num_input_tokens_seen": 3019452544, "step": 10620, "train_runtime": 103271.6438, "train_tokens_per_second": 29237.963 }, { "epoch": 0.37611094034369214, "grad_norm": 0.56640625, "learning_rate": 3.481215563061281e-05, "loss": 0.4127861976623535, "num_input_tokens_seen": 3022247808, "step": 10630, "train_runtime": 103368.0662, "train_tokens_per_second": 29237.732 }, { "epoch": 0.37646476060742096, "grad_norm": 0.57421875, "learning_rate": 3.4803721022965785e-05, "loss": 0.41522841453552245, "num_input_tokens_seen": 3025134272, "step": 10640, "train_runtime": 103466.6921, "train_tokens_per_second": 29237.76 }, { "epoch": 0.3768185808711497, "grad_norm": 0.578125, "learning_rate": 3.479529254319117e-05, "loss": 0.4138516426086426, "num_input_tokens_seen": 3027994880, "step": 10650, "train_runtime": 103564.5942, "train_tokens_per_second": 29237.742 }, { "epoch": 0.3771724011348785, "grad_norm": 0.55859375, "learning_rate": 3.478687018387257e-05, "loss": 0.42015748023986815, "num_input_tokens_seen": 3030848064, "step": 10660, "train_runtime": 103660.6563, "train_tokens_per_second": 29238.172 }, { "epoch": 0.37752622139860725, "grad_norm": 0.57421875, "learning_rate": 3.477845393760616e-05, "loss": 0.416491174697876, "num_input_tokens_seen": 3033682752, "step": 10670, "train_runtime": 103758.9775, "train_tokens_per_second": 29237.786 }, { "epoch": 0.3778800416623361, "grad_norm": 0.55078125, "learning_rate": 3.4770043797000614e-05, "loss": 0.4144142150878906, "num_input_tokens_seen": 3036544128, "step": 10680, "train_runtime": 103855.4374, "train_tokens_per_second": 29238.182 }, { "epoch": 0.37823386192606484, "grad_norm": 0.5625, "learning_rate": 3.4761639754677146e-05, "loss": 0.4219967365264893, "num_input_tokens_seen": 3039454016, "step": 10690, "train_runtime": 103958.9261, "train_tokens_per_second": 29237.066 }, { "epoch": 0.3785876821897936, "grad_norm": 0.5859375, "learning_rate": 3.4753241803269435e-05, "loss": 0.41213126182556153, "num_input_tokens_seen": 3042330880, "step": 10700, "train_runtime": 104057.9724, "train_tokens_per_second": 29236.884 }, { "epoch": 0.37894150245352237, "grad_norm": 0.6015625, "learning_rate": 3.474484993542361e-05, "loss": 0.4179734230041504, "num_input_tokens_seen": 3045096960, "step": 10710, "train_runtime": 104151.0302, "train_tokens_per_second": 29237.32 }, { "epoch": 0.3792953227172512, "grad_norm": 0.5390625, "learning_rate": 3.473646414379822e-05, "loss": 0.4129387855529785, "num_input_tokens_seen": 3047948800, "step": 10720, "train_runtime": 104249.9852, "train_tokens_per_second": 29236.923 }, { "epoch": 0.37964914298097996, "grad_norm": 0.55078125, "learning_rate": 3.472808442106422e-05, "loss": 0.4151453971862793, "num_input_tokens_seen": 3050755584, "step": 10730, "train_runtime": 104345.1266, "train_tokens_per_second": 29237.164 }, { "epoch": 0.3800029632447087, "grad_norm": 0.56640625, "learning_rate": 3.4719710759904936e-05, "loss": 0.41498217582702634, "num_input_tokens_seen": 3053615808, "step": 10740, "train_runtime": 104443.9086, "train_tokens_per_second": 29236.897 }, { "epoch": 0.3803567835084375, "grad_norm": 0.58203125, "learning_rate": 3.471134315301603e-05, "loss": 0.41576237678527833, "num_input_tokens_seen": 3056458816, "step": 10750, "train_runtime": 104541.9073, "train_tokens_per_second": 29236.685 }, { "epoch": 0.3807106037721663, "grad_norm": 0.5625, "learning_rate": 3.470298159310549e-05, "loss": 0.41095819473266604, "num_input_tokens_seen": 3059267264, "step": 10760, "train_runtime": 104639.1504, "train_tokens_per_second": 29236.354 }, { "epoch": 0.3810644240358951, "grad_norm": 0.5859375, "learning_rate": 3.4694626072893585e-05, "loss": 0.41770339012145996, "num_input_tokens_seen": 3062082304, "step": 10770, "train_runtime": 104735.0106, "train_tokens_per_second": 29236.473 }, { "epoch": 0.38141824429962384, "grad_norm": 0.55859375, "learning_rate": 3.468627658511285e-05, "loss": 0.41169066429138185, "num_input_tokens_seen": 3064864640, "step": 10780, "train_runtime": 104827.1761, "train_tokens_per_second": 29237.31 }, { "epoch": 0.3817720645633526, "grad_norm": 0.57421875, "learning_rate": 3.467793312250806e-05, "loss": 0.4173437118530273, "num_input_tokens_seen": 3067711424, "step": 10790, "train_runtime": 104923.53, "train_tokens_per_second": 29237.593 }, { "epoch": 0.38212588482708143, "grad_norm": 0.5625, "learning_rate": 3.466959567783619e-05, "loss": 0.4156506061553955, "num_input_tokens_seen": 3070594560, "step": 10800, "train_runtime": 105022.0814, "train_tokens_per_second": 29237.609 }, { "epoch": 0.3824797050908102, "grad_norm": 0.55859375, "learning_rate": 3.466126424386642e-05, "loss": 0.4139736175537109, "num_input_tokens_seen": 3073427264, "step": 10810, "train_runtime": 105118.701, "train_tokens_per_second": 29237.683 }, { "epoch": 0.38283352535453896, "grad_norm": 0.5546875, "learning_rate": 3.4652938813380056e-05, "loss": 0.414139461517334, "num_input_tokens_seen": 3076311168, "step": 10820, "train_runtime": 105216.2033, "train_tokens_per_second": 29237.998 }, { "epoch": 0.3831873456182677, "grad_norm": 0.57421875, "learning_rate": 3.464461937917057e-05, "loss": 0.4099103927612305, "num_input_tokens_seen": 3079126784, "step": 10830, "train_runtime": 105311.4041, "train_tokens_per_second": 29238.303 }, { "epoch": 0.3835411658819965, "grad_norm": 0.59375, "learning_rate": 3.4636305934043525e-05, "loss": 0.41831240653991697, "num_input_tokens_seen": 3082002240, "step": 10840, "train_runtime": 105412.7465, "train_tokens_per_second": 29237.472 }, { "epoch": 0.3838949861457253, "grad_norm": 0.5703125, "learning_rate": 3.4627998470816544e-05, "loss": 0.41381354331970216, "num_input_tokens_seen": 3084901440, "step": 10850, "train_runtime": 105509.4002, "train_tokens_per_second": 29238.167 }, { "epoch": 0.3842488064094541, "grad_norm": 0.5703125, "learning_rate": 3.4619696982319334e-05, "loss": 0.4139442443847656, "num_input_tokens_seen": 3087681536, "step": 10860, "train_runtime": 105603.5923, "train_tokens_per_second": 29238.414 }, { "epoch": 0.38460262667318285, "grad_norm": 0.59765625, "learning_rate": 3.461140146139361e-05, "loss": 0.41739892959594727, "num_input_tokens_seen": 3090515008, "step": 10870, "train_runtime": 105700.9769, "train_tokens_per_second": 29238.282 }, { "epoch": 0.3849564469369116, "grad_norm": 0.56640625, "learning_rate": 3.460311190089309e-05, "loss": 0.4170172691345215, "num_input_tokens_seen": 3093318016, "step": 10880, "train_runtime": 105797.094, "train_tokens_per_second": 29238.213 }, { "epoch": 0.38531026720064043, "grad_norm": 0.5625, "learning_rate": 3.459482829368348e-05, "loss": 0.41702852249145506, "num_input_tokens_seen": 3096163776, "step": 10890, "train_runtime": 105894.4538, "train_tokens_per_second": 29238.205 }, { "epoch": 0.3856640874643692, "grad_norm": 0.6171875, "learning_rate": 3.4586550632642425e-05, "loss": 0.41747055053710935, "num_input_tokens_seen": 3099002176, "step": 10900, "train_runtime": 105991.5087, "train_tokens_per_second": 29238.212 }, { "epoch": 0.38601790772809796, "grad_norm": 0.57421875, "learning_rate": 3.457827891065949e-05, "loss": 0.4186979293823242, "num_input_tokens_seen": 3101874688, "step": 10910, "train_runtime": 106089.9909, "train_tokens_per_second": 29238.146 }, { "epoch": 0.38637172799182673, "grad_norm": 0.57421875, "learning_rate": 3.457001312063614e-05, "loss": 0.41554436683654783, "num_input_tokens_seen": 3104693824, "step": 10920, "train_runtime": 106184.9611, "train_tokens_per_second": 29238.546 }, { "epoch": 0.38672554825555555, "grad_norm": 0.56640625, "learning_rate": 3.45617532554857e-05, "loss": 0.41666746139526367, "num_input_tokens_seen": 3107511360, "step": 10930, "train_runtime": 106282.591, "train_tokens_per_second": 29238.197 }, { "epoch": 0.3870793685192843, "grad_norm": 0.5703125, "learning_rate": 3.455349930813339e-05, "loss": 0.41462955474853513, "num_input_tokens_seen": 3110319744, "step": 10940, "train_runtime": 106376.9498, "train_tokens_per_second": 29238.663 }, { "epoch": 0.3874331887830131, "grad_norm": 0.56640625, "learning_rate": 3.45452512715162e-05, "loss": 0.4163802146911621, "num_input_tokens_seen": 3113139328, "step": 10950, "train_runtime": 106473.9351, "train_tokens_per_second": 29238.511 }, { "epoch": 0.38778700904674185, "grad_norm": 0.55859375, "learning_rate": 3.4537009138582935e-05, "loss": 0.4166153907775879, "num_input_tokens_seen": 3116035456, "step": 10960, "train_runtime": 106574.7197, "train_tokens_per_second": 29238.036 }, { "epoch": 0.38814082931047067, "grad_norm": 0.5625, "learning_rate": 3.4528772902294174e-05, "loss": 0.4174182891845703, "num_input_tokens_seen": 3118861248, "step": 10970, "train_runtime": 106668.4811, "train_tokens_per_second": 29238.827 }, { "epoch": 0.38849464957419944, "grad_norm": 0.578125, "learning_rate": 3.452054255562222e-05, "loss": 0.41211872100830077, "num_input_tokens_seen": 3121694144, "step": 10980, "train_runtime": 106765.0908, "train_tokens_per_second": 29238.903 }, { "epoch": 0.3888484698379282, "grad_norm": 0.56640625, "learning_rate": 3.451231809155115e-05, "loss": 0.419116735458374, "num_input_tokens_seen": 3124662464, "step": 10990, "train_runtime": 106875.2447, "train_tokens_per_second": 29236.541 }, { "epoch": 0.38920229010165697, "grad_norm": 0.58203125, "learning_rate": 3.450409950307666e-05, "loss": 0.4179194450378418, "num_input_tokens_seen": 3127486208, "step": 11000, "train_runtime": 106972.2202, "train_tokens_per_second": 29236.434 }, { "epoch": 0.3895561103653858, "grad_norm": 0.60546875, "learning_rate": 3.449588678320619e-05, "loss": 0.41327953338623047, "num_input_tokens_seen": 3130333248, "step": 11010, "train_runtime": 107068.9033, "train_tokens_per_second": 29236.624 }, { "epoch": 0.38990993062911455, "grad_norm": 0.578125, "learning_rate": 3.4487679924958767e-05, "loss": 0.41757965087890625, "num_input_tokens_seen": 3133211840, "step": 11020, "train_runtime": 107168.7551, "train_tokens_per_second": 29236.244 }, { "epoch": 0.3902637508928433, "grad_norm": 0.5859375, "learning_rate": 3.4479478921365076e-05, "loss": 0.4129302978515625, "num_input_tokens_seen": 3136050176, "step": 11030, "train_runtime": 107264.2321, "train_tokens_per_second": 29236.681 }, { "epoch": 0.3906175711565721, "grad_norm": 0.58203125, "learning_rate": 3.447128376546738e-05, "loss": 0.418621826171875, "num_input_tokens_seen": 3138931008, "step": 11040, "train_runtime": 107363.2956, "train_tokens_per_second": 29236.537 }, { "epoch": 0.3909713914203009, "grad_norm": 0.59765625, "learning_rate": 3.4463094450319505e-05, "loss": 0.41826591491699217, "num_input_tokens_seen": 3141796864, "step": 11050, "train_runtime": 107464.8358, "train_tokens_per_second": 29235.581 }, { "epoch": 0.3913252116840297, "grad_norm": 0.5625, "learning_rate": 3.4454910968986855e-05, "loss": 0.4192346572875977, "num_input_tokens_seen": 3144613824, "step": 11060, "train_runtime": 107561.4481, "train_tokens_per_second": 29235.51 }, { "epoch": 0.39167903194775844, "grad_norm": 0.55859375, "learning_rate": 3.4446733314546336e-05, "loss": 0.42135019302368165, "num_input_tokens_seen": 3147476032, "step": 11070, "train_runtime": 107662.3514, "train_tokens_per_second": 29234.695 }, { "epoch": 0.3920328522114872, "grad_norm": 0.5859375, "learning_rate": 3.443856148008633e-05, "loss": 0.410903263092041, "num_input_tokens_seen": 3150305600, "step": 11080, "train_runtime": 107758.3784, "train_tokens_per_second": 29234.902 }, { "epoch": 0.39238667247521597, "grad_norm": 0.58984375, "learning_rate": 3.443039545870672e-05, "loss": 0.419382905960083, "num_input_tokens_seen": 3153158784, "step": 11090, "train_runtime": 107854.9993, "train_tokens_per_second": 29235.166 }, { "epoch": 0.3927404927389448, "grad_norm": 0.56640625, "learning_rate": 3.442223524351883e-05, "loss": 0.416320276260376, "num_input_tokens_seen": 3156049984, "step": 11100, "train_runtime": 107957.0325, "train_tokens_per_second": 29234.316 }, { "epoch": 0.39309431300267356, "grad_norm": 0.59765625, "learning_rate": 3.44140808276454e-05, "loss": 0.41596460342407227, "num_input_tokens_seen": 3158898944, "step": 11110, "train_runtime": 108054.8311, "train_tokens_per_second": 29234.222 }, { "epoch": 0.3934481332664023, "grad_norm": 0.5859375, "learning_rate": 3.4405932204220575e-05, "loss": 0.41338586807250977, "num_input_tokens_seen": 3161758976, "step": 11120, "train_runtime": 108152.8269, "train_tokens_per_second": 29234.178 }, { "epoch": 0.3938019535301311, "grad_norm": 0.578125, "learning_rate": 3.4397789366389876e-05, "loss": 0.42003211975097654, "num_input_tokens_seen": 3164592256, "step": 11130, "train_runtime": 108247.4322, "train_tokens_per_second": 29234.802 }, { "epoch": 0.3941557737938599, "grad_norm": 0.59765625, "learning_rate": 3.438965230731016e-05, "loss": 0.4142338752746582, "num_input_tokens_seen": 3167391680, "step": 11140, "train_runtime": 108340.3606, "train_tokens_per_second": 29235.565 }, { "epoch": 0.3945095940575887, "grad_norm": 0.55859375, "learning_rate": 3.438152102014964e-05, "loss": 0.41826043128967283, "num_input_tokens_seen": 3170208256, "step": 11150, "train_runtime": 108436.2954, "train_tokens_per_second": 29235.675 }, { "epoch": 0.39486341432131744, "grad_norm": 0.55078125, "learning_rate": 3.437339549808778e-05, "loss": 0.41660280227661134, "num_input_tokens_seen": 3173073088, "step": 11160, "train_runtime": 108535.1378, "train_tokens_per_second": 29235.445 }, { "epoch": 0.3952172345850462, "grad_norm": 0.58203125, "learning_rate": 3.43652757343154e-05, "loss": 0.4146543025970459, "num_input_tokens_seen": 3175926528, "step": 11170, "train_runtime": 108632.8473, "train_tokens_per_second": 29235.416 }, { "epoch": 0.39557105484877503, "grad_norm": 0.58984375, "learning_rate": 3.435716172203449e-05, "loss": 0.4116074562072754, "num_input_tokens_seen": 3178719680, "step": 11180, "train_runtime": 108726.1964, "train_tokens_per_second": 29236.006 }, { "epoch": 0.3959248751125038, "grad_norm": 0.5859375, "learning_rate": 3.434905345445833e-05, "loss": 0.41634092330932615, "num_input_tokens_seen": 3181518912, "step": 11190, "train_runtime": 108822.6646, "train_tokens_per_second": 29235.812 }, { "epoch": 0.39627869537623256, "grad_norm": 0.56640625, "learning_rate": 3.4340950924811374e-05, "loss": 0.4111994743347168, "num_input_tokens_seen": 3184423232, "step": 11200, "train_runtime": 108920.5394, "train_tokens_per_second": 29236.205 }, { "epoch": 0.3966325156399613, "grad_norm": 0.5859375, "learning_rate": 3.433285412632927e-05, "loss": 0.41596279144287107, "num_input_tokens_seen": 3187193344, "step": 11210, "train_runtime": 109011.7762, "train_tokens_per_second": 29237.147 }, { "epoch": 0.39698633590369015, "grad_norm": 0.5703125, "learning_rate": 3.4324763052258835e-05, "loss": 0.4131749153137207, "num_input_tokens_seen": 3190018944, "step": 11220, "train_runtime": 109105.8799, "train_tokens_per_second": 29237.828 }, { "epoch": 0.3973401561674189, "grad_norm": 0.59375, "learning_rate": 3.4316677695858003e-05, "loss": 0.4115592002868652, "num_input_tokens_seen": 3192876288, "step": 11230, "train_runtime": 109205.9649, "train_tokens_per_second": 29237.197 }, { "epoch": 0.3976939764311477, "grad_norm": 0.5703125, "learning_rate": 3.430859805039583e-05, "loss": 0.41374759674072265, "num_input_tokens_seen": 3195720640, "step": 11240, "train_runtime": 109304.3384, "train_tokens_per_second": 29236.906 }, { "epoch": 0.39804779669487644, "grad_norm": 0.5703125, "learning_rate": 3.430052410915246e-05, "loss": 0.4114526271820068, "num_input_tokens_seen": 3198522880, "step": 11250, "train_runtime": 109397.5698, "train_tokens_per_second": 29237.604 }, { "epoch": 0.39840161695860526, "grad_norm": 0.55859375, "learning_rate": 3.4292455865419086e-05, "loss": 0.41596226692199706, "num_input_tokens_seen": 3201374656, "step": 11260, "train_runtime": 109495.2804, "train_tokens_per_second": 29237.558 }, { "epoch": 0.39875543722233403, "grad_norm": 0.58984375, "learning_rate": 3.4284393312497973e-05, "loss": 0.41753544807434084, "num_input_tokens_seen": 3204221120, "step": 11270, "train_runtime": 109597.4499, "train_tokens_per_second": 29236.274 }, { "epoch": 0.3991092574860628, "grad_norm": 0.5625, "learning_rate": 3.427633644370238e-05, "loss": 0.4173128128051758, "num_input_tokens_seen": 3207060992, "step": 11280, "train_runtime": 109692.2366, "train_tokens_per_second": 29236.9 }, { "epoch": 0.39946307774979156, "grad_norm": 0.5703125, "learning_rate": 3.4268285252356564e-05, "loss": 0.4158421516418457, "num_input_tokens_seen": 3209919680, "step": 11290, "train_runtime": 109790.1773, "train_tokens_per_second": 29236.857 }, { "epoch": 0.3998168980135204, "grad_norm": 0.56640625, "learning_rate": 3.426023973179575e-05, "loss": 0.4125174045562744, "num_input_tokens_seen": 3212786368, "step": 11300, "train_runtime": 109891.5353, "train_tokens_per_second": 29235.977 }, { "epoch": 0.40017071827724915, "grad_norm": 0.5703125, "learning_rate": 3.425219987536614e-05, "loss": 0.4186762809753418, "num_input_tokens_seen": 3215634944, "step": 11310, "train_runtime": 109988.3257, "train_tokens_per_second": 29236.148 }, { "epoch": 0.4005245385409779, "grad_norm": 0.57421875, "learning_rate": 3.4244165676424815e-05, "loss": 0.4166566848754883, "num_input_tokens_seen": 3218476672, "step": 11320, "train_runtime": 110083.396, "train_tokens_per_second": 29236.713 }, { "epoch": 0.4008783588047067, "grad_norm": 0.5625, "learning_rate": 3.423613712833979e-05, "loss": 0.4160191535949707, "num_input_tokens_seen": 3221314432, "step": 11330, "train_runtime": 110180.7442, "train_tokens_per_second": 29236.637 }, { "epoch": 0.40123217906843545, "grad_norm": 0.55859375, "learning_rate": 3.422811422448995e-05, "loss": 0.4123242378234863, "num_input_tokens_seen": 3224176704, "step": 11340, "train_runtime": 110279.8559, "train_tokens_per_second": 29236.316 }, { "epoch": 0.40158599933216427, "grad_norm": 0.59375, "learning_rate": 3.422009695826503e-05, "loss": 0.4157470703125, "num_input_tokens_seen": 3226992384, "step": 11350, "train_runtime": 110376.671, "train_tokens_per_second": 29236.181 }, { "epoch": 0.40193981959589303, "grad_norm": 0.56640625, "learning_rate": 3.4212085323065626e-05, "loss": 0.41890764236450195, "num_input_tokens_seen": 3229866496, "step": 11360, "train_runtime": 110476.103, "train_tokens_per_second": 29235.884 }, { "epoch": 0.4022936398596218, "grad_norm": 0.57421875, "learning_rate": 3.4204079312303103e-05, "loss": 0.4125824928283691, "num_input_tokens_seen": 3232696320, "step": 11370, "train_runtime": 110568.7335, "train_tokens_per_second": 29236.984 }, { "epoch": 0.40264746012335056, "grad_norm": 0.5859375, "learning_rate": 3.419607891939964e-05, "loss": 0.4136549949645996, "num_input_tokens_seen": 3235577024, "step": 11380, "train_runtime": 110668.3193, "train_tokens_per_second": 29236.705 }, { "epoch": 0.4030012803870794, "grad_norm": 0.58203125, "learning_rate": 3.4188084137788166e-05, "loss": 0.4150240421295166, "num_input_tokens_seen": 3238419904, "step": 11390, "train_runtime": 110764.7287, "train_tokens_per_second": 29236.924 }, { "epoch": 0.40335510065080815, "grad_norm": 0.59375, "learning_rate": 3.418009496091238e-05, "loss": 0.41760807037353515, "num_input_tokens_seen": 3241216512, "step": 11400, "train_runtime": 110857.656, "train_tokens_per_second": 29237.642 }, { "epoch": 0.4037089209145369, "grad_norm": 0.58984375, "learning_rate": 3.417211138222666e-05, "loss": 0.4124875545501709, "num_input_tokens_seen": 3244043904, "step": 11410, "train_runtime": 110953.3611, "train_tokens_per_second": 29237.906 }, { "epoch": 0.4040627411782657, "grad_norm": 0.58984375, "learning_rate": 3.416413339519612e-05, "loss": 0.4189607620239258, "num_input_tokens_seen": 3246944704, "step": 11420, "train_runtime": 111056.2458, "train_tokens_per_second": 29236.939 }, { "epoch": 0.4044165614419945, "grad_norm": 0.58984375, "learning_rate": 3.4156160993296524e-05, "loss": 0.41456027030944825, "num_input_tokens_seen": 3249768064, "step": 11430, "train_runtime": 111152.3585, "train_tokens_per_second": 29237.059 }, { "epoch": 0.40477038170572327, "grad_norm": 0.56640625, "learning_rate": 3.4148194170014295e-05, "loss": 0.4132650852203369, "num_input_tokens_seen": 3252589824, "step": 11440, "train_runtime": 111248.3799, "train_tokens_per_second": 29237.188 }, { "epoch": 0.40512420196945204, "grad_norm": 0.5703125, "learning_rate": 3.4140232918846484e-05, "loss": 0.4124772071838379, "num_input_tokens_seen": 3255463808, "step": 11450, "train_runtime": 111346.0604, "train_tokens_per_second": 29237.351 }, { "epoch": 0.4054780222331808, "grad_norm": 0.5859375, "learning_rate": 3.4132277233300753e-05, "loss": 0.406711483001709, "num_input_tokens_seen": 3258240768, "step": 11460, "train_runtime": 111437.1351, "train_tokens_per_second": 29238.375 }, { "epoch": 0.4058318424969096, "grad_norm": 0.58203125, "learning_rate": 3.4124327106895356e-05, "loss": 0.4144904136657715, "num_input_tokens_seen": 3261076992, "step": 11470, "train_runtime": 111533.2897, "train_tokens_per_second": 29238.598 }, { "epoch": 0.4061856627606384, "grad_norm": 0.58203125, "learning_rate": 3.4116382533159097e-05, "loss": 0.4160325050354004, "num_input_tokens_seen": 3263949568, "step": 11480, "train_runtime": 111631.8354, "train_tokens_per_second": 29238.519 }, { "epoch": 0.40653948302436715, "grad_norm": 0.55859375, "learning_rate": 3.4108443505631335e-05, "loss": 0.4144599914550781, "num_input_tokens_seen": 3266796544, "step": 11490, "train_runtime": 111728.9693, "train_tokens_per_second": 29238.581 }, { "epoch": 0.4068933032880959, "grad_norm": 0.57421875, "learning_rate": 3.410051001786192e-05, "loss": 0.4143384456634521, "num_input_tokens_seen": 3269649216, "step": 11500, "train_runtime": 111829.037, "train_tokens_per_second": 29237.927 }, { "epoch": 0.40724712355182474, "grad_norm": 0.56640625, "learning_rate": 3.409258206341124e-05, "loss": 0.41516814231872556, "num_input_tokens_seen": 3272512320, "step": 11510, "train_runtime": 111928.3504, "train_tokens_per_second": 29237.564 }, { "epoch": 0.4076009438155535, "grad_norm": 0.5703125, "learning_rate": 3.4084659635850134e-05, "loss": 0.41497111320495605, "num_input_tokens_seen": 3275336384, "step": 11520, "train_runtime": 112025.329, "train_tokens_per_second": 29237.463 }, { "epoch": 0.4079547640792823, "grad_norm": 0.60546875, "learning_rate": 3.40767427287599e-05, "loss": 0.4122370719909668, "num_input_tokens_seen": 3278275648, "step": 11530, "train_runtime": 112127.7816, "train_tokens_per_second": 29236.962 }, { "epoch": 0.40830858434301104, "grad_norm": 0.55859375, "learning_rate": 3.406883133573224e-05, "loss": 0.4149974822998047, "num_input_tokens_seen": 3281109184, "step": 11540, "train_runtime": 112226.1532, "train_tokens_per_second": 29236.582 }, { "epoch": 0.40866240460673986, "grad_norm": 0.578125, "learning_rate": 3.406092545036932e-05, "loss": 0.4140750885009766, "num_input_tokens_seen": 3283960064, "step": 11550, "train_runtime": 112322.5364, "train_tokens_per_second": 29236.876 }, { "epoch": 0.4090162248704686, "grad_norm": 0.578125, "learning_rate": 3.405302506628365e-05, "loss": 0.4131946563720703, "num_input_tokens_seen": 3286808128, "step": 11560, "train_runtime": 112419.7575, "train_tokens_per_second": 29236.926 }, { "epoch": 0.4093700451341974, "grad_norm": 0.55078125, "learning_rate": 3.404513017709813e-05, "loss": 0.4137443542480469, "num_input_tokens_seen": 3289673792, "step": 11570, "train_runtime": 112518.3897, "train_tokens_per_second": 29236.766 }, { "epoch": 0.40972386539792616, "grad_norm": 0.578125, "learning_rate": 3.403724077644598e-05, "loss": 0.4137574195861816, "num_input_tokens_seen": 3292509696, "step": 11580, "train_runtime": 112613.3476, "train_tokens_per_second": 29237.295 }, { "epoch": 0.4100776856616549, "grad_norm": 0.5546875, "learning_rate": 3.402935685797077e-05, "loss": 0.41542987823486327, "num_input_tokens_seen": 3295443840, "step": 11590, "train_runtime": 112718.0795, "train_tokens_per_second": 29236.16 }, { "epoch": 0.41043150592538374, "grad_norm": 0.60546875, "learning_rate": 3.4021478415326355e-05, "loss": 0.41658792495727537, "num_input_tokens_seen": 3298356224, "step": 11600, "train_runtime": 112822.1544, "train_tokens_per_second": 29235.005 }, { "epoch": 0.4107853261891125, "grad_norm": 0.5859375, "learning_rate": 3.401360544217687e-05, "loss": 0.41453099250793457, "num_input_tokens_seen": 3301193152, "step": 11610, "train_runtime": 112919.0471, "train_tokens_per_second": 29235.043 }, { "epoch": 0.4111391464528413, "grad_norm": 0.58984375, "learning_rate": 3.400573793219672e-05, "loss": 0.41672253608703613, "num_input_tokens_seen": 3304026112, "step": 11620, "train_runtime": 113016.0858, "train_tokens_per_second": 29235.007 }, { "epoch": 0.41149296671657004, "grad_norm": 0.5625, "learning_rate": 3.3997875879070546e-05, "loss": 0.41640443801879884, "num_input_tokens_seen": 3306898304, "step": 11630, "train_runtime": 113113.0236, "train_tokens_per_second": 29235.345 }, { "epoch": 0.41184678698029886, "grad_norm": 0.55859375, "learning_rate": 3.399001927649318e-05, "loss": 0.4163402557373047, "num_input_tokens_seen": 3309742208, "step": 11640, "train_runtime": 113212.4799, "train_tokens_per_second": 29234.782 }, { "epoch": 0.41220060724402763, "grad_norm": 0.57421875, "learning_rate": 3.398216811816968e-05, "loss": 0.4114383697509766, "num_input_tokens_seen": 3312578688, "step": 11650, "train_runtime": 113308.7347, "train_tokens_per_second": 29234.981 }, { "epoch": 0.4125544275077564, "grad_norm": 0.59765625, "learning_rate": 3.397432239781527e-05, "loss": 0.41254415512084963, "num_input_tokens_seen": 3315393024, "step": 11660, "train_runtime": 113405.2368, "train_tokens_per_second": 29234.92 }, { "epoch": 0.41290824777148516, "grad_norm": 0.58203125, "learning_rate": 3.396648210915531e-05, "loss": 0.4135406494140625, "num_input_tokens_seen": 3318191872, "step": 11670, "train_runtime": 113502.8791, "train_tokens_per_second": 29234.429 }, { "epoch": 0.413262068035214, "grad_norm": 0.58203125, "learning_rate": 3.3958647245925315e-05, "loss": 0.4148995399475098, "num_input_tokens_seen": 3321021888, "step": 11680, "train_runtime": 113601.2675, "train_tokens_per_second": 29234.021 }, { "epoch": 0.41361588829894275, "grad_norm": 0.56640625, "learning_rate": 3.3950817801870885e-05, "loss": 0.4123344421386719, "num_input_tokens_seen": 3323904960, "step": 11690, "train_runtime": 113702.991, "train_tokens_per_second": 29233.224 }, { "epoch": 0.4139697085626715, "grad_norm": 0.55078125, "learning_rate": 3.3942993770747735e-05, "loss": 0.410841703414917, "num_input_tokens_seen": 3326796480, "step": 11700, "train_runtime": 113801.4675, "train_tokens_per_second": 29233.336 }, { "epoch": 0.4143235288264003, "grad_norm": 0.5625, "learning_rate": 3.3935175146321626e-05, "loss": 0.416718578338623, "num_input_tokens_seen": 3329629056, "step": 11710, "train_runtime": 113898.1458, "train_tokens_per_second": 29233.391 }, { "epoch": 0.4146773490901291, "grad_norm": 0.578125, "learning_rate": 3.392736192236839e-05, "loss": 0.4115481376647949, "num_input_tokens_seen": 3332476864, "step": 11720, "train_runtime": 113993.6644, "train_tokens_per_second": 29233.878 }, { "epoch": 0.41503116935385787, "grad_norm": 0.58984375, "learning_rate": 3.391955409267387e-05, "loss": 0.4115856170654297, "num_input_tokens_seen": 3335266304, "step": 11730, "train_runtime": 114086.7436, "train_tokens_per_second": 29234.477 }, { "epoch": 0.41538498961758663, "grad_norm": 0.58203125, "learning_rate": 3.3911751651033896e-05, "loss": 0.41041812896728513, "num_input_tokens_seen": 3338176256, "step": 11740, "train_runtime": 114189.4387, "train_tokens_per_second": 29233.669 }, { "epoch": 0.4157388098813154, "grad_norm": 0.56640625, "learning_rate": 3.3903954591254334e-05, "loss": 0.41042661666870117, "num_input_tokens_seen": 3341021696, "step": 11750, "train_runtime": 114286.9775, "train_tokens_per_second": 29233.617 }, { "epoch": 0.4160926301450442, "grad_norm": 0.5703125, "learning_rate": 3.389616290715097e-05, "loss": 0.4141341209411621, "num_input_tokens_seen": 3343843200, "step": 11760, "train_runtime": 114384.4514, "train_tokens_per_second": 29233.372 }, { "epoch": 0.416446450408773, "grad_norm": 0.5703125, "learning_rate": 3.388837659254955e-05, "loss": 0.411664342880249, "num_input_tokens_seen": 3346653568, "step": 11770, "train_runtime": 114478.7255, "train_tokens_per_second": 29233.847 }, { "epoch": 0.41680027067250175, "grad_norm": 0.578125, "learning_rate": 3.3880595641285746e-05, "loss": 0.41227002143859864, "num_input_tokens_seen": 3349494080, "step": 11780, "train_runtime": 114574.7575, "train_tokens_per_second": 29234.136 }, { "epoch": 0.4171540909362305, "grad_norm": 0.61328125, "learning_rate": 3.387282004720513e-05, "loss": 0.4113319396972656, "num_input_tokens_seen": 3352347968, "step": 11790, "train_runtime": 114672.7997, "train_tokens_per_second": 29234.029 }, { "epoch": 0.41750791119995934, "grad_norm": 0.57421875, "learning_rate": 3.386504980416316e-05, "loss": 0.41370477676391604, "num_input_tokens_seen": 3355214848, "step": 11800, "train_runtime": 114770.1068, "train_tokens_per_second": 29234.223 }, { "epoch": 0.4178617314636881, "grad_norm": 0.57421875, "learning_rate": 3.385728490602515e-05, "loss": 0.40928473472595217, "num_input_tokens_seen": 3358055872, "step": 11810, "train_runtime": 114866.4605, "train_tokens_per_second": 29234.433 }, { "epoch": 0.41821555172741687, "grad_norm": 0.55859375, "learning_rate": 3.384952534666625e-05, "loss": 0.41118149757385253, "num_input_tokens_seen": 3360913728, "step": 11820, "train_runtime": 114963.7402, "train_tokens_per_second": 29234.554 }, { "epoch": 0.41856937199114563, "grad_norm": 0.5859375, "learning_rate": 3.3841771119971455e-05, "loss": 0.4141855716705322, "num_input_tokens_seen": 3363813568, "step": 11830, "train_runtime": 115065.9683, "train_tokens_per_second": 29233.783 }, { "epoch": 0.41892319225487445, "grad_norm": 0.57421875, "learning_rate": 3.383402221983554e-05, "loss": 0.4161659240722656, "num_input_tokens_seen": 3366657472, "step": 11840, "train_runtime": 115164.7511, "train_tokens_per_second": 29233.402 }, { "epoch": 0.4192770125186032, "grad_norm": 0.55859375, "learning_rate": 3.3826278640163064e-05, "loss": 0.41323318481445315, "num_input_tokens_seen": 3369497024, "step": 11850, "train_runtime": 115261.7681, "train_tokens_per_second": 29233.432 }, { "epoch": 0.419630832782332, "grad_norm": 0.57421875, "learning_rate": 3.3818540374868354e-05, "loss": 0.40776491165161133, "num_input_tokens_seen": 3372334208, "step": 11860, "train_runtime": 115357.53, "train_tokens_per_second": 29233.759 }, { "epoch": 0.41998465304606075, "grad_norm": 0.58203125, "learning_rate": 3.381080741787547e-05, "loss": 0.4171136856079102, "num_input_tokens_seen": 3375107712, "step": 11870, "train_runtime": 115450.9685, "train_tokens_per_second": 29234.122 }, { "epoch": 0.4203384733097895, "grad_norm": 0.578125, "learning_rate": 3.38030797631182e-05, "loss": 0.4164409637451172, "num_input_tokens_seen": 3377940096, "step": 11880, "train_runtime": 115546.4689, "train_tokens_per_second": 29234.473 }, { "epoch": 0.42069229357351834, "grad_norm": 0.5859375, "learning_rate": 3.379535740454003e-05, "loss": 0.4124338150024414, "num_input_tokens_seen": 3380774976, "step": 11890, "train_runtime": 115643.5731, "train_tokens_per_second": 29234.439 }, { "epoch": 0.4210461138372471, "grad_norm": 0.55859375, "learning_rate": 3.3787640336094126e-05, "loss": 0.4098670959472656, "num_input_tokens_seen": 3383618432, "step": 11900, "train_runtime": 115743.5378, "train_tokens_per_second": 29233.757 }, { "epoch": 0.42139993410097587, "grad_norm": 0.57421875, "learning_rate": 3.3779928551743325e-05, "loss": 0.4128416061401367, "num_input_tokens_seen": 3386487296, "step": 11910, "train_runtime": 115842.4194, "train_tokens_per_second": 29233.568 }, { "epoch": 0.42175375436470464, "grad_norm": 0.58984375, "learning_rate": 3.3772222045460084e-05, "loss": 0.4113110065460205, "num_input_tokens_seen": 3389325760, "step": 11920, "train_runtime": 115939.8054, "train_tokens_per_second": 29233.495 }, { "epoch": 0.42210757462843346, "grad_norm": 0.5546875, "learning_rate": 3.37645208112265e-05, "loss": 0.4120922565460205, "num_input_tokens_seen": 3392209920, "step": 11930, "train_runtime": 116041.1666, "train_tokens_per_second": 29232.815 }, { "epoch": 0.4224613948921622, "grad_norm": 0.56640625, "learning_rate": 3.3756824843034255e-05, "loss": 0.41185483932495115, "num_input_tokens_seen": 3395060672, "step": 11940, "train_runtime": 116136.7831, "train_tokens_per_second": 29233.294 }, { "epoch": 0.422815215155891, "grad_norm": 0.59765625, "learning_rate": 3.374913413488464e-05, "loss": 0.40811591148376464, "num_input_tokens_seen": 3397972864, "step": 11950, "train_runtime": 116238.346, "train_tokens_per_second": 29232.805 }, { "epoch": 0.42316903541961975, "grad_norm": 0.56640625, "learning_rate": 3.374144868078848e-05, "loss": 0.41322779655456543, "num_input_tokens_seen": 3400848320, "step": 11960, "train_runtime": 116339.4028, "train_tokens_per_second": 29232.128 }, { "epoch": 0.4235228556833486, "grad_norm": 0.59375, "learning_rate": 3.373376847476615e-05, "loss": 0.4113899230957031, "num_input_tokens_seen": 3403706240, "step": 11970, "train_runtime": 116438.9204, "train_tokens_per_second": 29231.688 }, { "epoch": 0.42387667594707734, "grad_norm": 0.55078125, "learning_rate": 3.3726093510847566e-05, "loss": 0.4134838104248047, "num_input_tokens_seen": 3406595200, "step": 11980, "train_runtime": 116536.7184, "train_tokens_per_second": 29231.947 }, { "epoch": 0.4242304962108061, "grad_norm": 0.56640625, "learning_rate": 3.371842378307212e-05, "loss": 0.40941553115844725, "num_input_tokens_seen": 3409425088, "step": 11990, "train_runtime": 116631.7065, "train_tokens_per_second": 29232.403 }, { "epoch": 0.4245843164745349, "grad_norm": 0.58203125, "learning_rate": 3.371075928548872e-05, "loss": 0.4122337818145752, "num_input_tokens_seen": 3412251712, "step": 12000, "train_runtime": 116726.7847, "train_tokens_per_second": 29232.808 }, { "epoch": 0.4249381367382637, "grad_norm": 0.5625, "learning_rate": 3.37031000121557e-05, "loss": 0.4123872756958008, "num_input_tokens_seen": 3415124224, "step": 12010, "train_runtime": 116827.0695, "train_tokens_per_second": 29232.302 }, { "epoch": 0.42529195700199246, "grad_norm": 0.55859375, "learning_rate": 3.369544595714088e-05, "loss": 0.4161685943603516, "num_input_tokens_seen": 3417996992, "step": 12020, "train_runtime": 116924.9032, "train_tokens_per_second": 29232.412 }, { "epoch": 0.4256457772657212, "grad_norm": 0.578125, "learning_rate": 3.368779711452148e-05, "loss": 0.41042294502258303, "num_input_tokens_seen": 3420820992, "step": 12030, "train_runtime": 117022.265, "train_tokens_per_second": 29232.223 }, { "epoch": 0.42599959752945, "grad_norm": 0.60546875, "learning_rate": 3.368015347838413e-05, "loss": 0.4107240676879883, "num_input_tokens_seen": 3423679168, "step": 12040, "train_runtime": 117119.4703, "train_tokens_per_second": 29232.366 }, { "epoch": 0.4263534177931788, "grad_norm": 0.59375, "learning_rate": 3.3672515042824855e-05, "loss": 0.4185525894165039, "num_input_tokens_seen": 3426460544, "step": 12050, "train_runtime": 117212.6937, "train_tokens_per_second": 29232.845 }, { "epoch": 0.4267072380569076, "grad_norm": 0.56640625, "learning_rate": 3.366488180194904e-05, "loss": 0.41394634246826173, "num_input_tokens_seen": 3429307456, "step": 12060, "train_runtime": 117312.3752, "train_tokens_per_second": 29232.274 }, { "epoch": 0.42706105832063634, "grad_norm": 0.56640625, "learning_rate": 3.365725374987143e-05, "loss": 0.4118229389190674, "num_input_tokens_seen": 3432160064, "step": 12070, "train_runtime": 117411.3888, "train_tokens_per_second": 29231.918 }, { "epoch": 0.4274148785843651, "grad_norm": 0.66796875, "learning_rate": 3.36496308807161e-05, "loss": 0.41736268997192383, "num_input_tokens_seen": 3434977472, "step": 12080, "train_runtime": 117507.87, "train_tokens_per_second": 29231.893 }, { "epoch": 0.42776869884809393, "grad_norm": 0.56640625, "learning_rate": 3.3642013188616426e-05, "loss": 0.41408915519714357, "num_input_tokens_seen": 3437811840, "step": 12090, "train_runtime": 117603.6562, "train_tokens_per_second": 29232.185 }, { "epoch": 0.4281225191118227, "grad_norm": 0.57421875, "learning_rate": 3.3634400667715074e-05, "loss": 0.4125615119934082, "num_input_tokens_seen": 3440651072, "step": 12100, "train_runtime": 117700.196, "train_tokens_per_second": 29232.331 }, { "epoch": 0.42847633937555146, "grad_norm": 0.58203125, "learning_rate": 3.3626793312164013e-05, "loss": 0.41154794692993163, "num_input_tokens_seen": 3443467200, "step": 12110, "train_runtime": 117796.3602, "train_tokens_per_second": 29232.374 }, { "epoch": 0.42883015963928023, "grad_norm": 0.5859375, "learning_rate": 3.361919111612443e-05, "loss": 0.4136035919189453, "num_input_tokens_seen": 3446304064, "step": 12120, "train_runtime": 117895.2356, "train_tokens_per_second": 29231.92 }, { "epoch": 0.429183979903009, "grad_norm": 0.58203125, "learning_rate": 3.361159407376678e-05, "loss": 0.41530570983886717, "num_input_tokens_seen": 3449141056, "step": 12130, "train_runtime": 117991.8594, "train_tokens_per_second": 29232.026 }, { "epoch": 0.4295378001667378, "grad_norm": 0.5625, "learning_rate": 3.3604002179270685e-05, "loss": 0.41527385711669923, "num_input_tokens_seen": 3451978496, "step": 12140, "train_runtime": 118089.1445, "train_tokens_per_second": 29231.971 }, { "epoch": 0.4298916204304666, "grad_norm": 0.57421875, "learning_rate": 3.359641542682504e-05, "loss": 0.41362857818603516, "num_input_tokens_seen": 3454860928, "step": 12150, "train_runtime": 118188.4612, "train_tokens_per_second": 29231.796 }, { "epoch": 0.43024544069419535, "grad_norm": 0.59375, "learning_rate": 3.3588833810627854e-05, "loss": 0.41366729736328123, "num_input_tokens_seen": 3457707904, "step": 12160, "train_runtime": 118284.5137, "train_tokens_per_second": 29232.127 }, { "epoch": 0.4305992609579241, "grad_norm": 0.55859375, "learning_rate": 3.358125732488632e-05, "loss": 0.41401143074035646, "num_input_tokens_seen": 3460558272, "step": 12170, "train_runtime": 118379.1147, "train_tokens_per_second": 29232.845 }, { "epoch": 0.43095308122165293, "grad_norm": 0.57421875, "learning_rate": 3.357368596381679e-05, "loss": 0.4111454010009766, "num_input_tokens_seen": 3463387392, "step": 12180, "train_runtime": 118477.1854, "train_tokens_per_second": 29232.526 }, { "epoch": 0.4313069014853817, "grad_norm": 0.55078125, "learning_rate": 3.356611972164471e-05, "loss": 0.41094369888305665, "num_input_tokens_seen": 3466219328, "step": 12190, "train_runtime": 118570.5693, "train_tokens_per_second": 29233.387 }, { "epoch": 0.43166072174911047, "grad_norm": 0.57421875, "learning_rate": 3.355855859260466e-05, "loss": 0.4134207248687744, "num_input_tokens_seen": 3469031360, "step": 12200, "train_runtime": 118663.8051, "train_tokens_per_second": 29234.115 }, { "epoch": 0.43201454201283923, "grad_norm": 0.59765625, "learning_rate": 3.3551002570940285e-05, "loss": 0.41342954635620116, "num_input_tokens_seen": 3471901376, "step": 12210, "train_runtime": 118763.4421, "train_tokens_per_second": 29233.755 }, { "epoch": 0.43236836227656805, "grad_norm": 0.546875, "learning_rate": 3.354345165090431e-05, "loss": 0.4202736377716064, "num_input_tokens_seen": 3474786368, "step": 12220, "train_runtime": 118862.6991, "train_tokens_per_second": 29233.615 }, { "epoch": 0.4327221825402968, "grad_norm": 0.58203125, "learning_rate": 3.3535905826758515e-05, "loss": 0.41166110038757325, "num_input_tokens_seen": 3477614976, "step": 12230, "train_runtime": 118956.3897, "train_tokens_per_second": 29234.369 }, { "epoch": 0.4330760028040256, "grad_norm": 0.59765625, "learning_rate": 3.352836509277369e-05, "loss": 0.4089472770690918, "num_input_tokens_seen": 3480460416, "step": 12240, "train_runtime": 119054.0382, "train_tokens_per_second": 29234.291 }, { "epoch": 0.43342982306775435, "grad_norm": 0.5859375, "learning_rate": 3.352082944322966e-05, "loss": 0.41441688537597654, "num_input_tokens_seen": 3483293248, "step": 12250, "train_runtime": 119151.4526, "train_tokens_per_second": 29234.165 }, { "epoch": 0.43378364333148317, "grad_norm": 0.5859375, "learning_rate": 3.351329887241524e-05, "loss": 0.41138763427734376, "num_input_tokens_seen": 3486146176, "step": 12260, "train_runtime": 119248.3364, "train_tokens_per_second": 29234.338 }, { "epoch": 0.43413746359521194, "grad_norm": 0.5703125, "learning_rate": 3.3505773374628225e-05, "loss": 0.41250147819519045, "num_input_tokens_seen": 3488975744, "step": 12270, "train_runtime": 119346.4506, "train_tokens_per_second": 29234.013 }, { "epoch": 0.4344912838589407, "grad_norm": 0.5703125, "learning_rate": 3.3498252944175354e-05, "loss": 0.4172475814819336, "num_input_tokens_seen": 3491848384, "step": 12280, "train_runtime": 119447.0021, "train_tokens_per_second": 29233.454 }, { "epoch": 0.43484510412266947, "grad_norm": 0.5859375, "learning_rate": 3.3490737575372326e-05, "loss": 0.4148406982421875, "num_input_tokens_seen": 3494671616, "step": 12290, "train_runtime": 119541.156, "train_tokens_per_second": 29234.046 }, { "epoch": 0.4351989243863983, "grad_norm": 0.578125, "learning_rate": 3.348322726254375e-05, "loss": 0.40831804275512695, "num_input_tokens_seen": 3497450944, "step": 12300, "train_runtime": 119634.6681, "train_tokens_per_second": 29234.427 }, { "epoch": 0.43555274465012705, "grad_norm": 0.5859375, "learning_rate": 3.347572200002315e-05, "loss": 0.4108287334442139, "num_input_tokens_seen": 3500264704, "step": 12310, "train_runtime": 119731.3464, "train_tokens_per_second": 29234.322 }, { "epoch": 0.4359065649138558, "grad_norm": 0.60546875, "learning_rate": 3.3468221782152924e-05, "loss": 0.4108120918273926, "num_input_tokens_seen": 3503073856, "step": 12320, "train_runtime": 119826.6025, "train_tokens_per_second": 29234.525 }, { "epoch": 0.4362603851775846, "grad_norm": 0.58984375, "learning_rate": 3.346072660328435e-05, "loss": 0.4088562488555908, "num_input_tokens_seen": 3505961728, "step": 12330, "train_runtime": 119926.0077, "train_tokens_per_second": 29234.374 }, { "epoch": 0.4366142054413134, "grad_norm": 0.5703125, "learning_rate": 3.345323645777756e-05, "loss": 0.4123429298400879, "num_input_tokens_seen": 3508781760, "step": 12340, "train_runtime": 120020.6248, "train_tokens_per_second": 29234.823 }, { "epoch": 0.4369680257050422, "grad_norm": 0.5703125, "learning_rate": 3.34457513400015e-05, "loss": 0.4115546703338623, "num_input_tokens_seen": 3511625344, "step": 12350, "train_runtime": 120116.7985, "train_tokens_per_second": 29235.089 }, { "epoch": 0.43732184596877094, "grad_norm": 0.6015625, "learning_rate": 3.343827124433396e-05, "loss": 0.41304798126220704, "num_input_tokens_seen": 3514470144, "step": 12360, "train_runtime": 120213.1841, "train_tokens_per_second": 29235.314 }, { "epoch": 0.4376756662324997, "grad_norm": 0.5859375, "learning_rate": 3.343079616516151e-05, "loss": 0.41658964157104494, "num_input_tokens_seen": 3517244992, "step": 12370, "train_runtime": 120306.7372, "train_tokens_per_second": 29235.644 }, { "epoch": 0.43802948649622847, "grad_norm": 0.58203125, "learning_rate": 3.3423326096879495e-05, "loss": 0.41205539703369143, "num_input_tokens_seen": 3520055808, "step": 12380, "train_runtime": 120402.5103, "train_tokens_per_second": 29235.734 }, { "epoch": 0.4383833067599573, "grad_norm": 0.578125, "learning_rate": 3.341586103389203e-05, "loss": 0.41498050689697263, "num_input_tokens_seen": 3522888384, "step": 12390, "train_runtime": 120498.0423, "train_tokens_per_second": 29236.063 }, { "epoch": 0.43873712702368606, "grad_norm": 0.578125, "learning_rate": 3.3408400970611995e-05, "loss": 0.41040878295898436, "num_input_tokens_seen": 3525718848, "step": 12400, "train_runtime": 120595.1917, "train_tokens_per_second": 29235.982 }, { "epoch": 0.4390909472874148, "grad_norm": 0.5703125, "learning_rate": 3.340094590146095e-05, "loss": 0.41658973693847656, "num_input_tokens_seen": 3528588416, "step": 12410, "train_runtime": 120691.9668, "train_tokens_per_second": 29236.315 }, { "epoch": 0.4394447675511436, "grad_norm": 0.5859375, "learning_rate": 3.3393495820869215e-05, "loss": 0.41256113052368165, "num_input_tokens_seen": 3531412928, "step": 12420, "train_runtime": 120790.331, "train_tokens_per_second": 29235.891 }, { "epoch": 0.4397985878148724, "grad_norm": 0.578125, "learning_rate": 3.338605072327576e-05, "loss": 0.4107187271118164, "num_input_tokens_seen": 3534187904, "step": 12430, "train_runtime": 120884.6733, "train_tokens_per_second": 29236.03 }, { "epoch": 0.4401524080786012, "grad_norm": 0.58984375, "learning_rate": 3.337861060312827e-05, "loss": 0.4129295825958252, "num_input_tokens_seen": 3537046400, "step": 12440, "train_runtime": 120980.0974, "train_tokens_per_second": 29236.597 }, { "epoch": 0.44050622834232994, "grad_norm": 0.5859375, "learning_rate": 3.337117545488306e-05, "loss": 0.4126898765563965, "num_input_tokens_seen": 3539862400, "step": 12450, "train_runtime": 121076.9904, "train_tokens_per_second": 29236.458 }, { "epoch": 0.4408600486060587, "grad_norm": 0.578125, "learning_rate": 3.33637452730051e-05, "loss": 0.4142162322998047, "num_input_tokens_seen": 3542731776, "step": 12460, "train_runtime": 121175.9922, "train_tokens_per_second": 29236.251 }, { "epoch": 0.44121386886978753, "grad_norm": 0.57421875, "learning_rate": 3.335632005196796e-05, "loss": 0.4092580795288086, "num_input_tokens_seen": 3545568832, "step": 12470, "train_runtime": 121273.0965, "train_tokens_per_second": 29236.236 }, { "epoch": 0.4415676891335163, "grad_norm": 0.5703125, "learning_rate": 3.334889978625383e-05, "loss": 0.4097914218902588, "num_input_tokens_seen": 3548391872, "step": 12480, "train_runtime": 121368.1931, "train_tokens_per_second": 29236.588 }, { "epoch": 0.44192150939724506, "grad_norm": 0.5625, "learning_rate": 3.3341484470353515e-05, "loss": 0.4096519470214844, "num_input_tokens_seen": 3551287488, "step": 12490, "train_runtime": 121470.7237, "train_tokens_per_second": 29235.748 }, { "epoch": 0.4422753296609738, "grad_norm": 0.59375, "learning_rate": 3.333407409876635e-05, "loss": 0.4120530128479004, "num_input_tokens_seen": 3554146688, "step": 12500, "train_runtime": 121567.4786, "train_tokens_per_second": 29235.999 }, { "epoch": 0.44262914992470265, "grad_norm": 0.59375, "learning_rate": 3.332666866600024e-05, "loss": 0.4091007232666016, "num_input_tokens_seen": 3556976192, "step": 12510, "train_runtime": 121666.4778, "train_tokens_per_second": 29235.466 }, { "epoch": 0.4429829701884314, "grad_norm": 0.5703125, "learning_rate": 3.331926816657162e-05, "loss": 0.412156867980957, "num_input_tokens_seen": 3559771392, "step": 12520, "train_runtime": 121760.1442, "train_tokens_per_second": 29235.933 }, { "epoch": 0.4433367904521602, "grad_norm": 0.59765625, "learning_rate": 3.331187259500546e-05, "loss": 0.41840124130249023, "num_input_tokens_seen": 3562673984, "step": 12530, "train_runtime": 121862.0695, "train_tokens_per_second": 29235.299 }, { "epoch": 0.44369061071588894, "grad_norm": 0.5703125, "learning_rate": 3.3304481945835235e-05, "loss": 0.4158226490020752, "num_input_tokens_seen": 3565495808, "step": 12540, "train_runtime": 121957.4465, "train_tokens_per_second": 29235.573 }, { "epoch": 0.44404443097961777, "grad_norm": 0.58984375, "learning_rate": 3.329709621360288e-05, "loss": 0.4107212066650391, "num_input_tokens_seen": 3568296192, "step": 12550, "train_runtime": 122050.3287, "train_tokens_per_second": 29236.269 }, { "epoch": 0.44439825124334653, "grad_norm": 0.59765625, "learning_rate": 3.328971539285882e-05, "loss": 0.4103407859802246, "num_input_tokens_seen": 3571137408, "step": 12560, "train_runtime": 122147.9686, "train_tokens_per_second": 29236.159 }, { "epoch": 0.4447520715070753, "grad_norm": 0.59375, "learning_rate": 3.3282339478161935e-05, "loss": 0.41288127899169924, "num_input_tokens_seen": 3573937216, "step": 12570, "train_runtime": 122240.9749, "train_tokens_per_second": 29236.819 }, { "epoch": 0.44510589177080406, "grad_norm": 0.56640625, "learning_rate": 3.327496846407953e-05, "loss": 0.4112571716308594, "num_input_tokens_seen": 3576755136, "step": 12580, "train_runtime": 122334.7996, "train_tokens_per_second": 29237.43 }, { "epoch": 0.4454597120345329, "grad_norm": 0.5703125, "learning_rate": 3.3267602345187304e-05, "loss": 0.416623592376709, "num_input_tokens_seen": 3579593728, "step": 12590, "train_runtime": 122430.3622, "train_tokens_per_second": 29237.794 }, { "epoch": 0.44581353229826165, "grad_norm": 0.5625, "learning_rate": 3.326024111606942e-05, "loss": 0.408983039855957, "num_input_tokens_seen": 3582422016, "step": 12600, "train_runtime": 122525.7936, "train_tokens_per_second": 29238.105 }, { "epoch": 0.4461673525619904, "grad_norm": 0.58203125, "learning_rate": 3.325288477131839e-05, "loss": 0.4170994758605957, "num_input_tokens_seen": 3585311552, "step": 12610, "train_runtime": 122625.6045, "train_tokens_per_second": 29237.871 }, { "epoch": 0.4465211728257192, "grad_norm": 0.5703125, "learning_rate": 3.324553330553507e-05, "loss": 0.4109673500061035, "num_input_tokens_seen": 3588124352, "step": 12620, "train_runtime": 122719.8513, "train_tokens_per_second": 29238.337 }, { "epoch": 0.44687499308944795, "grad_norm": 0.578125, "learning_rate": 3.323818671332871e-05, "loss": 0.41263542175292967, "num_input_tokens_seen": 3590967936, "step": 12630, "train_runtime": 122817.5717, "train_tokens_per_second": 29238.226 }, { "epoch": 0.44722881335317677, "grad_norm": 0.609375, "learning_rate": 3.323084498931687e-05, "loss": 0.41025333404541015, "num_input_tokens_seen": 3593794752, "step": 12640, "train_runtime": 122913.452, "train_tokens_per_second": 29238.417 }, { "epoch": 0.44758263361690553, "grad_norm": 0.57421875, "learning_rate": 3.322350812812545e-05, "loss": 0.4123964309692383, "num_input_tokens_seen": 3596652736, "step": 12650, "train_runtime": 123012.0161, "train_tokens_per_second": 29238.223 }, { "epoch": 0.4479364538806343, "grad_norm": 0.578125, "learning_rate": 3.321617612438862e-05, "loss": 0.41256985664367674, "num_input_tokens_seen": 3599468672, "step": 12660, "train_runtime": 123107.3889, "train_tokens_per_second": 29238.445 }, { "epoch": 0.44829027414436307, "grad_norm": 0.578125, "learning_rate": 3.320884897274886e-05, "loss": 0.4146679401397705, "num_input_tokens_seen": 3602314176, "step": 12670, "train_runtime": 123204.7841, "train_tokens_per_second": 29238.428 }, { "epoch": 0.4486440944080919, "grad_norm": 0.5859375, "learning_rate": 3.320152666785692e-05, "loss": 0.41847925186157225, "num_input_tokens_seen": 3605160320, "step": 12680, "train_runtime": 123299.835, "train_tokens_per_second": 29238.971 }, { "epoch": 0.44899791467182065, "grad_norm": 0.625, "learning_rate": 3.319420920437179e-05, "loss": 0.4097771644592285, "num_input_tokens_seen": 3608000448, "step": 12690, "train_runtime": 123396.0111, "train_tokens_per_second": 29239.198 }, { "epoch": 0.4493517349355494, "grad_norm": 0.578125, "learning_rate": 3.31868965769607e-05, "loss": 0.41338434219360354, "num_input_tokens_seen": 3610869056, "step": 12700, "train_runtime": 123495.345, "train_tokens_per_second": 29238.908 }, { "epoch": 0.4497055551992782, "grad_norm": 0.58984375, "learning_rate": 3.317958878029911e-05, "loss": 0.41217937469482424, "num_input_tokens_seen": 3613746304, "step": 12710, "train_runtime": 123594.8104, "train_tokens_per_second": 29238.657 }, { "epoch": 0.450059375463007, "grad_norm": 0.5546875, "learning_rate": 3.3172285809070665e-05, "loss": 0.41030683517456057, "num_input_tokens_seen": 3616641600, "step": 12720, "train_runtime": 123693.6921, "train_tokens_per_second": 29238.691 }, { "epoch": 0.45041319572673577, "grad_norm": 0.58203125, "learning_rate": 3.3164987657967214e-05, "loss": 0.4161098480224609, "num_input_tokens_seen": 3619544960, "step": 12730, "train_runtime": 123796.6688, "train_tokens_per_second": 29237.822 }, { "epoch": 0.45076701599046454, "grad_norm": 0.5625, "learning_rate": 3.315769432168877e-05, "loss": 0.4102607727050781, "num_input_tokens_seen": 3622380864, "step": 12740, "train_runtime": 123891.5451, "train_tokens_per_second": 29238.322 }, { "epoch": 0.4511208362541933, "grad_norm": 0.60546875, "learning_rate": 3.315040579494349e-05, "loss": 0.41478471755981444, "num_input_tokens_seen": 3625226368, "step": 12750, "train_runtime": 123989.0324, "train_tokens_per_second": 29238.283 }, { "epoch": 0.4514746565179221, "grad_norm": 0.56640625, "learning_rate": 3.31431220724477e-05, "loss": 0.4113792419433594, "num_input_tokens_seen": 3628066688, "step": 12760, "train_runtime": 124083.7917, "train_tokens_per_second": 29238.844 }, { "epoch": 0.4518284767816509, "grad_norm": 0.57421875, "learning_rate": 3.3135843148925834e-05, "loss": 0.4128225326538086, "num_input_tokens_seen": 3630867584, "step": 12770, "train_runtime": 124176.2962, "train_tokens_per_second": 29239.619 }, { "epoch": 0.45218229704537966, "grad_norm": 0.55859375, "learning_rate": 3.3128569019110414e-05, "loss": 0.4140755653381348, "num_input_tokens_seen": 3633722176, "step": 12780, "train_runtime": 124274.8195, "train_tokens_per_second": 29239.408 }, { "epoch": 0.4525361173091084, "grad_norm": 0.56640625, "learning_rate": 3.312129967774207e-05, "loss": 0.41249914169311525, "num_input_tokens_seen": 3636590208, "step": 12790, "train_runtime": 124374.942, "train_tokens_per_second": 29238.93 }, { "epoch": 0.45288993757283724, "grad_norm": 0.59765625, "learning_rate": 3.311403511956952e-05, "loss": 0.4087204933166504, "num_input_tokens_seen": 3639380736, "step": 12800, "train_runtime": 124468.6991, "train_tokens_per_second": 29239.325 }, { "epoch": 0.453243757836566, "grad_norm": 0.5703125, "learning_rate": 3.310677533934952e-05, "loss": 0.41220407485961913, "num_input_tokens_seen": 3642170816, "step": 12810, "train_runtime": 124563.5758, "train_tokens_per_second": 29239.453 }, { "epoch": 0.4535975781002948, "grad_norm": 0.59375, "learning_rate": 3.309952033184686e-05, "loss": 0.4085845947265625, "num_input_tokens_seen": 3644998592, "step": 12820, "train_runtime": 124658.3109, "train_tokens_per_second": 29239.916 }, { "epoch": 0.45395139836402354, "grad_norm": 0.5859375, "learning_rate": 3.309227009183439e-05, "loss": 0.4152225494384766, "num_input_tokens_seen": 3647778752, "step": 12830, "train_runtime": 124750.8097, "train_tokens_per_second": 29240.522 }, { "epoch": 0.45430521862775236, "grad_norm": 0.546875, "learning_rate": 3.308502461409295e-05, "loss": 0.4108767509460449, "num_input_tokens_seen": 3650677312, "step": 12840, "train_runtime": 124849.5664, "train_tokens_per_second": 29240.609 }, { "epoch": 0.4546590388914811, "grad_norm": 0.57421875, "learning_rate": 3.3077783893411386e-05, "loss": 0.4112394332885742, "num_input_tokens_seen": 3653550912, "step": 12850, "train_runtime": 124949.125, "train_tokens_per_second": 29240.308 }, { "epoch": 0.4550128591552099, "grad_norm": 0.5546875, "learning_rate": 3.30705479245865e-05, "loss": 0.41403961181640625, "num_input_tokens_seen": 3656410176, "step": 12860, "train_runtime": 125046.9119, "train_tokens_per_second": 29240.308 }, { "epoch": 0.45536667941893866, "grad_norm": 0.57421875, "learning_rate": 3.3063316702423094e-05, "loss": 0.4169203758239746, "num_input_tokens_seen": 3659304768, "step": 12870, "train_runtime": 125147.7847, "train_tokens_per_second": 29239.869 }, { "epoch": 0.4557204996826674, "grad_norm": 0.57421875, "learning_rate": 3.305609022173388e-05, "loss": 0.41733317375183104, "num_input_tokens_seen": 3662148672, "step": 12880, "train_runtime": 125244.1442, "train_tokens_per_second": 29240.079 }, { "epoch": 0.45607431994639624, "grad_norm": 0.58203125, "learning_rate": 3.304886847733954e-05, "loss": 0.4152997970581055, "num_input_tokens_seen": 3665006976, "step": 12890, "train_runtime": 125341.9795, "train_tokens_per_second": 29240.06 }, { "epoch": 0.456428140210125, "grad_norm": 0.578125, "learning_rate": 3.304165146406865e-05, "loss": 0.4129094123840332, "num_input_tokens_seen": 3667843008, "step": 12900, "train_runtime": 125439.5858, "train_tokens_per_second": 29239.916 }, { "epoch": 0.4567819604738538, "grad_norm": 0.57421875, "learning_rate": 3.30344391767577e-05, "loss": 0.40851707458496095, "num_input_tokens_seen": 3670698688, "step": 12910, "train_runtime": 125537.935, "train_tokens_per_second": 29239.757 }, { "epoch": 0.45713578073758254, "grad_norm": 0.59375, "learning_rate": 3.302723161025104e-05, "loss": 0.41683287620544435, "num_input_tokens_seen": 3673513344, "step": 12920, "train_runtime": 125631.4877, "train_tokens_per_second": 29240.387 }, { "epoch": 0.45748960100131136, "grad_norm": 0.5703125, "learning_rate": 3.302002875940093e-05, "loss": 0.41037778854370116, "num_input_tokens_seen": 3676334272, "step": 12930, "train_runtime": 125726.2488, "train_tokens_per_second": 29240.785 }, { "epoch": 0.45784342126504013, "grad_norm": 0.578125, "learning_rate": 3.3012830619067466e-05, "loss": 0.4098685264587402, "num_input_tokens_seen": 3679143232, "step": 12940, "train_runtime": 125821.3099, "train_tokens_per_second": 29241.018 }, { "epoch": 0.4581972415287689, "grad_norm": 0.57421875, "learning_rate": 3.300563718411857e-05, "loss": 0.4120169639587402, "num_input_tokens_seen": 3681976512, "step": 12950, "train_runtime": 125918.0031, "train_tokens_per_second": 29241.065 }, { "epoch": 0.45855106179249766, "grad_norm": 0.57421875, "learning_rate": 3.299844844943e-05, "loss": 0.40993967056274416, "num_input_tokens_seen": 3684819072, "step": 12960, "train_runtime": 126015.2812, "train_tokens_per_second": 29241.049 }, { "epoch": 0.4589048820562265, "grad_norm": 0.5625, "learning_rate": 3.299126440988535e-05, "loss": 0.4140603065490723, "num_input_tokens_seen": 3687670720, "step": 12970, "train_runtime": 126113.2231, "train_tokens_per_second": 29240.952 }, { "epoch": 0.45925870231995525, "grad_norm": 0.5859375, "learning_rate": 3.298408506037596e-05, "loss": 0.4080381393432617, "num_input_tokens_seen": 3690532032, "step": 12980, "train_runtime": 126212.9587, "train_tokens_per_second": 29240.516 }, { "epoch": 0.459612522583684, "grad_norm": 0.5546875, "learning_rate": 3.297691039580097e-05, "loss": 0.40605506896972654, "num_input_tokens_seen": 3693374976, "step": 12990, "train_runtime": 126310.4971, "train_tokens_per_second": 29240.444 }, { "epoch": 0.4599663428474128, "grad_norm": 0.5546875, "learning_rate": 3.29697404110673e-05, "loss": 0.41342811584472655, "num_input_tokens_seen": 3696248128, "step": 13000, "train_runtime": 126410.4816, "train_tokens_per_second": 29240.045 }, { "epoch": 0.4603201631111416, "grad_norm": 0.5859375, "learning_rate": 3.2962575101089594e-05, "loss": 0.411439323425293, "num_input_tokens_seen": 3699071680, "step": 13010, "train_runtime": 126505.8295, "train_tokens_per_second": 29240.326 }, { "epoch": 0.46067398337487037, "grad_norm": 0.58203125, "learning_rate": 3.295541446079024e-05, "loss": 0.4148221492767334, "num_input_tokens_seen": 3701891648, "step": 13020, "train_runtime": 126601.5584, "train_tokens_per_second": 29240.49 }, { "epoch": 0.46102780363859913, "grad_norm": 0.56640625, "learning_rate": 3.2948258485099336e-05, "loss": 0.41007609367370607, "num_input_tokens_seen": 3704756032, "step": 13030, "train_runtime": 126700.571, "train_tokens_per_second": 29240.247 }, { "epoch": 0.4613816239023279, "grad_norm": 0.58984375, "learning_rate": 3.29411071689547e-05, "loss": 0.41414527893066405, "num_input_tokens_seen": 3707661952, "step": 13040, "train_runtime": 126802.1024, "train_tokens_per_second": 29239.751 }, { "epoch": 0.4617354441660567, "grad_norm": 0.578125, "learning_rate": 3.2933960507301826e-05, "loss": 0.4107569694519043, "num_input_tokens_seen": 3710518912, "step": 13050, "train_runtime": 126900.7478, "train_tokens_per_second": 29239.535 }, { "epoch": 0.4620892644297855, "grad_norm": 0.6015625, "learning_rate": 3.292681849509387e-05, "loss": 0.4128089904785156, "num_input_tokens_seen": 3713319168, "step": 13060, "train_runtime": 126998.3582, "train_tokens_per_second": 29239.112 }, { "epoch": 0.46244308469351425, "grad_norm": 0.56640625, "learning_rate": 3.291968112729166e-05, "loss": 0.4093809127807617, "num_input_tokens_seen": 3716157248, "step": 13070, "train_runtime": 127095.2237, "train_tokens_per_second": 29239.157 }, { "epoch": 0.462796904957243, "grad_norm": 0.5703125, "learning_rate": 3.291254839886367e-05, "loss": 0.40978412628173827, "num_input_tokens_seen": 3718953728, "step": 13080, "train_runtime": 127192.2752, "train_tokens_per_second": 29238.833 }, { "epoch": 0.46315072522097184, "grad_norm": 0.6171875, "learning_rate": 3.2905420304785995e-05, "loss": 0.41519532203674314, "num_input_tokens_seen": 3721783488, "step": 13090, "train_runtime": 127287.9078, "train_tokens_per_second": 29239.097 }, { "epoch": 0.4635045454847006, "grad_norm": 0.57421875, "learning_rate": 3.289829684004235e-05, "loss": 0.41240777969360354, "num_input_tokens_seen": 3724641792, "step": 13100, "train_runtime": 127385.4639, "train_tokens_per_second": 29239.143 }, { "epoch": 0.46385836574842937, "grad_norm": 0.56640625, "learning_rate": 3.289117799962402e-05, "loss": 0.4131345748901367, "num_input_tokens_seen": 3727474368, "step": 13110, "train_runtime": 127481.9478, "train_tokens_per_second": 29239.233 }, { "epoch": 0.46421218601215813, "grad_norm": 0.5625, "learning_rate": 3.2884063778529914e-05, "loss": 0.40851125717163084, "num_input_tokens_seen": 3730300608, "step": 13120, "train_runtime": 127577.3435, "train_tokens_per_second": 29239.523 }, { "epoch": 0.4645660062758869, "grad_norm": 0.578125, "learning_rate": 3.28769541717665e-05, "loss": 0.41296701431274413, "num_input_tokens_seen": 3733139328, "step": 13130, "train_runtime": 127673.4702, "train_tokens_per_second": 29239.742 }, { "epoch": 0.4649198265396157, "grad_norm": 0.57421875, "learning_rate": 3.2869849174347775e-05, "loss": 0.40378413200378416, "num_input_tokens_seen": 3736004480, "step": 13140, "train_runtime": 127770.8835, "train_tokens_per_second": 29239.874 }, { "epoch": 0.4652736468033445, "grad_norm": 0.5859375, "learning_rate": 3.2862748781295294e-05, "loss": 0.4091127872467041, "num_input_tokens_seen": 3738816960, "step": 13150, "train_runtime": 127864.243, "train_tokens_per_second": 29240.52 }, { "epoch": 0.46562746706707325, "grad_norm": 0.5625, "learning_rate": 3.2855652987638146e-05, "loss": 0.41389904022216795, "num_input_tokens_seen": 3741696896, "step": 13160, "train_runtime": 127965.581, "train_tokens_per_second": 29239.87 }, { "epoch": 0.465981287330802, "grad_norm": 0.55859375, "learning_rate": 3.284856178841291e-05, "loss": 0.4076066970825195, "num_input_tokens_seen": 3744501888, "step": 13170, "train_runtime": 128059.821, "train_tokens_per_second": 29240.256 }, { "epoch": 0.46633510759453084, "grad_norm": 0.60546875, "learning_rate": 3.284147517866367e-05, "loss": 0.41181602478027346, "num_input_tokens_seen": 3747355968, "step": 13180, "train_runtime": 128158.839, "train_tokens_per_second": 29239.934 }, { "epoch": 0.4666889278582596, "grad_norm": 0.5859375, "learning_rate": 3.2834393153441976e-05, "loss": 0.4129744529724121, "num_input_tokens_seen": 3750236160, "step": 13190, "train_runtime": 128255.6865, "train_tokens_per_second": 29240.311 }, { "epoch": 0.46704274812198837, "grad_norm": 0.55078125, "learning_rate": 3.282731570780689e-05, "loss": 0.41068115234375, "num_input_tokens_seen": 3753081600, "step": 13200, "train_runtime": 128351.4484, "train_tokens_per_second": 29240.664 }, { "epoch": 0.46739656838571714, "grad_norm": 0.625, "learning_rate": 3.2820242836824875e-05, "loss": 0.41236133575439454, "num_input_tokens_seen": 3755909056, "step": 13210, "train_runtime": 128447.9644, "train_tokens_per_second": 29240.705 }, { "epoch": 0.46775038864944596, "grad_norm": 0.5859375, "learning_rate": 3.2813174535569854e-05, "loss": 0.41091275215148926, "num_input_tokens_seen": 3758709056, "step": 13220, "train_runtime": 128544.0075, "train_tokens_per_second": 29240.64 }, { "epoch": 0.4681042089131747, "grad_norm": 0.5703125, "learning_rate": 3.280611079912318e-05, "loss": 0.40787954330444337, "num_input_tokens_seen": 3761523904, "step": 13230, "train_runtime": 128638.6788, "train_tokens_per_second": 29241.002 }, { "epoch": 0.4684580291769035, "grad_norm": 0.57421875, "learning_rate": 3.279905162257358e-05, "loss": 0.4098822593688965, "num_input_tokens_seen": 3764351680, "step": 13240, "train_runtime": 128732.8753, "train_tokens_per_second": 29241.572 }, { "epoch": 0.46881184944063226, "grad_norm": 0.546875, "learning_rate": 3.279199700101723e-05, "loss": 0.4121509552001953, "num_input_tokens_seen": 3767180096, "step": 13250, "train_runtime": 128827.2957, "train_tokens_per_second": 29242.096 }, { "epoch": 0.4691656697043611, "grad_norm": 0.5703125, "learning_rate": 3.2784946929557644e-05, "loss": 0.40957231521606446, "num_input_tokens_seen": 3769964480, "step": 13260, "train_runtime": 128923.3506, "train_tokens_per_second": 29241.906 }, { "epoch": 0.46951948996808984, "grad_norm": 0.57421875, "learning_rate": 3.277790140330571e-05, "loss": 0.4122472763061523, "num_input_tokens_seen": 3772865984, "step": 13270, "train_runtime": 129022.4343, "train_tokens_per_second": 29241.938 }, { "epoch": 0.4698733102318186, "grad_norm": 0.578125, "learning_rate": 3.277086041737968e-05, "loss": 0.41433162689208985, "num_input_tokens_seen": 3775689600, "step": 13280, "train_runtime": 129116.4148, "train_tokens_per_second": 29242.522 }, { "epoch": 0.4702271304955474, "grad_norm": 0.56640625, "learning_rate": 3.276382396690513e-05, "loss": 0.4116861820220947, "num_input_tokens_seen": 3778486464, "step": 13290, "train_runtime": 129213.1758, "train_tokens_per_second": 29242.269 }, { "epoch": 0.4705809507592762, "grad_norm": 0.5703125, "learning_rate": 3.275679204701496e-05, "loss": 0.41191835403442384, "num_input_tokens_seen": 3781317632, "step": 13300, "train_runtime": 129309.344, "train_tokens_per_second": 29242.416 }, { "epoch": 0.47093477102300496, "grad_norm": 0.59765625, "learning_rate": 3.274976465284939e-05, "loss": 0.4106626510620117, "num_input_tokens_seen": 3784164480, "step": 13310, "train_runtime": 129405.5068, "train_tokens_per_second": 29242.685 }, { "epoch": 0.4712885912867337, "grad_norm": 0.58984375, "learning_rate": 3.274274177955593e-05, "loss": 0.41222991943359377, "num_input_tokens_seen": 3786995392, "step": 13320, "train_runtime": 129500.9483, "train_tokens_per_second": 29242.994 }, { "epoch": 0.4716424115504625, "grad_norm": 0.5703125, "learning_rate": 3.273572342228937e-05, "loss": 0.4107541561126709, "num_input_tokens_seen": 3789813440, "step": 13330, "train_runtime": 129596.7919, "train_tokens_per_second": 29243.112 }, { "epoch": 0.4719962318141913, "grad_norm": 0.578125, "learning_rate": 3.272870957621176e-05, "loss": 0.4079722881317139, "num_input_tokens_seen": 3792692928, "step": 13340, "train_runtime": 129694.0242, "train_tokens_per_second": 29243.39 }, { "epoch": 0.4723500520779201, "grad_norm": 0.57421875, "learning_rate": 3.2721700236492414e-05, "loss": 0.4138794898986816, "num_input_tokens_seen": 3795596096, "step": 13350, "train_runtime": 129796.9856, "train_tokens_per_second": 29242.56 }, { "epoch": 0.47270387234164885, "grad_norm": 0.57421875, "learning_rate": 3.271469539830788e-05, "loss": 0.4129480361938477, "num_input_tokens_seen": 3798444096, "step": 13360, "train_runtime": 129896.2756, "train_tokens_per_second": 29242.132 }, { "epoch": 0.4730576926053776, "grad_norm": 0.5859375, "learning_rate": 3.270769505684193e-05, "loss": 0.41733531951904296, "num_input_tokens_seen": 3801311488, "step": 13370, "train_runtime": 129995.6546, "train_tokens_per_second": 29241.835 }, { "epoch": 0.47341151286910643, "grad_norm": 0.6015625, "learning_rate": 3.2700699207285544e-05, "loss": 0.4079148292541504, "num_input_tokens_seen": 3804162368, "step": 13380, "train_runtime": 130092.3062, "train_tokens_per_second": 29242.024 }, { "epoch": 0.4737653331328352, "grad_norm": 0.58203125, "learning_rate": 3.269370784483691e-05, "loss": 0.4078085899353027, "num_input_tokens_seen": 3806985664, "step": 13390, "train_runtime": 130187.5312, "train_tokens_per_second": 29242.322 }, { "epoch": 0.47411915339656396, "grad_norm": 0.55859375, "learning_rate": 3.268672096470138e-05, "loss": 0.41168937683105467, "num_input_tokens_seen": 3809798528, "step": 13400, "train_runtime": 130282.5991, "train_tokens_per_second": 29242.574 }, { "epoch": 0.47447297366029273, "grad_norm": 0.59765625, "learning_rate": 3.2679738562091506e-05, "loss": 0.4101283073425293, "num_input_tokens_seen": 3812646720, "step": 13410, "train_runtime": 130379.5107, "train_tokens_per_second": 29242.683 }, { "epoch": 0.4748267939240215, "grad_norm": 0.58203125, "learning_rate": 3.2672760632226964e-05, "loss": 0.41565380096435545, "num_input_tokens_seen": 3815474560, "step": 13420, "train_runtime": 130478.0702, "train_tokens_per_second": 29242.267 }, { "epoch": 0.4751806141877503, "grad_norm": 0.5859375, "learning_rate": 3.266578717033458e-05, "loss": 0.4146378993988037, "num_input_tokens_seen": 3818355968, "step": 13430, "train_runtime": 130578.5243, "train_tokens_per_second": 29241.837 }, { "epoch": 0.4755344344514791, "grad_norm": 0.57421875, "learning_rate": 3.265881817164833e-05, "loss": 0.41215057373046876, "num_input_tokens_seen": 3821149376, "step": 13440, "train_runtime": 130671.1267, "train_tokens_per_second": 29242.492 }, { "epoch": 0.47588825471520785, "grad_norm": 0.59375, "learning_rate": 3.265185363140928e-05, "loss": 0.41379971504211427, "num_input_tokens_seen": 3824011584, "step": 13450, "train_runtime": 130768.656, "train_tokens_per_second": 29242.57 }, { "epoch": 0.4762420749789366, "grad_norm": 0.56640625, "learning_rate": 3.26448935448656e-05, "loss": 0.40944786071777345, "num_input_tokens_seen": 3826835904, "step": 13460, "train_runtime": 130864.3285, "train_tokens_per_second": 29242.773 }, { "epoch": 0.47659589524266543, "grad_norm": 0.5546875, "learning_rate": 3.263793790727256e-05, "loss": 0.41335458755493165, "num_input_tokens_seen": 3829707968, "step": 13470, "train_runtime": 130963.1124, "train_tokens_per_second": 29242.646 }, { "epoch": 0.4769497155063942, "grad_norm": 0.5859375, "learning_rate": 3.2630986713892495e-05, "loss": 0.4083230018615723, "num_input_tokens_seen": 3832545344, "step": 13480, "train_runtime": 131059.6954, "train_tokens_per_second": 29242.746 }, { "epoch": 0.47730353577012297, "grad_norm": 0.57421875, "learning_rate": 3.26240399599948e-05, "loss": 0.4113736152648926, "num_input_tokens_seen": 3835377728, "step": 13490, "train_runtime": 131156.8071, "train_tokens_per_second": 29242.689 }, { "epoch": 0.47765735603385173, "grad_norm": 0.59375, "learning_rate": 3.2617097640855914e-05, "loss": 0.4159392356872559, "num_input_tokens_seen": 3838192448, "step": 13500, "train_runtime": 131253.251, "train_tokens_per_second": 29242.647 }, { "epoch": 0.47801117629758055, "grad_norm": 0.58203125, "learning_rate": 3.2610159751759314e-05, "loss": 0.4103187084197998, "num_input_tokens_seen": 3841070848, "step": 13510, "train_runtime": 131352.8013, "train_tokens_per_second": 29242.398 }, { "epoch": 0.4783649965613093, "grad_norm": 0.62109375, "learning_rate": 3.26032262879955e-05, "loss": 0.41347618103027345, "num_input_tokens_seen": 3843858048, "step": 13520, "train_runtime": 131447.6004, "train_tokens_per_second": 29242.512 }, { "epoch": 0.4787188168250381, "grad_norm": 0.6015625, "learning_rate": 3.259629724486198e-05, "loss": 0.41372361183166506, "num_input_tokens_seen": 3846663040, "step": 13530, "train_runtime": 131542.9181, "train_tokens_per_second": 29242.646 }, { "epoch": 0.47907263708876685, "grad_norm": 0.56640625, "learning_rate": 3.258937261766323e-05, "loss": 0.4119584083557129, "num_input_tokens_seen": 3849578240, "step": 13540, "train_runtime": 131645.0162, "train_tokens_per_second": 29242.111 }, { "epoch": 0.47942645735249567, "grad_norm": 0.58203125, "learning_rate": 3.258245240171074e-05, "loss": 0.4128364086151123, "num_input_tokens_seen": 3852476672, "step": 13550, "train_runtime": 131744.1232, "train_tokens_per_second": 29242.114 }, { "epoch": 0.47978027761622444, "grad_norm": 0.5703125, "learning_rate": 3.2575536592322935e-05, "loss": 0.40924725532531736, "num_input_tokens_seen": 3855333952, "step": 13560, "train_runtime": 131840.7965, "train_tokens_per_second": 29242.344 }, { "epoch": 0.4801340978799532, "grad_norm": 0.5703125, "learning_rate": 3.256862518482523e-05, "loss": 0.40726399421691895, "num_input_tokens_seen": 3858135808, "step": 13570, "train_runtime": 131934.8294, "train_tokens_per_second": 29242.739 }, { "epoch": 0.48048791814368197, "grad_norm": 0.60546875, "learning_rate": 3.256171817454994e-05, "loss": 0.40947628021240234, "num_input_tokens_seen": 3860974400, "step": 13580, "train_runtime": 132031.5663, "train_tokens_per_second": 29242.813 }, { "epoch": 0.4808417384074108, "grad_norm": 0.59765625, "learning_rate": 3.255481555683633e-05, "loss": 0.41001739501953127, "num_input_tokens_seen": 3863829120, "step": 13590, "train_runtime": 132130.4133, "train_tokens_per_second": 29242.542 }, { "epoch": 0.48119555867113956, "grad_norm": 0.5703125, "learning_rate": 3.254791732703057e-05, "loss": 0.4125533580780029, "num_input_tokens_seen": 3866681408, "step": 13600, "train_runtime": 132228.978, "train_tokens_per_second": 29242.315 }, { "epoch": 0.4815493789348683, "grad_norm": 0.58984375, "learning_rate": 3.254102348048575e-05, "loss": 0.4093159675598145, "num_input_tokens_seen": 3869484160, "step": 13610, "train_runtime": 132323.7999, "train_tokens_per_second": 29242.541 }, { "epoch": 0.4819031991985971, "grad_norm": 0.546875, "learning_rate": 3.25341340125618e-05, "loss": 0.4039801597595215, "num_input_tokens_seen": 3872334656, "step": 13620, "train_runtime": 132419.413, "train_tokens_per_second": 29242.953 }, { "epoch": 0.4822570194623259, "grad_norm": 0.5703125, "learning_rate": 3.2527248918625575e-05, "loss": 0.4102001667022705, "num_input_tokens_seen": 3875176384, "step": 13630, "train_runtime": 132515.25, "train_tokens_per_second": 29243.248 }, { "epoch": 0.4826108397260547, "grad_norm": 0.58984375, "learning_rate": 3.252036819405075e-05, "loss": 0.4077859401702881, "num_input_tokens_seen": 3877983360, "step": 13640, "train_runtime": 132609.7545, "train_tokens_per_second": 29243.575 }, { "epoch": 0.48296465998978344, "grad_norm": 0.6015625, "learning_rate": 3.251349183421788e-05, "loss": 0.4132966995239258, "num_input_tokens_seen": 3880825280, "step": 13650, "train_runtime": 132706.497, "train_tokens_per_second": 29243.672 }, { "epoch": 0.4833184802535122, "grad_norm": 0.56640625, "learning_rate": 3.250661983451434e-05, "loss": 0.4122671127319336, "num_input_tokens_seen": 3883634624, "step": 13660, "train_runtime": 132800.9912, "train_tokens_per_second": 29244.018 }, { "epoch": 0.48367230051724097, "grad_norm": 0.56640625, "learning_rate": 3.2499752190334326e-05, "loss": 0.4115451812744141, "num_input_tokens_seen": 3886481728, "step": 13670, "train_runtime": 132901.8928, "train_tokens_per_second": 29243.238 }, { "epoch": 0.4840261207809698, "grad_norm": 0.55859375, "learning_rate": 3.2492888897078834e-05, "loss": 0.4136969089508057, "num_input_tokens_seen": 3889359232, "step": 13680, "train_runtime": 133000.9555, "train_tokens_per_second": 29243.092 }, { "epoch": 0.48437994104469856, "grad_norm": 0.56640625, "learning_rate": 3.248602995015567e-05, "loss": 0.4130582809448242, "num_input_tokens_seen": 3892185280, "step": 13690, "train_runtime": 133095.9976, "train_tokens_per_second": 29243.443 }, { "epoch": 0.4847337613084273, "grad_norm": 0.57421875, "learning_rate": 3.247917534497943e-05, "loss": 0.4113801956176758, "num_input_tokens_seen": 3895009856, "step": 13700, "train_runtime": 133193.6445, "train_tokens_per_second": 29243.211 }, { "epoch": 0.4850875815721561, "grad_norm": 0.578125, "learning_rate": 3.247232507697145e-05, "loss": 0.4093505859375, "num_input_tokens_seen": 3897859200, "step": 13710, "train_runtime": 133292.2116, "train_tokens_per_second": 29242.963 }, { "epoch": 0.4854414018358849, "grad_norm": 0.58984375, "learning_rate": 3.246547914155985e-05, "loss": 0.4139847278594971, "num_input_tokens_seen": 3900682816, "step": 13720, "train_runtime": 133385.5024, "train_tokens_per_second": 29243.679 }, { "epoch": 0.4857952220996137, "grad_norm": 0.578125, "learning_rate": 3.245863753417949e-05, "loss": 0.41477813720703127, "num_input_tokens_seen": 3903496256, "step": 13730, "train_runtime": 133479.3166, "train_tokens_per_second": 29244.203 }, { "epoch": 0.48614904236334244, "grad_norm": 0.57421875, "learning_rate": 3.2451800250271944e-05, "loss": 0.41378226280212405, "num_input_tokens_seen": 3906388864, "step": 13740, "train_runtime": 133580.4252, "train_tokens_per_second": 29243.722 }, { "epoch": 0.4865028626270712, "grad_norm": 0.59765625, "learning_rate": 3.244496728528553e-05, "loss": 0.41117258071899415, "num_input_tokens_seen": 3909218240, "step": 13750, "train_runtime": 133678.6029, "train_tokens_per_second": 29243.41 }, { "epoch": 0.48685668289080003, "grad_norm": 0.56640625, "learning_rate": 3.243813863467525e-05, "loss": 0.4135149002075195, "num_input_tokens_seen": 3912107584, "step": 13760, "train_runtime": 133779.1181, "train_tokens_per_second": 29243.036 }, { "epoch": 0.4872105031545288, "grad_norm": 0.56640625, "learning_rate": 3.243131429390281e-05, "loss": 0.4086174964904785, "num_input_tokens_seen": 3914896384, "step": 13770, "train_runtime": 133871.5528, "train_tokens_per_second": 29243.677 }, { "epoch": 0.48756432341825756, "grad_norm": 0.578125, "learning_rate": 3.2424494258436594e-05, "loss": 0.4061553955078125, "num_input_tokens_seen": 3917735680, "step": 13780, "train_runtime": 133970.8182, "train_tokens_per_second": 29243.202 }, { "epoch": 0.4879181436819863, "grad_norm": 0.58984375, "learning_rate": 3.241767852375166e-05, "loss": 0.4066512107849121, "num_input_tokens_seen": 3920528640, "step": 13790, "train_runtime": 134065.4083, "train_tokens_per_second": 29243.402 }, { "epoch": 0.48827196394571515, "grad_norm": 0.5703125, "learning_rate": 3.241086708532971e-05, "loss": 0.408186674118042, "num_input_tokens_seen": 3923366016, "step": 13800, "train_runtime": 134161.691, "train_tokens_per_second": 29243.564 }, { "epoch": 0.4886257842094439, "grad_norm": 0.5703125, "learning_rate": 3.24040599386591e-05, "loss": 0.41108503341674807, "num_input_tokens_seen": 3926291648, "step": 13810, "train_runtime": 134260.5433, "train_tokens_per_second": 29243.824 }, { "epoch": 0.4889796044731727, "grad_norm": 0.56640625, "learning_rate": 3.23972570792348e-05, "loss": 0.4115931510925293, "num_input_tokens_seen": 3929174336, "step": 13820, "train_runtime": 134360.2686, "train_tokens_per_second": 29243.573 }, { "epoch": 0.48933342473690145, "grad_norm": 0.625, "learning_rate": 3.239045850255842e-05, "loss": 0.4140009880065918, "num_input_tokens_seen": 3932069312, "step": 13830, "train_runtime": 134459.721, "train_tokens_per_second": 29243.474 }, { "epoch": 0.48968724500063027, "grad_norm": 0.5625, "learning_rate": 3.238366420413817e-05, "loss": 0.41455755233764646, "num_input_tokens_seen": 3934879616, "step": 13840, "train_runtime": 134553.2197, "train_tokens_per_second": 29244.039 }, { "epoch": 0.49004106526435903, "grad_norm": 0.5546875, "learning_rate": 3.237687417948882e-05, "loss": 0.411772632598877, "num_input_tokens_seen": 3937755456, "step": 13850, "train_runtime": 134650.9029, "train_tokens_per_second": 29244.182 }, { "epoch": 0.4903948855280878, "grad_norm": 0.55078125, "learning_rate": 3.2370088424131776e-05, "loss": 0.4148508071899414, "num_input_tokens_seen": 3940664064, "step": 13860, "train_runtime": 134751.9689, "train_tokens_per_second": 29243.833 }, { "epoch": 0.49074870579181656, "grad_norm": 0.58203125, "learning_rate": 3.236330693359497e-05, "loss": 0.41036348342895507, "num_input_tokens_seen": 3943483520, "step": 13870, "train_runtime": 134846.9012, "train_tokens_per_second": 29244.154 }, { "epoch": 0.4911025260555454, "grad_norm": 0.5625, "learning_rate": 3.2356529703412894e-05, "loss": 0.41105971336364744, "num_input_tokens_seen": 3946334144, "step": 13880, "train_runtime": 134944.6578, "train_tokens_per_second": 29244.093 }, { "epoch": 0.49145634631927415, "grad_norm": 0.578125, "learning_rate": 3.234975672912661e-05, "loss": 0.41156597137451173, "num_input_tokens_seen": 3949208896, "step": 13890, "train_runtime": 135042.804, "train_tokens_per_second": 29244.127 }, { "epoch": 0.4918101665830029, "grad_norm": 0.59765625, "learning_rate": 3.234298800628368e-05, "loss": 0.4125880241394043, "num_input_tokens_seen": 3952040192, "step": 13900, "train_runtime": 135139.8954, "train_tokens_per_second": 29244.067 }, { "epoch": 0.4921639868467317, "grad_norm": 0.57421875, "learning_rate": 3.2336223530438195e-05, "loss": 0.4110852241516113, "num_input_tokens_seen": 3954881216, "step": 13910, "train_runtime": 135237.2938, "train_tokens_per_second": 29244.013 }, { "epoch": 0.49251780711046045, "grad_norm": 0.57421875, "learning_rate": 3.232946329715076e-05, "loss": 0.4091800212860107, "num_input_tokens_seen": 3957707456, "step": 13920, "train_runtime": 135332.8133, "train_tokens_per_second": 29244.256 }, { "epoch": 0.49287162737418927, "grad_norm": 0.59765625, "learning_rate": 3.2322707301988456e-05, "loss": 0.4068630218505859, "num_input_tokens_seen": 3960528768, "step": 13930, "train_runtime": 135425.4095, "train_tokens_per_second": 29245.094 }, { "epoch": 0.49322544763791804, "grad_norm": 0.6015625, "learning_rate": 3.231595554052488e-05, "loss": 0.4096001148223877, "num_input_tokens_seen": 3963380224, "step": 13940, "train_runtime": 135522.603, "train_tokens_per_second": 29245.16 }, { "epoch": 0.4935792679016468, "grad_norm": 0.58984375, "learning_rate": 3.230920800834005e-05, "loss": 0.4113500118255615, "num_input_tokens_seen": 3966185728, "step": 13950, "train_runtime": 135618.7431, "train_tokens_per_second": 29245.115 }, { "epoch": 0.49393308816537557, "grad_norm": 0.59375, "learning_rate": 3.2302464701020486e-05, "loss": 0.41273021697998047, "num_input_tokens_seen": 3968997120, "step": 13960, "train_runtime": 135712.8662, "train_tokens_per_second": 29245.548 }, { "epoch": 0.4942869084291044, "grad_norm": 0.59375, "learning_rate": 3.2295725614159126e-05, "loss": 0.410627555847168, "num_input_tokens_seen": 3971827776, "step": 13970, "train_runtime": 135808.4213, "train_tokens_per_second": 29245.814 }, { "epoch": 0.49464072869283315, "grad_norm": 0.5703125, "learning_rate": 3.228899074335536e-05, "loss": 0.4088435173034668, "num_input_tokens_seen": 3974702400, "step": 13980, "train_runtime": 135910.0389, "train_tokens_per_second": 29245.098 }, { "epoch": 0.4949945489565619, "grad_norm": 0.5625, "learning_rate": 3.228226008421498e-05, "loss": 0.4095346450805664, "num_input_tokens_seen": 3977531136, "step": 13990, "train_runtime": 136005.1625, "train_tokens_per_second": 29245.442 }, { "epoch": 0.4953483692202907, "grad_norm": 0.5859375, "learning_rate": 3.2275533632350193e-05, "loss": 0.4095023155212402, "num_input_tokens_seen": 3980384000, "step": 14000, "train_runtime": 136104.1209, "train_tokens_per_second": 29245.139 }, { "epoch": 0.4957021894840195, "grad_norm": 0.62890625, "learning_rate": 3.226881138337963e-05, "loss": 0.41056323051452637, "num_input_tokens_seen": 3983229632, "step": 14010, "train_runtime": 136201.9369, "train_tokens_per_second": 29245.029 }, { "epoch": 0.49605600974774827, "grad_norm": 0.58203125, "learning_rate": 3.2262093332928256e-05, "loss": 0.40982680320739745, "num_input_tokens_seen": 3986041472, "step": 14020, "train_runtime": 136297.0031, "train_tokens_per_second": 29245.261 }, { "epoch": 0.49640983001147704, "grad_norm": 0.58203125, "learning_rate": 3.225537947662746e-05, "loss": 0.4065865516662598, "num_input_tokens_seen": 3988832896, "step": 14030, "train_runtime": 136387.8759, "train_tokens_per_second": 29246.243 }, { "epoch": 0.4967636502752058, "grad_norm": 0.59375, "learning_rate": 3.224866981011494e-05, "loss": 0.40512828826904296, "num_input_tokens_seen": 3991680640, "step": 14040, "train_runtime": 136483.1669, "train_tokens_per_second": 29246.688 }, { "epoch": 0.4971174705389346, "grad_norm": 0.5625, "learning_rate": 3.22419643290348e-05, "loss": 0.4101290225982666, "num_input_tokens_seen": 3994563456, "step": 14050, "train_runtime": 136581.2685, "train_tokens_per_second": 29246.788 }, { "epoch": 0.4974712908026634, "grad_norm": 0.5859375, "learning_rate": 3.2235263029037446e-05, "loss": 0.4105556488037109, "num_input_tokens_seen": 3997392256, "step": 14060, "train_runtime": 136680.9936, "train_tokens_per_second": 29246.146 }, { "epoch": 0.49782511106639216, "grad_norm": 0.57421875, "learning_rate": 3.222856590577962e-05, "loss": 0.411027717590332, "num_input_tokens_seen": 4000232832, "step": 14070, "train_runtime": 136777.8963, "train_tokens_per_second": 29246.194 }, { "epoch": 0.4981789313301209, "grad_norm": 0.56640625, "learning_rate": 3.222187295492436e-05, "loss": 0.4114194393157959, "num_input_tokens_seen": 4003073536, "step": 14080, "train_runtime": 136873.8234, "train_tokens_per_second": 29246.451 }, { "epoch": 0.49853275159384974, "grad_norm": 0.578125, "learning_rate": 3.221518417214104e-05, "loss": 0.41209001541137696, "num_input_tokens_seen": 4005809600, "step": 14090, "train_runtime": 136965.3394, "train_tokens_per_second": 29246.886 }, { "epoch": 0.4988865718575785, "grad_norm": 0.625, "learning_rate": 3.22084995531053e-05, "loss": 0.4022061824798584, "num_input_tokens_seen": 4008653568, "step": 14100, "train_runtime": 137063.6063, "train_tokens_per_second": 29246.666 }, { "epoch": 0.4992403921213073, "grad_norm": 0.55078125, "learning_rate": 3.220181909349907e-05, "loss": 0.40438218116760255, "num_input_tokens_seen": 4011502592, "step": 14110, "train_runtime": 137162.2486, "train_tokens_per_second": 29246.404 }, { "epoch": 0.49959421238503604, "grad_norm": 0.5859375, "learning_rate": 3.219514278901053e-05, "loss": 0.41073899269104003, "num_input_tokens_seen": 4014291200, "step": 14120, "train_runtime": 137255.7578, "train_tokens_per_second": 29246.796 }, { "epoch": 0.49994803264876486, "grad_norm": 0.5625, "learning_rate": 3.218847063533413e-05, "loss": 0.4103257656097412, "num_input_tokens_seen": 4017122112, "step": 14130, "train_runtime": 137350.9641, "train_tokens_per_second": 29247.134 }, { "epoch": 0.5003018529124936, "grad_norm": 0.6015625, "learning_rate": 3.218180262817055e-05, "loss": 0.41107468605041503, "num_input_tokens_seen": 4019970816, "step": 14140, "train_runtime": 137449.0381, "train_tokens_per_second": 29246.991 }, { "epoch": 0.5006556731762224, "grad_norm": 0.57421875, "learning_rate": 3.217513876322674e-05, "loss": 0.40564765930175783, "num_input_tokens_seen": 4022749120, "step": 14150, "train_runtime": 137544.9345, "train_tokens_per_second": 29246.799 }, { "epoch": 0.5010094934399512, "grad_norm": 0.59375, "learning_rate": 3.216847903621581e-05, "loss": 0.4059504508972168, "num_input_tokens_seen": 4025592000, "step": 14160, "train_runtime": 137641.0155, "train_tokens_per_second": 29247.038 }, { "epoch": 0.5013633137036799, "grad_norm": 0.6171875, "learning_rate": 3.216182344285713e-05, "loss": 0.4110740661621094, "num_input_tokens_seen": 4028470080, "step": 14170, "train_runtime": 137739.5368, "train_tokens_per_second": 29247.013 }, { "epoch": 0.5017171339674087, "grad_norm": 0.5703125, "learning_rate": 3.215517197887625e-05, "loss": 0.4101099014282227, "num_input_tokens_seen": 4031278400, "step": 14180, "train_runtime": 137834.806, "train_tokens_per_second": 29247.173 }, { "epoch": 0.5020709542311375, "grad_norm": 0.59765625, "learning_rate": 3.214852464000488e-05, "loss": 0.41011390686035154, "num_input_tokens_seen": 4034128192, "step": 14190, "train_runtime": 137929.6424, "train_tokens_per_second": 29247.725 }, { "epoch": 0.5024247744948663, "grad_norm": 0.6015625, "learning_rate": 3.2141881421980945e-05, "loss": 0.4089027404785156, "num_input_tokens_seen": 4036948608, "step": 14200, "train_runtime": 138025.0779, "train_tokens_per_second": 29247.936 }, { "epoch": 0.5027785947585951, "grad_norm": 0.5859375, "learning_rate": 3.213524232054851e-05, "loss": 0.4075775146484375, "num_input_tokens_seen": 4039743232, "step": 14210, "train_runtime": 138117.8362, "train_tokens_per_second": 29248.527 }, { "epoch": 0.5031324150223239, "grad_norm": 0.59765625, "learning_rate": 3.21286073314578e-05, "loss": 0.4120054244995117, "num_input_tokens_seen": 4042558016, "step": 14220, "train_runtime": 138216.1934, "train_tokens_per_second": 29248.078 }, { "epoch": 0.5034862352860526, "grad_norm": 0.6015625, "learning_rate": 3.2121976450465155e-05, "loss": 0.41195001602172854, "num_input_tokens_seen": 4045371264, "step": 14230, "train_runtime": 138310.5084, "train_tokens_per_second": 29248.474 }, { "epoch": 0.5038400555497814, "grad_norm": 0.57421875, "learning_rate": 3.211534967333308e-05, "loss": 0.40461182594299316, "num_input_tokens_seen": 4048218176, "step": 14240, "train_runtime": 138407.5156, "train_tokens_per_second": 29248.543 }, { "epoch": 0.5041938758135102, "grad_norm": 0.5703125, "learning_rate": 3.210872699583019e-05, "loss": 0.4075809955596924, "num_input_tokens_seen": 4051051456, "step": 14250, "train_runtime": 138503.7308, "train_tokens_per_second": 29248.681 }, { "epoch": 0.5045476960772389, "grad_norm": 0.5859375, "learning_rate": 3.210210841373118e-05, "loss": 0.41009230613708497, "num_input_tokens_seen": 4053911744, "step": 14260, "train_runtime": 138602.5778, "train_tokens_per_second": 29248.459 }, { "epoch": 0.5049015163409677, "grad_norm": 0.58984375, "learning_rate": 3.2095493922816855e-05, "loss": 0.4117298126220703, "num_input_tokens_seen": 4056795584, "step": 14270, "train_runtime": 138701.1285, "train_tokens_per_second": 29248.468 }, { "epoch": 0.5052553366046966, "grad_norm": 0.58203125, "learning_rate": 3.2088883518874105e-05, "loss": 0.40950603485107423, "num_input_tokens_seen": 4059580480, "step": 14280, "train_runtime": 138796.5235, "train_tokens_per_second": 29248.431 }, { "epoch": 0.5056091568684253, "grad_norm": 0.59765625, "learning_rate": 3.208227719769589e-05, "loss": 0.4050768852233887, "num_input_tokens_seen": 4062394432, "step": 14290, "train_runtime": 138892.5552, "train_tokens_per_second": 29248.468 }, { "epoch": 0.5059629771321541, "grad_norm": 0.5859375, "learning_rate": 3.207567495508124e-05, "loss": 0.40495052337646487, "num_input_tokens_seen": 4065237184, "step": 14300, "train_runtime": 138988.7476, "train_tokens_per_second": 29248.678 }, { "epoch": 0.5063167973958829, "grad_norm": 0.578125, "learning_rate": 3.2069076786835205e-05, "loss": 0.4067946434020996, "num_input_tokens_seen": 4068040320, "step": 14310, "train_runtime": 139085.0999, "train_tokens_per_second": 29248.57 }, { "epoch": 0.5066706176596116, "grad_norm": 0.57421875, "learning_rate": 3.2062482688768904e-05, "loss": 0.41307244300842283, "num_input_tokens_seen": 4070913536, "step": 14320, "train_runtime": 139185.12, "train_tokens_per_second": 29248.195 }, { "epoch": 0.5070244379233404, "grad_norm": 0.55078125, "learning_rate": 3.205589265669947e-05, "loss": 0.40561642646789553, "num_input_tokens_seen": 4073779840, "step": 14330, "train_runtime": 139283.7727, "train_tokens_per_second": 29248.058 }, { "epoch": 0.5073782581870692, "grad_norm": 0.5859375, "learning_rate": 3.204930668645005e-05, "loss": 0.4145057678222656, "num_input_tokens_seen": 4076619840, "step": 14340, "train_runtime": 139379.8003, "train_tokens_per_second": 29248.283 }, { "epoch": 0.5077320784507979, "grad_norm": 0.6015625, "learning_rate": 3.20427247738498e-05, "loss": 0.40759429931640623, "num_input_tokens_seen": 4079465216, "step": 14350, "train_runtime": 139478.8114, "train_tokens_per_second": 29247.921 }, { "epoch": 0.5080858987145268, "grad_norm": 0.625, "learning_rate": 3.2036146914733854e-05, "loss": 0.4121386528015137, "num_input_tokens_seen": 4082283904, "step": 14360, "train_runtime": 139574.8673, "train_tokens_per_second": 29247.987 }, { "epoch": 0.5084397189782556, "grad_norm": 0.578125, "learning_rate": 3.202957310494336e-05, "loss": 0.40762953758239745, "num_input_tokens_seen": 4085162240, "step": 14370, "train_runtime": 139673.3678, "train_tokens_per_second": 29247.968 }, { "epoch": 0.5087935392419843, "grad_norm": 0.55859375, "learning_rate": 3.202300334032542e-05, "loss": 0.399967360496521, "num_input_tokens_seen": 4088018432, "step": 14380, "train_runtime": 139771.0372, "train_tokens_per_second": 29247.965 }, { "epoch": 0.5091473595057131, "grad_norm": 0.5703125, "learning_rate": 3.201643761673308e-05, "loss": 0.41347856521606446, "num_input_tokens_seen": 4090857408, "step": 14390, "train_runtime": 139870.2281, "train_tokens_per_second": 29247.521 }, { "epoch": 0.5095011797694419, "grad_norm": 0.59765625, "learning_rate": 3.200987593002536e-05, "loss": 0.41163110733032227, "num_input_tokens_seen": 4093682816, "step": 14400, "train_runtime": 139966.55, "train_tokens_per_second": 29247.58 }, { "epoch": 0.5098550000331706, "grad_norm": 0.56640625, "learning_rate": 3.200331827606721e-05, "loss": 0.4086371898651123, "num_input_tokens_seen": 4096522432, "step": 14410, "train_runtime": 140064.191, "train_tokens_per_second": 29247.464 }, { "epoch": 0.5102088202968994, "grad_norm": 0.55078125, "learning_rate": 3.199676465072951e-05, "loss": 0.4037954330444336, "num_input_tokens_seen": 4099334656, "step": 14420, "train_runtime": 140159.8533, "train_tokens_per_second": 29247.567 }, { "epoch": 0.5105626405606282, "grad_norm": 0.58203125, "learning_rate": 3.1990215049889046e-05, "loss": 0.40871801376342776, "num_input_tokens_seen": 4102225472, "step": 14430, "train_runtime": 140259.7827, "train_tokens_per_second": 29247.339 }, { "epoch": 0.5109164608243569, "grad_norm": 0.56640625, "learning_rate": 3.198366946942851e-05, "loss": 0.41789684295654295, "num_input_tokens_seen": 4105131328, "step": 14440, "train_runtime": 140360.9934, "train_tokens_per_second": 29246.953 }, { "epoch": 0.5112702810880858, "grad_norm": 0.59375, "learning_rate": 3.1977127905236514e-05, "loss": 0.40943112373352053, "num_input_tokens_seen": 4107939968, "step": 14450, "train_runtime": 140455.4199, "train_tokens_per_second": 29247.287 }, { "epoch": 0.5116241013518146, "grad_norm": 0.5625, "learning_rate": 3.197059035320752e-05, "loss": 0.4104298114776611, "num_input_tokens_seen": 4110789568, "step": 14460, "train_runtime": 140554.9408, "train_tokens_per_second": 29246.852 }, { "epoch": 0.5119779216155433, "grad_norm": 0.59765625, "learning_rate": 3.196405680924189e-05, "loss": 0.40865387916564944, "num_input_tokens_seen": 4113665408, "step": 14470, "train_runtime": 140653.9388, "train_tokens_per_second": 29246.713 }, { "epoch": 0.5123317418792721, "grad_norm": 0.58984375, "learning_rate": 3.195752726924582e-05, "loss": 0.40996227264404295, "num_input_tokens_seen": 4116458560, "step": 14480, "train_runtime": 140748.8309, "train_tokens_per_second": 29246.84 }, { "epoch": 0.5126855621430009, "grad_norm": 0.578125, "learning_rate": 3.195100172913139e-05, "loss": 0.4076345443725586, "num_input_tokens_seen": 4119314880, "step": 14490, "train_runtime": 140848.2726, "train_tokens_per_second": 29246.471 }, { "epoch": 0.5130393824067296, "grad_norm": 0.55859375, "learning_rate": 3.19444801848165e-05, "loss": 0.41025753021240235, "num_input_tokens_seen": 4122162112, "step": 14500, "train_runtime": 140945.4708, "train_tokens_per_second": 29246.503 }, { "epoch": 0.5133932026704584, "grad_norm": 0.578125, "learning_rate": 3.1937962632224885e-05, "loss": 0.40854034423828123, "num_input_tokens_seen": 4125037696, "step": 14510, "train_runtime": 141045.013, "train_tokens_per_second": 29246.25 }, { "epoch": 0.5137470229341872, "grad_norm": 0.58984375, "learning_rate": 3.193144906728609e-05, "loss": 0.4043434143066406, "num_input_tokens_seen": 4127887424, "step": 14520, "train_runtime": 141140.7632, "train_tokens_per_second": 29246.6 }, { "epoch": 0.514100843197916, "grad_norm": 0.61328125, "learning_rate": 3.1924939485935494e-05, "loss": 0.4098823070526123, "num_input_tokens_seen": 4130725888, "step": 14530, "train_runtime": 141237.2549, "train_tokens_per_second": 29246.716 }, { "epoch": 0.5144546634616448, "grad_norm": 0.5859375, "learning_rate": 3.1918433884114253e-05, "loss": 0.40554037094116213, "num_input_tokens_seen": 4133562560, "step": 14540, "train_runtime": 141333.4964, "train_tokens_per_second": 29246.871 }, { "epoch": 0.5148084837253736, "grad_norm": 0.57421875, "learning_rate": 3.191193225776931e-05, "loss": 0.4158463954925537, "num_input_tokens_seen": 4136477056, "step": 14550, "train_runtime": 141435.577, "train_tokens_per_second": 29246.369 }, { "epoch": 0.5151623039891023, "grad_norm": 0.60546875, "learning_rate": 3.190543460285339e-05, "loss": 0.41065044403076173, "num_input_tokens_seen": 4139378048, "step": 14560, "train_runtime": 141538.2617, "train_tokens_per_second": 29245.647 }, { "epoch": 0.5155161242528311, "grad_norm": 0.5859375, "learning_rate": 3.189894091532499e-05, "loss": 0.41159496307373045, "num_input_tokens_seen": 4142189568, "step": 14570, "train_runtime": 141633.7955, "train_tokens_per_second": 29245.771 }, { "epoch": 0.5158699445165599, "grad_norm": 0.58203125, "learning_rate": 3.1892451191148346e-05, "loss": 0.4092118263244629, "num_input_tokens_seen": 4144996480, "step": 14580, "train_runtime": 141728.4706, "train_tokens_per_second": 29246.04 }, { "epoch": 0.5162237647802886, "grad_norm": 0.546875, "learning_rate": 3.1885965426293465e-05, "loss": 0.40863957405090334, "num_input_tokens_seen": 4147858752, "step": 14590, "train_runtime": 141828.8299, "train_tokens_per_second": 29245.526 }, { "epoch": 0.5165775850440174, "grad_norm": 0.58203125, "learning_rate": 3.187948361673606e-05, "loss": 0.4075927734375, "num_input_tokens_seen": 4150731072, "step": 14600, "train_runtime": 141929.401, "train_tokens_per_second": 29245.04 }, { "epoch": 0.5169314053077463, "grad_norm": 0.5703125, "learning_rate": 3.187300575845759e-05, "loss": 0.40454878807067873, "num_input_tokens_seen": 4153606400, "step": 14610, "train_runtime": 142030.9616, "train_tokens_per_second": 29244.373 }, { "epoch": 0.517285225571475, "grad_norm": 0.5859375, "learning_rate": 3.186653184744521e-05, "loss": 0.4053593635559082, "num_input_tokens_seen": 4156454976, "step": 14620, "train_runtime": 142132.5993, "train_tokens_per_second": 29243.502 }, { "epoch": 0.5176390458352038, "grad_norm": 0.625, "learning_rate": 3.18600618796918e-05, "loss": 0.41242570877075196, "num_input_tokens_seen": 4159297856, "step": 14630, "train_runtime": 142230.785, "train_tokens_per_second": 29243.302 }, { "epoch": 0.5179928660989326, "grad_norm": 0.57421875, "learning_rate": 3.185359585119591e-05, "loss": 0.4056413650512695, "num_input_tokens_seen": 4162070592, "step": 14640, "train_runtime": 142324.098, "train_tokens_per_second": 29243.611 }, { "epoch": 0.5183466863626613, "grad_norm": 0.58984375, "learning_rate": 3.184713375796178e-05, "loss": 0.4118755340576172, "num_input_tokens_seen": 4164963520, "step": 14650, "train_runtime": 142422.9052, "train_tokens_per_second": 29243.635 }, { "epoch": 0.5187005066263901, "grad_norm": 0.5390625, "learning_rate": 3.1840675595999344e-05, "loss": 0.4097257614135742, "num_input_tokens_seen": 4167799616, "step": 14660, "train_runtime": 142518.8997, "train_tokens_per_second": 29243.838 }, { "epoch": 0.5190543268901189, "grad_norm": 0.6015625, "learning_rate": 3.1834221361324155e-05, "loss": 0.41007165908813475, "num_input_tokens_seen": 4170638912, "step": 14670, "train_runtime": 142617.3679, "train_tokens_per_second": 29243.555 }, { "epoch": 0.5194081471538476, "grad_norm": 0.59375, "learning_rate": 3.182777104995744e-05, "loss": 0.4110051155090332, "num_input_tokens_seen": 4173507968, "step": 14680, "train_runtime": 142717.7805, "train_tokens_per_second": 29243.083 }, { "epoch": 0.5197619674175764, "grad_norm": 0.59375, "learning_rate": 3.182132465792609e-05, "loss": 0.40939817428588865, "num_input_tokens_seen": 4176281024, "step": 14690, "train_runtime": 142811.6736, "train_tokens_per_second": 29243.275 }, { "epoch": 0.5201157876813053, "grad_norm": 0.578125, "learning_rate": 3.181488218126259e-05, "loss": 0.4063596248626709, "num_input_tokens_seen": 4179121664, "step": 14700, "train_runtime": 142907.8813, "train_tokens_per_second": 29243.465 }, { "epoch": 0.520469607945034, "grad_norm": 0.57421875, "learning_rate": 3.180844361600506e-05, "loss": 0.4110249519348145, "num_input_tokens_seen": 4181968960, "step": 14710, "train_runtime": 143006.6258, "train_tokens_per_second": 29243.183 }, { "epoch": 0.5208234282087628, "grad_norm": 0.58984375, "learning_rate": 3.180200895819722e-05, "loss": 0.4097727298736572, "num_input_tokens_seen": 4184813760, "step": 14720, "train_runtime": 143106.4397, "train_tokens_per_second": 29242.666 }, { "epoch": 0.5211772484724916, "grad_norm": 0.58203125, "learning_rate": 3.1795578203888424e-05, "loss": 0.4089636325836182, "num_input_tokens_seen": 4187652480, "step": 14730, "train_runtime": 143201.8451, "train_tokens_per_second": 29243.006 }, { "epoch": 0.5215310687362203, "grad_norm": 0.609375, "learning_rate": 3.178915134913357e-05, "loss": 0.41102914810180663, "num_input_tokens_seen": 4190458368, "step": 14740, "train_runtime": 143297.8271, "train_tokens_per_second": 29243.0 }, { "epoch": 0.5218848889999491, "grad_norm": 0.5703125, "learning_rate": 3.178272838999316e-05, "loss": 0.4113306999206543, "num_input_tokens_seen": 4193264512, "step": 14750, "train_runtime": 143389.8787, "train_tokens_per_second": 29243.797 }, { "epoch": 0.5222387092636779, "grad_norm": 0.56640625, "learning_rate": 3.1776309322533274e-05, "loss": 0.4112546920776367, "num_input_tokens_seen": 4196158144, "step": 14760, "train_runtime": 143490.1834, "train_tokens_per_second": 29243.521 }, { "epoch": 0.5225925295274066, "grad_norm": 0.5859375, "learning_rate": 3.1769894142825536e-05, "loss": 0.4107497692108154, "num_input_tokens_seen": 4199005248, "step": 14770, "train_runtime": 143587.3436, "train_tokens_per_second": 29243.561 }, { "epoch": 0.5229463497911355, "grad_norm": 0.5859375, "learning_rate": 3.176348284694712e-05, "loss": 0.4052229881286621, "num_input_tokens_seen": 4201899904, "step": 14780, "train_runtime": 143685.1884, "train_tokens_per_second": 29243.793 }, { "epoch": 0.5233001700548643, "grad_norm": 0.57421875, "learning_rate": 3.175707543098075e-05, "loss": 0.40373902320861815, "num_input_tokens_seen": 4204755200, "step": 14790, "train_runtime": 143782.1135, "train_tokens_per_second": 29243.938 }, { "epoch": 0.523653990318593, "grad_norm": 0.57421875, "learning_rate": 3.1750671891014653e-05, "loss": 0.40833053588867185, "num_input_tokens_seen": 4207601856, "step": 14800, "train_runtime": 143877.7732, "train_tokens_per_second": 29244.28 }, { "epoch": 0.5240078105823218, "grad_norm": 0.57421875, "learning_rate": 3.174427222314262e-05, "loss": 0.4086447715759277, "num_input_tokens_seen": 4210502592, "step": 14810, "train_runtime": 143981.1024, "train_tokens_per_second": 29243.439 }, { "epoch": 0.5243616308460506, "grad_norm": 0.5546875, "learning_rate": 3.173787642346391e-05, "loss": 0.4065539360046387, "num_input_tokens_seen": 4213360320, "step": 14820, "train_runtime": 144078.8601, "train_tokens_per_second": 29243.432 }, { "epoch": 0.5247154511097794, "grad_norm": 0.59375, "learning_rate": 3.173148448808331e-05, "loss": 0.410731840133667, "num_input_tokens_seen": 4216256576, "step": 14830, "train_runtime": 144180.9939, "train_tokens_per_second": 29242.804 }, { "epoch": 0.5250692713735081, "grad_norm": 0.57421875, "learning_rate": 3.172509641311107e-05, "loss": 0.40764832496643066, "num_input_tokens_seen": 4219089728, "step": 14840, "train_runtime": 144277.4233, "train_tokens_per_second": 29242.896 }, { "epoch": 0.5254230916372369, "grad_norm": 0.578125, "learning_rate": 3.171871219466293e-05, "loss": 0.40964713096618655, "num_input_tokens_seen": 4221922816, "step": 14850, "train_runtime": 144375.7912, "train_tokens_per_second": 29242.595 }, { "epoch": 0.5257769119009658, "grad_norm": 0.5625, "learning_rate": 3.171233182886011e-05, "loss": 0.4118339061737061, "num_input_tokens_seen": 4224739520, "step": 14860, "train_runtime": 144470.1022, "train_tokens_per_second": 29243.002 }, { "epoch": 0.5261307321646945, "grad_norm": 0.56640625, "learning_rate": 3.170595531182928e-05, "loss": 0.407607889175415, "num_input_tokens_seen": 4227567616, "step": 14870, "train_runtime": 144565.6976, "train_tokens_per_second": 29243.228 }, { "epoch": 0.5264845524284233, "grad_norm": 0.59375, "learning_rate": 3.169958263970256e-05, "loss": 0.40597219467163087, "num_input_tokens_seen": 4230410944, "step": 14880, "train_runtime": 144662.352, "train_tokens_per_second": 29243.344 }, { "epoch": 0.5268383726921521, "grad_norm": 0.5703125, "learning_rate": 3.169321380861751e-05, "loss": 0.4079143524169922, "num_input_tokens_seen": 4233268416, "step": 14890, "train_runtime": 144760.6959, "train_tokens_per_second": 29243.217 }, { "epoch": 0.5271921929558808, "grad_norm": 0.5859375, "learning_rate": 3.168684881471711e-05, "loss": 0.4101587772369385, "num_input_tokens_seen": 4236136320, "step": 14900, "train_runtime": 144857.6424, "train_tokens_per_second": 29243.444 }, { "epoch": 0.5275460132196096, "grad_norm": 0.62109375, "learning_rate": 3.168048765414979e-05, "loss": 0.4105274200439453, "num_input_tokens_seen": 4238955776, "step": 14910, "train_runtime": 144954.1543, "train_tokens_per_second": 29243.424 }, { "epoch": 0.5278998334833384, "grad_norm": 0.59375, "learning_rate": 3.167413032306936e-05, "loss": 0.4076228618621826, "num_input_tokens_seen": 4241815808, "step": 14920, "train_runtime": 145050.2879, "train_tokens_per_second": 29243.76 }, { "epoch": 0.5282536537470671, "grad_norm": 0.578125, "learning_rate": 3.166777681763504e-05, "loss": 0.40525283813476565, "num_input_tokens_seen": 4244648448, "step": 14930, "train_runtime": 145146.8466, "train_tokens_per_second": 29243.821 }, { "epoch": 0.5286074740107959, "grad_norm": 0.58203125, "learning_rate": 3.166142713401144e-05, "loss": 0.4055943012237549, "num_input_tokens_seen": 4247458240, "step": 14940, "train_runtime": 145240.4891, "train_tokens_per_second": 29244.312 }, { "epoch": 0.5289612942745248, "grad_norm": 0.5625, "learning_rate": 3.165508126836857e-05, "loss": 0.4043453216552734, "num_input_tokens_seen": 4250291904, "step": 14950, "train_runtime": 145337.6913, "train_tokens_per_second": 29244.251 }, { "epoch": 0.5293151145382535, "grad_norm": 0.578125, "learning_rate": 3.164873921688177e-05, "loss": 0.41163172721862795, "num_input_tokens_seen": 4253113856, "step": 14960, "train_runtime": 145433.5779, "train_tokens_per_second": 29244.373 }, { "epoch": 0.5296689348019823, "grad_norm": 0.578125, "learning_rate": 3.164240097573178e-05, "loss": 0.4109938621520996, "num_input_tokens_seen": 4255949760, "step": 14970, "train_runtime": 145530.143, "train_tokens_per_second": 29244.455 }, { "epoch": 0.5300227550657111, "grad_norm": 0.5703125, "learning_rate": 3.163606654110467e-05, "loss": 0.40595426559448244, "num_input_tokens_seen": 4258822784, "step": 14980, "train_runtime": 145627.5212, "train_tokens_per_second": 29244.629 }, { "epoch": 0.5303765753294398, "grad_norm": 0.59375, "learning_rate": 3.162973590919187e-05, "loss": 0.4095478057861328, "num_input_tokens_seen": 4261609088, "step": 14990, "train_runtime": 145721.3922, "train_tokens_per_second": 29244.911 }, { "epoch": 0.5307303955931686, "grad_norm": 0.59375, "learning_rate": 3.162340907619012e-05, "loss": 0.40476217269897463, "num_input_tokens_seen": 4264439296, "step": 15000, "train_runtime": 145818.6201, "train_tokens_per_second": 29244.82 }, { "epoch": 0.5307303955931686, "eval_loss": 0.34381818771362305, "eval_runtime": 8.4257, "eval_samples_per_second": 473.311, "eval_steps_per_second": 3.798, "num_input_tokens_seen": 4264439296, "step": 15000 }, { "epoch": 0.5310842158568974, "grad_norm": 0.58984375, "learning_rate": 3.1617086038301516e-05, "loss": 0.4106022834777832, "num_input_tokens_seen": 4267301248, "step": 15010, "train_runtime": 145944.9471, "train_tokens_per_second": 29239.116 }, { "epoch": 0.5314380361206261, "grad_norm": 0.5703125, "learning_rate": 3.161076679173344e-05, "loss": 0.4102076530456543, "num_input_tokens_seen": 4270196416, "step": 15020, "train_runtime": 146044.743, "train_tokens_per_second": 29238.96 }, { "epoch": 0.531791856384355, "grad_norm": 0.59375, "learning_rate": 3.1604451332698575e-05, "loss": 0.4098836898803711, "num_input_tokens_seen": 4273007872, "step": 15030, "train_runtime": 146140.9001, "train_tokens_per_second": 29238.96 }, { "epoch": 0.5321456766480838, "grad_norm": 0.55859375, "learning_rate": 3.1598139657414923e-05, "loss": 0.40800275802612307, "num_input_tokens_seen": 4275906944, "step": 15040, "train_runtime": 146240.8114, "train_tokens_per_second": 29238.808 }, { "epoch": 0.5324994969118125, "grad_norm": 0.5625, "learning_rate": 3.159183176210574e-05, "loss": 0.4073368549346924, "num_input_tokens_seen": 4278740224, "step": 15050, "train_runtime": 146337.165, "train_tokens_per_second": 29238.917 }, { "epoch": 0.5328533171755413, "grad_norm": 0.6015625, "learning_rate": 3.1585527642999595e-05, "loss": 0.40842494964599607, "num_input_tokens_seen": 4281597824, "step": 15060, "train_runtime": 146434.478, "train_tokens_per_second": 29239.001 }, { "epoch": 0.5332071374392701, "grad_norm": 0.5703125, "learning_rate": 3.1579227296330294e-05, "loss": 0.40888800621032717, "num_input_tokens_seen": 4284404224, "step": 15070, "train_runtime": 146528.0021, "train_tokens_per_second": 29239.491 }, { "epoch": 0.5335609577029988, "grad_norm": 0.59765625, "learning_rate": 3.157293071833691e-05, "loss": 0.4051984786987305, "num_input_tokens_seen": 4287281280, "step": 15080, "train_runtime": 146626.0914, "train_tokens_per_second": 29239.552 }, { "epoch": 0.5339147779667276, "grad_norm": 0.6015625, "learning_rate": 3.156663790526375e-05, "loss": 0.413372278213501, "num_input_tokens_seen": 4290095232, "step": 15090, "train_runtime": 146719.6428, "train_tokens_per_second": 29240.088 }, { "epoch": 0.5342685982304564, "grad_norm": 0.5859375, "learning_rate": 3.156034885336039e-05, "loss": 0.4108406066894531, "num_input_tokens_seen": 4292953728, "step": 15100, "train_runtime": 146817.6716, "train_tokens_per_second": 29240.034 }, { "epoch": 0.5346224184941852, "grad_norm": 0.578125, "learning_rate": 3.155406355888161e-05, "loss": 0.40769710540771487, "num_input_tokens_seen": 4295809728, "step": 15110, "train_runtime": 146913.9085, "train_tokens_per_second": 29240.32 }, { "epoch": 0.534976238757914, "grad_norm": 0.59765625, "learning_rate": 3.1547782018087407e-05, "loss": 0.4042551517486572, "num_input_tokens_seen": 4298643584, "step": 15120, "train_runtime": 147011.0033, "train_tokens_per_second": 29240.285 }, { "epoch": 0.5353300590216428, "grad_norm": 0.55859375, "learning_rate": 3.154150422724299e-05, "loss": 0.40447430610656737, "num_input_tokens_seen": 4301509632, "step": 15130, "train_runtime": 147107.9939, "train_tokens_per_second": 29240.489 }, { "epoch": 0.5356838792853715, "grad_norm": 0.5703125, "learning_rate": 3.1535230182618783e-05, "loss": 0.40934176445007325, "num_input_tokens_seen": 4304355904, "step": 15140, "train_runtime": 147206.5555, "train_tokens_per_second": 29240.246 }, { "epoch": 0.5360376995491003, "grad_norm": 0.5546875, "learning_rate": 3.1528959880490387e-05, "loss": 0.4078420639038086, "num_input_tokens_seen": 4307218112, "step": 15150, "train_runtime": 147302.447, "train_tokens_per_second": 29240.642 }, { "epoch": 0.5363915198128291, "grad_norm": 0.5859375, "learning_rate": 3.152269331713859e-05, "loss": 0.4117298126220703, "num_input_tokens_seen": 4310026432, "step": 15160, "train_runtime": 147396.719, "train_tokens_per_second": 29240.993 }, { "epoch": 0.5367453400765578, "grad_norm": 0.5859375, "learning_rate": 3.151643048884935e-05, "loss": 0.41078572273254393, "num_input_tokens_seen": 4312905856, "step": 15170, "train_runtime": 147495.3044, "train_tokens_per_second": 29240.971 }, { "epoch": 0.5370991603402866, "grad_norm": 0.57421875, "learning_rate": 3.151017139191379e-05, "loss": 0.40717620849609376, "num_input_tokens_seen": 4315747840, "step": 15180, "train_runtime": 147595.5559, "train_tokens_per_second": 29240.364 }, { "epoch": 0.5374529806040154, "grad_norm": 0.58984375, "learning_rate": 3.150391602262818e-05, "loss": 0.4082365036010742, "num_input_tokens_seen": 4318558848, "step": 15190, "train_runtime": 147690.608, "train_tokens_per_second": 29240.579 }, { "epoch": 0.5378068008677442, "grad_norm": 0.58984375, "learning_rate": 3.149766437729394e-05, "loss": 0.40818538665771487, "num_input_tokens_seen": 4321412352, "step": 15200, "train_runtime": 147788.9902, "train_tokens_per_second": 29240.421 }, { "epoch": 0.538160621131473, "grad_norm": 0.58203125, "learning_rate": 3.1491416452217635e-05, "loss": 0.40845422744750975, "num_input_tokens_seen": 4324212544, "step": 15210, "train_runtime": 147883.0146, "train_tokens_per_second": 29240.765 }, { "epoch": 0.5385144413952018, "grad_norm": 0.546875, "learning_rate": 3.1485172243710954e-05, "loss": 0.40653200149536134, "num_input_tokens_seen": 4327046656, "step": 15220, "train_runtime": 147980.5588, "train_tokens_per_second": 29240.643 }, { "epoch": 0.5388682616589305, "grad_norm": 0.6015625, "learning_rate": 3.1478931748090676e-05, "loss": 0.4043598651885986, "num_input_tokens_seen": 4329853184, "step": 15230, "train_runtime": 148078.8799, "train_tokens_per_second": 29240.181 }, { "epoch": 0.5392220819226593, "grad_norm": 0.57421875, "learning_rate": 3.147269496167873e-05, "loss": 0.4014836311340332, "num_input_tokens_seen": 4332705792, "step": 15240, "train_runtime": 148177.291, "train_tokens_per_second": 29240.012 }, { "epoch": 0.5395759021863881, "grad_norm": 0.55859375, "learning_rate": 3.1466461880802105e-05, "loss": 0.40896382331848147, "num_input_tokens_seen": 4335562112, "step": 15250, "train_runtime": 148277.6878, "train_tokens_per_second": 29239.477 }, { "epoch": 0.5399297224501168, "grad_norm": 0.60546875, "learning_rate": 3.146023250179291e-05, "loss": 0.40951175689697267, "num_input_tokens_seen": 4338357376, "step": 15260, "train_runtime": 148372.5633, "train_tokens_per_second": 29239.62 }, { "epoch": 0.5402835427138456, "grad_norm": 0.58984375, "learning_rate": 3.145400682098833e-05, "loss": 0.4083584785461426, "num_input_tokens_seen": 4341228736, "step": 15270, "train_runtime": 148471.5553, "train_tokens_per_second": 29239.464 }, { "epoch": 0.5406373629775745, "grad_norm": 0.58984375, "learning_rate": 3.14477848347306e-05, "loss": 0.41114239692687987, "num_input_tokens_seen": 4344086976, "step": 15280, "train_runtime": 148569.1998, "train_tokens_per_second": 29239.486 }, { "epoch": 0.5409911832413032, "grad_norm": 0.59765625, "learning_rate": 3.144156653936703e-05, "loss": 0.4104591369628906, "num_input_tokens_seen": 4346898432, "step": 15290, "train_runtime": 148665.1077, "train_tokens_per_second": 29239.534 }, { "epoch": 0.541345003505032, "grad_norm": 0.59765625, "learning_rate": 3.1435351931250004e-05, "loss": 0.4089348316192627, "num_input_tokens_seen": 4349809920, "step": 15300, "train_runtime": 148768.2098, "train_tokens_per_second": 29238.84 }, { "epoch": 0.5416988237687608, "grad_norm": 0.5703125, "learning_rate": 3.142914100673692e-05, "loss": 0.4111007213592529, "num_input_tokens_seen": 4352621696, "step": 15310, "train_runtime": 148864.2382, "train_tokens_per_second": 29238.867 }, { "epoch": 0.5420526440324895, "grad_norm": 0.60546875, "learning_rate": 3.1422933762190235e-05, "loss": 0.40802755355834963, "num_input_tokens_seen": 4355470784, "step": 15320, "train_runtime": 148958.4792, "train_tokens_per_second": 29239.496 }, { "epoch": 0.5424064642962183, "grad_norm": 0.59765625, "learning_rate": 3.141673019397741e-05, "loss": 0.4092949390411377, "num_input_tokens_seen": 4358257216, "step": 15330, "train_runtime": 149051.4551, "train_tokens_per_second": 29239.951 }, { "epoch": 0.5427602845599471, "grad_norm": 0.578125, "learning_rate": 3.141053029847095e-05, "loss": 0.41081724166870115, "num_input_tokens_seen": 4361099712, "step": 15340, "train_runtime": 149148.5095, "train_tokens_per_second": 29239.982 }, { "epoch": 0.5431141048236758, "grad_norm": 0.58984375, "learning_rate": 3.140433407204835e-05, "loss": 0.40682077407836914, "num_input_tokens_seen": 4363925120, "step": 15350, "train_runtime": 149244.112, "train_tokens_per_second": 29240.183 }, { "epoch": 0.5434679250874047, "grad_norm": 0.578125, "learning_rate": 3.1398141511092124e-05, "loss": 0.41036109924316405, "num_input_tokens_seen": 4366730752, "step": 15360, "train_runtime": 149340.7947, "train_tokens_per_second": 29240.04 }, { "epoch": 0.5438217453511335, "grad_norm": 0.6015625, "learning_rate": 3.1391952611989736e-05, "loss": 0.4084867000579834, "num_input_tokens_seen": 4369636992, "step": 15370, "train_runtime": 149441.2993, "train_tokens_per_second": 29239.822 }, { "epoch": 0.5441755656148622, "grad_norm": 0.578125, "learning_rate": 3.138576737113369e-05, "loss": 0.4052896499633789, "num_input_tokens_seen": 4372542848, "step": 15380, "train_runtime": 149542.9996, "train_tokens_per_second": 29239.368 }, { "epoch": 0.544529385878591, "grad_norm": 0.59375, "learning_rate": 3.137958578492143e-05, "loss": 0.4081061363220215, "num_input_tokens_seen": 4375380224, "step": 15390, "train_runtime": 149640.1772, "train_tokens_per_second": 29239.341 }, { "epoch": 0.5448832061423198, "grad_norm": 0.5859375, "learning_rate": 3.137340784975535e-05, "loss": 0.407871150970459, "num_input_tokens_seen": 4378217408, "step": 15400, "train_runtime": 149734.0024, "train_tokens_per_second": 29239.968 }, { "epoch": 0.5452370264060485, "grad_norm": 0.61328125, "learning_rate": 3.136723356204285e-05, "loss": 0.40992279052734376, "num_input_tokens_seen": 4381097920, "step": 15410, "train_runtime": 149833.0925, "train_tokens_per_second": 29239.855 }, { "epoch": 0.5455908466697773, "grad_norm": 0.59375, "learning_rate": 3.136106291819622e-05, "loss": 0.40654382705688474, "num_input_tokens_seen": 4383983232, "step": 15420, "train_runtime": 149931.5595, "train_tokens_per_second": 29239.896 }, { "epoch": 0.5459446669335061, "grad_norm": 0.57421875, "learning_rate": 3.1354895914632736e-05, "loss": 0.4045723915100098, "num_input_tokens_seen": 4386808896, "step": 15430, "train_runtime": 150027.3028, "train_tokens_per_second": 29240.07 }, { "epoch": 0.546298487197235, "grad_norm": 0.58203125, "learning_rate": 3.1348732547774575e-05, "loss": 0.40632143020629885, "num_input_tokens_seen": 4389618368, "step": 15440, "train_runtime": 150118.6873, "train_tokens_per_second": 29240.986 }, { "epoch": 0.5466523074609637, "grad_norm": 0.5859375, "learning_rate": 3.134257281404883e-05, "loss": 0.41364545822143556, "num_input_tokens_seen": 4392389376, "step": 15450, "train_runtime": 150211.8433, "train_tokens_per_second": 29241.299 }, { "epoch": 0.5470061277246925, "grad_norm": 0.58984375, "learning_rate": 3.133641670988755e-05, "loss": 0.412398099899292, "num_input_tokens_seen": 4395211200, "step": 15460, "train_runtime": 150310.1197, "train_tokens_per_second": 29240.953 }, { "epoch": 0.5473599479884212, "grad_norm": 0.55859375, "learning_rate": 3.133026423172764e-05, "loss": 0.40074882507324217, "num_input_tokens_seen": 4398042880, "step": 15470, "train_runtime": 150406.5636, "train_tokens_per_second": 29241.03 }, { "epoch": 0.54771376825215, "grad_norm": 0.58203125, "learning_rate": 3.1324115376010897e-05, "loss": 0.4076112747192383, "num_input_tokens_seen": 4400883648, "step": 15480, "train_runtime": 150503.8433, "train_tokens_per_second": 29241.005 }, { "epoch": 0.5480675885158788, "grad_norm": 0.5859375, "learning_rate": 3.131797013918406e-05, "loss": 0.40844311714172366, "num_input_tokens_seen": 4403774336, "step": 15490, "train_runtime": 150603.816, "train_tokens_per_second": 29240.789 }, { "epoch": 0.5484214087796075, "grad_norm": 0.58203125, "learning_rate": 3.13118285176987e-05, "loss": 0.4066895008087158, "num_input_tokens_seen": 4406650432, "step": 15500, "train_runtime": 150705.3559, "train_tokens_per_second": 29240.171 }, { "epoch": 0.5487752290433363, "grad_norm": 0.578125, "learning_rate": 3.130569050801126e-05, "loss": 0.40573415756225584, "num_input_tokens_seen": 4409492992, "step": 15510, "train_runtime": 150807.5935, "train_tokens_per_second": 29239.197 }, { "epoch": 0.5491290493070651, "grad_norm": 0.57421875, "learning_rate": 3.129955610658306e-05, "loss": 0.4061446666717529, "num_input_tokens_seen": 4412328704, "step": 15520, "train_runtime": 150904.5021, "train_tokens_per_second": 29239.212 }, { "epoch": 0.549482869570794, "grad_norm": 0.6015625, "learning_rate": 3.129342530988025e-05, "loss": 0.4072696685791016, "num_input_tokens_seen": 4415215616, "step": 15530, "train_runtime": 151004.4551, "train_tokens_per_second": 29238.976 }, { "epoch": 0.5498366898345227, "grad_norm": 0.57421875, "learning_rate": 3.128729811437385e-05, "loss": 0.40645294189453124, "num_input_tokens_seen": 4418009344, "step": 15540, "train_runtime": 151097.3916, "train_tokens_per_second": 29239.481 }, { "epoch": 0.5501905100982515, "grad_norm": 0.56640625, "learning_rate": 3.12811745165397e-05, "loss": 0.4098991870880127, "num_input_tokens_seen": 4420809344, "step": 15550, "train_runtime": 151192.8314, "train_tokens_per_second": 29239.543 }, { "epoch": 0.5505443303619802, "grad_norm": 0.59375, "learning_rate": 3.127505451285846e-05, "loss": 0.4075554370880127, "num_input_tokens_seen": 4423656192, "step": 15560, "train_runtime": 151288.49, "train_tokens_per_second": 29239.873 }, { "epoch": 0.550898150625709, "grad_norm": 0.6015625, "learning_rate": 3.126893809981563e-05, "loss": 0.40610518455505373, "num_input_tokens_seen": 4426493120, "step": 15570, "train_runtime": 151384.0837, "train_tokens_per_second": 29240.149 }, { "epoch": 0.5512519708894378, "grad_norm": 0.5859375, "learning_rate": 3.126282527390149e-05, "loss": 0.4054409503936768, "num_input_tokens_seen": 4429351104, "step": 15580, "train_runtime": 151481.963, "train_tokens_per_second": 29240.122 }, { "epoch": 0.5516057911531665, "grad_norm": 0.56640625, "learning_rate": 3.1256716031611146e-05, "loss": 0.4078982353210449, "num_input_tokens_seen": 4432209088, "step": 15590, "train_runtime": 151580.8035, "train_tokens_per_second": 29239.91 }, { "epoch": 0.5519596114168953, "grad_norm": 0.6015625, "learning_rate": 3.1250610369444475e-05, "loss": 0.40864033699035646, "num_input_tokens_seen": 4435005440, "step": 15600, "train_runtime": 151675.0443, "train_tokens_per_second": 29240.179 }, { "epoch": 0.5523134316806242, "grad_norm": 0.58203125, "learning_rate": 3.124450828390616e-05, "loss": 0.4037106990814209, "num_input_tokens_seen": 4437808960, "step": 15610, "train_runtime": 151769.0708, "train_tokens_per_second": 29240.536 }, { "epoch": 0.552667251944353, "grad_norm": 0.59375, "learning_rate": 3.123840977150566e-05, "loss": 0.40448718070983886, "num_input_tokens_seen": 4440682112, "step": 15620, "train_runtime": 151867.4481, "train_tokens_per_second": 29240.513 }, { "epoch": 0.5530210722080817, "grad_norm": 0.59375, "learning_rate": 3.123231482875717e-05, "loss": 0.41243600845336914, "num_input_tokens_seen": 4443432064, "step": 15630, "train_runtime": 151960.5821, "train_tokens_per_second": 29240.689 }, { "epoch": 0.5533748924718105, "grad_norm": 0.58203125, "learning_rate": 3.122622345217967e-05, "loss": 0.4055476665496826, "num_input_tokens_seen": 4446262656, "step": 15640, "train_runtime": 152056.0163, "train_tokens_per_second": 29240.952 }, { "epoch": 0.5537287127355393, "grad_norm": 0.58203125, "learning_rate": 3.12201356382969e-05, "loss": 0.40500941276550295, "num_input_tokens_seen": 4449059968, "step": 15650, "train_runtime": 152148.725, "train_tokens_per_second": 29241.52 }, { "epoch": 0.554082532999268, "grad_norm": 0.5703125, "learning_rate": 3.1214051383637304e-05, "loss": 0.40358848571777345, "num_input_tokens_seen": 4451883072, "step": 15660, "train_runtime": 152245.8642, "train_tokens_per_second": 29241.406 }, { "epoch": 0.5544363532629968, "grad_norm": 0.6015625, "learning_rate": 3.1207970684734104e-05, "loss": 0.4064045429229736, "num_input_tokens_seen": 4454731648, "step": 15670, "train_runtime": 152344.2155, "train_tokens_per_second": 29241.226 }, { "epoch": 0.5547901735267255, "grad_norm": 0.60546875, "learning_rate": 3.120189353812521e-05, "loss": 0.40747699737548826, "num_input_tokens_seen": 4457504576, "step": 15680, "train_runtime": 152438.5674, "train_tokens_per_second": 29241.318 }, { "epoch": 0.5551439937904544, "grad_norm": 0.62890625, "learning_rate": 3.1195819940353294e-05, "loss": 0.40999584197998046, "num_input_tokens_seen": 4460403072, "step": 15690, "train_runtime": 152539.1046, "train_tokens_per_second": 29241.047 }, { "epoch": 0.5554978140541832, "grad_norm": 0.578125, "learning_rate": 3.1189749887965684e-05, "loss": 0.40561342239379883, "num_input_tokens_seen": 4463253248, "step": 15700, "train_runtime": 152636.0665, "train_tokens_per_second": 29241.144 }, { "epoch": 0.555851634317912, "grad_norm": 0.58984375, "learning_rate": 3.118368337751443e-05, "loss": 0.40368070602416994, "num_input_tokens_seen": 4466122112, "step": 15710, "train_runtime": 152734.2963, "train_tokens_per_second": 29241.121 }, { "epoch": 0.5562054545816407, "grad_norm": 0.59765625, "learning_rate": 3.1177620405556305e-05, "loss": 0.4062944412231445, "num_input_tokens_seen": 4468945472, "step": 15720, "train_runtime": 152827.5742, "train_tokens_per_second": 29241.748 }, { "epoch": 0.5565592748453695, "grad_norm": 0.58984375, "learning_rate": 3.117156096865272e-05, "loss": 0.40369558334350586, "num_input_tokens_seen": 4471820544, "step": 15730, "train_runtime": 152924.9119, "train_tokens_per_second": 29241.936 }, { "epoch": 0.5569130951090983, "grad_norm": 0.578125, "learning_rate": 3.116550506336979e-05, "loss": 0.4079303741455078, "num_input_tokens_seen": 4474630848, "step": 15740, "train_runtime": 153018.6344, "train_tokens_per_second": 29242.392 }, { "epoch": 0.557266915372827, "grad_norm": 0.5859375, "learning_rate": 3.11594526862783e-05, "loss": 0.4047048568725586, "num_input_tokens_seen": 4477449344, "step": 15750, "train_runtime": 153115.5054, "train_tokens_per_second": 29242.299 }, { "epoch": 0.5576207356365558, "grad_norm": 0.58203125, "learning_rate": 3.115340383395367e-05, "loss": 0.4134345054626465, "num_input_tokens_seen": 4480296448, "step": 15760, "train_runtime": 153212.7903, "train_tokens_per_second": 29242.314 }, { "epoch": 0.5579745559002846, "grad_norm": 0.6015625, "learning_rate": 3.1147358502975995e-05, "loss": 0.40609130859375, "num_input_tokens_seen": 4483132544, "step": 15770, "train_runtime": 153307.6213, "train_tokens_per_second": 29242.725 }, { "epoch": 0.5583283761640134, "grad_norm": 0.59375, "learning_rate": 3.114131668993e-05, "loss": 0.4067939281463623, "num_input_tokens_seen": 4486022528, "step": 15780, "train_runtime": 153409.0957, "train_tokens_per_second": 29242.22 }, { "epoch": 0.5586821964277422, "grad_norm": 0.55859375, "learning_rate": 3.113527839140507e-05, "loss": 0.40735297203063964, "num_input_tokens_seen": 4488831680, "step": 15790, "train_runtime": 153503.6308, "train_tokens_per_second": 29242.511 }, { "epoch": 0.559036016691471, "grad_norm": 0.5703125, "learning_rate": 3.112924360399517e-05, "loss": 0.40956878662109375, "num_input_tokens_seen": 4491701632, "step": 15800, "train_runtime": 153599.6774, "train_tokens_per_second": 29242.911 }, { "epoch": 0.5593898369551997, "grad_norm": 0.5703125, "learning_rate": 3.112321232429894e-05, "loss": 0.4095731735229492, "num_input_tokens_seen": 4494555328, "step": 15810, "train_runtime": 153698.6024, "train_tokens_per_second": 29242.656 }, { "epoch": 0.5597436572189285, "grad_norm": 0.57421875, "learning_rate": 3.11171845489196e-05, "loss": 0.4067424774169922, "num_input_tokens_seen": 4497396288, "step": 15820, "train_runtime": 153798.361, "train_tokens_per_second": 29242.16 }, { "epoch": 0.5600974774826573, "grad_norm": 0.58203125, "learning_rate": 3.1111160274464965e-05, "loss": 0.4107954025268555, "num_input_tokens_seen": 4500270336, "step": 15830, "train_runtime": 153895.5166, "train_tokens_per_second": 29242.375 }, { "epoch": 0.560451297746386, "grad_norm": 0.578125, "learning_rate": 3.1105139497547466e-05, "loss": 0.409916353225708, "num_input_tokens_seen": 4503136000, "step": 15840, "train_runtime": 153993.901, "train_tokens_per_second": 29242.301 }, { "epoch": 0.5608051180101148, "grad_norm": 0.57421875, "learning_rate": 3.109912221478411e-05, "loss": 0.40704822540283203, "num_input_tokens_seen": 4505967552, "step": 15850, "train_runtime": 154086.6973, "train_tokens_per_second": 29243.067 }, { "epoch": 0.5611589382738437, "grad_norm": 0.5859375, "learning_rate": 3.10931084227965e-05, "loss": 0.4107632637023926, "num_input_tokens_seen": 4508822272, "step": 15860, "train_runtime": 154185.1504, "train_tokens_per_second": 29242.909 }, { "epoch": 0.5615127585375724, "grad_norm": 0.578125, "learning_rate": 3.108709811821079e-05, "loss": 0.4064638137817383, "num_input_tokens_seen": 4511687872, "step": 15870, "train_runtime": 154280.9361, "train_tokens_per_second": 29243.327 }, { "epoch": 0.5618665788013012, "grad_norm": 0.59765625, "learning_rate": 3.1081091297657696e-05, "loss": 0.4065570831298828, "num_input_tokens_seen": 4514513728, "step": 15880, "train_runtime": 154376.883, "train_tokens_per_second": 29243.457 }, { "epoch": 0.56222039906503, "grad_norm": 0.55078125, "learning_rate": 3.107508795777251e-05, "loss": 0.40776753425598145, "num_input_tokens_seen": 4517418432, "step": 15890, "train_runtime": 154477.0895, "train_tokens_per_second": 29243.291 }, { "epoch": 0.5625742193287587, "grad_norm": 0.578125, "learning_rate": 3.1069088095195056e-05, "loss": 0.4102058410644531, "num_input_tokens_seen": 4520242240, "step": 15900, "train_runtime": 154573.3451, "train_tokens_per_second": 29243.349 }, { "epoch": 0.5629280395924875, "grad_norm": 0.6015625, "learning_rate": 3.1063091706569703e-05, "loss": 0.4087839126586914, "num_input_tokens_seen": 4523114112, "step": 15910, "train_runtime": 154673.2742, "train_tokens_per_second": 29243.023 }, { "epoch": 0.5632818598562163, "grad_norm": 0.60546875, "learning_rate": 3.105709878854535e-05, "loss": 0.4062658309936523, "num_input_tokens_seen": 4525934080, "step": 15920, "train_runtime": 154767.094, "train_tokens_per_second": 29243.517 }, { "epoch": 0.563635680119945, "grad_norm": 0.5703125, "learning_rate": 3.105110933777541e-05, "loss": 0.4077878475189209, "num_input_tokens_seen": 4528804608, "step": 15930, "train_runtime": 154866.661, "train_tokens_per_second": 29243.251 }, { "epoch": 0.5639895003836739, "grad_norm": 0.57421875, "learning_rate": 3.104512335091783e-05, "loss": 0.4015920162200928, "num_input_tokens_seen": 4531621824, "step": 15940, "train_runtime": 154962.2198, "train_tokens_per_second": 29243.398 }, { "epoch": 0.5643433206474027, "grad_norm": 0.55859375, "learning_rate": 3.1039140824635074e-05, "loss": 0.40623836517333983, "num_input_tokens_seen": 4534456960, "step": 15950, "train_runtime": 155057.8415, "train_tokens_per_second": 29243.648 }, { "epoch": 0.5646971409111314, "grad_norm": 0.55859375, "learning_rate": 3.103316175559406e-05, "loss": 0.4080641746520996, "num_input_tokens_seen": 4537251712, "step": 15960, "train_runtime": 155149.6821, "train_tokens_per_second": 29244.351 }, { "epoch": 0.5650509611748602, "grad_norm": 0.5546875, "learning_rate": 3.102718614046624e-05, "loss": 0.4091509819030762, "num_input_tokens_seen": 4540102528, "step": 15970, "train_runtime": 155248.8883, "train_tokens_per_second": 29244.026 }, { "epoch": 0.565404781438589, "grad_norm": 0.59375, "learning_rate": 3.1021213975927546e-05, "loss": 0.40813302993774414, "num_input_tokens_seen": 4542922176, "step": 15980, "train_runtime": 155344.8838, "train_tokens_per_second": 29244.106 }, { "epoch": 0.5657586017023177, "grad_norm": 0.59765625, "learning_rate": 3.1015245258658374e-05, "loss": 0.40922961235046384, "num_input_tokens_seen": 4545801856, "step": 15990, "train_runtime": 155444.3212, "train_tokens_per_second": 29243.924 }, { "epoch": 0.5661124219660465, "grad_norm": 0.58203125, "learning_rate": 3.1009279985343606e-05, "loss": 0.40422806739807127, "num_input_tokens_seen": 4548607936, "step": 16000, "train_runtime": 155538.0153, "train_tokens_per_second": 29244.349 }, { "epoch": 0.5664662422297753, "grad_norm": 0.5859375, "learning_rate": 3.100331815267255e-05, "loss": 0.4057432174682617, "num_input_tokens_seen": 4551433344, "step": 16010, "train_runtime": 155634.0775, "train_tokens_per_second": 29244.452 }, { "epoch": 0.566820062493504, "grad_norm": 0.62109375, "learning_rate": 3.099735975733902e-05, "loss": 0.40664067268371584, "num_input_tokens_seen": 4554319296, "step": 16020, "train_runtime": 155733.7403, "train_tokens_per_second": 29244.268 }, { "epoch": 0.5671738827572329, "grad_norm": 0.5859375, "learning_rate": 3.099140479604123e-05, "loss": 0.4142652988433838, "num_input_tokens_seen": 4557161024, "step": 16030, "train_runtime": 155830.9316, "train_tokens_per_second": 29244.265 }, { "epoch": 0.5675277030209617, "grad_norm": 0.58984375, "learning_rate": 3.098545326548186e-05, "loss": 0.4083212375640869, "num_input_tokens_seen": 4559967424, "step": 16040, "train_runtime": 155927.8103, "train_tokens_per_second": 29244.093 }, { "epoch": 0.5678815232846904, "grad_norm": 0.59765625, "learning_rate": 3.0979505162368014e-05, "loss": 0.406848669052124, "num_input_tokens_seen": 4562896704, "step": 16050, "train_runtime": 156031.1765, "train_tokens_per_second": 29243.494 }, { "epoch": 0.5682353435484192, "grad_norm": 0.56640625, "learning_rate": 3.097356048341121e-05, "loss": 0.4030649185180664, "num_input_tokens_seen": 4565749120, "step": 16060, "train_runtime": 156129.3172, "train_tokens_per_second": 29243.381 }, { "epoch": 0.568589163812148, "grad_norm": 0.578125, "learning_rate": 3.0967619225327396e-05, "loss": 0.4107643127441406, "num_input_tokens_seen": 4568584384, "step": 16070, "train_runtime": 156224.5034, "train_tokens_per_second": 29243.712 }, { "epoch": 0.5689429840758767, "grad_norm": 0.57421875, "learning_rate": 3.0961681384836924e-05, "loss": 0.40882062911987305, "num_input_tokens_seen": 4571418688, "step": 16080, "train_runtime": 156318.6348, "train_tokens_per_second": 29244.234 }, { "epoch": 0.5692968043396055, "grad_norm": 0.58203125, "learning_rate": 3.095574695866453e-05, "loss": 0.40875973701477053, "num_input_tokens_seen": 4574281664, "step": 16090, "train_runtime": 156416.8914, "train_tokens_per_second": 29244.167 }, { "epoch": 0.5696506246033343, "grad_norm": 0.578125, "learning_rate": 3.0949815943539355e-05, "loss": 0.4070535659790039, "num_input_tokens_seen": 4577187776, "step": 16100, "train_runtime": 156518.9301, "train_tokens_per_second": 29243.669 }, { "epoch": 0.5700044448670631, "grad_norm": 0.5625, "learning_rate": 3.094388833619495e-05, "loss": 0.40699381828308107, "num_input_tokens_seen": 4580032448, "step": 16110, "train_runtime": 156614.3319, "train_tokens_per_second": 29244.019 }, { "epoch": 0.5703582651307919, "grad_norm": 0.61328125, "learning_rate": 3.0937964133369196e-05, "loss": 0.40806264877319337, "num_input_tokens_seen": 4582878016, "step": 16120, "train_runtime": 156712.1107, "train_tokens_per_second": 29243.93 }, { "epoch": 0.5707120853945207, "grad_norm": 0.6015625, "learning_rate": 3.093204333180437e-05, "loss": 0.41038851737976073, "num_input_tokens_seen": 4585753088, "step": 16130, "train_runtime": 156809.9067, "train_tokens_per_second": 29244.027 }, { "epoch": 0.5710659056582494, "grad_norm": 0.58984375, "learning_rate": 3.0926125928247114e-05, "loss": 0.40847148895263674, "num_input_tokens_seen": 4588563328, "step": 16140, "train_runtime": 156902.3511, "train_tokens_per_second": 29244.707 }, { "epoch": 0.5714197259219782, "grad_norm": 0.58984375, "learning_rate": 3.092021191944842e-05, "loss": 0.4050747394561768, "num_input_tokens_seen": 4591463744, "step": 16150, "train_runtime": 157001.6358, "train_tokens_per_second": 29244.687 }, { "epoch": 0.571773546185707, "grad_norm": 0.609375, "learning_rate": 3.091430130216363e-05, "loss": 0.4123250961303711, "num_input_tokens_seen": 4594273024, "step": 16160, "train_runtime": 157097.8519, "train_tokens_per_second": 29244.658 }, { "epoch": 0.5721273664494357, "grad_norm": 0.578125, "learning_rate": 3.090839407315242e-05, "loss": 0.40061559677124026, "num_input_tokens_seen": 4597126080, "step": 16170, "train_runtime": 157196.9559, "train_tokens_per_second": 29244.371 }, { "epoch": 0.5724811867131645, "grad_norm": 0.57421875, "learning_rate": 3.0902490229178794e-05, "loss": 0.4055177688598633, "num_input_tokens_seen": 4600000640, "step": 16180, "train_runtime": 157294.2613, "train_tokens_per_second": 29244.555 }, { "epoch": 0.5728350069768934, "grad_norm": 0.5859375, "learning_rate": 3.0896589767011104e-05, "loss": 0.4096518039703369, "num_input_tokens_seen": 4602910592, "step": 16190, "train_runtime": 157396.7767, "train_tokens_per_second": 29243.995 }, { "epoch": 0.5731888272406221, "grad_norm": 0.56640625, "learning_rate": 3.0890692683421985e-05, "loss": 0.40958428382873535, "num_input_tokens_seen": 4605728704, "step": 16200, "train_runtime": 157493.9156, "train_tokens_per_second": 29243.852 }, { "epoch": 0.5735426475043509, "grad_norm": 0.578125, "learning_rate": 3.088479897518843e-05, "loss": 0.4066947937011719, "num_input_tokens_seen": 4608575232, "step": 16210, "train_runtime": 157593.0509, "train_tokens_per_second": 29243.518 }, { "epoch": 0.5738964677680797, "grad_norm": 0.58203125, "learning_rate": 3.087890863909168e-05, "loss": 0.4038949966430664, "num_input_tokens_seen": 4611442048, "step": 16220, "train_runtime": 157691.8594, "train_tokens_per_second": 29243.374 }, { "epoch": 0.5742502880318084, "grad_norm": 0.58203125, "learning_rate": 3.087302167191732e-05, "loss": 0.40948991775512694, "num_input_tokens_seen": 4614256512, "step": 16230, "train_runtime": 157786.625, "train_tokens_per_second": 29243.648 }, { "epoch": 0.5746041082955372, "grad_norm": 0.58203125, "learning_rate": 3.086713807045518e-05, "loss": 0.4068491458892822, "num_input_tokens_seen": 4617124736, "step": 16240, "train_runtime": 157883.9649, "train_tokens_per_second": 29243.785 }, { "epoch": 0.574957928559266, "grad_norm": 0.5703125, "learning_rate": 3.086125783149941e-05, "loss": 0.41111011505126954, "num_input_tokens_seen": 4620004160, "step": 16250, "train_runtime": 157985.0436, "train_tokens_per_second": 29243.301 }, { "epoch": 0.5753117488229947, "grad_norm": 0.58984375, "learning_rate": 3.0855380951848404e-05, "loss": 0.4075753688812256, "num_input_tokens_seen": 4622785792, "step": 16260, "train_runtime": 158077.5438, "train_tokens_per_second": 29243.786 }, { "epoch": 0.5756655690867235, "grad_norm": 0.5546875, "learning_rate": 3.084950742830484e-05, "loss": 0.40226335525512696, "num_input_tokens_seen": 4625604160, "step": 16270, "train_runtime": 158172.6473, "train_tokens_per_second": 29244.021 }, { "epoch": 0.5760193893504524, "grad_norm": 0.60546875, "learning_rate": 3.0843637257675654e-05, "loss": 0.40446810722351073, "num_input_tokens_seen": 4628437632, "step": 16280, "train_runtime": 158269.7433, "train_tokens_per_second": 29243.983 }, { "epoch": 0.5763732096141811, "grad_norm": 0.56640625, "learning_rate": 3.083777043677202e-05, "loss": 0.4045380115509033, "num_input_tokens_seen": 4631296000, "step": 16290, "train_runtime": 158370.1772, "train_tokens_per_second": 29243.486 }, { "epoch": 0.5767270298779099, "grad_norm": 0.5859375, "learning_rate": 3.083190696240936e-05, "loss": 0.4096792221069336, "num_input_tokens_seen": 4634136512, "step": 16300, "train_runtime": 158467.3551, "train_tokens_per_second": 29243.477 }, { "epoch": 0.5770808501416387, "grad_norm": 0.59765625, "learning_rate": 3.082604683140735e-05, "loss": 0.4100943565368652, "num_input_tokens_seen": 4636912320, "step": 16310, "train_runtime": 158560.5634, "train_tokens_per_second": 29243.793 }, { "epoch": 0.5774346704053674, "grad_norm": 0.58984375, "learning_rate": 3.082019004058987e-05, "loss": 0.4057792663574219, "num_input_tokens_seen": 4639789184, "step": 16320, "train_runtime": 158658.9235, "train_tokens_per_second": 29243.796 }, { "epoch": 0.5777884906690962, "grad_norm": 0.6171875, "learning_rate": 3.081433658678505e-05, "loss": 0.4112861156463623, "num_input_tokens_seen": 4642627456, "step": 16330, "train_runtime": 158758.137, "train_tokens_per_second": 29243.398 }, { "epoch": 0.578142310932825, "grad_norm": 0.61328125, "learning_rate": 3.080848646682521e-05, "loss": 0.40722041130065917, "num_input_tokens_seen": 4645507840, "step": 16340, "train_runtime": 158858.0436, "train_tokens_per_second": 29243.139 }, { "epoch": 0.5784961311965537, "grad_norm": 0.59765625, "learning_rate": 3.080263967754689e-05, "loss": 0.4033486366271973, "num_input_tokens_seen": 4648344960, "step": 16350, "train_runtime": 158953.8647, "train_tokens_per_second": 29243.359 }, { "epoch": 0.5788499514602826, "grad_norm": 0.59375, "learning_rate": 3.079679621579083e-05, "loss": 0.40462641716003417, "num_input_tokens_seen": 4651201088, "step": 16360, "train_runtime": 159049.4858, "train_tokens_per_second": 29243.735 }, { "epoch": 0.5792037717240114, "grad_norm": 0.5703125, "learning_rate": 3.079095607840197e-05, "loss": 0.41025028228759763, "num_input_tokens_seen": 4654067008, "step": 16370, "train_runtime": 159147.6383, "train_tokens_per_second": 29243.708 }, { "epoch": 0.5795575919877402, "grad_norm": 0.55859375, "learning_rate": 3.0785119262229416e-05, "loss": 0.4053900718688965, "num_input_tokens_seen": 4656871680, "step": 16380, "train_runtime": 159240.7007, "train_tokens_per_second": 29244.23 }, { "epoch": 0.5799114122514689, "grad_norm": 0.58984375, "learning_rate": 3.0779285764126485e-05, "loss": 0.4062835693359375, "num_input_tokens_seen": 4659745472, "step": 16390, "train_runtime": 159337.1469, "train_tokens_per_second": 29244.565 }, { "epoch": 0.5802652325151977, "grad_norm": 0.60546875, "learning_rate": 3.077345558095064e-05, "loss": 0.40163383483886717, "num_input_tokens_seen": 4662502656, "step": 16400, "train_runtime": 159426.5931, "train_tokens_per_second": 29245.451 }, { "epoch": 0.5806190527789264, "grad_norm": 0.5625, "learning_rate": 3.076762870956352e-05, "loss": 0.4057318687438965, "num_input_tokens_seen": 4665291584, "step": 16410, "train_runtime": 159522.1971, "train_tokens_per_second": 29245.407 }, { "epoch": 0.5809728730426552, "grad_norm": 0.6015625, "learning_rate": 3.076180514683092e-05, "loss": 0.4051515579223633, "num_input_tokens_seen": 4668126080, "step": 16420, "train_runtime": 159620.6695, "train_tokens_per_second": 29245.123 }, { "epoch": 0.581326693306384, "grad_norm": 0.60546875, "learning_rate": 3.075598488962278e-05, "loss": 0.4090378761291504, "num_input_tokens_seen": 4670958656, "step": 16430, "train_runtime": 159718.0407, "train_tokens_per_second": 29245.029 }, { "epoch": 0.5816805135701129, "grad_norm": 0.56640625, "learning_rate": 3.0750167934813207e-05, "loss": 0.4114226341247559, "num_input_tokens_seen": 4673823552, "step": 16440, "train_runtime": 159818.5283, "train_tokens_per_second": 29244.566 }, { "epoch": 0.5820343338338416, "grad_norm": 0.5859375, "learning_rate": 3.074435427928041e-05, "loss": 0.41299262046813967, "num_input_tokens_seen": 4676659520, "step": 16450, "train_runtime": 159915.0739, "train_tokens_per_second": 29244.645 }, { "epoch": 0.5823881540975704, "grad_norm": 0.5703125, "learning_rate": 3.073854391990675e-05, "loss": 0.40126829147338866, "num_input_tokens_seen": 4679561536, "step": 16460, "train_runtime": 160014.074, "train_tokens_per_second": 29244.687 }, { "epoch": 0.5827419743612992, "grad_norm": 0.55859375, "learning_rate": 3.073273685357871e-05, "loss": 0.40436415672302245, "num_input_tokens_seen": 4682363072, "step": 16470, "train_runtime": 160108.2698, "train_tokens_per_second": 29244.98 }, { "epoch": 0.5830957946250279, "grad_norm": 0.59765625, "learning_rate": 3.072693307718689e-05, "loss": 0.405302095413208, "num_input_tokens_seen": 4685215616, "step": 16480, "train_runtime": 160206.4422, "train_tokens_per_second": 29244.864 }, { "epoch": 0.5834496148887567, "grad_norm": 0.57421875, "learning_rate": 3.0721132587626e-05, "loss": 0.40462818145751955, "num_input_tokens_seen": 4687993344, "step": 16490, "train_runtime": 160298.7025, "train_tokens_per_second": 29245.361 }, { "epoch": 0.5838034351524855, "grad_norm": 0.59765625, "learning_rate": 3.071533538179482e-05, "loss": 0.4112078666687012, "num_input_tokens_seen": 4690838592, "step": 16500, "train_runtime": 160397.6336, "train_tokens_per_second": 29245.061 }, { "epoch": 0.5841572554162142, "grad_norm": 0.58984375, "learning_rate": 3.070954145659627e-05, "loss": 0.4079756259918213, "num_input_tokens_seen": 4693651456, "step": 16510, "train_runtime": 160492.3953, "train_tokens_per_second": 29245.32 }, { "epoch": 0.584511075679943, "grad_norm": 0.59765625, "learning_rate": 3.070375080893734e-05, "loss": 0.40964694023132325, "num_input_tokens_seen": 4696469440, "step": 16520, "train_runtime": 160584.6252, "train_tokens_per_second": 29246.072 }, { "epoch": 0.5848648959436719, "grad_norm": 0.56640625, "learning_rate": 3.06979634357291e-05, "loss": 0.40720019340515134, "num_input_tokens_seen": 4699296576, "step": 16530, "train_runtime": 160680.6172, "train_tokens_per_second": 29246.194 }, { "epoch": 0.5852187162074006, "grad_norm": 0.5546875, "learning_rate": 3.0692179333886686e-05, "loss": 0.4105440616607666, "num_input_tokens_seen": 4702138112, "step": 16540, "train_runtime": 160775.2258, "train_tokens_per_second": 29246.658 }, { "epoch": 0.5855725364711294, "grad_norm": 0.59765625, "learning_rate": 3.068639850032933e-05, "loss": 0.4070134162902832, "num_input_tokens_seen": 4705041280, "step": 16550, "train_runtime": 160876.327, "train_tokens_per_second": 29246.325 }, { "epoch": 0.5859263567348582, "grad_norm": 0.60546875, "learning_rate": 3.068062093198028e-05, "loss": 0.4061460494995117, "num_input_tokens_seen": 4707861184, "step": 16560, "train_runtime": 160973.0119, "train_tokens_per_second": 29246.276 }, { "epoch": 0.5862801769985869, "grad_norm": 0.578125, "learning_rate": 3.067484662576687e-05, "loss": 0.40291948318481446, "num_input_tokens_seen": 4710654208, "step": 16570, "train_runtime": 161066.8239, "train_tokens_per_second": 29246.583 }, { "epoch": 0.5866339972623157, "grad_norm": 0.609375, "learning_rate": 3.066907557862048e-05, "loss": 0.4098064422607422, "num_input_tokens_seen": 4713473728, "step": 16580, "train_runtime": 161163.9221, "train_tokens_per_second": 29246.457 }, { "epoch": 0.5869878175260445, "grad_norm": 0.57421875, "learning_rate": 3.066330778747651e-05, "loss": 0.40730891227722166, "num_input_tokens_seen": 4716275520, "step": 16590, "train_runtime": 161260.1269, "train_tokens_per_second": 29246.384 }, { "epoch": 0.5873416377897732, "grad_norm": 0.5859375, "learning_rate": 3.065754324927441e-05, "loss": 0.4051215171813965, "num_input_tokens_seen": 4719098112, "step": 16600, "train_runtime": 161357.3136, "train_tokens_per_second": 29246.261 }, { "epoch": 0.5876954580535021, "grad_norm": 0.609375, "learning_rate": 3.065178196095765e-05, "loss": 0.4059257984161377, "num_input_tokens_seen": 4721976000, "step": 16610, "train_runtime": 161455.859, "train_tokens_per_second": 29246.235 }, { "epoch": 0.5880492783172309, "grad_norm": 0.59765625, "learning_rate": 3.064602391947372e-05, "loss": 0.4054714679718018, "num_input_tokens_seen": 4724850880, "step": 16620, "train_runtime": 161554.8902, "train_tokens_per_second": 29246.103 }, { "epoch": 0.5884030985809596, "grad_norm": 0.58203125, "learning_rate": 3.0640269121774126e-05, "loss": 0.408254337310791, "num_input_tokens_seen": 4727732864, "step": 16630, "train_runtime": 161654.6644, "train_tokens_per_second": 29245.88 }, { "epoch": 0.5887569188446884, "grad_norm": 0.56640625, "learning_rate": 3.063451756481437e-05, "loss": 0.40446019172668457, "num_input_tokens_seen": 4730596480, "step": 16640, "train_runtime": 161753.4678, "train_tokens_per_second": 29245.719 }, { "epoch": 0.5891107391084172, "grad_norm": 0.6015625, "learning_rate": 3.062876924555396e-05, "loss": 0.4072012424468994, "num_input_tokens_seen": 4733436416, "step": 16650, "train_runtime": 161849.1676, "train_tokens_per_second": 29245.973 }, { "epoch": 0.5894645593721459, "grad_norm": 0.55859375, "learning_rate": 3.06230241609564e-05, "loss": 0.4029825210571289, "num_input_tokens_seen": 4736315712, "step": 16660, "train_runtime": 161947.6385, "train_tokens_per_second": 29245.97 }, { "epoch": 0.5898183796358747, "grad_norm": 0.61328125, "learning_rate": 3.061728230798916e-05, "loss": 0.40367813110351564, "num_input_tokens_seen": 4739207104, "step": 16670, "train_runtime": 162046.978, "train_tokens_per_second": 29245.884 }, { "epoch": 0.5901721998996035, "grad_norm": 0.60546875, "learning_rate": 3.061154368362373e-05, "loss": 0.4094395160675049, "num_input_tokens_seen": 4742024256, "step": 16680, "train_runtime": 162143.9247, "train_tokens_per_second": 29245.772 }, { "epoch": 0.5905260201633323, "grad_norm": 0.60546875, "learning_rate": 3.060580828483552e-05, "loss": 0.40355796813964845, "num_input_tokens_seen": 4744898496, "step": 16690, "train_runtime": 162243.197, "train_tokens_per_second": 29245.593 }, { "epoch": 0.5908798404270611, "grad_norm": 0.57421875, "learning_rate": 3.060007610860395e-05, "loss": 0.40567693710327146, "num_input_tokens_seen": 4747769280, "step": 16700, "train_runtime": 162340.5111, "train_tokens_per_second": 29245.746 }, { "epoch": 0.5912336606907899, "grad_norm": 0.59765625, "learning_rate": 3.059434715191236e-05, "loss": 0.4064697265625, "num_input_tokens_seen": 4750639936, "step": 16710, "train_runtime": 162439.2238, "train_tokens_per_second": 29245.645 }, { "epoch": 0.5915874809545186, "grad_norm": 0.60546875, "learning_rate": 3.0588621411748074e-05, "loss": 0.40702223777770996, "num_input_tokens_seen": 4753437632, "step": 16720, "train_runtime": 162531.1817, "train_tokens_per_second": 29246.312 }, { "epoch": 0.5919413012182474, "grad_norm": 0.60546875, "learning_rate": 3.0582898885102344e-05, "loss": 0.40258302688598635, "num_input_tokens_seen": 4756237120, "step": 16730, "train_runtime": 162622.4518, "train_tokens_per_second": 29247.112 }, { "epoch": 0.5922951214819762, "grad_norm": 0.5625, "learning_rate": 3.0577179568970366e-05, "loss": 0.4069647789001465, "num_input_tokens_seen": 4759045184, "step": 16740, "train_runtime": 162717.7168, "train_tokens_per_second": 29247.247 }, { "epoch": 0.5926489417457049, "grad_norm": 0.58984375, "learning_rate": 3.057146346035127e-05, "loss": 0.4019571304321289, "num_input_tokens_seen": 4761911616, "step": 16750, "train_runtime": 162815.3619, "train_tokens_per_second": 29247.312 }, { "epoch": 0.5930027620094337, "grad_norm": 0.59765625, "learning_rate": 3.056575055624811e-05, "loss": 0.40976428985595703, "num_input_tokens_seen": 4764743872, "step": 16760, "train_runtime": 162910.0742, "train_tokens_per_second": 29247.693 }, { "epoch": 0.5933565822731625, "grad_norm": 0.59375, "learning_rate": 3.0560040853667846e-05, "loss": 0.4099114418029785, "num_input_tokens_seen": 4767652416, "step": 16770, "train_runtime": 163014.603, "train_tokens_per_second": 29246.781 }, { "epoch": 0.5937104025368913, "grad_norm": 0.546875, "learning_rate": 3.0554334349621366e-05, "loss": 0.4050790786743164, "num_input_tokens_seen": 4770495296, "step": 16780, "train_runtime": 163112.1303, "train_tokens_per_second": 29246.723 }, { "epoch": 0.5940642228006201, "grad_norm": 0.5703125, "learning_rate": 3.054863104112347e-05, "loss": 0.40823917388916015, "num_input_tokens_seen": 4773229056, "step": 16790, "train_runtime": 163205.5212, "train_tokens_per_second": 29246.738 }, { "epoch": 0.5944180430643489, "grad_norm": 0.59375, "learning_rate": 3.0542930925192835e-05, "loss": 0.4047149658203125, "num_input_tokens_seen": 4776024960, "step": 16800, "train_runtime": 163298.5874, "train_tokens_per_second": 29247.191 }, { "epoch": 0.5947718633280776, "grad_norm": 0.5859375, "learning_rate": 3.053723399885205e-05, "loss": 0.4045846939086914, "num_input_tokens_seen": 4778855936, "step": 16810, "train_runtime": 163396.5845, "train_tokens_per_second": 29246.976 }, { "epoch": 0.5951256835918064, "grad_norm": 0.5625, "learning_rate": 3.0531540259127565e-05, "loss": 0.40632429122924807, "num_input_tokens_seen": 4781725888, "step": 16820, "train_runtime": 163493.8354, "train_tokens_per_second": 29247.133 }, { "epoch": 0.5954795038555352, "grad_norm": 0.58203125, "learning_rate": 3.052584970304976e-05, "loss": 0.408148193359375, "num_input_tokens_seen": 4784632384, "step": 16830, "train_runtime": 163595.339, "train_tokens_per_second": 29246.752 }, { "epoch": 0.5958333241192639, "grad_norm": 0.5703125, "learning_rate": 3.052016232765282e-05, "loss": 0.40592541694641116, "num_input_tokens_seen": 4787526400, "step": 16840, "train_runtime": 163696.1586, "train_tokens_per_second": 29246.419 }, { "epoch": 0.5961871443829927, "grad_norm": 0.59375, "learning_rate": 3.0514478129974845e-05, "loss": 0.40691165924072265, "num_input_tokens_seen": 4790408000, "step": 16850, "train_runtime": 163796.9337, "train_tokens_per_second": 29246.018 }, { "epoch": 0.5965409646467216, "grad_norm": 0.56640625, "learning_rate": 3.0508797107057785e-05, "loss": 0.4074373245239258, "num_input_tokens_seen": 4793291904, "step": 16860, "train_runtime": 163895.0921, "train_tokens_per_second": 29246.098 }, { "epoch": 0.5968947849104503, "grad_norm": 0.5859375, "learning_rate": 3.0503119255947432e-05, "loss": 0.4037750244140625, "num_input_tokens_seen": 4796120448, "step": 16870, "train_runtime": 163992.541, "train_tokens_per_second": 29245.967 }, { "epoch": 0.5972486051741791, "grad_norm": 0.5625, "learning_rate": 3.049744457369344e-05, "loss": 0.4029093742370605, "num_input_tokens_seen": 4798935680, "step": 16880, "train_runtime": 164090.1179, "train_tokens_per_second": 29245.732 }, { "epoch": 0.5976024254379079, "grad_norm": 0.58984375, "learning_rate": 3.049177305734929e-05, "loss": 0.40402708053588865, "num_input_tokens_seen": 4801809088, "step": 16890, "train_runtime": 164191.0366, "train_tokens_per_second": 29245.257 }, { "epoch": 0.5979562457016366, "grad_norm": 0.6015625, "learning_rate": 3.04861047039723e-05, "loss": 0.4065730571746826, "num_input_tokens_seen": 4804642752, "step": 16900, "train_runtime": 164287.1698, "train_tokens_per_second": 29245.392 }, { "epoch": 0.5983100659653654, "grad_norm": 0.59765625, "learning_rate": 3.0480439510623638e-05, "loss": 0.40772428512573244, "num_input_tokens_seen": 4807497472, "step": 16910, "train_runtime": 164383.2461, "train_tokens_per_second": 29245.666 }, { "epoch": 0.5986638862290942, "grad_norm": 0.578125, "learning_rate": 3.0474777474368255e-05, "loss": 0.4077460289001465, "num_input_tokens_seen": 4810281792, "step": 16920, "train_runtime": 164474.8734, "train_tokens_per_second": 29246.302 }, { "epoch": 0.5990177064928229, "grad_norm": 0.5859375, "learning_rate": 3.046911859227495e-05, "loss": 0.4049734592437744, "num_input_tokens_seen": 4813188032, "step": 16930, "train_runtime": 164572.3697, "train_tokens_per_second": 29246.635 }, { "epoch": 0.5993715267565518, "grad_norm": 0.62109375, "learning_rate": 3.0463462861416302e-05, "loss": 0.40674467086791993, "num_input_tokens_seen": 4816004416, "step": 16940, "train_runtime": 164668.1867, "train_tokens_per_second": 29246.72 }, { "epoch": 0.5997253470202806, "grad_norm": 0.58984375, "learning_rate": 3.045781027886873e-05, "loss": 0.40243988037109374, "num_input_tokens_seen": 4818798528, "step": 16950, "train_runtime": 164760.3024, "train_tokens_per_second": 29247.328 }, { "epoch": 0.6000791672840093, "grad_norm": 0.58203125, "learning_rate": 3.0452160841712408e-05, "loss": 0.40737123489379884, "num_input_tokens_seen": 4821652480, "step": 16960, "train_runtime": 164861.2112, "train_tokens_per_second": 29246.737 }, { "epoch": 0.6004329875477381, "grad_norm": 0.6015625, "learning_rate": 3.044651454703133e-05, "loss": 0.40608940124511717, "num_input_tokens_seen": 4824476672, "step": 16970, "train_runtime": 164959.2383, "train_tokens_per_second": 29246.478 }, { "epoch": 0.6007868078114669, "grad_norm": 0.59375, "learning_rate": 3.0440871391913257e-05, "loss": 0.40442862510681155, "num_input_tokens_seen": 4827343616, "step": 16980, "train_runtime": 165055.4929, "train_tokens_per_second": 29246.792 }, { "epoch": 0.6011406280751956, "grad_norm": 0.5859375, "learning_rate": 3.043523137344973e-05, "loss": 0.4066753387451172, "num_input_tokens_seen": 4830190848, "step": 16990, "train_runtime": 165152.3559, "train_tokens_per_second": 29246.878 }, { "epoch": 0.6014944483389244, "grad_norm": 0.58203125, "learning_rate": 3.0429594488736074e-05, "loss": 0.40218772888183596, "num_input_tokens_seen": 4833028416, "step": 17000, "train_runtime": 165249.3869, "train_tokens_per_second": 29246.877 }, { "epoch": 0.6018482686026532, "grad_norm": 0.5859375, "learning_rate": 3.0423960734871348e-05, "loss": 0.4041303634643555, "num_input_tokens_seen": 4835902656, "step": 17010, "train_runtime": 165347.6556, "train_tokens_per_second": 29246.878 }, { "epoch": 0.6022020888663819, "grad_norm": 0.5859375, "learning_rate": 3.0418330108958404e-05, "loss": 0.4078521728515625, "num_input_tokens_seen": 4838743168, "step": 17020, "train_runtime": 165444.1471, "train_tokens_per_second": 29246.989 }, { "epoch": 0.6025559091301108, "grad_norm": 0.609375, "learning_rate": 3.0412702608103828e-05, "loss": 0.4075908660888672, "num_input_tokens_seen": 4841615808, "step": 17030, "train_runtime": 165542.9198, "train_tokens_per_second": 29246.891 }, { "epoch": 0.6029097293938396, "grad_norm": 0.5859375, "learning_rate": 3.0407078229417944e-05, "loss": 0.4073158264160156, "num_input_tokens_seen": 4844434816, "step": 17040, "train_runtime": 165638.625, "train_tokens_per_second": 29247.012 }, { "epoch": 0.6032635496575683, "grad_norm": 0.59375, "learning_rate": 3.0401456970014836e-05, "loss": 0.40678677558898924, "num_input_tokens_seen": 4847282624, "step": 17050, "train_runtime": 165736.102, "train_tokens_per_second": 29246.993 }, { "epoch": 0.6036173699212971, "grad_norm": 0.609375, "learning_rate": 3.039583882701231e-05, "loss": 0.4060935974121094, "num_input_tokens_seen": 4850112192, "step": 17060, "train_runtime": 165833.882, "train_tokens_per_second": 29246.811 }, { "epoch": 0.6039711901850259, "grad_norm": 0.578125, "learning_rate": 3.0390223797531887e-05, "loss": 0.4084298133850098, "num_input_tokens_seen": 4852995648, "step": 17070, "train_runtime": 165933.5539, "train_tokens_per_second": 29246.62 }, { "epoch": 0.6043250104487546, "grad_norm": 0.60546875, "learning_rate": 3.0384611878698837e-05, "loss": 0.4082502365112305, "num_input_tokens_seen": 4855845952, "step": 17080, "train_runtime": 166030.9656, "train_tokens_per_second": 29246.628 }, { "epoch": 0.6046788307124834, "grad_norm": 0.5859375, "learning_rate": 3.0379003067642113e-05, "loss": 0.4072283744812012, "num_input_tokens_seen": 4858639744, "step": 17090, "train_runtime": 166123.6616, "train_tokens_per_second": 29247.126 }, { "epoch": 0.6050326509762122, "grad_norm": 0.57421875, "learning_rate": 3.037339736149441e-05, "loss": 0.4023797035217285, "num_input_tokens_seen": 4861526848, "step": 17100, "train_runtime": 166223.25, "train_tokens_per_second": 29246.973 }, { "epoch": 0.605386471239941, "grad_norm": 0.59765625, "learning_rate": 3.0367794757392092e-05, "loss": 0.4041740894317627, "num_input_tokens_seen": 4864316736, "step": 17110, "train_runtime": 166317.2356, "train_tokens_per_second": 29247.22 }, { "epoch": 0.6057402915036698, "grad_norm": 0.59765625, "learning_rate": 3.0362195252475245e-05, "loss": 0.4097470283508301, "num_input_tokens_seen": 4867139456, "step": 17120, "train_runtime": 166413.2144, "train_tokens_per_second": 29247.314 }, { "epoch": 0.6060941117673986, "grad_norm": 0.6015625, "learning_rate": 3.0356598843887634e-05, "loss": 0.4035935401916504, "num_input_tokens_seen": 4869951104, "step": 17130, "train_runtime": 166509.1161, "train_tokens_per_second": 29247.354 }, { "epoch": 0.6064479320311273, "grad_norm": 0.5859375, "learning_rate": 3.03510055287767e-05, "loss": 0.40491538047790526, "num_input_tokens_seen": 4872733760, "step": 17140, "train_runtime": 166602.3932, "train_tokens_per_second": 29247.682 }, { "epoch": 0.6068017522948561, "grad_norm": 0.57421875, "learning_rate": 3.0345415304293578e-05, "loss": 0.40308256149291993, "num_input_tokens_seen": 4875590400, "step": 17150, "train_runtime": 166700.8676, "train_tokens_per_second": 29247.541 }, { "epoch": 0.6071555725585849, "grad_norm": 0.57421875, "learning_rate": 3.0339828167593065e-05, "loss": 0.40570802688598634, "num_input_tokens_seen": 4878444224, "step": 17160, "train_runtime": 166800.6669, "train_tokens_per_second": 29247.151 }, { "epoch": 0.6075093928223136, "grad_norm": 0.56640625, "learning_rate": 3.033424411583363e-05, "loss": 0.4033414363861084, "num_input_tokens_seen": 4881299392, "step": 17170, "train_runtime": 166896.0823, "train_tokens_per_second": 29247.537 }, { "epoch": 0.6078632130860424, "grad_norm": 0.578125, "learning_rate": 3.0328663146177387e-05, "loss": 0.4091768264770508, "num_input_tokens_seen": 4884182528, "step": 17180, "train_runtime": 166996.0657, "train_tokens_per_second": 29247.291 }, { "epoch": 0.6082170333497713, "grad_norm": 0.5859375, "learning_rate": 3.032308525579013e-05, "loss": 0.40320463180541993, "num_input_tokens_seen": 4887034048, "step": 17190, "train_runtime": 167096.0523, "train_tokens_per_second": 29246.855 }, { "epoch": 0.6085708536135, "grad_norm": 0.56640625, "learning_rate": 3.031751044184127e-05, "loss": 0.4018968105316162, "num_input_tokens_seen": 4889851008, "step": 17200, "train_runtime": 167191.9173, "train_tokens_per_second": 29246.934 }, { "epoch": 0.6089246738772288, "grad_norm": 0.58984375, "learning_rate": 3.0311938701503872e-05, "loss": 0.4022430419921875, "num_input_tokens_seen": 4892737344, "step": 17210, "train_runtime": 167289.7295, "train_tokens_per_second": 29247.087 }, { "epoch": 0.6092784941409576, "grad_norm": 0.58203125, "learning_rate": 3.0306370031954646e-05, "loss": 0.4053038597106934, "num_input_tokens_seen": 4895623744, "step": 17220, "train_runtime": 167390.003, "train_tokens_per_second": 29246.811 }, { "epoch": 0.6096323144046863, "grad_norm": 0.60546875, "learning_rate": 3.030080443037393e-05, "loss": 0.4061570644378662, "num_input_tokens_seen": 4898499072, "step": 17230, "train_runtime": 167486.9705, "train_tokens_per_second": 29247.046 }, { "epoch": 0.6099861346684151, "grad_norm": 0.5546875, "learning_rate": 3.0295241893945663e-05, "loss": 0.4084829807281494, "num_input_tokens_seen": 4901417472, "step": 17240, "train_runtime": 167590.4965, "train_tokens_per_second": 29246.393 }, { "epoch": 0.6103399549321439, "grad_norm": 0.55078125, "learning_rate": 3.028968241985743e-05, "loss": 0.40891332626342775, "num_input_tokens_seen": 4904288448, "step": 17250, "train_runtime": 167689.8449, "train_tokens_per_second": 29246.186 }, { "epoch": 0.6106937751958726, "grad_norm": 0.5859375, "learning_rate": 3.0284126005300405e-05, "loss": 0.4050548553466797, "num_input_tokens_seen": 4907094080, "step": 17260, "train_runtime": 167786.8658, "train_tokens_per_second": 29245.996 }, { "epoch": 0.6110475954596014, "grad_norm": 0.55078125, "learning_rate": 3.0278572647469385e-05, "loss": 0.40810537338256836, "num_input_tokens_seen": 4909941952, "step": 17270, "train_runtime": 167886.6812, "train_tokens_per_second": 29245.572 }, { "epoch": 0.6114014157233303, "grad_norm": 0.6015625, "learning_rate": 3.027302234356275e-05, "loss": 0.40270819664001467, "num_input_tokens_seen": 4912768192, "step": 17280, "train_runtime": 167981.681, "train_tokens_per_second": 29245.857 }, { "epoch": 0.611755235987059, "grad_norm": 0.59765625, "learning_rate": 3.0267475090782494e-05, "loss": 0.4071396827697754, "num_input_tokens_seen": 4915623744, "step": 17290, "train_runtime": 168077.8724, "train_tokens_per_second": 29246.109 }, { "epoch": 0.6121090562507878, "grad_norm": 0.56640625, "learning_rate": 3.026193088633418e-05, "loss": 0.4104874610900879, "num_input_tokens_seen": 4918438208, "step": 17300, "train_runtime": 168172.8242, "train_tokens_per_second": 29246.332 }, { "epoch": 0.6124628765145166, "grad_norm": 0.59765625, "learning_rate": 3.0256389727426952e-05, "loss": 0.4036008358001709, "num_input_tokens_seen": 4921316352, "step": 17310, "train_runtime": 168271.8383, "train_tokens_per_second": 29246.227 }, { "epoch": 0.6128166967782454, "grad_norm": 0.58984375, "learning_rate": 3.0250851611273555e-05, "loss": 0.41010246276855467, "num_input_tokens_seen": 4924200896, "step": 17320, "train_runtime": 168372.4827, "train_tokens_per_second": 29245.877 }, { "epoch": 0.6131705170419741, "grad_norm": 0.63671875, "learning_rate": 3.0245316535090273e-05, "loss": 0.401582145690918, "num_input_tokens_seen": 4927030016, "step": 17330, "train_runtime": 168466.6279, "train_tokens_per_second": 29246.327 }, { "epoch": 0.6135243373057029, "grad_norm": 0.6015625, "learning_rate": 3.023978449609697e-05, "loss": 0.40504703521728513, "num_input_tokens_seen": 4929834496, "step": 17340, "train_runtime": 168561.8576, "train_tokens_per_second": 29246.441 }, { "epoch": 0.6138781575694316, "grad_norm": 0.5703125, "learning_rate": 3.023425549151707e-05, "loss": 0.40938544273376465, "num_input_tokens_seen": 4932647296, "step": 17350, "train_runtime": 168657.2375, "train_tokens_per_second": 29246.579 }, { "epoch": 0.6142319778331605, "grad_norm": 0.578125, "learning_rate": 3.022872951857754e-05, "loss": 0.4029240608215332, "num_input_tokens_seen": 4935509440, "step": 17360, "train_runtime": 168757.575, "train_tokens_per_second": 29246.151 }, { "epoch": 0.6145857980968893, "grad_norm": 0.59765625, "learning_rate": 3.0223206574508904e-05, "loss": 0.40139102935791016, "num_input_tokens_seen": 4938350144, "step": 17370, "train_runtime": 168854.0035, "train_tokens_per_second": 29246.272 }, { "epoch": 0.6149396183606181, "grad_norm": 0.59765625, "learning_rate": 3.0217686656545224e-05, "loss": 0.40678749084472654, "num_input_tokens_seen": 4941242176, "step": 17380, "train_runtime": 168954.661, "train_tokens_per_second": 29245.965 }, { "epoch": 0.6152934386243468, "grad_norm": 0.58203125, "learning_rate": 3.0212169761924077e-05, "loss": 0.40032229423522947, "num_input_tokens_seen": 4944175168, "step": 17390, "train_runtime": 169057.2969, "train_tokens_per_second": 29245.559 }, { "epoch": 0.6156472588880756, "grad_norm": 0.58203125, "learning_rate": 3.0206655887886604e-05, "loss": 0.4111682415008545, "num_input_tokens_seen": 4947047616, "step": 17400, "train_runtime": 169156.5873, "train_tokens_per_second": 29245.374 }, { "epoch": 0.6160010791518044, "grad_norm": 0.56640625, "learning_rate": 3.0201145031677448e-05, "loss": 0.40668344497680664, "num_input_tokens_seen": 4949891200, "step": 17410, "train_runtime": 169254.5683, "train_tokens_per_second": 29245.244 }, { "epoch": 0.6163548994155331, "grad_norm": 0.5859375, "learning_rate": 3.019563719054477e-05, "loss": 0.4065103054046631, "num_input_tokens_seen": 4952743552, "step": 17420, "train_runtime": 169353.1887, "train_tokens_per_second": 29245.056 }, { "epoch": 0.6167087196792619, "grad_norm": 0.5859375, "learning_rate": 3.019013236174025e-05, "loss": 0.40653672218322756, "num_input_tokens_seen": 4955594368, "step": 17430, "train_runtime": 169452.4934, "train_tokens_per_second": 29244.742 }, { "epoch": 0.6170625399429908, "grad_norm": 0.6015625, "learning_rate": 3.018463054251906e-05, "loss": 0.4084512710571289, "num_input_tokens_seen": 4958432448, "step": 17440, "train_runtime": 169546.824, "train_tokens_per_second": 29245.21 }, { "epoch": 0.6174163602067195, "grad_norm": 0.55859375, "learning_rate": 3.017913173013989e-05, "loss": 0.4048893451690674, "num_input_tokens_seen": 4961316288, "step": 17450, "train_runtime": 169644.6597, "train_tokens_per_second": 29245.343 }, { "epoch": 0.6177701804704483, "grad_norm": 0.58984375, "learning_rate": 3.017363592186491e-05, "loss": 0.4105884552001953, "num_input_tokens_seen": 4964150016, "step": 17460, "train_runtime": 169741.8624, "train_tokens_per_second": 29245.29 }, { "epoch": 0.6181240007341771, "grad_norm": 0.57421875, "learning_rate": 3.0168143114959797e-05, "loss": 0.40169200897216795, "num_input_tokens_seen": 4966970816, "step": 17470, "train_runtime": 169838.6365, "train_tokens_per_second": 29245.235 }, { "epoch": 0.6184778209979058, "grad_norm": 0.5625, "learning_rate": 3.016265330669369e-05, "loss": 0.4048782825469971, "num_input_tokens_seen": 4969811584, "step": 17480, "train_runtime": 169935.6616, "train_tokens_per_second": 29245.254 }, { "epoch": 0.6188316412616346, "grad_norm": 0.59765625, "learning_rate": 3.0157166494339223e-05, "loss": 0.40407352447509765, "num_input_tokens_seen": 4972673536, "step": 17490, "train_runtime": 170035.0961, "train_tokens_per_second": 29244.983 }, { "epoch": 0.6191854615253634, "grad_norm": 0.578125, "learning_rate": 3.0151682675172482e-05, "loss": 0.40251784324645995, "num_input_tokens_seen": 4975483200, "step": 17500, "train_runtime": 170131.8076, "train_tokens_per_second": 29244.874 }, { "epoch": 0.6195392817890921, "grad_norm": 0.640625, "learning_rate": 3.0146201846473034e-05, "loss": 0.4039877414703369, "num_input_tokens_seen": 4978340736, "step": 17510, "train_runtime": 170230.4562, "train_tokens_per_second": 29244.712 }, { "epoch": 0.6198931020528209, "grad_norm": 0.59765625, "learning_rate": 3.01407240055239e-05, "loss": 0.4047060966491699, "num_input_tokens_seen": 4981153600, "step": 17520, "train_runtime": 170325.915, "train_tokens_per_second": 29244.837 }, { "epoch": 0.6202469223165498, "grad_norm": 0.59375, "learning_rate": 3.013524914961157e-05, "loss": 0.4049750804901123, "num_input_tokens_seen": 4983947264, "step": 17530, "train_runtime": 170418.4329, "train_tokens_per_second": 29245.353 }, { "epoch": 0.6206007425802785, "grad_norm": 0.58203125, "learning_rate": 3.012977727602596e-05, "loss": 0.40945959091186523, "num_input_tokens_seen": 4986762560, "step": 17540, "train_runtime": 170512.8075, "train_tokens_per_second": 29245.677 }, { "epoch": 0.6209545628440073, "grad_norm": 0.58984375, "learning_rate": 3.0124308382060446e-05, "loss": 0.40868167877197265, "num_input_tokens_seen": 4989534656, "step": 17550, "train_runtime": 170608.5167, "train_tokens_per_second": 29245.519 }, { "epoch": 0.6213083831077361, "grad_norm": 0.58203125, "learning_rate": 3.011884246501183e-05, "loss": 0.4059316635131836, "num_input_tokens_seen": 4992401984, "step": 17560, "train_runtime": 170707.6769, "train_tokens_per_second": 29245.328 }, { "epoch": 0.6216622033714648, "grad_norm": 0.609375, "learning_rate": 3.0113379522180363e-05, "loss": 0.4088932991027832, "num_input_tokens_seen": 4995281408, "step": 17570, "train_runtime": 170806.7379, "train_tokens_per_second": 29245.225 }, { "epoch": 0.6220160236351936, "grad_norm": 0.5703125, "learning_rate": 3.0107919550869702e-05, "loss": 0.40520291328430175, "num_input_tokens_seen": 4998074432, "step": 17580, "train_runtime": 170898.1163, "train_tokens_per_second": 29245.931 }, { "epoch": 0.6223698438989224, "grad_norm": 0.61328125, "learning_rate": 3.0102462548386933e-05, "loss": 0.40500588417053224, "num_input_tokens_seen": 5000884480, "step": 17590, "train_runtime": 170992.7359, "train_tokens_per_second": 29246.181 }, { "epoch": 0.6227236641626511, "grad_norm": 0.6015625, "learning_rate": 3.0097008512042572e-05, "loss": 0.4085218906402588, "num_input_tokens_seen": 5003696768, "step": 17600, "train_runtime": 171088.4481, "train_tokens_per_second": 29246.257 }, { "epoch": 0.62307748442638, "grad_norm": 0.5859375, "learning_rate": 3.009155743915052e-05, "loss": 0.40653324127197266, "num_input_tokens_seen": 5006511936, "step": 17610, "train_runtime": 171184.7224, "train_tokens_per_second": 29246.254 }, { "epoch": 0.6234313046901088, "grad_norm": 0.56640625, "learning_rate": 3.00861093270281e-05, "loss": 0.40657758712768555, "num_input_tokens_seen": 5009304512, "step": 17620, "train_runtime": 171279.8812, "train_tokens_per_second": 29246.31 }, { "epoch": 0.6237851249538375, "grad_norm": 0.5859375, "learning_rate": 3.008066417299602e-05, "loss": 0.4066032409667969, "num_input_tokens_seen": 5012144896, "step": 17630, "train_runtime": 171373.7355, "train_tokens_per_second": 29246.867 }, { "epoch": 0.6241389452175663, "grad_norm": 0.60546875, "learning_rate": 3.00752219743784e-05, "loss": 0.4033350944519043, "num_input_tokens_seen": 5015010432, "step": 17640, "train_runtime": 171471.5681, "train_tokens_per_second": 29246.892 }, { "epoch": 0.6244927654812951, "grad_norm": 0.5703125, "learning_rate": 3.0069782728502737e-05, "loss": 0.40196542739868163, "num_input_tokens_seen": 5017832512, "step": 17650, "train_runtime": 171567.1023, "train_tokens_per_second": 29247.055 }, { "epoch": 0.6248465857450238, "grad_norm": 0.578125, "learning_rate": 3.00643464326999e-05, "loss": 0.404159688949585, "num_input_tokens_seen": 5020703808, "step": 17660, "train_runtime": 171666.1521, "train_tokens_per_second": 29246.906 }, { "epoch": 0.6252004060087526, "grad_norm": 0.6015625, "learning_rate": 3.0058913084304146e-05, "loss": 0.4051948547363281, "num_input_tokens_seen": 5023488640, "step": 17670, "train_runtime": 171759.9255, "train_tokens_per_second": 29247.152 }, { "epoch": 0.6255542262724814, "grad_norm": 0.609375, "learning_rate": 3.0053482680653112e-05, "loss": 0.40851216316223143, "num_input_tokens_seen": 5026346880, "step": 17680, "train_runtime": 171857.4776, "train_tokens_per_second": 29247.182 }, { "epoch": 0.6259080465362102, "grad_norm": 0.59375, "learning_rate": 3.0048055219087777e-05, "loss": 0.4006662368774414, "num_input_tokens_seen": 5029180480, "step": 17690, "train_runtime": 171954.0907, "train_tokens_per_second": 29247.228 }, { "epoch": 0.626261866799939, "grad_norm": 0.6015625, "learning_rate": 3.0042630696952507e-05, "loss": 0.404221248626709, "num_input_tokens_seen": 5032037952, "step": 17700, "train_runtime": 172050.627, "train_tokens_per_second": 29247.426 }, { "epoch": 0.6266156870636678, "grad_norm": 0.5859375, "learning_rate": 3.0037209111594994e-05, "loss": 0.40954113006591797, "num_input_tokens_seen": 5034930752, "step": 17710, "train_runtime": 172150.9555, "train_tokens_per_second": 29247.184 }, { "epoch": 0.6269695073273965, "grad_norm": 0.58984375, "learning_rate": 3.0031790460366305e-05, "loss": 0.4029120445251465, "num_input_tokens_seen": 5037810368, "step": 17720, "train_runtime": 172249.2074, "train_tokens_per_second": 29247.219 }, { "epoch": 0.6273233275911253, "grad_norm": 0.59375, "learning_rate": 3.002637474062083e-05, "loss": 0.4088258743286133, "num_input_tokens_seen": 5040589760, "step": 17730, "train_runtime": 172340.9759, "train_tokens_per_second": 29247.773 }, { "epoch": 0.6276771478548541, "grad_norm": 0.58984375, "learning_rate": 3.0020961949716325e-05, "loss": 0.40375308990478515, "num_input_tokens_seen": 5043435904, "step": 17740, "train_runtime": 172440.0387, "train_tokens_per_second": 29247.476 }, { "epoch": 0.6280309681185828, "grad_norm": 0.58984375, "learning_rate": 3.0015552085013847e-05, "loss": 0.4001753807067871, "num_input_tokens_seen": 5046189184, "step": 17750, "train_runtime": 172530.5485, "train_tokens_per_second": 29248.091 }, { "epoch": 0.6283847883823116, "grad_norm": 0.578125, "learning_rate": 3.0010145143877805e-05, "loss": 0.41054410934448243, "num_input_tokens_seen": 5048981696, "step": 17760, "train_runtime": 172623.9199, "train_tokens_per_second": 29248.448 }, { "epoch": 0.6287386086460404, "grad_norm": 0.59765625, "learning_rate": 3.0004741123675907e-05, "loss": 0.40427050590515134, "num_input_tokens_seen": 5051770688, "step": 17770, "train_runtime": 172719.1703, "train_tokens_per_second": 29248.465 }, { "epoch": 0.6290924289097692, "grad_norm": 0.58984375, "learning_rate": 2.9999340021779205e-05, "loss": 0.40260753631591795, "num_input_tokens_seen": 5054588800, "step": 17780, "train_runtime": 172815.2108, "train_tokens_per_second": 29248.518 }, { "epoch": 0.629446249173498, "grad_norm": 0.578125, "learning_rate": 2.999394183556204e-05, "loss": 0.40073323249816895, "num_input_tokens_seen": 5057500672, "step": 17790, "train_runtime": 172915.6167, "train_tokens_per_second": 29248.374 }, { "epoch": 0.6298000694372268, "grad_norm": 0.59765625, "learning_rate": 2.998854656240207e-05, "loss": 0.4047834396362305, "num_input_tokens_seen": 5060324160, "step": 17800, "train_runtime": 173010.135, "train_tokens_per_second": 29248.715 }, { "epoch": 0.6301538897009555, "grad_norm": 0.6015625, "learning_rate": 2.9983154199680257e-05, "loss": 0.40609073638916016, "num_input_tokens_seen": 5063190336, "step": 17810, "train_runtime": 173106.653, "train_tokens_per_second": 29248.964 }, { "epoch": 0.6305077099646843, "grad_norm": 0.5859375, "learning_rate": 2.9977764744780845e-05, "loss": 0.4032859802246094, "num_input_tokens_seen": 5065999168, "step": 17820, "train_runtime": 173202.9847, "train_tokens_per_second": 29248.914 }, { "epoch": 0.6308615302284131, "grad_norm": 0.58984375, "learning_rate": 2.9972378195091384e-05, "loss": 0.40296058654785155, "num_input_tokens_seen": 5068796416, "step": 17830, "train_runtime": 173300.5102, "train_tokens_per_second": 29248.595 }, { "epoch": 0.6312153504921418, "grad_norm": 0.5625, "learning_rate": 2.996699454800269e-05, "loss": 0.4052254676818848, "num_input_tokens_seen": 5071733952, "step": 17840, "train_runtime": 173401.6258, "train_tokens_per_second": 29248.48 }, { "epoch": 0.6315691707558706, "grad_norm": 0.5703125, "learning_rate": 2.9961613800908883e-05, "loss": 0.4059328079223633, "num_input_tokens_seen": 5074574912, "step": 17850, "train_runtime": 173498.3806, "train_tokens_per_second": 29248.543 }, { "epoch": 0.6319229910195995, "grad_norm": 0.58203125, "learning_rate": 2.995623595120733e-05, "loss": 0.4021906852722168, "num_input_tokens_seen": 5077408448, "step": 17860, "train_runtime": 173596.1813, "train_tokens_per_second": 29248.388 }, { "epoch": 0.6322768112833282, "grad_norm": 0.578125, "learning_rate": 2.995086099629869e-05, "loss": 0.40830192565917967, "num_input_tokens_seen": 5080244672, "step": 17870, "train_runtime": 173692.5777, "train_tokens_per_second": 29248.485 }, { "epoch": 0.632630631547057, "grad_norm": 0.5859375, "learning_rate": 2.9945488933586867e-05, "loss": 0.4018385887145996, "num_input_tokens_seen": 5083104384, "step": 17880, "train_runtime": 173792.9294, "train_tokens_per_second": 29248.051 }, { "epoch": 0.6329844518107858, "grad_norm": 0.578125, "learning_rate": 2.9940119760479045e-05, "loss": 0.4086899757385254, "num_input_tokens_seen": 5085932736, "step": 17890, "train_runtime": 173888.4772, "train_tokens_per_second": 29248.245 }, { "epoch": 0.6333382720745145, "grad_norm": 0.5859375, "learning_rate": 2.9934753474385635e-05, "loss": 0.39928598403930665, "num_input_tokens_seen": 5088743936, "step": 17900, "train_runtime": 173983.4914, "train_tokens_per_second": 29248.43 }, { "epoch": 0.6336920923382433, "grad_norm": 0.58984375, "learning_rate": 2.9929390072720314e-05, "loss": 0.4063319206237793, "num_input_tokens_seen": 5091568960, "step": 17910, "train_runtime": 174080.1294, "train_tokens_per_second": 29248.421 }, { "epoch": 0.6340459126019721, "grad_norm": 0.58203125, "learning_rate": 2.99240295529e-05, "loss": 0.4067960739135742, "num_input_tokens_seen": 5094457088, "step": 17920, "train_runtime": 174176.846, "train_tokens_per_second": 29248.762 }, { "epoch": 0.6343997328657008, "grad_norm": 0.59375, "learning_rate": 2.991867191234484e-05, "loss": 0.4066004753112793, "num_input_tokens_seen": 5097324736, "step": 17930, "train_runtime": 174276.0366, "train_tokens_per_second": 29248.569 }, { "epoch": 0.6347535531294297, "grad_norm": 0.609375, "learning_rate": 2.991331714847822e-05, "loss": 0.40811758041381835, "num_input_tokens_seen": 5100176512, "step": 17940, "train_runtime": 174372.81, "train_tokens_per_second": 29248.691 }, { "epoch": 0.6351073733931585, "grad_norm": 0.58984375, "learning_rate": 2.990796525872675e-05, "loss": 0.4074103832244873, "num_input_tokens_seen": 5103029248, "step": 17950, "train_runtime": 174468.7956, "train_tokens_per_second": 29248.951 }, { "epoch": 0.6354611936568872, "grad_norm": 0.5859375, "learning_rate": 2.990261624052027e-05, "loss": 0.40820956230163574, "num_input_tokens_seen": 5105830400, "step": 17960, "train_runtime": 174565.1352, "train_tokens_per_second": 29248.855 }, { "epoch": 0.635815013920616, "grad_norm": 0.5703125, "learning_rate": 2.989727009129182e-05, "loss": 0.4053308963775635, "num_input_tokens_seen": 5108736064, "step": 17970, "train_runtime": 174661.2532, "train_tokens_per_second": 29249.395 }, { "epoch": 0.6361688341843448, "grad_norm": 0.58203125, "learning_rate": 2.989192680847766e-05, "loss": 0.40932602882385255, "num_input_tokens_seen": 5111624448, "step": 17980, "train_runtime": 174762.1536, "train_tokens_per_second": 29249.036 }, { "epoch": 0.6365226544480735, "grad_norm": 0.5703125, "learning_rate": 2.9886586389517267e-05, "loss": 0.4071192741394043, "num_input_tokens_seen": 5114494144, "step": 17990, "train_runtime": 174859.4597, "train_tokens_per_second": 29249.17 }, { "epoch": 0.6368764747118023, "grad_norm": 0.5703125, "learning_rate": 2.98812488318533e-05, "loss": 0.40278215408325196, "num_input_tokens_seen": 5117328640, "step": 18000, "train_runtime": 174955.7788, "train_tokens_per_second": 29249.269 }, { "epoch": 0.6372302949755311, "grad_norm": 0.58203125, "learning_rate": 2.987591413293162e-05, "loss": 0.4063523292541504, "num_input_tokens_seen": 5120165696, "step": 18010, "train_runtime": 175050.8834, "train_tokens_per_second": 29249.585 }, { "epoch": 0.6375841152392598, "grad_norm": 0.5703125, "learning_rate": 2.98705822902013e-05, "loss": 0.4070803165435791, "num_input_tokens_seen": 5123009728, "step": 18020, "train_runtime": 175149.7041, "train_tokens_per_second": 29249.32 }, { "epoch": 0.6379379355029887, "grad_norm": 0.59765625, "learning_rate": 2.9865253301114553e-05, "loss": 0.39750356674194337, "num_input_tokens_seen": 5125901824, "step": 18030, "train_runtime": 175250.1147, "train_tokens_per_second": 29249.064 }, { "epoch": 0.6382917557667175, "grad_norm": 0.578125, "learning_rate": 2.985992716312683e-05, "loss": 0.4061281681060791, "num_input_tokens_seen": 5128786752, "step": 18040, "train_runtime": 175348.1224, "train_tokens_per_second": 29249.168 }, { "epoch": 0.6386455760304462, "grad_norm": 0.578125, "learning_rate": 2.9854603873696703e-05, "loss": 0.4045412540435791, "num_input_tokens_seen": 5131620736, "step": 18050, "train_runtime": 175444.1673, "train_tokens_per_second": 29249.309 }, { "epoch": 0.638999396294175, "grad_norm": 0.57421875, "learning_rate": 2.9849283430285947e-05, "loss": 0.4063894271850586, "num_input_tokens_seen": 5134488384, "step": 18060, "train_runtime": 175544.0789, "train_tokens_per_second": 29248.998 }, { "epoch": 0.6393532165579038, "grad_norm": 0.58984375, "learning_rate": 2.98439658303595e-05, "loss": 0.4066436767578125, "num_input_tokens_seen": 5137327488, "step": 18070, "train_runtime": 175641.4302, "train_tokens_per_second": 29248.95 }, { "epoch": 0.6397070368216325, "grad_norm": 0.59765625, "learning_rate": 2.9838651071385442e-05, "loss": 0.40442280769348143, "num_input_tokens_seen": 5140219712, "step": 18080, "train_runtime": 175744.0868, "train_tokens_per_second": 29248.322 }, { "epoch": 0.6400608570853613, "grad_norm": 0.58203125, "learning_rate": 2.9833339150835037e-05, "loss": 0.4047560214996338, "num_input_tokens_seen": 5143062656, "step": 18090, "train_runtime": 175841.3442, "train_tokens_per_second": 29248.313 }, { "epoch": 0.6404146773490901, "grad_norm": 0.58203125, "learning_rate": 2.982803006618267e-05, "loss": 0.4041615009307861, "num_input_tokens_seen": 5145871104, "step": 18100, "train_runtime": 175937.1483, "train_tokens_per_second": 29248.349 }, { "epoch": 0.640768497612819, "grad_norm": 0.578125, "learning_rate": 2.982272381490588e-05, "loss": 0.4070761680603027, "num_input_tokens_seen": 5148714880, "step": 18110, "train_runtime": 176032.3977, "train_tokens_per_second": 29248.678 }, { "epoch": 0.6411223178765477, "grad_norm": 0.5703125, "learning_rate": 2.9817420394485363e-05, "loss": 0.4018665313720703, "num_input_tokens_seen": 5151576832, "step": 18120, "train_runtime": 176128.3614, "train_tokens_per_second": 29248.991 }, { "epoch": 0.6414761381402765, "grad_norm": 0.59375, "learning_rate": 2.9812119802404927e-05, "loss": 0.4062140464782715, "num_input_tokens_seen": 5154438400, "step": 18130, "train_runtime": 176226.6315, "train_tokens_per_second": 29248.919 }, { "epoch": 0.6418299584040053, "grad_norm": 0.58203125, "learning_rate": 2.9806822036151523e-05, "loss": 0.40354671478271487, "num_input_tokens_seen": 5157314816, "step": 18140, "train_runtime": 176324.9595, "train_tokens_per_second": 29248.921 }, { "epoch": 0.642183778667734, "grad_norm": 0.5859375, "learning_rate": 2.980152709321522e-05, "loss": 0.40874857902526857, "num_input_tokens_seen": 5160157824, "step": 18150, "train_runtime": 176420.2056, "train_tokens_per_second": 29249.245 }, { "epoch": 0.6425375989314628, "grad_norm": 0.5625, "learning_rate": 2.9796234971089214e-05, "loss": 0.4053154945373535, "num_input_tokens_seen": 5163078912, "step": 18160, "train_runtime": 176520.4176, "train_tokens_per_second": 29249.188 }, { "epoch": 0.6428914191951915, "grad_norm": 0.5625, "learning_rate": 2.979094566726981e-05, "loss": 0.40380334854125977, "num_input_tokens_seen": 5165915968, "step": 18170, "train_runtime": 176617.6219, "train_tokens_per_second": 29249.154 }, { "epoch": 0.6432452394589203, "grad_norm": 0.58984375, "learning_rate": 2.9785659179256427e-05, "loss": 0.40433244705200194, "num_input_tokens_seen": 5168756928, "step": 18180, "train_runtime": 176713.5416, "train_tokens_per_second": 29249.354 }, { "epoch": 0.6435990597226492, "grad_norm": 0.61328125, "learning_rate": 2.978037550455159e-05, "loss": 0.40520520210266114, "num_input_tokens_seen": 5171592320, "step": 18190, "train_runtime": 176811.4756, "train_tokens_per_second": 29249.189 }, { "epoch": 0.643952879986378, "grad_norm": 0.578125, "learning_rate": 2.977509464066091e-05, "loss": 0.4089812278747559, "num_input_tokens_seen": 5174435520, "step": 18200, "train_runtime": 176909.624, "train_tokens_per_second": 29249.034 }, { "epoch": 0.6443067002501067, "grad_norm": 0.58203125, "learning_rate": 2.9769816585093126e-05, "loss": 0.40584535598754884, "num_input_tokens_seen": 5177222080, "step": 18210, "train_runtime": 177005.7505, "train_tokens_per_second": 29248.892 }, { "epoch": 0.6446605205138355, "grad_norm": 0.5859375, "learning_rate": 2.9764541335360024e-05, "loss": 0.39990782737731934, "num_input_tokens_seen": 5180071744, "step": 18220, "train_runtime": 177102.6002, "train_tokens_per_second": 29248.988 }, { "epoch": 0.6450143407775643, "grad_norm": 0.5625, "learning_rate": 2.9759268888976505e-05, "loss": 0.40387659072875975, "num_input_tokens_seen": 5182936768, "step": 18230, "train_runtime": 177203.9999, "train_tokens_per_second": 29248.419 }, { "epoch": 0.645368161041293, "grad_norm": 0.60546875, "learning_rate": 2.9753999243460546e-05, "loss": 0.4040827751159668, "num_input_tokens_seen": 5185806016, "step": 18240, "train_runtime": 177303.128, "train_tokens_per_second": 29248.249 }, { "epoch": 0.6457219813050218, "grad_norm": 0.6171875, "learning_rate": 2.974873239633319e-05, "loss": 0.4052712917327881, "num_input_tokens_seen": 5188599488, "step": 18250, "train_runtime": 177397.8722, "train_tokens_per_second": 29248.375 }, { "epoch": 0.6460758015687506, "grad_norm": 0.5859375, "learning_rate": 2.9743468345118563e-05, "loss": 0.40115108489990237, "num_input_tokens_seen": 5191436992, "step": 18260, "train_runtime": 177496.5386, "train_tokens_per_second": 29248.103 }, { "epoch": 0.6464296218324794, "grad_norm": 0.62109375, "learning_rate": 2.9738207087343844e-05, "loss": 0.4042972564697266, "num_input_tokens_seen": 5194292288, "step": 18270, "train_runtime": 177593.7099, "train_tokens_per_second": 29248.177 }, { "epoch": 0.6467834420962082, "grad_norm": 0.55078125, "learning_rate": 2.9732948620539287e-05, "loss": 0.4030327320098877, "num_input_tokens_seen": 5197122944, "step": 18280, "train_runtime": 177688.6268, "train_tokens_per_second": 29248.484 }, { "epoch": 0.647137262359937, "grad_norm": 0.59765625, "learning_rate": 2.9727692942238188e-05, "loss": 0.39977207183837893, "num_input_tokens_seen": 5199970304, "step": 18290, "train_runtime": 177781.784, "train_tokens_per_second": 29249.174 }, { "epoch": 0.6474910826236657, "grad_norm": 0.5703125, "learning_rate": 2.97224400499769e-05, "loss": 0.4066838264465332, "num_input_tokens_seen": 5202848960, "step": 18300, "train_runtime": 177882.1591, "train_tokens_per_second": 29248.852 }, { "epoch": 0.6478449028873945, "grad_norm": 0.58203125, "learning_rate": 2.9717189941294826e-05, "loss": 0.4029226303100586, "num_input_tokens_seen": 5205752704, "step": 18310, "train_runtime": 177982.2667, "train_tokens_per_second": 29248.716 }, { "epoch": 0.6481987231511233, "grad_norm": 0.6015625, "learning_rate": 2.97119426137344e-05, "loss": 0.4060703754425049, "num_input_tokens_seen": 5208582144, "step": 18320, "train_runtime": 178080.4096, "train_tokens_per_second": 29248.485 }, { "epoch": 0.648552543414852, "grad_norm": 0.6015625, "learning_rate": 2.9706698064841103e-05, "loss": 0.40630078315734863, "num_input_tokens_seen": 5211359552, "step": 18330, "train_runtime": 178172.6739, "train_tokens_per_second": 29248.927 }, { "epoch": 0.6489063636785808, "grad_norm": 0.5703125, "learning_rate": 2.970145629216345e-05, "loss": 0.4037792205810547, "num_input_tokens_seen": 5214195008, "step": 18340, "train_runtime": 178268.9692, "train_tokens_per_second": 29249.033 }, { "epoch": 0.6492601839423096, "grad_norm": 0.57421875, "learning_rate": 2.969621729325296e-05, "loss": 0.412615966796875, "num_input_tokens_seen": 5217021248, "step": 18350, "train_runtime": 178365.9207, "train_tokens_per_second": 29248.98 }, { "epoch": 0.6496140042060384, "grad_norm": 0.59765625, "learning_rate": 2.969098106566421e-05, "loss": 0.40331106185913085, "num_input_tokens_seen": 5219914240, "step": 18360, "train_runtime": 178467.6098, "train_tokens_per_second": 29248.524 }, { "epoch": 0.6499678244697672, "grad_norm": 0.625, "learning_rate": 2.968574760695476e-05, "loss": 0.40604658126831056, "num_input_tokens_seen": 5222842560, "step": 18370, "train_runtime": 178570.8671, "train_tokens_per_second": 29248.01 }, { "epoch": 0.650321644733496, "grad_norm": 0.57421875, "learning_rate": 2.9680516914685206e-05, "loss": 0.40002927780151365, "num_input_tokens_seen": 5225691136, "step": 18380, "train_runtime": 178667.3796, "train_tokens_per_second": 29248.155 }, { "epoch": 0.6506754649972247, "grad_norm": 0.56640625, "learning_rate": 2.9675288986419148e-05, "loss": 0.40667295455932617, "num_input_tokens_seen": 5228528256, "step": 18390, "train_runtime": 178764.8603, "train_tokens_per_second": 29248.076 }, { "epoch": 0.6510292852609535, "grad_norm": 0.5859375, "learning_rate": 2.967006381972317e-05, "loss": 0.40378704071044924, "num_input_tokens_seen": 5231359040, "step": 18400, "train_runtime": 178863.0201, "train_tokens_per_second": 29247.851 }, { "epoch": 0.6513831055246823, "grad_norm": 0.60546875, "learning_rate": 2.9664841412166882e-05, "loss": 0.405350399017334, "num_input_tokens_seen": 5234193408, "step": 18410, "train_runtime": 178961.058, "train_tokens_per_second": 29247.667 }, { "epoch": 0.651736925788411, "grad_norm": 0.5859375, "learning_rate": 2.965962176132287e-05, "loss": 0.40405893325805664, "num_input_tokens_seen": 5237039872, "step": 18420, "train_runtime": 179058.2821, "train_tokens_per_second": 29247.683 }, { "epoch": 0.6520907460521398, "grad_norm": 0.5859375, "learning_rate": 2.9654404864766706e-05, "loss": 0.3987222671508789, "num_input_tokens_seen": 5239866176, "step": 18430, "train_runtime": 179153.1633, "train_tokens_per_second": 29247.969 }, { "epoch": 0.6524445663158687, "grad_norm": 0.68359375, "learning_rate": 2.9649190720076962e-05, "loss": 0.40628809928894044, "num_input_tokens_seen": 5242772352, "step": 18440, "train_runtime": 179254.7858, "train_tokens_per_second": 29247.6 }, { "epoch": 0.6527983865795974, "grad_norm": 0.56640625, "learning_rate": 2.9643979324835176e-05, "loss": 0.40418100357055664, "num_input_tokens_seen": 5245648320, "step": 18450, "train_runtime": 179355.7168, "train_tokens_per_second": 29247.177 }, { "epoch": 0.6531522068433262, "grad_norm": 0.59765625, "learning_rate": 2.9638770676625866e-05, "loss": 0.4036346435546875, "num_input_tokens_seen": 5248480512, "step": 18460, "train_runtime": 179455.5824, "train_tokens_per_second": 29246.683 }, { "epoch": 0.653506027107055, "grad_norm": 0.57421875, "learning_rate": 2.9633564773036517e-05, "loss": 0.4022249221801758, "num_input_tokens_seen": 5251268608, "step": 18470, "train_runtime": 179548.7016, "train_tokens_per_second": 29247.043 }, { "epoch": 0.6538598473707837, "grad_norm": 0.59765625, "learning_rate": 2.9628361611657578e-05, "loss": 0.40443782806396483, "num_input_tokens_seen": 5254129984, "step": 18480, "train_runtime": 179649.4192, "train_tokens_per_second": 29246.574 }, { "epoch": 0.6542136676345125, "grad_norm": 0.5859375, "learning_rate": 2.9623161190082472e-05, "loss": 0.4029820919036865, "num_input_tokens_seen": 5256959360, "step": 18490, "train_runtime": 179749.2926, "train_tokens_per_second": 29246.064 }, { "epoch": 0.6545674878982413, "grad_norm": 0.58984375, "learning_rate": 2.9617963505907554e-05, "loss": 0.4015929698944092, "num_input_tokens_seen": 5259849216, "step": 18500, "train_runtime": 179852.3165, "train_tokens_per_second": 29245.379 }, { "epoch": 0.65492130816197, "grad_norm": 0.56640625, "learning_rate": 2.9612768556732145e-05, "loss": 0.40746254920959474, "num_input_tokens_seen": 5262726208, "step": 18510, "train_runtime": 179950.3076, "train_tokens_per_second": 29245.442 }, { "epoch": 0.6552751284256989, "grad_norm": 0.5703125, "learning_rate": 2.960757634015852e-05, "loss": 0.40365753173828123, "num_input_tokens_seen": 5265541184, "step": 18520, "train_runtime": 180046.651, "train_tokens_per_second": 29245.427 }, { "epoch": 0.6556289486894277, "grad_norm": 0.58203125, "learning_rate": 2.9602386853791885e-05, "loss": 0.4015194892883301, "num_input_tokens_seen": 5268363008, "step": 18530, "train_runtime": 180139.0506, "train_tokens_per_second": 29246.091 }, { "epoch": 0.6559827689531564, "grad_norm": 0.6015625, "learning_rate": 2.959720009524038e-05, "loss": 0.40960206985473635, "num_input_tokens_seen": 5271242496, "step": 18540, "train_runtime": 180239.942, "train_tokens_per_second": 29245.696 }, { "epoch": 0.6563365892168852, "grad_norm": 0.62890625, "learning_rate": 2.9592016062115085e-05, "loss": 0.4019481658935547, "num_input_tokens_seen": 5274129024, "step": 18550, "train_runtime": 180337.0544, "train_tokens_per_second": 29245.953 }, { "epoch": 0.656690409480614, "grad_norm": 0.6171875, "learning_rate": 2.9586834752030002e-05, "loss": 0.40447111129760743, "num_input_tokens_seen": 5277002112, "step": 18560, "train_runtime": 180434.7461, "train_tokens_per_second": 29246.042 }, { "epoch": 0.6570442297443427, "grad_norm": 0.57421875, "learning_rate": 2.958165616260206e-05, "loss": 0.40413599014282225, "num_input_tokens_seen": 5279807488, "step": 18570, "train_runtime": 180527.5096, "train_tokens_per_second": 29246.554 }, { "epoch": 0.6573980500080715, "grad_norm": 0.5859375, "learning_rate": 2.9576480291451114e-05, "loss": 0.4024855613708496, "num_input_tokens_seen": 5282667136, "step": 18580, "train_runtime": 180624.931, "train_tokens_per_second": 29246.611 }, { "epoch": 0.6577518702718003, "grad_norm": 0.56640625, "learning_rate": 2.957130713619991e-05, "loss": 0.4043850898742676, "num_input_tokens_seen": 5285451392, "step": 18590, "train_runtime": 180718.729, "train_tokens_per_second": 29246.838 }, { "epoch": 0.658105690535529, "grad_norm": 0.57421875, "learning_rate": 2.9566136694474138e-05, "loss": 0.40281333923339846, "num_input_tokens_seen": 5288344704, "step": 18600, "train_runtime": 180816.6277, "train_tokens_per_second": 29247.004 }, { "epoch": 0.6584595107992579, "grad_norm": 0.6015625, "learning_rate": 2.9560968963902365e-05, "loss": 0.4039157867431641, "num_input_tokens_seen": 5291221376, "step": 18610, "train_runtime": 180914.1267, "train_tokens_per_second": 29247.143 }, { "epoch": 0.6588133310629867, "grad_norm": 0.5703125, "learning_rate": 2.9555803942116062e-05, "loss": 0.40124988555908203, "num_input_tokens_seen": 5294061632, "step": 18620, "train_runtime": 181008.1448, "train_tokens_per_second": 29247.643 }, { "epoch": 0.6591671513267154, "grad_norm": 0.578125, "learning_rate": 2.955064162674961e-05, "loss": 0.4066600799560547, "num_input_tokens_seen": 5296885440, "step": 18630, "train_runtime": 181103.6768, "train_tokens_per_second": 29247.807 }, { "epoch": 0.6595209715904442, "grad_norm": 0.60546875, "learning_rate": 2.9545482015440266e-05, "loss": 0.4041609764099121, "num_input_tokens_seen": 5299739584, "step": 18640, "train_runtime": 181201.6057, "train_tokens_per_second": 29247.752 }, { "epoch": 0.659874791854173, "grad_norm": 0.58203125, "learning_rate": 2.954032510582819e-05, "loss": 0.40394792556762693, "num_input_tokens_seen": 5302608896, "step": 18650, "train_runtime": 181302.4812, "train_tokens_per_second": 29247.305 }, { "epoch": 0.6602286121179017, "grad_norm": 0.5625, "learning_rate": 2.95351708955564e-05, "loss": 0.4041898727416992, "num_input_tokens_seen": 5305451584, "step": 18660, "train_runtime": 181397.7855, "train_tokens_per_second": 29247.609 }, { "epoch": 0.6605824323816305, "grad_norm": 0.58203125, "learning_rate": 2.9530019382270823e-05, "loss": 0.40572643280029297, "num_input_tokens_seen": 5308258240, "step": 18670, "train_runtime": 181493.0896, "train_tokens_per_second": 29247.715 }, { "epoch": 0.6609362526453593, "grad_norm": 0.609375, "learning_rate": 2.9524870563620233e-05, "loss": 0.40117921829223635, "num_input_tokens_seen": 5311137216, "step": 18680, "train_runtime": 181594.5034, "train_tokens_per_second": 29247.236 }, { "epoch": 0.6612900729090881, "grad_norm": 0.5625, "learning_rate": 2.9519724437256287e-05, "loss": 0.4087681770324707, "num_input_tokens_seen": 5314011520, "step": 18690, "train_runtime": 181693.8391, "train_tokens_per_second": 29247.065 }, { "epoch": 0.6616438931728169, "grad_norm": 0.60546875, "learning_rate": 2.9514581000833496e-05, "loss": 0.4028594970703125, "num_input_tokens_seen": 5316814848, "step": 18700, "train_runtime": 181787.3546, "train_tokens_per_second": 29247.441 }, { "epoch": 0.6619977134365457, "grad_norm": 0.58203125, "learning_rate": 2.950944025200924e-05, "loss": 0.40320191383361814, "num_input_tokens_seen": 5319664256, "step": 18710, "train_runtime": 181883.3731, "train_tokens_per_second": 29247.667 }, { "epoch": 0.6623515337002744, "grad_norm": 0.58984375, "learning_rate": 2.950430218844375e-05, "loss": 0.400652551651001, "num_input_tokens_seen": 5322458624, "step": 18720, "train_runtime": 181976.3269, "train_tokens_per_second": 29248.083 }, { "epoch": 0.6627053539640032, "grad_norm": 0.578125, "learning_rate": 2.9499166807800106e-05, "loss": 0.40508260726928713, "num_input_tokens_seen": 5325399872, "step": 18730, "train_runtime": 182078.5306, "train_tokens_per_second": 29247.819 }, { "epoch": 0.663059174227732, "grad_norm": 0.59375, "learning_rate": 2.949403410774424e-05, "loss": 0.4024787425994873, "num_input_tokens_seen": 5328314432, "step": 18740, "train_runtime": 182180.7125, "train_tokens_per_second": 29247.412 }, { "epoch": 0.6634129944914607, "grad_norm": 0.57421875, "learning_rate": 2.948890408594492e-05, "loss": 0.4029059410095215, "num_input_tokens_seen": 5331233920, "step": 18750, "train_runtime": 182282.7735, "train_tokens_per_second": 29247.053 }, { "epoch": 0.6637668147551895, "grad_norm": 0.56640625, "learning_rate": 2.9483776740073748e-05, "loss": 0.40323166847229003, "num_input_tokens_seen": 5334099904, "step": 18760, "train_runtime": 182381.0214, "train_tokens_per_second": 29247.012 }, { "epoch": 0.6641206350189184, "grad_norm": 0.59375, "learning_rate": 2.947865206780518e-05, "loss": 0.4053342819213867, "num_input_tokens_seen": 5336928320, "step": 18770, "train_runtime": 182479.2312, "train_tokens_per_second": 29246.771 }, { "epoch": 0.6644744552826471, "grad_norm": 0.5859375, "learning_rate": 2.947353006681647e-05, "loss": 0.4063398361206055, "num_input_tokens_seen": 5339757504, "step": 18780, "train_runtime": 182577.407, "train_tokens_per_second": 29246.54 }, { "epoch": 0.6648282755463759, "grad_norm": 0.62890625, "learning_rate": 2.9468410734787717e-05, "loss": 0.4052834987640381, "num_input_tokens_seen": 5342539648, "step": 18790, "train_runtime": 182670.8025, "train_tokens_per_second": 29246.818 }, { "epoch": 0.6651820958101047, "grad_norm": 0.58984375, "learning_rate": 2.9463294069401838e-05, "loss": 0.4044794082641602, "num_input_tokens_seen": 5345349760, "step": 18800, "train_runtime": 182767.8813, "train_tokens_per_second": 29246.658 }, { "epoch": 0.6655359160738334, "grad_norm": 0.59375, "learning_rate": 2.9458180068344555e-05, "loss": 0.40369515419006347, "num_input_tokens_seen": 5348219840, "step": 18810, "train_runtime": 182864.9127, "train_tokens_per_second": 29246.835 }, { "epoch": 0.6658897363375622, "grad_norm": 0.5703125, "learning_rate": 2.9453068729304407e-05, "loss": 0.40727624893188474, "num_input_tokens_seen": 5351087040, "step": 18820, "train_runtime": 182963.0546, "train_tokens_per_second": 29246.817 }, { "epoch": 0.666243556601291, "grad_norm": 0.61328125, "learning_rate": 2.944796004997274e-05, "loss": 0.40417704582214353, "num_input_tokens_seen": 5353951744, "step": 18830, "train_runtime": 183062.4412, "train_tokens_per_second": 29246.588 }, { "epoch": 0.6665973768650197, "grad_norm": 0.59375, "learning_rate": 2.94428540280437e-05, "loss": 0.40285549163818357, "num_input_tokens_seen": 5356777280, "step": 18840, "train_runtime": 183159.0265, "train_tokens_per_second": 29246.592 }, { "epoch": 0.6669511971287485, "grad_norm": 0.59375, "learning_rate": 2.9437750661214242e-05, "loss": 0.4091742992401123, "num_input_tokens_seen": 5359628992, "step": 18850, "train_runtime": 183257.4138, "train_tokens_per_second": 29246.451 }, { "epoch": 0.6673050173924774, "grad_norm": 0.60546875, "learning_rate": 2.9432649947184094e-05, "loss": 0.40563039779663085, "num_input_tokens_seen": 5362466496, "step": 18860, "train_runtime": 183354.4268, "train_tokens_per_second": 29246.452 }, { "epoch": 0.6676588376562061, "grad_norm": 0.58203125, "learning_rate": 2.942755188365579e-05, "loss": 0.39965798854827883, "num_input_tokens_seen": 5365309760, "step": 18870, "train_runtime": 183448.7223, "train_tokens_per_second": 29246.918 }, { "epoch": 0.6680126579199349, "grad_norm": 0.58203125, "learning_rate": 2.9422456468334635e-05, "loss": 0.4059948444366455, "num_input_tokens_seen": 5368185728, "step": 18880, "train_runtime": 183547.5694, "train_tokens_per_second": 29246.836 }, { "epoch": 0.6683664781836637, "grad_norm": 0.57421875, "learning_rate": 2.9417363698928734e-05, "loss": 0.4070162296295166, "num_input_tokens_seen": 5371068544, "step": 18890, "train_runtime": 183646.1575, "train_tokens_per_second": 29246.833 }, { "epoch": 0.6687202984473924, "grad_norm": 0.58203125, "learning_rate": 2.9412273573148946e-05, "loss": 0.406981897354126, "num_input_tokens_seen": 5373968000, "step": 18900, "train_runtime": 183744.5213, "train_tokens_per_second": 29246.956 }, { "epoch": 0.6690741187111212, "grad_norm": 0.5859375, "learning_rate": 2.940718608870891e-05, "loss": 0.40624003410339354, "num_input_tokens_seen": 5376826432, "step": 18910, "train_runtime": 183840.8011, "train_tokens_per_second": 29247.188 }, { "epoch": 0.66942793897485, "grad_norm": 0.5703125, "learning_rate": 2.940210124332504e-05, "loss": 0.4022181510925293, "num_input_tokens_seen": 5379688192, "step": 18920, "train_runtime": 183938.5568, "train_tokens_per_second": 29247.202 }, { "epoch": 0.6697817592385787, "grad_norm": 0.62109375, "learning_rate": 2.9397019034716504e-05, "loss": 0.3991296052932739, "num_input_tokens_seen": 5382474368, "step": 18930, "train_runtime": 184031.302, "train_tokens_per_second": 29247.602 }, { "epoch": 0.6701355795023076, "grad_norm": 0.5859375, "learning_rate": 2.9391939460605233e-05, "loss": 0.4051826953887939, "num_input_tokens_seen": 5385377792, "step": 18940, "train_runtime": 184132.8964, "train_tokens_per_second": 29247.233 }, { "epoch": 0.6704893997660364, "grad_norm": 0.578125, "learning_rate": 2.9386862518715914e-05, "loss": 0.4025622844696045, "num_input_tokens_seen": 5388224832, "step": 18950, "train_runtime": 184230.0332, "train_tokens_per_second": 29247.266 }, { "epoch": 0.6708432200297652, "grad_norm": 0.5625, "learning_rate": 2.9381788206775966e-05, "loss": 0.4046022415161133, "num_input_tokens_seen": 5391128576, "step": 18960, "train_runtime": 184329.5082, "train_tokens_per_second": 29247.236 }, { "epoch": 0.6711970402934939, "grad_norm": 0.58984375, "learning_rate": 2.937671652251559e-05, "loss": 0.40441365242004396, "num_input_tokens_seen": 5393952960, "step": 18970, "train_runtime": 184424.9768, "train_tokens_per_second": 29247.41 }, { "epoch": 0.6715508605572227, "grad_norm": 0.58203125, "learning_rate": 2.9371647463667696e-05, "loss": 0.4034428119659424, "num_input_tokens_seen": 5396779968, "step": 18980, "train_runtime": 184520.3678, "train_tokens_per_second": 29247.611 }, { "epoch": 0.6719046808209514, "grad_norm": 0.57421875, "learning_rate": 2.9366581027967943e-05, "loss": 0.40221443176269533, "num_input_tokens_seen": 5399650560, "step": 18990, "train_runtime": 184618.8784, "train_tokens_per_second": 29247.554 }, { "epoch": 0.6722585010846802, "grad_norm": 0.5859375, "learning_rate": 2.9361517213154726e-05, "loss": 0.39937705993652345, "num_input_tokens_seen": 5402479168, "step": 19000, "train_runtime": 184716.1811, "train_tokens_per_second": 29247.46 }, { "epoch": 0.672612321348409, "grad_norm": 0.60546875, "learning_rate": 2.935645601696917e-05, "loss": 0.4040325164794922, "num_input_tokens_seen": 5405312896, "step": 19010, "train_runtime": 184811.7598, "train_tokens_per_second": 29247.667 }, { "epoch": 0.6729661416121379, "grad_norm": 0.59765625, "learning_rate": 2.9351397437155114e-05, "loss": 0.4082945346832275, "num_input_tokens_seen": 5408159488, "step": 19020, "train_runtime": 184910.5219, "train_tokens_per_second": 29247.441 }, { "epoch": 0.6733199618758666, "grad_norm": 0.58984375, "learning_rate": 2.934634147145913e-05, "loss": 0.4019640922546387, "num_input_tokens_seen": 5411064832, "step": 19030, "train_runtime": 185014.0706, "train_tokens_per_second": 29246.775 }, { "epoch": 0.6736737821395954, "grad_norm": 0.609375, "learning_rate": 2.9341288117630495e-05, "loss": 0.4040031909942627, "num_input_tokens_seen": 5413963968, "step": 19040, "train_runtime": 185116.6782, "train_tokens_per_second": 29246.225 }, { "epoch": 0.6740276024033242, "grad_norm": 0.59375, "learning_rate": 2.933623737342121e-05, "loss": 0.40644545555114747, "num_input_tokens_seen": 5416799744, "step": 19050, "train_runtime": 185213.9087, "train_tokens_per_second": 29246.182 }, { "epoch": 0.6743814226670529, "grad_norm": 0.58203125, "learning_rate": 2.9331189236585977e-05, "loss": 0.4047755241394043, "num_input_tokens_seen": 5419656768, "step": 19060, "train_runtime": 185311.5507, "train_tokens_per_second": 29246.19 }, { "epoch": 0.6747352429307817, "grad_norm": 0.578125, "learning_rate": 2.9326143704882192e-05, "loss": 0.403855037689209, "num_input_tokens_seen": 5422565120, "step": 19070, "train_runtime": 185412.0806, "train_tokens_per_second": 29246.018 }, { "epoch": 0.6750890631945105, "grad_norm": 0.58203125, "learning_rate": 2.932110077606997e-05, "loss": 0.4038975238800049, "num_input_tokens_seen": 5425444800, "step": 19080, "train_runtime": 185508.9213, "train_tokens_per_second": 29246.274 }, { "epoch": 0.6754428834582392, "grad_norm": 0.59375, "learning_rate": 2.931606044791212e-05, "loss": 0.406279182434082, "num_input_tokens_seen": 5428307008, "step": 19090, "train_runtime": 185605.7343, "train_tokens_per_second": 29246.44 }, { "epoch": 0.675796703721968, "grad_norm": 0.62109375, "learning_rate": 2.9311022718174114e-05, "loss": 0.4090275764465332, "num_input_tokens_seen": 5431148672, "step": 19100, "train_runtime": 185701.6331, "train_tokens_per_second": 29246.639 }, { "epoch": 0.6761505239856969, "grad_norm": 0.58984375, "learning_rate": 2.930598758462415e-05, "loss": 0.4032048225402832, "num_input_tokens_seen": 5433984128, "step": 19110, "train_runtime": 185797.9786, "train_tokens_per_second": 29246.734 }, { "epoch": 0.6765043442494256, "grad_norm": 0.578125, "learning_rate": 2.9300955045033072e-05, "loss": 0.40287294387817385, "num_input_tokens_seen": 5436845760, "step": 19120, "train_runtime": 185896.0779, "train_tokens_per_second": 29246.694 }, { "epoch": 0.6768581645131544, "grad_norm": 0.609375, "learning_rate": 2.9295925097174435e-05, "loss": 0.40950851440429686, "num_input_tokens_seen": 5439687872, "step": 19130, "train_runtime": 185992.9622, "train_tokens_per_second": 29246.74 }, { "epoch": 0.6772119847768832, "grad_norm": 0.58984375, "learning_rate": 2.929089773882445e-05, "loss": 0.39822540283203123, "num_input_tokens_seen": 5442598016, "step": 19140, "train_runtime": 186092.7309, "train_tokens_per_second": 29246.699 }, { "epoch": 0.6775658050406119, "grad_norm": 0.58984375, "learning_rate": 2.9285872967762007e-05, "loss": 0.40432300567626955, "num_input_tokens_seen": 5445430784, "step": 19150, "train_runtime": 186190.2248, "train_tokens_per_second": 29246.599 }, { "epoch": 0.6779196253043407, "grad_norm": 0.56640625, "learning_rate": 2.9280850781768638e-05, "loss": 0.40349321365356444, "num_input_tokens_seen": 5448254016, "step": 19160, "train_runtime": 186285.4888, "train_tokens_per_second": 29246.798 }, { "epoch": 0.6782734455680695, "grad_norm": 0.58203125, "learning_rate": 2.9275831178628576e-05, "loss": 0.4038459300994873, "num_input_tokens_seen": 5451079232, "step": 19170, "train_runtime": 186383.2017, "train_tokens_per_second": 29246.623 }, { "epoch": 0.6786272658317982, "grad_norm": 0.5546875, "learning_rate": 2.927081415612869e-05, "loss": 0.40450258255004884, "num_input_tokens_seen": 5453943552, "step": 19180, "train_runtime": 186479.595, "train_tokens_per_second": 29246.865 }, { "epoch": 0.6789810860955271, "grad_norm": 0.55859375, "learning_rate": 2.9265799712058505e-05, "loss": 0.4013828277587891, "num_input_tokens_seen": 5456769984, "step": 19190, "train_runtime": 186577.021, "train_tokens_per_second": 29246.742 }, { "epoch": 0.6793349063592559, "grad_norm": 0.57421875, "learning_rate": 2.926078784421019e-05, "loss": 0.40457735061645506, "num_input_tokens_seen": 5459565120, "step": 19200, "train_runtime": 186673.2695, "train_tokens_per_second": 29246.636 }, { "epoch": 0.6796887266229846, "grad_norm": 0.58203125, "learning_rate": 2.9255778550378575e-05, "loss": 0.40732393264770506, "num_input_tokens_seen": 5462365376, "step": 19210, "train_runtime": 186767.7108, "train_tokens_per_second": 29246.84 }, { "epoch": 0.6800425468867134, "grad_norm": 0.6015625, "learning_rate": 2.9250771828361118e-05, "loss": 0.40843663215637205, "num_input_tokens_seen": 5465167104, "step": 19220, "train_runtime": 186862.1113, "train_tokens_per_second": 29247.059 }, { "epoch": 0.6803963671504422, "grad_norm": 0.56640625, "learning_rate": 2.9245767675957923e-05, "loss": 0.40323553085327146, "num_input_tokens_seen": 5468045760, "step": 19230, "train_runtime": 186963.0588, "train_tokens_per_second": 29246.664 }, { "epoch": 0.6807501874141709, "grad_norm": 0.59765625, "learning_rate": 2.924076609097172e-05, "loss": 0.4037144184112549, "num_input_tokens_seen": 5470898304, "step": 19240, "train_runtime": 187059.6483, "train_tokens_per_second": 29246.812 }, { "epoch": 0.6811040076778997, "grad_norm": 0.59765625, "learning_rate": 2.9235767071207876e-05, "loss": 0.4081141471862793, "num_input_tokens_seen": 5473720128, "step": 19250, "train_runtime": 187157.8261, "train_tokens_per_second": 29246.547 }, { "epoch": 0.6814578279416285, "grad_norm": 0.59375, "learning_rate": 2.9230770614474383e-05, "loss": 0.4026987075805664, "num_input_tokens_seen": 5476543296, "step": 19260, "train_runtime": 187251.8523, "train_tokens_per_second": 29246.938 }, { "epoch": 0.6818116482053573, "grad_norm": 0.55859375, "learning_rate": 2.9225776718581842e-05, "loss": 0.4051219940185547, "num_input_tokens_seen": 5479396800, "step": 19270, "train_runtime": 187351.6803, "train_tokens_per_second": 29246.585 }, { "epoch": 0.6821654684690861, "grad_norm": 0.62890625, "learning_rate": 2.9220785381343495e-05, "loss": 0.40059242248535154, "num_input_tokens_seen": 5482251968, "step": 19280, "train_runtime": 187447.6358, "train_tokens_per_second": 29246.845 }, { "epoch": 0.6825192887328149, "grad_norm": 0.58203125, "learning_rate": 2.9215796600575174e-05, "loss": 0.4052286624908447, "num_input_tokens_seen": 5485147520, "step": 19290, "train_runtime": 187546.0509, "train_tokens_per_second": 29246.937 }, { "epoch": 0.6828731089965436, "grad_norm": 0.6015625, "learning_rate": 2.9210810374095332e-05, "loss": 0.40407209396362304, "num_input_tokens_seen": 5488081408, "step": 19300, "train_runtime": 187649.9708, "train_tokens_per_second": 29246.375 }, { "epoch": 0.6832269292602724, "grad_norm": 0.6015625, "learning_rate": 2.9205826699725026e-05, "loss": 0.403245210647583, "num_input_tokens_seen": 5490922368, "step": 19310, "train_runtime": 187746.8513, "train_tokens_per_second": 29246.415 }, { "epoch": 0.6835807495240012, "grad_norm": 0.58203125, "learning_rate": 2.920084557528791e-05, "loss": 0.40039286613464353, "num_input_tokens_seen": 5493779520, "step": 19320, "train_runtime": 187844.489, "train_tokens_per_second": 29246.424 }, { "epoch": 0.6839345697877299, "grad_norm": 0.58984375, "learning_rate": 2.9195866998610245e-05, "loss": 0.40297584533691405, "num_input_tokens_seen": 5496683584, "step": 19330, "train_runtime": 187944.5477, "train_tokens_per_second": 29246.305 }, { "epoch": 0.6842883900514587, "grad_norm": 0.5703125, "learning_rate": 2.9190890967520878e-05, "loss": 0.4039573669433594, "num_input_tokens_seen": 5499504832, "step": 19340, "train_runtime": 188040.7147, "train_tokens_per_second": 29246.351 }, { "epoch": 0.6846422103151875, "grad_norm": 0.58984375, "learning_rate": 2.9185917479851243e-05, "loss": 0.40180506706237795, "num_input_tokens_seen": 5502320448, "step": 19350, "train_runtime": 188134.4847, "train_tokens_per_second": 29246.74 }, { "epoch": 0.6849960305789163, "grad_norm": 0.59375, "learning_rate": 2.9180946533435366e-05, "loss": 0.40492935180664064, "num_input_tokens_seen": 5505159232, "step": 19360, "train_runtime": 188232.8225, "train_tokens_per_second": 29246.542 }, { "epoch": 0.6853498508426451, "grad_norm": 0.5859375, "learning_rate": 2.9175978126109853e-05, "loss": 0.40566396713256836, "num_input_tokens_seen": 5508060096, "step": 19370, "train_runtime": 188331.6847, "train_tokens_per_second": 29246.593 }, { "epoch": 0.6857036711063739, "grad_norm": 0.58984375, "learning_rate": 2.9171012255713885e-05, "loss": 0.40088791847229005, "num_input_tokens_seen": 5510877184, "step": 19380, "train_runtime": 188426.1362, "train_tokens_per_second": 29246.883 }, { "epoch": 0.6860574913701026, "grad_norm": 0.57421875, "learning_rate": 2.9166048920089217e-05, "loss": 0.40096755027770997, "num_input_tokens_seen": 5513754944, "step": 19390, "train_runtime": 188525.269, "train_tokens_per_second": 29246.769 }, { "epoch": 0.6864113116338314, "grad_norm": 0.59375, "learning_rate": 2.9161088117080175e-05, "loss": 0.4008651256561279, "num_input_tokens_seen": 5516608448, "step": 19400, "train_runtime": 188622.2714, "train_tokens_per_second": 29246.856 }, { "epoch": 0.6867651318975602, "grad_norm": 0.6015625, "learning_rate": 2.9156129844533658e-05, "loss": 0.4028066635131836, "num_input_tokens_seen": 5519425216, "step": 19410, "train_runtime": 188718.2727, "train_tokens_per_second": 29246.904 }, { "epoch": 0.6871189521612889, "grad_norm": 0.59765625, "learning_rate": 2.9151174100299104e-05, "loss": 0.40504870414733884, "num_input_tokens_seen": 5522282560, "step": 19420, "train_runtime": 188815.3237, "train_tokens_per_second": 29247.004 }, { "epoch": 0.6874727724250177, "grad_norm": 0.6015625, "learning_rate": 2.9146220882228535e-05, "loss": 0.40459461212158204, "num_input_tokens_seen": 5525120704, "step": 19430, "train_runtime": 188911.3949, "train_tokens_per_second": 29247.154 }, { "epoch": 0.6878265926887466, "grad_norm": 0.5703125, "learning_rate": 2.914127018817651e-05, "loss": 0.404727840423584, "num_input_tokens_seen": 5527968768, "step": 19440, "train_runtime": 189007.6364, "train_tokens_per_second": 29247.33 }, { "epoch": 0.6881804129524753, "grad_norm": 0.578125, "learning_rate": 2.9136322016000152e-05, "loss": 0.40401601791381836, "num_input_tokens_seen": 5530816640, "step": 19450, "train_runtime": 189104.0575, "train_tokens_per_second": 29247.477 }, { "epoch": 0.6885342332162041, "grad_norm": 0.6015625, "learning_rate": 2.9131376363559116e-05, "loss": 0.4041296005249023, "num_input_tokens_seen": 5533670784, "step": 19460, "train_runtime": 189202.7079, "train_tokens_per_second": 29247.313 }, { "epoch": 0.6888880534799329, "grad_norm": 0.5703125, "learning_rate": 2.9126433228715606e-05, "loss": 0.40099411010742186, "num_input_tokens_seen": 5536528192, "step": 19470, "train_runtime": 189300.3092, "train_tokens_per_second": 29247.328 }, { "epoch": 0.6892418737436616, "grad_norm": 0.61328125, "learning_rate": 2.9121492609334354e-05, "loss": 0.3998518466949463, "num_input_tokens_seen": 5539371584, "step": 19480, "train_runtime": 189398.7008, "train_tokens_per_second": 29247.147 }, { "epoch": 0.6895956940073904, "grad_norm": 0.578125, "learning_rate": 2.9116554503282656e-05, "loss": 0.40839290618896484, "num_input_tokens_seen": 5542197632, "step": 19490, "train_runtime": 189496.4358, "train_tokens_per_second": 29246.976 }, { "epoch": 0.6899495142711192, "grad_norm": 0.5859375, "learning_rate": 2.9111618908430303e-05, "loss": 0.40813555717468264, "num_input_tokens_seen": 5545063616, "step": 19500, "train_runtime": 189593.6999, "train_tokens_per_second": 29247.088 }, { "epoch": 0.6903033345348479, "grad_norm": 0.5703125, "learning_rate": 2.9106685822649643e-05, "loss": 0.4031411647796631, "num_input_tokens_seen": 5547930752, "step": 19510, "train_runtime": 189693.8308, "train_tokens_per_second": 29246.764 }, { "epoch": 0.6906571547985768, "grad_norm": 0.58203125, "learning_rate": 2.910175524381552e-05, "loss": 0.4062369346618652, "num_input_tokens_seen": 5550838656, "step": 19520, "train_runtime": 189795.7178, "train_tokens_per_second": 29246.385 }, { "epoch": 0.6910109750623056, "grad_norm": 0.58984375, "learning_rate": 2.9096827169805318e-05, "loss": 0.40814809799194335, "num_input_tokens_seen": 5553703552, "step": 19530, "train_runtime": 189892.8483, "train_tokens_per_second": 29246.512 }, { "epoch": 0.6913647953260343, "grad_norm": 0.61328125, "learning_rate": 2.9091901598498923e-05, "loss": 0.3996427536010742, "num_input_tokens_seen": 5556544960, "step": 19540, "train_runtime": 189988.2257, "train_tokens_per_second": 29246.786 }, { "epoch": 0.6917186155897631, "grad_norm": 0.55078125, "learning_rate": 2.9086978527778736e-05, "loss": 0.4041744709014893, "num_input_tokens_seen": 5559399936, "step": 19550, "train_runtime": 190088.2654, "train_tokens_per_second": 29246.413 }, { "epoch": 0.6920724358534919, "grad_norm": 0.59375, "learning_rate": 2.9082057955529668e-05, "loss": 0.4075783252716064, "num_input_tokens_seen": 5562200832, "step": 19560, "train_runtime": 190182.9895, "train_tokens_per_second": 29246.574 }, { "epoch": 0.6924262561172206, "grad_norm": 0.5859375, "learning_rate": 2.907713987963914e-05, "loss": 0.40821161270141604, "num_input_tokens_seen": 5565021952, "step": 19570, "train_runtime": 190278.3861, "train_tokens_per_second": 29246.737 }, { "epoch": 0.6927800763809494, "grad_norm": 0.5703125, "learning_rate": 2.9072224297997058e-05, "loss": 0.4013996601104736, "num_input_tokens_seen": 5567839552, "step": 19580, "train_runtime": 190373.5433, "train_tokens_per_second": 29246.919 }, { "epoch": 0.6931338966446782, "grad_norm": 0.6015625, "learning_rate": 2.9067311208495834e-05, "loss": 0.40244307518005373, "num_input_tokens_seen": 5570708480, "step": 19590, "train_runtime": 190471.9239, "train_tokens_per_second": 29246.875 }, { "epoch": 0.6934877169084069, "grad_norm": 0.59765625, "learning_rate": 2.9062400609030372e-05, "loss": 0.4038554191589355, "num_input_tokens_seen": 5573613440, "step": 19600, "train_runtime": 190576.8293, "train_tokens_per_second": 29246.018 }, { "epoch": 0.6938415371721358, "grad_norm": 0.58984375, "learning_rate": 2.905749249749806e-05, "loss": 0.40879669189453127, "num_input_tokens_seen": 5576448704, "step": 19610, "train_runtime": 190672.7253, "train_tokens_per_second": 29246.179 }, { "epoch": 0.6941953574358646, "grad_norm": 0.59375, "learning_rate": 2.905258687179878e-05, "loss": 0.40604748725891116, "num_input_tokens_seen": 5579299264, "step": 19620, "train_runtime": 190771.4989, "train_tokens_per_second": 29245.979 }, { "epoch": 0.6945491776995933, "grad_norm": 0.55859375, "learning_rate": 2.904768372983488e-05, "loss": 0.3974184989929199, "num_input_tokens_seen": 5582173632, "step": 19630, "train_runtime": 190870.5376, "train_tokens_per_second": 29245.863 }, { "epoch": 0.6949029979633221, "grad_norm": 0.60546875, "learning_rate": 2.90427830695112e-05, "loss": 0.4015629768371582, "num_input_tokens_seen": 5585031104, "step": 19640, "train_runtime": 190967.3811, "train_tokens_per_second": 29245.995 }, { "epoch": 0.6952568182270509, "grad_norm": 0.578125, "learning_rate": 2.9037884888735044e-05, "loss": 0.40587544441223145, "num_input_tokens_seen": 5587897024, "step": 19650, "train_runtime": 191064.6038, "train_tokens_per_second": 29246.113 }, { "epoch": 0.6956106384907796, "grad_norm": 0.5859375, "learning_rate": 2.9032989185416194e-05, "loss": 0.40116868019104, "num_input_tokens_seen": 5590733440, "step": 19660, "train_runtime": 191159.7141, "train_tokens_per_second": 29246.4 }, { "epoch": 0.6959644587545084, "grad_norm": 0.5859375, "learning_rate": 2.9028095957466888e-05, "loss": 0.4036966323852539, "num_input_tokens_seen": 5593578688, "step": 19670, "train_runtime": 191259.5813, "train_tokens_per_second": 29246.005 }, { "epoch": 0.6963182790182372, "grad_norm": 0.57421875, "learning_rate": 2.9023205202801833e-05, "loss": 0.4065293312072754, "num_input_tokens_seen": 5596428224, "step": 19680, "train_runtime": 191359.8402, "train_tokens_per_second": 29245.573 }, { "epoch": 0.696672099281966, "grad_norm": 0.5625, "learning_rate": 2.90183169193382e-05, "loss": 0.40302457809448244, "num_input_tokens_seen": 5599307520, "step": 19690, "train_runtime": 191458.7617, "train_tokens_per_second": 29245.502 }, { "epoch": 0.6970259195456948, "grad_norm": 0.58984375, "learning_rate": 2.90134311049956e-05, "loss": 0.4052546501159668, "num_input_tokens_seen": 5602154304, "step": 19700, "train_runtime": 191557.3991, "train_tokens_per_second": 29245.304 }, { "epoch": 0.6973797398094236, "grad_norm": 0.58984375, "learning_rate": 2.90085477576961e-05, "loss": 0.4053903579711914, "num_input_tokens_seen": 5605031168, "step": 19710, "train_runtime": 191657.1076, "train_tokens_per_second": 29245.099 }, { "epoch": 0.6977335600731523, "grad_norm": 0.5859375, "learning_rate": 2.9003666875364226e-05, "loss": 0.40281357765197756, "num_input_tokens_seen": 5607879552, "step": 19720, "train_runtime": 191757.3348, "train_tokens_per_second": 29244.668 }, { "epoch": 0.6980873803368811, "grad_norm": 0.5859375, "learning_rate": 2.899878845592694e-05, "loss": 0.4050135612487793, "num_input_tokens_seen": 5610736960, "step": 19730, "train_runtime": 191854.1822, "train_tokens_per_second": 29244.799 }, { "epoch": 0.6984412006006099, "grad_norm": 0.59765625, "learning_rate": 2.8993912497313636e-05, "loss": 0.40939970016479493, "num_input_tokens_seen": 5613547520, "step": 19740, "train_runtime": 191949.555, "train_tokens_per_second": 29244.91 }, { "epoch": 0.6987950208643386, "grad_norm": 0.57421875, "learning_rate": 2.8989038997456153e-05, "loss": 0.4023500919342041, "num_input_tokens_seen": 5616413824, "step": 19750, "train_runtime": 192049.239, "train_tokens_per_second": 29244.655 }, { "epoch": 0.6991488411280674, "grad_norm": 0.609375, "learning_rate": 2.898416795428876e-05, "loss": 0.39735095500946044, "num_input_tokens_seen": 5619273088, "step": 19760, "train_runtime": 192147.72, "train_tokens_per_second": 29244.547 }, { "epoch": 0.6995026613917963, "grad_norm": 0.57421875, "learning_rate": 2.897929936574816e-05, "loss": 0.40691452026367186, "num_input_tokens_seen": 5622143360, "step": 19770, "train_runtime": 192246.3783, "train_tokens_per_second": 29244.47 }, { "epoch": 0.699856481655525, "grad_norm": 0.5703125, "learning_rate": 2.8974433229773478e-05, "loss": 0.4022841930389404, "num_input_tokens_seen": 5624978304, "step": 19780, "train_runtime": 192343.5262, "train_tokens_per_second": 29244.438 }, { "epoch": 0.7002103019192538, "grad_norm": 0.578125, "learning_rate": 2.896956954430625e-05, "loss": 0.4064777374267578, "num_input_tokens_seen": 5627826944, "step": 19790, "train_runtime": 192439.5079, "train_tokens_per_second": 29244.655 }, { "epoch": 0.7005641221829826, "grad_norm": 0.57421875, "learning_rate": 2.896470830729045e-05, "loss": 0.40154685974121096, "num_input_tokens_seen": 5630693376, "step": 19800, "train_runtime": 192538.2174, "train_tokens_per_second": 29244.549 }, { "epoch": 0.7009179424467114, "grad_norm": 0.6015625, "learning_rate": 2.895984951667245e-05, "loss": 0.3982991218566895, "num_input_tokens_seen": 5633505024, "step": 19810, "train_runtime": 192634.6196, "train_tokens_per_second": 29244.51 }, { "epoch": 0.7012717627104401, "grad_norm": 0.58203125, "learning_rate": 2.8954993170401047e-05, "loss": 0.40444517135620117, "num_input_tokens_seen": 5636371072, "step": 19820, "train_runtime": 192733.9249, "train_tokens_per_second": 29244.312 }, { "epoch": 0.7016255829741689, "grad_norm": 0.6171875, "learning_rate": 2.8950139266427423e-05, "loss": 0.4031824111938477, "num_input_tokens_seen": 5639171712, "step": 19830, "train_runtime": 192833.5845, "train_tokens_per_second": 29243.722 }, { "epoch": 0.7019794032378976, "grad_norm": 0.5703125, "learning_rate": 2.8945287802705186e-05, "loss": 0.40310916900634763, "num_input_tokens_seen": 5642090560, "step": 19840, "train_runtime": 192937.0257, "train_tokens_per_second": 29243.172 }, { "epoch": 0.7023332235016264, "grad_norm": 0.57421875, "learning_rate": 2.8940438777190336e-05, "loss": 0.4033676624298096, "num_input_tokens_seen": 5644966464, "step": 19850, "train_runtime": 193034.7286, "train_tokens_per_second": 29243.269 }, { "epoch": 0.7026870437653553, "grad_norm": 0.58984375, "learning_rate": 2.8935592187841265e-05, "loss": 0.4016928195953369, "num_input_tokens_seen": 5647789632, "step": 19860, "train_runtime": 193131.0233, "train_tokens_per_second": 29243.306 }, { "epoch": 0.7030408640290841, "grad_norm": 0.59375, "learning_rate": 2.893074803261876e-05, "loss": 0.40922183990478517, "num_input_tokens_seen": 5650654400, "step": 19870, "train_runtime": 193229.4359, "train_tokens_per_second": 29243.238 }, { "epoch": 0.7033946842928128, "grad_norm": 0.5703125, "learning_rate": 2.8925906309485995e-05, "loss": 0.4039417266845703, "num_input_tokens_seen": 5653547328, "step": 19880, "train_runtime": 193328.4804, "train_tokens_per_second": 29243.22 }, { "epoch": 0.7037485045565416, "grad_norm": 0.578125, "learning_rate": 2.8921067016408532e-05, "loss": 0.3992153644561768, "num_input_tokens_seen": 5656377152, "step": 19890, "train_runtime": 193422.4224, "train_tokens_per_second": 29243.648 }, { "epoch": 0.7041023248202704, "grad_norm": 0.6015625, "learning_rate": 2.8916230151354316e-05, "loss": 0.40674762725830077, "num_input_tokens_seen": 5659159808, "step": 19900, "train_runtime": 193517.1736, "train_tokens_per_second": 29243.708 }, { "epoch": 0.7044561450839991, "grad_norm": 0.58984375, "learning_rate": 2.8911395712293677e-05, "loss": 0.4048741817474365, "num_input_tokens_seen": 5661991040, "step": 19910, "train_runtime": 193613.7713, "train_tokens_per_second": 29243.741 }, { "epoch": 0.7048099653477279, "grad_norm": 0.59375, "learning_rate": 2.8906563697199294e-05, "loss": 0.40169076919555663, "num_input_tokens_seen": 5664812992, "step": 19920, "train_runtime": 193708.9337, "train_tokens_per_second": 29243.943 }, { "epoch": 0.7051637856114567, "grad_norm": 0.5703125, "learning_rate": 2.8901734104046245e-05, "loss": 0.400034236907959, "num_input_tokens_seen": 5667594496, "step": 19930, "train_runtime": 193803.5676, "train_tokens_per_second": 29244.015 }, { "epoch": 0.7055176058751855, "grad_norm": 0.5859375, "learning_rate": 2.8896906930811964e-05, "loss": 0.40499048233032225, "num_input_tokens_seen": 5670416896, "step": 19940, "train_runtime": 193897.6874, "train_tokens_per_second": 29244.376 }, { "epoch": 0.7058714261389143, "grad_norm": 0.6015625, "learning_rate": 2.8892082175476243e-05, "loss": 0.40171356201171876, "num_input_tokens_seen": 5673184896, "step": 19950, "train_runtime": 193988.9811, "train_tokens_per_second": 29244.882 }, { "epoch": 0.7062252464026431, "grad_norm": 0.59765625, "learning_rate": 2.8887259836021246e-05, "loss": 0.4029547214508057, "num_input_tokens_seen": 5676008320, "step": 19960, "train_runtime": 194084.197, "train_tokens_per_second": 29245.082 }, { "epoch": 0.7065790666663718, "grad_norm": 0.59765625, "learning_rate": 2.8882439910431493e-05, "loss": 0.4039130210876465, "num_input_tokens_seen": 5678878592, "step": 19970, "train_runtime": 194184.391, "train_tokens_per_second": 29244.774 }, { "epoch": 0.7069328869301006, "grad_norm": 0.578125, "learning_rate": 2.8877622396693843e-05, "loss": 0.4053036689758301, "num_input_tokens_seen": 5681686336, "step": 19980, "train_runtime": 194278.5254, "train_tokens_per_second": 29245.056 }, { "epoch": 0.7072867071938294, "grad_norm": 0.578125, "learning_rate": 2.8872807292797516e-05, "loss": 0.4042822360992432, "num_input_tokens_seen": 5684484224, "step": 19990, "train_runtime": 194372.274, "train_tokens_per_second": 29245.345 }, { "epoch": 0.7076405274575581, "grad_norm": 0.546875, "learning_rate": 2.8867994596734084e-05, "loss": 0.399719762802124, "num_input_tokens_seen": 5687337600, "step": 20000, "train_runtime": 194469.5424, "train_tokens_per_second": 29245.39 }, { "epoch": 0.7076405274575581, "eval_loss": 0.3405376076698303, "eval_runtime": 8.4222, "eval_samples_per_second": 473.509, "eval_steps_per_second": 3.799, "num_input_tokens_seen": 5687337600, "step": 20000 }, { "epoch": 0.7079943477212869, "grad_norm": 0.5859375, "learning_rate": 2.8863184306497437e-05, "loss": 0.40539979934692383, "num_input_tokens_seen": 5690213376, "step": 20010, "train_runtime": 194599.4527, "train_tokens_per_second": 29240.644 }, { "epoch": 0.7083481679850158, "grad_norm": 0.6015625, "learning_rate": 2.8858376420083848e-05, "loss": 0.4044796466827393, "num_input_tokens_seen": 5693051008, "step": 20020, "train_runtime": 194694.6999, "train_tokens_per_second": 29240.914 }, { "epoch": 0.7087019882487445, "grad_norm": 0.58203125, "learning_rate": 2.8853570935491873e-05, "loss": 0.40385894775390624, "num_input_tokens_seen": 5695909696, "step": 20030, "train_runtime": 194791.9793, "train_tokens_per_second": 29240.987 }, { "epoch": 0.7090558085124733, "grad_norm": 0.578125, "learning_rate": 2.8848767850722447e-05, "loss": 0.40356879234313964, "num_input_tokens_seen": 5698707008, "step": 20040, "train_runtime": 194884.5988, "train_tokens_per_second": 29241.444 }, { "epoch": 0.7094096287762021, "grad_norm": 0.61328125, "learning_rate": 2.88439671637788e-05, "loss": 0.4030400276184082, "num_input_tokens_seen": 5701546880, "step": 20050, "train_runtime": 194978.3596, "train_tokens_per_second": 29241.947 }, { "epoch": 0.7097634490399308, "grad_norm": 0.578125, "learning_rate": 2.8839168872666505e-05, "loss": 0.39932711124420167, "num_input_tokens_seen": 5704427968, "step": 20060, "train_runtime": 195077.5007, "train_tokens_per_second": 29241.855 }, { "epoch": 0.7101172693036596, "grad_norm": 0.59375, "learning_rate": 2.8834372975393448e-05, "loss": 0.40181674957275393, "num_input_tokens_seen": 5707261696, "step": 20070, "train_runtime": 195176.1073, "train_tokens_per_second": 29241.6 }, { "epoch": 0.7104710895673884, "grad_norm": 0.59765625, "learning_rate": 2.8829579469969843e-05, "loss": 0.4052821159362793, "num_input_tokens_seen": 5710143360, "step": 20080, "train_runtime": 195276.995, "train_tokens_per_second": 29241.25 }, { "epoch": 0.7108249098311171, "grad_norm": 0.59375, "learning_rate": 2.88247883544082e-05, "loss": 0.39843552112579345, "num_input_tokens_seen": 5712987712, "step": 20090, "train_runtime": 195372.1321, "train_tokens_per_second": 29241.569 }, { "epoch": 0.7111787300948459, "grad_norm": 0.609375, "learning_rate": 2.8819999626723366e-05, "loss": 0.39776394367218015, "num_input_tokens_seen": 5715797888, "step": 20100, "train_runtime": 195469.6609, "train_tokens_per_second": 29241.356 }, { "epoch": 0.7115325503585748, "grad_norm": 0.58984375, "learning_rate": 2.881521328493248e-05, "loss": 0.4054411888122559, "num_input_tokens_seen": 5718698624, "step": 20110, "train_runtime": 195572.3946, "train_tokens_per_second": 29240.827 }, { "epoch": 0.7118863706223035, "grad_norm": 0.58203125, "learning_rate": 2.881042932705499e-05, "loss": 0.4002941608428955, "num_input_tokens_seen": 5721542016, "step": 20120, "train_runtime": 195670.7542, "train_tokens_per_second": 29240.66 }, { "epoch": 0.7122401908860323, "grad_norm": 0.5546875, "learning_rate": 2.8805647751112635e-05, "loss": 0.40181598663330076, "num_input_tokens_seen": 5724366592, "step": 20130, "train_runtime": 195766.4846, "train_tokens_per_second": 29240.79 }, { "epoch": 0.7125940111497611, "grad_norm": 0.60546875, "learning_rate": 2.8800868555129462e-05, "loss": 0.4026060104370117, "num_input_tokens_seen": 5727242496, "step": 20140, "train_runtime": 195865.8114, "train_tokens_per_second": 29240.644 }, { "epoch": 0.7129478314134898, "grad_norm": 0.609375, "learning_rate": 2.8796091737131814e-05, "loss": 0.40285167694091795, "num_input_tokens_seen": 5730071552, "step": 20150, "train_runtime": 195966.3893, "train_tokens_per_second": 29240.073 }, { "epoch": 0.7133016516772186, "grad_norm": 0.55078125, "learning_rate": 2.8791317295148322e-05, "loss": 0.4056499481201172, "num_input_tokens_seen": 5732937792, "step": 20160, "train_runtime": 196064.4829, "train_tokens_per_second": 29240.063 }, { "epoch": 0.7136554719409474, "grad_norm": 0.6015625, "learning_rate": 2.8786545227209893e-05, "loss": 0.39931330680847166, "num_input_tokens_seen": 5735873920, "step": 20170, "train_runtime": 196167.0414, "train_tokens_per_second": 29239.743 }, { "epoch": 0.7140092922046761, "grad_norm": 0.6015625, "learning_rate": 2.8781775531349742e-05, "loss": 0.40167598724365233, "num_input_tokens_seen": 5738691328, "step": 20180, "train_runtime": 196263.5948, "train_tokens_per_second": 29239.714 }, { "epoch": 0.714363112468405, "grad_norm": 0.5625, "learning_rate": 2.8777008205603334e-05, "loss": 0.4030892372131348, "num_input_tokens_seen": 5741575872, "step": 20190, "train_runtime": 196362.2094, "train_tokens_per_second": 29239.719 }, { "epoch": 0.7147169327321338, "grad_norm": 0.609375, "learning_rate": 2.877224324800844e-05, "loss": 0.4055344581604004, "num_input_tokens_seen": 5744369344, "step": 20200, "train_runtime": 196457.1184, "train_tokens_per_second": 29239.813 }, { "epoch": 0.7150707529958625, "grad_norm": 0.609375, "learning_rate": 2.8767480656605078e-05, "loss": 0.40584325790405273, "num_input_tokens_seen": 5747209984, "step": 20210, "train_runtime": 196552.4578, "train_tokens_per_second": 29240.082 }, { "epoch": 0.7154245732595913, "grad_norm": 0.60546875, "learning_rate": 2.8762720429435556e-05, "loss": 0.4035944938659668, "num_input_tokens_seen": 5750020864, "step": 20220, "train_runtime": 196647.9429, "train_tokens_per_second": 29240.178 }, { "epoch": 0.7157783935233201, "grad_norm": 0.61328125, "learning_rate": 2.8757962564544448e-05, "loss": 0.40030131340026853, "num_input_tokens_seen": 5752873536, "step": 20230, "train_runtime": 196745.7264, "train_tokens_per_second": 29240.145 }, { "epoch": 0.7161322137870488, "grad_norm": 0.5859375, "learning_rate": 2.8753207059978586e-05, "loss": 0.40159144401550295, "num_input_tokens_seen": 5755677440, "step": 20240, "train_runtime": 196840.2367, "train_tokens_per_second": 29240.35 }, { "epoch": 0.7164860340507776, "grad_norm": 0.56640625, "learning_rate": 2.874845391378706e-05, "loss": 0.40175318717956543, "num_input_tokens_seen": 5758570688, "step": 20250, "train_runtime": 196940.1201, "train_tokens_per_second": 29240.211 }, { "epoch": 0.7168398543145064, "grad_norm": 0.640625, "learning_rate": 2.874370312402121e-05, "loss": 0.40808658599853515, "num_input_tokens_seen": 5761387904, "step": 20260, "train_runtime": 197034.8403, "train_tokens_per_second": 29240.453 }, { "epoch": 0.7171936745782352, "grad_norm": 0.60546875, "learning_rate": 2.8738954688734647e-05, "loss": 0.4072543144226074, "num_input_tokens_seen": 5764247104, "step": 20270, "train_runtime": 197135.1515, "train_tokens_per_second": 29240.077 }, { "epoch": 0.717547494841964, "grad_norm": 0.56640625, "learning_rate": 2.8734208605983226e-05, "loss": 0.40230717658996584, "num_input_tokens_seen": 5767154432, "step": 20280, "train_runtime": 197237.9037, "train_tokens_per_second": 29239.585 }, { "epoch": 0.7179013151056928, "grad_norm": 0.6015625, "learning_rate": 2.8729464873825035e-05, "loss": 0.3948399305343628, "num_input_tokens_seen": 5769997696, "step": 20290, "train_runtime": 197338.0873, "train_tokens_per_second": 29239.149 }, { "epoch": 0.7182551353694215, "grad_norm": 0.5859375, "learning_rate": 2.8724723490320427e-05, "loss": 0.401629638671875, "num_input_tokens_seen": 5772786240, "step": 20300, "train_runtime": 197432.4498, "train_tokens_per_second": 29239.298 }, { "epoch": 0.7186089556331503, "grad_norm": 0.578125, "learning_rate": 2.8719984453531983e-05, "loss": 0.4044965267181396, "num_input_tokens_seen": 5775593920, "step": 20310, "train_runtime": 197526.0038, "train_tokens_per_second": 29239.664 }, { "epoch": 0.7189627758968791, "grad_norm": 0.5859375, "learning_rate": 2.871524776152452e-05, "loss": 0.40209026336669923, "num_input_tokens_seen": 5778514880, "step": 20320, "train_runtime": 197629.6449, "train_tokens_per_second": 29239.11 }, { "epoch": 0.7193165961606078, "grad_norm": 0.60546875, "learning_rate": 2.8710513412365093e-05, "loss": 0.4041339874267578, "num_input_tokens_seen": 5781344768, "step": 20330, "train_runtime": 197726.8976, "train_tokens_per_second": 29239.041 }, { "epoch": 0.7196704164243366, "grad_norm": 0.58984375, "learning_rate": 2.8705781404122977e-05, "loss": 0.40406408309936526, "num_input_tokens_seen": 5784193728, "step": 20340, "train_runtime": 197825.6613, "train_tokens_per_second": 29238.844 }, { "epoch": 0.7200242366880654, "grad_norm": 0.60546875, "learning_rate": 2.87010517348697e-05, "loss": 0.402649974822998, "num_input_tokens_seen": 5787004928, "step": 20350, "train_runtime": 197918.4293, "train_tokens_per_second": 29239.343 }, { "epoch": 0.7203780569517942, "grad_norm": 0.5546875, "learning_rate": 2.8696324402678976e-05, "loss": 0.402455472946167, "num_input_tokens_seen": 5789859136, "step": 20360, "train_runtime": 198017.0073, "train_tokens_per_second": 29239.201 }, { "epoch": 0.720731877215523, "grad_norm": 0.58984375, "learning_rate": 2.8691599405626764e-05, "loss": 0.3999408006668091, "num_input_tokens_seen": 5792650304, "step": 20370, "train_runtime": 198109.327, "train_tokens_per_second": 29239.665 }, { "epoch": 0.7210856974792518, "grad_norm": 0.56640625, "learning_rate": 2.8686876741791234e-05, "loss": 0.4015204429626465, "num_input_tokens_seen": 5795493184, "step": 20380, "train_runtime": 198204.4984, "train_tokens_per_second": 29239.968 }, { "epoch": 0.7214395177429805, "grad_norm": 0.609375, "learning_rate": 2.8682156409252775e-05, "loss": 0.4027289867401123, "num_input_tokens_seen": 5798369408, "step": 20390, "train_runtime": 198305.9255, "train_tokens_per_second": 29239.517 }, { "epoch": 0.7217933380067093, "grad_norm": 0.58203125, "learning_rate": 2.8677438406093976e-05, "loss": 0.40537252426147463, "num_input_tokens_seen": 5801295872, "step": 20400, "train_runtime": 198407.8089, "train_tokens_per_second": 29239.252 }, { "epoch": 0.7221471582704381, "grad_norm": 0.59375, "learning_rate": 2.867272273039964e-05, "loss": 0.4008030414581299, "num_input_tokens_seen": 5804118912, "step": 20410, "train_runtime": 198506.0513, "train_tokens_per_second": 29239.002 }, { "epoch": 0.7225009785341668, "grad_norm": 0.59375, "learning_rate": 2.8668009380256765e-05, "loss": 0.40213832855224607, "num_input_tokens_seen": 5806953088, "step": 20420, "train_runtime": 198603.0817, "train_tokens_per_second": 29238.988 }, { "epoch": 0.7228547987978956, "grad_norm": 0.57421875, "learning_rate": 2.8663298353754574e-05, "loss": 0.40180349349975586, "num_input_tokens_seen": 5809839424, "step": 20430, "train_runtime": 198700.4143, "train_tokens_per_second": 29239.191 }, { "epoch": 0.7232086190616245, "grad_norm": 0.60546875, "learning_rate": 2.865858964898445e-05, "loss": 0.3995216369628906, "num_input_tokens_seen": 5812671488, "step": 20440, "train_runtime": 198798.6111, "train_tokens_per_second": 29238.994 }, { "epoch": 0.7235624393253532, "grad_norm": 0.578125, "learning_rate": 2.8653883264040004e-05, "loss": 0.40815205574035646, "num_input_tokens_seen": 5815518528, "step": 20450, "train_runtime": 198897.4057, "train_tokens_per_second": 29238.785 }, { "epoch": 0.723916259589082, "grad_norm": 0.5859375, "learning_rate": 2.8649179197017017e-05, "loss": 0.39934215545654295, "num_input_tokens_seen": 5818345600, "step": 20460, "train_runtime": 198991.8652, "train_tokens_per_second": 29239.113 }, { "epoch": 0.7242700798528108, "grad_norm": 0.62109375, "learning_rate": 2.864447744601347e-05, "loss": 0.4011113166809082, "num_input_tokens_seen": 5821212608, "step": 20470, "train_runtime": 199092.5066, "train_tokens_per_second": 29238.733 }, { "epoch": 0.7246239001165395, "grad_norm": 0.5859375, "learning_rate": 2.8639778009129507e-05, "loss": 0.40370659828186034, "num_input_tokens_seen": 5824051264, "step": 20480, "train_runtime": 199188.8059, "train_tokens_per_second": 29238.848 }, { "epoch": 0.7249777203802683, "grad_norm": 0.6015625, "learning_rate": 2.8635080884467492e-05, "loss": 0.40807380676269533, "num_input_tokens_seen": 5826942080, "step": 20490, "train_runtime": 199289.2425, "train_tokens_per_second": 29238.618 }, { "epoch": 0.7253315406439971, "grad_norm": 0.609375, "learning_rate": 2.8630386070131927e-05, "loss": 0.4022520542144775, "num_input_tokens_seen": 5829822528, "step": 20500, "train_runtime": 199386.9549, "train_tokens_per_second": 29238.736 }, { "epoch": 0.7256853609077258, "grad_norm": 0.6015625, "learning_rate": 2.8625693564229507e-05, "loss": 0.4057596206665039, "num_input_tokens_seen": 5832641408, "step": 20510, "train_runtime": 199483.4091, "train_tokens_per_second": 29238.729 }, { "epoch": 0.7260391811714547, "grad_norm": 0.5625, "learning_rate": 2.8621003364869102e-05, "loss": 0.4062325477600098, "num_input_tokens_seen": 5835486976, "step": 20520, "train_runtime": 199581.8938, "train_tokens_per_second": 29238.559 }, { "epoch": 0.7263930014351835, "grad_norm": 0.57421875, "learning_rate": 2.8616315470161738e-05, "loss": 0.4033400535583496, "num_input_tokens_seen": 5838337664, "step": 20530, "train_runtime": 199676.2128, "train_tokens_per_second": 29239.024 }, { "epoch": 0.7267468216989122, "grad_norm": 0.58203125, "learning_rate": 2.8611629878220624e-05, "loss": 0.4002431869506836, "num_input_tokens_seen": 5841176896, "step": 20540, "train_runtime": 199770.084, "train_tokens_per_second": 29239.498 }, { "epoch": 0.727100641962641, "grad_norm": 0.59375, "learning_rate": 2.8606946587161116e-05, "loss": 0.40137500762939454, "num_input_tokens_seen": 5844045184, "step": 20550, "train_runtime": 199865.8017, "train_tokens_per_second": 29239.846 }, { "epoch": 0.7274544622263698, "grad_norm": 0.5859375, "learning_rate": 2.860226559510072e-05, "loss": 0.4063122749328613, "num_input_tokens_seen": 5846909568, "step": 20560, "train_runtime": 199962.8617, "train_tokens_per_second": 29239.977 }, { "epoch": 0.7278082824900985, "grad_norm": 0.58984375, "learning_rate": 2.859758690015913e-05, "loss": 0.401547908782959, "num_input_tokens_seen": 5849704832, "step": 20570, "train_runtime": 200059.2629, "train_tokens_per_second": 29239.86 }, { "epoch": 0.7281621027538273, "grad_norm": 0.59765625, "learning_rate": 2.8592910500458154e-05, "loss": 0.40147933959960935, "num_input_tokens_seen": 5852570432, "step": 20580, "train_runtime": 200154.6351, "train_tokens_per_second": 29240.244 }, { "epoch": 0.7285159230175561, "grad_norm": 0.5546875, "learning_rate": 2.858823639412178e-05, "loss": 0.40390429496765134, "num_input_tokens_seen": 5855476864, "step": 20590, "train_runtime": 200256.7957, "train_tokens_per_second": 29239.841 }, { "epoch": 0.7288697432812848, "grad_norm": 0.59375, "learning_rate": 2.858356457927613e-05, "loss": 0.40361733436584474, "num_input_tokens_seen": 5858295936, "step": 20600, "train_runtime": 200353.234, "train_tokens_per_second": 29239.837 }, { "epoch": 0.7292235635450137, "grad_norm": 0.56640625, "learning_rate": 2.857889505404946e-05, "loss": 0.4030409812927246, "num_input_tokens_seen": 5861133632, "step": 20610, "train_runtime": 200453.0145, "train_tokens_per_second": 29239.439 }, { "epoch": 0.7295773838087425, "grad_norm": 0.57421875, "learning_rate": 2.8574227816572184e-05, "loss": 0.4005866050720215, "num_input_tokens_seen": 5863989568, "step": 20620, "train_runtime": 200552.1593, "train_tokens_per_second": 29239.224 }, { "epoch": 0.7299312040724713, "grad_norm": 0.6015625, "learning_rate": 2.856956286497684e-05, "loss": 0.4035504341125488, "num_input_tokens_seen": 5866803392, "step": 20630, "train_runtime": 200646.3106, "train_tokens_per_second": 29239.528 }, { "epoch": 0.7302850243362, "grad_norm": 0.578125, "learning_rate": 2.85649001973981e-05, "loss": 0.40082406997680664, "num_input_tokens_seen": 5869583616, "step": 20640, "train_runtime": 200741.3622, "train_tokens_per_second": 29239.533 }, { "epoch": 0.7306388445999288, "grad_norm": 0.5703125, "learning_rate": 2.8560239811972754e-05, "loss": 0.39939250946044924, "num_input_tokens_seen": 5872449152, "step": 20650, "train_runtime": 200838.8262, "train_tokens_per_second": 29239.611 }, { "epoch": 0.7309926648636575, "grad_norm": 0.59375, "learning_rate": 2.855558170683976e-05, "loss": 0.4068933963775635, "num_input_tokens_seen": 5875205056, "step": 20660, "train_runtime": 200929.6156, "train_tokens_per_second": 29240.115 }, { "epoch": 0.7313464851273863, "grad_norm": 0.5859375, "learning_rate": 2.855092588014017e-05, "loss": 0.4007720470428467, "num_input_tokens_seen": 5878038464, "step": 20670, "train_runtime": 201025.0608, "train_tokens_per_second": 29240.327 }, { "epoch": 0.7317003053911151, "grad_norm": 0.5859375, "learning_rate": 2.854627233001715e-05, "loss": 0.4012059211730957, "num_input_tokens_seen": 5880880256, "step": 20680, "train_runtime": 201122.0765, "train_tokens_per_second": 29240.352 }, { "epoch": 0.732054125654844, "grad_norm": 0.58984375, "learning_rate": 2.8541621054615992e-05, "loss": 0.40305156707763673, "num_input_tokens_seen": 5883739392, "step": 20690, "train_runtime": 201220.5033, "train_tokens_per_second": 29240.258 }, { "epoch": 0.7324079459185727, "grad_norm": 0.59375, "learning_rate": 2.8536972052084122e-05, "loss": 0.4060030460357666, "num_input_tokens_seen": 5886572544, "step": 20700, "train_runtime": 201316.2142, "train_tokens_per_second": 29240.429 }, { "epoch": 0.7327617661823015, "grad_norm": 0.57421875, "learning_rate": 2.853232532057104e-05, "loss": 0.4038423538208008, "num_input_tokens_seen": 5889413760, "step": 20710, "train_runtime": 201415.8851, "train_tokens_per_second": 29240.066 }, { "epoch": 0.7331155864460303, "grad_norm": 0.58984375, "learning_rate": 2.8527680858228395e-05, "loss": 0.39737353324890134, "num_input_tokens_seen": 5892251136, "step": 20720, "train_runtime": 201513.2588, "train_tokens_per_second": 29240.017 }, { "epoch": 0.733469406709759, "grad_norm": 0.578125, "learning_rate": 2.8523038663209906e-05, "loss": 0.40528287887573244, "num_input_tokens_seen": 5895028096, "step": 20730, "train_runtime": 201605.9507, "train_tokens_per_second": 29240.348 }, { "epoch": 0.7338232269734878, "grad_norm": 0.58984375, "learning_rate": 2.8518398733671427e-05, "loss": 0.4017350196838379, "num_input_tokens_seen": 5897904192, "step": 20740, "train_runtime": 201704.795, "train_tokens_per_second": 29240.278 }, { "epoch": 0.7341770472372166, "grad_norm": 0.578125, "learning_rate": 2.8513761067770877e-05, "loss": 0.40599832534790037, "num_input_tokens_seen": 5900780160, "step": 20750, "train_runtime": 201802.2408, "train_tokens_per_second": 29240.41 }, { "epoch": 0.7345308675009453, "grad_norm": 0.56640625, "learning_rate": 2.85091256636683e-05, "loss": 0.40285730361938477, "num_input_tokens_seen": 5903594944, "step": 20760, "train_runtime": 201897.7366, "train_tokens_per_second": 29240.521 }, { "epoch": 0.7348846877646742, "grad_norm": 0.5859375, "learning_rate": 2.850449251952582e-05, "loss": 0.402994441986084, "num_input_tokens_seen": 5906506368, "step": 20770, "train_runtime": 201998.167, "train_tokens_per_second": 29240.396 }, { "epoch": 0.735238508028403, "grad_norm": 0.59375, "learning_rate": 2.849986163350766e-05, "loss": 0.40232067108154296, "num_input_tokens_seen": 5909345856, "step": 20780, "train_runtime": 202096.4309, "train_tokens_per_second": 29240.229 }, { "epoch": 0.7355923282921317, "grad_norm": 0.5859375, "learning_rate": 2.8495233003780103e-05, "loss": 0.40167899131774903, "num_input_tokens_seen": 5912204480, "step": 20790, "train_runtime": 202193.146, "train_tokens_per_second": 29240.38 }, { "epoch": 0.7359461485558605, "grad_norm": 0.58203125, "learning_rate": 2.8490606628511557e-05, "loss": 0.3991173267364502, "num_input_tokens_seen": 5915059072, "step": 20800, "train_runtime": 202291.8092, "train_tokens_per_second": 29240.23 }, { "epoch": 0.7362999688195893, "grad_norm": 0.5625, "learning_rate": 2.8485982505872476e-05, "loss": 0.4016124725341797, "num_input_tokens_seen": 5917924608, "step": 20810, "train_runtime": 202391.1153, "train_tokens_per_second": 29240.041 }, { "epoch": 0.736653789083318, "grad_norm": 0.5859375, "learning_rate": 2.8481360634035415e-05, "loss": 0.4056361198425293, "num_input_tokens_seen": 5920770944, "step": 20820, "train_runtime": 202487.5751, "train_tokens_per_second": 29240.169 }, { "epoch": 0.7370076093470468, "grad_norm": 0.5859375, "learning_rate": 2.847674101117499e-05, "loss": 0.403035831451416, "num_input_tokens_seen": 5923643264, "step": 20830, "train_runtime": 202583.6837, "train_tokens_per_second": 29240.476 }, { "epoch": 0.7373614296107756, "grad_norm": 0.578125, "learning_rate": 2.8472123635467896e-05, "loss": 0.4044186592102051, "num_input_tokens_seen": 5926487104, "step": 20840, "train_runtime": 202681.0483, "train_tokens_per_second": 29240.46 }, { "epoch": 0.7377152498745044, "grad_norm": 0.5859375, "learning_rate": 2.846750850509289e-05, "loss": 0.40087318420410156, "num_input_tokens_seen": 5929334592, "step": 20850, "train_runtime": 202775.8194, "train_tokens_per_second": 29240.837 }, { "epoch": 0.7380690701382332, "grad_norm": 0.578125, "learning_rate": 2.8462895618230813e-05, "loss": 0.4043607711791992, "num_input_tokens_seen": 5932241536, "step": 20860, "train_runtime": 202875.6707, "train_tokens_per_second": 29240.774 }, { "epoch": 0.738422890401962, "grad_norm": 0.61328125, "learning_rate": 2.845828497306453e-05, "loss": 0.39979393482208253, "num_input_tokens_seen": 5935053632, "step": 20870, "train_runtime": 202972.5017, "train_tokens_per_second": 29240.678 }, { "epoch": 0.7387767106656907, "grad_norm": 0.58203125, "learning_rate": 2.8453676567779018e-05, "loss": 0.40284051895141604, "num_input_tokens_seen": 5937934784, "step": 20880, "train_runtime": 203069.6837, "train_tokens_per_second": 29240.873 }, { "epoch": 0.7391305309294195, "grad_norm": 0.5859375, "learning_rate": 2.8449070400561267e-05, "loss": 0.40182785987854003, "num_input_tokens_seen": 5940800320, "step": 20890, "train_runtime": 203169.2245, "train_tokens_per_second": 29240.651 }, { "epoch": 0.7394843511931483, "grad_norm": 0.5703125, "learning_rate": 2.8444466469600343e-05, "loss": 0.40529537200927734, "num_input_tokens_seen": 5943635072, "step": 20900, "train_runtime": 203266.1073, "train_tokens_per_second": 29240.66 }, { "epoch": 0.739838171456877, "grad_norm": 0.5859375, "learning_rate": 2.8439864773087354e-05, "loss": 0.40120744705200195, "num_input_tokens_seen": 5946503040, "step": 20910, "train_runtime": 203365.7783, "train_tokens_per_second": 29240.431 }, { "epoch": 0.7401919917206058, "grad_norm": 0.59375, "learning_rate": 2.8435265309215465e-05, "loss": 0.4001636505126953, "num_input_tokens_seen": 5949331712, "step": 20920, "train_runtime": 203462.3254, "train_tokens_per_second": 29240.459 }, { "epoch": 0.7405458119843346, "grad_norm": 0.54296875, "learning_rate": 2.843066807617987e-05, "loss": 0.4073075294494629, "num_input_tokens_seen": 5952235008, "step": 20930, "train_runtime": 203562.527, "train_tokens_per_second": 29240.328 }, { "epoch": 0.7408996322480634, "grad_norm": 0.59375, "learning_rate": 2.8426073072177827e-05, "loss": 0.4028350830078125, "num_input_tokens_seen": 5955103680, "step": 20940, "train_runtime": 203658.8896, "train_tokens_per_second": 29240.578 }, { "epoch": 0.7412534525117922, "grad_norm": 0.58203125, "learning_rate": 2.8421480295408616e-05, "loss": 0.40394368171691897, "num_input_tokens_seen": 5957967168, "step": 20950, "train_runtime": 203758.4437, "train_tokens_per_second": 29240.345 }, { "epoch": 0.741607272775521, "grad_norm": 0.59765625, "learning_rate": 2.841688974407355e-05, "loss": 0.403903865814209, "num_input_tokens_seen": 5960793536, "step": 20960, "train_runtime": 203855.9122, "train_tokens_per_second": 29240.229 }, { "epoch": 0.7419610930392497, "grad_norm": 0.59375, "learning_rate": 2.8412301416375984e-05, "loss": 0.4063393592834473, "num_input_tokens_seen": 5963631616, "step": 20970, "train_runtime": 203952.8107, "train_tokens_per_second": 29240.252 }, { "epoch": 0.7423149133029785, "grad_norm": 0.58984375, "learning_rate": 2.840771531052131e-05, "loss": 0.40227136611938474, "num_input_tokens_seen": 5966481920, "step": 20980, "train_runtime": 204053.3711, "train_tokens_per_second": 29239.811 }, { "epoch": 0.7426687335667073, "grad_norm": 0.54296875, "learning_rate": 2.840313142471694e-05, "loss": 0.39959182739257815, "num_input_tokens_seen": 5969371072, "step": 20990, "train_runtime": 204156.5419, "train_tokens_per_second": 29239.186 }, { "epoch": 0.743022553830436, "grad_norm": 0.5625, "learning_rate": 2.83985497571723e-05, "loss": 0.4067965030670166, "num_input_tokens_seen": 5972228032, "step": 21000, "train_runtime": 204252.475, "train_tokens_per_second": 29239.44 }, { "epoch": 0.7433763740941648, "grad_norm": 0.60546875, "learning_rate": 2.8393970306098843e-05, "loss": 0.4042391777038574, "num_input_tokens_seen": 5975085504, "step": 21010, "train_runtime": 204349.7381, "train_tokens_per_second": 29239.507 }, { "epoch": 0.7437301943578937, "grad_norm": 0.5625, "learning_rate": 2.8389393069710053e-05, "loss": 0.4100473403930664, "num_input_tokens_seen": 5977922240, "step": 21020, "train_runtime": 204448.1148, "train_tokens_per_second": 29239.312 }, { "epoch": 0.7440840146216224, "grad_norm": 0.5859375, "learning_rate": 2.8384818046221418e-05, "loss": 0.40555534362792967, "num_input_tokens_seen": 5980802240, "step": 21030, "train_runtime": 204551.5903, "train_tokens_per_second": 29238.601 }, { "epoch": 0.7444378348853512, "grad_norm": 0.6015625, "learning_rate": 2.8380245233850434e-05, "loss": 0.4050168037414551, "num_input_tokens_seen": 5983692864, "step": 21040, "train_runtime": 204650.7446, "train_tokens_per_second": 29238.559 }, { "epoch": 0.74479165514908, "grad_norm": 0.6171875, "learning_rate": 2.837567463081662e-05, "loss": 0.40543422698974607, "num_input_tokens_seen": 5986513920, "step": 21050, "train_runtime": 204747.3409, "train_tokens_per_second": 29238.543 }, { "epoch": 0.7451454754128087, "grad_norm": 0.5625, "learning_rate": 2.8371106235341477e-05, "loss": 0.3963713884353638, "num_input_tokens_seen": 5989338944, "step": 21060, "train_runtime": 204841.2029, "train_tokens_per_second": 29238.937 }, { "epoch": 0.7454992956765375, "grad_norm": 0.59765625, "learning_rate": 2.836654004564855e-05, "loss": 0.4016937255859375, "num_input_tokens_seen": 5992180160, "step": 21070, "train_runtime": 204938.0576, "train_tokens_per_second": 29238.982 }, { "epoch": 0.7458531159402663, "grad_norm": 0.6171875, "learning_rate": 2.8361976059963348e-05, "loss": 0.40276317596435546, "num_input_tokens_seen": 5995003712, "step": 21080, "train_runtime": 205032.5377, "train_tokens_per_second": 29239.28 }, { "epoch": 0.746206936203995, "grad_norm": 0.640625, "learning_rate": 2.835741427651339e-05, "loss": 0.4051965713500977, "num_input_tokens_seen": 5997859648, "step": 21090, "train_runtime": 205132.8705, "train_tokens_per_second": 29238.901 }, { "epoch": 0.7465607564677239, "grad_norm": 0.57421875, "learning_rate": 2.8352854693528197e-05, "loss": 0.4022191047668457, "num_input_tokens_seen": 6000715712, "step": 21100, "train_runtime": 205231.0828, "train_tokens_per_second": 29238.825 }, { "epoch": 0.7469145767314527, "grad_norm": 0.59765625, "learning_rate": 2.8348297309239274e-05, "loss": 0.40061092376708984, "num_input_tokens_seen": 6003573504, "step": 21110, "train_runtime": 205326.9624, "train_tokens_per_second": 29239.09 }, { "epoch": 0.7472683969951814, "grad_norm": 0.58984375, "learning_rate": 2.834374212188012e-05, "loss": 0.40214147567749026, "num_input_tokens_seen": 6006483328, "step": 21120, "train_runtime": 205427.131, "train_tokens_per_second": 29238.997 }, { "epoch": 0.7476222172589102, "grad_norm": 0.578125, "learning_rate": 2.833918912968621e-05, "loss": 0.4019974708557129, "num_input_tokens_seen": 6009366272, "step": 21130, "train_runtime": 205527.2053, "train_tokens_per_second": 29238.787 }, { "epoch": 0.747976037522639, "grad_norm": 0.609375, "learning_rate": 2.833463833089502e-05, "loss": 0.4017859935760498, "num_input_tokens_seen": 6012217152, "step": 21140, "train_runtime": 205625.3154, "train_tokens_per_second": 29238.701 }, { "epoch": 0.7483298577863677, "grad_norm": 0.60546875, "learning_rate": 2.8330089723745985e-05, "loss": 0.4010505676269531, "num_input_tokens_seen": 6015078784, "step": 21150, "train_runtime": 205725.2724, "train_tokens_per_second": 29238.405 }, { "epoch": 0.7486836780500965, "grad_norm": 0.578125, "learning_rate": 2.8325543306480538e-05, "loss": 0.3991249084472656, "num_input_tokens_seen": 6017903040, "step": 21160, "train_runtime": 205822.6474, "train_tokens_per_second": 29238.294 }, { "epoch": 0.7490374983138253, "grad_norm": 0.55859375, "learning_rate": 2.832099907734208e-05, "loss": 0.4030435562133789, "num_input_tokens_seen": 6020737728, "step": 21170, "train_runtime": 205917.2135, "train_tokens_per_second": 29238.632 }, { "epoch": 0.749391318577554, "grad_norm": 0.57421875, "learning_rate": 2.831645703457598e-05, "loss": 0.4036706924438477, "num_input_tokens_seen": 6023592192, "step": 21180, "train_runtime": 206016.2433, "train_tokens_per_second": 29238.433 }, { "epoch": 0.7497451388412829, "grad_norm": 0.57421875, "learning_rate": 2.8311917176429582e-05, "loss": 0.40347042083740237, "num_input_tokens_seen": 6026465792, "step": 21190, "train_runtime": 206114.2207, "train_tokens_per_second": 29238.476 }, { "epoch": 0.7500989591050117, "grad_norm": 0.578125, "learning_rate": 2.830737950115218e-05, "loss": 0.4009533405303955, "num_input_tokens_seen": 6029296384, "step": 21200, "train_runtime": 206208.1955, "train_tokens_per_second": 29238.879 }, { "epoch": 0.7504527793687404, "grad_norm": 0.5625, "learning_rate": 2.8302844006995062e-05, "loss": 0.40364627838134765, "num_input_tokens_seen": 6032204928, "step": 21210, "train_runtime": 206310.0667, "train_tokens_per_second": 29238.539 }, { "epoch": 0.7508065996324692, "grad_norm": 0.57421875, "learning_rate": 2.829831069221145e-05, "loss": 0.4018427848815918, "num_input_tokens_seen": 6035024960, "step": 21220, "train_runtime": 206403.1199, "train_tokens_per_second": 29239.02 }, { "epoch": 0.751160419896198, "grad_norm": 0.59765625, "learning_rate": 2.8293779555056532e-05, "loss": 0.40345458984375, "num_input_tokens_seen": 6037872512, "step": 21230, "train_runtime": 206503.7871, "train_tokens_per_second": 29238.556 }, { "epoch": 0.7515142401599267, "grad_norm": 0.6015625, "learning_rate": 2.8289250593787454e-05, "loss": 0.40208120346069337, "num_input_tokens_seen": 6040666880, "step": 21240, "train_runtime": 206596.1275, "train_tokens_per_second": 29239.013 }, { "epoch": 0.7518680604236555, "grad_norm": 0.5859375, "learning_rate": 2.8284723806663316e-05, "loss": 0.39830024242401124, "num_input_tokens_seen": 6043495232, "step": 21250, "train_runtime": 206693.3955, "train_tokens_per_second": 29238.937 }, { "epoch": 0.7522218806873843, "grad_norm": 0.578125, "learning_rate": 2.828019919194515e-05, "loss": 0.40095744132995603, "num_input_tokens_seen": 6046314368, "step": 21260, "train_runtime": 206791.1022, "train_tokens_per_second": 29238.755 }, { "epoch": 0.7525757009511131, "grad_norm": 0.58984375, "learning_rate": 2.827567674789597e-05, "loss": 0.40511088371276854, "num_input_tokens_seen": 6049228096, "step": 21270, "train_runtime": 206890.2838, "train_tokens_per_second": 29238.822 }, { "epoch": 0.7529295212148419, "grad_norm": 0.6015625, "learning_rate": 2.8271156472780697e-05, "loss": 0.3994009017944336, "num_input_tokens_seen": 6052079168, "step": 21280, "train_runtime": 206991.0537, "train_tokens_per_second": 29238.361 }, { "epoch": 0.7532833414785707, "grad_norm": 0.58203125, "learning_rate": 2.826663836486621e-05, "loss": 0.4032484531402588, "num_input_tokens_seen": 6054953216, "step": 21290, "train_runtime": 207090.0406, "train_tokens_per_second": 29238.264 }, { "epoch": 0.7536371617422994, "grad_norm": 0.5859375, "learning_rate": 2.8262122422421326e-05, "loss": 0.40679135322570803, "num_input_tokens_seen": 6057801984, "step": 21300, "train_runtime": 207185.9263, "train_tokens_per_second": 29238.482 }, { "epoch": 0.7539909820060282, "grad_norm": 0.57421875, "learning_rate": 2.8257608643716797e-05, "loss": 0.40395288467407225, "num_input_tokens_seen": 6060640320, "step": 21310, "train_runtime": 207283.7265, "train_tokens_per_second": 29238.38 }, { "epoch": 0.754344802269757, "grad_norm": 0.57421875, "learning_rate": 2.8253097027025312e-05, "loss": 0.4087357521057129, "num_input_tokens_seen": 6063462656, "step": 21320, "train_runtime": 207378.5905, "train_tokens_per_second": 29238.614 }, { "epoch": 0.7546986225334857, "grad_norm": 0.57421875, "learning_rate": 2.8248587570621472e-05, "loss": 0.3998574256896973, "num_input_tokens_seen": 6066305152, "step": 21330, "train_runtime": 207475.2812, "train_tokens_per_second": 29238.689 }, { "epoch": 0.7550524427972145, "grad_norm": 0.58203125, "learning_rate": 2.824408027278182e-05, "loss": 0.4021791458129883, "num_input_tokens_seen": 6069158208, "step": 21340, "train_runtime": 207571.7768, "train_tokens_per_second": 29238.841 }, { "epoch": 0.7554062630609434, "grad_norm": 0.61328125, "learning_rate": 2.823957513178483e-05, "loss": 0.4011404037475586, "num_input_tokens_seen": 6071980864, "step": 21350, "train_runtime": 207665.9035, "train_tokens_per_second": 29239.181 }, { "epoch": 0.7557600833246721, "grad_norm": 0.5703125, "learning_rate": 2.8235072145910878e-05, "loss": 0.4065885543823242, "num_input_tokens_seen": 6074852992, "step": 21360, "train_runtime": 207765.9766, "train_tokens_per_second": 29238.921 }, { "epoch": 0.7561139035884009, "grad_norm": 0.58203125, "learning_rate": 2.8230571313442273e-05, "loss": 0.397721004486084, "num_input_tokens_seen": 6077675520, "step": 21370, "train_runtime": 207861.9349, "train_tokens_per_second": 29239.002 }, { "epoch": 0.7564677238521297, "grad_norm": 0.6015625, "learning_rate": 2.822607263266324e-05, "loss": 0.40192575454711915, "num_input_tokens_seen": 6080512448, "step": 21380, "train_runtime": 207956.6422, "train_tokens_per_second": 29239.328 }, { "epoch": 0.7568215441158584, "grad_norm": 0.5546875, "learning_rate": 2.822157610185991e-05, "loss": 0.3952006816864014, "num_input_tokens_seen": 6083380992, "step": 21390, "train_runtime": 208052.5695, "train_tokens_per_second": 29239.634 }, { "epoch": 0.7571753643795872, "grad_norm": 0.61328125, "learning_rate": 2.821708171932032e-05, "loss": 0.40285372734069824, "num_input_tokens_seen": 6086255040, "step": 21400, "train_runtime": 208151.89, "train_tokens_per_second": 29239.49 }, { "epoch": 0.757529184643316, "grad_norm": 0.56640625, "learning_rate": 2.821258948333444e-05, "loss": 0.4052440643310547, "num_input_tokens_seen": 6089119296, "step": 21410, "train_runtime": 208250.642, "train_tokens_per_second": 29239.378 }, { "epoch": 0.7578830049070447, "grad_norm": 0.60546875, "learning_rate": 2.8208099392194116e-05, "loss": 0.4063704967498779, "num_input_tokens_seen": 6091926080, "step": 21420, "train_runtime": 208346.0056, "train_tokens_per_second": 29239.467 }, { "epoch": 0.7582368251707735, "grad_norm": 0.57421875, "learning_rate": 2.8203611444193113e-05, "loss": 0.40077948570251465, "num_input_tokens_seen": 6094779584, "step": 21430, "train_runtime": 208441.7447, "train_tokens_per_second": 29239.726 }, { "epoch": 0.7585906454345024, "grad_norm": 0.5703125, "learning_rate": 2.8199125637627084e-05, "loss": 0.3984208106994629, "num_input_tokens_seen": 6097571456, "step": 21440, "train_runtime": 208535.5667, "train_tokens_per_second": 29239.959 }, { "epoch": 0.7589444656982312, "grad_norm": 0.5859375, "learning_rate": 2.8194641970793593e-05, "loss": 0.40079245567321775, "num_input_tokens_seen": 6100396672, "step": 21450, "train_runtime": 208630.3426, "train_tokens_per_second": 29240.218 }, { "epoch": 0.7592982859619599, "grad_norm": 0.6015625, "learning_rate": 2.8190160441992092e-05, "loss": 0.40223073959350586, "num_input_tokens_seen": 6103225152, "step": 21460, "train_runtime": 208728.2877, "train_tokens_per_second": 29240.048 }, { "epoch": 0.7596521062256887, "grad_norm": 0.609375, "learning_rate": 2.818568104952392e-05, "loss": 0.40602335929870603, "num_input_tokens_seen": 6106011520, "step": 21470, "train_runtime": 208819.8816, "train_tokens_per_second": 29240.566 }, { "epoch": 0.7600059264894174, "grad_norm": 0.6015625, "learning_rate": 2.8181203791692306e-05, "loss": 0.4030517578125, "num_input_tokens_seen": 6108848960, "step": 21480, "train_runtime": 208914.7528, "train_tokens_per_second": 29240.869 }, { "epoch": 0.7603597467531462, "grad_norm": 0.5859375, "learning_rate": 2.8176728666802375e-05, "loss": 0.4021156311035156, "num_input_tokens_seen": 6111702336, "step": 21490, "train_runtime": 209012.9843, "train_tokens_per_second": 29240.778 }, { "epoch": 0.760713567016875, "grad_norm": 0.5859375, "learning_rate": 2.8172255673161124e-05, "loss": 0.39834303855895997, "num_input_tokens_seen": 6114556160, "step": 21500, "train_runtime": 209110.1639, "train_tokens_per_second": 29240.837 }, { "epoch": 0.7610673872806037, "grad_norm": 0.578125, "learning_rate": 2.8167784809077436e-05, "loss": 0.4024876594543457, "num_input_tokens_seen": 6117416192, "step": 21510, "train_runtime": 209206.3248, "train_tokens_per_second": 29241.067 }, { "epoch": 0.7614212075443326, "grad_norm": 0.62109375, "learning_rate": 2.816331607286207e-05, "loss": 0.3980637788772583, "num_input_tokens_seen": 6120260224, "step": 21520, "train_runtime": 209303.9946, "train_tokens_per_second": 29241.01 }, { "epoch": 0.7617750278080614, "grad_norm": 0.5703125, "learning_rate": 2.815884946282766e-05, "loss": 0.4038565635681152, "num_input_tokens_seen": 6123067136, "step": 21530, "train_runtime": 209399.925, "train_tokens_per_second": 29241.019 }, { "epoch": 0.7621288480717902, "grad_norm": 0.62109375, "learning_rate": 2.815438497728871e-05, "loss": 0.40122556686401367, "num_input_tokens_seen": 6125931520, "step": 21540, "train_runtime": 209500.3182, "train_tokens_per_second": 29240.679 }, { "epoch": 0.7624826683355189, "grad_norm": 0.5859375, "learning_rate": 2.8149922614561607e-05, "loss": 0.40387563705444335, "num_input_tokens_seen": 6128745536, "step": 21550, "train_runtime": 209598.6607, "train_tokens_per_second": 29240.385 }, { "epoch": 0.7628364885992477, "grad_norm": 0.60546875, "learning_rate": 2.8145462372964588e-05, "loss": 0.40125017166137694, "num_input_tokens_seen": 6131573312, "step": 21560, "train_runtime": 209695.8369, "train_tokens_per_second": 29240.32 }, { "epoch": 0.7631903088629765, "grad_norm": 0.58984375, "learning_rate": 2.814100425081777e-05, "loss": 0.4010325908660889, "num_input_tokens_seen": 6134375040, "step": 21570, "train_runtime": 209791.1187, "train_tokens_per_second": 29240.394 }, { "epoch": 0.7635441291267052, "grad_norm": 0.59765625, "learning_rate": 2.8136548246443117e-05, "loss": 0.39951772689819337, "num_input_tokens_seen": 6137264960, "step": 21580, "train_runtime": 209892.3549, "train_tokens_per_second": 29240.06 }, { "epoch": 0.763897949390434, "grad_norm": 0.63671875, "learning_rate": 2.8132094358164468e-05, "loss": 0.40428409576416013, "num_input_tokens_seen": 6140138816, "step": 21590, "train_runtime": 209989.922, "train_tokens_per_second": 29240.16 }, { "epoch": 0.7642517696541629, "grad_norm": 0.5546875, "learning_rate": 2.8127642584307508e-05, "loss": 0.4010955810546875, "num_input_tokens_seen": 6142984064, "step": 21600, "train_runtime": 210088.3028, "train_tokens_per_second": 29240.01 }, { "epoch": 0.7646055899178916, "grad_norm": 0.59765625, "learning_rate": 2.8123192923199776e-05, "loss": 0.4032616138458252, "num_input_tokens_seen": 6145847488, "step": 21610, "train_runtime": 210185.2461, "train_tokens_per_second": 29240.147 }, { "epoch": 0.7649594101816204, "grad_norm": 0.60546875, "learning_rate": 2.8118745373170667e-05, "loss": 0.40500125885009763, "num_input_tokens_seen": 6148713792, "step": 21620, "train_runtime": 210283.9607, "train_tokens_per_second": 29240.051 }, { "epoch": 0.7653132304453492, "grad_norm": 0.58984375, "learning_rate": 2.8114299932551423e-05, "loss": 0.4008623600006104, "num_input_tokens_seen": 6151501696, "step": 21630, "train_runtime": 210376.6638, "train_tokens_per_second": 29240.419 }, { "epoch": 0.7656670507090779, "grad_norm": 0.6015625, "learning_rate": 2.8109856599675145e-05, "loss": 0.40099372863769533, "num_input_tokens_seen": 6154360064, "step": 21640, "train_runtime": 210476.1105, "train_tokens_per_second": 29240.183 }, { "epoch": 0.7660208709728067, "grad_norm": 0.58203125, "learning_rate": 2.8105415372876742e-05, "loss": 0.4013160228729248, "num_input_tokens_seen": 6157238080, "step": 21650, "train_runtime": 210575.7179, "train_tokens_per_second": 29240.019 }, { "epoch": 0.7663746912365355, "grad_norm": 0.578125, "learning_rate": 2.8100976250493e-05, "loss": 0.4019191741943359, "num_input_tokens_seen": 6160097728, "step": 21660, "train_runtime": 210676.1204, "train_tokens_per_second": 29239.658 }, { "epoch": 0.7667285115002642, "grad_norm": 0.59375, "learning_rate": 2.8096539230862527e-05, "loss": 0.4069089889526367, "num_input_tokens_seen": 6162970048, "step": 21670, "train_runtime": 210775.8123, "train_tokens_per_second": 29239.456 }, { "epoch": 0.767082331763993, "grad_norm": 0.58203125, "learning_rate": 2.809210431232578e-05, "loss": 0.40045604705810545, "num_input_tokens_seen": 6165827072, "step": 21680, "train_runtime": 210874.1769, "train_tokens_per_second": 29239.365 }, { "epoch": 0.7674361520277219, "grad_norm": 0.60546875, "learning_rate": 2.8087671493225025e-05, "loss": 0.4019759178161621, "num_input_tokens_seen": 6168667520, "step": 21690, "train_runtime": 210970.5362, "train_tokens_per_second": 29239.474 }, { "epoch": 0.7677899722914506, "grad_norm": 0.5859375, "learning_rate": 2.808324077190438e-05, "loss": 0.4014717102050781, "num_input_tokens_seen": 6171544384, "step": 21700, "train_runtime": 211070.563, "train_tokens_per_second": 29239.247 }, { "epoch": 0.7681437925551794, "grad_norm": 0.58203125, "learning_rate": 2.807881214670978e-05, "loss": 0.4000603675842285, "num_input_tokens_seen": 6174348288, "step": 21710, "train_runtime": 211164.9174, "train_tokens_per_second": 29239.461 }, { "epoch": 0.7684976128189082, "grad_norm": 0.609375, "learning_rate": 2.8074385615988996e-05, "loss": 0.403455924987793, "num_input_tokens_seen": 6177181760, "step": 21720, "train_runtime": 211261.3836, "train_tokens_per_second": 29239.521 }, { "epoch": 0.7688514330826369, "grad_norm": 0.578125, "learning_rate": 2.8069961178091602e-05, "loss": 0.4034730911254883, "num_input_tokens_seen": 6180022592, "step": 21730, "train_runtime": 211358.0672, "train_tokens_per_second": 29239.587 }, { "epoch": 0.7692052533463657, "grad_norm": 0.58984375, "learning_rate": 2.806553883136901e-05, "loss": 0.40419206619262693, "num_input_tokens_seen": 6182888576, "step": 21740, "train_runtime": 211457.1505, "train_tokens_per_second": 29239.44 }, { "epoch": 0.7695590736100945, "grad_norm": 0.58203125, "learning_rate": 2.806111857417445e-05, "loss": 0.4033034801483154, "num_input_tokens_seen": 6185731200, "step": 21750, "train_runtime": 211554.4256, "train_tokens_per_second": 29239.432 }, { "epoch": 0.7699128938738232, "grad_norm": 0.58984375, "learning_rate": 2.8056700404862957e-05, "loss": 0.40367727279663085, "num_input_tokens_seen": 6188538752, "step": 21760, "train_runtime": 211649.2799, "train_tokens_per_second": 29239.593 }, { "epoch": 0.7702667141375521, "grad_norm": 0.59375, "learning_rate": 2.8052284321791383e-05, "loss": 0.4004530429840088, "num_input_tokens_seen": 6191344448, "step": 21770, "train_runtime": 211742.7244, "train_tokens_per_second": 29239.939 }, { "epoch": 0.7706205344012809, "grad_norm": 0.58984375, "learning_rate": 2.8047870323318382e-05, "loss": 0.40040907859802244, "num_input_tokens_seen": 6194210752, "step": 21780, "train_runtime": 211841.9374, "train_tokens_per_second": 29239.776 }, { "epoch": 0.7709743546650096, "grad_norm": 0.5703125, "learning_rate": 2.8043458407804428e-05, "loss": 0.40522065162658694, "num_input_tokens_seen": 6197046656, "step": 21790, "train_runtime": 211939.2523, "train_tokens_per_second": 29239.731 }, { "epoch": 0.7713281749287384, "grad_norm": 0.59765625, "learning_rate": 2.8039048573611805e-05, "loss": 0.4014880180358887, "num_input_tokens_seen": 6199852800, "step": 21800, "train_runtime": 212034.7268, "train_tokens_per_second": 29239.799 }, { "epoch": 0.7716819951924672, "grad_norm": 0.57421875, "learning_rate": 2.8034640819104574e-05, "loss": 0.400075626373291, "num_input_tokens_seen": 6202663808, "step": 21810, "train_runtime": 212129.1713, "train_tokens_per_second": 29240.032 }, { "epoch": 0.7720358154561959, "grad_norm": 0.59375, "learning_rate": 2.803023514264861e-05, "loss": 0.40038352012634276, "num_input_tokens_seen": 6205479296, "step": 21820, "train_runtime": 212227.6669, "train_tokens_per_second": 29239.728 }, { "epoch": 0.7723896357199247, "grad_norm": 0.57421875, "learning_rate": 2.8025831542611596e-05, "loss": 0.40074548721313474, "num_input_tokens_seen": 6208357056, "step": 21830, "train_runtime": 212326.1394, "train_tokens_per_second": 29239.721 }, { "epoch": 0.7727434559836535, "grad_norm": 0.6171875, "learning_rate": 2.8021430017362994e-05, "loss": 0.40484304428100587, "num_input_tokens_seen": 6211215936, "step": 21840, "train_runtime": 212422.6916, "train_tokens_per_second": 29239.889 }, { "epoch": 0.7730972762473823, "grad_norm": 0.58203125, "learning_rate": 2.801703056527406e-05, "loss": 0.40180673599243166, "num_input_tokens_seen": 6214038720, "step": 21850, "train_runtime": 212517.8797, "train_tokens_per_second": 29240.075 }, { "epoch": 0.7734510965111111, "grad_norm": 0.58203125, "learning_rate": 2.801263318471784e-05, "loss": 0.40531578063964846, "num_input_tokens_seen": 6216856064, "step": 21860, "train_runtime": 212611.0702, "train_tokens_per_second": 29240.51 }, { "epoch": 0.7738049167748399, "grad_norm": 0.61328125, "learning_rate": 2.800823787406917e-05, "loss": 0.402863883972168, "num_input_tokens_seen": 6219774528, "step": 21870, "train_runtime": 212712.9938, "train_tokens_per_second": 29240.219 }, { "epoch": 0.7741587370385686, "grad_norm": 0.57421875, "learning_rate": 2.8003844631704678e-05, "loss": 0.4025244235992432, "num_input_tokens_seen": 6222680512, "step": 21880, "train_runtime": 212813.8948, "train_tokens_per_second": 29240.01 }, { "epoch": 0.7745125573022974, "grad_norm": 0.58203125, "learning_rate": 2.7999453456002755e-05, "loss": 0.40511693954467776, "num_input_tokens_seen": 6225528896, "step": 21890, "train_runtime": 212912.072, "train_tokens_per_second": 29239.906 }, { "epoch": 0.7748663775660262, "grad_norm": 0.6015625, "learning_rate": 2.799506434534359e-05, "loss": 0.40181965827941896, "num_input_tokens_seen": 6228382528, "step": 21900, "train_runtime": 213011.1105, "train_tokens_per_second": 29239.707 }, { "epoch": 0.7752201978297549, "grad_norm": 0.625, "learning_rate": 2.7990677298109136e-05, "loss": 0.40729293823242185, "num_input_tokens_seen": 6231212864, "step": 21910, "train_runtime": 213107.5718, "train_tokens_per_second": 29239.753 }, { "epoch": 0.7755740180934837, "grad_norm": 0.609375, "learning_rate": 2.7986292312683125e-05, "loss": 0.4004612922668457, "num_input_tokens_seen": 6233996096, "step": 21920, "train_runtime": 213199.4556, "train_tokens_per_second": 29240.206 }, { "epoch": 0.7759278383572125, "grad_norm": 0.59375, "learning_rate": 2.798190938745106e-05, "loss": 0.40383257865905764, "num_input_tokens_seen": 6236845568, "step": 21930, "train_runtime": 213294.8793, "train_tokens_per_second": 29240.484 }, { "epoch": 0.7762816586209413, "grad_norm": 0.578125, "learning_rate": 2.7977528520800218e-05, "loss": 0.4037925243377686, "num_input_tokens_seen": 6239686912, "step": 21940, "train_runtime": 213389.3728, "train_tokens_per_second": 29240.851 }, { "epoch": 0.7766354788846701, "grad_norm": 0.58984375, "learning_rate": 2.7973149711119635e-05, "loss": 0.403082275390625, "num_input_tokens_seen": 6242501824, "step": 21950, "train_runtime": 213484.7204, "train_tokens_per_second": 29240.977 }, { "epoch": 0.7769892991483989, "grad_norm": 0.59765625, "learning_rate": 2.7968772956800115e-05, "loss": 0.3998307466506958, "num_input_tokens_seen": 6245323904, "step": 21960, "train_runtime": 213580.5955, "train_tokens_per_second": 29241.064 }, { "epoch": 0.7773431194121276, "grad_norm": 0.58203125, "learning_rate": 2.796439825623423e-05, "loss": 0.3972943305969238, "num_input_tokens_seen": 6248202496, "step": 21970, "train_runtime": 213682.8308, "train_tokens_per_second": 29240.545 }, { "epoch": 0.7776969396758564, "grad_norm": 0.5859375, "learning_rate": 2.79600256078163e-05, "loss": 0.40175352096557615, "num_input_tokens_seen": 6251015872, "step": 21980, "train_runtime": 213780.1149, "train_tokens_per_second": 29240.399 }, { "epoch": 0.7780507599395852, "grad_norm": 0.5859375, "learning_rate": 2.7955655009942416e-05, "loss": 0.398640775680542, "num_input_tokens_seen": 6253897536, "step": 21990, "train_runtime": 213879.2381, "train_tokens_per_second": 29240.321 }, { "epoch": 0.7784045802033139, "grad_norm": 0.5625, "learning_rate": 2.79512864610104e-05, "loss": 0.3993380069732666, "num_input_tokens_seen": 6256718016, "step": 22000, "train_runtime": 213975.8102, "train_tokens_per_second": 29240.305 }, { "epoch": 0.7787584004670427, "grad_norm": 0.5859375, "learning_rate": 2.794691995941986e-05, "loss": 0.3973658800125122, "num_input_tokens_seen": 6259563648, "step": 22010, "train_runtime": 214072.9752, "train_tokens_per_second": 29240.326 }, { "epoch": 0.7791122207307716, "grad_norm": 0.58984375, "learning_rate": 2.7942555503572115e-05, "loss": 0.40152807235717775, "num_input_tokens_seen": 6262393408, "step": 22020, "train_runtime": 214170.3637, "train_tokens_per_second": 29240.243 }, { "epoch": 0.7794660409945003, "grad_norm": 0.5859375, "learning_rate": 2.7938193091870268e-05, "loss": 0.40468440055847166, "num_input_tokens_seen": 6265231040, "step": 22030, "train_runtime": 214267.0567, "train_tokens_per_second": 29240.291 }, { "epoch": 0.7798198612582291, "grad_norm": 0.5703125, "learning_rate": 2.793383272271914e-05, "loss": 0.40171175003051757, "num_input_tokens_seen": 6268078272, "step": 22040, "train_runtime": 214362.9292, "train_tokens_per_second": 29240.496 }, { "epoch": 0.7801736815219579, "grad_norm": 0.59375, "learning_rate": 2.7929474394525307e-05, "loss": 0.40299282073974607, "num_input_tokens_seen": 6270969152, "step": 22050, "train_runtime": 214463.4114, "train_tokens_per_second": 29240.275 }, { "epoch": 0.7805275017856866, "grad_norm": 0.56640625, "learning_rate": 2.7925118105697078e-05, "loss": 0.40417985916137694, "num_input_tokens_seen": 6273804032, "step": 22060, "train_runtime": 214559.7929, "train_tokens_per_second": 29240.353 }, { "epoch": 0.7808813220494154, "grad_norm": 0.58984375, "learning_rate": 2.792076385464451e-05, "loss": 0.4009377479553223, "num_input_tokens_seen": 6276699200, "step": 22070, "train_runtime": 214659.8802, "train_tokens_per_second": 29240.206 }, { "epoch": 0.7812351423131442, "grad_norm": 0.5859375, "learning_rate": 2.7916411639779383e-05, "loss": 0.4046659469604492, "num_input_tokens_seen": 6279558528, "step": 22080, "train_runtime": 214760.4374, "train_tokens_per_second": 29239.829 }, { "epoch": 0.7815889625768729, "grad_norm": 0.6171875, "learning_rate": 2.7912061459515215e-05, "loss": 0.4031815052032471, "num_input_tokens_seen": 6282408320, "step": 22090, "train_runtime": 214860.6102, "train_tokens_per_second": 29239.46 }, { "epoch": 0.7819427828406018, "grad_norm": 0.6015625, "learning_rate": 2.7907713312267247e-05, "loss": 0.40269718170166013, "num_input_tokens_seen": 6285253888, "step": 22100, "train_runtime": 214958.1226, "train_tokens_per_second": 29239.434 }, { "epoch": 0.7822966031043306, "grad_norm": 0.578125, "learning_rate": 2.7903367196452457e-05, "loss": 0.40325264930725097, "num_input_tokens_seen": 6288175424, "step": 22110, "train_runtime": 215058.0007, "train_tokens_per_second": 29239.44 }, { "epoch": 0.7826504233680593, "grad_norm": 0.578125, "learning_rate": 2.7899023110489554e-05, "loss": 0.4025906562805176, "num_input_tokens_seen": 6291064832, "step": 22120, "train_runtime": 215156.3358, "train_tokens_per_second": 29239.505 }, { "epoch": 0.7830042436317881, "grad_norm": 0.59375, "learning_rate": 2.789468105279895e-05, "loss": 0.39742507934570315, "num_input_tokens_seen": 6293907776, "step": 22130, "train_runtime": 215252.8934, "train_tokens_per_second": 29239.597 }, { "epoch": 0.7833580638955169, "grad_norm": 0.58984375, "learning_rate": 2.7890341021802786e-05, "loss": 0.4017388343811035, "num_input_tokens_seen": 6296731904, "step": 22140, "train_runtime": 215349.3687, "train_tokens_per_second": 29239.612 }, { "epoch": 0.7837118841592456, "grad_norm": 0.578125, "learning_rate": 2.7886003015924933e-05, "loss": 0.40320391654968263, "num_input_tokens_seen": 6299597952, "step": 22150, "train_runtime": 215447.1514, "train_tokens_per_second": 29239.644 }, { "epoch": 0.7840657044229744, "grad_norm": 0.5703125, "learning_rate": 2.788166703359096e-05, "loss": 0.40161876678466796, "num_input_tokens_seen": 6302420160, "step": 22160, "train_runtime": 215541.2025, "train_tokens_per_second": 29239.979 }, { "epoch": 0.7844195246867032, "grad_norm": 0.57421875, "learning_rate": 2.787733307322816e-05, "loss": 0.4034140586853027, "num_input_tokens_seen": 6305252352, "step": 22170, "train_runtime": 215636.4358, "train_tokens_per_second": 29240.199 }, { "epoch": 0.7847733449504319, "grad_norm": 0.57421875, "learning_rate": 2.7873001133265518e-05, "loss": 0.4045859813690186, "num_input_tokens_seen": 6308094464, "step": 22180, "train_runtime": 215733.5725, "train_tokens_per_second": 29240.208 }, { "epoch": 0.7851271652141608, "grad_norm": 0.58984375, "learning_rate": 2.7868671212133768e-05, "loss": 0.4012325286865234, "num_input_tokens_seen": 6311009408, "step": 22190, "train_runtime": 215835.8427, "train_tokens_per_second": 29239.858 }, { "epoch": 0.7854809854778896, "grad_norm": 0.546875, "learning_rate": 2.7864343308265313e-05, "loss": 0.3999070882797241, "num_input_tokens_seen": 6313870208, "step": 22200, "train_runtime": 215932.385, "train_tokens_per_second": 29240.034 }, { "epoch": 0.7858348057416183, "grad_norm": 0.5625, "learning_rate": 2.7860017420094258e-05, "loss": 0.40146970748901367, "num_input_tokens_seen": 6316758400, "step": 22210, "train_runtime": 216031.218, "train_tokens_per_second": 29240.026 }, { "epoch": 0.7861886260053471, "grad_norm": 0.59765625, "learning_rate": 2.7855693546056445e-05, "loss": 0.3986906766891479, "num_input_tokens_seen": 6319635136, "step": 22220, "train_runtime": 216130.7995, "train_tokens_per_second": 29239.864 }, { "epoch": 0.7865424462690759, "grad_norm": 0.59765625, "learning_rate": 2.785137168458937e-05, "loss": 0.4019612312316895, "num_input_tokens_seen": 6322477056, "step": 22230, "train_runtime": 216225.1908, "train_tokens_per_second": 29240.243 }, { "epoch": 0.7868962665328046, "grad_norm": 0.57421875, "learning_rate": 2.7847051834132265e-05, "loss": 0.4017789840698242, "num_input_tokens_seen": 6325317824, "step": 22240, "train_runtime": 216322.4894, "train_tokens_per_second": 29240.223 }, { "epoch": 0.7872500867965334, "grad_norm": 0.57421875, "learning_rate": 2.784273399312603e-05, "loss": 0.4004362106323242, "num_input_tokens_seen": 6328111424, "step": 22250, "train_runtime": 216415.653, "train_tokens_per_second": 29240.544 }, { "epoch": 0.7876039070602622, "grad_norm": 0.57421875, "learning_rate": 2.783841816001326e-05, "loss": 0.40133142471313477, "num_input_tokens_seen": 6330975616, "step": 22260, "train_runtime": 216514.8248, "train_tokens_per_second": 29240.379 }, { "epoch": 0.787957727323991, "grad_norm": 0.58984375, "learning_rate": 2.7834104333238255e-05, "loss": 0.40468730926513674, "num_input_tokens_seen": 6333824768, "step": 22270, "train_runtime": 216610.8411, "train_tokens_per_second": 29240.571 }, { "epoch": 0.7883115475877198, "grad_norm": 0.5625, "learning_rate": 2.7829792511246987e-05, "loss": 0.3991037368774414, "num_input_tokens_seen": 6336694208, "step": 22280, "train_runtime": 216710.6825, "train_tokens_per_second": 29240.341 }, { "epoch": 0.7886653678514486, "grad_norm": 0.5859375, "learning_rate": 2.7825482692487114e-05, "loss": 0.40187225341796873, "num_input_tokens_seen": 6339521664, "step": 22290, "train_runtime": 216806.6155, "train_tokens_per_second": 29240.444 }, { "epoch": 0.7890191881151774, "grad_norm": 0.5859375, "learning_rate": 2.7821174875407985e-05, "loss": 0.3983335494995117, "num_input_tokens_seen": 6342405632, "step": 22300, "train_runtime": 216908.0163, "train_tokens_per_second": 29240.07 }, { "epoch": 0.7893730083789061, "grad_norm": 0.6015625, "learning_rate": 2.781686905846062e-05, "loss": 0.397584056854248, "num_input_tokens_seen": 6345213056, "step": 22310, "train_runtime": 217003.4208, "train_tokens_per_second": 29240.152 }, { "epoch": 0.7897268286426349, "grad_norm": 0.57421875, "learning_rate": 2.7812565240097716e-05, "loss": 0.3988661289215088, "num_input_tokens_seen": 6348006400, "step": 22320, "train_runtime": 217097.2848, "train_tokens_per_second": 29240.377 }, { "epoch": 0.7900806489063636, "grad_norm": 0.5625, "learning_rate": 2.7808263418773656e-05, "loss": 0.4023624897003174, "num_input_tokens_seen": 6350875264, "step": 22330, "train_runtime": 217194.5227, "train_tokens_per_second": 29240.495 }, { "epoch": 0.7904344691700924, "grad_norm": 0.59375, "learning_rate": 2.7803963592944482e-05, "loss": 0.3968529462814331, "num_input_tokens_seen": 6353698624, "step": 22340, "train_runtime": 217289.9557, "train_tokens_per_second": 29240.646 }, { "epoch": 0.7907882894338213, "grad_norm": 0.59765625, "learning_rate": 2.779966576106792e-05, "loss": 0.40396957397460936, "num_input_tokens_seen": 6356481472, "step": 22350, "train_runtime": 217382.8834, "train_tokens_per_second": 29240.947 }, { "epoch": 0.7911421096975501, "grad_norm": 0.58984375, "learning_rate": 2.779536992160336e-05, "loss": 0.401324987411499, "num_input_tokens_seen": 6359324096, "step": 22360, "train_runtime": 217480.7217, "train_tokens_per_second": 29240.863 }, { "epoch": 0.7914959299612788, "grad_norm": 0.609375, "learning_rate": 2.7791076073011845e-05, "loss": 0.4039212703704834, "num_input_tokens_seen": 6362175808, "step": 22370, "train_runtime": 217579.1175, "train_tokens_per_second": 29240.746 }, { "epoch": 0.7918497502250076, "grad_norm": 0.609375, "learning_rate": 2.7786784213756102e-05, "loss": 0.4011545181274414, "num_input_tokens_seen": 6365002496, "step": 22380, "train_runtime": 217676.1372, "train_tokens_per_second": 29240.699 }, { "epoch": 0.7922035704887364, "grad_norm": 0.5859375, "learning_rate": 2.7782494342300502e-05, "loss": 0.4010001659393311, "num_input_tokens_seen": 6367800384, "step": 22390, "train_runtime": 217766.7573, "train_tokens_per_second": 29241.379 }, { "epoch": 0.7925573907524651, "grad_norm": 0.5859375, "learning_rate": 2.777820645711109e-05, "loss": 0.4051644325256348, "num_input_tokens_seen": 6370698624, "step": 22400, "train_runtime": 217866.8912, "train_tokens_per_second": 29241.243 }, { "epoch": 0.7929112110161939, "grad_norm": 0.5859375, "learning_rate": 2.777392055665556e-05, "loss": 0.40039501190185545, "num_input_tokens_seen": 6373549824, "step": 22410, "train_runtime": 217964.9791, "train_tokens_per_second": 29241.165 }, { "epoch": 0.7932650312799226, "grad_norm": 0.58203125, "learning_rate": 2.7769636639403252e-05, "loss": 0.400991153717041, "num_input_tokens_seen": 6376342400, "step": 22420, "train_runtime": 218059.1645, "train_tokens_per_second": 29241.341 }, { "epoch": 0.7936188515436514, "grad_norm": 0.59375, "learning_rate": 2.776535470382518e-05, "loss": 0.40067543983459475, "num_input_tokens_seen": 6379187776, "step": 22430, "train_runtime": 218157.2092, "train_tokens_per_second": 29241.242 }, { "epoch": 0.7939726718073803, "grad_norm": 0.57421875, "learning_rate": 2.776107474839399e-05, "loss": 0.40239601135253905, "num_input_tokens_seen": 6382054144, "step": 22440, "train_runtime": 218257.6177, "train_tokens_per_second": 29240.923 }, { "epoch": 0.7943264920711091, "grad_norm": 0.5703125, "learning_rate": 2.7756796771583976e-05, "loss": 0.39692723751068115, "num_input_tokens_seen": 6384900416, "step": 22450, "train_runtime": 218353.4945, "train_tokens_per_second": 29241.119 }, { "epoch": 0.7946803123348378, "grad_norm": 0.59765625, "learning_rate": 2.775252077187109e-05, "loss": 0.39790935516357423, "num_input_tokens_seen": 6387747456, "step": 22460, "train_runtime": 218450.358, "train_tokens_per_second": 29241.186 }, { "epoch": 0.7950341325985666, "grad_norm": 0.5859375, "learning_rate": 2.7748246747732902e-05, "loss": 0.4012287616729736, "num_input_tokens_seen": 6390513600, "step": 22470, "train_runtime": 218544.5121, "train_tokens_per_second": 29241.245 }, { "epoch": 0.7953879528622954, "grad_norm": 0.59765625, "learning_rate": 2.774397469764866e-05, "loss": 0.4026956558227539, "num_input_tokens_seen": 6393333760, "step": 22480, "train_runtime": 218639.1148, "train_tokens_per_second": 29241.491 }, { "epoch": 0.7957417731260241, "grad_norm": 0.58203125, "learning_rate": 2.7739704620099226e-05, "loss": 0.40224671363830566, "num_input_tokens_seen": 6396174656, "step": 22490, "train_runtime": 218738.023, "train_tokens_per_second": 29241.257 }, { "epoch": 0.7960955933897529, "grad_norm": 0.57421875, "learning_rate": 2.7735436513567098e-05, "loss": 0.3987330436706543, "num_input_tokens_seen": 6399009600, "step": 22500, "train_runtime": 218836.2403, "train_tokens_per_second": 29241.087 }, { "epoch": 0.7964494136534817, "grad_norm": 0.6015625, "learning_rate": 2.7731170376536402e-05, "loss": 0.40046215057373047, "num_input_tokens_seen": 6401880448, "step": 22510, "train_runtime": 218934.1744, "train_tokens_per_second": 29241.12 }, { "epoch": 0.7968032339172105, "grad_norm": 0.5625, "learning_rate": 2.7726906207492925e-05, "loss": 0.40197367668151857, "num_input_tokens_seen": 6404782144, "step": 22520, "train_runtime": 219035.2656, "train_tokens_per_second": 29240.872 }, { "epoch": 0.7971570541809393, "grad_norm": 0.59375, "learning_rate": 2.7722644004924048e-05, "loss": 0.4049616813659668, "num_input_tokens_seen": 6407612544, "step": 22530, "train_runtime": 219133.1562, "train_tokens_per_second": 29240.726 }, { "epoch": 0.7975108744446681, "grad_norm": 0.578125, "learning_rate": 2.77183837673188e-05, "loss": 0.3956486225128174, "num_input_tokens_seen": 6410450176, "step": 22540, "train_runtime": 219231.7534, "train_tokens_per_second": 29240.519 }, { "epoch": 0.7978646947083968, "grad_norm": 0.65625, "learning_rate": 2.7714125493167835e-05, "loss": 0.39937601089477537, "num_input_tokens_seen": 6413332416, "step": 22550, "train_runtime": 219333.9944, "train_tokens_per_second": 29240.029 }, { "epoch": 0.7982185149721256, "grad_norm": 0.59375, "learning_rate": 2.770986918096342e-05, "loss": 0.3993282079696655, "num_input_tokens_seen": 6416186432, "step": 22560, "train_runtime": 219432.4533, "train_tokens_per_second": 29239.916 }, { "epoch": 0.7985723352358544, "grad_norm": 0.61328125, "learning_rate": 2.7705614829199454e-05, "loss": 0.40130019187927246, "num_input_tokens_seen": 6418982848, "step": 22570, "train_runtime": 219527.2396, "train_tokens_per_second": 29240.029 }, { "epoch": 0.7989261554995831, "grad_norm": 0.5703125, "learning_rate": 2.7701362436371437e-05, "loss": 0.4002102851867676, "num_input_tokens_seen": 6421845056, "step": 22580, "train_runtime": 219626.3015, "train_tokens_per_second": 29239.873 }, { "epoch": 0.7992799757633119, "grad_norm": 0.59375, "learning_rate": 2.7697112000976492e-05, "loss": 0.3958927869796753, "num_input_tokens_seen": 6424694080, "step": 22590, "train_runtime": 219722.4644, "train_tokens_per_second": 29240.042 }, { "epoch": 0.7996337960270408, "grad_norm": 0.56640625, "learning_rate": 2.769286352151338e-05, "loss": 0.4024338722229004, "num_input_tokens_seen": 6427556096, "step": 22600, "train_runtime": 219819.9892, "train_tokens_per_second": 29240.089 }, { "epoch": 0.7999876162907695, "grad_norm": 0.5859375, "learning_rate": 2.768861699648243e-05, "loss": 0.39873199462890624, "num_input_tokens_seen": 6430488064, "step": 22610, "train_runtime": 219919.6272, "train_tokens_per_second": 29240.174 }, { "epoch": 0.8003414365544983, "grad_norm": 0.61328125, "learning_rate": 2.7684372424385613e-05, "loss": 0.4021897315979004, "num_input_tokens_seen": 6433337280, "step": 22620, "train_runtime": 220016.2226, "train_tokens_per_second": 29240.286 }, { "epoch": 0.8006952568182271, "grad_norm": 0.57421875, "learning_rate": 2.7680129803726496e-05, "loss": 0.397288179397583, "num_input_tokens_seen": 6436162176, "step": 22630, "train_runtime": 220113.6745, "train_tokens_per_second": 29240.174 }, { "epoch": 0.8010490770819558, "grad_norm": 0.5703125, "learning_rate": 2.767588913301025e-05, "loss": 0.40419631004333495, "num_input_tokens_seen": 6439001344, "step": 22640, "train_runtime": 220209.7097, "train_tokens_per_second": 29240.315 }, { "epoch": 0.8014028973456846, "grad_norm": 0.62109375, "learning_rate": 2.767165041074365e-05, "loss": 0.40021524429321287, "num_input_tokens_seen": 6441841536, "step": 22650, "train_runtime": 220305.0654, "train_tokens_per_second": 29240.551 }, { "epoch": 0.8017567176094134, "grad_norm": 0.5625, "learning_rate": 2.766741363543507e-05, "loss": 0.4055091381072998, "num_input_tokens_seen": 6444707584, "step": 22660, "train_runtime": 220403.9741, "train_tokens_per_second": 29240.433 }, { "epoch": 0.8021105378731421, "grad_norm": 0.60546875, "learning_rate": 2.7663178805594482e-05, "loss": 0.3965758800506592, "num_input_tokens_seen": 6447578112, "step": 22670, "train_runtime": 220501.3667, "train_tokens_per_second": 29240.536 }, { "epoch": 0.8024643581368709, "grad_norm": 0.56640625, "learning_rate": 2.7658945919733463e-05, "loss": 0.4039391040802002, "num_input_tokens_seen": 6450483520, "step": 22680, "train_runtime": 220604.4382, "train_tokens_per_second": 29240.044 }, { "epoch": 0.8028181784005998, "grad_norm": 0.57421875, "learning_rate": 2.7654714976365164e-05, "loss": 0.39691615104675293, "num_input_tokens_seen": 6453366400, "step": 22690, "train_runtime": 220701.4209, "train_tokens_per_second": 29240.258 }, { "epoch": 0.8031719986643285, "grad_norm": 0.5703125, "learning_rate": 2.765048597400436e-05, "loss": 0.4009274482727051, "num_input_tokens_seen": 6456204928, "step": 22700, "train_runtime": 220797.4659, "train_tokens_per_second": 29240.394 }, { "epoch": 0.8035258189280573, "grad_norm": 0.56640625, "learning_rate": 2.7646258911167373e-05, "loss": 0.4031529426574707, "num_input_tokens_seen": 6459031936, "step": 22710, "train_runtime": 220894.3986, "train_tokens_per_second": 29240.361 }, { "epoch": 0.8038796391917861, "grad_norm": 0.5859375, "learning_rate": 2.7642033786372145e-05, "loss": 0.40304059982299806, "num_input_tokens_seen": 6461922624, "step": 22720, "train_runtime": 220991.3738, "train_tokens_per_second": 29240.61 }, { "epoch": 0.8042334594555148, "grad_norm": 0.5859375, "learning_rate": 2.7637810598138193e-05, "loss": 0.3979023456573486, "num_input_tokens_seen": 6464810112, "step": 22730, "train_runtime": 221087.8941, "train_tokens_per_second": 29240.905 }, { "epoch": 0.8045872797192436, "grad_norm": 0.60546875, "learning_rate": 2.7633589344986615e-05, "loss": 0.4018411636352539, "num_input_tokens_seen": 6467718464, "step": 22740, "train_runtime": 221189.9903, "train_tokens_per_second": 29240.557 }, { "epoch": 0.8049410999829724, "grad_norm": 0.60546875, "learning_rate": 2.7629370025440087e-05, "loss": 0.40100917816162107, "num_input_tokens_seen": 6470567360, "step": 22750, "train_runtime": 221289.593, "train_tokens_per_second": 29240.27 }, { "epoch": 0.8052949202467011, "grad_norm": 0.5859375, "learning_rate": 2.762515263802287e-05, "loss": 0.40035085678100585, "num_input_tokens_seen": 6473497920, "step": 22760, "train_runtime": 221389.8537, "train_tokens_per_second": 29240.265 }, { "epoch": 0.80564874051043, "grad_norm": 0.578125, "learning_rate": 2.762093718126081e-05, "loss": 0.40250182151794434, "num_input_tokens_seen": 6476327488, "step": 22770, "train_runtime": 221482.7278, "train_tokens_per_second": 29240.779 }, { "epoch": 0.8060025607741588, "grad_norm": 0.5859375, "learning_rate": 2.7616723653681298e-05, "loss": 0.4035053253173828, "num_input_tokens_seen": 6479164608, "step": 22780, "train_runtime": 221578.8002, "train_tokens_per_second": 29240.905 }, { "epoch": 0.8063563810378875, "grad_norm": 0.60546875, "learning_rate": 2.761251205381332e-05, "loss": 0.39922728538513186, "num_input_tokens_seen": 6482004800, "step": 22790, "train_runtime": 221675.5232, "train_tokens_per_second": 29240.959 }, { "epoch": 0.8067102013016163, "grad_norm": 0.5859375, "learning_rate": 2.760830238018744e-05, "loss": 0.4007260322570801, "num_input_tokens_seen": 6484838592, "step": 22800, "train_runtime": 221773.2235, "train_tokens_per_second": 29240.855 }, { "epoch": 0.8070640215653451, "grad_norm": 0.59375, "learning_rate": 2.760409463133576e-05, "loss": 0.39955615997314453, "num_input_tokens_seen": 6487655488, "step": 22810, "train_runtime": 221866.7595, "train_tokens_per_second": 29241.223 }, { "epoch": 0.8074178418290738, "grad_norm": 0.61328125, "learning_rate": 2.7599888805791967e-05, "loss": 0.40296120643615724, "num_input_tokens_seen": 6490529792, "step": 22820, "train_runtime": 221968.1833, "train_tokens_per_second": 29240.811 }, { "epoch": 0.8077716620928026, "grad_norm": 0.5703125, "learning_rate": 2.759568490209132e-05, "loss": 0.3974020004272461, "num_input_tokens_seen": 6493384512, "step": 22830, "train_runtime": 222065.6348, "train_tokens_per_second": 29240.835 }, { "epoch": 0.8081254823565314, "grad_norm": 0.6015625, "learning_rate": 2.7591482918770613e-05, "loss": 0.39903085231781005, "num_input_tokens_seen": 6496235776, "step": 22840, "train_runtime": 222162.364, "train_tokens_per_second": 29240.937 }, { "epoch": 0.8084793026202602, "grad_norm": 0.5625, "learning_rate": 2.7587282854368222e-05, "loss": 0.39942545890808107, "num_input_tokens_seen": 6499074240, "step": 22850, "train_runtime": 222260.5674, "train_tokens_per_second": 29240.788 }, { "epoch": 0.808833122883989, "grad_norm": 0.5859375, "learning_rate": 2.7583084707424072e-05, "loss": 0.3966909170150757, "num_input_tokens_seen": 6501894272, "step": 22860, "train_runtime": 222356.4561, "train_tokens_per_second": 29240.861 }, { "epoch": 0.8091869431477178, "grad_norm": 0.58203125, "learning_rate": 2.7578888476479643e-05, "loss": 0.402421760559082, "num_input_tokens_seen": 6504719232, "step": 22870, "train_runtime": 222453.212, "train_tokens_per_second": 29240.842 }, { "epoch": 0.8095407634114465, "grad_norm": 0.60546875, "learning_rate": 2.7574694160077964e-05, "loss": 0.3987089157104492, "num_input_tokens_seen": 6507529088, "step": 22880, "train_runtime": 222548.3018, "train_tokens_per_second": 29240.974 }, { "epoch": 0.8098945836751753, "grad_norm": 0.578125, "learning_rate": 2.757050175676362e-05, "loss": 0.4025400161743164, "num_input_tokens_seen": 6510378048, "step": 22890, "train_runtime": 222647.7113, "train_tokens_per_second": 29240.714 }, { "epoch": 0.8102484039389041, "grad_norm": 0.54296875, "learning_rate": 2.756631126508274e-05, "loss": 0.401155948638916, "num_input_tokens_seen": 6513212288, "step": 22900, "train_runtime": 222741.6124, "train_tokens_per_second": 29241.111 }, { "epoch": 0.8106022242026328, "grad_norm": 0.58203125, "learning_rate": 2.7562122683583004e-05, "loss": 0.4013826847076416, "num_input_tokens_seen": 6516022976, "step": 22910, "train_runtime": 222840.1361, "train_tokens_per_second": 29240.796 }, { "epoch": 0.8109560444663616, "grad_norm": 0.5703125, "learning_rate": 2.7557936010813634e-05, "loss": 0.40588741302490233, "num_input_tokens_seen": 6518820352, "step": 22920, "train_runtime": 222934.9214, "train_tokens_per_second": 29240.912 }, { "epoch": 0.8113098647300904, "grad_norm": 0.58203125, "learning_rate": 2.75537512453254e-05, "loss": 0.4023984432220459, "num_input_tokens_seen": 6521648768, "step": 22930, "train_runtime": 223034.0193, "train_tokens_per_second": 29240.601 }, { "epoch": 0.8116636849938192, "grad_norm": 0.61328125, "learning_rate": 2.7549568385670595e-05, "loss": 0.40431985855102537, "num_input_tokens_seen": 6524491072, "step": 22940, "train_runtime": 223131.9726, "train_tokens_per_second": 29240.503 }, { "epoch": 0.812017505257548, "grad_norm": 0.609375, "learning_rate": 2.754538743040307e-05, "loss": 0.4044541835784912, "num_input_tokens_seen": 6527338176, "step": 22950, "train_runtime": 223229.1498, "train_tokens_per_second": 29240.528 }, { "epoch": 0.8123713255212768, "grad_norm": 0.59765625, "learning_rate": 2.75412083780782e-05, "loss": 0.3979846239089966, "num_input_tokens_seen": 6530195456, "step": 22960, "train_runtime": 223326.5544, "train_tokens_per_second": 29240.569 }, { "epoch": 0.8127251457850055, "grad_norm": 0.5703125, "learning_rate": 2.7537031227252898e-05, "loss": 0.4007590293884277, "num_input_tokens_seen": 6533060800, "step": 22970, "train_runtime": 223426.6871, "train_tokens_per_second": 29240.289 }, { "epoch": 0.8130789660487343, "grad_norm": 0.578125, "learning_rate": 2.75328559764856e-05, "loss": 0.405216121673584, "num_input_tokens_seen": 6535907968, "step": 22980, "train_runtime": 223522.5217, "train_tokens_per_second": 29240.49 }, { "epoch": 0.8134327863124631, "grad_norm": 0.59765625, "learning_rate": 2.752868262433629e-05, "loss": 0.40304250717163087, "num_input_tokens_seen": 6538782976, "step": 22990, "train_runtime": 223622.3276, "train_tokens_per_second": 29240.296 }, { "epoch": 0.8137866065761918, "grad_norm": 0.58984375, "learning_rate": 2.752451116936646e-05, "loss": 0.4003291606903076, "num_input_tokens_seen": 6541612096, "step": 23000, "train_runtime": 223717.8049, "train_tokens_per_second": 29240.463 }, { "epoch": 0.8141404268399206, "grad_norm": 0.609375, "learning_rate": 2.752034161013915e-05, "loss": 0.398400092124939, "num_input_tokens_seen": 6544474112, "step": 23010, "train_runtime": 223818.1918, "train_tokens_per_second": 29240.135 }, { "epoch": 0.8144942471036495, "grad_norm": 0.5703125, "learning_rate": 2.7516173945218888e-05, "loss": 0.39873456954956055, "num_input_tokens_seen": 6547316608, "step": 23020, "train_runtime": 223912.2222, "train_tokens_per_second": 29240.55 }, { "epoch": 0.8148480673673782, "grad_norm": 0.5859375, "learning_rate": 2.751200817317176e-05, "loss": 0.4035696029663086, "num_input_tokens_seen": 6550139776, "step": 23030, "train_runtime": 224009.0095, "train_tokens_per_second": 29240.519 }, { "epoch": 0.815201887631107, "grad_norm": 0.578125, "learning_rate": 2.7507844292565354e-05, "loss": 0.39484448432922364, "num_input_tokens_seen": 6552959808, "step": 23040, "train_runtime": 224105.9147, "train_tokens_per_second": 29240.459 }, { "epoch": 0.8155557078948358, "grad_norm": 0.6171875, "learning_rate": 2.7503682301968763e-05, "loss": 0.39975433349609374, "num_input_tokens_seen": 6555845696, "step": 23050, "train_runtime": 224206.8054, "train_tokens_per_second": 29240.173 }, { "epoch": 0.8159095281585645, "grad_norm": 0.59375, "learning_rate": 2.7499522199952627e-05, "loss": 0.4039126396179199, "num_input_tokens_seen": 6558741824, "step": 23060, "train_runtime": 224309.5896, "train_tokens_per_second": 29239.685 }, { "epoch": 0.8162633484222933, "grad_norm": 0.609375, "learning_rate": 2.7495363985089072e-05, "loss": 0.398949408531189, "num_input_tokens_seen": 6561577408, "step": 23070, "train_runtime": 224407.1797, "train_tokens_per_second": 29239.606 }, { "epoch": 0.8166171686860221, "grad_norm": 0.578125, "learning_rate": 2.7491207655951745e-05, "loss": 0.4011551856994629, "num_input_tokens_seen": 6564394368, "step": 23080, "train_runtime": 224502.6535, "train_tokens_per_second": 29239.718 }, { "epoch": 0.8169709889497508, "grad_norm": 0.58203125, "learning_rate": 2.7487053211115797e-05, "loss": 0.3990474224090576, "num_input_tokens_seen": 6567258048, "step": 23090, "train_runtime": 224603.8309, "train_tokens_per_second": 29239.297 }, { "epoch": 0.8173248092134797, "grad_norm": 0.6171875, "learning_rate": 2.748290064915789e-05, "loss": 0.4018836975097656, "num_input_tokens_seen": 6570109760, "step": 23100, "train_runtime": 224701.3323, "train_tokens_per_second": 29239.3 }, { "epoch": 0.8176786294772085, "grad_norm": 0.58984375, "learning_rate": 2.747874996865619e-05, "loss": 0.4037341117858887, "num_input_tokens_seen": 6572910400, "step": 23110, "train_runtime": 224797.346, "train_tokens_per_second": 29239.27 }, { "epoch": 0.8180324497409373, "grad_norm": 0.60546875, "learning_rate": 2.747460116819037e-05, "loss": 0.40352768898010255, "num_input_tokens_seen": 6575717312, "step": 23120, "train_runtime": 224890.6347, "train_tokens_per_second": 29239.623 }, { "epoch": 0.818386270004666, "grad_norm": 0.609375, "learning_rate": 2.7470454246341597e-05, "loss": 0.40348501205444337, "num_input_tokens_seen": 6578460416, "step": 23130, "train_runtime": 224982.1247, "train_tokens_per_second": 29239.925 }, { "epoch": 0.8187400902683948, "grad_norm": 0.58203125, "learning_rate": 2.746630920169254e-05, "loss": 0.40070600509643556, "num_input_tokens_seen": 6581277248, "step": 23140, "train_runtime": 225080.2647, "train_tokens_per_second": 29239.69 }, { "epoch": 0.8190939105321235, "grad_norm": 0.59765625, "learning_rate": 2.7462166032827358e-05, "loss": 0.40209321975708007, "num_input_tokens_seen": 6584125312, "step": 23150, "train_runtime": 225178.987, "train_tokens_per_second": 29239.519 }, { "epoch": 0.8194477307958523, "grad_norm": 0.578125, "learning_rate": 2.745802473833171e-05, "loss": 0.4015172004699707, "num_input_tokens_seen": 6586948032, "step": 23160, "train_runtime": 225274.9314, "train_tokens_per_second": 29239.596 }, { "epoch": 0.8198015510595811, "grad_norm": 0.578125, "learning_rate": 2.7453885316792755e-05, "loss": 0.39780478477478026, "num_input_tokens_seen": 6589785408, "step": 23170, "train_runtime": 225371.6977, "train_tokens_per_second": 29239.632 }, { "epoch": 0.8201553713233098, "grad_norm": 0.57421875, "learning_rate": 2.7449747766799135e-05, "loss": 0.3977693557739258, "num_input_tokens_seen": 6592632320, "step": 23180, "train_runtime": 225471.259, "train_tokens_per_second": 29239.347 }, { "epoch": 0.8205091915870387, "grad_norm": 0.59375, "learning_rate": 2.744561208694097e-05, "loss": 0.40313167572021485, "num_input_tokens_seen": 6595490112, "step": 23190, "train_runtime": 225568.1201, "train_tokens_per_second": 29239.46 }, { "epoch": 0.8208630118507675, "grad_norm": 0.578125, "learning_rate": 2.7441478275809884e-05, "loss": 0.40102329254150393, "num_input_tokens_seen": 6598388416, "step": 23200, "train_runtime": 225669.2044, "train_tokens_per_second": 29239.206 }, { "epoch": 0.8212168321144963, "grad_norm": 0.62109375, "learning_rate": 2.743734633199898e-05, "loss": 0.4089224338531494, "num_input_tokens_seen": 6601239296, "step": 23210, "train_runtime": 225767.9258, "train_tokens_per_second": 29239.048 }, { "epoch": 0.821570652378225, "grad_norm": 0.58203125, "learning_rate": 2.743321625410284e-05, "loss": 0.4025871276855469, "num_input_tokens_seen": 6604035840, "step": 23220, "train_runtime": 225860.6639, "train_tokens_per_second": 29239.425 }, { "epoch": 0.8219244726419538, "grad_norm": 0.58984375, "learning_rate": 2.7429088040717526e-05, "loss": 0.40401582717895507, "num_input_tokens_seen": 6606898432, "step": 23230, "train_runtime": 225957.8124, "train_tokens_per_second": 29239.522 }, { "epoch": 0.8222782929056826, "grad_norm": 0.59375, "learning_rate": 2.7424961690440586e-05, "loss": 0.39657657146453856, "num_input_tokens_seen": 6609739008, "step": 23240, "train_runtime": 226051.7867, "train_tokens_per_second": 29239.933 }, { "epoch": 0.8226321131694113, "grad_norm": 0.62109375, "learning_rate": 2.742083720187103e-05, "loss": 0.39868438243865967, "num_input_tokens_seen": 6612523008, "step": 23250, "train_runtime": 226143.6327, "train_tokens_per_second": 29240.368 }, { "epoch": 0.8229859334331401, "grad_norm": 0.61328125, "learning_rate": 2.7416714573609363e-05, "loss": 0.40042638778686523, "num_input_tokens_seen": 6615339584, "step": 23260, "train_runtime": 226240.2902, "train_tokens_per_second": 29240.325 }, { "epoch": 0.823339753696869, "grad_norm": 0.578125, "learning_rate": 2.7412593804257543e-05, "loss": 0.40003418922424316, "num_input_tokens_seen": 6618179392, "step": 23270, "train_runtime": 226334.7984, "train_tokens_per_second": 29240.662 }, { "epoch": 0.8236935739605977, "grad_norm": 0.59765625, "learning_rate": 2.740847489241901e-05, "loss": 0.40078253746032716, "num_input_tokens_seen": 6621007104, "step": 23280, "train_runtime": 226432.7942, "train_tokens_per_second": 29240.496 }, { "epoch": 0.8240473942243265, "grad_norm": 0.5859375, "learning_rate": 2.7404357836698668e-05, "loss": 0.40749382972717285, "num_input_tokens_seen": 6623822912, "step": 23290, "train_runtime": 226527.7947, "train_tokens_per_second": 29240.663 }, { "epoch": 0.8244012144880553, "grad_norm": 0.58203125, "learning_rate": 2.740024263570289e-05, "loss": 0.40078063011169435, "num_input_tokens_seen": 6626688576, "step": 23300, "train_runtime": 226625.6531, "train_tokens_per_second": 29240.682 }, { "epoch": 0.824755034751784, "grad_norm": 0.60546875, "learning_rate": 2.7396129288039503e-05, "loss": 0.3996004104614258, "num_input_tokens_seen": 6629458304, "step": 23310, "train_runtime": 226717.9459, "train_tokens_per_second": 29240.995 }, { "epoch": 0.8251088550155128, "grad_norm": 0.6171875, "learning_rate": 2.739201779231782e-05, "loss": 0.40511474609375, "num_input_tokens_seen": 6632267136, "step": 23320, "train_runtime": 226811.3615, "train_tokens_per_second": 29241.336 }, { "epoch": 0.8254626752792416, "grad_norm": 0.58984375, "learning_rate": 2.7387908147148587e-05, "loss": 0.4056240081787109, "num_input_tokens_seen": 6635163584, "step": 23330, "train_runtime": 226911.4497, "train_tokens_per_second": 29241.202 }, { "epoch": 0.8258164955429703, "grad_norm": 0.6171875, "learning_rate": 2.7383800351144027e-05, "loss": 0.40821280479431155, "num_input_tokens_seen": 6638039808, "step": 23340, "train_runtime": 227007.081, "train_tokens_per_second": 29241.554 }, { "epoch": 0.8261703158066992, "grad_norm": 0.56640625, "learning_rate": 2.737969440291782e-05, "loss": 0.40048990249633787, "num_input_tokens_seen": 6640829056, "step": 23350, "train_runtime": 227101.362, "train_tokens_per_second": 29241.696 }, { "epoch": 0.826524136070428, "grad_norm": 0.58203125, "learning_rate": 2.7375590301085087e-05, "loss": 0.4001479625701904, "num_input_tokens_seen": 6643602688, "step": 23360, "train_runtime": 227195.9009, "train_tokens_per_second": 29241.737 }, { "epoch": 0.8268779563341567, "grad_norm": 0.61328125, "learning_rate": 2.7371488044262406e-05, "loss": 0.40163044929504393, "num_input_tokens_seen": 6646403584, "step": 23370, "train_runtime": 227288.1138, "train_tokens_per_second": 29242.196 }, { "epoch": 0.8272317765978855, "grad_norm": 0.5703125, "learning_rate": 2.7367387631067816e-05, "loss": 0.397481107711792, "num_input_tokens_seen": 6649190208, "step": 23380, "train_runtime": 227382.4682, "train_tokens_per_second": 29242.317 }, { "epoch": 0.8275855968616143, "grad_norm": 0.59375, "learning_rate": 2.73632890601208e-05, "loss": 0.40126667022705076, "num_input_tokens_seen": 6651995392, "step": 23390, "train_runtime": 227477.2003, "train_tokens_per_second": 29242.471 }, { "epoch": 0.827939417125343, "grad_norm": 0.58203125, "learning_rate": 2.7359192330042277e-05, "loss": 0.3992583990097046, "num_input_tokens_seen": 6654835136, "step": 23400, "train_runtime": 227574.5842, "train_tokens_per_second": 29242.436 }, { "epoch": 0.8282932373890718, "grad_norm": 0.578125, "learning_rate": 2.7355097439454625e-05, "loss": 0.40599637031555175, "num_input_tokens_seen": 6657648832, "step": 23410, "train_runtime": 227668.8874, "train_tokens_per_second": 29242.682 }, { "epoch": 0.8286470576528006, "grad_norm": 0.59375, "learning_rate": 2.735100438698166e-05, "loss": 0.4006871223449707, "num_input_tokens_seen": 6660510272, "step": 23420, "train_runtime": 227767.5554, "train_tokens_per_second": 29242.577 }, { "epoch": 0.8290008779165293, "grad_norm": 0.59375, "learning_rate": 2.7346913171248635e-05, "loss": 0.4014723300933838, "num_input_tokens_seen": 6663379200, "step": 23430, "train_runtime": 227870.0338, "train_tokens_per_second": 29242.016 }, { "epoch": 0.8293546981802582, "grad_norm": 0.6015625, "learning_rate": 2.734282379088225e-05, "loss": 0.3993005037307739, "num_input_tokens_seen": 6666237120, "step": 23440, "train_runtime": 227970.6983, "train_tokens_per_second": 29241.64 }, { "epoch": 0.829708518443987, "grad_norm": 0.609375, "learning_rate": 2.733873624451063e-05, "loss": 0.40107412338256837, "num_input_tokens_seen": 6669092544, "step": 23450, "train_runtime": 228069.286, "train_tokens_per_second": 29241.52 }, { "epoch": 0.8300623387077157, "grad_norm": 0.609375, "learning_rate": 2.733465053076335e-05, "loss": 0.40411982536315916, "num_input_tokens_seen": 6671894848, "step": 23460, "train_runtime": 228164.9418, "train_tokens_per_second": 29241.543 }, { "epoch": 0.8304161589714445, "grad_norm": 0.5625, "learning_rate": 2.733056664827141e-05, "loss": 0.3983922004699707, "num_input_tokens_seen": 6674719872, "step": 23470, "train_runtime": 228259.0279, "train_tokens_per_second": 29241.866 }, { "epoch": 0.8307699792351733, "grad_norm": 0.60546875, "learning_rate": 2.732648459566724e-05, "loss": 0.4013786792755127, "num_input_tokens_seen": 6677592960, "step": 23480, "train_runtime": 228358.8753, "train_tokens_per_second": 29241.662 }, { "epoch": 0.831123799498902, "grad_norm": 0.58984375, "learning_rate": 2.73224043715847e-05, "loss": 0.40276732444763186, "num_input_tokens_seen": 6680380736, "step": 23490, "train_runtime": 228452.0276, "train_tokens_per_second": 29241.941 }, { "epoch": 0.8314776197626308, "grad_norm": 0.59765625, "learning_rate": 2.731832597465908e-05, "loss": 0.40181670188903806, "num_input_tokens_seen": 6683200000, "step": 23500, "train_runtime": 228548.9566, "train_tokens_per_second": 29241.875 }, { "epoch": 0.8318314400263596, "grad_norm": 0.625, "learning_rate": 2.7314249403527097e-05, "loss": 0.3983565330505371, "num_input_tokens_seen": 6686038400, "step": 23510, "train_runtime": 228648.2155, "train_tokens_per_second": 29241.594 }, { "epoch": 0.8321852602900884, "grad_norm": 0.6015625, "learning_rate": 2.731017465682689e-05, "loss": 0.4006089210510254, "num_input_tokens_seen": 6688851328, "step": 23520, "train_runtime": 228743.8829, "train_tokens_per_second": 29241.662 }, { "epoch": 0.8325390805538172, "grad_norm": 0.57421875, "learning_rate": 2.730610173319802e-05, "loss": 0.4024630546569824, "num_input_tokens_seen": 6691664960, "step": 23530, "train_runtime": 228838.0542, "train_tokens_per_second": 29241.924 }, { "epoch": 0.832892900817546, "grad_norm": 0.59765625, "learning_rate": 2.7302030631281454e-05, "loss": 0.40010366439819334, "num_input_tokens_seen": 6694520128, "step": 23540, "train_runtime": 228935.3453, "train_tokens_per_second": 29241.968 }, { "epoch": 0.8332467210812747, "grad_norm": 0.6015625, "learning_rate": 2.7297961349719608e-05, "loss": 0.4005733489990234, "num_input_tokens_seen": 6697419392, "step": 23550, "train_runtime": 229037.5235, "train_tokens_per_second": 29241.581 }, { "epoch": 0.8336005413450035, "grad_norm": 0.61328125, "learning_rate": 2.729389388715628e-05, "loss": 0.403204345703125, "num_input_tokens_seen": 6700298176, "step": 23560, "train_runtime": 229138.2028, "train_tokens_per_second": 29241.297 }, { "epoch": 0.8339543616087323, "grad_norm": 0.60546875, "learning_rate": 2.728982824223671e-05, "loss": 0.40502614974975587, "num_input_tokens_seen": 6703155264, "step": 23570, "train_runtime": 229234.0075, "train_tokens_per_second": 29241.539 }, { "epoch": 0.834308181872461, "grad_norm": 0.60546875, "learning_rate": 2.7285764413607527e-05, "loss": 0.4047130584716797, "num_input_tokens_seen": 6706059072, "step": 23580, "train_runtime": 229332.7372, "train_tokens_per_second": 29241.613 }, { "epoch": 0.8346620021361898, "grad_norm": 0.59765625, "learning_rate": 2.7281702399916786e-05, "loss": 0.4016727924346924, "num_input_tokens_seen": 6708845440, "step": 23590, "train_runtime": 229426.6707, "train_tokens_per_second": 29241.785 }, { "epoch": 0.8350158223999187, "grad_norm": 0.58984375, "learning_rate": 2.7277642199813954e-05, "loss": 0.4033057689666748, "num_input_tokens_seen": 6711675456, "step": 23600, "train_runtime": 229523.5159, "train_tokens_per_second": 29241.777 }, { "epoch": 0.8353696426636474, "grad_norm": 0.59375, "learning_rate": 2.7273583811949882e-05, "loss": 0.4035799026489258, "num_input_tokens_seen": 6714522112, "step": 23610, "train_runtime": 229618.9217, "train_tokens_per_second": 29242.024 }, { "epoch": 0.8357234629273762, "grad_norm": 0.58984375, "learning_rate": 2.7269527234976844e-05, "loss": 0.4005948543548584, "num_input_tokens_seen": 6717364800, "step": 23620, "train_runtime": 229714.8264, "train_tokens_per_second": 29242.191 }, { "epoch": 0.836077283191105, "grad_norm": 0.5859375, "learning_rate": 2.726547246754852e-05, "loss": 0.40173816680908203, "num_input_tokens_seen": 6720234496, "step": 23630, "train_runtime": 229815.0756, "train_tokens_per_second": 29241.922 }, { "epoch": 0.8364311034548337, "grad_norm": 0.59765625, "learning_rate": 2.726141950831998e-05, "loss": 0.3997680425643921, "num_input_tokens_seen": 6723101184, "step": 23640, "train_runtime": 229909.6251, "train_tokens_per_second": 29242.365 }, { "epoch": 0.8367849237185625, "grad_norm": 0.60546875, "learning_rate": 2.7257368355947686e-05, "loss": 0.40159969329833983, "num_input_tokens_seen": 6725948544, "step": 23650, "train_runtime": 230007.4266, "train_tokens_per_second": 29242.31 }, { "epoch": 0.8371387439822913, "grad_norm": 0.5859375, "learning_rate": 2.7253319009089528e-05, "loss": 0.4024930953979492, "num_input_tokens_seen": 6728794496, "step": 23660, "train_runtime": 230102.5708, "train_tokens_per_second": 29242.587 }, { "epoch": 0.83749256424602, "grad_norm": 0.56640625, "learning_rate": 2.7249271466404758e-05, "loss": 0.39936907291412355, "num_input_tokens_seen": 6731619392, "step": 23670, "train_runtime": 230199.6247, "train_tokens_per_second": 29242.53 }, { "epoch": 0.8378463845097489, "grad_norm": 0.59375, "learning_rate": 2.724522572655403e-05, "loss": 0.4012170314788818, "num_input_tokens_seen": 6734455360, "step": 23680, "train_runtime": 230298.2275, "train_tokens_per_second": 29242.324 }, { "epoch": 0.8382002047734777, "grad_norm": 0.6015625, "learning_rate": 2.7241181788199405e-05, "loss": 0.3996647596359253, "num_input_tokens_seen": 6737257792, "step": 23690, "train_runtime": 230391.5221, "train_tokens_per_second": 29242.646 }, { "epoch": 0.8385540250372064, "grad_norm": 0.60546875, "learning_rate": 2.7237139650004316e-05, "loss": 0.4030764579772949, "num_input_tokens_seen": 6740072256, "step": 23700, "train_runtime": 230486.0785, "train_tokens_per_second": 29242.861 }, { "epoch": 0.8389078453009352, "grad_norm": 0.58203125, "learning_rate": 2.7233099310633598e-05, "loss": 0.40282392501831055, "num_input_tokens_seen": 6742937472, "step": 23710, "train_runtime": 230584.2223, "train_tokens_per_second": 29242.84 }, { "epoch": 0.839261665564664, "grad_norm": 0.59765625, "learning_rate": 2.722906076875345e-05, "loss": 0.40260043144226076, "num_input_tokens_seen": 6745802560, "step": 23720, "train_runtime": 230680.812, "train_tokens_per_second": 29243.015 }, { "epoch": 0.8396154858283927, "grad_norm": 0.62109375, "learning_rate": 2.7225024023031487e-05, "loss": 0.40151286125183105, "num_input_tokens_seen": 6748624448, "step": 23730, "train_runtime": 230776.9835, "train_tokens_per_second": 29243.057 }, { "epoch": 0.8399693060921215, "grad_norm": 0.58984375, "learning_rate": 2.7220989072136676e-05, "loss": 0.40032100677490234, "num_input_tokens_seen": 6751487104, "step": 23740, "train_runtime": 230874.4852, "train_tokens_per_second": 29243.106 }, { "epoch": 0.8403231263558503, "grad_norm": 0.6171875, "learning_rate": 2.7216955914739385e-05, "loss": 0.40537681579589846, "num_input_tokens_seen": 6754324864, "step": 23750, "train_runtime": 230971.7696, "train_tokens_per_second": 29243.075 }, { "epoch": 0.840676946619579, "grad_norm": 0.58984375, "learning_rate": 2.7212924549511348e-05, "loss": 0.3997394323348999, "num_input_tokens_seen": 6757160064, "step": 23760, "train_runtime": 231069.1339, "train_tokens_per_second": 29243.023 }, { "epoch": 0.8410307668833079, "grad_norm": 0.58203125, "learning_rate": 2.7208894975125688e-05, "loss": 0.4048455238342285, "num_input_tokens_seen": 6759985152, "step": 23770, "train_runtime": 231164.95, "train_tokens_per_second": 29243.123 }, { "epoch": 0.8413845871470367, "grad_norm": 0.5859375, "learning_rate": 2.720486719025689e-05, "loss": 0.3983281135559082, "num_input_tokens_seen": 6762899520, "step": 23780, "train_runtime": 231267.742, "train_tokens_per_second": 29242.727 }, { "epoch": 0.8417384074107654, "grad_norm": 0.61328125, "learning_rate": 2.7200841193580816e-05, "loss": 0.4020063400268555, "num_input_tokens_seen": 6765737088, "step": 23790, "train_runtime": 231363.193, "train_tokens_per_second": 29242.928 }, { "epoch": 0.8420922276744942, "grad_norm": 0.578125, "learning_rate": 2.7196816983774708e-05, "loss": 0.402175760269165, "num_input_tokens_seen": 6768535104, "step": 23800, "train_runtime": 231458.8809, "train_tokens_per_second": 29242.927 }, { "epoch": 0.842446047938223, "grad_norm": 0.60546875, "learning_rate": 2.7192794559517166e-05, "loss": 0.39998593330383303, "num_input_tokens_seen": 6771360384, "step": 23810, "train_runtime": 231554.3962, "train_tokens_per_second": 29243.066 }, { "epoch": 0.8427998682019517, "grad_norm": 0.578125, "learning_rate": 2.7188773919488165e-05, "loss": 0.4000765323638916, "num_input_tokens_seen": 6774220352, "step": 23820, "train_runtime": 231654.2219, "train_tokens_per_second": 29242.81 }, { "epoch": 0.8431536884656805, "grad_norm": 0.59765625, "learning_rate": 2.7184755062369043e-05, "loss": 0.4026946544647217, "num_input_tokens_seen": 6777075840, "step": 23830, "train_runtime": 231753.8958, "train_tokens_per_second": 29242.554 }, { "epoch": 0.8435075087294093, "grad_norm": 0.640625, "learning_rate": 2.7180737986842498e-05, "loss": 0.3993961334228516, "num_input_tokens_seen": 6779957440, "step": 23840, "train_runtime": 231852.0896, "train_tokens_per_second": 29242.598 }, { "epoch": 0.8438613289931381, "grad_norm": 0.5859375, "learning_rate": 2.71767226915926e-05, "loss": 0.4022849082946777, "num_input_tokens_seen": 6782824192, "step": 23850, "train_runtime": 231950.8175, "train_tokens_per_second": 29242.51 }, { "epoch": 0.8442151492568669, "grad_norm": 0.5625, "learning_rate": 2.7172709175304767e-05, "loss": 0.39954342842102053, "num_input_tokens_seen": 6785715776, "step": 23860, "train_runtime": 232048.5861, "train_tokens_per_second": 29242.651 }, { "epoch": 0.8445689695205957, "grad_norm": 0.60546875, "learning_rate": 2.716869743666579e-05, "loss": 0.40131635665893556, "num_input_tokens_seen": 6788554176, "step": 23870, "train_runtime": 232142.7891, "train_tokens_per_second": 29243.011 }, { "epoch": 0.8449227897843244, "grad_norm": 0.58203125, "learning_rate": 2.7164687474363803e-05, "loss": 0.3996366262435913, "num_input_tokens_seen": 6791387200, "step": 23880, "train_runtime": 232240.5321, "train_tokens_per_second": 29242.902 }, { "epoch": 0.8452766100480532, "grad_norm": 0.61328125, "learning_rate": 2.7160679287088307e-05, "loss": 0.39946019649505615, "num_input_tokens_seen": 6794182400, "step": 23890, "train_runtime": 232335.9508, "train_tokens_per_second": 29242.923 }, { "epoch": 0.845630430311782, "grad_norm": 0.60546875, "learning_rate": 2.7156672873530147e-05, "loss": 0.40001659393310546, "num_input_tokens_seen": 6797066368, "step": 23900, "train_runtime": 232436.8081, "train_tokens_per_second": 29242.642 }, { "epoch": 0.8459842505755107, "grad_norm": 0.578125, "learning_rate": 2.715266823238152e-05, "loss": 0.40672922134399414, "num_input_tokens_seen": 6799884352, "step": 23910, "train_runtime": 232533.3231, "train_tokens_per_second": 29242.623 }, { "epoch": 0.8463380708392395, "grad_norm": 0.58984375, "learning_rate": 2.714866536233598e-05, "loss": 0.3905314922332764, "num_input_tokens_seen": 6802746560, "step": 23920, "train_runtime": 232631.7704, "train_tokens_per_second": 29242.552 }, { "epoch": 0.8466918911029684, "grad_norm": 0.5859375, "learning_rate": 2.7144664262088422e-05, "loss": 0.402878475189209, "num_input_tokens_seen": 6805556800, "step": 23930, "train_runtime": 232726.2261, "train_tokens_per_second": 29242.758 }, { "epoch": 0.8470457113666972, "grad_norm": 0.578125, "learning_rate": 2.7140664930335084e-05, "loss": 0.40422534942626953, "num_input_tokens_seen": 6808367872, "step": 23940, "train_runtime": 232821.2996, "train_tokens_per_second": 29242.891 }, { "epoch": 0.8473995316304259, "grad_norm": 0.58203125, "learning_rate": 2.713666736577356e-05, "loss": 0.40209207534790037, "num_input_tokens_seen": 6811223296, "step": 23950, "train_runtime": 232919.0216, "train_tokens_per_second": 29242.881 }, { "epoch": 0.8477533518941547, "grad_norm": 0.59765625, "learning_rate": 2.713267156710278e-05, "loss": 0.39720659255981444, "num_input_tokens_seen": 6814095104, "step": 23960, "train_runtime": 233016.6498, "train_tokens_per_second": 29242.954 }, { "epoch": 0.8481071721578834, "grad_norm": 0.578125, "learning_rate": 2.712867753302301e-05, "loss": 0.4034297466278076, "num_input_tokens_seen": 6816930432, "step": 23970, "train_runtime": 233113.8682, "train_tokens_per_second": 29242.921 }, { "epoch": 0.8484609924216122, "grad_norm": 0.58984375, "learning_rate": 2.7124685262235865e-05, "loss": 0.400280237197876, "num_input_tokens_seen": 6819820480, "step": 23980, "train_runtime": 233214.4467, "train_tokens_per_second": 29242.702 }, { "epoch": 0.848814812685341, "grad_norm": 0.6015625, "learning_rate": 2.7120694753444287e-05, "loss": 0.3994969606399536, "num_input_tokens_seen": 6822655680, "step": 23990, "train_runtime": 233312.7123, "train_tokens_per_second": 29242.537 }, { "epoch": 0.8491686329490697, "grad_norm": 0.6015625, "learning_rate": 2.7116706005352547e-05, "loss": 0.4037921905517578, "num_input_tokens_seen": 6825531264, "step": 24000, "train_runtime": 233411.416, "train_tokens_per_second": 29242.491 }, { "epoch": 0.8495224532127985, "grad_norm": 0.5859375, "learning_rate": 2.7112719016666282e-05, "loss": 0.3995975494384766, "num_input_tokens_seen": 6828340608, "step": 24010, "train_runtime": 233507.6233, "train_tokens_per_second": 29242.474 }, { "epoch": 0.8498762734765274, "grad_norm": 0.609375, "learning_rate": 2.7108733786092427e-05, "loss": 0.39865851402282715, "num_input_tokens_seen": 6831119424, "step": 24020, "train_runtime": 233602.7315, "train_tokens_per_second": 29242.464 }, { "epoch": 0.8502300937402562, "grad_norm": 0.58984375, "learning_rate": 2.7104750312339254e-05, "loss": 0.39898841381072997, "num_input_tokens_seen": 6833910272, "step": 24030, "train_runtime": 233693.4329, "train_tokens_per_second": 29243.057 }, { "epoch": 0.8505839140039849, "grad_norm": 0.60546875, "learning_rate": 2.7100768594116382e-05, "loss": 0.40321874618530273, "num_input_tokens_seen": 6836786432, "step": 24040, "train_runtime": 233790.5278, "train_tokens_per_second": 29243.214 }, { "epoch": 0.8509377342677137, "grad_norm": 0.59375, "learning_rate": 2.709678863013473e-05, "loss": 0.40262203216552733, "num_input_tokens_seen": 6839663232, "step": 24050, "train_runtime": 233888.8888, "train_tokens_per_second": 29243.216 }, { "epoch": 0.8512915545314425, "grad_norm": 0.58984375, "learning_rate": 2.7092810419106562e-05, "loss": 0.4003917217254639, "num_input_tokens_seen": 6842474688, "step": 24060, "train_runtime": 233985.006, "train_tokens_per_second": 29243.219 }, { "epoch": 0.8516453747951712, "grad_norm": 0.61328125, "learning_rate": 2.7088833959745457e-05, "loss": 0.39735984802246094, "num_input_tokens_seen": 6845340864, "step": 24070, "train_runtime": 234084.7902, "train_tokens_per_second": 29242.997 }, { "epoch": 0.8519991950589, "grad_norm": 0.5859375, "learning_rate": 2.708485925076631e-05, "loss": 0.3959228754043579, "num_input_tokens_seen": 6848187072, "step": 24080, "train_runtime": 234182.0074, "train_tokens_per_second": 29243.011 }, { "epoch": 0.8523530153226287, "grad_norm": 0.62109375, "learning_rate": 2.708088629088535e-05, "loss": 0.4006394386291504, "num_input_tokens_seen": 6851030336, "step": 24090, "train_runtime": 234277.1921, "train_tokens_per_second": 29243.266 }, { "epoch": 0.8527068355863576, "grad_norm": 0.5703125, "learning_rate": 2.7076915078820115e-05, "loss": 0.4071969985961914, "num_input_tokens_seen": 6853932416, "step": 24100, "train_runtime": 234375.7507, "train_tokens_per_second": 29243.351 }, { "epoch": 0.8530606558500864, "grad_norm": 0.578125, "learning_rate": 2.707294561328945e-05, "loss": 0.4035952568054199, "num_input_tokens_seen": 6856750656, "step": 24110, "train_runtime": 234471.5787, "train_tokens_per_second": 29243.419 }, { "epoch": 0.8534144761138152, "grad_norm": 0.609375, "learning_rate": 2.706897789301353e-05, "loss": 0.39940571784973145, "num_input_tokens_seen": 6859575616, "step": 24120, "train_runtime": 234569.1009, "train_tokens_per_second": 29243.304 }, { "epoch": 0.8537682963775439, "grad_norm": 0.578125, "learning_rate": 2.706501191671384e-05, "loss": 0.3971100807189941, "num_input_tokens_seen": 6862452608, "step": 24130, "train_runtime": 234671.6616, "train_tokens_per_second": 29242.784 }, { "epoch": 0.8541221166412727, "grad_norm": 0.6015625, "learning_rate": 2.7061047683113165e-05, "loss": 0.4009715557098389, "num_input_tokens_seen": 6865240064, "step": 24140, "train_runtime": 234765.4482, "train_tokens_per_second": 29242.975 }, { "epoch": 0.8544759369050015, "grad_norm": 0.609375, "learning_rate": 2.705708519093561e-05, "loss": 0.39855546951293946, "num_input_tokens_seen": 6868096128, "step": 24150, "train_runtime": 234860.3994, "train_tokens_per_second": 29243.313 }, { "epoch": 0.8548297571687302, "grad_norm": 0.61328125, "learning_rate": 2.705312443890658e-05, "loss": 0.4019068717956543, "num_input_tokens_seen": 6870921280, "step": 24160, "train_runtime": 234956.2379, "train_tokens_per_second": 29243.409 }, { "epoch": 0.855183577432459, "grad_norm": 0.58984375, "learning_rate": 2.70491654257528e-05, "loss": 0.4043871402740479, "num_input_tokens_seen": 6873722496, "step": 24170, "train_runtime": 235049.7705, "train_tokens_per_second": 29243.689 }, { "epoch": 0.8555373976961879, "grad_norm": 0.57421875, "learning_rate": 2.7045208150202274e-05, "loss": 0.4042680740356445, "num_input_tokens_seen": 6876630144, "step": 24180, "train_runtime": 235149.5498, "train_tokens_per_second": 29243.646 }, { "epoch": 0.8558912179599166, "grad_norm": 0.578125, "learning_rate": 2.704125261098433e-05, "loss": 0.39805164337158205, "num_input_tokens_seen": 6879503168, "step": 24190, "train_runtime": 235247.475, "train_tokens_per_second": 29243.685 }, { "epoch": 0.8562450382236454, "grad_norm": 0.6171875, "learning_rate": 2.7037298806829586e-05, "loss": 0.39963650703430176, "num_input_tokens_seen": 6882324928, "step": 24200, "train_runtime": 235344.347, "train_tokens_per_second": 29243.638 }, { "epoch": 0.8565988584873742, "grad_norm": 0.58984375, "learning_rate": 2.7033346736469967e-05, "loss": 0.4035895347595215, "num_input_tokens_seen": 6885142784, "step": 24210, "train_runtime": 235440.7271, "train_tokens_per_second": 29243.635 }, { "epoch": 0.8569526787511029, "grad_norm": 0.5859375, "learning_rate": 2.702939639863869e-05, "loss": 0.3984901189804077, "num_input_tokens_seen": 6888005184, "step": 24220, "train_runtime": 235538.8077, "train_tokens_per_second": 29243.611 }, { "epoch": 0.8573064990148317, "grad_norm": 0.59375, "learning_rate": 2.7025447792070262e-05, "loss": 0.40219988822937014, "num_input_tokens_seen": 6890802816, "step": 24230, "train_runtime": 235633.1091, "train_tokens_per_second": 29243.78 }, { "epoch": 0.8576603192785605, "grad_norm": 0.61328125, "learning_rate": 2.7021500915500493e-05, "loss": 0.40181446075439453, "num_input_tokens_seen": 6893650624, "step": 24240, "train_runtime": 235728.7996, "train_tokens_per_second": 29243.99 }, { "epoch": 0.8580141395422892, "grad_norm": 0.59765625, "learning_rate": 2.701755576766648e-05, "loss": 0.39760627746582033, "num_input_tokens_seen": 6896463104, "step": 24250, "train_runtime": 235822.8686, "train_tokens_per_second": 29244.251 }, { "epoch": 0.858367959806018, "grad_norm": 0.5703125, "learning_rate": 2.701361234730661e-05, "loss": 0.398471736907959, "num_input_tokens_seen": 6899282112, "step": 24260, "train_runtime": 235919.7098, "train_tokens_per_second": 29244.195 }, { "epoch": 0.8587217800697469, "grad_norm": 0.57421875, "learning_rate": 2.700967065316056e-05, "loss": 0.4050884246826172, "num_input_tokens_seen": 6902066688, "step": 24270, "train_runtime": 236012.4411, "train_tokens_per_second": 29244.504 }, { "epoch": 0.8590756003334756, "grad_norm": 0.6015625, "learning_rate": 2.70057306839693e-05, "loss": 0.39977211952209474, "num_input_tokens_seen": 6904942080, "step": 24280, "train_runtime": 236109.1139, "train_tokens_per_second": 29244.708 }, { "epoch": 0.8594294205972044, "grad_norm": 0.58984375, "learning_rate": 2.7001792438475076e-05, "loss": 0.4012551784515381, "num_input_tokens_seen": 6907759808, "step": 24290, "train_runtime": 236206.8632, "train_tokens_per_second": 29244.535 }, { "epoch": 0.8597832408609332, "grad_norm": 0.58203125, "learning_rate": 2.6997855915421416e-05, "loss": 0.401644229888916, "num_input_tokens_seen": 6910643456, "step": 24300, "train_runtime": 236306.3071, "train_tokens_per_second": 29244.431 }, { "epoch": 0.8601370611246619, "grad_norm": 0.609375, "learning_rate": 2.6993921113553145e-05, "loss": 0.4017834186553955, "num_input_tokens_seen": 6913510976, "step": 24310, "train_runtime": 236406.522, "train_tokens_per_second": 29244.163 }, { "epoch": 0.8604908813883907, "grad_norm": 0.59375, "learning_rate": 2.6989988031616343e-05, "loss": 0.4023585796356201, "num_input_tokens_seen": 6916365952, "step": 24320, "train_runtime": 236505.0915, "train_tokens_per_second": 29244.047 }, { "epoch": 0.8608447016521195, "grad_norm": 0.59765625, "learning_rate": 2.6986056668358396e-05, "loss": 0.3998257160186768, "num_input_tokens_seen": 6919160512, "step": 24330, "train_runtime": 236598.5858, "train_tokens_per_second": 29244.302 }, { "epoch": 0.8611985219158482, "grad_norm": 0.5859375, "learning_rate": 2.6982127022527947e-05, "loss": 0.3963127613067627, "num_input_tokens_seen": 6921967232, "step": 24340, "train_runtime": 236691.6587, "train_tokens_per_second": 29244.661 }, { "epoch": 0.8615523421795771, "grad_norm": 0.578125, "learning_rate": 2.697819909287493e-05, "loss": 0.40001840591430665, "num_input_tokens_seen": 6924779200, "step": 24350, "train_runtime": 236786.8895, "train_tokens_per_second": 29244.775 }, { "epoch": 0.8619061624433059, "grad_norm": 0.640625, "learning_rate": 2.697427287815053e-05, "loss": 0.4025301933288574, "num_input_tokens_seen": 6927630272, "step": 24360, "train_runtime": 236884.3528, "train_tokens_per_second": 29244.778 }, { "epoch": 0.8622599827070346, "grad_norm": 0.58203125, "learning_rate": 2.6970348377107236e-05, "loss": 0.3963738441467285, "num_input_tokens_seen": 6930432384, "step": 24370, "train_runtime": 236979.1943, "train_tokens_per_second": 29244.898 }, { "epoch": 0.8626138029707634, "grad_norm": 0.5546875, "learning_rate": 2.696642558849877e-05, "loss": 0.3980403900146484, "num_input_tokens_seen": 6933254400, "step": 24380, "train_runtime": 237076.1712, "train_tokens_per_second": 29244.839 }, { "epoch": 0.8629676232344922, "grad_norm": 0.625, "learning_rate": 2.696250451108016e-05, "loss": 0.3990329265594482, "num_input_tokens_seen": 6936082688, "step": 24390, "train_runtime": 237171.9176, "train_tokens_per_second": 29244.958 }, { "epoch": 0.8633214434982209, "grad_norm": 0.6171875, "learning_rate": 2.6958585143607662e-05, "loss": 0.4002392292022705, "num_input_tokens_seen": 6938952640, "step": 24400, "train_runtime": 237271.7665, "train_tokens_per_second": 29244.746 }, { "epoch": 0.8636752637619497, "grad_norm": 0.6015625, "learning_rate": 2.695466748483883e-05, "loss": 0.39701406955718993, "num_input_tokens_seen": 6941816064, "step": 24410, "train_runtime": 237370.5961, "train_tokens_per_second": 29244.633 }, { "epoch": 0.8640290840256785, "grad_norm": 0.59765625, "learning_rate": 2.695075153353247e-05, "loss": 0.3982418060302734, "num_input_tokens_seen": 6944680640, "step": 24420, "train_runtime": 237469.2819, "train_tokens_per_second": 29244.543 }, { "epoch": 0.8643829042894073, "grad_norm": 0.55859375, "learning_rate": 2.6946837288448646e-05, "loss": 0.40138587951660154, "num_input_tokens_seen": 6947518400, "step": 24430, "train_runtime": 237566.6297, "train_tokens_per_second": 29244.505 }, { "epoch": 0.8647367245531361, "grad_norm": 0.5625, "learning_rate": 2.6942924748348684e-05, "loss": 0.40033588409423826, "num_input_tokens_seen": 6950360640, "step": 24440, "train_runtime": 237665.1867, "train_tokens_per_second": 29244.336 }, { "epoch": 0.8650905448168649, "grad_norm": 0.609375, "learning_rate": 2.693901391199517e-05, "loss": 0.40167908668518065, "num_input_tokens_seen": 6953204544, "step": 24450, "train_runtime": 237764.675, "train_tokens_per_second": 29244.061 }, { "epoch": 0.8654443650805936, "grad_norm": 0.625, "learning_rate": 2.6935104778151943e-05, "loss": 0.40256080627441404, "num_input_tokens_seen": 6956102976, "step": 24460, "train_runtime": 237863.9386, "train_tokens_per_second": 29244.042 }, { "epoch": 0.8657981853443224, "grad_norm": 0.61328125, "learning_rate": 2.6931197345584102e-05, "loss": 0.397590184211731, "num_input_tokens_seen": 6958895232, "step": 24470, "train_runtime": 237958.5446, "train_tokens_per_second": 29244.149 }, { "epoch": 0.8661520056080512, "grad_norm": 0.59765625, "learning_rate": 2.6927291613058003e-05, "loss": 0.3997004270553589, "num_input_tokens_seen": 6961713088, "step": 24480, "train_runtime": 238053.9018, "train_tokens_per_second": 29244.272 }, { "epoch": 0.8665058258717799, "grad_norm": 0.58203125, "learning_rate": 2.6923387579341254e-05, "loss": 0.39673662185668945, "num_input_tokens_seen": 6964551872, "step": 24490, "train_runtime": 238147.4014, "train_tokens_per_second": 29244.711 }, { "epoch": 0.8668596461355087, "grad_norm": 0.58203125, "learning_rate": 2.6919485243202693e-05, "loss": 0.39530434608459475, "num_input_tokens_seen": 6967388480, "step": 24500, "train_runtime": 238244.6588, "train_tokens_per_second": 29244.679 }, { "epoch": 0.8672134663992375, "grad_norm": 0.578125, "learning_rate": 2.6915584603412434e-05, "loss": 0.39744112491607664, "num_input_tokens_seen": 6970218048, "step": 24510, "train_runtime": 238340.1691, "train_tokens_per_second": 29244.831 }, { "epoch": 0.8675672866629663, "grad_norm": 0.6015625, "learning_rate": 2.6911685658741827e-05, "loss": 0.40381155014038084, "num_input_tokens_seen": 6973067072, "step": 24520, "train_runtime": 238438.8011, "train_tokens_per_second": 29244.683 }, { "epoch": 0.8679211069266951, "grad_norm": 0.5859375, "learning_rate": 2.690778840796346e-05, "loss": 0.3999814987182617, "num_input_tokens_seen": 6975971712, "step": 24530, "train_runtime": 238537.6247, "train_tokens_per_second": 29244.744 }, { "epoch": 0.8682749271904239, "grad_norm": 0.578125, "learning_rate": 2.6903892849851175e-05, "loss": 0.40328664779663087, "num_input_tokens_seen": 6978857408, "step": 24540, "train_runtime": 238636.612, "train_tokens_per_second": 29244.705 }, { "epoch": 0.8686287474541526, "grad_norm": 0.578125, "learning_rate": 2.6899998983180057e-05, "loss": 0.40062580108642576, "num_input_tokens_seen": 6981693952, "step": 24550, "train_runtime": 238733.2755, "train_tokens_per_second": 29244.746 }, { "epoch": 0.8689825677178814, "grad_norm": 0.58203125, "learning_rate": 2.689610680672642e-05, "loss": 0.39992246627807615, "num_input_tokens_seen": 6984531072, "step": 24560, "train_runtime": 238829.546, "train_tokens_per_second": 29244.837 }, { "epoch": 0.8693363879816102, "grad_norm": 0.61328125, "learning_rate": 2.6892216319267843e-05, "loss": 0.39810681343078613, "num_input_tokens_seen": 6987390016, "step": 24570, "train_runtime": 238927.9982, "train_tokens_per_second": 29244.752 }, { "epoch": 0.8696902082453389, "grad_norm": 0.6015625, "learning_rate": 2.6888327519583107e-05, "loss": 0.4005607604980469, "num_input_tokens_seen": 6990256832, "step": 24580, "train_runtime": 239027.352, "train_tokens_per_second": 29244.59 }, { "epoch": 0.8700440285090677, "grad_norm": 0.5859375, "learning_rate": 2.688444040645225e-05, "loss": 0.3984896421432495, "num_input_tokens_seen": 6993125056, "step": 24590, "train_runtime": 239127.0516, "train_tokens_per_second": 29244.391 }, { "epoch": 0.8703978487727966, "grad_norm": 0.58203125, "learning_rate": 2.688055497865654e-05, "loss": 0.39867496490478516, "num_input_tokens_seen": 6995943936, "step": 24600, "train_runtime": 239222.0633, "train_tokens_per_second": 29244.56 }, { "epoch": 0.8707516690365253, "grad_norm": 0.57421875, "learning_rate": 2.6876671234978483e-05, "loss": 0.4010897636413574, "num_input_tokens_seen": 6998836736, "step": 24610, "train_runtime": 239324.5679, "train_tokens_per_second": 29244.121 }, { "epoch": 0.8711054893002541, "grad_norm": 0.57421875, "learning_rate": 2.6872789174201807e-05, "loss": 0.39871530532836913, "num_input_tokens_seen": 7001703360, "step": 24620, "train_runtime": 239424.464, "train_tokens_per_second": 29243.893 }, { "epoch": 0.8714593095639829, "grad_norm": 0.609375, "learning_rate": 2.686890879511147e-05, "loss": 0.4025277137756348, "num_input_tokens_seen": 7004562624, "step": 24630, "train_runtime": 239525.0201, "train_tokens_per_second": 29243.553 }, { "epoch": 0.8718131298277116, "grad_norm": 0.62890625, "learning_rate": 2.6865030096493665e-05, "loss": 0.4040116310119629, "num_input_tokens_seen": 7007431616, "step": 24640, "train_runtime": 239624.2932, "train_tokens_per_second": 29243.411 }, { "epoch": 0.8721669500914404, "grad_norm": 0.59375, "learning_rate": 2.6861153077135815e-05, "loss": 0.3997276544570923, "num_input_tokens_seen": 7010275584, "step": 24650, "train_runtime": 239721.3124, "train_tokens_per_second": 29243.439 }, { "epoch": 0.8725207703551692, "grad_norm": 0.57421875, "learning_rate": 2.6857277735826545e-05, "loss": 0.4015812873840332, "num_input_tokens_seen": 7013106304, "step": 24660, "train_runtime": 239817.2248, "train_tokens_per_second": 29243.547 }, { "epoch": 0.8728745906188979, "grad_norm": 0.578125, "learning_rate": 2.685340407135573e-05, "loss": 0.3989898681640625, "num_input_tokens_seen": 7016033600, "step": 24670, "train_runtime": 239919.9575, "train_tokens_per_second": 29243.226 }, { "epoch": 0.8732284108826268, "grad_norm": 0.59375, "learning_rate": 2.6849532082514445e-05, "loss": 0.39873347282409666, "num_input_tokens_seen": 7018875776, "step": 24680, "train_runtime": 240017.5015, "train_tokens_per_second": 29243.183 }, { "epoch": 0.8735822311463556, "grad_norm": 0.59765625, "learning_rate": 2.6845661768095005e-05, "loss": 0.3964445352554321, "num_input_tokens_seen": 7021816512, "step": 24690, "train_runtime": 240120.5197, "train_tokens_per_second": 29242.884 }, { "epoch": 0.8739360514100843, "grad_norm": 0.61328125, "learning_rate": 2.6841793126890925e-05, "loss": 0.4021657943725586, "num_input_tokens_seen": 7024625344, "step": 24700, "train_runtime": 240213.2829, "train_tokens_per_second": 29243.284 }, { "epoch": 0.8742898716738131, "grad_norm": 0.5859375, "learning_rate": 2.6837926157696946e-05, "loss": 0.4011106014251709, "num_input_tokens_seen": 7027444544, "step": 24710, "train_runtime": 240312.21, "train_tokens_per_second": 29242.977 }, { "epoch": 0.8746436919375419, "grad_norm": 0.609375, "learning_rate": 2.6834060859309018e-05, "loss": 0.40004878044128417, "num_input_tokens_seen": 7030291968, "step": 24720, "train_runtime": 240408.3043, "train_tokens_per_second": 29243.133 }, { "epoch": 0.8749975122012706, "grad_norm": 0.609375, "learning_rate": 2.6830197230524317e-05, "loss": 0.3969268321990967, "num_input_tokens_seen": 7033122624, "step": 24730, "train_runtime": 240501.6399, "train_tokens_per_second": 29243.554 }, { "epoch": 0.8753513324649994, "grad_norm": 0.5859375, "learning_rate": 2.6826335270141216e-05, "loss": 0.39848220348358154, "num_input_tokens_seen": 7036029120, "step": 24740, "train_runtime": 240604.1567, "train_tokens_per_second": 29243.174 }, { "epoch": 0.8757051527287282, "grad_norm": 0.59375, "learning_rate": 2.6822474976959312e-05, "loss": 0.39956305027008054, "num_input_tokens_seen": 7038888256, "step": 24750, "train_runtime": 240703.4345, "train_tokens_per_second": 29242.991 }, { "epoch": 0.8760589729924569, "grad_norm": 0.58984375, "learning_rate": 2.6818616349779397e-05, "loss": 0.40245985984802246, "num_input_tokens_seen": 7041737792, "step": 24760, "train_runtime": 240800.5963, "train_tokens_per_second": 29243.025 }, { "epoch": 0.8764127932561858, "grad_norm": 0.5859375, "learning_rate": 2.6814759387403482e-05, "loss": 0.4003581523895264, "num_input_tokens_seen": 7044557952, "step": 24770, "train_runtime": 240899.2249, "train_tokens_per_second": 29242.759 }, { "epoch": 0.8767666135199146, "grad_norm": 0.6015625, "learning_rate": 2.681090408863477e-05, "loss": 0.4022761344909668, "num_input_tokens_seen": 7047406528, "step": 24780, "train_runtime": 240999.2404, "train_tokens_per_second": 29242.443 }, { "epoch": 0.8771204337836433, "grad_norm": 0.58203125, "learning_rate": 2.6807050452277694e-05, "loss": 0.39827733039855956, "num_input_tokens_seen": 7050232384, "step": 24790, "train_runtime": 241093.8931, "train_tokens_per_second": 29242.683 }, { "epoch": 0.8774742540473721, "grad_norm": 0.62890625, "learning_rate": 2.6803198477137853e-05, "loss": 0.4002978324890137, "num_input_tokens_seen": 7053055232, "step": 24800, "train_runtime": 241188.5029, "train_tokens_per_second": 29242.916 }, { "epoch": 0.8778280743111009, "grad_norm": 0.61328125, "learning_rate": 2.6799348162022082e-05, "loss": 0.39804773330688475, "num_input_tokens_seen": 7055884096, "step": 24810, "train_runtime": 241284.7615, "train_tokens_per_second": 29242.974 }, { "epoch": 0.8781818945748296, "grad_norm": 0.59765625, "learning_rate": 2.6795499505738397e-05, "loss": 0.404567289352417, "num_input_tokens_seen": 7058721152, "step": 24820, "train_runtime": 241381.3902, "train_tokens_per_second": 29243.021 }, { "epoch": 0.8785357148385584, "grad_norm": 0.59765625, "learning_rate": 2.679165250709601e-05, "loss": 0.4042099952697754, "num_input_tokens_seen": 7061523712, "step": 24830, "train_runtime": 241477.7887, "train_tokens_per_second": 29242.953 }, { "epoch": 0.8788895351022872, "grad_norm": 0.57421875, "learning_rate": 2.678780716490533e-05, "loss": 0.3966546058654785, "num_input_tokens_seen": 7064400064, "step": 24840, "train_runtime": 241578.7272, "train_tokens_per_second": 29242.641 }, { "epoch": 0.879243355366016, "grad_norm": 0.58984375, "learning_rate": 2.678396347797798e-05, "loss": 0.3962850570678711, "num_input_tokens_seen": 7067241536, "step": 24850, "train_runtime": 241673.9546, "train_tokens_per_second": 29242.876 }, { "epoch": 0.8795971756297448, "grad_norm": 0.5625, "learning_rate": 2.6780121445126756e-05, "loss": 0.3981971263885498, "num_input_tokens_seen": 7070086080, "step": 24860, "train_runtime": 241771.045, "train_tokens_per_second": 29242.898 }, { "epoch": 0.8799509958934736, "grad_norm": 0.5703125, "learning_rate": 2.6776281065165644e-05, "loss": 0.3988051414489746, "num_input_tokens_seen": 7072959040, "step": 24870, "train_runtime": 241869.7212, "train_tokens_per_second": 29242.846 }, { "epoch": 0.8803048161572024, "grad_norm": 0.5859375, "learning_rate": 2.677244233690983e-05, "loss": 0.3995032787322998, "num_input_tokens_seen": 7075815808, "step": 24880, "train_runtime": 241968.6112, "train_tokens_per_second": 29242.701 }, { "epoch": 0.8806586364209311, "grad_norm": 0.58984375, "learning_rate": 2.6768605259175694e-05, "loss": 0.4009195327758789, "num_input_tokens_seen": 7078660800, "step": 24890, "train_runtime": 242068.0372, "train_tokens_per_second": 29242.443 }, { "epoch": 0.8810124566846599, "grad_norm": 0.59765625, "learning_rate": 2.6764769830780784e-05, "loss": 0.4026834964752197, "num_input_tokens_seen": 7081475520, "step": 24900, "train_runtime": 242161.042, "train_tokens_per_second": 29242.836 }, { "epoch": 0.8813662769483886, "grad_norm": 0.5859375, "learning_rate": 2.6760936050543857e-05, "loss": 0.399591326713562, "num_input_tokens_seen": 7084299776, "step": 24910, "train_runtime": 242256.131, "train_tokens_per_second": 29243.015 }, { "epoch": 0.8817200972121174, "grad_norm": 0.60546875, "learning_rate": 2.675710391728483e-05, "loss": 0.4019454002380371, "num_input_tokens_seen": 7087195264, "step": 24920, "train_runtime": 242356.2848, "train_tokens_per_second": 29242.878 }, { "epoch": 0.8820739174758463, "grad_norm": 0.5625, "learning_rate": 2.6753273429824822e-05, "loss": 0.40071897506713866, "num_input_tokens_seen": 7090094592, "step": 24930, "train_runtime": 242454.7721, "train_tokens_per_second": 29242.957 }, { "epoch": 0.8824277377395751, "grad_norm": 0.59765625, "learning_rate": 2.6749444586986127e-05, "loss": 0.39962120056152345, "num_input_tokens_seen": 7092936384, "step": 24940, "train_runtime": 242551.4582, "train_tokens_per_second": 29243.017 }, { "epoch": 0.8827815580033038, "grad_norm": 0.58203125, "learning_rate": 2.6745617387592214e-05, "loss": 0.39986209869384765, "num_input_tokens_seen": 7095776448, "step": 24950, "train_runtime": 242646.492, "train_tokens_per_second": 29243.268 }, { "epoch": 0.8831353782670326, "grad_norm": 0.578125, "learning_rate": 2.6741791830467728e-05, "loss": 0.39818081855773924, "num_input_tokens_seen": 7098612160, "step": 24960, "train_runtime": 242742.7557, "train_tokens_per_second": 29243.353 }, { "epoch": 0.8834891985307614, "grad_norm": 0.58203125, "learning_rate": 2.67379679144385e-05, "loss": 0.3946235179901123, "num_input_tokens_seen": 7101494464, "step": 24970, "train_runtime": 242841.5357, "train_tokens_per_second": 29243.327 }, { "epoch": 0.8838430187944901, "grad_norm": 0.609375, "learning_rate": 2.6734145638331536e-05, "loss": 0.3985111951828003, "num_input_tokens_seen": 7104353216, "step": 24980, "train_runtime": 242940.834, "train_tokens_per_second": 29243.142 }, { "epoch": 0.8841968390582189, "grad_norm": 0.5859375, "learning_rate": 2.673032500097501e-05, "loss": 0.40055456161499026, "num_input_tokens_seen": 7107186624, "step": 24990, "train_runtime": 243036.3765, "train_tokens_per_second": 29243.304 }, { "epoch": 0.8845506593219477, "grad_norm": 0.58203125, "learning_rate": 2.672650600119826e-05, "loss": 0.39823911190032957, "num_input_tokens_seen": 7110093696, "step": 25000, "train_runtime": 243137.6937, "train_tokens_per_second": 29243.075 }, { "epoch": 0.8845506593219477, "eval_loss": 0.3392401933670044, "eval_runtime": 8.4326, "eval_samples_per_second": 472.929, "eval_steps_per_second": 3.795, "num_input_tokens_seen": 7110093696, "step": 25000 }, { "epoch": 0.8849044795856764, "grad_norm": 0.6015625, "learning_rate": 2.672268863783181e-05, "loss": 0.4022231578826904, "num_input_tokens_seen": 7112954752, "step": 25010, "train_runtime": 243266.2006, "train_tokens_per_second": 29239.388 }, { "epoch": 0.8852582998494053, "grad_norm": 0.5703125, "learning_rate": 2.6718872909707347e-05, "loss": 0.40130186080932617, "num_input_tokens_seen": 7115726848, "step": 25020, "train_runtime": 243357.0304, "train_tokens_per_second": 29239.866 }, { "epoch": 0.8856121201131341, "grad_norm": 0.58984375, "learning_rate": 2.671505881565772e-05, "loss": 0.3980755567550659, "num_input_tokens_seen": 7118565376, "step": 25030, "train_runtime": 243455.1707, "train_tokens_per_second": 29239.738 }, { "epoch": 0.8859659403768628, "grad_norm": 0.58203125, "learning_rate": 2.671124635451696e-05, "loss": 0.3961543798446655, "num_input_tokens_seen": 7121407552, "step": 25040, "train_runtime": 243551.3333, "train_tokens_per_second": 29239.863 }, { "epoch": 0.8863197606405916, "grad_norm": 0.6328125, "learning_rate": 2.6707435525120237e-05, "loss": 0.3972560167312622, "num_input_tokens_seen": 7124235968, "step": 25050, "train_runtime": 243648.9175, "train_tokens_per_second": 29239.76 }, { "epoch": 0.8866735809043204, "grad_norm": 0.59765625, "learning_rate": 2.6703626326303906e-05, "loss": 0.39791016578674315, "num_input_tokens_seen": 7127074624, "step": 25060, "train_runtime": 243747.0575, "train_tokens_per_second": 29239.633 }, { "epoch": 0.8870274011680491, "grad_norm": 0.6171875, "learning_rate": 2.669981875690547e-05, "loss": 0.40055389404296876, "num_input_tokens_seen": 7129976704, "step": 25070, "train_runtime": 243846.1321, "train_tokens_per_second": 29239.655 }, { "epoch": 0.8873812214317779, "grad_norm": 0.56640625, "learning_rate": 2.6696012815763604e-05, "loss": 0.4002669811248779, "num_input_tokens_seen": 7132845120, "step": 25080, "train_runtime": 243947.6133, "train_tokens_per_second": 29239.249 }, { "epoch": 0.8877350416955067, "grad_norm": 0.5703125, "learning_rate": 2.669220850171813e-05, "loss": 0.40085816383361816, "num_input_tokens_seen": 7135742464, "step": 25090, "train_runtime": 244046.1847, "train_tokens_per_second": 29239.312 }, { "epoch": 0.8880888619592355, "grad_norm": 0.5859375, "learning_rate": 2.668840581361003e-05, "loss": 0.40192832946777346, "num_input_tokens_seen": 7138578432, "step": 25100, "train_runtime": 244141.7837, "train_tokens_per_second": 29239.478 }, { "epoch": 0.8884426822229643, "grad_norm": 0.59765625, "learning_rate": 2.668460475028145e-05, "loss": 0.40016489028930663, "num_input_tokens_seen": 7141411008, "step": 25110, "train_runtime": 244238.6767, "train_tokens_per_second": 29239.476 }, { "epoch": 0.8887965024866931, "grad_norm": 0.62890625, "learning_rate": 2.6680805310575686e-05, "loss": 0.40253238677978515, "num_input_tokens_seen": 7144279872, "step": 25120, "train_runtime": 244338.9, "train_tokens_per_second": 29239.224 }, { "epoch": 0.8891503227504218, "grad_norm": 0.59375, "learning_rate": 2.6677007493337164e-05, "loss": 0.4012650489807129, "num_input_tokens_seen": 7147075776, "step": 25130, "train_runtime": 244432.7077, "train_tokens_per_second": 29239.441 }, { "epoch": 0.8895041430141506, "grad_norm": 0.578125, "learning_rate": 2.6673211297411503e-05, "loss": 0.39514741897583006, "num_input_tokens_seen": 7149911360, "step": 25140, "train_runtime": 244529.86, "train_tokens_per_second": 29239.42 }, { "epoch": 0.8898579632778794, "grad_norm": 0.61328125, "learning_rate": 2.6669416721645447e-05, "loss": 0.40055103302001954, "num_input_tokens_seen": 7152746304, "step": 25150, "train_runtime": 244625.3545, "train_tokens_per_second": 29239.595 }, { "epoch": 0.8902117835416081, "grad_norm": 0.58203125, "learning_rate": 2.6665623764886876e-05, "loss": 0.3993120908737183, "num_input_tokens_seen": 7155609408, "step": 25160, "train_runtime": 244724.8088, "train_tokens_per_second": 29239.412 }, { "epoch": 0.8905656038053369, "grad_norm": 0.5859375, "learning_rate": 2.6661832425984847e-05, "loss": 0.39555697441101073, "num_input_tokens_seen": 7158470784, "step": 25170, "train_runtime": 244824.7674, "train_tokens_per_second": 29239.161 }, { "epoch": 0.8909194240690658, "grad_norm": 0.58203125, "learning_rate": 2.665804270378953e-05, "loss": 0.4029559135437012, "num_input_tokens_seen": 7161297344, "step": 25180, "train_runtime": 244922.7688, "train_tokens_per_second": 29239.002 }, { "epoch": 0.8912732443327945, "grad_norm": 0.57421875, "learning_rate": 2.665425459715228e-05, "loss": 0.3993260383605957, "num_input_tokens_seen": 7164144192, "step": 25190, "train_runtime": 245021.0608, "train_tokens_per_second": 29238.891 }, { "epoch": 0.8916270645965233, "grad_norm": 0.609375, "learning_rate": 2.6650468104925547e-05, "loss": 0.3969135761260986, "num_input_tokens_seen": 7167005376, "step": 25200, "train_runtime": 245118.7175, "train_tokens_per_second": 29238.915 }, { "epoch": 0.8919808848602521, "grad_norm": 0.59765625, "learning_rate": 2.664668322596295e-05, "loss": 0.39873499870300294, "num_input_tokens_seen": 7169872000, "step": 25210, "train_runtime": 245219.1725, "train_tokens_per_second": 29238.627 }, { "epoch": 0.8923347051239808, "grad_norm": 0.62109375, "learning_rate": 2.664289995911925e-05, "loss": 0.3989361047744751, "num_input_tokens_seen": 7172743232, "step": 25220, "train_runtime": 245317.432, "train_tokens_per_second": 29238.62 }, { "epoch": 0.8926885253877096, "grad_norm": 0.60546875, "learning_rate": 2.6639118303250328e-05, "loss": 0.4051660537719727, "num_input_tokens_seen": 7175549440, "step": 25230, "train_runtime": 245413.0108, "train_tokens_per_second": 29238.668 }, { "epoch": 0.8930423456514384, "grad_norm": 0.6015625, "learning_rate": 2.663533825721321e-05, "loss": 0.400730037689209, "num_input_tokens_seen": 7178427264, "step": 25240, "train_runtime": 245515.5353, "train_tokens_per_second": 29238.179 }, { "epoch": 0.8933961659151671, "grad_norm": 0.6015625, "learning_rate": 2.6631559819866065e-05, "loss": 0.39889414310455323, "num_input_tokens_seen": 7181239232, "step": 25250, "train_runtime": 245610.5753, "train_tokens_per_second": 29238.314 }, { "epoch": 0.8937499861788959, "grad_norm": 0.578125, "learning_rate": 2.662778299006819e-05, "loss": 0.4035154342651367, "num_input_tokens_seen": 7184113536, "step": 25260, "train_runtime": 245708.786, "train_tokens_per_second": 29238.326 }, { "epoch": 0.8941038064426248, "grad_norm": 0.60546875, "learning_rate": 2.6624007766680004e-05, "loss": 0.4019301891326904, "num_input_tokens_seen": 7186963200, "step": 25270, "train_runtime": 245804.6284, "train_tokens_per_second": 29238.519 }, { "epoch": 0.8944576267063535, "grad_norm": 0.58984375, "learning_rate": 2.6620234148563066e-05, "loss": 0.3962251663208008, "num_input_tokens_seen": 7189763328, "step": 25280, "train_runtime": 245899.5989, "train_tokens_per_second": 29238.613 }, { "epoch": 0.8948114469700823, "grad_norm": 0.6015625, "learning_rate": 2.6616462134580072e-05, "loss": 0.3975823402404785, "num_input_tokens_seen": 7192593280, "step": 25290, "train_runtime": 245997.0826, "train_tokens_per_second": 29238.531 }, { "epoch": 0.8951652672338111, "grad_norm": 0.59765625, "learning_rate": 2.6612691723594835e-05, "loss": 0.397947883605957, "num_input_tokens_seen": 7195397888, "step": 25300, "train_runtime": 246092.1813, "train_tokens_per_second": 29238.629 }, { "epoch": 0.8955190874975398, "grad_norm": 0.60546875, "learning_rate": 2.6608922914472283e-05, "loss": 0.3953337907791138, "num_input_tokens_seen": 7198229056, "step": 25310, "train_runtime": 246188.5198, "train_tokens_per_second": 29238.687 }, { "epoch": 0.8958729077612686, "grad_norm": 0.5859375, "learning_rate": 2.66051557060785e-05, "loss": 0.4060483455657959, "num_input_tokens_seen": 7200989056, "step": 25320, "train_runtime": 246279.8988, "train_tokens_per_second": 29239.045 }, { "epoch": 0.8962267280249974, "grad_norm": 0.6015625, "learning_rate": 2.6601390097280665e-05, "loss": 0.3961021423339844, "num_input_tokens_seen": 7203796608, "step": 25330, "train_runtime": 246376.2437, "train_tokens_per_second": 29239.007 }, { "epoch": 0.8965805482887261, "grad_norm": 0.60546875, "learning_rate": 2.6597626086947097e-05, "loss": 0.40268239974975584, "num_input_tokens_seen": 7206658048, "step": 25340, "train_runtime": 246474.6913, "train_tokens_per_second": 29238.937 }, { "epoch": 0.896934368552455, "grad_norm": 0.59765625, "learning_rate": 2.659386367394722e-05, "loss": 0.4050790786743164, "num_input_tokens_seen": 7209520704, "step": 25350, "train_runtime": 246572.0756, "train_tokens_per_second": 29238.999 }, { "epoch": 0.8972881888161838, "grad_norm": 0.5625, "learning_rate": 2.65901028571516e-05, "loss": 0.39623663425445554, "num_input_tokens_seen": 7212382976, "step": 25360, "train_runtime": 246670.3547, "train_tokens_per_second": 29238.953 }, { "epoch": 0.8976420090799125, "grad_norm": 0.59375, "learning_rate": 2.6586343635431887e-05, "loss": 0.4008064270019531, "num_input_tokens_seen": 7215223936, "step": 25370, "train_runtime": 246766.3552, "train_tokens_per_second": 29239.091 }, { "epoch": 0.8979958293436413, "grad_norm": 0.6171875, "learning_rate": 2.658258600766088e-05, "loss": 0.40004734992980956, "num_input_tokens_seen": 7218056128, "step": 25380, "train_runtime": 246861.552, "train_tokens_per_second": 29239.288 }, { "epoch": 0.8983496496073701, "grad_norm": 0.61328125, "learning_rate": 2.657882997271247e-05, "loss": 0.4022518157958984, "num_input_tokens_seen": 7220825728, "step": 25390, "train_runtime": 246952.8938, "train_tokens_per_second": 29239.689 }, { "epoch": 0.8987034698710988, "grad_norm": 0.59765625, "learning_rate": 2.6575075529461685e-05, "loss": 0.3985184669494629, "num_input_tokens_seen": 7223679360, "step": 25400, "train_runtime": 247052.6012, "train_tokens_per_second": 29239.439 }, { "epoch": 0.8990572901348276, "grad_norm": 0.578125, "learning_rate": 2.657132267678464e-05, "loss": 0.3990170001983643, "num_input_tokens_seen": 7226557696, "step": 25410, "train_runtime": 247152.0079, "train_tokens_per_second": 29239.324 }, { "epoch": 0.8994111103985564, "grad_norm": 0.6015625, "learning_rate": 2.656757141355857e-05, "loss": 0.4003419876098633, "num_input_tokens_seen": 7229419072, "step": 25420, "train_runtime": 247252.9209, "train_tokens_per_second": 29238.963 }, { "epoch": 0.8997649306622852, "grad_norm": 0.578125, "learning_rate": 2.6563821738661833e-05, "loss": 0.3981818675994873, "num_input_tokens_seen": 7232323200, "step": 25430, "train_runtime": 247351.7281, "train_tokens_per_second": 29239.024 }, { "epoch": 0.900118750926014, "grad_norm": 0.58203125, "learning_rate": 2.6560073650973873e-05, "loss": 0.3981840372085571, "num_input_tokens_seen": 7235181440, "step": 25440, "train_runtime": 247448.0445, "train_tokens_per_second": 29239.194 }, { "epoch": 0.9004725711897428, "grad_norm": 0.609375, "learning_rate": 2.655632714937525e-05, "loss": 0.40260777473449705, "num_input_tokens_seen": 7238069568, "step": 25450, "train_runtime": 247547.4707, "train_tokens_per_second": 29239.117 }, { "epoch": 0.9008263914534715, "grad_norm": 0.60546875, "learning_rate": 2.6552582232747637e-05, "loss": 0.39693174362182615, "num_input_tokens_seen": 7240984192, "step": 25460, "train_runtime": 247648.7242, "train_tokens_per_second": 29238.932 }, { "epoch": 0.9011802117172003, "grad_norm": 0.5859375, "learning_rate": 2.6548838899973794e-05, "loss": 0.3956117630004883, "num_input_tokens_seen": 7243801856, "step": 25470, "train_runtime": 247744.5052, "train_tokens_per_second": 29239.001 }, { "epoch": 0.9015340319809291, "grad_norm": 0.62109375, "learning_rate": 2.6545097149937598e-05, "loss": 0.3974839925765991, "num_input_tokens_seen": 7246685504, "step": 25480, "train_runtime": 247846.3743, "train_tokens_per_second": 29238.618 }, { "epoch": 0.9018878522446578, "grad_norm": 0.61328125, "learning_rate": 2.6541356981524018e-05, "loss": 0.39944212436676024, "num_input_tokens_seen": 7249484288, "step": 25490, "train_runtime": 247941.7978, "train_tokens_per_second": 29238.653 }, { "epoch": 0.9022416725083866, "grad_norm": 0.578125, "learning_rate": 2.653761839361913e-05, "loss": 0.39823575019836427, "num_input_tokens_seen": 7252360000, "step": 25500, "train_runtime": 248041.0483, "train_tokens_per_second": 29238.548 }, { "epoch": 0.9025954927721154, "grad_norm": 0.59375, "learning_rate": 2.6533881385110097e-05, "loss": 0.40156192779541017, "num_input_tokens_seen": 7255188736, "step": 25510, "train_runtime": 248136.859, "train_tokens_per_second": 29238.658 }, { "epoch": 0.9029493130358442, "grad_norm": 0.62109375, "learning_rate": 2.6530145954885187e-05, "loss": 0.40303540229797363, "num_input_tokens_seen": 7258065280, "step": 25520, "train_runtime": 248235.3909, "train_tokens_per_second": 29238.64 }, { "epoch": 0.903303133299573, "grad_norm": 0.57421875, "learning_rate": 2.6526412101833764e-05, "loss": 0.39902620315551757, "num_input_tokens_seen": 7260926016, "step": 25530, "train_runtime": 248332.3966, "train_tokens_per_second": 29238.739 }, { "epoch": 0.9036569535633018, "grad_norm": 0.59765625, "learning_rate": 2.6522679824846287e-05, "loss": 0.39557886123657227, "num_input_tokens_seen": 7263808640, "step": 25540, "train_runtime": 248430.5092, "train_tokens_per_second": 29238.795 }, { "epoch": 0.9040107738270305, "grad_norm": 0.56640625, "learning_rate": 2.6518949122814297e-05, "loss": 0.39488649368286133, "num_input_tokens_seen": 7266746560, "step": 25550, "train_runtime": 248531.237, "train_tokens_per_second": 29238.766 }, { "epoch": 0.9043645940907593, "grad_norm": 0.60546875, "learning_rate": 2.651521999463043e-05, "loss": 0.3974877595901489, "num_input_tokens_seen": 7269593280, "step": 25560, "train_runtime": 248630.7839, "train_tokens_per_second": 29238.508 }, { "epoch": 0.9047184143544881, "grad_norm": 0.61328125, "learning_rate": 2.651149243918842e-05, "loss": 0.40156941413879393, "num_input_tokens_seen": 7272358272, "step": 25570, "train_runtime": 248721.3389, "train_tokens_per_second": 29238.98 }, { "epoch": 0.9050722346182168, "grad_norm": 0.57421875, "learning_rate": 2.650776645538308e-05, "loss": 0.39846274852752683, "num_input_tokens_seen": 7275191680, "step": 25580, "train_runtime": 248817.4997, "train_tokens_per_second": 29239.068 }, { "epoch": 0.9054260548819456, "grad_norm": 0.59375, "learning_rate": 2.650404204211032e-05, "loss": 0.40518627166748045, "num_input_tokens_seen": 7278065728, "step": 25590, "train_runtime": 248915.292, "train_tokens_per_second": 29239.127 }, { "epoch": 0.9057798751456745, "grad_norm": 0.6015625, "learning_rate": 2.6500319198267126e-05, "loss": 0.40259642601013185, "num_input_tokens_seen": 7280872960, "step": 25600, "train_runtime": 249011.8018, "train_tokens_per_second": 29239.068 }, { "epoch": 0.9061336954094033, "grad_norm": 0.62890625, "learning_rate": 2.6496597922751572e-05, "loss": 0.4010054588317871, "num_input_tokens_seen": 7283647360, "step": 25610, "train_runtime": 249104.7891, "train_tokens_per_second": 29239.291 }, { "epoch": 0.906487515673132, "grad_norm": 0.609375, "learning_rate": 2.6492878214462818e-05, "loss": 0.4013101100921631, "num_input_tokens_seen": 7286489344, "step": 25620, "train_runtime": 249202.7918, "train_tokens_per_second": 29239.196 }, { "epoch": 0.9068413359368608, "grad_norm": 0.57421875, "learning_rate": 2.648916007230109e-05, "loss": 0.39694030284881593, "num_input_tokens_seen": 7289338816, "step": 25630, "train_runtime": 249296.3978, "train_tokens_per_second": 29239.648 }, { "epoch": 0.9071951562005895, "grad_norm": 0.609375, "learning_rate": 2.6485443495167722e-05, "loss": 0.39302549362182615, "num_input_tokens_seen": 7292164416, "step": 25640, "train_runtime": 249391.2613, "train_tokens_per_second": 29239.855 }, { "epoch": 0.9075489764643183, "grad_norm": 0.578125, "learning_rate": 2.6481728481965102e-05, "loss": 0.3992034435272217, "num_input_tokens_seen": 7295053952, "step": 25650, "train_runtime": 249493.0045, "train_tokens_per_second": 29239.513 }, { "epoch": 0.9079027967280471, "grad_norm": 0.59375, "learning_rate": 2.6478015031596705e-05, "loss": 0.39673738479614257, "num_input_tokens_seen": 7297896512, "step": 25660, "train_runtime": 249589.8775, "train_tokens_per_second": 29239.553 }, { "epoch": 0.9082566169917758, "grad_norm": 0.6171875, "learning_rate": 2.6474303142967076e-05, "loss": 0.39556074142456055, "num_input_tokens_seen": 7300728320, "step": 25670, "train_runtime": 249686.3369, "train_tokens_per_second": 29239.599 }, { "epoch": 0.9086104372555047, "grad_norm": 0.58984375, "learning_rate": 2.6470592814981852e-05, "loss": 0.40029754638671877, "num_input_tokens_seen": 7303594368, "step": 25680, "train_runtime": 249785.9909, "train_tokens_per_second": 29239.407 }, { "epoch": 0.9089642575192335, "grad_norm": 0.59765625, "learning_rate": 2.6466884046547725e-05, "loss": 0.4009224891662598, "num_input_tokens_seen": 7306414336, "step": 25690, "train_runtime": 249882.4836, "train_tokens_per_second": 29239.402 }, { "epoch": 0.9093180777829623, "grad_norm": 0.58984375, "learning_rate": 2.646317683657247e-05, "loss": 0.4027262687683105, "num_input_tokens_seen": 7309275328, "step": 25700, "train_runtime": 249981.0619, "train_tokens_per_second": 29239.316 }, { "epoch": 0.909671898046691, "grad_norm": 0.59375, "learning_rate": 2.645947118396491e-05, "loss": 0.39997520446777346, "num_input_tokens_seen": 7312084864, "step": 25710, "train_runtime": 250075.4069, "train_tokens_per_second": 29239.52 }, { "epoch": 0.9100257183104198, "grad_norm": 0.59375, "learning_rate": 2.6455767087634982e-05, "loss": 0.4024055957794189, "num_input_tokens_seen": 7314917504, "step": 25720, "train_runtime": 250173.7783, "train_tokens_per_second": 29239.345 }, { "epoch": 0.9103795385741486, "grad_norm": 0.58984375, "learning_rate": 2.6452064546493642e-05, "loss": 0.4042919635772705, "num_input_tokens_seen": 7317741568, "step": 25730, "train_runtime": 250270.8729, "train_tokens_per_second": 29239.286 }, { "epoch": 0.9107333588378773, "grad_norm": 0.5859375, "learning_rate": 2.644836355945295e-05, "loss": 0.4048019886016846, "num_input_tokens_seen": 7320575360, "step": 25740, "train_runtime": 250366.6792, "train_tokens_per_second": 29239.415 }, { "epoch": 0.9110871791016061, "grad_norm": 0.5703125, "learning_rate": 2.6444664125426012e-05, "loss": 0.4019166469573975, "num_input_tokens_seen": 7323435072, "step": 25750, "train_runtime": 250464.3066, "train_tokens_per_second": 29239.436 }, { "epoch": 0.9114409993653348, "grad_norm": 0.59375, "learning_rate": 2.6440966243326985e-05, "loss": 0.39493412971496583, "num_input_tokens_seen": 7326340928, "step": 25760, "train_runtime": 250563.9251, "train_tokens_per_second": 29239.408 }, { "epoch": 0.9117948196290637, "grad_norm": 0.58203125, "learning_rate": 2.6437269912071132e-05, "loss": 0.40195207595825194, "num_input_tokens_seen": 7329211904, "step": 25770, "train_runtime": 250664.9738, "train_tokens_per_second": 29239.075 }, { "epoch": 0.9121486398927925, "grad_norm": 0.59375, "learning_rate": 2.6433575130574732e-05, "loss": 0.3957659721374512, "num_input_tokens_seen": 7332064704, "step": 25780, "train_runtime": 250764.9594, "train_tokens_per_second": 29238.793 }, { "epoch": 0.9125024601565213, "grad_norm": 0.6015625, "learning_rate": 2.6429881897755154e-05, "loss": 0.39867801666259767, "num_input_tokens_seen": 7334932160, "step": 25790, "train_runtime": 250861.5924, "train_tokens_per_second": 29238.96 }, { "epoch": 0.91285628042025, "grad_norm": 0.5859375, "learning_rate": 2.6426190212530806e-05, "loss": 0.4010892391204834, "num_input_tokens_seen": 7337747072, "step": 25800, "train_runtime": 250956.3016, "train_tokens_per_second": 29239.143 }, { "epoch": 0.9132101006839788, "grad_norm": 0.5703125, "learning_rate": 2.6422500073821168e-05, "loss": 0.39749746322631835, "num_input_tokens_seen": 7340579904, "step": 25810, "train_runtime": 251052.6994, "train_tokens_per_second": 29239.199 }, { "epoch": 0.9135639209477076, "grad_norm": 0.61328125, "learning_rate": 2.6418811480546757e-05, "loss": 0.4014753341674805, "num_input_tokens_seen": 7343382400, "step": 25820, "train_runtime": 251149.0877, "train_tokens_per_second": 29239.136 }, { "epoch": 0.9139177412114363, "grad_norm": 0.60546875, "learning_rate": 2.641512443162917e-05, "loss": 0.4016080856323242, "num_input_tokens_seen": 7346285056, "step": 25830, "train_runtime": 251250.4477, "train_tokens_per_second": 29238.893 }, { "epoch": 0.9142715614751651, "grad_norm": 0.5859375, "learning_rate": 2.6411438925991034e-05, "loss": 0.40257940292358396, "num_input_tokens_seen": 7349125248, "step": 25840, "train_runtime": 251349.1903, "train_tokens_per_second": 29238.707 }, { "epoch": 0.914625381738894, "grad_norm": 0.59375, "learning_rate": 2.6407754962556046e-05, "loss": 0.4022639274597168, "num_input_tokens_seen": 7351978560, "step": 25850, "train_runtime": 251444.1783, "train_tokens_per_second": 29239.009 }, { "epoch": 0.9149792020026227, "grad_norm": 0.59375, "learning_rate": 2.640407254024894e-05, "loss": 0.39742555618286135, "num_input_tokens_seen": 7354887424, "step": 25860, "train_runtime": 251544.593, "train_tokens_per_second": 29238.901 }, { "epoch": 0.9153330222663515, "grad_norm": 0.6171875, "learning_rate": 2.640039165799551e-05, "loss": 0.39743528366088865, "num_input_tokens_seen": 7357754112, "step": 25870, "train_runtime": 251642.4702, "train_tokens_per_second": 29238.92 }, { "epoch": 0.9156868425300803, "grad_norm": 0.609375, "learning_rate": 2.6396712314722586e-05, "loss": 0.4021452903747559, "num_input_tokens_seen": 7360567936, "step": 25880, "train_runtime": 251739.4888, "train_tokens_per_second": 29238.829 }, { "epoch": 0.916040662793809, "grad_norm": 0.55859375, "learning_rate": 2.6393034509358054e-05, "loss": 0.39592957496643066, "num_input_tokens_seen": 7363417344, "step": 25890, "train_runtime": 251838.2718, "train_tokens_per_second": 29238.675 }, { "epoch": 0.9163944830575378, "grad_norm": 0.6015625, "learning_rate": 2.6389358240830854e-05, "loss": 0.39899747371673583, "num_input_tokens_seen": 7366247552, "step": 25900, "train_runtime": 251932.9911, "train_tokens_per_second": 29238.916 }, { "epoch": 0.9167483033212666, "grad_norm": 0.58984375, "learning_rate": 2.6385683508070942e-05, "loss": 0.4007877826690674, "num_input_tokens_seen": 7369084736, "step": 25910, "train_runtime": 252029.5419, "train_tokens_per_second": 29238.972 }, { "epoch": 0.9171021235849953, "grad_norm": 0.58203125, "learning_rate": 2.6382010310009335e-05, "loss": 0.39722001552581787, "num_input_tokens_seen": 7371948800, "step": 25920, "train_runtime": 252127.8505, "train_tokens_per_second": 29238.931 }, { "epoch": 0.9174559438487242, "grad_norm": 0.5859375, "learning_rate": 2.63783386455781e-05, "loss": 0.3985212087631226, "num_input_tokens_seen": 7374769472, "step": 25930, "train_runtime": 252222.4581, "train_tokens_per_second": 29239.147 }, { "epoch": 0.917809764112453, "grad_norm": 0.59375, "learning_rate": 2.637466851371032e-05, "loss": 0.40396957397460936, "num_input_tokens_seen": 7377641152, "step": 25940, "train_runtime": 252322.3132, "train_tokens_per_second": 29238.957 }, { "epoch": 0.9181635843761817, "grad_norm": 0.58984375, "learning_rate": 2.637099991334015e-05, "loss": 0.39706361293792725, "num_input_tokens_seen": 7380539456, "step": 25950, "train_runtime": 252423.4736, "train_tokens_per_second": 29238.721 }, { "epoch": 0.9185174046399105, "grad_norm": 0.62109375, "learning_rate": 2.636733284340275e-05, "loss": 0.3972465038299561, "num_input_tokens_seen": 7383350272, "step": 25960, "train_runtime": 252518.1685, "train_tokens_per_second": 29238.887 }, { "epoch": 0.9188712249036393, "grad_norm": 0.5625, "learning_rate": 2.6363667302834326e-05, "loss": 0.3986637115478516, "num_input_tokens_seen": 7386183232, "step": 25970, "train_runtime": 252614.8926, "train_tokens_per_second": 29238.907 }, { "epoch": 0.919225045167368, "grad_norm": 0.60546875, "learning_rate": 2.636000329057214e-05, "loss": 0.39251768589019775, "num_input_tokens_seen": 7389062656, "step": 25980, "train_runtime": 252715.0361, "train_tokens_per_second": 29238.714 }, { "epoch": 0.9195788654310968, "grad_norm": 0.60546875, "learning_rate": 2.6356340805554452e-05, "loss": 0.4001704216003418, "num_input_tokens_seen": 7391905792, "step": 25990, "train_runtime": 252813.0801, "train_tokens_per_second": 29238.621 }, { "epoch": 0.9199326856948256, "grad_norm": 0.6015625, "learning_rate": 2.635267984672058e-05, "loss": 0.39476704597473145, "num_input_tokens_seen": 7394704704, "step": 26000, "train_runtime": 252907.1595, "train_tokens_per_second": 29238.811 }, { "epoch": 0.9202865059585543, "grad_norm": 0.5703125, "learning_rate": 2.6349020413010862e-05, "loss": 0.4021094799041748, "num_input_tokens_seen": 7397520192, "step": 26010, "train_runtime": 253003.469, "train_tokens_per_second": 29238.809 }, { "epoch": 0.9206403262222832, "grad_norm": 0.5625, "learning_rate": 2.6345362503366676e-05, "loss": 0.39967756271362304, "num_input_tokens_seen": 7400370176, "step": 26020, "train_runtime": 253103.9036, "train_tokens_per_second": 29238.467 }, { "epoch": 0.920994146486012, "grad_norm": 0.609375, "learning_rate": 2.634170611673042e-05, "loss": 0.40238361358642577, "num_input_tokens_seen": 7403118144, "step": 26030, "train_runtime": 253196.691, "train_tokens_per_second": 29238.605 }, { "epoch": 0.9213479667497407, "grad_norm": 0.59765625, "learning_rate": 2.6338051252045516e-05, "loss": 0.3964683055877686, "num_input_tokens_seen": 7405969792, "step": 26040, "train_runtime": 253296.1415, "train_tokens_per_second": 29238.384 }, { "epoch": 0.9217017870134695, "grad_norm": 0.58203125, "learning_rate": 2.6334397908256412e-05, "loss": 0.39841771125793457, "num_input_tokens_seen": 7408837952, "step": 26050, "train_runtime": 253392.2897, "train_tokens_per_second": 29238.608 }, { "epoch": 0.9220556072771983, "grad_norm": 0.62890625, "learning_rate": 2.63307460843086e-05, "loss": 0.3997972011566162, "num_input_tokens_seen": 7411620864, "step": 26060, "train_runtime": 253485.8687, "train_tokens_per_second": 29238.793 }, { "epoch": 0.922409427540927, "grad_norm": 0.578125, "learning_rate": 2.6327095779148576e-05, "loss": 0.40070438385009766, "num_input_tokens_seen": 7414539200, "step": 26070, "train_runtime": 253588.2792, "train_tokens_per_second": 29238.493 }, { "epoch": 0.9227632478046558, "grad_norm": 0.578125, "learning_rate": 2.6323446991723856e-05, "loss": 0.3976911544799805, "num_input_tokens_seen": 7417369856, "step": 26080, "train_runtime": 253681.817, "train_tokens_per_second": 29238.871 }, { "epoch": 0.9231170680683846, "grad_norm": 0.59765625, "learning_rate": 2.6319799720982985e-05, "loss": 0.4010918617248535, "num_input_tokens_seen": 7420172992, "step": 26090, "train_runtime": 253777.73, "train_tokens_per_second": 29238.866 }, { "epoch": 0.9234708883321134, "grad_norm": 0.59765625, "learning_rate": 2.6316153965875527e-05, "loss": 0.39762158393859864, "num_input_tokens_seen": 7422991104, "step": 26100, "train_runtime": 253873.1305, "train_tokens_per_second": 29238.979 }, { "epoch": 0.9238247085958422, "grad_norm": 0.58984375, "learning_rate": 2.6312509725352074e-05, "loss": 0.40204601287841796, "num_input_tokens_seen": 7425821120, "step": 26110, "train_runtime": 253971.1555, "train_tokens_per_second": 29238.837 }, { "epoch": 0.924178528859571, "grad_norm": 0.5859375, "learning_rate": 2.6308866998364208e-05, "loss": 0.396649694442749, "num_input_tokens_seen": 7428651392, "step": 26120, "train_runtime": 254066.4012, "train_tokens_per_second": 29239.015 }, { "epoch": 0.9245323491232997, "grad_norm": 0.58984375, "learning_rate": 2.6305225783864556e-05, "loss": 0.39858369827270507, "num_input_tokens_seen": 7431515456, "step": 26130, "train_runtime": 254164.2058, "train_tokens_per_second": 29239.032 }, { "epoch": 0.9248861693870285, "grad_norm": 0.60546875, "learning_rate": 2.6301586080806734e-05, "loss": 0.3980096340179443, "num_input_tokens_seen": 7434345792, "step": 26140, "train_runtime": 254263.7872, "train_tokens_per_second": 29238.713 }, { "epoch": 0.9252399896507573, "grad_norm": 0.59765625, "learning_rate": 2.6297947888145395e-05, "loss": 0.3948065280914307, "num_input_tokens_seen": 7437112960, "step": 26150, "train_runtime": 254356.4414, "train_tokens_per_second": 29238.941 }, { "epoch": 0.925593809914486, "grad_norm": 0.5859375, "learning_rate": 2.6294311204836185e-05, "loss": 0.3992250919342041, "num_input_tokens_seen": 7440015104, "step": 26160, "train_runtime": 254456.0999, "train_tokens_per_second": 29238.895 }, { "epoch": 0.9259476301782148, "grad_norm": 0.6171875, "learning_rate": 2.6290676029835777e-05, "loss": 0.4019043445587158, "num_input_tokens_seen": 7442824320, "step": 26170, "train_runtime": 254551.2084, "train_tokens_per_second": 29239.006 }, { "epoch": 0.9263014504419437, "grad_norm": 0.58984375, "learning_rate": 2.6287042362101834e-05, "loss": 0.40125131607055664, "num_input_tokens_seen": 7445649280, "step": 26180, "train_runtime": 254645.1906, "train_tokens_per_second": 29239.308 }, { "epoch": 0.9266552707056724, "grad_norm": 0.578125, "learning_rate": 2.628341020059304e-05, "loss": 0.3943807363510132, "num_input_tokens_seen": 7448544256, "step": 26190, "train_runtime": 254747.2541, "train_tokens_per_second": 29238.958 }, { "epoch": 0.9270090909694012, "grad_norm": 0.59375, "learning_rate": 2.627977954426909e-05, "loss": 0.39886474609375, "num_input_tokens_seen": 7451411648, "step": 26200, "train_runtime": 254846.7685, "train_tokens_per_second": 29238.792 }, { "epoch": 0.92736291123313, "grad_norm": 0.6171875, "learning_rate": 2.627615039209067e-05, "loss": 0.40076217651367185, "num_input_tokens_seen": 7454233792, "step": 26210, "train_runtime": 254942.4137, "train_tokens_per_second": 29238.892 }, { "epoch": 0.9277167314968587, "grad_norm": 0.6015625, "learning_rate": 2.6272522743019483e-05, "loss": 0.39693379402160645, "num_input_tokens_seen": 7457067968, "step": 26220, "train_runtime": 255041.4614, "train_tokens_per_second": 29238.65 }, { "epoch": 0.9280705517605875, "grad_norm": 0.609375, "learning_rate": 2.6268896596018234e-05, "loss": 0.3957505226135254, "num_input_tokens_seen": 7459882048, "step": 26230, "train_runtime": 255134.9414, "train_tokens_per_second": 29238.967 }, { "epoch": 0.9284243720243163, "grad_norm": 0.62109375, "learning_rate": 2.6265271950050624e-05, "loss": 0.3964117765426636, "num_input_tokens_seen": 7462726464, "step": 26240, "train_runtime": 255232.2901, "train_tokens_per_second": 29238.959 }, { "epoch": 0.928778192288045, "grad_norm": 0.57421875, "learning_rate": 2.626164880408136e-05, "loss": 0.3972675085067749, "num_input_tokens_seen": 7465592512, "step": 26250, "train_runtime": 255330.8272, "train_tokens_per_second": 29238.9 }, { "epoch": 0.9291320125517738, "grad_norm": 0.58984375, "learning_rate": 2.6258027157076137e-05, "loss": 0.3954314231872559, "num_input_tokens_seen": 7468436288, "step": 26260, "train_runtime": 255429.3498, "train_tokens_per_second": 29238.755 }, { "epoch": 0.9294858328155027, "grad_norm": 0.62890625, "learning_rate": 2.625440700800167e-05, "loss": 0.3998711109161377, "num_input_tokens_seen": 7471270400, "step": 26270, "train_runtime": 255527.3188, "train_tokens_per_second": 29238.637 }, { "epoch": 0.9298396530792314, "grad_norm": 0.58203125, "learning_rate": 2.6250788355825646e-05, "loss": 0.3990406274795532, "num_input_tokens_seen": 7474175040, "step": 26280, "train_runtime": 255628.7445, "train_tokens_per_second": 29238.398 }, { "epoch": 0.9301934733429602, "grad_norm": 0.59375, "learning_rate": 2.6247171199516767e-05, "loss": 0.39998886585235593, "num_input_tokens_seen": 7477086272, "step": 26290, "train_runtime": 255729.8865, "train_tokens_per_second": 29238.218 }, { "epoch": 0.930547293606689, "grad_norm": 0.56640625, "learning_rate": 2.6243555538044717e-05, "loss": 0.3982580900192261, "num_input_tokens_seen": 7479947072, "step": 26300, "train_runtime": 255828.4484, "train_tokens_per_second": 29238.136 }, { "epoch": 0.9309011138704177, "grad_norm": 0.5859375, "learning_rate": 2.6239941370380184e-05, "loss": 0.39694933891296386, "num_input_tokens_seen": 7482773952, "step": 26310, "train_runtime": 255925.0286, "train_tokens_per_second": 29238.148 }, { "epoch": 0.9312549341341465, "grad_norm": 0.60546875, "learning_rate": 2.6236328695494834e-05, "loss": 0.39450922012329104, "num_input_tokens_seen": 7485591360, "step": 26320, "train_runtime": 256019.371, "train_tokens_per_second": 29238.379 }, { "epoch": 0.9316087543978753, "grad_norm": 0.5859375, "learning_rate": 2.6232717512361343e-05, "loss": 0.39752721786499023, "num_input_tokens_seen": 7488479360, "step": 26330, "train_runtime": 256119.0977, "train_tokens_per_second": 29238.27 }, { "epoch": 0.931962574661604, "grad_norm": 0.59375, "learning_rate": 2.6229107819953357e-05, "loss": 0.3971027612686157, "num_input_tokens_seen": 7491326208, "step": 26340, "train_runtime": 256215.9879, "train_tokens_per_second": 29238.325 }, { "epoch": 0.9323163949253329, "grad_norm": 0.59765625, "learning_rate": 2.6225499617245525e-05, "loss": 0.401854133605957, "num_input_tokens_seen": 7494171328, "step": 26350, "train_runtime": 256310.7447, "train_tokens_per_second": 29238.616 }, { "epoch": 0.9326702151890617, "grad_norm": 0.5859375, "learning_rate": 2.6221892903213473e-05, "loss": 0.4006021976470947, "num_input_tokens_seen": 7496991168, "step": 26360, "train_runtime": 256406.7733, "train_tokens_per_second": 29238.663 }, { "epoch": 0.9330240354527904, "grad_norm": 0.6328125, "learning_rate": 2.621828767683382e-05, "loss": 0.3983322620391846, "num_input_tokens_seen": 7499831552, "step": 26370, "train_runtime": 256505.1867, "train_tokens_per_second": 29238.518 }, { "epoch": 0.9333778557165192, "grad_norm": 0.60546875, "learning_rate": 2.6214683937084162e-05, "loss": 0.40112690925598143, "num_input_tokens_seen": 7502663936, "step": 26380, "train_runtime": 256600.5239, "train_tokens_per_second": 29238.693 }, { "epoch": 0.933731675980248, "grad_norm": 0.61328125, "learning_rate": 2.621108168294309e-05, "loss": 0.40163602828979494, "num_input_tokens_seen": 7505471744, "step": 26390, "train_runtime": 256694.7296, "train_tokens_per_second": 29238.901 }, { "epoch": 0.9340854962439767, "grad_norm": 0.58984375, "learning_rate": 2.620748091339016e-05, "loss": 0.3998089790344238, "num_input_tokens_seen": 7508353152, "step": 26400, "train_runtime": 256789.0575, "train_tokens_per_second": 29239.381 }, { "epoch": 0.9344393165077055, "grad_norm": 0.61328125, "learning_rate": 2.620388162740593e-05, "loss": 0.4036846160888672, "num_input_tokens_seen": 7511148928, "step": 26410, "train_runtime": 256883.6016, "train_tokens_per_second": 29239.503 }, { "epoch": 0.9347931367714343, "grad_norm": 0.58984375, "learning_rate": 2.620028382397192e-05, "loss": 0.3989966154098511, "num_input_tokens_seen": 7514030912, "step": 26420, "train_runtime": 256982.5912, "train_tokens_per_second": 29239.455 }, { "epoch": 0.9351469570351632, "grad_norm": 0.59765625, "learning_rate": 2.6196687502070645e-05, "loss": 0.40350589752197263, "num_input_tokens_seen": 7516908224, "step": 26430, "train_runtime": 257080.4288, "train_tokens_per_second": 29239.52 }, { "epoch": 0.9355007772988919, "grad_norm": 0.58203125, "learning_rate": 2.6193092660685577e-05, "loss": 0.397203254699707, "num_input_tokens_seen": 7519726528, "step": 26440, "train_runtime": 257172.7595, "train_tokens_per_second": 29239.981 }, { "epoch": 0.9358545975626207, "grad_norm": 0.6015625, "learning_rate": 2.618949929880118e-05, "loss": 0.4003242015838623, "num_input_tokens_seen": 7522534016, "step": 26450, "train_runtime": 257268.5171, "train_tokens_per_second": 29240.01 }, { "epoch": 0.9362084178263494, "grad_norm": 0.60546875, "learning_rate": 2.618590741540289e-05, "loss": 0.3972476959228516, "num_input_tokens_seen": 7525328512, "step": 26460, "train_runtime": 257360.7375, "train_tokens_per_second": 29240.391 }, { "epoch": 0.9365622380900782, "grad_norm": 0.59375, "learning_rate": 2.6182317009477104e-05, "loss": 0.3991569519042969, "num_input_tokens_seen": 7528202048, "step": 26470, "train_runtime": 257459.2788, "train_tokens_per_second": 29240.36 }, { "epoch": 0.936916058353807, "grad_norm": 0.609375, "learning_rate": 2.617872808001122e-05, "loss": 0.3979495525360107, "num_input_tokens_seen": 7531066304, "step": 26480, "train_runtime": 257557.1297, "train_tokens_per_second": 29240.372 }, { "epoch": 0.9372698786175357, "grad_norm": 0.5859375, "learning_rate": 2.6175140625993583e-05, "loss": 0.3976877689361572, "num_input_tokens_seen": 7533873984, "step": 26490, "train_runtime": 257652.221, "train_tokens_per_second": 29240.478 }, { "epoch": 0.9376236988812645, "grad_norm": 0.5859375, "learning_rate": 2.6171554646413508e-05, "loss": 0.39845259189605714, "num_input_tokens_seen": 7536732416, "step": 26500, "train_runtime": 257750.4679, "train_tokens_per_second": 29240.422 }, { "epoch": 0.9379775191449934, "grad_norm": 0.578125, "learning_rate": 2.61679701402613e-05, "loss": 0.3973482847213745, "num_input_tokens_seen": 7539570496, "step": 26510, "train_runtime": 257849.0575, "train_tokens_per_second": 29240.248 }, { "epoch": 0.9383313394087222, "grad_norm": 0.59375, "learning_rate": 2.6164387106528197e-05, "loss": 0.40004758834838866, "num_input_tokens_seen": 7542419776, "step": 26520, "train_runtime": 257948.9355, "train_tokens_per_second": 29239.972 }, { "epoch": 0.9386851596724509, "grad_norm": 0.6015625, "learning_rate": 2.6160805544206447e-05, "loss": 0.3993862152099609, "num_input_tokens_seen": 7545247616, "step": 26530, "train_runtime": 258046.3643, "train_tokens_per_second": 29239.891 }, { "epoch": 0.9390389799361797, "grad_norm": 0.5859375, "learning_rate": 2.6157225452289223e-05, "loss": 0.39635534286499025, "num_input_tokens_seen": 7548103680, "step": 26540, "train_runtime": 258141.6549, "train_tokens_per_second": 29240.162 }, { "epoch": 0.9393928001999085, "grad_norm": 0.6015625, "learning_rate": 2.6153646829770696e-05, "loss": 0.39853811264038086, "num_input_tokens_seen": 7550937152, "step": 26550, "train_runtime": 258239.1635, "train_tokens_per_second": 29240.093 }, { "epoch": 0.9397466204636372, "grad_norm": 0.58203125, "learning_rate": 2.6150069675645972e-05, "loss": 0.39964966773986815, "num_input_tokens_seen": 7553826304, "step": 26560, "train_runtime": 258339.811, "train_tokens_per_second": 29239.885 }, { "epoch": 0.940100440727366, "grad_norm": 0.625, "learning_rate": 2.6146493988911137e-05, "loss": 0.4021864891052246, "num_input_tokens_seen": 7556638656, "step": 26570, "train_runtime": 258434.1137, "train_tokens_per_second": 29240.097 }, { "epoch": 0.9404542609910947, "grad_norm": 0.6328125, "learning_rate": 2.6142919768563224e-05, "loss": 0.4010316848754883, "num_input_tokens_seen": 7559477248, "step": 26580, "train_runtime": 258530.2279, "train_tokens_per_second": 29240.206 }, { "epoch": 0.9408080812548235, "grad_norm": 0.58984375, "learning_rate": 2.613934701360024e-05, "loss": 0.40176992416381835, "num_input_tokens_seen": 7562282368, "step": 26590, "train_runtime": 258623.3783, "train_tokens_per_second": 29240.521 }, { "epoch": 0.9411619015185524, "grad_norm": 0.609375, "learning_rate": 2.6135775723021143e-05, "loss": 0.396843409538269, "num_input_tokens_seen": 7565127424, "step": 26600, "train_runtime": 258719.4161, "train_tokens_per_second": 29240.664 }, { "epoch": 0.9415157217822812, "grad_norm": 0.59375, "learning_rate": 2.613220589582585e-05, "loss": 0.4043242931365967, "num_input_tokens_seen": 7568018496, "step": 26610, "train_runtime": 258819.3856, "train_tokens_per_second": 29240.54 }, { "epoch": 0.9418695420460099, "grad_norm": 0.6171875, "learning_rate": 2.612863753101522e-05, "loss": 0.39943852424621584, "num_input_tokens_seen": 7570843008, "step": 26620, "train_runtime": 258913.5032, "train_tokens_per_second": 29240.819 }, { "epoch": 0.9422233623097387, "grad_norm": 0.5703125, "learning_rate": 2.612507062759109e-05, "loss": 0.4017926216125488, "num_input_tokens_seen": 7573606592, "step": 26630, "train_runtime": 259004.5437, "train_tokens_per_second": 29241.211 }, { "epoch": 0.9425771825734675, "grad_norm": 0.59375, "learning_rate": 2.612150518455625e-05, "loss": 0.3972273349761963, "num_input_tokens_seen": 7576424576, "step": 26640, "train_runtime": 259102.0225, "train_tokens_per_second": 29241.086 }, { "epoch": 0.9429310028371962, "grad_norm": 0.60546875, "learning_rate": 2.6117941200914407e-05, "loss": 0.39843101501464845, "num_input_tokens_seen": 7579285376, "step": 26650, "train_runtime": 259197.1733, "train_tokens_per_second": 29241.389 }, { "epoch": 0.943284823100925, "grad_norm": 0.57421875, "learning_rate": 2.6114378675670266e-05, "loss": 0.3988903045654297, "num_input_tokens_seen": 7582086912, "step": 26660, "train_runtime": 259290.5894, "train_tokens_per_second": 29241.659 }, { "epoch": 0.9436386433646538, "grad_norm": 0.58203125, "learning_rate": 2.611081760782944e-05, "loss": 0.39679226875305174, "num_input_tokens_seen": 7584917376, "step": 26670, "train_runtime": 259386.5904, "train_tokens_per_second": 29241.748 }, { "epoch": 0.9439924636283826, "grad_norm": 0.56640625, "learning_rate": 2.6107257996398533e-05, "loss": 0.3978052854537964, "num_input_tokens_seen": 7587733568, "step": 26680, "train_runtime": 259482.9664, "train_tokens_per_second": 29241.74 }, { "epoch": 0.9443462838921114, "grad_norm": 0.609375, "learning_rate": 2.610369984038506e-05, "loss": 0.4018243312835693, "num_input_tokens_seen": 7590547328, "step": 26690, "train_runtime": 259576.8924, "train_tokens_per_second": 29241.999 }, { "epoch": 0.9447001041558402, "grad_norm": 0.6015625, "learning_rate": 2.6100143138797508e-05, "loss": 0.3984825134277344, "num_input_tokens_seen": 7593391104, "step": 26700, "train_runtime": 259673.2033, "train_tokens_per_second": 29242.105 }, { "epoch": 0.9450539244195689, "grad_norm": 0.58203125, "learning_rate": 2.6096587890645286e-05, "loss": 0.4009200096130371, "num_input_tokens_seen": 7596243136, "step": 26710, "train_runtime": 259771.0683, "train_tokens_per_second": 29242.068 }, { "epoch": 0.9454077446832977, "grad_norm": 0.578125, "learning_rate": 2.6093034094938772e-05, "loss": 0.4034112453460693, "num_input_tokens_seen": 7599072192, "step": 26720, "train_runtime": 259867.6947, "train_tokens_per_second": 29242.081 }, { "epoch": 0.9457615649470265, "grad_norm": 0.6015625, "learning_rate": 2.608948175068927e-05, "loss": 0.3975165843963623, "num_input_tokens_seen": 7601949120, "step": 26730, "train_runtime": 259964.2155, "train_tokens_per_second": 29242.291 }, { "epoch": 0.9461153852107552, "grad_norm": 0.58984375, "learning_rate": 2.6085930856909035e-05, "loss": 0.39958236217498777, "num_input_tokens_seen": 7604805952, "step": 26740, "train_runtime": 260060.0049, "train_tokens_per_second": 29242.505 }, { "epoch": 0.946469205474484, "grad_norm": 0.5859375, "learning_rate": 2.608238141261126e-05, "loss": 0.39940547943115234, "num_input_tokens_seen": 7607641280, "step": 26750, "train_runtime": 260155.1379, "train_tokens_per_second": 29242.71 }, { "epoch": 0.9468230257382129, "grad_norm": 0.609375, "learning_rate": 2.6078833416810072e-05, "loss": 0.39827785491943357, "num_input_tokens_seen": 7610425536, "step": 26760, "train_runtime": 260248.7823, "train_tokens_per_second": 29242.886 }, { "epoch": 0.9471768460019416, "grad_norm": 0.5859375, "learning_rate": 2.6075286868520543e-05, "loss": 0.3989081382751465, "num_input_tokens_seen": 7613237632, "step": 26770, "train_runtime": 260342.3794, "train_tokens_per_second": 29243.175 }, { "epoch": 0.9475306662656704, "grad_norm": 0.58984375, "learning_rate": 2.6071741766758678e-05, "loss": 0.4026822090148926, "num_input_tokens_seen": 7616021312, "step": 26780, "train_runtime": 260437.1807, "train_tokens_per_second": 29243.218 }, { "epoch": 0.9478844865293992, "grad_norm": 0.5703125, "learning_rate": 2.6068198110541432e-05, "loss": 0.4010054111480713, "num_input_tokens_seen": 7618848512, "step": 26790, "train_runtime": 260534.1842, "train_tokens_per_second": 29243.182 }, { "epoch": 0.9482383067931279, "grad_norm": 0.59765625, "learning_rate": 2.606465589888667e-05, "loss": 0.401930570602417, "num_input_tokens_seen": 7621735040, "step": 26800, "train_runtime": 260633.4887, "train_tokens_per_second": 29243.115 }, { "epoch": 0.9485921270568567, "grad_norm": 0.57421875, "learning_rate": 2.606111513081321e-05, "loss": 0.3994897365570068, "num_input_tokens_seen": 7624568320, "step": 26810, "train_runtime": 260729.2195, "train_tokens_per_second": 29243.245 }, { "epoch": 0.9489459473205855, "grad_norm": 0.6171875, "learning_rate": 2.60575758053408e-05, "loss": 0.39697816371917727, "num_input_tokens_seen": 7627436160, "step": 26820, "train_runtime": 260828.2178, "train_tokens_per_second": 29243.14 }, { "epoch": 0.9492997675843142, "grad_norm": 0.58984375, "learning_rate": 2.605403792149012e-05, "loss": 0.396331787109375, "num_input_tokens_seen": 7630342400, "step": 26830, "train_runtime": 260928.4661, "train_tokens_per_second": 29243.043 }, { "epoch": 0.949653587848043, "grad_norm": 0.609375, "learning_rate": 2.6050501478282775e-05, "loss": 0.3953064203262329, "num_input_tokens_seen": 7633210560, "step": 26840, "train_runtime": 261028.1649, "train_tokens_per_second": 29242.862 }, { "epoch": 0.9500074081117719, "grad_norm": 0.59375, "learning_rate": 2.6046966474741293e-05, "loss": 0.39481778144836427, "num_input_tokens_seen": 7636083072, "step": 26850, "train_runtime": 261124.3796, "train_tokens_per_second": 29243.087 }, { "epoch": 0.9503612283755006, "grad_norm": 0.59375, "learning_rate": 2.6043432909889148e-05, "loss": 0.397759222984314, "num_input_tokens_seen": 7638949888, "step": 26860, "train_runtime": 261220.6694, "train_tokens_per_second": 29243.283 }, { "epoch": 0.9507150486392294, "grad_norm": 0.5703125, "learning_rate": 2.6039900782750737e-05, "loss": 0.39381046295166017, "num_input_tokens_seen": 7641783168, "step": 26870, "train_runtime": 261316.8062, "train_tokens_per_second": 29243.367 }, { "epoch": 0.9510688689029582, "grad_norm": 0.61328125, "learning_rate": 2.6036370092351377e-05, "loss": 0.39339656829833985, "num_input_tokens_seen": 7644615424, "step": 26880, "train_runtime": 261414.7572, "train_tokens_per_second": 29243.244 }, { "epoch": 0.9514226891666869, "grad_norm": 0.59765625, "learning_rate": 2.6032840837717298e-05, "loss": 0.4019001007080078, "num_input_tokens_seen": 7647469376, "step": 26890, "train_runtime": 261513.0631, "train_tokens_per_second": 29243.164 }, { "epoch": 0.9517765094304157, "grad_norm": 0.57421875, "learning_rate": 2.6029313017875682e-05, "loss": 0.400600004196167, "num_input_tokens_seen": 7650284608, "step": 26900, "train_runtime": 261607.3265, "train_tokens_per_second": 29243.388 }, { "epoch": 0.9521303296941445, "grad_norm": 0.58984375, "learning_rate": 2.602578663185461e-05, "loss": 0.40262789726257325, "num_input_tokens_seen": 7653107456, "step": 26910, "train_runtime": 261706.5654, "train_tokens_per_second": 29243.085 }, { "epoch": 0.9524841499578732, "grad_norm": 0.58984375, "learning_rate": 2.6022261678683102e-05, "loss": 0.3949984073638916, "num_input_tokens_seen": 7655948864, "step": 26920, "train_runtime": 261804.2575, "train_tokens_per_second": 29243.027 }, { "epoch": 0.9528379702216021, "grad_norm": 0.60546875, "learning_rate": 2.601873815739108e-05, "loss": 0.3995465040206909, "num_input_tokens_seen": 7658779392, "step": 26930, "train_runtime": 261901.3699, "train_tokens_per_second": 29242.991 }, { "epoch": 0.9531917904853309, "grad_norm": 0.6015625, "learning_rate": 2.6015216067009395e-05, "loss": 0.3973482847213745, "num_input_tokens_seen": 7661614784, "step": 26940, "train_runtime": 261996.1394, "train_tokens_per_second": 29243.235 }, { "epoch": 0.9535456107490596, "grad_norm": 0.56640625, "learning_rate": 2.6011695406569824e-05, "loss": 0.39684038162231444, "num_input_tokens_seen": 7664483008, "step": 26950, "train_runtime": 262094.8116, "train_tokens_per_second": 29243.17 }, { "epoch": 0.9538994310127884, "grad_norm": 0.5859375, "learning_rate": 2.6008176175105048e-05, "loss": 0.3989076614379883, "num_input_tokens_seen": 7667332416, "step": 26960, "train_runtime": 262189.4958, "train_tokens_per_second": 29243.477 }, { "epoch": 0.9542532512765172, "grad_norm": 0.609375, "learning_rate": 2.6004658371648672e-05, "loss": 0.4005279541015625, "num_input_tokens_seen": 7670159680, "step": 26970, "train_runtime": 262285.7287, "train_tokens_per_second": 29243.527 }, { "epoch": 0.9546070715402459, "grad_norm": 0.58984375, "learning_rate": 2.6001141995235195e-05, "loss": 0.39890542030334475, "num_input_tokens_seen": 7673056704, "step": 26980, "train_runtime": 262384.7522, "train_tokens_per_second": 29243.531 }, { "epoch": 0.9549608918039747, "grad_norm": 0.5703125, "learning_rate": 2.599762704490007e-05, "loss": 0.40028767585754393, "num_input_tokens_seen": 7675956352, "step": 26990, "train_runtime": 262486.2876, "train_tokens_per_second": 29243.266 }, { "epoch": 0.9553147120677035, "grad_norm": 0.59765625, "learning_rate": 2.599411351967963e-05, "loss": 0.39893522262573244, "num_input_tokens_seen": 7678770112, "step": 27000, "train_runtime": 262582.6036, "train_tokens_per_second": 29243.255 }, { "epoch": 0.9556685323314323, "grad_norm": 0.5859375, "learning_rate": 2.5990601418611127e-05, "loss": 0.3983405590057373, "num_input_tokens_seen": 7681633920, "step": 27010, "train_runtime": 262682.5763, "train_tokens_per_second": 29243.028 }, { "epoch": 0.9560223525951611, "grad_norm": 0.62109375, "learning_rate": 2.598709074073272e-05, "loss": 0.39721479415893557, "num_input_tokens_seen": 7684447104, "step": 27020, "train_runtime": 262776.9718, "train_tokens_per_second": 29243.229 }, { "epoch": 0.9563761728588899, "grad_norm": 0.60546875, "learning_rate": 2.5983581485083498e-05, "loss": 0.4035499095916748, "num_input_tokens_seen": 7687253632, "step": 27030, "train_runtime": 262873.4507, "train_tokens_per_second": 29243.172 }, { "epoch": 0.9567299931226186, "grad_norm": 0.58984375, "learning_rate": 2.598007365070343e-05, "loss": 0.40035438537597656, "num_input_tokens_seen": 7690112640, "step": 27040, "train_runtime": 262973.2914, "train_tokens_per_second": 29242.942 }, { "epoch": 0.9570838133863474, "grad_norm": 0.6015625, "learning_rate": 2.5976567236633403e-05, "loss": 0.40668430328369143, "num_input_tokens_seen": 7692974400, "step": 27050, "train_runtime": 263072.4014, "train_tokens_per_second": 29242.803 }, { "epoch": 0.9574376336500762, "grad_norm": 0.6328125, "learning_rate": 2.5973062241915225e-05, "loss": 0.39524426460266116, "num_input_tokens_seen": 7695779648, "step": 27060, "train_runtime": 263169.327, "train_tokens_per_second": 29242.692 }, { "epoch": 0.9577914539138049, "grad_norm": 0.61328125, "learning_rate": 2.5969558665591576e-05, "loss": 0.4012258529663086, "num_input_tokens_seen": 7698627264, "step": 27070, "train_runtime": 263267.095, "train_tokens_per_second": 29242.649 }, { "epoch": 0.9581452741775337, "grad_norm": 0.59765625, "learning_rate": 2.5966056506706078e-05, "loss": 0.40055179595947266, "num_input_tokens_seen": 7701469120, "step": 27080, "train_runtime": 263365.9532, "train_tokens_per_second": 29242.463 }, { "epoch": 0.9584990944412625, "grad_norm": 0.61328125, "learning_rate": 2.596255576430322e-05, "loss": 0.40211167335510256, "num_input_tokens_seen": 7704293632, "step": 27090, "train_runtime": 263460.8687, "train_tokens_per_second": 29242.649 }, { "epoch": 0.9588529147049913, "grad_norm": 0.59375, "learning_rate": 2.5959056437428414e-05, "loss": 0.4005706787109375, "num_input_tokens_seen": 7707106816, "step": 27100, "train_runtime": 263556.7867, "train_tokens_per_second": 29242.68 }, { "epoch": 0.9592067349687201, "grad_norm": 0.61328125, "learning_rate": 2.5955558525127977e-05, "loss": 0.3992138385772705, "num_input_tokens_seen": 7709932096, "step": 27110, "train_runtime": 263651.5026, "train_tokens_per_second": 29242.891 }, { "epoch": 0.9595605552324489, "grad_norm": 0.59765625, "learning_rate": 2.5952062026449096e-05, "loss": 0.4039638519287109, "num_input_tokens_seen": 7712776768, "step": 27120, "train_runtime": 263749.3231, "train_tokens_per_second": 29242.831 }, { "epoch": 0.9599143754961776, "grad_norm": 0.640625, "learning_rate": 2.59485669404399e-05, "loss": 0.39955973625183105, "num_input_tokens_seen": 7715607616, "step": 27130, "train_runtime": 263844.754, "train_tokens_per_second": 29242.983 }, { "epoch": 0.9602681957599064, "grad_norm": 0.5859375, "learning_rate": 2.5945073266149366e-05, "loss": 0.39974355697631836, "num_input_tokens_seen": 7718424512, "step": 27140, "train_runtime": 263939.8514, "train_tokens_per_second": 29243.119 }, { "epoch": 0.9606220160236352, "grad_norm": 0.59765625, "learning_rate": 2.594158100262741e-05, "loss": 0.39653887748718264, "num_input_tokens_seen": 7721271360, "step": 27150, "train_runtime": 264035.8988, "train_tokens_per_second": 29243.263 }, { "epoch": 0.9609758362873639, "grad_norm": 0.60546875, "learning_rate": 2.5938090148924815e-05, "loss": 0.40317444801330565, "num_input_tokens_seen": 7724100992, "step": 27160, "train_runtime": 264132.0322, "train_tokens_per_second": 29243.333 }, { "epoch": 0.9613296565510927, "grad_norm": 0.60546875, "learning_rate": 2.5934600704093282e-05, "loss": 0.40064101219177245, "num_input_tokens_seen": 7726932160, "step": 27170, "train_runtime": 264228.039, "train_tokens_per_second": 29243.422 }, { "epoch": 0.9616834768148216, "grad_norm": 0.59765625, "learning_rate": 2.5931112667185365e-05, "loss": 0.39939146041870116, "num_input_tokens_seen": 7729738432, "step": 27180, "train_runtime": 264323.5664, "train_tokens_per_second": 29243.471 }, { "epoch": 0.9620372970785503, "grad_norm": 0.58984375, "learning_rate": 2.592762603725456e-05, "loss": 0.3980076313018799, "num_input_tokens_seen": 7732588608, "step": 27190, "train_runtime": 264419.3244, "train_tokens_per_second": 29243.659 }, { "epoch": 0.9623911173422791, "grad_norm": 0.62890625, "learning_rate": 2.592414081335522e-05, "loss": 0.39870409965515136, "num_input_tokens_seen": 7735442176, "step": 27200, "train_runtime": 264514.4786, "train_tokens_per_second": 29243.927 }, { "epoch": 0.9627449376060079, "grad_norm": 0.58984375, "learning_rate": 2.592065699454259e-05, "loss": 0.3983691930770874, "num_input_tokens_seen": 7738321792, "step": 27210, "train_runtime": 264614.3441, "train_tokens_per_second": 29243.773 }, { "epoch": 0.9630987578697366, "grad_norm": 0.5703125, "learning_rate": 2.5917174579872815e-05, "loss": 0.3958759784698486, "num_input_tokens_seen": 7741176000, "step": 27220, "train_runtime": 264710.7654, "train_tokens_per_second": 29243.903 }, { "epoch": 0.9634525781334654, "grad_norm": 0.58984375, "learning_rate": 2.5913693568402926e-05, "loss": 0.3938683032989502, "num_input_tokens_seen": 7744038848, "step": 27230, "train_runtime": 264808.8046, "train_tokens_per_second": 29243.887 }, { "epoch": 0.9638063983971942, "grad_norm": 0.59375, "learning_rate": 2.5910213959190833e-05, "loss": 0.40143728256225586, "num_input_tokens_seen": 7746888704, "step": 27240, "train_runtime": 264907.4816, "train_tokens_per_second": 29243.752 }, { "epoch": 0.9641602186609229, "grad_norm": 0.609375, "learning_rate": 2.590673575129534e-05, "loss": 0.40088181495666503, "num_input_tokens_seen": 7749687296, "step": 27250, "train_runtime": 265001.2782, "train_tokens_per_second": 29243.962 }, { "epoch": 0.9645140389246518, "grad_norm": 0.58984375, "learning_rate": 2.5903258943776116e-05, "loss": 0.39911527633666993, "num_input_tokens_seen": 7752568768, "step": 27260, "train_runtime": 265102.9423, "train_tokens_per_second": 29243.616 }, { "epoch": 0.9648678591883806, "grad_norm": 0.6171875, "learning_rate": 2.5899783535693745e-05, "loss": 0.3927340030670166, "num_input_tokens_seen": 7755390336, "step": 27270, "train_runtime": 265198.5543, "train_tokens_per_second": 29243.713 }, { "epoch": 0.9652216794521093, "grad_norm": 0.58984375, "learning_rate": 2.5896309526109663e-05, "loss": 0.3992013454437256, "num_input_tokens_seen": 7758272320, "step": 27280, "train_runtime": 265298.2601, "train_tokens_per_second": 29243.585 }, { "epoch": 0.9655754997158381, "grad_norm": 0.6171875, "learning_rate": 2.589283691408621e-05, "loss": 0.3973858118057251, "num_input_tokens_seen": 7761131648, "step": 27290, "train_runtime": 265396.3767, "train_tokens_per_second": 29243.548 }, { "epoch": 0.9659293199795669, "grad_norm": 0.58984375, "learning_rate": 2.588936569868658e-05, "loss": 0.40364990234375, "num_input_tokens_seen": 7763973760, "step": 27300, "train_runtime": 265494.3461, "train_tokens_per_second": 29243.462 }, { "epoch": 0.9662831402432956, "grad_norm": 0.56640625, "learning_rate": 2.5885895878974877e-05, "loss": 0.400461483001709, "num_input_tokens_seen": 7766862464, "step": 27310, "train_runtime": 265595.0834, "train_tokens_per_second": 29243.246 }, { "epoch": 0.9666369605070244, "grad_norm": 0.578125, "learning_rate": 2.5882427454016055e-05, "loss": 0.4009994983673096, "num_input_tokens_seen": 7769708480, "step": 27320, "train_runtime": 265693.6931, "train_tokens_per_second": 29243.105 }, { "epoch": 0.9669907807707532, "grad_norm": 0.59765625, "learning_rate": 2.587896042287596e-05, "loss": 0.3973134279251099, "num_input_tokens_seen": 7772516544, "step": 27330, "train_runtime": 265790.1556, "train_tokens_per_second": 29243.057 }, { "epoch": 0.9673446010344819, "grad_norm": 0.60546875, "learning_rate": 2.5875494784621317e-05, "loss": 0.3973072052001953, "num_input_tokens_seen": 7775338240, "step": 27340, "train_runtime": 265886.1814, "train_tokens_per_second": 29243.108 }, { "epoch": 0.9676984212982108, "grad_norm": 0.58984375, "learning_rate": 2.587203053831971e-05, "loss": 0.3967430591583252, "num_input_tokens_seen": 7778188160, "step": 27350, "train_runtime": 265985.7147, "train_tokens_per_second": 29242.879 }, { "epoch": 0.9680522415619396, "grad_norm": 0.59765625, "learning_rate": 2.586856768303961e-05, "loss": 0.39706850051879883, "num_input_tokens_seen": 7781007616, "step": 27360, "train_runtime": 266082.6795, "train_tokens_per_second": 29242.819 }, { "epoch": 0.9684060618256684, "grad_norm": 0.6171875, "learning_rate": 2.586510621785036e-05, "loss": 0.39858102798461914, "num_input_tokens_seen": 7783851840, "step": 27370, "train_runtime": 266177.0195, "train_tokens_per_second": 29243.14 }, { "epoch": 0.9687598820893971, "grad_norm": 0.6015625, "learning_rate": 2.5861646141822164e-05, "loss": 0.40108633041381836, "num_input_tokens_seen": 7786691392, "step": 27380, "train_runtime": 266277.0223, "train_tokens_per_second": 29242.821 }, { "epoch": 0.9691137023531259, "grad_norm": 0.58984375, "learning_rate": 2.5858187454026106e-05, "loss": 0.39533224105834963, "num_input_tokens_seen": 7789517312, "step": 27390, "train_runtime": 266371.5938, "train_tokens_per_second": 29243.048 }, { "epoch": 0.9694675226168546, "grad_norm": 0.578125, "learning_rate": 2.5854730153534134e-05, "loss": 0.3947713851928711, "num_input_tokens_seen": 7792367616, "step": 27400, "train_runtime": 266470.3422, "train_tokens_per_second": 29242.908 }, { "epoch": 0.9698213428805834, "grad_norm": 0.57421875, "learning_rate": 2.585127423941907e-05, "loss": 0.4002467155456543, "num_input_tokens_seen": 7795244736, "step": 27410, "train_runtime": 266571.1649, "train_tokens_per_second": 29242.64 }, { "epoch": 0.9701751631443122, "grad_norm": 0.59765625, "learning_rate": 2.58478197107546e-05, "loss": 0.3985337972640991, "num_input_tokens_seen": 7798101888, "step": 27420, "train_runtime": 266667.7506, "train_tokens_per_second": 29242.763 }, { "epoch": 0.9705289834080411, "grad_norm": 0.6015625, "learning_rate": 2.5844366566615273e-05, "loss": 0.39818401336669923, "num_input_tokens_seen": 7801014976, "step": 27430, "train_runtime": 266768.1858, "train_tokens_per_second": 29242.674 }, { "epoch": 0.9708828036717698, "grad_norm": 0.59375, "learning_rate": 2.584091480607651e-05, "loss": 0.40388174057006837, "num_input_tokens_seen": 7803891904, "step": 27440, "train_runtime": 266867.9715, "train_tokens_per_second": 29242.52 }, { "epoch": 0.9712366239354986, "grad_norm": 0.59375, "learning_rate": 2.5837464428214592e-05, "loss": 0.3994109869003296, "num_input_tokens_seen": 7806784704, "step": 27450, "train_runtime": 266968.4823, "train_tokens_per_second": 29242.346 }, { "epoch": 0.9715904441992274, "grad_norm": 0.61328125, "learning_rate": 2.5834015432106666e-05, "loss": 0.39685707092285155, "num_input_tokens_seen": 7809631744, "step": 27460, "train_runtime": 267064.7881, "train_tokens_per_second": 29242.461 }, { "epoch": 0.9719442644629561, "grad_norm": 0.5859375, "learning_rate": 2.5830567816830737e-05, "loss": 0.39645776748657224, "num_input_tokens_seen": 7812457856, "step": 27470, "train_runtime": 267161.074, "train_tokens_per_second": 29242.501 }, { "epoch": 0.9722980847266849, "grad_norm": 0.58203125, "learning_rate": 2.5827121581465668e-05, "loss": 0.3955065727233887, "num_input_tokens_seen": 7815289536, "step": 27480, "train_runtime": 267259.7847, "train_tokens_per_second": 29242.295 }, { "epoch": 0.9726519049904137, "grad_norm": 0.5859375, "learning_rate": 2.5823676725091193e-05, "loss": 0.4005618095397949, "num_input_tokens_seen": 7818122176, "step": 27490, "train_runtime": 267357.1218, "train_tokens_per_second": 29242.244 }, { "epoch": 0.9730057252541424, "grad_norm": 0.5625, "learning_rate": 2.5820233246787902e-05, "loss": 0.40039587020874023, "num_input_tokens_seen": 7820980032, "step": 27500, "train_runtime": 267453.5882, "train_tokens_per_second": 29242.382 }, { "epoch": 0.9733595455178713, "grad_norm": 0.59375, "learning_rate": 2.581679114563723e-05, "loss": 0.4029428005218506, "num_input_tokens_seen": 7823928128, "step": 27510, "train_runtime": 267557.7607, "train_tokens_per_second": 29242.015 }, { "epoch": 0.9737133657816001, "grad_norm": 0.59765625, "learning_rate": 2.5813350420721488e-05, "loss": 0.4005100250244141, "num_input_tokens_seen": 7826748928, "step": 27520, "train_runtime": 267652.1895, "train_tokens_per_second": 29242.238 }, { "epoch": 0.9740671860453288, "grad_norm": 0.5703125, "learning_rate": 2.5809911071123834e-05, "loss": 0.3956948757171631, "num_input_tokens_seen": 7829627584, "step": 27530, "train_runtime": 267751.987, "train_tokens_per_second": 29242.09 }, { "epoch": 0.9744210063090576, "grad_norm": 0.6015625, "learning_rate": 2.5806473095928274e-05, "loss": 0.3960397720336914, "num_input_tokens_seen": 7832470336, "step": 27540, "train_runtime": 267846.8999, "train_tokens_per_second": 29242.341 }, { "epoch": 0.9747748265727864, "grad_norm": 0.6171875, "learning_rate": 2.5803036494219678e-05, "loss": 0.3994396209716797, "num_input_tokens_seen": 7835371520, "step": 27550, "train_runtime": 267948.1227, "train_tokens_per_second": 29242.121 }, { "epoch": 0.9751286468365151, "grad_norm": 0.58203125, "learning_rate": 2.5799601265083767e-05, "loss": 0.400991153717041, "num_input_tokens_seen": 7838242752, "step": 27560, "train_runtime": 268046.1473, "train_tokens_per_second": 29242.139 }, { "epoch": 0.9754824671002439, "grad_norm": 0.578125, "learning_rate": 2.5796167407607113e-05, "loss": 0.3959287881851196, "num_input_tokens_seen": 7841110848, "step": 27570, "train_runtime": 268143.133, "train_tokens_per_second": 29242.259 }, { "epoch": 0.9758362873639727, "grad_norm": 0.609375, "learning_rate": 2.5792734920877138e-05, "loss": 0.3995499134063721, "num_input_tokens_seen": 7843947392, "step": 27580, "train_runtime": 268239.4221, "train_tokens_per_second": 29242.336 }, { "epoch": 0.9761901076277014, "grad_norm": 0.60546875, "learning_rate": 2.5789303803982114e-05, "loss": 0.39961650371551516, "num_input_tokens_seen": 7846760832, "step": 27590, "train_runtime": 268334.4578, "train_tokens_per_second": 29242.464 }, { "epoch": 0.9765439278914303, "grad_norm": 0.5703125, "learning_rate": 2.578587405601115e-05, "loss": 0.40409126281738283, "num_input_tokens_seen": 7849578048, "step": 27600, "train_runtime": 268430.4744, "train_tokens_per_second": 29242.5 }, { "epoch": 0.9768977481551591, "grad_norm": 0.58984375, "learning_rate": 2.5782445676054233e-05, "loss": 0.39781885147094725, "num_input_tokens_seen": 7852493312, "step": 27610, "train_runtime": 268530.5108, "train_tokens_per_second": 29242.462 }, { "epoch": 0.9772515684188878, "grad_norm": 0.58203125, "learning_rate": 2.577901866320217e-05, "loss": 0.4021693229675293, "num_input_tokens_seen": 7855302656, "step": 27620, "train_runtime": 268625.3663, "train_tokens_per_second": 29242.594 }, { "epoch": 0.9776053886826166, "grad_norm": 0.5859375, "learning_rate": 2.5775593016546618e-05, "loss": 0.3960843563079834, "num_input_tokens_seen": 7858197760, "step": 27630, "train_runtime": 268726.3392, "train_tokens_per_second": 29242.38 }, { "epoch": 0.9779592089463454, "grad_norm": 0.58984375, "learning_rate": 2.5772168735180084e-05, "loss": 0.40301008224487306, "num_input_tokens_seen": 7861040896, "step": 27640, "train_runtime": 268824.2922, "train_tokens_per_second": 29242.301 }, { "epoch": 0.9783130292100741, "grad_norm": 0.5703125, "learning_rate": 2.5768745818195927e-05, "loss": 0.3999293565750122, "num_input_tokens_seen": 7863913856, "step": 27650, "train_runtime": 268922.9966, "train_tokens_per_second": 29242.251 }, { "epoch": 0.9786668494738029, "grad_norm": 0.5859375, "learning_rate": 2.5765324264688327e-05, "loss": 0.3959509372711182, "num_input_tokens_seen": 7866820160, "step": 27660, "train_runtime": 269022.7867, "train_tokens_per_second": 29242.208 }, { "epoch": 0.9790206697375317, "grad_norm": 0.6015625, "learning_rate": 2.5761904073752323e-05, "loss": 0.39629387855529785, "num_input_tokens_seen": 7869606464, "step": 27670, "train_runtime": 269114.9455, "train_tokens_per_second": 29242.547 }, { "epoch": 0.9793744900012605, "grad_norm": 0.59765625, "learning_rate": 2.5758485244483788e-05, "loss": 0.40226335525512696, "num_input_tokens_seen": 7872438336, "step": 27680, "train_runtime": 269212.2273, "train_tokens_per_second": 29242.499 }, { "epoch": 0.9797283102649893, "grad_norm": 0.58984375, "learning_rate": 2.5755067775979443e-05, "loss": 0.3981515645980835, "num_input_tokens_seen": 7875197248, "step": 27690, "train_runtime": 269303.2712, "train_tokens_per_second": 29242.858 }, { "epoch": 0.9800821305287181, "grad_norm": 0.6015625, "learning_rate": 2.5751651667336824e-05, "loss": 0.3977331638336182, "num_input_tokens_seen": 7878105984, "step": 27700, "train_runtime": 269404.3895, "train_tokens_per_second": 29242.679 }, { "epoch": 0.9804359507924468, "grad_norm": 0.61328125, "learning_rate": 2.5748236917654333e-05, "loss": 0.4015091896057129, "num_input_tokens_seen": 7880935232, "step": 27710, "train_runtime": 269497.8693, "train_tokens_per_second": 29243.034 }, { "epoch": 0.9807897710561756, "grad_norm": 0.58984375, "learning_rate": 2.5744823526031202e-05, "loss": 0.40073838233947756, "num_input_tokens_seen": 7883814720, "step": 27720, "train_runtime": 269595.6837, "train_tokens_per_second": 29243.104 }, { "epoch": 0.9811435913199044, "grad_norm": 0.61328125, "learning_rate": 2.5741411491567484e-05, "loss": 0.3967472553253174, "num_input_tokens_seen": 7886692032, "step": 27730, "train_runtime": 269694.2669, "train_tokens_per_second": 29243.084 }, { "epoch": 0.9814974115836331, "grad_norm": 0.59765625, "learning_rate": 2.573800081336408e-05, "loss": 0.39780030250549314, "num_input_tokens_seen": 7889550912, "step": 27740, "train_runtime": 269792.0549, "train_tokens_per_second": 29243.081 }, { "epoch": 0.9818512318473619, "grad_norm": 0.625, "learning_rate": 2.573459149052272e-05, "loss": 0.3954323768615723, "num_input_tokens_seen": 7892358528, "step": 27750, "train_runtime": 269885.2353, "train_tokens_per_second": 29243.388 }, { "epoch": 0.9822050521110908, "grad_norm": 0.59765625, "learning_rate": 2.5731183522145968e-05, "loss": 0.4019524574279785, "num_input_tokens_seen": 7895227200, "step": 27760, "train_runtime": 269986.1562, "train_tokens_per_second": 29243.082 }, { "epoch": 0.9825588723748195, "grad_norm": 0.56640625, "learning_rate": 2.5727776907337226e-05, "loss": 0.39240384101867676, "num_input_tokens_seen": 7898030208, "step": 27770, "train_runtime": 270079.829, "train_tokens_per_second": 29243.318 }, { "epoch": 0.9829126926385483, "grad_norm": 0.609375, "learning_rate": 2.5724371645200708e-05, "loss": 0.39812841415405276, "num_input_tokens_seen": 7900816960, "step": 27780, "train_runtime": 270176.9517, "train_tokens_per_second": 29243.12 }, { "epoch": 0.9832665129022771, "grad_norm": 0.609375, "learning_rate": 2.572096773484147e-05, "loss": 0.4045284271240234, "num_input_tokens_seen": 7903646848, "step": 27790, "train_runtime": 270272.9178, "train_tokens_per_second": 29243.207 }, { "epoch": 0.9836203331660058, "grad_norm": 0.60546875, "learning_rate": 2.5717565175365416e-05, "loss": 0.39740467071533203, "num_input_tokens_seen": 7906475520, "step": 27800, "train_runtime": 270367.5579, "train_tokens_per_second": 29243.433 }, { "epoch": 0.9839741534297346, "grad_norm": 0.59765625, "learning_rate": 2.571416396587924e-05, "loss": 0.3975717067718506, "num_input_tokens_seen": 7909321216, "step": 27810, "train_runtime": 270465.8021, "train_tokens_per_second": 29243.332 }, { "epoch": 0.9843279736934634, "grad_norm": 0.58984375, "learning_rate": 2.5710764105490486e-05, "loss": 0.3997790336608887, "num_input_tokens_seen": 7912120320, "step": 27820, "train_runtime": 270559.6413, "train_tokens_per_second": 29243.535 }, { "epoch": 0.9846817939571921, "grad_norm": 0.58984375, "learning_rate": 2.570736559330752e-05, "loss": 0.39911911487579343, "num_input_tokens_seen": 7914969536, "step": 27830, "train_runtime": 270656.305, "train_tokens_per_second": 29243.618 }, { "epoch": 0.9850356142209209, "grad_norm": 0.64453125, "learning_rate": 2.570396842843953e-05, "loss": 0.39789586067199706, "num_input_tokens_seen": 7917792064, "step": 27840, "train_runtime": 270751.9984, "train_tokens_per_second": 29243.707 }, { "epoch": 0.9853894344846498, "grad_norm": 0.6015625, "learning_rate": 2.5700572609996526e-05, "loss": 0.3981212615966797, "num_input_tokens_seen": 7920633152, "step": 27850, "train_runtime": 270850.3418, "train_tokens_per_second": 29243.578 }, { "epoch": 0.9857432547483785, "grad_norm": 0.6015625, "learning_rate": 2.5697178137089357e-05, "loss": 0.3947503089904785, "num_input_tokens_seen": 7923523520, "step": 27860, "train_runtime": 270947.7642, "train_tokens_per_second": 29243.731 }, { "epoch": 0.9860970750121073, "grad_norm": 0.58203125, "learning_rate": 2.569378500882966e-05, "loss": 0.3959986686706543, "num_input_tokens_seen": 7926298176, "step": 27870, "train_runtime": 271043.6654, "train_tokens_per_second": 29243.621 }, { "epoch": 0.9864508952758361, "grad_norm": 0.5859375, "learning_rate": 2.569039322432994e-05, "loss": 0.40237884521484374, "num_input_tokens_seen": 7929133824, "step": 27880, "train_runtime": 271139.3219, "train_tokens_per_second": 29243.762 }, { "epoch": 0.9868047155395648, "grad_norm": 0.625, "learning_rate": 2.5687002782703474e-05, "loss": 0.4016533851623535, "num_input_tokens_seen": 7931983168, "step": 27890, "train_runtime": 271237.5189, "train_tokens_per_second": 29243.68 }, { "epoch": 0.9871585358032936, "grad_norm": 0.6015625, "learning_rate": 2.568361368306439e-05, "loss": 0.39665908813476564, "num_input_tokens_seen": 7934843328, "step": 27900, "train_runtime": 271337.0613, "train_tokens_per_second": 29243.493 }, { "epoch": 0.9875123560670224, "grad_norm": 0.59375, "learning_rate": 2.5680225924527623e-05, "loss": 0.39907145500183105, "num_input_tokens_seen": 7937700352, "step": 27910, "train_runtime": 271434.8647, "train_tokens_per_second": 29243.481 }, { "epoch": 0.9878661763307511, "grad_norm": 0.6015625, "learning_rate": 2.5676839506208927e-05, "loss": 0.3972276210784912, "num_input_tokens_seen": 7940547648, "step": 27920, "train_runtime": 271531.7043, "train_tokens_per_second": 29243.538 }, { "epoch": 0.98821999659448, "grad_norm": 0.56640625, "learning_rate": 2.567345442722487e-05, "loss": 0.39655632972717286, "num_input_tokens_seen": 7943389504, "step": 27930, "train_runtime": 271627.0183, "train_tokens_per_second": 29243.739 }, { "epoch": 0.9885738168582088, "grad_norm": 0.58984375, "learning_rate": 2.567007068669283e-05, "loss": 0.3965986967086792, "num_input_tokens_seen": 7946204800, "step": 27940, "train_runtime": 271720.5643, "train_tokens_per_second": 29244.032 }, { "epoch": 0.9889276371219375, "grad_norm": 0.60546875, "learning_rate": 2.5666688283731016e-05, "loss": 0.3946433782577515, "num_input_tokens_seen": 7948974080, "step": 27950, "train_runtime": 271811.0232, "train_tokens_per_second": 29244.488 }, { "epoch": 0.9892814573856663, "grad_norm": 0.58984375, "learning_rate": 2.5663307217458428e-05, "loss": 0.3974971532821655, "num_input_tokens_seen": 7951878912, "step": 27960, "train_runtime": 271910.2389, "train_tokens_per_second": 29244.5 }, { "epoch": 0.9896352776493951, "grad_norm": 0.58203125, "learning_rate": 2.5659927486994893e-05, "loss": 0.39725556373596194, "num_input_tokens_seen": 7954701824, "step": 27970, "train_runtime": 272005.9134, "train_tokens_per_second": 29244.592 }, { "epoch": 0.9899890979131238, "grad_norm": 0.578125, "learning_rate": 2.565654909146105e-05, "loss": 0.39673457145690916, "num_input_tokens_seen": 7957524096, "step": 27980, "train_runtime": 272102.9322, "train_tokens_per_second": 29244.536 }, { "epoch": 0.9903429181768526, "grad_norm": 0.60546875, "learning_rate": 2.5653172029978346e-05, "loss": 0.40122127532958984, "num_input_tokens_seen": 7960404800, "step": 27990, "train_runtime": 272199.7308, "train_tokens_per_second": 29244.72 }, { "epoch": 0.9906967384405814, "grad_norm": 0.60546875, "learning_rate": 2.5649796301669014e-05, "loss": 0.3940152883529663, "num_input_tokens_seen": 7963204224, "step": 28000, "train_runtime": 272295.2892, "train_tokens_per_second": 29244.737 }, { "epoch": 0.9910505587043102, "grad_norm": 0.61328125, "learning_rate": 2.5646421905656148e-05, "loss": 0.3974417209625244, "num_input_tokens_seen": 7966060928, "step": 28010, "train_runtime": 272391.7257, "train_tokens_per_second": 29244.871 }, { "epoch": 0.991404378968039, "grad_norm": 0.62109375, "learning_rate": 2.5643048841063587e-05, "loss": 0.3976799964904785, "num_input_tokens_seen": 7968937280, "step": 28020, "train_runtime": 272489.8236, "train_tokens_per_second": 29244.899 }, { "epoch": 0.9917581992317678, "grad_norm": 0.62109375, "learning_rate": 2.563967710701603e-05, "loss": 0.4041726112365723, "num_input_tokens_seen": 7971751104, "step": 28030, "train_runtime": 272585.5933, "train_tokens_per_second": 29244.947 }, { "epoch": 0.9921120194954965, "grad_norm": 0.62109375, "learning_rate": 2.5636306702638946e-05, "loss": 0.40075006484985354, "num_input_tokens_seen": 7974506944, "step": 28040, "train_runtime": 272677.9714, "train_tokens_per_second": 29245.145 }, { "epoch": 0.9924658397592253, "grad_norm": 0.59375, "learning_rate": 2.5632937627058624e-05, "loss": 0.40079808235168457, "num_input_tokens_seen": 7977336320, "step": 28050, "train_runtime": 272773.5431, "train_tokens_per_second": 29245.271 }, { "epoch": 0.9928196600229541, "grad_norm": 0.58203125, "learning_rate": 2.562956987940216e-05, "loss": 0.3951700210571289, "num_input_tokens_seen": 7980157952, "step": 28060, "train_runtime": 272868.5018, "train_tokens_per_second": 29245.435 }, { "epoch": 0.9931734802866828, "grad_norm": 0.609375, "learning_rate": 2.5626203458797432e-05, "loss": 0.39908695220947266, "num_input_tokens_seen": 7983067456, "step": 28070, "train_runtime": 272969.7001, "train_tokens_per_second": 29245.251 }, { "epoch": 0.9935273005504116, "grad_norm": 0.578125, "learning_rate": 2.562283836437315e-05, "loss": 0.3960444450378418, "num_input_tokens_seen": 7985969856, "step": 28080, "train_runtime": 273069.6747, "train_tokens_per_second": 29245.173 }, { "epoch": 0.9938811208141404, "grad_norm": 0.62109375, "learning_rate": 2.561947459525879e-05, "loss": 0.39877910614013673, "num_input_tokens_seen": 7988810048, "step": 28090, "train_runtime": 273165.3761, "train_tokens_per_second": 29245.324 }, { "epoch": 0.9942349410778692, "grad_norm": 0.58203125, "learning_rate": 2.561611215058466e-05, "loss": 0.39794418811798093, "num_input_tokens_seen": 7991675072, "step": 28100, "train_runtime": 273263.9158, "train_tokens_per_second": 29245.263 }, { "epoch": 0.994588761341598, "grad_norm": 0.59375, "learning_rate": 2.5612751029481845e-05, "loss": 0.3959181785583496, "num_input_tokens_seen": 7994518144, "step": 28110, "train_runtime": 273359.6536, "train_tokens_per_second": 29245.421 }, { "epoch": 0.9949425816053268, "grad_norm": 0.58203125, "learning_rate": 2.560939123108225e-05, "loss": 0.3949803590774536, "num_input_tokens_seen": 7997373312, "step": 28120, "train_runtime": 273460.239, "train_tokens_per_second": 29245.105 }, { "epoch": 0.9952964018690555, "grad_norm": 0.6015625, "learning_rate": 2.560603275451855e-05, "loss": 0.4009438991546631, "num_input_tokens_seen": 8000276352, "step": 28130, "train_runtime": 273562.1617, "train_tokens_per_second": 29244.821 }, { "epoch": 0.9956502221327843, "grad_norm": 0.609375, "learning_rate": 2.5602675598924227e-05, "loss": 0.4008786201477051, "num_input_tokens_seen": 8003102528, "step": 28140, "train_runtime": 273655.0942, "train_tokens_per_second": 29245.217 }, { "epoch": 0.9960040423965131, "grad_norm": 0.6015625, "learning_rate": 2.5599319763433566e-05, "loss": 0.39966888427734376, "num_input_tokens_seen": 8005923840, "step": 28150, "train_runtime": 273752.4196, "train_tokens_per_second": 29245.125 }, { "epoch": 0.9963578626602418, "grad_norm": 0.5703125, "learning_rate": 2.559596524718164e-05, "loss": 0.39789068698883057, "num_input_tokens_seen": 8008785664, "step": 28160, "train_runtime": 273849.4826, "train_tokens_per_second": 29245.21 }, { "epoch": 0.9967116829239706, "grad_norm": 0.58203125, "learning_rate": 2.559261204930431e-05, "loss": 0.39697449207305907, "num_input_tokens_seen": 8011625856, "step": 28170, "train_runtime": 273946.75, "train_tokens_per_second": 29245.194 }, { "epoch": 0.9970655031876995, "grad_norm": 0.59765625, "learning_rate": 2.558926016893824e-05, "loss": 0.39841408729553224, "num_input_tokens_seen": 8014461440, "step": 28180, "train_runtime": 274042.2682, "train_tokens_per_second": 29245.348 }, { "epoch": 0.9974193234514283, "grad_norm": 0.57421875, "learning_rate": 2.5585909605220877e-05, "loss": 0.3999458312988281, "num_input_tokens_seen": 8017315840, "step": 28190, "train_runtime": 274140.9999, "train_tokens_per_second": 29245.227 }, { "epoch": 0.997773143715157, "grad_norm": 0.57421875, "learning_rate": 2.558256035729046e-05, "loss": 0.39957804679870607, "num_input_tokens_seen": 8020148032, "step": 28200, "train_runtime": 274235.8306, "train_tokens_per_second": 29245.442 }, { "epoch": 0.9981269639788858, "grad_norm": 0.58203125, "learning_rate": 2.557921242428602e-05, "loss": 0.4022542953491211, "num_input_tokens_seen": 8022949056, "step": 28210, "train_runtime": 274330.5863, "train_tokens_per_second": 29245.551 }, { "epoch": 0.9984807842426145, "grad_norm": 0.6015625, "learning_rate": 2.557586580534737e-05, "loss": 0.3926943302154541, "num_input_tokens_seen": 8025749568, "step": 28220, "train_runtime": 274424.8234, "train_tokens_per_second": 29245.713 }, { "epoch": 0.9988346045063433, "grad_norm": 0.609375, "learning_rate": 2.5572520499615127e-05, "loss": 0.3961955070495605, "num_input_tokens_seen": 8028631680, "step": 28230, "train_runtime": 274524.7178, "train_tokens_per_second": 29245.569 }, { "epoch": 0.9991884247700721, "grad_norm": 0.58203125, "learning_rate": 2.5569176506230667e-05, "loss": 0.4020658016204834, "num_input_tokens_seen": 8031430592, "step": 28240, "train_runtime": 274620.7369, "train_tokens_per_second": 29245.536 }, { "epoch": 0.9995422450338008, "grad_norm": 0.5703125, "learning_rate": 2.5565833824336183e-05, "loss": 0.39832544326782227, "num_input_tokens_seen": 8034253696, "step": 28250, "train_runtime": 274714.2057, "train_tokens_per_second": 29245.862 }, { "epoch": 0.9998960652975297, "grad_norm": 0.56640625, "learning_rate": 2.5562492453074633e-05, "loss": 0.39608800411224365, "num_input_tokens_seen": 8037056512, "step": 28260, "train_runtime": 274806.3584, "train_tokens_per_second": 29246.254 }, { "epoch": 1.0002476741846102, "grad_norm": 0.60546875, "learning_rate": 2.555915239158976e-05, "loss": 0.3948505878448486, "num_input_tokens_seen": 8039909376, "step": 28270, "train_runtime": 274916.5534, "train_tokens_per_second": 29244.908 }, { "epoch": 1.000601494448339, "grad_norm": 0.5859375, "learning_rate": 2.5555813639026093e-05, "loss": 0.38819246292114257, "num_input_tokens_seen": 8042756800, "step": 28280, "train_runtime": 275017.0202, "train_tokens_per_second": 29244.578 }, { "epoch": 1.0009553147120678, "grad_norm": 0.59375, "learning_rate": 2.5552476194528947e-05, "loss": 0.3980375289916992, "num_input_tokens_seen": 8045619328, "step": 28290, "train_runtime": 275116.1622, "train_tokens_per_second": 29244.444 }, { "epoch": 1.0013091349757965, "grad_norm": 0.5859375, "learning_rate": 2.5549140057244413e-05, "loss": 0.38842923641204835, "num_input_tokens_seen": 8048455744, "step": 28300, "train_runtime": 275215.1701, "train_tokens_per_second": 29244.23 }, { "epoch": 1.0016629552395253, "grad_norm": 0.59375, "learning_rate": 2.5545805226319362e-05, "loss": 0.39246401786804197, "num_input_tokens_seen": 8051281152, "step": 28310, "train_runtime": 275311.9869, "train_tokens_per_second": 29244.209 }, { "epoch": 1.002016775503254, "grad_norm": 0.578125, "learning_rate": 2.5542471700901453e-05, "loss": 0.394031023979187, "num_input_tokens_seen": 8054102272, "step": 28320, "train_runtime": 275406.79, "train_tokens_per_second": 29244.385 }, { "epoch": 1.0023705957669828, "grad_norm": 0.6328125, "learning_rate": 2.5539139480139113e-05, "loss": 0.39044389724731443, "num_input_tokens_seen": 8056987648, "step": 28330, "train_runtime": 275507.1303, "train_tokens_per_second": 29244.207 }, { "epoch": 1.0027244160307116, "grad_norm": 0.5859375, "learning_rate": 2.5535808563181546e-05, "loss": 0.390697717666626, "num_input_tokens_seen": 8059853504, "step": 28340, "train_runtime": 275603.6438, "train_tokens_per_second": 29244.365 }, { "epoch": 1.0030782362944404, "grad_norm": 0.59375, "learning_rate": 2.553247894917874e-05, "loss": 0.3869602680206299, "num_input_tokens_seen": 8062724288, "step": 28350, "train_runtime": 275701.4999, "train_tokens_per_second": 29244.398 }, { "epoch": 1.0034320565581691, "grad_norm": 0.59765625, "learning_rate": 2.5529150637281453e-05, "loss": 0.3930094242095947, "num_input_tokens_seen": 8065563840, "step": 28360, "train_runtime": 275800.9129, "train_tokens_per_second": 29244.152 }, { "epoch": 1.003785876821898, "grad_norm": 0.56640625, "learning_rate": 2.552582362664122e-05, "loss": 0.3876837491989136, "num_input_tokens_seen": 8068325568, "step": 28370, "train_runtime": 275893.2306, "train_tokens_per_second": 29244.377 }, { "epoch": 1.0041396970856267, "grad_norm": 0.55859375, "learning_rate": 2.5522497916410353e-05, "loss": 0.39084525108337403, "num_input_tokens_seen": 8071166848, "step": 28380, "train_runtime": 275989.7705, "train_tokens_per_second": 29244.442 }, { "epoch": 1.0044935173493554, "grad_norm": 0.59375, "learning_rate": 2.5519173505741933e-05, "loss": 0.3946462869644165, "num_input_tokens_seen": 8074037760, "step": 28390, "train_runtime": 276090.4518, "train_tokens_per_second": 29244.176 }, { "epoch": 1.0048473376130842, "grad_norm": 0.61328125, "learning_rate": 2.551585039378981e-05, "loss": 0.3910089015960693, "num_input_tokens_seen": 8076849536, "step": 28400, "train_runtime": 276186.128, "train_tokens_per_second": 29244.226 }, { "epoch": 1.005201157876813, "grad_norm": 0.6171875, "learning_rate": 2.551252857970861e-05, "loss": 0.3901904821395874, "num_input_tokens_seen": 8079745472, "step": 28410, "train_runtime": 276285.7455, "train_tokens_per_second": 29244.163 }, { "epoch": 1.0055549781405417, "grad_norm": 0.609375, "learning_rate": 2.5509208062653734e-05, "loss": 0.39221858978271484, "num_input_tokens_seen": 8082548672, "step": 28420, "train_runtime": 276380.8867, "train_tokens_per_second": 29244.239 }, { "epoch": 1.0059087984042707, "grad_norm": 0.5859375, "learning_rate": 2.5505888841781333e-05, "loss": 0.3890850067138672, "num_input_tokens_seen": 8085400384, "step": 28430, "train_runtime": 276479.0026, "train_tokens_per_second": 29244.175 }, { "epoch": 1.0062626186679995, "grad_norm": 0.59765625, "learning_rate": 2.5502570916248353e-05, "loss": 0.39583353996276854, "num_input_tokens_seen": 8088302272, "step": 28440, "train_runtime": 276580.6365, "train_tokens_per_second": 29243.921 }, { "epoch": 1.0066164389317283, "grad_norm": 0.6015625, "learning_rate": 2.5499254285212486e-05, "loss": 0.39234309196472167, "num_input_tokens_seen": 8091105088, "step": 28450, "train_runtime": 276674.0766, "train_tokens_per_second": 29244.175 }, { "epoch": 1.006970259195457, "grad_norm": 0.6171875, "learning_rate": 2.5495938947832204e-05, "loss": 0.3897040605545044, "num_input_tokens_seen": 8093894528, "step": 28460, "train_runtime": 276770.773, "train_tokens_per_second": 29244.036 }, { "epoch": 1.0073240794591858, "grad_norm": 0.62890625, "learning_rate": 2.5492624903266732e-05, "loss": 0.39056398868560793, "num_input_tokens_seen": 8096779008, "step": 28470, "train_runtime": 276869.1037, "train_tokens_per_second": 29244.068 }, { "epoch": 1.0076778997229145, "grad_norm": 0.6015625, "learning_rate": 2.548931215067607e-05, "loss": 0.39957690238952637, "num_input_tokens_seen": 8099626048, "step": 28480, "train_runtime": 276966.8954, "train_tokens_per_second": 29244.022 }, { "epoch": 1.0080317199866433, "grad_norm": 0.59765625, "learning_rate": 2.5486000689220985e-05, "loss": 0.38661961555480956, "num_input_tokens_seen": 8102472448, "step": 28490, "train_runtime": 277062.7847, "train_tokens_per_second": 29244.175 }, { "epoch": 1.008385540250372, "grad_norm": 0.57421875, "learning_rate": 2.5482690518062994e-05, "loss": 0.39012315273284914, "num_input_tokens_seen": 8105298176, "step": 28500, "train_runtime": 277160.4093, "train_tokens_per_second": 29244.069 }, { "epoch": 1.0087393605141008, "grad_norm": 0.6015625, "learning_rate": 2.547938163636439e-05, "loss": 0.388866662979126, "num_input_tokens_seen": 8108137024, "step": 28510, "train_runtime": 277256.926, "train_tokens_per_second": 29244.128 }, { "epoch": 1.0090931807778296, "grad_norm": 0.60546875, "learning_rate": 2.5476074043288212e-05, "loss": 0.39122862815856935, "num_input_tokens_seen": 8110957248, "step": 28520, "train_runtime": 277351.5339, "train_tokens_per_second": 29244.321 }, { "epoch": 1.0094470010415584, "grad_norm": 0.5859375, "learning_rate": 2.547276773799827e-05, "loss": 0.3896785736083984, "num_input_tokens_seen": 8113789056, "step": 28530, "train_runtime": 277445.8992, "train_tokens_per_second": 29244.581 }, { "epoch": 1.0098008213052871, "grad_norm": 0.5703125, "learning_rate": 2.5469462719659138e-05, "loss": 0.388866925239563, "num_input_tokens_seen": 8116633408, "step": 28540, "train_runtime": 277545.8829, "train_tokens_per_second": 29244.294 }, { "epoch": 1.010154641569016, "grad_norm": 0.58984375, "learning_rate": 2.5466158987436135e-05, "loss": 0.3922267913818359, "num_input_tokens_seen": 8119549888, "step": 28550, "train_runtime": 277647.306, "train_tokens_per_second": 29244.116 }, { "epoch": 1.0105084618327447, "grad_norm": 0.5859375, "learning_rate": 2.5462856540495345e-05, "loss": 0.3909679174423218, "num_input_tokens_seen": 8122393088, "step": 28560, "train_runtime": 277744.8676, "train_tokens_per_second": 29244.08 }, { "epoch": 1.0108622820964734, "grad_norm": 0.59375, "learning_rate": 2.5459555378003607e-05, "loss": 0.39356722831726076, "num_input_tokens_seen": 8125268992, "step": 28570, "train_runtime": 277847.0507, "train_tokens_per_second": 29243.676 }, { "epoch": 1.0112161023602022, "grad_norm": 0.58984375, "learning_rate": 2.545625549912853e-05, "loss": 0.39147493839263914, "num_input_tokens_seen": 8128035648, "step": 28580, "train_runtime": 277940.762, "train_tokens_per_second": 29243.77 }, { "epoch": 1.011569922623931, "grad_norm": 0.59765625, "learning_rate": 2.5452956903038445e-05, "loss": 0.3919403076171875, "num_input_tokens_seen": 8130815040, "step": 28590, "train_runtime": 278033.6585, "train_tokens_per_second": 29243.995 }, { "epoch": 1.01192374288766, "grad_norm": 0.58203125, "learning_rate": 2.5449659588902468e-05, "loss": 0.38667960166931153, "num_input_tokens_seen": 8133671872, "step": 28600, "train_runtime": 278132.4553, "train_tokens_per_second": 29243.879 }, { "epoch": 1.0122775631513887, "grad_norm": 0.60546875, "learning_rate": 2.5446363555890464e-05, "loss": 0.39066686630249026, "num_input_tokens_seen": 8136553088, "step": 28610, "train_runtime": 278230.0244, "train_tokens_per_second": 29243.979 }, { "epoch": 1.0126313834151175, "grad_norm": 0.59375, "learning_rate": 2.5443068803173025e-05, "loss": 0.3922752857208252, "num_input_tokens_seen": 8139360896, "step": 28620, "train_runtime": 278325.0413, "train_tokens_per_second": 29244.084 }, { "epoch": 1.0129852036788463, "grad_norm": 0.58984375, "learning_rate": 2.5439775329921533e-05, "loss": 0.3946134090423584, "num_input_tokens_seen": 8142155072, "step": 28630, "train_runtime": 278418.2579, "train_tokens_per_second": 29244.329 }, { "epoch": 1.013339023942575, "grad_norm": 0.6171875, "learning_rate": 2.5436483135308092e-05, "loss": 0.3948752641677856, "num_input_tokens_seen": 8144966400, "step": 28640, "train_runtime": 278513.889, "train_tokens_per_second": 29244.381 }, { "epoch": 1.0136928442063038, "grad_norm": 0.5703125, "learning_rate": 2.543319221850557e-05, "loss": 0.3923147916793823, "num_input_tokens_seen": 8147819264, "step": 28650, "train_runtime": 278610.3917, "train_tokens_per_second": 29244.492 }, { "epoch": 1.0140466644700326, "grad_norm": 0.60546875, "learning_rate": 2.542990257868757e-05, "loss": 0.39341349601745607, "num_input_tokens_seen": 8150625984, "step": 28660, "train_runtime": 278705.637, "train_tokens_per_second": 29244.568 }, { "epoch": 1.0144004847337613, "grad_norm": 0.62890625, "learning_rate": 2.542661421502846e-05, "loss": 0.39618620872497556, "num_input_tokens_seen": 8153499264, "step": 28670, "train_runtime": 278803.3415, "train_tokens_per_second": 29244.625 }, { "epoch": 1.01475430499749, "grad_norm": 0.61328125, "learning_rate": 2.5423327126703344e-05, "loss": 0.392274808883667, "num_input_tokens_seen": 8156353152, "step": 28680, "train_runtime": 278900.3714, "train_tokens_per_second": 29244.684 }, { "epoch": 1.0151081252612189, "grad_norm": 0.5703125, "learning_rate": 2.5420041312888078e-05, "loss": 0.3968669414520264, "num_input_tokens_seen": 8159211072, "step": 28690, "train_runtime": 278997.2729, "train_tokens_per_second": 29244.77 }, { "epoch": 1.0154619455249476, "grad_norm": 0.6015625, "learning_rate": 2.5416756772759254e-05, "loss": 0.38858857154846194, "num_input_tokens_seen": 8162032448, "step": 28700, "train_runtime": 279090.5133, "train_tokens_per_second": 29245.109 }, { "epoch": 1.0158157657886764, "grad_norm": 0.5859375, "learning_rate": 2.5413473505494222e-05, "loss": 0.3933609962463379, "num_input_tokens_seen": 8164826816, "step": 28710, "train_runtime": 279187.8334, "train_tokens_per_second": 29244.923 }, { "epoch": 1.0161695860524051, "grad_norm": 0.59375, "learning_rate": 2.5410191510271063e-05, "loss": 0.3880609512329102, "num_input_tokens_seen": 8167666688, "step": 28720, "train_runtime": 279283.8765, "train_tokens_per_second": 29245.035 }, { "epoch": 1.016523406316134, "grad_norm": 0.5703125, "learning_rate": 2.5406910786268613e-05, "loss": 0.39503769874572753, "num_input_tokens_seen": 8170509952, "step": 28730, "train_runtime": 279382.4255, "train_tokens_per_second": 29244.896 }, { "epoch": 1.0168772265798627, "grad_norm": 0.61328125, "learning_rate": 2.5403631332666444e-05, "loss": 0.39555599689483645, "num_input_tokens_seen": 8173393088, "step": 28740, "train_runtime": 279481.2334, "train_tokens_per_second": 29244.873 }, { "epoch": 1.0172310468435914, "grad_norm": 0.6328125, "learning_rate": 2.5400353148644863e-05, "loss": 0.389239764213562, "num_input_tokens_seen": 8176212416, "step": 28750, "train_runtime": 279578.2223, "train_tokens_per_second": 29244.812 }, { "epoch": 1.0175848671073202, "grad_norm": 0.57421875, "learning_rate": 2.5397076233384925e-05, "loss": 0.3915641069412231, "num_input_tokens_seen": 8179049152, "step": 28760, "train_runtime": 279674.1033, "train_tokens_per_second": 29244.928 }, { "epoch": 1.0179386873710492, "grad_norm": 0.6015625, "learning_rate": 2.539380058606843e-05, "loss": 0.39095616340637207, "num_input_tokens_seen": 8181930752, "step": 28770, "train_runtime": 279772.2446, "train_tokens_per_second": 29244.969 }, { "epoch": 1.018292507634778, "grad_norm": 0.6171875, "learning_rate": 2.5390526205877895e-05, "loss": 0.3957646369934082, "num_input_tokens_seen": 8184747072, "step": 28780, "train_runtime": 279867.1103, "train_tokens_per_second": 29245.119 }, { "epoch": 1.0186463278985067, "grad_norm": 0.60546875, "learning_rate": 2.53872530919966e-05, "loss": 0.3865208625793457, "num_input_tokens_seen": 8187612480, "step": 28790, "train_runtime": 279967.3498, "train_tokens_per_second": 29244.883 }, { "epoch": 1.0190001481622355, "grad_norm": 0.5859375, "learning_rate": 2.5383981243608547e-05, "loss": 0.3902866840362549, "num_input_tokens_seen": 8190449536, "step": 28800, "train_runtime": 280064.0818, "train_tokens_per_second": 29244.912 }, { "epoch": 1.0193539684259643, "grad_norm": 0.59375, "learning_rate": 2.5380710659898476e-05, "loss": 0.39726145267486573, "num_input_tokens_seen": 8193309440, "step": 28810, "train_runtime": 280161.9844, "train_tokens_per_second": 29244.901 }, { "epoch": 1.019707788689693, "grad_norm": 0.6015625, "learning_rate": 2.537744134005187e-05, "loss": 0.3934477806091309, "num_input_tokens_seen": 8196130880, "step": 28820, "train_runtime": 280259.0353, "train_tokens_per_second": 29244.841 }, { "epoch": 1.0200616089534218, "grad_norm": 0.6015625, "learning_rate": 2.537417328325493e-05, "loss": 0.39667491912841796, "num_input_tokens_seen": 8198935744, "step": 28830, "train_runtime": 280352.8095, "train_tokens_per_second": 29245.064 }, { "epoch": 1.0204154292171506, "grad_norm": 0.6015625, "learning_rate": 2.5370906488694606e-05, "loss": 0.3903061389923096, "num_input_tokens_seen": 8201811456, "step": 28840, "train_runtime": 280452.0619, "train_tokens_per_second": 29244.968 }, { "epoch": 1.0207692494808793, "grad_norm": 0.5703125, "learning_rate": 2.536764095555857e-05, "loss": 0.3888975143432617, "num_input_tokens_seen": 8204692032, "step": 28850, "train_runtime": 280550.8779, "train_tokens_per_second": 29244.934 }, { "epoch": 1.021123069744608, "grad_norm": 0.59375, "learning_rate": 2.536437668303524e-05, "loss": 0.3873569488525391, "num_input_tokens_seen": 8207528256, "step": 28860, "train_runtime": 280649.1832, "train_tokens_per_second": 29244.797 }, { "epoch": 1.0214768900083369, "grad_norm": 0.58203125, "learning_rate": 2.5361113670313745e-05, "loss": 0.3949462890625, "num_input_tokens_seen": 8210386176, "step": 28870, "train_runtime": 280748.3918, "train_tokens_per_second": 29244.642 }, { "epoch": 1.0218307102720656, "grad_norm": 0.625, "learning_rate": 2.5357851916583964e-05, "loss": 0.3935708045959473, "num_input_tokens_seen": 8213194304, "step": 28880, "train_runtime": 280843.3946, "train_tokens_per_second": 29244.748 }, { "epoch": 1.0221845305357944, "grad_norm": 0.6171875, "learning_rate": 2.5354591421036485e-05, "loss": 0.3913459300994873, "num_input_tokens_seen": 8216071488, "step": 28890, "train_runtime": 280942.0698, "train_tokens_per_second": 29244.718 }, { "epoch": 1.0225383507995232, "grad_norm": 0.609375, "learning_rate": 2.5351332182862643e-05, "loss": 0.3918105125427246, "num_input_tokens_seen": 8218899968, "step": 28900, "train_runtime": 281037.8746, "train_tokens_per_second": 29244.813 }, { "epoch": 1.022892171063252, "grad_norm": 0.59375, "learning_rate": 2.5348074201254484e-05, "loss": 0.3912977933883667, "num_input_tokens_seen": 8221649344, "step": 28910, "train_runtime": 281129.0699, "train_tokens_per_second": 29245.106 }, { "epoch": 1.0232459913269807, "grad_norm": 0.61328125, "learning_rate": 2.53448174754048e-05, "loss": 0.3941735982894897, "num_input_tokens_seen": 8224446976, "step": 28920, "train_runtime": 281222.128, "train_tokens_per_second": 29245.376 }, { "epoch": 1.0235998115907097, "grad_norm": 0.61328125, "learning_rate": 2.5341562004507087e-05, "loss": 0.39432220458984374, "num_input_tokens_seen": 8227288704, "step": 28930, "train_runtime": 281316.8823, "train_tokens_per_second": 29245.627 }, { "epoch": 1.0239536318544384, "grad_norm": 0.59765625, "learning_rate": 2.5338307787755583e-05, "loss": 0.3874164581298828, "num_input_tokens_seen": 8230196608, "step": 28940, "train_runtime": 281417.625, "train_tokens_per_second": 29245.491 }, { "epoch": 1.0243074521181672, "grad_norm": 0.59375, "learning_rate": 2.533505482434524e-05, "loss": 0.390718412399292, "num_input_tokens_seen": 8233026688, "step": 28950, "train_runtime": 281514.7085, "train_tokens_per_second": 29245.458 }, { "epoch": 1.024661272381896, "grad_norm": 0.59375, "learning_rate": 2.533180311347174e-05, "loss": 0.391047739982605, "num_input_tokens_seen": 8235850176, "step": 28960, "train_runtime": 281608.7161, "train_tokens_per_second": 29245.722 }, { "epoch": 1.0250150926456247, "grad_norm": 0.60546875, "learning_rate": 2.532855265433149e-05, "loss": 0.3936030387878418, "num_input_tokens_seen": 8238641280, "step": 28970, "train_runtime": 281705.395, "train_tokens_per_second": 29245.593 }, { "epoch": 1.0253689129093535, "grad_norm": 0.61328125, "learning_rate": 2.5325303446121602e-05, "loss": 0.3960809469223022, "num_input_tokens_seen": 8241520448, "step": 28980, "train_runtime": 281807.0434, "train_tokens_per_second": 29245.261 }, { "epoch": 1.0257227331730823, "grad_norm": 0.578125, "learning_rate": 2.532205548803992e-05, "loss": 0.391988205909729, "num_input_tokens_seen": 8244379776, "step": 28990, "train_runtime": 281905.4003, "train_tokens_per_second": 29245.2 }, { "epoch": 1.026076553436811, "grad_norm": 0.59765625, "learning_rate": 2.531880877928502e-05, "loss": 0.3893109321594238, "num_input_tokens_seen": 8247211264, "step": 29000, "train_runtime": 282000.9201, "train_tokens_per_second": 29245.335 }, { "epoch": 1.0264303737005398, "grad_norm": 0.5703125, "learning_rate": 2.5315563319056173e-05, "loss": 0.3934291124343872, "num_input_tokens_seen": 8250072320, "step": 29010, "train_runtime": 282100.5032, "train_tokens_per_second": 29245.153 }, { "epoch": 1.0267841939642686, "grad_norm": 0.58984375, "learning_rate": 2.5312319106553384e-05, "loss": 0.3905926704406738, "num_input_tokens_seen": 8252970432, "step": 29020, "train_runtime": 282198.289, "train_tokens_per_second": 29245.289 }, { "epoch": 1.0271380142279973, "grad_norm": 0.6015625, "learning_rate": 2.5309076140977378e-05, "loss": 0.3938968896865845, "num_input_tokens_seen": 8255750656, "step": 29030, "train_runtime": 282291.0442, "train_tokens_per_second": 29245.528 }, { "epoch": 1.027491834491726, "grad_norm": 0.5859375, "learning_rate": 2.530583442152958e-05, "loss": 0.3917114734649658, "num_input_tokens_seen": 8258627008, "step": 29040, "train_runtime": 282390.9767, "train_tokens_per_second": 29245.364 }, { "epoch": 1.0278456547554549, "grad_norm": 0.59765625, "learning_rate": 2.5302593947412147e-05, "loss": 0.3924980640411377, "num_input_tokens_seen": 8261513408, "step": 29050, "train_runtime": 282489.3091, "train_tokens_per_second": 29245.402 }, { "epoch": 1.0281994750191836, "grad_norm": 0.60546875, "learning_rate": 2.529935471782794e-05, "loss": 0.3921475887298584, "num_input_tokens_seen": 8264319104, "step": 29060, "train_runtime": 282585.9333, "train_tokens_per_second": 29245.331 }, { "epoch": 1.0285532952829124, "grad_norm": 0.59765625, "learning_rate": 2.5296116731980547e-05, "loss": 0.38964266777038575, "num_input_tokens_seen": 8267183424, "step": 29070, "train_runtime": 282684.9284, "train_tokens_per_second": 29245.222 }, { "epoch": 1.0289071155466412, "grad_norm": 0.62890625, "learning_rate": 2.529287998907426e-05, "loss": 0.38799319267272947, "num_input_tokens_seen": 8270033920, "step": 29080, "train_runtime": 282782.373, "train_tokens_per_second": 29245.224 }, { "epoch": 1.02926093581037, "grad_norm": 0.59375, "learning_rate": 2.528964448831408e-05, "loss": 0.3917055606842041, "num_input_tokens_seen": 8272901376, "step": 29090, "train_runtime": 282877.3973, "train_tokens_per_second": 29245.537 }, { "epoch": 1.029614756074099, "grad_norm": 0.60546875, "learning_rate": 2.5286410228905727e-05, "loss": 0.3961790084838867, "num_input_tokens_seen": 8275804544, "step": 29100, "train_runtime": 282979.0001, "train_tokens_per_second": 29245.296 }, { "epoch": 1.0299685763378277, "grad_norm": 0.5703125, "learning_rate": 2.5283177210055632e-05, "loss": 0.39419353008270264, "num_input_tokens_seen": 8278685440, "step": 29110, "train_runtime": 283076.32, "train_tokens_per_second": 29245.418 }, { "epoch": 1.0303223966015564, "grad_norm": 0.609375, "learning_rate": 2.527994543097093e-05, "loss": 0.39393742084503175, "num_input_tokens_seen": 8281519168, "step": 29120, "train_runtime": 283170.7197, "train_tokens_per_second": 29245.676 }, { "epoch": 1.0306762168652852, "grad_norm": 0.6015625, "learning_rate": 2.5276714890859472e-05, "loss": 0.3897049903869629, "num_input_tokens_seen": 8284398976, "step": 29130, "train_runtime": 283269.3824, "train_tokens_per_second": 29245.656 }, { "epoch": 1.031030037129014, "grad_norm": 0.5703125, "learning_rate": 2.527348558892981e-05, "loss": 0.388124418258667, "num_input_tokens_seen": 8287274432, "step": 29140, "train_runtime": 283368.6999, "train_tokens_per_second": 29245.553 }, { "epoch": 1.0313838573927427, "grad_norm": 0.60546875, "learning_rate": 2.5270257524391223e-05, "loss": 0.39238662719726564, "num_input_tokens_seen": 8290079808, "step": 29150, "train_runtime": 283465.155, "train_tokens_per_second": 29245.499 }, { "epoch": 1.0317376776564715, "grad_norm": 0.58984375, "learning_rate": 2.526703069645366e-05, "loss": 0.38860769271850587, "num_input_tokens_seen": 8292949888, "step": 29160, "train_runtime": 283564.6928, "train_tokens_per_second": 29245.354 }, { "epoch": 1.0320914979202003, "grad_norm": 0.578125, "learning_rate": 2.5263805104327815e-05, "loss": 0.3866438865661621, "num_input_tokens_seen": 8295789568, "step": 29170, "train_runtime": 283661.722, "train_tokens_per_second": 29245.361 }, { "epoch": 1.032445318183929, "grad_norm": 0.58984375, "learning_rate": 2.526058074722506e-05, "loss": 0.3949902534484863, "num_input_tokens_seen": 8298608576, "step": 29180, "train_runtime": 283755.695, "train_tokens_per_second": 29245.611 }, { "epoch": 1.0327991384476578, "grad_norm": 0.58984375, "learning_rate": 2.5257357624357485e-05, "loss": 0.39396042823791505, "num_input_tokens_seen": 8301422400, "step": 29190, "train_runtime": 283851.9774, "train_tokens_per_second": 29245.604 }, { "epoch": 1.0331529587113866, "grad_norm": 0.58203125, "learning_rate": 2.525413573493788e-05, "loss": 0.3916712522506714, "num_input_tokens_seen": 8304241792, "step": 29200, "train_runtime": 283947.9157, "train_tokens_per_second": 29245.652 }, { "epoch": 1.0335067789751153, "grad_norm": 0.58203125, "learning_rate": 2.525091507817974e-05, "loss": 0.39437236785888674, "num_input_tokens_seen": 8307077248, "step": 29210, "train_runtime": 284044.0184, "train_tokens_per_second": 29245.739 }, { "epoch": 1.033860599238844, "grad_norm": 0.59375, "learning_rate": 2.524769565329725e-05, "loss": 0.3935762166976929, "num_input_tokens_seen": 8309927040, "step": 29220, "train_runtime": 284141.5342, "train_tokens_per_second": 29245.732 }, { "epoch": 1.0342144195025729, "grad_norm": 0.6015625, "learning_rate": 2.5244477459505317e-05, "loss": 0.38967466354370117, "num_input_tokens_seen": 8312778944, "step": 29230, "train_runtime": 284241.9251, "train_tokens_per_second": 29245.436 }, { "epoch": 1.0345682397663016, "grad_norm": 0.58984375, "learning_rate": 2.524126049601953e-05, "loss": 0.3948280572891235, "num_input_tokens_seen": 8315668160, "step": 29240, "train_runtime": 284341.5166, "train_tokens_per_second": 29245.353 }, { "epoch": 1.0349220600300304, "grad_norm": 0.65625, "learning_rate": 2.523804476205619e-05, "loss": 0.3941455841064453, "num_input_tokens_seen": 8318459328, "step": 29250, "train_runtime": 284434.9622, "train_tokens_per_second": 29245.559 }, { "epoch": 1.0352758802937592, "grad_norm": 0.609375, "learning_rate": 2.5234830256832292e-05, "loss": 0.3910728931427002, "num_input_tokens_seen": 8321299904, "step": 29260, "train_runtime": 284534.4454, "train_tokens_per_second": 29245.316 }, { "epoch": 1.0356297005574882, "grad_norm": 0.59765625, "learning_rate": 2.523161697956552e-05, "loss": 0.39293575286865234, "num_input_tokens_seen": 8324117120, "step": 29270, "train_runtime": 284629.3624, "train_tokens_per_second": 29245.462 }, { "epoch": 1.035983520821217, "grad_norm": 0.59765625, "learning_rate": 2.522840492947427e-05, "loss": 0.3858278751373291, "num_input_tokens_seen": 8326990528, "step": 29280, "train_runtime": 284728.6879, "train_tokens_per_second": 29245.351 }, { "epoch": 1.0363373410849457, "grad_norm": 0.58984375, "learning_rate": 2.5225194105777628e-05, "loss": 0.3904426574707031, "num_input_tokens_seen": 8329845760, "step": 29290, "train_runtime": 284827.7666, "train_tokens_per_second": 29245.203 }, { "epoch": 1.0366911613486745, "grad_norm": 0.58203125, "learning_rate": 2.5221984507695367e-05, "loss": 0.39294967651367185, "num_input_tokens_seen": 8332707136, "step": 29300, "train_runtime": 284923.6179, "train_tokens_per_second": 29245.407 }, { "epoch": 1.0370449816124032, "grad_norm": 0.5859375, "learning_rate": 2.5218776134447975e-05, "loss": 0.39381191730499265, "num_input_tokens_seen": 8335544064, "step": 29310, "train_runtime": 285021.1171, "train_tokens_per_second": 29245.356 }, { "epoch": 1.037398801876132, "grad_norm": 0.58203125, "learning_rate": 2.5215568985256617e-05, "loss": 0.39267659187316895, "num_input_tokens_seen": 8338327616, "step": 29320, "train_runtime": 285113.7349, "train_tokens_per_second": 29245.619 }, { "epoch": 1.0377526221398607, "grad_norm": 0.609375, "learning_rate": 2.5212363059343154e-05, "loss": 0.3902092456817627, "num_input_tokens_seen": 8341245440, "step": 29330, "train_runtime": 285214.8337, "train_tokens_per_second": 29245.483 }, { "epoch": 1.0381064424035895, "grad_norm": 0.609375, "learning_rate": 2.520915835593014e-05, "loss": 0.3982834339141846, "num_input_tokens_seen": 8344038784, "step": 29340, "train_runtime": 285308.3448, "train_tokens_per_second": 29245.688 }, { "epoch": 1.0384602626673183, "grad_norm": 0.61328125, "learning_rate": 2.5205954874240828e-05, "loss": 0.3928164005279541, "num_input_tokens_seen": 8346882368, "step": 29350, "train_runtime": 285404.1704, "train_tokens_per_second": 29245.832 }, { "epoch": 1.038814082931047, "grad_norm": 0.58203125, "learning_rate": 2.5202752613499154e-05, "loss": 0.3947235107421875, "num_input_tokens_seen": 8349779264, "step": 29360, "train_runtime": 285503.65, "train_tokens_per_second": 29245.788 }, { "epoch": 1.0391679031947758, "grad_norm": 0.60546875, "learning_rate": 2.5199551572929743e-05, "loss": 0.39569816589355467, "num_input_tokens_seen": 8352670208, "step": 29370, "train_runtime": 285604.8208, "train_tokens_per_second": 29245.55 }, { "epoch": 1.0395217234585046, "grad_norm": 0.59765625, "learning_rate": 2.5196351751757913e-05, "loss": 0.39073193073272705, "num_input_tokens_seen": 8355529344, "step": 29380, "train_runtime": 285702.3099, "train_tokens_per_second": 29245.579 }, { "epoch": 1.0398755437222333, "grad_norm": 0.62890625, "learning_rate": 2.5193153149209664e-05, "loss": 0.3907917976379395, "num_input_tokens_seen": 8358456000, "step": 29390, "train_runtime": 285806.7424, "train_tokens_per_second": 29245.132 }, { "epoch": 1.040229363985962, "grad_norm": 0.625, "learning_rate": 2.5189955764511702e-05, "loss": 0.39262776374816893, "num_input_tokens_seen": 8361291264, "step": 29400, "train_runtime": 285904.0918, "train_tokens_per_second": 29245.091 }, { "epoch": 1.0405831842496909, "grad_norm": 0.6171875, "learning_rate": 2.5186759596891398e-05, "loss": 0.38845105171203614, "num_input_tokens_seen": 8364111616, "step": 29410, "train_runtime": 286000.2778, "train_tokens_per_second": 29245.117 }, { "epoch": 1.0409370045134196, "grad_norm": 0.6015625, "learning_rate": 2.518356464557682e-05, "loss": 0.38805246353149414, "num_input_tokens_seen": 8366962112, "step": 29420, "train_runtime": 286097.6714, "train_tokens_per_second": 29245.125 }, { "epoch": 1.0412908247771484, "grad_norm": 0.60546875, "learning_rate": 2.5180370909796718e-05, "loss": 0.39016094207763674, "num_input_tokens_seen": 8369782848, "step": 29430, "train_runtime": 286190.9234, "train_tokens_per_second": 29245.452 }, { "epoch": 1.0416446450408774, "grad_norm": 0.59375, "learning_rate": 2.5177178388780527e-05, "loss": 0.38773393630981445, "num_input_tokens_seen": 8372579840, "step": 29440, "train_runtime": 286283.5771, "train_tokens_per_second": 29245.757 }, { "epoch": 1.0419984653046062, "grad_norm": 0.609375, "learning_rate": 2.5173987081758372e-05, "loss": 0.3923208713531494, "num_input_tokens_seen": 8375406144, "step": 29450, "train_runtime": 286378.8227, "train_tokens_per_second": 29245.899 }, { "epoch": 1.042352285568335, "grad_norm": 0.60546875, "learning_rate": 2.5170796987961044e-05, "loss": 0.39222288131713867, "num_input_tokens_seen": 8378244928, "step": 29460, "train_runtime": 286473.6574, "train_tokens_per_second": 29246.127 }, { "epoch": 1.0427061058320637, "grad_norm": 0.58984375, "learning_rate": 2.516760810662004e-05, "loss": 0.3883936405181885, "num_input_tokens_seen": 8381078592, "step": 29470, "train_runtime": 286570.4073, "train_tokens_per_second": 29246.141 }, { "epoch": 1.0430599260957925, "grad_norm": 0.5859375, "learning_rate": 2.5164420436967517e-05, "loss": 0.38690016269683836, "num_input_tokens_seen": 8383939776, "step": 29480, "train_runtime": 286668.4832, "train_tokens_per_second": 29246.116 }, { "epoch": 1.0434137463595212, "grad_norm": 0.59375, "learning_rate": 2.516123397823632e-05, "loss": 0.38701939582824707, "num_input_tokens_seen": 8386789760, "step": 29490, "train_runtime": 286765.5134, "train_tokens_per_second": 29246.159 }, { "epoch": 1.04376756662325, "grad_norm": 0.6171875, "learning_rate": 2.5158048729659988e-05, "loss": 0.3961660146713257, "num_input_tokens_seen": 8389647168, "step": 29500, "train_runtime": 286863.4687, "train_tokens_per_second": 29246.133 }, { "epoch": 1.0441213868869788, "grad_norm": 0.6015625, "learning_rate": 2.5154864690472714e-05, "loss": 0.3914198398590088, "num_input_tokens_seen": 8392480128, "step": 29510, "train_runtime": 286960.4671, "train_tokens_per_second": 29246.12 }, { "epoch": 1.0444752071507075, "grad_norm": 0.62890625, "learning_rate": 2.5151681859909383e-05, "loss": 0.3919799566268921, "num_input_tokens_seen": 8395303808, "step": 29520, "train_runtime": 287057.03, "train_tokens_per_second": 29246.118 }, { "epoch": 1.0448290274144363, "grad_norm": 0.6015625, "learning_rate": 2.5148500237205564e-05, "loss": 0.3953500986099243, "num_input_tokens_seen": 8398207104, "step": 29530, "train_runtime": 287159.2559, "train_tokens_per_second": 29245.817 }, { "epoch": 1.045182847678165, "grad_norm": 0.59765625, "learning_rate": 2.514531982159748e-05, "loss": 0.39100074768066406, "num_input_tokens_seen": 8401092352, "step": 29540, "train_runtime": 287258.6658, "train_tokens_per_second": 29245.74 }, { "epoch": 1.0455366679418938, "grad_norm": 0.61328125, "learning_rate": 2.5142140612322056e-05, "loss": 0.392481255531311, "num_input_tokens_seen": 8403973376, "step": 29550, "train_runtime": 287358.0226, "train_tokens_per_second": 29245.654 }, { "epoch": 1.0458904882056226, "grad_norm": 0.61328125, "learning_rate": 2.5138962608616883e-05, "loss": 0.39355695247650146, "num_input_tokens_seen": 8406783168, "step": 29560, "train_runtime": 287451.1813, "train_tokens_per_second": 29245.951 }, { "epoch": 1.0462443084693513, "grad_norm": 0.58984375, "learning_rate": 2.513578580972022e-05, "loss": 0.38819451332092286, "num_input_tokens_seen": 8409632128, "step": 29570, "train_runtime": 287548.4739, "train_tokens_per_second": 29245.963 }, { "epoch": 1.0465981287330801, "grad_norm": 0.6171875, "learning_rate": 2.5132610214871e-05, "loss": 0.3934628486633301, "num_input_tokens_seen": 8412488576, "step": 29580, "train_runtime": 287646.1058, "train_tokens_per_second": 29245.967 }, { "epoch": 1.0469519489968089, "grad_norm": 0.6171875, "learning_rate": 2.5129435823308835e-05, "loss": 0.38758509159088134, "num_input_tokens_seen": 8415376256, "step": 29590, "train_runtime": 287744.4316, "train_tokens_per_second": 29246.009 }, { "epoch": 1.0473057692605379, "grad_norm": 0.58203125, "learning_rate": 2.5126262634274012e-05, "loss": 0.3935369968414307, "num_input_tokens_seen": 8418174016, "step": 29600, "train_runtime": 287840.7621, "train_tokens_per_second": 29245.941 }, { "epoch": 1.0476595895242666, "grad_norm": 0.60546875, "learning_rate": 2.512309064700748e-05, "loss": 0.39109344482421876, "num_input_tokens_seen": 8420998912, "step": 29610, "train_runtime": 287937.6684, "train_tokens_per_second": 29245.909 }, { "epoch": 1.0480134097879954, "grad_norm": 0.59765625, "learning_rate": 2.511991986075086e-05, "loss": 0.3876230239868164, "num_input_tokens_seen": 8423861184, "step": 29620, "train_runtime": 288034.9024, "train_tokens_per_second": 29245.974 }, { "epoch": 1.0483672300517242, "grad_norm": 0.6015625, "learning_rate": 2.511675027474645e-05, "loss": 0.39133505821228026, "num_input_tokens_seen": 8426761344, "step": 29630, "train_runtime": 288133.4812, "train_tokens_per_second": 29246.033 }, { "epoch": 1.048721050315453, "grad_norm": 0.6171875, "learning_rate": 2.5113581888237215e-05, "loss": 0.39363951683044435, "num_input_tokens_seen": 8429587008, "step": 29640, "train_runtime": 288229.0876, "train_tokens_per_second": 29246.136 }, { "epoch": 1.0490748705791817, "grad_norm": 0.59765625, "learning_rate": 2.5110414700466782e-05, "loss": 0.38858904838562014, "num_input_tokens_seen": 8432394048, "step": 29650, "train_runtime": 288325.6057, "train_tokens_per_second": 29246.081 }, { "epoch": 1.0494286908429105, "grad_norm": 0.59375, "learning_rate": 2.5107248710679447e-05, "loss": 0.3939572095870972, "num_input_tokens_seen": 8435300096, "step": 29660, "train_runtime": 288424.8863, "train_tokens_per_second": 29246.09 }, { "epoch": 1.0497825111066392, "grad_norm": 0.60546875, "learning_rate": 2.5104083918120187e-05, "loss": 0.3967156887054443, "num_input_tokens_seen": 8438190336, "step": 29670, "train_runtime": 288525.1346, "train_tokens_per_second": 29245.945 }, { "epoch": 1.050136331370368, "grad_norm": 0.60546875, "learning_rate": 2.5100920322034615e-05, "loss": 0.39824814796447755, "num_input_tokens_seen": 8441038080, "step": 29680, "train_runtime": 288623.869, "train_tokens_per_second": 29245.807 }, { "epoch": 1.0504901516340968, "grad_norm": 0.62109375, "learning_rate": 2.5097757921669047e-05, "loss": 0.3882847785949707, "num_input_tokens_seen": 8443878784, "step": 29690, "train_runtime": 288721.6497, "train_tokens_per_second": 29245.742 }, { "epoch": 1.0508439718978255, "grad_norm": 0.6015625, "learning_rate": 2.509459671627043e-05, "loss": 0.39636979103088377, "num_input_tokens_seen": 8446693824, "step": 29700, "train_runtime": 288816.1708, "train_tokens_per_second": 29245.917 }, { "epoch": 1.0511977921615543, "grad_norm": 0.59375, "learning_rate": 2.50914367050864e-05, "loss": 0.39093470573425293, "num_input_tokens_seen": 8449562112, "step": 29710, "train_runtime": 288914.1834, "train_tokens_per_second": 29245.924 }, { "epoch": 1.051551612425283, "grad_norm": 0.6015625, "learning_rate": 2.5088277887365236e-05, "loss": 0.3928231239318848, "num_input_tokens_seen": 8452375104, "step": 29720, "train_runtime": 289009.2335, "train_tokens_per_second": 29246.038 }, { "epoch": 1.0519054326890118, "grad_norm": 0.578125, "learning_rate": 2.5085120262355895e-05, "loss": 0.3927906513214111, "num_input_tokens_seen": 8455174848, "step": 29730, "train_runtime": 289102.6452, "train_tokens_per_second": 29246.273 }, { "epoch": 1.0522592529527406, "grad_norm": 0.58984375, "learning_rate": 2.5081963829307987e-05, "loss": 0.3902306079864502, "num_input_tokens_seen": 8458032256, "step": 29740, "train_runtime": 289202.9291, "train_tokens_per_second": 29246.012 }, { "epoch": 1.0526130732164694, "grad_norm": 0.60546875, "learning_rate": 2.507880858747178e-05, "loss": 0.3920453548431396, "num_input_tokens_seen": 8460895680, "step": 29750, "train_runtime": 289299.0348, "train_tokens_per_second": 29246.194 }, { "epoch": 1.0529668934801983, "grad_norm": 0.59765625, "learning_rate": 2.5075654536098213e-05, "loss": 0.3894463300704956, "num_input_tokens_seen": 8463737536, "step": 29760, "train_runtime": 289395.1597, "train_tokens_per_second": 29246.3 }, { "epoch": 1.053320713743927, "grad_norm": 0.62890625, "learning_rate": 2.5072501674438875e-05, "loss": 0.39032104015350344, "num_input_tokens_seen": 8466601408, "step": 29770, "train_runtime": 289494.8925, "train_tokens_per_second": 29246.117 }, { "epoch": 1.0536745340076559, "grad_norm": 0.5703125, "learning_rate": 2.5069350001746017e-05, "loss": 0.3964667320251465, "num_input_tokens_seen": 8469489536, "step": 29780, "train_runtime": 289597.6525, "train_tokens_per_second": 29245.712 }, { "epoch": 1.0540283542713846, "grad_norm": 0.61328125, "learning_rate": 2.506619951727255e-05, "loss": 0.392992639541626, "num_input_tokens_seen": 8472355136, "step": 29790, "train_runtime": 289697.756, "train_tokens_per_second": 29245.498 }, { "epoch": 1.0543821745351134, "grad_norm": 0.59765625, "learning_rate": 2.5063050220272033e-05, "loss": 0.3889392137527466, "num_input_tokens_seen": 8475185664, "step": 29800, "train_runtime": 289793.0504, "train_tokens_per_second": 29245.648 }, { "epoch": 1.0547359947988422, "grad_norm": 0.6015625, "learning_rate": 2.5059902109998696e-05, "loss": 0.3884976863861084, "num_input_tokens_seen": 8478013504, "step": 29810, "train_runtime": 289887.7784, "train_tokens_per_second": 29245.847 }, { "epoch": 1.055089815062571, "grad_norm": 0.5703125, "learning_rate": 2.505675518570741e-05, "loss": 0.38781890869140623, "num_input_tokens_seen": 8480837376, "step": 29820, "train_runtime": 289984.0125, "train_tokens_per_second": 29245.879 }, { "epoch": 1.0554436353262997, "grad_norm": 0.61328125, "learning_rate": 2.505360944665371e-05, "loss": 0.38853533267974855, "num_input_tokens_seen": 8483714496, "step": 29830, "train_runtime": 290084.4879, "train_tokens_per_second": 29245.668 }, { "epoch": 1.0557974555900285, "grad_norm": 0.6015625, "learning_rate": 2.5050464892093777e-05, "loss": 0.389754056930542, "num_input_tokens_seen": 8486601152, "step": 29840, "train_runtime": 290185.1493, "train_tokens_per_second": 29245.47 }, { "epoch": 1.0561512758537572, "grad_norm": 0.60546875, "learning_rate": 2.5047321521284463e-05, "loss": 0.39377455711364745, "num_input_tokens_seen": 8489445376, "step": 29850, "train_runtime": 290283.3663, "train_tokens_per_second": 29245.373 }, { "epoch": 1.056505096117486, "grad_norm": 0.59375, "learning_rate": 2.5044179333483243e-05, "loss": 0.39593095779418946, "num_input_tokens_seen": 8492256192, "step": 29860, "train_runtime": 290378.1811, "train_tokens_per_second": 29245.504 }, { "epoch": 1.0568589163812148, "grad_norm": 0.62109375, "learning_rate": 2.5041038327948274e-05, "loss": 0.39040825366973875, "num_input_tokens_seen": 8495081984, "step": 29870, "train_runtime": 290474.3289, "train_tokens_per_second": 29245.552 }, { "epoch": 1.0572127366449435, "grad_norm": 0.60546875, "learning_rate": 2.5037898503938346e-05, "loss": 0.38826441764831543, "num_input_tokens_seen": 8497885824, "step": 29880, "train_runtime": 290569.0143, "train_tokens_per_second": 29245.671 }, { "epoch": 1.0575665569086723, "grad_norm": 0.59765625, "learning_rate": 2.5034759860712903e-05, "loss": 0.3920740604400635, "num_input_tokens_seen": 8500759808, "step": 29890, "train_runtime": 290667.3682, "train_tokens_per_second": 29245.663 }, { "epoch": 1.057920377172401, "grad_norm": 0.58984375, "learning_rate": 2.5031622397532047e-05, "loss": 0.3881415367126465, "num_input_tokens_seen": 8503626176, "step": 29900, "train_runtime": 290762.8635, "train_tokens_per_second": 29245.916 }, { "epoch": 1.0582741974361298, "grad_norm": 0.58203125, "learning_rate": 2.502848611365651e-05, "loss": 0.3909889221191406, "num_input_tokens_seen": 8506471488, "step": 29910, "train_runtime": 290862.676, "train_tokens_per_second": 29245.662 }, { "epoch": 1.0586280176998586, "grad_norm": 0.57421875, "learning_rate": 2.50253510083477e-05, "loss": 0.391344690322876, "num_input_tokens_seen": 8509321664, "step": 29920, "train_runtime": 290957.3531, "train_tokens_per_second": 29245.941 }, { "epoch": 1.0589818379635876, "grad_norm": 0.6171875, "learning_rate": 2.502221708086765e-05, "loss": 0.39687111377716067, "num_input_tokens_seen": 8512201600, "step": 29930, "train_runtime": 291055.5012, "train_tokens_per_second": 29245.974 }, { "epoch": 1.0593356582273163, "grad_norm": 0.59375, "learning_rate": 2.501908433047904e-05, "loss": 0.39103198051452637, "num_input_tokens_seen": 8515051712, "step": 29940, "train_runtime": 291153.0473, "train_tokens_per_second": 29245.965 }, { "epoch": 1.0596894784910451, "grad_norm": 0.6015625, "learning_rate": 2.501595275644521e-05, "loss": 0.39113216400146483, "num_input_tokens_seen": 8517857344, "step": 29950, "train_runtime": 291246.9731, "train_tokens_per_second": 29246.166 }, { "epoch": 1.0600432987547739, "grad_norm": 0.5859375, "learning_rate": 2.5012822358030136e-05, "loss": 0.39150357246398926, "num_input_tokens_seen": 8520674944, "step": 29960, "train_runtime": 291341.0129, "train_tokens_per_second": 29246.397 }, { "epoch": 1.0603971190185026, "grad_norm": 0.6015625, "learning_rate": 2.500969313449844e-05, "loss": 0.3969014406204224, "num_input_tokens_seen": 8523534848, "step": 29970, "train_runtime": 291439.628, "train_tokens_per_second": 29246.314 }, { "epoch": 1.0607509392822314, "grad_norm": 0.61328125, "learning_rate": 2.500656508511539e-05, "loss": 0.3912001609802246, "num_input_tokens_seen": 8526372224, "step": 29980, "train_runtime": 291535.8571, "train_tokens_per_second": 29246.393 }, { "epoch": 1.0611047595459602, "grad_norm": 0.59765625, "learning_rate": 2.500343820914689e-05, "loss": 0.3907221078872681, "num_input_tokens_seen": 8529185856, "step": 29990, "train_runtime": 291632.5782, "train_tokens_per_second": 29246.341 }, { "epoch": 1.061458579809689, "grad_norm": 0.6015625, "learning_rate": 2.5000312505859502e-05, "loss": 0.39152894020080564, "num_input_tokens_seen": 8532056576, "step": 30000, "train_runtime": 291732.4245, "train_tokens_per_second": 29246.172 }, { "epoch": 1.061458579809689, "eval_loss": 0.33860355615615845, "eval_runtime": 8.4123, "eval_samples_per_second": 474.068, "eval_steps_per_second": 3.804, "num_input_tokens_seen": 8532056576, "step": 30000 }, { "epoch": 1.0618124000734177, "grad_norm": 0.58984375, "learning_rate": 2.4997187974520408e-05, "loss": 0.38997437953948977, "num_input_tokens_seen": 8534891904, "step": 30010, "train_runtime": 291861.1082, "train_tokens_per_second": 29242.991 }, { "epoch": 1.0621662203371465, "grad_norm": 0.5859375, "learning_rate": 2.4994064614397442e-05, "loss": 0.3899205684661865, "num_input_tokens_seen": 8537737984, "step": 30020, "train_runtime": 291958.4356, "train_tokens_per_second": 29242.991 }, { "epoch": 1.0625200406008752, "grad_norm": 0.59765625, "learning_rate": 2.499094242475909e-05, "loss": 0.39099855422973634, "num_input_tokens_seen": 8540617600, "step": 30030, "train_runtime": 292059.5355, "train_tokens_per_second": 29242.728 }, { "epoch": 1.062873860864604, "grad_norm": 0.59375, "learning_rate": 2.4987821404874463e-05, "loss": 0.3915839672088623, "num_input_tokens_seen": 8543440512, "step": 30040, "train_runtime": 292156.2345, "train_tokens_per_second": 29242.712 }, { "epoch": 1.0632276811283328, "grad_norm": 0.57421875, "learning_rate": 2.49847015540133e-05, "loss": 0.39154677391052245, "num_input_tokens_seen": 8546294080, "step": 30050, "train_runtime": 292253.4059, "train_tokens_per_second": 29242.753 }, { "epoch": 1.0635815013920615, "grad_norm": 0.625, "learning_rate": 2.498158287144601e-05, "loss": 0.39322285652160643, "num_input_tokens_seen": 8549108480, "step": 30060, "train_runtime": 292348.6232, "train_tokens_per_second": 29242.855 }, { "epoch": 1.0639353216557903, "grad_norm": 0.6015625, "learning_rate": 2.4978465356443613e-05, "loss": 0.3957035541534424, "num_input_tokens_seen": 8551931200, "step": 30070, "train_runtime": 292445.378, "train_tokens_per_second": 29242.832 }, { "epoch": 1.064289141919519, "grad_norm": 0.61328125, "learning_rate": 2.4975349008277774e-05, "loss": 0.3882534265518188, "num_input_tokens_seen": 8554742592, "step": 30080, "train_runtime": 292542.3738, "train_tokens_per_second": 29242.747 }, { "epoch": 1.0646429621832478, "grad_norm": 0.59375, "learning_rate": 2.4972233826220794e-05, "loss": 0.3938943386077881, "num_input_tokens_seen": 8557563520, "step": 30090, "train_runtime": 292640.0618, "train_tokens_per_second": 29242.625 }, { "epoch": 1.0649967824469768, "grad_norm": 0.62109375, "learning_rate": 2.496911980954561e-05, "loss": 0.3884228467941284, "num_input_tokens_seen": 8560374208, "step": 30100, "train_runtime": 292735.4993, "train_tokens_per_second": 29242.693 }, { "epoch": 1.0653506027107056, "grad_norm": 0.60546875, "learning_rate": 2.496600695752579e-05, "loss": 0.39510948657989503, "num_input_tokens_seen": 8563199168, "step": 30110, "train_runtime": 292832.422, "train_tokens_per_second": 29242.661 }, { "epoch": 1.0657044229744344, "grad_norm": 0.60546875, "learning_rate": 2.4962895269435543e-05, "loss": 0.38712444305419924, "num_input_tokens_seen": 8566012160, "step": 30120, "train_runtime": 292928.7818, "train_tokens_per_second": 29242.644 }, { "epoch": 1.0660582432381631, "grad_norm": 0.58984375, "learning_rate": 2.49597847445497e-05, "loss": 0.38688387870788576, "num_input_tokens_seen": 8568842368, "step": 30130, "train_runtime": 293026.3627, "train_tokens_per_second": 29242.565 }, { "epoch": 1.0664120635018919, "grad_norm": 0.58203125, "learning_rate": 2.495667538214374e-05, "loss": 0.3950577974319458, "num_input_tokens_seen": 8571620096, "step": 30140, "train_runtime": 293118.5252, "train_tokens_per_second": 29242.847 }, { "epoch": 1.0667658837656206, "grad_norm": 0.59375, "learning_rate": 2.4953567181493754e-05, "loss": 0.39014949798583987, "num_input_tokens_seen": 8574470656, "step": 30150, "train_runtime": 293217.5208, "train_tokens_per_second": 29242.695 }, { "epoch": 1.0671197040293494, "grad_norm": 0.61328125, "learning_rate": 2.495046014187648e-05, "loss": 0.3923321723937988, "num_input_tokens_seen": 8577330752, "step": 30160, "train_runtime": 293318.587, "train_tokens_per_second": 29242.37 }, { "epoch": 1.0674735242930782, "grad_norm": 0.6015625, "learning_rate": 2.494735426256928e-05, "loss": 0.3899068355560303, "num_input_tokens_seen": 8580153856, "step": 30170, "train_runtime": 293413.7994, "train_tokens_per_second": 29242.503 }, { "epoch": 1.067827344556807, "grad_norm": 0.62109375, "learning_rate": 2.4944249542850143e-05, "loss": 0.385516619682312, "num_input_tokens_seen": 8582978368, "step": 30180, "train_runtime": 293510.5507, "train_tokens_per_second": 29242.487 }, { "epoch": 1.0681811648205357, "grad_norm": 0.58984375, "learning_rate": 2.494114598199769e-05, "loss": 0.39456958770751954, "num_input_tokens_seen": 8585800064, "step": 30190, "train_runtime": 293603.5382, "train_tokens_per_second": 29242.836 }, { "epoch": 1.0685349850842645, "grad_norm": 0.578125, "learning_rate": 2.493804357929118e-05, "loss": 0.3906743049621582, "num_input_tokens_seen": 8588638464, "step": 30200, "train_runtime": 293700.7107, "train_tokens_per_second": 29242.825 }, { "epoch": 1.0688888053479932, "grad_norm": 0.60546875, "learning_rate": 2.4934942334010474e-05, "loss": 0.3913243770599365, "num_input_tokens_seen": 8591515776, "step": 30210, "train_runtime": 293797.821, "train_tokens_per_second": 29242.953 }, { "epoch": 1.069242625611722, "grad_norm": 0.57421875, "learning_rate": 2.493184224543609e-05, "loss": 0.3911145210266113, "num_input_tokens_seen": 8594383872, "step": 30220, "train_runtime": 293897.5497, "train_tokens_per_second": 29242.788 }, { "epoch": 1.0695964458754508, "grad_norm": 0.6015625, "learning_rate": 2.4928743312849144e-05, "loss": 0.39372868537902833, "num_input_tokens_seen": 8597279040, "step": 30230, "train_runtime": 293996.6376, "train_tokens_per_second": 29242.78 }, { "epoch": 1.0699502661391795, "grad_norm": 0.56640625, "learning_rate": 2.4925645535531404e-05, "loss": 0.3938077688217163, "num_input_tokens_seen": 8600124544, "step": 30240, "train_runtime": 294094.6164, "train_tokens_per_second": 29242.713 }, { "epoch": 1.0703040864029083, "grad_norm": 0.59375, "learning_rate": 2.4922548912765234e-05, "loss": 0.38884749412536623, "num_input_tokens_seen": 8603017472, "step": 30250, "train_runtime": 294193.5933, "train_tokens_per_second": 29242.708 }, { "epoch": 1.070657906666637, "grad_norm": 0.58203125, "learning_rate": 2.4919453443833642e-05, "loss": 0.39093847274780275, "num_input_tokens_seen": 8605882240, "step": 30260, "train_runtime": 294290.5123, "train_tokens_per_second": 29242.812 }, { "epoch": 1.071011726930366, "grad_norm": 0.6015625, "learning_rate": 2.4916359128020264e-05, "loss": 0.3939260482788086, "num_input_tokens_seen": 8608732864, "step": 30270, "train_runtime": 294390.7041, "train_tokens_per_second": 29242.543 }, { "epoch": 1.0713655471940948, "grad_norm": 0.5859375, "learning_rate": 2.4913265964609342e-05, "loss": 0.3872772216796875, "num_input_tokens_seen": 8611570944, "step": 30280, "train_runtime": 294487.3008, "train_tokens_per_second": 29242.588 }, { "epoch": 1.0717193674578236, "grad_norm": 0.62890625, "learning_rate": 2.4910173952885737e-05, "loss": 0.38878345489501953, "num_input_tokens_seen": 8614446272, "step": 30290, "train_runtime": 294584.4167, "train_tokens_per_second": 29242.709 }, { "epoch": 1.0720731877215524, "grad_norm": 0.58984375, "learning_rate": 2.490708309213496e-05, "loss": 0.39459388256072997, "num_input_tokens_seen": 8617270976, "step": 30300, "train_runtime": 294680.9229, "train_tokens_per_second": 29242.717 }, { "epoch": 1.0724270079852811, "grad_norm": 0.62890625, "learning_rate": 2.4903993381643107e-05, "loss": 0.3869975805282593, "num_input_tokens_seen": 8620095744, "step": 30310, "train_runtime": 294776.3496, "train_tokens_per_second": 29242.834 }, { "epoch": 1.0727808282490099, "grad_norm": 0.609375, "learning_rate": 2.4900904820696916e-05, "loss": 0.39280712604522705, "num_input_tokens_seen": 8622953920, "step": 30320, "train_runtime": 294875.9985, "train_tokens_per_second": 29242.644 }, { "epoch": 1.0731346485127387, "grad_norm": 0.59765625, "learning_rate": 2.489781740858374e-05, "loss": 0.39142396450042727, "num_input_tokens_seen": 8625767808, "step": 30330, "train_runtime": 294972.992, "train_tokens_per_second": 29242.568 }, { "epoch": 1.0734884687764674, "grad_norm": 0.6015625, "learning_rate": 2.4894731144591545e-05, "loss": 0.39249932765960693, "num_input_tokens_seen": 8628583552, "step": 30340, "train_runtime": 295068.6476, "train_tokens_per_second": 29242.631 }, { "epoch": 1.0738422890401962, "grad_norm": 0.6015625, "learning_rate": 2.4891646028008923e-05, "loss": 0.39223670959472656, "num_input_tokens_seen": 8631424640, "step": 30350, "train_runtime": 295166.9822, "train_tokens_per_second": 29242.514 }, { "epoch": 1.074196109303925, "grad_norm": 0.58984375, "learning_rate": 2.4888562058125068e-05, "loss": 0.3923863410949707, "num_input_tokens_seen": 8634254720, "step": 30360, "train_runtime": 295263.0897, "train_tokens_per_second": 29242.581 }, { "epoch": 1.0745499295676537, "grad_norm": 0.58984375, "learning_rate": 2.488547923422981e-05, "loss": 0.39220428466796875, "num_input_tokens_seen": 8637137792, "step": 30370, "train_runtime": 295362.7215, "train_tokens_per_second": 29242.478 }, { "epoch": 1.0749037498313825, "grad_norm": 0.60546875, "learning_rate": 2.4882397555613582e-05, "loss": 0.3963631629943848, "num_input_tokens_seen": 8639975552, "step": 30380, "train_runtime": 295458.3872, "train_tokens_per_second": 29242.614 }, { "epoch": 1.0752575700951112, "grad_norm": 0.578125, "learning_rate": 2.487931702156743e-05, "loss": 0.3911131381988525, "num_input_tokens_seen": 8642767680, "step": 30390, "train_runtime": 295554.0562, "train_tokens_per_second": 29242.595 }, { "epoch": 1.07561139035884, "grad_norm": 0.59375, "learning_rate": 2.4876237631383026e-05, "loss": 0.3917921781539917, "num_input_tokens_seen": 8645595200, "step": 30400, "train_runtime": 295648.8771, "train_tokens_per_second": 29242.78 }, { "epoch": 1.0759652106225688, "grad_norm": 0.59765625, "learning_rate": 2.4873159384352647e-05, "loss": 0.3936903953552246, "num_input_tokens_seen": 8648428928, "step": 30410, "train_runtime": 295744.4223, "train_tokens_per_second": 29242.915 }, { "epoch": 1.0763190308862975, "grad_norm": 0.609375, "learning_rate": 2.487008227976918e-05, "loss": 0.3960005283355713, "num_input_tokens_seen": 8651207872, "step": 30420, "train_runtime": 295836.6888, "train_tokens_per_second": 29243.188 }, { "epoch": 1.0766728511500263, "grad_norm": 0.6015625, "learning_rate": 2.486700631692613e-05, "loss": 0.3870538711547852, "num_input_tokens_seen": 8654055616, "step": 30430, "train_runtime": 295933.39, "train_tokens_per_second": 29243.255 }, { "epoch": 1.0770266714137553, "grad_norm": 0.61328125, "learning_rate": 2.486393149511762e-05, "loss": 0.39339210987091067, "num_input_tokens_seen": 8656875840, "step": 30440, "train_runtime": 296029.6617, "train_tokens_per_second": 29243.272 }, { "epoch": 1.077380491677484, "grad_norm": 0.61328125, "learning_rate": 2.4860857813638365e-05, "loss": 0.3922523021697998, "num_input_tokens_seen": 8659703808, "step": 30450, "train_runtime": 296126.5514, "train_tokens_per_second": 29243.253 }, { "epoch": 1.0777343119412128, "grad_norm": 0.58984375, "learning_rate": 2.485778527178371e-05, "loss": 0.3936240911483765, "num_input_tokens_seen": 8662570112, "step": 30460, "train_runtime": 296224.2327, "train_tokens_per_second": 29243.287 }, { "epoch": 1.0780881322049416, "grad_norm": 0.578125, "learning_rate": 2.48547138688496e-05, "loss": 0.39096481800079347, "num_input_tokens_seen": 8665451456, "step": 30470, "train_runtime": 296326.1169, "train_tokens_per_second": 29242.956 }, { "epoch": 1.0784419524686704, "grad_norm": 0.61328125, "learning_rate": 2.485164360413258e-05, "loss": 0.39667930603027346, "num_input_tokens_seen": 8668232768, "step": 30480, "train_runtime": 296422.0746, "train_tokens_per_second": 29242.872 }, { "epoch": 1.0787957727323991, "grad_norm": 0.59765625, "learning_rate": 2.4848574476929823e-05, "loss": 0.3877444267272949, "num_input_tokens_seen": 8671091072, "step": 30490, "train_runtime": 296522.9176, "train_tokens_per_second": 29242.566 }, { "epoch": 1.079149592996128, "grad_norm": 0.59375, "learning_rate": 2.484550648653909e-05, "loss": 0.38915562629699707, "num_input_tokens_seen": 8673882240, "step": 30500, "train_runtime": 296615.8692, "train_tokens_per_second": 29242.812 }, { "epoch": 1.0795034132598567, "grad_norm": 0.578125, "learning_rate": 2.484243963225877e-05, "loss": 0.3889951229095459, "num_input_tokens_seen": 8676791552, "step": 30510, "train_runtime": 296715.2644, "train_tokens_per_second": 29242.822 }, { "epoch": 1.0798572335235854, "grad_norm": 0.59765625, "learning_rate": 2.4839373913387835e-05, "loss": 0.3849780082702637, "num_input_tokens_seen": 8679678208, "step": 30520, "train_runtime": 296812.6414, "train_tokens_per_second": 29242.953 }, { "epoch": 1.0802110537873142, "grad_norm": 0.609375, "learning_rate": 2.4836309329225873e-05, "loss": 0.3888519763946533, "num_input_tokens_seen": 8682504064, "step": 30530, "train_runtime": 296911.5965, "train_tokens_per_second": 29242.725 }, { "epoch": 1.080564874051043, "grad_norm": 0.58984375, "learning_rate": 2.483324587907309e-05, "loss": 0.3945186138153076, "num_input_tokens_seen": 8685337408, "step": 30540, "train_runtime": 297009.4306, "train_tokens_per_second": 29242.632 }, { "epoch": 1.0809186943147717, "grad_norm": 0.60546875, "learning_rate": 2.483018356223027e-05, "loss": 0.3936718463897705, "num_input_tokens_seen": 8688214592, "step": 30550, "train_runtime": 297107.9761, "train_tokens_per_second": 29242.616 }, { "epoch": 1.0812725145785005, "grad_norm": 0.61328125, "learning_rate": 2.4827122377998815e-05, "loss": 0.38601295948028563, "num_input_tokens_seen": 8691076224, "step": 30560, "train_runtime": 297204.5527, "train_tokens_per_second": 29242.743 }, { "epoch": 1.0816263348422293, "grad_norm": 0.609375, "learning_rate": 2.4824062325680737e-05, "loss": 0.38950190544128416, "num_input_tokens_seen": 8693898432, "step": 30570, "train_runtime": 297301.4989, "train_tokens_per_second": 29242.7 }, { "epoch": 1.081980155105958, "grad_norm": 0.61328125, "learning_rate": 2.4821003404578623e-05, "loss": 0.3913022518157959, "num_input_tokens_seen": 8696720704, "step": 30580, "train_runtime": 297396.1197, "train_tokens_per_second": 29242.886 }, { "epoch": 1.082333975369687, "grad_norm": 0.609375, "learning_rate": 2.4817945613995703e-05, "loss": 0.3862746238708496, "num_input_tokens_seen": 8699545408, "step": 30590, "train_runtime": 297488.9721, "train_tokens_per_second": 29243.253 }, { "epoch": 1.0826877956334158, "grad_norm": 0.58203125, "learning_rate": 2.481488895323577e-05, "loss": 0.3895613670349121, "num_input_tokens_seen": 8702389504, "step": 30600, "train_runtime": 297584.367, "train_tokens_per_second": 29243.436 }, { "epoch": 1.0830416158971445, "grad_norm": 0.609375, "learning_rate": 2.481183342160324e-05, "loss": 0.3940150737762451, "num_input_tokens_seen": 8705240000, "step": 30610, "train_runtime": 297682.6145, "train_tokens_per_second": 29243.36 }, { "epoch": 1.0833954361608733, "grad_norm": 0.60546875, "learning_rate": 2.4808779018403107e-05, "loss": 0.38983974456787107, "num_input_tokens_seen": 8708054656, "step": 30620, "train_runtime": 297779.6245, "train_tokens_per_second": 29243.286 }, { "epoch": 1.083749256424602, "grad_norm": 0.6171875, "learning_rate": 2.4805725742940987e-05, "loss": 0.3891287326812744, "num_input_tokens_seen": 8710902016, "step": 30630, "train_runtime": 297877.6803, "train_tokens_per_second": 29243.218 }, { "epoch": 1.0841030766883308, "grad_norm": 0.6171875, "learning_rate": 2.4802673594523086e-05, "loss": 0.3929009437561035, "num_input_tokens_seen": 8713767680, "step": 30640, "train_runtime": 297979.0452, "train_tokens_per_second": 29242.887 }, { "epoch": 1.0844568969520596, "grad_norm": 0.59765625, "learning_rate": 2.4799622572456198e-05, "loss": 0.38962838649749754, "num_input_tokens_seen": 8716583552, "step": 30650, "train_runtime": 298072.9508, "train_tokens_per_second": 29243.122 }, { "epoch": 1.0848107172157884, "grad_norm": 0.58984375, "learning_rate": 2.479657267604772e-05, "loss": 0.3892711639404297, "num_input_tokens_seen": 8719445056, "step": 30660, "train_runtime": 298169.2462, "train_tokens_per_second": 29243.274 }, { "epoch": 1.0851645374795171, "grad_norm": 0.5703125, "learning_rate": 2.4793523904605657e-05, "loss": 0.389400053024292, "num_input_tokens_seen": 8722262400, "step": 30670, "train_runtime": 298264.3982, "train_tokens_per_second": 29243.391 }, { "epoch": 1.085518357743246, "grad_norm": 0.5859375, "learning_rate": 2.479047625743859e-05, "loss": 0.39056341648101806, "num_input_tokens_seen": 8725083008, "step": 30680, "train_runtime": 298360.6569, "train_tokens_per_second": 29243.41 }, { "epoch": 1.0858721780069747, "grad_norm": 0.59375, "learning_rate": 2.4787429733855697e-05, "loss": 0.39096994400024415, "num_input_tokens_seen": 8727941952, "step": 30690, "train_runtime": 298459.0667, "train_tokens_per_second": 29243.347 }, { "epoch": 1.0862259982707034, "grad_norm": 0.6015625, "learning_rate": 2.478438433316677e-05, "loss": 0.3891505241394043, "num_input_tokens_seen": 8730815872, "step": 30700, "train_runtime": 298558.4874, "train_tokens_per_second": 29243.235 }, { "epoch": 1.0865798185344322, "grad_norm": 0.6484375, "learning_rate": 2.478134005468217e-05, "loss": 0.3924570083618164, "num_input_tokens_seen": 8733630720, "step": 30710, "train_runtime": 298654.5416, "train_tokens_per_second": 29243.254 }, { "epoch": 1.086933638798161, "grad_norm": 0.61328125, "learning_rate": 2.4778296897712865e-05, "loss": 0.3891456604003906, "num_input_tokens_seen": 8736459968, "step": 30720, "train_runtime": 298749.7811, "train_tokens_per_second": 29243.402 }, { "epoch": 1.0872874590618897, "grad_norm": 0.59375, "learning_rate": 2.4775254861570422e-05, "loss": 0.39409651756286623, "num_input_tokens_seen": 8739337600, "step": 30730, "train_runtime": 298847.9506, "train_tokens_per_second": 29243.425 }, { "epoch": 1.0876412793256185, "grad_norm": 0.63671875, "learning_rate": 2.4772213945566974e-05, "loss": 0.39090328216552733, "num_input_tokens_seen": 8742197120, "step": 30740, "train_runtime": 298946.2306, "train_tokens_per_second": 29243.376 }, { "epoch": 1.0879950995893473, "grad_norm": 0.59375, "learning_rate": 2.4769174149015266e-05, "loss": 0.39293441772460935, "num_input_tokens_seen": 8745038464, "step": 30750, "train_runtime": 299042.2485, "train_tokens_per_second": 29243.488 }, { "epoch": 1.0883489198530762, "grad_norm": 0.61328125, "learning_rate": 2.476613547122863e-05, "loss": 0.38801114559173583, "num_input_tokens_seen": 8747859200, "step": 30760, "train_runtime": 299135.2603, "train_tokens_per_second": 29243.825 }, { "epoch": 1.088702740116805, "grad_norm": 0.58203125, "learning_rate": 2.476309791152098e-05, "loss": 0.39524762630462645, "num_input_tokens_seen": 8750696064, "step": 30770, "train_runtime": 299234.0534, "train_tokens_per_second": 29243.65 }, { "epoch": 1.0890565603805338, "grad_norm": 0.61328125, "learning_rate": 2.4760061469206827e-05, "loss": 0.3922133445739746, "num_input_tokens_seen": 8753561088, "step": 30780, "train_runtime": 299333.4186, "train_tokens_per_second": 29243.514 }, { "epoch": 1.0894103806442625, "grad_norm": 0.609375, "learning_rate": 2.4757026143601268e-05, "loss": 0.39108834266662595, "num_input_tokens_seen": 8756371328, "step": 30790, "train_runtime": 299425.136, "train_tokens_per_second": 29243.942 }, { "epoch": 1.0897642009079913, "grad_norm": 0.5703125, "learning_rate": 2.475399193401998e-05, "loss": 0.3922947883605957, "num_input_tokens_seen": 8759267776, "step": 30800, "train_runtime": 299525.7874, "train_tokens_per_second": 29243.785 }, { "epoch": 1.09011802117172, "grad_norm": 0.62109375, "learning_rate": 2.475095883977924e-05, "loss": 0.3926777601242065, "num_input_tokens_seen": 8762098944, "step": 30810, "train_runtime": 299623.3458, "train_tokens_per_second": 29243.712 }, { "epoch": 1.0904718414354488, "grad_norm": 0.58984375, "learning_rate": 2.474792686019591e-05, "loss": 0.3913769245147705, "num_input_tokens_seen": 8764981312, "step": 30820, "train_runtime": 299724.0777, "train_tokens_per_second": 29243.501 }, { "epoch": 1.0908256616991776, "grad_norm": 0.6015625, "learning_rate": 2.474489599458742e-05, "loss": 0.39033284187316897, "num_input_tokens_seen": 8767852096, "step": 30830, "train_runtime": 299821.3553, "train_tokens_per_second": 29243.588 }, { "epoch": 1.0911794819629064, "grad_norm": 0.58984375, "learning_rate": 2.4741866242271804e-05, "loss": 0.3910961627960205, "num_input_tokens_seen": 8770695360, "step": 30840, "train_runtime": 299918.2345, "train_tokens_per_second": 29243.622 }, { "epoch": 1.0915333022266351, "grad_norm": 0.578125, "learning_rate": 2.473883760256767e-05, "loss": 0.39322586059570314, "num_input_tokens_seen": 8773544896, "step": 30850, "train_runtime": 300016.6479, "train_tokens_per_second": 29243.527 }, { "epoch": 1.091887122490364, "grad_norm": 0.6171875, "learning_rate": 2.4735810074794217e-05, "loss": 0.39442267417907717, "num_input_tokens_seen": 8776427072, "step": 30860, "train_runtime": 300117.4523, "train_tokens_per_second": 29243.308 }, { "epoch": 1.0922409427540927, "grad_norm": 0.59765625, "learning_rate": 2.473278365827123e-05, "loss": 0.39067783355712893, "num_input_tokens_seen": 8779285632, "step": 30870, "train_runtime": 300215.7366, "train_tokens_per_second": 29243.256 }, { "epoch": 1.0925947630178214, "grad_norm": 0.60546875, "learning_rate": 2.472975835231906e-05, "loss": 0.3886127471923828, "num_input_tokens_seen": 8782105792, "step": 30880, "train_runtime": 300311.6188, "train_tokens_per_second": 29243.31 }, { "epoch": 1.0929485832815502, "grad_norm": 0.609375, "learning_rate": 2.4726734156258647e-05, "loss": 0.39494221210479735, "num_input_tokens_seen": 8784940160, "step": 30890, "train_runtime": 300408.7423, "train_tokens_per_second": 29243.291 }, { "epoch": 1.093302403545279, "grad_norm": 0.6015625, "learning_rate": 2.4723711069411526e-05, "loss": 0.3886883735656738, "num_input_tokens_seen": 8787793280, "step": 30900, "train_runtime": 300506.1262, "train_tokens_per_second": 29243.308 }, { "epoch": 1.0936562238090077, "grad_norm": 0.6171875, "learning_rate": 2.472068909109979e-05, "loss": 0.3853020668029785, "num_input_tokens_seen": 8790602368, "step": 30910, "train_runtime": 300603.7881, "train_tokens_per_second": 29243.152 }, { "epoch": 1.0940100440727365, "grad_norm": 0.578125, "learning_rate": 2.471766822064614e-05, "loss": 0.3937170743942261, "num_input_tokens_seen": 8793475968, "step": 30920, "train_runtime": 300703.3074, "train_tokens_per_second": 29243.03 }, { "epoch": 1.0943638643364655, "grad_norm": 0.625, "learning_rate": 2.4714648457373824e-05, "loss": 0.3961985111236572, "num_input_tokens_seen": 8796281344, "step": 30930, "train_runtime": 300798.3225, "train_tokens_per_second": 29243.12 }, { "epoch": 1.0947176846001943, "grad_norm": 0.59765625, "learning_rate": 2.4711629800606694e-05, "loss": 0.39090895652770996, "num_input_tokens_seen": 8799133248, "step": 30940, "train_runtime": 300896.7396, "train_tokens_per_second": 29243.033 }, { "epoch": 1.095071504863923, "grad_norm": 0.59765625, "learning_rate": 2.4708612249669157e-05, "loss": 0.38562180995941164, "num_input_tokens_seen": 8801989376, "step": 30950, "train_runtime": 300995.2973, "train_tokens_per_second": 29242.946 }, { "epoch": 1.0954253251276518, "grad_norm": 0.5859375, "learning_rate": 2.4705595803886223e-05, "loss": 0.39196100234985354, "num_input_tokens_seen": 8804858112, "step": 30960, "train_runtime": 301095.1445, "train_tokens_per_second": 29242.777 }, { "epoch": 1.0957791453913805, "grad_norm": 0.59375, "learning_rate": 2.4702580462583468e-05, "loss": 0.3861811399459839, "num_input_tokens_seen": 8807736384, "step": 30970, "train_runtime": 301193.0945, "train_tokens_per_second": 29242.823 }, { "epoch": 1.0961329656551093, "grad_norm": 0.6015625, "learning_rate": 2.4699566225087032e-05, "loss": 0.39705095291137693, "num_input_tokens_seen": 8810558976, "step": 30980, "train_runtime": 301286.9113, "train_tokens_per_second": 29243.086 }, { "epoch": 1.096486785918838, "grad_norm": 0.578125, "learning_rate": 2.4696553090723644e-05, "loss": 0.3898041248321533, "num_input_tokens_seen": 8813443392, "step": 30990, "train_runtime": 301385.8839, "train_tokens_per_second": 29243.053 }, { "epoch": 1.0968406061825668, "grad_norm": 0.59375, "learning_rate": 2.4693541058820606e-05, "loss": 0.39616055488586427, "num_input_tokens_seen": 8816337728, "step": 31000, "train_runtime": 301485.4949, "train_tokens_per_second": 29242.991 }, { "epoch": 1.0971944264462956, "grad_norm": 0.60546875, "learning_rate": 2.4690530128705798e-05, "loss": 0.39245381355285647, "num_input_tokens_seen": 8819114624, "step": 31010, "train_runtime": 301576.6941, "train_tokens_per_second": 29243.356 }, { "epoch": 1.0975482467100244, "grad_norm": 0.59765625, "learning_rate": 2.4687520299707655e-05, "loss": 0.3932775020599365, "num_input_tokens_seen": 8821949056, "step": 31020, "train_runtime": 301674.1395, "train_tokens_per_second": 29243.306 }, { "epoch": 1.0979020669737531, "grad_norm": 0.59765625, "learning_rate": 2.4684511571155208e-05, "loss": 0.39643881320953367, "num_input_tokens_seen": 8824721216, "step": 31030, "train_runtime": 301769.5844, "train_tokens_per_second": 29243.243 }, { "epoch": 1.098255887237482, "grad_norm": 0.59375, "learning_rate": 2.4681503942378048e-05, "loss": 0.3923227787017822, "num_input_tokens_seen": 8827554688, "step": 31040, "train_runtime": 301866.2976, "train_tokens_per_second": 29243.26 }, { "epoch": 1.0986097075012107, "grad_norm": 0.59375, "learning_rate": 2.4678497412706344e-05, "loss": 0.3933370590209961, "num_input_tokens_seen": 8830366976, "step": 31050, "train_runtime": 301964.2767, "train_tokens_per_second": 29243.085 }, { "epoch": 1.0989635277649394, "grad_norm": 0.59765625, "learning_rate": 2.4675491981470825e-05, "loss": 0.39458398818969725, "num_input_tokens_seen": 8833177664, "step": 31060, "train_runtime": 302059.1236, "train_tokens_per_second": 29243.208 }, { "epoch": 1.0993173480286682, "grad_norm": 0.6171875, "learning_rate": 2.4672487648002803e-05, "loss": 0.3981754779815674, "num_input_tokens_seen": 8835960448, "step": 31070, "train_runtime": 302155.6452, "train_tokens_per_second": 29243.076 }, { "epoch": 1.099671168292397, "grad_norm": 0.5859375, "learning_rate": 2.4669484411634147e-05, "loss": 0.3921816349029541, "num_input_tokens_seen": 8838765440, "step": 31080, "train_runtime": 302252.7105, "train_tokens_per_second": 29242.965 }, { "epoch": 1.1000249885561257, "grad_norm": 0.578125, "learning_rate": 2.466648227169731e-05, "loss": 0.38764967918396, "num_input_tokens_seen": 8841659136, "step": 31090, "train_runtime": 302352.4358, "train_tokens_per_second": 29242.89 }, { "epoch": 1.1003788088198547, "grad_norm": 0.59765625, "learning_rate": 2.4663481227525304e-05, "loss": 0.3933694362640381, "num_input_tokens_seen": 8844499712, "step": 31100, "train_runtime": 302450.1423, "train_tokens_per_second": 29242.835 }, { "epoch": 1.1007326290835835, "grad_norm": 0.56640625, "learning_rate": 2.4660481278451704e-05, "loss": 0.3893763542175293, "num_input_tokens_seen": 8847438720, "step": 31110, "train_runtime": 302553.9717, "train_tokens_per_second": 29242.514 }, { "epoch": 1.1010864493473123, "grad_norm": 0.6015625, "learning_rate": 2.465748242381067e-05, "loss": 0.39050793647766113, "num_input_tokens_seen": 8850241344, "step": 31120, "train_runtime": 302648.4457, "train_tokens_per_second": 29242.646 }, { "epoch": 1.101440269611041, "grad_norm": 0.58203125, "learning_rate": 2.4654484662936915e-05, "loss": 0.3951855659484863, "num_input_tokens_seen": 8853025600, "step": 31130, "train_runtime": 302743.1624, "train_tokens_per_second": 29242.694 }, { "epoch": 1.1017940898747698, "grad_norm": 0.5859375, "learning_rate": 2.4651487995165712e-05, "loss": 0.38728985786437986, "num_input_tokens_seen": 8855847872, "step": 31140, "train_runtime": 302837.9759, "train_tokens_per_second": 29242.858 }, { "epoch": 1.1021479101384986, "grad_norm": 0.578125, "learning_rate": 2.4648492419832915e-05, "loss": 0.39473934173583985, "num_input_tokens_seen": 8858661760, "step": 31150, "train_runtime": 302933.4312, "train_tokens_per_second": 29242.932 }, { "epoch": 1.1025017304022273, "grad_norm": 0.59375, "learning_rate": 2.4645497936274937e-05, "loss": 0.3893791675567627, "num_input_tokens_seen": 8861430016, "step": 31160, "train_runtime": 303025.6612, "train_tokens_per_second": 29243.167 }, { "epoch": 1.102855550665956, "grad_norm": 0.609375, "learning_rate": 2.4642504543828753e-05, "loss": 0.39426631927490235, "num_input_tokens_seen": 8864291968, "step": 31170, "train_runtime": 303122.6259, "train_tokens_per_second": 29243.254 }, { "epoch": 1.1032093709296849, "grad_norm": 0.61328125, "learning_rate": 2.4639512241831904e-05, "loss": 0.3910731315612793, "num_input_tokens_seen": 8867147392, "step": 31180, "train_runtime": 303222.8837, "train_tokens_per_second": 29243.002 }, { "epoch": 1.1035631911934136, "grad_norm": 0.59765625, "learning_rate": 2.4636521029622485e-05, "loss": 0.3913859844207764, "num_input_tokens_seen": 8869901376, "step": 31190, "train_runtime": 303313.6855, "train_tokens_per_second": 29243.327 }, { "epoch": 1.1039170114571424, "grad_norm": 0.59375, "learning_rate": 2.463353090653917e-05, "loss": 0.39261603355407715, "num_input_tokens_seen": 8872737920, "step": 31200, "train_runtime": 303410.8262, "train_tokens_per_second": 29243.314 }, { "epoch": 1.1042708317208711, "grad_norm": 0.62109375, "learning_rate": 2.4630541871921187e-05, "loss": 0.3920186758041382, "num_input_tokens_seen": 8875596736, "step": 31210, "train_runtime": 303509.819, "train_tokens_per_second": 29243.195 }, { "epoch": 1.1046246519846, "grad_norm": 0.58203125, "learning_rate": 2.4627553925108313e-05, "loss": 0.3933091163635254, "num_input_tokens_seen": 8878420480, "step": 31220, "train_runtime": 303608.1885, "train_tokens_per_second": 29243.021 }, { "epoch": 1.1049784722483287, "grad_norm": 0.59375, "learning_rate": 2.4624567065440906e-05, "loss": 0.38926043510437014, "num_input_tokens_seen": 8881234816, "step": 31230, "train_runtime": 303703.4122, "train_tokens_per_second": 29243.118 }, { "epoch": 1.1053322925120574, "grad_norm": 0.62890625, "learning_rate": 2.4621581292259868e-05, "loss": 0.393221378326416, "num_input_tokens_seen": 8883989888, "step": 31240, "train_runtime": 303797.0095, "train_tokens_per_second": 29243.178 }, { "epoch": 1.1056861127757862, "grad_norm": 0.58203125, "learning_rate": 2.4618596604906673e-05, "loss": 0.389432954788208, "num_input_tokens_seen": 8886794368, "step": 31250, "train_runtime": 303891.7611, "train_tokens_per_second": 29243.288 }, { "epoch": 1.106039933039515, "grad_norm": 0.63671875, "learning_rate": 2.4615613002723347e-05, "loss": 0.3893982648849487, "num_input_tokens_seen": 8889625600, "step": 31260, "train_runtime": 303984.9766, "train_tokens_per_second": 29243.635 }, { "epoch": 1.106393753303244, "grad_norm": 0.61328125, "learning_rate": 2.4612630485052466e-05, "loss": 0.3953744888305664, "num_input_tokens_seen": 8892476480, "step": 31270, "train_runtime": 304083.0955, "train_tokens_per_second": 29243.574 }, { "epoch": 1.1067475735669727, "grad_norm": 0.59375, "learning_rate": 2.4609649051237175e-05, "loss": 0.3910569667816162, "num_input_tokens_seen": 8895300608, "step": 31280, "train_runtime": 304176.9587, "train_tokens_per_second": 29243.834 }, { "epoch": 1.1071013938307015, "grad_norm": 0.62109375, "learning_rate": 2.460666870062118e-05, "loss": 0.39440701007843015, "num_input_tokens_seen": 8898108736, "step": 31290, "train_runtime": 304272.1462, "train_tokens_per_second": 29243.915 }, { "epoch": 1.1074552140944303, "grad_norm": 0.59375, "learning_rate": 2.4603689432548728e-05, "loss": 0.38909599781036375, "num_input_tokens_seen": 8900946240, "step": 31300, "train_runtime": 304369.5293, "train_tokens_per_second": 29243.881 }, { "epoch": 1.107809034358159, "grad_norm": 0.640625, "learning_rate": 2.460071124636463e-05, "loss": 0.39116530418395995, "num_input_tokens_seen": 8903786752, "step": 31310, "train_runtime": 304467.0999, "train_tokens_per_second": 29243.839 }, { "epoch": 1.1081628546218878, "grad_norm": 0.58984375, "learning_rate": 2.4597734141414254e-05, "loss": 0.3890060901641846, "num_input_tokens_seen": 8906625472, "step": 31320, "train_runtime": 304565.2535, "train_tokens_per_second": 29243.735 }, { "epoch": 1.1085166748856166, "grad_norm": 0.58984375, "learning_rate": 2.4594758117043516e-05, "loss": 0.38748846054077146, "num_input_tokens_seen": 8909447808, "step": 31330, "train_runtime": 304660.9074, "train_tokens_per_second": 29243.817 }, { "epoch": 1.1088704951493453, "grad_norm": 0.609375, "learning_rate": 2.4591783172598898e-05, "loss": 0.39062840938568116, "num_input_tokens_seen": 8912378432, "step": 31340, "train_runtime": 304765.4424, "train_tokens_per_second": 29243.402 }, { "epoch": 1.109224315413074, "grad_norm": 0.57421875, "learning_rate": 2.458880930742742e-05, "loss": 0.39377598762512206, "num_input_tokens_seen": 8915198144, "step": 31350, "train_runtime": 304860.6907, "train_tokens_per_second": 29243.515 }, { "epoch": 1.1095781356768029, "grad_norm": 0.58984375, "learning_rate": 2.458583652087666e-05, "loss": 0.39347522258758544, "num_input_tokens_seen": 8918044992, "step": 31360, "train_runtime": 304956.3497, "train_tokens_per_second": 29243.677 }, { "epoch": 1.1099319559405316, "grad_norm": 0.609375, "learning_rate": 2.4582864812294757e-05, "loss": 0.3891420364379883, "num_input_tokens_seen": 8920859072, "step": 31370, "train_runtime": 305052.0724, "train_tokens_per_second": 29243.726 }, { "epoch": 1.1102857762042604, "grad_norm": 0.58984375, "learning_rate": 2.4579894181030387e-05, "loss": 0.39308948516845704, "num_input_tokens_seen": 8923675840, "step": 31380, "train_runtime": 305146.9005, "train_tokens_per_second": 29243.869 }, { "epoch": 1.1106395964679892, "grad_norm": 0.59765625, "learning_rate": 2.457692462643279e-05, "loss": 0.38944506645202637, "num_input_tokens_seen": 8926519936, "step": 31390, "train_runtime": 305243.7572, "train_tokens_per_second": 29243.907 }, { "epoch": 1.110993416731718, "grad_norm": 0.609375, "learning_rate": 2.4573956147851734e-05, "loss": 0.3937228679656982, "num_input_tokens_seen": 8929360768, "step": 31400, "train_runtime": 305340.8982, "train_tokens_per_second": 29243.907 }, { "epoch": 1.1113472369954467, "grad_norm": 0.6015625, "learning_rate": 2.4570988744637573e-05, "loss": 0.38926851749420166, "num_input_tokens_seen": 8932176064, "step": 31410, "train_runtime": 305435.1044, "train_tokens_per_second": 29244.104 }, { "epoch": 1.1117010572591755, "grad_norm": 0.5859375, "learning_rate": 2.4568022416141178e-05, "loss": 0.3905486106872559, "num_input_tokens_seen": 8935036928, "step": 31420, "train_runtime": 305530.6639, "train_tokens_per_second": 29244.321 }, { "epoch": 1.1120548775229042, "grad_norm": 0.58984375, "learning_rate": 2.4565057161713987e-05, "loss": 0.39151678085327146, "num_input_tokens_seen": 8937931264, "step": 31430, "train_runtime": 305630.9228, "train_tokens_per_second": 29244.198 }, { "epoch": 1.1124086977866332, "grad_norm": 0.6171875, "learning_rate": 2.4562092980707975e-05, "loss": 0.39062275886535647, "num_input_tokens_seen": 8940802240, "step": 31440, "train_runtime": 305727.964, "train_tokens_per_second": 29244.306 }, { "epoch": 1.112762518050362, "grad_norm": 0.6171875, "learning_rate": 2.455912987247566e-05, "loss": 0.38751611709594724, "num_input_tokens_seen": 8943665088, "step": 31450, "train_runtime": 305825.8198, "train_tokens_per_second": 29244.31 }, { "epoch": 1.1131163383140907, "grad_norm": 0.62890625, "learning_rate": 2.455616783637013e-05, "loss": 0.3899212837219238, "num_input_tokens_seen": 8946493184, "step": 31460, "train_runtime": 305924.4112, "train_tokens_per_second": 29244.13 }, { "epoch": 1.1134701585778195, "grad_norm": 0.59765625, "learning_rate": 2.4553206871745e-05, "loss": 0.39320101737976076, "num_input_tokens_seen": 8949372224, "step": 31470, "train_runtime": 306023.8287, "train_tokens_per_second": 29244.037 }, { "epoch": 1.1138239788415483, "grad_norm": 0.62109375, "learning_rate": 2.4550246977954422e-05, "loss": 0.39439618587493896, "num_input_tokens_seen": 8952211392, "step": 31480, "train_runtime": 306120.495, "train_tokens_per_second": 29244.077 }, { "epoch": 1.114177799105277, "grad_norm": 0.6171875, "learning_rate": 2.454728815435312e-05, "loss": 0.39246206283569335, "num_input_tokens_seen": 8955083968, "step": 31490, "train_runtime": 306220.7326, "train_tokens_per_second": 29243.885 }, { "epoch": 1.1145316193690058, "grad_norm": 0.60546875, "learning_rate": 2.4544330400296333e-05, "loss": 0.3932910919189453, "num_input_tokens_seen": 8957897152, "step": 31500, "train_runtime": 306315.9622, "train_tokens_per_second": 29243.978 }, { "epoch": 1.1148854396327346, "grad_norm": 0.59765625, "learning_rate": 2.4541373715139876e-05, "loss": 0.394961953163147, "num_input_tokens_seen": 8960745408, "step": 31510, "train_runtime": 306416.1858, "train_tokens_per_second": 29243.708 }, { "epoch": 1.1152392598964633, "grad_norm": 0.58203125, "learning_rate": 2.453841809824007e-05, "loss": 0.3874105930328369, "num_input_tokens_seen": 8963585856, "step": 31520, "train_runtime": 306514.2837, "train_tokens_per_second": 29243.615 }, { "epoch": 1.115593080160192, "grad_norm": 0.62109375, "learning_rate": 2.4535463548953808e-05, "loss": 0.38852055072784425, "num_input_tokens_seen": 8966380032, "step": 31530, "train_runtime": 306607.3951, "train_tokens_per_second": 29243.848 }, { "epoch": 1.1159469004239209, "grad_norm": 0.56640625, "learning_rate": 2.4532510066638515e-05, "loss": 0.3929260730743408, "num_input_tokens_seen": 8969227840, "step": 31540, "train_runtime": 306707.6512, "train_tokens_per_second": 29243.574 }, { "epoch": 1.1163007206876496, "grad_norm": 0.59375, "learning_rate": 2.452955765065216e-05, "loss": 0.39009239673614504, "num_input_tokens_seen": 8972045184, "step": 31550, "train_runtime": 306803.2046, "train_tokens_per_second": 29243.649 }, { "epoch": 1.1166545409513784, "grad_norm": 0.60546875, "learning_rate": 2.4526606300353234e-05, "loss": 0.3912105321884155, "num_input_tokens_seen": 8974774208, "step": 31560, "train_runtime": 306892.0353, "train_tokens_per_second": 29244.077 }, { "epoch": 1.1170083612151072, "grad_norm": 0.61328125, "learning_rate": 2.4523656015100795e-05, "loss": 0.3898076772689819, "num_input_tokens_seen": 8977614272, "step": 31570, "train_runtime": 306990.7283, "train_tokens_per_second": 29243.926 }, { "epoch": 1.117362181478836, "grad_norm": 0.57421875, "learning_rate": 2.4520706794254433e-05, "loss": 0.3923133373260498, "num_input_tokens_seen": 8980489344, "step": 31580, "train_runtime": 307090.6597, "train_tokens_per_second": 29243.772 }, { "epoch": 1.117716001742565, "grad_norm": 0.58984375, "learning_rate": 2.4517758637174266e-05, "loss": 0.3897665500640869, "num_input_tokens_seen": 8983301248, "step": 31590, "train_runtime": 307183.1044, "train_tokens_per_second": 29244.125 }, { "epoch": 1.1180698220062937, "grad_norm": 0.58984375, "learning_rate": 2.4514811543220957e-05, "loss": 0.3889149188995361, "num_input_tokens_seen": 8986166976, "step": 31600, "train_runtime": 307280.6148, "train_tokens_per_second": 29244.171 }, { "epoch": 1.1184236422700224, "grad_norm": 0.62109375, "learning_rate": 2.4511865511755717e-05, "loss": 0.3887796878814697, "num_input_tokens_seen": 8989008256, "step": 31610, "train_runtime": 307376.2393, "train_tokens_per_second": 29244.317 }, { "epoch": 1.1187774625337512, "grad_norm": 0.60546875, "learning_rate": 2.4508920542140266e-05, "loss": 0.3897322416305542, "num_input_tokens_seen": 8991880064, "step": 31620, "train_runtime": 307473.3479, "train_tokens_per_second": 29244.421 }, { "epoch": 1.11913128279748, "grad_norm": 0.62109375, "learning_rate": 2.4505976633736905e-05, "loss": 0.39379243850708007, "num_input_tokens_seen": 8994712896, "step": 31630, "train_runtime": 307569.3225, "train_tokens_per_second": 29244.506 }, { "epoch": 1.1194851030612087, "grad_norm": 0.60546875, "learning_rate": 2.4503033785908423e-05, "loss": 0.3944609880447388, "num_input_tokens_seen": 8997562816, "step": 31640, "train_runtime": 307667.1114, "train_tokens_per_second": 29244.474 }, { "epoch": 1.1198389233249375, "grad_norm": 0.59765625, "learning_rate": 2.4500091998018178e-05, "loss": 0.3878974437713623, "num_input_tokens_seen": 9000375744, "step": 31650, "train_runtime": 307761.4758, "train_tokens_per_second": 29244.647 }, { "epoch": 1.1201927435886663, "grad_norm": 0.6171875, "learning_rate": 2.4497151269430056e-05, "loss": 0.390798020362854, "num_input_tokens_seen": 9003194944, "step": 31660, "train_runtime": 307855.3584, "train_tokens_per_second": 29244.886 }, { "epoch": 1.120546563852395, "grad_norm": 0.61328125, "learning_rate": 2.4494211599508456e-05, "loss": 0.38975703716278076, "num_input_tokens_seen": 9006043008, "step": 31670, "train_runtime": 307952.3983, "train_tokens_per_second": 29244.919 }, { "epoch": 1.1209003841161238, "grad_norm": 0.5859375, "learning_rate": 2.4491272987618343e-05, "loss": 0.38620786666870116, "num_input_tokens_seen": 9008929856, "step": 31680, "train_runtime": 308054.1393, "train_tokens_per_second": 29244.632 }, { "epoch": 1.1212542043798526, "grad_norm": 0.59375, "learning_rate": 2.44883354331252e-05, "loss": 0.3955803871154785, "num_input_tokens_seen": 9011756992, "step": 31690, "train_runtime": 308149.6609, "train_tokens_per_second": 29244.741 }, { "epoch": 1.1216080246435813, "grad_norm": 0.65625, "learning_rate": 2.4485398935395037e-05, "loss": 0.39271974563598633, "num_input_tokens_seen": 9014561344, "step": 31700, "train_runtime": 308246.9085, "train_tokens_per_second": 29244.612 }, { "epoch": 1.12196184490731, "grad_norm": 0.5703125, "learning_rate": 2.44824634937944e-05, "loss": 0.39099879264831544, "num_input_tokens_seen": 9017416320, "step": 31710, "train_runtime": 308343.2466, "train_tokens_per_second": 29244.734 }, { "epoch": 1.1223156651710389, "grad_norm": 0.58984375, "learning_rate": 2.4479529107690374e-05, "loss": 0.3882007122039795, "num_input_tokens_seen": 9020226688, "step": 31720, "train_runtime": 308436.7245, "train_tokens_per_second": 29244.983 }, { "epoch": 1.1226694854347676, "grad_norm": 0.5859375, "learning_rate": 2.4476595776450564e-05, "loss": 0.389832067489624, "num_input_tokens_seen": 9023073728, "step": 31730, "train_runtime": 308535.1464, "train_tokens_per_second": 29244.881 }, { "epoch": 1.1230233056984964, "grad_norm": 0.60546875, "learning_rate": 2.4473663499443112e-05, "loss": 0.38889412879943847, "num_input_tokens_seen": 9025939264, "step": 31740, "train_runtime": 308633.2035, "train_tokens_per_second": 29244.874 }, { "epoch": 1.1233771259622252, "grad_norm": 0.6171875, "learning_rate": 2.4470732276036698e-05, "loss": 0.39253294467926025, "num_input_tokens_seen": 9028742144, "step": 31750, "train_runtime": 308727.6061, "train_tokens_per_second": 29245.011 }, { "epoch": 1.1237309462259542, "grad_norm": 0.59765625, "learning_rate": 2.4467802105600504e-05, "loss": 0.39611001014709474, "num_input_tokens_seen": 9031582592, "step": 31760, "train_runtime": 308825.3862, "train_tokens_per_second": 29244.949 }, { "epoch": 1.124084766489683, "grad_norm": 0.578125, "learning_rate": 2.4464872987504275e-05, "loss": 0.39229393005371094, "num_input_tokens_seen": 9034511360, "step": 31770, "train_runtime": 308928.8806, "train_tokens_per_second": 29244.632 }, { "epoch": 1.1244385867534117, "grad_norm": 0.60546875, "learning_rate": 2.446194492111825e-05, "loss": 0.3919085502624512, "num_input_tokens_seen": 9037327936, "step": 31780, "train_runtime": 309025.1635, "train_tokens_per_second": 29244.634 }, { "epoch": 1.1247924070171404, "grad_norm": 0.5859375, "learning_rate": 2.445901790581323e-05, "loss": 0.3887171268463135, "num_input_tokens_seen": 9040213888, "step": 31790, "train_runtime": 309122.2702, "train_tokens_per_second": 29244.784 }, { "epoch": 1.1251462272808692, "grad_norm": 0.5859375, "learning_rate": 2.445609194096051e-05, "loss": 0.39116415977478025, "num_input_tokens_seen": 9043037632, "step": 31800, "train_runtime": 309216.7238, "train_tokens_per_second": 29244.982 }, { "epoch": 1.125500047544598, "grad_norm": 0.61328125, "learning_rate": 2.4453167025931932e-05, "loss": 0.3889565706253052, "num_input_tokens_seen": 9045867008, "step": 31810, "train_runtime": 309311.2437, "train_tokens_per_second": 29245.193 }, { "epoch": 1.1258538678083267, "grad_norm": 0.578125, "learning_rate": 2.445024316009987e-05, "loss": 0.39447908401489257, "num_input_tokens_seen": 9048692928, "step": 31820, "train_runtime": 309408.0861, "train_tokens_per_second": 29245.173 }, { "epoch": 1.1262076880720555, "grad_norm": 0.58203125, "learning_rate": 2.4447320342837192e-05, "loss": 0.39153826236724854, "num_input_tokens_seen": 9051539264, "step": 31830, "train_runtime": 309504.2724, "train_tokens_per_second": 29245.281 }, { "epoch": 1.1265615083357843, "grad_norm": 0.6171875, "learning_rate": 2.444439857351732e-05, "loss": 0.39404993057250975, "num_input_tokens_seen": 9054397632, "step": 31840, "train_runtime": 309603.0445, "train_tokens_per_second": 29245.183 }, { "epoch": 1.126915328599513, "grad_norm": 0.59765625, "learning_rate": 2.4441477851514195e-05, "loss": 0.3889914512634277, "num_input_tokens_seen": 9057182848, "step": 31850, "train_runtime": 309698.2147, "train_tokens_per_second": 29245.189 }, { "epoch": 1.1272691488632418, "grad_norm": 0.609375, "learning_rate": 2.443855817620227e-05, "loss": 0.389780592918396, "num_input_tokens_seen": 9060000320, "step": 31860, "train_runtime": 309796.5989, "train_tokens_per_second": 29244.996 }, { "epoch": 1.1276229691269706, "grad_norm": 0.6171875, "learning_rate": 2.4435639546956534e-05, "loss": 0.39208064079284666, "num_input_tokens_seen": 9062860096, "step": 31870, "train_runtime": 309895.1214, "train_tokens_per_second": 29244.927 }, { "epoch": 1.1279767893906993, "grad_norm": 0.62890625, "learning_rate": 2.4432721963152482e-05, "loss": 0.3877956628799438, "num_input_tokens_seen": 9065692160, "step": 31880, "train_runtime": 309989.995, "train_tokens_per_second": 29245.112 }, { "epoch": 1.128330609654428, "grad_norm": 0.6328125, "learning_rate": 2.442980542416615e-05, "loss": 0.3879082679748535, "num_input_tokens_seen": 9068529280, "step": 31890, "train_runtime": 310083.0174, "train_tokens_per_second": 29245.488 }, { "epoch": 1.1286844299181569, "grad_norm": 0.5859375, "learning_rate": 2.4426889929374085e-05, "loss": 0.3877959966659546, "num_input_tokens_seen": 9071363904, "step": 31900, "train_runtime": 310176.5124, "train_tokens_per_second": 29245.812 }, { "epoch": 1.1290382501818856, "grad_norm": 0.5859375, "learning_rate": 2.442397547815336e-05, "loss": 0.388504695892334, "num_input_tokens_seen": 9074169152, "step": 31910, "train_runtime": 310272.4356, "train_tokens_per_second": 29245.811 }, { "epoch": 1.1293920704456144, "grad_norm": 0.6015625, "learning_rate": 2.4421062069881545e-05, "loss": 0.39296574592590333, "num_input_tokens_seen": 9077015808, "step": 31920, "train_runtime": 310371.6294, "train_tokens_per_second": 29245.636 }, { "epoch": 1.1297458907093434, "grad_norm": 0.6171875, "learning_rate": 2.4418149703936773e-05, "loss": 0.394504189491272, "num_input_tokens_seen": 9079837120, "step": 31930, "train_runtime": 310469.283, "train_tokens_per_second": 29245.525 }, { "epoch": 1.1300997109730722, "grad_norm": 0.60546875, "learning_rate": 2.4415238379697657e-05, "loss": 0.39421706199645995, "num_input_tokens_seen": 9082718400, "step": 31940, "train_runtime": 310567.7098, "train_tokens_per_second": 29245.534 }, { "epoch": 1.130453531236801, "grad_norm": 0.60546875, "learning_rate": 2.4412328096543355e-05, "loss": 0.3945643901824951, "num_input_tokens_seen": 9085524160, "step": 31950, "train_runtime": 310663.5349, "train_tokens_per_second": 29245.544 }, { "epoch": 1.1308073515005297, "grad_norm": 0.6015625, "learning_rate": 2.4409418853853517e-05, "loss": 0.39127635955810547, "num_input_tokens_seen": 9088371776, "step": 31960, "train_runtime": 310761.9664, "train_tokens_per_second": 29245.444 }, { "epoch": 1.1311611717642585, "grad_norm": 0.609375, "learning_rate": 2.440651065100833e-05, "loss": 0.3958575963973999, "num_input_tokens_seen": 9091224704, "step": 31970, "train_runtime": 310860.1038, "train_tokens_per_second": 29245.389 }, { "epoch": 1.1315149920279872, "grad_norm": 0.59765625, "learning_rate": 2.44036034873885e-05, "loss": 0.3935561180114746, "num_input_tokens_seen": 9094091584, "step": 31980, "train_runtime": 310958.2393, "train_tokens_per_second": 29245.379 }, { "epoch": 1.131868812291716, "grad_norm": 0.609375, "learning_rate": 2.440069736237523e-05, "loss": 0.38922598361968996, "num_input_tokens_seen": 9096930752, "step": 31990, "train_runtime": 311051.8854, "train_tokens_per_second": 29245.702 }, { "epoch": 1.1322226325554448, "grad_norm": 0.609375, "learning_rate": 2.439779227535026e-05, "loss": 0.3947909832000732, "num_input_tokens_seen": 9099779968, "step": 32000, "train_runtime": 311148.7996, "train_tokens_per_second": 29245.75 }, { "epoch": 1.1325764528191735, "grad_norm": 0.6328125, "learning_rate": 2.439488822569583e-05, "loss": 0.39146995544433594, "num_input_tokens_seen": 9102639104, "step": 32010, "train_runtime": 311244.7328, "train_tokens_per_second": 29245.922 }, { "epoch": 1.1329302730829023, "grad_norm": 0.63671875, "learning_rate": 2.4391985212794695e-05, "loss": 0.38922438621520994, "num_input_tokens_seen": 9105475008, "step": 32020, "train_runtime": 311343.203, "train_tokens_per_second": 29245.781 }, { "epoch": 1.133284093346631, "grad_norm": 0.640625, "learning_rate": 2.4389083236030146e-05, "loss": 0.39569735527038574, "num_input_tokens_seen": 9108276032, "step": 32030, "train_runtime": 311438.609, "train_tokens_per_second": 29245.815 }, { "epoch": 1.1336379136103598, "grad_norm": 0.578125, "learning_rate": 2.4386182294785952e-05, "loss": 0.3915308713912964, "num_input_tokens_seen": 9111154176, "step": 32040, "train_runtime": 311538.3799, "train_tokens_per_second": 29245.688 }, { "epoch": 1.1339917338740886, "grad_norm": 0.6015625, "learning_rate": 2.438328238844642e-05, "loss": 0.39095933437347413, "num_input_tokens_seen": 9113959488, "step": 32050, "train_runtime": 311631.6651, "train_tokens_per_second": 29245.935 }, { "epoch": 1.1343455541378173, "grad_norm": 0.6015625, "learning_rate": 2.4380383516396372e-05, "loss": 0.39179201126098634, "num_input_tokens_seen": 9116817472, "step": 32060, "train_runtime": 311727.0025, "train_tokens_per_second": 29246.159 }, { "epoch": 1.1346993744015461, "grad_norm": 0.6015625, "learning_rate": 2.4377485678021113e-05, "loss": 0.3900890350341797, "num_input_tokens_seen": 9119695808, "step": 32070, "train_runtime": 311824.6078, "train_tokens_per_second": 29246.235 }, { "epoch": 1.1350531946652749, "grad_norm": 0.5859375, "learning_rate": 2.4374588872706498e-05, "loss": 0.38930773735046387, "num_input_tokens_seen": 9122551872, "step": 32080, "train_runtime": 311923.1444, "train_tokens_per_second": 29246.153 }, { "epoch": 1.1354070149290036, "grad_norm": 0.5859375, "learning_rate": 2.4371693099838865e-05, "loss": 0.39177489280700684, "num_input_tokens_seen": 9125410176, "step": 32090, "train_runtime": 312024.172, "train_tokens_per_second": 29245.844 }, { "epoch": 1.1357608351927326, "grad_norm": 0.59765625, "learning_rate": 2.4368798358805075e-05, "loss": 0.3898944616317749, "num_input_tokens_seen": 9128252480, "step": 32100, "train_runtime": 312121.1576, "train_tokens_per_second": 29245.863 }, { "epoch": 1.1361146554564614, "grad_norm": 0.59375, "learning_rate": 2.4365904648992495e-05, "loss": 0.39085969924926756, "num_input_tokens_seen": 9131125248, "step": 32110, "train_runtime": 312216.5121, "train_tokens_per_second": 29246.132 }, { "epoch": 1.1364684757201902, "grad_norm": 0.61328125, "learning_rate": 2.436301196978899e-05, "loss": 0.3918031692504883, "num_input_tokens_seen": 9133973888, "step": 32120, "train_runtime": 312314.9469, "train_tokens_per_second": 29246.035 }, { "epoch": 1.136822295983919, "grad_norm": 0.59765625, "learning_rate": 2.436012032058296e-05, "loss": 0.38938679695129397, "num_input_tokens_seen": 9136808640, "step": 32130, "train_runtime": 312410.8143, "train_tokens_per_second": 29246.134 }, { "epoch": 1.1371761162476477, "grad_norm": 0.58203125, "learning_rate": 2.4357229700763283e-05, "loss": 0.3918055534362793, "num_input_tokens_seen": 9139679488, "step": 32140, "train_runtime": 312506.9487, "train_tokens_per_second": 29246.324 }, { "epoch": 1.1375299365113765, "grad_norm": 0.59765625, "learning_rate": 2.435434010971937e-05, "loss": 0.3938034772872925, "num_input_tokens_seen": 9142476992, "step": 32150, "train_runtime": 312600.8925, "train_tokens_per_second": 29246.484 }, { "epoch": 1.1378837567751052, "grad_norm": 0.609375, "learning_rate": 2.4351451546841118e-05, "loss": 0.3926145315170288, "num_input_tokens_seen": 9145374272, "step": 32160, "train_runtime": 312701.5992, "train_tokens_per_second": 29246.33 }, { "epoch": 1.138237577038834, "grad_norm": 0.59765625, "learning_rate": 2.434856401151895e-05, "loss": 0.39398512840270994, "num_input_tokens_seen": 9148207488, "step": 32170, "train_runtime": 312799.9376, "train_tokens_per_second": 29246.193 }, { "epoch": 1.1385913973025628, "grad_norm": 0.6015625, "learning_rate": 2.4345677503143778e-05, "loss": 0.39225115776062014, "num_input_tokens_seen": 9151062912, "step": 32180, "train_runtime": 312898.1305, "train_tokens_per_second": 29246.141 }, { "epoch": 1.1389452175662915, "grad_norm": 0.578125, "learning_rate": 2.4342792021107033e-05, "loss": 0.39346837997436523, "num_input_tokens_seen": 9153943872, "step": 32190, "train_runtime": 312995.9529, "train_tokens_per_second": 29246.205 }, { "epoch": 1.1392990378300203, "grad_norm": 0.625, "learning_rate": 2.433990756480064e-05, "loss": 0.3894240379333496, "num_input_tokens_seen": 9156787648, "step": 32200, "train_runtime": 313092.8912, "train_tokens_per_second": 29246.233 }, { "epoch": 1.139652858093749, "grad_norm": 0.62109375, "learning_rate": 2.433702413361703e-05, "loss": 0.394959020614624, "num_input_tokens_seen": 9159608000, "step": 32210, "train_runtime": 313188.7594, "train_tokens_per_second": 29246.286 }, { "epoch": 1.1400066783574778, "grad_norm": 0.60546875, "learning_rate": 2.4334141726949147e-05, "loss": 0.38838396072387693, "num_input_tokens_seen": 9162429568, "step": 32220, "train_runtime": 313284.2726, "train_tokens_per_second": 29246.376 }, { "epoch": 1.1403604986212066, "grad_norm": 0.59375, "learning_rate": 2.433126034419042e-05, "loss": 0.3915014982223511, "num_input_tokens_seen": 9165374848, "step": 32230, "train_runtime": 313386.5248, "train_tokens_per_second": 29246.231 }, { "epoch": 1.1407143188849354, "grad_norm": 0.62890625, "learning_rate": 2.4328379984734804e-05, "loss": 0.3841994762420654, "num_input_tokens_seen": 9168251840, "step": 32240, "train_runtime": 313485.7653, "train_tokens_per_second": 29246.15 }, { "epoch": 1.1410681391486643, "grad_norm": 0.59765625, "learning_rate": 2.4325500647976738e-05, "loss": 0.39467051029205324, "num_input_tokens_seen": 9171082368, "step": 32250, "train_runtime": 313581.2743, "train_tokens_per_second": 29246.269 }, { "epoch": 1.1414219594123929, "grad_norm": 0.59375, "learning_rate": 2.4322622333311165e-05, "loss": 0.38826684951782225, "num_input_tokens_seen": 9173994176, "step": 32260, "train_runtime": 313679.8139, "train_tokens_per_second": 29246.365 }, { "epoch": 1.1417757796761219, "grad_norm": 0.578125, "learning_rate": 2.4319745040133543e-05, "loss": 0.39078197479248045, "num_input_tokens_seen": 9176779456, "step": 32270, "train_runtime": 313775.6903, "train_tokens_per_second": 29246.305 }, { "epoch": 1.1421295999398506, "grad_norm": 0.60546875, "learning_rate": 2.431686876783981e-05, "loss": 0.39177799224853516, "num_input_tokens_seen": 9179582464, "step": 32280, "train_runtime": 313872.58, "train_tokens_per_second": 29246.207 }, { "epoch": 1.1424834202035794, "grad_norm": 0.58984375, "learning_rate": 2.431399351582642e-05, "loss": 0.3909552574157715, "num_input_tokens_seen": 9182380544, "step": 32290, "train_runtime": 313968.3097, "train_tokens_per_second": 29246.202 }, { "epoch": 1.1428372404673082, "grad_norm": 0.57421875, "learning_rate": 2.431111928349032e-05, "loss": 0.38819835186004636, "num_input_tokens_seen": 9185219008, "step": 32300, "train_runtime": 314066.3769, "train_tokens_per_second": 29246.107 }, { "epoch": 1.143191060731037, "grad_norm": 0.62109375, "learning_rate": 2.4308246070228956e-05, "loss": 0.3869027614593506, "num_input_tokens_seen": 9188072448, "step": 32310, "train_runtime": 314164.1727, "train_tokens_per_second": 29246.086 }, { "epoch": 1.1435448809947657, "grad_norm": 0.59765625, "learning_rate": 2.430537387544027e-05, "loss": 0.3925086259841919, "num_input_tokens_seen": 9190898560, "step": 32320, "train_runtime": 314261.412, "train_tokens_per_second": 29246.03 }, { "epoch": 1.1438987012584945, "grad_norm": 0.62109375, "learning_rate": 2.4302502698522707e-05, "loss": 0.3948864221572876, "num_input_tokens_seen": 9193738752, "step": 32330, "train_runtime": 314359.4429, "train_tokens_per_second": 29245.944 }, { "epoch": 1.1442525215222232, "grad_norm": 0.61328125, "learning_rate": 2.429963253887521e-05, "loss": 0.39093406200408937, "num_input_tokens_seen": 9196551616, "step": 32340, "train_runtime": 314455.2591, "train_tokens_per_second": 29245.978 }, { "epoch": 1.144606341785952, "grad_norm": 0.58984375, "learning_rate": 2.4296763395897212e-05, "loss": 0.38929646015167235, "num_input_tokens_seen": 9199440448, "step": 32350, "train_runtime": 314554.2006, "train_tokens_per_second": 29245.963 }, { "epoch": 1.1449601620496808, "grad_norm": 0.6171875, "learning_rate": 2.4293895268988646e-05, "loss": 0.3914044380187988, "num_input_tokens_seen": 9202239616, "step": 32360, "train_runtime": 314648.7416, "train_tokens_per_second": 29246.072 }, { "epoch": 1.1453139823134095, "grad_norm": 0.57421875, "learning_rate": 2.429102815754994e-05, "loss": 0.3884486198425293, "num_input_tokens_seen": 9205112192, "step": 32370, "train_runtime": 314749.3006, "train_tokens_per_second": 29245.854 }, { "epoch": 1.1456678025771383, "grad_norm": 0.59765625, "learning_rate": 2.428816206098202e-05, "loss": 0.3874303579330444, "num_input_tokens_seen": 9208002176, "step": 32380, "train_runtime": 314848.5331, "train_tokens_per_second": 29245.816 }, { "epoch": 1.146021622840867, "grad_norm": 0.58984375, "learning_rate": 2.42852969786863e-05, "loss": 0.39446771144866943, "num_input_tokens_seen": 9210931712, "step": 32390, "train_runtime": 314949.878, "train_tokens_per_second": 29245.707 }, { "epoch": 1.1463754431045958, "grad_norm": 0.59375, "learning_rate": 2.42824329100647e-05, "loss": 0.39263575077056884, "num_input_tokens_seen": 9213806912, "step": 32400, "train_runtime": 315047.3592, "train_tokens_per_second": 29245.784 }, { "epoch": 1.1467292633683246, "grad_norm": 0.61328125, "learning_rate": 2.4279569854519623e-05, "loss": 0.3886662483215332, "num_input_tokens_seen": 9216752256, "step": 32410, "train_runtime": 315155.1344, "train_tokens_per_second": 29245.128 }, { "epoch": 1.1470830836320536, "grad_norm": 0.609375, "learning_rate": 2.427670781145397e-05, "loss": 0.39008941650390627, "num_input_tokens_seen": 9219542528, "step": 32420, "train_runtime": 315248.5001, "train_tokens_per_second": 29245.318 }, { "epoch": 1.1474369038957821, "grad_norm": 0.61328125, "learning_rate": 2.4273846780271132e-05, "loss": 0.39446125030517576, "num_input_tokens_seen": 9222449664, "step": 32430, "train_runtime": 315350.6589, "train_tokens_per_second": 29245.062 }, { "epoch": 1.147790724159511, "grad_norm": 0.6171875, "learning_rate": 2.4270986760374985e-05, "loss": 0.38886094093322754, "num_input_tokens_seen": 9225259136, "step": 32440, "train_runtime": 315447.2086, "train_tokens_per_second": 29245.018 }, { "epoch": 1.1481445444232399, "grad_norm": 0.625, "learning_rate": 2.4268127751169922e-05, "loss": 0.3905381202697754, "num_input_tokens_seen": 9228095808, "step": 32450, "train_runtime": 315544.1472, "train_tokens_per_second": 29245.023 }, { "epoch": 1.1484983646869686, "grad_norm": 0.59765625, "learning_rate": 2.4265269752060792e-05, "loss": 0.3935687065124512, "num_input_tokens_seen": 9230960960, "step": 32460, "train_runtime": 315642.7926, "train_tokens_per_second": 29244.96 }, { "epoch": 1.1488521849506974, "grad_norm": 0.60546875, "learning_rate": 2.4262412762452966e-05, "loss": 0.38972697257995603, "num_input_tokens_seen": 9233762240, "step": 32470, "train_runtime": 315736.3797, "train_tokens_per_second": 29245.164 }, { "epoch": 1.1492060052144262, "grad_norm": 0.62890625, "learning_rate": 2.4259556781752288e-05, "loss": 0.385425329208374, "num_input_tokens_seen": 9236616256, "step": 32480, "train_runtime": 315832.7851, "train_tokens_per_second": 29245.274 }, { "epoch": 1.149559825478155, "grad_norm": 0.6015625, "learning_rate": 2.4256701809365084e-05, "loss": 0.39088973999023435, "num_input_tokens_seen": 9239468160, "step": 32490, "train_runtime": 315931.4306, "train_tokens_per_second": 29245.169 }, { "epoch": 1.1499136457418837, "grad_norm": 0.6015625, "learning_rate": 2.4253847844698192e-05, "loss": 0.3911791563034058, "num_input_tokens_seen": 9242305792, "step": 32500, "train_runtime": 316025.0078, "train_tokens_per_second": 29245.489 }, { "epoch": 1.1502674660056125, "grad_norm": 0.578125, "learning_rate": 2.4250994887158923e-05, "loss": 0.3907617568969727, "num_input_tokens_seen": 9245208512, "step": 32510, "train_runtime": 316125.8865, "train_tokens_per_second": 29245.338 }, { "epoch": 1.1506212862693412, "grad_norm": 0.58984375, "learning_rate": 2.4248142936155078e-05, "loss": 0.391890811920166, "num_input_tokens_seen": 9248095040, "step": 32520, "train_runtime": 316225.4804, "train_tokens_per_second": 29245.256 }, { "epoch": 1.15097510653307, "grad_norm": 0.60546875, "learning_rate": 2.424529199109494e-05, "loss": 0.3876257181167603, "num_input_tokens_seen": 9250908736, "step": 32530, "train_runtime": 316319.4834, "train_tokens_per_second": 29245.46 }, { "epoch": 1.1513289267967988, "grad_norm": 0.578125, "learning_rate": 2.42424420513873e-05, "loss": 0.38611156940460206, "num_input_tokens_seen": 9253798272, "step": 32540, "train_runtime": 316418.6449, "train_tokens_per_second": 29245.427 }, { "epoch": 1.1516827470605275, "grad_norm": 0.6015625, "learning_rate": 2.4239593116441407e-05, "loss": 0.394504976272583, "num_input_tokens_seen": 9256601152, "step": 32550, "train_runtime": 316514.7657, "train_tokens_per_second": 29245.401 }, { "epoch": 1.1520365673242563, "grad_norm": 0.5859375, "learning_rate": 2.423674518566701e-05, "loss": 0.38872513771057127, "num_input_tokens_seen": 9259409984, "step": 32560, "train_runtime": 316609.1938, "train_tokens_per_second": 29245.55 }, { "epoch": 1.152390387587985, "grad_norm": 0.5859375, "learning_rate": 2.4233898258474347e-05, "loss": 0.39398970603942873, "num_input_tokens_seen": 9262257600, "step": 32570, "train_runtime": 316708.237, "train_tokens_per_second": 29245.395 }, { "epoch": 1.1527442078517138, "grad_norm": 0.640625, "learning_rate": 2.4231052334274144e-05, "loss": 0.3939439058303833, "num_input_tokens_seen": 9265102848, "step": 32580, "train_runtime": 316803.5251, "train_tokens_per_second": 29245.58 }, { "epoch": 1.1530980281154428, "grad_norm": 0.6171875, "learning_rate": 2.4228207412477587e-05, "loss": 0.3905972957611084, "num_input_tokens_seen": 9267959744, "step": 32590, "train_runtime": 316900.841, "train_tokens_per_second": 29245.614 }, { "epoch": 1.1534518483791714, "grad_norm": 0.60546875, "learning_rate": 2.4225363492496376e-05, "loss": 0.3900750637054443, "num_input_tokens_seen": 9270835776, "step": 32600, "train_runtime": 317001.3905, "train_tokens_per_second": 29245.41 }, { "epoch": 1.1538056686429004, "grad_norm": 0.578125, "learning_rate": 2.422252057374267e-05, "loss": 0.38943114280700686, "num_input_tokens_seen": 9273656704, "step": 32610, "train_runtime": 317096.3531, "train_tokens_per_second": 29245.548 }, { "epoch": 1.1541594889066291, "grad_norm": 0.58984375, "learning_rate": 2.421967865562914e-05, "loss": 0.38686678409576414, "num_input_tokens_seen": 9276506176, "step": 32620, "train_runtime": 317195.089, "train_tokens_per_second": 29245.428 }, { "epoch": 1.1545133091703579, "grad_norm": 0.62109375, "learning_rate": 2.42168377375689e-05, "loss": 0.3897801399230957, "num_input_tokens_seen": 9279303040, "step": 32630, "train_runtime": 317290.2676, "train_tokens_per_second": 29245.47 }, { "epoch": 1.1548671294340866, "grad_norm": 0.6015625, "learning_rate": 2.421399781897558e-05, "loss": 0.3919291734695435, "num_input_tokens_seen": 9282128768, "step": 32640, "train_runtime": 317385.6821, "train_tokens_per_second": 29245.581 }, { "epoch": 1.1552209496978154, "grad_norm": 0.625, "learning_rate": 2.421115889926327e-05, "loss": 0.3873903751373291, "num_input_tokens_seen": 9284994944, "step": 32650, "train_runtime": 317481.1753, "train_tokens_per_second": 29245.813 }, { "epoch": 1.1555747699615442, "grad_norm": 0.6171875, "learning_rate": 2.4208320977846555e-05, "loss": 0.3920799732208252, "num_input_tokens_seen": 9287864128, "step": 32660, "train_runtime": 317583.2458, "train_tokens_per_second": 29245.447 }, { "epoch": 1.155928590225273, "grad_norm": 0.62109375, "learning_rate": 2.4205484054140493e-05, "loss": 0.3898750305175781, "num_input_tokens_seen": 9290722688, "step": 32670, "train_runtime": 317677.5102, "train_tokens_per_second": 29245.768 }, { "epoch": 1.1562824104890017, "grad_norm": 0.6015625, "learning_rate": 2.4202648127560616e-05, "loss": 0.3876809597015381, "num_input_tokens_seen": 9293619328, "step": 32680, "train_runtime": 317777.1099, "train_tokens_per_second": 29245.717 }, { "epoch": 1.1566362307527305, "grad_norm": 0.6171875, "learning_rate": 2.4199813197522947e-05, "loss": 0.3931845426559448, "num_input_tokens_seen": 9296439552, "step": 32690, "train_runtime": 317871.6796, "train_tokens_per_second": 29245.888 }, { "epoch": 1.1569900510164592, "grad_norm": 0.58984375, "learning_rate": 2.4196979263443985e-05, "loss": 0.39022073745727537, "num_input_tokens_seen": 9299260096, "step": 32700, "train_runtime": 317966.7076, "train_tokens_per_second": 29246.018 }, { "epoch": 1.157343871280188, "grad_norm": 0.5859375, "learning_rate": 2.4194146324740697e-05, "loss": 0.3913739681243896, "num_input_tokens_seen": 9302155392, "step": 32710, "train_runtime": 318065.7709, "train_tokens_per_second": 29246.012 }, { "epoch": 1.1576976915439168, "grad_norm": 0.58984375, "learning_rate": 2.4191314380830545e-05, "loss": 0.39194812774658205, "num_input_tokens_seen": 9305032704, "step": 32720, "train_runtime": 318165.6922, "train_tokens_per_second": 29245.871 }, { "epoch": 1.1580515118076455, "grad_norm": 0.59375, "learning_rate": 2.4188483431131453e-05, "loss": 0.3865678310394287, "num_input_tokens_seen": 9307922176, "step": 32730, "train_runtime": 318265.3656, "train_tokens_per_second": 29245.79 }, { "epoch": 1.1584053320713743, "grad_norm": 0.609375, "learning_rate": 2.4185653475061826e-05, "loss": 0.3931853771209717, "num_input_tokens_seen": 9310772928, "step": 32740, "train_runtime": 318363.1105, "train_tokens_per_second": 29245.766 }, { "epoch": 1.158759152335103, "grad_norm": 0.59375, "learning_rate": 2.418282451204055e-05, "loss": 0.3928253650665283, "num_input_tokens_seen": 9313617920, "step": 32750, "train_runtime": 318458.9538, "train_tokens_per_second": 29245.897 }, { "epoch": 1.159112972598832, "grad_norm": 0.609375, "learning_rate": 2.417999654148698e-05, "loss": 0.38882534503936766, "num_input_tokens_seen": 9316380864, "step": 32760, "train_runtime": 318552.7872, "train_tokens_per_second": 29245.956 }, { "epoch": 1.1594667928625608, "grad_norm": 0.59765625, "learning_rate": 2.4177169562820957e-05, "loss": 0.39058284759521483, "num_input_tokens_seen": 9319236608, "step": 32770, "train_runtime": 318648.7624, "train_tokens_per_second": 29246.11 }, { "epoch": 1.1598206131262896, "grad_norm": 0.60546875, "learning_rate": 2.417434357546278e-05, "loss": 0.3878857851028442, "num_input_tokens_seen": 9322090112, "step": 32780, "train_runtime": 318747.3846, "train_tokens_per_second": 29246.013 }, { "epoch": 1.1601744333900184, "grad_norm": 0.61328125, "learning_rate": 2.417151857883324e-05, "loss": 0.39049334526062013, "num_input_tokens_seen": 9324975552, "step": 32790, "train_runtime": 318847.8388, "train_tokens_per_second": 29245.848 }, { "epoch": 1.1605282536537471, "grad_norm": 0.6015625, "learning_rate": 2.416869457235358e-05, "loss": 0.3914969444274902, "num_input_tokens_seen": 9327805440, "step": 32800, "train_runtime": 318945.9341, "train_tokens_per_second": 29245.726 }, { "epoch": 1.1608820739174759, "grad_norm": 0.59375, "learning_rate": 2.416587155544554e-05, "loss": 0.3889345169067383, "num_input_tokens_seen": 9330690368, "step": 32810, "train_runtime": 319048.2211, "train_tokens_per_second": 29245.392 }, { "epoch": 1.1612358941812047, "grad_norm": 0.578125, "learning_rate": 2.416304952753132e-05, "loss": 0.38731536865234373, "num_input_tokens_seen": 9333535360, "step": 32820, "train_runtime": 319147.6692, "train_tokens_per_second": 29245.194 }, { "epoch": 1.1615897144449334, "grad_norm": 0.578125, "learning_rate": 2.4160228488033597e-05, "loss": 0.3884768486022949, "num_input_tokens_seen": 9336407552, "step": 32830, "train_runtime": 319245.1271, "train_tokens_per_second": 29245.263 }, { "epoch": 1.1619435347086622, "grad_norm": 0.59375, "learning_rate": 2.415740843637551e-05, "loss": 0.3937070846557617, "num_input_tokens_seen": 9339243968, "step": 32840, "train_runtime": 319341.3287, "train_tokens_per_second": 29245.334 }, { "epoch": 1.162297354972391, "grad_norm": 0.59375, "learning_rate": 2.4154589371980672e-05, "loss": 0.3886354923248291, "num_input_tokens_seen": 9342061376, "step": 32850, "train_runtime": 319437.9461, "train_tokens_per_second": 29245.309 }, { "epoch": 1.1626511752361197, "grad_norm": 0.59765625, "learning_rate": 2.415177129427319e-05, "loss": 0.3893561840057373, "num_input_tokens_seen": 9344861312, "step": 32860, "train_runtime": 319531.9223, "train_tokens_per_second": 29245.47 }, { "epoch": 1.1630049954998485, "grad_norm": 0.625, "learning_rate": 2.414895420267761e-05, "loss": 0.39281692504882815, "num_input_tokens_seen": 9347685952, "step": 32870, "train_runtime": 319628.6971, "train_tokens_per_second": 29245.453 }, { "epoch": 1.1633588157635772, "grad_norm": 0.59765625, "learning_rate": 2.414613809661895e-05, "loss": 0.38995981216430664, "num_input_tokens_seen": 9350535936, "step": 32880, "train_runtime": 319723.3539, "train_tokens_per_second": 29245.708 }, { "epoch": 1.163712636027306, "grad_norm": 0.609375, "learning_rate": 2.4143322975522726e-05, "loss": 0.3920666933059692, "num_input_tokens_seen": 9353344832, "step": 32890, "train_runtime": 319819.2069, "train_tokens_per_second": 29245.726 }, { "epoch": 1.1640664562910348, "grad_norm": 0.578125, "learning_rate": 2.414050883881489e-05, "loss": 0.39069352149963377, "num_input_tokens_seen": 9356229248, "step": 32900, "train_runtime": 319918.5376, "train_tokens_per_second": 29245.661 }, { "epoch": 1.1644202765547635, "grad_norm": 0.59375, "learning_rate": 2.413769568592188e-05, "loss": 0.39227004051208497, "num_input_tokens_seen": 9359088832, "step": 32910, "train_runtime": 320015.7986, "train_tokens_per_second": 29245.709 }, { "epoch": 1.1647740968184923, "grad_norm": 0.625, "learning_rate": 2.41348835162706e-05, "loss": 0.3868955850601196, "num_input_tokens_seen": 9361896832, "step": 32920, "train_runtime": 320107.2464, "train_tokens_per_second": 29246.126 }, { "epoch": 1.1651279170822213, "grad_norm": 0.58984375, "learning_rate": 2.4132072329288414e-05, "loss": 0.390920090675354, "num_input_tokens_seen": 9364762048, "step": 32930, "train_runtime": 320205.0195, "train_tokens_per_second": 29246.144 }, { "epoch": 1.16548173734595, "grad_norm": 0.625, "learning_rate": 2.4129262124403165e-05, "loss": 0.38875927925109866, "num_input_tokens_seen": 9367664576, "step": 32940, "train_runtime": 320307.9694, "train_tokens_per_second": 29245.806 }, { "epoch": 1.1658355576096788, "grad_norm": 0.58984375, "learning_rate": 2.4126452901043155e-05, "loss": 0.3936948299407959, "num_input_tokens_seen": 9370459584, "step": 32950, "train_runtime": 320404.2293, "train_tokens_per_second": 29245.742 }, { "epoch": 1.1661893778734076, "grad_norm": 0.62109375, "learning_rate": 2.412364465863714e-05, "loss": 0.38907370567321775, "num_input_tokens_seen": 9373308352, "step": 32960, "train_runtime": 320503.1836, "train_tokens_per_second": 29245.601 }, { "epoch": 1.1665431981371364, "grad_norm": 0.5859375, "learning_rate": 2.4120837396614367e-05, "loss": 0.38681161403656006, "num_input_tokens_seen": 9376113856, "step": 32970, "train_runtime": 320597.0282, "train_tokens_per_second": 29245.792 }, { "epoch": 1.1668970184008651, "grad_norm": 0.6171875, "learning_rate": 2.4118031114404525e-05, "loss": 0.3915836811065674, "num_input_tokens_seen": 9378983360, "step": 32980, "train_runtime": 320694.8308, "train_tokens_per_second": 29245.82 }, { "epoch": 1.167250838664594, "grad_norm": 0.6015625, "learning_rate": 2.411522581143778e-05, "loss": 0.39067468643188474, "num_input_tokens_seen": 9381851328, "step": 32990, "train_runtime": 320792.8586, "train_tokens_per_second": 29245.824 }, { "epoch": 1.1676046589283227, "grad_norm": 0.5859375, "learning_rate": 2.4112421487144762e-05, "loss": 0.3922233581542969, "num_input_tokens_seen": 9384704960, "step": 33000, "train_runtime": 320890.7299, "train_tokens_per_second": 29245.796 }, { "epoch": 1.1679584791920514, "grad_norm": 0.61328125, "learning_rate": 2.410961814095655e-05, "loss": 0.3909944534301758, "num_input_tokens_seen": 9387591232, "step": 33010, "train_runtime": 320989.9865, "train_tokens_per_second": 29245.745 }, { "epoch": 1.1683122994557802, "grad_norm": 0.61328125, "learning_rate": 2.410681577230471e-05, "loss": 0.390471076965332, "num_input_tokens_seen": 9390438848, "step": 33020, "train_runtime": 321089.079, "train_tokens_per_second": 29245.588 }, { "epoch": 1.168666119719509, "grad_norm": 0.59375, "learning_rate": 2.410401438062125e-05, "loss": 0.390967583656311, "num_input_tokens_seen": 9393268608, "step": 33030, "train_runtime": 321185.8725, "train_tokens_per_second": 29245.585 }, { "epoch": 1.1690199399832377, "grad_norm": 0.6171875, "learning_rate": 2.4101213965338647e-05, "loss": 0.3953163385391235, "num_input_tokens_seen": 9396069120, "step": 33040, "train_runtime": 321279.5651, "train_tokens_per_second": 29245.773 }, { "epoch": 1.1693737602469665, "grad_norm": 0.58984375, "learning_rate": 2.4098414525889836e-05, "loss": 0.38777520656585696, "num_input_tokens_seen": 9398898688, "step": 33050, "train_runtime": 321376.7717, "train_tokens_per_second": 29245.731 }, { "epoch": 1.1697275805106953, "grad_norm": 0.61328125, "learning_rate": 2.4095616061708218e-05, "loss": 0.3901984214782715, "num_input_tokens_seen": 9401752448, "step": 33060, "train_runtime": 321472.9812, "train_tokens_per_second": 29245.856 }, { "epoch": 1.170081400774424, "grad_norm": 0.62109375, "learning_rate": 2.4092818572227663e-05, "loss": 0.3925659656524658, "num_input_tokens_seen": 9404559936, "step": 33070, "train_runtime": 321570.0961, "train_tokens_per_second": 29245.754 }, { "epoch": 1.1704352210381528, "grad_norm": 0.578125, "learning_rate": 2.4090022056882475e-05, "loss": 0.3923038959503174, "num_input_tokens_seen": 9407359360, "step": 33080, "train_runtime": 321666.0551, "train_tokens_per_second": 29245.732 }, { "epoch": 1.1707890413018816, "grad_norm": 0.609375, "learning_rate": 2.408722651510744e-05, "loss": 0.39384050369262696, "num_input_tokens_seen": 9410227264, "step": 33090, "train_runtime": 321767.0328, "train_tokens_per_second": 29245.467 }, { "epoch": 1.1711428615656105, "grad_norm": 0.6015625, "learning_rate": 2.40844319463378e-05, "loss": 0.3934753179550171, "num_input_tokens_seen": 9413071936, "step": 33100, "train_runtime": 321865.6523, "train_tokens_per_second": 29245.345 }, { "epoch": 1.1714966818293393, "grad_norm": 0.609375, "learning_rate": 2.4081638350009247e-05, "loss": 0.3884658098220825, "num_input_tokens_seen": 9415914944, "step": 33110, "train_runtime": 321961.2524, "train_tokens_per_second": 29245.491 }, { "epoch": 1.171850502093068, "grad_norm": 0.5859375, "learning_rate": 2.407884572555794e-05, "loss": 0.39093215465545655, "num_input_tokens_seen": 9418758016, "step": 33120, "train_runtime": 322059.8125, "train_tokens_per_second": 29245.369 }, { "epoch": 1.1722043223567968, "grad_norm": 0.59765625, "learning_rate": 2.4076054072420486e-05, "loss": 0.39130733013153074, "num_input_tokens_seen": 9421605568, "step": 33130, "train_runtime": 322156.6887, "train_tokens_per_second": 29245.413 }, { "epoch": 1.1725581426205256, "grad_norm": 0.58203125, "learning_rate": 2.4073263390033957e-05, "loss": 0.39181196689605713, "num_input_tokens_seen": 9424470656, "step": 33140, "train_runtime": 322253.452, "train_tokens_per_second": 29245.523 }, { "epoch": 1.1729119628842544, "grad_norm": 0.6171875, "learning_rate": 2.407047367783588e-05, "loss": 0.3926100730895996, "num_input_tokens_seen": 9427328064, "step": 33150, "train_runtime": 322351.3235, "train_tokens_per_second": 29245.508 }, { "epoch": 1.1732657831479831, "grad_norm": 0.61328125, "learning_rate": 2.406768493526424e-05, "loss": 0.39453699588775637, "num_input_tokens_seen": 9430267776, "step": 33160, "train_runtime": 322453.8805, "train_tokens_per_second": 29245.323 }, { "epoch": 1.173619603411712, "grad_norm": 0.60546875, "learning_rate": 2.4064897161757468e-05, "loss": 0.39337542057037356, "num_input_tokens_seen": 9433076864, "step": 33170, "train_runtime": 322546.3481, "train_tokens_per_second": 29245.648 }, { "epoch": 1.1739734236754407, "grad_norm": 0.61328125, "learning_rate": 2.4062110356754464e-05, "loss": 0.39212806224823, "num_input_tokens_seen": 9435879104, "step": 33180, "train_runtime": 322640.9313, "train_tokens_per_second": 29245.76 }, { "epoch": 1.1743272439391694, "grad_norm": 0.625, "learning_rate": 2.4059324519694572e-05, "loss": 0.38807973861694334, "num_input_tokens_seen": 9438735936, "step": 33190, "train_runtime": 322737.4517, "train_tokens_per_second": 29245.865 }, { "epoch": 1.1746810642028982, "grad_norm": 0.61328125, "learning_rate": 2.40565396500176e-05, "loss": 0.3934789180755615, "num_input_tokens_seen": 9441674880, "step": 33200, "train_runtime": 322840.2738, "train_tokens_per_second": 29245.654 }, { "epoch": 1.175034884466627, "grad_norm": 0.5859375, "learning_rate": 2.40537557471638e-05, "loss": 0.3919606924057007, "num_input_tokens_seen": 9444507392, "step": 33210, "train_runtime": 322937.084, "train_tokens_per_second": 29245.658 }, { "epoch": 1.1753887047303557, "grad_norm": 0.6015625, "learning_rate": 2.4050972810573875e-05, "loss": 0.3910083770751953, "num_input_tokens_seen": 9447403584, "step": 33220, "train_runtime": 323038.894, "train_tokens_per_second": 29245.406 }, { "epoch": 1.1757425249940845, "grad_norm": 0.6015625, "learning_rate": 2.4048190839689003e-05, "loss": 0.39489221572875977, "num_input_tokens_seen": 9450276032, "step": 33230, "train_runtime": 323136.2946, "train_tokens_per_second": 29245.48 }, { "epoch": 1.1760963452578133, "grad_norm": 0.58203125, "learning_rate": 2.404540983395078e-05, "loss": 0.39011573791503906, "num_input_tokens_seen": 9453128704, "step": 33240, "train_runtime": 323233.1523, "train_tokens_per_second": 29245.542 }, { "epoch": 1.1764501655215422, "grad_norm": 0.5859375, "learning_rate": 2.404262979280129e-05, "loss": 0.38842086791992186, "num_input_tokens_seen": 9455938816, "step": 33250, "train_runtime": 323329.3394, "train_tokens_per_second": 29245.533 }, { "epoch": 1.1768039857852708, "grad_norm": 0.61328125, "learning_rate": 2.403985071568304e-05, "loss": 0.39597139358520506, "num_input_tokens_seen": 9458846912, "step": 33260, "train_runtime": 323431.0297, "train_tokens_per_second": 29245.329 }, { "epoch": 1.1771578060489998, "grad_norm": 0.6015625, "learning_rate": 2.4037072602039002e-05, "loss": 0.3884121894836426, "num_input_tokens_seen": 9461655808, "step": 33270, "train_runtime": 323527.0981, "train_tokens_per_second": 29245.327 }, { "epoch": 1.1775116263127285, "grad_norm": 0.62109375, "learning_rate": 2.4034295451312596e-05, "loss": 0.39089303016662597, "num_input_tokens_seen": 9464510336, "step": 33280, "train_runtime": 323624.5172, "train_tokens_per_second": 29245.344 }, { "epoch": 1.1778654465764573, "grad_norm": 0.578125, "learning_rate": 2.403151926294769e-05, "loss": 0.38807382583618166, "num_input_tokens_seen": 9467379904, "step": 33290, "train_runtime": 323721.2511, "train_tokens_per_second": 29245.469 }, { "epoch": 1.178219266840186, "grad_norm": 0.62890625, "learning_rate": 2.4028744036388606e-05, "loss": 0.39189863204956055, "num_input_tokens_seen": 9470173248, "step": 33300, "train_runtime": 323814.7964, "train_tokens_per_second": 29245.647 }, { "epoch": 1.1785730871039148, "grad_norm": 0.60546875, "learning_rate": 2.4025969771080115e-05, "loss": 0.39383530616760254, "num_input_tokens_seen": 9473054848, "step": 33310, "train_runtime": 323915.1414, "train_tokens_per_second": 29245.483 }, { "epoch": 1.1789269073676436, "grad_norm": 0.609375, "learning_rate": 2.402319646646742e-05, "loss": 0.3898460388183594, "num_input_tokens_seen": 9475877696, "step": 33320, "train_runtime": 324010.8769, "train_tokens_per_second": 29245.554 }, { "epoch": 1.1792807276313724, "grad_norm": 0.60546875, "learning_rate": 2.40204241219962e-05, "loss": 0.387637996673584, "num_input_tokens_seen": 9478680000, "step": 33330, "train_runtime": 324104.6018, "train_tokens_per_second": 29245.743 }, { "epoch": 1.1796345478951011, "grad_norm": 0.58203125, "learning_rate": 2.4017652737112568e-05, "loss": 0.38987891674041747, "num_input_tokens_seen": 9481559616, "step": 33340, "train_runtime": 324204.3136, "train_tokens_per_second": 29245.631 }, { "epoch": 1.17998836815883, "grad_norm": 0.578125, "learning_rate": 2.4014882311263073e-05, "loss": 0.38961448669433596, "num_input_tokens_seen": 9484425536, "step": 33350, "train_runtime": 324302.8261, "train_tokens_per_second": 29245.584 }, { "epoch": 1.1803421884225587, "grad_norm": 0.578125, "learning_rate": 2.4012112843894734e-05, "loss": 0.39429607391357424, "num_input_tokens_seen": 9487289024, "step": 33360, "train_runtime": 324400.6646, "train_tokens_per_second": 29245.591 }, { "epoch": 1.1806960086862874, "grad_norm": 0.6015625, "learning_rate": 2.400934433445499e-05, "loss": 0.39247570037841795, "num_input_tokens_seen": 9490138112, "step": 33370, "train_runtime": 324497.3767, "train_tokens_per_second": 29245.654 }, { "epoch": 1.1810498289500162, "grad_norm": 0.62890625, "learning_rate": 2.4006576782391752e-05, "loss": 0.38724794387817385, "num_input_tokens_seen": 9492945728, "step": 33380, "train_runtime": 324590.6473, "train_tokens_per_second": 29245.9 }, { "epoch": 1.181403649213745, "grad_norm": 0.61328125, "learning_rate": 2.400381018715336e-05, "loss": 0.3899810791015625, "num_input_tokens_seen": 9495778368, "step": 33390, "train_runtime": 324686.0745, "train_tokens_per_second": 29246.029 }, { "epoch": 1.1817574694774737, "grad_norm": 0.609375, "learning_rate": 2.40010445481886e-05, "loss": 0.3902117252349854, "num_input_tokens_seen": 9498635840, "step": 33400, "train_runtime": 324783.6944, "train_tokens_per_second": 29246.037 }, { "epoch": 1.1821112897412025, "grad_norm": 0.59375, "learning_rate": 2.399827986494671e-05, "loss": 0.38477678298950196, "num_input_tokens_seen": 9501464128, "step": 33410, "train_runtime": 324878.1467, "train_tokens_per_second": 29246.24 }, { "epoch": 1.1824651100049315, "grad_norm": 0.6015625, "learning_rate": 2.3995516136877368e-05, "loss": 0.3882612943649292, "num_input_tokens_seen": 9504287872, "step": 33420, "train_runtime": 324972.9569, "train_tokens_per_second": 29246.396 }, { "epoch": 1.18281893026866, "grad_norm": 0.61328125, "learning_rate": 2.3992753363430694e-05, "loss": 0.39034693241119384, "num_input_tokens_seen": 9507071424, "step": 33430, "train_runtime": 325065.6531, "train_tokens_per_second": 29246.619 }, { "epoch": 1.183172750532389, "grad_norm": 0.609375, "learning_rate": 2.3989991544057252e-05, "loss": 0.3888209342956543, "num_input_tokens_seen": 9509908096, "step": 33440, "train_runtime": 325160.0972, "train_tokens_per_second": 29246.848 }, { "epoch": 1.1835265707961178, "grad_norm": 0.59375, "learning_rate": 2.3987230678208044e-05, "loss": 0.39576475620269774, "num_input_tokens_seen": 9512749568, "step": 33450, "train_runtime": 325257.0272, "train_tokens_per_second": 29246.869 }, { "epoch": 1.1838803910598465, "grad_norm": 0.59375, "learning_rate": 2.3984470765334527e-05, "loss": 0.38622972965240476, "num_input_tokens_seen": 9515630272, "step": 33460, "train_runtime": 325356.6755, "train_tokens_per_second": 29246.765 }, { "epoch": 1.1842342113235753, "grad_norm": 0.59765625, "learning_rate": 2.398171180488859e-05, "loss": 0.39551146030426027, "num_input_tokens_seen": 9518488256, "step": 33470, "train_runtime": 325455.8428, "train_tokens_per_second": 29246.635 }, { "epoch": 1.184588031587304, "grad_norm": 0.59765625, "learning_rate": 2.3978953796322565e-05, "loss": 0.3946110248565674, "num_input_tokens_seen": 9521336768, "step": 33480, "train_runtime": 325553.9345, "train_tokens_per_second": 29246.573 }, { "epoch": 1.1849418518510328, "grad_norm": 0.6171875, "learning_rate": 2.3976196739089218e-05, "loss": 0.39379899501800536, "num_input_tokens_seen": 9524181696, "step": 33490, "train_runtime": 325652.0931, "train_tokens_per_second": 29246.493 }, { "epoch": 1.1852956721147616, "grad_norm": 0.60546875, "learning_rate": 2.397344063264177e-05, "loss": 0.3925729513168335, "num_input_tokens_seen": 9527027968, "step": 33500, "train_runtime": 325749.8174, "train_tokens_per_second": 29246.457 }, { "epoch": 1.1856494923784904, "grad_norm": 0.62109375, "learning_rate": 2.3970685476433867e-05, "loss": 0.38857645988464357, "num_input_tokens_seen": 9529800960, "step": 33510, "train_runtime": 325842.2382, "train_tokens_per_second": 29246.672 }, { "epoch": 1.1860033126422191, "grad_norm": 0.59375, "learning_rate": 2.396793126991961e-05, "loss": 0.39438643455505373, "num_input_tokens_seen": 9532695360, "step": 33520, "train_runtime": 325942.5265, "train_tokens_per_second": 29246.553 }, { "epoch": 1.186357132905948, "grad_norm": 0.61328125, "learning_rate": 2.396517801255352e-05, "loss": 0.3892963409423828, "num_input_tokens_seen": 9535536512, "step": 33530, "train_runtime": 326038.781, "train_tokens_per_second": 29246.633 }, { "epoch": 1.1867109531696767, "grad_norm": 0.60546875, "learning_rate": 2.3962425703790577e-05, "loss": 0.3927242994308472, "num_input_tokens_seen": 9538409280, "step": 33540, "train_runtime": 326135.9822, "train_tokens_per_second": 29246.725 }, { "epoch": 1.1870647734334054, "grad_norm": 0.61328125, "learning_rate": 2.395967434308618e-05, "loss": 0.388751220703125, "num_input_tokens_seen": 9541272320, "step": 33550, "train_runtime": 326232.7178, "train_tokens_per_second": 29246.828 }, { "epoch": 1.1874185936971342, "grad_norm": 0.60546875, "learning_rate": 2.395692392989619e-05, "loss": 0.3861258506774902, "num_input_tokens_seen": 9544064320, "step": 33560, "train_runtime": 326327.8187, "train_tokens_per_second": 29246.861 }, { "epoch": 1.187772413960863, "grad_norm": 0.60546875, "learning_rate": 2.3954174463676868e-05, "loss": 0.3948571443557739, "num_input_tokens_seen": 9546886080, "step": 33570, "train_runtime": 326425.6548, "train_tokens_per_second": 29246.739 }, { "epoch": 1.1881262342245917, "grad_norm": 0.59375, "learning_rate": 2.395142594388495e-05, "loss": 0.3900721788406372, "num_input_tokens_seen": 9549726336, "step": 33580, "train_runtime": 326520.4389, "train_tokens_per_second": 29246.948 }, { "epoch": 1.1884800544883207, "grad_norm": 0.61328125, "learning_rate": 2.3948678369977577e-05, "loss": 0.3959944725036621, "num_input_tokens_seen": 9552575936, "step": 33590, "train_runtime": 326618.5543, "train_tokens_per_second": 29246.887 }, { "epoch": 1.1888338747520493, "grad_norm": 0.5859375, "learning_rate": 2.3945931741412362e-05, "loss": 0.3917521953582764, "num_input_tokens_seen": 9555412928, "step": 33600, "train_runtime": 326716.4835, "train_tokens_per_second": 29246.804 }, { "epoch": 1.1891876950157783, "grad_norm": 0.5859375, "learning_rate": 2.394318605764731e-05, "loss": 0.3932295322418213, "num_input_tokens_seen": 9558267328, "step": 33610, "train_runtime": 326814.7158, "train_tokens_per_second": 29246.747 }, { "epoch": 1.189541515279507, "grad_norm": 0.609375, "learning_rate": 2.3940441318140893e-05, "loss": 0.38986716270446775, "num_input_tokens_seen": 9561136192, "step": 33620, "train_runtime": 326913.7845, "train_tokens_per_second": 29246.66 }, { "epoch": 1.1898953355432358, "grad_norm": 0.62109375, "learning_rate": 2.3937697522352013e-05, "loss": 0.3913094520568848, "num_input_tokens_seen": 9564021504, "step": 33630, "train_runtime": 327014.8582, "train_tokens_per_second": 29246.443 }, { "epoch": 1.1902491558069646, "grad_norm": 0.60546875, "learning_rate": 2.3934954669739984e-05, "loss": 0.3905174970626831, "num_input_tokens_seen": 9566898944, "step": 33640, "train_runtime": 327114.9105, "train_tokens_per_second": 29246.294 }, { "epoch": 1.1906029760706933, "grad_norm": 0.60546875, "learning_rate": 2.3932212759764587e-05, "loss": 0.3906787157058716, "num_input_tokens_seen": 9569715968, "step": 33650, "train_runtime": 327209.5814, "train_tokens_per_second": 29246.442 }, { "epoch": 1.190956796334422, "grad_norm": 0.640625, "learning_rate": 2.3929471791886006e-05, "loss": 0.3931232452392578, "num_input_tokens_seen": 9572561984, "step": 33660, "train_runtime": 327307.4466, "train_tokens_per_second": 29246.392 }, { "epoch": 1.1913106165981509, "grad_norm": 0.59375, "learning_rate": 2.3926731765564872e-05, "loss": 0.3944676399230957, "num_input_tokens_seen": 9575418432, "step": 33670, "train_runtime": 327406.388, "train_tokens_per_second": 29246.279 }, { "epoch": 1.1916644368618796, "grad_norm": 0.609375, "learning_rate": 2.3923992680262258e-05, "loss": 0.3941665172576904, "num_input_tokens_seen": 9578277056, "step": 33680, "train_runtime": 327504.9892, "train_tokens_per_second": 29246.202 }, { "epoch": 1.1920182571256084, "grad_norm": 0.57421875, "learning_rate": 2.3921254535439645e-05, "loss": 0.3895529270172119, "num_input_tokens_seen": 9581097408, "step": 33690, "train_runtime": 327599.2772, "train_tokens_per_second": 29246.394 }, { "epoch": 1.1923720773893371, "grad_norm": 0.59375, "learning_rate": 2.391851733055896e-05, "loss": 0.3941351890563965, "num_input_tokens_seen": 9583940608, "step": 33700, "train_runtime": 327697.4113, "train_tokens_per_second": 29246.312 }, { "epoch": 1.192725897653066, "grad_norm": 0.63671875, "learning_rate": 2.3915781065082566e-05, "loss": 0.3885958194732666, "num_input_tokens_seen": 9586741440, "step": 33710, "train_runtime": 327790.943, "train_tokens_per_second": 29246.511 }, { "epoch": 1.1930797179167947, "grad_norm": 0.6015625, "learning_rate": 2.391304573847324e-05, "loss": 0.39181630611419677, "num_input_tokens_seen": 9589594176, "step": 33720, "train_runtime": 327888.5916, "train_tokens_per_second": 29246.501 }, { "epoch": 1.1934335381805234, "grad_norm": 0.61328125, "learning_rate": 2.3910311350194205e-05, "loss": 0.3927597999572754, "num_input_tokens_seen": 9592433600, "step": 33730, "train_runtime": 327986.9084, "train_tokens_per_second": 29246.392 }, { "epoch": 1.1937873584442522, "grad_norm": 0.5859375, "learning_rate": 2.39075778997091e-05, "loss": 0.3883208751678467, "num_input_tokens_seen": 9595292032, "step": 33740, "train_runtime": 328083.1119, "train_tokens_per_second": 29246.528 }, { "epoch": 1.194141178707981, "grad_norm": 0.59765625, "learning_rate": 2.390484538648201e-05, "loss": 0.3834574222564697, "num_input_tokens_seen": 9598131072, "step": 33750, "train_runtime": 328180.4448, "train_tokens_per_second": 29246.505 }, { "epoch": 1.19449499897171, "grad_norm": 0.60546875, "learning_rate": 2.3902113809977433e-05, "loss": 0.3930532455444336, "num_input_tokens_seen": 9601000896, "step": 33760, "train_runtime": 328279.463, "train_tokens_per_second": 29246.426 }, { "epoch": 1.1948488192354387, "grad_norm": 0.6171875, "learning_rate": 2.3899383169660297e-05, "loss": 0.38910708427429197, "num_input_tokens_seen": 9603877632, "step": 33770, "train_runtime": 328377.339, "train_tokens_per_second": 29246.469 }, { "epoch": 1.1952026394991675, "grad_norm": 0.6015625, "learning_rate": 2.3896653464995968e-05, "loss": 0.39278712272644045, "num_input_tokens_seen": 9606686784, "step": 33780, "train_runtime": 328469.3258, "train_tokens_per_second": 29246.831 }, { "epoch": 1.1955564597628963, "grad_norm": 0.60546875, "learning_rate": 2.3893924695450232e-05, "loss": 0.39176130294799805, "num_input_tokens_seen": 9609472128, "step": 33790, "train_runtime": 328564.3086, "train_tokens_per_second": 29246.853 }, { "epoch": 1.195910280026625, "grad_norm": 0.61328125, "learning_rate": 2.3891196860489297e-05, "loss": 0.3888782739639282, "num_input_tokens_seen": 9612316480, "step": 33800, "train_runtime": 328658.962, "train_tokens_per_second": 29247.085 }, { "epoch": 1.1962641002903538, "grad_norm": 0.609375, "learning_rate": 2.3888469959579813e-05, "loss": 0.3965553045272827, "num_input_tokens_seen": 9615149248, "step": 33810, "train_runtime": 328754.7708, "train_tokens_per_second": 29247.178 }, { "epoch": 1.1966179205540826, "grad_norm": 0.61328125, "learning_rate": 2.388574399218883e-05, "loss": 0.3913938045501709, "num_input_tokens_seen": 9618028096, "step": 33820, "train_runtime": 328853.1235, "train_tokens_per_second": 29247.185 }, { "epoch": 1.1969717408178113, "grad_norm": 0.5859375, "learning_rate": 2.3883018957783854e-05, "loss": 0.390216588973999, "num_input_tokens_seen": 9620882880, "step": 33830, "train_runtime": 328952.5224, "train_tokens_per_second": 29247.026 }, { "epoch": 1.19732556108154, "grad_norm": 0.62109375, "learning_rate": 2.3880294855832802e-05, "loss": 0.38720552921295165, "num_input_tokens_seen": 9623748352, "step": 33840, "train_runtime": 329051.7335, "train_tokens_per_second": 29246.916 }, { "epoch": 1.1976793813452689, "grad_norm": 0.57421875, "learning_rate": 2.387757168580401e-05, "loss": 0.39399967193603513, "num_input_tokens_seen": 9626657536, "step": 33850, "train_runtime": 329154.6699, "train_tokens_per_second": 29246.608 }, { "epoch": 1.1980332016089976, "grad_norm": 0.609375, "learning_rate": 2.387484944716625e-05, "loss": 0.3881422519683838, "num_input_tokens_seen": 9629524736, "step": 33860, "train_runtime": 329252.0356, "train_tokens_per_second": 29246.667 }, { "epoch": 1.1983870218727264, "grad_norm": 0.58984375, "learning_rate": 2.387212813938871e-05, "loss": 0.39118475914001466, "num_input_tokens_seen": 9632425664, "step": 33870, "train_runtime": 329351.5655, "train_tokens_per_second": 29246.637 }, { "epoch": 1.1987408421364552, "grad_norm": 0.578125, "learning_rate": 2.3869407761940998e-05, "loss": 0.3896019697189331, "num_input_tokens_seen": 9635266304, "step": 33880, "train_runtime": 329447.0366, "train_tokens_per_second": 29246.784 }, { "epoch": 1.199094662400184, "grad_norm": 0.62109375, "learning_rate": 2.3866688314293158e-05, "loss": 0.3908462762832642, "num_input_tokens_seen": 9638069824, "step": 33890, "train_runtime": 329540.353, "train_tokens_per_second": 29247.009 }, { "epoch": 1.1994484826639127, "grad_norm": 0.58984375, "learning_rate": 2.3863969795915643e-05, "loss": 0.3864020347595215, "num_input_tokens_seen": 9640934016, "step": 33900, "train_runtime": 329638.5296, "train_tokens_per_second": 29246.988 }, { "epoch": 1.1998023029276415, "grad_norm": 0.609375, "learning_rate": 2.3861252206279336e-05, "loss": 0.3906244277954102, "num_input_tokens_seen": 9643792320, "step": 33910, "train_runtime": 329736.0231, "train_tokens_per_second": 29247.009 }, { "epoch": 1.2001561231913702, "grad_norm": 0.5859375, "learning_rate": 2.3858535544855544e-05, "loss": 0.38703858852386475, "num_input_tokens_seen": 9646623424, "step": 33920, "train_runtime": 329833.3356, "train_tokens_per_second": 29246.963 }, { "epoch": 1.2005099434550992, "grad_norm": 0.62109375, "learning_rate": 2.3855819811115987e-05, "loss": 0.39233222007751467, "num_input_tokens_seen": 9649468544, "step": 33930, "train_runtime": 329928.0479, "train_tokens_per_second": 29247.191 }, { "epoch": 1.200863763718828, "grad_norm": 0.58984375, "learning_rate": 2.385310500453281e-05, "loss": 0.3908323049545288, "num_input_tokens_seen": 9652265792, "step": 33940, "train_runtime": 330025.0956, "train_tokens_per_second": 29247.066 }, { "epoch": 1.2012175839825567, "grad_norm": 0.5859375, "learning_rate": 2.3850391124578573e-05, "loss": 0.3900197982788086, "num_input_tokens_seen": 9655174464, "step": 33950, "train_runtime": 330123.6009, "train_tokens_per_second": 29247.15 }, { "epoch": 1.2015714042462855, "grad_norm": 0.6171875, "learning_rate": 2.3847678170726275e-05, "loss": 0.3944376468658447, "num_input_tokens_seen": 9658019648, "step": 33960, "train_runtime": 330219.7724, "train_tokens_per_second": 29247.248 }, { "epoch": 1.2019252245100143, "grad_norm": 0.609375, "learning_rate": 2.3844966142449312e-05, "loss": 0.3907630205154419, "num_input_tokens_seen": 9660785984, "step": 33970, "train_runtime": 330312.3133, "train_tokens_per_second": 29247.429 }, { "epoch": 1.202279044773743, "grad_norm": 0.59375, "learning_rate": 2.384225503922151e-05, "loss": 0.3928015470504761, "num_input_tokens_seen": 9663646464, "step": 33980, "train_runtime": 330410.0502, "train_tokens_per_second": 29247.435 }, { "epoch": 1.2026328650374718, "grad_norm": 0.62109375, "learning_rate": 2.3839544860517103e-05, "loss": 0.3893132209777832, "num_input_tokens_seen": 9666481280, "step": 33990, "train_runtime": 330506.9991, "train_tokens_per_second": 29247.433 }, { "epoch": 1.2029866853012006, "grad_norm": 0.60546875, "learning_rate": 2.3836835605810765e-05, "loss": 0.39322385787963865, "num_input_tokens_seen": 9669289216, "step": 34000, "train_runtime": 330603.2874, "train_tokens_per_second": 29247.408 }, { "epoch": 1.2033405055649293, "grad_norm": 0.59765625, "learning_rate": 2.3834127274577564e-05, "loss": 0.3904114723205566, "num_input_tokens_seen": 9672089728, "step": 34010, "train_runtime": 330696.22, "train_tokens_per_second": 29247.657 }, { "epoch": 1.203694325828658, "grad_norm": 0.5703125, "learning_rate": 2.3831419866293005e-05, "loss": 0.3903738260269165, "num_input_tokens_seen": 9674950272, "step": 34020, "train_runtime": 330793.7231, "train_tokens_per_second": 29247.684 }, { "epoch": 1.2040481460923869, "grad_norm": 0.60546875, "learning_rate": 2.3828713380432997e-05, "loss": 0.39186806678771974, "num_input_tokens_seen": 9677808448, "step": 34030, "train_runtime": 330892.5336, "train_tokens_per_second": 29247.588 }, { "epoch": 1.2044019663561156, "grad_norm": 0.6015625, "learning_rate": 2.3826007816473866e-05, "loss": 0.3914055824279785, "num_input_tokens_seen": 9680670464, "step": 34040, "train_runtime": 330992.3933, "train_tokens_per_second": 29247.411 }, { "epoch": 1.2047557866198444, "grad_norm": 0.609375, "learning_rate": 2.3823303173892365e-05, "loss": 0.3886967897415161, "num_input_tokens_seen": 9683566656, "step": 34050, "train_runtime": 331092.4404, "train_tokens_per_second": 29247.32 }, { "epoch": 1.2051096068835732, "grad_norm": 0.60546875, "learning_rate": 2.382059945216565e-05, "loss": 0.3942198514938354, "num_input_tokens_seen": 9686376832, "step": 34060, "train_runtime": 331187.8427, "train_tokens_per_second": 29247.38 }, { "epoch": 1.205463427147302, "grad_norm": 0.59375, "learning_rate": 2.3817896650771297e-05, "loss": 0.3941674709320068, "num_input_tokens_seen": 9689171392, "step": 34070, "train_runtime": 331282.3607, "train_tokens_per_second": 29247.471 }, { "epoch": 1.205817247411031, "grad_norm": 0.62109375, "learning_rate": 2.38151947691873e-05, "loss": 0.389211368560791, "num_input_tokens_seen": 9692054784, "step": 34080, "train_runtime": 331379.7936, "train_tokens_per_second": 29247.573 }, { "epoch": 1.2061710676747595, "grad_norm": 0.6015625, "learning_rate": 2.3812493806892066e-05, "loss": 0.3886995315551758, "num_input_tokens_seen": 9694916736, "step": 34090, "train_runtime": 331477.8089, "train_tokens_per_second": 29247.559 }, { "epoch": 1.2065248879384884, "grad_norm": 0.6171875, "learning_rate": 2.3809793763364406e-05, "loss": 0.3905021190643311, "num_input_tokens_seen": 9697683648, "step": 34100, "train_runtime": 331568.8774, "train_tokens_per_second": 29247.871 }, { "epoch": 1.2068787082022172, "grad_norm": 0.59375, "learning_rate": 2.3807094638083575e-05, "loss": 0.39222333431243894, "num_input_tokens_seen": 9700529856, "step": 34110, "train_runtime": 331667.8596, "train_tokens_per_second": 29247.724 }, { "epoch": 1.207232528465946, "grad_norm": 0.61328125, "learning_rate": 2.3804396430529196e-05, "loss": 0.38743300437927247, "num_input_tokens_seen": 9703314112, "step": 34120, "train_runtime": 331757.5566, "train_tokens_per_second": 29248.208 }, { "epoch": 1.2075863487296747, "grad_norm": 0.60546875, "learning_rate": 2.380169914018134e-05, "loss": 0.3886707305908203, "num_input_tokens_seen": 9706138560, "step": 34130, "train_runtime": 331852.6993, "train_tokens_per_second": 29248.334 }, { "epoch": 1.2079401689934035, "grad_norm": 0.6171875, "learning_rate": 2.3799002766520473e-05, "loss": 0.39063329696655275, "num_input_tokens_seen": 9708987008, "step": 34140, "train_runtime": 331948.238, "train_tokens_per_second": 29248.497 }, { "epoch": 1.2082939892571323, "grad_norm": 0.58984375, "learning_rate": 2.379630730902749e-05, "loss": 0.3893106698989868, "num_input_tokens_seen": 9711806784, "step": 34150, "train_runtime": 332045.9647, "train_tokens_per_second": 29248.381 }, { "epoch": 1.208647809520861, "grad_norm": 0.58203125, "learning_rate": 2.3793612767183668e-05, "loss": 0.38825669288635256, "num_input_tokens_seen": 9714642624, "step": 34160, "train_runtime": 332141.4053, "train_tokens_per_second": 29248.514 }, { "epoch": 1.2090016297845898, "grad_norm": 0.625, "learning_rate": 2.3790919140470726e-05, "loss": 0.38932573795318604, "num_input_tokens_seen": 9717448704, "step": 34170, "train_runtime": 332235.293, "train_tokens_per_second": 29248.695 }, { "epoch": 1.2093554500483186, "grad_norm": 0.58984375, "learning_rate": 2.3788226428370774e-05, "loss": 0.3852090835571289, "num_input_tokens_seen": 9720349056, "step": 34180, "train_runtime": 332334.6336, "train_tokens_per_second": 29248.679 }, { "epoch": 1.2097092703120473, "grad_norm": 0.59375, "learning_rate": 2.3785534630366355e-05, "loss": 0.39013381004333497, "num_input_tokens_seen": 9723184512, "step": 34190, "train_runtime": 332429.7361, "train_tokens_per_second": 29248.841 }, { "epoch": 1.210063090575776, "grad_norm": 0.58984375, "learning_rate": 2.378284374594038e-05, "loss": 0.3916423559188843, "num_input_tokens_seen": 9726001856, "step": 34200, "train_runtime": 332524.4548, "train_tokens_per_second": 29248.982 }, { "epoch": 1.2104169108395049, "grad_norm": 0.62109375, "learning_rate": 2.3780153774576215e-05, "loss": 0.39029865264892577, "num_input_tokens_seen": 9728830720, "step": 34210, "train_runtime": 332616.7762, "train_tokens_per_second": 29249.369 }, { "epoch": 1.2107707311032336, "grad_norm": 0.609375, "learning_rate": 2.3777464715757608e-05, "loss": 0.39426584243774415, "num_input_tokens_seen": 9731613632, "step": 34220, "train_runtime": 332710.034, "train_tokens_per_second": 29249.535 }, { "epoch": 1.2111245513669624, "grad_norm": 0.60546875, "learning_rate": 2.3774776568968716e-05, "loss": 0.3904907703399658, "num_input_tokens_seen": 9734413504, "step": 34230, "train_runtime": 332805.1423, "train_tokens_per_second": 29249.589 }, { "epoch": 1.2114783716306912, "grad_norm": 0.6015625, "learning_rate": 2.377208933369413e-05, "loss": 0.39004790782928467, "num_input_tokens_seen": 9737197568, "step": 34240, "train_runtime": 332899.1789, "train_tokens_per_second": 29249.689 }, { "epoch": 1.2118321918944202, "grad_norm": 0.61328125, "learning_rate": 2.3769403009418808e-05, "loss": 0.38975651264190675, "num_input_tokens_seen": 9740070400, "step": 34250, "train_runtime": 332998.5262, "train_tokens_per_second": 29249.59 }, { "epoch": 1.2121860121581487, "grad_norm": 0.6015625, "learning_rate": 2.3766717595628145e-05, "loss": 0.38875398635864256, "num_input_tokens_seen": 9742856832, "step": 34260, "train_runtime": 333094.1005, "train_tokens_per_second": 29249.563 }, { "epoch": 1.2125398324218777, "grad_norm": 0.64453125, "learning_rate": 2.376403309180794e-05, "loss": 0.39031352996826174, "num_input_tokens_seen": 9745677376, "step": 34270, "train_runtime": 333189.1765, "train_tokens_per_second": 29249.682 }, { "epoch": 1.2128936526856064, "grad_norm": 0.609375, "learning_rate": 2.3761349497444387e-05, "loss": 0.3901947021484375, "num_input_tokens_seen": 9748482816, "step": 34280, "train_runtime": 333283.9658, "train_tokens_per_second": 29249.78 }, { "epoch": 1.2132474729493352, "grad_norm": 0.6171875, "learning_rate": 2.3758666812024093e-05, "loss": 0.38884131908416747, "num_input_tokens_seen": 9751270656, "step": 34290, "train_runtime": 333375.7528, "train_tokens_per_second": 29250.09 }, { "epoch": 1.213601293213064, "grad_norm": 0.59765625, "learning_rate": 2.3755985035034072e-05, "loss": 0.3917670726776123, "num_input_tokens_seen": 9754067584, "step": 34300, "train_runtime": 333467.5621, "train_tokens_per_second": 29250.424 }, { "epoch": 1.2139551134767927, "grad_norm": 0.6328125, "learning_rate": 2.3753304165961733e-05, "loss": 0.39243981838226316, "num_input_tokens_seen": 9756888192, "step": 34310, "train_runtime": 333565.1188, "train_tokens_per_second": 29250.325 }, { "epoch": 1.2143089337405215, "grad_norm": 0.59765625, "learning_rate": 2.3750624204294913e-05, "loss": 0.39138786792755126, "num_input_tokens_seen": 9759714240, "step": 34320, "train_runtime": 333662.4836, "train_tokens_per_second": 29250.26 }, { "epoch": 1.2146627540042503, "grad_norm": 0.60546875, "learning_rate": 2.3747945149521823e-05, "loss": 0.3886219024658203, "num_input_tokens_seen": 9762568192, "step": 34330, "train_runtime": 333759.2047, "train_tokens_per_second": 29250.334 }, { "epoch": 1.215016574267979, "grad_norm": 0.6015625, "learning_rate": 2.374526700113111e-05, "loss": 0.3916738986968994, "num_input_tokens_seen": 9765409216, "step": 34340, "train_runtime": 333856.5116, "train_tokens_per_second": 29250.318 }, { "epoch": 1.2153703945317078, "grad_norm": 0.59765625, "learning_rate": 2.374258975861179e-05, "loss": 0.3902529239654541, "num_input_tokens_seen": 9768232192, "step": 34350, "train_runtime": 333949.5065, "train_tokens_per_second": 29250.626 }, { "epoch": 1.2157242147954366, "grad_norm": 0.59765625, "learning_rate": 2.3739913421453303e-05, "loss": 0.39206860065460203, "num_input_tokens_seen": 9771099072, "step": 34360, "train_runtime": 334046.4062, "train_tokens_per_second": 29250.724 }, { "epoch": 1.2160780350591653, "grad_norm": 0.6015625, "learning_rate": 2.37372379891455e-05, "loss": 0.3900717258453369, "num_input_tokens_seen": 9773976512, "step": 34370, "train_runtime": 334148.7894, "train_tokens_per_second": 29250.372 }, { "epoch": 1.216431855322894, "grad_norm": 0.61328125, "learning_rate": 2.3734563461178615e-05, "loss": 0.38710927963256836, "num_input_tokens_seen": 9776848576, "step": 34380, "train_runtime": 334251.7521, "train_tokens_per_second": 29249.955 }, { "epoch": 1.2167856755866229, "grad_norm": 0.6171875, "learning_rate": 2.3731889837043294e-05, "loss": 0.39729976654052734, "num_input_tokens_seen": 9779679808, "step": 34390, "train_runtime": 334349.2568, "train_tokens_per_second": 29249.892 }, { "epoch": 1.2171394958503516, "grad_norm": 0.60546875, "learning_rate": 2.3729217116230586e-05, "loss": 0.3876819133758545, "num_input_tokens_seen": 9782507968, "step": 34400, "train_runtime": 334444.0391, "train_tokens_per_second": 29250.059 }, { "epoch": 1.2174933161140804, "grad_norm": 0.609375, "learning_rate": 2.3726545298231932e-05, "loss": 0.38928420543670655, "num_input_tokens_seen": 9785377728, "step": 34410, "train_runtime": 334544.0338, "train_tokens_per_second": 29249.895 }, { "epoch": 1.2178471363778094, "grad_norm": 0.6171875, "learning_rate": 2.3723874382539182e-05, "loss": 0.39150271415710447, "num_input_tokens_seen": 9788234496, "step": 34420, "train_runtime": 334640.2833, "train_tokens_per_second": 29250.019 }, { "epoch": 1.218200956641538, "grad_norm": 0.5859375, "learning_rate": 2.3721204368644585e-05, "loss": 0.3904736042022705, "num_input_tokens_seen": 9791061312, "step": 34430, "train_runtime": 334738.5852, "train_tokens_per_second": 29249.874 }, { "epoch": 1.218554776905267, "grad_norm": 0.6171875, "learning_rate": 2.371853525604079e-05, "loss": 0.393033504486084, "num_input_tokens_seen": 9793960000, "step": 34440, "train_runtime": 334839.5084, "train_tokens_per_second": 29249.714 }, { "epoch": 1.2189085971689957, "grad_norm": 0.58203125, "learning_rate": 2.371586704422084e-05, "loss": 0.3932281255722046, "num_input_tokens_seen": 9796792448, "step": 34450, "train_runtime": 334937.395, "train_tokens_per_second": 29249.623 }, { "epoch": 1.2192624174327245, "grad_norm": 0.6015625, "learning_rate": 2.3713199732678183e-05, "loss": 0.3898531436920166, "num_input_tokens_seen": 9799579008, "step": 34460, "train_runtime": 335030.9717, "train_tokens_per_second": 29249.77 }, { "epoch": 1.2196162376964532, "grad_norm": 0.58203125, "learning_rate": 2.371053332090666e-05, "loss": 0.3909220457077026, "num_input_tokens_seen": 9802470912, "step": 34470, "train_runtime": 335131.0845, "train_tokens_per_second": 29249.662 }, { "epoch": 1.219970057960182, "grad_norm": 0.59765625, "learning_rate": 2.3707867808400527e-05, "loss": 0.391217565536499, "num_input_tokens_seen": 9805286080, "step": 34480, "train_runtime": 335225.352, "train_tokens_per_second": 29249.835 }, { "epoch": 1.2203238782239108, "grad_norm": 0.62890625, "learning_rate": 2.370520319465442e-05, "loss": 0.39152050018310547, "num_input_tokens_seen": 9808145920, "step": 34490, "train_runtime": 335323.4415, "train_tokens_per_second": 29249.807 }, { "epoch": 1.2206776984876395, "grad_norm": 0.609375, "learning_rate": 2.370253947916337e-05, "loss": 0.38847715854644777, "num_input_tokens_seen": 9810961536, "step": 34500, "train_runtime": 335423.0923, "train_tokens_per_second": 29249.511 }, { "epoch": 1.2210315187513683, "grad_norm": 0.56640625, "learning_rate": 2.369987666142282e-05, "loss": 0.38788018226623533, "num_input_tokens_seen": 9813835456, "step": 34510, "train_runtime": 335522.217, "train_tokens_per_second": 29249.436 }, { "epoch": 1.221385339015097, "grad_norm": 0.609375, "learning_rate": 2.36972147409286e-05, "loss": 0.38880462646484376, "num_input_tokens_seen": 9816663680, "step": 34520, "train_runtime": 335618.0042, "train_tokens_per_second": 29249.515 }, { "epoch": 1.2217391592788258, "grad_norm": 0.62109375, "learning_rate": 2.3694553717176945e-05, "loss": 0.38937208652496336, "num_input_tokens_seen": 9819550080, "step": 34530, "train_runtime": 335719.9094, "train_tokens_per_second": 29249.234 }, { "epoch": 1.2220929795425546, "grad_norm": 0.6015625, "learning_rate": 2.369189358966447e-05, "loss": 0.391521692276001, "num_input_tokens_seen": 9822366336, "step": 34540, "train_runtime": 335815.4327, "train_tokens_per_second": 29249.3 }, { "epoch": 1.2224467998062833, "grad_norm": 0.60546875, "learning_rate": 2.3689234357888205e-05, "loss": 0.3923304557800293, "num_input_tokens_seen": 9825223488, "step": 34550, "train_runtime": 335913.1046, "train_tokens_per_second": 29249.301 }, { "epoch": 1.2228006200700121, "grad_norm": 0.5703125, "learning_rate": 2.368657602134556e-05, "loss": 0.38765337467193606, "num_input_tokens_seen": 9828064064, "step": 34560, "train_runtime": 336008.0003, "train_tokens_per_second": 29249.494 }, { "epoch": 1.2231544403337409, "grad_norm": 0.59765625, "learning_rate": 2.3683918579534347e-05, "loss": 0.39066851139068604, "num_input_tokens_seen": 9830890048, "step": 34570, "train_runtime": 336105.5677, "train_tokens_per_second": 29249.411 }, { "epoch": 1.2235082605974696, "grad_norm": 0.59375, "learning_rate": 2.368126203195277e-05, "loss": 0.38983473777770994, "num_input_tokens_seen": 9833731520, "step": 34580, "train_runtime": 336202.7445, "train_tokens_per_second": 29249.409 }, { "epoch": 1.2238620808611986, "grad_norm": 0.6171875, "learning_rate": 2.3678606378099428e-05, "loss": 0.38753561973571776, "num_input_tokens_seen": 9836584960, "step": 34590, "train_runtime": 336303.4783, "train_tokens_per_second": 29249.132 }, { "epoch": 1.2242159011249274, "grad_norm": 0.58984375, "learning_rate": 2.3675951617473315e-05, "loss": 0.3899605989456177, "num_input_tokens_seen": 9839436032, "step": 34600, "train_runtime": 336400.8276, "train_tokens_per_second": 29249.143 }, { "epoch": 1.2245697213886562, "grad_norm": 0.58203125, "learning_rate": 2.3673297749573805e-05, "loss": 0.39180185794830324, "num_input_tokens_seen": 9842257152, "step": 34610, "train_runtime": 336496.2138, "train_tokens_per_second": 29249.236 }, { "epoch": 1.224923541652385, "grad_norm": 0.59765625, "learning_rate": 2.3670644773900692e-05, "loss": 0.3895064353942871, "num_input_tokens_seen": 9845072128, "step": 34620, "train_runtime": 336592.198, "train_tokens_per_second": 29249.258 }, { "epoch": 1.2252773619161137, "grad_norm": 0.625, "learning_rate": 2.3667992689954135e-05, "loss": 0.39354586601257324, "num_input_tokens_seen": 9847911808, "step": 34630, "train_runtime": 336688.1621, "train_tokens_per_second": 29249.356 }, { "epoch": 1.2256311821798425, "grad_norm": 0.59765625, "learning_rate": 2.3665341497234704e-05, "loss": 0.38932151794433595, "num_input_tokens_seen": 9850730624, "step": 34640, "train_runtime": 336785.3759, "train_tokens_per_second": 29249.283 }, { "epoch": 1.2259850024435712, "grad_norm": 0.5859375, "learning_rate": 2.3662691195243346e-05, "loss": 0.39045109748840334, "num_input_tokens_seen": 9853537408, "step": 34650, "train_runtime": 336879.5923, "train_tokens_per_second": 29249.434 }, { "epoch": 1.2263388227073, "grad_norm": 0.58984375, "learning_rate": 2.3660041783481403e-05, "loss": 0.3947850227355957, "num_input_tokens_seen": 9856290560, "step": 34660, "train_runtime": 336968.9291, "train_tokens_per_second": 29249.85 }, { "epoch": 1.2266926429710288, "grad_norm": 0.59375, "learning_rate": 2.365739326145062e-05, "loss": 0.39142184257507323, "num_input_tokens_seen": 9859116416, "step": 34670, "train_runtime": 337065.8149, "train_tokens_per_second": 29249.826 }, { "epoch": 1.2270464632347575, "grad_norm": 0.61328125, "learning_rate": 2.3654745628653117e-05, "loss": 0.3880918025970459, "num_input_tokens_seen": 9861939776, "step": 34680, "train_runtime": 337162.894, "train_tokens_per_second": 29249.778 }, { "epoch": 1.2274002834984863, "grad_norm": 0.6015625, "learning_rate": 2.3652098884591413e-05, "loss": 0.38976516723632815, "num_input_tokens_seen": 9864776704, "step": 34690, "train_runtime": 337259.5001, "train_tokens_per_second": 29249.811 }, { "epoch": 1.227754103762215, "grad_norm": 0.6171875, "learning_rate": 2.3649453028768406e-05, "loss": 0.3898470401763916, "num_input_tokens_seen": 9867605056, "step": 34700, "train_runtime": 337353.4724, "train_tokens_per_second": 29250.047 }, { "epoch": 1.2281079240259438, "grad_norm": 0.609375, "learning_rate": 2.3646808060687397e-05, "loss": 0.38961086273193357, "num_input_tokens_seen": 9870411776, "step": 34710, "train_runtime": 337446.9877, "train_tokens_per_second": 29250.259 }, { "epoch": 1.2284617442896726, "grad_norm": 0.609375, "learning_rate": 2.364416397985207e-05, "loss": 0.39345560073852537, "num_input_tokens_seen": 9873246208, "step": 34720, "train_runtime": 337542.4438, "train_tokens_per_second": 29250.384 }, { "epoch": 1.2288155645534014, "grad_norm": 0.60546875, "learning_rate": 2.3641520785766487e-05, "loss": 0.3879849433898926, "num_input_tokens_seen": 9876161920, "step": 34730, "train_runtime": 337644.6231, "train_tokens_per_second": 29250.168 }, { "epoch": 1.2291693848171301, "grad_norm": 0.6015625, "learning_rate": 2.363887847793512e-05, "loss": 0.3916689157485962, "num_input_tokens_seen": 9878980416, "step": 34740, "train_runtime": 337740.7509, "train_tokens_per_second": 29250.188 }, { "epoch": 1.2295232050808589, "grad_norm": 0.61328125, "learning_rate": 2.363623705586281e-05, "loss": 0.39472362995147703, "num_input_tokens_seen": 9881828992, "step": 34750, "train_runtime": 337839.8374, "train_tokens_per_second": 29250.041 }, { "epoch": 1.2298770253445879, "grad_norm": 0.60546875, "learning_rate": 2.363359651905479e-05, "loss": 0.3958576679229736, "num_input_tokens_seen": 9884673792, "step": 34760, "train_runtime": 337936.5957, "train_tokens_per_second": 29250.084 }, { "epoch": 1.2302308456083166, "grad_norm": 0.609375, "learning_rate": 2.3630956867016688e-05, "loss": 0.38894104957580566, "num_input_tokens_seen": 9887490688, "step": 34770, "train_runtime": 338031.4344, "train_tokens_per_second": 29250.211 }, { "epoch": 1.2305846658720454, "grad_norm": 0.609375, "learning_rate": 2.3628318099254506e-05, "loss": 0.38692293167114256, "num_input_tokens_seen": 9890319040, "step": 34780, "train_runtime": 338125.6299, "train_tokens_per_second": 29250.427 }, { "epoch": 1.2309384861357742, "grad_norm": 0.61328125, "learning_rate": 2.3625680215274635e-05, "loss": 0.38958425521850587, "num_input_tokens_seen": 9893143104, "step": 34790, "train_runtime": 338223.8932, "train_tokens_per_second": 29250.279 }, { "epoch": 1.231292306399503, "grad_norm": 0.60546875, "learning_rate": 2.362304321458386e-05, "loss": 0.3958865165710449, "num_input_tokens_seen": 9896034752, "step": 34800, "train_runtime": 338325.475, "train_tokens_per_second": 29250.043 }, { "epoch": 1.2316461266632317, "grad_norm": 0.578125, "learning_rate": 2.362040709668934e-05, "loss": 0.3878112554550171, "num_input_tokens_seen": 9898863040, "step": 34810, "train_runtime": 338422.8142, "train_tokens_per_second": 29249.987 }, { "epoch": 1.2319999469269605, "grad_norm": 0.578125, "learning_rate": 2.361777186109863e-05, "loss": 0.3871556997299194, "num_input_tokens_seen": 9901685696, "step": 34820, "train_runtime": 338517.6135, "train_tokens_per_second": 29250.134 }, { "epoch": 1.2323537671906892, "grad_norm": 0.59375, "learning_rate": 2.3615137507319672e-05, "loss": 0.39195685386657714, "num_input_tokens_seen": 9904598208, "step": 34830, "train_runtime": 338619.4897, "train_tokens_per_second": 29249.935 }, { "epoch": 1.232707587454418, "grad_norm": 0.6171875, "learning_rate": 2.361250403486076e-05, "loss": 0.3917252540588379, "num_input_tokens_seen": 9907452864, "step": 34840, "train_runtime": 338717.0262, "train_tokens_per_second": 29249.941 }, { "epoch": 1.2330614077181468, "grad_norm": 0.609375, "learning_rate": 2.360987144323062e-05, "loss": 0.38925833702087403, "num_input_tokens_seen": 9910414720, "step": 34850, "train_runtime": 338819.5251, "train_tokens_per_second": 29249.834 }, { "epoch": 1.2334152279818755, "grad_norm": 0.61328125, "learning_rate": 2.3607239731938324e-05, "loss": 0.3893608570098877, "num_input_tokens_seen": 9913257856, "step": 34860, "train_runtime": 338917.6403, "train_tokens_per_second": 29249.755 }, { "epoch": 1.2337690482456043, "grad_norm": 0.65234375, "learning_rate": 2.3604608900493343e-05, "loss": 0.3903757095336914, "num_input_tokens_seen": 9916116224, "step": 34870, "train_runtime": 339016.155, "train_tokens_per_second": 29249.686 }, { "epoch": 1.234122868509333, "grad_norm": 0.62109375, "learning_rate": 2.360197894840553e-05, "loss": 0.39066381454467775, "num_input_tokens_seen": 9918965312, "step": 34880, "train_runtime": 339113.0984, "train_tokens_per_second": 29249.726 }, { "epoch": 1.2344766887730618, "grad_norm": 0.5859375, "learning_rate": 2.3599349875185117e-05, "loss": 0.3920109272003174, "num_input_tokens_seen": 9921834944, "step": 34890, "train_runtime": 339211.2045, "train_tokens_per_second": 29249.726 }, { "epoch": 1.2348305090367906, "grad_norm": 0.58203125, "learning_rate": 2.359672168034272e-05, "loss": 0.391188383102417, "num_input_tokens_seen": 9924674240, "step": 34900, "train_runtime": 339310.2829, "train_tokens_per_second": 29249.553 }, { "epoch": 1.2351843293005194, "grad_norm": 0.62109375, "learning_rate": 2.3594094363389327e-05, "loss": 0.3887295722961426, "num_input_tokens_seen": 9927486080, "step": 34910, "train_runtime": 339404.4318, "train_tokens_per_second": 29249.724 }, { "epoch": 1.2355381495642481, "grad_norm": 0.58984375, "learning_rate": 2.3591467923836324e-05, "loss": 0.39623570442199707, "num_input_tokens_seen": 9930325312, "step": 34920, "train_runtime": 339504.7869, "train_tokens_per_second": 29249.441 }, { "epoch": 1.235891969827977, "grad_norm": 0.58984375, "learning_rate": 2.3588842361195467e-05, "loss": 0.3905511379241943, "num_input_tokens_seen": 9933175360, "step": 34930, "train_runtime": 339601.7731, "train_tokens_per_second": 29249.48 }, { "epoch": 1.2362457900917059, "grad_norm": 0.578125, "learning_rate": 2.3586217674978893e-05, "loss": 0.39021623134613037, "num_input_tokens_seen": 9936098560, "step": 34940, "train_runtime": 339703.6504, "train_tokens_per_second": 29249.313 }, { "epoch": 1.2365996103554346, "grad_norm": 0.60546875, "learning_rate": 2.358359386469912e-05, "loss": 0.38912899494171144, "num_input_tokens_seen": 9938961792, "step": 34950, "train_runtime": 339801.4642, "train_tokens_per_second": 29249.32 }, { "epoch": 1.2369534306191634, "grad_norm": 0.58984375, "learning_rate": 2.3580970929869047e-05, "loss": 0.3933791875839233, "num_input_tokens_seen": 9941761600, "step": 34960, "train_runtime": 339894.0911, "train_tokens_per_second": 29249.586 }, { "epoch": 1.2373072508828922, "grad_norm": 0.61328125, "learning_rate": 2.3578348870001952e-05, "loss": 0.3955677032470703, "num_input_tokens_seen": 9944624256, "step": 34970, "train_runtime": 339993.3756, "train_tokens_per_second": 29249.465 }, { "epoch": 1.237661071146621, "grad_norm": 0.60546875, "learning_rate": 2.357572768461149e-05, "loss": 0.38793082237243653, "num_input_tokens_seen": 9947495936, "step": 34980, "train_runtime": 340093.9304, "train_tokens_per_second": 29249.26 }, { "epoch": 1.2380148914103497, "grad_norm": 0.59765625, "learning_rate": 2.3573107373211687e-05, "loss": 0.39339404106140136, "num_input_tokens_seen": 9950286144, "step": 34990, "train_runtime": 340184.6625, "train_tokens_per_second": 29249.661 }, { "epoch": 1.2383687116740785, "grad_norm": 0.5859375, "learning_rate": 2.3570487935316964e-05, "loss": 0.3933719158172607, "num_input_tokens_seen": 9953103872, "step": 35000, "train_runtime": 340281.5165, "train_tokens_per_second": 29249.617 }, { "epoch": 1.2383687116740785, "eval_loss": 0.33749818801879883, "eval_runtime": 8.4167, "eval_samples_per_second": 473.818, "eval_steps_per_second": 3.802, "num_input_tokens_seen": 9953103872, "step": 35000 }, { "epoch": 1.2387225319378072, "grad_norm": 0.6015625, "learning_rate": 2.3567869370442104e-05, "loss": 0.38792977333068845, "num_input_tokens_seen": 9955961216, "step": 35010, "train_runtime": 340411.1001, "train_tokens_per_second": 29246.876 }, { "epoch": 1.239076352201536, "grad_norm": 0.5859375, "learning_rate": 2.356525167810228e-05, "loss": 0.39495229721069336, "num_input_tokens_seen": 9958810304, "step": 35020, "train_runtime": 340511.7608, "train_tokens_per_second": 29246.597 }, { "epoch": 1.2394301724652648, "grad_norm": 0.61328125, "learning_rate": 2.3562634857813034e-05, "loss": 0.39720590114593507, "num_input_tokens_seen": 9961596352, "step": 35030, "train_runtime": 340606.3562, "train_tokens_per_second": 29246.654 }, { "epoch": 1.2397839927289935, "grad_norm": 0.61328125, "learning_rate": 2.3560018909090288e-05, "loss": 0.3956779956817627, "num_input_tokens_seen": 9964467392, "step": 35040, "train_runtime": 340705.0098, "train_tokens_per_second": 29246.612 }, { "epoch": 1.2401378129927223, "grad_norm": 0.6171875, "learning_rate": 2.355740383145033e-05, "loss": 0.391188383102417, "num_input_tokens_seen": 9967367488, "step": 35050, "train_runtime": 340805.7111, "train_tokens_per_second": 29246.48 }, { "epoch": 1.240491633256451, "grad_norm": 0.5859375, "learning_rate": 2.3554789624409836e-05, "loss": 0.3957855701446533, "num_input_tokens_seen": 9970211264, "step": 35060, "train_runtime": 340901.7307, "train_tokens_per_second": 29246.584 }, { "epoch": 1.2408454535201798, "grad_norm": 0.58984375, "learning_rate": 2.355217628748586e-05, "loss": 0.38939361572265624, "num_input_tokens_seen": 9973072000, "step": 35070, "train_runtime": 340997.8008, "train_tokens_per_second": 29246.734 }, { "epoch": 1.2411992737839088, "grad_norm": 0.61328125, "learning_rate": 2.354956382019581e-05, "loss": 0.39279704093933104, "num_input_tokens_seen": 9975927488, "step": 35080, "train_runtime": 341094.3148, "train_tokens_per_second": 29246.83 }, { "epoch": 1.2415530940476374, "grad_norm": 0.59765625, "learning_rate": 2.35469522220575e-05, "loss": 0.3957968235015869, "num_input_tokens_seen": 9978769408, "step": 35090, "train_runtime": 341188.578, "train_tokens_per_second": 29247.079 }, { "epoch": 1.2419069143113664, "grad_norm": 0.625, "learning_rate": 2.3544341492589096e-05, "loss": 0.395880389213562, "num_input_tokens_seen": 9981646080, "step": 35100, "train_runtime": 341288.0979, "train_tokens_per_second": 29246.98 }, { "epoch": 1.2422607345750951, "grad_norm": 0.6171875, "learning_rate": 2.3541731631309126e-05, "loss": 0.38951592445373534, "num_input_tokens_seen": 9984491392, "step": 35110, "train_runtime": 341386.188, "train_tokens_per_second": 29246.911 }, { "epoch": 1.2426145548388239, "grad_norm": 0.62109375, "learning_rate": 2.3539122637736537e-05, "loss": 0.38961329460144045, "num_input_tokens_seen": 9987369216, "step": 35120, "train_runtime": 341484.2428, "train_tokens_per_second": 29246.94 }, { "epoch": 1.2429683751025526, "grad_norm": 0.58984375, "learning_rate": 2.35365145113906e-05, "loss": 0.3884893417358398, "num_input_tokens_seen": 9990212224, "step": 35130, "train_runtime": 341580.9817, "train_tokens_per_second": 29246.98 }, { "epoch": 1.2433221953662814, "grad_norm": 0.609375, "learning_rate": 2.3533907251790983e-05, "loss": 0.3930696964263916, "num_input_tokens_seen": 9993065216, "step": 35140, "train_runtime": 341679.9127, "train_tokens_per_second": 29246.862 }, { "epoch": 1.2436760156300102, "grad_norm": 0.6171875, "learning_rate": 2.3531300858457727e-05, "loss": 0.3917020082473755, "num_input_tokens_seen": 9995957056, "step": 35150, "train_runtime": 341782.3056, "train_tokens_per_second": 29246.561 }, { "epoch": 1.244029835893739, "grad_norm": 0.609375, "learning_rate": 2.352869533091124e-05, "loss": 0.3884159564971924, "num_input_tokens_seen": 9998854080, "step": 35160, "train_runtime": 341883.0793, "train_tokens_per_second": 29246.414 }, { "epoch": 1.2443836561574677, "grad_norm": 0.609375, "learning_rate": 2.3526090668672306e-05, "loss": 0.39250574111938474, "num_input_tokens_seen": 10001740096, "step": 35170, "train_runtime": 341984.2574, "train_tokens_per_second": 29246.2 }, { "epoch": 1.2447374764211965, "grad_norm": 0.59375, "learning_rate": 2.3523486871262068e-05, "loss": 0.3898512363433838, "num_input_tokens_seen": 10004669440, "step": 35180, "train_runtime": 342084.8514, "train_tokens_per_second": 29246.163 }, { "epoch": 1.2450912966849252, "grad_norm": 0.59375, "learning_rate": 2.3520883938202048e-05, "loss": 0.3902533292770386, "num_input_tokens_seen": 10007498176, "step": 35190, "train_runtime": 342181.3145, "train_tokens_per_second": 29246.185 }, { "epoch": 1.245445116948654, "grad_norm": 0.6015625, "learning_rate": 2.3518281869014153e-05, "loss": 0.3891111373901367, "num_input_tokens_seen": 10010338560, "step": 35200, "train_runtime": 342276.5217, "train_tokens_per_second": 29246.349 }, { "epoch": 1.2457989372123828, "grad_norm": 0.609375, "learning_rate": 2.3515680663220632e-05, "loss": 0.39291832447052, "num_input_tokens_seen": 10013225984, "step": 35210, "train_runtime": 342378.8767, "train_tokens_per_second": 29246.039 }, { "epoch": 1.2461527574761115, "grad_norm": 0.58984375, "learning_rate": 2.351308032034413e-05, "loss": 0.3892541408538818, "num_input_tokens_seen": 10016053440, "step": 35220, "train_runtime": 342474.8532, "train_tokens_per_second": 29246.099 }, { "epoch": 1.2465065777398403, "grad_norm": 0.609375, "learning_rate": 2.3510480839907635e-05, "loss": 0.39425790309906006, "num_input_tokens_seen": 10018930112, "step": 35230, "train_runtime": 342576.108, "train_tokens_per_second": 29245.852 }, { "epoch": 1.246860398003569, "grad_norm": 0.59375, "learning_rate": 2.350788222143453e-05, "loss": 0.39088053703308107, "num_input_tokens_seen": 10021760448, "step": 35240, "train_runtime": 342673.0866, "train_tokens_per_second": 29245.835 }, { "epoch": 1.247214218267298, "grad_norm": 0.5859375, "learning_rate": 2.3505284464448558e-05, "loss": 0.3901395797729492, "num_input_tokens_seen": 10024582720, "step": 35250, "train_runtime": 342769.6239, "train_tokens_per_second": 29245.832 }, { "epoch": 1.2475680385310266, "grad_norm": 0.59375, "learning_rate": 2.3502687568473815e-05, "loss": 0.393476676940918, "num_input_tokens_seen": 10027407872, "step": 35260, "train_runtime": 342866.3879, "train_tokens_per_second": 29245.818 }, { "epoch": 1.2479218587947556, "grad_norm": 0.59765625, "learning_rate": 2.3500091533034785e-05, "loss": 0.39229159355163573, "num_input_tokens_seen": 10030243520, "step": 35270, "train_runtime": 342963.2879, "train_tokens_per_second": 29245.823 }, { "epoch": 1.2482756790584844, "grad_norm": 0.5859375, "learning_rate": 2.3497496357656313e-05, "loss": 0.3912361621856689, "num_input_tokens_seen": 10033080960, "step": 35280, "train_runtime": 343060.9269, "train_tokens_per_second": 29245.77 }, { "epoch": 1.2486294993222131, "grad_norm": 0.6171875, "learning_rate": 2.3494902041863607e-05, "loss": 0.39301586151123047, "num_input_tokens_seen": 10035942016, "step": 35290, "train_runtime": 343157.4138, "train_tokens_per_second": 29245.884 }, { "epoch": 1.2489833195859419, "grad_norm": 0.60546875, "learning_rate": 2.349230858518225e-05, "loss": 0.3922626495361328, "num_input_tokens_seen": 10038792768, "step": 35300, "train_runtime": 343254.2584, "train_tokens_per_second": 29245.938 }, { "epoch": 1.2493371398496707, "grad_norm": 0.61328125, "learning_rate": 2.3489715987138178e-05, "loss": 0.38910613059997556, "num_input_tokens_seen": 10041574528, "step": 35310, "train_runtime": 343348.9419, "train_tokens_per_second": 29245.975 }, { "epoch": 1.2496909601133994, "grad_norm": 0.62109375, "learning_rate": 2.348712424725771e-05, "loss": 0.3897295713424683, "num_input_tokens_seen": 10044415808, "step": 35320, "train_runtime": 343447.6273, "train_tokens_per_second": 29245.844 }, { "epoch": 1.2500447803771282, "grad_norm": 0.59375, "learning_rate": 2.3484533365067526e-05, "loss": 0.39483957290649413, "num_input_tokens_seen": 10047284864, "step": 35330, "train_runtime": 343549.4455, "train_tokens_per_second": 29245.528 }, { "epoch": 1.250398600640857, "grad_norm": 0.61328125, "learning_rate": 2.3481943340094656e-05, "loss": 0.38970365524291994, "num_input_tokens_seen": 10050130944, "step": 35340, "train_runtime": 343645.337, "train_tokens_per_second": 29245.649 }, { "epoch": 1.2507524209045857, "grad_norm": 0.609375, "learning_rate": 2.3479354171866517e-05, "loss": 0.3914132833480835, "num_input_tokens_seen": 10052974080, "step": 35350, "train_runtime": 343741.368, "train_tokens_per_second": 29245.75 }, { "epoch": 1.2511062411683145, "grad_norm": 0.58203125, "learning_rate": 2.3476765859910877e-05, "loss": 0.39165487289428713, "num_input_tokens_seen": 10055788288, "step": 35360, "train_runtime": 343835.5828, "train_tokens_per_second": 29245.921 }, { "epoch": 1.2514600614320432, "grad_norm": 0.609375, "learning_rate": 2.347417840375587e-05, "loss": 0.3855934143066406, "num_input_tokens_seen": 10058621248, "step": 35370, "train_runtime": 343933.5432, "train_tokens_per_second": 29245.828 }, { "epoch": 1.251813881695772, "grad_norm": 0.6015625, "learning_rate": 2.347159180293e-05, "loss": 0.3871392965316772, "num_input_tokens_seen": 10061456640, "step": 35380, "train_runtime": 344028.9755, "train_tokens_per_second": 29245.957 }, { "epoch": 1.2521677019595008, "grad_norm": 0.58984375, "learning_rate": 2.346900605696213e-05, "loss": 0.3917234897613525, "num_input_tokens_seen": 10064292736, "step": 35390, "train_runtime": 344123.7692, "train_tokens_per_second": 29246.142 }, { "epoch": 1.2525215222232295, "grad_norm": 0.58203125, "learning_rate": 2.3466421165381486e-05, "loss": 0.38956403732299805, "num_input_tokens_seen": 10067125568, "step": 35400, "train_runtime": 344219.9752, "train_tokens_per_second": 29246.198 }, { "epoch": 1.2528753424869583, "grad_norm": 0.6015625, "learning_rate": 2.346383712771766e-05, "loss": 0.39185781478881837, "num_input_tokens_seen": 10069973440, "step": 35410, "train_runtime": 344316.2755, "train_tokens_per_second": 29246.289 }, { "epoch": 1.2532291627506873, "grad_norm": 0.5859375, "learning_rate": 2.3461253943500598e-05, "loss": 0.392056941986084, "num_input_tokens_seen": 10072860544, "step": 35420, "train_runtime": 344415.4029, "train_tokens_per_second": 29246.255 }, { "epoch": 1.2535829830144158, "grad_norm": 0.60546875, "learning_rate": 2.345867161226062e-05, "loss": 0.39003934860229494, "num_input_tokens_seen": 10075716096, "step": 35430, "train_runtime": 344513.0706, "train_tokens_per_second": 29246.252 }, { "epoch": 1.2539368032781448, "grad_norm": 0.5859375, "learning_rate": 2.34560901335284e-05, "loss": 0.38649041652679444, "num_input_tokens_seen": 10078532096, "step": 35440, "train_runtime": 344608.808, "train_tokens_per_second": 29246.299 }, { "epoch": 1.2542906235418736, "grad_norm": 0.62109375, "learning_rate": 2.3453509506834984e-05, "loss": 0.3915275812149048, "num_input_tokens_seen": 10081347968, "step": 35450, "train_runtime": 344707.7571, "train_tokens_per_second": 29246.072 }, { "epoch": 1.2546444438056024, "grad_norm": 0.609375, "learning_rate": 2.345092973171176e-05, "loss": 0.38986341953277587, "num_input_tokens_seen": 10084213888, "step": 35460, "train_runtime": 344807.3865, "train_tokens_per_second": 29245.933 }, { "epoch": 1.2549982640693311, "grad_norm": 0.61328125, "learning_rate": 2.3448350807690487e-05, "loss": 0.3932187080383301, "num_input_tokens_seen": 10087038336, "step": 35470, "train_runtime": 344903.9498, "train_tokens_per_second": 29245.935 }, { "epoch": 1.25535208433306, "grad_norm": 0.58984375, "learning_rate": 2.3445772734303292e-05, "loss": 0.3870553016662598, "num_input_tokens_seen": 10089841024, "step": 35480, "train_runtime": 344999.2428, "train_tokens_per_second": 29245.98 }, { "epoch": 1.2557059045967887, "grad_norm": 0.609375, "learning_rate": 2.344319551108265e-05, "loss": 0.38880760669708253, "num_input_tokens_seen": 10092678848, "step": 35490, "train_runtime": 345091.8232, "train_tokens_per_second": 29246.358 }, { "epoch": 1.2560597248605174, "grad_norm": 0.578125, "learning_rate": 2.3440619137561402e-05, "loss": 0.38543813228607177, "num_input_tokens_seen": 10095558208, "step": 35500, "train_runtime": 345194.9715, "train_tokens_per_second": 29245.96 }, { "epoch": 1.2564135451242462, "grad_norm": 0.60546875, "learning_rate": 2.343804361327275e-05, "loss": 0.38905441761016846, "num_input_tokens_seen": 10098391104, "step": 35510, "train_runtime": 345289.871, "train_tokens_per_second": 29246.126 }, { "epoch": 1.256767365387975, "grad_norm": 0.60546875, "learning_rate": 2.3435468937750252e-05, "loss": 0.3927861452102661, "num_input_tokens_seen": 10101243008, "step": 35520, "train_runtime": 345385.7238, "train_tokens_per_second": 29246.267 }, { "epoch": 1.2571211856517037, "grad_norm": 0.5859375, "learning_rate": 2.3432895110527815e-05, "loss": 0.392937970161438, "num_input_tokens_seen": 10104065792, "step": 35530, "train_runtime": 345481.266, "train_tokens_per_second": 29246.349 }, { "epoch": 1.2574750059154325, "grad_norm": 0.6015625, "learning_rate": 2.3430322131139726e-05, "loss": 0.38762712478637695, "num_input_tokens_seen": 10106898368, "step": 35540, "train_runtime": 345579.5951, "train_tokens_per_second": 29246.224 }, { "epoch": 1.2578288261791613, "grad_norm": 0.6015625, "learning_rate": 2.342774999912061e-05, "loss": 0.39256060123443604, "num_input_tokens_seen": 10109664512, "step": 35550, "train_runtime": 345670.996, "train_tokens_per_second": 29246.493 }, { "epoch": 1.25818264644289, "grad_norm": 0.578125, "learning_rate": 2.342517871400546e-05, "loss": 0.39326491355896, "num_input_tokens_seen": 10112520512, "step": 35560, "train_runtime": 345768.1898, "train_tokens_per_second": 29246.532 }, { "epoch": 1.258536466706619, "grad_norm": 0.5859375, "learning_rate": 2.342260827532962e-05, "loss": 0.3897913932800293, "num_input_tokens_seen": 10115328000, "step": 35570, "train_runtime": 345865.7365, "train_tokens_per_second": 29246.401 }, { "epoch": 1.2588902869703475, "grad_norm": 0.6015625, "learning_rate": 2.34200386826288e-05, "loss": 0.389065146446228, "num_input_tokens_seen": 10118209472, "step": 35580, "train_runtime": 345964.5616, "train_tokens_per_second": 29246.375 }, { "epoch": 1.2592441072340765, "grad_norm": 0.6328125, "learning_rate": 2.3417469935439052e-05, "loss": 0.3881157398223877, "num_input_tokens_seen": 10121055488, "step": 35590, "train_runtime": 346062.4692, "train_tokens_per_second": 29246.325 }, { "epoch": 1.259597927497805, "grad_norm": 0.59765625, "learning_rate": 2.34149020332968e-05, "loss": 0.3917097568511963, "num_input_tokens_seen": 10123917824, "step": 35600, "train_runtime": 346161.0508, "train_tokens_per_second": 29246.265 }, { "epoch": 1.259951747761534, "grad_norm": 0.59375, "learning_rate": 2.3412334975738813e-05, "loss": 0.394685959815979, "num_input_tokens_seen": 10126750016, "step": 35610, "train_runtime": 346258.6902, "train_tokens_per_second": 29246.197 }, { "epoch": 1.2603055680252628, "grad_norm": 0.5859375, "learning_rate": 2.3409768762302222e-05, "loss": 0.3866231918334961, "num_input_tokens_seen": 10129580608, "step": 35620, "train_runtime": 346356.9092, "train_tokens_per_second": 29246.076 }, { "epoch": 1.2606593882889916, "grad_norm": 0.609375, "learning_rate": 2.340720339252451e-05, "loss": 0.3914416074752808, "num_input_tokens_seen": 10132420992, "step": 35630, "train_runtime": 346454.3603, "train_tokens_per_second": 29246.048 }, { "epoch": 1.2610132085527204, "grad_norm": 0.58203125, "learning_rate": 2.3404638865943507e-05, "loss": 0.3888051509857178, "num_input_tokens_seen": 10135264512, "step": 35640, "train_runtime": 346549.7353, "train_tokens_per_second": 29246.205 }, { "epoch": 1.2613670288164491, "grad_norm": 0.58984375, "learning_rate": 2.3402075182097412e-05, "loss": 0.3925264596939087, "num_input_tokens_seen": 10138134912, "step": 35650, "train_runtime": 346649.717, "train_tokens_per_second": 29246.05 }, { "epoch": 1.261720849080178, "grad_norm": 0.6015625, "learning_rate": 2.339951234052477e-05, "loss": 0.38530669212341306, "num_input_tokens_seen": 10140988224, "step": 35660, "train_runtime": 346749.2634, "train_tokens_per_second": 29245.883 }, { "epoch": 1.2620746693439067, "grad_norm": 0.62890625, "learning_rate": 2.3396950340764478e-05, "loss": 0.3853438377380371, "num_input_tokens_seen": 10143858304, "step": 35670, "train_runtime": 346850.5364, "train_tokens_per_second": 29245.618 }, { "epoch": 1.2624284896076354, "grad_norm": 0.59765625, "learning_rate": 2.3394389182355793e-05, "loss": 0.39094090461730957, "num_input_tokens_seen": 10146706752, "step": 35680, "train_runtime": 346949.634, "train_tokens_per_second": 29245.475 }, { "epoch": 1.2627823098713642, "grad_norm": 0.6171875, "learning_rate": 2.339182886483832e-05, "loss": 0.391913628578186, "num_input_tokens_seen": 10149506048, "step": 35690, "train_runtime": 347043.6888, "train_tokens_per_second": 29245.615 }, { "epoch": 1.263136130135093, "grad_norm": 0.58203125, "learning_rate": 2.3389269387752017e-05, "loss": 0.38967850208282473, "num_input_tokens_seen": 10152397888, "step": 35700, "train_runtime": 347143.1268, "train_tokens_per_second": 29245.568 }, { "epoch": 1.2634899503988217, "grad_norm": 0.5859375, "learning_rate": 2.3386710750637194e-05, "loss": 0.39403934478759767, "num_input_tokens_seen": 10155230208, "step": 35710, "train_runtime": 347240.178, "train_tokens_per_second": 29245.551 }, { "epoch": 1.2638437706625505, "grad_norm": 0.59765625, "learning_rate": 2.3384152953034514e-05, "loss": 0.3918935298919678, "num_input_tokens_seen": 10158070912, "step": 35720, "train_runtime": 347338.8769, "train_tokens_per_second": 29245.419 }, { "epoch": 1.2641975909262793, "grad_norm": 0.6015625, "learning_rate": 2.338159599448499e-05, "loss": 0.3861706733703613, "num_input_tokens_seen": 10160917056, "step": 35730, "train_runtime": 347436.0195, "train_tokens_per_second": 29245.434 }, { "epoch": 1.2645514111900082, "grad_norm": 0.58984375, "learning_rate": 2.3379039874529996e-05, "loss": 0.3889310359954834, "num_input_tokens_seen": 10163797952, "step": 35740, "train_runtime": 347534.1027, "train_tokens_per_second": 29245.469 }, { "epoch": 1.2649052314537368, "grad_norm": 0.625, "learning_rate": 2.337648459271124e-05, "loss": 0.39087882041931155, "num_input_tokens_seen": 10166626048, "step": 35750, "train_runtime": 347631.708, "train_tokens_per_second": 29245.393 }, { "epoch": 1.2652590517174658, "grad_norm": 0.61328125, "learning_rate": 2.3373930148570787e-05, "loss": 0.3912909984588623, "num_input_tokens_seen": 10169436416, "step": 35760, "train_runtime": 347728.0864, "train_tokens_per_second": 29245.37 }, { "epoch": 1.2656128719811943, "grad_norm": 0.60546875, "learning_rate": 2.3371376541651063e-05, "loss": 0.3960239887237549, "num_input_tokens_seen": 10172264768, "step": 35770, "train_runtime": 347823.1062, "train_tokens_per_second": 29245.512 }, { "epoch": 1.2659666922449233, "grad_norm": 0.6484375, "learning_rate": 2.336882377149483e-05, "loss": 0.3915431499481201, "num_input_tokens_seen": 10175120896, "step": 35780, "train_runtime": 347921.1709, "train_tokens_per_second": 29245.478 }, { "epoch": 1.266320512508652, "grad_norm": 0.60546875, "learning_rate": 2.3366271837645207e-05, "loss": 0.39311091899871825, "num_input_tokens_seen": 10178012672, "step": 35790, "train_runtime": 348019.6358, "train_tokens_per_second": 29245.513 }, { "epoch": 1.2666743327723808, "grad_norm": 0.60546875, "learning_rate": 2.3363720739645652e-05, "loss": 0.39456839561462403, "num_input_tokens_seen": 10180854720, "step": 35800, "train_runtime": 348116.6634, "train_tokens_per_second": 29245.525 }, { "epoch": 1.2670281530361096, "grad_norm": 0.6015625, "learning_rate": 2.3361170477039995e-05, "loss": 0.3854986190795898, "num_input_tokens_seen": 10183678464, "step": 35810, "train_runtime": 348211.9287, "train_tokens_per_second": 29245.634 }, { "epoch": 1.2673819732998384, "grad_norm": 0.6015625, "learning_rate": 2.3358621049372383e-05, "loss": 0.3889935970306396, "num_input_tokens_seen": 10186474624, "step": 35820, "train_runtime": 348308.5498, "train_tokens_per_second": 29245.549 }, { "epoch": 1.2677357935635671, "grad_norm": 0.61328125, "learning_rate": 2.3356072456187336e-05, "loss": 0.3913357019424438, "num_input_tokens_seen": 10189268608, "step": 35830, "train_runtime": 348401.8643, "train_tokens_per_second": 29245.735 }, { "epoch": 1.268089613827296, "grad_norm": 0.59765625, "learning_rate": 2.335352469702972e-05, "loss": 0.3917271137237549, "num_input_tokens_seen": 10192053568, "step": 35840, "train_runtime": 348496.9661, "train_tokens_per_second": 29245.745 }, { "epoch": 1.2684434340910247, "grad_norm": 0.61328125, "learning_rate": 2.3350977771444724e-05, "loss": 0.38952884674072263, "num_input_tokens_seen": 10194905920, "step": 35850, "train_runtime": 348597.0177, "train_tokens_per_second": 29245.534 }, { "epoch": 1.2687972543547534, "grad_norm": 0.6015625, "learning_rate": 2.3348431678977914e-05, "loss": 0.3941945552825928, "num_input_tokens_seen": 10197752832, "step": 35860, "train_runtime": 348693.8026, "train_tokens_per_second": 29245.581 }, { "epoch": 1.2691510746184822, "grad_norm": 0.58984375, "learning_rate": 2.334588641917519e-05, "loss": 0.3887597322463989, "num_input_tokens_seen": 10200570048, "step": 35870, "train_runtime": 348787.3616, "train_tokens_per_second": 29245.813 }, { "epoch": 1.269504894882211, "grad_norm": 0.5859375, "learning_rate": 2.3343341991582792e-05, "loss": 0.3919421672821045, "num_input_tokens_seen": 10203438656, "step": 35880, "train_runtime": 348887.7515, "train_tokens_per_second": 29245.62 }, { "epoch": 1.2698587151459397, "grad_norm": 0.6015625, "learning_rate": 2.334079839574732e-05, "loss": 0.38967156410217285, "num_input_tokens_seen": 10206278592, "step": 35890, "train_runtime": 348982.7272, "train_tokens_per_second": 29245.799 }, { "epoch": 1.2702125354096685, "grad_norm": 0.58984375, "learning_rate": 2.333825563121571e-05, "loss": 0.39358320236206057, "num_input_tokens_seen": 10209164416, "step": 35900, "train_runtime": 349081.2782, "train_tokens_per_second": 29245.809 }, { "epoch": 1.2705663556733975, "grad_norm": 0.59375, "learning_rate": 2.333571369753525e-05, "loss": 0.3916492938995361, "num_input_tokens_seen": 10212010368, "step": 35910, "train_runtime": 349179.6844, "train_tokens_per_second": 29245.717 }, { "epoch": 1.270920175937126, "grad_norm": 0.6171875, "learning_rate": 2.3333172594253564e-05, "loss": 0.39238781929016114, "num_input_tokens_seen": 10214850176, "step": 35920, "train_runtime": 349277.039, "train_tokens_per_second": 29245.696 }, { "epoch": 1.271273996200855, "grad_norm": 0.578125, "learning_rate": 2.3330632320918626e-05, "loss": 0.3926822662353516, "num_input_tokens_seen": 10217684864, "step": 35930, "train_runtime": 349374.2686, "train_tokens_per_second": 29245.671 }, { "epoch": 1.2716278164645836, "grad_norm": 0.62890625, "learning_rate": 2.3328092877078757e-05, "loss": 0.38837418556213377, "num_input_tokens_seen": 10220489984, "step": 35940, "train_runtime": 349469.6099, "train_tokens_per_second": 29245.719 }, { "epoch": 1.2719816367283125, "grad_norm": 0.60546875, "learning_rate": 2.3325554262282617e-05, "loss": 0.39333467483520507, "num_input_tokens_seen": 10223374272, "step": 35950, "train_runtime": 349567.8213, "train_tokens_per_second": 29245.753 }, { "epoch": 1.2723354569920413, "grad_norm": 0.65234375, "learning_rate": 2.332301647607922e-05, "loss": 0.38719959259033204, "num_input_tokens_seen": 10226270016, "step": 35960, "train_runtime": 349667.1947, "train_tokens_per_second": 29245.723 }, { "epoch": 1.27268927725577, "grad_norm": 0.58203125, "learning_rate": 2.3320479518017907e-05, "loss": 0.38618924617767336, "num_input_tokens_seen": 10229135040, "step": 35970, "train_runtime": 349763.3216, "train_tokens_per_second": 29245.877 }, { "epoch": 1.2730430975194988, "grad_norm": 0.61328125, "learning_rate": 2.3317943387648372e-05, "loss": 0.39114928245544434, "num_input_tokens_seen": 10232022784, "step": 35980, "train_runtime": 349866.146, "train_tokens_per_second": 29245.535 }, { "epoch": 1.2733969177832276, "grad_norm": 0.59375, "learning_rate": 2.3315408084520653e-05, "loss": 0.3932966232299805, "num_input_tokens_seen": 10234852992, "step": 35990, "train_runtime": 349963.5043, "train_tokens_per_second": 29245.487 }, { "epoch": 1.2737507380469564, "grad_norm": 0.60546875, "learning_rate": 2.3312873608185128e-05, "loss": 0.38701791763305665, "num_input_tokens_seen": 10237701504, "step": 36000, "train_runtime": 350061.0874, "train_tokens_per_second": 29245.471 }, { "epoch": 1.2741045583106851, "grad_norm": 0.58984375, "learning_rate": 2.3310339958192516e-05, "loss": 0.3945901393890381, "num_input_tokens_seen": 10240542208, "step": 36010, "train_runtime": 350158.2051, "train_tokens_per_second": 29245.473 }, { "epoch": 1.274458378574414, "grad_norm": 0.5625, "learning_rate": 2.3307807134093877e-05, "loss": 0.3894914388656616, "num_input_tokens_seen": 10243427712, "step": 36020, "train_runtime": 350258.1559, "train_tokens_per_second": 29245.365 }, { "epoch": 1.2748121988381427, "grad_norm": 0.60546875, "learning_rate": 2.3305275135440616e-05, "loss": 0.3927293300628662, "num_input_tokens_seen": 10246277184, "step": 36030, "train_runtime": 350355.3845, "train_tokens_per_second": 29245.382 }, { "epoch": 1.2751660191018714, "grad_norm": 0.58984375, "learning_rate": 2.3302743961784472e-05, "loss": 0.39076340198516846, "num_input_tokens_seen": 10249089600, "step": 36040, "train_runtime": 350450.8584, "train_tokens_per_second": 29245.44 }, { "epoch": 1.2755198393656002, "grad_norm": 0.59375, "learning_rate": 2.3300213612677545e-05, "loss": 0.38801989555358884, "num_input_tokens_seen": 10252022528, "step": 36050, "train_runtime": 350551.8324, "train_tokens_per_second": 29245.383 }, { "epoch": 1.275873659629329, "grad_norm": 0.58984375, "learning_rate": 2.3297684087672242e-05, "loss": 0.39103810787200927, "num_input_tokens_seen": 10254893120, "step": 36060, "train_runtime": 350647.6531, "train_tokens_per_second": 29245.578 }, { "epoch": 1.2762274798930577, "grad_norm": 0.625, "learning_rate": 2.3295155386321336e-05, "loss": 0.39308369159698486, "num_input_tokens_seen": 10257762624, "step": 36070, "train_runtime": 350745.5495, "train_tokens_per_second": 29245.596 }, { "epoch": 1.2765813001567867, "grad_norm": 0.5859375, "learning_rate": 2.3292627508177933e-05, "loss": 0.3874519824981689, "num_input_tokens_seen": 10260627968, "step": 36080, "train_runtime": 350841.7539, "train_tokens_per_second": 29245.744 }, { "epoch": 1.2769351204205153, "grad_norm": 0.62109375, "learning_rate": 2.3290100452795474e-05, "loss": 0.39218294620513916, "num_input_tokens_seen": 10263424576, "step": 36090, "train_runtime": 350937.0391, "train_tokens_per_second": 29245.772 }, { "epoch": 1.2772889406842443, "grad_norm": 0.6328125, "learning_rate": 2.3287574219727752e-05, "loss": 0.39055254459381106, "num_input_tokens_seen": 10266299072, "step": 36100, "train_runtime": 351038.9557, "train_tokens_per_second": 29245.47 }, { "epoch": 1.277642760947973, "grad_norm": 0.6171875, "learning_rate": 2.3285048808528872e-05, "loss": 0.38941469192504885, "num_input_tokens_seen": 10269100928, "step": 36110, "train_runtime": 351134.099, "train_tokens_per_second": 29245.525 }, { "epoch": 1.2779965812117018, "grad_norm": 0.5859375, "learning_rate": 2.3282524218753308e-05, "loss": 0.39226882457733153, "num_input_tokens_seen": 10271921792, "step": 36120, "train_runtime": 351229.719, "train_tokens_per_second": 29245.594 }, { "epoch": 1.2783504014754306, "grad_norm": 0.59765625, "learning_rate": 2.328000044995586e-05, "loss": 0.3881704330444336, "num_input_tokens_seen": 10274797312, "step": 36130, "train_runtime": 351326.457, "train_tokens_per_second": 29245.726 }, { "epoch": 1.2787042217391593, "grad_norm": 0.59765625, "learning_rate": 2.3277477501691647e-05, "loss": 0.3907644271850586, "num_input_tokens_seen": 10277620416, "step": 36140, "train_runtime": 351422.6468, "train_tokens_per_second": 29245.754 }, { "epoch": 1.279058042002888, "grad_norm": 0.5859375, "learning_rate": 2.3274955373516163e-05, "loss": 0.391316556930542, "num_input_tokens_seen": 10280484224, "step": 36150, "train_runtime": 351519.7564, "train_tokens_per_second": 29245.822 }, { "epoch": 1.2794118622666169, "grad_norm": 0.60546875, "learning_rate": 2.3272434064985205e-05, "loss": 0.3923471450805664, "num_input_tokens_seen": 10283366336, "step": 36160, "train_runtime": 351617.6747, "train_tokens_per_second": 29245.874 }, { "epoch": 1.2797656825303456, "grad_norm": 0.58203125, "learning_rate": 2.3269913575654932e-05, "loss": 0.38865563869476316, "num_input_tokens_seen": 10286268288, "step": 36170, "train_runtime": 351717.6281, "train_tokens_per_second": 29245.814 }, { "epoch": 1.2801195027940744, "grad_norm": 0.59765625, "learning_rate": 2.326739390508182e-05, "loss": 0.39372360706329346, "num_input_tokens_seen": 10289162304, "step": 36180, "train_runtime": 351819.8586, "train_tokens_per_second": 29245.542 }, { "epoch": 1.2804733230578031, "grad_norm": 0.609375, "learning_rate": 2.326487505282269e-05, "loss": 0.3919198751449585, "num_input_tokens_seen": 10291963072, "step": 36190, "train_runtime": 351913.2904, "train_tokens_per_second": 29245.736 }, { "epoch": 1.280827143321532, "grad_norm": 0.6015625, "learning_rate": 2.3262357018434698e-05, "loss": 0.39367635250091554, "num_input_tokens_seen": 10294793920, "step": 36200, "train_runtime": 352009.7273, "train_tokens_per_second": 29245.765 }, { "epoch": 1.2811809635852607, "grad_norm": 0.625, "learning_rate": 2.3259839801475338e-05, "loss": 0.39380860328674316, "num_input_tokens_seen": 10297646528, "step": 36210, "train_runtime": 352107.488, "train_tokens_per_second": 29245.747 }, { "epoch": 1.2815347838489894, "grad_norm": 0.6171875, "learning_rate": 2.325732340150243e-05, "loss": 0.3922597646713257, "num_input_tokens_seen": 10300463360, "step": 36220, "train_runtime": 352203.6652, "train_tokens_per_second": 29245.759 }, { "epoch": 1.2818886041127182, "grad_norm": 0.62109375, "learning_rate": 2.325480781807415e-05, "loss": 0.3932282209396362, "num_input_tokens_seen": 10303317952, "step": 36230, "train_runtime": 352304.2576, "train_tokens_per_second": 29245.511 }, { "epoch": 1.282242424376447, "grad_norm": 0.61328125, "learning_rate": 2.3252293050748975e-05, "loss": 0.3873154640197754, "num_input_tokens_seen": 10306168768, "step": 36240, "train_runtime": 352400.8422, "train_tokens_per_second": 29245.585 }, { "epoch": 1.282596244640176, "grad_norm": 0.59765625, "learning_rate": 2.324977909908575e-05, "loss": 0.39307422637939454, "num_input_tokens_seen": 10308941952, "step": 36250, "train_runtime": 352496.0846, "train_tokens_per_second": 29245.55 }, { "epoch": 1.2829500649039045, "grad_norm": 0.625, "learning_rate": 2.3247265962643632e-05, "loss": 0.39191014766693116, "num_input_tokens_seen": 10311799040, "step": 36260, "train_runtime": 352595.1545, "train_tokens_per_second": 29245.436 }, { "epoch": 1.2833038851676335, "grad_norm": 0.59765625, "learning_rate": 2.3244753640982106e-05, "loss": 0.3940455436706543, "num_input_tokens_seen": 10314670976, "step": 36270, "train_runtime": 352695.7194, "train_tokens_per_second": 29245.24 }, { "epoch": 1.2836577054313623, "grad_norm": 0.62890625, "learning_rate": 2.324224213366102e-05, "loss": 0.3956727981567383, "num_input_tokens_seen": 10317556096, "step": 36280, "train_runtime": 352795.6582, "train_tokens_per_second": 29245.133 }, { "epoch": 1.284011525695091, "grad_norm": 0.609375, "learning_rate": 2.3239731440240538e-05, "loss": 0.3826421022415161, "num_input_tokens_seen": 10320370240, "step": 36290, "train_runtime": 352891.3146, "train_tokens_per_second": 29245.181 }, { "epoch": 1.2843653459588198, "grad_norm": 0.61328125, "learning_rate": 2.3237221560281143e-05, "loss": 0.39660933017730715, "num_input_tokens_seen": 10323213696, "step": 36300, "train_runtime": 352991.1144, "train_tokens_per_second": 29244.968 }, { "epoch": 1.2847191662225486, "grad_norm": 0.61328125, "learning_rate": 2.3234712493343673e-05, "loss": 0.39238438606262205, "num_input_tokens_seen": 10326142016, "step": 36310, "train_runtime": 353091.1406, "train_tokens_per_second": 29244.976 }, { "epoch": 1.2850729864862773, "grad_norm": 0.625, "learning_rate": 2.323220423898928e-05, "loss": 0.39208695888519285, "num_input_tokens_seen": 10329028416, "step": 36320, "train_runtime": 353189.9915, "train_tokens_per_second": 29244.964 }, { "epoch": 1.285426806750006, "grad_norm": 0.58203125, "learning_rate": 2.3229696796779456e-05, "loss": 0.39110984802246096, "num_input_tokens_seen": 10331877632, "step": 36330, "train_runtime": 353286.6885, "train_tokens_per_second": 29245.024 }, { "epoch": 1.2857806270137349, "grad_norm": 0.55859375, "learning_rate": 2.3227190166276033e-05, "loss": 0.3885376453399658, "num_input_tokens_seen": 10334730560, "step": 36340, "train_runtime": 353382.0732, "train_tokens_per_second": 29245.203 }, { "epoch": 1.2861344472774636, "grad_norm": 0.59375, "learning_rate": 2.3224684347041153e-05, "loss": 0.3953958511352539, "num_input_tokens_seen": 10337580928, "step": 36350, "train_runtime": 353479.2301, "train_tokens_per_second": 29245.229 }, { "epoch": 1.2864882675411924, "grad_norm": 0.60546875, "learning_rate": 2.3222179338637306e-05, "loss": 0.3921929597854614, "num_input_tokens_seen": 10340425472, "step": 36360, "train_runtime": 353576.0464, "train_tokens_per_second": 29245.266 }, { "epoch": 1.2868420878049212, "grad_norm": 0.6171875, "learning_rate": 2.3219675140627302e-05, "loss": 0.38900277614593504, "num_input_tokens_seen": 10343287040, "step": 36370, "train_runtime": 353672.324, "train_tokens_per_second": 29245.396 }, { "epoch": 1.28719590806865, "grad_norm": 0.59765625, "learning_rate": 2.3217171752574292e-05, "loss": 0.39088029861450196, "num_input_tokens_seen": 10346137920, "step": 36380, "train_runtime": 353769.0309, "train_tokens_per_second": 29245.46 }, { "epoch": 1.2875497283323787, "grad_norm": 0.6640625, "learning_rate": 2.3214669174041745e-05, "loss": 0.3967722415924072, "num_input_tokens_seen": 10348913664, "step": 36390, "train_runtime": 353861.0586, "train_tokens_per_second": 29245.698 }, { "epoch": 1.2879035485961077, "grad_norm": 0.62890625, "learning_rate": 2.321216740459346e-05, "loss": 0.3920655012130737, "num_input_tokens_seen": 10351740544, "step": 36400, "train_runtime": 353956.1517, "train_tokens_per_second": 29245.827 }, { "epoch": 1.2882573688598362, "grad_norm": 0.609375, "learning_rate": 2.3209666443793578e-05, "loss": 0.39097981452941893, "num_input_tokens_seen": 10354564224, "step": 36410, "train_runtime": 354054.1439, "train_tokens_per_second": 29245.708 }, { "epoch": 1.2886111891235652, "grad_norm": 0.59765625, "learning_rate": 2.3207166291206553e-05, "loss": 0.3885443449020386, "num_input_tokens_seen": 10357410304, "step": 36420, "train_runtime": 354151.5021, "train_tokens_per_second": 29245.705 }, { "epoch": 1.2889650093872937, "grad_norm": 0.58984375, "learning_rate": 2.3204666946397175e-05, "loss": 0.3927842378616333, "num_input_tokens_seen": 10360279296, "step": 36430, "train_runtime": 354249.9769, "train_tokens_per_second": 29245.674 }, { "epoch": 1.2893188296510227, "grad_norm": 0.58984375, "learning_rate": 2.3202168408930565e-05, "loss": 0.39349889755249023, "num_input_tokens_seen": 10363111616, "step": 36440, "train_runtime": 354346.4421, "train_tokens_per_second": 29245.705 }, { "epoch": 1.2896726499147515, "grad_norm": 0.6015625, "learning_rate": 2.3199670678372166e-05, "loss": 0.3919225692749023, "num_input_tokens_seen": 10365997312, "step": 36450, "train_runtime": 354445.3674, "train_tokens_per_second": 29245.684 }, { "epoch": 1.2900264701784803, "grad_norm": 0.578125, "learning_rate": 2.3197173754287747e-05, "loss": 0.388189959526062, "num_input_tokens_seen": 10368827776, "step": 36460, "train_runtime": 354538.5494, "train_tokens_per_second": 29245.981 }, { "epoch": 1.290380290442209, "grad_norm": 0.6015625, "learning_rate": 2.319467763624341e-05, "loss": 0.3922209978103638, "num_input_tokens_seen": 10371667456, "step": 36470, "train_runtime": 354634.5094, "train_tokens_per_second": 29246.075 }, { "epoch": 1.2907341107059378, "grad_norm": 0.6015625, "learning_rate": 2.3192182323805577e-05, "loss": 0.38714075088500977, "num_input_tokens_seen": 10374532864, "step": 36480, "train_runtime": 354734.4045, "train_tokens_per_second": 29245.917 }, { "epoch": 1.2910879309696666, "grad_norm": 0.6171875, "learning_rate": 2.318968781654101e-05, "loss": 0.39092111587524414, "num_input_tokens_seen": 10377353600, "step": 36490, "train_runtime": 354828.4586, "train_tokens_per_second": 29246.114 }, { "epoch": 1.2914417512333953, "grad_norm": 0.6171875, "learning_rate": 2.3187194114016778e-05, "loss": 0.39103260040283205, "num_input_tokens_seen": 10380203328, "step": 36500, "train_runtime": 354924.7475, "train_tokens_per_second": 29246.209 }, { "epoch": 1.291795571497124, "grad_norm": 0.60546875, "learning_rate": 2.318470121580029e-05, "loss": 0.39037678241729734, "num_input_tokens_seen": 10383002688, "step": 36510, "train_runtime": 355020.5526, "train_tokens_per_second": 29246.202 }, { "epoch": 1.2921493917608529, "grad_norm": 0.5859375, "learning_rate": 2.318220912145927e-05, "loss": 0.39055805206298827, "num_input_tokens_seen": 10385819840, "step": 36520, "train_runtime": 355117.4685, "train_tokens_per_second": 29246.153 }, { "epoch": 1.2925032120245816, "grad_norm": 0.59375, "learning_rate": 2.3179717830561783e-05, "loss": 0.3888389110565186, "num_input_tokens_seen": 10388652800, "step": 36530, "train_runtime": 355212.3957, "train_tokens_per_second": 29246.313 }, { "epoch": 1.2928570322883104, "grad_norm": 0.59765625, "learning_rate": 2.3177227342676204e-05, "loss": 0.3895245552062988, "num_input_tokens_seen": 10391493696, "step": 36540, "train_runtime": 355310.1496, "train_tokens_per_second": 29246.262 }, { "epoch": 1.2932108525520392, "grad_norm": 0.5625, "learning_rate": 2.317473765737124e-05, "loss": 0.38902356624603274, "num_input_tokens_seen": 10394314816, "step": 36550, "train_runtime": 355406.287, "train_tokens_per_second": 29246.289 }, { "epoch": 1.293564672815768, "grad_norm": 0.58203125, "learning_rate": 2.317224877421591e-05, "loss": 0.3910688877105713, "num_input_tokens_seen": 10397156672, "step": 36560, "train_runtime": 355502.9464, "train_tokens_per_second": 29246.331 }, { "epoch": 1.293918493079497, "grad_norm": 0.58984375, "learning_rate": 2.3169760692779578e-05, "loss": 0.39177327156066893, "num_input_tokens_seen": 10400008960, "step": 36570, "train_runtime": 355601.1802, "train_tokens_per_second": 29246.272 }, { "epoch": 1.2942723133432255, "grad_norm": 0.6171875, "learning_rate": 2.316727341263191e-05, "loss": 0.3879788875579834, "num_input_tokens_seen": 10402812224, "step": 36580, "train_runtime": 355698.4023, "train_tokens_per_second": 29246.16 }, { "epoch": 1.2946261336069544, "grad_norm": 0.62109375, "learning_rate": 2.3164786933342915e-05, "loss": 0.39709744453430174, "num_input_tokens_seen": 10405665600, "step": 36590, "train_runtime": 355796.0953, "train_tokens_per_second": 29246.149 }, { "epoch": 1.294979953870683, "grad_norm": 0.609375, "learning_rate": 2.3162301254482914e-05, "loss": 0.39253203868865966, "num_input_tokens_seen": 10408514944, "step": 36600, "train_runtime": 355893.6424, "train_tokens_per_second": 29246.139 }, { "epoch": 1.295333774134412, "grad_norm": 0.58203125, "learning_rate": 2.3159816375622546e-05, "loss": 0.38924694061279297, "num_input_tokens_seen": 10411365760, "step": 36610, "train_runtime": 355991.4874, "train_tokens_per_second": 29246.109 }, { "epoch": 1.2956875943981407, "grad_norm": 0.5703125, "learning_rate": 2.3157332296332783e-05, "loss": 0.3876067638397217, "num_input_tokens_seen": 10414225920, "step": 36620, "train_runtime": 356089.5858, "train_tokens_per_second": 29246.084 }, { "epoch": 1.2960414146618695, "grad_norm": 0.61328125, "learning_rate": 2.3154849016184914e-05, "loss": 0.3923532485961914, "num_input_tokens_seen": 10417155072, "step": 36630, "train_runtime": 356192.2649, "train_tokens_per_second": 29245.877 }, { "epoch": 1.2963952349255983, "grad_norm": 0.625, "learning_rate": 2.3152366534750554e-05, "loss": 0.38785197734832766, "num_input_tokens_seen": 10420005760, "step": 36640, "train_runtime": 356289.3908, "train_tokens_per_second": 29245.905 }, { "epoch": 1.296749055189327, "grad_norm": 0.625, "learning_rate": 2.3149884851601633e-05, "loss": 0.38750295639038085, "num_input_tokens_seen": 10422820672, "step": 36650, "train_runtime": 356386.0458, "train_tokens_per_second": 29245.872 }, { "epoch": 1.2971028754530558, "grad_norm": 0.58984375, "learning_rate": 2.31474039663104e-05, "loss": 0.3918515920639038, "num_input_tokens_seen": 10425622016, "step": 36660, "train_runtime": 356479.0735, "train_tokens_per_second": 29246.098 }, { "epoch": 1.2974566957167846, "grad_norm": 0.6171875, "learning_rate": 2.314492387844944e-05, "loss": 0.39035797119140625, "num_input_tokens_seen": 10428388224, "step": 36670, "train_runtime": 356576.1579, "train_tokens_per_second": 29245.893 }, { "epoch": 1.2978105159805133, "grad_norm": 0.61328125, "learning_rate": 2.314244458759163e-05, "loss": 0.3924812078475952, "num_input_tokens_seen": 10431217152, "step": 36680, "train_runtime": 356674.9117, "train_tokens_per_second": 29245.727 }, { "epoch": 1.298164336244242, "grad_norm": 0.6328125, "learning_rate": 2.3139966093310202e-05, "loss": 0.38553104400634763, "num_input_tokens_seen": 10434115456, "step": 36690, "train_runtime": 356771.6916, "train_tokens_per_second": 29245.917 }, { "epoch": 1.2985181565079709, "grad_norm": 0.61328125, "learning_rate": 2.3137488395178695e-05, "loss": 0.389219331741333, "num_input_tokens_seen": 10436962176, "step": 36700, "train_runtime": 356868.3728, "train_tokens_per_second": 29245.971 }, { "epoch": 1.2988719767716996, "grad_norm": 0.58984375, "learning_rate": 2.313501149277095e-05, "loss": 0.38736035823822024, "num_input_tokens_seen": 10439813568, "step": 36710, "train_runtime": 356964.1742, "train_tokens_per_second": 29246.11 }, { "epoch": 1.2992257970354284, "grad_norm": 0.6171875, "learning_rate": 2.3132535385661143e-05, "loss": 0.39359226226806643, "num_input_tokens_seen": 10442624128, "step": 36720, "train_runtime": 357060.1122, "train_tokens_per_second": 29246.123 }, { "epoch": 1.2995796172991572, "grad_norm": 0.6015625, "learning_rate": 2.313006007342377e-05, "loss": 0.39149534702301025, "num_input_tokens_seen": 10445464384, "step": 36730, "train_runtime": 357155.96, "train_tokens_per_second": 29246.227 }, { "epoch": 1.2999334375628862, "grad_norm": 0.578125, "learning_rate": 2.312758555563365e-05, "loss": 0.3922810316085815, "num_input_tokens_seen": 10448279744, "step": 36740, "train_runtime": 357251.4893, "train_tokens_per_second": 29246.287 }, { "epoch": 1.3002872578266147, "grad_norm": 0.6015625, "learning_rate": 2.3125111831865908e-05, "loss": 0.3928556442260742, "num_input_tokens_seen": 10451154112, "step": 36750, "train_runtime": 357351.5242, "train_tokens_per_second": 29246.144 }, { "epoch": 1.3006410780903437, "grad_norm": 0.6171875, "learning_rate": 2.3122638901695983e-05, "loss": 0.3899819374084473, "num_input_tokens_seen": 10454018944, "step": 36760, "train_runtime": 357452.2415, "train_tokens_per_second": 29245.918 }, { "epoch": 1.3009948983540722, "grad_norm": 0.60546875, "learning_rate": 2.3120166764699654e-05, "loss": 0.39181995391845703, "num_input_tokens_seen": 10456844672, "step": 36770, "train_runtime": 357549.7234, "train_tokens_per_second": 29245.847 }, { "epoch": 1.3013487186178012, "grad_norm": 0.63671875, "learning_rate": 2.3117695420453e-05, "loss": 0.39190337657928465, "num_input_tokens_seen": 10459667520, "step": 36780, "train_runtime": 357645.8494, "train_tokens_per_second": 29245.88 }, { "epoch": 1.30170253888153, "grad_norm": 0.59765625, "learning_rate": 2.3115224868532416e-05, "loss": 0.39562134742736815, "num_input_tokens_seen": 10462504000, "step": 36790, "train_runtime": 357741.0773, "train_tokens_per_second": 29246.024 }, { "epoch": 1.3020563591452587, "grad_norm": 0.6015625, "learning_rate": 2.3112755108514628e-05, "loss": 0.3894166946411133, "num_input_tokens_seen": 10465319296, "step": 36800, "train_runtime": 357835.7976, "train_tokens_per_second": 29246.15 }, { "epoch": 1.3024101794089875, "grad_norm": 0.62890625, "learning_rate": 2.311028613997666e-05, "loss": 0.39465794563293455, "num_input_tokens_seen": 10468055424, "step": 36810, "train_runtime": 357927.6291, "train_tokens_per_second": 29246.291 }, { "epoch": 1.3027639996727163, "grad_norm": 0.61328125, "learning_rate": 2.3107817962495873e-05, "loss": 0.38817002773284914, "num_input_tokens_seen": 10470895104, "step": 36820, "train_runtime": 358023.7671, "train_tokens_per_second": 29246.369 }, { "epoch": 1.303117819936445, "grad_norm": 0.59375, "learning_rate": 2.3105350575649924e-05, "loss": 0.3915217399597168, "num_input_tokens_seen": 10473714944, "step": 36830, "train_runtime": 358119.1685, "train_tokens_per_second": 29246.452 }, { "epoch": 1.3034716402001738, "grad_norm": 0.6015625, "learning_rate": 2.31028839790168e-05, "loss": 0.38786485195159914, "num_input_tokens_seen": 10476587264, "step": 36840, "train_runtime": 358214.9748, "train_tokens_per_second": 29246.648 }, { "epoch": 1.3038254604639026, "grad_norm": 0.6015625, "learning_rate": 2.310041817217479e-05, "loss": 0.3925775051116943, "num_input_tokens_seen": 10479458496, "step": 36850, "train_runtime": 358312.5866, "train_tokens_per_second": 29246.694 }, { "epoch": 1.3041792807276313, "grad_norm": 0.58203125, "learning_rate": 2.3097953154702514e-05, "loss": 0.3880384683609009, "num_input_tokens_seen": 10482322368, "step": 36860, "train_runtime": 358409.6312, "train_tokens_per_second": 29246.765 }, { "epoch": 1.30453310099136, "grad_norm": 0.59765625, "learning_rate": 2.3095488926178896e-05, "loss": 0.3910287618637085, "num_input_tokens_seen": 10485198720, "step": 36870, "train_runtime": 358507.8019, "train_tokens_per_second": 29246.78 }, { "epoch": 1.3048869212550889, "grad_norm": 0.6015625, "learning_rate": 2.3093025486183175e-05, "loss": 0.39112653732299807, "num_input_tokens_seen": 10488079168, "step": 36880, "train_runtime": 358605.28, "train_tokens_per_second": 29246.862 }, { "epoch": 1.3052407415188176, "grad_norm": 0.6171875, "learning_rate": 2.3090562834294908e-05, "loss": 0.38792574405670166, "num_input_tokens_seen": 10490917376, "step": 36890, "train_runtime": 358703.1434, "train_tokens_per_second": 29246.795 }, { "epoch": 1.3055945617825464, "grad_norm": 0.58984375, "learning_rate": 2.3088100970093966e-05, "loss": 0.38968286514282224, "num_input_tokens_seen": 10493685440, "step": 36900, "train_runtime": 358797.598, "train_tokens_per_second": 29246.811 }, { "epoch": 1.3059483820462754, "grad_norm": 0.609375, "learning_rate": 2.3085639893160527e-05, "loss": 0.39174542427062986, "num_input_tokens_seen": 10496578880, "step": 36910, "train_runtime": 358899.126, "train_tokens_per_second": 29246.599 }, { "epoch": 1.306302202310004, "grad_norm": 0.63671875, "learning_rate": 2.3083179603075084e-05, "loss": 0.3913600444793701, "num_input_tokens_seen": 10499381056, "step": 36920, "train_runtime": 358995.3682, "train_tokens_per_second": 29246.564 }, { "epoch": 1.306656022573733, "grad_norm": 0.62109375, "learning_rate": 2.308072009941845e-05, "loss": 0.3898455619812012, "num_input_tokens_seen": 10502223168, "step": 36930, "train_runtime": 359091.1348, "train_tokens_per_second": 29246.679 }, { "epoch": 1.3070098428374615, "grad_norm": 0.609375, "learning_rate": 2.3078261381771748e-05, "loss": 0.39620747566223147, "num_input_tokens_seen": 10505056384, "step": 36940, "train_runtime": 359190.0985, "train_tokens_per_second": 29246.509 }, { "epoch": 1.3073636631011905, "grad_norm": 0.609375, "learning_rate": 2.3075803449716407e-05, "loss": 0.388875150680542, "num_input_tokens_seen": 10507953088, "step": 36950, "train_runtime": 359290.4044, "train_tokens_per_second": 29246.406 }, { "epoch": 1.3077174833649192, "grad_norm": 0.58984375, "learning_rate": 2.3073346302834174e-05, "loss": 0.38850765228271483, "num_input_tokens_seen": 10510797760, "step": 36960, "train_runtime": 359386.994, "train_tokens_per_second": 29246.461 }, { "epoch": 1.308071303628648, "grad_norm": 0.59375, "learning_rate": 2.3070889940707103e-05, "loss": 0.3870737552642822, "num_input_tokens_seen": 10513629440, "step": 36970, "train_runtime": 359481.5065, "train_tokens_per_second": 29246.649 }, { "epoch": 1.3084251238923768, "grad_norm": 0.61328125, "learning_rate": 2.3068434362917562e-05, "loss": 0.3883809566497803, "num_input_tokens_seen": 10516463040, "step": 36980, "train_runtime": 359579.0445, "train_tokens_per_second": 29246.596 }, { "epoch": 1.3087789441561055, "grad_norm": 0.62109375, "learning_rate": 2.3065979569048235e-05, "loss": 0.3883203983306885, "num_input_tokens_seen": 10519315840, "step": 36990, "train_runtime": 359677.9472, "train_tokens_per_second": 29246.485 }, { "epoch": 1.3091327644198343, "grad_norm": 0.609375, "learning_rate": 2.306352555868211e-05, "loss": 0.39303610324859617, "num_input_tokens_seen": 10522161280, "step": 37000, "train_runtime": 359779.6993, "train_tokens_per_second": 29246.123 }, { "epoch": 1.309486584683563, "grad_norm": 0.62109375, "learning_rate": 2.3061072331402486e-05, "loss": 0.38878188133239744, "num_input_tokens_seen": 10525001856, "step": 37010, "train_runtime": 359877.1936, "train_tokens_per_second": 29246.093 }, { "epoch": 1.3098404049472918, "grad_norm": 0.59765625, "learning_rate": 2.3058619886792977e-05, "loss": 0.3925739288330078, "num_input_tokens_seen": 10527894912, "step": 37020, "train_runtime": 359978.4156, "train_tokens_per_second": 29245.906 }, { "epoch": 1.3101942252110206, "grad_norm": 0.6015625, "learning_rate": 2.30561682244375e-05, "loss": 0.391937255859375, "num_input_tokens_seen": 10530746304, "step": 37030, "train_runtime": 360076.1454, "train_tokens_per_second": 29245.887 }, { "epoch": 1.3105480454747493, "grad_norm": 0.6015625, "learning_rate": 2.3053717343920285e-05, "loss": 0.3854072093963623, "num_input_tokens_seen": 10533536064, "step": 37040, "train_runtime": 360167.7451, "train_tokens_per_second": 29246.195 }, { "epoch": 1.3109018657384781, "grad_norm": 0.60546875, "learning_rate": 2.3051267244825882e-05, "loss": 0.38942029476165774, "num_input_tokens_seen": 10536402112, "step": 37050, "train_runtime": 360267.4987, "train_tokens_per_second": 29246.052 }, { "epoch": 1.3112556860022069, "grad_norm": 0.59765625, "learning_rate": 2.3048817926739122e-05, "loss": 0.38984384536743166, "num_input_tokens_seen": 10539198208, "step": 37060, "train_runtime": 360362.529, "train_tokens_per_second": 29246.099 }, { "epoch": 1.3116095062659356, "grad_norm": 0.60546875, "learning_rate": 2.3046369389245177e-05, "loss": 0.39116687774658204, "num_input_tokens_seen": 10542040704, "step": 37070, "train_runtime": 360459.2542, "train_tokens_per_second": 29246.137 }, { "epoch": 1.3119633265296646, "grad_norm": 0.609375, "learning_rate": 2.3043921631929502e-05, "loss": 0.3927873134613037, "num_input_tokens_seen": 10544857600, "step": 37080, "train_runtime": 360554.3536, "train_tokens_per_second": 29246.236 }, { "epoch": 1.3123171467933932, "grad_norm": 0.60546875, "learning_rate": 2.304147465437788e-05, "loss": 0.39102873802185056, "num_input_tokens_seen": 10547648128, "step": 37090, "train_runtime": 360651.1462, "train_tokens_per_second": 29246.124 }, { "epoch": 1.3126709670571222, "grad_norm": 0.609375, "learning_rate": 2.3039028456176388e-05, "loss": 0.3926230907440186, "num_input_tokens_seen": 10550496320, "step": 37100, "train_runtime": 360749.5896, "train_tokens_per_second": 29246.038 }, { "epoch": 1.313024787320851, "grad_norm": 0.5859375, "learning_rate": 2.3036583036911418e-05, "loss": 0.39110236167907714, "num_input_tokens_seen": 10553359488, "step": 37110, "train_runtime": 360848.9736, "train_tokens_per_second": 29245.918 }, { "epoch": 1.3133786075845797, "grad_norm": 0.62109375, "learning_rate": 2.3034138396169667e-05, "loss": 0.3842885971069336, "num_input_tokens_seen": 10556238080, "step": 37120, "train_runtime": 360949.0415, "train_tokens_per_second": 29245.785 }, { "epoch": 1.3137324278483085, "grad_norm": 0.609375, "learning_rate": 2.3031694533538127e-05, "loss": 0.3885584115982056, "num_input_tokens_seen": 10559099584, "step": 37130, "train_runtime": 361045.5472, "train_tokens_per_second": 29245.893 }, { "epoch": 1.3140862481120372, "grad_norm": 0.6015625, "learning_rate": 2.302925144860413e-05, "loss": 0.3924171686172485, "num_input_tokens_seen": 10561887616, "step": 37140, "train_runtime": 361137.2381, "train_tokens_per_second": 29246.188 }, { "epoch": 1.314440068375766, "grad_norm": 0.625, "learning_rate": 2.302680914095527e-05, "loss": 0.38936653137207033, "num_input_tokens_seen": 10564708288, "step": 37150, "train_runtime": 361233.1305, "train_tokens_per_second": 29246.233 }, { "epoch": 1.3147938886394948, "grad_norm": 0.6015625, "learning_rate": 2.3024367610179485e-05, "loss": 0.39456074237823485, "num_input_tokens_seen": 10567546368, "step": 37160, "train_runtime": 361329.6712, "train_tokens_per_second": 29246.273 }, { "epoch": 1.3151477089032235, "grad_norm": 0.62109375, "learning_rate": 2.3021926855864995e-05, "loss": 0.3941436767578125, "num_input_tokens_seen": 10570346432, "step": 37170, "train_runtime": 361423.3379, "train_tokens_per_second": 29246.441 }, { "epoch": 1.3155015291669523, "grad_norm": 0.6015625, "learning_rate": 2.3019486877600337e-05, "loss": 0.3912742376327515, "num_input_tokens_seen": 10573251008, "step": 37180, "train_runtime": 361525.5141, "train_tokens_per_second": 29246.21 }, { "epoch": 1.315855349430681, "grad_norm": 0.62109375, "learning_rate": 2.3017047674974354e-05, "loss": 0.3891000270843506, "num_input_tokens_seen": 10576018752, "step": 37190, "train_runtime": 361620.103, "train_tokens_per_second": 29246.214 }, { "epoch": 1.3162091696944098, "grad_norm": 0.60546875, "learning_rate": 2.301460924757618e-05, "loss": 0.38751907348632814, "num_input_tokens_seen": 10578802304, "step": 37200, "train_runtime": 361712.2268, "train_tokens_per_second": 29246.46 }, { "epoch": 1.3165629899581386, "grad_norm": 0.625, "learning_rate": 2.3012171594995272e-05, "loss": 0.39267170429229736, "num_input_tokens_seen": 10581651136, "step": 37210, "train_runtime": 361809.9441, "train_tokens_per_second": 29246.435 }, { "epoch": 1.3169168102218674, "grad_norm": 0.62890625, "learning_rate": 2.3009734716821385e-05, "loss": 0.3916393995285034, "num_input_tokens_seen": 10584571264, "step": 37220, "train_runtime": 361911.3705, "train_tokens_per_second": 29246.308 }, { "epoch": 1.3172706304855961, "grad_norm": 0.60546875, "learning_rate": 2.3007298612644562e-05, "loss": 0.3918531656265259, "num_input_tokens_seen": 10587413376, "step": 37230, "train_runtime": 362007.2937, "train_tokens_per_second": 29246.409 }, { "epoch": 1.3176244507493249, "grad_norm": 0.62890625, "learning_rate": 2.3004863282055178e-05, "loss": 0.3942422866821289, "num_input_tokens_seen": 10590196160, "step": 37240, "train_runtime": 362101.6099, "train_tokens_per_second": 29246.476 }, { "epoch": 1.3179782710130539, "grad_norm": 0.625, "learning_rate": 2.300242872464389e-05, "loss": 0.3919389247894287, "num_input_tokens_seen": 10593082240, "step": 37250, "train_runtime": 362200.9103, "train_tokens_per_second": 29246.426 }, { "epoch": 1.3183320912767824, "grad_norm": 0.62109375, "learning_rate": 2.299999494000167e-05, "loss": 0.3921942949295044, "num_input_tokens_seen": 10595914944, "step": 37260, "train_runtime": 362298.88, "train_tokens_per_second": 29246.336 }, { "epoch": 1.3186859115405114, "grad_norm": 0.60546875, "learning_rate": 2.299756192771979e-05, "loss": 0.3891026973724365, "num_input_tokens_seen": 10598733952, "step": 37270, "train_runtime": 362393.0457, "train_tokens_per_second": 29246.516 }, { "epoch": 1.3190397318042402, "grad_norm": 0.61328125, "learning_rate": 2.299512968738981e-05, "loss": 0.3897572040557861, "num_input_tokens_seen": 10601590592, "step": 37280, "train_runtime": 362492.5509, "train_tokens_per_second": 29246.368 }, { "epoch": 1.319393552067969, "grad_norm": 0.6171875, "learning_rate": 2.2992698218603617e-05, "loss": 0.39164884090423585, "num_input_tokens_seen": 10604454208, "step": 37290, "train_runtime": 362589.9875, "train_tokens_per_second": 29246.407 }, { "epoch": 1.3197473723316977, "grad_norm": 0.59375, "learning_rate": 2.2990267520953383e-05, "loss": 0.3887930870056152, "num_input_tokens_seen": 10607281792, "step": 37300, "train_runtime": 362687.7187, "train_tokens_per_second": 29246.322 }, { "epoch": 1.3201011925954265, "grad_norm": 0.625, "learning_rate": 2.2987837594031587e-05, "loss": 0.3866581916809082, "num_input_tokens_seen": 10610142208, "step": 37310, "train_runtime": 362787.1685, "train_tokens_per_second": 29246.189 }, { "epoch": 1.3204550128591552, "grad_norm": 0.59375, "learning_rate": 2.2985408437431016e-05, "loss": 0.38734891414642336, "num_input_tokens_seen": 10613000000, "step": 37320, "train_runtime": 362883.2676, "train_tokens_per_second": 29246.32 }, { "epoch": 1.320808833122884, "grad_norm": 0.60546875, "learning_rate": 2.2982980050744743e-05, "loss": 0.39428086280822755, "num_input_tokens_seen": 10615812480, "step": 37330, "train_runtime": 362979.1906, "train_tokens_per_second": 29246.339 }, { "epoch": 1.3211626533866128, "grad_norm": 0.578125, "learning_rate": 2.2980552433566154e-05, "loss": 0.3905577421188354, "num_input_tokens_seen": 10618701824, "step": 37340, "train_runtime": 363080.3312, "train_tokens_per_second": 29246.15 }, { "epoch": 1.3215164736503415, "grad_norm": 0.60546875, "learning_rate": 2.297812558548893e-05, "loss": 0.3894331932067871, "num_input_tokens_seen": 10621494208, "step": 37350, "train_runtime": 363172.9061, "train_tokens_per_second": 29246.384 }, { "epoch": 1.3218702939140703, "grad_norm": 0.59765625, "learning_rate": 2.2975699506107056e-05, "loss": 0.39195420742034914, "num_input_tokens_seen": 10624335168, "step": 37360, "train_runtime": 363272.1554, "train_tokens_per_second": 29246.214 }, { "epoch": 1.322224114177799, "grad_norm": 0.59765625, "learning_rate": 2.2973274195014816e-05, "loss": 0.3894282102584839, "num_input_tokens_seen": 10627284608, "step": 37370, "train_runtime": 363376.8585, "train_tokens_per_second": 29245.904 }, { "epoch": 1.3225779344415278, "grad_norm": 0.58203125, "learning_rate": 2.2970849651806796e-05, "loss": 0.3907696962356567, "num_input_tokens_seen": 10630163712, "step": 37380, "train_runtime": 363474.0165, "train_tokens_per_second": 29246.007 }, { "epoch": 1.3229317547052566, "grad_norm": 0.6015625, "learning_rate": 2.2968425876077866e-05, "loss": 0.39137604236602785, "num_input_tokens_seen": 10633005760, "step": 37390, "train_runtime": 363570.2619, "train_tokens_per_second": 29246.082 }, { "epoch": 1.3232855749689856, "grad_norm": 0.57421875, "learning_rate": 2.2966002867423225e-05, "loss": 0.391874885559082, "num_input_tokens_seen": 10635808064, "step": 37400, "train_runtime": 363667.7049, "train_tokens_per_second": 29245.952 }, { "epoch": 1.3236393952327141, "grad_norm": 0.6015625, "learning_rate": 2.296358062543834e-05, "loss": 0.3922929525375366, "num_input_tokens_seen": 10638664576, "step": 37410, "train_runtime": 363767.4395, "train_tokens_per_second": 29245.786 }, { "epoch": 1.323993215496443, "grad_norm": 0.62109375, "learning_rate": 2.2961159149718993e-05, "loss": 0.3879826545715332, "num_input_tokens_seen": 10641406976, "step": 37420, "train_runtime": 363859.8428, "train_tokens_per_second": 29245.896 }, { "epoch": 1.3243470357601717, "grad_norm": 0.60546875, "learning_rate": 2.295873843986126e-05, "loss": 0.39168686866760255, "num_input_tokens_seen": 10644213824, "step": 37430, "train_runtime": 363956.1724, "train_tokens_per_second": 29245.867 }, { "epoch": 1.3247008560239006, "grad_norm": 0.5703125, "learning_rate": 2.2956318495461526e-05, "loss": 0.3887831687927246, "num_input_tokens_seen": 10647067776, "step": 37440, "train_runtime": 364055.0182, "train_tokens_per_second": 29245.766 }, { "epoch": 1.3250546762876294, "grad_norm": 0.625, "learning_rate": 2.295389931611645e-05, "loss": 0.39048161506652834, "num_input_tokens_seen": 10649914880, "step": 37450, "train_runtime": 364150.4294, "train_tokens_per_second": 29245.922 }, { "epoch": 1.3254084965513582, "grad_norm": 0.61328125, "learning_rate": 2.2951480901423017e-05, "loss": 0.3884414196014404, "num_input_tokens_seen": 10652834368, "step": 37460, "train_runtime": 364252.4646, "train_tokens_per_second": 29245.744 }, { "epoch": 1.325762316815087, "grad_norm": 0.59375, "learning_rate": 2.294906325097848e-05, "loss": 0.39214463233947755, "num_input_tokens_seen": 10655695232, "step": 37470, "train_runtime": 364349.9782, "train_tokens_per_second": 29245.769 }, { "epoch": 1.3261161370788157, "grad_norm": 0.59765625, "learning_rate": 2.2946646364380415e-05, "loss": 0.39381585121154783, "num_input_tokens_seen": 10658500800, "step": 37480, "train_runtime": 364445.9941, "train_tokens_per_second": 29245.762 }, { "epoch": 1.3264699573425445, "grad_norm": 0.6015625, "learning_rate": 2.294423024122668e-05, "loss": 0.38974153995513916, "num_input_tokens_seen": 10661347136, "step": 37490, "train_runtime": 364543.7907, "train_tokens_per_second": 29245.724 }, { "epoch": 1.3268237776062732, "grad_norm": 0.6328125, "learning_rate": 2.2941814881115428e-05, "loss": 0.3915058374404907, "num_input_tokens_seen": 10664161344, "step": 37500, "train_runtime": 364640.5279, "train_tokens_per_second": 29245.683 }, { "epoch": 1.327177597870002, "grad_norm": 0.6015625, "learning_rate": 2.293940028364512e-05, "loss": 0.3865213871002197, "num_input_tokens_seen": 10666978752, "step": 37510, "train_runtime": 364738.2333, "train_tokens_per_second": 29245.573 }, { "epoch": 1.3275314181337308, "grad_norm": 0.57421875, "learning_rate": 2.2936986448414498e-05, "loss": 0.38599205017089844, "num_input_tokens_seen": 10669854080, "step": 37520, "train_runtime": 364835.1879, "train_tokens_per_second": 29245.683 }, { "epoch": 1.3278852383974595, "grad_norm": 0.6171875, "learning_rate": 2.2934573375022613e-05, "loss": 0.39447388648986814, "num_input_tokens_seen": 10672654272, "step": 37530, "train_runtime": 364931.9291, "train_tokens_per_second": 29245.603 }, { "epoch": 1.3282390586611883, "grad_norm": 0.5859375, "learning_rate": 2.2932161063068803e-05, "loss": 0.3906829357147217, "num_input_tokens_seen": 10675512896, "step": 37540, "train_runtime": 365030.3218, "train_tokens_per_second": 29245.551 }, { "epoch": 1.328592878924917, "grad_norm": 0.60546875, "learning_rate": 2.29297495121527e-05, "loss": 0.3903957366943359, "num_input_tokens_seen": 10678393792, "step": 37550, "train_runtime": 365129.2312, "train_tokens_per_second": 29245.519 }, { "epoch": 1.3289466991886458, "grad_norm": 0.60546875, "learning_rate": 2.2927338721874245e-05, "loss": 0.39175052642822267, "num_input_tokens_seen": 10681257408, "step": 37560, "train_runtime": 365228.3417, "train_tokens_per_second": 29245.423 }, { "epoch": 1.3293005194523748, "grad_norm": 0.6328125, "learning_rate": 2.2924928691833646e-05, "loss": 0.3884971857070923, "num_input_tokens_seen": 10684109248, "step": 37570, "train_runtime": 365324.8351, "train_tokens_per_second": 29245.505 }, { "epoch": 1.3296543397161034, "grad_norm": 0.6328125, "learning_rate": 2.292251942163143e-05, "loss": 0.39147922992706297, "num_input_tokens_seen": 10686949504, "step": 37580, "train_runtime": 365425.8234, "train_tokens_per_second": 29245.195 }, { "epoch": 1.3300081599798323, "grad_norm": 0.6171875, "learning_rate": 2.292011091086841e-05, "loss": 0.38724594116210936, "num_input_tokens_seen": 10689757504, "step": 37590, "train_runtime": 365519.8107, "train_tokens_per_second": 29245.357 }, { "epoch": 1.330361980243561, "grad_norm": 0.6015625, "learning_rate": 2.291770315914569e-05, "loss": 0.3886714458465576, "num_input_tokens_seen": 10692563456, "step": 37600, "train_runtime": 365615.9653, "train_tokens_per_second": 29245.341 }, { "epoch": 1.3307158005072899, "grad_norm": 0.578125, "learning_rate": 2.291529616606466e-05, "loss": 0.3949223518371582, "num_input_tokens_seen": 10695440576, "step": 37610, "train_runtime": 365714.4005, "train_tokens_per_second": 29245.336 }, { "epoch": 1.3310696207710186, "grad_norm": 0.5859375, "learning_rate": 2.291288993122703e-05, "loss": 0.3912301540374756, "num_input_tokens_seen": 10698309440, "step": 37620, "train_runtime": 365810.5334, "train_tokens_per_second": 29245.493 }, { "epoch": 1.3314234410347474, "grad_norm": 0.60546875, "learning_rate": 2.291048445423477e-05, "loss": 0.39014320373535155, "num_input_tokens_seen": 10701123648, "step": 37630, "train_runtime": 365906.3739, "train_tokens_per_second": 29245.524 }, { "epoch": 1.3317772612984762, "grad_norm": 0.6015625, "learning_rate": 2.2908079734690165e-05, "loss": 0.3915010929107666, "num_input_tokens_seen": 10704008128, "step": 37640, "train_runtime": 366007.6815, "train_tokens_per_second": 29245.31 }, { "epoch": 1.332131081562205, "grad_norm": 0.60546875, "learning_rate": 2.290567577219578e-05, "loss": 0.3960436820983887, "num_input_tokens_seen": 10706837312, "step": 37650, "train_runtime": 366106.6337, "train_tokens_per_second": 29245.133 }, { "epoch": 1.3324849018259337, "grad_norm": 0.6328125, "learning_rate": 2.2903272566354474e-05, "loss": 0.39026584625244143, "num_input_tokens_seen": 10709667584, "step": 37660, "train_runtime": 366202.3384, "train_tokens_per_second": 29245.219 }, { "epoch": 1.3328387220896625, "grad_norm": 0.57421875, "learning_rate": 2.2900870116769398e-05, "loss": 0.3882603168487549, "num_input_tokens_seen": 10712546048, "step": 37670, "train_runtime": 366302.1771, "train_tokens_per_second": 29245.106 }, { "epoch": 1.3331925423533912, "grad_norm": 0.609375, "learning_rate": 2.289846842304401e-05, "loss": 0.39290494918823243, "num_input_tokens_seen": 10715385920, "step": 37680, "train_runtime": 366394.953, "train_tokens_per_second": 29245.452 }, { "epoch": 1.33354636261712, "grad_norm": 0.6328125, "learning_rate": 2.2896067484782027e-05, "loss": 0.38860411643981935, "num_input_tokens_seen": 10718208256, "step": 37690, "train_runtime": 366491.0424, "train_tokens_per_second": 29245.485 }, { "epoch": 1.3339001828808488, "grad_norm": 0.6171875, "learning_rate": 2.2893667301587484e-05, "loss": 0.39140305519104, "num_input_tokens_seen": 10721053248, "step": 37700, "train_runtime": 366586.5835, "train_tokens_per_second": 29245.624 }, { "epoch": 1.3342540031445775, "grad_norm": 0.60546875, "learning_rate": 2.28912678730647e-05, "loss": 0.38918509483337405, "num_input_tokens_seen": 10723918528, "step": 37710, "train_runtime": 366684.5357, "train_tokens_per_second": 29245.625 }, { "epoch": 1.3346078234083063, "grad_norm": 0.625, "learning_rate": 2.2888869198818276e-05, "loss": 0.3890595197677612, "num_input_tokens_seen": 10726782400, "step": 37720, "train_runtime": 366783.3785, "train_tokens_per_second": 29245.552 }, { "epoch": 1.334961643672035, "grad_norm": 0.62109375, "learning_rate": 2.288647127845311e-05, "loss": 0.38911287784576415, "num_input_tokens_seen": 10729592704, "step": 37730, "train_runtime": 366878.2245, "train_tokens_per_second": 29245.652 }, { "epoch": 1.335315463935764, "grad_norm": 0.59765625, "learning_rate": 2.2884074111574384e-05, "loss": 0.3911198616027832, "num_input_tokens_seen": 10732409408, "step": 37740, "train_runtime": 366972.7822, "train_tokens_per_second": 29245.791 }, { "epoch": 1.3356692841994926, "grad_norm": 0.640625, "learning_rate": 2.2881677697787584e-05, "loss": 0.38768208026885986, "num_input_tokens_seen": 10735275520, "step": 37750, "train_runtime": 367072.5985, "train_tokens_per_second": 29245.647 }, { "epoch": 1.3360231044632216, "grad_norm": 0.5859375, "learning_rate": 2.2879282036698465e-05, "loss": 0.38977029323577883, "num_input_tokens_seen": 10738120000, "step": 37760, "train_runtime": 367168.2674, "train_tokens_per_second": 29245.774 }, { "epoch": 1.3363769247269501, "grad_norm": 0.6015625, "learning_rate": 2.2876887127913084e-05, "loss": 0.39130654335021975, "num_input_tokens_seen": 10740943936, "step": 37770, "train_runtime": 367266.4072, "train_tokens_per_second": 29245.648 }, { "epoch": 1.3367307449906791, "grad_norm": 0.60546875, "learning_rate": 2.2874492971037785e-05, "loss": 0.38621296882629397, "num_input_tokens_seen": 10743787392, "step": 37780, "train_runtime": 367362.5428, "train_tokens_per_second": 29245.735 }, { "epoch": 1.3370845652544079, "grad_norm": 0.609375, "learning_rate": 2.2872099565679195e-05, "loss": 0.39300858974456787, "num_input_tokens_seen": 10746590016, "step": 37790, "train_runtime": 367456.0712, "train_tokens_per_second": 29245.918 }, { "epoch": 1.3374383855181367, "grad_norm": 0.6015625, "learning_rate": 2.2869706911444235e-05, "loss": 0.3949438095092773, "num_input_tokens_seen": 10749435136, "step": 37800, "train_runtime": 367551.7817, "train_tokens_per_second": 29246.043 }, { "epoch": 1.3377922057818654, "grad_norm": 0.68359375, "learning_rate": 2.286731500794011e-05, "loss": 0.389025616645813, "num_input_tokens_seen": 10752276416, "step": 37810, "train_runtime": 367652.5325, "train_tokens_per_second": 29245.756 }, { "epoch": 1.3381460260455942, "grad_norm": 0.5859375, "learning_rate": 2.2864923854774315e-05, "loss": 0.3898641347885132, "num_input_tokens_seen": 10755136384, "step": 37820, "train_runtime": 367748.2194, "train_tokens_per_second": 29245.924 }, { "epoch": 1.338499846309323, "grad_norm": 0.59765625, "learning_rate": 2.286253345155463e-05, "loss": 0.39429464340209963, "num_input_tokens_seen": 10758000256, "step": 37830, "train_runtime": 367844.7631, "train_tokens_per_second": 29246.033 }, { "epoch": 1.3388536665730517, "grad_norm": 0.6015625, "learning_rate": 2.286014379788912e-05, "loss": 0.391705322265625, "num_input_tokens_seen": 10760865920, "step": 37840, "train_runtime": 367943.1908, "train_tokens_per_second": 29245.998 }, { "epoch": 1.3392074868367805, "grad_norm": 0.6171875, "learning_rate": 2.285775489338615e-05, "loss": 0.3914210557937622, "num_input_tokens_seen": 10763731520, "step": 37850, "train_runtime": 368043.1102, "train_tokens_per_second": 29245.844 }, { "epoch": 1.3395613071005092, "grad_norm": 0.60546875, "learning_rate": 2.285536673765435e-05, "loss": 0.38653855323791503, "num_input_tokens_seen": 10766653312, "step": 37860, "train_runtime": 368145.8487, "train_tokens_per_second": 29245.619 }, { "epoch": 1.339915127364238, "grad_norm": 0.58984375, "learning_rate": 2.285297933030265e-05, "loss": 0.3879828929901123, "num_input_tokens_seen": 10769527616, "step": 37870, "train_runtime": 368244.8072, "train_tokens_per_second": 29245.565 }, { "epoch": 1.3402689476279668, "grad_norm": 0.640625, "learning_rate": 2.2850592670940272e-05, "loss": 0.38802452087402345, "num_input_tokens_seen": 10772364544, "step": 37880, "train_runtime": 368341.1486, "train_tokens_per_second": 29245.618 }, { "epoch": 1.3406227678916955, "grad_norm": 0.62109375, "learning_rate": 2.2848206759176703e-05, "loss": 0.38828909397125244, "num_input_tokens_seen": 10775186496, "step": 37890, "train_runtime": 368434.1479, "train_tokens_per_second": 29245.895 }, { "epoch": 1.3409765881554243, "grad_norm": 0.6015625, "learning_rate": 2.284582159462173e-05, "loss": 0.3904193162918091, "num_input_tokens_seen": 10778001152, "step": 37900, "train_runtime": 368528.8872, "train_tokens_per_second": 29246.014 }, { "epoch": 1.3413304084191533, "grad_norm": 0.5859375, "learning_rate": 2.284343717688543e-05, "loss": 0.3872607469558716, "num_input_tokens_seen": 10780771584, "step": 37910, "train_runtime": 368620.7312, "train_tokens_per_second": 29246.243 }, { "epoch": 1.3416842286828818, "grad_norm": 0.59765625, "learning_rate": 2.284105350557815e-05, "loss": 0.3839366912841797, "num_input_tokens_seen": 10783595904, "step": 37920, "train_runtime": 368716.4703, "train_tokens_per_second": 29246.309 }, { "epoch": 1.3420380489466108, "grad_norm": 0.6015625, "learning_rate": 2.2838670580310526e-05, "loss": 0.3887828826904297, "num_input_tokens_seen": 10786434432, "step": 37930, "train_runtime": 368814.158, "train_tokens_per_second": 29246.259 }, { "epoch": 1.3423918692103396, "grad_norm": 0.58984375, "learning_rate": 2.283628840069349e-05, "loss": 0.3892253875732422, "num_input_tokens_seen": 10789229440, "step": 37940, "train_runtime": 368911.9678, "train_tokens_per_second": 29246.081 }, { "epoch": 1.3427456894740684, "grad_norm": 0.6015625, "learning_rate": 2.2833906966338237e-05, "loss": 0.3865851402282715, "num_input_tokens_seen": 10792035136, "step": 37950, "train_runtime": 369005.6976, "train_tokens_per_second": 29246.256 }, { "epoch": 1.3430995097377971, "grad_norm": 0.625, "learning_rate": 2.2831526276856274e-05, "loss": 0.38839163780212405, "num_input_tokens_seen": 10794873920, "step": 37960, "train_runtime": 369102.7428, "train_tokens_per_second": 29246.258 }, { "epoch": 1.343453330001526, "grad_norm": 0.60546875, "learning_rate": 2.282914633185936e-05, "loss": 0.39214296340942384, "num_input_tokens_seen": 10797723776, "step": 37970, "train_runtime": 369199.4787, "train_tokens_per_second": 29246.314 }, { "epoch": 1.3438071502652547, "grad_norm": 0.6328125, "learning_rate": 2.282676713095956e-05, "loss": 0.3928501129150391, "num_input_tokens_seen": 10800582464, "step": 37980, "train_runtime": 369296.7543, "train_tokens_per_second": 29246.351 }, { "epoch": 1.3441609705289834, "grad_norm": 0.58984375, "learning_rate": 2.2824388673769212e-05, "loss": 0.38679208755493166, "num_input_tokens_seen": 10803405056, "step": 37990, "train_runtime": 369393.6148, "train_tokens_per_second": 29246.323 }, { "epoch": 1.3445147907927122, "grad_norm": 0.59765625, "learning_rate": 2.282201095990094e-05, "loss": 0.3891578435897827, "num_input_tokens_seen": 10806262080, "step": 38000, "train_runtime": 369490.0114, "train_tokens_per_second": 29246.425 }, { "epoch": 1.344868611056441, "grad_norm": 0.61328125, "learning_rate": 2.281963398896765e-05, "loss": 0.38672671318054197, "num_input_tokens_seen": 10809123968, "step": 38010, "train_runtime": 369589.1446, "train_tokens_per_second": 29246.324 }, { "epoch": 1.3452224313201697, "grad_norm": 0.6328125, "learning_rate": 2.281725776058253e-05, "loss": 0.38184943199157717, "num_input_tokens_seen": 10812005120, "step": 38020, "train_runtime": 369689.4453, "train_tokens_per_second": 29246.183 }, { "epoch": 1.3455762515838985, "grad_norm": 0.61328125, "learning_rate": 2.2814882274359045e-05, "loss": 0.38944220542907715, "num_input_tokens_seen": 10814812608, "step": 38030, "train_runtime": 369784.863, "train_tokens_per_second": 29246.229 }, { "epoch": 1.3459300718476273, "grad_norm": 0.60546875, "learning_rate": 2.2812507529910955e-05, "loss": 0.3935706377029419, "num_input_tokens_seen": 10817676160, "step": 38040, "train_runtime": 369886.1042, "train_tokens_per_second": 29245.965 }, { "epoch": 1.346283892111356, "grad_norm": 0.60546875, "learning_rate": 2.2810133526852288e-05, "loss": 0.39360015392303466, "num_input_tokens_seen": 10820531584, "step": 38050, "train_runtime": 369981.3543, "train_tokens_per_second": 29246.154 }, { "epoch": 1.3466377123750848, "grad_norm": 0.59375, "learning_rate": 2.2807760264797352e-05, "loss": 0.3902523279190063, "num_input_tokens_seen": 10823374656, "step": 38060, "train_runtime": 370076.2582, "train_tokens_per_second": 29246.336 }, { "epoch": 1.3469915326388135, "grad_norm": 0.59375, "learning_rate": 2.280538774336075e-05, "loss": 0.3879945516586304, "num_input_tokens_seen": 10826221568, "step": 38070, "train_runtime": 370172.4738, "train_tokens_per_second": 29246.425 }, { "epoch": 1.3473453529025425, "grad_norm": 0.60546875, "learning_rate": 2.280301596215735e-05, "loss": 0.3895974636077881, "num_input_tokens_seen": 10829106240, "step": 38080, "train_runtime": 370271.2613, "train_tokens_per_second": 29246.413 }, { "epoch": 1.347699173166271, "grad_norm": 0.5859375, "learning_rate": 2.280064492080231e-05, "loss": 0.39406661987304686, "num_input_tokens_seen": 10831973376, "step": 38090, "train_runtime": 370372.5527, "train_tokens_per_second": 29246.156 }, { "epoch": 1.34805299343, "grad_norm": 0.61328125, "learning_rate": 2.2798274618911075e-05, "loss": 0.3909964323043823, "num_input_tokens_seen": 10834827968, "step": 38100, "train_runtime": 370471.3694, "train_tokens_per_second": 29246.06 }, { "epoch": 1.3484068136937288, "grad_norm": 0.6171875, "learning_rate": 2.2795905056099345e-05, "loss": 0.38561186790466306, "num_input_tokens_seen": 10837663360, "step": 38110, "train_runtime": 370564.8954, "train_tokens_per_second": 29246.33 }, { "epoch": 1.3487606339574576, "grad_norm": 0.609375, "learning_rate": 2.2793536231983123e-05, "loss": 0.3913773536682129, "num_input_tokens_seen": 10840504384, "step": 38120, "train_runtime": 370662.5758, "train_tokens_per_second": 29246.288 }, { "epoch": 1.3491144542211864, "grad_norm": 0.6171875, "learning_rate": 2.279116814617868e-05, "loss": 0.39183220863342283, "num_input_tokens_seen": 10843375552, "step": 38130, "train_runtime": 370761.463, "train_tokens_per_second": 29246.231 }, { "epoch": 1.3494682744849151, "grad_norm": 0.625, "learning_rate": 2.278880079830257e-05, "loss": 0.3905796527862549, "num_input_tokens_seen": 10846235072, "step": 38140, "train_runtime": 370856.124, "train_tokens_per_second": 29246.477 }, { "epoch": 1.349822094748644, "grad_norm": 0.6171875, "learning_rate": 2.278643418797163e-05, "loss": 0.3909287691116333, "num_input_tokens_seen": 10849056384, "step": 38150, "train_runtime": 370950.4726, "train_tokens_per_second": 29246.644 }, { "epoch": 1.3501759150123727, "grad_norm": 0.6015625, "learning_rate": 2.2784068314802963e-05, "loss": 0.390028977394104, "num_input_tokens_seen": 10851937984, "step": 38160, "train_runtime": 371051.7917, "train_tokens_per_second": 29246.424 }, { "epoch": 1.3505297352761014, "grad_norm": 0.6015625, "learning_rate": 2.278170317841396e-05, "loss": 0.39056925773620604, "num_input_tokens_seen": 10854759168, "step": 38170, "train_runtime": 371146.6208, "train_tokens_per_second": 29246.553 }, { "epoch": 1.3508835555398302, "grad_norm": 0.61328125, "learning_rate": 2.2779338778422287e-05, "loss": 0.39166011810302737, "num_input_tokens_seen": 10857565568, "step": 38180, "train_runtime": 371243.4216, "train_tokens_per_second": 29246.486 }, { "epoch": 1.351237375803559, "grad_norm": 0.59375, "learning_rate": 2.2776975114445885e-05, "loss": 0.39177675247192384, "num_input_tokens_seen": 10860431872, "step": 38190, "train_runtime": 371343.3564, "train_tokens_per_second": 29246.334 }, { "epoch": 1.3515911960672877, "grad_norm": 0.61328125, "learning_rate": 2.2774612186102988e-05, "loss": 0.39413065910339357, "num_input_tokens_seen": 10863265536, "step": 38200, "train_runtime": 371439.2387, "train_tokens_per_second": 29246.413 }, { "epoch": 1.3519450163310165, "grad_norm": 0.625, "learning_rate": 2.277224999301208e-05, "loss": 0.3913625001907349, "num_input_tokens_seen": 10866100608, "step": 38210, "train_runtime": 371537.5405, "train_tokens_per_second": 29246.306 }, { "epoch": 1.3522988365947453, "grad_norm": 0.625, "learning_rate": 2.276988853479194e-05, "loss": 0.3887608528137207, "num_input_tokens_seen": 10868931328, "step": 38220, "train_runtime": 371637.8878, "train_tokens_per_second": 29246.026 }, { "epoch": 1.352652656858474, "grad_norm": 0.61328125, "learning_rate": 2.2767527811061636e-05, "loss": 0.3916268587112427, "num_input_tokens_seen": 10871714048, "step": 38230, "train_runtime": 371731.4685, "train_tokens_per_second": 29246.149 }, { "epoch": 1.3530064771222028, "grad_norm": 0.609375, "learning_rate": 2.2765167821440473e-05, "loss": 0.3936856746673584, "num_input_tokens_seen": 10874593664, "step": 38240, "train_runtime": 371830.4005, "train_tokens_per_second": 29246.112 }, { "epoch": 1.3533602973859318, "grad_norm": 0.62109375, "learning_rate": 2.2762808565548063e-05, "loss": 0.38674130439758303, "num_input_tokens_seen": 10877424960, "step": 38250, "train_runtime": 371927.4276, "train_tokens_per_second": 29246.095 }, { "epoch": 1.3537141176496603, "grad_norm": 0.5859375, "learning_rate": 2.2760450043004303e-05, "loss": 0.3925855398178101, "num_input_tokens_seen": 10880254464, "step": 38260, "train_runtime": 372024.7213, "train_tokens_per_second": 29246.052 }, { "epoch": 1.3540679379133893, "grad_norm": 0.58984375, "learning_rate": 2.2758092253429327e-05, "loss": 0.38815057277679443, "num_input_tokens_seen": 10883046016, "step": 38270, "train_runtime": 372117.903, "train_tokens_per_second": 29246.231 }, { "epoch": 1.354421758177118, "grad_norm": 0.59765625, "learning_rate": 2.2755735196443585e-05, "loss": 0.39426164627075194, "num_input_tokens_seen": 10885894336, "step": 38280, "train_runtime": 372215.8005, "train_tokens_per_second": 29246.191 }, { "epoch": 1.3547755784408468, "grad_norm": 0.609375, "learning_rate": 2.2753378871667773e-05, "loss": 0.3930710792541504, "num_input_tokens_seen": 10888731584, "step": 38290, "train_runtime": 372312.7758, "train_tokens_per_second": 29246.194 }, { "epoch": 1.3551293987045756, "grad_norm": 0.62109375, "learning_rate": 2.275102327872288e-05, "loss": 0.3935257911682129, "num_input_tokens_seen": 10891600512, "step": 38300, "train_runtime": 372410.3619, "train_tokens_per_second": 29246.234 }, { "epoch": 1.3554832189683044, "grad_norm": 0.62109375, "learning_rate": 2.274866841723015e-05, "loss": 0.39020767211914065, "num_input_tokens_seen": 10894444864, "step": 38310, "train_runtime": 372504.6177, "train_tokens_per_second": 29246.469 }, { "epoch": 1.3558370392320331, "grad_norm": 0.61328125, "learning_rate": 2.2746314286811134e-05, "loss": 0.38763995170593263, "num_input_tokens_seen": 10897268608, "step": 38320, "train_runtime": 372602.1022, "train_tokens_per_second": 29246.396 }, { "epoch": 1.356190859495762, "grad_norm": 0.61328125, "learning_rate": 2.2743960887087616e-05, "loss": 0.3916309833526611, "num_input_tokens_seen": 10900054720, "step": 38330, "train_runtime": 372696.1836, "train_tokens_per_second": 29246.489 }, { "epoch": 1.3565446797594907, "grad_norm": 0.6171875, "learning_rate": 2.274160821768169e-05, "loss": 0.39238176345825193, "num_input_tokens_seen": 10902898240, "step": 38340, "train_runtime": 372794.7408, "train_tokens_per_second": 29246.384 }, { "epoch": 1.3568985000232194, "grad_norm": 0.609375, "learning_rate": 2.2739256278215697e-05, "loss": 0.3912178039550781, "num_input_tokens_seen": 10905727360, "step": 38350, "train_runtime": 372892.5124, "train_tokens_per_second": 29246.303 }, { "epoch": 1.3572523202869482, "grad_norm": 0.60546875, "learning_rate": 2.273690506831227e-05, "loss": 0.39323103427886963, "num_input_tokens_seen": 10908560768, "step": 38360, "train_runtime": 372990.561, "train_tokens_per_second": 29246.211 }, { "epoch": 1.357606140550677, "grad_norm": 0.59765625, "learning_rate": 2.273455458759431e-05, "loss": 0.3869377851486206, "num_input_tokens_seen": 10911420800, "step": 38370, "train_runtime": 373087.0696, "train_tokens_per_second": 29246.312 }, { "epoch": 1.3579599608144057, "grad_norm": 0.609375, "learning_rate": 2.2732204835684982e-05, "loss": 0.3878058671951294, "num_input_tokens_seen": 10914297472, "step": 38380, "train_runtime": 373186.1111, "train_tokens_per_second": 29246.258 }, { "epoch": 1.3583137810781345, "grad_norm": 0.609375, "learning_rate": 2.2729855812207737e-05, "loss": 0.3878204107284546, "num_input_tokens_seen": 10917116480, "step": 38390, "train_runtime": 373282.4818, "train_tokens_per_second": 29246.26 }, { "epoch": 1.3586676013418635, "grad_norm": 0.63671875, "learning_rate": 2.272750751678628e-05, "loss": 0.38982443809509276, "num_input_tokens_seen": 10919937344, "step": 38400, "train_runtime": 373378.6009, "train_tokens_per_second": 29246.286 }, { "epoch": 1.359021421605592, "grad_norm": 0.61328125, "learning_rate": 2.2725159949044613e-05, "loss": 0.39234676361083987, "num_input_tokens_seen": 10922721856, "step": 38410, "train_runtime": 373472.5134, "train_tokens_per_second": 29246.388 }, { "epoch": 1.359375241869321, "grad_norm": 0.6015625, "learning_rate": 2.2722813108606992e-05, "loss": 0.38744635581970216, "num_input_tokens_seen": 10925587264, "step": 38420, "train_runtime": 373569.6247, "train_tokens_per_second": 29246.455 }, { "epoch": 1.3597290621330496, "grad_norm": 0.5859375, "learning_rate": 2.2720466995097943e-05, "loss": 0.39301509857177735, "num_input_tokens_seen": 10928521728, "step": 38430, "train_runtime": 373674.4998, "train_tokens_per_second": 29246.1 }, { "epoch": 1.3600828823967785, "grad_norm": 0.6015625, "learning_rate": 2.271812160814228e-05, "loss": 0.39125211238861085, "num_input_tokens_seen": 10931379456, "step": 38440, "train_runtime": 373775.0728, "train_tokens_per_second": 29245.876 }, { "epoch": 1.3604367026605073, "grad_norm": 0.5859375, "learning_rate": 2.2715776947365065e-05, "loss": 0.3927396535873413, "num_input_tokens_seen": 10934192128, "step": 38450, "train_runtime": 373866.461, "train_tokens_per_second": 29246.25 }, { "epoch": 1.360790522924236, "grad_norm": 0.59765625, "learning_rate": 2.2713433012391654e-05, "loss": 0.3895401954650879, "num_input_tokens_seen": 10936995136, "step": 38460, "train_runtime": 373960.6791, "train_tokens_per_second": 29246.377 }, { "epoch": 1.3611443431879648, "grad_norm": 0.609375, "learning_rate": 2.2711089802847657e-05, "loss": 0.3885706901550293, "num_input_tokens_seen": 10939837696, "step": 38470, "train_runtime": 374059.2763, "train_tokens_per_second": 29246.268 }, { "epoch": 1.3614981634516936, "grad_norm": 0.625, "learning_rate": 2.270874731835896e-05, "loss": 0.38973586559295653, "num_input_tokens_seen": 10942637888, "step": 38480, "train_runtime": 374155.5545, "train_tokens_per_second": 29246.226 }, { "epoch": 1.3618519837154224, "grad_norm": 0.61328125, "learning_rate": 2.270640555855172e-05, "loss": 0.3894874095916748, "num_input_tokens_seen": 10945469248, "step": 38490, "train_runtime": 374252.4342, "train_tokens_per_second": 29246.221 }, { "epoch": 1.3622058039791511, "grad_norm": 0.60546875, "learning_rate": 2.2704064523052372e-05, "loss": 0.39103376865386963, "num_input_tokens_seen": 10948361600, "step": 38500, "train_runtime": 374355.9209, "train_tokens_per_second": 29245.862 }, { "epoch": 1.36255962424288, "grad_norm": 0.6640625, "learning_rate": 2.270172421148759e-05, "loss": 0.392916202545166, "num_input_tokens_seen": 10951189440, "step": 38510, "train_runtime": 374452.5684, "train_tokens_per_second": 29245.865 }, { "epoch": 1.3629134445066087, "grad_norm": 0.6171875, "learning_rate": 2.269938462348436e-05, "loss": 0.3911635398864746, "num_input_tokens_seen": 10954091712, "step": 38520, "train_runtime": 374550.9593, "train_tokens_per_second": 29245.932 }, { "epoch": 1.3632672647703374, "grad_norm": 0.60546875, "learning_rate": 2.26970457586699e-05, "loss": 0.3889798402786255, "num_input_tokens_seen": 10956958592, "step": 38530, "train_runtime": 374647.7384, "train_tokens_per_second": 29246.029 }, { "epoch": 1.3636210850340662, "grad_norm": 0.609375, "learning_rate": 2.2694707616671726e-05, "loss": 0.39226632118225097, "num_input_tokens_seen": 10959828992, "step": 38540, "train_runtime": 374745.2825, "train_tokens_per_second": 29246.076 }, { "epoch": 1.363974905297795, "grad_norm": 0.62109375, "learning_rate": 2.2692370197117605e-05, "loss": 0.38927111625671384, "num_input_tokens_seen": 10962646848, "step": 38550, "train_runtime": 374841.2973, "train_tokens_per_second": 29246.102 }, { "epoch": 1.3643287255615237, "grad_norm": 0.62890625, "learning_rate": 2.269003349963557e-05, "loss": 0.386190128326416, "num_input_tokens_seen": 10965488256, "step": 38560, "train_runtime": 374935.5501, "train_tokens_per_second": 29246.328 }, { "epoch": 1.3646825458252527, "grad_norm": 0.609375, "learning_rate": 2.268769752385393e-05, "loss": 0.38511104583740235, "num_input_tokens_seen": 10968309696, "step": 38570, "train_runtime": 375030.3355, "train_tokens_per_second": 29246.46 }, { "epoch": 1.3650363660889813, "grad_norm": 0.6015625, "learning_rate": 2.2685362269401272e-05, "loss": 0.3887251615524292, "num_input_tokens_seen": 10971198272, "step": 38580, "train_runtime": 375127.6258, "train_tokens_per_second": 29246.575 }, { "epoch": 1.3653901863527103, "grad_norm": 0.609375, "learning_rate": 2.268302773590643e-05, "loss": 0.3868979215621948, "num_input_tokens_seen": 10974057664, "step": 38590, "train_runtime": 375225.2979, "train_tokens_per_second": 29246.583 }, { "epoch": 1.3657440066164388, "grad_norm": 0.578125, "learning_rate": 2.268069392299851e-05, "loss": 0.3841234683990479, "num_input_tokens_seen": 10976914496, "step": 38600, "train_runtime": 375323.7025, "train_tokens_per_second": 29246.526 }, { "epoch": 1.3660978268801678, "grad_norm": 0.65234375, "learning_rate": 2.267836083030689e-05, "loss": 0.39037380218505857, "num_input_tokens_seen": 10979768960, "step": 38610, "train_runtime": 375422.6566, "train_tokens_per_second": 29246.421 }, { "epoch": 1.3664516471438966, "grad_norm": 0.6015625, "learning_rate": 2.2676028457461225e-05, "loss": 0.38668346405029297, "num_input_tokens_seen": 10982613952, "step": 38620, "train_runtime": 375519.797, "train_tokens_per_second": 29246.431 }, { "epoch": 1.3668054674076253, "grad_norm": 0.60546875, "learning_rate": 2.2673696804091418e-05, "loss": 0.38927206993103025, "num_input_tokens_seen": 10985410048, "step": 38630, "train_runtime": 375612.8179, "train_tokens_per_second": 29246.633 }, { "epoch": 1.367159287671354, "grad_norm": 0.59375, "learning_rate": 2.267136586982764e-05, "loss": 0.38597822189331055, "num_input_tokens_seen": 10988300032, "step": 38640, "train_runtime": 375711.3313, "train_tokens_per_second": 29246.656 }, { "epoch": 1.3675131079350829, "grad_norm": 0.60546875, "learning_rate": 2.2669035654300346e-05, "loss": 0.38661832809448243, "num_input_tokens_seen": 10991144128, "step": 38650, "train_runtime": 375810.4459, "train_tokens_per_second": 29246.51 }, { "epoch": 1.3678669281988116, "grad_norm": 0.59765625, "learning_rate": 2.2666706157140242e-05, "loss": 0.3878067970275879, "num_input_tokens_seen": 10994020800, "step": 38660, "train_runtime": 375909.6378, "train_tokens_per_second": 29246.446 }, { "epoch": 1.3682207484625404, "grad_norm": 0.59375, "learning_rate": 2.2664377377978295e-05, "loss": 0.38732447624206545, "num_input_tokens_seen": 10996851072, "step": 38670, "train_runtime": 376006.2827, "train_tokens_per_second": 29246.456 }, { "epoch": 1.3685745687262691, "grad_norm": 0.58984375, "learning_rate": 2.2662049316445754e-05, "loss": 0.39151811599731445, "num_input_tokens_seen": 10999660864, "step": 38680, "train_runtime": 376100.6271, "train_tokens_per_second": 29246.59 }, { "epoch": 1.368928388989998, "grad_norm": 0.59375, "learning_rate": 2.2659721972174117e-05, "loss": 0.3887642383575439, "num_input_tokens_seen": 11002482368, "step": 38690, "train_runtime": 376198.4601, "train_tokens_per_second": 29246.484 }, { "epoch": 1.3692822092537267, "grad_norm": 0.609375, "learning_rate": 2.2657395344795153e-05, "loss": 0.39536571502685547, "num_input_tokens_seen": 11005339264, "step": 38700, "train_runtime": 376296.1956, "train_tokens_per_second": 29246.48 }, { "epoch": 1.3696360295174554, "grad_norm": 0.59765625, "learning_rate": 2.265506943394091e-05, "loss": 0.3898845911026001, "num_input_tokens_seen": 11008131072, "step": 38710, "train_runtime": 376387.4887, "train_tokens_per_second": 29246.804 }, { "epoch": 1.3699898497811842, "grad_norm": 0.60546875, "learning_rate": 2.2652744239243668e-05, "loss": 0.38378276824951174, "num_input_tokens_seen": 11010988160, "step": 38720, "train_runtime": 376484.812, "train_tokens_per_second": 29246.832 }, { "epoch": 1.370343670044913, "grad_norm": 0.640625, "learning_rate": 2.2650419760336006e-05, "loss": 0.3887014389038086, "num_input_tokens_seen": 11013866176, "step": 38730, "train_runtime": 376584.8316, "train_tokens_per_second": 29246.707 }, { "epoch": 1.370697490308642, "grad_norm": 0.6328125, "learning_rate": 2.2648095996850735e-05, "loss": 0.3874682903289795, "num_input_tokens_seen": 11016722496, "step": 38740, "train_runtime": 376682.2946, "train_tokens_per_second": 29246.722 }, { "epoch": 1.3710513105723705, "grad_norm": 0.6171875, "learning_rate": 2.2645772948420957e-05, "loss": 0.3867891073226929, "num_input_tokens_seen": 11019531904, "step": 38750, "train_runtime": 376776.9646, "train_tokens_per_second": 29246.83 }, { "epoch": 1.3714051308360995, "grad_norm": 0.58203125, "learning_rate": 2.264345061468003e-05, "loss": 0.38934223651885985, "num_input_tokens_seen": 11022393792, "step": 38760, "train_runtime": 376876.3004, "train_tokens_per_second": 29246.715 }, { "epoch": 1.371758951099828, "grad_norm": 0.59765625, "learning_rate": 2.2641128995261554e-05, "loss": 0.3914985656738281, "num_input_tokens_seen": 11025283008, "step": 38770, "train_runtime": 376976.6337, "train_tokens_per_second": 29246.595 }, { "epoch": 1.372112771363557, "grad_norm": 0.640625, "learning_rate": 2.2638808089799417e-05, "loss": 0.38730630874633787, "num_input_tokens_seen": 11028088128, "step": 38780, "train_runtime": 377072.1014, "train_tokens_per_second": 29246.63 }, { "epoch": 1.3724665916272858, "grad_norm": 0.58984375, "learning_rate": 2.2636487897927773e-05, "loss": 0.3903202056884766, "num_input_tokens_seen": 11030944000, "step": 38790, "train_runtime": 377172.8151, "train_tokens_per_second": 29246.392 }, { "epoch": 1.3728204118910146, "grad_norm": 0.609375, "learning_rate": 2.2634168419281007e-05, "loss": 0.3899411678314209, "num_input_tokens_seen": 11033770048, "step": 38800, "train_runtime": 377268.3092, "train_tokens_per_second": 29246.48 }, { "epoch": 1.3731742321547433, "grad_norm": 0.5859375, "learning_rate": 2.2631849653493803e-05, "loss": 0.3898441791534424, "num_input_tokens_seen": 11036662784, "step": 38810, "train_runtime": 377364.9128, "train_tokens_per_second": 29246.659 }, { "epoch": 1.373528052418472, "grad_norm": 0.609375, "learning_rate": 2.2629531600201077e-05, "loss": 0.3927628517150879, "num_input_tokens_seen": 11039528064, "step": 38820, "train_runtime": 377462.1501, "train_tokens_per_second": 29246.715 }, { "epoch": 1.3738818726822009, "grad_norm": 0.60546875, "learning_rate": 2.2627214259038028e-05, "loss": 0.3915828227996826, "num_input_tokens_seen": 11042412992, "step": 38830, "train_runtime": 377561.3635, "train_tokens_per_second": 29246.671 }, { "epoch": 1.3742356929459296, "grad_norm": 0.62109375, "learning_rate": 2.2624897629640108e-05, "loss": 0.39042153358459475, "num_input_tokens_seen": 11045297216, "step": 38840, "train_runtime": 377660.8228, "train_tokens_per_second": 29246.606 }, { "epoch": 1.3745895132096584, "grad_norm": 0.6171875, "learning_rate": 2.2622581711643022e-05, "loss": 0.39333410263061525, "num_input_tokens_seen": 11048189056, "step": 38850, "train_runtime": 377761.0502, "train_tokens_per_second": 29246.501 }, { "epoch": 1.3749433334733872, "grad_norm": 0.6171875, "learning_rate": 2.262026650468275e-05, "loss": 0.3897092819213867, "num_input_tokens_seen": 11051043840, "step": 38860, "train_runtime": 377858.3855, "train_tokens_per_second": 29246.523 }, { "epoch": 1.375297153737116, "grad_norm": 0.61328125, "learning_rate": 2.261795200839553e-05, "loss": 0.39409472942352297, "num_input_tokens_seen": 11053920512, "step": 38870, "train_runtime": 377958.2752, "train_tokens_per_second": 29246.404 }, { "epoch": 1.3756509740008447, "grad_norm": 0.6015625, "learning_rate": 2.2615638222417856e-05, "loss": 0.39360010623931885, "num_input_tokens_seen": 11056773632, "step": 38880, "train_runtime": 378059.8846, "train_tokens_per_second": 29246.091 }, { "epoch": 1.3760047942645734, "grad_norm": 0.59375, "learning_rate": 2.261332514638648e-05, "loss": 0.38776426315307616, "num_input_tokens_seen": 11059602944, "step": 38890, "train_runtime": 378156.459, "train_tokens_per_second": 29246.104 }, { "epoch": 1.3763586145283022, "grad_norm": 0.5859375, "learning_rate": 2.261101277993842e-05, "loss": 0.3868075370788574, "num_input_tokens_seen": 11062481856, "step": 38900, "train_runtime": 378255.3864, "train_tokens_per_second": 29246.066 }, { "epoch": 1.3767124347920312, "grad_norm": 0.5859375, "learning_rate": 2.2608701122710953e-05, "loss": 0.39182395935058595, "num_input_tokens_seen": 11065335296, "step": 38910, "train_runtime": 378351.5243, "train_tokens_per_second": 29246.176 }, { "epoch": 1.3770662550557597, "grad_norm": 0.6015625, "learning_rate": 2.2606390174341617e-05, "loss": 0.39125618934631345, "num_input_tokens_seen": 11068160768, "step": 38920, "train_runtime": 378447.1497, "train_tokens_per_second": 29246.252 }, { "epoch": 1.3774200753194887, "grad_norm": 0.63671875, "learning_rate": 2.2604079934468193e-05, "loss": 0.3885795116424561, "num_input_tokens_seen": 11070971520, "step": 38930, "train_runtime": 378542.2916, "train_tokens_per_second": 29246.327 }, { "epoch": 1.3777738955832175, "grad_norm": 0.5859375, "learning_rate": 2.260177040272875e-05, "loss": 0.3865159511566162, "num_input_tokens_seen": 11073798144, "step": 38940, "train_runtime": 378637.9301, "train_tokens_per_second": 29246.405 }, { "epoch": 1.3781277158469463, "grad_norm": 0.60546875, "learning_rate": 2.2599461578761593e-05, "loss": 0.3925990104675293, "num_input_tokens_seen": 11076636224, "step": 38950, "train_runtime": 378735.2566, "train_tokens_per_second": 29246.383 }, { "epoch": 1.378481536110675, "grad_norm": 0.5859375, "learning_rate": 2.2597153462205292e-05, "loss": 0.3931520938873291, "num_input_tokens_seen": 11079494464, "step": 38960, "train_runtime": 378833.8381, "train_tokens_per_second": 29246.317 }, { "epoch": 1.3788353563744038, "grad_norm": 0.609375, "learning_rate": 2.259484605269868e-05, "loss": 0.3876009941101074, "num_input_tokens_seen": 11082340352, "step": 38970, "train_runtime": 378932.6962, "train_tokens_per_second": 29246.197 }, { "epoch": 1.3791891766381326, "grad_norm": 0.61328125, "learning_rate": 2.259253934988084e-05, "loss": 0.393019962310791, "num_input_tokens_seen": 11085170816, "step": 38980, "train_runtime": 379030.247, "train_tokens_per_second": 29246.138 }, { "epoch": 1.3795429969018613, "grad_norm": 0.61328125, "learning_rate": 2.2590233353391124e-05, "loss": 0.387861442565918, "num_input_tokens_seen": 11087992192, "step": 38990, "train_runtime": 379125.7156, "train_tokens_per_second": 29246.215 }, { "epoch": 1.37989681716559, "grad_norm": 0.6015625, "learning_rate": 2.2587928062869124e-05, "loss": 0.39212684631347655, "num_input_tokens_seen": 11090834624, "step": 39000, "train_runtime": 379222.6804, "train_tokens_per_second": 29246.232 }, { "epoch": 1.3802506374293189, "grad_norm": 0.59765625, "learning_rate": 2.258562347795471e-05, "loss": 0.3850613832473755, "num_input_tokens_seen": 11093671168, "step": 39010, "train_runtime": 379320.2688, "train_tokens_per_second": 29246.186 }, { "epoch": 1.3806044576930476, "grad_norm": 0.61328125, "learning_rate": 2.2583319598287993e-05, "loss": 0.38744335174560546, "num_input_tokens_seen": 11096512000, "step": 39020, "train_runtime": 379421.3887, "train_tokens_per_second": 29245.879 }, { "epoch": 1.3809582779567764, "grad_norm": 0.59375, "learning_rate": 2.258101642350935e-05, "loss": 0.3917128324508667, "num_input_tokens_seen": 11099313280, "step": 39030, "train_runtime": 379514.7702, "train_tokens_per_second": 29246.064 }, { "epoch": 1.3813120982205052, "grad_norm": 0.58203125, "learning_rate": 2.2578713953259414e-05, "loss": 0.38610689640045165, "num_input_tokens_seen": 11102135744, "step": 39040, "train_runtime": 379611.9395, "train_tokens_per_second": 29246.013 }, { "epoch": 1.381665918484234, "grad_norm": 0.64453125, "learning_rate": 2.2576412187179074e-05, "loss": 0.3876628398895264, "num_input_tokens_seen": 11104966592, "step": 39050, "train_runtime": 379710.1414, "train_tokens_per_second": 29245.905 }, { "epoch": 1.3820197387479627, "grad_norm": 0.60546875, "learning_rate": 2.257411112490946e-05, "loss": 0.3869986057281494, "num_input_tokens_seen": 11107825536, "step": 39060, "train_runtime": 379809.8551, "train_tokens_per_second": 29245.754 }, { "epoch": 1.3823735590116915, "grad_norm": 0.58984375, "learning_rate": 2.257181076609199e-05, "loss": 0.39197072982788084, "num_input_tokens_seen": 11110701056, "step": 39070, "train_runtime": 379908.152, "train_tokens_per_second": 29245.756 }, { "epoch": 1.3827273792754204, "grad_norm": 0.58984375, "learning_rate": 2.2569511110368306e-05, "loss": 0.3927911758422852, "num_input_tokens_seen": 11113572480, "step": 39080, "train_runtime": 380004.3382, "train_tokens_per_second": 29245.909 }, { "epoch": 1.383081199539149, "grad_norm": 0.59765625, "learning_rate": 2.256721215738032e-05, "loss": 0.3901776075363159, "num_input_tokens_seen": 11116431744, "step": 39090, "train_runtime": 380104.2094, "train_tokens_per_second": 29245.748 }, { "epoch": 1.383435019802878, "grad_norm": 0.5859375, "learning_rate": 2.2564913906770207e-05, "loss": 0.38931324481964114, "num_input_tokens_seen": 11119239296, "step": 39100, "train_runtime": 380197.4414, "train_tokens_per_second": 29245.96 }, { "epoch": 1.3837888400666067, "grad_norm": 0.6015625, "learning_rate": 2.2562616358180384e-05, "loss": 0.38906543254852294, "num_input_tokens_seen": 11122072192, "step": 39110, "train_runtime": 380291.4675, "train_tokens_per_second": 29246.179 }, { "epoch": 1.3841426603303355, "grad_norm": 0.58984375, "learning_rate": 2.2560319511253522e-05, "loss": 0.388606595993042, "num_input_tokens_seen": 11124964864, "step": 39120, "train_runtime": 380390.9688, "train_tokens_per_second": 29246.133 }, { "epoch": 1.3844964805940643, "grad_norm": 0.58203125, "learning_rate": 2.255802336563256e-05, "loss": 0.389971661567688, "num_input_tokens_seen": 11127832384, "step": 39130, "train_runtime": 380488.4181, "train_tokens_per_second": 29246.179 }, { "epoch": 1.384850300857793, "grad_norm": 0.625, "learning_rate": 2.255572792096067e-05, "loss": 0.3933126926422119, "num_input_tokens_seen": 11130690944, "step": 39140, "train_runtime": 380589.6429, "train_tokens_per_second": 29245.911 }, { "epoch": 1.3852041211215218, "grad_norm": 0.609375, "learning_rate": 2.2553433176881303e-05, "loss": 0.39327635765075686, "num_input_tokens_seen": 11133547840, "step": 39150, "train_runtime": 380688.7151, "train_tokens_per_second": 29245.805 }, { "epoch": 1.3855579413852506, "grad_norm": 0.625, "learning_rate": 2.2551139133038147e-05, "loss": 0.3896777153015137, "num_input_tokens_seen": 11136403328, "step": 39160, "train_runtime": 380787.163, "train_tokens_per_second": 29245.743 }, { "epoch": 1.3859117616489793, "grad_norm": 0.58984375, "learning_rate": 2.2548845789075145e-05, "loss": 0.3917239189147949, "num_input_tokens_seen": 11139264832, "step": 39170, "train_runtime": 380885.4899, "train_tokens_per_second": 29245.705 }, { "epoch": 1.386265581912708, "grad_norm": 0.62109375, "learning_rate": 2.2546553144636503e-05, "loss": 0.3911376714706421, "num_input_tokens_seen": 11142194368, "step": 39180, "train_runtime": 380990.5183, "train_tokens_per_second": 29245.332 }, { "epoch": 1.3866194021764369, "grad_norm": 0.61328125, "learning_rate": 2.254426119936668e-05, "loss": 0.3860174179077148, "num_input_tokens_seen": 11145013632, "step": 39190, "train_runtime": 381086.0626, "train_tokens_per_second": 29245.398 }, { "epoch": 1.3869732224401656, "grad_norm": 0.5859375, "learning_rate": 2.2541969952910365e-05, "loss": 0.3878906726837158, "num_input_tokens_seen": 11147898752, "step": 39200, "train_runtime": 381184.88, "train_tokens_per_second": 29245.385 }, { "epoch": 1.3873270427038944, "grad_norm": 0.6171875, "learning_rate": 2.2539679404912533e-05, "loss": 0.3896648645401001, "num_input_tokens_seen": 11150699776, "step": 39210, "train_runtime": 381280.9754, "train_tokens_per_second": 29245.361 }, { "epoch": 1.3876808629676232, "grad_norm": 0.59375, "learning_rate": 2.253738955501838e-05, "loss": 0.38965606689453125, "num_input_tokens_seen": 11153533632, "step": 39220, "train_runtime": 381377.9565, "train_tokens_per_second": 29245.355 }, { "epoch": 1.3880346832313522, "grad_norm": 0.609375, "learning_rate": 2.2535100402873383e-05, "loss": 0.3914762496948242, "num_input_tokens_seen": 11156396864, "step": 39230, "train_runtime": 381474.7135, "train_tokens_per_second": 29245.443 }, { "epoch": 1.3883885034950807, "grad_norm": 0.62109375, "learning_rate": 2.2532811948123252e-05, "loss": 0.3892830371856689, "num_input_tokens_seen": 11159236160, "step": 39240, "train_runtime": 381574.2574, "train_tokens_per_second": 29245.254 }, { "epoch": 1.3887423237588097, "grad_norm": 0.609375, "learning_rate": 2.2530524190413955e-05, "loss": 0.3849909782409668, "num_input_tokens_seen": 11162052224, "step": 39250, "train_runtime": 381668.3629, "train_tokens_per_second": 29245.422 }, { "epoch": 1.3890961440225382, "grad_norm": 0.60546875, "learning_rate": 2.2528237129391706e-05, "loss": 0.39268150329589846, "num_input_tokens_seen": 11164892736, "step": 39260, "train_runtime": 381767.2125, "train_tokens_per_second": 29245.29 }, { "epoch": 1.3894499642862672, "grad_norm": 0.5859375, "learning_rate": 2.2525950764702985e-05, "loss": 0.39043426513671875, "num_input_tokens_seen": 11167730112, "step": 39270, "train_runtime": 381863.5923, "train_tokens_per_second": 29245.339 }, { "epoch": 1.389803784549996, "grad_norm": 0.60546875, "learning_rate": 2.2523665095994505e-05, "loss": 0.38786580562591555, "num_input_tokens_seen": 11170539264, "step": 39280, "train_runtime": 381957.7934, "train_tokens_per_second": 29245.481 }, { "epoch": 1.3901576048137247, "grad_norm": 0.6328125, "learning_rate": 2.252138012291324e-05, "loss": 0.3902053594589233, "num_input_tokens_seen": 11173406528, "step": 39290, "train_runtime": 382058.2143, "train_tokens_per_second": 29245.299 }, { "epoch": 1.3905114250774535, "grad_norm": 0.58203125, "learning_rate": 2.2519095845106414e-05, "loss": 0.39381895065307615, "num_input_tokens_seen": 11176267392, "step": 39300, "train_runtime": 382155.9994, "train_tokens_per_second": 29245.301 }, { "epoch": 1.3908652453411823, "grad_norm": 0.59765625, "learning_rate": 2.25168122622215e-05, "loss": 0.38964109420776366, "num_input_tokens_seen": 11179142976, "step": 39310, "train_runtime": 382254.918, "train_tokens_per_second": 29245.256 }, { "epoch": 1.391219065604911, "grad_norm": 0.60546875, "learning_rate": 2.2514529373906217e-05, "loss": 0.3899622678756714, "num_input_tokens_seen": 11181973504, "step": 39320, "train_runtime": 382349.174, "train_tokens_per_second": 29245.45 }, { "epoch": 1.3915728858686398, "grad_norm": 0.62109375, "learning_rate": 2.251224717980855e-05, "loss": 0.3894974708557129, "num_input_tokens_seen": 11184771456, "step": 39330, "train_runtime": 382441.6519, "train_tokens_per_second": 29245.694 }, { "epoch": 1.3919267061323686, "grad_norm": 0.6171875, "learning_rate": 2.2509965679576713e-05, "loss": 0.39198126792907717, "num_input_tokens_seen": 11187658048, "step": 39340, "train_runtime": 382541.81, "train_tokens_per_second": 29245.582 }, { "epoch": 1.3922805263960973, "grad_norm": 0.59765625, "learning_rate": 2.250768487285918e-05, "loss": 0.38835816383361815, "num_input_tokens_seen": 11190528448, "step": 39350, "train_runtime": 382640.6157, "train_tokens_per_second": 29245.532 }, { "epoch": 1.392634346659826, "grad_norm": 0.60546875, "learning_rate": 2.250540475930467e-05, "loss": 0.3910823345184326, "num_input_tokens_seen": 11193331648, "step": 39360, "train_runtime": 382735.9042, "train_tokens_per_second": 29245.575 }, { "epoch": 1.3929881669235549, "grad_norm": 0.5859375, "learning_rate": 2.2503125338562166e-05, "loss": 0.3896183013916016, "num_input_tokens_seen": 11196209024, "step": 39370, "train_runtime": 382834.6952, "train_tokens_per_second": 29245.544 }, { "epoch": 1.3933419871872836, "grad_norm": 0.6015625, "learning_rate": 2.2500846610280868e-05, "loss": 0.38942005634307864, "num_input_tokens_seen": 11199065536, "step": 39380, "train_runtime": 382934.9725, "train_tokens_per_second": 29245.345 }, { "epoch": 1.3936958074510124, "grad_norm": 0.62109375, "learning_rate": 2.2498568574110262e-05, "loss": 0.38760254383087156, "num_input_tokens_seen": 11201837056, "step": 39390, "train_runtime": 383027.5662, "train_tokens_per_second": 29245.511 }, { "epoch": 1.3940496277147414, "grad_norm": 0.609375, "learning_rate": 2.249629122970006e-05, "loss": 0.3866061449050903, "num_input_tokens_seen": 11204617408, "step": 39400, "train_runtime": 383120.8743, "train_tokens_per_second": 29245.646 }, { "epoch": 1.39440344797847, "grad_norm": 0.58984375, "learning_rate": 2.2494014576700217e-05, "loss": 0.38678503036499023, "num_input_tokens_seen": 11207412032, "step": 39410, "train_runtime": 383215.2734, "train_tokens_per_second": 29245.734 }, { "epoch": 1.394757268242199, "grad_norm": 0.625, "learning_rate": 2.2491738614760956e-05, "loss": 0.3901569128036499, "num_input_tokens_seen": 11210267648, "step": 39420, "train_runtime": 383313.1594, "train_tokens_per_second": 29245.716 }, { "epoch": 1.3951110885059275, "grad_norm": 0.625, "learning_rate": 2.2489463343532742e-05, "loss": 0.39046335220336914, "num_input_tokens_seen": 11213072064, "step": 39430, "train_runtime": 383408.2707, "train_tokens_per_second": 29245.775 }, { "epoch": 1.3954649087696565, "grad_norm": 0.62890625, "learning_rate": 2.2487188762666268e-05, "loss": 0.3915881156921387, "num_input_tokens_seen": 11215926144, "step": 39440, "train_runtime": 383507.0138, "train_tokens_per_second": 29245.687 }, { "epoch": 1.3958187290333852, "grad_norm": 0.6171875, "learning_rate": 2.2484914871812504e-05, "loss": 0.3882216215133667, "num_input_tokens_seen": 11218763200, "step": 39450, "train_runtime": 383604.3437, "train_tokens_per_second": 29245.663 }, { "epoch": 1.396172549297114, "grad_norm": 0.578125, "learning_rate": 2.248264167062264e-05, "loss": 0.3908745288848877, "num_input_tokens_seen": 11221601472, "step": 39460, "train_runtime": 383698.7409, "train_tokens_per_second": 29245.865 }, { "epoch": 1.3965263695608428, "grad_norm": 0.6015625, "learning_rate": 2.2480369158748138e-05, "loss": 0.3922338724136353, "num_input_tokens_seen": 11224429952, "step": 39470, "train_runtime": 383796.9044, "train_tokens_per_second": 29245.754 }, { "epoch": 1.3968801898245715, "grad_norm": 0.60546875, "learning_rate": 2.2478097335840682e-05, "loss": 0.39245095252990725, "num_input_tokens_seen": 11227295360, "step": 39480, "train_runtime": 383897.2996, "train_tokens_per_second": 29245.57 }, { "epoch": 1.3972340100883003, "grad_norm": 0.58203125, "learning_rate": 2.2475826201552215e-05, "loss": 0.39073567390441893, "num_input_tokens_seen": 11230140864, "step": 39490, "train_runtime": 383993.99, "train_tokens_per_second": 29245.616 }, { "epoch": 1.397587830352029, "grad_norm": 0.6171875, "learning_rate": 2.2473555755534935e-05, "loss": 0.39198329448699953, "num_input_tokens_seen": 11232961856, "step": 39500, "train_runtime": 384090.3125, "train_tokens_per_second": 29245.627 }, { "epoch": 1.3979416506157578, "grad_norm": 0.609375, "learning_rate": 2.2471285997441267e-05, "loss": 0.3873871326446533, "num_input_tokens_seen": 11235836672, "step": 39510, "train_runtime": 384189.067, "train_tokens_per_second": 29245.592 }, { "epoch": 1.3982954708794866, "grad_norm": 0.6171875, "learning_rate": 2.246901692692389e-05, "loss": 0.39047234058380126, "num_input_tokens_seen": 11238604864, "step": 39520, "train_runtime": 384281.7974, "train_tokens_per_second": 29245.738 }, { "epoch": 1.3986492911432153, "grad_norm": 0.5859375, "learning_rate": 2.2466748543635735e-05, "loss": 0.38958890438079835, "num_input_tokens_seen": 11241440704, "step": 39530, "train_runtime": 384376.1892, "train_tokens_per_second": 29245.934 }, { "epoch": 1.399003111406944, "grad_norm": 0.6171875, "learning_rate": 2.2464480847229967e-05, "loss": 0.38456265926361083, "num_input_tokens_seen": 11244246336, "step": 39540, "train_runtime": 384472.2667, "train_tokens_per_second": 29245.923 }, { "epoch": 1.3993569316706729, "grad_norm": 0.6171875, "learning_rate": 2.2462213837360003e-05, "loss": 0.38970279693603516, "num_input_tokens_seen": 11247100608, "step": 39550, "train_runtime": 384566.7038, "train_tokens_per_second": 29246.163 }, { "epoch": 1.3997107519344016, "grad_norm": 0.6171875, "learning_rate": 2.2459947513679502e-05, "loss": 0.3863519191741943, "num_input_tokens_seen": 11249952448, "step": 39560, "train_runtime": 384664.4729, "train_tokens_per_second": 29246.144 }, { "epoch": 1.4000645721981306, "grad_norm": 0.58203125, "learning_rate": 2.2457681875842372e-05, "loss": 0.3867347717285156, "num_input_tokens_seen": 11252786880, "step": 39570, "train_runtime": 384759.4287, "train_tokens_per_second": 29246.293 }, { "epoch": 1.4004183924618592, "grad_norm": 0.58203125, "learning_rate": 2.245541692350276e-05, "loss": 0.39089341163635255, "num_input_tokens_seen": 11255565824, "step": 39580, "train_runtime": 384851.6433, "train_tokens_per_second": 29246.506 }, { "epoch": 1.4007722127255882, "grad_norm": 0.62890625, "learning_rate": 2.245315265631506e-05, "loss": 0.3921431303024292, "num_input_tokens_seen": 11258436608, "step": 39590, "train_runtime": 384951.7604, "train_tokens_per_second": 29246.357 }, { "epoch": 1.4011260329893167, "grad_norm": 0.609375, "learning_rate": 2.2450889073933906e-05, "loss": 0.3916007518768311, "num_input_tokens_seen": 11261232640, "step": 39600, "train_runtime": 385044.439, "train_tokens_per_second": 29246.579 }, { "epoch": 1.4014798532530457, "grad_norm": 0.59375, "learning_rate": 2.2448626176014187e-05, "loss": 0.3927267551422119, "num_input_tokens_seen": 11264059072, "step": 39610, "train_runtime": 385141.9845, "train_tokens_per_second": 29246.51 }, { "epoch": 1.4018336735167745, "grad_norm": 0.5859375, "learning_rate": 2.2446363962211015e-05, "loss": 0.39011099338531496, "num_input_tokens_seen": 11266859392, "step": 39620, "train_runtime": 385238.1925, "train_tokens_per_second": 29246.476 }, { "epoch": 1.4021874937805032, "grad_norm": 0.59375, "learning_rate": 2.244410243217976e-05, "loss": 0.3889866828918457, "num_input_tokens_seen": 11269693120, "step": 39630, "train_runtime": 385334.2888, "train_tokens_per_second": 29246.536 }, { "epoch": 1.402541314044232, "grad_norm": 0.58203125, "learning_rate": 2.2441841585576043e-05, "loss": 0.389142370223999, "num_input_tokens_seen": 11272529792, "step": 39640, "train_runtime": 385431.9442, "train_tokens_per_second": 29246.486 }, { "epoch": 1.4028951343079608, "grad_norm": 0.60546875, "learning_rate": 2.2439581422055703e-05, "loss": 0.394963812828064, "num_input_tokens_seen": 11275426048, "step": 39650, "train_runtime": 385532.5329, "train_tokens_per_second": 29246.367 }, { "epoch": 1.4032489545716895, "grad_norm": 0.62109375, "learning_rate": 2.2437321941274843e-05, "loss": 0.39005801677703855, "num_input_tokens_seen": 11278256192, "step": 39660, "train_runtime": 385630.7891, "train_tokens_per_second": 29246.254 }, { "epoch": 1.4036027748354183, "grad_norm": 0.58984375, "learning_rate": 2.2435063142889803e-05, "loss": 0.39021968841552734, "num_input_tokens_seen": 11281119616, "step": 39670, "train_runtime": 385729.2435, "train_tokens_per_second": 29246.213 }, { "epoch": 1.403956595099147, "grad_norm": 0.62890625, "learning_rate": 2.2432805026557163e-05, "loss": 0.38866124153137205, "num_input_tokens_seen": 11284013440, "step": 39680, "train_runtime": 385830.2866, "train_tokens_per_second": 29246.054 }, { "epoch": 1.4043104153628758, "grad_norm": 0.6171875, "learning_rate": 2.243054759193374e-05, "loss": 0.39093899726867676, "num_input_tokens_seen": 11286918848, "step": 39690, "train_runtime": 385932.5904, "train_tokens_per_second": 29245.83 }, { "epoch": 1.4046642356266046, "grad_norm": 0.609375, "learning_rate": 2.2428290838676597e-05, "loss": 0.39354887008666994, "num_input_tokens_seen": 11289822400, "step": 39700, "train_runtime": 386030.8565, "train_tokens_per_second": 29245.907 }, { "epoch": 1.4050180558903334, "grad_norm": 0.6015625, "learning_rate": 2.2426034766443042e-05, "loss": 0.388654899597168, "num_input_tokens_seen": 11292672064, "step": 39710, "train_runtime": 386127.8401, "train_tokens_per_second": 29245.941 }, { "epoch": 1.4053718761540621, "grad_norm": 0.625, "learning_rate": 2.2423779374890626e-05, "loss": 0.388590669631958, "num_input_tokens_seen": 11295548544, "step": 39720, "train_runtime": 386229.5597, "train_tokens_per_second": 29245.686 }, { "epoch": 1.4057256964177909, "grad_norm": 0.61328125, "learning_rate": 2.2421524663677132e-05, "loss": 0.3916128396987915, "num_input_tokens_seen": 11298352256, "step": 39730, "train_runtime": 386324.3274, "train_tokens_per_second": 29245.77 }, { "epoch": 1.4060795166815199, "grad_norm": 0.61328125, "learning_rate": 2.2419270632460588e-05, "loss": 0.3905921936035156, "num_input_tokens_seen": 11301168896, "step": 39740, "train_runtime": 386419.523, "train_tokens_per_second": 29245.854 }, { "epoch": 1.4064333369452484, "grad_norm": 0.59765625, "learning_rate": 2.2417017280899265e-05, "loss": 0.39098193645477297, "num_input_tokens_seen": 11303974528, "step": 39750, "train_runtime": 386516.1704, "train_tokens_per_second": 29245.8 }, { "epoch": 1.4067871572089774, "grad_norm": 0.59375, "learning_rate": 2.2414764608651668e-05, "loss": 0.3909113883972168, "num_input_tokens_seen": 11306792128, "step": 39760, "train_runtime": 386614.3664, "train_tokens_per_second": 29245.66 }, { "epoch": 1.407140977472706, "grad_norm": 0.6015625, "learning_rate": 2.241251261537655e-05, "loss": 0.3887632369995117, "num_input_tokens_seen": 11309587840, "step": 39770, "train_runtime": 386708.711, "train_tokens_per_second": 29245.754 }, { "epoch": 1.407494797736435, "grad_norm": 0.62890625, "learning_rate": 2.2410261300732903e-05, "loss": 0.3937871217727661, "num_input_tokens_seen": 11312487232, "step": 39780, "train_runtime": 386811.6242, "train_tokens_per_second": 29245.469 }, { "epoch": 1.4078486180001637, "grad_norm": 0.58203125, "learning_rate": 2.240801066437995e-05, "loss": 0.3941979169845581, "num_input_tokens_seen": 11315314880, "step": 39790, "train_runtime": 386906.2005, "train_tokens_per_second": 29245.628 }, { "epoch": 1.4082024382638925, "grad_norm": 0.59765625, "learning_rate": 2.2405760705977166e-05, "loss": 0.3887176513671875, "num_input_tokens_seen": 11318206912, "step": 39800, "train_runtime": 387005.9583, "train_tokens_per_second": 29245.562 }, { "epoch": 1.4085562585276212, "grad_norm": 0.62109375, "learning_rate": 2.240351142518425e-05, "loss": 0.3900728225708008, "num_input_tokens_seen": 11321046528, "step": 39810, "train_runtime": 387102.7036, "train_tokens_per_second": 29245.589 }, { "epoch": 1.40891007879135, "grad_norm": 0.578125, "learning_rate": 2.240126282166116e-05, "loss": 0.38937814235687257, "num_input_tokens_seen": 11323874880, "step": 39820, "train_runtime": 387200.5701, "train_tokens_per_second": 29245.502 }, { "epoch": 1.4092638990550788, "grad_norm": 0.625, "learning_rate": 2.239901489506808e-05, "loss": 0.3895012378692627, "num_input_tokens_seen": 11326753280, "step": 39830, "train_runtime": 387301.2846, "train_tokens_per_second": 29245.328 }, { "epoch": 1.4096177193188075, "grad_norm": 0.62109375, "learning_rate": 2.2396767645065424e-05, "loss": 0.39227278232574464, "num_input_tokens_seen": 11329605440, "step": 39840, "train_runtime": 387398.4679, "train_tokens_per_second": 29245.354 }, { "epoch": 1.4099715395825363, "grad_norm": 0.609375, "learning_rate": 2.239452107131387e-05, "loss": 0.39105401039123533, "num_input_tokens_seen": 11332447360, "step": 39850, "train_runtime": 387495.2068, "train_tokens_per_second": 29245.387 }, { "epoch": 1.410325359846265, "grad_norm": 0.6015625, "learning_rate": 2.239227517347431e-05, "loss": 0.3898653984069824, "num_input_tokens_seen": 11335302336, "step": 39860, "train_runtime": 387593.0355, "train_tokens_per_second": 29245.372 }, { "epoch": 1.4106791801099938, "grad_norm": 0.6015625, "learning_rate": 2.2390029951207876e-05, "loss": 0.3870972156524658, "num_input_tokens_seen": 11338120000, "step": 39870, "train_runtime": 387686.425, "train_tokens_per_second": 29245.595 }, { "epoch": 1.4110330003737226, "grad_norm": 0.61328125, "learning_rate": 2.2387785404175965e-05, "loss": 0.3906590938568115, "num_input_tokens_seen": 11340983232, "step": 39880, "train_runtime": 387785.0483, "train_tokens_per_second": 29245.54 }, { "epoch": 1.4113868206374514, "grad_norm": 0.60546875, "learning_rate": 2.2385541532040178e-05, "loss": 0.39721705913543703, "num_input_tokens_seen": 11343874368, "step": 39890, "train_runtime": 387885.3249, "train_tokens_per_second": 29245.433 }, { "epoch": 1.4117406409011801, "grad_norm": 0.61328125, "learning_rate": 2.2383298334462368e-05, "loss": 0.39101126194000246, "num_input_tokens_seen": 11346669056, "step": 39900, "train_runtime": 387979.7176, "train_tokens_per_second": 29245.521 }, { "epoch": 1.412094461164909, "grad_norm": 0.62109375, "learning_rate": 2.2381055811104627e-05, "loss": 0.3916982650756836, "num_input_tokens_seen": 11349581440, "step": 39910, "train_runtime": 388081.7648, "train_tokens_per_second": 29245.336 }, { "epoch": 1.4124482814286377, "grad_norm": 0.64453125, "learning_rate": 2.2378813961629274e-05, "loss": 0.392187762260437, "num_input_tokens_seen": 11352445824, "step": 39920, "train_runtime": 388181.5717, "train_tokens_per_second": 29245.195 }, { "epoch": 1.4128021016923666, "grad_norm": 0.62890625, "learning_rate": 2.2376572785698884e-05, "loss": 0.3917304515838623, "num_input_tokens_seen": 11355256192, "step": 39930, "train_runtime": 388276.3498, "train_tokens_per_second": 29245.294 }, { "epoch": 1.4131559219560954, "grad_norm": 0.6171875, "learning_rate": 2.237433228297625e-05, "loss": 0.3887251138687134, "num_input_tokens_seen": 11358158912, "step": 39940, "train_runtime": 388375.2664, "train_tokens_per_second": 29245.32 }, { "epoch": 1.4135097422198242, "grad_norm": 0.59375, "learning_rate": 2.2372092453124402e-05, "loss": 0.3879792928695679, "num_input_tokens_seen": 11360970368, "step": 39950, "train_runtime": 388470.9916, "train_tokens_per_second": 29245.351 }, { "epoch": 1.413863562483553, "grad_norm": 0.59765625, "learning_rate": 2.236985329580662e-05, "loss": 0.38984549045562744, "num_input_tokens_seen": 11363792768, "step": 39960, "train_runtime": 388564.4927, "train_tokens_per_second": 29245.577 }, { "epoch": 1.4142173827472817, "grad_norm": 0.63671875, "learning_rate": 2.236761481068641e-05, "loss": 0.3871484279632568, "num_input_tokens_seen": 11366586624, "step": 39970, "train_runtime": 388659.9159, "train_tokens_per_second": 29245.585 }, { "epoch": 1.4145712030110105, "grad_norm": 0.71875, "learning_rate": 2.2365376997427508e-05, "loss": 0.3879386901855469, "num_input_tokens_seen": 11369383424, "step": 39980, "train_runtime": 388753.0564, "train_tokens_per_second": 29245.772 }, { "epoch": 1.4149250232747392, "grad_norm": 0.60546875, "learning_rate": 2.2363139855693906e-05, "loss": 0.38856356143951415, "num_input_tokens_seen": 11372213504, "step": 39990, "train_runtime": 388851.2578, "train_tokens_per_second": 29245.665 }, { "epoch": 1.415278843538468, "grad_norm": 0.59375, "learning_rate": 2.2360903385149807e-05, "loss": 0.38887643814086914, "num_input_tokens_seen": 11374996992, "step": 40000, "train_runtime": 388944.4839, "train_tokens_per_second": 29245.811 }, { "epoch": 1.415278843538468, "eval_loss": 0.33797845244407654, "eval_runtime": 8.4274, "eval_samples_per_second": 473.217, "eval_steps_per_second": 3.797, "num_input_tokens_seen": 11374996992, "step": 40000 }, { "epoch": 1.4156326638021968, "grad_norm": 0.62109375, "learning_rate": 2.2358667585459662e-05, "loss": 0.38672637939453125, "num_input_tokens_seen": 11377803456, "step": 40010, "train_runtime": 389069.8515, "train_tokens_per_second": 29243.601 }, { "epoch": 1.4159864840659255, "grad_norm": 0.6015625, "learning_rate": 2.2356432456288154e-05, "loss": 0.38859717845916747, "num_input_tokens_seen": 11380581760, "step": 40020, "train_runtime": 389161.6461, "train_tokens_per_second": 29243.842 }, { "epoch": 1.4163403043296543, "grad_norm": 0.59375, "learning_rate": 2.235419799730021e-05, "loss": 0.3892946243286133, "num_input_tokens_seen": 11383398080, "step": 40030, "train_runtime": 389256.8893, "train_tokens_per_second": 29243.922 }, { "epoch": 1.416694124593383, "grad_norm": 0.63671875, "learning_rate": 2.2351964208160966e-05, "loss": 0.393123722076416, "num_input_tokens_seen": 11386258048, "step": 40040, "train_runtime": 389353.9447, "train_tokens_per_second": 29243.978 }, { "epoch": 1.4170479448571118, "grad_norm": 0.62109375, "learning_rate": 2.2349731088535826e-05, "loss": 0.3896328926086426, "num_input_tokens_seen": 11389134464, "step": 40050, "train_runtime": 389451.9993, "train_tokens_per_second": 29244.001 }, { "epoch": 1.4174017651208406, "grad_norm": 0.60546875, "learning_rate": 2.2347498638090404e-05, "loss": 0.3914656639099121, "num_input_tokens_seen": 11391962304, "step": 40060, "train_runtime": 389547.4846, "train_tokens_per_second": 29244.092 }, { "epoch": 1.4177555853845694, "grad_norm": 0.60546875, "learning_rate": 2.234526685649055e-05, "loss": 0.389146614074707, "num_input_tokens_seen": 11394846720, "step": 40070, "train_runtime": 389646.0307, "train_tokens_per_second": 29244.098 }, { "epoch": 1.4181094056482983, "grad_norm": 0.609375, "learning_rate": 2.234303574340235e-05, "loss": 0.3896371364593506, "num_input_tokens_seen": 11397669696, "step": 40080, "train_runtime": 389741.2251, "train_tokens_per_second": 29244.198 }, { "epoch": 1.418463225912027, "grad_norm": 0.6015625, "learning_rate": 2.234080529849214e-05, "loss": 0.3892864942550659, "num_input_tokens_seen": 11400518080, "step": 40090, "train_runtime": 389840.6003, "train_tokens_per_second": 29244.05 }, { "epoch": 1.4188170461757559, "grad_norm": 0.59375, "learning_rate": 2.2338575521426467e-05, "loss": 0.3886976718902588, "num_input_tokens_seen": 11403364352, "step": 40100, "train_runtime": 389939.6015, "train_tokens_per_second": 29243.925 }, { "epoch": 1.4191708664394846, "grad_norm": 0.6171875, "learning_rate": 2.2336346411872113e-05, "loss": 0.3863805294036865, "num_input_tokens_seen": 11406277248, "step": 40110, "train_runtime": 390039.1615, "train_tokens_per_second": 29243.928 }, { "epoch": 1.4195246867032134, "grad_norm": 0.59765625, "learning_rate": 2.2334117969496103e-05, "loss": 0.39302668571472166, "num_input_tokens_seen": 11409132672, "step": 40120, "train_runtime": 390133.9945, "train_tokens_per_second": 29244.139 }, { "epoch": 1.4198785069669422, "grad_norm": 0.62890625, "learning_rate": 2.2331890193965688e-05, "loss": 0.39189538955688474, "num_input_tokens_seen": 11411977280, "step": 40130, "train_runtime": 390232.8637, "train_tokens_per_second": 29244.019 }, { "epoch": 1.420232327230671, "grad_norm": 0.61328125, "learning_rate": 2.2329663084948358e-05, "loss": 0.3895774602890015, "num_input_tokens_seen": 11414848768, "step": 40140, "train_runtime": 390330.0745, "train_tokens_per_second": 29244.092 }, { "epoch": 1.4205861474943997, "grad_norm": 0.609375, "learning_rate": 2.2327436642111822e-05, "loss": 0.39326364994049073, "num_input_tokens_seen": 11417682944, "step": 40150, "train_runtime": 390425.1589, "train_tokens_per_second": 29244.229 }, { "epoch": 1.4209399677581285, "grad_norm": 0.6015625, "learning_rate": 2.2325210865124034e-05, "loss": 0.39289882183074953, "num_input_tokens_seen": 11420514240, "step": 40160, "train_runtime": 390522.7983, "train_tokens_per_second": 29244.168 }, { "epoch": 1.4212937880218572, "grad_norm": 0.61328125, "learning_rate": 2.2322985753653177e-05, "loss": 0.3914470195770264, "num_input_tokens_seen": 11423375296, "step": 40170, "train_runtime": 390617.9384, "train_tokens_per_second": 29244.369 }, { "epoch": 1.421647608285586, "grad_norm": 0.6015625, "learning_rate": 2.2320761307367658e-05, "loss": 0.3858524799346924, "num_input_tokens_seen": 11426219264, "step": 40180, "train_runtime": 390715.8501, "train_tokens_per_second": 29244.32 }, { "epoch": 1.4220014285493148, "grad_norm": 0.609375, "learning_rate": 2.2318537525936124e-05, "loss": 0.39272003173828124, "num_input_tokens_seen": 11429033600, "step": 40190, "train_runtime": 390812.3121, "train_tokens_per_second": 29244.303 }, { "epoch": 1.4223552488130435, "grad_norm": 0.62109375, "learning_rate": 2.2316314409027443e-05, "loss": 0.3908493757247925, "num_input_tokens_seen": 11431858624, "step": 40200, "train_runtime": 390910.306, "train_tokens_per_second": 29244.199 }, { "epoch": 1.4227090690767723, "grad_norm": 0.625, "learning_rate": 2.2314091956310723e-05, "loss": 0.39589080810546873, "num_input_tokens_seen": 11434702080, "step": 40210, "train_runtime": 391007.777, "train_tokens_per_second": 29244.181 }, { "epoch": 1.423062889340501, "grad_norm": 0.59375, "learning_rate": 2.231187016745531e-05, "loss": 0.38591485023498534, "num_input_tokens_seen": 11437572544, "step": 40220, "train_runtime": 391108.7964, "train_tokens_per_second": 29243.967 }, { "epoch": 1.42341670960423, "grad_norm": 0.5859375, "learning_rate": 2.2309649042130753e-05, "loss": 0.3878044128417969, "num_input_tokens_seen": 11440431808, "step": 40230, "train_runtime": 391208.1155, "train_tokens_per_second": 29243.851 }, { "epoch": 1.4237705298679586, "grad_norm": 0.58984375, "learning_rate": 2.2307428580006863e-05, "loss": 0.3874910831451416, "num_input_tokens_seen": 11443291968, "step": 40240, "train_runtime": 391305.5926, "train_tokens_per_second": 29243.875 }, { "epoch": 1.4241243501316876, "grad_norm": 0.59765625, "learning_rate": 2.230520878075366e-05, "loss": 0.3884744167327881, "num_input_tokens_seen": 11446056000, "step": 40250, "train_runtime": 391397.1458, "train_tokens_per_second": 29244.097 }, { "epoch": 1.4244781703954161, "grad_norm": 0.58984375, "learning_rate": 2.2302989644041396e-05, "loss": 0.3924331426620483, "num_input_tokens_seen": 11448894656, "step": 40260, "train_runtime": 391492.6087, "train_tokens_per_second": 29244.217 }, { "epoch": 1.4248319906591451, "grad_norm": 0.578125, "learning_rate": 2.2300771169540562e-05, "loss": 0.3892298698425293, "num_input_tokens_seen": 11451740096, "step": 40270, "train_runtime": 391587.7858, "train_tokens_per_second": 29244.375 }, { "epoch": 1.4251858109228739, "grad_norm": 0.59375, "learning_rate": 2.2298553356921874e-05, "loss": 0.38946716785430907, "num_input_tokens_seen": 11454567040, "step": 40280, "train_runtime": 391682.0183, "train_tokens_per_second": 29244.557 }, { "epoch": 1.4255396311866027, "grad_norm": 0.625, "learning_rate": 2.2296336205856278e-05, "loss": 0.3936901569366455, "num_input_tokens_seen": 11457382976, "step": 40290, "train_runtime": 391776.4845, "train_tokens_per_second": 29244.693 }, { "epoch": 1.4258934514503314, "grad_norm": 0.58203125, "learning_rate": 2.2294119716014944e-05, "loss": 0.38647236824035647, "num_input_tokens_seen": 11460279872, "step": 40300, "train_runtime": 391879.8901, "train_tokens_per_second": 29244.368 }, { "epoch": 1.4262472717140602, "grad_norm": 0.609375, "learning_rate": 2.2291903887069275e-05, "loss": 0.38946921825408937, "num_input_tokens_seen": 11463110400, "step": 40310, "train_runtime": 391975.3813, "train_tokens_per_second": 29244.465 }, { "epoch": 1.426601091977789, "grad_norm": 0.59765625, "learning_rate": 2.22896887186909e-05, "loss": 0.38969926834106444, "num_input_tokens_seen": 11465984384, "step": 40320, "train_runtime": 392075.605, "train_tokens_per_second": 29244.32 }, { "epoch": 1.4269549122415177, "grad_norm": 0.609375, "learning_rate": 2.2287474210551678e-05, "loss": 0.3908782243728638, "num_input_tokens_seen": 11468849600, "step": 40330, "train_runtime": 392175.8523, "train_tokens_per_second": 29244.15 }, { "epoch": 1.4273087325052465, "grad_norm": 0.6015625, "learning_rate": 2.22852603623237e-05, "loss": 0.38668394088745117, "num_input_tokens_seen": 11471715584, "step": 40340, "train_runtime": 392273.4114, "train_tokens_per_second": 29244.183 }, { "epoch": 1.4276625527689752, "grad_norm": 0.58203125, "learning_rate": 2.2283047173679276e-05, "loss": 0.3864229679107666, "num_input_tokens_seen": 11474555008, "step": 40350, "train_runtime": 392370.7603, "train_tokens_per_second": 29244.164 }, { "epoch": 1.428016373032704, "grad_norm": 0.609375, "learning_rate": 2.2280834644290958e-05, "loss": 0.3852095365524292, "num_input_tokens_seen": 11477404096, "step": 40360, "train_runtime": 392468.9914, "train_tokens_per_second": 29244.104 }, { "epoch": 1.4283701932964328, "grad_norm": 0.60546875, "learning_rate": 2.2278622773831507e-05, "loss": 0.3873852252960205, "num_input_tokens_seen": 11480238592, "step": 40370, "train_runtime": 392564.3631, "train_tokens_per_second": 29244.22 }, { "epoch": 1.4287240135601615, "grad_norm": 0.62890625, "learning_rate": 2.227641156197392e-05, "loss": 0.3899340867996216, "num_input_tokens_seen": 11483001536, "step": 40380, "train_runtime": 392655.7495, "train_tokens_per_second": 29244.45 }, { "epoch": 1.4290778338238903, "grad_norm": 0.609375, "learning_rate": 2.227420100839143e-05, "loss": 0.3916586399078369, "num_input_tokens_seen": 11485833152, "step": 40390, "train_runtime": 392751.5872, "train_tokens_per_second": 29244.524 }, { "epoch": 1.4294316540876193, "grad_norm": 0.59375, "learning_rate": 2.227199111275749e-05, "loss": 0.3894233226776123, "num_input_tokens_seen": 11488681728, "step": 40400, "train_runtime": 392849.262, "train_tokens_per_second": 29244.504 }, { "epoch": 1.4297854743513478, "grad_norm": 0.6015625, "learning_rate": 2.226978187474577e-05, "loss": 0.3920260429382324, "num_input_tokens_seen": 11491614080, "step": 40410, "train_runtime": 392951.2174, "train_tokens_per_second": 29244.378 }, { "epoch": 1.4301392946150768, "grad_norm": 0.609375, "learning_rate": 2.226757329403018e-05, "loss": 0.3896705389022827, "num_input_tokens_seen": 11494459264, "step": 40420, "train_runtime": 393047.4887, "train_tokens_per_second": 29244.454 }, { "epoch": 1.4304931148788054, "grad_norm": 0.6015625, "learning_rate": 2.226536537028485e-05, "loss": 0.3868753433227539, "num_input_tokens_seen": 11497338880, "step": 40430, "train_runtime": 393146.7239, "train_tokens_per_second": 29244.397 }, { "epoch": 1.4308469351425344, "grad_norm": 0.62109375, "learning_rate": 2.2263158103184143e-05, "loss": 0.38915555477142333, "num_input_tokens_seen": 11500204352, "step": 40440, "train_runtime": 393244.1577, "train_tokens_per_second": 29244.438 }, { "epoch": 1.4312007554062631, "grad_norm": 0.609375, "learning_rate": 2.2260951492402636e-05, "loss": 0.3887815475463867, "num_input_tokens_seen": 11502991680, "step": 40450, "train_runtime": 393337.5303, "train_tokens_per_second": 29244.582 }, { "epoch": 1.431554575669992, "grad_norm": 0.58203125, "learning_rate": 2.225874553761514e-05, "loss": 0.3865049362182617, "num_input_tokens_seen": 11505850112, "step": 40460, "train_runtime": 393432.8216, "train_tokens_per_second": 29244.764 }, { "epoch": 1.4319083959337207, "grad_norm": 0.59765625, "learning_rate": 2.2256540238496687e-05, "loss": 0.387589693069458, "num_input_tokens_seen": 11508674048, "step": 40470, "train_runtime": 393528.6376, "train_tokens_per_second": 29244.82 }, { "epoch": 1.4322622161974494, "grad_norm": 0.609375, "learning_rate": 2.225433559472255e-05, "loss": 0.3893230199813843, "num_input_tokens_seen": 11511497024, "step": 40480, "train_runtime": 393626.089, "train_tokens_per_second": 29244.751 }, { "epoch": 1.4326160364611782, "grad_norm": 0.6171875, "learning_rate": 2.22521316059682e-05, "loss": 0.3911158800125122, "num_input_tokens_seen": 11514339264, "step": 40490, "train_runtime": 393722.019, "train_tokens_per_second": 29244.845 }, { "epoch": 1.432969856724907, "grad_norm": 0.62109375, "learning_rate": 2.224992827190935e-05, "loss": 0.3901453733444214, "num_input_tokens_seen": 11517171136, "step": 40500, "train_runtime": 393818.7668, "train_tokens_per_second": 29244.851 }, { "epoch": 1.4333236769886357, "grad_norm": 0.60546875, "learning_rate": 2.2247725592221942e-05, "loss": 0.38905446529388427, "num_input_tokens_seen": 11520055104, "step": 40510, "train_runtime": 393918.7668, "train_tokens_per_second": 29244.748 }, { "epoch": 1.4336774972523645, "grad_norm": 0.58984375, "learning_rate": 2.224552356658213e-05, "loss": 0.3883650779724121, "num_input_tokens_seen": 11522938176, "step": 40520, "train_runtime": 394019.906, "train_tokens_per_second": 29244.558 }, { "epoch": 1.4340313175160933, "grad_norm": 0.59765625, "learning_rate": 2.2243322194666296e-05, "loss": 0.3913144111633301, "num_input_tokens_seen": 11525780544, "step": 40530, "train_runtime": 394117.0546, "train_tokens_per_second": 29244.562 }, { "epoch": 1.434385137779822, "grad_norm": 0.59765625, "learning_rate": 2.2241121476151057e-05, "loss": 0.3855109691619873, "num_input_tokens_seen": 11528624000, "step": 40540, "train_runtime": 394212.708, "train_tokens_per_second": 29244.679 }, { "epoch": 1.4347389580435508, "grad_norm": 0.60546875, "learning_rate": 2.2238921410713234e-05, "loss": 0.38794527053833006, "num_input_tokens_seen": 11531470016, "step": 40550, "train_runtime": 394309.3802, "train_tokens_per_second": 29244.727 }, { "epoch": 1.4350927783072795, "grad_norm": 0.62109375, "learning_rate": 2.223672199802989e-05, "loss": 0.39396731853485106, "num_input_tokens_seen": 11534291712, "step": 40560, "train_runtime": 394406.6627, "train_tokens_per_second": 29244.668 }, { "epoch": 1.4354465985710085, "grad_norm": 0.62109375, "learning_rate": 2.2234523237778308e-05, "loss": 0.3863222122192383, "num_input_tokens_seen": 11537152192, "step": 40570, "train_runtime": 394507.4858, "train_tokens_per_second": 29244.444 }, { "epoch": 1.435800418834737, "grad_norm": 0.60546875, "learning_rate": 2.2232325129635972e-05, "loss": 0.38979282379150393, "num_input_tokens_seen": 11539980224, "step": 40580, "train_runtime": 394604.2177, "train_tokens_per_second": 29244.442 }, { "epoch": 1.436154239098466, "grad_norm": 0.58984375, "learning_rate": 2.2230127673280628e-05, "loss": 0.38915553092956545, "num_input_tokens_seen": 11542885888, "step": 40590, "train_runtime": 394706.5566, "train_tokens_per_second": 29244.221 }, { "epoch": 1.4365080593621946, "grad_norm": 0.58984375, "learning_rate": 2.222793086839022e-05, "loss": 0.38700313568115235, "num_input_tokens_seen": 11545725440, "step": 40600, "train_runtime": 394806.9318, "train_tokens_per_second": 29243.979 }, { "epoch": 1.4368618796259236, "grad_norm": 0.63671875, "learning_rate": 2.222573471464291e-05, "loss": 0.3864602565765381, "num_input_tokens_seen": 11548548416, "step": 40610, "train_runtime": 394905.1277, "train_tokens_per_second": 29243.855 }, { "epoch": 1.4372156998896524, "grad_norm": 0.59765625, "learning_rate": 2.22235392117171e-05, "loss": 0.3960279941558838, "num_input_tokens_seen": 11551403648, "step": 40620, "train_runtime": 395003.0354, "train_tokens_per_second": 29243.835 }, { "epoch": 1.4375695201533811, "grad_norm": 0.609375, "learning_rate": 2.22213443592914e-05, "loss": 0.3902994155883789, "num_input_tokens_seen": 11554256640, "step": 40630, "train_runtime": 395101.2051, "train_tokens_per_second": 29243.79 }, { "epoch": 1.43792334041711, "grad_norm": 0.61328125, "learning_rate": 2.221915015704465e-05, "loss": 0.3881173610687256, "num_input_tokens_seen": 11557072000, "step": 40640, "train_runtime": 395195.2645, "train_tokens_per_second": 29243.954 }, { "epoch": 1.4382771606808387, "grad_norm": 0.58203125, "learning_rate": 2.221695660465592e-05, "loss": 0.38553333282470703, "num_input_tokens_seen": 11559902336, "step": 40650, "train_runtime": 395294.6429, "train_tokens_per_second": 29243.762 }, { "epoch": 1.4386309809445674, "grad_norm": 0.6171875, "learning_rate": 2.2214763701804485e-05, "loss": 0.3853966236114502, "num_input_tokens_seen": 11562712000, "step": 40660, "train_runtime": 395389.7903, "train_tokens_per_second": 29243.83 }, { "epoch": 1.4389848012082962, "grad_norm": 0.58203125, "learning_rate": 2.221257144816984e-05, "loss": 0.3895285606384277, "num_input_tokens_seen": 11565586112, "step": 40670, "train_runtime": 395487.0615, "train_tokens_per_second": 29243.905 }, { "epoch": 1.439338621472025, "grad_norm": 0.6015625, "learning_rate": 2.2210379843431728e-05, "loss": 0.3875574588775635, "num_input_tokens_seen": 11568444672, "step": 40680, "train_runtime": 395583.8155, "train_tokens_per_second": 29243.979 }, { "epoch": 1.4396924417357537, "grad_norm": 0.61328125, "learning_rate": 2.220818888727008e-05, "loss": 0.39140543937683103, "num_input_tokens_seen": 11571286464, "step": 40690, "train_runtime": 395679.8891, "train_tokens_per_second": 29244.06 }, { "epoch": 1.4400462619994825, "grad_norm": 0.59765625, "learning_rate": 2.2205998579365066e-05, "loss": 0.38942081928253175, "num_input_tokens_seen": 11574163904, "step": 40700, "train_runtime": 395777.0879, "train_tokens_per_second": 29244.148 }, { "epoch": 1.4404000822632113, "grad_norm": 0.6015625, "learning_rate": 2.220380891939708e-05, "loss": 0.39285242557525635, "num_input_tokens_seen": 11577004992, "step": 40710, "train_runtime": 395871.9878, "train_tokens_per_second": 29244.315 }, { "epoch": 1.44075390252694, "grad_norm": 0.61328125, "learning_rate": 2.220161990704673e-05, "loss": 0.3845607995986938, "num_input_tokens_seen": 11579829248, "step": 40720, "train_runtime": 395967.9229, "train_tokens_per_second": 29244.362 }, { "epoch": 1.4411077227906688, "grad_norm": 0.60546875, "learning_rate": 2.2199431541994836e-05, "loss": 0.3867394208908081, "num_input_tokens_seen": 11582653632, "step": 40730, "train_runtime": 396065.5919, "train_tokens_per_second": 29244.281 }, { "epoch": 1.4414615430543978, "grad_norm": 0.609375, "learning_rate": 2.2197243823922452e-05, "loss": 0.38645544052124026, "num_input_tokens_seen": 11585477120, "step": 40740, "train_runtime": 396162.0728, "train_tokens_per_second": 29244.286 }, { "epoch": 1.4418153633181263, "grad_norm": 0.63671875, "learning_rate": 2.2195056752510847e-05, "loss": 0.3891130924224854, "num_input_tokens_seen": 11588314752, "step": 40750, "train_runtime": 396258.9957, "train_tokens_per_second": 29244.294 }, { "epoch": 1.4421691835818553, "grad_norm": 0.625, "learning_rate": 2.2192870327441508e-05, "loss": 0.3863529682159424, "num_input_tokens_seen": 11591223168, "step": 40760, "train_runtime": 396359.3425, "train_tokens_per_second": 29244.228 }, { "epoch": 1.442523003845584, "grad_norm": 0.58984375, "learning_rate": 2.219068454839615e-05, "loss": 0.3863476276397705, "num_input_tokens_seen": 11594067584, "step": 40770, "train_runtime": 396454.1755, "train_tokens_per_second": 29244.408 }, { "epoch": 1.4428768241093128, "grad_norm": 0.609375, "learning_rate": 2.218849941505669e-05, "loss": 0.3878518342971802, "num_input_tokens_seen": 11596892352, "step": 40780, "train_runtime": 396550.635, "train_tokens_per_second": 29244.418 }, { "epoch": 1.4432306443730416, "grad_norm": 0.59765625, "learning_rate": 2.2186314927105285e-05, "loss": 0.38821682929992674, "num_input_tokens_seen": 11599698048, "step": 40790, "train_runtime": 396644.0766, "train_tokens_per_second": 29244.602 }, { "epoch": 1.4435844646367704, "grad_norm": 0.6015625, "learning_rate": 2.2184131084224292e-05, "loss": 0.3887503147125244, "num_input_tokens_seen": 11602548928, "step": 40800, "train_runtime": 396742.2958, "train_tokens_per_second": 29244.548 }, { "epoch": 1.4439382849004991, "grad_norm": 0.65625, "learning_rate": 2.2181947886096305e-05, "loss": 0.3889749526977539, "num_input_tokens_seen": 11605396096, "step": 40810, "train_runtime": 396838.6051, "train_tokens_per_second": 29244.625 }, { "epoch": 1.444292105164228, "grad_norm": 0.60546875, "learning_rate": 2.217976533240412e-05, "loss": 0.39027340412139894, "num_input_tokens_seen": 11608202496, "step": 40820, "train_runtime": 396933.7398, "train_tokens_per_second": 29244.686 }, { "epoch": 1.4446459254279567, "grad_norm": 0.609375, "learning_rate": 2.217758342283076e-05, "loss": 0.39053912162780763, "num_input_tokens_seen": 11611019392, "step": 40830, "train_runtime": 397028.8914, "train_tokens_per_second": 29244.772 }, { "epoch": 1.4449997456916854, "grad_norm": 0.6171875, "learning_rate": 2.2175402157059465e-05, "loss": 0.3942587852478027, "num_input_tokens_seen": 11613865792, "step": 40840, "train_runtime": 397126.1768, "train_tokens_per_second": 29244.775 }, { "epoch": 1.4453535659554142, "grad_norm": 0.59375, "learning_rate": 2.2173221534773696e-05, "loss": 0.3930384635925293, "num_input_tokens_seen": 11616688384, "step": 40850, "train_runtime": 397220.0521, "train_tokens_per_second": 29244.97 }, { "epoch": 1.445707386219143, "grad_norm": 0.609375, "learning_rate": 2.217104155565713e-05, "loss": 0.3854065418243408, "num_input_tokens_seen": 11619584704, "step": 40860, "train_runtime": 397322.9183, "train_tokens_per_second": 29244.688 }, { "epoch": 1.4460612064828717, "grad_norm": 0.59765625, "learning_rate": 2.2168862219393656e-05, "loss": 0.3892513275146484, "num_input_tokens_seen": 11622397504, "step": 40870, "train_runtime": 397416.9661, "train_tokens_per_second": 29244.845 }, { "epoch": 1.4464150267466005, "grad_norm": 0.59375, "learning_rate": 2.2166683525667382e-05, "loss": 0.38978431224822996, "num_input_tokens_seen": 11625274112, "step": 40880, "train_runtime": 397516.0864, "train_tokens_per_second": 29244.789 }, { "epoch": 1.4467688470103293, "grad_norm": 0.6171875, "learning_rate": 2.2164505474162645e-05, "loss": 0.38984863758087157, "num_input_tokens_seen": 11628109952, "step": 40890, "train_runtime": 397611.2174, "train_tokens_per_second": 29244.924 }, { "epoch": 1.447122667274058, "grad_norm": 0.609375, "learning_rate": 2.216232806456398e-05, "loss": 0.391741943359375, "num_input_tokens_seen": 11630886720, "step": 40900, "train_runtime": 397703.835, "train_tokens_per_second": 29245.096 }, { "epoch": 1.447476487537787, "grad_norm": 0.6328125, "learning_rate": 2.2160151296556163e-05, "loss": 0.3904669761657715, "num_input_tokens_seen": 11633691392, "step": 40910, "train_runtime": 397798.411, "train_tokens_per_second": 29245.193 }, { "epoch": 1.4478303078015156, "grad_norm": 0.609375, "learning_rate": 2.2157975169824165e-05, "loss": 0.39179158210754395, "num_input_tokens_seen": 11636556800, "step": 40920, "train_runtime": 397896.6563, "train_tokens_per_second": 29245.174 }, { "epoch": 1.4481841280652445, "grad_norm": 0.63671875, "learning_rate": 2.2155799684053176e-05, "loss": 0.3884803295135498, "num_input_tokens_seen": 11639413632, "step": 40930, "train_runtime": 397994.2706, "train_tokens_per_second": 29245.179 }, { "epoch": 1.4485379483289733, "grad_norm": 0.61328125, "learning_rate": 2.215362483892862e-05, "loss": 0.3948474168777466, "num_input_tokens_seen": 11642220480, "step": 40940, "train_runtime": 398088.3793, "train_tokens_per_second": 29245.316 }, { "epoch": 1.448891768592702, "grad_norm": 0.59375, "learning_rate": 2.2151450634136108e-05, "loss": 0.38910617828369143, "num_input_tokens_seen": 11645031872, "step": 40950, "train_runtime": 398184.17, "train_tokens_per_second": 29245.341 }, { "epoch": 1.4492455888564308, "grad_norm": 0.59765625, "learning_rate": 2.2149277069361504e-05, "loss": 0.38561482429504396, "num_input_tokens_seen": 11647837376, "step": 40960, "train_runtime": 398279.122, "train_tokens_per_second": 29245.413 }, { "epoch": 1.4495994091201596, "grad_norm": 0.6171875, "learning_rate": 2.2147104144290857e-05, "loss": 0.39092767238616943, "num_input_tokens_seen": 11650645696, "step": 40970, "train_runtime": 398375.1057, "train_tokens_per_second": 29245.416 }, { "epoch": 1.4499532293838884, "grad_norm": 0.609375, "learning_rate": 2.2144931858610438e-05, "loss": 0.3938960790634155, "num_input_tokens_seen": 11653494912, "step": 40980, "train_runtime": 398474.9027, "train_tokens_per_second": 29245.242 }, { "epoch": 1.4503070496476171, "grad_norm": 0.58984375, "learning_rate": 2.214276021200674e-05, "loss": 0.38536319732666013, "num_input_tokens_seen": 11656305984, "step": 40990, "train_runtime": 398571.0246, "train_tokens_per_second": 29245.242 }, { "epoch": 1.450660869911346, "grad_norm": 0.6640625, "learning_rate": 2.2140589204166476e-05, "loss": 0.38586225509643557, "num_input_tokens_seen": 11659153792, "step": 41000, "train_runtime": 398667.6044, "train_tokens_per_second": 29245.3 }, { "epoch": 1.4510146901750747, "grad_norm": 0.625, "learning_rate": 2.2138418834776557e-05, "loss": 0.3900140762329102, "num_input_tokens_seen": 11661997248, "step": 41010, "train_runtime": 398766.339, "train_tokens_per_second": 29245.19 }, { "epoch": 1.4513685104388034, "grad_norm": 0.61328125, "learning_rate": 2.213624910352413e-05, "loss": 0.38683252334594725, "num_input_tokens_seen": 11664893056, "step": 41020, "train_runtime": 398867.2381, "train_tokens_per_second": 29245.052 }, { "epoch": 1.4517223307025322, "grad_norm": 0.6171875, "learning_rate": 2.2134080010096532e-05, "loss": 0.38812670707702634, "num_input_tokens_seen": 11667749184, "step": 41030, "train_runtime": 398968.3211, "train_tokens_per_second": 29244.801 }, { "epoch": 1.452076150966261, "grad_norm": 0.609375, "learning_rate": 2.213191155418133e-05, "loss": 0.39428157806396485, "num_input_tokens_seen": 11670609856, "step": 41040, "train_runtime": 399066.7455, "train_tokens_per_second": 29244.757 }, { "epoch": 1.4524299712299897, "grad_norm": 0.61328125, "learning_rate": 2.212974373546631e-05, "loss": 0.39076895713806153, "num_input_tokens_seen": 11673447424, "step": 41050, "train_runtime": 399164.6891, "train_tokens_per_second": 29244.69 }, { "epoch": 1.4527837914937185, "grad_norm": 0.63671875, "learning_rate": 2.212757655363946e-05, "loss": 0.38721442222595215, "num_input_tokens_seen": 11676262784, "step": 41060, "train_runtime": 399259.2753, "train_tokens_per_second": 29244.813 }, { "epoch": 1.4531376117574473, "grad_norm": 0.63671875, "learning_rate": 2.2125410008388984e-05, "loss": 0.3874940872192383, "num_input_tokens_seen": 11679105472, "step": 41070, "train_runtime": 399357.5361, "train_tokens_per_second": 29244.735 }, { "epoch": 1.4534914320211763, "grad_norm": 0.59765625, "learning_rate": 2.2123244099403306e-05, "loss": 0.38756141662597654, "num_input_tokens_seen": 11681939456, "step": 41080, "train_runtime": 399453.2044, "train_tokens_per_second": 29244.826 }, { "epoch": 1.4538452522849048, "grad_norm": 0.61328125, "learning_rate": 2.2121078826371056e-05, "loss": 0.3879857063293457, "num_input_tokens_seen": 11684796032, "step": 41090, "train_runtime": 399549.6661, "train_tokens_per_second": 29244.915 }, { "epoch": 1.4541990725486338, "grad_norm": 0.58984375, "learning_rate": 2.2118914188981088e-05, "loss": 0.38819236755371095, "num_input_tokens_seen": 11687639744, "step": 41100, "train_runtime": 399647.8629, "train_tokens_per_second": 29244.845 }, { "epoch": 1.4545528928123626, "grad_norm": 0.6015625, "learning_rate": 2.2116750186922453e-05, "loss": 0.39173412322998047, "num_input_tokens_seen": 11690419520, "step": 41110, "train_runtime": 399741.0738, "train_tokens_per_second": 29244.98 }, { "epoch": 1.4549067130760913, "grad_norm": 0.6171875, "learning_rate": 2.2114586819884432e-05, "loss": 0.3884713649749756, "num_input_tokens_seen": 11693284544, "step": 41120, "train_runtime": 399841.5348, "train_tokens_per_second": 29244.797 }, { "epoch": 1.45526053333982, "grad_norm": 0.60546875, "learning_rate": 2.21124240875565e-05, "loss": 0.3936263084411621, "num_input_tokens_seen": 11696187968, "step": 41130, "train_runtime": 399942.7547, "train_tokens_per_second": 29244.655 }, { "epoch": 1.4556143536035488, "grad_norm": 0.609375, "learning_rate": 2.2110261989628366e-05, "loss": 0.3882664680480957, "num_input_tokens_seen": 11699114240, "step": 41140, "train_runtime": 400047.8965, "train_tokens_per_second": 29244.284 }, { "epoch": 1.4559681738672776, "grad_norm": 0.59375, "learning_rate": 2.210810052578994e-05, "loss": 0.3900323390960693, "num_input_tokens_seen": 11701960832, "step": 41150, "train_runtime": 400145.8045, "train_tokens_per_second": 29244.242 }, { "epoch": 1.4563219941310064, "grad_norm": 0.59375, "learning_rate": 2.2105939695731333e-05, "loss": 0.389192533493042, "num_input_tokens_seen": 11704807872, "step": 41160, "train_runtime": 400242.7667, "train_tokens_per_second": 29244.271 }, { "epoch": 1.4566758143947351, "grad_norm": 0.609375, "learning_rate": 2.210377949914289e-05, "loss": 0.3876333713531494, "num_input_tokens_seen": 11707594944, "step": 41170, "train_runtime": 400336.2974, "train_tokens_per_second": 29244.4 }, { "epoch": 1.457029634658464, "grad_norm": 0.58203125, "learning_rate": 2.2101619935715153e-05, "loss": 0.39046659469604494, "num_input_tokens_seen": 11710382912, "step": 41180, "train_runtime": 400429.4773, "train_tokens_per_second": 29244.558 }, { "epoch": 1.4573834549221927, "grad_norm": 0.58984375, "learning_rate": 2.2099461005138885e-05, "loss": 0.38741326332092285, "num_input_tokens_seen": 11713193856, "step": 41190, "train_runtime": 400525.2661, "train_tokens_per_second": 29244.582 }, { "epoch": 1.4577372751859214, "grad_norm": 0.61328125, "learning_rate": 2.2097302707105054e-05, "loss": 0.38676726818084717, "num_input_tokens_seen": 11715963584, "step": 41200, "train_runtime": 400616.7709, "train_tokens_per_second": 29244.816 }, { "epoch": 1.4580910954496502, "grad_norm": 0.6171875, "learning_rate": 2.209514504130483e-05, "loss": 0.38543100357055665, "num_input_tokens_seen": 11718841600, "step": 41210, "train_runtime": 400717.7699, "train_tokens_per_second": 29244.627 }, { "epoch": 1.458444915713379, "grad_norm": 0.6015625, "learning_rate": 2.2092988007429625e-05, "loss": 0.3888906478881836, "num_input_tokens_seen": 11721698304, "step": 41220, "train_runtime": 400816.5829, "train_tokens_per_second": 29244.544 }, { "epoch": 1.458798735977108, "grad_norm": 0.61328125, "learning_rate": 2.209083160517102e-05, "loss": 0.39154150485992434, "num_input_tokens_seen": 11724616320, "step": 41230, "train_runtime": 400920.3522, "train_tokens_per_second": 29244.253 }, { "epoch": 1.4591525562408365, "grad_norm": 0.62109375, "learning_rate": 2.208867583422084e-05, "loss": 0.38861167430877686, "num_input_tokens_seen": 11727516416, "step": 41240, "train_runtime": 401021.1499, "train_tokens_per_second": 29244.134 }, { "epoch": 1.4595063765045655, "grad_norm": 0.625, "learning_rate": 2.2086520694271108e-05, "loss": 0.3876093864440918, "num_input_tokens_seen": 11730358784, "step": 41250, "train_runtime": 401120.1848, "train_tokens_per_second": 29244.0 }, { "epoch": 1.459860196768294, "grad_norm": 0.5859375, "learning_rate": 2.2084366185014058e-05, "loss": 0.3886312484741211, "num_input_tokens_seen": 11733238336, "step": 41260, "train_runtime": 401219.768, "train_tokens_per_second": 29243.919 }, { "epoch": 1.460214017032023, "grad_norm": 0.60546875, "learning_rate": 2.208221230614213e-05, "loss": 0.3850902318954468, "num_input_tokens_seen": 11736064640, "step": 41270, "train_runtime": 401316.0489, "train_tokens_per_second": 29243.945 }, { "epoch": 1.4605678372957518, "grad_norm": 0.60546875, "learning_rate": 2.208005905734798e-05, "loss": 0.3880853414535522, "num_input_tokens_seen": 11738981952, "step": 41280, "train_runtime": 401415.5316, "train_tokens_per_second": 29243.965 }, { "epoch": 1.4609216575594806, "grad_norm": 0.6015625, "learning_rate": 2.2077906438324474e-05, "loss": 0.3935344457626343, "num_input_tokens_seen": 11741814272, "step": 41290, "train_runtime": 401511.0538, "train_tokens_per_second": 29244.062 }, { "epoch": 1.4612754778232093, "grad_norm": 0.609375, "learning_rate": 2.2075754448764683e-05, "loss": 0.3901233196258545, "num_input_tokens_seen": 11744600640, "step": 41300, "train_runtime": 401604.7705, "train_tokens_per_second": 29244.176 }, { "epoch": 1.461629298086938, "grad_norm": 0.62109375, "learning_rate": 2.2073603088361887e-05, "loss": 0.3872868061065674, "num_input_tokens_seen": 11747479040, "step": 41310, "train_runtime": 401704.5716, "train_tokens_per_second": 29244.076 }, { "epoch": 1.4619831183506669, "grad_norm": 0.60546875, "learning_rate": 2.2071452356809586e-05, "loss": 0.38918461799621584, "num_input_tokens_seen": 11750318720, "step": 41320, "train_runtime": 401800.4639, "train_tokens_per_second": 29244.164 }, { "epoch": 1.4623369386143956, "grad_norm": 0.58984375, "learning_rate": 2.2069302253801474e-05, "loss": 0.3885365009307861, "num_input_tokens_seen": 11753198720, "step": 41330, "train_runtime": 401897.5005, "train_tokens_per_second": 29244.269 }, { "epoch": 1.4626907588781244, "grad_norm": 0.62109375, "learning_rate": 2.2067152779031465e-05, "loss": 0.3934452056884766, "num_input_tokens_seen": 11756035008, "step": 41340, "train_runtime": 401991.9097, "train_tokens_per_second": 29244.457 }, { "epoch": 1.4630445791418532, "grad_norm": 0.62109375, "learning_rate": 2.206500393219367e-05, "loss": 0.3892578840255737, "num_input_tokens_seen": 11758838976, "step": 41350, "train_runtime": 402086.2275, "train_tokens_per_second": 29244.57 }, { "epoch": 1.463398399405582, "grad_norm": 0.58984375, "learning_rate": 2.206285571298242e-05, "loss": 0.3952140808105469, "num_input_tokens_seen": 11761715328, "step": 41360, "train_runtime": 402184.6644, "train_tokens_per_second": 29244.564 }, { "epoch": 1.4637522196693107, "grad_norm": 0.60546875, "learning_rate": 2.206070812109226e-05, "loss": 0.38689894676208497, "num_input_tokens_seen": 11764582592, "step": 41370, "train_runtime": 402282.2075, "train_tokens_per_second": 29244.601 }, { "epoch": 1.4641060399330394, "grad_norm": 0.6484375, "learning_rate": 2.2058561156217913e-05, "loss": 0.3905513763427734, "num_input_tokens_seen": 11767450752, "step": 41380, "train_runtime": 402379.7553, "train_tokens_per_second": 29244.639 }, { "epoch": 1.4644598601967682, "grad_norm": 0.6015625, "learning_rate": 2.2056414818054347e-05, "loss": 0.38667137622833253, "num_input_tokens_seen": 11770238464, "step": 41390, "train_runtime": 402471.5769, "train_tokens_per_second": 29244.894 }, { "epoch": 1.4648136804604972, "grad_norm": 0.61328125, "learning_rate": 2.2054269106296714e-05, "loss": 0.3852600336074829, "num_input_tokens_seen": 11773071424, "step": 41400, "train_runtime": 402567.8338, "train_tokens_per_second": 29244.938 }, { "epoch": 1.4651675007242257, "grad_norm": 0.62890625, "learning_rate": 2.205212402064038e-05, "loss": 0.3888318300247192, "num_input_tokens_seen": 11775928576, "step": 41410, "train_runtime": 402662.9419, "train_tokens_per_second": 29245.126 }, { "epoch": 1.4655213209879547, "grad_norm": 0.58203125, "learning_rate": 2.204997956078092e-05, "loss": 0.3925034999847412, "num_input_tokens_seen": 11778787136, "step": 41420, "train_runtime": 402760.0548, "train_tokens_per_second": 29245.172 }, { "epoch": 1.4658751412516833, "grad_norm": 0.609375, "learning_rate": 2.2047835726414116e-05, "loss": 0.3913259506225586, "num_input_tokens_seen": 11781597376, "step": 41430, "train_runtime": 402855.1457, "train_tokens_per_second": 29245.245 }, { "epoch": 1.4662289615154123, "grad_norm": 0.6015625, "learning_rate": 2.2045692517235952e-05, "loss": 0.3940769672393799, "num_input_tokens_seen": 11784486528, "step": 41440, "train_runtime": 402957.0544, "train_tokens_per_second": 29245.019 }, { "epoch": 1.466582781779141, "grad_norm": 0.625, "learning_rate": 2.204354993294263e-05, "loss": 0.388521409034729, "num_input_tokens_seen": 11787246976, "step": 41450, "train_runtime": 403050.9107, "train_tokens_per_second": 29245.057 }, { "epoch": 1.4669366020428698, "grad_norm": 0.62109375, "learning_rate": 2.2041407973230548e-05, "loss": 0.3861745119094849, "num_input_tokens_seen": 11790027328, "step": 41460, "train_runtime": 403144.7412, "train_tokens_per_second": 29245.147 }, { "epoch": 1.4672904223065986, "grad_norm": 0.60546875, "learning_rate": 2.203926663779631e-05, "loss": 0.39077186584472656, "num_input_tokens_seen": 11792876288, "step": 41470, "train_runtime": 403241.5868, "train_tokens_per_second": 29245.189 }, { "epoch": 1.4676442425703273, "grad_norm": 0.57421875, "learning_rate": 2.2037125926336733e-05, "loss": 0.38942904472351075, "num_input_tokens_seen": 11795772096, "step": 41480, "train_runtime": 403343.6798, "train_tokens_per_second": 29244.966 }, { "epoch": 1.467998062834056, "grad_norm": 0.58203125, "learning_rate": 2.2034985838548835e-05, "loss": 0.3886574745178223, "num_input_tokens_seen": 11798590080, "step": 41490, "train_runtime": 403440.9354, "train_tokens_per_second": 29244.901 }, { "epoch": 1.4683518830977849, "grad_norm": 0.609375, "learning_rate": 2.2032846374129848e-05, "loss": 0.38815042972564695, "num_input_tokens_seen": 11801416064, "step": 41500, "train_runtime": 403538.3232, "train_tokens_per_second": 29244.846 }, { "epoch": 1.4687057033615136, "grad_norm": 0.62890625, "learning_rate": 2.2030707532777196e-05, "loss": 0.39616124629974364, "num_input_tokens_seen": 11804203456, "step": 41510, "train_runtime": 403632.2213, "train_tokens_per_second": 29244.948 }, { "epoch": 1.4690595236252424, "grad_norm": 0.625, "learning_rate": 2.2028569314188528e-05, "loss": 0.3893098831176758, "num_input_tokens_seen": 11807072768, "step": 41520, "train_runtime": 403730.4441, "train_tokens_per_second": 29244.94 }, { "epoch": 1.4694133438889712, "grad_norm": 0.57421875, "learning_rate": 2.2026431718061676e-05, "loss": 0.3874368667602539, "num_input_tokens_seen": 11809909504, "step": 41530, "train_runtime": 403827.9398, "train_tokens_per_second": 29244.904 }, { "epoch": 1.4697671641527, "grad_norm": 0.61328125, "learning_rate": 2.202429474409469e-05, "loss": 0.39329066276550295, "num_input_tokens_seen": 11812725696, "step": 41540, "train_runtime": 403923.1493, "train_tokens_per_second": 29244.983 }, { "epoch": 1.4701209844164287, "grad_norm": 0.58203125, "learning_rate": 2.202215839198583e-05, "loss": 0.38404526710510256, "num_input_tokens_seen": 11815580224, "step": 41550, "train_runtime": 404020.6708, "train_tokens_per_second": 29244.989 }, { "epoch": 1.4704748046801575, "grad_norm": 0.5859375, "learning_rate": 2.2020022661433544e-05, "loss": 0.389002251625061, "num_input_tokens_seen": 11818447168, "step": 41560, "train_runtime": 404118.0932, "train_tokens_per_second": 29245.033 }, { "epoch": 1.4708286249438864, "grad_norm": 0.63671875, "learning_rate": 2.20178875521365e-05, "loss": 0.3907487869262695, "num_input_tokens_seen": 11821257664, "step": 41570, "train_runtime": 404214.8997, "train_tokens_per_second": 29244.982 }, { "epoch": 1.471182445207615, "grad_norm": 0.59765625, "learning_rate": 2.2015753063793566e-05, "loss": 0.39040122032165525, "num_input_tokens_seen": 11824069248, "step": 41580, "train_runtime": 404307.0474, "train_tokens_per_second": 29245.271 }, { "epoch": 1.471536265471344, "grad_norm": 0.609375, "learning_rate": 2.2013619196103812e-05, "loss": 0.3934812068939209, "num_input_tokens_seen": 11826916096, "step": 41590, "train_runtime": 404405.3064, "train_tokens_per_second": 29245.205 }, { "epoch": 1.4718900857350725, "grad_norm": 0.5703125, "learning_rate": 2.2011485948766514e-05, "loss": 0.38592445850372314, "num_input_tokens_seen": 11829774080, "step": 41600, "train_runtime": 404502.8361, "train_tokens_per_second": 29245.219 }, { "epoch": 1.4722439059988015, "grad_norm": 0.625, "learning_rate": 2.2009353321481148e-05, "loss": 0.3861634016036987, "num_input_tokens_seen": 11832622592, "step": 41610, "train_runtime": 404598.1632, "train_tokens_per_second": 29245.369 }, { "epoch": 1.4725977262625303, "grad_norm": 0.609375, "learning_rate": 2.2007221313947404e-05, "loss": 0.3925305366516113, "num_input_tokens_seen": 11835515584, "step": 41620, "train_runtime": 404697.2593, "train_tokens_per_second": 29245.356 }, { "epoch": 1.472951546526259, "grad_norm": 0.62890625, "learning_rate": 2.2005089925865162e-05, "loss": 0.39200472831726074, "num_input_tokens_seen": 11838331520, "step": 41630, "train_runtime": 404793.9421, "train_tokens_per_second": 29245.328 }, { "epoch": 1.4733053667899878, "grad_norm": 0.5859375, "learning_rate": 2.2002959156934518e-05, "loss": 0.38784592151641845, "num_input_tokens_seen": 11841169152, "step": 41640, "train_runtime": 404887.8089, "train_tokens_per_second": 29245.556 }, { "epoch": 1.4736591870537166, "grad_norm": 0.62890625, "learning_rate": 2.2000829006855763e-05, "loss": 0.39212713241577146, "num_input_tokens_seen": 11844018688, "step": 41650, "train_runtime": 404984.5536, "train_tokens_per_second": 29245.606 }, { "epoch": 1.4740130073174453, "grad_norm": 0.58984375, "learning_rate": 2.199869947532939e-05, "loss": 0.3888967037200928, "num_input_tokens_seen": 11846870592, "step": 41660, "train_runtime": 405080.0081, "train_tokens_per_second": 29245.755 }, { "epoch": 1.474366827581174, "grad_norm": 0.578125, "learning_rate": 2.199657056205611e-05, "loss": 0.38810622692108154, "num_input_tokens_seen": 11849697280, "step": 41670, "train_runtime": 405175.5263, "train_tokens_per_second": 29245.837 }, { "epoch": 1.4747206478449029, "grad_norm": 0.60546875, "learning_rate": 2.1994442266736807e-05, "loss": 0.3954521656036377, "num_input_tokens_seen": 11852599104, "step": 41680, "train_runtime": 405273.8043, "train_tokens_per_second": 29245.905 }, { "epoch": 1.4750744681086316, "grad_norm": 0.58984375, "learning_rate": 2.1992314589072605e-05, "loss": 0.38598241806030276, "num_input_tokens_seen": 11855496576, "step": 41690, "train_runtime": 405375.459, "train_tokens_per_second": 29245.719 }, { "epoch": 1.4754282883723604, "grad_norm": 0.6015625, "learning_rate": 2.1990187528764796e-05, "loss": 0.3855717182159424, "num_input_tokens_seen": 11858326784, "step": 41700, "train_runtime": 405470.619, "train_tokens_per_second": 29245.835 }, { "epoch": 1.4757821086360892, "grad_norm": 0.62890625, "learning_rate": 2.19880610855149e-05, "loss": 0.38348994255065916, "num_input_tokens_seen": 11861230528, "step": 41710, "train_runtime": 405567.4784, "train_tokens_per_second": 29246.01 }, { "epoch": 1.476135928899818, "grad_norm": 0.61328125, "learning_rate": 2.1985935259024618e-05, "loss": 0.38772623538970946, "num_input_tokens_seen": 11864121472, "step": 41720, "train_runtime": 405667.0795, "train_tokens_per_second": 29245.956 }, { "epoch": 1.4764897491635467, "grad_norm": 0.62109375, "learning_rate": 2.1983810048995874e-05, "loss": 0.38765480518341067, "num_input_tokens_seen": 11866918208, "step": 41730, "train_runtime": 405762.2506, "train_tokens_per_second": 29245.989 }, { "epoch": 1.4768435694272757, "grad_norm": 0.6171875, "learning_rate": 2.1981685455130778e-05, "loss": 0.3916560173034668, "num_input_tokens_seen": 11869772224, "step": 41740, "train_runtime": 405862.2649, "train_tokens_per_second": 29245.814 }, { "epoch": 1.4771973896910042, "grad_norm": 0.62109375, "learning_rate": 2.1979561477131642e-05, "loss": 0.39403786659240725, "num_input_tokens_seen": 11872650752, "step": 41750, "train_runtime": 405962.4937, "train_tokens_per_second": 29245.684 }, { "epoch": 1.4775512099547332, "grad_norm": 0.59375, "learning_rate": 2.197743811470099e-05, "loss": 0.3879851341247559, "num_input_tokens_seen": 11875491328, "step": 41760, "train_runtime": 406058.9136, "train_tokens_per_second": 29245.735 }, { "epoch": 1.477905030218462, "grad_norm": 0.62109375, "learning_rate": 2.197531536754154e-05, "loss": 0.39210987091064453, "num_input_tokens_seen": 11878366272, "step": 41770, "train_runtime": 406158.8204, "train_tokens_per_second": 29245.619 }, { "epoch": 1.4782588504821907, "grad_norm": 0.62109375, "learning_rate": 2.1973193235356205e-05, "loss": 0.3847451686859131, "num_input_tokens_seen": 11881177856, "step": 41780, "train_runtime": 406255.8606, "train_tokens_per_second": 29245.554 }, { "epoch": 1.4786126707459195, "grad_norm": 0.625, "learning_rate": 2.197107171784811e-05, "loss": 0.38843379020690916, "num_input_tokens_seen": 11884000640, "step": 41790, "train_runtime": 406347.8649, "train_tokens_per_second": 29245.879 }, { "epoch": 1.4789664910096483, "grad_norm": 0.62890625, "learning_rate": 2.196895081472058e-05, "loss": 0.38926947116851807, "num_input_tokens_seen": 11886802112, "step": 41800, "train_runtime": 406445.1468, "train_tokens_per_second": 29245.772 }, { "epoch": 1.479320311273377, "grad_norm": 0.62109375, "learning_rate": 2.196683052567713e-05, "loss": 0.3918159008026123, "num_input_tokens_seen": 11889605760, "step": 41810, "train_runtime": 406542.3383, "train_tokens_per_second": 29245.677 }, { "epoch": 1.4796741315371058, "grad_norm": 0.60546875, "learning_rate": 2.1964710850421486e-05, "loss": 0.3893465995788574, "num_input_tokens_seen": 11892479424, "step": 41820, "train_runtime": 406638.8454, "train_tokens_per_second": 29245.803 }, { "epoch": 1.4800279518008346, "grad_norm": 0.6171875, "learning_rate": 2.196259178865757e-05, "loss": 0.3939209461212158, "num_input_tokens_seen": 11895332288, "step": 41830, "train_runtime": 406735.9528, "train_tokens_per_second": 29245.834 }, { "epoch": 1.4803817720645633, "grad_norm": 0.63671875, "learning_rate": 2.1960473340089502e-05, "loss": 0.3899192810058594, "num_input_tokens_seen": 11898161408, "step": 41840, "train_runtime": 406833.3941, "train_tokens_per_second": 29245.784 }, { "epoch": 1.480735592328292, "grad_norm": 0.61328125, "learning_rate": 2.19583555044216e-05, "loss": 0.3907729148864746, "num_input_tokens_seen": 11900976064, "step": 41850, "train_runtime": 406929.0064, "train_tokens_per_second": 29245.829 }, { "epoch": 1.4810894125920209, "grad_norm": 0.58984375, "learning_rate": 2.1956238281358394e-05, "loss": 0.38986475467681886, "num_input_tokens_seen": 11903796608, "step": 41860, "train_runtime": 407022.4065, "train_tokens_per_second": 29246.047 }, { "epoch": 1.4814432328557496, "grad_norm": 0.640625, "learning_rate": 2.1954121670604595e-05, "loss": 0.3915048122406006, "num_input_tokens_seen": 11906668864, "step": 41870, "train_runtime": 407121.282, "train_tokens_per_second": 29246.0 }, { "epoch": 1.4817970531194784, "grad_norm": 0.6328125, "learning_rate": 2.1952005671865124e-05, "loss": 0.38891217708587644, "num_input_tokens_seen": 11909509120, "step": 41880, "train_runtime": 407217.1733, "train_tokens_per_second": 29246.088 }, { "epoch": 1.4821508733832072, "grad_norm": 0.609375, "learning_rate": 2.194989028484511e-05, "loss": 0.38334877490997316, "num_input_tokens_seen": 11912281088, "step": 41890, "train_runtime": 407311.0434, "train_tokens_per_second": 29246.153 }, { "epoch": 1.482504693646936, "grad_norm": 0.60546875, "learning_rate": 2.1947775509249857e-05, "loss": 0.38658182621002196, "num_input_tokens_seen": 11915101440, "step": 41900, "train_runtime": 407407.1951, "train_tokens_per_second": 29246.173 }, { "epoch": 1.482858513910665, "grad_norm": 0.59765625, "learning_rate": 2.194566134478489e-05, "loss": 0.39027931690216067, "num_input_tokens_seen": 11917887168, "step": 41910, "train_runtime": 407498.8048, "train_tokens_per_second": 29246.435 }, { "epoch": 1.4832123341743935, "grad_norm": 0.60546875, "learning_rate": 2.1943547791155918e-05, "loss": 0.3932937145233154, "num_input_tokens_seen": 11920766592, "step": 41920, "train_runtime": 407595.7417, "train_tokens_per_second": 29246.544 }, { "epoch": 1.4835661544381225, "grad_norm": 0.61328125, "learning_rate": 2.1941434848068865e-05, "loss": 0.3913945198059082, "num_input_tokens_seen": 11923626560, "step": 41930, "train_runtime": 407691.4506, "train_tokens_per_second": 29246.693 }, { "epoch": 1.4839199747018512, "grad_norm": 0.609375, "learning_rate": 2.193932251522983e-05, "loss": 0.38409278392791746, "num_input_tokens_seen": 11926494080, "step": 41940, "train_runtime": 407792.0428, "train_tokens_per_second": 29246.51 }, { "epoch": 1.48427379496558, "grad_norm": 0.59765625, "learning_rate": 2.1937210792345127e-05, "loss": 0.3881162166595459, "num_input_tokens_seen": 11929369280, "step": 41950, "train_runtime": 407892.2239, "train_tokens_per_second": 29246.376 }, { "epoch": 1.4846276152293088, "grad_norm": 0.6171875, "learning_rate": 2.193509967912126e-05, "loss": 0.39225139617919924, "num_input_tokens_seen": 11932191616, "step": 41960, "train_runtime": 407989.1695, "train_tokens_per_second": 29246.344 }, { "epoch": 1.4849814354930375, "grad_norm": 0.609375, "learning_rate": 2.193298917526494e-05, "loss": 0.3883184909820557, "num_input_tokens_seen": 11935069632, "step": 41970, "train_runtime": 408087.9126, "train_tokens_per_second": 29246.32 }, { "epoch": 1.4853352557567663, "grad_norm": 0.6015625, "learning_rate": 2.1930879280483068e-05, "loss": 0.3937432289123535, "num_input_tokens_seen": 11937905984, "step": 41980, "train_runtime": 408184.6134, "train_tokens_per_second": 29246.34 }, { "epoch": 1.485689076020495, "grad_norm": 0.6171875, "learning_rate": 2.1928769994482743e-05, "loss": 0.39079980850219725, "num_input_tokens_seen": 11940753536, "step": 41990, "train_runtime": 408282.423, "train_tokens_per_second": 29246.308 }, { "epoch": 1.4860428962842238, "grad_norm": 0.625, "learning_rate": 2.1926661316971257e-05, "loss": 0.39066352844238283, "num_input_tokens_seen": 11943568640, "step": 42000, "train_runtime": 408375.7694, "train_tokens_per_second": 29246.516 }, { "epoch": 1.4863967165479526, "grad_norm": 0.59765625, "learning_rate": 2.192455324765611e-05, "loss": 0.39258360862731934, "num_input_tokens_seen": 11946471296, "step": 42010, "train_runtime": 408480.7985, "train_tokens_per_second": 29246.102 }, { "epoch": 1.4867505368116813, "grad_norm": 0.60546875, "learning_rate": 2.192244578624499e-05, "loss": 0.388304615020752, "num_input_tokens_seen": 11949288896, "step": 42020, "train_runtime": 408576.321, "train_tokens_per_second": 29246.161 }, { "epoch": 1.48710435707541, "grad_norm": 0.59375, "learning_rate": 2.1920338932445783e-05, "loss": 0.3867853879928589, "num_input_tokens_seen": 11952160768, "step": 42030, "train_runtime": 408675.1986, "train_tokens_per_second": 29246.112 }, { "epoch": 1.4874581773391389, "grad_norm": 0.6015625, "learning_rate": 2.191823268596658e-05, "loss": 0.39093039035797117, "num_input_tokens_seen": 11955001600, "step": 42040, "train_runtime": 408773.2994, "train_tokens_per_second": 29246.043 }, { "epoch": 1.4878119976028676, "grad_norm": 0.6015625, "learning_rate": 2.191612704651565e-05, "loss": 0.3905934810638428, "num_input_tokens_seen": 11957859520, "step": 42050, "train_runtime": 408872.0825, "train_tokens_per_second": 29245.967 }, { "epoch": 1.4881658178665966, "grad_norm": 0.62109375, "learning_rate": 2.191402201380148e-05, "loss": 0.38708198070526123, "num_input_tokens_seen": 11960717312, "step": 42060, "train_runtime": 408968.2515, "train_tokens_per_second": 29246.078 }, { "epoch": 1.4885196381303252, "grad_norm": 0.6328125, "learning_rate": 2.191191758753273e-05, "loss": 0.3918651819229126, "num_input_tokens_seen": 11963604416, "step": 42070, "train_runtime": 409065.7062, "train_tokens_per_second": 29246.168 }, { "epoch": 1.4888734583940542, "grad_norm": 0.61328125, "learning_rate": 2.190981376741828e-05, "loss": 0.3869763374328613, "num_input_tokens_seen": 11966445696, "step": 42080, "train_runtime": 409163.0258, "train_tokens_per_second": 29246.156 }, { "epoch": 1.4892272786577827, "grad_norm": 0.625, "learning_rate": 2.190771055316719e-05, "loss": 0.38770365715026855, "num_input_tokens_seen": 11969239296, "step": 42090, "train_runtime": 409257.3887, "train_tokens_per_second": 29246.239 }, { "epoch": 1.4895810989215117, "grad_norm": 0.6328125, "learning_rate": 2.1905607944488718e-05, "loss": 0.38915128707885743, "num_input_tokens_seen": 11972024704, "step": 42100, "train_runtime": 409351.5883, "train_tokens_per_second": 29246.313 }, { "epoch": 1.4899349191852405, "grad_norm": 0.6328125, "learning_rate": 2.1903505941092315e-05, "loss": 0.39298579692840574, "num_input_tokens_seen": 11974864512, "step": 42110, "train_runtime": 409452.4827, "train_tokens_per_second": 29246.042 }, { "epoch": 1.4902887394489692, "grad_norm": 0.58984375, "learning_rate": 2.1901404542687634e-05, "loss": 0.3821543216705322, "num_input_tokens_seen": 11977747904, "step": 42120, "train_runtime": 409551.0011, "train_tokens_per_second": 29246.047 }, { "epoch": 1.490642559712698, "grad_norm": 0.62109375, "learning_rate": 2.189930374898452e-05, "loss": 0.38375015258789064, "num_input_tokens_seen": 11980582336, "step": 42130, "train_runtime": 409646.78, "train_tokens_per_second": 29246.128 }, { "epoch": 1.4909963799764268, "grad_norm": 0.609375, "learning_rate": 2.1897203559693018e-05, "loss": 0.38978650569915774, "num_input_tokens_seen": 11983450432, "step": 42140, "train_runtime": 409748.0475, "train_tokens_per_second": 29245.9 }, { "epoch": 1.4913502002401555, "grad_norm": 0.58984375, "learning_rate": 2.1895103974523347e-05, "loss": 0.38601322174072267, "num_input_tokens_seen": 11986294720, "step": 42150, "train_runtime": 409845.928, "train_tokens_per_second": 29245.855 }, { "epoch": 1.4917040205038843, "grad_norm": 0.59765625, "learning_rate": 2.1893004993185944e-05, "loss": 0.3908984184265137, "num_input_tokens_seen": 11989119424, "step": 42160, "train_runtime": 409940.0123, "train_tokens_per_second": 29246.034 }, { "epoch": 1.492057840767613, "grad_norm": 0.60546875, "learning_rate": 2.189090661539144e-05, "loss": 0.39123926162719724, "num_input_tokens_seen": 11991940736, "step": 42170, "train_runtime": 410035.6492, "train_tokens_per_second": 29246.093 }, { "epoch": 1.4924116610313418, "grad_norm": 0.609375, "learning_rate": 2.188880884085063e-05, "loss": 0.38629870414733886, "num_input_tokens_seen": 11994823424, "step": 42180, "train_runtime": 410133.1666, "train_tokens_per_second": 29246.168 }, { "epoch": 1.4927654812950706, "grad_norm": 0.6171875, "learning_rate": 2.1886711669274547e-05, "loss": 0.3888279914855957, "num_input_tokens_seen": 11997691712, "step": 42190, "train_runtime": 410231.6169, "train_tokens_per_second": 29246.141 }, { "epoch": 1.4931193015587994, "grad_norm": 0.609375, "learning_rate": 2.188461510037438e-05, "loss": 0.3864429473876953, "num_input_tokens_seen": 12000527232, "step": 42200, "train_runtime": 410326.9727, "train_tokens_per_second": 29246.255 }, { "epoch": 1.4934731218225281, "grad_norm": 0.640625, "learning_rate": 2.1882519133861538e-05, "loss": 0.38834528923034667, "num_input_tokens_seen": 12003381312, "step": 42210, "train_runtime": 410424.9339, "train_tokens_per_second": 29246.228 }, { "epoch": 1.4938269420862569, "grad_norm": 0.57421875, "learning_rate": 2.1880423769447607e-05, "loss": 0.39205136299133303, "num_input_tokens_seen": 12006237440, "step": 42220, "train_runtime": 410522.1044, "train_tokens_per_second": 29246.263 }, { "epoch": 1.4941807623499859, "grad_norm": 0.59375, "learning_rate": 2.1878329006844368e-05, "loss": 0.38584532737731936, "num_input_tokens_seen": 12009064128, "step": 42230, "train_runtime": 410620.6729, "train_tokens_per_second": 29246.126 }, { "epoch": 1.4945345826137144, "grad_norm": 0.60546875, "learning_rate": 2.1876234845763806e-05, "loss": 0.3882946491241455, "num_input_tokens_seen": 12011854592, "step": 42240, "train_runtime": 410716.0073, "train_tokens_per_second": 29246.132 }, { "epoch": 1.4948884028774434, "grad_norm": 0.625, "learning_rate": 2.1874141285918086e-05, "loss": 0.385976505279541, "num_input_tokens_seen": 12014750016, "step": 42250, "train_runtime": 410818.3783, "train_tokens_per_second": 29245.892 }, { "epoch": 1.495242223141172, "grad_norm": 0.609375, "learning_rate": 2.1872048327019575e-05, "loss": 0.39275107383728025, "num_input_tokens_seen": 12017579008, "step": 42260, "train_runtime": 410913.728, "train_tokens_per_second": 29245.991 }, { "epoch": 1.495596043404901, "grad_norm": 0.59375, "learning_rate": 2.1869955968780834e-05, "loss": 0.3885845184326172, "num_input_tokens_seen": 12020409536, "step": 42270, "train_runtime": 411008.0546, "train_tokens_per_second": 29246.165 }, { "epoch": 1.4959498636686297, "grad_norm": 0.6171875, "learning_rate": 2.1867864210914605e-05, "loss": 0.3897651195526123, "num_input_tokens_seen": 12023295872, "step": 42280, "train_runtime": 411109.5461, "train_tokens_per_second": 29245.966 }, { "epoch": 1.4963036839323585, "grad_norm": 0.61328125, "learning_rate": 2.1865773053133827e-05, "loss": 0.3897970914840698, "num_input_tokens_seen": 12026124864, "step": 42290, "train_runtime": 411205.7304, "train_tokens_per_second": 29246.005 }, { "epoch": 1.4966575041960872, "grad_norm": 0.62890625, "learning_rate": 2.186368249515164e-05, "loss": 0.38759841918945315, "num_input_tokens_seen": 12028913472, "step": 42300, "train_runtime": 411299.913, "train_tokens_per_second": 29246.088 }, { "epoch": 1.497011324459816, "grad_norm": 0.625, "learning_rate": 2.1861592536681362e-05, "loss": 0.38748767375946047, "num_input_tokens_seen": 12031675968, "step": 42310, "train_runtime": 411394.025, "train_tokens_per_second": 29246.113 }, { "epoch": 1.4973651447235448, "grad_norm": 0.59375, "learning_rate": 2.1859503177436517e-05, "loss": 0.3915513038635254, "num_input_tokens_seen": 12034532864, "step": 42320, "train_runtime": 411493.8369, "train_tokens_per_second": 29245.961 }, { "epoch": 1.4977189649872735, "grad_norm": 0.6015625, "learning_rate": 2.1857414417130808e-05, "loss": 0.38543593883514404, "num_input_tokens_seen": 12037375104, "step": 42330, "train_runtime": 411591.5308, "train_tokens_per_second": 29245.925 }, { "epoch": 1.4980727852510023, "grad_norm": 0.63671875, "learning_rate": 2.1855326255478136e-05, "loss": 0.38600897789001465, "num_input_tokens_seen": 12040229696, "step": 42340, "train_runtime": 411690.2796, "train_tokens_per_second": 29245.844 }, { "epoch": 1.498426605514731, "grad_norm": 0.60546875, "learning_rate": 2.1853238692192597e-05, "loss": 0.3888068914413452, "num_input_tokens_seen": 12043131968, "step": 42350, "train_runtime": 411792.2459, "train_tokens_per_second": 29245.65 }, { "epoch": 1.4987804257784598, "grad_norm": 0.609375, "learning_rate": 2.185115172698846e-05, "loss": 0.39337098598480225, "num_input_tokens_seen": 12045978368, "step": 42360, "train_runtime": 411889.3799, "train_tokens_per_second": 29245.664 }, { "epoch": 1.4991342460421886, "grad_norm": 0.63671875, "learning_rate": 2.1849065359580216e-05, "loss": 0.38784613609313967, "num_input_tokens_seen": 12048829120, "step": 42370, "train_runtime": 411986.9061, "train_tokens_per_second": 29245.66 }, { "epoch": 1.4994880663059174, "grad_norm": 0.60546875, "learning_rate": 2.1846979589682517e-05, "loss": 0.38994128704071046, "num_input_tokens_seen": 12051688192, "step": 42380, "train_runtime": 412084.554, "train_tokens_per_second": 29245.668 }, { "epoch": 1.4998418865696461, "grad_norm": 0.60546875, "learning_rate": 2.184489441701022e-05, "loss": 0.38850257396697996, "num_input_tokens_seen": 12054501504, "step": 42390, "train_runtime": 412180.2209, "train_tokens_per_second": 29245.706 }, { "epoch": 1.500195706833375, "grad_norm": 0.609375, "learning_rate": 2.1842809841278376e-05, "loss": 0.3886709451675415, "num_input_tokens_seen": 12057332352, "step": 42400, "train_runtime": 412276.3762, "train_tokens_per_second": 29245.751 }, { "epoch": 1.5005495270971037, "grad_norm": 0.61328125, "learning_rate": 2.1840725862202214e-05, "loss": 0.388775110244751, "num_input_tokens_seen": 12060198464, "step": 42410, "train_runtime": 412375.602, "train_tokens_per_second": 29245.664 }, { "epoch": 1.5009033473608326, "grad_norm": 0.59765625, "learning_rate": 2.183864247949716e-05, "loss": 0.38613133430480956, "num_input_tokens_seen": 12063074496, "step": 42420, "train_runtime": 412477.185, "train_tokens_per_second": 29245.434 }, { "epoch": 1.5012571676245612, "grad_norm": 0.609375, "learning_rate": 2.183655969287883e-05, "loss": 0.3919047832489014, "num_input_tokens_seen": 12065890304, "step": 42430, "train_runtime": 412571.6475, "train_tokens_per_second": 29245.563 }, { "epoch": 1.5016109878882902, "grad_norm": 0.62109375, "learning_rate": 2.1834477502063034e-05, "loss": 0.3853446960449219, "num_input_tokens_seen": 12068698816, "step": 42440, "train_runtime": 412667.7823, "train_tokens_per_second": 29245.556 }, { "epoch": 1.5019648081520187, "grad_norm": 0.60546875, "learning_rate": 2.183239590676576e-05, "loss": 0.38905317783355714, "num_input_tokens_seen": 12071541632, "step": 42450, "train_runtime": 412766.2836, "train_tokens_per_second": 29245.464 }, { "epoch": 1.5023186284157477, "grad_norm": 0.6015625, "learning_rate": 2.1830314906703198e-05, "loss": 0.3881096839904785, "num_input_tokens_seen": 12074359232, "step": 42460, "train_runtime": 412860.7051, "train_tokens_per_second": 29245.6 }, { "epoch": 1.5026724486794765, "grad_norm": 0.58984375, "learning_rate": 2.1828234501591717e-05, "loss": 0.3910414218902588, "num_input_tokens_seen": 12077214400, "step": 42470, "train_runtime": 412959.1654, "train_tokens_per_second": 29245.541 }, { "epoch": 1.5030262689432052, "grad_norm": 0.61328125, "learning_rate": 2.182615469114789e-05, "loss": 0.39313597679138185, "num_input_tokens_seen": 12079984256, "step": 42480, "train_runtime": 413052.2198, "train_tokens_per_second": 29245.659 }, { "epoch": 1.503380089206934, "grad_norm": 0.59375, "learning_rate": 2.182407547508846e-05, "loss": 0.3910232067108154, "num_input_tokens_seen": 12082777152, "step": 42490, "train_runtime": 413145.249, "train_tokens_per_second": 29245.833 }, { "epoch": 1.5037339094706628, "grad_norm": 0.6015625, "learning_rate": 2.1821996853130363e-05, "loss": 0.39245460033416746, "num_input_tokens_seen": 12085594880, "step": 42500, "train_runtime": 413239.6262, "train_tokens_per_second": 29245.973 }, { "epoch": 1.5040877297343915, "grad_norm": 0.640625, "learning_rate": 2.1819918824990745e-05, "loss": 0.391314697265625, "num_input_tokens_seen": 12088394176, "step": 42510, "train_runtime": 413335.1861, "train_tokens_per_second": 29245.984 }, { "epoch": 1.5044415499981203, "grad_norm": 0.62890625, "learning_rate": 2.1817841390386913e-05, "loss": 0.3880293607711792, "num_input_tokens_seen": 12091286464, "step": 42520, "train_runtime": 413437.4819, "train_tokens_per_second": 29245.743 }, { "epoch": 1.504795370261849, "grad_norm": 0.578125, "learning_rate": 2.1815764549036372e-05, "loss": 0.38989307880401614, "num_input_tokens_seen": 12094099776, "step": 42530, "train_runtime": 413532.075, "train_tokens_per_second": 29245.857 }, { "epoch": 1.5051491905255778, "grad_norm": 0.59765625, "learning_rate": 2.1813688300656823e-05, "loss": 0.3885371446609497, "num_input_tokens_seen": 12096892544, "step": 42540, "train_runtime": 413625.6383, "train_tokens_per_second": 29245.993 }, { "epoch": 1.5055030107893068, "grad_norm": 0.59375, "learning_rate": 2.181161264496615e-05, "loss": 0.3847520351409912, "num_input_tokens_seen": 12099722304, "step": 42550, "train_runtime": 413724.8359, "train_tokens_per_second": 29245.821 }, { "epoch": 1.5058568310530354, "grad_norm": 0.61328125, "learning_rate": 2.1809537581682414e-05, "loss": 0.38471245765686035, "num_input_tokens_seen": 12102568576, "step": 42560, "train_runtime": 413825.3597, "train_tokens_per_second": 29245.594 }, { "epoch": 1.5062106513167643, "grad_norm": 0.609375, "learning_rate": 2.1807463110523877e-05, "loss": 0.39519548416137695, "num_input_tokens_seen": 12105425984, "step": 42570, "train_runtime": 413924.7316, "train_tokens_per_second": 29245.476 }, { "epoch": 1.506564471580493, "grad_norm": 0.6171875, "learning_rate": 2.1805389231208993e-05, "loss": 0.387813925743103, "num_input_tokens_seen": 12108240576, "step": 42580, "train_runtime": 414019.6556, "train_tokens_per_second": 29245.569 }, { "epoch": 1.5069182918442219, "grad_norm": 0.62109375, "learning_rate": 2.1803315943456386e-05, "loss": 0.3898014545440674, "num_input_tokens_seen": 12111070208, "step": 42590, "train_runtime": 414118.1279, "train_tokens_per_second": 29245.448 }, { "epoch": 1.5072721121079504, "grad_norm": 0.62890625, "learning_rate": 2.180124324698488e-05, "loss": 0.39206585884094236, "num_input_tokens_seen": 12113892736, "step": 42600, "train_runtime": 414213.2032, "train_tokens_per_second": 29245.549 }, { "epoch": 1.5076259323716794, "grad_norm": 0.59375, "learning_rate": 2.1799171141513476e-05, "loss": 0.38569135665893556, "num_input_tokens_seen": 12116740160, "step": 42610, "train_runtime": 414311.518, "train_tokens_per_second": 29245.482 }, { "epoch": 1.507979752635408, "grad_norm": 0.62890625, "learning_rate": 2.1797099626761385e-05, "loss": 0.388590669631958, "num_input_tokens_seen": 12119576064, "step": 42620, "train_runtime": 414408.8388, "train_tokens_per_second": 29245.457 }, { "epoch": 1.508333572899137, "grad_norm": 0.59765625, "learning_rate": 2.179502870244797e-05, "loss": 0.3887790679931641, "num_input_tokens_seen": 12122361472, "step": 42630, "train_runtime": 414504.0187, "train_tokens_per_second": 29245.462 }, { "epoch": 1.5086873931628657, "grad_norm": 0.6015625, "learning_rate": 2.1792958368292814e-05, "loss": 0.3878232479095459, "num_input_tokens_seen": 12125185728, "step": 42640, "train_runtime": 414598.1624, "train_tokens_per_second": 29245.633 }, { "epoch": 1.5090412134265945, "grad_norm": 0.59765625, "learning_rate": 2.1790888624015656e-05, "loss": 0.38990106582641604, "num_input_tokens_seen": 12128054336, "step": 42650, "train_runtime": 414693.8636, "train_tokens_per_second": 29245.801 }, { "epoch": 1.5093950336903232, "grad_norm": 0.61328125, "learning_rate": 2.1788819469336452e-05, "loss": 0.38659181594848635, "num_input_tokens_seen": 12130873984, "step": 42660, "train_runtime": 414788.646, "train_tokens_per_second": 29245.916 }, { "epoch": 1.509748853954052, "grad_norm": 0.59765625, "learning_rate": 2.1786750903975316e-05, "loss": 0.3870596647262573, "num_input_tokens_seen": 12133724032, "step": 42670, "train_runtime": 414886.7789, "train_tokens_per_second": 29245.868 }, { "epoch": 1.5101026742177808, "grad_norm": 0.60546875, "learning_rate": 2.178468292765257e-05, "loss": 0.3873318672180176, "num_input_tokens_seen": 12136596352, "step": 42680, "train_runtime": 414985.2269, "train_tokens_per_second": 29245.852 }, { "epoch": 1.5104564944815095, "grad_norm": 0.6015625, "learning_rate": 2.1782615540088703e-05, "loss": 0.3861170053482056, "num_input_tokens_seen": 12139420544, "step": 42690, "train_runtime": 415083.1337, "train_tokens_per_second": 29245.757 }, { "epoch": 1.5108103147452383, "grad_norm": 0.58203125, "learning_rate": 2.178054874100441e-05, "loss": 0.38941497802734376, "num_input_tokens_seen": 12142253632, "step": 42700, "train_runtime": 415180.3735, "train_tokens_per_second": 29245.731 }, { "epoch": 1.511164135008967, "grad_norm": 0.59375, "learning_rate": 2.177848253012055e-05, "loss": 0.3882740020751953, "num_input_tokens_seen": 12145089920, "step": 42710, "train_runtime": 415276.7605, "train_tokens_per_second": 29245.773 }, { "epoch": 1.511517955272696, "grad_norm": 0.6171875, "learning_rate": 2.177641690715819e-05, "loss": 0.3938926696777344, "num_input_tokens_seen": 12148039232, "step": 42720, "train_runtime": 415380.1582, "train_tokens_per_second": 29245.593 }, { "epoch": 1.5118717755364246, "grad_norm": 0.6015625, "learning_rate": 2.1774351871838557e-05, "loss": 0.3898476123809814, "num_input_tokens_seen": 12150827264, "step": 42730, "train_runtime": 415473.5174, "train_tokens_per_second": 29245.732 }, { "epoch": 1.5122255958001536, "grad_norm": 0.58984375, "learning_rate": 2.177228742388308e-05, "loss": 0.38460755348205566, "num_input_tokens_seen": 12153618240, "step": 42740, "train_runtime": 415568.7935, "train_tokens_per_second": 29245.743 }, { "epoch": 1.5125794160638821, "grad_norm": 0.59765625, "learning_rate": 2.1770223563013374e-05, "loss": 0.3908083915710449, "num_input_tokens_seen": 12156494272, "step": 42750, "train_runtime": 415667.4388, "train_tokens_per_second": 29245.722 }, { "epoch": 1.5129332363276111, "grad_norm": 0.6015625, "learning_rate": 2.176816028895123e-05, "loss": 0.39047675132751464, "num_input_tokens_seen": 12159317760, "step": 42760, "train_runtime": 415761.6049, "train_tokens_per_second": 29245.889 }, { "epoch": 1.5132870565913397, "grad_norm": 0.609375, "learning_rate": 2.1766097601418624e-05, "loss": 0.38875522613525393, "num_input_tokens_seen": 12162160128, "step": 42770, "train_runtime": 415857.3658, "train_tokens_per_second": 29245.989 }, { "epoch": 1.5136408768550687, "grad_norm": 0.6328125, "learning_rate": 2.176403550013773e-05, "loss": 0.38666815757751466, "num_input_tokens_seen": 12164983872, "step": 42780, "train_runtime": 415954.08, "train_tokens_per_second": 29245.978 }, { "epoch": 1.5139946971187974, "grad_norm": 0.609375, "learning_rate": 2.176197398483088e-05, "loss": 0.3883677005767822, "num_input_tokens_seen": 12167836288, "step": 42790, "train_runtime": 416050.914, "train_tokens_per_second": 29246.027 }, { "epoch": 1.5143485173825262, "grad_norm": 0.60546875, "learning_rate": 2.1759913055220623e-05, "loss": 0.3917588233947754, "num_input_tokens_seen": 12170711296, "step": 42800, "train_runtime": 416147.5851, "train_tokens_per_second": 29246.142 }, { "epoch": 1.514702337646255, "grad_norm": 0.609375, "learning_rate": 2.1757852711029664e-05, "loss": 0.3863863468170166, "num_input_tokens_seen": 12173560000, "step": 42810, "train_runtime": 416245.8584, "train_tokens_per_second": 29246.081 }, { "epoch": 1.5150561579099837, "grad_norm": 0.62109375, "learning_rate": 2.1755792951980896e-05, "loss": 0.3919061660766602, "num_input_tokens_seen": 12176367744, "step": 42820, "train_runtime": 416342.7478, "train_tokens_per_second": 29246.019 }, { "epoch": 1.5154099781737125, "grad_norm": 0.59765625, "learning_rate": 2.175373377779742e-05, "loss": 0.3897319078445435, "num_input_tokens_seen": 12179276928, "step": 42830, "train_runtime": 416442.7031, "train_tokens_per_second": 29245.985 }, { "epoch": 1.5157637984374412, "grad_norm": 0.60546875, "learning_rate": 2.1751675188202493e-05, "loss": 0.3912724494934082, "num_input_tokens_seen": 12182130112, "step": 42840, "train_runtime": 416538.2024, "train_tokens_per_second": 29246.129 }, { "epoch": 1.51611761870117, "grad_norm": 0.6171875, "learning_rate": 2.174961718291956e-05, "loss": 0.38510124683380126, "num_input_tokens_seen": 12184963072, "step": 42850, "train_runtime": 416633.4323, "train_tokens_per_second": 29246.244 }, { "epoch": 1.5164714389648988, "grad_norm": 0.58984375, "learning_rate": 2.174755976167226e-05, "loss": 0.3861616373062134, "num_input_tokens_seen": 12187821696, "step": 42860, "train_runtime": 416730.2961, "train_tokens_per_second": 29246.306 }, { "epoch": 1.5168252592286275, "grad_norm": 0.6171875, "learning_rate": 2.1745502924184407e-05, "loss": 0.38733668327331544, "num_input_tokens_seen": 12190711616, "step": 42870, "train_runtime": 416826.4984, "train_tokens_per_second": 29246.489 }, { "epoch": 1.5171790794923563, "grad_norm": 0.609375, "learning_rate": 2.1743446670180005e-05, "loss": 0.3877874374389648, "num_input_tokens_seen": 12193600256, "step": 42880, "train_runtime": 416922.3548, "train_tokens_per_second": 29246.693 }, { "epoch": 1.5175328997560853, "grad_norm": 0.609375, "learning_rate": 2.1741390999383225e-05, "loss": 0.3919093370437622, "num_input_tokens_seen": 12196479168, "step": 42890, "train_runtime": 417020.8529, "train_tokens_per_second": 29246.689 }, { "epoch": 1.5178867200198138, "grad_norm": 0.60546875, "learning_rate": 2.1739335911518432e-05, "loss": 0.38647260665893557, "num_input_tokens_seen": 12199325632, "step": 42900, "train_runtime": 417115.739, "train_tokens_per_second": 29246.86 }, { "epoch": 1.5182405402835428, "grad_norm": 0.59765625, "learning_rate": 2.1737281406310186e-05, "loss": 0.38724236488342284, "num_input_tokens_seen": 12202148992, "step": 42910, "train_runtime": 417213.8127, "train_tokens_per_second": 29246.752 }, { "epoch": 1.5185943605472714, "grad_norm": 0.6015625, "learning_rate": 2.17352274834832e-05, "loss": 0.39097347259521487, "num_input_tokens_seen": 12204924544, "step": 42920, "train_runtime": 417307.722, "train_tokens_per_second": 29246.822 }, { "epoch": 1.5189481808110004, "grad_norm": 0.61328125, "learning_rate": 2.1733174142762388e-05, "loss": 0.38936848640441896, "num_input_tokens_seen": 12207786432, "step": 42930, "train_runtime": 417405.3406, "train_tokens_per_second": 29246.838 }, { "epoch": 1.519302001074729, "grad_norm": 0.61328125, "learning_rate": 2.1731121383872852e-05, "loss": 0.38815531730651853, "num_input_tokens_seen": 12210541632, "step": 42940, "train_runtime": 417496.5612, "train_tokens_per_second": 29247.047 }, { "epoch": 1.519655821338458, "grad_norm": 0.5859375, "learning_rate": 2.1729069206539847e-05, "loss": 0.3922411441802979, "num_input_tokens_seen": 12213365440, "step": 42950, "train_runtime": 417593.9831, "train_tokens_per_second": 29246.986 }, { "epoch": 1.5200096416021867, "grad_norm": 0.625, "learning_rate": 2.172701761048885e-05, "loss": 0.3850921630859375, "num_input_tokens_seen": 12216205056, "step": 42960, "train_runtime": 417692.3333, "train_tokens_per_second": 29246.898 }, { "epoch": 1.5203634618659154, "grad_norm": 0.59765625, "learning_rate": 2.1724966595445483e-05, "loss": 0.38896331787109373, "num_input_tokens_seen": 12219023168, "step": 42970, "train_runtime": 417787.0532, "train_tokens_per_second": 29247.013 }, { "epoch": 1.5207172821296442, "grad_norm": 0.59765625, "learning_rate": 2.172291616113557e-05, "loss": 0.39084429740905763, "num_input_tokens_seen": 12221892480, "step": 42980, "train_runtime": 417887.3888, "train_tokens_per_second": 29246.856 }, { "epoch": 1.521071102393373, "grad_norm": 0.59765625, "learning_rate": 2.172086630728511e-05, "loss": 0.3847005367279053, "num_input_tokens_seen": 12224784640, "step": 42990, "train_runtime": 417987.2754, "train_tokens_per_second": 29246.787 }, { "epoch": 1.5214249226571017, "grad_norm": 0.58984375, "learning_rate": 2.171881703362028e-05, "loss": 0.3871195316314697, "num_input_tokens_seen": 12227680960, "step": 43000, "train_runtime": 418087.3327, "train_tokens_per_second": 29246.715 }, { "epoch": 1.5217787429208305, "grad_norm": 0.60546875, "learning_rate": 2.1716768339867445e-05, "loss": 0.3897268533706665, "num_input_tokens_seen": 12230492544, "step": 43010, "train_runtime": 418181.6483, "train_tokens_per_second": 29246.842 }, { "epoch": 1.5221325631845593, "grad_norm": 0.6015625, "learning_rate": 2.1714720225753148e-05, "loss": 0.3881224155426025, "num_input_tokens_seen": 12233338944, "step": 43020, "train_runtime": 418276.2105, "train_tokens_per_second": 29247.035 }, { "epoch": 1.522486383448288, "grad_norm": 0.5859375, "learning_rate": 2.1712672691004098e-05, "loss": 0.38787715435028075, "num_input_tokens_seen": 12236178880, "step": 43030, "train_runtime": 418375.055, "train_tokens_per_second": 29246.913 }, { "epoch": 1.522840203712017, "grad_norm": 0.5859375, "learning_rate": 2.171062573534722e-05, "loss": 0.39142684936523436, "num_input_tokens_seen": 12238977280, "step": 43040, "train_runtime": 418470.0868, "train_tokens_per_second": 29246.959 }, { "epoch": 1.5231940239757455, "grad_norm": 0.60546875, "learning_rate": 2.1708579358509578e-05, "loss": 0.3917617082595825, "num_input_tokens_seen": 12241750400, "step": 43050, "train_runtime": 418564.536, "train_tokens_per_second": 29246.984 }, { "epoch": 1.5235478442394745, "grad_norm": 0.59375, "learning_rate": 2.1706533560218447e-05, "loss": 0.3920008182525635, "num_input_tokens_seen": 12244605504, "step": 43060, "train_runtime": 418661.8291, "train_tokens_per_second": 29247.007 }, { "epoch": 1.523901664503203, "grad_norm": 0.625, "learning_rate": 2.1704488340201262e-05, "loss": 0.39245123863220216, "num_input_tokens_seen": 12247415680, "step": 43070, "train_runtime": 418758.0275, "train_tokens_per_second": 29246.999 }, { "epoch": 1.524255484766932, "grad_norm": 0.5859375, "learning_rate": 2.170244369818564e-05, "loss": 0.38855547904968263, "num_input_tokens_seen": 12250276096, "step": 43080, "train_runtime": 418853.7655, "train_tokens_per_second": 29247.143 }, { "epoch": 1.5246093050306606, "grad_norm": 0.63671875, "learning_rate": 2.17003996338994e-05, "loss": 0.384521484375, "num_input_tokens_seen": 12253115968, "step": 43090, "train_runtime": 418951.1559, "train_tokens_per_second": 29247.123 }, { "epoch": 1.5249631252943896, "grad_norm": 0.578125, "learning_rate": 2.1698356147070515e-05, "loss": 0.38777961730957033, "num_input_tokens_seen": 12255938880, "step": 43100, "train_runtime": 419044.361, "train_tokens_per_second": 29247.354 }, { "epoch": 1.5253169455581181, "grad_norm": 0.6015625, "learning_rate": 2.169631323742714e-05, "loss": 0.3913033246994019, "num_input_tokens_seen": 12258805568, "step": 43110, "train_runtime": 419140.5134, "train_tokens_per_second": 29247.484 }, { "epoch": 1.5256707658218471, "grad_norm": 0.6171875, "learning_rate": 2.1694270904697623e-05, "loss": 0.38835670948028567, "num_input_tokens_seen": 12261658944, "step": 43120, "train_runtime": 419236.7749, "train_tokens_per_second": 29247.575 }, { "epoch": 1.526024586085576, "grad_norm": 0.63671875, "learning_rate": 2.169222914861048e-05, "loss": 0.39002649784088134, "num_input_tokens_seen": 12264533888, "step": 43130, "train_runtime": 419334.8963, "train_tokens_per_second": 29247.587 }, { "epoch": 1.5263784063493047, "grad_norm": 0.609375, "learning_rate": 2.1690187968894404e-05, "loss": 0.3865140438079834, "num_input_tokens_seen": 12267309504, "step": 43140, "train_runtime": 419427.1286, "train_tokens_per_second": 29247.773 }, { "epoch": 1.5267322266130334, "grad_norm": 0.6015625, "learning_rate": 2.168814736527828e-05, "loss": 0.3910662651062012, "num_input_tokens_seen": 12270153472, "step": 43150, "train_runtime": 419525.1251, "train_tokens_per_second": 29247.72 }, { "epoch": 1.5270860468767622, "grad_norm": 0.59375, "learning_rate": 2.1686107337491155e-05, "loss": 0.39094431400299073, "num_input_tokens_seen": 12272988096, "step": 43160, "train_runtime": 419621.0618, "train_tokens_per_second": 29247.789 }, { "epoch": 1.527439867140491, "grad_norm": 0.6015625, "learning_rate": 2.1684067885262266e-05, "loss": 0.39046144485473633, "num_input_tokens_seen": 12275819520, "step": 43170, "train_runtime": 419717.1906, "train_tokens_per_second": 29247.836 }, { "epoch": 1.5277936874042197, "grad_norm": 0.60546875, "learning_rate": 2.1682029008321024e-05, "loss": 0.39098682403564455, "num_input_tokens_seen": 12278695552, "step": 43180, "train_runtime": 419816.8514, "train_tokens_per_second": 29247.743 }, { "epoch": 1.5281475076679485, "grad_norm": 0.60546875, "learning_rate": 2.167999070639702e-05, "loss": 0.38949458599090575, "num_input_tokens_seen": 12281526208, "step": 43190, "train_runtime": 419915.4518, "train_tokens_per_second": 29247.617 }, { "epoch": 1.5285013279316773, "grad_norm": 0.62890625, "learning_rate": 2.1677952979220015e-05, "loss": 0.3916356563568115, "num_input_tokens_seen": 12284343616, "step": 43200, "train_runtime": 420011.7067, "train_tokens_per_second": 29247.622 }, { "epoch": 1.5288551481954062, "grad_norm": 0.609375, "learning_rate": 2.167591582651996e-05, "loss": 0.39000668525695803, "num_input_tokens_seen": 12287138176, "step": 43210, "train_runtime": 420107.5473, "train_tokens_per_second": 29247.602 }, { "epoch": 1.5292089684591348, "grad_norm": 0.609375, "learning_rate": 2.1673879248026977e-05, "loss": 0.3884908437728882, "num_input_tokens_seen": 12289980992, "step": 43220, "train_runtime": 420204.4627, "train_tokens_per_second": 29247.621 }, { "epoch": 1.5295627887228638, "grad_norm": 0.6015625, "learning_rate": 2.1671843243471366e-05, "loss": 0.39139065742492674, "num_input_tokens_seen": 12292877440, "step": 43230, "train_runtime": 420303.3254, "train_tokens_per_second": 29247.633 }, { "epoch": 1.5299166089865923, "grad_norm": 0.609375, "learning_rate": 2.1669807812583602e-05, "loss": 0.3898471355438232, "num_input_tokens_seen": 12295747712, "step": 43240, "train_runtime": 420402.7648, "train_tokens_per_second": 29247.542 }, { "epoch": 1.5302704292503213, "grad_norm": 0.62890625, "learning_rate": 2.1667772955094347e-05, "loss": 0.387610125541687, "num_input_tokens_seen": 12298618496, "step": 43250, "train_runtime": 420499.9824, "train_tokens_per_second": 29247.608 }, { "epoch": 1.5306242495140499, "grad_norm": 0.58984375, "learning_rate": 2.1665738670734422e-05, "loss": 0.3915060043334961, "num_input_tokens_seen": 12301503552, "step": 43260, "train_runtime": 420601.8545, "train_tokens_per_second": 29247.383 }, { "epoch": 1.5309780697777788, "grad_norm": 0.57421875, "learning_rate": 2.166370495923485e-05, "loss": 0.396150803565979, "num_input_tokens_seen": 12304304192, "step": 43270, "train_runtime": 420695.1807, "train_tokens_per_second": 29247.552 }, { "epoch": 1.5313318900415074, "grad_norm": 0.57421875, "learning_rate": 2.16616718203268e-05, "loss": 0.39034366607666016, "num_input_tokens_seen": 12307178752, "step": 43280, "train_runtime": 420792.5669, "train_tokens_per_second": 29247.614 }, { "epoch": 1.5316857103052364, "grad_norm": 0.62890625, "learning_rate": 2.1659639253741637e-05, "loss": 0.3915281295776367, "num_input_tokens_seen": 12310115008, "step": 43290, "train_runtime": 420897.1642, "train_tokens_per_second": 29247.322 }, { "epoch": 1.5320395305689651, "grad_norm": 0.59375, "learning_rate": 2.1657607259210906e-05, "loss": 0.3863854885101318, "num_input_tokens_seen": 12312915904, "step": 43300, "train_runtime": 420990.8421, "train_tokens_per_second": 29247.467 }, { "epoch": 1.532393350832694, "grad_norm": 0.59375, "learning_rate": 2.1655575836466328e-05, "loss": 0.38784518241882326, "num_input_tokens_seen": 12315801152, "step": 43310, "train_runtime": 421087.3088, "train_tokens_per_second": 29247.619 }, { "epoch": 1.5327471710964227, "grad_norm": 0.62890625, "learning_rate": 2.1653544985239775e-05, "loss": 0.3899970769882202, "num_input_tokens_seen": 12318612608, "step": 43320, "train_runtime": 421182.8268, "train_tokens_per_second": 29247.661 }, { "epoch": 1.5331009913601514, "grad_norm": 0.60546875, "learning_rate": 2.1651514705263324e-05, "loss": 0.38704278469085696, "num_input_tokens_seen": 12321439360, "step": 43330, "train_runtime": 421279.7469, "train_tokens_per_second": 29247.642 }, { "epoch": 1.5334548116238802, "grad_norm": 0.59375, "learning_rate": 2.164948499626922e-05, "loss": 0.3893830060958862, "num_input_tokens_seen": 12324267840, "step": 43340, "train_runtime": 421375.5103, "train_tokens_per_second": 29247.708 }, { "epoch": 1.533808631887609, "grad_norm": 0.609375, "learning_rate": 2.1647455857989867e-05, "loss": 0.3891900539398193, "num_input_tokens_seen": 12327083776, "step": 43350, "train_runtime": 421473.195, "train_tokens_per_second": 29247.61 }, { "epoch": 1.5341624521513377, "grad_norm": 0.62890625, "learning_rate": 2.164542729015788e-05, "loss": 0.3932191848754883, "num_input_tokens_seen": 12329918656, "step": 43360, "train_runtime": 421568.3761, "train_tokens_per_second": 29247.731 }, { "epoch": 1.5345162724150665, "grad_norm": 0.60546875, "learning_rate": 2.1643399292506014e-05, "loss": 0.3885686159133911, "num_input_tokens_seen": 12332732800, "step": 43370, "train_runtime": 421662.9073, "train_tokens_per_second": 29247.848 }, { "epoch": 1.5348700926787955, "grad_norm": 0.60546875, "learning_rate": 2.164137186476722e-05, "loss": 0.39277896881103513, "num_input_tokens_seen": 12335606464, "step": 43380, "train_runtime": 421759.9218, "train_tokens_per_second": 29247.934 }, { "epoch": 1.535223912942524, "grad_norm": 0.63671875, "learning_rate": 2.1639345006674607e-05, "loss": 0.38790106773376465, "num_input_tokens_seen": 12338514496, "step": 43390, "train_runtime": 421859.7552, "train_tokens_per_second": 29247.906 }, { "epoch": 1.535577733206253, "grad_norm": 0.6015625, "learning_rate": 2.1637318717961477e-05, "loss": 0.3909615993499756, "num_input_tokens_seen": 12341371840, "step": 43400, "train_runtime": 421957.0989, "train_tokens_per_second": 29247.93 }, { "epoch": 1.5359315534699816, "grad_norm": 0.6015625, "learning_rate": 2.16352929983613e-05, "loss": 0.3921290397644043, "num_input_tokens_seen": 12344204800, "step": 43410, "train_runtime": 422052.037, "train_tokens_per_second": 29248.064 }, { "epoch": 1.5362853737337105, "grad_norm": 0.59375, "learning_rate": 2.1633267847607718e-05, "loss": 0.3894049882888794, "num_input_tokens_seen": 12347099648, "step": 43420, "train_runtime": 422154.1794, "train_tokens_per_second": 29247.844 }, { "epoch": 1.536639193997439, "grad_norm": 0.5859375, "learning_rate": 2.1631243265434543e-05, "loss": 0.39225380420684813, "num_input_tokens_seen": 12349994944, "step": 43430, "train_runtime": 422251.2379, "train_tokens_per_second": 29247.978 }, { "epoch": 1.536993014261168, "grad_norm": 0.61328125, "learning_rate": 2.1629219251575783e-05, "loss": 0.3890273094177246, "num_input_tokens_seen": 12352848384, "step": 43440, "train_runtime": 422347.2348, "train_tokens_per_second": 29248.086 }, { "epoch": 1.5373468345248966, "grad_norm": 0.59765625, "learning_rate": 2.1627195805765592e-05, "loss": 0.3877848148345947, "num_input_tokens_seen": 12355717632, "step": 43450, "train_runtime": 422446.7528, "train_tokens_per_second": 29247.988 }, { "epoch": 1.5377006547886256, "grad_norm": 0.609375, "learning_rate": 2.162517292773831e-05, "loss": 0.3912092685699463, "num_input_tokens_seen": 12358574016, "step": 43460, "train_runtime": 422543.7612, "train_tokens_per_second": 29248.033 }, { "epoch": 1.5380544750523544, "grad_norm": 0.58984375, "learning_rate": 2.1623150617228456e-05, "loss": 0.384053897857666, "num_input_tokens_seen": 12361382976, "step": 43470, "train_runtime": 422639.1415, "train_tokens_per_second": 29248.079 }, { "epoch": 1.5384082953160831, "grad_norm": 0.63671875, "learning_rate": 2.1621128873970715e-05, "loss": 0.3927616119384766, "num_input_tokens_seen": 12364179456, "step": 43480, "train_runtime": 422733.6381, "train_tokens_per_second": 29248.156 }, { "epoch": 1.538762115579812, "grad_norm": 0.57421875, "learning_rate": 2.1619107697699955e-05, "loss": 0.382613205909729, "num_input_tokens_seen": 12367064192, "step": 43490, "train_runtime": 422831.9757, "train_tokens_per_second": 29248.176 }, { "epoch": 1.5391159358435407, "grad_norm": 0.59765625, "learning_rate": 2.1617087088151208e-05, "loss": 0.38992834091186523, "num_input_tokens_seen": 12369846336, "step": 43500, "train_runtime": 422923.1623, "train_tokens_per_second": 29248.449 }, { "epoch": 1.5394697561072694, "grad_norm": 0.59765625, "learning_rate": 2.1615067045059685e-05, "loss": 0.3945052146911621, "num_input_tokens_seen": 12372748672, "step": 43510, "train_runtime": 423026.0475, "train_tokens_per_second": 29248.196 }, { "epoch": 1.5398235763709982, "grad_norm": 0.59375, "learning_rate": 2.161304756816076e-05, "loss": 0.38994674682617186, "num_input_tokens_seen": 12375564032, "step": 43520, "train_runtime": 423120.2176, "train_tokens_per_second": 29248.34 }, { "epoch": 1.540177396634727, "grad_norm": 0.58984375, "learning_rate": 2.1611028657189997e-05, "loss": 0.3891166687011719, "num_input_tokens_seen": 12378426496, "step": 43530, "train_runtime": 423217.9715, "train_tokens_per_second": 29248.348 }, { "epoch": 1.5405312168984557, "grad_norm": 0.6484375, "learning_rate": 2.160901031188312e-05, "loss": 0.3958103179931641, "num_input_tokens_seen": 12381221568, "step": 43540, "train_runtime": 423311.8014, "train_tokens_per_second": 29248.468 }, { "epoch": 1.5408850371621847, "grad_norm": 0.62890625, "learning_rate": 2.1606992531976027e-05, "loss": 0.38954644203186034, "num_input_tokens_seen": 12384109184, "step": 43550, "train_runtime": 423411.4636, "train_tokens_per_second": 29248.403 }, { "epoch": 1.5412388574259133, "grad_norm": 0.6171875, "learning_rate": 2.1604975317204805e-05, "loss": 0.38824265003204345, "num_input_tokens_seen": 12386943936, "step": 43560, "train_runtime": 423507.6904, "train_tokens_per_second": 29248.451 }, { "epoch": 1.5415926776896423, "grad_norm": 0.6328125, "learning_rate": 2.160295866730568e-05, "loss": 0.3835118293762207, "num_input_tokens_seen": 12389767488, "step": 43570, "train_runtime": 423604.7275, "train_tokens_per_second": 29248.416 }, { "epoch": 1.5419464979533708, "grad_norm": 0.609375, "learning_rate": 2.160094258201508e-05, "loss": 0.39267544746398925, "num_input_tokens_seen": 12392641280, "step": 43580, "train_runtime": 423704.1664, "train_tokens_per_second": 29248.335 }, { "epoch": 1.5423003182170998, "grad_norm": 0.61328125, "learning_rate": 2.1598927061069596e-05, "loss": 0.3896996736526489, "num_input_tokens_seen": 12395480384, "step": 43590, "train_runtime": 423800.3095, "train_tokens_per_second": 29248.399 }, { "epoch": 1.5426541384808283, "grad_norm": 0.61328125, "learning_rate": 2.159691210420599e-05, "loss": 0.3902219533920288, "num_input_tokens_seen": 12398313600, "step": 43600, "train_runtime": 423897.716, "train_tokens_per_second": 29248.361 }, { "epoch": 1.5430079587445573, "grad_norm": 0.609375, "learning_rate": 2.1594897711161196e-05, "loss": 0.386974573135376, "num_input_tokens_seen": 12401137984, "step": 43610, "train_runtime": 423995.171, "train_tokens_per_second": 29248.3 }, { "epoch": 1.543361779008286, "grad_norm": 0.6015625, "learning_rate": 2.1592883881672317e-05, "loss": 0.38967456817626955, "num_input_tokens_seen": 12403944384, "step": 43620, "train_runtime": 424090.8996, "train_tokens_per_second": 29248.315 }, { "epoch": 1.5437155992720148, "grad_norm": 0.62109375, "learning_rate": 2.1590870615476628e-05, "loss": 0.388608455657959, "num_input_tokens_seen": 12406708288, "step": 43630, "train_runtime": 424182.7507, "train_tokens_per_second": 29248.498 }, { "epoch": 1.5440694195357436, "grad_norm": 0.578125, "learning_rate": 2.158885791231158e-05, "loss": 0.38902058601379397, "num_input_tokens_seen": 12409582400, "step": 43640, "train_runtime": 424283.7626, "train_tokens_per_second": 29248.309 }, { "epoch": 1.5444232397994724, "grad_norm": 0.578125, "learning_rate": 2.15868457719148e-05, "loss": 0.38901457786560056, "num_input_tokens_seen": 12412413120, "step": 43650, "train_runtime": 424380.7537, "train_tokens_per_second": 29248.294 }, { "epoch": 1.5447770600632011, "grad_norm": 0.61328125, "learning_rate": 2.158483419402407e-05, "loss": 0.3894495964050293, "num_input_tokens_seen": 12415259136, "step": 43660, "train_runtime": 424476.3555, "train_tokens_per_second": 29248.412 }, { "epoch": 1.54513088032693, "grad_norm": 0.6171875, "learning_rate": 2.158282317837736e-05, "loss": 0.3907548189163208, "num_input_tokens_seen": 12418113728, "step": 43670, "train_runtime": 424575.742, "train_tokens_per_second": 29248.288 }, { "epoch": 1.5454847005906587, "grad_norm": 0.60546875, "learning_rate": 2.1580812724712792e-05, "loss": 0.385688853263855, "num_input_tokens_seen": 12420983232, "step": 43680, "train_runtime": 424673.6897, "train_tokens_per_second": 29248.299 }, { "epoch": 1.5458385208543874, "grad_norm": 0.60546875, "learning_rate": 2.157880283276868e-05, "loss": 0.3868332624435425, "num_input_tokens_seen": 12423910528, "step": 43690, "train_runtime": 424778.5156, "train_tokens_per_second": 29247.973 }, { "epoch": 1.5461923411181162, "grad_norm": 0.59765625, "learning_rate": 2.1576793502283494e-05, "loss": 0.38932070732116697, "num_input_tokens_seen": 12426757504, "step": 43700, "train_runtime": 424877.2188, "train_tokens_per_second": 29247.879 }, { "epoch": 1.546546161381845, "grad_norm": 0.58984375, "learning_rate": 2.1574784732995884e-05, "loss": 0.3905416250228882, "num_input_tokens_seen": 12429555392, "step": 43710, "train_runtime": 424970.9095, "train_tokens_per_second": 29248.015 }, { "epoch": 1.546899981645574, "grad_norm": 0.59765625, "learning_rate": 2.1572776524644658e-05, "loss": 0.38866915702819826, "num_input_tokens_seen": 12432411840, "step": 43720, "train_runtime": 425071.9054, "train_tokens_per_second": 29247.785 }, { "epoch": 1.5472538019093025, "grad_norm": 0.609375, "learning_rate": 2.1570768876968802e-05, "loss": 0.38974111080169677, "num_input_tokens_seen": 12435229312, "step": 43730, "train_runtime": 425166.919, "train_tokens_per_second": 29247.876 }, { "epoch": 1.5476076221730315, "grad_norm": 0.59765625, "learning_rate": 2.1568761789707474e-05, "loss": 0.3852193355560303, "num_input_tokens_seen": 12438057088, "step": 43740, "train_runtime": 425262.7791, "train_tokens_per_second": 29247.933 }, { "epoch": 1.54796144243676, "grad_norm": 0.609375, "learning_rate": 2.15667552626e-05, "loss": 0.3881957530975342, "num_input_tokens_seen": 12440882112, "step": 43750, "train_runtime": 425359.9747, "train_tokens_per_second": 29247.891 }, { "epoch": 1.548315262700489, "grad_norm": 0.58203125, "learning_rate": 2.1564749295385872e-05, "loss": 0.390362286567688, "num_input_tokens_seen": 12443744384, "step": 43760, "train_runtime": 425458.2629, "train_tokens_per_second": 29247.862 }, { "epoch": 1.5486690829642176, "grad_norm": 0.625, "learning_rate": 2.1562743887804757e-05, "loss": 0.3880608081817627, "num_input_tokens_seen": 12446624256, "step": 43770, "train_runtime": 425558.5004, "train_tokens_per_second": 29247.74 }, { "epoch": 1.5490229032279466, "grad_norm": 0.6015625, "learning_rate": 2.1560739039596485e-05, "loss": 0.3888096332550049, "num_input_tokens_seen": 12449464896, "step": 43780, "train_runtime": 425656.4557, "train_tokens_per_second": 29247.683 }, { "epoch": 1.5493767234916753, "grad_norm": 0.61328125, "learning_rate": 2.1558734750501068e-05, "loss": 0.3873999834060669, "num_input_tokens_seen": 12452267776, "step": 43790, "train_runtime": 425751.7086, "train_tokens_per_second": 29247.722 }, { "epoch": 1.549730543755404, "grad_norm": 0.59765625, "learning_rate": 2.1556731020258664e-05, "loss": 0.39227685928344724, "num_input_tokens_seen": 12455164288, "step": 43800, "train_runtime": 425851.5039, "train_tokens_per_second": 29247.67 }, { "epoch": 1.5500843640191329, "grad_norm": 0.609375, "learning_rate": 2.1554727848609627e-05, "loss": 0.3890377998352051, "num_input_tokens_seen": 12458012544, "step": 43810, "train_runtime": 425947.3468, "train_tokens_per_second": 29247.776 }, { "epoch": 1.5504381842828616, "grad_norm": 0.61328125, "learning_rate": 2.155272523529446e-05, "loss": 0.3918537378311157, "num_input_tokens_seen": 12460797376, "step": 43820, "train_runtime": 426043.9057, "train_tokens_per_second": 29247.684 }, { "epoch": 1.5507920045465904, "grad_norm": 0.62890625, "learning_rate": 2.1550723180053844e-05, "loss": 0.3858006954193115, "num_input_tokens_seen": 12463622784, "step": 43830, "train_runtime": 426141.5019, "train_tokens_per_second": 29247.615 }, { "epoch": 1.5511458248103192, "grad_norm": 0.609375, "learning_rate": 2.154872168262863e-05, "loss": 0.3911353588104248, "num_input_tokens_seen": 12466459840, "step": 43840, "train_runtime": 426238.7432, "train_tokens_per_second": 29247.599 }, { "epoch": 1.551499645074048, "grad_norm": 0.6015625, "learning_rate": 2.1546720742759827e-05, "loss": 0.3917374610900879, "num_input_tokens_seen": 12469283840, "step": 43850, "train_runtime": 426337.9126, "train_tokens_per_second": 29247.42 }, { "epoch": 1.5518534653377767, "grad_norm": 0.61328125, "learning_rate": 2.1544720360188627e-05, "loss": 0.3883843421936035, "num_input_tokens_seen": 12472106944, "step": 43860, "train_runtime": 426434.3304, "train_tokens_per_second": 29247.427 }, { "epoch": 1.5522072856015057, "grad_norm": 0.6015625, "learning_rate": 2.1542720534656376e-05, "loss": 0.39139976501464846, "num_input_tokens_seen": 12474971072, "step": 43870, "train_runtime": 426534.5777, "train_tokens_per_second": 29247.268 }, { "epoch": 1.5525611058652342, "grad_norm": 0.6015625, "learning_rate": 2.1540721265904594e-05, "loss": 0.39008517265319825, "num_input_tokens_seen": 12477812096, "step": 43880, "train_runtime": 426630.7019, "train_tokens_per_second": 29247.337 }, { "epoch": 1.5529149261289632, "grad_norm": 0.61328125, "learning_rate": 2.153872255367498e-05, "loss": 0.3899892807006836, "num_input_tokens_seen": 12480686400, "step": 43890, "train_runtime": 426729.1607, "train_tokens_per_second": 29247.325 }, { "epoch": 1.5532687463926917, "grad_norm": 0.61328125, "learning_rate": 2.1536724397709374e-05, "loss": 0.3917407512664795, "num_input_tokens_seen": 12483482560, "step": 43900, "train_runtime": 426823.1444, "train_tokens_per_second": 29247.436 }, { "epoch": 1.5536225666564207, "grad_norm": 0.59765625, "learning_rate": 2.1534726797749813e-05, "loss": 0.39223179817199705, "num_input_tokens_seen": 12486327744, "step": 43910, "train_runtime": 426918.045, "train_tokens_per_second": 29247.599 }, { "epoch": 1.5539763869201493, "grad_norm": 0.60546875, "learning_rate": 2.153272975353848e-05, "loss": 0.3840668201446533, "num_input_tokens_seen": 12489117760, "step": 43920, "train_runtime": 427013.3095, "train_tokens_per_second": 29247.608 }, { "epoch": 1.5543302071838783, "grad_norm": 0.6171875, "learning_rate": 2.1530733264817737e-05, "loss": 0.3913280010223389, "num_input_tokens_seen": 12491962432, "step": 43930, "train_runtime": 427110.43, "train_tokens_per_second": 29247.617 }, { "epoch": 1.5546840274476068, "grad_norm": 0.58203125, "learning_rate": 2.152873733133011e-05, "loss": 0.3897716522216797, "num_input_tokens_seen": 12494818688, "step": 43940, "train_runtime": 427209.6269, "train_tokens_per_second": 29247.512 }, { "epoch": 1.5550378477113358, "grad_norm": 0.6015625, "learning_rate": 2.1526741952818296e-05, "loss": 0.39046201705932615, "num_input_tokens_seen": 12497623616, "step": 43950, "train_runtime": 427305.5774, "train_tokens_per_second": 29247.509 }, { "epoch": 1.5553916679750646, "grad_norm": 0.609375, "learning_rate": 2.152474712902514e-05, "loss": 0.38759191036224366, "num_input_tokens_seen": 12500495488, "step": 43960, "train_runtime": 427403.6832, "train_tokens_per_second": 29247.515 }, { "epoch": 1.5557454882387933, "grad_norm": 0.62109375, "learning_rate": 2.1522752859693686e-05, "loss": 0.39222135543823244, "num_input_tokens_seen": 12503396544, "step": 43970, "train_runtime": 427501.8889, "train_tokens_per_second": 29247.582 }, { "epoch": 1.556099308502522, "grad_norm": 0.578125, "learning_rate": 2.152075914456711e-05, "loss": 0.38758115768432616, "num_input_tokens_seen": 12506165056, "step": 43980, "train_runtime": 427595.4729, "train_tokens_per_second": 29247.655 }, { "epoch": 1.5564531287662509, "grad_norm": 0.61328125, "learning_rate": 2.1518765983388788e-05, "loss": 0.39447574615478515, "num_input_tokens_seen": 12508950272, "step": 43990, "train_runtime": 427689.8732, "train_tokens_per_second": 29247.712 }, { "epoch": 1.5568069490299796, "grad_norm": 0.6171875, "learning_rate": 2.1516773375902238e-05, "loss": 0.3862939357757568, "num_input_tokens_seen": 12511763648, "step": 44000, "train_runtime": 427785.0979, "train_tokens_per_second": 29247.778 }, { "epoch": 1.5571607692937084, "grad_norm": 0.66796875, "learning_rate": 2.1514781321851152e-05, "loss": 0.387599515914917, "num_input_tokens_seen": 12514606592, "step": 44010, "train_runtime": 427879.6165, "train_tokens_per_second": 29247.962 }, { "epoch": 1.5575145895574372, "grad_norm": 0.62109375, "learning_rate": 2.1512789820979384e-05, "loss": 0.3897282600402832, "num_input_tokens_seen": 12517426304, "step": 44020, "train_runtime": 427974.4037, "train_tokens_per_second": 29248.072 }, { "epoch": 1.557868409821166, "grad_norm": 0.5703125, "learning_rate": 2.1510798873030965e-05, "loss": 0.3901822090148926, "num_input_tokens_seen": 12520287168, "step": 44030, "train_runtime": 428071.0461, "train_tokens_per_second": 29248.152 }, { "epoch": 1.558222230084895, "grad_norm": 0.609375, "learning_rate": 2.1508808477750084e-05, "loss": 0.3936939716339111, "num_input_tokens_seen": 12523135232, "step": 44040, "train_runtime": 428166.5373, "train_tokens_per_second": 29248.281 }, { "epoch": 1.5585760503486235, "grad_norm": 0.58984375, "learning_rate": 2.1506818634881096e-05, "loss": 0.384035062789917, "num_input_tokens_seen": 12525946816, "step": 44050, "train_runtime": 428260.64, "train_tokens_per_second": 29248.419 }, { "epoch": 1.5589298706123524, "grad_norm": 0.609375, "learning_rate": 2.1504829344168518e-05, "loss": 0.38800787925720215, "num_input_tokens_seen": 12528793280, "step": 44060, "train_runtime": 428359.5153, "train_tokens_per_second": 29248.313 }, { "epoch": 1.559283690876081, "grad_norm": 0.6015625, "learning_rate": 2.1502840605357042e-05, "loss": 0.3905655384063721, "num_input_tokens_seen": 12531591424, "step": 44070, "train_runtime": 428455.0368, "train_tokens_per_second": 29248.323 }, { "epoch": 1.55963751113981, "grad_norm": 0.609375, "learning_rate": 2.1500852418191518e-05, "loss": 0.3879871845245361, "num_input_tokens_seen": 12534477184, "step": 44080, "train_runtime": 428557.426, "train_tokens_per_second": 29248.069 }, { "epoch": 1.5599913314035385, "grad_norm": 0.59375, "learning_rate": 2.1498864782416958e-05, "loss": 0.389221715927124, "num_input_tokens_seen": 12537293888, "step": 44090, "train_runtime": 428651.5733, "train_tokens_per_second": 29248.216 }, { "epoch": 1.5603451516672675, "grad_norm": 0.62109375, "learning_rate": 2.1496877697778547e-05, "loss": 0.38833768367767335, "num_input_tokens_seen": 12540124032, "step": 44100, "train_runtime": 428746.2996, "train_tokens_per_second": 29248.355 }, { "epoch": 1.560698971930996, "grad_norm": 0.5859375, "learning_rate": 2.1494891164021637e-05, "loss": 0.38802669048309324, "num_input_tokens_seen": 12542967296, "step": 44110, "train_runtime": 428843.677, "train_tokens_per_second": 29248.344 }, { "epoch": 1.561052792194725, "grad_norm": 0.61328125, "learning_rate": 2.149290518089173e-05, "loss": 0.3914804220199585, "num_input_tokens_seen": 12545837312, "step": 44120, "train_runtime": 428942.6341, "train_tokens_per_second": 29248.287 }, { "epoch": 1.5614066124584538, "grad_norm": 0.6328125, "learning_rate": 2.1490919748134512e-05, "loss": 0.38834688663482664, "num_input_tokens_seen": 12548620288, "step": 44130, "train_runtime": 429037.5439, "train_tokens_per_second": 29248.303 }, { "epoch": 1.5617604327221826, "grad_norm": 0.609375, "learning_rate": 2.1488934865495812e-05, "loss": 0.3912999629974365, "num_input_tokens_seen": 12551454720, "step": 44140, "train_runtime": 429131.673, "train_tokens_per_second": 29248.493 }, { "epoch": 1.5621142529859113, "grad_norm": 0.609375, "learning_rate": 2.1486950532721642e-05, "loss": 0.38909385204315183, "num_input_tokens_seen": 12554275392, "step": 44150, "train_runtime": 429227.0067, "train_tokens_per_second": 29248.568 }, { "epoch": 1.56246807324964, "grad_norm": 0.61328125, "learning_rate": 2.1484966749558173e-05, "loss": 0.39074001312255857, "num_input_tokens_seen": 12557107904, "step": 44160, "train_runtime": 429321.2483, "train_tokens_per_second": 29248.745 }, { "epoch": 1.5628218935133689, "grad_norm": 0.59375, "learning_rate": 2.1482983515751732e-05, "loss": 0.3922168731689453, "num_input_tokens_seen": 12559961920, "step": 44170, "train_runtime": 429417.3568, "train_tokens_per_second": 29248.845 }, { "epoch": 1.5631757137770976, "grad_norm": 0.625, "learning_rate": 2.1481000831048812e-05, "loss": 0.39490609169006347, "num_input_tokens_seen": 12562849856, "step": 44180, "train_runtime": 429512.4419, "train_tokens_per_second": 29249.094 }, { "epoch": 1.5635295340408264, "grad_norm": 0.62109375, "learning_rate": 2.147901869519609e-05, "loss": 0.38771209716796873, "num_input_tokens_seen": 12565730240, "step": 44190, "train_runtime": 429613.2651, "train_tokens_per_second": 29248.934 }, { "epoch": 1.5638833543045552, "grad_norm": 0.578125, "learning_rate": 2.147703710794037e-05, "loss": 0.3866820096969604, "num_input_tokens_seen": 12568560064, "step": 44200, "train_runtime": 429707.3922, "train_tokens_per_second": 29249.113 }, { "epoch": 1.5642371745682841, "grad_norm": 0.59765625, "learning_rate": 2.147505606902865e-05, "loss": 0.3912502288818359, "num_input_tokens_seen": 12571387584, "step": 44210, "train_runtime": 429802.7927, "train_tokens_per_second": 29249.199 }, { "epoch": 1.5645909948320127, "grad_norm": 0.58984375, "learning_rate": 2.147307557820808e-05, "loss": 0.38916351795196535, "num_input_tokens_seen": 12574206720, "step": 44220, "train_runtime": 429899.3628, "train_tokens_per_second": 29249.187 }, { "epoch": 1.5649448150957417, "grad_norm": 0.5859375, "learning_rate": 2.147109563522597e-05, "loss": 0.3939924716949463, "num_input_tokens_seen": 12577028288, "step": 44230, "train_runtime": 429992.1132, "train_tokens_per_second": 29249.439 }, { "epoch": 1.5652986353594702, "grad_norm": 0.609375, "learning_rate": 2.1469116239829804e-05, "loss": 0.3916449069976807, "num_input_tokens_seen": 12579834816, "step": 44240, "train_runtime": 430085.2853, "train_tokens_per_second": 29249.628 }, { "epoch": 1.5656524556231992, "grad_norm": 0.625, "learning_rate": 2.1467137391767213e-05, "loss": 0.39118366241455077, "num_input_tokens_seen": 12582689984, "step": 44250, "train_runtime": 430182.2923, "train_tokens_per_second": 29249.67 }, { "epoch": 1.5660062758869278, "grad_norm": 0.59375, "learning_rate": 2.146515909078601e-05, "loss": 0.3892606019973755, "num_input_tokens_seen": 12585563968, "step": 44260, "train_runtime": 430283.4127, "train_tokens_per_second": 29249.475 }, { "epoch": 1.5663600961506567, "grad_norm": 0.58984375, "learning_rate": 2.1463181336634156e-05, "loss": 0.39255824089050295, "num_input_tokens_seen": 12588414528, "step": 44270, "train_runtime": 430380.6113, "train_tokens_per_second": 29249.493 }, { "epoch": 1.5667139164143853, "grad_norm": 0.60546875, "learning_rate": 2.1461204129059776e-05, "loss": 0.39202563762664794, "num_input_tokens_seen": 12591275648, "step": 44280, "train_runtime": 430478.8885, "train_tokens_per_second": 29249.461 }, { "epoch": 1.5670677366781143, "grad_norm": 0.59375, "learning_rate": 2.145922746781116e-05, "loss": 0.38499107360839846, "num_input_tokens_seen": 12594127680, "step": 44290, "train_runtime": 430574.1974, "train_tokens_per_second": 29249.611 }, { "epoch": 1.567421556941843, "grad_norm": 0.60546875, "learning_rate": 2.1457251352636765e-05, "loss": 0.38577277660369874, "num_input_tokens_seen": 12596940032, "step": 44300, "train_runtime": 430666.7557, "train_tokens_per_second": 29249.855 }, { "epoch": 1.5677753772055718, "grad_norm": 0.609375, "learning_rate": 2.1455275783285203e-05, "loss": 0.3907612800598145, "num_input_tokens_seen": 12599772992, "step": 44310, "train_runtime": 430764.1901, "train_tokens_per_second": 29249.815 }, { "epoch": 1.5681291974693006, "grad_norm": 0.62890625, "learning_rate": 2.1453300759505255e-05, "loss": 0.38887863159179686, "num_input_tokens_seen": 12602666496, "step": 44320, "train_runtime": 430862.7641, "train_tokens_per_second": 29249.839 }, { "epoch": 1.5684830177330293, "grad_norm": 0.6171875, "learning_rate": 2.145132628104585e-05, "loss": 0.39121160507202146, "num_input_tokens_seen": 12605518912, "step": 44330, "train_runtime": 430960.3884, "train_tokens_per_second": 29249.832 }, { "epoch": 1.568836837996758, "grad_norm": 0.64453125, "learning_rate": 2.1449352347656098e-05, "loss": 0.3926108360290527, "num_input_tokens_seen": 12608373696, "step": 44340, "train_runtime": 431059.8077, "train_tokens_per_second": 29249.708 }, { "epoch": 1.5691906582604869, "grad_norm": 0.6015625, "learning_rate": 2.1447378959085256e-05, "loss": 0.3865676403045654, "num_input_tokens_seen": 12611231296, "step": 44350, "train_runtime": 431156.9887, "train_tokens_per_second": 29249.743 }, { "epoch": 1.5695444785242156, "grad_norm": 0.625, "learning_rate": 2.1445406115082747e-05, "loss": 0.38885016441345216, "num_input_tokens_seen": 12614064960, "step": 44360, "train_runtime": 431254.7606, "train_tokens_per_second": 29249.683 }, { "epoch": 1.5698982987879444, "grad_norm": 0.59375, "learning_rate": 2.1443433815398163e-05, "loss": 0.3882179260253906, "num_input_tokens_seen": 12616857728, "step": 44370, "train_runtime": 431350.3679, "train_tokens_per_second": 29249.674 }, { "epoch": 1.5702521190516734, "grad_norm": 0.6015625, "learning_rate": 2.1441462059781238e-05, "loss": 0.3887664794921875, "num_input_tokens_seen": 12619720000, "step": 44380, "train_runtime": 431448.5504, "train_tokens_per_second": 29249.652 }, { "epoch": 1.570605939315402, "grad_norm": 0.65625, "learning_rate": 2.1439490847981885e-05, "loss": 0.3904621124267578, "num_input_tokens_seen": 12622584512, "step": 44390, "train_runtime": 431547.9387, "train_tokens_per_second": 29249.553 }, { "epoch": 1.570959759579131, "grad_norm": 0.58984375, "learning_rate": 2.1437520179750174e-05, "loss": 0.3902522087097168, "num_input_tokens_seen": 12625504576, "step": 44400, "train_runtime": 431650.6297, "train_tokens_per_second": 29249.36 }, { "epoch": 1.5713135798428595, "grad_norm": 0.609375, "learning_rate": 2.1435550054836332e-05, "loss": 0.38826086521148684, "num_input_tokens_seen": 12628376768, "step": 44410, "train_runtime": 431751.2738, "train_tokens_per_second": 29249.194 }, { "epoch": 1.5716674001065885, "grad_norm": 0.61328125, "learning_rate": 2.1433580472990743e-05, "loss": 0.38236465454101565, "num_input_tokens_seen": 12631232192, "step": 44420, "train_runtime": 431848.5327, "train_tokens_per_second": 29249.219 }, { "epoch": 1.572021220370317, "grad_norm": 0.59765625, "learning_rate": 2.1431611433963964e-05, "loss": 0.3914022922515869, "num_input_tokens_seen": 12634029568, "step": 44430, "train_runtime": 431944.1389, "train_tokens_per_second": 29249.221 }, { "epoch": 1.572375040634046, "grad_norm": 0.58984375, "learning_rate": 2.14296429375067e-05, "loss": 0.3884912014007568, "num_input_tokens_seen": 12636909120, "step": 44440, "train_runtime": 432044.6001, "train_tokens_per_second": 29249.085 }, { "epoch": 1.5727288608977745, "grad_norm": 0.61328125, "learning_rate": 2.1427674983369826e-05, "loss": 0.393666934967041, "num_input_tokens_seen": 12639779136, "step": 44450, "train_runtime": 432145.4449, "train_tokens_per_second": 29248.901 }, { "epoch": 1.5730826811615035, "grad_norm": 0.609375, "learning_rate": 2.1425707571304366e-05, "loss": 0.3901156663894653, "num_input_tokens_seen": 12642660672, "step": 44460, "train_runtime": 432246.2274, "train_tokens_per_second": 29248.747 }, { "epoch": 1.5734365014252323, "grad_norm": 0.60546875, "learning_rate": 2.1423740701061512e-05, "loss": 0.3896439552307129, "num_input_tokens_seen": 12645494208, "step": 44470, "train_runtime": 432344.2171, "train_tokens_per_second": 29248.672 }, { "epoch": 1.573790321688961, "grad_norm": 0.58984375, "learning_rate": 2.1421774372392622e-05, "loss": 0.3929807424545288, "num_input_tokens_seen": 12648281280, "step": 44480, "train_runtime": 432436.8241, "train_tokens_per_second": 29248.853 }, { "epoch": 1.5741441419526898, "grad_norm": 0.59375, "learning_rate": 2.1419808585049194e-05, "loss": 0.39260187149047854, "num_input_tokens_seen": 12651189952, "step": 44490, "train_runtime": 432536.3823, "train_tokens_per_second": 29248.846 }, { "epoch": 1.5744979622164186, "grad_norm": 0.59765625, "learning_rate": 2.1417843338782907e-05, "loss": 0.387771463394165, "num_input_tokens_seen": 12654037952, "step": 44500, "train_runtime": 432633.9228, "train_tokens_per_second": 29248.834 }, { "epoch": 1.5748517824801473, "grad_norm": 0.60546875, "learning_rate": 2.1415878633345592e-05, "loss": 0.391402530670166, "num_input_tokens_seen": 12656910592, "step": 44510, "train_runtime": 432734.6176, "train_tokens_per_second": 29248.667 }, { "epoch": 1.575205602743876, "grad_norm": 0.5859375, "learning_rate": 2.1413914468489227e-05, "loss": 0.38649921417236327, "num_input_tokens_seen": 12659733376, "step": 44520, "train_runtime": 432832.1401, "train_tokens_per_second": 29248.598 }, { "epoch": 1.5755594230076049, "grad_norm": 0.578125, "learning_rate": 2.141195084396597e-05, "loss": 0.38875837326049806, "num_input_tokens_seen": 12662600768, "step": 44530, "train_runtime": 432928.0458, "train_tokens_per_second": 29248.742 }, { "epoch": 1.5759132432713336, "grad_norm": 0.609375, "learning_rate": 2.140998775952812e-05, "loss": 0.3887928009033203, "num_input_tokens_seen": 12665407296, "step": 44540, "train_runtime": 433024.383, "train_tokens_per_second": 29248.716 }, { "epoch": 1.5762670635350626, "grad_norm": 0.59765625, "learning_rate": 2.140802521492814e-05, "loss": 0.38804116249084475, "num_input_tokens_seen": 12668250752, "step": 44550, "train_runtime": 433120.6943, "train_tokens_per_second": 29248.777 }, { "epoch": 1.5766208837987912, "grad_norm": 0.60546875, "learning_rate": 2.140606320991867e-05, "loss": 0.39308843612670896, "num_input_tokens_seen": 12671056320, "step": 44560, "train_runtime": 433218.6944, "train_tokens_per_second": 29248.637 }, { "epoch": 1.5769747040625202, "grad_norm": 0.61328125, "learning_rate": 2.140410174425248e-05, "loss": 0.3906198024749756, "num_input_tokens_seen": 12673875200, "step": 44570, "train_runtime": 433314.9591, "train_tokens_per_second": 29248.645 }, { "epoch": 1.5773285243262487, "grad_norm": 0.6328125, "learning_rate": 2.140214081768251e-05, "loss": 0.38810865879058837, "num_input_tokens_seen": 12676647872, "step": 44580, "train_runtime": 433410.6798, "train_tokens_per_second": 29248.582 }, { "epoch": 1.5776823445899777, "grad_norm": 0.60546875, "learning_rate": 2.140018042996187e-05, "loss": 0.3846935987472534, "num_input_tokens_seen": 12679409024, "step": 44590, "train_runtime": 433502.3061, "train_tokens_per_second": 29248.769 }, { "epoch": 1.5780361648537062, "grad_norm": 0.609375, "learning_rate": 2.1398220580843807e-05, "loss": 0.3881331443786621, "num_input_tokens_seen": 12682261504, "step": 44600, "train_runtime": 433599.7376, "train_tokens_per_second": 29248.776 }, { "epoch": 1.5783899851174352, "grad_norm": 0.6171875, "learning_rate": 2.1396261270081748e-05, "loss": 0.3894944190979004, "num_input_tokens_seen": 12685153856, "step": 44610, "train_runtime": 433700.4043, "train_tokens_per_second": 29248.656 }, { "epoch": 1.578743805381164, "grad_norm": 0.61328125, "learning_rate": 2.1394302497429258e-05, "loss": 0.389498233795166, "num_input_tokens_seen": 12688015296, "step": 44620, "train_runtime": 433797.4886, "train_tokens_per_second": 29248.706 }, { "epoch": 1.5790976256448928, "grad_norm": 0.62109375, "learning_rate": 2.1392344262640077e-05, "loss": 0.38886559009552, "num_input_tokens_seen": 12690933824, "step": 44630, "train_runtime": 433897.5332, "train_tokens_per_second": 29248.689 }, { "epoch": 1.5794514459086215, "grad_norm": 0.5859375, "learning_rate": 2.139038656546809e-05, "loss": 0.38655881881713866, "num_input_tokens_seen": 12693750144, "step": 44640, "train_runtime": 433990.4033, "train_tokens_per_second": 29248.919 }, { "epoch": 1.5798052661723503, "grad_norm": 0.61328125, "learning_rate": 2.138842940566735e-05, "loss": 0.39056284427642823, "num_input_tokens_seen": 12696573056, "step": 44650, "train_runtime": 434085.0021, "train_tokens_per_second": 29249.048 }, { "epoch": 1.580159086436079, "grad_norm": 0.58984375, "learning_rate": 2.1386472782992055e-05, "loss": 0.38646736145019533, "num_input_tokens_seen": 12699389568, "step": 44660, "train_runtime": 434180.2714, "train_tokens_per_second": 29249.117 }, { "epoch": 1.5805129066998078, "grad_norm": 0.6171875, "learning_rate": 2.138451669719658e-05, "loss": 0.39318141937255857, "num_input_tokens_seen": 12702281792, "step": 44670, "train_runtime": 434281.4869, "train_tokens_per_second": 29248.96 }, { "epoch": 1.5808667269635366, "grad_norm": 0.59375, "learning_rate": 2.138256114803543e-05, "loss": 0.38870036602020264, "num_input_tokens_seen": 12705152832, "step": 44680, "train_runtime": 434378.9183, "train_tokens_per_second": 29249.009 }, { "epoch": 1.5812205472272653, "grad_norm": 0.59375, "learning_rate": 2.138060613526329e-05, "loss": 0.3939640045166016, "num_input_tokens_seen": 12707983872, "step": 44690, "train_runtime": 434476.3898, "train_tokens_per_second": 29248.963 }, { "epoch": 1.5815743674909941, "grad_norm": 0.66015625, "learning_rate": 2.1378651658634993e-05, "loss": 0.3891609191894531, "num_input_tokens_seen": 12710842048, "step": 44700, "train_runtime": 434574.9814, "train_tokens_per_second": 29248.904 }, { "epoch": 1.5819281877547229, "grad_norm": 0.60546875, "learning_rate": 2.137669771790553e-05, "loss": 0.38781180381774905, "num_input_tokens_seen": 12713751936, "step": 44710, "train_runtime": 434675.7516, "train_tokens_per_second": 29248.818 }, { "epoch": 1.5822820080184519, "grad_norm": 0.6328125, "learning_rate": 2.1374744312830048e-05, "loss": 0.38753108978271483, "num_input_tokens_seen": 12716627776, "step": 44720, "train_runtime": 434775.6943, "train_tokens_per_second": 29248.709 }, { "epoch": 1.5826358282821804, "grad_norm": 0.63671875, "learning_rate": 2.137279144316385e-05, "loss": 0.39143168926239014, "num_input_tokens_seen": 12719462592, "step": 44730, "train_runtime": 434868.5703, "train_tokens_per_second": 29248.981 }, { "epoch": 1.5829896485459094, "grad_norm": 0.6171875, "learning_rate": 2.1370839108662393e-05, "loss": 0.3870562553405762, "num_input_tokens_seen": 12722289728, "step": 44740, "train_runtime": 434964.6183, "train_tokens_per_second": 29249.022 }, { "epoch": 1.583343468809638, "grad_norm": 0.59765625, "learning_rate": 2.1368887309081305e-05, "loss": 0.3888025999069214, "num_input_tokens_seen": 12725142528, "step": 44750, "train_runtime": 435062.3952, "train_tokens_per_second": 29249.006 }, { "epoch": 1.583697289073367, "grad_norm": 0.6171875, "learning_rate": 2.136693604417635e-05, "loss": 0.38753998279571533, "num_input_tokens_seen": 12727975808, "step": 44760, "train_runtime": 435159.9033, "train_tokens_per_second": 29248.963 }, { "epoch": 1.5840511093370955, "grad_norm": 0.62890625, "learning_rate": 2.1364985313703465e-05, "loss": 0.3935102462768555, "num_input_tokens_seen": 12730808960, "step": 44770, "train_runtime": 435255.8914, "train_tokens_per_second": 29249.022 }, { "epoch": 1.5844049296008245, "grad_norm": 0.59375, "learning_rate": 2.1363035117418724e-05, "loss": 0.3910824298858643, "num_input_tokens_seen": 12733634816, "step": 44780, "train_runtime": 435351.7661, "train_tokens_per_second": 29249.071 }, { "epoch": 1.5847587498645532, "grad_norm": 0.625, "learning_rate": 2.1361085455078375e-05, "loss": 0.3940113544464111, "num_input_tokens_seen": 12736443904, "step": 44790, "train_runtime": 435448.0749, "train_tokens_per_second": 29249.053 }, { "epoch": 1.585112570128282, "grad_norm": 0.6171875, "learning_rate": 2.1359136326438812e-05, "loss": 0.39459786415100095, "num_input_tokens_seen": 12739237568, "step": 44800, "train_runtime": 435541.8822, "train_tokens_per_second": 29249.168 }, { "epoch": 1.5854663903920108, "grad_norm": 0.59375, "learning_rate": 2.1357187731256588e-05, "loss": 0.384906005859375, "num_input_tokens_seen": 12742100800, "step": 44810, "train_runtime": 435640.6836, "train_tokens_per_second": 29249.107 }, { "epoch": 1.5858202106557395, "grad_norm": 0.61328125, "learning_rate": 2.1355239669288418e-05, "loss": 0.3929803133010864, "num_input_tokens_seen": 12745032448, "step": 44820, "train_runtime": 435740.5623, "train_tokens_per_second": 29249.13 }, { "epoch": 1.5861740309194683, "grad_norm": 0.6015625, "learning_rate": 2.1353292140291152e-05, "loss": 0.39290447235107423, "num_input_tokens_seen": 12747848768, "step": 44830, "train_runtime": 435838.1182, "train_tokens_per_second": 29249.045 }, { "epoch": 1.586527851183197, "grad_norm": 0.5859375, "learning_rate": 2.1351345144021818e-05, "loss": 0.3892096519470215, "num_input_tokens_seen": 12750732672, "step": 44840, "train_runtime": 435940.0591, "train_tokens_per_second": 29248.821 }, { "epoch": 1.5868816714469258, "grad_norm": 0.62890625, "learning_rate": 2.1349398680237585e-05, "loss": 0.3912916660308838, "num_input_tokens_seen": 12753564352, "step": 44850, "train_runtime": 436036.6689, "train_tokens_per_second": 29248.834 }, { "epoch": 1.5872354917106546, "grad_norm": 0.61328125, "learning_rate": 2.1347452748695784e-05, "loss": 0.3866436243057251, "num_input_tokens_seen": 12756367616, "step": 44860, "train_runtime": 436131.8071, "train_tokens_per_second": 29248.882 }, { "epoch": 1.5875893119743836, "grad_norm": 0.609375, "learning_rate": 2.1345507349153896e-05, "loss": 0.38961215019226075, "num_input_tokens_seen": 12759225088, "step": 44870, "train_runtime": 436226.7441, "train_tokens_per_second": 29249.067 }, { "epoch": 1.5879431322381121, "grad_norm": 0.5859375, "learning_rate": 2.1343562481369555e-05, "loss": 0.38921217918395995, "num_input_tokens_seen": 12762026688, "step": 44880, "train_runtime": 436321.0909, "train_tokens_per_second": 29249.163 }, { "epoch": 1.588296952501841, "grad_norm": 0.6171875, "learning_rate": 2.1341618145100557e-05, "loss": 0.3892656326293945, "num_input_tokens_seen": 12764949504, "step": 44890, "train_runtime": 436422.795, "train_tokens_per_second": 29249.044 }, { "epoch": 1.5886507727655697, "grad_norm": 0.65234375, "learning_rate": 2.133967434010485e-05, "loss": 0.3880063533782959, "num_input_tokens_seen": 12767798144, "step": 44900, "train_runtime": 436522.1908, "train_tokens_per_second": 29248.91 }, { "epoch": 1.5890045930292986, "grad_norm": 0.59765625, "learning_rate": 2.1337731066140536e-05, "loss": 0.38448147773742675, "num_input_tokens_seen": 12770677440, "step": 44910, "train_runtime": 436618.5099, "train_tokens_per_second": 29249.052 }, { "epoch": 1.5893584132930272, "grad_norm": 0.62890625, "learning_rate": 2.1335788322965864e-05, "loss": 0.39184203147888186, "num_input_tokens_seen": 12773505792, "step": 44920, "train_runtime": 436710.9335, "train_tokens_per_second": 29249.338 }, { "epoch": 1.5897122335567562, "grad_norm": 0.5859375, "learning_rate": 2.1333846110339246e-05, "loss": 0.384472131729126, "num_input_tokens_seen": 12776366080, "step": 44930, "train_runtime": 436807.0916, "train_tokens_per_second": 29249.447 }, { "epoch": 1.5900660538204847, "grad_norm": 0.6015625, "learning_rate": 2.133190442801925e-05, "loss": 0.39309532642364503, "num_input_tokens_seen": 12779222592, "step": 44940, "train_runtime": 436906.3582, "train_tokens_per_second": 29249.34 }, { "epoch": 1.5904198740842137, "grad_norm": 0.5859375, "learning_rate": 2.1329963275764586e-05, "loss": 0.3858497142791748, "num_input_tokens_seen": 12782075776, "step": 44950, "train_runtime": 437002.5757, "train_tokens_per_second": 29249.429 }, { "epoch": 1.5907736943479425, "grad_norm": 0.6015625, "learning_rate": 2.1328022653334127e-05, "loss": 0.39380998611450196, "num_input_tokens_seen": 12784884160, "step": 44960, "train_runtime": 437094.4987, "train_tokens_per_second": 29249.703 }, { "epoch": 1.5911275146116712, "grad_norm": 0.60546875, "learning_rate": 2.1326082560486895e-05, "loss": 0.38759121894836424, "num_input_tokens_seen": 12787754624, "step": 44970, "train_runtime": 437189.1406, "train_tokens_per_second": 29249.937 }, { "epoch": 1.5914813348754, "grad_norm": 0.625, "learning_rate": 2.132414299698207e-05, "loss": 0.38825697898864747, "num_input_tokens_seen": 12790593216, "step": 44980, "train_runtime": 437284.6757, "train_tokens_per_second": 29250.038 }, { "epoch": 1.5918351551391288, "grad_norm": 0.59375, "learning_rate": 2.1322203962578984e-05, "loss": 0.38610210418701174, "num_input_tokens_seen": 12793465920, "step": 44990, "train_runtime": 437382.2998, "train_tokens_per_second": 29250.077 }, { "epoch": 1.5921889754028575, "grad_norm": 0.6171875, "learning_rate": 2.1320265457037115e-05, "loss": 0.39192681312561034, "num_input_tokens_seen": 12796284416, "step": 45000, "train_runtime": 437480.7379, "train_tokens_per_second": 29249.938 }, { "epoch": 1.5921889754028575, "eval_loss": 0.33652210235595703, "eval_runtime": 8.4198, "eval_samples_per_second": 473.647, "eval_steps_per_second": 3.801, "num_input_tokens_seen": 12796284416, "step": 45000 }, { "epoch": 1.5925427956665863, "grad_norm": 0.609375, "learning_rate": 2.1318327480116112e-05, "loss": 0.3895860195159912, "num_input_tokens_seen": 12799080832, "step": 45010, "train_runtime": 437604.1809, "train_tokens_per_second": 29248.077 }, { "epoch": 1.592896615930315, "grad_norm": 0.60546875, "learning_rate": 2.131639003157575e-05, "loss": 0.3914334297180176, "num_input_tokens_seen": 12801917888, "step": 45020, "train_runtime": 437702.9683, "train_tokens_per_second": 29247.958 }, { "epoch": 1.5932504361940438, "grad_norm": 0.609375, "learning_rate": 2.1314453111175983e-05, "loss": 0.3910184383392334, "num_input_tokens_seen": 12804813248, "step": 45030, "train_runtime": 437801.331, "train_tokens_per_second": 29248.0 }, { "epoch": 1.5936042564577728, "grad_norm": 0.5625, "learning_rate": 2.13125167186769e-05, "loss": 0.39088263511657717, "num_input_tokens_seen": 12807639168, "step": 45040, "train_runtime": 437895.9329, "train_tokens_per_second": 29248.135 }, { "epoch": 1.5939580767215014, "grad_norm": 0.625, "learning_rate": 2.131058085383875e-05, "loss": 0.39203720092773436, "num_input_tokens_seen": 12810487744, "step": 45050, "train_runtime": 437995.3044, "train_tokens_per_second": 29248.002 }, { "epoch": 1.5943118969852303, "grad_norm": 0.6171875, "learning_rate": 2.1308645516421935e-05, "loss": 0.3851248502731323, "num_input_tokens_seen": 12813344448, "step": 45060, "train_runtime": 438091.3401, "train_tokens_per_second": 29248.112 }, { "epoch": 1.594665717248959, "grad_norm": 0.60546875, "learning_rate": 2.1306710706187006e-05, "loss": 0.38852543830871583, "num_input_tokens_seen": 12816212480, "step": 45070, "train_runtime": 438189.2873, "train_tokens_per_second": 29248.119 }, { "epoch": 1.5950195375126879, "grad_norm": 0.6171875, "learning_rate": 2.1304776422894667e-05, "loss": 0.38821632862091066, "num_input_tokens_seen": 12819068672, "step": 45080, "train_runtime": 438284.7482, "train_tokens_per_second": 29248.265 }, { "epoch": 1.5953733577764164, "grad_norm": 0.6015625, "learning_rate": 2.1302842666305776e-05, "loss": 0.3872946500778198, "num_input_tokens_seen": 12821913664, "step": 45090, "train_runtime": 438379.9603, "train_tokens_per_second": 29248.403 }, { "epoch": 1.5957271780401454, "grad_norm": 0.60546875, "learning_rate": 2.1300909436181343e-05, "loss": 0.39091858863830564, "num_input_tokens_seen": 12824738816, "step": 45100, "train_runtime": 438477.1787, "train_tokens_per_second": 29248.361 }, { "epoch": 1.596080998303874, "grad_norm": 0.58984375, "learning_rate": 2.129897673228253e-05, "loss": 0.3875157833099365, "num_input_tokens_seen": 12827594304, "step": 45110, "train_runtime": 438576.9868, "train_tokens_per_second": 29248.216 }, { "epoch": 1.596434818567603, "grad_norm": 0.6015625, "learning_rate": 2.1297044554370643e-05, "loss": 0.38906288146972656, "num_input_tokens_seen": 12830426944, "step": 45120, "train_runtime": 438673.163, "train_tokens_per_second": 29248.26 }, { "epoch": 1.5967886388313317, "grad_norm": 0.60546875, "learning_rate": 2.1295112902207147e-05, "loss": 0.39132840633392335, "num_input_tokens_seen": 12833234624, "step": 45130, "train_runtime": 438767.2574, "train_tokens_per_second": 29248.387 }, { "epoch": 1.5971424590950605, "grad_norm": 0.61328125, "learning_rate": 2.1293181775553662e-05, "loss": 0.3892688274383545, "num_input_tokens_seen": 12836122624, "step": 45140, "train_runtime": 438867.1395, "train_tokens_per_second": 29248.311 }, { "epoch": 1.5974962793587892, "grad_norm": 0.60546875, "learning_rate": 2.1291251174171946e-05, "loss": 0.3857736587524414, "num_input_tokens_seen": 12838963712, "step": 45150, "train_runtime": 438963.9186, "train_tokens_per_second": 29248.335 }, { "epoch": 1.597850099622518, "grad_norm": 0.59765625, "learning_rate": 2.128932109782393e-05, "loss": 0.38685131072998047, "num_input_tokens_seen": 12841800960, "step": 45160, "train_runtime": 439057.2823, "train_tokens_per_second": 29248.578 }, { "epoch": 1.5982039198862468, "grad_norm": 0.6171875, "learning_rate": 2.128739154627167e-05, "loss": 0.3905055999755859, "num_input_tokens_seen": 12844650624, "step": 45170, "train_runtime": 439155.7038, "train_tokens_per_second": 29248.511 }, { "epoch": 1.5985577401499755, "grad_norm": 0.66015625, "learning_rate": 2.128546251927739e-05, "loss": 0.3858360528945923, "num_input_tokens_seen": 12847525312, "step": 45180, "train_runtime": 439252.4011, "train_tokens_per_second": 29248.617 }, { "epoch": 1.5989115604137043, "grad_norm": 0.61328125, "learning_rate": 2.128353401660346e-05, "loss": 0.39108691215515134, "num_input_tokens_seen": 12850308864, "step": 45190, "train_runtime": 439345.6058, "train_tokens_per_second": 29248.748 }, { "epoch": 1.599265380677433, "grad_norm": 0.58984375, "learning_rate": 2.1281606038012402e-05, "loss": 0.3894501209259033, "num_input_tokens_seen": 12853207808, "step": 45200, "train_runtime": 439446.3421, "train_tokens_per_second": 29248.64 }, { "epoch": 1.599619200941162, "grad_norm": 0.58984375, "learning_rate": 2.1279678583266886e-05, "loss": 0.39052419662475585, "num_input_tokens_seen": 12856019520, "step": 45210, "train_runtime": 439543.9966, "train_tokens_per_second": 29248.539 }, { "epoch": 1.5999730212048906, "grad_norm": 0.6171875, "learning_rate": 2.127775165212974e-05, "loss": 0.39018614292144777, "num_input_tokens_seen": 12858788544, "step": 45220, "train_runtime": 439635.1388, "train_tokens_per_second": 29248.773 }, { "epoch": 1.6003268414686196, "grad_norm": 0.61328125, "learning_rate": 2.1275825244363922e-05, "loss": 0.3904735803604126, "num_input_tokens_seen": 12861605056, "step": 45230, "train_runtime": 439732.5926, "train_tokens_per_second": 29248.696 }, { "epoch": 1.6006806617323481, "grad_norm": 0.609375, "learning_rate": 2.127389935973257e-05, "loss": 0.3859109401702881, "num_input_tokens_seen": 12864459136, "step": 45240, "train_runtime": 439830.607, "train_tokens_per_second": 29248.667 }, { "epoch": 1.6010344819960771, "grad_norm": 0.62109375, "learning_rate": 2.1271973997998947e-05, "loss": 0.38423891067504884, "num_input_tokens_seen": 12867307072, "step": 45250, "train_runtime": 439926.8426, "train_tokens_per_second": 29248.743 }, { "epoch": 1.6013883022598057, "grad_norm": 0.61328125, "learning_rate": 2.1270049158926483e-05, "loss": 0.3884052515029907, "num_input_tokens_seen": 12870160896, "step": 45260, "train_runtime": 440022.2624, "train_tokens_per_second": 29248.886 }, { "epoch": 1.6017421225235347, "grad_norm": 0.58203125, "learning_rate": 2.1268124842278744e-05, "loss": 0.3884448528289795, "num_input_tokens_seen": 12873036864, "step": 45270, "train_runtime": 440121.0662, "train_tokens_per_second": 29248.854 }, { "epoch": 1.6020959427872632, "grad_norm": 0.609375, "learning_rate": 2.1266201047819458e-05, "loss": 0.39068496227264404, "num_input_tokens_seen": 12875860800, "step": 45280, "train_runtime": 440216.6337, "train_tokens_per_second": 29248.919 }, { "epoch": 1.6024497630509922, "grad_norm": 0.61328125, "learning_rate": 2.126427777531249e-05, "loss": 0.38841488361358645, "num_input_tokens_seen": 12878672064, "step": 45290, "train_runtime": 440313.4151, "train_tokens_per_second": 29248.875 }, { "epoch": 1.602803583314721, "grad_norm": 0.6171875, "learning_rate": 2.126235502452186e-05, "loss": 0.3897926092147827, "num_input_tokens_seen": 12881511680, "step": 45300, "train_runtime": 440411.8428, "train_tokens_per_second": 29248.786 }, { "epoch": 1.6031574035784497, "grad_norm": 0.59375, "learning_rate": 2.1260432795211747e-05, "loss": 0.39048631191253663, "num_input_tokens_seen": 12884358464, "step": 45310, "train_runtime": 440507.1425, "train_tokens_per_second": 29248.921 }, { "epoch": 1.6035112238421785, "grad_norm": 0.62109375, "learning_rate": 2.1258511087146463e-05, "loss": 0.38648035526275637, "num_input_tokens_seen": 12887202048, "step": 45320, "train_runtime": 440605.1579, "train_tokens_per_second": 29248.868 }, { "epoch": 1.6038650441059072, "grad_norm": 0.6015625, "learning_rate": 2.125658990009048e-05, "loss": 0.39255719184875487, "num_input_tokens_seen": 12890055360, "step": 45330, "train_runtime": 440702.3899, "train_tokens_per_second": 29248.889 }, { "epoch": 1.604218864369636, "grad_norm": 0.625, "learning_rate": 2.125466923380842e-05, "loss": 0.39010910987854003, "num_input_tokens_seen": 12892913984, "step": 45340, "train_runtime": 440796.0499, "train_tokens_per_second": 29249.16 }, { "epoch": 1.6045726846333648, "grad_norm": 0.62109375, "learning_rate": 2.1252749088065038e-05, "loss": 0.38816065788269044, "num_input_tokens_seen": 12895766784, "step": 45350, "train_runtime": 440892.5637, "train_tokens_per_second": 29249.227 }, { "epoch": 1.6049265048970935, "grad_norm": 0.60546875, "learning_rate": 2.125082946262526e-05, "loss": 0.38496904373168944, "num_input_tokens_seen": 12898648448, "step": 45360, "train_runtime": 440992.4429, "train_tokens_per_second": 29249.137 }, { "epoch": 1.6052803251608223, "grad_norm": 0.6328125, "learning_rate": 2.1248910357254146e-05, "loss": 0.38748290538787844, "num_input_tokens_seen": 12901506176, "step": 45370, "train_runtime": 441089.2587, "train_tokens_per_second": 29249.196 }, { "epoch": 1.6056341454245513, "grad_norm": 0.5859375, "learning_rate": 2.1246991771716913e-05, "loss": 0.3928998470306396, "num_input_tokens_seen": 12904395392, "step": 45380, "train_runtime": 441189.34, "train_tokens_per_second": 29249.11 }, { "epoch": 1.6059879656882798, "grad_norm": 0.61328125, "learning_rate": 2.124507370577891e-05, "loss": 0.385508394241333, "num_input_tokens_seen": 12907297152, "step": 45390, "train_runtime": 441289.8673, "train_tokens_per_second": 29249.022 }, { "epoch": 1.6063417859520088, "grad_norm": 0.5859375, "learning_rate": 2.1243156159205653e-05, "loss": 0.3894524574279785, "num_input_tokens_seen": 12910122304, "step": 45400, "train_runtime": 441385.4849, "train_tokens_per_second": 29249.087 }, { "epoch": 1.6066956062157374, "grad_norm": 0.60546875, "learning_rate": 2.1241239131762808e-05, "loss": 0.3883928060531616, "num_input_tokens_seen": 12912981696, "step": 45410, "train_runtime": 441480.7367, "train_tokens_per_second": 29249.253 }, { "epoch": 1.6070494264794664, "grad_norm": 0.6015625, "learning_rate": 2.1239322623216165e-05, "loss": 0.38733625411987305, "num_input_tokens_seen": 12915846144, "step": 45420, "train_runtime": 441579.0986, "train_tokens_per_second": 29249.224 }, { "epoch": 1.607403246743195, "grad_norm": 0.6328125, "learning_rate": 2.1237406633331682e-05, "loss": 0.39173614978790283, "num_input_tokens_seen": 12918590592, "step": 45430, "train_runtime": 441672.402, "train_tokens_per_second": 29249.259 }, { "epoch": 1.607757067006924, "grad_norm": 0.64453125, "learning_rate": 2.1235491161875466e-05, "loss": 0.3900144577026367, "num_input_tokens_seen": 12921430848, "step": 45440, "train_runtime": 441769.4881, "train_tokens_per_second": 29249.261 }, { "epoch": 1.6081108872706524, "grad_norm": 0.62890625, "learning_rate": 2.123357620861376e-05, "loss": 0.3882885932922363, "num_input_tokens_seen": 12924311040, "step": 45450, "train_runtime": 441868.9054, "train_tokens_per_second": 29249.198 }, { "epoch": 1.6084647075343814, "grad_norm": 0.59375, "learning_rate": 2.1231661773312958e-05, "loss": 0.38944187164306643, "num_input_tokens_seen": 12927140416, "step": 45460, "train_runtime": 441964.2725, "train_tokens_per_second": 29249.288 }, { "epoch": 1.6088185277981102, "grad_norm": 0.60546875, "learning_rate": 2.122974785573961e-05, "loss": 0.3875762939453125, "num_input_tokens_seen": 12929985536, "step": 45470, "train_runtime": 442061.0217, "train_tokens_per_second": 29249.323 }, { "epoch": 1.609172348061839, "grad_norm": 0.6328125, "learning_rate": 2.12278344556604e-05, "loss": 0.38895392417907715, "num_input_tokens_seen": 12932874688, "step": 45480, "train_runtime": 442161.6975, "train_tokens_per_second": 29249.197 }, { "epoch": 1.6095261683255677, "grad_norm": 0.59765625, "learning_rate": 2.1225921572842165e-05, "loss": 0.3914012432098389, "num_input_tokens_seen": 12935733760, "step": 45490, "train_runtime": 442259.7988, "train_tokens_per_second": 29249.174 }, { "epoch": 1.6098799885892965, "grad_norm": 0.6015625, "learning_rate": 2.12240092070519e-05, "loss": 0.38959786891937254, "num_input_tokens_seen": 12938590528, "step": 45500, "train_runtime": 442356.5536, "train_tokens_per_second": 29249.234 }, { "epoch": 1.6102338088530253, "grad_norm": 0.6015625, "learning_rate": 2.1222097358056727e-05, "loss": 0.387194299697876, "num_input_tokens_seen": 12941407296, "step": 45510, "train_runtime": 442452.0517, "train_tokens_per_second": 29249.288 }, { "epoch": 1.610587629116754, "grad_norm": 0.59765625, "learning_rate": 2.122018602562393e-05, "loss": 0.3864673376083374, "num_input_tokens_seen": 12944279360, "step": 45520, "train_runtime": 442547.8466, "train_tokens_per_second": 29249.446 }, { "epoch": 1.6109414493804828, "grad_norm": 0.62890625, "learning_rate": 2.1218275209520926e-05, "loss": 0.3891880989074707, "num_input_tokens_seen": 12947076288, "step": 45530, "train_runtime": 442642.5694, "train_tokens_per_second": 29249.506 }, { "epoch": 1.6112952696442115, "grad_norm": 0.58203125, "learning_rate": 2.1216364909515306e-05, "loss": 0.3909165382385254, "num_input_tokens_seen": 12949908672, "step": 45540, "train_runtime": 442738.512, "train_tokens_per_second": 29249.565 }, { "epoch": 1.6116490899079405, "grad_norm": 0.625, "learning_rate": 2.1214455125374763e-05, "loss": 0.3852527618408203, "num_input_tokens_seen": 12952833728, "step": 45550, "train_runtime": 442841.4899, "train_tokens_per_second": 29249.368 }, { "epoch": 1.612002910171669, "grad_norm": 0.60546875, "learning_rate": 2.1212545856867176e-05, "loss": 0.3862185478210449, "num_input_tokens_seen": 12955658368, "step": 45560, "train_runtime": 442936.5167, "train_tokens_per_second": 29249.47 }, { "epoch": 1.612356730435398, "grad_norm": 0.6015625, "learning_rate": 2.1210637103760558e-05, "loss": 0.3919167995452881, "num_input_tokens_seen": 12958541632, "step": 45570, "train_runtime": 443037.5259, "train_tokens_per_second": 29249.309 }, { "epoch": 1.6127105506991266, "grad_norm": 0.59375, "learning_rate": 2.1208728865823054e-05, "loss": 0.389019775390625, "num_input_tokens_seen": 12961378560, "step": 45580, "train_runtime": 443131.7045, "train_tokens_per_second": 29249.495 }, { "epoch": 1.6130643709628556, "grad_norm": 0.60546875, "learning_rate": 2.120682114282298e-05, "loss": 0.38559646606445314, "num_input_tokens_seen": 12964219904, "step": 45590, "train_runtime": 443227.6238, "train_tokens_per_second": 29249.576 }, { "epoch": 1.6134181912265841, "grad_norm": 0.62109375, "learning_rate": 2.1204913934528784e-05, "loss": 0.38884451389312746, "num_input_tokens_seen": 12967115520, "step": 45600, "train_runtime": 443328.553, "train_tokens_per_second": 29249.448 }, { "epoch": 1.6137720114903131, "grad_norm": 0.59765625, "learning_rate": 2.120300724070905e-05, "loss": 0.3895893573760986, "num_input_tokens_seen": 12969981824, "step": 45610, "train_runtime": 443424.6611, "train_tokens_per_second": 29249.573 }, { "epoch": 1.614125831754042, "grad_norm": 0.6015625, "learning_rate": 2.1201101061132525e-05, "loss": 0.39345195293426516, "num_input_tokens_seen": 12972808768, "step": 45620, "train_runtime": 443518.7004, "train_tokens_per_second": 29249.745 }, { "epoch": 1.6144796520177707, "grad_norm": 0.6328125, "learning_rate": 2.1199195395568095e-05, "loss": 0.38239092826843263, "num_input_tokens_seen": 12975654144, "step": 45630, "train_runtime": 443613.8372, "train_tokens_per_second": 29249.886 }, { "epoch": 1.6148334722814994, "grad_norm": 0.61328125, "learning_rate": 2.119729024378479e-05, "loss": 0.39530048370361326, "num_input_tokens_seen": 12978517376, "step": 45640, "train_runtime": 443710.8838, "train_tokens_per_second": 29249.941 }, { "epoch": 1.6151872925452282, "grad_norm": 0.5859375, "learning_rate": 2.119538560555179e-05, "loss": 0.3886423587799072, "num_input_tokens_seen": 12981345408, "step": 45650, "train_runtime": 443806.7277, "train_tokens_per_second": 29249.997 }, { "epoch": 1.615541112808957, "grad_norm": 0.62109375, "learning_rate": 2.1193481480638405e-05, "loss": 0.3916743516921997, "num_input_tokens_seen": 12984199744, "step": 45660, "train_runtime": 443904.6842, "train_tokens_per_second": 29249.972 }, { "epoch": 1.6158949330726857, "grad_norm": 0.6328125, "learning_rate": 2.119157786881411e-05, "loss": 0.38446879386901855, "num_input_tokens_seen": 12986996160, "step": 45670, "train_runtime": 443999.7416, "train_tokens_per_second": 29250.008 }, { "epoch": 1.6162487533364145, "grad_norm": 0.6484375, "learning_rate": 2.118967476984852e-05, "loss": 0.3916933536529541, "num_input_tokens_seen": 12989805504, "step": 45680, "train_runtime": 444097.1134, "train_tokens_per_second": 29249.921 }, { "epoch": 1.6166025736001433, "grad_norm": 0.6015625, "learning_rate": 2.118777218351139e-05, "loss": 0.38768706321716306, "num_input_tokens_seen": 12992623296, "step": 45690, "train_runtime": 444194.4075, "train_tokens_per_second": 29249.858 }, { "epoch": 1.616956393863872, "grad_norm": 0.6171875, "learning_rate": 2.1185870109572614e-05, "loss": 0.3936758041381836, "num_input_tokens_seen": 12995437504, "step": 45700, "train_runtime": 444289.8534, "train_tokens_per_second": 29249.908 }, { "epoch": 1.6173102141276008, "grad_norm": 0.59765625, "learning_rate": 2.1183968547802243e-05, "loss": 0.3878281593322754, "num_input_tokens_seen": 12998207936, "step": 45710, "train_runtime": 444386.8101, "train_tokens_per_second": 29249.761 }, { "epoch": 1.6176640343913298, "grad_norm": 0.59765625, "learning_rate": 2.1182067497970464e-05, "loss": 0.3898247957229614, "num_input_tokens_seen": 13001048000, "step": 45720, "train_runtime": 444484.811, "train_tokens_per_second": 29249.701 }, { "epoch": 1.6180178546550583, "grad_norm": 0.61328125, "learning_rate": 2.1180166959847613e-05, "loss": 0.3905017614364624, "num_input_tokens_seen": 13003955456, "step": 45730, "train_runtime": 444588.9167, "train_tokens_per_second": 29249.392 }, { "epoch": 1.6183716749187873, "grad_norm": 0.609375, "learning_rate": 2.1178266933204168e-05, "loss": 0.38474531173706056, "num_input_tokens_seen": 13006771584, "step": 45740, "train_runtime": 444685.5909, "train_tokens_per_second": 29249.366 }, { "epoch": 1.6187254951825158, "grad_norm": 0.60546875, "learning_rate": 2.1176367417810754e-05, "loss": 0.38822102546691895, "num_input_tokens_seen": 13009608512, "step": 45750, "train_runtime": 444782.9026, "train_tokens_per_second": 29249.345 }, { "epoch": 1.6190793154462448, "grad_norm": 0.6328125, "learning_rate": 2.1174468413438138e-05, "loss": 0.39193115234375, "num_input_tokens_seen": 13012532928, "step": 45760, "train_runtime": 444885.5319, "train_tokens_per_second": 29249.171 }, { "epoch": 1.6194331357099734, "grad_norm": 0.60546875, "learning_rate": 2.1172569919857225e-05, "loss": 0.38861267566680907, "num_input_tokens_seen": 13015375424, "step": 45770, "train_runtime": 444982.4495, "train_tokens_per_second": 29249.188 }, { "epoch": 1.6197869559737024, "grad_norm": 0.640625, "learning_rate": 2.117067193683907e-05, "loss": 0.3913105487823486, "num_input_tokens_seen": 13018198976, "step": 45780, "train_runtime": 445077.6808, "train_tokens_per_second": 29249.274 }, { "epoch": 1.6201407762374311, "grad_norm": 0.60546875, "learning_rate": 2.1168774464154877e-05, "loss": 0.3899451732635498, "num_input_tokens_seen": 13021067456, "step": 45790, "train_runtime": 445175.8421, "train_tokens_per_second": 29249.268 }, { "epoch": 1.62049459650116, "grad_norm": 0.578125, "learning_rate": 2.116687750157598e-05, "loss": 0.38467795848846437, "num_input_tokens_seen": 13023915008, "step": 45800, "train_runtime": 445275.6805, "train_tokens_per_second": 29249.105 }, { "epoch": 1.6208484167648887, "grad_norm": 0.625, "learning_rate": 2.116498104887387e-05, "loss": 0.38592872619628904, "num_input_tokens_seen": 13026771648, "step": 45810, "train_runtime": 445374.3353, "train_tokens_per_second": 29249.04 }, { "epoch": 1.6212022370286174, "grad_norm": 0.59375, "learning_rate": 2.1163085105820175e-05, "loss": 0.3860755681991577, "num_input_tokens_seen": 13029592256, "step": 45820, "train_runtime": 445469.7779, "train_tokens_per_second": 29249.105 }, { "epoch": 1.6215560572923462, "grad_norm": 0.625, "learning_rate": 2.116118967218666e-05, "loss": 0.38577728271484374, "num_input_tokens_seen": 13032440768, "step": 45830, "train_runtime": 445566.9765, "train_tokens_per_second": 29249.117 }, { "epoch": 1.621909877556075, "grad_norm": 0.62109375, "learning_rate": 2.115929474774525e-05, "loss": 0.38961329460144045, "num_input_tokens_seen": 13035298816, "step": 45840, "train_runtime": 445662.474, "train_tokens_per_second": 29249.263 }, { "epoch": 1.6222636978198037, "grad_norm": 0.59765625, "learning_rate": 2.1157400332267988e-05, "loss": 0.3902440071105957, "num_input_tokens_seen": 13038126784, "step": 45850, "train_runtime": 445758.477, "train_tokens_per_second": 29249.308 }, { "epoch": 1.6226175180835325, "grad_norm": 0.60546875, "learning_rate": 2.1155506425527083e-05, "loss": 0.3902561187744141, "num_input_tokens_seen": 13040989568, "step": 45860, "train_runtime": 445854.7956, "train_tokens_per_second": 29249.41 }, { "epoch": 1.6229713383472615, "grad_norm": 0.625, "learning_rate": 2.115361302729488e-05, "loss": 0.3927320003509521, "num_input_tokens_seen": 13043850432, "step": 45870, "train_runtime": 445953.749, "train_tokens_per_second": 29249.335 }, { "epoch": 1.62332515861099, "grad_norm": 0.6171875, "learning_rate": 2.115172013734386e-05, "loss": 0.38945329189300537, "num_input_tokens_seen": 13046672512, "step": 45880, "train_runtime": 446049.2243, "train_tokens_per_second": 29249.401 }, { "epoch": 1.623678978874719, "grad_norm": 0.6171875, "learning_rate": 2.1149827755446652e-05, "loss": 0.3876248836517334, "num_input_tokens_seen": 13049484224, "step": 45890, "train_runtime": 446147.7794, "train_tokens_per_second": 29249.242 }, { "epoch": 1.6240327991384476, "grad_norm": 0.59375, "learning_rate": 2.1147935881376024e-05, "loss": 0.3892193794250488, "num_input_tokens_seen": 13052268352, "step": 45900, "train_runtime": 446238.3939, "train_tokens_per_second": 29249.541 }, { "epoch": 1.6243866194021765, "grad_norm": 0.60546875, "learning_rate": 2.114604451490489e-05, "loss": 0.3882743835449219, "num_input_tokens_seen": 13055154752, "step": 45910, "train_runtime": 446336.3084, "train_tokens_per_second": 29249.592 }, { "epoch": 1.624740439665905, "grad_norm": 0.58203125, "learning_rate": 2.1144153655806313e-05, "loss": 0.3892354011535645, "num_input_tokens_seen": 13058002880, "step": 45920, "train_runtime": 446432.8786, "train_tokens_per_second": 29249.644 }, { "epoch": 1.625094259929634, "grad_norm": 0.59375, "learning_rate": 2.114226330385347e-05, "loss": 0.38631439208984375, "num_input_tokens_seen": 13060896256, "step": 45930, "train_runtime": 446534.7978, "train_tokens_per_second": 29249.448 }, { "epoch": 1.6254480801933626, "grad_norm": 0.59765625, "learning_rate": 2.1140373458819724e-05, "loss": 0.3903128862380981, "num_input_tokens_seen": 13063714752, "step": 45940, "train_runtime": 446634.0336, "train_tokens_per_second": 29249.26 }, { "epoch": 1.6258019004570916, "grad_norm": 0.62890625, "learning_rate": 2.1138484120478535e-05, "loss": 0.38848493099212644, "num_input_tokens_seen": 13066550336, "step": 45950, "train_runtime": 446728.5558, "train_tokens_per_second": 29249.418 }, { "epoch": 1.6261557207208204, "grad_norm": 0.59375, "learning_rate": 2.1136595288603532e-05, "loss": 0.3935427188873291, "num_input_tokens_seen": 13069404032, "step": 45960, "train_runtime": 446830.6119, "train_tokens_per_second": 29249.124 }, { "epoch": 1.6265095409845491, "grad_norm": 0.62890625, "learning_rate": 2.113470696296849e-05, "loss": 0.3888894319534302, "num_input_tokens_seen": 13072281472, "step": 45970, "train_runtime": 446928.6995, "train_tokens_per_second": 29249.143 }, { "epoch": 1.626863361248278, "grad_norm": 0.6015625, "learning_rate": 2.1132819143347296e-05, "loss": 0.39215869903564454, "num_input_tokens_seen": 13075117376, "step": 45980, "train_runtime": 447027.062, "train_tokens_per_second": 29249.051 }, { "epoch": 1.6272171815120067, "grad_norm": 0.61328125, "learning_rate": 2.1130931829514005e-05, "loss": 0.38678665161132814, "num_input_tokens_seen": 13077915200, "step": 45990, "train_runtime": 447120.9937, "train_tokens_per_second": 29249.164 }, { "epoch": 1.6275710017757354, "grad_norm": 0.61328125, "learning_rate": 2.112904502124281e-05, "loss": 0.39141292572021485, "num_input_tokens_seen": 13080718592, "step": 46000, "train_runtime": 447215.0943, "train_tokens_per_second": 29249.278 }, { "epoch": 1.6279248220394642, "grad_norm": 0.60546875, "learning_rate": 2.112715871830803e-05, "loss": 0.38442325592041016, "num_input_tokens_seen": 13083587968, "step": 46010, "train_runtime": 447313.7075, "train_tokens_per_second": 29249.244 }, { "epoch": 1.628278642303193, "grad_norm": 0.62890625, "learning_rate": 2.112527292048414e-05, "loss": 0.39490082263946535, "num_input_tokens_seen": 13086399744, "step": 46020, "train_runtime": 447409.6308, "train_tokens_per_second": 29249.258 }, { "epoch": 1.6286324625669217, "grad_norm": 0.609375, "learning_rate": 2.1123387627545748e-05, "loss": 0.3847757339477539, "num_input_tokens_seen": 13089255104, "step": 46030, "train_runtime": 447506.9711, "train_tokens_per_second": 29249.276 }, { "epoch": 1.6289862828306507, "grad_norm": 0.62109375, "learning_rate": 2.112150283926761e-05, "loss": 0.3872460603713989, "num_input_tokens_seen": 13092094592, "step": 46040, "train_runtime": 447605.0378, "train_tokens_per_second": 29249.212 }, { "epoch": 1.6293401030943793, "grad_norm": 0.6015625, "learning_rate": 2.1119618555424612e-05, "loss": 0.3925561666488647, "num_input_tokens_seen": 13094937920, "step": 46050, "train_runtime": 447701.5626, "train_tokens_per_second": 29249.257 }, { "epoch": 1.6296939233581083, "grad_norm": 0.62890625, "learning_rate": 2.1117734775791794e-05, "loss": 0.39198276996612547, "num_input_tokens_seen": 13097787008, "step": 46060, "train_runtime": 447801.6987, "train_tokens_per_second": 29249.078 }, { "epoch": 1.6300477436218368, "grad_norm": 0.6171875, "learning_rate": 2.1115851500144324e-05, "loss": 0.3884898662567139, "num_input_tokens_seen": 13100669632, "step": 46070, "train_runtime": 447903.4452, "train_tokens_per_second": 29248.87 }, { "epoch": 1.6304015638855658, "grad_norm": 0.58984375, "learning_rate": 2.1113968728257516e-05, "loss": 0.3887759208679199, "num_input_tokens_seen": 13103485440, "step": 46080, "train_runtime": 447996.9217, "train_tokens_per_second": 29249.052 }, { "epoch": 1.6307553841492943, "grad_norm": 0.59765625, "learning_rate": 2.1112086459906828e-05, "loss": 0.3887644290924072, "num_input_tokens_seen": 13106362880, "step": 46090, "train_runtime": 448094.9702, "train_tokens_per_second": 29249.074 }, { "epoch": 1.6311092044130233, "grad_norm": 0.625, "learning_rate": 2.1110204694867846e-05, "loss": 0.38816585540771487, "num_input_tokens_seen": 13109184320, "step": 46100, "train_runtime": 448191.558, "train_tokens_per_second": 29249.066 }, { "epoch": 1.6314630246767519, "grad_norm": 0.60546875, "learning_rate": 2.1108323432916305e-05, "loss": 0.3907257080078125, "num_input_tokens_seen": 13111998528, "step": 46110, "train_runtime": 448286.0098, "train_tokens_per_second": 29249.181 }, { "epoch": 1.6318168449404808, "grad_norm": 0.609375, "learning_rate": 2.1106442673828086e-05, "loss": 0.38648648262023927, "num_input_tokens_seen": 13114796928, "step": 46120, "train_runtime": 448381.8918, "train_tokens_per_second": 29249.167 }, { "epoch": 1.6321706652042096, "grad_norm": 0.58203125, "learning_rate": 2.1104562417379202e-05, "loss": 0.38654747009277346, "num_input_tokens_seen": 13117667904, "step": 46130, "train_runtime": 448479.9792, "train_tokens_per_second": 29249.172 }, { "epoch": 1.6325244854679384, "grad_norm": 0.609375, "learning_rate": 2.1102682663345797e-05, "loss": 0.39447746276855467, "num_input_tokens_seen": 13120485824, "step": 46140, "train_runtime": 448578.4906, "train_tokens_per_second": 29249.03 }, { "epoch": 1.6328783057316671, "grad_norm": 0.625, "learning_rate": 2.110080341150417e-05, "loss": 0.3891158580780029, "num_input_tokens_seen": 13123296384, "step": 46150, "train_runtime": 448675.9349, "train_tokens_per_second": 29248.942 }, { "epoch": 1.633232125995396, "grad_norm": 0.64453125, "learning_rate": 2.1098924661630748e-05, "loss": 0.3895108222961426, "num_input_tokens_seen": 13126158592, "step": 46160, "train_runtime": 448773.8159, "train_tokens_per_second": 29248.94 }, { "epoch": 1.6335859462591247, "grad_norm": 0.59375, "learning_rate": 2.109704641350211e-05, "loss": 0.3934329032897949, "num_input_tokens_seen": 13128961920, "step": 46170, "train_runtime": 448868.9857, "train_tokens_per_second": 29248.984 }, { "epoch": 1.6339397665228534, "grad_norm": 0.58203125, "learning_rate": 2.1095168666894962e-05, "loss": 0.3871035099029541, "num_input_tokens_seen": 13131829312, "step": 46180, "train_runtime": 448964.9138, "train_tokens_per_second": 29249.121 }, { "epoch": 1.6342935867865822, "grad_norm": 0.59375, "learning_rate": 2.1093291421586156e-05, "loss": 0.3858203411102295, "num_input_tokens_seen": 13134680704, "step": 46190, "train_runtime": 449064.2398, "train_tokens_per_second": 29249.002 }, { "epoch": 1.634647407050311, "grad_norm": 0.6015625, "learning_rate": 2.1091414677352676e-05, "loss": 0.38942317962646483, "num_input_tokens_seen": 13137536192, "step": 46200, "train_runtime": 449163.3913, "train_tokens_per_second": 29248.902 }, { "epoch": 1.63500122731404, "grad_norm": 0.6171875, "learning_rate": 2.1089538433971655e-05, "loss": 0.38621108531951903, "num_input_tokens_seen": 13140289920, "step": 46210, "train_runtime": 449252.792, "train_tokens_per_second": 29249.211 }, { "epoch": 1.6353550475777685, "grad_norm": 0.58203125, "learning_rate": 2.1087662691220356e-05, "loss": 0.38844685554504393, "num_input_tokens_seen": 13143133696, "step": 46220, "train_runtime": 449352.7402, "train_tokens_per_second": 29249.034 }, { "epoch": 1.6357088678414975, "grad_norm": 0.62109375, "learning_rate": 2.1085787448876184e-05, "loss": 0.38851022720336914, "num_input_tokens_seen": 13145959488, "step": 46230, "train_runtime": 449447.8473, "train_tokens_per_second": 29249.132 }, { "epoch": 1.636062688105226, "grad_norm": 0.61328125, "learning_rate": 2.1083912706716684e-05, "loss": 0.3890007734298706, "num_input_tokens_seen": 13148823552, "step": 46240, "train_runtime": 449546.7192, "train_tokens_per_second": 29249.07 }, { "epoch": 1.636416508368955, "grad_norm": 0.61328125, "learning_rate": 2.108203846451954e-05, "loss": 0.3935135841369629, "num_input_tokens_seen": 13151654272, "step": 46250, "train_runtime": 449641.8274, "train_tokens_per_second": 29249.179 }, { "epoch": 1.6367703286326836, "grad_norm": 0.609375, "learning_rate": 2.1080164722062563e-05, "loss": 0.3888871192932129, "num_input_tokens_seen": 13154499264, "step": 46260, "train_runtime": 449740.3228, "train_tokens_per_second": 29249.099 }, { "epoch": 1.6371241488964126, "grad_norm": 0.59765625, "learning_rate": 2.107829147912372e-05, "loss": 0.38654944896697996, "num_input_tokens_seen": 13157342336, "step": 46270, "train_runtime": 449834.7353, "train_tokens_per_second": 29249.28 }, { "epoch": 1.637477969160141, "grad_norm": 0.59375, "learning_rate": 2.1076418735481103e-05, "loss": 0.3874382019042969, "num_input_tokens_seen": 13160202240, "step": 46280, "train_runtime": 449931.8959, "train_tokens_per_second": 29249.321 }, { "epoch": 1.63783178942387, "grad_norm": 0.59765625, "learning_rate": 2.1074546490912953e-05, "loss": 0.39109230041503906, "num_input_tokens_seen": 13163059008, "step": 46290, "train_runtime": 450026.4284, "train_tokens_per_second": 29249.524 }, { "epoch": 1.6381856096875989, "grad_norm": 0.62109375, "learning_rate": 2.1072674745197633e-05, "loss": 0.3839420318603516, "num_input_tokens_seen": 13165887680, "step": 46300, "train_runtime": 450122.0673, "train_tokens_per_second": 29249.594 }, { "epoch": 1.6385394299513276, "grad_norm": 0.58984375, "learning_rate": 2.1070803498113666e-05, "loss": 0.38668949604034425, "num_input_tokens_seen": 13168763136, "step": 46310, "train_runtime": 450218.0087, "train_tokens_per_second": 29249.748 }, { "epoch": 1.6388932502150564, "grad_norm": 0.640625, "learning_rate": 2.1068932749439683e-05, "loss": 0.38903012275695803, "num_input_tokens_seen": 13171664704, "step": 46320, "train_runtime": 450317.5456, "train_tokens_per_second": 29249.726 }, { "epoch": 1.6392470704787852, "grad_norm": 0.61328125, "learning_rate": 2.106706249895448e-05, "loss": 0.3871425151824951, "num_input_tokens_seen": 13174498368, "step": 46330, "train_runtime": 450411.0583, "train_tokens_per_second": 29249.944 }, { "epoch": 1.639600890742514, "grad_norm": 0.58984375, "learning_rate": 2.1065192746436978e-05, "loss": 0.39148578643798826, "num_input_tokens_seen": 13177369472, "step": 46340, "train_runtime": 450509.897, "train_tokens_per_second": 29249.9 }, { "epoch": 1.6399547110062427, "grad_norm": 0.609375, "learning_rate": 2.1063323491666236e-05, "loss": 0.3871280670166016, "num_input_tokens_seen": 13180198144, "step": 46350, "train_runtime": 450605.6525, "train_tokens_per_second": 29249.962 }, { "epoch": 1.6403085312699714, "grad_norm": 0.65234375, "learning_rate": 2.1061454734421454e-05, "loss": 0.3891870975494385, "num_input_tokens_seen": 13183083840, "step": 46360, "train_runtime": 450706.9556, "train_tokens_per_second": 29249.79 }, { "epoch": 1.6406623515337002, "grad_norm": 0.62109375, "learning_rate": 2.1059586474481964e-05, "loss": 0.3866166353225708, "num_input_tokens_seen": 13185916928, "step": 46370, "train_runtime": 450805.1468, "train_tokens_per_second": 29249.704 }, { "epoch": 1.6410161717974292, "grad_norm": 0.5859375, "learning_rate": 2.1057718711627242e-05, "loss": 0.3884653329849243, "num_input_tokens_seen": 13188786176, "step": 46380, "train_runtime": 450903.0062, "train_tokens_per_second": 29249.719 }, { "epoch": 1.6413699920611577, "grad_norm": 0.6171875, "learning_rate": 2.1055851445636883e-05, "loss": 0.3931423187255859, "num_input_tokens_seen": 13191628032, "step": 46390, "train_runtime": 451005.7145, "train_tokens_per_second": 29249.359 }, { "epoch": 1.6417238123248867, "grad_norm": 0.5859375, "learning_rate": 2.105398467629065e-05, "loss": 0.3949535846710205, "num_input_tokens_seen": 13194503104, "step": 46400, "train_runtime": 451104.3716, "train_tokens_per_second": 29249.335 }, { "epoch": 1.6420776325886153, "grad_norm": 0.65625, "learning_rate": 2.105211840336841e-05, "loss": 0.38668758869171144, "num_input_tokens_seen": 13197430976, "step": 46410, "train_runtime": 451209.5355, "train_tokens_per_second": 29249.007 }, { "epoch": 1.6424314528523443, "grad_norm": 0.62109375, "learning_rate": 2.1050252626650186e-05, "loss": 0.3920552730560303, "num_input_tokens_seen": 13200295744, "step": 46420, "train_runtime": 451308.4595, "train_tokens_per_second": 29248.944 }, { "epoch": 1.6427852731160728, "grad_norm": 0.59375, "learning_rate": 2.104838734591614e-05, "loss": 0.3914467811584473, "num_input_tokens_seen": 13203172032, "step": 46430, "train_runtime": 451407.9919, "train_tokens_per_second": 29248.866 }, { "epoch": 1.6431390933798018, "grad_norm": 0.625, "learning_rate": 2.1046522560946552e-05, "loss": 0.3910368919372559, "num_input_tokens_seen": 13206040256, "step": 46440, "train_runtime": 451507.5691, "train_tokens_per_second": 29248.768 }, { "epoch": 1.6434929136435306, "grad_norm": 0.60546875, "learning_rate": 2.1044658271521856e-05, "loss": 0.3880784034729004, "num_input_tokens_seen": 13208871616, "step": 46450, "train_runtime": 451603.4092, "train_tokens_per_second": 29248.831 }, { "epoch": 1.6438467339072593, "grad_norm": 0.60546875, "learning_rate": 2.1042794477422607e-05, "loss": 0.388734245300293, "num_input_tokens_seen": 13211724224, "step": 46460, "train_runtime": 451701.49, "train_tokens_per_second": 29248.795 }, { "epoch": 1.644200554170988, "grad_norm": 0.62890625, "learning_rate": 2.104093117842952e-05, "loss": 0.3912392854690552, "num_input_tokens_seen": 13214587840, "step": 46470, "train_runtime": 451800.011, "train_tokens_per_second": 29248.755 }, { "epoch": 1.6445543744347169, "grad_norm": 0.62109375, "learning_rate": 2.1039068374323418e-05, "loss": 0.3883832931518555, "num_input_tokens_seen": 13217446528, "step": 46480, "train_runtime": 451897.7304, "train_tokens_per_second": 29248.756 }, { "epoch": 1.6449081946984456, "grad_norm": 0.59765625, "learning_rate": 2.1037206064885274e-05, "loss": 0.3877273082733154, "num_input_tokens_seen": 13220312960, "step": 46490, "train_runtime": 451997.8253, "train_tokens_per_second": 29248.621 }, { "epoch": 1.6452620149621744, "grad_norm": 0.62890625, "learning_rate": 2.1035344249896195e-05, "loss": 0.38761367797851565, "num_input_tokens_seen": 13223205056, "step": 46500, "train_runtime": 452097.2946, "train_tokens_per_second": 29248.583 }, { "epoch": 1.6456158352259032, "grad_norm": 0.6171875, "learning_rate": 2.1033482929137428e-05, "loss": 0.38792369365692136, "num_input_tokens_seen": 13226083584, "step": 46510, "train_runtime": 452198.3255, "train_tokens_per_second": 29248.413 }, { "epoch": 1.645969655489632, "grad_norm": 0.62109375, "learning_rate": 2.1031622102390343e-05, "loss": 0.38866071701049804, "num_input_tokens_seen": 13228925952, "step": 46520, "train_runtime": 452294.3403, "train_tokens_per_second": 29248.489 }, { "epoch": 1.6463234757533607, "grad_norm": 0.6171875, "learning_rate": 2.1029761769436462e-05, "loss": 0.39198248386383056, "num_input_tokens_seen": 13231716608, "step": 46530, "train_runtime": 452389.4176, "train_tokens_per_second": 29248.51 }, { "epoch": 1.6466772960170895, "grad_norm": 0.61328125, "learning_rate": 2.1027901930057424e-05, "loss": 0.38909015655517576, "num_input_tokens_seen": 13234541632, "step": 46540, "train_runtime": 452485.4925, "train_tokens_per_second": 29248.544 }, { "epoch": 1.6470311162808184, "grad_norm": 0.59375, "learning_rate": 2.1026042584035024e-05, "loss": 0.3909201145172119, "num_input_tokens_seen": 13237397568, "step": 46550, "train_runtime": 452583.3906, "train_tokens_per_second": 29248.527 }, { "epoch": 1.647384936544547, "grad_norm": 0.62890625, "learning_rate": 2.102418373115117e-05, "loss": 0.38832712173461914, "num_input_tokens_seen": 13240272896, "step": 46560, "train_runtime": 452682.235, "train_tokens_per_second": 29248.492 }, { "epoch": 1.647738756808276, "grad_norm": 0.6328125, "learning_rate": 2.1022325371187922e-05, "loss": 0.386026930809021, "num_input_tokens_seen": 13243127168, "step": 46570, "train_runtime": 452779.1908, "train_tokens_per_second": 29248.533 }, { "epoch": 1.6480925770720045, "grad_norm": 0.58984375, "learning_rate": 2.102046750392747e-05, "loss": 0.3893928527832031, "num_input_tokens_seen": 13245971712, "step": 46580, "train_runtime": 452875.5863, "train_tokens_per_second": 29248.589 }, { "epoch": 1.6484463973357335, "grad_norm": 0.60546875, "learning_rate": 2.1018610129152124e-05, "loss": 0.3930018901824951, "num_input_tokens_seen": 13248825600, "step": 46590, "train_runtime": 452975.5923, "train_tokens_per_second": 29248.432 }, { "epoch": 1.648800217599462, "grad_norm": 0.59765625, "learning_rate": 2.101675324664436e-05, "loss": 0.3875734806060791, "num_input_tokens_seen": 13251676864, "step": 46600, "train_runtime": 453070.9867, "train_tokens_per_second": 29248.566 }, { "epoch": 1.649154037863191, "grad_norm": 0.59765625, "learning_rate": 2.101489685618676e-05, "loss": 0.38723509311676024, "num_input_tokens_seen": 13254531008, "step": 46610, "train_runtime": 453168.4579, "train_tokens_per_second": 29248.574 }, { "epoch": 1.6495078581269198, "grad_norm": 0.6328125, "learning_rate": 2.1013040957562053e-05, "loss": 0.3871634006500244, "num_input_tokens_seen": 13257378880, "step": 46620, "train_runtime": 453265.9474, "train_tokens_per_second": 29248.566 }, { "epoch": 1.6498616783906486, "grad_norm": 0.62109375, "learning_rate": 2.1011185550553098e-05, "loss": 0.38614802360534667, "num_input_tokens_seen": 13260264704, "step": 46630, "train_runtime": 453363.3088, "train_tokens_per_second": 29248.65 }, { "epoch": 1.6502154986543773, "grad_norm": 0.61328125, "learning_rate": 2.1009330634942888e-05, "loss": 0.3922013759613037, "num_input_tokens_seen": 13263092864, "step": 46640, "train_runtime": 453458.5091, "train_tokens_per_second": 29248.746 }, { "epoch": 1.650569318918106, "grad_norm": 0.59375, "learning_rate": 2.1007476210514558e-05, "loss": 0.3882549524307251, "num_input_tokens_seen": 13265986880, "step": 46650, "train_runtime": 453557.7782, "train_tokens_per_second": 29248.725 }, { "epoch": 1.6509231391818349, "grad_norm": 0.6171875, "learning_rate": 2.1005622277051373e-05, "loss": 0.38733229637145994, "num_input_tokens_seen": 13268831936, "step": 46660, "train_runtime": 453654.8428, "train_tokens_per_second": 29248.739 }, { "epoch": 1.6512769594455636, "grad_norm": 0.6171875, "learning_rate": 2.1003768834336722e-05, "loss": 0.38726320266723635, "num_input_tokens_seen": 13271678208, "step": 46670, "train_runtime": 453753.74, "train_tokens_per_second": 29248.637 }, { "epoch": 1.6516307797092924, "grad_norm": 0.609375, "learning_rate": 2.100191588215414e-05, "loss": 0.3897682189941406, "num_input_tokens_seen": 13274531392, "step": 46680, "train_runtime": 453852.5892, "train_tokens_per_second": 29248.553 }, { "epoch": 1.6519845999730212, "grad_norm": 0.59375, "learning_rate": 2.1000063420287294e-05, "loss": 0.390595817565918, "num_input_tokens_seen": 13277452096, "step": 46690, "train_runtime": 453953.6452, "train_tokens_per_second": 29248.476 }, { "epoch": 1.6523384202367501, "grad_norm": 0.59765625, "learning_rate": 2.0998211448519977e-05, "loss": 0.38735337257385255, "num_input_tokens_seen": 13280262400, "step": 46700, "train_runtime": 454048.711, "train_tokens_per_second": 29248.541 }, { "epoch": 1.6526922405004787, "grad_norm": 0.5859375, "learning_rate": 2.0996359966636126e-05, "loss": 0.38974733352661134, "num_input_tokens_seen": 13283095104, "step": 46710, "train_runtime": 454145.5845, "train_tokens_per_second": 29248.54 }, { "epoch": 1.6530460607642077, "grad_norm": 0.62109375, "learning_rate": 2.0994508974419803e-05, "loss": 0.38871474266052247, "num_input_tokens_seen": 13285955648, "step": 46720, "train_runtime": 454245.3277, "train_tokens_per_second": 29248.415 }, { "epoch": 1.6533998810279362, "grad_norm": 0.625, "learning_rate": 2.0992658471655204e-05, "loss": 0.38708810806274413, "num_input_tokens_seen": 13288854080, "step": 46730, "train_runtime": 454344.7538, "train_tokens_per_second": 29248.393 }, { "epoch": 1.6537537012916652, "grad_norm": 0.60546875, "learning_rate": 2.099080845812666e-05, "loss": 0.38606536388397217, "num_input_tokens_seen": 13291678272, "step": 46740, "train_runtime": 454441.144, "train_tokens_per_second": 29248.404 }, { "epoch": 1.6541075215553938, "grad_norm": 0.640625, "learning_rate": 2.0988958933618644e-05, "loss": 0.38857297897338866, "num_input_tokens_seen": 13294490624, "step": 46750, "train_runtime": 454534.9157, "train_tokens_per_second": 29248.558 }, { "epoch": 1.6544613418191227, "grad_norm": 0.6171875, "learning_rate": 2.0987109897915743e-05, "loss": 0.3870939493179321, "num_input_tokens_seen": 13297313344, "step": 46760, "train_runtime": 454628.9877, "train_tokens_per_second": 29248.714 }, { "epoch": 1.6548151620828513, "grad_norm": 0.62109375, "learning_rate": 2.098526135080269e-05, "loss": 0.38361668586730957, "num_input_tokens_seen": 13300200448, "step": 46770, "train_runtime": 454731.5799, "train_tokens_per_second": 29248.464 }, { "epoch": 1.6551689823465803, "grad_norm": 0.65234375, "learning_rate": 2.098341329206435e-05, "loss": 0.3892812728881836, "num_input_tokens_seen": 13303008704, "step": 46780, "train_runtime": 454828.0272, "train_tokens_per_second": 29248.437 }, { "epoch": 1.655522802610309, "grad_norm": 0.625, "learning_rate": 2.0981565721485717e-05, "loss": 0.38861937522888185, "num_input_tokens_seen": 13305876544, "step": 46790, "train_runtime": 454926.9153, "train_tokens_per_second": 29248.383 }, { "epoch": 1.6558766228740378, "grad_norm": 0.58203125, "learning_rate": 2.097971863885191e-05, "loss": 0.38390097618103025, "num_input_tokens_seen": 13308730368, "step": 46800, "train_runtime": 455024.6788, "train_tokens_per_second": 29248.37 }, { "epoch": 1.6562304431377666, "grad_norm": 0.6171875, "learning_rate": 2.0977872043948204e-05, "loss": 0.3919650077819824, "num_input_tokens_seen": 13311532672, "step": 46810, "train_runtime": 455119.1797, "train_tokens_per_second": 29248.455 }, { "epoch": 1.6565842634014953, "grad_norm": 0.60546875, "learning_rate": 2.0976025936559985e-05, "loss": 0.3910619497299194, "num_input_tokens_seen": 13314393216, "step": 46820, "train_runtime": 455217.2855, "train_tokens_per_second": 29248.435 }, { "epoch": 1.656938083665224, "grad_norm": 0.6640625, "learning_rate": 2.0974180316472775e-05, "loss": 0.38962488174438475, "num_input_tokens_seen": 13317245120, "step": 46830, "train_runtime": 455315.2829, "train_tokens_per_second": 29248.404 }, { "epoch": 1.6572919039289529, "grad_norm": 0.59765625, "learning_rate": 2.097233518347223e-05, "loss": 0.3907878875732422, "num_input_tokens_seen": 13320087360, "step": 46840, "train_runtime": 455409.8375, "train_tokens_per_second": 29248.572 }, { "epoch": 1.6576457241926816, "grad_norm": 0.61328125, "learning_rate": 2.0970490537344147e-05, "loss": 0.3881929874420166, "num_input_tokens_seen": 13322951360, "step": 46850, "train_runtime": 455508.4169, "train_tokens_per_second": 29248.529 }, { "epoch": 1.6579995444564104, "grad_norm": 0.6015625, "learning_rate": 2.096864637787444e-05, "loss": 0.38553380966186523, "num_input_tokens_seen": 13325792384, "step": 46860, "train_runtime": 455607.6401, "train_tokens_per_second": 29248.395 }, { "epoch": 1.6583533647201394, "grad_norm": 0.6015625, "learning_rate": 2.0966802704849163e-05, "loss": 0.3898475170135498, "num_input_tokens_seen": 13328666816, "step": 46870, "train_runtime": 455707.071, "train_tokens_per_second": 29248.321 }, { "epoch": 1.658707184983868, "grad_norm": 0.6015625, "learning_rate": 2.0964959518054493e-05, "loss": 0.39019615650177003, "num_input_tokens_seen": 13331439104, "step": 46880, "train_runtime": 455799.4746, "train_tokens_per_second": 29248.474 }, { "epoch": 1.659061005247597, "grad_norm": 0.59375, "learning_rate": 2.0963116817276757e-05, "loss": 0.3866535425186157, "num_input_tokens_seen": 13334280384, "step": 46890, "train_runtime": 455898.4874, "train_tokens_per_second": 29248.354 }, { "epoch": 1.6594148255113255, "grad_norm": 0.6171875, "learning_rate": 2.09612746023024e-05, "loss": 0.3936209201812744, "num_input_tokens_seen": 13337033728, "step": 46900, "train_runtime": 455989.5888, "train_tokens_per_second": 29248.549 }, { "epoch": 1.6597686457750545, "grad_norm": 0.59765625, "learning_rate": 2.095943287291799e-05, "loss": 0.38361918926239014, "num_input_tokens_seen": 13339911232, "step": 46910, "train_runtime": 456089.4049, "train_tokens_per_second": 29248.457 }, { "epoch": 1.660122466038783, "grad_norm": 0.6171875, "learning_rate": 2.0957591628910243e-05, "loss": 0.3843294382095337, "num_input_tokens_seen": 13342779200, "step": 46920, "train_runtime": 456187.6947, "train_tokens_per_second": 29248.442 }, { "epoch": 1.660476286302512, "grad_norm": 0.6015625, "learning_rate": 2.0955750870066006e-05, "loss": 0.3919475555419922, "num_input_tokens_seen": 13345669440, "step": 46930, "train_runtime": 456286.4408, "train_tokens_per_second": 29248.446 }, { "epoch": 1.6608301065662405, "grad_norm": 0.6015625, "learning_rate": 2.0953910596172238e-05, "loss": 0.38295903205871584, "num_input_tokens_seen": 13348459328, "step": 46940, "train_runtime": 456381.235, "train_tokens_per_second": 29248.484 }, { "epoch": 1.6611839268299695, "grad_norm": 0.61328125, "learning_rate": 2.095207080701605e-05, "loss": 0.388715934753418, "num_input_tokens_seen": 13351299712, "step": 46950, "train_runtime": 456481.3803, "train_tokens_per_second": 29248.29 }, { "epoch": 1.6615377470936983, "grad_norm": 0.6171875, "learning_rate": 2.095023150238468e-05, "loss": 0.3895021200180054, "num_input_tokens_seen": 13354214464, "step": 46960, "train_runtime": 456580.4923, "train_tokens_per_second": 29248.325 }, { "epoch": 1.661891567357427, "grad_norm": 0.64453125, "learning_rate": 2.094839268206548e-05, "loss": 0.39182310104370116, "num_input_tokens_seen": 13357048896, "step": 46970, "train_runtime": 456675.9918, "train_tokens_per_second": 29248.415 }, { "epoch": 1.6622453876211558, "grad_norm": 0.6171875, "learning_rate": 2.094655434584595e-05, "loss": 0.3866722583770752, "num_input_tokens_seen": 13359905216, "step": 46980, "train_runtime": 456772.4087, "train_tokens_per_second": 29248.494 }, { "epoch": 1.6625992078848846, "grad_norm": 0.64453125, "learning_rate": 2.0944716493513714e-05, "loss": 0.38572053909301757, "num_input_tokens_seen": 13362752320, "step": 46990, "train_runtime": 456872.7681, "train_tokens_per_second": 29248.301 }, { "epoch": 1.6629530281486133, "grad_norm": 0.625, "learning_rate": 2.0942879124856534e-05, "loss": 0.3886034727096558, "num_input_tokens_seen": 13365596352, "step": 47000, "train_runtime": 456970.1335, "train_tokens_per_second": 29248.293 }, { "epoch": 1.663306848412342, "grad_norm": 0.609375, "learning_rate": 2.094104223966229e-05, "loss": 0.39440786838531494, "num_input_tokens_seen": 13368435264, "step": 47010, "train_runtime": 457070.1147, "train_tokens_per_second": 29248.106 }, { "epoch": 1.6636606686760709, "grad_norm": 0.59375, "learning_rate": 2.0939205837719e-05, "loss": 0.3892618179321289, "num_input_tokens_seen": 13371336128, "step": 47020, "train_runtime": 457170.7487, "train_tokens_per_second": 29248.013 }, { "epoch": 1.6640144889397996, "grad_norm": 0.609375, "learning_rate": 2.093736991881481e-05, "loss": 0.3866738796234131, "num_input_tokens_seen": 13374194624, "step": 47030, "train_runtime": 457268.1129, "train_tokens_per_second": 29248.037 }, { "epoch": 1.6643683092035286, "grad_norm": 0.59765625, "learning_rate": 2.0935534482737994e-05, "loss": 0.3849113941192627, "num_input_tokens_seen": 13377049408, "step": 47040, "train_runtime": 457367.2466, "train_tokens_per_second": 29247.939 }, { "epoch": 1.6647221294672572, "grad_norm": 0.6171875, "learning_rate": 2.0933699529276963e-05, "loss": 0.3889256238937378, "num_input_tokens_seen": 13379879360, "step": 47050, "train_runtime": 457466.1342, "train_tokens_per_second": 29247.803 }, { "epoch": 1.6650759497309862, "grad_norm": 0.60546875, "learning_rate": 2.093186505822025e-05, "loss": 0.38730587959289553, "num_input_tokens_seen": 13382698880, "step": 47060, "train_runtime": 457560.5806, "train_tokens_per_second": 29247.928 }, { "epoch": 1.6654297699947147, "grad_norm": 0.61328125, "learning_rate": 2.093003106935652e-05, "loss": 0.3923827648162842, "num_input_tokens_seen": 13385529024, "step": 47070, "train_runtime": 457654.9817, "train_tokens_per_second": 29248.079 }, { "epoch": 1.6657835902584437, "grad_norm": 0.62109375, "learning_rate": 2.0928197562474576e-05, "loss": 0.39537787437438965, "num_input_tokens_seen": 13388344192, "step": 47080, "train_runtime": 457750.8909, "train_tokens_per_second": 29248.101 }, { "epoch": 1.6661374105221722, "grad_norm": 0.625, "learning_rate": 2.0926364537363328e-05, "loss": 0.3837417125701904, "num_input_tokens_seen": 13391186560, "step": 47090, "train_runtime": 457846.9027, "train_tokens_per_second": 29248.175 }, { "epoch": 1.6664912307859012, "grad_norm": 0.61328125, "learning_rate": 2.0924531993811842e-05, "loss": 0.39069561958312987, "num_input_tokens_seen": 13393996416, "step": 47100, "train_runtime": 457940.1759, "train_tokens_per_second": 29248.354 }, { "epoch": 1.6668450510496298, "grad_norm": 0.59375, "learning_rate": 2.0922699931609298e-05, "loss": 0.390627384185791, "num_input_tokens_seen": 13396853760, "step": 47110, "train_runtime": 458039.7808, "train_tokens_per_second": 29248.232 }, { "epoch": 1.6671988713133588, "grad_norm": 0.61328125, "learning_rate": 2.092086835054501e-05, "loss": 0.3899845123291016, "num_input_tokens_seen": 13399712064, "step": 47120, "train_runtime": 458141.0149, "train_tokens_per_second": 29248.008 }, { "epoch": 1.6675526915770875, "grad_norm": 0.62890625, "learning_rate": 2.0919037250408417e-05, "loss": 0.39252281188964844, "num_input_tokens_seen": 13402605056, "step": 47130, "train_runtime": 458243.2845, "train_tokens_per_second": 29247.794 }, { "epoch": 1.6679065118408163, "grad_norm": 0.60546875, "learning_rate": 2.0917206630989093e-05, "loss": 0.3857570171356201, "num_input_tokens_seen": 13405434112, "step": 47140, "train_runtime": 458338.0847, "train_tokens_per_second": 29247.917 }, { "epoch": 1.668260332104545, "grad_norm": 0.62109375, "learning_rate": 2.0915376492076734e-05, "loss": 0.3930667400360107, "num_input_tokens_seen": 13408317248, "step": 47150, "train_runtime": 458437.5575, "train_tokens_per_second": 29247.859 }, { "epoch": 1.6686141523682738, "grad_norm": 0.60546875, "learning_rate": 2.0913546833461167e-05, "loss": 0.38636794090271, "num_input_tokens_seen": 13411214528, "step": 47160, "train_runtime": 458536.2124, "train_tokens_per_second": 29247.885 }, { "epoch": 1.6689679726320026, "grad_norm": 0.6015625, "learning_rate": 2.0911717654932358e-05, "loss": 0.39260072708129884, "num_input_tokens_seen": 13414142848, "step": 47170, "train_runtime": 458637.8854, "train_tokens_per_second": 29247.786 }, { "epoch": 1.6693217928957313, "grad_norm": 0.61328125, "learning_rate": 2.0909888956280382e-05, "loss": 0.3901290655136108, "num_input_tokens_seen": 13416974656, "step": 47180, "train_runtime": 458736.3746, "train_tokens_per_second": 29247.68 }, { "epoch": 1.6696756131594601, "grad_norm": 0.59765625, "learning_rate": 2.0908060737295463e-05, "loss": 0.388273024559021, "num_input_tokens_seen": 13419807360, "step": 47190, "train_runtime": 458834.9417, "train_tokens_per_second": 29247.571 }, { "epoch": 1.6700294334231889, "grad_norm": 0.6328125, "learning_rate": 2.0906232997767933e-05, "loss": 0.3891755104064941, "num_input_tokens_seen": 13422652160, "step": 47200, "train_runtime": 458933.3821, "train_tokens_per_second": 29247.496 }, { "epoch": 1.6703832536869179, "grad_norm": 0.58984375, "learning_rate": 2.0904405737488273e-05, "loss": 0.3939460515975952, "num_input_tokens_seen": 13425501952, "step": 47210, "train_runtime": 459031.8822, "train_tokens_per_second": 29247.428 }, { "epoch": 1.6707370739506464, "grad_norm": 0.59375, "learning_rate": 2.0902578956247073e-05, "loss": 0.3910306453704834, "num_input_tokens_seen": 13428351808, "step": 47220, "train_runtime": 459127.969, "train_tokens_per_second": 29247.514 }, { "epoch": 1.6710908942143754, "grad_norm": 0.6328125, "learning_rate": 2.090075265383507e-05, "loss": 0.38813965320587157, "num_input_tokens_seen": 13431173376, "step": 47230, "train_runtime": 459222.3928, "train_tokens_per_second": 29247.645 }, { "epoch": 1.671444714478104, "grad_norm": 0.6171875, "learning_rate": 2.0898926830043105e-05, "loss": 0.38821945190429685, "num_input_tokens_seen": 13434019200, "step": 47240, "train_runtime": 459322.2859, "train_tokens_per_second": 29247.48 }, { "epoch": 1.671798534741833, "grad_norm": 0.59765625, "learning_rate": 2.0897101484662172e-05, "loss": 0.38429558277130127, "num_input_tokens_seen": 13436852224, "step": 47250, "train_runtime": 459418.4656, "train_tokens_per_second": 29247.523 }, { "epoch": 1.6721523550055615, "grad_norm": 0.6015625, "learning_rate": 2.0895276617483384e-05, "loss": 0.3929542779922485, "num_input_tokens_seen": 13439749248, "step": 47260, "train_runtime": 459520.6449, "train_tokens_per_second": 29247.324 }, { "epoch": 1.6725061752692905, "grad_norm": 0.640625, "learning_rate": 2.089345222829797e-05, "loss": 0.3935800552368164, "num_input_tokens_seen": 13442612416, "step": 47270, "train_runtime": 459623.1406, "train_tokens_per_second": 29247.031 }, { "epoch": 1.672859995533019, "grad_norm": 0.6015625, "learning_rate": 2.0891628316897297e-05, "loss": 0.3896228075027466, "num_input_tokens_seen": 13445467136, "step": 47280, "train_runtime": 459720.5324, "train_tokens_per_second": 29247.045 }, { "epoch": 1.673213815796748, "grad_norm": 0.6328125, "learning_rate": 2.0889804883072863e-05, "loss": 0.38893582820892336, "num_input_tokens_seen": 13448285184, "step": 47290, "train_runtime": 459813.4449, "train_tokens_per_second": 29247.264 }, { "epoch": 1.6735676360604768, "grad_norm": 0.6171875, "learning_rate": 2.088798192661629e-05, "loss": 0.3861669063568115, "num_input_tokens_seen": 13451164352, "step": 47300, "train_runtime": 459914.6584, "train_tokens_per_second": 29247.088 }, { "epoch": 1.6739214563242055, "grad_norm": 0.60546875, "learning_rate": 2.0886159447319314e-05, "loss": 0.3862429618835449, "num_input_tokens_seen": 13453996416, "step": 47310, "train_runtime": 460007.9611, "train_tokens_per_second": 29247.312 }, { "epoch": 1.6742752765879343, "grad_norm": 0.62890625, "learning_rate": 2.0884337444973824e-05, "loss": 0.3916969060897827, "num_input_tokens_seen": 13456834240, "step": 47320, "train_runtime": 460107.4836, "train_tokens_per_second": 29247.154 }, { "epoch": 1.674629096851663, "grad_norm": 0.60546875, "learning_rate": 2.088251591937182e-05, "loss": 0.3888957977294922, "num_input_tokens_seen": 13459677824, "step": 47330, "train_runtime": 460202.2009, "train_tokens_per_second": 29247.313 }, { "epoch": 1.6749829171153918, "grad_norm": 0.59375, "learning_rate": 2.0880694870305427e-05, "loss": 0.3945812702178955, "num_input_tokens_seen": 13462523200, "step": 47340, "train_runtime": 460297.2586, "train_tokens_per_second": 29247.455 }, { "epoch": 1.6753367373791206, "grad_norm": 0.61328125, "learning_rate": 2.08788742975669e-05, "loss": 0.3929840087890625, "num_input_tokens_seen": 13465363840, "step": 47350, "train_runtime": 460393.4131, "train_tokens_per_second": 29247.516 }, { "epoch": 1.6756905576428494, "grad_norm": 0.61328125, "learning_rate": 2.0877054200948624e-05, "loss": 0.38920021057128906, "num_input_tokens_seen": 13468191488, "step": 47360, "train_runtime": 460488.8508, "train_tokens_per_second": 29247.595 }, { "epoch": 1.6760443779065781, "grad_norm": 0.60546875, "learning_rate": 2.08752345802431e-05, "loss": 0.3889219522476196, "num_input_tokens_seen": 13471042048, "step": 47370, "train_runtime": 460586.2864, "train_tokens_per_second": 29247.597 }, { "epoch": 1.676398198170307, "grad_norm": 0.58203125, "learning_rate": 2.0873415435242988e-05, "loss": 0.3904151201248169, "num_input_tokens_seen": 13473888448, "step": 47380, "train_runtime": 460683.149, "train_tokens_per_second": 29247.626 }, { "epoch": 1.6767520184340357, "grad_norm": 0.60546875, "learning_rate": 2.087159676574102e-05, "loss": 0.39035844802856445, "num_input_tokens_seen": 13476737984, "step": 47390, "train_runtime": 460780.1048, "train_tokens_per_second": 29247.656 }, { "epoch": 1.6771058386977646, "grad_norm": 0.6171875, "learning_rate": 2.086977857153011e-05, "loss": 0.388238525390625, "num_input_tokens_seen": 13479566400, "step": 47400, "train_runtime": 460876.8322, "train_tokens_per_second": 29247.655 }, { "epoch": 1.6774596589614932, "grad_norm": 0.609375, "learning_rate": 2.086796085240326e-05, "loss": 0.38954696655273435, "num_input_tokens_seen": 13482357696, "step": 47410, "train_runtime": 460972.0755, "train_tokens_per_second": 29247.667 }, { "epoch": 1.6778134792252222, "grad_norm": 0.6171875, "learning_rate": 2.0866143608153614e-05, "loss": 0.387572717666626, "num_input_tokens_seen": 13485198336, "step": 47420, "train_runtime": 461070.4873, "train_tokens_per_second": 29247.585 }, { "epoch": 1.6781672994889507, "grad_norm": 0.625, "learning_rate": 2.086432683857444e-05, "loss": 0.39342925548553465, "num_input_tokens_seen": 13488037952, "step": 47430, "train_runtime": 461167.6907, "train_tokens_per_second": 29247.578 }, { "epoch": 1.6785211197526797, "grad_norm": 0.625, "learning_rate": 2.0862510543459127e-05, "loss": 0.389902925491333, "num_input_tokens_seen": 13490893952, "step": 47440, "train_runtime": 461263.9646, "train_tokens_per_second": 29247.665 }, { "epoch": 1.6788749400164085, "grad_norm": 0.58984375, "learning_rate": 2.0860694722601197e-05, "loss": 0.38869054317474366, "num_input_tokens_seen": 13493688384, "step": 47450, "train_runtime": 461358.8109, "train_tokens_per_second": 29247.709 }, { "epoch": 1.6792287602801372, "grad_norm": 0.59765625, "learning_rate": 2.0858879375794306e-05, "loss": 0.38864936828613283, "num_input_tokens_seen": 13496522752, "step": 47460, "train_runtime": 461455.8821, "train_tokens_per_second": 29247.699 }, { "epoch": 1.679582580543866, "grad_norm": 0.6015625, "learning_rate": 2.0857064502832207e-05, "loss": 0.392928409576416, "num_input_tokens_seen": 13499400384, "step": 47470, "train_runtime": 461557.7966, "train_tokens_per_second": 29247.476 }, { "epoch": 1.6799364008075948, "grad_norm": 0.60546875, "learning_rate": 2.0855250103508805e-05, "loss": 0.38923797607421873, "num_input_tokens_seen": 13502198976, "step": 47480, "train_runtime": 461651.2542, "train_tokens_per_second": 29247.617 }, { "epoch": 1.6802902210713235, "grad_norm": 0.59375, "learning_rate": 2.085343617761812e-05, "loss": 0.38673949241638184, "num_input_tokens_seen": 13505095424, "step": 47490, "train_runtime": 461752.7296, "train_tokens_per_second": 29247.462 }, { "epoch": 1.6806440413350523, "grad_norm": 0.609375, "learning_rate": 2.08516227249543e-05, "loss": 0.3887539625167847, "num_input_tokens_seen": 13507979072, "step": 47500, "train_runtime": 461851.8082, "train_tokens_per_second": 29247.431 }, { "epoch": 1.680997861598781, "grad_norm": 0.61328125, "learning_rate": 2.084980974531162e-05, "loss": 0.39057395458221433, "num_input_tokens_seen": 13510811264, "step": 47510, "train_runtime": 461950.3962, "train_tokens_per_second": 29247.32 }, { "epoch": 1.6813516818625098, "grad_norm": 0.6171875, "learning_rate": 2.0847997238484477e-05, "loss": 0.3878222227096558, "num_input_tokens_seen": 13513655808, "step": 47520, "train_runtime": 462044.0756, "train_tokens_per_second": 29247.547 }, { "epoch": 1.6817055021262386, "grad_norm": 0.58984375, "learning_rate": 2.084618520426739e-05, "loss": 0.3899877071380615, "num_input_tokens_seen": 13516457088, "step": 47530, "train_runtime": 462139.674, "train_tokens_per_second": 29247.558 }, { "epoch": 1.6820593223899674, "grad_norm": 0.6328125, "learning_rate": 2.0844373642455005e-05, "loss": 0.38895201683044434, "num_input_tokens_seen": 13519269760, "step": 47540, "train_runtime": 462238.1319, "train_tokens_per_second": 29247.413 }, { "epoch": 1.6824131426536963, "grad_norm": 0.58203125, "learning_rate": 2.0842562552842103e-05, "loss": 0.3893259525299072, "num_input_tokens_seen": 13522149376, "step": 47550, "train_runtime": 462335.3976, "train_tokens_per_second": 29247.489 }, { "epoch": 1.682766962917425, "grad_norm": 0.66015625, "learning_rate": 2.0840751935223573e-05, "loss": 0.3897470235824585, "num_input_tokens_seen": 13525025600, "step": 47560, "train_runtime": 462432.3599, "train_tokens_per_second": 29247.576 }, { "epoch": 1.6831207831811539, "grad_norm": 0.61328125, "learning_rate": 2.0838941789394442e-05, "loss": 0.3892627000808716, "num_input_tokens_seen": 13527870528, "step": 47570, "train_runtime": 462528.3003, "train_tokens_per_second": 29247.66 }, { "epoch": 1.6834746034448824, "grad_norm": 0.63671875, "learning_rate": 2.083713211514986e-05, "loss": 0.3881516933441162, "num_input_tokens_seen": 13530731712, "step": 47580, "train_runtime": 462628.8423, "train_tokens_per_second": 29247.488 }, { "epoch": 1.6838284237086114, "grad_norm": 0.61328125, "learning_rate": 2.083532291228509e-05, "loss": 0.3877270698547363, "num_input_tokens_seen": 13533541440, "step": 47590, "train_runtime": 462723.4868, "train_tokens_per_second": 29247.578 }, { "epoch": 1.68418224397234, "grad_norm": 0.6171875, "learning_rate": 2.0833514180595527e-05, "loss": 0.38462152481079104, "num_input_tokens_seen": 13536369920, "step": 47600, "train_runtime": 462821.7333, "train_tokens_per_second": 29247.481 }, { "epoch": 1.684536064236069, "grad_norm": 0.61328125, "learning_rate": 2.08317059198767e-05, "loss": 0.38976967334747314, "num_input_tokens_seen": 13539229248, "step": 47610, "train_runtime": 462919.077, "train_tokens_per_second": 29247.508 }, { "epoch": 1.6848898844997977, "grad_norm": 0.5859375, "learning_rate": 2.0829898129924246e-05, "loss": 0.38527483940124513, "num_input_tokens_seen": 13542116416, "step": 47620, "train_runtime": 463019.6292, "train_tokens_per_second": 29247.392 }, { "epoch": 1.6852437047635265, "grad_norm": 0.609375, "learning_rate": 2.0828090810533936e-05, "loss": 0.3903650760650635, "num_input_tokens_seen": 13544968064, "step": 47630, "train_runtime": 463118.1215, "train_tokens_per_second": 29247.329 }, { "epoch": 1.6855975250272552, "grad_norm": 0.60546875, "learning_rate": 2.0826283961501665e-05, "loss": 0.38622426986694336, "num_input_tokens_seen": 13547780288, "step": 47640, "train_runtime": 463214.1933, "train_tokens_per_second": 29247.334 }, { "epoch": 1.685951345290984, "grad_norm": 0.59375, "learning_rate": 2.0824477582623445e-05, "loss": 0.3926991939544678, "num_input_tokens_seen": 13550642496, "step": 47650, "train_runtime": 463311.4677, "train_tokens_per_second": 29247.371 }, { "epoch": 1.6863051655547128, "grad_norm": 0.59765625, "learning_rate": 2.0822671673695414e-05, "loss": 0.3876538038253784, "num_input_tokens_seen": 13553570048, "step": 47660, "train_runtime": 463411.6836, "train_tokens_per_second": 29247.364 }, { "epoch": 1.6866589858184415, "grad_norm": 0.62109375, "learning_rate": 2.0820866234513844e-05, "loss": 0.39308881759643555, "num_input_tokens_seen": 13556407616, "step": 47670, "train_runtime": 463510.247, "train_tokens_per_second": 29247.266 }, { "epoch": 1.6870128060821703, "grad_norm": 0.62109375, "learning_rate": 2.0819061264875116e-05, "loss": 0.39126613140106203, "num_input_tokens_seen": 13559210688, "step": 47680, "train_runtime": 463602.5828, "train_tokens_per_second": 29247.487 }, { "epoch": 1.687366626345899, "grad_norm": 0.61328125, "learning_rate": 2.0817256764575738e-05, "loss": 0.39210147857666017, "num_input_tokens_seen": 13561989696, "step": 47690, "train_runtime": 463697.3214, "train_tokens_per_second": 29247.505 }, { "epoch": 1.687720446609628, "grad_norm": 0.60546875, "learning_rate": 2.0815452733412354e-05, "loss": 0.3905423641204834, "num_input_tokens_seen": 13564833792, "step": 47700, "train_runtime": 463792.5491, "train_tokens_per_second": 29247.632 }, { "epoch": 1.6880742668733566, "grad_norm": 0.59765625, "learning_rate": 2.081364917118171e-05, "loss": 0.3887256383895874, "num_input_tokens_seen": 13567649856, "step": 47710, "train_runtime": 463886.8042, "train_tokens_per_second": 29247.76 }, { "epoch": 1.6884280871370856, "grad_norm": 0.60546875, "learning_rate": 2.08118460776807e-05, "loss": 0.38867313861846925, "num_input_tokens_seen": 13570492544, "step": 47720, "train_runtime": 463982.3738, "train_tokens_per_second": 29247.862 }, { "epoch": 1.6887819074008141, "grad_norm": 0.58984375, "learning_rate": 2.0810043452706317e-05, "loss": 0.39161770343780516, "num_input_tokens_seen": 13573312896, "step": 47730, "train_runtime": 464077.5377, "train_tokens_per_second": 29247.942 }, { "epoch": 1.6891357276645431, "grad_norm": 0.578125, "learning_rate": 2.08082412960557e-05, "loss": 0.3880011558532715, "num_input_tokens_seen": 13576127424, "step": 47740, "train_runtime": 464171.6178, "train_tokens_per_second": 29248.077 }, { "epoch": 1.6894895479282717, "grad_norm": 0.62109375, "learning_rate": 2.0806439607526085e-05, "loss": 0.39341139793395996, "num_input_tokens_seen": 13578962368, "step": 47750, "train_runtime": 464266.3035, "train_tokens_per_second": 29248.219 }, { "epoch": 1.6898433681920006, "grad_norm": 0.62109375, "learning_rate": 2.0804638386914853e-05, "loss": 0.39020657539367676, "num_input_tokens_seen": 13581805696, "step": 47760, "train_runtime": 464363.7679, "train_tokens_per_second": 29248.203 }, { "epoch": 1.6901971884557292, "grad_norm": 0.62890625, "learning_rate": 2.0802837634019497e-05, "loss": 0.39258518218994143, "num_input_tokens_seen": 13584596864, "step": 47770, "train_runtime": 464458.5562, "train_tokens_per_second": 29248.243 }, { "epoch": 1.6905510087194582, "grad_norm": 0.61328125, "learning_rate": 2.080103734863764e-05, "loss": 0.38879125118255614, "num_input_tokens_seen": 13587456064, "step": 47780, "train_runtime": 464557.3039, "train_tokens_per_second": 29248.181 }, { "epoch": 1.690904828983187, "grad_norm": 0.609375, "learning_rate": 2.0799237530567022e-05, "loss": 0.39292140007019044, "num_input_tokens_seen": 13590344512, "step": 47790, "train_runtime": 464654.547, "train_tokens_per_second": 29248.276 }, { "epoch": 1.6912586492469157, "grad_norm": 0.6015625, "learning_rate": 2.079743817960551e-05, "loss": 0.3895714282989502, "num_input_tokens_seen": 13593122368, "step": 47800, "train_runtime": 464750.6976, "train_tokens_per_second": 29248.202 }, { "epoch": 1.6916124695106445, "grad_norm": 0.59765625, "learning_rate": 2.0795639295551074e-05, "loss": 0.3920772552490234, "num_input_tokens_seen": 13596015680, "step": 47810, "train_runtime": 464849.825, "train_tokens_per_second": 29248.189 }, { "epoch": 1.6919662897743732, "grad_norm": 0.6171875, "learning_rate": 2.0793840878201835e-05, "loss": 0.3850001335144043, "num_input_tokens_seen": 13598832384, "step": 47820, "train_runtime": 464944.5073, "train_tokens_per_second": 29248.291 }, { "epoch": 1.692320110038102, "grad_norm": 0.62890625, "learning_rate": 2.0792042927356023e-05, "loss": 0.3832183837890625, "num_input_tokens_seen": 13601646720, "step": 47830, "train_runtime": 465040.5788, "train_tokens_per_second": 29248.301 }, { "epoch": 1.6926739303018308, "grad_norm": 0.609375, "learning_rate": 2.079024544281199e-05, "loss": 0.39319667816162107, "num_input_tokens_seen": 13604438848, "step": 47840, "train_runtime": 465135.6664, "train_tokens_per_second": 29248.324 }, { "epoch": 1.6930277505655595, "grad_norm": 0.625, "learning_rate": 2.078844842436821e-05, "loss": 0.3922778606414795, "num_input_tokens_seen": 13607228928, "step": 47850, "train_runtime": 465229.8747, "train_tokens_per_second": 29248.399 }, { "epoch": 1.6933815708292883, "grad_norm": 0.62109375, "learning_rate": 2.0786651871823272e-05, "loss": 0.38624837398529055, "num_input_tokens_seen": 13610089280, "step": 47860, "train_runtime": 465329.7429, "train_tokens_per_second": 29248.269 }, { "epoch": 1.6937353910930173, "grad_norm": 0.640625, "learning_rate": 2.0784855784975907e-05, "loss": 0.3850614070892334, "num_input_tokens_seen": 13612907328, "step": 47870, "train_runtime": 465424.1986, "train_tokens_per_second": 29248.388 }, { "epoch": 1.6940892113567458, "grad_norm": 0.59375, "learning_rate": 2.078306016362495e-05, "loss": 0.3858610153198242, "num_input_tokens_seen": 13615737856, "step": 47880, "train_runtime": 465520.9037, "train_tokens_per_second": 29248.392 }, { "epoch": 1.6944430316204748, "grad_norm": 0.60546875, "learning_rate": 2.0781265007569355e-05, "loss": 0.3895831823348999, "num_input_tokens_seen": 13618588352, "step": 47890, "train_runtime": 465617.6169, "train_tokens_per_second": 29248.439 }, { "epoch": 1.6947968518842034, "grad_norm": 0.61328125, "learning_rate": 2.0779470316608218e-05, "loss": 0.3867624521255493, "num_input_tokens_seen": 13621466304, "step": 47900, "train_runtime": 465715.334, "train_tokens_per_second": 29248.481 }, { "epoch": 1.6951506721479324, "grad_norm": 0.59375, "learning_rate": 2.0777676090540738e-05, "loss": 0.3871964931488037, "num_input_tokens_seen": 13624274496, "step": 47910, "train_runtime": 465809.163, "train_tokens_per_second": 29248.618 }, { "epoch": 1.695504492411661, "grad_norm": 0.6015625, "learning_rate": 2.0775882329166235e-05, "loss": 0.38729941844940186, "num_input_tokens_seen": 13627144192, "step": 47920, "train_runtime": 465904.7439, "train_tokens_per_second": 29248.778 }, { "epoch": 1.69585831267539, "grad_norm": 0.625, "learning_rate": 2.0774089032284164e-05, "loss": 0.39241800308227537, "num_input_tokens_seen": 13629971648, "step": 47930, "train_runtime": 465997.9116, "train_tokens_per_second": 29248.997 }, { "epoch": 1.6962121329391184, "grad_norm": 0.59765625, "learning_rate": 2.0772296199694092e-05, "loss": 0.3910749197006226, "num_input_tokens_seen": 13632793792, "step": 47940, "train_runtime": 466093.9172, "train_tokens_per_second": 29249.027 }, { "epoch": 1.6965659532028474, "grad_norm": 0.60546875, "learning_rate": 2.0770503831195703e-05, "loss": 0.3873137474060059, "num_input_tokens_seen": 13635600512, "step": 47950, "train_runtime": 466189.6038, "train_tokens_per_second": 29249.045 }, { "epoch": 1.6969197734665762, "grad_norm": 0.625, "learning_rate": 2.0768711926588813e-05, "loss": 0.3928596258163452, "num_input_tokens_seen": 13638457728, "step": 47960, "train_runtime": 466289.8642, "train_tokens_per_second": 29248.883 }, { "epoch": 1.697273593730305, "grad_norm": 0.58984375, "learning_rate": 2.076692048567335e-05, "loss": 0.38697829246521, "num_input_tokens_seen": 13641345664, "step": 47970, "train_runtime": 466386.8521, "train_tokens_per_second": 29248.993 }, { "epoch": 1.6976274139940337, "grad_norm": 0.59765625, "learning_rate": 2.076512950824937e-05, "loss": 0.3890304327011108, "num_input_tokens_seen": 13644170176, "step": 47980, "train_runtime": 466481.2059, "train_tokens_per_second": 29249.132 }, { "epoch": 1.6979812342577625, "grad_norm": 0.6171875, "learning_rate": 2.0763338994117043e-05, "loss": 0.3881545066833496, "num_input_tokens_seen": 13647034688, "step": 47990, "train_runtime": 466577.0557, "train_tokens_per_second": 29249.262 }, { "epoch": 1.6983350545214912, "grad_norm": 0.62109375, "learning_rate": 2.0761548943076657e-05, "loss": 0.38659062385559084, "num_input_tokens_seen": 13649907456, "step": 48000, "train_runtime": 466678.2925, "train_tokens_per_second": 29249.073 }, { "epoch": 1.69868887478522, "grad_norm": 0.58984375, "learning_rate": 2.0759759354928637e-05, "loss": 0.3865540027618408, "num_input_tokens_seen": 13652747200, "step": 48010, "train_runtime": 466776.2689, "train_tokens_per_second": 29249.017 }, { "epoch": 1.6990426950489488, "grad_norm": 0.58984375, "learning_rate": 2.0757970229473512e-05, "loss": 0.39294488430023194, "num_input_tokens_seen": 13655570176, "step": 48020, "train_runtime": 466873.1559, "train_tokens_per_second": 29248.994 }, { "epoch": 1.6993965153126775, "grad_norm": 0.6015625, "learning_rate": 2.0756181566511933e-05, "loss": 0.3923866987228394, "num_input_tokens_seen": 13658403008, "step": 48030, "train_runtime": 466968.8544, "train_tokens_per_second": 29249.066 }, { "epoch": 1.6997503355764065, "grad_norm": 0.6171875, "learning_rate": 2.0754393365844677e-05, "loss": 0.3864671945571899, "num_input_tokens_seen": 13661246656, "step": 48040, "train_runtime": 467066.846, "train_tokens_per_second": 29249.018 }, { "epoch": 1.700104155840135, "grad_norm": 0.62890625, "learning_rate": 2.075260562727264e-05, "loss": 0.3852688789367676, "num_input_tokens_seen": 13664068160, "step": 48050, "train_runtime": 467162.0993, "train_tokens_per_second": 29249.094 }, { "epoch": 1.700457976103864, "grad_norm": 0.625, "learning_rate": 2.0750818350596838e-05, "loss": 0.3894263982772827, "num_input_tokens_seen": 13666918592, "step": 48060, "train_runtime": 467261.8188, "train_tokens_per_second": 29248.952 }, { "epoch": 1.7008117963675926, "grad_norm": 0.59765625, "learning_rate": 2.0749031535618403e-05, "loss": 0.38974287509918215, "num_input_tokens_seen": 13669768384, "step": 48070, "train_runtime": 467356.0299, "train_tokens_per_second": 29249.154 }, { "epoch": 1.7011656166313216, "grad_norm": 0.5859375, "learning_rate": 2.074724518213859e-05, "loss": 0.3871318817138672, "num_input_tokens_seen": 13672655936, "step": 48080, "train_runtime": 467457.3216, "train_tokens_per_second": 29248.993 }, { "epoch": 1.7015194368950501, "grad_norm": 0.6171875, "learning_rate": 2.0745459289958773e-05, "loss": 0.38607001304626465, "num_input_tokens_seen": 13675506176, "step": 48090, "train_runtime": 467555.6855, "train_tokens_per_second": 29248.936 }, { "epoch": 1.7018732571587791, "grad_norm": 0.62109375, "learning_rate": 2.0743673858880447e-05, "loss": 0.3865602731704712, "num_input_tokens_seen": 13678392192, "step": 48100, "train_runtime": 467656.405, "train_tokens_per_second": 29248.808 }, { "epoch": 1.7022270774225077, "grad_norm": 0.625, "learning_rate": 2.074188888870523e-05, "loss": 0.3908292055130005, "num_input_tokens_seen": 13681223040, "step": 48110, "train_runtime": 467754.0079, "train_tokens_per_second": 29248.756 }, { "epoch": 1.7025808976862367, "grad_norm": 0.62890625, "learning_rate": 2.0740104379234847e-05, "loss": 0.3867603302001953, "num_input_tokens_seen": 13684064896, "step": 48120, "train_runtime": 467851.1323, "train_tokens_per_second": 29248.759 }, { "epoch": 1.7029347179499654, "grad_norm": 0.59375, "learning_rate": 2.073832033027116e-05, "loss": 0.38911683559417726, "num_input_tokens_seen": 13686884928, "step": 48130, "train_runtime": 467945.4125, "train_tokens_per_second": 29248.892 }, { "epoch": 1.7032885382136942, "grad_norm": 0.609375, "learning_rate": 2.0736536741616128e-05, "loss": 0.38747320175170896, "num_input_tokens_seen": 13689754880, "step": 48140, "train_runtime": 468041.4136, "train_tokens_per_second": 29249.025 }, { "epoch": 1.703642358477423, "grad_norm": 0.6015625, "learning_rate": 2.073475361307185e-05, "loss": 0.38791484832763673, "num_input_tokens_seen": 13692595840, "step": 48150, "train_runtime": 468137.1248, "train_tokens_per_second": 29249.113 }, { "epoch": 1.7039961787411517, "grad_norm": 0.60546875, "learning_rate": 2.0732970944440534e-05, "loss": 0.38873212337493895, "num_input_tokens_seen": 13695499712, "step": 48160, "train_runtime": 468235.9639, "train_tokens_per_second": 29249.141 }, { "epoch": 1.7043499990048805, "grad_norm": 0.6171875, "learning_rate": 2.073118873552452e-05, "loss": 0.3841092586517334, "num_input_tokens_seen": 13698357888, "step": 48170, "train_runtime": 468334.7198, "train_tokens_per_second": 29249.076 }, { "epoch": 1.7047038192686093, "grad_norm": 0.58984375, "learning_rate": 2.0729406986126238e-05, "loss": 0.38967161178588866, "num_input_tokens_seen": 13701224064, "step": 48180, "train_runtime": 468433.5833, "train_tokens_per_second": 29249.022 }, { "epoch": 1.705057639532338, "grad_norm": 0.63671875, "learning_rate": 2.0727625696048264e-05, "loss": 0.39243450164794924, "num_input_tokens_seen": 13704029888, "step": 48190, "train_runtime": 468529.842, "train_tokens_per_second": 29249.001 }, { "epoch": 1.7054114597960668, "grad_norm": 0.59375, "learning_rate": 2.0725844865093287e-05, "loss": 0.39022054672241213, "num_input_tokens_seen": 13706867200, "step": 48200, "train_runtime": 468624.7872, "train_tokens_per_second": 29249.13 }, { "epoch": 1.7057652800597958, "grad_norm": 0.6015625, "learning_rate": 2.07240644930641e-05, "loss": 0.38955373764038087, "num_input_tokens_seen": 13709739264, "step": 48210, "train_runtime": 468723.729, "train_tokens_per_second": 29249.083 }, { "epoch": 1.7061191003235243, "grad_norm": 0.609375, "learning_rate": 2.0722284579763633e-05, "loss": 0.3858583927154541, "num_input_tokens_seen": 13712579456, "step": 48220, "train_runtime": 468821.056, "train_tokens_per_second": 29249.069 }, { "epoch": 1.7064729205872533, "grad_norm": 0.6171875, "learning_rate": 2.0720505124994934e-05, "loss": 0.389461612701416, "num_input_tokens_seen": 13715411648, "step": 48230, "train_runtime": 468917.6904, "train_tokens_per_second": 29249.081 }, { "epoch": 1.7068267408509818, "grad_norm": 0.609375, "learning_rate": 2.0718726128561156e-05, "loss": 0.3888113021850586, "num_input_tokens_seen": 13718270848, "step": 48240, "train_runtime": 469013.8477, "train_tokens_per_second": 29249.181 }, { "epoch": 1.7071805611147108, "grad_norm": 0.5859375, "learning_rate": 2.0716947590265572e-05, "loss": 0.39095044136047363, "num_input_tokens_seen": 13721091776, "step": 48250, "train_runtime": 469109.6785, "train_tokens_per_second": 29249.219 }, { "epoch": 1.7075343813784394, "grad_norm": 0.6015625, "learning_rate": 2.0715169509911588e-05, "loss": 0.3898854970932007, "num_input_tokens_seen": 13723950912, "step": 48260, "train_runtime": 469207.281, "train_tokens_per_second": 29249.228 }, { "epoch": 1.7078882016421684, "grad_norm": 0.61328125, "learning_rate": 2.0713391887302706e-05, "loss": 0.3899320125579834, "num_input_tokens_seen": 13726796736, "step": 48270, "train_runtime": 469305.9885, "train_tokens_per_second": 29249.14 }, { "epoch": 1.708242021905897, "grad_norm": 0.6015625, "learning_rate": 2.0711614722242566e-05, "loss": 0.3884573459625244, "num_input_tokens_seen": 13729610496, "step": 48280, "train_runtime": 469402.8319, "train_tokens_per_second": 29249.1 }, { "epoch": 1.708595842169626, "grad_norm": 0.59375, "learning_rate": 2.0709838014534923e-05, "loss": 0.38820972442626955, "num_input_tokens_seen": 13732433536, "step": 48290, "train_runtime": 469499.4594, "train_tokens_per_second": 29249.093 }, { "epoch": 1.7089496624333547, "grad_norm": 0.609375, "learning_rate": 2.0708061763983633e-05, "loss": 0.3893574714660645, "num_input_tokens_seen": 13735299264, "step": 48300, "train_runtime": 469597.641, "train_tokens_per_second": 29249.081 }, { "epoch": 1.7093034826970834, "grad_norm": 0.62109375, "learning_rate": 2.070628597039269e-05, "loss": 0.38619108200073243, "num_input_tokens_seen": 13738148736, "step": 48310, "train_runtime": 469690.9236, "train_tokens_per_second": 29249.338 }, { "epoch": 1.7096573029608122, "grad_norm": 0.62109375, "learning_rate": 2.07045106335662e-05, "loss": 0.3881126165390015, "num_input_tokens_seen": 13741024576, "step": 48320, "train_runtime": 469789.7111, "train_tokens_per_second": 29249.309 }, { "epoch": 1.710011123224541, "grad_norm": 0.625, "learning_rate": 2.0702735753308372e-05, "loss": 0.3866866111755371, "num_input_tokens_seen": 13743871680, "step": 48330, "train_runtime": 469885.2731, "train_tokens_per_second": 29249.42 }, { "epoch": 1.7103649434882697, "grad_norm": 0.60546875, "learning_rate": 2.0700961329423558e-05, "loss": 0.38760910034179685, "num_input_tokens_seen": 13746730624, "step": 48340, "train_runtime": 469983.7262, "train_tokens_per_second": 29249.376 }, { "epoch": 1.7107187637519985, "grad_norm": 0.60546875, "learning_rate": 2.06991873617162e-05, "loss": 0.390235161781311, "num_input_tokens_seen": 13749591872, "step": 48350, "train_runtime": 470083.279, "train_tokens_per_second": 29249.268 }, { "epoch": 1.7110725840157273, "grad_norm": 0.609375, "learning_rate": 2.0697413849990883e-05, "loss": 0.3880808115005493, "num_input_tokens_seen": 13752402496, "step": 48360, "train_runtime": 470178.898, "train_tokens_per_second": 29249.298 }, { "epoch": 1.711426404279456, "grad_norm": 0.59765625, "learning_rate": 2.0695640794052288e-05, "loss": 0.38985333442687986, "num_input_tokens_seen": 13755270592, "step": 48370, "train_runtime": 470281.2909, "train_tokens_per_second": 29249.028 }, { "epoch": 1.711780224543185, "grad_norm": 0.625, "learning_rate": 2.0693868193705228e-05, "loss": 0.39145784378051757, "num_input_tokens_seen": 13758136064, "step": 48380, "train_runtime": 470381.9039, "train_tokens_per_second": 29248.863 }, { "epoch": 1.7121340448069136, "grad_norm": 0.60546875, "learning_rate": 2.069209604875463e-05, "loss": 0.386849045753479, "num_input_tokens_seen": 13761048000, "step": 48390, "train_runtime": 470483.2625, "train_tokens_per_second": 29248.751 }, { "epoch": 1.7124878650706425, "grad_norm": 0.58984375, "learning_rate": 2.069032435900553e-05, "loss": 0.39316654205322266, "num_input_tokens_seen": 13763955520, "step": 48400, "train_runtime": 470586.4994, "train_tokens_per_second": 29248.513 }, { "epoch": 1.712841685334371, "grad_norm": 0.60546875, "learning_rate": 2.0688553124263086e-05, "loss": 0.39151811599731445, "num_input_tokens_seen": 13766769280, "step": 48410, "train_runtime": 470682.3274, "train_tokens_per_second": 29248.537 }, { "epoch": 1.7131955055981, "grad_norm": 0.5859375, "learning_rate": 2.068678234433257e-05, "loss": 0.3873628616333008, "num_input_tokens_seen": 13769620032, "step": 48420, "train_runtime": 470779.6541, "train_tokens_per_second": 29248.545 }, { "epoch": 1.7135493258618286, "grad_norm": 0.59375, "learning_rate": 2.0685012019019385e-05, "loss": 0.3883244037628174, "num_input_tokens_seen": 13772479168, "step": 48430, "train_runtime": 470876.1222, "train_tokens_per_second": 29248.625 }, { "epoch": 1.7139031461255576, "grad_norm": 0.59375, "learning_rate": 2.0683242148129027e-05, "loss": 0.39118180274963377, "num_input_tokens_seen": 13775317824, "step": 48440, "train_runtime": 470971.4519, "train_tokens_per_second": 29248.732 }, { "epoch": 1.7142569663892864, "grad_norm": 0.60546875, "learning_rate": 2.068147273146712e-05, "loss": 0.38933897018432617, "num_input_tokens_seen": 13778182400, "step": 48450, "train_runtime": 471069.309, "train_tokens_per_second": 29248.737 }, { "epoch": 1.7146107866530151, "grad_norm": 0.609375, "learning_rate": 2.067970376883942e-05, "loss": 0.3872515201568604, "num_input_tokens_seen": 13781024832, "step": 48460, "train_runtime": 471167.1516, "train_tokens_per_second": 29248.696 }, { "epoch": 1.714964606916744, "grad_norm": 0.6015625, "learning_rate": 2.0677935260051766e-05, "loss": 0.38962535858154296, "num_input_tokens_seen": 13783832896, "step": 48470, "train_runtime": 471261.0837, "train_tokens_per_second": 29248.825 }, { "epoch": 1.7153184271804727, "grad_norm": 0.6171875, "learning_rate": 2.0676167204910145e-05, "loss": 0.3942216634750366, "num_input_tokens_seen": 13786695424, "step": 48480, "train_runtime": 471357.0438, "train_tokens_per_second": 29248.943 }, { "epoch": 1.7156722474442014, "grad_norm": 0.61328125, "learning_rate": 2.067439960322063e-05, "loss": 0.38683304786682127, "num_input_tokens_seen": 13789540672, "step": 48490, "train_runtime": 471454.8238, "train_tokens_per_second": 29248.912 }, { "epoch": 1.7160260677079302, "grad_norm": 0.61328125, "learning_rate": 2.067263245478945e-05, "loss": 0.38875441551208495, "num_input_tokens_seen": 13792359680, "step": 48500, "train_runtime": 471551.9756, "train_tokens_per_second": 29248.864 }, { "epoch": 1.716379887971659, "grad_norm": 0.62890625, "learning_rate": 2.06708657594229e-05, "loss": 0.3962899684906006, "num_input_tokens_seen": 13795189312, "step": 48510, "train_runtime": 471647.285, "train_tokens_per_second": 29248.953 }, { "epoch": 1.7167337082353877, "grad_norm": 0.6171875, "learning_rate": 2.066909951692744e-05, "loss": 0.38721909523010256, "num_input_tokens_seen": 13798056320, "step": 48520, "train_runtime": 471746.6991, "train_tokens_per_second": 29248.867 }, { "epoch": 1.7170875284991165, "grad_norm": 0.62109375, "learning_rate": 2.0667333727109607e-05, "loss": 0.38817930221557617, "num_input_tokens_seen": 13800873792, "step": 48530, "train_runtime": 471842.123, "train_tokens_per_second": 29248.923 }, { "epoch": 1.7174413487628453, "grad_norm": 0.61328125, "learning_rate": 2.066556838977608e-05, "loss": 0.3903515338897705, "num_input_tokens_seen": 13803753728, "step": 48540, "train_runtime": 471942.606, "train_tokens_per_second": 29248.798 }, { "epoch": 1.7177951690265743, "grad_norm": 0.59765625, "learning_rate": 2.0663803504733643e-05, "loss": 0.38574464321136476, "num_input_tokens_seen": 13806596224, "step": 48550, "train_runtime": 472038.1316, "train_tokens_per_second": 29248.9 }, { "epoch": 1.7181489892903028, "grad_norm": 0.60546875, "learning_rate": 2.0662039071789186e-05, "loss": 0.3923600196838379, "num_input_tokens_seen": 13809494848, "step": 48560, "train_runtime": 472139.5578, "train_tokens_per_second": 29248.756 }, { "epoch": 1.7185028095540318, "grad_norm": 0.61328125, "learning_rate": 2.066027509074973e-05, "loss": 0.3877371311187744, "num_input_tokens_seen": 13812316224, "step": 48570, "train_runtime": 472233.1679, "train_tokens_per_second": 29248.933 }, { "epoch": 1.7188566298177603, "grad_norm": 0.58984375, "learning_rate": 2.0658511561422408e-05, "loss": 0.38576905727386473, "num_input_tokens_seen": 13815134080, "step": 48580, "train_runtime": 472329.3796, "train_tokens_per_second": 29248.941 }, { "epoch": 1.7192104500814893, "grad_norm": 0.63671875, "learning_rate": 2.0656748483614464e-05, "loss": 0.3853257656097412, "num_input_tokens_seen": 13818018304, "step": 48590, "train_runtime": 472428.0954, "train_tokens_per_second": 29248.934 }, { "epoch": 1.7195642703452179, "grad_norm": 0.609375, "learning_rate": 2.0654985857133256e-05, "loss": 0.38887615203857423, "num_input_tokens_seen": 13820798656, "step": 48600, "train_runtime": 472521.6071, "train_tokens_per_second": 29249.03 }, { "epoch": 1.7199180906089468, "grad_norm": 0.6328125, "learning_rate": 2.065322368178626e-05, "loss": 0.3885476589202881, "num_input_tokens_seen": 13823666880, "step": 48610, "train_runtime": 472618.1759, "train_tokens_per_second": 29249.122 }, { "epoch": 1.7202719108726756, "grad_norm": 0.578125, "learning_rate": 2.0651461957381073e-05, "loss": 0.3862586498260498, "num_input_tokens_seen": 13826486272, "step": 48620, "train_runtime": 472713.7131, "train_tokens_per_second": 29249.175 }, { "epoch": 1.7206257311364044, "grad_norm": 0.625, "learning_rate": 2.064970068372539e-05, "loss": 0.39878201484680176, "num_input_tokens_seen": 13829337600, "step": 48630, "train_runtime": 472811.3425, "train_tokens_per_second": 29249.166 }, { "epoch": 1.7209795514001331, "grad_norm": 0.61328125, "learning_rate": 2.0647939860627043e-05, "loss": 0.3905741453170776, "num_input_tokens_seen": 13832139200, "step": 48640, "train_runtime": 472907.059, "train_tokens_per_second": 29249.17 }, { "epoch": 1.721333371663862, "grad_norm": 0.59375, "learning_rate": 2.0646179487893964e-05, "loss": 0.38819422721862795, "num_input_tokens_seen": 13835023680, "step": 48650, "train_runtime": 473007.0874, "train_tokens_per_second": 29249.083 }, { "epoch": 1.7216871919275907, "grad_norm": 0.6015625, "learning_rate": 2.0644419565334194e-05, "loss": 0.39127411842346194, "num_input_tokens_seen": 13837870400, "step": 48660, "train_runtime": 473106.0407, "train_tokens_per_second": 29248.983 }, { "epoch": 1.7220410121913194, "grad_norm": 0.59375, "learning_rate": 2.0642660092755907e-05, "loss": 0.38996338844299316, "num_input_tokens_seen": 13840713216, "step": 48670, "train_runtime": 473202.1329, "train_tokens_per_second": 29249.051 }, { "epoch": 1.7223948324550482, "grad_norm": 0.6015625, "learning_rate": 2.0640901069967375e-05, "loss": 0.38815195560455323, "num_input_tokens_seen": 13843563264, "step": 48680, "train_runtime": 473297.6681, "train_tokens_per_second": 29249.169 }, { "epoch": 1.722748652718777, "grad_norm": 0.65625, "learning_rate": 2.0639142496777e-05, "loss": 0.38807406425476076, "num_input_tokens_seen": 13846371072, "step": 48690, "train_runtime": 473393.6627, "train_tokens_per_second": 29249.169 }, { "epoch": 1.723102472982506, "grad_norm": 0.59375, "learning_rate": 2.0637384372993275e-05, "loss": 0.39033467769622804, "num_input_tokens_seen": 13849165696, "step": 48700, "train_runtime": 473486.5234, "train_tokens_per_second": 29249.334 }, { "epoch": 1.7234562932462345, "grad_norm": 0.5859375, "learning_rate": 2.0635626698424836e-05, "loss": 0.387131404876709, "num_input_tokens_seen": 13851974848, "step": 48710, "train_runtime": 473581.8964, "train_tokens_per_second": 29249.376 }, { "epoch": 1.7238101135099635, "grad_norm": 0.6171875, "learning_rate": 2.0633869472880413e-05, "loss": 0.3892030715942383, "num_input_tokens_seen": 13854800512, "step": 48720, "train_runtime": 473675.5049, "train_tokens_per_second": 29249.561 }, { "epoch": 1.724163933773692, "grad_norm": 0.59375, "learning_rate": 2.0632112696168856e-05, "loss": 0.3873451709747314, "num_input_tokens_seen": 13857649536, "step": 48730, "train_runtime": 473772.3268, "train_tokens_per_second": 29249.597 }, { "epoch": 1.724517754037421, "grad_norm": 0.6171875, "learning_rate": 2.0630356368099127e-05, "loss": 0.392289924621582, "num_input_tokens_seen": 13860484224, "step": 48740, "train_runtime": 473866.4495, "train_tokens_per_second": 29249.769 }, { "epoch": 1.7248715743011496, "grad_norm": 0.625, "learning_rate": 2.06286004884803e-05, "loss": 0.3891010284423828, "num_input_tokens_seen": 13863294144, "step": 48750, "train_runtime": 473960.3885, "train_tokens_per_second": 29249.9 }, { "epoch": 1.7252253945648786, "grad_norm": 0.6171875, "learning_rate": 2.062684505712157e-05, "loss": 0.3863518238067627, "num_input_tokens_seen": 13866109632, "step": 48760, "train_runtime": 474053.8263, "train_tokens_per_second": 29250.074 }, { "epoch": 1.725579214828607, "grad_norm": 0.62109375, "learning_rate": 2.0625090073832243e-05, "loss": 0.3932070016860962, "num_input_tokens_seen": 13868989440, "step": 48770, "train_runtime": 474153.7189, "train_tokens_per_second": 29249.986 }, { "epoch": 1.725933035092336, "grad_norm": 0.59375, "learning_rate": 2.0623335538421733e-05, "loss": 0.3887565851211548, "num_input_tokens_seen": 13871900992, "step": 48780, "train_runtime": 474254.4155, "train_tokens_per_second": 29249.914 }, { "epoch": 1.7262868553560649, "grad_norm": 0.5859375, "learning_rate": 2.0621581450699574e-05, "loss": 0.38957719802856444, "num_input_tokens_seen": 13874715264, "step": 48790, "train_runtime": 474350.9089, "train_tokens_per_second": 29249.897 }, { "epoch": 1.7266406756197936, "grad_norm": 0.6484375, "learning_rate": 2.0619827810475418e-05, "loss": 0.38720059394836426, "num_input_tokens_seen": 13877607872, "step": 48800, "train_runtime": 474449.114, "train_tokens_per_second": 29249.939 }, { "epoch": 1.7269944958835224, "grad_norm": 0.63671875, "learning_rate": 2.0618074617559007e-05, "loss": 0.38745574951171874, "num_input_tokens_seen": 13880471104, "step": 48810, "train_runtime": 474547.5285, "train_tokens_per_second": 29249.907 }, { "epoch": 1.7273483161472512, "grad_norm": 0.61328125, "learning_rate": 2.0616321871760226e-05, "loss": 0.3931020736694336, "num_input_tokens_seen": 13883314176, "step": 48820, "train_runtime": 474643.2385, "train_tokens_per_second": 29249.999 }, { "epoch": 1.72770213641098, "grad_norm": 0.59375, "learning_rate": 2.0614569572889056e-05, "loss": 0.3858001232147217, "num_input_tokens_seen": 13886184000, "step": 48830, "train_runtime": 474740.6214, "train_tokens_per_second": 29250.044 }, { "epoch": 1.7280559566747087, "grad_norm": 0.60546875, "learning_rate": 2.061281772075559e-05, "loss": 0.3869338512420654, "num_input_tokens_seen": 13888998912, "step": 48840, "train_runtime": 474836.4905, "train_tokens_per_second": 29250.066 }, { "epoch": 1.7284097769384374, "grad_norm": 0.609375, "learning_rate": 2.0611066315170047e-05, "loss": 0.3855573654174805, "num_input_tokens_seen": 13891844032, "step": 48850, "train_runtime": 474933.3176, "train_tokens_per_second": 29250.094 }, { "epoch": 1.7287635972021662, "grad_norm": 0.6015625, "learning_rate": 2.0609315355942744e-05, "loss": 0.3895872592926025, "num_input_tokens_seen": 13894653056, "step": 48860, "train_runtime": 475027.446, "train_tokens_per_second": 29250.211 }, { "epoch": 1.7291174174658952, "grad_norm": 0.58984375, "learning_rate": 2.0607564842884116e-05, "loss": 0.38496174812316897, "num_input_tokens_seen": 13897499200, "step": 48870, "train_runtime": 475124.3129, "train_tokens_per_second": 29250.238 }, { "epoch": 1.7294712377296237, "grad_norm": 0.59375, "learning_rate": 2.0605814775804717e-05, "loss": 0.3888188600540161, "num_input_tokens_seen": 13900315904, "step": 48880, "train_runtime": 475221.6379, "train_tokens_per_second": 29250.175 }, { "epoch": 1.7298250579933527, "grad_norm": 0.59375, "learning_rate": 2.0604065154515207e-05, "loss": 0.3855093479156494, "num_input_tokens_seen": 13903188096, "step": 48890, "train_runtime": 475324.7147, "train_tokens_per_second": 29249.874 }, { "epoch": 1.7301788782570813, "grad_norm": 0.58984375, "learning_rate": 2.0602315978826363e-05, "loss": 0.38578956127166747, "num_input_tokens_seen": 13906031168, "step": 48900, "train_runtime": 475420.1049, "train_tokens_per_second": 29249.985 }, { "epoch": 1.7305326985208103, "grad_norm": 0.59375, "learning_rate": 2.0600567248549062e-05, "loss": 0.3835385799407959, "num_input_tokens_seen": 13908900416, "step": 48910, "train_runtime": 475519.2943, "train_tokens_per_second": 29249.918 }, { "epoch": 1.7308865187845388, "grad_norm": 0.609375, "learning_rate": 2.0598818963494312e-05, "loss": 0.3878213882446289, "num_input_tokens_seen": 13911761984, "step": 48920, "train_runtime": 475617.5046, "train_tokens_per_second": 29249.895 }, { "epoch": 1.7312403390482678, "grad_norm": 0.59765625, "learning_rate": 2.0597071123473223e-05, "loss": 0.39088256359100343, "num_input_tokens_seen": 13914586048, "step": 48930, "train_runtime": 475714.3398, "train_tokens_per_second": 29249.877 }, { "epoch": 1.7315941593119963, "grad_norm": 0.58203125, "learning_rate": 2.0595323728297013e-05, "loss": 0.3886402130126953, "num_input_tokens_seen": 13917437120, "step": 48940, "train_runtime": 475812.2584, "train_tokens_per_second": 29249.85 }, { "epoch": 1.7319479795757253, "grad_norm": 0.62109375, "learning_rate": 2.059357677777702e-05, "loss": 0.3934603691101074, "num_input_tokens_seen": 13920332864, "step": 48950, "train_runtime": 475913.5294, "train_tokens_per_second": 29249.71 }, { "epoch": 1.732301799839454, "grad_norm": 0.59765625, "learning_rate": 2.0591830271724687e-05, "loss": 0.3913571357727051, "num_input_tokens_seen": 13923163072, "step": 48960, "train_runtime": 476008.2784, "train_tokens_per_second": 29249.834 }, { "epoch": 1.7326556201031829, "grad_norm": 0.5859375, "learning_rate": 2.0590084209951588e-05, "loss": 0.3880268096923828, "num_input_tokens_seen": 13926025600, "step": 48970, "train_runtime": 476104.2661, "train_tokens_per_second": 29249.949 }, { "epoch": 1.7330094403669116, "grad_norm": 0.6171875, "learning_rate": 2.0588338592269375e-05, "loss": 0.3864912986755371, "num_input_tokens_seen": 13928862016, "step": 48980, "train_runtime": 476200.6625, "train_tokens_per_second": 29249.985 }, { "epoch": 1.7333632606306404, "grad_norm": 0.6015625, "learning_rate": 2.0586593418489846e-05, "loss": 0.3858344554901123, "num_input_tokens_seen": 13931706304, "step": 48990, "train_runtime": 476296.892, "train_tokens_per_second": 29250.047 }, { "epoch": 1.7337170808943692, "grad_norm": 0.61328125, "learning_rate": 2.0584848688424894e-05, "loss": 0.38674952983856203, "num_input_tokens_seen": 13934492032, "step": 49000, "train_runtime": 476390.1694, "train_tokens_per_second": 29250.167 }, { "epoch": 1.734070901158098, "grad_norm": 0.57421875, "learning_rate": 2.0583104401886512e-05, "loss": 0.38558807373046877, "num_input_tokens_seen": 13937352640, "step": 49010, "train_runtime": 476487.3211, "train_tokens_per_second": 29250.207 }, { "epoch": 1.7344247214218267, "grad_norm": 0.625, "learning_rate": 2.0581360558686828e-05, "loss": 0.389147424697876, "num_input_tokens_seen": 13940169664, "step": 49020, "train_runtime": 476584.5349, "train_tokens_per_second": 29250.151 }, { "epoch": 1.7347785416855555, "grad_norm": 0.62890625, "learning_rate": 2.057961715863807e-05, "loss": 0.39339375495910645, "num_input_tokens_seen": 13942974080, "step": 49030, "train_runtime": 476681.9763, "train_tokens_per_second": 29250.055 }, { "epoch": 1.7351323619492844, "grad_norm": 0.59375, "learning_rate": 2.0577874201552578e-05, "loss": 0.38551983833312986, "num_input_tokens_seen": 13945876096, "step": 49040, "train_runtime": 476782.1259, "train_tokens_per_second": 29249.998 }, { "epoch": 1.735486182213013, "grad_norm": 0.625, "learning_rate": 2.0576131687242803e-05, "loss": 0.38854217529296875, "num_input_tokens_seen": 13948727552, "step": 49050, "train_runtime": 476878.5845, "train_tokens_per_second": 29250.061 }, { "epoch": 1.735840002476742, "grad_norm": 0.6015625, "learning_rate": 2.0574389615521303e-05, "loss": 0.38984825611114504, "num_input_tokens_seen": 13951510016, "step": 49060, "train_runtime": 476972.6515, "train_tokens_per_second": 29250.126 }, { "epoch": 1.7361938227404705, "grad_norm": 0.6171875, "learning_rate": 2.0572647986200757e-05, "loss": 0.38666157722473143, "num_input_tokens_seen": 13954370496, "step": 49070, "train_runtime": 477069.8123, "train_tokens_per_second": 29250.165 }, { "epoch": 1.7365476430041995, "grad_norm": 0.61328125, "learning_rate": 2.057090679909395e-05, "loss": 0.3921320915222168, "num_input_tokens_seen": 13957226688, "step": 49080, "train_runtime": 477166.6995, "train_tokens_per_second": 29250.211 }, { "epoch": 1.736901463267928, "grad_norm": 0.640625, "learning_rate": 2.056916605401378e-05, "loss": 0.3907826662063599, "num_input_tokens_seen": 13960103168, "step": 49090, "train_runtime": 477263.1189, "train_tokens_per_second": 29250.329 }, { "epoch": 1.737255283531657, "grad_norm": 0.61328125, "learning_rate": 2.0567425750773247e-05, "loss": 0.38638982772827146, "num_input_tokens_seen": 13962869504, "step": 49100, "train_runtime": 477356.8745, "train_tokens_per_second": 29250.379 }, { "epoch": 1.7376091037953856, "grad_norm": 0.5859375, "learning_rate": 2.056568588918547e-05, "loss": 0.38939127922058103, "num_input_tokens_seen": 13965735744, "step": 49110, "train_runtime": 477453.2158, "train_tokens_per_second": 29250.48 }, { "epoch": 1.7379629240591146, "grad_norm": 0.578125, "learning_rate": 2.056394646906368e-05, "loss": 0.3872859001159668, "num_input_tokens_seen": 13968618560, "step": 49120, "train_runtime": 477553.4373, "train_tokens_per_second": 29250.378 }, { "epoch": 1.7383167443228433, "grad_norm": 0.59765625, "learning_rate": 2.0562207490221216e-05, "loss": 0.3951389789581299, "num_input_tokens_seen": 13971409984, "step": 49130, "train_runtime": 477649.583, "train_tokens_per_second": 29250.334 }, { "epoch": 1.738670564586572, "grad_norm": 0.58203125, "learning_rate": 2.056046895247152e-05, "loss": 0.38391273021697997, "num_input_tokens_seen": 13974325824, "step": 49140, "train_runtime": 477751.9794, "train_tokens_per_second": 29250.168 }, { "epoch": 1.7390243848503009, "grad_norm": 0.61328125, "learning_rate": 2.0558730855628155e-05, "loss": 0.3855523347854614, "num_input_tokens_seen": 13977164992, "step": 49150, "train_runtime": 477849.3774, "train_tokens_per_second": 29250.148 }, { "epoch": 1.7393782051140296, "grad_norm": 0.578125, "learning_rate": 2.055699319950479e-05, "loss": 0.3909287929534912, "num_input_tokens_seen": 13980006592, "step": 49160, "train_runtime": 477947.0516, "train_tokens_per_second": 29250.116 }, { "epoch": 1.7397320253777584, "grad_norm": 0.59765625, "learning_rate": 2.055525598391521e-05, "loss": 0.38961195945739746, "num_input_tokens_seen": 13982844032, "step": 49170, "train_runtime": 478041.199, "train_tokens_per_second": 29250.291 }, { "epoch": 1.7400858456414872, "grad_norm": 0.6171875, "learning_rate": 2.0553519208673293e-05, "loss": 0.3888551712036133, "num_input_tokens_seen": 13985742656, "step": 49180, "train_runtime": 478141.1087, "train_tokens_per_second": 29250.241 }, { "epoch": 1.740439665905216, "grad_norm": 0.6015625, "learning_rate": 2.0551782873593057e-05, "loss": 0.39024658203125, "num_input_tokens_seen": 13988579712, "step": 49190, "train_runtime": 478237.363, "train_tokens_per_second": 29250.286 }, { "epoch": 1.7407934861689447, "grad_norm": 0.609375, "learning_rate": 2.0550046978488592e-05, "loss": 0.3875107288360596, "num_input_tokens_seen": 13991383168, "step": 49200, "train_runtime": 478334.1302, "train_tokens_per_second": 29250.23 }, { "epoch": 1.7411473064326737, "grad_norm": 0.609375, "learning_rate": 2.0548311523174133e-05, "loss": 0.3859492301940918, "num_input_tokens_seen": 13994221952, "step": 49210, "train_runtime": 478432.8478, "train_tokens_per_second": 29250.128 }, { "epoch": 1.7415011266964022, "grad_norm": 0.59375, "learning_rate": 2.0546576507464003e-05, "loss": 0.38080430030822754, "num_input_tokens_seen": 13997047232, "step": 49220, "train_runtime": 478527.5028, "train_tokens_per_second": 29250.246 }, { "epoch": 1.7418549469601312, "grad_norm": 0.62109375, "learning_rate": 2.054484193117264e-05, "loss": 0.38934381008148194, "num_input_tokens_seen": 13999908032, "step": 49230, "train_runtime": 478627.0181, "train_tokens_per_second": 29250.142 }, { "epoch": 1.7422087672238598, "grad_norm": 0.6171875, "learning_rate": 2.0543107794114597e-05, "loss": 0.39241857528686525, "num_input_tokens_seen": 14002766016, "step": 49240, "train_runtime": 478725.1502, "train_tokens_per_second": 29250.116 }, { "epoch": 1.7425625874875887, "grad_norm": 0.60546875, "learning_rate": 2.0541374096104523e-05, "loss": 0.39133267402648925, "num_input_tokens_seen": 14005568576, "step": 49250, "train_runtime": 478819.4384, "train_tokens_per_second": 29250.209 }, { "epoch": 1.7429164077513173, "grad_norm": 0.6171875, "learning_rate": 2.05396408369572e-05, "loss": 0.3865822315216064, "num_input_tokens_seen": 14008406912, "step": 49260, "train_runtime": 478916.8275, "train_tokens_per_second": 29250.187 }, { "epoch": 1.7432702280150463, "grad_norm": 0.62109375, "learning_rate": 2.05379080164875e-05, "loss": 0.3883687973022461, "num_input_tokens_seen": 14011195456, "step": 49270, "train_runtime": 479011.4427, "train_tokens_per_second": 29250.231 }, { "epoch": 1.743624048278775, "grad_norm": 0.6015625, "learning_rate": 2.053617563451041e-05, "loss": 0.394056510925293, "num_input_tokens_seen": 14014009280, "step": 49280, "train_runtime": 479106.6861, "train_tokens_per_second": 29250.29 }, { "epoch": 1.7439778685425038, "grad_norm": 0.62890625, "learning_rate": 2.0534443690841026e-05, "loss": 0.39061501026153567, "num_input_tokens_seen": 14016871680, "step": 49290, "train_runtime": 479202.8156, "train_tokens_per_second": 29250.395 }, { "epoch": 1.7443316888062326, "grad_norm": 0.6171875, "learning_rate": 2.0532712185294546e-05, "loss": 0.39222581386566163, "num_input_tokens_seen": 14019706496, "step": 49300, "train_runtime": 479299.0917, "train_tokens_per_second": 29250.434 }, { "epoch": 1.7446855090699613, "grad_norm": 0.59375, "learning_rate": 2.0530981117686292e-05, "loss": 0.3871941566467285, "num_input_tokens_seen": 14022544512, "step": 49310, "train_runtime": 479395.8669, "train_tokens_per_second": 29250.449 }, { "epoch": 1.74503932933369, "grad_norm": 0.609375, "learning_rate": 2.0529250487831685e-05, "loss": 0.38560240268707274, "num_input_tokens_seen": 14025402624, "step": 49320, "train_runtime": 479493.1182, "train_tokens_per_second": 29250.477 }, { "epoch": 1.7453931495974189, "grad_norm": 0.609375, "learning_rate": 2.0527520295546256e-05, "loss": 0.3916832447052002, "num_input_tokens_seen": 14028195008, "step": 49330, "train_runtime": 479587.8461, "train_tokens_per_second": 29250.522 }, { "epoch": 1.7457469698611476, "grad_norm": 0.58203125, "learning_rate": 2.052579054064565e-05, "loss": 0.3858347415924072, "num_input_tokens_seen": 14031070592, "step": 49340, "train_runtime": 479686.2644, "train_tokens_per_second": 29250.516 }, { "epoch": 1.7461007901248764, "grad_norm": 0.59765625, "learning_rate": 2.052406122294561e-05, "loss": 0.3910540580749512, "num_input_tokens_seen": 14033917056, "step": 49350, "train_runtime": 479784.6796, "train_tokens_per_second": 29250.448 }, { "epoch": 1.7464546103886052, "grad_norm": 0.5859375, "learning_rate": 2.0522332342261998e-05, "loss": 0.38623507022857667, "num_input_tokens_seen": 14036744256, "step": 49360, "train_runtime": 479880.8659, "train_tokens_per_second": 29250.477 }, { "epoch": 1.746808430652334, "grad_norm": 0.6015625, "learning_rate": 2.052060389841078e-05, "loss": 0.3902060747146606, "num_input_tokens_seen": 14039614784, "step": 49370, "train_runtime": 479979.2337, "train_tokens_per_second": 29250.463 }, { "epoch": 1.747162250916063, "grad_norm": 0.64453125, "learning_rate": 2.0518875891208032e-05, "loss": 0.38612380027771, "num_input_tokens_seen": 14042505024, "step": 49380, "train_runtime": 480076.6135, "train_tokens_per_second": 29250.55 }, { "epoch": 1.7475160711797915, "grad_norm": 0.625, "learning_rate": 2.051714832046994e-05, "loss": 0.3875981092453003, "num_input_tokens_seen": 14045327680, "step": 49390, "train_runtime": 480171.0525, "train_tokens_per_second": 29250.676 }, { "epoch": 1.7478698914435205, "grad_norm": 0.59375, "learning_rate": 2.051542118601279e-05, "loss": 0.3948683500289917, "num_input_tokens_seen": 14048168320, "step": 49400, "train_runtime": 480268.5161, "train_tokens_per_second": 29250.654 }, { "epoch": 1.748223711707249, "grad_norm": 0.609375, "learning_rate": 2.0513694487652985e-05, "loss": 0.38892192840576173, "num_input_tokens_seen": 14050945984, "step": 49410, "train_runtime": 480361.8669, "train_tokens_per_second": 29250.752 }, { "epoch": 1.748577531970978, "grad_norm": 0.63671875, "learning_rate": 2.051196822520703e-05, "loss": 0.39353418350219727, "num_input_tokens_seen": 14053775424, "step": 49420, "train_runtime": 480455.7062, "train_tokens_per_second": 29250.928 }, { "epoch": 1.7489313522347065, "grad_norm": 0.59375, "learning_rate": 2.0510242398491553e-05, "loss": 0.38719897270202636, "num_input_tokens_seen": 14056553600, "step": 49430, "train_runtime": 480550.6452, "train_tokens_per_second": 29250.931 }, { "epoch": 1.7492851724984355, "grad_norm": 0.6171875, "learning_rate": 2.0508517007323266e-05, "loss": 0.3912373065948486, "num_input_tokens_seen": 14059430400, "step": 49440, "train_runtime": 480648.6139, "train_tokens_per_second": 29250.954 }, { "epoch": 1.7496389927621643, "grad_norm": 0.6171875, "learning_rate": 2.0506792051519007e-05, "loss": 0.38600988388061525, "num_input_tokens_seen": 14062304448, "step": 49450, "train_runtime": 480748.0998, "train_tokens_per_second": 29250.879 }, { "epoch": 1.749992813025893, "grad_norm": 0.6015625, "learning_rate": 2.050506753089571e-05, "loss": 0.39232099056243896, "num_input_tokens_seen": 14065174720, "step": 49460, "train_runtime": 480847.976, "train_tokens_per_second": 29250.772 }, { "epoch": 1.7503466332896218, "grad_norm": 0.6015625, "learning_rate": 2.050334344527043e-05, "loss": 0.38351552486419677, "num_input_tokens_seen": 14067993536, "step": 49470, "train_runtime": 480943.036, "train_tokens_per_second": 29250.852 }, { "epoch": 1.7507004535533506, "grad_norm": 0.6015625, "learning_rate": 2.0501619794460322e-05, "loss": 0.38890819549560546, "num_input_tokens_seen": 14070812992, "step": 49480, "train_runtime": 481037.6774, "train_tokens_per_second": 29250.958 }, { "epoch": 1.7510542738170793, "grad_norm": 0.60546875, "learning_rate": 2.0499896578282647e-05, "loss": 0.38720974922180174, "num_input_tokens_seen": 14073621120, "step": 49490, "train_runtime": 481132.7232, "train_tokens_per_second": 29251.016 }, { "epoch": 1.751408094080808, "grad_norm": 0.6328125, "learning_rate": 2.049817379655477e-05, "loss": 0.3879827976226807, "num_input_tokens_seen": 14076485120, "step": 49500, "train_runtime": 481230.7111, "train_tokens_per_second": 29251.012 }, { "epoch": 1.7517619143445369, "grad_norm": 0.625, "learning_rate": 2.049645144909418e-05, "loss": 0.3924839019775391, "num_input_tokens_seen": 14079344448, "step": 49510, "train_runtime": 481328.2738, "train_tokens_per_second": 29251.023 }, { "epoch": 1.7521157346082656, "grad_norm": 0.578125, "learning_rate": 2.0494729535718454e-05, "loss": 0.38801000118255613, "num_input_tokens_seen": 14082116544, "step": 49520, "train_runtime": 481423.1651, "train_tokens_per_second": 29251.016 }, { "epoch": 1.7524695548719946, "grad_norm": 0.6328125, "learning_rate": 2.0493008056245292e-05, "loss": 0.3944086074829102, "num_input_tokens_seen": 14085002496, "step": 49530, "train_runtime": 481521.9948, "train_tokens_per_second": 29251.005 }, { "epoch": 1.7528233751357232, "grad_norm": 0.6171875, "learning_rate": 2.0491287010492484e-05, "loss": 0.3899362564086914, "num_input_tokens_seen": 14087823168, "step": 49540, "train_runtime": 481618.526, "train_tokens_per_second": 29250.999 }, { "epoch": 1.7531771953994522, "grad_norm": 0.6171875, "learning_rate": 2.0489566398277943e-05, "loss": 0.38977460861206054, "num_input_tokens_seen": 14090702016, "step": 49550, "train_runtime": 481715.9026, "train_tokens_per_second": 29251.063 }, { "epoch": 1.7535310156631807, "grad_norm": 0.59375, "learning_rate": 2.0487846219419683e-05, "loss": 0.3842364549636841, "num_input_tokens_seen": 14093561536, "step": 49560, "train_runtime": 481812.2191, "train_tokens_per_second": 29251.15 }, { "epoch": 1.7538848359269097, "grad_norm": 0.640625, "learning_rate": 2.048612647373583e-05, "loss": 0.38803696632385254, "num_input_tokens_seen": 14096403200, "step": 49570, "train_runtime": 481908.0421, "train_tokens_per_second": 29251.23 }, { "epoch": 1.7542386561906382, "grad_norm": 0.60546875, "learning_rate": 2.0484407161044598e-05, "loss": 0.38816018104553224, "num_input_tokens_seen": 14099277248, "step": 49580, "train_runtime": 482011.921, "train_tokens_per_second": 29250.889 }, { "epoch": 1.7545924764543672, "grad_norm": 0.61328125, "learning_rate": 2.0482688281164333e-05, "loss": 0.38619720935821533, "num_input_tokens_seen": 14102163968, "step": 49590, "train_runtime": 482109.9581, "train_tokens_per_second": 29250.929 }, { "epoch": 1.7549462967180958, "grad_norm": 0.6015625, "learning_rate": 2.048096983391347e-05, "loss": 0.3884623050689697, "num_input_tokens_seen": 14104997632, "step": 49600, "train_runtime": 482204.5257, "train_tokens_per_second": 29251.069 }, { "epoch": 1.7553001169818248, "grad_norm": 0.6015625, "learning_rate": 2.047925181911056e-05, "loss": 0.39087040424346925, "num_input_tokens_seen": 14107825920, "step": 49610, "train_runtime": 482300.8649, "train_tokens_per_second": 29251.09 }, { "epoch": 1.7556539372455535, "grad_norm": 0.625, "learning_rate": 2.0477534236574254e-05, "loss": 0.3876131534576416, "num_input_tokens_seen": 14110684672, "step": 49620, "train_runtime": 482397.3718, "train_tokens_per_second": 29251.164 }, { "epoch": 1.7560077575092823, "grad_norm": 0.625, "learning_rate": 2.0475817086123313e-05, "loss": 0.38890039920806885, "num_input_tokens_seen": 14113532736, "step": 49630, "train_runtime": 482496.6899, "train_tokens_per_second": 29251.046 }, { "epoch": 1.756361577773011, "grad_norm": 0.59765625, "learning_rate": 2.047410036757661e-05, "loss": 0.3884609222412109, "num_input_tokens_seen": 14116398912, "step": 49640, "train_runtime": 482594.4803, "train_tokens_per_second": 29251.058 }, { "epoch": 1.7567153980367398, "grad_norm": 0.59375, "learning_rate": 2.0472384080753113e-05, "loss": 0.3850518226623535, "num_input_tokens_seen": 14119203904, "step": 49650, "train_runtime": 482688.6484, "train_tokens_per_second": 29251.162 }, { "epoch": 1.7570692183004686, "grad_norm": 0.6328125, "learning_rate": 2.04706682254719e-05, "loss": 0.38535640239715574, "num_input_tokens_seen": 14122062720, "step": 49660, "train_runtime": 482787.2379, "train_tokens_per_second": 29251.11 }, { "epoch": 1.7574230385641973, "grad_norm": 0.60546875, "learning_rate": 2.0468952801552166e-05, "loss": 0.38881592750549315, "num_input_tokens_seen": 14124929664, "step": 49670, "train_runtime": 482886.9309, "train_tokens_per_second": 29251.008 }, { "epoch": 1.7577768588279261, "grad_norm": 0.6171875, "learning_rate": 2.046723780881319e-05, "loss": 0.3919193744659424, "num_input_tokens_seen": 14127732224, "step": 49680, "train_runtime": 482984.0892, "train_tokens_per_second": 29250.927 }, { "epoch": 1.7581306790916549, "grad_norm": 0.6171875, "learning_rate": 2.0465523247074376e-05, "loss": 0.38100900650024416, "num_input_tokens_seen": 14130582720, "step": 49690, "train_runtime": 483079.7414, "train_tokens_per_second": 29251.036 }, { "epoch": 1.7584844993553839, "grad_norm": 0.58984375, "learning_rate": 2.046380911615523e-05, "loss": 0.38820900917053225, "num_input_tokens_seen": 14133457536, "step": 49700, "train_runtime": 483177.5975, "train_tokens_per_second": 29251.061 }, { "epoch": 1.7588383196191124, "grad_norm": 0.63671875, "learning_rate": 2.0462095415875357e-05, "loss": 0.38717851638793943, "num_input_tokens_seen": 14136300352, "step": 49710, "train_runtime": 483273.7354, "train_tokens_per_second": 29251.125 }, { "epoch": 1.7591921398828414, "grad_norm": 0.58203125, "learning_rate": 2.046038214605448e-05, "loss": 0.38627569675445556, "num_input_tokens_seen": 14139115072, "step": 49720, "train_runtime": 483367.6709, "train_tokens_per_second": 29251.263 }, { "epoch": 1.75954596014657, "grad_norm": 0.60546875, "learning_rate": 2.0458669306512404e-05, "loss": 0.3881821155548096, "num_input_tokens_seen": 14141986880, "step": 49730, "train_runtime": 483467.0762, "train_tokens_per_second": 29251.189 }, { "epoch": 1.759899780410299, "grad_norm": 0.61328125, "learning_rate": 2.045695689706907e-05, "loss": 0.38967266082763674, "num_input_tokens_seen": 14144775616, "step": 49740, "train_runtime": 483559.8751, "train_tokens_per_second": 29251.343 }, { "epoch": 1.7602536006740275, "grad_norm": 0.60546875, "learning_rate": 2.0455244917544507e-05, "loss": 0.3913793325424194, "num_input_tokens_seen": 14147649088, "step": 49750, "train_runtime": 483657.1635, "train_tokens_per_second": 29251.4 }, { "epoch": 1.7606074209377565, "grad_norm": 0.58203125, "learning_rate": 2.0453533367758846e-05, "loss": 0.3884756326675415, "num_input_tokens_seen": 14150497472, "step": 49760, "train_runtime": 483755.5038, "train_tokens_per_second": 29251.342 }, { "epoch": 1.760961241201485, "grad_norm": 0.60546875, "learning_rate": 2.0451822247532338e-05, "loss": 0.3908435821533203, "num_input_tokens_seen": 14153397504, "step": 49770, "train_runtime": 483855.3439, "train_tokens_per_second": 29251.299 }, { "epoch": 1.761315061465214, "grad_norm": 0.62890625, "learning_rate": 2.0450111556685323e-05, "loss": 0.385576868057251, "num_input_tokens_seen": 14156242496, "step": 49780, "train_runtime": 483953.2473, "train_tokens_per_second": 29251.26 }, { "epoch": 1.7616688817289428, "grad_norm": 0.6171875, "learning_rate": 2.0448401295038257e-05, "loss": 0.3850072145462036, "num_input_tokens_seen": 14159148352, "step": 49790, "train_runtime": 484050.2214, "train_tokens_per_second": 29251.404 }, { "epoch": 1.7620227019926715, "grad_norm": 0.60546875, "learning_rate": 2.04466914624117e-05, "loss": 0.39039804935455324, "num_input_tokens_seen": 14162018816, "step": 49800, "train_runtime": 484146.162, "train_tokens_per_second": 29251.536 }, { "epoch": 1.7623765222564003, "grad_norm": 0.609375, "learning_rate": 2.0444982058626314e-05, "loss": 0.3904542922973633, "num_input_tokens_seen": 14164775744, "step": 49810, "train_runtime": 484236.7633, "train_tokens_per_second": 29251.756 }, { "epoch": 1.762730342520129, "grad_norm": 0.609375, "learning_rate": 2.0443273083502863e-05, "loss": 0.3892939567565918, "num_input_tokens_seen": 14167685312, "step": 49820, "train_runtime": 484335.816, "train_tokens_per_second": 29251.781 }, { "epoch": 1.7630841627838578, "grad_norm": 0.59375, "learning_rate": 2.044156453686223e-05, "loss": 0.39123556613922117, "num_input_tokens_seen": 14170503936, "step": 49830, "train_runtime": 484429.7172, "train_tokens_per_second": 29251.93 }, { "epoch": 1.7634379830475866, "grad_norm": 0.63671875, "learning_rate": 2.0439856418525386e-05, "loss": 0.38967945575714114, "num_input_tokens_seen": 14173361536, "step": 49840, "train_runtime": 484524.8368, "train_tokens_per_second": 29252.085 }, { "epoch": 1.7637918033113154, "grad_norm": 0.60546875, "learning_rate": 2.043814872831341e-05, "loss": 0.3876481056213379, "num_input_tokens_seen": 14176290624, "step": 49850, "train_runtime": 484624.3168, "train_tokens_per_second": 29252.124 }, { "epoch": 1.7641456235750441, "grad_norm": 0.609375, "learning_rate": 2.0436441466047494e-05, "loss": 0.3952652454376221, "num_input_tokens_seen": 14179099648, "step": 49860, "train_runtime": 484717.9606, "train_tokens_per_second": 29252.268 }, { "epoch": 1.764499443838773, "grad_norm": 0.6015625, "learning_rate": 2.0434734631548927e-05, "loss": 0.3850527048110962, "num_input_tokens_seen": 14181980544, "step": 49870, "train_runtime": 484820.7565, "train_tokens_per_second": 29252.008 }, { "epoch": 1.7648532641025017, "grad_norm": 0.66796875, "learning_rate": 2.0433028224639106e-05, "loss": 0.39000668525695803, "num_input_tokens_seen": 14184771008, "step": 49880, "train_runtime": 484911.9545, "train_tokens_per_second": 29252.261 }, { "epoch": 1.7652070843662306, "grad_norm": 0.60546875, "learning_rate": 2.0431322245139533e-05, "loss": 0.3878610610961914, "num_input_tokens_seen": 14187629440, "step": 49890, "train_runtime": 485009.7506, "train_tokens_per_second": 29252.256 }, { "epoch": 1.7655609046299592, "grad_norm": 0.62109375, "learning_rate": 2.0429616692871808e-05, "loss": 0.38987021446228026, "num_input_tokens_seen": 14190438336, "step": 49900, "train_runtime": 485105.7331, "train_tokens_per_second": 29252.259 }, { "epoch": 1.7659147248936882, "grad_norm": 0.60546875, "learning_rate": 2.0427911567657644e-05, "loss": 0.3873212575912476, "num_input_tokens_seen": 14193285184, "step": 49910, "train_runtime": 485204.9153, "train_tokens_per_second": 29252.146 }, { "epoch": 1.7662685451574167, "grad_norm": 0.625, "learning_rate": 2.0426206869318852e-05, "loss": 0.3871925354003906, "num_input_tokens_seen": 14196087936, "step": 49920, "train_runtime": 485298.3057, "train_tokens_per_second": 29252.292 }, { "epoch": 1.7666223654211457, "grad_norm": 0.58203125, "learning_rate": 2.0424502597677357e-05, "loss": 0.3897804021835327, "num_input_tokens_seen": 14198965376, "step": 49930, "train_runtime": 485399.9089, "train_tokens_per_second": 29252.097 }, { "epoch": 1.7669761856848742, "grad_norm": 0.5859375, "learning_rate": 2.042279875255517e-05, "loss": 0.3890186309814453, "num_input_tokens_seen": 14201795712, "step": 49940, "train_runtime": 485497.8847, "train_tokens_per_second": 29252.024 }, { "epoch": 1.7673300059486032, "grad_norm": 0.6171875, "learning_rate": 2.0421095333774413e-05, "loss": 0.3899000883102417, "num_input_tokens_seen": 14204625984, "step": 49950, "train_runtime": 485593.7096, "train_tokens_per_second": 29252.08 }, { "epoch": 1.767683826212332, "grad_norm": 0.59765625, "learning_rate": 2.0419392341157327e-05, "loss": 0.3857257843017578, "num_input_tokens_seen": 14207496960, "step": 49960, "train_runtime": 485694.9456, "train_tokens_per_second": 29251.894 }, { "epoch": 1.7680376464760608, "grad_norm": 0.56640625, "learning_rate": 2.0417689774526235e-05, "loss": 0.388786768913269, "num_input_tokens_seen": 14210322496, "step": 49970, "train_runtime": 485792.1481, "train_tokens_per_second": 29251.857 }, { "epoch": 1.7683914667397895, "grad_norm": 0.625, "learning_rate": 2.0415987633703583e-05, "loss": 0.3869042873382568, "num_input_tokens_seen": 14213167616, "step": 49980, "train_runtime": 485890.2902, "train_tokens_per_second": 29251.804 }, { "epoch": 1.7687452870035183, "grad_norm": 0.625, "learning_rate": 2.04142859185119e-05, "loss": 0.3896949768066406, "num_input_tokens_seen": 14216049408, "step": 49990, "train_runtime": 485989.8037, "train_tokens_per_second": 29251.744 }, { "epoch": 1.769099107267247, "grad_norm": 0.6171875, "learning_rate": 2.0412584628773835e-05, "loss": 0.39403295516967773, "num_input_tokens_seen": 14218881984, "step": 50000, "train_runtime": 486088.2502, "train_tokens_per_second": 29251.647 }, { "epoch": 1.769099107267247, "eval_loss": 0.33621031045913696, "eval_runtime": 8.4143, "eval_samples_per_second": 473.954, "eval_steps_per_second": 3.803, "num_input_tokens_seen": 14218881984, "step": 50000 }, { "epoch": 1.7694529275309758, "grad_norm": 0.58203125, "learning_rate": 2.0410883764312135e-05, "loss": 0.38748767375946047, "num_input_tokens_seen": 14221693248, "step": 50010, "train_runtime": 486213.8011, "train_tokens_per_second": 29249.876 }, { "epoch": 1.7698067477947046, "grad_norm": 0.625, "learning_rate": 2.0409183324949646e-05, "loss": 0.389849328994751, "num_input_tokens_seen": 14224536320, "step": 50020, "train_runtime": 486314.1335, "train_tokens_per_second": 29249.687 }, { "epoch": 1.7701605680584334, "grad_norm": 0.625, "learning_rate": 2.0407483310509333e-05, "loss": 0.38871333599090574, "num_input_tokens_seen": 14227418304, "step": 50030, "train_runtime": 486415.575, "train_tokens_per_second": 29249.512 }, { "epoch": 1.7705143883221623, "grad_norm": 0.6171875, "learning_rate": 2.040578372081424e-05, "loss": 0.389327073097229, "num_input_tokens_seen": 14230233536, "step": 50040, "train_runtime": 486510.9739, "train_tokens_per_second": 29249.563 }, { "epoch": 1.770868208585891, "grad_norm": 0.60546875, "learning_rate": 2.0404084555687525e-05, "loss": 0.3867353439331055, "num_input_tokens_seen": 14233023552, "step": 50050, "train_runtime": 486603.7164, "train_tokens_per_second": 29249.722 }, { "epoch": 1.7712220288496199, "grad_norm": 0.609375, "learning_rate": 2.0402385814952464e-05, "loss": 0.3870378494262695, "num_input_tokens_seen": 14235863680, "step": 50060, "train_runtime": 486699.7038, "train_tokens_per_second": 29249.789 }, { "epoch": 1.7715758491133484, "grad_norm": 0.61328125, "learning_rate": 2.0400687498432415e-05, "loss": 0.38392367362976076, "num_input_tokens_seen": 14238697344, "step": 50070, "train_runtime": 486795.689, "train_tokens_per_second": 29249.843 }, { "epoch": 1.7719296693770774, "grad_norm": 0.62109375, "learning_rate": 2.039898960595085e-05, "loss": 0.3898477077484131, "num_input_tokens_seen": 14241492992, "step": 50080, "train_runtime": 486891.6743, "train_tokens_per_second": 29249.818 }, { "epoch": 1.772283489640806, "grad_norm": 0.59765625, "learning_rate": 2.039729213733134e-05, "loss": 0.3867949962615967, "num_input_tokens_seen": 14244341760, "step": 50090, "train_runtime": 486990.4964, "train_tokens_per_second": 29249.733 }, { "epoch": 1.772637309904535, "grad_norm": 0.671875, "learning_rate": 2.0395595092397554e-05, "loss": 0.3867375373840332, "num_input_tokens_seen": 14247171968, "step": 50100, "train_runtime": 487089.4145, "train_tokens_per_second": 29249.603 }, { "epoch": 1.7729911301682635, "grad_norm": 0.62890625, "learning_rate": 2.0393898470973276e-05, "loss": 0.3887359380722046, "num_input_tokens_seen": 14249991808, "step": 50110, "train_runtime": 487187.819, "train_tokens_per_second": 29249.483 }, { "epoch": 1.7733449504319925, "grad_norm": 0.60546875, "learning_rate": 2.0392202272882384e-05, "loss": 0.39030065536499026, "num_input_tokens_seen": 14252898176, "step": 50120, "train_runtime": 487288.2392, "train_tokens_per_second": 29249.42 }, { "epoch": 1.7736987706957212, "grad_norm": 0.61328125, "learning_rate": 2.0390506497948854e-05, "loss": 0.39316370487213137, "num_input_tokens_seen": 14255738752, "step": 50130, "train_runtime": 487386.6149, "train_tokens_per_second": 29249.344 }, { "epoch": 1.77405259095945, "grad_norm": 0.6171875, "learning_rate": 2.038881114599678e-05, "loss": 0.39061784744262695, "num_input_tokens_seen": 14258539840, "step": 50140, "train_runtime": 487480.1763, "train_tokens_per_second": 29249.476 }, { "epoch": 1.7744064112231788, "grad_norm": 0.62109375, "learning_rate": 2.0387116216850345e-05, "loss": 0.38534982204437257, "num_input_tokens_seen": 14261400064, "step": 50150, "train_runtime": 487575.3235, "train_tokens_per_second": 29249.635 }, { "epoch": 1.7747602314869075, "grad_norm": 0.609375, "learning_rate": 2.0385421710333838e-05, "loss": 0.3840333938598633, "num_input_tokens_seen": 14264280128, "step": 50160, "train_runtime": 487672.4498, "train_tokens_per_second": 29249.715 }, { "epoch": 1.7751140517506363, "grad_norm": 0.61328125, "learning_rate": 2.0383727626271648e-05, "loss": 0.39063568115234376, "num_input_tokens_seen": 14267157120, "step": 50170, "train_runtime": 487770.4123, "train_tokens_per_second": 29249.739 }, { "epoch": 1.775467872014365, "grad_norm": 0.61328125, "learning_rate": 2.0382033964488274e-05, "loss": 0.3923508167266846, "num_input_tokens_seen": 14270035136, "step": 50180, "train_runtime": 487868.3916, "train_tokens_per_second": 29249.764 }, { "epoch": 1.7758216922780938, "grad_norm": 0.625, "learning_rate": 2.0380340724808307e-05, "loss": 0.3892721652984619, "num_input_tokens_seen": 14272912768, "step": 50190, "train_runtime": 487968.5315, "train_tokens_per_second": 29249.658 }, { "epoch": 1.7761755125418226, "grad_norm": 0.60546875, "learning_rate": 2.0378647907056447e-05, "loss": 0.39028334617614746, "num_input_tokens_seen": 14275817984, "step": 50200, "train_runtime": 488068.5493, "train_tokens_per_second": 29249.617 }, { "epoch": 1.7765293328055516, "grad_norm": 0.609375, "learning_rate": 2.0376955511057493e-05, "loss": 0.38695802688598635, "num_input_tokens_seen": 14278631360, "step": 50210, "train_runtime": 488167.1444, "train_tokens_per_second": 29249.472 }, { "epoch": 1.7768831530692801, "grad_norm": 0.59765625, "learning_rate": 2.0375263536636348e-05, "loss": 0.38867812156677245, "num_input_tokens_seen": 14281497792, "step": 50220, "train_runtime": 488264.505, "train_tokens_per_second": 29249.511 }, { "epoch": 1.7772369733330091, "grad_norm": 0.6328125, "learning_rate": 2.0373571983618014e-05, "loss": 0.39181008338928225, "num_input_tokens_seen": 14284357120, "step": 50230, "train_runtime": 488363.8163, "train_tokens_per_second": 29249.417 }, { "epoch": 1.7775907935967377, "grad_norm": 0.61328125, "learning_rate": 2.0371880851827597e-05, "loss": 0.38538293838500975, "num_input_tokens_seen": 14287188160, "step": 50240, "train_runtime": 488459.4548, "train_tokens_per_second": 29249.486 }, { "epoch": 1.7779446138604666, "grad_norm": 0.61328125, "learning_rate": 2.0370190141090298e-05, "loss": 0.38669528961181643, "num_input_tokens_seen": 14290047232, "step": 50250, "train_runtime": 488555.5429, "train_tokens_per_second": 29249.586 }, { "epoch": 1.7782984341241952, "grad_norm": 0.60546875, "learning_rate": 2.0368499851231433e-05, "loss": 0.3892032623291016, "num_input_tokens_seen": 14292963264, "step": 50260, "train_runtime": 488655.9293, "train_tokens_per_second": 29249.544 }, { "epoch": 1.7786522543879242, "grad_norm": 0.63671875, "learning_rate": 2.0366809982076404e-05, "loss": 0.38855705261230467, "num_input_tokens_seen": 14295811392, "step": 50270, "train_runtime": 488755.0564, "train_tokens_per_second": 29249.439 }, { "epoch": 1.779006074651653, "grad_norm": 0.6171875, "learning_rate": 2.0365120533450732e-05, "loss": 0.39193086624145507, "num_input_tokens_seen": 14298666560, "step": 50280, "train_runtime": 488851.2157, "train_tokens_per_second": 29249.526 }, { "epoch": 1.7793598949153817, "grad_norm": 0.59765625, "learning_rate": 2.0363431505180018e-05, "loss": 0.38649711608886717, "num_input_tokens_seen": 14301523264, "step": 50290, "train_runtime": 488952.5037, "train_tokens_per_second": 29249.31 }, { "epoch": 1.7797137151791105, "grad_norm": 0.61328125, "learning_rate": 2.036174289708998e-05, "loss": 0.3914536714553833, "num_input_tokens_seen": 14304374016, "step": 50300, "train_runtime": 489051.6167, "train_tokens_per_second": 29249.211 }, { "epoch": 1.7800675354428392, "grad_norm": 0.59765625, "learning_rate": 2.036005470900643e-05, "loss": 0.38511826992034914, "num_input_tokens_seen": 14307237504, "step": 50310, "train_runtime": 489149.4595, "train_tokens_per_second": 29249.215 }, { "epoch": 1.780421355706568, "grad_norm": 0.6171875, "learning_rate": 2.035836694075529e-05, "loss": 0.3879786491394043, "num_input_tokens_seen": 14310040896, "step": 50320, "train_runtime": 489241.3717, "train_tokens_per_second": 29249.45 }, { "epoch": 1.7807751759702968, "grad_norm": 0.63671875, "learning_rate": 2.0356679592162574e-05, "loss": 0.38781094551086426, "num_input_tokens_seen": 14312854592, "step": 50330, "train_runtime": 489336.0319, "train_tokens_per_second": 29249.542 }, { "epoch": 1.7811289962340255, "grad_norm": 0.625, "learning_rate": 2.0354992663054395e-05, "loss": 0.38694162368774415, "num_input_tokens_seen": 14315676736, "step": 50340, "train_runtime": 489432.7855, "train_tokens_per_second": 29249.525 }, { "epoch": 1.7814828164977543, "grad_norm": 0.6171875, "learning_rate": 2.0353306153256975e-05, "loss": 0.3925336837768555, "num_input_tokens_seen": 14318516544, "step": 50350, "train_runtime": 489535.1432, "train_tokens_per_second": 29249.211 }, { "epoch": 1.781836636761483, "grad_norm": 0.58203125, "learning_rate": 2.0351620062596634e-05, "loss": 0.3856451749801636, "num_input_tokens_seen": 14321402944, "step": 50360, "train_runtime": 489635.4111, "train_tokens_per_second": 29249.116 }, { "epoch": 1.7821904570252118, "grad_norm": 0.62890625, "learning_rate": 2.0349934390899796e-05, "loss": 0.38912713527679443, "num_input_tokens_seen": 14324217408, "step": 50370, "train_runtime": 489729.8469, "train_tokens_per_second": 29249.223 }, { "epoch": 1.7825442772889408, "grad_norm": 0.609375, "learning_rate": 2.0348249137992967e-05, "loss": 0.38780841827392576, "num_input_tokens_seen": 14327077504, "step": 50380, "train_runtime": 489826.7211, "train_tokens_per_second": 29249.277 }, { "epoch": 1.7828980975526694, "grad_norm": 0.609375, "learning_rate": 2.034656430370278e-05, "loss": 0.3941533088684082, "num_input_tokens_seen": 14329920000, "step": 50390, "train_runtime": 489924.0967, "train_tokens_per_second": 29249.266 }, { "epoch": 1.7832519178163984, "grad_norm": 0.625, "learning_rate": 2.0344879887855952e-05, "loss": 0.3906111717224121, "num_input_tokens_seen": 14332805952, "step": 50400, "train_runtime": 490023.3647, "train_tokens_per_second": 29249.23 }, { "epoch": 1.783605738080127, "grad_norm": 0.6171875, "learning_rate": 2.0343195890279314e-05, "loss": 0.39227895736694335, "num_input_tokens_seen": 14335667776, "step": 50410, "train_runtime": 490121.0244, "train_tokens_per_second": 29249.241 }, { "epoch": 1.783959558343856, "grad_norm": 0.58203125, "learning_rate": 2.034151231079977e-05, "loss": 0.3909771919250488, "num_input_tokens_seen": 14338499456, "step": 50420, "train_runtime": 490217.6106, "train_tokens_per_second": 29249.254 }, { "epoch": 1.7843133786075844, "grad_norm": 0.62109375, "learning_rate": 2.033982914924436e-05, "loss": 0.39262781143188474, "num_input_tokens_seen": 14341356736, "step": 50430, "train_runtime": 490317.5493, "train_tokens_per_second": 29249.12 }, { "epoch": 1.7846671988713134, "grad_norm": 0.59765625, "learning_rate": 2.0338146405440198e-05, "loss": 0.3838437557220459, "num_input_tokens_seen": 14344204160, "step": 50440, "train_runtime": 490414.1884, "train_tokens_per_second": 29249.162 }, { "epoch": 1.7850210191350422, "grad_norm": 0.60546875, "learning_rate": 2.0336464079214507e-05, "loss": 0.38554673194885253, "num_input_tokens_seen": 14347045632, "step": 50450, "train_runtime": 490511.2604, "train_tokens_per_second": 29249.167 }, { "epoch": 1.785374839398771, "grad_norm": 0.62109375, "learning_rate": 2.033478217039461e-05, "loss": 0.3890625, "num_input_tokens_seen": 14349957440, "step": 50460, "train_runtime": 490613.135, "train_tokens_per_second": 29249.028 }, { "epoch": 1.7857286596624997, "grad_norm": 0.6015625, "learning_rate": 2.033310067880794e-05, "loss": 0.3881007194519043, "num_input_tokens_seen": 14352851520, "step": 50470, "train_runtime": 490711.7109, "train_tokens_per_second": 29249.05 }, { "epoch": 1.7860824799262285, "grad_norm": 0.60546875, "learning_rate": 2.0331419604282e-05, "loss": 0.38754591941833494, "num_input_tokens_seen": 14355658304, "step": 50480, "train_runtime": 490806.4584, "train_tokens_per_second": 29249.123 }, { "epoch": 1.7864363001899572, "grad_norm": 0.6015625, "learning_rate": 2.0329738946644425e-05, "loss": 0.38557004928588867, "num_input_tokens_seen": 14358490496, "step": 50490, "train_runtime": 490904.2026, "train_tokens_per_second": 29249.068 }, { "epoch": 1.786790120453686, "grad_norm": 0.6015625, "learning_rate": 2.0328058705722937e-05, "loss": 0.3874515056610107, "num_input_tokens_seen": 14361369600, "step": 50500, "train_runtime": 491003.4368, "train_tokens_per_second": 29249.021 }, { "epoch": 1.7871439407174148, "grad_norm": 0.64453125, "learning_rate": 2.0326378881345356e-05, "loss": 0.388558554649353, "num_input_tokens_seen": 14364233472, "step": 50510, "train_runtime": 491099.3591, "train_tokens_per_second": 29249.139 }, { "epoch": 1.7874977609811435, "grad_norm": 0.61328125, "learning_rate": 2.0324699473339605e-05, "loss": 0.3865520477294922, "num_input_tokens_seen": 14367140736, "step": 50520, "train_runtime": 491199.9063, "train_tokens_per_second": 29249.071 }, { "epoch": 1.7878515812448725, "grad_norm": 0.63671875, "learning_rate": 2.0323020481533697e-05, "loss": 0.3855280876159668, "num_input_tokens_seen": 14369975680, "step": 50530, "train_runtime": 491301.4099, "train_tokens_per_second": 29248.798 }, { "epoch": 1.788205401508601, "grad_norm": 0.6015625, "learning_rate": 2.0321341905755763e-05, "loss": 0.3844597578048706, "num_input_tokens_seen": 14372866816, "step": 50540, "train_runtime": 491400.7593, "train_tokens_per_second": 29248.768 }, { "epoch": 1.78855922177233, "grad_norm": 0.58984375, "learning_rate": 2.0319663745834018e-05, "loss": 0.39006433486938474, "num_input_tokens_seen": 14375748352, "step": 50550, "train_runtime": 491501.2781, "train_tokens_per_second": 29248.649 }, { "epoch": 1.7889130420360586, "grad_norm": 0.62109375, "learning_rate": 2.031798600159678e-05, "loss": 0.3903589487075806, "num_input_tokens_seen": 14378604800, "step": 50560, "train_runtime": 491599.3989, "train_tokens_per_second": 29248.622 }, { "epoch": 1.7892668622997876, "grad_norm": 0.59765625, "learning_rate": 2.0316308672872466e-05, "loss": 0.38635687828063964, "num_input_tokens_seen": 14381446144, "step": 50570, "train_runtime": 491694.3128, "train_tokens_per_second": 29248.754 }, { "epoch": 1.7896206825635161, "grad_norm": 0.61328125, "learning_rate": 2.0314631759489597e-05, "loss": 0.3876587629318237, "num_input_tokens_seen": 14384275968, "step": 50580, "train_runtime": 491791.4679, "train_tokens_per_second": 29248.73 }, { "epoch": 1.7899745028272451, "grad_norm": 0.59375, "learning_rate": 2.0312955261276783e-05, "loss": 0.38613548278808596, "num_input_tokens_seen": 14387086464, "step": 50590, "train_runtime": 491886.9151, "train_tokens_per_second": 29248.768 }, { "epoch": 1.7903283230909737, "grad_norm": 0.62109375, "learning_rate": 2.0311279178062754e-05, "loss": 0.3904703617095947, "num_input_tokens_seen": 14389862144, "step": 50600, "train_runtime": 491978.3965, "train_tokens_per_second": 29248.972 }, { "epoch": 1.7906821433547027, "grad_norm": 0.63671875, "learning_rate": 2.0309603509676307e-05, "loss": 0.39000988006591797, "num_input_tokens_seen": 14392652352, "step": 50610, "train_runtime": 492070.7514, "train_tokens_per_second": 29249.152 }, { "epoch": 1.7910359636184314, "grad_norm": 0.62109375, "learning_rate": 2.0307928255946362e-05, "loss": 0.3903473377227783, "num_input_tokens_seen": 14395532992, "step": 50620, "train_runtime": 492168.4055, "train_tokens_per_second": 29249.202 }, { "epoch": 1.7913897838821602, "grad_norm": 0.6015625, "learning_rate": 2.0306253416701935e-05, "loss": 0.38553466796875, "num_input_tokens_seen": 14398337088, "step": 50630, "train_runtime": 492262.4211, "train_tokens_per_second": 29249.312 }, { "epoch": 1.791743604145889, "grad_norm": 0.62109375, "learning_rate": 2.0304578991772127e-05, "loss": 0.38522820472717284, "num_input_tokens_seen": 14401125888, "step": 50640, "train_runtime": 492355.2867, "train_tokens_per_second": 29249.459 }, { "epoch": 1.7920974244096177, "grad_norm": 0.5859375, "learning_rate": 2.030290498098616e-05, "loss": 0.3891852855682373, "num_input_tokens_seen": 14403993088, "step": 50650, "train_runtime": 492454.1209, "train_tokens_per_second": 29249.411 }, { "epoch": 1.7924512446733465, "grad_norm": 0.609375, "learning_rate": 2.0301231384173324e-05, "loss": 0.3905333995819092, "num_input_tokens_seen": 14406857472, "step": 50660, "train_runtime": 492551.175, "train_tokens_per_second": 29249.463 }, { "epoch": 1.7928050649370753, "grad_norm": 0.62890625, "learning_rate": 2.0299558201163047e-05, "loss": 0.387405252456665, "num_input_tokens_seen": 14409669824, "step": 50670, "train_runtime": 492646.5498, "train_tokens_per_second": 29249.509 }, { "epoch": 1.793158885200804, "grad_norm": 0.61328125, "learning_rate": 2.0297885431784816e-05, "loss": 0.391724967956543, "num_input_tokens_seen": 14412567104, "step": 50680, "train_runtime": 492745.1343, "train_tokens_per_second": 29249.537 }, { "epoch": 1.7935127054645328, "grad_norm": 0.625, "learning_rate": 2.0296213075868243e-05, "loss": 0.38786237239837645, "num_input_tokens_seen": 14415413184, "step": 50690, "train_runtime": 492842.4688, "train_tokens_per_second": 29249.535 }, { "epoch": 1.7938665257282618, "grad_norm": 0.62109375, "learning_rate": 2.0294541133243025e-05, "loss": 0.38762688636779785, "num_input_tokens_seen": 14418257472, "step": 50700, "train_runtime": 492938.2576, "train_tokens_per_second": 29249.622 }, { "epoch": 1.7942203459919903, "grad_norm": 0.62109375, "learning_rate": 2.0292869603738964e-05, "loss": 0.3917722702026367, "num_input_tokens_seen": 14421087296, "step": 50710, "train_runtime": 493035.0339, "train_tokens_per_second": 29249.62 }, { "epoch": 1.7945741662557193, "grad_norm": 0.62109375, "learning_rate": 2.0291198487185956e-05, "loss": 0.3887815237045288, "num_input_tokens_seen": 14423951360, "step": 50720, "train_runtime": 493132.4879, "train_tokens_per_second": 29249.647 }, { "epoch": 1.7949279865194478, "grad_norm": 0.62109375, "learning_rate": 2.0289527783413993e-05, "loss": 0.3890718460083008, "num_input_tokens_seen": 14426803840, "step": 50730, "train_runtime": 493226.9739, "train_tokens_per_second": 29249.827 }, { "epoch": 1.7952818067831768, "grad_norm": 0.6171875, "learning_rate": 2.0287857492253182e-05, "loss": 0.39197487831115724, "num_input_tokens_seen": 14429652032, "step": 50740, "train_runtime": 493322.6958, "train_tokens_per_second": 29249.925 }, { "epoch": 1.7956356270469054, "grad_norm": 0.578125, "learning_rate": 2.0286187613533696e-05, "loss": 0.388737154006958, "num_input_tokens_seen": 14432463744, "step": 50750, "train_runtime": 493417.379, "train_tokens_per_second": 29250.011 }, { "epoch": 1.7959894473106344, "grad_norm": 0.58984375, "learning_rate": 2.0284518147085836e-05, "loss": 0.3835196256637573, "num_input_tokens_seen": 14435292544, "step": 50760, "train_runtime": 493514.6831, "train_tokens_per_second": 29249.976 }, { "epoch": 1.796343267574363, "grad_norm": 0.59765625, "learning_rate": 2.0282849092739986e-05, "loss": 0.39655866622924807, "num_input_tokens_seen": 14438149312, "step": 50770, "train_runtime": 493613.1606, "train_tokens_per_second": 29249.928 }, { "epoch": 1.796697087838092, "grad_norm": 0.6171875, "learning_rate": 2.0281180450326632e-05, "loss": 0.38693928718566895, "num_input_tokens_seen": 14441028352, "step": 50780, "train_runtime": 493714.0791, "train_tokens_per_second": 29249.78 }, { "epoch": 1.7970509081018207, "grad_norm": 0.60546875, "learning_rate": 2.0279512219676352e-05, "loss": 0.3872836589813232, "num_input_tokens_seen": 14443823424, "step": 50790, "train_runtime": 493807.194, "train_tokens_per_second": 29249.925 }, { "epoch": 1.7974047283655494, "grad_norm": 0.58984375, "learning_rate": 2.027784440061983e-05, "loss": 0.39070749282836914, "num_input_tokens_seen": 14446639488, "step": 50800, "train_runtime": 493904.4922, "train_tokens_per_second": 29249.865 }, { "epoch": 1.7977585486292782, "grad_norm": 0.6328125, "learning_rate": 2.0276176992987846e-05, "loss": 0.38802294731140136, "num_input_tokens_seen": 14449491200, "step": 50810, "train_runtime": 494003.0615, "train_tokens_per_second": 29249.801 }, { "epoch": 1.798112368893007, "grad_norm": 0.62109375, "learning_rate": 2.027450999661126e-05, "loss": 0.39028615951538087, "num_input_tokens_seen": 14452334592, "step": 50820, "train_runtime": 494098.4464, "train_tokens_per_second": 29249.909 }, { "epoch": 1.7984661891567357, "grad_norm": 0.58984375, "learning_rate": 2.027284341132106e-05, "loss": 0.39107933044433596, "num_input_tokens_seen": 14455210944, "step": 50830, "train_runtime": 494198.7975, "train_tokens_per_second": 29249.79 }, { "epoch": 1.7988200094204645, "grad_norm": 0.609375, "learning_rate": 2.0271177236948313e-05, "loss": 0.3896492958068848, "num_input_tokens_seen": 14458058048, "step": 50840, "train_runtime": 494295.6551, "train_tokens_per_second": 29249.818 }, { "epoch": 1.7991738296841933, "grad_norm": 0.62109375, "learning_rate": 2.0269511473324176e-05, "loss": 0.3889066934585571, "num_input_tokens_seen": 14460942528, "step": 50850, "train_runtime": 494396.2546, "train_tokens_per_second": 29249.701 }, { "epoch": 1.799527649947922, "grad_norm": 0.578125, "learning_rate": 2.0267846120279927e-05, "loss": 0.3871904373168945, "num_input_tokens_seen": 14463786432, "step": 50860, "train_runtime": 494491.7351, "train_tokens_per_second": 29249.804 }, { "epoch": 1.799881470211651, "grad_norm": 0.6015625, "learning_rate": 2.0266181177646913e-05, "loss": 0.3901465177536011, "num_input_tokens_seen": 14466568000, "step": 50870, "train_runtime": 494584.0623, "train_tokens_per_second": 29249.968 }, { "epoch": 1.8002352904753796, "grad_norm": 0.62109375, "learning_rate": 2.0264516645256593e-05, "loss": 0.3877096652984619, "num_input_tokens_seen": 14469439616, "step": 50880, "train_runtime": 494682.7995, "train_tokens_per_second": 29249.935 }, { "epoch": 1.8005891107391085, "grad_norm": 0.62109375, "learning_rate": 2.0262852522940528e-05, "loss": 0.3882959604263306, "num_input_tokens_seen": 14472290816, "step": 50890, "train_runtime": 494775.3336, "train_tokens_per_second": 29250.227 }, { "epoch": 1.800942931002837, "grad_norm": 0.6171875, "learning_rate": 2.0261188810530366e-05, "loss": 0.39019896984100344, "num_input_tokens_seen": 14475117760, "step": 50900, "train_runtime": 494872.4894, "train_tokens_per_second": 29250.197 }, { "epoch": 1.801296751266566, "grad_norm": 0.59375, "learning_rate": 2.025952550785785e-05, "loss": 0.3897997379302979, "num_input_tokens_seen": 14478041856, "step": 50910, "train_runtime": 494976.8509, "train_tokens_per_second": 29249.937 }, { "epoch": 1.8016505715302946, "grad_norm": 0.609375, "learning_rate": 2.0257862614754837e-05, "loss": 0.38805365562438965, "num_input_tokens_seen": 14480872128, "step": 50920, "train_runtime": 495075.6908, "train_tokens_per_second": 29249.815 }, { "epoch": 1.8020043917940236, "grad_norm": 0.6015625, "learning_rate": 2.0256200131053257e-05, "loss": 0.3874636173248291, "num_input_tokens_seen": 14483709056, "step": 50930, "train_runtime": 495171.2177, "train_tokens_per_second": 29249.901 }, { "epoch": 1.8023582120577522, "grad_norm": 0.59765625, "learning_rate": 2.025453805658515e-05, "loss": 0.3914686679840088, "num_input_tokens_seen": 14486550784, "step": 50940, "train_runtime": 495268.0834, "train_tokens_per_second": 29249.918 }, { "epoch": 1.8027120323214811, "grad_norm": 0.609375, "learning_rate": 2.0252876391182653e-05, "loss": 0.38584802150726316, "num_input_tokens_seen": 14489419584, "step": 50950, "train_runtime": 495364.9799, "train_tokens_per_second": 29249.988 }, { "epoch": 1.80306585258521, "grad_norm": 0.625, "learning_rate": 2.0251215134677996e-05, "loss": 0.38669064044952395, "num_input_tokens_seen": 14492228352, "step": 50960, "train_runtime": 495458.7484, "train_tokens_per_second": 29250.121 }, { "epoch": 1.8034196728489387, "grad_norm": 0.6015625, "learning_rate": 2.02495542869035e-05, "loss": 0.3868887901306152, "num_input_tokens_seen": 14495119616, "step": 50970, "train_runtime": 495557.0897, "train_tokens_per_second": 29250.151 }, { "epoch": 1.8037734931126674, "grad_norm": 0.6328125, "learning_rate": 2.0247893847691597e-05, "loss": 0.38996105194091796, "num_input_tokens_seen": 14497977664, "step": 50980, "train_runtime": 495655.7573, "train_tokens_per_second": 29250.094 }, { "epoch": 1.8041273133763962, "grad_norm": 0.59765625, "learning_rate": 2.02462338168748e-05, "loss": 0.38741815090179443, "num_input_tokens_seen": 14500845632, "step": 50990, "train_runtime": 495753.7292, "train_tokens_per_second": 29250.099 }, { "epoch": 1.804481133640125, "grad_norm": 0.62890625, "learning_rate": 2.0244574194285724e-05, "loss": 0.387392520904541, "num_input_tokens_seen": 14503726720, "step": 51000, "train_runtime": 495851.7451, "train_tokens_per_second": 29250.127 }, { "epoch": 1.8048349539038537, "grad_norm": 0.59375, "learning_rate": 2.0242914979757085e-05, "loss": 0.3885485649108887, "num_input_tokens_seen": 14506607104, "step": 51010, "train_runtime": 495951.4604, "train_tokens_per_second": 29250.054 }, { "epoch": 1.8051887741675825, "grad_norm": 0.609375, "learning_rate": 2.024125617312169e-05, "loss": 0.38977670669555664, "num_input_tokens_seen": 14509458560, "step": 51020, "train_runtime": 496048.1631, "train_tokens_per_second": 29250.1 }, { "epoch": 1.8055425944313113, "grad_norm": 0.609375, "learning_rate": 2.0239597774212434e-05, "loss": 0.3883575201034546, "num_input_tokens_seen": 14512300352, "step": 51030, "train_runtime": 496145.2953, "train_tokens_per_second": 29250.102 }, { "epoch": 1.8058964146950403, "grad_norm": 0.62890625, "learning_rate": 2.023793978286233e-05, "loss": 0.39366955757141114, "num_input_tokens_seen": 14515180032, "step": 51040, "train_runtime": 496244.5307, "train_tokens_per_second": 29250.055 }, { "epoch": 1.8062502349587688, "grad_norm": 0.609375, "learning_rate": 2.023628219890446e-05, "loss": 0.38989949226379395, "num_input_tokens_seen": 14518073408, "step": 51050, "train_runtime": 496344.502, "train_tokens_per_second": 29249.993 }, { "epoch": 1.8066040552224978, "grad_norm": 0.61328125, "learning_rate": 2.0234625022172022e-05, "loss": 0.39272136688232423, "num_input_tokens_seen": 14520882176, "step": 51060, "train_runtime": 496440.6228, "train_tokens_per_second": 29249.988 }, { "epoch": 1.8069578754862263, "grad_norm": 0.59375, "learning_rate": 2.0232968252498296e-05, "loss": 0.38747172355651854, "num_input_tokens_seen": 14523785792, "step": 51070, "train_runtime": 496541.3672, "train_tokens_per_second": 29249.901 }, { "epoch": 1.8073116957499553, "grad_norm": 0.5859375, "learning_rate": 2.0231311889716673e-05, "loss": 0.38672194480895994, "num_input_tokens_seen": 14526678976, "step": 51080, "train_runtime": 496642.4783, "train_tokens_per_second": 29249.771 }, { "epoch": 1.8076655160136839, "grad_norm": 0.59765625, "learning_rate": 2.022965593366062e-05, "loss": 0.3924574851989746, "num_input_tokens_seen": 14529515904, "step": 51090, "train_runtime": 496739.2706, "train_tokens_per_second": 29249.783 }, { "epoch": 1.8080193362774128, "grad_norm": 0.625, "learning_rate": 2.0228000384163716e-05, "loss": 0.38303341865539553, "num_input_tokens_seen": 14532425728, "step": 51100, "train_runtime": 496838.0788, "train_tokens_per_second": 29249.823 }, { "epoch": 1.8083731565411414, "grad_norm": 0.62109375, "learning_rate": 2.0226345241059623e-05, "loss": 0.38330740928649903, "num_input_tokens_seen": 14535256000, "step": 51110, "train_runtime": 496933.1687, "train_tokens_per_second": 29249.921 }, { "epoch": 1.8087269768048704, "grad_norm": 0.6015625, "learning_rate": 2.022469050418211e-05, "loss": 0.38721954822540283, "num_input_tokens_seen": 14538068928, "step": 51120, "train_runtime": 497028.3479, "train_tokens_per_second": 29249.979 }, { "epoch": 1.8090807970685991, "grad_norm": 0.62890625, "learning_rate": 2.0223036173365033e-05, "loss": 0.3908969879150391, "num_input_tokens_seen": 14540915776, "step": 51130, "train_runtime": 497125.9455, "train_tokens_per_second": 29249.964 }, { "epoch": 1.809434617332328, "grad_norm": 0.62890625, "learning_rate": 2.0221382248442346e-05, "loss": 0.39102463722229003, "num_input_tokens_seen": 14543712704, "step": 51140, "train_runtime": 497220.2099, "train_tokens_per_second": 29250.043 }, { "epoch": 1.8097884375960567, "grad_norm": 0.6328125, "learning_rate": 2.0219728729248095e-05, "loss": 0.3879990577697754, "num_input_tokens_seen": 14546570112, "step": 51150, "train_runtime": 497318.0571, "train_tokens_per_second": 29250.034 }, { "epoch": 1.8101422578597854, "grad_norm": 0.59375, "learning_rate": 2.0218075615616425e-05, "loss": 0.3864192724227905, "num_input_tokens_seen": 14549390400, "step": 51160, "train_runtime": 497413.9602, "train_tokens_per_second": 29250.064 }, { "epoch": 1.8104960781235142, "grad_norm": 0.59765625, "learning_rate": 2.0216422907381577e-05, "loss": 0.3912806034088135, "num_input_tokens_seen": 14552233984, "step": 51170, "train_runtime": 497510.5844, "train_tokens_per_second": 29250.099 }, { "epoch": 1.810849898387243, "grad_norm": 0.6015625, "learning_rate": 2.021477060437788e-05, "loss": 0.3887171268463135, "num_input_tokens_seen": 14555083712, "step": 51180, "train_runtime": 497607.9912, "train_tokens_per_second": 29250.1 }, { "epoch": 1.8112037186509717, "grad_norm": 0.63671875, "learning_rate": 2.021311870643976e-05, "loss": 0.38593878746032717, "num_input_tokens_seen": 14557916544, "step": 51190, "train_runtime": 497703.4896, "train_tokens_per_second": 29250.18 }, { "epoch": 1.8115575389147005, "grad_norm": 0.609375, "learning_rate": 2.0211467213401743e-05, "loss": 0.39083452224731446, "num_input_tokens_seen": 14560795200, "step": 51200, "train_runtime": 497804.4282, "train_tokens_per_second": 29250.031 }, { "epoch": 1.8119113591784295, "grad_norm": 0.6015625, "learning_rate": 2.0209816125098453e-05, "loss": 0.3883590459823608, "num_input_tokens_seen": 14563599168, "step": 51210, "train_runtime": 497899.0444, "train_tokens_per_second": 29250.105 }, { "epoch": 1.812265179442158, "grad_norm": 0.62890625, "learning_rate": 2.020816544136459e-05, "loss": 0.38519399166107177, "num_input_tokens_seen": 14566429632, "step": 51220, "train_runtime": 497994.5208, "train_tokens_per_second": 29250.181 }, { "epoch": 1.812618999705887, "grad_norm": 0.625, "learning_rate": 2.0206515162034965e-05, "loss": 0.38746793270111085, "num_input_tokens_seen": 14569262720, "step": 51230, "train_runtime": 498090.7423, "train_tokens_per_second": 29250.218 }, { "epoch": 1.8129728199696156, "grad_norm": 0.61328125, "learning_rate": 2.0204865286944477e-05, "loss": 0.38526105880737305, "num_input_tokens_seen": 14572097408, "step": 51240, "train_runtime": 498189.7699, "train_tokens_per_second": 29250.094 }, { "epoch": 1.8133266402333446, "grad_norm": 0.59765625, "learning_rate": 2.0203215815928123e-05, "loss": 0.38857054710388184, "num_input_tokens_seen": 14574926208, "step": 51250, "train_runtime": 498286.82, "train_tokens_per_second": 29250.074 }, { "epoch": 1.813680460497073, "grad_norm": 0.6171875, "learning_rate": 2.0201566748820995e-05, "loss": 0.38366098403930665, "num_input_tokens_seen": 14577741888, "step": 51260, "train_runtime": 498381.9565, "train_tokens_per_second": 29250.14 }, { "epoch": 1.814034280760802, "grad_norm": 0.625, "learning_rate": 2.019991808545827e-05, "loss": 0.3872786521911621, "num_input_tokens_seen": 14580565376, "step": 51270, "train_runtime": 498478.4629, "train_tokens_per_second": 29250.141 }, { "epoch": 1.8143881010245309, "grad_norm": 0.59765625, "learning_rate": 2.019826982567523e-05, "loss": 0.3879929304122925, "num_input_tokens_seen": 14583456704, "step": 51280, "train_runtime": 498579.5898, "train_tokens_per_second": 29250.007 }, { "epoch": 1.8147419212882596, "grad_norm": 0.6328125, "learning_rate": 2.019662196930725e-05, "loss": 0.39245221614837644, "num_input_tokens_seen": 14586282368, "step": 51290, "train_runtime": 498678.8841, "train_tokens_per_second": 29249.85 }, { "epoch": 1.8150957415519884, "grad_norm": 0.609375, "learning_rate": 2.0194974516189784e-05, "loss": 0.3849053382873535, "num_input_tokens_seen": 14589166144, "step": 51300, "train_runtime": 498778.6819, "train_tokens_per_second": 29249.779 }, { "epoch": 1.8154495618157171, "grad_norm": 0.6171875, "learning_rate": 2.019332746615841e-05, "loss": 0.38883171081542967, "num_input_tokens_seen": 14592027904, "step": 51310, "train_runtime": 498876.9275, "train_tokens_per_second": 29249.755 }, { "epoch": 1.815803382079446, "grad_norm": 0.6328125, "learning_rate": 2.0191680819048758e-05, "loss": 0.38864936828613283, "num_input_tokens_seen": 14594885632, "step": 51320, "train_runtime": 498974.4771, "train_tokens_per_second": 29249.764 }, { "epoch": 1.8161572023431747, "grad_norm": 0.625, "learning_rate": 2.0190034574696592e-05, "loss": 0.3953663110733032, "num_input_tokens_seen": 14597692416, "step": 51330, "train_runtime": 499069.0467, "train_tokens_per_second": 29249.845 }, { "epoch": 1.8165110226069034, "grad_norm": 0.609375, "learning_rate": 2.0188388732937753e-05, "loss": 0.3909308433532715, "num_input_tokens_seen": 14600551936, "step": 51340, "train_runtime": 499168.0665, "train_tokens_per_second": 29249.772 }, { "epoch": 1.8168648428706322, "grad_norm": 0.61328125, "learning_rate": 2.0186743293608164e-05, "loss": 0.3911138534545898, "num_input_tokens_seen": 14603393216, "step": 51350, "train_runtime": 499263.8772, "train_tokens_per_second": 29249.849 }, { "epoch": 1.817218663134361, "grad_norm": 0.62890625, "learning_rate": 2.0185098256543866e-05, "loss": 0.39126052856445315, "num_input_tokens_seen": 14606230912, "step": 51360, "train_runtime": 499362.5553, "train_tokens_per_second": 29249.752 }, { "epoch": 1.8175724833980897, "grad_norm": 0.609375, "learning_rate": 2.018345362158098e-05, "loss": 0.3843747854232788, "num_input_tokens_seen": 14609116672, "step": 51370, "train_runtime": 499460.4393, "train_tokens_per_second": 29249.797 }, { "epoch": 1.8179263036618187, "grad_norm": 0.58203125, "learning_rate": 2.018180938855571e-05, "loss": 0.38645114898681643, "num_input_tokens_seen": 14611964800, "step": 51380, "train_runtime": 499558.0418, "train_tokens_per_second": 29249.784 }, { "epoch": 1.8182801239255473, "grad_norm": 0.65234375, "learning_rate": 2.0180165557304377e-05, "loss": 0.38966965675354004, "num_input_tokens_seen": 14614870656, "step": 51390, "train_runtime": 499656.6361, "train_tokens_per_second": 29249.828 }, { "epoch": 1.8186339441892763, "grad_norm": 0.63671875, "learning_rate": 2.0178522127663373e-05, "loss": 0.38861324787139895, "num_input_tokens_seen": 14617749760, "step": 51400, "train_runtime": 499754.2409, "train_tokens_per_second": 29249.876 }, { "epoch": 1.8189877644530048, "grad_norm": 0.6015625, "learning_rate": 2.0176879099469196e-05, "loss": 0.3853743553161621, "num_input_tokens_seen": 14620598784, "step": 51410, "train_runtime": 499852.5015, "train_tokens_per_second": 29249.826 }, { "epoch": 1.8193415847167338, "grad_norm": 0.6171875, "learning_rate": 2.0175236472558443e-05, "loss": 0.3880643129348755, "num_input_tokens_seen": 14623430720, "step": 51420, "train_runtime": 499948.6648, "train_tokens_per_second": 29249.865 }, { "epoch": 1.8196954049804623, "grad_norm": 0.6328125, "learning_rate": 2.017359424676778e-05, "loss": 0.39051432609558107, "num_input_tokens_seen": 14626291456, "step": 51430, "train_runtime": 500046.9283, "train_tokens_per_second": 29249.838 }, { "epoch": 1.8200492252441913, "grad_norm": 0.63671875, "learning_rate": 2.0171952421933997e-05, "loss": 0.3882394552230835, "num_input_tokens_seen": 14629185536, "step": 51440, "train_runtime": 500147.3461, "train_tokens_per_second": 29249.751 }, { "epoch": 1.82040304550792, "grad_norm": 0.59375, "learning_rate": 2.017031099789395e-05, "loss": 0.3860489368438721, "num_input_tokens_seen": 14631982272, "step": 51450, "train_runtime": 500244.0866, "train_tokens_per_second": 29249.686 }, { "epoch": 1.8207568657716489, "grad_norm": 0.59375, "learning_rate": 2.0168669974484606e-05, "loss": 0.3885204792022705, "num_input_tokens_seen": 14634767872, "step": 51460, "train_runtime": 500335.4841, "train_tokens_per_second": 29249.91 }, { "epoch": 1.8211106860353776, "grad_norm": 0.62109375, "learning_rate": 2.0167029351543015e-05, "loss": 0.39079971313476564, "num_input_tokens_seen": 14637595008, "step": 51470, "train_runtime": 500432.4641, "train_tokens_per_second": 29249.891 }, { "epoch": 1.8214645062991064, "grad_norm": 0.6015625, "learning_rate": 2.0165389128906324e-05, "loss": 0.3891436576843262, "num_input_tokens_seen": 14640451712, "step": 51480, "train_runtime": 500529.9603, "train_tokens_per_second": 29249.901 }, { "epoch": 1.8218183265628352, "grad_norm": 0.625, "learning_rate": 2.0163749306411775e-05, "loss": 0.3888471364974976, "num_input_tokens_seen": 14643309056, "step": 51490, "train_runtime": 500631.0391, "train_tokens_per_second": 29249.703 }, { "epoch": 1.822172146826564, "grad_norm": 0.59375, "learning_rate": 2.0162109883896694e-05, "loss": 0.3852571725845337, "num_input_tokens_seen": 14646130432, "step": 51500, "train_runtime": 500728.5953, "train_tokens_per_second": 29249.639 }, { "epoch": 1.8225259670902927, "grad_norm": 0.5703125, "learning_rate": 2.016047086119851e-05, "loss": 0.3879885196685791, "num_input_tokens_seen": 14649022720, "step": 51510, "train_runtime": 500828.2873, "train_tokens_per_second": 29249.591 }, { "epoch": 1.8228797873540215, "grad_norm": 0.63671875, "learning_rate": 2.015883223815473e-05, "loss": 0.38724889755249026, "num_input_tokens_seen": 14651866240, "step": 51520, "train_runtime": 500924.9569, "train_tokens_per_second": 29249.623 }, { "epoch": 1.8232336076177504, "grad_norm": 0.6015625, "learning_rate": 2.0157194014602974e-05, "loss": 0.3896310329437256, "num_input_tokens_seen": 14654656192, "step": 51530, "train_runtime": 501020.631, "train_tokens_per_second": 29249.606 }, { "epoch": 1.823587427881479, "grad_norm": 0.59765625, "learning_rate": 2.0155556190380938e-05, "loss": 0.39223451614379884, "num_input_tokens_seen": 14657508992, "step": 51540, "train_runtime": 501118.8798, "train_tokens_per_second": 29249.564 }, { "epoch": 1.823941248145208, "grad_norm": 0.62109375, "learning_rate": 2.0153918765326414e-05, "loss": 0.3866464853286743, "num_input_tokens_seen": 14660358720, "step": 51550, "train_runtime": 501218.5585, "train_tokens_per_second": 29249.433 }, { "epoch": 1.8242950684089365, "grad_norm": 0.6328125, "learning_rate": 2.0152281739277286e-05, "loss": 0.38678860664367676, "num_input_tokens_seen": 14663172096, "step": 51560, "train_runtime": 501313.8766, "train_tokens_per_second": 29249.484 }, { "epoch": 1.8246488886726655, "grad_norm": 0.62109375, "learning_rate": 2.0150645112071542e-05, "loss": 0.38818650245666503, "num_input_tokens_seen": 14666016192, "step": 51570, "train_runtime": 501411.9656, "train_tokens_per_second": 29249.434 }, { "epoch": 1.825002708936394, "grad_norm": 0.61328125, "learning_rate": 2.0149008883547245e-05, "loss": 0.38543081283569336, "num_input_tokens_seen": 14668849408, "step": 51580, "train_runtime": 501509.2997, "train_tokens_per_second": 29249.407 }, { "epoch": 1.825356529200123, "grad_norm": 0.62109375, "learning_rate": 2.0147373053542558e-05, "loss": 0.3867804527282715, "num_input_tokens_seen": 14671720320, "step": 51590, "train_runtime": 501608.2592, "train_tokens_per_second": 29249.36 }, { "epoch": 1.8257103494638516, "grad_norm": 0.62890625, "learning_rate": 2.014573762189573e-05, "loss": 0.39119749069213866, "num_input_tokens_seen": 14674547072, "step": 51600, "train_runtime": 501703.147, "train_tokens_per_second": 29249.462 }, { "epoch": 1.8260641697275806, "grad_norm": 0.6171875, "learning_rate": 2.0144102588445116e-05, "loss": 0.39220762252807617, "num_input_tokens_seen": 14677419392, "step": 51610, "train_runtime": 501803.2585, "train_tokens_per_second": 29249.351 }, { "epoch": 1.8264179899913093, "grad_norm": 0.62109375, "learning_rate": 2.014246795302915e-05, "loss": 0.38856210708618166, "num_input_tokens_seen": 14680263424, "step": 51620, "train_runtime": 501902.3775, "train_tokens_per_second": 29249.241 }, { "epoch": 1.826771810255038, "grad_norm": 0.6328125, "learning_rate": 2.0140833715486358e-05, "loss": 0.39266233444213866, "num_input_tokens_seen": 14683072576, "step": 51630, "train_runtime": 501996.335, "train_tokens_per_second": 29249.362 }, { "epoch": 1.8271256305187669, "grad_norm": 0.61328125, "learning_rate": 2.013919987565536e-05, "loss": 0.3925272703170776, "num_input_tokens_seen": 14685962816, "step": 51640, "train_runtime": 502097.4776, "train_tokens_per_second": 29249.226 }, { "epoch": 1.8274794507824956, "grad_norm": 0.6015625, "learning_rate": 2.0137566433374875e-05, "loss": 0.3927711009979248, "num_input_tokens_seen": 14688814784, "step": 51650, "train_runtime": 502193.8079, "train_tokens_per_second": 29249.295 }, { "epoch": 1.8278332710462244, "grad_norm": 0.6328125, "learning_rate": 2.0135933388483708e-05, "loss": 0.3837876796722412, "num_input_tokens_seen": 14691624512, "step": 51660, "train_runtime": 502288.6677, "train_tokens_per_second": 29249.365 }, { "epoch": 1.8281870913099532, "grad_norm": 0.6171875, "learning_rate": 2.0134300740820746e-05, "loss": 0.3872742414474487, "num_input_tokens_seen": 14694446016, "step": 51670, "train_runtime": 502384.053, "train_tokens_per_second": 29249.428 }, { "epoch": 1.828540911573682, "grad_norm": 0.59375, "learning_rate": 2.0132668490224984e-05, "loss": 0.3876617431640625, "num_input_tokens_seen": 14697304640, "step": 51680, "train_runtime": 502481.7891, "train_tokens_per_second": 29249.427 }, { "epoch": 1.8288947318374107, "grad_norm": 0.5703125, "learning_rate": 2.0131036636535498e-05, "loss": 0.38526296615600586, "num_input_tokens_seen": 14700168192, "step": 51690, "train_runtime": 502580.5036, "train_tokens_per_second": 29249.38 }, { "epoch": 1.8292485521011397, "grad_norm": 0.6171875, "learning_rate": 2.012940517959146e-05, "loss": 0.38771839141845704, "num_input_tokens_seen": 14703018816, "step": 51700, "train_runtime": 502675.857, "train_tokens_per_second": 29249.503 }, { "epoch": 1.8296023723648682, "grad_norm": 0.6171875, "learning_rate": 2.0127774119232128e-05, "loss": 0.3868736743927002, "num_input_tokens_seen": 14705870720, "step": 51710, "train_runtime": 502772.4787, "train_tokens_per_second": 29249.554 }, { "epoch": 1.8299561926285972, "grad_norm": 0.609375, "learning_rate": 2.0126143455296853e-05, "loss": 0.388594388961792, "num_input_tokens_seen": 14708772032, "step": 51720, "train_runtime": 502872.9558, "train_tokens_per_second": 29249.479 }, { "epoch": 1.8303100128923258, "grad_norm": 0.60546875, "learning_rate": 2.012451318762508e-05, "loss": 0.3878726243972778, "num_input_tokens_seen": 14711634496, "step": 51730, "train_runtime": 502970.4788, "train_tokens_per_second": 29249.499 }, { "epoch": 1.8306638331560547, "grad_norm": 0.609375, "learning_rate": 2.0122883316056348e-05, "loss": 0.38696799278259275, "num_input_tokens_seen": 14714460160, "step": 51740, "train_runtime": 503066.7496, "train_tokens_per_second": 29249.518 }, { "epoch": 1.8310176534197833, "grad_norm": 0.578125, "learning_rate": 2.0121253840430276e-05, "loss": 0.3870852470397949, "num_input_tokens_seen": 14717380800, "step": 51750, "train_runtime": 503169.045, "train_tokens_per_second": 29249.376 }, { "epoch": 1.8313714736835123, "grad_norm": 0.60546875, "learning_rate": 2.0119624760586583e-05, "loss": 0.3874931335449219, "num_input_tokens_seen": 14720253952, "step": 51760, "train_runtime": 503267.78, "train_tokens_per_second": 29249.347 }, { "epoch": 1.8317252939472408, "grad_norm": 0.58984375, "learning_rate": 2.0117996076365077e-05, "loss": 0.38912889957427976, "num_input_tokens_seen": 14723105536, "step": 51770, "train_runtime": 503365.1076, "train_tokens_per_second": 29249.357 }, { "epoch": 1.8320791142109698, "grad_norm": 0.5859375, "learning_rate": 2.0116367787605653e-05, "loss": 0.38758020401000975, "num_input_tokens_seen": 14725951360, "step": 51780, "train_runtime": 503462.9393, "train_tokens_per_second": 29249.325 }, { "epoch": 1.8324329344746986, "grad_norm": 0.625, "learning_rate": 2.01147398941483e-05, "loss": 0.38751816749572754, "num_input_tokens_seen": 14728826624, "step": 51790, "train_runtime": 503561.3377, "train_tokens_per_second": 29249.32 }, { "epoch": 1.8327867547384273, "grad_norm": 0.6015625, "learning_rate": 2.01131123958331e-05, "loss": 0.3913458824157715, "num_input_tokens_seen": 14731645760, "step": 51800, "train_runtime": 503653.669, "train_tokens_per_second": 29249.555 }, { "epoch": 1.833140575002156, "grad_norm": 0.59765625, "learning_rate": 2.0111485292500217e-05, "loss": 0.38903346061706545, "num_input_tokens_seen": 14734529472, "step": 51810, "train_runtime": 503752.0737, "train_tokens_per_second": 29249.566 }, { "epoch": 1.8334943952658849, "grad_norm": 0.61328125, "learning_rate": 2.010985858398992e-05, "loss": 0.38600361347198486, "num_input_tokens_seen": 14737382208, "step": 51820, "train_runtime": 503848.3798, "train_tokens_per_second": 29249.637 }, { "epoch": 1.8338482155296136, "grad_norm": 0.63671875, "learning_rate": 2.0108232270142547e-05, "loss": 0.38599767684936526, "num_input_tokens_seen": 14740214656, "step": 51830, "train_runtime": 503945.8543, "train_tokens_per_second": 29249.6 }, { "epoch": 1.8342020357933424, "grad_norm": 0.59765625, "learning_rate": 2.0106606350798547e-05, "loss": 0.39305527210235597, "num_input_tokens_seen": 14743062976, "step": 51840, "train_runtime": 504044.6211, "train_tokens_per_second": 29249.52 }, { "epoch": 1.8345558560570712, "grad_norm": 0.58203125, "learning_rate": 2.0104980825798458e-05, "loss": 0.383164644241333, "num_input_tokens_seen": 14745890688, "step": 51850, "train_runtime": 504137.9903, "train_tokens_per_second": 29249.711 }, { "epoch": 1.8349096763208, "grad_norm": 0.640625, "learning_rate": 2.0103355694982888e-05, "loss": 0.3885310649871826, "num_input_tokens_seen": 14748708992, "step": 51860, "train_runtime": 504232.4301, "train_tokens_per_second": 29249.822 }, { "epoch": 1.835263496584529, "grad_norm": 0.6171875, "learning_rate": 2.010173095819256e-05, "loss": 0.3892142057418823, "num_input_tokens_seen": 14751567872, "step": 51870, "train_runtime": 504332.7875, "train_tokens_per_second": 29249.671 }, { "epoch": 1.8356173168482575, "grad_norm": 0.59765625, "learning_rate": 2.0100106615268267e-05, "loss": 0.3875137805938721, "num_input_tokens_seen": 14754377344, "step": 51880, "train_runtime": 504429.2492, "train_tokens_per_second": 29249.647 }, { "epoch": 1.8359711371119865, "grad_norm": 0.6171875, "learning_rate": 2.0098482666050902e-05, "loss": 0.3896777868270874, "num_input_tokens_seen": 14757212480, "step": 51890, "train_runtime": 504529.0345, "train_tokens_per_second": 29249.481 }, { "epoch": 1.836324957375715, "grad_norm": 0.5859375, "learning_rate": 2.009685911038145e-05, "loss": 0.3893177270889282, "num_input_tokens_seen": 14760058624, "step": 51900, "train_runtime": 504625.389, "train_tokens_per_second": 29249.536 }, { "epoch": 1.836678777639444, "grad_norm": 0.609375, "learning_rate": 2.0095235948100982e-05, "loss": 0.3884300708770752, "num_input_tokens_seen": 14762878976, "step": 51910, "train_runtime": 504719.8282, "train_tokens_per_second": 29249.651 }, { "epoch": 1.8370325979031725, "grad_norm": 0.640625, "learning_rate": 2.0093613179050662e-05, "loss": 0.3878193378448486, "num_input_tokens_seen": 14765716864, "step": 51920, "train_runtime": 504816.5655, "train_tokens_per_second": 29249.668 }, { "epoch": 1.8373864181669015, "grad_norm": 0.61328125, "learning_rate": 2.0091990803071733e-05, "loss": 0.3849036693572998, "num_input_tokens_seen": 14768661952, "step": 51930, "train_runtime": 504920.4873, "train_tokens_per_second": 29249.481 }, { "epoch": 1.83774023843063, "grad_norm": 0.61328125, "learning_rate": 2.009036882000554e-05, "loss": 0.38760464191436766, "num_input_tokens_seen": 14771459328, "step": 51940, "train_runtime": 505013.5867, "train_tokens_per_second": 29249.628 }, { "epoch": 1.838094058694359, "grad_norm": 0.61328125, "learning_rate": 2.008874722969352e-05, "loss": 0.38884477615356444, "num_input_tokens_seen": 14774306688, "step": 51950, "train_runtime": 505113.5556, "train_tokens_per_second": 29249.476 }, { "epoch": 1.8384478789580878, "grad_norm": 0.60546875, "learning_rate": 2.0087126031977192e-05, "loss": 0.38777933120727537, "num_input_tokens_seen": 14777162176, "step": 51960, "train_runtime": 505210.7378, "train_tokens_per_second": 29249.501 }, { "epoch": 1.8388016992218166, "grad_norm": 0.60546875, "learning_rate": 2.008550522669815e-05, "loss": 0.3837061166763306, "num_input_tokens_seen": 14779979264, "step": 51970, "train_runtime": 505307.3182, "train_tokens_per_second": 29249.486 }, { "epoch": 1.8391555194855453, "grad_norm": 0.6015625, "learning_rate": 2.0083884813698114e-05, "loss": 0.38832640647888184, "num_input_tokens_seen": 14782824768, "step": 51980, "train_runtime": 505403.8279, "train_tokens_per_second": 29249.531 }, { "epoch": 1.839509339749274, "grad_norm": 0.62890625, "learning_rate": 2.008226479281886e-05, "loss": 0.3870819568634033, "num_input_tokens_seen": 14785633472, "step": 51990, "train_runtime": 505499.5477, "train_tokens_per_second": 29249.548 }, { "epoch": 1.8398631600130029, "grad_norm": 0.6171875, "learning_rate": 2.008064516390227e-05, "loss": 0.38431243896484374, "num_input_tokens_seen": 14788486272, "step": 52000, "train_runtime": 505596.1193, "train_tokens_per_second": 29249.604 }, { "epoch": 1.8402169802767316, "grad_norm": 0.59375, "learning_rate": 2.0079025926790312e-05, "loss": 0.38648500442504885, "num_input_tokens_seen": 14791354112, "step": 52010, "train_runtime": 505693.7442, "train_tokens_per_second": 29249.628 }, { "epoch": 1.8405708005404604, "grad_norm": 0.609375, "learning_rate": 2.007740708132504e-05, "loss": 0.3847785472869873, "num_input_tokens_seen": 14794183552, "step": 52020, "train_runtime": 505793.0866, "train_tokens_per_second": 29249.478 }, { "epoch": 1.8409246208041892, "grad_norm": 0.640625, "learning_rate": 2.0075788627348595e-05, "loss": 0.3903635025024414, "num_input_tokens_seen": 14797066048, "step": 52030, "train_runtime": 505891.9421, "train_tokens_per_second": 29249.46 }, { "epoch": 1.8412784410679182, "grad_norm": 0.6015625, "learning_rate": 2.007417056470322e-05, "loss": 0.38654141426086425, "num_input_tokens_seen": 14799977664, "step": 52040, "train_runtime": 505992.337, "train_tokens_per_second": 29249.411 }, { "epoch": 1.8416322613316467, "grad_norm": 0.61328125, "learning_rate": 2.0072552893231236e-05, "loss": 0.3915912389755249, "num_input_tokens_seen": 14802843776, "step": 52050, "train_runtime": 506090.6381, "train_tokens_per_second": 29249.393 }, { "epoch": 1.8419860815953757, "grad_norm": 0.60546875, "learning_rate": 2.0070935612775056e-05, "loss": 0.3833825349807739, "num_input_tokens_seen": 14805666496, "step": 52060, "train_runtime": 506186.0841, "train_tokens_per_second": 29249.454 }, { "epoch": 1.8423399018591042, "grad_norm": 0.609375, "learning_rate": 2.006931872317718e-05, "loss": 0.3913029670715332, "num_input_tokens_seen": 14808541888, "step": 52070, "train_runtime": 506287.0803, "train_tokens_per_second": 29249.298 }, { "epoch": 1.8426937221228332, "grad_norm": 0.6171875, "learning_rate": 2.0067702224280192e-05, "loss": 0.3902284622192383, "num_input_tokens_seen": 14811345728, "step": 52080, "train_runtime": 506380.27, "train_tokens_per_second": 29249.453 }, { "epoch": 1.8430475423865618, "grad_norm": 0.61328125, "learning_rate": 2.0066086115926782e-05, "loss": 0.39210846424102785, "num_input_tokens_seen": 14814217152, "step": 52090, "train_runtime": 506477.9481, "train_tokens_per_second": 29249.481 }, { "epoch": 1.8434013626502908, "grad_norm": 0.625, "learning_rate": 2.0064470397959713e-05, "loss": 0.39340524673461913, "num_input_tokens_seen": 14817025984, "step": 52100, "train_runtime": 506572.8461, "train_tokens_per_second": 29249.546 }, { "epoch": 1.8437551829140195, "grad_norm": 0.6015625, "learning_rate": 2.0062855070221834e-05, "loss": 0.3835534334182739, "num_input_tokens_seen": 14819859648, "step": 52110, "train_runtime": 506669.8526, "train_tokens_per_second": 29249.539 }, { "epoch": 1.8441090031777483, "grad_norm": 0.62890625, "learning_rate": 2.0061240132556102e-05, "loss": 0.3896360158920288, "num_input_tokens_seen": 14822672128, "step": 52120, "train_runtime": 506766.0747, "train_tokens_per_second": 29249.535 }, { "epoch": 1.844462823441477, "grad_norm": 0.59375, "learning_rate": 2.0059625584805542e-05, "loss": 0.38804266452789304, "num_input_tokens_seen": 14825601920, "step": 52130, "train_runtime": 506869.6919, "train_tokens_per_second": 29249.336 }, { "epoch": 1.8448166437052058, "grad_norm": 0.578125, "learning_rate": 2.0058011426813275e-05, "loss": 0.39243288040161134, "num_input_tokens_seen": 14828473088, "step": 52140, "train_runtime": 506970.8204, "train_tokens_per_second": 29249.165 }, { "epoch": 1.8451704639689346, "grad_norm": 0.609375, "learning_rate": 2.0056397658422517e-05, "loss": 0.39058969020843504, "num_input_tokens_seen": 14831337536, "step": 52150, "train_runtime": 507069.6306, "train_tokens_per_second": 29249.114 }, { "epoch": 1.8455242842326633, "grad_norm": 0.609375, "learning_rate": 2.005478427947656e-05, "loss": 0.39193899631500245, "num_input_tokens_seen": 14834190336, "step": 52160, "train_runtime": 507166.6087, "train_tokens_per_second": 29249.146 }, { "epoch": 1.8458781044963921, "grad_norm": 0.60546875, "learning_rate": 2.005317128981879e-05, "loss": 0.3927168846130371, "num_input_tokens_seen": 14837054976, "step": 52170, "train_runtime": 507267.6291, "train_tokens_per_second": 29248.969 }, { "epoch": 1.8462319247601209, "grad_norm": 0.640625, "learning_rate": 2.005155868929269e-05, "loss": 0.3869420051574707, "num_input_tokens_seen": 14839866816, "step": 52180, "train_runtime": 507363.1584, "train_tokens_per_second": 29249.004 }, { "epoch": 1.8465857450238496, "grad_norm": 0.62890625, "learning_rate": 2.0049946477741817e-05, "loss": 0.38881487846374513, "num_input_tokens_seen": 14842770944, "step": 52190, "train_runtime": 507463.65, "train_tokens_per_second": 29248.934 }, { "epoch": 1.8469395652875784, "grad_norm": 0.578125, "learning_rate": 2.0048334655009818e-05, "loss": 0.38770217895507814, "num_input_tokens_seen": 14845628288, "step": 52200, "train_runtime": 507558.5093, "train_tokens_per_second": 29249.097 }, { "epoch": 1.8472933855513074, "grad_norm": 0.6015625, "learning_rate": 2.004672322094043e-05, "loss": 0.38989987373352053, "num_input_tokens_seen": 14848459520, "step": 52210, "train_runtime": 507652.5757, "train_tokens_per_second": 29249.255 }, { "epoch": 1.847647205815036, "grad_norm": 0.62109375, "learning_rate": 2.00451121753775e-05, "loss": 0.3895394802093506, "num_input_tokens_seen": 14851264192, "step": 52220, "train_runtime": 507747.0476, "train_tokens_per_second": 29249.336 }, { "epoch": 1.848001026078765, "grad_norm": 0.6015625, "learning_rate": 2.0043501518164916e-05, "loss": 0.3878207206726074, "num_input_tokens_seen": 14854066368, "step": 52230, "train_runtime": 507840.7596, "train_tokens_per_second": 29249.457 }, { "epoch": 1.8483548463424935, "grad_norm": 0.62890625, "learning_rate": 2.0041891249146692e-05, "loss": 0.3886967658996582, "num_input_tokens_seen": 14856942720, "step": 52240, "train_runtime": 507940.7347, "train_tokens_per_second": 29249.363 }, { "epoch": 1.8487086666062225, "grad_norm": 0.63671875, "learning_rate": 2.0040281368166923e-05, "loss": 0.3910306692123413, "num_input_tokens_seen": 14859740992, "step": 52250, "train_runtime": 508035.4659, "train_tokens_per_second": 29249.417 }, { "epoch": 1.849062486869951, "grad_norm": 0.640625, "learning_rate": 2.0038671875069774e-05, "loss": 0.38906378746032716, "num_input_tokens_seen": 14862599808, "step": 52260, "train_runtime": 508135.6772, "train_tokens_per_second": 29249.274 }, { "epoch": 1.84941630713368, "grad_norm": 0.62109375, "learning_rate": 2.0037062769699525e-05, "loss": 0.3852107524871826, "num_input_tokens_seen": 14865442304, "step": 52270, "train_runtime": 508233.7452, "train_tokens_per_second": 29249.223 }, { "epoch": 1.8497701273974088, "grad_norm": 0.61328125, "learning_rate": 2.0035454051900516e-05, "loss": 0.3884259223937988, "num_input_tokens_seen": 14868314304, "step": 52280, "train_runtime": 508332.1903, "train_tokens_per_second": 29249.209 }, { "epoch": 1.8501239476611375, "grad_norm": 0.59765625, "learning_rate": 2.003384572151719e-05, "loss": 0.38514723777771, "num_input_tokens_seen": 14871239232, "step": 52290, "train_runtime": 508432.5702, "train_tokens_per_second": 29249.187 }, { "epoch": 1.8504777679248663, "grad_norm": 0.578125, "learning_rate": 2.0032237778394082e-05, "loss": 0.38457412719726564, "num_input_tokens_seen": 14874111104, "step": 52300, "train_runtime": 508529.5118, "train_tokens_per_second": 29249.258 }, { "epoch": 1.850831588188595, "grad_norm": 0.6171875, "learning_rate": 2.0030630222375794e-05, "loss": 0.3913117408752441, "num_input_tokens_seen": 14876953088, "step": 52310, "train_runtime": 508627.3621, "train_tokens_per_second": 29249.219 }, { "epoch": 1.8511854084523238, "grad_norm": 0.59375, "learning_rate": 2.0029023053307043e-05, "loss": 0.3888120174407959, "num_input_tokens_seen": 14879821632, "step": 52320, "train_runtime": 508726.9111, "train_tokens_per_second": 29249.134 }, { "epoch": 1.8515392287160526, "grad_norm": 0.58984375, "learning_rate": 2.0027416271032604e-05, "loss": 0.38582258224487304, "num_input_tokens_seen": 14882681024, "step": 52330, "train_runtime": 508824.0878, "train_tokens_per_second": 29249.168 }, { "epoch": 1.8518930489797814, "grad_norm": 0.6171875, "learning_rate": 2.0025809875397362e-05, "loss": 0.3930107593536377, "num_input_tokens_seen": 14885498688, "step": 52340, "train_runtime": 508921.175, "train_tokens_per_second": 29249.124 }, { "epoch": 1.8522468692435101, "grad_norm": 0.61328125, "learning_rate": 2.002420386624628e-05, "loss": 0.39712607860565186, "num_input_tokens_seen": 14888316288, "step": 52350, "train_runtime": 509016.525, "train_tokens_per_second": 29249.181 }, { "epoch": 1.852600689507239, "grad_norm": 0.60546875, "learning_rate": 2.0022598243424406e-05, "loss": 0.39173412322998047, "num_input_tokens_seen": 14891132864, "step": 52360, "train_runtime": 509111.5333, "train_tokens_per_second": 29249.255 }, { "epoch": 1.8529545097709677, "grad_norm": 0.625, "learning_rate": 2.0020993006776878e-05, "loss": 0.3871928691864014, "num_input_tokens_seen": 14893995456, "step": 52370, "train_runtime": 509210.0886, "train_tokens_per_second": 29249.215 }, { "epoch": 1.8533083300346966, "grad_norm": 0.58984375, "learning_rate": 2.0019388156148922e-05, "loss": 0.390073299407959, "num_input_tokens_seen": 14896844864, "step": 52380, "train_runtime": 509305.57, "train_tokens_per_second": 29249.326 }, { "epoch": 1.8536621502984252, "grad_norm": 0.60546875, "learning_rate": 2.001778369138585e-05, "loss": 0.3903347969055176, "num_input_tokens_seen": 14899698176, "step": 52390, "train_runtime": 509402.5361, "train_tokens_per_second": 29249.36 }, { "epoch": 1.8540159705621542, "grad_norm": 0.59375, "learning_rate": 2.001617961233306e-05, "loss": 0.39125995635986327, "num_input_tokens_seen": 14902509760, "step": 52400, "train_runtime": 509500.6138, "train_tokens_per_second": 29249.248 }, { "epoch": 1.8543697908258827, "grad_norm": 0.61328125, "learning_rate": 2.0014575918836026e-05, "loss": 0.38801701068878175, "num_input_tokens_seen": 14905346752, "step": 52410, "train_runtime": 509595.0325, "train_tokens_per_second": 29249.396 }, { "epoch": 1.8547236110896117, "grad_norm": 0.62890625, "learning_rate": 2.0012972610740336e-05, "loss": 0.3901921272277832, "num_input_tokens_seen": 14908187008, "step": 52420, "train_runtime": 509691.1106, "train_tokens_per_second": 29249.455 }, { "epoch": 1.8550774313533402, "grad_norm": 0.61328125, "learning_rate": 2.001136968789164e-05, "loss": 0.3896796464920044, "num_input_tokens_seen": 14911065536, "step": 52430, "train_runtime": 509789.3757, "train_tokens_per_second": 29249.463 }, { "epoch": 1.8554312516170692, "grad_norm": 0.58984375, "learning_rate": 2.000976715013568e-05, "loss": 0.38902010917663576, "num_input_tokens_seen": 14913905792, "step": 52440, "train_runtime": 509885.2164, "train_tokens_per_second": 29249.536 }, { "epoch": 1.855785071880798, "grad_norm": 0.609375, "learning_rate": 2.0008164997318294e-05, "loss": 0.39191834926605223, "num_input_tokens_seen": 14916731520, "step": 52450, "train_runtime": 509981.4176, "train_tokens_per_second": 29249.559 }, { "epoch": 1.8561388921445268, "grad_norm": 0.58984375, "learning_rate": 2.000656322928539e-05, "loss": 0.3873609066009521, "num_input_tokens_seen": 14919531776, "step": 52460, "train_runtime": 510076.5417, "train_tokens_per_second": 29249.594 }, { "epoch": 1.8564927124082555, "grad_norm": 0.609375, "learning_rate": 2.000496184588298e-05, "loss": 0.3859537601470947, "num_input_tokens_seen": 14922358592, "step": 52470, "train_runtime": 510175.3012, "train_tokens_per_second": 29249.473 }, { "epoch": 1.8568465326719843, "grad_norm": 0.62109375, "learning_rate": 2.0003360846957154e-05, "loss": 0.38540210723876955, "num_input_tokens_seen": 14925212928, "step": 52480, "train_runtime": 510273.4346, "train_tokens_per_second": 29249.441 }, { "epoch": 1.857200352935713, "grad_norm": 0.6171875, "learning_rate": 2.0001760232354076e-05, "loss": 0.3895920991897583, "num_input_tokens_seen": 14928026944, "step": 52490, "train_runtime": 510366.6321, "train_tokens_per_second": 29249.614 }, { "epoch": 1.8575541731994418, "grad_norm": 0.6015625, "learning_rate": 2.0000160001920026e-05, "loss": 0.38834171295166015, "num_input_tokens_seen": 14930867008, "step": 52500, "train_runtime": 510463.152, "train_tokens_per_second": 29249.647 }, { "epoch": 1.8579079934631706, "grad_norm": 0.61328125, "learning_rate": 1.9998560155501343e-05, "loss": 0.3922633171081543, "num_input_tokens_seen": 14933773568, "step": 52510, "train_runtime": 510566.8691, "train_tokens_per_second": 29249.398 }, { "epoch": 1.8582618137268994, "grad_norm": 0.6171875, "learning_rate": 1.9996960692944456e-05, "loss": 0.3900697469711304, "num_input_tokens_seen": 14936665216, "step": 52520, "train_runtime": 510667.5934, "train_tokens_per_second": 29249.291 }, { "epoch": 1.8586156339906283, "grad_norm": 0.62890625, "learning_rate": 1.9995361614095893e-05, "loss": 0.39076385498046873, "num_input_tokens_seen": 14939450240, "step": 52530, "train_runtime": 510763.0833, "train_tokens_per_second": 29249.276 }, { "epoch": 1.858969454254357, "grad_norm": 0.60546875, "learning_rate": 1.9993762918802263e-05, "loss": 0.3901973247528076, "num_input_tokens_seen": 14942286464, "step": 52540, "train_runtime": 510859.3885, "train_tokens_per_second": 29249.314 }, { "epoch": 1.8593232745180859, "grad_norm": 0.6171875, "learning_rate": 1.9992164606910253e-05, "loss": 0.3884864807128906, "num_input_tokens_seen": 14945110144, "step": 52550, "train_runtime": 510953.3283, "train_tokens_per_second": 29249.462 }, { "epoch": 1.8596770947818144, "grad_norm": 0.62890625, "learning_rate": 1.999056667826664e-05, "loss": 0.38579819202423093, "num_input_tokens_seen": 14947939904, "step": 52560, "train_runtime": 511048.6292, "train_tokens_per_second": 29249.545 }, { "epoch": 1.8600309150455434, "grad_norm": 0.609375, "learning_rate": 1.9988969132718285e-05, "loss": 0.3899259567260742, "num_input_tokens_seen": 14950793920, "step": 52570, "train_runtime": 511144.9867, "train_tokens_per_second": 29249.615 }, { "epoch": 1.860384735309272, "grad_norm": 0.59765625, "learning_rate": 1.9987371970112145e-05, "loss": 0.3879676342010498, "num_input_tokens_seen": 14953684864, "step": 52580, "train_runtime": 511244.4133, "train_tokens_per_second": 29249.581 }, { "epoch": 1.860738555573001, "grad_norm": 0.6171875, "learning_rate": 1.998577519029525e-05, "loss": 0.3869981288909912, "num_input_tokens_seen": 14956571904, "step": 52590, "train_runtime": 511344.5647, "train_tokens_per_second": 29249.498 }, { "epoch": 1.8610923758367295, "grad_norm": 0.625, "learning_rate": 1.9984178793114727e-05, "loss": 0.38635365962982177, "num_input_tokens_seen": 14959440576, "step": 52600, "train_runtime": 511443.1942, "train_tokens_per_second": 29249.467 }, { "epoch": 1.8614461961004585, "grad_norm": 0.6171875, "learning_rate": 1.9982582778417768e-05, "loss": 0.38664755821228025, "num_input_tokens_seen": 14962240768, "step": 52610, "train_runtime": 511538.3098, "train_tokens_per_second": 29249.502 }, { "epoch": 1.8618000163641872, "grad_norm": 0.625, "learning_rate": 1.9980987146051677e-05, "loss": 0.38433499336242677, "num_input_tokens_seen": 14965126656, "step": 52620, "train_runtime": 511639.8379, "train_tokens_per_second": 29249.338 }, { "epoch": 1.862153836627916, "grad_norm": 0.58984375, "learning_rate": 1.9979391895863827e-05, "loss": 0.3902010679244995, "num_input_tokens_seen": 14967964416, "step": 52630, "train_runtime": 511734.8524, "train_tokens_per_second": 29249.453 }, { "epoch": 1.8625076568916448, "grad_norm": 0.62109375, "learning_rate": 1.997779702770168e-05, "loss": 0.3881723880767822, "num_input_tokens_seen": 14970794816, "step": 52640, "train_runtime": 511830.6282, "train_tokens_per_second": 29249.509 }, { "epoch": 1.8628614771553735, "grad_norm": 0.62890625, "learning_rate": 1.997620254141278e-05, "loss": 0.38869125843048097, "num_input_tokens_seen": 14973588160, "step": 52650, "train_runtime": 511923.8461, "train_tokens_per_second": 29249.64 }, { "epoch": 1.8632152974191023, "grad_norm": 0.59765625, "learning_rate": 1.997460843684476e-05, "loss": 0.3851171493530273, "num_input_tokens_seen": 14976479104, "step": 52660, "train_runtime": 512024.1628, "train_tokens_per_second": 29249.555 }, { "epoch": 1.863569117682831, "grad_norm": 0.61328125, "learning_rate": 1.997301471384534e-05, "loss": 0.38960976600646974, "num_input_tokens_seen": 14979315392, "step": 52670, "train_runtime": 512121.102, "train_tokens_per_second": 29249.557 }, { "epoch": 1.8639229379465598, "grad_norm": 0.625, "learning_rate": 1.997142137226232e-05, "loss": 0.38511836528778076, "num_input_tokens_seen": 14982132672, "step": 52680, "train_runtime": 512214.3851, "train_tokens_per_second": 29249.73 }, { "epoch": 1.8642767582102886, "grad_norm": 0.62109375, "learning_rate": 1.9969828411943588e-05, "loss": 0.3878340244293213, "num_input_tokens_seen": 14984967808, "step": 52690, "train_runtime": 512309.5573, "train_tokens_per_second": 29249.831 }, { "epoch": 1.8646305784740176, "grad_norm": 0.6171875, "learning_rate": 1.9968235832737117e-05, "loss": 0.3881404161453247, "num_input_tokens_seen": 14987848256, "step": 52700, "train_runtime": 512408.4854, "train_tokens_per_second": 29249.805 }, { "epoch": 1.8649843987377461, "grad_norm": 0.6328125, "learning_rate": 1.9966643634490965e-05, "loss": 0.38811697959899905, "num_input_tokens_seen": 14990697344, "step": 52710, "train_runtime": 512505.8956, "train_tokens_per_second": 29249.805 }, { "epoch": 1.8653382190014751, "grad_norm": 0.6015625, "learning_rate": 1.9965051817053272e-05, "loss": 0.38676812648773196, "num_input_tokens_seen": 14993497344, "step": 52720, "train_runtime": 512603.546, "train_tokens_per_second": 29249.695 }, { "epoch": 1.8656920392652037, "grad_norm": 0.61328125, "learning_rate": 1.9963460380272264e-05, "loss": 0.38706045150756835, "num_input_tokens_seen": 14996344832, "step": 52730, "train_runtime": 512700.6838, "train_tokens_per_second": 29249.707 }, { "epoch": 1.8660458595289326, "grad_norm": 0.6171875, "learning_rate": 1.9961869323996253e-05, "loss": 0.38314013481140136, "num_input_tokens_seen": 14999178816, "step": 52740, "train_runtime": 512795.7838, "train_tokens_per_second": 29249.809 }, { "epoch": 1.8663996797926612, "grad_norm": 0.625, "learning_rate": 1.996027864807364e-05, "loss": 0.3890821933746338, "num_input_tokens_seen": 15002017408, "step": 52750, "train_runtime": 512891.9241, "train_tokens_per_second": 29249.861 }, { "epoch": 1.8667535000563902, "grad_norm": 0.625, "learning_rate": 1.9958688352352895e-05, "loss": 0.39221336841583254, "num_input_tokens_seen": 15004853824, "step": 52760, "train_runtime": 512989.8352, "train_tokens_per_second": 29249.807 }, { "epoch": 1.8671073203201187, "grad_norm": 0.609375, "learning_rate": 1.995709843668259e-05, "loss": 0.3884114265441895, "num_input_tokens_seen": 15007682048, "step": 52770, "train_runtime": 513086.3345, "train_tokens_per_second": 29249.818 }, { "epoch": 1.8674611405838477, "grad_norm": 0.59375, "learning_rate": 1.995550890091138e-05, "loss": 0.38825714588165283, "num_input_tokens_seen": 15010514304, "step": 52780, "train_runtime": 513181.9569, "train_tokens_per_second": 29249.887 }, { "epoch": 1.8678149608475765, "grad_norm": 0.609375, "learning_rate": 1.9953919744887985e-05, "loss": 0.39096574783325194, "num_input_tokens_seen": 15013325632, "step": 52790, "train_runtime": 513278.8824, "train_tokens_per_second": 29249.841 }, { "epoch": 1.8681687811113052, "grad_norm": 0.60546875, "learning_rate": 1.9952330968461233e-05, "loss": 0.38544411659240724, "num_input_tokens_seen": 15016185792, "step": 52800, "train_runtime": 513376.2024, "train_tokens_per_second": 29249.867 }, { "epoch": 1.868522601375034, "grad_norm": 0.64453125, "learning_rate": 1.995074257148002e-05, "loss": 0.38976938724517823, "num_input_tokens_seen": 15019031040, "step": 52810, "train_runtime": 513472.5359, "train_tokens_per_second": 29249.921 }, { "epoch": 1.8688764216387628, "grad_norm": 0.63671875, "learning_rate": 1.9949154553793342e-05, "loss": 0.3901804447174072, "num_input_tokens_seen": 15021916736, "step": 52820, "train_runtime": 513572.9633, "train_tokens_per_second": 29249.82 }, { "epoch": 1.8692302419024915, "grad_norm": 0.59375, "learning_rate": 1.994756691525026e-05, "loss": 0.38826560974121094, "num_input_tokens_seen": 15024798208, "step": 52830, "train_runtime": 513673.7044, "train_tokens_per_second": 29249.693 }, { "epoch": 1.8695840621662203, "grad_norm": 0.62890625, "learning_rate": 1.9945979655699932e-05, "loss": 0.38898324966430664, "num_input_tokens_seen": 15027600960, "step": 52840, "train_runtime": 513765.1444, "train_tokens_per_second": 29249.943 }, { "epoch": 1.869937882429949, "grad_norm": 0.6171875, "learning_rate": 1.99443927749916e-05, "loss": 0.39112677574157717, "num_input_tokens_seen": 15030380544, "step": 52850, "train_runtime": 513861.6642, "train_tokens_per_second": 29249.858 }, { "epoch": 1.8702917026936778, "grad_norm": 0.59375, "learning_rate": 1.994280627297458e-05, "loss": 0.3858879566192627, "num_input_tokens_seen": 15033159424, "step": 52860, "train_runtime": 513954.0953, "train_tokens_per_second": 29250.004 }, { "epoch": 1.8706455229574068, "grad_norm": 0.59765625, "learning_rate": 1.9941220149498282e-05, "loss": 0.3906075954437256, "num_input_tokens_seen": 15035982464, "step": 52870, "train_runtime": 514051.9026, "train_tokens_per_second": 29249.931 }, { "epoch": 1.8709993432211354, "grad_norm": 0.59765625, "learning_rate": 1.99396344044122e-05, "loss": 0.39344029426574706, "num_input_tokens_seen": 15038833600, "step": 52880, "train_runtime": 514148.8733, "train_tokens_per_second": 29249.959 }, { "epoch": 1.8713531634848644, "grad_norm": 0.61328125, "learning_rate": 1.9938049037565903e-05, "loss": 0.38948564529418944, "num_input_tokens_seen": 15041661824, "step": 52890, "train_runtime": 514245.6409, "train_tokens_per_second": 29249.955 }, { "epoch": 1.871706983748593, "grad_norm": 0.609375, "learning_rate": 1.993646404880905e-05, "loss": 0.39232783317565917, "num_input_tokens_seen": 15044500672, "step": 52900, "train_runtime": 514343.6075, "train_tokens_per_second": 29249.903 }, { "epoch": 1.8720608040123219, "grad_norm": 0.6171875, "learning_rate": 1.993487943799139e-05, "loss": 0.3886898040771484, "num_input_tokens_seen": 15047343552, "step": 52910, "train_runtime": 514438.3456, "train_tokens_per_second": 29250.043 }, { "epoch": 1.8724146242760504, "grad_norm": 0.609375, "learning_rate": 1.9933295204962733e-05, "loss": 0.38711795806884763, "num_input_tokens_seen": 15050183808, "step": 52920, "train_runtime": 514535.842, "train_tokens_per_second": 29250.02 }, { "epoch": 1.8727684445397794, "grad_norm": 0.625, "learning_rate": 1.9931711349572995e-05, "loss": 0.38999531269073484, "num_input_tokens_seen": 15053017280, "step": 52930, "train_runtime": 514633.5178, "train_tokens_per_second": 29249.975 }, { "epoch": 1.873122264803508, "grad_norm": 0.62109375, "learning_rate": 1.9930127871672175e-05, "loss": 0.3885352611541748, "num_input_tokens_seen": 15055880320, "step": 52940, "train_runtime": 514732.5528, "train_tokens_per_second": 29249.909 }, { "epoch": 1.873476085067237, "grad_norm": 0.625, "learning_rate": 1.992854477111034e-05, "loss": 0.39130687713623047, "num_input_tokens_seen": 15058738560, "step": 52950, "train_runtime": 514829.2295, "train_tokens_per_second": 29249.968 }, { "epoch": 1.8738299053309657, "grad_norm": 0.625, "learning_rate": 1.9926962047737652e-05, "loss": 0.38676133155822756, "num_input_tokens_seen": 15061586240, "step": 52960, "train_runtime": 514927.0767, "train_tokens_per_second": 29249.94 }, { "epoch": 1.8741837255946945, "grad_norm": 0.6171875, "learning_rate": 1.992537970140435e-05, "loss": 0.3870056629180908, "num_input_tokens_seen": 15064406464, "step": 52970, "train_runtime": 515020.2596, "train_tokens_per_second": 29250.124 }, { "epoch": 1.8745375458584232, "grad_norm": 0.62890625, "learning_rate": 1.9923797731960762e-05, "loss": 0.3875922679901123, "num_input_tokens_seen": 15067219712, "step": 52980, "train_runtime": 515114.4994, "train_tokens_per_second": 29250.234 }, { "epoch": 1.874891366122152, "grad_norm": 0.609375, "learning_rate": 1.9922216139257303e-05, "loss": 0.3881427049636841, "num_input_tokens_seen": 15070048576, "step": 52990, "train_runtime": 515211.6136, "train_tokens_per_second": 29250.211 }, { "epoch": 1.8752451863858808, "grad_norm": 0.62890625, "learning_rate": 1.9920634923144448e-05, "loss": 0.38758556842803954, "num_input_tokens_seen": 15072914944, "step": 53000, "train_runtime": 515307.7614, "train_tokens_per_second": 29250.316 }, { "epoch": 1.8755990066496095, "grad_norm": 0.62109375, "learning_rate": 1.9919054083472788e-05, "loss": 0.3880557298660278, "num_input_tokens_seen": 15075765440, "step": 53010, "train_runtime": 515404.2855, "train_tokens_per_second": 29250.369 }, { "epoch": 1.8759528269133383, "grad_norm": 0.62109375, "learning_rate": 1.9917473620092976e-05, "loss": 0.3893942594528198, "num_input_tokens_seen": 15078580992, "step": 53020, "train_runtime": 515497.3784, "train_tokens_per_second": 29250.548 }, { "epoch": 1.876306647177067, "grad_norm": 0.59375, "learning_rate": 1.9915893532855746e-05, "loss": 0.39071145057678225, "num_input_tokens_seen": 15081389120, "step": 53030, "train_runtime": 515591.3678, "train_tokens_per_second": 29250.663 }, { "epoch": 1.876660467440796, "grad_norm": 0.60546875, "learning_rate": 1.9914313821611926e-05, "loss": 0.3903194904327393, "num_input_tokens_seen": 15084214336, "step": 53040, "train_runtime": 515684.9541, "train_tokens_per_second": 29250.833 }, { "epoch": 1.8770142877045246, "grad_norm": 0.61328125, "learning_rate": 1.9912734486212426e-05, "loss": 0.38924849033355713, "num_input_tokens_seen": 15087038464, "step": 53050, "train_runtime": 515782.5988, "train_tokens_per_second": 29250.771 }, { "epoch": 1.8773681079682536, "grad_norm": 0.61328125, "learning_rate": 1.9911155526508233e-05, "loss": 0.3888861179351807, "num_input_tokens_seen": 15089893760, "step": 53060, "train_runtime": 515879.7605, "train_tokens_per_second": 29250.796 }, { "epoch": 1.8777219282319821, "grad_norm": 0.59375, "learning_rate": 1.9909576942350416e-05, "loss": 0.3890857219696045, "num_input_tokens_seen": 15092741632, "step": 53070, "train_runtime": 515979.9138, "train_tokens_per_second": 29250.638 }, { "epoch": 1.8780757484957111, "grad_norm": 0.625, "learning_rate": 1.9907998733590127e-05, "loss": 0.3897523880004883, "num_input_tokens_seen": 15095558784, "step": 53080, "train_runtime": 516075.1505, "train_tokens_per_second": 29250.699 }, { "epoch": 1.8784295687594397, "grad_norm": 0.60546875, "learning_rate": 1.9906420900078614e-05, "loss": 0.3894433736801147, "num_input_tokens_seen": 15098389696, "step": 53090, "train_runtime": 516169.9889, "train_tokens_per_second": 29250.809 }, { "epoch": 1.8787833890231687, "grad_norm": 0.671875, "learning_rate": 1.9904843441667184e-05, "loss": 0.38627848625183103, "num_input_tokens_seen": 15101230144, "step": 53100, "train_runtime": 516269.9061, "train_tokens_per_second": 29250.65 }, { "epoch": 1.8791372092868974, "grad_norm": 0.61328125, "learning_rate": 1.990326635820725e-05, "loss": 0.38816375732421876, "num_input_tokens_seen": 15104124416, "step": 53110, "train_runtime": 516368.0914, "train_tokens_per_second": 29250.693 }, { "epoch": 1.8794910295506262, "grad_norm": 0.625, "learning_rate": 1.9901689649550285e-05, "loss": 0.3869650840759277, "num_input_tokens_seen": 15106953216, "step": 53120, "train_runtime": 516464.4259, "train_tokens_per_second": 29250.714 }, { "epoch": 1.879844849814355, "grad_norm": 0.59765625, "learning_rate": 1.9900113315547862e-05, "loss": 0.389239764213562, "num_input_tokens_seen": 15109785728, "step": 53130, "train_runtime": 516560.4768, "train_tokens_per_second": 29250.758 }, { "epoch": 1.8801986700780837, "grad_norm": 0.6015625, "learning_rate": 1.9898537356051635e-05, "loss": 0.38719141483306885, "num_input_tokens_seen": 15112611712, "step": 53140, "train_runtime": 516659.3849, "train_tokens_per_second": 29250.628 }, { "epoch": 1.8805524903418125, "grad_norm": 0.6484375, "learning_rate": 1.9896961770913325e-05, "loss": 0.39161033630371095, "num_input_tokens_seen": 15115498368, "step": 53150, "train_runtime": 516761.9015, "train_tokens_per_second": 29250.412 }, { "epoch": 1.8809063106055413, "grad_norm": 0.59765625, "learning_rate": 1.989538655998475e-05, "loss": 0.3917238235473633, "num_input_tokens_seen": 15118345792, "step": 53160, "train_runtime": 516860.7018, "train_tokens_per_second": 29250.329 }, { "epoch": 1.88126013086927, "grad_norm": 0.62109375, "learning_rate": 1.989381172311781e-05, "loss": 0.38785481452941895, "num_input_tokens_seen": 15121195328, "step": 53170, "train_runtime": 516955.3983, "train_tokens_per_second": 29250.483 }, { "epoch": 1.8816139511329988, "grad_norm": 0.6015625, "learning_rate": 1.9892237260164473e-05, "loss": 0.3875454902648926, "num_input_tokens_seen": 15123988544, "step": 53180, "train_runtime": 517049.8868, "train_tokens_per_second": 29250.54 }, { "epoch": 1.8819677713967276, "grad_norm": 0.59765625, "learning_rate": 1.9890663170976807e-05, "loss": 0.38889455795288086, "num_input_tokens_seen": 15126827200, "step": 53190, "train_runtime": 517145.7013, "train_tokens_per_second": 29250.61 }, { "epoch": 1.8823215916604563, "grad_norm": 0.625, "learning_rate": 1.9889089455406948e-05, "loss": 0.3917581081390381, "num_input_tokens_seen": 15129682240, "step": 53200, "train_runtime": 517241.1588, "train_tokens_per_second": 29250.731 }, { "epoch": 1.8826754119241853, "grad_norm": 0.60546875, "learning_rate": 1.9887516113307126e-05, "loss": 0.3889960527420044, "num_input_tokens_seen": 15132541760, "step": 53210, "train_runtime": 517339.2663, "train_tokens_per_second": 29250.712 }, { "epoch": 1.8830292321879138, "grad_norm": 0.62890625, "learning_rate": 1.9885943144529635e-05, "loss": 0.3879654884338379, "num_input_tokens_seen": 15135366592, "step": 53220, "train_runtime": 517434.2953, "train_tokens_per_second": 29250.799 }, { "epoch": 1.8833830524516428, "grad_norm": 0.625, "learning_rate": 1.9884370548926874e-05, "loss": 0.38990857601165774, "num_input_tokens_seen": 15138289152, "step": 53230, "train_runtime": 517534.567, "train_tokens_per_second": 29250.779 }, { "epoch": 1.8837368727153714, "grad_norm": 0.59765625, "learning_rate": 1.9882798326351305e-05, "loss": 0.38763885498046874, "num_input_tokens_seen": 15141172672, "step": 53240, "train_runtime": 517635.5553, "train_tokens_per_second": 29250.643 }, { "epoch": 1.8840906929791004, "grad_norm": 0.609375, "learning_rate": 1.9881226476655475e-05, "loss": 0.38727731704711915, "num_input_tokens_seen": 15144026176, "step": 53250, "train_runtime": 517732.476, "train_tokens_per_second": 29250.678 }, { "epoch": 1.884444513242829, "grad_norm": 0.59765625, "learning_rate": 1.9879654999692028e-05, "loss": 0.38786969184875486, "num_input_tokens_seen": 15146872384, "step": 53260, "train_runtime": 517833.151, "train_tokens_per_second": 29250.488 }, { "epoch": 1.884798333506558, "grad_norm": 0.62109375, "learning_rate": 1.987808389531366e-05, "loss": 0.3893772840499878, "num_input_tokens_seen": 15149702272, "step": 53270, "train_runtime": 517930.3972, "train_tokens_per_second": 29250.46 }, { "epoch": 1.8851521537702867, "grad_norm": 0.59375, "learning_rate": 1.987651316337318e-05, "loss": 0.3891500234603882, "num_input_tokens_seen": 15152548288, "step": 53280, "train_runtime": 518027.8306, "train_tokens_per_second": 29250.452 }, { "epoch": 1.8855059740340154, "grad_norm": 0.62109375, "learning_rate": 1.9874942803723465e-05, "loss": 0.3888816833496094, "num_input_tokens_seen": 15155368576, "step": 53290, "train_runtime": 518120.5242, "train_tokens_per_second": 29250.662 }, { "epoch": 1.8858597942977442, "grad_norm": 0.6328125, "learning_rate": 1.987337281621746e-05, "loss": 0.3868882656097412, "num_input_tokens_seen": 15158285760, "step": 53300, "train_runtime": 518218.0611, "train_tokens_per_second": 29250.786 }, { "epoch": 1.886213614561473, "grad_norm": 0.62109375, "learning_rate": 1.9871803200708214e-05, "loss": 0.3888881206512451, "num_input_tokens_seen": 15161112320, "step": 53310, "train_runtime": 518311.1369, "train_tokens_per_second": 29250.987 }, { "epoch": 1.8865674348252017, "grad_norm": 0.6015625, "learning_rate": 1.9870233957048844e-05, "loss": 0.3868952751159668, "num_input_tokens_seen": 15163967936, "step": 53320, "train_runtime": 518408.5207, "train_tokens_per_second": 29251.001 }, { "epoch": 1.8869212550889305, "grad_norm": 0.609375, "learning_rate": 1.9868665085092556e-05, "loss": 0.3902482032775879, "num_input_tokens_seen": 15166826496, "step": 53330, "train_runtime": 518506.9476, "train_tokens_per_second": 29250.961 }, { "epoch": 1.8872750753526593, "grad_norm": 0.62109375, "learning_rate": 1.9867096584692624e-05, "loss": 0.3900275230407715, "num_input_tokens_seen": 15169662656, "step": 53340, "train_runtime": 518603.1434, "train_tokens_per_second": 29251.004 }, { "epoch": 1.887628895616388, "grad_norm": 0.609375, "learning_rate": 1.9865528455702416e-05, "loss": 0.3940988302230835, "num_input_tokens_seen": 15172499712, "step": 53350, "train_runtime": 518700.8679, "train_tokens_per_second": 29250.963 }, { "epoch": 1.887982715880117, "grad_norm": 0.65234375, "learning_rate": 1.9863960697975378e-05, "loss": 0.38994994163513186, "num_input_tokens_seen": 15175370112, "step": 53360, "train_runtime": 518800.3126, "train_tokens_per_second": 29250.889 }, { "epoch": 1.8883365361438456, "grad_norm": 0.578125, "learning_rate": 1.986239331136503e-05, "loss": 0.3894001007080078, "num_input_tokens_seen": 15178147008, "step": 53370, "train_runtime": 518892.6364, "train_tokens_per_second": 29251.036 }, { "epoch": 1.8886903564075745, "grad_norm": 0.62890625, "learning_rate": 1.9860826295724985e-05, "loss": 0.39093894958496095, "num_input_tokens_seen": 15181014080, "step": 53380, "train_runtime": 518994.4726, "train_tokens_per_second": 29250.82 }, { "epoch": 1.889044176671303, "grad_norm": 0.61328125, "learning_rate": 1.985925965090893e-05, "loss": 0.3889622688293457, "num_input_tokens_seen": 15183882944, "step": 53390, "train_runtime": 519092.1551, "train_tokens_per_second": 29250.843 }, { "epoch": 1.889397996935032, "grad_norm": 0.6171875, "learning_rate": 1.9857693376770625e-05, "loss": 0.39083285331726075, "num_input_tokens_seen": 15186685824, "step": 53400, "train_runtime": 519187.7971, "train_tokens_per_second": 29250.853 }, { "epoch": 1.8897518171987606, "grad_norm": 0.6171875, "learning_rate": 1.9856127473163922e-05, "loss": 0.38647093772888186, "num_input_tokens_seen": 15189505536, "step": 53410, "train_runtime": 519282.5959, "train_tokens_per_second": 29250.943 }, { "epoch": 1.8901056374624896, "grad_norm": 0.59375, "learning_rate": 1.9854561939942756e-05, "loss": 0.38783090114593505, "num_input_tokens_seen": 15192307968, "step": 53420, "train_runtime": 519379.6171, "train_tokens_per_second": 29250.874 }, { "epoch": 1.8904594577262182, "grad_norm": 0.60546875, "learning_rate": 1.985299677696113e-05, "loss": 0.3890634536743164, "num_input_tokens_seen": 15195184448, "step": 53430, "train_runtime": 519477.2443, "train_tokens_per_second": 29250.914 }, { "epoch": 1.8908132779899471, "grad_norm": 0.59375, "learning_rate": 1.9851431984073143e-05, "loss": 0.3879124164581299, "num_input_tokens_seen": 15198006784, "step": 53440, "train_runtime": 519571.6041, "train_tokens_per_second": 29251.034 }, { "epoch": 1.891167098253676, "grad_norm": 0.6015625, "learning_rate": 1.9849867561132955e-05, "loss": 0.3906916379928589, "num_input_tokens_seen": 15200875904, "step": 53450, "train_runtime": 519668.583, "train_tokens_per_second": 29251.097 }, { "epoch": 1.8915209185174047, "grad_norm": 0.61328125, "learning_rate": 1.9848303507994826e-05, "loss": 0.3866857051849365, "num_input_tokens_seen": 15203784192, "step": 53460, "train_runtime": 519770.6749, "train_tokens_per_second": 29250.946 }, { "epoch": 1.8918747387811334, "grad_norm": 0.6015625, "learning_rate": 1.9846739824513087e-05, "loss": 0.3907691478729248, "num_input_tokens_seen": 15206600512, "step": 53470, "train_runtime": 519865.0141, "train_tokens_per_second": 29251.056 }, { "epoch": 1.8922285590448622, "grad_norm": 0.62109375, "learning_rate": 1.9845176510542145e-05, "loss": 0.3860243082046509, "num_input_tokens_seen": 15209420352, "step": 53480, "train_runtime": 519959.256, "train_tokens_per_second": 29251.177 }, { "epoch": 1.892582379308591, "grad_norm": 0.5859375, "learning_rate": 1.9843613565936495e-05, "loss": 0.3895238161087036, "num_input_tokens_seen": 15212237376, "step": 53490, "train_runtime": 520054.5685, "train_tokens_per_second": 29251.233 }, { "epoch": 1.8929361995723197, "grad_norm": 0.59765625, "learning_rate": 1.9842050990550707e-05, "loss": 0.3885918617248535, "num_input_tokens_seen": 15215105664, "step": 53500, "train_runtime": 520153.2804, "train_tokens_per_second": 29251.196 }, { "epoch": 1.8932900198360485, "grad_norm": 0.609375, "learning_rate": 1.9840488784239442e-05, "loss": 0.3880393266677856, "num_input_tokens_seen": 15217921088, "step": 53510, "train_runtime": 520247.3298, "train_tokens_per_second": 29251.32 }, { "epoch": 1.8936438400997773, "grad_norm": 0.640625, "learning_rate": 1.983892694685743e-05, "loss": 0.3908080101013184, "num_input_tokens_seen": 15220754240, "step": 53520, "train_runtime": 520343.9307, "train_tokens_per_second": 29251.334 }, { "epoch": 1.8939976603635063, "grad_norm": 0.625, "learning_rate": 1.983736547825947e-05, "loss": 0.3856344699859619, "num_input_tokens_seen": 15223586240, "step": 53530, "train_runtime": 520440.2466, "train_tokens_per_second": 29251.362 }, { "epoch": 1.8943514806272348, "grad_norm": 0.609375, "learning_rate": 1.983580437830047e-05, "loss": 0.3907046318054199, "num_input_tokens_seen": 15226450176, "step": 53540, "train_runtime": 520538.1517, "train_tokens_per_second": 29251.363 }, { "epoch": 1.8947053008909638, "grad_norm": 0.6015625, "learning_rate": 1.9834243646835407e-05, "loss": 0.38485419750213623, "num_input_tokens_seen": 15229264320, "step": 53550, "train_runtime": 520633.7646, "train_tokens_per_second": 29251.396 }, { "epoch": 1.8950591211546923, "grad_norm": 0.62890625, "learning_rate": 1.9832683283719318e-05, "loss": 0.38997886180877683, "num_input_tokens_seen": 15232128128, "step": 53560, "train_runtime": 520734.4648, "train_tokens_per_second": 29251.239 }, { "epoch": 1.8954129414184213, "grad_norm": 0.609375, "learning_rate": 1.9831123288807342e-05, "loss": 0.38659234046936036, "num_input_tokens_seen": 15234941632, "step": 53570, "train_runtime": 520832.0475, "train_tokens_per_second": 29251.16 }, { "epoch": 1.8957667616821499, "grad_norm": 0.6171875, "learning_rate": 1.9829563661954696e-05, "loss": 0.3892052412033081, "num_input_tokens_seen": 15237821568, "step": 53580, "train_runtime": 520933.1464, "train_tokens_per_second": 29251.012 }, { "epoch": 1.8961205819458788, "grad_norm": 0.58984375, "learning_rate": 1.9828004403016665e-05, "loss": 0.3880744457244873, "num_input_tokens_seen": 15240696384, "step": 53590, "train_runtime": 521032.0135, "train_tokens_per_second": 29250.979 }, { "epoch": 1.8964744022096074, "grad_norm": 0.640625, "learning_rate": 1.9826445511848627e-05, "loss": 0.3953718900680542, "num_input_tokens_seen": 15243539328, "step": 53600, "train_runtime": 521126.9955, "train_tokens_per_second": 29251.103 }, { "epoch": 1.8968282224733364, "grad_norm": 0.6015625, "learning_rate": 1.9824886988306024e-05, "loss": 0.3863143682479858, "num_input_tokens_seen": 15246413888, "step": 53610, "train_runtime": 521224.8278, "train_tokens_per_second": 29251.127 }, { "epoch": 1.8971820427370651, "grad_norm": 0.609375, "learning_rate": 1.9823328832244396e-05, "loss": 0.3872296571731567, "num_input_tokens_seen": 15249245376, "step": 53620, "train_runtime": 521323.1341, "train_tokens_per_second": 29251.043 }, { "epoch": 1.897535863000794, "grad_norm": 0.578125, "learning_rate": 1.9821771043519348e-05, "loss": 0.3867331981658936, "num_input_tokens_seen": 15252124224, "step": 53630, "train_runtime": 521422.567, "train_tokens_per_second": 29250.986 }, { "epoch": 1.8978896832645227, "grad_norm": 0.60546875, "learning_rate": 1.9820213621986572e-05, "loss": 0.3917325496673584, "num_input_tokens_seen": 15254925440, "step": 53640, "train_runtime": 521516.3369, "train_tokens_per_second": 29251.098 }, { "epoch": 1.8982435035282514, "grad_norm": 0.6484375, "learning_rate": 1.9818656567501832e-05, "loss": 0.38895363807678224, "num_input_tokens_seen": 15257742528, "step": 53650, "train_runtime": 521613.1825, "train_tokens_per_second": 29251.068 }, { "epoch": 1.8985973237919802, "grad_norm": 0.58203125, "learning_rate": 1.9817099879920984e-05, "loss": 0.3855937957763672, "num_input_tokens_seen": 15260600320, "step": 53660, "train_runtime": 521710.7091, "train_tokens_per_second": 29251.077 }, { "epoch": 1.898951144055709, "grad_norm": 0.59765625, "learning_rate": 1.981554355909995e-05, "loss": 0.38933491706848145, "num_input_tokens_seen": 15263387648, "step": 53670, "train_runtime": 521805.3432, "train_tokens_per_second": 29251.114 }, { "epoch": 1.8993049643194377, "grad_norm": 0.609375, "learning_rate": 1.9813987604894733e-05, "loss": 0.38747310638427734, "num_input_tokens_seen": 15266260160, "step": 53680, "train_runtime": 521905.618, "train_tokens_per_second": 29250.998 }, { "epoch": 1.8996587845831665, "grad_norm": 0.6328125, "learning_rate": 1.981243201716143e-05, "loss": 0.3825028657913208, "num_input_tokens_seen": 15269102656, "step": 53690, "train_runtime": 522003.5787, "train_tokens_per_second": 29250.954 }, { "epoch": 1.9000126048468955, "grad_norm": 0.5859375, "learning_rate": 1.98108767957562e-05, "loss": 0.39011249542236326, "num_input_tokens_seen": 15271902464, "step": 53700, "train_runtime": 522095.9074, "train_tokens_per_second": 29251.144 }, { "epoch": 1.900366425110624, "grad_norm": 0.58203125, "learning_rate": 1.9809321940535282e-05, "loss": 0.3835816144943237, "num_input_tokens_seen": 15274761856, "step": 53710, "train_runtime": 522194.221, "train_tokens_per_second": 29251.112 }, { "epoch": 1.900720245374353, "grad_norm": 0.6015625, "learning_rate": 1.9807767451355004e-05, "loss": 0.38843545913696287, "num_input_tokens_seen": 15277596800, "step": 53720, "train_runtime": 522290.1021, "train_tokens_per_second": 29251.17 }, { "epoch": 1.9010740656380816, "grad_norm": 0.62890625, "learning_rate": 1.9806213328071767e-05, "loss": 0.38711061477661135, "num_input_tokens_seen": 15280457344, "step": 53730, "train_runtime": 522386.7806, "train_tokens_per_second": 29251.233 }, { "epoch": 1.9014278859018106, "grad_norm": 0.625, "learning_rate": 1.980465957054205e-05, "loss": 0.38663573265075685, "num_input_tokens_seen": 15283255808, "step": 53740, "train_runtime": 522482.6489, "train_tokens_per_second": 29251.222 }, { "epoch": 1.901781706165539, "grad_norm": 0.62109375, "learning_rate": 1.980310617862242e-05, "loss": 0.391534423828125, "num_input_tokens_seen": 15286074816, "step": 53750, "train_runtime": 522580.4353, "train_tokens_per_second": 29251.143 }, { "epoch": 1.902135526429268, "grad_norm": 0.62890625, "learning_rate": 1.98015531521695e-05, "loss": 0.3836332321166992, "num_input_tokens_seen": 15288933504, "step": 53760, "train_runtime": 522676.9832, "train_tokens_per_second": 29251.209 }, { "epoch": 1.9024893466929966, "grad_norm": 0.60546875, "learning_rate": 1.980000049104002e-05, "loss": 0.39131228923797606, "num_input_tokens_seen": 15291791680, "step": 53770, "train_runtime": 522775.5348, "train_tokens_per_second": 29251.162 }, { "epoch": 1.9028431669567256, "grad_norm": 0.60546875, "learning_rate": 1.979844819509077e-05, "loss": 0.3852677345275879, "num_input_tokens_seen": 15294617856, "step": 53780, "train_runtime": 522872.9132, "train_tokens_per_second": 29251.119 }, { "epoch": 1.9031969872204544, "grad_norm": 0.62890625, "learning_rate": 1.979689626417863e-05, "loss": 0.3901498556137085, "num_input_tokens_seen": 15297405056, "step": 53790, "train_runtime": 522966.9226, "train_tokens_per_second": 29251.19 }, { "epoch": 1.9035508074841831, "grad_norm": 0.6171875, "learning_rate": 1.9795344698160537e-05, "loss": 0.3894065856933594, "num_input_tokens_seen": 15300277568, "step": 53800, "train_runtime": 523064.7036, "train_tokens_per_second": 29251.214 }, { "epoch": 1.903904627747912, "grad_norm": 0.6015625, "learning_rate": 1.979379349689354e-05, "loss": 0.3846890926361084, "num_input_tokens_seen": 15303062272, "step": 53810, "train_runtime": 523158.1422, "train_tokens_per_second": 29251.312 }, { "epoch": 1.9042584480116407, "grad_norm": 0.609375, "learning_rate": 1.979224266023474e-05, "loss": 0.39230320453643797, "num_input_tokens_seen": 15305852416, "step": 53820, "train_runtime": 523254.4533, "train_tokens_per_second": 29251.261 }, { "epoch": 1.9046122682753694, "grad_norm": 0.6328125, "learning_rate": 1.9790692188041323e-05, "loss": 0.3900423526763916, "num_input_tokens_seen": 15308687872, "step": 53830, "train_runtime": 523350.118, "train_tokens_per_second": 29251.332 }, { "epoch": 1.9049660885390982, "grad_norm": 0.625, "learning_rate": 1.9789142080170562e-05, "loss": 0.3864589691162109, "num_input_tokens_seen": 15311520832, "step": 53840, "train_runtime": 523445.8033, "train_tokens_per_second": 29251.397 }, { "epoch": 1.905319908802827, "grad_norm": 0.5859375, "learning_rate": 1.9787592336479794e-05, "loss": 0.386370587348938, "num_input_tokens_seen": 15314368448, "step": 53850, "train_runtime": 523542.0465, "train_tokens_per_second": 29251.459 }, { "epoch": 1.9056737290665557, "grad_norm": 0.61328125, "learning_rate": 1.9786042956826444e-05, "loss": 0.38846635818481445, "num_input_tokens_seen": 15317277248, "step": 53860, "train_runtime": 523643.7517, "train_tokens_per_second": 29251.332 }, { "epoch": 1.9060275493302847, "grad_norm": 0.58203125, "learning_rate": 1.9784493941068015e-05, "loss": 0.3874437093734741, "num_input_tokens_seen": 15320099968, "step": 53870, "train_runtime": 523737.3723, "train_tokens_per_second": 29251.493 }, { "epoch": 1.9063813695940133, "grad_norm": 0.59375, "learning_rate": 1.9782945289062085e-05, "loss": 0.3873290538787842, "num_input_tokens_seen": 15322939968, "step": 53880, "train_runtime": 523834.1951, "train_tokens_per_second": 29251.508 }, { "epoch": 1.9067351898577423, "grad_norm": 0.6171875, "learning_rate": 1.978139700066631e-05, "loss": 0.38614840507507325, "num_input_tokens_seen": 15325730816, "step": 53890, "train_runtime": 523926.7606, "train_tokens_per_second": 29251.666 }, { "epoch": 1.9070890101214708, "grad_norm": 0.63671875, "learning_rate": 1.977984907573842e-05, "loss": 0.385538125038147, "num_input_tokens_seen": 15328558592, "step": 53900, "train_runtime": 524022.7305, "train_tokens_per_second": 29251.706 }, { "epoch": 1.9074428303851998, "grad_norm": 0.58203125, "learning_rate": 1.9778301514136232e-05, "loss": 0.3856320858001709, "num_input_tokens_seen": 15331444736, "step": 53910, "train_runtime": 524123.3013, "train_tokens_per_second": 29251.599 }, { "epoch": 1.9077966506489283, "grad_norm": 0.60546875, "learning_rate": 1.977675431571764e-05, "loss": 0.38629310131072997, "num_input_tokens_seen": 15334280256, "step": 53920, "train_runtime": 524221.6893, "train_tokens_per_second": 29251.518 }, { "epoch": 1.9081504709126573, "grad_norm": 0.625, "learning_rate": 1.977520748034061e-05, "loss": 0.38968839645385744, "num_input_tokens_seen": 15337088064, "step": 53930, "train_runtime": 524317.2451, "train_tokens_per_second": 29251.542 }, { "epoch": 1.9085042911763859, "grad_norm": 0.60546875, "learning_rate": 1.9773661007863183e-05, "loss": 0.3931389808654785, "num_input_tokens_seen": 15339925120, "step": 53940, "train_runtime": 524416.8215, "train_tokens_per_second": 29251.398 }, { "epoch": 1.9088581114401149, "grad_norm": 0.60546875, "learning_rate": 1.977211489814349e-05, "loss": 0.3909188508987427, "num_input_tokens_seen": 15342791616, "step": 53950, "train_runtime": 524516.9827, "train_tokens_per_second": 29251.277 }, { "epoch": 1.9092119317038436, "grad_norm": 0.62890625, "learning_rate": 1.977056915103973e-05, "loss": 0.38784518241882326, "num_input_tokens_seen": 15345632192, "step": 53960, "train_runtime": 524612.927, "train_tokens_per_second": 29251.342 }, { "epoch": 1.9095657519675724, "grad_norm": 0.625, "learning_rate": 1.9769023766410176e-05, "loss": 0.3866534471511841, "num_input_tokens_seen": 15348445056, "step": 53970, "train_runtime": 524710.1247, "train_tokens_per_second": 29251.284 }, { "epoch": 1.9099195722313012, "grad_norm": 0.61328125, "learning_rate": 1.9767478744113192e-05, "loss": 0.3944977045059204, "num_input_tokens_seen": 15351364864, "step": 53980, "train_runtime": 524810.9224, "train_tokens_per_second": 29251.23 }, { "epoch": 1.91027339249503, "grad_norm": 0.62109375, "learning_rate": 1.976593408400721e-05, "loss": 0.3887478828430176, "num_input_tokens_seen": 15354176640, "step": 53990, "train_runtime": 524906.03, "train_tokens_per_second": 29251.286 }, { "epoch": 1.9106272127587587, "grad_norm": 0.6015625, "learning_rate": 1.976438978595074e-05, "loss": 0.38941264152526855, "num_input_tokens_seen": 15357006080, "step": 54000, "train_runtime": 525001.8646, "train_tokens_per_second": 29251.336 }, { "epoch": 1.9109810330224875, "grad_norm": 0.58984375, "learning_rate": 1.9762845849802375e-05, "loss": 0.3852963924407959, "num_input_tokens_seen": 15359838528, "step": 54010, "train_runtime": 525096.894, "train_tokens_per_second": 29251.437 }, { "epoch": 1.9113348532862162, "grad_norm": 0.59765625, "learning_rate": 1.9761302275420775e-05, "loss": 0.3875159502029419, "num_input_tokens_seen": 15362698240, "step": 54020, "train_runtime": 525194.2941, "train_tokens_per_second": 29251.457 }, { "epoch": 1.911688673549945, "grad_norm": 0.58203125, "learning_rate": 1.9759759062664685e-05, "loss": 0.3879960775375366, "num_input_tokens_seen": 15365653056, "step": 54030, "train_runtime": 525299.0726, "train_tokens_per_second": 29251.247 }, { "epoch": 1.912042493813674, "grad_norm": 0.60546875, "learning_rate": 1.9758216211392925e-05, "loss": 0.3892364501953125, "num_input_tokens_seen": 15368471552, "step": 54040, "train_runtime": 525396.1679, "train_tokens_per_second": 29251.206 }, { "epoch": 1.9123963140774025, "grad_norm": 0.609375, "learning_rate": 1.97566737214644e-05, "loss": 0.38932032585144044, "num_input_tokens_seen": 15371287040, "step": 54050, "train_runtime": 525489.7998, "train_tokens_per_second": 29251.352 }, { "epoch": 1.9127501343411315, "grad_norm": 0.625, "learning_rate": 1.9755131592738073e-05, "loss": 0.39127469062805176, "num_input_tokens_seen": 15374138880, "step": 54060, "train_runtime": 525587.2948, "train_tokens_per_second": 29251.352 }, { "epoch": 1.91310395460486, "grad_norm": 0.61328125, "learning_rate": 1.9753589825073005e-05, "loss": 0.3866180181503296, "num_input_tokens_seen": 15376968384, "step": 54070, "train_runtime": 525680.9897, "train_tokens_per_second": 29251.521 }, { "epoch": 1.913457774868589, "grad_norm": 0.58984375, "learning_rate": 1.975204841832832e-05, "loss": 0.3887892723083496, "num_input_tokens_seen": 15379848192, "step": 54080, "train_runtime": 525779.5947, "train_tokens_per_second": 29251.512 }, { "epoch": 1.9138115951323176, "grad_norm": 0.6328125, "learning_rate": 1.9750507372363228e-05, "loss": 0.3888261318206787, "num_input_tokens_seen": 15382733440, "step": 54090, "train_runtime": 525877.4496, "train_tokens_per_second": 29251.556 }, { "epoch": 1.9141654153960466, "grad_norm": 0.6015625, "learning_rate": 1.9748966687037003e-05, "loss": 0.38535704612731936, "num_input_tokens_seen": 15385608064, "step": 54100, "train_runtime": 525977.8039, "train_tokens_per_second": 29251.44 }, { "epoch": 1.9145192356597753, "grad_norm": 0.59375, "learning_rate": 1.974742636220902e-05, "loss": 0.38651299476623535, "num_input_tokens_seen": 15388443712, "step": 54110, "train_runtime": 526074.9859, "train_tokens_per_second": 29251.426 }, { "epoch": 1.914873055923504, "grad_norm": 0.58984375, "learning_rate": 1.97458863977387e-05, "loss": 0.3876023530960083, "num_input_tokens_seen": 15391288576, "step": 54120, "train_runtime": 526169.9775, "train_tokens_per_second": 29251.552 }, { "epoch": 1.9152268761872329, "grad_norm": 0.6015625, "learning_rate": 1.9744346793485567e-05, "loss": 0.38829994201660156, "num_input_tokens_seen": 15394125504, "step": 54130, "train_runtime": 526265.5389, "train_tokens_per_second": 29251.631 }, { "epoch": 1.9155806964509616, "grad_norm": 0.60546875, "learning_rate": 1.97428075493092e-05, "loss": 0.38388900756835936, "num_input_tokens_seen": 15396968256, "step": 54140, "train_runtime": 526364.1278, "train_tokens_per_second": 29251.553 }, { "epoch": 1.9159345167146904, "grad_norm": 0.59375, "learning_rate": 1.9741268665069273e-05, "loss": 0.3890402793884277, "num_input_tokens_seen": 15399818176, "step": 54150, "train_runtime": 526459.7926, "train_tokens_per_second": 29251.651 }, { "epoch": 1.9162883369784192, "grad_norm": 0.6171875, "learning_rate": 1.9739730140625527e-05, "loss": 0.3863030195236206, "num_input_tokens_seen": 15402693504, "step": 54160, "train_runtime": 526557.9933, "train_tokens_per_second": 29251.656 }, { "epoch": 1.916642157242148, "grad_norm": 0.6015625, "learning_rate": 1.9738191975837777e-05, "loss": 0.38698320388793944, "num_input_tokens_seen": 15405510592, "step": 54170, "train_runtime": 526653.4313, "train_tokens_per_second": 29251.705 }, { "epoch": 1.9169959775058767, "grad_norm": 0.60546875, "learning_rate": 1.9736654170565928e-05, "loss": 0.3885756015777588, "num_input_tokens_seen": 15408342016, "step": 54180, "train_runtime": 526749.6089, "train_tokens_per_second": 29251.739 }, { "epoch": 1.9173497977696055, "grad_norm": 0.62109375, "learning_rate": 1.9735116724669948e-05, "loss": 0.38958680629730225, "num_input_tokens_seen": 15411184448, "step": 54190, "train_runtime": 526849.3708, "train_tokens_per_second": 29251.595 }, { "epoch": 1.9177036180333342, "grad_norm": 0.6328125, "learning_rate": 1.9733579638009878e-05, "loss": 0.3934484958648682, "num_input_tokens_seen": 15414026560, "step": 54200, "train_runtime": 526945.343, "train_tokens_per_second": 29251.661 }, { "epoch": 1.9180574382970632, "grad_norm": 0.6171875, "learning_rate": 1.973204291044585e-05, "loss": 0.38809478282928467, "num_input_tokens_seen": 15416833152, "step": 54210, "train_runtime": 527039.8845, "train_tokens_per_second": 29251.739 }, { "epoch": 1.9184112585607918, "grad_norm": 0.625, "learning_rate": 1.973050654183807e-05, "loss": 0.3903543472290039, "num_input_tokens_seen": 15419706752, "step": 54220, "train_runtime": 527138.8681, "train_tokens_per_second": 29251.698 }, { "epoch": 1.9187650788245207, "grad_norm": 0.62890625, "learning_rate": 1.97289705320468e-05, "loss": 0.3884843587875366, "num_input_tokens_seen": 15422575872, "step": 54230, "train_runtime": 527236.1031, "train_tokens_per_second": 29251.745 }, { "epoch": 1.9191188990882493, "grad_norm": 0.59765625, "learning_rate": 1.9727434880932412e-05, "loss": 0.39126129150390626, "num_input_tokens_seen": 15425396160, "step": 54240, "train_runtime": 527334.4476, "train_tokens_per_second": 29251.638 }, { "epoch": 1.9194727193519783, "grad_norm": 0.625, "learning_rate": 1.972589958835532e-05, "loss": 0.3899538993835449, "num_input_tokens_seen": 15428272832, "step": 54250, "train_runtime": 527434.0875, "train_tokens_per_second": 29251.566 }, { "epoch": 1.9198265396157068, "grad_norm": 0.60546875, "learning_rate": 1.9724364654176036e-05, "loss": 0.39056031703948973, "num_input_tokens_seen": 15431049664, "step": 54260, "train_runtime": 527527.3331, "train_tokens_per_second": 29251.659 }, { "epoch": 1.9201803598794358, "grad_norm": 0.6484375, "learning_rate": 1.9722830078255144e-05, "loss": 0.3884063720703125, "num_input_tokens_seen": 15433842304, "step": 54270, "train_runtime": 527622.3744, "train_tokens_per_second": 29251.683 }, { "epoch": 1.9205341801431646, "grad_norm": 0.62109375, "learning_rate": 1.9721295860453297e-05, "loss": 0.3904250621795654, "num_input_tokens_seen": 15436725376, "step": 54280, "train_runtime": 527723.882, "train_tokens_per_second": 29251.519 }, { "epoch": 1.9208880004068933, "grad_norm": 0.609375, "learning_rate": 1.971976200063123e-05, "loss": 0.38887896537780764, "num_input_tokens_seen": 15439570304, "step": 54290, "train_runtime": 527819.9619, "train_tokens_per_second": 29251.585 }, { "epoch": 1.921241820670622, "grad_norm": 0.62109375, "learning_rate": 1.9718228498649746e-05, "loss": 0.3917547225952148, "num_input_tokens_seen": 15442452736, "step": 54300, "train_runtime": 527922.1731, "train_tokens_per_second": 29251.381 }, { "epoch": 1.9215956409343509, "grad_norm": 0.625, "learning_rate": 1.9716695354369742e-05, "loss": 0.39081730842590334, "num_input_tokens_seen": 15445309888, "step": 54310, "train_runtime": 528019.7, "train_tokens_per_second": 29251.389 }, { "epoch": 1.9219494611980796, "grad_norm": 0.6015625, "learning_rate": 1.9715162567652167e-05, "loss": 0.38950605392456056, "num_input_tokens_seen": 15448118336, "step": 54320, "train_runtime": 528116.2842, "train_tokens_per_second": 29251.358 }, { "epoch": 1.9223032814618084, "grad_norm": 0.61328125, "learning_rate": 1.9713630138358067e-05, "loss": 0.3867368221282959, "num_input_tokens_seen": 15450951168, "step": 54330, "train_runtime": 528215.0257, "train_tokens_per_second": 29251.253 }, { "epoch": 1.9226571017255372, "grad_norm": 0.6015625, "learning_rate": 1.9712098066348543e-05, "loss": 0.390903902053833, "num_input_tokens_seen": 15453823552, "step": 54340, "train_runtime": 528313.835, "train_tokens_per_second": 29251.219 }, { "epoch": 1.923010921989266, "grad_norm": 0.62109375, "learning_rate": 1.971056635148479e-05, "loss": 0.38699500560760497, "num_input_tokens_seen": 15456641280, "step": 54350, "train_runtime": 528410.2386, "train_tokens_per_second": 29251.215 }, { "epoch": 1.923364742252995, "grad_norm": 0.58984375, "learning_rate": 1.9709034993628065e-05, "loss": 0.38905603885650636, "num_input_tokens_seen": 15459451392, "step": 54360, "train_runtime": 528505.8363, "train_tokens_per_second": 29251.241 }, { "epoch": 1.9237185625167235, "grad_norm": 0.609375, "learning_rate": 1.9707503992639716e-05, "loss": 0.38847765922546384, "num_input_tokens_seen": 15462280512, "step": 54370, "train_runtime": 528602.5439, "train_tokens_per_second": 29251.241 }, { "epoch": 1.9240723827804525, "grad_norm": 0.60546875, "learning_rate": 1.9705973348381145e-05, "loss": 0.3889357328414917, "num_input_tokens_seen": 15465139904, "step": 54380, "train_runtime": 528699.0955, "train_tokens_per_second": 29251.308 }, { "epoch": 1.924426203044181, "grad_norm": 0.62109375, "learning_rate": 1.9704443060713846e-05, "loss": 0.3833740234375, "num_input_tokens_seen": 15467953216, "step": 54390, "train_runtime": 528794.5454, "train_tokens_per_second": 29251.348 }, { "epoch": 1.92478002330791, "grad_norm": 0.625, "learning_rate": 1.9702913129499384e-05, "loss": 0.3912911653518677, "num_input_tokens_seen": 15470823872, "step": 54400, "train_runtime": 528889.608, "train_tokens_per_second": 29251.518 }, { "epoch": 1.9251338435716385, "grad_norm": 0.59375, "learning_rate": 1.9701383554599397e-05, "loss": 0.3886124610900879, "num_input_tokens_seen": 15473629376, "step": 54410, "train_runtime": 528988.0865, "train_tokens_per_second": 29251.376 }, { "epoch": 1.9254876638353675, "grad_norm": 0.640625, "learning_rate": 1.9699854335875603e-05, "loss": 0.3872699499130249, "num_input_tokens_seen": 15476444864, "step": 54420, "train_runtime": 529083.0722, "train_tokens_per_second": 29251.446 }, { "epoch": 1.925841484099096, "grad_norm": 0.59765625, "learning_rate": 1.9698325473189788e-05, "loss": 0.38746678829193115, "num_input_tokens_seen": 15479297408, "step": 54430, "train_runtime": 529180.0971, "train_tokens_per_second": 29251.473 }, { "epoch": 1.926195304362825, "grad_norm": 0.62109375, "learning_rate": 1.969679696640382e-05, "loss": 0.3851868391036987, "num_input_tokens_seen": 15482150528, "step": 54440, "train_runtime": 529276.4678, "train_tokens_per_second": 29251.538 }, { "epoch": 1.9265491246265538, "grad_norm": 0.6171875, "learning_rate": 1.9695268815379634e-05, "loss": 0.39093623161315916, "num_input_tokens_seen": 15485021312, "step": 54450, "train_runtime": 529377.4337, "train_tokens_per_second": 29251.382 }, { "epoch": 1.9269029448902826, "grad_norm": 0.5859375, "learning_rate": 1.9693741019979244e-05, "loss": 0.3886695384979248, "num_input_tokens_seen": 15487830080, "step": 54460, "train_runtime": 529471.2129, "train_tokens_per_second": 29251.505 }, { "epoch": 1.9272567651540113, "grad_norm": 0.61328125, "learning_rate": 1.9692213580064744e-05, "loss": 0.3880319595336914, "num_input_tokens_seen": 15490663424, "step": 54470, "train_runtime": 529571.1838, "train_tokens_per_second": 29251.334 }, { "epoch": 1.92761058541774, "grad_norm": 0.62890625, "learning_rate": 1.9690686495498302e-05, "loss": 0.38658292293548585, "num_input_tokens_seen": 15493534464, "step": 54480, "train_runtime": 529670.4976, "train_tokens_per_second": 29251.269 }, { "epoch": 1.9279644056814689, "grad_norm": 0.59765625, "learning_rate": 1.9689159766142147e-05, "loss": 0.38579521179199217, "num_input_tokens_seen": 15496378368, "step": 54490, "train_runtime": 529767.244, "train_tokens_per_second": 29251.296 }, { "epoch": 1.9283182259451976, "grad_norm": 0.60546875, "learning_rate": 1.9687633391858605e-05, "loss": 0.3875744104385376, "num_input_tokens_seen": 15499240064, "step": 54500, "train_runtime": 529866.2531, "train_tokens_per_second": 29251.231 }, { "epoch": 1.9286720462089264, "grad_norm": 0.60546875, "learning_rate": 1.9686107372510057e-05, "loss": 0.390608549118042, "num_input_tokens_seen": 15502129664, "step": 54510, "train_runtime": 529963.7982, "train_tokens_per_second": 29251.299 }, { "epoch": 1.9290258664726552, "grad_norm": 0.58984375, "learning_rate": 1.9684581707958966e-05, "loss": 0.38645851612091064, "num_input_tokens_seen": 15504955584, "step": 54520, "train_runtime": 530059.3261, "train_tokens_per_second": 29251.359 }, { "epoch": 1.9293796867363842, "grad_norm": 0.6015625, "learning_rate": 1.9683056398067875e-05, "loss": 0.39103331565856936, "num_input_tokens_seen": 15507822912, "step": 54530, "train_runtime": 530159.4858, "train_tokens_per_second": 29251.241 }, { "epoch": 1.9297335070001127, "grad_norm": 0.61328125, "learning_rate": 1.9681531442699394e-05, "loss": 0.39015212059021, "num_input_tokens_seen": 15510617088, "step": 54540, "train_runtime": 530256.33, "train_tokens_per_second": 29251.168 }, { "epoch": 1.9300873272638417, "grad_norm": 0.640625, "learning_rate": 1.9680006841716207e-05, "loss": 0.38644578456878664, "num_input_tokens_seen": 15513424640, "step": 54550, "train_runtime": 530354.1682, "train_tokens_per_second": 29251.066 }, { "epoch": 1.9304411475275702, "grad_norm": 0.6015625, "learning_rate": 1.967848259498108e-05, "loss": 0.385676646232605, "num_input_tokens_seen": 15516254272, "step": 54560, "train_runtime": 530449.7798, "train_tokens_per_second": 29251.128 }, { "epoch": 1.9307949677912992, "grad_norm": 0.625, "learning_rate": 1.967695870235685e-05, "loss": 0.38791708946228026, "num_input_tokens_seen": 15519045440, "step": 54570, "train_runtime": 530546.9817, "train_tokens_per_second": 29251.03 }, { "epoch": 1.9311487880550278, "grad_norm": 0.61328125, "learning_rate": 1.9675435163706427e-05, "loss": 0.3904177904129028, "num_input_tokens_seen": 15521874368, "step": 54580, "train_runtime": 530641.2351, "train_tokens_per_second": 29251.165 }, { "epoch": 1.9315026083187568, "grad_norm": 0.62890625, "learning_rate": 1.967391197889279e-05, "loss": 0.39180641174316405, "num_input_tokens_seen": 15524670592, "step": 54590, "train_runtime": 530734.8551, "train_tokens_per_second": 29251.274 }, { "epoch": 1.9318564285824853, "grad_norm": 0.61328125, "learning_rate": 1.9672389147779e-05, "loss": 0.3862171173095703, "num_input_tokens_seen": 15527475904, "step": 54600, "train_runtime": 530828.7138, "train_tokens_per_second": 29251.387 }, { "epoch": 1.9322102488462143, "grad_norm": 0.63671875, "learning_rate": 1.9670866670228194e-05, "loss": 0.3870074272155762, "num_input_tokens_seen": 15530364736, "step": 54610, "train_runtime": 530926.2054, "train_tokens_per_second": 29251.456 }, { "epoch": 1.932564069109943, "grad_norm": 0.6328125, "learning_rate": 1.9669344546103576e-05, "loss": 0.3859997749328613, "num_input_tokens_seen": 15533226624, "step": 54620, "train_runtime": 531025.9391, "train_tokens_per_second": 29251.352 }, { "epoch": 1.9329178893736718, "grad_norm": 0.6328125, "learning_rate": 1.9667822775268428e-05, "loss": 0.3879380226135254, "num_input_tokens_seen": 15536062208, "step": 54630, "train_runtime": 531119.9328, "train_tokens_per_second": 29251.514 }, { "epoch": 1.9332717096374006, "grad_norm": 0.625, "learning_rate": 1.9666301357586107e-05, "loss": 0.3917035341262817, "num_input_tokens_seen": 15538880256, "step": 54640, "train_runtime": 531215.0583, "train_tokens_per_second": 29251.581 }, { "epoch": 1.9336255299011293, "grad_norm": 0.6328125, "learning_rate": 1.9664780292920036e-05, "loss": 0.3878628730773926, "num_input_tokens_seen": 15541767296, "step": 54650, "train_runtime": 531315.2997, "train_tokens_per_second": 29251.496 }, { "epoch": 1.9339793501648581, "grad_norm": 0.6015625, "learning_rate": 1.9663259581133726e-05, "loss": 0.3857172966003418, "num_input_tokens_seen": 15544632128, "step": 54660, "train_runtime": 531412.7246, "train_tokens_per_second": 29251.524 }, { "epoch": 1.9343331704285869, "grad_norm": 0.59375, "learning_rate": 1.9661739222090753e-05, "loss": 0.3852613210678101, "num_input_tokens_seen": 15547487360, "step": 54670, "train_runtime": 531510.6582, "train_tokens_per_second": 29251.506 }, { "epoch": 1.9346869906923156, "grad_norm": 0.62890625, "learning_rate": 1.966021921565476e-05, "loss": 0.387258243560791, "num_input_tokens_seen": 15550336384, "step": 54680, "train_runtime": 531608.558, "train_tokens_per_second": 29251.479 }, { "epoch": 1.9350408109560444, "grad_norm": 0.60546875, "learning_rate": 1.965869956168948e-05, "loss": 0.3893598556518555, "num_input_tokens_seen": 15553125504, "step": 54690, "train_runtime": 531701.0293, "train_tokens_per_second": 29251.637 }, { "epoch": 1.9353946312197734, "grad_norm": 0.6328125, "learning_rate": 1.965718026005871e-05, "loss": 0.38754892349243164, "num_input_tokens_seen": 15555997760, "step": 54700, "train_runtime": 531798.7089, "train_tokens_per_second": 29251.665 }, { "epoch": 1.935748451483502, "grad_norm": 0.59375, "learning_rate": 1.9655661310626317e-05, "loss": 0.39072866439819337, "num_input_tokens_seen": 15558850560, "step": 54710, "train_runtime": 531896.8391, "train_tokens_per_second": 29251.632 }, { "epoch": 1.936102271747231, "grad_norm": 0.5859375, "learning_rate": 1.965414271325625e-05, "loss": 0.38925814628601074, "num_input_tokens_seen": 15561740672, "step": 54720, "train_runtime": 531995.1334, "train_tokens_per_second": 29251.66 }, { "epoch": 1.9364560920109595, "grad_norm": 0.62109375, "learning_rate": 1.9652624467812534e-05, "loss": 0.3912940740585327, "num_input_tokens_seen": 15564547840, "step": 54730, "train_runtime": 532090.7253, "train_tokens_per_second": 29251.68 }, { "epoch": 1.9368099122746885, "grad_norm": 0.59765625, "learning_rate": 1.965110657415925e-05, "loss": 0.3876797199249268, "num_input_tokens_seen": 15567381760, "step": 54740, "train_runtime": 532185.5498, "train_tokens_per_second": 29251.793 }, { "epoch": 1.937163732538417, "grad_norm": 0.61328125, "learning_rate": 1.9649589032160576e-05, "loss": 0.38842966556549074, "num_input_tokens_seen": 15570193216, "step": 54750, "train_runtime": 532280.3788, "train_tokens_per_second": 29251.864 }, { "epoch": 1.937517552802146, "grad_norm": 0.6328125, "learning_rate": 1.9648071841680746e-05, "loss": 0.38835141658782957, "num_input_tokens_seen": 15573023872, "step": 54760, "train_runtime": 532375.9339, "train_tokens_per_second": 29251.931 }, { "epoch": 1.9378713730658745, "grad_norm": 0.61328125, "learning_rate": 1.964655500258407e-05, "loss": 0.3879629850387573, "num_input_tokens_seen": 15575857152, "step": 54770, "train_runtime": 532471.4762, "train_tokens_per_second": 29252.003 }, { "epoch": 1.9382251933296035, "grad_norm": 0.625, "learning_rate": 1.964503851473494e-05, "loss": 0.3855945587158203, "num_input_tokens_seen": 15578714112, "step": 54780, "train_runtime": 532572.447, "train_tokens_per_second": 29251.821 }, { "epoch": 1.9385790135933323, "grad_norm": 0.62109375, "learning_rate": 1.9643522377997807e-05, "loss": 0.3841076374053955, "num_input_tokens_seen": 15581578688, "step": 54790, "train_runtime": 532673.4553, "train_tokens_per_second": 29251.652 }, { "epoch": 1.938932833857061, "grad_norm": 0.60546875, "learning_rate": 1.9642006592237216e-05, "loss": 0.3880176305770874, "num_input_tokens_seen": 15584446336, "step": 54800, "train_runtime": 532777.2403, "train_tokens_per_second": 29251.337 }, { "epoch": 1.9392866541207898, "grad_norm": 0.60546875, "learning_rate": 1.9640491157317767e-05, "loss": 0.38619556427001955, "num_input_tokens_seen": 15587297472, "step": 54810, "train_runtime": 532874.7419, "train_tokens_per_second": 29251.335 }, { "epoch": 1.9396404743845186, "grad_norm": 0.5859375, "learning_rate": 1.9638976073104138e-05, "loss": 0.38499722480773924, "num_input_tokens_seen": 15590176064, "step": 54820, "train_runtime": 532976.3237, "train_tokens_per_second": 29251.161 }, { "epoch": 1.9399942946482474, "grad_norm": 0.61328125, "learning_rate": 1.9637461339461084e-05, "loss": 0.3904792308807373, "num_input_tokens_seen": 15593021568, "step": 54830, "train_runtime": 533074.5882, "train_tokens_per_second": 29251.107 }, { "epoch": 1.9403481149119761, "grad_norm": 0.61328125, "learning_rate": 1.9635946956253426e-05, "loss": 0.3888221740722656, "num_input_tokens_seen": 15595863488, "step": 54840, "train_runtime": 533171.6126, "train_tokens_per_second": 29251.114 }, { "epoch": 1.9407019351757049, "grad_norm": 0.625, "learning_rate": 1.9634432923346063e-05, "loss": 0.3841134548187256, "num_input_tokens_seen": 15598663552, "step": 54850, "train_runtime": 533266.4843, "train_tokens_per_second": 29251.161 }, { "epoch": 1.9410557554394336, "grad_norm": 0.6484375, "learning_rate": 1.963291924060397e-05, "loss": 0.3886404514312744, "num_input_tokens_seen": 15601518336, "step": 54860, "train_runtime": 533364.9072, "train_tokens_per_second": 29251.115 }, { "epoch": 1.9414095757031626, "grad_norm": 0.60546875, "learning_rate": 1.963140590789219e-05, "loss": 0.3887904644012451, "num_input_tokens_seen": 15604354688, "step": 54870, "train_runtime": 533460.479, "train_tokens_per_second": 29251.192 }, { "epoch": 1.9417633959668912, "grad_norm": 0.63671875, "learning_rate": 1.9629892925075834e-05, "loss": 0.389663028717041, "num_input_tokens_seen": 15607185728, "step": 54880, "train_runtime": 533557.067, "train_tokens_per_second": 29251.202 }, { "epoch": 1.9421172162306202, "grad_norm": 0.60546875, "learning_rate": 1.9628380292020093e-05, "loss": 0.38409695625305174, "num_input_tokens_seen": 15609983744, "step": 54890, "train_runtime": 533650.4948, "train_tokens_per_second": 29251.324 }, { "epoch": 1.9424710364943487, "grad_norm": 0.60546875, "learning_rate": 1.9626868008590238e-05, "loss": 0.3847958564758301, "num_input_tokens_seen": 15612857152, "step": 54900, "train_runtime": 533748.9016, "train_tokens_per_second": 29251.315 }, { "epoch": 1.9428248567580777, "grad_norm": 0.625, "learning_rate": 1.9625356074651595e-05, "loss": 0.3890111207962036, "num_input_tokens_seen": 15615759808, "step": 54910, "train_runtime": 533849.0432, "train_tokens_per_second": 29251.265 }, { "epoch": 1.9431786770218062, "grad_norm": 0.6015625, "learning_rate": 1.9623844490069577e-05, "loss": 0.388214111328125, "num_input_tokens_seen": 15618584640, "step": 54920, "train_runtime": 533944.4144, "train_tokens_per_second": 29251.331 }, { "epoch": 1.9435324972855352, "grad_norm": 0.6328125, "learning_rate": 1.9622333254709655e-05, "loss": 0.38620638847351074, "num_input_tokens_seen": 15621465664, "step": 54930, "train_runtime": 534043.6179, "train_tokens_per_second": 29251.292 }, { "epoch": 1.943886317549264, "grad_norm": 0.6015625, "learning_rate": 1.9620822368437388e-05, "loss": 0.3910114288330078, "num_input_tokens_seen": 15624342592, "step": 54940, "train_runtime": 534142.347, "train_tokens_per_second": 29251.271 }, { "epoch": 1.9442401378129928, "grad_norm": 0.6171875, "learning_rate": 1.9619311831118405e-05, "loss": 0.3886824607849121, "num_input_tokens_seen": 15627171520, "step": 54950, "train_runtime": 534239.2919, "train_tokens_per_second": 29251.258 }, { "epoch": 1.9445939580767215, "grad_norm": 0.60546875, "learning_rate": 1.961780164261839e-05, "loss": 0.3930304288864136, "num_input_tokens_seen": 15629987008, "step": 54960, "train_runtime": 534333.8572, "train_tokens_per_second": 29251.351 }, { "epoch": 1.9449477783404503, "grad_norm": 0.61328125, "learning_rate": 1.961629180280313e-05, "loss": 0.39078459739685056, "num_input_tokens_seen": 15632884096, "step": 54970, "train_runtime": 534436.5523, "train_tokens_per_second": 29251.151 }, { "epoch": 1.945301598604179, "grad_norm": 0.64453125, "learning_rate": 1.9614782311538455e-05, "loss": 0.38828024864196775, "num_input_tokens_seen": 15635758080, "step": 54980, "train_runtime": 534533.7213, "train_tokens_per_second": 29251.21 }, { "epoch": 1.9456554188679078, "grad_norm": 0.61328125, "learning_rate": 1.9613273168690278e-05, "loss": 0.3859945058822632, "num_input_tokens_seen": 15638642944, "step": 54990, "train_runtime": 534631.5177, "train_tokens_per_second": 29251.255 }, { "epoch": 1.9460092391316366, "grad_norm": 0.62109375, "learning_rate": 1.9611764374124592e-05, "loss": 0.39281420707702636, "num_input_tokens_seen": 15641534336, "step": 55000, "train_runtime": 534733.4733, "train_tokens_per_second": 29251.085 }, { "epoch": 1.9460092391316366, "eval_loss": 0.33642661571502686, "eval_runtime": 8.4306, "eval_samples_per_second": 473.041, "eval_steps_per_second": 3.796, "num_input_tokens_seen": 15641534336, "step": 55000 }, { "epoch": 1.9463630593953654, "grad_norm": 0.58984375, "learning_rate": 1.9610255927707456e-05, "loss": 0.39242579936981203, "num_input_tokens_seen": 15644404544, "step": 55010, "train_runtime": 534859.6357, "train_tokens_per_second": 29249.552 }, { "epoch": 1.9467168796590941, "grad_norm": 0.58984375, "learning_rate": 1.9608747829304998e-05, "loss": 0.38872780799865725, "num_input_tokens_seen": 15647263296, "step": 55020, "train_runtime": 534959.4949, "train_tokens_per_second": 29249.436 }, { "epoch": 1.947070699922823, "grad_norm": 0.62109375, "learning_rate": 1.9607240078783416e-05, "loss": 0.38651509284973146, "num_input_tokens_seen": 15650120320, "step": 55030, "train_runtime": 535056.7762, "train_tokens_per_second": 29249.457 }, { "epoch": 1.9474245201865519, "grad_norm": 0.609375, "learning_rate": 1.960573267600899e-05, "loss": 0.3863197326660156, "num_input_tokens_seen": 15652989696, "step": 55040, "train_runtime": 535155.7273, "train_tokens_per_second": 29249.411 }, { "epoch": 1.9477783404502804, "grad_norm": 0.6171875, "learning_rate": 1.9604225620848072e-05, "loss": 0.3943453788757324, "num_input_tokens_seen": 15655835264, "step": 55050, "train_runtime": 535254.4405, "train_tokens_per_second": 29249.333 }, { "epoch": 1.9481321607140094, "grad_norm": 0.58984375, "learning_rate": 1.9602718913167075e-05, "loss": 0.3903839349746704, "num_input_tokens_seen": 15658645696, "step": 55060, "train_runtime": 535349.621, "train_tokens_per_second": 29249.382 }, { "epoch": 1.948485980977738, "grad_norm": 0.6171875, "learning_rate": 1.9601212552832483e-05, "loss": 0.3878039360046387, "num_input_tokens_seen": 15661494656, "step": 55070, "train_runtime": 535448.9371, "train_tokens_per_second": 29249.278 }, { "epoch": 1.948839801241467, "grad_norm": 0.61328125, "learning_rate": 1.959970653971087e-05, "loss": 0.3857141017913818, "num_input_tokens_seen": 15664384128, "step": 55080, "train_runtime": 535549.4843, "train_tokens_per_second": 29249.182 }, { "epoch": 1.9491936215051955, "grad_norm": 0.65234375, "learning_rate": 1.9598200873668862e-05, "loss": 0.38744616508483887, "num_input_tokens_seen": 15667203200, "step": 55090, "train_runtime": 535644.6271, "train_tokens_per_second": 29249.249 }, { "epoch": 1.9495474417689245, "grad_norm": 0.62109375, "learning_rate": 1.9596695554573167e-05, "loss": 0.388596248626709, "num_input_tokens_seen": 15670068224, "step": 55100, "train_runtime": 535746.8419, "train_tokens_per_second": 29249.017 }, { "epoch": 1.9499012620326532, "grad_norm": 0.625, "learning_rate": 1.959519058229056e-05, "loss": 0.3864539861679077, "num_input_tokens_seen": 15672869056, "step": 55110, "train_runtime": 535842.5524, "train_tokens_per_second": 29249.019 }, { "epoch": 1.950255082296382, "grad_norm": 0.62109375, "learning_rate": 1.9593685956687895e-05, "loss": 0.3895367860794067, "num_input_tokens_seen": 15675753984, "step": 55120, "train_runtime": 535940.4164, "train_tokens_per_second": 29249.061 }, { "epoch": 1.9506089025601108, "grad_norm": 0.61328125, "learning_rate": 1.9592181677632094e-05, "loss": 0.3872324705123901, "num_input_tokens_seen": 15678597760, "step": 55130, "train_runtime": 536038.4367, "train_tokens_per_second": 29249.018 }, { "epoch": 1.9509627228238395, "grad_norm": 0.60546875, "learning_rate": 1.9590677744990145e-05, "loss": 0.3908626794815063, "num_input_tokens_seen": 15681442496, "step": 55140, "train_runtime": 536136.6538, "train_tokens_per_second": 29248.966 }, { "epoch": 1.9513165430875683, "grad_norm": 0.62109375, "learning_rate": 1.9589174158629106e-05, "loss": 0.3930805206298828, "num_input_tokens_seen": 15684275456, "step": 55150, "train_runtime": 536233.9829, "train_tokens_per_second": 29248.94 }, { "epoch": 1.951670363351297, "grad_norm": 0.58984375, "learning_rate": 1.958767091841612e-05, "loss": 0.38980922698974607, "num_input_tokens_seen": 15687186944, "step": 55160, "train_runtime": 536332.8837, "train_tokens_per_second": 29248.975 }, { "epoch": 1.9520241836150258, "grad_norm": 0.62890625, "learning_rate": 1.9586168024218395e-05, "loss": 0.3865967273712158, "num_input_tokens_seen": 15690080128, "step": 55170, "train_runtime": 536433.4917, "train_tokens_per_second": 29248.882 }, { "epoch": 1.9523780038787546, "grad_norm": 0.578125, "learning_rate": 1.9584665475903198e-05, "loss": 0.38882744312286377, "num_input_tokens_seen": 15692963840, "step": 55180, "train_runtime": 536533.9838, "train_tokens_per_second": 29248.779 }, { "epoch": 1.9527318241424836, "grad_norm": 0.59375, "learning_rate": 1.9583163273337892e-05, "loss": 0.39128913879394533, "num_input_tokens_seen": 15695856960, "step": 55190, "train_runtime": 536634.8755, "train_tokens_per_second": 29248.671 }, { "epoch": 1.9530856444062121, "grad_norm": 0.6171875, "learning_rate": 1.9581661416389887e-05, "loss": 0.3890889883041382, "num_input_tokens_seen": 15698729088, "step": 55200, "train_runtime": 536735.4092, "train_tokens_per_second": 29248.544 }, { "epoch": 1.9534394646699411, "grad_norm": 0.61328125, "learning_rate": 1.9580159904926674e-05, "loss": 0.38544507026672364, "num_input_tokens_seen": 15701555520, "step": 55210, "train_runtime": 536829.7376, "train_tokens_per_second": 29248.669 }, { "epoch": 1.9537932849336697, "grad_norm": 0.62109375, "learning_rate": 1.9578658738815823e-05, "loss": 0.39132275581359866, "num_input_tokens_seen": 15704386112, "step": 55220, "train_runtime": 536928.25, "train_tokens_per_second": 29248.575 }, { "epoch": 1.9541471051973986, "grad_norm": 0.6171875, "learning_rate": 1.957715791792496e-05, "loss": 0.3887802600860596, "num_input_tokens_seen": 15707238720, "step": 55230, "train_runtime": 537027.4782, "train_tokens_per_second": 29248.482 }, { "epoch": 1.9545009254611272, "grad_norm": 0.58984375, "learning_rate": 1.9575657442121788e-05, "loss": 0.38661653995513917, "num_input_tokens_seen": 15710040640, "step": 55240, "train_runtime": 537122.3265, "train_tokens_per_second": 29248.534 }, { "epoch": 1.9548547457248562, "grad_norm": 0.58984375, "learning_rate": 1.957415731127409e-05, "loss": 0.390841007232666, "num_input_tokens_seen": 15712885248, "step": 55250, "train_runtime": 537220.5205, "train_tokens_per_second": 29248.483 }, { "epoch": 1.9552085659885847, "grad_norm": 0.62890625, "learning_rate": 1.957265752524971e-05, "loss": 0.38548755645751953, "num_input_tokens_seen": 15715707648, "step": 55260, "train_runtime": 537315.4663, "train_tokens_per_second": 29248.567 }, { "epoch": 1.9555623862523137, "grad_norm": 0.59765625, "learning_rate": 1.9571158083916562e-05, "loss": 0.3947559118270874, "num_input_tokens_seen": 15718585024, "step": 55270, "train_runtime": 537415.503, "train_tokens_per_second": 29248.477 }, { "epoch": 1.9559162065160425, "grad_norm": 0.625, "learning_rate": 1.9569658987142637e-05, "loss": 0.39704484939575196, "num_input_tokens_seen": 15721424576, "step": 55280, "train_runtime": 537511.4409, "train_tokens_per_second": 29248.539 }, { "epoch": 1.9562700267797712, "grad_norm": 0.58984375, "learning_rate": 1.9568160234795992e-05, "loss": 0.39054360389709475, "num_input_tokens_seen": 15724310208, "step": 55290, "train_runtime": 537611.4371, "train_tokens_per_second": 29248.467 }, { "epoch": 1.9566238470435, "grad_norm": 0.61328125, "learning_rate": 1.956666182674476e-05, "loss": 0.38492422103881835, "num_input_tokens_seen": 15727165312, "step": 55300, "train_runtime": 537710.8509, "train_tokens_per_second": 29248.369 }, { "epoch": 1.9569776673072288, "grad_norm": 0.58984375, "learning_rate": 1.9565163762857133e-05, "loss": 0.3898935079574585, "num_input_tokens_seen": 15730059968, "step": 55310, "train_runtime": 537812.0899, "train_tokens_per_second": 29248.245 }, { "epoch": 1.9573314875709575, "grad_norm": 0.6171875, "learning_rate": 1.9563666043001394e-05, "loss": 0.387939977645874, "num_input_tokens_seen": 15732864960, "step": 55320, "train_runtime": 537908.2302, "train_tokens_per_second": 29248.232 }, { "epoch": 1.9576853078346863, "grad_norm": 0.61328125, "learning_rate": 1.9562168667045876e-05, "loss": 0.388346004486084, "num_input_tokens_seen": 15735718464, "step": 55330, "train_runtime": 538005.2773, "train_tokens_per_second": 29248.26 }, { "epoch": 1.958039128098415, "grad_norm": 0.61328125, "learning_rate": 1.9560671634858988e-05, "loss": 0.3887749910354614, "num_input_tokens_seen": 15738593088, "step": 55340, "train_runtime": 538103.4229, "train_tokens_per_second": 29248.268 }, { "epoch": 1.9583929483621438, "grad_norm": 0.61328125, "learning_rate": 1.9559174946309216e-05, "loss": 0.38655991554260255, "num_input_tokens_seen": 15741446784, "step": 55350, "train_runtime": 538198.8122, "train_tokens_per_second": 29248.386 }, { "epoch": 1.9587467686258728, "grad_norm": 0.6328125, "learning_rate": 1.955767860126512e-05, "loss": 0.390248966217041, "num_input_tokens_seen": 15744336704, "step": 55360, "train_runtime": 538297.5492, "train_tokens_per_second": 29248.39 }, { "epoch": 1.9591005888896014, "grad_norm": 0.59765625, "learning_rate": 1.9556182599595313e-05, "loss": 0.3863346576690674, "num_input_tokens_seen": 15747229056, "step": 55370, "train_runtime": 538395.4857, "train_tokens_per_second": 29248.442 }, { "epoch": 1.9594544091533304, "grad_norm": 0.59765625, "learning_rate": 1.95546869411685e-05, "loss": 0.3862210035324097, "num_input_tokens_seen": 15750091136, "step": 55380, "train_runtime": 538491.7963, "train_tokens_per_second": 29248.526 }, { "epoch": 1.959808229417059, "grad_norm": 0.6171875, "learning_rate": 1.9553191625853427e-05, "loss": 0.3949150085449219, "num_input_tokens_seen": 15752914624, "step": 55390, "train_runtime": 538588.7906, "train_tokens_per_second": 29248.501 }, { "epoch": 1.9601620496807879, "grad_norm": 0.64453125, "learning_rate": 1.9551696653518943e-05, "loss": 0.3891268491744995, "num_input_tokens_seen": 15755769664, "step": 55400, "train_runtime": 538687.1132, "train_tokens_per_second": 29248.462 }, { "epoch": 1.9605158699445164, "grad_norm": 0.62890625, "learning_rate": 1.9550202024033947e-05, "loss": 0.3915924310684204, "num_input_tokens_seen": 15758620224, "step": 55410, "train_runtime": 538782.619, "train_tokens_per_second": 29248.568 }, { "epoch": 1.9608696902082454, "grad_norm": 0.62890625, "learning_rate": 1.9548707737267412e-05, "loss": 0.38542590141296384, "num_input_tokens_seen": 15761456640, "step": 55420, "train_runtime": 538878.9925, "train_tokens_per_second": 29248.601 }, { "epoch": 1.961223510471974, "grad_norm": 0.64453125, "learning_rate": 1.9547213793088384e-05, "loss": 0.39220314025878905, "num_input_tokens_seen": 15764266944, "step": 55430, "train_runtime": 538974.1982, "train_tokens_per_second": 29248.649 }, { "epoch": 1.961577330735703, "grad_norm": 0.62109375, "learning_rate": 1.9545720191365983e-05, "loss": 0.38616414070129396, "num_input_tokens_seen": 15767081344, "step": 55440, "train_runtime": 539069.0127, "train_tokens_per_second": 29248.725 }, { "epoch": 1.9619311509994317, "grad_norm": 0.59375, "learning_rate": 1.9544226931969382e-05, "loss": 0.3876357078552246, "num_input_tokens_seen": 15769919872, "step": 55450, "train_runtime": 539166.2276, "train_tokens_per_second": 29248.716 }, { "epoch": 1.9622849712631605, "grad_norm": 0.58203125, "learning_rate": 1.9542734014767848e-05, "loss": 0.39226813316345216, "num_input_tokens_seen": 15772834752, "step": 55460, "train_runtime": 539267.1381, "train_tokens_per_second": 29248.648 }, { "epoch": 1.9626387915268892, "grad_norm": 0.61328125, "learning_rate": 1.9541241439630693e-05, "loss": 0.38219451904296875, "num_input_tokens_seen": 15775712128, "step": 55470, "train_runtime": 539368.8579, "train_tokens_per_second": 29248.467 }, { "epoch": 1.962992611790618, "grad_norm": 0.59765625, "learning_rate": 1.9539749206427322e-05, "loss": 0.3890096664428711, "num_input_tokens_seen": 15778560000, "step": 55480, "train_runtime": 539466.8098, "train_tokens_per_second": 29248.435 }, { "epoch": 1.9633464320543468, "grad_norm": 0.6015625, "learning_rate": 1.9538257315027194e-05, "loss": 0.38710412979125974, "num_input_tokens_seen": 15781436992, "step": 55490, "train_runtime": 539567.1331, "train_tokens_per_second": 29248.329 }, { "epoch": 1.9637002523180755, "grad_norm": 0.62109375, "learning_rate": 1.953676576529984e-05, "loss": 0.387100887298584, "num_input_tokens_seen": 15784325056, "step": 55500, "train_runtime": 539666.7467, "train_tokens_per_second": 29248.282 }, { "epoch": 1.9640540725818043, "grad_norm": 0.61328125, "learning_rate": 1.953527455711487e-05, "loss": 0.38877167701721194, "num_input_tokens_seen": 15787178496, "step": 55510, "train_runtime": 539763.6015, "train_tokens_per_second": 29248.32 }, { "epoch": 1.964407892845533, "grad_norm": 0.59375, "learning_rate": 1.9533783690341955e-05, "loss": 0.389346981048584, "num_input_tokens_seen": 15790024832, "step": 55520, "train_runtime": 539860.1604, "train_tokens_per_second": 29248.361 }, { "epoch": 1.964761713109262, "grad_norm": 0.59765625, "learning_rate": 1.9532293164850833e-05, "loss": 0.38842344284057617, "num_input_tokens_seen": 15792909888, "step": 55530, "train_runtime": 539959.3154, "train_tokens_per_second": 29248.333 }, { "epoch": 1.9651155333729906, "grad_norm": 0.61328125, "learning_rate": 1.9530802980511325e-05, "loss": 0.3873558044433594, "num_input_tokens_seen": 15795838272, "step": 55540, "train_runtime": 540060.8468, "train_tokens_per_second": 29248.257 }, { "epoch": 1.9654693536367196, "grad_norm": 0.609375, "learning_rate": 1.95293131371933e-05, "loss": 0.38912575244903563, "num_input_tokens_seen": 15798662848, "step": 55550, "train_runtime": 540156.1108, "train_tokens_per_second": 29248.328 }, { "epoch": 1.9658231739004481, "grad_norm": 0.59765625, "learning_rate": 1.9527823634766724e-05, "loss": 0.3886443853378296, "num_input_tokens_seen": 15801563648, "step": 55560, "train_runtime": 540256.3085, "train_tokens_per_second": 29248.272 }, { "epoch": 1.9661769941641771, "grad_norm": 0.6015625, "learning_rate": 1.952633447310161e-05, "loss": 0.3855548858642578, "num_input_tokens_seen": 15804382336, "step": 55570, "train_runtime": 540352.1454, "train_tokens_per_second": 29248.301 }, { "epoch": 1.9665308144279057, "grad_norm": 0.64453125, "learning_rate": 1.9524845652068046e-05, "loss": 0.39172892570495604, "num_input_tokens_seen": 15807244096, "step": 55580, "train_runtime": 540448.7253, "train_tokens_per_second": 29248.37 }, { "epoch": 1.9668846346916347, "grad_norm": 0.6328125, "learning_rate": 1.9523357171536195e-05, "loss": 0.395935583114624, "num_input_tokens_seen": 15810162048, "step": 55590, "train_runtime": 540551.5516, "train_tokens_per_second": 29248.204 }, { "epoch": 1.9672384549553632, "grad_norm": 0.625, "learning_rate": 1.9521869031376288e-05, "loss": 0.39039177894592286, "num_input_tokens_seen": 15813060352, "step": 55600, "train_runtime": 540650.1283, "train_tokens_per_second": 29248.232 }, { "epoch": 1.9675922752190922, "grad_norm": 0.6328125, "learning_rate": 1.9520381231458616e-05, "loss": 0.3864325284957886, "num_input_tokens_seen": 15815886656, "step": 55610, "train_runtime": 540745.1056, "train_tokens_per_second": 29248.321 }, { "epoch": 1.967946095482821, "grad_norm": 0.65234375, "learning_rate": 1.9518893771653555e-05, "loss": 0.3902462959289551, "num_input_tokens_seen": 15818718272, "step": 55620, "train_runtime": 540839.5121, "train_tokens_per_second": 29248.452 }, { "epoch": 1.9682999157465497, "grad_norm": 0.59765625, "learning_rate": 1.951740665183153e-05, "loss": 0.38970136642456055, "num_input_tokens_seen": 15821595008, "step": 55630, "train_runtime": 540939.8841, "train_tokens_per_second": 29248.343 }, { "epoch": 1.9686537360102785, "grad_norm": 0.609375, "learning_rate": 1.9515919871863057e-05, "loss": 0.3938803195953369, "num_input_tokens_seen": 15824438784, "step": 55640, "train_runtime": 541038.8022, "train_tokens_per_second": 29248.251 }, { "epoch": 1.9690075562740073, "grad_norm": 0.609375, "learning_rate": 1.9514433431618707e-05, "loss": 0.3875724792480469, "num_input_tokens_seen": 15827281600, "step": 55650, "train_runtime": 541134.8987, "train_tokens_per_second": 29248.311 }, { "epoch": 1.969361376537736, "grad_norm": 0.59375, "learning_rate": 1.951294733096912e-05, "loss": 0.3896567106246948, "num_input_tokens_seen": 15830160896, "step": 55660, "train_runtime": 541235.4517, "train_tokens_per_second": 29248.197 }, { "epoch": 1.9697151968014648, "grad_norm": 0.60546875, "learning_rate": 1.951146156978501e-05, "loss": 0.39091081619262696, "num_input_tokens_seen": 15833006400, "step": 55670, "train_runtime": 541334.0766, "train_tokens_per_second": 29248.124 }, { "epoch": 1.9700690170651936, "grad_norm": 0.57421875, "learning_rate": 1.9509976147937163e-05, "loss": 0.3877918243408203, "num_input_tokens_seen": 15835852608, "step": 55680, "train_runtime": 541429.3107, "train_tokens_per_second": 29248.237 }, { "epoch": 1.9704228373289223, "grad_norm": 0.65234375, "learning_rate": 1.950849106529642e-05, "loss": 0.3898444652557373, "num_input_tokens_seen": 15838724736, "step": 55690, "train_runtime": 541528.9814, "train_tokens_per_second": 29248.157 }, { "epoch": 1.9707766575926513, "grad_norm": 0.6015625, "learning_rate": 1.950700632173371e-05, "loss": 0.3855905532836914, "num_input_tokens_seen": 15841599232, "step": 55700, "train_runtime": 541629.4067, "train_tokens_per_second": 29248.041 }, { "epoch": 1.9711304778563798, "grad_norm": 0.640625, "learning_rate": 1.9505521917120013e-05, "loss": 0.38884222507476807, "num_input_tokens_seen": 15844439424, "step": 55710, "train_runtime": 541727.5996, "train_tokens_per_second": 29247.983 }, { "epoch": 1.9714842981201088, "grad_norm": 0.65234375, "learning_rate": 1.9504037851326387e-05, "loss": 0.3871743679046631, "num_input_tokens_seen": 15847310976, "step": 55720, "train_runtime": 541828.6158, "train_tokens_per_second": 29247.83 }, { "epoch": 1.9718381183838374, "grad_norm": 0.59375, "learning_rate": 1.950255412422396e-05, "loss": 0.3910228729248047, "num_input_tokens_seen": 15850160768, "step": 55730, "train_runtime": 541924.5694, "train_tokens_per_second": 29247.91 }, { "epoch": 1.9721919386475664, "grad_norm": 0.56640625, "learning_rate": 1.9501070735683924e-05, "loss": 0.38800630569458006, "num_input_tokens_seen": 15853018368, "step": 55740, "train_runtime": 542020.6958, "train_tokens_per_second": 29247.995 }, { "epoch": 1.972545758911295, "grad_norm": 0.5859375, "learning_rate": 1.9499587685577537e-05, "loss": 0.3861918687820435, "num_input_tokens_seen": 15855846528, "step": 55750, "train_runtime": 542115.6907, "train_tokens_per_second": 29248.086 }, { "epoch": 1.972899579175024, "grad_norm": 0.59375, "learning_rate": 1.9498104973776137e-05, "loss": 0.3848401069641113, "num_input_tokens_seen": 15858727552, "step": 55760, "train_runtime": 542215.3893, "train_tokens_per_second": 29248.022 }, { "epoch": 1.9732533994387524, "grad_norm": 0.61328125, "learning_rate": 1.949662260015112e-05, "loss": 0.3858680009841919, "num_input_tokens_seen": 15861522944, "step": 55770, "train_runtime": 542310.0314, "train_tokens_per_second": 29248.072 }, { "epoch": 1.9736072197024814, "grad_norm": 0.59375, "learning_rate": 1.9495140564573953e-05, "loss": 0.38861143589019775, "num_input_tokens_seen": 15864311616, "step": 55780, "train_runtime": 542403.9228, "train_tokens_per_second": 29248.151 }, { "epoch": 1.9739610399662102, "grad_norm": 0.609375, "learning_rate": 1.9493658866916166e-05, "loss": 0.3888195514678955, "num_input_tokens_seen": 15867128704, "step": 55790, "train_runtime": 542499.9532, "train_tokens_per_second": 29248.166 }, { "epoch": 1.974314860229939, "grad_norm": 0.61328125, "learning_rate": 1.9492177507049375e-05, "loss": 0.3892224788665771, "num_input_tokens_seen": 15869987776, "step": 55800, "train_runtime": 542595.498, "train_tokens_per_second": 29248.285 }, { "epoch": 1.9746686804936677, "grad_norm": 0.609375, "learning_rate": 1.9490696484845252e-05, "loss": 0.389974308013916, "num_input_tokens_seen": 15872832768, "step": 55810, "train_runtime": 542691.2321, "train_tokens_per_second": 29248.368 }, { "epoch": 1.9750225007573965, "grad_norm": 0.640625, "learning_rate": 1.948921580017553e-05, "loss": 0.39040675163269045, "num_input_tokens_seen": 15875630080, "step": 55820, "train_runtime": 542787.8396, "train_tokens_per_second": 29248.316 }, { "epoch": 1.9753763210211253, "grad_norm": 0.60546875, "learning_rate": 1.948773545291202e-05, "loss": 0.3840803623199463, "num_input_tokens_seen": 15878497024, "step": 55830, "train_runtime": 542886.1844, "train_tokens_per_second": 29248.298 }, { "epoch": 1.975730141284854, "grad_norm": 0.62109375, "learning_rate": 1.94862554429266e-05, "loss": 0.38790407180786135, "num_input_tokens_seen": 15881281920, "step": 55840, "train_runtime": 542980.2494, "train_tokens_per_second": 29248.36 }, { "epoch": 1.9760839615485828, "grad_norm": 0.6015625, "learning_rate": 1.9484775770091214e-05, "loss": 0.38820159435272217, "num_input_tokens_seen": 15884091584, "step": 55850, "train_runtime": 543075.7874, "train_tokens_per_second": 29248.388 }, { "epoch": 1.9764377818123116, "grad_norm": 0.60546875, "learning_rate": 1.9483296434277877e-05, "loss": 0.3876596450805664, "num_input_tokens_seen": 15886903616, "step": 55860, "train_runtime": 543171.9104, "train_tokens_per_second": 29248.39 }, { "epoch": 1.9767916020760405, "grad_norm": 0.61328125, "learning_rate": 1.9481817435358675e-05, "loss": 0.38994905948638914, "num_input_tokens_seen": 15889770048, "step": 55870, "train_runtime": 543269.8322, "train_tokens_per_second": 29248.394 }, { "epoch": 1.977145422339769, "grad_norm": 0.58984375, "learning_rate": 1.9480338773205753e-05, "loss": 0.3916220188140869, "num_input_tokens_seen": 15892611776, "step": 55880, "train_runtime": 543365.8853, "train_tokens_per_second": 29248.453 }, { "epoch": 1.977499242603498, "grad_norm": 0.609375, "learning_rate": 1.9478860447691327e-05, "loss": 0.3893189191818237, "num_input_tokens_seen": 15895480896, "step": 55890, "train_runtime": 543463.0586, "train_tokens_per_second": 29248.503 }, { "epoch": 1.9778530628672266, "grad_norm": 0.68359375, "learning_rate": 1.9477382458687682e-05, "loss": 0.3878438472747803, "num_input_tokens_seen": 15898312192, "step": 55900, "train_runtime": 543557.1126, "train_tokens_per_second": 29248.651 }, { "epoch": 1.9782068831309556, "grad_norm": 0.59765625, "learning_rate": 1.9475904806067173e-05, "loss": 0.38989160060882566, "num_input_tokens_seen": 15901135168, "step": 55910, "train_runtime": 543652.7197, "train_tokens_per_second": 29248.7 }, { "epoch": 1.9785607033946842, "grad_norm": 0.625, "learning_rate": 1.947442748970222e-05, "loss": 0.38657007217407224, "num_input_tokens_seen": 15904008320, "step": 55920, "train_runtime": 543753.1734, "train_tokens_per_second": 29248.58 }, { "epoch": 1.9789145236584131, "grad_norm": 0.6171875, "learning_rate": 1.947295050946531e-05, "loss": 0.39104328155517576, "num_input_tokens_seen": 15906858176, "step": 55930, "train_runtime": 543851.6428, "train_tokens_per_second": 29248.525 }, { "epoch": 1.979268343922142, "grad_norm": 0.59765625, "learning_rate": 1.9471473865229005e-05, "loss": 0.3895110607147217, "num_input_tokens_seen": 15909717376, "step": 55940, "train_runtime": 543948.9459, "train_tokens_per_second": 29248.549 }, { "epoch": 1.9796221641858707, "grad_norm": 0.625, "learning_rate": 1.946999755686592e-05, "loss": 0.3883556365966797, "num_input_tokens_seen": 15912560960, "step": 55950, "train_runtime": 544045.2682, "train_tokens_per_second": 29248.597 }, { "epoch": 1.9799759844495994, "grad_norm": 0.62109375, "learning_rate": 1.9468521584248754e-05, "loss": 0.3900402069091797, "num_input_tokens_seen": 15915391488, "step": 55960, "train_runtime": 544140.7013, "train_tokens_per_second": 29248.669 }, { "epoch": 1.9803298047133282, "grad_norm": 0.57421875, "learning_rate": 1.9467045947250262e-05, "loss": 0.3871407985687256, "num_input_tokens_seen": 15918301120, "step": 55970, "train_runtime": 544244.2884, "train_tokens_per_second": 29248.449 }, { "epoch": 1.980683624977057, "grad_norm": 0.61328125, "learning_rate": 1.9465570645743265e-05, "loss": 0.387880802154541, "num_input_tokens_seen": 15921138688, "step": 55980, "train_runtime": 544339.5857, "train_tokens_per_second": 29248.541 }, { "epoch": 1.9810374452407857, "grad_norm": 0.6328125, "learning_rate": 1.946409567960067e-05, "loss": 0.39166951179504395, "num_input_tokens_seen": 15923974144, "step": 55990, "train_runtime": 544435.1966, "train_tokens_per_second": 29248.613 }, { "epoch": 1.9813912655045145, "grad_norm": 0.60546875, "learning_rate": 1.9462621048695433e-05, "loss": 0.3900148868560791, "num_input_tokens_seen": 15926836800, "step": 56000, "train_runtime": 544533.6879, "train_tokens_per_second": 29248.579 }, { "epoch": 1.9817450857682433, "grad_norm": 0.65234375, "learning_rate": 1.9461146752900578e-05, "loss": 0.3865171432495117, "num_input_tokens_seen": 15929623360, "step": 56010, "train_runtime": 544628.1686, "train_tokens_per_second": 29248.622 }, { "epoch": 1.982098906031972, "grad_norm": 0.6171875, "learning_rate": 1.9459672792089206e-05, "loss": 0.38361918926239014, "num_input_tokens_seen": 15932404736, "step": 56020, "train_runtime": 544721.5726, "train_tokens_per_second": 29248.713 }, { "epoch": 1.9824527262957008, "grad_norm": 0.6171875, "learning_rate": 1.9458199166134474e-05, "loss": 0.38777186870574953, "num_input_tokens_seen": 15935241664, "step": 56030, "train_runtime": 544819.1346, "train_tokens_per_second": 29248.682 }, { "epoch": 1.9828065465594298, "grad_norm": 0.58984375, "learning_rate": 1.945672587490962e-05, "loss": 0.3864882469177246, "num_input_tokens_seen": 15938158144, "step": 56040, "train_runtime": 544919.7016, "train_tokens_per_second": 29248.636 }, { "epoch": 1.9831603668231583, "grad_norm": 0.62890625, "learning_rate": 1.945525291828794e-05, "loss": 0.3837608814239502, "num_input_tokens_seen": 15941030912, "step": 56050, "train_runtime": 545018.1996, "train_tokens_per_second": 29248.621 }, { "epoch": 1.9835141870868873, "grad_norm": 0.6171875, "learning_rate": 1.945378029614279e-05, "loss": 0.392111611366272, "num_input_tokens_seen": 15943890688, "step": 56060, "train_runtime": 545116.1005, "train_tokens_per_second": 29248.615 }, { "epoch": 1.9838680073506159, "grad_norm": 0.640625, "learning_rate": 1.9452308008347617e-05, "loss": 0.387205982208252, "num_input_tokens_seen": 15946700800, "step": 56070, "train_runtime": 545209.0562, "train_tokens_per_second": 29248.782 }, { "epoch": 1.9842218276143448, "grad_norm": 0.62109375, "learning_rate": 1.945083605477591e-05, "loss": 0.39066190719604493, "num_input_tokens_seen": 15949568640, "step": 56080, "train_runtime": 545307.5681, "train_tokens_per_second": 29248.757 }, { "epoch": 1.9845756478780734, "grad_norm": 0.58203125, "learning_rate": 1.9449364435301235e-05, "loss": 0.3899407863616943, "num_input_tokens_seen": 15952373440, "step": 56090, "train_runtime": 545402.9177, "train_tokens_per_second": 29248.786 }, { "epoch": 1.9849294681418024, "grad_norm": 0.58203125, "learning_rate": 1.944789314979723e-05, "loss": 0.38867807388305664, "num_input_tokens_seen": 15955251264, "step": 56100, "train_runtime": 545500.1708, "train_tokens_per_second": 29248.847 }, { "epoch": 1.9852832884055311, "grad_norm": 0.60546875, "learning_rate": 1.944642219813759e-05, "loss": 0.38737475872039795, "num_input_tokens_seen": 15958147520, "step": 56110, "train_runtime": 545599.7706, "train_tokens_per_second": 29248.816 }, { "epoch": 1.98563710866926, "grad_norm": 0.6171875, "learning_rate": 1.944495158019608e-05, "loss": 0.39335243701934813, "num_input_tokens_seen": 15960998592, "step": 56120, "train_runtime": 545698.4075, "train_tokens_per_second": 29248.754 }, { "epoch": 1.9859909289329887, "grad_norm": 0.609375, "learning_rate": 1.9443481295846537e-05, "loss": 0.3889739990234375, "num_input_tokens_seen": 15963850880, "step": 56130, "train_runtime": 545795.3756, "train_tokens_per_second": 29248.784 }, { "epoch": 1.9863447491967174, "grad_norm": 0.6171875, "learning_rate": 1.9442011344962863e-05, "loss": 0.3894783020019531, "num_input_tokens_seen": 15966651520, "step": 56140, "train_runtime": 545888.3274, "train_tokens_per_second": 29248.934 }, { "epoch": 1.9866985694604462, "grad_norm": 0.578125, "learning_rate": 1.9440541727419024e-05, "loss": 0.38727807998657227, "num_input_tokens_seen": 15969476416, "step": 56150, "train_runtime": 545984.6154, "train_tokens_per_second": 29248.949 }, { "epoch": 1.987052389724175, "grad_norm": 0.625, "learning_rate": 1.9439072443089045e-05, "loss": 0.3868678569793701, "num_input_tokens_seen": 15972270208, "step": 56160, "train_runtime": 546080.1405, "train_tokens_per_second": 29248.949 }, { "epoch": 1.9874062099879037, "grad_norm": 0.59765625, "learning_rate": 1.9437603491847038e-05, "loss": 0.38737854957580564, "num_input_tokens_seen": 15975082880, "step": 56170, "train_runtime": 546173.4227, "train_tokens_per_second": 29249.103 }, { "epoch": 1.9877600302516325, "grad_norm": 0.765625, "learning_rate": 1.943613487356717e-05, "loss": 0.3907593250274658, "num_input_tokens_seen": 15977881472, "step": 56180, "train_runtime": 546268.4217, "train_tokens_per_second": 29249.14 }, { "epoch": 1.9881138505153615, "grad_norm": 0.59765625, "learning_rate": 1.9434666588123665e-05, "loss": 0.38759555816650393, "num_input_tokens_seen": 15980732160, "step": 56190, "train_runtime": 546367.0793, "train_tokens_per_second": 29249.076 }, { "epoch": 1.98846767077909, "grad_norm": 0.59765625, "learning_rate": 1.943319863539083e-05, "loss": 0.38571479320526125, "num_input_tokens_seen": 15983606720, "step": 56200, "train_runtime": 546466.9789, "train_tokens_per_second": 29248.989 }, { "epoch": 1.988821491042819, "grad_norm": 0.609375, "learning_rate": 1.9431731015243026e-05, "loss": 0.38887112140655516, "num_input_tokens_seen": 15986437888, "step": 56210, "train_runtime": 546564.0289, "train_tokens_per_second": 29248.975 }, { "epoch": 1.9891753113065476, "grad_norm": 0.578125, "learning_rate": 1.943026372755469e-05, "loss": 0.38435850143432615, "num_input_tokens_seen": 15989271872, "step": 56220, "train_runtime": 546657.799, "train_tokens_per_second": 29249.143 }, { "epoch": 1.9895291315702766, "grad_norm": 0.59765625, "learning_rate": 1.942879677220032e-05, "loss": 0.38748531341552733, "num_input_tokens_seen": 15992126080, "step": 56230, "train_runtime": 546755.5419, "train_tokens_per_second": 29249.134 }, { "epoch": 1.989882951834005, "grad_norm": 0.59375, "learning_rate": 1.942733014905448e-05, "loss": 0.38696928024291993, "num_input_tokens_seen": 15994999744, "step": 56240, "train_runtime": 546853.9709, "train_tokens_per_second": 29249.124 }, { "epoch": 1.990236772097734, "grad_norm": 0.62109375, "learning_rate": 1.9425863857991804e-05, "loss": 0.3852285385131836, "num_input_tokens_seen": 15997838912, "step": 56250, "train_runtime": 546950.1797, "train_tokens_per_second": 29249.17 }, { "epoch": 1.9905905923614626, "grad_norm": 0.625, "learning_rate": 1.9424397898886988e-05, "loss": 0.39238824844360354, "num_input_tokens_seen": 16000681920, "step": 56260, "train_runtime": 547048.5108, "train_tokens_per_second": 29249.11 }, { "epoch": 1.9909444126251916, "grad_norm": 0.640625, "learning_rate": 1.9422932271614797e-05, "loss": 0.3879425525665283, "num_input_tokens_seen": 16003485632, "step": 56270, "train_runtime": 547144.8376, "train_tokens_per_second": 29249.085 }, { "epoch": 1.9912982328889204, "grad_norm": 0.625, "learning_rate": 1.942146697605006e-05, "loss": 0.3862175941467285, "num_input_tokens_seen": 16006271936, "step": 56280, "train_runtime": 547237.6583, "train_tokens_per_second": 29249.215 }, { "epoch": 1.9916520531526491, "grad_norm": 0.59375, "learning_rate": 1.9420002012067674e-05, "loss": 0.3871592044830322, "num_input_tokens_seen": 16009110784, "step": 56290, "train_runtime": 547333.4235, "train_tokens_per_second": 29249.284 }, { "epoch": 1.992005873416378, "grad_norm": 0.61328125, "learning_rate": 1.94185373795426e-05, "loss": 0.3912575960159302, "num_input_tokens_seen": 16011932416, "step": 56300, "train_runtime": 547428.8662, "train_tokens_per_second": 29249.339 }, { "epoch": 1.9923596936801067, "grad_norm": 0.6015625, "learning_rate": 1.9417073078349874e-05, "loss": 0.38839623928070066, "num_input_tokens_seen": 16014766144, "step": 56310, "train_runtime": 547526.2904, "train_tokens_per_second": 29249.31 }, { "epoch": 1.9927135139438354, "grad_norm": 0.61328125, "learning_rate": 1.9415609108364576e-05, "loss": 0.3878905773162842, "num_input_tokens_seen": 16017600256, "step": 56320, "train_runtime": 547622.7303, "train_tokens_per_second": 29249.334 }, { "epoch": 1.9930673342075642, "grad_norm": 0.61328125, "learning_rate": 1.941414546946188e-05, "loss": 0.38534860610961913, "num_input_tokens_seen": 16020442688, "step": 56330, "train_runtime": 547717.2263, "train_tokens_per_second": 29249.477 }, { "epoch": 1.993421154471293, "grad_norm": 0.61328125, "learning_rate": 1.9412682161517005e-05, "loss": 0.385499906539917, "num_input_tokens_seen": 16023284992, "step": 56340, "train_runtime": 547816.9663, "train_tokens_per_second": 29249.341 }, { "epoch": 1.9937749747350217, "grad_norm": 0.59765625, "learning_rate": 1.9411219184405246e-05, "loss": 0.3872855186462402, "num_input_tokens_seen": 16026120832, "step": 56350, "train_runtime": 547913.5725, "train_tokens_per_second": 29249.359 }, { "epoch": 1.9941287949987507, "grad_norm": 0.59375, "learning_rate": 1.9409756538001956e-05, "loss": 0.38614506721496583, "num_input_tokens_seen": 16028994240, "step": 56360, "train_runtime": 548011.2381, "train_tokens_per_second": 29249.39 }, { "epoch": 1.9944826152624793, "grad_norm": 0.65625, "learning_rate": 1.940829422218256e-05, "loss": 0.3927909374237061, "num_input_tokens_seen": 16031783040, "step": 56370, "train_runtime": 548104.2196, "train_tokens_per_second": 29249.516 }, { "epoch": 1.9948364355262083, "grad_norm": 0.609375, "learning_rate": 1.9406832236822554e-05, "loss": 0.38695297241210935, "num_input_tokens_seen": 16034585152, "step": 56380, "train_runtime": 548200.7224, "train_tokens_per_second": 29249.478 }, { "epoch": 1.9951902557899368, "grad_norm": 0.60546875, "learning_rate": 1.940537058179749e-05, "loss": 0.39509925842285154, "num_input_tokens_seen": 16037380736, "step": 56390, "train_runtime": 548296.1867, "train_tokens_per_second": 29249.484 }, { "epoch": 1.9955440760536658, "grad_norm": 0.60546875, "learning_rate": 1.9403909256982976e-05, "loss": 0.3866716384887695, "num_input_tokens_seen": 16040219648, "step": 56400, "train_runtime": 548394.1267, "train_tokens_per_second": 29249.437 }, { "epoch": 1.9958978963173943, "grad_norm": 0.62109375, "learning_rate": 1.9402448262254713e-05, "loss": 0.3871128082275391, "num_input_tokens_seen": 16043105216, "step": 56410, "train_runtime": 548492.3908, "train_tokens_per_second": 29249.458 }, { "epoch": 1.9962517165811233, "grad_norm": 0.5859375, "learning_rate": 1.940098759748845e-05, "loss": 0.3847597599029541, "num_input_tokens_seen": 16045917184, "step": 56420, "train_runtime": 548585.5884, "train_tokens_per_second": 29249.615 }, { "epoch": 1.9966055368448519, "grad_norm": 0.62890625, "learning_rate": 1.9399527262559997e-05, "loss": 0.39197144508361814, "num_input_tokens_seen": 16048747712, "step": 56430, "train_runtime": 548683.806, "train_tokens_per_second": 29249.538 }, { "epoch": 1.9969593571085809, "grad_norm": 0.609375, "learning_rate": 1.939806725734524e-05, "loss": 0.39178879261016847, "num_input_tokens_seen": 16051591232, "step": 56440, "train_runtime": 548783.5458, "train_tokens_per_second": 29249.403 }, { "epoch": 1.9973131773723096, "grad_norm": 0.6171875, "learning_rate": 1.9396607581720126e-05, "loss": 0.38765707015991213, "num_input_tokens_seen": 16054406464, "step": 56450, "train_runtime": 548881.1302, "train_tokens_per_second": 29249.332 }, { "epoch": 1.9976669976360384, "grad_norm": 0.609375, "learning_rate": 1.9395148235560674e-05, "loss": 0.39126756191253664, "num_input_tokens_seen": 16057303168, "step": 56460, "train_runtime": 548982.8371, "train_tokens_per_second": 29249.19 }, { "epoch": 1.9980208178997672, "grad_norm": 0.609375, "learning_rate": 1.9393689218742955e-05, "loss": 0.3877740383148193, "num_input_tokens_seen": 16060162496, "step": 56470, "train_runtime": 549079.271, "train_tokens_per_second": 29249.26 }, { "epoch": 1.998374638163496, "grad_norm": 0.62109375, "learning_rate": 1.939223053114311e-05, "loss": 0.3860870361328125, "num_input_tokens_seen": 16062997696, "step": 56480, "train_runtime": 549176.1254, "train_tokens_per_second": 29249.264 }, { "epoch": 1.9987284584272247, "grad_norm": 0.609375, "learning_rate": 1.939077217263736e-05, "loss": 0.3871375560760498, "num_input_tokens_seen": 16065828288, "step": 56490, "train_runtime": 549273.7421, "train_tokens_per_second": 29249.22 }, { "epoch": 1.9990822786909535, "grad_norm": 0.60546875, "learning_rate": 1.9389314143101967e-05, "loss": 0.39275059700012205, "num_input_tokens_seen": 16068675392, "step": 56500, "train_runtime": 549370.6268, "train_tokens_per_second": 29249.244 }, { "epoch": 1.9994360989546822, "grad_norm": 0.61328125, "learning_rate": 1.938785644241327e-05, "loss": 0.38933744430541994, "num_input_tokens_seen": 16071454080, "step": 56510, "train_runtime": 549462.9893, "train_tokens_per_second": 29249.384 }, { "epoch": 1.999789919218411, "grad_norm": 0.62109375, "learning_rate": 1.9386399070447685e-05, "loss": 0.3833935260772705, "num_input_tokens_seen": 16074315392, "step": 56520, "train_runtime": 549561.6289, "train_tokens_per_second": 29249.341 }, { "epoch": 2.0001415281054915, "grad_norm": 0.5859375, "learning_rate": 1.938494202708167e-05, "loss": 0.38704848289489746, "num_input_tokens_seen": 16077140928, "step": 56530, "train_runtime": 549667.984, "train_tokens_per_second": 29248.822 }, { "epoch": 2.0004953483692205, "grad_norm": 0.62109375, "learning_rate": 1.9383485312191764e-05, "loss": 0.38617887496948244, "num_input_tokens_seen": 16079929728, "step": 56540, "train_runtime": 549762.1155, "train_tokens_per_second": 29248.887 }, { "epoch": 2.000849168632949, "grad_norm": 0.62890625, "learning_rate": 1.9382028925654567e-05, "loss": 0.3824448585510254, "num_input_tokens_seen": 16082804608, "step": 56550, "train_runtime": 549859.9417, "train_tokens_per_second": 29248.911 }, { "epoch": 2.001202988896678, "grad_norm": 0.6015625, "learning_rate": 1.9380572867346734e-05, "loss": 0.387738037109375, "num_input_tokens_seen": 16085644544, "step": 56560, "train_runtime": 549956.9715, "train_tokens_per_second": 29248.915 }, { "epoch": 2.0015568091604066, "grad_norm": 0.60546875, "learning_rate": 1.9379117137145007e-05, "loss": 0.38633456230163576, "num_input_tokens_seen": 16088528128, "step": 56570, "train_runtime": 550054.5191, "train_tokens_per_second": 29248.97 }, { "epoch": 2.0019106294241356, "grad_norm": 0.609375, "learning_rate": 1.937766173492617e-05, "loss": 0.3873283863067627, "num_input_tokens_seen": 16091350208, "step": 56580, "train_runtime": 550151.4144, "train_tokens_per_second": 29248.948 }, { "epoch": 2.002264449687864, "grad_norm": 0.59375, "learning_rate": 1.9376206660567083e-05, "loss": 0.388609790802002, "num_input_tokens_seen": 16094200960, "step": 56590, "train_runtime": 550250.2922, "train_tokens_per_second": 29248.873 }, { "epoch": 2.002618269951593, "grad_norm": 0.5859375, "learning_rate": 1.9374751913944676e-05, "loss": 0.3812508821487427, "num_input_tokens_seen": 16097080832, "step": 56600, "train_runtime": 550352.5456, "train_tokens_per_second": 29248.672 }, { "epoch": 2.0029720902153216, "grad_norm": 0.625, "learning_rate": 1.9373297494935928e-05, "loss": 0.38963875770568845, "num_input_tokens_seen": 16099895808, "step": 56610, "train_runtime": 550447.658, "train_tokens_per_second": 29248.732 }, { "epoch": 2.0033259104790506, "grad_norm": 0.60546875, "learning_rate": 1.9371843403417894e-05, "loss": 0.38725159168243406, "num_input_tokens_seen": 16102718208, "step": 56620, "train_runtime": 550542.7941, "train_tokens_per_second": 29248.804 }, { "epoch": 2.003679730742779, "grad_norm": 0.59765625, "learning_rate": 1.937038963926769e-05, "loss": 0.3814414978027344, "num_input_tokens_seen": 16105603008, "step": 56630, "train_runtime": 550642.4855, "train_tokens_per_second": 29248.747 }, { "epoch": 2.004033551006508, "grad_norm": 0.63671875, "learning_rate": 1.93689362023625e-05, "loss": 0.38872013092041013, "num_input_tokens_seen": 16108478784, "step": 56640, "train_runtime": 550743.1313, "train_tokens_per_second": 29248.624 }, { "epoch": 2.0043873712702367, "grad_norm": 0.6171875, "learning_rate": 1.936748309257957e-05, "loss": 0.38713483810424804, "num_input_tokens_seen": 16111278848, "step": 56650, "train_runtime": 550835.4975, "train_tokens_per_second": 29248.803 }, { "epoch": 2.0047411915339657, "grad_norm": 0.61328125, "learning_rate": 1.9366030309796208e-05, "loss": 0.38740978240966795, "num_input_tokens_seen": 16114109696, "step": 56660, "train_runtime": 550928.7259, "train_tokens_per_second": 29248.992 }, { "epoch": 2.0050950117976942, "grad_norm": 0.59765625, "learning_rate": 1.936457785388979e-05, "loss": 0.385851526260376, "num_input_tokens_seen": 16116990336, "step": 56670, "train_runtime": 551028.3389, "train_tokens_per_second": 29248.932 }, { "epoch": 2.005448832061423, "grad_norm": 0.62109375, "learning_rate": 1.9363125724737757e-05, "loss": 0.38767757415771487, "num_input_tokens_seen": 16119840448, "step": 56680, "train_runtime": 551124.5255, "train_tokens_per_second": 29248.999 }, { "epoch": 2.0058026523251518, "grad_norm": 0.6015625, "learning_rate": 1.9361673922217612e-05, "loss": 0.3847143888473511, "num_input_tokens_seen": 16122732800, "step": 56690, "train_runtime": 551222.4148, "train_tokens_per_second": 29249.052 }, { "epoch": 2.0061564725888807, "grad_norm": 0.6015625, "learning_rate": 1.9360222446206923e-05, "loss": 0.38465657234191897, "num_input_tokens_seen": 16125596480, "step": 56700, "train_runtime": 551320.5566, "train_tokens_per_second": 29249.039 }, { "epoch": 2.0065102928526097, "grad_norm": 0.65234375, "learning_rate": 1.9358771296583317e-05, "loss": 0.38240666389465333, "num_input_tokens_seen": 16128472704, "step": 56710, "train_runtime": 551419.452, "train_tokens_per_second": 29249.009 }, { "epoch": 2.0068641131163383, "grad_norm": 0.62109375, "learning_rate": 1.935732047322449e-05, "loss": 0.3871786117553711, "num_input_tokens_seen": 16131364864, "step": 56720, "train_runtime": 551518.8231, "train_tokens_per_second": 29248.983 }, { "epoch": 2.0072179333800673, "grad_norm": 0.60546875, "learning_rate": 1.9355869976008212e-05, "loss": 0.3847933292388916, "num_input_tokens_seen": 16134208448, "step": 56730, "train_runtime": 551617.4706, "train_tokens_per_second": 29248.908 }, { "epoch": 2.007571753643796, "grad_norm": 0.6171875, "learning_rate": 1.9354419804812303e-05, "loss": 0.3835297107696533, "num_input_tokens_seen": 16137034688, "step": 56740, "train_runtime": 551714.0554, "train_tokens_per_second": 29248.91 }, { "epoch": 2.007925573907525, "grad_norm": 0.609375, "learning_rate": 1.935296995951465e-05, "loss": 0.38516807556152344, "num_input_tokens_seen": 16139858944, "step": 56750, "train_runtime": 551808.7734, "train_tokens_per_second": 29249.007 }, { "epoch": 2.0082793941712533, "grad_norm": 0.625, "learning_rate": 1.9351520439993207e-05, "loss": 0.3873849630355835, "num_input_tokens_seen": 16142652160, "step": 56760, "train_runtime": 551904.9945, "train_tokens_per_second": 29248.969 }, { "epoch": 2.0086332144349823, "grad_norm": 0.58984375, "learning_rate": 1.935007124612599e-05, "loss": 0.38938198089599607, "num_input_tokens_seen": 16145533824, "step": 56770, "train_runtime": 552003.5175, "train_tokens_per_second": 29248.969 }, { "epoch": 2.008987034698711, "grad_norm": 0.6015625, "learning_rate": 1.9348622377791077e-05, "loss": 0.38253188133239746, "num_input_tokens_seen": 16148411392, "step": 56780, "train_runtime": 552100.5256, "train_tokens_per_second": 29249.042 }, { "epoch": 2.00934085496244, "grad_norm": 0.62109375, "learning_rate": 1.9347173834866616e-05, "loss": 0.3878162860870361, "num_input_tokens_seen": 16151261248, "step": 56790, "train_runtime": 552199.3174, "train_tokens_per_second": 29248.97 }, { "epoch": 2.0096946752261684, "grad_norm": 0.6484375, "learning_rate": 1.9345725617230813e-05, "loss": 0.390401291847229, "num_input_tokens_seen": 16154109568, "step": 56800, "train_runtime": 552297.3459, "train_tokens_per_second": 29248.936 }, { "epoch": 2.0100484954898974, "grad_norm": 0.63671875, "learning_rate": 1.9344277724761943e-05, "loss": 0.38604035377502444, "num_input_tokens_seen": 16156944128, "step": 56810, "train_runtime": 552396.9767, "train_tokens_per_second": 29248.792 }, { "epoch": 2.010402315753626, "grad_norm": 0.62890625, "learning_rate": 1.9342830157338338e-05, "loss": 0.3858720064163208, "num_input_tokens_seen": 16159769408, "step": 56820, "train_runtime": 552492.0817, "train_tokens_per_second": 29248.871 }, { "epoch": 2.010756136017355, "grad_norm": 0.6171875, "learning_rate": 1.93413829148384e-05, "loss": 0.38519110679626467, "num_input_tokens_seen": 16162587264, "step": 56830, "train_runtime": 552588.2256, "train_tokens_per_second": 29248.881 }, { "epoch": 2.0111099562810835, "grad_norm": 0.62890625, "learning_rate": 1.9339935997140592e-05, "loss": 0.3876930236816406, "num_input_tokens_seen": 16165395328, "step": 56840, "train_runtime": 552682.9627, "train_tokens_per_second": 29248.948 }, { "epoch": 2.0114637765448125, "grad_norm": 0.61328125, "learning_rate": 1.9338489404123445e-05, "loss": 0.384290885925293, "num_input_tokens_seen": 16168253568, "step": 56850, "train_runtime": 552783.4325, "train_tokens_per_second": 29248.803 }, { "epoch": 2.0118175968085414, "grad_norm": 0.640625, "learning_rate": 1.933704313566554e-05, "loss": 0.3906275510787964, "num_input_tokens_seen": 16171069824, "step": 56860, "train_runtime": 552878.7366, "train_tokens_per_second": 29248.855 }, { "epoch": 2.01217141707227, "grad_norm": 0.609375, "learning_rate": 1.9335597191645538e-05, "loss": 0.3834575414657593, "num_input_tokens_seen": 16173874944, "step": 56870, "train_runtime": 552975.2534, "train_tokens_per_second": 29248.822 }, { "epoch": 2.012525237335999, "grad_norm": 0.62890625, "learning_rate": 1.9334151571942157e-05, "loss": 0.38457741737365725, "num_input_tokens_seen": 16176671680, "step": 56880, "train_runtime": 553069.6287, "train_tokens_per_second": 29248.888 }, { "epoch": 2.0128790575997275, "grad_norm": 0.6015625, "learning_rate": 1.933270627643417e-05, "loss": 0.3847815990447998, "num_input_tokens_seen": 16179527232, "step": 56890, "train_runtime": 553168.0118, "train_tokens_per_second": 29248.848 }, { "epoch": 2.0132328778634565, "grad_norm": 0.62109375, "learning_rate": 1.9331261305000432e-05, "loss": 0.3897664546966553, "num_input_tokens_seen": 16182371008, "step": 56900, "train_runtime": 553264.691, "train_tokens_per_second": 29248.877 }, { "epoch": 2.013586698127185, "grad_norm": 0.6171875, "learning_rate": 1.9329816657519845e-05, "loss": 0.3876787185668945, "num_input_tokens_seen": 16185209088, "step": 56910, "train_runtime": 553359.4992, "train_tokens_per_second": 29248.995 }, { "epoch": 2.013940518390914, "grad_norm": 0.62890625, "learning_rate": 1.9328372333871378e-05, "loss": 0.38917956352233884, "num_input_tokens_seen": 16187992576, "step": 56920, "train_runtime": 553454.5417, "train_tokens_per_second": 29249.001 }, { "epoch": 2.0142943386546426, "grad_norm": 0.64453125, "learning_rate": 1.9326928333934072e-05, "loss": 0.3802932262420654, "num_input_tokens_seen": 16190857664, "step": 56930, "train_runtime": 553553.8492, "train_tokens_per_second": 29248.93 }, { "epoch": 2.0146481589183716, "grad_norm": 0.5859375, "learning_rate": 1.9325484657587018e-05, "loss": 0.38528952598571775, "num_input_tokens_seen": 16193695104, "step": 56940, "train_runtime": 553651.5095, "train_tokens_per_second": 29248.895 }, { "epoch": 2.0150019791821, "grad_norm": 0.59375, "learning_rate": 1.932404130470938e-05, "loss": 0.3865856409072876, "num_input_tokens_seen": 16196511360, "step": 56950, "train_runtime": 553746.0466, "train_tokens_per_second": 29248.988 }, { "epoch": 2.015355799445829, "grad_norm": 0.6015625, "learning_rate": 1.9322598275180383e-05, "loss": 0.38748080730438234, "num_input_tokens_seen": 16199365248, "step": 56960, "train_runtime": 553844.8517, "train_tokens_per_second": 29248.923 }, { "epoch": 2.0157096197095576, "grad_norm": 0.59765625, "learning_rate": 1.9321155568879315e-05, "loss": 0.38855226039886476, "num_input_tokens_seen": 16202188288, "step": 56970, "train_runtime": 553941.4092, "train_tokens_per_second": 29248.921 }, { "epoch": 2.0160634399732866, "grad_norm": 0.59765625, "learning_rate": 1.9319713185685522e-05, "loss": 0.3852694511413574, "num_input_tokens_seen": 16205015936, "step": 56980, "train_runtime": 554039.6616, "train_tokens_per_second": 29248.837 }, { "epoch": 2.016417260237015, "grad_norm": 0.5859375, "learning_rate": 1.9318271125478422e-05, "loss": 0.391272759437561, "num_input_tokens_seen": 16207861376, "step": 56990, "train_runtime": 554134.221, "train_tokens_per_second": 29248.981 }, { "epoch": 2.016771080500744, "grad_norm": 0.62109375, "learning_rate": 1.9316829388137487e-05, "loss": 0.38520827293396, "num_input_tokens_seen": 16210714240, "step": 57000, "train_runtime": 554232.7394, "train_tokens_per_second": 29248.929 }, { "epoch": 2.0171249007644727, "grad_norm": 0.6328125, "learning_rate": 1.931538797354226e-05, "loss": 0.3826314926147461, "num_input_tokens_seen": 16213538688, "step": 57010, "train_runtime": 554329.5303, "train_tokens_per_second": 29248.917 }, { "epoch": 2.0174787210282017, "grad_norm": 0.5859375, "learning_rate": 1.931394688157234e-05, "loss": 0.386994743347168, "num_input_tokens_seen": 16216409728, "step": 57020, "train_runtime": 554429.2333, "train_tokens_per_second": 29248.836 }, { "epoch": 2.0178325412919307, "grad_norm": 0.625, "learning_rate": 1.9312506112107394e-05, "loss": 0.3874991416931152, "num_input_tokens_seen": 16219295360, "step": 57030, "train_runtime": 554528.9717, "train_tokens_per_second": 29248.779 }, { "epoch": 2.0181863615556592, "grad_norm": 0.6640625, "learning_rate": 1.931106566502715e-05, "loss": 0.385809326171875, "num_input_tokens_seen": 16222161216, "step": 57040, "train_runtime": 554632.041, "train_tokens_per_second": 29248.511 }, { "epoch": 2.018540181819388, "grad_norm": 0.609375, "learning_rate": 1.9309625540211397e-05, "loss": 0.38689398765563965, "num_input_tokens_seen": 16224984512, "step": 57050, "train_runtime": 554729.5222, "train_tokens_per_second": 29248.46 }, { "epoch": 2.0188940020831168, "grad_norm": 0.6171875, "learning_rate": 1.9308185737539988e-05, "loss": 0.3856795787811279, "num_input_tokens_seen": 16227826048, "step": 57060, "train_runtime": 554826.0232, "train_tokens_per_second": 29248.495 }, { "epoch": 2.0192478223468457, "grad_norm": 0.61328125, "learning_rate": 1.930674625689284e-05, "loss": 0.3907461404800415, "num_input_tokens_seen": 16230663616, "step": 57070, "train_runtime": 554922.5407, "train_tokens_per_second": 29248.521 }, { "epoch": 2.0196016426105743, "grad_norm": 0.62890625, "learning_rate": 1.9305307098149935e-05, "loss": 0.38799228668212893, "num_input_tokens_seen": 16233473984, "step": 57080, "train_runtime": 555017.6253, "train_tokens_per_second": 29248.574 }, { "epoch": 2.0199554628743033, "grad_norm": 0.6171875, "learning_rate": 1.930386826119131e-05, "loss": 0.3867323875427246, "num_input_tokens_seen": 16236298688, "step": 57090, "train_runtime": 555112.0126, "train_tokens_per_second": 29248.689 }, { "epoch": 2.020309283138032, "grad_norm": 0.59765625, "learning_rate": 1.930242974589707e-05, "loss": 0.3862288475036621, "num_input_tokens_seen": 16239094976, "step": 57100, "train_runtime": 555206.5344, "train_tokens_per_second": 29248.746 }, { "epoch": 2.020663103401761, "grad_norm": 0.6171875, "learning_rate": 1.9300991552147384e-05, "loss": 0.3861955165863037, "num_input_tokens_seen": 16241963392, "step": 57110, "train_runtime": 555306.6935, "train_tokens_per_second": 29248.636 }, { "epoch": 2.0210169236654894, "grad_norm": 0.6171875, "learning_rate": 1.9299553679822472e-05, "loss": 0.38731913566589354, "num_input_tokens_seen": 16244818176, "step": 57120, "train_runtime": 555403.9317, "train_tokens_per_second": 29248.655 }, { "epoch": 2.0213707439292183, "grad_norm": 0.609375, "learning_rate": 1.929811612880264e-05, "loss": 0.3851296901702881, "num_input_tokens_seen": 16247708736, "step": 57130, "train_runtime": 555503.9843, "train_tokens_per_second": 29248.591 }, { "epoch": 2.021724564192947, "grad_norm": 0.60546875, "learning_rate": 1.929667889896823e-05, "loss": 0.3831844091415405, "num_input_tokens_seen": 16250485120, "step": 57140, "train_runtime": 555597.1178, "train_tokens_per_second": 29248.685 }, { "epoch": 2.022078384456676, "grad_norm": 0.6328125, "learning_rate": 1.9295241990199666e-05, "loss": 0.3858208656311035, "num_input_tokens_seen": 16253317120, "step": 57150, "train_runtime": 555692.686, "train_tokens_per_second": 29248.751 }, { "epoch": 2.0224322047204044, "grad_norm": 0.6171875, "learning_rate": 1.9293805402377416e-05, "loss": 0.3857236385345459, "num_input_tokens_seen": 16256130560, "step": 57160, "train_runtime": 555785.9703, "train_tokens_per_second": 29248.904 }, { "epoch": 2.0227860249841334, "grad_norm": 0.640625, "learning_rate": 1.9292369135382035e-05, "loss": 0.3830159902572632, "num_input_tokens_seen": 16258945856, "step": 57170, "train_runtime": 555882.5793, "train_tokens_per_second": 29248.885 }, { "epoch": 2.023139845247862, "grad_norm": 0.62109375, "learning_rate": 1.9290933189094114e-05, "loss": 0.38844497203826905, "num_input_tokens_seen": 16261732672, "step": 57180, "train_runtime": 555976.2799, "train_tokens_per_second": 29248.968 }, { "epoch": 2.023493665511591, "grad_norm": 0.609375, "learning_rate": 1.928949756339432e-05, "loss": 0.38911459445953367, "num_input_tokens_seen": 16264601152, "step": 57190, "train_runtime": 556076.4171, "train_tokens_per_second": 29248.86 }, { "epoch": 2.02384748577532, "grad_norm": 0.61328125, "learning_rate": 1.9288062258163386e-05, "loss": 0.3868520975112915, "num_input_tokens_seen": 16267415296, "step": 57200, "train_runtime": 556170.3384, "train_tokens_per_second": 29248.98 }, { "epoch": 2.0242013060390485, "grad_norm": 0.61328125, "learning_rate": 1.92866272732821e-05, "loss": 0.383447527885437, "num_input_tokens_seen": 16270270080, "step": 57210, "train_runtime": 556270.2683, "train_tokens_per_second": 29248.858 }, { "epoch": 2.0245551263027775, "grad_norm": 0.6015625, "learning_rate": 1.928519260863131e-05, "loss": 0.38642072677612305, "num_input_tokens_seen": 16273134592, "step": 57220, "train_runtime": 556368.4004, "train_tokens_per_second": 29248.848 }, { "epoch": 2.024908946566506, "grad_norm": 0.62109375, "learning_rate": 1.9283758264091932e-05, "loss": 0.38658928871154785, "num_input_tokens_seen": 16275985856, "step": 57230, "train_runtime": 556464.4672, "train_tokens_per_second": 29248.922 }, { "epoch": 2.025262766830235, "grad_norm": 0.60546875, "learning_rate": 1.9282324239544938e-05, "loss": 0.38594517707824705, "num_input_tokens_seen": 16278872896, "step": 57240, "train_runtime": 556566.1764, "train_tokens_per_second": 29248.764 }, { "epoch": 2.0256165870939635, "grad_norm": 0.6015625, "learning_rate": 1.9280890534871375e-05, "loss": 0.38664746284484863, "num_input_tokens_seen": 16281744064, "step": 57250, "train_runtime": 556664.9385, "train_tokens_per_second": 29248.733 }, { "epoch": 2.0259704073576925, "grad_norm": 0.61328125, "learning_rate": 1.9279457149952333e-05, "loss": 0.3837035894393921, "num_input_tokens_seen": 16284558848, "step": 57260, "train_runtime": 556760.7209, "train_tokens_per_second": 29248.757 }, { "epoch": 2.026324227621421, "grad_norm": 0.60546875, "learning_rate": 1.9278024084668976e-05, "loss": 0.3891209363937378, "num_input_tokens_seen": 16287411648, "step": 57270, "train_runtime": 556858.9716, "train_tokens_per_second": 29248.719 }, { "epoch": 2.02667804788515, "grad_norm": 0.58203125, "learning_rate": 1.9276591338902524e-05, "loss": 0.38507354259490967, "num_input_tokens_seen": 16290273344, "step": 57280, "train_runtime": 556957.0206, "train_tokens_per_second": 29248.708 }, { "epoch": 2.0270318681488786, "grad_norm": 0.63671875, "learning_rate": 1.9275158912534273e-05, "loss": 0.38678689002990724, "num_input_tokens_seen": 16293120320, "step": 57290, "train_runtime": 557054.4727, "train_tokens_per_second": 29248.702 }, { "epoch": 2.0273856884126076, "grad_norm": 0.625, "learning_rate": 1.9273726805445557e-05, "loss": 0.3900745868682861, "num_input_tokens_seen": 16295982912, "step": 57300, "train_runtime": 557151.7909, "train_tokens_per_second": 29248.731 }, { "epoch": 2.027739508676336, "grad_norm": 0.59375, "learning_rate": 1.927229501751779e-05, "loss": 0.3791146993637085, "num_input_tokens_seen": 16298892096, "step": 57310, "train_runtime": 557254.2572, "train_tokens_per_second": 29248.573 }, { "epoch": 2.028093328940065, "grad_norm": 0.61328125, "learning_rate": 1.9270863548632443e-05, "loss": 0.38923916816711424, "num_input_tokens_seen": 16301703744, "step": 57320, "train_runtime": 557346.5851, "train_tokens_per_second": 29248.773 }, { "epoch": 2.0284471492037937, "grad_norm": 0.64453125, "learning_rate": 1.9269432398671045e-05, "loss": 0.38825297355651855, "num_input_tokens_seen": 16304540672, "step": 57330, "train_runtime": 557445.2754, "train_tokens_per_second": 29248.684 }, { "epoch": 2.0288009694675226, "grad_norm": 0.60546875, "learning_rate": 1.926800156751519e-05, "loss": 0.38906786441802976, "num_input_tokens_seen": 16307324480, "step": 57340, "train_runtime": 557539.0879, "train_tokens_per_second": 29248.756 }, { "epoch": 2.029154789731251, "grad_norm": 0.59375, "learning_rate": 1.9266571055046537e-05, "loss": 0.3896360158920288, "num_input_tokens_seen": 16310174400, "step": 57350, "train_runtime": 557636.9285, "train_tokens_per_second": 29248.734 }, { "epoch": 2.02950860999498, "grad_norm": 0.63671875, "learning_rate": 1.9265140861146795e-05, "loss": 0.3821599006652832, "num_input_tokens_seen": 16313056256, "step": 57360, "train_runtime": 557737.6963, "train_tokens_per_second": 29248.617 }, { "epoch": 2.029862430258709, "grad_norm": 0.625, "learning_rate": 1.9263710985697744e-05, "loss": 0.38727900981903074, "num_input_tokens_seen": 16315897216, "step": 57370, "train_runtime": 557833.805, "train_tokens_per_second": 29248.671 }, { "epoch": 2.0302162505224377, "grad_norm": 0.625, "learning_rate": 1.9262281428581227e-05, "loss": 0.3850520133972168, "num_input_tokens_seen": 16318746432, "step": 57380, "train_runtime": 557930.4874, "train_tokens_per_second": 29248.709 }, { "epoch": 2.0305700707861667, "grad_norm": 0.61328125, "learning_rate": 1.926085218967914e-05, "loss": 0.3860297203063965, "num_input_tokens_seen": 16321615360, "step": 57390, "train_runtime": 558027.1512, "train_tokens_per_second": 29248.784 }, { "epoch": 2.0309238910498952, "grad_norm": 0.6328125, "learning_rate": 1.925942326887345e-05, "loss": 0.3840751886367798, "num_input_tokens_seen": 16324460160, "step": 57400, "train_runtime": 558127.4625, "train_tokens_per_second": 29248.624 }, { "epoch": 2.0312777113136242, "grad_norm": 0.61328125, "learning_rate": 1.925799466604617e-05, "loss": 0.3841102123260498, "num_input_tokens_seen": 16327308032, "step": 57410, "train_runtime": 558225.264, "train_tokens_per_second": 29248.601 }, { "epoch": 2.0316315315773528, "grad_norm": 0.61328125, "learning_rate": 1.9256566381079393e-05, "loss": 0.38485302925109866, "num_input_tokens_seen": 16330159360, "step": 57420, "train_runtime": 558323.6783, "train_tokens_per_second": 29248.552 }, { "epoch": 2.0319853518410818, "grad_norm": 0.62890625, "learning_rate": 1.9255138413855265e-05, "loss": 0.38656368255615237, "num_input_tokens_seen": 16333020608, "step": 57430, "train_runtime": 558423.0674, "train_tokens_per_second": 29248.47 }, { "epoch": 2.0323391721048103, "grad_norm": 0.609375, "learning_rate": 1.9253710764255987e-05, "loss": 0.38820481300354004, "num_input_tokens_seen": 16335876224, "step": 57440, "train_runtime": 558518.9273, "train_tokens_per_second": 29248.563 }, { "epoch": 2.0326929923685393, "grad_norm": 0.60546875, "learning_rate": 1.925228343216383e-05, "loss": 0.3871767520904541, "num_input_tokens_seen": 16338737920, "step": 57450, "train_runtime": 558615.622, "train_tokens_per_second": 29248.623 }, { "epoch": 2.033046812632268, "grad_norm": 0.609375, "learning_rate": 1.925085641746113e-05, "loss": 0.3866570472717285, "num_input_tokens_seen": 16341589632, "step": 57460, "train_runtime": 558709.6202, "train_tokens_per_second": 29248.807 }, { "epoch": 2.033400632895997, "grad_norm": 0.60546875, "learning_rate": 1.9249429720030262e-05, "loss": 0.3798818588256836, "num_input_tokens_seen": 16344415744, "step": 57470, "train_runtime": 558803.5216, "train_tokens_per_second": 29248.949 }, { "epoch": 2.0337544531597254, "grad_norm": 0.5859375, "learning_rate": 1.9248003339753688e-05, "loss": 0.3787179946899414, "num_input_tokens_seen": 16347214720, "step": 57480, "train_runtime": 558898.0564, "train_tokens_per_second": 29249.01 }, { "epoch": 2.0341082734234543, "grad_norm": 0.6328125, "learning_rate": 1.9246577276513916e-05, "loss": 0.38461205959320066, "num_input_tokens_seen": 16350015872, "step": 57490, "train_runtime": 558996.377, "train_tokens_per_second": 29248.876 }, { "epoch": 2.034462093687183, "grad_norm": 0.6484375, "learning_rate": 1.9245151530193517e-05, "loss": 0.3852632999420166, "num_input_tokens_seen": 16352839488, "step": 57500, "train_runtime": 559093.7959, "train_tokens_per_second": 29248.83 }, { "epoch": 2.034815913950912, "grad_norm": 0.58984375, "learning_rate": 1.9243726100675132e-05, "loss": 0.3867560863494873, "num_input_tokens_seen": 16355633728, "step": 57510, "train_runtime": 559188.6361, "train_tokens_per_second": 29248.866 }, { "epoch": 2.0351697342146404, "grad_norm": 0.6171875, "learning_rate": 1.924230098784145e-05, "loss": 0.3869407892227173, "num_input_tokens_seen": 16358462400, "step": 57520, "train_runtime": 559284.7853, "train_tokens_per_second": 29248.896 }, { "epoch": 2.0355235544783694, "grad_norm": 0.58984375, "learning_rate": 1.9240876191575226e-05, "loss": 0.3871732234954834, "num_input_tokens_seen": 16361296448, "step": 57530, "train_runtime": 559379.9067, "train_tokens_per_second": 29248.988 }, { "epoch": 2.0358773747420984, "grad_norm": 0.6171875, "learning_rate": 1.923945171175928e-05, "loss": 0.38892321586608886, "num_input_tokens_seen": 16364104640, "step": 57540, "train_runtime": 559476.7551, "train_tokens_per_second": 29248.945 }, { "epoch": 2.036231195005827, "grad_norm": 0.64453125, "learning_rate": 1.9238027548276487e-05, "loss": 0.38225431442260743, "num_input_tokens_seen": 16366969344, "step": 57550, "train_runtime": 559573.6006, "train_tokens_per_second": 29249.002 }, { "epoch": 2.036585015269556, "grad_norm": 0.6171875, "learning_rate": 1.923660370100978e-05, "loss": 0.38768270015716555, "num_input_tokens_seen": 16369761984, "step": 57560, "train_runtime": 559667.6261, "train_tokens_per_second": 29249.078 }, { "epoch": 2.0369388355332845, "grad_norm": 0.6328125, "learning_rate": 1.9235180169842168e-05, "loss": 0.3881745576858521, "num_input_tokens_seen": 16372637952, "step": 57570, "train_runtime": 559766.5694, "train_tokens_per_second": 29249.046 }, { "epoch": 2.0372926557970135, "grad_norm": 0.62890625, "learning_rate": 1.9233756954656694e-05, "loss": 0.3880466938018799, "num_input_tokens_seen": 16375454912, "step": 57580, "train_runtime": 559862.882, "train_tokens_per_second": 29249.046 }, { "epoch": 2.037646476060742, "grad_norm": 0.60546875, "learning_rate": 1.9232334055336495e-05, "loss": 0.3897970914840698, "num_input_tokens_seen": 16378272576, "step": 57590, "train_runtime": 559959.1872, "train_tokens_per_second": 29249.047 }, { "epoch": 2.038000296324471, "grad_norm": 0.61328125, "learning_rate": 1.923091147176474e-05, "loss": 0.3881336212158203, "num_input_tokens_seen": 16381104576, "step": 57600, "train_runtime": 560056.3161, "train_tokens_per_second": 29249.031 }, { "epoch": 2.0383541165881995, "grad_norm": 0.6328125, "learning_rate": 1.9229489203824668e-05, "loss": 0.3915989398956299, "num_input_tokens_seen": 16383972736, "step": 57610, "train_runtime": 560156.3244, "train_tokens_per_second": 29248.929 }, { "epoch": 2.0387079368519285, "grad_norm": 0.61328125, "learning_rate": 1.9228067251399588e-05, "loss": 0.3817268371582031, "num_input_tokens_seen": 16386880320, "step": 57620, "train_runtime": 560259.8743, "train_tokens_per_second": 29248.713 }, { "epoch": 2.039061757115657, "grad_norm": 0.60546875, "learning_rate": 1.9226645614372854e-05, "loss": 0.3863487482070923, "num_input_tokens_seen": 16389696512, "step": 57630, "train_runtime": 560357.6068, "train_tokens_per_second": 29248.638 }, { "epoch": 2.039415577379386, "grad_norm": 0.64453125, "learning_rate": 1.922522429262789e-05, "loss": 0.39143540859222414, "num_input_tokens_seen": 16392534016, "step": 57640, "train_runtime": 560452.988, "train_tokens_per_second": 29248.723 }, { "epoch": 2.0397693976431146, "grad_norm": 0.6328125, "learning_rate": 1.9223803286048182e-05, "loss": 0.39022886753082275, "num_input_tokens_seen": 16395392576, "step": 57650, "train_runtime": 560552.3168, "train_tokens_per_second": 29248.639 }, { "epoch": 2.0401232179068436, "grad_norm": 0.6328125, "learning_rate": 1.9222382594517262e-05, "loss": 0.3853925228118896, "num_input_tokens_seen": 16398186176, "step": 57660, "train_runtime": 560643.8478, "train_tokens_per_second": 29248.847 }, { "epoch": 2.040477038170572, "grad_norm": 0.65234375, "learning_rate": 1.9220962217918742e-05, "loss": 0.38784065246582033, "num_input_tokens_seen": 16400999424, "step": 57670, "train_runtime": 560739.2843, "train_tokens_per_second": 29248.886 }, { "epoch": 2.040830858434301, "grad_norm": 0.640625, "learning_rate": 1.921954215613628e-05, "loss": 0.38124451637268064, "num_input_tokens_seen": 16403853632, "step": 57680, "train_runtime": 560832.849, "train_tokens_per_second": 29249.096 }, { "epoch": 2.0411846786980297, "grad_norm": 0.6015625, "learning_rate": 1.92181224090536e-05, "loss": 0.38401103019714355, "num_input_tokens_seen": 16406737536, "step": 57690, "train_runtime": 560932.3604, "train_tokens_per_second": 29249.048 }, { "epoch": 2.0415384989617587, "grad_norm": 0.59765625, "learning_rate": 1.9216702976554487e-05, "loss": 0.38697223663330077, "num_input_tokens_seen": 16409616320, "step": 57700, "train_runtime": 561031.5844, "train_tokens_per_second": 29249.006 }, { "epoch": 2.0418923192254876, "grad_norm": 0.58203125, "learning_rate": 1.9215283858522782e-05, "loss": 0.3856818199157715, "num_input_tokens_seen": 16412478848, "step": 57710, "train_runtime": 561129.7848, "train_tokens_per_second": 29248.989 }, { "epoch": 2.042246139489216, "grad_norm": 0.59375, "learning_rate": 1.9213865054842385e-05, "loss": 0.3871749401092529, "num_input_tokens_seen": 16415389632, "step": 57720, "train_runtime": 561229.7931, "train_tokens_per_second": 29248.963 }, { "epoch": 2.042599959752945, "grad_norm": 0.6171875, "learning_rate": 1.921244656539726e-05, "loss": 0.3837709426879883, "num_input_tokens_seen": 16418210240, "step": 57730, "train_runtime": 561324.8009, "train_tokens_per_second": 29249.038 }, { "epoch": 2.0429537800166737, "grad_norm": 0.6171875, "learning_rate": 1.9211028390071435e-05, "loss": 0.38338398933410645, "num_input_tokens_seen": 16421070208, "step": 57740, "train_runtime": 561424.1885, "train_tokens_per_second": 29248.954 }, { "epoch": 2.0433076002804027, "grad_norm": 0.61328125, "learning_rate": 1.9209610528748988e-05, "loss": 0.38839943408966066, "num_input_tokens_seen": 16423968064, "step": 57750, "train_runtime": 561524.4996, "train_tokens_per_second": 29248.89 }, { "epoch": 2.0436614205441312, "grad_norm": 0.60546875, "learning_rate": 1.9208192981314058e-05, "loss": 0.3894335269927979, "num_input_tokens_seen": 16426784896, "step": 57760, "train_runtime": 561622.3918, "train_tokens_per_second": 29248.807 }, { "epoch": 2.0440152408078602, "grad_norm": 0.625, "learning_rate": 1.9206775747650858e-05, "loss": 0.38296008110046387, "num_input_tokens_seen": 16429569536, "step": 57770, "train_runtime": 561715.7375, "train_tokens_per_second": 29248.904 }, { "epoch": 2.0443690610715888, "grad_norm": 0.6328125, "learning_rate": 1.9205358827643647e-05, "loss": 0.38352227210998535, "num_input_tokens_seen": 16432386752, "step": 57780, "train_runtime": 561809.0363, "train_tokens_per_second": 29249.061 }, { "epoch": 2.0447228813353178, "grad_norm": 0.609375, "learning_rate": 1.9203942221176744e-05, "loss": 0.38447539806365966, "num_input_tokens_seen": 16435227136, "step": 57790, "train_runtime": 561905.3125, "train_tokens_per_second": 29249.104 }, { "epoch": 2.0450767015990463, "grad_norm": 0.60546875, "learning_rate": 1.9202525928134525e-05, "loss": 0.3876351356506348, "num_input_tokens_seen": 16438072832, "step": 57800, "train_runtime": 562004.4789, "train_tokens_per_second": 29249.007 }, { "epoch": 2.0454305218627753, "grad_norm": 0.62109375, "learning_rate": 1.9201109948401445e-05, "loss": 0.38484692573547363, "num_input_tokens_seen": 16440924416, "step": 57810, "train_runtime": 562103.1082, "train_tokens_per_second": 29248.948 }, { "epoch": 2.045784342126504, "grad_norm": 0.640625, "learning_rate": 1.9199694281861996e-05, "loss": 0.3874545097351074, "num_input_tokens_seen": 16443785088, "step": 57820, "train_runtime": 562200.5191, "train_tokens_per_second": 29248.968 }, { "epoch": 2.046138162390233, "grad_norm": 0.6328125, "learning_rate": 1.9198278928400747e-05, "loss": 0.38264055252075196, "num_input_tokens_seen": 16446580032, "step": 57830, "train_runtime": 562295.3919, "train_tokens_per_second": 29249.004 }, { "epoch": 2.0464919826539614, "grad_norm": 0.58203125, "learning_rate": 1.9196863887902305e-05, "loss": 0.383734393119812, "num_input_tokens_seen": 16449394368, "step": 57840, "train_runtime": 562390.4881, "train_tokens_per_second": 29249.062 }, { "epoch": 2.0468458029176904, "grad_norm": 0.5859375, "learning_rate": 1.919544916025136e-05, "loss": 0.3878195285797119, "num_input_tokens_seen": 16452250240, "step": 57850, "train_runtime": 562486.8766, "train_tokens_per_second": 29249.127 }, { "epoch": 2.0471996231814193, "grad_norm": 0.62890625, "learning_rate": 1.919403474533265e-05, "loss": 0.38706605434417723, "num_input_tokens_seen": 16455117440, "step": 57860, "train_runtime": 562586.7438, "train_tokens_per_second": 29249.032 }, { "epoch": 2.047553443445148, "grad_norm": 0.609375, "learning_rate": 1.919262064303097e-05, "loss": 0.3906421661376953, "num_input_tokens_seen": 16457974784, "step": 57870, "train_runtime": 562684.496, "train_tokens_per_second": 29249.028 }, { "epoch": 2.047907263708877, "grad_norm": 0.62109375, "learning_rate": 1.9191206853231182e-05, "loss": 0.38469743728637695, "num_input_tokens_seen": 16460806592, "step": 57880, "train_runtime": 562780.0141, "train_tokens_per_second": 29249.096 }, { "epoch": 2.0482610839726054, "grad_norm": 0.59375, "learning_rate": 1.9189793375818203e-05, "loss": 0.3847479343414307, "num_input_tokens_seen": 16463637056, "step": 57890, "train_runtime": 562879.5573, "train_tokens_per_second": 29248.952 }, { "epoch": 2.0486149042363344, "grad_norm": 0.625, "learning_rate": 1.9188380210677005e-05, "loss": 0.39026119709014895, "num_input_tokens_seen": 16466482944, "step": 57900, "train_runtime": 562974.5809, "train_tokens_per_second": 29249.07 }, { "epoch": 2.048968724500063, "grad_norm": 0.62109375, "learning_rate": 1.9186967357692633e-05, "loss": 0.3886385440826416, "num_input_tokens_seen": 16469398272, "step": 57910, "train_runtime": 563077.4703, "train_tokens_per_second": 29248.903 }, { "epoch": 2.049322544763792, "grad_norm": 0.6171875, "learning_rate": 1.918555481675017e-05, "loss": 0.3855393648147583, "num_input_tokens_seen": 16472209088, "step": 57920, "train_runtime": 563174.7692, "train_tokens_per_second": 29248.841 }, { "epoch": 2.0496763650275205, "grad_norm": 0.61328125, "learning_rate": 1.9184142587734786e-05, "loss": 0.3866295099258423, "num_input_tokens_seen": 16475035968, "step": 57930, "train_runtime": 563272.7156, "train_tokens_per_second": 29248.773 }, { "epoch": 2.0500301852912495, "grad_norm": 0.62109375, "learning_rate": 1.918273067053168e-05, "loss": 0.3828116893768311, "num_input_tokens_seen": 16477834560, "step": 57940, "train_runtime": 563366.9196, "train_tokens_per_second": 29248.85 }, { "epoch": 2.050384005554978, "grad_norm": 0.62890625, "learning_rate": 1.9181319065026137e-05, "loss": 0.3829640865325928, "num_input_tokens_seen": 16480694144, "step": 57950, "train_runtime": 563465.1146, "train_tokens_per_second": 29248.828 }, { "epoch": 2.050737825818707, "grad_norm": 0.62890625, "learning_rate": 1.9179907771103482e-05, "loss": 0.38607547283172605, "num_input_tokens_seen": 16483574144, "step": 57960, "train_runtime": 563567.8722, "train_tokens_per_second": 29248.605 }, { "epoch": 2.0510916460824355, "grad_norm": 0.58203125, "learning_rate": 1.9178496788649106e-05, "loss": 0.384198522567749, "num_input_tokens_seen": 16486465920, "step": 57970, "train_runtime": 563664.3736, "train_tokens_per_second": 29248.728 }, { "epoch": 2.0514454663461645, "grad_norm": 0.609375, "learning_rate": 1.9177086117548462e-05, "loss": 0.38707704544067384, "num_input_tokens_seen": 16489395392, "step": 57980, "train_runtime": 563767.966, "train_tokens_per_second": 29248.55 }, { "epoch": 2.051799286609893, "grad_norm": 0.62109375, "learning_rate": 1.917567575768706e-05, "loss": 0.3893141269683838, "num_input_tokens_seen": 16492230464, "step": 57990, "train_runtime": 563864.1126, "train_tokens_per_second": 29248.59 }, { "epoch": 2.052153106873622, "grad_norm": 0.59765625, "learning_rate": 1.9174265708950457e-05, "loss": 0.3840630531311035, "num_input_tokens_seen": 16495102592, "step": 58000, "train_runtime": 563964.7001, "train_tokens_per_second": 29248.466 }, { "epoch": 2.0525069271373506, "grad_norm": 0.609375, "learning_rate": 1.91728559712243e-05, "loss": 0.38563687801361085, "num_input_tokens_seen": 16497938880, "step": 58010, "train_runtime": 564063.0289, "train_tokens_per_second": 29248.396 }, { "epoch": 2.0528607474010796, "grad_norm": 0.62109375, "learning_rate": 1.9171446544394252e-05, "loss": 0.3864439010620117, "num_input_tokens_seen": 16500778368, "step": 58020, "train_runtime": 564159.4754, "train_tokens_per_second": 29248.429 }, { "epoch": 2.0532145676648086, "grad_norm": 0.6328125, "learning_rate": 1.9170037428346075e-05, "loss": 0.38301858901977537, "num_input_tokens_seen": 16503592896, "step": 58030, "train_runtime": 564256.5826, "train_tokens_per_second": 29248.383 }, { "epoch": 2.053568387928537, "grad_norm": 0.57421875, "learning_rate": 1.9168628622965565e-05, "loss": 0.38618757724761965, "num_input_tokens_seen": 16506471616, "step": 58040, "train_runtime": 564356.886, "train_tokens_per_second": 29248.286 }, { "epoch": 2.053922208192266, "grad_norm": 0.6171875, "learning_rate": 1.916722012813858e-05, "loss": 0.38683304786682127, "num_input_tokens_seen": 16509271680, "step": 58050, "train_runtime": 564452.3644, "train_tokens_per_second": 29248.299 }, { "epoch": 2.0542760284559947, "grad_norm": 0.60546875, "learning_rate": 1.916581194375105e-05, "loss": 0.3859408855438232, "num_input_tokens_seen": 16512101888, "step": 58060, "train_runtime": 564544.5039, "train_tokens_per_second": 29248.539 }, { "epoch": 2.0546298487197237, "grad_norm": 0.5703125, "learning_rate": 1.916440406968895e-05, "loss": 0.3859276294708252, "num_input_tokens_seen": 16514964032, "step": 58070, "train_runtime": 564642.1393, "train_tokens_per_second": 29248.55 }, { "epoch": 2.054983668983452, "grad_norm": 0.59765625, "learning_rate": 1.9162996505838317e-05, "loss": 0.3842756271362305, "num_input_tokens_seen": 16517902080, "step": 58080, "train_runtime": 564744.0434, "train_tokens_per_second": 29248.475 }, { "epoch": 2.055337489247181, "grad_norm": 0.59375, "learning_rate": 1.9161589252085248e-05, "loss": 0.38589086532592776, "num_input_tokens_seen": 16520802944, "step": 58090, "train_runtime": 564845.5805, "train_tokens_per_second": 29248.353 }, { "epoch": 2.0556913095109097, "grad_norm": 0.609375, "learning_rate": 1.9160182308315897e-05, "loss": 0.3876638650894165, "num_input_tokens_seen": 16523652480, "step": 58100, "train_runtime": 564944.7787, "train_tokens_per_second": 29248.261 }, { "epoch": 2.0560451297746387, "grad_norm": 0.625, "learning_rate": 1.9158775674416478e-05, "loss": 0.38782439231872556, "num_input_tokens_seen": 16526456192, "step": 58110, "train_runtime": 565036.3657, "train_tokens_per_second": 29248.482 }, { "epoch": 2.0563989500383673, "grad_norm": 0.59375, "learning_rate": 1.9157369350273266e-05, "loss": 0.3871755838394165, "num_input_tokens_seen": 16529326656, "step": 58120, "train_runtime": 565136.1417, "train_tokens_per_second": 29248.398 }, { "epoch": 2.0567527703020962, "grad_norm": 0.6171875, "learning_rate": 1.9155963335772588e-05, "loss": 0.3844400644302368, "num_input_tokens_seen": 16532169472, "step": 58130, "train_runtime": 565231.9643, "train_tokens_per_second": 29248.469 }, { "epoch": 2.057106590565825, "grad_norm": 0.64453125, "learning_rate": 1.9154557630800835e-05, "loss": 0.3873779535293579, "num_input_tokens_seen": 16535058240, "step": 58140, "train_runtime": 565330.8887, "train_tokens_per_second": 29248.461 }, { "epoch": 2.0574604108295538, "grad_norm": 0.59765625, "learning_rate": 1.9153152235244455e-05, "loss": 0.3834215641021729, "num_input_tokens_seen": 16537861632, "step": 58150, "train_runtime": 565427.7113, "train_tokens_per_second": 29248.41 }, { "epoch": 2.0578142310932823, "grad_norm": 0.59375, "learning_rate": 1.9151747148989955e-05, "loss": 0.38964693546295165, "num_input_tokens_seen": 16540702272, "step": 58160, "train_runtime": 565525.4184, "train_tokens_per_second": 29248.38 }, { "epoch": 2.0581680513570113, "grad_norm": 0.65234375, "learning_rate": 1.915034237192389e-05, "loss": 0.3901151180267334, "num_input_tokens_seen": 16543565632, "step": 58170, "train_runtime": 565624.2022, "train_tokens_per_second": 29248.334 }, { "epoch": 2.05852187162074, "grad_norm": 0.625, "learning_rate": 1.9148937903932894e-05, "loss": 0.3880653142929077, "num_input_tokens_seen": 16546400960, "step": 58180, "train_runtime": 565720.4584, "train_tokens_per_second": 29248.369 }, { "epoch": 2.058875691884469, "grad_norm": 0.58203125, "learning_rate": 1.9147533744903633e-05, "loss": 0.38370046615600584, "num_input_tokens_seen": 16549215936, "step": 58190, "train_runtime": 565814.1428, "train_tokens_per_second": 29248.502 }, { "epoch": 2.059229512148198, "grad_norm": 0.61328125, "learning_rate": 1.9146129894722863e-05, "loss": 0.3874203681945801, "num_input_tokens_seen": 16552081728, "step": 58200, "train_runtime": 565911.0306, "train_tokens_per_second": 29248.558 }, { "epoch": 2.0595833324119264, "grad_norm": 0.63671875, "learning_rate": 1.9144726353277365e-05, "loss": 0.384489917755127, "num_input_tokens_seen": 16554895168, "step": 58210, "train_runtime": 566007.9633, "train_tokens_per_second": 29248.52 }, { "epoch": 2.0599371526756554, "grad_norm": 0.60546875, "learning_rate": 1.9143323120453997e-05, "loss": 0.38760085105895997, "num_input_tokens_seen": 16557778880, "step": 58220, "train_runtime": 566110.256, "train_tokens_per_second": 29248.329 }, { "epoch": 2.060290972939384, "grad_norm": 0.61328125, "learning_rate": 1.9141920196139683e-05, "loss": 0.3869471549987793, "num_input_tokens_seen": 16560576960, "step": 58230, "train_runtime": 566205.0338, "train_tokens_per_second": 29248.375 }, { "epoch": 2.060644793203113, "grad_norm": 0.62109375, "learning_rate": 1.914051758022138e-05, "loss": 0.38341827392578126, "num_input_tokens_seen": 16563413696, "step": 58240, "train_runtime": 566304.4096, "train_tokens_per_second": 29248.251 }, { "epoch": 2.0609986134668414, "grad_norm": 0.6015625, "learning_rate": 1.9139115272586125e-05, "loss": 0.3877772092819214, "num_input_tokens_seen": 16566302912, "step": 58250, "train_runtime": 566402.1012, "train_tokens_per_second": 29248.308 }, { "epoch": 2.0613524337305704, "grad_norm": 0.61328125, "learning_rate": 1.9137713273121004e-05, "loss": 0.3847397804260254, "num_input_tokens_seen": 16569132608, "step": 58260, "train_runtime": 566498.1859, "train_tokens_per_second": 29248.342 }, { "epoch": 2.061706253994299, "grad_norm": 0.609375, "learning_rate": 1.913631158171315e-05, "loss": 0.3809072017669678, "num_input_tokens_seen": 16571966016, "step": 58270, "train_runtime": 566595.0986, "train_tokens_per_second": 29248.34 }, { "epoch": 2.062060074258028, "grad_norm": 0.6015625, "learning_rate": 1.9134910198249782e-05, "loss": 0.39027929306030273, "num_input_tokens_seen": 16574814464, "step": 58280, "train_runtime": 566694.2139, "train_tokens_per_second": 29248.251 }, { "epoch": 2.0624138945217565, "grad_norm": 0.60546875, "learning_rate": 1.9133509122618147e-05, "loss": 0.3818178176879883, "num_input_tokens_seen": 16577656832, "step": 58290, "train_runtime": 566791.8585, "train_tokens_per_second": 29248.227 }, { "epoch": 2.0627677147854855, "grad_norm": 0.60546875, "learning_rate": 1.913210835470557e-05, "loss": 0.3854954242706299, "num_input_tokens_seen": 16580464512, "step": 58300, "train_runtime": 566888.2398, "train_tokens_per_second": 29248.207 }, { "epoch": 2.063121535049214, "grad_norm": 0.60546875, "learning_rate": 1.9130707894399428e-05, "loss": 0.38894038200378417, "num_input_tokens_seen": 16583327232, "step": 58310, "train_runtime": 566987.1213, "train_tokens_per_second": 29248.155 }, { "epoch": 2.063475355312943, "grad_norm": 0.58984375, "learning_rate": 1.9129307741587146e-05, "loss": 0.3856056690216064, "num_input_tokens_seen": 16586220096, "step": 58320, "train_runtime": 567088.732, "train_tokens_per_second": 29248.016 }, { "epoch": 2.0638291755766716, "grad_norm": 0.640625, "learning_rate": 1.9127907896156226e-05, "loss": 0.3851458549499512, "num_input_tokens_seen": 16589100800, "step": 58330, "train_runtime": 567188.6443, "train_tokens_per_second": 29247.942 }, { "epoch": 2.0641829958404005, "grad_norm": 0.61328125, "learning_rate": 1.9126508357994205e-05, "loss": 0.38668527603149416, "num_input_tokens_seen": 16591993792, "step": 58340, "train_runtime": 567289.059, "train_tokens_per_second": 29247.865 }, { "epoch": 2.064536816104129, "grad_norm": 0.6171875, "learning_rate": 1.9125109126988696e-05, "loss": 0.38441359996795654, "num_input_tokens_seen": 16594866560, "step": 58350, "train_runtime": 567387.2645, "train_tokens_per_second": 29247.866 }, { "epoch": 2.064890636367858, "grad_norm": 0.62109375, "learning_rate": 1.9123710203027365e-05, "loss": 0.38750877380371096, "num_input_tokens_seen": 16597712704, "step": 58360, "train_runtime": 567485.7848, "train_tokens_per_second": 29247.803 }, { "epoch": 2.065244456631587, "grad_norm": 0.62109375, "learning_rate": 1.9122311585997927e-05, "loss": 0.38785815238952637, "num_input_tokens_seen": 16600563392, "step": 58370, "train_runtime": 567582.9141, "train_tokens_per_second": 29247.821 }, { "epoch": 2.0655982768953156, "grad_norm": 0.609375, "learning_rate": 1.9120913275788162e-05, "loss": 0.3889042377471924, "num_input_tokens_seen": 16603433600, "step": 58380, "train_runtime": 567682.008, "train_tokens_per_second": 29247.771 }, { "epoch": 2.0659520971590446, "grad_norm": 0.60546875, "learning_rate": 1.9119515272285913e-05, "loss": 0.3869378328323364, "num_input_tokens_seen": 16606308032, "step": 58390, "train_runtime": 567782.9588, "train_tokens_per_second": 29247.634 }, { "epoch": 2.066305917422773, "grad_norm": 0.6015625, "learning_rate": 1.9118117575379065e-05, "loss": 0.3873006820678711, "num_input_tokens_seen": 16609180992, "step": 58400, "train_runtime": 567882.1006, "train_tokens_per_second": 29247.587 }, { "epoch": 2.066659737686502, "grad_norm": 0.60546875, "learning_rate": 1.9116720184955574e-05, "loss": 0.38443694114685056, "num_input_tokens_seen": 16612066880, "step": 58410, "train_runtime": 567981.0292, "train_tokens_per_second": 29247.573 }, { "epoch": 2.0670135579502307, "grad_norm": 0.63671875, "learning_rate": 1.9115323100903446e-05, "loss": 0.3899965524673462, "num_input_tokens_seen": 16614880960, "step": 58420, "train_runtime": 568078.0556, "train_tokens_per_second": 29247.532 }, { "epoch": 2.0673673782139597, "grad_norm": 0.609375, "learning_rate": 1.9113926323110748e-05, "loss": 0.3834644317626953, "num_input_tokens_seen": 16617709824, "step": 58430, "train_runtime": 568173.0232, "train_tokens_per_second": 29247.622 }, { "epoch": 2.067721198477688, "grad_norm": 0.65625, "learning_rate": 1.9112529851465603e-05, "loss": 0.385329008102417, "num_input_tokens_seen": 16620580800, "step": 58440, "train_runtime": 568269.4465, "train_tokens_per_second": 29247.711 }, { "epoch": 2.068075018741417, "grad_norm": 0.61328125, "learning_rate": 1.911113368585619e-05, "loss": 0.3836948394775391, "num_input_tokens_seen": 16623380800, "step": 58450, "train_runtime": 568364.135, "train_tokens_per_second": 29247.765 }, { "epoch": 2.0684288390051457, "grad_norm": 0.60546875, "learning_rate": 1.910973782617074e-05, "loss": 0.38384337425231935, "num_input_tokens_seen": 16626224128, "step": 58460, "train_runtime": 568463.8353, "train_tokens_per_second": 29247.637 }, { "epoch": 2.0687826592688747, "grad_norm": 0.6015625, "learning_rate": 1.9108342272297558e-05, "loss": 0.38511841297149657, "num_input_tokens_seen": 16629075392, "step": 58470, "train_runtime": 568561.4303, "train_tokens_per_second": 29247.632 }, { "epoch": 2.0691364795326033, "grad_norm": 0.62109375, "learning_rate": 1.910694702412499e-05, "loss": 0.38358519077301023, "num_input_tokens_seen": 16631960256, "step": 58480, "train_runtime": 568660.2095, "train_tokens_per_second": 29247.624 }, { "epoch": 2.0694902997963323, "grad_norm": 0.6171875, "learning_rate": 1.9105552081541444e-05, "loss": 0.38654475212097167, "num_input_tokens_seen": 16634859328, "step": 58490, "train_runtime": 568760.3801, "train_tokens_per_second": 29247.571 }, { "epoch": 2.069844120060061, "grad_norm": 0.61328125, "learning_rate": 1.910415744443539e-05, "loss": 0.3828063249588013, "num_input_tokens_seen": 16637724160, "step": 58500, "train_runtime": 568857.6059, "train_tokens_per_second": 29247.608 }, { "epoch": 2.07019794032379, "grad_norm": 0.609375, "learning_rate": 1.9102763112695343e-05, "loss": 0.383486270904541, "num_input_tokens_seen": 16640587520, "step": 58510, "train_runtime": 568958.2697, "train_tokens_per_second": 29247.466 }, { "epoch": 2.0705517605875183, "grad_norm": 0.6171875, "learning_rate": 1.910136908620989e-05, "loss": 0.3876341342926025, "num_input_tokens_seen": 16643402432, "step": 58520, "train_runtime": 569053.6295, "train_tokens_per_second": 29247.511 }, { "epoch": 2.0709055808512473, "grad_norm": 0.58984375, "learning_rate": 1.9099975364867663e-05, "loss": 0.3868858814239502, "num_input_tokens_seen": 16646235200, "step": 58530, "train_runtime": 569152.5102, "train_tokens_per_second": 29247.407 }, { "epoch": 2.0712594011149763, "grad_norm": 0.61328125, "learning_rate": 1.9098581948557356e-05, "loss": 0.38619887828826904, "num_input_tokens_seen": 16649072384, "step": 58540, "train_runtime": 569249.3385, "train_tokens_per_second": 29247.416 }, { "epoch": 2.071613221378705, "grad_norm": 0.59765625, "learning_rate": 1.909718883716772e-05, "loss": 0.38712923526763915, "num_input_tokens_seen": 16651890624, "step": 58550, "train_runtime": 569347.113, "train_tokens_per_second": 29247.344 }, { "epoch": 2.071967041642434, "grad_norm": 0.61328125, "learning_rate": 1.9095796030587556e-05, "loss": 0.3854062557220459, "num_input_tokens_seen": 16654746560, "step": 58560, "train_runtime": 569446.2075, "train_tokens_per_second": 29247.269 }, { "epoch": 2.0723208619061624, "grad_norm": 0.625, "learning_rate": 1.9094403528705734e-05, "loss": 0.39183869361877444, "num_input_tokens_seen": 16657629760, "step": 58570, "train_runtime": 569548.039, "train_tokens_per_second": 29247.102 }, { "epoch": 2.0726746821698914, "grad_norm": 0.6484375, "learning_rate": 1.9093011331411173e-05, "loss": 0.3855603694915771, "num_input_tokens_seen": 16660483520, "step": 58580, "train_runtime": 569645.0262, "train_tokens_per_second": 29247.132 }, { "epoch": 2.07302850243362, "grad_norm": 0.609375, "learning_rate": 1.9091619438592854e-05, "loss": 0.38959057331085206, "num_input_tokens_seen": 16663353984, "step": 58590, "train_runtime": 569743.7706, "train_tokens_per_second": 29247.102 }, { "epoch": 2.073382322697349, "grad_norm": 0.59765625, "learning_rate": 1.90902278501398e-05, "loss": 0.38801748752593995, "num_input_tokens_seen": 16666182080, "step": 58600, "train_runtime": 569837.3714, "train_tokens_per_second": 29247.261 }, { "epoch": 2.0737361429610774, "grad_norm": 0.6015625, "learning_rate": 1.908883656594111e-05, "loss": 0.38353424072265624, "num_input_tokens_seen": 16669053312, "step": 58610, "train_runtime": 569935.9164, "train_tokens_per_second": 29247.241 }, { "epoch": 2.0740899632248064, "grad_norm": 0.6171875, "learning_rate": 1.9087445585885926e-05, "loss": 0.3850236892700195, "num_input_tokens_seen": 16671956672, "step": 58620, "train_runtime": 570038.1109, "train_tokens_per_second": 29247.091 }, { "epoch": 2.074443783488535, "grad_norm": 0.625, "learning_rate": 1.9086054909863457e-05, "loss": 0.3869431972503662, "num_input_tokens_seen": 16674774464, "step": 58630, "train_runtime": 570133.7539, "train_tokens_per_second": 29247.127 }, { "epoch": 2.074797603752264, "grad_norm": 0.62890625, "learning_rate": 1.9084664537762958e-05, "loss": 0.382286810874939, "num_input_tokens_seen": 16677654784, "step": 58640, "train_runtime": 570233.7303, "train_tokens_per_second": 29247.051 }, { "epoch": 2.0751514240159925, "grad_norm": 0.6171875, "learning_rate": 1.9083274469473747e-05, "loss": 0.3872214794158936, "num_input_tokens_seen": 16680489984, "step": 58650, "train_runtime": 570332.0646, "train_tokens_per_second": 29246.979 }, { "epoch": 2.0755052442797215, "grad_norm": 0.62109375, "learning_rate": 1.9081884704885193e-05, "loss": 0.3864173889160156, "num_input_tokens_seen": 16683313088, "step": 58660, "train_runtime": 570428.5675, "train_tokens_per_second": 29246.98 }, { "epoch": 2.07585906454345, "grad_norm": 0.625, "learning_rate": 1.9080495243886733e-05, "loss": 0.3849653720855713, "num_input_tokens_seen": 16686174720, "step": 58670, "train_runtime": 570528.1999, "train_tokens_per_second": 29246.889 }, { "epoch": 2.076212884807179, "grad_norm": 0.6015625, "learning_rate": 1.9079106086367845e-05, "loss": 0.38805761337280276, "num_input_tokens_seen": 16689068864, "step": 58680, "train_runtime": 570628.8018, "train_tokens_per_second": 29246.804 }, { "epoch": 2.076566705070908, "grad_norm": 0.61328125, "learning_rate": 1.9077717232218072e-05, "loss": 0.3826923847198486, "num_input_tokens_seen": 16691909440, "step": 58690, "train_runtime": 570726.7727, "train_tokens_per_second": 29246.761 }, { "epoch": 2.0769205253346366, "grad_norm": 0.60546875, "learning_rate": 1.9076328681327017e-05, "loss": 0.38638982772827146, "num_input_tokens_seen": 16694771648, "step": 58700, "train_runtime": 570824.6266, "train_tokens_per_second": 29246.761 }, { "epoch": 2.0772743455983655, "grad_norm": 0.61328125, "learning_rate": 1.907494043358433e-05, "loss": 0.3822152137756348, "num_input_tokens_seen": 16697627008, "step": 58710, "train_runtime": 570922.0915, "train_tokens_per_second": 29246.77 }, { "epoch": 2.077628165862094, "grad_norm": 0.59765625, "learning_rate": 1.9073552488879724e-05, "loss": 0.38420515060424804, "num_input_tokens_seen": 16700488768, "step": 58720, "train_runtime": 571020.7905, "train_tokens_per_second": 29246.726 }, { "epoch": 2.077981986125823, "grad_norm": 0.609375, "learning_rate": 1.907216484710296e-05, "loss": 0.3886378288269043, "num_input_tokens_seen": 16703329920, "step": 58730, "train_runtime": 571115.4013, "train_tokens_per_second": 29246.856 }, { "epoch": 2.0783358063895516, "grad_norm": 0.60546875, "learning_rate": 1.9070777508143868e-05, "loss": 0.3881584882736206, "num_input_tokens_seen": 16706194816, "step": 58740, "train_runtime": 571215.5316, "train_tokens_per_second": 29246.745 }, { "epoch": 2.0786896266532806, "grad_norm": 0.61328125, "learning_rate": 1.9069390471892324e-05, "loss": 0.38559885025024415, "num_input_tokens_seen": 16708993728, "step": 58750, "train_runtime": 571309.2894, "train_tokens_per_second": 29246.844 }, { "epoch": 2.079043446917009, "grad_norm": 0.609375, "learning_rate": 1.9068003738238263e-05, "loss": 0.3888734817504883, "num_input_tokens_seen": 16711879168, "step": 58760, "train_runtime": 571407.3433, "train_tokens_per_second": 29246.875 }, { "epoch": 2.079397267180738, "grad_norm": 0.6171875, "learning_rate": 1.9066617307071674e-05, "loss": 0.3883217811584473, "num_input_tokens_seen": 16714695232, "step": 58770, "train_runtime": 571506.2569, "train_tokens_per_second": 29246.741 }, { "epoch": 2.0797510874444667, "grad_norm": 0.60546875, "learning_rate": 1.9065231178282607e-05, "loss": 0.3875225782394409, "num_input_tokens_seen": 16717574208, "step": 58780, "train_runtime": 571603.4339, "train_tokens_per_second": 29246.805 }, { "epoch": 2.0801049077081957, "grad_norm": 0.625, "learning_rate": 1.906384535176116e-05, "loss": 0.387648344039917, "num_input_tokens_seen": 16720437760, "step": 58790, "train_runtime": 571702.9974, "train_tokens_per_second": 29246.72 }, { "epoch": 2.080458727971924, "grad_norm": 0.640625, "learning_rate": 1.90624598273975e-05, "loss": 0.3830115795135498, "num_input_tokens_seen": 16723306368, "step": 58800, "train_runtime": 571802.8289, "train_tokens_per_second": 29246.631 }, { "epoch": 2.080812548235653, "grad_norm": 0.59765625, "learning_rate": 1.9061074605081837e-05, "loss": 0.3860777378082275, "num_input_tokens_seen": 16726129088, "step": 58810, "train_runtime": 571898.008, "train_tokens_per_second": 29246.699 }, { "epoch": 2.0811663684993817, "grad_norm": 0.609375, "learning_rate": 1.905968968470444e-05, "loss": 0.38523015975952146, "num_input_tokens_seen": 16728959232, "step": 58820, "train_runtime": 571993.0954, "train_tokens_per_second": 29246.785 }, { "epoch": 2.0815201887631107, "grad_norm": 0.6328125, "learning_rate": 1.9058305066155632e-05, "loss": 0.38867983818054197, "num_input_tokens_seen": 16731800960, "step": 58830, "train_runtime": 572091.0111, "train_tokens_per_second": 29246.747 }, { "epoch": 2.0818740090268393, "grad_norm": 0.61328125, "learning_rate": 1.9056920749325805e-05, "loss": 0.38263487815856934, "num_input_tokens_seen": 16734670592, "step": 58840, "train_runtime": 572189.971, "train_tokens_per_second": 29246.704 }, { "epoch": 2.0822278292905683, "grad_norm": 0.58984375, "learning_rate": 1.905553673410539e-05, "loss": 0.38182716369628905, "num_input_tokens_seen": 16737600256, "step": 58850, "train_runtime": 572292.3695, "train_tokens_per_second": 29246.59 }, { "epoch": 2.082581649554297, "grad_norm": 0.61328125, "learning_rate": 1.905415302038488e-05, "loss": 0.3883997440338135, "num_input_tokens_seen": 16740470080, "step": 58860, "train_runtime": 572392.6356, "train_tokens_per_second": 29246.481 }, { "epoch": 2.082935469818026, "grad_norm": 0.60546875, "learning_rate": 1.905276960805483e-05, "loss": 0.3892531871795654, "num_input_tokens_seen": 16743316864, "step": 58870, "train_runtime": 572490.0627, "train_tokens_per_second": 29246.476 }, { "epoch": 2.083289290081755, "grad_norm": 0.63671875, "learning_rate": 1.9051386497005842e-05, "loss": 0.3850471019744873, "num_input_tokens_seen": 16746192640, "step": 58880, "train_runtime": 572589.2054, "train_tokens_per_second": 29246.434 }, { "epoch": 2.0836431103454833, "grad_norm": 0.609375, "learning_rate": 1.9050003687128574e-05, "loss": 0.38381457328796387, "num_input_tokens_seen": 16749062784, "step": 58890, "train_runtime": 572688.7732, "train_tokens_per_second": 29246.361 }, { "epoch": 2.0839969306092123, "grad_norm": 0.62109375, "learning_rate": 1.9048621178313737e-05, "loss": 0.38531529903411865, "num_input_tokens_seen": 16751884544, "step": 58900, "train_runtime": 572787.0305, "train_tokens_per_second": 29246.271 }, { "epoch": 2.084350750872941, "grad_norm": 0.625, "learning_rate": 1.9047238970452116e-05, "loss": 0.38550586700439454, "num_input_tokens_seen": 16754719872, "step": 58910, "train_runtime": 572884.2049, "train_tokens_per_second": 29246.259 }, { "epoch": 2.08470457113667, "grad_norm": 0.61328125, "learning_rate": 1.904585706343453e-05, "loss": 0.3814000368118286, "num_input_tokens_seen": 16757534656, "step": 58920, "train_runtime": 572980.3912, "train_tokens_per_second": 29246.262 }, { "epoch": 2.0850583914003984, "grad_norm": 0.58203125, "learning_rate": 1.904447545715186e-05, "loss": 0.38686399459838866, "num_input_tokens_seen": 16760392192, "step": 58930, "train_runtime": 573078.6153, "train_tokens_per_second": 29246.236 }, { "epoch": 2.0854122116641274, "grad_norm": 0.6171875, "learning_rate": 1.9043094151495045e-05, "loss": 0.3836365699768066, "num_input_tokens_seen": 16763251072, "step": 58940, "train_runtime": 573174.1386, "train_tokens_per_second": 29246.349 }, { "epoch": 2.085766031927856, "grad_norm": 0.64453125, "learning_rate": 1.904171314635508e-05, "loss": 0.38606197834014894, "num_input_tokens_seen": 16766037888, "step": 58950, "train_runtime": 573267.363, "train_tokens_per_second": 29246.455 }, { "epoch": 2.086119852191585, "grad_norm": 0.6171875, "learning_rate": 1.904033244162301e-05, "loss": 0.38819375038146975, "num_input_tokens_seen": 16768900480, "step": 58960, "train_runtime": 573365.602, "train_tokens_per_second": 29246.436 }, { "epoch": 2.0864736724553135, "grad_norm": 0.6171875, "learning_rate": 1.903895203718994e-05, "loss": 0.38612895011901854, "num_input_tokens_seen": 16771760064, "step": 58970, "train_runtime": 573461.1319, "train_tokens_per_second": 29246.551 }, { "epoch": 2.0868274927190424, "grad_norm": 0.6171875, "learning_rate": 1.903757193294703e-05, "loss": 0.3860905647277832, "num_input_tokens_seen": 16774568384, "step": 58980, "train_runtime": 573555.2946, "train_tokens_per_second": 29246.646 }, { "epoch": 2.087181312982771, "grad_norm": 0.58984375, "learning_rate": 1.9036192128785495e-05, "loss": 0.3890978336334229, "num_input_tokens_seen": 16777428352, "step": 58990, "train_runtime": 573656.3501, "train_tokens_per_second": 29246.479 }, { "epoch": 2.0875351332465, "grad_norm": 0.62109375, "learning_rate": 1.9034812624596605e-05, "loss": 0.38856046199798583, "num_input_tokens_seen": 16780237632, "step": 59000, "train_runtime": 573751.5704, "train_tokens_per_second": 29246.521 }, { "epoch": 2.0878889535102285, "grad_norm": 0.61328125, "learning_rate": 1.903343342027168e-05, "loss": 0.3844883441925049, "num_input_tokens_seen": 16783086208, "step": 59010, "train_runtime": 573848.4889, "train_tokens_per_second": 29246.546 }, { "epoch": 2.0882427737739575, "grad_norm": 0.6328125, "learning_rate": 1.9032054515702103e-05, "loss": 0.3868630170822144, "num_input_tokens_seen": 16785940544, "step": 59020, "train_runtime": 573946.2901, "train_tokens_per_second": 29246.535 }, { "epoch": 2.0885965940376865, "grad_norm": 0.640625, "learning_rate": 1.9030675910779307e-05, "loss": 0.3906904935836792, "num_input_tokens_seen": 16788787776, "step": 59030, "train_runtime": 574046.0853, "train_tokens_per_second": 29246.411 }, { "epoch": 2.088950414301415, "grad_norm": 0.625, "learning_rate": 1.9029297605394782e-05, "loss": 0.3896930456161499, "num_input_tokens_seen": 16791682304, "step": 59040, "train_runtime": 574147.1514, "train_tokens_per_second": 29246.304 }, { "epoch": 2.089304234565144, "grad_norm": 0.625, "learning_rate": 1.9027919599440077e-05, "loss": 0.3879457712173462, "num_input_tokens_seen": 16794538944, "step": 59050, "train_runtime": 574246.5517, "train_tokens_per_second": 29246.216 }, { "epoch": 2.0896580548288726, "grad_norm": 0.59765625, "learning_rate": 1.9026541892806784e-05, "loss": 0.3865446805953979, "num_input_tokens_seen": 16797344256, "step": 59060, "train_runtime": 574340.3598, "train_tokens_per_second": 29246.324 }, { "epoch": 2.0900118750926016, "grad_norm": 0.59375, "learning_rate": 1.9025164485386562e-05, "loss": 0.3882107734680176, "num_input_tokens_seen": 16800192256, "step": 59070, "train_runtime": 574436.381, "train_tokens_per_second": 29246.393 }, { "epoch": 2.09036569535633, "grad_norm": 0.62109375, "learning_rate": 1.9023787377071123e-05, "loss": 0.37806999683380127, "num_input_tokens_seen": 16803091072, "step": 59080, "train_runtime": 574536.6708, "train_tokens_per_second": 29246.333 }, { "epoch": 2.090719515620059, "grad_norm": 0.61328125, "learning_rate": 1.902241056775223e-05, "loss": 0.3875662088394165, "num_input_tokens_seen": 16805860032, "step": 59090, "train_runtime": 574631.5893, "train_tokens_per_second": 29246.321 }, { "epoch": 2.0910733358837876, "grad_norm": 0.59765625, "learning_rate": 1.9021034057321694e-05, "loss": 0.3790420055389404, "num_input_tokens_seen": 16808715520, "step": 59100, "train_runtime": 574728.4199, "train_tokens_per_second": 29246.362 }, { "epoch": 2.0914271561475166, "grad_norm": 0.609375, "learning_rate": 1.90196578456714e-05, "loss": 0.38483433723449706, "num_input_tokens_seen": 16811623104, "step": 59110, "train_runtime": 574828.546, "train_tokens_per_second": 29246.326 }, { "epoch": 2.091780976411245, "grad_norm": 0.6328125, "learning_rate": 1.9018281932693273e-05, "loss": 0.38743863105773924, "num_input_tokens_seen": 16814509888, "step": 59120, "train_runtime": 574927.043, "train_tokens_per_second": 29246.337 }, { "epoch": 2.092134796674974, "grad_norm": 0.625, "learning_rate": 1.9016906318279295e-05, "loss": 0.3846376895904541, "num_input_tokens_seen": 16817333248, "step": 59130, "train_runtime": 575023.0021, "train_tokens_per_second": 29246.366 }, { "epoch": 2.0924886169387027, "grad_norm": 0.609375, "learning_rate": 1.9015531002321503e-05, "loss": 0.3846463203430176, "num_input_tokens_seen": 16820180224, "step": 59140, "train_runtime": 575121.3335, "train_tokens_per_second": 29246.316 }, { "epoch": 2.0928424372024317, "grad_norm": 0.60546875, "learning_rate": 1.9014155984711995e-05, "loss": 0.38582520484924315, "num_input_tokens_seen": 16823024000, "step": 59150, "train_runtime": 575220.0346, "train_tokens_per_second": 29246.241 }, { "epoch": 2.0931962574661602, "grad_norm": 0.625, "learning_rate": 1.9012781265342913e-05, "loss": 0.3891855955123901, "num_input_tokens_seen": 16825902592, "step": 59160, "train_runtime": 575320.6714, "train_tokens_per_second": 29246.129 }, { "epoch": 2.093550077729889, "grad_norm": 0.58203125, "learning_rate": 1.9011406844106467e-05, "loss": 0.3889988899230957, "num_input_tokens_seen": 16828736576, "step": 59170, "train_runtime": 575417.0578, "train_tokens_per_second": 29246.155 }, { "epoch": 2.0939038979936178, "grad_norm": 0.59765625, "learning_rate": 1.90100327208949e-05, "loss": 0.3889432907104492, "num_input_tokens_seen": 16831600000, "step": 59180, "train_runtime": 575515.0192, "train_tokens_per_second": 29246.152 }, { "epoch": 2.0942577182573467, "grad_norm": 0.6171875, "learning_rate": 1.9008658895600537e-05, "loss": 0.3837843418121338, "num_input_tokens_seen": 16834408512, "step": 59190, "train_runtime": 575608.6488, "train_tokens_per_second": 29246.274 }, { "epoch": 2.0946115385210757, "grad_norm": 0.6328125, "learning_rate": 1.9007285368115737e-05, "loss": 0.38916356563568116, "num_input_tokens_seen": 16837252480, "step": 59200, "train_runtime": 575706.2749, "train_tokens_per_second": 29246.255 }, { "epoch": 2.0949653587848043, "grad_norm": 0.609375, "learning_rate": 1.9005912138332918e-05, "loss": 0.3871171474456787, "num_input_tokens_seen": 16840087232, "step": 59210, "train_runtime": 575804.9652, "train_tokens_per_second": 29246.165 }, { "epoch": 2.0953191790485333, "grad_norm": 0.609375, "learning_rate": 1.9004539206144557e-05, "loss": 0.3865817546844482, "num_input_tokens_seen": 16842959360, "step": 59220, "train_runtime": 575906.016, "train_tokens_per_second": 29246.021 }, { "epoch": 2.095672999312262, "grad_norm": 0.6015625, "learning_rate": 1.9003166571443183e-05, "loss": 0.39054596424102783, "num_input_tokens_seen": 16845817536, "step": 59230, "train_runtime": 576007.0958, "train_tokens_per_second": 29245.851 }, { "epoch": 2.096026819575991, "grad_norm": 0.61328125, "learning_rate": 1.900179423412138e-05, "loss": 0.3876781463623047, "num_input_tokens_seen": 16848680640, "step": 59240, "train_runtime": 576106.5664, "train_tokens_per_second": 29245.771 }, { "epoch": 2.0963806398397193, "grad_norm": 0.61328125, "learning_rate": 1.900042219407178e-05, "loss": 0.3834547758102417, "num_input_tokens_seen": 16851506560, "step": 59250, "train_runtime": 576201.7135, "train_tokens_per_second": 29245.846 }, { "epoch": 2.0967344601034483, "grad_norm": 0.609375, "learning_rate": 1.8999050451187084e-05, "loss": 0.3865455150604248, "num_input_tokens_seen": 16854356672, "step": 59260, "train_runtime": 576298.8162, "train_tokens_per_second": 29245.864 }, { "epoch": 2.097088280367177, "grad_norm": 0.59765625, "learning_rate": 1.8997679005360026e-05, "loss": 0.38815932273864745, "num_input_tokens_seen": 16857248256, "step": 59270, "train_runtime": 576400.4358, "train_tokens_per_second": 29245.724 }, { "epoch": 2.097442100630906, "grad_norm": 0.609375, "learning_rate": 1.8996307856483418e-05, "loss": 0.3849550724029541, "num_input_tokens_seen": 16860063168, "step": 59280, "train_runtime": 576495.2226, "train_tokens_per_second": 29245.799 }, { "epoch": 2.0977959208946344, "grad_norm": 0.59375, "learning_rate": 1.8994937004450106e-05, "loss": 0.389237642288208, "num_input_tokens_seen": 16862879744, "step": 59290, "train_runtime": 576590.4013, "train_tokens_per_second": 29245.856 }, { "epoch": 2.0981497411583634, "grad_norm": 0.6328125, "learning_rate": 1.8993566449153e-05, "loss": 0.38845076560974123, "num_input_tokens_seen": 16865706624, "step": 59300, "train_runtime": 576684.6441, "train_tokens_per_second": 29245.978 }, { "epoch": 2.098503561422092, "grad_norm": 0.6484375, "learning_rate": 1.8992196190485065e-05, "loss": 0.3912659645080566, "num_input_tokens_seen": 16868554560, "step": 59310, "train_runtime": 576783.3222, "train_tokens_per_second": 29245.912 }, { "epoch": 2.098857381685821, "grad_norm": 0.609375, "learning_rate": 1.8990826228339316e-05, "loss": 0.3865690231323242, "num_input_tokens_seen": 16871385536, "step": 59320, "train_runtime": 576877.9691, "train_tokens_per_second": 29246.022 }, { "epoch": 2.0992112019495495, "grad_norm": 0.59375, "learning_rate": 1.898945656260882e-05, "loss": 0.38594870567321776, "num_input_tokens_seen": 16874222016, "step": 59330, "train_runtime": 576975.5969, "train_tokens_per_second": 29245.989 }, { "epoch": 2.0995650222132785, "grad_norm": 0.6171875, "learning_rate": 1.89880871931867e-05, "loss": 0.38623223304748533, "num_input_tokens_seen": 16877072512, "step": 59340, "train_runtime": 577076.1244, "train_tokens_per_second": 29245.834 }, { "epoch": 2.099918842477007, "grad_norm": 0.61328125, "learning_rate": 1.8986718119966142e-05, "loss": 0.38059368133544924, "num_input_tokens_seen": 16879917504, "step": 59350, "train_runtime": 577174.0837, "train_tokens_per_second": 29245.799 }, { "epoch": 2.100272662740736, "grad_norm": 0.62109375, "learning_rate": 1.898534934284038e-05, "loss": 0.3889148235321045, "num_input_tokens_seen": 16882767488, "step": 59360, "train_runtime": 577272.8232, "train_tokens_per_second": 29245.734 }, { "epoch": 2.100626483004465, "grad_norm": 0.6328125, "learning_rate": 1.8983980861702692e-05, "loss": 0.38382296562194823, "num_input_tokens_seen": 16885574272, "step": 59370, "train_runtime": 577366.0794, "train_tokens_per_second": 29245.872 }, { "epoch": 2.1009803032681935, "grad_norm": 0.6171875, "learning_rate": 1.8982612676446417e-05, "loss": 0.3874004364013672, "num_input_tokens_seen": 16888400384, "step": 59380, "train_runtime": 577459.3854, "train_tokens_per_second": 29246.04 }, { "epoch": 2.1013341235319225, "grad_norm": 0.609375, "learning_rate": 1.898124478696496e-05, "loss": 0.3878662586212158, "num_input_tokens_seen": 16891245568, "step": 59390, "train_runtime": 577557.2865, "train_tokens_per_second": 29246.009 }, { "epoch": 2.101687943795651, "grad_norm": 0.60546875, "learning_rate": 1.897987719315175e-05, "loss": 0.3853639602661133, "num_input_tokens_seen": 16894094848, "step": 59400, "train_runtime": 577654.9739, "train_tokens_per_second": 29245.996 }, { "epoch": 2.10204176405938, "grad_norm": 0.625, "learning_rate": 1.8978509894900306e-05, "loss": 0.38562397956848143, "num_input_tokens_seen": 16896904000, "step": 59410, "train_runtime": 577750.8945, "train_tokens_per_second": 29246.002 }, { "epoch": 2.1023955843231086, "grad_norm": 0.62109375, "learning_rate": 1.8977142892104177e-05, "loss": 0.383879566192627, "num_input_tokens_seen": 16899750528, "step": 59420, "train_runtime": 577848.2879, "train_tokens_per_second": 29245.999 }, { "epoch": 2.1027494045868376, "grad_norm": 0.63671875, "learning_rate": 1.897577618465697e-05, "loss": 0.38712153434753416, "num_input_tokens_seen": 16902604160, "step": 59430, "train_runtime": 577947.9629, "train_tokens_per_second": 29245.893 }, { "epoch": 2.103103224850566, "grad_norm": 0.6640625, "learning_rate": 1.8974409772452347e-05, "loss": 0.3875401496887207, "num_input_tokens_seen": 16905459840, "step": 59440, "train_runtime": 578043.1975, "train_tokens_per_second": 29246.015 }, { "epoch": 2.103457045114295, "grad_norm": 0.6015625, "learning_rate": 1.8973043655384025e-05, "loss": 0.3876309394836426, "num_input_tokens_seen": 16908293312, "step": 59450, "train_runtime": 578138.379, "train_tokens_per_second": 29246.101 }, { "epoch": 2.1038108653780236, "grad_norm": 0.609375, "learning_rate": 1.8971677833345776e-05, "loss": 0.38457136154174804, "num_input_tokens_seen": 16911197632, "step": 59460, "train_runtime": 578236.4712, "train_tokens_per_second": 29246.162 }, { "epoch": 2.1041646856417526, "grad_norm": 0.625, "learning_rate": 1.8970312306231413e-05, "loss": 0.39127962589263915, "num_input_tokens_seen": 16914028416, "step": 59470, "train_runtime": 578333.3764, "train_tokens_per_second": 29246.156 }, { "epoch": 2.104518505905481, "grad_norm": 0.6484375, "learning_rate": 1.896894707393483e-05, "loss": 0.38178465366363523, "num_input_tokens_seen": 16916836288, "step": 59480, "train_runtime": 578430.9873, "train_tokens_per_second": 29246.075 }, { "epoch": 2.10487232616921, "grad_norm": 0.6171875, "learning_rate": 1.8967582136349938e-05, "loss": 0.3837705135345459, "num_input_tokens_seen": 16919666560, "step": 59490, "train_runtime": 578527.97, "train_tokens_per_second": 29246.065 }, { "epoch": 2.1052261464329387, "grad_norm": 0.63671875, "learning_rate": 1.8966217493370726e-05, "loss": 0.3887350082397461, "num_input_tokens_seen": 16922553664, "step": 59500, "train_runtime": 578626.8082, "train_tokens_per_second": 29246.059 }, { "epoch": 2.1055799666966677, "grad_norm": 0.6171875, "learning_rate": 1.896485314489124e-05, "loss": 0.37958450317382814, "num_input_tokens_seen": 16925391424, "step": 59510, "train_runtime": 578723.8851, "train_tokens_per_second": 29246.056 }, { "epoch": 2.1059337869603967, "grad_norm": 0.6171875, "learning_rate": 1.8963489090805563e-05, "loss": 0.3833619594573975, "num_input_tokens_seen": 16928190656, "step": 59520, "train_runtime": 578817.5683, "train_tokens_per_second": 29246.159 }, { "epoch": 2.1062876072241252, "grad_norm": 0.60546875, "learning_rate": 1.896212533100784e-05, "loss": 0.3876672267913818, "num_input_tokens_seen": 16931077696, "step": 59530, "train_runtime": 578915.4669, "train_tokens_per_second": 29246.2 }, { "epoch": 2.106641427487854, "grad_norm": 0.63671875, "learning_rate": 1.8960761865392257e-05, "loss": 0.3884193181991577, "num_input_tokens_seen": 16933905408, "step": 59540, "train_runtime": 579011.2292, "train_tokens_per_second": 29246.247 }, { "epoch": 2.1069952477515828, "grad_norm": 0.62109375, "learning_rate": 1.895939869385308e-05, "loss": 0.38404288291931155, "num_input_tokens_seen": 16936739008, "step": 59550, "train_runtime": 579108.4406, "train_tokens_per_second": 29246.231 }, { "epoch": 2.1073490680153117, "grad_norm": 0.63671875, "learning_rate": 1.8958035816284607e-05, "loss": 0.38599746227264403, "num_input_tokens_seen": 16939603072, "step": 59560, "train_runtime": 579205.0048, "train_tokens_per_second": 29246.3 }, { "epoch": 2.1077028882790403, "grad_norm": 0.609375, "learning_rate": 1.8956673232581184e-05, "loss": 0.3837181568145752, "num_input_tokens_seen": 16942526144, "step": 59570, "train_runtime": 579307.0688, "train_tokens_per_second": 29246.193 }, { "epoch": 2.1080567085427693, "grad_norm": 0.60546875, "learning_rate": 1.8955310942637233e-05, "loss": 0.3881374835968018, "num_input_tokens_seen": 16945340224, "step": 59580, "train_runtime": 579401.9956, "train_tokens_per_second": 29246.258 }, { "epoch": 2.108410528806498, "grad_norm": 0.60546875, "learning_rate": 1.8953948946347214e-05, "loss": 0.38920345306396487, "num_input_tokens_seen": 16948140032, "step": 59590, "train_runtime": 579496.0061, "train_tokens_per_second": 29246.345 }, { "epoch": 2.108764349070227, "grad_norm": 0.60546875, "learning_rate": 1.895258724360564e-05, "loss": 0.38628239631652833, "num_input_tokens_seen": 16950946176, "step": 59600, "train_runtime": 579589.8385, "train_tokens_per_second": 29246.452 }, { "epoch": 2.1091181693339554, "grad_norm": 0.625, "learning_rate": 1.8951225834307078e-05, "loss": 0.38569657802581786, "num_input_tokens_seen": 16953736832, "step": 59610, "train_runtime": 579682.637, "train_tokens_per_second": 29246.584 }, { "epoch": 2.1094719895976843, "grad_norm": 0.609375, "learning_rate": 1.8949864718346153e-05, "loss": 0.38288078308105467, "num_input_tokens_seen": 16956575488, "step": 59620, "train_runtime": 579776.5867, "train_tokens_per_second": 29246.741 }, { "epoch": 2.109825809861413, "grad_norm": 0.62109375, "learning_rate": 1.894850389561754e-05, "loss": 0.38653500080108644, "num_input_tokens_seen": 16959433536, "step": 59630, "train_runtime": 579873.3226, "train_tokens_per_second": 29246.79 }, { "epoch": 2.110179630125142, "grad_norm": 0.625, "learning_rate": 1.8947143366015962e-05, "loss": 0.3877106189727783, "num_input_tokens_seen": 16962239424, "step": 59640, "train_runtime": 579969.6623, "train_tokens_per_second": 29246.77 }, { "epoch": 2.1105334503888704, "grad_norm": 0.62109375, "learning_rate": 1.89457831294362e-05, "loss": 0.3871367692947388, "num_input_tokens_seen": 16965117632, "step": 59650, "train_runtime": 580069.7194, "train_tokens_per_second": 29246.687 }, { "epoch": 2.1108872706525994, "grad_norm": 0.640625, "learning_rate": 1.8944423185773093e-05, "loss": 0.3859116554260254, "num_input_tokens_seen": 16967958464, "step": 59660, "train_runtime": 580165.4415, "train_tokens_per_second": 29246.758 }, { "epoch": 2.111241090916328, "grad_norm": 0.6015625, "learning_rate": 1.894306353492153e-05, "loss": 0.3868103504180908, "num_input_tokens_seen": 16970785600, "step": 59670, "train_runtime": 580263.4264, "train_tokens_per_second": 29246.692 }, { "epoch": 2.111594911180057, "grad_norm": 0.625, "learning_rate": 1.8941704176776433e-05, "loss": 0.38725378513336184, "num_input_tokens_seen": 16973653568, "step": 59680, "train_runtime": 580362.9294, "train_tokens_per_second": 29246.619 }, { "epoch": 2.1119487314437855, "grad_norm": 0.59375, "learning_rate": 1.8940345111232806e-05, "loss": 0.38458704948425293, "num_input_tokens_seen": 16976514752, "step": 59690, "train_runtime": 580459.6854, "train_tokens_per_second": 29246.673 }, { "epoch": 2.1123025517075145, "grad_norm": 0.6171875, "learning_rate": 1.8938986338185695e-05, "loss": 0.3891266107559204, "num_input_tokens_seen": 16979358528, "step": 59700, "train_runtime": 580559.4214, "train_tokens_per_second": 29246.547 }, { "epoch": 2.1126563719712435, "grad_norm": 0.62890625, "learning_rate": 1.8937627857530196e-05, "loss": 0.38526318073272703, "num_input_tokens_seen": 16982169344, "step": 59710, "train_runtime": 580656.0782, "train_tokens_per_second": 29246.52 }, { "epoch": 2.113010192234972, "grad_norm": 0.6015625, "learning_rate": 1.8936269669161455e-05, "loss": 0.38611767292022703, "num_input_tokens_seen": 16985047168, "step": 59720, "train_runtime": 580755.023, "train_tokens_per_second": 29246.492 }, { "epoch": 2.113364012498701, "grad_norm": 0.625, "learning_rate": 1.8934911772974672e-05, "loss": 0.38472647666931153, "num_input_tokens_seen": 16987827264, "step": 59730, "train_runtime": 580847.8788, "train_tokens_per_second": 29246.603 }, { "epoch": 2.1137178327624295, "grad_norm": 0.61328125, "learning_rate": 1.893355416886511e-05, "loss": 0.38174147605895997, "num_input_tokens_seen": 16990676416, "step": 59740, "train_runtime": 580945.9381, "train_tokens_per_second": 29246.571 }, { "epoch": 2.1140716530261585, "grad_norm": 0.6328125, "learning_rate": 1.893219685672807e-05, "loss": 0.38504838943481445, "num_input_tokens_seen": 16993544704, "step": 59750, "train_runtime": 581041.7241, "train_tokens_per_second": 29246.686 }, { "epoch": 2.114425473289887, "grad_norm": 0.625, "learning_rate": 1.893083983645892e-05, "loss": 0.3856698751449585, "num_input_tokens_seen": 16996417024, "step": 59760, "train_runtime": 581137.3846, "train_tokens_per_second": 29246.814 }, { "epoch": 2.114779293553616, "grad_norm": 0.58984375, "learning_rate": 1.8929483107953064e-05, "loss": 0.383039665222168, "num_input_tokens_seen": 16999229504, "step": 59770, "train_runtime": 581233.0405, "train_tokens_per_second": 29246.84 }, { "epoch": 2.1151331138173446, "grad_norm": 0.6328125, "learning_rate": 1.892812667110597e-05, "loss": 0.38240551948547363, "num_input_tokens_seen": 17002028224, "step": 59780, "train_runtime": 581329.3576, "train_tokens_per_second": 29246.808 }, { "epoch": 2.1154869340810736, "grad_norm": 0.640625, "learning_rate": 1.8926770525813152e-05, "loss": 0.3890200614929199, "num_input_tokens_seen": 17004890368, "step": 59790, "train_runtime": 581430.2598, "train_tokens_per_second": 29246.655 }, { "epoch": 2.115840754344802, "grad_norm": 0.60546875, "learning_rate": 1.892541467197019e-05, "loss": 0.386551570892334, "num_input_tokens_seen": 17007705856, "step": 59800, "train_runtime": 581526.3966, "train_tokens_per_second": 29246.662 }, { "epoch": 2.116194574608531, "grad_norm": 0.6171875, "learning_rate": 1.8924059109472695e-05, "loss": 0.38725121021270753, "num_input_tokens_seen": 17010587200, "step": 59810, "train_runtime": 581629.7743, "train_tokens_per_second": 29246.417 }, { "epoch": 2.1165483948722597, "grad_norm": 0.59765625, "learning_rate": 1.892270383821635e-05, "loss": 0.3862725257873535, "num_input_tokens_seen": 17013437824, "step": 59820, "train_runtime": 581725.8185, "train_tokens_per_second": 29246.489 }, { "epoch": 2.1169022151359886, "grad_norm": 0.59765625, "learning_rate": 1.8921348858096877e-05, "loss": 0.3889531135559082, "num_input_tokens_seen": 17016261568, "step": 59830, "train_runtime": 581822.5161, "train_tokens_per_second": 29246.482 }, { "epoch": 2.117256035399717, "grad_norm": 0.62109375, "learning_rate": 1.8919994169010055e-05, "loss": 0.386976432800293, "num_input_tokens_seen": 17019096064, "step": 59840, "train_runtime": 581917.9929, "train_tokens_per_second": 29246.554 }, { "epoch": 2.117609855663446, "grad_norm": 0.6171875, "learning_rate": 1.891863977085172e-05, "loss": 0.38829855918884276, "num_input_tokens_seen": 17021946176, "step": 59850, "train_runtime": 582012.4419, "train_tokens_per_second": 29246.705 }, { "epoch": 2.117963675927175, "grad_norm": 0.59375, "learning_rate": 1.8917285663517752e-05, "loss": 0.38342986106872556, "num_input_tokens_seen": 17024808960, "step": 59860, "train_runtime": 582108.9995, "train_tokens_per_second": 29246.772 }, { "epoch": 2.1183174961909037, "grad_norm": 0.625, "learning_rate": 1.8915931846904088e-05, "loss": 0.3851174831390381, "num_input_tokens_seen": 17027647168, "step": 59870, "train_runtime": 582202.9793, "train_tokens_per_second": 29246.926 }, { "epoch": 2.1186713164546327, "grad_norm": 0.609375, "learning_rate": 1.8914578320906713e-05, "loss": 0.38332548141479494, "num_input_tokens_seen": 17030481664, "step": 59880, "train_runtime": 582300.0427, "train_tokens_per_second": 29246.918 }, { "epoch": 2.1190251367183612, "grad_norm": 0.59765625, "learning_rate": 1.8913225085421666e-05, "loss": 0.3865786552429199, "num_input_tokens_seen": 17033372480, "step": 59890, "train_runtime": 582402.4061, "train_tokens_per_second": 29246.741 }, { "epoch": 2.1193789569820902, "grad_norm": 0.6015625, "learning_rate": 1.8911872140345043e-05, "loss": 0.3820863485336304, "num_input_tokens_seen": 17036237568, "step": 59900, "train_runtime": 582501.3795, "train_tokens_per_second": 29246.691 }, { "epoch": 2.1197327772458188, "grad_norm": 0.5703125, "learning_rate": 1.891051948557299e-05, "loss": 0.3850423574447632, "num_input_tokens_seen": 17039136448, "step": 59910, "train_runtime": 582603.0652, "train_tokens_per_second": 29246.562 }, { "epoch": 2.1200865975095478, "grad_norm": 0.609375, "learning_rate": 1.8909167121001694e-05, "loss": 0.3856400966644287, "num_input_tokens_seen": 17042093504, "step": 59920, "train_runtime": 582710.6242, "train_tokens_per_second": 29246.238 }, { "epoch": 2.1204404177732763, "grad_norm": 0.61328125, "learning_rate": 1.8907815046527415e-05, "loss": 0.3830983638763428, "num_input_tokens_seen": 17044966144, "step": 59930, "train_runtime": 582807.5559, "train_tokens_per_second": 29246.303 }, { "epoch": 2.1207942380370053, "grad_norm": 0.609375, "learning_rate": 1.8906463262046445e-05, "loss": 0.3820266485214233, "num_input_tokens_seen": 17047717120, "step": 59940, "train_runtime": 582898.8403, "train_tokens_per_second": 29246.442 }, { "epoch": 2.121148058300734, "grad_norm": 0.60546875, "learning_rate": 1.8905111767455133e-05, "loss": 0.387908411026001, "num_input_tokens_seen": 17050561792, "step": 59950, "train_runtime": 582996.2624, "train_tokens_per_second": 29246.434 }, { "epoch": 2.121501878564463, "grad_norm": 0.59765625, "learning_rate": 1.890376056264989e-05, "loss": 0.38885958194732667, "num_input_tokens_seen": 17053431360, "step": 59960, "train_runtime": 583093.5354, "train_tokens_per_second": 29246.476 }, { "epoch": 2.1218556988281914, "grad_norm": 0.5859375, "learning_rate": 1.890240964752717e-05, "loss": 0.39104886054992677, "num_input_tokens_seen": 17056203904, "step": 59970, "train_runtime": 583186.1891, "train_tokens_per_second": 29246.584 }, { "epoch": 2.1222095190919203, "grad_norm": 0.61328125, "learning_rate": 1.890105902198348e-05, "loss": 0.38394579887390134, "num_input_tokens_seen": 17059085696, "step": 59980, "train_runtime": 583284.3902, "train_tokens_per_second": 29246.601 }, { "epoch": 2.122563339355649, "grad_norm": 0.609375, "learning_rate": 1.889970868591537e-05, "loss": 0.3869048833847046, "num_input_tokens_seen": 17061870464, "step": 59990, "train_runtime": 583378.6621, "train_tokens_per_second": 29246.648 }, { "epoch": 2.122917159619378, "grad_norm": 0.60546875, "learning_rate": 1.8898358639219462e-05, "loss": 0.3859964370727539, "num_input_tokens_seen": 17064681856, "step": 60000, "train_runtime": 583473.2994, "train_tokens_per_second": 29246.723 }, { "epoch": 2.122917159619378, "eval_loss": 0.33690783381462097, "eval_runtime": 8.4142, "eval_samples_per_second": 473.963, "eval_steps_per_second": 3.803, "num_input_tokens_seen": 17064681856, "step": 60000 }, { "epoch": 2.1232709798831064, "grad_norm": 0.62109375, "learning_rate": 1.8897008881792415e-05, "loss": 0.38256158828735354, "num_input_tokens_seen": 17067488128, "step": 60010, "train_runtime": 583600.0222, "train_tokens_per_second": 29245.181 }, { "epoch": 2.1236248001468354, "grad_norm": 0.609375, "learning_rate": 1.889565941353094e-05, "loss": 0.3864023685455322, "num_input_tokens_seen": 17070313344, "step": 60020, "train_runtime": 583695.977, "train_tokens_per_second": 29245.213 }, { "epoch": 2.1239786204105644, "grad_norm": 0.61328125, "learning_rate": 1.8894310234331808e-05, "loss": 0.39201419353485106, "num_input_tokens_seen": 17073132480, "step": 60030, "train_runtime": 583791.5338, "train_tokens_per_second": 29245.255 }, { "epoch": 2.124332440674293, "grad_norm": 0.6171875, "learning_rate": 1.889296134409183e-05, "loss": 0.3851889371871948, "num_input_tokens_seen": 17075946112, "step": 60040, "train_runtime": 583887.5879, "train_tokens_per_second": 29245.263 }, { "epoch": 2.124686260938022, "grad_norm": 0.625, "learning_rate": 1.8891612742707884e-05, "loss": 0.38455679416656496, "num_input_tokens_seen": 17078730368, "step": 60050, "train_runtime": 583982.5151, "train_tokens_per_second": 29245.277 }, { "epoch": 2.1250400812017505, "grad_norm": 0.61328125, "learning_rate": 1.8890264430076882e-05, "loss": 0.38625550270080566, "num_input_tokens_seen": 17081572864, "step": 60060, "train_runtime": 584078.9958, "train_tokens_per_second": 29245.313 }, { "epoch": 2.1253939014654795, "grad_norm": 0.625, "learning_rate": 1.8888916406095796e-05, "loss": 0.38981564044952394, "num_input_tokens_seen": 17084360576, "step": 60070, "train_runtime": 584171.4315, "train_tokens_per_second": 29245.457 }, { "epoch": 2.125747721729208, "grad_norm": 0.61328125, "learning_rate": 1.8887568670661654e-05, "loss": 0.38290517330169677, "num_input_tokens_seen": 17087122496, "step": 60080, "train_runtime": 584261.6864, "train_tokens_per_second": 29245.667 }, { "epoch": 2.126101541992937, "grad_norm": 0.62109375, "learning_rate": 1.888622122367153e-05, "loss": 0.385133171081543, "num_input_tokens_seen": 17089951680, "step": 60090, "train_runtime": 584359.6854, "train_tokens_per_second": 29245.604 }, { "epoch": 2.1264553622566655, "grad_norm": 0.6171875, "learning_rate": 1.8884874065022547e-05, "loss": 0.38584825992584226, "num_input_tokens_seen": 17092807680, "step": 60100, "train_runtime": 584459.718, "train_tokens_per_second": 29245.485 }, { "epoch": 2.1268091825203945, "grad_norm": 0.6328125, "learning_rate": 1.888352719461188e-05, "loss": 0.388007664680481, "num_input_tokens_seen": 17095697664, "step": 60110, "train_runtime": 584561.7226, "train_tokens_per_second": 29245.325 }, { "epoch": 2.127163002784123, "grad_norm": 0.60546875, "learning_rate": 1.8882180612336762e-05, "loss": 0.39150466918945315, "num_input_tokens_seen": 17098565440, "step": 60120, "train_runtime": 584660.2332, "train_tokens_per_second": 29245.303 }, { "epoch": 2.127516823047852, "grad_norm": 0.59765625, "learning_rate": 1.8880834318094482e-05, "loss": 0.39028732776641845, "num_input_tokens_seen": 17101441408, "step": 60130, "train_runtime": 584756.8495, "train_tokens_per_second": 29245.389 }, { "epoch": 2.1278706433115806, "grad_norm": 0.6171875, "learning_rate": 1.8879488311782353e-05, "loss": 0.38725595474243163, "num_input_tokens_seen": 17104317184, "step": 60140, "train_runtime": 584853.798, "train_tokens_per_second": 29245.458 }, { "epoch": 2.1282244635753096, "grad_norm": 0.59765625, "learning_rate": 1.887814259329777e-05, "loss": 0.3906563758850098, "num_input_tokens_seen": 17107165504, "step": 60150, "train_runtime": 584950.7248, "train_tokens_per_second": 29245.481 }, { "epoch": 2.128578283839038, "grad_norm": 0.6015625, "learning_rate": 1.8876797162538166e-05, "loss": 0.38708858489990233, "num_input_tokens_seen": 17110032832, "step": 60160, "train_runtime": 585048.7171, "train_tokens_per_second": 29245.484 }, { "epoch": 2.128932104102767, "grad_norm": 0.6015625, "learning_rate": 1.887545201940102e-05, "loss": 0.38337829113006594, "num_input_tokens_seen": 17112893568, "step": 60170, "train_runtime": 585145.1411, "train_tokens_per_second": 29245.554 }, { "epoch": 2.1292859243664957, "grad_norm": 0.62890625, "learning_rate": 1.887410716378387e-05, "loss": 0.3826786994934082, "num_input_tokens_seen": 17115758336, "step": 60180, "train_runtime": 585244.1365, "train_tokens_per_second": 29245.502 }, { "epoch": 2.1296397446302247, "grad_norm": 0.6171875, "learning_rate": 1.8872762595584308e-05, "loss": 0.3893911838531494, "num_input_tokens_seen": 17118615232, "step": 60190, "train_runtime": 585342.9324, "train_tokens_per_second": 29245.446 }, { "epoch": 2.1299935648939536, "grad_norm": 0.6171875, "learning_rate": 1.8871418314699966e-05, "loss": 0.3834666728973389, "num_input_tokens_seen": 17121483968, "step": 60200, "train_runtime": 585441.7933, "train_tokens_per_second": 29245.408 }, { "epoch": 2.130347385157682, "grad_norm": 0.578125, "learning_rate": 1.887007432102854e-05, "loss": 0.39141502380371096, "num_input_tokens_seen": 17124333696, "step": 60210, "train_runtime": 585539.2879, "train_tokens_per_second": 29245.405 }, { "epoch": 2.130701205421411, "grad_norm": 0.609375, "learning_rate": 1.8868730614467763e-05, "loss": 0.3861417770385742, "num_input_tokens_seen": 17127250240, "step": 60220, "train_runtime": 585637.6815, "train_tokens_per_second": 29245.472 }, { "epoch": 2.1310550256851397, "grad_norm": 0.62109375, "learning_rate": 1.886738719491543e-05, "loss": 0.3890763521194458, "num_input_tokens_seen": 17130068096, "step": 60230, "train_runtime": 585735.0049, "train_tokens_per_second": 29245.423 }, { "epoch": 2.1314088459488687, "grad_norm": 0.60546875, "learning_rate": 1.8866044062269382e-05, "loss": 0.3886754035949707, "num_input_tokens_seen": 17132911360, "step": 60240, "train_runtime": 585832.1138, "train_tokens_per_second": 29245.429 }, { "epoch": 2.1317626662125972, "grad_norm": 0.62890625, "learning_rate": 1.8864701216427515e-05, "loss": 0.38402643203735354, "num_input_tokens_seen": 17135699264, "step": 60250, "train_runtime": 585924.8573, "train_tokens_per_second": 29245.558 }, { "epoch": 2.1321164864763262, "grad_norm": 0.60546875, "learning_rate": 1.8863358657287767e-05, "loss": 0.3857043504714966, "num_input_tokens_seen": 17138549440, "step": 60260, "train_runtime": 586022.2117, "train_tokens_per_second": 29245.563 }, { "epoch": 2.1324703067400548, "grad_norm": 0.6171875, "learning_rate": 1.886201638474814e-05, "loss": 0.38955609798431395, "num_input_tokens_seen": 17141375680, "step": 60270, "train_runtime": 586118.7647, "train_tokens_per_second": 29245.567 }, { "epoch": 2.1328241270037838, "grad_norm": 0.625, "learning_rate": 1.886067439870667e-05, "loss": 0.38744549751281737, "num_input_tokens_seen": 17144211968, "step": 60280, "train_runtime": 586216.7559, "train_tokens_per_second": 29245.517 }, { "epoch": 2.1331779472675123, "grad_norm": 0.59765625, "learning_rate": 1.8859332699061463e-05, "loss": 0.38938026428222655, "num_input_tokens_seen": 17147082240, "step": 60290, "train_runtime": 586313.5677, "train_tokens_per_second": 29245.583 }, { "epoch": 2.1335317675312413, "grad_norm": 0.63671875, "learning_rate": 1.8857991285710668e-05, "loss": 0.3856241703033447, "num_input_tokens_seen": 17149895104, "step": 60300, "train_runtime": 586410.0609, "train_tokens_per_second": 29245.568 }, { "epoch": 2.13388558779497, "grad_norm": 0.6171875, "learning_rate": 1.8856650158552467e-05, "loss": 0.38742842674255373, "num_input_tokens_seen": 17152704384, "step": 60310, "train_runtime": 586504.1008, "train_tokens_per_second": 29245.668 }, { "epoch": 2.134239408058699, "grad_norm": 0.61328125, "learning_rate": 1.8855309317485123e-05, "loss": 0.38872356414794923, "num_input_tokens_seen": 17155585408, "step": 60320, "train_runtime": 586603.804, "train_tokens_per_second": 29245.609 }, { "epoch": 2.1345932283224274, "grad_norm": 0.6171875, "learning_rate": 1.8853968762406928e-05, "loss": 0.38028364181518554, "num_input_tokens_seen": 17158439360, "step": 60330, "train_runtime": 586700.1198, "train_tokens_per_second": 29245.672 }, { "epoch": 2.1349470485861564, "grad_norm": 0.62109375, "learning_rate": 1.8852628493216236e-05, "loss": 0.3856541156768799, "num_input_tokens_seen": 17161269120, "step": 60340, "train_runtime": 586796.539, "train_tokens_per_second": 29245.689 }, { "epoch": 2.1353008688498853, "grad_norm": 0.59765625, "learning_rate": 1.8851288509811446e-05, "loss": 0.3877675533294678, "num_input_tokens_seen": 17164128000, "step": 60350, "train_runtime": 586893.7037, "train_tokens_per_second": 29245.718 }, { "epoch": 2.135654689113614, "grad_norm": 0.61328125, "learning_rate": 1.8849948812091007e-05, "loss": 0.38853323459625244, "num_input_tokens_seen": 17166980032, "step": 60360, "train_runtime": 586991.0606, "train_tokens_per_second": 29245.727 }, { "epoch": 2.136008509377343, "grad_norm": 0.6015625, "learning_rate": 1.884860939995342e-05, "loss": 0.38944363594055176, "num_input_tokens_seen": 17169832896, "step": 60370, "train_runtime": 587088.5613, "train_tokens_per_second": 29245.729 }, { "epoch": 2.1363623296410714, "grad_norm": 0.59375, "learning_rate": 1.884727027329724e-05, "loss": 0.39067137241363525, "num_input_tokens_seen": 17172664512, "step": 60380, "train_runtime": 587184.6077, "train_tokens_per_second": 29245.767 }, { "epoch": 2.1367161499048004, "grad_norm": 0.6171875, "learning_rate": 1.8845931432021067e-05, "loss": 0.3879371404647827, "num_input_tokens_seen": 17175466560, "step": 60390, "train_runtime": 587277.8665, "train_tokens_per_second": 29245.895 }, { "epoch": 2.137069970168529, "grad_norm": 0.59765625, "learning_rate": 1.8844592876023555e-05, "loss": 0.3840583086013794, "num_input_tokens_seen": 17178302656, "step": 60400, "train_runtime": 587374.6415, "train_tokens_per_second": 29245.904 }, { "epoch": 2.137423790432258, "grad_norm": 0.625, "learning_rate": 1.88432546052034e-05, "loss": 0.38749213218688966, "num_input_tokens_seen": 17181206528, "step": 60410, "train_runtime": 587473.9305, "train_tokens_per_second": 29245.905 }, { "epoch": 2.1377776106959865, "grad_norm": 0.64453125, "learning_rate": 1.884191661945937e-05, "loss": 0.38306283950805664, "num_input_tokens_seen": 17184034752, "step": 60420, "train_runtime": 587568.2646, "train_tokens_per_second": 29246.023 }, { "epoch": 2.1381314309597155, "grad_norm": 0.625, "learning_rate": 1.884057891869025e-05, "loss": 0.38718523979187014, "num_input_tokens_seen": 17186925248, "step": 60430, "train_runtime": 587669.4673, "train_tokens_per_second": 29245.905 }, { "epoch": 2.138485251223444, "grad_norm": 0.6015625, "learning_rate": 1.883924150279491e-05, "loss": 0.39154276847839353, "num_input_tokens_seen": 17189764032, "step": 60440, "train_runtime": 587764.1462, "train_tokens_per_second": 29246.024 }, { "epoch": 2.138839071487173, "grad_norm": 0.59375, "learning_rate": 1.8837904371672252e-05, "loss": 0.38042216300964354, "num_input_tokens_seen": 17192595904, "step": 60450, "train_runtime": 587861.0143, "train_tokens_per_second": 29246.022 }, { "epoch": 2.1391928917509015, "grad_norm": 0.61328125, "learning_rate": 1.8836567525221222e-05, "loss": 0.38723273277282716, "num_input_tokens_seen": 17195496768, "step": 60460, "train_runtime": 587960.6276, "train_tokens_per_second": 29246.0 }, { "epoch": 2.1395467120146305, "grad_norm": 0.59765625, "learning_rate": 1.8835230963340828e-05, "loss": 0.38415482044219973, "num_input_tokens_seen": 17198369216, "step": 60470, "train_runtime": 588059.2478, "train_tokens_per_second": 29245.98 }, { "epoch": 2.139900532278359, "grad_norm": 0.62109375, "learning_rate": 1.883389468593013e-05, "loss": 0.3883045673370361, "num_input_tokens_seen": 17201179520, "step": 60480, "train_runtime": 588153.1828, "train_tokens_per_second": 29246.088 }, { "epoch": 2.140254352542088, "grad_norm": 0.6171875, "learning_rate": 1.8832558692888226e-05, "loss": 0.38452730178833006, "num_input_tokens_seen": 17204054720, "step": 60490, "train_runtime": 588253.6834, "train_tokens_per_second": 29245.979 }, { "epoch": 2.1406081728058166, "grad_norm": 0.61328125, "learning_rate": 1.8831222984114276e-05, "loss": 0.38687431812286377, "num_input_tokens_seen": 17206879424, "step": 60500, "train_runtime": 588349.8404, "train_tokens_per_second": 29246.0 }, { "epoch": 2.1409619930695456, "grad_norm": 0.67578125, "learning_rate": 1.882988755950748e-05, "loss": 0.39170589447021487, "num_input_tokens_seen": 17209693952, "step": 60510, "train_runtime": 588444.9904, "train_tokens_per_second": 29246.054 }, { "epoch": 2.141315813333274, "grad_norm": 0.6015625, "learning_rate": 1.88285524189671e-05, "loss": 0.3879119396209717, "num_input_tokens_seen": 17212594368, "step": 60520, "train_runtime": 588551.4936, "train_tokens_per_second": 29245.69 }, { "epoch": 2.141669633597003, "grad_norm": 0.6171875, "learning_rate": 1.8827217562392433e-05, "loss": 0.386278772354126, "num_input_tokens_seen": 17215391488, "step": 60530, "train_runtime": 588645.6942, "train_tokens_per_second": 29245.761 }, { "epoch": 2.142023453860732, "grad_norm": 0.62890625, "learning_rate": 1.8825882989682843e-05, "loss": 0.3828026294708252, "num_input_tokens_seen": 17218271232, "step": 60540, "train_runtime": 588745.4907, "train_tokens_per_second": 29245.695 }, { "epoch": 2.1423772741244607, "grad_norm": 0.63671875, "learning_rate": 1.8824548700737723e-05, "loss": 0.3884097099304199, "num_input_tokens_seen": 17221112832, "step": 60550, "train_runtime": 588840.9073, "train_tokens_per_second": 29245.782 }, { "epoch": 2.1427310943881896, "grad_norm": 0.61328125, "learning_rate": 1.8823214695456538e-05, "loss": 0.3851633548736572, "num_input_tokens_seen": 17223947904, "step": 60560, "train_runtime": 588935.3099, "train_tokens_per_second": 29245.908 }, { "epoch": 2.143084914651918, "grad_norm": 0.59375, "learning_rate": 1.8821880973738792e-05, "loss": 0.3876689910888672, "num_input_tokens_seen": 17226748480, "step": 60570, "train_runtime": 589029.0583, "train_tokens_per_second": 29246.008 }, { "epoch": 2.143438734915647, "grad_norm": 0.62109375, "learning_rate": 1.8820547535484033e-05, "loss": 0.38605761528015137, "num_input_tokens_seen": 17229556736, "step": 60580, "train_runtime": 589124.5894, "train_tokens_per_second": 29246.032 }, { "epoch": 2.1437925551793757, "grad_norm": 0.60546875, "learning_rate": 1.8819214380591876e-05, "loss": 0.3882163047790527, "num_input_tokens_seen": 17232463680, "step": 60590, "train_runtime": 589224.7377, "train_tokens_per_second": 29245.995 }, { "epoch": 2.1441463754431047, "grad_norm": 0.62109375, "learning_rate": 1.8817881508961965e-05, "loss": 0.3880929708480835, "num_input_tokens_seen": 17235324608, "step": 60600, "train_runtime": 589320.2934, "train_tokens_per_second": 29246.107 }, { "epoch": 2.1445001957068333, "grad_norm": 0.59375, "learning_rate": 1.881654892049401e-05, "loss": 0.38804771900177004, "num_input_tokens_seen": 17238223424, "step": 60610, "train_runtime": 589423.5462, "train_tokens_per_second": 29245.902 }, { "epoch": 2.1448540159705622, "grad_norm": 0.609375, "learning_rate": 1.881521661508776e-05, "loss": 0.3868117809295654, "num_input_tokens_seen": 17241020416, "step": 60620, "train_runtime": 589517.9086, "train_tokens_per_second": 29245.965 }, { "epoch": 2.145207836234291, "grad_norm": 0.60546875, "learning_rate": 1.8813884592643023e-05, "loss": 0.38586370944976806, "num_input_tokens_seen": 17243888512, "step": 60630, "train_runtime": 589619.9387, "train_tokens_per_second": 29245.769 }, { "epoch": 2.1455616564980198, "grad_norm": 0.625, "learning_rate": 1.8812552853059646e-05, "loss": 0.39091432094573975, "num_input_tokens_seen": 17246744000, "step": 60640, "train_runtime": 589715.6254, "train_tokens_per_second": 29245.866 }, { "epoch": 2.1459154767617483, "grad_norm": 0.6328125, "learning_rate": 1.881122139623754e-05, "loss": 0.3884439468383789, "num_input_tokens_seen": 17249580224, "step": 60650, "train_runtime": 589814.1781, "train_tokens_per_second": 29245.788 }, { "epoch": 2.1462692970254773, "grad_norm": 0.60546875, "learning_rate": 1.8809890222076647e-05, "loss": 0.3859309911727905, "num_input_tokens_seen": 17252459328, "step": 60660, "train_runtime": 589911.6224, "train_tokens_per_second": 29245.837 }, { "epoch": 2.146623117289206, "grad_norm": 0.60546875, "learning_rate": 1.8808559330476978e-05, "loss": 0.3882889747619629, "num_input_tokens_seen": 17255289664, "step": 60670, "train_runtime": 590007.4005, "train_tokens_per_second": 29245.887 }, { "epoch": 2.146976937552935, "grad_norm": 0.62109375, "learning_rate": 1.880722872133858e-05, "loss": 0.3860327243804932, "num_input_tokens_seen": 17258201984, "step": 60680, "train_runtime": 590104.544, "train_tokens_per_second": 29246.008 }, { "epoch": 2.147330757816664, "grad_norm": 0.625, "learning_rate": 1.8805898394561554e-05, "loss": 0.3851497650146484, "num_input_tokens_seen": 17261048000, "step": 60690, "train_runtime": 590201.5445, "train_tokens_per_second": 29246.023 }, { "epoch": 2.1476845780803924, "grad_norm": 0.640625, "learning_rate": 1.8804568350046047e-05, "loss": 0.38547773361206056, "num_input_tokens_seen": 17263837120, "step": 60700, "train_runtime": 590296.4701, "train_tokens_per_second": 29246.045 }, { "epoch": 2.1480383983441214, "grad_norm": 0.64453125, "learning_rate": 1.8803238587692266e-05, "loss": 0.38608880043029786, "num_input_tokens_seen": 17266761024, "step": 60710, "train_runtime": 590400.1299, "train_tokens_per_second": 29245.863 }, { "epoch": 2.14839221860785, "grad_norm": 0.61328125, "learning_rate": 1.880190910740045e-05, "loss": 0.3900933265686035, "num_input_tokens_seen": 17269636992, "step": 60720, "train_runtime": 590499.8074, "train_tokens_per_second": 29245.796 }, { "epoch": 2.148746038871579, "grad_norm": 0.61328125, "learning_rate": 1.8800579909070908e-05, "loss": 0.38424131870269773, "num_input_tokens_seen": 17272521472, "step": 60730, "train_runtime": 590598.9428, "train_tokens_per_second": 29245.771 }, { "epoch": 2.1490998591353074, "grad_norm": 0.62890625, "learning_rate": 1.879925099260398e-05, "loss": 0.38953866958618166, "num_input_tokens_seen": 17275307584, "step": 60740, "train_runtime": 590690.031, "train_tokens_per_second": 29245.978 }, { "epoch": 2.1494536793990364, "grad_norm": 0.6015625, "learning_rate": 1.879792235790007e-05, "loss": 0.3831746578216553, "num_input_tokens_seen": 17278189248, "step": 60750, "train_runtime": 590791.4273, "train_tokens_per_second": 29245.836 }, { "epoch": 2.149807499662765, "grad_norm": 0.58203125, "learning_rate": 1.8796594004859614e-05, "loss": 0.3884650707244873, "num_input_tokens_seen": 17281056064, "step": 60760, "train_runtime": 590888.5332, "train_tokens_per_second": 29245.882 }, { "epoch": 2.150161319926494, "grad_norm": 0.62890625, "learning_rate": 1.8795265933383115e-05, "loss": 0.385513162612915, "num_input_tokens_seen": 17283865152, "step": 60770, "train_runtime": 590985.5877, "train_tokens_per_second": 29245.832 }, { "epoch": 2.1505151401902225, "grad_norm": 0.609375, "learning_rate": 1.8793938143371118e-05, "loss": 0.3835740566253662, "num_input_tokens_seen": 17286665344, "step": 60780, "train_runtime": 591079.0888, "train_tokens_per_second": 29245.943 }, { "epoch": 2.1508689604539515, "grad_norm": 0.62109375, "learning_rate": 1.8792610634724215e-05, "loss": 0.3861441135406494, "num_input_tokens_seen": 17289489664, "step": 60790, "train_runtime": 591174.4455, "train_tokens_per_second": 29246.003 }, { "epoch": 2.15122278071768, "grad_norm": 0.609375, "learning_rate": 1.8791283407343048e-05, "loss": 0.38686556816101075, "num_input_tokens_seen": 17292283776, "step": 60800, "train_runtime": 591268.8176, "train_tokens_per_second": 29246.061 }, { "epoch": 2.151576600981409, "grad_norm": 0.6484375, "learning_rate": 1.8789956461128312e-05, "loss": 0.3895624876022339, "num_input_tokens_seen": 17295177216, "step": 60810, "train_runtime": 591367.7868, "train_tokens_per_second": 29246.059 }, { "epoch": 2.1519304212451376, "grad_norm": 0.61328125, "learning_rate": 1.878862979598074e-05, "loss": 0.38757944107055664, "num_input_tokens_seen": 17297993216, "step": 60820, "train_runtime": 591463.4299, "train_tokens_per_second": 29246.091 }, { "epoch": 2.1522842415088665, "grad_norm": 0.6171875, "learning_rate": 1.8787303411801134e-05, "loss": 0.387520956993103, "num_input_tokens_seen": 17300816320, "step": 60830, "train_runtime": 591557.4557, "train_tokens_per_second": 29246.215 }, { "epoch": 2.152638061772595, "grad_norm": 0.6015625, "learning_rate": 1.8785977308490328e-05, "loss": 0.3854555368423462, "num_input_tokens_seen": 17303713856, "step": 60840, "train_runtime": 591654.5406, "train_tokens_per_second": 29246.313 }, { "epoch": 2.152991882036324, "grad_norm": 0.60546875, "learning_rate": 1.8784651485949205e-05, "loss": 0.38765678405761717, "num_input_tokens_seen": 17306572992, "step": 60850, "train_runtime": 591752.2406, "train_tokens_per_second": 29246.316 }, { "epoch": 2.1533457023000526, "grad_norm": 0.63671875, "learning_rate": 1.8783325944078713e-05, "loss": 0.3828439712524414, "num_input_tokens_seen": 17309422016, "step": 60860, "train_runtime": 591849.3837, "train_tokens_per_second": 29246.329 }, { "epoch": 2.1536995225637816, "grad_norm": 0.61328125, "learning_rate": 1.878200068277983e-05, "loss": 0.38779449462890625, "num_input_tokens_seen": 17312235456, "step": 60870, "train_runtime": 591944.913, "train_tokens_per_second": 29246.362 }, { "epoch": 2.1540533428275106, "grad_norm": 0.59765625, "learning_rate": 1.8780675701953594e-05, "loss": 0.38764224052429197, "num_input_tokens_seen": 17315097280, "step": 60880, "train_runtime": 592042.8286, "train_tokens_per_second": 29246.359 }, { "epoch": 2.154407163091239, "grad_norm": 0.640625, "learning_rate": 1.877935100150109e-05, "loss": 0.38846454620361326, "num_input_tokens_seen": 17317914176, "step": 60890, "train_runtime": 592139.9772, "train_tokens_per_second": 29246.318 }, { "epoch": 2.154760983354968, "grad_norm": 0.60546875, "learning_rate": 1.8778026581323445e-05, "loss": 0.388960599899292, "num_input_tokens_seen": 17320673664, "step": 60900, "train_runtime": 592232.7427, "train_tokens_per_second": 29246.397 }, { "epoch": 2.1551148036186967, "grad_norm": 0.61328125, "learning_rate": 1.8776702441321843e-05, "loss": 0.38748199939727784, "num_input_tokens_seen": 17323522560, "step": 60910, "train_runtime": 592327.8702, "train_tokens_per_second": 29246.509 }, { "epoch": 2.1554686238824257, "grad_norm": 0.5859375, "learning_rate": 1.8775378581397523e-05, "loss": 0.3825246334075928, "num_input_tokens_seen": 17326356480, "step": 60920, "train_runtime": 592426.945, "train_tokens_per_second": 29246.402 }, { "epoch": 2.155822444146154, "grad_norm": 0.60546875, "learning_rate": 1.8774055001451754e-05, "loss": 0.38863024711608884, "num_input_tokens_seen": 17329271552, "step": 60930, "train_runtime": 592528.7453, "train_tokens_per_second": 29246.297 }, { "epoch": 2.156176264409883, "grad_norm": 0.5859375, "learning_rate": 1.8772731701385865e-05, "loss": 0.38425326347351074, "num_input_tokens_seen": 17332025280, "step": 60940, "train_runtime": 592621.0365, "train_tokens_per_second": 29246.389 }, { "epoch": 2.1565300846736117, "grad_norm": 0.62109375, "learning_rate": 1.8771408681101236e-05, "loss": 0.3854637384414673, "num_input_tokens_seen": 17334866112, "step": 60950, "train_runtime": 592718.0602, "train_tokens_per_second": 29246.394 }, { "epoch": 2.1568839049373407, "grad_norm": 0.64453125, "learning_rate": 1.877008594049929e-05, "loss": 0.3821453809738159, "num_input_tokens_seen": 17337678848, "step": 60960, "train_runtime": 592812.9728, "train_tokens_per_second": 29246.457 }, { "epoch": 2.1572377252010693, "grad_norm": 0.61328125, "learning_rate": 1.87687634794815e-05, "loss": 0.3865180730819702, "num_input_tokens_seen": 17340461952, "step": 60970, "train_runtime": 592907.6713, "train_tokens_per_second": 29246.479 }, { "epoch": 2.1575915454647983, "grad_norm": 0.61328125, "learning_rate": 1.876744129794939e-05, "loss": 0.38787617683410647, "num_input_tokens_seen": 17343278528, "step": 60980, "train_runtime": 593003.7045, "train_tokens_per_second": 29246.493 }, { "epoch": 2.157945365728527, "grad_norm": 0.59375, "learning_rate": 1.8766119395804525e-05, "loss": 0.3859707355499268, "num_input_tokens_seen": 17346139328, "step": 60990, "train_runtime": 593103.2686, "train_tokens_per_second": 29246.407 }, { "epoch": 2.158299185992256, "grad_norm": 0.60546875, "learning_rate": 1.8764797772948537e-05, "loss": 0.3854742288589478, "num_input_tokens_seen": 17348953856, "step": 61000, "train_runtime": 593198.9228, "train_tokens_per_second": 29246.435 }, { "epoch": 2.1586530062559843, "grad_norm": 0.59375, "learning_rate": 1.8763476429283083e-05, "loss": 0.381731653213501, "num_input_tokens_seen": 17351814208, "step": 61010, "train_runtime": 593295.9978, "train_tokens_per_second": 29246.471 }, { "epoch": 2.1590068265197133, "grad_norm": 0.62109375, "learning_rate": 1.8762155364709885e-05, "loss": 0.3908177614212036, "num_input_tokens_seen": 17354639808, "step": 61020, "train_runtime": 593393.2845, "train_tokens_per_second": 29246.438 }, { "epoch": 2.1593606467834423, "grad_norm": 0.6328125, "learning_rate": 1.8760834579130705e-05, "loss": 0.3879721641540527, "num_input_tokens_seen": 17357488192, "step": 61030, "train_runtime": 593489.658, "train_tokens_per_second": 29246.488 }, { "epoch": 2.159714467047171, "grad_norm": 0.6015625, "learning_rate": 1.8759514072447352e-05, "loss": 0.3863555908203125, "num_input_tokens_seen": 17360398464, "step": 61040, "train_runtime": 593587.9768, "train_tokens_per_second": 29246.547 }, { "epoch": 2.1600682873109, "grad_norm": 0.640625, "learning_rate": 1.8758193844561695e-05, "loss": 0.38376669883728026, "num_input_tokens_seen": 17363253888, "step": 61050, "train_runtime": 593687.6612, "train_tokens_per_second": 29246.446 }, { "epoch": 2.1604221075746284, "grad_norm": 0.6171875, "learning_rate": 1.875687389537564e-05, "loss": 0.3873939037322998, "num_input_tokens_seen": 17366058752, "step": 61060, "train_runtime": 593781.5523, "train_tokens_per_second": 29246.545 }, { "epoch": 2.1607759278383574, "grad_norm": 0.58203125, "learning_rate": 1.8755554224791144e-05, "loss": 0.3876068353652954, "num_input_tokens_seen": 17368965504, "step": 61070, "train_runtime": 593882.3837, "train_tokens_per_second": 29246.474 }, { "epoch": 2.161129748102086, "grad_norm": 0.609375, "learning_rate": 1.8754234832710217e-05, "loss": 0.38747658729553225, "num_input_tokens_seen": 17371842752, "step": 61080, "train_runtime": 593983.0066, "train_tokens_per_second": 29246.363 }, { "epoch": 2.161483568365815, "grad_norm": 0.62109375, "learning_rate": 1.8752915719034914e-05, "loss": 0.38890810012817384, "num_input_tokens_seen": 17374629824, "step": 61090, "train_runtime": 594076.3849, "train_tokens_per_second": 29246.458 }, { "epoch": 2.1618373886295434, "grad_norm": 0.5859375, "learning_rate": 1.8751596883667337e-05, "loss": 0.3885769844055176, "num_input_tokens_seen": 17377418176, "step": 61100, "train_runtime": 594171.4768, "train_tokens_per_second": 29246.47 }, { "epoch": 2.1621912088932724, "grad_norm": 0.625, "learning_rate": 1.8750278326509628e-05, "loss": 0.3861593246459961, "num_input_tokens_seen": 17380196800, "step": 61110, "train_runtime": 594261.7217, "train_tokens_per_second": 29246.704 }, { "epoch": 2.162545029157001, "grad_norm": 0.59375, "learning_rate": 1.8748960047464e-05, "loss": 0.3824602127075195, "num_input_tokens_seen": 17383017792, "step": 61120, "train_runtime": 594356.8389, "train_tokens_per_second": 29246.77 }, { "epoch": 2.16289884942073, "grad_norm": 0.625, "learning_rate": 1.8747642046432698e-05, "loss": 0.38700094223022463, "num_input_tokens_seen": 17385819328, "step": 61130, "train_runtime": 594448.7053, "train_tokens_per_second": 29246.963 }, { "epoch": 2.1632526696844585, "grad_norm": 0.58984375, "learning_rate": 1.8746324323318008e-05, "loss": 0.3900285720825195, "num_input_tokens_seen": 17388649984, "step": 61140, "train_runtime": 594544.2303, "train_tokens_per_second": 29247.025 }, { "epoch": 2.1636064899481875, "grad_norm": 0.61328125, "learning_rate": 1.8745006878022285e-05, "loss": 0.3876815319061279, "num_input_tokens_seen": 17391516032, "step": 61150, "train_runtime": 594641.7453, "train_tokens_per_second": 29247.049 }, { "epoch": 2.163960310211916, "grad_norm": 0.62109375, "learning_rate": 1.8743689710447914e-05, "loss": 0.3892263650894165, "num_input_tokens_seen": 17394293696, "step": 61160, "train_runtime": 594737.6579, "train_tokens_per_second": 29247.002 }, { "epoch": 2.164314130475645, "grad_norm": 0.6171875, "learning_rate": 1.8742372820497335e-05, "loss": 0.3843223571777344, "num_input_tokens_seen": 17397146880, "step": 61170, "train_runtime": 594835.393, "train_tokens_per_second": 29246.994 }, { "epoch": 2.164667950739374, "grad_norm": 0.61328125, "learning_rate": 1.8741056208073036e-05, "loss": 0.3839869976043701, "num_input_tokens_seen": 17400026752, "step": 61180, "train_runtime": 594934.8474, "train_tokens_per_second": 29246.945 }, { "epoch": 2.1650217710031026, "grad_norm": 0.59375, "learning_rate": 1.873973987307755e-05, "loss": 0.3889696359634399, "num_input_tokens_seen": 17402869504, "step": 61190, "train_runtime": 595032.4639, "train_tokens_per_second": 29246.924 }, { "epoch": 2.1653755912668315, "grad_norm": 0.6171875, "learning_rate": 1.8738423815413468e-05, "loss": 0.3881132364273071, "num_input_tokens_seen": 17405652992, "step": 61200, "train_runtime": 595125.3724, "train_tokens_per_second": 29247.036 }, { "epoch": 2.16572941153056, "grad_norm": 0.6171875, "learning_rate": 1.8737108034983415e-05, "loss": 0.39003844261169435, "num_input_tokens_seen": 17408465152, "step": 61210, "train_runtime": 595221.0184, "train_tokens_per_second": 29247.061 }, { "epoch": 2.166083231794289, "grad_norm": 0.5703125, "learning_rate": 1.873579253169007e-05, "loss": 0.38290090560913087, "num_input_tokens_seen": 17411338880, "step": 61220, "train_runtime": 595315.9282, "train_tokens_per_second": 29247.225 }, { "epoch": 2.1664370520580176, "grad_norm": 0.609375, "learning_rate": 1.8734477305436166e-05, "loss": 0.38256587982177737, "num_input_tokens_seen": 17414242496, "step": 61230, "train_runtime": 595416.7842, "train_tokens_per_second": 29247.147 }, { "epoch": 2.1667908723217466, "grad_norm": 0.6171875, "learning_rate": 1.873316235612447e-05, "loss": 0.3900241136550903, "num_input_tokens_seen": 17417080704, "step": 61240, "train_runtime": 595514.7058, "train_tokens_per_second": 29247.104 }, { "epoch": 2.167144692585475, "grad_norm": 0.60546875, "learning_rate": 1.873184768365781e-05, "loss": 0.38803949356079104, "num_input_tokens_seen": 17419943680, "step": 61250, "train_runtime": 595615.3844, "train_tokens_per_second": 29246.967 }, { "epoch": 2.167498512849204, "grad_norm": 0.6015625, "learning_rate": 1.8730533287939052e-05, "loss": 0.386526894569397, "num_input_tokens_seen": 17422755584, "step": 61260, "train_runtime": 595709.132, "train_tokens_per_second": 29247.085 }, { "epoch": 2.1678523331129327, "grad_norm": 0.63671875, "learning_rate": 1.8729219168871118e-05, "loss": 0.3834963083267212, "num_input_tokens_seen": 17425571776, "step": 61270, "train_runtime": 595805.0437, "train_tokens_per_second": 29247.103 }, { "epoch": 2.1682061533766617, "grad_norm": 0.609375, "learning_rate": 1.872790532635697e-05, "loss": 0.3876005172729492, "num_input_tokens_seen": 17428384256, "step": 61280, "train_runtime": 595901.7086, "train_tokens_per_second": 29247.079 }, { "epoch": 2.16855997364039, "grad_norm": 0.62109375, "learning_rate": 1.8726591760299626e-05, "loss": 0.38833298683166506, "num_input_tokens_seen": 17431207488, "step": 61290, "train_runtime": 595995.4931, "train_tokens_per_second": 29247.214 }, { "epoch": 2.168913793904119, "grad_norm": 0.58984375, "learning_rate": 1.8725278470602142e-05, "loss": 0.3874513149261475, "num_input_tokens_seen": 17434045888, "step": 61300, "train_runtime": 596093.0135, "train_tokens_per_second": 29247.19 }, { "epoch": 2.1692676141678477, "grad_norm": 0.625, "learning_rate": 1.872396545716763e-05, "loss": 0.3876046895980835, "num_input_tokens_seen": 17436891264, "step": 61310, "train_runtime": 596190.2179, "train_tokens_per_second": 29247.195 }, { "epoch": 2.1696214344315767, "grad_norm": 0.61328125, "learning_rate": 1.8722652719899246e-05, "loss": 0.38645663261413576, "num_input_tokens_seen": 17439702144, "step": 61320, "train_runtime": 596286.3965, "train_tokens_per_second": 29247.191 }, { "epoch": 2.1699752546953053, "grad_norm": 0.59765625, "learning_rate": 1.872134025870019e-05, "loss": 0.3838057518005371, "num_input_tokens_seen": 17442579904, "step": 61330, "train_runtime": 596385.6629, "train_tokens_per_second": 29247.148 }, { "epoch": 2.1703290749590343, "grad_norm": 0.59375, "learning_rate": 1.872002807347371e-05, "loss": 0.38198373317718504, "num_input_tokens_seen": 17445395392, "step": 61340, "train_runtime": 596480.0234, "train_tokens_per_second": 29247.242 }, { "epoch": 2.170682895222763, "grad_norm": 0.6015625, "learning_rate": 1.8718716164123114e-05, "loss": 0.3841330289840698, "num_input_tokens_seen": 17448275072, "step": 61350, "train_runtime": 596580.2192, "train_tokens_per_second": 29247.157 }, { "epoch": 2.171036715486492, "grad_norm": 0.6171875, "learning_rate": 1.8717404530551747e-05, "loss": 0.3877728939056396, "num_input_tokens_seen": 17451117248, "step": 61360, "train_runtime": 596678.0557, "train_tokens_per_second": 29247.124 }, { "epoch": 2.171390535750221, "grad_norm": 0.6015625, "learning_rate": 1.8716093172662993e-05, "loss": 0.3879808187484741, "num_input_tokens_seen": 17453973312, "step": 61370, "train_runtime": 596776.3798, "train_tokens_per_second": 29247.091 }, { "epoch": 2.1717443560139493, "grad_norm": 0.60546875, "learning_rate": 1.87147820903603e-05, "loss": 0.38223164081573485, "num_input_tokens_seen": 17456835520, "step": 61380, "train_runtime": 596876.917, "train_tokens_per_second": 29246.96 }, { "epoch": 2.1720981762776783, "grad_norm": 0.62109375, "learning_rate": 1.8713471283547156e-05, "loss": 0.3881186008453369, "num_input_tokens_seen": 17459705216, "step": 61390, "train_runtime": 596977.6474, "train_tokens_per_second": 29246.832 }, { "epoch": 2.172451996541407, "grad_norm": 0.59765625, "learning_rate": 1.8712160752127094e-05, "loss": 0.38828539848327637, "num_input_tokens_seen": 17462594880, "step": 61400, "train_runtime": 597077.7358, "train_tokens_per_second": 29246.769 }, { "epoch": 2.172805816805136, "grad_norm": 0.62890625, "learning_rate": 1.8710850496003697e-05, "loss": 0.38840174674987793, "num_input_tokens_seen": 17465466816, "step": 61410, "train_runtime": 597177.5508, "train_tokens_per_second": 29246.69 }, { "epoch": 2.1731596370688644, "grad_norm": 0.6171875, "learning_rate": 1.8709540515080597e-05, "loss": 0.38725717067718507, "num_input_tokens_seen": 17468312512, "step": 61420, "train_runtime": 597275.2683, "train_tokens_per_second": 29246.67 }, { "epoch": 2.1735134573325934, "grad_norm": 0.609375, "learning_rate": 1.8708230809261465e-05, "loss": 0.3879450082778931, "num_input_tokens_seen": 17471146880, "step": 61430, "train_runtime": 597370.3696, "train_tokens_per_second": 29246.758 }, { "epoch": 2.173867277596322, "grad_norm": 0.61328125, "learning_rate": 1.8706921378450034e-05, "loss": 0.3891200065612793, "num_input_tokens_seen": 17473970816, "step": 61440, "train_runtime": 597470.9696, "train_tokens_per_second": 29246.56 }, { "epoch": 2.174221097860051, "grad_norm": 0.6328125, "learning_rate": 1.870561222255007e-05, "loss": 0.38735768795013426, "num_input_tokens_seen": 17476795328, "step": 61450, "train_runtime": 597566.1268, "train_tokens_per_second": 29246.63 }, { "epoch": 2.1745749181237795, "grad_norm": 0.6171875, "learning_rate": 1.8704303341465393e-05, "loss": 0.3866576194763184, "num_input_tokens_seen": 17479608960, "step": 61460, "train_runtime": 597660.7614, "train_tokens_per_second": 29246.707 }, { "epoch": 2.1749287383875084, "grad_norm": 0.58984375, "learning_rate": 1.8702994735099868e-05, "loss": 0.3878880500793457, "num_input_tokens_seen": 17482478592, "step": 61470, "train_runtime": 597756.386, "train_tokens_per_second": 29246.829 }, { "epoch": 2.175282558651237, "grad_norm": 0.62890625, "learning_rate": 1.8701686403357407e-05, "loss": 0.3896933078765869, "num_input_tokens_seen": 17485279424, "step": 61480, "train_runtime": 597852.4748, "train_tokens_per_second": 29246.813 }, { "epoch": 2.175636378914966, "grad_norm": 0.609375, "learning_rate": 1.8700378346141973e-05, "loss": 0.3861856460571289, "num_input_tokens_seen": 17488142464, "step": 61490, "train_runtime": 597951.6453, "train_tokens_per_second": 29246.75 }, { "epoch": 2.1759901991786945, "grad_norm": 0.6171875, "learning_rate": 1.8699070563357574e-05, "loss": 0.38948023319244385, "num_input_tokens_seen": 17490942848, "step": 61500, "train_runtime": 598046.2986, "train_tokens_per_second": 29246.804 }, { "epoch": 2.1763440194424235, "grad_norm": 0.62890625, "learning_rate": 1.8697763054908255e-05, "loss": 0.3894660472869873, "num_input_tokens_seen": 17493765120, "step": 61510, "train_runtime": 598143.1164, "train_tokens_per_second": 29246.788 }, { "epoch": 2.1766978397061525, "grad_norm": 0.65234375, "learning_rate": 1.8696455820698124e-05, "loss": 0.38852667808532715, "num_input_tokens_seen": 17496527616, "step": 61520, "train_runtime": 598236.8218, "train_tokens_per_second": 29246.825 }, { "epoch": 2.177051659969881, "grad_norm": 0.60546875, "learning_rate": 1.8695148860631327e-05, "loss": 0.3853722095489502, "num_input_tokens_seen": 17499360960, "step": 61530, "train_runtime": 598331.1446, "train_tokens_per_second": 29246.95 }, { "epoch": 2.17740548023361, "grad_norm": 0.62109375, "learning_rate": 1.869384217461206e-05, "loss": 0.3896056652069092, "num_input_tokens_seen": 17502238720, "step": 61540, "train_runtime": 598433.1918, "train_tokens_per_second": 29246.771 }, { "epoch": 2.1777593004973386, "grad_norm": 0.61328125, "learning_rate": 1.8692535762544565e-05, "loss": 0.3850872993469238, "num_input_tokens_seen": 17505065216, "step": 61550, "train_runtime": 598531.1551, "train_tokens_per_second": 29246.707 }, { "epoch": 2.1781131207610676, "grad_norm": 0.609375, "learning_rate": 1.8691229624333126e-05, "loss": 0.38930888175964357, "num_input_tokens_seen": 17507923456, "step": 61560, "train_runtime": 598630.1993, "train_tokens_per_second": 29246.643 }, { "epoch": 2.178466941024796, "grad_norm": 0.6171875, "learning_rate": 1.8689923759882078e-05, "loss": 0.3874336004257202, "num_input_tokens_seen": 17510774400, "step": 61570, "train_runtime": 598725.3105, "train_tokens_per_second": 29246.758 }, { "epoch": 2.178820761288525, "grad_norm": 0.60546875, "learning_rate": 1.868861816909581e-05, "loss": 0.38097991943359377, "num_input_tokens_seen": 17513635840, "step": 61580, "train_runtime": 598821.0504, "train_tokens_per_second": 29246.861 }, { "epoch": 2.1791745815522536, "grad_norm": 0.60546875, "learning_rate": 1.8687312851878747e-05, "loss": 0.38545732498168944, "num_input_tokens_seen": 17516477248, "step": 61590, "train_runtime": 598916.7381, "train_tokens_per_second": 29246.932 }, { "epoch": 2.1795284018159826, "grad_norm": 0.6171875, "learning_rate": 1.868600780813536e-05, "loss": 0.38284945487976074, "num_input_tokens_seen": 17519313344, "step": 61600, "train_runtime": 599011.0879, "train_tokens_per_second": 29247.06 }, { "epoch": 2.179882222079711, "grad_norm": 0.5625, "learning_rate": 1.8684703037770177e-05, "loss": 0.3869945049285889, "num_input_tokens_seen": 17522141632, "step": 61610, "train_runtime": 599107.534, "train_tokens_per_second": 29247.073 }, { "epoch": 2.18023604234344, "grad_norm": 0.60546875, "learning_rate": 1.868339854068776e-05, "loss": 0.38443565368652344, "num_input_tokens_seen": 17525007360, "step": 61620, "train_runtime": 599206.5513, "train_tokens_per_second": 29247.022 }, { "epoch": 2.1805898626071687, "grad_norm": 0.6015625, "learning_rate": 1.8682094316792737e-05, "loss": 0.38622493743896485, "num_input_tokens_seen": 17527868992, "step": 61630, "train_runtime": 599304.6675, "train_tokens_per_second": 29247.009 }, { "epoch": 2.1809436828708977, "grad_norm": 0.62109375, "learning_rate": 1.868079036598975e-05, "loss": 0.3877041578292847, "num_input_tokens_seen": 17530742272, "step": 61640, "train_runtime": 599405.3695, "train_tokens_per_second": 29246.889 }, { "epoch": 2.1812975031346262, "grad_norm": 0.59765625, "learning_rate": 1.8679486688183527e-05, "loss": 0.39104065895080564, "num_input_tokens_seen": 17533594048, "step": 61650, "train_runtime": 599503.877, "train_tokens_per_second": 29246.84 }, { "epoch": 2.181651323398355, "grad_norm": 0.59765625, "learning_rate": 1.8678183283278816e-05, "loss": 0.38863177299499513, "num_input_tokens_seen": 17536464256, "step": 61660, "train_runtime": 599601.7379, "train_tokens_per_second": 29246.854 }, { "epoch": 2.1820051436620838, "grad_norm": 0.6015625, "learning_rate": 1.8676880151180415e-05, "loss": 0.38354628086090087, "num_input_tokens_seen": 17539378816, "step": 61670, "train_runtime": 599701.7234, "train_tokens_per_second": 29246.837 }, { "epoch": 2.1823589639258127, "grad_norm": 0.609375, "learning_rate": 1.8675577291793172e-05, "loss": 0.38083949089050295, "num_input_tokens_seen": 17542225280, "step": 61680, "train_runtime": 599797.7277, "train_tokens_per_second": 29246.902 }, { "epoch": 2.1827127841895413, "grad_norm": 0.59375, "learning_rate": 1.867427470502199e-05, "loss": 0.3875278472900391, "num_input_tokens_seen": 17545053888, "step": 61690, "train_runtime": 599894.651, "train_tokens_per_second": 29246.892 }, { "epoch": 2.1830666044532703, "grad_norm": 0.609375, "learning_rate": 1.86729723907718e-05, "loss": 0.3849807262420654, "num_input_tokens_seen": 17547918080, "step": 61700, "train_runtime": 599992.0655, "train_tokens_per_second": 29246.917 }, { "epoch": 2.1834204247169993, "grad_norm": 0.6171875, "learning_rate": 1.8671670348947597e-05, "loss": 0.3840256452560425, "num_input_tokens_seen": 17550791040, "step": 61710, "train_runtime": 600090.3697, "train_tokens_per_second": 29246.913 }, { "epoch": 2.183774244980728, "grad_norm": 0.6171875, "learning_rate": 1.8670368579454405e-05, "loss": 0.38533930778503417, "num_input_tokens_seen": 17553607104, "step": 61720, "train_runtime": 600187.5026, "train_tokens_per_second": 29246.872 }, { "epoch": 2.184128065244457, "grad_norm": 0.609375, "learning_rate": 1.8669067082197318e-05, "loss": 0.3853305339813232, "num_input_tokens_seen": 17556536064, "step": 61730, "train_runtime": 600289.9262, "train_tokens_per_second": 29246.761 }, { "epoch": 2.1844818855081853, "grad_norm": 0.65234375, "learning_rate": 1.866776585708145e-05, "loss": 0.3883723258972168, "num_input_tokens_seen": 17559385856, "step": 61740, "train_runtime": 600383.7392, "train_tokens_per_second": 29246.938 }, { "epoch": 2.1848357057719143, "grad_norm": 0.6015625, "learning_rate": 1.8666464904011983e-05, "loss": 0.3842418909072876, "num_input_tokens_seen": 17562246080, "step": 61750, "train_runtime": 600483.492, "train_tokens_per_second": 29246.842 }, { "epoch": 2.185189526035643, "grad_norm": 0.61328125, "learning_rate": 1.8665164222894125e-05, "loss": 0.38751270771026614, "num_input_tokens_seen": 17565140800, "step": 61760, "train_runtime": 600582.504, "train_tokens_per_second": 29246.841 }, { "epoch": 2.185543346299372, "grad_norm": 0.625, "learning_rate": 1.8663863813633152e-05, "loss": 0.3861790895462036, "num_input_tokens_seen": 17567945856, "step": 61770, "train_runtime": 600676.0565, "train_tokens_per_second": 29246.955 }, { "epoch": 2.1858971665631004, "grad_norm": 0.625, "learning_rate": 1.866256367613437e-05, "loss": 0.38616693019866943, "num_input_tokens_seen": 17570781184, "step": 61780, "train_runtime": 600773.0557, "train_tokens_per_second": 29246.953 }, { "epoch": 2.1862509868268294, "grad_norm": 0.609375, "learning_rate": 1.8661263810303138e-05, "loss": 0.38463492393493653, "num_input_tokens_seen": 17573646208, "step": 61790, "train_runtime": 600870.4557, "train_tokens_per_second": 29246.98 }, { "epoch": 2.186604807090558, "grad_norm": 0.61328125, "learning_rate": 1.8659964216044853e-05, "loss": 0.3852818012237549, "num_input_tokens_seen": 17576526592, "step": 61800, "train_runtime": 600969.5101, "train_tokens_per_second": 29246.952 }, { "epoch": 2.186958627354287, "grad_norm": 0.61328125, "learning_rate": 1.8658664893264978e-05, "loss": 0.390532922744751, "num_input_tokens_seen": 17579403136, "step": 61810, "train_runtime": 601071.3939, "train_tokens_per_second": 29246.781 }, { "epoch": 2.1873124476180155, "grad_norm": 0.58984375, "learning_rate": 1.8657365841868997e-05, "loss": 0.3843573570251465, "num_input_tokens_seen": 17582272640, "step": 61820, "train_runtime": 601168.5734, "train_tokens_per_second": 29246.826 }, { "epoch": 2.1876662678817445, "grad_norm": 0.60546875, "learning_rate": 1.865606706176246e-05, "loss": 0.388136625289917, "num_input_tokens_seen": 17585155648, "step": 61830, "train_runtime": 601267.5946, "train_tokens_per_second": 29246.804 }, { "epoch": 2.188020088145473, "grad_norm": 0.609375, "learning_rate": 1.8654768552850943e-05, "loss": 0.3837641716003418, "num_input_tokens_seen": 17588005056, "step": 61840, "train_runtime": 601363.2962, "train_tokens_per_second": 29246.888 }, { "epoch": 2.188373908409202, "grad_norm": 0.6328125, "learning_rate": 1.8653470315040096e-05, "loss": 0.38420701026916504, "num_input_tokens_seen": 17590807744, "step": 61850, "train_runtime": 601457.8784, "train_tokens_per_second": 29246.949 }, { "epoch": 2.188727728672931, "grad_norm": 0.6015625, "learning_rate": 1.8652172348235588e-05, "loss": 0.38457636833190917, "num_input_tokens_seen": 17593702784, "step": 61860, "train_runtime": 601555.5593, "train_tokens_per_second": 29247.012 }, { "epoch": 2.1890815489366595, "grad_norm": 0.64453125, "learning_rate": 1.8650874652343146e-05, "loss": 0.38947651386260984, "num_input_tokens_seen": 17596551360, "step": 61870, "train_runtime": 601651.8834, "train_tokens_per_second": 29247.064 }, { "epoch": 2.1894353692003885, "grad_norm": 0.62109375, "learning_rate": 1.864957722726855e-05, "loss": 0.3834806442260742, "num_input_tokens_seen": 17599421888, "step": 61880, "train_runtime": 601751.389, "train_tokens_per_second": 29246.998 }, { "epoch": 2.189789189464117, "grad_norm": 0.61328125, "learning_rate": 1.8648280072917605e-05, "loss": 0.3866006851196289, "num_input_tokens_seen": 17602278592, "step": 61890, "train_runtime": 601846.6763, "train_tokens_per_second": 29247.114 }, { "epoch": 2.190143009727846, "grad_norm": 0.61328125, "learning_rate": 1.864698318919618e-05, "loss": 0.38844497203826905, "num_input_tokens_seen": 17605110528, "step": 61900, "train_runtime": 601942.0069, "train_tokens_per_second": 29247.187 }, { "epoch": 2.1904968299915746, "grad_norm": 0.62109375, "learning_rate": 1.8645686576010185e-05, "loss": 0.386997127532959, "num_input_tokens_seen": 17607923200, "step": 61910, "train_runtime": 602040.4114, "train_tokens_per_second": 29247.079 }, { "epoch": 2.1908506502553036, "grad_norm": 0.625, "learning_rate": 1.8644390233265576e-05, "loss": 0.3856661319732666, "num_input_tokens_seen": 17610732992, "step": 61920, "train_runtime": 602135.3385, "train_tokens_per_second": 29247.134 }, { "epoch": 2.191204470519032, "grad_norm": 0.62109375, "learning_rate": 1.8643094160868353e-05, "loss": 0.3890425682067871, "num_input_tokens_seen": 17613603008, "step": 61930, "train_runtime": 602232.1773, "train_tokens_per_second": 29247.197 }, { "epoch": 2.191558290782761, "grad_norm": 0.59375, "learning_rate": 1.864179835872456e-05, "loss": 0.3832890033721924, "num_input_tokens_seen": 17616494016, "step": 61940, "train_runtime": 602332.8183, "train_tokens_per_second": 29247.11 }, { "epoch": 2.1919121110464896, "grad_norm": 0.62890625, "learning_rate": 1.8640502826740292e-05, "loss": 0.3883743047714233, "num_input_tokens_seen": 17619335488, "step": 61950, "train_runtime": 602429.0226, "train_tokens_per_second": 29247.156 }, { "epoch": 2.1922659313102186, "grad_norm": 0.61328125, "learning_rate": 1.8639207564821686e-05, "loss": 0.38341598510742186, "num_input_tokens_seen": 17622172864, "step": 61960, "train_runtime": 602524.6057, "train_tokens_per_second": 29247.225 }, { "epoch": 2.192619751573947, "grad_norm": 0.609375, "learning_rate": 1.8637912572874924e-05, "loss": 0.3869826316833496, "num_input_tokens_seen": 17625011712, "step": 61970, "train_runtime": 602619.6093, "train_tokens_per_second": 29247.325 }, { "epoch": 2.192973571837676, "grad_norm": 0.625, "learning_rate": 1.863661785080624e-05, "loss": 0.3922722339630127, "num_input_tokens_seen": 17627814336, "step": 61980, "train_runtime": 602715.2134, "train_tokens_per_second": 29247.336 }, { "epoch": 2.1933273921014047, "grad_norm": 0.63671875, "learning_rate": 1.86353233985219e-05, "loss": 0.3880609035491943, "num_input_tokens_seen": 17630649280, "step": 61990, "train_runtime": 602813.6206, "train_tokens_per_second": 29247.264 }, { "epoch": 2.1936812123651337, "grad_norm": 0.609375, "learning_rate": 1.8634029215928235e-05, "loss": 0.38416998386383056, "num_input_tokens_seen": 17633497792, "step": 62000, "train_runtime": 602910.2793, "train_tokens_per_second": 29247.3 }, { "epoch": 2.1940350326288627, "grad_norm": 0.62890625, "learning_rate": 1.8632735302931604e-05, "loss": 0.38510818481445314, "num_input_tokens_seen": 17636320640, "step": 62010, "train_runtime": 603006.1169, "train_tokens_per_second": 29247.333 }, { "epoch": 2.1943888528925912, "grad_norm": 0.64453125, "learning_rate": 1.8631441659438417e-05, "loss": 0.3807917356491089, "num_input_tokens_seen": 17639196672, "step": 62020, "train_runtime": 603102.8197, "train_tokens_per_second": 29247.412 }, { "epoch": 2.19474267315632, "grad_norm": 0.61328125, "learning_rate": 1.863014828535514e-05, "loss": 0.38839921951293943, "num_input_tokens_seen": 17642081216, "step": 62030, "train_runtime": 603200.2926, "train_tokens_per_second": 29247.468 }, { "epoch": 2.1950964934200488, "grad_norm": 0.59765625, "learning_rate": 1.8628855180588262e-05, "loss": 0.38147544860839844, "num_input_tokens_seen": 17644976064, "step": 62040, "train_runtime": 603299.4058, "train_tokens_per_second": 29247.461 }, { "epoch": 2.1954503136837777, "grad_norm": 0.6328125, "learning_rate": 1.862756234504434e-05, "loss": 0.3902407646179199, "num_input_tokens_seen": 17647833216, "step": 62050, "train_runtime": 603395.9347, "train_tokens_per_second": 29247.518 }, { "epoch": 2.1958041339475063, "grad_norm": 0.61328125, "learning_rate": 1.8626269778629965e-05, "loss": 0.38625283241271974, "num_input_tokens_seen": 17650638208, "step": 62060, "train_runtime": 603490.1566, "train_tokens_per_second": 29247.599 }, { "epoch": 2.1961579542112353, "grad_norm": 0.63671875, "learning_rate": 1.8624977481251777e-05, "loss": 0.3855902671813965, "num_input_tokens_seen": 17653478400, "step": 62070, "train_runtime": 603587.1114, "train_tokens_per_second": 29247.607 }, { "epoch": 2.196511774474964, "grad_norm": 0.5859375, "learning_rate": 1.862368545281646e-05, "loss": 0.3816222667694092, "num_input_tokens_seen": 17656320896, "step": 62080, "train_runtime": 603682.9316, "train_tokens_per_second": 29247.673 }, { "epoch": 2.196865594738693, "grad_norm": 0.609375, "learning_rate": 1.8622393693230738e-05, "loss": 0.3865756273269653, "num_input_tokens_seen": 17659203712, "step": 62090, "train_runtime": 603783.9889, "train_tokens_per_second": 29247.552 }, { "epoch": 2.1972194150024213, "grad_norm": 0.6171875, "learning_rate": 1.8621102202401388e-05, "loss": 0.3871957302093506, "num_input_tokens_seen": 17662076288, "step": 62100, "train_runtime": 603882.0943, "train_tokens_per_second": 29247.558 }, { "epoch": 2.1975732352661503, "grad_norm": 0.609375, "learning_rate": 1.8619810980235236e-05, "loss": 0.38620591163635254, "num_input_tokens_seen": 17664887296, "step": 62110, "train_runtime": 603973.8743, "train_tokens_per_second": 29247.767 }, { "epoch": 2.197927055529879, "grad_norm": 0.64453125, "learning_rate": 1.861852002663913e-05, "loss": 0.3887690544128418, "num_input_tokens_seen": 17667683200, "step": 62120, "train_runtime": 604067.617, "train_tokens_per_second": 29247.857 }, { "epoch": 2.198280875793608, "grad_norm": 0.59375, "learning_rate": 1.8617229341520003e-05, "loss": 0.38804523944854735, "num_input_tokens_seen": 17670567744, "step": 62130, "train_runtime": 604164.1993, "train_tokens_per_second": 29247.956 }, { "epoch": 2.1986346960573364, "grad_norm": 0.58984375, "learning_rate": 1.861593892478479e-05, "loss": 0.3862619400024414, "num_input_tokens_seen": 17673351808, "step": 62140, "train_runtime": 604254.694, "train_tokens_per_second": 29248.183 }, { "epoch": 2.1989885163210654, "grad_norm": 0.64453125, "learning_rate": 1.861464877634051e-05, "loss": 0.38628759384155276, "num_input_tokens_seen": 17676174976, "step": 62150, "train_runtime": 604351.8363, "train_tokens_per_second": 29248.153 }, { "epoch": 2.199342336584794, "grad_norm": 0.609375, "learning_rate": 1.861335889609419e-05, "loss": 0.3862605571746826, "num_input_tokens_seen": 17679012096, "step": 62160, "train_runtime": 604450.0359, "train_tokens_per_second": 29248.095 }, { "epoch": 2.199696156848523, "grad_norm": 0.61328125, "learning_rate": 1.861206928395293e-05, "loss": 0.38453800678253175, "num_input_tokens_seen": 17681857024, "step": 62170, "train_runtime": 604548.7779, "train_tokens_per_second": 29248.024 }, { "epoch": 2.2000499771122515, "grad_norm": 0.609375, "learning_rate": 1.8610779939823866e-05, "loss": 0.3866212606430054, "num_input_tokens_seen": 17684691456, "step": 62180, "train_runtime": 604648.1554, "train_tokens_per_second": 29247.904 }, { "epoch": 2.2004037973759805, "grad_norm": 0.61328125, "learning_rate": 1.8609490863614178e-05, "loss": 0.39065597057342527, "num_input_tokens_seen": 17687516544, "step": 62190, "train_runtime": 604743.1645, "train_tokens_per_second": 29247.981 }, { "epoch": 2.2007576176397095, "grad_norm": 0.61328125, "learning_rate": 1.860820205523109e-05, "loss": 0.3849517583847046, "num_input_tokens_seen": 17690320320, "step": 62200, "train_runtime": 604837.9408, "train_tokens_per_second": 29248.033 }, { "epoch": 2.201111437903438, "grad_norm": 0.61328125, "learning_rate": 1.860691351458187e-05, "loss": 0.39128837585449217, "num_input_tokens_seen": 17693185216, "step": 62210, "train_runtime": 604937.7764, "train_tokens_per_second": 29247.942 }, { "epoch": 2.201465258167167, "grad_norm": 0.59765625, "learning_rate": 1.8605625241573843e-05, "loss": 0.3887389421463013, "num_input_tokens_seen": 17696017216, "step": 62220, "train_runtime": 605034.9224, "train_tokens_per_second": 29247.927 }, { "epoch": 2.2018190784308955, "grad_norm": 0.625, "learning_rate": 1.860433723611436e-05, "loss": 0.38534297943115237, "num_input_tokens_seen": 17698888960, "step": 62230, "train_runtime": 605131.8595, "train_tokens_per_second": 29247.987 }, { "epoch": 2.2021728986946245, "grad_norm": 0.62109375, "learning_rate": 1.860304949811083e-05, "loss": 0.37967557907104493, "num_input_tokens_seen": 17701728960, "step": 62240, "train_runtime": 605232.2659, "train_tokens_per_second": 29247.828 }, { "epoch": 2.202526718958353, "grad_norm": 0.64453125, "learning_rate": 1.8601762027470703e-05, "loss": 0.3878924369812012, "num_input_tokens_seen": 17704541120, "step": 62250, "train_runtime": 605329.6438, "train_tokens_per_second": 29247.768 }, { "epoch": 2.202880539222082, "grad_norm": 0.6015625, "learning_rate": 1.8600474824101473e-05, "loss": 0.38958141803741453, "num_input_tokens_seen": 17707415232, "step": 62260, "train_runtime": 605428.2997, "train_tokens_per_second": 29247.749 }, { "epoch": 2.2032343594858106, "grad_norm": 0.6484375, "learning_rate": 1.8599187887910684e-05, "loss": 0.38509092330932615, "num_input_tokens_seen": 17710243136, "step": 62270, "train_runtime": 605525.9695, "train_tokens_per_second": 29247.702 }, { "epoch": 2.2035881797495396, "grad_norm": 0.63671875, "learning_rate": 1.8597901218805913e-05, "loss": 0.392694878578186, "num_input_tokens_seen": 17713073152, "step": 62280, "train_runtime": 605621.957, "train_tokens_per_second": 29247.739 }, { "epoch": 2.203942000013268, "grad_norm": 0.62109375, "learning_rate": 1.8596614816694798e-05, "loss": 0.38522379398345946, "num_input_tokens_seen": 17715918400, "step": 62290, "train_runtime": 605718.6219, "train_tokens_per_second": 29247.769 }, { "epoch": 2.204295820276997, "grad_norm": 0.62890625, "learning_rate": 1.8595328681485004e-05, "loss": 0.38733806610107424, "num_input_tokens_seen": 17718743104, "step": 62300, "train_runtime": 605815.5704, "train_tokens_per_second": 29247.751 }, { "epoch": 2.2046496405407257, "grad_norm": 0.62109375, "learning_rate": 1.8594042813084256e-05, "loss": 0.3868782758712769, "num_input_tokens_seen": 17721597248, "step": 62310, "train_runtime": 605915.173, "train_tokens_per_second": 29247.654 }, { "epoch": 2.2050034608044546, "grad_norm": 0.6171875, "learning_rate": 1.859275721140032e-05, "loss": 0.3843999862670898, "num_input_tokens_seen": 17724442304, "step": 62320, "train_runtime": 606012.1567, "train_tokens_per_second": 29247.668 }, { "epoch": 2.205357281068183, "grad_norm": 0.58203125, "learning_rate": 1.8591471876341e-05, "loss": 0.3873064279556274, "num_input_tokens_seen": 17727305152, "step": 62330, "train_runtime": 606107.481, "train_tokens_per_second": 29247.791 }, { "epoch": 2.205711101331912, "grad_norm": 0.59765625, "learning_rate": 1.859018680781414e-05, "loss": 0.38848042488098145, "num_input_tokens_seen": 17730153856, "step": 62340, "train_runtime": 606203.4464, "train_tokens_per_second": 29247.861 }, { "epoch": 2.206064921595641, "grad_norm": 0.62109375, "learning_rate": 1.8588902005727657e-05, "loss": 0.3906503677368164, "num_input_tokens_seen": 17732989184, "step": 62350, "train_runtime": 606298.5508, "train_tokens_per_second": 29247.949 }, { "epoch": 2.2064187418593697, "grad_norm": 0.62109375, "learning_rate": 1.8587617469989476e-05, "loss": 0.38793971538543703, "num_input_tokens_seen": 17735848512, "step": 62360, "train_runtime": 606398.6225, "train_tokens_per_second": 29247.838 }, { "epoch": 2.2067725621230987, "grad_norm": 0.62109375, "learning_rate": 1.8586333200507588e-05, "loss": 0.3845386981964111, "num_input_tokens_seen": 17738637504, "step": 62370, "train_runtime": 606493.5293, "train_tokens_per_second": 29247.859 }, { "epoch": 2.2071263823868272, "grad_norm": 0.60546875, "learning_rate": 1.858504919719003e-05, "loss": 0.3884584903717041, "num_input_tokens_seen": 17741497344, "step": 62380, "train_runtime": 606591.6658, "train_tokens_per_second": 29247.842 }, { "epoch": 2.2074802026505562, "grad_norm": 0.6328125, "learning_rate": 1.858376545994487e-05, "loss": 0.3864442348480225, "num_input_tokens_seen": 17744365440, "step": 62390, "train_runtime": 606690.8469, "train_tokens_per_second": 29247.788 }, { "epoch": 2.2078340229142848, "grad_norm": 0.62109375, "learning_rate": 1.858248198868023e-05, "loss": 0.3872101068496704, "num_input_tokens_seen": 17747151168, "step": 62400, "train_runtime": 606785.3896, "train_tokens_per_second": 29247.822 }, { "epoch": 2.2081878431780138, "grad_norm": 0.59375, "learning_rate": 1.8581198783304274e-05, "loss": 0.38182380199432375, "num_input_tokens_seen": 17749970624, "step": 62410, "train_runtime": 606880.3499, "train_tokens_per_second": 29247.891 }, { "epoch": 2.2085416634417423, "grad_norm": 0.62890625, "learning_rate": 1.8579915843725208e-05, "loss": 0.3883842468261719, "num_input_tokens_seen": 17752786432, "step": 62420, "train_runtime": 606978.4378, "train_tokens_per_second": 29247.804 }, { "epoch": 2.2088954837054713, "grad_norm": 0.6015625, "learning_rate": 1.857863316985129e-05, "loss": 0.3855446815490723, "num_input_tokens_seen": 17755608000, "step": 62430, "train_runtime": 607071.7665, "train_tokens_per_second": 29247.955 }, { "epoch": 2.2092493039692, "grad_norm": 0.59765625, "learning_rate": 1.857735076159082e-05, "loss": 0.3832533359527588, "num_input_tokens_seen": 17758458496, "step": 62440, "train_runtime": 607170.0545, "train_tokens_per_second": 29247.916 }, { "epoch": 2.209603124232929, "grad_norm": 0.61328125, "learning_rate": 1.8576068618852123e-05, "loss": 0.3876873254776001, "num_input_tokens_seen": 17761298176, "step": 62450, "train_runtime": 607268.5017, "train_tokens_per_second": 29247.85 }, { "epoch": 2.2099569444966574, "grad_norm": 0.59765625, "learning_rate": 1.8574786741543605e-05, "loss": 0.38634462356567384, "num_input_tokens_seen": 17764157248, "step": 62460, "train_runtime": 607367.0004, "train_tokens_per_second": 29247.814 }, { "epoch": 2.2103107647603863, "grad_norm": 0.63671875, "learning_rate": 1.8573505129573684e-05, "loss": 0.38374159336090086, "num_input_tokens_seen": 17766932928, "step": 62470, "train_runtime": 607459.2752, "train_tokens_per_second": 29247.941 }, { "epoch": 2.210664585024115, "grad_norm": 0.61328125, "learning_rate": 1.857222378285084e-05, "loss": 0.3854056835174561, "num_input_tokens_seen": 17769756160, "step": 62480, "train_runtime": 607554.1835, "train_tokens_per_second": 29248.019 }, { "epoch": 2.211018405287844, "grad_norm": 0.59765625, "learning_rate": 1.8570942701283585e-05, "loss": 0.38499021530151367, "num_input_tokens_seen": 17772630336, "step": 62490, "train_runtime": 607652.1745, "train_tokens_per_second": 29248.032 }, { "epoch": 2.2113722255515724, "grad_norm": 0.59765625, "learning_rate": 1.8569661884780485e-05, "loss": 0.38618247509002684, "num_input_tokens_seen": 17775517248, "step": 62500, "train_runtime": 607752.4337, "train_tokens_per_second": 29247.957 }, { "epoch": 2.2117260458153014, "grad_norm": 0.61328125, "learning_rate": 1.8568381333250152e-05, "loss": 0.3884061098098755, "num_input_tokens_seen": 17778377984, "step": 62510, "train_runtime": 607849.1252, "train_tokens_per_second": 29248.011 }, { "epoch": 2.21207986607903, "grad_norm": 0.625, "learning_rate": 1.856710104660123e-05, "loss": 0.38503437042236327, "num_input_tokens_seen": 17781199488, "step": 62520, "train_runtime": 607946.0832, "train_tokens_per_second": 29247.988 }, { "epoch": 2.212433686342759, "grad_norm": 0.625, "learning_rate": 1.8565821024742414e-05, "loss": 0.39023537635803224, "num_input_tokens_seen": 17784016896, "step": 62530, "train_runtime": 608041.5571, "train_tokens_per_second": 29248.029 }, { "epoch": 2.212787506606488, "grad_norm": 0.62890625, "learning_rate": 1.856454126758245e-05, "loss": 0.3851016521453857, "num_input_tokens_seen": 17786886592, "step": 62540, "train_runtime": 608140.767, "train_tokens_per_second": 29247.976 }, { "epoch": 2.2131413268702165, "grad_norm": 0.62109375, "learning_rate": 1.8563261775030108e-05, "loss": 0.3857923984527588, "num_input_tokens_seen": 17789750720, "step": 62550, "train_runtime": 608239.8742, "train_tokens_per_second": 29247.919 }, { "epoch": 2.2134951471339455, "grad_norm": 0.578125, "learning_rate": 1.856198254699423e-05, "loss": 0.38740196228027346, "num_input_tokens_seen": 17792588096, "step": 62560, "train_runtime": 608338.613, "train_tokens_per_second": 29247.836 }, { "epoch": 2.213848967397674, "grad_norm": 0.62109375, "learning_rate": 1.8560703583383675e-05, "loss": 0.38474035263061523, "num_input_tokens_seen": 17795441536, "step": 62570, "train_runtime": 608434.9886, "train_tokens_per_second": 29247.893 }, { "epoch": 2.214202787661403, "grad_norm": 0.62109375, "learning_rate": 1.855942488410737e-05, "loss": 0.38535232543945314, "num_input_tokens_seen": 17798296512, "step": 62580, "train_runtime": 608532.7341, "train_tokens_per_second": 29247.887 }, { "epoch": 2.2145566079251315, "grad_norm": 0.61328125, "learning_rate": 1.855814644907426e-05, "loss": 0.3838515281677246, "num_input_tokens_seen": 17801200640, "step": 62590, "train_runtime": 608634.6649, "train_tokens_per_second": 29247.76 }, { "epoch": 2.2149104281888605, "grad_norm": 0.625, "learning_rate": 1.855686827819336e-05, "loss": 0.3851050138473511, "num_input_tokens_seen": 17804031872, "step": 62600, "train_runtime": 608731.584, "train_tokens_per_second": 29247.754 }, { "epoch": 2.215264248452589, "grad_norm": 0.61328125, "learning_rate": 1.855559037137371e-05, "loss": 0.3896501064300537, "num_input_tokens_seen": 17806885504, "step": 62610, "train_runtime": 608828.1516, "train_tokens_per_second": 29247.802 }, { "epoch": 2.215618068716318, "grad_norm": 0.64453125, "learning_rate": 1.85543127285244e-05, "loss": 0.38946242332458497, "num_input_tokens_seen": 17809684032, "step": 62620, "train_runtime": 608924.3744, "train_tokens_per_second": 29247.777 }, { "epoch": 2.2159718889800466, "grad_norm": 0.609375, "learning_rate": 1.8553035349554565e-05, "loss": 0.38803634643554685, "num_input_tokens_seen": 17812522176, "step": 62630, "train_runtime": 609019.8604, "train_tokens_per_second": 29247.851 }, { "epoch": 2.2163257092437756, "grad_norm": 0.6328125, "learning_rate": 1.855175823437339e-05, "loss": 0.38423309326171873, "num_input_tokens_seen": 17815373440, "step": 62640, "train_runtime": 609117.5216, "train_tokens_per_second": 29247.843 }, { "epoch": 2.216679529507504, "grad_norm": 0.58984375, "learning_rate": 1.8550481382890086e-05, "loss": 0.38359885215759276, "num_input_tokens_seen": 17818197824, "step": 62650, "train_runtime": 609211.9786, "train_tokens_per_second": 29247.944 }, { "epoch": 2.217033349771233, "grad_norm": 0.60546875, "learning_rate": 1.8549204795013926e-05, "loss": 0.389111852645874, "num_input_tokens_seen": 17821069632, "step": 62660, "train_runtime": 609310.1439, "train_tokens_per_second": 29247.945 }, { "epoch": 2.2173871700349617, "grad_norm": 0.61328125, "learning_rate": 1.8547928470654215e-05, "loss": 0.3860340118408203, "num_input_tokens_seen": 17823951168, "step": 62670, "train_runtime": 609411.3084, "train_tokens_per_second": 29247.818 }, { "epoch": 2.2177409902986907, "grad_norm": 0.6015625, "learning_rate": 1.854665240972031e-05, "loss": 0.3835591793060303, "num_input_tokens_seen": 17826824576, "step": 62680, "train_runtime": 609509.8536, "train_tokens_per_second": 29247.804 }, { "epoch": 2.2180948105624196, "grad_norm": 0.625, "learning_rate": 1.8545376612121605e-05, "loss": 0.3858494281768799, "num_input_tokens_seen": 17829648384, "step": 62690, "train_runtime": 609607.5202, "train_tokens_per_second": 29247.75 }, { "epoch": 2.218448630826148, "grad_norm": 0.6328125, "learning_rate": 1.854410107776754e-05, "loss": 0.3890784740447998, "num_input_tokens_seen": 17832494912, "step": 62700, "train_runtime": 609704.5337, "train_tokens_per_second": 29247.765 }, { "epoch": 2.218802451089877, "grad_norm": 0.63671875, "learning_rate": 1.8542825806567598e-05, "loss": 0.387264347076416, "num_input_tokens_seen": 17835344064, "step": 62710, "train_runtime": 609800.2778, "train_tokens_per_second": 29247.845 }, { "epoch": 2.2191562713536057, "grad_norm": 0.6171875, "learning_rate": 1.854155079843131e-05, "loss": 0.38875930309295653, "num_input_tokens_seen": 17838160576, "step": 62720, "train_runtime": 609895.4197, "train_tokens_per_second": 29247.901 }, { "epoch": 2.2195100916173347, "grad_norm": 0.625, "learning_rate": 1.8540276053268246e-05, "loss": 0.38609349727630615, "num_input_tokens_seen": 17840954304, "step": 62730, "train_runtime": 609991.6282, "train_tokens_per_second": 29247.867 }, { "epoch": 2.2198639118810632, "grad_norm": 0.62890625, "learning_rate": 1.8539001570988016e-05, "loss": 0.38794708251953125, "num_input_tokens_seen": 17843745280, "step": 62740, "train_runtime": 610086.7993, "train_tokens_per_second": 29247.88 }, { "epoch": 2.2202177321447922, "grad_norm": 0.64453125, "learning_rate": 1.8537727351500283e-05, "loss": 0.38756680488586426, "num_input_tokens_seen": 17846575936, "step": 62750, "train_runtime": 610183.5299, "train_tokens_per_second": 29247.882 }, { "epoch": 2.2205715524085208, "grad_norm": 0.58984375, "learning_rate": 1.8536453394714744e-05, "loss": 0.3864884376525879, "num_input_tokens_seen": 17849360512, "step": 62760, "train_runtime": 610276.7602, "train_tokens_per_second": 29247.977 }, { "epoch": 2.2209253726722498, "grad_norm": 0.60546875, "learning_rate": 1.8535179700541148e-05, "loss": 0.38657164573669434, "num_input_tokens_seen": 17852226816, "step": 62770, "train_runtime": 610375.875, "train_tokens_per_second": 29247.923 }, { "epoch": 2.2212791929359783, "grad_norm": 0.6171875, "learning_rate": 1.853390626888928e-05, "loss": 0.3843152284622192, "num_input_tokens_seen": 17855051712, "step": 62780, "train_runtime": 610474.2793, "train_tokens_per_second": 29247.836 }, { "epoch": 2.2216330131997073, "grad_norm": 0.640625, "learning_rate": 1.8532633099668977e-05, "loss": 0.38683643341064455, "num_input_tokens_seen": 17857865280, "step": 62790, "train_runtime": 610569.9174, "train_tokens_per_second": 29247.863 }, { "epoch": 2.221986833463436, "grad_norm": 0.625, "learning_rate": 1.8531360192790107e-05, "loss": 0.3838510990142822, "num_input_tokens_seen": 17860658048, "step": 62800, "train_runtime": 610662.4757, "train_tokens_per_second": 29248.003 }, { "epoch": 2.222340653727165, "grad_norm": 0.62890625, "learning_rate": 1.853008754816259e-05, "loss": 0.38716635704040525, "num_input_tokens_seen": 17863485696, "step": 62810, "train_runtime": 610758.7341, "train_tokens_per_second": 29248.023 }, { "epoch": 2.2226944739908934, "grad_norm": 0.62109375, "learning_rate": 1.852881516569639e-05, "loss": 0.38870112895965575, "num_input_tokens_seen": 17866356800, "step": 62820, "train_runtime": 610859.9269, "train_tokens_per_second": 29247.878 }, { "epoch": 2.2230482942546224, "grad_norm": 0.62109375, "learning_rate": 1.8527543045301513e-05, "loss": 0.38657517433166505, "num_input_tokens_seen": 17869209344, "step": 62830, "train_runtime": 610954.5554, "train_tokens_per_second": 29248.017 }, { "epoch": 2.223402114518351, "grad_norm": 0.62890625, "learning_rate": 1.8526271186888e-05, "loss": 0.3889434337615967, "num_input_tokens_seen": 17872057152, "step": 62840, "train_runtime": 611052.1161, "train_tokens_per_second": 29248.008 }, { "epoch": 2.22375593478208, "grad_norm": 0.62890625, "learning_rate": 1.852499959036595e-05, "loss": 0.38601605892181395, "num_input_tokens_seen": 17874869568, "step": 62850, "train_runtime": 611145.1393, "train_tokens_per_second": 29248.158 }, { "epoch": 2.2241097550458084, "grad_norm": 0.62109375, "learning_rate": 1.8523728255645494e-05, "loss": 0.38413076400756835, "num_input_tokens_seen": 17877708864, "step": 62860, "train_runtime": 611241.4438, "train_tokens_per_second": 29248.195 }, { "epoch": 2.2244635753095374, "grad_norm": 0.609375, "learning_rate": 1.8522457182636814e-05, "loss": 0.38504643440246583, "num_input_tokens_seen": 17880557632, "step": 62870, "train_runtime": 611339.6248, "train_tokens_per_second": 29248.157 }, { "epoch": 2.2248173955732664, "grad_norm": 0.6015625, "learning_rate": 1.8521186371250122e-05, "loss": 0.38976006507873534, "num_input_tokens_seen": 17883430784, "step": 62880, "train_runtime": 611434.1718, "train_tokens_per_second": 29248.334 }, { "epoch": 2.225171215836995, "grad_norm": 0.609375, "learning_rate": 1.851991582139569e-05, "loss": 0.38901619911193847, "num_input_tokens_seen": 17886279104, "step": 62890, "train_runtime": 611527.9339, "train_tokens_per_second": 29248.507 }, { "epoch": 2.225525036100724, "grad_norm": 0.6015625, "learning_rate": 1.8518645532983816e-05, "loss": 0.38570528030395507, "num_input_tokens_seen": 17889097344, "step": 62900, "train_runtime": 611624.0357, "train_tokens_per_second": 29248.519 }, { "epoch": 2.2258788563644525, "grad_norm": 0.625, "learning_rate": 1.851737550592486e-05, "loss": 0.38550467491149903, "num_input_tokens_seen": 17891929792, "step": 62910, "train_runtime": 611720.1888, "train_tokens_per_second": 29248.552 }, { "epoch": 2.2262326766281815, "grad_norm": 0.6171875, "learning_rate": 1.8516105740129215e-05, "loss": 0.38628244400024414, "num_input_tokens_seen": 17894842304, "step": 62920, "train_runtime": 611820.5967, "train_tokens_per_second": 29248.512 }, { "epoch": 2.22658649689191, "grad_norm": 0.65234375, "learning_rate": 1.8514836235507305e-05, "loss": 0.390250039100647, "num_input_tokens_seen": 17897694336, "step": 62930, "train_runtime": 611917.809, "train_tokens_per_second": 29248.527 }, { "epoch": 2.226940317155639, "grad_norm": 0.5859375, "learning_rate": 1.8513566991969618e-05, "loss": 0.3838039875030518, "num_input_tokens_seen": 17900512064, "step": 62940, "train_runtime": 612012.9569, "train_tokens_per_second": 29248.583 }, { "epoch": 2.2272941374193675, "grad_norm": 0.6015625, "learning_rate": 1.851229800942668e-05, "loss": 0.3902816534042358, "num_input_tokens_seen": 17903365056, "step": 62950, "train_runtime": 612108.2113, "train_tokens_per_second": 29248.693 }, { "epoch": 2.2276479576830965, "grad_norm": 0.59375, "learning_rate": 1.851102928778905e-05, "loss": 0.38694334030151367, "num_input_tokens_seen": 17906207488, "step": 62960, "train_runtime": 612204.7139, "train_tokens_per_second": 29248.725 }, { "epoch": 2.228001777946825, "grad_norm": 0.63671875, "learning_rate": 1.8509760826967337e-05, "loss": 0.38334312438964846, "num_input_tokens_seen": 17909064768, "step": 62970, "train_runtime": 612302.7836, "train_tokens_per_second": 29248.707 }, { "epoch": 2.228355598210554, "grad_norm": 0.62890625, "learning_rate": 1.850849262687219e-05, "loss": 0.38725640773773196, "num_input_tokens_seen": 17911911680, "step": 62980, "train_runtime": 612397.2952, "train_tokens_per_second": 29248.842 }, { "epoch": 2.2287094184742826, "grad_norm": 0.61328125, "learning_rate": 1.8507224687414308e-05, "loss": 0.38622047901153567, "num_input_tokens_seen": 17914744320, "step": 62990, "train_runtime": 612493.8376, "train_tokens_per_second": 29248.856 }, { "epoch": 2.2290632387380116, "grad_norm": 0.609375, "learning_rate": 1.8505957008504415e-05, "loss": 0.3843966007232666, "num_input_tokens_seen": 17917577600, "step": 63000, "train_runtime": 612588.1447, "train_tokens_per_second": 29248.979 }, { "epoch": 2.22941705900174, "grad_norm": 0.59375, "learning_rate": 1.8504689590053308e-05, "loss": 0.38288173675537107, "num_input_tokens_seen": 17920431744, "step": 63010, "train_runtime": 612687.612, "train_tokens_per_second": 29248.889 }, { "epoch": 2.229770879265469, "grad_norm": 0.61328125, "learning_rate": 1.8503422431971794e-05, "loss": 0.38563108444213867, "num_input_tokens_seen": 17923229248, "step": 63020, "train_runtime": 612784.4382, "train_tokens_per_second": 29248.832 }, { "epoch": 2.230124699529198, "grad_norm": 0.6015625, "learning_rate": 1.850215553417074e-05, "loss": 0.38161664009094237, "num_input_tokens_seen": 17926048128, "step": 63030, "train_runtime": 612879.0707, "train_tokens_per_second": 29248.915 }, { "epoch": 2.2304785197929267, "grad_norm": 0.6171875, "learning_rate": 1.8500888896561066e-05, "loss": 0.3875094413757324, "num_input_tokens_seen": 17928859264, "step": 63040, "train_runtime": 612975.8531, "train_tokens_per_second": 29248.883 }, { "epoch": 2.2308323400566556, "grad_norm": 0.73828125, "learning_rate": 1.8499622519053708e-05, "loss": 0.38614673614501954, "num_input_tokens_seen": 17931673024, "step": 63050, "train_runtime": 613071.8507, "train_tokens_per_second": 29248.893 }, { "epoch": 2.231186160320384, "grad_norm": 0.62109375, "learning_rate": 1.8498356401559667e-05, "loss": 0.3868428707122803, "num_input_tokens_seen": 17934523840, "step": 63060, "train_runtime": 613169.0365, "train_tokens_per_second": 29248.907 }, { "epoch": 2.231539980584113, "grad_norm": 0.6171875, "learning_rate": 1.8497090543989972e-05, "loss": 0.38914055824279786, "num_input_tokens_seen": 17937379968, "step": 63070, "train_runtime": 613265.6988, "train_tokens_per_second": 29248.954 }, { "epoch": 2.2318938008478417, "grad_norm": 0.59765625, "learning_rate": 1.8495824946255704e-05, "loss": 0.38773550987243655, "num_input_tokens_seen": 17940220032, "step": 63080, "train_runtime": 613362.1471, "train_tokens_per_second": 29248.985 }, { "epoch": 2.2322476211115707, "grad_norm": 0.6328125, "learning_rate": 1.8494559608267985e-05, "loss": 0.38642306327819825, "num_input_tokens_seen": 17943035136, "step": 63090, "train_runtime": 613457.4787, "train_tokens_per_second": 29249.028 }, { "epoch": 2.2326014413752993, "grad_norm": 0.62890625, "learning_rate": 1.8493294529937976e-05, "loss": 0.3919111728668213, "num_input_tokens_seen": 17945947456, "step": 63100, "train_runtime": 613559.7063, "train_tokens_per_second": 29248.902 }, { "epoch": 2.2329552616390282, "grad_norm": 0.625, "learning_rate": 1.849202971117688e-05, "loss": 0.389154052734375, "num_input_tokens_seen": 17948796544, "step": 63110, "train_runtime": 613656.1787, "train_tokens_per_second": 29248.946 }, { "epoch": 2.233309081902757, "grad_norm": 0.6328125, "learning_rate": 1.8490765151895952e-05, "loss": 0.392545747756958, "num_input_tokens_seen": 17951693056, "step": 63120, "train_runtime": 613754.3092, "train_tokens_per_second": 29248.989 }, { "epoch": 2.2336629021664858, "grad_norm": 0.61328125, "learning_rate": 1.8489500852006484e-05, "loss": 0.3844566345214844, "num_input_tokens_seen": 17954511552, "step": 63130, "train_runtime": 613850.3295, "train_tokens_per_second": 29249.005 }, { "epoch": 2.2340167224302143, "grad_norm": 0.6171875, "learning_rate": 1.8488236811419795e-05, "loss": 0.3873509645462036, "num_input_tokens_seen": 17957332800, "step": 63140, "train_runtime": 613943.4574, "train_tokens_per_second": 29249.164 }, { "epoch": 2.2343705426939433, "grad_norm": 0.65625, "learning_rate": 1.8486973030047278e-05, "loss": 0.38297343254089355, "num_input_tokens_seen": 17960199232, "step": 63150, "train_runtime": 614041.9337, "train_tokens_per_second": 29249.141 }, { "epoch": 2.234724362957672, "grad_norm": 0.58203125, "learning_rate": 1.8485709507800337e-05, "loss": 0.38829975128173827, "num_input_tokens_seen": 17963042176, "step": 63160, "train_runtime": 614140.0573, "train_tokens_per_second": 29249.097 }, { "epoch": 2.235078183221401, "grad_norm": 0.62109375, "learning_rate": 1.8484446244590438e-05, "loss": 0.38270604610443115, "num_input_tokens_seen": 17965905216, "step": 63170, "train_runtime": 614242.3739, "train_tokens_per_second": 29248.886 }, { "epoch": 2.23543200348513, "grad_norm": 0.6015625, "learning_rate": 1.848318324032909e-05, "loss": 0.38156564235687257, "num_input_tokens_seen": 17968737600, "step": 63180, "train_runtime": 614339.7398, "train_tokens_per_second": 29248.861 }, { "epoch": 2.2357858237488584, "grad_norm": 0.625, "learning_rate": 1.8481920494927827e-05, "loss": 0.38745296001434326, "num_input_tokens_seen": 17971527744, "step": 63190, "train_runtime": 614434.6463, "train_tokens_per_second": 29248.884 }, { "epoch": 2.2361396440125874, "grad_norm": 0.625, "learning_rate": 1.8480658008298242e-05, "loss": 0.3892880916595459, "num_input_tokens_seen": 17974361408, "step": 63200, "train_runtime": 614534.984, "train_tokens_per_second": 29248.72 }, { "epoch": 2.236493464276316, "grad_norm": 0.6171875, "learning_rate": 1.8479395780351963e-05, "loss": 0.3830745697021484, "num_input_tokens_seen": 17977231808, "step": 63210, "train_runtime": 614632.0735, "train_tokens_per_second": 29248.769 }, { "epoch": 2.236847284540045, "grad_norm": 0.6015625, "learning_rate": 1.8478133811000662e-05, "loss": 0.3844662427902222, "num_input_tokens_seen": 17980107904, "step": 63220, "train_runtime": 614730.1412, "train_tokens_per_second": 29248.782 }, { "epoch": 2.2372011048037734, "grad_norm": 0.609375, "learning_rate": 1.8476872100156055e-05, "loss": 0.3875835657119751, "num_input_tokens_seen": 17982972992, "step": 63230, "train_runtime": 614826.6736, "train_tokens_per_second": 29248.85 }, { "epoch": 2.2375549250675024, "grad_norm": 0.6484375, "learning_rate": 1.8475610647729893e-05, "loss": 0.38609728813171384, "num_input_tokens_seen": 17985832064, "step": 63240, "train_runtime": 614925.7825, "train_tokens_per_second": 29248.785 }, { "epoch": 2.237908745331231, "grad_norm": 0.60546875, "learning_rate": 1.8474349453633978e-05, "loss": 0.38477334976196287, "num_input_tokens_seen": 17988681024, "step": 63250, "train_runtime": 615024.0059, "train_tokens_per_second": 29248.746 }, { "epoch": 2.23826256559496, "grad_norm": 0.625, "learning_rate": 1.8473088517780156e-05, "loss": 0.3886557102203369, "num_input_tokens_seen": 17991489792, "step": 63260, "train_runtime": 615118.4382, "train_tokens_per_second": 29248.822 }, { "epoch": 2.2386163858586885, "grad_norm": 0.6328125, "learning_rate": 1.84718278400803e-05, "loss": 0.38866229057312013, "num_input_tokens_seen": 17994283456, "step": 63270, "train_runtime": 615212.4775, "train_tokens_per_second": 29248.892 }, { "epoch": 2.2389702061224175, "grad_norm": 0.62890625, "learning_rate": 1.847056742044634e-05, "loss": 0.3846184730529785, "num_input_tokens_seen": 17997138560, "step": 63280, "train_runtime": 615310.5759, "train_tokens_per_second": 29248.869 }, { "epoch": 2.239324026386146, "grad_norm": 0.6171875, "learning_rate": 1.8469307258790238e-05, "loss": 0.3878648281097412, "num_input_tokens_seen": 18000014592, "step": 63290, "train_runtime": 615412.7538, "train_tokens_per_second": 29248.686 }, { "epoch": 2.239677846649875, "grad_norm": 0.62890625, "learning_rate": 1.8468047355024013e-05, "loss": 0.3866232395172119, "num_input_tokens_seen": 18002834944, "step": 63300, "train_runtime": 615509.0316, "train_tokens_per_second": 29248.693 }, { "epoch": 2.2400316669136036, "grad_norm": 0.6171875, "learning_rate": 1.8466787709059705e-05, "loss": 0.39187049865722656, "num_input_tokens_seen": 18005689024, "step": 63310, "train_runtime": 615607.4936, "train_tokens_per_second": 29248.651 }, { "epoch": 2.2403854871773325, "grad_norm": 0.625, "learning_rate": 1.846552832080941e-05, "loss": 0.39432082176208494, "num_input_tokens_seen": 18008566912, "step": 63320, "train_runtime": 615708.9379, "train_tokens_per_second": 29248.507 }, { "epoch": 2.240739307441061, "grad_norm": 0.609375, "learning_rate": 1.8464269190185267e-05, "loss": 0.3885178804397583, "num_input_tokens_seen": 18011385536, "step": 63330, "train_runtime": 615804.3236, "train_tokens_per_second": 29248.553 }, { "epoch": 2.24109312770479, "grad_norm": 0.640625, "learning_rate": 1.8463010317099445e-05, "loss": 0.386199951171875, "num_input_tokens_seen": 18014273600, "step": 63340, "train_runtime": 615903.306, "train_tokens_per_second": 29248.542 }, { "epoch": 2.2414469479685186, "grad_norm": 0.62890625, "learning_rate": 1.8461751701464168e-05, "loss": 0.39035494327545167, "num_input_tokens_seen": 18017111104, "step": 63350, "train_runtime": 615997.6359, "train_tokens_per_second": 29248.669 }, { "epoch": 2.2418007682322476, "grad_norm": 0.62109375, "learning_rate": 1.8460493343191697e-05, "loss": 0.3860316276550293, "num_input_tokens_seen": 18019982592, "step": 63360, "train_runtime": 616096.8328, "train_tokens_per_second": 29248.621 }, { "epoch": 2.2421545884959766, "grad_norm": 0.59375, "learning_rate": 1.8459235242194336e-05, "loss": 0.3914928913116455, "num_input_tokens_seen": 18022809728, "step": 63370, "train_runtime": 616193.5266, "train_tokens_per_second": 29248.619 }, { "epoch": 2.242508408759705, "grad_norm": 0.62109375, "learning_rate": 1.8457977398384422e-05, "loss": 0.3819234848022461, "num_input_tokens_seen": 18025575296, "step": 63380, "train_runtime": 616288.094, "train_tokens_per_second": 29248.618 }, { "epoch": 2.242862229023434, "grad_norm": 0.58984375, "learning_rate": 1.8456719811674344e-05, "loss": 0.3863274097442627, "num_input_tokens_seen": 18028389056, "step": 63390, "train_runtime": 616382.6946, "train_tokens_per_second": 29248.694 }, { "epoch": 2.2432160492871627, "grad_norm": 0.60546875, "learning_rate": 1.8455462481976532e-05, "loss": 0.3876702308654785, "num_input_tokens_seen": 18031265984, "step": 63400, "train_runtime": 616480.2311, "train_tokens_per_second": 29248.733 }, { "epoch": 2.2435698695508917, "grad_norm": 0.6171875, "learning_rate": 1.8454205409203457e-05, "loss": 0.3863736629486084, "num_input_tokens_seen": 18034121600, "step": 63410, "train_runtime": 616581.6094, "train_tokens_per_second": 29248.556 }, { "epoch": 2.24392368981462, "grad_norm": 0.63671875, "learning_rate": 1.8452948593267625e-05, "loss": 0.38455352783203123, "num_input_tokens_seen": 18037002880, "step": 63420, "train_runtime": 616681.6374, "train_tokens_per_second": 29248.484 }, { "epoch": 2.244277510078349, "grad_norm": 0.5703125, "learning_rate": 1.845169203408159e-05, "loss": 0.3856102466583252, "num_input_tokens_seen": 18039850752, "step": 63430, "train_runtime": 616779.0066, "train_tokens_per_second": 29248.484 }, { "epoch": 2.2446313303420777, "grad_norm": 0.62890625, "learning_rate": 1.845043573155795e-05, "loss": 0.38246469497680663, "num_input_tokens_seen": 18042645056, "step": 63440, "train_runtime": 616876.221, "train_tokens_per_second": 29248.404 }, { "epoch": 2.2449851506058067, "grad_norm": 0.60546875, "learning_rate": 1.8449179685609337e-05, "loss": 0.38494458198547366, "num_input_tokens_seen": 18045479104, "step": 63450, "train_runtime": 616970.7627, "train_tokens_per_second": 29248.516 }, { "epoch": 2.2453389708695353, "grad_norm": 0.6328125, "learning_rate": 1.8447923896148434e-05, "loss": 0.38051161766052244, "num_input_tokens_seen": 18048314304, "step": 63460, "train_runtime": 617066.7148, "train_tokens_per_second": 29248.562 }, { "epoch": 2.2456927911332643, "grad_norm": 0.69921875, "learning_rate": 1.8446668363087957e-05, "loss": 0.3884440422058105, "num_input_tokens_seen": 18051161152, "step": 63470, "train_runtime": 617166.1079, "train_tokens_per_second": 29248.465 }, { "epoch": 2.246046611396993, "grad_norm": 0.6171875, "learning_rate": 1.8445413086340664e-05, "loss": 0.38826732635498046, "num_input_tokens_seen": 18054002368, "step": 63480, "train_runtime": 617262.593, "train_tokens_per_second": 29248.496 }, { "epoch": 2.246400431660722, "grad_norm": 0.6171875, "learning_rate": 1.8444158065819366e-05, "loss": 0.3854444742202759, "num_input_tokens_seen": 18056809152, "step": 63490, "train_runtime": 617358.7415, "train_tokens_per_second": 29248.487 }, { "epoch": 2.2467542519244503, "grad_norm": 0.59375, "learning_rate": 1.8442903301436902e-05, "loss": 0.3874361991882324, "num_input_tokens_seen": 18059634944, "step": 63500, "train_runtime": 617457.3552, "train_tokens_per_second": 29248.392 }, { "epoch": 2.2471080721881793, "grad_norm": 0.625, "learning_rate": 1.844164879310616e-05, "loss": 0.3885998010635376, "num_input_tokens_seen": 18062452928, "step": 63510, "train_runtime": 617552.5647, "train_tokens_per_second": 29248.446 }, { "epoch": 2.2474618924519083, "grad_norm": 0.625, "learning_rate": 1.844039454074006e-05, "loss": 0.3909266471862793, "num_input_tokens_seen": 18065313152, "step": 63520, "train_runtime": 617650.4032, "train_tokens_per_second": 29248.444 }, { "epoch": 2.247815712715637, "grad_norm": 0.640625, "learning_rate": 1.8439140544251578e-05, "loss": 0.3861539840698242, "num_input_tokens_seen": 18068128896, "step": 63530, "train_runtime": 617748.0946, "train_tokens_per_second": 29248.377 }, { "epoch": 2.248169532979366, "grad_norm": 0.6328125, "learning_rate": 1.8437886803553726e-05, "loss": 0.3860292434692383, "num_input_tokens_seen": 18070927296, "step": 63540, "train_runtime": 617839.3269, "train_tokens_per_second": 29248.587 }, { "epoch": 2.2485233532430944, "grad_norm": 0.59765625, "learning_rate": 1.843663331855955e-05, "loss": 0.3855440139770508, "num_input_tokens_seen": 18073789568, "step": 63550, "train_runtime": 617939.1781, "train_tokens_per_second": 29248.493 }, { "epoch": 2.2488771735068234, "grad_norm": 0.60546875, "learning_rate": 1.8435380089182142e-05, "loss": 0.38881330490112304, "num_input_tokens_seen": 18076627072, "step": 63560, "train_runtime": 618037.3166, "train_tokens_per_second": 29248.44 }, { "epoch": 2.249230993770552, "grad_norm": 0.59375, "learning_rate": 1.8434127115334636e-05, "loss": 0.38506574630737306, "num_input_tokens_seen": 18079494784, "step": 63570, "train_runtime": 618136.0165, "train_tokens_per_second": 29248.409 }, { "epoch": 2.249584814034281, "grad_norm": 0.61328125, "learning_rate": 1.843287439693021e-05, "loss": 0.3893226146697998, "num_input_tokens_seen": 18082270528, "step": 63580, "train_runtime": 618229.0636, "train_tokens_per_second": 29248.496 }, { "epoch": 2.2499386342980094, "grad_norm": 0.640625, "learning_rate": 1.8431621933882087e-05, "loss": 0.38431107997894287, "num_input_tokens_seen": 18085124736, "step": 63590, "train_runtime": 618327.2981, "train_tokens_per_second": 29248.466 }, { "epoch": 2.2502924545617384, "grad_norm": 0.62890625, "learning_rate": 1.8430369726103514e-05, "loss": 0.3872710704803467, "num_input_tokens_seen": 18087948160, "step": 63600, "train_runtime": 618424.1864, "train_tokens_per_second": 29248.449 }, { "epoch": 2.250646274825467, "grad_norm": 0.63671875, "learning_rate": 1.8429117773507797e-05, "loss": 0.387183403968811, "num_input_tokens_seen": 18090803840, "step": 63610, "train_runtime": 618521.4649, "train_tokens_per_second": 29248.466 }, { "epoch": 2.251000095089196, "grad_norm": 0.62890625, "learning_rate": 1.8427866076008265e-05, "loss": 0.3877406597137451, "num_input_tokens_seen": 18093636864, "step": 63620, "train_runtime": 618616.229, "train_tokens_per_second": 29248.565 }, { "epoch": 2.2513539153529245, "grad_norm": 0.609375, "learning_rate": 1.842661463351832e-05, "loss": 0.38566179275512696, "num_input_tokens_seen": 18096458176, "step": 63630, "train_runtime": 618712.2165, "train_tokens_per_second": 29248.587 }, { "epoch": 2.2517077356166535, "grad_norm": 0.58984375, "learning_rate": 1.8425363445951368e-05, "loss": 0.38597493171691893, "num_input_tokens_seen": 18099305088, "step": 63640, "train_runtime": 618810.5609, "train_tokens_per_second": 29248.539 }, { "epoch": 2.252061555880382, "grad_norm": 0.6328125, "learning_rate": 1.842411251322088e-05, "loss": 0.38338935375213623, "num_input_tokens_seen": 18102157248, "step": 63650, "train_runtime": 618909.4243, "train_tokens_per_second": 29248.476 }, { "epoch": 2.252415376144111, "grad_norm": 0.59765625, "learning_rate": 1.8422861835240357e-05, "loss": 0.3890397071838379, "num_input_tokens_seen": 18105021696, "step": 63660, "train_runtime": 619006.2779, "train_tokens_per_second": 29248.527 }, { "epoch": 2.25276919640784, "grad_norm": 0.59375, "learning_rate": 1.842161141192335e-05, "loss": 0.38200969696044923, "num_input_tokens_seen": 18107910592, "step": 63670, "train_runtime": 619105.5955, "train_tokens_per_second": 29248.501 }, { "epoch": 2.2531230166715686, "grad_norm": 0.62109375, "learning_rate": 1.8420361243183444e-05, "loss": 0.3853623628616333, "num_input_tokens_seen": 18110765696, "step": 63680, "train_runtime": 619200.921, "train_tokens_per_second": 29248.609 }, { "epoch": 2.253476836935297, "grad_norm": 0.61328125, "learning_rate": 1.841911132893427e-05, "loss": 0.3850614070892334, "num_input_tokens_seen": 18113634752, "step": 63690, "train_runtime": 619300.1032, "train_tokens_per_second": 29248.558 }, { "epoch": 2.253830657199026, "grad_norm": 0.6171875, "learning_rate": 1.841786166908949e-05, "loss": 0.38353285789489744, "num_input_tokens_seen": 18116427968, "step": 63700, "train_runtime": 619393.3731, "train_tokens_per_second": 29248.663 }, { "epoch": 2.254184477462755, "grad_norm": 0.6328125, "learning_rate": 1.841661226356282e-05, "loss": 0.38275372982025146, "num_input_tokens_seen": 18119236352, "step": 63710, "train_runtime": 619488.8798, "train_tokens_per_second": 29248.687 }, { "epoch": 2.2545382977264836, "grad_norm": 0.61328125, "learning_rate": 1.8415363112268012e-05, "loss": 0.3870521545410156, "num_input_tokens_seen": 18122137728, "step": 63720, "train_runtime": 619589.5425, "train_tokens_per_second": 29248.618 }, { "epoch": 2.2548921179902126, "grad_norm": 0.6015625, "learning_rate": 1.841411421511886e-05, "loss": 0.3854475736618042, "num_input_tokens_seen": 18124975104, "step": 63730, "train_runtime": 619685.3409, "train_tokens_per_second": 29248.675 }, { "epoch": 2.255245938253941, "grad_norm": 0.6015625, "learning_rate": 1.841286557202919e-05, "loss": 0.3885016679763794, "num_input_tokens_seen": 18127781952, "step": 63740, "train_runtime": 619780.9295, "train_tokens_per_second": 29248.693 }, { "epoch": 2.25559975851767, "grad_norm": 0.6015625, "learning_rate": 1.841161718291288e-05, "loss": 0.37965714931488037, "num_input_tokens_seen": 18130655552, "step": 63750, "train_runtime": 619879.7819, "train_tokens_per_second": 29248.664 }, { "epoch": 2.2559535787813987, "grad_norm": 0.625, "learning_rate": 1.8410369047683846e-05, "loss": 0.3882360219955444, "num_input_tokens_seen": 18133477952, "step": 63760, "train_runtime": 619975.9904, "train_tokens_per_second": 29248.678 }, { "epoch": 2.2563073990451277, "grad_norm": 0.59765625, "learning_rate": 1.8409121166256037e-05, "loss": 0.38308262825012207, "num_input_tokens_seen": 18136394880, "step": 63770, "train_runtime": 620075.9373, "train_tokens_per_second": 29248.667 }, { "epoch": 2.256661219308856, "grad_norm": 0.63671875, "learning_rate": 1.840787353854346e-05, "loss": 0.3947603702545166, "num_input_tokens_seen": 18139277696, "step": 63780, "train_runtime": 620173.7832, "train_tokens_per_second": 29248.701 }, { "epoch": 2.257015039572585, "grad_norm": 0.6171875, "learning_rate": 1.840662616446015e-05, "loss": 0.3855008125305176, "num_input_tokens_seen": 18142099264, "step": 63790, "train_runtime": 620267.5793, "train_tokens_per_second": 29248.827 }, { "epoch": 2.2573688598363137, "grad_norm": 0.609375, "learning_rate": 1.8405379043920177e-05, "loss": 0.3874178886413574, "num_input_tokens_seen": 18144960192, "step": 63800, "train_runtime": 620365.8154, "train_tokens_per_second": 29248.807 }, { "epoch": 2.2577226801000427, "grad_norm": 0.62890625, "learning_rate": 1.8404132176837667e-05, "loss": 0.38170671463012695, "num_input_tokens_seen": 18147823744, "step": 63810, "train_runtime": 620461.957, "train_tokens_per_second": 29248.89 }, { "epoch": 2.2580765003637713, "grad_norm": 0.609375, "learning_rate": 1.840288556312678e-05, "loss": 0.3856589078903198, "num_input_tokens_seen": 18150667328, "step": 63820, "train_runtime": 620560.6893, "train_tokens_per_second": 29248.819 }, { "epoch": 2.2584303206275003, "grad_norm": 0.61328125, "learning_rate": 1.8401639202701713e-05, "loss": 0.3918909549713135, "num_input_tokens_seen": 18153507776, "step": 63830, "train_runtime": 620658.3348, "train_tokens_per_second": 29248.794 }, { "epoch": 2.258784140891229, "grad_norm": 0.625, "learning_rate": 1.8400393095476712e-05, "loss": 0.3859292268753052, "num_input_tokens_seen": 18156356992, "step": 63840, "train_runtime": 620755.3692, "train_tokens_per_second": 29248.812 }, { "epoch": 2.259137961154958, "grad_norm": 0.60546875, "learning_rate": 1.8399147241366053e-05, "loss": 0.38292129039764405, "num_input_tokens_seen": 18159206912, "step": 63850, "train_runtime": 620853.4952, "train_tokens_per_second": 29248.779 }, { "epoch": 2.259491781418687, "grad_norm": 0.60546875, "learning_rate": 1.8397901640284058e-05, "loss": 0.3852531433105469, "num_input_tokens_seen": 18162015296, "step": 63860, "train_runtime": 620948.0599, "train_tokens_per_second": 29248.848 }, { "epoch": 2.2598456016824153, "grad_norm": 0.640625, "learning_rate": 1.8396656292145095e-05, "loss": 0.3920015811920166, "num_input_tokens_seen": 18164865728, "step": 63870, "train_runtime": 621045.0674, "train_tokens_per_second": 29248.869 }, { "epoch": 2.2601994219461443, "grad_norm": 0.625, "learning_rate": 1.8395411196863562e-05, "loss": 0.38411126136779783, "num_input_tokens_seen": 18167747456, "step": 63880, "train_runtime": 621144.9787, "train_tokens_per_second": 29248.804 }, { "epoch": 2.260553242209873, "grad_norm": 0.62890625, "learning_rate": 1.839416635435391e-05, "loss": 0.3886701583862305, "num_input_tokens_seen": 18170612736, "step": 63890, "train_runtime": 621243.452, "train_tokens_per_second": 29248.779 }, { "epoch": 2.260907062473602, "grad_norm": 0.62890625, "learning_rate": 1.8392921764530616e-05, "loss": 0.3931838274002075, "num_input_tokens_seen": 18173508032, "step": 63900, "train_runtime": 621341.3544, "train_tokens_per_second": 29248.831 }, { "epoch": 2.2612608827373304, "grad_norm": 0.62890625, "learning_rate": 1.8391677427308206e-05, "loss": 0.3892277717590332, "num_input_tokens_seen": 18176356672, "step": 63910, "train_runtime": 621438.4389, "train_tokens_per_second": 29248.845 }, { "epoch": 2.2616147030010594, "grad_norm": 0.6171875, "learning_rate": 1.8390433342601252e-05, "loss": 0.38676550388336184, "num_input_tokens_seen": 18179242432, "step": 63920, "train_runtime": 621537.1414, "train_tokens_per_second": 29248.843 }, { "epoch": 2.261968523264788, "grad_norm": 0.59375, "learning_rate": 1.838918951032435e-05, "loss": 0.3876307487487793, "num_input_tokens_seen": 18182086272, "step": 63930, "train_runtime": 621638.1417, "train_tokens_per_second": 29248.666 }, { "epoch": 2.262322343528517, "grad_norm": 0.59375, "learning_rate": 1.8387945930392157e-05, "loss": 0.3839359521865845, "num_input_tokens_seen": 18184978560, "step": 63940, "train_runtime": 621739.1856, "train_tokens_per_second": 29248.564 }, { "epoch": 2.2626761637922455, "grad_norm": 0.6015625, "learning_rate": 1.838670260271935e-05, "loss": 0.3845299482345581, "num_input_tokens_seen": 18187870912, "step": 63950, "train_runtime": 621838.598, "train_tokens_per_second": 29248.54 }, { "epoch": 2.2630299840559744, "grad_norm": 0.63671875, "learning_rate": 1.8385459527220665e-05, "loss": 0.3811118841171265, "num_input_tokens_seen": 18190690944, "step": 63960, "train_runtime": 621936.2747, "train_tokens_per_second": 29248.48 }, { "epoch": 2.263383804319703, "grad_norm": 0.64453125, "learning_rate": 1.838421670381086e-05, "loss": 0.38582501411437986, "num_input_tokens_seen": 18193527552, "step": 63970, "train_runtime": 622032.0523, "train_tokens_per_second": 29248.537 }, { "epoch": 2.263737624583432, "grad_norm": 0.60546875, "learning_rate": 1.838297413240475e-05, "loss": 0.3884643316268921, "num_input_tokens_seen": 18196320960, "step": 63980, "train_runtime": 622127.734, "train_tokens_per_second": 29248.529 }, { "epoch": 2.2640914448471605, "grad_norm": 0.6015625, "learning_rate": 1.8381731812917183e-05, "loss": 0.38035154342651367, "num_input_tokens_seen": 18199177536, "step": 63990, "train_runtime": 622224.5776, "train_tokens_per_second": 29248.567 }, { "epoch": 2.2644452651108895, "grad_norm": 0.60546875, "learning_rate": 1.8380489745263044e-05, "loss": 0.39151365756988527, "num_input_tokens_seen": 18202115584, "step": 64000, "train_runtime": 622327.9893, "train_tokens_per_second": 29248.428 }, { "epoch": 2.2647990853746185, "grad_norm": 0.62890625, "learning_rate": 1.8379247929357262e-05, "loss": 0.3870481014251709, "num_input_tokens_seen": 18204937984, "step": 64010, "train_runtime": 622423.9877, "train_tokens_per_second": 29248.452 }, { "epoch": 2.265152905638347, "grad_norm": 0.59765625, "learning_rate": 1.8378006365114808e-05, "loss": 0.38342905044555664, "num_input_tokens_seen": 18207782784, "step": 64020, "train_runtime": 622522.8633, "train_tokens_per_second": 29248.376 }, { "epoch": 2.2655067259020756, "grad_norm": 0.61328125, "learning_rate": 1.8376765052450693e-05, "loss": 0.38654041290283203, "num_input_tokens_seen": 18210612032, "step": 64030, "train_runtime": 622618.4137, "train_tokens_per_second": 29248.432 }, { "epoch": 2.2658605461658046, "grad_norm": 0.609375, "learning_rate": 1.8375523991279958e-05, "loss": 0.388966703414917, "num_input_tokens_seen": 18213459136, "step": 64040, "train_runtime": 622716.1569, "train_tokens_per_second": 29248.413 }, { "epoch": 2.2662143664295336, "grad_norm": 0.61328125, "learning_rate": 1.83742831815177e-05, "loss": 0.38438925743103025, "num_input_tokens_seen": 18216316096, "step": 64050, "train_runtime": 622813.759, "train_tokens_per_second": 29248.416 }, { "epoch": 2.266568186693262, "grad_norm": 0.62890625, "learning_rate": 1.8373042623079042e-05, "loss": 0.38289847373962405, "num_input_tokens_seen": 18219144064, "step": 64060, "train_runtime": 622908.4088, "train_tokens_per_second": 29248.512 }, { "epoch": 2.266922006956991, "grad_norm": 0.61328125, "learning_rate": 1.8371802315879157e-05, "loss": 0.38445069789886477, "num_input_tokens_seen": 18222026368, "step": 64070, "train_runtime": 623008.2321, "train_tokens_per_second": 29248.452 }, { "epoch": 2.2672758272207196, "grad_norm": 0.62109375, "learning_rate": 1.837056225983326e-05, "loss": 0.38940114974975587, "num_input_tokens_seen": 18224849856, "step": 64080, "train_runtime": 623104.9458, "train_tokens_per_second": 29248.444 }, { "epoch": 2.2676296474844486, "grad_norm": 0.62109375, "learning_rate": 1.8369322454856595e-05, "loss": 0.38449721336364745, "num_input_tokens_seen": 18227699200, "step": 64090, "train_runtime": 623203.2159, "train_tokens_per_second": 29248.404 }, { "epoch": 2.267983467748177, "grad_norm": 0.59765625, "learning_rate": 1.8368082900864454e-05, "loss": 0.3882309436798096, "num_input_tokens_seen": 18230607296, "step": 64100, "train_runtime": 623303.6239, "train_tokens_per_second": 29248.358 }, { "epoch": 2.268337288011906, "grad_norm": 0.62109375, "learning_rate": 1.8366843597772163e-05, "loss": 0.3835292339324951, "num_input_tokens_seen": 18233416512, "step": 64110, "train_runtime": 623398.0001, "train_tokens_per_second": 29248.436 }, { "epoch": 2.2686911082756347, "grad_norm": 0.6328125, "learning_rate": 1.8365604545495093e-05, "loss": 0.384830904006958, "num_input_tokens_seen": 18236270336, "step": 64120, "train_runtime": 623496.3096, "train_tokens_per_second": 29248.401 }, { "epoch": 2.2690449285393637, "grad_norm": 0.60546875, "learning_rate": 1.8364365743948656e-05, "loss": 0.38359675407409666, "num_input_tokens_seen": 18239149376, "step": 64130, "train_runtime": 623594.1746, "train_tokens_per_second": 29248.428 }, { "epoch": 2.2693987488030922, "grad_norm": 0.61328125, "learning_rate": 1.8363127193048303e-05, "loss": 0.3859595775604248, "num_input_tokens_seen": 18241989056, "step": 64140, "train_runtime": 623691.6708, "train_tokens_per_second": 29248.409 }, { "epoch": 2.269752569066821, "grad_norm": 0.64453125, "learning_rate": 1.836188889270952e-05, "loss": 0.38685386180877684, "num_input_tokens_seen": 18244820672, "step": 64150, "train_runtime": 623790.5176, "train_tokens_per_second": 29248.314 }, { "epoch": 2.2701063893305498, "grad_norm": 0.63671875, "learning_rate": 1.8360650842847834e-05, "loss": 0.3923333644866943, "num_input_tokens_seen": 18247666816, "step": 64160, "train_runtime": 623890.0459, "train_tokens_per_second": 29248.21 }, { "epoch": 2.2704602095942787, "grad_norm": 0.59765625, "learning_rate": 1.8359413043378822e-05, "loss": 0.3894052505493164, "num_input_tokens_seen": 18250471552, "step": 64170, "train_runtime": 623987.1168, "train_tokens_per_second": 29248.154 }, { "epoch": 2.2708140298580073, "grad_norm": 0.61328125, "learning_rate": 1.8358175494218088e-05, "loss": 0.38121535778045657, "num_input_tokens_seen": 18253279872, "step": 64180, "train_runtime": 624080.5487, "train_tokens_per_second": 29248.276 }, { "epoch": 2.2711678501217363, "grad_norm": 0.62109375, "learning_rate": 1.8356938195281282e-05, "loss": 0.3870903491973877, "num_input_tokens_seen": 18256188672, "step": 64190, "train_runtime": 624183.1258, "train_tokens_per_second": 29248.129 }, { "epoch": 2.2715216703854653, "grad_norm": 0.609375, "learning_rate": 1.8355701146484093e-05, "loss": 0.38402590751647947, "num_input_tokens_seen": 18258988480, "step": 64200, "train_runtime": 624278.4668, "train_tokens_per_second": 29248.147 }, { "epoch": 2.271875490649194, "grad_norm": 0.6328125, "learning_rate": 1.835446434774225e-05, "loss": 0.38783631324768064, "num_input_tokens_seen": 18261761728, "step": 64210, "train_runtime": 624370.0392, "train_tokens_per_second": 29248.299 }, { "epoch": 2.272229310912923, "grad_norm": 0.6171875, "learning_rate": 1.835322779897152e-05, "loss": 0.38504955768585203, "num_input_tokens_seen": 18264589440, "step": 64220, "train_runtime": 624468.065, "train_tokens_per_second": 29248.236 }, { "epoch": 2.2725831311766513, "grad_norm": 0.59765625, "learning_rate": 1.8351991500087712e-05, "loss": 0.3877102851867676, "num_input_tokens_seen": 18267451840, "step": 64230, "train_runtime": 624564.492, "train_tokens_per_second": 29248.304 }, { "epoch": 2.2729369514403803, "grad_norm": 0.62109375, "learning_rate": 1.8350755451006675e-05, "loss": 0.391158390045166, "num_input_tokens_seen": 18270272704, "step": 64240, "train_runtime": 624661.5345, "train_tokens_per_second": 29248.276 }, { "epoch": 2.273290771704109, "grad_norm": 0.6015625, "learning_rate": 1.8349519651644293e-05, "loss": 0.38818509578704835, "num_input_tokens_seen": 18273148800, "step": 64250, "train_runtime": 624760.5452, "train_tokens_per_second": 29248.244 }, { "epoch": 2.273644591967838, "grad_norm": 0.6015625, "learning_rate": 1.8348284101916496e-05, "loss": 0.38398194313049316, "num_input_tokens_seen": 18275962176, "step": 64260, "train_runtime": 624855.2861, "train_tokens_per_second": 29248.312 }, { "epoch": 2.2739984122315664, "grad_norm": 0.6328125, "learning_rate": 1.8347048801739246e-05, "loss": 0.38775057792663575, "num_input_tokens_seen": 18278836416, "step": 64270, "train_runtime": 624951.3426, "train_tokens_per_second": 29248.415 }, { "epoch": 2.2743522324952954, "grad_norm": 0.60546875, "learning_rate": 1.8345813751028558e-05, "loss": 0.3825794219970703, "num_input_tokens_seen": 18281634432, "step": 64280, "train_runtime": 625044.7715, "train_tokens_per_second": 29248.52 }, { "epoch": 2.274706052759024, "grad_norm": 0.59375, "learning_rate": 1.834457894970047e-05, "loss": 0.3875119686126709, "num_input_tokens_seen": 18284517248, "step": 64290, "train_runtime": 625145.7634, "train_tokens_per_second": 29248.406 }, { "epoch": 2.275059873022753, "grad_norm": 0.62890625, "learning_rate": 1.834334439767107e-05, "loss": 0.390265154838562, "num_input_tokens_seen": 18287369728, "step": 64300, "train_runtime": 625245.0624, "train_tokens_per_second": 29248.323 }, { "epoch": 2.2754136932864815, "grad_norm": 0.6015625, "learning_rate": 1.8342110094856478e-05, "loss": 0.3876230239868164, "num_input_tokens_seen": 18290188480, "step": 64310, "train_runtime": 625341.3633, "train_tokens_per_second": 29248.327 }, { "epoch": 2.2757675135502105, "grad_norm": 0.640625, "learning_rate": 1.834087604117287e-05, "loss": 0.3871523141860962, "num_input_tokens_seen": 18293081152, "step": 64320, "train_runtime": 625440.6346, "train_tokens_per_second": 29248.309 }, { "epoch": 2.276121333813939, "grad_norm": 0.60546875, "learning_rate": 1.833964223653644e-05, "loss": 0.38451662063598635, "num_input_tokens_seen": 18295940352, "step": 64330, "train_runtime": 625538.3515, "train_tokens_per_second": 29248.311 }, { "epoch": 2.276475154077668, "grad_norm": 0.6171875, "learning_rate": 1.8338408680863432e-05, "loss": 0.3850873470306396, "num_input_tokens_seen": 18298808640, "step": 64340, "train_runtime": 625635.1343, "train_tokens_per_second": 29248.371 }, { "epoch": 2.276828974341397, "grad_norm": 0.62109375, "learning_rate": 1.8337175374070135e-05, "loss": 0.3885332107543945, "num_input_tokens_seen": 18301680768, "step": 64350, "train_runtime": 625732.3507, "train_tokens_per_second": 29248.417 }, { "epoch": 2.2771827946051255, "grad_norm": 0.6171875, "learning_rate": 1.8335942316072865e-05, "loss": 0.38517260551452637, "num_input_tokens_seen": 18304524160, "step": 64360, "train_runtime": 625829.1708, "train_tokens_per_second": 29248.436 }, { "epoch": 2.277536614868854, "grad_norm": 0.62890625, "learning_rate": 1.8334709506787985e-05, "loss": 0.38727407455444335, "num_input_tokens_seen": 18307434048, "step": 64370, "train_runtime": 625930.5692, "train_tokens_per_second": 29248.346 }, { "epoch": 2.277890435132583, "grad_norm": 0.63671875, "learning_rate": 1.8333476946131896e-05, "loss": 0.3823495388031006, "num_input_tokens_seen": 18310294400, "step": 64380, "train_runtime": 626029.2378, "train_tokens_per_second": 29248.306 }, { "epoch": 2.278244255396312, "grad_norm": 0.63671875, "learning_rate": 1.833224463402104e-05, "loss": 0.38387060165405273, "num_input_tokens_seen": 18313157696, "step": 64390, "train_runtime": 626128.0501, "train_tokens_per_second": 29248.263 }, { "epoch": 2.2785980756600406, "grad_norm": 0.6015625, "learning_rate": 1.8331012570371896e-05, "loss": 0.38391757011413574, "num_input_tokens_seen": 18316027776, "step": 64400, "train_runtime": 626225.6232, "train_tokens_per_second": 29248.289 }, { "epoch": 2.2789518959237696, "grad_norm": 0.625, "learning_rate": 1.8329780755100982e-05, "loss": 0.3866096019744873, "num_input_tokens_seen": 18318848320, "step": 64410, "train_runtime": 626319.5249, "train_tokens_per_second": 29248.407 }, { "epoch": 2.279305716187498, "grad_norm": 0.62890625, "learning_rate": 1.8328549188124855e-05, "loss": 0.3855460166931152, "num_input_tokens_seen": 18321744320, "step": 64420, "train_runtime": 626421.7309, "train_tokens_per_second": 29248.258 }, { "epoch": 2.279659536451227, "grad_norm": 0.609375, "learning_rate": 1.8327317869360112e-05, "loss": 0.3851401567459106, "num_input_tokens_seen": 18324578176, "step": 64430, "train_runtime": 626518.6012, "train_tokens_per_second": 29248.259 }, { "epoch": 2.2800133567149556, "grad_norm": 0.63671875, "learning_rate": 1.8326086798723394e-05, "loss": 0.386049485206604, "num_input_tokens_seen": 18327486656, "step": 64440, "train_runtime": 626618.9161, "train_tokens_per_second": 29248.218 }, { "epoch": 2.2803671769786846, "grad_norm": 0.625, "learning_rate": 1.832485597613137e-05, "loss": 0.39018571376800537, "num_input_tokens_seen": 18330381120, "step": 64450, "train_runtime": 626719.1844, "train_tokens_per_second": 29248.157 }, { "epoch": 2.280720997242413, "grad_norm": 0.62890625, "learning_rate": 1.8323625401500763e-05, "loss": 0.38712291717529296, "num_input_tokens_seen": 18333246272, "step": 64460, "train_runtime": 626817.8772, "train_tokens_per_second": 29248.123 }, { "epoch": 2.281074817506142, "grad_norm": 0.60546875, "learning_rate": 1.832239507474832e-05, "loss": 0.38573760986328126, "num_input_tokens_seen": 18336156800, "step": 64470, "train_runtime": 626919.7318, "train_tokens_per_second": 29248.014 }, { "epoch": 2.2814286377698707, "grad_norm": 0.59375, "learning_rate": 1.8321164995790837e-05, "loss": 0.38653221130371096, "num_input_tokens_seen": 18339035840, "step": 64480, "train_runtime": 627018.4884, "train_tokens_per_second": 29247.999 }, { "epoch": 2.2817824580335997, "grad_norm": 0.6171875, "learning_rate": 1.831993516454515e-05, "loss": 0.3872544765472412, "num_input_tokens_seen": 18341846016, "step": 64490, "train_runtime": 627115.3202, "train_tokens_per_second": 29247.964 }, { "epoch": 2.2821362782973287, "grad_norm": 0.62109375, "learning_rate": 1.8318705580928116e-05, "loss": 0.38541855812072756, "num_input_tokens_seen": 18344666752, "step": 64500, "train_runtime": 627211.2121, "train_tokens_per_second": 29247.989 }, { "epoch": 2.2824900985610572, "grad_norm": 0.6328125, "learning_rate": 1.8317476244856666e-05, "loss": 0.38570847511291506, "num_input_tokens_seen": 18347492224, "step": 64510, "train_runtime": 627305.8565, "train_tokens_per_second": 29248.081 }, { "epoch": 2.2828439188247858, "grad_norm": 0.609375, "learning_rate": 1.8316247156247734e-05, "loss": 0.38433194160461426, "num_input_tokens_seen": 18350386304, "step": 64520, "train_runtime": 627405.4278, "train_tokens_per_second": 29248.052 }, { "epoch": 2.2831977390885148, "grad_norm": 0.6015625, "learning_rate": 1.8315018315018315e-05, "loss": 0.384813928604126, "num_input_tokens_seen": 18353217600, "step": 64530, "train_runtime": 627503.2391, "train_tokens_per_second": 29248.005 }, { "epoch": 2.2835515593522437, "grad_norm": 0.609375, "learning_rate": 1.8313789721085437e-05, "loss": 0.38196754455566406, "num_input_tokens_seen": 18356073664, "step": 64540, "train_runtime": 627600.0699, "train_tokens_per_second": 29248.043 }, { "epoch": 2.2839053796159723, "grad_norm": 0.6328125, "learning_rate": 1.8312561374366162e-05, "loss": 0.3838608741760254, "num_input_tokens_seen": 18358872704, "step": 64550, "train_runtime": 627694.189, "train_tokens_per_second": 29248.116 }, { "epoch": 2.2842591998797013, "grad_norm": 0.609375, "learning_rate": 1.83113332747776e-05, "loss": 0.3866115570068359, "num_input_tokens_seen": 18361735744, "step": 64560, "train_runtime": 627794.5986, "train_tokens_per_second": 29247.999 }, { "epoch": 2.28461302014343, "grad_norm": 0.62890625, "learning_rate": 1.8310105422236888e-05, "loss": 0.3874118089675903, "num_input_tokens_seen": 18364562880, "step": 64570, "train_runtime": 627892.2596, "train_tokens_per_second": 29247.952 }, { "epoch": 2.284966840407159, "grad_norm": 0.625, "learning_rate": 1.8308877816661216e-05, "loss": 0.3888392448425293, "num_input_tokens_seen": 18367401024, "step": 64580, "train_runtime": 627990.4738, "train_tokens_per_second": 29247.898 }, { "epoch": 2.2853206606708873, "grad_norm": 0.63671875, "learning_rate": 1.8307650457967805e-05, "loss": 0.3871408224105835, "num_input_tokens_seen": 18370255744, "step": 64590, "train_runtime": 628090.709, "train_tokens_per_second": 29247.775 }, { "epoch": 2.2856744809346163, "grad_norm": 0.640625, "learning_rate": 1.8306423346073912e-05, "loss": 0.3865889310836792, "num_input_tokens_seen": 18373099648, "step": 64600, "train_runtime": 628185.8544, "train_tokens_per_second": 29247.872 }, { "epoch": 2.286028301198345, "grad_norm": 0.62890625, "learning_rate": 1.830519648089684e-05, "loss": 0.3860872745513916, "num_input_tokens_seen": 18375949440, "step": 64610, "train_runtime": 628279.7378, "train_tokens_per_second": 29248.038 }, { "epoch": 2.286382121462074, "grad_norm": 0.6015625, "learning_rate": 1.8303969862353928e-05, "loss": 0.3834192752838135, "num_input_tokens_seen": 18378796160, "step": 64620, "train_runtime": 628375.5314, "train_tokens_per_second": 29248.109 }, { "epoch": 2.2867359417258024, "grad_norm": 0.640625, "learning_rate": 1.830274349036255e-05, "loss": 0.38586907386779784, "num_input_tokens_seen": 18381682240, "step": 64630, "train_runtime": 628476.7142, "train_tokens_per_second": 29247.993 }, { "epoch": 2.2870897619895314, "grad_norm": 0.62890625, "learning_rate": 1.830151736484013e-05, "loss": 0.3856481075286865, "num_input_tokens_seen": 18384510848, "step": 64640, "train_runtime": 628575.2069, "train_tokens_per_second": 29247.91 }, { "epoch": 2.28744358225326, "grad_norm": 0.5859375, "learning_rate": 1.830029148570411e-05, "loss": 0.38550620079040526, "num_input_tokens_seen": 18387382016, "step": 64650, "train_runtime": 628674.9517, "train_tokens_per_second": 29247.836 }, { "epoch": 2.287797402516989, "grad_norm": 0.61328125, "learning_rate": 1.829906585287199e-05, "loss": 0.39180865287780764, "num_input_tokens_seen": 18390254336, "step": 64660, "train_runtime": 628772.6892, "train_tokens_per_second": 29247.858 }, { "epoch": 2.2881512227807175, "grad_norm": 0.609375, "learning_rate": 1.8297840466261302e-05, "loss": 0.38927016258239744, "num_input_tokens_seen": 18393092352, "step": 64670, "train_runtime": 628871.6133, "train_tokens_per_second": 29247.77 }, { "epoch": 2.2885050430444465, "grad_norm": 0.63671875, "learning_rate": 1.8296615325789615e-05, "loss": 0.3878291845321655, "num_input_tokens_seen": 18395909632, "step": 64680, "train_runtime": 628965.0934, "train_tokens_per_second": 29247.902 }, { "epoch": 2.2888588633081755, "grad_norm": 0.6171875, "learning_rate": 1.829539043137454e-05, "loss": 0.387098503112793, "num_input_tokens_seen": 18398797824, "step": 64690, "train_runtime": 629062.4303, "train_tokens_per_second": 29247.968 }, { "epoch": 2.289212683571904, "grad_norm": 0.6171875, "learning_rate": 1.8294165782933725e-05, "loss": 0.38688108921051023, "num_input_tokens_seen": 18401685376, "step": 64700, "train_runtime": 629163.5467, "train_tokens_per_second": 29247.857 }, { "epoch": 2.289566503835633, "grad_norm": 0.65234375, "learning_rate": 1.8292941380384852e-05, "loss": 0.38908910751342773, "num_input_tokens_seen": 18404513216, "step": 64710, "train_runtime": 629260.0233, "train_tokens_per_second": 29247.867 }, { "epoch": 2.2899203240993615, "grad_norm": 0.6015625, "learning_rate": 1.8291717223645656e-05, "loss": 0.3844440460205078, "num_input_tokens_seen": 18407399104, "step": 64720, "train_runtime": 629360.1143, "train_tokens_per_second": 29247.801 }, { "epoch": 2.2902741443630905, "grad_norm": 0.625, "learning_rate": 1.8290493312633896e-05, "loss": 0.3866072177886963, "num_input_tokens_seen": 18410233344, "step": 64730, "train_runtime": 629456.4705, "train_tokens_per_second": 29247.826 }, { "epoch": 2.290627964626819, "grad_norm": 0.62890625, "learning_rate": 1.8289269647267365e-05, "loss": 0.3871736526489258, "num_input_tokens_seen": 18413004224, "step": 64740, "train_runtime": 629550.1764, "train_tokens_per_second": 29247.874 }, { "epoch": 2.290981784890548, "grad_norm": 0.6484375, "learning_rate": 1.8288046227463916e-05, "loss": 0.3888375997543335, "num_input_tokens_seen": 18415917824, "step": 64750, "train_runtime": 629651.3246, "train_tokens_per_second": 29247.803 }, { "epoch": 2.2913356051542766, "grad_norm": 0.609375, "learning_rate": 1.828682305314142e-05, "loss": 0.38705532550811766, "num_input_tokens_seen": 18418796032, "step": 64760, "train_runtime": 629748.6961, "train_tokens_per_second": 29247.851 }, { "epoch": 2.2916894254180056, "grad_norm": 0.64453125, "learning_rate": 1.82856001242178e-05, "loss": 0.38695216178894043, "num_input_tokens_seen": 18421703296, "step": 64770, "train_runtime": 629850.934, "train_tokens_per_second": 29247.719 }, { "epoch": 2.292043245681734, "grad_norm": 0.6328125, "learning_rate": 1.8284377440611006e-05, "loss": 0.38610775470733644, "num_input_tokens_seen": 18424564416, "step": 64780, "train_runtime": 629948.5526, "train_tokens_per_second": 29247.729 }, { "epoch": 2.292397065945463, "grad_norm": 0.58984375, "learning_rate": 1.828315500223904e-05, "loss": 0.3819850206375122, "num_input_tokens_seen": 18427471424, "step": 64790, "train_runtime": 630046.852, "train_tokens_per_second": 29247.78 }, { "epoch": 2.2927508862091917, "grad_norm": 0.62890625, "learning_rate": 1.8281932809019927e-05, "loss": 0.38526899814605714, "num_input_tokens_seen": 18430335168, "step": 64800, "train_runtime": 630141.5097, "train_tokens_per_second": 29247.931 }, { "epoch": 2.2931047064729206, "grad_norm": 0.6328125, "learning_rate": 1.828071086087174e-05, "loss": 0.38569176197052, "num_input_tokens_seen": 18433147648, "step": 64810, "train_runtime": 630238.3758, "train_tokens_per_second": 29247.898 }, { "epoch": 2.293458526736649, "grad_norm": 0.6171875, "learning_rate": 1.827948915771259e-05, "loss": 0.38973560333251955, "num_input_tokens_seen": 18436049856, "step": 64820, "train_runtime": 630337.5761, "train_tokens_per_second": 29247.899 }, { "epoch": 2.293812347000378, "grad_norm": 0.6015625, "learning_rate": 1.827826769946063e-05, "loss": 0.3876962184906006, "num_input_tokens_seen": 18438903360, "step": 64830, "train_runtime": 630437.5369, "train_tokens_per_second": 29247.788 }, { "epoch": 2.294166167264107, "grad_norm": 0.59765625, "learning_rate": 1.8277046486034035e-05, "loss": 0.3843767404556274, "num_input_tokens_seen": 18441781184, "step": 64840, "train_runtime": 630537.4013, "train_tokens_per_second": 29247.72 }, { "epoch": 2.2945199875278357, "grad_norm": 0.63671875, "learning_rate": 1.8275825517351035e-05, "loss": 0.3874641418457031, "num_input_tokens_seen": 18444648704, "step": 64850, "train_runtime": 630636.1729, "train_tokens_per_second": 29247.686 }, { "epoch": 2.2948738077915642, "grad_norm": 0.58984375, "learning_rate": 1.827460479332989e-05, "loss": 0.38566668033599855, "num_input_tokens_seen": 18447546560, "step": 64860, "train_runtime": 630736.3539, "train_tokens_per_second": 29247.635 }, { "epoch": 2.2952276280552932, "grad_norm": 0.61328125, "learning_rate": 1.827338431388891e-05, "loss": 0.38759870529174806, "num_input_tokens_seen": 18450421440, "step": 64870, "train_runtime": 630838.9224, "train_tokens_per_second": 29247.437 }, { "epoch": 2.295581448319022, "grad_norm": 0.609375, "learning_rate": 1.8272164078946418e-05, "loss": 0.3854562520980835, "num_input_tokens_seen": 18453212928, "step": 64880, "train_runtime": 630930.6381, "train_tokens_per_second": 29247.61 }, { "epoch": 2.2959352685827508, "grad_norm": 0.63671875, "learning_rate": 1.82709440884208e-05, "loss": 0.38477783203125, "num_input_tokens_seen": 18456091264, "step": 64890, "train_runtime": 631029.7588, "train_tokens_per_second": 29247.577 }, { "epoch": 2.2962890888464798, "grad_norm": 0.6328125, "learning_rate": 1.8269724342230474e-05, "loss": 0.38562769889831544, "num_input_tokens_seen": 18458993792, "step": 64900, "train_runtime": 631128.6558, "train_tokens_per_second": 29247.593 }, { "epoch": 2.2966429091102083, "grad_norm": 0.62890625, "learning_rate": 1.8268504840293886e-05, "loss": 0.3923305034637451, "num_input_tokens_seen": 18461815168, "step": 64910, "train_runtime": 631223.0299, "train_tokens_per_second": 29247.689 }, { "epoch": 2.2969967293739373, "grad_norm": 0.6328125, "learning_rate": 1.8267285582529535e-05, "loss": 0.3861689567565918, "num_input_tokens_seen": 18464662144, "step": 64920, "train_runtime": 631318.2256, "train_tokens_per_second": 29247.789 }, { "epoch": 2.297350549637666, "grad_norm": 0.6484375, "learning_rate": 1.826606656885594e-05, "loss": 0.38799750804901123, "num_input_tokens_seen": 18467464896, "step": 64930, "train_runtime": 631413.51, "train_tokens_per_second": 29247.814 }, { "epoch": 2.297704369901395, "grad_norm": 0.59765625, "learning_rate": 1.826484779919168e-05, "loss": 0.38740129470825196, "num_input_tokens_seen": 18470356672, "step": 64940, "train_runtime": 631513.9313, "train_tokens_per_second": 29247.742 }, { "epoch": 2.2980581901651234, "grad_norm": 0.63671875, "learning_rate": 1.8263629273455353e-05, "loss": 0.388030481338501, "num_input_tokens_seen": 18473203840, "step": 64950, "train_runtime": 631614.4037, "train_tokens_per_second": 29247.597 }, { "epoch": 2.2984120104288523, "grad_norm": 0.58984375, "learning_rate": 1.8262410991565605e-05, "loss": 0.3871011734008789, "num_input_tokens_seen": 18476093120, "step": 64960, "train_runtime": 631717.5783, "train_tokens_per_second": 29247.394 }, { "epoch": 2.298765830692581, "grad_norm": 0.6484375, "learning_rate": 1.826119295344112e-05, "loss": 0.38274321556091306, "num_input_tokens_seen": 18478951936, "step": 64970, "train_runtime": 631816.5242, "train_tokens_per_second": 29247.339 }, { "epoch": 2.29911965095631, "grad_norm": 0.59375, "learning_rate": 1.8259975159000613e-05, "loss": 0.3868141174316406, "num_input_tokens_seen": 18481807872, "step": 64980, "train_runtime": 631913.135, "train_tokens_per_second": 29247.387 }, { "epoch": 2.2994734712200384, "grad_norm": 0.59765625, "learning_rate": 1.825875760816284e-05, "loss": 0.3884878158569336, "num_input_tokens_seen": 18484662720, "step": 64990, "train_runtime": 632009.3297, "train_tokens_per_second": 29247.452 }, { "epoch": 2.2998272914837674, "grad_norm": 0.65625, "learning_rate": 1.8257540300846603e-05, "loss": 0.3876064300537109, "num_input_tokens_seen": 18487515328, "step": 65000, "train_runtime": 632109.7985, "train_tokens_per_second": 29247.316 }, { "epoch": 2.2998272914837674, "eval_loss": 0.3366485834121704, "eval_runtime": 8.4285, "eval_samples_per_second": 473.157, "eval_steps_per_second": 3.797, "num_input_tokens_seen": 18487515328, "step": 65000 }, { "epoch": 2.300181111747496, "grad_norm": 0.609375, "learning_rate": 1.825632323697073e-05, "loss": 0.38701891899108887, "num_input_tokens_seen": 18490398528, "step": 65010, "train_runtime": 632237.6177, "train_tokens_per_second": 29245.964 }, { "epoch": 2.300534932011225, "grad_norm": 0.6328125, "learning_rate": 1.8255106416454093e-05, "loss": 0.3864434719085693, "num_input_tokens_seen": 18493255488, "step": 65020, "train_runtime": 632334.9735, "train_tokens_per_second": 29245.979 }, { "epoch": 2.300888752274954, "grad_norm": 0.63671875, "learning_rate": 1.82538898392156e-05, "loss": 0.3889376163482666, "num_input_tokens_seen": 18496091968, "step": 65030, "train_runtime": 632434.5849, "train_tokens_per_second": 29245.858 }, { "epoch": 2.3012425725386825, "grad_norm": 0.625, "learning_rate": 1.8252673505174206e-05, "loss": 0.3881181240081787, "num_input_tokens_seen": 18498931456, "step": 65040, "train_runtime": 632531.4566, "train_tokens_per_second": 29245.868 }, { "epoch": 2.3015963928024115, "grad_norm": 0.6328125, "learning_rate": 1.825145741424888e-05, "loss": 0.38629789352416993, "num_input_tokens_seen": 18501787392, "step": 65050, "train_runtime": 632631.6518, "train_tokens_per_second": 29245.75 }, { "epoch": 2.30195021306614, "grad_norm": 0.625, "learning_rate": 1.8250241566358662e-05, "loss": 0.3839745044708252, "num_input_tokens_seen": 18504658240, "step": 65060, "train_runtime": 632731.0523, "train_tokens_per_second": 29245.693 }, { "epoch": 2.302304033329869, "grad_norm": 0.609375, "learning_rate": 1.8249025961422598e-05, "loss": 0.38858942985534667, "num_input_tokens_seen": 18507565504, "step": 65070, "train_runtime": 632831.5762, "train_tokens_per_second": 29245.642 }, { "epoch": 2.3026578535935975, "grad_norm": 0.62890625, "learning_rate": 1.824781059935979e-05, "loss": 0.38565118312835694, "num_input_tokens_seen": 18510434112, "step": 65080, "train_runtime": 632931.5554, "train_tokens_per_second": 29245.554 }, { "epoch": 2.3030116738573265, "grad_norm": 0.62890625, "learning_rate": 1.8246595480089376e-05, "loss": 0.38530526161193845, "num_input_tokens_seen": 18513277376, "step": 65090, "train_runtime": 633028.3542, "train_tokens_per_second": 29245.574 }, { "epoch": 2.303365494121055, "grad_norm": 0.6171875, "learning_rate": 1.8245380603530526e-05, "loss": 0.3832041501998901, "num_input_tokens_seen": 18516184256, "step": 65100, "train_runtime": 633127.7731, "train_tokens_per_second": 29245.573 }, { "epoch": 2.303719314384784, "grad_norm": 0.62109375, "learning_rate": 1.8244165969602455e-05, "loss": 0.3861818313598633, "num_input_tokens_seen": 18519012096, "step": 65110, "train_runtime": 633224.2649, "train_tokens_per_second": 29245.582 }, { "epoch": 2.3040731346485126, "grad_norm": 0.609375, "learning_rate": 1.824295157822441e-05, "loss": 0.38622608184814455, "num_input_tokens_seen": 18521816896, "step": 65120, "train_runtime": 633318.3804, "train_tokens_per_second": 29245.665 }, { "epoch": 2.3044269549122416, "grad_norm": 0.625, "learning_rate": 1.8241737429315674e-05, "loss": 0.3872580051422119, "num_input_tokens_seen": 18524689920, "step": 65130, "train_runtime": 633418.3835, "train_tokens_per_second": 29245.583 }, { "epoch": 2.30478077517597, "grad_norm": 0.61328125, "learning_rate": 1.8240523522795575e-05, "loss": 0.3836192607879639, "num_input_tokens_seen": 18527584000, "step": 65140, "train_runtime": 633523.1267, "train_tokens_per_second": 29245.316 }, { "epoch": 2.305134595439699, "grad_norm": 0.640625, "learning_rate": 1.8239309858583466e-05, "loss": 0.38173096179962157, "num_input_tokens_seen": 18530475648, "step": 65150, "train_runtime": 633621.0424, "train_tokens_per_second": 29245.36 }, { "epoch": 2.3054884157034277, "grad_norm": 0.6015625, "learning_rate": 1.8238096436598755e-05, "loss": 0.38759703636169435, "num_input_tokens_seen": 18533333888, "step": 65160, "train_runtime": 633719.5944, "train_tokens_per_second": 29245.322 }, { "epoch": 2.3058422359671567, "grad_norm": 0.625, "learning_rate": 1.8236883256760882e-05, "loss": 0.3836358070373535, "num_input_tokens_seen": 18536214272, "step": 65170, "train_runtime": 633819.6206, "train_tokens_per_second": 29245.252 }, { "epoch": 2.3061960562308856, "grad_norm": 0.6640625, "learning_rate": 1.8235670318989305e-05, "loss": 0.3821556806564331, "num_input_tokens_seen": 18539085120, "step": 65180, "train_runtime": 633917.3366, "train_tokens_per_second": 29245.272 }, { "epoch": 2.306549876494614, "grad_norm": 0.6328125, "learning_rate": 1.8234457623203548e-05, "loss": 0.38454060554504393, "num_input_tokens_seen": 18541982144, "step": 65190, "train_runtime": 634015.2402, "train_tokens_per_second": 29245.326 }, { "epoch": 2.3069036967583427, "grad_norm": 0.61328125, "learning_rate": 1.8233245169323163e-05, "loss": 0.3883782386779785, "num_input_tokens_seen": 18544886080, "step": 65200, "train_runtime": 634116.1726, "train_tokens_per_second": 29245.25 }, { "epoch": 2.3072575170220717, "grad_norm": 0.58984375, "learning_rate": 1.823203295726772e-05, "loss": 0.38774886131286623, "num_input_tokens_seen": 18547720512, "step": 65210, "train_runtime": 634210.7352, "train_tokens_per_second": 29245.359 }, { "epoch": 2.3076113372858007, "grad_norm": 0.62109375, "learning_rate": 1.823082098695686e-05, "loss": 0.3898928642272949, "num_input_tokens_seen": 18550568192, "step": 65220, "train_runtime": 634310.5853, "train_tokens_per_second": 29245.245 }, { "epoch": 2.3079651575495292, "grad_norm": 0.59375, "learning_rate": 1.8229609258310233e-05, "loss": 0.3822164535522461, "num_input_tokens_seen": 18553420544, "step": 65230, "train_runtime": 634408.2978, "train_tokens_per_second": 29245.236 }, { "epoch": 2.3083189778132582, "grad_norm": 0.62890625, "learning_rate": 1.8228397771247542e-05, "loss": 0.3885348320007324, "num_input_tokens_seen": 18556261376, "step": 65240, "train_runtime": 634506.3229, "train_tokens_per_second": 29245.195 }, { "epoch": 2.3086727980769868, "grad_norm": 0.61328125, "learning_rate": 1.822718652568852e-05, "loss": 0.38760967254638673, "num_input_tokens_seen": 18559124864, "step": 65250, "train_runtime": 634601.0271, "train_tokens_per_second": 29245.343 }, { "epoch": 2.3090266183407158, "grad_norm": 0.60546875, "learning_rate": 1.8225975521552944e-05, "loss": 0.38417651653289797, "num_input_tokens_seen": 18561957888, "step": 65260, "train_runtime": 634696.8587, "train_tokens_per_second": 29245.391 }, { "epoch": 2.3093804386044443, "grad_norm": 0.61328125, "learning_rate": 1.8224764758760622e-05, "loss": 0.39082984924316405, "num_input_tokens_seen": 18564790272, "step": 65270, "train_runtime": 634794.0302, "train_tokens_per_second": 29245.376 }, { "epoch": 2.3097342588681733, "grad_norm": 0.6171875, "learning_rate": 1.8223554237231398e-05, "loss": 0.38508620262146, "num_input_tokens_seen": 18567663936, "step": 65280, "train_runtime": 634894.2937, "train_tokens_per_second": 29245.284 }, { "epoch": 2.310088079131902, "grad_norm": 0.6328125, "learning_rate": 1.822234395688517e-05, "loss": 0.3839262008666992, "num_input_tokens_seen": 18570522944, "step": 65290, "train_runtime": 634993.4044, "train_tokens_per_second": 29245.222 }, { "epoch": 2.310441899395631, "grad_norm": 0.62109375, "learning_rate": 1.8221133917641845e-05, "loss": 0.38491172790527345, "num_input_tokens_seen": 18573323968, "step": 65300, "train_runtime": 635085.8851, "train_tokens_per_second": 29245.374 }, { "epoch": 2.3107957196593594, "grad_norm": 0.609375, "learning_rate": 1.821992411942139e-05, "loss": 0.38651888370513915, "num_input_tokens_seen": 18576142400, "step": 65310, "train_runtime": 635181.5934, "train_tokens_per_second": 29245.404 }, { "epoch": 2.3111495399230884, "grad_norm": 0.609375, "learning_rate": 1.8218714562143804e-05, "loss": 0.385313892364502, "num_input_tokens_seen": 18578974528, "step": 65320, "train_runtime": 635277.6333, "train_tokens_per_second": 29245.441 }, { "epoch": 2.3115033601868173, "grad_norm": 0.61328125, "learning_rate": 1.8217505245729113e-05, "loss": 0.3890071392059326, "num_input_tokens_seen": 18581874560, "step": 65330, "train_runtime": 635377.6016, "train_tokens_per_second": 29245.404 }, { "epoch": 2.311857180450546, "grad_norm": 0.62890625, "learning_rate": 1.8216296170097395e-05, "loss": 0.38903064727783204, "num_input_tokens_seen": 18584736768, "step": 65340, "train_runtime": 635478.7432, "train_tokens_per_second": 29245.253 }, { "epoch": 2.3122110007142744, "grad_norm": 0.62109375, "learning_rate": 1.8215087335168758e-05, "loss": 0.3895043134689331, "num_input_tokens_seen": 18587584192, "step": 65350, "train_runtime": 635575.2941, "train_tokens_per_second": 29245.291 }, { "epoch": 2.3125648209780034, "grad_norm": 0.58984375, "learning_rate": 1.8213878740863342e-05, "loss": 0.3860654592514038, "num_input_tokens_seen": 18590437696, "step": 65360, "train_runtime": 635672.8997, "train_tokens_per_second": 29245.289 }, { "epoch": 2.3129186412417324, "grad_norm": 0.6171875, "learning_rate": 1.821267038710133e-05, "loss": 0.39289758205413816, "num_input_tokens_seen": 18593262144, "step": 65370, "train_runtime": 635766.4709, "train_tokens_per_second": 29245.427 }, { "epoch": 2.313272461505461, "grad_norm": 0.61328125, "learning_rate": 1.8211462273802946e-05, "loss": 0.388733434677124, "num_input_tokens_seen": 18596127232, "step": 65380, "train_runtime": 635866.6835, "train_tokens_per_second": 29245.324 }, { "epoch": 2.31362628176919, "grad_norm": 0.63671875, "learning_rate": 1.821025440088844e-05, "loss": 0.3889653444290161, "num_input_tokens_seen": 18598984320, "step": 65390, "train_runtime": 635965.4346, "train_tokens_per_second": 29245.275 }, { "epoch": 2.3139801020329185, "grad_norm": 0.58984375, "learning_rate": 1.8209046768278115e-05, "loss": 0.3817785978317261, "num_input_tokens_seen": 18601814464, "step": 65400, "train_runtime": 636062.8022, "train_tokens_per_second": 29245.248 }, { "epoch": 2.3143339222966475, "grad_norm": 0.6484375, "learning_rate": 1.8207839375892292e-05, "loss": 0.391879940032959, "num_input_tokens_seen": 18604680256, "step": 65410, "train_runtime": 636161.922, "train_tokens_per_second": 29245.196 }, { "epoch": 2.314687742560376, "grad_norm": 0.59765625, "learning_rate": 1.8206632223651342e-05, "loss": 0.3825816631317139, "num_input_tokens_seen": 18607483072, "step": 65420, "train_runtime": 636255.1977, "train_tokens_per_second": 29245.314 }, { "epoch": 2.315041562824105, "grad_norm": 0.59765625, "learning_rate": 1.8205425311475674e-05, "loss": 0.3869927167892456, "num_input_tokens_seen": 18610298048, "step": 65430, "train_runtime": 636349.6136, "train_tokens_per_second": 29245.399 }, { "epoch": 2.3153953830878335, "grad_norm": 0.60546875, "learning_rate": 1.820421863928572e-05, "loss": 0.3871757507324219, "num_input_tokens_seen": 18613147456, "step": 65440, "train_runtime": 636449.7369, "train_tokens_per_second": 29245.275 }, { "epoch": 2.3157492033515625, "grad_norm": 0.625, "learning_rate": 1.8203012207001965e-05, "loss": 0.38469738960266114, "num_input_tokens_seen": 18616037376, "step": 65450, "train_runtime": 636551.7329, "train_tokens_per_second": 29245.129 }, { "epoch": 2.316103023615291, "grad_norm": 0.58984375, "learning_rate": 1.8201806014544923e-05, "loss": 0.3902743816375732, "num_input_tokens_seen": 18618861184, "step": 65460, "train_runtime": 636644.9673, "train_tokens_per_second": 29245.281 }, { "epoch": 2.31645684387902, "grad_norm": 0.61328125, "learning_rate": 1.8200600061835143e-05, "loss": 0.3905118465423584, "num_input_tokens_seen": 18621689664, "step": 65470, "train_runtime": 636741.4679, "train_tokens_per_second": 29245.291 }, { "epoch": 2.3168106641427486, "grad_norm": 0.609375, "learning_rate": 1.8199394348793213e-05, "loss": 0.3878653526306152, "num_input_tokens_seen": 18624549248, "step": 65480, "train_runtime": 636838.7872, "train_tokens_per_second": 29245.312 }, { "epoch": 2.3171644844064776, "grad_norm": 0.609375, "learning_rate": 1.8198188875339767e-05, "loss": 0.3901439428329468, "num_input_tokens_seen": 18627419968, "step": 65490, "train_runtime": 636935.7204, "train_tokens_per_second": 29245.369 }, { "epoch": 2.317518304670206, "grad_norm": 0.60546875, "learning_rate": 1.8196983641395458e-05, "loss": 0.3875009298324585, "num_input_tokens_seen": 18630259328, "step": 65500, "train_runtime": 637030.9285, "train_tokens_per_second": 29245.455 }, { "epoch": 2.317872124933935, "grad_norm": 0.6015625, "learning_rate": 1.819577864688099e-05, "loss": 0.3852522611618042, "num_input_tokens_seen": 18633127296, "step": 65510, "train_runtime": 637127.8564, "train_tokens_per_second": 29245.507 }, { "epoch": 2.318225945197664, "grad_norm": 0.58984375, "learning_rate": 1.8194573891717096e-05, "loss": 0.38724446296691895, "num_input_tokens_seen": 18635986944, "step": 65520, "train_runtime": 637224.3972, "train_tokens_per_second": 29245.564 }, { "epoch": 2.3185797654613927, "grad_norm": 0.609375, "learning_rate": 1.819336937582455e-05, "loss": 0.38571667671203613, "num_input_tokens_seen": 18638905088, "step": 65530, "train_runtime": 637327.0636, "train_tokens_per_second": 29245.432 }, { "epoch": 2.3189335857251216, "grad_norm": 0.640625, "learning_rate": 1.8192165099124165e-05, "loss": 0.3846283435821533, "num_input_tokens_seen": 18641765184, "step": 65540, "train_runtime": 637425.5079, "train_tokens_per_second": 29245.402 }, { "epoch": 2.31928740598885, "grad_norm": 0.6328125, "learning_rate": 1.8190961061536783e-05, "loss": 0.38587141036987305, "num_input_tokens_seen": 18644563072, "step": 65550, "train_runtime": 637519.7526, "train_tokens_per_second": 29245.467 }, { "epoch": 2.319641226252579, "grad_norm": 0.63671875, "learning_rate": 1.8189757262983285e-05, "loss": 0.3852789878845215, "num_input_tokens_seen": 18647349824, "step": 65560, "train_runtime": 637612.4318, "train_tokens_per_second": 29245.587 }, { "epoch": 2.3199950465163077, "grad_norm": 0.63671875, "learning_rate": 1.818855370338459e-05, "loss": 0.38773860931396487, "num_input_tokens_seen": 18650167424, "step": 65570, "train_runtime": 637707.8408, "train_tokens_per_second": 29245.63 }, { "epoch": 2.3203488667800367, "grad_norm": 0.6015625, "learning_rate": 1.8187350382661664e-05, "loss": 0.38150548934936523, "num_input_tokens_seen": 18653026496, "step": 65580, "train_runtime": 637805.0661, "train_tokens_per_second": 29245.654 }, { "epoch": 2.3207026870437653, "grad_norm": 0.62109375, "learning_rate": 1.818614730073549e-05, "loss": 0.3881141901016235, "num_input_tokens_seen": 18655831808, "step": 65590, "train_runtime": 637898.5944, "train_tokens_per_second": 29245.764 }, { "epoch": 2.3210565073074942, "grad_norm": 0.64453125, "learning_rate": 1.81849444575271e-05, "loss": 0.38222854137420653, "num_input_tokens_seen": 18658701440, "step": 65600, "train_runtime": 637996.3308, "train_tokens_per_second": 29245.782 }, { "epoch": 2.321410327571223, "grad_norm": 0.62109375, "learning_rate": 1.818374185295756e-05, "loss": 0.3893751621246338, "num_input_tokens_seen": 18661548544, "step": 65610, "train_runtime": 638090.8655, "train_tokens_per_second": 29245.911 }, { "epoch": 2.3217641478349518, "grad_norm": 0.62109375, "learning_rate": 1.8182539486947967e-05, "loss": 0.38494224548339845, "num_input_tokens_seen": 18664386688, "step": 65620, "train_runtime": 638185.4847, "train_tokens_per_second": 29246.022 }, { "epoch": 2.3221179680986803, "grad_norm": 0.61328125, "learning_rate": 1.8181337359419467e-05, "loss": 0.3871985912322998, "num_input_tokens_seen": 18667199936, "step": 65630, "train_runtime": 638280.192, "train_tokens_per_second": 29246.09 }, { "epoch": 2.3224717883624093, "grad_norm": 0.62109375, "learning_rate": 1.8180135470293233e-05, "loss": 0.3882903099060059, "num_input_tokens_seen": 18670070528, "step": 65640, "train_runtime": 638380.8818, "train_tokens_per_second": 29245.974 }, { "epoch": 2.322825608626138, "grad_norm": 0.6171875, "learning_rate": 1.817893381949048e-05, "loss": 0.3839714527130127, "num_input_tokens_seen": 18672928768, "step": 65650, "train_runtime": 638477.9911, "train_tokens_per_second": 29246.002 }, { "epoch": 2.323179428889867, "grad_norm": 0.60546875, "learning_rate": 1.8177732406932444e-05, "loss": 0.38971834182739257, "num_input_tokens_seen": 18675744448, "step": 65660, "train_runtime": 638570.83, "train_tokens_per_second": 29246.16 }, { "epoch": 2.323533249153596, "grad_norm": 0.625, "learning_rate": 1.8176531232540427e-05, "loss": 0.389362096786499, "num_input_tokens_seen": 18678559424, "step": 65670, "train_runtime": 638665.0724, "train_tokens_per_second": 29246.252 }, { "epoch": 2.3238870694173244, "grad_norm": 0.59765625, "learning_rate": 1.8175330296235734e-05, "loss": 0.3869276762008667, "num_input_tokens_seen": 18681412992, "step": 65680, "train_runtime": 638762.8011, "train_tokens_per_second": 29246.244 }, { "epoch": 2.324240889681053, "grad_norm": 0.59765625, "learning_rate": 1.8174129597939733e-05, "loss": 0.38761887550354, "num_input_tokens_seen": 18684223744, "step": 65690, "train_runtime": 638857.9893, "train_tokens_per_second": 29246.286 }, { "epoch": 2.324594709944782, "grad_norm": 0.60546875, "learning_rate": 1.8172929137573813e-05, "loss": 0.3872941017150879, "num_input_tokens_seen": 18687058176, "step": 65700, "train_runtime": 638956.4801, "train_tokens_per_second": 29246.214 }, { "epoch": 2.324948530208511, "grad_norm": 0.6171875, "learning_rate": 1.8171728915059404e-05, "loss": 0.38887743949890136, "num_input_tokens_seen": 18689947136, "step": 65710, "train_runtime": 639055.4016, "train_tokens_per_second": 29246.208 }, { "epoch": 2.3253023504722394, "grad_norm": 0.61328125, "learning_rate": 1.817052893031798e-05, "loss": 0.3858642578125, "num_input_tokens_seen": 18692801856, "step": 65720, "train_runtime": 639151.0217, "train_tokens_per_second": 29246.299 }, { "epoch": 2.3256561707359684, "grad_norm": 0.609375, "learning_rate": 1.816932918327103e-05, "loss": 0.38456680774688723, "num_input_tokens_seen": 18695612672, "step": 65730, "train_runtime": 639246.767, "train_tokens_per_second": 29246.316 }, { "epoch": 2.326009990999697, "grad_norm": 0.65234375, "learning_rate": 1.8168129673840103e-05, "loss": 0.3868723392486572, "num_input_tokens_seen": 18698471744, "step": 65740, "train_runtime": 639344.4729, "train_tokens_per_second": 29246.318 }, { "epoch": 2.326363811263426, "grad_norm": 0.58984375, "learning_rate": 1.8166930401946775e-05, "loss": 0.38702569007873533, "num_input_tokens_seen": 18701272576, "step": 65750, "train_runtime": 639437.5184, "train_tokens_per_second": 29246.442 }, { "epoch": 2.3267176315271545, "grad_norm": 0.6171875, "learning_rate": 1.816573136751265e-05, "loss": 0.38517940044403076, "num_input_tokens_seen": 18704139328, "step": 65760, "train_runtime": 639533.5852, "train_tokens_per_second": 29246.532 }, { "epoch": 2.3270714517908835, "grad_norm": 0.62109375, "learning_rate": 1.8164532570459383e-05, "loss": 0.3821824073791504, "num_input_tokens_seen": 18707006848, "step": 65770, "train_runtime": 639631.086, "train_tokens_per_second": 29246.557 }, { "epoch": 2.327425272054612, "grad_norm": 0.64453125, "learning_rate": 1.8163334010708654e-05, "loss": 0.38336355686187745, "num_input_tokens_seen": 18709892928, "step": 65780, "train_runtime": 639728.5832, "train_tokens_per_second": 29246.611 }, { "epoch": 2.327779092318341, "grad_norm": 0.61328125, "learning_rate": 1.8162135688182183e-05, "loss": 0.38662965297698976, "num_input_tokens_seen": 18712777408, "step": 65790, "train_runtime": 639827.0812, "train_tokens_per_second": 29246.617 }, { "epoch": 2.3281329125820696, "grad_norm": 0.62109375, "learning_rate": 1.8160937602801726e-05, "loss": 0.3911834478378296, "num_input_tokens_seen": 18715626432, "step": 65800, "train_runtime": 639925.2329, "train_tokens_per_second": 29246.583 }, { "epoch": 2.3284867328457985, "grad_norm": 0.640625, "learning_rate": 1.815973975448908e-05, "loss": 0.38278281688690186, "num_input_tokens_seen": 18718445888, "step": 65810, "train_runtime": 640021.4856, "train_tokens_per_second": 29246.59 }, { "epoch": 2.328840553109527, "grad_norm": 0.6484375, "learning_rate": 1.8158542143166065e-05, "loss": 0.38755595684051514, "num_input_tokens_seen": 18721253184, "step": 65820, "train_runtime": 640116.7987, "train_tokens_per_second": 29246.621 }, { "epoch": 2.329194373373256, "grad_norm": 0.6171875, "learning_rate": 1.8157344768754553e-05, "loss": 0.3937510013580322, "num_input_tokens_seen": 18724112320, "step": 65830, "train_runtime": 640214.1708, "train_tokens_per_second": 29246.638 }, { "epoch": 2.3295481936369846, "grad_norm": 0.6171875, "learning_rate": 1.8156147631176442e-05, "loss": 0.38613576889038087, "num_input_tokens_seen": 18726930880, "step": 65840, "train_runtime": 640308.373, "train_tokens_per_second": 29246.737 }, { "epoch": 2.3299020139007136, "grad_norm": 0.640625, "learning_rate": 1.815495073035367e-05, "loss": 0.3827350616455078, "num_input_tokens_seen": 18729769408, "step": 65850, "train_runtime": 640404.8797, "train_tokens_per_second": 29246.762 }, { "epoch": 2.3302558341644426, "grad_norm": 0.6015625, "learning_rate": 1.8153754066208205e-05, "loss": 0.3805245876312256, "num_input_tokens_seen": 18732633152, "step": 65860, "train_runtime": 640501.7894, "train_tokens_per_second": 29246.808 }, { "epoch": 2.330609654428171, "grad_norm": 0.6171875, "learning_rate": 1.815255763866206e-05, "loss": 0.3851560354232788, "num_input_tokens_seen": 18735486784, "step": 65870, "train_runtime": 640599.2072, "train_tokens_per_second": 29246.815 }, { "epoch": 2.3309634746919, "grad_norm": 0.62890625, "learning_rate": 1.815136144763728e-05, "loss": 0.3921637058258057, "num_input_tokens_seen": 18738361472, "step": 65880, "train_runtime": 640698.4072, "train_tokens_per_second": 29246.774 }, { "epoch": 2.3313172949556287, "grad_norm": 0.625, "learning_rate": 1.815016549305594e-05, "loss": 0.3898458480834961, "num_input_tokens_seen": 18741237696, "step": 65890, "train_runtime": 640800.4233, "train_tokens_per_second": 29246.606 }, { "epoch": 2.3316711152193577, "grad_norm": 0.5859375, "learning_rate": 1.8148969774840164e-05, "loss": 0.3838940143585205, "num_input_tokens_seen": 18744061760, "step": 65900, "train_runtime": 640893.4113, "train_tokens_per_second": 29246.769 }, { "epoch": 2.332024935483086, "grad_norm": 0.60546875, "learning_rate": 1.81477742929121e-05, "loss": 0.38811526298522947, "num_input_tokens_seen": 18746900800, "step": 65910, "train_runtime": 640988.6602, "train_tokens_per_second": 29246.853 }, { "epoch": 2.332378755746815, "grad_norm": 0.63671875, "learning_rate": 1.8146579047193934e-05, "loss": 0.3865293025970459, "num_input_tokens_seen": 18749736960, "step": 65920, "train_runtime": 641083.4656, "train_tokens_per_second": 29246.951 }, { "epoch": 2.3327325760105437, "grad_norm": 0.61328125, "learning_rate": 1.8145384037607897e-05, "loss": 0.39019017219543456, "num_input_tokens_seen": 18752535488, "step": 65930, "train_runtime": 641177.5922, "train_tokens_per_second": 29247.023 }, { "epoch": 2.3330863962742727, "grad_norm": 0.625, "learning_rate": 1.814418926407624e-05, "loss": 0.38755249977111816, "num_input_tokens_seen": 18755344768, "step": 65940, "train_runtime": 641274.6151, "train_tokens_per_second": 29246.978 }, { "epoch": 2.3334402165380013, "grad_norm": 0.609375, "learning_rate": 1.814299472652127e-05, "loss": 0.3913054227828979, "num_input_tokens_seen": 18758153088, "step": 65950, "train_runtime": 641369.1982, "train_tokens_per_second": 29247.044 }, { "epoch": 2.3337940368017303, "grad_norm": 0.58984375, "learning_rate": 1.8141800424865312e-05, "loss": 0.38626272678375245, "num_input_tokens_seen": 18761029760, "step": 65960, "train_runtime": 641471.081, "train_tokens_per_second": 29246.883 }, { "epoch": 2.334147857065459, "grad_norm": 0.62890625, "learning_rate": 1.814060635903073e-05, "loss": 0.3903139352798462, "num_input_tokens_seen": 18763859392, "step": 65970, "train_runtime": 641566.7502, "train_tokens_per_second": 29246.932 }, { "epoch": 2.334501677329188, "grad_norm": 0.61328125, "learning_rate": 1.8139412528939936e-05, "loss": 0.3872283220291138, "num_input_tokens_seen": 18766739456, "step": 65980, "train_runtime": 641663.7352, "train_tokens_per_second": 29247.0 }, { "epoch": 2.3348554975929163, "grad_norm": 0.58984375, "learning_rate": 1.8138218934515365e-05, "loss": 0.38320231437683105, "num_input_tokens_seen": 18769582080, "step": 65990, "train_runtime": 641758.1845, "train_tokens_per_second": 29247.125 }, { "epoch": 2.3352093178566453, "grad_norm": 0.625, "learning_rate": 1.8137025575679486e-05, "loss": 0.38507232666015623, "num_input_tokens_seen": 18772463872, "step": 66000, "train_runtime": 641859.2814, "train_tokens_per_second": 29247.009 }, { "epoch": 2.3355631381203743, "grad_norm": 0.62890625, "learning_rate": 1.8135832452354816e-05, "loss": 0.38588366508483884, "num_input_tokens_seen": 18775306816, "step": 66010, "train_runtime": 641958.3687, "train_tokens_per_second": 29246.923 }, { "epoch": 2.335916958384103, "grad_norm": 0.6171875, "learning_rate": 1.8134639564463902e-05, "loss": 0.3845822811126709, "num_input_tokens_seen": 18778154816, "step": 66020, "train_runtime": 642053.3225, "train_tokens_per_second": 29247.033 }, { "epoch": 2.3362707786478314, "grad_norm": 0.58984375, "learning_rate": 1.8133446911929316e-05, "loss": 0.3836571216583252, "num_input_tokens_seen": 18781012096, "step": 66030, "train_runtime": 642151.9568, "train_tokens_per_second": 29246.99 }, { "epoch": 2.3366245989115604, "grad_norm": 0.6015625, "learning_rate": 1.813225449467369e-05, "loss": 0.3847710132598877, "num_input_tokens_seen": 18783775872, "step": 66040, "train_runtime": 642245.0448, "train_tokens_per_second": 29247.055 }, { "epoch": 2.3369784191752894, "grad_norm": 0.6015625, "learning_rate": 1.8131062312619663e-05, "loss": 0.38940436840057374, "num_input_tokens_seen": 18786629696, "step": 66050, "train_runtime": 642344.5377, "train_tokens_per_second": 29246.967 }, { "epoch": 2.337332239439018, "grad_norm": 0.63671875, "learning_rate": 1.8129870365689933e-05, "loss": 0.3868520736694336, "num_input_tokens_seen": 18789471104, "step": 66060, "train_runtime": 642442.6671, "train_tokens_per_second": 29246.923 }, { "epoch": 2.337686059702747, "grad_norm": 0.625, "learning_rate": 1.812867865380722e-05, "loss": 0.38232736587524413, "num_input_tokens_seen": 18792219776, "step": 66070, "train_runtime": 642532.2414, "train_tokens_per_second": 29247.123 }, { "epoch": 2.3380398799664754, "grad_norm": 0.64453125, "learning_rate": 1.8127487176894286e-05, "loss": 0.3905600070953369, "num_input_tokens_seen": 18795002688, "step": 66080, "train_runtime": 642626.7007, "train_tokens_per_second": 29247.155 }, { "epoch": 2.3383937002302044, "grad_norm": 0.625, "learning_rate": 1.8126295934873926e-05, "loss": 0.3846308708190918, "num_input_tokens_seen": 18797805056, "step": 66090, "train_runtime": 642721.4829, "train_tokens_per_second": 29247.202 }, { "epoch": 2.338747520493933, "grad_norm": 0.609375, "learning_rate": 1.8125104927668964e-05, "loss": 0.38696794509887694, "num_input_tokens_seen": 18800643456, "step": 66100, "train_runtime": 642819.4424, "train_tokens_per_second": 29247.161 }, { "epoch": 2.339101340757662, "grad_norm": 0.59375, "learning_rate": 1.8123914155202273e-05, "loss": 0.3825960636138916, "num_input_tokens_seen": 18803516992, "step": 66110, "train_runtime": 642918.9863, "train_tokens_per_second": 29247.102 }, { "epoch": 2.3394551610213905, "grad_norm": 0.609375, "learning_rate": 1.8122723617396757e-05, "loss": 0.3834648609161377, "num_input_tokens_seen": 18806350144, "step": 66120, "train_runtime": 643016.338, "train_tokens_per_second": 29247.08 }, { "epoch": 2.3398089812851195, "grad_norm": 0.64453125, "learning_rate": 1.8121533314175345e-05, "loss": 0.385701847076416, "num_input_tokens_seen": 18809254528, "step": 66130, "train_runtime": 643114.8653, "train_tokens_per_second": 29247.115 }, { "epoch": 2.340162801548848, "grad_norm": 0.62109375, "learning_rate": 1.8120343245461015e-05, "loss": 0.38894429206848147, "num_input_tokens_seen": 18812083584, "step": 66140, "train_runtime": 643209.6227, "train_tokens_per_second": 29247.205 }, { "epoch": 2.340516621812577, "grad_norm": 0.63671875, "learning_rate": 1.8119153411176775e-05, "loss": 0.38922088146209716, "num_input_tokens_seen": 18814965056, "step": 66150, "train_runtime": 643308.0302, "train_tokens_per_second": 29247.21 }, { "epoch": 2.3408704420763056, "grad_norm": 0.63671875, "learning_rate": 1.8117963811245663e-05, "loss": 0.39129436016082764, "num_input_tokens_seen": 18817774016, "step": 66160, "train_runtime": 643404.259, "train_tokens_per_second": 29247.202 }, { "epoch": 2.3412242623400346, "grad_norm": 0.6015625, "learning_rate": 1.8116774445590763e-05, "loss": 0.3829531192779541, "num_input_tokens_seen": 18820576064, "step": 66170, "train_runtime": 643498.3129, "train_tokens_per_second": 29247.281 }, { "epoch": 2.341578082603763, "grad_norm": 0.6171875, "learning_rate": 1.811558531413519e-05, "loss": 0.3856523036956787, "num_input_tokens_seen": 18823359872, "step": 66180, "train_runtime": 643593.1088, "train_tokens_per_second": 29247.299 }, { "epoch": 2.341931902867492, "grad_norm": 0.6171875, "learning_rate": 1.8114396416802094e-05, "loss": 0.3844825267791748, "num_input_tokens_seen": 18826234368, "step": 66190, "train_runtime": 643692.166, "train_tokens_per_second": 29247.263 }, { "epoch": 2.342285723131221, "grad_norm": 0.58984375, "learning_rate": 1.8113207753514652e-05, "loss": 0.38792896270751953, "num_input_tokens_seen": 18829086336, "step": 66200, "train_runtime": 643788.881, "train_tokens_per_second": 29247.3 }, { "epoch": 2.3426395433949496, "grad_norm": 0.609375, "learning_rate": 1.8112019324196088e-05, "loss": 0.39226531982421875, "num_input_tokens_seen": 18831936704, "step": 66210, "train_runtime": 643885.464, "train_tokens_per_second": 29247.339 }, { "epoch": 2.3429933636586786, "grad_norm": 0.60546875, "learning_rate": 1.811083112876966e-05, "loss": 0.3846435546875, "num_input_tokens_seen": 18834722496, "step": 66220, "train_runtime": 643977.9275, "train_tokens_per_second": 29247.466 }, { "epoch": 2.343347183922407, "grad_norm": 0.62109375, "learning_rate": 1.8109643167158653e-05, "loss": 0.38691723346710205, "num_input_tokens_seen": 18837561088, "step": 66230, "train_runtime": 644074.8959, "train_tokens_per_second": 29247.47 }, { "epoch": 2.343701004186136, "grad_norm": 0.60546875, "learning_rate": 1.8108455439286402e-05, "loss": 0.3878159999847412, "num_input_tokens_seen": 18840350976, "step": 66240, "train_runtime": 644167.466, "train_tokens_per_second": 29247.598 }, { "epoch": 2.3440548244498647, "grad_norm": 0.625, "learning_rate": 1.8107267945076254e-05, "loss": 0.38343660831451415, "num_input_tokens_seen": 18843199936, "step": 66250, "train_runtime": 644265.0498, "train_tokens_per_second": 29247.59 }, { "epoch": 2.3444086447135937, "grad_norm": 0.62109375, "learning_rate": 1.810608068445162e-05, "loss": 0.38767142295837403, "num_input_tokens_seen": 18846032704, "step": 66260, "train_runtime": 644359.0772, "train_tokens_per_second": 29247.718 }, { "epoch": 2.344762464977322, "grad_norm": 0.63671875, "learning_rate": 1.8104893657335918e-05, "loss": 0.3838646411895752, "num_input_tokens_seen": 18848898560, "step": 66270, "train_runtime": 644456.4573, "train_tokens_per_second": 29247.746 }, { "epoch": 2.345116285241051, "grad_norm": 0.63671875, "learning_rate": 1.810370686365262e-05, "loss": 0.3861142635345459, "num_input_tokens_seen": 18851771072, "step": 66280, "train_runtime": 644556.4751, "train_tokens_per_second": 29247.664 }, { "epoch": 2.3454701055047797, "grad_norm": 0.6015625, "learning_rate": 1.810252030332523e-05, "loss": 0.38788437843322754, "num_input_tokens_seen": 18854587648, "step": 66290, "train_runtime": 644653.0426, "train_tokens_per_second": 29247.652 }, { "epoch": 2.3458239257685087, "grad_norm": 0.60546875, "learning_rate": 1.8101333976277282e-05, "loss": 0.38442020416259765, "num_input_tokens_seen": 18857386176, "step": 66300, "train_runtime": 644748.6271, "train_tokens_per_second": 29247.656 }, { "epoch": 2.3461777460322373, "grad_norm": 0.63671875, "learning_rate": 1.8100147882432346e-05, "loss": 0.3865343570709229, "num_input_tokens_seen": 18860248448, "step": 66310, "train_runtime": 644847.002, "train_tokens_per_second": 29247.633 }, { "epoch": 2.3465315662959663, "grad_norm": 0.625, "learning_rate": 1.8098962021714032e-05, "loss": 0.3854925870895386, "num_input_tokens_seen": 18863064320, "step": 66320, "train_runtime": 644943.0405, "train_tokens_per_second": 29247.644 }, { "epoch": 2.346885386559695, "grad_norm": 0.609375, "learning_rate": 1.8097776394045977e-05, "loss": 0.3840511322021484, "num_input_tokens_seen": 18865859712, "step": 66330, "train_runtime": 645036.4179, "train_tokens_per_second": 29247.744 }, { "epoch": 2.347239206823424, "grad_norm": 0.6328125, "learning_rate": 1.8096590999351865e-05, "loss": 0.3879375457763672, "num_input_tokens_seen": 18868693952, "step": 66340, "train_runtime": 645131.5674, "train_tokens_per_second": 29247.823 }, { "epoch": 2.347593027087153, "grad_norm": 0.625, "learning_rate": 1.8095405837555397e-05, "loss": 0.3843435764312744, "num_input_tokens_seen": 18871519552, "step": 66350, "train_runtime": 645230.1334, "train_tokens_per_second": 29247.734 }, { "epoch": 2.3479468473508813, "grad_norm": 0.62109375, "learning_rate": 1.809422090858033e-05, "loss": 0.3864013195037842, "num_input_tokens_seen": 18874326400, "step": 66360, "train_runtime": 645329.0799, "train_tokens_per_second": 29247.599 }, { "epoch": 2.3483006676146103, "grad_norm": 0.60546875, "learning_rate": 1.809303621235044e-05, "loss": 0.38490939140319824, "num_input_tokens_seen": 18877182784, "step": 66370, "train_runtime": 645428.3269, "train_tokens_per_second": 29247.528 }, { "epoch": 2.348654487878339, "grad_norm": 0.62890625, "learning_rate": 1.8091851748789548e-05, "loss": 0.38621280193328855, "num_input_tokens_seen": 18880003776, "step": 66380, "train_runtime": 645525.1182, "train_tokens_per_second": 29247.512 }, { "epoch": 2.349008308142068, "grad_norm": 0.625, "learning_rate": 1.80906675178215e-05, "loss": 0.3870787382125854, "num_input_tokens_seen": 18882870144, "step": 66390, "train_runtime": 645622.1936, "train_tokens_per_second": 29247.554 }, { "epoch": 2.3493621284057964, "grad_norm": 0.625, "learning_rate": 1.808948351937018e-05, "loss": 0.387070894241333, "num_input_tokens_seen": 18885742848, "step": 66400, "train_runtime": 645722.4224, "train_tokens_per_second": 29247.463 }, { "epoch": 2.3497159486695254, "grad_norm": 0.58984375, "learning_rate": 1.808829975335952e-05, "loss": 0.38469786643981935, "num_input_tokens_seen": 18888581888, "step": 66410, "train_runtime": 645818.56, "train_tokens_per_second": 29247.506 }, { "epoch": 2.350069768933254, "grad_norm": 0.6328125, "learning_rate": 1.8087116219713467e-05, "loss": 0.3849670648574829, "num_input_tokens_seen": 18891465728, "step": 66420, "train_runtime": 645920.2036, "train_tokens_per_second": 29247.368 }, { "epoch": 2.350423589196983, "grad_norm": 0.6171875, "learning_rate": 1.8085932918356015e-05, "loss": 0.39301486015319825, "num_input_tokens_seen": 18894308736, "step": 66430, "train_runtime": 646016.2967, "train_tokens_per_second": 29247.418 }, { "epoch": 2.3507774094607115, "grad_norm": 0.62890625, "learning_rate": 1.8084749849211188e-05, "loss": 0.3868676424026489, "num_input_tokens_seen": 18897165888, "step": 66440, "train_runtime": 646110.6441, "train_tokens_per_second": 29247.569 }, { "epoch": 2.3511312297244404, "grad_norm": 0.61328125, "learning_rate": 1.8083567012203052e-05, "loss": 0.3886558055877686, "num_input_tokens_seen": 18900017216, "step": 66450, "train_runtime": 646209.5855, "train_tokens_per_second": 29247.504 }, { "epoch": 2.351485049988169, "grad_norm": 0.609375, "learning_rate": 1.808238440725569e-05, "loss": 0.3784471988677979, "num_input_tokens_seen": 18902877056, "step": 66460, "train_runtime": 646306.3435, "train_tokens_per_second": 29247.55 }, { "epoch": 2.351838870251898, "grad_norm": 0.63671875, "learning_rate": 1.8081202034293245e-05, "loss": 0.3872998237609863, "num_input_tokens_seen": 18905723136, "step": 66470, "train_runtime": 646404.2408, "train_tokens_per_second": 29247.523 }, { "epoch": 2.3521926905156265, "grad_norm": 0.6171875, "learning_rate": 1.808001989323987e-05, "loss": 0.3838960647583008, "num_input_tokens_seen": 18908575936, "step": 66480, "train_runtime": 646500.4465, "train_tokens_per_second": 29247.584 }, { "epoch": 2.3525465107793555, "grad_norm": 0.60546875, "learning_rate": 1.807883798401978e-05, "loss": 0.38517446517944337, "num_input_tokens_seen": 18911356288, "step": 66490, "train_runtime": 646593.5346, "train_tokens_per_second": 29247.673 }, { "epoch": 2.3529003310430845, "grad_norm": 0.609375, "learning_rate": 1.8077656306557196e-05, "loss": 0.3873758316040039, "num_input_tokens_seen": 18914208448, "step": 66500, "train_runtime": 646692.2892, "train_tokens_per_second": 29247.617 }, { "epoch": 2.353254151306813, "grad_norm": 0.6171875, "learning_rate": 1.8076474860776387e-05, "loss": 0.38544299602508547, "num_input_tokens_seen": 18917053952, "step": 66510, "train_runtime": 646788.3514, "train_tokens_per_second": 29247.673 }, { "epoch": 2.3536079715705416, "grad_norm": 0.609375, "learning_rate": 1.807529364660166e-05, "loss": 0.38534984588623045, "num_input_tokens_seen": 18919881536, "step": 66520, "train_runtime": 646886.3583, "train_tokens_per_second": 29247.612 }, { "epoch": 2.3539617918342706, "grad_norm": 0.62890625, "learning_rate": 1.8074112663957353e-05, "loss": 0.3883091449737549, "num_input_tokens_seen": 18922675456, "step": 66530, "train_runtime": 646980.6405, "train_tokens_per_second": 29247.669 }, { "epoch": 2.3543156120979996, "grad_norm": 0.609375, "learning_rate": 1.8072931912767843e-05, "loss": 0.384459924697876, "num_input_tokens_seen": 18925517760, "step": 66540, "train_runtime": 647077.0155, "train_tokens_per_second": 29247.705 }, { "epoch": 2.354669432361728, "grad_norm": 0.6171875, "learning_rate": 1.807175139295753e-05, "loss": 0.38231282234191893, "num_input_tokens_seen": 18928376128, "step": 66550, "train_runtime": 647176.8396, "train_tokens_per_second": 29247.61 }, { "epoch": 2.355023252625457, "grad_norm": 0.63671875, "learning_rate": 1.8070571104450855e-05, "loss": 0.3841726303100586, "num_input_tokens_seen": 18931240256, "step": 66560, "train_runtime": 647277.1317, "train_tokens_per_second": 29247.504 }, { "epoch": 2.3553770728891856, "grad_norm": 0.60546875, "learning_rate": 1.8069391047172297e-05, "loss": 0.3860349416732788, "num_input_tokens_seen": 18934033152, "step": 66570, "train_runtime": 647371.6176, "train_tokens_per_second": 29247.549 }, { "epoch": 2.3557308931529146, "grad_norm": 0.62109375, "learning_rate": 1.8068211221046367e-05, "loss": 0.38725550174713136, "num_input_tokens_seen": 18936829376, "step": 66580, "train_runtime": 647465.053, "train_tokens_per_second": 29247.647 }, { "epoch": 2.356084713416643, "grad_norm": 0.60546875, "learning_rate": 1.8067031625997616e-05, "loss": 0.3895761489868164, "num_input_tokens_seen": 18939639552, "step": 66590, "train_runtime": 647558.7382, "train_tokens_per_second": 29247.755 }, { "epoch": 2.356438533680372, "grad_norm": 0.62109375, "learning_rate": 1.8065852261950612e-05, "loss": 0.3881476879119873, "num_input_tokens_seen": 18942461440, "step": 66600, "train_runtime": 647653.8605, "train_tokens_per_second": 29247.817 }, { "epoch": 2.3567923539441007, "grad_norm": 0.61328125, "learning_rate": 1.8064673128829977e-05, "loss": 0.38766913414001464, "num_input_tokens_seen": 18945258304, "step": 66610, "train_runtime": 647747.509, "train_tokens_per_second": 29247.906 }, { "epoch": 2.3571461742078297, "grad_norm": 0.625, "learning_rate": 1.8063494226560355e-05, "loss": 0.38472020626068115, "num_input_tokens_seen": 18948082688, "step": 66620, "train_runtime": 647842.5085, "train_tokens_per_second": 29247.977 }, { "epoch": 2.3574999944715582, "grad_norm": 0.61328125, "learning_rate": 1.8062315555066432e-05, "loss": 0.3879100799560547, "num_input_tokens_seen": 18950908864, "step": 66630, "train_runtime": 647937.4518, "train_tokens_per_second": 29248.053 }, { "epoch": 2.357853814735287, "grad_norm": 0.6171875, "learning_rate": 1.8061137114272934e-05, "loss": 0.3836753606796265, "num_input_tokens_seen": 18953769920, "step": 66640, "train_runtime": 648036.104, "train_tokens_per_second": 29248.015 }, { "epoch": 2.3582076349990158, "grad_norm": 0.609375, "learning_rate": 1.8059958904104592e-05, "loss": 0.3854692459106445, "num_input_tokens_seen": 18956558976, "step": 66650, "train_runtime": 648127.7377, "train_tokens_per_second": 29248.183 }, { "epoch": 2.3585614552627447, "grad_norm": 0.6171875, "learning_rate": 1.8058780924486212e-05, "loss": 0.3840113639831543, "num_input_tokens_seen": 18959454272, "step": 66660, "train_runtime": 648228.805, "train_tokens_per_second": 29248.09 }, { "epoch": 2.3589152755264733, "grad_norm": 0.60546875, "learning_rate": 1.8057603175342603e-05, "loss": 0.3865053176879883, "num_input_tokens_seen": 18962273984, "step": 66670, "train_runtime": 648324.1628, "train_tokens_per_second": 29248.137 }, { "epoch": 2.3592690957902023, "grad_norm": 0.5703125, "learning_rate": 1.8056425656598623e-05, "loss": 0.38563454151153564, "num_input_tokens_seen": 18965111808, "step": 66680, "train_runtime": 648418.8958, "train_tokens_per_second": 29248.24 }, { "epoch": 2.3596229160539313, "grad_norm": 0.6328125, "learning_rate": 1.805524836817916e-05, "loss": 0.3880745887756348, "num_input_tokens_seen": 18967973248, "step": 66690, "train_runtime": 648518.2619, "train_tokens_per_second": 29248.171 }, { "epoch": 2.35997673631766, "grad_norm": 0.59765625, "learning_rate": 1.8054071310009144e-05, "loss": 0.3890956401824951, "num_input_tokens_seen": 18970783296, "step": 66700, "train_runtime": 648615.0094, "train_tokens_per_second": 29248.141 }, { "epoch": 2.360330556581389, "grad_norm": 0.6015625, "learning_rate": 1.8052894482013526e-05, "loss": 0.3844252347946167, "num_input_tokens_seen": 18973634560, "step": 66710, "train_runtime": 648713.7525, "train_tokens_per_second": 29248.084 }, { "epoch": 2.3606843768451173, "grad_norm": 0.62890625, "learning_rate": 1.80517178841173e-05, "loss": 0.3907251596450806, "num_input_tokens_seen": 18976445888, "step": 66720, "train_runtime": 648808.1675, "train_tokens_per_second": 29248.161 }, { "epoch": 2.3610381971088463, "grad_norm": 0.6015625, "learning_rate": 1.805054151624549e-05, "loss": 0.3880284070968628, "num_input_tokens_seen": 18979350976, "step": 66730, "train_runtime": 648908.7899, "train_tokens_per_second": 29248.103 }, { "epoch": 2.361392017372575, "grad_norm": 0.62109375, "learning_rate": 1.8049365378323154e-05, "loss": 0.38728818893432615, "num_input_tokens_seen": 18982182400, "step": 66740, "train_runtime": 649005.3534, "train_tokens_per_second": 29248.114 }, { "epoch": 2.361745837636304, "grad_norm": 0.62890625, "learning_rate": 1.8048189470275397e-05, "loss": 0.3859985828399658, "num_input_tokens_seen": 18985068800, "step": 66750, "train_runtime": 649102.5821, "train_tokens_per_second": 29248.179 }, { "epoch": 2.3620996579000324, "grad_norm": 0.59765625, "learning_rate": 1.804701379202734e-05, "loss": 0.38720026016235354, "num_input_tokens_seen": 18987914560, "step": 66760, "train_runtime": 649200.1359, "train_tokens_per_second": 29248.168 }, { "epoch": 2.3624534781637614, "grad_norm": 0.609375, "learning_rate": 1.8045838343504142e-05, "loss": 0.3851181983947754, "num_input_tokens_seen": 18990767360, "step": 66770, "train_runtime": 649297.6939, "train_tokens_per_second": 29248.167 }, { "epoch": 2.36280729842749, "grad_norm": 0.578125, "learning_rate": 1.8044663124631007e-05, "loss": 0.3856996536254883, "num_input_tokens_seen": 18993610112, "step": 66780, "train_runtime": 649397.4844, "train_tokens_per_second": 29248.05 }, { "epoch": 2.363161118691219, "grad_norm": 0.61328125, "learning_rate": 1.8043488135333166e-05, "loss": 0.3841752052307129, "num_input_tokens_seen": 18996413312, "step": 66790, "train_runtime": 649492.3725, "train_tokens_per_second": 29248.093 }, { "epoch": 2.3635149389549475, "grad_norm": 0.63671875, "learning_rate": 1.804231337553588e-05, "loss": 0.3858665466308594, "num_input_tokens_seen": 18999240960, "step": 66800, "train_runtime": 649588.3122, "train_tokens_per_second": 29248.126 }, { "epoch": 2.3638687592186765, "grad_norm": 0.6015625, "learning_rate": 1.804113884516445e-05, "loss": 0.38831095695495604, "num_input_tokens_seen": 19002115392, "step": 66810, "train_runtime": 649685.1296, "train_tokens_per_second": 29248.192 }, { "epoch": 2.364222579482405, "grad_norm": 0.609375, "learning_rate": 1.803996454414421e-05, "loss": 0.3856593132019043, "num_input_tokens_seen": 19004939456, "step": 66820, "train_runtime": 649780.1918, "train_tokens_per_second": 29248.259 }, { "epoch": 2.364576399746134, "grad_norm": 0.6015625, "learning_rate": 1.803879047240052e-05, "loss": 0.3851649761199951, "num_input_tokens_seen": 19007806976, "step": 66830, "train_runtime": 649879.3818, "train_tokens_per_second": 29248.207 }, { "epoch": 2.364930220009863, "grad_norm": 0.63671875, "learning_rate": 1.8037616629858794e-05, "loss": 0.3904259443283081, "num_input_tokens_seen": 19010648704, "step": 66840, "train_runtime": 649977.205, "train_tokens_per_second": 29248.178 }, { "epoch": 2.3652840402735915, "grad_norm": 0.6015625, "learning_rate": 1.803644301644446e-05, "loss": 0.38640198707580564, "num_input_tokens_seen": 19013491520, "step": 66850, "train_runtime": 650070.1276, "train_tokens_per_second": 29248.37 }, { "epoch": 2.36563786053732, "grad_norm": 0.59765625, "learning_rate": 1.8035269632082984e-05, "loss": 0.38723571300506593, "num_input_tokens_seen": 19016368320, "step": 66860, "train_runtime": 650170.072, "train_tokens_per_second": 29248.298 }, { "epoch": 2.365991680801049, "grad_norm": 0.62890625, "learning_rate": 1.8034096476699873e-05, "loss": 0.3838082790374756, "num_input_tokens_seen": 19019231680, "step": 66870, "train_runtime": 650269.4669, "train_tokens_per_second": 29248.231 }, { "epoch": 2.366345501064778, "grad_norm": 0.60546875, "learning_rate": 1.8032923550220667e-05, "loss": 0.38194947242736815, "num_input_tokens_seen": 19022032128, "step": 66880, "train_runtime": 650365.9442, "train_tokens_per_second": 29248.198 }, { "epoch": 2.3666993213285066, "grad_norm": 0.6484375, "learning_rate": 1.803175085257093e-05, "loss": 0.38920769691467283, "num_input_tokens_seen": 19024924416, "step": 66890, "train_runtime": 650466.4228, "train_tokens_per_second": 29248.127 }, { "epoch": 2.3670531415922356, "grad_norm": 0.65625, "learning_rate": 1.8030578383676272e-05, "loss": 0.3835707902908325, "num_input_tokens_seen": 19027770240, "step": 66900, "train_runtime": 650565.5491, "train_tokens_per_second": 29248.045 }, { "epoch": 2.367406961855964, "grad_norm": 0.6484375, "learning_rate": 1.8029406143462326e-05, "loss": 0.39029593467712403, "num_input_tokens_seen": 19030609344, "step": 66910, "train_runtime": 650662.2479, "train_tokens_per_second": 29248.061 }, { "epoch": 2.367760782119693, "grad_norm": 0.6015625, "learning_rate": 1.8028234131854774e-05, "loss": 0.3825751781463623, "num_input_tokens_seen": 19033486464, "step": 66920, "train_runtime": 650759.6986, "train_tokens_per_second": 29248.103 }, { "epoch": 2.3681146023834216, "grad_norm": 0.61328125, "learning_rate": 1.8027062348779313e-05, "loss": 0.3817171573638916, "num_input_tokens_seen": 19036277568, "step": 66930, "train_runtime": 650855.6204, "train_tokens_per_second": 29248.08 }, { "epoch": 2.3684684226471506, "grad_norm": 0.61328125, "learning_rate": 1.802589079416168e-05, "loss": 0.38561415672302246, "num_input_tokens_seen": 19039119552, "step": 66940, "train_runtime": 650948.9906, "train_tokens_per_second": 29248.251 }, { "epoch": 2.368822242910879, "grad_norm": 0.59375, "learning_rate": 1.8024719467927664e-05, "loss": 0.38842480182647704, "num_input_tokens_seen": 19042012416, "step": 66950, "train_runtime": 651051.8933, "train_tokens_per_second": 29248.072 }, { "epoch": 2.369176063174608, "grad_norm": 0.62109375, "learning_rate": 1.8023548370003062e-05, "loss": 0.38610038757324217, "num_input_tokens_seen": 19044805184, "step": 66960, "train_runtime": 651145.5184, "train_tokens_per_second": 29248.155 }, { "epoch": 2.3695298834383367, "grad_norm": 0.6015625, "learning_rate": 1.8022377500313714e-05, "loss": 0.38412020206451414, "num_input_tokens_seen": 19047623872, "step": 66970, "train_runtime": 651240.1106, "train_tokens_per_second": 29248.235 }, { "epoch": 2.3698837037020657, "grad_norm": 0.59375, "learning_rate": 1.80212068587855e-05, "loss": 0.387067985534668, "num_input_tokens_seen": 19050525824, "step": 66980, "train_runtime": 651340.3006, "train_tokens_per_second": 29248.191 }, { "epoch": 2.3702375239657942, "grad_norm": 0.6171875, "learning_rate": 1.8020036445344325e-05, "loss": 0.3839916467666626, "num_input_tokens_seen": 19053351168, "step": 66990, "train_runtime": 651436.9939, "train_tokens_per_second": 29248.187 }, { "epoch": 2.3705913442295232, "grad_norm": 0.6171875, "learning_rate": 1.8018866259916134e-05, "loss": 0.3910531044006348, "num_input_tokens_seen": 19056236480, "step": 67000, "train_runtime": 651534.7595, "train_tokens_per_second": 29248.227 }, { "epoch": 2.3709451644932518, "grad_norm": 0.60546875, "learning_rate": 1.8017696302426904e-05, "loss": 0.3840883016586304, "num_input_tokens_seen": 19059105792, "step": 67010, "train_runtime": 651632.3382, "train_tokens_per_second": 29248.25 }, { "epoch": 2.3712989847569808, "grad_norm": 0.64453125, "learning_rate": 1.801652657280264e-05, "loss": 0.38502113819122313, "num_input_tokens_seen": 19061936128, "step": 67020, "train_runtime": 651727.936, "train_tokens_per_second": 29248.303 }, { "epoch": 2.3716528050207097, "grad_norm": 0.62109375, "learning_rate": 1.8015357070969387e-05, "loss": 0.3863154172897339, "num_input_tokens_seen": 19064763584, "step": 67030, "train_runtime": 651823.9772, "train_tokens_per_second": 29248.331 }, { "epoch": 2.3720066252844383, "grad_norm": 0.6171875, "learning_rate": 1.801418779685323e-05, "loss": 0.3895847320556641, "num_input_tokens_seen": 19067641472, "step": 67040, "train_runtime": 651921.2878, "train_tokens_per_second": 29248.38 }, { "epoch": 2.3723604455481673, "grad_norm": 0.6171875, "learning_rate": 1.8013018750380265e-05, "loss": 0.38856494426727295, "num_input_tokens_seen": 19070533248, "step": 67050, "train_runtime": 652022.4864, "train_tokens_per_second": 29248.275 }, { "epoch": 2.372714265811896, "grad_norm": 0.62890625, "learning_rate": 1.8011849931476647e-05, "loss": 0.3876237154006958, "num_input_tokens_seen": 19073411136, "step": 67060, "train_runtime": 652122.7214, "train_tokens_per_second": 29248.193 }, { "epoch": 2.373068086075625, "grad_norm": 0.6171875, "learning_rate": 1.8010681340068548e-05, "loss": 0.38921217918395995, "num_input_tokens_seen": 19076215360, "step": 67070, "train_runtime": 652220.7375, "train_tokens_per_second": 29248.097 }, { "epoch": 2.3734219063393533, "grad_norm": 0.61328125, "learning_rate": 1.800951297608218e-05, "loss": 0.3862889766693115, "num_input_tokens_seen": 19079047936, "step": 67080, "train_runtime": 652315.2522, "train_tokens_per_second": 29248.201 }, { "epoch": 2.3737757266030823, "grad_norm": 0.62109375, "learning_rate": 1.8008344839443795e-05, "loss": 0.37821016311645506, "num_input_tokens_seen": 19081876416, "step": 67090, "train_runtime": 652412.6667, "train_tokens_per_second": 29248.17 }, { "epoch": 2.374129546866811, "grad_norm": 0.62109375, "learning_rate": 1.8007176930079663e-05, "loss": 0.3829841613769531, "num_input_tokens_seen": 19084723968, "step": 67100, "train_runtime": 652507.6098, "train_tokens_per_second": 29248.278 }, { "epoch": 2.37448336713054, "grad_norm": 0.64453125, "learning_rate": 1.8006009247916096e-05, "loss": 0.3886546611785889, "num_input_tokens_seen": 19087596672, "step": 67110, "train_runtime": 652605.0066, "train_tokens_per_second": 29248.315 }, { "epoch": 2.3748371873942684, "grad_norm": 0.6015625, "learning_rate": 1.800484179287944e-05, "loss": 0.38506135940551756, "num_input_tokens_seen": 19090493248, "step": 67120, "train_runtime": 652705.2186, "train_tokens_per_second": 29248.262 }, { "epoch": 2.3751910076579974, "grad_norm": 0.63671875, "learning_rate": 1.8003674564896075e-05, "loss": 0.3862583637237549, "num_input_tokens_seen": 19093306240, "step": 67130, "train_runtime": 652800.0633, "train_tokens_per_second": 29248.322 }, { "epoch": 2.375544827921726, "grad_norm": 0.625, "learning_rate": 1.8002507563892413e-05, "loss": 0.3825004816055298, "num_input_tokens_seen": 19096105600, "step": 67140, "train_runtime": 652893.9238, "train_tokens_per_second": 29248.405 }, { "epoch": 2.375898648185455, "grad_norm": 0.6171875, "learning_rate": 1.8001340789794895e-05, "loss": 0.3888943910598755, "num_input_tokens_seen": 19098944000, "step": 67150, "train_runtime": 652990.8187, "train_tokens_per_second": 29248.411 }, { "epoch": 2.3762524684491835, "grad_norm": 0.61328125, "learning_rate": 1.800017424253001e-05, "loss": 0.3856736421585083, "num_input_tokens_seen": 19101779264, "step": 67160, "train_runtime": 653091.9635, "train_tokens_per_second": 29248.223 }, { "epoch": 2.3766062887129125, "grad_norm": 0.67578125, "learning_rate": 1.7999007922024254e-05, "loss": 0.3889627933502197, "num_input_tokens_seen": 19104616576, "step": 67170, "train_runtime": 653187.2613, "train_tokens_per_second": 29248.299 }, { "epoch": 2.3769601089766415, "grad_norm": 0.59375, "learning_rate": 1.7997841828204185e-05, "loss": 0.386491584777832, "num_input_tokens_seen": 19107457088, "step": 67180, "train_runtime": 653282.6978, "train_tokens_per_second": 29248.375 }, { "epoch": 2.37731392924037, "grad_norm": 0.59765625, "learning_rate": 1.799667596099638e-05, "loss": 0.3883882999420166, "num_input_tokens_seen": 19110291264, "step": 67190, "train_runtime": 653377.4336, "train_tokens_per_second": 29248.472 }, { "epoch": 2.3776677495040985, "grad_norm": 0.640625, "learning_rate": 1.7995510320327445e-05, "loss": 0.3875779628753662, "num_input_tokens_seen": 19113143040, "step": 67200, "train_runtime": 653473.3777, "train_tokens_per_second": 29248.541 }, { "epoch": 2.3780215697678275, "grad_norm": 0.62109375, "learning_rate": 1.7994344906124028e-05, "loss": 0.3921213150024414, "num_input_tokens_seen": 19115954752, "step": 67210, "train_runtime": 653571.7862, "train_tokens_per_second": 29248.439 }, { "epoch": 2.3783753900315565, "grad_norm": 0.625, "learning_rate": 1.799317971831281e-05, "loss": 0.38783869743347166, "num_input_tokens_seen": 19118786944, "step": 67220, "train_runtime": 653669.0166, "train_tokens_per_second": 29248.422 }, { "epoch": 2.378729210295285, "grad_norm": 0.61328125, "learning_rate": 1.79920147568205e-05, "loss": 0.3880669116973877, "num_input_tokens_seen": 19121651968, "step": 67230, "train_runtime": 653767.5396, "train_tokens_per_second": 29248.396 }, { "epoch": 2.379083030559014, "grad_norm": 0.6171875, "learning_rate": 1.7990850021573845e-05, "loss": 0.3857611656188965, "num_input_tokens_seen": 19124483200, "step": 67240, "train_runtime": 653863.8638, "train_tokens_per_second": 29248.417 }, { "epoch": 2.3794368508227426, "grad_norm": 0.62890625, "learning_rate": 1.798968551249962e-05, "loss": 0.3844860076904297, "num_input_tokens_seen": 19127322624, "step": 67250, "train_runtime": 653960.4245, "train_tokens_per_second": 29248.441 }, { "epoch": 2.3797906710864716, "grad_norm": 0.62109375, "learning_rate": 1.7988521229524637e-05, "loss": 0.386318302154541, "num_input_tokens_seen": 19130141760, "step": 67260, "train_runtime": 654053.9467, "train_tokens_per_second": 29248.569 }, { "epoch": 2.3801444913502, "grad_norm": 0.62109375, "learning_rate": 1.7987357172575745e-05, "loss": 0.3859975814819336, "num_input_tokens_seen": 19132988224, "step": 67270, "train_runtime": 654150.7836, "train_tokens_per_second": 29248.59 }, { "epoch": 2.380498311613929, "grad_norm": 0.66796875, "learning_rate": 1.7986193341579814e-05, "loss": 0.3843409061431885, "num_input_tokens_seen": 19135846528, "step": 67280, "train_runtime": 654248.8822, "train_tokens_per_second": 29248.574 }, { "epoch": 2.3808521318776577, "grad_norm": 0.6328125, "learning_rate": 1.7985029736463757e-05, "loss": 0.3858004570007324, "num_input_tokens_seen": 19138757312, "step": 67290, "train_runtime": 654353.1232, "train_tokens_per_second": 29248.362 }, { "epoch": 2.3812059521413866, "grad_norm": 0.625, "learning_rate": 1.798386635715452e-05, "loss": 0.38802061080932615, "num_input_tokens_seen": 19141531136, "step": 67300, "train_runtime": 654445.0724, "train_tokens_per_second": 29248.491 }, { "epoch": 2.381559772405115, "grad_norm": 0.62109375, "learning_rate": 1.798270320357908e-05, "loss": 0.38294553756713867, "num_input_tokens_seen": 19144349440, "step": 67310, "train_runtime": 654543.2547, "train_tokens_per_second": 29248.41 }, { "epoch": 2.381913592668844, "grad_norm": 0.6171875, "learning_rate": 1.7981540275664447e-05, "loss": 0.38640589714050294, "num_input_tokens_seen": 19147203008, "step": 67320, "train_runtime": 654639.8297, "train_tokens_per_second": 29248.454 }, { "epoch": 2.382267412932573, "grad_norm": 0.60546875, "learning_rate": 1.7980377573337658e-05, "loss": 0.38403520584106443, "num_input_tokens_seen": 19150074432, "step": 67330, "train_runtime": 654737.4114, "train_tokens_per_second": 29248.481 }, { "epoch": 2.3826212331963017, "grad_norm": 0.66796875, "learning_rate": 1.7979215096525794e-05, "loss": 0.38894870281219485, "num_input_tokens_seen": 19152964736, "step": 67340, "train_runtime": 654836.1498, "train_tokens_per_second": 29248.484 }, { "epoch": 2.3829750534600302, "grad_norm": 0.62109375, "learning_rate": 1.7978052845155965e-05, "loss": 0.3874341011047363, "num_input_tokens_seen": 19155801792, "step": 67350, "train_runtime": 654934.7389, "train_tokens_per_second": 29248.413 }, { "epoch": 2.3833288737237592, "grad_norm": 0.63671875, "learning_rate": 1.797689081915531e-05, "loss": 0.38392815589904783, "num_input_tokens_seen": 19158648192, "step": 67360, "train_runtime": 655032.1756, "train_tokens_per_second": 29248.408 }, { "epoch": 2.383682693987488, "grad_norm": 0.58984375, "learning_rate": 1.7975729018451004e-05, "loss": 0.38665311336517333, "num_input_tokens_seen": 19161527488, "step": 67370, "train_runtime": 655134.0268, "train_tokens_per_second": 29248.256 }, { "epoch": 2.3840365142512168, "grad_norm": 0.60546875, "learning_rate": 1.7974567442970254e-05, "loss": 0.38753490447998046, "num_input_tokens_seen": 19164337920, "step": 67380, "train_runtime": 655228.2903, "train_tokens_per_second": 29248.337 }, { "epoch": 2.3843903345149458, "grad_norm": 0.625, "learning_rate": 1.7973406092640308e-05, "loss": 0.38848047256469725, "num_input_tokens_seen": 19167200960, "step": 67390, "train_runtime": 655327.7185, "train_tokens_per_second": 29248.268 }, { "epoch": 2.3847441547786743, "grad_norm": 0.59375, "learning_rate": 1.797224496738843e-05, "loss": 0.38537015914916994, "num_input_tokens_seen": 19170035712, "step": 67400, "train_runtime": 655426.0759, "train_tokens_per_second": 29248.204 }, { "epoch": 2.3850979750424033, "grad_norm": 0.65234375, "learning_rate": 1.797108406714193e-05, "loss": 0.3868121147155762, "num_input_tokens_seen": 19172876992, "step": 67410, "train_runtime": 655522.7833, "train_tokens_per_second": 29248.224 }, { "epoch": 2.385451795306132, "grad_norm": 0.6171875, "learning_rate": 1.7969923391828146e-05, "loss": 0.3907296657562256, "num_input_tokens_seen": 19175719744, "step": 67420, "train_runtime": 655618.7415, "train_tokens_per_second": 29248.279 }, { "epoch": 2.385805615569861, "grad_norm": 0.65234375, "learning_rate": 1.7968762941374456e-05, "loss": 0.3842211961746216, "num_input_tokens_seen": 19178526016, "step": 67430, "train_runtime": 655716.0888, "train_tokens_per_second": 29248.216 }, { "epoch": 2.3861594358335894, "grad_norm": 0.61328125, "learning_rate": 1.7967602715708257e-05, "loss": 0.3899972677230835, "num_input_tokens_seen": 19181360832, "step": 67440, "train_runtime": 655812.1668, "train_tokens_per_second": 29248.254 }, { "epoch": 2.3865132560973183, "grad_norm": 0.58203125, "learning_rate": 1.7966442714756992e-05, "loss": 0.3831056594848633, "num_input_tokens_seen": 19184188736, "step": 67450, "train_runtime": 655906.9262, "train_tokens_per_second": 29248.34 }, { "epoch": 2.386867076361047, "grad_norm": 0.62109375, "learning_rate": 1.7965282938448134e-05, "loss": 0.3842476844787598, "num_input_tokens_seen": 19186973888, "step": 67460, "train_runtime": 655998.3292, "train_tokens_per_second": 29248.51 }, { "epoch": 2.387220896624776, "grad_norm": 0.609375, "learning_rate": 1.7964123386709175e-05, "loss": 0.3880655765533447, "num_input_tokens_seen": 19189801984, "step": 67470, "train_runtime": 656093.8372, "train_tokens_per_second": 29248.563 }, { "epoch": 2.3875747168885044, "grad_norm": 0.6484375, "learning_rate": 1.796296405946766e-05, "loss": 0.3874183177947998, "num_input_tokens_seen": 19192624448, "step": 67480, "train_runtime": 656187.9472, "train_tokens_per_second": 29248.67 }, { "epoch": 2.3879285371522334, "grad_norm": 0.61328125, "learning_rate": 1.796180495665116e-05, "loss": 0.3858750820159912, "num_input_tokens_seen": 19195485120, "step": 67490, "train_runtime": 656285.4672, "train_tokens_per_second": 29248.682 }, { "epoch": 2.388282357415962, "grad_norm": 0.62109375, "learning_rate": 1.796064607818727e-05, "loss": 0.38378736972808836, "num_input_tokens_seen": 19198248000, "step": 67500, "train_runtime": 656380.3029, "train_tokens_per_second": 29248.666 }, { "epoch": 2.388636177679691, "grad_norm": 0.625, "learning_rate": 1.795948742400363e-05, "loss": 0.3820474624633789, "num_input_tokens_seen": 19201038656, "step": 67510, "train_runtime": 656473.2496, "train_tokens_per_second": 29248.775 }, { "epoch": 2.38898999794342, "grad_norm": 0.66015625, "learning_rate": 1.7958328994027903e-05, "loss": 0.3854734182357788, "num_input_tokens_seen": 19203872192, "step": 67520, "train_runtime": 656566.678, "train_tokens_per_second": 29248.929 }, { "epoch": 2.3893438182071485, "grad_norm": 0.58984375, "learning_rate": 1.7957170788187792e-05, "loss": 0.3885235548019409, "num_input_tokens_seen": 19206691648, "step": 67530, "train_runtime": 656661.9185, "train_tokens_per_second": 29248.98 }, { "epoch": 2.3896976384708775, "grad_norm": 0.62109375, "learning_rate": 1.7956012806411028e-05, "loss": 0.38292100429534914, "num_input_tokens_seen": 19209527552, "step": 67540, "train_runtime": 656762.8867, "train_tokens_per_second": 29248.802 }, { "epoch": 2.390051458734606, "grad_norm": 0.62890625, "learning_rate": 1.795485504862537e-05, "loss": 0.38591823577880857, "num_input_tokens_seen": 19212346624, "step": 67550, "train_runtime": 656859.1842, "train_tokens_per_second": 29248.806 }, { "epoch": 2.390405278998335, "grad_norm": 0.60546875, "learning_rate": 1.795369751475862e-05, "loss": 0.38375487327575686, "num_input_tokens_seen": 19215182976, "step": 67560, "train_runtime": 656954.3784, "train_tokens_per_second": 29248.885 }, { "epoch": 2.3907590992620635, "grad_norm": 0.6328125, "learning_rate": 1.795254020473861e-05, "loss": 0.39004030227661135, "num_input_tokens_seen": 19218037120, "step": 67570, "train_runtime": 657053.248, "train_tokens_per_second": 29248.828 }, { "epoch": 2.3911129195257925, "grad_norm": 0.6328125, "learning_rate": 1.7951383118493203e-05, "loss": 0.38717434406280515, "num_input_tokens_seen": 19220905088, "step": 67580, "train_runtime": 657155.582, "train_tokens_per_second": 29248.637 }, { "epoch": 2.391466739789521, "grad_norm": 0.609375, "learning_rate": 1.795022625595029e-05, "loss": 0.38304524421691893, "num_input_tokens_seen": 19223711296, "step": 67590, "train_runtime": 657250.3483, "train_tokens_per_second": 29248.689 }, { "epoch": 2.39182056005325, "grad_norm": 0.62109375, "learning_rate": 1.79490696170378e-05, "loss": 0.38646512031555175, "num_input_tokens_seen": 19226493888, "step": 67600, "train_runtime": 657342.8652, "train_tokens_per_second": 29248.806 }, { "epoch": 2.3921743803169786, "grad_norm": 0.609375, "learning_rate": 1.79479132016837e-05, "loss": 0.38769145011901857, "num_input_tokens_seen": 19229300800, "step": 67610, "train_runtime": 657436.241, "train_tokens_per_second": 29248.921 }, { "epoch": 2.3925282005807076, "grad_norm": 0.62109375, "learning_rate": 1.794675700981597e-05, "loss": 0.38835821151733396, "num_input_tokens_seen": 19232120256, "step": 67620, "train_runtime": 657534.3171, "train_tokens_per_second": 29248.846 }, { "epoch": 2.392882020844436, "grad_norm": 0.60546875, "learning_rate": 1.794560104136264e-05, "loss": 0.38687279224395754, "num_input_tokens_seen": 19234951936, "step": 67630, "train_runtime": 657628.7664, "train_tokens_per_second": 29248.952 }, { "epoch": 2.393235841108165, "grad_norm": 0.63671875, "learning_rate": 1.7944445296251776e-05, "loss": 0.3826420307159424, "num_input_tokens_seen": 19237797504, "step": 67640, "train_runtime": 657726.5015, "train_tokens_per_second": 29248.932 }, { "epoch": 2.3935896613718937, "grad_norm": 0.58984375, "learning_rate": 1.794328977441146e-05, "loss": 0.384617280960083, "num_input_tokens_seen": 19240642304, "step": 67650, "train_runtime": 657821.5443, "train_tokens_per_second": 29249.03 }, { "epoch": 2.3939434816356226, "grad_norm": 0.62109375, "learning_rate": 1.7942134475769813e-05, "loss": 0.3850719690322876, "num_input_tokens_seen": 19243497152, "step": 67660, "train_runtime": 657922.1269, "train_tokens_per_second": 29248.898 }, { "epoch": 2.3942973018993516, "grad_norm": 0.625, "learning_rate": 1.794097940025499e-05, "loss": 0.3867626190185547, "num_input_tokens_seen": 19246382720, "step": 67670, "train_runtime": 658021.6857, "train_tokens_per_second": 29248.858 }, { "epoch": 2.39465112216308, "grad_norm": 0.6328125, "learning_rate": 1.7939824547795183e-05, "loss": 0.387221097946167, "num_input_tokens_seen": 19249216896, "step": 67680, "train_runtime": 658116.8658, "train_tokens_per_second": 29248.934 }, { "epoch": 2.3950049424268087, "grad_norm": 0.6171875, "learning_rate": 1.793866991831861e-05, "loss": 0.38462803363800047, "num_input_tokens_seen": 19252052992, "step": 67690, "train_runtime": 658210.0308, "train_tokens_per_second": 29249.103 }, { "epoch": 2.3953587626905377, "grad_norm": 0.640625, "learning_rate": 1.793751551175352e-05, "loss": 0.382578182220459, "num_input_tokens_seen": 19254910272, "step": 67700, "train_runtime": 658305.8863, "train_tokens_per_second": 29249.184 }, { "epoch": 2.3957125829542667, "grad_norm": 0.6328125, "learning_rate": 1.7936361328028196e-05, "loss": 0.3824758529663086, "num_input_tokens_seen": 19257707904, "step": 67710, "train_runtime": 658398.7477, "train_tokens_per_second": 29249.308 }, { "epoch": 2.3960664032179952, "grad_norm": 0.6171875, "learning_rate": 1.7935207367070964e-05, "loss": 0.38828563690185547, "num_input_tokens_seen": 19260580096, "step": 67720, "train_runtime": 658496.2851, "train_tokens_per_second": 29249.338 }, { "epoch": 2.3964202234817242, "grad_norm": 0.6328125, "learning_rate": 1.793405362881016e-05, "loss": 0.3870595693588257, "num_input_tokens_seen": 19263461888, "step": 67730, "train_runtime": 658595.9488, "train_tokens_per_second": 29249.287 }, { "epoch": 2.3967740437454528, "grad_norm": 0.60546875, "learning_rate": 1.7932900113174182e-05, "loss": 0.3890698909759521, "num_input_tokens_seen": 19266301248, "step": 67740, "train_runtime": 658692.086, "train_tokens_per_second": 29249.329 }, { "epoch": 2.3971278640091818, "grad_norm": 0.62109375, "learning_rate": 1.7931746820091423e-05, "loss": 0.3873075723648071, "num_input_tokens_seen": 19269187200, "step": 67750, "train_runtime": 658793.2023, "train_tokens_per_second": 29249.22 }, { "epoch": 2.3974816842729103, "grad_norm": 0.609375, "learning_rate": 1.793059374949034e-05, "loss": 0.38792710304260253, "num_input_tokens_seen": 19272044224, "step": 67760, "train_runtime": 658890.4124, "train_tokens_per_second": 29249.241 }, { "epoch": 2.3978355045366393, "grad_norm": 0.62890625, "learning_rate": 1.7929440901299405e-05, "loss": 0.38840744495391843, "num_input_tokens_seen": 19274895168, "step": 67770, "train_runtime": 658987.086, "train_tokens_per_second": 29249.276 }, { "epoch": 2.398189324800368, "grad_norm": 0.63671875, "learning_rate": 1.7928288275447135e-05, "loss": 0.3856579542160034, "num_input_tokens_seen": 19277718016, "step": 67780, "train_runtime": 659083.6087, "train_tokens_per_second": 29249.275 }, { "epoch": 2.398543145064097, "grad_norm": 0.6171875, "learning_rate": 1.792713587186207e-05, "loss": 0.3879667282104492, "num_input_tokens_seen": 19280601024, "step": 67790, "train_runtime": 659183.7444, "train_tokens_per_second": 29249.206 }, { "epoch": 2.3988969653278254, "grad_norm": 0.62109375, "learning_rate": 1.7925983690472782e-05, "loss": 0.38777642250061034, "num_input_tokens_seen": 19283403200, "step": 67800, "train_runtime": 659278.0277, "train_tokens_per_second": 29249.273 }, { "epoch": 2.3992507855915544, "grad_norm": 0.59375, "learning_rate": 1.7924831731207873e-05, "loss": 0.3857454776763916, "num_input_tokens_seen": 19286276032, "step": 67810, "train_runtime": 659377.6345, "train_tokens_per_second": 29249.212 }, { "epoch": 2.399604605855283, "grad_norm": 0.61328125, "learning_rate": 1.7923679993995988e-05, "loss": 0.3831601619720459, "num_input_tokens_seen": 19289053632, "step": 67820, "train_runtime": 659469.2148, "train_tokens_per_second": 29249.362 }, { "epoch": 2.399958426119012, "grad_norm": 0.62890625, "learning_rate": 1.79225284787658e-05, "loss": 0.39115471839904786, "num_input_tokens_seen": 19291869760, "step": 67830, "train_runtime": 659564.5288, "train_tokens_per_second": 29249.405 }, { "epoch": 2.4003122463827404, "grad_norm": 0.64453125, "learning_rate": 1.7921377185446003e-05, "loss": 0.3869039297103882, "num_input_tokens_seen": 19294748224, "step": 67840, "train_runtime": 659664.713, "train_tokens_per_second": 29249.326 }, { "epoch": 2.4006660666464694, "grad_norm": 0.60546875, "learning_rate": 1.7920226113965338e-05, "loss": 0.3882428169250488, "num_input_tokens_seen": 19297604224, "step": 67850, "train_runtime": 659761.8706, "train_tokens_per_second": 29249.348 }, { "epoch": 2.4010198869101984, "grad_norm": 0.58984375, "learning_rate": 1.791907526425257e-05, "loss": 0.3835087060928345, "num_input_tokens_seen": 19300442624, "step": 67860, "train_runtime": 659859.3756, "train_tokens_per_second": 29249.327 }, { "epoch": 2.401373707173927, "grad_norm": 0.6171875, "learning_rate": 1.7917924636236495e-05, "loss": 0.39130091667175293, "num_input_tokens_seen": 19303286912, "step": 67870, "train_runtime": 659956.5227, "train_tokens_per_second": 29249.331 }, { "epoch": 2.401727527437656, "grad_norm": 0.6328125, "learning_rate": 1.7916774229845944e-05, "loss": 0.39014620780944825, "num_input_tokens_seen": 19306127872, "step": 67880, "train_runtime": 660054.073, "train_tokens_per_second": 29249.313 }, { "epoch": 2.4020813477013845, "grad_norm": 0.62109375, "learning_rate": 1.7915624045009787e-05, "loss": 0.3851542711257935, "num_input_tokens_seen": 19308988352, "step": 67890, "train_runtime": 660154.3482, "train_tokens_per_second": 29249.203 }, { "epoch": 2.4024351679651135, "grad_norm": 0.640625, "learning_rate": 1.791447408165691e-05, "loss": 0.38439435958862306, "num_input_tokens_seen": 19311830400, "step": 67900, "train_runtime": 660251.0498, "train_tokens_per_second": 29249.223 }, { "epoch": 2.402788988228842, "grad_norm": 0.63671875, "learning_rate": 1.7913324339716244e-05, "loss": 0.3864377498626709, "num_input_tokens_seen": 19314628096, "step": 67910, "train_runtime": 660348.8875, "train_tokens_per_second": 29249.126 }, { "epoch": 2.403142808492571, "grad_norm": 0.60546875, "learning_rate": 1.7912174819116744e-05, "loss": 0.39105536937713625, "num_input_tokens_seen": 19317486464, "step": 67920, "train_runtime": 660443.6466, "train_tokens_per_second": 29249.258 }, { "epoch": 2.4034966287562995, "grad_norm": 0.65625, "learning_rate": 1.7911025519787406e-05, "loss": 0.3873642921447754, "num_input_tokens_seen": 19320343936, "step": 67930, "train_runtime": 660542.2593, "train_tokens_per_second": 29249.217 }, { "epoch": 2.4038504490200285, "grad_norm": 0.6328125, "learning_rate": 1.7909876441657247e-05, "loss": 0.3838647365570068, "num_input_tokens_seen": 19323255232, "step": 67940, "train_runtime": 660642.8159, "train_tokens_per_second": 29249.172 }, { "epoch": 2.404204269283757, "grad_norm": 0.62890625, "learning_rate": 1.7908727584655324e-05, "loss": 0.3887533664703369, "num_input_tokens_seen": 19326011456, "step": 67950, "train_runtime": 660735.479, "train_tokens_per_second": 29249.241 }, { "epoch": 2.404558089547486, "grad_norm": 0.6328125, "learning_rate": 1.7907578948710722e-05, "loss": 0.38205652236938475, "num_input_tokens_seen": 19328812416, "step": 67960, "train_runtime": 660830.0656, "train_tokens_per_second": 29249.293 }, { "epoch": 2.4049119098112146, "grad_norm": 0.6015625, "learning_rate": 1.790643053375256e-05, "loss": 0.3907313823699951, "num_input_tokens_seen": 19331645056, "step": 67970, "train_runtime": 660925.1271, "train_tokens_per_second": 29249.372 }, { "epoch": 2.4052657300749436, "grad_norm": 0.59765625, "learning_rate": 1.7905282339709987e-05, "loss": 0.38699769973754883, "num_input_tokens_seen": 19334499904, "step": 67980, "train_runtime": 661021.6204, "train_tokens_per_second": 29249.421 }, { "epoch": 2.405619550338672, "grad_norm": 0.6015625, "learning_rate": 1.7904134366512183e-05, "loss": 0.3880749702453613, "num_input_tokens_seen": 19337347840, "step": 67990, "train_runtime": 661118.1021, "train_tokens_per_second": 29249.461 }, { "epoch": 2.405973370602401, "grad_norm": 0.60546875, "learning_rate": 1.790298661408836e-05, "loss": 0.3875674486160278, "num_input_tokens_seen": 19340199680, "step": 68000, "train_runtime": 661213.2493, "train_tokens_per_second": 29249.565 }, { "epoch": 2.40632719086613, "grad_norm": 0.62109375, "learning_rate": 1.7901839082367766e-05, "loss": 0.3829047203063965, "num_input_tokens_seen": 19343053632, "step": 68010, "train_runtime": 661310.6351, "train_tokens_per_second": 29249.573 }, { "epoch": 2.4066810111298587, "grad_norm": 0.6015625, "learning_rate": 1.7900691771279682e-05, "loss": 0.38587212562561035, "num_input_tokens_seen": 19345908864, "step": 68020, "train_runtime": 661406.2284, "train_tokens_per_second": 29249.662 }, { "epoch": 2.407034831393587, "grad_norm": 0.61328125, "learning_rate": 1.7899544680753404e-05, "loss": 0.3864143371582031, "num_input_tokens_seen": 19348721856, "step": 68030, "train_runtime": 661502.3503, "train_tokens_per_second": 29249.665 }, { "epoch": 2.407388651657316, "grad_norm": 0.62109375, "learning_rate": 1.7898397810718286e-05, "loss": 0.38871009349823, "num_input_tokens_seen": 19351526976, "step": 68040, "train_runtime": 661599.8308, "train_tokens_per_second": 29249.595 }, { "epoch": 2.407742471921045, "grad_norm": 0.6015625, "learning_rate": 1.7897251161103693e-05, "loss": 0.3876418352127075, "num_input_tokens_seen": 19354386368, "step": 68050, "train_runtime": 661696.8537, "train_tokens_per_second": 29249.627 }, { "epoch": 2.4080962921847737, "grad_norm": 0.625, "learning_rate": 1.789610473183903e-05, "loss": 0.38550117015838625, "num_input_tokens_seen": 19357238848, "step": 68060, "train_runtime": 661791.8658, "train_tokens_per_second": 29249.738 }, { "epoch": 2.4084501124485027, "grad_norm": 0.62109375, "learning_rate": 1.789495852285373e-05, "loss": 0.3871241807937622, "num_input_tokens_seen": 19360095936, "step": 68070, "train_runtime": 661889.7004, "train_tokens_per_second": 29249.731 }, { "epoch": 2.4088039327122313, "grad_norm": 0.62890625, "learning_rate": 1.789381253407726e-05, "loss": 0.3843658447265625, "num_input_tokens_seen": 19362983168, "step": 68080, "train_runtime": 661989.3366, "train_tokens_per_second": 29249.69 }, { "epoch": 2.4091577529759602, "grad_norm": 0.59375, "learning_rate": 1.7892666765439117e-05, "loss": 0.38748888969421386, "num_input_tokens_seen": 19365830400, "step": 68090, "train_runtime": 662084.8793, "train_tokens_per_second": 29249.77 }, { "epoch": 2.409511573239689, "grad_norm": 0.62109375, "learning_rate": 1.789152121686884e-05, "loss": 0.384832763671875, "num_input_tokens_seen": 19368627456, "step": 68100, "train_runtime": 662176.325, "train_tokens_per_second": 29249.955 }, { "epoch": 2.4098653935034178, "grad_norm": 0.640625, "learning_rate": 1.789037588829598e-05, "loss": 0.3864151954650879, "num_input_tokens_seen": 19371494976, "step": 68110, "train_runtime": 662275.0771, "train_tokens_per_second": 29249.923 }, { "epoch": 2.4102192137671463, "grad_norm": 0.61328125, "learning_rate": 1.7889230779650135e-05, "loss": 0.38594019412994385, "num_input_tokens_seen": 19374391936, "step": 68120, "train_runtime": 662376.4841, "train_tokens_per_second": 29249.818 }, { "epoch": 2.4105730340308753, "grad_norm": 0.58203125, "learning_rate": 1.7888085890860927e-05, "loss": 0.38209917545318606, "num_input_tokens_seen": 19377238656, "step": 68130, "train_runtime": 662472.6451, "train_tokens_per_second": 29249.87 }, { "epoch": 2.410926854294604, "grad_norm": 0.60546875, "learning_rate": 1.7886941221858022e-05, "loss": 0.38693718910217284, "num_input_tokens_seen": 19380071296, "step": 68140, "train_runtime": 662570.1248, "train_tokens_per_second": 29249.842 }, { "epoch": 2.411280674558333, "grad_norm": 0.62109375, "learning_rate": 1.7885796772571094e-05, "loss": 0.38875608444213866, "num_input_tokens_seen": 19382972800, "step": 68150, "train_runtime": 662672.2939, "train_tokens_per_second": 29249.711 }, { "epoch": 2.411634494822062, "grad_norm": 0.625, "learning_rate": 1.788465254292987e-05, "loss": 0.3817655086517334, "num_input_tokens_seen": 19385770304, "step": 68160, "train_runtime": 662768.091, "train_tokens_per_second": 29249.704 }, { "epoch": 2.4119883150857904, "grad_norm": 0.6328125, "learning_rate": 1.7883508532864095e-05, "loss": 0.38323497772216797, "num_input_tokens_seen": 19388657024, "step": 68170, "train_runtime": 662868.5361, "train_tokens_per_second": 29249.626 }, { "epoch": 2.412342135349519, "grad_norm": 0.62109375, "learning_rate": 1.7882364742303563e-05, "loss": 0.38757858276367185, "num_input_tokens_seen": 19391486080, "step": 68180, "train_runtime": 662965.2125, "train_tokens_per_second": 29249.628 }, { "epoch": 2.412695955613248, "grad_norm": 0.6015625, "learning_rate": 1.7881221171178072e-05, "loss": 0.38554298877716064, "num_input_tokens_seen": 19394326528, "step": 68190, "train_runtime": 663061.4661, "train_tokens_per_second": 29249.666 }, { "epoch": 2.413049775876977, "grad_norm": 0.6171875, "learning_rate": 1.7880077819417483e-05, "loss": 0.3880670785903931, "num_input_tokens_seen": 19397190464, "step": 68200, "train_runtime": 663159.4791, "train_tokens_per_second": 29249.662 }, { "epoch": 2.4134035961407054, "grad_norm": 0.61328125, "learning_rate": 1.7878934686951657e-05, "loss": 0.3865138053894043, "num_input_tokens_seen": 19399980352, "step": 68210, "train_runtime": 663251.5265, "train_tokens_per_second": 29249.809 }, { "epoch": 2.4137574164044344, "grad_norm": 0.62890625, "learning_rate": 1.787779177371051e-05, "loss": 0.3825418472290039, "num_input_tokens_seen": 19402815616, "step": 68220, "train_runtime": 663349.6357, "train_tokens_per_second": 29249.757 }, { "epoch": 2.414111236668163, "grad_norm": 0.6171875, "learning_rate": 1.7876649079623982e-05, "loss": 0.3875403642654419, "num_input_tokens_seen": 19405657088, "step": 68230, "train_runtime": 663446.6959, "train_tokens_per_second": 29249.761 }, { "epoch": 2.414465056931892, "grad_norm": 0.62109375, "learning_rate": 1.787550660462204e-05, "loss": 0.3883230209350586, "num_input_tokens_seen": 19408556928, "step": 68240, "train_runtime": 663548.9657, "train_tokens_per_second": 29249.623 }, { "epoch": 2.4148188771956205, "grad_norm": 0.62109375, "learning_rate": 1.7874364348634686e-05, "loss": 0.38724329471588137, "num_input_tokens_seen": 19411388096, "step": 68250, "train_runtime": 663644.3295, "train_tokens_per_second": 29249.686 }, { "epoch": 2.4151726974593495, "grad_norm": 0.61328125, "learning_rate": 1.787322231159196e-05, "loss": 0.3832000732421875, "num_input_tokens_seen": 19414268544, "step": 68260, "train_runtime": 663743.4242, "train_tokens_per_second": 29249.659 }, { "epoch": 2.415526517723078, "grad_norm": 0.62890625, "learning_rate": 1.7872080493423915e-05, "loss": 0.3849701642990112, "num_input_tokens_seen": 19417073856, "step": 68270, "train_runtime": 663840.2457, "train_tokens_per_second": 29249.618 }, { "epoch": 2.415880337986807, "grad_norm": 0.63671875, "learning_rate": 1.7870938894060653e-05, "loss": 0.3862785816192627, "num_input_tokens_seen": 19419968512, "step": 68280, "train_runtime": 663937.9209, "train_tokens_per_second": 29249.675 }, { "epoch": 2.4162341582505356, "grad_norm": 0.62109375, "learning_rate": 1.7869797513432305e-05, "loss": 0.3864187717437744, "num_input_tokens_seen": 19422819328, "step": 68290, "train_runtime": 664035.0492, "train_tokens_per_second": 29249.69 }, { "epoch": 2.4165879785142645, "grad_norm": 0.58203125, "learning_rate": 1.7868656351469017e-05, "loss": 0.3882637023925781, "num_input_tokens_seen": 19425674496, "step": 68300, "train_runtime": 664134.0223, "train_tokens_per_second": 29249.63 }, { "epoch": 2.416941798777993, "grad_norm": 0.62109375, "learning_rate": 1.786751540810099e-05, "loss": 0.38697137832641604, "num_input_tokens_seen": 19428499456, "step": 68310, "train_runtime": 664229.8259, "train_tokens_per_second": 29249.664 }, { "epoch": 2.417295619041722, "grad_norm": 0.6328125, "learning_rate": 1.786637468325844e-05, "loss": 0.3823454141616821, "num_input_tokens_seen": 19431315072, "step": 68320, "train_runtime": 664322.3507, "train_tokens_per_second": 29249.829 }, { "epoch": 2.4176494393054506, "grad_norm": 0.62890625, "learning_rate": 1.786523417687162e-05, "loss": 0.38868486881256104, "num_input_tokens_seen": 19434190656, "step": 68330, "train_runtime": 664425.3466, "train_tokens_per_second": 29249.623 }, { "epoch": 2.4180032595691796, "grad_norm": 0.609375, "learning_rate": 1.7864093888870813e-05, "loss": 0.38460938930511473, "num_input_tokens_seen": 19437104192, "step": 68340, "train_runtime": 664531.0014, "train_tokens_per_second": 29249.357 }, { "epoch": 2.4183570798329086, "grad_norm": 0.59375, "learning_rate": 1.7862953819186332e-05, "loss": 0.3870745420455933, "num_input_tokens_seen": 19439931200, "step": 68350, "train_runtime": 664628.9457, "train_tokens_per_second": 29249.3 }, { "epoch": 2.418710900096637, "grad_norm": 0.59765625, "learning_rate": 1.786181396774852e-05, "loss": 0.3881475210189819, "num_input_tokens_seen": 19442805888, "step": 68360, "train_runtime": 664725.3103, "train_tokens_per_second": 29249.384 }, { "epoch": 2.419064720360366, "grad_norm": 0.61328125, "learning_rate": 1.7860674334487757e-05, "loss": 0.382158088684082, "num_input_tokens_seen": 19445669952, "step": 68370, "train_runtime": 664822.3962, "train_tokens_per_second": 29249.421 }, { "epoch": 2.4194185406240947, "grad_norm": 0.62109375, "learning_rate": 1.7859534919334447e-05, "loss": 0.3840055465698242, "num_input_tokens_seen": 19448465280, "step": 68380, "train_runtime": 664914.7205, "train_tokens_per_second": 29249.563 }, { "epoch": 2.4197723608878237, "grad_norm": 0.62109375, "learning_rate": 1.7858395722219032e-05, "loss": 0.3886756658554077, "num_input_tokens_seen": 19451290176, "step": 68390, "train_runtime": 665011.1215, "train_tokens_per_second": 29249.571 }, { "epoch": 2.420126181151552, "grad_norm": 0.6171875, "learning_rate": 1.7857256743071978e-05, "loss": 0.3851438522338867, "num_input_tokens_seen": 19454168704, "step": 68400, "train_runtime": 665111.5759, "train_tokens_per_second": 29249.481 }, { "epoch": 2.420480001415281, "grad_norm": 0.65234375, "learning_rate": 1.785611798182379e-05, "loss": 0.38528194427490237, "num_input_tokens_seen": 19456994560, "step": 68410, "train_runtime": 665206.4897, "train_tokens_per_second": 29249.556 }, { "epoch": 2.4208338216790097, "grad_norm": 0.62890625, "learning_rate": 1.7854979438405e-05, "loss": 0.38706820011138915, "num_input_tokens_seen": 19459841792, "step": 68420, "train_runtime": 665301.2115, "train_tokens_per_second": 29249.671 }, { "epoch": 2.4211876419427387, "grad_norm": 0.58984375, "learning_rate": 1.7853841112746157e-05, "loss": 0.3822739839553833, "num_input_tokens_seen": 19462673920, "step": 68430, "train_runtime": 665397.9831, "train_tokens_per_second": 29249.674 }, { "epoch": 2.4215414622064673, "grad_norm": 0.62109375, "learning_rate": 1.7852703004777873e-05, "loss": 0.38995659351348877, "num_input_tokens_seen": 19465500608, "step": 68440, "train_runtime": 665493.3342, "train_tokens_per_second": 29249.73 }, { "epoch": 2.4218952824701963, "grad_norm": 0.625, "learning_rate": 1.7851565114430764e-05, "loss": 0.385045599937439, "num_input_tokens_seen": 19468332288, "step": 68450, "train_runtime": 665591.9177, "train_tokens_per_second": 29249.652 }, { "epoch": 2.422249102733925, "grad_norm": 0.6171875, "learning_rate": 1.7850427441635482e-05, "loss": 0.38572192192077637, "num_input_tokens_seen": 19471153856, "step": 68460, "train_runtime": 665686.3888, "train_tokens_per_second": 29249.74 }, { "epoch": 2.422602922997654, "grad_norm": 0.60546875, "learning_rate": 1.7849289986322723e-05, "loss": 0.38976345062255857, "num_input_tokens_seen": 19473960384, "step": 68470, "train_runtime": 665780.5846, "train_tokens_per_second": 29249.817 }, { "epoch": 2.4229567432613823, "grad_norm": 0.6171875, "learning_rate": 1.7848152748423196e-05, "loss": 0.384015417098999, "num_input_tokens_seen": 19476810240, "step": 68480, "train_runtime": 665878.4752, "train_tokens_per_second": 29249.797 }, { "epoch": 2.4233105635251113, "grad_norm": 0.62109375, "learning_rate": 1.784701572786765e-05, "loss": 0.3880761623382568, "num_input_tokens_seen": 19479679872, "step": 68490, "train_runtime": 665974.2185, "train_tokens_per_second": 29249.901 }, { "epoch": 2.4236643837888403, "grad_norm": 0.59765625, "learning_rate": 1.7845878924586875e-05, "loss": 0.38806092739105225, "num_input_tokens_seen": 19482488192, "step": 68500, "train_runtime": 666068.814, "train_tokens_per_second": 29249.963 }, { "epoch": 2.424018204052569, "grad_norm": 0.59375, "learning_rate": 1.7844742338511663e-05, "loss": 0.38856942653656007, "num_input_tokens_seen": 19485348736, "step": 68510, "train_runtime": 666167.8738, "train_tokens_per_second": 29249.908 }, { "epoch": 2.4243720243162974, "grad_norm": 0.609375, "learning_rate": 1.7843605969572865e-05, "loss": 0.385299015045166, "num_input_tokens_seen": 19488182592, "step": 68520, "train_runtime": 666264.1823, "train_tokens_per_second": 29249.933 }, { "epoch": 2.4247258445800264, "grad_norm": 0.61328125, "learning_rate": 1.7842469817701354e-05, "loss": 0.38481812477111815, "num_input_tokens_seen": 19491078592, "step": 68530, "train_runtime": 666363.2866, "train_tokens_per_second": 29249.929 }, { "epoch": 2.4250796648437554, "grad_norm": 0.62109375, "learning_rate": 1.7841333882828033e-05, "loss": 0.38563559055328367, "num_input_tokens_seen": 19493887616, "step": 68540, "train_runtime": 666460.125, "train_tokens_per_second": 29249.893 }, { "epoch": 2.425433485107484, "grad_norm": 0.640625, "learning_rate": 1.7840198164883827e-05, "loss": 0.3876136541366577, "num_input_tokens_seen": 19496733952, "step": 68550, "train_runtime": 666555.5352, "train_tokens_per_second": 29249.977 }, { "epoch": 2.425787305371213, "grad_norm": 0.60546875, "learning_rate": 1.7839062663799703e-05, "loss": 0.3833590030670166, "num_input_tokens_seen": 19499576576, "step": 68560, "train_runtime": 666653.7683, "train_tokens_per_second": 29249.931 }, { "epoch": 2.4261411256349414, "grad_norm": 0.625, "learning_rate": 1.7837927379506662e-05, "loss": 0.38374671936035154, "num_input_tokens_seen": 19502451520, "step": 68570, "train_runtime": 666750.7974, "train_tokens_per_second": 29249.986 }, { "epoch": 2.4264949458986704, "grad_norm": 0.609375, "learning_rate": 1.7836792311935722e-05, "loss": 0.38574895858764646, "num_input_tokens_seen": 19505334848, "step": 68580, "train_runtime": 666851.2098, "train_tokens_per_second": 29249.905 }, { "epoch": 2.426848766162399, "grad_norm": 0.65625, "learning_rate": 1.7835657461017948e-05, "loss": 0.3871032238006592, "num_input_tokens_seen": 19508146112, "step": 68590, "train_runtime": 666948.2138, "train_tokens_per_second": 29249.866 }, { "epoch": 2.427202586426128, "grad_norm": 0.59375, "learning_rate": 1.7834522826684414e-05, "loss": 0.38348524570465087, "num_input_tokens_seen": 19511018624, "step": 68600, "train_runtime": 667045.8508, "train_tokens_per_second": 29249.891 }, { "epoch": 2.4275564066898565, "grad_norm": 0.6328125, "learning_rate": 1.783338840886625e-05, "loss": 0.3856853485107422, "num_input_tokens_seen": 19513878080, "step": 68610, "train_runtime": 667142.7645, "train_tokens_per_second": 29249.928 }, { "epoch": 2.4279102269535855, "grad_norm": 0.6171875, "learning_rate": 1.7832254207494598e-05, "loss": 0.3850064277648926, "num_input_tokens_seen": 19516727616, "step": 68620, "train_runtime": 667243.9464, "train_tokens_per_second": 29249.763 }, { "epoch": 2.428264047217314, "grad_norm": 0.61328125, "learning_rate": 1.7831120222500635e-05, "loss": 0.39541604518890383, "num_input_tokens_seen": 19519535680, "step": 68630, "train_runtime": 667340.0371, "train_tokens_per_second": 29249.76 }, { "epoch": 2.428617867481043, "grad_norm": 0.63671875, "learning_rate": 1.782998645381558e-05, "loss": 0.3894403696060181, "num_input_tokens_seen": 19522431680, "step": 68640, "train_runtime": 667439.2528, "train_tokens_per_second": 29249.751 }, { "epoch": 2.4289716877447716, "grad_norm": 0.6171875, "learning_rate": 1.7828852901370663e-05, "loss": 0.38569400310516355, "num_input_tokens_seen": 19525270144, "step": 68650, "train_runtime": 667535.6113, "train_tokens_per_second": 29249.781 }, { "epoch": 2.4293255080085006, "grad_norm": 0.59765625, "learning_rate": 1.7827719565097157e-05, "loss": 0.3869462966918945, "num_input_tokens_seen": 19528156928, "step": 68660, "train_runtime": 667635.5715, "train_tokens_per_second": 29249.725 }, { "epoch": 2.429679328272229, "grad_norm": 0.59765625, "learning_rate": 1.7826586444926364e-05, "loss": 0.3893005847930908, "num_input_tokens_seen": 19531035392, "step": 68670, "train_runtime": 667733.3684, "train_tokens_per_second": 29249.752 }, { "epoch": 2.430033148535958, "grad_norm": 0.609375, "learning_rate": 1.782545354078962e-05, "loss": 0.3851781845092773, "num_input_tokens_seen": 19533874624, "step": 68680, "train_runtime": 667830.1509, "train_tokens_per_second": 29249.764 }, { "epoch": 2.430386968799687, "grad_norm": 0.6015625, "learning_rate": 1.7824320852618285e-05, "loss": 0.384342098236084, "num_input_tokens_seen": 19536690112, "step": 68690, "train_runtime": 667927.1153, "train_tokens_per_second": 29249.733 }, { "epoch": 2.4307407890634156, "grad_norm": 0.6171875, "learning_rate": 1.7823188380343746e-05, "loss": 0.3890566110610962, "num_input_tokens_seen": 19539581504, "step": 68700, "train_runtime": 668026.3404, "train_tokens_per_second": 29249.717 }, { "epoch": 2.4310946093271446, "grad_norm": 0.59765625, "learning_rate": 1.7822056123897433e-05, "loss": 0.3845391750335693, "num_input_tokens_seen": 19542478080, "step": 68710, "train_runtime": 668127.6735, "train_tokens_per_second": 29249.616 }, { "epoch": 2.431448429590873, "grad_norm": 0.61328125, "learning_rate": 1.7820924083210802e-05, "loss": 0.38262989521026614, "num_input_tokens_seen": 19545280320, "step": 68720, "train_runtime": 668220.0452, "train_tokens_per_second": 29249.767 }, { "epoch": 2.431802249854602, "grad_norm": 0.62109375, "learning_rate": 1.781979225821533e-05, "loss": 0.38478808403015136, "num_input_tokens_seen": 19548097024, "step": 68730, "train_runtime": 668317.4254, "train_tokens_per_second": 29249.719 }, { "epoch": 2.4321560701183307, "grad_norm": 0.6328125, "learning_rate": 1.781866064884254e-05, "loss": 0.38600692749023435, "num_input_tokens_seen": 19550942208, "step": 68740, "train_runtime": 668413.4443, "train_tokens_per_second": 29249.774 }, { "epoch": 2.4325098903820597, "grad_norm": 0.62890625, "learning_rate": 1.7817529255023968e-05, "loss": 0.39072885513305666, "num_input_tokens_seen": 19553779264, "step": 68750, "train_runtime": 668508.1131, "train_tokens_per_second": 29249.876 }, { "epoch": 2.432863710645788, "grad_norm": 0.59765625, "learning_rate": 1.78163980766912e-05, "loss": 0.38450586795806885, "num_input_tokens_seen": 19556599360, "step": 68760, "train_runtime": 668605.5211, "train_tokens_per_second": 29249.832 }, { "epoch": 2.433217530909517, "grad_norm": 0.59765625, "learning_rate": 1.7815267113775832e-05, "loss": 0.38595972061157224, "num_input_tokens_seen": 19559495680, "step": 68770, "train_runtime": 668707.8685, "train_tokens_per_second": 29249.687 }, { "epoch": 2.4335713511732457, "grad_norm": 0.61328125, "learning_rate": 1.781413636620951e-05, "loss": 0.38293497562408446, "num_input_tokens_seen": 19562304384, "step": 68780, "train_runtime": 668802.4918, "train_tokens_per_second": 29249.748 }, { "epoch": 2.4339251714369747, "grad_norm": 0.59765625, "learning_rate": 1.781300583392389e-05, "loss": 0.3914920806884766, "num_input_tokens_seen": 19565156416, "step": 68790, "train_runtime": 668900.683, "train_tokens_per_second": 29249.718 }, { "epoch": 2.4342789917007033, "grad_norm": 0.6015625, "learning_rate": 1.7811875516850678e-05, "loss": 0.3848621606826782, "num_input_tokens_seen": 19568039168, "step": 68800, "train_runtime": 669000.243, "train_tokens_per_second": 29249.674 }, { "epoch": 2.4346328119644323, "grad_norm": 0.62109375, "learning_rate": 1.7810745414921605e-05, "loss": 0.38750481605529785, "num_input_tokens_seen": 19570895680, "step": 68810, "train_runtime": 669097.9941, "train_tokens_per_second": 29249.67 }, { "epoch": 2.434986632228161, "grad_norm": 0.60546875, "learning_rate": 1.7809615528068414e-05, "loss": 0.3826527833938599, "num_input_tokens_seen": 19573712576, "step": 68820, "train_runtime": 669193.8068, "train_tokens_per_second": 29249.692 }, { "epoch": 2.43534045249189, "grad_norm": 0.6171875, "learning_rate": 1.7808485856222905e-05, "loss": 0.38694062232971194, "num_input_tokens_seen": 19576527808, "step": 68830, "train_runtime": 669288.9496, "train_tokens_per_second": 29249.74 }, { "epoch": 2.435694272755619, "grad_norm": 0.6328125, "learning_rate": 1.7807356399316896e-05, "loss": 0.38736538887023925, "num_input_tokens_seen": 19579367232, "step": 68840, "train_runtime": 669386.3943, "train_tokens_per_second": 29249.724 }, { "epoch": 2.4360480930193473, "grad_norm": 0.6328125, "learning_rate": 1.780622715728223e-05, "loss": 0.3896360397338867, "num_input_tokens_seen": 19582191040, "step": 68850, "train_runtime": 669481.6135, "train_tokens_per_second": 29249.782 }, { "epoch": 2.436401913283076, "grad_norm": 0.6171875, "learning_rate": 1.7805098130050797e-05, "loss": 0.3867495536804199, "num_input_tokens_seen": 19585090240, "step": 68860, "train_runtime": 669582.4338, "train_tokens_per_second": 29249.707 }, { "epoch": 2.436755733546805, "grad_norm": 0.625, "learning_rate": 1.780396931755449e-05, "loss": 0.3905338287353516, "num_input_tokens_seen": 19587910144, "step": 68870, "train_runtime": 669678.1423, "train_tokens_per_second": 29249.738 }, { "epoch": 2.437109553810534, "grad_norm": 0.609375, "learning_rate": 1.7802840719725262e-05, "loss": 0.38450236320495607, "num_input_tokens_seen": 19590721216, "step": 68880, "train_runtime": 669774.2965, "train_tokens_per_second": 29249.736 }, { "epoch": 2.4374633740742624, "grad_norm": 0.6015625, "learning_rate": 1.7801712336495076e-05, "loss": 0.3825587511062622, "num_input_tokens_seen": 19593571584, "step": 68890, "train_runtime": 669873.8151, "train_tokens_per_second": 29249.645 }, { "epoch": 2.4378171943379914, "grad_norm": 0.62890625, "learning_rate": 1.7800584167795936e-05, "loss": 0.38755455017089846, "num_input_tokens_seen": 19596410624, "step": 68900, "train_runtime": 669971.3997, "train_tokens_per_second": 29249.623 }, { "epoch": 2.43817101460172, "grad_norm": 0.63671875, "learning_rate": 1.7799456213559863e-05, "loss": 0.37914950847625734, "num_input_tokens_seen": 19599232384, "step": 68910, "train_runtime": 670068.2046, "train_tokens_per_second": 29249.608 }, { "epoch": 2.438524834865449, "grad_norm": 0.63671875, "learning_rate": 1.7798328473718933e-05, "loss": 0.3909867525100708, "num_input_tokens_seen": 19602052352, "step": 68920, "train_runtime": 670164.2452, "train_tokens_per_second": 29249.624 }, { "epoch": 2.4388786551291775, "grad_norm": 0.60546875, "learning_rate": 1.779720094820522e-05, "loss": 0.3860414743423462, "num_input_tokens_seen": 19604874368, "step": 68930, "train_runtime": 670257.9732, "train_tokens_per_second": 29249.744 }, { "epoch": 2.4392324753929064, "grad_norm": 0.62890625, "learning_rate": 1.7796073636950857e-05, "loss": 0.38661651611328124, "num_input_tokens_seen": 19607754176, "step": 68940, "train_runtime": 670357.2167, "train_tokens_per_second": 29249.71 }, { "epoch": 2.439586295656635, "grad_norm": 0.625, "learning_rate": 1.7794946539887983e-05, "loss": 0.38774547576904295, "num_input_tokens_seen": 19610550208, "step": 68950, "train_runtime": 670453.2073, "train_tokens_per_second": 29249.693 }, { "epoch": 2.439940115920364, "grad_norm": 0.62890625, "learning_rate": 1.7793819656948787e-05, "loss": 0.3843644142150879, "num_input_tokens_seen": 19613431296, "step": 68960, "train_runtime": 670549.666, "train_tokens_per_second": 29249.782 }, { "epoch": 2.4402939361840925, "grad_norm": 0.625, "learning_rate": 1.7792692988065476e-05, "loss": 0.3909768581390381, "num_input_tokens_seen": 19616247744, "step": 68970, "train_runtime": 670646.0564, "train_tokens_per_second": 29249.777 }, { "epoch": 2.4406477564478215, "grad_norm": 0.59765625, "learning_rate": 1.7791566533170294e-05, "loss": 0.38463563919067384, "num_input_tokens_seen": 19619128000, "step": 68980, "train_runtime": 670746.0025, "train_tokens_per_second": 29249.713 }, { "epoch": 2.44100157671155, "grad_norm": 0.609375, "learning_rate": 1.7790440292195505e-05, "loss": 0.3878877878189087, "num_input_tokens_seen": 19621999168, "step": 68990, "train_runtime": 670844.7747, "train_tokens_per_second": 29249.686 }, { "epoch": 2.441355396975279, "grad_norm": 0.6328125, "learning_rate": 1.778931426507342e-05, "loss": 0.39021735191345214, "num_input_tokens_seen": 19624835136, "step": 69000, "train_runtime": 670942.8044, "train_tokens_per_second": 29249.639 }, { "epoch": 2.4417092172390076, "grad_norm": 0.6171875, "learning_rate": 1.778818845173636e-05, "loss": 0.3840382814407349, "num_input_tokens_seen": 19627691904, "step": 69010, "train_runtime": 671040.5282, "train_tokens_per_second": 29249.637 }, { "epoch": 2.4420630375027366, "grad_norm": 0.625, "learning_rate": 1.7787062852116687e-05, "loss": 0.3801845073699951, "num_input_tokens_seen": 19630551680, "step": 69020, "train_runtime": 671137.9418, "train_tokens_per_second": 29249.653 }, { "epoch": 2.4424168577664656, "grad_norm": 0.6328125, "learning_rate": 1.7785937466146795e-05, "loss": 0.3876810550689697, "num_input_tokens_seen": 19633376384, "step": 69030, "train_runtime": 671234.0637, "train_tokens_per_second": 29249.672 }, { "epoch": 2.442770678030194, "grad_norm": 0.60546875, "learning_rate": 1.7784812293759106e-05, "loss": 0.3851534128189087, "num_input_tokens_seen": 19636211712, "step": 69040, "train_runtime": 671329.8676, "train_tokens_per_second": 29249.722 }, { "epoch": 2.443124498293923, "grad_norm": 0.58203125, "learning_rate": 1.7783687334886065e-05, "loss": 0.38785078525543215, "num_input_tokens_seen": 19639016256, "step": 69050, "train_runtime": 671424.5537, "train_tokens_per_second": 29249.774 }, { "epoch": 2.4434783185576516, "grad_norm": 0.625, "learning_rate": 1.7782562589460156e-05, "loss": 0.38778104782104494, "num_input_tokens_seen": 19641962752, "step": 69060, "train_runtime": 671528.1726, "train_tokens_per_second": 29249.648 }, { "epoch": 2.4438321388213806, "grad_norm": 0.6015625, "learning_rate": 1.778143805741389e-05, "loss": 0.3882192611694336, "num_input_tokens_seen": 19644806592, "step": 69070, "train_runtime": 671627.499, "train_tokens_per_second": 29249.557 }, { "epoch": 2.444185959085109, "grad_norm": 0.6015625, "learning_rate": 1.7780313738679804e-05, "loss": 0.38394689559936523, "num_input_tokens_seen": 19647662272, "step": 69080, "train_runtime": 671722.4818, "train_tokens_per_second": 29249.672 }, { "epoch": 2.444539779348838, "grad_norm": 0.62890625, "learning_rate": 1.777918963319047e-05, "loss": 0.38447554111480714, "num_input_tokens_seen": 19650563968, "step": 69090, "train_runtime": 671821.6218, "train_tokens_per_second": 29249.675 }, { "epoch": 2.4448935996125667, "grad_norm": 0.62109375, "learning_rate": 1.7778065740878485e-05, "loss": 0.3888410091400146, "num_input_tokens_seen": 19653403136, "step": 69100, "train_runtime": 671921.0224, "train_tokens_per_second": 29249.573 }, { "epoch": 2.4452474198762957, "grad_norm": 0.6171875, "learning_rate": 1.7776942061676485e-05, "loss": 0.3863215923309326, "num_input_tokens_seen": 19656230784, "step": 69110, "train_runtime": 672018.5213, "train_tokens_per_second": 29249.537 }, { "epoch": 2.4456012401400242, "grad_norm": 0.6015625, "learning_rate": 1.7775818595517125e-05, "loss": 0.3869148254394531, "num_input_tokens_seen": 19659065408, "step": 69120, "train_runtime": 672114.4271, "train_tokens_per_second": 29249.581 }, { "epoch": 2.445955060403753, "grad_norm": 0.6015625, "learning_rate": 1.7774695342333093e-05, "loss": 0.38787178993225097, "num_input_tokens_seen": 19661943488, "step": 69130, "train_runtime": 672211.7971, "train_tokens_per_second": 29249.626 }, { "epoch": 2.4463088806674818, "grad_norm": 0.61328125, "learning_rate": 1.7773572302057108e-05, "loss": 0.3808140754699707, "num_input_tokens_seen": 19664729728, "step": 69140, "train_runtime": 672303.7223, "train_tokens_per_second": 29249.771 }, { "epoch": 2.4466627009312107, "grad_norm": 0.6328125, "learning_rate": 1.777244947462192e-05, "loss": 0.3911693572998047, "num_input_tokens_seen": 19667571456, "step": 69150, "train_runtime": 672402.1277, "train_tokens_per_second": 29249.716 }, { "epoch": 2.4470165211949393, "grad_norm": 0.609375, "learning_rate": 1.777132685996031e-05, "loss": 0.3874667167663574, "num_input_tokens_seen": 19670420928, "step": 69160, "train_runtime": 672498.7597, "train_tokens_per_second": 29249.75 }, { "epoch": 2.4473703414586683, "grad_norm": 0.609375, "learning_rate": 1.7770204458005086e-05, "loss": 0.38370957374572756, "num_input_tokens_seen": 19673216000, "step": 69170, "train_runtime": 672592.5247, "train_tokens_per_second": 29249.829 }, { "epoch": 2.4477241617223973, "grad_norm": 0.6328125, "learning_rate": 1.776908226868908e-05, "loss": 0.3922628402709961, "num_input_tokens_seen": 19676064512, "step": 69180, "train_runtime": 672690.8619, "train_tokens_per_second": 29249.787 }, { "epoch": 2.448077981986126, "grad_norm": 0.6328125, "learning_rate": 1.776796029194517e-05, "loss": 0.38692190647125246, "num_input_tokens_seen": 19678938944, "step": 69190, "train_runtime": 672788.6467, "train_tokens_per_second": 29249.808 }, { "epoch": 2.448431802249855, "grad_norm": 0.65625, "learning_rate": 1.776683852770624e-05, "loss": 0.38929319381713867, "num_input_tokens_seen": 19681750464, "step": 69200, "train_runtime": 672884.4013, "train_tokens_per_second": 29249.824 }, { "epoch": 2.4487856225135833, "grad_norm": 0.625, "learning_rate": 1.7765716975905224e-05, "loss": 0.3889157772064209, "num_input_tokens_seen": 19684566592, "step": 69210, "train_runtime": 672981.2231, "train_tokens_per_second": 29249.801 }, { "epoch": 2.4491394427773123, "grad_norm": 0.62109375, "learning_rate": 1.776459563647508e-05, "loss": 0.3855783462524414, "num_input_tokens_seen": 19687365696, "step": 69220, "train_runtime": 673074.3676, "train_tokens_per_second": 29249.912 }, { "epoch": 2.449493263041041, "grad_norm": 0.59375, "learning_rate": 1.7763474509348795e-05, "loss": 0.3851781368255615, "num_input_tokens_seen": 19690192640, "step": 69230, "train_runtime": 673170.1943, "train_tokens_per_second": 29249.947 }, { "epoch": 2.44984708330477, "grad_norm": 0.62109375, "learning_rate": 1.7762353594459377e-05, "loss": 0.38280205726623534, "num_input_tokens_seen": 19693018944, "step": 69240, "train_runtime": 673264.6716, "train_tokens_per_second": 29250.041 }, { "epoch": 2.4502009035684984, "grad_norm": 0.6015625, "learning_rate": 1.7761232891739878e-05, "loss": 0.3867254018783569, "num_input_tokens_seen": 19695877760, "step": 69250, "train_runtime": 673364.6092, "train_tokens_per_second": 29249.945 }, { "epoch": 2.4505547238322274, "grad_norm": 0.640625, "learning_rate": 1.776011240112337e-05, "loss": 0.3847388505935669, "num_input_tokens_seen": 19698677056, "step": 69260, "train_runtime": 673461.9936, "train_tokens_per_second": 29249.872 }, { "epoch": 2.450908544095956, "grad_norm": 0.59375, "learning_rate": 1.7758992122542966e-05, "loss": 0.38564984798431395, "num_input_tokens_seen": 19701504960, "step": 69270, "train_runtime": 673558.1779, "train_tokens_per_second": 29249.893 }, { "epoch": 2.451262364359685, "grad_norm": 0.61328125, "learning_rate": 1.7757872055931786e-05, "loss": 0.38860111236572265, "num_input_tokens_seen": 19704340224, "step": 69280, "train_runtime": 673654.0166, "train_tokens_per_second": 29249.941 }, { "epoch": 2.4516161846234135, "grad_norm": 0.62109375, "learning_rate": 1.7756752201223005e-05, "loss": 0.3863933563232422, "num_input_tokens_seen": 19707155328, "step": 69290, "train_runtime": 673748.2219, "train_tokens_per_second": 29250.029 }, { "epoch": 2.4519700048871425, "grad_norm": 0.61328125, "learning_rate": 1.7755632558349808e-05, "loss": 0.38688414096832274, "num_input_tokens_seen": 19710033664, "step": 69300, "train_runtime": 673847.4195, "train_tokens_per_second": 29249.995 }, { "epoch": 2.452323825150871, "grad_norm": 0.62109375, "learning_rate": 1.7754513127245423e-05, "loss": 0.38744819164276123, "num_input_tokens_seen": 19712820608, "step": 69310, "train_runtime": 673940.2089, "train_tokens_per_second": 29250.103 }, { "epoch": 2.4526776454146, "grad_norm": 0.60546875, "learning_rate": 1.77533939078431e-05, "loss": 0.38521599769592285, "num_input_tokens_seen": 19715692160, "step": 69320, "train_runtime": 674037.5017, "train_tokens_per_second": 29250.141 }, { "epoch": 2.453031465678329, "grad_norm": 0.65625, "learning_rate": 1.7752274900076117e-05, "loss": 0.38271634578704833, "num_input_tokens_seen": 19718515712, "step": 69330, "train_runtime": 674134.1946, "train_tokens_per_second": 29250.134 }, { "epoch": 2.4533852859420575, "grad_norm": 0.62109375, "learning_rate": 1.775115610387779e-05, "loss": 0.37929162979125974, "num_input_tokens_seen": 19721335040, "step": 69340, "train_runtime": 674228.3903, "train_tokens_per_second": 29250.229 }, { "epoch": 2.453739106205786, "grad_norm": 0.609375, "learning_rate": 1.7750037519181458e-05, "loss": 0.38574793338775637, "num_input_tokens_seen": 19724223744, "step": 69350, "train_runtime": 674329.6789, "train_tokens_per_second": 29250.12 }, { "epoch": 2.454092926469515, "grad_norm": 0.61328125, "learning_rate": 1.774891914592049e-05, "loss": 0.3858103036880493, "num_input_tokens_seen": 19727068800, "step": 69360, "train_runtime": 674427.1838, "train_tokens_per_second": 29250.109 }, { "epoch": 2.454446746733244, "grad_norm": 0.640625, "learning_rate": 1.7747800984028288e-05, "loss": 0.38794875144958496, "num_input_tokens_seen": 19729890368, "step": 69370, "train_runtime": 674524.3261, "train_tokens_per_second": 29250.08 }, { "epoch": 2.4548005669969726, "grad_norm": 0.609375, "learning_rate": 1.7746683033438273e-05, "loss": 0.38625426292419435, "num_input_tokens_seen": 19732693376, "step": 69380, "train_runtime": 674622.4596, "train_tokens_per_second": 29249.98 }, { "epoch": 2.4551543872607016, "grad_norm": 0.62109375, "learning_rate": 1.7745565294083913e-05, "loss": 0.3860450744628906, "num_input_tokens_seen": 19735536192, "step": 69390, "train_runtime": 674720.6276, "train_tokens_per_second": 29249.938 }, { "epoch": 2.45550820752443, "grad_norm": 0.58984375, "learning_rate": 1.7744447765898684e-05, "loss": 0.38929362297058107, "num_input_tokens_seen": 19738395840, "step": 69400, "train_runtime": 674817.8123, "train_tokens_per_second": 29249.963 }, { "epoch": 2.455862027788159, "grad_norm": 0.65234375, "learning_rate": 1.774333044881611e-05, "loss": 0.3885905027389526, "num_input_tokens_seen": 19741271552, "step": 69410, "train_runtime": 674915.8755, "train_tokens_per_second": 29249.974 }, { "epoch": 2.4562158480518876, "grad_norm": 0.6015625, "learning_rate": 1.7742213342769734e-05, "loss": 0.38676636219024657, "num_input_tokens_seen": 19744131584, "step": 69420, "train_runtime": 675013.0214, "train_tokens_per_second": 29250.001 }, { "epoch": 2.4565696683156166, "grad_norm": 0.625, "learning_rate": 1.7741096447693133e-05, "loss": 0.3845911741256714, "num_input_tokens_seen": 19747028800, "step": 69430, "train_runtime": 675113.8845, "train_tokens_per_second": 29249.923 }, { "epoch": 2.456923488579345, "grad_norm": 0.625, "learning_rate": 1.7739979763519905e-05, "loss": 0.3830073833465576, "num_input_tokens_seen": 19749886016, "step": 69440, "train_runtime": 675209.0608, "train_tokens_per_second": 29250.031 }, { "epoch": 2.457277308843074, "grad_norm": 0.59765625, "learning_rate": 1.7738863290183695e-05, "loss": 0.37986533641815184, "num_input_tokens_seen": 19752744512, "step": 69450, "train_runtime": 675308.4248, "train_tokens_per_second": 29249.96 }, { "epoch": 2.4576311291068027, "grad_norm": 0.609375, "learning_rate": 1.7737747027618156e-05, "loss": 0.38946533203125, "num_input_tokens_seen": 19755592768, "step": 69460, "train_runtime": 675405.4356, "train_tokens_per_second": 29249.976 }, { "epoch": 2.4579849493705317, "grad_norm": 0.609375, "learning_rate": 1.7736630975756982e-05, "loss": 0.3870500087738037, "num_input_tokens_seen": 19758432768, "step": 69470, "train_runtime": 675503.4735, "train_tokens_per_second": 29249.935 }, { "epoch": 2.4583387696342602, "grad_norm": 0.62109375, "learning_rate": 1.7735515134533902e-05, "loss": 0.3837573528289795, "num_input_tokens_seen": 19761284928, "step": 69480, "train_runtime": 675602.5976, "train_tokens_per_second": 29249.865 }, { "epoch": 2.4586925898979892, "grad_norm": 0.61328125, "learning_rate": 1.773439950388265e-05, "loss": 0.38840084075927733, "num_input_tokens_seen": 19764132992, "step": 69490, "train_runtime": 675700.018, "train_tokens_per_second": 29249.863 }, { "epoch": 2.4590464101617178, "grad_norm": 0.66796875, "learning_rate": 1.773328408373702e-05, "loss": 0.3912993907928467, "num_input_tokens_seen": 19766993728, "step": 69500, "train_runtime": 675798.5429, "train_tokens_per_second": 29249.832 }, { "epoch": 2.4594002304254468, "grad_norm": 0.63671875, "learning_rate": 1.7732168874030813e-05, "loss": 0.3795579433441162, "num_input_tokens_seen": 19769818432, "step": 69510, "train_runtime": 675893.3566, "train_tokens_per_second": 29249.908 }, { "epoch": 2.4597540506891757, "grad_norm": 0.63671875, "learning_rate": 1.7731053874697875e-05, "loss": 0.3902834177017212, "num_input_tokens_seen": 19772655424, "step": 69520, "train_runtime": 675990.9674, "train_tokens_per_second": 29249.881 }, { "epoch": 2.4601078709529043, "grad_norm": 0.625, "learning_rate": 1.7729939085672064e-05, "loss": 0.3869187593460083, "num_input_tokens_seen": 19775456576, "step": 69530, "train_runtime": 676085.493, "train_tokens_per_second": 29249.935 }, { "epoch": 2.4604616912166333, "grad_norm": 0.62109375, "learning_rate": 1.7728824506887278e-05, "loss": 0.3830282211303711, "num_input_tokens_seen": 19778306176, "step": 69540, "train_runtime": 676182.4485, "train_tokens_per_second": 29249.955 }, { "epoch": 2.460815511480362, "grad_norm": 0.625, "learning_rate": 1.7727710138277448e-05, "loss": 0.38532142639160155, "num_input_tokens_seen": 19781158528, "step": 69550, "train_runtime": 676279.2555, "train_tokens_per_second": 29249.986 }, { "epoch": 2.461169331744091, "grad_norm": 0.65234375, "learning_rate": 1.7726595979776522e-05, "loss": 0.38169758319854735, "num_input_tokens_seen": 19783951744, "step": 69560, "train_runtime": 676373.044, "train_tokens_per_second": 29250.059 }, { "epoch": 2.4615231520078193, "grad_norm": 0.61328125, "learning_rate": 1.7725482031318487e-05, "loss": 0.38606102466583253, "num_input_tokens_seen": 19786827456, "step": 69570, "train_runtime": 676475.1798, "train_tokens_per_second": 29249.894 }, { "epoch": 2.4618769722715483, "grad_norm": 0.6015625, "learning_rate": 1.772436829283735e-05, "loss": 0.38149051666259765, "num_input_tokens_seen": 19789700992, "step": 69580, "train_runtime": 676574.3379, "train_tokens_per_second": 29249.855 }, { "epoch": 2.462230792535277, "grad_norm": 0.62109375, "learning_rate": 1.7723254764267157e-05, "loss": 0.3839037179946899, "num_input_tokens_seen": 19792513024, "step": 69590, "train_runtime": 676670.2785, "train_tokens_per_second": 29249.863 }, { "epoch": 2.462584612799006, "grad_norm": 0.62890625, "learning_rate": 1.772214144554198e-05, "loss": 0.3879279613494873, "num_input_tokens_seen": 19795376896, "step": 69600, "train_runtime": 676767.6194, "train_tokens_per_second": 29249.888 }, { "epoch": 2.4629384330627344, "grad_norm": 0.58984375, "learning_rate": 1.772102833659591e-05, "loss": 0.392243480682373, "num_input_tokens_seen": 19798204352, "step": 69610, "train_runtime": 676864.2648, "train_tokens_per_second": 29249.889 }, { "epoch": 2.4632922533264634, "grad_norm": 0.60546875, "learning_rate": 1.771991543736308e-05, "loss": 0.38358900547027586, "num_input_tokens_seen": 19801081152, "step": 69620, "train_runtime": 676961.8303, "train_tokens_per_second": 29249.923 }, { "epoch": 2.463646073590192, "grad_norm": 0.66796875, "learning_rate": 1.7718802747777656e-05, "loss": 0.38689651489257815, "num_input_tokens_seen": 19803958720, "step": 69630, "train_runtime": 677062.4267, "train_tokens_per_second": 29249.827 }, { "epoch": 2.463999893853921, "grad_norm": 0.61328125, "learning_rate": 1.771769026777381e-05, "loss": 0.39035146236419677, "num_input_tokens_seen": 19806807360, "step": 69640, "train_runtime": 677158.941, "train_tokens_per_second": 29249.865 }, { "epoch": 2.4643537141176495, "grad_norm": 0.609375, "learning_rate": 1.7716577997285763e-05, "loss": 0.38914761543273924, "num_input_tokens_seen": 19809599360, "step": 69650, "train_runtime": 677255.5234, "train_tokens_per_second": 29249.816 }, { "epoch": 2.4647075343813785, "grad_norm": 0.62890625, "learning_rate": 1.771546593624776e-05, "loss": 0.3914644241333008, "num_input_tokens_seen": 19812505984, "step": 69660, "train_runtime": 677353.529, "train_tokens_per_second": 29249.875 }, { "epoch": 2.4650613546451074, "grad_norm": 0.62109375, "learning_rate": 1.7714354084594077e-05, "loss": 0.3835927963256836, "num_input_tokens_seen": 19815300608, "step": 69670, "train_runtime": 677446.42, "train_tokens_per_second": 29249.989 }, { "epoch": 2.465415174908836, "grad_norm": 0.58984375, "learning_rate": 1.7713242442259005e-05, "loss": 0.38383283615112307, "num_input_tokens_seen": 19818156096, "step": 69680, "train_runtime": 677544.0532, "train_tokens_per_second": 29249.989 }, { "epoch": 2.4657689951725645, "grad_norm": 0.60546875, "learning_rate": 1.771213100917688e-05, "loss": 0.3838203907012939, "num_input_tokens_seen": 19821056256, "step": 69690, "train_runtime": 677644.1262, "train_tokens_per_second": 29249.949 }, { "epoch": 2.4661228154362935, "grad_norm": 0.6171875, "learning_rate": 1.771101978528207e-05, "loss": 0.3864152431488037, "num_input_tokens_seen": 19823867648, "step": 69700, "train_runtime": 677738.432, "train_tokens_per_second": 29250.027 }, { "epoch": 2.4664766357000225, "grad_norm": 0.6171875, "learning_rate": 1.770990877050895e-05, "loss": 0.38721094131469724, "num_input_tokens_seen": 19826690560, "step": 69710, "train_runtime": 677835.239, "train_tokens_per_second": 29250.014 }, { "epoch": 2.466830455963751, "grad_norm": 0.62890625, "learning_rate": 1.7708797964791944e-05, "loss": 0.383952260017395, "num_input_tokens_seen": 19829525056, "step": 69720, "train_runtime": 677931.3943, "train_tokens_per_second": 29250.047 }, { "epoch": 2.46718427622748, "grad_norm": 0.61328125, "learning_rate": 1.7707687368065497e-05, "loss": 0.38641607761383057, "num_input_tokens_seen": 19832363904, "step": 69730, "train_runtime": 678030.0622, "train_tokens_per_second": 29249.977 }, { "epoch": 2.4675380964912086, "grad_norm": 0.625, "learning_rate": 1.7706576980264086e-05, "loss": 0.38266696929931643, "num_input_tokens_seen": 19835189952, "step": 69740, "train_runtime": 678125.3478, "train_tokens_per_second": 29250.035 }, { "epoch": 2.4678919167549376, "grad_norm": 0.63671875, "learning_rate": 1.770546680132221e-05, "loss": 0.3842828035354614, "num_input_tokens_seen": 19838050304, "step": 69750, "train_runtime": 678223.5087, "train_tokens_per_second": 29250.019 }, { "epoch": 2.468245737018666, "grad_norm": 0.5859375, "learning_rate": 1.7704356831174402e-05, "loss": 0.3810943841934204, "num_input_tokens_seen": 19840935616, "step": 69760, "train_runtime": 678322.278, "train_tokens_per_second": 29250.013 }, { "epoch": 2.468599557282395, "grad_norm": 0.59375, "learning_rate": 1.770324706975523e-05, "loss": 0.3846139907836914, "num_input_tokens_seen": 19843782208, "step": 69770, "train_runtime": 678417.6898, "train_tokens_per_second": 29250.095 }, { "epoch": 2.4689533775461237, "grad_norm": 0.61328125, "learning_rate": 1.7702137516999267e-05, "loss": 0.3798831462860107, "num_input_tokens_seen": 19846603840, "step": 69780, "train_runtime": 678513.006, "train_tokens_per_second": 29250.145 }, { "epoch": 2.4693071978098526, "grad_norm": 0.6015625, "learning_rate": 1.7701028172841147e-05, "loss": 0.38324086666107177, "num_input_tokens_seen": 19849473472, "step": 69790, "train_runtime": 678613.9837, "train_tokens_per_second": 29250.021 }, { "epoch": 2.469661018073581, "grad_norm": 0.63671875, "learning_rate": 1.7699919037215512e-05, "loss": 0.38632800579071047, "num_input_tokens_seen": 19852302208, "step": 69800, "train_runtime": 678709.1298, "train_tokens_per_second": 29250.089 }, { "epoch": 2.47001483833731, "grad_norm": 0.6171875, "learning_rate": 1.7698810110057035e-05, "loss": 0.38391814231872556, "num_input_tokens_seen": 19855086656, "step": 69810, "train_runtime": 678804.4673, "train_tokens_per_second": 29250.082 }, { "epoch": 2.4703686586010387, "grad_norm": 0.62890625, "learning_rate": 1.769770139130042e-05, "loss": 0.3902827501296997, "num_input_tokens_seen": 19857882560, "step": 69820, "train_runtime": 678900.4313, "train_tokens_per_second": 29250.066 }, { "epoch": 2.4707224788647677, "grad_norm": 0.60546875, "learning_rate": 1.7696592880880408e-05, "loss": 0.3875112056732178, "num_input_tokens_seen": 19860724608, "step": 69830, "train_runtime": 678998.5732, "train_tokens_per_second": 29250.024 }, { "epoch": 2.4710762991284962, "grad_norm": 0.66796875, "learning_rate": 1.769548457873175e-05, "loss": 0.3854401111602783, "num_input_tokens_seen": 19863600896, "step": 69840, "train_runtime": 679098.1213, "train_tokens_per_second": 29249.972 }, { "epoch": 2.4714301193922252, "grad_norm": 0.59765625, "learning_rate": 1.7694376484789247e-05, "loss": 0.3867147207260132, "num_input_tokens_seen": 19866412352, "step": 69850, "train_runtime": 679193.9332, "train_tokens_per_second": 29249.985 }, { "epoch": 2.471783939655954, "grad_norm": 0.59375, "learning_rate": 1.7693268598987705e-05, "loss": 0.3834913969039917, "num_input_tokens_seen": 19869221248, "step": 69860, "train_runtime": 679291.8624, "train_tokens_per_second": 29249.903 }, { "epoch": 2.4721377599196828, "grad_norm": 0.65625, "learning_rate": 1.769216092126198e-05, "loss": 0.38513617515563964, "num_input_tokens_seen": 19872089536, "step": 69870, "train_runtime": 679389.6569, "train_tokens_per_second": 29249.915 }, { "epoch": 2.4724915801834118, "grad_norm": 0.6015625, "learning_rate": 1.7691053451546948e-05, "loss": 0.38790097236633303, "num_input_tokens_seen": 19874967808, "step": 69880, "train_runtime": 679488.2907, "train_tokens_per_second": 29249.905 }, { "epoch": 2.4728454004471403, "grad_norm": 0.62109375, "learning_rate": 1.7689946189777502e-05, "loss": 0.38289918899536135, "num_input_tokens_seen": 19877793088, "step": 69890, "train_runtime": 679582.0751, "train_tokens_per_second": 29250.026 }, { "epoch": 2.4731992207108693, "grad_norm": 0.6171875, "learning_rate": 1.7688839135888594e-05, "loss": 0.3907016277313232, "num_input_tokens_seen": 19880589376, "step": 69900, "train_runtime": 679680.713, "train_tokens_per_second": 29249.895 }, { "epoch": 2.473553040974598, "grad_norm": 0.62890625, "learning_rate": 1.768773228981517e-05, "loss": 0.38656439781188967, "num_input_tokens_seen": 19883474944, "step": 69910, "train_runtime": 679778.0774, "train_tokens_per_second": 29249.95 }, { "epoch": 2.473906861238327, "grad_norm": 0.61328125, "learning_rate": 1.7686625651492226e-05, "loss": 0.3838407754898071, "num_input_tokens_seen": 19886367424, "step": 69920, "train_runtime": 679875.7261, "train_tokens_per_second": 29250.004 }, { "epoch": 2.4742606815020554, "grad_norm": 0.6328125, "learning_rate": 1.7685519220854775e-05, "loss": 0.3877925634384155, "num_input_tokens_seen": 19889233600, "step": 69930, "train_runtime": 679977.644, "train_tokens_per_second": 29249.835 }, { "epoch": 2.4746145017657843, "grad_norm": 0.6171875, "learning_rate": 1.7684412997837872e-05, "loss": 0.38650951385498045, "num_input_tokens_seen": 19892081472, "step": 69940, "train_runtime": 680077.006, "train_tokens_per_second": 29249.749 }, { "epoch": 2.474968322029513, "grad_norm": 0.62890625, "learning_rate": 1.7683306982376585e-05, "loss": 0.3828622102737427, "num_input_tokens_seen": 19894934656, "step": 69950, "train_runtime": 680175.6842, "train_tokens_per_second": 29249.7 }, { "epoch": 2.475322142293242, "grad_norm": 0.6015625, "learning_rate": 1.7682201174406023e-05, "loss": 0.3817132949829102, "num_input_tokens_seen": 19897847616, "step": 69960, "train_runtime": 680276.9111, "train_tokens_per_second": 29249.63 }, { "epoch": 2.4756759625569704, "grad_norm": 0.65234375, "learning_rate": 1.7681095573861314e-05, "loss": 0.3854166269302368, "num_input_tokens_seen": 19900666432, "step": 69970, "train_runtime": 680373.374, "train_tokens_per_second": 29249.626 }, { "epoch": 2.4760297828206994, "grad_norm": 0.61328125, "learning_rate": 1.7679990180677623e-05, "loss": 0.38974804878234864, "num_input_tokens_seen": 19903458944, "step": 69980, "train_runtime": 680466.8818, "train_tokens_per_second": 29249.71 }, { "epoch": 2.476383603084428, "grad_norm": 0.62890625, "learning_rate": 1.767888499479013e-05, "loss": 0.3887038707733154, "num_input_tokens_seen": 19906279488, "step": 69990, "train_runtime": 680563.327, "train_tokens_per_second": 29249.709 }, { "epoch": 2.476737423348157, "grad_norm": 0.59765625, "learning_rate": 1.767778001613406e-05, "loss": 0.3845175266265869, "num_input_tokens_seen": 19909106304, "step": 70000, "train_runtime": 680660.7774, "train_tokens_per_second": 29249.675 }, { "epoch": 2.476737423348157, "eval_loss": 0.3363865911960602, "eval_runtime": 8.4244, "eval_samples_per_second": 473.389, "eval_steps_per_second": 3.799, "num_input_tokens_seen": 19909106304, "step": 70000 }, { "epoch": 2.477091243611886, "grad_norm": 0.62890625, "learning_rate": 1.7676675244644658e-05, "loss": 0.38898544311523436, "num_input_tokens_seen": 19911947520, "step": 70010, "train_runtime": 680785.4424, "train_tokens_per_second": 29248.492 }, { "epoch": 2.4774450638756145, "grad_norm": 0.65234375, "learning_rate": 1.7675570680257193e-05, "loss": 0.38664755821228025, "num_input_tokens_seen": 19914752768, "step": 70020, "train_runtime": 680879.5656, "train_tokens_per_second": 29248.569 }, { "epoch": 2.477798884139343, "grad_norm": 0.6171875, "learning_rate": 1.7674466322906973e-05, "loss": 0.38545091152191163, "num_input_tokens_seen": 19917633088, "step": 70030, "train_runtime": 680979.0432, "train_tokens_per_second": 29248.526 }, { "epoch": 2.478152704403072, "grad_norm": 0.6171875, "learning_rate": 1.7673362172529324e-05, "loss": 0.38661556243896483, "num_input_tokens_seen": 19920416832, "step": 70040, "train_runtime": 681071.5682, "train_tokens_per_second": 29248.64 }, { "epoch": 2.478506524666801, "grad_norm": 0.63671875, "learning_rate": 1.7672258229059605e-05, "loss": 0.38671653270721434, "num_input_tokens_seen": 19923288640, "step": 70050, "train_runtime": 681166.3388, "train_tokens_per_second": 29248.786 }, { "epoch": 2.4788603449305295, "grad_norm": 0.6015625, "learning_rate": 1.76711544924332e-05, "loss": 0.3889922142028809, "num_input_tokens_seen": 19926118016, "step": 70060, "train_runtime": 681260.3676, "train_tokens_per_second": 29248.902 }, { "epoch": 2.4792141651942585, "grad_norm": 0.62890625, "learning_rate": 1.7670050962585536e-05, "loss": 0.3879117012023926, "num_input_tokens_seen": 19928952320, "step": 70070, "train_runtime": 681357.4297, "train_tokens_per_second": 29248.896 }, { "epoch": 2.479567985457987, "grad_norm": 0.609375, "learning_rate": 1.7668947639452045e-05, "loss": 0.39149041175842286, "num_input_tokens_seen": 19931790464, "step": 70080, "train_runtime": 681455.0622, "train_tokens_per_second": 29248.87 }, { "epoch": 2.479921805721716, "grad_norm": 0.62890625, "learning_rate": 1.76678445229682e-05, "loss": 0.3885554313659668, "num_input_tokens_seen": 19934580160, "step": 70090, "train_runtime": 681548.5404, "train_tokens_per_second": 29248.951 }, { "epoch": 2.4802756259854446, "grad_norm": 0.6328125, "learning_rate": 1.7666741613069505e-05, "loss": 0.3846467971801758, "num_input_tokens_seen": 19937440128, "step": 70100, "train_runtime": 681645.3253, "train_tokens_per_second": 29248.994 }, { "epoch": 2.4806294462491736, "grad_norm": 0.6328125, "learning_rate": 1.7665638909691484e-05, "loss": 0.38697223663330077, "num_input_tokens_seen": 19940313664, "step": 70110, "train_runtime": 681746.0083, "train_tokens_per_second": 29248.889 }, { "epoch": 2.480983266512902, "grad_norm": 0.60546875, "learning_rate": 1.766453641276969e-05, "loss": 0.3926079273223877, "num_input_tokens_seen": 19943147776, "step": 70120, "train_runtime": 681844.3728, "train_tokens_per_second": 29248.827 }, { "epoch": 2.481337086776631, "grad_norm": 0.625, "learning_rate": 1.7663434122239723e-05, "loss": 0.3873988151550293, "num_input_tokens_seen": 19945951232, "step": 70130, "train_runtime": 681940.3578, "train_tokens_per_second": 29248.821 }, { "epoch": 2.4816909070403597, "grad_norm": 0.578125, "learning_rate": 1.7662332038037176e-05, "loss": 0.38596668243408205, "num_input_tokens_seen": 19948818112, "step": 70140, "train_runtime": 682039.9796, "train_tokens_per_second": 29248.752 }, { "epoch": 2.4820447273040886, "grad_norm": 0.6328125, "learning_rate": 1.76612301600977e-05, "loss": 0.3911670446395874, "num_input_tokens_seen": 19951633920, "step": 70150, "train_runtime": 682134.1734, "train_tokens_per_second": 29248.841 }, { "epoch": 2.4823985475678176, "grad_norm": 0.640625, "learning_rate": 1.7660128488356968e-05, "loss": 0.3846114635467529, "num_input_tokens_seen": 19954501632, "step": 70160, "train_runtime": 682232.3839, "train_tokens_per_second": 29248.834 }, { "epoch": 2.482752367831546, "grad_norm": 0.62890625, "learning_rate": 1.7659027022750667e-05, "loss": 0.38332276344299315, "num_input_tokens_seen": 19957396288, "step": 70170, "train_runtime": 682331.8456, "train_tokens_per_second": 29248.813 }, { "epoch": 2.4831061880952747, "grad_norm": 0.62890625, "learning_rate": 1.765792576321452e-05, "loss": 0.3880870819091797, "num_input_tokens_seen": 19960188992, "step": 70180, "train_runtime": 682426.8258, "train_tokens_per_second": 29248.834 }, { "epoch": 2.4834600083590037, "grad_norm": 0.625, "learning_rate": 1.7656824709684287e-05, "loss": 0.38588049411773684, "num_input_tokens_seen": 19963016256, "step": 70190, "train_runtime": 682520.8258, "train_tokens_per_second": 29248.948 }, { "epoch": 2.4838138286227327, "grad_norm": 0.6171875, "learning_rate": 1.765572386209575e-05, "loss": 0.3874520778656006, "num_input_tokens_seen": 19965854144, "step": 70200, "train_runtime": 682619.522, "train_tokens_per_second": 29248.877 }, { "epoch": 2.4841676488864612, "grad_norm": 0.62109375, "learning_rate": 1.7654623220384713e-05, "loss": 0.39153075218200684, "num_input_tokens_seen": 19968755072, "step": 70210, "train_runtime": 682719.049, "train_tokens_per_second": 29248.862 }, { "epoch": 2.4845214691501902, "grad_norm": 0.62109375, "learning_rate": 1.7653522784487014e-05, "loss": 0.38494038581848145, "num_input_tokens_seen": 19971626880, "step": 70220, "train_runtime": 682820.5947, "train_tokens_per_second": 29248.718 }, { "epoch": 2.4848752894139188, "grad_norm": 0.609375, "learning_rate": 1.765242255433852e-05, "loss": 0.3874661445617676, "num_input_tokens_seen": 19974504704, "step": 70230, "train_runtime": 682918.4584, "train_tokens_per_second": 29248.74 }, { "epoch": 2.4852291096776478, "grad_norm": 0.61328125, "learning_rate": 1.7651322529875126e-05, "loss": 0.38773882389068604, "num_input_tokens_seen": 19977307968, "step": 70240, "train_runtime": 683013.4007, "train_tokens_per_second": 29248.779 }, { "epoch": 2.4855829299413763, "grad_norm": 0.625, "learning_rate": 1.7650222711032744e-05, "loss": 0.38625500202178953, "num_input_tokens_seen": 19980154560, "step": 70250, "train_runtime": 683110.5157, "train_tokens_per_second": 29248.788 }, { "epoch": 2.4859367502051053, "grad_norm": 0.62890625, "learning_rate": 1.764912309774733e-05, "loss": 0.38571677207946775, "num_input_tokens_seen": 19982925312, "step": 70260, "train_runtime": 683202.7717, "train_tokens_per_second": 29248.894 }, { "epoch": 2.486290570468834, "grad_norm": 0.60546875, "learning_rate": 1.764802368995486e-05, "loss": 0.3853276252746582, "num_input_tokens_seen": 19985811008, "step": 70270, "train_runtime": 683300.5099, "train_tokens_per_second": 29248.933 }, { "epoch": 2.486644390732563, "grad_norm": 0.61328125, "learning_rate": 1.764692448759134e-05, "loss": 0.38460555076599123, "num_input_tokens_seen": 19988728576, "step": 70280, "train_runtime": 683400.6412, "train_tokens_per_second": 29248.917 }, { "epoch": 2.4869982109962914, "grad_norm": 0.60546875, "learning_rate": 1.7645825490592797e-05, "loss": 0.38587079048156736, "num_input_tokens_seen": 19991587584, "step": 70290, "train_runtime": 683501.763, "train_tokens_per_second": 29248.773 }, { "epoch": 2.4873520312600204, "grad_norm": 0.609375, "learning_rate": 1.7644726698895296e-05, "loss": 0.38921346664428713, "num_input_tokens_seen": 19994424064, "step": 70300, "train_runtime": 683597.2451, "train_tokens_per_second": 29248.837 }, { "epoch": 2.487705851523749, "grad_norm": 0.6171875, "learning_rate": 1.7643628112434918e-05, "loss": 0.38572556972503663, "num_input_tokens_seen": 19997281344, "step": 70310, "train_runtime": 683694.1972, "train_tokens_per_second": 29248.868 }, { "epoch": 2.488059671787478, "grad_norm": 0.640625, "learning_rate": 1.764252973114779e-05, "loss": 0.38218538761138915, "num_input_tokens_seen": 20000128448, "step": 70320, "train_runtime": 683791.4072, "train_tokens_per_second": 29248.874 }, { "epoch": 2.4884134920512064, "grad_norm": 0.59375, "learning_rate": 1.764143155497005e-05, "loss": 0.3856635093688965, "num_input_tokens_seen": 20002925120, "step": 70330, "train_runtime": 683885.9125, "train_tokens_per_second": 29248.921 }, { "epoch": 2.4887673123149354, "grad_norm": 0.6171875, "learning_rate": 1.7640333583837874e-05, "loss": 0.3883447408676147, "num_input_tokens_seen": 20005764160, "step": 70340, "train_runtime": 683983.4951, "train_tokens_per_second": 29248.899 }, { "epoch": 2.4891211325786644, "grad_norm": 0.6015625, "learning_rate": 1.7639235817687455e-05, "loss": 0.38215930461883546, "num_input_tokens_seen": 20008615616, "step": 70350, "train_runtime": 684081.5611, "train_tokens_per_second": 29248.874 }, { "epoch": 2.489474952842393, "grad_norm": 0.6015625, "learning_rate": 1.7638138256455024e-05, "loss": 0.3882733345031738, "num_input_tokens_seen": 20011465024, "step": 70360, "train_runtime": 684178.6784, "train_tokens_per_second": 29248.887 }, { "epoch": 2.489828773106122, "grad_norm": 0.609375, "learning_rate": 1.7637040900076837e-05, "loss": 0.3836606740951538, "num_input_tokens_seen": 20014335744, "step": 70370, "train_runtime": 684276.0441, "train_tokens_per_second": 29248.921 }, { "epoch": 2.4901825933698505, "grad_norm": 0.59765625, "learning_rate": 1.7635943748489174e-05, "loss": 0.38716998100280764, "num_input_tokens_seen": 20017177792, "step": 70380, "train_runtime": 684374.4691, "train_tokens_per_second": 29248.867 }, { "epoch": 2.4905364136335795, "grad_norm": 0.59765625, "learning_rate": 1.7634846801628348e-05, "loss": 0.37952208518981934, "num_input_tokens_seen": 20020005760, "step": 70390, "train_runtime": 684470.0219, "train_tokens_per_second": 29248.915 }, { "epoch": 2.490890233897308, "grad_norm": 0.62109375, "learning_rate": 1.7633750059430698e-05, "loss": 0.3838933229446411, "num_input_tokens_seen": 20022855936, "step": 70400, "train_runtime": 684566.9677, "train_tokens_per_second": 29248.937 }, { "epoch": 2.491244054161037, "grad_norm": 0.62109375, "learning_rate": 1.763265352183259e-05, "loss": 0.38312368392944335, "num_input_tokens_seen": 20025694464, "step": 70410, "train_runtime": 684660.9776, "train_tokens_per_second": 29249.066 }, { "epoch": 2.4915978744247655, "grad_norm": 0.62890625, "learning_rate": 1.7631557188770415e-05, "loss": 0.38325514793396, "num_input_tokens_seen": 20028502272, "step": 70420, "train_runtime": 684755.0196, "train_tokens_per_second": 29249.15 }, { "epoch": 2.4919516946884945, "grad_norm": 0.6015625, "learning_rate": 1.7630461060180593e-05, "loss": 0.38318958282470705, "num_input_tokens_seen": 20031350080, "step": 70430, "train_runtime": 684849.4729, "train_tokens_per_second": 29249.274 }, { "epoch": 2.492305514952223, "grad_norm": 0.609375, "learning_rate": 1.762936513599958e-05, "loss": 0.3877424240112305, "num_input_tokens_seen": 20034196416, "step": 70440, "train_runtime": 684948.1704, "train_tokens_per_second": 29249.215 }, { "epoch": 2.492659335215952, "grad_norm": 0.609375, "learning_rate": 1.7628269416163852e-05, "loss": 0.3866433620452881, "num_input_tokens_seen": 20036979200, "step": 70450, "train_runtime": 685042.9028, "train_tokens_per_second": 29249.233 }, { "epoch": 2.4930131554796806, "grad_norm": 0.625, "learning_rate": 1.7627173900609905e-05, "loss": 0.38688628673553466, "num_input_tokens_seen": 20039828608, "step": 70460, "train_runtime": 685142.0571, "train_tokens_per_second": 29249.158 }, { "epoch": 2.4933669757434096, "grad_norm": 0.62109375, "learning_rate": 1.762607858927428e-05, "loss": 0.38215885162353513, "num_input_tokens_seen": 20042683840, "step": 70470, "train_runtime": 685238.9604, "train_tokens_per_second": 29249.189 }, { "epoch": 2.493720796007138, "grad_norm": 0.6171875, "learning_rate": 1.7624983482093533e-05, "loss": 0.3901267766952515, "num_input_tokens_seen": 20045562304, "step": 70480, "train_runtime": 685340.836, "train_tokens_per_second": 29249.041 }, { "epoch": 2.494074616270867, "grad_norm": 0.62890625, "learning_rate": 1.762388857900425e-05, "loss": 0.38214433193206787, "num_input_tokens_seen": 20048406016, "step": 70490, "train_runtime": 685437.9874, "train_tokens_per_second": 29249.044 }, { "epoch": 2.494428436534596, "grad_norm": 0.609375, "learning_rate": 1.762279387994305e-05, "loss": 0.3872185230255127, "num_input_tokens_seen": 20051217472, "step": 70500, "train_runtime": 685531.6317, "train_tokens_per_second": 29249.15 }, { "epoch": 2.4947822567983247, "grad_norm": 0.609375, "learning_rate": 1.7621699384846572e-05, "loss": 0.38647022247314455, "num_input_tokens_seen": 20054047872, "step": 70510, "train_runtime": 685626.8472, "train_tokens_per_second": 29249.216 }, { "epoch": 2.495136077062053, "grad_norm": 0.59375, "learning_rate": 1.7620605093651485e-05, "loss": 0.38982081413269043, "num_input_tokens_seen": 20056927616, "step": 70520, "train_runtime": 685728.5697, "train_tokens_per_second": 29249.077 }, { "epoch": 2.495489897325782, "grad_norm": 0.62109375, "learning_rate": 1.761951100629449e-05, "loss": 0.3834831714630127, "num_input_tokens_seen": 20059779904, "step": 70530, "train_runtime": 685826.1375, "train_tokens_per_second": 29249.075 }, { "epoch": 2.495843717589511, "grad_norm": 0.625, "learning_rate": 1.7618417122712306e-05, "loss": 0.3838294506072998, "num_input_tokens_seen": 20062643328, "step": 70540, "train_runtime": 685923.7298, "train_tokens_per_second": 29249.088 }, { "epoch": 2.4961975378532397, "grad_norm": 0.62109375, "learning_rate": 1.7617323442841694e-05, "loss": 0.3840170860290527, "num_input_tokens_seen": 20065479360, "step": 70550, "train_runtime": 686020.4895, "train_tokens_per_second": 29249.096 }, { "epoch": 2.4965513581169687, "grad_norm": 0.61328125, "learning_rate": 1.7616229966619426e-05, "loss": 0.3809061527252197, "num_input_tokens_seen": 20068353216, "step": 70560, "train_runtime": 686120.5821, "train_tokens_per_second": 29249.018 }, { "epoch": 2.4969051783806973, "grad_norm": 0.6015625, "learning_rate": 1.7615136693982312e-05, "loss": 0.39016356468200686, "num_input_tokens_seen": 20071205120, "step": 70570, "train_runtime": 686219.9509, "train_tokens_per_second": 29248.938 }, { "epoch": 2.4972589986444262, "grad_norm": 0.671875, "learning_rate": 1.761404362486719e-05, "loss": 0.3852728605270386, "num_input_tokens_seen": 20073973632, "step": 70580, "train_runtime": 686313.1148, "train_tokens_per_second": 29249.002 }, { "epoch": 2.497612818908155, "grad_norm": 0.6171875, "learning_rate": 1.761295075921092e-05, "loss": 0.3809437036514282, "num_input_tokens_seen": 20076802560, "step": 70590, "train_runtime": 686410.7386, "train_tokens_per_second": 29248.963 }, { "epoch": 2.4979666391718838, "grad_norm": 0.61328125, "learning_rate": 1.761185809695039e-05, "loss": 0.3876835823059082, "num_input_tokens_seen": 20079634944, "step": 70600, "train_runtime": 686512.6742, "train_tokens_per_second": 29248.746 }, { "epoch": 2.4983204594356123, "grad_norm": 0.62109375, "learning_rate": 1.7610765638022518e-05, "loss": 0.3828484535217285, "num_input_tokens_seen": 20082539520, "step": 70610, "train_runtime": 686614.2438, "train_tokens_per_second": 29248.65 }, { "epoch": 2.4986742796993413, "grad_norm": 0.6171875, "learning_rate": 1.760967338236425e-05, "loss": 0.38417739868164064, "num_input_tokens_seen": 20085392384, "step": 70620, "train_runtime": 686711.1073, "train_tokens_per_second": 29248.678 }, { "epoch": 2.49902809996307, "grad_norm": 0.6328125, "learning_rate": 1.7608581329912554e-05, "loss": 0.38393497467041016, "num_input_tokens_seen": 20088244544, "step": 70630, "train_runtime": 686807.9649, "train_tokens_per_second": 29248.706 }, { "epoch": 2.499381920226799, "grad_norm": 0.609375, "learning_rate": 1.7607489480604435e-05, "loss": 0.3870813846588135, "num_input_tokens_seen": 20091088832, "step": 70640, "train_runtime": 686905.8724, "train_tokens_per_second": 29248.678 }, { "epoch": 2.4997357404905274, "grad_norm": 0.62890625, "learning_rate": 1.760639783437692e-05, "loss": 0.3891451835632324, "num_input_tokens_seen": 20093947968, "step": 70650, "train_runtime": 687004.7149, "train_tokens_per_second": 29248.632 }, { "epoch": 2.5000895607542564, "grad_norm": 0.61328125, "learning_rate": 1.7605306391167054e-05, "loss": 0.39011578559875487, "num_input_tokens_seen": 20096796864, "step": 70660, "train_runtime": 687103.7261, "train_tokens_per_second": 29248.563 }, { "epoch": 2.500443381017985, "grad_norm": 0.6015625, "learning_rate": 1.7604215150911924e-05, "loss": 0.3902756690979004, "num_input_tokens_seen": 20099653888, "step": 70670, "train_runtime": 687203.6403, "train_tokens_per_second": 29248.468 }, { "epoch": 2.500797201281714, "grad_norm": 0.62109375, "learning_rate": 1.7603124113548636e-05, "loss": 0.38825139999389646, "num_input_tokens_seen": 20102535744, "step": 70680, "train_runtime": 687304.2315, "train_tokens_per_second": 29248.381 }, { "epoch": 2.501151021545443, "grad_norm": 0.625, "learning_rate": 1.7602033279014336e-05, "loss": 0.3888502597808838, "num_input_tokens_seen": 20105282176, "step": 70690, "train_runtime": 687396.3185, "train_tokens_per_second": 29248.458 }, { "epoch": 2.5015048418091714, "grad_norm": 0.6328125, "learning_rate": 1.7600942647246167e-05, "loss": 0.38906421661376955, "num_input_tokens_seen": 20108109184, "step": 70700, "train_runtime": 687493.6239, "train_tokens_per_second": 29248.43 }, { "epoch": 2.5018586620729, "grad_norm": 0.625, "learning_rate": 1.759985221818134e-05, "loss": 0.3870364189147949, "num_input_tokens_seen": 20110959168, "step": 70710, "train_runtime": 687588.247, "train_tokens_per_second": 29248.55 }, { "epoch": 2.502212482336629, "grad_norm": 0.62109375, "learning_rate": 1.7598761991757063e-05, "loss": 0.3857097148895264, "num_input_tokens_seen": 20113792832, "step": 70720, "train_runtime": 687682.6265, "train_tokens_per_second": 29248.656 }, { "epoch": 2.502566302600358, "grad_norm": 0.64453125, "learning_rate": 1.7597671967910576e-05, "loss": 0.3848094463348389, "num_input_tokens_seen": 20116706048, "step": 70730, "train_runtime": 687784.033, "train_tokens_per_second": 29248.58 }, { "epoch": 2.5029201228640865, "grad_norm": 0.59765625, "learning_rate": 1.7596582146579158e-05, "loss": 0.3874844551086426, "num_input_tokens_seen": 20119553664, "step": 70740, "train_runtime": 687882.4337, "train_tokens_per_second": 29248.535 }, { "epoch": 2.5032739431278155, "grad_norm": 0.6171875, "learning_rate": 1.7595492527700113e-05, "loss": 0.382014536857605, "num_input_tokens_seen": 20122383680, "step": 70750, "train_runtime": 687980.3416, "train_tokens_per_second": 29248.486 }, { "epoch": 2.503627763391544, "grad_norm": 0.63671875, "learning_rate": 1.7594403111210754e-05, "loss": 0.3867045879364014, "num_input_tokens_seen": 20125241664, "step": 70760, "train_runtime": 688077.0482, "train_tokens_per_second": 29248.529 }, { "epoch": 2.503981583655273, "grad_norm": 0.58984375, "learning_rate": 1.759331389704844e-05, "loss": 0.38740832805633546, "num_input_tokens_seen": 20128067520, "step": 70770, "train_runtime": 688172.1706, "train_tokens_per_second": 29248.593 }, { "epoch": 2.5043354039190016, "grad_norm": 0.64453125, "learning_rate": 1.7592224885150554e-05, "loss": 0.3863245964050293, "num_input_tokens_seen": 20130945472, "step": 70780, "train_runtime": 688269.1459, "train_tokens_per_second": 29248.653 }, { "epoch": 2.5046892241827305, "grad_norm": 0.61328125, "learning_rate": 1.7591136075454505e-05, "loss": 0.3898874282836914, "num_input_tokens_seen": 20133811840, "step": 70790, "train_runtime": 688367.4727, "train_tokens_per_second": 29248.639 }, { "epoch": 2.505043044446459, "grad_norm": 0.59765625, "learning_rate": 1.759004746789772e-05, "loss": 0.3844128608703613, "num_input_tokens_seen": 20136662016, "step": 70800, "train_runtime": 688464.5969, "train_tokens_per_second": 29248.653 }, { "epoch": 2.505396864710188, "grad_norm": 0.62890625, "learning_rate": 1.7588959062417677e-05, "loss": 0.3871614933013916, "num_input_tokens_seen": 20139489600, "step": 70810, "train_runtime": 688560.2503, "train_tokens_per_second": 29248.696 }, { "epoch": 2.5057506849739166, "grad_norm": 0.609375, "learning_rate": 1.7587870858951845e-05, "loss": 0.38546171188354494, "num_input_tokens_seen": 20142356672, "step": 70820, "train_runtime": 688657.9891, "train_tokens_per_second": 29248.708 }, { "epoch": 2.5061045052376456, "grad_norm": 0.61328125, "learning_rate": 1.7586782857437747e-05, "loss": 0.38804049491882325, "num_input_tokens_seen": 20145186560, "step": 70830, "train_runtime": 688755.1921, "train_tokens_per_second": 29248.689 }, { "epoch": 2.5064583255013746, "grad_norm": 0.59375, "learning_rate": 1.7585695057812936e-05, "loss": 0.38854146003723145, "num_input_tokens_seen": 20148037056, "step": 70840, "train_runtime": 688854.7817, "train_tokens_per_second": 29248.599 }, { "epoch": 2.506812145765103, "grad_norm": 0.625, "learning_rate": 1.7584607460014974e-05, "loss": 0.3861550807952881, "num_input_tokens_seen": 20150856640, "step": 70850, "train_runtime": 688952.2104, "train_tokens_per_second": 29248.555 }, { "epoch": 2.5071659660288317, "grad_norm": 0.59765625, "learning_rate": 1.7583520063981454e-05, "loss": 0.382442569732666, "num_input_tokens_seen": 20153722560, "step": 70860, "train_runtime": 689049.1265, "train_tokens_per_second": 29248.6 }, { "epoch": 2.5075197862925607, "grad_norm": 0.6171875, "learning_rate": 1.7582432869650005e-05, "loss": 0.38774971961975097, "num_input_tokens_seen": 20156559872, "step": 70870, "train_runtime": 689147.6676, "train_tokens_per_second": 29248.535 }, { "epoch": 2.5078736065562897, "grad_norm": 0.6015625, "learning_rate": 1.7581345876958283e-05, "loss": 0.38747391700744627, "num_input_tokens_seen": 20159407296, "step": 70880, "train_runtime": 689245.3035, "train_tokens_per_second": 29248.523 }, { "epoch": 2.508227426820018, "grad_norm": 0.625, "learning_rate": 1.758025908584396e-05, "loss": 0.3846898078918457, "num_input_tokens_seen": 20162231168, "step": 70890, "train_runtime": 689342.8341, "train_tokens_per_second": 29248.482 }, { "epoch": 2.508581247083747, "grad_norm": 0.60546875, "learning_rate": 1.7579172496244738e-05, "loss": 0.3857410907745361, "num_input_tokens_seen": 20165083776, "step": 70900, "train_runtime": 689438.1967, "train_tokens_per_second": 29248.574 }, { "epoch": 2.5089350673474757, "grad_norm": 0.59375, "learning_rate": 1.7578086108098357e-05, "loss": 0.3873237371444702, "num_input_tokens_seen": 20167938752, "step": 70910, "train_runtime": 689533.1872, "train_tokens_per_second": 29248.685 }, { "epoch": 2.5092888876112047, "grad_norm": 0.58203125, "learning_rate": 1.7576999921342574e-05, "loss": 0.3880675554275513, "num_input_tokens_seen": 20170824000, "step": 70920, "train_runtime": 689632.4546, "train_tokens_per_second": 29248.658 }, { "epoch": 2.5096427078749333, "grad_norm": 0.60546875, "learning_rate": 1.757591393591517e-05, "loss": 0.3835528135299683, "num_input_tokens_seen": 20173757184, "step": 70930, "train_runtime": 689736.366, "train_tokens_per_second": 29248.504 }, { "epoch": 2.5099965281386623, "grad_norm": 0.62109375, "learning_rate": 1.757482815175397e-05, "loss": 0.3894948959350586, "num_input_tokens_seen": 20176624384, "step": 70940, "train_runtime": 689836.9419, "train_tokens_per_second": 29248.396 }, { "epoch": 2.510350348402391, "grad_norm": 0.6640625, "learning_rate": 1.7573742568796796e-05, "loss": 0.3857612371444702, "num_input_tokens_seen": 20179397632, "step": 70950, "train_runtime": 689926.9181, "train_tokens_per_second": 29248.602 }, { "epoch": 2.51070416866612, "grad_norm": 0.61328125, "learning_rate": 1.7572657186981528e-05, "loss": 0.38314089775085447, "num_input_tokens_seen": 20182239744, "step": 70960, "train_runtime": 690022.9101, "train_tokens_per_second": 29248.652 }, { "epoch": 2.5110579889298483, "grad_norm": 0.640625, "learning_rate": 1.7571572006246058e-05, "loss": 0.3839996337890625, "num_input_tokens_seen": 20185052096, "step": 70970, "train_runtime": 690119.1853, "train_tokens_per_second": 29248.647 }, { "epoch": 2.5114118091935773, "grad_norm": 0.6171875, "learning_rate": 1.7570487026528298e-05, "loss": 0.38002169132232666, "num_input_tokens_seen": 20187876608, "step": 70980, "train_runtime": 690212.8905, "train_tokens_per_second": 29248.768 }, { "epoch": 2.5117656294573063, "grad_norm": 0.6171875, "learning_rate": 1.7569402247766204e-05, "loss": 0.38715014457702634, "num_input_tokens_seen": 20190655872, "step": 70990, "train_runtime": 690309.2956, "train_tokens_per_second": 29248.709 }, { "epoch": 2.512119449721035, "grad_norm": 0.62890625, "learning_rate": 1.756831766989775e-05, "loss": 0.3922735214233398, "num_input_tokens_seen": 20193493696, "step": 71000, "train_runtime": 690404.6582, "train_tokens_per_second": 29248.78 }, { "epoch": 2.5124732699847634, "grad_norm": 0.59765625, "learning_rate": 1.7567233292860927e-05, "loss": 0.3836193084716797, "num_input_tokens_seen": 20196396096, "step": 71010, "train_runtime": 690504.7227, "train_tokens_per_second": 29248.744 }, { "epoch": 2.5128270902484924, "grad_norm": 0.63671875, "learning_rate": 1.7566149116593772e-05, "loss": 0.38806490898132323, "num_input_tokens_seen": 20199170688, "step": 71020, "train_runtime": 690596.4621, "train_tokens_per_second": 29248.877 }, { "epoch": 2.5131809105122214, "grad_norm": 0.62109375, "learning_rate": 1.7565065141034336e-05, "loss": 0.3897226333618164, "num_input_tokens_seen": 20202050368, "step": 71030, "train_runtime": 690696.5447, "train_tokens_per_second": 29248.808 }, { "epoch": 2.51353473077595, "grad_norm": 0.62109375, "learning_rate": 1.7563981366120702e-05, "loss": 0.38810908794403076, "num_input_tokens_seen": 20204947520, "step": 71040, "train_runtime": 690800.6839, "train_tokens_per_second": 29248.592 }, { "epoch": 2.5138885510396785, "grad_norm": 0.6171875, "learning_rate": 1.7562897791790976e-05, "loss": 0.38892536163330077, "num_input_tokens_seen": 20207766720, "step": 71050, "train_runtime": 690896.1682, "train_tokens_per_second": 29248.63 }, { "epoch": 2.5142423713034074, "grad_norm": 0.625, "learning_rate": 1.7561814417983292e-05, "loss": 0.39044952392578125, "num_input_tokens_seen": 20210606912, "step": 71060, "train_runtime": 690991.5395, "train_tokens_per_second": 29248.704 }, { "epoch": 2.5145961915671364, "grad_norm": 0.61328125, "learning_rate": 1.756073124463581e-05, "loss": 0.38892350196838377, "num_input_tokens_seen": 20213471168, "step": 71070, "train_runtime": 691091.4736, "train_tokens_per_second": 29248.619 }, { "epoch": 2.514950011830865, "grad_norm": 0.60546875, "learning_rate": 1.7559648271686728e-05, "loss": 0.3855701684951782, "num_input_tokens_seen": 20216309632, "step": 71080, "train_runtime": 691186.9743, "train_tokens_per_second": 29248.684 }, { "epoch": 2.515303832094594, "grad_norm": 0.62890625, "learning_rate": 1.7558565499074244e-05, "loss": 0.38713946342468264, "num_input_tokens_seen": 20219150528, "step": 71090, "train_runtime": 691283.6061, "train_tokens_per_second": 29248.705 }, { "epoch": 2.5156576523583225, "grad_norm": 0.6171875, "learning_rate": 1.7557482926736613e-05, "loss": 0.3840949535369873, "num_input_tokens_seen": 20221969920, "step": 71100, "train_runtime": 691380.7785, "train_tokens_per_second": 29248.672 }, { "epoch": 2.5160114726220515, "grad_norm": 0.6171875, "learning_rate": 1.7556400554612095e-05, "loss": 0.389097785949707, "num_input_tokens_seen": 20224859456, "step": 71110, "train_runtime": 691479.4911, "train_tokens_per_second": 29248.676 }, { "epoch": 2.51636529288578, "grad_norm": 0.6171875, "learning_rate": 1.755531838263899e-05, "loss": 0.385307240486145, "num_input_tokens_seen": 20227731328, "step": 71120, "train_runtime": 691577.1014, "train_tokens_per_second": 29248.7 }, { "epoch": 2.516719113149509, "grad_norm": 0.63671875, "learning_rate": 1.7554236410755618e-05, "loss": 0.3875169515609741, "num_input_tokens_seen": 20230561728, "step": 71130, "train_runtime": 691672.6368, "train_tokens_per_second": 29248.752 }, { "epoch": 2.517072933413238, "grad_norm": 0.640625, "learning_rate": 1.7553154638900324e-05, "loss": 0.3899528980255127, "num_input_tokens_seen": 20233369024, "step": 71140, "train_runtime": 691767.9708, "train_tokens_per_second": 29248.78 }, { "epoch": 2.5174267536769666, "grad_norm": 0.6015625, "learning_rate": 1.755207306701148e-05, "loss": 0.3865573644638062, "num_input_tokens_seen": 20236241920, "step": 71150, "train_runtime": 691866.8622, "train_tokens_per_second": 29248.751 }, { "epoch": 2.517780573940695, "grad_norm": 0.6171875, "learning_rate": 1.7550991695027495e-05, "loss": 0.3876651763916016, "num_input_tokens_seen": 20239093888, "step": 71160, "train_runtime": 691962.571, "train_tokens_per_second": 29248.828 }, { "epoch": 2.518134394204424, "grad_norm": 0.6171875, "learning_rate": 1.754991052288679e-05, "loss": 0.38529953956604, "num_input_tokens_seen": 20241943488, "step": 71170, "train_runtime": 692058.406, "train_tokens_per_second": 29248.895 }, { "epoch": 2.518488214468153, "grad_norm": 0.6015625, "learning_rate": 1.7548829550527827e-05, "loss": 0.3858953475952148, "num_input_tokens_seen": 20244810752, "step": 71180, "train_runtime": 692155.112, "train_tokens_per_second": 29248.951 }, { "epoch": 2.5188420347318816, "grad_norm": 0.62890625, "learning_rate": 1.7547748777889075e-05, "loss": 0.3898101091384888, "num_input_tokens_seen": 20247703104, "step": 71190, "train_runtime": 692255.2837, "train_tokens_per_second": 29248.896 }, { "epoch": 2.51919585499561, "grad_norm": 0.6328125, "learning_rate": 1.7546668204909052e-05, "loss": 0.39031836986541746, "num_input_tokens_seen": 20250545472, "step": 71200, "train_runtime": 692353.2982, "train_tokens_per_second": 29248.861 }, { "epoch": 2.519549675259339, "grad_norm": 0.609375, "learning_rate": 1.7545587831526283e-05, "loss": 0.3870730400085449, "num_input_tokens_seen": 20253413440, "step": 71210, "train_runtime": 692452.4596, "train_tokens_per_second": 29248.814 }, { "epoch": 2.519903495523068, "grad_norm": 0.6015625, "learning_rate": 1.7544507657679332e-05, "loss": 0.38480219841003416, "num_input_tokens_seen": 20256302592, "step": 71220, "train_runtime": 692551.7593, "train_tokens_per_second": 29248.792 }, { "epoch": 2.5202573157867967, "grad_norm": 0.62890625, "learning_rate": 1.754342768330679e-05, "loss": 0.386008620262146, "num_input_tokens_seen": 20259174336, "step": 71230, "train_runtime": 692650.1319, "train_tokens_per_second": 29248.784 }, { "epoch": 2.5206111360505257, "grad_norm": 0.6171875, "learning_rate": 1.7542347908347262e-05, "loss": 0.38831191062927245, "num_input_tokens_seen": 20262036224, "step": 71240, "train_runtime": 692748.8535, "train_tokens_per_second": 29248.747 }, { "epoch": 2.520964956314254, "grad_norm": 0.59765625, "learning_rate": 1.7541268332739394e-05, "loss": 0.38004751205444337, "num_input_tokens_seen": 20264869056, "step": 71250, "train_runtime": 692847.7769, "train_tokens_per_second": 29248.66 }, { "epoch": 2.521318776577983, "grad_norm": 0.62890625, "learning_rate": 1.7540188956421847e-05, "loss": 0.3855795383453369, "num_input_tokens_seen": 20267714688, "step": 71260, "train_runtime": 692943.6113, "train_tokens_per_second": 29248.721 }, { "epoch": 2.5216725968417117, "grad_norm": 0.63671875, "learning_rate": 1.7539109779333315e-05, "loss": 0.3830139636993408, "num_input_tokens_seen": 20270540288, "step": 71270, "train_runtime": 693040.3268, "train_tokens_per_second": 29248.717 }, { "epoch": 2.5220264171054407, "grad_norm": 0.62109375, "learning_rate": 1.753803080141252e-05, "loss": 0.38417460918426516, "num_input_tokens_seen": 20273355968, "step": 71280, "train_runtime": 693133.9695, "train_tokens_per_second": 29248.828 }, { "epoch": 2.5223802373691693, "grad_norm": 0.62890625, "learning_rate": 1.7536952022598202e-05, "loss": 0.3841129779815674, "num_input_tokens_seen": 20276167552, "step": 71290, "train_runtime": 693230.5216, "train_tokens_per_second": 29248.81 }, { "epoch": 2.5227340576328983, "grad_norm": 0.66796875, "learning_rate": 1.7535873442829135e-05, "loss": 0.3805593490600586, "num_input_tokens_seen": 20278973056, "step": 71300, "train_runtime": 693324.9608, "train_tokens_per_second": 29248.872 }, { "epoch": 2.523087877896627, "grad_norm": 0.625, "learning_rate": 1.753479506204412e-05, "loss": 0.38619811534881593, "num_input_tokens_seen": 20281819072, "step": 71310, "train_runtime": 693420.402, "train_tokens_per_second": 29248.951 }, { "epoch": 2.523441698160356, "grad_norm": 0.64453125, "learning_rate": 1.7533716880181973e-05, "loss": 0.38463554382324217, "num_input_tokens_seen": 20284649920, "step": 71320, "train_runtime": 693515.5695, "train_tokens_per_second": 29249.019 }, { "epoch": 2.523795518424085, "grad_norm": 0.6171875, "learning_rate": 1.753263889718155e-05, "loss": 0.386564826965332, "num_input_tokens_seen": 20287518336, "step": 71330, "train_runtime": 693616.5028, "train_tokens_per_second": 29248.898 }, { "epoch": 2.5241493386878133, "grad_norm": 0.6015625, "learning_rate": 1.753156111298173e-05, "loss": 0.38729922771453856, "num_input_tokens_seen": 20290399488, "step": 71340, "train_runtime": 693714.2334, "train_tokens_per_second": 29248.931 }, { "epoch": 2.524503158951542, "grad_norm": 0.61328125, "learning_rate": 1.7530483527521414e-05, "loss": 0.38954720497131345, "num_input_tokens_seen": 20293213312, "step": 71350, "train_runtime": 693808.9855, "train_tokens_per_second": 29248.992 }, { "epoch": 2.524856979215271, "grad_norm": 0.62890625, "learning_rate": 1.752940614073953e-05, "loss": 0.3870147943496704, "num_input_tokens_seen": 20295999424, "step": 71360, "train_runtime": 693905.1482, "train_tokens_per_second": 29248.954 }, { "epoch": 2.525210799479, "grad_norm": 0.62890625, "learning_rate": 1.752832895257503e-05, "loss": 0.3876980781555176, "num_input_tokens_seen": 20298866944, "step": 71370, "train_runtime": 694003.7238, "train_tokens_per_second": 29248.931 }, { "epoch": 2.5255646197427284, "grad_norm": 0.61328125, "learning_rate": 1.752725196296691e-05, "loss": 0.38730497360229493, "num_input_tokens_seen": 20301717888, "step": 71380, "train_runtime": 694099.454, "train_tokens_per_second": 29249.004 }, { "epoch": 2.5259184400064574, "grad_norm": 0.6171875, "learning_rate": 1.7526175171854162e-05, "loss": 0.38428587913513185, "num_input_tokens_seen": 20304618112, "step": 71390, "train_runtime": 694199.4714, "train_tokens_per_second": 29248.968 }, { "epoch": 2.526272260270186, "grad_norm": 0.62109375, "learning_rate": 1.7525098579175827e-05, "loss": 0.3889008522033691, "num_input_tokens_seen": 20307481920, "step": 71400, "train_runtime": 694299.9816, "train_tokens_per_second": 29248.859 }, { "epoch": 2.526626080533915, "grad_norm": 0.59375, "learning_rate": 1.752402218487097e-05, "loss": 0.3824108600616455, "num_input_tokens_seen": 20310337024, "step": 71410, "train_runtime": 694396.3827, "train_tokens_per_second": 29248.91 }, { "epoch": 2.5269799007976435, "grad_norm": 0.625, "learning_rate": 1.752294598887867e-05, "loss": 0.38058953285217284, "num_input_tokens_seen": 20313203264, "step": 71420, "train_runtime": 694491.9797, "train_tokens_per_second": 29249.011 }, { "epoch": 2.5273337210613724, "grad_norm": 0.609375, "learning_rate": 1.7521869991138047e-05, "loss": 0.38137240409851075, "num_input_tokens_seen": 20316021696, "step": 71430, "train_runtime": 694587.9346, "train_tokens_per_second": 29249.028 }, { "epoch": 2.527687541325101, "grad_norm": 0.6171875, "learning_rate": 1.7520794191588235e-05, "loss": 0.38843822479248047, "num_input_tokens_seen": 20318850752, "step": 71440, "train_runtime": 694681.6505, "train_tokens_per_second": 29249.154 }, { "epoch": 2.52804136158883, "grad_norm": 0.59765625, "learning_rate": 1.75197185901684e-05, "loss": 0.3843752145767212, "num_input_tokens_seen": 20321689920, "step": 71450, "train_runtime": 694777.8408, "train_tokens_per_second": 29249.191 }, { "epoch": 2.5283951818525585, "grad_norm": 0.625, "learning_rate": 1.7518643186817734e-05, "loss": 0.3882627487182617, "num_input_tokens_seen": 20324493056, "step": 71460, "train_runtime": 694872.5298, "train_tokens_per_second": 29249.24 }, { "epoch": 2.5287490021162875, "grad_norm": 0.640625, "learning_rate": 1.751756798147546e-05, "loss": 0.38930478096008303, "num_input_tokens_seen": 20327357952, "step": 71470, "train_runtime": 694970.2748, "train_tokens_per_second": 29249.248 }, { "epoch": 2.5291028223800165, "grad_norm": 0.609375, "learning_rate": 1.7516492974080814e-05, "loss": 0.38165066242218015, "num_input_tokens_seen": 20330247104, "step": 71480, "train_runtime": 695070.0549, "train_tokens_per_second": 29249.206 }, { "epoch": 2.529456642643745, "grad_norm": 0.640625, "learning_rate": 1.7515418164573068e-05, "loss": 0.383614706993103, "num_input_tokens_seen": 20333112576, "step": 71490, "train_runtime": 695168.0907, "train_tokens_per_second": 29249.203 }, { "epoch": 2.5298104629074736, "grad_norm": 0.6484375, "learning_rate": 1.751434355289152e-05, "loss": 0.38726081848144533, "num_input_tokens_seen": 20335925760, "step": 71500, "train_runtime": 695260.9833, "train_tokens_per_second": 29249.341 }, { "epoch": 2.5301642831712026, "grad_norm": 0.640625, "learning_rate": 1.751326913897549e-05, "loss": 0.3896699190139771, "num_input_tokens_seen": 20338758848, "step": 71510, "train_runtime": 695357.861, "train_tokens_per_second": 29249.341 }, { "epoch": 2.5305181034349316, "grad_norm": 0.61328125, "learning_rate": 1.751219492276433e-05, "loss": 0.3855555534362793, "num_input_tokens_seen": 20341625664, "step": 71520, "train_runtime": 695454.958, "train_tokens_per_second": 29249.379 }, { "epoch": 2.53087192369866, "grad_norm": 0.65234375, "learning_rate": 1.7511120904197406e-05, "loss": 0.38286623954772947, "num_input_tokens_seen": 20344459520, "step": 71530, "train_runtime": 695551.6955, "train_tokens_per_second": 29249.385 }, { "epoch": 2.5312257439623886, "grad_norm": 0.609375, "learning_rate": 1.7510047083214125e-05, "loss": 0.39187235832214357, "num_input_tokens_seen": 20347315264, "step": 71540, "train_runtime": 695647.1014, "train_tokens_per_second": 29249.479 }, { "epoch": 2.5315795642261176, "grad_norm": 0.58984375, "learning_rate": 1.750897345975391e-05, "loss": 0.382798433303833, "num_input_tokens_seen": 20350156416, "step": 71550, "train_runtime": 695744.8487, "train_tokens_per_second": 29249.453 }, { "epoch": 2.5319333844898466, "grad_norm": 0.6171875, "learning_rate": 1.7507900033756213e-05, "loss": 0.3854855537414551, "num_input_tokens_seen": 20352940096, "step": 71560, "train_runtime": 695838.2717, "train_tokens_per_second": 29249.527 }, { "epoch": 2.532287204753575, "grad_norm": 0.62109375, "learning_rate": 1.750682680516052e-05, "loss": 0.3845286130905151, "num_input_tokens_seen": 20355880000, "step": 71570, "train_runtime": 695940.4388, "train_tokens_per_second": 29249.457 }, { "epoch": 2.532641025017304, "grad_norm": 0.6171875, "learning_rate": 1.7505753773906322e-05, "loss": 0.38743271827697756, "num_input_tokens_seen": 20358729344, "step": 71580, "train_runtime": 696040.6809, "train_tokens_per_second": 29249.338 }, { "epoch": 2.5329948452810327, "grad_norm": 0.6015625, "learning_rate": 1.7504680939933153e-05, "loss": 0.38537399768829345, "num_input_tokens_seen": 20361543488, "step": 71590, "train_runtime": 696135.6167, "train_tokens_per_second": 29249.392 }, { "epoch": 2.5333486655447617, "grad_norm": 0.625, "learning_rate": 1.7503608303180574e-05, "loss": 0.3836169481277466, "num_input_tokens_seen": 20364404352, "step": 71600, "train_runtime": 696234.9218, "train_tokens_per_second": 29249.329 }, { "epoch": 2.5337024858084902, "grad_norm": 0.640625, "learning_rate": 1.7502535863588165e-05, "loss": 0.38952980041503904, "num_input_tokens_seen": 20367230016, "step": 71610, "train_runtime": 696330.4075, "train_tokens_per_second": 29249.376 }, { "epoch": 2.534056306072219, "grad_norm": 0.6015625, "learning_rate": 1.7501463621095532e-05, "loss": 0.38968582153320314, "num_input_tokens_seen": 20370069696, "step": 71620, "train_runtime": 696430.742, "train_tokens_per_second": 29249.24 }, { "epoch": 2.5344101263359478, "grad_norm": 0.62890625, "learning_rate": 1.7500391575642305e-05, "loss": 0.38724427223205565, "num_input_tokens_seen": 20372935360, "step": 71630, "train_runtime": 696528.7902, "train_tokens_per_second": 29249.237 }, { "epoch": 2.5347639465996767, "grad_norm": 0.6171875, "learning_rate": 1.7499319727168155e-05, "loss": 0.38423311710357666, "num_input_tokens_seen": 20375760320, "step": 71640, "train_runtime": 696626.9106, "train_tokens_per_second": 29249.172 }, { "epoch": 2.5351177668634053, "grad_norm": 0.59375, "learning_rate": 1.7498248075612753e-05, "loss": 0.3837351083755493, "num_input_tokens_seen": 20378570176, "step": 71650, "train_runtime": 696721.4654, "train_tokens_per_second": 29249.235 }, { "epoch": 2.5354715871271343, "grad_norm": 0.609375, "learning_rate": 1.749717662091582e-05, "loss": 0.38747596740722656, "num_input_tokens_seen": 20381461056, "step": 71660, "train_runtime": 696818.4778, "train_tokens_per_second": 29249.312 }, { "epoch": 2.5358254073908633, "grad_norm": 0.609375, "learning_rate": 1.749610536301709e-05, "loss": 0.3857890129089355, "num_input_tokens_seen": 20384278976, "step": 71670, "train_runtime": 696914.4905, "train_tokens_per_second": 29249.326 }, { "epoch": 2.536179227654592, "grad_norm": 0.6484375, "learning_rate": 1.749503430185633e-05, "loss": 0.38343987464904783, "num_input_tokens_seen": 20387070080, "step": 71680, "train_runtime": 697010.9799, "train_tokens_per_second": 29249.281 }, { "epoch": 2.5365330479183203, "grad_norm": 0.6015625, "learning_rate": 1.749396343737332e-05, "loss": 0.38547072410583494, "num_input_tokens_seen": 20389926656, "step": 71690, "train_runtime": 697110.6057, "train_tokens_per_second": 29249.199 }, { "epoch": 2.5368868681820493, "grad_norm": 0.640625, "learning_rate": 1.7492892769507885e-05, "loss": 0.3897873401641846, "num_input_tokens_seen": 20392709184, "step": 71700, "train_runtime": 697204.406, "train_tokens_per_second": 29249.255 }, { "epoch": 2.5372406884457783, "grad_norm": 0.59375, "learning_rate": 1.7491822298199854e-05, "loss": 0.3842735767364502, "num_input_tokens_seen": 20395600960, "step": 71710, "train_runtime": 697305.3707, "train_tokens_per_second": 29249.167 }, { "epoch": 2.537594508709507, "grad_norm": 0.6171875, "learning_rate": 1.74907520233891e-05, "loss": 0.38124186992645265, "num_input_tokens_seen": 20398470400, "step": 71720, "train_runtime": 697404.6002, "train_tokens_per_second": 29249.119 }, { "epoch": 2.537948328973236, "grad_norm": 0.62109375, "learning_rate": 1.7489681945015517e-05, "loss": 0.38555612564086916, "num_input_tokens_seen": 20401296832, "step": 71730, "train_runtime": 697499.6705, "train_tokens_per_second": 29249.185 }, { "epoch": 2.5383021492369644, "grad_norm": 0.65234375, "learning_rate": 1.7488612063019018e-05, "loss": 0.3859811067581177, "num_input_tokens_seen": 20404107264, "step": 71740, "train_runtime": 697593.8178, "train_tokens_per_second": 29249.266 }, { "epoch": 2.5386559695006934, "grad_norm": 0.6328125, "learning_rate": 1.7487542377339547e-05, "loss": 0.3880645751953125, "num_input_tokens_seen": 20406953792, "step": 71750, "train_runtime": 697689.9534, "train_tokens_per_second": 29249.316 }, { "epoch": 2.539009789764422, "grad_norm": 0.609375, "learning_rate": 1.7486472887917072e-05, "loss": 0.3881432771682739, "num_input_tokens_seen": 20409816768, "step": 71760, "train_runtime": 697787.7304, "train_tokens_per_second": 29249.32 }, { "epoch": 2.539363610028151, "grad_norm": 0.625, "learning_rate": 1.7485403594691592e-05, "loss": 0.3873645305633545, "num_input_tokens_seen": 20412693888, "step": 71770, "train_runtime": 697887.4533, "train_tokens_per_second": 29249.263 }, { "epoch": 2.5397174302918795, "grad_norm": 0.65234375, "learning_rate": 1.7484334497603126e-05, "loss": 0.38535351753234864, "num_input_tokens_seen": 20415487872, "step": 71780, "train_runtime": 697982.8577, "train_tokens_per_second": 29249.268 }, { "epoch": 2.5400712505556085, "grad_norm": 0.609375, "learning_rate": 1.7483265596591712e-05, "loss": 0.38485443592071533, "num_input_tokens_seen": 20418321472, "step": 71790, "train_runtime": 698079.1639, "train_tokens_per_second": 29249.292 }, { "epoch": 2.540425070819337, "grad_norm": 0.640625, "learning_rate": 1.7482196891597433e-05, "loss": 0.38553314208984374, "num_input_tokens_seen": 20421154816, "step": 71800, "train_runtime": 698175.0823, "train_tokens_per_second": 29249.332 }, { "epoch": 2.540778891083066, "grad_norm": 0.61328125, "learning_rate": 1.7481128382560382e-05, "loss": 0.3869482517242432, "num_input_tokens_seen": 20423964608, "step": 71810, "train_runtime": 698272.9826, "train_tokens_per_second": 29249.255 }, { "epoch": 2.541132711346795, "grad_norm": 0.58984375, "learning_rate": 1.748006006942068e-05, "loss": 0.3878339290618896, "num_input_tokens_seen": 20426861632, "step": 71820, "train_runtime": 698371.8545, "train_tokens_per_second": 29249.262 }, { "epoch": 2.5414865316105235, "grad_norm": 0.6328125, "learning_rate": 1.7478991952118476e-05, "loss": 0.3841610670089722, "num_input_tokens_seen": 20429681792, "step": 71830, "train_runtime": 698467.528, "train_tokens_per_second": 29249.294 }, { "epoch": 2.541840351874252, "grad_norm": 0.6484375, "learning_rate": 1.747792403059395e-05, "loss": 0.38683784008026123, "num_input_tokens_seen": 20432497280, "step": 71840, "train_runtime": 698561.9039, "train_tokens_per_second": 29249.372 }, { "epoch": 2.542194172137981, "grad_norm": 0.6328125, "learning_rate": 1.747685630478729e-05, "loss": 0.3898813486099243, "num_input_tokens_seen": 20435354624, "step": 71850, "train_runtime": 698658.9605, "train_tokens_per_second": 29249.399 }, { "epoch": 2.54254799240171, "grad_norm": 0.61328125, "learning_rate": 1.7475788774638732e-05, "loss": 0.38735437393188477, "num_input_tokens_seen": 20438161600, "step": 71860, "train_runtime": 698752.2788, "train_tokens_per_second": 29249.51 }, { "epoch": 2.5429018126654386, "grad_norm": 0.60546875, "learning_rate": 1.7474721440088522e-05, "loss": 0.38495023250579835, "num_input_tokens_seen": 20441053888, "step": 71870, "train_runtime": 698851.4249, "train_tokens_per_second": 29249.499 }, { "epoch": 2.543255632929167, "grad_norm": 0.63671875, "learning_rate": 1.747365430107694e-05, "loss": 0.388193941116333, "num_input_tokens_seen": 20443936192, "step": 71880, "train_runtime": 698949.8783, "train_tokens_per_second": 29249.502 }, { "epoch": 2.543609453192896, "grad_norm": 0.609375, "learning_rate": 1.7472587357544283e-05, "loss": 0.38282017707824706, "num_input_tokens_seen": 20446803712, "step": 71890, "train_runtime": 699045.8926, "train_tokens_per_second": 29249.587 }, { "epoch": 2.543963273456625, "grad_norm": 0.640625, "learning_rate": 1.7471520609430883e-05, "loss": 0.388105583190918, "num_input_tokens_seen": 20449636224, "step": 71900, "train_runtime": 699141.3227, "train_tokens_per_second": 29249.646 }, { "epoch": 2.5443170937203536, "grad_norm": 0.60546875, "learning_rate": 1.747045405667709e-05, "loss": 0.38689699172973635, "num_input_tokens_seen": 20452428224, "step": 71910, "train_runtime": 699234.5971, "train_tokens_per_second": 29249.737 }, { "epoch": 2.5446709139840826, "grad_norm": 0.62109375, "learning_rate": 1.7469387699223282e-05, "loss": 0.3821892261505127, "num_input_tokens_seen": 20455261440, "step": 71920, "train_runtime": 699329.6725, "train_tokens_per_second": 29249.812 }, { "epoch": 2.545024734247811, "grad_norm": 0.6328125, "learning_rate": 1.7468321537009867e-05, "loss": 0.3824774265289307, "num_input_tokens_seen": 20458134784, "step": 71930, "train_runtime": 699429.13, "train_tokens_per_second": 29249.761 }, { "epoch": 2.54537855451154, "grad_norm": 0.625, "learning_rate": 1.746725556997727e-05, "loss": 0.38945980072021485, "num_input_tokens_seen": 20460955776, "step": 71940, "train_runtime": 699527.1202, "train_tokens_per_second": 29249.696 }, { "epoch": 2.5457323747752687, "grad_norm": 0.60546875, "learning_rate": 1.7466189798065948e-05, "loss": 0.38823580741882324, "num_input_tokens_seen": 20463774080, "step": 71950, "train_runtime": 699623.8114, "train_tokens_per_second": 29249.682 }, { "epoch": 2.5460861950389977, "grad_norm": 0.671875, "learning_rate": 1.7465124221216382e-05, "loss": 0.3891043186187744, "num_input_tokens_seen": 20466610112, "step": 71960, "train_runtime": 699718.5001, "train_tokens_per_second": 29249.777 }, { "epoch": 2.5464400153027267, "grad_norm": 0.61328125, "learning_rate": 1.7464058839369074e-05, "loss": 0.3851813554763794, "num_input_tokens_seen": 20469394560, "step": 71970, "train_runtime": 699812.7036, "train_tokens_per_second": 29249.818 }, { "epoch": 2.546793835566455, "grad_norm": 0.609375, "learning_rate": 1.7462993652464556e-05, "loss": 0.3852069616317749, "num_input_tokens_seen": 20472254144, "step": 71980, "train_runtime": 699910.6959, "train_tokens_per_second": 29249.809 }, { "epoch": 2.5471476558301838, "grad_norm": 0.59765625, "learning_rate": 1.746192866044339e-05, "loss": 0.3870324373245239, "num_input_tokens_seen": 20475150016, "step": 71990, "train_runtime": 700011.282, "train_tokens_per_second": 29249.743 }, { "epoch": 2.5475014760939128, "grad_norm": 0.578125, "learning_rate": 1.746086386324615e-05, "loss": 0.3841458797454834, "num_input_tokens_seen": 20477997248, "step": 72000, "train_runtime": 700108.2143, "train_tokens_per_second": 29249.76 }, { "epoch": 2.5478552963576417, "grad_norm": 0.6171875, "learning_rate": 1.7459799260813448e-05, "loss": 0.38673877716064453, "num_input_tokens_seen": 20480808576, "step": 72010, "train_runtime": 700203.8994, "train_tokens_per_second": 29249.778 }, { "epoch": 2.5482091166213703, "grad_norm": 0.65234375, "learning_rate": 1.7458734853085918e-05, "loss": 0.3884261608123779, "num_input_tokens_seen": 20483689472, "step": 72020, "train_runtime": 700303.4733, "train_tokens_per_second": 29249.733 }, { "epoch": 2.548562936885099, "grad_norm": 0.62890625, "learning_rate": 1.7457670640004212e-05, "loss": 0.38671445846557617, "num_input_tokens_seen": 20486498944, "step": 72030, "train_runtime": 700397.1172, "train_tokens_per_second": 29249.833 }, { "epoch": 2.548916757148828, "grad_norm": 0.63671875, "learning_rate": 1.7456606621509013e-05, "loss": 0.38740196228027346, "num_input_tokens_seen": 20489338176, "step": 72040, "train_runtime": 700495.338, "train_tokens_per_second": 29249.785 }, { "epoch": 2.549270577412557, "grad_norm": 0.64453125, "learning_rate": 1.745554279754104e-05, "loss": 0.3833166599273682, "num_input_tokens_seen": 20492240576, "step": 72050, "train_runtime": 700596.783, "train_tokens_per_second": 29249.693 }, { "epoch": 2.5496243976762853, "grad_norm": 0.6328125, "learning_rate": 1.7454479168041013e-05, "loss": 0.38718838691711427, "num_input_tokens_seen": 20495117568, "step": 72060, "train_runtime": 700696.7751, "train_tokens_per_second": 29249.625 }, { "epoch": 2.5499782179400143, "grad_norm": 0.6015625, "learning_rate": 1.74534157329497e-05, "loss": 0.38707432746887205, "num_input_tokens_seen": 20497946432, "step": 72070, "train_runtime": 700791.8608, "train_tokens_per_second": 29249.692 }, { "epoch": 2.550332038203743, "grad_norm": 0.60546875, "learning_rate": 1.7452352492207886e-05, "loss": 0.3846604347229004, "num_input_tokens_seen": 20500781440, "step": 72080, "train_runtime": 700886.5944, "train_tokens_per_second": 29249.784 }, { "epoch": 2.550685858467472, "grad_norm": 0.625, "learning_rate": 1.7451289445756374e-05, "loss": 0.3814728260040283, "num_input_tokens_seen": 20503619904, "step": 72090, "train_runtime": 700984.4335, "train_tokens_per_second": 29249.751 }, { "epoch": 2.5510396787312004, "grad_norm": 0.61328125, "learning_rate": 1.7450226593536005e-05, "loss": 0.3872837543487549, "num_input_tokens_seen": 20506504192, "step": 72100, "train_runtime": 701082.679, "train_tokens_per_second": 29249.766 }, { "epoch": 2.5513934989949294, "grad_norm": 0.61328125, "learning_rate": 1.744916393548763e-05, "loss": 0.384901762008667, "num_input_tokens_seen": 20509361536, "step": 72110, "train_runtime": 701182.4991, "train_tokens_per_second": 29249.677 }, { "epoch": 2.551747319258658, "grad_norm": 0.6328125, "learning_rate": 1.744810147155215e-05, "loss": 0.3845955848693848, "num_input_tokens_seen": 20512159936, "step": 72120, "train_runtime": 701280.902, "train_tokens_per_second": 29249.563 }, { "epoch": 2.552101139522387, "grad_norm": 0.59765625, "learning_rate": 1.7447039201670458e-05, "loss": 0.38531951904296874, "num_input_tokens_seen": 20515013056, "step": 72130, "train_runtime": 701378.3319, "train_tokens_per_second": 29249.568 }, { "epoch": 2.5524549597861155, "grad_norm": 0.625, "learning_rate": 1.7445977125783497e-05, "loss": 0.387006950378418, "num_input_tokens_seen": 20517825984, "step": 72140, "train_runtime": 701476.1195, "train_tokens_per_second": 29249.5 }, { "epoch": 2.5528087800498445, "grad_norm": 0.6015625, "learning_rate": 1.7444915243832234e-05, "loss": 0.3883934497833252, "num_input_tokens_seen": 20520697984, "step": 72150, "train_runtime": 701576.9798, "train_tokens_per_second": 29249.389 }, { "epoch": 2.5531626003135734, "grad_norm": 0.63671875, "learning_rate": 1.7443853555757645e-05, "loss": 0.3865645408630371, "num_input_tokens_seen": 20523585344, "step": 72160, "train_runtime": 701675.1793, "train_tokens_per_second": 29249.41 }, { "epoch": 2.553516420577302, "grad_norm": 0.640625, "learning_rate": 1.744279206150074e-05, "loss": 0.3867837905883789, "num_input_tokens_seen": 20526424384, "step": 72170, "train_runtime": 701772.4606, "train_tokens_per_second": 29249.401 }, { "epoch": 2.5538702408410305, "grad_norm": 0.6171875, "learning_rate": 1.7441730761002567e-05, "loss": 0.39119277000427244, "num_input_tokens_seen": 20529302208, "step": 72180, "train_runtime": 701872.238, "train_tokens_per_second": 29249.344 }, { "epoch": 2.5542240611047595, "grad_norm": 0.63671875, "learning_rate": 1.7440669654204185e-05, "loss": 0.3830560207366943, "num_input_tokens_seen": 20532160512, "step": 72190, "train_runtime": 701970.7846, "train_tokens_per_second": 29249.309 }, { "epoch": 2.5545778813684885, "grad_norm": 0.640625, "learning_rate": 1.7439608741046666e-05, "loss": 0.3865551471710205, "num_input_tokens_seen": 20535015680, "step": 72200, "train_runtime": 702069.4557, "train_tokens_per_second": 29249.265 }, { "epoch": 2.554931701632217, "grad_norm": 0.6171875, "learning_rate": 1.7438548021471134e-05, "loss": 0.3892939805984497, "num_input_tokens_seen": 20537910336, "step": 72210, "train_runtime": 702171.1597, "train_tokens_per_second": 29249.151 }, { "epoch": 2.555285521895946, "grad_norm": 0.6171875, "learning_rate": 1.7437487495418724e-05, "loss": 0.38391158580780027, "num_input_tokens_seen": 20540782016, "step": 72220, "train_runtime": 702268.7552, "train_tokens_per_second": 29249.175 }, { "epoch": 2.5556393421596746, "grad_norm": 0.6640625, "learning_rate": 1.7436427162830597e-05, "loss": 0.38832964897155764, "num_input_tokens_seen": 20543592128, "step": 72230, "train_runtime": 702365.4667, "train_tokens_per_second": 29249.149 }, { "epoch": 2.5559931624234036, "grad_norm": 0.63671875, "learning_rate": 1.743536702364794e-05, "loss": 0.3866887092590332, "num_input_tokens_seen": 20546470208, "step": 72240, "train_runtime": 702464.5948, "train_tokens_per_second": 29249.119 }, { "epoch": 2.556346982687132, "grad_norm": 0.59765625, "learning_rate": 1.743430707781196e-05, "loss": 0.39111597537994386, "num_input_tokens_seen": 20549301952, "step": 72250, "train_runtime": 702563.8962, "train_tokens_per_second": 29249.015 }, { "epoch": 2.556700802950861, "grad_norm": 0.6328125, "learning_rate": 1.74332473252639e-05, "loss": 0.38591115474700927, "num_input_tokens_seen": 20552154176, "step": 72260, "train_runtime": 702661.3964, "train_tokens_per_second": 29249.016 }, { "epoch": 2.5570546232145897, "grad_norm": 0.60546875, "learning_rate": 1.7432187765945016e-05, "loss": 0.38828890323638915, "num_input_tokens_seen": 20554992704, "step": 72270, "train_runtime": 702760.2105, "train_tokens_per_second": 29248.942 }, { "epoch": 2.5574084434783186, "grad_norm": 0.62109375, "learning_rate": 1.74311283997966e-05, "loss": 0.3892641305923462, "num_input_tokens_seen": 20557903744, "step": 72280, "train_runtime": 702860.0418, "train_tokens_per_second": 29248.929 }, { "epoch": 2.557762263742047, "grad_norm": 0.62109375, "learning_rate": 1.7430069226759962e-05, "loss": 0.38228960037231446, "num_input_tokens_seen": 20560747520, "step": 72290, "train_runtime": 702955.0139, "train_tokens_per_second": 29249.023 }, { "epoch": 2.558116084005776, "grad_norm": 0.58984375, "learning_rate": 1.7429010246776435e-05, "loss": 0.38678109645843506, "num_input_tokens_seen": 20563542208, "step": 72300, "train_runtime": 703047.809, "train_tokens_per_second": 29249.138 }, { "epoch": 2.558469904269505, "grad_norm": 0.62890625, "learning_rate": 1.7427951459787386e-05, "loss": 0.3943061828613281, "num_input_tokens_seen": 20566405568, "step": 72310, "train_runtime": 703146.2275, "train_tokens_per_second": 29249.116 }, { "epoch": 2.5588237245332337, "grad_norm": 0.63671875, "learning_rate": 1.7426892865734197e-05, "loss": 0.38891263008117677, "num_input_tokens_seen": 20569259520, "step": 72320, "train_runtime": 703245.4019, "train_tokens_per_second": 29249.049 }, { "epoch": 2.5591775447969622, "grad_norm": 0.609375, "learning_rate": 1.742583446455828e-05, "loss": 0.3832040309906006, "num_input_tokens_seen": 20572132544, "step": 72330, "train_runtime": 703340.1749, "train_tokens_per_second": 29249.193 }, { "epoch": 2.5595313650606912, "grad_norm": 0.63671875, "learning_rate": 1.7424776256201074e-05, "loss": 0.39090604782104493, "num_input_tokens_seen": 20574947520, "step": 72340, "train_runtime": 703435.2092, "train_tokens_per_second": 29249.243 }, { "epoch": 2.55988518532442, "grad_norm": 0.640625, "learning_rate": 1.7423718240604035e-05, "loss": 0.38827416896820066, "num_input_tokens_seen": 20577857664, "step": 72350, "train_runtime": 703537.5926, "train_tokens_per_second": 29249.123 }, { "epoch": 2.5602390055881488, "grad_norm": 0.625, "learning_rate": 1.7422660417708656e-05, "loss": 0.38462128639221194, "num_input_tokens_seen": 20580678912, "step": 72360, "train_runtime": 703634.5961, "train_tokens_per_second": 29249.1 }, { "epoch": 2.5605928258518773, "grad_norm": 0.609375, "learning_rate": 1.7421602787456446e-05, "loss": 0.3870999336242676, "num_input_tokens_seen": 20583452032, "step": 72370, "train_runtime": 703726.5436, "train_tokens_per_second": 29249.219 }, { "epoch": 2.5609466461156063, "grad_norm": 0.62109375, "learning_rate": 1.7420545349788937e-05, "loss": 0.3895162582397461, "num_input_tokens_seen": 20586235200, "step": 72380, "train_runtime": 703821.1367, "train_tokens_per_second": 29249.243 }, { "epoch": 2.5613004663793353, "grad_norm": 0.609375, "learning_rate": 1.7419488104647694e-05, "loss": 0.38846116065979003, "num_input_tokens_seen": 20589092928, "step": 72390, "train_runtime": 703921.3168, "train_tokens_per_second": 29249.14 }, { "epoch": 2.561654286643064, "grad_norm": 0.6484375, "learning_rate": 1.7418431051974298e-05, "loss": 0.38369078636169435, "num_input_tokens_seen": 20591972160, "step": 72400, "train_runtime": 704018.3517, "train_tokens_per_second": 29249.198 }, { "epoch": 2.562008106906793, "grad_norm": 0.62109375, "learning_rate": 1.7417374191710362e-05, "loss": 0.3863586187362671, "num_input_tokens_seen": 20594829568, "step": 72410, "train_runtime": 704115.8396, "train_tokens_per_second": 29249.206 }, { "epoch": 2.5623619271705214, "grad_norm": 0.59375, "learning_rate": 1.7416317523797522e-05, "loss": 0.38245353698730467, "num_input_tokens_seen": 20597679360, "step": 72420, "train_runtime": 704210.167, "train_tokens_per_second": 29249.335 }, { "epoch": 2.5627157474342503, "grad_norm": 0.6171875, "learning_rate": 1.7415261048177434e-05, "loss": 0.38879098892211916, "num_input_tokens_seen": 20600511872, "step": 72430, "train_runtime": 704306.3703, "train_tokens_per_second": 29249.362 }, { "epoch": 2.563069567697979, "grad_norm": 0.65625, "learning_rate": 1.7414204764791785e-05, "loss": 0.3847618103027344, "num_input_tokens_seen": 20603403456, "step": 72440, "train_runtime": 704405.4807, "train_tokens_per_second": 29249.351 }, { "epoch": 2.563423387961708, "grad_norm": 0.59375, "learning_rate": 1.741314867358229e-05, "loss": 0.38361034393310545, "num_input_tokens_seen": 20606216256, "step": 72450, "train_runtime": 704499.9682, "train_tokens_per_second": 29249.421 }, { "epoch": 2.5637772082254364, "grad_norm": 0.58984375, "learning_rate": 1.7412092774490668e-05, "loss": 0.3859847068786621, "num_input_tokens_seen": 20609104064, "step": 72460, "train_runtime": 704601.5791, "train_tokens_per_second": 29249.302 }, { "epoch": 2.5641310284891654, "grad_norm": 0.60546875, "learning_rate": 1.741103706745869e-05, "loss": 0.386204195022583, "num_input_tokens_seen": 20611943552, "step": 72470, "train_runtime": 704702.6505, "train_tokens_per_second": 29249.136 }, { "epoch": 2.564484848752894, "grad_norm": 0.6484375, "learning_rate": 1.740998155242814e-05, "loss": 0.38925986289978026, "num_input_tokens_seen": 20614718400, "step": 72480, "train_runtime": 704796.515, "train_tokens_per_second": 29249.178 }, { "epoch": 2.564838669016623, "grad_norm": 0.6015625, "learning_rate": 1.740892622934082e-05, "loss": 0.3884198904037476, "num_input_tokens_seen": 20617540800, "step": 72490, "train_runtime": 704891.1115, "train_tokens_per_second": 29249.256 }, { "epoch": 2.565192489280352, "grad_norm": 0.59765625, "learning_rate": 1.740787109813857e-05, "loss": 0.387147855758667, "num_input_tokens_seen": 20620348352, "step": 72500, "train_runtime": 704985.8545, "train_tokens_per_second": 29249.308 }, { "epoch": 2.5655463095440805, "grad_norm": 0.6484375, "learning_rate": 1.7406816158763242e-05, "loss": 0.3906718254089355, "num_input_tokens_seen": 20623187264, "step": 72510, "train_runtime": 705082.8747, "train_tokens_per_second": 29249.31 }, { "epoch": 2.565900129807809, "grad_norm": 0.61328125, "learning_rate": 1.7405761411156717e-05, "loss": 0.3823741674423218, "num_input_tokens_seen": 20626035456, "step": 72520, "train_runtime": 705179.3947, "train_tokens_per_second": 29249.345 }, { "epoch": 2.566253950071538, "grad_norm": 0.63671875, "learning_rate": 1.7404706855260906e-05, "loss": 0.3907054662704468, "num_input_tokens_seen": 20628858880, "step": 72530, "train_runtime": 705276.0853, "train_tokens_per_second": 29249.338 }, { "epoch": 2.566607770335267, "grad_norm": 0.62109375, "learning_rate": 1.7403652491017738e-05, "loss": 0.38681812286376954, "num_input_tokens_seen": 20631688512, "step": 72540, "train_runtime": 705372.1867, "train_tokens_per_second": 29249.365 }, { "epoch": 2.5669615905989955, "grad_norm": 0.6015625, "learning_rate": 1.7402598318369174e-05, "loss": 0.3863770246505737, "num_input_tokens_seen": 20634507200, "step": 72550, "train_runtime": 705465.7844, "train_tokens_per_second": 29249.48 }, { "epoch": 2.5673154108627245, "grad_norm": 0.58984375, "learning_rate": 1.7401544337257186e-05, "loss": 0.3860642910003662, "num_input_tokens_seen": 20637348352, "step": 72560, "train_runtime": 705563.5365, "train_tokens_per_second": 29249.454 }, { "epoch": 2.567669231126453, "grad_norm": 0.609375, "learning_rate": 1.740049054762379e-05, "loss": 0.3843374729156494, "num_input_tokens_seen": 20640215424, "step": 72570, "train_runtime": 705661.4099, "train_tokens_per_second": 29249.46 }, { "epoch": 2.568023051390182, "grad_norm": 0.59765625, "learning_rate": 1.7399436949411007e-05, "loss": 0.38776202201843263, "num_input_tokens_seen": 20643027648, "step": 72580, "train_runtime": 705754.2139, "train_tokens_per_second": 29249.599 }, { "epoch": 2.5683768716539106, "grad_norm": 0.64453125, "learning_rate": 1.7398383542560892e-05, "loss": 0.3860463619232178, "num_input_tokens_seen": 20645891072, "step": 72590, "train_runtime": 705852.5086, "train_tokens_per_second": 29249.582 }, { "epoch": 2.5687306919176396, "grad_norm": 0.63671875, "learning_rate": 1.739733032701553e-05, "loss": 0.3863032579421997, "num_input_tokens_seen": 20648709120, "step": 72600, "train_runtime": 705947.9263, "train_tokens_per_second": 29249.621 }, { "epoch": 2.569084512181368, "grad_norm": 0.62109375, "learning_rate": 1.7396277302717024e-05, "loss": 0.3927278995513916, "num_input_tokens_seen": 20651559168, "step": 72610, "train_runtime": 706045.0998, "train_tokens_per_second": 29249.632 }, { "epoch": 2.569438332445097, "grad_norm": 0.58203125, "learning_rate": 1.7395224469607495e-05, "loss": 0.38797450065612793, "num_input_tokens_seen": 20654400000, "step": 72620, "train_runtime": 706143.5269, "train_tokens_per_second": 29249.578 }, { "epoch": 2.5697921527088257, "grad_norm": 0.62109375, "learning_rate": 1.73941718276291e-05, "loss": 0.38426249027252196, "num_input_tokens_seen": 20657272192, "step": 72630, "train_runtime": 706243.9945, "train_tokens_per_second": 29249.484 }, { "epoch": 2.5701459729725546, "grad_norm": 0.59765625, "learning_rate": 1.7393119376724022e-05, "loss": 0.38627171516418457, "num_input_tokens_seen": 20660119040, "step": 72640, "train_runtime": 706339.557, "train_tokens_per_second": 29249.557 }, { "epoch": 2.5704997932362836, "grad_norm": 0.6640625, "learning_rate": 1.739206711683445e-05, "loss": 0.38833160400390626, "num_input_tokens_seen": 20662932928, "step": 72650, "train_runtime": 706437.1436, "train_tokens_per_second": 29249.5 }, { "epoch": 2.570853613500012, "grad_norm": 0.58984375, "learning_rate": 1.739101504790262e-05, "loss": 0.3859187126159668, "num_input_tokens_seen": 20665755456, "step": 72660, "train_runtime": 706532.4764, "train_tokens_per_second": 29249.548 }, { "epoch": 2.5712074337637407, "grad_norm": 0.6015625, "learning_rate": 1.7389963169870784e-05, "loss": 0.3849137783050537, "num_input_tokens_seen": 20668651456, "step": 72670, "train_runtime": 706632.5511, "train_tokens_per_second": 29249.504 }, { "epoch": 2.5715612540274697, "grad_norm": 0.59765625, "learning_rate": 1.7388911482681212e-05, "loss": 0.3879070281982422, "num_input_tokens_seen": 20671458752, "step": 72680, "train_runtime": 706727.6465, "train_tokens_per_second": 29249.54 }, { "epoch": 2.5719150742911987, "grad_norm": 0.609375, "learning_rate": 1.7387859986276197e-05, "loss": 0.3888691425323486, "num_input_tokens_seen": 20674322048, "step": 72690, "train_runtime": 706827.4297, "train_tokens_per_second": 29249.462 }, { "epoch": 2.5722688945549272, "grad_norm": 0.609375, "learning_rate": 1.7386808680598078e-05, "loss": 0.3865368366241455, "num_input_tokens_seen": 20677222848, "step": 72700, "train_runtime": 706927.8599, "train_tokens_per_second": 29249.41 }, { "epoch": 2.572622714818656, "grad_norm": 0.625, "learning_rate": 1.7385757565589192e-05, "loss": 0.3862831830978394, "num_input_tokens_seen": 20680008704, "step": 72710, "train_runtime": 707023.4399, "train_tokens_per_second": 29249.396 }, { "epoch": 2.5729765350823848, "grad_norm": 0.61328125, "learning_rate": 1.7384706641191913e-05, "loss": 0.3844675779342651, "num_input_tokens_seen": 20682933632, "step": 72720, "train_runtime": 707126.9081, "train_tokens_per_second": 29249.253 }, { "epoch": 2.5733303553461138, "grad_norm": 0.64453125, "learning_rate": 1.7383655907348643e-05, "loss": 0.38379473686218263, "num_input_tokens_seen": 20685755072, "step": 72730, "train_runtime": 707223.4991, "train_tokens_per_second": 29249.247 }, { "epoch": 2.5736841756098423, "grad_norm": 0.62109375, "learning_rate": 1.7382605364001803e-05, "loss": 0.38410191535949706, "num_input_tokens_seen": 20688576000, "step": 72740, "train_runtime": 707321.4104, "train_tokens_per_second": 29249.187 }, { "epoch": 2.5740379958735713, "grad_norm": 0.6171875, "learning_rate": 1.738155501109383e-05, "loss": 0.38686318397521974, "num_input_tokens_seen": 20691433728, "step": 72750, "train_runtime": 707419.358, "train_tokens_per_second": 29249.177 }, { "epoch": 2.5743918161373, "grad_norm": 0.60546875, "learning_rate": 1.7380504848567207e-05, "loss": 0.38775198459625243, "num_input_tokens_seen": 20694294400, "step": 72760, "train_runtime": 707515.5769, "train_tokens_per_second": 29249.242 }, { "epoch": 2.574745636401029, "grad_norm": 0.62890625, "learning_rate": 1.7379454876364413e-05, "loss": 0.3854989528656006, "num_input_tokens_seen": 20697143680, "step": 72770, "train_runtime": 707612.2355, "train_tokens_per_second": 29249.273 }, { "epoch": 2.5750994566647574, "grad_norm": 0.6015625, "learning_rate": 1.7378405094427978e-05, "loss": 0.3907506465911865, "num_input_tokens_seen": 20700026816, "step": 72780, "train_runtime": 707712.194, "train_tokens_per_second": 29249.216 }, { "epoch": 2.5754532769284864, "grad_norm": 0.59765625, "learning_rate": 1.737735550270045e-05, "loss": 0.3860790252685547, "num_input_tokens_seen": 20702885952, "step": 72790, "train_runtime": 707810.2234, "train_tokens_per_second": 29249.204 }, { "epoch": 2.5758070971922153, "grad_norm": 0.60546875, "learning_rate": 1.7376306101124385e-05, "loss": 0.3875294208526611, "num_input_tokens_seen": 20705759360, "step": 72800, "train_runtime": 707907.0578, "train_tokens_per_second": 29249.262 }, { "epoch": 2.576160917455944, "grad_norm": 0.6484375, "learning_rate": 1.7375256889642376e-05, "loss": 0.38815035820007326, "num_input_tokens_seen": 20708582592, "step": 72810, "train_runtime": 708003.3812, "train_tokens_per_second": 29249.271 }, { "epoch": 2.5765147377196724, "grad_norm": 0.62890625, "learning_rate": 1.7374207868197044e-05, "loss": 0.3845224380493164, "num_input_tokens_seen": 20711415936, "step": 72820, "train_runtime": 708099.9531, "train_tokens_per_second": 29249.283 }, { "epoch": 2.5768685579834014, "grad_norm": 0.609375, "learning_rate": 1.7373159036731028e-05, "loss": 0.3894948959350586, "num_input_tokens_seen": 20714234880, "step": 72830, "train_runtime": 708195.7337, "train_tokens_per_second": 29249.308 }, { "epoch": 2.5772223782471304, "grad_norm": 0.609375, "learning_rate": 1.737211039518699e-05, "loss": 0.3889970064163208, "num_input_tokens_seen": 20717062464, "step": 72840, "train_runtime": 708294.0493, "train_tokens_per_second": 29249.24 }, { "epoch": 2.577576198510859, "grad_norm": 0.6328125, "learning_rate": 1.7371061943507615e-05, "loss": 0.38866562843322755, "num_input_tokens_seen": 20719861312, "step": 72850, "train_runtime": 708387.205, "train_tokens_per_second": 29249.344 }, { "epoch": 2.5779300187745875, "grad_norm": 0.65625, "learning_rate": 1.7370013681635626e-05, "loss": 0.38962316513061523, "num_input_tokens_seen": 20722699136, "step": 72860, "train_runtime": 708484.5341, "train_tokens_per_second": 29249.332 }, { "epoch": 2.5782838390383165, "grad_norm": 0.6171875, "learning_rate": 1.7368965609513755e-05, "loss": 0.3829775094985962, "num_input_tokens_seen": 20725508736, "step": 72870, "train_runtime": 708583.5109, "train_tokens_per_second": 29249.211 }, { "epoch": 2.5786376593020455, "grad_norm": 0.62109375, "learning_rate": 1.736791772708476e-05, "loss": 0.3895395755767822, "num_input_tokens_seen": 20728335552, "step": 72880, "train_runtime": 708679.5834, "train_tokens_per_second": 29249.235 }, { "epoch": 2.578991479565774, "grad_norm": 0.62890625, "learning_rate": 1.7366870034291427e-05, "loss": 0.3847679615020752, "num_input_tokens_seen": 20731187840, "step": 72890, "train_runtime": 708777.086, "train_tokens_per_second": 29249.235 }, { "epoch": 2.579345299829503, "grad_norm": 0.625, "learning_rate": 1.736582253107657e-05, "loss": 0.3882322072982788, "num_input_tokens_seen": 20733978560, "step": 72900, "train_runtime": 708870.4904, "train_tokens_per_second": 29249.318 }, { "epoch": 2.5796991200932315, "grad_norm": 0.609375, "learning_rate": 1.736477521738302e-05, "loss": 0.38532466888427735, "num_input_tokens_seen": 20736831488, "step": 72910, "train_runtime": 708968.0909, "train_tokens_per_second": 29249.316 }, { "epoch": 2.5800529403569605, "grad_norm": 0.6171875, "learning_rate": 1.7363728093153632e-05, "loss": 0.3869034767150879, "num_input_tokens_seen": 20739722624, "step": 72920, "train_runtime": 709069.509, "train_tokens_per_second": 29249.21 }, { "epoch": 2.580406760620689, "grad_norm": 0.59765625, "learning_rate": 1.7362681158331295e-05, "loss": 0.3879739761352539, "num_input_tokens_seen": 20742627072, "step": 72930, "train_runtime": 709168.9954, "train_tokens_per_second": 29249.202 }, { "epoch": 2.580760580884418, "grad_norm": 0.62890625, "learning_rate": 1.7361634412858908e-05, "loss": 0.38549802303314207, "num_input_tokens_seen": 20745470464, "step": 72940, "train_runtime": 709268.268, "train_tokens_per_second": 29249.117 }, { "epoch": 2.5811144011481466, "grad_norm": 0.59375, "learning_rate": 1.7360587856679405e-05, "loss": 0.3879418849945068, "num_input_tokens_seen": 20748280128, "step": 72950, "train_runtime": 709363.5986, "train_tokens_per_second": 29249.147 }, { "epoch": 2.5814682214118756, "grad_norm": 0.6171875, "learning_rate": 1.735954148973574e-05, "loss": 0.3875317335128784, "num_input_tokens_seen": 20751092480, "step": 72960, "train_runtime": 709459.1305, "train_tokens_per_second": 29249.172 }, { "epoch": 2.581822041675604, "grad_norm": 0.62109375, "learning_rate": 1.7358495311970887e-05, "loss": 0.3866284370422363, "num_input_tokens_seen": 20753923712, "step": 72970, "train_runtime": 709552.9986, "train_tokens_per_second": 29249.293 }, { "epoch": 2.582175861939333, "grad_norm": 0.62109375, "learning_rate": 1.7357449323327853e-05, "loss": 0.3865057468414307, "num_input_tokens_seen": 20756733696, "step": 72980, "train_runtime": 709649.6532, "train_tokens_per_second": 29249.269 }, { "epoch": 2.582529682203062, "grad_norm": 0.63671875, "learning_rate": 1.7356403523749667e-05, "loss": 0.3865872859954834, "num_input_tokens_seen": 20759522816, "step": 72990, "train_runtime": 709743.9765, "train_tokens_per_second": 29249.312 }, { "epoch": 2.5828835024667907, "grad_norm": 0.59375, "learning_rate": 1.7355357913179375e-05, "loss": 0.38580405712127686, "num_input_tokens_seen": 20762470848, "step": 73000, "train_runtime": 709845.707, "train_tokens_per_second": 29249.273 }, { "epoch": 2.583237322730519, "grad_norm": 0.62109375, "learning_rate": 1.7354312491560043e-05, "loss": 0.38407533168792723, "num_input_tokens_seen": 20765296640, "step": 73010, "train_runtime": 709940.1239, "train_tokens_per_second": 29249.363 }, { "epoch": 2.583591142994248, "grad_norm": 0.625, "learning_rate": 1.7353267258834785e-05, "loss": 0.38304691314697265, "num_input_tokens_seen": 20768109120, "step": 73020, "train_runtime": 710035.7575, "train_tokens_per_second": 29249.385 }, { "epoch": 2.583944963257977, "grad_norm": 0.60546875, "learning_rate": 1.7352222214946716e-05, "loss": 0.3822983741760254, "num_input_tokens_seen": 20770975936, "step": 73030, "train_runtime": 710135.7982, "train_tokens_per_second": 29249.301 }, { "epoch": 2.5842987835217057, "grad_norm": 0.609375, "learning_rate": 1.735117735983898e-05, "loss": 0.38666086196899413, "num_input_tokens_seen": 20773825472, "step": 73040, "train_runtime": 710237.5475, "train_tokens_per_second": 29249.123 }, { "epoch": 2.5846526037854347, "grad_norm": 0.625, "learning_rate": 1.735013269345475e-05, "loss": 0.38639349937438966, "num_input_tokens_seen": 20776646144, "step": 73050, "train_runtime": 710334.1833, "train_tokens_per_second": 29249.115 }, { "epoch": 2.5850064240491633, "grad_norm": 0.6171875, "learning_rate": 1.7349088215737225e-05, "loss": 0.3866072416305542, "num_input_tokens_seen": 20779489664, "step": 73060, "train_runtime": 710431.9329, "train_tokens_per_second": 29249.093 }, { "epoch": 2.5853602443128922, "grad_norm": 0.6328125, "learning_rate": 1.7348043926629614e-05, "loss": 0.38664243221282957, "num_input_tokens_seen": 20782366720, "step": 73070, "train_runtime": 710529.5534, "train_tokens_per_second": 29249.124 }, { "epoch": 2.585714064576621, "grad_norm": 0.60546875, "learning_rate": 1.7346999826075162e-05, "loss": 0.38595821857452395, "num_input_tokens_seen": 20785225088, "step": 73080, "train_runtime": 710628.3667, "train_tokens_per_second": 29249.079 }, { "epoch": 2.5860678848403498, "grad_norm": 0.59375, "learning_rate": 1.7345955914017143e-05, "loss": 0.38643383979797363, "num_input_tokens_seen": 20788115840, "step": 73090, "train_runtime": 710727.0954, "train_tokens_per_second": 29249.083 }, { "epoch": 2.5864217051040783, "grad_norm": 0.62109375, "learning_rate": 1.7344912190398834e-05, "loss": 0.38464994430541993, "num_input_tokens_seen": 20790963584, "step": 73100, "train_runtime": 710824.5474, "train_tokens_per_second": 29249.079 }, { "epoch": 2.5867755253678073, "grad_norm": 0.60546875, "learning_rate": 1.734386865516356e-05, "loss": 0.38803610801696775, "num_input_tokens_seen": 20793819776, "step": 73110, "train_runtime": 710920.4085, "train_tokens_per_second": 29249.153 }, { "epoch": 2.587129345631536, "grad_norm": 0.62109375, "learning_rate": 1.734282530825465e-05, "loss": 0.3899891138076782, "num_input_tokens_seen": 20796683840, "step": 73120, "train_runtime": 711021.1756, "train_tokens_per_second": 29249.036 }, { "epoch": 2.587483165895265, "grad_norm": 0.6015625, "learning_rate": 1.734178214961547e-05, "loss": 0.3866103172302246, "num_input_tokens_seen": 20799500928, "step": 73130, "train_runtime": 711115.58, "train_tokens_per_second": 29249.114 }, { "epoch": 2.587836986158994, "grad_norm": 0.6015625, "learning_rate": 1.7340739179189408e-05, "loss": 0.38913352489471437, "num_input_tokens_seen": 20802316864, "step": 73140, "train_runtime": 711210.8509, "train_tokens_per_second": 29249.156 }, { "epoch": 2.5881908064227224, "grad_norm": 0.62890625, "learning_rate": 1.7339696396919868e-05, "loss": 0.388286828994751, "num_input_tokens_seen": 20805153536, "step": 73150, "train_runtime": 711309.6948, "train_tokens_per_second": 29249.079 }, { "epoch": 2.588544626686451, "grad_norm": 0.62890625, "learning_rate": 1.7338653802750284e-05, "loss": 0.38502509593963624, "num_input_tokens_seen": 20808015808, "step": 73160, "train_runtime": 711406.7687, "train_tokens_per_second": 29249.111 }, { "epoch": 2.58889844695018, "grad_norm": 0.625, "learning_rate": 1.7337611396624114e-05, "loss": 0.38944072723388673, "num_input_tokens_seen": 20810881280, "step": 73170, "train_runtime": 711505.1033, "train_tokens_per_second": 29249.096 }, { "epoch": 2.589252267213909, "grad_norm": 0.61328125, "learning_rate": 1.733656917848484e-05, "loss": 0.38742449283599856, "num_input_tokens_seen": 20813741248, "step": 73180, "train_runtime": 711600.366, "train_tokens_per_second": 29249.2 }, { "epoch": 2.5896060874776374, "grad_norm": 0.62890625, "learning_rate": 1.733552714827596e-05, "loss": 0.38803579807281496, "num_input_tokens_seen": 20816625088, "step": 73190, "train_runtime": 711702.2839, "train_tokens_per_second": 29249.063 }, { "epoch": 2.589959907741366, "grad_norm": 0.59765625, "learning_rate": 1.7334485305941013e-05, "loss": 0.38478214740753175, "num_input_tokens_seen": 20819518080, "step": 73200, "train_runtime": 711804.3458, "train_tokens_per_second": 29248.934 }, { "epoch": 2.590313728005095, "grad_norm": 0.609375, "learning_rate": 1.7333443651423543e-05, "loss": 0.3860636234283447, "num_input_tokens_seen": 20822403584, "step": 73210, "train_runtime": 711904.1, "train_tokens_per_second": 29248.888 }, { "epoch": 2.590667548268824, "grad_norm": 0.6171875, "learning_rate": 1.7332402184667127e-05, "loss": 0.38175268173217775, "num_input_tokens_seen": 20825248640, "step": 73220, "train_runtime": 711999.9099, "train_tokens_per_second": 29248.948 }, { "epoch": 2.5910213685325525, "grad_norm": 0.609375, "learning_rate": 1.7331360905615364e-05, "loss": 0.38857741355895997, "num_input_tokens_seen": 20828073856, "step": 73230, "train_runtime": 712096.7565, "train_tokens_per_second": 29248.938 }, { "epoch": 2.5913751887962815, "grad_norm": 0.63671875, "learning_rate": 1.733031981421188e-05, "loss": 0.3916304111480713, "num_input_tokens_seen": 20830918720, "step": 73240, "train_runtime": 712196.0154, "train_tokens_per_second": 29248.856 }, { "epoch": 2.59172900906001, "grad_norm": 0.62109375, "learning_rate": 1.7329278910400316e-05, "loss": 0.38816845417022705, "num_input_tokens_seen": 20833775936, "step": 73250, "train_runtime": 712292.6427, "train_tokens_per_second": 29248.9 }, { "epoch": 2.592082829323739, "grad_norm": 0.61328125, "learning_rate": 1.7328238194124348e-05, "loss": 0.3832723617553711, "num_input_tokens_seen": 20836626816, "step": 73260, "train_runtime": 712390.7221, "train_tokens_per_second": 29248.874 }, { "epoch": 2.5924366495874676, "grad_norm": 0.609375, "learning_rate": 1.7327197665327667e-05, "loss": 0.3866168975830078, "num_input_tokens_seen": 20839408512, "step": 73270, "train_runtime": 712483.4933, "train_tokens_per_second": 29248.97 }, { "epoch": 2.5927904698511965, "grad_norm": 0.6171875, "learning_rate": 1.7326157323953994e-05, "loss": 0.3852705717086792, "num_input_tokens_seen": 20842184896, "step": 73280, "train_runtime": 712574.5521, "train_tokens_per_second": 29249.129 }, { "epoch": 2.593144290114925, "grad_norm": 0.609375, "learning_rate": 1.732511716994707e-05, "loss": 0.384720516204834, "num_input_tokens_seen": 20845055808, "step": 73290, "train_runtime": 712671.8941, "train_tokens_per_second": 29249.162 }, { "epoch": 2.593498110378654, "grad_norm": 0.6328125, "learning_rate": 1.7324077203250654e-05, "loss": 0.3839640855789185, "num_input_tokens_seen": 20847931264, "step": 73300, "train_runtime": 712770.1137, "train_tokens_per_second": 29249.166 }, { "epoch": 2.5938519306423826, "grad_norm": 0.625, "learning_rate": 1.7323037423808545e-05, "loss": 0.38370201587677, "num_input_tokens_seen": 20850769152, "step": 73310, "train_runtime": 712864.9451, "train_tokens_per_second": 29249.256 }, { "epoch": 2.5942057509061116, "grad_norm": 0.609375, "learning_rate": 1.7321997831564546e-05, "loss": 0.38873872756958006, "num_input_tokens_seen": 20853610880, "step": 73320, "train_runtime": 712962.1339, "train_tokens_per_second": 29249.254 }, { "epoch": 2.5945595711698406, "grad_norm": 0.59765625, "learning_rate": 1.7320958426462496e-05, "loss": 0.386285138130188, "num_input_tokens_seen": 20856452352, "step": 73330, "train_runtime": 713057.6688, "train_tokens_per_second": 29249.321 }, { "epoch": 2.594913391433569, "grad_norm": 0.6171875, "learning_rate": 1.731991920844626e-05, "loss": 0.3880527257919312, "num_input_tokens_seen": 20859311808, "step": 73340, "train_runtime": 713156.5236, "train_tokens_per_second": 29249.276 }, { "epoch": 2.5952672116972977, "grad_norm": 0.63671875, "learning_rate": 1.7318880177459714e-05, "loss": 0.3857563495635986, "num_input_tokens_seen": 20862189568, "step": 73350, "train_runtime": 713256.1177, "train_tokens_per_second": 29249.226 }, { "epoch": 2.5956210319610267, "grad_norm": 0.609375, "learning_rate": 1.7317841333446765e-05, "loss": 0.38396296501159666, "num_input_tokens_seen": 20865010560, "step": 73360, "train_runtime": 713351.5974, "train_tokens_per_second": 29249.266 }, { "epoch": 2.5959748522247557, "grad_norm": 0.62109375, "learning_rate": 1.731680267635135e-05, "loss": 0.3856297492980957, "num_input_tokens_seen": 20867867264, "step": 73370, "train_runtime": 713449.3101, "train_tokens_per_second": 29249.264 }, { "epoch": 2.596328672488484, "grad_norm": 0.6171875, "learning_rate": 1.7315764206117417e-05, "loss": 0.3855828523635864, "num_input_tokens_seen": 20870682048, "step": 73380, "train_runtime": 713544.7762, "train_tokens_per_second": 29249.296 }, { "epoch": 2.596682492752213, "grad_norm": 0.61328125, "learning_rate": 1.7314725922688945e-05, "loss": 0.3825018882751465, "num_input_tokens_seen": 20873590400, "step": 73390, "train_runtime": 713644.7422, "train_tokens_per_second": 29249.274 }, { "epoch": 2.5970363130159417, "grad_norm": 0.6171875, "learning_rate": 1.731368782600993e-05, "loss": 0.38587749004364014, "num_input_tokens_seen": 20876455424, "step": 73400, "train_runtime": 713741.4389, "train_tokens_per_second": 29249.325 }, { "epoch": 2.5973901332796707, "grad_norm": 0.61328125, "learning_rate": 1.7312649916024402e-05, "loss": 0.38906397819519045, "num_input_tokens_seen": 20879320896, "step": 73410, "train_runtime": 713838.5318, "train_tokens_per_second": 29249.361 }, { "epoch": 2.5977439535433993, "grad_norm": 0.6171875, "learning_rate": 1.731161219267641e-05, "loss": 0.3845083713531494, "num_input_tokens_seen": 20882183040, "step": 73420, "train_runtime": 713935.9455, "train_tokens_per_second": 29249.379 }, { "epoch": 2.5980977738071283, "grad_norm": 0.60546875, "learning_rate": 1.731057465591002e-05, "loss": 0.3824885368347168, "num_input_tokens_seen": 20885040192, "step": 73430, "train_runtime": 714037.7764, "train_tokens_per_second": 29249.209 }, { "epoch": 2.598451594070857, "grad_norm": 0.62109375, "learning_rate": 1.7309537305669334e-05, "loss": 0.38613746166229246, "num_input_tokens_seen": 20887862656, "step": 73440, "train_runtime": 714131.2075, "train_tokens_per_second": 29249.335 }, { "epoch": 2.598805414334586, "grad_norm": 0.61328125, "learning_rate": 1.7308500141898458e-05, "loss": 0.3843658447265625, "num_input_tokens_seen": 20890725696, "step": 73450, "train_runtime": 714225.9561, "train_tokens_per_second": 29249.463 }, { "epoch": 2.5991592345983143, "grad_norm": 0.62890625, "learning_rate": 1.730746316454155e-05, "loss": 0.37988944053649903, "num_input_tokens_seen": 20893585792, "step": 73460, "train_runtime": 714326.1766, "train_tokens_per_second": 29249.363 }, { "epoch": 2.5995130548620433, "grad_norm": 0.65234375, "learning_rate": 1.730642637354276e-05, "loss": 0.38753297328948977, "num_input_tokens_seen": 20896413568, "step": 73470, "train_runtime": 714420.8511, "train_tokens_per_second": 29249.445 }, { "epoch": 2.5998668751257723, "grad_norm": 0.609375, "learning_rate": 1.7305389768846286e-05, "loss": 0.38197689056396483, "num_input_tokens_seen": 20899254592, "step": 73480, "train_runtime": 714517.1223, "train_tokens_per_second": 29249.48 }, { "epoch": 2.600220695389501, "grad_norm": 0.62109375, "learning_rate": 1.7304353350396332e-05, "loss": 0.38238523006439207, "num_input_tokens_seen": 20902064384, "step": 73490, "train_runtime": 714612.0366, "train_tokens_per_second": 29249.527 }, { "epoch": 2.6005745156532294, "grad_norm": 0.62890625, "learning_rate": 1.7303317118137143e-05, "loss": 0.3910677433013916, "num_input_tokens_seen": 20904853440, "step": 73500, "train_runtime": 714705.8951, "train_tokens_per_second": 29249.589 }, { "epoch": 2.6009283359169584, "grad_norm": 0.6328125, "learning_rate": 1.7302281072012973e-05, "loss": 0.38762850761413575, "num_input_tokens_seen": 20907649664, "step": 73510, "train_runtime": 714798.7037, "train_tokens_per_second": 29249.703 }, { "epoch": 2.6012821561806874, "grad_norm": 0.62890625, "learning_rate": 1.7301245211968094e-05, "loss": 0.38384621143341063, "num_input_tokens_seen": 20910440256, "step": 73520, "train_runtime": 714894.2926, "train_tokens_per_second": 29249.695 }, { "epoch": 2.601635976444416, "grad_norm": 0.61328125, "learning_rate": 1.7300209537946832e-05, "loss": 0.38538570404052735, "num_input_tokens_seen": 20913234880, "step": 73530, "train_runtime": 714987.3653, "train_tokens_per_second": 29249.796 }, { "epoch": 2.6019897967081445, "grad_norm": 0.62890625, "learning_rate": 1.7299174049893497e-05, "loss": 0.3852902173995972, "num_input_tokens_seen": 20916057088, "step": 73540, "train_runtime": 715084.7642, "train_tokens_per_second": 29249.759 }, { "epoch": 2.6023436169718734, "grad_norm": 0.6328125, "learning_rate": 1.7298138747752453e-05, "loss": 0.38555431365966797, "num_input_tokens_seen": 20918907264, "step": 73550, "train_runtime": 715182.9946, "train_tokens_per_second": 29249.727 }, { "epoch": 2.6026974372356024, "grad_norm": 0.625, "learning_rate": 1.729710363146807e-05, "loss": 0.38380913734436034, "num_input_tokens_seen": 20921776704, "step": 73560, "train_runtime": 715282.5639, "train_tokens_per_second": 29249.667 }, { "epoch": 2.603051257499331, "grad_norm": 0.59765625, "learning_rate": 1.7296068700984743e-05, "loss": 0.3886416912078857, "num_input_tokens_seen": 20924649920, "step": 73570, "train_runtime": 715380.6677, "train_tokens_per_second": 29249.672 }, { "epoch": 2.60340507776306, "grad_norm": 0.625, "learning_rate": 1.7295033956246902e-05, "loss": 0.39080562591552737, "num_input_tokens_seen": 20927540288, "step": 73580, "train_runtime": 715481.2225, "train_tokens_per_second": 29249.601 }, { "epoch": 2.6037588980267885, "grad_norm": 0.6171875, "learning_rate": 1.7293999397198985e-05, "loss": 0.3841590881347656, "num_input_tokens_seen": 20930353536, "step": 73590, "train_runtime": 715576.1632, "train_tokens_per_second": 29249.652 }, { "epoch": 2.6041127182905175, "grad_norm": 0.62890625, "learning_rate": 1.7292965023785464e-05, "loss": 0.38810131549835203, "num_input_tokens_seen": 20933269120, "step": 73600, "train_runtime": 715676.3002, "train_tokens_per_second": 29249.633 }, { "epoch": 2.604466538554246, "grad_norm": 0.62890625, "learning_rate": 1.7291930835950827e-05, "loss": 0.385075044631958, "num_input_tokens_seen": 20936127552, "step": 73610, "train_runtime": 715772.8776, "train_tokens_per_second": 29249.68 }, { "epoch": 2.604820358817975, "grad_norm": 0.62109375, "learning_rate": 1.72908968336396e-05, "loss": 0.39043853282928465, "num_input_tokens_seen": 20938932160, "step": 73620, "train_runtime": 715871.9027, "train_tokens_per_second": 29249.552 }, { "epoch": 2.6051741790817036, "grad_norm": 0.609375, "learning_rate": 1.728986301679631e-05, "loss": 0.3904495477676392, "num_input_tokens_seen": 20941741568, "step": 73630, "train_runtime": 715966.6537, "train_tokens_per_second": 29249.605 }, { "epoch": 2.6055279993454326, "grad_norm": 0.60546875, "learning_rate": 1.7288829385365522e-05, "loss": 0.384967565536499, "num_input_tokens_seen": 20944624768, "step": 73640, "train_runtime": 716066.6603, "train_tokens_per_second": 29249.546 }, { "epoch": 2.605881819609161, "grad_norm": 0.59375, "learning_rate": 1.7287795939291814e-05, "loss": 0.38532323837280275, "num_input_tokens_seen": 20947419776, "step": 73650, "train_runtime": 716162.4076, "train_tokens_per_second": 29249.538 }, { "epoch": 2.60623563987289, "grad_norm": 0.62890625, "learning_rate": 1.728676267851981e-05, "loss": 0.38766984939575194, "num_input_tokens_seen": 20950244352, "step": 73660, "train_runtime": 716259.4315, "train_tokens_per_second": 29249.52 }, { "epoch": 2.606589460136619, "grad_norm": 0.640625, "learning_rate": 1.728572960299412e-05, "loss": 0.3832993507385254, "num_input_tokens_seen": 20953037376, "step": 73670, "train_runtime": 716353.1972, "train_tokens_per_second": 29249.59 }, { "epoch": 2.6069432804003476, "grad_norm": 0.65234375, "learning_rate": 1.7284696712659413e-05, "loss": 0.3878342628479004, "num_input_tokens_seen": 20955934848, "step": 73680, "train_runtime": 716453.0024, "train_tokens_per_second": 29249.56 }, { "epoch": 2.607297100664076, "grad_norm": 0.6015625, "learning_rate": 1.728366400746036e-05, "loss": 0.38535079956054685, "num_input_tokens_seen": 20958793728, "step": 73690, "train_runtime": 716550.4947, "train_tokens_per_second": 29249.57 }, { "epoch": 2.607650920927805, "grad_norm": 0.65234375, "learning_rate": 1.7282631487341668e-05, "loss": 0.3885688304901123, "num_input_tokens_seen": 20961629568, "step": 73700, "train_runtime": 716646.4262, "train_tokens_per_second": 29249.612 }, { "epoch": 2.608004741191534, "grad_norm": 0.6015625, "learning_rate": 1.728159915224805e-05, "loss": 0.38648903369903564, "num_input_tokens_seen": 20964455104, "step": 73710, "train_runtime": 716742.7275, "train_tokens_per_second": 29249.624 }, { "epoch": 2.6083585614552627, "grad_norm": 0.62109375, "learning_rate": 1.728056700212426e-05, "loss": 0.38951883316040037, "num_input_tokens_seen": 20967304832, "step": 73720, "train_runtime": 716838.9429, "train_tokens_per_second": 29249.673 }, { "epoch": 2.6087123817189917, "grad_norm": 0.6328125, "learning_rate": 1.7279535036915067e-05, "loss": 0.3854218006134033, "num_input_tokens_seen": 20970106624, "step": 73730, "train_runtime": 716934.0214, "train_tokens_per_second": 29249.702 }, { "epoch": 2.60906620198272, "grad_norm": 0.62109375, "learning_rate": 1.727850325656526e-05, "loss": 0.3818650245666504, "num_input_tokens_seen": 20972956032, "step": 73740, "train_runtime": 717029.4234, "train_tokens_per_second": 29249.784 }, { "epoch": 2.609420022246449, "grad_norm": 0.62890625, "learning_rate": 1.7277471661019656e-05, "loss": 0.3885868310928345, "num_input_tokens_seen": 20975826112, "step": 73750, "train_runtime": 717128.0438, "train_tokens_per_second": 29249.764 }, { "epoch": 2.6097738425101777, "grad_norm": 0.6171875, "learning_rate": 1.7276440250223096e-05, "loss": 0.3880035161972046, "num_input_tokens_seen": 20978662528, "step": 73760, "train_runtime": 717225.1514, "train_tokens_per_second": 29249.759 }, { "epoch": 2.6101276627739067, "grad_norm": 0.625, "learning_rate": 1.727540902412044e-05, "loss": 0.3850111484527588, "num_input_tokens_seen": 20981486208, "step": 73770, "train_runtime": 717319.8713, "train_tokens_per_second": 29249.833 }, { "epoch": 2.6104814830376353, "grad_norm": 0.609375, "learning_rate": 1.7274377982656575e-05, "loss": 0.38850417137146, "num_input_tokens_seen": 20984376768, "step": 73780, "train_runtime": 717418.0371, "train_tokens_per_second": 29249.859 }, { "epoch": 2.6108353033013643, "grad_norm": 0.6328125, "learning_rate": 1.7273347125776408e-05, "loss": 0.3834697723388672, "num_input_tokens_seen": 20987196416, "step": 73790, "train_runtime": 717515.5469, "train_tokens_per_second": 29249.814 }, { "epoch": 2.611189123565093, "grad_norm": 0.62109375, "learning_rate": 1.727231645342487e-05, "loss": 0.38417582511901854, "num_input_tokens_seen": 20990048384, "step": 73800, "train_runtime": 717614.0842, "train_tokens_per_second": 29249.772 }, { "epoch": 2.611542943828822, "grad_norm": 0.62109375, "learning_rate": 1.727128596554691e-05, "loss": 0.38305504322052003, "num_input_tokens_seen": 20992882624, "step": 73810, "train_runtime": 717711.8541, "train_tokens_per_second": 29249.737 }, { "epoch": 2.611896764092551, "grad_norm": 0.62109375, "learning_rate": 1.7270255662087515e-05, "loss": 0.3844930410385132, "num_input_tokens_seen": 20995766208, "step": 73820, "train_runtime": 717810.7786, "train_tokens_per_second": 29249.723 }, { "epoch": 2.6122505843562793, "grad_norm": 0.60546875, "learning_rate": 1.7269225542991676e-05, "loss": 0.3874272108078003, "num_input_tokens_seen": 20998585920, "step": 73830, "train_runtime": 717905.2163, "train_tokens_per_second": 29249.803 }, { "epoch": 2.612604404620008, "grad_norm": 0.62890625, "learning_rate": 1.726819560820442e-05, "loss": 0.3849189281463623, "num_input_tokens_seen": 21001371392, "step": 73840, "train_runtime": 717998.062, "train_tokens_per_second": 29249.9 }, { "epoch": 2.612958224883737, "grad_norm": 0.61328125, "learning_rate": 1.7267165857670794e-05, "loss": 0.386501407623291, "num_input_tokens_seen": 21004203648, "step": 73850, "train_runtime": 718096.8867, "train_tokens_per_second": 29249.819 }, { "epoch": 2.613312045147466, "grad_norm": 0.6171875, "learning_rate": 1.7266136291335867e-05, "loss": 0.3880645990371704, "num_input_tokens_seen": 21007036032, "step": 73860, "train_runtime": 718191.7931, "train_tokens_per_second": 29249.897 }, { "epoch": 2.6136658654111944, "grad_norm": 0.64453125, "learning_rate": 1.726510690914472e-05, "loss": 0.38773393630981445, "num_input_tokens_seen": 21009850816, "step": 73870, "train_runtime": 718285.8432, "train_tokens_per_second": 29249.986 }, { "epoch": 2.614019685674923, "grad_norm": 0.64453125, "learning_rate": 1.7264077711042482e-05, "loss": 0.3821838140487671, "num_input_tokens_seen": 21012699328, "step": 73880, "train_runtime": 718384.9695, "train_tokens_per_second": 29249.915 }, { "epoch": 2.614373505938652, "grad_norm": 0.625, "learning_rate": 1.7263048696974286e-05, "loss": 0.3879333257675171, "num_input_tokens_seen": 21015604288, "step": 73890, "train_runtime": 718484.2853, "train_tokens_per_second": 29249.915 }, { "epoch": 2.614727326202381, "grad_norm": 0.6171875, "learning_rate": 1.7262019866885286e-05, "loss": 0.38918299674987794, "num_input_tokens_seen": 21018489536, "step": 73900, "train_runtime": 718582.2685, "train_tokens_per_second": 29249.942 }, { "epoch": 2.6150811464661095, "grad_norm": 0.62109375, "learning_rate": 1.7260991220720677e-05, "loss": 0.38948636054992675, "num_input_tokens_seen": 21021335488, "step": 73910, "train_runtime": 718676.7568, "train_tokens_per_second": 29250.056 }, { "epoch": 2.6154349667298384, "grad_norm": 0.6015625, "learning_rate": 1.7259962758425654e-05, "loss": 0.3825868844985962, "num_input_tokens_seen": 21024135552, "step": 73920, "train_runtime": 718769.5055, "train_tokens_per_second": 29250.177 }, { "epoch": 2.615788786993567, "grad_norm": 0.62109375, "learning_rate": 1.725893447994545e-05, "loss": 0.38635573387145994, "num_input_tokens_seen": 21026949824, "step": 73930, "train_runtime": 718863.8151, "train_tokens_per_second": 29250.255 }, { "epoch": 2.616142607257296, "grad_norm": 0.59765625, "learning_rate": 1.725790638522532e-05, "loss": 0.3859381198883057, "num_input_tokens_seen": 21029835200, "step": 73940, "train_runtime": 718963.9428, "train_tokens_per_second": 29250.195 }, { "epoch": 2.6164964275210245, "grad_norm": 0.60546875, "learning_rate": 1.7256878474210535e-05, "loss": 0.3851091146469116, "num_input_tokens_seen": 21032660032, "step": 73950, "train_runtime": 719060.2858, "train_tokens_per_second": 29250.204 }, { "epoch": 2.6168502477847535, "grad_norm": 0.625, "learning_rate": 1.7255850746846394e-05, "loss": 0.3885054588317871, "num_input_tokens_seen": 21035511104, "step": 73960, "train_runtime": 719159.0054, "train_tokens_per_second": 29250.153 }, { "epoch": 2.6172040680484825, "grad_norm": 0.66015625, "learning_rate": 1.7254823203078215e-05, "loss": 0.38359837532043456, "num_input_tokens_seen": 21038345728, "step": 73970, "train_runtime": 719260.6023, "train_tokens_per_second": 29249.963 }, { "epoch": 2.617557888312211, "grad_norm": 0.6484375, "learning_rate": 1.7253795842851346e-05, "loss": 0.3879091739654541, "num_input_tokens_seen": 21041184256, "step": 73980, "train_runtime": 719355.7815, "train_tokens_per_second": 29250.038 }, { "epoch": 2.6179117085759396, "grad_norm": 0.640625, "learning_rate": 1.7252768666111146e-05, "loss": 0.39066300392150877, "num_input_tokens_seen": 21044001600, "step": 73990, "train_runtime": 719451.7995, "train_tokens_per_second": 29250.051 }, { "epoch": 2.6182655288396686, "grad_norm": 0.62109375, "learning_rate": 1.725174167280301e-05, "loss": 0.3870569705963135, "num_input_tokens_seen": 21046825920, "step": 74000, "train_runtime": 719548.5494, "train_tokens_per_second": 29250.043 }, { "epoch": 2.6186193491033976, "grad_norm": 0.62109375, "learning_rate": 1.7250714862872344e-05, "loss": 0.38666629791259766, "num_input_tokens_seen": 21049622976, "step": 74010, "train_runtime": 719640.2701, "train_tokens_per_second": 29250.202 }, { "epoch": 2.618973169367126, "grad_norm": 0.625, "learning_rate": 1.7249688236264586e-05, "loss": 0.388053297996521, "num_input_tokens_seen": 21052515648, "step": 74020, "train_runtime": 719736.5742, "train_tokens_per_second": 29250.307 }, { "epoch": 2.6193269896308546, "grad_norm": 0.609375, "learning_rate": 1.7248661792925187e-05, "loss": 0.3832382678985596, "num_input_tokens_seen": 21055384128, "step": 74030, "train_runtime": 719833.6914, "train_tokens_per_second": 29250.345 }, { "epoch": 2.6196808098945836, "grad_norm": 0.61328125, "learning_rate": 1.7247635532799638e-05, "loss": 0.3932713747024536, "num_input_tokens_seen": 21058265024, "step": 74040, "train_runtime": 719933.8618, "train_tokens_per_second": 29250.277 }, { "epoch": 2.6200346301583126, "grad_norm": 0.625, "learning_rate": 1.7246609455833433e-05, "loss": 0.39045188426971433, "num_input_tokens_seen": 21061118592, "step": 74050, "train_runtime": 720032.4665, "train_tokens_per_second": 29250.235 }, { "epoch": 2.620388450422041, "grad_norm": 0.640625, "learning_rate": 1.7245583561972093e-05, "loss": 0.38668007850646974, "num_input_tokens_seen": 21063940864, "step": 74060, "train_runtime": 720127.1913, "train_tokens_per_second": 29250.306 }, { "epoch": 2.62074227068577, "grad_norm": 0.625, "learning_rate": 1.724455785116118e-05, "loss": 0.38700165748596194, "num_input_tokens_seen": 21066691904, "step": 74070, "train_runtime": 720217.7977, "train_tokens_per_second": 29250.446 }, { "epoch": 2.6210960909494987, "grad_norm": 0.59375, "learning_rate": 1.7243532323346245e-05, "loss": 0.3821300983428955, "num_input_tokens_seen": 21069529344, "step": 74080, "train_runtime": 720315.8648, "train_tokens_per_second": 29250.403 }, { "epoch": 2.6214499112132277, "grad_norm": 0.61328125, "learning_rate": 1.7242506978472894e-05, "loss": 0.38727333545684817, "num_input_tokens_seen": 21072362368, "step": 74090, "train_runtime": 720414.6346, "train_tokens_per_second": 29250.325 }, { "epoch": 2.6218037314769562, "grad_norm": 0.609375, "learning_rate": 1.724148181648674e-05, "loss": 0.3851685762405396, "num_input_tokens_seen": 21075212032, "step": 74100, "train_runtime": 720512.9842, "train_tokens_per_second": 29250.288 }, { "epoch": 2.622157551740685, "grad_norm": 0.6328125, "learning_rate": 1.7240456837333422e-05, "loss": 0.3895851135253906, "num_input_tokens_seen": 21078059712, "step": 74110, "train_runtime": 720611.6324, "train_tokens_per_second": 29250.235 }, { "epoch": 2.6225113720044138, "grad_norm": 0.6015625, "learning_rate": 1.72394320409586e-05, "loss": 0.38266630172729493, "num_input_tokens_seen": 21080842944, "step": 74120, "train_runtime": 720705.1064, "train_tokens_per_second": 29250.303 }, { "epoch": 2.6228651922681427, "grad_norm": 0.61328125, "learning_rate": 1.7238407427307952e-05, "loss": 0.3894216775894165, "num_input_tokens_seen": 21083691840, "step": 74130, "train_runtime": 720802.75, "train_tokens_per_second": 29250.293 }, { "epoch": 2.6232190125318713, "grad_norm": 0.62109375, "learning_rate": 1.7237382996327196e-05, "loss": 0.38794474601745604, "num_input_tokens_seen": 21086498176, "step": 74140, "train_runtime": 720898.5875, "train_tokens_per_second": 29250.298 }, { "epoch": 2.6235728327956003, "grad_norm": 0.61328125, "learning_rate": 1.7236358747962054e-05, "loss": 0.38649075031280516, "num_input_tokens_seen": 21089361856, "step": 74150, "train_runtime": 720998.8592, "train_tokens_per_second": 29250.201 }, { "epoch": 2.6239266530593293, "grad_norm": 0.640625, "learning_rate": 1.723533468215827e-05, "loss": 0.3895872116088867, "num_input_tokens_seen": 21092201920, "step": 74160, "train_runtime": 721095.2183, "train_tokens_per_second": 29250.231 }, { "epoch": 2.624280473323058, "grad_norm": 0.66796875, "learning_rate": 1.7234310798861627e-05, "loss": 0.38542847633361815, "num_input_tokens_seen": 21095045888, "step": 74170, "train_runtime": 721194.1609, "train_tokens_per_second": 29250.162 }, { "epoch": 2.6246342935867863, "grad_norm": 0.61328125, "learning_rate": 1.723328709801792e-05, "loss": 0.3887073516845703, "num_input_tokens_seen": 21097907136, "step": 74180, "train_runtime": 721290.8753, "train_tokens_per_second": 29250.207 }, { "epoch": 2.6249881138505153, "grad_norm": 0.59375, "learning_rate": 1.7232263579572966e-05, "loss": 0.3836081027984619, "num_input_tokens_seen": 21100776960, "step": 74190, "train_runtime": 721386.928, "train_tokens_per_second": 29250.29 }, { "epoch": 2.6253419341142443, "grad_norm": 0.61328125, "learning_rate": 1.723124024347261e-05, "loss": 0.3843811511993408, "num_input_tokens_seen": 21103612416, "step": 74200, "train_runtime": 721485.4236, "train_tokens_per_second": 29250.227 }, { "epoch": 2.625695754377973, "grad_norm": 0.6328125, "learning_rate": 1.723021708966271e-05, "loss": 0.38996295928955077, "num_input_tokens_seen": 21106506368, "step": 74210, "train_runtime": 721586.903, "train_tokens_per_second": 29250.124 }, { "epoch": 2.626049574641702, "grad_norm": 0.640625, "learning_rate": 1.7229194118089154e-05, "loss": 0.3860771179199219, "num_input_tokens_seen": 21109353856, "step": 74220, "train_runtime": 721687.1291, "train_tokens_per_second": 29250.007 }, { "epoch": 2.6264033949054304, "grad_norm": 0.62109375, "learning_rate": 1.7228171328697853e-05, "loss": 0.3857696771621704, "num_input_tokens_seen": 21112211456, "step": 74230, "train_runtime": 721784.4995, "train_tokens_per_second": 29250.021 }, { "epoch": 2.6267572151691594, "grad_norm": 0.609375, "learning_rate": 1.7227148721434737e-05, "loss": 0.38657779693603517, "num_input_tokens_seen": 21115057344, "step": 74240, "train_runtime": 721880.3118, "train_tokens_per_second": 29250.081 }, { "epoch": 2.627111035432888, "grad_norm": 0.61328125, "learning_rate": 1.7226126296245764e-05, "loss": 0.38780524730682375, "num_input_tokens_seen": 21117978752, "step": 74250, "train_runtime": 721983.4398, "train_tokens_per_second": 29249.949 }, { "epoch": 2.627464855696617, "grad_norm": 0.625, "learning_rate": 1.7225104053076904e-05, "loss": 0.38394529819488527, "num_input_tokens_seen": 21120835712, "step": 74260, "train_runtime": 722082.154, "train_tokens_per_second": 29249.907 }, { "epoch": 2.6278186759603455, "grad_norm": 0.6171875, "learning_rate": 1.722408199187416e-05, "loss": 0.3886481761932373, "num_input_tokens_seen": 21123661312, "step": 74270, "train_runtime": 722179.004, "train_tokens_per_second": 29249.897 }, { "epoch": 2.6281724962240745, "grad_norm": 0.6171875, "learning_rate": 1.722306011258355e-05, "loss": 0.3893352746963501, "num_input_tokens_seen": 21126457792, "step": 74280, "train_runtime": 722273.9977, "train_tokens_per_second": 29249.922 }, { "epoch": 2.628526316487803, "grad_norm": 0.62109375, "learning_rate": 1.7222038415151115e-05, "loss": 0.385011100769043, "num_input_tokens_seen": 21129291136, "step": 74290, "train_runtime": 722371.5036, "train_tokens_per_second": 29249.896 }, { "epoch": 2.628880136751532, "grad_norm": 0.609375, "learning_rate": 1.7221016899522925e-05, "loss": 0.3886619806289673, "num_input_tokens_seen": 21132155264, "step": 74300, "train_runtime": 722469.4719, "train_tokens_per_second": 29249.894 }, { "epoch": 2.629233957015261, "grad_norm": 0.61328125, "learning_rate": 1.7219995565645076e-05, "loss": 0.3862520694732666, "num_input_tokens_seen": 21135021504, "step": 74310, "train_runtime": 722567.19, "train_tokens_per_second": 29249.905 }, { "epoch": 2.6295877772789895, "grad_norm": 0.625, "learning_rate": 1.721897441346366e-05, "loss": 0.387230658531189, "num_input_tokens_seen": 21137851712, "step": 74320, "train_runtime": 722661.3885, "train_tokens_per_second": 29250.008 }, { "epoch": 2.629941597542718, "grad_norm": 0.5859375, "learning_rate": 1.721795344292483e-05, "loss": 0.3869665861129761, "num_input_tokens_seen": 21140660928, "step": 74330, "train_runtime": 722756.6684, "train_tokens_per_second": 29250.039 }, { "epoch": 2.630295417806447, "grad_norm": 0.65234375, "learning_rate": 1.7216932653974727e-05, "loss": 0.38742647171020506, "num_input_tokens_seen": 21143533184, "step": 74340, "train_runtime": 722854.2076, "train_tokens_per_second": 29250.066 }, { "epoch": 2.630649238070176, "grad_norm": 0.62109375, "learning_rate": 1.7215912046559533e-05, "loss": 0.3892971992492676, "num_input_tokens_seen": 21146320576, "step": 74350, "train_runtime": 722950.9025, "train_tokens_per_second": 29250.009 }, { "epoch": 2.6310030583339046, "grad_norm": 0.64453125, "learning_rate": 1.7214891620625454e-05, "loss": 0.39136877059936526, "num_input_tokens_seen": 21149176960, "step": 74360, "train_runtime": 723048.1644, "train_tokens_per_second": 29250.025 }, { "epoch": 2.631356878597633, "grad_norm": 0.60546875, "learning_rate": 1.7213871376118704e-05, "loss": 0.38932342529296876, "num_input_tokens_seen": 21152039488, "step": 74370, "train_runtime": 723143.9373, "train_tokens_per_second": 29250.11 }, { "epoch": 2.631710698861362, "grad_norm": 0.60546875, "learning_rate": 1.721285131298553e-05, "loss": 0.3894200801849365, "num_input_tokens_seen": 21154890176, "step": 74380, "train_runtime": 723240.5038, "train_tokens_per_second": 29250.146 }, { "epoch": 2.632064519125091, "grad_norm": 0.6015625, "learning_rate": 1.72118314311722e-05, "loss": 0.3884094476699829, "num_input_tokens_seen": 21157692672, "step": 74390, "train_runtime": 723336.071, "train_tokens_per_second": 29250.156 }, { "epoch": 2.6324183393888196, "grad_norm": 0.609375, "learning_rate": 1.7210811730625004e-05, "loss": 0.3872340679168701, "num_input_tokens_seen": 21160574016, "step": 74400, "train_runtime": 723435.6168, "train_tokens_per_second": 29250.114 }, { "epoch": 2.6327721596525486, "grad_norm": 0.62890625, "learning_rate": 1.720979221129026e-05, "loss": 0.38279070854187014, "num_input_tokens_seen": 21163414784, "step": 74410, "train_runtime": 723531.4542, "train_tokens_per_second": 29250.166 }, { "epoch": 2.633125979916277, "grad_norm": 0.6171875, "learning_rate": 1.7208772873114285e-05, "loss": 0.3878284454345703, "num_input_tokens_seen": 21166249216, "step": 74420, "train_runtime": 723626.5484, "train_tokens_per_second": 29250.239 }, { "epoch": 2.633479800180006, "grad_norm": 0.61328125, "learning_rate": 1.720775371604345e-05, "loss": 0.38469562530517576, "num_input_tokens_seen": 21169072000, "step": 74430, "train_runtime": 723721.837, "train_tokens_per_second": 29250.288 }, { "epoch": 2.6338336204437347, "grad_norm": 0.6328125, "learning_rate": 1.7206734740024123e-05, "loss": 0.38969926834106444, "num_input_tokens_seen": 21171826496, "step": 74440, "train_runtime": 723816.3905, "train_tokens_per_second": 29250.272 }, { "epoch": 2.6341874407074637, "grad_norm": 0.62109375, "learning_rate": 1.7205715945002714e-05, "loss": 0.385995888710022, "num_input_tokens_seen": 21174732928, "step": 74450, "train_runtime": 723917.2761, "train_tokens_per_second": 29250.211 }, { "epoch": 2.6345412609711922, "grad_norm": 0.6328125, "learning_rate": 1.720469733092564e-05, "loss": 0.38598835468292236, "num_input_tokens_seen": 21177572160, "step": 74460, "train_runtime": 724010.6643, "train_tokens_per_second": 29250.359 }, { "epoch": 2.634895081234921, "grad_norm": 0.62890625, "learning_rate": 1.7203678897739344e-05, "loss": 0.3873575687408447, "num_input_tokens_seen": 21180421568, "step": 74470, "train_runtime": 724109.7653, "train_tokens_per_second": 29250.291 }, { "epoch": 2.6352489014986498, "grad_norm": 0.65625, "learning_rate": 1.72026606453903e-05, "loss": 0.3840164661407471, "num_input_tokens_seen": 21183226624, "step": 74480, "train_runtime": 724205.8702, "train_tokens_per_second": 29250.283 }, { "epoch": 2.6356027217623788, "grad_norm": 0.58984375, "learning_rate": 1.7201642573824997e-05, "loss": 0.3837096691131592, "num_input_tokens_seen": 21186133120, "step": 74490, "train_runtime": 724304.8472, "train_tokens_per_second": 29250.299 }, { "epoch": 2.6359565420261077, "grad_norm": 0.625, "learning_rate": 1.7200624682989938e-05, "loss": 0.38433451652526857, "num_input_tokens_seen": 21188933696, "step": 74500, "train_runtime": 724400.8244, "train_tokens_per_second": 29250.289 }, { "epoch": 2.6363103622898363, "grad_norm": 0.62890625, "learning_rate": 1.7199606972831665e-05, "loss": 0.38067963123321535, "num_input_tokens_seen": 21191812480, "step": 74510, "train_runtime": 724498.8213, "train_tokens_per_second": 29250.306 }, { "epoch": 2.636664182553565, "grad_norm": 0.6015625, "learning_rate": 1.7198589443296727e-05, "loss": 0.3851020336151123, "num_input_tokens_seen": 21194666944, "step": 74520, "train_runtime": 724596.4691, "train_tokens_per_second": 29250.304 }, { "epoch": 2.637018002817294, "grad_norm": 0.61328125, "learning_rate": 1.7197572094331708e-05, "loss": 0.3846184730529785, "num_input_tokens_seen": 21197567488, "step": 74530, "train_runtime": 724697.0592, "train_tokens_per_second": 29250.246 }, { "epoch": 2.637371823081023, "grad_norm": 0.6171875, "learning_rate": 1.7196554925883205e-05, "loss": 0.3866997957229614, "num_input_tokens_seen": 21200438720, "step": 74540, "train_runtime": 724796.5692, "train_tokens_per_second": 29250.192 }, { "epoch": 2.6377256433447513, "grad_norm": 0.625, "learning_rate": 1.719553793789784e-05, "loss": 0.3820904016494751, "num_input_tokens_seen": 21203302528, "step": 74550, "train_runtime": 724895.4851, "train_tokens_per_second": 29250.151 }, { "epoch": 2.6380794636084803, "grad_norm": 0.609375, "learning_rate": 1.7194521130322257e-05, "loss": 0.38410923480987547, "num_input_tokens_seen": 21206112320, "step": 74560, "train_runtime": 724991.5268, "train_tokens_per_second": 29250.152 }, { "epoch": 2.638433283872209, "grad_norm": 0.625, "learning_rate": 1.719350450310313e-05, "loss": 0.3834213733673096, "num_input_tokens_seen": 21208951360, "step": 74570, "train_runtime": 725088.4165, "train_tokens_per_second": 29250.159 }, { "epoch": 2.638787104135938, "grad_norm": 0.6328125, "learning_rate": 1.719248805618713e-05, "loss": 0.38759140968322753, "num_input_tokens_seen": 21211793536, "step": 74580, "train_runtime": 725183.3092, "train_tokens_per_second": 29250.251 }, { "epoch": 2.6391409243996664, "grad_norm": 0.61328125, "learning_rate": 1.7191471789520986e-05, "loss": 0.3907924652099609, "num_input_tokens_seen": 21214634752, "step": 74590, "train_runtime": 725281.0295, "train_tokens_per_second": 29250.227 }, { "epoch": 2.6394947446633954, "grad_norm": 0.625, "learning_rate": 1.7190455703051418e-05, "loss": 0.3893891334533691, "num_input_tokens_seen": 21217478016, "step": 74600, "train_runtime": 725378.3345, "train_tokens_per_second": 29250.223 }, { "epoch": 2.639848564927124, "grad_norm": 0.62109375, "learning_rate": 1.718943979672519e-05, "loss": 0.38451220989227297, "num_input_tokens_seen": 21220320320, "step": 74610, "train_runtime": 725475.615, "train_tokens_per_second": 29250.219 }, { "epoch": 2.640202385190853, "grad_norm": 0.6015625, "learning_rate": 1.7188424070489067e-05, "loss": 0.38333878517150877, "num_input_tokens_seen": 21223128576, "step": 74620, "train_runtime": 725571.6979, "train_tokens_per_second": 29250.216 }, { "epoch": 2.6405562054545815, "grad_norm": 0.61328125, "learning_rate": 1.718740852428986e-05, "loss": 0.39389753341674805, "num_input_tokens_seen": 21226022720, "step": 74630, "train_runtime": 725670.6523, "train_tokens_per_second": 29250.215 }, { "epoch": 2.6409100257183105, "grad_norm": 0.60546875, "learning_rate": 1.7186393158074376e-05, "loss": 0.38661441802978513, "num_input_tokens_seen": 21228902464, "step": 74640, "train_runtime": 725771.621, "train_tokens_per_second": 29250.114 }, { "epoch": 2.6412638459820394, "grad_norm": 0.6171875, "learning_rate": 1.7185377971789472e-05, "loss": 0.38412113189697267, "num_input_tokens_seen": 21231730240, "step": 74650, "train_runtime": 725866.4709, "train_tokens_per_second": 29250.187 }, { "epoch": 2.641617666245768, "grad_norm": 0.6015625, "learning_rate": 1.7184362965382004e-05, "loss": 0.38910865783691406, "num_input_tokens_seen": 21234550016, "step": 74660, "train_runtime": 725960.4556, "train_tokens_per_second": 29250.285 }, { "epoch": 2.6419714865094965, "grad_norm": 0.6171875, "learning_rate": 1.7183348138798857e-05, "loss": 0.3888072490692139, "num_input_tokens_seen": 21237429248, "step": 74670, "train_runtime": 726059.1722, "train_tokens_per_second": 29250.273 }, { "epoch": 2.6423253067732255, "grad_norm": 0.62890625, "learning_rate": 1.7182333491986944e-05, "loss": 0.3864339590072632, "num_input_tokens_seen": 21240264064, "step": 74680, "train_runtime": 726156.2351, "train_tokens_per_second": 29250.267 }, { "epoch": 2.6426791270369545, "grad_norm": 0.6015625, "learning_rate": 1.7181319024893197e-05, "loss": 0.38910503387451173, "num_input_tokens_seen": 21243128064, "step": 74690, "train_runtime": 726254.749, "train_tokens_per_second": 29250.243 }, { "epoch": 2.643032947300683, "grad_norm": 0.59765625, "learning_rate": 1.7180304737464563e-05, "loss": 0.38635969161987305, "num_input_tokens_seen": 21245930688, "step": 74700, "train_runtime": 726351.2687, "train_tokens_per_second": 29250.215 }, { "epoch": 2.6433867675644116, "grad_norm": 0.63671875, "learning_rate": 1.717929062964802e-05, "loss": 0.3903571605682373, "num_input_tokens_seen": 21248833792, "step": 74710, "train_runtime": 726452.2539, "train_tokens_per_second": 29250.145 }, { "epoch": 2.6437405878281406, "grad_norm": 0.625, "learning_rate": 1.7178276701390557e-05, "loss": 0.38762946128845216, "num_input_tokens_seen": 21251690944, "step": 74720, "train_runtime": 726549.0079, "train_tokens_per_second": 29250.182 }, { "epoch": 2.6440944080918696, "grad_norm": 0.62890625, "learning_rate": 1.7177262952639204e-05, "loss": 0.3850399017333984, "num_input_tokens_seen": 21254541952, "step": 74730, "train_runtime": 726648.3875, "train_tokens_per_second": 29250.105 }, { "epoch": 2.644448228355598, "grad_norm": 0.6015625, "learning_rate": 1.7176249383340994e-05, "loss": 0.3854344129562378, "num_input_tokens_seen": 21257403136, "step": 74740, "train_runtime": 726745.6114, "train_tokens_per_second": 29250.129 }, { "epoch": 2.644802048619327, "grad_norm": 0.63671875, "learning_rate": 1.7175235993442985e-05, "loss": 0.39130709171295164, "num_input_tokens_seen": 21260179008, "step": 74750, "train_runtime": 726836.1137, "train_tokens_per_second": 29250.306 }, { "epoch": 2.6451558688830556, "grad_norm": 0.60546875, "learning_rate": 1.7174222782892264e-05, "loss": 0.3896197319030762, "num_input_tokens_seen": 21262949312, "step": 74760, "train_runtime": 726930.9648, "train_tokens_per_second": 29250.301 }, { "epoch": 2.6455096891467846, "grad_norm": 0.6328125, "learning_rate": 1.717320975163594e-05, "loss": 0.38497314453125, "num_input_tokens_seen": 21265767488, "step": 74770, "train_runtime": 727026.3698, "train_tokens_per_second": 29250.339 }, { "epoch": 2.645863509410513, "grad_norm": 0.62890625, "learning_rate": 1.717219689962114e-05, "loss": 0.3902001857757568, "num_input_tokens_seen": 21268573504, "step": 74780, "train_runtime": 727121.5073, "train_tokens_per_second": 29250.371 }, { "epoch": 2.646217329674242, "grad_norm": 0.63671875, "learning_rate": 1.717118422679501e-05, "loss": 0.3815563201904297, "num_input_tokens_seen": 21271434688, "step": 74790, "train_runtime": 727217.5015, "train_tokens_per_second": 29250.444 }, { "epoch": 2.646571149937971, "grad_norm": 0.6171875, "learning_rate": 1.7170171733104716e-05, "loss": 0.3863277196884155, "num_input_tokens_seen": 21274258048, "step": 74800, "train_runtime": 727313.467, "train_tokens_per_second": 29250.466 }, { "epoch": 2.6469249702016997, "grad_norm": 0.609375, "learning_rate": 1.7169159418497464e-05, "loss": 0.3851405143737793, "num_input_tokens_seen": 21277078912, "step": 74810, "train_runtime": 727410.0677, "train_tokens_per_second": 29250.46 }, { "epoch": 2.6472787904654282, "grad_norm": 0.61328125, "learning_rate": 1.716814728292046e-05, "loss": 0.3886796712875366, "num_input_tokens_seen": 21279938368, "step": 74820, "train_runtime": 727506.3182, "train_tokens_per_second": 29250.52 }, { "epoch": 2.6476326107291572, "grad_norm": 0.609375, "learning_rate": 1.716713532632094e-05, "loss": 0.3882636785507202, "num_input_tokens_seen": 21282810560, "step": 74830, "train_runtime": 727604.8263, "train_tokens_per_second": 29250.508 }, { "epoch": 2.647986430992886, "grad_norm": 0.6171875, "learning_rate": 1.7166123548646162e-05, "loss": 0.39129340648651123, "num_input_tokens_seen": 21285690624, "step": 74840, "train_runtime": 727705.8786, "train_tokens_per_second": 29250.404 }, { "epoch": 2.6483402512566148, "grad_norm": 0.62109375, "learning_rate": 1.7165111949843414e-05, "loss": 0.3841498613357544, "num_input_tokens_seen": 21288509504, "step": 74850, "train_runtime": 727804.0111, "train_tokens_per_second": 29250.333 }, { "epoch": 2.6486940715203433, "grad_norm": 0.60546875, "learning_rate": 1.7164100529859983e-05, "loss": 0.38797218799591066, "num_input_tokens_seen": 21291339008, "step": 74860, "train_runtime": 727899.496, "train_tokens_per_second": 29250.383 }, { "epoch": 2.6490478917840723, "grad_norm": 0.62109375, "learning_rate": 1.7163089288643202e-05, "loss": 0.3857181787490845, "num_input_tokens_seen": 21294160896, "step": 74870, "train_runtime": 727997.6187, "train_tokens_per_second": 29250.317 }, { "epoch": 2.6494017120478013, "grad_norm": 0.6171875, "learning_rate": 1.716207822614042e-05, "loss": 0.3836466073989868, "num_input_tokens_seen": 21296970304, "step": 74880, "train_runtime": 728093.2564, "train_tokens_per_second": 29250.333 }, { "epoch": 2.64975553231153, "grad_norm": 0.61328125, "learning_rate": 1.7161067342298994e-05, "loss": 0.3877160310745239, "num_input_tokens_seen": 21299887296, "step": 74890, "train_runtime": 728194.6684, "train_tokens_per_second": 29250.265 }, { "epoch": 2.650109352575259, "grad_norm": 0.61328125, "learning_rate": 1.716005663706632e-05, "loss": 0.3892143726348877, "num_input_tokens_seen": 21302715392, "step": 74900, "train_runtime": 728292.0218, "train_tokens_per_second": 29250.239 }, { "epoch": 2.6504631728389874, "grad_norm": 0.6171875, "learning_rate": 1.71590461103898e-05, "loss": 0.3806128025054932, "num_input_tokens_seen": 21305607168, "step": 74910, "train_runtime": 728391.0476, "train_tokens_per_second": 29250.232 }, { "epoch": 2.6508169931027163, "grad_norm": 0.65625, "learning_rate": 1.7158035762216875e-05, "loss": 0.39104580879211426, "num_input_tokens_seen": 21308404736, "step": 74920, "train_runtime": 728485.5838, "train_tokens_per_second": 29250.276 }, { "epoch": 2.651170813366445, "grad_norm": 0.625, "learning_rate": 1.715702559249499e-05, "loss": 0.39225139617919924, "num_input_tokens_seen": 21311278016, "step": 74930, "train_runtime": 728583.7065, "train_tokens_per_second": 29250.281 }, { "epoch": 2.651524633630174, "grad_norm": 0.609375, "learning_rate": 1.715601560117163e-05, "loss": 0.38332881927490237, "num_input_tokens_seen": 21314162560, "step": 74940, "train_runtime": 728685.6618, "train_tokens_per_second": 29250.147 }, { "epoch": 2.6518784538939024, "grad_norm": 0.60546875, "learning_rate": 1.7155005788194283e-05, "loss": 0.387650203704834, "num_input_tokens_seen": 21317031872, "step": 74950, "train_runtime": 728785.7536, "train_tokens_per_second": 29250.067 }, { "epoch": 2.6522322741576314, "grad_norm": 0.65625, "learning_rate": 1.7153996153510472e-05, "loss": 0.38602781295776367, "num_input_tokens_seen": 21319871040, "step": 74960, "train_runtime": 728884.1089, "train_tokens_per_second": 29250.015 }, { "epoch": 2.65258609442136, "grad_norm": 0.60546875, "learning_rate": 1.7152986697067734e-05, "loss": 0.3877532958984375, "num_input_tokens_seen": 21322697536, "step": 74970, "train_runtime": 728982.092, "train_tokens_per_second": 29249.961 }, { "epoch": 2.652939914685089, "grad_norm": 0.6171875, "learning_rate": 1.7151977418813636e-05, "loss": 0.3876424551010132, "num_input_tokens_seen": 21325580480, "step": 74980, "train_runtime": 729081.5034, "train_tokens_per_second": 29249.927 }, { "epoch": 2.653293734948818, "grad_norm": 0.59765625, "learning_rate": 1.7150968318695755e-05, "loss": 0.38400471210479736, "num_input_tokens_seen": 21328386432, "step": 74990, "train_runtime": 729176.1206, "train_tokens_per_second": 29249.979 }, { "epoch": 2.6536475552125465, "grad_norm": 0.62109375, "learning_rate": 1.7149959396661695e-05, "loss": 0.38516504764556886, "num_input_tokens_seen": 21331230016, "step": 75000, "train_runtime": 729272.3207, "train_tokens_per_second": 29250.02 }, { "epoch": 2.6536475552125465, "eval_loss": 0.33609068393707275, "eval_runtime": 8.43, "eval_samples_per_second": 473.072, "eval_steps_per_second": 3.796, "num_input_tokens_seen": 21331230016, "step": 75000 }, { "epoch": 2.654001375476275, "grad_norm": 0.61328125, "learning_rate": 1.714895065265909e-05, "loss": 0.38525369167327883, "num_input_tokens_seen": 21334045504, "step": 75010, "train_runtime": 729397.8039, "train_tokens_per_second": 29248.848 }, { "epoch": 2.654355195740004, "grad_norm": 0.60546875, "learning_rate": 1.7147942086635584e-05, "loss": 0.3812159299850464, "num_input_tokens_seen": 21336892864, "step": 75020, "train_runtime": 729496.1851, "train_tokens_per_second": 29248.807 }, { "epoch": 2.654709016003733, "grad_norm": 0.61328125, "learning_rate": 1.7146933698538846e-05, "loss": 0.38089590072631835, "num_input_tokens_seen": 21339728320, "step": 75030, "train_runtime": 729589.9907, "train_tokens_per_second": 29248.932 }, { "epoch": 2.6550628362674615, "grad_norm": 0.62890625, "learning_rate": 1.714592548831657e-05, "loss": 0.384178900718689, "num_input_tokens_seen": 21342609664, "step": 75040, "train_runtime": 729690.0074, "train_tokens_per_second": 29248.872 }, { "epoch": 2.6554166565311905, "grad_norm": 0.63671875, "learning_rate": 1.7144917455916462e-05, "loss": 0.3812519311904907, "num_input_tokens_seen": 21345477696, "step": 75050, "train_runtime": 729788.6767, "train_tokens_per_second": 29248.847 }, { "epoch": 2.655770476794919, "grad_norm": 0.59375, "learning_rate": 1.7143909601286258e-05, "loss": 0.3848569393157959, "num_input_tokens_seen": 21348371520, "step": 75060, "train_runtime": 729889.5555, "train_tokens_per_second": 29248.77 }, { "epoch": 2.656124297058648, "grad_norm": 0.578125, "learning_rate": 1.714290192437372e-05, "loss": 0.3827219486236572, "num_input_tokens_seen": 21351214976, "step": 75070, "train_runtime": 729989.5144, "train_tokens_per_second": 29248.66 }, { "epoch": 2.6564781173223766, "grad_norm": 0.62109375, "learning_rate": 1.7141894425126622e-05, "loss": 0.3897125244140625, "num_input_tokens_seen": 21354111424, "step": 75080, "train_runtime": 730090.7149, "train_tokens_per_second": 29248.573 }, { "epoch": 2.6568319375861056, "grad_norm": 0.6171875, "learning_rate": 1.714088710349276e-05, "loss": 0.3853651285171509, "num_input_tokens_seen": 21356917824, "step": 75090, "train_runtime": 730184.6421, "train_tokens_per_second": 29248.654 }, { "epoch": 2.657185757849834, "grad_norm": 0.59375, "learning_rate": 1.7139879959419956e-05, "loss": 0.38927493095397947, "num_input_tokens_seen": 21359767360, "step": 75100, "train_runtime": 730281.1719, "train_tokens_per_second": 29248.69 }, { "epoch": 2.657539578113563, "grad_norm": 0.58984375, "learning_rate": 1.7138872992856052e-05, "loss": 0.38738260269165037, "num_input_tokens_seen": 21362590848, "step": 75110, "train_runtime": 730377.8378, "train_tokens_per_second": 29248.684 }, { "epoch": 2.6578933983772917, "grad_norm": 0.62890625, "learning_rate": 1.7137866203748908e-05, "loss": 0.3886084079742432, "num_input_tokens_seen": 21365424768, "step": 75120, "train_runtime": 730472.7639, "train_tokens_per_second": 29248.763 }, { "epoch": 2.6582472186410206, "grad_norm": 0.625, "learning_rate": 1.7136859592046407e-05, "loss": 0.3856485366821289, "num_input_tokens_seen": 21368230656, "step": 75130, "train_runtime": 730568.0745, "train_tokens_per_second": 29248.788 }, { "epoch": 2.6586010389047496, "grad_norm": 0.6015625, "learning_rate": 1.7135853157696462e-05, "loss": 0.3815124988555908, "num_input_tokens_seen": 21371087424, "step": 75140, "train_runtime": 730668.3444, "train_tokens_per_second": 29248.684 }, { "epoch": 2.658954859168478, "grad_norm": 0.64453125, "learning_rate": 1.7134846900647e-05, "loss": 0.38549108505249025, "num_input_tokens_seen": 21373933824, "step": 75150, "train_runtime": 730764.2045, "train_tokens_per_second": 29248.742 }, { "epoch": 2.6593086794322067, "grad_norm": 0.58203125, "learning_rate": 1.713384082084596e-05, "loss": 0.38742890357971194, "num_input_tokens_seen": 21376792704, "step": 75160, "train_runtime": 730860.7498, "train_tokens_per_second": 29248.79 }, { "epoch": 2.6596624996959357, "grad_norm": 0.61328125, "learning_rate": 1.713283491824132e-05, "loss": 0.3921644687652588, "num_input_tokens_seen": 21379616256, "step": 75170, "train_runtime": 730953.7484, "train_tokens_per_second": 29248.932 }, { "epoch": 2.6600163199596647, "grad_norm": 0.61328125, "learning_rate": 1.713182919278107e-05, "loss": 0.3826498031616211, "num_input_tokens_seen": 21382498624, "step": 75180, "train_runtime": 731056.1849, "train_tokens_per_second": 29248.776 }, { "epoch": 2.6603701402233932, "grad_norm": 0.61328125, "learning_rate": 1.7130823644413222e-05, "loss": 0.3903824806213379, "num_input_tokens_seen": 21385420160, "step": 75190, "train_runtime": 731156.5335, "train_tokens_per_second": 29248.758 }, { "epoch": 2.660723960487122, "grad_norm": 0.62890625, "learning_rate": 1.712981827308581e-05, "loss": 0.384019660949707, "num_input_tokens_seen": 21388258624, "step": 75200, "train_runtime": 731253.0597, "train_tokens_per_second": 29248.778 }, { "epoch": 2.6610777807508508, "grad_norm": 0.625, "learning_rate": 1.712881307874689e-05, "loss": 0.3902750968933105, "num_input_tokens_seen": 21391087168, "step": 75210, "train_runtime": 731351.5875, "train_tokens_per_second": 29248.705 }, { "epoch": 2.6614316010145798, "grad_norm": 0.65625, "learning_rate": 1.712780806134454e-05, "loss": 0.3889188766479492, "num_input_tokens_seen": 21393891648, "step": 75220, "train_runtime": 731445.3455, "train_tokens_per_second": 29248.79 }, { "epoch": 2.6617854212783083, "grad_norm": 0.61328125, "learning_rate": 1.7126803220826854e-05, "loss": 0.3854790687561035, "num_input_tokens_seen": 21396704512, "step": 75230, "train_runtime": 731541.3849, "train_tokens_per_second": 29248.796 }, { "epoch": 2.6621392415420373, "grad_norm": 0.609375, "learning_rate": 1.7125798557141954e-05, "loss": 0.3865359783172607, "num_input_tokens_seen": 21399525952, "step": 75240, "train_runtime": 731637.1957, "train_tokens_per_second": 29248.822 }, { "epoch": 2.662493061805766, "grad_norm": 0.60546875, "learning_rate": 1.7124794070237987e-05, "loss": 0.38853440284729, "num_input_tokens_seen": 21402350976, "step": 75250, "train_runtime": 731731.2279, "train_tokens_per_second": 29248.924 }, { "epoch": 2.662846882069495, "grad_norm": 0.65625, "learning_rate": 1.71237897600631e-05, "loss": 0.3857755184173584, "num_input_tokens_seen": 21405216576, "step": 75260, "train_runtime": 731829.119, "train_tokens_per_second": 29248.927 }, { "epoch": 2.6632007023332234, "grad_norm": 0.6171875, "learning_rate": 1.7122785626565498e-05, "loss": 0.3863802909851074, "num_input_tokens_seen": 21408015360, "step": 75270, "train_runtime": 731923.1369, "train_tokens_per_second": 29248.994 }, { "epoch": 2.6635545225969524, "grad_norm": 0.625, "learning_rate": 1.7121781669693363e-05, "loss": 0.3834370613098145, "num_input_tokens_seen": 21410867392, "step": 75280, "train_runtime": 732021.8677, "train_tokens_per_second": 29248.945 }, { "epoch": 2.663908342860681, "grad_norm": 0.61328125, "learning_rate": 1.7120777889394933e-05, "loss": 0.38622612953186036, "num_input_tokens_seen": 21413760192, "step": 75290, "train_runtime": 732120.2308, "train_tokens_per_second": 29248.967 }, { "epoch": 2.66426216312441, "grad_norm": 0.62890625, "learning_rate": 1.711977428561845e-05, "loss": 0.38889827728271487, "num_input_tokens_seen": 21416683264, "step": 75300, "train_runtime": 732222.6123, "train_tokens_per_second": 29248.869 }, { "epoch": 2.6646159833881384, "grad_norm": 0.6328125, "learning_rate": 1.7118770858312188e-05, "loss": 0.38661072254180906, "num_input_tokens_seen": 21419519360, "step": 75310, "train_runtime": 732320.4496, "train_tokens_per_second": 29248.834 }, { "epoch": 2.6649698036518674, "grad_norm": 0.59765625, "learning_rate": 1.7117767607424434e-05, "loss": 0.38426618576049804, "num_input_tokens_seen": 21422421760, "step": 75320, "train_runtime": 732419.5605, "train_tokens_per_second": 29248.839 }, { "epoch": 2.6653236239155964, "grad_norm": 0.59765625, "learning_rate": 1.71167645329035e-05, "loss": 0.38428621292114257, "num_input_tokens_seen": 21425259456, "step": 75330, "train_runtime": 732513.224, "train_tokens_per_second": 29248.973 }, { "epoch": 2.665677444179325, "grad_norm": 0.6171875, "learning_rate": 1.7115761634697715e-05, "loss": 0.3917688846588135, "num_input_tokens_seen": 21428091328, "step": 75340, "train_runtime": 732610.3699, "train_tokens_per_second": 29248.96 }, { "epoch": 2.6660312644430535, "grad_norm": 0.625, "learning_rate": 1.7114758912755432e-05, "loss": 0.38284454345703123, "num_input_tokens_seen": 21430920960, "step": 75350, "train_runtime": 732709.8049, "train_tokens_per_second": 29248.852 }, { "epoch": 2.6663850847067825, "grad_norm": 0.6328125, "learning_rate": 1.7113756367025033e-05, "loss": 0.386495566368103, "num_input_tokens_seen": 21433734336, "step": 75360, "train_runtime": 732804.12, "train_tokens_per_second": 29248.927 }, { "epoch": 2.6667389049705115, "grad_norm": 0.609375, "learning_rate": 1.71127539974549e-05, "loss": 0.3837636947631836, "num_input_tokens_seen": 21436544064, "step": 75370, "train_runtime": 732898.6519, "train_tokens_per_second": 29248.988 }, { "epoch": 2.66709272523424, "grad_norm": 0.6484375, "learning_rate": 1.711175180399346e-05, "loss": 0.38471112251281736, "num_input_tokens_seen": 21439364224, "step": 75380, "train_runtime": 732991.7175, "train_tokens_per_second": 29249.122 }, { "epoch": 2.667446545497969, "grad_norm": 0.640625, "learning_rate": 1.7110749786589146e-05, "loss": 0.3879976749420166, "num_input_tokens_seen": 21442223744, "step": 75390, "train_runtime": 733091.8995, "train_tokens_per_second": 29249.026 }, { "epoch": 2.6678003657616975, "grad_norm": 0.64453125, "learning_rate": 1.7109747945190424e-05, "loss": 0.38988304138183594, "num_input_tokens_seen": 21445103360, "step": 75400, "train_runtime": 733193.5064, "train_tokens_per_second": 29248.9 }, { "epoch": 2.6681541860254265, "grad_norm": 0.61328125, "learning_rate": 1.7108746279745763e-05, "loss": 0.3864877223968506, "num_input_tokens_seen": 21447920640, "step": 75410, "train_runtime": 733289.3641, "train_tokens_per_second": 29248.918 }, { "epoch": 2.668508006289155, "grad_norm": 0.625, "learning_rate": 1.7107744790203676e-05, "loss": 0.3839066505432129, "num_input_tokens_seen": 21450836416, "step": 75420, "train_runtime": 733392.1899, "train_tokens_per_second": 29248.793 }, { "epoch": 2.668861826552884, "grad_norm": 0.625, "learning_rate": 1.7106743476512673e-05, "loss": 0.3884526491165161, "num_input_tokens_seen": 21453674560, "step": 75430, "train_runtime": 733487.0433, "train_tokens_per_second": 29248.88 }, { "epoch": 2.6692156468166126, "grad_norm": 0.65625, "learning_rate": 1.71057423386213e-05, "loss": 0.387351393699646, "num_input_tokens_seen": 21456513792, "step": 75440, "train_runtime": 733580.8536, "train_tokens_per_second": 29249.01 }, { "epoch": 2.6695694670803416, "grad_norm": 0.60546875, "learning_rate": 1.7104741376478137e-05, "loss": 0.3889933586120605, "num_input_tokens_seen": 21459358976, "step": 75450, "train_runtime": 733678.4985, "train_tokens_per_second": 29248.995 }, { "epoch": 2.66992328734407, "grad_norm": 0.609375, "learning_rate": 1.710374059003175e-05, "loss": 0.3874448299407959, "num_input_tokens_seen": 21462132352, "step": 75460, "train_runtime": 733772.7353, "train_tokens_per_second": 29249.019 }, { "epoch": 2.670277107607799, "grad_norm": 0.61328125, "learning_rate": 1.7102739979230753e-05, "loss": 0.3866525173187256, "num_input_tokens_seen": 21464969152, "step": 75470, "train_runtime": 733871.4709, "train_tokens_per_second": 29248.949 }, { "epoch": 2.670630927871528, "grad_norm": 0.61328125, "learning_rate": 1.7101739544023772e-05, "loss": 0.38673057556152346, "num_input_tokens_seen": 21467774336, "step": 75480, "train_runtime": 733965.1097, "train_tokens_per_second": 29249.039 }, { "epoch": 2.6709847481352567, "grad_norm": 0.62890625, "learning_rate": 1.7100739284359464e-05, "loss": 0.3853473663330078, "num_input_tokens_seen": 21470656000, "step": 75490, "train_runtime": 734063.6275, "train_tokens_per_second": 29249.039 }, { "epoch": 2.671338568398985, "grad_norm": 0.6171875, "learning_rate": 1.7099739200186484e-05, "loss": 0.38706963062286376, "num_input_tokens_seen": 21473521728, "step": 75500, "train_runtime": 734159.6334, "train_tokens_per_second": 29249.118 }, { "epoch": 2.671692388662714, "grad_norm": 0.62109375, "learning_rate": 1.7098739291453537e-05, "loss": 0.38556981086730957, "num_input_tokens_seen": 21476320704, "step": 75510, "train_runtime": 734254.1466, "train_tokens_per_second": 29249.165 }, { "epoch": 2.672046208926443, "grad_norm": 0.6171875, "learning_rate": 1.7097739558109325e-05, "loss": 0.3881751537322998, "num_input_tokens_seen": 21479090432, "step": 75520, "train_runtime": 734346.9563, "train_tokens_per_second": 29249.24 }, { "epoch": 2.6724000291901717, "grad_norm": 0.63671875, "learning_rate": 1.709674000010258e-05, "loss": 0.38916056156158446, "num_input_tokens_seen": 21482007488, "step": 75530, "train_runtime": 734451.0781, "train_tokens_per_second": 29249.065 }, { "epoch": 2.6727538494539003, "grad_norm": 0.6328125, "learning_rate": 1.7095740617382063e-05, "loss": 0.3858955860137939, "num_input_tokens_seen": 21484823488, "step": 75540, "train_runtime": 734544.1078, "train_tokens_per_second": 29249.195 }, { "epoch": 2.6731076697176293, "grad_norm": 0.62890625, "learning_rate": 1.7094741409896546e-05, "loss": 0.3860058307647705, "num_input_tokens_seen": 21487602816, "step": 75550, "train_runtime": 734637.1399, "train_tokens_per_second": 29249.274 }, { "epoch": 2.6734614899813582, "grad_norm": 0.61328125, "learning_rate": 1.709374237759482e-05, "loss": 0.3865677356719971, "num_input_tokens_seen": 21490430208, "step": 75560, "train_runtime": 734734.4625, "train_tokens_per_second": 29249.248 }, { "epoch": 2.673815310245087, "grad_norm": 0.5859375, "learning_rate": 1.7092743520425707e-05, "loss": 0.3832091808319092, "num_input_tokens_seen": 21493338944, "step": 75570, "train_runtime": 734836.4788, "train_tokens_per_second": 29249.145 }, { "epoch": 2.6741691305088158, "grad_norm": 0.609375, "learning_rate": 1.709174483833804e-05, "loss": 0.39235196113586424, "num_input_tokens_seen": 21496185408, "step": 75580, "train_runtime": 734932.0085, "train_tokens_per_second": 29249.216 }, { "epoch": 2.6745229507725443, "grad_norm": 0.625, "learning_rate": 1.7090746331280686e-05, "loss": 0.3864452838897705, "num_input_tokens_seen": 21499051008, "step": 75590, "train_runtime": 735029.5198, "train_tokens_per_second": 29249.235 }, { "epoch": 2.6748767710362733, "grad_norm": 0.60546875, "learning_rate": 1.708974799920251e-05, "loss": 0.38420858383178713, "num_input_tokens_seen": 21501881216, "step": 75600, "train_runtime": 735126.5475, "train_tokens_per_second": 29249.224 }, { "epoch": 2.675230591300002, "grad_norm": 0.6015625, "learning_rate": 1.7088749842052426e-05, "loss": 0.38848147392272947, "num_input_tokens_seen": 21504745920, "step": 75610, "train_runtime": 735226.1882, "train_tokens_per_second": 29249.157 }, { "epoch": 2.675584411563731, "grad_norm": 0.62890625, "learning_rate": 1.708775185977935e-05, "loss": 0.3859638452529907, "num_input_tokens_seen": 21507583360, "step": 75620, "train_runtime": 735322.6778, "train_tokens_per_second": 29249.177 }, { "epoch": 2.67593823182746, "grad_norm": 0.62109375, "learning_rate": 1.7086754052332214e-05, "loss": 0.38794145584106443, "num_input_tokens_seen": 21510452928, "step": 75630, "train_runtime": 735421.0076, "train_tokens_per_second": 29249.168 }, { "epoch": 2.6762920520911884, "grad_norm": 0.62109375, "learning_rate": 1.7085756419659995e-05, "loss": 0.3890834331512451, "num_input_tokens_seen": 21513343104, "step": 75640, "train_runtime": 735517.6428, "train_tokens_per_second": 29249.255 }, { "epoch": 2.676645872354917, "grad_norm": 0.62109375, "learning_rate": 1.7084758961711672e-05, "loss": 0.38825201988220215, "num_input_tokens_seen": 21516211328, "step": 75650, "train_runtime": 735616.2345, "train_tokens_per_second": 29249.234 }, { "epoch": 2.676999692618646, "grad_norm": 0.63671875, "learning_rate": 1.708376167843625e-05, "loss": 0.385071325302124, "num_input_tokens_seen": 21519057920, "step": 75660, "train_runtime": 735712.5886, "train_tokens_per_second": 29249.272 }, { "epoch": 2.677353512882375, "grad_norm": 0.625, "learning_rate": 1.708276456978275e-05, "loss": 0.3842024803161621, "num_input_tokens_seen": 21521913728, "step": 75670, "train_runtime": 735808.9764, "train_tokens_per_second": 29249.322 }, { "epoch": 2.6777073331461034, "grad_norm": 0.59765625, "learning_rate": 1.7081767635700222e-05, "loss": 0.38241674900054934, "num_input_tokens_seen": 21524808512, "step": 75680, "train_runtime": 735908.1923, "train_tokens_per_second": 29249.312 }, { "epoch": 2.678061153409832, "grad_norm": 0.62109375, "learning_rate": 1.7080770876137737e-05, "loss": 0.3874392509460449, "num_input_tokens_seen": 21527647104, "step": 75690, "train_runtime": 736004.7949, "train_tokens_per_second": 29249.33 }, { "epoch": 2.678414973673561, "grad_norm": 0.63671875, "learning_rate": 1.707977429104437e-05, "loss": 0.3857190847396851, "num_input_tokens_seen": 21530510784, "step": 75700, "train_runtime": 736101.7731, "train_tokens_per_second": 29249.367 }, { "epoch": 2.67876879393729, "grad_norm": 0.62890625, "learning_rate": 1.7078777880369244e-05, "loss": 0.3850836277008057, "num_input_tokens_seen": 21533340544, "step": 75710, "train_runtime": 736195.6083, "train_tokens_per_second": 29249.482 }, { "epoch": 2.6791226142010185, "grad_norm": 0.62109375, "learning_rate": 1.7077781644061477e-05, "loss": 0.3871301651000977, "num_input_tokens_seen": 21536198336, "step": 75720, "train_runtime": 736291.3738, "train_tokens_per_second": 29249.559 }, { "epoch": 2.6794764344647475, "grad_norm": 0.6015625, "learning_rate": 1.7076785582070228e-05, "loss": 0.38590035438537595, "num_input_tokens_seen": 21539043904, "step": 75730, "train_runtime": 736388.1521, "train_tokens_per_second": 29249.58 }, { "epoch": 2.679830254728476, "grad_norm": 0.59375, "learning_rate": 1.7075789694344664e-05, "loss": 0.38796091079711914, "num_input_tokens_seen": 21541908672, "step": 75740, "train_runtime": 736485.0552, "train_tokens_per_second": 29249.621 }, { "epoch": 2.680184074992205, "grad_norm": 0.6328125, "learning_rate": 1.7074793980833974e-05, "loss": 0.38872604370117186, "num_input_tokens_seen": 21544763392, "step": 75750, "train_runtime": 736584.0186, "train_tokens_per_second": 29249.567 }, { "epoch": 2.6805378952559336, "grad_norm": 0.6328125, "learning_rate": 1.7073798441487372e-05, "loss": 0.3832289934158325, "num_input_tokens_seen": 21547567424, "step": 75760, "train_runtime": 736677.5667, "train_tokens_per_second": 29249.659 }, { "epoch": 2.6808917155196625, "grad_norm": 0.61328125, "learning_rate": 1.7072803076254092e-05, "loss": 0.3870734214782715, "num_input_tokens_seen": 21550345856, "step": 75770, "train_runtime": 736769.8855, "train_tokens_per_second": 29249.765 }, { "epoch": 2.681245535783391, "grad_norm": 0.625, "learning_rate": 1.707180788508339e-05, "loss": 0.38754122257232665, "num_input_tokens_seen": 21553202816, "step": 75780, "train_runtime": 736866.9507, "train_tokens_per_second": 29249.789 }, { "epoch": 2.68159935604712, "grad_norm": 0.60546875, "learning_rate": 1.707081286792454e-05, "loss": 0.38608517646789553, "num_input_tokens_seen": 21556086656, "step": 75790, "train_runtime": 736966.306, "train_tokens_per_second": 29249.759 }, { "epoch": 2.6819531763108486, "grad_norm": 0.64453125, "learning_rate": 1.7069818024726833e-05, "loss": 0.38488450050354006, "num_input_tokens_seen": 21558929152, "step": 75800, "train_runtime": 737063.7975, "train_tokens_per_second": 29249.746 }, { "epoch": 2.6823069965745776, "grad_norm": 0.6328125, "learning_rate": 1.7068823355439583e-05, "loss": 0.38973703384399416, "num_input_tokens_seen": 21561794176, "step": 75810, "train_runtime": 737159.3135, "train_tokens_per_second": 29249.843 }, { "epoch": 2.6826608168383066, "grad_norm": 0.60546875, "learning_rate": 1.7067828860012138e-05, "loss": 0.3831465244293213, "num_input_tokens_seen": 21564658624, "step": 75820, "train_runtime": 737259.1402, "train_tokens_per_second": 29249.768 }, { "epoch": 2.683014637102035, "grad_norm": 0.62109375, "learning_rate": 1.7066834538393844e-05, "loss": 0.38516356945037844, "num_input_tokens_seen": 21567477376, "step": 75830, "train_runtime": 737356.0075, "train_tokens_per_second": 29249.748 }, { "epoch": 2.6833684573657637, "grad_norm": 0.62109375, "learning_rate": 1.7065840390534083e-05, "loss": 0.3875086307525635, "num_input_tokens_seen": 21570292608, "step": 75840, "train_runtime": 737452.2396, "train_tokens_per_second": 29249.749 }, { "epoch": 2.6837222776294927, "grad_norm": 0.6484375, "learning_rate": 1.7064846416382256e-05, "loss": 0.38725829124450684, "num_input_tokens_seen": 21573104320, "step": 75850, "train_runtime": 737547.3803, "train_tokens_per_second": 29249.788 }, { "epoch": 2.6840760978932217, "grad_norm": 0.6171875, "learning_rate": 1.7063852615887773e-05, "loss": 0.38848841190338135, "num_input_tokens_seen": 21575921984, "step": 75860, "train_runtime": 737642.3321, "train_tokens_per_second": 29249.842 }, { "epoch": 2.68442991815695, "grad_norm": 0.62109375, "learning_rate": 1.7062858989000085e-05, "loss": 0.3879056930541992, "num_input_tokens_seen": 21578773568, "step": 75870, "train_runtime": 737740.1067, "train_tokens_per_second": 29249.831 }, { "epoch": 2.684783738420679, "grad_norm": 0.6015625, "learning_rate": 1.7061865535668645e-05, "loss": 0.38703012466430664, "num_input_tokens_seen": 21581601600, "step": 75880, "train_runtime": 737834.5643, "train_tokens_per_second": 29249.919 }, { "epoch": 2.6851375586844077, "grad_norm": 0.609375, "learning_rate": 1.706087225584294e-05, "loss": 0.38229732513427733, "num_input_tokens_seen": 21584469952, "step": 75890, "train_runtime": 737933.8026, "train_tokens_per_second": 29249.873 }, { "epoch": 2.6854913789481367, "grad_norm": 0.60546875, "learning_rate": 1.7059879149472464e-05, "loss": 0.38459124565124514, "num_input_tokens_seen": 21587296640, "step": 75900, "train_runtime": 738029.3646, "train_tokens_per_second": 29249.916 }, { "epoch": 2.6858451992118653, "grad_norm": 0.5859375, "learning_rate": 1.7058886216506746e-05, "loss": 0.38746132850646975, "num_input_tokens_seen": 21590111808, "step": 75910, "train_runtime": 738122.8953, "train_tokens_per_second": 29250.023 }, { "epoch": 2.6861990194755943, "grad_norm": 0.609375, "learning_rate": 1.705789345689532e-05, "loss": 0.38462421894073484, "num_input_tokens_seen": 21592972352, "step": 75920, "train_runtime": 738221.9809, "train_tokens_per_second": 29249.972 }, { "epoch": 2.686552839739323, "grad_norm": 0.63671875, "learning_rate": 1.705690087058776e-05, "loss": 0.38400309085845946, "num_input_tokens_seen": 21595827328, "step": 75930, "train_runtime": 738319.6262, "train_tokens_per_second": 29249.971 }, { "epoch": 2.686906660003052, "grad_norm": 0.6484375, "learning_rate": 1.7055908457533644e-05, "loss": 0.39088256359100343, "num_input_tokens_seen": 21598685184, "step": 75940, "train_runtime": 738419.7646, "train_tokens_per_second": 29249.874 }, { "epoch": 2.6872604802667803, "grad_norm": 0.6171875, "learning_rate": 1.7054916217682577e-05, "loss": 0.386277437210083, "num_input_tokens_seen": 21601495360, "step": 75950, "train_runtime": 738516.6758, "train_tokens_per_second": 29249.841 }, { "epoch": 2.6876143005305093, "grad_norm": 0.640625, "learning_rate": 1.7053924150984184e-05, "loss": 0.38320021629333495, "num_input_tokens_seen": 21604312000, "step": 75960, "train_runtime": 738613.4068, "train_tokens_per_second": 29249.824 }, { "epoch": 2.6879681207942383, "grad_norm": 0.609375, "learning_rate": 1.7052932257388107e-05, "loss": 0.3878506660461426, "num_input_tokens_seen": 21607158528, "step": 75970, "train_runtime": 738710.598, "train_tokens_per_second": 29249.829 }, { "epoch": 2.688321941057967, "grad_norm": 0.64453125, "learning_rate": 1.7051940536844015e-05, "loss": 0.3887681484222412, "num_input_tokens_seen": 21609980864, "step": 75980, "train_runtime": 738806.5576, "train_tokens_per_second": 29249.85 }, { "epoch": 2.6886757613216954, "grad_norm": 0.6171875, "learning_rate": 1.7050948989301595e-05, "loss": 0.3843262195587158, "num_input_tokens_seen": 21612790976, "step": 75990, "train_runtime": 738903.3475, "train_tokens_per_second": 29249.821 }, { "epoch": 2.6890295815854244, "grad_norm": 0.62890625, "learning_rate": 1.7049957614710553e-05, "loss": 0.38376855850219727, "num_input_tokens_seen": 21615594560, "step": 76000, "train_runtime": 738997.8071, "train_tokens_per_second": 29249.876 }, { "epoch": 2.6893834018491534, "grad_norm": 0.60546875, "learning_rate": 1.7048966413020613e-05, "loss": 0.38604605197906494, "num_input_tokens_seen": 21618415616, "step": 76010, "train_runtime": 739094.7889, "train_tokens_per_second": 29249.855 }, { "epoch": 2.689737222112882, "grad_norm": 0.62109375, "learning_rate": 1.704797538418153e-05, "loss": 0.38668999671936033, "num_input_tokens_seen": 21621306880, "step": 76020, "train_runtime": 739192.3123, "train_tokens_per_second": 29249.908 }, { "epoch": 2.6900910423766105, "grad_norm": 0.6015625, "learning_rate": 1.7046984528143065e-05, "loss": 0.38678865432739257, "num_input_tokens_seen": 21624121792, "step": 76030, "train_runtime": 739286.5256, "train_tokens_per_second": 29249.988 }, { "epoch": 2.6904448626403394, "grad_norm": 0.609375, "learning_rate": 1.7045993844855012e-05, "loss": 0.385788106918335, "num_input_tokens_seen": 21626982592, "step": 76040, "train_runtime": 739382.4385, "train_tokens_per_second": 29250.063 }, { "epoch": 2.6907986829040684, "grad_norm": 0.62109375, "learning_rate": 1.7045003334267175e-05, "loss": 0.3811150550842285, "num_input_tokens_seen": 21629820416, "step": 76050, "train_runtime": 739480.0209, "train_tokens_per_second": 29250.04 }, { "epoch": 2.691152503167797, "grad_norm": 0.6328125, "learning_rate": 1.704401299632939e-05, "loss": 0.38633582592010496, "num_input_tokens_seen": 21632654976, "step": 76060, "train_runtime": 739577.6041, "train_tokens_per_second": 29250.014 }, { "epoch": 2.691506323431526, "grad_norm": 0.64453125, "learning_rate": 1.7043022830991498e-05, "loss": 0.379053521156311, "num_input_tokens_seen": 21635567616, "step": 76070, "train_runtime": 739678.8977, "train_tokens_per_second": 29249.946 }, { "epoch": 2.6918601436952545, "grad_norm": 0.63671875, "learning_rate": 1.7042032838203372e-05, "loss": 0.3882865905761719, "num_input_tokens_seen": 21638366592, "step": 76080, "train_runtime": 739774.4354, "train_tokens_per_second": 29249.952 }, { "epoch": 2.6922139639589835, "grad_norm": 0.609375, "learning_rate": 1.7041043017914912e-05, "loss": 0.3874474048614502, "num_input_tokens_seen": 21641229952, "step": 76090, "train_runtime": 739872.5146, "train_tokens_per_second": 29249.944 }, { "epoch": 2.692567784222712, "grad_norm": 0.625, "learning_rate": 1.7040053370076014e-05, "loss": 0.38727507591247556, "num_input_tokens_seen": 21644022464, "step": 76100, "train_runtime": 739968.0229, "train_tokens_per_second": 29249.943 }, { "epoch": 2.692921604486441, "grad_norm": 0.62109375, "learning_rate": 1.703906389463662e-05, "loss": 0.3891221284866333, "num_input_tokens_seen": 21646869952, "step": 76110, "train_runtime": 740066.1051, "train_tokens_per_second": 29249.914 }, { "epoch": 2.6932754247501696, "grad_norm": 0.6328125, "learning_rate": 1.703807459154668e-05, "loss": 0.38599109649658203, "num_input_tokens_seen": 21649738432, "step": 76120, "train_runtime": 740166.7922, "train_tokens_per_second": 29249.811 }, { "epoch": 2.6936292450138986, "grad_norm": 0.625, "learning_rate": 1.703708546075616e-05, "loss": 0.388598108291626, "num_input_tokens_seen": 21652608960, "step": 76130, "train_runtime": 740265.112, "train_tokens_per_second": 29249.803 }, { "epoch": 2.693983065277627, "grad_norm": 0.6171875, "learning_rate": 1.7036096502215064e-05, "loss": 0.385296106338501, "num_input_tokens_seen": 21655470272, "step": 76140, "train_runtime": 740361.3112, "train_tokens_per_second": 29249.868 }, { "epoch": 2.694336885541356, "grad_norm": 0.625, "learning_rate": 1.703510771587339e-05, "loss": 0.3901038646697998, "num_input_tokens_seen": 21658332672, "step": 76150, "train_runtime": 740456.8869, "train_tokens_per_second": 29249.958 }, { "epoch": 2.694690705805085, "grad_norm": 0.61328125, "learning_rate": 1.703411910168118e-05, "loss": 0.38502204418182373, "num_input_tokens_seen": 21661167552, "step": 76160, "train_runtime": 740551.2079, "train_tokens_per_second": 29250.06 }, { "epoch": 2.6950445260688136, "grad_norm": 0.640625, "learning_rate": 1.7033130659588486e-05, "loss": 0.3832906007766724, "num_input_tokens_seen": 21663979008, "step": 76170, "train_runtime": 740645.8342, "train_tokens_per_second": 29250.119 }, { "epoch": 2.695398346332542, "grad_norm": 0.60546875, "learning_rate": 1.703214238954538e-05, "loss": 0.38453123569488523, "num_input_tokens_seen": 21666785984, "step": 76180, "train_runtime": 740739.2266, "train_tokens_per_second": 29250.221 }, { "epoch": 2.695752166596271, "grad_norm": 0.59375, "learning_rate": 1.7031154291501962e-05, "loss": 0.3841399192810059, "num_input_tokens_seen": 21669590656, "step": 76190, "train_runtime": 740833.1431, "train_tokens_per_second": 29250.299 }, { "epoch": 2.69610598686, "grad_norm": 0.6015625, "learning_rate": 1.7030166365408335e-05, "loss": 0.39055495262145995, "num_input_tokens_seen": 21672408704, "step": 76200, "train_runtime": 740927.035, "train_tokens_per_second": 29250.395 }, { "epoch": 2.6964598071237287, "grad_norm": 0.62109375, "learning_rate": 1.702917861121464e-05, "loss": 0.3875312328338623, "num_input_tokens_seen": 21675227200, "step": 76210, "train_runtime": 741020.3775, "train_tokens_per_second": 29250.514 }, { "epoch": 2.6968136273874577, "grad_norm": 0.63671875, "learning_rate": 1.7028191028871033e-05, "loss": 0.38333899974823, "num_input_tokens_seen": 21678019072, "step": 76220, "train_runtime": 741113.9961, "train_tokens_per_second": 29250.587 }, { "epoch": 2.697167447651186, "grad_norm": 0.640625, "learning_rate": 1.7027203618327685e-05, "loss": 0.3813507080078125, "num_input_tokens_seen": 21680876416, "step": 76230, "train_runtime": 741213.6737, "train_tokens_per_second": 29250.508 }, { "epoch": 2.697521267914915, "grad_norm": 0.6796875, "learning_rate": 1.7026216379534793e-05, "loss": 0.3822087049484253, "num_input_tokens_seen": 21683763584, "step": 76240, "train_runtime": 741315.0653, "train_tokens_per_second": 29250.402 }, { "epoch": 2.6978750881786437, "grad_norm": 0.6015625, "learning_rate": 1.7025229312442577e-05, "loss": 0.38779416084289553, "num_input_tokens_seen": 21686638080, "step": 76250, "train_runtime": 741414.8495, "train_tokens_per_second": 29250.342 }, { "epoch": 2.6982289084423727, "grad_norm": 0.60546875, "learning_rate": 1.702424241700126e-05, "loss": 0.3850146770477295, "num_input_tokens_seen": 21689497024, "step": 76260, "train_runtime": 741512.6553, "train_tokens_per_second": 29250.34 }, { "epoch": 2.6985827287061013, "grad_norm": 0.58984375, "learning_rate": 1.702325569316111e-05, "loss": 0.3861421585083008, "num_input_tokens_seen": 21692301504, "step": 76270, "train_runtime": 741607.6974, "train_tokens_per_second": 29250.373 }, { "epoch": 2.6989365489698303, "grad_norm": 0.640625, "learning_rate": 1.702226914087239e-05, "loss": 0.38536500930786133, "num_input_tokens_seen": 21695201088, "step": 76280, "train_runtime": 741708.8022, "train_tokens_per_second": 29250.295 }, { "epoch": 2.699290369233559, "grad_norm": 0.65625, "learning_rate": 1.7021282760085415e-05, "loss": 0.38678975105285646, "num_input_tokens_seen": 21698053248, "step": 76290, "train_runtime": 741810.9373, "train_tokens_per_second": 29250.112 }, { "epoch": 2.699644189497288, "grad_norm": 0.59765625, "learning_rate": 1.7020296550750485e-05, "loss": 0.38616104125976564, "num_input_tokens_seen": 21700865984, "step": 76300, "train_runtime": 741907.1691, "train_tokens_per_second": 29250.11 }, { "epoch": 2.699998009761017, "grad_norm": 0.625, "learning_rate": 1.7019310512817936e-05, "loss": 0.38514184951782227, "num_input_tokens_seen": 21703666688, "step": 76310, "train_runtime": 742002.9235, "train_tokens_per_second": 29250.109 }, { "epoch": 2.7003518300247453, "grad_norm": 0.62890625, "learning_rate": 1.7018324646238134e-05, "loss": 0.38914012908935547, "num_input_tokens_seen": 21706505600, "step": 76320, "train_runtime": 742100.5754, "train_tokens_per_second": 29250.086 }, { "epoch": 2.700705650288474, "grad_norm": 0.5859375, "learning_rate": 1.7017338950961455e-05, "loss": 0.3854983329772949, "num_input_tokens_seen": 21709358976, "step": 76330, "train_runtime": 742198.521, "train_tokens_per_second": 29250.07 }, { "epoch": 2.701059470552203, "grad_norm": 0.62890625, "learning_rate": 1.7016353426938287e-05, "loss": 0.3853592872619629, "num_input_tokens_seen": 21712215616, "step": 76340, "train_runtime": 742297.553, "train_tokens_per_second": 29250.016 }, { "epoch": 2.701413290815932, "grad_norm": 0.63671875, "learning_rate": 1.701536807411905e-05, "loss": 0.38556020259857177, "num_input_tokens_seen": 21715044352, "step": 76350, "train_runtime": 742394.2885, "train_tokens_per_second": 29250.015 }, { "epoch": 2.7017671110796604, "grad_norm": 0.6015625, "learning_rate": 1.7014382892454186e-05, "loss": 0.39275150299072265, "num_input_tokens_seen": 21717864448, "step": 76360, "train_runtime": 742488.8151, "train_tokens_per_second": 29250.09 }, { "epoch": 2.702120931343389, "grad_norm": 0.62109375, "learning_rate": 1.7013397881894147e-05, "loss": 0.386823034286499, "num_input_tokens_seen": 21720737600, "step": 76370, "train_runtime": 742587.7526, "train_tokens_per_second": 29250.062 }, { "epoch": 2.702474751607118, "grad_norm": 0.6328125, "learning_rate": 1.701241304238941e-05, "loss": 0.3873495578765869, "num_input_tokens_seen": 21723578752, "step": 76380, "train_runtime": 742688.2047, "train_tokens_per_second": 29249.931 }, { "epoch": 2.702828571870847, "grad_norm": 0.625, "learning_rate": 1.7011428373890478e-05, "loss": 0.3863509178161621, "num_input_tokens_seen": 21726396992, "step": 76390, "train_runtime": 742784.1663, "train_tokens_per_second": 29249.946 }, { "epoch": 2.7031823921345755, "grad_norm": 0.640625, "learning_rate": 1.7010443876347863e-05, "loss": 0.3863941431045532, "num_input_tokens_seen": 21729171008, "step": 76400, "train_runtime": 742877.763, "train_tokens_per_second": 29249.995 }, { "epoch": 2.7035362123983044, "grad_norm": 0.6328125, "learning_rate": 1.70094595497121e-05, "loss": 0.38391761779785155, "num_input_tokens_seen": 21731987520, "step": 76410, "train_runtime": 742974.2451, "train_tokens_per_second": 29249.988 }, { "epoch": 2.703890032662033, "grad_norm": 0.60546875, "learning_rate": 1.700847539393375e-05, "loss": 0.39025249481201174, "num_input_tokens_seen": 21734839360, "step": 76420, "train_runtime": 743074.4538, "train_tokens_per_second": 29249.881 }, { "epoch": 2.704243852925762, "grad_norm": 0.61328125, "learning_rate": 1.7007491408963392e-05, "loss": 0.3919255256652832, "num_input_tokens_seen": 21737673280, "step": 76430, "train_runtime": 743170.6731, "train_tokens_per_second": 29249.907 }, { "epoch": 2.7045976731894905, "grad_norm": 0.62890625, "learning_rate": 1.7006507594751617e-05, "loss": 0.3894176959991455, "num_input_tokens_seen": 21740469248, "step": 76440, "train_runtime": 743264.5521, "train_tokens_per_second": 29249.975 }, { "epoch": 2.7049514934532195, "grad_norm": 0.62890625, "learning_rate": 1.7005523951249047e-05, "loss": 0.3877555847167969, "num_input_tokens_seen": 21743335360, "step": 76450, "train_runtime": 743361.1243, "train_tokens_per_second": 29250.03 }, { "epoch": 2.705305313716948, "grad_norm": 0.62890625, "learning_rate": 1.700454047840632e-05, "loss": 0.3856799125671387, "num_input_tokens_seen": 21746228608, "step": 76460, "train_runtime": 743463.7112, "train_tokens_per_second": 29249.886 }, { "epoch": 2.705659133980677, "grad_norm": 0.62109375, "learning_rate": 1.700355717617409e-05, "loss": 0.3885051250457764, "num_input_tokens_seen": 21749065088, "step": 76470, "train_runtime": 743561.4273, "train_tokens_per_second": 29249.857 }, { "epoch": 2.7060129542444056, "grad_norm": 0.6015625, "learning_rate": 1.7002574044503038e-05, "loss": 0.3870185613632202, "num_input_tokens_seen": 21751911296, "step": 76480, "train_runtime": 743659.804, "train_tokens_per_second": 29249.814 }, { "epoch": 2.7063667745081346, "grad_norm": 0.6328125, "learning_rate": 1.7001591083343853e-05, "loss": 0.38483624458312987, "num_input_tokens_seen": 21754742208, "step": 76490, "train_runtime": 743757.1695, "train_tokens_per_second": 29249.792 }, { "epoch": 2.7067205947718636, "grad_norm": 0.61328125, "learning_rate": 1.700060829264726e-05, "loss": 0.38583059310913087, "num_input_tokens_seen": 21757582848, "step": 76500, "train_runtime": 743853.5949, "train_tokens_per_second": 29249.819 }, { "epoch": 2.707074415035592, "grad_norm": 0.62890625, "learning_rate": 1.6999625672363997e-05, "loss": 0.38498797416687014, "num_input_tokens_seen": 21760409728, "step": 76510, "train_runtime": 743950.4095, "train_tokens_per_second": 29249.812 }, { "epoch": 2.7074282352993206, "grad_norm": 0.6328125, "learning_rate": 1.699864322244482e-05, "loss": 0.38719921112060546, "num_input_tokens_seen": 21763204672, "step": 76520, "train_runtime": 744045.2425, "train_tokens_per_second": 29249.841 }, { "epoch": 2.7077820555630496, "grad_norm": 0.6015625, "learning_rate": 1.6997660942840497e-05, "loss": 0.38466825485229494, "num_input_tokens_seen": 21766003712, "step": 76530, "train_runtime": 744137.7869, "train_tokens_per_second": 29249.964 }, { "epoch": 2.7081358758267786, "grad_norm": 0.62109375, "learning_rate": 1.6996678833501832e-05, "loss": 0.38578386306762696, "num_input_tokens_seen": 21768833600, "step": 76540, "train_runtime": 744234.5362, "train_tokens_per_second": 29249.964 }, { "epoch": 2.708489696090507, "grad_norm": 0.62109375, "learning_rate": 1.699569689437965e-05, "loss": 0.38596031665802, "num_input_tokens_seen": 21771657984, "step": 76550, "train_runtime": 744330.6372, "train_tokens_per_second": 29249.982 }, { "epoch": 2.708843516354236, "grad_norm": 0.58984375, "learning_rate": 1.699471512542477e-05, "loss": 0.38004016876220703, "num_input_tokens_seen": 21774478912, "step": 76560, "train_runtime": 744427.5824, "train_tokens_per_second": 29249.963 }, { "epoch": 2.7091973366179647, "grad_norm": 0.66796875, "learning_rate": 1.6993733526588064e-05, "loss": 0.38650059700012207, "num_input_tokens_seen": 21777322304, "step": 76570, "train_runtime": 744524.8378, "train_tokens_per_second": 29249.961 }, { "epoch": 2.7095511568816937, "grad_norm": 0.59765625, "learning_rate": 1.6992752097820396e-05, "loss": 0.38565430641174314, "num_input_tokens_seen": 21780193088, "step": 76580, "train_runtime": 744623.2876, "train_tokens_per_second": 29249.949 }, { "epoch": 2.7099049771454222, "grad_norm": 0.609375, "learning_rate": 1.699177083907267e-05, "loss": 0.3872755765914917, "num_input_tokens_seen": 21783066048, "step": 76590, "train_runtime": 744720.8747, "train_tokens_per_second": 29249.974 }, { "epoch": 2.710258797409151, "grad_norm": 0.64453125, "learning_rate": 1.6990789750295798e-05, "loss": 0.3843536853790283, "num_input_tokens_seen": 21785906688, "step": 76600, "train_runtime": 744817.0564, "train_tokens_per_second": 29250.01 }, { "epoch": 2.7106126176728798, "grad_norm": 0.640625, "learning_rate": 1.6989808831440724e-05, "loss": 0.3836094856262207, "num_input_tokens_seen": 21788675264, "step": 76610, "train_runtime": 744910.1321, "train_tokens_per_second": 29250.072 }, { "epoch": 2.7109664379366087, "grad_norm": 0.61328125, "learning_rate": 1.6988828082458395e-05, "loss": 0.38330371379852296, "num_input_tokens_seen": 21791558400, "step": 76620, "train_runtime": 745008.4164, "train_tokens_per_second": 29250.084 }, { "epoch": 2.7113202582003373, "grad_norm": 0.6015625, "learning_rate": 1.6987847503299786e-05, "loss": 0.3911462306976318, "num_input_tokens_seen": 21794476480, "step": 76630, "train_runtime": 745109.581, "train_tokens_per_second": 29250.029 }, { "epoch": 2.7116740784640663, "grad_norm": 0.625, "learning_rate": 1.6986867093915897e-05, "loss": 0.3838812828063965, "num_input_tokens_seen": 21797305600, "step": 76640, "train_runtime": 745204.5384, "train_tokens_per_second": 29250.098 }, { "epoch": 2.7120278987277953, "grad_norm": 0.625, "learning_rate": 1.6985886854257746e-05, "loss": 0.38353514671325684, "num_input_tokens_seen": 21800140032, "step": 76650, "train_runtime": 745301.4313, "train_tokens_per_second": 29250.098 }, { "epoch": 2.712381718991524, "grad_norm": 0.60546875, "learning_rate": 1.6984906784276358e-05, "loss": 0.38346195220947266, "num_input_tokens_seen": 21802975936, "step": 76660, "train_runtime": 745397.5088, "train_tokens_per_second": 29250.133 }, { "epoch": 2.7127355392552523, "grad_norm": 0.6328125, "learning_rate": 1.6983926883922794e-05, "loss": 0.3906045913696289, "num_input_tokens_seen": 21805830272, "step": 76670, "train_runtime": 745493.0547, "train_tokens_per_second": 29250.213 }, { "epoch": 2.7130893595189813, "grad_norm": 0.62890625, "learning_rate": 1.698294715314813e-05, "loss": 0.3925213575363159, "num_input_tokens_seen": 21808682048, "step": 76680, "train_runtime": 745592.4224, "train_tokens_per_second": 29250.139 }, { "epoch": 2.7134431797827103, "grad_norm": 0.6171875, "learning_rate": 1.6981967591903456e-05, "loss": 0.3881517887115479, "num_input_tokens_seen": 21811552832, "step": 76690, "train_runtime": 745691.328, "train_tokens_per_second": 29250.109 }, { "epoch": 2.713797000046439, "grad_norm": 0.60546875, "learning_rate": 1.6980988200139892e-05, "loss": 0.3868730068206787, "num_input_tokens_seen": 21814358976, "step": 76700, "train_runtime": 745783.3234, "train_tokens_per_second": 29250.264 }, { "epoch": 2.7141508203101674, "grad_norm": 0.6484375, "learning_rate": 1.698000897780856e-05, "loss": 0.3928858757019043, "num_input_tokens_seen": 21817212736, "step": 76710, "train_runtime": 745881.1323, "train_tokens_per_second": 29250.254 }, { "epoch": 2.7145046405738964, "grad_norm": 0.625, "learning_rate": 1.6979029924860625e-05, "loss": 0.3907364845275879, "num_input_tokens_seen": 21820037248, "step": 76720, "train_runtime": 745977.6706, "train_tokens_per_second": 29250.255 }, { "epoch": 2.7148584608376254, "grad_norm": 0.64453125, "learning_rate": 1.6978051041247257e-05, "loss": 0.3829702854156494, "num_input_tokens_seen": 21822866944, "step": 76730, "train_runtime": 746072.5581, "train_tokens_per_second": 29250.328 }, { "epoch": 2.715212281101354, "grad_norm": 0.6015625, "learning_rate": 1.6977072326919648e-05, "loss": 0.3784936904907227, "num_input_tokens_seen": 21825739008, "step": 76740, "train_runtime": 746171.6832, "train_tokens_per_second": 29250.291 }, { "epoch": 2.715566101365083, "grad_norm": 0.63671875, "learning_rate": 1.6976093781829007e-05, "loss": 0.38403844833374023, "num_input_tokens_seen": 21828614784, "step": 76750, "train_runtime": 746271.5175, "train_tokens_per_second": 29250.232 }, { "epoch": 2.7159199216288115, "grad_norm": 0.609375, "learning_rate": 1.697511540592657e-05, "loss": 0.3903098821640015, "num_input_tokens_seen": 21831440576, "step": 76760, "train_runtime": 746370.6037, "train_tokens_per_second": 29250.135 }, { "epoch": 2.7162737418925404, "grad_norm": 0.59375, "learning_rate": 1.6974137199163594e-05, "loss": 0.3891082763671875, "num_input_tokens_seen": 21834287296, "step": 76770, "train_runtime": 746468.3147, "train_tokens_per_second": 29250.119 }, { "epoch": 2.716627562156269, "grad_norm": 0.625, "learning_rate": 1.697315916149134e-05, "loss": 0.38273158073425295, "num_input_tokens_seen": 21837165440, "step": 76780, "train_runtime": 746569.9871, "train_tokens_per_second": 29249.991 }, { "epoch": 2.716981382419998, "grad_norm": 0.6171875, "learning_rate": 1.6972181292861104e-05, "loss": 0.38473920822143554, "num_input_tokens_seen": 21839997568, "step": 76790, "train_runtime": 746666.3219, "train_tokens_per_second": 29250.01 }, { "epoch": 2.717335202683727, "grad_norm": 0.61328125, "learning_rate": 1.6971203593224196e-05, "loss": 0.38906278610229494, "num_input_tokens_seen": 21842827200, "step": 76800, "train_runtime": 746761.8053, "train_tokens_per_second": 29250.059 }, { "epoch": 2.7176890229474555, "grad_norm": 0.6171875, "learning_rate": 1.6970226062531953e-05, "loss": 0.3868934869766235, "num_input_tokens_seen": 21845663168, "step": 76810, "train_runtime": 746856.0429, "train_tokens_per_second": 29250.166 }, { "epoch": 2.718042843211184, "grad_norm": 0.609375, "learning_rate": 1.6969248700735715e-05, "loss": 0.3909526109695435, "num_input_tokens_seen": 21848520832, "step": 76820, "train_runtime": 746956.4496, "train_tokens_per_second": 29250.06 }, { "epoch": 2.718396663474913, "grad_norm": 0.625, "learning_rate": 1.6968271507786855e-05, "loss": 0.38682026863098146, "num_input_tokens_seen": 21851369344, "step": 76830, "train_runtime": 747055.7265, "train_tokens_per_second": 29249.986 }, { "epoch": 2.718750483738642, "grad_norm": 0.58203125, "learning_rate": 1.696729448363677e-05, "loss": 0.3850741386413574, "num_input_tokens_seen": 21854241984, "step": 76840, "train_runtime": 747152.8527, "train_tokens_per_second": 29250.028 }, { "epoch": 2.7191043040023706, "grad_norm": 0.64453125, "learning_rate": 1.6966317628236856e-05, "loss": 0.3836874008178711, "num_input_tokens_seen": 21857128640, "step": 76850, "train_runtime": 747251.3663, "train_tokens_per_second": 29250.035 }, { "epoch": 2.719458124266099, "grad_norm": 0.62890625, "learning_rate": 1.6965340941538545e-05, "loss": 0.3817173957824707, "num_input_tokens_seen": 21860015104, "step": 76860, "train_runtime": 747350.8908, "train_tokens_per_second": 29250.002 }, { "epoch": 2.719811944529828, "grad_norm": 0.58203125, "learning_rate": 1.6964364423493297e-05, "loss": 0.38294711112976076, "num_input_tokens_seen": 21862857920, "step": 76870, "train_runtime": 747448.484, "train_tokens_per_second": 29249.986 }, { "epoch": 2.720165764793557, "grad_norm": 0.640625, "learning_rate": 1.6963388074052565e-05, "loss": 0.3841033220291138, "num_input_tokens_seen": 21865689920, "step": 76880, "train_runtime": 747545.2345, "train_tokens_per_second": 29249.989 }, { "epoch": 2.7205195850572856, "grad_norm": 0.609375, "learning_rate": 1.696241189316784e-05, "loss": 0.38262276649475097, "num_input_tokens_seen": 21868568512, "step": 76890, "train_runtime": 747644.7313, "train_tokens_per_second": 29249.947 }, { "epoch": 2.7208734053210146, "grad_norm": 0.60546875, "learning_rate": 1.696143588079063e-05, "loss": 0.3831918239593506, "num_input_tokens_seen": 21871420864, "step": 76900, "train_runtime": 747744.3292, "train_tokens_per_second": 29249.865 }, { "epoch": 2.721227225584743, "grad_norm": 0.6328125, "learning_rate": 1.6960460036872468e-05, "loss": 0.3868118762969971, "num_input_tokens_seen": 21874252096, "step": 76910, "train_runtime": 747838.2979, "train_tokens_per_second": 29249.976 }, { "epoch": 2.721581045848472, "grad_norm": 0.58984375, "learning_rate": 1.6959484361364888e-05, "loss": 0.3924058437347412, "num_input_tokens_seen": 21877093760, "step": 76920, "train_runtime": 747933.5293, "train_tokens_per_second": 29250.051 }, { "epoch": 2.7219348661122007, "grad_norm": 0.62109375, "learning_rate": 1.6958508854219458e-05, "loss": 0.3860179901123047, "num_input_tokens_seen": 21879918656, "step": 76930, "train_runtime": 748030.5029, "train_tokens_per_second": 29250.035 }, { "epoch": 2.7222886863759297, "grad_norm": 0.62890625, "learning_rate": 1.6957533515387773e-05, "loss": 0.3884253025054932, "num_input_tokens_seen": 21882779904, "step": 76940, "train_runtime": 748127.9297, "train_tokens_per_second": 29250.051 }, { "epoch": 2.7226425066396582, "grad_norm": 0.65234375, "learning_rate": 1.6956558344821422e-05, "loss": 0.3865114688873291, "num_input_tokens_seen": 21885640960, "step": 76950, "train_runtime": 748226.2766, "train_tokens_per_second": 29250.03 }, { "epoch": 2.722996326903387, "grad_norm": 0.6328125, "learning_rate": 1.695558334247204e-05, "loss": 0.39028191566467285, "num_input_tokens_seen": 21888424064, "step": 76960, "train_runtime": 748319.5775, "train_tokens_per_second": 29250.102 }, { "epoch": 2.7233501471671158, "grad_norm": 0.60546875, "learning_rate": 1.6954608508291262e-05, "loss": 0.3842151165008545, "num_input_tokens_seen": 21891334464, "step": 76970, "train_runtime": 748422.6426, "train_tokens_per_second": 29249.963 }, { "epoch": 2.7237039674308448, "grad_norm": 0.6015625, "learning_rate": 1.6953633842230755e-05, "loss": 0.38736732006073, "num_input_tokens_seen": 21894168512, "step": 76980, "train_runtime": 748518.0486, "train_tokens_per_second": 29250.021 }, { "epoch": 2.7240577876945737, "grad_norm": 0.59375, "learning_rate": 1.6952659344242205e-05, "loss": 0.38971450328826907, "num_input_tokens_seen": 21896982784, "step": 76990, "train_runtime": 748615.3145, "train_tokens_per_second": 29249.98 }, { "epoch": 2.7244116079583023, "grad_norm": 0.640625, "learning_rate": 1.6951685014277307e-05, "loss": 0.3848890781402588, "num_input_tokens_seen": 21899842432, "step": 77000, "train_runtime": 748714.9969, "train_tokens_per_second": 29249.905 }, { "epoch": 2.724765428222031, "grad_norm": 0.66015625, "learning_rate": 1.6950710852287785e-05, "loss": 0.38681445121765134, "num_input_tokens_seen": 21902723712, "step": 77010, "train_runtime": 748814.7742, "train_tokens_per_second": 29249.855 }, { "epoch": 2.72511924848576, "grad_norm": 0.625, "learning_rate": 1.694973685822538e-05, "loss": 0.391303563117981, "num_input_tokens_seen": 21905556736, "step": 77020, "train_runtime": 748915.068, "train_tokens_per_second": 29249.721 }, { "epoch": 2.725473068749489, "grad_norm": 0.62109375, "learning_rate": 1.694876303204185e-05, "loss": 0.3900762557983398, "num_input_tokens_seen": 21908415424, "step": 77030, "train_runtime": 749011.9566, "train_tokens_per_second": 29249.754 }, { "epoch": 2.7258268890132173, "grad_norm": 0.609375, "learning_rate": 1.694778937368897e-05, "loss": 0.3882468223571777, "num_input_tokens_seen": 21911277504, "step": 77040, "train_runtime": 749111.3282, "train_tokens_per_second": 29249.695 }, { "epoch": 2.7261807092769463, "grad_norm": 0.58984375, "learning_rate": 1.694681588311855e-05, "loss": 0.38852438926696775, "num_input_tokens_seen": 21914132480, "step": 77050, "train_runtime": 749209.0818, "train_tokens_per_second": 29249.689 }, { "epoch": 2.726534529540675, "grad_norm": 0.65625, "learning_rate": 1.69458425602824e-05, "loss": 0.38608083724975584, "num_input_tokens_seen": 21917014848, "step": 77060, "train_runtime": 749308.3396, "train_tokens_per_second": 29249.661 }, { "epoch": 2.726888349804404, "grad_norm": 0.61328125, "learning_rate": 1.6944869405132355e-05, "loss": 0.38509140014648435, "num_input_tokens_seen": 21919817088, "step": 77070, "train_runtime": 749403.5247, "train_tokens_per_second": 29249.685 }, { "epoch": 2.7272421700681324, "grad_norm": 0.6015625, "learning_rate": 1.6943896417620272e-05, "loss": 0.38679819107055663, "num_input_tokens_seen": 21922673088, "step": 77080, "train_runtime": 749503.2182, "train_tokens_per_second": 29249.605 }, { "epoch": 2.7275959903318614, "grad_norm": 0.60546875, "learning_rate": 1.6942923597698035e-05, "loss": 0.38493216037750244, "num_input_tokens_seen": 21925522880, "step": 77090, "train_runtime": 749599.3769, "train_tokens_per_second": 29249.655 }, { "epoch": 2.72794981059559, "grad_norm": 0.6484375, "learning_rate": 1.6941950945317536e-05, "loss": 0.3853883743286133, "num_input_tokens_seen": 21928275456, "step": 77100, "train_runtime": 749689.7128, "train_tokens_per_second": 29249.802 }, { "epoch": 2.728303630859319, "grad_norm": 0.625, "learning_rate": 1.6940978460430684e-05, "loss": 0.38822784423828127, "num_input_tokens_seen": 21931067648, "step": 77110, "train_runtime": 749782.9327, "train_tokens_per_second": 29249.889 }, { "epoch": 2.7286574511230475, "grad_norm": 0.65234375, "learning_rate": 1.694000614298942e-05, "loss": 0.3830754518508911, "num_input_tokens_seen": 21933895808, "step": 77120, "train_runtime": 749878.0472, "train_tokens_per_second": 29249.951 }, { "epoch": 2.7290112713867765, "grad_norm": 0.6640625, "learning_rate": 1.6939033992945697e-05, "loss": 0.3825803756713867, "num_input_tokens_seen": 21936745856, "step": 77130, "train_runtime": 749974.8465, "train_tokens_per_second": 29249.975 }, { "epoch": 2.7293650916505054, "grad_norm": 0.578125, "learning_rate": 1.6938062010251483e-05, "loss": 0.3856812953948975, "num_input_tokens_seen": 21939569088, "step": 77140, "train_runtime": 750070.6797, "train_tokens_per_second": 29250.002 }, { "epoch": 2.729718911914234, "grad_norm": 0.59375, "learning_rate": 1.693709019485877e-05, "loss": 0.38559327125549314, "num_input_tokens_seen": 21942403072, "step": 77150, "train_runtime": 750165.7906, "train_tokens_per_second": 29250.072 }, { "epoch": 2.7300727321779625, "grad_norm": 0.640625, "learning_rate": 1.6936118546719572e-05, "loss": 0.3913443565368652, "num_input_tokens_seen": 21945177536, "step": 77160, "train_runtime": 750259.1952, "train_tokens_per_second": 29250.128 }, { "epoch": 2.7304265524416915, "grad_norm": 0.640625, "learning_rate": 1.6935147065785917e-05, "loss": 0.3923962116241455, "num_input_tokens_seen": 21948041216, "step": 77170, "train_runtime": 750356.5018, "train_tokens_per_second": 29250.151 }, { "epoch": 2.7307803727054205, "grad_norm": 0.62890625, "learning_rate": 1.693417575200986e-05, "loss": 0.3857344388961792, "num_input_tokens_seen": 21950913408, "step": 77180, "train_runtime": 750453.6191, "train_tokens_per_second": 29250.193 }, { "epoch": 2.731134192969149, "grad_norm": 0.58984375, "learning_rate": 1.6933204605343466e-05, "loss": 0.3833878993988037, "num_input_tokens_seen": 21953740544, "step": 77190, "train_runtime": 750550.7575, "train_tokens_per_second": 29250.174 }, { "epoch": 2.7314880132328776, "grad_norm": 0.63671875, "learning_rate": 1.693223362573882e-05, "loss": 0.3907898426055908, "num_input_tokens_seen": 21956518336, "step": 77200, "train_runtime": 750642.4725, "train_tokens_per_second": 29250.301 }, { "epoch": 2.7318418334966066, "grad_norm": 0.6015625, "learning_rate": 1.6931262813148036e-05, "loss": 0.39191856384277346, "num_input_tokens_seen": 21959352768, "step": 77210, "train_runtime": 750740.714, "train_tokens_per_second": 29250.249 }, { "epoch": 2.7321956537603356, "grad_norm": 0.60546875, "learning_rate": 1.6930292167523236e-05, "loss": 0.3813400030136108, "num_input_tokens_seen": 21962230144, "step": 77220, "train_runtime": 750839.7142, "train_tokens_per_second": 29250.224 }, { "epoch": 2.732549474024064, "grad_norm": 0.609375, "learning_rate": 1.6929321688816573e-05, "loss": 0.3807516098022461, "num_input_tokens_seen": 21965091328, "step": 77230, "train_runtime": 750933.5386, "train_tokens_per_second": 29250.38 }, { "epoch": 2.732903294287793, "grad_norm": 0.640625, "learning_rate": 1.6928351376980197e-05, "loss": 0.38213391304016114, "num_input_tokens_seen": 21967972992, "step": 77240, "train_runtime": 751031.5699, "train_tokens_per_second": 29250.399 }, { "epoch": 2.7332571145515216, "grad_norm": 0.6171875, "learning_rate": 1.692738123196631e-05, "loss": 0.3840660572052002, "num_input_tokens_seen": 21970800576, "step": 77250, "train_runtime": 751128.4832, "train_tokens_per_second": 29250.389 }, { "epoch": 2.7336109348152506, "grad_norm": 0.6171875, "learning_rate": 1.6926411253727104e-05, "loss": 0.38460583686828614, "num_input_tokens_seen": 21973649280, "step": 77260, "train_runtime": 751225.0384, "train_tokens_per_second": 29250.422 }, { "epoch": 2.733964755078979, "grad_norm": 0.61328125, "learning_rate": 1.69254414422148e-05, "loss": 0.3856522798538208, "num_input_tokens_seen": 21976449216, "step": 77270, "train_runtime": 751318.7683, "train_tokens_per_second": 29250.499 }, { "epoch": 2.734318575342708, "grad_norm": 0.62109375, "learning_rate": 1.6924471797381652e-05, "loss": 0.38483476638793945, "num_input_tokens_seen": 21979263296, "step": 77280, "train_runtime": 751414.4084, "train_tokens_per_second": 29250.521 }, { "epoch": 2.7346723956064367, "grad_norm": 0.62109375, "learning_rate": 1.692350231917991e-05, "loss": 0.38748822212219236, "num_input_tokens_seen": 21982126528, "step": 77290, "train_runtime": 751510.7036, "train_tokens_per_second": 29250.583 }, { "epoch": 2.7350262158701657, "grad_norm": 0.609375, "learning_rate": 1.692253300756186e-05, "loss": 0.3898794174194336, "num_input_tokens_seen": 21985036480, "step": 77300, "train_runtime": 751611.5396, "train_tokens_per_second": 29250.531 }, { "epoch": 2.7353800361338942, "grad_norm": 0.60546875, "learning_rate": 1.6921563862479795e-05, "loss": 0.3850629568099976, "num_input_tokens_seen": 21987895872, "step": 77310, "train_runtime": 751707.2659, "train_tokens_per_second": 29250.61 }, { "epoch": 2.7357338563976232, "grad_norm": 0.609375, "learning_rate": 1.692059488388604e-05, "loss": 0.38352408409118655, "num_input_tokens_seen": 21990741056, "step": 77320, "train_runtime": 751803.5255, "train_tokens_per_second": 29250.649 }, { "epoch": 2.736087676661352, "grad_norm": 0.625, "learning_rate": 1.6919626071732924e-05, "loss": 0.38570780754089357, "num_input_tokens_seen": 21993612672, "step": 77330, "train_runtime": 751903.1957, "train_tokens_per_second": 29250.591 }, { "epoch": 2.7364414969250808, "grad_norm": 0.609375, "learning_rate": 1.6918657425972812e-05, "loss": 0.3877967596054077, "num_input_tokens_seen": 21996454272, "step": 77340, "train_runtime": 752001.1087, "train_tokens_per_second": 29250.561 }, { "epoch": 2.7367953171888093, "grad_norm": 0.6328125, "learning_rate": 1.6917688946558078e-05, "loss": 0.3909803867340088, "num_input_tokens_seen": 21999303488, "step": 77350, "train_runtime": 752098.5884, "train_tokens_per_second": 29250.558 }, { "epoch": 2.7371491374525383, "grad_norm": 0.59765625, "learning_rate": 1.6916720633441113e-05, "loss": 0.3863527297973633, "num_input_tokens_seen": 22002172608, "step": 77360, "train_runtime": 752195.9116, "train_tokens_per_second": 29250.588 }, { "epoch": 2.7375029577162673, "grad_norm": 0.63671875, "learning_rate": 1.6915752486574336e-05, "loss": 0.3840712785720825, "num_input_tokens_seen": 22005088576, "step": 77370, "train_runtime": 752294.9756, "train_tokens_per_second": 29250.612 }, { "epoch": 2.737856777979996, "grad_norm": 0.62109375, "learning_rate": 1.6914784505910173e-05, "loss": 0.38370304107666015, "num_input_tokens_seen": 22007950400, "step": 77380, "train_runtime": 752388.907, "train_tokens_per_second": 29250.764 }, { "epoch": 2.738210598243725, "grad_norm": 0.61328125, "learning_rate": 1.6913816691401083e-05, "loss": 0.3804908514022827, "num_input_tokens_seen": 22010779520, "step": 77390, "train_runtime": 752484.7852, "train_tokens_per_second": 29250.797 }, { "epoch": 2.7385644185074534, "grad_norm": 0.625, "learning_rate": 1.691284904299953e-05, "loss": 0.3805437803268433, "num_input_tokens_seen": 22013619264, "step": 77400, "train_runtime": 752579.5399, "train_tokens_per_second": 29250.887 }, { "epoch": 2.7389182387711823, "grad_norm": 0.61328125, "learning_rate": 1.6911881560658007e-05, "loss": 0.38747193813323977, "num_input_tokens_seen": 22016483264, "step": 77410, "train_runtime": 752677.4287, "train_tokens_per_second": 29250.888 }, { "epoch": 2.739272059034911, "grad_norm": 0.62109375, "learning_rate": 1.6910914244329028e-05, "loss": 0.38733615875244143, "num_input_tokens_seen": 22019272000, "step": 77420, "train_runtime": 752771.7801, "train_tokens_per_second": 29250.926 }, { "epoch": 2.73962587929864, "grad_norm": 0.62890625, "learning_rate": 1.690994709396511e-05, "loss": 0.38250150680541994, "num_input_tokens_seen": 22022173440, "step": 77430, "train_runtime": 752874.0059, "train_tokens_per_second": 29250.809 }, { "epoch": 2.7399796995623684, "grad_norm": 0.609375, "learning_rate": 1.690898010951881e-05, "loss": 0.384661865234375, "num_input_tokens_seen": 22024978752, "step": 77440, "train_runtime": 752969.4686, "train_tokens_per_second": 29250.826 }, { "epoch": 2.7403335198260974, "grad_norm": 0.60546875, "learning_rate": 1.690801329094269e-05, "loss": 0.38803393840789796, "num_input_tokens_seen": 22027876416, "step": 77450, "train_runtime": 753067.8373, "train_tokens_per_second": 29250.853 }, { "epoch": 2.740687340089826, "grad_norm": 0.63671875, "learning_rate": 1.6907046638189336e-05, "loss": 0.38559856414794924, "num_input_tokens_seen": 22030670016, "step": 77460, "train_runtime": 753162.3707, "train_tokens_per_second": 29250.89 }, { "epoch": 2.741041160353555, "grad_norm": 0.62109375, "learning_rate": 1.6906080151211352e-05, "loss": 0.38303604125976565, "num_input_tokens_seen": 22033492032, "step": 77470, "train_runtime": 753258.5108, "train_tokens_per_second": 29250.904 }, { "epoch": 2.741394980617284, "grad_norm": 0.61328125, "learning_rate": 1.6905113829961355e-05, "loss": 0.3902784824371338, "num_input_tokens_seen": 22036393792, "step": 77480, "train_runtime": 753359.9816, "train_tokens_per_second": 29250.815 }, { "epoch": 2.7417488008810125, "grad_norm": 0.609375, "learning_rate": 1.6904147674391995e-05, "loss": 0.38965511322021484, "num_input_tokens_seen": 22039244224, "step": 77490, "train_runtime": 753457.1231, "train_tokens_per_second": 29250.827 }, { "epoch": 2.742102621144741, "grad_norm": 0.6171875, "learning_rate": 1.690318168445593e-05, "loss": 0.38219285011291504, "num_input_tokens_seen": 22042118848, "step": 77500, "train_runtime": 753557.1493, "train_tokens_per_second": 29250.759 }, { "epoch": 2.74245644140847, "grad_norm": 0.62109375, "learning_rate": 1.6902215860105837e-05, "loss": 0.3888564109802246, "num_input_tokens_seen": 22044959296, "step": 77510, "train_runtime": 753651.5898, "train_tokens_per_second": 29250.863 }, { "epoch": 2.742810261672199, "grad_norm": 0.62109375, "learning_rate": 1.6901250201294422e-05, "loss": 0.38782639503479005, "num_input_tokens_seen": 22047794688, "step": 77520, "train_runtime": 753749.1399, "train_tokens_per_second": 29250.839 }, { "epoch": 2.7431640819359275, "grad_norm": 0.62109375, "learning_rate": 1.6900284707974394e-05, "loss": 0.3811646461486816, "num_input_tokens_seen": 22050627136, "step": 77530, "train_runtime": 753845.4471, "train_tokens_per_second": 29250.859 }, { "epoch": 2.743517902199656, "grad_norm": 0.62109375, "learning_rate": 1.689931938009849e-05, "loss": 0.39369497299194334, "num_input_tokens_seen": 22053482688, "step": 77540, "train_runtime": 753941.214, "train_tokens_per_second": 29250.931 }, { "epoch": 2.743871722463385, "grad_norm": 0.609375, "learning_rate": 1.6898354217619476e-05, "loss": 0.3870671272277832, "num_input_tokens_seen": 22056334528, "step": 77550, "train_runtime": 754036.6702, "train_tokens_per_second": 29251.01 }, { "epoch": 2.744225542727114, "grad_norm": 0.62109375, "learning_rate": 1.689738922049011e-05, "loss": 0.38261919021606444, "num_input_tokens_seen": 22059175488, "step": 77560, "train_runtime": 754135.1853, "train_tokens_per_second": 29250.956 }, { "epoch": 2.7445793629908426, "grad_norm": 0.62109375, "learning_rate": 1.6896424388663198e-05, "loss": 0.3870835304260254, "num_input_tokens_seen": 22061974016, "step": 77570, "train_runtime": 754231.244, "train_tokens_per_second": 29250.942 }, { "epoch": 2.7449331832545716, "grad_norm": 0.6328125, "learning_rate": 1.6895459722091548e-05, "loss": 0.38804211616516116, "num_input_tokens_seen": 22064835392, "step": 77580, "train_runtime": 754329.4637, "train_tokens_per_second": 29250.926 }, { "epoch": 2.7452870035183, "grad_norm": 0.65234375, "learning_rate": 1.689449522072799e-05, "loss": 0.3837564468383789, "num_input_tokens_seen": 22067711104, "step": 77590, "train_runtime": 754427.2535, "train_tokens_per_second": 29250.946 }, { "epoch": 2.745640823782029, "grad_norm": 0.6015625, "learning_rate": 1.6893530884525372e-05, "loss": 0.3875821590423584, "num_input_tokens_seen": 22070538496, "step": 77600, "train_runtime": 754521.6255, "train_tokens_per_second": 29251.035 }, { "epoch": 2.7459946440457577, "grad_norm": 0.609375, "learning_rate": 1.6892566713436568e-05, "loss": 0.38980393409729003, "num_input_tokens_seen": 22073471424, "step": 77610, "train_runtime": 754627.0618, "train_tokens_per_second": 29250.835 }, { "epoch": 2.7463484643094866, "grad_norm": 0.6640625, "learning_rate": 1.6891602707414458e-05, "loss": 0.3899756908416748, "num_input_tokens_seen": 22076286656, "step": 77620, "train_runtime": 754722.0824, "train_tokens_per_second": 29250.882 }, { "epoch": 2.7467022845732156, "grad_norm": 0.59765625, "learning_rate": 1.6890638866411958e-05, "loss": 0.3900710105895996, "num_input_tokens_seen": 22079122304, "step": 77630, "train_runtime": 754819.7119, "train_tokens_per_second": 29250.855 }, { "epoch": 2.747056104836944, "grad_norm": 0.61328125, "learning_rate": 1.6889675190381985e-05, "loss": 0.390013313293457, "num_input_tokens_seen": 22081886336, "step": 77640, "train_runtime": 754912.078, "train_tokens_per_second": 29250.938 }, { "epoch": 2.7474099251006727, "grad_norm": 0.6015625, "learning_rate": 1.6888711679277482e-05, "loss": 0.38519601821899413, "num_input_tokens_seen": 22084674624, "step": 77650, "train_runtime": 755008.7423, "train_tokens_per_second": 29250.886 }, { "epoch": 2.7477637453644017, "grad_norm": 0.6171875, "learning_rate": 1.688774833305142e-05, "loss": 0.38426783084869387, "num_input_tokens_seen": 22087477760, "step": 77660, "train_runtime": 755103.0701, "train_tokens_per_second": 29250.944 }, { "epoch": 2.7481175656281307, "grad_norm": 0.62109375, "learning_rate": 1.688678515165677e-05, "loss": 0.3895281791687012, "num_input_tokens_seen": 22090309504, "step": 77670, "train_runtime": 755200.9052, "train_tokens_per_second": 29250.904 }, { "epoch": 2.7484713858918592, "grad_norm": 0.609375, "learning_rate": 1.6885822135046542e-05, "loss": 0.38850746154785154, "num_input_tokens_seen": 22093155520, "step": 77680, "train_runtime": 755300.3605, "train_tokens_per_second": 29250.821 }, { "epoch": 2.748825206155588, "grad_norm": 0.64453125, "learning_rate": 1.6884859283173742e-05, "loss": 0.3878913164138794, "num_input_tokens_seen": 22095957504, "step": 77690, "train_runtime": 755393.2069, "train_tokens_per_second": 29250.935 }, { "epoch": 2.7491790264193168, "grad_norm": 0.62890625, "learning_rate": 1.688389659599142e-05, "loss": 0.38462255001068113, "num_input_tokens_seen": 22098825664, "step": 77700, "train_runtime": 755493.6739, "train_tokens_per_second": 29250.841 }, { "epoch": 2.7495328466830458, "grad_norm": 0.60546875, "learning_rate": 1.688293407345263e-05, "loss": 0.3852888822555542, "num_input_tokens_seen": 22101652608, "step": 77710, "train_runtime": 755591.7813, "train_tokens_per_second": 29250.785 }, { "epoch": 2.7498866669467743, "grad_norm": 0.63671875, "learning_rate": 1.688197171551044e-05, "loss": 0.3814253568649292, "num_input_tokens_seen": 22104494784, "step": 77720, "train_runtime": 755689.4385, "train_tokens_per_second": 29250.766 }, { "epoch": 2.7502404872105033, "grad_norm": 0.62890625, "learning_rate": 1.6881009522117954e-05, "loss": 0.3821877002716064, "num_input_tokens_seen": 22107361344, "step": 77730, "train_runtime": 755790.6466, "train_tokens_per_second": 29250.642 }, { "epoch": 2.750594307474232, "grad_norm": 0.64453125, "learning_rate": 1.688004749322828e-05, "loss": 0.38443262577056886, "num_input_tokens_seen": 22110234624, "step": 77740, "train_runtime": 755890.2035, "train_tokens_per_second": 29250.59 }, { "epoch": 2.750948127737961, "grad_norm": 0.63671875, "learning_rate": 1.6879085628794544e-05, "loss": 0.3903075695037842, "num_input_tokens_seen": 22113058496, "step": 77750, "train_runtime": 755988.8854, "train_tokens_per_second": 29250.507 }, { "epoch": 2.7513019480016894, "grad_norm": 0.62890625, "learning_rate": 1.6878123928769905e-05, "loss": 0.3827351093292236, "num_input_tokens_seen": 22115896384, "step": 77760, "train_runtime": 756085.6973, "train_tokens_per_second": 29250.515 }, { "epoch": 2.7516557682654184, "grad_norm": 0.6640625, "learning_rate": 1.6877162393107524e-05, "loss": 0.38554117679595945, "num_input_tokens_seen": 22118697984, "step": 77770, "train_runtime": 756180.304, "train_tokens_per_second": 29250.561 }, { "epoch": 2.752009588529147, "grad_norm": 0.63671875, "learning_rate": 1.687620102176059e-05, "loss": 0.38048548698425294, "num_input_tokens_seen": 22121535360, "step": 77780, "train_runtime": 756277.6664, "train_tokens_per_second": 29250.547 }, { "epoch": 2.752363408792876, "grad_norm": 0.62890625, "learning_rate": 1.6875239814682313e-05, "loss": 0.38638551235198976, "num_input_tokens_seen": 22124367936, "step": 77790, "train_runtime": 756375.6677, "train_tokens_per_second": 29250.502 }, { "epoch": 2.7527172290566044, "grad_norm": 0.62109375, "learning_rate": 1.6874278771825917e-05, "loss": 0.3864504337310791, "num_input_tokens_seen": 22127225408, "step": 77800, "train_runtime": 756474.4407, "train_tokens_per_second": 29250.46 }, { "epoch": 2.7530710493203334, "grad_norm": 0.625, "learning_rate": 1.6873317893144635e-05, "loss": 0.38992536067962646, "num_input_tokens_seen": 22130098176, "step": 77810, "train_runtime": 756575.7715, "train_tokens_per_second": 29250.34 }, { "epoch": 2.7534248695840624, "grad_norm": 0.6171875, "learning_rate": 1.6872357178591744e-05, "loss": 0.38590755462646487, "num_input_tokens_seen": 22132897664, "step": 77820, "train_runtime": 756668.3787, "train_tokens_per_second": 29250.459 }, { "epoch": 2.753778689847791, "grad_norm": 0.6015625, "learning_rate": 1.6871396628120516e-05, "loss": 0.3891230583190918, "num_input_tokens_seen": 22135731520, "step": 77830, "train_runtime": 756767.6185, "train_tokens_per_second": 29250.368 }, { "epoch": 2.7541325101115195, "grad_norm": 0.609375, "learning_rate": 1.6870436241684255e-05, "loss": 0.38344383239746094, "num_input_tokens_seen": 22138625280, "step": 77840, "train_runtime": 756867.1567, "train_tokens_per_second": 29250.345 }, { "epoch": 2.7544863303752485, "grad_norm": 0.61328125, "learning_rate": 1.6869476019236267e-05, "loss": 0.3902973413467407, "num_input_tokens_seen": 22141391040, "step": 77850, "train_runtime": 756961.1538, "train_tokens_per_second": 29250.366 }, { "epoch": 2.7548401506389775, "grad_norm": 0.6171875, "learning_rate": 1.6868515960729903e-05, "loss": 0.38764266967773436, "num_input_tokens_seen": 22144226176, "step": 77860, "train_runtime": 757055.6285, "train_tokens_per_second": 29250.461 }, { "epoch": 2.755193970902706, "grad_norm": 0.6328125, "learning_rate": 1.686755606611851e-05, "loss": 0.3846998453140259, "num_input_tokens_seen": 22147074304, "step": 77870, "train_runtime": 757150.3233, "train_tokens_per_second": 29250.564 }, { "epoch": 2.755547791166435, "grad_norm": 0.625, "learning_rate": 1.6866596335355463e-05, "loss": 0.3827911138534546, "num_input_tokens_seen": 22149905152, "step": 77880, "train_runtime": 757247.042, "train_tokens_per_second": 29250.567 }, { "epoch": 2.7559016114301635, "grad_norm": 0.62109375, "learning_rate": 1.6865636768394156e-05, "loss": 0.3889758110046387, "num_input_tokens_seen": 22152753536, "step": 77890, "train_runtime": 757344.7885, "train_tokens_per_second": 29250.553 }, { "epoch": 2.7562554316938925, "grad_norm": 0.6171875, "learning_rate": 1.6864677365187998e-05, "loss": 0.37844281196594237, "num_input_tokens_seen": 22155593856, "step": 77900, "train_runtime": 757441.8161, "train_tokens_per_second": 29250.555 }, { "epoch": 2.756609251957621, "grad_norm": 0.62109375, "learning_rate": 1.6863718125690418e-05, "loss": 0.3849318027496338, "num_input_tokens_seen": 22158424960, "step": 77910, "train_runtime": 757537.1247, "train_tokens_per_second": 29250.613 }, { "epoch": 2.75696307222135, "grad_norm": 0.6171875, "learning_rate": 1.686275904985486e-05, "loss": 0.3863871097564697, "num_input_tokens_seen": 22161254208, "step": 77920, "train_runtime": 757634.4553, "train_tokens_per_second": 29250.589 }, { "epoch": 2.7573168924850786, "grad_norm": 0.60546875, "learning_rate": 1.6861800137634795e-05, "loss": 0.3870380163192749, "num_input_tokens_seen": 22164182720, "step": 77930, "train_runtime": 757736.6095, "train_tokens_per_second": 29250.511 }, { "epoch": 2.7576707127488076, "grad_norm": 0.6015625, "learning_rate": 1.6860841388983708e-05, "loss": 0.3864006042480469, "num_input_tokens_seen": 22167008064, "step": 77940, "train_runtime": 757831.0429, "train_tokens_per_second": 29250.594 }, { "epoch": 2.758024533012536, "grad_norm": 0.6171875, "learning_rate": 1.6859882803855102e-05, "loss": 0.3868141174316406, "num_input_tokens_seen": 22169825856, "step": 77950, "train_runtime": 757925.5393, "train_tokens_per_second": 29250.665 }, { "epoch": 2.758378353276265, "grad_norm": 0.640625, "learning_rate": 1.6858924382202497e-05, "loss": 0.3833159923553467, "num_input_tokens_seen": 22172692160, "step": 77960, "train_runtime": 758024.2703, "train_tokens_per_second": 29250.636 }, { "epoch": 2.758732173539994, "grad_norm": 0.62890625, "learning_rate": 1.6857966123979434e-05, "loss": 0.3863433837890625, "num_input_tokens_seen": 22175520448, "step": 77970, "train_runtime": 758120.08, "train_tokens_per_second": 29250.67 }, { "epoch": 2.7590859938037227, "grad_norm": 0.6328125, "learning_rate": 1.685700802913947e-05, "loss": 0.38769395351409913, "num_input_tokens_seen": 22178426944, "step": 77980, "train_runtime": 758219.2038, "train_tokens_per_second": 29250.68 }, { "epoch": 2.759439814067451, "grad_norm": 0.62109375, "learning_rate": 1.6856050097636186e-05, "loss": 0.3921926975250244, "num_input_tokens_seen": 22181314688, "step": 77990, "train_runtime": 758321.1588, "train_tokens_per_second": 29250.555 }, { "epoch": 2.75979363433118, "grad_norm": 0.62890625, "learning_rate": 1.6855092329423174e-05, "loss": 0.3871100902557373, "num_input_tokens_seen": 22184108224, "step": 78000, "train_runtime": 758412.7332, "train_tokens_per_second": 29250.706 }, { "epoch": 2.760147454594909, "grad_norm": 0.6328125, "learning_rate": 1.685413472445405e-05, "loss": 0.383712100982666, "num_input_tokens_seen": 22186936768, "step": 78010, "train_runtime": 758509.242, "train_tokens_per_second": 29250.714 }, { "epoch": 2.7605012748586377, "grad_norm": 0.59765625, "learning_rate": 1.685317728268245e-05, "loss": 0.38512454032897947, "num_input_tokens_seen": 22189785280, "step": 78020, "train_runtime": 758609.2897, "train_tokens_per_second": 29250.611 }, { "epoch": 2.7608550951223663, "grad_norm": 0.62890625, "learning_rate": 1.685222000406202e-05, "loss": 0.38504347801208494, "num_input_tokens_seen": 22192593792, "step": 78030, "train_runtime": 758705.6, "train_tokens_per_second": 29250.6 }, { "epoch": 2.7612089153860953, "grad_norm": 0.59765625, "learning_rate": 1.685126288854643e-05, "loss": 0.38506505489349363, "num_input_tokens_seen": 22195471872, "step": 78040, "train_runtime": 758804.4313, "train_tokens_per_second": 29250.583 }, { "epoch": 2.7615627356498242, "grad_norm": 0.625, "learning_rate": 1.6850305936089365e-05, "loss": 0.38674774169921877, "num_input_tokens_seen": 22198294656, "step": 78050, "train_runtime": 758899.343, "train_tokens_per_second": 29250.644 }, { "epoch": 2.761916555913553, "grad_norm": 0.61328125, "learning_rate": 1.6849349146644543e-05, "loss": 0.38572063446044924, "num_input_tokens_seen": 22201098240, "step": 78060, "train_runtime": 758994.7973, "train_tokens_per_second": 29250.659 }, { "epoch": 2.7622703761772818, "grad_norm": 0.60546875, "learning_rate": 1.6848392520165675e-05, "loss": 0.3863166093826294, "num_input_tokens_seen": 22203973952, "step": 78070, "train_runtime": 759092.8568, "train_tokens_per_second": 29250.669 }, { "epoch": 2.7626241964410103, "grad_norm": 0.60546875, "learning_rate": 1.684743605660651e-05, "loss": 0.3838151693344116, "num_input_tokens_seen": 22206807104, "step": 78080, "train_runtime": 759194.3946, "train_tokens_per_second": 29250.489 }, { "epoch": 2.7629780167047393, "grad_norm": 0.62109375, "learning_rate": 1.684647975592081e-05, "loss": 0.3818851709365845, "num_input_tokens_seen": 22209710528, "step": 78090, "train_runtime": 759292.4956, "train_tokens_per_second": 29250.533 }, { "epoch": 2.763331836968468, "grad_norm": 0.60546875, "learning_rate": 1.6845523618062353e-05, "loss": 0.38626275062561033, "num_input_tokens_seen": 22212573568, "step": 78100, "train_runtime": 759390.0674, "train_tokens_per_second": 29250.545 }, { "epoch": 2.763685657232197, "grad_norm": 0.62109375, "learning_rate": 1.684456764298494e-05, "loss": 0.38286261558532714, "num_input_tokens_seen": 22215399360, "step": 78110, "train_runtime": 759486.69, "train_tokens_per_second": 29250.545 }, { "epoch": 2.7640394774959254, "grad_norm": 0.6015625, "learning_rate": 1.6843611830642385e-05, "loss": 0.38418700695037844, "num_input_tokens_seen": 22218234368, "step": 78120, "train_runtime": 759583.6029, "train_tokens_per_second": 29250.545 }, { "epoch": 2.7643932977596544, "grad_norm": 0.63671875, "learning_rate": 1.6842656180988522e-05, "loss": 0.38846583366394044, "num_input_tokens_seen": 22221042496, "step": 78130, "train_runtime": 759679.9268, "train_tokens_per_second": 29250.533 }, { "epoch": 2.764747118023383, "grad_norm": 0.62890625, "learning_rate": 1.6841700693977213e-05, "loss": 0.38442559242248536, "num_input_tokens_seen": 22223843904, "step": 78140, "train_runtime": 759774.4951, "train_tokens_per_second": 29250.579 }, { "epoch": 2.765100938287112, "grad_norm": 0.61328125, "learning_rate": 1.6840745369562314e-05, "loss": 0.3828442573547363, "num_input_tokens_seen": 22226673472, "step": 78150, "train_runtime": 759869.0405, "train_tokens_per_second": 29250.663 }, { "epoch": 2.765454758550841, "grad_norm": 0.62890625, "learning_rate": 1.6839790207697727e-05, "loss": 0.38646955490112306, "num_input_tokens_seen": 22229570880, "step": 78160, "train_runtime": 759968.713, "train_tokens_per_second": 29250.64 }, { "epoch": 2.7658085788145694, "grad_norm": 0.609375, "learning_rate": 1.6838835208337357e-05, "loss": 0.38210015296936034, "num_input_tokens_seen": 22232420608, "step": 78170, "train_runtime": 760064.9304, "train_tokens_per_second": 29250.686 }, { "epoch": 2.766162399078298, "grad_norm": 0.609375, "learning_rate": 1.6837880371435127e-05, "loss": 0.3843751668930054, "num_input_tokens_seen": 22235267136, "step": 78180, "train_runtime": 760163.2679, "train_tokens_per_second": 29250.647 }, { "epoch": 2.766516219342027, "grad_norm": 0.61328125, "learning_rate": 1.6836925696944987e-05, "loss": 0.38655805587768555, "num_input_tokens_seen": 22238079104, "step": 78190, "train_runtime": 760257.9899, "train_tokens_per_second": 29250.701 }, { "epoch": 2.766870039605756, "grad_norm": 0.63671875, "learning_rate": 1.6835971184820895e-05, "loss": 0.39056613445281985, "num_input_tokens_seen": 22240920832, "step": 78200, "train_runtime": 760353.5365, "train_tokens_per_second": 29250.763 }, { "epoch": 2.7672238598694845, "grad_norm": 0.625, "learning_rate": 1.6835016835016834e-05, "loss": 0.3845752000808716, "num_input_tokens_seen": 22243733824, "step": 78210, "train_runtime": 760448.7896, "train_tokens_per_second": 29250.798 }, { "epoch": 2.7675776801332135, "grad_norm": 0.60546875, "learning_rate": 1.683406264748681e-05, "loss": 0.38459124565124514, "num_input_tokens_seen": 22246553728, "step": 78220, "train_runtime": 760543.6462, "train_tokens_per_second": 29250.857 }, { "epoch": 2.767931500396942, "grad_norm": 0.609375, "learning_rate": 1.6833108622184828e-05, "loss": 0.38901629447937014, "num_input_tokens_seen": 22249420352, "step": 78230, "train_runtime": 760644.2516, "train_tokens_per_second": 29250.757 }, { "epoch": 2.768285320660671, "grad_norm": 0.60546875, "learning_rate": 1.6832154759064936e-05, "loss": 0.3875391960144043, "num_input_tokens_seen": 22252240832, "step": 78240, "train_runtime": 760740.2973, "train_tokens_per_second": 29250.772 }, { "epoch": 2.7686391409243996, "grad_norm": 0.65625, "learning_rate": 1.6831201058081183e-05, "loss": 0.38439579010009767, "num_input_tokens_seen": 22255082176, "step": 78250, "train_runtime": 760835.9149, "train_tokens_per_second": 29250.83 }, { "epoch": 2.7689929611881285, "grad_norm": 0.59375, "learning_rate": 1.6830247519187638e-05, "loss": 0.389575719833374, "num_input_tokens_seen": 22257962304, "step": 78260, "train_runtime": 760934.5693, "train_tokens_per_second": 29250.823 }, { "epoch": 2.769346781451857, "grad_norm": 0.6328125, "learning_rate": 1.68292941423384e-05, "loss": 0.3874102354049683, "num_input_tokens_seen": 22260806144, "step": 78270, "train_runtime": 761033.2437, "train_tokens_per_second": 29250.767 }, { "epoch": 2.769700601715586, "grad_norm": 0.6015625, "learning_rate": 1.682834092748757e-05, "loss": 0.38518362045288085, "num_input_tokens_seen": 22263636032, "step": 78280, "train_runtime": 761129.2154, "train_tokens_per_second": 29250.797 }, { "epoch": 2.7700544219793146, "grad_norm": 0.62109375, "learning_rate": 1.682738787458928e-05, "loss": 0.38323662281036375, "num_input_tokens_seen": 22266491520, "step": 78290, "train_runtime": 761225.9895, "train_tokens_per_second": 29250.829 }, { "epoch": 2.7704082422430436, "grad_norm": 0.60546875, "learning_rate": 1.6826434983597672e-05, "loss": 0.386376953125, "num_input_tokens_seen": 22269292672, "step": 78300, "train_runtime": 761318.5664, "train_tokens_per_second": 29250.952 }, { "epoch": 2.7707620625067726, "grad_norm": 0.609375, "learning_rate": 1.6825482254466916e-05, "loss": 0.3856979846954346, "num_input_tokens_seen": 22272114496, "step": 78310, "train_runtime": 761415.1428, "train_tokens_per_second": 29250.948 }, { "epoch": 2.771115882770501, "grad_norm": 0.6171875, "learning_rate": 1.6824529687151183e-05, "loss": 0.3857269287109375, "num_input_tokens_seen": 22274962176, "step": 78320, "train_runtime": 761512.7167, "train_tokens_per_second": 29250.939 }, { "epoch": 2.7714697030342297, "grad_norm": 0.625, "learning_rate": 1.682357728160468e-05, "loss": 0.38968968391418457, "num_input_tokens_seen": 22277834496, "step": 78330, "train_runtime": 761612.3398, "train_tokens_per_second": 29250.884 }, { "epoch": 2.7718235232979587, "grad_norm": 0.62890625, "learning_rate": 1.6822625037781626e-05, "loss": 0.3861381530761719, "num_input_tokens_seen": 22280728768, "step": 78340, "train_runtime": 761712.5502, "train_tokens_per_second": 29250.836 }, { "epoch": 2.7721773435616877, "grad_norm": 0.59375, "learning_rate": 1.6821672955636254e-05, "loss": 0.3871183156967163, "num_input_tokens_seen": 22283664064, "step": 78350, "train_runtime": 761816.6357, "train_tokens_per_second": 29250.692 }, { "epoch": 2.772531163825416, "grad_norm": 0.640625, "learning_rate": 1.6820721035122815e-05, "loss": 0.38559417724609374, "num_input_tokens_seen": 22286453632, "step": 78360, "train_runtime": 761908.3887, "train_tokens_per_second": 29250.831 }, { "epoch": 2.7728849840891447, "grad_norm": 0.59765625, "learning_rate": 1.6819769276195584e-05, "loss": 0.3849762439727783, "num_input_tokens_seen": 22289323072, "step": 78370, "train_runtime": 762006.2301, "train_tokens_per_second": 29250.841 }, { "epoch": 2.7732388043528737, "grad_norm": 0.625, "learning_rate": 1.6818817678808855e-05, "loss": 0.38625340461730956, "num_input_tokens_seen": 22292172864, "step": 78380, "train_runtime": 762102.3342, "train_tokens_per_second": 29250.892 }, { "epoch": 2.7735926246166027, "grad_norm": 0.6171875, "learning_rate": 1.6817866242916934e-05, "loss": 0.3882770538330078, "num_input_tokens_seen": 22295007808, "step": 78390, "train_runtime": 762199.5133, "train_tokens_per_second": 29250.882 }, { "epoch": 2.7739464448803313, "grad_norm": 0.60546875, "learning_rate": 1.6816914968474148e-05, "loss": 0.3871619701385498, "num_input_tokens_seen": 22297791168, "step": 78400, "train_runtime": 762292.1313, "train_tokens_per_second": 29250.979 }, { "epoch": 2.7743002651440603, "grad_norm": 0.61328125, "learning_rate": 1.6815963855434838e-05, "loss": 0.3849196910858154, "num_input_tokens_seen": 22300622016, "step": 78410, "train_runtime": 762387.2175, "train_tokens_per_second": 29251.044 }, { "epoch": 2.774654085407789, "grad_norm": 0.62890625, "learning_rate": 1.681501290375337e-05, "loss": 0.386171555519104, "num_input_tokens_seen": 22303400320, "step": 78420, "train_runtime": 762480.0351, "train_tokens_per_second": 29251.127 }, { "epoch": 2.775007905671518, "grad_norm": 0.6015625, "learning_rate": 1.6814062113384127e-05, "loss": 0.38807241916656493, "num_input_tokens_seen": 22306210880, "step": 78430, "train_runtime": 762576.5861, "train_tokens_per_second": 29251.109 }, { "epoch": 2.7753617259352463, "grad_norm": 0.6171875, "learning_rate": 1.6813111484281506e-05, "loss": 0.3816505432128906, "num_input_tokens_seen": 22309084032, "step": 78440, "train_runtime": 762679.4806, "train_tokens_per_second": 29250.93 }, { "epoch": 2.7757155461989753, "grad_norm": 0.6015625, "learning_rate": 1.6812161016399918e-05, "loss": 0.3843584775924683, "num_input_tokens_seen": 22311947648, "step": 78450, "train_runtime": 762779.4376, "train_tokens_per_second": 29250.851 }, { "epoch": 2.7760693664627043, "grad_norm": 0.59375, "learning_rate": 1.681121070969381e-05, "loss": 0.38947181701660155, "num_input_tokens_seen": 22314863168, "step": 78460, "train_runtime": 762880.4765, "train_tokens_per_second": 29250.799 }, { "epoch": 2.776423186726433, "grad_norm": 0.6015625, "learning_rate": 1.6810260564117625e-05, "loss": 0.3871855020523071, "num_input_tokens_seen": 22317715904, "step": 78470, "train_runtime": 762980.0693, "train_tokens_per_second": 29250.719 }, { "epoch": 2.7767770069901614, "grad_norm": 0.60546875, "learning_rate": 1.6809310579625838e-05, "loss": 0.38584098815917967, "num_input_tokens_seen": 22320463168, "step": 78480, "train_runtime": 763072.3837, "train_tokens_per_second": 29250.781 }, { "epoch": 2.7771308272538904, "grad_norm": 0.6171875, "learning_rate": 1.680836075617293e-05, "loss": 0.38796844482421877, "num_input_tokens_seen": 22323344384, "step": 78490, "train_runtime": 763172.0173, "train_tokens_per_second": 29250.738 }, { "epoch": 2.7774846475176194, "grad_norm": 0.609375, "learning_rate": 1.6807411093713423e-05, "loss": 0.3851827621459961, "num_input_tokens_seen": 22326178176, "step": 78500, "train_runtime": 763270.9909, "train_tokens_per_second": 29250.657 }, { "epoch": 2.777838467781348, "grad_norm": 0.62109375, "learning_rate": 1.6806461592201837e-05, "loss": 0.383903956413269, "num_input_tokens_seen": 22329054592, "step": 78510, "train_runtime": 763371.2938, "train_tokens_per_second": 29250.582 }, { "epoch": 2.7781922880450765, "grad_norm": 0.6171875, "learning_rate": 1.6805512251592702e-05, "loss": 0.3865769863128662, "num_input_tokens_seen": 22331912768, "step": 78520, "train_runtime": 763470.0557, "train_tokens_per_second": 29250.542 }, { "epoch": 2.7785461083088054, "grad_norm": 0.625, "learning_rate": 1.6804563071840595e-05, "loss": 0.387351393699646, "num_input_tokens_seen": 22334710336, "step": 78530, "train_runtime": 763565.5118, "train_tokens_per_second": 29250.549 }, { "epoch": 2.7788999285725344, "grad_norm": 0.609375, "learning_rate": 1.680361405290009e-05, "loss": 0.3864955186843872, "num_input_tokens_seen": 22337572160, "step": 78540, "train_runtime": 763663.8241, "train_tokens_per_second": 29250.531 }, { "epoch": 2.779253748836263, "grad_norm": 0.60546875, "learning_rate": 1.6802665194725778e-05, "loss": 0.39133076667785643, "num_input_tokens_seen": 22340434496, "step": 78550, "train_runtime": 763760.4965, "train_tokens_per_second": 29250.576 }, { "epoch": 2.779607569099992, "grad_norm": 0.59375, "learning_rate": 1.6801716497272283e-05, "loss": 0.3841114044189453, "num_input_tokens_seen": 22343290432, "step": 78560, "train_runtime": 763856.7578, "train_tokens_per_second": 29250.629 }, { "epoch": 2.7799613893637205, "grad_norm": 0.58203125, "learning_rate": 1.6800767960494234e-05, "loss": 0.38547325134277344, "num_input_tokens_seen": 22346138368, "step": 78570, "train_runtime": 763952.8508, "train_tokens_per_second": 29250.677 }, { "epoch": 2.7803152096274495, "grad_norm": 0.61328125, "learning_rate": 1.6799819584346275e-05, "loss": 0.3842307567596436, "num_input_tokens_seen": 22348997440, "step": 78580, "train_runtime": 764048.1975, "train_tokens_per_second": 29250.769 }, { "epoch": 2.780669029891178, "grad_norm": 0.62109375, "learning_rate": 1.6798871368783085e-05, "loss": 0.39015960693359375, "num_input_tokens_seen": 22351825024, "step": 78590, "train_runtime": 764142.8209, "train_tokens_per_second": 29250.847 }, { "epoch": 2.781022850154907, "grad_norm": 0.59375, "learning_rate": 1.6797923313759344e-05, "loss": 0.3816447019577026, "num_input_tokens_seen": 22354714048, "step": 78600, "train_runtime": 764242.0161, "train_tokens_per_second": 29250.831 }, { "epoch": 2.7813766704186356, "grad_norm": 0.60546875, "learning_rate": 1.679697541922976e-05, "loss": 0.3905625581741333, "num_input_tokens_seen": 22357579840, "step": 78610, "train_runtime": 764341.4414, "train_tokens_per_second": 29250.775 }, { "epoch": 2.7817304906823646, "grad_norm": 0.62890625, "learning_rate": 1.679602768514905e-05, "loss": 0.3888481378555298, "num_input_tokens_seen": 22360363328, "step": 78620, "train_runtime": 764435.5736, "train_tokens_per_second": 29250.815 }, { "epoch": 2.782084310946093, "grad_norm": 0.609375, "learning_rate": 1.679508011147196e-05, "loss": 0.38836982250213625, "num_input_tokens_seen": 22363190912, "step": 78630, "train_runtime": 764531.3634, "train_tokens_per_second": 29250.848 }, { "epoch": 2.782438131209822, "grad_norm": 0.62109375, "learning_rate": 1.679413269815325e-05, "loss": 0.3852013111114502, "num_input_tokens_seen": 22366037632, "step": 78640, "train_runtime": 764627.4857, "train_tokens_per_second": 29250.894 }, { "epoch": 2.782791951473551, "grad_norm": 0.59765625, "learning_rate": 1.679318544514769e-05, "loss": 0.38367300033569335, "num_input_tokens_seen": 22368912640, "step": 78650, "train_runtime": 764726.6005, "train_tokens_per_second": 29250.862 }, { "epoch": 2.7831457717372796, "grad_norm": 0.6328125, "learning_rate": 1.679223835241007e-05, "loss": 0.3868675708770752, "num_input_tokens_seen": 22371757440, "step": 78660, "train_runtime": 764823.4942, "train_tokens_per_second": 29250.876 }, { "epoch": 2.783499592001008, "grad_norm": 0.640625, "learning_rate": 1.679129141989521e-05, "loss": 0.3858372688293457, "num_input_tokens_seen": 22374578816, "step": 78670, "train_runtime": 764918.652, "train_tokens_per_second": 29250.926 }, { "epoch": 2.783853412264737, "grad_norm": 0.58984375, "learning_rate": 1.6790344647557936e-05, "loss": 0.3847068786621094, "num_input_tokens_seen": 22377440960, "step": 78680, "train_runtime": 765018.1488, "train_tokens_per_second": 29250.863 }, { "epoch": 2.784207232528466, "grad_norm": 0.6171875, "learning_rate": 1.6789398035353095e-05, "loss": 0.38566620349884034, "num_input_tokens_seen": 22380344832, "step": 78690, "train_runtime": 765118.0009, "train_tokens_per_second": 29250.841 }, { "epoch": 2.7845610527921947, "grad_norm": 0.61328125, "learning_rate": 1.6788451583235557e-05, "loss": 0.38476803302764895, "num_input_tokens_seen": 22383213120, "step": 78700, "train_runtime": 765216.1778, "train_tokens_per_second": 29250.836 }, { "epoch": 2.7849148730559237, "grad_norm": 0.62109375, "learning_rate": 1.6787505291160198e-05, "loss": 0.38550920486450196, "num_input_tokens_seen": 22386001152, "step": 78710, "train_runtime": 765306.815, "train_tokens_per_second": 29251.015 }, { "epoch": 2.785268693319652, "grad_norm": 0.6328125, "learning_rate": 1.6786559159081923e-05, "loss": 0.3879872798919678, "num_input_tokens_seen": 22388851200, "step": 78720, "train_runtime": 765405.6575, "train_tokens_per_second": 29250.961 }, { "epoch": 2.785622513583381, "grad_norm": 0.6015625, "learning_rate": 1.6785613186955645e-05, "loss": 0.38557913303375246, "num_input_tokens_seen": 22391718272, "step": 78730, "train_runtime": 765504.1252, "train_tokens_per_second": 29250.944 }, { "epoch": 2.7859763338471097, "grad_norm": 0.59765625, "learning_rate": 1.6784667374736305e-05, "loss": 0.3802063226699829, "num_input_tokens_seen": 22394603136, "step": 78740, "train_runtime": 765604.2003, "train_tokens_per_second": 29250.889 }, { "epoch": 2.7863301541108387, "grad_norm": 0.61328125, "learning_rate": 1.678372172237886e-05, "loss": 0.3919590950012207, "num_input_tokens_seen": 22397408832, "step": 78750, "train_runtime": 765700.2599, "train_tokens_per_second": 29250.883 }, { "epoch": 2.7866839743745673, "grad_norm": 0.63671875, "learning_rate": 1.678277622983827e-05, "loss": 0.3880882501602173, "num_input_tokens_seen": 22400283968, "step": 78760, "train_runtime": 765800.2557, "train_tokens_per_second": 29250.818 }, { "epoch": 2.7870377946382963, "grad_norm": 0.61328125, "learning_rate": 1.678183089706954e-05, "loss": 0.3854238033294678, "num_input_tokens_seen": 22403159552, "step": 78770, "train_runtime": 765898.8163, "train_tokens_per_second": 29250.808 }, { "epoch": 2.787391614902025, "grad_norm": 0.58984375, "learning_rate": 1.6780885724027666e-05, "loss": 0.38970532417297366, "num_input_tokens_seen": 22405994944, "step": 78780, "train_runtime": 765997.5295, "train_tokens_per_second": 29250.74 }, { "epoch": 2.787745435165754, "grad_norm": 0.6171875, "learning_rate": 1.6779940710667678e-05, "loss": 0.3870706558227539, "num_input_tokens_seen": 22408906560, "step": 78790, "train_runtime": 766098.8858, "train_tokens_per_second": 29250.671 }, { "epoch": 2.788099255429483, "grad_norm": 0.609375, "learning_rate": 1.677899585694461e-05, "loss": 0.38471298217773436, "num_input_tokens_seen": 22411748224, "step": 78800, "train_runtime": 766194.8742, "train_tokens_per_second": 29250.715 }, { "epoch": 2.7884530756932113, "grad_norm": 0.60546875, "learning_rate": 1.677805116281354e-05, "loss": 0.3853740692138672, "num_input_tokens_seen": 22414616128, "step": 78810, "train_runtime": 766294.7032, "train_tokens_per_second": 29250.647 }, { "epoch": 2.78880689595694, "grad_norm": 0.65234375, "learning_rate": 1.6777106628229533e-05, "loss": 0.38826632499694824, "num_input_tokens_seen": 22417387840, "step": 78820, "train_runtime": 766388.8791, "train_tokens_per_second": 29250.67 }, { "epoch": 2.789160716220669, "grad_norm": 0.62109375, "learning_rate": 1.677616225314769e-05, "loss": 0.3869755506515503, "num_input_tokens_seen": 22420179392, "step": 78830, "train_runtime": 766482.6747, "train_tokens_per_second": 29250.732 }, { "epoch": 2.789514536484398, "grad_norm": 0.64453125, "learning_rate": 1.6775218037523117e-05, "loss": 0.38819022178649903, "num_input_tokens_seen": 22423023808, "step": 78840, "train_runtime": 766579.0447, "train_tokens_per_second": 29250.765 }, { "epoch": 2.7898683567481264, "grad_norm": 0.6171875, "learning_rate": 1.6774273981310952e-05, "loss": 0.38688805103302004, "num_input_tokens_seen": 22425856768, "step": 78850, "train_runtime": 766676.0618, "train_tokens_per_second": 29250.759 }, { "epoch": 2.790222177011855, "grad_norm": 0.6171875, "learning_rate": 1.6773330084466342e-05, "loss": 0.386118221282959, "num_input_tokens_seen": 22428683712, "step": 78860, "train_runtime": 766773.9637, "train_tokens_per_second": 29250.711 }, { "epoch": 2.790575997275584, "grad_norm": 0.609375, "learning_rate": 1.6772386346944455e-05, "loss": 0.3862916469573975, "num_input_tokens_seen": 22431505600, "step": 78870, "train_runtime": 766868.901, "train_tokens_per_second": 29250.77 }, { "epoch": 2.790929817539313, "grad_norm": 0.609375, "learning_rate": 1.6771442768700477e-05, "loss": 0.38166322708129885, "num_input_tokens_seen": 22434373568, "step": 78880, "train_runtime": 766965.4522, "train_tokens_per_second": 29250.827 }, { "epoch": 2.7912836378030415, "grad_norm": 0.6328125, "learning_rate": 1.6770499349689606e-05, "loss": 0.38252265453338624, "num_input_tokens_seen": 22437308160, "step": 78890, "train_runtime": 767066.1437, "train_tokens_per_second": 29250.813 }, { "epoch": 2.7916374580667704, "grad_norm": 0.61328125, "learning_rate": 1.676955608986706e-05, "loss": 0.38495802879333496, "num_input_tokens_seen": 22440142976, "step": 78900, "train_runtime": 767161.2054, "train_tokens_per_second": 29250.883 }, { "epoch": 2.791991278330499, "grad_norm": 0.62890625, "learning_rate": 1.676861298918808e-05, "loss": 0.3879550457000732, "num_input_tokens_seen": 22442945728, "step": 78910, "train_runtime": 767255.816, "train_tokens_per_second": 29250.929 }, { "epoch": 2.792345098594228, "grad_norm": 0.59765625, "learning_rate": 1.6767670047607924e-05, "loss": 0.38320116996765136, "num_input_tokens_seen": 22445788992, "step": 78920, "train_runtime": 767353.7433, "train_tokens_per_second": 29250.902 }, { "epoch": 2.7926989188579565, "grad_norm": 0.64453125, "learning_rate": 1.6766727265081858e-05, "loss": 0.38472561836242675, "num_input_tokens_seen": 22448639232, "step": 78930, "train_runtime": 767452.1006, "train_tokens_per_second": 29250.867 }, { "epoch": 2.7930527391216855, "grad_norm": 0.6015625, "learning_rate": 1.676578464156517e-05, "loss": 0.38680319786071776, "num_input_tokens_seen": 22451453376, "step": 78940, "train_runtime": 767547.9433, "train_tokens_per_second": 29250.881 }, { "epoch": 2.793406559385414, "grad_norm": 0.64453125, "learning_rate": 1.6764842177013176e-05, "loss": 0.3873145341873169, "num_input_tokens_seen": 22454338048, "step": 78950, "train_runtime": 767649.2603, "train_tokens_per_second": 29250.778 }, { "epoch": 2.793760379649143, "grad_norm": 0.6484375, "learning_rate": 1.67638998713812e-05, "loss": 0.38494348526000977, "num_input_tokens_seen": 22457192384, "step": 78960, "train_runtime": 767744.8764, "train_tokens_per_second": 29250.853 }, { "epoch": 2.7941141999128716, "grad_norm": 0.6171875, "learning_rate": 1.676295772462457e-05, "loss": 0.38083271980285643, "num_input_tokens_seen": 22460072896, "step": 78970, "train_runtime": 767846.4679, "train_tokens_per_second": 29250.734 }, { "epoch": 2.7944680201766006, "grad_norm": 0.6015625, "learning_rate": 1.6762015736698667e-05, "loss": 0.39101157188415525, "num_input_tokens_seen": 22462947456, "step": 78980, "train_runtime": 767947.068, "train_tokens_per_second": 29250.646 }, { "epoch": 2.7948218404403296, "grad_norm": 0.60546875, "learning_rate": 1.676107390755886e-05, "loss": 0.38897204399108887, "num_input_tokens_seen": 22465819968, "step": 78990, "train_runtime": 768047.2326, "train_tokens_per_second": 29250.571 }, { "epoch": 2.795175660704058, "grad_norm": 0.625, "learning_rate": 1.6760132237160538e-05, "loss": 0.38744144439697265, "num_input_tokens_seen": 22468670784, "step": 79000, "train_runtime": 768143.3612, "train_tokens_per_second": 29250.622 }, { "epoch": 2.7955294809677866, "grad_norm": 0.61328125, "learning_rate": 1.6759190725459125e-05, "loss": 0.38637101650238037, "num_input_tokens_seen": 22471500608, "step": 79010, "train_runtime": 768240.8708, "train_tokens_per_second": 29250.592 }, { "epoch": 2.7958833012315156, "grad_norm": 0.60546875, "learning_rate": 1.675824937241005e-05, "loss": 0.38822498321533205, "num_input_tokens_seen": 22474348096, "step": 79020, "train_runtime": 768338.8414, "train_tokens_per_second": 29250.569 }, { "epoch": 2.7962371214952446, "grad_norm": 0.6171875, "learning_rate": 1.675730817796875e-05, "loss": 0.3906718254089355, "num_input_tokens_seen": 22477195520, "step": 79030, "train_runtime": 768434.8025, "train_tokens_per_second": 29250.621 }, { "epoch": 2.796590941758973, "grad_norm": 0.61328125, "learning_rate": 1.67563671420907e-05, "loss": 0.3826432228088379, "num_input_tokens_seen": 22480027648, "step": 79040, "train_runtime": 768531.8048, "train_tokens_per_second": 29250.615 }, { "epoch": 2.796944762022702, "grad_norm": 0.63671875, "learning_rate": 1.6755426264731383e-05, "loss": 0.38129429817199706, "num_input_tokens_seen": 22482931776, "step": 79050, "train_runtime": 768632.3431, "train_tokens_per_second": 29250.567 }, { "epoch": 2.7972985822864307, "grad_norm": 0.6328125, "learning_rate": 1.6754485545846296e-05, "loss": 0.38255622386932375, "num_input_tokens_seen": 22485762688, "step": 79060, "train_runtime": 768729.2989, "train_tokens_per_second": 29250.56 }, { "epoch": 2.7976524025501597, "grad_norm": 0.59765625, "learning_rate": 1.675354498539096e-05, "loss": 0.3849782943725586, "num_input_tokens_seen": 22488650496, "step": 79070, "train_runtime": 768827.3218, "train_tokens_per_second": 29250.587 }, { "epoch": 2.798006222813888, "grad_norm": 0.62109375, "learning_rate": 1.675260458332091e-05, "loss": 0.3899967670440674, "num_input_tokens_seen": 22491476864, "step": 79080, "train_runtime": 768925.8452, "train_tokens_per_second": 29250.515 }, { "epoch": 2.798360043077617, "grad_norm": 0.640625, "learning_rate": 1.6751664339591696e-05, "loss": 0.38746883869171145, "num_input_tokens_seen": 22494350720, "step": 79090, "train_runtime": 769027.1071, "train_tokens_per_second": 29250.4 }, { "epoch": 2.7987138633413458, "grad_norm": 0.62890625, "learning_rate": 1.6750724254158888e-05, "loss": 0.38402130603790285, "num_input_tokens_seen": 22497189248, "step": 79100, "train_runtime": 769124.5857, "train_tokens_per_second": 29250.384 }, { "epoch": 2.7990676836050747, "grad_norm": 0.6328125, "learning_rate": 1.674978432697808e-05, "loss": 0.38719642162323, "num_input_tokens_seen": 22500000512, "step": 79110, "train_runtime": 769219.649, "train_tokens_per_second": 29250.424 }, { "epoch": 2.7994215038688033, "grad_norm": 0.59375, "learning_rate": 1.6748844558004877e-05, "loss": 0.38563075065612795, "num_input_tokens_seen": 22502837696, "step": 79120, "train_runtime": 769315.7808, "train_tokens_per_second": 29250.456 }, { "epoch": 2.7997753241325323, "grad_norm": 0.64453125, "learning_rate": 1.6747904947194892e-05, "loss": 0.38919844627380373, "num_input_tokens_seen": 22505659008, "step": 79130, "train_runtime": 769412.7603, "train_tokens_per_second": 29250.436 }, { "epoch": 2.8001291443962613, "grad_norm": 0.63671875, "learning_rate": 1.6746965494503776e-05, "loss": 0.3818293571472168, "num_input_tokens_seen": 22508518272, "step": 79140, "train_runtime": 769514.9417, "train_tokens_per_second": 29250.268 }, { "epoch": 2.80048296465999, "grad_norm": 0.62109375, "learning_rate": 1.6746026199887178e-05, "loss": 0.385685133934021, "num_input_tokens_seen": 22511400896, "step": 79150, "train_runtime": 769614.656, "train_tokens_per_second": 29250.224 }, { "epoch": 2.8008367849237183, "grad_norm": 0.625, "learning_rate": 1.674508706330078e-05, "loss": 0.38182744979858396, "num_input_tokens_seen": 22514250368, "step": 79160, "train_runtime": 769711.907, "train_tokens_per_second": 29250.23 }, { "epoch": 2.8011906051874473, "grad_norm": 0.62109375, "learning_rate": 1.674414808470027e-05, "loss": 0.3875946760177612, "num_input_tokens_seen": 22517091392, "step": 79170, "train_runtime": 769808.3316, "train_tokens_per_second": 29250.257 }, { "epoch": 2.8015444254511763, "grad_norm": 0.6328125, "learning_rate": 1.674320926404136e-05, "loss": 0.38591713905334474, "num_input_tokens_seen": 22519973952, "step": 79180, "train_runtime": 769910.0173, "train_tokens_per_second": 29250.138 }, { "epoch": 2.801898245714905, "grad_norm": 0.61328125, "learning_rate": 1.6742270601279773e-05, "loss": 0.38675990104675295, "num_input_tokens_seen": 22522788032, "step": 79190, "train_runtime": 770005.1674, "train_tokens_per_second": 29250.178 }, { "epoch": 2.8022520659786334, "grad_norm": 0.60546875, "learning_rate": 1.674133209637126e-05, "loss": 0.38520815372467043, "num_input_tokens_seen": 22525527232, "step": 79200, "train_runtime": 770097.6322, "train_tokens_per_second": 29250.223 }, { "epoch": 2.8026058862423624, "grad_norm": 0.625, "learning_rate": 1.6740393749271583e-05, "loss": 0.3826102018356323, "num_input_tokens_seen": 22528348864, "step": 79210, "train_runtime": 770193.5533, "train_tokens_per_second": 29250.243 }, { "epoch": 2.8029597065060914, "grad_norm": 0.6328125, "learning_rate": 1.6739455559936515e-05, "loss": 0.38376452922821047, "num_input_tokens_seen": 22531238848, "step": 79220, "train_runtime": 770295.2241, "train_tokens_per_second": 29250.134 }, { "epoch": 2.80331352676982, "grad_norm": 0.62890625, "learning_rate": 1.6738517528321858e-05, "loss": 0.3872870922088623, "num_input_tokens_seen": 22534054976, "step": 79230, "train_runtime": 770389.2595, "train_tokens_per_second": 29250.22 }, { "epoch": 2.803667347033549, "grad_norm": 0.64453125, "learning_rate": 1.673757965438342e-05, "loss": 0.3831596851348877, "num_input_tokens_seen": 22536885504, "step": 79240, "train_runtime": 770484.0029, "train_tokens_per_second": 29250.296 }, { "epoch": 2.8040211672972775, "grad_norm": 0.6328125, "learning_rate": 1.6736641938077036e-05, "loss": 0.38428702354431155, "num_input_tokens_seen": 22539703424, "step": 79250, "train_runtime": 770580.5287, "train_tokens_per_second": 29250.289 }, { "epoch": 2.8043749875610064, "grad_norm": 0.60546875, "learning_rate": 1.6735704379358556e-05, "loss": 0.38142881393432615, "num_input_tokens_seen": 22542576768, "step": 79260, "train_runtime": 770678.0908, "train_tokens_per_second": 29250.315 }, { "epoch": 2.804728807824735, "grad_norm": 0.62109375, "learning_rate": 1.6734766978183844e-05, "loss": 0.38763766288757323, "num_input_tokens_seen": 22545414400, "step": 79270, "train_runtime": 770775.9565, "train_tokens_per_second": 29250.282 }, { "epoch": 2.805082628088464, "grad_norm": 0.578125, "learning_rate": 1.6733829734508786e-05, "loss": 0.38669252395629883, "num_input_tokens_seen": 22548244032, "step": 79280, "train_runtime": 770870.6481, "train_tokens_per_second": 29250.36 }, { "epoch": 2.8054364483521925, "grad_norm": 0.6171875, "learning_rate": 1.6732892648289272e-05, "loss": 0.38689565658569336, "num_input_tokens_seen": 22551078080, "step": 79290, "train_runtime": 770966.7723, "train_tokens_per_second": 29250.389 }, { "epoch": 2.8057902686159215, "grad_norm": 0.62109375, "learning_rate": 1.6731955719481236e-05, "loss": 0.38439764976501467, "num_input_tokens_seen": 22553890176, "step": 79300, "train_runtime": 771060.6516, "train_tokens_per_second": 29250.475 }, { "epoch": 2.80614408887965, "grad_norm": 0.60546875, "learning_rate": 1.6731018948040602e-05, "loss": 0.38398351669311526, "num_input_tokens_seen": 22556735360, "step": 79310, "train_runtime": 771158.8378, "train_tokens_per_second": 29250.44 }, { "epoch": 2.806497909143379, "grad_norm": 0.61328125, "learning_rate": 1.6730082333923324e-05, "loss": 0.38662004470825195, "num_input_tokens_seen": 22559638784, "step": 79320, "train_runtime": 771261.0718, "train_tokens_per_second": 29250.327 }, { "epoch": 2.806851729407108, "grad_norm": 0.62109375, "learning_rate": 1.6729145877085377e-05, "loss": 0.38518533706665037, "num_input_tokens_seen": 22562438080, "step": 79330, "train_runtime": 771355.3018, "train_tokens_per_second": 29250.383 }, { "epoch": 2.8072055496708366, "grad_norm": 0.63671875, "learning_rate": 1.6728209577482738e-05, "loss": 0.383742618560791, "num_input_tokens_seen": 22565311872, "step": 79340, "train_runtime": 771452.5265, "train_tokens_per_second": 29250.422 }, { "epoch": 2.807559369934565, "grad_norm": 0.6171875, "learning_rate": 1.672727343507142e-05, "loss": 0.3861359119415283, "num_input_tokens_seen": 22568143872, "step": 79350, "train_runtime": 771549.3219, "train_tokens_per_second": 29250.423 }, { "epoch": 2.807913190198294, "grad_norm": 0.64453125, "learning_rate": 1.6726337449807442e-05, "loss": 0.3795956611633301, "num_input_tokens_seen": 22570998912, "step": 79360, "train_runtime": 771645.9935, "train_tokens_per_second": 29250.458 }, { "epoch": 2.808267010462023, "grad_norm": 0.625, "learning_rate": 1.6725401621646838e-05, "loss": 0.38527793884277345, "num_input_tokens_seen": 22573867392, "step": 79370, "train_runtime": 771744.4834, "train_tokens_per_second": 29250.442 }, { "epoch": 2.8086208307257516, "grad_norm": 0.59375, "learning_rate": 1.672446595054567e-05, "loss": 0.3826130867004395, "num_input_tokens_seen": 22576701120, "step": 79380, "train_runtime": 771840.792, "train_tokens_per_second": 29250.464 }, { "epoch": 2.8089746509894806, "grad_norm": 0.640625, "learning_rate": 1.6723530436460007e-05, "loss": 0.3877525806427002, "num_input_tokens_seen": 22579582016, "step": 79390, "train_runtime": 771940.6443, "train_tokens_per_second": 29250.412 }, { "epoch": 2.809328471253209, "grad_norm": 0.6171875, "learning_rate": 1.6722595079345938e-05, "loss": 0.3821340799331665, "num_input_tokens_seen": 22582426944, "step": 79400, "train_runtime": 772036.1112, "train_tokens_per_second": 29250.48 }, { "epoch": 2.809682291516938, "grad_norm": 0.60546875, "learning_rate": 1.6721659879159576e-05, "loss": 0.3870774984359741, "num_input_tokens_seen": 22585227584, "step": 79410, "train_runtime": 772129.5818, "train_tokens_per_second": 29250.566 }, { "epoch": 2.8100361117806667, "grad_norm": 0.6171875, "learning_rate": 1.672072483585704e-05, "loss": 0.3856063365936279, "num_input_tokens_seen": 22588139392, "step": 79420, "train_runtime": 772229.4001, "train_tokens_per_second": 29250.556 }, { "epoch": 2.8103899320443957, "grad_norm": 0.625, "learning_rate": 1.6719789949394475e-05, "loss": 0.38336544036865233, "num_input_tokens_seen": 22590980032, "step": 79430, "train_runtime": 772328.7449, "train_tokens_per_second": 29250.472 }, { "epoch": 2.8107437523081242, "grad_norm": 0.609375, "learning_rate": 1.6718855219728038e-05, "loss": 0.3862900972366333, "num_input_tokens_seen": 22593824960, "step": 79440, "train_runtime": 772425.5995, "train_tokens_per_second": 29250.487 }, { "epoch": 2.811097572571853, "grad_norm": 0.59375, "learning_rate": 1.6717920646813904e-05, "loss": 0.3862600564956665, "num_input_tokens_seen": 22596675008, "step": 79450, "train_runtime": 772521.7824, "train_tokens_per_second": 29250.534 }, { "epoch": 2.8114513928355818, "grad_norm": 0.6328125, "learning_rate": 1.671698623060827e-05, "loss": 0.3853559970855713, "num_input_tokens_seen": 22599531776, "step": 79460, "train_runtime": 772620.4066, "train_tokens_per_second": 29250.498 }, { "epoch": 2.8118052130993108, "grad_norm": 0.61328125, "learning_rate": 1.6716051971067343e-05, "loss": 0.3849400520324707, "num_input_tokens_seen": 22602311936, "step": 79470, "train_runtime": 772713.2379, "train_tokens_per_second": 29250.582 }, { "epoch": 2.8121590333630397, "grad_norm": 0.6328125, "learning_rate": 1.671511786814735e-05, "loss": 0.3867997646331787, "num_input_tokens_seen": 22605161536, "step": 79480, "train_runtime": 772812.6185, "train_tokens_per_second": 29250.508 }, { "epoch": 2.8125128536267683, "grad_norm": 0.59765625, "learning_rate": 1.671418392180454e-05, "loss": 0.38906450271606446, "num_input_tokens_seen": 22608042176, "step": 79490, "train_runtime": 772913.7003, "train_tokens_per_second": 29250.409 }, { "epoch": 2.812866673890497, "grad_norm": 0.625, "learning_rate": 1.671325013199517e-05, "loss": 0.38559508323669434, "num_input_tokens_seen": 22610894592, "step": 79500, "train_runtime": 773010.0466, "train_tokens_per_second": 29250.454 }, { "epoch": 2.813220494154226, "grad_norm": 0.62890625, "learning_rate": 1.671231649867552e-05, "loss": 0.39032411575317383, "num_input_tokens_seen": 22613708032, "step": 79510, "train_runtime": 773107.7141, "train_tokens_per_second": 29250.398 }, { "epoch": 2.813574314417955, "grad_norm": 0.61328125, "learning_rate": 1.671138302180189e-05, "loss": 0.38908555507659914, "num_input_tokens_seen": 22616538560, "step": 79520, "train_runtime": 773204.8063, "train_tokens_per_second": 29250.385 }, { "epoch": 2.8139281346816833, "grad_norm": 0.625, "learning_rate": 1.6710449701330584e-05, "loss": 0.38480467796325685, "num_input_tokens_seen": 22619327744, "step": 79530, "train_runtime": 773296.5492, "train_tokens_per_second": 29250.522 }, { "epoch": 2.814281954945412, "grad_norm": 0.62890625, "learning_rate": 1.670951653721794e-05, "loss": 0.386159610748291, "num_input_tokens_seen": 22622145408, "step": 79540, "train_runtime": 773391.6603, "train_tokens_per_second": 29250.568 }, { "epoch": 2.814635775209141, "grad_norm": 0.62109375, "learning_rate": 1.6708583529420303e-05, "loss": 0.389597749710083, "num_input_tokens_seen": 22624937088, "step": 79550, "train_runtime": 773485.379, "train_tokens_per_second": 29250.633 }, { "epoch": 2.81498959547287, "grad_norm": 0.65625, "learning_rate": 1.6707650677894036e-05, "loss": 0.3874568700790405, "num_input_tokens_seen": 22627746688, "step": 79560, "train_runtime": 773579.6011, "train_tokens_per_second": 29250.702 }, { "epoch": 2.8153434157365984, "grad_norm": 0.63671875, "learning_rate": 1.670671798259552e-05, "loss": 0.38398401737213134, "num_input_tokens_seen": 22630539840, "step": 79570, "train_runtime": 773674.6064, "train_tokens_per_second": 29250.721 }, { "epoch": 2.8156972360003274, "grad_norm": 0.63671875, "learning_rate": 1.6705785443481153e-05, "loss": 0.3836381196975708, "num_input_tokens_seen": 22633376000, "step": 79580, "train_runtime": 773768.2135, "train_tokens_per_second": 29250.847 }, { "epoch": 2.816051056264056, "grad_norm": 0.61328125, "learning_rate": 1.6704853060507353e-05, "loss": 0.3806574821472168, "num_input_tokens_seen": 22636252992, "step": 79590, "train_runtime": 773867.8512, "train_tokens_per_second": 29250.799 }, { "epoch": 2.816404876527785, "grad_norm": 0.65234375, "learning_rate": 1.6703920833630547e-05, "loss": 0.38527727127075195, "num_input_tokens_seen": 22639025728, "step": 79600, "train_runtime": 773960.6244, "train_tokens_per_second": 29250.875 }, { "epoch": 2.8167586967915135, "grad_norm": 0.625, "learning_rate": 1.670298876280719e-05, "loss": 0.38628311157226564, "num_input_tokens_seen": 22641890048, "step": 79610, "train_runtime": 774057.9569, "train_tokens_per_second": 29250.898 }, { "epoch": 2.8171125170552425, "grad_norm": 0.62890625, "learning_rate": 1.6702056847993747e-05, "loss": 0.3895313262939453, "num_input_tokens_seen": 22644749760, "step": 79620, "train_runtime": 774154.8705, "train_tokens_per_second": 29250.93 }, { "epoch": 2.8174663373189714, "grad_norm": 0.61328125, "learning_rate": 1.6701125089146698e-05, "loss": 0.38973727226257326, "num_input_tokens_seen": 22647593088, "step": 79630, "train_runtime": 774251.9179, "train_tokens_per_second": 29250.936 }, { "epoch": 2.8178201575827, "grad_norm": 0.6015625, "learning_rate": 1.6700193486222547e-05, "loss": 0.3906029224395752, "num_input_tokens_seen": 22650394176, "step": 79640, "train_runtime": 774346.1597, "train_tokens_per_second": 29250.993 }, { "epoch": 2.8181739778464285, "grad_norm": 0.62109375, "learning_rate": 1.669926203917781e-05, "loss": 0.38452539443969724, "num_input_tokens_seen": 22653288576, "step": 79650, "train_runtime": 774442.431, "train_tokens_per_second": 29251.094 }, { "epoch": 2.8185277981101575, "grad_norm": 0.609375, "learning_rate": 1.669833074796902e-05, "loss": 0.38055756092071535, "num_input_tokens_seen": 22656080832, "step": 79660, "train_runtime": 774536.5878, "train_tokens_per_second": 29251.143 }, { "epoch": 2.8188816183738865, "grad_norm": 0.63671875, "learning_rate": 1.669739961255273e-05, "loss": 0.38433547019958497, "num_input_tokens_seen": 22658895168, "step": 79670, "train_runtime": 774633.1622, "train_tokens_per_second": 29251.13 }, { "epoch": 2.819235438637615, "grad_norm": 0.625, "learning_rate": 1.669646863288551e-05, "loss": 0.38738934993743895, "num_input_tokens_seen": 22661759104, "step": 79680, "train_runtime": 774728.8904, "train_tokens_per_second": 29251.212 }, { "epoch": 2.8195892589013436, "grad_norm": 0.61328125, "learning_rate": 1.669553780892394e-05, "loss": 0.3875512838363647, "num_input_tokens_seen": 22664598336, "step": 79690, "train_runtime": 774828.0474, "train_tokens_per_second": 29251.133 }, { "epoch": 2.8199430791650726, "grad_norm": 0.62109375, "learning_rate": 1.6694607140624624e-05, "loss": 0.3931875467300415, "num_input_tokens_seen": 22667450240, "step": 79700, "train_runtime": 774925.6416, "train_tokens_per_second": 29251.129 }, { "epoch": 2.8202968994288016, "grad_norm": 0.625, "learning_rate": 1.6693676627944183e-05, "loss": 0.3834944486618042, "num_input_tokens_seen": 22670263360, "step": 79710, "train_runtime": 775021.9081, "train_tokens_per_second": 29251.126 }, { "epoch": 2.82065071969253, "grad_norm": 0.625, "learning_rate": 1.6692746270839252e-05, "loss": 0.3909069299697876, "num_input_tokens_seen": 22673060800, "step": 79720, "train_runtime": 775117.582, "train_tokens_per_second": 29251.124 }, { "epoch": 2.821004539956259, "grad_norm": 0.61328125, "learning_rate": 1.6691816069266487e-05, "loss": 0.38351175785064695, "num_input_tokens_seen": 22675910144, "step": 79730, "train_runtime": 775214.9135, "train_tokens_per_second": 29251.127 }, { "epoch": 2.8213583602199876, "grad_norm": 0.640625, "learning_rate": 1.6690886023182548e-05, "loss": 0.38737714290618896, "num_input_tokens_seen": 22678804544, "step": 79740, "train_runtime": 775312.7158, "train_tokens_per_second": 29251.171 }, { "epoch": 2.8217121804837166, "grad_norm": 0.6328125, "learning_rate": 1.6689956132544133e-05, "loss": 0.3835658073425293, "num_input_tokens_seen": 22681628544, "step": 79750, "train_runtime": 775411.3488, "train_tokens_per_second": 29251.092 }, { "epoch": 2.822066000747445, "grad_norm": 0.6015625, "learning_rate": 1.6689026397307936e-05, "loss": 0.3828464984893799, "num_input_tokens_seen": 22684480640, "step": 79760, "train_runtime": 775508.2772, "train_tokens_per_second": 29251.114 }, { "epoch": 2.822419821011174, "grad_norm": 0.62890625, "learning_rate": 1.6688096817430687e-05, "loss": 0.38687493801116946, "num_input_tokens_seen": 22687366912, "step": 79770, "train_runtime": 775607.9198, "train_tokens_per_second": 29251.077 }, { "epoch": 2.8227736412749027, "grad_norm": 0.62890625, "learning_rate": 1.6687167392869115e-05, "loss": 0.38324871063232424, "num_input_tokens_seen": 22690203008, "step": 79780, "train_runtime": 775704.5829, "train_tokens_per_second": 29251.088 }, { "epoch": 2.8231274615386317, "grad_norm": 0.62890625, "learning_rate": 1.668623812357998e-05, "loss": 0.38308563232421877, "num_input_tokens_seen": 22693049152, "step": 79790, "train_runtime": 775799.6588, "train_tokens_per_second": 29251.172 }, { "epoch": 2.8234812818023602, "grad_norm": 0.6328125, "learning_rate": 1.6685309009520046e-05, "loss": 0.38517184257507325, "num_input_tokens_seen": 22695839424, "step": 79800, "train_runtime": 775893.286, "train_tokens_per_second": 29251.238 }, { "epoch": 2.8238351020660892, "grad_norm": 0.61328125, "learning_rate": 1.668438005064611e-05, "loss": 0.38472585678100585, "num_input_tokens_seen": 22698688832, "step": 79810, "train_runtime": 775994.041, "train_tokens_per_second": 29251.112 }, { "epoch": 2.824188922329818, "grad_norm": 0.61328125, "learning_rate": 1.6683451246914973e-05, "loss": 0.3862781047821045, "num_input_tokens_seen": 22701506496, "step": 79820, "train_runtime": 776089.4126, "train_tokens_per_second": 29251.148 }, { "epoch": 2.8245427425935468, "grad_norm": 0.6171875, "learning_rate": 1.6682522598283452e-05, "loss": 0.38753132820129393, "num_input_tokens_seen": 22704423808, "step": 79830, "train_runtime": 776189.2958, "train_tokens_per_second": 29251.143 }, { "epoch": 2.8248965628572753, "grad_norm": 0.61328125, "learning_rate": 1.6681594104708393e-05, "loss": 0.38221988677978513, "num_input_tokens_seen": 22707222912, "step": 79840, "train_runtime": 776284.2988, "train_tokens_per_second": 29251.169 }, { "epoch": 2.8252503831210043, "grad_norm": 0.640625, "learning_rate": 1.6680665766146643e-05, "loss": 0.38983840942382814, "num_input_tokens_seen": 22710062464, "step": 79850, "train_runtime": 776381.5522, "train_tokens_per_second": 29251.162 }, { "epoch": 2.8256042033847333, "grad_norm": 0.60546875, "learning_rate": 1.667973758255508e-05, "loss": 0.38589110374450686, "num_input_tokens_seen": 22712959424, "step": 79860, "train_runtime": 776480.9717, "train_tokens_per_second": 29251.147 }, { "epoch": 2.825958023648462, "grad_norm": 0.62109375, "learning_rate": 1.667880955389059e-05, "loss": 0.38367085456848143, "num_input_tokens_seen": 22715825792, "step": 79870, "train_runtime": 776579.961, "train_tokens_per_second": 29251.11 }, { "epoch": 2.826311843912191, "grad_norm": 0.57421875, "learning_rate": 1.6677881680110082e-05, "loss": 0.3864089012145996, "num_input_tokens_seen": 22718702272, "step": 79880, "train_runtime": 776679.1135, "train_tokens_per_second": 29251.079 }, { "epoch": 2.8266656641759194, "grad_norm": 0.68359375, "learning_rate": 1.6676953961170472e-05, "loss": 0.3819018602371216, "num_input_tokens_seen": 22721534784, "step": 79890, "train_runtime": 776775.0115, "train_tokens_per_second": 29251.114 }, { "epoch": 2.8270194844396483, "grad_norm": 0.64453125, "learning_rate": 1.6676026397028705e-05, "loss": 0.3894267797470093, "num_input_tokens_seen": 22724360256, "step": 79900, "train_runtime": 776871.0666, "train_tokens_per_second": 29251.135 }, { "epoch": 2.827373304703377, "grad_norm": 0.59765625, "learning_rate": 1.6675098987641735e-05, "loss": 0.3883958101272583, "num_input_tokens_seen": 22727262016, "step": 79910, "train_runtime": 776974.9496, "train_tokens_per_second": 29250.959 }, { "epoch": 2.827727124967106, "grad_norm": 0.6171875, "learning_rate": 1.6674171732966538e-05, "loss": 0.386810827255249, "num_input_tokens_seen": 22730093376, "step": 79920, "train_runtime": 777071.0968, "train_tokens_per_second": 29250.983 }, { "epoch": 2.8280809452308344, "grad_norm": 0.60546875, "learning_rate": 1.6673244632960093e-05, "loss": 0.38858642578125, "num_input_tokens_seen": 22732973632, "step": 79930, "train_runtime": 777173.3332, "train_tokens_per_second": 29250.841 }, { "epoch": 2.8284347654945634, "grad_norm": 0.6328125, "learning_rate": 1.6672317687579418e-05, "loss": 0.38652629852294923, "num_input_tokens_seen": 22735793600, "step": 79940, "train_runtime": 777268.3467, "train_tokens_per_second": 29250.893 }, { "epoch": 2.828788585758292, "grad_norm": 0.60546875, "learning_rate": 1.6671390896781527e-05, "loss": 0.3870053291320801, "num_input_tokens_seen": 22738639808, "step": 79950, "train_runtime": 777364.8108, "train_tokens_per_second": 29250.925 }, { "epoch": 2.829142406022021, "grad_norm": 0.609375, "learning_rate": 1.6670464260523466e-05, "loss": 0.3891130447387695, "num_input_tokens_seen": 22741458816, "step": 79960, "train_runtime": 777455.8513, "train_tokens_per_second": 29251.126 }, { "epoch": 2.82949622628575, "grad_norm": 0.62109375, "learning_rate": 1.666953777876229e-05, "loss": 0.38746280670166017, "num_input_tokens_seen": 22744280000, "step": 79970, "train_runtime": 777549.9918, "train_tokens_per_second": 29251.212 }, { "epoch": 2.8298500465494785, "grad_norm": 0.609375, "learning_rate": 1.6668611451455068e-05, "loss": 0.3845673084259033, "num_input_tokens_seen": 22747096128, "step": 79980, "train_runtime": 777646.0949, "train_tokens_per_second": 29251.219 }, { "epoch": 2.830203866813207, "grad_norm": 0.609375, "learning_rate": 1.6667685278558893e-05, "loss": 0.38469481468200684, "num_input_tokens_seen": 22749936704, "step": 79990, "train_runtime": 777744.0866, "train_tokens_per_second": 29251.186 }, { "epoch": 2.830557687076936, "grad_norm": 0.61328125, "learning_rate": 1.666675926003087e-05, "loss": 0.3861361503601074, "num_input_tokens_seen": 22752762176, "step": 80000, "train_runtime": 777842.3534, "train_tokens_per_second": 29251.123 }, { "epoch": 2.830557687076936, "eval_loss": 0.33632194995880127, "eval_runtime": 8.4203, "eval_samples_per_second": 473.62, "eval_steps_per_second": 3.8, "num_input_tokens_seen": 22752762176, "step": 80000 }, { "epoch": 2.830911507340665, "grad_norm": 0.64453125, "learning_rate": 1.6665833395828124e-05, "loss": 0.3849381446838379, "num_input_tokens_seen": 22755631936, "step": 80010, "train_runtime": 777968.77, "train_tokens_per_second": 29250.058 }, { "epoch": 2.8312653276043935, "grad_norm": 0.6328125, "learning_rate": 1.6664907685907795e-05, "loss": 0.3885098218917847, "num_input_tokens_seen": 22758462976, "step": 80020, "train_runtime": 778067.0432, "train_tokens_per_second": 29250.003 }, { "epoch": 2.831619147868122, "grad_norm": 0.64453125, "learning_rate": 1.666398213022704e-05, "loss": 0.3882602691650391, "num_input_tokens_seen": 22761258944, "step": 80030, "train_runtime": 778160.0273, "train_tokens_per_second": 29250.1 }, { "epoch": 2.831972968131851, "grad_norm": 0.6015625, "learning_rate": 1.6663056728743024e-05, "loss": 0.38812813758850095, "num_input_tokens_seen": 22764086592, "step": 80040, "train_runtime": 778256.4386, "train_tokens_per_second": 29250.11 }, { "epoch": 2.83232678839558, "grad_norm": 0.62109375, "learning_rate": 1.6662131481412947e-05, "loss": 0.384420108795166, "num_input_tokens_seen": 22766929536, "step": 80050, "train_runtime": 778354.7476, "train_tokens_per_second": 29250.068 }, { "epoch": 2.8326806086593086, "grad_norm": 0.62890625, "learning_rate": 1.6661206388194006e-05, "loss": 0.3842109203338623, "num_input_tokens_seen": 22769697472, "step": 80060, "train_runtime": 778449.7291, "train_tokens_per_second": 29250.055 }, { "epoch": 2.8330344289230376, "grad_norm": 0.61328125, "learning_rate": 1.6660281449043436e-05, "loss": 0.3840348720550537, "num_input_tokens_seen": 22772522304, "step": 80070, "train_runtime": 778548.0338, "train_tokens_per_second": 29249.99 }, { "epoch": 2.833388249186766, "grad_norm": 0.6328125, "learning_rate": 1.6659356663918466e-05, "loss": 0.38687548637390134, "num_input_tokens_seen": 22775296320, "step": 80080, "train_runtime": 778640.3477, "train_tokens_per_second": 29250.085 }, { "epoch": 2.833742069450495, "grad_norm": 0.63671875, "learning_rate": 1.6658432032776354e-05, "loss": 0.38970940113067626, "num_input_tokens_seen": 22778134208, "step": 80090, "train_runtime": 778736.5431, "train_tokens_per_second": 29250.116 }, { "epoch": 2.8340958897142237, "grad_norm": 0.62109375, "learning_rate": 1.6657507555574375e-05, "loss": 0.39075944423675535, "num_input_tokens_seen": 22780978304, "step": 80100, "train_runtime": 778832.5269, "train_tokens_per_second": 29250.163 }, { "epoch": 2.8344497099779526, "grad_norm": 0.5859375, "learning_rate": 1.6656583232269816e-05, "loss": 0.38437342643737793, "num_input_tokens_seen": 22783811328, "step": 80110, "train_runtime": 778926.3621, "train_tokens_per_second": 29250.276 }, { "epoch": 2.834803530241681, "grad_norm": 0.625, "learning_rate": 1.665565906281999e-05, "loss": 0.3807594537734985, "num_input_tokens_seen": 22786625408, "step": 80120, "train_runtime": 779021.4333, "train_tokens_per_second": 29250.319 }, { "epoch": 2.83515735050541, "grad_norm": 0.61328125, "learning_rate": 1.6654735047182213e-05, "loss": 0.3859172105789185, "num_input_tokens_seen": 22789406720, "step": 80130, "train_runtime": 779116.6409, "train_tokens_per_second": 29250.314 }, { "epoch": 2.8355111707691387, "grad_norm": 0.60546875, "learning_rate": 1.6653811185313824e-05, "loss": 0.38521318435668944, "num_input_tokens_seen": 22792252736, "step": 80140, "train_runtime": 779213.4352, "train_tokens_per_second": 29250.333 }, { "epoch": 2.8358649910328677, "grad_norm": 0.62890625, "learning_rate": 1.665288747717218e-05, "loss": 0.3856534481048584, "num_input_tokens_seen": 22795048704, "step": 80150, "train_runtime": 779306.3575, "train_tokens_per_second": 29250.433 }, { "epoch": 2.8362188112965967, "grad_norm": 0.6171875, "learning_rate": 1.6651963922714655e-05, "loss": 0.38876359462738036, "num_input_tokens_seen": 22797884928, "step": 80160, "train_runtime": 779404.6228, "train_tokens_per_second": 29250.385 }, { "epoch": 2.8365726315603252, "grad_norm": 0.62109375, "learning_rate": 1.6651040521898635e-05, "loss": 0.3902108192443848, "num_input_tokens_seen": 22800727424, "step": 80170, "train_runtime": 779499.9339, "train_tokens_per_second": 29250.455 }, { "epoch": 2.836926451824054, "grad_norm": 0.6171875, "learning_rate": 1.6650117274681528e-05, "loss": 0.3851343631744385, "num_input_tokens_seen": 22803598144, "step": 80180, "train_runtime": 779596.4794, "train_tokens_per_second": 29250.515 }, { "epoch": 2.8372802720877828, "grad_norm": 0.609375, "learning_rate": 1.6649194181020756e-05, "loss": 0.3855489730834961, "num_input_tokens_seen": 22806523392, "step": 80190, "train_runtime": 779698.1872, "train_tokens_per_second": 29250.451 }, { "epoch": 2.8376340923515118, "grad_norm": 0.62109375, "learning_rate": 1.6648271240873753e-05, "loss": 0.3873851776123047, "num_input_tokens_seen": 22809368256, "step": 80200, "train_runtime": 779796.3105, "train_tokens_per_second": 29250.418 }, { "epoch": 2.8379879126152403, "grad_norm": 0.62890625, "learning_rate": 1.664734845419798e-05, "loss": 0.3816483736038208, "num_input_tokens_seen": 22812157952, "step": 80210, "train_runtime": 779888.013, "train_tokens_per_second": 29250.556 }, { "epoch": 2.8383417328789693, "grad_norm": 0.62109375, "learning_rate": 1.66464258209509e-05, "loss": 0.3907389402389526, "num_input_tokens_seen": 22815019264, "step": 80220, "train_runtime": 779987.0567, "train_tokens_per_second": 29250.51 }, { "epoch": 2.838695553142698, "grad_norm": 0.6015625, "learning_rate": 1.664550334109001e-05, "loss": 0.38678407669067383, "num_input_tokens_seen": 22817832448, "step": 80230, "train_runtime": 780082.5395, "train_tokens_per_second": 29250.536 }, { "epoch": 2.839049373406427, "grad_norm": 0.63671875, "learning_rate": 1.664458101457281e-05, "loss": 0.3886272430419922, "num_input_tokens_seen": 22820726848, "step": 80240, "train_runtime": 780183.7718, "train_tokens_per_second": 29250.451 }, { "epoch": 2.8394031936701554, "grad_norm": 0.61328125, "learning_rate": 1.664365884135682e-05, "loss": 0.39076919555664064, "num_input_tokens_seen": 22823606464, "step": 80250, "train_runtime": 780281.8615, "train_tokens_per_second": 29250.464 }, { "epoch": 2.8397570139338844, "grad_norm": 0.6171875, "learning_rate": 1.6642736821399583e-05, "loss": 0.3917582035064697, "num_input_tokens_seen": 22826425216, "step": 80260, "train_runtime": 780377.1104, "train_tokens_per_second": 29250.506 }, { "epoch": 2.840110834197613, "grad_norm": 0.64453125, "learning_rate": 1.6641814954658643e-05, "loss": 0.38414387702941893, "num_input_tokens_seen": 22829255552, "step": 80270, "train_runtime": 780472.5692, "train_tokens_per_second": 29250.555 }, { "epoch": 2.840464654461342, "grad_norm": 0.63671875, "learning_rate": 1.664089324109158e-05, "loss": 0.3921938180923462, "num_input_tokens_seen": 22832113664, "step": 80280, "train_runtime": 780570.7698, "train_tokens_per_second": 29250.536 }, { "epoch": 2.8408184747250704, "grad_norm": 0.62109375, "learning_rate": 1.6639971680655975e-05, "loss": 0.38543407917022704, "num_input_tokens_seen": 22834964416, "step": 80290, "train_runtime": 780667.5209, "train_tokens_per_second": 29250.563 }, { "epoch": 2.8411722949887994, "grad_norm": 0.62109375, "learning_rate": 1.6639050273309432e-05, "loss": 0.3855253219604492, "num_input_tokens_seen": 22837856320, "step": 80300, "train_runtime": 780767.5143, "train_tokens_per_second": 29250.521 }, { "epoch": 2.8415261152525284, "grad_norm": 0.609375, "learning_rate": 1.6638129019009573e-05, "loss": 0.3859180212020874, "num_input_tokens_seen": 22840750912, "step": 80310, "train_runtime": 780869.1977, "train_tokens_per_second": 29250.419 }, { "epoch": 2.841879935516257, "grad_norm": 0.6171875, "learning_rate": 1.663720791771403e-05, "loss": 0.3858411550521851, "num_input_tokens_seen": 22843562560, "step": 80320, "train_runtime": 780967.7743, "train_tokens_per_second": 29250.327 }, { "epoch": 2.8422337557799855, "grad_norm": 0.6171875, "learning_rate": 1.663628696938046e-05, "loss": 0.3882434368133545, "num_input_tokens_seen": 22846482752, "step": 80330, "train_runtime": 781069.9396, "train_tokens_per_second": 29250.239 }, { "epoch": 2.8425875760437145, "grad_norm": 0.62109375, "learning_rate": 1.663536617396653e-05, "loss": 0.3832517623901367, "num_input_tokens_seen": 22849334080, "step": 80340, "train_runtime": 781171.1469, "train_tokens_per_second": 29250.1 }, { "epoch": 2.8429413963074435, "grad_norm": 0.6484375, "learning_rate": 1.6634445531429922e-05, "loss": 0.38891263008117677, "num_input_tokens_seen": 22852179392, "step": 80350, "train_runtime": 781268.8711, "train_tokens_per_second": 29250.083 }, { "epoch": 2.843295216571172, "grad_norm": 0.6171875, "learning_rate": 1.663352504172834e-05, "loss": 0.3878302097320557, "num_input_tokens_seen": 22854962240, "step": 80360, "train_runtime": 781361.3607, "train_tokens_per_second": 29250.182 }, { "epoch": 2.8436490368349006, "grad_norm": 0.62109375, "learning_rate": 1.663260470481951e-05, "loss": 0.3905947208404541, "num_input_tokens_seen": 22857796608, "step": 80370, "train_runtime": 781457.9163, "train_tokens_per_second": 29250.195 }, { "epoch": 2.8440028570986295, "grad_norm": 0.60546875, "learning_rate": 1.663168452066115e-05, "loss": 0.38461761474609374, "num_input_tokens_seen": 22860663616, "step": 80380, "train_runtime": 781555.6871, "train_tokens_per_second": 29250.204 }, { "epoch": 2.8443566773623585, "grad_norm": 0.609375, "learning_rate": 1.663076448921102e-05, "loss": 0.3854233980178833, "num_input_tokens_seen": 22863503296, "step": 80390, "train_runtime": 781651.8041, "train_tokens_per_second": 29250.241 }, { "epoch": 2.844710497626087, "grad_norm": 0.62109375, "learning_rate": 1.6629844610426892e-05, "loss": 0.39031667709350587, "num_input_tokens_seen": 22866358464, "step": 80400, "train_runtime": 781751.1409, "train_tokens_per_second": 29250.176 }, { "epoch": 2.845064317889816, "grad_norm": 0.66015625, "learning_rate": 1.6628924884266542e-05, "loss": 0.389051628112793, "num_input_tokens_seen": 22869242816, "step": 80410, "train_runtime": 781850.0502, "train_tokens_per_second": 29250.165 }, { "epoch": 2.8454181381535446, "grad_norm": 0.62109375, "learning_rate": 1.6628005310687773e-05, "loss": 0.39028325080871584, "num_input_tokens_seen": 22872063808, "step": 80420, "train_runtime": 781944.7537, "train_tokens_per_second": 29250.23 }, { "epoch": 2.8457719584172736, "grad_norm": 0.625, "learning_rate": 1.6627085889648396e-05, "loss": 0.38775925636291503, "num_input_tokens_seen": 22874942272, "step": 80430, "train_runtime": 782040.7286, "train_tokens_per_second": 29250.321 }, { "epoch": 2.846125778681002, "grad_norm": 0.609375, "learning_rate": 1.6626166621106252e-05, "loss": 0.38816003799438475, "num_input_tokens_seen": 22877804864, "step": 80440, "train_runtime": 782138.7298, "train_tokens_per_second": 29250.316 }, { "epoch": 2.846479598944731, "grad_norm": 0.63671875, "learning_rate": 1.6625247505019183e-05, "loss": 0.385836124420166, "num_input_tokens_seen": 22880627520, "step": 80450, "train_runtime": 782232.8879, "train_tokens_per_second": 29250.403 }, { "epoch": 2.84683341920846, "grad_norm": 0.6015625, "learning_rate": 1.6624328541345054e-05, "loss": 0.3842759132385254, "num_input_tokens_seen": 22883450304, "step": 80460, "train_runtime": 782328.0565, "train_tokens_per_second": 29250.453 }, { "epoch": 2.8471872394721887, "grad_norm": 0.62890625, "learning_rate": 1.662340973004175e-05, "loss": 0.38395133018493655, "num_input_tokens_seen": 22886343104, "step": 80470, "train_runtime": 782428.7274, "train_tokens_per_second": 29250.387 }, { "epoch": 2.847541059735917, "grad_norm": 0.609375, "learning_rate": 1.6622491071067173e-05, "loss": 0.3870535850524902, "num_input_tokens_seen": 22889160512, "step": 80480, "train_runtime": 782522.6449, "train_tokens_per_second": 29250.477 }, { "epoch": 2.847894879999646, "grad_norm": 0.62890625, "learning_rate": 1.662157256437923e-05, "loss": 0.38376150131225584, "num_input_tokens_seen": 22892025600, "step": 80490, "train_runtime": 782620.9043, "train_tokens_per_second": 29250.465 }, { "epoch": 2.848248700263375, "grad_norm": 0.609375, "learning_rate": 1.6620654209935848e-05, "loss": 0.3873354434967041, "num_input_tokens_seen": 22894854976, "step": 80500, "train_runtime": 782717.777, "train_tokens_per_second": 29250.46 }, { "epoch": 2.8486025205271037, "grad_norm": 0.62109375, "learning_rate": 1.661973600769498e-05, "loss": 0.3883077383041382, "num_input_tokens_seen": 22897708736, "step": 80510, "train_runtime": 782816.3256, "train_tokens_per_second": 29250.423 }, { "epoch": 2.8489563407908323, "grad_norm": 0.63671875, "learning_rate": 1.6618817957614587e-05, "loss": 0.38348290920257566, "num_input_tokens_seen": 22900593600, "step": 80520, "train_runtime": 782915.7654, "train_tokens_per_second": 29250.393 }, { "epoch": 2.8493101610545613, "grad_norm": 0.60546875, "learning_rate": 1.661790005965265e-05, "loss": 0.3868986129760742, "num_input_tokens_seen": 22903405696, "step": 80530, "train_runtime": 783011.7308, "train_tokens_per_second": 29250.399 }, { "epoch": 2.8496639813182902, "grad_norm": 0.60546875, "learning_rate": 1.6616982313767158e-05, "loss": 0.38521132469177244, "num_input_tokens_seen": 22906273536, "step": 80540, "train_runtime": 783110.5185, "train_tokens_per_second": 29250.371 }, { "epoch": 2.850017801582019, "grad_norm": 0.625, "learning_rate": 1.661606471991613e-05, "loss": 0.38873720169067383, "num_input_tokens_seen": 22909100416, "step": 80550, "train_runtime": 783205.2885, "train_tokens_per_second": 29250.441 }, { "epoch": 2.8503716218457478, "grad_norm": 0.63671875, "learning_rate": 1.661514727805759e-05, "loss": 0.39095287322998046, "num_input_tokens_seen": 22911954944, "step": 80560, "train_runtime": 783305.2964, "train_tokens_per_second": 29250.351 }, { "epoch": 2.8507254421094763, "grad_norm": 0.59765625, "learning_rate": 1.6614229988149582e-05, "loss": 0.38513381481170655, "num_input_tokens_seen": 22914805888, "step": 80570, "train_runtime": 783402.2149, "train_tokens_per_second": 29250.372 }, { "epoch": 2.8510792623732053, "grad_norm": 0.625, "learning_rate": 1.6613312850150166e-05, "loss": 0.38893725872039797, "num_input_tokens_seen": 22917642432, "step": 80580, "train_runtime": 783497.692, "train_tokens_per_second": 29250.427 }, { "epoch": 2.851433082636934, "grad_norm": 0.6171875, "learning_rate": 1.661239586401742e-05, "loss": 0.3853666543960571, "num_input_tokens_seen": 22920466432, "step": 80590, "train_runtime": 783595.5057, "train_tokens_per_second": 29250.38 }, { "epoch": 2.851786902900663, "grad_norm": 0.62109375, "learning_rate": 1.6611479029709438e-05, "loss": 0.3924888610839844, "num_input_tokens_seen": 22923306688, "step": 80600, "train_runtime": 783690.092, "train_tokens_per_second": 29250.474 }, { "epoch": 2.8521407231643914, "grad_norm": 0.625, "learning_rate": 1.6610562347184323e-05, "loss": 0.38466897010803225, "num_input_tokens_seen": 22926170240, "step": 80610, "train_runtime": 783786.5151, "train_tokens_per_second": 29250.529 }, { "epoch": 2.8524945434281204, "grad_norm": 0.6328125, "learning_rate": 1.66096458164002e-05, "loss": 0.38309307098388673, "num_input_tokens_seen": 22928970432, "step": 80620, "train_runtime": 783882.9271, "train_tokens_per_second": 29250.504 }, { "epoch": 2.852848363691849, "grad_norm": 0.609375, "learning_rate": 1.6608729437315218e-05, "loss": 0.3849660873413086, "num_input_tokens_seen": 22931792896, "step": 80630, "train_runtime": 783978.8945, "train_tokens_per_second": 29250.523 }, { "epoch": 2.853202183955578, "grad_norm": 0.59765625, "learning_rate": 1.660781320988753e-05, "loss": 0.3867595434188843, "num_input_tokens_seen": 22934705536, "step": 80640, "train_runtime": 784080.3947, "train_tokens_per_second": 29250.451 }, { "epoch": 2.853556004219307, "grad_norm": 0.6171875, "learning_rate": 1.6606897134075307e-05, "loss": 0.38904967308044436, "num_input_tokens_seen": 22937512192, "step": 80650, "train_runtime": 784174.6519, "train_tokens_per_second": 29250.515 }, { "epoch": 2.8539098244830354, "grad_norm": 0.640625, "learning_rate": 1.660598120983674e-05, "loss": 0.39061775207519533, "num_input_tokens_seen": 22940352448, "step": 80660, "train_runtime": 784271.1141, "train_tokens_per_second": 29250.539 }, { "epoch": 2.854263644746764, "grad_norm": 0.62109375, "learning_rate": 1.660506543713004e-05, "loss": 0.3834700107574463, "num_input_tokens_seen": 22943216320, "step": 80670, "train_runtime": 784369.9723, "train_tokens_per_second": 29250.503 }, { "epoch": 2.854617465010493, "grad_norm": 0.62109375, "learning_rate": 1.660414981591342e-05, "loss": 0.38445167541503905, "num_input_tokens_seen": 22946051328, "step": 80680, "train_runtime": 784467.4124, "train_tokens_per_second": 29250.484 }, { "epoch": 2.854971285274222, "grad_norm": 0.61328125, "learning_rate": 1.6603234346145123e-05, "loss": 0.38368687629699705, "num_input_tokens_seen": 22948868032, "step": 80690, "train_runtime": 784561.2666, "train_tokens_per_second": 29250.575 }, { "epoch": 2.8553251055379505, "grad_norm": 0.6015625, "learning_rate": 1.6602319027783403e-05, "loss": 0.38330755233764646, "num_input_tokens_seen": 22951708672, "step": 80700, "train_runtime": 784656.5964, "train_tokens_per_second": 29250.641 }, { "epoch": 2.8556789258016795, "grad_norm": 0.62890625, "learning_rate": 1.6601403860786528e-05, "loss": 0.3859090805053711, "num_input_tokens_seen": 22954602496, "step": 80710, "train_runtime": 784756.0554, "train_tokens_per_second": 29250.622 }, { "epoch": 2.856032746065408, "grad_norm": 0.671875, "learning_rate": 1.660048884511279e-05, "loss": 0.3851149082183838, "num_input_tokens_seen": 22957379648, "step": 80720, "train_runtime": 784849.9043, "train_tokens_per_second": 29250.662 }, { "epoch": 2.856386566329137, "grad_norm": 0.609375, "learning_rate": 1.6599573980720478e-05, "loss": 0.38347327709198, "num_input_tokens_seen": 22960240256, "step": 80730, "train_runtime": 784945.5008, "train_tokens_per_second": 29250.744 }, { "epoch": 2.8567403865928656, "grad_norm": 0.62109375, "learning_rate": 1.6598659267567925e-05, "loss": 0.3873884916305542, "num_input_tokens_seen": 22963055232, "step": 80740, "train_runtime": 785041.8243, "train_tokens_per_second": 29250.741 }, { "epoch": 2.8570942068565945, "grad_norm": 0.625, "learning_rate": 1.6597744705613464e-05, "loss": 0.38725402355194094, "num_input_tokens_seen": 22965878144, "step": 80750, "train_runtime": 785139.5512, "train_tokens_per_second": 29250.696 }, { "epoch": 2.857448027120323, "grad_norm": 0.62890625, "learning_rate": 1.6596830294815434e-05, "loss": 0.38797409534454347, "num_input_tokens_seen": 22968705728, "step": 80760, "train_runtime": 785236.4918, "train_tokens_per_second": 29250.686 }, { "epoch": 2.857801847384052, "grad_norm": 0.62109375, "learning_rate": 1.6595916035132218e-05, "loss": 0.38525421619415284, "num_input_tokens_seen": 22971548928, "step": 80770, "train_runtime": 785336.157, "train_tokens_per_second": 29250.594 }, { "epoch": 2.8581556676477806, "grad_norm": 0.63671875, "learning_rate": 1.6595001926522184e-05, "loss": 0.3828424453735352, "num_input_tokens_seen": 22974430848, "step": 80780, "train_runtime": 785435.9423, "train_tokens_per_second": 29250.547 }, { "epoch": 2.8585094879115096, "grad_norm": 0.61328125, "learning_rate": 1.6594087968943735e-05, "loss": 0.3842684268951416, "num_input_tokens_seen": 22977273280, "step": 80790, "train_runtime": 785531.8988, "train_tokens_per_second": 29250.592 }, { "epoch": 2.8588633081752386, "grad_norm": 0.6328125, "learning_rate": 1.6593174162355295e-05, "loss": 0.38341169357299804, "num_input_tokens_seen": 22980155840, "step": 80800, "train_runtime": 785630.5183, "train_tokens_per_second": 29250.59 }, { "epoch": 2.859217128438967, "grad_norm": 0.60546875, "learning_rate": 1.6592260506715286e-05, "loss": 0.38517658710479735, "num_input_tokens_seen": 22983013056, "step": 80810, "train_runtime": 785728.2441, "train_tokens_per_second": 29250.588 }, { "epoch": 2.8595709487026957, "grad_norm": 0.62890625, "learning_rate": 1.6591347001982155e-05, "loss": 0.38637361526489256, "num_input_tokens_seen": 22985856384, "step": 80820, "train_runtime": 785825.4351, "train_tokens_per_second": 29250.588 }, { "epoch": 2.8599247689664247, "grad_norm": 0.62890625, "learning_rate": 1.659043364811436e-05, "loss": 0.38329670429229734, "num_input_tokens_seen": 22988643200, "step": 80830, "train_runtime": 785919.5308, "train_tokens_per_second": 29250.632 }, { "epoch": 2.8602785892301537, "grad_norm": 0.6328125, "learning_rate": 1.6589520445070395e-05, "loss": 0.3859461784362793, "num_input_tokens_seen": 22991561792, "step": 80840, "train_runtime": 786017.2471, "train_tokens_per_second": 29250.709 }, { "epoch": 2.860632409493882, "grad_norm": 0.61328125, "learning_rate": 1.6588607392808746e-05, "loss": 0.38774890899658204, "num_input_tokens_seen": 22994382656, "step": 80850, "train_runtime": 786112.7548, "train_tokens_per_second": 29250.744 }, { "epoch": 2.8609862297576107, "grad_norm": 0.58984375, "learning_rate": 1.658769449128792e-05, "loss": 0.3839534521102905, "num_input_tokens_seen": 22997277952, "step": 80860, "train_runtime": 786215.1305, "train_tokens_per_second": 29250.617 }, { "epoch": 2.8613400500213397, "grad_norm": 0.625, "learning_rate": 1.6586781740466448e-05, "loss": 0.385223913192749, "num_input_tokens_seen": 23000124160, "step": 80870, "train_runtime": 786312.3651, "train_tokens_per_second": 29250.62 }, { "epoch": 2.8616938702850687, "grad_norm": 0.65625, "learning_rate": 1.6585869140302875e-05, "loss": 0.3855762958526611, "num_input_tokens_seen": 23002947008, "step": 80880, "train_runtime": 786407.8233, "train_tokens_per_second": 29250.659 }, { "epoch": 2.8620476905487973, "grad_norm": 0.62890625, "learning_rate": 1.6584956690755752e-05, "loss": 0.39006495475769043, "num_input_tokens_seen": 23005774592, "step": 80890, "train_runtime": 786505.5582, "train_tokens_per_second": 29250.619 }, { "epoch": 2.8624015108125263, "grad_norm": 0.62890625, "learning_rate": 1.658404439178366e-05, "loss": 0.38556675910949706, "num_input_tokens_seen": 23008555840, "step": 80900, "train_runtime": 786598.0095, "train_tokens_per_second": 29250.717 }, { "epoch": 2.862755331076255, "grad_norm": 0.58984375, "learning_rate": 1.6583132243345195e-05, "loss": 0.3841893672943115, "num_input_tokens_seen": 23011404608, "step": 80910, "train_runtime": 786694.0004, "train_tokens_per_second": 29250.769 }, { "epoch": 2.863109151339984, "grad_norm": 0.625, "learning_rate": 1.6582220245398953e-05, "loss": 0.3896572828292847, "num_input_tokens_seen": 23014274560, "step": 80920, "train_runtime": 786792.3161, "train_tokens_per_second": 29250.762 }, { "epoch": 2.8634629716037123, "grad_norm": 0.6015625, "learning_rate": 1.658130839790356e-05, "loss": 0.38740460872650145, "num_input_tokens_seen": 23017134336, "step": 80930, "train_runtime": 786888.6637, "train_tokens_per_second": 29250.815 }, { "epoch": 2.8638167918674413, "grad_norm": 0.63671875, "learning_rate": 1.658039670081766e-05, "loss": 0.37956216335296633, "num_input_tokens_seen": 23019984512, "step": 80940, "train_runtime": 786986.1573, "train_tokens_per_second": 29250.812 }, { "epoch": 2.86417061213117, "grad_norm": 0.609375, "learning_rate": 1.65794851540999e-05, "loss": 0.38520843982696534, "num_input_tokens_seen": 23022766400, "step": 80950, "train_runtime": 787079.0905, "train_tokens_per_second": 29250.893 }, { "epoch": 2.864524432394899, "grad_norm": 0.609375, "learning_rate": 1.6578573757708953e-05, "loss": 0.38732295036315917, "num_input_tokens_seen": 23025656960, "step": 80960, "train_runtime": 787179.0435, "train_tokens_per_second": 29250.851 }, { "epoch": 2.8648782526586274, "grad_norm": 0.6171875, "learning_rate": 1.6577662511603507e-05, "loss": 0.3871471881866455, "num_input_tokens_seen": 23028472640, "step": 80970, "train_runtime": 787274.3673, "train_tokens_per_second": 29250.886 }, { "epoch": 2.8652320729223564, "grad_norm": 0.61328125, "learning_rate": 1.6576751415742262e-05, "loss": 0.3873793363571167, "num_input_tokens_seen": 23031304192, "step": 80980, "train_runtime": 787368.0609, "train_tokens_per_second": 29251.001 }, { "epoch": 2.8655858931860854, "grad_norm": 0.64453125, "learning_rate": 1.6575840470083934e-05, "loss": 0.38881549835205076, "num_input_tokens_seen": 23034158272, "step": 80990, "train_runtime": 787465.0715, "train_tokens_per_second": 29251.022 }, { "epoch": 2.865939713449814, "grad_norm": 0.6328125, "learning_rate": 1.6574929674587263e-05, "loss": 0.3861287355422974, "num_input_tokens_seen": 23037005184, "step": 81000, "train_runtime": 787563.2652, "train_tokens_per_second": 29250.99 }, { "epoch": 2.8662935337135425, "grad_norm": 0.6640625, "learning_rate": 1.6574019029210995e-05, "loss": 0.3872844696044922, "num_input_tokens_seen": 23039829248, "step": 81010, "train_runtime": 787659.067, "train_tokens_per_second": 29251.018 }, { "epoch": 2.8666473539772714, "grad_norm": 0.6015625, "learning_rate": 1.6573108533913894e-05, "loss": 0.38566126823425295, "num_input_tokens_seen": 23042716608, "step": 81020, "train_runtime": 787760.1879, "train_tokens_per_second": 29250.928 }, { "epoch": 2.8670011742410004, "grad_norm": 0.6171875, "learning_rate": 1.657219818865474e-05, "loss": 0.38692626953125, "num_input_tokens_seen": 23045577920, "step": 81030, "train_runtime": 787857.7704, "train_tokens_per_second": 29250.937 }, { "epoch": 2.867354994504729, "grad_norm": 0.609375, "learning_rate": 1.6571287993392336e-05, "loss": 0.3842721700668335, "num_input_tokens_seen": 23048399296, "step": 81040, "train_runtime": 787953.1177, "train_tokens_per_second": 29250.978 }, { "epoch": 2.867708814768458, "grad_norm": 0.62109375, "learning_rate": 1.6570377948085496e-05, "loss": 0.3845519065856934, "num_input_tokens_seen": 23051287040, "step": 81050, "train_runtime": 788050.9936, "train_tokens_per_second": 29251.009 }, { "epoch": 2.8680626350321865, "grad_norm": 0.66015625, "learning_rate": 1.6569468052693042e-05, "loss": 0.39033515453338624, "num_input_tokens_seen": 23054120704, "step": 81060, "train_runtime": 788148.1429, "train_tokens_per_second": 29250.999 }, { "epoch": 2.8684164552959155, "grad_norm": 0.609375, "learning_rate": 1.6568558307173823e-05, "loss": 0.38727493286132814, "num_input_tokens_seen": 23056946880, "step": 81070, "train_runtime": 788246.4344, "train_tokens_per_second": 29250.937 }, { "epoch": 2.868770275559644, "grad_norm": 0.640625, "learning_rate": 1.65676487114867e-05, "loss": 0.38291044235229493, "num_input_tokens_seen": 23059841856, "step": 81080, "train_runtime": 788346.273, "train_tokens_per_second": 29250.905 }, { "epoch": 2.869124095823373, "grad_norm": 0.625, "learning_rate": 1.6566739265590547e-05, "loss": 0.3887549877166748, "num_input_tokens_seen": 23062668928, "step": 81090, "train_runtime": 788442.8903, "train_tokens_per_second": 29250.906 }, { "epoch": 2.8694779160871016, "grad_norm": 0.62890625, "learning_rate": 1.656582996944426e-05, "loss": 0.3819906234741211, "num_input_tokens_seen": 23065522304, "step": 81100, "train_runtime": 788540.3032, "train_tokens_per_second": 29250.911 }, { "epoch": 2.8698317363508306, "grad_norm": 0.625, "learning_rate": 1.6564920823006745e-05, "loss": 0.386607027053833, "num_input_tokens_seen": 23068403328, "step": 81110, "train_runtime": 788638.8854, "train_tokens_per_second": 29250.908 }, { "epoch": 2.870185556614559, "grad_norm": 0.59375, "learning_rate": 1.6564011826236926e-05, "loss": 0.3872599363327026, "num_input_tokens_seen": 23071303168, "step": 81120, "train_runtime": 788739.9712, "train_tokens_per_second": 29250.836 }, { "epoch": 2.870539376878288, "grad_norm": 0.6328125, "learning_rate": 1.656310297909374e-05, "loss": 0.38534929752349856, "num_input_tokens_seen": 23074100224, "step": 81130, "train_runtime": 788835.5325, "train_tokens_per_second": 29250.838 }, { "epoch": 2.870893197142017, "grad_norm": 0.63671875, "learning_rate": 1.6562194281536146e-05, "loss": 0.38730440139770506, "num_input_tokens_seen": 23076961088, "step": 81140, "train_runtime": 788933.5368, "train_tokens_per_second": 29250.83 }, { "epoch": 2.8712470174057456, "grad_norm": 0.60546875, "learning_rate": 1.6561285733523108e-05, "loss": 0.3849898338317871, "num_input_tokens_seen": 23079791232, "step": 81150, "train_runtime": 789030.6827, "train_tokens_per_second": 29250.816 }, { "epoch": 2.871600837669474, "grad_norm": 0.609375, "learning_rate": 1.6560377335013625e-05, "loss": 0.38543477058410647, "num_input_tokens_seen": 23082620160, "step": 81160, "train_runtime": 789125.0493, "train_tokens_per_second": 29250.903 }, { "epoch": 2.871954657933203, "grad_norm": 0.59375, "learning_rate": 1.655946908596669e-05, "loss": 0.38542652130126953, "num_input_tokens_seen": 23085475136, "step": 81170, "train_runtime": 789224.3364, "train_tokens_per_second": 29250.84 }, { "epoch": 2.872308478196932, "grad_norm": 0.6484375, "learning_rate": 1.6558560986341324e-05, "loss": 0.3886594295501709, "num_input_tokens_seen": 23088293056, "step": 81180, "train_runtime": 789319.4661, "train_tokens_per_second": 29250.885 }, { "epoch": 2.8726622984606607, "grad_norm": 0.625, "learning_rate": 1.6557653036096564e-05, "loss": 0.39289045333862305, "num_input_tokens_seen": 23091135424, "step": 81190, "train_runtime": 789416.4736, "train_tokens_per_second": 29250.891 }, { "epoch": 2.8730161187243892, "grad_norm": 0.6171875, "learning_rate": 1.6556745235191454e-05, "loss": 0.38567628860473635, "num_input_tokens_seen": 23093985664, "step": 81200, "train_runtime": 789511.9572, "train_tokens_per_second": 29250.964 }, { "epoch": 2.873369938988118, "grad_norm": 0.64453125, "learning_rate": 1.6555837583585066e-05, "loss": 0.39205853939056395, "num_input_tokens_seen": 23096877056, "step": 81210, "train_runtime": 789612.3049, "train_tokens_per_second": 29250.908 }, { "epoch": 2.873723759251847, "grad_norm": 0.60546875, "learning_rate": 1.6554930081236475e-05, "loss": 0.3855047464370728, "num_input_tokens_seen": 23099723456, "step": 81220, "train_runtime": 789709.8876, "train_tokens_per_second": 29250.898 }, { "epoch": 2.8740775795155757, "grad_norm": 0.6328125, "learning_rate": 1.6554022728104783e-05, "loss": 0.38598003387451174, "num_input_tokens_seen": 23102569664, "step": 81230, "train_runtime": 789807.4231, "train_tokens_per_second": 29250.89 }, { "epoch": 2.8744313997793047, "grad_norm": 0.625, "learning_rate": 1.65531155241491e-05, "loss": 0.3862329959869385, "num_input_tokens_seen": 23105362432, "step": 81240, "train_runtime": 789900.9452, "train_tokens_per_second": 29250.962 }, { "epoch": 2.8747852200430333, "grad_norm": 0.6015625, "learning_rate": 1.6552208469328555e-05, "loss": 0.3869790077209473, "num_input_tokens_seen": 23108133120, "step": 81250, "train_runtime": 789992.5089, "train_tokens_per_second": 29251.079 }, { "epoch": 2.8751390403067623, "grad_norm": 0.62109375, "learning_rate": 1.6551301563602294e-05, "loss": 0.3815010547637939, "num_input_tokens_seen": 23110986048, "step": 81260, "train_runtime": 790091.2287, "train_tokens_per_second": 29251.035 }, { "epoch": 2.875492860570491, "grad_norm": 0.6328125, "learning_rate": 1.655039480692947e-05, "loss": 0.3899769067764282, "num_input_tokens_seen": 23113758464, "step": 81270, "train_runtime": 790183.9305, "train_tokens_per_second": 29251.112 }, { "epoch": 2.87584668083422, "grad_norm": 0.609375, "learning_rate": 1.6549488199269263e-05, "loss": 0.3841294765472412, "num_input_tokens_seen": 23116559744, "step": 81280, "train_runtime": 790278.4974, "train_tokens_per_second": 29251.156 }, { "epoch": 2.876200501097949, "grad_norm": 0.60546875, "learning_rate": 1.654858174058087e-05, "loss": 0.3816652536392212, "num_input_tokens_seen": 23119414528, "step": 81290, "train_runtime": 790376.6878, "train_tokens_per_second": 29251.134 }, { "epoch": 2.8765543213616773, "grad_norm": 0.640625, "learning_rate": 1.6547675430823484e-05, "loss": 0.38713769912719725, "num_input_tokens_seen": 23122306944, "step": 81300, "train_runtime": 790476.0557, "train_tokens_per_second": 29251.116 }, { "epoch": 2.876908141625406, "grad_norm": 0.61328125, "learning_rate": 1.6546769269956337e-05, "loss": 0.3860367774963379, "num_input_tokens_seen": 23125164416, "step": 81310, "train_runtime": 790575.2789, "train_tokens_per_second": 29251.059 }, { "epoch": 2.877261961889135, "grad_norm": 0.61328125, "learning_rate": 1.6545863257938662e-05, "loss": 0.3824927806854248, "num_input_tokens_seen": 23128015424, "step": 81320, "train_runtime": 790671.7099, "train_tokens_per_second": 29251.098 }, { "epoch": 2.877615782152864, "grad_norm": 0.6328125, "learning_rate": 1.654495739472972e-05, "loss": 0.38840570449829104, "num_input_tokens_seen": 23130818240, "step": 81330, "train_runtime": 790767.5978, "train_tokens_per_second": 29251.095 }, { "epoch": 2.8779696024165924, "grad_norm": 0.6171875, "learning_rate": 1.654405168028877e-05, "loss": 0.38400247097015383, "num_input_tokens_seen": 23133666240, "step": 81340, "train_runtime": 790866.0679, "train_tokens_per_second": 29251.054 }, { "epoch": 2.878323422680321, "grad_norm": 0.61328125, "learning_rate": 1.6543146114575108e-05, "loss": 0.38600523471832277, "num_input_tokens_seen": 23136511360, "step": 81350, "train_runtime": 790962.5959, "train_tokens_per_second": 29251.082 }, { "epoch": 2.87867724294405, "grad_norm": 0.6171875, "learning_rate": 1.6542240697548022e-05, "loss": 0.382672119140625, "num_input_tokens_seen": 23139309760, "step": 81360, "train_runtime": 791058.0198, "train_tokens_per_second": 29251.091 }, { "epoch": 2.879031063207779, "grad_norm": 0.63671875, "learning_rate": 1.6541335429166833e-05, "loss": 0.38936915397644045, "num_input_tokens_seen": 23142062976, "step": 81370, "train_runtime": 791148.3108, "train_tokens_per_second": 29251.232 }, { "epoch": 2.8793848834715075, "grad_norm": 0.60546875, "learning_rate": 1.6540430309390877e-05, "loss": 0.38384013175964354, "num_input_tokens_seen": 23144899776, "step": 81380, "train_runtime": 791245.5605, "train_tokens_per_second": 29251.222 }, { "epoch": 2.8797387037352364, "grad_norm": 0.6015625, "learning_rate": 1.6539525338179495e-05, "loss": 0.3860579013824463, "num_input_tokens_seen": 23147722432, "step": 81390, "train_runtime": 791343.3789, "train_tokens_per_second": 29251.173 }, { "epoch": 2.880092523998965, "grad_norm": 0.625, "learning_rate": 1.6538620515492054e-05, "loss": 0.3901110887527466, "num_input_tokens_seen": 23150635136, "step": 81400, "train_runtime": 791447.8889, "train_tokens_per_second": 29250.991 }, { "epoch": 2.880446344262694, "grad_norm": 0.62890625, "learning_rate": 1.6537715841287933e-05, "loss": 0.38684787750244143, "num_input_tokens_seen": 23153445824, "step": 81410, "train_runtime": 791546.531, "train_tokens_per_second": 29250.897 }, { "epoch": 2.8808001645264225, "grad_norm": 0.61328125, "learning_rate": 1.6536811315526516e-05, "loss": 0.39116668701171875, "num_input_tokens_seen": 23156338304, "step": 81420, "train_runtime": 791646.5693, "train_tokens_per_second": 29250.854 }, { "epoch": 2.8811539847901515, "grad_norm": 0.62890625, "learning_rate": 1.6535906938167223e-05, "loss": 0.38677234649658204, "num_input_tokens_seen": 23159170432, "step": 81430, "train_runtime": 791743.5291, "train_tokens_per_second": 29250.849 }, { "epoch": 2.88150780505388, "grad_norm": 0.65234375, "learning_rate": 1.6535002709169474e-05, "loss": 0.38967745304107665, "num_input_tokens_seen": 23162008640, "step": 81440, "train_runtime": 791837.0017, "train_tokens_per_second": 29250.98 }, { "epoch": 2.881861625317609, "grad_norm": 0.63671875, "learning_rate": 1.653409862849271e-05, "loss": 0.3861429691314697, "num_input_tokens_seen": 23164825472, "step": 81450, "train_runtime": 791934.299, "train_tokens_per_second": 29250.944 }, { "epoch": 2.8822154455813376, "grad_norm": 0.63671875, "learning_rate": 1.653319469609639e-05, "loss": 0.3831209182739258, "num_input_tokens_seen": 23167639168, "step": 81460, "train_runtime": 792029.261, "train_tokens_per_second": 29250.989 }, { "epoch": 2.8825692658450666, "grad_norm": 0.6484375, "learning_rate": 1.6532290911939978e-05, "loss": 0.3878655910491943, "num_input_tokens_seen": 23170475456, "step": 81470, "train_runtime": 792125.1391, "train_tokens_per_second": 29251.029 }, { "epoch": 2.8829230861087956, "grad_norm": 0.625, "learning_rate": 1.6531387275982972e-05, "loss": 0.38855006694793703, "num_input_tokens_seen": 23173259136, "step": 81480, "train_runtime": 792220.4839, "train_tokens_per_second": 29251.022 }, { "epoch": 2.883276906372524, "grad_norm": 0.59765625, "learning_rate": 1.6530483788184863e-05, "loss": 0.3821551322937012, "num_input_tokens_seen": 23176068160, "step": 81490, "train_runtime": 792314.8089, "train_tokens_per_second": 29251.085 }, { "epoch": 2.8836307266362526, "grad_norm": 0.6015625, "learning_rate": 1.6529580448505172e-05, "loss": 0.3886830806732178, "num_input_tokens_seen": 23178903680, "step": 81500, "train_runtime": 792409.9868, "train_tokens_per_second": 29251.15 }, { "epoch": 2.8839845468999816, "grad_norm": 0.640625, "learning_rate": 1.6528677256903436e-05, "loss": 0.3892590761184692, "num_input_tokens_seen": 23181723136, "step": 81510, "train_runtime": 792506.2284, "train_tokens_per_second": 29251.156 }, { "epoch": 2.8843383671637106, "grad_norm": 0.63671875, "learning_rate": 1.6527774213339204e-05, "loss": 0.3896749496459961, "num_input_tokens_seen": 23184502272, "step": 81520, "train_runtime": 792598.6911, "train_tokens_per_second": 29251.25 }, { "epoch": 2.884692187427439, "grad_norm": 0.63671875, "learning_rate": 1.6526871317772037e-05, "loss": 0.38340129852294924, "num_input_tokens_seen": 23187387136, "step": 81530, "train_runtime": 792694.2099, "train_tokens_per_second": 29251.364 }, { "epoch": 2.885046007691168, "grad_norm": 0.62890625, "learning_rate": 1.6525968570161512e-05, "loss": 0.3903005599975586, "num_input_tokens_seen": 23190172480, "step": 81540, "train_runtime": 792789.6181, "train_tokens_per_second": 29251.357 }, { "epoch": 2.8853998279548967, "grad_norm": 0.640625, "learning_rate": 1.6525065970467236e-05, "loss": 0.38321237564086913, "num_input_tokens_seen": 23193086080, "step": 81550, "train_runtime": 792893.3739, "train_tokens_per_second": 29251.204 }, { "epoch": 2.8857536482186257, "grad_norm": 0.62109375, "learning_rate": 1.6524163518648803e-05, "loss": 0.3898627281188965, "num_input_tokens_seen": 23195886528, "step": 81560, "train_runtime": 792988.7158, "train_tokens_per_second": 29251.219 }, { "epoch": 2.886107468482354, "grad_norm": 0.65625, "learning_rate": 1.6523261214665855e-05, "loss": 0.38414835929870605, "num_input_tokens_seen": 23198753536, "step": 81570, "train_runtime": 793086.8064, "train_tokens_per_second": 29251.216 }, { "epoch": 2.886461288746083, "grad_norm": 0.62890625, "learning_rate": 1.6522359058478024e-05, "loss": 0.384470796585083, "num_input_tokens_seen": 23201578240, "step": 81580, "train_runtime": 793180.8015, "train_tokens_per_second": 29251.311 }, { "epoch": 2.8868151090098118, "grad_norm": 0.640625, "learning_rate": 1.652145705004497e-05, "loss": 0.3838948249816895, "num_input_tokens_seen": 23204418304, "step": 81590, "train_runtime": 793276.5534, "train_tokens_per_second": 29251.36 }, { "epoch": 2.8871689292735407, "grad_norm": 0.6171875, "learning_rate": 1.652055518932636e-05, "loss": 0.38438825607299804, "num_input_tokens_seen": 23207239872, "step": 81600, "train_runtime": 793371.9011, "train_tokens_per_second": 29251.401 }, { "epoch": 2.8875227495372693, "grad_norm": 0.6328125, "learning_rate": 1.6519653476281895e-05, "loss": 0.386983060836792, "num_input_tokens_seen": 23210166912, "step": 81610, "train_runtime": 793472.3377, "train_tokens_per_second": 29251.388 }, { "epoch": 2.8878765698009983, "grad_norm": 0.60546875, "learning_rate": 1.6518751910871267e-05, "loss": 0.38485558032989503, "num_input_tokens_seen": 23212979328, "step": 81620, "train_runtime": 793566.3105, "train_tokens_per_second": 29251.468 }, { "epoch": 2.8882303900647273, "grad_norm": 0.6328125, "learning_rate": 1.6517850493054192e-05, "loss": 0.3835980176925659, "num_input_tokens_seen": 23215794752, "step": 81630, "train_runtime": 793658.6734, "train_tokens_per_second": 29251.611 }, { "epoch": 2.888584210328456, "grad_norm": 0.6484375, "learning_rate": 1.6516949222790416e-05, "loss": 0.38127636909484863, "num_input_tokens_seen": 23218609280, "step": 81640, "train_runtime": 793756.0186, "train_tokens_per_second": 29251.569 }, { "epoch": 2.8889380305921843, "grad_norm": 0.6171875, "learning_rate": 1.651604810003968e-05, "loss": 0.3875267744064331, "num_input_tokens_seen": 23221403840, "step": 81650, "train_runtime": 793850.1855, "train_tokens_per_second": 29251.62 }, { "epoch": 2.8892918508559133, "grad_norm": 0.61328125, "learning_rate": 1.6515147124761745e-05, "loss": 0.38620743751525877, "num_input_tokens_seen": 23224249472, "step": 81660, "train_runtime": 793946.3548, "train_tokens_per_second": 29251.661 }, { "epoch": 2.8896456711196423, "grad_norm": 0.640625, "learning_rate": 1.6514246296916406e-05, "loss": 0.3855967283248901, "num_input_tokens_seen": 23227105728, "step": 81670, "train_runtime": 794042.8205, "train_tokens_per_second": 29251.704 }, { "epoch": 2.889999491383371, "grad_norm": 0.609375, "learning_rate": 1.6513345616463443e-05, "loss": 0.38955535888671877, "num_input_tokens_seen": 23229927488, "step": 81680, "train_runtime": 794140.607, "train_tokens_per_second": 29251.656 }, { "epoch": 2.8903533116470994, "grad_norm": 0.6015625, "learning_rate": 1.651244508336267e-05, "loss": 0.3868558406829834, "num_input_tokens_seen": 23232781248, "step": 81690, "train_runtime": 794236.0817, "train_tokens_per_second": 29251.732 }, { "epoch": 2.8907071319108284, "grad_norm": 0.62890625, "learning_rate": 1.651154469757392e-05, "loss": 0.3861047029495239, "num_input_tokens_seen": 23235630400, "step": 81700, "train_runtime": 794331.8317, "train_tokens_per_second": 29251.793 }, { "epoch": 2.8910609521745574, "grad_norm": 0.61328125, "learning_rate": 1.6510644459057032e-05, "loss": 0.3819290637969971, "num_input_tokens_seen": 23238496384, "step": 81710, "train_runtime": 794429.9231, "train_tokens_per_second": 29251.789 }, { "epoch": 2.891414772438286, "grad_norm": 0.609375, "learning_rate": 1.6509744367771856e-05, "loss": 0.38619470596313477, "num_input_tokens_seen": 23241361984, "step": 81720, "train_runtime": 794532.7109, "train_tokens_per_second": 29251.611 }, { "epoch": 2.891768592702015, "grad_norm": 0.61328125, "learning_rate": 1.650884442367827e-05, "loss": 0.38799047470092773, "num_input_tokens_seen": 23244226048, "step": 81730, "train_runtime": 794629.7972, "train_tokens_per_second": 29251.642 }, { "epoch": 2.8921224129657435, "grad_norm": 0.60546875, "learning_rate": 1.6507944626736166e-05, "loss": 0.3849436521530151, "num_input_tokens_seen": 23247043072, "step": 81740, "train_runtime": 794724.3475, "train_tokens_per_second": 29251.706 }, { "epoch": 2.8924762332294724, "grad_norm": 0.6171875, "learning_rate": 1.6507044976905436e-05, "loss": 0.38478143215179444, "num_input_tokens_seen": 23249923328, "step": 81750, "train_runtime": 794823.3739, "train_tokens_per_second": 29251.685 }, { "epoch": 2.892830053493201, "grad_norm": 0.5859375, "learning_rate": 1.6506145474146002e-05, "loss": 0.3904749631881714, "num_input_tokens_seen": 23252808448, "step": 81760, "train_runtime": 794923.4818, "train_tokens_per_second": 29251.631 }, { "epoch": 2.89318387375693, "grad_norm": 0.625, "learning_rate": 1.6505246118417803e-05, "loss": 0.3853966951370239, "num_input_tokens_seen": 23255655424, "step": 81770, "train_runtime": 795018.8708, "train_tokens_per_second": 29251.702 }, { "epoch": 2.8935376940206585, "grad_norm": 0.609375, "learning_rate": 1.650434690968078e-05, "loss": 0.385425066947937, "num_input_tokens_seen": 23258495040, "step": 81780, "train_runtime": 795114.4154, "train_tokens_per_second": 29251.759 }, { "epoch": 2.8938915142843875, "grad_norm": 0.60546875, "learning_rate": 1.6503447847894902e-05, "loss": 0.3871616363525391, "num_input_tokens_seen": 23261335040, "step": 81790, "train_runtime": 795208.7604, "train_tokens_per_second": 29251.86 }, { "epoch": 2.894245334548116, "grad_norm": 0.62109375, "learning_rate": 1.6502548933020142e-05, "loss": 0.390057897567749, "num_input_tokens_seen": 23264181824, "step": 81800, "train_runtime": 795306.5143, "train_tokens_per_second": 29251.844 }, { "epoch": 2.894599154811845, "grad_norm": 0.6015625, "learning_rate": 1.6501650165016504e-05, "loss": 0.38388235569000245, "num_input_tokens_seen": 23267051008, "step": 81810, "train_runtime": 795408.3919, "train_tokens_per_second": 29251.704 }, { "epoch": 2.894952975075574, "grad_norm": 0.609375, "learning_rate": 1.6500751543843988e-05, "loss": 0.38326637744903563, "num_input_tokens_seen": 23269968704, "step": 81820, "train_runtime": 795509.8269, "train_tokens_per_second": 29251.642 }, { "epoch": 2.8953067953393026, "grad_norm": 0.6640625, "learning_rate": 1.6499853069462623e-05, "loss": 0.3844102621078491, "num_input_tokens_seen": 23272819136, "step": 81830, "train_runtime": 795608.6372, "train_tokens_per_second": 29251.592 }, { "epoch": 2.895660615603031, "grad_norm": 0.6171875, "learning_rate": 1.649895474183245e-05, "loss": 0.3845831871032715, "num_input_tokens_seen": 23275730752, "step": 81840, "train_runtime": 795706.8968, "train_tokens_per_second": 29251.639 }, { "epoch": 2.89601443586676, "grad_norm": 0.6015625, "learning_rate": 1.649805656091352e-05, "loss": 0.3881673812866211, "num_input_tokens_seen": 23278545536, "step": 81850, "train_runtime": 795802.7138, "train_tokens_per_second": 29251.654 }, { "epoch": 2.896368256130489, "grad_norm": 0.6484375, "learning_rate": 1.649715852666591e-05, "loss": 0.38451552391052246, "num_input_tokens_seen": 23281337024, "step": 81860, "train_runtime": 795897.4076, "train_tokens_per_second": 29251.681 }, { "epoch": 2.8967220763942176, "grad_norm": 0.609375, "learning_rate": 1.6496260639049703e-05, "loss": 0.3868791341781616, "num_input_tokens_seen": 23284166976, "step": 81870, "train_runtime": 795994.4553, "train_tokens_per_second": 29251.67 }, { "epoch": 2.8970758966579466, "grad_norm": 0.625, "learning_rate": 1.6495362898024995e-05, "loss": 0.3884408950805664, "num_input_tokens_seen": 23286988288, "step": 81880, "train_runtime": 796090.5999, "train_tokens_per_second": 29251.681 }, { "epoch": 2.897429716921675, "grad_norm": 0.59765625, "learning_rate": 1.649446530355191e-05, "loss": 0.3881901741027832, "num_input_tokens_seen": 23289779840, "step": 81890, "train_runtime": 796186.3836, "train_tokens_per_second": 29251.668 }, { "epoch": 2.897783537185404, "grad_norm": 0.609375, "learning_rate": 1.6493567855590576e-05, "loss": 0.3867985486984253, "num_input_tokens_seen": 23292648000, "step": 81900, "train_runtime": 796281.432, "train_tokens_per_second": 29251.778 }, { "epoch": 2.8981373574491327, "grad_norm": 0.640625, "learning_rate": 1.649267055410114e-05, "loss": 0.3887564897537231, "num_input_tokens_seen": 23295458304, "step": 81910, "train_runtime": 796376.1053, "train_tokens_per_second": 29251.83 }, { "epoch": 2.8984911777128617, "grad_norm": 0.59765625, "learning_rate": 1.649177339904376e-05, "loss": 0.3849599361419678, "num_input_tokens_seen": 23298307712, "step": 81920, "train_runtime": 796471.9361, "train_tokens_per_second": 29251.888 }, { "epoch": 2.8988449979765902, "grad_norm": 0.625, "learning_rate": 1.649087639037862e-05, "loss": 0.3815911769866943, "num_input_tokens_seen": 23301108992, "step": 81930, "train_runtime": 796563.892, "train_tokens_per_second": 29252.028 }, { "epoch": 2.899198818240319, "grad_norm": 0.62890625, "learning_rate": 1.6489979528065905e-05, "loss": 0.38560535907745364, "num_input_tokens_seen": 23303952384, "step": 81940, "train_runtime": 796662.055, "train_tokens_per_second": 29251.992 }, { "epoch": 2.8995526385040478, "grad_norm": 0.60546875, "learning_rate": 1.6489082812065826e-05, "loss": 0.38556230068206787, "num_input_tokens_seen": 23306748480, "step": 81950, "train_runtime": 796758.1956, "train_tokens_per_second": 29251.972 }, { "epoch": 2.8999064587677768, "grad_norm": 0.58203125, "learning_rate": 1.64881862423386e-05, "loss": 0.3902272701263428, "num_input_tokens_seen": 23309584064, "step": 81960, "train_runtime": 796853.2062, "train_tokens_per_second": 29252.043 }, { "epoch": 2.9002602790315057, "grad_norm": 0.62890625, "learning_rate": 1.6487289818844477e-05, "loss": 0.3831901550292969, "num_input_tokens_seen": 23312365312, "step": 81970, "train_runtime": 796946.3862, "train_tokens_per_second": 29252.112 }, { "epoch": 2.9006140992952343, "grad_norm": 0.62890625, "learning_rate": 1.6486393541543697e-05, "loss": 0.38457527160644533, "num_input_tokens_seen": 23315219072, "step": 81980, "train_runtime": 797049.0178, "train_tokens_per_second": 29251.926 }, { "epoch": 2.900967919558963, "grad_norm": 0.60546875, "learning_rate": 1.6485497410396535e-05, "loss": 0.3861251354217529, "num_input_tokens_seen": 23318028480, "step": 81990, "train_runtime": 797141.4714, "train_tokens_per_second": 29252.058 }, { "epoch": 2.901321739822692, "grad_norm": 0.625, "learning_rate": 1.6484601425363267e-05, "loss": 0.38825788497924807, "num_input_tokens_seen": 23320873664, "step": 82000, "train_runtime": 797238.6041, "train_tokens_per_second": 29252.063 }, { "epoch": 2.901675560086421, "grad_norm": 0.609375, "learning_rate": 1.6483705586404196e-05, "loss": 0.3879213333129883, "num_input_tokens_seen": 23323738368, "step": 82010, "train_runtime": 797334.7913, "train_tokens_per_second": 29252.127 }, { "epoch": 2.9020293803501493, "grad_norm": 0.62109375, "learning_rate": 1.6482809893479635e-05, "loss": 0.38478999137878417, "num_input_tokens_seen": 23326582464, "step": 82020, "train_runtime": 797433.0514, "train_tokens_per_second": 29252.089 }, { "epoch": 2.902383200613878, "grad_norm": 0.6015625, "learning_rate": 1.648191434654991e-05, "loss": 0.3881343126296997, "num_input_tokens_seen": 23329444608, "step": 82030, "train_runtime": 797532.3221, "train_tokens_per_second": 29252.037 }, { "epoch": 2.902737020877607, "grad_norm": 0.59765625, "learning_rate": 1.6481018945575367e-05, "loss": 0.3858876943588257, "num_input_tokens_seen": 23332333568, "step": 82040, "train_runtime": 797633.876, "train_tokens_per_second": 29251.934 }, { "epoch": 2.903090841141336, "grad_norm": 0.62890625, "learning_rate": 1.6480123690516364e-05, "loss": 0.387485408782959, "num_input_tokens_seen": 23335177600, "step": 82050, "train_runtime": 797732.1834, "train_tokens_per_second": 29251.894 }, { "epoch": 2.9034446614050644, "grad_norm": 0.625, "learning_rate": 1.6479228581333274e-05, "loss": 0.38678512573242185, "num_input_tokens_seen": 23338055424, "step": 82060, "train_runtime": 797832.0491, "train_tokens_per_second": 29251.84 }, { "epoch": 2.9037984816687934, "grad_norm": 0.63671875, "learning_rate": 1.647833361798648e-05, "loss": 0.38803179264068605, "num_input_tokens_seen": 23340829952, "step": 82070, "train_runtime": 797926.1842, "train_tokens_per_second": 29251.866 }, { "epoch": 2.904152301932522, "grad_norm": 0.625, "learning_rate": 1.6477438800436394e-05, "loss": 0.3876200199127197, "num_input_tokens_seen": 23343640960, "step": 82080, "train_runtime": 798020.2788, "train_tokens_per_second": 29251.94 }, { "epoch": 2.904506122196251, "grad_norm": 0.61328125, "learning_rate": 1.6476544128643425e-05, "loss": 0.3908067226409912, "num_input_tokens_seen": 23346495808, "step": 82090, "train_runtime": 798118.9086, "train_tokens_per_second": 29251.902 }, { "epoch": 2.9048599424599795, "grad_norm": 0.625, "learning_rate": 1.6475649602568016e-05, "loss": 0.388978099822998, "num_input_tokens_seen": 23349385728, "step": 82100, "train_runtime": 798222.0452, "train_tokens_per_second": 29251.743 }, { "epoch": 2.9052137627237085, "grad_norm": 0.609375, "learning_rate": 1.6474755222170613e-05, "loss": 0.3860910892486572, "num_input_tokens_seen": 23352194688, "step": 82110, "train_runtime": 798317.4213, "train_tokens_per_second": 29251.766 }, { "epoch": 2.905567582987437, "grad_norm": 0.62890625, "learning_rate": 1.6473860987411676e-05, "loss": 0.38558456897735593, "num_input_tokens_seen": 23355018176, "step": 82120, "train_runtime": 798413.1412, "train_tokens_per_second": 29251.796 }, { "epoch": 2.905921403251166, "grad_norm": 0.65625, "learning_rate": 1.6472966898251688e-05, "loss": 0.3880720853805542, "num_input_tokens_seen": 23357856768, "step": 82130, "train_runtime": 798508.8794, "train_tokens_per_second": 29251.843 }, { "epoch": 2.9062752235148945, "grad_norm": 0.61328125, "learning_rate": 1.647207295465114e-05, "loss": 0.3878506660461426, "num_input_tokens_seen": 23360679424, "step": 82140, "train_runtime": 798604.314, "train_tokens_per_second": 29251.882 }, { "epoch": 2.9066290437786235, "grad_norm": 0.6171875, "learning_rate": 1.647117915657054e-05, "loss": 0.3875114917755127, "num_input_tokens_seen": 23363557888, "step": 82150, "train_runtime": 798702.0068, "train_tokens_per_second": 29251.908 }, { "epoch": 2.9069828640423525, "grad_norm": 0.57421875, "learning_rate": 1.6470285503970414e-05, "loss": 0.3877086639404297, "num_input_tokens_seen": 23366426304, "step": 82160, "train_runtime": 798802.766, "train_tokens_per_second": 29251.809 }, { "epoch": 2.907336684306081, "grad_norm": 0.63671875, "learning_rate": 1.64693919968113e-05, "loss": 0.38842005729675294, "num_input_tokens_seen": 23369299520, "step": 82170, "train_runtime": 798902.7782, "train_tokens_per_second": 29251.744 }, { "epoch": 2.9076905045698096, "grad_norm": 0.609375, "learning_rate": 1.646849863505375e-05, "loss": 0.3870576858520508, "num_input_tokens_seen": 23372104064, "step": 82180, "train_runtime": 798998.3905, "train_tokens_per_second": 29251.754 }, { "epoch": 2.9080443248335386, "grad_norm": 0.62890625, "learning_rate": 1.646760541865834e-05, "loss": 0.38545010089874265, "num_input_tokens_seen": 23374971840, "step": 82190, "train_runtime": 799095.4987, "train_tokens_per_second": 29251.788 }, { "epoch": 2.9083981450972676, "grad_norm": 0.63671875, "learning_rate": 1.6466712347585644e-05, "loss": 0.38867011070251467, "num_input_tokens_seen": 23377801472, "step": 82200, "train_runtime": 799191.6627, "train_tokens_per_second": 29251.808 }, { "epoch": 2.908751965360996, "grad_norm": 0.62109375, "learning_rate": 1.6465819421796264e-05, "loss": 0.38352065086364745, "num_input_tokens_seen": 23380662528, "step": 82210, "train_runtime": 799291.8311, "train_tokens_per_second": 29251.722 }, { "epoch": 2.909105785624725, "grad_norm": 0.59375, "learning_rate": 1.6464926641250812e-05, "loss": 0.38645453453063966, "num_input_tokens_seen": 23383518848, "step": 82220, "train_runtime": 799390.4051, "train_tokens_per_second": 29251.688 }, { "epoch": 2.9094596058884536, "grad_norm": 0.65625, "learning_rate": 1.646403400590992e-05, "loss": 0.38330936431884766, "num_input_tokens_seen": 23386361024, "step": 82230, "train_runtime": 799486.5176, "train_tokens_per_second": 29251.727 }, { "epoch": 2.9098134261521826, "grad_norm": 0.60546875, "learning_rate": 1.6463141515734232e-05, "loss": 0.3893889427185059, "num_input_tokens_seen": 23389224576, "step": 82240, "train_runtime": 799586.4815, "train_tokens_per_second": 29251.651 }, { "epoch": 2.910167246415911, "grad_norm": 0.65234375, "learning_rate": 1.6462249170684403e-05, "loss": 0.38858442306518554, "num_input_tokens_seen": 23392087744, "step": 82250, "train_runtime": 799684.0798, "train_tokens_per_second": 29251.661 }, { "epoch": 2.91052106667964, "grad_norm": 0.6171875, "learning_rate": 1.6461356970721107e-05, "loss": 0.38663530349731445, "num_input_tokens_seen": 23394902336, "step": 82260, "train_runtime": 799778.373, "train_tokens_per_second": 29251.732 }, { "epoch": 2.9108748869433687, "grad_norm": 0.6171875, "learning_rate": 1.646046491580503e-05, "loss": 0.38488140106201174, "num_input_tokens_seen": 23397752896, "step": 82270, "train_runtime": 799875.8841, "train_tokens_per_second": 29251.729 }, { "epoch": 2.9112287072070977, "grad_norm": 0.62109375, "learning_rate": 1.645957300589688e-05, "loss": 0.3893092632293701, "num_input_tokens_seen": 23400557440, "step": 82280, "train_runtime": 799973.2886, "train_tokens_per_second": 29251.673 }, { "epoch": 2.9115825274708262, "grad_norm": 0.6171875, "learning_rate": 1.6458681240957374e-05, "loss": 0.38267061710357664, "num_input_tokens_seen": 23403410944, "step": 82290, "train_runtime": 800071.1152, "train_tokens_per_second": 29251.663 }, { "epoch": 2.9119363477345552, "grad_norm": 0.58984375, "learning_rate": 1.645778962094724e-05, "loss": 0.38626751899719236, "num_input_tokens_seen": 23406277184, "step": 82300, "train_runtime": 800170.0068, "train_tokens_per_second": 29251.63 }, { "epoch": 2.912290167998284, "grad_norm": 0.625, "learning_rate": 1.645689814582723e-05, "loss": 0.38466930389404297, "num_input_tokens_seen": 23409114752, "step": 82310, "train_runtime": 800267.402, "train_tokens_per_second": 29251.616 }, { "epoch": 2.9126439882620128, "grad_norm": 0.65234375, "learning_rate": 1.645600681555811e-05, "loss": 0.3833747863769531, "num_input_tokens_seen": 23411988544, "step": 82320, "train_runtime": 800367.7889, "train_tokens_per_second": 29251.538 }, { "epoch": 2.9129978085257413, "grad_norm": 0.62109375, "learning_rate": 1.645511563010065e-05, "loss": 0.3836660385131836, "num_input_tokens_seen": 23414833600, "step": 82330, "train_runtime": 800462.4365, "train_tokens_per_second": 29251.633 }, { "epoch": 2.9133516287894703, "grad_norm": 0.6171875, "learning_rate": 1.6454224589415647e-05, "loss": 0.3863020896911621, "num_input_tokens_seen": 23417700224, "step": 82340, "train_runtime": 800565.5209, "train_tokens_per_second": 29251.447 }, { "epoch": 2.9137054490531993, "grad_norm": 0.59375, "learning_rate": 1.6453333693463906e-05, "loss": 0.3894108772277832, "num_input_tokens_seen": 23420516672, "step": 82350, "train_runtime": 800661.063, "train_tokens_per_second": 29251.475 }, { "epoch": 2.914059269316928, "grad_norm": 0.6171875, "learning_rate": 1.645244294220625e-05, "loss": 0.3824916362762451, "num_input_tokens_seen": 23423308992, "step": 82360, "train_runtime": 800755.2406, "train_tokens_per_second": 29251.521 }, { "epoch": 2.914413089580657, "grad_norm": 0.63671875, "learning_rate": 1.645155233560352e-05, "loss": 0.38927502632141114, "num_input_tokens_seen": 23426087808, "step": 82370, "train_runtime": 800849.6012, "train_tokens_per_second": 29251.545 }, { "epoch": 2.9147669098443854, "grad_norm": 0.625, "learning_rate": 1.645066187361656e-05, "loss": 0.38840441703796386, "num_input_tokens_seen": 23428857280, "step": 82380, "train_runtime": 800942.9596, "train_tokens_per_second": 29251.593 }, { "epoch": 2.9151207301081143, "grad_norm": 0.640625, "learning_rate": 1.6449771556206242e-05, "loss": 0.38769676685333254, "num_input_tokens_seen": 23431687424, "step": 82390, "train_runtime": 801041.7426, "train_tokens_per_second": 29251.519 }, { "epoch": 2.915474550371843, "grad_norm": 0.640625, "learning_rate": 1.6448881383333446e-05, "loss": 0.38501365184783937, "num_input_tokens_seen": 23434521024, "step": 82400, "train_runtime": 801135.9172, "train_tokens_per_second": 29251.617 }, { "epoch": 2.915828370635572, "grad_norm": 0.625, "learning_rate": 1.644799135495907e-05, "loss": 0.38813204765319825, "num_input_tokens_seen": 23437367872, "step": 82410, "train_runtime": 801234.5991, "train_tokens_per_second": 29251.567 }, { "epoch": 2.9161821908993004, "grad_norm": 0.6015625, "learning_rate": 1.644710147104402e-05, "loss": 0.3833182334899902, "num_input_tokens_seen": 23440213440, "step": 82420, "train_runtime": 801333.9401, "train_tokens_per_second": 29251.492 }, { "epoch": 2.9165360111630294, "grad_norm": 0.61328125, "learning_rate": 1.644621173154923e-05, "loss": 0.3859065055847168, "num_input_tokens_seen": 23443040192, "step": 82430, "train_runtime": 801431.143, "train_tokens_per_second": 29251.471 }, { "epoch": 2.916889831426758, "grad_norm": 0.6171875, "learning_rate": 1.6445322136435636e-05, "loss": 0.38240962028503417, "num_input_tokens_seen": 23445897728, "step": 82440, "train_runtime": 801528.214, "train_tokens_per_second": 29251.494 }, { "epoch": 2.917243651690487, "grad_norm": 0.6171875, "learning_rate": 1.644443268566419e-05, "loss": 0.3901880979537964, "num_input_tokens_seen": 23448717952, "step": 82450, "train_runtime": 801623.2574, "train_tokens_per_second": 29251.544 }, { "epoch": 2.917597471954216, "grad_norm": 0.6015625, "learning_rate": 1.6443543379195868e-05, "loss": 0.38433401584625243, "num_input_tokens_seen": 23451563712, "step": 82460, "train_runtime": 801720.5405, "train_tokens_per_second": 29251.544 }, { "epoch": 2.9179512922179445, "grad_norm": 0.63671875, "learning_rate": 1.6442654216991655e-05, "loss": 0.3919672966003418, "num_input_tokens_seen": 23454397248, "step": 82470, "train_runtime": 801817.1071, "train_tokens_per_second": 29251.555 }, { "epoch": 2.918305112481673, "grad_norm": 0.5859375, "learning_rate": 1.6441765199012542e-05, "loss": 0.3850131034851074, "num_input_tokens_seen": 23457219136, "step": 82480, "train_runtime": 801912.2591, "train_tokens_per_second": 29251.603 }, { "epoch": 2.918658932745402, "grad_norm": 0.60546875, "learning_rate": 1.6440876325219555e-05, "loss": 0.3848023176193237, "num_input_tokens_seen": 23460053376, "step": 82490, "train_runtime": 802010.9696, "train_tokens_per_second": 29251.537 }, { "epoch": 2.919012753009131, "grad_norm": 0.64453125, "learning_rate": 1.643998759557372e-05, "loss": 0.38811097145080564, "num_input_tokens_seen": 23462918400, "step": 82500, "train_runtime": 802111.4252, "train_tokens_per_second": 29251.445 }, { "epoch": 2.9193665732728595, "grad_norm": 0.58984375, "learning_rate": 1.6439099010036077e-05, "loss": 0.3836625814437866, "num_input_tokens_seen": 23465773888, "step": 82510, "train_runtime": 802211.9389, "train_tokens_per_second": 29251.34 }, { "epoch": 2.919720393536588, "grad_norm": 0.6328125, "learning_rate": 1.643821056856769e-05, "loss": 0.38422541618347167, "num_input_tokens_seen": 23468648320, "step": 82520, "train_runtime": 802310.2545, "train_tokens_per_second": 29251.338 }, { "epoch": 2.920074213800317, "grad_norm": 0.62109375, "learning_rate": 1.6437322271129625e-05, "loss": 0.38550510406494143, "num_input_tokens_seen": 23471500992, "step": 82530, "train_runtime": 802410.2736, "train_tokens_per_second": 29251.247 }, { "epoch": 2.920428034064046, "grad_norm": 0.609375, "learning_rate": 1.6436434117682977e-05, "loss": 0.383764386177063, "num_input_tokens_seen": 23474317632, "step": 82540, "train_runtime": 802506.311, "train_tokens_per_second": 29251.256 }, { "epoch": 2.9207818543277746, "grad_norm": 0.6328125, "learning_rate": 1.643554610818885e-05, "loss": 0.3846308469772339, "num_input_tokens_seen": 23477154112, "step": 82550, "train_runtime": 802603.7564, "train_tokens_per_second": 29251.239 }, { "epoch": 2.9211356745915036, "grad_norm": 0.60546875, "learning_rate": 1.6434658242608358e-05, "loss": 0.3879562854766846, "num_input_tokens_seen": 23479999040, "step": 82560, "train_runtime": 802701.8921, "train_tokens_per_second": 29251.207 }, { "epoch": 2.921489494855232, "grad_norm": 0.61328125, "learning_rate": 1.6433770520902633e-05, "loss": 0.38408846855163575, "num_input_tokens_seen": 23482883584, "step": 82570, "train_runtime": 802798.8625, "train_tokens_per_second": 29251.267 }, { "epoch": 2.921843315118961, "grad_norm": 0.61328125, "learning_rate": 1.6432882943032823e-05, "loss": 0.3868762969970703, "num_input_tokens_seen": 23485719744, "step": 82580, "train_runtime": 802895.6746, "train_tokens_per_second": 29251.272 }, { "epoch": 2.9221971353826897, "grad_norm": 0.625, "learning_rate": 1.643199550896009e-05, "loss": 0.38322787284851073, "num_input_tokens_seen": 23488491712, "step": 82590, "train_runtime": 802988.3141, "train_tokens_per_second": 29251.349 }, { "epoch": 2.9225509556464186, "grad_norm": 0.6328125, "learning_rate": 1.6431108218645612e-05, "loss": 0.3878592014312744, "num_input_tokens_seen": 23491391424, "step": 82600, "train_runtime": 803089.3654, "train_tokens_per_second": 29251.279 }, { "epoch": 2.922904775910147, "grad_norm": 0.625, "learning_rate": 1.643022107205058e-05, "loss": 0.3882612228393555, "num_input_tokens_seen": 23494246912, "step": 82610, "train_runtime": 803189.2487, "train_tokens_per_second": 29251.197 }, { "epoch": 2.923258596173876, "grad_norm": 0.6328125, "learning_rate": 1.6429334069136193e-05, "loss": 0.38557631969451905, "num_input_tokens_seen": 23497134400, "step": 82620, "train_runtime": 803288.1373, "train_tokens_per_second": 29251.191 }, { "epoch": 2.9236124164376047, "grad_norm": 0.62890625, "learning_rate": 1.642844720986368e-05, "loss": 0.3846468448638916, "num_input_tokens_seen": 23499930368, "step": 82630, "train_runtime": 803381.1145, "train_tokens_per_second": 29251.286 }, { "epoch": 2.9239662367013337, "grad_norm": 0.63671875, "learning_rate": 1.642756049419427e-05, "loss": 0.38690791130065916, "num_input_tokens_seen": 23502771072, "step": 82640, "train_runtime": 803477.3236, "train_tokens_per_second": 29251.318 }, { "epoch": 2.9243200569650627, "grad_norm": 0.625, "learning_rate": 1.6426673922089217e-05, "loss": 0.3903887033462524, "num_input_tokens_seen": 23505573696, "step": 82650, "train_runtime": 803571.9645, "train_tokens_per_second": 29251.361 }, { "epoch": 2.9246738772287912, "grad_norm": 0.62109375, "learning_rate": 1.6425787493509783e-05, "loss": 0.3897097110748291, "num_input_tokens_seen": 23508397952, "step": 82660, "train_runtime": 803668.7908, "train_tokens_per_second": 29251.351 }, { "epoch": 2.92502769749252, "grad_norm": 0.61328125, "learning_rate": 1.642490120841725e-05, "loss": 0.3898149013519287, "num_input_tokens_seen": 23511237120, "step": 82670, "train_runtime": 803765.9287, "train_tokens_per_second": 29251.348 }, { "epoch": 2.9253815177562488, "grad_norm": 0.5859375, "learning_rate": 1.6424015066772907e-05, "loss": 0.38415255546569826, "num_input_tokens_seen": 23514068032, "step": 82680, "train_runtime": 803861.7196, "train_tokens_per_second": 29251.384 }, { "epoch": 2.9257353380199778, "grad_norm": 0.609375, "learning_rate": 1.6423129068538065e-05, "loss": 0.38874664306640627, "num_input_tokens_seen": 23516875840, "step": 82690, "train_runtime": 803954.4711, "train_tokens_per_second": 29251.502 }, { "epoch": 2.9260891582837063, "grad_norm": 0.61328125, "learning_rate": 1.642224321367405e-05, "loss": 0.3848646402359009, "num_input_tokens_seen": 23519660288, "step": 82700, "train_runtime": 804051.3578, "train_tokens_per_second": 29251.44 }, { "epoch": 2.9264429785474353, "grad_norm": 0.6171875, "learning_rate": 1.6421357502142192e-05, "loss": 0.3840176582336426, "num_input_tokens_seen": 23522507648, "step": 82710, "train_runtime": 804149.8971, "train_tokens_per_second": 29251.397 }, { "epoch": 2.926796798811164, "grad_norm": 0.6171875, "learning_rate": 1.6420471933903847e-05, "loss": 0.38656115531921387, "num_input_tokens_seen": 23525359104, "step": 82720, "train_runtime": 804247.9308, "train_tokens_per_second": 29251.377 }, { "epoch": 2.927150619074893, "grad_norm": 0.63671875, "learning_rate": 1.6419586508920383e-05, "loss": 0.3846739768981934, "num_input_tokens_seen": 23528215360, "step": 82730, "train_runtime": 804345.542, "train_tokens_per_second": 29251.378 }, { "epoch": 2.9275044393386214, "grad_norm": 0.58984375, "learning_rate": 1.641870122715318e-05, "loss": 0.3805502414703369, "num_input_tokens_seen": 23531081984, "step": 82740, "train_runtime": 804444.6396, "train_tokens_per_second": 29251.338 }, { "epoch": 2.9278582596023504, "grad_norm": 0.62109375, "learning_rate": 1.641781608856363e-05, "loss": 0.3851936817169189, "num_input_tokens_seen": 23533993408, "step": 82750, "train_runtime": 804549.1638, "train_tokens_per_second": 29251.156 }, { "epoch": 2.928212079866079, "grad_norm": 0.66015625, "learning_rate": 1.6416931093113156e-05, "loss": 0.3823270320892334, "num_input_tokens_seen": 23536830208, "step": 82760, "train_runtime": 804646.945, "train_tokens_per_second": 29251.127 }, { "epoch": 2.928565900129808, "grad_norm": 0.63671875, "learning_rate": 1.6416046240763165e-05, "loss": 0.38697922229766846, "num_input_tokens_seen": 23539626496, "step": 82770, "train_runtime": 804741.2888, "train_tokens_per_second": 29251.173 }, { "epoch": 2.9289197203935364, "grad_norm": 0.63671875, "learning_rate": 1.641516153147511e-05, "loss": 0.38668863773345946, "num_input_tokens_seen": 23542492032, "step": 82780, "train_runtime": 804839.8677, "train_tokens_per_second": 29251.15 }, { "epoch": 2.9292735406572654, "grad_norm": 0.6328125, "learning_rate": 1.6414276965210436e-05, "loss": 0.3821967124938965, "num_input_tokens_seen": 23545410752, "step": 82790, "train_runtime": 804939.2334, "train_tokens_per_second": 29251.166 }, { "epoch": 2.9296273609209944, "grad_norm": 0.62109375, "learning_rate": 1.641339254193062e-05, "loss": 0.3810905456542969, "num_input_tokens_seen": 23548268608, "step": 82800, "train_runtime": 805037.9791, "train_tokens_per_second": 29251.128 }, { "epoch": 2.929981181184723, "grad_norm": 0.63671875, "learning_rate": 1.6412508261597135e-05, "loss": 0.3860907554626465, "num_input_tokens_seen": 23551140928, "step": 82810, "train_runtime": 805136.7942, "train_tokens_per_second": 29251.105 }, { "epoch": 2.9303350014484515, "grad_norm": 0.63671875, "learning_rate": 1.641162412417149e-05, "loss": 0.3856302261352539, "num_input_tokens_seen": 23554037248, "step": 82820, "train_runtime": 805236.3193, "train_tokens_per_second": 29251.087 }, { "epoch": 2.9306888217121805, "grad_norm": 0.6015625, "learning_rate": 1.641074012961519e-05, "loss": 0.38336546421051027, "num_input_tokens_seen": 23556947584, "step": 82830, "train_runtime": 805338.2179, "train_tokens_per_second": 29250.999 }, { "epoch": 2.9310426419759095, "grad_norm": 0.63671875, "learning_rate": 1.6409856277889765e-05, "loss": 0.38657488822937014, "num_input_tokens_seen": 23559806400, "step": 82840, "train_runtime": 805433.7414, "train_tokens_per_second": 29251.079 }, { "epoch": 2.931396462239638, "grad_norm": 0.625, "learning_rate": 1.6408972568956752e-05, "loss": 0.3888406276702881, "num_input_tokens_seen": 23562656192, "step": 82850, "train_runtime": 805532.0673, "train_tokens_per_second": 29251.047 }, { "epoch": 2.9317502825033666, "grad_norm": 0.609375, "learning_rate": 1.640808900277771e-05, "loss": 0.3857844352722168, "num_input_tokens_seen": 23565470976, "step": 82860, "train_runtime": 805628.9688, "train_tokens_per_second": 29251.022 }, { "epoch": 2.9321041027670955, "grad_norm": 0.6171875, "learning_rate": 1.6407205579314206e-05, "loss": 0.3853294372558594, "num_input_tokens_seen": 23568335808, "step": 82870, "train_runtime": 805727.3849, "train_tokens_per_second": 29251.005 }, { "epoch": 2.9324579230308245, "grad_norm": 0.62109375, "learning_rate": 1.640632229852783e-05, "loss": 0.388051700592041, "num_input_tokens_seen": 23571196224, "step": 82880, "train_runtime": 805827.8079, "train_tokens_per_second": 29250.909 }, { "epoch": 2.932811743294553, "grad_norm": 0.62109375, "learning_rate": 1.6405439160380177e-05, "loss": 0.38526253700256347, "num_input_tokens_seen": 23574055680, "step": 82890, "train_runtime": 805927.4114, "train_tokens_per_second": 29250.842 }, { "epoch": 2.933165563558282, "grad_norm": 0.6328125, "learning_rate": 1.640455616483286e-05, "loss": 0.3887608051300049, "num_input_tokens_seen": 23576903680, "step": 82900, "train_runtime": 806023.5991, "train_tokens_per_second": 29250.885 }, { "epoch": 2.9335193838220106, "grad_norm": 0.6171875, "learning_rate": 1.6403673311847505e-05, "loss": 0.3862152099609375, "num_input_tokens_seen": 23579735552, "step": 82910, "train_runtime": 806118.0537, "train_tokens_per_second": 29250.971 }, { "epoch": 2.9338732040857396, "grad_norm": 0.65625, "learning_rate": 1.6402790601385763e-05, "loss": 0.38983745574951173, "num_input_tokens_seen": 23582601088, "step": 82920, "train_runtime": 806214.7457, "train_tokens_per_second": 29251.017 }, { "epoch": 2.934227024349468, "grad_norm": 0.62890625, "learning_rate": 1.6401908033409285e-05, "loss": 0.38552117347717285, "num_input_tokens_seen": 23585431296, "step": 82930, "train_runtime": 806308.9158, "train_tokens_per_second": 29251.111 }, { "epoch": 2.934580844613197, "grad_norm": 0.60546875, "learning_rate": 1.640102560787974e-05, "loss": 0.3851055145263672, "num_input_tokens_seen": 23588249344, "step": 82940, "train_runtime": 806406.6898, "train_tokens_per_second": 29251.059 }, { "epoch": 2.9349346648769257, "grad_norm": 0.60546875, "learning_rate": 1.640014332475882e-05, "loss": 0.3832894802093506, "num_input_tokens_seen": 23591092352, "step": 82950, "train_runtime": 806502.8358, "train_tokens_per_second": 29251.097 }, { "epoch": 2.9352884851406547, "grad_norm": 0.61328125, "learning_rate": 1.639926118400822e-05, "loss": 0.3889326810836792, "num_input_tokens_seen": 23593946496, "step": 82960, "train_runtime": 806600.5491, "train_tokens_per_second": 29251.092 }, { "epoch": 2.935642305404383, "grad_norm": 0.625, "learning_rate": 1.6398379185589653e-05, "loss": 0.385534405708313, "num_input_tokens_seen": 23596771136, "step": 82970, "train_runtime": 806696.8554, "train_tokens_per_second": 29251.101 }, { "epoch": 2.935996125668112, "grad_norm": 0.62890625, "learning_rate": 1.6397497329464858e-05, "loss": 0.3899168729782104, "num_input_tokens_seen": 23599582208, "step": 82980, "train_runtime": 806794.4251, "train_tokens_per_second": 29251.048 }, { "epoch": 2.936349945931841, "grad_norm": 0.60546875, "learning_rate": 1.639661561559557e-05, "loss": 0.38686366081237794, "num_input_tokens_seen": 23602429056, "step": 82990, "train_runtime": 806894.4242, "train_tokens_per_second": 29250.951 }, { "epoch": 2.9367037661955697, "grad_norm": 0.6015625, "learning_rate": 1.639573404394355e-05, "loss": 0.38504624366760254, "num_input_tokens_seen": 23605236096, "step": 83000, "train_runtime": 806988.7567, "train_tokens_per_second": 29251.01 }, { "epoch": 2.9370575864592983, "grad_norm": 0.62109375, "learning_rate": 1.6394852614470568e-05, "loss": 0.38621604442596436, "num_input_tokens_seen": 23608039360, "step": 83010, "train_runtime": 807083.1546, "train_tokens_per_second": 29251.062 }, { "epoch": 2.9374114067230273, "grad_norm": 0.62890625, "learning_rate": 1.6393971327138412e-05, "loss": 0.38556957244873047, "num_input_tokens_seen": 23610894848, "step": 83020, "train_runtime": 807180.9453, "train_tokens_per_second": 29251.056 }, { "epoch": 2.9377652269867562, "grad_norm": 0.625, "learning_rate": 1.639309018190888e-05, "loss": 0.38628058433532714, "num_input_tokens_seen": 23613715840, "step": 83030, "train_runtime": 807278.9878, "train_tokens_per_second": 29250.998 }, { "epoch": 2.938119047250485, "grad_norm": 0.61328125, "learning_rate": 1.6392209178743793e-05, "loss": 0.37987167835235597, "num_input_tokens_seen": 23616599040, "step": 83040, "train_runtime": 807378.2615, "train_tokens_per_second": 29250.972 }, { "epoch": 2.9384728675142138, "grad_norm": 0.609375, "learning_rate": 1.639132831760497e-05, "loss": 0.3892202377319336, "num_input_tokens_seen": 23619449024, "step": 83050, "train_runtime": 807474.8821, "train_tokens_per_second": 29251.002 }, { "epoch": 2.9388266877779423, "grad_norm": 0.609375, "learning_rate": 1.6390447598454276e-05, "loss": 0.38800644874572754, "num_input_tokens_seen": 23622251072, "step": 83060, "train_runtime": 807567.1711, "train_tokens_per_second": 29251.128 }, { "epoch": 2.9391805080416713, "grad_norm": 0.609375, "learning_rate": 1.6389567021253547e-05, "loss": 0.3839103698730469, "num_input_tokens_seen": 23625106624, "step": 83070, "train_runtime": 807661.7853, "train_tokens_per_second": 29251.237 }, { "epoch": 2.9395343283054, "grad_norm": 0.60546875, "learning_rate": 1.6388686585964667e-05, "loss": 0.38768534660339354, "num_input_tokens_seen": 23627990528, "step": 83080, "train_runtime": 807762.3764, "train_tokens_per_second": 29251.165 }, { "epoch": 2.939888148569129, "grad_norm": 0.61328125, "learning_rate": 1.6387806292549522e-05, "loss": 0.3853769302368164, "num_input_tokens_seen": 23630893568, "step": 83090, "train_runtime": 807863.1703, "train_tokens_per_second": 29251.109 }, { "epoch": 2.9402419688328574, "grad_norm": 0.60546875, "learning_rate": 1.6386926140970015e-05, "loss": 0.38523569107055666, "num_input_tokens_seen": 23633754176, "step": 83100, "train_runtime": 807960.258, "train_tokens_per_second": 29251.134 }, { "epoch": 2.9405957890965864, "grad_norm": 0.62890625, "learning_rate": 1.6386046131188054e-05, "loss": 0.38545637130737304, "num_input_tokens_seen": 23636573824, "step": 83110, "train_runtime": 808055.1514, "train_tokens_per_second": 29251.189 }, { "epoch": 2.940949609360315, "grad_norm": 0.63671875, "learning_rate": 1.638516626316558e-05, "loss": 0.3828999996185303, "num_input_tokens_seen": 23639506816, "step": 83120, "train_runtime": 808158.5608, "train_tokens_per_second": 29251.075 }, { "epoch": 2.941303429624044, "grad_norm": 0.6171875, "learning_rate": 1.6384286536864525e-05, "loss": 0.38341171741485597, "num_input_tokens_seen": 23642375104, "step": 83130, "train_runtime": 808257.5624, "train_tokens_per_second": 29251.041 }, { "epoch": 2.941657249887773, "grad_norm": 0.60546875, "learning_rate": 1.6383406952246856e-05, "loss": 0.38609349727630615, "num_input_tokens_seen": 23645265600, "step": 83140, "train_runtime": 808359.3333, "train_tokens_per_second": 29250.934 }, { "epoch": 2.9420110701515014, "grad_norm": 0.640625, "learning_rate": 1.638252750927455e-05, "loss": 0.3891077995300293, "num_input_tokens_seen": 23648169152, "step": 83150, "train_runtime": 808462.3777, "train_tokens_per_second": 29250.797 }, { "epoch": 2.94236489041523, "grad_norm": 0.62890625, "learning_rate": 1.6381648207909584e-05, "loss": 0.38407163619995116, "num_input_tokens_seen": 23651006656, "step": 83160, "train_runtime": 808560.7752, "train_tokens_per_second": 29250.747 }, { "epoch": 2.942718710678959, "grad_norm": 0.61328125, "learning_rate": 1.6380769048113964e-05, "loss": 0.38840465545654296, "num_input_tokens_seen": 23653862656, "step": 83170, "train_runtime": 808659.2289, "train_tokens_per_second": 29250.717 }, { "epoch": 2.943072530942688, "grad_norm": 0.640625, "learning_rate": 1.6379890029849707e-05, "loss": 0.3854518890380859, "num_input_tokens_seen": 23656685696, "step": 83180, "train_runtime": 808753.499, "train_tokens_per_second": 29250.799 }, { "epoch": 2.9434263512064165, "grad_norm": 0.60546875, "learning_rate": 1.6379011153078844e-05, "loss": 0.38362760543823243, "num_input_tokens_seen": 23659521088, "step": 83190, "train_runtime": 808851.3075, "train_tokens_per_second": 29250.767 }, { "epoch": 2.943780171470145, "grad_norm": 0.62890625, "learning_rate": 1.6378132417763415e-05, "loss": 0.3878089427947998, "num_input_tokens_seen": 23662329792, "step": 83200, "train_runtime": 808944.838, "train_tokens_per_second": 29250.857 }, { "epoch": 2.944133991733874, "grad_norm": 0.6171875, "learning_rate": 1.637725382386548e-05, "loss": 0.3869441509246826, "num_input_tokens_seen": 23665161344, "step": 83210, "train_runtime": 809040.6236, "train_tokens_per_second": 29250.894 }, { "epoch": 2.944487811997603, "grad_norm": 0.6171875, "learning_rate": 1.6376375371347118e-05, "loss": 0.3846909046173096, "num_input_tokens_seen": 23668013440, "step": 83220, "train_runtime": 809137.3557, "train_tokens_per_second": 29250.922 }, { "epoch": 2.9448416322613316, "grad_norm": 0.6328125, "learning_rate": 1.6375497060170403e-05, "loss": 0.3894462585449219, "num_input_tokens_seen": 23670866432, "step": 83230, "train_runtime": 809235.3718, "train_tokens_per_second": 29250.904 }, { "epoch": 2.9451954525250605, "grad_norm": 0.609375, "learning_rate": 1.637461889029745e-05, "loss": 0.39057221412658694, "num_input_tokens_seen": 23673660032, "step": 83240, "train_runtime": 809329.3318, "train_tokens_per_second": 29250.96 }, { "epoch": 2.945549272788789, "grad_norm": 0.625, "learning_rate": 1.637374086169037e-05, "loss": 0.3871551513671875, "num_input_tokens_seen": 23676509120, "step": 83250, "train_runtime": 809428.5724, "train_tokens_per_second": 29250.894 }, { "epoch": 2.945903093052518, "grad_norm": 0.6171875, "learning_rate": 1.6372862974311286e-05, "loss": 0.3927941083908081, "num_input_tokens_seen": 23679353472, "step": 83260, "train_runtime": 809525.959, "train_tokens_per_second": 29250.888 }, { "epoch": 2.9462569133162466, "grad_norm": 0.609375, "learning_rate": 1.637198522812235e-05, "loss": 0.38093230724334715, "num_input_tokens_seen": 23682166592, "step": 83270, "train_runtime": 809620.0608, "train_tokens_per_second": 29250.963 }, { "epoch": 2.9466107335799756, "grad_norm": 0.63671875, "learning_rate": 1.6371107623085722e-05, "loss": 0.38582792282104494, "num_input_tokens_seen": 23684986752, "step": 83280, "train_runtime": 809713.6848, "train_tokens_per_second": 29251.064 }, { "epoch": 2.9469645538437046, "grad_norm": 0.63671875, "learning_rate": 1.637023015916356e-05, "loss": 0.3854196786880493, "num_input_tokens_seen": 23687790464, "step": 83290, "train_runtime": 809809.1079, "train_tokens_per_second": 29251.079 }, { "epoch": 2.947318374107433, "grad_norm": 0.6171875, "learning_rate": 1.636935283631807e-05, "loss": 0.3870986461639404, "num_input_tokens_seen": 23690656576, "step": 83300, "train_runtime": 809908.5148, "train_tokens_per_second": 29251.028 }, { "epoch": 2.9476721943711617, "grad_norm": 0.61328125, "learning_rate": 1.6368475654511438e-05, "loss": 0.3840007781982422, "num_input_tokens_seen": 23693496896, "step": 83310, "train_runtime": 810006.6314, "train_tokens_per_second": 29250.991 }, { "epoch": 2.9480260146348907, "grad_norm": 0.640625, "learning_rate": 1.6367598613705887e-05, "loss": 0.38996109962463377, "num_input_tokens_seen": 23696350464, "step": 83320, "train_runtime": 810106.3755, "train_tokens_per_second": 29250.912 }, { "epoch": 2.9483798348986197, "grad_norm": 0.62109375, "learning_rate": 1.636672171386364e-05, "loss": 0.3854548454284668, "num_input_tokens_seen": 23699161920, "step": 83330, "train_runtime": 810200.3888, "train_tokens_per_second": 29250.988 }, { "epoch": 2.948733655162348, "grad_norm": 0.6015625, "learning_rate": 1.6365844954946946e-05, "loss": 0.38654074668884275, "num_input_tokens_seen": 23702015040, "step": 83340, "train_runtime": 810298.678, "train_tokens_per_second": 29250.961 }, { "epoch": 2.9490874754260767, "grad_norm": 0.609375, "learning_rate": 1.6364968336918064e-05, "loss": 0.38648381233215334, "num_input_tokens_seen": 23704874816, "step": 83350, "train_runtime": 810395.9266, "train_tokens_per_second": 29250.98 }, { "epoch": 2.9494412956898057, "grad_norm": 0.6484375, "learning_rate": 1.636409185973925e-05, "loss": 0.3865505218505859, "num_input_tokens_seen": 23707676672, "step": 83360, "train_runtime": 810491.4689, "train_tokens_per_second": 29250.989 }, { "epoch": 2.9497951159535347, "grad_norm": 0.62109375, "learning_rate": 1.6363215523372812e-05, "loss": 0.38443286418914796, "num_input_tokens_seen": 23710491712, "step": 83370, "train_runtime": 810586.5557, "train_tokens_per_second": 29251.03 }, { "epoch": 2.9501489362172633, "grad_norm": 0.609375, "learning_rate": 1.6362339327781036e-05, "loss": 0.38669571876525877, "num_input_tokens_seen": 23713341312, "step": 83380, "train_runtime": 810683.6683, "train_tokens_per_second": 29251.041 }, { "epoch": 2.9505027564809923, "grad_norm": 0.62109375, "learning_rate": 1.6361463272926238e-05, "loss": 0.3865213394165039, "num_input_tokens_seen": 23716154880, "step": 83390, "train_runtime": 810779.7494, "train_tokens_per_second": 29251.045 }, { "epoch": 2.950856576744721, "grad_norm": 0.61328125, "learning_rate": 1.6360587358770747e-05, "loss": 0.3836618423461914, "num_input_tokens_seen": 23719030144, "step": 83400, "train_runtime": 810878.6613, "train_tokens_per_second": 29251.023 }, { "epoch": 2.95121039700845, "grad_norm": 0.625, "learning_rate": 1.635971158527691e-05, "loss": 0.38424320220947267, "num_input_tokens_seen": 23721824896, "step": 83410, "train_runtime": 810973.1139, "train_tokens_per_second": 29251.062 }, { "epoch": 2.9515642172721783, "grad_norm": 0.625, "learning_rate": 1.6358835952407074e-05, "loss": 0.3885367393493652, "num_input_tokens_seen": 23724640000, "step": 83420, "train_runtime": 811069.0067, "train_tokens_per_second": 29251.075 }, { "epoch": 2.9519180375359073, "grad_norm": 0.59375, "learning_rate": 1.6357960460123614e-05, "loss": 0.38461220264434814, "num_input_tokens_seen": 23727508160, "step": 83430, "train_runtime": 811165.983, "train_tokens_per_second": 29251.113 }, { "epoch": 2.952271857799636, "grad_norm": 0.62109375, "learning_rate": 1.6357085108388913e-05, "loss": 0.38738555908203126, "num_input_tokens_seen": 23730346240, "step": 83440, "train_runtime": 811264.0204, "train_tokens_per_second": 29251.077 }, { "epoch": 2.952625678063365, "grad_norm": 0.64453125, "learning_rate": 1.6356209897165374e-05, "loss": 0.39089107513427734, "num_input_tokens_seen": 23733172224, "step": 83450, "train_runtime": 811360.8403, "train_tokens_per_second": 29251.069 }, { "epoch": 2.9529794983270934, "grad_norm": 0.62890625, "learning_rate": 1.635533482641541e-05, "loss": 0.38880579471588134, "num_input_tokens_seen": 23736043904, "step": 83460, "train_runtime": 811460.4281, "train_tokens_per_second": 29251.018 }, { "epoch": 2.9533333185908224, "grad_norm": 0.6328125, "learning_rate": 1.6354459896101436e-05, "loss": 0.38423309326171873, "num_input_tokens_seen": 23738905920, "step": 83470, "train_runtime": 811561.4152, "train_tokens_per_second": 29250.905 }, { "epoch": 2.9536871388545514, "grad_norm": 0.6328125, "learning_rate": 1.6353585106185908e-05, "loss": 0.38716278076171873, "num_input_tokens_seen": 23741739648, "step": 83480, "train_runtime": 811659.9734, "train_tokens_per_second": 29250.844 }, { "epoch": 2.95404095911828, "grad_norm": 0.61328125, "learning_rate": 1.6352710456631275e-05, "loss": 0.38989255428314207, "num_input_tokens_seen": 23744573248, "step": 83490, "train_runtime": 811754.8302, "train_tokens_per_second": 29250.917 }, { "epoch": 2.9543947793820085, "grad_norm": 0.62109375, "learning_rate": 1.6351835947400003e-05, "loss": 0.38204116821289064, "num_input_tokens_seen": 23747442240, "step": 83500, "train_runtime": 811852.6835, "train_tokens_per_second": 29250.925 }, { "epoch": 2.9547485996457374, "grad_norm": 0.60546875, "learning_rate": 1.6350961578454578e-05, "loss": 0.3851689577102661, "num_input_tokens_seen": 23750253312, "step": 83510, "train_runtime": 811946.1042, "train_tokens_per_second": 29251.022 }, { "epoch": 2.9551024199094664, "grad_norm": 0.64453125, "learning_rate": 1.6350087349757494e-05, "loss": 0.38490025997161864, "num_input_tokens_seen": 23752986560, "step": 83520, "train_runtime": 812038.1159, "train_tokens_per_second": 29251.073 }, { "epoch": 2.955456240173195, "grad_norm": 0.625, "learning_rate": 1.6349213261271268e-05, "loss": 0.3878573656082153, "num_input_tokens_seen": 23755793728, "step": 83530, "train_runtime": 812131.7532, "train_tokens_per_second": 29251.157 }, { "epoch": 2.955810060436924, "grad_norm": 0.62890625, "learning_rate": 1.634833931295842e-05, "loss": 0.38826005458831786, "num_input_tokens_seen": 23758717696, "step": 83540, "train_runtime": 812233.6767, "train_tokens_per_second": 29251.087 }, { "epoch": 2.9561638807006525, "grad_norm": 0.6171875, "learning_rate": 1.6347465504781485e-05, "loss": 0.38635029792785647, "num_input_tokens_seen": 23761537792, "step": 83550, "train_runtime": 812327.9192, "train_tokens_per_second": 29251.165 }, { "epoch": 2.9565177009643815, "grad_norm": 0.62890625, "learning_rate": 1.634659183670303e-05, "loss": 0.38464970588684083, "num_input_tokens_seen": 23764342720, "step": 83560, "train_runtime": 812422.5798, "train_tokens_per_second": 29251.209 }, { "epoch": 2.95687152122811, "grad_norm": 0.640625, "learning_rate": 1.634571830868561e-05, "loss": 0.38938307762145996, "num_input_tokens_seen": 23767170432, "step": 83570, "train_runtime": 812518.6613, "train_tokens_per_second": 29251.23 }, { "epoch": 2.957225341491839, "grad_norm": 0.62109375, "learning_rate": 1.634484492069181e-05, "loss": 0.38609766960144043, "num_input_tokens_seen": 23770029248, "step": 83580, "train_runtime": 812618.9286, "train_tokens_per_second": 29251.139 }, { "epoch": 2.9575791617555676, "grad_norm": 0.60546875, "learning_rate": 1.6343971672684228e-05, "loss": 0.3823888063430786, "num_input_tokens_seen": 23772902400, "step": 83590, "train_runtime": 812717.1496, "train_tokens_per_second": 29251.139 }, { "epoch": 2.9579329820192966, "grad_norm": 0.65625, "learning_rate": 1.634309856462547e-05, "loss": 0.38741140365600585, "num_input_tokens_seen": 23775763584, "step": 83600, "train_runtime": 812816.5878, "train_tokens_per_second": 29251.081 }, { "epoch": 2.958286802283025, "grad_norm": 0.609375, "learning_rate": 1.6342225596478154e-05, "loss": 0.39187190532684324, "num_input_tokens_seen": 23778612032, "step": 83610, "train_runtime": 812912.3357, "train_tokens_per_second": 29251.139 }, { "epoch": 2.958640622546754, "grad_norm": 0.61328125, "learning_rate": 1.6341352768204925e-05, "loss": 0.3843673229217529, "num_input_tokens_seen": 23781454720, "step": 83620, "train_runtime": 813011.2587, "train_tokens_per_second": 29251.077 }, { "epoch": 2.958994442810483, "grad_norm": 0.62109375, "learning_rate": 1.6340480079768432e-05, "loss": 0.3842111110687256, "num_input_tokens_seen": 23784243904, "step": 83630, "train_runtime": 813107.931, "train_tokens_per_second": 29251.029 }, { "epoch": 2.9593482630742116, "grad_norm": 0.6171875, "learning_rate": 1.6339607531131343e-05, "loss": 0.38688862323760986, "num_input_tokens_seen": 23787060416, "step": 83640, "train_runtime": 813205.2827, "train_tokens_per_second": 29250.991 }, { "epoch": 2.95970208333794, "grad_norm": 0.59375, "learning_rate": 1.633873512225633e-05, "loss": 0.3859706401824951, "num_input_tokens_seen": 23789838016, "step": 83650, "train_runtime": 813298.9852, "train_tokens_per_second": 29251.036 }, { "epoch": 2.960055903601669, "grad_norm": 0.60546875, "learning_rate": 1.6337862853106086e-05, "loss": 0.385085129737854, "num_input_tokens_seen": 23792624640, "step": 83660, "train_runtime": 813393.4514, "train_tokens_per_second": 29251.065 }, { "epoch": 2.960409723865398, "grad_norm": 0.6171875, "learning_rate": 1.633699072364333e-05, "loss": 0.3840926170349121, "num_input_tokens_seen": 23795411712, "step": 83670, "train_runtime": 813488.1029, "train_tokens_per_second": 29251.088 }, { "epoch": 2.9607635441291267, "grad_norm": 0.63671875, "learning_rate": 1.6336118733830765e-05, "loss": 0.39058752059936525, "num_input_tokens_seen": 23798338304, "step": 83680, "train_runtime": 813589.8391, "train_tokens_per_second": 29251.027 }, { "epoch": 2.9611173643928552, "grad_norm": 0.6015625, "learning_rate": 1.633524688363114e-05, "loss": 0.385579252243042, "num_input_tokens_seen": 23801185152, "step": 83690, "train_runtime": 813687.262, "train_tokens_per_second": 29251.023 }, { "epoch": 2.961471184656584, "grad_norm": 0.60546875, "learning_rate": 1.6334375173007193e-05, "loss": 0.383055591583252, "num_input_tokens_seen": 23804061376, "step": 83700, "train_runtime": 813785.6328, "train_tokens_per_second": 29251.022 }, { "epoch": 2.961825004920313, "grad_norm": 0.625, "learning_rate": 1.6333503601921697e-05, "loss": 0.38640170097351073, "num_input_tokens_seen": 23806873920, "step": 83710, "train_runtime": 813884.2769, "train_tokens_per_second": 29250.932 }, { "epoch": 2.9621788251840417, "grad_norm": 0.6171875, "learning_rate": 1.6332632170337422e-05, "loss": 0.3885246753692627, "num_input_tokens_seen": 23809774912, "step": 83720, "train_runtime": 813987.0272, "train_tokens_per_second": 29250.804 }, { "epoch": 2.9625326454477707, "grad_norm": 0.609375, "learning_rate": 1.6331760878217162e-05, "loss": 0.38816304206848146, "num_input_tokens_seen": 23812611520, "step": 83730, "train_runtime": 814080.9216, "train_tokens_per_second": 29250.915 }, { "epoch": 2.9628864657114993, "grad_norm": 0.62109375, "learning_rate": 1.6330889725523713e-05, "loss": 0.38534929752349856, "num_input_tokens_seen": 23815486784, "step": 83740, "train_runtime": 814181.2573, "train_tokens_per_second": 29250.841 }, { "epoch": 2.9632402859752283, "grad_norm": 0.6484375, "learning_rate": 1.6330018712219902e-05, "loss": 0.38374896049499513, "num_input_tokens_seen": 23818351040, "step": 83750, "train_runtime": 814278.0851, "train_tokens_per_second": 29250.881 }, { "epoch": 2.963594106238957, "grad_norm": 0.62109375, "learning_rate": 1.632914783826856e-05, "loss": 0.38723015785217285, "num_input_tokens_seen": 23821142784, "step": 83760, "train_runtime": 814371.8529, "train_tokens_per_second": 29250.941 }, { "epoch": 2.963947926502686, "grad_norm": 0.6171875, "learning_rate": 1.632827710363253e-05, "loss": 0.386868953704834, "num_input_tokens_seen": 23823973440, "step": 83770, "train_runtime": 814469.9264, "train_tokens_per_second": 29250.894 }, { "epoch": 2.9643017467664143, "grad_norm": 0.61328125, "learning_rate": 1.632740650827467e-05, "loss": 0.387319278717041, "num_input_tokens_seen": 23826783360, "step": 83780, "train_runtime": 814564.5968, "train_tokens_per_second": 29250.944 }, { "epoch": 2.9646555670301433, "grad_norm": 0.64453125, "learning_rate": 1.632653605215786e-05, "loss": 0.38904705047607424, "num_input_tokens_seen": 23829662080, "step": 83790, "train_runtime": 814665.6683, "train_tokens_per_second": 29250.849 }, { "epoch": 2.965009387293872, "grad_norm": 0.609375, "learning_rate": 1.6325665735244984e-05, "loss": 0.38100247383117675, "num_input_tokens_seen": 23832484480, "step": 83800, "train_runtime": 814762.2296, "train_tokens_per_second": 29250.846 }, { "epoch": 2.965363207557601, "grad_norm": 0.6171875, "learning_rate": 1.6324795557498935e-05, "loss": 0.38549013137817384, "num_input_tokens_seen": 23835282624, "step": 83810, "train_runtime": 814856.1657, "train_tokens_per_second": 29250.908 }, { "epoch": 2.96571702782133, "grad_norm": 0.6484375, "learning_rate": 1.6323925518882646e-05, "loss": 0.39046125411987304, "num_input_tokens_seen": 23838149952, "step": 83820, "train_runtime": 814954.5309, "train_tokens_per_second": 29250.896 }, { "epoch": 2.9660708480850584, "grad_norm": 0.625, "learning_rate": 1.632305561935903e-05, "loss": 0.3899209499359131, "num_input_tokens_seen": 23840988480, "step": 83830, "train_runtime": 815052.8829, "train_tokens_per_second": 29250.849 }, { "epoch": 2.966424668348787, "grad_norm": 0.62890625, "learning_rate": 1.632218585889104e-05, "loss": 0.384243369102478, "num_input_tokens_seen": 23843888640, "step": 83840, "train_runtime": 815152.8016, "train_tokens_per_second": 29250.821 }, { "epoch": 2.966778488612516, "grad_norm": 0.59765625, "learning_rate": 1.6321316237441624e-05, "loss": 0.38520216941833496, "num_input_tokens_seen": 23846769472, "step": 83850, "train_runtime": 815252.6967, "train_tokens_per_second": 29250.77 }, { "epoch": 2.967132308876245, "grad_norm": 0.6171875, "learning_rate": 1.632044675497376e-05, "loss": 0.38357346057891845, "num_input_tokens_seen": 23849633408, "step": 83860, "train_runtime": 815349.9518, "train_tokens_per_second": 29250.794 }, { "epoch": 2.9674861291399734, "grad_norm": 0.6171875, "learning_rate": 1.6319577411450427e-05, "loss": 0.38504045009613036, "num_input_tokens_seen": 23852474496, "step": 83870, "train_runtime": 815448.7905, "train_tokens_per_second": 29250.733 }, { "epoch": 2.9678399494037024, "grad_norm": 0.62109375, "learning_rate": 1.631870820683463e-05, "loss": 0.38596034049987793, "num_input_tokens_seen": 23855295936, "step": 83880, "train_runtime": 815543.3712, "train_tokens_per_second": 29250.8 }, { "epoch": 2.968193769667431, "grad_norm": 0.625, "learning_rate": 1.6317839141089375e-05, "loss": 0.3841878414154053, "num_input_tokens_seen": 23858154432, "step": 83890, "train_runtime": 815642.4243, "train_tokens_per_second": 29250.752 }, { "epoch": 2.96854758993116, "grad_norm": 0.66796875, "learning_rate": 1.6316970214177686e-05, "loss": 0.3918689966201782, "num_input_tokens_seen": 23861043520, "step": 83900, "train_runtime": 815741.8705, "train_tokens_per_second": 29250.728 }, { "epoch": 2.9689014101948885, "grad_norm": 0.62890625, "learning_rate": 1.6316101426062604e-05, "loss": 0.38515558242797854, "num_input_tokens_seen": 23863870976, "step": 83910, "train_runtime": 815840.8788, "train_tokens_per_second": 29250.644 }, { "epoch": 2.9692552304586175, "grad_norm": 0.63671875, "learning_rate": 1.6315232776707187e-05, "loss": 0.387478232383728, "num_input_tokens_seen": 23866709632, "step": 83920, "train_runtime": 815936.0057, "train_tokens_per_second": 29250.713 }, { "epoch": 2.969609050722346, "grad_norm": 0.62109375, "learning_rate": 1.63143642660745e-05, "loss": 0.38737921714782714, "num_input_tokens_seen": 23869575552, "step": 83930, "train_runtime": 816033.6368, "train_tokens_per_second": 29250.725 }, { "epoch": 2.969962870986075, "grad_norm": 0.6015625, "learning_rate": 1.631349589412762e-05, "loss": 0.38399181365966795, "num_input_tokens_seen": 23872414336, "step": 83940, "train_runtime": 816130.8162, "train_tokens_per_second": 29250.72 }, { "epoch": 2.9703166912498036, "grad_norm": 0.61328125, "learning_rate": 1.631262766082964e-05, "loss": 0.3832873344421387, "num_input_tokens_seen": 23875271040, "step": 83950, "train_runtime": 816228.2014, "train_tokens_per_second": 29250.73 }, { "epoch": 2.9706705115135326, "grad_norm": 0.6328125, "learning_rate": 1.631175956614368e-05, "loss": 0.39100937843322753, "num_input_tokens_seen": 23878081408, "step": 83960, "train_runtime": 816324.8059, "train_tokens_per_second": 29250.712 }, { "epoch": 2.9710243317772616, "grad_norm": 0.62890625, "learning_rate": 1.6310891610032843e-05, "loss": 0.3873640775680542, "num_input_tokens_seen": 23880967424, "step": 83970, "train_runtime": 816423.2244, "train_tokens_per_second": 29250.72 }, { "epoch": 2.97137815204099, "grad_norm": 0.61328125, "learning_rate": 1.6310023792460282e-05, "loss": 0.3853854417800903, "num_input_tokens_seen": 23883809984, "step": 83980, "train_runtime": 816517.7085, "train_tokens_per_second": 29250.817 }, { "epoch": 2.9717319723047186, "grad_norm": 0.6015625, "learning_rate": 1.630915611338914e-05, "loss": 0.384059476852417, "num_input_tokens_seen": 23886686784, "step": 83990, "train_runtime": 816618.8333, "train_tokens_per_second": 29250.717 }, { "epoch": 2.9720857925684476, "grad_norm": 0.6171875, "learning_rate": 1.6308288572782576e-05, "loss": 0.382511568069458, "num_input_tokens_seen": 23889513152, "step": 84000, "train_runtime": 816716.6254, "train_tokens_per_second": 29250.676 }, { "epoch": 2.9724396128321766, "grad_norm": 0.57421875, "learning_rate": 1.6307421170603776e-05, "loss": 0.3868354320526123, "num_input_tokens_seen": 23892358592, "step": 84010, "train_runtime": 816813.8951, "train_tokens_per_second": 29250.676 }, { "epoch": 2.972793433095905, "grad_norm": 0.62109375, "learning_rate": 1.630655390681592e-05, "loss": 0.38753175735473633, "num_input_tokens_seen": 23895242368, "step": 84020, "train_runtime": 816912.2422, "train_tokens_per_second": 29250.685 }, { "epoch": 2.9731472533596337, "grad_norm": 0.6015625, "learning_rate": 1.6305686781382223e-05, "loss": 0.3871962785720825, "num_input_tokens_seen": 23898074240, "step": 84030, "train_runtime": 817007.2581, "train_tokens_per_second": 29250.749 }, { "epoch": 2.9735010736233627, "grad_norm": 0.6171875, "learning_rate": 1.6304819794265894e-05, "loss": 0.38687567710876464, "num_input_tokens_seen": 23900947776, "step": 84040, "train_runtime": 817107.5339, "train_tokens_per_second": 29250.676 }, { "epoch": 2.9738548938870917, "grad_norm": 0.63671875, "learning_rate": 1.630395294543017e-05, "loss": 0.38591742515563965, "num_input_tokens_seen": 23903795648, "step": 84050, "train_runtime": 817205.3436, "train_tokens_per_second": 29250.66 }, { "epoch": 2.97420871415082, "grad_norm": 0.609375, "learning_rate": 1.6303086234838297e-05, "loss": 0.3876797199249268, "num_input_tokens_seen": 23906608384, "step": 84060, "train_runtime": 817302.2332, "train_tokens_per_second": 29250.634 }, { "epoch": 2.974562534414549, "grad_norm": 0.609375, "learning_rate": 1.6302219662453528e-05, "loss": 0.38749096393585203, "num_input_tokens_seen": 23909471936, "step": 84070, "train_runtime": 817399.5166, "train_tokens_per_second": 29250.656 }, { "epoch": 2.9749163546782778, "grad_norm": 0.640625, "learning_rate": 1.6301353228239137e-05, "loss": 0.3863779067993164, "num_input_tokens_seen": 23912263040, "step": 84080, "train_runtime": 817494.1015, "train_tokens_per_second": 29250.686 }, { "epoch": 2.9752701749420067, "grad_norm": 0.61328125, "learning_rate": 1.630048693215842e-05, "loss": 0.3879044532775879, "num_input_tokens_seen": 23915095168, "step": 84090, "train_runtime": 817591.5215, "train_tokens_per_second": 29250.664 }, { "epoch": 2.9756239952057353, "grad_norm": 0.58984375, "learning_rate": 1.6299620774174663e-05, "loss": 0.38594398498535154, "num_input_tokens_seen": 23917917952, "step": 84100, "train_runtime": 817684.8408, "train_tokens_per_second": 29250.778 }, { "epoch": 2.9759778154694643, "grad_norm": 0.6171875, "learning_rate": 1.6298754754251192e-05, "loss": 0.38448729515075686, "num_input_tokens_seen": 23920775040, "step": 84110, "train_runtime": 817784.7256, "train_tokens_per_second": 29250.699 }, { "epoch": 2.9763316357331933, "grad_norm": 0.6171875, "learning_rate": 1.6297888872351324e-05, "loss": 0.3839802503585815, "num_input_tokens_seen": 23923597440, "step": 84120, "train_runtime": 817879.9603, "train_tokens_per_second": 29250.744 }, { "epoch": 2.976685455996922, "grad_norm": 0.6328125, "learning_rate": 1.6297023128438407e-05, "loss": 0.3864637851715088, "num_input_tokens_seen": 23926424320, "step": 84130, "train_runtime": 817974.4292, "train_tokens_per_second": 29250.822 }, { "epoch": 2.9770392762606503, "grad_norm": 0.6171875, "learning_rate": 1.6296157522475794e-05, "loss": 0.381453800201416, "num_input_tokens_seen": 23929324800, "step": 84140, "train_runtime": 818076.6973, "train_tokens_per_second": 29250.711 }, { "epoch": 2.9773930965243793, "grad_norm": 0.62890625, "learning_rate": 1.629529205442685e-05, "loss": 0.38701021671295166, "num_input_tokens_seen": 23932135424, "step": 84150, "train_runtime": 818170.1628, "train_tokens_per_second": 29250.804 }, { "epoch": 2.9777469167881083, "grad_norm": 0.62109375, "learning_rate": 1.629442672425496e-05, "loss": 0.3835440635681152, "num_input_tokens_seen": 23934969664, "step": 84160, "train_runtime": 818268.1814, "train_tokens_per_second": 29250.764 }, { "epoch": 2.978100737051837, "grad_norm": 0.59765625, "learning_rate": 1.6293561531923517e-05, "loss": 0.38739843368530275, "num_input_tokens_seen": 23937865792, "step": 84170, "train_runtime": 818369.1988, "train_tokens_per_second": 29250.693 }, { "epoch": 2.9784545573155654, "grad_norm": 0.609375, "learning_rate": 1.6292696477395934e-05, "loss": 0.3834614515304565, "num_input_tokens_seen": 23940704256, "step": 84180, "train_runtime": 818463.4353, "train_tokens_per_second": 29250.793 }, { "epoch": 2.9788083775792944, "grad_norm": 0.609375, "learning_rate": 1.6291831560635628e-05, "loss": 0.384566330909729, "num_input_tokens_seen": 23943607104, "step": 84190, "train_runtime": 818565.4569, "train_tokens_per_second": 29250.693 }, { "epoch": 2.9791621978430234, "grad_norm": 0.62890625, "learning_rate": 1.6290966781606043e-05, "loss": 0.38975088596343993, "num_input_tokens_seen": 23946468992, "step": 84200, "train_runtime": 818665.2585, "train_tokens_per_second": 29250.623 }, { "epoch": 2.979516018106752, "grad_norm": 0.6484375, "learning_rate": 1.6290102140270622e-05, "loss": 0.38160152435302735, "num_input_tokens_seen": 23949304768, "step": 84210, "train_runtime": 818763.0072, "train_tokens_per_second": 29250.595 }, { "epoch": 2.979869838370481, "grad_norm": 0.61328125, "learning_rate": 1.6289237636592827e-05, "loss": 0.3898234605789185, "num_input_tokens_seen": 23952142016, "step": 84220, "train_runtime": 818861.5797, "train_tokens_per_second": 29250.538 }, { "epoch": 2.9802236586342095, "grad_norm": 0.62109375, "learning_rate": 1.628837327053614e-05, "loss": 0.3887813568115234, "num_input_tokens_seen": 23955013248, "step": 84230, "train_runtime": 818960.0758, "train_tokens_per_second": 29250.526 }, { "epoch": 2.9805774788979384, "grad_norm": 0.62890625, "learning_rate": 1.6287509042064053e-05, "loss": 0.38473570346832275, "num_input_tokens_seen": 23957892288, "step": 84240, "train_runtime": 819061.6066, "train_tokens_per_second": 29250.415 }, { "epoch": 2.980931299161667, "grad_norm": 0.59765625, "learning_rate": 1.6286644951140067e-05, "loss": 0.38391947746276855, "num_input_tokens_seen": 23960771200, "step": 84250, "train_runtime": 819160.1108, "train_tokens_per_second": 29250.413 }, { "epoch": 2.981285119425396, "grad_norm": 0.6484375, "learning_rate": 1.6285780997727696e-05, "loss": 0.38719513416290285, "num_input_tokens_seen": 23963668736, "step": 84260, "train_runtime": 819257.5901, "train_tokens_per_second": 29250.469 }, { "epoch": 2.9816389396891245, "grad_norm": 0.640625, "learning_rate": 1.6284917181790476e-05, "loss": 0.3832190990447998, "num_input_tokens_seen": 23966484160, "step": 84270, "train_runtime": 819352.6332, "train_tokens_per_second": 29250.512 }, { "epoch": 2.9819927599528535, "grad_norm": 0.6171875, "learning_rate": 1.628405350329195e-05, "loss": 0.3852893590927124, "num_input_tokens_seen": 23969362176, "step": 84280, "train_runtime": 819451.2226, "train_tokens_per_second": 29250.505 }, { "epoch": 2.982346580216582, "grad_norm": 0.609375, "learning_rate": 1.628318996219568e-05, "loss": 0.3811798572540283, "num_input_tokens_seen": 23972235456, "step": 84290, "train_runtime": 819551.1124, "train_tokens_per_second": 29250.446 }, { "epoch": 2.982700400480311, "grad_norm": 0.640625, "learning_rate": 1.628232655846523e-05, "loss": 0.38569204807281493, "num_input_tokens_seen": 23975004352, "step": 84300, "train_runtime": 819646.7948, "train_tokens_per_second": 29250.409 }, { "epoch": 2.98305422074404, "grad_norm": 0.62109375, "learning_rate": 1.6281463292064193e-05, "loss": 0.3844261646270752, "num_input_tokens_seen": 23977789120, "step": 84310, "train_runtime": 819741.5913, "train_tokens_per_second": 29250.424 }, { "epoch": 2.9834080410077686, "grad_norm": 0.625, "learning_rate": 1.628060016295616e-05, "loss": 0.38418993949890134, "num_input_tokens_seen": 23980638016, "step": 84320, "train_runtime": 819842.4247, "train_tokens_per_second": 29250.301 }, { "epoch": 2.983761861271497, "grad_norm": 0.63671875, "learning_rate": 1.6279737171104752e-05, "loss": 0.38731942176818845, "num_input_tokens_seen": 23983545536, "step": 84330, "train_runtime": 819941.5167, "train_tokens_per_second": 29250.312 }, { "epoch": 2.984115681535226, "grad_norm": 0.625, "learning_rate": 1.6278874316473593e-05, "loss": 0.3855140686035156, "num_input_tokens_seen": 23986342400, "step": 84340, "train_runtime": 820036.4802, "train_tokens_per_second": 29250.336 }, { "epoch": 2.984469501798955, "grad_norm": 0.62109375, "learning_rate": 1.6278011599026314e-05, "loss": 0.3823753595352173, "num_input_tokens_seen": 23989209536, "step": 84350, "train_runtime": 820135.6798, "train_tokens_per_second": 29250.294 }, { "epoch": 2.9848233220626836, "grad_norm": 0.62890625, "learning_rate": 1.627714901872657e-05, "loss": 0.3882883071899414, "num_input_tokens_seen": 23992052352, "step": 84360, "train_runtime": 820230.2152, "train_tokens_per_second": 29250.388 }, { "epoch": 2.9851771423264126, "grad_norm": 0.62890625, "learning_rate": 1.627628657553804e-05, "loss": 0.3877525806427002, "num_input_tokens_seen": 23994967104, "step": 84370, "train_runtime": 820332.5306, "train_tokens_per_second": 29250.293 }, { "epoch": 2.985530962590141, "grad_norm": 0.62890625, "learning_rate": 1.627542426942439e-05, "loss": 0.386457633972168, "num_input_tokens_seen": 23997814592, "step": 84380, "train_runtime": 820427.9195, "train_tokens_per_second": 29250.363 }, { "epoch": 2.98588478285387, "grad_norm": 0.609375, "learning_rate": 1.627456210034932e-05, "loss": 0.38124253749847414, "num_input_tokens_seen": 24000678208, "step": 84390, "train_runtime": 820526.0061, "train_tokens_per_second": 29250.357 }, { "epoch": 2.9862386031175987, "grad_norm": 0.62890625, "learning_rate": 1.6273700068276534e-05, "loss": 0.38640170097351073, "num_input_tokens_seen": 24003519680, "step": 84400, "train_runtime": 820623.7711, "train_tokens_per_second": 29250.334 }, { "epoch": 2.9865924233813277, "grad_norm": 0.609375, "learning_rate": 1.6272838173169752e-05, "loss": 0.3883213043212891, "num_input_tokens_seen": 24006336896, "step": 84410, "train_runtime": 820714.6258, "train_tokens_per_second": 29250.529 }, { "epoch": 2.9869462436450562, "grad_norm": 0.59375, "learning_rate": 1.627197641499271e-05, "loss": 0.38307795524597166, "num_input_tokens_seen": 24009124224, "step": 84420, "train_runtime": 820809.05, "train_tokens_per_second": 29250.56 }, { "epoch": 2.987300063908785, "grad_norm": 0.62890625, "learning_rate": 1.6271114793709146e-05, "loss": 0.3844077825546265, "num_input_tokens_seen": 24011981888, "step": 84430, "train_runtime": 820904.8797, "train_tokens_per_second": 29250.626 }, { "epoch": 2.9876538841725138, "grad_norm": 0.62109375, "learning_rate": 1.6270253309282836e-05, "loss": 0.38652212619781495, "num_input_tokens_seen": 24014828672, "step": 84440, "train_runtime": 821002.4014, "train_tokens_per_second": 29250.619 }, { "epoch": 2.9880077044362428, "grad_norm": 0.62109375, "learning_rate": 1.626939196167754e-05, "loss": 0.3835011959075928, "num_input_tokens_seen": 24017713280, "step": 84450, "train_runtime": 821101.0595, "train_tokens_per_second": 29250.618 }, { "epoch": 2.9883615246999717, "grad_norm": 0.6171875, "learning_rate": 1.6268530750857053e-05, "loss": 0.3885365962982178, "num_input_tokens_seen": 24020520128, "step": 84460, "train_runtime": 821196.3123, "train_tokens_per_second": 29250.643 }, { "epoch": 2.9887153449637003, "grad_norm": 0.6328125, "learning_rate": 1.6267669676785175e-05, "loss": 0.38040938377380373, "num_input_tokens_seen": 24023329728, "step": 84470, "train_runtime": 821292.3313, "train_tokens_per_second": 29250.644 }, { "epoch": 2.989069165227429, "grad_norm": 0.6171875, "learning_rate": 1.6266808739425716e-05, "loss": 0.3820831775665283, "num_input_tokens_seen": 24026236160, "step": 84480, "train_runtime": 821394.8832, "train_tokens_per_second": 29250.531 }, { "epoch": 2.989422985491158, "grad_norm": 0.64453125, "learning_rate": 1.6265947938742507e-05, "loss": 0.38855204582214353, "num_input_tokens_seen": 24029062336, "step": 84490, "train_runtime": 821493.0443, "train_tokens_per_second": 29250.476 }, { "epoch": 2.989776805754887, "grad_norm": 0.6171875, "learning_rate": 1.6265087274699387e-05, "loss": 0.3898318767547607, "num_input_tokens_seen": 24031888384, "step": 84500, "train_runtime": 821593.2205, "train_tokens_per_second": 29250.349 }, { "epoch": 2.9901306260186153, "grad_norm": 0.625, "learning_rate": 1.626422674726021e-05, "loss": 0.3839479923248291, "num_input_tokens_seen": 24034728064, "step": 84510, "train_runtime": 821689.304, "train_tokens_per_second": 29250.384 }, { "epoch": 2.990484446282344, "grad_norm": 0.59375, "learning_rate": 1.6263366356388846e-05, "loss": 0.38756752014160156, "num_input_tokens_seen": 24037534720, "step": 84520, "train_runtime": 821785.21, "train_tokens_per_second": 29250.386 }, { "epoch": 2.990838266546073, "grad_norm": 0.609375, "learning_rate": 1.626250610204918e-05, "loss": 0.3872845649719238, "num_input_tokens_seen": 24040405760, "step": 84530, "train_runtime": 821885.0155, "train_tokens_per_second": 29250.327 }, { "epoch": 2.991192086809802, "grad_norm": 0.59765625, "learning_rate": 1.6261645984205095e-05, "loss": 0.39045803546905516, "num_input_tokens_seen": 24043297024, "step": 84540, "train_runtime": 821987.6068, "train_tokens_per_second": 29250.194 }, { "epoch": 2.9915459070735304, "grad_norm": 0.62890625, "learning_rate": 1.6260786002820508e-05, "loss": 0.3870557308197021, "num_input_tokens_seen": 24046108160, "step": 84550, "train_runtime": 822083.9736, "train_tokens_per_second": 29250.185 }, { "epoch": 2.9918997273372594, "grad_norm": 0.60546875, "learning_rate": 1.6259926157859336e-05, "loss": 0.3919745922088623, "num_input_tokens_seen": 24049044672, "step": 84560, "train_runtime": 822185.994, "train_tokens_per_second": 29250.127 }, { "epoch": 2.992253547600988, "grad_norm": 0.59375, "learning_rate": 1.625906644928552e-05, "loss": 0.38787250518798827, "num_input_tokens_seen": 24051938048, "step": 84570, "train_runtime": 822287.6618, "train_tokens_per_second": 29250.029 }, { "epoch": 2.992607367864717, "grad_norm": 0.61328125, "learning_rate": 1.6258206877062995e-05, "loss": 0.38698816299438477, "num_input_tokens_seen": 24054786176, "step": 84580, "train_runtime": 822384.409, "train_tokens_per_second": 29250.051 }, { "epoch": 2.9929611881284455, "grad_norm": 0.6171875, "learning_rate": 1.6257347441155738e-05, "loss": 0.38751916885375975, "num_input_tokens_seen": 24057639360, "step": 84590, "train_runtime": 822481.9447, "train_tokens_per_second": 29250.052 }, { "epoch": 2.9933150083921745, "grad_norm": 0.61328125, "learning_rate": 1.625648814152771e-05, "loss": 0.38276000022888185, "num_input_tokens_seen": 24060529600, "step": 84600, "train_runtime": 822582.7049, "train_tokens_per_second": 29249.982 }, { "epoch": 2.993668828655903, "grad_norm": 0.62109375, "learning_rate": 1.6255628978142908e-05, "loss": 0.3855485439300537, "num_input_tokens_seen": 24063329024, "step": 84610, "train_runtime": 822675.0288, "train_tokens_per_second": 29250.103 }, { "epoch": 2.994022648919632, "grad_norm": 0.6328125, "learning_rate": 1.6254769950965327e-05, "loss": 0.38649394512176516, "num_input_tokens_seen": 24066189824, "step": 84620, "train_runtime": 822772.0373, "train_tokens_per_second": 29250.131 }, { "epoch": 2.9943764691833605, "grad_norm": 0.62890625, "learning_rate": 1.6253911059958986e-05, "loss": 0.3890997886657715, "num_input_tokens_seen": 24069068992, "step": 84630, "train_runtime": 822870.7955, "train_tokens_per_second": 29250.119 }, { "epoch": 2.9947302894470895, "grad_norm": 0.62109375, "learning_rate": 1.625305230508791e-05, "loss": 0.38601021766662597, "num_input_tokens_seen": 24071887808, "step": 84640, "train_runtime": 822964.6293, "train_tokens_per_second": 29250.209 }, { "epoch": 2.9950841097108185, "grad_norm": 0.63671875, "learning_rate": 1.625219368631614e-05, "loss": 0.3883702754974365, "num_input_tokens_seen": 24074699776, "step": 84650, "train_runtime": 823058.8071, "train_tokens_per_second": 29250.279 }, { "epoch": 2.995437929974547, "grad_norm": 0.6171875, "learning_rate": 1.6251335203607734e-05, "loss": 0.38436412811279297, "num_input_tokens_seen": 24077558400, "step": 84660, "train_runtime": 823157.9823, "train_tokens_per_second": 29250.228 }, { "epoch": 2.9957917502382756, "grad_norm": 0.61328125, "learning_rate": 1.6250476856926757e-05, "loss": 0.3865625858306885, "num_input_tokens_seen": 24080440832, "step": 84670, "train_runtime": 823257.6809, "train_tokens_per_second": 29250.187 }, { "epoch": 2.9961455705020046, "grad_norm": 0.62109375, "learning_rate": 1.6249618646237292e-05, "loss": 0.3846981287002563, "num_input_tokens_seen": 24083276032, "step": 84680, "train_runtime": 823356.4856, "train_tokens_per_second": 29250.12 }, { "epoch": 2.9964993907657336, "grad_norm": 0.61328125, "learning_rate": 1.624876057150343e-05, "loss": 0.3845958232879639, "num_input_tokens_seen": 24086081344, "step": 84690, "train_runtime": 823451.4212, "train_tokens_per_second": 29250.155 }, { "epoch": 2.996853211029462, "grad_norm": 0.59765625, "learning_rate": 1.624790263268928e-05, "loss": 0.3860167503356934, "num_input_tokens_seen": 24088907200, "step": 84700, "train_runtime": 823545.9534, "train_tokens_per_second": 29250.228 }, { "epoch": 2.997207031293191, "grad_norm": 0.6171875, "learning_rate": 1.6247044829758963e-05, "loss": 0.3877938985824585, "num_input_tokens_seen": 24091731584, "step": 84710, "train_runtime": 823641.9437, "train_tokens_per_second": 29250.249 }, { "epoch": 2.9975608515569196, "grad_norm": 0.59765625, "learning_rate": 1.6246187162676616e-05, "loss": 0.3880586624145508, "num_input_tokens_seen": 24094547328, "step": 84720, "train_runtime": 823734.922, "train_tokens_per_second": 29250.365 }, { "epoch": 2.9979146718206486, "grad_norm": 0.59375, "learning_rate": 1.624532963140638e-05, "loss": 0.38626956939697266, "num_input_tokens_seen": 24097437120, "step": 84730, "train_runtime": 823837.1031, "train_tokens_per_second": 29250.245 }, { "epoch": 2.998268492084377, "grad_norm": 0.5859375, "learning_rate": 1.6244472235912418e-05, "loss": 0.38243086338043214, "num_input_tokens_seen": 24100316032, "step": 84740, "train_runtime": 823936.3314, "train_tokens_per_second": 29250.216 }, { "epoch": 2.998622312348106, "grad_norm": 0.58203125, "learning_rate": 1.624361497615891e-05, "loss": 0.3870294809341431, "num_input_tokens_seen": 24103207808, "step": 84750, "train_runtime": 824037.6102, "train_tokens_per_second": 29250.131 }, { "epoch": 2.9989761326118347, "grad_norm": 0.62890625, "learning_rate": 1.624275785211003e-05, "loss": 0.39350252151489257, "num_input_tokens_seen": 24106077248, "step": 84760, "train_runtime": 824137.1856, "train_tokens_per_second": 29250.078 }, { "epoch": 2.9993299528755637, "grad_norm": 0.6171875, "learning_rate": 1.624190086372999e-05, "loss": 0.3870228290557861, "num_input_tokens_seen": 24108912320, "step": 84770, "train_runtime": 824233.0925, "train_tokens_per_second": 29250.114 }, { "epoch": 2.9996837731392922, "grad_norm": 0.62890625, "learning_rate": 1.6241044010982998e-05, "loss": 0.3872014045715332, "num_input_tokens_seen": 24111758528, "step": 84780, "train_runtime": 824328.4964, "train_tokens_per_second": 29250.182 }, { "epoch": 3.0, "eval_loss": 0.3361869752407074, "eval_runtime": 8.4623, "eval_samples_per_second": 471.268, "eval_steps_per_second": 3.781, "num_input_tokens_seen": 24114289216, "step": 84789 }, { "epoch": 3.0, "num_input_tokens_seen": 24114289216, "step": 84789, "total_flos": 4.014701818973667e+20, "train_loss": 0.4004683384819235, "train_runtime": 824447.1535, "train_samples_per_second": 105.311, "train_steps_per_second": 0.103 } ], "logging_steps": 10, "max_steps": 84789, "num_input_tokens_seen": 24114289216, "num_train_epochs": 3, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.014701818973667e+20, "train_batch_size": 8, "trial_name": null, "trial_params": null }