{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2410655095522208, "eval_steps": 300, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 8.035516985074027e-05, "grad_norm": 0.4128876030445099, "learning_rate": 0.0, "loss": 1.8204, "num_input_tokens_seen": 3020, "step": 1, "train_runtime": 4.1565, "train_tokens_per_second": 726.569 }, { "epoch": 0.00016071033970148054, "grad_norm": 0.4843665063381195, "learning_rate": 4e-05, "loss": 1.8788, "num_input_tokens_seen": 6288, "step": 2, "train_runtime": 7.5142, "train_tokens_per_second": 836.817 }, { "epoch": 0.0002410655095522208, "grad_norm": 0.40459391474723816, "learning_rate": 8e-05, "loss": 1.7231, "num_input_tokens_seen": 8462, "step": 3, "train_runtime": 9.4044, "train_tokens_per_second": 899.788 }, { "epoch": 0.0003214206794029611, "grad_norm": 0.5273571610450745, "learning_rate": 0.00012, "loss": 2.0439, "num_input_tokens_seen": 10932, "step": 4, "train_runtime": 11.4295, "train_tokens_per_second": 956.472 }, { "epoch": 0.0004017758492537014, "grad_norm": 0.653209388256073, "learning_rate": 0.00016, "loss": 2.0319, "num_input_tokens_seen": 12380, "step": 5, "train_runtime": 12.9859, "train_tokens_per_second": 953.345 }, { "epoch": 0.0004821310191044416, "grad_norm": 0.9386360049247742, "learning_rate": 0.0002, "loss": 1.5702, "num_input_tokens_seen": 14486, "step": 6, "train_runtime": 14.8546, "train_tokens_per_second": 975.184 }, { "epoch": 0.0005624861889551819, "grad_norm": 0.7347410917282104, "learning_rate": 0.00019993322203672788, "loss": 1.4188, "num_input_tokens_seen": 16916, "step": 7, "train_runtime": 16.7998, "train_tokens_per_second": 1006.916 }, { "epoch": 0.0006428413588059222, "grad_norm": 0.7510082721710205, "learning_rate": 0.00019986644407345576, "loss": 1.6411, "num_input_tokens_seen": 19304, "step": 8, "train_runtime": 18.9414, "train_tokens_per_second": 1019.145 }, { "epoch": 0.0007231965286566625, "grad_norm": 0.531984269618988, "learning_rate": 0.00019979966611018366, "loss": 1.3169, "num_input_tokens_seen": 22836, "step": 9, "train_runtime": 21.6639, "train_tokens_per_second": 1054.103 }, { "epoch": 0.0008035516985074027, "grad_norm": 0.5088340044021606, "learning_rate": 0.00019973288814691153, "loss": 1.1896, "num_input_tokens_seen": 24708, "step": 10, "train_runtime": 23.3512, "train_tokens_per_second": 1058.105 }, { "epoch": 0.000883906868358143, "grad_norm": 0.5455313920974731, "learning_rate": 0.0001996661101836394, "loss": 1.3183, "num_input_tokens_seen": 26740, "step": 11, "train_runtime": 25.1284, "train_tokens_per_second": 1064.134 }, { "epoch": 0.0009642620382088832, "grad_norm": 0.811518132686615, "learning_rate": 0.00019959933222036728, "loss": 1.4893, "num_input_tokens_seen": 30814, "step": 12, "train_runtime": 28.0711, "train_tokens_per_second": 1097.711 }, { "epoch": 0.0010446172080596236, "grad_norm": 0.7564262747764587, "learning_rate": 0.00019953255425709515, "loss": 1.1969, "num_input_tokens_seen": 34248, "step": 13, "train_runtime": 30.648, "train_tokens_per_second": 1117.464 }, { "epoch": 0.0011249723779103637, "grad_norm": 1.155938744544983, "learning_rate": 0.00019946577629382305, "loss": 1.2152, "num_input_tokens_seen": 36942, "step": 14, "train_runtime": 32.8559, "train_tokens_per_second": 1124.364 }, { "epoch": 0.001205327547761104, "grad_norm": 0.6982361078262329, "learning_rate": 0.00019939899833055092, "loss": 1.3557, "num_input_tokens_seen": 43012, "step": 15, "train_runtime": 38.7669, "train_tokens_per_second": 1109.503 }, { "epoch": 0.0012856827176118443, "grad_norm": 0.7386748194694519, "learning_rate": 0.00019933222036727882, "loss": 1.3978, "num_input_tokens_seen": 45962, "step": 16, "train_runtime": 41.1696, "train_tokens_per_second": 1116.405 }, { "epoch": 0.0013660378874625846, "grad_norm": 0.3979336619377136, "learning_rate": 0.0001992654424040067, "loss": 1.4051, "num_input_tokens_seen": 49486, "step": 17, "train_runtime": 43.7809, "train_tokens_per_second": 1130.31 }, { "epoch": 0.001446393057313325, "grad_norm": 0.587181568145752, "learning_rate": 0.00019919866444073457, "loss": 1.384, "num_input_tokens_seen": 53358, "step": 18, "train_runtime": 46.7014, "train_tokens_per_second": 1142.534 }, { "epoch": 0.0015267482271640652, "grad_norm": 0.32670366764068604, "learning_rate": 0.00019913188647746244, "loss": 1.1467, "num_input_tokens_seen": 57148, "step": 19, "train_runtime": 49.547, "train_tokens_per_second": 1153.411 }, { "epoch": 0.0016071033970148055, "grad_norm": 0.40024834871292114, "learning_rate": 0.00019906510851419034, "loss": 1.3787, "num_input_tokens_seen": 59690, "step": 20, "train_runtime": 51.6745, "train_tokens_per_second": 1155.114 }, { "epoch": 0.0016874585668655458, "grad_norm": 0.5168688297271729, "learning_rate": 0.00019899833055091822, "loss": 1.1428, "num_input_tokens_seen": 63540, "step": 21, "train_runtime": 54.5401, "train_tokens_per_second": 1165.014 }, { "epoch": 0.001767813736716286, "grad_norm": 0.39956149458885193, "learning_rate": 0.0001989315525876461, "loss": 1.0249, "num_input_tokens_seen": 65924, "step": 22, "train_runtime": 56.6016, "train_tokens_per_second": 1164.703 }, { "epoch": 0.0018481689065670262, "grad_norm": 0.28881531953811646, "learning_rate": 0.00019886477462437396, "loss": 0.806, "num_input_tokens_seen": 70882, "step": 23, "train_runtime": 60.2487, "train_tokens_per_second": 1176.489 }, { "epoch": 0.0019285240764177665, "grad_norm": 0.3325786590576172, "learning_rate": 0.00019879799666110183, "loss": 1.0302, "num_input_tokens_seen": 74916, "step": 24, "train_runtime": 63.2047, "train_tokens_per_second": 1185.292 }, { "epoch": 0.0020088792462685068, "grad_norm": 0.29011744260787964, "learning_rate": 0.00019873121869782974, "loss": 1.0027, "num_input_tokens_seen": 77098, "step": 25, "train_runtime": 65.1412, "train_tokens_per_second": 1183.553 }, { "epoch": 0.0020892344161192473, "grad_norm": 0.2955094277858734, "learning_rate": 0.0001986644407345576, "loss": 1.3089, "num_input_tokens_seen": 79924, "step": 26, "train_runtime": 67.3225, "train_tokens_per_second": 1187.182 }, { "epoch": 0.0021695895859699874, "grad_norm": 0.4490657448768616, "learning_rate": 0.00019859766277128548, "loss": 1.4656, "num_input_tokens_seen": 82532, "step": 27, "train_runtime": 69.5014, "train_tokens_per_second": 1187.487 }, { "epoch": 0.0022499447558207274, "grad_norm": 0.4933200776576996, "learning_rate": 0.00019853088480801335, "loss": 1.2859, "num_input_tokens_seen": 84328, "step": 28, "train_runtime": 71.2185, "train_tokens_per_second": 1184.074 }, { "epoch": 0.002330299925671468, "grad_norm": 0.33834826946258545, "learning_rate": 0.00019846410684474123, "loss": 1.4659, "num_input_tokens_seen": 87268, "step": 29, "train_runtime": 73.4964, "train_tokens_per_second": 1187.378 }, { "epoch": 0.002410655095522208, "grad_norm": 0.4045095443725586, "learning_rate": 0.00019839732888146913, "loss": 1.2821, "num_input_tokens_seen": 90546, "step": 30, "train_runtime": 75.9674, "train_tokens_per_second": 1191.905 }, { "epoch": 0.0024910102653729485, "grad_norm": 0.4099307656288147, "learning_rate": 0.000198330550918197, "loss": 1.2785, "num_input_tokens_seen": 92580, "step": 31, "train_runtime": 80.094, "train_tokens_per_second": 1155.891 }, { "epoch": 0.0025713654352236886, "grad_norm": 0.34756144881248474, "learning_rate": 0.00019826377295492487, "loss": 1.307, "num_input_tokens_seen": 95030, "step": 32, "train_runtime": 82.0563, "train_tokens_per_second": 1158.107 }, { "epoch": 0.002651720605074429, "grad_norm": 0.34918075799942017, "learning_rate": 0.00019819699499165277, "loss": 1.1396, "num_input_tokens_seen": 96986, "step": 33, "train_runtime": 83.8307, "train_tokens_per_second": 1156.927 }, { "epoch": 0.002732075774925169, "grad_norm": 0.3395019471645355, "learning_rate": 0.00019813021702838065, "loss": 0.7633, "num_input_tokens_seen": 98324, "step": 34, "train_runtime": 85.4198, "train_tokens_per_second": 1151.068 }, { "epoch": 0.0028124309447759097, "grad_norm": 0.34623047709465027, "learning_rate": 0.00019806343906510852, "loss": 1.2512, "num_input_tokens_seen": 101938, "step": 35, "train_runtime": 88.129, "train_tokens_per_second": 1156.691 }, { "epoch": 0.00289278611462665, "grad_norm": 0.27665939927101135, "learning_rate": 0.00019799666110183642, "loss": 1.0116, "num_input_tokens_seen": 103720, "step": 36, "train_runtime": 89.9509, "train_tokens_per_second": 1153.074 }, { "epoch": 0.00297314128447739, "grad_norm": 0.30108535289764404, "learning_rate": 0.0001979298831385643, "loss": 1.0475, "num_input_tokens_seen": 105896, "step": 37, "train_runtime": 91.8679, "train_tokens_per_second": 1152.699 }, { "epoch": 0.0030534964543281304, "grad_norm": 0.30923861265182495, "learning_rate": 0.00019786310517529217, "loss": 1.1604, "num_input_tokens_seen": 108132, "step": 38, "train_runtime": 93.8496, "train_tokens_per_second": 1152.184 }, { "epoch": 0.0031338516241788705, "grad_norm": 0.33123621344566345, "learning_rate": 0.00019779632721202004, "loss": 1.1684, "num_input_tokens_seen": 114642, "step": 39, "train_runtime": 98.1366, "train_tokens_per_second": 1168.188 }, { "epoch": 0.003214206794029611, "grad_norm": 0.3305603861808777, "learning_rate": 0.00019772954924874791, "loss": 0.9128, "num_input_tokens_seen": 117000, "step": 40, "train_runtime": 100.1499, "train_tokens_per_second": 1168.248 }, { "epoch": 0.003294561963880351, "grad_norm": 0.3243100345134735, "learning_rate": 0.00019766277128547581, "loss": 1.018, "num_input_tokens_seen": 119622, "step": 41, "train_runtime": 102.2941, "train_tokens_per_second": 1169.393 }, { "epoch": 0.0033749171337310916, "grad_norm": 0.30681395530700684, "learning_rate": 0.0001975959933222037, "loss": 0.8678, "num_input_tokens_seen": 121540, "step": 42, "train_runtime": 104.0763, "train_tokens_per_second": 1167.797 }, { "epoch": 0.0034552723035818317, "grad_norm": 0.3122865557670593, "learning_rate": 0.00019752921535893156, "loss": 1.2514, "num_input_tokens_seen": 125898, "step": 43, "train_runtime": 107.1933, "train_tokens_per_second": 1174.495 }, { "epoch": 0.003535627473432572, "grad_norm": 0.26632049679756165, "learning_rate": 0.00019746243739565943, "loss": 1.0827, "num_input_tokens_seen": 128672, "step": 44, "train_runtime": 109.4139, "train_tokens_per_second": 1176.012 }, { "epoch": 0.0036159826432833123, "grad_norm": 0.28619447350502014, "learning_rate": 0.0001973956594323873, "loss": 1.1041, "num_input_tokens_seen": 130568, "step": 45, "train_runtime": 111.1803, "train_tokens_per_second": 1174.381 }, { "epoch": 0.0036963378131340523, "grad_norm": 0.3083089292049408, "learning_rate": 0.0001973288814691152, "loss": 0.891, "num_input_tokens_seen": 132298, "step": 46, "train_runtime": 112.8204, "train_tokens_per_second": 1172.642 }, { "epoch": 0.003776692982984793, "grad_norm": 0.27593693137168884, "learning_rate": 0.00019726210350584308, "loss": 1.1675, "num_input_tokens_seen": 134276, "step": 47, "train_runtime": 114.6997, "train_tokens_per_second": 1170.675 }, { "epoch": 0.003857048152835533, "grad_norm": 0.33598679304122925, "learning_rate": 0.00019719532554257095, "loss": 0.9671, "num_input_tokens_seen": 137872, "step": 48, "train_runtime": 117.4017, "train_tokens_per_second": 1174.361 }, { "epoch": 0.0039374033226862734, "grad_norm": 0.34018149971961975, "learning_rate": 0.00019712854757929883, "loss": 1.2053, "num_input_tokens_seen": 140504, "step": 49, "train_runtime": 119.5089, "train_tokens_per_second": 1175.678 }, { "epoch": 0.0040177584925370135, "grad_norm": 0.2602927088737488, "learning_rate": 0.00019706176961602673, "loss": 1.0059, "num_input_tokens_seen": 144068, "step": 50, "train_runtime": 122.149, "train_tokens_per_second": 1179.445 }, { "epoch": 0.004098113662387754, "grad_norm": 0.32150211930274963, "learning_rate": 0.0001969949916527546, "loss": 1.3919, "num_input_tokens_seen": 147256, "step": 51, "train_runtime": 124.6096, "train_tokens_per_second": 1181.739 }, { "epoch": 0.0041784688322384946, "grad_norm": 0.29502740502357483, "learning_rate": 0.0001969282136894825, "loss": 0.9057, "num_input_tokens_seen": 150536, "step": 52, "train_runtime": 127.0806, "train_tokens_per_second": 1184.571 }, { "epoch": 0.004258824002089235, "grad_norm": 0.3121987581253052, "learning_rate": 0.00019686143572621037, "loss": 1.0761, "num_input_tokens_seen": 152722, "step": 53, "train_runtime": 129.0448, "train_tokens_per_second": 1183.481 }, { "epoch": 0.004339179171939975, "grad_norm": 0.3160906732082367, "learning_rate": 0.00019679465776293825, "loss": 1.3607, "num_input_tokens_seen": 155360, "step": 54, "train_runtime": 131.1821, "train_tokens_per_second": 1184.308 }, { "epoch": 0.004419534341790715, "grad_norm": 0.3124387264251709, "learning_rate": 0.00019672787979966612, "loss": 1.0816, "num_input_tokens_seen": 157556, "step": 55, "train_runtime": 133.0249, "train_tokens_per_second": 1184.41 }, { "epoch": 0.004499889511641455, "grad_norm": 0.3181786835193634, "learning_rate": 0.000196661101836394, "loss": 1.1499, "num_input_tokens_seen": 159108, "step": 56, "train_runtime": 134.668, "train_tokens_per_second": 1181.484 }, { "epoch": 0.004580244681492196, "grad_norm": 0.2405022531747818, "learning_rate": 0.0001965943238731219, "loss": 0.996, "num_input_tokens_seen": 161932, "step": 57, "train_runtime": 136.9022, "train_tokens_per_second": 1182.83 }, { "epoch": 0.004660599851342936, "grad_norm": 0.4457870125770569, "learning_rate": 0.00019652754590984977, "loss": 1.2403, "num_input_tokens_seen": 165060, "step": 58, "train_runtime": 139.3245, "train_tokens_per_second": 1184.717 }, { "epoch": 0.004740955021193676, "grad_norm": 0.38461732864379883, "learning_rate": 0.00019646076794657764, "loss": 1.1906, "num_input_tokens_seen": 166838, "step": 59, "train_runtime": 141.049, "train_tokens_per_second": 1182.838 }, { "epoch": 0.004821310191044416, "grad_norm": 0.3107485771179199, "learning_rate": 0.0001963939899833055, "loss": 0.8156, "num_input_tokens_seen": 169110, "step": 60, "train_runtime": 143.0768, "train_tokens_per_second": 1181.953 }, { "epoch": 0.004901665360895157, "grad_norm": 0.33994483947753906, "learning_rate": 0.00019632721202003339, "loss": 1.1714, "num_input_tokens_seen": 174954, "step": 61, "train_runtime": 149.0535, "train_tokens_per_second": 1173.767 }, { "epoch": 0.004982020530745897, "grad_norm": 0.44787871837615967, "learning_rate": 0.00019626043405676129, "loss": 1.1095, "num_input_tokens_seen": 177472, "step": 62, "train_runtime": 151.142, "train_tokens_per_second": 1174.207 }, { "epoch": 0.005062375700596637, "grad_norm": 0.27905064821243286, "learning_rate": 0.00019619365609348916, "loss": 1.1697, "num_input_tokens_seen": 180142, "step": 63, "train_runtime": 153.2885, "train_tokens_per_second": 1175.183 }, { "epoch": 0.005142730870447377, "grad_norm": 0.37700754404067993, "learning_rate": 0.00019612687813021703, "loss": 0.8613, "num_input_tokens_seen": 182542, "step": 64, "train_runtime": 155.2662, "train_tokens_per_second": 1175.671 }, { "epoch": 0.005223086040298117, "grad_norm": 0.38357803225517273, "learning_rate": 0.0001960601001669449, "loss": 1.415, "num_input_tokens_seen": 185674, "step": 65, "train_runtime": 157.8417, "train_tokens_per_second": 1176.33 }, { "epoch": 0.005303441210148858, "grad_norm": 0.331096351146698, "learning_rate": 0.00019599332220367278, "loss": 1.138, "num_input_tokens_seen": 188782, "step": 66, "train_runtime": 160.1648, "train_tokens_per_second": 1178.673 }, { "epoch": 0.005383796379999598, "grad_norm": 0.30474039912223816, "learning_rate": 0.00019592654424040068, "loss": 0.9835, "num_input_tokens_seen": 191548, "step": 67, "train_runtime": 162.3347, "train_tokens_per_second": 1179.957 }, { "epoch": 0.005464151549850338, "grad_norm": 0.3312320113182068, "learning_rate": 0.00019585976627712855, "loss": 1.3151, "num_input_tokens_seen": 193904, "step": 68, "train_runtime": 164.3436, "train_tokens_per_second": 1179.87 }, { "epoch": 0.0055445067197010785, "grad_norm": 0.33529728651046753, "learning_rate": 0.00019579298831385645, "loss": 0.7548, "num_input_tokens_seen": 195936, "step": 69, "train_runtime": 166.103, "train_tokens_per_second": 1179.605 }, { "epoch": 0.0056248618895518195, "grad_norm": 0.4673730432987213, "learning_rate": 0.00019572621035058433, "loss": 1.0031, "num_input_tokens_seen": 198776, "step": 70, "train_runtime": 168.4298, "train_tokens_per_second": 1180.171 }, { "epoch": 0.0057052170594025595, "grad_norm": 0.3669169247150421, "learning_rate": 0.0001956594323873122, "loss": 1.3102, "num_input_tokens_seen": 200468, "step": 71, "train_runtime": 170.1819, "train_tokens_per_second": 1177.963 }, { "epoch": 0.0057855722292533, "grad_norm": 0.32449740171432495, "learning_rate": 0.00019559265442404007, "loss": 1.3044, "num_input_tokens_seen": 202402, "step": 72, "train_runtime": 171.9566, "train_tokens_per_second": 1177.053 }, { "epoch": 0.00586592739910404, "grad_norm": 0.317749947309494, "learning_rate": 0.00019552587646076797, "loss": 0.9175, "num_input_tokens_seen": 204974, "step": 73, "train_runtime": 174.1032, "train_tokens_per_second": 1177.313 }, { "epoch": 0.00594628256895478, "grad_norm": 0.2952556312084198, "learning_rate": 0.00019545909849749584, "loss": 1.0741, "num_input_tokens_seen": 207182, "step": 74, "train_runtime": 176.0295, "train_tokens_per_second": 1176.973 }, { "epoch": 0.006026637738805521, "grad_norm": 0.3129689693450928, "learning_rate": 0.00019539232053422372, "loss": 1.3219, "num_input_tokens_seen": 209668, "step": 75, "train_runtime": 178.1761, "train_tokens_per_second": 1176.746 }, { "epoch": 0.006106992908656261, "grad_norm": 0.30917924642562866, "learning_rate": 0.0001953255425709516, "loss": 0.9812, "num_input_tokens_seen": 211166, "step": 76, "train_runtime": 179.7681, "train_tokens_per_second": 1174.658 }, { "epoch": 0.006187348078507001, "grad_norm": 0.3077734708786011, "learning_rate": 0.00019525876460767946, "loss": 0.8593, "num_input_tokens_seen": 213850, "step": 77, "train_runtime": 181.9352, "train_tokens_per_second": 1175.419 }, { "epoch": 0.006267703248357741, "grad_norm": 0.32136771082878113, "learning_rate": 0.00019519198664440736, "loss": 0.8924, "num_input_tokens_seen": 215464, "step": 78, "train_runtime": 183.5224, "train_tokens_per_second": 1174.048 }, { "epoch": 0.006348058418208482, "grad_norm": 0.3433220684528351, "learning_rate": 0.00019512520868113524, "loss": 1.2776, "num_input_tokens_seen": 217552, "step": 79, "train_runtime": 185.4837, "train_tokens_per_second": 1172.89 }, { "epoch": 0.006428413588059222, "grad_norm": 0.2551766037940979, "learning_rate": 0.0001950584307178631, "loss": 0.9551, "num_input_tokens_seen": 219780, "step": 80, "train_runtime": 187.3526, "train_tokens_per_second": 1173.082 }, { "epoch": 0.006508768757909962, "grad_norm": 0.32899704575538635, "learning_rate": 0.00019499165275459098, "loss": 1.1009, "num_input_tokens_seen": 221666, "step": 81, "train_runtime": 189.228, "train_tokens_per_second": 1171.423 }, { "epoch": 0.006589123927760702, "grad_norm": 0.2957477271556854, "learning_rate": 0.00019492487479131886, "loss": 1.0102, "num_input_tokens_seen": 224776, "step": 82, "train_runtime": 191.6613, "train_tokens_per_second": 1172.777 }, { "epoch": 0.006669479097611442, "grad_norm": 0.3482891321182251, "learning_rate": 0.00019485809682804673, "loss": 1.2924, "num_input_tokens_seen": 226698, "step": 83, "train_runtime": 193.4219, "train_tokens_per_second": 1172.039 }, { "epoch": 0.006749834267462183, "grad_norm": 0.3823198080062866, "learning_rate": 0.00019479131886477463, "loss": 1.0649, "num_input_tokens_seen": 228926, "step": 84, "train_runtime": 195.3491, "train_tokens_per_second": 1171.881 }, { "epoch": 0.006830189437312923, "grad_norm": 0.35176682472229004, "learning_rate": 0.0001947245409015025, "loss": 0.7604, "num_input_tokens_seen": 230892, "step": 85, "train_runtime": 197.2893, "train_tokens_per_second": 1170.322 }, { "epoch": 0.006910544607163663, "grad_norm": 0.31647080183029175, "learning_rate": 0.0001946577629382304, "loss": 1.1499, "num_input_tokens_seen": 232544, "step": 86, "train_runtime": 198.9968, "train_tokens_per_second": 1168.582 }, { "epoch": 0.006990899777014403, "grad_norm": 0.32222849130630493, "learning_rate": 0.00019459098497495828, "loss": 1.3333, "num_input_tokens_seen": 235528, "step": 87, "train_runtime": 201.3497, "train_tokens_per_second": 1169.746 }, { "epoch": 0.007071254946865144, "grad_norm": 0.24119481444358826, "learning_rate": 0.00019452420701168615, "loss": 0.8085, "num_input_tokens_seen": 241730, "step": 88, "train_runtime": 205.582, "train_tokens_per_second": 1175.832 }, { "epoch": 0.0071516101167158844, "grad_norm": 0.32314327359199524, "learning_rate": 0.00019445742904841405, "loss": 1.0329, "num_input_tokens_seen": 246178, "step": 89, "train_runtime": 208.8028, "train_tokens_per_second": 1178.997 }, { "epoch": 0.0072319652865666245, "grad_norm": 0.33118972182273865, "learning_rate": 0.00019439065108514192, "loss": 0.7723, "num_input_tokens_seen": 248024, "step": 90, "train_runtime": 210.5811, "train_tokens_per_second": 1177.807 }, { "epoch": 0.007312320456417365, "grad_norm": 0.31792575120925903, "learning_rate": 0.0001943238731218698, "loss": 1.2614, "num_input_tokens_seen": 250440, "step": 91, "train_runtime": 214.4372, "train_tokens_per_second": 1167.894 }, { "epoch": 0.007392675626268105, "grad_norm": 0.2944311499595642, "learning_rate": 0.00019425709515859767, "loss": 1.1398, "num_input_tokens_seen": 252556, "step": 92, "train_runtime": 216.2752, "train_tokens_per_second": 1167.753 }, { "epoch": 0.007473030796118846, "grad_norm": 0.36758142709732056, "learning_rate": 0.00019419031719532554, "loss": 1.2504, "num_input_tokens_seen": 254592, "step": 93, "train_runtime": 218.1443, "train_tokens_per_second": 1167.081 }, { "epoch": 0.007553385965969586, "grad_norm": 0.36635059118270874, "learning_rate": 0.00019412353923205344, "loss": 1.2812, "num_input_tokens_seen": 259620, "step": 94, "train_runtime": 221.5746, "train_tokens_per_second": 1171.705 }, { "epoch": 0.007633741135820326, "grad_norm": 0.3519682288169861, "learning_rate": 0.00019405676126878132, "loss": 0.7904, "num_input_tokens_seen": 265416, "step": 95, "train_runtime": 225.4702, "train_tokens_per_second": 1177.167 }, { "epoch": 0.007714096305671066, "grad_norm": 0.3626551926136017, "learning_rate": 0.0001939899833055092, "loss": 1.0009, "num_input_tokens_seen": 267690, "step": 96, "train_runtime": 227.3784, "train_tokens_per_second": 1177.288 }, { "epoch": 0.007794451475521807, "grad_norm": 0.3471205234527588, "learning_rate": 0.00019392320534223706, "loss": 0.7001, "num_input_tokens_seen": 269884, "step": 97, "train_runtime": 229.3942, "train_tokens_per_second": 1176.507 }, { "epoch": 0.007874806645372547, "grad_norm": 0.34355437755584717, "learning_rate": 0.00019385642737896494, "loss": 1.0947, "num_input_tokens_seen": 272076, "step": 98, "train_runtime": 231.2879, "train_tokens_per_second": 1176.352 }, { "epoch": 0.007955161815223287, "grad_norm": 0.41802075505256653, "learning_rate": 0.0001937896494156928, "loss": 1.0463, "num_input_tokens_seen": 273562, "step": 99, "train_runtime": 232.8923, "train_tokens_per_second": 1174.629 }, { "epoch": 0.008035516985074027, "grad_norm": 0.30516642332077026, "learning_rate": 0.0001937228714524207, "loss": 0.9816, "num_input_tokens_seen": 277596, "step": 100, "train_runtime": 235.8828, "train_tokens_per_second": 1176.839 }, { "epoch": 0.008115872154924767, "grad_norm": 0.31250709295272827, "learning_rate": 0.00019365609348914858, "loss": 1.2959, "num_input_tokens_seen": 279602, "step": 101, "train_runtime": 237.637, "train_tokens_per_second": 1176.593 }, { "epoch": 0.008196227324775507, "grad_norm": 0.28079161047935486, "learning_rate": 0.00019358931552587646, "loss": 0.9055, "num_input_tokens_seen": 282844, "step": 102, "train_runtime": 240.1527, "train_tokens_per_second": 1177.767 }, { "epoch": 0.008276582494626247, "grad_norm": 0.32835954427719116, "learning_rate": 0.00019352253756260436, "loss": 1.2387, "num_input_tokens_seen": 285008, "step": 103, "train_runtime": 242.1092, "train_tokens_per_second": 1177.188 }, { "epoch": 0.008356937664476989, "grad_norm": 0.36610671877861023, "learning_rate": 0.00019345575959933223, "loss": 1.1193, "num_input_tokens_seen": 286942, "step": 104, "train_runtime": 243.8693, "train_tokens_per_second": 1176.622 }, { "epoch": 0.00843729283432773, "grad_norm": 0.3345883786678314, "learning_rate": 0.00019338898163606013, "loss": 1.1626, "num_input_tokens_seen": 289080, "step": 105, "train_runtime": 245.8204, "train_tokens_per_second": 1175.981 }, { "epoch": 0.00851764800417847, "grad_norm": 0.2844889461994171, "learning_rate": 0.000193322203672788, "loss": 1.0387, "num_input_tokens_seen": 291750, "step": 106, "train_runtime": 247.9457, "train_tokens_per_second": 1176.669 }, { "epoch": 0.00859800317402921, "grad_norm": 0.3191639482975006, "learning_rate": 0.00019325542570951588, "loss": 1.1567, "num_input_tokens_seen": 293930, "step": 107, "train_runtime": 249.8932, "train_tokens_per_second": 1176.223 }, { "epoch": 0.00867835834387995, "grad_norm": 0.34993913769721985, "learning_rate": 0.00019318864774624375, "loss": 1.6206, "num_input_tokens_seen": 297240, "step": 108, "train_runtime": 252.2674, "train_tokens_per_second": 1178.273 }, { "epoch": 0.00875871351373069, "grad_norm": 0.3329659104347229, "learning_rate": 0.00019312186978297162, "loss": 0.8939, "num_input_tokens_seen": 300264, "step": 109, "train_runtime": 254.5719, "train_tokens_per_second": 1179.486 }, { "epoch": 0.00883906868358143, "grad_norm": 0.44520723819732666, "learning_rate": 0.00019305509181969952, "loss": 0.9183, "num_input_tokens_seen": 304144, "step": 110, "train_runtime": 257.3764, "train_tokens_per_second": 1181.709 }, { "epoch": 0.00891942385343217, "grad_norm": 0.364200621843338, "learning_rate": 0.0001929883138564274, "loss": 1.2748, "num_input_tokens_seen": 306332, "step": 111, "train_runtime": 259.1637, "train_tokens_per_second": 1182.002 }, { "epoch": 0.00899977902328291, "grad_norm": 0.3243260085582733, "learning_rate": 0.00019292153589315527, "loss": 1.3284, "num_input_tokens_seen": 309172, "step": 112, "train_runtime": 261.3851, "train_tokens_per_second": 1182.822 }, { "epoch": 0.009080134193133652, "grad_norm": 0.3614398241043091, "learning_rate": 0.00019285475792988314, "loss": 1.1274, "num_input_tokens_seen": 311626, "step": 113, "train_runtime": 263.4309, "train_tokens_per_second": 1182.952 }, { "epoch": 0.009160489362984392, "grad_norm": 0.36545294523239136, "learning_rate": 0.00019278797996661101, "loss": 1.3002, "num_input_tokens_seen": 313606, "step": 114, "train_runtime": 265.2996, "train_tokens_per_second": 1182.082 }, { "epoch": 0.009240844532835132, "grad_norm": 0.2833547294139862, "learning_rate": 0.0001927212020033389, "loss": 0.9341, "num_input_tokens_seen": 317028, "step": 115, "train_runtime": 267.9413, "train_tokens_per_second": 1183.199 }, { "epoch": 0.009321199702685872, "grad_norm": 0.31258538365364075, "learning_rate": 0.0001926544240400668, "loss": 1.0246, "num_input_tokens_seen": 319196, "step": 116, "train_runtime": 269.816, "train_tokens_per_second": 1183.014 }, { "epoch": 0.009401554872536612, "grad_norm": 0.29805701971054077, "learning_rate": 0.00019258764607679466, "loss": 0.8631, "num_input_tokens_seen": 321744, "step": 117, "train_runtime": 271.9051, "train_tokens_per_second": 1183.295 }, { "epoch": 0.009481910042387352, "grad_norm": 0.31408268213272095, "learning_rate": 0.00019252086811352253, "loss": 1.2062, "num_input_tokens_seen": 323606, "step": 118, "train_runtime": 273.5706, "train_tokens_per_second": 1182.897 }, { "epoch": 0.009562265212238092, "grad_norm": 0.31819990277290344, "learning_rate": 0.0001924540901502504, "loss": 0.8167, "num_input_tokens_seen": 325606, "step": 119, "train_runtime": 275.3904, "train_tokens_per_second": 1182.343 }, { "epoch": 0.009642620382088832, "grad_norm": 0.45045605301856995, "learning_rate": 0.0001923873121869783, "loss": 1.0418, "num_input_tokens_seen": 328614, "step": 120, "train_runtime": 277.709, "train_tokens_per_second": 1183.303 }, { "epoch": 0.009722975551939572, "grad_norm": 0.4011978507041931, "learning_rate": 0.00019232053422370618, "loss": 1.2648, "num_input_tokens_seen": 329944, "step": 121, "train_runtime": 280.8675, "train_tokens_per_second": 1174.732 }, { "epoch": 0.009803330721790314, "grad_norm": 0.31260213255882263, "learning_rate": 0.00019225375626043408, "loss": 0.8947, "num_input_tokens_seen": 332712, "step": 122, "train_runtime": 283.0597, "train_tokens_per_second": 1175.413 }, { "epoch": 0.009883685891641054, "grad_norm": 0.26335906982421875, "learning_rate": 0.00019218697829716195, "loss": 1.1746, "num_input_tokens_seen": 335566, "step": 123, "train_runtime": 285.3939, "train_tokens_per_second": 1175.8 }, { "epoch": 0.009964041061491794, "grad_norm": 0.341661661863327, "learning_rate": 0.00019212020033388983, "loss": 0.9389, "num_input_tokens_seen": 337592, "step": 124, "train_runtime": 287.21, "train_tokens_per_second": 1175.419 }, { "epoch": 0.010044396231342534, "grad_norm": 0.2743532061576843, "learning_rate": 0.0001920534223706177, "loss": 1.0696, "num_input_tokens_seen": 342232, "step": 125, "train_runtime": 290.5217, "train_tokens_per_second": 1177.991 }, { "epoch": 0.010124751401193274, "grad_norm": 0.32186877727508545, "learning_rate": 0.0001919866444073456, "loss": 1.1878, "num_input_tokens_seen": 348666, "step": 126, "train_runtime": 294.8735, "train_tokens_per_second": 1182.426 }, { "epoch": 0.010205106571044014, "grad_norm": 0.32328155636787415, "learning_rate": 0.00019191986644407347, "loss": 1.1599, "num_input_tokens_seen": 351168, "step": 127, "train_runtime": 296.876, "train_tokens_per_second": 1182.878 }, { "epoch": 0.010285461740894754, "grad_norm": 0.24393251538276672, "learning_rate": 0.00019185308848080135, "loss": 0.9055, "num_input_tokens_seen": 353856, "step": 128, "train_runtime": 299.0515, "train_tokens_per_second": 1183.261 }, { "epoch": 0.010365816910745495, "grad_norm": 0.3262992203235626, "learning_rate": 0.00019178631051752922, "loss": 1.0087, "num_input_tokens_seen": 356904, "step": 129, "train_runtime": 301.5106, "train_tokens_per_second": 1183.719 }, { "epoch": 0.010446172080596235, "grad_norm": 0.3335343599319458, "learning_rate": 0.0001917195325542571, "loss": 0.7588, "num_input_tokens_seen": 358514, "step": 130, "train_runtime": 303.1449, "train_tokens_per_second": 1182.649 }, { "epoch": 0.010526527250446976, "grad_norm": 0.3395357131958008, "learning_rate": 0.00019165275459098497, "loss": 0.9075, "num_input_tokens_seen": 361170, "step": 131, "train_runtime": 305.3375, "train_tokens_per_second": 1182.855 }, { "epoch": 0.010606882420297717, "grad_norm": 0.2968093752861023, "learning_rate": 0.00019158597662771287, "loss": 1.2704, "num_input_tokens_seen": 364662, "step": 132, "train_runtime": 307.9228, "train_tokens_per_second": 1184.264 }, { "epoch": 0.010687237590148457, "grad_norm": 0.28696516156196594, "learning_rate": 0.00019151919866444074, "loss": 0.974, "num_input_tokens_seen": 366440, "step": 133, "train_runtime": 309.6872, "train_tokens_per_second": 1183.259 }, { "epoch": 0.010767592759999197, "grad_norm": 0.39053821563720703, "learning_rate": 0.0001914524207011686, "loss": 1.1736, "num_input_tokens_seen": 369316, "step": 134, "train_runtime": 311.9466, "train_tokens_per_second": 1183.908 }, { "epoch": 0.010847947929849937, "grad_norm": 0.2857292890548706, "learning_rate": 0.0001913856427378965, "loss": 1.2166, "num_input_tokens_seen": 374450, "step": 135, "train_runtime": 315.4388, "train_tokens_per_second": 1187.076 }, { "epoch": 0.010928303099700677, "grad_norm": 0.31891822814941406, "learning_rate": 0.0001913188647746244, "loss": 1.1599, "num_input_tokens_seen": 376760, "step": 136, "train_runtime": 317.4662, "train_tokens_per_second": 1186.772 }, { "epoch": 0.011008658269551417, "grad_norm": 0.38524264097213745, "learning_rate": 0.00019125208681135226, "loss": 0.9643, "num_input_tokens_seen": 383920, "step": 137, "train_runtime": 322.2268, "train_tokens_per_second": 1191.459 }, { "epoch": 0.011089013439402157, "grad_norm": 0.27233901619911194, "learning_rate": 0.00019118530884808016, "loss": 0.9706, "num_input_tokens_seen": 387242, "step": 138, "train_runtime": 324.7669, "train_tokens_per_second": 1192.369 }, { "epoch": 0.011169368609252897, "grad_norm": 0.31465741991996765, "learning_rate": 0.00019111853088480803, "loss": 0.817, "num_input_tokens_seen": 389096, "step": 139, "train_runtime": 326.4619, "train_tokens_per_second": 1191.857 }, { "epoch": 0.011249723779103639, "grad_norm": 0.33668479323387146, "learning_rate": 0.0001910517529215359, "loss": 0.9297, "num_input_tokens_seen": 390466, "step": 140, "train_runtime": 328.0146, "train_tokens_per_second": 1190.392 }, { "epoch": 0.011330078948954379, "grad_norm": 0.3122538924217224, "learning_rate": 0.00019098497495826378, "loss": 1.0915, "num_input_tokens_seen": 392606, "step": 141, "train_runtime": 329.8811, "train_tokens_per_second": 1190.144 }, { "epoch": 0.011410434118805119, "grad_norm": 0.30943194031715393, "learning_rate": 0.00019091819699499168, "loss": 1.1691, "num_input_tokens_seen": 396696, "step": 142, "train_runtime": 332.8156, "train_tokens_per_second": 1191.939 }, { "epoch": 0.01149078928865586, "grad_norm": 0.3253512680530548, "learning_rate": 0.00019085141903171955, "loss": 1.3012, "num_input_tokens_seen": 401946, "step": 143, "train_runtime": 336.627, "train_tokens_per_second": 1194.04 }, { "epoch": 0.0115711444585066, "grad_norm": 0.25847896933555603, "learning_rate": 0.00019078464106844743, "loss": 0.9076, "num_input_tokens_seen": 404700, "step": 144, "train_runtime": 338.7673, "train_tokens_per_second": 1194.625 }, { "epoch": 0.01165149962835734, "grad_norm": 0.3235805034637451, "learning_rate": 0.0001907178631051753, "loss": 0.8834, "num_input_tokens_seen": 408034, "step": 145, "train_runtime": 341.3179, "train_tokens_per_second": 1195.466 }, { "epoch": 0.01173185479820808, "grad_norm": 0.3012896776199341, "learning_rate": 0.00019065108514190317, "loss": 0.8598, "num_input_tokens_seen": 410702, "step": 146, "train_runtime": 343.4148, "train_tokens_per_second": 1195.936 }, { "epoch": 0.01181220996805882, "grad_norm": 0.2586335837841034, "learning_rate": 0.00019058430717863107, "loss": 0.8836, "num_input_tokens_seen": 413772, "step": 147, "train_runtime": 345.8469, "train_tokens_per_second": 1196.402 }, { "epoch": 0.01189256513790956, "grad_norm": 0.32044851779937744, "learning_rate": 0.00019051752921535895, "loss": 1.0863, "num_input_tokens_seen": 416638, "step": 148, "train_runtime": 348.0787, "train_tokens_per_second": 1196.965 }, { "epoch": 0.011972920307760301, "grad_norm": 0.2788418233394623, "learning_rate": 0.00019045075125208682, "loss": 1.0831, "num_input_tokens_seen": 419928, "step": 149, "train_runtime": 350.5712, "train_tokens_per_second": 1197.839 }, { "epoch": 0.012053275477611041, "grad_norm": 0.30677565932273865, "learning_rate": 0.0001903839732888147, "loss": 0.9189, "num_input_tokens_seen": 421844, "step": 150, "train_runtime": 352.38, "train_tokens_per_second": 1197.128 }, { "epoch": 0.012133630647461782, "grad_norm": 0.32193708419799805, "learning_rate": 0.00019031719532554257, "loss": 1.1098, "num_input_tokens_seen": 427896, "step": 151, "train_runtime": 358.4671, "train_tokens_per_second": 1193.683 }, { "epoch": 0.012213985817312522, "grad_norm": 0.3394554555416107, "learning_rate": 0.00019025041736227044, "loss": 1.2618, "num_input_tokens_seen": 431144, "step": 152, "train_runtime": 360.9563, "train_tokens_per_second": 1194.449 }, { "epoch": 0.012294340987163262, "grad_norm": 0.2948708236217499, "learning_rate": 0.00019018363939899834, "loss": 1.1895, "num_input_tokens_seen": 434692, "step": 153, "train_runtime": 363.6825, "train_tokens_per_second": 1195.252 }, { "epoch": 0.012374696157014002, "grad_norm": 0.29126468300819397, "learning_rate": 0.0001901168614357262, "loss": 1.0718, "num_input_tokens_seen": 437218, "step": 154, "train_runtime": 365.779, "train_tokens_per_second": 1195.306 }, { "epoch": 0.012455051326864742, "grad_norm": 0.3046357333660126, "learning_rate": 0.0001900500834724541, "loss": 1.0429, "num_input_tokens_seen": 438958, "step": 155, "train_runtime": 367.4695, "train_tokens_per_second": 1194.543 }, { "epoch": 0.012535406496715482, "grad_norm": 0.32712283730506897, "learning_rate": 0.00018998330550918199, "loss": 1.1488, "num_input_tokens_seen": 441698, "step": 156, "train_runtime": 369.7698, "train_tokens_per_second": 1194.522 }, { "epoch": 0.012615761666566222, "grad_norm": 0.2856847047805786, "learning_rate": 0.00018991652754590986, "loss": 0.813, "num_input_tokens_seen": 444172, "step": 157, "train_runtime": 371.8292, "train_tokens_per_second": 1194.559 }, { "epoch": 0.012696116836416964, "grad_norm": 0.2785474359989166, "learning_rate": 0.00018984974958263776, "loss": 0.9779, "num_input_tokens_seen": 447652, "step": 158, "train_runtime": 374.403, "train_tokens_per_second": 1195.642 }, { "epoch": 0.012776472006267704, "grad_norm": 0.3558673858642578, "learning_rate": 0.00018978297161936563, "loss": 0.8613, "num_input_tokens_seen": 449884, "step": 159, "train_runtime": 376.4077, "train_tokens_per_second": 1195.204 }, { "epoch": 0.012856827176118444, "grad_norm": 0.30430328845977783, "learning_rate": 0.0001897161936560935, "loss": 1.1641, "num_input_tokens_seen": 452756, "step": 160, "train_runtime": 378.6837, "train_tokens_per_second": 1195.605 }, { "epoch": 0.012937182345969184, "grad_norm": 0.33249416947364807, "learning_rate": 0.00018964941569282138, "loss": 1.5722, "num_input_tokens_seen": 457040, "step": 161, "train_runtime": 381.8514, "train_tokens_per_second": 1196.905 }, { "epoch": 0.013017537515819924, "grad_norm": 0.33412277698516846, "learning_rate": 0.00018958263772954925, "loss": 0.9908, "num_input_tokens_seen": 459366, "step": 162, "train_runtime": 383.8328, "train_tokens_per_second": 1196.787 }, { "epoch": 0.013097892685670664, "grad_norm": 0.3346627652645111, "learning_rate": 0.00018951585976627715, "loss": 1.0819, "num_input_tokens_seen": 461756, "step": 163, "train_runtime": 385.8181, "train_tokens_per_second": 1196.823 }, { "epoch": 0.013178247855521404, "grad_norm": 0.40962570905685425, "learning_rate": 0.00018944908180300502, "loss": 0.851, "num_input_tokens_seen": 464706, "step": 164, "train_runtime": 388.1203, "train_tokens_per_second": 1197.325 }, { "epoch": 0.013258603025372144, "grad_norm": 0.2635403275489807, "learning_rate": 0.0001893823038397329, "loss": 1.0716, "num_input_tokens_seen": 468260, "step": 165, "train_runtime": 390.6874, "train_tokens_per_second": 1198.554 }, { "epoch": 0.013338958195222884, "grad_norm": 0.367654412984848, "learning_rate": 0.00018931552587646077, "loss": 0.7616, "num_input_tokens_seen": 471848, "step": 166, "train_runtime": 393.284, "train_tokens_per_second": 1199.764 }, { "epoch": 0.013419313365073626, "grad_norm": 0.30167949199676514, "learning_rate": 0.00018924874791318864, "loss": 1.2558, "num_input_tokens_seen": 475074, "step": 167, "train_runtime": 395.8428, "train_tokens_per_second": 1200.158 }, { "epoch": 0.013499668534924366, "grad_norm": 0.365676611661911, "learning_rate": 0.00018918196994991652, "loss": 0.9429, "num_input_tokens_seen": 477110, "step": 168, "train_runtime": 397.6989, "train_tokens_per_second": 1199.676 }, { "epoch": 0.013580023704775106, "grad_norm": 0.26204466819763184, "learning_rate": 0.00018911519198664442, "loss": 0.9637, "num_input_tokens_seen": 479824, "step": 169, "train_runtime": 399.87, "train_tokens_per_second": 1199.95 }, { "epoch": 0.013660378874625847, "grad_norm": 0.3446420133113861, "learning_rate": 0.0001890484140233723, "loss": 1.0273, "num_input_tokens_seen": 481880, "step": 170, "train_runtime": 401.7023, "train_tokens_per_second": 1199.595 }, { "epoch": 0.013740734044476587, "grad_norm": 0.3590293824672699, "learning_rate": 0.00018898163606010016, "loss": 0.8755, "num_input_tokens_seen": 484256, "step": 171, "train_runtime": 403.7885, "train_tokens_per_second": 1199.281 }, { "epoch": 0.013821089214327327, "grad_norm": 0.2834423780441284, "learning_rate": 0.00018891485809682806, "loss": 0.8606, "num_input_tokens_seen": 486474, "step": 172, "train_runtime": 405.7457, "train_tokens_per_second": 1198.963 }, { "epoch": 0.013901444384178067, "grad_norm": 0.3650365471839905, "learning_rate": 0.00018884808013355594, "loss": 0.9288, "num_input_tokens_seen": 488262, "step": 173, "train_runtime": 407.4692, "train_tokens_per_second": 1198.279 }, { "epoch": 0.013981799554028807, "grad_norm": 0.29482585191726685, "learning_rate": 0.00018878130217028384, "loss": 0.9901, "num_input_tokens_seen": 491614, "step": 174, "train_runtime": 410.0341, "train_tokens_per_second": 1198.959 }, { "epoch": 0.014062154723879547, "grad_norm": 0.32307374477386475, "learning_rate": 0.0001887145242070117, "loss": 1.1529, "num_input_tokens_seen": 494446, "step": 175, "train_runtime": 412.2213, "train_tokens_per_second": 1199.468 }, { "epoch": 0.014142509893730289, "grad_norm": 0.3395145833492279, "learning_rate": 0.00018864774624373958, "loss": 0.9121, "num_input_tokens_seen": 496538, "step": 176, "train_runtime": 414.066, "train_tokens_per_second": 1199.176 }, { "epoch": 0.014222865063581029, "grad_norm": 0.31804996728897095, "learning_rate": 0.00018858096828046746, "loss": 1.0448, "num_input_tokens_seen": 498296, "step": 177, "train_runtime": 415.8093, "train_tokens_per_second": 1198.376 }, { "epoch": 0.014303220233431769, "grad_norm": 0.2677456736564636, "learning_rate": 0.00018851419031719533, "loss": 1.2028, "num_input_tokens_seen": 501642, "step": 178, "train_runtime": 418.2921, "train_tokens_per_second": 1199.262 }, { "epoch": 0.014383575403282509, "grad_norm": 0.3364807367324829, "learning_rate": 0.00018844741235392323, "loss": 1.1838, "num_input_tokens_seen": 504436, "step": 179, "train_runtime": 420.5919, "train_tokens_per_second": 1199.348 }, { "epoch": 0.014463930573133249, "grad_norm": 0.2928422689437866, "learning_rate": 0.0001883806343906511, "loss": 1.1621, "num_input_tokens_seen": 507202, "step": 180, "train_runtime": 422.8354, "train_tokens_per_second": 1199.526 }, { "epoch": 0.014544285742983989, "grad_norm": 0.2664826214313507, "learning_rate": 0.00018831385642737898, "loss": 1.001, "num_input_tokens_seen": 509714, "step": 181, "train_runtime": 426.5843, "train_tokens_per_second": 1194.873 }, { "epoch": 0.01462464091283473, "grad_norm": 0.3463704288005829, "learning_rate": 0.00018824707846410685, "loss": 1.3769, "num_input_tokens_seen": 513034, "step": 182, "train_runtime": 429.0651, "train_tokens_per_second": 1195.702 }, { "epoch": 0.01470499608268547, "grad_norm": 0.29105862975120544, "learning_rate": 0.00018818030050083472, "loss": 1.1422, "num_input_tokens_seen": 515310, "step": 183, "train_runtime": 430.9312, "train_tokens_per_second": 1195.806 }, { "epoch": 0.01478535125253621, "grad_norm": 0.3170328736305237, "learning_rate": 0.0001881135225375626, "loss": 1.0611, "num_input_tokens_seen": 516950, "step": 184, "train_runtime": 432.6182, "train_tokens_per_second": 1194.934 }, { "epoch": 0.014865706422386951, "grad_norm": 0.28122666478157043, "learning_rate": 0.0001880467445742905, "loss": 0.8899, "num_input_tokens_seen": 518780, "step": 185, "train_runtime": 434.3792, "train_tokens_per_second": 1194.302 }, { "epoch": 0.014946061592237691, "grad_norm": 0.4011630117893219, "learning_rate": 0.00018797996661101837, "loss": 1.0401, "num_input_tokens_seen": 520284, "step": 186, "train_runtime": 435.9646, "train_tokens_per_second": 1193.409 }, { "epoch": 0.015026416762088431, "grad_norm": 0.3490202724933624, "learning_rate": 0.00018791318864774624, "loss": 0.9352, "num_input_tokens_seen": 522202, "step": 187, "train_runtime": 437.705, "train_tokens_per_second": 1193.045 }, { "epoch": 0.015106771931939171, "grad_norm": 0.3363865911960602, "learning_rate": 0.00018784641068447412, "loss": 1.0091, "num_input_tokens_seen": 525100, "step": 188, "train_runtime": 439.9542, "train_tokens_per_second": 1193.533 }, { "epoch": 0.015187127101789911, "grad_norm": 0.32519596815109253, "learning_rate": 0.00018777963272120202, "loss": 0.9339, "num_input_tokens_seen": 530716, "step": 189, "train_runtime": 443.8903, "train_tokens_per_second": 1195.602 }, { "epoch": 0.015267482271640652, "grad_norm": 0.34321466088294983, "learning_rate": 0.0001877128547579299, "loss": 0.927, "num_input_tokens_seen": 532866, "step": 190, "train_runtime": 445.7307, "train_tokens_per_second": 1195.489 }, { "epoch": 0.015347837441491392, "grad_norm": 0.2840273976325989, "learning_rate": 0.0001876460767946578, "loss": 0.9089, "num_input_tokens_seen": 535414, "step": 191, "train_runtime": 447.8213, "train_tokens_per_second": 1195.597 }, { "epoch": 0.015428192611342132, "grad_norm": 0.3532767593860626, "learning_rate": 0.00018757929883138566, "loss": 1.1514, "num_input_tokens_seen": 536984, "step": 192, "train_runtime": 449.4759, "train_tokens_per_second": 1194.689 }, { "epoch": 0.015508547781192872, "grad_norm": 0.27947568893432617, "learning_rate": 0.00018751252086811354, "loss": 1.1501, "num_input_tokens_seen": 538716, "step": 193, "train_runtime": 451.1462, "train_tokens_per_second": 1194.105 }, { "epoch": 0.015588902951043614, "grad_norm": 0.32376599311828613, "learning_rate": 0.0001874457429048414, "loss": 0.5927, "num_input_tokens_seen": 540080, "step": 194, "train_runtime": 452.7433, "train_tokens_per_second": 1192.905 }, { "epoch": 0.015669258120894352, "grad_norm": 0.28643298149108887, "learning_rate": 0.0001873789649415693, "loss": 1.0052, "num_input_tokens_seen": 541804, "step": 195, "train_runtime": 454.4569, "train_tokens_per_second": 1192.201 }, { "epoch": 0.015749613290745094, "grad_norm": 0.2806437313556671, "learning_rate": 0.00018731218697829718, "loss": 0.9636, "num_input_tokens_seen": 543062, "step": 196, "train_runtime": 455.9817, "train_tokens_per_second": 1190.973 }, { "epoch": 0.015829968460595832, "grad_norm": 0.2808949649333954, "learning_rate": 0.00018724540901502506, "loss": 1.0987, "num_input_tokens_seen": 545946, "step": 197, "train_runtime": 458.2294, "train_tokens_per_second": 1191.425 }, { "epoch": 0.015910323630446574, "grad_norm": 0.27494966983795166, "learning_rate": 0.00018717863105175293, "loss": 0.9189, "num_input_tokens_seen": 548450, "step": 198, "train_runtime": 460.2307, "train_tokens_per_second": 1191.685 }, { "epoch": 0.015990678800297316, "grad_norm": 0.29499420523643494, "learning_rate": 0.0001871118530884808, "loss": 1.1379, "num_input_tokens_seen": 550444, "step": 199, "train_runtime": 462.0599, "train_tokens_per_second": 1191.283 }, { "epoch": 0.016071033970148054, "grad_norm": 0.34383973479270935, "learning_rate": 0.00018704507512520868, "loss": 0.9679, "num_input_tokens_seen": 552642, "step": 200, "train_runtime": 463.9201, "train_tokens_per_second": 1191.244 }, { "epoch": 0.016151389139998796, "grad_norm": 0.351194828748703, "learning_rate": 0.00018697829716193658, "loss": 1.1505, "num_input_tokens_seen": 554544, "step": 201, "train_runtime": 465.8094, "train_tokens_per_second": 1190.495 }, { "epoch": 0.016231744309849534, "grad_norm": 0.32537057995796204, "learning_rate": 0.00018691151919866445, "loss": 1.2466, "num_input_tokens_seen": 557158, "step": 202, "train_runtime": 467.9495, "train_tokens_per_second": 1190.637 }, { "epoch": 0.016312099479700276, "grad_norm": 0.341013103723526, "learning_rate": 0.00018684474123539232, "loss": 0.8909, "num_input_tokens_seen": 558518, "step": 203, "train_runtime": 469.5307, "train_tokens_per_second": 1189.524 }, { "epoch": 0.016392454649551014, "grad_norm": 0.2822452485561371, "learning_rate": 0.0001867779632721202, "loss": 0.7545, "num_input_tokens_seen": 560902, "step": 204, "train_runtime": 471.5518, "train_tokens_per_second": 1189.481 }, { "epoch": 0.016472809819401756, "grad_norm": 0.31220871210098267, "learning_rate": 0.00018671118530884807, "loss": 0.9268, "num_input_tokens_seen": 562980, "step": 205, "train_runtime": 473.4079, "train_tokens_per_second": 1189.207 }, { "epoch": 0.016553164989252495, "grad_norm": 0.33676648139953613, "learning_rate": 0.00018664440734557597, "loss": 0.9465, "num_input_tokens_seen": 565404, "step": 206, "train_runtime": 475.4152, "train_tokens_per_second": 1189.285 }, { "epoch": 0.016633520159103236, "grad_norm": 0.267469197511673, "learning_rate": 0.00018657762938230384, "loss": 0.8469, "num_input_tokens_seen": 568626, "step": 207, "train_runtime": 477.9041, "train_tokens_per_second": 1189.833 }, { "epoch": 0.016713875328953978, "grad_norm": 0.3146427273750305, "learning_rate": 0.00018651085141903174, "loss": 1.2071, "num_input_tokens_seen": 571642, "step": 208, "train_runtime": 480.2594, "train_tokens_per_second": 1190.278 }, { "epoch": 0.016794230498804717, "grad_norm": 0.32051125168800354, "learning_rate": 0.00018644407345575962, "loss": 1.1623, "num_input_tokens_seen": 574268, "step": 209, "train_runtime": 482.4211, "train_tokens_per_second": 1190.387 }, { "epoch": 0.01687458566865546, "grad_norm": 0.3071257174015045, "learning_rate": 0.0001863772954924875, "loss": 1.1845, "num_input_tokens_seen": 577408, "step": 210, "train_runtime": 484.818, "train_tokens_per_second": 1190.979 }, { "epoch": 0.016954940838506197, "grad_norm": 0.4016221761703491, "learning_rate": 0.0001863105175292154, "loss": 1.075, "num_input_tokens_seen": 580100, "step": 211, "train_runtime": 489.0016, "train_tokens_per_second": 1186.295 }, { "epoch": 0.01703529600835694, "grad_norm": 0.2990512549877167, "learning_rate": 0.00018624373956594326, "loss": 0.9753, "num_input_tokens_seen": 583272, "step": 212, "train_runtime": 491.3423, "train_tokens_per_second": 1187.099 }, { "epoch": 0.017115651178207677, "grad_norm": 0.3335602581501007, "learning_rate": 0.00018617696160267113, "loss": 0.7289, "num_input_tokens_seen": 585576, "step": 213, "train_runtime": 493.2548, "train_tokens_per_second": 1187.167 }, { "epoch": 0.01719600634805842, "grad_norm": 0.31806111335754395, "learning_rate": 0.000186110183639399, "loss": 0.8652, "num_input_tokens_seen": 586932, "step": 214, "train_runtime": 494.7909, "train_tokens_per_second": 1186.222 }, { "epoch": 0.017276361517909157, "grad_norm": 0.269388884305954, "learning_rate": 0.00018604340567612688, "loss": 1.3159, "num_input_tokens_seen": 590226, "step": 215, "train_runtime": 497.2321, "train_tokens_per_second": 1187.023 }, { "epoch": 0.0173567166877599, "grad_norm": 0.3230859041213989, "learning_rate": 0.00018597662771285475, "loss": 1.2652, "num_input_tokens_seen": 592584, "step": 216, "train_runtime": 499.1562, "train_tokens_per_second": 1187.171 }, { "epoch": 0.01743707185761064, "grad_norm": 0.3253515064716339, "learning_rate": 0.00018590984974958265, "loss": 1.0018, "num_input_tokens_seen": 594752, "step": 217, "train_runtime": 500.9867, "train_tokens_per_second": 1187.161 }, { "epoch": 0.01751742702746138, "grad_norm": 0.29371151328086853, "learning_rate": 0.00018584307178631053, "loss": 0.9875, "num_input_tokens_seen": 596604, "step": 218, "train_runtime": 502.7494, "train_tokens_per_second": 1186.683 }, { "epoch": 0.01759778219731212, "grad_norm": 0.33814385533332825, "learning_rate": 0.0001857762938230384, "loss": 1.0848, "num_input_tokens_seen": 600334, "step": 219, "train_runtime": 505.3906, "train_tokens_per_second": 1187.861 }, { "epoch": 0.01767813736716286, "grad_norm": 0.26476287841796875, "learning_rate": 0.00018570951585976627, "loss": 0.9078, "num_input_tokens_seen": 603930, "step": 220, "train_runtime": 508.0612, "train_tokens_per_second": 1188.695 }, { "epoch": 0.0177584925370136, "grad_norm": 0.2639309763908386, "learning_rate": 0.00018564273789649415, "loss": 1.0194, "num_input_tokens_seen": 606094, "step": 221, "train_runtime": 509.9427, "train_tokens_per_second": 1188.553 }, { "epoch": 0.01783884770686434, "grad_norm": 0.3658522367477417, "learning_rate": 0.00018557595993322205, "loss": 1.3372, "num_input_tokens_seen": 609150, "step": 222, "train_runtime": 512.2491, "train_tokens_per_second": 1189.168 }, { "epoch": 0.01791920287671508, "grad_norm": 0.2818155288696289, "learning_rate": 0.00018550918196994992, "loss": 1.0582, "num_input_tokens_seen": 611726, "step": 223, "train_runtime": 514.3235, "train_tokens_per_second": 1189.38 }, { "epoch": 0.01799955804656582, "grad_norm": 0.281306654214859, "learning_rate": 0.0001854424040066778, "loss": 0.9165, "num_input_tokens_seen": 613594, "step": 224, "train_runtime": 516.0901, "train_tokens_per_second": 1188.928 }, { "epoch": 0.01807991321641656, "grad_norm": 0.3171606957912445, "learning_rate": 0.0001853756260434057, "loss": 0.9054, "num_input_tokens_seen": 615324, "step": 225, "train_runtime": 517.8348, "train_tokens_per_second": 1188.263 }, { "epoch": 0.018160268386267303, "grad_norm": 0.2836587131023407, "learning_rate": 0.00018530884808013357, "loss": 1.0919, "num_input_tokens_seen": 618166, "step": 226, "train_runtime": 519.9689, "train_tokens_per_second": 1188.852 }, { "epoch": 0.01824062355611804, "grad_norm": 0.29988783597946167, "learning_rate": 0.00018524207011686147, "loss": 0.7693, "num_input_tokens_seen": 620906, "step": 227, "train_runtime": 522.1826, "train_tokens_per_second": 1189.059 }, { "epoch": 0.018320978725968783, "grad_norm": 0.38843727111816406, "learning_rate": 0.00018517529215358934, "loss": 0.92, "num_input_tokens_seen": 623114, "step": 228, "train_runtime": 524.1536, "train_tokens_per_second": 1188.8 }, { "epoch": 0.01840133389581952, "grad_norm": 0.3710363507270813, "learning_rate": 0.00018510851419031721, "loss": 0.9383, "num_input_tokens_seen": 624454, "step": 229, "train_runtime": 525.6716, "train_tokens_per_second": 1187.917 }, { "epoch": 0.018481689065670263, "grad_norm": 0.34894946217536926, "learning_rate": 0.0001850417362270451, "loss": 1.4647, "num_input_tokens_seen": 626452, "step": 230, "train_runtime": 527.5335, "train_tokens_per_second": 1187.511 }, { "epoch": 0.018562044235521002, "grad_norm": 0.3306509554386139, "learning_rate": 0.00018497495826377296, "loss": 1.0398, "num_input_tokens_seen": 630858, "step": 231, "train_runtime": 530.764, "train_tokens_per_second": 1188.585 }, { "epoch": 0.018642399405371744, "grad_norm": 0.3057507276535034, "learning_rate": 0.00018490818030050083, "loss": 1.0419, "num_input_tokens_seen": 633720, "step": 232, "train_runtime": 533.0, "train_tokens_per_second": 1188.968 }, { "epoch": 0.018722754575222482, "grad_norm": 0.3533569872379303, "learning_rate": 0.00018484140233722873, "loss": 1.3783, "num_input_tokens_seen": 635986, "step": 233, "train_runtime": 535.048, "train_tokens_per_second": 1188.652 }, { "epoch": 0.018803109745073224, "grad_norm": 0.33996251225471497, "learning_rate": 0.0001847746243739566, "loss": 1.0849, "num_input_tokens_seen": 637676, "step": 234, "train_runtime": 536.751, "train_tokens_per_second": 1188.03 }, { "epoch": 0.018883464914923966, "grad_norm": 0.2771894335746765, "learning_rate": 0.00018470784641068448, "loss": 0.9898, "num_input_tokens_seen": 640458, "step": 235, "train_runtime": 538.9257, "train_tokens_per_second": 1188.398 }, { "epoch": 0.018963820084774704, "grad_norm": 0.351846843957901, "learning_rate": 0.00018464106844741235, "loss": 1.2405, "num_input_tokens_seen": 642002, "step": 236, "train_runtime": 540.5796, "train_tokens_per_second": 1187.618 }, { "epoch": 0.019044175254625446, "grad_norm": 0.3286455273628235, "learning_rate": 0.00018457429048414023, "loss": 0.8548, "num_input_tokens_seen": 646542, "step": 237, "train_runtime": 543.7546, "train_tokens_per_second": 1189.033 }, { "epoch": 0.019124530424476184, "grad_norm": 0.2703714966773987, "learning_rate": 0.00018450751252086813, "loss": 0.7789, "num_input_tokens_seen": 648010, "step": 238, "train_runtime": 545.3085, "train_tokens_per_second": 1188.336 }, { "epoch": 0.019204885594326926, "grad_norm": 0.3055046498775482, "learning_rate": 0.000184440734557596, "loss": 1.2842, "num_input_tokens_seen": 651002, "step": 239, "train_runtime": 547.6009, "train_tokens_per_second": 1188.826 }, { "epoch": 0.019285240764177664, "grad_norm": 0.2989618480205536, "learning_rate": 0.00018437395659432387, "loss": 0.7324, "num_input_tokens_seen": 654196, "step": 240, "train_runtime": 550.0684, "train_tokens_per_second": 1189.299 }, { "epoch": 0.019365595934028406, "grad_norm": 0.30718129873275757, "learning_rate": 0.00018430717863105175, "loss": 0.6282, "num_input_tokens_seen": 656554, "step": 241, "train_runtime": 554.0852, "train_tokens_per_second": 1184.933 }, { "epoch": 0.019445951103879144, "grad_norm": 0.3032449781894684, "learning_rate": 0.00018424040066777965, "loss": 0.8998, "num_input_tokens_seen": 658716, "step": 242, "train_runtime": 555.9485, "train_tokens_per_second": 1184.851 }, { "epoch": 0.019526306273729886, "grad_norm": 0.36071792244911194, "learning_rate": 0.00018417362270450752, "loss": 1.0962, "num_input_tokens_seen": 660638, "step": 243, "train_runtime": 557.7411, "train_tokens_per_second": 1184.489 }, { "epoch": 0.019606661443580628, "grad_norm": 0.3375242352485657, "learning_rate": 0.00018410684474123542, "loss": 1.0222, "num_input_tokens_seen": 663794, "step": 244, "train_runtime": 560.31, "train_tokens_per_second": 1184.691 }, { "epoch": 0.019687016613431366, "grad_norm": 0.3033391833305359, "learning_rate": 0.0001840400667779633, "loss": 0.9836, "num_input_tokens_seen": 665898, "step": 245, "train_runtime": 562.1405, "train_tokens_per_second": 1184.576 }, { "epoch": 0.019767371783282108, "grad_norm": 0.334856241941452, "learning_rate": 0.00018397328881469117, "loss": 1.0768, "num_input_tokens_seen": 669356, "step": 246, "train_runtime": 564.7073, "train_tokens_per_second": 1185.315 }, { "epoch": 0.019847726953132847, "grad_norm": 0.32017403841018677, "learning_rate": 0.00018390651085141904, "loss": 0.9337, "num_input_tokens_seen": 670858, "step": 247, "train_runtime": 566.3387, "train_tokens_per_second": 1184.553 }, { "epoch": 0.01992808212298359, "grad_norm": 0.28297939896583557, "learning_rate": 0.0001838397328881469, "loss": 1.06, "num_input_tokens_seen": 673118, "step": 248, "train_runtime": 568.2626, "train_tokens_per_second": 1184.519 }, { "epoch": 0.020008437292834327, "grad_norm": 0.31982824206352234, "learning_rate": 0.0001837729549248748, "loss": 1.0177, "num_input_tokens_seen": 675548, "step": 249, "train_runtime": 570.3117, "train_tokens_per_second": 1184.524 }, { "epoch": 0.02008879246268507, "grad_norm": 0.28836411237716675, "learning_rate": 0.00018370617696160269, "loss": 0.9755, "num_input_tokens_seen": 679092, "step": 250, "train_runtime": 572.8814, "train_tokens_per_second": 1185.397 }, { "epoch": 0.020169147632535807, "grad_norm": 0.32343533635139465, "learning_rate": 0.00018363939899833056, "loss": 1.1175, "num_input_tokens_seen": 683370, "step": 251, "train_runtime": 575.9968, "train_tokens_per_second": 1186.413 }, { "epoch": 0.02024950280238655, "grad_norm": 0.25986310839653015, "learning_rate": 0.00018357262103505843, "loss": 1.0566, "num_input_tokens_seen": 686506, "step": 252, "train_runtime": 578.3604, "train_tokens_per_second": 1186.987 }, { "epoch": 0.02032985797223729, "grad_norm": 0.4172917902469635, "learning_rate": 0.0001835058430717863, "loss": 1.1435, "num_input_tokens_seen": 688146, "step": 253, "train_runtime": 579.9753, "train_tokens_per_second": 1186.509 }, { "epoch": 0.02041021314208803, "grad_norm": 0.3311367928981781, "learning_rate": 0.0001834390651085142, "loss": 1.1981, "num_input_tokens_seen": 690826, "step": 254, "train_runtime": 582.1721, "train_tokens_per_second": 1186.635 }, { "epoch": 0.02049056831193877, "grad_norm": 0.32272371649742126, "learning_rate": 0.00018337228714524208, "loss": 1.0856, "num_input_tokens_seen": 696758, "step": 255, "train_runtime": 586.1914, "train_tokens_per_second": 1188.619 }, { "epoch": 0.02057092348178951, "grad_norm": 0.3319406807422638, "learning_rate": 0.00018330550918196995, "loss": 0.9676, "num_input_tokens_seen": 699308, "step": 256, "train_runtime": 588.2945, "train_tokens_per_second": 1188.704 }, { "epoch": 0.02065127865164025, "grad_norm": 0.28314608335494995, "learning_rate": 0.00018323873121869782, "loss": 1.0579, "num_input_tokens_seen": 701988, "step": 257, "train_runtime": 590.4355, "train_tokens_per_second": 1188.933 }, { "epoch": 0.02073163382149099, "grad_norm": 0.3084408938884735, "learning_rate": 0.0001831719532554257, "loss": 1.0021, "num_input_tokens_seen": 705378, "step": 258, "train_runtime": 593.0866, "train_tokens_per_second": 1189.334 }, { "epoch": 0.02081198899134173, "grad_norm": 0.33266472816467285, "learning_rate": 0.0001831051752921536, "loss": 0.9928, "num_input_tokens_seen": 708452, "step": 259, "train_runtime": 595.4499, "train_tokens_per_second": 1189.776 }, { "epoch": 0.02089234416119247, "grad_norm": 0.33789265155792236, "learning_rate": 0.00018303839732888147, "loss": 1.1864, "num_input_tokens_seen": 711596, "step": 260, "train_runtime": 597.8571, "train_tokens_per_second": 1190.244 }, { "epoch": 0.02097269933104321, "grad_norm": 0.39183464646339417, "learning_rate": 0.00018297161936560937, "loss": 1.1375, "num_input_tokens_seen": 713536, "step": 261, "train_runtime": 599.6624, "train_tokens_per_second": 1189.896 }, { "epoch": 0.021053054500893953, "grad_norm": 0.2988393306732178, "learning_rate": 0.00018290484140233724, "loss": 1.0411, "num_input_tokens_seen": 715772, "step": 262, "train_runtime": 601.5042, "train_tokens_per_second": 1189.97 }, { "epoch": 0.02113340967074469, "grad_norm": 0.35692253708839417, "learning_rate": 0.00018283806343906512, "loss": 1.3377, "num_input_tokens_seen": 718176, "step": 263, "train_runtime": 603.5783, "train_tokens_per_second": 1189.864 }, { "epoch": 0.021213764840595433, "grad_norm": 0.3549998998641968, "learning_rate": 0.000182771285475793, "loss": 1.0436, "num_input_tokens_seen": 720824, "step": 264, "train_runtime": 605.6188, "train_tokens_per_second": 1190.227 }, { "epoch": 0.02129412001044617, "grad_norm": 0.39884763956069946, "learning_rate": 0.0001827045075125209, "loss": 1.0585, "num_input_tokens_seen": 722544, "step": 265, "train_runtime": 607.3114, "train_tokens_per_second": 1189.742 }, { "epoch": 0.021374475180296913, "grad_norm": 0.3078259229660034, "learning_rate": 0.00018263772954924876, "loss": 1.2007, "num_input_tokens_seen": 725812, "step": 266, "train_runtime": 609.7726, "train_tokens_per_second": 1190.299 }, { "epoch": 0.02145483035014765, "grad_norm": 0.3153076767921448, "learning_rate": 0.00018257095158597664, "loss": 0.9561, "num_input_tokens_seen": 729636, "step": 267, "train_runtime": 612.5845, "train_tokens_per_second": 1191.078 }, { "epoch": 0.021535185519998393, "grad_norm": 0.3072142004966736, "learning_rate": 0.0001825041736227045, "loss": 1.1039, "num_input_tokens_seen": 731774, "step": 268, "train_runtime": 614.4373, "train_tokens_per_second": 1190.966 }, { "epoch": 0.021615540689849132, "grad_norm": 0.2938554584980011, "learning_rate": 0.00018243739565943238, "loss": 0.7892, "num_input_tokens_seen": 734640, "step": 269, "train_runtime": 616.8038, "train_tokens_per_second": 1191.043 }, { "epoch": 0.021695895859699874, "grad_norm": 0.3175390958786011, "learning_rate": 0.00018237061769616028, "loss": 1.1768, "num_input_tokens_seen": 738162, "step": 270, "train_runtime": 619.4736, "train_tokens_per_second": 1191.596 }, { "epoch": 0.021776251029550615, "grad_norm": 0.359017550945282, "learning_rate": 0.00018230383973288816, "loss": 1.4663, "num_input_tokens_seen": 741614, "step": 271, "train_runtime": 624.2311, "train_tokens_per_second": 1188.044 }, { "epoch": 0.021856606199401354, "grad_norm": 0.31477251648902893, "learning_rate": 0.00018223706176961603, "loss": 1.1051, "num_input_tokens_seen": 744968, "step": 272, "train_runtime": 626.7102, "train_tokens_per_second": 1188.696 }, { "epoch": 0.021936961369252096, "grad_norm": 0.40492677688598633, "learning_rate": 0.0001821702838063439, "loss": 0.792, "num_input_tokens_seen": 746498, "step": 273, "train_runtime": 628.3129, "train_tokens_per_second": 1188.099 }, { "epoch": 0.022017316539102834, "grad_norm": 0.29795950651168823, "learning_rate": 0.00018210350584307178, "loss": 0.8987, "num_input_tokens_seen": 749370, "step": 274, "train_runtime": 630.5416, "train_tokens_per_second": 1188.455 }, { "epoch": 0.022097671708953576, "grad_norm": 0.21813727915287018, "learning_rate": 0.00018203672787979968, "loss": 0.8571, "num_input_tokens_seen": 752410, "step": 275, "train_runtime": 632.9991, "train_tokens_per_second": 1188.643 }, { "epoch": 0.022178026878804314, "grad_norm": 0.46228572726249695, "learning_rate": 0.00018196994991652755, "loss": 0.8525, "num_input_tokens_seen": 756972, "step": 276, "train_runtime": 636.2182, "train_tokens_per_second": 1189.799 }, { "epoch": 0.022258382048655056, "grad_norm": 0.3270361125469208, "learning_rate": 0.00018190317195325542, "loss": 1.276, "num_input_tokens_seen": 759264, "step": 277, "train_runtime": 638.1625, "train_tokens_per_second": 1189.766 }, { "epoch": 0.022338737218505794, "grad_norm": 0.3066183626651764, "learning_rate": 0.00018183639398998332, "loss": 0.84, "num_input_tokens_seen": 762356, "step": 278, "train_runtime": 640.515, "train_tokens_per_second": 1190.223 }, { "epoch": 0.022419092388356536, "grad_norm": 0.3379145860671997, "learning_rate": 0.0001817696160267112, "loss": 0.845, "num_input_tokens_seen": 764308, "step": 279, "train_runtime": 642.3225, "train_tokens_per_second": 1189.913 }, { "epoch": 0.022499447558207278, "grad_norm": 0.2823447287082672, "learning_rate": 0.0001817028380634391, "loss": 1.3112, "num_input_tokens_seen": 766402, "step": 280, "train_runtime": 644.0831, "train_tokens_per_second": 1189.912 }, { "epoch": 0.022579802728058016, "grad_norm": 0.3513202965259552, "learning_rate": 0.00018163606010016697, "loss": 0.9946, "num_input_tokens_seen": 769308, "step": 281, "train_runtime": 646.3636, "train_tokens_per_second": 1190.209 }, { "epoch": 0.022660157897908758, "grad_norm": 0.3789612650871277, "learning_rate": 0.00018156928213689484, "loss": 1.0793, "num_input_tokens_seen": 771698, "step": 282, "train_runtime": 648.3166, "train_tokens_per_second": 1190.31 }, { "epoch": 0.022740513067759496, "grad_norm": 0.3214729130268097, "learning_rate": 0.00018150250417362272, "loss": 1.2683, "num_input_tokens_seen": 778998, "step": 283, "train_runtime": 653.0352, "train_tokens_per_second": 1192.888 }, { "epoch": 0.022820868237610238, "grad_norm": 0.3571290373802185, "learning_rate": 0.0001814357262103506, "loss": 0.8057, "num_input_tokens_seen": 780600, "step": 284, "train_runtime": 654.6897, "train_tokens_per_second": 1192.321 }, { "epoch": 0.022901223407460976, "grad_norm": 0.37717893719673157, "learning_rate": 0.00018136894824707846, "loss": 1.0761, "num_input_tokens_seen": 783222, "step": 285, "train_runtime": 656.8363, "train_tokens_per_second": 1192.416 }, { "epoch": 0.02298157857731172, "grad_norm": 0.3153490424156189, "learning_rate": 0.00018130217028380636, "loss": 0.9528, "num_input_tokens_seen": 786730, "step": 286, "train_runtime": 659.4083, "train_tokens_per_second": 1193.085 }, { "epoch": 0.023061933747162457, "grad_norm": 0.29828205704689026, "learning_rate": 0.00018123539232053424, "loss": 0.9196, "num_input_tokens_seen": 789450, "step": 287, "train_runtime": 661.5361, "train_tokens_per_second": 1193.359 }, { "epoch": 0.0231422889170132, "grad_norm": 0.3584853708744049, "learning_rate": 0.0001811686143572621, "loss": 0.8471, "num_input_tokens_seen": 791610, "step": 288, "train_runtime": 663.4202, "train_tokens_per_second": 1193.226 }, { "epoch": 0.02322264408686394, "grad_norm": 0.33623620867729187, "learning_rate": 0.00018110183639398998, "loss": 1.0002, "num_input_tokens_seen": 794294, "step": 289, "train_runtime": 665.5696, "train_tokens_per_second": 1193.405 }, { "epoch": 0.02330299925671468, "grad_norm": 0.2922380566596985, "learning_rate": 0.00018103505843071786, "loss": 1.0132, "num_input_tokens_seen": 798442, "step": 290, "train_runtime": 668.5575, "train_tokens_per_second": 1194.276 }, { "epoch": 0.02338335442656542, "grad_norm": 0.2733694314956665, "learning_rate": 0.00018096828046744576, "loss": 1.0303, "num_input_tokens_seen": 801948, "step": 291, "train_runtime": 671.1696, "train_tokens_per_second": 1194.852 }, { "epoch": 0.02346370959641616, "grad_norm": 0.3377852141857147, "learning_rate": 0.00018090150250417363, "loss": 1.1365, "num_input_tokens_seen": 803772, "step": 292, "train_runtime": 672.8719, "train_tokens_per_second": 1194.539 }, { "epoch": 0.0235440647662669, "grad_norm": 0.3539382219314575, "learning_rate": 0.0001808347245409015, "loss": 1.3856, "num_input_tokens_seen": 805678, "step": 293, "train_runtime": 674.6333, "train_tokens_per_second": 1194.246 }, { "epoch": 0.02362441993611764, "grad_norm": 0.3829708695411682, "learning_rate": 0.00018076794657762938, "loss": 1.179, "num_input_tokens_seen": 807536, "step": 294, "train_runtime": 676.3396, "train_tokens_per_second": 1193.98 }, { "epoch": 0.02370477510596838, "grad_norm": 0.2746177911758423, "learning_rate": 0.00018070116861435728, "loss": 0.9804, "num_input_tokens_seen": 810270, "step": 295, "train_runtime": 678.4794, "train_tokens_per_second": 1194.244 }, { "epoch": 0.02378513027581912, "grad_norm": 0.2421218901872635, "learning_rate": 0.00018063439065108515, "loss": 0.8228, "num_input_tokens_seen": 812892, "step": 296, "train_runtime": 680.595, "train_tokens_per_second": 1194.384 }, { "epoch": 0.02386548544566986, "grad_norm": 0.3055904507637024, "learning_rate": 0.00018056761268781305, "loss": 0.9661, "num_input_tokens_seen": 815328, "step": 297, "train_runtime": 682.5564, "train_tokens_per_second": 1194.521 }, { "epoch": 0.023945840615520603, "grad_norm": 0.3203045129776001, "learning_rate": 0.00018050083472454092, "loss": 1.0487, "num_input_tokens_seen": 818542, "step": 298, "train_runtime": 685.0442, "train_tokens_per_second": 1194.875 }, { "epoch": 0.02402619578537134, "grad_norm": 0.33606308698654175, "learning_rate": 0.0001804340567612688, "loss": 0.7003, "num_input_tokens_seen": 819804, "step": 299, "train_runtime": 686.5544, "train_tokens_per_second": 1194.085 }, { "epoch": 0.024106550955222083, "grad_norm": 0.35947442054748535, "learning_rate": 0.00018036727879799667, "loss": 1.0502, "num_input_tokens_seen": 822530, "step": 300, "train_runtime": 688.7295, "train_tokens_per_second": 1194.271 }, { "epoch": 0.024106550955222083, "eval_loss": 1.0293227434158325, "eval_runtime": 92.507, "eval_samples_per_second": 10.745, "eval_steps_per_second": 5.373, "num_input_tokens_seen": 822530, "step": 300 }, { "epoch": 0.02418690612507282, "grad_norm": 0.3234299421310425, "learning_rate": 0.00018030050083472454, "loss": 0.8288, "num_input_tokens_seen": 825642, "step": 301, "train_runtime": 785.6794, "train_tokens_per_second": 1050.864 }, { "epoch": 0.024267261294923563, "grad_norm": 0.3050432801246643, "learning_rate": 0.00018023372287145244, "loss": 1.1029, "num_input_tokens_seen": 829728, "step": 302, "train_runtime": 788.6291, "train_tokens_per_second": 1052.114 }, { "epoch": 0.0243476164647743, "grad_norm": 0.30831417441368103, "learning_rate": 0.00018016694490818031, "loss": 1.0772, "num_input_tokens_seen": 831968, "step": 303, "train_runtime": 790.5661, "train_tokens_per_second": 1052.37 }, { "epoch": 0.024427971634625043, "grad_norm": 0.31089532375335693, "learning_rate": 0.0001801001669449082, "loss": 0.9571, "num_input_tokens_seen": 835942, "step": 304, "train_runtime": 793.4084, "train_tokens_per_second": 1053.609 }, { "epoch": 0.02450832680447578, "grad_norm": 0.2574862837791443, "learning_rate": 0.00018003338898163606, "loss": 1.0147, "num_input_tokens_seen": 838214, "step": 305, "train_runtime": 795.3659, "train_tokens_per_second": 1053.872 }, { "epoch": 0.024588681974326523, "grad_norm": 0.29710450768470764, "learning_rate": 0.00017996661101836393, "loss": 0.9261, "num_input_tokens_seen": 843000, "step": 306, "train_runtime": 798.8386, "train_tokens_per_second": 1055.282 }, { "epoch": 0.024669037144177265, "grad_norm": 0.27685678005218506, "learning_rate": 0.00017989983305509183, "loss": 1.0539, "num_input_tokens_seen": 845588, "step": 307, "train_runtime": 800.9657, "train_tokens_per_second": 1055.711 }, { "epoch": 0.024749392314028004, "grad_norm": 0.2785474956035614, "learning_rate": 0.0001798330550918197, "loss": 0.7323, "num_input_tokens_seen": 848704, "step": 308, "train_runtime": 803.3106, "train_tokens_per_second": 1056.508 }, { "epoch": 0.024829747483878745, "grad_norm": 0.3003632128238678, "learning_rate": 0.00017976627712854758, "loss": 0.8072, "num_input_tokens_seen": 850446, "step": 309, "train_runtime": 804.9444, "train_tokens_per_second": 1056.528 }, { "epoch": 0.024910102653729484, "grad_norm": 0.3557335138320923, "learning_rate": 0.00017969949916527545, "loss": 1.1393, "num_input_tokens_seen": 852032, "step": 310, "train_runtime": 806.5353, "train_tokens_per_second": 1056.41 }, { "epoch": 0.024990457823580225, "grad_norm": 0.28027603030204773, "learning_rate": 0.00017963272120200333, "loss": 1.0839, "num_input_tokens_seen": 855012, "step": 311, "train_runtime": 808.852, "train_tokens_per_second": 1057.069 }, { "epoch": 0.025070812993430964, "grad_norm": 0.3183228373527527, "learning_rate": 0.00017956594323873123, "loss": 1.2603, "num_input_tokens_seen": 858100, "step": 312, "train_runtime": 811.2805, "train_tokens_per_second": 1057.711 }, { "epoch": 0.025151168163281706, "grad_norm": 0.29947277903556824, "learning_rate": 0.0001794991652754591, "loss": 0.9422, "num_input_tokens_seen": 860210, "step": 313, "train_runtime": 813.1143, "train_tokens_per_second": 1057.92 }, { "epoch": 0.025231523333132444, "grad_norm": 0.2728103697299957, "learning_rate": 0.000179432387312187, "loss": 0.9389, "num_input_tokens_seen": 863722, "step": 314, "train_runtime": 815.7772, "train_tokens_per_second": 1058.772 }, { "epoch": 0.025311878502983186, "grad_norm": 0.33725112676620483, "learning_rate": 0.00017936560934891487, "loss": 1.2485, "num_input_tokens_seen": 868400, "step": 315, "train_runtime": 819.2078, "train_tokens_per_second": 1060.049 }, { "epoch": 0.025392233672833928, "grad_norm": 0.25919032096862793, "learning_rate": 0.00017929883138564275, "loss": 0.9498, "num_input_tokens_seen": 870832, "step": 316, "train_runtime": 821.221, "train_tokens_per_second": 1060.411 }, { "epoch": 0.025472588842684666, "grad_norm": 0.26820915937423706, "learning_rate": 0.00017923205342237062, "loss": 0.7763, "num_input_tokens_seen": 874886, "step": 317, "train_runtime": 824.1521, "train_tokens_per_second": 1061.559 }, { "epoch": 0.025552944012535408, "grad_norm": 0.3074873387813568, "learning_rate": 0.00017916527545909852, "loss": 0.992, "num_input_tokens_seen": 877822, "step": 318, "train_runtime": 826.512, "train_tokens_per_second": 1062.08 }, { "epoch": 0.025633299182386146, "grad_norm": 0.2895393967628479, "learning_rate": 0.0001790984974958264, "loss": 1.0058, "num_input_tokens_seen": 879982, "step": 319, "train_runtime": 828.3689, "train_tokens_per_second": 1062.307 }, { "epoch": 0.025713654352236888, "grad_norm": 0.33440056443214417, "learning_rate": 0.00017903171953255427, "loss": 0.998, "num_input_tokens_seen": 881992, "step": 320, "train_runtime": 830.2461, "train_tokens_per_second": 1062.326 }, { "epoch": 0.025794009522087626, "grad_norm": 0.2001473754644394, "learning_rate": 0.00017896494156928214, "loss": 0.769, "num_input_tokens_seen": 885918, "step": 321, "train_runtime": 833.1032, "train_tokens_per_second": 1063.395 }, { "epoch": 0.025874364691938368, "grad_norm": 0.30161628127098083, "learning_rate": 0.00017889816360601, "loss": 0.9834, "num_input_tokens_seen": 888442, "step": 322, "train_runtime": 835.1223, "train_tokens_per_second": 1063.847 }, { "epoch": 0.025954719861789106, "grad_norm": 0.26389217376708984, "learning_rate": 0.0001788313856427379, "loss": 0.9027, "num_input_tokens_seen": 891640, "step": 323, "train_runtime": 837.49, "train_tokens_per_second": 1064.657 }, { "epoch": 0.026035075031639848, "grad_norm": 0.2665056586265564, "learning_rate": 0.0001787646076794658, "loss": 0.6519, "num_input_tokens_seen": 894146, "step": 324, "train_runtime": 839.5513, "train_tokens_per_second": 1065.028 }, { "epoch": 0.02611543020149059, "grad_norm": 0.3544711768627167, "learning_rate": 0.00017869782971619366, "loss": 1.0825, "num_input_tokens_seen": 897002, "step": 325, "train_runtime": 841.9102, "train_tokens_per_second": 1065.437 }, { "epoch": 0.02619578537134133, "grad_norm": 0.28575438261032104, "learning_rate": 0.00017863105175292153, "loss": 0.7889, "num_input_tokens_seen": 898690, "step": 326, "train_runtime": 843.4952, "train_tokens_per_second": 1065.436 }, { "epoch": 0.02627614054119207, "grad_norm": 0.31976303458213806, "learning_rate": 0.0001785642737896494, "loss": 0.8223, "num_input_tokens_seen": 902416, "step": 327, "train_runtime": 846.41, "train_tokens_per_second": 1066.169 }, { "epoch": 0.02635649571104281, "grad_norm": 0.37153351306915283, "learning_rate": 0.0001784974958263773, "loss": 1.2682, "num_input_tokens_seen": 904900, "step": 328, "train_runtime": 848.4684, "train_tokens_per_second": 1066.51 }, { "epoch": 0.02643685088089355, "grad_norm": 0.3395041823387146, "learning_rate": 0.00017843071786310518, "loss": 0.7636, "num_input_tokens_seen": 908254, "step": 329, "train_runtime": 850.9843, "train_tokens_per_second": 1067.298 }, { "epoch": 0.02651720605074429, "grad_norm": 0.2999211847782135, "learning_rate": 0.00017836393989983305, "loss": 1.2016, "num_input_tokens_seen": 913526, "step": 330, "train_runtime": 854.8068, "train_tokens_per_second": 1068.693 }, { "epoch": 0.02659756122059503, "grad_norm": 0.4062979519367218, "learning_rate": 0.00017829716193656095, "loss": 1.3509, "num_input_tokens_seen": 915430, "step": 331, "train_runtime": 858.6115, "train_tokens_per_second": 1066.175 }, { "epoch": 0.02667791639044577, "grad_norm": 0.36649632453918457, "learning_rate": 0.00017823038397328883, "loss": 1.2088, "num_input_tokens_seen": 917560, "step": 332, "train_runtime": 860.456, "train_tokens_per_second": 1066.365 }, { "epoch": 0.02675827156029651, "grad_norm": 0.3506964147090912, "learning_rate": 0.0001781636060100167, "loss": 0.8204, "num_input_tokens_seen": 919932, "step": 333, "train_runtime": 862.4173, "train_tokens_per_second": 1066.69 }, { "epoch": 0.026838626730147253, "grad_norm": 0.3504076600074768, "learning_rate": 0.0001780968280467446, "loss": 1.1844, "num_input_tokens_seen": 923320, "step": 334, "train_runtime": 864.9706, "train_tokens_per_second": 1067.458 }, { "epoch": 0.02691898189999799, "grad_norm": 0.34691742062568665, "learning_rate": 0.00017803005008347247, "loss": 1.1981, "num_input_tokens_seen": 925438, "step": 335, "train_runtime": 866.9339, "train_tokens_per_second": 1067.484 }, { "epoch": 0.026999337069848733, "grad_norm": 0.28551656007766724, "learning_rate": 0.00017796327212020035, "loss": 0.9535, "num_input_tokens_seen": 927510, "step": 336, "train_runtime": 868.7185, "train_tokens_per_second": 1067.676 }, { "epoch": 0.02707969223969947, "grad_norm": 0.2888050079345703, "learning_rate": 0.00017789649415692822, "loss": 1.2472, "num_input_tokens_seen": 929556, "step": 337, "train_runtime": 870.5581, "train_tokens_per_second": 1067.77 }, { "epoch": 0.027160047409550213, "grad_norm": 0.27506229281425476, "learning_rate": 0.0001778297161936561, "loss": 1.2203, "num_input_tokens_seen": 931564, "step": 338, "train_runtime": 872.3983, "train_tokens_per_second": 1067.82 }, { "epoch": 0.02724040257940095, "grad_norm": 0.376938134431839, "learning_rate": 0.000177762938230384, "loss": 1.1158, "num_input_tokens_seen": 933568, "step": 339, "train_runtime": 874.2015, "train_tokens_per_second": 1067.909 }, { "epoch": 0.027320757749251693, "grad_norm": 0.3374652862548828, "learning_rate": 0.00017769616026711187, "loss": 1.1596, "num_input_tokens_seen": 936760, "step": 340, "train_runtime": 876.6754, "train_tokens_per_second": 1068.537 }, { "epoch": 0.02740111291910243, "grad_norm": 0.3184716999530792, "learning_rate": 0.00017762938230383974, "loss": 0.9784, "num_input_tokens_seen": 940762, "step": 341, "train_runtime": 879.5921, "train_tokens_per_second": 1069.543 }, { "epoch": 0.027481468088953173, "grad_norm": 0.27784883975982666, "learning_rate": 0.0001775626043405676, "loss": 0.9596, "num_input_tokens_seen": 944180, "step": 342, "train_runtime": 882.14, "train_tokens_per_second": 1070.329 }, { "epoch": 0.027561823258803915, "grad_norm": 0.31485989689826965, "learning_rate": 0.00017749582637729548, "loss": 0.9454, "num_input_tokens_seen": 947532, "step": 343, "train_runtime": 884.7641, "train_tokens_per_second": 1070.943 }, { "epoch": 0.027642178428654653, "grad_norm": 0.19721388816833496, "learning_rate": 0.00017742904841402339, "loss": 0.8979, "num_input_tokens_seen": 950782, "step": 344, "train_runtime": 887.1238, "train_tokens_per_second": 1071.758 }, { "epoch": 0.027722533598505395, "grad_norm": 0.3029862642288208, "learning_rate": 0.00017736227045075126, "loss": 1.3457, "num_input_tokens_seen": 953466, "step": 345, "train_runtime": 889.2656, "train_tokens_per_second": 1072.195 }, { "epoch": 0.027802888768356133, "grad_norm": 0.2497890740633011, "learning_rate": 0.00017729549248747913, "loss": 0.932, "num_input_tokens_seen": 955468, "step": 346, "train_runtime": 891.0254, "train_tokens_per_second": 1072.324 }, { "epoch": 0.027883243938206875, "grad_norm": 0.2995472848415375, "learning_rate": 0.000177228714524207, "loss": 1.104, "num_input_tokens_seen": 962602, "step": 347, "train_runtime": 895.8467, "train_tokens_per_second": 1074.516 }, { "epoch": 0.027963599108057614, "grad_norm": 0.3298209309577942, "learning_rate": 0.0001771619365609349, "loss": 1.446, "num_input_tokens_seen": 965170, "step": 348, "train_runtime": 897.9165, "train_tokens_per_second": 1074.899 }, { "epoch": 0.028043954277908355, "grad_norm": 0.35635843873023987, "learning_rate": 0.00017709515859766278, "loss": 1.196, "num_input_tokens_seen": 966402, "step": 349, "train_runtime": 899.4278, "train_tokens_per_second": 1074.463 }, { "epoch": 0.028124309447759094, "grad_norm": 0.2697749137878418, "learning_rate": 0.00017702838063439068, "loss": 1.1712, "num_input_tokens_seen": 969120, "step": 350, "train_runtime": 901.6435, "train_tokens_per_second": 1074.837 }, { "epoch": 0.028204664617609836, "grad_norm": 0.28007960319519043, "learning_rate": 0.00017696160267111855, "loss": 0.7704, "num_input_tokens_seen": 971174, "step": 351, "train_runtime": 903.4927, "train_tokens_per_second": 1074.911 }, { "epoch": 0.028285019787460577, "grad_norm": 0.2861485779285431, "learning_rate": 0.00017689482470784642, "loss": 1.1288, "num_input_tokens_seen": 974448, "step": 352, "train_runtime": 906.0007, "train_tokens_per_second": 1075.549 }, { "epoch": 0.028365374957311316, "grad_norm": 0.2961346507072449, "learning_rate": 0.0001768280467445743, "loss": 1.252, "num_input_tokens_seen": 977222, "step": 353, "train_runtime": 908.1532, "train_tokens_per_second": 1076.054 }, { "epoch": 0.028445730127162058, "grad_norm": 0.2412026822566986, "learning_rate": 0.00017676126878130217, "loss": 0.9611, "num_input_tokens_seen": 979666, "step": 354, "train_runtime": 910.2101, "train_tokens_per_second": 1076.308 }, { "epoch": 0.028526085297012796, "grad_norm": 0.40000274777412415, "learning_rate": 0.00017669449081803007, "loss": 1.3821, "num_input_tokens_seen": 980940, "step": 355, "train_runtime": 911.7758, "train_tokens_per_second": 1075.857 }, { "epoch": 0.028606440466863538, "grad_norm": 0.3051069974899292, "learning_rate": 0.00017662771285475794, "loss": 0.8413, "num_input_tokens_seen": 983684, "step": 356, "train_runtime": 913.9508, "train_tokens_per_second": 1076.299 }, { "epoch": 0.028686795636714276, "grad_norm": 0.31597766280174255, "learning_rate": 0.00017656093489148582, "loss": 1.2544, "num_input_tokens_seen": 993122, "step": 357, "train_runtime": 919.9445, "train_tokens_per_second": 1079.546 }, { "epoch": 0.028767150806565018, "grad_norm": 0.34993791580200195, "learning_rate": 0.0001764941569282137, "loss": 1.3095, "num_input_tokens_seen": 995658, "step": 358, "train_runtime": 922.0586, "train_tokens_per_second": 1079.821 }, { "epoch": 0.028847505976415756, "grad_norm": 0.31747668981552124, "learning_rate": 0.00017642737896494156, "loss": 1.0146, "num_input_tokens_seen": 998980, "step": 359, "train_runtime": 924.6271, "train_tokens_per_second": 1080.414 }, { "epoch": 0.028927861146266498, "grad_norm": 0.2664702832698822, "learning_rate": 0.00017636060100166946, "loss": 0.8058, "num_input_tokens_seen": 1001000, "step": 360, "train_runtime": 926.5061, "train_tokens_per_second": 1080.403 }, { "epoch": 0.02900821631611724, "grad_norm": 0.3068900406360626, "learning_rate": 0.00017629382303839734, "loss": 1.2296, "num_input_tokens_seen": 1004382, "step": 361, "train_runtime": 930.9966, "train_tokens_per_second": 1078.825 }, { "epoch": 0.029088571485967978, "grad_norm": 0.3020861744880676, "learning_rate": 0.0001762270450751252, "loss": 1.3893, "num_input_tokens_seen": 1007248, "step": 362, "train_runtime": 933.244, "train_tokens_per_second": 1079.298 }, { "epoch": 0.02916892665581872, "grad_norm": 0.3030184805393219, "learning_rate": 0.00017616026711185308, "loss": 1.4272, "num_input_tokens_seen": 1011076, "step": 363, "train_runtime": 936.0694, "train_tokens_per_second": 1080.129 }, { "epoch": 0.02924928182566946, "grad_norm": 0.32471176981925964, "learning_rate": 0.00017609348914858096, "loss": 1.0103, "num_input_tokens_seen": 1013570, "step": 364, "train_runtime": 938.0863, "train_tokens_per_second": 1080.466 }, { "epoch": 0.0293296369955202, "grad_norm": 0.3173401653766632, "learning_rate": 0.00017602671118530886, "loss": 0.9379, "num_input_tokens_seen": 1014974, "step": 365, "train_runtime": 939.6768, "train_tokens_per_second": 1080.131 }, { "epoch": 0.02940999216537094, "grad_norm": 0.28528130054473877, "learning_rate": 0.00017595993322203673, "loss": 0.7587, "num_input_tokens_seen": 1017044, "step": 366, "train_runtime": 941.6503, "train_tokens_per_second": 1080.065 }, { "epoch": 0.02949034733522168, "grad_norm": 0.2877449691295624, "learning_rate": 0.00017589315525876463, "loss": 0.9675, "num_input_tokens_seen": 1021034, "step": 367, "train_runtime": 944.3924, "train_tokens_per_second": 1081.154 }, { "epoch": 0.02957070250507242, "grad_norm": 0.26632797718048096, "learning_rate": 0.0001758263772954925, "loss": 0.7783, "num_input_tokens_seen": 1022808, "step": 368, "train_runtime": 946.0748, "train_tokens_per_second": 1081.107 }, { "epoch": 0.02965105767492316, "grad_norm": 0.31062689423561096, "learning_rate": 0.00017575959933222038, "loss": 1.214, "num_input_tokens_seen": 1026104, "step": 369, "train_runtime": 948.4748, "train_tokens_per_second": 1081.846 }, { "epoch": 0.029731412844773902, "grad_norm": 0.2866829037666321, "learning_rate": 0.00017569282136894825, "loss": 0.7996, "num_input_tokens_seen": 1029384, "step": 370, "train_runtime": 951.1018, "train_tokens_per_second": 1082.307 }, { "epoch": 0.02981176801462464, "grad_norm": 0.31888410449028015, "learning_rate": 0.00017562604340567615, "loss": 1.1984, "num_input_tokens_seen": 1033068, "step": 371, "train_runtime": 953.7773, "train_tokens_per_second": 1083.133 }, { "epoch": 0.029892123184475382, "grad_norm": 0.2944906949996948, "learning_rate": 0.00017555926544240402, "loss": 1.2214, "num_input_tokens_seen": 1035278, "step": 372, "train_runtime": 955.6776, "train_tokens_per_second": 1083.292 }, { "epoch": 0.02997247835432612, "grad_norm": 0.3593326508998871, "learning_rate": 0.0001754924874791319, "loss": 1.0988, "num_input_tokens_seen": 1038318, "step": 373, "train_runtime": 958.0543, "train_tokens_per_second": 1083.778 }, { "epoch": 0.030052833524176863, "grad_norm": 0.309621125459671, "learning_rate": 0.00017542570951585977, "loss": 0.9025, "num_input_tokens_seen": 1041572, "step": 374, "train_runtime": 960.4868, "train_tokens_per_second": 1084.421 }, { "epoch": 0.0301331886940276, "grad_norm": 0.2950892448425293, "learning_rate": 0.00017535893155258764, "loss": 1.1809, "num_input_tokens_seen": 1043442, "step": 375, "train_runtime": 962.2298, "train_tokens_per_second": 1084.4 }, { "epoch": 0.030213543863878343, "grad_norm": 0.3762933909893036, "learning_rate": 0.00017529215358931554, "loss": 0.98, "num_input_tokens_seen": 1045694, "step": 376, "train_runtime": 964.0901, "train_tokens_per_second": 1084.643 }, { "epoch": 0.03029389903372908, "grad_norm": 0.2948756515979767, "learning_rate": 0.00017522537562604342, "loss": 0.9154, "num_input_tokens_seen": 1049460, "step": 377, "train_runtime": 966.8047, "train_tokens_per_second": 1085.493 }, { "epoch": 0.030374254203579823, "grad_norm": 0.266676664352417, "learning_rate": 0.0001751585976627713, "loss": 1.0154, "num_input_tokens_seen": 1053400, "step": 378, "train_runtime": 969.5925, "train_tokens_per_second": 1086.436 }, { "epoch": 0.030454609373430565, "grad_norm": 0.271295428276062, "learning_rate": 0.00017509181969949916, "loss": 0.9774, "num_input_tokens_seen": 1056186, "step": 379, "train_runtime": 971.7497, "train_tokens_per_second": 1086.891 }, { "epoch": 0.030534964543281303, "grad_norm": 0.2567802369594574, "learning_rate": 0.00017502504173622704, "loss": 0.7366, "num_input_tokens_seen": 1058786, "step": 380, "train_runtime": 973.8713, "train_tokens_per_second": 1087.193 }, { "epoch": 0.030615319713132045, "grad_norm": 0.2612038850784302, "learning_rate": 0.0001749582637729549, "loss": 0.9533, "num_input_tokens_seen": 1061502, "step": 381, "train_runtime": 976.0026, "train_tokens_per_second": 1087.602 }, { "epoch": 0.030695674882982783, "grad_norm": 0.3431708514690399, "learning_rate": 0.0001748914858096828, "loss": 0.9277, "num_input_tokens_seen": 1063254, "step": 382, "train_runtime": 977.7576, "train_tokens_per_second": 1087.441 }, { "epoch": 0.030776030052833525, "grad_norm": 0.3861244320869446, "learning_rate": 0.0001748247078464107, "loss": 1.2894, "num_input_tokens_seen": 1066208, "step": 383, "train_runtime": 980.0461, "train_tokens_per_second": 1087.916 }, { "epoch": 0.030856385222684263, "grad_norm": 0.2675583064556122, "learning_rate": 0.00017475792988313858, "loss": 1.1537, "num_input_tokens_seen": 1069864, "step": 384, "train_runtime": 982.6449, "train_tokens_per_second": 1088.759 }, { "epoch": 0.030936740392535005, "grad_norm": 0.3754398226737976, "learning_rate": 0.00017469115191986646, "loss": 1.0408, "num_input_tokens_seen": 1072406, "step": 385, "train_runtime": 984.8168, "train_tokens_per_second": 1088.94 }, { "epoch": 0.031017095562385744, "grad_norm": 0.24042372405529022, "learning_rate": 0.00017462437395659433, "loss": 1.3946, "num_input_tokens_seen": 1075636, "step": 386, "train_runtime": 987.3118, "train_tokens_per_second": 1089.459 }, { "epoch": 0.031097450732236485, "grad_norm": 0.3622994124889374, "learning_rate": 0.00017455759599332223, "loss": 1.0261, "num_input_tokens_seen": 1078594, "step": 387, "train_runtime": 989.7139, "train_tokens_per_second": 1089.804 }, { "epoch": 0.031177805902087227, "grad_norm": 0.2808270752429962, "learning_rate": 0.0001744908180300501, "loss": 1.1029, "num_input_tokens_seen": 1080282, "step": 388, "train_runtime": 991.353, "train_tokens_per_second": 1089.705 }, { "epoch": 0.03125816107193797, "grad_norm": 0.2996695637702942, "learning_rate": 0.00017442404006677798, "loss": 1.0891, "num_input_tokens_seen": 1084780, "step": 389, "train_runtime": 994.6542, "train_tokens_per_second": 1090.61 }, { "epoch": 0.031338516241788704, "grad_norm": 0.28290489315986633, "learning_rate": 0.00017435726210350585, "loss": 0.9752, "num_input_tokens_seen": 1087136, "step": 390, "train_runtime": 996.5787, "train_tokens_per_second": 1090.868 }, { "epoch": 0.031418871411639446, "grad_norm": 0.36534032225608826, "learning_rate": 0.00017429048414023372, "loss": 1.2168, "num_input_tokens_seen": 1090300, "step": 391, "train_runtime": 1000.7808, "train_tokens_per_second": 1089.449 }, { "epoch": 0.03149922658149019, "grad_norm": 0.34648290276527405, "learning_rate": 0.00017422370617696162, "loss": 0.9941, "num_input_tokens_seen": 1092990, "step": 392, "train_runtime": 1002.9913, "train_tokens_per_second": 1089.73 }, { "epoch": 0.03157958175134093, "grad_norm": 0.3221375644207001, "learning_rate": 0.0001741569282136895, "loss": 0.9356, "num_input_tokens_seen": 1095638, "step": 393, "train_runtime": 1005.08, "train_tokens_per_second": 1090.1 }, { "epoch": 0.031659936921191664, "grad_norm": 0.2946549952030182, "learning_rate": 0.00017409015025041737, "loss": 1.0739, "num_input_tokens_seen": 1097618, "step": 394, "train_runtime": 1006.8478, "train_tokens_per_second": 1090.153 }, { "epoch": 0.031740292091042406, "grad_norm": 0.3398057222366333, "learning_rate": 0.00017402337228714524, "loss": 1.0839, "num_input_tokens_seen": 1098974, "step": 395, "train_runtime": 1008.3661, "train_tokens_per_second": 1089.856 }, { "epoch": 0.03182064726089315, "grad_norm": 0.28257885575294495, "learning_rate": 0.00017395659432387311, "loss": 1.1825, "num_input_tokens_seen": 1101014, "step": 396, "train_runtime": 1010.2335, "train_tokens_per_second": 1089.861 }, { "epoch": 0.03190100243074389, "grad_norm": 0.2921408712863922, "learning_rate": 0.00017388981636060101, "loss": 1.7143, "num_input_tokens_seen": 1106898, "step": 397, "train_runtime": 1014.1899, "train_tokens_per_second": 1091.411 }, { "epoch": 0.03198135760059463, "grad_norm": 0.3177490532398224, "learning_rate": 0.0001738230383973289, "loss": 1.1459, "num_input_tokens_seen": 1110030, "step": 398, "train_runtime": 1016.5793, "train_tokens_per_second": 1091.927 }, { "epoch": 0.032061712770445366, "grad_norm": 0.27498766779899597, "learning_rate": 0.00017375626043405676, "loss": 0.9801, "num_input_tokens_seen": 1112316, "step": 399, "train_runtime": 1018.5545, "train_tokens_per_second": 1092.054 }, { "epoch": 0.03214206794029611, "grad_norm": 0.2847306430339813, "learning_rate": 0.00017368948247078466, "loss": 0.9599, "num_input_tokens_seen": 1114706, "step": 400, "train_runtime": 1020.5936, "train_tokens_per_second": 1092.213 }, { "epoch": 0.03222242311014685, "grad_norm": 0.34009799361228943, "learning_rate": 0.00017362270450751253, "loss": 1.1011, "num_input_tokens_seen": 1120778, "step": 401, "train_runtime": 1024.7879, "train_tokens_per_second": 1093.668 }, { "epoch": 0.03230277827999759, "grad_norm": 0.35099753737449646, "learning_rate": 0.0001735559265442404, "loss": 1.3141, "num_input_tokens_seen": 1123376, "step": 402, "train_runtime": 1026.9283, "train_tokens_per_second": 1093.919 }, { "epoch": 0.03238313344984833, "grad_norm": 0.3260703384876251, "learning_rate": 0.0001734891485809683, "loss": 1.0699, "num_input_tokens_seen": 1125148, "step": 403, "train_runtime": 1028.5868, "train_tokens_per_second": 1093.878 }, { "epoch": 0.03246348861969907, "grad_norm": 0.29309403896331787, "learning_rate": 0.00017342237061769618, "loss": 1.0256, "num_input_tokens_seen": 1127176, "step": 404, "train_runtime": 1030.4677, "train_tokens_per_second": 1093.849 }, { "epoch": 0.03254384378954981, "grad_norm": 0.2610347270965576, "learning_rate": 0.00017335559265442405, "loss": 0.8452, "num_input_tokens_seen": 1131924, "step": 405, "train_runtime": 1033.8426, "train_tokens_per_second": 1094.871 }, { "epoch": 0.03262419895940055, "grad_norm": 0.3089810609817505, "learning_rate": 0.00017328881469115193, "loss": 0.9333, "num_input_tokens_seen": 1133338, "step": 406, "train_runtime": 1035.4445, "train_tokens_per_second": 1094.542 }, { "epoch": 0.032704554129251294, "grad_norm": 0.32210832834243774, "learning_rate": 0.0001732220367278798, "loss": 0.9726, "num_input_tokens_seen": 1136126, "step": 407, "train_runtime": 1037.6272, "train_tokens_per_second": 1094.927 }, { "epoch": 0.03278490929910203, "grad_norm": 0.3733350336551666, "learning_rate": 0.0001731552587646077, "loss": 1.0942, "num_input_tokens_seen": 1137842, "step": 408, "train_runtime": 1039.3386, "train_tokens_per_second": 1094.775 }, { "epoch": 0.03286526446895277, "grad_norm": 0.28001129627227783, "learning_rate": 0.00017308848080133557, "loss": 1.0348, "num_input_tokens_seen": 1141572, "step": 409, "train_runtime": 1042.0283, "train_tokens_per_second": 1095.529 }, { "epoch": 0.03294561963880351, "grad_norm": 0.27658599615097046, "learning_rate": 0.00017302170283806345, "loss": 0.8904, "num_input_tokens_seen": 1144452, "step": 410, "train_runtime": 1044.2155, "train_tokens_per_second": 1095.992 }, { "epoch": 0.033025974808654254, "grad_norm": 0.3635813891887665, "learning_rate": 0.00017295492487479132, "loss": 1.3809, "num_input_tokens_seen": 1148208, "step": 411, "train_runtime": 1047.0373, "train_tokens_per_second": 1096.626 }, { "epoch": 0.03310632997850499, "grad_norm": 0.3085966110229492, "learning_rate": 0.0001728881469115192, "loss": 0.9932, "num_input_tokens_seen": 1150816, "step": 412, "train_runtime": 1049.1355, "train_tokens_per_second": 1096.918 }, { "epoch": 0.03318668514835573, "grad_norm": 0.4016687870025635, "learning_rate": 0.0001728213689482471, "loss": 1.1162, "num_input_tokens_seen": 1153398, "step": 413, "train_runtime": 1051.2539, "train_tokens_per_second": 1097.164 }, { "epoch": 0.03326704031820647, "grad_norm": 0.3800343871116638, "learning_rate": 0.00017275459098497497, "loss": 1.2136, "num_input_tokens_seen": 1156048, "step": 414, "train_runtime": 1053.4026, "train_tokens_per_second": 1097.442 }, { "epoch": 0.033347395488057215, "grad_norm": 0.3973337411880493, "learning_rate": 0.00017268781302170284, "loss": 1.0981, "num_input_tokens_seen": 1158302, "step": 415, "train_runtime": 1055.3362, "train_tokens_per_second": 1097.567 }, { "epoch": 0.033427750657907956, "grad_norm": 0.3727961480617523, "learning_rate": 0.0001726210350584307, "loss": 1.3403, "num_input_tokens_seen": 1161096, "step": 416, "train_runtime": 1057.5223, "train_tokens_per_second": 1097.94 }, { "epoch": 0.03350810582775869, "grad_norm": 0.3895726203918457, "learning_rate": 0.0001725542570951586, "loss": 1.013, "num_input_tokens_seen": 1162742, "step": 417, "train_runtime": 1059.2234, "train_tokens_per_second": 1097.731 }, { "epoch": 0.03358846099760943, "grad_norm": 0.3150062561035156, "learning_rate": 0.0001724874791318865, "loss": 1.2591, "num_input_tokens_seen": 1165064, "step": 418, "train_runtime": 1061.1738, "train_tokens_per_second": 1097.901 }, { "epoch": 0.033668816167460175, "grad_norm": 0.3188002407550812, "learning_rate": 0.0001724207011686144, "loss": 1.1988, "num_input_tokens_seen": 1168084, "step": 419, "train_runtime": 1063.5283, "train_tokens_per_second": 1098.31 }, { "epoch": 0.03374917133731092, "grad_norm": 0.3131507933139801, "learning_rate": 0.00017235392320534226, "loss": 0.7852, "num_input_tokens_seen": 1171426, "step": 420, "train_runtime": 1066.1926, "train_tokens_per_second": 1098.7 }, { "epoch": 0.03382952650716165, "grad_norm": 0.2633776366710663, "learning_rate": 0.00017228714524207013, "loss": 0.9786, "num_input_tokens_seen": 1174218, "step": 421, "train_runtime": 1070.1204, "train_tokens_per_second": 1097.277 }, { "epoch": 0.03390988167701239, "grad_norm": 0.3124426305294037, "learning_rate": 0.000172220367278798, "loss": 0.9216, "num_input_tokens_seen": 1176310, "step": 422, "train_runtime": 1071.9478, "train_tokens_per_second": 1097.358 }, { "epoch": 0.033990236846863135, "grad_norm": 0.2875818908214569, "learning_rate": 0.00017215358931552588, "loss": 1.2885, "num_input_tokens_seen": 1178900, "step": 423, "train_runtime": 1074.1468, "train_tokens_per_second": 1097.522 }, { "epoch": 0.03407059201671388, "grad_norm": 0.3103838562965393, "learning_rate": 0.00017208681135225378, "loss": 1.1525, "num_input_tokens_seen": 1184014, "step": 424, "train_runtime": 1077.6489, "train_tokens_per_second": 1098.701 }, { "epoch": 0.03415094718656462, "grad_norm": 0.29413601756095886, "learning_rate": 0.00017202003338898165, "loss": 0.9123, "num_input_tokens_seen": 1186588, "step": 425, "train_runtime": 1079.6745, "train_tokens_per_second": 1099.024 }, { "epoch": 0.034231302356415354, "grad_norm": 0.3262699246406555, "learning_rate": 0.00017195325542570953, "loss": 0.7304, "num_input_tokens_seen": 1189358, "step": 426, "train_runtime": 1081.9085, "train_tokens_per_second": 1099.315 }, { "epoch": 0.034311657526266096, "grad_norm": 0.3086264431476593, "learning_rate": 0.0001718864774624374, "loss": 1.3913, "num_input_tokens_seen": 1192308, "step": 427, "train_runtime": 1084.2987, "train_tokens_per_second": 1099.612 }, { "epoch": 0.03439201269611684, "grad_norm": 0.31988200545310974, "learning_rate": 0.00017181969949916527, "loss": 0.9717, "num_input_tokens_seen": 1195212, "step": 428, "train_runtime": 1086.614, "train_tokens_per_second": 1099.942 }, { "epoch": 0.03447236786596758, "grad_norm": 0.3014238476753235, "learning_rate": 0.00017175292153589317, "loss": 1.1486, "num_input_tokens_seen": 1197536, "step": 429, "train_runtime": 1088.5881, "train_tokens_per_second": 1100.082 }, { "epoch": 0.034552723035818314, "grad_norm": 0.34671786427497864, "learning_rate": 0.00017168614357262105, "loss": 1.1268, "num_input_tokens_seen": 1199868, "step": 430, "train_runtime": 1090.5466, "train_tokens_per_second": 1100.245 }, { "epoch": 0.034633078205669056, "grad_norm": 0.2531111240386963, "learning_rate": 0.00017161936560934892, "loss": 0.8155, "num_input_tokens_seen": 1202948, "step": 431, "train_runtime": 1092.9097, "train_tokens_per_second": 1100.684 }, { "epoch": 0.0347134333755198, "grad_norm": 0.29365605115890503, "learning_rate": 0.0001715525876460768, "loss": 1.0678, "num_input_tokens_seen": 1206882, "step": 432, "train_runtime": 1095.7879, "train_tokens_per_second": 1101.383 }, { "epoch": 0.03479378854537054, "grad_norm": 0.3197197914123535, "learning_rate": 0.00017148580968280467, "loss": 1.0508, "num_input_tokens_seen": 1210226, "step": 433, "train_runtime": 1098.2378, "train_tokens_per_second": 1101.971 }, { "epoch": 0.03487414371522128, "grad_norm": 0.3036319613456726, "learning_rate": 0.00017141903171953257, "loss": 1.1495, "num_input_tokens_seen": 1213026, "step": 434, "train_runtime": 1100.4866, "train_tokens_per_second": 1102.263 }, { "epoch": 0.034954498885072016, "grad_norm": 0.276408851146698, "learning_rate": 0.00017135225375626044, "loss": 0.9933, "num_input_tokens_seen": 1216442, "step": 435, "train_runtime": 1103.0565, "train_tokens_per_second": 1102.792 }, { "epoch": 0.03503485405492276, "grad_norm": 0.3260977864265442, "learning_rate": 0.00017128547579298834, "loss": 1.1636, "num_input_tokens_seen": 1219046, "step": 436, "train_runtime": 1105.1811, "train_tokens_per_second": 1103.028 }, { "epoch": 0.0351152092247735, "grad_norm": 0.28073257207870483, "learning_rate": 0.0001712186978297162, "loss": 1.2499, "num_input_tokens_seen": 1221778, "step": 437, "train_runtime": 1107.3901, "train_tokens_per_second": 1103.295 }, { "epoch": 0.03519556439462424, "grad_norm": 0.30442941188812256, "learning_rate": 0.00017115191986644409, "loss": 1.2515, "num_input_tokens_seen": 1224002, "step": 438, "train_runtime": 1109.1972, "train_tokens_per_second": 1103.503 }, { "epoch": 0.035275919564474977, "grad_norm": 0.2952291667461395, "learning_rate": 0.00017108514190317196, "loss": 0.8443, "num_input_tokens_seen": 1225982, "step": 439, "train_runtime": 1110.9581, "train_tokens_per_second": 1103.536 }, { "epoch": 0.03535627473432572, "grad_norm": 0.25175273418426514, "learning_rate": 0.00017101836393989986, "loss": 0.9596, "num_input_tokens_seen": 1230048, "step": 440, "train_runtime": 1113.8367, "train_tokens_per_second": 1104.334 }, { "epoch": 0.03543662990417646, "grad_norm": 0.25086110830307007, "learning_rate": 0.00017095158597662773, "loss": 0.8363, "num_input_tokens_seen": 1232236, "step": 441, "train_runtime": 1115.7358, "train_tokens_per_second": 1104.416 }, { "epoch": 0.0355169850740272, "grad_norm": 0.26771441102027893, "learning_rate": 0.0001708848080133556, "loss": 0.7641, "num_input_tokens_seen": 1234444, "step": 442, "train_runtime": 1117.6826, "train_tokens_per_second": 1104.467 }, { "epoch": 0.035597340243877944, "grad_norm": 0.27989158034324646, "learning_rate": 0.00017081803005008348, "loss": 1.0552, "num_input_tokens_seen": 1237656, "step": 443, "train_runtime": 1120.1697, "train_tokens_per_second": 1104.883 }, { "epoch": 0.03567769541372868, "grad_norm": 0.2957555949687958, "learning_rate": 0.00017075125208681135, "loss": 1.1023, "num_input_tokens_seen": 1241284, "step": 444, "train_runtime": 1122.8789, "train_tokens_per_second": 1105.448 }, { "epoch": 0.03575805058357942, "grad_norm": 0.2737371027469635, "learning_rate": 0.00017068447412353925, "loss": 0.9989, "num_input_tokens_seen": 1242916, "step": 445, "train_runtime": 1124.5852, "train_tokens_per_second": 1105.222 }, { "epoch": 0.03583840575343016, "grad_norm": 0.3018834590911865, "learning_rate": 0.00017061769616026712, "loss": 0.8744, "num_input_tokens_seen": 1245290, "step": 446, "train_runtime": 1126.5345, "train_tokens_per_second": 1105.417 }, { "epoch": 0.035918760923280904, "grad_norm": 0.3098128139972687, "learning_rate": 0.000170550918196995, "loss": 0.9994, "num_input_tokens_seen": 1247416, "step": 447, "train_runtime": 1128.505, "train_tokens_per_second": 1105.37 }, { "epoch": 0.03599911609313164, "grad_norm": 0.2849488854408264, "learning_rate": 0.00017048414023372287, "loss": 1.3004, "num_input_tokens_seen": 1251064, "step": 448, "train_runtime": 1131.1497, "train_tokens_per_second": 1106.011 }, { "epoch": 0.03607947126298238, "grad_norm": 0.2536231577396393, "learning_rate": 0.00017041736227045074, "loss": 0.9552, "num_input_tokens_seen": 1254712, "step": 449, "train_runtime": 1133.8587, "train_tokens_per_second": 1106.586 }, { "epoch": 0.03615982643283312, "grad_norm": 0.3291691839694977, "learning_rate": 0.00017035058430717862, "loss": 1.2501, "num_input_tokens_seen": 1257184, "step": 450, "train_runtime": 1135.9122, "train_tokens_per_second": 1106.762 }, { "epoch": 0.036240181602683864, "grad_norm": 0.3126014173030853, "learning_rate": 0.00017028380634390652, "loss": 1.1347, "num_input_tokens_seen": 1259704, "step": 451, "train_runtime": 1139.7684, "train_tokens_per_second": 1105.228 }, { "epoch": 0.036320536772534606, "grad_norm": 0.2651938498020172, "learning_rate": 0.0001702170283806344, "loss": 0.8355, "num_input_tokens_seen": 1263596, "step": 452, "train_runtime": 1142.6277, "train_tokens_per_second": 1105.869 }, { "epoch": 0.03640089194238534, "grad_norm": 0.2972799241542816, "learning_rate": 0.0001701502504173623, "loss": 1.2333, "num_input_tokens_seen": 1265162, "step": 453, "train_runtime": 1144.2087, "train_tokens_per_second": 1105.709 }, { "epoch": 0.03648124711223608, "grad_norm": 0.3837432563304901, "learning_rate": 0.00017008347245409016, "loss": 1.1638, "num_input_tokens_seen": 1266794, "step": 454, "train_runtime": 1145.8047, "train_tokens_per_second": 1105.593 }, { "epoch": 0.036561602282086825, "grad_norm": 0.31418415904045105, "learning_rate": 0.00017001669449081804, "loss": 1.2247, "num_input_tokens_seen": 1270012, "step": 455, "train_runtime": 1148.2069, "train_tokens_per_second": 1106.083 }, { "epoch": 0.03664195745193757, "grad_norm": 0.2486877590417862, "learning_rate": 0.00016994991652754594, "loss": 0.9665, "num_input_tokens_seen": 1272992, "step": 456, "train_runtime": 1150.5529, "train_tokens_per_second": 1106.418 }, { "epoch": 0.0367223126217883, "grad_norm": 0.28888317942619324, "learning_rate": 0.0001698831385642738, "loss": 0.895, "num_input_tokens_seen": 1274966, "step": 457, "train_runtime": 1152.3425, "train_tokens_per_second": 1106.412 }, { "epoch": 0.03680266779163904, "grad_norm": 0.34526416659355164, "learning_rate": 0.00016981636060100168, "loss": 1.1872, "num_input_tokens_seen": 1276664, "step": 458, "train_runtime": 1154.0102, "train_tokens_per_second": 1106.285 }, { "epoch": 0.036883022961489785, "grad_norm": 0.3177397549152374, "learning_rate": 0.00016974958263772956, "loss": 0.8193, "num_input_tokens_seen": 1280068, "step": 459, "train_runtime": 1156.5444, "train_tokens_per_second": 1106.804 }, { "epoch": 0.03696337813134053, "grad_norm": 0.3397356867790222, "learning_rate": 0.00016968280467445743, "loss": 1.0335, "num_input_tokens_seen": 1282256, "step": 460, "train_runtime": 1158.471, "train_tokens_per_second": 1106.852 }, { "epoch": 0.03704373330119127, "grad_norm": 0.31023797392845154, "learning_rate": 0.00016961602671118533, "loss": 1.0502, "num_input_tokens_seen": 1285318, "step": 461, "train_runtime": 1160.9668, "train_tokens_per_second": 1107.11 }, { "epoch": 0.037124088471042004, "grad_norm": 0.28655844926834106, "learning_rate": 0.0001695492487479132, "loss": 0.9002, "num_input_tokens_seen": 1288374, "step": 462, "train_runtime": 1163.3335, "train_tokens_per_second": 1107.485 }, { "epoch": 0.037204443640892745, "grad_norm": 0.3392660617828369, "learning_rate": 0.00016948247078464108, "loss": 0.6588, "num_input_tokens_seen": 1290312, "step": 463, "train_runtime": 1165.1734, "train_tokens_per_second": 1107.399 }, { "epoch": 0.03728479881074349, "grad_norm": 0.2751123905181885, "learning_rate": 0.00016941569282136895, "loss": 0.7814, "num_input_tokens_seen": 1292578, "step": 464, "train_runtime": 1167.1163, "train_tokens_per_second": 1107.497 }, { "epoch": 0.03736515398059423, "grad_norm": 0.3018333315849304, "learning_rate": 0.00016934891485809682, "loss": 1.0923, "num_input_tokens_seen": 1294750, "step": 465, "train_runtime": 1169.0036, "train_tokens_per_second": 1107.567 }, { "epoch": 0.037445509150444964, "grad_norm": 0.34172528982162476, "learning_rate": 0.0001692821368948247, "loss": 1.1338, "num_input_tokens_seen": 1298036, "step": 466, "train_runtime": 1171.5677, "train_tokens_per_second": 1107.948 }, { "epoch": 0.037525864320295706, "grad_norm": 0.25886115431785583, "learning_rate": 0.0001692153589315526, "loss": 0.7873, "num_input_tokens_seen": 1300234, "step": 467, "train_runtime": 1173.4752, "train_tokens_per_second": 1108.02 }, { "epoch": 0.03760621949014645, "grad_norm": 0.2959878444671631, "learning_rate": 0.00016914858096828047, "loss": 0.891, "num_input_tokens_seen": 1302488, "step": 468, "train_runtime": 1175.4823, "train_tokens_per_second": 1108.046 }, { "epoch": 0.03768657465999719, "grad_norm": 0.3088524639606476, "learning_rate": 0.00016908180300500834, "loss": 1.0366, "num_input_tokens_seen": 1304818, "step": 469, "train_runtime": 1177.4553, "train_tokens_per_second": 1108.168 }, { "epoch": 0.03776692982984793, "grad_norm": 0.3135266602039337, "learning_rate": 0.00016901502504173624, "loss": 1.0494, "num_input_tokens_seen": 1307896, "step": 470, "train_runtime": 1179.8193, "train_tokens_per_second": 1108.556 }, { "epoch": 0.037847284999698666, "grad_norm": 0.2991373836994171, "learning_rate": 0.00016894824707846412, "loss": 1.2399, "num_input_tokens_seen": 1311892, "step": 471, "train_runtime": 1182.6972, "train_tokens_per_second": 1109.237 }, { "epoch": 0.03792764016954941, "grad_norm": 0.35278165340423584, "learning_rate": 0.00016888146911519202, "loss": 0.7783, "num_input_tokens_seen": 1314402, "step": 472, "train_runtime": 1184.7445, "train_tokens_per_second": 1109.439 }, { "epoch": 0.03800799533940015, "grad_norm": 0.2868156135082245, "learning_rate": 0.0001688146911519199, "loss": 1.238, "num_input_tokens_seen": 1317072, "step": 473, "train_runtime": 1186.826, "train_tokens_per_second": 1109.743 }, { "epoch": 0.03808835050925089, "grad_norm": 0.2835414707660675, "learning_rate": 0.00016874791318864776, "loss": 1.1234, "num_input_tokens_seen": 1320792, "step": 474, "train_runtime": 1189.6151, "train_tokens_per_second": 1110.268 }, { "epoch": 0.038168705679101626, "grad_norm": 0.32327404618263245, "learning_rate": 0.00016868113522537564, "loss": 0.9026, "num_input_tokens_seen": 1322676, "step": 475, "train_runtime": 1191.4105, "train_tokens_per_second": 1110.177 }, { "epoch": 0.03824906084895237, "grad_norm": 0.3147921562194824, "learning_rate": 0.0001686143572621035, "loss": 1.2454, "num_input_tokens_seen": 1325490, "step": 476, "train_runtime": 1193.6387, "train_tokens_per_second": 1110.462 }, { "epoch": 0.03832941601880311, "grad_norm": 0.3412136137485504, "learning_rate": 0.0001685475792988314, "loss": 0.9937, "num_input_tokens_seen": 1329268, "step": 477, "train_runtime": 1196.4157, "train_tokens_per_second": 1111.042 }, { "epoch": 0.03840977118865385, "grad_norm": 0.39507076144218445, "learning_rate": 0.00016848080133555928, "loss": 1.3339, "num_input_tokens_seen": 1331396, "step": 478, "train_runtime": 1198.2903, "train_tokens_per_second": 1111.08 }, { "epoch": 0.038490126358504594, "grad_norm": 0.3128511309623718, "learning_rate": 0.00016841402337228716, "loss": 1.3723, "num_input_tokens_seen": 1334386, "step": 479, "train_runtime": 1200.6237, "train_tokens_per_second": 1111.411 }, { "epoch": 0.03857048152835533, "grad_norm": 0.3059634268283844, "learning_rate": 0.00016834724540901503, "loss": 0.8782, "num_input_tokens_seen": 1337446, "step": 480, "train_runtime": 1202.9349, "train_tokens_per_second": 1111.819 }, { "epoch": 0.03865083669820607, "grad_norm": 0.3931996822357178, "learning_rate": 0.0001682804674457429, "loss": 0.8992, "num_input_tokens_seen": 1339258, "step": 481, "train_runtime": 1206.7839, "train_tokens_per_second": 1109.774 }, { "epoch": 0.03873119186805681, "grad_norm": 0.26833397150039673, "learning_rate": 0.00016821368948247077, "loss": 1.3182, "num_input_tokens_seen": 1342016, "step": 482, "train_runtime": 1208.9671, "train_tokens_per_second": 1110.052 }, { "epoch": 0.038811547037907554, "grad_norm": 0.283633828163147, "learning_rate": 0.00016814691151919868, "loss": 1.2343, "num_input_tokens_seen": 1345168, "step": 483, "train_runtime": 1211.3739, "train_tokens_per_second": 1110.448 }, { "epoch": 0.03889190220775829, "grad_norm": 0.24241532385349274, "learning_rate": 0.00016808013355592655, "loss": 0.6693, "num_input_tokens_seen": 1348988, "step": 484, "train_runtime": 1214.089, "train_tokens_per_second": 1111.111 }, { "epoch": 0.03897225737760903, "grad_norm": 0.30962204933166504, "learning_rate": 0.00016801335559265442, "loss": 0.794, "num_input_tokens_seen": 1351492, "step": 485, "train_runtime": 1216.1875, "train_tokens_per_second": 1111.253 }, { "epoch": 0.03905261254745977, "grad_norm": 0.3316614627838135, "learning_rate": 0.0001679465776293823, "loss": 1.1496, "num_input_tokens_seen": 1352990, "step": 486, "train_runtime": 1217.7667, "train_tokens_per_second": 1111.042 }, { "epoch": 0.039132967717310514, "grad_norm": 0.3337160050868988, "learning_rate": 0.0001678797996661102, "loss": 1.3319, "num_input_tokens_seen": 1355490, "step": 487, "train_runtime": 1219.8451, "train_tokens_per_second": 1111.199 }, { "epoch": 0.039213322887161256, "grad_norm": 0.33112165331840515, "learning_rate": 0.00016781302170283807, "loss": 1.2246, "num_input_tokens_seen": 1358564, "step": 488, "train_runtime": 1222.1597, "train_tokens_per_second": 1111.609 }, { "epoch": 0.03929367805701199, "grad_norm": 0.3269559442996979, "learning_rate": 0.00016774624373956597, "loss": 1.1281, "num_input_tokens_seen": 1361516, "step": 489, "train_runtime": 1224.4886, "train_tokens_per_second": 1111.906 }, { "epoch": 0.03937403322686273, "grad_norm": 0.31837156414985657, "learning_rate": 0.00016767946577629384, "loss": 1.0632, "num_input_tokens_seen": 1363794, "step": 490, "train_runtime": 1226.4391, "train_tokens_per_second": 1111.995 }, { "epoch": 0.039454388396713475, "grad_norm": 0.38089337944984436, "learning_rate": 0.00016761268781302171, "loss": 0.9146, "num_input_tokens_seen": 1366056, "step": 491, "train_runtime": 1228.3994, "train_tokens_per_second": 1112.062 }, { "epoch": 0.039534743566564216, "grad_norm": 0.42928919196128845, "learning_rate": 0.0001675459098497496, "loss": 0.9499, "num_input_tokens_seen": 1368594, "step": 492, "train_runtime": 1230.6799, "train_tokens_per_second": 1112.063 }, { "epoch": 0.03961509873641495, "grad_norm": 0.2621776759624481, "learning_rate": 0.0001674791318864775, "loss": 0.6951, "num_input_tokens_seen": 1372604, "step": 493, "train_runtime": 1233.5747, "train_tokens_per_second": 1112.704 }, { "epoch": 0.03969545390626569, "grad_norm": 0.40490996837615967, "learning_rate": 0.00016741235392320536, "loss": 1.3043, "num_input_tokens_seen": 1375610, "step": 494, "train_runtime": 1235.8826, "train_tokens_per_second": 1113.059 }, { "epoch": 0.039775809076116435, "grad_norm": 0.2883574962615967, "learning_rate": 0.00016734557595993323, "loss": 1.1695, "num_input_tokens_seen": 1378200, "step": 495, "train_runtime": 1237.9826, "train_tokens_per_second": 1113.263 }, { "epoch": 0.03985616424596718, "grad_norm": 0.36347633600234985, "learning_rate": 0.0001672787979966611, "loss": 1.1713, "num_input_tokens_seen": 1379932, "step": 496, "train_runtime": 1239.5904, "train_tokens_per_second": 1113.216 }, { "epoch": 0.03993651941581792, "grad_norm": 0.3250490725040436, "learning_rate": 0.00016721202003338898, "loss": 1.0827, "num_input_tokens_seen": 1381588, "step": 497, "train_runtime": 1241.2933, "train_tokens_per_second": 1113.023 }, { "epoch": 0.04001687458566865, "grad_norm": 0.31661948561668396, "learning_rate": 0.00016714524207011685, "loss": 0.9298, "num_input_tokens_seen": 1386302, "step": 498, "train_runtime": 1244.6013, "train_tokens_per_second": 1113.852 }, { "epoch": 0.040097229755519395, "grad_norm": 0.2635970711708069, "learning_rate": 0.00016707846410684475, "loss": 0.6909, "num_input_tokens_seen": 1388112, "step": 499, "train_runtime": 1246.2907, "train_tokens_per_second": 1113.795 }, { "epoch": 0.04017758492537014, "grad_norm": 0.285051554441452, "learning_rate": 0.00016701168614357263, "loss": 0.7754, "num_input_tokens_seen": 1391612, "step": 500, "train_runtime": 1248.9314, "train_tokens_per_second": 1114.242 }, { "epoch": 0.04025794009522088, "grad_norm": 0.3328403830528259, "learning_rate": 0.0001669449081803005, "loss": 1.4458, "num_input_tokens_seen": 1394868, "step": 501, "train_runtime": 1251.3154, "train_tokens_per_second": 1114.721 }, { "epoch": 0.040338295265071614, "grad_norm": 0.31206661462783813, "learning_rate": 0.00016687813021702837, "loss": 0.9529, "num_input_tokens_seen": 1397966, "step": 502, "train_runtime": 1253.7554, "train_tokens_per_second": 1115.023 }, { "epoch": 0.040418650434922355, "grad_norm": 0.3316718339920044, "learning_rate": 0.00016681135225375625, "loss": 1.2912, "num_input_tokens_seen": 1401884, "step": 503, "train_runtime": 1256.7215, "train_tokens_per_second": 1115.509 }, { "epoch": 0.0404990056047731, "grad_norm": 0.28495049476623535, "learning_rate": 0.00016674457429048415, "loss": 0.9016, "num_input_tokens_seen": 1404772, "step": 504, "train_runtime": 1258.8812, "train_tokens_per_second": 1115.889 }, { "epoch": 0.04057936077462384, "grad_norm": 0.30233266949653625, "learning_rate": 0.00016667779632721202, "loss": 1.0187, "num_input_tokens_seen": 1409318, "step": 505, "train_runtime": 1262.1301, "train_tokens_per_second": 1116.619 }, { "epoch": 0.04065971594447458, "grad_norm": 0.3341182768344879, "learning_rate": 0.00016661101836393992, "loss": 0.9593, "num_input_tokens_seen": 1412278, "step": 506, "train_runtime": 1264.4717, "train_tokens_per_second": 1116.892 }, { "epoch": 0.040740071114325316, "grad_norm": 0.28704357147216797, "learning_rate": 0.0001665442404006678, "loss": 1.001, "num_input_tokens_seen": 1415504, "step": 507, "train_runtime": 1266.8747, "train_tokens_per_second": 1117.32 }, { "epoch": 0.04082042628417606, "grad_norm": 0.26951321959495544, "learning_rate": 0.00016647746243739567, "loss": 0.9587, "num_input_tokens_seen": 1418684, "step": 508, "train_runtime": 1269.3245, "train_tokens_per_second": 1117.668 }, { "epoch": 0.0409007814540268, "grad_norm": 0.3407914936542511, "learning_rate": 0.00016641068447412357, "loss": 0.9534, "num_input_tokens_seen": 1421036, "step": 509, "train_runtime": 1271.3605, "train_tokens_per_second": 1117.729 }, { "epoch": 0.04098113662387754, "grad_norm": 0.33112484216690063, "learning_rate": 0.00016634390651085144, "loss": 0.8905, "num_input_tokens_seen": 1423300, "step": 510, "train_runtime": 1273.3026, "train_tokens_per_second": 1117.802 }, { "epoch": 0.041061491793728276, "grad_norm": 0.27271634340286255, "learning_rate": 0.0001662771285475793, "loss": 0.7882, "num_input_tokens_seen": 1426964, "step": 511, "train_runtime": 1278.2192, "train_tokens_per_second": 1116.369 }, { "epoch": 0.04114184696357902, "grad_norm": 0.2489190697669983, "learning_rate": 0.00016621035058430719, "loss": 0.7609, "num_input_tokens_seen": 1429752, "step": 512, "train_runtime": 1280.3282, "train_tokens_per_second": 1116.707 }, { "epoch": 0.04122220213342976, "grad_norm": 0.4314664602279663, "learning_rate": 0.00016614357262103506, "loss": 0.9647, "num_input_tokens_seen": 1432418, "step": 513, "train_runtime": 1282.5147, "train_tokens_per_second": 1116.882 }, { "epoch": 0.0413025573032805, "grad_norm": 0.37440216541290283, "learning_rate": 0.00016607679465776293, "loss": 1.3032, "num_input_tokens_seen": 1436178, "step": 514, "train_runtime": 1285.2827, "train_tokens_per_second": 1117.402 }, { "epoch": 0.04138291247313124, "grad_norm": 0.3475145697593689, "learning_rate": 0.00016601001669449083, "loss": 0.8235, "num_input_tokens_seen": 1438236, "step": 515, "train_runtime": 1287.0789, "train_tokens_per_second": 1117.442 }, { "epoch": 0.04146326764298198, "grad_norm": 0.29458504915237427, "learning_rate": 0.0001659432387312187, "loss": 1.0016, "num_input_tokens_seen": 1441264, "step": 516, "train_runtime": 1289.4622, "train_tokens_per_second": 1117.725 }, { "epoch": 0.04154362281283272, "grad_norm": 0.2998146414756775, "learning_rate": 0.00016587646076794658, "loss": 1.1158, "num_input_tokens_seen": 1444966, "step": 517, "train_runtime": 1292.2153, "train_tokens_per_second": 1118.208 }, { "epoch": 0.04162397798268346, "grad_norm": 0.3156857490539551, "learning_rate": 0.00016580968280467445, "loss": 0.9576, "num_input_tokens_seen": 1448814, "step": 518, "train_runtime": 1295.0533, "train_tokens_per_second": 1118.729 }, { "epoch": 0.041704333152534204, "grad_norm": 0.2988636791706085, "learning_rate": 0.00016574290484140233, "loss": 0.9327, "num_input_tokens_seen": 1452354, "step": 519, "train_runtime": 1297.6684, "train_tokens_per_second": 1119.203 }, { "epoch": 0.04178468832238494, "grad_norm": 0.29688844084739685, "learning_rate": 0.00016567612687813023, "loss": 1.2435, "num_input_tokens_seen": 1454658, "step": 520, "train_runtime": 1299.6956, "train_tokens_per_second": 1119.23 }, { "epoch": 0.04186504349223568, "grad_norm": 0.32755959033966064, "learning_rate": 0.0001656093489148581, "loss": 0.9829, "num_input_tokens_seen": 1456450, "step": 521, "train_runtime": 1301.4736, "train_tokens_per_second": 1119.078 }, { "epoch": 0.04194539866208642, "grad_norm": 0.33042067289352417, "learning_rate": 0.00016554257095158597, "loss": 1.1854, "num_input_tokens_seen": 1459110, "step": 522, "train_runtime": 1303.6084, "train_tokens_per_second": 1119.285 }, { "epoch": 0.042025753831937164, "grad_norm": 0.24316900968551636, "learning_rate": 0.00016547579298831387, "loss": 1.0388, "num_input_tokens_seen": 1461406, "step": 523, "train_runtime": 1305.4827, "train_tokens_per_second": 1119.437 }, { "epoch": 0.042106109001787906, "grad_norm": 0.2608068883419037, "learning_rate": 0.00016540901502504175, "loss": 0.797, "num_input_tokens_seen": 1463864, "step": 524, "train_runtime": 1307.4925, "train_tokens_per_second": 1119.596 }, { "epoch": 0.04218646417163864, "grad_norm": 0.2739805281162262, "learning_rate": 0.00016534223706176965, "loss": 0.9095, "num_input_tokens_seen": 1466956, "step": 525, "train_runtime": 1309.8869, "train_tokens_per_second": 1119.91 }, { "epoch": 0.04226681934148938, "grad_norm": 0.29957881569862366, "learning_rate": 0.00016527545909849752, "loss": 0.9904, "num_input_tokens_seen": 1470008, "step": 526, "train_runtime": 1312.2745, "train_tokens_per_second": 1120.199 }, { "epoch": 0.042347174511340124, "grad_norm": 0.31610366702079773, "learning_rate": 0.0001652086811352254, "loss": 1.329, "num_input_tokens_seen": 1471884, "step": 527, "train_runtime": 1313.9712, "train_tokens_per_second": 1120.18 }, { "epoch": 0.042427529681190866, "grad_norm": 0.2806980609893799, "learning_rate": 0.00016514190317195327, "loss": 0.8342, "num_input_tokens_seen": 1473638, "step": 528, "train_runtime": 1315.6966, "train_tokens_per_second": 1120.044 }, { "epoch": 0.0425078848510416, "grad_norm": 0.34865710139274597, "learning_rate": 0.00016507512520868114, "loss": 1.0074, "num_input_tokens_seen": 1477422, "step": 529, "train_runtime": 1318.4171, "train_tokens_per_second": 1120.603 }, { "epoch": 0.04258824002089234, "grad_norm": 0.29557326436042786, "learning_rate": 0.00016500834724540904, "loss": 1.0376, "num_input_tokens_seen": 1480596, "step": 530, "train_runtime": 1320.7853, "train_tokens_per_second": 1120.997 }, { "epoch": 0.042668595190743085, "grad_norm": 0.31514546275138855, "learning_rate": 0.0001649415692821369, "loss": 0.7571, "num_input_tokens_seen": 1484062, "step": 531, "train_runtime": 1323.5221, "train_tokens_per_second": 1121.297 }, { "epoch": 0.042748950360593826, "grad_norm": 0.3336114287376404, "learning_rate": 0.00016487479131886478, "loss": 1.2614, "num_input_tokens_seen": 1489870, "step": 532, "train_runtime": 1327.4899, "train_tokens_per_second": 1122.321 }, { "epoch": 0.04282930553044457, "grad_norm": 0.34417012333869934, "learning_rate": 0.00016480801335559266, "loss": 1.4205, "num_input_tokens_seen": 1492616, "step": 533, "train_runtime": 1329.7479, "train_tokens_per_second": 1122.48 }, { "epoch": 0.0429096607002953, "grad_norm": 0.34672799706459045, "learning_rate": 0.00016474123539232053, "loss": 1.0132, "num_input_tokens_seen": 1496298, "step": 534, "train_runtime": 1332.4516, "train_tokens_per_second": 1122.966 }, { "epoch": 0.042990015870146045, "grad_norm": 0.3274341821670532, "learning_rate": 0.0001646744574290484, "loss": 0.9711, "num_input_tokens_seen": 1498178, "step": 535, "train_runtime": 1334.293, "train_tokens_per_second": 1122.825 }, { "epoch": 0.04307037103999679, "grad_norm": 0.31558096408843994, "learning_rate": 0.0001646076794657763, "loss": 1.1928, "num_input_tokens_seen": 1500716, "step": 536, "train_runtime": 1336.2966, "train_tokens_per_second": 1123.041 }, { "epoch": 0.04315072620984753, "grad_norm": 0.2852008044719696, "learning_rate": 0.00016454090150250418, "loss": 0.9901, "num_input_tokens_seen": 1503318, "step": 537, "train_runtime": 1338.4725, "train_tokens_per_second": 1123.159 }, { "epoch": 0.043231081379698263, "grad_norm": 0.26600342988967896, "learning_rate": 0.00016447412353923205, "loss": 0.9885, "num_input_tokens_seen": 1506788, "step": 538, "train_runtime": 1341.1218, "train_tokens_per_second": 1123.528 }, { "epoch": 0.043311436549549005, "grad_norm": 0.257356196641922, "learning_rate": 0.00016440734557595992, "loss": 0.6195, "num_input_tokens_seen": 1508954, "step": 539, "train_runtime": 1342.9701, "train_tokens_per_second": 1123.595 }, { "epoch": 0.04339179171939975, "grad_norm": 0.36241650581359863, "learning_rate": 0.00016434056761268782, "loss": 0.8107, "num_input_tokens_seen": 1514520, "step": 540, "train_runtime": 1346.8254, "train_tokens_per_second": 1124.511 }, { "epoch": 0.04347214688925049, "grad_norm": 0.30938225984573364, "learning_rate": 0.0001642737896494157, "loss": 0.9419, "num_input_tokens_seen": 1517146, "step": 541, "train_runtime": 1351.0155, "train_tokens_per_second": 1122.967 }, { "epoch": 0.04355250205910123, "grad_norm": 0.30551084876060486, "learning_rate": 0.0001642070116861436, "loss": 0.7459, "num_input_tokens_seen": 1518960, "step": 542, "train_runtime": 1352.7273, "train_tokens_per_second": 1122.887 }, { "epoch": 0.043632857228951966, "grad_norm": 0.3435930013656616, "learning_rate": 0.00016414023372287147, "loss": 0.8315, "num_input_tokens_seen": 1521962, "step": 543, "train_runtime": 1355.0508, "train_tokens_per_second": 1123.177 }, { "epoch": 0.04371321239880271, "grad_norm": 0.3326947093009949, "learning_rate": 0.00016407345575959934, "loss": 1.3582, "num_input_tokens_seen": 1524492, "step": 544, "train_runtime": 1357.1273, "train_tokens_per_second": 1123.323 }, { "epoch": 0.04379356756865345, "grad_norm": 0.2878602147102356, "learning_rate": 0.00016400667779632722, "loss": 1.0477, "num_input_tokens_seen": 1526732, "step": 545, "train_runtime": 1359.0122, "train_tokens_per_second": 1123.413 }, { "epoch": 0.04387392273850419, "grad_norm": 0.35480237007141113, "learning_rate": 0.00016393989983305512, "loss": 0.922, "num_input_tokens_seen": 1528872, "step": 546, "train_runtime": 1360.8368, "train_tokens_per_second": 1123.479 }, { "epoch": 0.043954277908354926, "grad_norm": 0.40055155754089355, "learning_rate": 0.000163873121869783, "loss": 1.1884, "num_input_tokens_seen": 1531854, "step": 547, "train_runtime": 1363.1985, "train_tokens_per_second": 1123.72 }, { "epoch": 0.04403463307820567, "grad_norm": 0.2950405776500702, "learning_rate": 0.00016380634390651086, "loss": 1.0828, "num_input_tokens_seen": 1534416, "step": 548, "train_runtime": 1365.2619, "train_tokens_per_second": 1123.899 }, { "epoch": 0.04411498824805641, "grad_norm": 0.3034539520740509, "learning_rate": 0.00016373956594323874, "loss": 1.0698, "num_input_tokens_seen": 1538264, "step": 549, "train_runtime": 1368.0231, "train_tokens_per_second": 1124.443 }, { "epoch": 0.04419534341790715, "grad_norm": 0.3034869432449341, "learning_rate": 0.0001636727879799666, "loss": 0.8759, "num_input_tokens_seen": 1542434, "step": 550, "train_runtime": 1371.052, "train_tokens_per_second": 1125.0 }, { "epoch": 0.04427569858775789, "grad_norm": 0.4061206579208374, "learning_rate": 0.00016360601001669448, "loss": 1.0151, "num_input_tokens_seen": 1543824, "step": 551, "train_runtime": 1372.6307, "train_tokens_per_second": 1124.719 }, { "epoch": 0.04435605375760863, "grad_norm": 0.26810020208358765, "learning_rate": 0.00016353923205342238, "loss": 0.7532, "num_input_tokens_seen": 1546394, "step": 552, "train_runtime": 1374.7568, "train_tokens_per_second": 1124.849 }, { "epoch": 0.04443640892745937, "grad_norm": 0.3383218050003052, "learning_rate": 0.00016347245409015026, "loss": 0.9789, "num_input_tokens_seen": 1548030, "step": 553, "train_runtime": 1376.5011, "train_tokens_per_second": 1124.612 }, { "epoch": 0.04451676409731011, "grad_norm": 0.5009167194366455, "learning_rate": 0.00016340567612687813, "loss": 1.1864, "num_input_tokens_seen": 1549794, "step": 554, "train_runtime": 1378.2539, "train_tokens_per_second": 1124.462 }, { "epoch": 0.044597119267160854, "grad_norm": 0.3085728585720062, "learning_rate": 0.000163338898163606, "loss": 0.8579, "num_input_tokens_seen": 1552074, "step": 555, "train_runtime": 1380.2922, "train_tokens_per_second": 1124.453 }, { "epoch": 0.04467747443701159, "grad_norm": 0.2872931659221649, "learning_rate": 0.00016327212020033388, "loss": 0.9283, "num_input_tokens_seen": 1556052, "step": 556, "train_runtime": 1383.1055, "train_tokens_per_second": 1125.042 }, { "epoch": 0.04475782960686233, "grad_norm": 0.33563920855522156, "learning_rate": 0.00016320534223706178, "loss": 0.9859, "num_input_tokens_seen": 1558014, "step": 557, "train_runtime": 1384.9456, "train_tokens_per_second": 1124.964 }, { "epoch": 0.04483818477671307, "grad_norm": 0.30859917402267456, "learning_rate": 0.00016313856427378965, "loss": 1.0199, "num_input_tokens_seen": 1559734, "step": 558, "train_runtime": 1386.5523, "train_tokens_per_second": 1124.901 }, { "epoch": 0.044918539946563814, "grad_norm": 0.40110355615615845, "learning_rate": 0.00016307178631051755, "loss": 1.0607, "num_input_tokens_seen": 1562466, "step": 559, "train_runtime": 1388.7789, "train_tokens_per_second": 1125.065 }, { "epoch": 0.044998895116414556, "grad_norm": 0.5635671615600586, "learning_rate": 0.00016300500834724542, "loss": 1.2245, "num_input_tokens_seen": 1564642, "step": 560, "train_runtime": 1390.6863, "train_tokens_per_second": 1125.086 }, { "epoch": 0.04507925028626529, "grad_norm": 0.4702927768230438, "learning_rate": 0.0001629382303839733, "loss": 0.7973, "num_input_tokens_seen": 1567322, "step": 561, "train_runtime": 1392.774, "train_tokens_per_second": 1125.324 }, { "epoch": 0.04515960545611603, "grad_norm": 0.3103383481502533, "learning_rate": 0.0001628714524207012, "loss": 1.0033, "num_input_tokens_seen": 1570110, "step": 562, "train_runtime": 1394.8792, "train_tokens_per_second": 1125.624 }, { "epoch": 0.045239960625966774, "grad_norm": 0.37203335762023926, "learning_rate": 0.00016280467445742907, "loss": 0.924, "num_input_tokens_seen": 1571484, "step": 563, "train_runtime": 1396.4245, "train_tokens_per_second": 1125.363 }, { "epoch": 0.045320315795817516, "grad_norm": 0.276150643825531, "learning_rate": 0.00016273789649415694, "loss": 0.9249, "num_input_tokens_seen": 1573506, "step": 564, "train_runtime": 1398.1345, "train_tokens_per_second": 1125.433 }, { "epoch": 0.04540067096566825, "grad_norm": 0.3232124149799347, "learning_rate": 0.00016267111853088482, "loss": 1.3818, "num_input_tokens_seen": 1576608, "step": 565, "train_runtime": 1400.5972, "train_tokens_per_second": 1125.668 }, { "epoch": 0.04548102613551899, "grad_norm": 0.3408963680267334, "learning_rate": 0.0001626043405676127, "loss": 1.213, "num_input_tokens_seen": 1578858, "step": 566, "train_runtime": 1402.6764, "train_tokens_per_second": 1125.604 }, { "epoch": 0.045561381305369734, "grad_norm": 0.26941266655921936, "learning_rate": 0.00016253756260434056, "loss": 0.9142, "num_input_tokens_seen": 1581898, "step": 567, "train_runtime": 1404.953, "train_tokens_per_second": 1125.944 }, { "epoch": 0.045641736475220476, "grad_norm": 0.2751913070678711, "learning_rate": 0.00016247078464106846, "loss": 0.5027, "num_input_tokens_seen": 1583358, "step": 568, "train_runtime": 1406.5934, "train_tokens_per_second": 1125.669 }, { "epoch": 0.04572209164507122, "grad_norm": 0.25977325439453125, "learning_rate": 0.00016240400667779634, "loss": 0.57, "num_input_tokens_seen": 1586514, "step": 569, "train_runtime": 1409.088, "train_tokens_per_second": 1125.916 }, { "epoch": 0.04580244681492195, "grad_norm": 0.28802600502967834, "learning_rate": 0.0001623372287145242, "loss": 0.9104, "num_input_tokens_seen": 1588972, "step": 570, "train_runtime": 1411.0445, "train_tokens_per_second": 1126.096 }, { "epoch": 0.045882801984772695, "grad_norm": 0.334716796875, "learning_rate": 0.00016227045075125208, "loss": 1.2295, "num_input_tokens_seen": 1592682, "step": 571, "train_runtime": 1415.8663, "train_tokens_per_second": 1124.882 }, { "epoch": 0.04596315715462344, "grad_norm": 0.35369017720222473, "learning_rate": 0.00016220367278797996, "loss": 0.9268, "num_input_tokens_seen": 1594704, "step": 572, "train_runtime": 1417.7121, "train_tokens_per_second": 1124.843 }, { "epoch": 0.04604351232447418, "grad_norm": 0.30256491899490356, "learning_rate": 0.00016213689482470786, "loss": 0.8199, "num_input_tokens_seen": 1597136, "step": 573, "train_runtime": 1419.6891, "train_tokens_per_second": 1124.99 }, { "epoch": 0.04612386749432491, "grad_norm": 0.45038849115371704, "learning_rate": 0.00016207011686143573, "loss": 0.7788, "num_input_tokens_seen": 1599230, "step": 574, "train_runtime": 1421.5377, "train_tokens_per_second": 1125.0 }, { "epoch": 0.046204222664175655, "grad_norm": 0.30017659068107605, "learning_rate": 0.0001620033388981636, "loss": 1.1283, "num_input_tokens_seen": 1601638, "step": 575, "train_runtime": 1423.5342, "train_tokens_per_second": 1125.114 }, { "epoch": 0.0462845778340264, "grad_norm": 0.3505881726741791, "learning_rate": 0.0001619365609348915, "loss": 1.1406, "num_input_tokens_seen": 1605180, "step": 576, "train_runtime": 1426.2371, "train_tokens_per_second": 1125.465 }, { "epoch": 0.04636493300387714, "grad_norm": 0.2925964295864105, "learning_rate": 0.00016186978297161938, "loss": 0.921, "num_input_tokens_seen": 1607854, "step": 577, "train_runtime": 1428.5118, "train_tokens_per_second": 1125.545 }, { "epoch": 0.04644528817372788, "grad_norm": 0.27441343665122986, "learning_rate": 0.00016180300500834728, "loss": 0.9909, "num_input_tokens_seen": 1609836, "step": 578, "train_runtime": 1430.3275, "train_tokens_per_second": 1125.502 }, { "epoch": 0.046525643343578615, "grad_norm": 0.3009042739868164, "learning_rate": 0.00016173622704507515, "loss": 0.9685, "num_input_tokens_seen": 1612046, "step": 579, "train_runtime": 1432.1628, "train_tokens_per_second": 1125.602 }, { "epoch": 0.04660599851342936, "grad_norm": 0.2828468382358551, "learning_rate": 0.00016166944908180302, "loss": 1.087, "num_input_tokens_seen": 1617292, "step": 580, "train_runtime": 1435.8583, "train_tokens_per_second": 1126.359 }, { "epoch": 0.0466863536832801, "grad_norm": 0.21674178540706635, "learning_rate": 0.0001616026711185309, "loss": 0.5879, "num_input_tokens_seen": 1621710, "step": 581, "train_runtime": 1438.8474, "train_tokens_per_second": 1127.09 }, { "epoch": 0.04676670885313084, "grad_norm": 0.37525784969329834, "learning_rate": 0.00016153589315525877, "loss": 0.8292, "num_input_tokens_seen": 1625344, "step": 582, "train_runtime": 1441.5424, "train_tokens_per_second": 1127.503 }, { "epoch": 0.046847064022981576, "grad_norm": 0.3150649666786194, "learning_rate": 0.00016146911519198664, "loss": 1.2162, "num_input_tokens_seen": 1628084, "step": 583, "train_runtime": 1443.7235, "train_tokens_per_second": 1127.698 }, { "epoch": 0.04692741919283232, "grad_norm": 0.29897260665893555, "learning_rate": 0.00016140233722871454, "loss": 1.0659, "num_input_tokens_seen": 1630780, "step": 584, "train_runtime": 1445.8491, "train_tokens_per_second": 1127.905 }, { "epoch": 0.04700777436268306, "grad_norm": 0.27850741147994995, "learning_rate": 0.00016133555926544241, "loss": 1.1754, "num_input_tokens_seen": 1633554, "step": 585, "train_runtime": 1448.0572, "train_tokens_per_second": 1128.1 }, { "epoch": 0.0470881295325338, "grad_norm": 0.3504570424556732, "learning_rate": 0.0001612687813021703, "loss": 0.9959, "num_input_tokens_seen": 1635914, "step": 586, "train_runtime": 1450.1219, "train_tokens_per_second": 1128.122 }, { "epoch": 0.04716848470238454, "grad_norm": 0.29737618565559387, "learning_rate": 0.00016120200333889816, "loss": 1.1948, "num_input_tokens_seen": 1638884, "step": 587, "train_runtime": 1452.4476, "train_tokens_per_second": 1128.36 }, { "epoch": 0.04724883987223528, "grad_norm": 0.3277566134929657, "learning_rate": 0.00016113522537562603, "loss": 1.3117, "num_input_tokens_seen": 1642050, "step": 588, "train_runtime": 1454.8081, "train_tokens_per_second": 1128.706 }, { "epoch": 0.04732919504208602, "grad_norm": 0.34753653407096863, "learning_rate": 0.00016106844741235393, "loss": 1.056, "num_input_tokens_seen": 1643628, "step": 589, "train_runtime": 1456.4866, "train_tokens_per_second": 1128.488 }, { "epoch": 0.04740955021193676, "grad_norm": 0.2398485243320465, "learning_rate": 0.0001610016694490818, "loss": 0.6869, "num_input_tokens_seen": 1645652, "step": 590, "train_runtime": 1458.3916, "train_tokens_per_second": 1128.402 }, { "epoch": 0.0474899053817875, "grad_norm": 0.26019415259361267, "learning_rate": 0.00016093489148580968, "loss": 0.7328, "num_input_tokens_seen": 1648080, "step": 591, "train_runtime": 1460.4683, "train_tokens_per_second": 1128.46 }, { "epoch": 0.04757026055163824, "grad_norm": 0.269775927066803, "learning_rate": 0.00016086811352253755, "loss": 0.9202, "num_input_tokens_seen": 1650988, "step": 592, "train_runtime": 1462.6425, "train_tokens_per_second": 1128.771 }, { "epoch": 0.04765061572148898, "grad_norm": 0.2770116627216339, "learning_rate": 0.00016080133555926545, "loss": 0.8383, "num_input_tokens_seen": 1653452, "step": 593, "train_runtime": 1464.6359, "train_tokens_per_second": 1128.917 }, { "epoch": 0.04773097089133972, "grad_norm": 0.36373430490493774, "learning_rate": 0.00016073455759599333, "loss": 0.8562, "num_input_tokens_seen": 1655594, "step": 594, "train_runtime": 1466.5373, "train_tokens_per_second": 1128.914 }, { "epoch": 0.047811326061190464, "grad_norm": 0.28949663043022156, "learning_rate": 0.00016066777963272123, "loss": 1.1579, "num_input_tokens_seen": 1657722, "step": 595, "train_runtime": 1468.3706, "train_tokens_per_second": 1128.953 }, { "epoch": 0.047891681231041205, "grad_norm": 0.30830082297325134, "learning_rate": 0.0001606010016694491, "loss": 1.1471, "num_input_tokens_seen": 1659910, "step": 596, "train_runtime": 1470.3253, "train_tokens_per_second": 1128.941 }, { "epoch": 0.04797203640089194, "grad_norm": 0.347534716129303, "learning_rate": 0.00016053422370617697, "loss": 1.2735, "num_input_tokens_seen": 1663292, "step": 597, "train_runtime": 1472.8028, "train_tokens_per_second": 1129.338 }, { "epoch": 0.04805239157074268, "grad_norm": 0.4051826298236847, "learning_rate": 0.00016046744574290485, "loss": 0.7937, "num_input_tokens_seen": 1665434, "step": 598, "train_runtime": 1474.6824, "train_tokens_per_second": 1129.351 }, { "epoch": 0.048132746740593424, "grad_norm": 0.28954237699508667, "learning_rate": 0.00016040066777963272, "loss": 0.8046, "num_input_tokens_seen": 1668146, "step": 599, "train_runtime": 1476.8764, "train_tokens_per_second": 1129.51 }, { "epoch": 0.048213101910444166, "grad_norm": 0.31506192684173584, "learning_rate": 0.00016033388981636062, "loss": 0.9025, "num_input_tokens_seen": 1669976, "step": 600, "train_runtime": 1478.5583, "train_tokens_per_second": 1129.462 }, { "epoch": 0.048213101910444166, "eval_loss": 1.0045510530471802, "eval_runtime": 92.4855, "eval_samples_per_second": 10.748, "eval_steps_per_second": 5.374, "num_input_tokens_seen": 1669976, "step": 600 }, { "epoch": 0.0482934570802949, "grad_norm": 0.2952899634838104, "learning_rate": 0.0001602671118530885, "loss": 0.9183, "num_input_tokens_seen": 1672228, "step": 601, "train_runtime": 1575.0426, "train_tokens_per_second": 1061.703 }, { "epoch": 0.04837381225014564, "grad_norm": 0.37234246730804443, "learning_rate": 0.00016020033388981637, "loss": 1.015, "num_input_tokens_seen": 1675632, "step": 602, "train_runtime": 1577.6241, "train_tokens_per_second": 1062.124 }, { "epoch": 0.048454167419996384, "grad_norm": 0.3364265561103821, "learning_rate": 0.00016013355592654424, "loss": 0.8864, "num_input_tokens_seen": 1679108, "step": 603, "train_runtime": 1580.2599, "train_tokens_per_second": 1062.552 }, { "epoch": 0.048534522589847126, "grad_norm": 0.25584179162979126, "learning_rate": 0.0001600667779632721, "loss": 0.8234, "num_input_tokens_seen": 1682176, "step": 604, "train_runtime": 1582.6328, "train_tokens_per_second": 1062.897 }, { "epoch": 0.04861487775969787, "grad_norm": 0.2942083775997162, "learning_rate": 0.00016, "loss": 0.8421, "num_input_tokens_seen": 1685508, "step": 605, "train_runtime": 1585.0741, "train_tokens_per_second": 1063.362 }, { "epoch": 0.0486952329295486, "grad_norm": 0.32731980085372925, "learning_rate": 0.00015993322203672789, "loss": 0.8268, "num_input_tokens_seen": 1687128, "step": 606, "train_runtime": 1586.6616, "train_tokens_per_second": 1063.319 }, { "epoch": 0.048775588099399345, "grad_norm": 0.3258304297924042, "learning_rate": 0.00015986644407345576, "loss": 0.993, "num_input_tokens_seen": 1689832, "step": 607, "train_runtime": 1588.8773, "train_tokens_per_second": 1063.538 }, { "epoch": 0.048855943269250086, "grad_norm": 0.39065971970558167, "learning_rate": 0.00015979966611018363, "loss": 1.0378, "num_input_tokens_seen": 1692632, "step": 608, "train_runtime": 1591.0951, "train_tokens_per_second": 1063.816 }, { "epoch": 0.04893629843910083, "grad_norm": 0.30499234795570374, "learning_rate": 0.0001597328881469115, "loss": 0.9139, "num_input_tokens_seen": 1694372, "step": 609, "train_runtime": 1592.7801, "train_tokens_per_second": 1063.783 }, { "epoch": 0.04901665360895156, "grad_norm": 0.29981762170791626, "learning_rate": 0.0001596661101836394, "loss": 0.8803, "num_input_tokens_seen": 1696954, "step": 610, "train_runtime": 1594.8667, "train_tokens_per_second": 1064.01 }, { "epoch": 0.049097008778802305, "grad_norm": 0.27179670333862305, "learning_rate": 0.00015959933222036728, "loss": 0.7833, "num_input_tokens_seen": 1700184, "step": 611, "train_runtime": 1597.3495, "train_tokens_per_second": 1064.378 }, { "epoch": 0.04917736394865305, "grad_norm": 0.2974316477775574, "learning_rate": 0.00015953255425709518, "loss": 0.7587, "num_input_tokens_seen": 1703114, "step": 612, "train_runtime": 1599.7017, "train_tokens_per_second": 1064.645 }, { "epoch": 0.04925771911850379, "grad_norm": 0.29061052203178406, "learning_rate": 0.00015946577629382305, "loss": 1.0839, "num_input_tokens_seen": 1706324, "step": 613, "train_runtime": 1602.0616, "train_tokens_per_second": 1065.08 }, { "epoch": 0.04933807428835453, "grad_norm": 0.31000691652297974, "learning_rate": 0.00015939899833055093, "loss": 1.1214, "num_input_tokens_seen": 1707674, "step": 614, "train_runtime": 1603.6048, "train_tokens_per_second": 1064.897 }, { "epoch": 0.049418429458205265, "grad_norm": 0.30445772409439087, "learning_rate": 0.0001593322203672788, "loss": 1.2307, "num_input_tokens_seen": 1709922, "step": 615, "train_runtime": 1605.5598, "train_tokens_per_second": 1065.0 }, { "epoch": 0.04949878462805601, "grad_norm": 0.3193359971046448, "learning_rate": 0.0001592654424040067, "loss": 0.8299, "num_input_tokens_seen": 1712346, "step": 616, "train_runtime": 1607.5376, "train_tokens_per_second": 1065.198 }, { "epoch": 0.04957913979790675, "grad_norm": 0.33989283442497253, "learning_rate": 0.00015919866444073457, "loss": 1.0256, "num_input_tokens_seen": 1714932, "step": 617, "train_runtime": 1609.6151, "train_tokens_per_second": 1065.43 }, { "epoch": 0.04965949496775749, "grad_norm": 0.2855062186717987, "learning_rate": 0.00015913188647746245, "loss": 1.0201, "num_input_tokens_seen": 1716728, "step": 618, "train_runtime": 1611.4335, "train_tokens_per_second": 1065.342 }, { "epoch": 0.049739850137608226, "grad_norm": 0.30604907870292664, "learning_rate": 0.00015906510851419032, "loss": 1.2372, "num_input_tokens_seen": 1720144, "step": 619, "train_runtime": 1613.9733, "train_tokens_per_second": 1065.782 }, { "epoch": 0.04982020530745897, "grad_norm": 0.28403913974761963, "learning_rate": 0.0001589983305509182, "loss": 0.9487, "num_input_tokens_seen": 1723338, "step": 620, "train_runtime": 1616.3836, "train_tokens_per_second": 1066.169 }, { "epoch": 0.04990056047730971, "grad_norm": 0.298054963350296, "learning_rate": 0.0001589315525876461, "loss": 1.1147, "num_input_tokens_seen": 1725456, "step": 621, "train_runtime": 1618.2846, "train_tokens_per_second": 1066.225 }, { "epoch": 0.04998091564716045, "grad_norm": 0.3101802468299866, "learning_rate": 0.00015886477462437397, "loss": 0.8578, "num_input_tokens_seen": 1727466, "step": 622, "train_runtime": 1620.136, "train_tokens_per_second": 1066.248 }, { "epoch": 0.05006127081701119, "grad_norm": 0.318127304315567, "learning_rate": 0.00015879799666110184, "loss": 1.1982, "num_input_tokens_seen": 1730740, "step": 623, "train_runtime": 1622.6157, "train_tokens_per_second": 1066.636 }, { "epoch": 0.05014162598686193, "grad_norm": 0.2606166899204254, "learning_rate": 0.0001587312186978297, "loss": 0.8735, "num_input_tokens_seen": 1732610, "step": 624, "train_runtime": 1624.4236, "train_tokens_per_second": 1066.6 }, { "epoch": 0.05022198115671267, "grad_norm": 0.2978360950946808, "learning_rate": 0.00015866444073455758, "loss": 0.947, "num_input_tokens_seen": 1734532, "step": 625, "train_runtime": 1626.2926, "train_tokens_per_second": 1066.556 }, { "epoch": 0.05030233632656341, "grad_norm": 0.24004898965358734, "learning_rate": 0.00015859766277128548, "loss": 0.7807, "num_input_tokens_seen": 1736410, "step": 626, "train_runtime": 1627.9219, "train_tokens_per_second": 1066.642 }, { "epoch": 0.05038269149641415, "grad_norm": 0.32084575295448303, "learning_rate": 0.00015853088480801336, "loss": 1.1471, "num_input_tokens_seen": 1739552, "step": 627, "train_runtime": 1630.3991, "train_tokens_per_second": 1066.949 }, { "epoch": 0.05046304666626489, "grad_norm": 0.2868972420692444, "learning_rate": 0.00015846410684474123, "loss": 0.9481, "num_input_tokens_seen": 1741818, "step": 628, "train_runtime": 1632.3224, "train_tokens_per_second": 1067.08 }, { "epoch": 0.05054340183611563, "grad_norm": 0.28634634613990784, "learning_rate": 0.00015839732888146913, "loss": 0.8362, "num_input_tokens_seen": 1744374, "step": 629, "train_runtime": 1634.5174, "train_tokens_per_second": 1067.21 }, { "epoch": 0.05062375700596637, "grad_norm": 0.28812044858932495, "learning_rate": 0.000158330550918197, "loss": 1.1386, "num_input_tokens_seen": 1746560, "step": 630, "train_runtime": 1636.4281, "train_tokens_per_second": 1067.3 }, { "epoch": 0.05070411217581711, "grad_norm": 0.25034233927726746, "learning_rate": 0.00015826377295492488, "loss": 1.0815, "num_input_tokens_seen": 1750862, "step": 631, "train_runtime": 1641.2506, "train_tokens_per_second": 1066.785 }, { "epoch": 0.050784467345667855, "grad_norm": 0.3361033797264099, "learning_rate": 0.00015819699499165278, "loss": 0.9215, "num_input_tokens_seen": 1756678, "step": 632, "train_runtime": 1645.3083, "train_tokens_per_second": 1067.689 }, { "epoch": 0.05086482251551859, "grad_norm": 0.30996039509773254, "learning_rate": 0.00015813021702838065, "loss": 1.1946, "num_input_tokens_seen": 1758616, "step": 633, "train_runtime": 1647.0662, "train_tokens_per_second": 1067.726 }, { "epoch": 0.05094517768536933, "grad_norm": 0.40377989411354065, "learning_rate": 0.00015806343906510852, "loss": 0.8723, "num_input_tokens_seen": 1761132, "step": 634, "train_runtime": 1649.1157, "train_tokens_per_second": 1067.925 }, { "epoch": 0.051025532855220074, "grad_norm": 0.37052226066589355, "learning_rate": 0.0001579966611018364, "loss": 1.3183, "num_input_tokens_seen": 1764814, "step": 635, "train_runtime": 1651.7167, "train_tokens_per_second": 1068.473 }, { "epoch": 0.051105888025070816, "grad_norm": 0.2999049723148346, "learning_rate": 0.00015792988313856427, "loss": 1.1808, "num_input_tokens_seen": 1767792, "step": 636, "train_runtime": 1653.9548, "train_tokens_per_second": 1068.827 }, { "epoch": 0.05118624319492155, "grad_norm": 0.29953721165657043, "learning_rate": 0.00015786310517529217, "loss": 1.1399, "num_input_tokens_seen": 1771904, "step": 637, "train_runtime": 1656.8735, "train_tokens_per_second": 1069.426 }, { "epoch": 0.05126659836477229, "grad_norm": 0.3269258439540863, "learning_rate": 0.00015779632721202004, "loss": 1.1387, "num_input_tokens_seen": 1777092, "step": 638, "train_runtime": 1660.5696, "train_tokens_per_second": 1070.17 }, { "epoch": 0.051346953534623034, "grad_norm": 0.399961918592453, "learning_rate": 0.00015772954924874792, "loss": 1.0384, "num_input_tokens_seen": 1779902, "step": 639, "train_runtime": 1662.7712, "train_tokens_per_second": 1070.443 }, { "epoch": 0.051427308704473776, "grad_norm": 0.3907172977924347, "learning_rate": 0.0001576627712854758, "loss": 0.7542, "num_input_tokens_seen": 1783698, "step": 640, "train_runtime": 1665.4589, "train_tokens_per_second": 1070.995 }, { "epoch": 0.05150766387432452, "grad_norm": 0.3268730640411377, "learning_rate": 0.00015759599332220366, "loss": 1.0357, "num_input_tokens_seen": 1785036, "step": 641, "train_runtime": 1667.0452, "train_tokens_per_second": 1070.778 }, { "epoch": 0.05158801904417525, "grad_norm": 0.33701813220977783, "learning_rate": 0.00015752921535893156, "loss": 1.0021, "num_input_tokens_seen": 1787714, "step": 642, "train_runtime": 1669.1885, "train_tokens_per_second": 1071.008 }, { "epoch": 0.051668374214025994, "grad_norm": 0.38054177165031433, "learning_rate": 0.00015746243739565944, "loss": 1.1016, "num_input_tokens_seen": 1790836, "step": 643, "train_runtime": 1671.5851, "train_tokens_per_second": 1071.34 }, { "epoch": 0.051748729383876736, "grad_norm": 0.3670094609260559, "learning_rate": 0.0001573956594323873, "loss": 1.0972, "num_input_tokens_seen": 1793486, "step": 644, "train_runtime": 1673.8086, "train_tokens_per_second": 1071.5 }, { "epoch": 0.05182908455372748, "grad_norm": 0.31700095534324646, "learning_rate": 0.0001573288814691152, "loss": 1.1621, "num_input_tokens_seen": 1797676, "step": 645, "train_runtime": 1676.7705, "train_tokens_per_second": 1072.106 }, { "epoch": 0.05190943972357821, "grad_norm": 0.3346264064311981, "learning_rate": 0.00015726210350584308, "loss": 1.2192, "num_input_tokens_seen": 1799684, "step": 646, "train_runtime": 1678.5158, "train_tokens_per_second": 1072.188 }, { "epoch": 0.051989794893428955, "grad_norm": 0.3344186842441559, "learning_rate": 0.00015719532554257096, "loss": 0.9437, "num_input_tokens_seen": 1801374, "step": 647, "train_runtime": 1680.1845, "train_tokens_per_second": 1072.129 }, { "epoch": 0.052070150063279697, "grad_norm": 0.30313628911972046, "learning_rate": 0.00015712854757929886, "loss": 0.9575, "num_input_tokens_seen": 1803918, "step": 648, "train_runtime": 1682.2983, "train_tokens_per_second": 1072.294 }, { "epoch": 0.05215050523313044, "grad_norm": 0.38865846395492554, "learning_rate": 0.00015706176961602673, "loss": 0.8839, "num_input_tokens_seen": 1806028, "step": 649, "train_runtime": 1684.2041, "train_tokens_per_second": 1072.333 }, { "epoch": 0.05223086040298118, "grad_norm": 0.34449660778045654, "learning_rate": 0.0001569949916527546, "loss": 1.1493, "num_input_tokens_seen": 1807402, "step": 650, "train_runtime": 1685.7496, "train_tokens_per_second": 1072.165 }, { "epoch": 0.052311215572831915, "grad_norm": 0.2894439101219177, "learning_rate": 0.00015692821368948248, "loss": 0.8203, "num_input_tokens_seen": 1811010, "step": 651, "train_runtime": 1688.3898, "train_tokens_per_second": 1072.626 }, { "epoch": 0.05239157074268266, "grad_norm": 0.34291529655456543, "learning_rate": 0.00015686143572621035, "loss": 0.9161, "num_input_tokens_seen": 1813494, "step": 652, "train_runtime": 1690.5124, "train_tokens_per_second": 1072.748 }, { "epoch": 0.0524719259125334, "grad_norm": 0.3010275959968567, "learning_rate": 0.00015679465776293825, "loss": 1.0819, "num_input_tokens_seen": 1815446, "step": 653, "train_runtime": 1692.2704, "train_tokens_per_second": 1072.787 }, { "epoch": 0.05255228108238414, "grad_norm": 0.25478747487068176, "learning_rate": 0.00015672787979966612, "loss": 0.8383, "num_input_tokens_seen": 1819932, "step": 654, "train_runtime": 1695.4802, "train_tokens_per_second": 1073.402 }, { "epoch": 0.052632636252234875, "grad_norm": 0.3816944360733032, "learning_rate": 0.000156661101836394, "loss": 1.0901, "num_input_tokens_seen": 1822734, "step": 655, "train_runtime": 1697.7839, "train_tokens_per_second": 1073.596 }, { "epoch": 0.05271299142208562, "grad_norm": 0.2838401794433594, "learning_rate": 0.00015659432387312187, "loss": 1.0233, "num_input_tokens_seen": 1826098, "step": 656, "train_runtime": 1700.2787, "train_tokens_per_second": 1073.999 }, { "epoch": 0.05279334659193636, "grad_norm": 0.31507235765457153, "learning_rate": 0.00015652754590984974, "loss": 1.0798, "num_input_tokens_seen": 1827972, "step": 657, "train_runtime": 1702.0232, "train_tokens_per_second": 1073.999 }, { "epoch": 0.0528737017617871, "grad_norm": 0.2731901705265045, "learning_rate": 0.00015646076794657764, "loss": 0.6823, "num_input_tokens_seen": 1829970, "step": 658, "train_runtime": 1703.8753, "train_tokens_per_second": 1074.005 }, { "epoch": 0.05295405693163784, "grad_norm": 0.31667497754096985, "learning_rate": 0.00015639398998330552, "loss": 1.0495, "num_input_tokens_seen": 1833766, "step": 659, "train_runtime": 1706.7872, "train_tokens_per_second": 1074.396 }, { "epoch": 0.05303441210148858, "grad_norm": 0.3218362331390381, "learning_rate": 0.0001563272120200334, "loss": 0.9003, "num_input_tokens_seen": 1836690, "step": 660, "train_runtime": 1709.1734, "train_tokens_per_second": 1074.607 }, { "epoch": 0.05311476727133932, "grad_norm": 0.27151763439178467, "learning_rate": 0.00015626043405676126, "loss": 0.6526, "num_input_tokens_seen": 1838682, "step": 661, "train_runtime": 1713.0454, "train_tokens_per_second": 1073.341 }, { "epoch": 0.05319512244119006, "grad_norm": 0.35131528973579407, "learning_rate": 0.00015619365609348916, "loss": 0.94, "num_input_tokens_seen": 1842712, "step": 662, "train_runtime": 1716.0381, "train_tokens_per_second": 1073.818 }, { "epoch": 0.0532754776110408, "grad_norm": 0.2772160768508911, "learning_rate": 0.00015612687813021704, "loss": 1.0933, "num_input_tokens_seen": 1845834, "step": 663, "train_runtime": 1718.4847, "train_tokens_per_second": 1074.106 }, { "epoch": 0.05335583278089154, "grad_norm": 0.3245062530040741, "learning_rate": 0.00015606010016694494, "loss": 1.1518, "num_input_tokens_seen": 1850994, "step": 664, "train_runtime": 1722.107, "train_tokens_per_second": 1074.843 }, { "epoch": 0.05343618795074228, "grad_norm": 0.3193010687828064, "learning_rate": 0.0001559933222036728, "loss": 0.9863, "num_input_tokens_seen": 1854218, "step": 665, "train_runtime": 1724.6527, "train_tokens_per_second": 1075.125 }, { "epoch": 0.05351654312059302, "grad_norm": 0.2925742268562317, "learning_rate": 0.00015592654424040068, "loss": 0.8213, "num_input_tokens_seen": 1858166, "step": 666, "train_runtime": 1727.4576, "train_tokens_per_second": 1075.665 }, { "epoch": 0.05359689829044376, "grad_norm": 0.3380376398563385, "learning_rate": 0.00015585976627712856, "loss": 0.9427, "num_input_tokens_seen": 1860388, "step": 667, "train_runtime": 1729.3953, "train_tokens_per_second": 1075.745 }, { "epoch": 0.053677253460294505, "grad_norm": 0.32776203751564026, "learning_rate": 0.00015579298831385643, "loss": 1.367, "num_input_tokens_seen": 1863720, "step": 668, "train_runtime": 1731.8818, "train_tokens_per_second": 1076.124 }, { "epoch": 0.05375760863014524, "grad_norm": 0.31421107053756714, "learning_rate": 0.00015572621035058433, "loss": 1.0622, "num_input_tokens_seen": 1865502, "step": 669, "train_runtime": 1733.5408, "train_tokens_per_second": 1076.122 }, { "epoch": 0.05383796379999598, "grad_norm": 0.28330931067466736, "learning_rate": 0.0001556594323873122, "loss": 1.2096, "num_input_tokens_seen": 1868070, "step": 670, "train_runtime": 1735.6739, "train_tokens_per_second": 1076.279 }, { "epoch": 0.053918318969846724, "grad_norm": 0.2609613537788391, "learning_rate": 0.00015559265442404007, "loss": 0.6405, "num_input_tokens_seen": 1869382, "step": 671, "train_runtime": 1737.2445, "train_tokens_per_second": 1076.062 }, { "epoch": 0.053998674139697465, "grad_norm": 0.318636953830719, "learning_rate": 0.00015552587646076795, "loss": 0.9964, "num_input_tokens_seen": 1872516, "step": 672, "train_runtime": 1739.6236, "train_tokens_per_second": 1076.391 }, { "epoch": 0.0540790293095482, "grad_norm": 0.26012375950813293, "learning_rate": 0.00015545909849749582, "loss": 0.933, "num_input_tokens_seen": 1874650, "step": 673, "train_runtime": 1741.5153, "train_tokens_per_second": 1076.448 }, { "epoch": 0.05415938447939894, "grad_norm": 0.32276418805122375, "learning_rate": 0.00015539232053422372, "loss": 1.0842, "num_input_tokens_seen": 1876620, "step": 674, "train_runtime": 1743.3273, "train_tokens_per_second": 1076.459 }, { "epoch": 0.054239739649249684, "grad_norm": 0.3392653167247772, "learning_rate": 0.0001553255425709516, "loss": 1.0656, "num_input_tokens_seen": 1881422, "step": 675, "train_runtime": 1746.7302, "train_tokens_per_second": 1077.111 }, { "epoch": 0.054320094819100426, "grad_norm": 0.29520127177238464, "learning_rate": 0.00015525876460767947, "loss": 0.6711, "num_input_tokens_seen": 1884100, "step": 676, "train_runtime": 1748.9369, "train_tokens_per_second": 1077.283 }, { "epoch": 0.05440044998895117, "grad_norm": 0.3347858786582947, "learning_rate": 0.00015519198664440734, "loss": 1.1263, "num_input_tokens_seen": 1885718, "step": 677, "train_runtime": 1750.5285, "train_tokens_per_second": 1077.228 }, { "epoch": 0.0544808051588019, "grad_norm": 0.3290030360221863, "learning_rate": 0.00015512520868113521, "loss": 0.9578, "num_input_tokens_seen": 1888086, "step": 678, "train_runtime": 1752.5106, "train_tokens_per_second": 1077.361 }, { "epoch": 0.054561160328652644, "grad_norm": 0.3620326817035675, "learning_rate": 0.00015505843071786311, "loss": 0.9817, "num_input_tokens_seen": 1890442, "step": 679, "train_runtime": 1754.5567, "train_tokens_per_second": 1077.447 }, { "epoch": 0.054641515498503386, "grad_norm": 0.36778369545936584, "learning_rate": 0.000154991652754591, "loss": 0.838, "num_input_tokens_seen": 1892284, "step": 680, "train_runtime": 1756.3317, "train_tokens_per_second": 1077.407 }, { "epoch": 0.05472187066835413, "grad_norm": 0.31623950600624084, "learning_rate": 0.0001549248747913189, "loss": 0.9384, "num_input_tokens_seen": 1894934, "step": 681, "train_runtime": 1758.5071, "train_tokens_per_second": 1077.581 }, { "epoch": 0.05480222583820486, "grad_norm": 0.2577507495880127, "learning_rate": 0.00015485809682804676, "loss": 0.8484, "num_input_tokens_seen": 1898802, "step": 682, "train_runtime": 1761.357, "train_tokens_per_second": 1078.034 }, { "epoch": 0.054882581008055605, "grad_norm": 0.2751832902431488, "learning_rate": 0.00015479131886477463, "loss": 0.7455, "num_input_tokens_seen": 1900668, "step": 683, "train_runtime": 1762.9767, "train_tokens_per_second": 1078.102 }, { "epoch": 0.054962936177906346, "grad_norm": 0.3682342767715454, "learning_rate": 0.0001547245409015025, "loss": 0.9043, "num_input_tokens_seen": 1904252, "step": 684, "train_runtime": 1765.5917, "train_tokens_per_second": 1078.535 }, { "epoch": 0.05504329134775709, "grad_norm": 0.29235321283340454, "learning_rate": 0.0001546577629382304, "loss": 1.0878, "num_input_tokens_seen": 1907134, "step": 685, "train_runtime": 1767.8719, "train_tokens_per_second": 1078.774 }, { "epoch": 0.05512364651760783, "grad_norm": 0.27555689215660095, "learning_rate": 0.00015459098497495828, "loss": 0.803, "num_input_tokens_seen": 1910678, "step": 686, "train_runtime": 1770.5152, "train_tokens_per_second": 1079.165 }, { "epoch": 0.055204001687458565, "grad_norm": 0.32898277044296265, "learning_rate": 0.00015452420701168615, "loss": 0.8662, "num_input_tokens_seen": 1912310, "step": 687, "train_runtime": 1772.1262, "train_tokens_per_second": 1079.105 }, { "epoch": 0.05528435685730931, "grad_norm": 0.2872154414653778, "learning_rate": 0.00015445742904841403, "loss": 1.1046, "num_input_tokens_seen": 1915508, "step": 688, "train_runtime": 1774.4972, "train_tokens_per_second": 1079.465 }, { "epoch": 0.05536471202716005, "grad_norm": 0.29981961846351624, "learning_rate": 0.0001543906510851419, "loss": 1.1274, "num_input_tokens_seen": 1918116, "step": 689, "train_runtime": 1776.6914, "train_tokens_per_second": 1079.6 }, { "epoch": 0.05544506719701079, "grad_norm": 0.33591628074645996, "learning_rate": 0.0001543238731218698, "loss": 0.9346, "num_input_tokens_seen": 1919452, "step": 690, "train_runtime": 1778.2472, "train_tokens_per_second": 1079.407 }, { "epoch": 0.055525422366861525, "grad_norm": 0.284965455532074, "learning_rate": 0.00015425709515859767, "loss": 1.0246, "num_input_tokens_seen": 1922190, "step": 691, "train_runtime": 1782.4841, "train_tokens_per_second": 1078.377 }, { "epoch": 0.05560577753671227, "grad_norm": 0.27644267678260803, "learning_rate": 0.00015419031719532555, "loss": 0.9134, "num_input_tokens_seen": 1925062, "step": 692, "train_runtime": 1784.6903, "train_tokens_per_second": 1078.653 }, { "epoch": 0.05568613270656301, "grad_norm": 0.33998218178749084, "learning_rate": 0.00015412353923205342, "loss": 0.8353, "num_input_tokens_seen": 1927318, "step": 693, "train_runtime": 1786.609, "train_tokens_per_second": 1078.758 }, { "epoch": 0.05576648787641375, "grad_norm": 0.2729622423648834, "learning_rate": 0.0001540567612687813, "loss": 0.7494, "num_input_tokens_seen": 1931602, "step": 694, "train_runtime": 1789.702, "train_tokens_per_second": 1079.287 }, { "epoch": 0.05584684304626449, "grad_norm": 0.28827887773513794, "learning_rate": 0.0001539899833055092, "loss": 0.9188, "num_input_tokens_seen": 1933984, "step": 695, "train_runtime": 1791.7153, "train_tokens_per_second": 1079.404 }, { "epoch": 0.05592719821611523, "grad_norm": 0.4026768207550049, "learning_rate": 0.00015392320534223707, "loss": 0.9791, "num_input_tokens_seen": 1936502, "step": 696, "train_runtime": 1793.9386, "train_tokens_per_second": 1079.469 }, { "epoch": 0.05600755338596597, "grad_norm": 0.2798472046852112, "learning_rate": 0.00015385642737896494, "loss": 0.62, "num_input_tokens_seen": 1938680, "step": 697, "train_runtime": 1795.8759, "train_tokens_per_second": 1079.518 }, { "epoch": 0.05608790855581671, "grad_norm": 0.2956175208091736, "learning_rate": 0.00015378964941569284, "loss": 0.6289, "num_input_tokens_seen": 1940370, "step": 698, "train_runtime": 1797.5764, "train_tokens_per_second": 1079.437 }, { "epoch": 0.05616826372566745, "grad_norm": 0.30674660205841064, "learning_rate": 0.0001537228714524207, "loss": 1.1346, "num_input_tokens_seen": 1944056, "step": 699, "train_runtime": 1800.1653, "train_tokens_per_second": 1079.932 }, { "epoch": 0.05624861889551819, "grad_norm": 0.3235774040222168, "learning_rate": 0.00015365609348914859, "loss": 1.1422, "num_input_tokens_seen": 1945484, "step": 700, "train_runtime": 1801.7645, "train_tokens_per_second": 1079.766 }, { "epoch": 0.05632897406536893, "grad_norm": 0.3246361017227173, "learning_rate": 0.00015358931552587649, "loss": 1.037, "num_input_tokens_seen": 1950982, "step": 701, "train_runtime": 1805.6746, "train_tokens_per_second": 1080.473 }, { "epoch": 0.05640932923521967, "grad_norm": 0.28568196296691895, "learning_rate": 0.00015352253756260436, "loss": 0.928, "num_input_tokens_seen": 1954032, "step": 702, "train_runtime": 1807.9373, "train_tokens_per_second": 1080.807 }, { "epoch": 0.05648968440507041, "grad_norm": 0.34797027707099915, "learning_rate": 0.00015345575959933223, "loss": 0.9213, "num_input_tokens_seen": 1955984, "step": 703, "train_runtime": 1809.842, "train_tokens_per_second": 1080.748 }, { "epoch": 0.056570039574921155, "grad_norm": 0.30620652437210083, "learning_rate": 0.0001533889816360601, "loss": 0.8303, "num_input_tokens_seen": 1959298, "step": 704, "train_runtime": 1812.4911, "train_tokens_per_second": 1080.997 }, { "epoch": 0.05665039474477189, "grad_norm": 0.26757800579071045, "learning_rate": 0.00015332220367278798, "loss": 1.0902, "num_input_tokens_seen": 1962378, "step": 705, "train_runtime": 1814.8604, "train_tokens_per_second": 1081.283 }, { "epoch": 0.05673074991462263, "grad_norm": 0.3470252454280853, "learning_rate": 0.00015325542570951588, "loss": 0.7748, "num_input_tokens_seen": 1965148, "step": 706, "train_runtime": 1817.1073, "train_tokens_per_second": 1081.471 }, { "epoch": 0.05681110508447337, "grad_norm": 0.257053405046463, "learning_rate": 0.00015318864774624375, "loss": 0.7623, "num_input_tokens_seen": 1967994, "step": 707, "train_runtime": 1819.4047, "train_tokens_per_second": 1081.669 }, { "epoch": 0.056891460254324115, "grad_norm": 0.3352760672569275, "learning_rate": 0.00015312186978297163, "loss": 1.1276, "num_input_tokens_seen": 1971064, "step": 708, "train_runtime": 1821.7562, "train_tokens_per_second": 1081.958 }, { "epoch": 0.05697181542417485, "grad_norm": 0.3215519189834595, "learning_rate": 0.0001530550918196995, "loss": 1.0408, "num_input_tokens_seen": 1973634, "step": 709, "train_runtime": 1823.853, "train_tokens_per_second": 1082.123 }, { "epoch": 0.05705217059402559, "grad_norm": 0.29732009768486023, "learning_rate": 0.00015298831385642737, "loss": 1.2322, "num_input_tokens_seen": 1975384, "step": 710, "train_runtime": 1825.5454, "train_tokens_per_second": 1082.079 }, { "epoch": 0.057132525763876334, "grad_norm": 0.35030630230903625, "learning_rate": 0.00015292153589315527, "loss": 0.8895, "num_input_tokens_seen": 1978254, "step": 711, "train_runtime": 1827.8538, "train_tokens_per_second": 1082.282 }, { "epoch": 0.057212880933727076, "grad_norm": 0.32095322012901306, "learning_rate": 0.00015285475792988315, "loss": 1.0253, "num_input_tokens_seen": 1980222, "step": 712, "train_runtime": 1829.64, "train_tokens_per_second": 1082.301 }, { "epoch": 0.05729323610357782, "grad_norm": 0.2621558606624603, "learning_rate": 0.00015278797996661102, "loss": 1.0712, "num_input_tokens_seen": 1983714, "step": 713, "train_runtime": 1832.1453, "train_tokens_per_second": 1082.727 }, { "epoch": 0.05737359127342855, "grad_norm": 0.30798768997192383, "learning_rate": 0.0001527212020033389, "loss": 1.0327, "num_input_tokens_seen": 1985694, "step": 714, "train_runtime": 1833.9312, "train_tokens_per_second": 1082.753 }, { "epoch": 0.057453946443279294, "grad_norm": 0.32821840047836304, "learning_rate": 0.0001526544240400668, "loss": 0.9513, "num_input_tokens_seen": 1988750, "step": 715, "train_runtime": 1836.2632, "train_tokens_per_second": 1083.042 }, { "epoch": 0.057534301613130036, "grad_norm": 0.35471609234809875, "learning_rate": 0.00015258764607679466, "loss": 0.9607, "num_input_tokens_seen": 1991266, "step": 716, "train_runtime": 1838.2892, "train_tokens_per_second": 1083.217 }, { "epoch": 0.05761465678298078, "grad_norm": 0.29893821477890015, "learning_rate": 0.00015252086811352257, "loss": 0.7843, "num_input_tokens_seen": 1993566, "step": 717, "train_runtime": 1840.2644, "train_tokens_per_second": 1083.304 }, { "epoch": 0.05769501195283151, "grad_norm": 0.33154726028442383, "learning_rate": 0.00015245409015025044, "loss": 1.2394, "num_input_tokens_seen": 1995860, "step": 718, "train_runtime": 1842.17, "train_tokens_per_second": 1083.429 }, { "epoch": 0.057775367122682254, "grad_norm": 0.3338896632194519, "learning_rate": 0.0001523873121869783, "loss": 0.7933, "num_input_tokens_seen": 1998962, "step": 719, "train_runtime": 1844.537, "train_tokens_per_second": 1083.72 }, { "epoch": 0.057855722292532996, "grad_norm": 0.3402370512485504, "learning_rate": 0.00015232053422370618, "loss": 1.0473, "num_input_tokens_seen": 2001728, "step": 720, "train_runtime": 1846.8124, "train_tokens_per_second": 1083.883 }, { "epoch": 0.05793607746238374, "grad_norm": 0.3279224932193756, "learning_rate": 0.00015225375626043406, "loss": 0.8423, "num_input_tokens_seen": 2004578, "step": 721, "train_runtime": 1851.0791, "train_tokens_per_second": 1082.924 }, { "epoch": 0.05801643263223448, "grad_norm": 0.27328982949256897, "learning_rate": 0.00015218697829716196, "loss": 0.9153, "num_input_tokens_seen": 2007970, "step": 722, "train_runtime": 1853.6423, "train_tokens_per_second": 1083.256 }, { "epoch": 0.058096787802085215, "grad_norm": 0.3246921896934509, "learning_rate": 0.00015212020033388983, "loss": 1.1111, "num_input_tokens_seen": 2009966, "step": 723, "train_runtime": 1855.5032, "train_tokens_per_second": 1083.246 }, { "epoch": 0.058177142971935956, "grad_norm": 0.29969558119773865, "learning_rate": 0.0001520534223706177, "loss": 1.1185, "num_input_tokens_seen": 2011548, "step": 724, "train_runtime": 1857.1507, "train_tokens_per_second": 1083.137 }, { "epoch": 0.0582574981417867, "grad_norm": 0.25052857398986816, "learning_rate": 0.00015198664440734558, "loss": 0.8242, "num_input_tokens_seen": 2014494, "step": 725, "train_runtime": 1859.4042, "train_tokens_per_second": 1083.408 }, { "epoch": 0.05833785331163744, "grad_norm": 0.2533136010169983, "learning_rate": 0.00015191986644407345, "loss": 1.0544, "num_input_tokens_seen": 2018804, "step": 726, "train_runtime": 1862.4596, "train_tokens_per_second": 1083.945 }, { "epoch": 0.058418208481488175, "grad_norm": 0.34300217032432556, "learning_rate": 0.00015185308848080135, "loss": 1.1558, "num_input_tokens_seen": 2021872, "step": 727, "train_runtime": 1864.9797, "train_tokens_per_second": 1084.125 }, { "epoch": 0.05849856365133892, "grad_norm": 0.2861180007457733, "learning_rate": 0.00015178631051752922, "loss": 0.8775, "num_input_tokens_seen": 2024396, "step": 728, "train_runtime": 1867.0564, "train_tokens_per_second": 1084.271 }, { "epoch": 0.05857891882118966, "grad_norm": 0.2502950131893158, "learning_rate": 0.0001517195325542571, "loss": 0.7155, "num_input_tokens_seen": 2028560, "step": 729, "train_runtime": 1870.0691, "train_tokens_per_second": 1084.751 }, { "epoch": 0.0586592739910404, "grad_norm": 0.3140285909175873, "learning_rate": 0.00015165275459098497, "loss": 0.9702, "num_input_tokens_seen": 2031816, "step": 730, "train_runtime": 1872.5611, "train_tokens_per_second": 1085.047 }, { "epoch": 0.05873962916089114, "grad_norm": 0.3011912405490875, "learning_rate": 0.00015158597662771284, "loss": 1.1461, "num_input_tokens_seen": 2033714, "step": 731, "train_runtime": 1874.2976, "train_tokens_per_second": 1085.054 }, { "epoch": 0.05881998433074188, "grad_norm": 0.3443948030471802, "learning_rate": 0.00015151919866444074, "loss": 1.106, "num_input_tokens_seen": 2039640, "step": 732, "train_runtime": 1878.3622, "train_tokens_per_second": 1085.861 }, { "epoch": 0.05890033950059262, "grad_norm": 0.30849480628967285, "learning_rate": 0.00015145242070116862, "loss": 1.1929, "num_input_tokens_seen": 2043664, "step": 733, "train_runtime": 1881.3566, "train_tokens_per_second": 1086.271 }, { "epoch": 0.05898069467044336, "grad_norm": 0.3384644687175751, "learning_rate": 0.00015138564273789652, "loss": 1.3346, "num_input_tokens_seen": 2046676, "step": 734, "train_runtime": 1883.7806, "train_tokens_per_second": 1086.473 }, { "epoch": 0.0590610498402941, "grad_norm": 0.41189488768577576, "learning_rate": 0.0001513188647746244, "loss": 1.1487, "num_input_tokens_seen": 2048630, "step": 735, "train_runtime": 1885.5806, "train_tokens_per_second": 1086.472 }, { "epoch": 0.05914140501014484, "grad_norm": 0.35140398144721985, "learning_rate": 0.00015125208681135226, "loss": 0.7905, "num_input_tokens_seen": 2050468, "step": 736, "train_runtime": 1887.3125, "train_tokens_per_second": 1086.449 }, { "epoch": 0.05922176017999558, "grad_norm": 0.29333919286727905, "learning_rate": 0.00015118530884808014, "loss": 0.7653, "num_input_tokens_seen": 2053514, "step": 737, "train_runtime": 1889.6361, "train_tokens_per_second": 1086.725 }, { "epoch": 0.05930211534984632, "grad_norm": 0.27940815687179565, "learning_rate": 0.00015111853088480804, "loss": 1.1097, "num_input_tokens_seen": 2056204, "step": 738, "train_runtime": 1891.8235, "train_tokens_per_second": 1086.89 }, { "epoch": 0.05938247051969706, "grad_norm": 0.27439242601394653, "learning_rate": 0.0001510517529215359, "loss": 0.7571, "num_input_tokens_seen": 2058580, "step": 739, "train_runtime": 1893.8655, "train_tokens_per_second": 1086.973 }, { "epoch": 0.059462825689547805, "grad_norm": 0.5973687171936035, "learning_rate": 0.00015098497495826378, "loss": 0.8022, "num_input_tokens_seen": 2061114, "step": 740, "train_runtime": 1896.0041, "train_tokens_per_second": 1087.083 }, { "epoch": 0.05954318085939854, "grad_norm": 0.3319377303123474, "learning_rate": 0.00015091819699499166, "loss": 0.9576, "num_input_tokens_seen": 2063538, "step": 741, "train_runtime": 1898.041, "train_tokens_per_second": 1087.194 }, { "epoch": 0.05962353602924928, "grad_norm": 0.27499696612358093, "learning_rate": 0.00015085141903171953, "loss": 0.8339, "num_input_tokens_seen": 2067446, "step": 742, "train_runtime": 1900.8523, "train_tokens_per_second": 1087.642 }, { "epoch": 0.05970389119910002, "grad_norm": 0.3294494152069092, "learning_rate": 0.00015078464106844743, "loss": 0.8107, "num_input_tokens_seen": 2069534, "step": 743, "train_runtime": 1902.6727, "train_tokens_per_second": 1087.698 }, { "epoch": 0.059784246368950765, "grad_norm": 0.3478166162967682, "learning_rate": 0.0001507178631051753, "loss": 0.803, "num_input_tokens_seen": 2071896, "step": 744, "train_runtime": 1904.7234, "train_tokens_per_second": 1087.767 }, { "epoch": 0.0598646015388015, "grad_norm": 0.3554915189743042, "learning_rate": 0.00015065108514190318, "loss": 1.0449, "num_input_tokens_seen": 2073966, "step": 745, "train_runtime": 1906.6912, "train_tokens_per_second": 1087.73 }, { "epoch": 0.05994495670865224, "grad_norm": 0.30656698346138, "learning_rate": 0.00015058430717863105, "loss": 0.7917, "num_input_tokens_seen": 2076060, "step": 746, "train_runtime": 1908.6257, "train_tokens_per_second": 1087.725 }, { "epoch": 0.060025311878502983, "grad_norm": 0.2801983952522278, "learning_rate": 0.00015051752921535892, "loss": 0.7432, "num_input_tokens_seen": 2078862, "step": 747, "train_runtime": 1910.8057, "train_tokens_per_second": 1087.951 }, { "epoch": 0.060105667048353725, "grad_norm": 0.47750338912010193, "learning_rate": 0.0001504507512520868, "loss": 1.0171, "num_input_tokens_seen": 2080784, "step": 748, "train_runtime": 1912.4467, "train_tokens_per_second": 1088.022 }, { "epoch": 0.06018602221820447, "grad_norm": 0.38815444707870483, "learning_rate": 0.0001503839732888147, "loss": 1.089, "num_input_tokens_seen": 2083682, "step": 749, "train_runtime": 1914.7004, "train_tokens_per_second": 1088.255 }, { "epoch": 0.0602663773880552, "grad_norm": 0.30164188146591187, "learning_rate": 0.00015031719532554257, "loss": 1.0412, "num_input_tokens_seen": 2086678, "step": 750, "train_runtime": 1917.0235, "train_tokens_per_second": 1088.499 }, { "epoch": 0.060346732557905944, "grad_norm": 0.32808375358581543, "learning_rate": 0.00015025041736227047, "loss": 1.1034, "num_input_tokens_seen": 2088932, "step": 751, "train_runtime": 1920.9797, "train_tokens_per_second": 1087.431 }, { "epoch": 0.060427087727756686, "grad_norm": 0.28214800357818604, "learning_rate": 0.00015018363939899834, "loss": 0.8384, "num_input_tokens_seen": 2091816, "step": 752, "train_runtime": 1923.1554, "train_tokens_per_second": 1087.7 }, { "epoch": 0.06050744289760743, "grad_norm": 0.33014342188835144, "learning_rate": 0.00015011686143572622, "loss": 1.1402, "num_input_tokens_seen": 2095270, "step": 753, "train_runtime": 1925.7468, "train_tokens_per_second": 1088.03 }, { "epoch": 0.06058779806745816, "grad_norm": 0.3177398443222046, "learning_rate": 0.00015005008347245412, "loss": 1.0321, "num_input_tokens_seen": 2098510, "step": 754, "train_runtime": 1928.2026, "train_tokens_per_second": 1088.324 }, { "epoch": 0.060668153237308904, "grad_norm": 0.3043687343597412, "learning_rate": 0.000149983305509182, "loss": 1.0418, "num_input_tokens_seen": 2100818, "step": 755, "train_runtime": 1930.0889, "train_tokens_per_second": 1088.457 }, { "epoch": 0.060748508407159646, "grad_norm": 0.3117942810058594, "learning_rate": 0.00014991652754590986, "loss": 1.0242, "num_input_tokens_seen": 2103630, "step": 756, "train_runtime": 1932.282, "train_tokens_per_second": 1088.677 }, { "epoch": 0.06082886357701039, "grad_norm": 0.2615673542022705, "learning_rate": 0.00014984974958263774, "loss": 0.8929, "num_input_tokens_seen": 2105904, "step": 757, "train_runtime": 1934.1837, "train_tokens_per_second": 1088.782 }, { "epoch": 0.06090921874686113, "grad_norm": 0.3243381977081299, "learning_rate": 0.0001497829716193656, "loss": 1.1386, "num_input_tokens_seen": 2108018, "step": 758, "train_runtime": 1936.0094, "train_tokens_per_second": 1088.847 }, { "epoch": 0.060989573916711864, "grad_norm": 0.330251544713974, "learning_rate": 0.0001497161936560935, "loss": 0.9637, "num_input_tokens_seen": 2111362, "step": 759, "train_runtime": 1938.6033, "train_tokens_per_second": 1089.115 }, { "epoch": 0.061069929086562606, "grad_norm": 0.34466591477394104, "learning_rate": 0.00014964941569282138, "loss": 1.0165, "num_input_tokens_seen": 2114330, "step": 760, "train_runtime": 1941.0526, "train_tokens_per_second": 1089.27 }, { "epoch": 0.06115028425641335, "grad_norm": 0.29236334562301636, "learning_rate": 0.00014958263772954926, "loss": 0.9817, "num_input_tokens_seen": 2117744, "step": 761, "train_runtime": 1943.6514, "train_tokens_per_second": 1089.57 }, { "epoch": 0.06123063942626409, "grad_norm": 0.3150699734687805, "learning_rate": 0.00014951585976627713, "loss": 1.1979, "num_input_tokens_seen": 2120630, "step": 762, "train_runtime": 1945.8991, "train_tokens_per_second": 1089.794 }, { "epoch": 0.061310994596114825, "grad_norm": 0.3132155239582062, "learning_rate": 0.000149449081803005, "loss": 0.8408, "num_input_tokens_seen": 2125434, "step": 763, "train_runtime": 1949.221, "train_tokens_per_second": 1090.402 }, { "epoch": 0.06139134976596557, "grad_norm": 0.3346937894821167, "learning_rate": 0.00014938230383973287, "loss": 1.2044, "num_input_tokens_seen": 2128796, "step": 764, "train_runtime": 1951.791, "train_tokens_per_second": 1090.688 }, { "epoch": 0.06147170493581631, "grad_norm": 0.29328790307044983, "learning_rate": 0.00014931552587646077, "loss": 1.1102, "num_input_tokens_seen": 2132024, "step": 765, "train_runtime": 1954.229, "train_tokens_per_second": 1090.98 }, { "epoch": 0.06155206010566705, "grad_norm": 0.2834538221359253, "learning_rate": 0.00014924874791318865, "loss": 0.8466, "num_input_tokens_seen": 2133818, "step": 766, "train_runtime": 1955.9092, "train_tokens_per_second": 1090.96 }, { "epoch": 0.06163241527551779, "grad_norm": 0.3271242082118988, "learning_rate": 0.00014918196994991652, "loss": 1.1796, "num_input_tokens_seen": 2136520, "step": 767, "train_runtime": 1958.137, "train_tokens_per_second": 1091.098 }, { "epoch": 0.06171277044536853, "grad_norm": 0.3325490355491638, "learning_rate": 0.00014911519198664442, "loss": 1.1547, "num_input_tokens_seen": 2138466, "step": 768, "train_runtime": 1960.0398, "train_tokens_per_second": 1091.032 }, { "epoch": 0.06179312561521927, "grad_norm": 0.34948816895484924, "learning_rate": 0.0001490484140233723, "loss": 1.0936, "num_input_tokens_seen": 2139834, "step": 769, "train_runtime": 1961.5708, "train_tokens_per_second": 1090.878 }, { "epoch": 0.06187348078507001, "grad_norm": 0.26612240076065063, "learning_rate": 0.0001489816360601002, "loss": 1.1135, "num_input_tokens_seen": 2142074, "step": 770, "train_runtime": 1963.5128, "train_tokens_per_second": 1090.94 }, { "epoch": 0.06195383595492075, "grad_norm": 0.26699098944664, "learning_rate": 0.00014891485809682807, "loss": 1.0005, "num_input_tokens_seen": 2144910, "step": 771, "train_runtime": 1965.7524, "train_tokens_per_second": 1091.139 }, { "epoch": 0.06203419112477149, "grad_norm": 0.26087722182273865, "learning_rate": 0.00014884808013355594, "loss": 1.0274, "num_input_tokens_seen": 2148416, "step": 772, "train_runtime": 1968.3805, "train_tokens_per_second": 1091.464 }, { "epoch": 0.06211454629462223, "grad_norm": 0.305115282535553, "learning_rate": 0.00014878130217028381, "loss": 0.804, "num_input_tokens_seen": 2150900, "step": 773, "train_runtime": 1970.4444, "train_tokens_per_second": 1091.581 }, { "epoch": 0.06219490146447297, "grad_norm": 0.29959383606910706, "learning_rate": 0.0001487145242070117, "loss": 0.6794, "num_input_tokens_seen": 2157162, "step": 774, "train_runtime": 1974.6936, "train_tokens_per_second": 1092.403 }, { "epoch": 0.06227525663432371, "grad_norm": 0.27511703968048096, "learning_rate": 0.0001486477462437396, "loss": 0.64, "num_input_tokens_seen": 2159236, "step": 775, "train_runtime": 1976.6404, "train_tokens_per_second": 1092.377 }, { "epoch": 0.062355611804174454, "grad_norm": 0.3052910268306732, "learning_rate": 0.00014858096828046746, "loss": 1.0433, "num_input_tokens_seen": 2160942, "step": 776, "train_runtime": 1978.3747, "train_tokens_per_second": 1092.281 }, { "epoch": 0.06243596697402519, "grad_norm": 0.27722468972206116, "learning_rate": 0.00014851419031719533, "loss": 0.7702, "num_input_tokens_seen": 2163482, "step": 777, "train_runtime": 1980.4575, "train_tokens_per_second": 1092.415 }, { "epoch": 0.06251632214387594, "grad_norm": 0.35401254892349243, "learning_rate": 0.0001484474123539232, "loss": 0.9084, "num_input_tokens_seen": 2166868, "step": 778, "train_runtime": 1983.0423, "train_tokens_per_second": 1092.699 }, { "epoch": 0.06259667731372667, "grad_norm": 0.3272496461868286, "learning_rate": 0.00014838063439065108, "loss": 1.0999, "num_input_tokens_seen": 2169036, "step": 779, "train_runtime": 1984.9872, "train_tokens_per_second": 1092.72 }, { "epoch": 0.06267703248357741, "grad_norm": 0.3062959909439087, "learning_rate": 0.00014831385642737895, "loss": 1.2502, "num_input_tokens_seen": 2173368, "step": 780, "train_runtime": 1988.1783, "train_tokens_per_second": 1093.145 }, { "epoch": 0.06275738765342816, "grad_norm": 0.30199354887008667, "learning_rate": 0.00014824707846410685, "loss": 0.9818, "num_input_tokens_seen": 2177228, "step": 781, "train_runtime": 1992.9748, "train_tokens_per_second": 1092.451 }, { "epoch": 0.06283774282327889, "grad_norm": 0.3133285343647003, "learning_rate": 0.00014818030050083473, "loss": 0.9363, "num_input_tokens_seen": 2179588, "step": 782, "train_runtime": 1995.0025, "train_tokens_per_second": 1092.524 }, { "epoch": 0.06291809799312963, "grad_norm": 0.2926086187362671, "learning_rate": 0.0001481135225375626, "loss": 0.7605, "num_input_tokens_seen": 2183504, "step": 783, "train_runtime": 1997.794, "train_tokens_per_second": 1092.958 }, { "epoch": 0.06299845316298038, "grad_norm": 0.3522408902645111, "learning_rate": 0.00014804674457429047, "loss": 0.9815, "num_input_tokens_seen": 2185204, "step": 784, "train_runtime": 1999.4975, "train_tokens_per_second": 1092.877 }, { "epoch": 0.06307880833283111, "grad_norm": 0.2630411386489868, "learning_rate": 0.00014797996661101837, "loss": 0.6635, "num_input_tokens_seen": 2187770, "step": 785, "train_runtime": 2001.5965, "train_tokens_per_second": 1093.012 }, { "epoch": 0.06315916350268186, "grad_norm": 0.3483324944972992, "learning_rate": 0.00014791318864774625, "loss": 0.6638, "num_input_tokens_seen": 2189540, "step": 786, "train_runtime": 2003.2525, "train_tokens_per_second": 1092.993 }, { "epoch": 0.0632395186725326, "grad_norm": 0.3385311961174011, "learning_rate": 0.00014784641068447415, "loss": 1.081, "num_input_tokens_seen": 2192502, "step": 787, "train_runtime": 2005.533, "train_tokens_per_second": 1093.227 }, { "epoch": 0.06331987384238333, "grad_norm": 0.29116401076316833, "learning_rate": 0.00014777963272120202, "loss": 0.8055, "num_input_tokens_seen": 2195678, "step": 788, "train_runtime": 2007.9418, "train_tokens_per_second": 1093.497 }, { "epoch": 0.06340022901223408, "grad_norm": 0.3660394549369812, "learning_rate": 0.0001477128547579299, "loss": 1.0744, "num_input_tokens_seen": 2197978, "step": 789, "train_runtime": 2009.9164, "train_tokens_per_second": 1093.567 }, { "epoch": 0.06348058418208481, "grad_norm": 0.3061630427837372, "learning_rate": 0.00014764607679465777, "loss": 1.111, "num_input_tokens_seen": 2201604, "step": 790, "train_runtime": 2012.5559, "train_tokens_per_second": 1093.934 }, { "epoch": 0.06356093935193556, "grad_norm": 0.43108677864074707, "learning_rate": 0.00014757929883138567, "loss": 1.1627, "num_input_tokens_seen": 2203232, "step": 791, "train_runtime": 2014.2338, "train_tokens_per_second": 1093.831 }, { "epoch": 0.0636412945217863, "grad_norm": 0.28936949372291565, "learning_rate": 0.00014751252086811354, "loss": 1.0865, "num_input_tokens_seen": 2206308, "step": 792, "train_runtime": 2016.6608, "train_tokens_per_second": 1094.04 }, { "epoch": 0.06372164969163703, "grad_norm": 0.3124532997608185, "learning_rate": 0.0001474457429048414, "loss": 0.9604, "num_input_tokens_seen": 2208956, "step": 793, "train_runtime": 2018.8626, "train_tokens_per_second": 1094.159 }, { "epoch": 0.06380200486148778, "grad_norm": 0.3006727695465088, "learning_rate": 0.00014737896494156929, "loss": 1.2855, "num_input_tokens_seen": 2212122, "step": 794, "train_runtime": 2021.3389, "train_tokens_per_second": 1094.385 }, { "epoch": 0.06388236003133851, "grad_norm": 0.31648802757263184, "learning_rate": 0.00014731218697829716, "loss": 0.8528, "num_input_tokens_seen": 2214924, "step": 795, "train_runtime": 2023.5258, "train_tokens_per_second": 1094.586 }, { "epoch": 0.06396271520118926, "grad_norm": 0.34675687551498413, "learning_rate": 0.00014724540901502506, "loss": 1.1535, "num_input_tokens_seen": 2217172, "step": 796, "train_runtime": 2025.438, "train_tokens_per_second": 1094.663 }, { "epoch": 0.06404307037104, "grad_norm": 0.32003170251846313, "learning_rate": 0.00014717863105175293, "loss": 1.238, "num_input_tokens_seen": 2219220, "step": 797, "train_runtime": 2027.283, "train_tokens_per_second": 1094.677 }, { "epoch": 0.06412342554089073, "grad_norm": 0.3504277467727661, "learning_rate": 0.0001471118530884808, "loss": 1.2829, "num_input_tokens_seen": 2223568, "step": 798, "train_runtime": 2030.2734, "train_tokens_per_second": 1095.206 }, { "epoch": 0.06420378071074148, "grad_norm": 0.4509447515010834, "learning_rate": 0.00014704507512520868, "loss": 1.118, "num_input_tokens_seen": 2228636, "step": 799, "train_runtime": 2033.9184, "train_tokens_per_second": 1095.735 }, { "epoch": 0.06428413588059222, "grad_norm": 0.38358405232429504, "learning_rate": 0.00014697829716193655, "loss": 1.2002, "num_input_tokens_seen": 2231550, "step": 800, "train_runtime": 2036.2424, "train_tokens_per_second": 1095.916 }, { "epoch": 0.06436449105044295, "grad_norm": 1.3257673978805542, "learning_rate": 0.00014691151919866443, "loss": 1.0104, "num_input_tokens_seen": 2233714, "step": 801, "train_runtime": 2038.1132, "train_tokens_per_second": 1095.971 }, { "epoch": 0.0644448462202937, "grad_norm": 0.338990181684494, "learning_rate": 0.00014684474123539233, "loss": 1.186, "num_input_tokens_seen": 2238176, "step": 802, "train_runtime": 2041.2052, "train_tokens_per_second": 1096.497 }, { "epoch": 0.06452520139014443, "grad_norm": 0.3138526976108551, "learning_rate": 0.0001467779632721202, "loss": 1.0222, "num_input_tokens_seen": 2240232, "step": 803, "train_runtime": 2043.1096, "train_tokens_per_second": 1096.482 }, { "epoch": 0.06460555655999518, "grad_norm": 0.33103451132774353, "learning_rate": 0.0001467111853088481, "loss": 0.9648, "num_input_tokens_seen": 2244260, "step": 804, "train_runtime": 2046.0091, "train_tokens_per_second": 1096.896 }, { "epoch": 0.06468591172984592, "grad_norm": 0.3298628628253937, "learning_rate": 0.00014664440734557597, "loss": 0.997, "num_input_tokens_seen": 2247018, "step": 805, "train_runtime": 2048.1157, "train_tokens_per_second": 1097.115 }, { "epoch": 0.06476626689969665, "grad_norm": 0.4388108253479004, "learning_rate": 0.00014657762938230385, "loss": 1.0147, "num_input_tokens_seen": 2249964, "step": 806, "train_runtime": 2050.5383, "train_tokens_per_second": 1097.255 }, { "epoch": 0.0648466220695474, "grad_norm": 0.3108203709125519, "learning_rate": 0.00014651085141903175, "loss": 1.1797, "num_input_tokens_seen": 2252174, "step": 807, "train_runtime": 2052.5013, "train_tokens_per_second": 1097.283 }, { "epoch": 0.06492697723939814, "grad_norm": 0.28939804434776306, "learning_rate": 0.00014644407345575962, "loss": 0.8583, "num_input_tokens_seen": 2254734, "step": 808, "train_runtime": 2054.6798, "train_tokens_per_second": 1097.365 }, { "epoch": 0.06500733240924889, "grad_norm": 0.32528600096702576, "learning_rate": 0.0001463772954924875, "loss": 0.9182, "num_input_tokens_seen": 2256938, "step": 809, "train_runtime": 2056.6395, "train_tokens_per_second": 1097.391 }, { "epoch": 0.06508768757909962, "grad_norm": 0.3474142849445343, "learning_rate": 0.00014631051752921536, "loss": 1.0004, "num_input_tokens_seen": 2259454, "step": 810, "train_runtime": 2058.7849, "train_tokens_per_second": 1097.47 }, { "epoch": 0.06516804274895036, "grad_norm": 0.2869245111942291, "learning_rate": 0.00014624373956594324, "loss": 0.8194, "num_input_tokens_seen": 2262010, "step": 811, "train_runtime": 2062.842, "train_tokens_per_second": 1096.55 }, { "epoch": 0.0652483979188011, "grad_norm": 0.287260502576828, "learning_rate": 0.00014617696160267114, "loss": 0.5982, "num_input_tokens_seen": 2264084, "step": 812, "train_runtime": 2064.7321, "train_tokens_per_second": 1096.551 }, { "epoch": 0.06532875308865184, "grad_norm": 0.3509330451488495, "learning_rate": 0.000146110183639399, "loss": 0.9707, "num_input_tokens_seen": 2267016, "step": 813, "train_runtime": 2067.0734, "train_tokens_per_second": 1096.727 }, { "epoch": 0.06540910825850259, "grad_norm": 0.2859979271888733, "learning_rate": 0.00014604340567612688, "loss": 1.0721, "num_input_tokens_seen": 2269022, "step": 814, "train_runtime": 2068.8138, "train_tokens_per_second": 1096.774 }, { "epoch": 0.06548946342835332, "grad_norm": 0.3086937367916107, "learning_rate": 0.00014597662771285476, "loss": 1.0999, "num_input_tokens_seen": 2271010, "step": 815, "train_runtime": 2070.6374, "train_tokens_per_second": 1096.769 }, { "epoch": 0.06556981859820406, "grad_norm": 0.3894175589084625, "learning_rate": 0.00014590984974958263, "loss": 0.9667, "num_input_tokens_seen": 2272986, "step": 816, "train_runtime": 2072.5372, "train_tokens_per_second": 1096.717 }, { "epoch": 0.0656501737680548, "grad_norm": 0.29864999651908875, "learning_rate": 0.0001458430717863105, "loss": 1.132, "num_input_tokens_seen": 2276418, "step": 817, "train_runtime": 2075.0689, "train_tokens_per_second": 1097.032 }, { "epoch": 0.06573052893790554, "grad_norm": 0.2906742990016937, "learning_rate": 0.0001457762938230384, "loss": 1.0294, "num_input_tokens_seen": 2279166, "step": 818, "train_runtime": 2077.2069, "train_tokens_per_second": 1097.226 }, { "epoch": 0.06581088410775628, "grad_norm": 0.35557055473327637, "learning_rate": 0.00014570951585976628, "loss": 1.4576, "num_input_tokens_seen": 2282628, "step": 819, "train_runtime": 2079.7498, "train_tokens_per_second": 1097.549 }, { "epoch": 0.06589123927760702, "grad_norm": 0.33739808201789856, "learning_rate": 0.00014564273789649415, "loss": 1.0374, "num_input_tokens_seen": 2284800, "step": 820, "train_runtime": 2081.7058, "train_tokens_per_second": 1097.561 }, { "epoch": 0.06597159444745776, "grad_norm": 0.3174346089363098, "learning_rate": 0.00014557595993322205, "loss": 1.2244, "num_input_tokens_seen": 2286730, "step": 821, "train_runtime": 2083.4607, "train_tokens_per_second": 1097.563 }, { "epoch": 0.06605194961730851, "grad_norm": 0.3701056241989136, "learning_rate": 0.00014550918196994992, "loss": 1.0022, "num_input_tokens_seen": 2288096, "step": 822, "train_runtime": 2085.0081, "train_tokens_per_second": 1097.404 }, { "epoch": 0.06613230478715924, "grad_norm": 0.362595796585083, "learning_rate": 0.00014544240400667782, "loss": 1.1043, "num_input_tokens_seen": 2293658, "step": 823, "train_runtime": 2088.7749, "train_tokens_per_second": 1098.088 }, { "epoch": 0.06621265995700998, "grad_norm": 0.3538409471511841, "learning_rate": 0.0001453756260434057, "loss": 0.7711, "num_input_tokens_seen": 2297144, "step": 824, "train_runtime": 2091.3574, "train_tokens_per_second": 1098.399 }, { "epoch": 0.06629301512686073, "grad_norm": 0.3676832318305969, "learning_rate": 0.00014530884808013357, "loss": 0.9033, "num_input_tokens_seen": 2298690, "step": 825, "train_runtime": 2092.9404, "train_tokens_per_second": 1098.306 }, { "epoch": 0.06637337029671146, "grad_norm": 0.3476060628890991, "learning_rate": 0.00014524207011686144, "loss": 0.937, "num_input_tokens_seen": 2302140, "step": 826, "train_runtime": 2095.5397, "train_tokens_per_second": 1098.59 }, { "epoch": 0.06645372546656221, "grad_norm": 0.3231962323188782, "learning_rate": 0.00014517529215358932, "loss": 1.0176, "num_input_tokens_seen": 2306764, "step": 827, "train_runtime": 2098.8486, "train_tokens_per_second": 1099.062 }, { "epoch": 0.06653408063641295, "grad_norm": 0.297827810049057, "learning_rate": 0.00014510851419031722, "loss": 1.3588, "num_input_tokens_seen": 2310012, "step": 828, "train_runtime": 2101.2968, "train_tokens_per_second": 1099.327 }, { "epoch": 0.06661443580626368, "grad_norm": 0.3019084334373474, "learning_rate": 0.0001450417362270451, "loss": 1.1462, "num_input_tokens_seen": 2313408, "step": 829, "train_runtime": 2103.8391, "train_tokens_per_second": 1099.613 }, { "epoch": 0.06669479097611443, "grad_norm": 0.30470922589302063, "learning_rate": 0.00014497495826377296, "loss": 0.6886, "num_input_tokens_seen": 2315554, "step": 830, "train_runtime": 2105.8151, "train_tokens_per_second": 1099.6 }, { "epoch": 0.06677514614596516, "grad_norm": 0.28943684697151184, "learning_rate": 0.00014490818030050084, "loss": 0.826, "num_input_tokens_seen": 2318524, "step": 831, "train_runtime": 2108.13, "train_tokens_per_second": 1099.801 }, { "epoch": 0.06685550131581591, "grad_norm": 0.24569806456565857, "learning_rate": 0.0001448414023372287, "loss": 1.0543, "num_input_tokens_seen": 2322384, "step": 832, "train_runtime": 2110.9425, "train_tokens_per_second": 1100.165 }, { "epoch": 0.06693585648566665, "grad_norm": 0.36814194917678833, "learning_rate": 0.00014477462437395658, "loss": 1.1182, "num_input_tokens_seen": 2324442, "step": 833, "train_runtime": 2112.8781, "train_tokens_per_second": 1100.131 }, { "epoch": 0.06701621165551738, "grad_norm": 0.31107985973358154, "learning_rate": 0.00014470784641068448, "loss": 1.1417, "num_input_tokens_seen": 2327314, "step": 834, "train_runtime": 2115.1806, "train_tokens_per_second": 1100.291 }, { "epoch": 0.06709656682536813, "grad_norm": 0.31709203124046326, "learning_rate": 0.00014464106844741236, "loss": 1.2616, "num_input_tokens_seen": 2330790, "step": 835, "train_runtime": 2117.7567, "train_tokens_per_second": 1100.594 }, { "epoch": 0.06717692199521887, "grad_norm": 0.2921311557292938, "learning_rate": 0.00014457429048414023, "loss": 1.684, "num_input_tokens_seen": 2334704, "step": 836, "train_runtime": 2120.5867, "train_tokens_per_second": 1100.971 }, { "epoch": 0.0672572771650696, "grad_norm": 0.33907264471054077, "learning_rate": 0.0001445075125208681, "loss": 1.0741, "num_input_tokens_seen": 2336548, "step": 837, "train_runtime": 2122.2753, "train_tokens_per_second": 1100.964 }, { "epoch": 0.06733763233492035, "grad_norm": 0.37785765528678894, "learning_rate": 0.000144440734557596, "loss": 0.9078, "num_input_tokens_seen": 2339354, "step": 838, "train_runtime": 2124.4297, "train_tokens_per_second": 1101.168 }, { "epoch": 0.06741798750477108, "grad_norm": 0.28260868787765503, "learning_rate": 0.00014437395659432388, "loss": 0.5368, "num_input_tokens_seen": 2341304, "step": 839, "train_runtime": 2126.1999, "train_tokens_per_second": 1101.168 }, { "epoch": 0.06749834267462183, "grad_norm": 0.32741856575012207, "learning_rate": 0.00014430717863105178, "loss": 0.8695, "num_input_tokens_seen": 2344036, "step": 840, "train_runtime": 2128.4882, "train_tokens_per_second": 1101.268 }, { "epoch": 0.06757869784447257, "grad_norm": 0.2809388041496277, "learning_rate": 0.00014424040066777965, "loss": 0.9008, "num_input_tokens_seen": 2347434, "step": 841, "train_runtime": 2133.0161, "train_tokens_per_second": 1100.523 }, { "epoch": 0.0676590530143233, "grad_norm": 0.319504052400589, "learning_rate": 0.00014417362270450752, "loss": 0.8029, "num_input_tokens_seen": 2349046, "step": 842, "train_runtime": 2134.6633, "train_tokens_per_second": 1100.429 }, { "epoch": 0.06773940818417405, "grad_norm": 0.39870065450668335, "learning_rate": 0.0001441068447412354, "loss": 0.8163, "num_input_tokens_seen": 2350854, "step": 843, "train_runtime": 2136.3911, "train_tokens_per_second": 1100.386 }, { "epoch": 0.06781976335402479, "grad_norm": 0.3060488700866699, "learning_rate": 0.0001440400667779633, "loss": 1.4375, "num_input_tokens_seen": 2352832, "step": 844, "train_runtime": 2138.0359, "train_tokens_per_second": 1100.464 }, { "epoch": 0.06790011852387554, "grad_norm": 0.3320007622241974, "learning_rate": 0.00014397328881469117, "loss": 1.0134, "num_input_tokens_seen": 2355290, "step": 845, "train_runtime": 2140.1806, "train_tokens_per_second": 1100.51 }, { "epoch": 0.06798047369372627, "grad_norm": 0.27483120560646057, "learning_rate": 0.00014390651085141904, "loss": 1.0031, "num_input_tokens_seen": 2358390, "step": 846, "train_runtime": 2142.6555, "train_tokens_per_second": 1100.686 }, { "epoch": 0.068060828863577, "grad_norm": 0.2573234736919403, "learning_rate": 0.00014383973288814692, "loss": 0.7291, "num_input_tokens_seen": 2363332, "step": 847, "train_runtime": 2145.9755, "train_tokens_per_second": 1101.286 }, { "epoch": 0.06814118403342775, "grad_norm": 0.36865949630737305, "learning_rate": 0.0001437729549248748, "loss": 0.9043, "num_input_tokens_seen": 2364422, "step": 848, "train_runtime": 2147.4875, "train_tokens_per_second": 1101.018 }, { "epoch": 0.06822153920327849, "grad_norm": 0.34308263659477234, "learning_rate": 0.00014370617696160266, "loss": 0.9577, "num_input_tokens_seen": 2368038, "step": 849, "train_runtime": 2150.1985, "train_tokens_per_second": 1101.311 }, { "epoch": 0.06830189437312924, "grad_norm": 0.31565070152282715, "learning_rate": 0.00014363939899833056, "loss": 0.8389, "num_input_tokens_seen": 2369928, "step": 850, "train_runtime": 2151.9561, "train_tokens_per_second": 1101.29 }, { "epoch": 0.06838224954297997, "grad_norm": 0.3276442289352417, "learning_rate": 0.00014357262103505844, "loss": 1.0645, "num_input_tokens_seen": 2372630, "step": 851, "train_runtime": 2154.1483, "train_tokens_per_second": 1101.424 }, { "epoch": 0.06846260471283071, "grad_norm": 0.33249008655548096, "learning_rate": 0.0001435058430717863, "loss": 0.9825, "num_input_tokens_seen": 2375532, "step": 852, "train_runtime": 2156.4452, "train_tokens_per_second": 1101.596 }, { "epoch": 0.06854295988268146, "grad_norm": 0.30959081649780273, "learning_rate": 0.00014343906510851418, "loss": 0.7941, "num_input_tokens_seen": 2377566, "step": 853, "train_runtime": 2158.2389, "train_tokens_per_second": 1101.623 }, { "epoch": 0.06862331505253219, "grad_norm": 0.33025220036506653, "learning_rate": 0.00014337228714524205, "loss": 1.0709, "num_input_tokens_seen": 2379800, "step": 854, "train_runtime": 2160.1969, "train_tokens_per_second": 1101.659 }, { "epoch": 0.06870367022238293, "grad_norm": 0.32086995244026184, "learning_rate": 0.00014330550918196995, "loss": 1.1182, "num_input_tokens_seen": 2382506, "step": 855, "train_runtime": 2162.4812, "train_tokens_per_second": 1101.746 }, { "epoch": 0.06878402539223367, "grad_norm": 0.2943474054336548, "learning_rate": 0.00014323873121869783, "loss": 0.9666, "num_input_tokens_seen": 2383976, "step": 856, "train_runtime": 2164.0846, "train_tokens_per_second": 1101.609 }, { "epoch": 0.06886438056208441, "grad_norm": 0.25427353382110596, "learning_rate": 0.00014317195325542573, "loss": 0.8151, "num_input_tokens_seen": 2386344, "step": 857, "train_runtime": 2166.0732, "train_tokens_per_second": 1101.691 }, { "epoch": 0.06894473573193516, "grad_norm": 0.3360339403152466, "learning_rate": 0.0001431051752921536, "loss": 1.0084, "num_input_tokens_seen": 2388192, "step": 858, "train_runtime": 2167.7965, "train_tokens_per_second": 1101.668 }, { "epoch": 0.0690250909017859, "grad_norm": 0.2708817422389984, "learning_rate": 0.00014303839732888147, "loss": 0.7753, "num_input_tokens_seen": 2390812, "step": 859, "train_runtime": 2169.9736, "train_tokens_per_second": 1101.77 }, { "epoch": 0.06910544607163663, "grad_norm": 0.28567513823509216, "learning_rate": 0.00014297161936560937, "loss": 0.9032, "num_input_tokens_seen": 2393582, "step": 860, "train_runtime": 2172.2403, "train_tokens_per_second": 1101.896 }, { "epoch": 0.06918580124148738, "grad_norm": 0.3475951850414276, "learning_rate": 0.00014290484140233725, "loss": 1.1451, "num_input_tokens_seen": 2395954, "step": 861, "train_runtime": 2174.2098, "train_tokens_per_second": 1101.988 }, { "epoch": 0.06926615641133811, "grad_norm": 0.27370399236679077, "learning_rate": 0.00014283806343906512, "loss": 0.6476, "num_input_tokens_seen": 2399068, "step": 862, "train_runtime": 2176.6151, "train_tokens_per_second": 1102.201 }, { "epoch": 0.06934651158118886, "grad_norm": 0.3076470196247101, "learning_rate": 0.000142771285475793, "loss": 1.3084, "num_input_tokens_seen": 2402940, "step": 863, "train_runtime": 2179.3847, "train_tokens_per_second": 1102.577 }, { "epoch": 0.0694268667510396, "grad_norm": 0.26172661781311035, "learning_rate": 0.00014270450751252087, "loss": 0.9147, "num_input_tokens_seen": 2405548, "step": 864, "train_runtime": 2181.4025, "train_tokens_per_second": 1102.753 }, { "epoch": 0.06950722192089033, "grad_norm": 0.23512691259384155, "learning_rate": 0.00014263772954924874, "loss": 0.5001, "num_input_tokens_seen": 2408136, "step": 865, "train_runtime": 2183.4872, "train_tokens_per_second": 1102.885 }, { "epoch": 0.06958757709074108, "grad_norm": 0.32899776101112366, "learning_rate": 0.00014257095158597664, "loss": 0.7307, "num_input_tokens_seen": 2411650, "step": 866, "train_runtime": 2186.067, "train_tokens_per_second": 1103.191 }, { "epoch": 0.06966793226059181, "grad_norm": 0.3800621032714844, "learning_rate": 0.00014250417362270451, "loss": 1.2247, "num_input_tokens_seen": 2413314, "step": 867, "train_runtime": 2187.77, "train_tokens_per_second": 1103.093 }, { "epoch": 0.06974828743044256, "grad_norm": 0.3513256311416626, "learning_rate": 0.0001424373956594324, "loss": 1.1149, "num_input_tokens_seen": 2416568, "step": 868, "train_runtime": 2190.2241, "train_tokens_per_second": 1103.343 }, { "epoch": 0.0698286426002933, "grad_norm": 0.2976699769496918, "learning_rate": 0.00014237061769616026, "loss": 1.0455, "num_input_tokens_seen": 2418772, "step": 869, "train_runtime": 2192.1403, "train_tokens_per_second": 1103.384 }, { "epoch": 0.06990899777014403, "grad_norm": 0.3433803617954254, "learning_rate": 0.00014230383973288813, "loss": 0.7543, "num_input_tokens_seen": 2422658, "step": 870, "train_runtime": 2194.9572, "train_tokens_per_second": 1103.738 }, { "epoch": 0.06998935293999478, "grad_norm": 0.2978561520576477, "learning_rate": 0.00014223706176961603, "loss": 0.9657, "num_input_tokens_seen": 2426162, "step": 871, "train_runtime": 2199.5277, "train_tokens_per_second": 1103.038 }, { "epoch": 0.07006970810984552, "grad_norm": 0.32957741618156433, "learning_rate": 0.0001421702838063439, "loss": 1.1739, "num_input_tokens_seen": 2429586, "step": 872, "train_runtime": 2202.1639, "train_tokens_per_second": 1103.272 }, { "epoch": 0.07015006327969625, "grad_norm": 0.27114084362983704, "learning_rate": 0.00014210350584307178, "loss": 0.817, "num_input_tokens_seen": 2432888, "step": 873, "train_runtime": 2204.6522, "train_tokens_per_second": 1103.525 }, { "epoch": 0.070230418449547, "grad_norm": 0.29244133830070496, "learning_rate": 0.00014203672787979968, "loss": 0.8771, "num_input_tokens_seen": 2437370, "step": 874, "train_runtime": 2207.811, "train_tokens_per_second": 1103.976 }, { "epoch": 0.07031077361939773, "grad_norm": 0.32263773679733276, "learning_rate": 0.00014196994991652755, "loss": 1.2008, "num_input_tokens_seen": 2440254, "step": 875, "train_runtime": 2210.0591, "train_tokens_per_second": 1104.158 }, { "epoch": 0.07039112878924848, "grad_norm": 0.31919553875923157, "learning_rate": 0.00014190317195325545, "loss": 1.3151, "num_input_tokens_seen": 2443340, "step": 876, "train_runtime": 2212.5313, "train_tokens_per_second": 1104.319 }, { "epoch": 0.07047148395909922, "grad_norm": 0.35774099826812744, "learning_rate": 0.00014183639398998333, "loss": 1.3196, "num_input_tokens_seen": 2448938, "step": 877, "train_runtime": 2216.4178, "train_tokens_per_second": 1104.908 }, { "epoch": 0.07055183912894995, "grad_norm": 0.3260195255279541, "learning_rate": 0.0001417696160267112, "loss": 1.1791, "num_input_tokens_seen": 2450678, "step": 878, "train_runtime": 2218.0835, "train_tokens_per_second": 1104.863 }, { "epoch": 0.0706321942988007, "grad_norm": 0.329819917678833, "learning_rate": 0.00014170283806343907, "loss": 0.8675, "num_input_tokens_seen": 2452838, "step": 879, "train_runtime": 2219.9794, "train_tokens_per_second": 1104.892 }, { "epoch": 0.07071254946865144, "grad_norm": 0.28507351875305176, "learning_rate": 0.00014163606010016695, "loss": 0.8498, "num_input_tokens_seen": 2455320, "step": 880, "train_runtime": 2222.0154, "train_tokens_per_second": 1104.997 }, { "epoch": 0.07079290463850219, "grad_norm": 0.33230507373809814, "learning_rate": 0.00014156928213689482, "loss": 0.9981, "num_input_tokens_seen": 2458492, "step": 881, "train_runtime": 2224.3685, "train_tokens_per_second": 1105.254 }, { "epoch": 0.07087325980835292, "grad_norm": 0.3293096423149109, "learning_rate": 0.00014150250417362272, "loss": 0.9813, "num_input_tokens_seen": 2461146, "step": 882, "train_runtime": 2226.5517, "train_tokens_per_second": 1105.362 }, { "epoch": 0.07095361497820366, "grad_norm": 0.2984834909439087, "learning_rate": 0.0001414357262103506, "loss": 0.8875, "num_input_tokens_seen": 2463364, "step": 883, "train_runtime": 2228.509, "train_tokens_per_second": 1105.387 }, { "epoch": 0.0710339701480544, "grad_norm": 0.3159421980381012, "learning_rate": 0.00014136894824707847, "loss": 0.9008, "num_input_tokens_seen": 2468600, "step": 884, "train_runtime": 2232.2104, "train_tokens_per_second": 1105.899 }, { "epoch": 0.07111432531790514, "grad_norm": 0.2863374650478363, "learning_rate": 0.00014130217028380634, "loss": 0.71, "num_input_tokens_seen": 2471004, "step": 885, "train_runtime": 2234.2492, "train_tokens_per_second": 1105.966 }, { "epoch": 0.07119468048775589, "grad_norm": 0.35992884635925293, "learning_rate": 0.0001412353923205342, "loss": 0.9864, "num_input_tokens_seen": 2472852, "step": 886, "train_runtime": 2236.0199, "train_tokens_per_second": 1105.917 }, { "epoch": 0.07127503565760662, "grad_norm": 0.2793021500110626, "learning_rate": 0.0001411686143572621, "loss": 1.023, "num_input_tokens_seen": 2475582, "step": 887, "train_runtime": 2238.2781, "train_tokens_per_second": 1106.021 }, { "epoch": 0.07135539082745736, "grad_norm": 0.2968974709510803, "learning_rate": 0.00014110183639398999, "loss": 1.1568, "num_input_tokens_seen": 2477236, "step": 888, "train_runtime": 2239.9187, "train_tokens_per_second": 1105.949 }, { "epoch": 0.0714357459973081, "grad_norm": 0.2545320987701416, "learning_rate": 0.00014103505843071786, "loss": 0.9085, "num_input_tokens_seen": 2480568, "step": 889, "train_runtime": 2242.4181, "train_tokens_per_second": 1106.202 }, { "epoch": 0.07151610116715884, "grad_norm": 0.30533871054649353, "learning_rate": 0.00014096828046744576, "loss": 0.9795, "num_input_tokens_seen": 2483616, "step": 890, "train_runtime": 2244.7653, "train_tokens_per_second": 1106.403 }, { "epoch": 0.07159645633700958, "grad_norm": 0.32545360922813416, "learning_rate": 0.00014090150250417363, "loss": 1.3072, "num_input_tokens_seen": 2486592, "step": 891, "train_runtime": 2247.1278, "train_tokens_per_second": 1106.565 }, { "epoch": 0.07167681150686032, "grad_norm": 0.39703962206840515, "learning_rate": 0.00014083472454090153, "loss": 0.9259, "num_input_tokens_seen": 2489772, "step": 892, "train_runtime": 2249.528, "train_tokens_per_second": 1106.797 }, { "epoch": 0.07175716667671106, "grad_norm": 0.30668574571609497, "learning_rate": 0.0001407679465776294, "loss": 0.7198, "num_input_tokens_seen": 2491744, "step": 893, "train_runtime": 2251.3359, "train_tokens_per_second": 1106.785 }, { "epoch": 0.07183752184656181, "grad_norm": 0.3326931297779083, "learning_rate": 0.00014070116861435728, "loss": 0.8413, "num_input_tokens_seen": 2493878, "step": 894, "train_runtime": 2253.2432, "train_tokens_per_second": 1106.795 }, { "epoch": 0.07191787701641254, "grad_norm": 0.3320900797843933, "learning_rate": 0.00014063439065108515, "loss": 1.0939, "num_input_tokens_seen": 2497272, "step": 895, "train_runtime": 2255.8107, "train_tokens_per_second": 1107.04 }, { "epoch": 0.07199823218626328, "grad_norm": 0.2334388792514801, "learning_rate": 0.00014056761268781303, "loss": 0.6992, "num_input_tokens_seen": 2500572, "step": 896, "train_runtime": 2258.2501, "train_tokens_per_second": 1107.305 }, { "epoch": 0.07207858735611403, "grad_norm": 0.2968538701534271, "learning_rate": 0.0001405008347245409, "loss": 0.9063, "num_input_tokens_seen": 2503412, "step": 897, "train_runtime": 2260.531, "train_tokens_per_second": 1107.444 }, { "epoch": 0.07215894252596476, "grad_norm": 0.4175359010696411, "learning_rate": 0.0001404340567612688, "loss": 1.0619, "num_input_tokens_seen": 2504978, "step": 898, "train_runtime": 2262.1536, "train_tokens_per_second": 1107.342 }, { "epoch": 0.07223929769581551, "grad_norm": 0.29439496994018555, "learning_rate": 0.00014036727879799667, "loss": 1.1068, "num_input_tokens_seen": 2507652, "step": 899, "train_runtime": 2264.3545, "train_tokens_per_second": 1107.447 }, { "epoch": 0.07231965286566625, "grad_norm": 0.25840285420417786, "learning_rate": 0.00014030050083472454, "loss": 0.6788, "num_input_tokens_seen": 2510880, "step": 900, "train_runtime": 2266.7892, "train_tokens_per_second": 1107.681 }, { "epoch": 0.07231965286566625, "eval_loss": 0.9866039752960205, "eval_runtime": 92.2639, "eval_samples_per_second": 10.773, "eval_steps_per_second": 5.387, "num_input_tokens_seen": 2510880, "step": 900 }, { "epoch": 0.07240000803551698, "grad_norm": 0.3053082525730133, "learning_rate": 0.00014023372287145242, "loss": 0.8406, "num_input_tokens_seen": 2515564, "step": 901, "train_runtime": 2364.3843, "train_tokens_per_second": 1063.94 }, { "epoch": 0.07248036320536773, "grad_norm": 0.3301785886287689, "learning_rate": 0.0001401669449081803, "loss": 0.9861, "num_input_tokens_seen": 2517432, "step": 902, "train_runtime": 2366.1807, "train_tokens_per_second": 1063.922 }, { "epoch": 0.07256071837521846, "grad_norm": 0.25372639298439026, "learning_rate": 0.0001401001669449082, "loss": 0.75, "num_input_tokens_seen": 2520406, "step": 903, "train_runtime": 2368.4827, "train_tokens_per_second": 1064.144 }, { "epoch": 0.07264107354506921, "grad_norm": 0.2701776921749115, "learning_rate": 0.00014003338898163606, "loss": 1.0623, "num_input_tokens_seen": 2522934, "step": 904, "train_runtime": 2370.5351, "train_tokens_per_second": 1064.289 }, { "epoch": 0.07272142871491995, "grad_norm": 0.4370821714401245, "learning_rate": 0.00013996661101836394, "loss": 1.2123, "num_input_tokens_seen": 2524668, "step": 905, "train_runtime": 2372.2502, "train_tokens_per_second": 1064.25 }, { "epoch": 0.07280178388477068, "grad_norm": 0.28252699971199036, "learning_rate": 0.0001398998330550918, "loss": 0.9468, "num_input_tokens_seen": 2527960, "step": 906, "train_runtime": 2374.7204, "train_tokens_per_second": 1064.53 }, { "epoch": 0.07288213905462143, "grad_norm": 0.42438647150993347, "learning_rate": 0.0001398330550918197, "loss": 0.9752, "num_input_tokens_seen": 2529190, "step": 907, "train_runtime": 2376.2171, "train_tokens_per_second": 1064.377 }, { "epoch": 0.07296249422447217, "grad_norm": 0.31667259335517883, "learning_rate": 0.00013976627712854758, "loss": 1.1575, "num_input_tokens_seen": 2531280, "step": 908, "train_runtime": 2378.042, "train_tokens_per_second": 1064.439 }, { "epoch": 0.0730428493943229, "grad_norm": 0.2693456709384918, "learning_rate": 0.00013969949916527548, "loss": 0.8908, "num_input_tokens_seen": 2534944, "step": 909, "train_runtime": 2380.7252, "train_tokens_per_second": 1064.778 }, { "epoch": 0.07312320456417365, "grad_norm": 0.30570200085639954, "learning_rate": 0.00013963272120200336, "loss": 0.8179, "num_input_tokens_seen": 2537856, "step": 910, "train_runtime": 2382.9982, "train_tokens_per_second": 1064.984 }, { "epoch": 0.07320355973402438, "grad_norm": 0.33213672041893005, "learning_rate": 0.00013956594323873123, "loss": 0.9409, "num_input_tokens_seen": 2540764, "step": 911, "train_runtime": 2385.2901, "train_tokens_per_second": 1065.18 }, { "epoch": 0.07328391490387513, "grad_norm": 0.2745407819747925, "learning_rate": 0.0001394991652754591, "loss": 0.8521, "num_input_tokens_seen": 2544394, "step": 912, "train_runtime": 2387.9627, "train_tokens_per_second": 1065.508 }, { "epoch": 0.07336427007372587, "grad_norm": 0.27919888496398926, "learning_rate": 0.00013943238731218698, "loss": 0.8954, "num_input_tokens_seen": 2546268, "step": 913, "train_runtime": 2389.7563, "train_tokens_per_second": 1065.493 }, { "epoch": 0.0734446252435766, "grad_norm": 0.3274606466293335, "learning_rate": 0.00013936560934891488, "loss": 1.2778, "num_input_tokens_seen": 2548368, "step": 914, "train_runtime": 2391.5747, "train_tokens_per_second": 1065.561 }, { "epoch": 0.07352498041342735, "grad_norm": 0.2568143606185913, "learning_rate": 0.00013929883138564275, "loss": 0.9203, "num_input_tokens_seen": 2552286, "step": 915, "train_runtime": 2394.4307, "train_tokens_per_second": 1065.926 }, { "epoch": 0.07360533558327809, "grad_norm": 0.32585129141807556, "learning_rate": 0.00013923205342237062, "loss": 1.0161, "num_input_tokens_seen": 2555594, "step": 916, "train_runtime": 2396.8311, "train_tokens_per_second": 1066.239 }, { "epoch": 0.07368569075312884, "grad_norm": 0.3598208427429199, "learning_rate": 0.0001391652754590985, "loss": 1.2984, "num_input_tokens_seen": 2557780, "step": 917, "train_runtime": 2398.7323, "train_tokens_per_second": 1066.305 }, { "epoch": 0.07376604592297957, "grad_norm": 3.1584792137145996, "learning_rate": 0.00013909849749582637, "loss": 0.9168, "num_input_tokens_seen": 2559650, "step": 918, "train_runtime": 2400.505, "train_tokens_per_second": 1066.296 }, { "epoch": 0.0738464010928303, "grad_norm": 0.20963475108146667, "learning_rate": 0.00013903171953255427, "loss": 0.7538, "num_input_tokens_seen": 2562186, "step": 919, "train_runtime": 2402.557, "train_tokens_per_second": 1066.441 }, { "epoch": 0.07392675626268105, "grad_norm": 0.33692628145217896, "learning_rate": 0.00013896494156928214, "loss": 0.9828, "num_input_tokens_seen": 2564266, "step": 920, "train_runtime": 2404.3244, "train_tokens_per_second": 1066.522 }, { "epoch": 0.07400711143253179, "grad_norm": 0.2947012186050415, "learning_rate": 0.00013889816360601002, "loss": 0.9959, "num_input_tokens_seen": 2567370, "step": 921, "train_runtime": 2406.7523, "train_tokens_per_second": 1066.736 }, { "epoch": 0.07408746660238254, "grad_norm": 0.24923081696033478, "learning_rate": 0.0001388313856427379, "loss": 0.7778, "num_input_tokens_seen": 2569422, "step": 922, "train_runtime": 2408.5658, "train_tokens_per_second": 1066.785 }, { "epoch": 0.07416782177223327, "grad_norm": 0.3389129042625427, "learning_rate": 0.00013876460767946576, "loss": 0.8421, "num_input_tokens_seen": 2573156, "step": 923, "train_runtime": 2411.4311, "train_tokens_per_second": 1067.066 }, { "epoch": 0.07424817694208401, "grad_norm": 0.33941352367401123, "learning_rate": 0.00013869782971619366, "loss": 0.7385, "num_input_tokens_seen": 2574820, "step": 924, "train_runtime": 2413.0289, "train_tokens_per_second": 1067.049 }, { "epoch": 0.07432853211193476, "grad_norm": 0.25243544578552246, "learning_rate": 0.00013863105175292154, "loss": 0.84, "num_input_tokens_seen": 2577314, "step": 925, "train_runtime": 2415.0644, "train_tokens_per_second": 1067.182 }, { "epoch": 0.07440888728178549, "grad_norm": 0.31679514050483704, "learning_rate": 0.00013856427378964944, "loss": 1.0994, "num_input_tokens_seen": 2579960, "step": 926, "train_runtime": 2417.1973, "train_tokens_per_second": 1067.335 }, { "epoch": 0.07448924245163623, "grad_norm": 0.31016841530799866, "learning_rate": 0.0001384974958263773, "loss": 1.0724, "num_input_tokens_seen": 2583246, "step": 927, "train_runtime": 2419.6613, "train_tokens_per_second": 1067.606 }, { "epoch": 0.07456959762148697, "grad_norm": 0.31450945138931274, "learning_rate": 0.00013843071786310518, "loss": 1.0615, "num_input_tokens_seen": 2585238, "step": 928, "train_runtime": 2421.4737, "train_tokens_per_second": 1067.63 }, { "epoch": 0.07464995279133771, "grad_norm": 0.33551156520843506, "learning_rate": 0.00013836393989983308, "loss": 1.165, "num_input_tokens_seen": 2588802, "step": 929, "train_runtime": 2424.0847, "train_tokens_per_second": 1067.95 }, { "epoch": 0.07473030796118846, "grad_norm": 0.31785404682159424, "learning_rate": 0.00013829716193656096, "loss": 0.8766, "num_input_tokens_seen": 2591080, "step": 930, "train_runtime": 2425.9993, "train_tokens_per_second": 1068.046 }, { "epoch": 0.07481066313103919, "grad_norm": 0.3630451560020447, "learning_rate": 0.00013823038397328883, "loss": 1.1808, "num_input_tokens_seen": 2593852, "step": 931, "train_runtime": 2430.233, "train_tokens_per_second": 1067.326 }, { "epoch": 0.07489101830088993, "grad_norm": 0.3400619328022003, "learning_rate": 0.0001381636060100167, "loss": 0.9443, "num_input_tokens_seen": 2595960, "step": 932, "train_runtime": 2432.1372, "train_tokens_per_second": 1067.358 }, { "epoch": 0.07497137347074068, "grad_norm": 0.3520766496658325, "learning_rate": 0.00013809682804674458, "loss": 1.0372, "num_input_tokens_seen": 2597788, "step": 933, "train_runtime": 2433.888, "train_tokens_per_second": 1067.341 }, { "epoch": 0.07505172864059141, "grad_norm": 0.3400426208972931, "learning_rate": 0.00013803005008347245, "loss": 1.0806, "num_input_tokens_seen": 2599384, "step": 934, "train_runtime": 2435.563, "train_tokens_per_second": 1067.262 }, { "epoch": 0.07513208381044216, "grad_norm": 0.2729679048061371, "learning_rate": 0.00013796327212020035, "loss": 0.7861, "num_input_tokens_seen": 2601622, "step": 935, "train_runtime": 2437.4584, "train_tokens_per_second": 1067.35 }, { "epoch": 0.0752124389802929, "grad_norm": 0.30108392238616943, "learning_rate": 0.00013789649415692822, "loss": 0.9608, "num_input_tokens_seen": 2603164, "step": 936, "train_runtime": 2439.0252, "train_tokens_per_second": 1067.297 }, { "epoch": 0.07529279415014363, "grad_norm": 0.35101914405822754, "learning_rate": 0.0001378297161936561, "loss": 0.8204, "num_input_tokens_seen": 2605520, "step": 937, "train_runtime": 2440.953, "train_tokens_per_second": 1067.419 }, { "epoch": 0.07537314931999438, "grad_norm": 0.2950875163078308, "learning_rate": 0.00013776293823038397, "loss": 0.9251, "num_input_tokens_seen": 2608150, "step": 938, "train_runtime": 2443.0413, "train_tokens_per_second": 1067.583 }, { "epoch": 0.07545350448984511, "grad_norm": 0.36441686749458313, "learning_rate": 0.00013769616026711184, "loss": 0.9219, "num_input_tokens_seen": 2611550, "step": 939, "train_runtime": 2445.6027, "train_tokens_per_second": 1067.855 }, { "epoch": 0.07553385965969586, "grad_norm": 0.33548998832702637, "learning_rate": 0.00013762938230383974, "loss": 0.7137, "num_input_tokens_seen": 2615298, "step": 940, "train_runtime": 2448.4347, "train_tokens_per_second": 1068.151 }, { "epoch": 0.0756142148295466, "grad_norm": 0.35290947556495667, "learning_rate": 0.00013756260434056762, "loss": 1.067, "num_input_tokens_seen": 2617814, "step": 941, "train_runtime": 2450.4719, "train_tokens_per_second": 1068.29 }, { "epoch": 0.07569456999939733, "grad_norm": 0.3726901710033417, "learning_rate": 0.0001374958263772955, "loss": 1.0097, "num_input_tokens_seen": 2620472, "step": 942, "train_runtime": 2452.5967, "train_tokens_per_second": 1068.448 }, { "epoch": 0.07577492516924808, "grad_norm": 0.34148970246315, "learning_rate": 0.0001374290484140234, "loss": 0.7774, "num_input_tokens_seen": 2622866, "step": 943, "train_runtime": 2454.4761, "train_tokens_per_second": 1068.605 }, { "epoch": 0.07585528033909882, "grad_norm": 0.30516350269317627, "learning_rate": 0.00013736227045075126, "loss": 1.0457, "num_input_tokens_seen": 2626722, "step": 944, "train_runtime": 2457.2673, "train_tokens_per_second": 1068.961 }, { "epoch": 0.07593563550894955, "grad_norm": 0.3085141181945801, "learning_rate": 0.00013729549248747916, "loss": 0.8317, "num_input_tokens_seen": 2629280, "step": 945, "train_runtime": 2459.3703, "train_tokens_per_second": 1069.087 }, { "epoch": 0.0760159906788003, "grad_norm": 0.2886466383934021, "learning_rate": 0.00013722871452420704, "loss": 1.0737, "num_input_tokens_seen": 2632166, "step": 946, "train_runtime": 2461.6671, "train_tokens_per_second": 1069.262 }, { "epoch": 0.07609634584865103, "grad_norm": 0.34234121441841125, "learning_rate": 0.0001371619365609349, "loss": 1.1575, "num_input_tokens_seen": 2634576, "step": 947, "train_runtime": 2463.6806, "train_tokens_per_second": 1069.366 }, { "epoch": 0.07617670101850178, "grad_norm": 0.33628860116004944, "learning_rate": 0.00013709515859766278, "loss": 0.769, "num_input_tokens_seen": 2638766, "step": 948, "train_runtime": 2466.7, "train_tokens_per_second": 1069.756 }, { "epoch": 0.07625705618835252, "grad_norm": 0.30892881751060486, "learning_rate": 0.00013702838063439065, "loss": 0.8611, "num_input_tokens_seen": 2640364, "step": 949, "train_runtime": 2468.3586, "train_tokens_per_second": 1069.684 }, { "epoch": 0.07633741135820325, "grad_norm": 0.3496696949005127, "learning_rate": 0.00013696160267111853, "loss": 1.0535, "num_input_tokens_seen": 2642190, "step": 950, "train_runtime": 2470.1155, "train_tokens_per_second": 1069.663 }, { "epoch": 0.076417766528054, "grad_norm": 0.37416523694992065, "learning_rate": 0.00013689482470784643, "loss": 0.9155, "num_input_tokens_seen": 2644842, "step": 951, "train_runtime": 2472.3448, "train_tokens_per_second": 1069.771 }, { "epoch": 0.07649812169790474, "grad_norm": 0.32983753085136414, "learning_rate": 0.0001368280467445743, "loss": 1.0483, "num_input_tokens_seen": 2648056, "step": 952, "train_runtime": 2474.7585, "train_tokens_per_second": 1070.026 }, { "epoch": 0.07657847686775549, "grad_norm": 0.30027881264686584, "learning_rate": 0.00013676126878130217, "loss": 1.0072, "num_input_tokens_seen": 2651264, "step": 953, "train_runtime": 2477.2327, "train_tokens_per_second": 1070.252 }, { "epoch": 0.07665883203760622, "grad_norm": 0.2947307825088501, "learning_rate": 0.00013669449081803005, "loss": 0.8835, "num_input_tokens_seen": 2653084, "step": 954, "train_runtime": 2479.0202, "train_tokens_per_second": 1070.215 }, { "epoch": 0.07673918720745695, "grad_norm": 0.3923710584640503, "learning_rate": 0.00013662771285475792, "loss": 1.1733, "num_input_tokens_seen": 2655462, "step": 955, "train_runtime": 2480.9973, "train_tokens_per_second": 1070.32 }, { "epoch": 0.0768195423773077, "grad_norm": 0.3278249204158783, "learning_rate": 0.00013656093489148582, "loss": 0.8441, "num_input_tokens_seen": 2660804, "step": 956, "train_runtime": 2484.6748, "train_tokens_per_second": 1070.886 }, { "epoch": 0.07689989754715844, "grad_norm": 0.3549589514732361, "learning_rate": 0.0001364941569282137, "loss": 1.2839, "num_input_tokens_seen": 2663256, "step": 957, "train_runtime": 2486.7036, "train_tokens_per_second": 1070.999 }, { "epoch": 0.07698025271700919, "grad_norm": 0.2980327010154724, "learning_rate": 0.00013642737896494157, "loss": 0.885, "num_input_tokens_seen": 2665716, "step": 958, "train_runtime": 2488.7584, "train_tokens_per_second": 1071.103 }, { "epoch": 0.07706060788685992, "grad_norm": 0.26402148604393005, "learning_rate": 0.00013636060100166944, "loss": 0.8327, "num_input_tokens_seen": 2671606, "step": 959, "train_runtime": 2492.6877, "train_tokens_per_second": 1071.777 }, { "epoch": 0.07714096305671066, "grad_norm": 0.2681846618652344, "learning_rate": 0.00013629382303839734, "loss": 1.0438, "num_input_tokens_seen": 2674746, "step": 960, "train_runtime": 2495.1259, "train_tokens_per_second": 1071.988 }, { "epoch": 0.0772213182265614, "grad_norm": 0.2988883852958679, "learning_rate": 0.00013622704507512521, "loss": 0.9291, "num_input_tokens_seen": 2677738, "step": 961, "train_runtime": 2499.5586, "train_tokens_per_second": 1071.284 }, { "epoch": 0.07730167339641214, "grad_norm": 0.32819023728370667, "learning_rate": 0.00013616026711185311, "loss": 1.003, "num_input_tokens_seen": 2680480, "step": 962, "train_runtime": 2501.7862, "train_tokens_per_second": 1071.427 }, { "epoch": 0.07738202856626288, "grad_norm": 0.33189529180526733, "learning_rate": 0.000136093489148581, "loss": 1.0143, "num_input_tokens_seen": 2683808, "step": 963, "train_runtime": 2504.2769, "train_tokens_per_second": 1071.69 }, { "epoch": 0.07746238373611362, "grad_norm": 0.410520076751709, "learning_rate": 0.00013602671118530886, "loss": 0.9478, "num_input_tokens_seen": 2684988, "step": 964, "train_runtime": 2505.7765, "train_tokens_per_second": 1071.519 }, { "epoch": 0.07754273890596436, "grad_norm": 0.3094470798969269, "learning_rate": 0.00013595993322203673, "loss": 0.9913, "num_input_tokens_seen": 2687546, "step": 965, "train_runtime": 2507.8293, "train_tokens_per_second": 1071.662 }, { "epoch": 0.07762309407581511, "grad_norm": 0.29441124200820923, "learning_rate": 0.0001358931552587646, "loss": 1.0393, "num_input_tokens_seen": 2689618, "step": 966, "train_runtime": 2509.7037, "train_tokens_per_second": 1071.687 }, { "epoch": 0.07770344924566584, "grad_norm": 0.3093130886554718, "learning_rate": 0.0001358263772954925, "loss": 0.9381, "num_input_tokens_seen": 2692652, "step": 967, "train_runtime": 2512.1247, "train_tokens_per_second": 1071.862 }, { "epoch": 0.07778380441551658, "grad_norm": 0.28437837958335876, "learning_rate": 0.00013575959933222038, "loss": 1.3758, "num_input_tokens_seen": 2696322, "step": 968, "train_runtime": 2514.8131, "train_tokens_per_second": 1072.176 }, { "epoch": 0.07786415958536733, "grad_norm": 0.2774305045604706, "learning_rate": 0.00013569282136894825, "loss": 1.0696, "num_input_tokens_seen": 2698352, "step": 969, "train_runtime": 2516.584, "train_tokens_per_second": 1072.228 }, { "epoch": 0.07794451475521806, "grad_norm": 0.26283907890319824, "learning_rate": 0.00013562604340567613, "loss": 0.8386, "num_input_tokens_seen": 2700488, "step": 970, "train_runtime": 2518.421, "train_tokens_per_second": 1072.294 }, { "epoch": 0.07802486992506881, "grad_norm": 0.2612572908401489, "learning_rate": 0.000135559265442404, "loss": 0.9145, "num_input_tokens_seen": 2703334, "step": 971, "train_runtime": 2520.606, "train_tokens_per_second": 1072.494 }, { "epoch": 0.07810522509491954, "grad_norm": 0.28983965516090393, "learning_rate": 0.0001354924874791319, "loss": 0.9132, "num_input_tokens_seen": 2705586, "step": 972, "train_runtime": 2522.4971, "train_tokens_per_second": 1072.582 }, { "epoch": 0.07818558026477028, "grad_norm": 0.3406868278980255, "learning_rate": 0.00013542570951585977, "loss": 0.9522, "num_input_tokens_seen": 2707800, "step": 973, "train_runtime": 2524.4546, "train_tokens_per_second": 1072.628 }, { "epoch": 0.07826593543462103, "grad_norm": 0.2974483370780945, "learning_rate": 0.00013535893155258765, "loss": 0.909, "num_input_tokens_seen": 2710136, "step": 974, "train_runtime": 2526.4256, "train_tokens_per_second": 1072.716 }, { "epoch": 0.07834629060447176, "grad_norm": 0.3680464029312134, "learning_rate": 0.00013529215358931552, "loss": 1.008, "num_input_tokens_seen": 2711794, "step": 975, "train_runtime": 2528.0481, "train_tokens_per_second": 1072.683 }, { "epoch": 0.07842664577432251, "grad_norm": 0.33887895941734314, "learning_rate": 0.0001352253756260434, "loss": 0.8406, "num_input_tokens_seen": 2715442, "step": 976, "train_runtime": 2530.7166, "train_tokens_per_second": 1072.993 }, { "epoch": 0.07850700094417325, "grad_norm": 0.2796920835971832, "learning_rate": 0.0001351585976627713, "loss": 0.8131, "num_input_tokens_seen": 2717936, "step": 977, "train_runtime": 2532.7658, "train_tokens_per_second": 1073.11 }, { "epoch": 0.07858735611402398, "grad_norm": 0.3388163447380066, "learning_rate": 0.00013509181969949917, "loss": 0.8993, "num_input_tokens_seen": 2720616, "step": 978, "train_runtime": 2535.0221, "train_tokens_per_second": 1073.212 }, { "epoch": 0.07866771128387473, "grad_norm": 0.2970505654811859, "learning_rate": 0.00013502504173622707, "loss": 0.8783, "num_input_tokens_seen": 2725144, "step": 979, "train_runtime": 2538.1962, "train_tokens_per_second": 1073.654 }, { "epoch": 0.07874806645372547, "grad_norm": 0.43267375230789185, "learning_rate": 0.00013495826377295494, "loss": 0.9771, "num_input_tokens_seen": 2727974, "step": 980, "train_runtime": 2540.4159, "train_tokens_per_second": 1073.83 }, { "epoch": 0.0788284216235762, "grad_norm": 0.2954391837120056, "learning_rate": 0.0001348914858096828, "loss": 1.058, "num_input_tokens_seen": 2732958, "step": 981, "train_runtime": 2543.9824, "train_tokens_per_second": 1074.283 }, { "epoch": 0.07890877679342695, "grad_norm": 0.39759600162506104, "learning_rate": 0.00013482470784641069, "loss": 1.1552, "num_input_tokens_seen": 2735778, "step": 982, "train_runtime": 2546.1563, "train_tokens_per_second": 1074.474 }, { "epoch": 0.07898913196327768, "grad_norm": 0.37654632329940796, "learning_rate": 0.00013475792988313859, "loss": 0.9169, "num_input_tokens_seen": 2738094, "step": 983, "train_runtime": 2548.0408, "train_tokens_per_second": 1074.588 }, { "epoch": 0.07906948713312843, "grad_norm": 0.40086641907691956, "learning_rate": 0.00013469115191986646, "loss": 1.1409, "num_input_tokens_seen": 2741050, "step": 984, "train_runtime": 2550.365, "train_tokens_per_second": 1074.768 }, { "epoch": 0.07914984230297917, "grad_norm": 0.27053409814834595, "learning_rate": 0.00013462437395659433, "loss": 0.8318, "num_input_tokens_seen": 2745116, "step": 985, "train_runtime": 2553.2183, "train_tokens_per_second": 1075.159 }, { "epoch": 0.0792301974728299, "grad_norm": 0.28262272477149963, "learning_rate": 0.0001345575959933222, "loss": 1.2787, "num_input_tokens_seen": 2748234, "step": 986, "train_runtime": 2555.6442, "train_tokens_per_second": 1075.359 }, { "epoch": 0.07931055264268065, "grad_norm": 0.39394891262054443, "learning_rate": 0.00013449081803005008, "loss": 0.9399, "num_input_tokens_seen": 2749862, "step": 987, "train_runtime": 2557.3673, "train_tokens_per_second": 1075.271 }, { "epoch": 0.07939090781253139, "grad_norm": 0.2508150637149811, "learning_rate": 0.00013442404006677798, "loss": 0.9904, "num_input_tokens_seen": 2752260, "step": 988, "train_runtime": 2559.3405, "train_tokens_per_second": 1075.379 }, { "epoch": 0.07947126298238213, "grad_norm": 0.43806296586990356, "learning_rate": 0.00013435726210350585, "loss": 1.0792, "num_input_tokens_seen": 2754188, "step": 989, "train_runtime": 2561.1655, "train_tokens_per_second": 1075.365 }, { "epoch": 0.07955161815223287, "grad_norm": 0.3231634497642517, "learning_rate": 0.00013429048414023373, "loss": 0.8406, "num_input_tokens_seen": 2756030, "step": 990, "train_runtime": 2562.9015, "train_tokens_per_second": 1075.355 }, { "epoch": 0.0796319733220836, "grad_norm": 0.35421857237815857, "learning_rate": 0.0001342237061769616, "loss": 0.8888, "num_input_tokens_seen": 2757438, "step": 991, "train_runtime": 2566.5337, "train_tokens_per_second": 1074.382 }, { "epoch": 0.07971232849193435, "grad_norm": 0.3755453824996948, "learning_rate": 0.00013415692821368947, "loss": 0.7254, "num_input_tokens_seen": 2759520, "step": 992, "train_runtime": 2568.2994, "train_tokens_per_second": 1074.454 }, { "epoch": 0.07979268366178509, "grad_norm": 0.33065688610076904, "learning_rate": 0.00013409015025041737, "loss": 0.9412, "num_input_tokens_seen": 2762334, "step": 993, "train_runtime": 2570.5521, "train_tokens_per_second": 1074.607 }, { "epoch": 0.07987303883163584, "grad_norm": 0.2998780906200409, "learning_rate": 0.00013402337228714524, "loss": 0.7833, "num_input_tokens_seen": 2764744, "step": 994, "train_runtime": 2572.6205, "train_tokens_per_second": 1074.68 }, { "epoch": 0.07995339400148657, "grad_norm": 0.32594361901283264, "learning_rate": 0.00013395659432387312, "loss": 0.8737, "num_input_tokens_seen": 2766820, "step": 995, "train_runtime": 2574.3804, "train_tokens_per_second": 1074.752 }, { "epoch": 0.0800337491713373, "grad_norm": 0.3067326545715332, "learning_rate": 0.00013388981636060102, "loss": 1.0962, "num_input_tokens_seen": 2769598, "step": 996, "train_runtime": 2576.5668, "train_tokens_per_second": 1074.918 }, { "epoch": 0.08011410434118806, "grad_norm": 0.3515946865081787, "learning_rate": 0.0001338230383973289, "loss": 0.8304, "num_input_tokens_seen": 2771802, "step": 997, "train_runtime": 2578.6034, "train_tokens_per_second": 1074.924 }, { "epoch": 0.08019445951103879, "grad_norm": 0.2858158349990845, "learning_rate": 0.00013375626043405676, "loss": 1.0681, "num_input_tokens_seen": 2774884, "step": 998, "train_runtime": 2580.9382, "train_tokens_per_second": 1075.145 }, { "epoch": 0.08027481468088953, "grad_norm": 0.6481911540031433, "learning_rate": 0.00013368948247078466, "loss": 0.974, "num_input_tokens_seen": 2776190, "step": 999, "train_runtime": 2582.5019, "train_tokens_per_second": 1075.0 }, { "epoch": 0.08035516985074027, "grad_norm": 0.34825989603996277, "learning_rate": 0.00013362270450751254, "loss": 1.092, "num_input_tokens_seen": 2781156, "step": 1000, "train_runtime": 2586.0123, "train_tokens_per_second": 1075.461 }, { "epoch": 0.08043552502059101, "grad_norm": 0.34092801809310913, "learning_rate": 0.0001335559265442404, "loss": 1.0392, "num_input_tokens_seen": 2783550, "step": 1001, "train_runtime": 2588.0704, "train_tokens_per_second": 1075.531 }, { "epoch": 0.08051588019044176, "grad_norm": 0.3506810963153839, "learning_rate": 0.00013348914858096828, "loss": 0.8791, "num_input_tokens_seen": 2786234, "step": 1002, "train_runtime": 2590.2442, "train_tokens_per_second": 1075.665 }, { "epoch": 0.08059623536029249, "grad_norm": 0.3020326793193817, "learning_rate": 0.00013342237061769616, "loss": 1.0414, "num_input_tokens_seen": 2788480, "step": 1003, "train_runtime": 2592.1898, "train_tokens_per_second": 1075.724 }, { "epoch": 0.08067659053014323, "grad_norm": 0.3670845627784729, "learning_rate": 0.00013335559265442406, "loss": 1.2268, "num_input_tokens_seen": 2791858, "step": 1004, "train_runtime": 2594.8598, "train_tokens_per_second": 1075.919 }, { "epoch": 0.08075694569999398, "grad_norm": 0.29267269372940063, "learning_rate": 0.00013328881469115193, "loss": 0.8361, "num_input_tokens_seen": 2794236, "step": 1005, "train_runtime": 2596.8873, "train_tokens_per_second": 1075.994 }, { "epoch": 0.08083730086984471, "grad_norm": 0.3259250819683075, "learning_rate": 0.0001332220367278798, "loss": 1.2422, "num_input_tokens_seen": 2796898, "step": 1006, "train_runtime": 2599.064, "train_tokens_per_second": 1076.117 }, { "epoch": 0.08091765603969546, "grad_norm": 0.35236838459968567, "learning_rate": 0.00013315525876460768, "loss": 0.932, "num_input_tokens_seen": 2799064, "step": 1007, "train_runtime": 2600.9463, "train_tokens_per_second": 1076.171 }, { "epoch": 0.0809980112095462, "grad_norm": 0.3951377868652344, "learning_rate": 0.00013308848080133555, "loss": 0.8327, "num_input_tokens_seen": 2803022, "step": 1008, "train_runtime": 2603.9105, "train_tokens_per_second": 1076.466 }, { "epoch": 0.08107836637939693, "grad_norm": 0.4352874755859375, "learning_rate": 0.00013302170283806345, "loss": 1.0081, "num_input_tokens_seen": 2804650, "step": 1009, "train_runtime": 2605.5357, "train_tokens_per_second": 1076.42 }, { "epoch": 0.08115872154924768, "grad_norm": 0.31826362013816833, "learning_rate": 0.00013295492487479132, "loss": 1.2703, "num_input_tokens_seen": 2808310, "step": 1010, "train_runtime": 2608.2061, "train_tokens_per_second": 1076.721 }, { "epoch": 0.08123907671909841, "grad_norm": 0.35901400446891785, "learning_rate": 0.0001328881469115192, "loss": 0.898, "num_input_tokens_seen": 2810310, "step": 1011, "train_runtime": 2610.0179, "train_tokens_per_second": 1076.74 }, { "epoch": 0.08131943188894916, "grad_norm": 0.2934917211532593, "learning_rate": 0.00013282136894824707, "loss": 0.8468, "num_input_tokens_seen": 2812368, "step": 1012, "train_runtime": 2611.8821, "train_tokens_per_second": 1076.759 }, { "epoch": 0.0813997870587999, "grad_norm": 0.4374319911003113, "learning_rate": 0.00013275459098497497, "loss": 1.1719, "num_input_tokens_seen": 2813738, "step": 1013, "train_runtime": 2613.4076, "train_tokens_per_second": 1076.655 }, { "epoch": 0.08148014222865063, "grad_norm": 0.28275415301322937, "learning_rate": 0.00013268781302170284, "loss": 0.8692, "num_input_tokens_seen": 2815598, "step": 1014, "train_runtime": 2615.0373, "train_tokens_per_second": 1076.695 }, { "epoch": 0.08156049739850138, "grad_norm": 0.21789546310901642, "learning_rate": 0.00013262103505843074, "loss": 0.7414, "num_input_tokens_seen": 2817622, "step": 1015, "train_runtime": 2616.8942, "train_tokens_per_second": 1076.705 }, { "epoch": 0.08164085256835212, "grad_norm": 0.4071328639984131, "learning_rate": 0.00013255425709515862, "loss": 0.9186, "num_input_tokens_seen": 2821024, "step": 1016, "train_runtime": 2619.4291, "train_tokens_per_second": 1076.961 }, { "epoch": 0.08172120773820285, "grad_norm": 0.26125869154930115, "learning_rate": 0.0001324874791318865, "loss": 0.7718, "num_input_tokens_seen": 2823164, "step": 1017, "train_runtime": 2621.2648, "train_tokens_per_second": 1077.024 }, { "epoch": 0.0818015629080536, "grad_norm": 0.3403930962085724, "learning_rate": 0.00013242070116861436, "loss": 1.052, "num_input_tokens_seen": 2826500, "step": 1018, "train_runtime": 2623.7693, "train_tokens_per_second": 1077.267 }, { "epoch": 0.08188191807790433, "grad_norm": 0.2818782329559326, "learning_rate": 0.00013235392320534224, "loss": 1.0326, "num_input_tokens_seen": 2829252, "step": 1019, "train_runtime": 2626.0117, "train_tokens_per_second": 1077.395 }, { "epoch": 0.08196227324775508, "grad_norm": 0.30011674761772156, "learning_rate": 0.00013228714524207014, "loss": 1.2725, "num_input_tokens_seen": 2831818, "step": 1020, "train_runtime": 2628.1214, "train_tokens_per_second": 1077.507 }, { "epoch": 0.08204262841760582, "grad_norm": 0.27111268043518066, "learning_rate": 0.000132220367278798, "loss": 0.9214, "num_input_tokens_seen": 2837286, "step": 1021, "train_runtime": 2633.9711, "train_tokens_per_second": 1077.189 }, { "epoch": 0.08212298358745655, "grad_norm": 0.2721482515335083, "learning_rate": 0.00013215358931552588, "loss": 1.0397, "num_input_tokens_seen": 2839606, "step": 1022, "train_runtime": 2635.9691, "train_tokens_per_second": 1077.253 }, { "epoch": 0.0822033387573073, "grad_norm": 0.27940985560417175, "learning_rate": 0.00013208681135225376, "loss": 0.8657, "num_input_tokens_seen": 2841590, "step": 1023, "train_runtime": 2637.8243, "train_tokens_per_second": 1077.248 }, { "epoch": 0.08228369392715804, "grad_norm": 0.332803875207901, "learning_rate": 0.00013202003338898163, "loss": 0.6836, "num_input_tokens_seen": 2846138, "step": 1024, "train_runtime": 2641.0347, "train_tokens_per_second": 1077.66 }, { "epoch": 0.08236404909700878, "grad_norm": 0.29152676463127136, "learning_rate": 0.00013195325542570953, "loss": 0.8369, "num_input_tokens_seen": 2848412, "step": 1025, "train_runtime": 2642.9532, "train_tokens_per_second": 1077.738 }, { "epoch": 0.08244440426685952, "grad_norm": 0.37724512815475464, "learning_rate": 0.0001318864774624374, "loss": 0.8647, "num_input_tokens_seen": 2849874, "step": 1026, "train_runtime": 2644.5686, "train_tokens_per_second": 1077.633 }, { "epoch": 0.08252475943671025, "grad_norm": 0.33222779631614685, "learning_rate": 0.00013181969949916528, "loss": 1.2321, "num_input_tokens_seen": 2852100, "step": 1027, "train_runtime": 2646.5123, "train_tokens_per_second": 1077.682 }, { "epoch": 0.082605114606561, "grad_norm": 0.31807512044906616, "learning_rate": 0.00013175292153589315, "loss": 0.8616, "num_input_tokens_seen": 2854402, "step": 1028, "train_runtime": 2648.4239, "train_tokens_per_second": 1077.774 }, { "epoch": 0.08268546977641174, "grad_norm": 0.30015531182289124, "learning_rate": 0.00013168614357262102, "loss": 1.0101, "num_input_tokens_seen": 2856872, "step": 1029, "train_runtime": 2650.4748, "train_tokens_per_second": 1077.872 }, { "epoch": 0.08276582494626249, "grad_norm": 0.34851160645484924, "learning_rate": 0.00013161936560934892, "loss": 1.0764, "num_input_tokens_seen": 2858760, "step": 1030, "train_runtime": 2652.2334, "train_tokens_per_second": 1077.869 }, { "epoch": 0.08284618011611322, "grad_norm": 0.3319004774093628, "learning_rate": 0.0001315525876460768, "loss": 1.1199, "num_input_tokens_seen": 2860558, "step": 1031, "train_runtime": 2653.9857, "train_tokens_per_second": 1077.835 }, { "epoch": 0.08292653528596396, "grad_norm": 0.3031421899795532, "learning_rate": 0.0001314858096828047, "loss": 0.8352, "num_input_tokens_seen": 2864206, "step": 1032, "train_runtime": 2656.7358, "train_tokens_per_second": 1078.092 }, { "epoch": 0.0830068904558147, "grad_norm": 0.2702726125717163, "learning_rate": 0.00013141903171953257, "loss": 1.04, "num_input_tokens_seen": 2867676, "step": 1033, "train_runtime": 2659.2742, "train_tokens_per_second": 1078.368 }, { "epoch": 0.08308724562566544, "grad_norm": 0.30745938420295715, "learning_rate": 0.00013135225375626044, "loss": 1.1677, "num_input_tokens_seen": 2870066, "step": 1034, "train_runtime": 2661.2829, "train_tokens_per_second": 1078.452 }, { "epoch": 0.08316760079551618, "grad_norm": 0.3097253143787384, "learning_rate": 0.00013128547579298832, "loss": 0.7924, "num_input_tokens_seen": 2873278, "step": 1035, "train_runtime": 2663.7629, "train_tokens_per_second": 1078.654 }, { "epoch": 0.08324795596536692, "grad_norm": 0.31835857033729553, "learning_rate": 0.00013121869782971622, "loss": 1.0011, "num_input_tokens_seen": 2874902, "step": 1036, "train_runtime": 2665.4132, "train_tokens_per_second": 1078.595 }, { "epoch": 0.08332831113521766, "grad_norm": 0.2660655379295349, "learning_rate": 0.0001311519198664441, "loss": 0.8712, "num_input_tokens_seen": 2877546, "step": 1037, "train_runtime": 2667.4818, "train_tokens_per_second": 1078.75 }, { "epoch": 0.08340866630506841, "grad_norm": 0.31649038195610046, "learning_rate": 0.00013108514190317196, "loss": 0.5954, "num_input_tokens_seen": 2879968, "step": 1038, "train_runtime": 2669.5734, "train_tokens_per_second": 1078.812 }, { "epoch": 0.08348902147491914, "grad_norm": 0.27658918499946594, "learning_rate": 0.00013101836393989983, "loss": 0.7088, "num_input_tokens_seen": 2881680, "step": 1039, "train_runtime": 2671.244, "train_tokens_per_second": 1078.778 }, { "epoch": 0.08356937664476988, "grad_norm": 0.2922908365726471, "learning_rate": 0.0001309515859766277, "loss": 1.2907, "num_input_tokens_seen": 2884004, "step": 1040, "train_runtime": 2673.2697, "train_tokens_per_second": 1078.83 }, { "epoch": 0.08364973181462063, "grad_norm": 0.23947563767433167, "learning_rate": 0.0001308848080133556, "loss": 0.7296, "num_input_tokens_seen": 2886704, "step": 1041, "train_runtime": 2675.4457, "train_tokens_per_second": 1078.962 }, { "epoch": 0.08373008698447136, "grad_norm": 0.27451804280281067, "learning_rate": 0.00013081803005008348, "loss": 1.0104, "num_input_tokens_seen": 2888982, "step": 1042, "train_runtime": 2677.5056, "train_tokens_per_second": 1078.983 }, { "epoch": 0.08381044215432211, "grad_norm": 0.2693738341331482, "learning_rate": 0.00013075125208681135, "loss": 1.0469, "num_input_tokens_seen": 2893346, "step": 1043, "train_runtime": 2680.46, "train_tokens_per_second": 1079.421 }, { "epoch": 0.08389079732417284, "grad_norm": 0.29715558886528015, "learning_rate": 0.00013068447412353923, "loss": 1.0376, "num_input_tokens_seen": 2895484, "step": 1044, "train_runtime": 2682.423, "train_tokens_per_second": 1079.429 }, { "epoch": 0.08397115249402358, "grad_norm": 0.3529125452041626, "learning_rate": 0.0001306176961602671, "loss": 1.3031, "num_input_tokens_seen": 2898552, "step": 1045, "train_runtime": 2684.8308, "train_tokens_per_second": 1079.603 }, { "epoch": 0.08405150766387433, "grad_norm": 0.34995678067207336, "learning_rate": 0.00013055091819699497, "loss": 0.8914, "num_input_tokens_seen": 2901326, "step": 1046, "train_runtime": 2687.041, "train_tokens_per_second": 1079.748 }, { "epoch": 0.08413186283372506, "grad_norm": 0.272154837846756, "learning_rate": 0.00013048414023372287, "loss": 0.8414, "num_input_tokens_seen": 2903690, "step": 1047, "train_runtime": 2689.0487, "train_tokens_per_second": 1079.821 }, { "epoch": 0.08421221800357581, "grad_norm": 0.3116409182548523, "learning_rate": 0.00013041736227045075, "loss": 1.2821, "num_input_tokens_seen": 2906882, "step": 1048, "train_runtime": 2691.4399, "train_tokens_per_second": 1080.047 }, { "epoch": 0.08429257317342655, "grad_norm": 0.2630103528499603, "learning_rate": 0.00013035058430717865, "loss": 0.9734, "num_input_tokens_seen": 2909530, "step": 1049, "train_runtime": 2693.5598, "train_tokens_per_second": 1080.18 }, { "epoch": 0.08437292834327728, "grad_norm": 0.26427966356277466, "learning_rate": 0.00013028380634390652, "loss": 1.2673, "num_input_tokens_seen": 2911538, "step": 1050, "train_runtime": 2695.3087, "train_tokens_per_second": 1080.224 }, { "epoch": 0.08445328351312803, "grad_norm": 0.2952263653278351, "learning_rate": 0.0001302170283806344, "loss": 1.144, "num_input_tokens_seen": 2913298, "step": 1051, "train_runtime": 2699.0488, "train_tokens_per_second": 1079.38 }, { "epoch": 0.08453363868297877, "grad_norm": 0.36667385697364807, "learning_rate": 0.0001301502504173623, "loss": 0.9793, "num_input_tokens_seen": 2919372, "step": 1052, "train_runtime": 2703.297, "train_tokens_per_second": 1079.93 }, { "epoch": 0.0846139938528295, "grad_norm": 0.33305513858795166, "learning_rate": 0.00013008347245409017, "loss": 1.3704, "num_input_tokens_seen": 2922472, "step": 1053, "train_runtime": 2705.785, "train_tokens_per_second": 1080.083 }, { "epoch": 0.08469434902268025, "grad_norm": 0.38013726472854614, "learning_rate": 0.00013001669449081804, "loss": 0.9353, "num_input_tokens_seen": 2924566, "step": 1054, "train_runtime": 2707.7092, "train_tokens_per_second": 1080.089 }, { "epoch": 0.08477470419253098, "grad_norm": 0.28573718667030334, "learning_rate": 0.00012994991652754591, "loss": 0.9211, "num_input_tokens_seen": 2927362, "step": 1055, "train_runtime": 2709.8846, "train_tokens_per_second": 1080.253 }, { "epoch": 0.08485505936238173, "grad_norm": 0.31847864389419556, "learning_rate": 0.0001298831385642738, "loss": 0.9339, "num_input_tokens_seen": 2930960, "step": 1056, "train_runtime": 2712.6034, "train_tokens_per_second": 1080.497 }, { "epoch": 0.08493541453223247, "grad_norm": 0.44332391023635864, "learning_rate": 0.0001298163606010017, "loss": 1.288, "num_input_tokens_seen": 2933888, "step": 1057, "train_runtime": 2714.9189, "train_tokens_per_second": 1080.654 }, { "epoch": 0.0850157697020832, "grad_norm": 0.350253701210022, "learning_rate": 0.00012974958263772956, "loss": 0.9685, "num_input_tokens_seen": 2937338, "step": 1058, "train_runtime": 2717.4842, "train_tokens_per_second": 1080.903 }, { "epoch": 0.08509612487193395, "grad_norm": 0.33024874329566956, "learning_rate": 0.00012968280467445743, "loss": 0.7487, "num_input_tokens_seen": 2938738, "step": 1059, "train_runtime": 2719.0708, "train_tokens_per_second": 1080.788 }, { "epoch": 0.08517648004178469, "grad_norm": 0.30797895789146423, "learning_rate": 0.0001296160267111853, "loss": 1.0426, "num_input_tokens_seen": 2942108, "step": 1060, "train_runtime": 2721.5573, "train_tokens_per_second": 1081.038 }, { "epoch": 0.08525683521163543, "grad_norm": 0.33872172236442566, "learning_rate": 0.00012954924874791318, "loss": 0.9575, "num_input_tokens_seen": 2945742, "step": 1061, "train_runtime": 2724.2489, "train_tokens_per_second": 1081.304 }, { "epoch": 0.08533719038148617, "grad_norm": 0.38300707936286926, "learning_rate": 0.00012948247078464108, "loss": 1.0997, "num_input_tokens_seen": 2948428, "step": 1062, "train_runtime": 2726.5297, "train_tokens_per_second": 1081.385 }, { "epoch": 0.0854175455513369, "grad_norm": 0.34665048122406006, "learning_rate": 0.00012941569282136895, "loss": 0.9976, "num_input_tokens_seen": 2949936, "step": 1063, "train_runtime": 2728.1047, "train_tokens_per_second": 1081.313 }, { "epoch": 0.08549790072118765, "grad_norm": 0.4175337255001068, "learning_rate": 0.00012934891485809683, "loss": 0.9155, "num_input_tokens_seen": 2952068, "step": 1064, "train_runtime": 2729.9211, "train_tokens_per_second": 1081.375 }, { "epoch": 0.08557825589103839, "grad_norm": 0.29677116870880127, "learning_rate": 0.0001292821368948247, "loss": 1.0279, "num_input_tokens_seen": 2957814, "step": 1065, "train_runtime": 2733.866, "train_tokens_per_second": 1081.916 }, { "epoch": 0.08565861106088914, "grad_norm": 0.27838361263275146, "learning_rate": 0.0001292153589315526, "loss": 0.8967, "num_input_tokens_seen": 2961052, "step": 1066, "train_runtime": 2736.39, "train_tokens_per_second": 1082.102 }, { "epoch": 0.08573896623073987, "grad_norm": 0.3175829350948334, "learning_rate": 0.00012914858096828047, "loss": 1.0931, "num_input_tokens_seen": 2963148, "step": 1067, "train_runtime": 2738.1507, "train_tokens_per_second": 1082.171 }, { "epoch": 0.0858193214005906, "grad_norm": 0.33555886149406433, "learning_rate": 0.00012908180300500837, "loss": 1.1348, "num_input_tokens_seen": 2965132, "step": 1068, "train_runtime": 2739.9372, "train_tokens_per_second": 1082.19 }, { "epoch": 0.08589967657044136, "grad_norm": 0.3252342939376831, "learning_rate": 0.00012901502504173625, "loss": 1.1991, "num_input_tokens_seen": 2968356, "step": 1069, "train_runtime": 2742.3451, "train_tokens_per_second": 1082.415 }, { "epoch": 0.08598003174029209, "grad_norm": 0.34085896611213684, "learning_rate": 0.00012894824707846412, "loss": 1.0614, "num_input_tokens_seen": 2971714, "step": 1070, "train_runtime": 2744.7657, "train_tokens_per_second": 1082.684 }, { "epoch": 0.08606038691014282, "grad_norm": 0.3247336447238922, "learning_rate": 0.000128881469115192, "loss": 1.2979, "num_input_tokens_seen": 2977932, "step": 1071, "train_runtime": 2748.9803, "train_tokens_per_second": 1083.286 }, { "epoch": 0.08614074207999357, "grad_norm": 0.285835862159729, "learning_rate": 0.00012881469115191987, "loss": 1.0365, "num_input_tokens_seen": 2980568, "step": 1072, "train_runtime": 2751.0834, "train_tokens_per_second": 1083.416 }, { "epoch": 0.08622109724984431, "grad_norm": 0.30813121795654297, "learning_rate": 0.00012874791318864777, "loss": 1.0571, "num_input_tokens_seen": 2983094, "step": 1073, "train_runtime": 2753.1286, "train_tokens_per_second": 1083.529 }, { "epoch": 0.08630145241969506, "grad_norm": 0.2712572515010834, "learning_rate": 0.00012868113522537564, "loss": 0.9591, "num_input_tokens_seen": 2985844, "step": 1074, "train_runtime": 2755.2385, "train_tokens_per_second": 1083.697 }, { "epoch": 0.08638180758954579, "grad_norm": 0.255834698677063, "learning_rate": 0.0001286143572621035, "loss": 0.7757, "num_input_tokens_seen": 2989678, "step": 1075, "train_runtime": 2757.9776, "train_tokens_per_second": 1084.011 }, { "epoch": 0.08646216275939653, "grad_norm": 0.3725673258304596, "learning_rate": 0.00012854757929883139, "loss": 0.892, "num_input_tokens_seen": 2993680, "step": 1076, "train_runtime": 2760.8726, "train_tokens_per_second": 1084.324 }, { "epoch": 0.08654251792924728, "grad_norm": 0.41319602727890015, "learning_rate": 0.00012848080133555926, "loss": 0.882, "num_input_tokens_seen": 2995424, "step": 1077, "train_runtime": 2762.5437, "train_tokens_per_second": 1084.299 }, { "epoch": 0.08662287309909801, "grad_norm": 0.3238431215286255, "learning_rate": 0.00012841402337228716, "loss": 1.0179, "num_input_tokens_seen": 2997696, "step": 1078, "train_runtime": 2764.5115, "train_tokens_per_second": 1084.349 }, { "epoch": 0.08670322826894876, "grad_norm": 0.2749386429786682, "learning_rate": 0.00012834724540901503, "loss": 1.0802, "num_input_tokens_seen": 3001614, "step": 1079, "train_runtime": 2767.2697, "train_tokens_per_second": 1084.684 }, { "epoch": 0.0867835834387995, "grad_norm": 0.38312584161758423, "learning_rate": 0.0001282804674457429, "loss": 0.9611, "num_input_tokens_seen": 3003716, "step": 1080, "train_runtime": 2769.0475, "train_tokens_per_second": 1084.747 }, { "epoch": 0.08686393860865023, "grad_norm": 0.29507017135620117, "learning_rate": 0.00012821368948247078, "loss": 0.8433, "num_input_tokens_seen": 3007974, "step": 1081, "train_runtime": 2773.7463, "train_tokens_per_second": 1084.445 }, { "epoch": 0.08694429377850098, "grad_norm": 0.3189148008823395, "learning_rate": 0.00012814691151919865, "loss": 0.9217, "num_input_tokens_seen": 3010416, "step": 1082, "train_runtime": 2775.8468, "train_tokens_per_second": 1084.504 }, { "epoch": 0.08702464894835171, "grad_norm": 0.35395893454551697, "learning_rate": 0.00012808013355592655, "loss": 1.0264, "num_input_tokens_seen": 3013942, "step": 1083, "train_runtime": 2778.4236, "train_tokens_per_second": 1084.767 }, { "epoch": 0.08710500411820246, "grad_norm": 0.3388271927833557, "learning_rate": 0.00012801335559265442, "loss": 1.0092, "num_input_tokens_seen": 3019748, "step": 1084, "train_runtime": 2782.4385, "train_tokens_per_second": 1085.288 }, { "epoch": 0.0871853592880532, "grad_norm": 0.30448269844055176, "learning_rate": 0.00012794657762938233, "loss": 1.0393, "num_input_tokens_seen": 3023376, "step": 1085, "train_runtime": 2785.1904, "train_tokens_per_second": 1085.519 }, { "epoch": 0.08726571445790393, "grad_norm": 0.3304644823074341, "learning_rate": 0.0001278797996661102, "loss": 1.1707, "num_input_tokens_seen": 3025506, "step": 1086, "train_runtime": 2787.0267, "train_tokens_per_second": 1085.568 }, { "epoch": 0.08734606962775468, "grad_norm": 0.3211642801761627, "learning_rate": 0.00012781302170283807, "loss": 0.755, "num_input_tokens_seen": 3029170, "step": 1087, "train_runtime": 2789.8789, "train_tokens_per_second": 1085.771 }, { "epoch": 0.08742642479760541, "grad_norm": 0.35865727066993713, "learning_rate": 0.00012774624373956594, "loss": 1.0895, "num_input_tokens_seen": 3030380, "step": 1088, "train_runtime": 2791.378, "train_tokens_per_second": 1085.622 }, { "epoch": 0.08750677996745615, "grad_norm": 0.40979212522506714, "learning_rate": 0.00012767946577629384, "loss": 0.7962, "num_input_tokens_seen": 3035056, "step": 1089, "train_runtime": 2794.7372, "train_tokens_per_second": 1085.99 }, { "epoch": 0.0875871351373069, "grad_norm": 0.364322304725647, "learning_rate": 0.00012761268781302172, "loss": 0.6807, "num_input_tokens_seen": 3039682, "step": 1090, "train_runtime": 2797.9686, "train_tokens_per_second": 1086.389 }, { "epoch": 0.08766749030715763, "grad_norm": 0.25292372703552246, "learning_rate": 0.0001275459098497496, "loss": 0.6023, "num_input_tokens_seen": 3042474, "step": 1091, "train_runtime": 2800.2429, "train_tokens_per_second": 1086.504 }, { "epoch": 0.08774784547700838, "grad_norm": 0.3244749903678894, "learning_rate": 0.00012747913188647746, "loss": 0.8558, "num_input_tokens_seen": 3045692, "step": 1092, "train_runtime": 2802.7945, "train_tokens_per_second": 1086.663 }, { "epoch": 0.08782820064685912, "grad_norm": 0.3067663013935089, "learning_rate": 0.00012741235392320534, "loss": 1.2547, "num_input_tokens_seen": 3049432, "step": 1093, "train_runtime": 2805.4878, "train_tokens_per_second": 1086.953 }, { "epoch": 0.08790855581670985, "grad_norm": 0.33565008640289307, "learning_rate": 0.00012734557595993324, "loss": 1.1355, "num_input_tokens_seen": 3051074, "step": 1094, "train_runtime": 2807.1266, "train_tokens_per_second": 1086.903 }, { "epoch": 0.0879889109865606, "grad_norm": 0.2515357434749603, "learning_rate": 0.0001272787979966611, "loss": 0.9789, "num_input_tokens_seen": 3054176, "step": 1095, "train_runtime": 2809.5162, "train_tokens_per_second": 1087.083 }, { "epoch": 0.08806926615641134, "grad_norm": 0.318328320980072, "learning_rate": 0.00012721202003338898, "loss": 0.9675, "num_input_tokens_seen": 3056492, "step": 1096, "train_runtime": 2811.5311, "train_tokens_per_second": 1087.127 }, { "epoch": 0.08814962132626208, "grad_norm": 0.28950101137161255, "learning_rate": 0.00012714524207011686, "loss": 0.9639, "num_input_tokens_seen": 3058622, "step": 1097, "train_runtime": 2813.4483, "train_tokens_per_second": 1087.143 }, { "epoch": 0.08822997649611282, "grad_norm": 0.26731500029563904, "learning_rate": 0.00012707846410684473, "loss": 0.8594, "num_input_tokens_seen": 3060882, "step": 1098, "train_runtime": 2815.2939, "train_tokens_per_second": 1087.234 }, { "epoch": 0.08831033166596355, "grad_norm": 0.3259464204311371, "learning_rate": 0.0001270116861435726, "loss": 0.8474, "num_input_tokens_seen": 3064758, "step": 1099, "train_runtime": 2817.9789, "train_tokens_per_second": 1087.573 }, { "epoch": 0.0883906868358143, "grad_norm": 0.2628142237663269, "learning_rate": 0.0001269449081803005, "loss": 0.9793, "num_input_tokens_seen": 3067526, "step": 1100, "train_runtime": 2820.2414, "train_tokens_per_second": 1087.682 }, { "epoch": 0.08847104200566504, "grad_norm": 0.2963213622570038, "learning_rate": 0.00012687813021702838, "loss": 1.0457, "num_input_tokens_seen": 3072786, "step": 1101, "train_runtime": 2823.9783, "train_tokens_per_second": 1088.105 }, { "epoch": 0.08855139717551579, "grad_norm": 0.25485289096832275, "learning_rate": 0.00012681135225375628, "loss": 0.8066, "num_input_tokens_seen": 3075326, "step": 1102, "train_runtime": 2826.029, "train_tokens_per_second": 1088.215 }, { "epoch": 0.08863175234536652, "grad_norm": 0.3377240002155304, "learning_rate": 0.00012674457429048415, "loss": 1.0257, "num_input_tokens_seen": 3077822, "step": 1103, "train_runtime": 2828.1255, "train_tokens_per_second": 1088.29 }, { "epoch": 0.08871210751521726, "grad_norm": 0.3242761194705963, "learning_rate": 0.00012667779632721202, "loss": 0.9341, "num_input_tokens_seen": 3080172, "step": 1104, "train_runtime": 2830.1085, "train_tokens_per_second": 1088.358 }, { "epoch": 0.088792462685068, "grad_norm": 0.3196955621242523, "learning_rate": 0.00012661101836393992, "loss": 0.8233, "num_input_tokens_seen": 3081838, "step": 1105, "train_runtime": 2831.8054, "train_tokens_per_second": 1088.294 }, { "epoch": 0.08887281785491874, "grad_norm": 0.31218263506889343, "learning_rate": 0.0001265442404006678, "loss": 0.697, "num_input_tokens_seen": 3083180, "step": 1106, "train_runtime": 2833.3457, "train_tokens_per_second": 1088.176 }, { "epoch": 0.08895317302476947, "grad_norm": 0.25134435296058655, "learning_rate": 0.00012647746243739567, "loss": 0.9046, "num_input_tokens_seen": 3085902, "step": 1107, "train_runtime": 2835.5446, "train_tokens_per_second": 1088.293 }, { "epoch": 0.08903352819462022, "grad_norm": 0.3291313648223877, "learning_rate": 0.00012641068447412354, "loss": 1.0468, "num_input_tokens_seen": 3088724, "step": 1108, "train_runtime": 2837.8289, "train_tokens_per_second": 1088.411 }, { "epoch": 0.08911388336447096, "grad_norm": 0.27928370237350464, "learning_rate": 0.00012634390651085142, "loss": 0.5629, "num_input_tokens_seen": 3091956, "step": 1109, "train_runtime": 2840.291, "train_tokens_per_second": 1088.605 }, { "epoch": 0.08919423853432171, "grad_norm": 0.28240346908569336, "learning_rate": 0.00012627712854757932, "loss": 0.8145, "num_input_tokens_seen": 3093976, "step": 1110, "train_runtime": 2842.1335, "train_tokens_per_second": 1088.61 }, { "epoch": 0.08927459370417244, "grad_norm": 0.3529825508594513, "learning_rate": 0.0001262103505843072, "loss": 1.157, "num_input_tokens_seen": 3095586, "step": 1111, "train_runtime": 2845.8065, "train_tokens_per_second": 1087.771 }, { "epoch": 0.08935494887402318, "grad_norm": 0.36176350712776184, "learning_rate": 0.00012614357262103506, "loss": 0.6121, "num_input_tokens_seen": 3097942, "step": 1112, "train_runtime": 2847.8101, "train_tokens_per_second": 1087.833 }, { "epoch": 0.08943530404387393, "grad_norm": 0.3233826756477356, "learning_rate": 0.00012607679465776294, "loss": 0.8317, "num_input_tokens_seen": 3100626, "step": 1113, "train_runtime": 2850.0094, "train_tokens_per_second": 1087.935 }, { "epoch": 0.08951565921372466, "grad_norm": 0.3124631345272064, "learning_rate": 0.0001260100166944908, "loss": 0.8077, "num_input_tokens_seen": 3103032, "step": 1114, "train_runtime": 2851.9984, "train_tokens_per_second": 1088.02 }, { "epoch": 0.08959601438357541, "grad_norm": 0.4034174084663391, "learning_rate": 0.00012594323873121868, "loss": 1.0622, "num_input_tokens_seen": 3105442, "step": 1115, "train_runtime": 2854.1264, "train_tokens_per_second": 1088.053 }, { "epoch": 0.08967636955342614, "grad_norm": 0.34770938754081726, "learning_rate": 0.00012587646076794658, "loss": 0.9828, "num_input_tokens_seen": 3108546, "step": 1116, "train_runtime": 2856.5363, "train_tokens_per_second": 1088.222 }, { "epoch": 0.08975672472327688, "grad_norm": 0.30814117193222046, "learning_rate": 0.00012580968280467446, "loss": 1.1445, "num_input_tokens_seen": 3110768, "step": 1117, "train_runtime": 2858.492, "train_tokens_per_second": 1088.255 }, { "epoch": 0.08983707989312763, "grad_norm": 0.2673361599445343, "learning_rate": 0.00012574290484140233, "loss": 0.8873, "num_input_tokens_seen": 3114964, "step": 1118, "train_runtime": 2861.5538, "train_tokens_per_second": 1088.557 }, { "epoch": 0.08991743506297836, "grad_norm": 0.25939151644706726, "learning_rate": 0.00012567612687813023, "loss": 1.0144, "num_input_tokens_seen": 3117966, "step": 1119, "train_runtime": 2863.873, "train_tokens_per_second": 1088.724 }, { "epoch": 0.08999779023282911, "grad_norm": 0.39517298340797424, "learning_rate": 0.0001256093489148581, "loss": 1.1092, "num_input_tokens_seen": 3120626, "step": 1120, "train_runtime": 2865.9633, "train_tokens_per_second": 1088.858 }, { "epoch": 0.09007814540267985, "grad_norm": 0.32868483662605286, "learning_rate": 0.000125542570951586, "loss": 0.8212, "num_input_tokens_seen": 3122954, "step": 1121, "train_runtime": 2868.0347, "train_tokens_per_second": 1088.883 }, { "epoch": 0.09015850057253058, "grad_norm": 0.23024609684944153, "learning_rate": 0.00012547579298831388, "loss": 0.6645, "num_input_tokens_seen": 3125558, "step": 1122, "train_runtime": 2870.1293, "train_tokens_per_second": 1088.996 }, { "epoch": 0.09023885574238133, "grad_norm": 0.3265283405780792, "learning_rate": 0.00012540901502504175, "loss": 0.8031, "num_input_tokens_seen": 3129850, "step": 1123, "train_runtime": 2873.0987, "train_tokens_per_second": 1089.364 }, { "epoch": 0.09031921091223206, "grad_norm": 0.3203762173652649, "learning_rate": 0.00012534223706176962, "loss": 0.8992, "num_input_tokens_seen": 3131932, "step": 1124, "train_runtime": 2874.9894, "train_tokens_per_second": 1089.372 }, { "epoch": 0.0903995660820828, "grad_norm": 0.2812959849834442, "learning_rate": 0.0001252754590984975, "loss": 0.9781, "num_input_tokens_seen": 3134200, "step": 1125, "train_runtime": 2876.8935, "train_tokens_per_second": 1089.439 }, { "epoch": 0.09047992125193355, "grad_norm": 0.2835489809513092, "learning_rate": 0.0001252086811352254, "loss": 0.8796, "num_input_tokens_seen": 3137694, "step": 1126, "train_runtime": 2879.5734, "train_tokens_per_second": 1089.638 }, { "epoch": 0.09056027642178428, "grad_norm": 0.31469953060150146, "learning_rate": 0.00012514190317195327, "loss": 1.0935, "num_input_tokens_seen": 3139166, "step": 1127, "train_runtime": 2881.1656, "train_tokens_per_second": 1089.547 }, { "epoch": 0.09064063159163503, "grad_norm": 0.3524523377418518, "learning_rate": 0.00012507512520868114, "loss": 1.1163, "num_input_tokens_seen": 3142166, "step": 1128, "train_runtime": 2883.5085, "train_tokens_per_second": 1089.702 }, { "epoch": 0.09072098676148577, "grad_norm": 0.30217206478118896, "learning_rate": 0.00012500834724540902, "loss": 1.1273, "num_input_tokens_seen": 3145102, "step": 1129, "train_runtime": 2885.7967, "train_tokens_per_second": 1089.856 }, { "epoch": 0.0908013419313365, "grad_norm": 0.3433888256549835, "learning_rate": 0.0001249415692821369, "loss": 0.7967, "num_input_tokens_seen": 3147396, "step": 1130, "train_runtime": 2887.8093, "train_tokens_per_second": 1089.891 }, { "epoch": 0.09088169710118725, "grad_norm": 0.3130668103694916, "learning_rate": 0.00012487479131886476, "loss": 0.9809, "num_input_tokens_seen": 3149078, "step": 1131, "train_runtime": 2889.4744, "train_tokens_per_second": 1089.845 }, { "epoch": 0.09096205227103799, "grad_norm": 0.2751938998699188, "learning_rate": 0.00012480801335559266, "loss": 0.766, "num_input_tokens_seen": 3152012, "step": 1132, "train_runtime": 2891.7653, "train_tokens_per_second": 1089.996 }, { "epoch": 0.09104240744088873, "grad_norm": 0.30756300687789917, "learning_rate": 0.00012474123539232053, "loss": 1.0362, "num_input_tokens_seen": 3153830, "step": 1133, "train_runtime": 2893.5276, "train_tokens_per_second": 1089.96 }, { "epoch": 0.09112276261073947, "grad_norm": 0.3334805965423584, "learning_rate": 0.0001246744574290484, "loss": 0.8753, "num_input_tokens_seen": 3155538, "step": 1134, "train_runtime": 2895.1942, "train_tokens_per_second": 1089.923 }, { "epoch": 0.0912031177805902, "grad_norm": 0.27908143401145935, "learning_rate": 0.0001246076794657763, "loss": 0.6604, "num_input_tokens_seen": 3158164, "step": 1135, "train_runtime": 2897.2174, "train_tokens_per_second": 1090.068 }, { "epoch": 0.09128347295044095, "grad_norm": 0.3932334780693054, "learning_rate": 0.00012454090150250418, "loss": 1.0836, "num_input_tokens_seen": 3163376, "step": 1136, "train_runtime": 2900.8607, "train_tokens_per_second": 1090.496 }, { "epoch": 0.09136382812029169, "grad_norm": 0.33885687589645386, "learning_rate": 0.00012447412353923208, "loss": 0.9214, "num_input_tokens_seen": 3166084, "step": 1137, "train_runtime": 2903.015, "train_tokens_per_second": 1090.619 }, { "epoch": 0.09144418329014244, "grad_norm": 0.2946315407752991, "learning_rate": 0.00012440734557595995, "loss": 0.9546, "num_input_tokens_seen": 3167780, "step": 1138, "train_runtime": 2904.6595, "train_tokens_per_second": 1090.586 }, { "epoch": 0.09152453845999317, "grad_norm": 0.31270208954811096, "learning_rate": 0.00012434056761268783, "loss": 1.0801, "num_input_tokens_seen": 3170926, "step": 1139, "train_runtime": 2907.1033, "train_tokens_per_second": 1090.751 }, { "epoch": 0.0916048936298439, "grad_norm": 0.3032757341861725, "learning_rate": 0.0001242737896494157, "loss": 0.6802, "num_input_tokens_seen": 3175594, "step": 1140, "train_runtime": 2910.2688, "train_tokens_per_second": 1091.169 }, { "epoch": 0.09168524879969465, "grad_norm": 0.328593909740448, "learning_rate": 0.00012420701168614357, "loss": 0.8727, "num_input_tokens_seen": 3178492, "step": 1141, "train_runtime": 2914.6077, "train_tokens_per_second": 1090.539 }, { "epoch": 0.09176560396954539, "grad_norm": 0.32067033648490906, "learning_rate": 0.00012414023372287147, "loss": 1.3166, "num_input_tokens_seen": 3181490, "step": 1142, "train_runtime": 2916.9055, "train_tokens_per_second": 1090.707 }, { "epoch": 0.09184595913939612, "grad_norm": 0.27059289813041687, "learning_rate": 0.00012407345575959935, "loss": 0.9869, "num_input_tokens_seen": 3185200, "step": 1143, "train_runtime": 2919.5893, "train_tokens_per_second": 1090.975 }, { "epoch": 0.09192631430924687, "grad_norm": 0.3421857953071594, "learning_rate": 0.00012400667779632722, "loss": 1.0266, "num_input_tokens_seen": 3188268, "step": 1144, "train_runtime": 2921.9862, "train_tokens_per_second": 1091.13 }, { "epoch": 0.09200666947909761, "grad_norm": 0.34387344121932983, "learning_rate": 0.0001239398998330551, "loss": 1.0565, "num_input_tokens_seen": 3191514, "step": 1145, "train_runtime": 2924.3616, "train_tokens_per_second": 1091.354 }, { "epoch": 0.09208702464894836, "grad_norm": 0.45765259861946106, "learning_rate": 0.00012387312186978297, "loss": 1.2379, "num_input_tokens_seen": 3193618, "step": 1146, "train_runtime": 2926.2304, "train_tokens_per_second": 1091.376 }, { "epoch": 0.09216737981879909, "grad_norm": 0.27509790658950806, "learning_rate": 0.00012380634390651084, "loss": 0.9037, "num_input_tokens_seen": 3196160, "step": 1147, "train_runtime": 2928.2053, "train_tokens_per_second": 1091.508 }, { "epoch": 0.09224773498864983, "grad_norm": 0.28337612748146057, "learning_rate": 0.00012373956594323874, "loss": 0.8756, "num_input_tokens_seen": 3198826, "step": 1148, "train_runtime": 2930.3393, "train_tokens_per_second": 1091.623 }, { "epoch": 0.09232809015850058, "grad_norm": 0.3089130222797394, "learning_rate": 0.00012367278797996661, "loss": 1.1017, "num_input_tokens_seen": 3201486, "step": 1149, "train_runtime": 2932.5295, "train_tokens_per_second": 1091.715 }, { "epoch": 0.09240844532835131, "grad_norm": 0.31819039583206177, "learning_rate": 0.0001236060100166945, "loss": 0.8012, "num_input_tokens_seen": 3203882, "step": 1150, "train_runtime": 2934.4923, "train_tokens_per_second": 1091.801 }, { "epoch": 0.09248880049820206, "grad_norm": 0.3065102994441986, "learning_rate": 0.00012353923205342236, "loss": 0.9448, "num_input_tokens_seen": 3206016, "step": 1151, "train_runtime": 2936.2829, "train_tokens_per_second": 1091.862 }, { "epoch": 0.0925691556680528, "grad_norm": 0.3837001323699951, "learning_rate": 0.00012347245409015026, "loss": 0.6354, "num_input_tokens_seen": 3208838, "step": 1152, "train_runtime": 2938.5387, "train_tokens_per_second": 1091.984 }, { "epoch": 0.09264951083790353, "grad_norm": 0.3397212624549866, "learning_rate": 0.00012340567612687813, "loss": 1.0924, "num_input_tokens_seen": 3212190, "step": 1153, "train_runtime": 2941.0359, "train_tokens_per_second": 1092.197 }, { "epoch": 0.09272986600775428, "grad_norm": 0.30270108580589294, "learning_rate": 0.00012333889816360603, "loss": 0.8581, "num_input_tokens_seen": 3214572, "step": 1154, "train_runtime": 2943.0509, "train_tokens_per_second": 1092.258 }, { "epoch": 0.09281022117760501, "grad_norm": 0.2992537319660187, "learning_rate": 0.0001232721202003339, "loss": 0.8548, "num_input_tokens_seen": 3216486, "step": 1155, "train_runtime": 2944.734, "train_tokens_per_second": 1092.284 }, { "epoch": 0.09289057634745576, "grad_norm": 0.33950281143188477, "learning_rate": 0.00012320534223706178, "loss": 1.09, "num_input_tokens_seen": 3218280, "step": 1156, "train_runtime": 2946.3632, "train_tokens_per_second": 1092.289 }, { "epoch": 0.0929709315173065, "grad_norm": 0.315149188041687, "learning_rate": 0.00012313856427378965, "loss": 1.2139, "num_input_tokens_seen": 3221044, "step": 1157, "train_runtime": 2948.5947, "train_tokens_per_second": 1092.4 }, { "epoch": 0.09305128668715723, "grad_norm": 0.26932209730148315, "learning_rate": 0.00012307178631051755, "loss": 0.9881, "num_input_tokens_seen": 3225038, "step": 1158, "train_runtime": 2951.4962, "train_tokens_per_second": 1092.679 }, { "epoch": 0.09313164185700798, "grad_norm": 0.31834033131599426, "learning_rate": 0.00012300500834724543, "loss": 1.2673, "num_input_tokens_seen": 3227596, "step": 1159, "train_runtime": 2953.5391, "train_tokens_per_second": 1092.789 }, { "epoch": 0.09321199702685871, "grad_norm": 0.3501078188419342, "learning_rate": 0.0001229382303839733, "loss": 1.4483, "num_input_tokens_seen": 3230014, "step": 1160, "train_runtime": 2955.5747, "train_tokens_per_second": 1092.855 }, { "epoch": 0.09329235219670945, "grad_norm": 0.3090665638446808, "learning_rate": 0.00012287145242070117, "loss": 0.9208, "num_input_tokens_seen": 3232256, "step": 1161, "train_runtime": 2957.5276, "train_tokens_per_second": 1092.891 }, { "epoch": 0.0933727073665602, "grad_norm": 0.3182087540626526, "learning_rate": 0.00012280467445742905, "loss": 0.9703, "num_input_tokens_seen": 3234172, "step": 1162, "train_runtime": 2959.2768, "train_tokens_per_second": 1092.893 }, { "epoch": 0.09345306253641093, "grad_norm": 0.3346424698829651, "learning_rate": 0.00012273789649415692, "loss": 1.0238, "num_input_tokens_seen": 3236354, "step": 1163, "train_runtime": 2961.1973, "train_tokens_per_second": 1092.921 }, { "epoch": 0.09353341770626168, "grad_norm": 0.304471880197525, "learning_rate": 0.00012267111853088482, "loss": 1.1515, "num_input_tokens_seen": 3239612, "step": 1164, "train_runtime": 2963.5918, "train_tokens_per_second": 1093.137 }, { "epoch": 0.09361377287611242, "grad_norm": 0.26479142904281616, "learning_rate": 0.0001226043405676127, "loss": 0.8122, "num_input_tokens_seen": 3242874, "step": 1165, "train_runtime": 2966.052, "train_tokens_per_second": 1093.33 }, { "epoch": 0.09369412804596315, "grad_norm": 0.3055541515350342, "learning_rate": 0.00012253756260434057, "loss": 0.8506, "num_input_tokens_seen": 3245036, "step": 1166, "train_runtime": 2967.9365, "train_tokens_per_second": 1093.364 }, { "epoch": 0.0937744832158139, "grad_norm": 0.3619381785392761, "learning_rate": 0.00012247078464106844, "loss": 0.9579, "num_input_tokens_seen": 3246832, "step": 1167, "train_runtime": 2969.7046, "train_tokens_per_second": 1093.318 }, { "epoch": 0.09385483838566464, "grad_norm": 0.28716981410980225, "learning_rate": 0.0001224040066777963, "loss": 1.1342, "num_input_tokens_seen": 3249492, "step": 1168, "train_runtime": 2971.8211, "train_tokens_per_second": 1093.435 }, { "epoch": 0.09393519355551538, "grad_norm": 0.2521206736564636, "learning_rate": 0.0001223372287145242, "loss": 0.9544, "num_input_tokens_seen": 3251466, "step": 1169, "train_runtime": 2973.5833, "train_tokens_per_second": 1093.45 }, { "epoch": 0.09401554872536612, "grad_norm": 0.3139553964138031, "learning_rate": 0.00012227045075125209, "loss": 1.1726, "num_input_tokens_seen": 3255194, "step": 1170, "train_runtime": 2976.2718, "train_tokens_per_second": 1093.715 }, { "epoch": 0.09409590389521685, "grad_norm": 0.3215081989765167, "learning_rate": 0.00012220367278797999, "loss": 1.093, "num_input_tokens_seen": 3257140, "step": 1171, "train_runtime": 2980.0717, "train_tokens_per_second": 1092.974 }, { "epoch": 0.0941762590650676, "grad_norm": 0.25101542472839355, "learning_rate": 0.00012213689482470786, "loss": 0.6596, "num_input_tokens_seen": 3260770, "step": 1172, "train_runtime": 2982.74, "train_tokens_per_second": 1093.213 }, { "epoch": 0.09425661423491834, "grad_norm": 0.32819992303848267, "learning_rate": 0.00012207011686143572, "loss": 0.9306, "num_input_tokens_seen": 3263358, "step": 1173, "train_runtime": 2984.8253, "train_tokens_per_second": 1093.316 }, { "epoch": 0.09433696940476909, "grad_norm": 0.3013783097267151, "learning_rate": 0.00012200333889816362, "loss": 0.8609, "num_input_tokens_seen": 3265994, "step": 1174, "train_runtime": 2986.9099, "train_tokens_per_second": 1093.436 }, { "epoch": 0.09441732457461982, "grad_norm": 0.4124008119106293, "learning_rate": 0.00012193656093489149, "loss": 0.9928, "num_input_tokens_seen": 3267986, "step": 1175, "train_runtime": 2988.7424, "train_tokens_per_second": 1093.432 }, { "epoch": 0.09449767974447056, "grad_norm": 0.31742510199546814, "learning_rate": 0.00012186978297161938, "loss": 1.0538, "num_input_tokens_seen": 3270978, "step": 1176, "train_runtime": 2991.1303, "train_tokens_per_second": 1093.559 }, { "epoch": 0.0945780349143213, "grad_norm": 0.2772507667541504, "learning_rate": 0.00012180300500834725, "loss": 0.6553, "num_input_tokens_seen": 3273460, "step": 1177, "train_runtime": 2993.1726, "train_tokens_per_second": 1093.642 }, { "epoch": 0.09465839008417204, "grad_norm": 0.32513031363487244, "learning_rate": 0.00012173622704507512, "loss": 0.9216, "num_input_tokens_seen": 3275222, "step": 1178, "train_runtime": 2994.8408, "train_tokens_per_second": 1093.621 }, { "epoch": 0.09473874525402277, "grad_norm": 0.30071112513542175, "learning_rate": 0.00012166944908180303, "loss": 0.9744, "num_input_tokens_seen": 3277610, "step": 1179, "train_runtime": 2996.866, "train_tokens_per_second": 1093.679 }, { "epoch": 0.09481910042387352, "grad_norm": 0.4937950074672699, "learning_rate": 0.0001216026711185309, "loss": 0.684, "num_input_tokens_seen": 3279686, "step": 1180, "train_runtime": 2998.6405, "train_tokens_per_second": 1093.724 }, { "epoch": 0.09489945559372426, "grad_norm": 0.35838666558265686, "learning_rate": 0.00012153589315525877, "loss": 1.1709, "num_input_tokens_seen": 3282104, "step": 1181, "train_runtime": 3000.6778, "train_tokens_per_second": 1093.788 }, { "epoch": 0.094979810763575, "grad_norm": 0.3639245629310608, "learning_rate": 0.00012146911519198664, "loss": 0.8092, "num_input_tokens_seen": 3284068, "step": 1182, "train_runtime": 3002.4917, "train_tokens_per_second": 1093.781 }, { "epoch": 0.09506016593342574, "grad_norm": 0.31621286273002625, "learning_rate": 0.00012140233722871452, "loss": 0.9947, "num_input_tokens_seen": 3286962, "step": 1183, "train_runtime": 3004.727, "train_tokens_per_second": 1093.93 }, { "epoch": 0.09514052110327648, "grad_norm": 0.4309380054473877, "learning_rate": 0.0001213355592654424, "loss": 0.9539, "num_input_tokens_seen": 3290742, "step": 1184, "train_runtime": 3007.5212, "train_tokens_per_second": 1094.171 }, { "epoch": 0.09522087627312723, "grad_norm": 0.2795886993408203, "learning_rate": 0.00012126878130217029, "loss": 0.8429, "num_input_tokens_seen": 3293040, "step": 1185, "train_runtime": 3009.4995, "train_tokens_per_second": 1094.215 }, { "epoch": 0.09530123144297796, "grad_norm": 0.40882760286331177, "learning_rate": 0.00012120200333889818, "loss": 1.0339, "num_input_tokens_seen": 3296526, "step": 1186, "train_runtime": 3012.2903, "train_tokens_per_second": 1094.359 }, { "epoch": 0.09538158661282871, "grad_norm": 0.4669959247112274, "learning_rate": 0.00012113522537562605, "loss": 1.0336, "num_input_tokens_seen": 3299012, "step": 1187, "train_runtime": 3014.4237, "train_tokens_per_second": 1094.409 }, { "epoch": 0.09546194178267944, "grad_norm": 0.3601592779159546, "learning_rate": 0.00012106844741235392, "loss": 0.9862, "num_input_tokens_seen": 3301084, "step": 1188, "train_runtime": 3016.3675, "train_tokens_per_second": 1094.391 }, { "epoch": 0.09554229695253018, "grad_norm": 0.25590991973876953, "learning_rate": 0.0001210016694490818, "loss": 0.8542, "num_input_tokens_seen": 3302880, "step": 1189, "train_runtime": 3018.1605, "train_tokens_per_second": 1094.335 }, { "epoch": 0.09562265212238093, "grad_norm": 0.3337498903274536, "learning_rate": 0.0001209348914858097, "loss": 1.0826, "num_input_tokens_seen": 3304580, "step": 1190, "train_runtime": 3019.7608, "train_tokens_per_second": 1094.318 }, { "epoch": 0.09570300729223166, "grad_norm": 0.31814974546432495, "learning_rate": 0.00012086811352253757, "loss": 0.9773, "num_input_tokens_seen": 3307130, "step": 1191, "train_runtime": 3021.8885, "train_tokens_per_second": 1094.392 }, { "epoch": 0.09578336246208241, "grad_norm": 0.27574920654296875, "learning_rate": 0.00012080133555926544, "loss": 0.9745, "num_input_tokens_seen": 3310210, "step": 1192, "train_runtime": 3024.1884, "train_tokens_per_second": 1094.578 }, { "epoch": 0.09586371763193315, "grad_norm": 0.2402028739452362, "learning_rate": 0.00012073455759599333, "loss": 0.607, "num_input_tokens_seen": 3312534, "step": 1193, "train_runtime": 3026.1177, "train_tokens_per_second": 1094.648 }, { "epoch": 0.09594407280178388, "grad_norm": 0.3079510033130646, "learning_rate": 0.0001206677796327212, "loss": 1.1701, "num_input_tokens_seen": 3315400, "step": 1194, "train_runtime": 3028.4559, "train_tokens_per_second": 1094.749 }, { "epoch": 0.09602442797163463, "grad_norm": 0.30498263239860535, "learning_rate": 0.0001206010016694491, "loss": 1.2102, "num_input_tokens_seen": 3318620, "step": 1195, "train_runtime": 3030.936, "train_tokens_per_second": 1094.916 }, { "epoch": 0.09610478314148536, "grad_norm": 0.34362462162971497, "learning_rate": 0.00012053422370617698, "loss": 0.9796, "num_input_tokens_seen": 3321292, "step": 1196, "train_runtime": 3033.1273, "train_tokens_per_second": 1095.006 }, { "epoch": 0.0961851383113361, "grad_norm": 0.28773069381713867, "learning_rate": 0.00012046744574290485, "loss": 0.8244, "num_input_tokens_seen": 3323442, "step": 1197, "train_runtime": 3035.1383, "train_tokens_per_second": 1094.989 }, { "epoch": 0.09626549348118685, "grad_norm": 0.28585824370384216, "learning_rate": 0.00012040066777963272, "loss": 1.1634, "num_input_tokens_seen": 3325440, "step": 1198, "train_runtime": 3036.917, "train_tokens_per_second": 1095.005 }, { "epoch": 0.09634584865103758, "grad_norm": 0.2801036238670349, "learning_rate": 0.0001203338898163606, "loss": 0.883, "num_input_tokens_seen": 3327700, "step": 1199, "train_runtime": 3038.8898, "train_tokens_per_second": 1095.038 }, { "epoch": 0.09642620382088833, "grad_norm": 0.2651750147342682, "learning_rate": 0.00012026711185308848, "loss": 0.9353, "num_input_tokens_seen": 3329912, "step": 1200, "train_runtime": 3040.8113, "train_tokens_per_second": 1095.074 }, { "epoch": 0.09642620382088833, "eval_loss": 0.9765015244483948, "eval_runtime": 93.3343, "eval_samples_per_second": 10.65, "eval_steps_per_second": 5.325, "num_input_tokens_seen": 3329912, "step": 1200 }, { "epoch": 0.09650655899073907, "grad_norm": 0.314842164516449, "learning_rate": 0.00012020033388981637, "loss": 1.0329, "num_input_tokens_seen": 3332024, "step": 1201, "train_runtime": 3138.0196, "train_tokens_per_second": 1061.824 }, { "epoch": 0.0965869141605898, "grad_norm": 0.32207608222961426, "learning_rate": 0.00012013355592654426, "loss": 0.9658, "num_input_tokens_seen": 3336034, "step": 1202, "train_runtime": 3141.0618, "train_tokens_per_second": 1062.072 }, { "epoch": 0.09666726933044055, "grad_norm": 0.3103851079940796, "learning_rate": 0.00012006677796327213, "loss": 0.869, "num_input_tokens_seen": 3337826, "step": 1203, "train_runtime": 3142.8775, "train_tokens_per_second": 1062.029 }, { "epoch": 0.09674762450029128, "grad_norm": 0.3051537573337555, "learning_rate": 0.00012, "loss": 0.9135, "num_input_tokens_seen": 3339950, "step": 1204, "train_runtime": 3144.7626, "train_tokens_per_second": 1062.067 }, { "epoch": 0.09682797967014203, "grad_norm": 0.33335167169570923, "learning_rate": 0.00011993322203672788, "loss": 1.0979, "num_input_tokens_seen": 3343030, "step": 1205, "train_runtime": 3147.2014, "train_tokens_per_second": 1062.223 }, { "epoch": 0.09690833483999277, "grad_norm": 0.3052538335323334, "learning_rate": 0.00011986644407345578, "loss": 1.234, "num_input_tokens_seen": 3345764, "step": 1206, "train_runtime": 3149.4487, "train_tokens_per_second": 1062.333 }, { "epoch": 0.0969886900098435, "grad_norm": 0.29944851994514465, "learning_rate": 0.00011979966611018365, "loss": 1.0247, "num_input_tokens_seen": 3347902, "step": 1207, "train_runtime": 3151.3077, "train_tokens_per_second": 1062.385 }, { "epoch": 0.09706904517969425, "grad_norm": 0.32125842571258545, "learning_rate": 0.00011973288814691152, "loss": 0.9658, "num_input_tokens_seen": 3350306, "step": 1208, "train_runtime": 3153.2804, "train_tokens_per_second": 1062.483 }, { "epoch": 0.09714940034954499, "grad_norm": 0.3880539536476135, "learning_rate": 0.0001196661101836394, "loss": 1.0051, "num_input_tokens_seen": 3354422, "step": 1209, "train_runtime": 3156.2662, "train_tokens_per_second": 1062.782 }, { "epoch": 0.09722975551939574, "grad_norm": 0.3151746988296509, "learning_rate": 0.00011959933222036728, "loss": 0.9279, "num_input_tokens_seen": 3357024, "step": 1210, "train_runtime": 3158.4457, "train_tokens_per_second": 1062.872 }, { "epoch": 0.09731011068924647, "grad_norm": 0.2788081169128418, "learning_rate": 0.00011953255425709517, "loss": 0.7704, "num_input_tokens_seen": 3359668, "step": 1211, "train_runtime": 3160.6625, "train_tokens_per_second": 1062.963 }, { "epoch": 0.0973904658590972, "grad_norm": 0.2628996670246124, "learning_rate": 0.00011946577629382306, "loss": 0.8496, "num_input_tokens_seen": 3362928, "step": 1212, "train_runtime": 3163.2719, "train_tokens_per_second": 1063.117 }, { "epoch": 0.09747082102894795, "grad_norm": 0.3539094924926758, "learning_rate": 0.00011939899833055093, "loss": 1.2361, "num_input_tokens_seen": 3365638, "step": 1213, "train_runtime": 3165.4906, "train_tokens_per_second": 1063.228 }, { "epoch": 0.09755117619879869, "grad_norm": 0.3183014690876007, "learning_rate": 0.0001193322203672788, "loss": 0.8117, "num_input_tokens_seen": 3367574, "step": 1214, "train_runtime": 3167.3193, "train_tokens_per_second": 1063.225 }, { "epoch": 0.09763153136864942, "grad_norm": 0.29052481055259705, "learning_rate": 0.00011926544240400668, "loss": 0.8508, "num_input_tokens_seen": 3369940, "step": 1215, "train_runtime": 3169.3579, "train_tokens_per_second": 1063.288 }, { "epoch": 0.09771188653850017, "grad_norm": 0.27354535460472107, "learning_rate": 0.00011919866444073455, "loss": 0.6888, "num_input_tokens_seen": 3372702, "step": 1216, "train_runtime": 3171.5886, "train_tokens_per_second": 1063.411 }, { "epoch": 0.09779224170835091, "grad_norm": 0.2888067066669464, "learning_rate": 0.00011913188647746245, "loss": 0.8659, "num_input_tokens_seen": 3374686, "step": 1217, "train_runtime": 3173.3758, "train_tokens_per_second": 1063.437 }, { "epoch": 0.09787259687820166, "grad_norm": 0.51072758436203, "learning_rate": 0.00011906510851419032, "loss": 1.2043, "num_input_tokens_seen": 3378102, "step": 1218, "train_runtime": 3175.984, "train_tokens_per_second": 1063.639 }, { "epoch": 0.09795295204805239, "grad_norm": 0.2898387908935547, "learning_rate": 0.00011899833055091821, "loss": 0.7763, "num_input_tokens_seen": 3380130, "step": 1219, "train_runtime": 3177.7603, "train_tokens_per_second": 1063.683 }, { "epoch": 0.09803330721790313, "grad_norm": 0.3145882785320282, "learning_rate": 0.00011893155258764608, "loss": 1.2572, "num_input_tokens_seen": 3386286, "step": 1220, "train_runtime": 3181.9788, "train_tokens_per_second": 1064.208 }, { "epoch": 0.09811366238775387, "grad_norm": 0.24348506331443787, "learning_rate": 0.00011886477462437396, "loss": 0.7086, "num_input_tokens_seen": 3388292, "step": 1221, "train_runtime": 3183.8526, "train_tokens_per_second": 1064.211 }, { "epoch": 0.09819401755760461, "grad_norm": 0.32285764813423157, "learning_rate": 0.00011879799666110186, "loss": 1.1369, "num_input_tokens_seen": 3390588, "step": 1222, "train_runtime": 3185.8309, "train_tokens_per_second": 1064.271 }, { "epoch": 0.09827437272745536, "grad_norm": 2.257875680923462, "learning_rate": 0.00011873121869782973, "loss": 0.9062, "num_input_tokens_seen": 3392844, "step": 1223, "train_runtime": 3187.7494, "train_tokens_per_second": 1064.338 }, { "epoch": 0.0983547278973061, "grad_norm": 0.29244640469551086, "learning_rate": 0.0001186644407345576, "loss": 0.9722, "num_input_tokens_seen": 3394832, "step": 1224, "train_runtime": 3189.5074, "train_tokens_per_second": 1064.375 }, { "epoch": 0.09843508306715683, "grad_norm": 0.3648703694343567, "learning_rate": 0.00011859766277128547, "loss": 1.085, "num_input_tokens_seen": 3397904, "step": 1225, "train_runtime": 3191.9959, "train_tokens_per_second": 1064.508 }, { "epoch": 0.09851543823700758, "grad_norm": 0.3223254382610321, "learning_rate": 0.00011853088480801335, "loss": 1.059, "num_input_tokens_seen": 3401394, "step": 1226, "train_runtime": 3194.6813, "train_tokens_per_second": 1064.705 }, { "epoch": 0.09859579340685831, "grad_norm": 0.30533918738365173, "learning_rate": 0.00011846410684474125, "loss": 1.1062, "num_input_tokens_seen": 3404168, "step": 1227, "train_runtime": 3196.9597, "train_tokens_per_second": 1064.814 }, { "epoch": 0.09867614857670906, "grad_norm": 0.2948809266090393, "learning_rate": 0.00011839732888146912, "loss": 1.0735, "num_input_tokens_seen": 3406594, "step": 1228, "train_runtime": 3198.9441, "train_tokens_per_second": 1064.912 }, { "epoch": 0.0987565037465598, "grad_norm": 0.42436307668685913, "learning_rate": 0.00011833055091819701, "loss": 1.0877, "num_input_tokens_seen": 3409922, "step": 1229, "train_runtime": 3201.5479, "train_tokens_per_second": 1065.085 }, { "epoch": 0.09883685891641053, "grad_norm": 0.43277955055236816, "learning_rate": 0.00011826377295492488, "loss": 0.8141, "num_input_tokens_seen": 3411954, "step": 1230, "train_runtime": 3203.5064, "train_tokens_per_second": 1065.069 }, { "epoch": 0.09891721408626128, "grad_norm": 0.3280401825904846, "learning_rate": 0.00011819699499165275, "loss": 1.1611, "num_input_tokens_seen": 3415216, "step": 1231, "train_runtime": 3208.063, "train_tokens_per_second": 1064.573 }, { "epoch": 0.09899756925611201, "grad_norm": 0.35693255066871643, "learning_rate": 0.00011813021702838063, "loss": 0.8101, "num_input_tokens_seen": 3418256, "step": 1232, "train_runtime": 3210.416, "train_tokens_per_second": 1064.739 }, { "epoch": 0.09907792442596275, "grad_norm": 0.3006307780742645, "learning_rate": 0.00011806343906510853, "loss": 0.8263, "num_input_tokens_seen": 3421074, "step": 1233, "train_runtime": 3212.6835, "train_tokens_per_second": 1064.865 }, { "epoch": 0.0991582795958135, "grad_norm": 0.39713171124458313, "learning_rate": 0.0001179966611018364, "loss": 1.295, "num_input_tokens_seen": 3423054, "step": 1234, "train_runtime": 3214.5737, "train_tokens_per_second": 1064.855 }, { "epoch": 0.09923863476566423, "grad_norm": 0.30702802538871765, "learning_rate": 0.00011792988313856427, "loss": 0.9079, "num_input_tokens_seen": 3425640, "step": 1235, "train_runtime": 3216.7137, "train_tokens_per_second": 1064.95 }, { "epoch": 0.09931898993551498, "grad_norm": 0.3540534973144531, "learning_rate": 0.00011786310517529216, "loss": 1.2356, "num_input_tokens_seen": 3429086, "step": 1236, "train_runtime": 3219.2915, "train_tokens_per_second": 1065.168 }, { "epoch": 0.09939934510536572, "grad_norm": 0.26566973328590393, "learning_rate": 0.00011779632721202003, "loss": 0.6904, "num_input_tokens_seen": 3431732, "step": 1237, "train_runtime": 3221.4314, "train_tokens_per_second": 1065.282 }, { "epoch": 0.09947970027521645, "grad_norm": 0.27577558159828186, "learning_rate": 0.00011772954924874793, "loss": 0.9845, "num_input_tokens_seen": 3433848, "step": 1238, "train_runtime": 3223.349, "train_tokens_per_second": 1065.304 }, { "epoch": 0.0995600554450672, "grad_norm": 0.314525842666626, "learning_rate": 0.00011766277128547581, "loss": 1.0063, "num_input_tokens_seen": 3436860, "step": 1239, "train_runtime": 3225.6969, "train_tokens_per_second": 1065.463 }, { "epoch": 0.09964041061491793, "grad_norm": 0.3086790144443512, "learning_rate": 0.00011759599332220368, "loss": 1.2317, "num_input_tokens_seen": 3439382, "step": 1240, "train_runtime": 3227.76, "train_tokens_per_second": 1065.563 }, { "epoch": 0.09972076578476868, "grad_norm": 0.31807294487953186, "learning_rate": 0.00011752921535893155, "loss": 1.0096, "num_input_tokens_seen": 3442102, "step": 1241, "train_runtime": 3229.9903, "train_tokens_per_second": 1065.669 }, { "epoch": 0.09980112095461942, "grad_norm": 0.3649135231971741, "learning_rate": 0.00011746243739565943, "loss": 1.1959, "num_input_tokens_seen": 3445372, "step": 1242, "train_runtime": 3232.4229, "train_tokens_per_second": 1065.879 }, { "epoch": 0.09988147612447015, "grad_norm": 0.3410540819168091, "learning_rate": 0.00011739565943238733, "loss": 1.2128, "num_input_tokens_seen": 3450264, "step": 1243, "train_runtime": 3235.9695, "train_tokens_per_second": 1066.223 }, { "epoch": 0.0999618312943209, "grad_norm": 0.31123611330986023, "learning_rate": 0.0001173288814691152, "loss": 1.1788, "num_input_tokens_seen": 3453118, "step": 1244, "train_runtime": 3238.2566, "train_tokens_per_second": 1066.351 }, { "epoch": 0.10004218646417164, "grad_norm": 0.5428243279457092, "learning_rate": 0.00011726210350584307, "loss": 0.7929, "num_input_tokens_seen": 3454734, "step": 1245, "train_runtime": 3239.9068, "train_tokens_per_second": 1066.307 }, { "epoch": 0.10012254163402239, "grad_norm": 0.3110898435115814, "learning_rate": 0.00011719532554257096, "loss": 0.9553, "num_input_tokens_seen": 3457338, "step": 1246, "train_runtime": 3241.9796, "train_tokens_per_second": 1066.428 }, { "epoch": 0.10020289680387312, "grad_norm": 0.29573866724967957, "learning_rate": 0.00011712854757929883, "loss": 0.9578, "num_input_tokens_seen": 3464012, "step": 1247, "train_runtime": 3246.4569, "train_tokens_per_second": 1067.013 }, { "epoch": 0.10028325197372386, "grad_norm": 0.3642765283584595, "learning_rate": 0.0001170617696160267, "loss": 0.9672, "num_input_tokens_seen": 3466478, "step": 1248, "train_runtime": 3248.516, "train_tokens_per_second": 1067.096 }, { "epoch": 0.1003636071435746, "grad_norm": 0.36443278193473816, "learning_rate": 0.0001169949916527546, "loss": 0.9012, "num_input_tokens_seen": 3468728, "step": 1249, "train_runtime": 3250.4518, "train_tokens_per_second": 1067.153 }, { "epoch": 0.10044396231342534, "grad_norm": 0.3295373320579529, "learning_rate": 0.00011692821368948248, "loss": 0.8551, "num_input_tokens_seen": 3470494, "step": 1250, "train_runtime": 3252.1408, "train_tokens_per_second": 1067.141 }, { "epoch": 0.10052431748327607, "grad_norm": 0.2924972176551819, "learning_rate": 0.00011686143572621035, "loss": 0.9447, "num_input_tokens_seen": 3473070, "step": 1251, "train_runtime": 3254.2408, "train_tokens_per_second": 1067.244 }, { "epoch": 0.10060467265312682, "grad_norm": 0.3317801058292389, "learning_rate": 0.00011679465776293823, "loss": 1.1554, "num_input_tokens_seen": 3476870, "step": 1252, "train_runtime": 3257.0631, "train_tokens_per_second": 1067.486 }, { "epoch": 0.10068502782297756, "grad_norm": 0.29733848571777344, "learning_rate": 0.00011672787979966611, "loss": 1.2392, "num_input_tokens_seen": 3481962, "step": 1253, "train_runtime": 3260.6026, "train_tokens_per_second": 1067.889 }, { "epoch": 0.1007653829928283, "grad_norm": 0.39476510882377625, "learning_rate": 0.000116661101836394, "loss": 1.059, "num_input_tokens_seen": 3483844, "step": 1254, "train_runtime": 3262.4423, "train_tokens_per_second": 1067.864 }, { "epoch": 0.10084573816267904, "grad_norm": 0.34786123037338257, "learning_rate": 0.00011659432387312189, "loss": 0.8964, "num_input_tokens_seen": 3486148, "step": 1255, "train_runtime": 3264.3911, "train_tokens_per_second": 1067.932 }, { "epoch": 0.10092609333252978, "grad_norm": 0.3131040036678314, "learning_rate": 0.00011652754590984976, "loss": 1.064, "num_input_tokens_seen": 3489286, "step": 1256, "train_runtime": 3266.81, "train_tokens_per_second": 1068.102 }, { "epoch": 0.10100644850238052, "grad_norm": 0.3158160150051117, "learning_rate": 0.00011646076794657763, "loss": 0.8569, "num_input_tokens_seen": 3490964, "step": 1257, "train_runtime": 3268.4627, "train_tokens_per_second": 1068.075 }, { "epoch": 0.10108680367223126, "grad_norm": 0.3509765863418579, "learning_rate": 0.0001163939899833055, "loss": 1.1789, "num_input_tokens_seen": 3494808, "step": 1258, "train_runtime": 3271.2276, "train_tokens_per_second": 1068.348 }, { "epoch": 0.10116715884208201, "grad_norm": 0.3125106990337372, "learning_rate": 0.0001163272120200334, "loss": 0.9231, "num_input_tokens_seen": 3498294, "step": 1259, "train_runtime": 3273.8426, "train_tokens_per_second": 1068.559 }, { "epoch": 0.10124751401193274, "grad_norm": 0.3093608319759369, "learning_rate": 0.00011626043405676128, "loss": 0.6292, "num_input_tokens_seen": 3500254, "step": 1260, "train_runtime": 3275.6331, "train_tokens_per_second": 1068.573 }, { "epoch": 0.10132786918178348, "grad_norm": 0.36007463932037354, "learning_rate": 0.00011619365609348915, "loss": 0.7856, "num_input_tokens_seen": 3503508, "step": 1261, "train_runtime": 3280.1542, "train_tokens_per_second": 1068.092 }, { "epoch": 0.10140822435163423, "grad_norm": 0.28798437118530273, "learning_rate": 0.00011612687813021703, "loss": 0.8916, "num_input_tokens_seen": 3505852, "step": 1262, "train_runtime": 3282.1114, "train_tokens_per_second": 1068.17 }, { "epoch": 0.10148857952148496, "grad_norm": 0.2930155098438263, "learning_rate": 0.00011606010016694491, "loss": 1.3215, "num_input_tokens_seen": 3508346, "step": 1263, "train_runtime": 3284.1582, "train_tokens_per_second": 1068.263 }, { "epoch": 0.10156893469133571, "grad_norm": 0.311412513256073, "learning_rate": 0.00011599332220367279, "loss": 1.1918, "num_input_tokens_seen": 3513318, "step": 1264, "train_runtime": 3287.5156, "train_tokens_per_second": 1068.685 }, { "epoch": 0.10164928986118645, "grad_norm": 0.3272484540939331, "learning_rate": 0.00011592654424040069, "loss": 0.8194, "num_input_tokens_seen": 3516784, "step": 1265, "train_runtime": 3289.9868, "train_tokens_per_second": 1068.936 }, { "epoch": 0.10172964503103718, "grad_norm": 0.2773434817790985, "learning_rate": 0.00011585976627712856, "loss": 1.1294, "num_input_tokens_seen": 3519300, "step": 1266, "train_runtime": 3291.9888, "train_tokens_per_second": 1069.05 }, { "epoch": 0.10181000020088793, "grad_norm": 0.33304062485694885, "learning_rate": 0.00011579298831385643, "loss": 1.092, "num_input_tokens_seen": 3521494, "step": 1267, "train_runtime": 3293.8491, "train_tokens_per_second": 1069.112 }, { "epoch": 0.10189035537073866, "grad_norm": 0.2839994430541992, "learning_rate": 0.0001157262103505843, "loss": 1.1517, "num_input_tokens_seen": 3527394, "step": 1268, "train_runtime": 3297.807, "train_tokens_per_second": 1069.618 }, { "epoch": 0.1019707105405894, "grad_norm": 0.2699480950832367, "learning_rate": 0.00011565943238731218, "loss": 0.9478, "num_input_tokens_seen": 3533516, "step": 1269, "train_runtime": 3301.821, "train_tokens_per_second": 1070.172 }, { "epoch": 0.10205106571044015, "grad_norm": 0.3100241422653198, "learning_rate": 0.00011559265442404008, "loss": 1.0893, "num_input_tokens_seen": 3535846, "step": 1270, "train_runtime": 3303.8417, "train_tokens_per_second": 1070.223 }, { "epoch": 0.10213142088029088, "grad_norm": 0.3002788722515106, "learning_rate": 0.00011552587646076795, "loss": 0.8683, "num_input_tokens_seen": 3538008, "step": 1271, "train_runtime": 3305.749, "train_tokens_per_second": 1070.259 }, { "epoch": 0.10221177605014163, "grad_norm": 0.3277871012687683, "learning_rate": 0.00011545909849749584, "loss": 0.9769, "num_input_tokens_seen": 3539180, "step": 1272, "train_runtime": 3307.2377, "train_tokens_per_second": 1070.132 }, { "epoch": 0.10229213121999237, "grad_norm": 0.2547849714756012, "learning_rate": 0.00011539232053422371, "loss": 0.6298, "num_input_tokens_seen": 3541598, "step": 1273, "train_runtime": 3309.3054, "train_tokens_per_second": 1070.194 }, { "epoch": 0.1023724863898431, "grad_norm": 0.28834977746009827, "learning_rate": 0.00011532554257095158, "loss": 0.9077, "num_input_tokens_seen": 3543802, "step": 1274, "train_runtime": 3311.2111, "train_tokens_per_second": 1070.243 }, { "epoch": 0.10245284155969385, "grad_norm": 0.2694496214389801, "learning_rate": 0.00011525876460767948, "loss": 0.6518, "num_input_tokens_seen": 3546678, "step": 1275, "train_runtime": 3313.4455, "train_tokens_per_second": 1070.39 }, { "epoch": 0.10253319672954458, "grad_norm": 0.3871023654937744, "learning_rate": 0.00011519198664440736, "loss": 1.0278, "num_input_tokens_seen": 3548778, "step": 1276, "train_runtime": 3315.268, "train_tokens_per_second": 1070.435 }, { "epoch": 0.10261355189939533, "grad_norm": 0.3189085125923157, "learning_rate": 0.00011512520868113523, "loss": 0.6991, "num_input_tokens_seen": 3551284, "step": 1277, "train_runtime": 3317.2689, "train_tokens_per_second": 1070.545 }, { "epoch": 0.10269390706924607, "grad_norm": 0.2518240511417389, "learning_rate": 0.0001150584307178631, "loss": 0.9118, "num_input_tokens_seen": 3553470, "step": 1278, "train_runtime": 3319.1756, "train_tokens_per_second": 1070.588 }, { "epoch": 0.1027742622390968, "grad_norm": 0.39815038442611694, "learning_rate": 0.00011499165275459098, "loss": 1.1411, "num_input_tokens_seen": 3555536, "step": 1279, "train_runtime": 3321.0262, "train_tokens_per_second": 1070.614 }, { "epoch": 0.10285461740894755, "grad_norm": 0.3301222026348114, "learning_rate": 0.00011492487479131886, "loss": 0.986, "num_input_tokens_seen": 3557820, "step": 1280, "train_runtime": 3322.9737, "train_tokens_per_second": 1070.674 }, { "epoch": 0.10293497257879829, "grad_norm": 0.28770166635513306, "learning_rate": 0.00011485809682804675, "loss": 0.9974, "num_input_tokens_seen": 3560260, "step": 1281, "train_runtime": 3325.0176, "train_tokens_per_second": 1070.749 }, { "epoch": 0.10301532774864904, "grad_norm": 0.2879880964756012, "learning_rate": 0.00011479131886477464, "loss": 0.562, "num_input_tokens_seen": 3562704, "step": 1282, "train_runtime": 3327.0281, "train_tokens_per_second": 1070.837 }, { "epoch": 0.10309568291849977, "grad_norm": 0.3472915291786194, "learning_rate": 0.00011472454090150251, "loss": 1.2714, "num_input_tokens_seen": 3564448, "step": 1283, "train_runtime": 3328.7455, "train_tokens_per_second": 1070.808 }, { "epoch": 0.1031760380883505, "grad_norm": 0.3218541741371155, "learning_rate": 0.00011465776293823038, "loss": 0.7804, "num_input_tokens_seen": 3566114, "step": 1284, "train_runtime": 3330.3697, "train_tokens_per_second": 1070.786 }, { "epoch": 0.10325639325820125, "grad_norm": 0.26079198718070984, "learning_rate": 0.00011459098497495826, "loss": 0.7276, "num_input_tokens_seen": 3569880, "step": 1285, "train_runtime": 3333.0734, "train_tokens_per_second": 1071.048 }, { "epoch": 0.10333674842805199, "grad_norm": 0.32714328169822693, "learning_rate": 0.00011452420701168616, "loss": 1.0029, "num_input_tokens_seen": 3572704, "step": 1286, "train_runtime": 3335.2715, "train_tokens_per_second": 1071.188 }, { "epoch": 0.10341710359790272, "grad_norm": 0.30337613821029663, "learning_rate": 0.00011445742904841403, "loss": 0.817, "num_input_tokens_seen": 3574476, "step": 1287, "train_runtime": 3336.9605, "train_tokens_per_second": 1071.177 }, { "epoch": 0.10349745876775347, "grad_norm": 0.28457576036453247, "learning_rate": 0.0001143906510851419, "loss": 0.9901, "num_input_tokens_seen": 3577610, "step": 1288, "train_runtime": 3339.2978, "train_tokens_per_second": 1071.366 }, { "epoch": 0.10357781393760421, "grad_norm": 0.3802544176578522, "learning_rate": 0.00011432387312186979, "loss": 1.233, "num_input_tokens_seen": 3579984, "step": 1289, "train_runtime": 3341.3605, "train_tokens_per_second": 1071.415 }, { "epoch": 0.10365816910745496, "grad_norm": 0.4489324688911438, "learning_rate": 0.00011425709515859766, "loss": 1.1114, "num_input_tokens_seen": 3582412, "step": 1290, "train_runtime": 3343.2872, "train_tokens_per_second": 1071.524 }, { "epoch": 0.10373852427730569, "grad_norm": 0.2681956887245178, "learning_rate": 0.00011419031719532556, "loss": 0.6312, "num_input_tokens_seen": 3584672, "step": 1291, "train_runtime": 3347.2626, "train_tokens_per_second": 1070.926 }, { "epoch": 0.10381887944715643, "grad_norm": 0.3160945177078247, "learning_rate": 0.00011412353923205344, "loss": 0.8936, "num_input_tokens_seen": 3587328, "step": 1292, "train_runtime": 3349.3113, "train_tokens_per_second": 1071.064 }, { "epoch": 0.10389923461700717, "grad_norm": 0.3134382963180542, "learning_rate": 0.00011405676126878131, "loss": 1.1508, "num_input_tokens_seen": 3592166, "step": 1293, "train_runtime": 3352.6762, "train_tokens_per_second": 1071.432 }, { "epoch": 0.10397958978685791, "grad_norm": 0.32309138774871826, "learning_rate": 0.00011398998330550918, "loss": 1.1359, "num_input_tokens_seen": 3593964, "step": 1294, "train_runtime": 3354.4147, "train_tokens_per_second": 1071.413 }, { "epoch": 0.10405994495670866, "grad_norm": 0.32670146226882935, "learning_rate": 0.00011392320534223706, "loss": 1.0211, "num_input_tokens_seen": 3595924, "step": 1295, "train_runtime": 3356.2253, "train_tokens_per_second": 1071.419 }, { "epoch": 0.10414030012655939, "grad_norm": 0.2928754389286041, "learning_rate": 0.00011385642737896493, "loss": 1.0102, "num_input_tokens_seen": 3598434, "step": 1296, "train_runtime": 3358.2748, "train_tokens_per_second": 1071.513 }, { "epoch": 0.10422065529641013, "grad_norm": 0.39643630385398865, "learning_rate": 0.00011378964941569283, "loss": 0.968, "num_input_tokens_seen": 3601478, "step": 1297, "train_runtime": 3360.6429, "train_tokens_per_second": 1071.663 }, { "epoch": 0.10430101046626088, "grad_norm": 0.5213744044303894, "learning_rate": 0.0001137228714524207, "loss": 1.014, "num_input_tokens_seen": 3603918, "step": 1298, "train_runtime": 3362.7224, "train_tokens_per_second": 1071.726 }, { "epoch": 0.10438136563611161, "grad_norm": 0.23302114009857178, "learning_rate": 0.00011365609348914859, "loss": 0.8334, "num_input_tokens_seen": 3607438, "step": 1299, "train_runtime": 3365.3521, "train_tokens_per_second": 1071.935 }, { "epoch": 0.10446172080596236, "grad_norm": 0.39406678080558777, "learning_rate": 0.00011358931552587646, "loss": 1.1717, "num_input_tokens_seen": 3609654, "step": 1300, "train_runtime": 3367.2601, "train_tokens_per_second": 1071.986 }, { "epoch": 0.1045420759758131, "grad_norm": 0.2761419117450714, "learning_rate": 0.00011352253756260434, "loss": 1.004, "num_input_tokens_seen": 3613216, "step": 1301, "train_runtime": 3369.8443, "train_tokens_per_second": 1072.22 }, { "epoch": 0.10462243114566383, "grad_norm": 0.3041739761829376, "learning_rate": 0.00011345575959933224, "loss": 0.8539, "num_input_tokens_seen": 3615684, "step": 1302, "train_runtime": 3371.9426, "train_tokens_per_second": 1072.285 }, { "epoch": 0.10470278631551458, "grad_norm": 0.24297115206718445, "learning_rate": 0.00011338898163606011, "loss": 0.9024, "num_input_tokens_seen": 3618762, "step": 1303, "train_runtime": 3374.1865, "train_tokens_per_second": 1072.484 }, { "epoch": 0.10478314148536531, "grad_norm": 0.30591264367103577, "learning_rate": 0.00011332220367278798, "loss": 1.3905, "num_input_tokens_seen": 3620824, "step": 1304, "train_runtime": 3375.9352, "train_tokens_per_second": 1072.54 }, { "epoch": 0.10486349665521605, "grad_norm": 0.306010365486145, "learning_rate": 0.00011325542570951586, "loss": 0.8382, "num_input_tokens_seen": 3623304, "step": 1305, "train_runtime": 3378.0611, "train_tokens_per_second": 1072.599 }, { "epoch": 0.1049438518250668, "grad_norm": 0.3153892755508423, "learning_rate": 0.00011318864774624374, "loss": 1.1346, "num_input_tokens_seen": 3624926, "step": 1306, "train_runtime": 3379.6914, "train_tokens_per_second": 1072.561 }, { "epoch": 0.10502420699491753, "grad_norm": 0.35114431381225586, "learning_rate": 0.00011312186978297163, "loss": 1.0101, "num_input_tokens_seen": 3627426, "step": 1307, "train_runtime": 3381.8135, "train_tokens_per_second": 1072.627 }, { "epoch": 0.10510456216476828, "grad_norm": 0.3883284628391266, "learning_rate": 0.00011305509181969952, "loss": 1.0112, "num_input_tokens_seen": 3629386, "step": 1308, "train_runtime": 3383.6357, "train_tokens_per_second": 1072.629 }, { "epoch": 0.10518491733461902, "grad_norm": 0.41548824310302734, "learning_rate": 0.00011298831385642739, "loss": 0.9458, "num_input_tokens_seen": 3631680, "step": 1309, "train_runtime": 3385.5591, "train_tokens_per_second": 1072.697 }, { "epoch": 0.10526527250446975, "grad_norm": 0.31654754281044006, "learning_rate": 0.00011292153589315526, "loss": 0.986, "num_input_tokens_seen": 3633942, "step": 1310, "train_runtime": 3387.4288, "train_tokens_per_second": 1072.773 }, { "epoch": 0.1053456276743205, "grad_norm": 0.2752566933631897, "learning_rate": 0.00011285475792988314, "loss": 0.7523, "num_input_tokens_seen": 3635718, "step": 1311, "train_runtime": 3389.1385, "train_tokens_per_second": 1072.756 }, { "epoch": 0.10542598284417123, "grad_norm": 0.32447850704193115, "learning_rate": 0.00011278797996661104, "loss": 1.0836, "num_input_tokens_seen": 3637488, "step": 1312, "train_runtime": 3390.8198, "train_tokens_per_second": 1072.746 }, { "epoch": 0.10550633801402198, "grad_norm": 0.22222858667373657, "learning_rate": 0.00011272120200333891, "loss": 0.5156, "num_input_tokens_seen": 3639824, "step": 1313, "train_runtime": 3392.6896, "train_tokens_per_second": 1072.843 }, { "epoch": 0.10558669318387272, "grad_norm": 0.27509626746177673, "learning_rate": 0.00011265442404006678, "loss": 1.0833, "num_input_tokens_seen": 3642780, "step": 1314, "train_runtime": 3395.0259, "train_tokens_per_second": 1072.976 }, { "epoch": 0.10566704835372345, "grad_norm": 0.3218839764595032, "learning_rate": 0.00011258764607679465, "loss": 1.1377, "num_input_tokens_seen": 3645864, "step": 1315, "train_runtime": 3397.3436, "train_tokens_per_second": 1073.151 }, { "epoch": 0.1057474035235742, "grad_norm": 0.3075161576271057, "learning_rate": 0.00011252086811352254, "loss": 1.0003, "num_input_tokens_seen": 3647748, "step": 1316, "train_runtime": 3399.1268, "train_tokens_per_second": 1073.143 }, { "epoch": 0.10582775869342494, "grad_norm": 0.33633488416671753, "learning_rate": 0.00011245409015025041, "loss": 0.9582, "num_input_tokens_seen": 3649650, "step": 1317, "train_runtime": 3400.9247, "train_tokens_per_second": 1073.135 }, { "epoch": 0.10590811386327569, "grad_norm": 0.28925010561943054, "learning_rate": 0.00011238731218697832, "loss": 0.7256, "num_input_tokens_seen": 3651120, "step": 1318, "train_runtime": 3402.5544, "train_tokens_per_second": 1073.053 }, { "epoch": 0.10598846903312642, "grad_norm": 0.24827858805656433, "learning_rate": 0.00011232053422370619, "loss": 0.599, "num_input_tokens_seen": 3652890, "step": 1319, "train_runtime": 3404.2269, "train_tokens_per_second": 1073.045 }, { "epoch": 0.10606882420297715, "grad_norm": 0.384735643863678, "learning_rate": 0.00011225375626043406, "loss": 0.9334, "num_input_tokens_seen": 3654918, "step": 1320, "train_runtime": 3406.0906, "train_tokens_per_second": 1073.054 }, { "epoch": 0.1061491793728279, "grad_norm": 0.28056448698043823, "learning_rate": 0.00011218697829716193, "loss": 1.1756, "num_input_tokens_seen": 3657194, "step": 1321, "train_runtime": 3410.0353, "train_tokens_per_second": 1072.48 }, { "epoch": 0.10622953454267864, "grad_norm": 0.33696311712265015, "learning_rate": 0.00011212020033388981, "loss": 0.977, "num_input_tokens_seen": 3658668, "step": 1322, "train_runtime": 3411.6571, "train_tokens_per_second": 1072.402 }, { "epoch": 0.10630988971252937, "grad_norm": 0.34870147705078125, "learning_rate": 0.00011205342237061771, "loss": 1.141, "num_input_tokens_seen": 3660450, "step": 1323, "train_runtime": 3413.4146, "train_tokens_per_second": 1072.372 }, { "epoch": 0.10639024488238012, "grad_norm": 0.27133920788764954, "learning_rate": 0.00011198664440734558, "loss": 0.8748, "num_input_tokens_seen": 3662052, "step": 1324, "train_runtime": 3415.0366, "train_tokens_per_second": 1072.332 }, { "epoch": 0.10647060005223086, "grad_norm": 0.41314199566841125, "learning_rate": 0.00011191986644407347, "loss": 1.1214, "num_input_tokens_seen": 3664276, "step": 1325, "train_runtime": 3416.9565, "train_tokens_per_second": 1072.38 }, { "epoch": 0.1065509552220816, "grad_norm": 0.3371661305427551, "learning_rate": 0.00011185308848080134, "loss": 1.1208, "num_input_tokens_seen": 3667412, "step": 1326, "train_runtime": 3419.4142, "train_tokens_per_second": 1072.526 }, { "epoch": 0.10663131039193234, "grad_norm": 0.3550303876399994, "learning_rate": 0.00011178631051752921, "loss": 0.9646, "num_input_tokens_seen": 3668990, "step": 1327, "train_runtime": 3421.0603, "train_tokens_per_second": 1072.472 }, { "epoch": 0.10671166556178308, "grad_norm": 0.31260353326797485, "learning_rate": 0.00011171953255425711, "loss": 1.01, "num_input_tokens_seen": 3670524, "step": 1328, "train_runtime": 3422.6944, "train_tokens_per_second": 1072.408 }, { "epoch": 0.10679202073163382, "grad_norm": 0.2847209870815277, "learning_rate": 0.00011165275459098499, "loss": 1.0297, "num_input_tokens_seen": 3672938, "step": 1329, "train_runtime": 3424.769, "train_tokens_per_second": 1072.463 }, { "epoch": 0.10687237590148456, "grad_norm": 0.3199746012687683, "learning_rate": 0.00011158597662771286, "loss": 1.0204, "num_input_tokens_seen": 3675080, "step": 1330, "train_runtime": 3426.7408, "train_tokens_per_second": 1072.471 }, { "epoch": 0.10695273107133531, "grad_norm": 0.3620395064353943, "learning_rate": 0.00011151919866444073, "loss": 0.7482, "num_input_tokens_seen": 3676924, "step": 1331, "train_runtime": 3428.4531, "train_tokens_per_second": 1072.473 }, { "epoch": 0.10703308624118604, "grad_norm": 0.453721284866333, "learning_rate": 0.00011145242070116862, "loss": 1.1147, "num_input_tokens_seen": 3679230, "step": 1332, "train_runtime": 3430.5278, "train_tokens_per_second": 1072.497 }, { "epoch": 0.10711344141103678, "grad_norm": 0.278247594833374, "learning_rate": 0.0001113856427378965, "loss": 0.7915, "num_input_tokens_seen": 3682504, "step": 1333, "train_runtime": 3433.3317, "train_tokens_per_second": 1072.575 }, { "epoch": 0.10719379658088753, "grad_norm": 0.2761545181274414, "learning_rate": 0.0001113188647746244, "loss": 0.7856, "num_input_tokens_seen": 3684416, "step": 1334, "train_runtime": 3435.074, "train_tokens_per_second": 1072.587 }, { "epoch": 0.10727415175073826, "grad_norm": 0.2801143229007721, "learning_rate": 0.00011125208681135227, "loss": 1.1772, "num_input_tokens_seen": 3687104, "step": 1335, "train_runtime": 3437.1997, "train_tokens_per_second": 1072.706 }, { "epoch": 0.10735450692058901, "grad_norm": 0.393561452627182, "learning_rate": 0.00011118530884808014, "loss": 1.2837, "num_input_tokens_seen": 3689000, "step": 1336, "train_runtime": 3438.9737, "train_tokens_per_second": 1072.704 }, { "epoch": 0.10743486209043974, "grad_norm": 0.34230685234069824, "learning_rate": 0.00011111853088480801, "loss": 1.2398, "num_input_tokens_seen": 3692920, "step": 1337, "train_runtime": 3441.8685, "train_tokens_per_second": 1072.94 }, { "epoch": 0.10751521726029048, "grad_norm": 0.20867261290550232, "learning_rate": 0.00011105175292153589, "loss": 0.6112, "num_input_tokens_seen": 3695068, "step": 1338, "train_runtime": 3443.8284, "train_tokens_per_second": 1072.954 }, { "epoch": 0.10759557243014123, "grad_norm": 0.3125673234462738, "learning_rate": 0.00011098497495826379, "loss": 0.9997, "num_input_tokens_seen": 3697470, "step": 1339, "train_runtime": 3445.8147, "train_tokens_per_second": 1073.032 }, { "epoch": 0.10767592759999196, "grad_norm": 0.29269737005233765, "learning_rate": 0.00011091819699499166, "loss": 1.2169, "num_input_tokens_seen": 3699864, "step": 1340, "train_runtime": 3447.7964, "train_tokens_per_second": 1073.11 }, { "epoch": 0.1077562827698427, "grad_norm": 0.37325942516326904, "learning_rate": 0.00011085141903171953, "loss": 1.3217, "num_input_tokens_seen": 3703614, "step": 1341, "train_runtime": 3450.5096, "train_tokens_per_second": 1073.353 }, { "epoch": 0.10783663793969345, "grad_norm": 0.29524070024490356, "learning_rate": 0.00011078464106844742, "loss": 0.8587, "num_input_tokens_seen": 3705338, "step": 1342, "train_runtime": 3452.2589, "train_tokens_per_second": 1073.308 }, { "epoch": 0.10791699310954418, "grad_norm": 0.40680551528930664, "learning_rate": 0.00011071786310517529, "loss": 1.1864, "num_input_tokens_seen": 3708598, "step": 1343, "train_runtime": 3454.7802, "train_tokens_per_second": 1073.469 }, { "epoch": 0.10799734827939493, "grad_norm": 0.3449890911579132, "learning_rate": 0.0001106510851419032, "loss": 1.0204, "num_input_tokens_seen": 3712782, "step": 1344, "train_runtime": 3457.7119, "train_tokens_per_second": 1073.768 }, { "epoch": 0.10807770344924567, "grad_norm": 0.26540616154670715, "learning_rate": 0.00011058430717863107, "loss": 0.8519, "num_input_tokens_seen": 3715000, "step": 1345, "train_runtime": 3459.6408, "train_tokens_per_second": 1073.811 }, { "epoch": 0.1081580586190964, "grad_norm": 0.3037562966346741, "learning_rate": 0.00011051752921535894, "loss": 1.0007, "num_input_tokens_seen": 3718230, "step": 1346, "train_runtime": 3462.0935, "train_tokens_per_second": 1073.983 }, { "epoch": 0.10823841378894715, "grad_norm": 0.33242589235305786, "learning_rate": 0.00011045075125208681, "loss": 1.0404, "num_input_tokens_seen": 3720778, "step": 1347, "train_runtime": 3464.1848, "train_tokens_per_second": 1074.07 }, { "epoch": 0.10831876895879788, "grad_norm": 0.32828032970428467, "learning_rate": 0.00011038397328881469, "loss": 1.1201, "num_input_tokens_seen": 3722980, "step": 1348, "train_runtime": 3466.0775, "train_tokens_per_second": 1074.119 }, { "epoch": 0.10839912412864863, "grad_norm": 0.3383139967918396, "learning_rate": 0.00011031719532554257, "loss": 1.1004, "num_input_tokens_seen": 3726764, "step": 1349, "train_runtime": 3468.925, "train_tokens_per_second": 1074.328 }, { "epoch": 0.10847947929849937, "grad_norm": 0.26566532254219055, "learning_rate": 0.00011025041736227046, "loss": 0.9865, "num_input_tokens_seen": 3731318, "step": 1350, "train_runtime": 3472.0228, "train_tokens_per_second": 1074.681 }, { "epoch": 0.1085598344683501, "grad_norm": 0.27251118421554565, "learning_rate": 0.00011018363939899835, "loss": 0.9114, "num_input_tokens_seen": 3734166, "step": 1351, "train_runtime": 3476.1917, "train_tokens_per_second": 1074.212 }, { "epoch": 0.10864018963820085, "grad_norm": 0.3204699456691742, "learning_rate": 0.00011011686143572622, "loss": 1.0144, "num_input_tokens_seen": 3736466, "step": 1352, "train_runtime": 3478.162, "train_tokens_per_second": 1074.264 }, { "epoch": 0.10872054480805159, "grad_norm": 0.37815171480178833, "learning_rate": 0.00011005008347245409, "loss": 1.2469, "num_input_tokens_seen": 3738370, "step": 1353, "train_runtime": 3479.8996, "train_tokens_per_second": 1074.275 }, { "epoch": 0.10880089997790234, "grad_norm": 0.3219520151615143, "learning_rate": 0.00010998330550918197, "loss": 1.2015, "num_input_tokens_seen": 3741902, "step": 1354, "train_runtime": 3482.5231, "train_tokens_per_second": 1074.48 }, { "epoch": 0.10888125514775307, "grad_norm": 0.27995145320892334, "learning_rate": 0.00010991652754590987, "loss": 1.1808, "num_input_tokens_seen": 3745614, "step": 1355, "train_runtime": 3485.2325, "train_tokens_per_second": 1074.71 }, { "epoch": 0.1089616103176038, "grad_norm": 0.3314412236213684, "learning_rate": 0.00010984974958263774, "loss": 0.995, "num_input_tokens_seen": 3749444, "step": 1356, "train_runtime": 3487.9662, "train_tokens_per_second": 1074.966 }, { "epoch": 0.10904196548745455, "grad_norm": 0.39481425285339355, "learning_rate": 0.00010978297161936561, "loss": 1.0378, "num_input_tokens_seen": 3750840, "step": 1357, "train_runtime": 3489.5382, "train_tokens_per_second": 1074.881 }, { "epoch": 0.10912232065730529, "grad_norm": 0.3497794270515442, "learning_rate": 0.00010971619365609349, "loss": 1.1416, "num_input_tokens_seen": 3752454, "step": 1358, "train_runtime": 3491.1985, "train_tokens_per_second": 1074.833 }, { "epoch": 0.10920267582715602, "grad_norm": 0.3231332004070282, "learning_rate": 0.00010964941569282137, "loss": 0.8696, "num_input_tokens_seen": 3753972, "step": 1359, "train_runtime": 3492.8057, "train_tokens_per_second": 1074.773 }, { "epoch": 0.10928303099700677, "grad_norm": 0.250036358833313, "learning_rate": 0.00010958263772954926, "loss": 1.001, "num_input_tokens_seen": 3756846, "step": 1360, "train_runtime": 3495.0693, "train_tokens_per_second": 1074.899 }, { "epoch": 0.1093633861668575, "grad_norm": 0.29247865080833435, "learning_rate": 0.00010951585976627715, "loss": 0.9141, "num_input_tokens_seen": 3759354, "step": 1361, "train_runtime": 3497.0523, "train_tokens_per_second": 1075.007 }, { "epoch": 0.10944374133670826, "grad_norm": 0.2691769003868103, "learning_rate": 0.00010944908180300502, "loss": 0.996, "num_input_tokens_seen": 3762132, "step": 1362, "train_runtime": 3499.2741, "train_tokens_per_second": 1075.118 }, { "epoch": 0.10952409650655899, "grad_norm": 0.42689990997314453, "learning_rate": 0.00010938230383973289, "loss": 0.9984, "num_input_tokens_seen": 3765012, "step": 1363, "train_runtime": 3501.5444, "train_tokens_per_second": 1075.243 }, { "epoch": 0.10960445167640973, "grad_norm": 0.28335949778556824, "learning_rate": 0.00010931552587646076, "loss": 0.7242, "num_input_tokens_seen": 3766120, "step": 1364, "train_runtime": 3503.0292, "train_tokens_per_second": 1075.104 }, { "epoch": 0.10968480684626047, "grad_norm": 0.29798826575279236, "learning_rate": 0.00010924874791318864, "loss": 0.774, "num_input_tokens_seen": 3768304, "step": 1365, "train_runtime": 3504.8183, "train_tokens_per_second": 1075.178 }, { "epoch": 0.10976516201611121, "grad_norm": 0.2864566445350647, "learning_rate": 0.00010918196994991654, "loss": 0.8877, "num_input_tokens_seen": 3772924, "step": 1366, "train_runtime": 3508.0897, "train_tokens_per_second": 1075.492 }, { "epoch": 0.10984551718596196, "grad_norm": 0.3073413372039795, "learning_rate": 0.00010911519198664441, "loss": 1.0691, "num_input_tokens_seen": 3775548, "step": 1367, "train_runtime": 3510.2155, "train_tokens_per_second": 1075.589 }, { "epoch": 0.10992587235581269, "grad_norm": 0.29954490065574646, "learning_rate": 0.0001090484140233723, "loss": 1.0633, "num_input_tokens_seen": 3777364, "step": 1368, "train_runtime": 3511.9896, "train_tokens_per_second": 1075.562 }, { "epoch": 0.11000622752566343, "grad_norm": 0.28042760491371155, "learning_rate": 0.00010898163606010017, "loss": 1.0094, "num_input_tokens_seen": 3779544, "step": 1369, "train_runtime": 3513.9366, "train_tokens_per_second": 1075.587 }, { "epoch": 0.11008658269551418, "grad_norm": 0.3415967524051666, "learning_rate": 0.00010891485809682804, "loss": 1.0676, "num_input_tokens_seen": 3782884, "step": 1370, "train_runtime": 3516.366, "train_tokens_per_second": 1075.794 }, { "epoch": 0.11016693786536491, "grad_norm": 0.2940909266471863, "learning_rate": 0.00010884808013355594, "loss": 1.3355, "num_input_tokens_seen": 3785772, "step": 1371, "train_runtime": 3518.5452, "train_tokens_per_second": 1075.948 }, { "epoch": 0.11024729303521566, "grad_norm": 0.29695481061935425, "learning_rate": 0.00010878130217028382, "loss": 0.8361, "num_input_tokens_seen": 3787272, "step": 1372, "train_runtime": 3520.1921, "train_tokens_per_second": 1075.871 }, { "epoch": 0.1103276482050664, "grad_norm": 0.3094223141670227, "learning_rate": 0.00010871452420701169, "loss": 1.0499, "num_input_tokens_seen": 3790462, "step": 1373, "train_runtime": 3522.6757, "train_tokens_per_second": 1076.018 }, { "epoch": 0.11040800337491713, "grad_norm": 0.2748089134693146, "learning_rate": 0.00010864774624373956, "loss": 0.7391, "num_input_tokens_seen": 3792374, "step": 1374, "train_runtime": 3524.4285, "train_tokens_per_second": 1076.025 }, { "epoch": 0.11048835854476788, "grad_norm": 0.4110908806324005, "learning_rate": 0.00010858096828046744, "loss": 1.0267, "num_input_tokens_seen": 3793806, "step": 1375, "train_runtime": 3525.9834, "train_tokens_per_second": 1075.957 }, { "epoch": 0.11056871371461861, "grad_norm": 0.4627639055252075, "learning_rate": 0.00010851419031719534, "loss": 0.9407, "num_input_tokens_seen": 3797124, "step": 1376, "train_runtime": 3528.5315, "train_tokens_per_second": 1076.12 }, { "epoch": 0.11064906888446935, "grad_norm": 0.3095523416996002, "learning_rate": 0.00010844741235392321, "loss": 1.2738, "num_input_tokens_seen": 3799874, "step": 1377, "train_runtime": 3530.5832, "train_tokens_per_second": 1076.274 }, { "epoch": 0.1107294240543201, "grad_norm": 0.2851976454257965, "learning_rate": 0.0001083806343906511, "loss": 0.9193, "num_input_tokens_seen": 3803560, "step": 1378, "train_runtime": 3533.2815, "train_tokens_per_second": 1076.495 }, { "epoch": 0.11080977922417083, "grad_norm": 0.33301135897636414, "learning_rate": 0.00010831385642737897, "loss": 0.859, "num_input_tokens_seen": 3809396, "step": 1379, "train_runtime": 3537.2705, "train_tokens_per_second": 1076.931 }, { "epoch": 0.11089013439402158, "grad_norm": 0.33650487661361694, "learning_rate": 0.00010824707846410684, "loss": 1.0981, "num_input_tokens_seen": 3811146, "step": 1380, "train_runtime": 3539.0327, "train_tokens_per_second": 1076.889 }, { "epoch": 0.11097048956387232, "grad_norm": 0.35976412892341614, "learning_rate": 0.00010818030050083472, "loss": 0.8029, "num_input_tokens_seen": 3812980, "step": 1381, "train_runtime": 3542.4727, "train_tokens_per_second": 1076.361 }, { "epoch": 0.11105084473372305, "grad_norm": 0.31813323497772217, "learning_rate": 0.00010811352253756262, "loss": 0.7812, "num_input_tokens_seen": 3815602, "step": 1382, "train_runtime": 3544.5753, "train_tokens_per_second": 1076.462 }, { "epoch": 0.1111311999035738, "grad_norm": 0.34927958250045776, "learning_rate": 0.00010804674457429049, "loss": 0.8661, "num_input_tokens_seen": 3817980, "step": 1383, "train_runtime": 3546.5334, "train_tokens_per_second": 1076.539 }, { "epoch": 0.11121155507342453, "grad_norm": 0.23879820108413696, "learning_rate": 0.00010797996661101836, "loss": 0.8932, "num_input_tokens_seen": 3821382, "step": 1384, "train_runtime": 3549.0931, "train_tokens_per_second": 1076.721 }, { "epoch": 0.11129191024327528, "grad_norm": 0.3335447311401367, "learning_rate": 0.00010791318864774625, "loss": 1.2005, "num_input_tokens_seen": 3824918, "step": 1385, "train_runtime": 3551.658, "train_tokens_per_second": 1076.939 }, { "epoch": 0.11137226541312602, "grad_norm": 0.2883974015712738, "learning_rate": 0.00010784641068447412, "loss": 1.1426, "num_input_tokens_seen": 3827574, "step": 1386, "train_runtime": 3553.7373, "train_tokens_per_second": 1077.056 }, { "epoch": 0.11145262058297675, "grad_norm": 0.2518156170845032, "learning_rate": 0.00010777963272120202, "loss": 0.7465, "num_input_tokens_seen": 3829382, "step": 1387, "train_runtime": 3555.4441, "train_tokens_per_second": 1077.047 }, { "epoch": 0.1115329757528275, "grad_norm": 0.3041207194328308, "learning_rate": 0.0001077128547579299, "loss": 1.0229, "num_input_tokens_seen": 3833380, "step": 1388, "train_runtime": 3558.254, "train_tokens_per_second": 1077.321 }, { "epoch": 0.11161333092267824, "grad_norm": 0.217087060213089, "learning_rate": 0.00010764607679465777, "loss": 0.5558, "num_input_tokens_seen": 3836120, "step": 1389, "train_runtime": 3560.364, "train_tokens_per_second": 1077.452 }, { "epoch": 0.11169368609252898, "grad_norm": 0.2774825096130371, "learning_rate": 0.00010757929883138564, "loss": 1.1133, "num_input_tokens_seen": 3839662, "step": 1390, "train_runtime": 3562.8997, "train_tokens_per_second": 1077.679 }, { "epoch": 0.11177404126237972, "grad_norm": 0.3661069869995117, "learning_rate": 0.00010751252086811352, "loss": 1.2426, "num_input_tokens_seen": 3842038, "step": 1391, "train_runtime": 3564.8522, "train_tokens_per_second": 1077.755 }, { "epoch": 0.11185439643223045, "grad_norm": 0.29887625575065613, "learning_rate": 0.00010744574290484142, "loss": 0.8912, "num_input_tokens_seen": 3846600, "step": 1392, "train_runtime": 3568.1821, "train_tokens_per_second": 1078.028 }, { "epoch": 0.1119347516020812, "grad_norm": 0.2846955955028534, "learning_rate": 0.00010737896494156929, "loss": 0.9515, "num_input_tokens_seen": 3849338, "step": 1393, "train_runtime": 3570.3948, "train_tokens_per_second": 1078.127 }, { "epoch": 0.11201510677193194, "grad_norm": 0.30389881134033203, "learning_rate": 0.00010731218697829716, "loss": 0.9121, "num_input_tokens_seen": 3851292, "step": 1394, "train_runtime": 3572.2378, "train_tokens_per_second": 1078.117 }, { "epoch": 0.11209546194178267, "grad_norm": 0.2863844633102417, "learning_rate": 0.00010724540901502505, "loss": 1.0296, "num_input_tokens_seen": 3854908, "step": 1395, "train_runtime": 3574.8935, "train_tokens_per_second": 1078.328 }, { "epoch": 0.11217581711163342, "grad_norm": 0.314884215593338, "learning_rate": 0.00010717863105175292, "loss": 0.836, "num_input_tokens_seen": 3858098, "step": 1396, "train_runtime": 3577.2419, "train_tokens_per_second": 1078.512 }, { "epoch": 0.11225617228148416, "grad_norm": 0.28291910886764526, "learning_rate": 0.0001071118530884808, "loss": 1.1745, "num_input_tokens_seen": 3860180, "step": 1397, "train_runtime": 3579.0546, "train_tokens_per_second": 1078.547 }, { "epoch": 0.1123365274513349, "grad_norm": 0.29328039288520813, "learning_rate": 0.0001070450751252087, "loss": 1.0608, "num_input_tokens_seen": 3862534, "step": 1398, "train_runtime": 3580.9789, "train_tokens_per_second": 1078.625 }, { "epoch": 0.11241688262118564, "grad_norm": 0.3768022358417511, "learning_rate": 0.00010697829716193657, "loss": 0.9091, "num_input_tokens_seen": 3864172, "step": 1399, "train_runtime": 3582.6296, "train_tokens_per_second": 1078.585 }, { "epoch": 0.11249723779103638, "grad_norm": 0.33518317341804504, "learning_rate": 0.00010691151919866444, "loss": 0.906, "num_input_tokens_seen": 3866808, "step": 1400, "train_runtime": 3584.7371, "train_tokens_per_second": 1078.687 }, { "epoch": 0.11257759296088712, "grad_norm": 0.2500336766242981, "learning_rate": 0.00010684474123539232, "loss": 0.7949, "num_input_tokens_seen": 3869754, "step": 1401, "train_runtime": 3587.0515, "train_tokens_per_second": 1078.812 }, { "epoch": 0.11265794813073786, "grad_norm": 0.3795786201953888, "learning_rate": 0.0001067779632721202, "loss": 1.1297, "num_input_tokens_seen": 3871500, "step": 1402, "train_runtime": 3588.6919, "train_tokens_per_second": 1078.805 }, { "epoch": 0.11273830330058861, "grad_norm": 0.2931092381477356, "learning_rate": 0.00010671118530884809, "loss": 1.1258, "num_input_tokens_seen": 3874924, "step": 1403, "train_runtime": 3591.2505, "train_tokens_per_second": 1078.99 }, { "epoch": 0.11281865847043934, "grad_norm": 0.29299911856651306, "learning_rate": 0.00010664440734557598, "loss": 0.8513, "num_input_tokens_seen": 3876736, "step": 1404, "train_runtime": 3592.8513, "train_tokens_per_second": 1079.014 }, { "epoch": 0.11289901364029008, "grad_norm": 0.3434504568576813, "learning_rate": 0.00010657762938230385, "loss": 1.0769, "num_input_tokens_seen": 3879800, "step": 1405, "train_runtime": 3595.2112, "train_tokens_per_second": 1079.158 }, { "epoch": 0.11297936881014083, "grad_norm": 0.307935893535614, "learning_rate": 0.00010651085141903172, "loss": 1.0917, "num_input_tokens_seen": 3883250, "step": 1406, "train_runtime": 3597.689, "train_tokens_per_second": 1079.373 }, { "epoch": 0.11305972397999156, "grad_norm": 0.24430879950523376, "learning_rate": 0.0001064440734557596, "loss": 0.7913, "num_input_tokens_seen": 3885800, "step": 1407, "train_runtime": 3599.8448, "train_tokens_per_second": 1079.435 }, { "epoch": 0.11314007914984231, "grad_norm": 0.28974589705467224, "learning_rate": 0.0001063772954924875, "loss": 1.0021, "num_input_tokens_seen": 3887698, "step": 1408, "train_runtime": 3601.5295, "train_tokens_per_second": 1079.457 }, { "epoch": 0.11322043431969304, "grad_norm": 0.31558918952941895, "learning_rate": 0.00010631051752921537, "loss": 0.9754, "num_input_tokens_seen": 3891894, "step": 1409, "train_runtime": 3604.5385, "train_tokens_per_second": 1079.72 }, { "epoch": 0.11330078948954378, "grad_norm": 0.32462847232818604, "learning_rate": 0.00010624373956594324, "loss": 0.9992, "num_input_tokens_seen": 3894568, "step": 1410, "train_runtime": 3606.7005, "train_tokens_per_second": 1079.815 }, { "epoch": 0.11338114465939453, "grad_norm": 0.34621408581733704, "learning_rate": 0.00010617696160267111, "loss": 1.2976, "num_input_tokens_seen": 3896366, "step": 1411, "train_runtime": 3610.4554, "train_tokens_per_second": 1079.19 }, { "epoch": 0.11346149982924526, "grad_norm": 0.2981546223163605, "learning_rate": 0.000106110183639399, "loss": 0.8862, "num_input_tokens_seen": 3900532, "step": 1412, "train_runtime": 3613.396, "train_tokens_per_second": 1079.464 }, { "epoch": 0.113541854999096, "grad_norm": 0.40481603145599365, "learning_rate": 0.00010604340567612687, "loss": 1.1212, "num_input_tokens_seen": 3903224, "step": 1413, "train_runtime": 3615.5408, "train_tokens_per_second": 1079.569 }, { "epoch": 0.11362221016894675, "grad_norm": 0.35557135939598083, "learning_rate": 0.00010597662771285477, "loss": 1.0561, "num_input_tokens_seen": 3905938, "step": 1414, "train_runtime": 3617.8326, "train_tokens_per_second": 1079.635 }, { "epoch": 0.11370256533879748, "grad_norm": 0.302202969789505, "learning_rate": 0.00010590984974958265, "loss": 0.9211, "num_input_tokens_seen": 3908128, "step": 1415, "train_runtime": 3619.6637, "train_tokens_per_second": 1079.694 }, { "epoch": 0.11378292050864823, "grad_norm": 0.2821248769760132, "learning_rate": 0.00010584307178631052, "loss": 0.7784, "num_input_tokens_seen": 3910714, "step": 1416, "train_runtime": 3621.802, "train_tokens_per_second": 1079.77 }, { "epoch": 0.11386327567849897, "grad_norm": 0.3250631093978882, "learning_rate": 0.0001057762938230384, "loss": 0.8794, "num_input_tokens_seen": 3912254, "step": 1417, "train_runtime": 3623.4543, "train_tokens_per_second": 1079.703 }, { "epoch": 0.1139436308483497, "grad_norm": 0.34978342056274414, "learning_rate": 0.00010570951585976627, "loss": 1.1143, "num_input_tokens_seen": 3915770, "step": 1418, "train_runtime": 3625.9582, "train_tokens_per_second": 1079.927 }, { "epoch": 0.11402398601820045, "grad_norm": 0.34009402990341187, "learning_rate": 0.00010564273789649417, "loss": 0.9026, "num_input_tokens_seen": 3918878, "step": 1419, "train_runtime": 3628.3053, "train_tokens_per_second": 1080.085 }, { "epoch": 0.11410434118805118, "grad_norm": 0.33979278802871704, "learning_rate": 0.00010557595993322204, "loss": 0.9767, "num_input_tokens_seen": 3919988, "step": 1420, "train_runtime": 3629.8122, "train_tokens_per_second": 1079.942 }, { "epoch": 0.11418469635790193, "grad_norm": 0.34232306480407715, "learning_rate": 0.00010550918196994993, "loss": 1.1845, "num_input_tokens_seen": 3921820, "step": 1421, "train_runtime": 3631.4929, "train_tokens_per_second": 1079.947 }, { "epoch": 0.11426505152775267, "grad_norm": 0.33989453315734863, "learning_rate": 0.0001054424040066778, "loss": 0.8203, "num_input_tokens_seen": 3925958, "step": 1422, "train_runtime": 3634.6185, "train_tokens_per_second": 1080.157 }, { "epoch": 0.1143454066976034, "grad_norm": 0.3074391782283783, "learning_rate": 0.00010537562604340567, "loss": 1.0615, "num_input_tokens_seen": 3928358, "step": 1423, "train_runtime": 3636.5942, "train_tokens_per_second": 1080.23 }, { "epoch": 0.11442576186745415, "grad_norm": 0.3119485676288605, "learning_rate": 0.00010530884808013357, "loss": 0.958, "num_input_tokens_seen": 3931152, "step": 1424, "train_runtime": 3638.8064, "train_tokens_per_second": 1080.341 }, { "epoch": 0.11450611703730489, "grad_norm": 0.38976985216140747, "learning_rate": 0.00010524207011686145, "loss": 1.041, "num_input_tokens_seen": 3932784, "step": 1425, "train_runtime": 3640.4249, "train_tokens_per_second": 1080.309 }, { "epoch": 0.11458647220715563, "grad_norm": 0.3487476110458374, "learning_rate": 0.00010517529215358932, "loss": 1.1562, "num_input_tokens_seen": 3934768, "step": 1426, "train_runtime": 3642.1234, "train_tokens_per_second": 1080.35 }, { "epoch": 0.11466682737700637, "grad_norm": 0.3184686601161957, "learning_rate": 0.0001051085141903172, "loss": 1.0298, "num_input_tokens_seen": 3937902, "step": 1427, "train_runtime": 3644.5798, "train_tokens_per_second": 1080.482 }, { "epoch": 0.1147471825468571, "grad_norm": 0.4373387396335602, "learning_rate": 0.00010504173622704507, "loss": 1.304, "num_input_tokens_seen": 3942896, "step": 1428, "train_runtime": 3648.0381, "train_tokens_per_second": 1080.826 }, { "epoch": 0.11482753771670785, "grad_norm": 0.3348543643951416, "learning_rate": 0.00010497495826377295, "loss": 1.1626, "num_input_tokens_seen": 3945662, "step": 1429, "train_runtime": 3650.1428, "train_tokens_per_second": 1080.961 }, { "epoch": 0.11490789288655859, "grad_norm": 0.33286574482917786, "learning_rate": 0.00010490818030050084, "loss": 0.8599, "num_input_tokens_seen": 3948736, "step": 1430, "train_runtime": 3652.4788, "train_tokens_per_second": 1081.111 }, { "epoch": 0.11498824805640932, "grad_norm": 0.3033377528190613, "learning_rate": 0.00010484140233722873, "loss": 1.3113, "num_input_tokens_seen": 3951594, "step": 1431, "train_runtime": 3654.6938, "train_tokens_per_second": 1081.238 }, { "epoch": 0.11506860322626007, "grad_norm": 0.3794889748096466, "learning_rate": 0.0001047746243739566, "loss": 1.3646, "num_input_tokens_seen": 3953800, "step": 1432, "train_runtime": 3656.5296, "train_tokens_per_second": 1081.299 }, { "epoch": 0.1151489583961108, "grad_norm": 0.3114030063152313, "learning_rate": 0.00010470784641068447, "loss": 1.1194, "num_input_tokens_seen": 3956818, "step": 1433, "train_runtime": 3658.8008, "train_tokens_per_second": 1081.452 }, { "epoch": 0.11522931356596156, "grad_norm": 0.27211475372314453, "learning_rate": 0.00010464106844741235, "loss": 0.8474, "num_input_tokens_seen": 3959178, "step": 1434, "train_runtime": 3660.8197, "train_tokens_per_second": 1081.5 }, { "epoch": 0.11530966873581229, "grad_norm": 0.2972334921360016, "learning_rate": 0.00010457429048414025, "loss": 0.8336, "num_input_tokens_seen": 3960544, "step": 1435, "train_runtime": 3662.3874, "train_tokens_per_second": 1081.41 }, { "epoch": 0.11539002390566303, "grad_norm": 0.29183486104011536, "learning_rate": 0.00010450751252086812, "loss": 0.9665, "num_input_tokens_seen": 3962588, "step": 1436, "train_runtime": 3664.2521, "train_tokens_per_second": 1081.418 }, { "epoch": 0.11547037907551377, "grad_norm": 0.30539897084236145, "learning_rate": 0.00010444073455759599, "loss": 1.0487, "num_input_tokens_seen": 3965300, "step": 1437, "train_runtime": 3666.4031, "train_tokens_per_second": 1081.523 }, { "epoch": 0.11555073424536451, "grad_norm": 0.3198235034942627, "learning_rate": 0.00010437395659432388, "loss": 1.0284, "num_input_tokens_seen": 3967034, "step": 1438, "train_runtime": 3668.0817, "train_tokens_per_second": 1081.501 }, { "epoch": 0.11563108941521526, "grad_norm": 0.3200485110282898, "learning_rate": 0.00010430717863105175, "loss": 1.1556, "num_input_tokens_seen": 3970296, "step": 1439, "train_runtime": 3670.5023, "train_tokens_per_second": 1081.676 }, { "epoch": 0.11571144458506599, "grad_norm": 0.2981796860694885, "learning_rate": 0.00010424040066777965, "loss": 1.0596, "num_input_tokens_seen": 3972926, "step": 1440, "train_runtime": 3672.6602, "train_tokens_per_second": 1081.757 }, { "epoch": 0.11579179975491673, "grad_norm": 0.28679391741752625, "learning_rate": 0.00010417362270450753, "loss": 0.9033, "num_input_tokens_seen": 3976014, "step": 1441, "train_runtime": 3677.0176, "train_tokens_per_second": 1081.315 }, { "epoch": 0.11587215492476748, "grad_norm": 0.3157092332839966, "learning_rate": 0.0001041068447412354, "loss": 0.9198, "num_input_tokens_seen": 3979538, "step": 1442, "train_runtime": 3679.559, "train_tokens_per_second": 1081.526 }, { "epoch": 0.11595251009461821, "grad_norm": 0.3371581435203552, "learning_rate": 0.00010404006677796327, "loss": 1.0642, "num_input_tokens_seen": 3981386, "step": 1443, "train_runtime": 3681.3359, "train_tokens_per_second": 1081.506 }, { "epoch": 0.11603286526446896, "grad_norm": 0.2808104157447815, "learning_rate": 0.00010397328881469115, "loss": 1.4665, "num_input_tokens_seen": 3985510, "step": 1444, "train_runtime": 3684.3932, "train_tokens_per_second": 1081.728 }, { "epoch": 0.1161132204343197, "grad_norm": 0.31633618474006653, "learning_rate": 0.00010390651085141905, "loss": 1.0221, "num_input_tokens_seen": 3987956, "step": 1445, "train_runtime": 3686.4853, "train_tokens_per_second": 1081.777 }, { "epoch": 0.11619357560417043, "grad_norm": 0.29563218355178833, "learning_rate": 0.00010383973288814692, "loss": 0.9477, "num_input_tokens_seen": 3990216, "step": 1446, "train_runtime": 3688.3936, "train_tokens_per_second": 1081.83 }, { "epoch": 0.11627393077402118, "grad_norm": 0.3616282045841217, "learning_rate": 0.0001037729549248748, "loss": 0.9883, "num_input_tokens_seen": 3992298, "step": 1447, "train_runtime": 3690.2458, "train_tokens_per_second": 1081.852 }, { "epoch": 0.11635428594387191, "grad_norm": 0.3951462209224701, "learning_rate": 0.00010370617696160268, "loss": 1.3897, "num_input_tokens_seen": 3996792, "step": 1448, "train_runtime": 3693.5612, "train_tokens_per_second": 1082.097 }, { "epoch": 0.11643464111372265, "grad_norm": 0.3162688612937927, "learning_rate": 0.00010363939899833055, "loss": 0.8743, "num_input_tokens_seen": 3998988, "step": 1449, "train_runtime": 3695.4694, "train_tokens_per_second": 1082.133 }, { "epoch": 0.1165149962835734, "grad_norm": 0.3188450336456299, "learning_rate": 0.00010357262103505843, "loss": 1.0401, "num_input_tokens_seen": 4000944, "step": 1450, "train_runtime": 3697.2579, "train_tokens_per_second": 1082.138 }, { "epoch": 0.11659535145342413, "grad_norm": 0.2858012914657593, "learning_rate": 0.00010350584307178633, "loss": 1.0443, "num_input_tokens_seen": 4003162, "step": 1451, "train_runtime": 3699.0944, "train_tokens_per_second": 1082.201 }, { "epoch": 0.11667570662327488, "grad_norm": 0.3404531180858612, "learning_rate": 0.0001034390651085142, "loss": 0.6921, "num_input_tokens_seen": 4004826, "step": 1452, "train_runtime": 3700.7609, "train_tokens_per_second": 1082.163 }, { "epoch": 0.11675606179312562, "grad_norm": 0.31202077865600586, "learning_rate": 0.00010337228714524207, "loss": 0.9364, "num_input_tokens_seen": 4007318, "step": 1453, "train_runtime": 3702.8423, "train_tokens_per_second": 1082.228 }, { "epoch": 0.11683641696297635, "grad_norm": 0.3742130398750305, "learning_rate": 0.00010330550918196994, "loss": 0.8273, "num_input_tokens_seen": 4012332, "step": 1454, "train_runtime": 3706.531, "train_tokens_per_second": 1082.503 }, { "epoch": 0.1169167721328271, "grad_norm": 0.3088212311267853, "learning_rate": 0.00010323873121869783, "loss": 0.8714, "num_input_tokens_seen": 4014652, "step": 1455, "train_runtime": 3708.5804, "train_tokens_per_second": 1082.531 }, { "epoch": 0.11699712730267783, "grad_norm": 0.3392530679702759, "learning_rate": 0.00010317195325542572, "loss": 0.9011, "num_input_tokens_seen": 4016462, "step": 1456, "train_runtime": 3710.3192, "train_tokens_per_second": 1082.511 }, { "epoch": 0.11707748247252858, "grad_norm": 0.3812410533428192, "learning_rate": 0.0001031051752921536, "loss": 1.1298, "num_input_tokens_seen": 4018634, "step": 1457, "train_runtime": 3712.2635, "train_tokens_per_second": 1082.529 }, { "epoch": 0.11715783764237932, "grad_norm": 0.35789114236831665, "learning_rate": 0.00010303839732888148, "loss": 0.9295, "num_input_tokens_seen": 4020642, "step": 1458, "train_runtime": 3714.1219, "train_tokens_per_second": 1082.528 }, { "epoch": 0.11723819281223005, "grad_norm": 0.2593947649002075, "learning_rate": 0.00010297161936560935, "loss": 1.1925, "num_input_tokens_seen": 4023940, "step": 1459, "train_runtime": 3716.6038, "train_tokens_per_second": 1082.693 }, { "epoch": 0.1173185479820808, "grad_norm": 0.2739175260066986, "learning_rate": 0.00010290484140233722, "loss": 1.0771, "num_input_tokens_seen": 4026284, "step": 1460, "train_runtime": 3718.5772, "train_tokens_per_second": 1082.749 }, { "epoch": 0.11739890315193154, "grad_norm": 0.31637459993362427, "learning_rate": 0.00010283806343906512, "loss": 0.772, "num_input_tokens_seen": 4027962, "step": 1461, "train_runtime": 3720.2325, "train_tokens_per_second": 1082.718 }, { "epoch": 0.11747925832178228, "grad_norm": 0.2679910957813263, "learning_rate": 0.000102771285475793, "loss": 0.7238, "num_input_tokens_seen": 4032768, "step": 1462, "train_runtime": 3723.4886, "train_tokens_per_second": 1083.062 }, { "epoch": 0.11755961349163302, "grad_norm": 0.283014714717865, "learning_rate": 0.00010270450751252087, "loss": 0.8421, "num_input_tokens_seen": 4034896, "step": 1463, "train_runtime": 3725.3309, "train_tokens_per_second": 1083.097 }, { "epoch": 0.11763996866148375, "grad_norm": 0.31199800968170166, "learning_rate": 0.00010263772954924876, "loss": 1.0831, "num_input_tokens_seen": 4036852, "step": 1464, "train_runtime": 3727.0819, "train_tokens_per_second": 1083.113 }, { "epoch": 0.1177203238313345, "grad_norm": 0.29866108298301697, "learning_rate": 0.00010257095158597663, "loss": 0.9584, "num_input_tokens_seen": 4039966, "step": 1465, "train_runtime": 3729.5273, "train_tokens_per_second": 1083.238 }, { "epoch": 0.11780067900118524, "grad_norm": 0.28818005323410034, "learning_rate": 0.0001025041736227045, "loss": 1.0084, "num_input_tokens_seen": 4042228, "step": 1466, "train_runtime": 3731.3739, "train_tokens_per_second": 1083.308 }, { "epoch": 0.11788103417103597, "grad_norm": 0.36868417263031006, "learning_rate": 0.0001024373956594324, "loss": 1.0072, "num_input_tokens_seen": 4043934, "step": 1467, "train_runtime": 3733.0507, "train_tokens_per_second": 1083.279 }, { "epoch": 0.11796138934088672, "grad_norm": 0.4026516377925873, "learning_rate": 0.00010237061769616028, "loss": 0.9238, "num_input_tokens_seen": 4045512, "step": 1468, "train_runtime": 3734.6428, "train_tokens_per_second": 1083.239 }, { "epoch": 0.11804174451073746, "grad_norm": 0.3591594398021698, "learning_rate": 0.00010230383973288815, "loss": 1.1237, "num_input_tokens_seen": 4046834, "step": 1469, "train_runtime": 3736.1764, "train_tokens_per_second": 1083.149 }, { "epoch": 0.1181220996805882, "grad_norm": 0.32499995827674866, "learning_rate": 0.00010223706176961602, "loss": 0.9187, "num_input_tokens_seen": 4049092, "step": 1470, "train_runtime": 3738.2093, "train_tokens_per_second": 1083.164 }, { "epoch": 0.11820245485043894, "grad_norm": 0.2623390555381775, "learning_rate": 0.0001021702838063439, "loss": 0.9589, "num_input_tokens_seen": 4053266, "step": 1471, "train_runtime": 3742.8531, "train_tokens_per_second": 1082.935 }, { "epoch": 0.11828281002028967, "grad_norm": 0.3267577588558197, "learning_rate": 0.0001021035058430718, "loss": 0.7474, "num_input_tokens_seen": 4055404, "step": 1472, "train_runtime": 3744.7093, "train_tokens_per_second": 1082.969 }, { "epoch": 0.11836316519014042, "grad_norm": 0.3571934998035431, "learning_rate": 0.00010203672787979967, "loss": 1.4617, "num_input_tokens_seen": 4058278, "step": 1473, "train_runtime": 3746.958, "train_tokens_per_second": 1083.086 }, { "epoch": 0.11844352035999116, "grad_norm": 0.38490167260169983, "learning_rate": 0.00010196994991652756, "loss": 1.2963, "num_input_tokens_seen": 4060432, "step": 1474, "train_runtime": 3748.846, "train_tokens_per_second": 1083.115 }, { "epoch": 0.11852387552984191, "grad_norm": 0.2769409418106079, "learning_rate": 0.00010190317195325543, "loss": 0.901, "num_input_tokens_seen": 4063322, "step": 1475, "train_runtime": 3751.1721, "train_tokens_per_second": 1083.214 }, { "epoch": 0.11860423069969264, "grad_norm": 0.3213483691215515, "learning_rate": 0.0001018363939899833, "loss": 0.6892, "num_input_tokens_seen": 4066616, "step": 1476, "train_runtime": 3753.6915, "train_tokens_per_second": 1083.364 }, { "epoch": 0.11868458586954338, "grad_norm": 0.29150086641311646, "learning_rate": 0.0001017696160267112, "loss": 0.9867, "num_input_tokens_seen": 4069198, "step": 1477, "train_runtime": 3755.7526, "train_tokens_per_second": 1083.457 }, { "epoch": 0.11876494103939413, "grad_norm": 0.3302112817764282, "learning_rate": 0.00010170283806343908, "loss": 1.3474, "num_input_tokens_seen": 4071784, "step": 1478, "train_runtime": 3757.8616, "train_tokens_per_second": 1083.538 }, { "epoch": 0.11884529620924486, "grad_norm": 0.319048136472702, "learning_rate": 0.00010163606010016695, "loss": 1.1293, "num_input_tokens_seen": 4074594, "step": 1479, "train_runtime": 3760.0506, "train_tokens_per_second": 1083.654 }, { "epoch": 0.11892565137909561, "grad_norm": 0.4086817800998688, "learning_rate": 0.00010156928213689482, "loss": 0.9525, "num_input_tokens_seen": 4077978, "step": 1480, "train_runtime": 3762.6566, "train_tokens_per_second": 1083.803 }, { "epoch": 0.11900600654894634, "grad_norm": 0.3641253113746643, "learning_rate": 0.00010150250417362271, "loss": 1.2776, "num_input_tokens_seen": 4080702, "step": 1481, "train_runtime": 3764.7547, "train_tokens_per_second": 1083.922 }, { "epoch": 0.11908636171879708, "grad_norm": 0.29269173741340637, "learning_rate": 0.00010143572621035058, "loss": 1.2271, "num_input_tokens_seen": 4083220, "step": 1482, "train_runtime": 3766.8052, "train_tokens_per_second": 1084.001 }, { "epoch": 0.11916671688864783, "grad_norm": 0.3291515111923218, "learning_rate": 0.00010136894824707848, "loss": 1.1588, "num_input_tokens_seen": 4085380, "step": 1483, "train_runtime": 3768.7048, "train_tokens_per_second": 1084.028 }, { "epoch": 0.11924707205849856, "grad_norm": 0.2971457839012146, "learning_rate": 0.00010130217028380636, "loss": 1.0273, "num_input_tokens_seen": 4087444, "step": 1484, "train_runtime": 3770.5371, "train_tokens_per_second": 1084.048 }, { "epoch": 0.1193274272283493, "grad_norm": 0.32142123579978943, "learning_rate": 0.00010123539232053423, "loss": 0.9107, "num_input_tokens_seen": 4089092, "step": 1485, "train_runtime": 3772.1972, "train_tokens_per_second": 1084.008 }, { "epoch": 0.11940778239820005, "grad_norm": 0.3527226150035858, "learning_rate": 0.0001011686143572621, "loss": 1.1797, "num_input_tokens_seen": 4090958, "step": 1486, "train_runtime": 3773.8854, "train_tokens_per_second": 1084.018 }, { "epoch": 0.11948813756805078, "grad_norm": 0.3108879625797272, "learning_rate": 0.00010110183639398998, "loss": 0.8897, "num_input_tokens_seen": 4093624, "step": 1487, "train_runtime": 3776.0624, "train_tokens_per_second": 1084.099 }, { "epoch": 0.11956849273790153, "grad_norm": 0.3651483356952667, "learning_rate": 0.00010103505843071788, "loss": 0.8955, "num_input_tokens_seen": 4096158, "step": 1488, "train_runtime": 3778.1789, "train_tokens_per_second": 1084.162 }, { "epoch": 0.11964884790775226, "grad_norm": 0.3421587646007538, "learning_rate": 0.00010096828046744575, "loss": 1.2061, "num_input_tokens_seen": 4098476, "step": 1489, "train_runtime": 3780.11, "train_tokens_per_second": 1084.221 }, { "epoch": 0.119729203077603, "grad_norm": 0.27953073382377625, "learning_rate": 0.00010090150250417362, "loss": 0.8189, "num_input_tokens_seen": 4100152, "step": 1490, "train_runtime": 3781.7738, "train_tokens_per_second": 1084.188 }, { "epoch": 0.11980955824745375, "grad_norm": 0.29624682664871216, "learning_rate": 0.00010083472454090151, "loss": 0.7177, "num_input_tokens_seen": 4102288, "step": 1491, "train_runtime": 3783.6621, "train_tokens_per_second": 1084.211 }, { "epoch": 0.11988991341730448, "grad_norm": 0.3120693862438202, "learning_rate": 0.00010076794657762938, "loss": 0.903, "num_input_tokens_seen": 4104320, "step": 1492, "train_runtime": 3785.4741, "train_tokens_per_second": 1084.229 }, { "epoch": 0.11997026858715523, "grad_norm": 0.34112513065338135, "learning_rate": 0.00010070116861435728, "loss": 1.2143, "num_input_tokens_seen": 4106598, "step": 1493, "train_runtime": 3787.4906, "train_tokens_per_second": 1084.253 }, { "epoch": 0.12005062375700597, "grad_norm": 0.3413991928100586, "learning_rate": 0.00010063439065108516, "loss": 1.043, "num_input_tokens_seen": 4109652, "step": 1494, "train_runtime": 3789.903, "train_tokens_per_second": 1084.369 }, { "epoch": 0.1201309789268567, "grad_norm": 0.28197675943374634, "learning_rate": 0.00010056761268781303, "loss": 0.8596, "num_input_tokens_seen": 4112258, "step": 1495, "train_runtime": 3792.0023, "train_tokens_per_second": 1084.456 }, { "epoch": 0.12021133409670745, "grad_norm": 0.345485121011734, "learning_rate": 0.0001005008347245409, "loss": 1.0525, "num_input_tokens_seen": 4114188, "step": 1496, "train_runtime": 3793.737, "train_tokens_per_second": 1084.468 }, { "epoch": 0.12029168926655819, "grad_norm": 0.3160560429096222, "learning_rate": 0.00010043405676126878, "loss": 1.0691, "num_input_tokens_seen": 4118016, "step": 1497, "train_runtime": 3796.4987, "train_tokens_per_second": 1084.688 }, { "epoch": 0.12037204443640893, "grad_norm": 0.35005122423171997, "learning_rate": 0.00010036727879799666, "loss": 0.908, "num_input_tokens_seen": 4119490, "step": 1498, "train_runtime": 3798.0739, "train_tokens_per_second": 1084.626 }, { "epoch": 0.12045239960625967, "grad_norm": 0.293682724237442, "learning_rate": 0.00010030050083472455, "loss": 0.6331, "num_input_tokens_seen": 4122572, "step": 1499, "train_runtime": 3800.4721, "train_tokens_per_second": 1084.753 }, { "epoch": 0.1205327547761104, "grad_norm": 0.2874637544155121, "learning_rate": 0.00010023372287145244, "loss": 0.8274, "num_input_tokens_seen": 4125028, "step": 1500, "train_runtime": 3802.5022, "train_tokens_per_second": 1084.819 }, { "epoch": 0.1205327547761104, "eval_loss": 0.9687259197235107, "eval_runtime": 91.9069, "eval_samples_per_second": 10.815, "eval_steps_per_second": 5.408, "num_input_tokens_seen": 4125028, "step": 1500 }, { "epoch": 0.12061310994596115, "grad_norm": 0.4220530092716217, "learning_rate": 0.00010016694490818031, "loss": 1.0931, "num_input_tokens_seen": 4126924, "step": 1501, "train_runtime": 3898.2509, "train_tokens_per_second": 1058.66 }, { "epoch": 0.12069346511581189, "grad_norm": 0.3375208079814911, "learning_rate": 0.00010010016694490818, "loss": 1.026, "num_input_tokens_seen": 4128474, "step": 1502, "train_runtime": 3899.8855, "train_tokens_per_second": 1058.614 }, { "epoch": 0.12077382028566262, "grad_norm": 0.3334346115589142, "learning_rate": 0.00010003338898163605, "loss": 1.1606, "num_input_tokens_seen": 4130818, "step": 1503, "train_runtime": 3901.7898, "train_tokens_per_second": 1058.698 }, { "epoch": 0.12085417545551337, "grad_norm": 0.24376749992370605, "learning_rate": 9.996661101836394e-05, "loss": 0.8696, "num_input_tokens_seen": 4134226, "step": 1504, "train_runtime": 3904.3643, "train_tokens_per_second": 1058.873 }, { "epoch": 0.1209345306253641, "grad_norm": 0.33671870827674866, "learning_rate": 9.989983305509183e-05, "loss": 1.0061, "num_input_tokens_seen": 4136524, "step": 1505, "train_runtime": 3906.3474, "train_tokens_per_second": 1058.924 }, { "epoch": 0.12101488579521485, "grad_norm": 0.3007793724536896, "learning_rate": 9.98330550918197e-05, "loss": 1.0107, "num_input_tokens_seen": 4142152, "step": 1506, "train_runtime": 3910.1659, "train_tokens_per_second": 1059.329 }, { "epoch": 0.12109524096506559, "grad_norm": 0.38502055406570435, "learning_rate": 9.976627712854757e-05, "loss": 0.6883, "num_input_tokens_seen": 4145772, "step": 1507, "train_runtime": 3912.821, "train_tokens_per_second": 1059.535 }, { "epoch": 0.12117559613491632, "grad_norm": 0.3022374212741852, "learning_rate": 9.969949916527546e-05, "loss": 0.8321, "num_input_tokens_seen": 4148734, "step": 1508, "train_runtime": 3915.115, "train_tokens_per_second": 1059.671 }, { "epoch": 0.12125595130476707, "grad_norm": 0.3609469532966614, "learning_rate": 9.963272120200335e-05, "loss": 0.926, "num_input_tokens_seen": 4149902, "step": 1509, "train_runtime": 3916.5995, "train_tokens_per_second": 1059.568 }, { "epoch": 0.12133630647461781, "grad_norm": 0.36960041522979736, "learning_rate": 9.956594323873122e-05, "loss": 0.8551, "num_input_tokens_seen": 4151634, "step": 1510, "train_runtime": 3918.2656, "train_tokens_per_second": 1059.559 }, { "epoch": 0.12141666164446856, "grad_norm": 0.3294745087623596, "learning_rate": 9.949916527545911e-05, "loss": 0.9627, "num_input_tokens_seen": 4154556, "step": 1511, "train_runtime": 3920.5899, "train_tokens_per_second": 1059.676 }, { "epoch": 0.12149701681431929, "grad_norm": 0.34972280263900757, "learning_rate": 9.943238731218698e-05, "loss": 0.8768, "num_input_tokens_seen": 4156844, "step": 1512, "train_runtime": 3922.489, "train_tokens_per_second": 1059.746 }, { "epoch": 0.12157737198417003, "grad_norm": 0.29665154218673706, "learning_rate": 9.936560934891487e-05, "loss": 1.1868, "num_input_tokens_seen": 4158776, "step": 1513, "train_runtime": 3924.2701, "train_tokens_per_second": 1059.758 }, { "epoch": 0.12165772715402078, "grad_norm": 0.3763272762298584, "learning_rate": 9.929883138564274e-05, "loss": 1.1702, "num_input_tokens_seen": 4161048, "step": 1514, "train_runtime": 3926.2345, "train_tokens_per_second": 1059.806 }, { "epoch": 0.12173808232387151, "grad_norm": 0.30107128620147705, "learning_rate": 9.923205342237061e-05, "loss": 0.8206, "num_input_tokens_seen": 4163580, "step": 1515, "train_runtime": 3928.3509, "train_tokens_per_second": 1059.88 }, { "epoch": 0.12181843749372226, "grad_norm": 0.3155030906200409, "learning_rate": 9.91652754590985e-05, "loss": 1.0903, "num_input_tokens_seen": 4168808, "step": 1516, "train_runtime": 3932.0118, "train_tokens_per_second": 1060.223 }, { "epoch": 0.121898792663573, "grad_norm": 0.3096657395362854, "learning_rate": 9.909849749582639e-05, "loss": 0.8853, "num_input_tokens_seen": 4171406, "step": 1517, "train_runtime": 3934.1106, "train_tokens_per_second": 1060.317 }, { "epoch": 0.12197914783342373, "grad_norm": 0.29947328567504883, "learning_rate": 9.903171953255426e-05, "loss": 0.8163, "num_input_tokens_seen": 4174348, "step": 1518, "train_runtime": 3936.49, "train_tokens_per_second": 1060.424 }, { "epoch": 0.12205950300327448, "grad_norm": 0.4084034860134125, "learning_rate": 9.896494156928215e-05, "loss": 1.4146, "num_input_tokens_seen": 4178092, "step": 1519, "train_runtime": 3939.2342, "train_tokens_per_second": 1060.636 }, { "epoch": 0.12213985817312521, "grad_norm": 0.3082602620124817, "learning_rate": 9.889816360601002e-05, "loss": 0.9939, "num_input_tokens_seen": 4180770, "step": 1520, "train_runtime": 3941.3942, "train_tokens_per_second": 1060.734 }, { "epoch": 0.12222021334297595, "grad_norm": 0.29626932740211487, "learning_rate": 9.883138564273791e-05, "loss": 1.0401, "num_input_tokens_seen": 4183738, "step": 1521, "train_runtime": 3943.6946, "train_tokens_per_second": 1060.868 }, { "epoch": 0.1223005685128267, "grad_norm": 0.3405837416648865, "learning_rate": 9.876460767946578e-05, "loss": 1.0216, "num_input_tokens_seen": 4187014, "step": 1522, "train_runtime": 3946.1954, "train_tokens_per_second": 1061.026 }, { "epoch": 0.12238092368267743, "grad_norm": 0.2592165768146515, "learning_rate": 9.869782971619365e-05, "loss": 0.5401, "num_input_tokens_seen": 4188814, "step": 1523, "train_runtime": 3947.9318, "train_tokens_per_second": 1061.015 }, { "epoch": 0.12246127885252818, "grad_norm": 0.30895012617111206, "learning_rate": 9.863105175292154e-05, "loss": 1.1475, "num_input_tokens_seen": 4190888, "step": 1524, "train_runtime": 3949.8037, "train_tokens_per_second": 1061.037 }, { "epoch": 0.12254163402237891, "grad_norm": 0.26299959421157837, "learning_rate": 9.856427378964941e-05, "loss": 0.7644, "num_input_tokens_seen": 4193516, "step": 1525, "train_runtime": 3951.9798, "train_tokens_per_second": 1061.118 }, { "epoch": 0.12262198919222965, "grad_norm": 0.2840707302093506, "learning_rate": 9.84974958263773e-05, "loss": 0.8117, "num_input_tokens_seen": 4197604, "step": 1526, "train_runtime": 3955.0031, "train_tokens_per_second": 1061.34 }, { "epoch": 0.1227023443620804, "grad_norm": 0.27579811215400696, "learning_rate": 9.843071786310519e-05, "loss": 1.0271, "num_input_tokens_seen": 4201056, "step": 1527, "train_runtime": 3957.551, "train_tokens_per_second": 1061.529 }, { "epoch": 0.12278269953193113, "grad_norm": 0.30672600865364075, "learning_rate": 9.836393989983306e-05, "loss": 0.8594, "num_input_tokens_seen": 4204054, "step": 1528, "train_runtime": 3959.819, "train_tokens_per_second": 1061.678 }, { "epoch": 0.12286305470178188, "grad_norm": 0.3525024950504303, "learning_rate": 9.829716193656095e-05, "loss": 1.216, "num_input_tokens_seen": 4206328, "step": 1529, "train_runtime": 3961.8489, "train_tokens_per_second": 1061.708 }, { "epoch": 0.12294340987163262, "grad_norm": 0.29691240191459656, "learning_rate": 9.823038397328882e-05, "loss": 1.1783, "num_input_tokens_seen": 4209390, "step": 1530, "train_runtime": 3964.1874, "train_tokens_per_second": 1061.854 }, { "epoch": 0.12302376504148335, "grad_norm": 0.2713939845561981, "learning_rate": 9.816360601001669e-05, "loss": 0.8498, "num_input_tokens_seen": 4212364, "step": 1531, "train_runtime": 3968.5436, "train_tokens_per_second": 1061.438 }, { "epoch": 0.1231041202113341, "grad_norm": 0.2757306694984436, "learning_rate": 9.809682804674458e-05, "loss": 0.9648, "num_input_tokens_seen": 4214222, "step": 1532, "train_runtime": 3970.2781, "train_tokens_per_second": 1061.443 }, { "epoch": 0.12318447538118484, "grad_norm": 0.32179951667785645, "learning_rate": 9.803005008347245e-05, "loss": 0.9963, "num_input_tokens_seen": 4215616, "step": 1533, "train_runtime": 3971.8362, "train_tokens_per_second": 1061.377 }, { "epoch": 0.12326483055103558, "grad_norm": 0.29909610748291016, "learning_rate": 9.796327212020034e-05, "loss": 0.9778, "num_input_tokens_seen": 4218242, "step": 1534, "train_runtime": 3973.9604, "train_tokens_per_second": 1061.471 }, { "epoch": 0.12334518572088632, "grad_norm": 0.30370089411735535, "learning_rate": 9.789649415692823e-05, "loss": 1.0526, "num_input_tokens_seen": 4222488, "step": 1535, "train_runtime": 3977.1252, "train_tokens_per_second": 1061.694 }, { "epoch": 0.12342554089073705, "grad_norm": 0.33886227011680603, "learning_rate": 9.78297161936561e-05, "loss": 0.9511, "num_input_tokens_seen": 4224014, "step": 1536, "train_runtime": 3978.7271, "train_tokens_per_second": 1061.65 }, { "epoch": 0.1235058960605878, "grad_norm": 0.2827256917953491, "learning_rate": 9.776293823038399e-05, "loss": 1.2194, "num_input_tokens_seen": 4227360, "step": 1537, "train_runtime": 3981.2885, "train_tokens_per_second": 1061.807 }, { "epoch": 0.12358625123043854, "grad_norm": 0.29998552799224854, "learning_rate": 9.769616026711186e-05, "loss": 1.0784, "num_input_tokens_seen": 4230310, "step": 1538, "train_runtime": 3983.5407, "train_tokens_per_second": 1061.947 }, { "epoch": 0.12366660640028927, "grad_norm": 0.26519492268562317, "learning_rate": 9.762938230383973e-05, "loss": 0.9632, "num_input_tokens_seen": 4232910, "step": 1539, "train_runtime": 3985.6123, "train_tokens_per_second": 1062.048 }, { "epoch": 0.12374696157014002, "grad_norm": 0.33117997646331787, "learning_rate": 9.756260434056762e-05, "loss": 1.2052, "num_input_tokens_seen": 4236572, "step": 1540, "train_runtime": 3988.3582, "train_tokens_per_second": 1062.235 }, { "epoch": 0.12382731673999076, "grad_norm": 0.32519131898880005, "learning_rate": 9.749582637729549e-05, "loss": 1.0382, "num_input_tokens_seen": 4238426, "step": 1541, "train_runtime": 3990.093, "train_tokens_per_second": 1062.237 }, { "epoch": 0.1239076719098415, "grad_norm": 0.29621413350105286, "learning_rate": 9.742904841402337e-05, "loss": 0.7077, "num_input_tokens_seen": 4241042, "step": 1542, "train_runtime": 3992.137, "train_tokens_per_second": 1062.349 }, { "epoch": 0.12398802707969224, "grad_norm": 0.4213193356990814, "learning_rate": 9.736227045075125e-05, "loss": 1.0655, "num_input_tokens_seen": 4243640, "step": 1543, "train_runtime": 3994.2365, "train_tokens_per_second": 1062.441 }, { "epoch": 0.12406838224954297, "grad_norm": 0.3207896649837494, "learning_rate": 9.729549248747914e-05, "loss": 1.0782, "num_input_tokens_seen": 4246446, "step": 1544, "train_runtime": 3996.5018, "train_tokens_per_second": 1062.541 }, { "epoch": 0.12414873741939372, "grad_norm": 0.3392288386821747, "learning_rate": 9.722871452420703e-05, "loss": 0.9714, "num_input_tokens_seen": 4248688, "step": 1545, "train_runtime": 3998.4739, "train_tokens_per_second": 1062.577 }, { "epoch": 0.12422909258924446, "grad_norm": 0.3342682719230652, "learning_rate": 9.71619365609349e-05, "loss": 0.785, "num_input_tokens_seen": 4250868, "step": 1546, "train_runtime": 4000.3503, "train_tokens_per_second": 1062.624 }, { "epoch": 0.1243094477590952, "grad_norm": 0.46963852643966675, "learning_rate": 9.709515859766277e-05, "loss": 0.8838, "num_input_tokens_seen": 4254280, "step": 1547, "train_runtime": 4002.8892, "train_tokens_per_second": 1062.802 }, { "epoch": 0.12438980292894594, "grad_norm": 0.2585029602050781, "learning_rate": 9.702838063439066e-05, "loss": 0.716, "num_input_tokens_seen": 4257168, "step": 1548, "train_runtime": 4005.1704, "train_tokens_per_second": 1062.918 }, { "epoch": 0.12447015809879668, "grad_norm": 0.355210542678833, "learning_rate": 9.696160267111853e-05, "loss": 1.0856, "num_input_tokens_seen": 4260700, "step": 1549, "train_runtime": 4007.8139, "train_tokens_per_second": 1063.098 }, { "epoch": 0.12455051326864743, "grad_norm": 0.3496839106082916, "learning_rate": 9.68948247078464e-05, "loss": 1.2003, "num_input_tokens_seen": 4263468, "step": 1550, "train_runtime": 4010.0487, "train_tokens_per_second": 1063.196 }, { "epoch": 0.12463086843849816, "grad_norm": 0.35232529044151306, "learning_rate": 9.682804674457429e-05, "loss": 0.846, "num_input_tokens_seen": 4266430, "step": 1551, "train_runtime": 4012.3354, "train_tokens_per_second": 1063.328 }, { "epoch": 0.12471122360834891, "grad_norm": 0.5223502516746521, "learning_rate": 9.676126878130218e-05, "loss": 0.9476, "num_input_tokens_seen": 4268414, "step": 1552, "train_runtime": 4014.1462, "train_tokens_per_second": 1063.343 }, { "epoch": 0.12479157877819964, "grad_norm": 0.352175772190094, "learning_rate": 9.669449081803006e-05, "loss": 1.2018, "num_input_tokens_seen": 4272096, "step": 1553, "train_runtime": 4016.8707, "train_tokens_per_second": 1063.538 }, { "epoch": 0.12487193394805038, "grad_norm": 0.2820923626422882, "learning_rate": 9.662771285475794e-05, "loss": 0.8292, "num_input_tokens_seen": 4275040, "step": 1554, "train_runtime": 4019.155, "train_tokens_per_second": 1063.666 }, { "epoch": 0.12495228911790113, "grad_norm": 0.35349148511886597, "learning_rate": 9.656093489148581e-05, "loss": 0.8889, "num_input_tokens_seen": 4277406, "step": 1555, "train_runtime": 4021.1961, "train_tokens_per_second": 1063.715 }, { "epoch": 0.12503264428775188, "grad_norm": 0.28008055686950684, "learning_rate": 9.64941569282137e-05, "loss": 1.0218, "num_input_tokens_seen": 4279672, "step": 1556, "train_runtime": 4023.1201, "train_tokens_per_second": 1063.769 }, { "epoch": 0.1251129994576026, "grad_norm": 0.25264522433280945, "learning_rate": 9.642737896494157e-05, "loss": 0.7857, "num_input_tokens_seen": 4281902, "step": 1557, "train_runtime": 4025.038, "train_tokens_per_second": 1063.817 }, { "epoch": 0.12519335462745335, "grad_norm": 0.34692656993865967, "learning_rate": 9.636060100166944e-05, "loss": 0.9851, "num_input_tokens_seen": 4283642, "step": 1558, "train_runtime": 4026.8277, "train_tokens_per_second": 1063.776 }, { "epoch": 0.1252737097973041, "grad_norm": 0.36077600717544556, "learning_rate": 9.629382303839733e-05, "loss": 0.9562, "num_input_tokens_seen": 4286324, "step": 1559, "train_runtime": 4029.0136, "train_tokens_per_second": 1063.864 }, { "epoch": 0.12535406496715482, "grad_norm": 0.29979103803634644, "learning_rate": 9.62270450751252e-05, "loss": 0.9474, "num_input_tokens_seen": 4289516, "step": 1560, "train_runtime": 4031.5425, "train_tokens_per_second": 1063.989 }, { "epoch": 0.12543442013700556, "grad_norm": 0.4771215617656708, "learning_rate": 9.616026711185309e-05, "loss": 0.7319, "num_input_tokens_seen": 4291630, "step": 1561, "train_runtime": 4035.3936, "train_tokens_per_second": 1063.497 }, { "epoch": 0.1255147753068563, "grad_norm": 0.30186399817466736, "learning_rate": 9.609348914858098e-05, "loss": 0.9793, "num_input_tokens_seen": 4295206, "step": 1562, "train_runtime": 4038.0338, "train_tokens_per_second": 1063.687 }, { "epoch": 0.12559513047670703, "grad_norm": 0.3582748472690582, "learning_rate": 9.602671118530885e-05, "loss": 1.001, "num_input_tokens_seen": 4297150, "step": 1563, "train_runtime": 4039.8707, "train_tokens_per_second": 1063.685 }, { "epoch": 0.12567548564655778, "grad_norm": 0.2658465504646301, "learning_rate": 9.595993322203674e-05, "loss": 1.0441, "num_input_tokens_seen": 4299646, "step": 1564, "train_runtime": 4041.947, "train_tokens_per_second": 1063.756 }, { "epoch": 0.12575584081640853, "grad_norm": 0.3602330684661865, "learning_rate": 9.589315525876461e-05, "loss": 0.7958, "num_input_tokens_seen": 4304910, "step": 1565, "train_runtime": 4045.4956, "train_tokens_per_second": 1064.124 }, { "epoch": 0.12583619598625925, "grad_norm": 0.47481727600097656, "learning_rate": 9.582637729549248e-05, "loss": 1.2609, "num_input_tokens_seen": 4309734, "step": 1566, "train_runtime": 4049.116, "train_tokens_per_second": 1064.364 }, { "epoch": 0.12591655115611, "grad_norm": 0.4152240753173828, "learning_rate": 9.575959933222037e-05, "loss": 1.0946, "num_input_tokens_seen": 4312310, "step": 1567, "train_runtime": 4051.2582, "train_tokens_per_second": 1064.437 }, { "epoch": 0.12599690632596075, "grad_norm": 0.34455329179763794, "learning_rate": 9.569282136894824e-05, "loss": 1.1691, "num_input_tokens_seen": 4314016, "step": 1568, "train_runtime": 4052.9792, "train_tokens_per_second": 1064.406 }, { "epoch": 0.1260772614958115, "grad_norm": 0.36066463589668274, "learning_rate": 9.562604340567613e-05, "loss": 1.1051, "num_input_tokens_seen": 4315980, "step": 1569, "train_runtime": 4054.8256, "train_tokens_per_second": 1064.406 }, { "epoch": 0.12615761666566222, "grad_norm": 0.3376621901988983, "learning_rate": 9.555926544240402e-05, "loss": 1.3598, "num_input_tokens_seen": 4318890, "step": 1570, "train_runtime": 4057.0943, "train_tokens_per_second": 1064.528 }, { "epoch": 0.12623797183551297, "grad_norm": 0.29116007685661316, "learning_rate": 9.549248747913189e-05, "loss": 1.21, "num_input_tokens_seen": 4322766, "step": 1571, "train_runtime": 4059.8215, "train_tokens_per_second": 1064.768 }, { "epoch": 0.12631832700536372, "grad_norm": 0.3354508876800537, "learning_rate": 9.542570951585978e-05, "loss": 1.1107, "num_input_tokens_seen": 4325462, "step": 1572, "train_runtime": 4061.9668, "train_tokens_per_second": 1064.869 }, { "epoch": 0.12639868217521444, "grad_norm": 0.3176094591617584, "learning_rate": 9.535893155258765e-05, "loss": 1.1147, "num_input_tokens_seen": 4328720, "step": 1573, "train_runtime": 4064.3823, "train_tokens_per_second": 1065.038 }, { "epoch": 0.1264790373450652, "grad_norm": 0.2785077691078186, "learning_rate": 9.529215358931554e-05, "loss": 0.9175, "num_input_tokens_seen": 4332450, "step": 1574, "train_runtime": 4067.1878, "train_tokens_per_second": 1065.22 }, { "epoch": 0.12655939251491594, "grad_norm": 0.3080126643180847, "learning_rate": 9.522537562604341e-05, "loss": 0.8276, "num_input_tokens_seen": 4334602, "step": 1575, "train_runtime": 4069.0806, "train_tokens_per_second": 1065.253 }, { "epoch": 0.12663974768476666, "grad_norm": 0.25135132670402527, "learning_rate": 9.515859766277128e-05, "loss": 0.7839, "num_input_tokens_seen": 4338854, "step": 1576, "train_runtime": 4072.0152, "train_tokens_per_second": 1065.53 }, { "epoch": 0.1267201028546174, "grad_norm": 0.34842756390571594, "learning_rate": 9.509181969949917e-05, "loss": 0.7685, "num_input_tokens_seen": 4341122, "step": 1577, "train_runtime": 4074.0358, "train_tokens_per_second": 1065.558 }, { "epoch": 0.12680045802446815, "grad_norm": 0.29723262786865234, "learning_rate": 9.502504173622706e-05, "loss": 0.9885, "num_input_tokens_seen": 4345372, "step": 1578, "train_runtime": 4077.1368, "train_tokens_per_second": 1065.79 }, { "epoch": 0.1268808131943189, "grad_norm": 0.3278983235359192, "learning_rate": 9.495826377295493e-05, "loss": 1.1951, "num_input_tokens_seen": 4348502, "step": 1579, "train_runtime": 4079.5335, "train_tokens_per_second": 1065.931 }, { "epoch": 0.12696116836416962, "grad_norm": 0.3214225172996521, "learning_rate": 9.489148580968282e-05, "loss": 1.1698, "num_input_tokens_seen": 4350354, "step": 1580, "train_runtime": 4081.2724, "train_tokens_per_second": 1065.931 }, { "epoch": 0.12704152353402037, "grad_norm": 0.31389468908309937, "learning_rate": 9.482470784641069e-05, "loss": 0.6864, "num_input_tokens_seen": 4351910, "step": 1581, "train_runtime": 4082.8667, "train_tokens_per_second": 1065.896 }, { "epoch": 0.12712187870387112, "grad_norm": 0.35068169236183167, "learning_rate": 9.475792988313858e-05, "loss": 0.9628, "num_input_tokens_seen": 4353630, "step": 1582, "train_runtime": 4084.641, "train_tokens_per_second": 1065.854 }, { "epoch": 0.12720223387372184, "grad_norm": 0.2965669333934784, "learning_rate": 9.469115191986645e-05, "loss": 0.8182, "num_input_tokens_seen": 4356496, "step": 1583, "train_runtime": 4087.0429, "train_tokens_per_second": 1065.929 }, { "epoch": 0.1272825890435726, "grad_norm": 0.34938281774520874, "learning_rate": 9.462437395659432e-05, "loss": 0.8695, "num_input_tokens_seen": 4359048, "step": 1584, "train_runtime": 4089.2205, "train_tokens_per_second": 1065.985 }, { "epoch": 0.12736294421342334, "grad_norm": 0.33864614367485046, "learning_rate": 9.455759599332221e-05, "loss": 1.0555, "num_input_tokens_seen": 4361124, "step": 1585, "train_runtime": 4091.2194, "train_tokens_per_second": 1065.972 }, { "epoch": 0.12744329938327406, "grad_norm": 0.32404622435569763, "learning_rate": 9.449081803005008e-05, "loss": 1.0601, "num_input_tokens_seen": 4364340, "step": 1586, "train_runtime": 4093.6635, "train_tokens_per_second": 1066.121 }, { "epoch": 0.1275236545531248, "grad_norm": 0.3412817418575287, "learning_rate": 9.442404006677797e-05, "loss": 1.1029, "num_input_tokens_seen": 4365894, "step": 1587, "train_runtime": 4095.2502, "train_tokens_per_second": 1066.087 }, { "epoch": 0.12760400972297556, "grad_norm": 0.38739249110221863, "learning_rate": 9.435726210350586e-05, "loss": 1.0414, "num_input_tokens_seen": 4369104, "step": 1588, "train_runtime": 4097.6883, "train_tokens_per_second": 1066.236 }, { "epoch": 0.12768436489282628, "grad_norm": 0.3215208649635315, "learning_rate": 9.429048414023373e-05, "loss": 0.9363, "num_input_tokens_seen": 4371096, "step": 1589, "train_runtime": 4099.5478, "train_tokens_per_second": 1066.239 }, { "epoch": 0.12776472006267703, "grad_norm": 0.249175563454628, "learning_rate": 9.422370617696162e-05, "loss": 0.7218, "num_input_tokens_seen": 4374214, "step": 1590, "train_runtime": 4101.9081, "train_tokens_per_second": 1066.385 }, { "epoch": 0.12784507523252778, "grad_norm": 0.26424458622932434, "learning_rate": 9.415692821368949e-05, "loss": 0.8172, "num_input_tokens_seen": 4376924, "step": 1591, "train_runtime": 4105.9222, "train_tokens_per_second": 1066.003 }, { "epoch": 0.12792543040237853, "grad_norm": 0.2841605842113495, "learning_rate": 9.409015025041736e-05, "loss": 0.8139, "num_input_tokens_seen": 4380006, "step": 1592, "train_runtime": 4108.3375, "train_tokens_per_second": 1066.126 }, { "epoch": 0.12800578557222925, "grad_norm": 0.33027318120002747, "learning_rate": 9.402337228714525e-05, "loss": 0.8235, "num_input_tokens_seen": 4381974, "step": 1593, "train_runtime": 4110.1363, "train_tokens_per_second": 1066.138 }, { "epoch": 0.12808614074208, "grad_norm": 0.3513645529747009, "learning_rate": 9.395659432387312e-05, "loss": 0.9179, "num_input_tokens_seen": 4384918, "step": 1594, "train_runtime": 4112.326, "train_tokens_per_second": 1066.287 }, { "epoch": 0.12816649591193074, "grad_norm": 0.32416418194770813, "learning_rate": 9.388981636060101e-05, "loss": 1.1617, "num_input_tokens_seen": 4386724, "step": 1595, "train_runtime": 4114.0026, "train_tokens_per_second": 1066.291 }, { "epoch": 0.12824685108178147, "grad_norm": 0.39823058247566223, "learning_rate": 9.38230383973289e-05, "loss": 1.329, "num_input_tokens_seen": 4391324, "step": 1596, "train_runtime": 4117.4051, "train_tokens_per_second": 1066.527 }, { "epoch": 0.12832720625163221, "grad_norm": 0.3567141890525818, "learning_rate": 9.375626043405677e-05, "loss": 1.0886, "num_input_tokens_seen": 4394018, "step": 1597, "train_runtime": 4119.5702, "train_tokens_per_second": 1066.62 }, { "epoch": 0.12840756142148296, "grad_norm": 0.32280534505844116, "learning_rate": 9.368948247078465e-05, "loss": 1.2491, "num_input_tokens_seen": 4396968, "step": 1598, "train_runtime": 4121.8578, "train_tokens_per_second": 1066.744 }, { "epoch": 0.12848791659133368, "grad_norm": 0.33652475476264954, "learning_rate": 9.362270450751253e-05, "loss": 0.9289, "num_input_tokens_seen": 4400246, "step": 1599, "train_runtime": 4124.3122, "train_tokens_per_second": 1066.904 }, { "epoch": 0.12856827176118443, "grad_norm": 0.3057388961315155, "learning_rate": 9.35559265442404e-05, "loss": 0.9814, "num_input_tokens_seen": 4403088, "step": 1600, "train_runtime": 4126.5194, "train_tokens_per_second": 1067.022 }, { "epoch": 0.12864862693103518, "grad_norm": 0.3203054666519165, "learning_rate": 9.348914858096829e-05, "loss": 0.9271, "num_input_tokens_seen": 4407068, "step": 1601, "train_runtime": 4129.3721, "train_tokens_per_second": 1067.249 }, { "epoch": 0.1287289821008859, "grad_norm": 0.3386048376560211, "learning_rate": 9.342237061769616e-05, "loss": 0.987, "num_input_tokens_seen": 4408798, "step": 1602, "train_runtime": 4131.0341, "train_tokens_per_second": 1067.238 }, { "epoch": 0.12880933727073665, "grad_norm": 0.25215280055999756, "learning_rate": 9.335559265442403e-05, "loss": 0.7593, "num_input_tokens_seen": 4413646, "step": 1603, "train_runtime": 4134.3417, "train_tokens_per_second": 1067.557 }, { "epoch": 0.1288896924405874, "grad_norm": 0.26832783222198486, "learning_rate": 9.328881469115192e-05, "loss": 1.0153, "num_input_tokens_seen": 4415762, "step": 1604, "train_runtime": 4136.1728, "train_tokens_per_second": 1067.596 }, { "epoch": 0.12897004761043815, "grad_norm": 0.42433273792266846, "learning_rate": 9.322203672787981e-05, "loss": 0.9614, "num_input_tokens_seen": 4418652, "step": 1605, "train_runtime": 4138.4507, "train_tokens_per_second": 1067.707 }, { "epoch": 0.12905040278028887, "grad_norm": 0.2514105439186096, "learning_rate": 9.31552587646077e-05, "loss": 0.8276, "num_input_tokens_seen": 4420204, "step": 1606, "train_runtime": 4140.0388, "train_tokens_per_second": 1067.672 }, { "epoch": 0.12913075795013962, "grad_norm": 0.2524038851261139, "learning_rate": 9.308848080133557e-05, "loss": 1.2064, "num_input_tokens_seen": 4422934, "step": 1607, "train_runtime": 4142.2247, "train_tokens_per_second": 1067.768 }, { "epoch": 0.12921111311999037, "grad_norm": 0.29408514499664307, "learning_rate": 9.302170283806344e-05, "loss": 1.0602, "num_input_tokens_seen": 4425688, "step": 1608, "train_runtime": 4144.3247, "train_tokens_per_second": 1067.891 }, { "epoch": 0.1292914682898411, "grad_norm": 0.2821078896522522, "learning_rate": 9.295492487479133e-05, "loss": 0.8052, "num_input_tokens_seen": 4428300, "step": 1609, "train_runtime": 4146.572, "train_tokens_per_second": 1067.942 }, { "epoch": 0.12937182345969184, "grad_norm": 0.25574159622192383, "learning_rate": 9.28881469115192e-05, "loss": 0.7596, "num_input_tokens_seen": 4430626, "step": 1610, "train_runtime": 4148.5215, "train_tokens_per_second": 1068.001 }, { "epoch": 0.12945217862954259, "grad_norm": 0.28250545263290405, "learning_rate": 9.282136894824707e-05, "loss": 0.955, "num_input_tokens_seen": 4432484, "step": 1611, "train_runtime": 4150.2126, "train_tokens_per_second": 1068.014 }, { "epoch": 0.1295325337993933, "grad_norm": 0.27344927191734314, "learning_rate": 9.275459098497496e-05, "loss": 0.5724, "num_input_tokens_seen": 4437890, "step": 1612, "train_runtime": 4153.9689, "train_tokens_per_second": 1068.349 }, { "epoch": 0.12961288896924406, "grad_norm": 0.3148863613605499, "learning_rate": 9.268781302170285e-05, "loss": 0.9932, "num_input_tokens_seen": 4440388, "step": 1613, "train_runtime": 4156.051, "train_tokens_per_second": 1068.415 }, { "epoch": 0.1296932441390948, "grad_norm": 0.3240756690502167, "learning_rate": 9.262103505843073e-05, "loss": 0.8635, "num_input_tokens_seen": 4442402, "step": 1614, "train_runtime": 4157.9847, "train_tokens_per_second": 1068.403 }, { "epoch": 0.12977359930894555, "grad_norm": 0.3345417082309723, "learning_rate": 9.255425709515861e-05, "loss": 1.1861, "num_input_tokens_seen": 4444962, "step": 1615, "train_runtime": 4160.0953, "train_tokens_per_second": 1068.476 }, { "epoch": 0.12985395447879627, "grad_norm": 0.33316949009895325, "learning_rate": 9.248747913188648e-05, "loss": 1.028, "num_input_tokens_seen": 4449454, "step": 1616, "train_runtime": 4163.2201, "train_tokens_per_second": 1068.753 }, { "epoch": 0.12993430964864702, "grad_norm": 0.49215489625930786, "learning_rate": 9.242070116861437e-05, "loss": 0.9807, "num_input_tokens_seen": 4451866, "step": 1617, "train_runtime": 4165.1562, "train_tokens_per_second": 1068.835 }, { "epoch": 0.13001466481849777, "grad_norm": 0.3640338182449341, "learning_rate": 9.235392320534224e-05, "loss": 0.9479, "num_input_tokens_seen": 4453300, "step": 1618, "train_runtime": 4166.7527, "train_tokens_per_second": 1068.77 }, { "epoch": 0.1300950199883485, "grad_norm": 0.24760620296001434, "learning_rate": 9.228714524207011e-05, "loss": 0.6054, "num_input_tokens_seen": 4456352, "step": 1619, "train_runtime": 4169.1115, "train_tokens_per_second": 1068.897 }, { "epoch": 0.13017537515819924, "grad_norm": 0.37118616700172424, "learning_rate": 9.2220367278798e-05, "loss": 0.9708, "num_input_tokens_seen": 4459332, "step": 1620, "train_runtime": 4171.557, "train_tokens_per_second": 1068.985 }, { "epoch": 0.13025573032805, "grad_norm": 0.30011922121047974, "learning_rate": 9.215358931552587e-05, "loss": 1.076, "num_input_tokens_seen": 4461230, "step": 1621, "train_runtime": 4174.9637, "train_tokens_per_second": 1068.567 }, { "epoch": 0.1303360854979007, "grad_norm": 0.35796383023262024, "learning_rate": 9.208681135225376e-05, "loss": 0.8814, "num_input_tokens_seen": 4463488, "step": 1622, "train_runtime": 4176.9112, "train_tokens_per_second": 1068.61 }, { "epoch": 0.13041644066775146, "grad_norm": 0.3439129889011383, "learning_rate": 9.202003338898165e-05, "loss": 0.987, "num_input_tokens_seen": 4467164, "step": 1623, "train_runtime": 4179.5879, "train_tokens_per_second": 1068.805 }, { "epoch": 0.1304967958376022, "grad_norm": 0.337166965007782, "learning_rate": 9.195325542570952e-05, "loss": 1.0371, "num_input_tokens_seen": 4470520, "step": 1624, "train_runtime": 4182.1445, "train_tokens_per_second": 1068.954 }, { "epoch": 0.13057715100745293, "grad_norm": 0.3797534108161926, "learning_rate": 9.18864774624374e-05, "loss": 0.846, "num_input_tokens_seen": 4471852, "step": 1625, "train_runtime": 4183.6934, "train_tokens_per_second": 1068.877 }, { "epoch": 0.13065750617730368, "grad_norm": 0.25332966446876526, "learning_rate": 9.181969949916528e-05, "loss": 0.8772, "num_input_tokens_seen": 4475116, "step": 1626, "train_runtime": 4186.1983, "train_tokens_per_second": 1069.017 }, { "epoch": 0.13073786134715443, "grad_norm": 0.31641215085983276, "learning_rate": 9.175292153589315e-05, "loss": 0.852, "num_input_tokens_seen": 4476870, "step": 1627, "train_runtime": 4187.8897, "train_tokens_per_second": 1069.004 }, { "epoch": 0.13081821651700518, "grad_norm": 0.30552247166633606, "learning_rate": 9.168614357262104e-05, "loss": 1.04, "num_input_tokens_seen": 4479824, "step": 1628, "train_runtime": 4190.0846, "train_tokens_per_second": 1069.149 }, { "epoch": 0.1308985716868559, "grad_norm": 0.28019553422927856, "learning_rate": 9.161936560934891e-05, "loss": 1.0666, "num_input_tokens_seen": 4482186, "step": 1629, "train_runtime": 4192.0882, "train_tokens_per_second": 1069.201 }, { "epoch": 0.13097892685670665, "grad_norm": 0.28002801537513733, "learning_rate": 9.15525876460768e-05, "loss": 0.9712, "num_input_tokens_seen": 4484060, "step": 1630, "train_runtime": 4193.8702, "train_tokens_per_second": 1069.194 }, { "epoch": 0.1310592820265574, "grad_norm": 0.25342047214508057, "learning_rate": 9.148580968280469e-05, "loss": 0.7143, "num_input_tokens_seen": 4487294, "step": 1631, "train_runtime": 4196.3134, "train_tokens_per_second": 1069.342 }, { "epoch": 0.13113963719640812, "grad_norm": 0.2778625786304474, "learning_rate": 9.141903171953256e-05, "loss": 0.7966, "num_input_tokens_seen": 4489094, "step": 1632, "train_runtime": 4198.1966, "train_tokens_per_second": 1069.291 }, { "epoch": 0.13121999236625886, "grad_norm": 0.33734869956970215, "learning_rate": 9.135225375626045e-05, "loss": 0.8386, "num_input_tokens_seen": 4491332, "step": 1633, "train_runtime": 4200.204, "train_tokens_per_second": 1069.313 }, { "epoch": 0.1313003475361096, "grad_norm": 0.3175203800201416, "learning_rate": 9.128547579298832e-05, "loss": 0.7832, "num_input_tokens_seen": 4493968, "step": 1634, "train_runtime": 4202.4361, "train_tokens_per_second": 1069.372 }, { "epoch": 0.13138070270596033, "grad_norm": 0.3065336346626282, "learning_rate": 9.121869782971619e-05, "loss": 0.8444, "num_input_tokens_seen": 4495802, "step": 1635, "train_runtime": 4204.2043, "train_tokens_per_second": 1069.359 }, { "epoch": 0.13146105787581108, "grad_norm": 0.3828697204589844, "learning_rate": 9.115191986644408e-05, "loss": 1.0292, "num_input_tokens_seen": 4497860, "step": 1636, "train_runtime": 4205.9624, "train_tokens_per_second": 1069.401 }, { "epoch": 0.13154141304566183, "grad_norm": 0.2931973338127136, "learning_rate": 9.108514190317195e-05, "loss": 1.1776, "num_input_tokens_seen": 4500282, "step": 1637, "train_runtime": 4207.9363, "train_tokens_per_second": 1069.475 }, { "epoch": 0.13162176821551255, "grad_norm": 0.2747010886669159, "learning_rate": 9.101836393989984e-05, "loss": 0.8025, "num_input_tokens_seen": 4503798, "step": 1638, "train_runtime": 4210.496, "train_tokens_per_second": 1069.66 }, { "epoch": 0.1317021233853633, "grad_norm": 0.3100590407848358, "learning_rate": 9.095158597662771e-05, "loss": 0.8297, "num_input_tokens_seen": 4506974, "step": 1639, "train_runtime": 4212.9528, "train_tokens_per_second": 1069.79 }, { "epoch": 0.13178247855521405, "grad_norm": 0.30835211277008057, "learning_rate": 9.08848080133556e-05, "loss": 1.0038, "num_input_tokens_seen": 4509138, "step": 1640, "train_runtime": 4214.8822, "train_tokens_per_second": 1069.814 }, { "epoch": 0.1318628337250648, "grad_norm": 0.20513121783733368, "learning_rate": 9.081803005008348e-05, "loss": 0.3474, "num_input_tokens_seen": 4511390, "step": 1641, "train_runtime": 4216.8515, "train_tokens_per_second": 1069.848 }, { "epoch": 0.13194318889491552, "grad_norm": 0.31580573320388794, "learning_rate": 9.075125208681136e-05, "loss": 0.8266, "num_input_tokens_seen": 4513928, "step": 1642, "train_runtime": 4218.9634, "train_tokens_per_second": 1069.914 }, { "epoch": 0.13202354406476627, "grad_norm": 0.4065244197845459, "learning_rate": 9.068447412353923e-05, "loss": 1.0224, "num_input_tokens_seen": 4515578, "step": 1643, "train_runtime": 4220.645, "train_tokens_per_second": 1069.879 }, { "epoch": 0.13210389923461702, "grad_norm": 0.3030647039413452, "learning_rate": 9.061769616026712e-05, "loss": 1.0523, "num_input_tokens_seen": 4517324, "step": 1644, "train_runtime": 4222.3246, "train_tokens_per_second": 1069.867 }, { "epoch": 0.13218425440446774, "grad_norm": 0.36461055278778076, "learning_rate": 9.055091819699499e-05, "loss": 0.8365, "num_input_tokens_seen": 4519522, "step": 1645, "train_runtime": 4224.2701, "train_tokens_per_second": 1069.894 }, { "epoch": 0.1322646095743185, "grad_norm": 0.42367351055145264, "learning_rate": 9.048414023372288e-05, "loss": 0.9529, "num_input_tokens_seen": 4520928, "step": 1646, "train_runtime": 4225.8589, "train_tokens_per_second": 1069.825 }, { "epoch": 0.13234496474416924, "grad_norm": 0.25916787981987, "learning_rate": 9.041736227045075e-05, "loss": 0.8301, "num_input_tokens_seen": 4523560, "step": 1647, "train_runtime": 4228.0031, "train_tokens_per_second": 1069.905 }, { "epoch": 0.13242531991401996, "grad_norm": 0.2737148702144623, "learning_rate": 9.035058430717864e-05, "loss": 0.9342, "num_input_tokens_seen": 4526918, "step": 1648, "train_runtime": 4230.5098, "train_tokens_per_second": 1070.064 }, { "epoch": 0.1325056750838707, "grad_norm": 0.29724356532096863, "learning_rate": 9.028380634390652e-05, "loss": 0.7756, "num_input_tokens_seen": 4530596, "step": 1649, "train_runtime": 4233.2695, "train_tokens_per_second": 1070.236 }, { "epoch": 0.13258603025372145, "grad_norm": 0.31504523754119873, "learning_rate": 9.02170283806344e-05, "loss": 0.969, "num_input_tokens_seen": 4531860, "step": 1650, "train_runtime": 4234.7892, "train_tokens_per_second": 1070.15 }, { "epoch": 0.1326663854235722, "grad_norm": 0.2676130533218384, "learning_rate": 9.015025041736227e-05, "loss": 0.8469, "num_input_tokens_seen": 4535260, "step": 1651, "train_runtime": 4239.0719, "train_tokens_per_second": 1069.871 }, { "epoch": 0.13274674059342292, "grad_norm": 0.3291208744049072, "learning_rate": 9.008347245409016e-05, "loss": 1.3977, "num_input_tokens_seen": 4538326, "step": 1652, "train_runtime": 4241.4146, "train_tokens_per_second": 1070.003 }, { "epoch": 0.13282709576327367, "grad_norm": 0.3381328284740448, "learning_rate": 9.001669449081803e-05, "loss": 1.0963, "num_input_tokens_seen": 4541152, "step": 1653, "train_runtime": 4243.6372, "train_tokens_per_second": 1070.108 }, { "epoch": 0.13290745093312442, "grad_norm": 0.33428165316581726, "learning_rate": 8.994991652754592e-05, "loss": 1.0073, "num_input_tokens_seen": 4543384, "step": 1654, "train_runtime": 4245.6022, "train_tokens_per_second": 1070.139 }, { "epoch": 0.13298780610297514, "grad_norm": 0.45007333159446716, "learning_rate": 8.988313856427379e-05, "loss": 1.1264, "num_input_tokens_seen": 4545610, "step": 1655, "train_runtime": 4247.5942, "train_tokens_per_second": 1070.161 }, { "epoch": 0.1330681612728259, "grad_norm": 0.24271412193775177, "learning_rate": 8.981636060100166e-05, "loss": 0.7438, "num_input_tokens_seen": 4548880, "step": 1656, "train_runtime": 4250.0792, "train_tokens_per_second": 1070.305 }, { "epoch": 0.13314851644267664, "grad_norm": 0.3081810772418976, "learning_rate": 8.974958263772955e-05, "loss": 1.0669, "num_input_tokens_seen": 4554630, "step": 1657, "train_runtime": 4254.0066, "train_tokens_per_second": 1070.668 }, { "epoch": 0.13322887161252736, "grad_norm": 0.3170272707939148, "learning_rate": 8.968280467445744e-05, "loss": 1.0973, "num_input_tokens_seen": 4558384, "step": 1658, "train_runtime": 4256.7557, "train_tokens_per_second": 1070.859 }, { "epoch": 0.1333092267823781, "grad_norm": 0.28447824716567993, "learning_rate": 8.961602671118531e-05, "loss": 0.6721, "num_input_tokens_seen": 4560850, "step": 1659, "train_runtime": 4258.8203, "train_tokens_per_second": 1070.919 }, { "epoch": 0.13338958195222886, "grad_norm": 0.24304047226905823, "learning_rate": 8.95492487479132e-05, "loss": 0.8053, "num_input_tokens_seen": 4563652, "step": 1660, "train_runtime": 4261.0141, "train_tokens_per_second": 1071.025 }, { "epoch": 0.13346993712207958, "grad_norm": 0.3356163799762726, "learning_rate": 8.948247078464107e-05, "loss": 0.9594, "num_input_tokens_seen": 4566372, "step": 1661, "train_runtime": 4263.1376, "train_tokens_per_second": 1071.129 }, { "epoch": 0.13355029229193033, "grad_norm": 0.35904183983802795, "learning_rate": 8.941569282136896e-05, "loss": 1.0483, "num_input_tokens_seen": 4569306, "step": 1662, "train_runtime": 4265.3941, "train_tokens_per_second": 1071.251 }, { "epoch": 0.13363064746178108, "grad_norm": 0.350241094827652, "learning_rate": 8.934891485809683e-05, "loss": 0.9494, "num_input_tokens_seen": 4571786, "step": 1663, "train_runtime": 4267.4207, "train_tokens_per_second": 1071.323 }, { "epoch": 0.13371100263163183, "grad_norm": 0.2899452745914459, "learning_rate": 8.92821368948247e-05, "loss": 0.9646, "num_input_tokens_seen": 4573962, "step": 1664, "train_runtime": 4269.4142, "train_tokens_per_second": 1071.332 }, { "epoch": 0.13379135780148255, "grad_norm": 0.3941836357116699, "learning_rate": 8.921535893155259e-05, "loss": 1.0085, "num_input_tokens_seen": 4576108, "step": 1665, "train_runtime": 4271.3959, "train_tokens_per_second": 1071.338 }, { "epoch": 0.1338717129713333, "grad_norm": 0.3039100468158722, "learning_rate": 8.914858096828048e-05, "loss": 1.0543, "num_input_tokens_seen": 4579370, "step": 1666, "train_runtime": 4273.8943, "train_tokens_per_second": 1071.475 }, { "epoch": 0.13395206814118404, "grad_norm": 0.3556115925312042, "learning_rate": 8.908180300500835e-05, "loss": 1.0549, "num_input_tokens_seen": 4581778, "step": 1667, "train_runtime": 4275.9314, "train_tokens_per_second": 1071.527 }, { "epoch": 0.13403242331103477, "grad_norm": 0.32420018315315247, "learning_rate": 8.901502504173624e-05, "loss": 0.8315, "num_input_tokens_seen": 4584206, "step": 1668, "train_runtime": 4277.9082, "train_tokens_per_second": 1071.6 }, { "epoch": 0.13411277848088551, "grad_norm": 0.397775262594223, "learning_rate": 8.894824707846411e-05, "loss": 0.8873, "num_input_tokens_seen": 4587772, "step": 1669, "train_runtime": 4280.5771, "train_tokens_per_second": 1071.765 }, { "epoch": 0.13419313365073626, "grad_norm": 0.3347060978412628, "learning_rate": 8.8881469115192e-05, "loss": 0.8835, "num_input_tokens_seen": 4589850, "step": 1670, "train_runtime": 4282.4087, "train_tokens_per_second": 1071.792 }, { "epoch": 0.13427348882058698, "grad_norm": 0.3155038058757782, "learning_rate": 8.881469115191987e-05, "loss": 0.9874, "num_input_tokens_seen": 4594972, "step": 1671, "train_runtime": 4286.0552, "train_tokens_per_second": 1072.075 }, { "epoch": 0.13435384399043773, "grad_norm": 0.41316670179367065, "learning_rate": 8.874791318864774e-05, "loss": 1.0672, "num_input_tokens_seen": 4597130, "step": 1672, "train_runtime": 4288.0242, "train_tokens_per_second": 1072.086 }, { "epoch": 0.13443419916028848, "grad_norm": 0.3476656973361969, "learning_rate": 8.868113522537563e-05, "loss": 1.159, "num_input_tokens_seen": 4600874, "step": 1673, "train_runtime": 4290.758, "train_tokens_per_second": 1072.275 }, { "epoch": 0.1345145543301392, "grad_norm": 0.33450794219970703, "learning_rate": 8.86143572621035e-05, "loss": 1.158, "num_input_tokens_seen": 4602716, "step": 1674, "train_runtime": 4292.4431, "train_tokens_per_second": 1072.284 }, { "epoch": 0.13459490949998995, "grad_norm": 0.3329657018184662, "learning_rate": 8.854757929883139e-05, "loss": 1.1793, "num_input_tokens_seen": 4605052, "step": 1675, "train_runtime": 4294.4282, "train_tokens_per_second": 1072.332 }, { "epoch": 0.1346752646698407, "grad_norm": 0.37308019399642944, "learning_rate": 8.848080133555928e-05, "loss": 1.1019, "num_input_tokens_seen": 4609106, "step": 1676, "train_runtime": 4297.3189, "train_tokens_per_second": 1072.554 }, { "epoch": 0.13475561983969145, "grad_norm": 0.30606627464294434, "learning_rate": 8.841402337228715e-05, "loss": 0.8794, "num_input_tokens_seen": 4611216, "step": 1677, "train_runtime": 4299.1549, "train_tokens_per_second": 1072.587 }, { "epoch": 0.13483597500954217, "grad_norm": 0.3290914297103882, "learning_rate": 8.834724540901504e-05, "loss": 1.0011, "num_input_tokens_seen": 4613654, "step": 1678, "train_runtime": 4301.1824, "train_tokens_per_second": 1072.648 }, { "epoch": 0.13491633017939292, "grad_norm": 0.33814892172813416, "learning_rate": 8.828046744574291e-05, "loss": 0.8095, "num_input_tokens_seen": 4615598, "step": 1679, "train_runtime": 4303.0239, "train_tokens_per_second": 1072.641 }, { "epoch": 0.13499668534924367, "grad_norm": 0.3479299545288086, "learning_rate": 8.821368948247078e-05, "loss": 0.8497, "num_input_tokens_seen": 4618324, "step": 1680, "train_runtime": 4305.2634, "train_tokens_per_second": 1072.716 }, { "epoch": 0.1350770405190944, "grad_norm": 0.3423509895801544, "learning_rate": 8.814691151919867e-05, "loss": 1.1246, "num_input_tokens_seen": 4620580, "step": 1681, "train_runtime": 4309.372, "train_tokens_per_second": 1072.217 }, { "epoch": 0.13515739568894514, "grad_norm": 0.3519035875797272, "learning_rate": 8.808013355592654e-05, "loss": 1.0326, "num_input_tokens_seen": 4622674, "step": 1682, "train_runtime": 4311.2041, "train_tokens_per_second": 1072.247 }, { "epoch": 0.13523775085879589, "grad_norm": 0.31621867418289185, "learning_rate": 8.801335559265443e-05, "loss": 1.0432, "num_input_tokens_seen": 4625648, "step": 1683, "train_runtime": 4313.5557, "train_tokens_per_second": 1072.352 }, { "epoch": 0.1353181060286466, "grad_norm": 0.4220649302005768, "learning_rate": 8.794657762938232e-05, "loss": 0.9385, "num_input_tokens_seen": 4629020, "step": 1684, "train_runtime": 4316.0764, "train_tokens_per_second": 1072.507 }, { "epoch": 0.13539846119849736, "grad_norm": 0.2913580536842346, "learning_rate": 8.787979966611019e-05, "loss": 0.8173, "num_input_tokens_seen": 4631074, "step": 1685, "train_runtime": 4317.9804, "train_tokens_per_second": 1072.509 }, { "epoch": 0.1354788163683481, "grad_norm": 0.2683812975883484, "learning_rate": 8.781302170283808e-05, "loss": 1.08, "num_input_tokens_seen": 4635102, "step": 1686, "train_runtime": 4320.904, "train_tokens_per_second": 1072.716 }, { "epoch": 0.13555917153819885, "grad_norm": 0.3216564655303955, "learning_rate": 8.774624373956595e-05, "loss": 0.8944, "num_input_tokens_seen": 4637268, "step": 1687, "train_runtime": 4322.7587, "train_tokens_per_second": 1072.757 }, { "epoch": 0.13563952670804957, "grad_norm": 0.2993555963039398, "learning_rate": 8.767946577629382e-05, "loss": 0.8588, "num_input_tokens_seen": 4640094, "step": 1688, "train_runtime": 4325.0756, "train_tokens_per_second": 1072.835 }, { "epoch": 0.13571988187790032, "grad_norm": 0.3338256776332855, "learning_rate": 8.761268781302171e-05, "loss": 0.9787, "num_input_tokens_seen": 4642262, "step": 1689, "train_runtime": 4326.918, "train_tokens_per_second": 1072.88 }, { "epoch": 0.13580023704775107, "grad_norm": 0.3616194427013397, "learning_rate": 8.754590984974958e-05, "loss": 1.0568, "num_input_tokens_seen": 4644614, "step": 1690, "train_runtime": 4328.9495, "train_tokens_per_second": 1072.919 }, { "epoch": 0.1358805922176018, "grad_norm": 0.2871371805667877, "learning_rate": 8.747913188647745e-05, "loss": 0.8855, "num_input_tokens_seen": 4646220, "step": 1691, "train_runtime": 4330.6302, "train_tokens_per_second": 1072.874 }, { "epoch": 0.13596094738745254, "grad_norm": 0.3189316689968109, "learning_rate": 8.741235392320535e-05, "loss": 1.1744, "num_input_tokens_seen": 4649310, "step": 1692, "train_runtime": 4333.021, "train_tokens_per_second": 1072.995 }, { "epoch": 0.1360413025573033, "grad_norm": 0.3624874949455261, "learning_rate": 8.734557595993323e-05, "loss": 0.8644, "num_input_tokens_seen": 4651880, "step": 1693, "train_runtime": 4335.0983, "train_tokens_per_second": 1073.074 }, { "epoch": 0.136121657727154, "grad_norm": 0.27284377813339233, "learning_rate": 8.727879799666111e-05, "loss": 0.6774, "num_input_tokens_seen": 4653500, "step": 1694, "train_runtime": 4336.6965, "train_tokens_per_second": 1073.052 }, { "epoch": 0.13620201289700476, "grad_norm": 0.24099037051200867, "learning_rate": 8.721202003338899e-05, "loss": 0.8722, "num_input_tokens_seen": 4656814, "step": 1695, "train_runtime": 4339.1886, "train_tokens_per_second": 1073.199 }, { "epoch": 0.1362823680668555, "grad_norm": 0.23552261292934418, "learning_rate": 8.714524207011686e-05, "loss": 0.4232, "num_input_tokens_seen": 4659278, "step": 1696, "train_runtime": 4341.3146, "train_tokens_per_second": 1073.241 }, { "epoch": 0.13636272323670623, "grad_norm": 0.3358173072338104, "learning_rate": 8.707846410684475e-05, "loss": 0.9733, "num_input_tokens_seen": 4661962, "step": 1697, "train_runtime": 4343.4613, "train_tokens_per_second": 1073.329 }, { "epoch": 0.13644307840655698, "grad_norm": 0.5365708470344543, "learning_rate": 8.701168614357262e-05, "loss": 1.0802, "num_input_tokens_seen": 4666956, "step": 1698, "train_runtime": 4346.9631, "train_tokens_per_second": 1073.613 }, { "epoch": 0.13652343357640773, "grad_norm": 0.3458505868911743, "learning_rate": 8.694490818030051e-05, "loss": 0.8993, "num_input_tokens_seen": 4668718, "step": 1699, "train_runtime": 4348.6378, "train_tokens_per_second": 1073.605 }, { "epoch": 0.13660378874625848, "grad_norm": 0.30510833859443665, "learning_rate": 8.687813021702838e-05, "loss": 1.0165, "num_input_tokens_seen": 4671682, "step": 1700, "train_runtime": 4350.8413, "train_tokens_per_second": 1073.742 }, { "epoch": 0.1366841439161092, "grad_norm": 0.3102036118507385, "learning_rate": 8.681135225375627e-05, "loss": 1.0339, "num_input_tokens_seen": 4673562, "step": 1701, "train_runtime": 4352.6165, "train_tokens_per_second": 1073.736 }, { "epoch": 0.13676449908595995, "grad_norm": 0.35591694712638855, "learning_rate": 8.674457429048415e-05, "loss": 0.8726, "num_input_tokens_seen": 4675602, "step": 1702, "train_runtime": 4354.4034, "train_tokens_per_second": 1073.764 }, { "epoch": 0.1368448542558107, "grad_norm": 0.325438916683197, "learning_rate": 8.667779632721203e-05, "loss": 1.001, "num_input_tokens_seen": 4677726, "step": 1703, "train_runtime": 4356.4042, "train_tokens_per_second": 1073.759 }, { "epoch": 0.13692520942566141, "grad_norm": 0.2606280446052551, "learning_rate": 8.66110183639399e-05, "loss": 0.8853, "num_input_tokens_seen": 4680866, "step": 1704, "train_runtime": 4358.7825, "train_tokens_per_second": 1073.893 }, { "epoch": 0.13700556459551216, "grad_norm": 0.26266175508499146, "learning_rate": 8.654424040066779e-05, "loss": 0.6576, "num_input_tokens_seen": 4683616, "step": 1705, "train_runtime": 4360.9884, "train_tokens_per_second": 1073.98 }, { "epoch": 0.1370859197653629, "grad_norm": 0.28277552127838135, "learning_rate": 8.647746243739566e-05, "loss": 1.3001, "num_input_tokens_seen": 4686820, "step": 1706, "train_runtime": 4363.3592, "train_tokens_per_second": 1074.131 }, { "epoch": 0.13716627493521363, "grad_norm": 0.3710005283355713, "learning_rate": 8.641068447412355e-05, "loss": 1.1717, "num_input_tokens_seen": 4689866, "step": 1707, "train_runtime": 4365.6024, "train_tokens_per_second": 1074.277 }, { "epoch": 0.13724663010506438, "grad_norm": 0.3213399350643158, "learning_rate": 8.634390651085142e-05, "loss": 1.0501, "num_input_tokens_seen": 4693132, "step": 1708, "train_runtime": 4368.0512, "train_tokens_per_second": 1074.422 }, { "epoch": 0.13732698527491513, "grad_norm": 0.4787834882736206, "learning_rate": 8.62771285475793e-05, "loss": 1.445, "num_input_tokens_seen": 4695088, "step": 1709, "train_runtime": 4369.9405, "train_tokens_per_second": 1074.405 }, { "epoch": 0.13740734044476585, "grad_norm": 0.29735395312309265, "learning_rate": 8.62103505843072e-05, "loss": 1.044, "num_input_tokens_seen": 4698032, "step": 1710, "train_runtime": 4372.2716, "train_tokens_per_second": 1074.506 }, { "epoch": 0.1374876956146166, "grad_norm": 0.3056807816028595, "learning_rate": 8.614357262103507e-05, "loss": 1.0037, "num_input_tokens_seen": 4700646, "step": 1711, "train_runtime": 4376.3613, "train_tokens_per_second": 1074.099 }, { "epoch": 0.13756805078446735, "grad_norm": 0.38576528429985046, "learning_rate": 8.607679465776294e-05, "loss": 1.1108, "num_input_tokens_seen": 4703298, "step": 1712, "train_runtime": 4378.5549, "train_tokens_per_second": 1074.167 }, { "epoch": 0.1376484059543181, "grad_norm": 0.33567014336586, "learning_rate": 8.601001669449083e-05, "loss": 1.1805, "num_input_tokens_seen": 4705322, "step": 1713, "train_runtime": 4380.3166, "train_tokens_per_second": 1074.197 }, { "epoch": 0.13772876112416882, "grad_norm": 0.26364225149154663, "learning_rate": 8.59432387312187e-05, "loss": 1.0343, "num_input_tokens_seen": 4707596, "step": 1714, "train_runtime": 4382.2285, "train_tokens_per_second": 1074.247 }, { "epoch": 0.13780911629401957, "grad_norm": 0.32710427045822144, "learning_rate": 8.587646076794659e-05, "loss": 0.9873, "num_input_tokens_seen": 4709850, "step": 1715, "train_runtime": 4384.2031, "train_tokens_per_second": 1074.277 }, { "epoch": 0.13788947146387032, "grad_norm": 0.9376202821731567, "learning_rate": 8.580968280467446e-05, "loss": 1.0839, "num_input_tokens_seen": 4713218, "step": 1716, "train_runtime": 4386.7057, "train_tokens_per_second": 1074.432 }, { "epoch": 0.13796982663372104, "grad_norm": 0.33692240715026855, "learning_rate": 8.574290484140233e-05, "loss": 1.1751, "num_input_tokens_seen": 4716474, "step": 1717, "train_runtime": 4389.1871, "train_tokens_per_second": 1074.567 }, { "epoch": 0.1380501818035718, "grad_norm": 0.29505711793899536, "learning_rate": 8.567612687813022e-05, "loss": 1.0749, "num_input_tokens_seen": 4718104, "step": 1718, "train_runtime": 4390.8474, "train_tokens_per_second": 1074.532 }, { "epoch": 0.13813053697342254, "grad_norm": 0.2989121675491333, "learning_rate": 8.56093489148581e-05, "loss": 0.9142, "num_input_tokens_seen": 4720348, "step": 1719, "train_runtime": 4392.7474, "train_tokens_per_second": 1074.578 }, { "epoch": 0.13821089214327326, "grad_norm": 0.35670560598373413, "learning_rate": 8.554257095158598e-05, "loss": 1.2714, "num_input_tokens_seen": 4722706, "step": 1720, "train_runtime": 4394.7899, "train_tokens_per_second": 1074.615 }, { "epoch": 0.138291247313124, "grad_norm": 0.28659960627555847, "learning_rate": 8.547579298831387e-05, "loss": 1.0231, "num_input_tokens_seen": 4727842, "step": 1721, "train_runtime": 4398.3018, "train_tokens_per_second": 1074.924 }, { "epoch": 0.13837160248297475, "grad_norm": 0.2947317957878113, "learning_rate": 8.540901502504174e-05, "loss": 0.9436, "num_input_tokens_seen": 4730294, "step": 1722, "train_runtime": 4400.3013, "train_tokens_per_second": 1074.993 }, { "epoch": 0.1384519576528255, "grad_norm": 0.3691924512386322, "learning_rate": 8.534223706176963e-05, "loss": 0.9322, "num_input_tokens_seen": 4732194, "step": 1723, "train_runtime": 4402.0304, "train_tokens_per_second": 1075.003 }, { "epoch": 0.13853231282267622, "grad_norm": 0.2930741012096405, "learning_rate": 8.52754590984975e-05, "loss": 0.9929, "num_input_tokens_seen": 4734300, "step": 1724, "train_runtime": 4403.8539, "train_tokens_per_second": 1075.036 }, { "epoch": 0.13861266799252697, "grad_norm": 0.3534330725669861, "learning_rate": 8.520868113522537e-05, "loss": 0.8906, "num_input_tokens_seen": 4736670, "step": 1725, "train_runtime": 4405.8647, "train_tokens_per_second": 1075.083 }, { "epoch": 0.13869302316237772, "grad_norm": 0.2637708783149719, "learning_rate": 8.514190317195326e-05, "loss": 0.7433, "num_input_tokens_seen": 4738966, "step": 1726, "train_runtime": 4407.8285, "train_tokens_per_second": 1075.125 }, { "epoch": 0.13877337833222844, "grad_norm": 0.34065011143684387, "learning_rate": 8.507512520868115e-05, "loss": 0.8965, "num_input_tokens_seen": 4741414, "step": 1727, "train_runtime": 4409.8232, "train_tokens_per_second": 1075.194 }, { "epoch": 0.1388537335020792, "grad_norm": 0.37217527627944946, "learning_rate": 8.500834724540902e-05, "loss": 1.343, "num_input_tokens_seen": 4743398, "step": 1728, "train_runtime": 4411.6143, "train_tokens_per_second": 1075.207 }, { "epoch": 0.13893408867192994, "grad_norm": 0.34970638155937195, "learning_rate": 8.49415692821369e-05, "loss": 0.8375, "num_input_tokens_seen": 4744930, "step": 1729, "train_runtime": 4413.1785, "train_tokens_per_second": 1075.173 }, { "epoch": 0.13901444384178066, "grad_norm": 0.3551918566226959, "learning_rate": 8.487479131886478e-05, "loss": 1.2019, "num_input_tokens_seen": 4747054, "step": 1730, "train_runtime": 4415.0128, "train_tokens_per_second": 1075.207 }, { "epoch": 0.1390947990116314, "grad_norm": 0.27151378989219666, "learning_rate": 8.480801335559267e-05, "loss": 0.6937, "num_input_tokens_seen": 4749468, "step": 1731, "train_runtime": 4416.9781, "train_tokens_per_second": 1075.275 }, { "epoch": 0.13917515418148216, "grad_norm": 0.32051900029182434, "learning_rate": 8.474123539232054e-05, "loss": 0.9629, "num_input_tokens_seen": 4751234, "step": 1732, "train_runtime": 4418.69, "train_tokens_per_second": 1075.259 }, { "epoch": 0.13925550935133288, "grad_norm": 0.32169175148010254, "learning_rate": 8.467445742904841e-05, "loss": 0.8266, "num_input_tokens_seen": 4754098, "step": 1733, "train_runtime": 4421.0239, "train_tokens_per_second": 1075.339 }, { "epoch": 0.13933586452118363, "grad_norm": 0.26191744208335876, "learning_rate": 8.46076794657763e-05, "loss": 0.5521, "num_input_tokens_seen": 4757408, "step": 1734, "train_runtime": 4423.5117, "train_tokens_per_second": 1075.482 }, { "epoch": 0.13941621969103438, "grad_norm": 0.3420778512954712, "learning_rate": 8.454090150250417e-05, "loss": 1.0926, "num_input_tokens_seen": 4759564, "step": 1735, "train_runtime": 4425.3401, "train_tokens_per_second": 1075.525 }, { "epoch": 0.13949657486088513, "grad_norm": 0.367861270904541, "learning_rate": 8.447412353923206e-05, "loss": 0.7912, "num_input_tokens_seen": 4762880, "step": 1736, "train_runtime": 4427.8488, "train_tokens_per_second": 1075.665 }, { "epoch": 0.13957693003073585, "grad_norm": 0.2986046075820923, "learning_rate": 8.440734557595994e-05, "loss": 0.7877, "num_input_tokens_seen": 4765186, "step": 1737, "train_runtime": 4429.9083, "train_tokens_per_second": 1075.685 }, { "epoch": 0.1396572852005866, "grad_norm": 0.37660762667655945, "learning_rate": 8.434056761268782e-05, "loss": 1.1873, "num_input_tokens_seen": 4767038, "step": 1738, "train_runtime": 4431.7161, "train_tokens_per_second": 1075.664 }, { "epoch": 0.13973764037043734, "grad_norm": 0.33014607429504395, "learning_rate": 8.42737896494157e-05, "loss": 1.203, "num_input_tokens_seen": 4768766, "step": 1739, "train_runtime": 4433.3984, "train_tokens_per_second": 1075.646 }, { "epoch": 0.13981799554028806, "grad_norm": 0.32945960760116577, "learning_rate": 8.420701168614358e-05, "loss": 0.875, "num_input_tokens_seen": 4771482, "step": 1740, "train_runtime": 4435.5963, "train_tokens_per_second": 1075.725 }, { "epoch": 0.1398983507101388, "grad_norm": 0.25348135828971863, "learning_rate": 8.414023372287145e-05, "loss": 0.699, "num_input_tokens_seen": 4773254, "step": 1741, "train_runtime": 4439.3401, "train_tokens_per_second": 1075.217 }, { "epoch": 0.13997870587998956, "grad_norm": 0.3237021565437317, "learning_rate": 8.407345575959934e-05, "loss": 0.934, "num_input_tokens_seen": 4775682, "step": 1742, "train_runtime": 4441.4177, "train_tokens_per_second": 1075.261 }, { "epoch": 0.14005906104984028, "grad_norm": 0.26454129815101624, "learning_rate": 8.400667779632721e-05, "loss": 0.931, "num_input_tokens_seen": 4778738, "step": 1743, "train_runtime": 4443.7954, "train_tokens_per_second": 1075.373 }, { "epoch": 0.14013941621969103, "grad_norm": 0.4479910731315613, "learning_rate": 8.39398998330551e-05, "loss": 0.9491, "num_input_tokens_seen": 4781942, "step": 1744, "train_runtime": 4446.353, "train_tokens_per_second": 1075.475 }, { "epoch": 0.14021977138954178, "grad_norm": 0.3604801297187805, "learning_rate": 8.387312186978298e-05, "loss": 1.2846, "num_input_tokens_seen": 4784942, "step": 1745, "train_runtime": 4448.6614, "train_tokens_per_second": 1075.591 }, { "epoch": 0.1403001265593925, "grad_norm": 0.28335997462272644, "learning_rate": 8.380634390651086e-05, "loss": 1.0659, "num_input_tokens_seen": 4787498, "step": 1746, "train_runtime": 4450.7215, "train_tokens_per_second": 1075.668 }, { "epoch": 0.14038048172924325, "grad_norm": 0.2960796654224396, "learning_rate": 8.373956594323874e-05, "loss": 0.8629, "num_input_tokens_seen": 4789710, "step": 1747, "train_runtime": 4452.6173, "train_tokens_per_second": 1075.707 }, { "epoch": 0.140460836899094, "grad_norm": 0.2844523787498474, "learning_rate": 8.367278797996662e-05, "loss": 0.9802, "num_input_tokens_seen": 4793382, "step": 1748, "train_runtime": 4455.2906, "train_tokens_per_second": 1075.885 }, { "epoch": 0.14054119206894475, "grad_norm": 0.3542284071445465, "learning_rate": 8.360601001669449e-05, "loss": 0.9333, "num_input_tokens_seen": 4795896, "step": 1749, "train_runtime": 4457.3781, "train_tokens_per_second": 1075.946 }, { "epoch": 0.14062154723879547, "grad_norm": 0.37776631116867065, "learning_rate": 8.353923205342238e-05, "loss": 0.9041, "num_input_tokens_seen": 4798136, "step": 1750, "train_runtime": 4459.3767, "train_tokens_per_second": 1075.966 }, { "epoch": 0.14070190240864622, "grad_norm": 0.31492453813552856, "learning_rate": 8.347245409015025e-05, "loss": 0.9638, "num_input_tokens_seen": 4801146, "step": 1751, "train_runtime": 4461.7929, "train_tokens_per_second": 1076.058 }, { "epoch": 0.14078225757849697, "grad_norm": 0.3911091983318329, "learning_rate": 8.340567612687812e-05, "loss": 1.0243, "num_input_tokens_seen": 4803740, "step": 1752, "train_runtime": 4463.8089, "train_tokens_per_second": 1076.153 }, { "epoch": 0.1408626127483477, "grad_norm": 0.36505600810050964, "learning_rate": 8.333889816360601e-05, "loss": 1.0655, "num_input_tokens_seen": 4805340, "step": 1753, "train_runtime": 4465.4437, "train_tokens_per_second": 1076.117 }, { "epoch": 0.14094296791819844, "grad_norm": 0.3208926320075989, "learning_rate": 8.32721202003339e-05, "loss": 1.1023, "num_input_tokens_seen": 4807752, "step": 1754, "train_runtime": 4467.47, "train_tokens_per_second": 1076.169 }, { "epoch": 0.14102332308804919, "grad_norm": 0.3210667073726654, "learning_rate": 8.320534223706178e-05, "loss": 1.0684, "num_input_tokens_seen": 4810732, "step": 1755, "train_runtime": 4469.735, "train_tokens_per_second": 1076.29 }, { "epoch": 0.1411036782578999, "grad_norm": 0.3312217891216278, "learning_rate": 8.313856427378966e-05, "loss": 0.969, "num_input_tokens_seen": 4813090, "step": 1756, "train_runtime": 4471.6076, "train_tokens_per_second": 1076.367 }, { "epoch": 0.14118403342775065, "grad_norm": 0.35422152280807495, "learning_rate": 8.307178631051753e-05, "loss": 0.5602, "num_input_tokens_seen": 4815772, "step": 1757, "train_runtime": 4473.749, "train_tokens_per_second": 1076.451 }, { "epoch": 0.1412643885976014, "grad_norm": 0.3862323462963104, "learning_rate": 8.300500834724542e-05, "loss": 1.0834, "num_input_tokens_seen": 4818168, "step": 1758, "train_runtime": 4475.8021, "train_tokens_per_second": 1076.493 }, { "epoch": 0.14134474376745215, "grad_norm": 0.28599441051483154, "learning_rate": 8.293823038397329e-05, "loss": 0.7657, "num_input_tokens_seen": 4820946, "step": 1759, "train_runtime": 4477.9166, "train_tokens_per_second": 1076.605 }, { "epoch": 0.14142509893730287, "grad_norm": 0.25712910294532776, "learning_rate": 8.287145242070116e-05, "loss": 0.9001, "num_input_tokens_seen": 4823344, "step": 1760, "train_runtime": 4479.8492, "train_tokens_per_second": 1076.676 }, { "epoch": 0.14150545410715362, "grad_norm": 0.24105006456375122, "learning_rate": 8.280467445742905e-05, "loss": 1.2903, "num_input_tokens_seen": 4828096, "step": 1761, "train_runtime": 4483.2322, "train_tokens_per_second": 1076.923 }, { "epoch": 0.14158580927700437, "grad_norm": 0.42079001665115356, "learning_rate": 8.273789649415694e-05, "loss": 1.2758, "num_input_tokens_seen": 4829848, "step": 1762, "train_runtime": 4484.9746, "train_tokens_per_second": 1076.895 }, { "epoch": 0.1416661644468551, "grad_norm": 0.2710529565811157, "learning_rate": 8.267111853088482e-05, "loss": 1.0162, "num_input_tokens_seen": 4832462, "step": 1763, "train_runtime": 4487.0989, "train_tokens_per_second": 1076.968 }, { "epoch": 0.14174651961670584, "grad_norm": 0.27971163392066956, "learning_rate": 8.26043405676127e-05, "loss": 1.0044, "num_input_tokens_seen": 4834896, "step": 1764, "train_runtime": 4489.1525, "train_tokens_per_second": 1077.018 }, { "epoch": 0.1418268747865566, "grad_norm": 0.3546024560928345, "learning_rate": 8.253756260434057e-05, "loss": 1.0111, "num_input_tokens_seen": 4836672, "step": 1765, "train_runtime": 4490.9071, "train_tokens_per_second": 1076.992 }, { "epoch": 0.1419072299564073, "grad_norm": 0.3018425703048706, "learning_rate": 8.247078464106846e-05, "loss": 0.9991, "num_input_tokens_seen": 4838946, "step": 1766, "train_runtime": 4492.8314, "train_tokens_per_second": 1077.037 }, { "epoch": 0.14198758512625806, "grad_norm": 0.25082850456237793, "learning_rate": 8.240400667779633e-05, "loss": 0.7473, "num_input_tokens_seen": 4841088, "step": 1767, "train_runtime": 4494.7616, "train_tokens_per_second": 1077.051 }, { "epoch": 0.1420679402961088, "grad_norm": 0.29914844036102295, "learning_rate": 8.23372287145242e-05, "loss": 1.209, "num_input_tokens_seen": 4844314, "step": 1768, "train_runtime": 4497.1685, "train_tokens_per_second": 1077.192 }, { "epoch": 0.14214829546595953, "grad_norm": 0.29812729358673096, "learning_rate": 8.227045075125209e-05, "loss": 1.0831, "num_input_tokens_seen": 4845794, "step": 1769, "train_runtime": 4498.8471, "train_tokens_per_second": 1077.119 }, { "epoch": 0.14222865063581028, "grad_norm": 0.30985888838768005, "learning_rate": 8.220367278797996e-05, "loss": 1.0373, "num_input_tokens_seen": 4849466, "step": 1770, "train_runtime": 4501.6246, "train_tokens_per_second": 1077.27 }, { "epoch": 0.14230900580566103, "grad_norm": 0.2536572813987732, "learning_rate": 8.213689482470785e-05, "loss": 0.9653, "num_input_tokens_seen": 4852044, "step": 1771, "train_runtime": 4506.0357, "train_tokens_per_second": 1076.788 }, { "epoch": 0.14238936097551178, "grad_norm": 0.4140840172767639, "learning_rate": 8.207011686143574e-05, "loss": 0.8622, "num_input_tokens_seen": 4853508, "step": 1772, "train_runtime": 4507.621, "train_tokens_per_second": 1076.734 }, { "epoch": 0.1424697161453625, "grad_norm": 0.391434907913208, "learning_rate": 8.200333889816361e-05, "loss": 1.3303, "num_input_tokens_seen": 4854818, "step": 1773, "train_runtime": 4509.1771, "train_tokens_per_second": 1076.653 }, { "epoch": 0.14255007131521324, "grad_norm": 0.29283902049064636, "learning_rate": 8.19365609348915e-05, "loss": 1.0958, "num_input_tokens_seen": 4856784, "step": 1774, "train_runtime": 4510.9736, "train_tokens_per_second": 1076.66 }, { "epoch": 0.142630426485064, "grad_norm": 0.30271488428115845, "learning_rate": 8.186978297161937e-05, "loss": 0.9557, "num_input_tokens_seen": 4859568, "step": 1775, "train_runtime": 4513.2247, "train_tokens_per_second": 1076.74 }, { "epoch": 0.14271078165491471, "grad_norm": 0.31910306215286255, "learning_rate": 8.180300500834724e-05, "loss": 1.0811, "num_input_tokens_seen": 4860940, "step": 1776, "train_runtime": 4514.7818, "train_tokens_per_second": 1076.672 }, { "epoch": 0.14279113682476546, "grad_norm": 0.290634423494339, "learning_rate": 8.173622704507513e-05, "loss": 1.0577, "num_input_tokens_seen": 4863640, "step": 1777, "train_runtime": 4516.9902, "train_tokens_per_second": 1076.744 }, { "epoch": 0.1428714919946162, "grad_norm": 0.3327615559101105, "learning_rate": 8.1669449081803e-05, "loss": 0.7974, "num_input_tokens_seen": 4866062, "step": 1778, "train_runtime": 4518.9905, "train_tokens_per_second": 1076.803 }, { "epoch": 0.14295184716446693, "grad_norm": 0.2692924737930298, "learning_rate": 8.160267111853089e-05, "loss": 0.8588, "num_input_tokens_seen": 4868934, "step": 1779, "train_runtime": 4521.2411, "train_tokens_per_second": 1076.902 }, { "epoch": 0.14303220233431768, "grad_norm": 0.3325542211532593, "learning_rate": 8.153589315525877e-05, "loss": 1.0313, "num_input_tokens_seen": 4871290, "step": 1780, "train_runtime": 4523.2753, "train_tokens_per_second": 1076.939 }, { "epoch": 0.14311255750416843, "grad_norm": 0.32254281640052795, "learning_rate": 8.146911519198665e-05, "loss": 0.9361, "num_input_tokens_seen": 4873974, "step": 1781, "train_runtime": 4525.3971, "train_tokens_per_second": 1077.027 }, { "epoch": 0.14319291267401915, "grad_norm": 0.31965771317481995, "learning_rate": 8.140233722871453e-05, "loss": 0.5854, "num_input_tokens_seen": 4876116, "step": 1782, "train_runtime": 4527.3632, "train_tokens_per_second": 1077.032 }, { "epoch": 0.1432732678438699, "grad_norm": 0.2537826597690582, "learning_rate": 8.133555926544241e-05, "loss": 0.7571, "num_input_tokens_seen": 4878490, "step": 1783, "train_runtime": 4529.4171, "train_tokens_per_second": 1077.068 }, { "epoch": 0.14335362301372065, "grad_norm": 0.3414912521839142, "learning_rate": 8.126878130217028e-05, "loss": 0.8181, "num_input_tokens_seen": 4880758, "step": 1784, "train_runtime": 4531.3433, "train_tokens_per_second": 1077.111 }, { "epoch": 0.1434339781835714, "grad_norm": 0.3281090259552002, "learning_rate": 8.120200333889817e-05, "loss": 0.8966, "num_input_tokens_seen": 4882458, "step": 1785, "train_runtime": 4533.0136, "train_tokens_per_second": 1077.089 }, { "epoch": 0.14351433335342212, "grad_norm": 0.33726608753204346, "learning_rate": 8.113522537562604e-05, "loss": 0.7388, "num_input_tokens_seen": 4884796, "step": 1786, "train_runtime": 4535.0516, "train_tokens_per_second": 1077.12 }, { "epoch": 0.14359468852327287, "grad_norm": 0.3633520007133484, "learning_rate": 8.106844741235393e-05, "loss": 0.9775, "num_input_tokens_seen": 4887166, "step": 1787, "train_runtime": 4537.061, "train_tokens_per_second": 1077.166 }, { "epoch": 0.14367504369312362, "grad_norm": 0.3352885842323303, "learning_rate": 8.10016694490818e-05, "loss": 0.7796, "num_input_tokens_seen": 4888628, "step": 1788, "train_runtime": 4538.6449, "train_tokens_per_second": 1077.112 }, { "epoch": 0.14375539886297434, "grad_norm": 0.39273911714553833, "learning_rate": 8.093489148580969e-05, "loss": 1.0027, "num_input_tokens_seen": 4893330, "step": 1789, "train_runtime": 4541.9119, "train_tokens_per_second": 1077.372 }, { "epoch": 0.14383575403282509, "grad_norm": 0.293765664100647, "learning_rate": 8.086811352253757e-05, "loss": 1.0126, "num_input_tokens_seen": 4895868, "step": 1790, "train_runtime": 4544.0354, "train_tokens_per_second": 1077.427 }, { "epoch": 0.14391610920267583, "grad_norm": 0.4194832444190979, "learning_rate": 8.080133555926545e-05, "loss": 0.8635, "num_input_tokens_seen": 4897834, "step": 1791, "train_runtime": 4545.8162, "train_tokens_per_second": 1077.438 }, { "epoch": 0.14399646437252656, "grad_norm": 0.3623499572277069, "learning_rate": 8.073455759599332e-05, "loss": 0.8487, "num_input_tokens_seen": 4900016, "step": 1792, "train_runtime": 4547.7089, "train_tokens_per_second": 1077.469 }, { "epoch": 0.1440768195423773, "grad_norm": 0.32666507363319397, "learning_rate": 8.066777963272121e-05, "loss": 0.9051, "num_input_tokens_seen": 4903478, "step": 1793, "train_runtime": 4550.281, "train_tokens_per_second": 1077.621 }, { "epoch": 0.14415717471222805, "grad_norm": 0.33514103293418884, "learning_rate": 8.060100166944908e-05, "loss": 1.1268, "num_input_tokens_seen": 4906908, "step": 1794, "train_runtime": 4552.9085, "train_tokens_per_second": 1077.752 }, { "epoch": 0.1442375298820788, "grad_norm": 0.3593701422214508, "learning_rate": 8.053422370617697e-05, "loss": 0.8101, "num_input_tokens_seen": 4909098, "step": 1795, "train_runtime": 4554.9556, "train_tokens_per_second": 1077.749 }, { "epoch": 0.14431788505192952, "grad_norm": 0.687896192073822, "learning_rate": 8.046744574290484e-05, "loss": 0.723, "num_input_tokens_seen": 4910916, "step": 1796, "train_runtime": 4556.7513, "train_tokens_per_second": 1077.723 }, { "epoch": 0.14439824022178027, "grad_norm": 0.4509037733078003, "learning_rate": 8.040066777963273e-05, "loss": 0.6966, "num_input_tokens_seen": 4912680, "step": 1797, "train_runtime": 4558.4128, "train_tokens_per_second": 1077.717 }, { "epoch": 0.14447859539163102, "grad_norm": 0.3475772440433502, "learning_rate": 8.033388981636061e-05, "loss": 1.0005, "num_input_tokens_seen": 4915064, "step": 1798, "train_runtime": 4560.4283, "train_tokens_per_second": 1077.764 }, { "epoch": 0.14455895056148174, "grad_norm": 0.33785468339920044, "learning_rate": 8.026711185308849e-05, "loss": 1.1092, "num_input_tokens_seen": 4916788, "step": 1799, "train_runtime": 4562.1033, "train_tokens_per_second": 1077.746 }, { "epoch": 0.1446393057313325, "grad_norm": 0.3122391998767853, "learning_rate": 8.020033388981636e-05, "loss": 0.9636, "num_input_tokens_seen": 4918674, "step": 1800, "train_runtime": 4563.8036, "train_tokens_per_second": 1077.758 }, { "epoch": 0.1446393057313325, "eval_loss": 0.9616109728813171, "eval_runtime": 92.1343, "eval_samples_per_second": 10.789, "eval_steps_per_second": 5.394, "num_input_tokens_seen": 4918674, "step": 1800 }, { "epoch": 0.14471966090118324, "grad_norm": 0.41370221972465515, "learning_rate": 8.013355592654425e-05, "loss": 1.2713, "num_input_tokens_seen": 4921512, "step": 1801, "train_runtime": 4660.2677, "train_tokens_per_second": 1056.058 }, { "epoch": 0.14480001607103396, "grad_norm": 0.2980494499206543, "learning_rate": 8.006677796327212e-05, "loss": 0.6827, "num_input_tokens_seen": 4924550, "step": 1802, "train_runtime": 4662.5942, "train_tokens_per_second": 1056.182 }, { "epoch": 0.1448803712408847, "grad_norm": 0.33906808495521545, "learning_rate": 8e-05, "loss": 1.1137, "num_input_tokens_seen": 4928058, "step": 1803, "train_runtime": 4665.1979, "train_tokens_per_second": 1056.345 }, { "epoch": 0.14496072641073546, "grad_norm": 0.31733813881874084, "learning_rate": 7.993322203672788e-05, "loss": 0.8569, "num_input_tokens_seen": 4930166, "step": 1804, "train_runtime": 4667.0501, "train_tokens_per_second": 1056.377 }, { "epoch": 0.14504108158058618, "grad_norm": 0.33354100584983826, "learning_rate": 7.986644407345575e-05, "loss": 0.8129, "num_input_tokens_seen": 4933748, "step": 1805, "train_runtime": 4669.7004, "train_tokens_per_second": 1056.545 }, { "epoch": 0.14512143675043693, "grad_norm": 0.2890450358390808, "learning_rate": 7.979966611018364e-05, "loss": 1.1081, "num_input_tokens_seen": 4936598, "step": 1806, "train_runtime": 4671.9897, "train_tokens_per_second": 1056.637 }, { "epoch": 0.14520179192028768, "grad_norm": 0.3265434205532074, "learning_rate": 7.973288814691153e-05, "loss": 0.9386, "num_input_tokens_seen": 4939290, "step": 1807, "train_runtime": 4674.1162, "train_tokens_per_second": 1056.732 }, { "epoch": 0.14528214709013842, "grad_norm": 0.31261536478996277, "learning_rate": 7.96661101836394e-05, "loss": 0.8162, "num_input_tokens_seen": 4942706, "step": 1808, "train_runtime": 4676.5737, "train_tokens_per_second": 1056.908 }, { "epoch": 0.14536250225998915, "grad_norm": 0.38988253474235535, "learning_rate": 7.959933222036729e-05, "loss": 0.9918, "num_input_tokens_seen": 4944108, "step": 1809, "train_runtime": 4678.1623, "train_tokens_per_second": 1056.848 }, { "epoch": 0.1454428574298399, "grad_norm": 0.30823296308517456, "learning_rate": 7.953255425709516e-05, "loss": 1.1804, "num_input_tokens_seen": 4947164, "step": 1810, "train_runtime": 4680.5276, "train_tokens_per_second": 1056.967 }, { "epoch": 0.14552321259969064, "grad_norm": 0.33548760414123535, "learning_rate": 7.946577629382305e-05, "loss": 0.9968, "num_input_tokens_seen": 4950030, "step": 1811, "train_runtime": 4682.8149, "train_tokens_per_second": 1057.063 }, { "epoch": 0.14560356776954136, "grad_norm": 0.32266977429389954, "learning_rate": 7.939899833055092e-05, "loss": 0.7696, "num_input_tokens_seen": 4951992, "step": 1812, "train_runtime": 4684.5912, "train_tokens_per_second": 1057.081 }, { "epoch": 0.1456839229393921, "grad_norm": 0.33458128571510315, "learning_rate": 7.933222036727879e-05, "loss": 0.8766, "num_input_tokens_seen": 4953388, "step": 1813, "train_runtime": 4686.1652, "train_tokens_per_second": 1057.024 }, { "epoch": 0.14576427810924286, "grad_norm": 0.34393540024757385, "learning_rate": 7.926544240400668e-05, "loss": 1.0121, "num_input_tokens_seen": 4955168, "step": 1814, "train_runtime": 4687.8651, "train_tokens_per_second": 1057.02 }, { "epoch": 0.14584463327909358, "grad_norm": 0.38021495938301086, "learning_rate": 7.919866444073457e-05, "loss": 0.9994, "num_input_tokens_seen": 4957354, "step": 1815, "train_runtime": 4689.8823, "train_tokens_per_second": 1057.032 }, { "epoch": 0.14592498844894433, "grad_norm": 0.27749598026275635, "learning_rate": 7.913188647746244e-05, "loss": 0.8157, "num_input_tokens_seen": 4961082, "step": 1816, "train_runtime": 4692.5458, "train_tokens_per_second": 1057.226 }, { "epoch": 0.14600534361879508, "grad_norm": 0.3151441812515259, "learning_rate": 7.906510851419033e-05, "loss": 0.793, "num_input_tokens_seen": 4962698, "step": 1817, "train_runtime": 4694.1284, "train_tokens_per_second": 1057.214 }, { "epoch": 0.1460856987886458, "grad_norm": 0.27059224247932434, "learning_rate": 7.89983305509182e-05, "loss": 0.892, "num_input_tokens_seen": 4964792, "step": 1818, "train_runtime": 4695.8982, "train_tokens_per_second": 1057.261 }, { "epoch": 0.14616605395849655, "grad_norm": 0.2897622287273407, "learning_rate": 7.893155258764609e-05, "loss": 0.7819, "num_input_tokens_seen": 4966272, "step": 1819, "train_runtime": 4697.4694, "train_tokens_per_second": 1057.223 }, { "epoch": 0.1462464091283473, "grad_norm": 0.27906838059425354, "learning_rate": 7.886477462437396e-05, "loss": 0.7947, "num_input_tokens_seen": 4969124, "step": 1820, "train_runtime": 4699.7433, "train_tokens_per_second": 1057.318 }, { "epoch": 0.14632676429819805, "grad_norm": 0.28144511580467224, "learning_rate": 7.879799666110183e-05, "loss": 0.5762, "num_input_tokens_seen": 4971258, "step": 1821, "train_runtime": 4701.5203, "train_tokens_per_second": 1057.372 }, { "epoch": 0.14640711946804877, "grad_norm": 0.2370944321155548, "learning_rate": 7.873121869782972e-05, "loss": 0.8168, "num_input_tokens_seen": 4973386, "step": 1822, "train_runtime": 4703.4156, "train_tokens_per_second": 1057.399 }, { "epoch": 0.14648747463789952, "grad_norm": 0.3134889304637909, "learning_rate": 7.86644407345576e-05, "loss": 0.8297, "num_input_tokens_seen": 4975456, "step": 1823, "train_runtime": 4705.2445, "train_tokens_per_second": 1057.428 }, { "epoch": 0.14656782980775027, "grad_norm": 0.3657674193382263, "learning_rate": 7.859766277128548e-05, "loss": 1.0269, "num_input_tokens_seen": 4978124, "step": 1824, "train_runtime": 4707.3684, "train_tokens_per_second": 1057.517 }, { "epoch": 0.146648184977601, "grad_norm": 0.3408898115158081, "learning_rate": 7.853088480801337e-05, "loss": 1.0257, "num_input_tokens_seen": 4980896, "step": 1825, "train_runtime": 4709.5561, "train_tokens_per_second": 1057.615 }, { "epoch": 0.14672854014745174, "grad_norm": 0.32894331216812134, "learning_rate": 7.846410684474124e-05, "loss": 1.1435, "num_input_tokens_seen": 4984224, "step": 1826, "train_runtime": 4712.0255, "train_tokens_per_second": 1057.767 }, { "epoch": 0.14680889531730248, "grad_norm": 0.4239885210990906, "learning_rate": 7.839732888146912e-05, "loss": 0.7581, "num_input_tokens_seen": 4986756, "step": 1827, "train_runtime": 4714.1954, "train_tokens_per_second": 1057.817 }, { "epoch": 0.1468892504871532, "grad_norm": 0.2986898720264435, "learning_rate": 7.8330550918197e-05, "loss": 0.8127, "num_input_tokens_seen": 4988648, "step": 1828, "train_runtime": 4716.011, "train_tokens_per_second": 1057.811 }, { "epoch": 0.14696960565700395, "grad_norm": 0.379794180393219, "learning_rate": 7.826377295492487e-05, "loss": 1.0461, "num_input_tokens_seen": 4991768, "step": 1829, "train_runtime": 4718.4877, "train_tokens_per_second": 1057.917 }, { "epoch": 0.1470499608268547, "grad_norm": 0.3045078217983246, "learning_rate": 7.819699499165276e-05, "loss": 0.9049, "num_input_tokens_seen": 4994264, "step": 1830, "train_runtime": 4720.4511, "train_tokens_per_second": 1058.006 }, { "epoch": 0.14713031599670545, "grad_norm": 0.2988998293876648, "learning_rate": 7.813021702838063e-05, "loss": 1.097, "num_input_tokens_seen": 4996932, "step": 1831, "train_runtime": 4724.7509, "train_tokens_per_second": 1057.608 }, { "epoch": 0.14721067116655617, "grad_norm": 0.3512405753135681, "learning_rate": 7.806343906510852e-05, "loss": 1.1671, "num_input_tokens_seen": 4999478, "step": 1832, "train_runtime": 4726.8514, "train_tokens_per_second": 1057.676 }, { "epoch": 0.14729102633640692, "grad_norm": 0.2384834587574005, "learning_rate": 7.79966611018364e-05, "loss": 0.6767, "num_input_tokens_seen": 5002526, "step": 1833, "train_runtime": 4729.108, "train_tokens_per_second": 1057.816 }, { "epoch": 0.14737138150625767, "grad_norm": 0.35167041420936584, "learning_rate": 7.792988313856428e-05, "loss": 0.8955, "num_input_tokens_seen": 5006018, "step": 1834, "train_runtime": 4731.8312, "train_tokens_per_second": 1057.945 }, { "epoch": 0.1474517366761084, "grad_norm": 0.31407415866851807, "learning_rate": 7.786310517529216e-05, "loss": 1.0368, "num_input_tokens_seen": 5008698, "step": 1835, "train_runtime": 4733.9481, "train_tokens_per_second": 1058.038 }, { "epoch": 0.14753209184595914, "grad_norm": 0.31917980313301086, "learning_rate": 7.779632721202004e-05, "loss": 1.2385, "num_input_tokens_seen": 5011016, "step": 1836, "train_runtime": 4735.9331, "train_tokens_per_second": 1058.084 }, { "epoch": 0.1476124470158099, "grad_norm": 0.36754271388053894, "learning_rate": 7.772954924874791e-05, "loss": 1.2063, "num_input_tokens_seen": 5013288, "step": 1837, "train_runtime": 4737.9122, "train_tokens_per_second": 1058.122 }, { "epoch": 0.1476928021856606, "grad_norm": 0.398705393075943, "learning_rate": 7.76627712854758e-05, "loss": 0.8671, "num_input_tokens_seen": 5016040, "step": 1838, "train_runtime": 4740.1781, "train_tokens_per_second": 1058.197 }, { "epoch": 0.14777315735551136, "grad_norm": 0.2788223624229431, "learning_rate": 7.759599332220367e-05, "loss": 0.8191, "num_input_tokens_seen": 5018418, "step": 1839, "train_runtime": 4742.2362, "train_tokens_per_second": 1058.239 }, { "epoch": 0.1478535125253621, "grad_norm": 0.2603667080402374, "learning_rate": 7.752921535893156e-05, "loss": 0.6136, "num_input_tokens_seen": 5021834, "step": 1840, "train_runtime": 4744.9004, "train_tokens_per_second": 1058.364 }, { "epoch": 0.14793386769521283, "grad_norm": 0.4340488016605377, "learning_rate": 7.746243739565944e-05, "loss": 1.17, "num_input_tokens_seen": 5023670, "step": 1841, "train_runtime": 4746.706, "train_tokens_per_second": 1058.349 }, { "epoch": 0.14801422286506358, "grad_norm": 0.3422788679599762, "learning_rate": 7.739565943238732e-05, "loss": 1.1022, "num_input_tokens_seen": 5027296, "step": 1842, "train_runtime": 4749.4105, "train_tokens_per_second": 1058.509 }, { "epoch": 0.14809457803491433, "grad_norm": 0.3044053018093109, "learning_rate": 7.73288814691152e-05, "loss": 0.7276, "num_input_tokens_seen": 5030706, "step": 1843, "train_runtime": 4752.0853, "train_tokens_per_second": 1058.631 }, { "epoch": 0.14817493320476507, "grad_norm": 0.3811112642288208, "learning_rate": 7.726210350584308e-05, "loss": 1.1837, "num_input_tokens_seen": 5032990, "step": 1844, "train_runtime": 4754.0788, "train_tokens_per_second": 1058.668 }, { "epoch": 0.1482552883746158, "grad_norm": 0.3198108375072479, "learning_rate": 7.719532554257095e-05, "loss": 0.9298, "num_input_tokens_seen": 5036188, "step": 1845, "train_runtime": 4756.5978, "train_tokens_per_second": 1058.779 }, { "epoch": 0.14833564354446654, "grad_norm": 0.3088493347167969, "learning_rate": 7.712854757929884e-05, "loss": 0.9046, "num_input_tokens_seen": 5038732, "step": 1846, "train_runtime": 4758.6419, "train_tokens_per_second": 1058.859 }, { "epoch": 0.1484159987143173, "grad_norm": 0.3104758858680725, "learning_rate": 7.706176961602671e-05, "loss": 0.9043, "num_input_tokens_seen": 5042912, "step": 1847, "train_runtime": 4761.5946, "train_tokens_per_second": 1059.08 }, { "epoch": 0.14849635388416801, "grad_norm": 0.39914751052856445, "learning_rate": 7.69949916527546e-05, "loss": 1.0854, "num_input_tokens_seen": 5045060, "step": 1848, "train_runtime": 4763.5631, "train_tokens_per_second": 1059.094 }, { "epoch": 0.14857670905401876, "grad_norm": 0.28599026799201965, "learning_rate": 7.692821368948247e-05, "loss": 0.6572, "num_input_tokens_seen": 5047270, "step": 1849, "train_runtime": 4765.5135, "train_tokens_per_second": 1059.124 }, { "epoch": 0.1486570642238695, "grad_norm": 0.3523062467575073, "learning_rate": 7.686143572621036e-05, "loss": 1.0561, "num_input_tokens_seen": 5049036, "step": 1850, "train_runtime": 4767.2338, "train_tokens_per_second": 1059.112 }, { "epoch": 0.14873741939372023, "grad_norm": 0.34514477849006653, "learning_rate": 7.679465776293824e-05, "loss": 0.9255, "num_input_tokens_seen": 5052864, "step": 1851, "train_runtime": 4770.0394, "train_tokens_per_second": 1059.292 }, { "epoch": 0.14881777456357098, "grad_norm": 0.27023229002952576, "learning_rate": 7.672787979966612e-05, "loss": 0.7405, "num_input_tokens_seen": 5055216, "step": 1852, "train_runtime": 4771.9484, "train_tokens_per_second": 1059.361 }, { "epoch": 0.14889812973342173, "grad_norm": 0.3530409038066864, "learning_rate": 7.666110183639399e-05, "loss": 0.934, "num_input_tokens_seen": 5057806, "step": 1853, "train_runtime": 4774.1141, "train_tokens_per_second": 1059.423 }, { "epoch": 0.14897848490327245, "grad_norm": 0.29033932089805603, "learning_rate": 7.659432387312188e-05, "loss": 0.6937, "num_input_tokens_seen": 5059462, "step": 1854, "train_runtime": 4775.712, "train_tokens_per_second": 1059.415 }, { "epoch": 0.1490588400731232, "grad_norm": 0.3162938058376312, "learning_rate": 7.652754590984975e-05, "loss": 1.2512, "num_input_tokens_seen": 5062448, "step": 1855, "train_runtime": 4778.0421, "train_tokens_per_second": 1059.524 }, { "epoch": 0.14913919524297395, "grad_norm": 0.33358120918273926, "learning_rate": 7.646076794657764e-05, "loss": 0.9231, "num_input_tokens_seen": 5065472, "step": 1856, "train_runtime": 4780.3905, "train_tokens_per_second": 1059.636 }, { "epoch": 0.1492195504128247, "grad_norm": 0.39617830514907837, "learning_rate": 7.639398998330551e-05, "loss": 1.2502, "num_input_tokens_seen": 5067392, "step": 1857, "train_runtime": 4782.0899, "train_tokens_per_second": 1059.661 }, { "epoch": 0.14929990558267542, "grad_norm": 0.3091368079185486, "learning_rate": 7.63272120200334e-05, "loss": 0.6895, "num_input_tokens_seen": 5070066, "step": 1858, "train_runtime": 4784.1645, "train_tokens_per_second": 1059.76 }, { "epoch": 0.14938026075252617, "grad_norm": 0.28823646903038025, "learning_rate": 7.626043405676128e-05, "loss": 0.914, "num_input_tokens_seen": 5072422, "step": 1859, "train_runtime": 4786.1703, "train_tokens_per_second": 1059.808 }, { "epoch": 0.14946061592237692, "grad_norm": 0.2921087145805359, "learning_rate": 7.619365609348916e-05, "loss": 0.8947, "num_input_tokens_seen": 5075142, "step": 1860, "train_runtime": 4788.3545, "train_tokens_per_second": 1059.893 }, { "epoch": 0.14954097109222764, "grad_norm": 0.31922945380210876, "learning_rate": 7.612687813021703e-05, "loss": 0.8345, "num_input_tokens_seen": 5077324, "step": 1861, "train_runtime": 4792.3665, "train_tokens_per_second": 1059.461 }, { "epoch": 0.14962132626207839, "grad_norm": 0.3315534293651581, "learning_rate": 7.606010016694492e-05, "loss": 0.8381, "num_input_tokens_seen": 5082268, "step": 1862, "train_runtime": 4795.816, "train_tokens_per_second": 1059.73 }, { "epoch": 0.14970168143192913, "grad_norm": 0.2970399558544159, "learning_rate": 7.599332220367279e-05, "loss": 0.8596, "num_input_tokens_seen": 5084770, "step": 1863, "train_runtime": 4797.9035, "train_tokens_per_second": 1059.79 }, { "epoch": 0.14978203660177986, "grad_norm": 0.30772262811660767, "learning_rate": 7.592654424040068e-05, "loss": 0.7521, "num_input_tokens_seen": 5088996, "step": 1864, "train_runtime": 4800.8487, "train_tokens_per_second": 1060.02 }, { "epoch": 0.1498623917716306, "grad_norm": 0.39119404554367065, "learning_rate": 7.585976627712855e-05, "loss": 0.8695, "num_input_tokens_seen": 5091114, "step": 1865, "train_runtime": 4802.7391, "train_tokens_per_second": 1060.044 }, { "epoch": 0.14994274694148135, "grad_norm": 0.3998778462409973, "learning_rate": 7.579298831385642e-05, "loss": 0.9175, "num_input_tokens_seen": 5095358, "step": 1866, "train_runtime": 4805.7097, "train_tokens_per_second": 1060.272 }, { "epoch": 0.15002310211133207, "grad_norm": 0.25680747628211975, "learning_rate": 7.572621035058431e-05, "loss": 0.9966, "num_input_tokens_seen": 5099042, "step": 1867, "train_runtime": 4808.3481, "train_tokens_per_second": 1060.456 }, { "epoch": 0.15010345728118282, "grad_norm": 0.37600386142730713, "learning_rate": 7.56594323873122e-05, "loss": 1.0055, "num_input_tokens_seen": 5100804, "step": 1868, "train_runtime": 4810.0694, "train_tokens_per_second": 1060.443 }, { "epoch": 0.15018381245103357, "grad_norm": 0.3055481016635895, "learning_rate": 7.559265442404007e-05, "loss": 0.8539, "num_input_tokens_seen": 5102828, "step": 1869, "train_runtime": 4811.9025, "train_tokens_per_second": 1060.46 }, { "epoch": 0.15026416762088432, "grad_norm": 0.39110270142555237, "learning_rate": 7.552587646076796e-05, "loss": 1.1043, "num_input_tokens_seen": 5104350, "step": 1870, "train_runtime": 4813.5109, "train_tokens_per_second": 1060.421 }, { "epoch": 0.15034452279073504, "grad_norm": 0.5098723769187927, "learning_rate": 7.545909849749583e-05, "loss": 0.7585, "num_input_tokens_seen": 5110098, "step": 1871, "train_runtime": 4817.4461, "train_tokens_per_second": 1060.748 }, { "epoch": 0.1504248779605858, "grad_norm": 0.316049724817276, "learning_rate": 7.539232053422371e-05, "loss": 1.0061, "num_input_tokens_seen": 5112320, "step": 1872, "train_runtime": 4819.3869, "train_tokens_per_second": 1060.782 }, { "epoch": 0.15050523313043654, "grad_norm": 0.33303219079971313, "learning_rate": 7.532554257095159e-05, "loss": 0.9716, "num_input_tokens_seen": 5114994, "step": 1873, "train_runtime": 4821.6076, "train_tokens_per_second": 1060.848 }, { "epoch": 0.15058558830028726, "grad_norm": 0.38001522421836853, "learning_rate": 7.525876460767946e-05, "loss": 1.1266, "num_input_tokens_seen": 5119332, "step": 1874, "train_runtime": 4824.6852, "train_tokens_per_second": 1061.071 }, { "epoch": 0.150665943470138, "grad_norm": 0.3607804477214813, "learning_rate": 7.519198664440735e-05, "loss": 0.9092, "num_input_tokens_seen": 5121648, "step": 1875, "train_runtime": 4826.657, "train_tokens_per_second": 1061.117 }, { "epoch": 0.15074629863998876, "grad_norm": 0.34840768575668335, "learning_rate": 7.512520868113523e-05, "loss": 1.2315, "num_input_tokens_seen": 5125280, "step": 1876, "train_runtime": 4829.3761, "train_tokens_per_second": 1061.272 }, { "epoch": 0.15082665380983948, "grad_norm": 0.31236961483955383, "learning_rate": 7.505843071786311e-05, "loss": 0.99, "num_input_tokens_seen": 5129068, "step": 1877, "train_runtime": 4832.1284, "train_tokens_per_second": 1061.451 }, { "epoch": 0.15090700897969023, "grad_norm": 0.32192865014076233, "learning_rate": 7.4991652754591e-05, "loss": 0.8144, "num_input_tokens_seen": 5130916, "step": 1878, "train_runtime": 4833.8107, "train_tokens_per_second": 1061.464 }, { "epoch": 0.15098736414954098, "grad_norm": 0.2932069003582001, "learning_rate": 7.492487479131887e-05, "loss": 0.8109, "num_input_tokens_seen": 5132514, "step": 1879, "train_runtime": 4835.5079, "train_tokens_per_second": 1061.422 }, { "epoch": 0.15106771931939172, "grad_norm": 0.3649126887321472, "learning_rate": 7.485809682804675e-05, "loss": 1.0694, "num_input_tokens_seen": 5134464, "step": 1880, "train_runtime": 4837.3481, "train_tokens_per_second": 1061.421 }, { "epoch": 0.15114807448924245, "grad_norm": 0.30628979206085205, "learning_rate": 7.479131886477463e-05, "loss": 0.7232, "num_input_tokens_seen": 5137726, "step": 1881, "train_runtime": 4839.9165, "train_tokens_per_second": 1061.532 }, { "epoch": 0.1512284296590932, "grad_norm": 0.33181437849998474, "learning_rate": 7.47245409015025e-05, "loss": 0.9539, "num_input_tokens_seen": 5143082, "step": 1882, "train_runtime": 4843.794, "train_tokens_per_second": 1061.788 }, { "epoch": 0.15130878482894394, "grad_norm": 0.3224644660949707, "learning_rate": 7.465776293823039e-05, "loss": 0.9683, "num_input_tokens_seen": 5145648, "step": 1883, "train_runtime": 4845.9106, "train_tokens_per_second": 1061.854 }, { "epoch": 0.15138913999879466, "grad_norm": 0.3094010651111603, "learning_rate": 7.459098497495826e-05, "loss": 0.9663, "num_input_tokens_seen": 5148430, "step": 1884, "train_runtime": 4848.1518, "train_tokens_per_second": 1061.937 }, { "epoch": 0.1514694951686454, "grad_norm": 0.37314093112945557, "learning_rate": 7.452420701168615e-05, "loss": 1.1559, "num_input_tokens_seen": 5152000, "step": 1885, "train_runtime": 4850.7413, "train_tokens_per_second": 1062.106 }, { "epoch": 0.15154985033849616, "grad_norm": 0.36039674282073975, "learning_rate": 7.445742904841403e-05, "loss": 1.208, "num_input_tokens_seen": 5153956, "step": 1886, "train_runtime": 4852.6567, "train_tokens_per_second": 1062.09 }, { "epoch": 0.15163020550834688, "grad_norm": 0.3279634118080139, "learning_rate": 7.439065108514191e-05, "loss": 1.1465, "num_input_tokens_seen": 5156578, "step": 1887, "train_runtime": 4854.7492, "train_tokens_per_second": 1062.172 }, { "epoch": 0.15171056067819763, "grad_norm": 0.40980371832847595, "learning_rate": 7.43238731218698e-05, "loss": 1.1245, "num_input_tokens_seen": 5158624, "step": 1888, "train_runtime": 4856.6932, "train_tokens_per_second": 1062.168 }, { "epoch": 0.15179091584804838, "grad_norm": 0.4229605495929718, "learning_rate": 7.425709515859767e-05, "loss": 0.9635, "num_input_tokens_seen": 5161528, "step": 1889, "train_runtime": 4858.962, "train_tokens_per_second": 1062.27 }, { "epoch": 0.1518712710178991, "grad_norm": 0.3345964848995209, "learning_rate": 7.419031719532554e-05, "loss": 0.9265, "num_input_tokens_seen": 5163202, "step": 1890, "train_runtime": 4860.6204, "train_tokens_per_second": 1062.252 }, { "epoch": 0.15195162618774985, "grad_norm": 0.3538210391998291, "learning_rate": 7.412353923205343e-05, "loss": 0.8929, "num_input_tokens_seen": 5165900, "step": 1891, "train_runtime": 4864.9363, "train_tokens_per_second": 1061.864 }, { "epoch": 0.1520319813576006, "grad_norm": 0.38495078682899475, "learning_rate": 7.40567612687813e-05, "loss": 0.8546, "num_input_tokens_seen": 5167566, "step": 1892, "train_runtime": 4866.5927, "train_tokens_per_second": 1061.845 }, { "epoch": 0.15211233652745135, "grad_norm": 0.349223256111145, "learning_rate": 7.398998330550919e-05, "loss": 1.1528, "num_input_tokens_seen": 5170206, "step": 1893, "train_runtime": 4868.7182, "train_tokens_per_second": 1061.923 }, { "epoch": 0.15219269169730207, "grad_norm": 0.3576130270957947, "learning_rate": 7.392320534223707e-05, "loss": 1.0046, "num_input_tokens_seen": 5172036, "step": 1894, "train_runtime": 4870.426, "train_tokens_per_second": 1061.927 }, { "epoch": 0.15227304686715282, "grad_norm": 1.4568307399749756, "learning_rate": 7.385642737896495e-05, "loss": 0.8733, "num_input_tokens_seen": 5175464, "step": 1895, "train_runtime": 4872.9803, "train_tokens_per_second": 1062.074 }, { "epoch": 0.15235340203700357, "grad_norm": 0.29496410489082336, "learning_rate": 7.378964941569283e-05, "loss": 1.0438, "num_input_tokens_seen": 5178876, "step": 1896, "train_runtime": 4875.5744, "train_tokens_per_second": 1062.208 }, { "epoch": 0.1524337572068543, "grad_norm": 0.2935889661312103, "learning_rate": 7.37228714524207e-05, "loss": 1.1221, "num_input_tokens_seen": 5181552, "step": 1897, "train_runtime": 4877.7336, "train_tokens_per_second": 1062.287 }, { "epoch": 0.15251411237670504, "grad_norm": 0.3043937087059021, "learning_rate": 7.365609348914858e-05, "loss": 0.5566, "num_input_tokens_seen": 5184480, "step": 1898, "train_runtime": 4879.9705, "train_tokens_per_second": 1062.4 }, { "epoch": 0.15259446754655578, "grad_norm": 0.2773970067501068, "learning_rate": 7.358931552587647e-05, "loss": 0.8711, "num_input_tokens_seen": 5186758, "step": 1899, "train_runtime": 4881.9367, "train_tokens_per_second": 1062.439 }, { "epoch": 0.1526748227164065, "grad_norm": 0.3039838671684265, "learning_rate": 7.352253756260434e-05, "loss": 0.793, "num_input_tokens_seen": 5189176, "step": 1900, "train_runtime": 4883.9847, "train_tokens_per_second": 1062.488 }, { "epoch": 0.15275517788625725, "grad_norm": 0.25697827339172363, "learning_rate": 7.345575959933221e-05, "loss": 1.0684, "num_input_tokens_seen": 5192512, "step": 1901, "train_runtime": 4886.5191, "train_tokens_per_second": 1062.62 }, { "epoch": 0.152835533056108, "grad_norm": 0.35505983233451843, "learning_rate": 7.33889816360601e-05, "loss": 1.3142, "num_input_tokens_seen": 5193996, "step": 1902, "train_runtime": 4888.0521, "train_tokens_per_second": 1062.59 }, { "epoch": 0.15291588822595872, "grad_norm": 0.3592718243598938, "learning_rate": 7.332220367278799e-05, "loss": 0.7646, "num_input_tokens_seen": 5195492, "step": 1903, "train_runtime": 4889.6754, "train_tokens_per_second": 1062.543 }, { "epoch": 0.15299624339580947, "grad_norm": 0.3807624876499176, "learning_rate": 7.325542570951587e-05, "loss": 0.7792, "num_input_tokens_seen": 5197704, "step": 1904, "train_runtime": 4891.5146, "train_tokens_per_second": 1062.596 }, { "epoch": 0.15307659856566022, "grad_norm": 0.2654176950454712, "learning_rate": 7.318864774624375e-05, "loss": 0.795, "num_input_tokens_seen": 5200306, "step": 1905, "train_runtime": 4893.5224, "train_tokens_per_second": 1062.692 }, { "epoch": 0.15315695373551097, "grad_norm": 0.41271671652793884, "learning_rate": 7.312186978297162e-05, "loss": 1.1301, "num_input_tokens_seen": 5202424, "step": 1906, "train_runtime": 4895.3515, "train_tokens_per_second": 1062.727 }, { "epoch": 0.1532373089053617, "grad_norm": 0.3771877586841583, "learning_rate": 7.30550918196995e-05, "loss": 1.1185, "num_input_tokens_seen": 5204678, "step": 1907, "train_runtime": 4897.2459, "train_tokens_per_second": 1062.777 }, { "epoch": 0.15331766407521244, "grad_norm": 0.3171680271625519, "learning_rate": 7.298831385642738e-05, "loss": 1.1087, "num_input_tokens_seen": 5207316, "step": 1908, "train_runtime": 4899.3389, "train_tokens_per_second": 1062.861 }, { "epoch": 0.1533980192450632, "grad_norm": 0.31542688608169556, "learning_rate": 7.292153589315525e-05, "loss": 0.893, "num_input_tokens_seen": 5210150, "step": 1909, "train_runtime": 4901.5634, "train_tokens_per_second": 1062.957 }, { "epoch": 0.1534783744149139, "grad_norm": 0.343566358089447, "learning_rate": 7.285475792988314e-05, "loss": 0.9828, "num_input_tokens_seen": 5213138, "step": 1910, "train_runtime": 4903.8576, "train_tokens_per_second": 1063.069 }, { "epoch": 0.15355872958476466, "grad_norm": 0.3639136552810669, "learning_rate": 7.278797996661103e-05, "loss": 1.1935, "num_input_tokens_seen": 5216152, "step": 1911, "train_runtime": 4906.1572, "train_tokens_per_second": 1063.185 }, { "epoch": 0.1536390847546154, "grad_norm": 0.3396984040737152, "learning_rate": 7.272120200333891e-05, "loss": 0.9106, "num_input_tokens_seen": 5218510, "step": 1912, "train_runtime": 4908.2123, "train_tokens_per_second": 1063.22 }, { "epoch": 0.15371943992446613, "grad_norm": 0.2760705053806305, "learning_rate": 7.265442404006679e-05, "loss": 1.6664, "num_input_tokens_seen": 5223978, "step": 1913, "train_runtime": 4911.9747, "train_tokens_per_second": 1063.519 }, { "epoch": 0.15379979509431688, "grad_norm": 0.39068683981895447, "learning_rate": 7.258764607679466e-05, "loss": 1.0712, "num_input_tokens_seen": 5228494, "step": 1914, "train_runtime": 4915.1275, "train_tokens_per_second": 1063.756 }, { "epoch": 0.15388015026416763, "grad_norm": 0.36092981696128845, "learning_rate": 7.252086811352255e-05, "loss": 0.9338, "num_input_tokens_seen": 5230158, "step": 1915, "train_runtime": 4916.7702, "train_tokens_per_second": 1063.739 }, { "epoch": 0.15396050543401837, "grad_norm": 0.3354611098766327, "learning_rate": 7.245409015025042e-05, "loss": 0.7635, "num_input_tokens_seen": 5233528, "step": 1916, "train_runtime": 4919.2822, "train_tokens_per_second": 1063.88 }, { "epoch": 0.1540408606038691, "grad_norm": 0.37053558230400085, "learning_rate": 7.238731218697829e-05, "loss": 0.8299, "num_input_tokens_seen": 5236698, "step": 1917, "train_runtime": 4921.8174, "train_tokens_per_second": 1063.976 }, { "epoch": 0.15412121577371984, "grad_norm": 0.28253820538520813, "learning_rate": 7.232053422370618e-05, "loss": 0.8143, "num_input_tokens_seen": 5238578, "step": 1918, "train_runtime": 4923.6118, "train_tokens_per_second": 1063.971 }, { "epoch": 0.1542015709435706, "grad_norm": 0.2893552780151367, "learning_rate": 7.225375626043405e-05, "loss": 0.6788, "num_input_tokens_seen": 5241272, "step": 1919, "train_runtime": 4925.8895, "train_tokens_per_second": 1064.025 }, { "epoch": 0.1542819261134213, "grad_norm": 0.36532264947891235, "learning_rate": 7.218697829716194e-05, "loss": 0.9269, "num_input_tokens_seen": 5242960, "step": 1920, "train_runtime": 4927.6228, "train_tokens_per_second": 1063.994 }, { "epoch": 0.15436228128327206, "grad_norm": 0.28941330313682556, "learning_rate": 7.212020033388982e-05, "loss": 0.8461, "num_input_tokens_seen": 5246010, "step": 1921, "train_runtime": 4931.9946, "train_tokens_per_second": 1063.669 }, { "epoch": 0.1544426364531228, "grad_norm": 0.3160305321216583, "learning_rate": 7.20534223706177e-05, "loss": 0.8282, "num_input_tokens_seen": 5249440, "step": 1922, "train_runtime": 4934.4495, "train_tokens_per_second": 1063.835 }, { "epoch": 0.15452299162297353, "grad_norm": 0.30684584379196167, "learning_rate": 7.198664440734558e-05, "loss": 1.0146, "num_input_tokens_seen": 5254612, "step": 1923, "train_runtime": 4938.1082, "train_tokens_per_second": 1064.094 }, { "epoch": 0.15460334679282428, "grad_norm": 0.36664050817489624, "learning_rate": 7.191986644407346e-05, "loss": 0.8535, "num_input_tokens_seen": 5257486, "step": 1924, "train_runtime": 4940.3908, "train_tokens_per_second": 1064.184 }, { "epoch": 0.15468370196267503, "grad_norm": 0.3335873782634735, "learning_rate": 7.185308848080133e-05, "loss": 1.3193, "num_input_tokens_seen": 5260324, "step": 1925, "train_runtime": 4942.6239, "train_tokens_per_second": 1064.278 }, { "epoch": 0.15476405713252575, "grad_norm": 0.35470297932624817, "learning_rate": 7.178631051752922e-05, "loss": 1.101, "num_input_tokens_seen": 5262270, "step": 1926, "train_runtime": 4944.434, "train_tokens_per_second": 1064.282 }, { "epoch": 0.1548444123023765, "grad_norm": 0.3678680658340454, "learning_rate": 7.171953255425709e-05, "loss": 0.9404, "num_input_tokens_seen": 5264188, "step": 1927, "train_runtime": 4946.2821, "train_tokens_per_second": 1064.272 }, { "epoch": 0.15492476747222725, "grad_norm": 0.3112119734287262, "learning_rate": 7.165275459098498e-05, "loss": 1.0872, "num_input_tokens_seen": 5267080, "step": 1928, "train_runtime": 4948.5653, "train_tokens_per_second": 1064.365 }, { "epoch": 0.155005122642078, "grad_norm": 0.3068605959415436, "learning_rate": 7.158597662771286e-05, "loss": 0.6879, "num_input_tokens_seen": 5270234, "step": 1929, "train_runtime": 4950.9807, "train_tokens_per_second": 1064.483 }, { "epoch": 0.15508547781192872, "grad_norm": 0.34481146931648254, "learning_rate": 7.151919866444074e-05, "loss": 1.0135, "num_input_tokens_seen": 5272392, "step": 1930, "train_runtime": 4952.8855, "train_tokens_per_second": 1064.509 }, { "epoch": 0.15516583298177947, "grad_norm": 0.3026423454284668, "learning_rate": 7.145242070116862e-05, "loss": 0.7957, "num_input_tokens_seen": 5274920, "step": 1931, "train_runtime": 4954.9971, "train_tokens_per_second": 1064.566 }, { "epoch": 0.15524618815163022, "grad_norm": 0.2699041962623596, "learning_rate": 7.13856427378965e-05, "loss": 0.7993, "num_input_tokens_seen": 5279748, "step": 1932, "train_runtime": 4958.319, "train_tokens_per_second": 1064.826 }, { "epoch": 0.15532654332148094, "grad_norm": 0.3555600941181183, "learning_rate": 7.131886477462437e-05, "loss": 0.9359, "num_input_tokens_seen": 5282704, "step": 1933, "train_runtime": 4960.6019, "train_tokens_per_second": 1064.932 }, { "epoch": 0.15540689849133169, "grad_norm": 0.25394558906555176, "learning_rate": 7.125208681135226e-05, "loss": 0.6316, "num_input_tokens_seen": 5285336, "step": 1934, "train_runtime": 4962.7909, "train_tokens_per_second": 1064.993 }, { "epoch": 0.15548725366118243, "grad_norm": 0.3657974600791931, "learning_rate": 7.118530884808013e-05, "loss": 1.1242, "num_input_tokens_seen": 5288346, "step": 1935, "train_runtime": 4964.963, "train_tokens_per_second": 1065.133 }, { "epoch": 0.15556760883103316, "grad_norm": 0.32395562529563904, "learning_rate": 7.111853088480802e-05, "loss": 0.9284, "num_input_tokens_seen": 5291148, "step": 1936, "train_runtime": 4967.2269, "train_tokens_per_second": 1065.212 }, { "epoch": 0.1556479640008839, "grad_norm": 0.3251456022262573, "learning_rate": 7.105175292153589e-05, "loss": 0.8826, "num_input_tokens_seen": 5294288, "step": 1937, "train_runtime": 4969.5641, "train_tokens_per_second": 1065.343 }, { "epoch": 0.15572831917073465, "grad_norm": 0.25326696038246155, "learning_rate": 7.098497495826378e-05, "loss": 0.9146, "num_input_tokens_seen": 5299438, "step": 1938, "train_runtime": 4973.0897, "train_tokens_per_second": 1065.623 }, { "epoch": 0.15580867434058537, "grad_norm": 0.27798202633857727, "learning_rate": 7.091819699499166e-05, "loss": 1.0162, "num_input_tokens_seen": 5301834, "step": 1939, "train_runtime": 4975.0732, "train_tokens_per_second": 1065.68 }, { "epoch": 0.15588902951043612, "grad_norm": 0.37339428067207336, "learning_rate": 7.085141903171954e-05, "loss": 0.9491, "num_input_tokens_seen": 5303752, "step": 1940, "train_runtime": 4976.8114, "train_tokens_per_second": 1065.693 }, { "epoch": 0.15596938468028687, "grad_norm": 0.2563164234161377, "learning_rate": 7.078464106844741e-05, "loss": 0.5693, "num_input_tokens_seen": 5306322, "step": 1941, "train_runtime": 4978.9217, "train_tokens_per_second": 1065.757 }, { "epoch": 0.15604973985013762, "grad_norm": 0.28995391726493835, "learning_rate": 7.07178631051753e-05, "loss": 0.6531, "num_input_tokens_seen": 5310170, "step": 1942, "train_runtime": 4981.758, "train_tokens_per_second": 1065.923 }, { "epoch": 0.15613009501998834, "grad_norm": 0.370501309633255, "learning_rate": 7.065108514190317e-05, "loss": 0.8652, "num_input_tokens_seen": 5313770, "step": 1943, "train_runtime": 4984.492, "train_tokens_per_second": 1066.06 }, { "epoch": 0.1562104501898391, "grad_norm": 0.31541895866394043, "learning_rate": 7.058430717863106e-05, "loss": 0.8789, "num_input_tokens_seen": 5315990, "step": 1944, "train_runtime": 4986.3345, "train_tokens_per_second": 1066.112 }, { "epoch": 0.15629080535968984, "grad_norm": 0.2401241511106491, "learning_rate": 7.051752921535893e-05, "loss": 1.0005, "num_input_tokens_seen": 5318204, "step": 1945, "train_runtime": 4988.2485, "train_tokens_per_second": 1066.147 }, { "epoch": 0.15637116052954056, "grad_norm": 0.3356855511665344, "learning_rate": 7.045075125208682e-05, "loss": 0.7906, "num_input_tokens_seen": 5319620, "step": 1946, "train_runtime": 4989.8284, "train_tokens_per_second": 1066.093 }, { "epoch": 0.1564515156993913, "grad_norm": 0.3931116759777069, "learning_rate": 7.03839732888147e-05, "loss": 1.0376, "num_input_tokens_seen": 5323762, "step": 1947, "train_runtime": 4992.6268, "train_tokens_per_second": 1066.325 }, { "epoch": 0.15653187086924206, "grad_norm": 0.3554634749889374, "learning_rate": 7.031719532554258e-05, "loss": 0.7906, "num_input_tokens_seen": 5327932, "step": 1948, "train_runtime": 4995.5836, "train_tokens_per_second": 1066.528 }, { "epoch": 0.15661222603909278, "grad_norm": 0.3552740514278412, "learning_rate": 7.025041736227045e-05, "loss": 1.1707, "num_input_tokens_seen": 5329492, "step": 1949, "train_runtime": 4997.1604, "train_tokens_per_second": 1066.504 }, { "epoch": 0.15669258120894353, "grad_norm": 0.28638574481010437, "learning_rate": 7.018363939899834e-05, "loss": 1.0422, "num_input_tokens_seen": 5332904, "step": 1950, "train_runtime": 4999.7415, "train_tokens_per_second": 1066.636 }, { "epoch": 0.15677293637879428, "grad_norm": 0.2969324290752411, "learning_rate": 7.011686143572621e-05, "loss": 0.9198, "num_input_tokens_seen": 5335286, "step": 1951, "train_runtime": 5003.4018, "train_tokens_per_second": 1066.332 }, { "epoch": 0.15685329154864502, "grad_norm": 0.29404449462890625, "learning_rate": 7.00500834724541e-05, "loss": 0.9238, "num_input_tokens_seen": 5337290, "step": 1952, "train_runtime": 5005.2396, "train_tokens_per_second": 1066.341 }, { "epoch": 0.15693364671849575, "grad_norm": 0.35833194851875305, "learning_rate": 6.998330550918197e-05, "loss": 0.8637, "num_input_tokens_seen": 5340164, "step": 1953, "train_runtime": 5007.5406, "train_tokens_per_second": 1066.424 }, { "epoch": 0.1570140018883465, "grad_norm": 0.3525274693965912, "learning_rate": 6.991652754590986e-05, "loss": 0.9701, "num_input_tokens_seen": 5342766, "step": 1954, "train_runtime": 5009.6672, "train_tokens_per_second": 1066.491 }, { "epoch": 0.15709435705819724, "grad_norm": 0.262835830450058, "learning_rate": 6.984974958263774e-05, "loss": 0.8071, "num_input_tokens_seen": 5345382, "step": 1955, "train_runtime": 5011.8178, "train_tokens_per_second": 1066.556 }, { "epoch": 0.15717471222804796, "grad_norm": 0.29403117299079895, "learning_rate": 6.978297161936562e-05, "loss": 0.8564, "num_input_tokens_seen": 5347578, "step": 1956, "train_runtime": 5013.6731, "train_tokens_per_second": 1066.599 }, { "epoch": 0.1572550673978987, "grad_norm": 0.29831740260124207, "learning_rate": 6.971619365609349e-05, "loss": 0.91, "num_input_tokens_seen": 5350144, "step": 1957, "train_runtime": 5015.725, "train_tokens_per_second": 1066.674 }, { "epoch": 0.15733542256774946, "grad_norm": 0.3791574239730835, "learning_rate": 6.964941569282138e-05, "loss": 0.7161, "num_input_tokens_seen": 5352736, "step": 1958, "train_runtime": 5017.9306, "train_tokens_per_second": 1066.722 }, { "epoch": 0.15741577773760018, "grad_norm": 0.2974484860897064, "learning_rate": 6.958263772954925e-05, "loss": 0.7892, "num_input_tokens_seen": 5355908, "step": 1959, "train_runtime": 5020.3733, "train_tokens_per_second": 1066.835 }, { "epoch": 0.15749613290745093, "grad_norm": 0.37496134638786316, "learning_rate": 6.951585976627714e-05, "loss": 0.9776, "num_input_tokens_seen": 5358350, "step": 1960, "train_runtime": 5022.4329, "train_tokens_per_second": 1066.883 }, { "epoch": 0.15757648807730168, "grad_norm": 0.32669517397880554, "learning_rate": 6.944908180300501e-05, "loss": 1.1729, "num_input_tokens_seen": 5360426, "step": 1961, "train_runtime": 5024.251, "train_tokens_per_second": 1066.91 }, { "epoch": 0.1576568432471524, "grad_norm": 0.33246564865112305, "learning_rate": 6.938230383973288e-05, "loss": 1.1655, "num_input_tokens_seen": 5362906, "step": 1962, "train_runtime": 5026.2137, "train_tokens_per_second": 1066.987 }, { "epoch": 0.15773719841700315, "grad_norm": 0.29764726758003235, "learning_rate": 6.931552587646077e-05, "loss": 0.8907, "num_input_tokens_seen": 5366248, "step": 1963, "train_runtime": 5028.7282, "train_tokens_per_second": 1067.118 }, { "epoch": 0.1578175535868539, "grad_norm": 0.29955893754959106, "learning_rate": 6.924874791318865e-05, "loss": 1.1362, "num_input_tokens_seen": 5368114, "step": 1964, "train_runtime": 5030.4758, "train_tokens_per_second": 1067.119 }, { "epoch": 0.15789790875670465, "grad_norm": 0.41301074624061584, "learning_rate": 6.918196994991654e-05, "loss": 0.8787, "num_input_tokens_seen": 5370326, "step": 1965, "train_runtime": 5032.501, "train_tokens_per_second": 1067.129 }, { "epoch": 0.15797826392655537, "grad_norm": 0.3436276614665985, "learning_rate": 6.911519198664441e-05, "loss": 0.9528, "num_input_tokens_seen": 5373510, "step": 1966, "train_runtime": 5034.8354, "train_tokens_per_second": 1067.266 }, { "epoch": 0.15805861909640612, "grad_norm": 0.4939381778240204, "learning_rate": 6.904841402337229e-05, "loss": 0.9795, "num_input_tokens_seen": 5377876, "step": 1967, "train_runtime": 5038.0103, "train_tokens_per_second": 1067.46 }, { "epoch": 0.15813897426625687, "grad_norm": 0.41390731930732727, "learning_rate": 6.898163606010017e-05, "loss": 0.8077, "num_input_tokens_seen": 5379832, "step": 1968, "train_runtime": 5039.8319, "train_tokens_per_second": 1067.463 }, { "epoch": 0.1582193294361076, "grad_norm": 0.2849280536174774, "learning_rate": 6.891485809682805e-05, "loss": 1.0216, "num_input_tokens_seen": 5385832, "step": 1969, "train_runtime": 5043.919, "train_tokens_per_second": 1067.787 }, { "epoch": 0.15829968460595834, "grad_norm": 0.29219865798950195, "learning_rate": 6.884808013355592e-05, "loss": 0.8279, "num_input_tokens_seen": 5388922, "step": 1970, "train_runtime": 5046.3134, "train_tokens_per_second": 1067.893 }, { "epoch": 0.15838003977580908, "grad_norm": 0.3463384211063385, "learning_rate": 6.878130217028381e-05, "loss": 1.1366, "num_input_tokens_seen": 5391822, "step": 1971, "train_runtime": 5048.778, "train_tokens_per_second": 1067.946 }, { "epoch": 0.1584603949456598, "grad_norm": 0.248994380235672, "learning_rate": 6.87145242070117e-05, "loss": 0.8292, "num_input_tokens_seen": 5398074, "step": 1972, "train_runtime": 5053.109, "train_tokens_per_second": 1068.268 }, { "epoch": 0.15854075011551055, "grad_norm": 0.3142145574092865, "learning_rate": 6.864774624373958e-05, "loss": 0.829, "num_input_tokens_seen": 5399646, "step": 1973, "train_runtime": 5054.7784, "train_tokens_per_second": 1068.226 }, { "epoch": 0.1586211052853613, "grad_norm": 0.35669538378715515, "learning_rate": 6.858096828046745e-05, "loss": 1.1861, "num_input_tokens_seen": 5402010, "step": 1974, "train_runtime": 5056.8084, "train_tokens_per_second": 1068.265 }, { "epoch": 0.15870146045521202, "grad_norm": 0.3485780358314514, "learning_rate": 6.851419031719533e-05, "loss": 0.6812, "num_input_tokens_seen": 5404206, "step": 1975, "train_runtime": 5058.6761, "train_tokens_per_second": 1068.304 }, { "epoch": 0.15878181562506277, "grad_norm": 0.3071657121181488, "learning_rate": 6.844741235392321e-05, "loss": 0.7835, "num_input_tokens_seen": 5405990, "step": 1976, "train_runtime": 5060.4081, "train_tokens_per_second": 1068.291 }, { "epoch": 0.15886217079491352, "grad_norm": 0.2993569076061249, "learning_rate": 6.838063439065109e-05, "loss": 1.1551, "num_input_tokens_seen": 5408148, "step": 1977, "train_runtime": 5062.2414, "train_tokens_per_second": 1068.331 }, { "epoch": 0.15894252596476427, "grad_norm": 0.34315863251686096, "learning_rate": 6.831385642737896e-05, "loss": 1.2995, "num_input_tokens_seen": 5409808, "step": 1978, "train_runtime": 5063.944, "train_tokens_per_second": 1068.299 }, { "epoch": 0.159022881134615, "grad_norm": 0.395594984292984, "learning_rate": 6.824707846410685e-05, "loss": 1.3062, "num_input_tokens_seen": 5411408, "step": 1979, "train_runtime": 5065.5757, "train_tokens_per_second": 1068.271 }, { "epoch": 0.15910323630446574, "grad_norm": 0.3101098835468292, "learning_rate": 6.818030050083472e-05, "loss": 1.0669, "num_input_tokens_seen": 5414612, "step": 1980, "train_runtime": 5067.9197, "train_tokens_per_second": 1068.409 }, { "epoch": 0.1591835914743165, "grad_norm": 0.28457948565483093, "learning_rate": 6.811352253756261e-05, "loss": 1.1173, "num_input_tokens_seen": 5418072, "step": 1981, "train_runtime": 5072.0984, "train_tokens_per_second": 1068.211 }, { "epoch": 0.1592639466441672, "grad_norm": 0.2898434102535248, "learning_rate": 6.80467445742905e-05, "loss": 0.8002, "num_input_tokens_seen": 5419758, "step": 1982, "train_runtime": 5073.886, "train_tokens_per_second": 1068.167 }, { "epoch": 0.15934430181401796, "grad_norm": 0.27834630012512207, "learning_rate": 6.797996661101837e-05, "loss": 0.763, "num_input_tokens_seen": 5423198, "step": 1983, "train_runtime": 5076.4303, "train_tokens_per_second": 1068.309 }, { "epoch": 0.1594246569838687, "grad_norm": 0.3703613579273224, "learning_rate": 6.791318864774625e-05, "loss": 0.9988, "num_input_tokens_seen": 5425062, "step": 1984, "train_runtime": 5078.181, "train_tokens_per_second": 1068.308 }, { "epoch": 0.15950501215371943, "grad_norm": 0.2970855236053467, "learning_rate": 6.784641068447413e-05, "loss": 1.0776, "num_input_tokens_seen": 5427042, "step": 1985, "train_runtime": 5080.045, "train_tokens_per_second": 1068.306 }, { "epoch": 0.15958536732357018, "grad_norm": 0.34390586614608765, "learning_rate": 6.7779632721202e-05, "loss": 0.978, "num_input_tokens_seen": 5429028, "step": 1986, "train_runtime": 5081.9533, "train_tokens_per_second": 1068.296 }, { "epoch": 0.15966572249342093, "grad_norm": 0.26503974199295044, "learning_rate": 6.771285475792989e-05, "loss": 0.8988, "num_input_tokens_seen": 5432860, "step": 1987, "train_runtime": 5084.6806, "train_tokens_per_second": 1068.476 }, { "epoch": 0.15974607766327167, "grad_norm": 0.27086111903190613, "learning_rate": 6.764607679465776e-05, "loss": 0.9022, "num_input_tokens_seen": 5435918, "step": 1988, "train_runtime": 5087.1247, "train_tokens_per_second": 1068.564 }, { "epoch": 0.1598264328331224, "grad_norm": 0.4578646719455719, "learning_rate": 6.757929883138565e-05, "loss": 0.893, "num_input_tokens_seen": 5437828, "step": 1989, "train_runtime": 5088.8072, "train_tokens_per_second": 1068.586 }, { "epoch": 0.15990678800297314, "grad_norm": 0.3436759412288666, "learning_rate": 6.751252086811353e-05, "loss": 0.9503, "num_input_tokens_seen": 5440438, "step": 1990, "train_runtime": 5090.8326, "train_tokens_per_second": 1068.674 }, { "epoch": 0.1599871431728239, "grad_norm": 0.3114043176174164, "learning_rate": 6.74457429048414e-05, "loss": 0.9616, "num_input_tokens_seen": 5446342, "step": 1991, "train_runtime": 5094.9021, "train_tokens_per_second": 1068.979 }, { "epoch": 0.1600674983426746, "grad_norm": 0.3067304491996765, "learning_rate": 6.737896494156929e-05, "loss": 0.7178, "num_input_tokens_seen": 5448296, "step": 1992, "train_runtime": 5096.7909, "train_tokens_per_second": 1068.966 }, { "epoch": 0.16014785351252536, "grad_norm": 0.2988907992839813, "learning_rate": 6.731218697829717e-05, "loss": 1.0715, "num_input_tokens_seen": 5454086, "step": 1993, "train_runtime": 5100.8145, "train_tokens_per_second": 1069.258 }, { "epoch": 0.1602282086823761, "grad_norm": 0.2712036371231079, "learning_rate": 6.724540901502504e-05, "loss": 1.1776, "num_input_tokens_seen": 5459316, "step": 1994, "train_runtime": 5104.4322, "train_tokens_per_second": 1069.525 }, { "epoch": 0.16030856385222683, "grad_norm": 0.5102654695510864, "learning_rate": 6.717863105175293e-05, "loss": 0.7674, "num_input_tokens_seen": 5463292, "step": 1995, "train_runtime": 5107.4182, "train_tokens_per_second": 1069.678 }, { "epoch": 0.16038891902207758, "grad_norm": 0.37160399556159973, "learning_rate": 6.71118530884808e-05, "loss": 1.031, "num_input_tokens_seen": 5466880, "step": 1996, "train_runtime": 5110.0017, "train_tokens_per_second": 1069.839 }, { "epoch": 0.16046927419192833, "grad_norm": 0.2616192400455475, "learning_rate": 6.704507512520869e-05, "loss": 1.0917, "num_input_tokens_seen": 5469918, "step": 1997, "train_runtime": 5112.3784, "train_tokens_per_second": 1069.936 }, { "epoch": 0.16054962936177905, "grad_norm": 0.3706570863723755, "learning_rate": 6.697829716193656e-05, "loss": 0.7708, "num_input_tokens_seen": 5471192, "step": 1998, "train_runtime": 5113.8874, "train_tokens_per_second": 1069.869 }, { "epoch": 0.1606299845316298, "grad_norm": 0.412650465965271, "learning_rate": 6.691151919866445e-05, "loss": 0.4588, "num_input_tokens_seen": 5475472, "step": 1999, "train_runtime": 5117.0738, "train_tokens_per_second": 1070.04 }, { "epoch": 0.16071033970148055, "grad_norm": 0.37960755825042725, "learning_rate": 6.684474123539233e-05, "loss": 1.0389, "num_input_tokens_seen": 5478570, "step": 2000, "train_runtime": 5119.3993, "train_tokens_per_second": 1070.159 }, { "epoch": 0.1607906948713313, "grad_norm": 0.29763177037239075, "learning_rate": 6.67779632721202e-05, "loss": 0.8047, "num_input_tokens_seen": 5480588, "step": 2001, "train_runtime": 5121.2035, "train_tokens_per_second": 1070.176 }, { "epoch": 0.16087105004118202, "grad_norm": 0.2461473047733307, "learning_rate": 6.671118530884808e-05, "loss": 0.878, "num_input_tokens_seen": 5484472, "step": 2002, "train_runtime": 5124.0742, "train_tokens_per_second": 1070.334 }, { "epoch": 0.16095140521103277, "grad_norm": 0.38381364941596985, "learning_rate": 6.664440734557597e-05, "loss": 1.2021, "num_input_tokens_seen": 5487396, "step": 2003, "train_runtime": 5126.3374, "train_tokens_per_second": 1070.432 }, { "epoch": 0.16103176038088352, "grad_norm": 0.36581820249557495, "learning_rate": 6.657762938230384e-05, "loss": 1.1594, "num_input_tokens_seen": 5488868, "step": 2004, "train_runtime": 5127.9142, "train_tokens_per_second": 1070.39 }, { "epoch": 0.16111211555073424, "grad_norm": 0.3146212100982666, "learning_rate": 6.651085141903173e-05, "loss": 1.0656, "num_input_tokens_seen": 5491252, "step": 2005, "train_runtime": 5129.9666, "train_tokens_per_second": 1070.426 }, { "epoch": 0.16119247072058498, "grad_norm": 0.3928852379322052, "learning_rate": 6.64440734557596e-05, "loss": 1.1531, "num_input_tokens_seen": 5493438, "step": 2006, "train_runtime": 5131.9773, "train_tokens_per_second": 1070.433 }, { "epoch": 0.16127282589043573, "grad_norm": 0.29733264446258545, "learning_rate": 6.637729549248749e-05, "loss": 1.0532, "num_input_tokens_seen": 5495702, "step": 2007, "train_runtime": 5133.846, "train_tokens_per_second": 1070.484 }, { "epoch": 0.16135318106028645, "grad_norm": 0.28483888506889343, "learning_rate": 6.631051752921537e-05, "loss": 1.1196, "num_input_tokens_seen": 5498840, "step": 2008, "train_runtime": 5136.282, "train_tokens_per_second": 1070.588 }, { "epoch": 0.1614335362301372, "grad_norm": 0.31708404421806335, "learning_rate": 6.624373956594325e-05, "loss": 0.9999, "num_input_tokens_seen": 5501512, "step": 2009, "train_runtime": 5138.4136, "train_tokens_per_second": 1070.664 }, { "epoch": 0.16151389139998795, "grad_norm": 0.30248215794563293, "learning_rate": 6.617696160267112e-05, "loss": 1.0217, "num_input_tokens_seen": 5504706, "step": 2010, "train_runtime": 5140.9301, "train_tokens_per_second": 1070.761 }, { "epoch": 0.16159424656983867, "grad_norm": 0.3167038857936859, "learning_rate": 6.6110183639399e-05, "loss": 0.6999, "num_input_tokens_seen": 5507808, "step": 2011, "train_runtime": 5145.091, "train_tokens_per_second": 1070.498 }, { "epoch": 0.16167460173968942, "grad_norm": 0.26810508966445923, "learning_rate": 6.604340567612688e-05, "loss": 0.7864, "num_input_tokens_seen": 5511200, "step": 2012, "train_runtime": 5147.6391, "train_tokens_per_second": 1070.627 }, { "epoch": 0.16175495690954017, "grad_norm": 0.3418722152709961, "learning_rate": 6.597662771285476e-05, "loss": 1.0623, "num_input_tokens_seen": 5514692, "step": 2013, "train_runtime": 5150.319, "train_tokens_per_second": 1070.748 }, { "epoch": 0.16183531207939092, "grad_norm": 0.3534741699695587, "learning_rate": 6.590984974958264e-05, "loss": 1.0377, "num_input_tokens_seen": 5517002, "step": 2014, "train_runtime": 5152.3375, "train_tokens_per_second": 1070.777 }, { "epoch": 0.16191566724924164, "grad_norm": 0.2800027132034302, "learning_rate": 6.584307178631051e-05, "loss": 0.8989, "num_input_tokens_seen": 5520926, "step": 2015, "train_runtime": 5155.1256, "train_tokens_per_second": 1070.959 }, { "epoch": 0.1619960224190924, "grad_norm": 0.31767845153808594, "learning_rate": 6.57762938230384e-05, "loss": 1.0594, "num_input_tokens_seen": 5522890, "step": 2016, "train_runtime": 5156.8531, "train_tokens_per_second": 1070.981 }, { "epoch": 0.16207637758894314, "grad_norm": 0.23786990344524384, "learning_rate": 6.570951585976628e-05, "loss": 0.6891, "num_input_tokens_seen": 5526156, "step": 2017, "train_runtime": 5159.2947, "train_tokens_per_second": 1071.107 }, { "epoch": 0.16215673275879386, "grad_norm": 0.3688257336616516, "learning_rate": 6.564273789649416e-05, "loss": 1.0869, "num_input_tokens_seen": 5530634, "step": 2018, "train_runtime": 5162.6587, "train_tokens_per_second": 1071.276 }, { "epoch": 0.1622370879286446, "grad_norm": 0.3014098107814789, "learning_rate": 6.557595993322204e-05, "loss": 1.0303, "num_input_tokens_seen": 5533082, "step": 2019, "train_runtime": 5164.7146, "train_tokens_per_second": 1071.324 }, { "epoch": 0.16231744309849536, "grad_norm": 0.34500762820243835, "learning_rate": 6.550918196994992e-05, "loss": 0.9926, "num_input_tokens_seen": 5535222, "step": 2020, "train_runtime": 5166.621, "train_tokens_per_second": 1071.343 }, { "epoch": 0.16239779826834608, "grad_norm": 0.24485503137111664, "learning_rate": 6.54424040066778e-05, "loss": 0.5423, "num_input_tokens_seen": 5537210, "step": 2021, "train_runtime": 5168.4414, "train_tokens_per_second": 1071.35 }, { "epoch": 0.16247815343819683, "grad_norm": 0.2860889136791229, "learning_rate": 6.537562604340568e-05, "loss": 0.9626, "num_input_tokens_seen": 5540068, "step": 2022, "train_runtime": 5170.7148, "train_tokens_per_second": 1071.432 }, { "epoch": 0.16255850860804757, "grad_norm": 0.3342204988002777, "learning_rate": 6.530884808013355e-05, "loss": 0.8224, "num_input_tokens_seen": 5542534, "step": 2023, "train_runtime": 5172.7647, "train_tokens_per_second": 1071.484 }, { "epoch": 0.16263886377789832, "grad_norm": 0.4009633958339691, "learning_rate": 6.524207011686144e-05, "loss": 0.6614, "num_input_tokens_seen": 5544744, "step": 2024, "train_runtime": 5174.5959, "train_tokens_per_second": 1071.532 }, { "epoch": 0.16271921894774904, "grad_norm": 0.42543843388557434, "learning_rate": 6.517529215358932e-05, "loss": 0.9491, "num_input_tokens_seen": 5546498, "step": 2025, "train_runtime": 5176.2583, "train_tokens_per_second": 1071.527 }, { "epoch": 0.1627995741175998, "grad_norm": 0.2977692186832428, "learning_rate": 6.51085141903172e-05, "loss": 0.8044, "num_input_tokens_seen": 5548960, "step": 2026, "train_runtime": 5178.2467, "train_tokens_per_second": 1071.591 }, { "epoch": 0.16287992928745054, "grad_norm": 0.37556591629981995, "learning_rate": 6.504173622704508e-05, "loss": 1.2746, "num_input_tokens_seen": 5551680, "step": 2027, "train_runtime": 5180.4911, "train_tokens_per_second": 1071.651 }, { "epoch": 0.16296028445730126, "grad_norm": 0.30354321002960205, "learning_rate": 6.497495826377296e-05, "loss": 2.0511, "num_input_tokens_seen": 5557666, "step": 2028, "train_runtime": 5184.4913, "train_tokens_per_second": 1071.979 }, { "epoch": 0.163040639627152, "grad_norm": 0.288390576839447, "learning_rate": 6.490818030050084e-05, "loss": 1.2055, "num_input_tokens_seen": 5561890, "step": 2029, "train_runtime": 5187.4586, "train_tokens_per_second": 1072.18 }, { "epoch": 0.16312099479700276, "grad_norm": 0.31022995710372925, "learning_rate": 6.484140233722872e-05, "loss": 1.4456, "num_input_tokens_seen": 5565122, "step": 2030, "train_runtime": 5189.9589, "train_tokens_per_second": 1072.286 }, { "epoch": 0.16320134996685348, "grad_norm": 0.30416494607925415, "learning_rate": 6.477462437395659e-05, "loss": 1.0686, "num_input_tokens_seen": 5568044, "step": 2031, "train_runtime": 5192.1884, "train_tokens_per_second": 1072.389 }, { "epoch": 0.16328170513670423, "grad_norm": 0.3376562297344208, "learning_rate": 6.470784641068448e-05, "loss": 0.8914, "num_input_tokens_seen": 5574294, "step": 2032, "train_runtime": 5196.367, "train_tokens_per_second": 1072.729 }, { "epoch": 0.16336206030655498, "grad_norm": 0.2965356409549713, "learning_rate": 6.464106844741235e-05, "loss": 0.682, "num_input_tokens_seen": 5576298, "step": 2033, "train_runtime": 5198.2066, "train_tokens_per_second": 1072.735 }, { "epoch": 0.1634424154764057, "grad_norm": 0.33282458782196045, "learning_rate": 6.457429048414024e-05, "loss": 1.1757, "num_input_tokens_seen": 5579398, "step": 2034, "train_runtime": 5200.5787, "train_tokens_per_second": 1072.842 }, { "epoch": 0.16352277064625645, "grad_norm": 0.30046728253364563, "learning_rate": 6.450751252086812e-05, "loss": 1.1992, "num_input_tokens_seen": 5582100, "step": 2035, "train_runtime": 5202.7948, "train_tokens_per_second": 1072.904 }, { "epoch": 0.1636031258161072, "grad_norm": 0.3563089966773987, "learning_rate": 6.4440734557596e-05, "loss": 0.9134, "num_input_tokens_seen": 5585168, "step": 2036, "train_runtime": 5205.1611, "train_tokens_per_second": 1073.006 }, { "epoch": 0.16368348098595795, "grad_norm": 0.2713526487350464, "learning_rate": 6.437395659432388e-05, "loss": 1.0813, "num_input_tokens_seen": 5588818, "step": 2037, "train_runtime": 5207.7872, "train_tokens_per_second": 1073.166 }, { "epoch": 0.16376383615580867, "grad_norm": 0.3220246136188507, "learning_rate": 6.430717863105176e-05, "loss": 1.0672, "num_input_tokens_seen": 5592964, "step": 2038, "train_runtime": 5210.7337, "train_tokens_per_second": 1073.354 }, { "epoch": 0.16384419132565942, "grad_norm": 0.3526294231414795, "learning_rate": 6.424040066777963e-05, "loss": 1.1681, "num_input_tokens_seen": 5596184, "step": 2039, "train_runtime": 5213.0688, "train_tokens_per_second": 1073.491 }, { "epoch": 0.16392454649551016, "grad_norm": 0.4200699031352997, "learning_rate": 6.417362270450752e-05, "loss": 1.2005, "num_input_tokens_seen": 5599934, "step": 2040, "train_runtime": 5215.8182, "train_tokens_per_second": 1073.644 }, { "epoch": 0.16400490166536089, "grad_norm": 0.276871919631958, "learning_rate": 6.410684474123539e-05, "loss": 0.7408, "num_input_tokens_seen": 5601698, "step": 2041, "train_runtime": 5219.1761, "train_tokens_per_second": 1073.292 }, { "epoch": 0.16408525683521163, "grad_norm": 0.2654786705970764, "learning_rate": 6.404006677796328e-05, "loss": 0.8731, "num_input_tokens_seen": 5605180, "step": 2042, "train_runtime": 5221.7471, "train_tokens_per_second": 1073.43 }, { "epoch": 0.16416561200506238, "grad_norm": 0.3190358281135559, "learning_rate": 6.397328881469116e-05, "loss": 1.0788, "num_input_tokens_seen": 5608582, "step": 2043, "train_runtime": 5224.374, "train_tokens_per_second": 1073.541 }, { "epoch": 0.1642459671749131, "grad_norm": 0.31441324949264526, "learning_rate": 6.390651085141904e-05, "loss": 1.1984, "num_input_tokens_seen": 5610288, "step": 2044, "train_runtime": 5225.9917, "train_tokens_per_second": 1073.536 }, { "epoch": 0.16432632234476385, "grad_norm": 0.2650690972805023, "learning_rate": 6.383973288814692e-05, "loss": 0.7757, "num_input_tokens_seen": 5613108, "step": 2045, "train_runtime": 5228.2134, "train_tokens_per_second": 1073.619 }, { "epoch": 0.1644066775146146, "grad_norm": 0.3159467875957489, "learning_rate": 6.37729549248748e-05, "loss": 1.0578, "num_input_tokens_seen": 5614898, "step": 2046, "train_runtime": 5229.9417, "train_tokens_per_second": 1073.606 }, { "epoch": 0.16448703268446532, "grad_norm": 0.30501702427864075, "learning_rate": 6.370617696160267e-05, "loss": 0.8563, "num_input_tokens_seen": 5618320, "step": 2047, "train_runtime": 5232.6038, "train_tokens_per_second": 1073.714 }, { "epoch": 0.16456738785431607, "grad_norm": 0.28293177485466003, "learning_rate": 6.363939899833056e-05, "loss": 0.9986, "num_input_tokens_seen": 5621794, "step": 2048, "train_runtime": 5235.1232, "train_tokens_per_second": 1073.861 }, { "epoch": 0.16464774302416682, "grad_norm": 0.2597467303276062, "learning_rate": 6.357262103505843e-05, "loss": 0.8053, "num_input_tokens_seen": 5624258, "step": 2049, "train_runtime": 5237.1675, "train_tokens_per_second": 1073.912 }, { "epoch": 0.16472809819401757, "grad_norm": 0.47438162565231323, "learning_rate": 6.35058430717863e-05, "loss": 0.64, "num_input_tokens_seen": 5626210, "step": 2050, "train_runtime": 5238.957, "train_tokens_per_second": 1073.918 }, { "epoch": 0.1648084533638683, "grad_norm": 0.3228159248828888, "learning_rate": 6.343906510851419e-05, "loss": 1.0785, "num_input_tokens_seen": 5628302, "step": 2051, "train_runtime": 5240.7838, "train_tokens_per_second": 1073.943 }, { "epoch": 0.16488880853371904, "grad_norm": 0.4315949082374573, "learning_rate": 6.337228714524208e-05, "loss": 1.1422, "num_input_tokens_seen": 5631272, "step": 2052, "train_runtime": 5242.9917, "train_tokens_per_second": 1074.057 }, { "epoch": 0.1649691637035698, "grad_norm": 0.31984058022499084, "learning_rate": 6.330550918196996e-05, "loss": 1.2722, "num_input_tokens_seen": 5633816, "step": 2053, "train_runtime": 5245.0384, "train_tokens_per_second": 1074.123 }, { "epoch": 0.1650495188734205, "grad_norm": 0.31677675247192383, "learning_rate": 6.323873121869784e-05, "loss": 1.0599, "num_input_tokens_seen": 5636902, "step": 2054, "train_runtime": 5247.4159, "train_tokens_per_second": 1074.224 }, { "epoch": 0.16512987404327126, "grad_norm": 0.3054615557193756, "learning_rate": 6.317195325542571e-05, "loss": 0.9121, "num_input_tokens_seen": 5638898, "step": 2055, "train_runtime": 5249.2337, "train_tokens_per_second": 1074.233 }, { "epoch": 0.165210229213122, "grad_norm": 0.3366914987564087, "learning_rate": 6.31051752921536e-05, "loss": 1.083, "num_input_tokens_seen": 5642702, "step": 2056, "train_runtime": 5252.099, "train_tokens_per_second": 1074.371 }, { "epoch": 0.16529058438297273, "grad_norm": 0.3531474769115448, "learning_rate": 6.303839732888147e-05, "loss": 1.2471, "num_input_tokens_seen": 5645056, "step": 2057, "train_runtime": 5254.0375, "train_tokens_per_second": 1074.422 }, { "epoch": 0.16537093955282348, "grad_norm": 0.31711310148239136, "learning_rate": 6.297161936560934e-05, "loss": 0.7763, "num_input_tokens_seen": 5646962, "step": 2058, "train_runtime": 5255.9512, "train_tokens_per_second": 1074.394 }, { "epoch": 0.16545129472267422, "grad_norm": 0.34467220306396484, "learning_rate": 6.290484140233723e-05, "loss": 1.2711, "num_input_tokens_seen": 5650330, "step": 2059, "train_runtime": 5258.4124, "train_tokens_per_second": 1074.532 }, { "epoch": 0.16553164989252497, "grad_norm": 0.30267950892448425, "learning_rate": 6.283806343906511e-05, "loss": 0.9442, "num_input_tokens_seen": 5652646, "step": 2060, "train_runtime": 5260.383, "train_tokens_per_second": 1074.569 }, { "epoch": 0.1656120050623757, "grad_norm": 0.28625982999801636, "learning_rate": 6.2771285475793e-05, "loss": 0.907, "num_input_tokens_seen": 5656780, "step": 2061, "train_runtime": 5263.2694, "train_tokens_per_second": 1074.765 }, { "epoch": 0.16569236023222644, "grad_norm": 0.37177157402038574, "learning_rate": 6.270450751252087e-05, "loss": 1.2762, "num_input_tokens_seen": 5659600, "step": 2062, "train_runtime": 5265.4257, "train_tokens_per_second": 1074.861 }, { "epoch": 0.1657727154020772, "grad_norm": 0.34112870693206787, "learning_rate": 6.263772954924875e-05, "loss": 0.864, "num_input_tokens_seen": 5662498, "step": 2063, "train_runtime": 5267.6289, "train_tokens_per_second": 1074.961 }, { "epoch": 0.1658530705719279, "grad_norm": 0.3134649693965912, "learning_rate": 6.257095158597663e-05, "loss": 0.6045, "num_input_tokens_seen": 5665668, "step": 2064, "train_runtime": 5269.9908, "train_tokens_per_second": 1075.081 }, { "epoch": 0.16593342574177866, "grad_norm": 0.3043017089366913, "learning_rate": 6.250417362270451e-05, "loss": 1.0348, "num_input_tokens_seen": 5668906, "step": 2065, "train_runtime": 5272.3977, "train_tokens_per_second": 1075.205 }, { "epoch": 0.1660137809116294, "grad_norm": 0.32345324754714966, "learning_rate": 6.243739565943238e-05, "loss": 0.8914, "num_input_tokens_seen": 5672164, "step": 2066, "train_runtime": 5274.8868, "train_tokens_per_second": 1075.315 }, { "epoch": 0.16609413608148013, "grad_norm": 0.368843674659729, "learning_rate": 6.237061769616027e-05, "loss": 1.2069, "num_input_tokens_seen": 5674750, "step": 2067, "train_runtime": 5277.0032, "train_tokens_per_second": 1075.374 }, { "epoch": 0.16617449125133088, "grad_norm": 0.35405561327934265, "learning_rate": 6.230383973288815e-05, "loss": 1.1689, "num_input_tokens_seen": 5676472, "step": 2068, "train_runtime": 5278.7059, "train_tokens_per_second": 1075.353 }, { "epoch": 0.16625484642118163, "grad_norm": 0.28620272874832153, "learning_rate": 6.223706176961604e-05, "loss": 0.984, "num_input_tokens_seen": 5679514, "step": 2069, "train_runtime": 5281.048, "train_tokens_per_second": 1075.452 }, { "epoch": 0.16633520159103235, "grad_norm": 0.3701074719429016, "learning_rate": 6.217028380634391e-05, "loss": 1.0772, "num_input_tokens_seen": 5681956, "step": 2070, "train_runtime": 5283.0865, "train_tokens_per_second": 1075.499 }, { "epoch": 0.1664155567608831, "grad_norm": 0.46768495440483093, "learning_rate": 6.210350584307179e-05, "loss": 1.0691, "num_input_tokens_seen": 5685598, "step": 2071, "train_runtime": 5287.3326, "train_tokens_per_second": 1075.324 }, { "epoch": 0.16649591193073385, "grad_norm": 0.32651495933532715, "learning_rate": 6.203672787979967e-05, "loss": 0.8737, "num_input_tokens_seen": 5687910, "step": 2072, "train_runtime": 5289.3436, "train_tokens_per_second": 1075.353 }, { "epoch": 0.1665762671005846, "grad_norm": 0.3948456943035126, "learning_rate": 6.196994991652755e-05, "loss": 1.0487, "num_input_tokens_seen": 5693982, "step": 2073, "train_runtime": 5293.3662, "train_tokens_per_second": 1075.683 }, { "epoch": 0.16665662227043532, "grad_norm": 0.386605441570282, "learning_rate": 6.190317195325542e-05, "loss": 1.089, "num_input_tokens_seen": 5697036, "step": 2074, "train_runtime": 5295.7537, "train_tokens_per_second": 1075.774 }, { "epoch": 0.16673697744028607, "grad_norm": 0.31722506880760193, "learning_rate": 6.183639398998331e-05, "loss": 1.1406, "num_input_tokens_seen": 5700596, "step": 2075, "train_runtime": 5298.4093, "train_tokens_per_second": 1075.907 }, { "epoch": 0.16681733261013681, "grad_norm": 0.31338486075401306, "learning_rate": 6.176961602671118e-05, "loss": 0.685, "num_input_tokens_seen": 5704598, "step": 2076, "train_runtime": 5301.298, "train_tokens_per_second": 1076.076 }, { "epoch": 0.16689768777998754, "grad_norm": 0.31885960698127747, "learning_rate": 6.170283806343907e-05, "loss": 0.8387, "num_input_tokens_seen": 5707762, "step": 2077, "train_runtime": 5303.7714, "train_tokens_per_second": 1076.17 }, { "epoch": 0.16697804294983828, "grad_norm": 0.3406186103820801, "learning_rate": 6.163606010016695e-05, "loss": 1.0031, "num_input_tokens_seen": 5709990, "step": 2078, "train_runtime": 5305.7598, "train_tokens_per_second": 1076.187 }, { "epoch": 0.16705839811968903, "grad_norm": 0.32604217529296875, "learning_rate": 6.156928213689483e-05, "loss": 0.8163, "num_input_tokens_seen": 5712006, "step": 2079, "train_runtime": 5307.6824, "train_tokens_per_second": 1076.177 }, { "epoch": 0.16713875328953975, "grad_norm": 0.3653429448604584, "learning_rate": 6.150250417362271e-05, "loss": 0.9424, "num_input_tokens_seen": 5714072, "step": 2080, "train_runtime": 5309.5057, "train_tokens_per_second": 1076.197 }, { "epoch": 0.1672191084593905, "grad_norm": 0.3046902120113373, "learning_rate": 6.143572621035059e-05, "loss": 0.8268, "num_input_tokens_seen": 5717166, "step": 2081, "train_runtime": 5311.8409, "train_tokens_per_second": 1076.306 }, { "epoch": 0.16729946362924125, "grad_norm": 0.3862263858318329, "learning_rate": 6.136894824707846e-05, "loss": 0.9915, "num_input_tokens_seen": 5718692, "step": 2082, "train_runtime": 5313.4471, "train_tokens_per_second": 1076.268 }, { "epoch": 0.16737981879909197, "grad_norm": 0.289603054523468, "learning_rate": 6.130217028380635e-05, "loss": 0.8169, "num_input_tokens_seen": 5721638, "step": 2083, "train_runtime": 5315.623, "train_tokens_per_second": 1076.381 }, { "epoch": 0.16746017396894272, "grad_norm": 0.2774498462677002, "learning_rate": 6.123539232053422e-05, "loss": 0.7985, "num_input_tokens_seen": 5725192, "step": 2084, "train_runtime": 5318.2295, "train_tokens_per_second": 1076.522 }, { "epoch": 0.16754052913879347, "grad_norm": 0.31284478306770325, "learning_rate": 6.11686143572621e-05, "loss": 0.6903, "num_input_tokens_seen": 5727052, "step": 2085, "train_runtime": 5319.9579, "train_tokens_per_second": 1076.522 }, { "epoch": 0.16762088430864422, "grad_norm": 0.3342660367488861, "learning_rate": 6.110183639398999e-05, "loss": 0.9719, "num_input_tokens_seen": 5732260, "step": 2086, "train_runtime": 5323.4947, "train_tokens_per_second": 1076.785 }, { "epoch": 0.16770123947849494, "grad_norm": 0.304916650056839, "learning_rate": 6.103505843071786e-05, "loss": 0.8482, "num_input_tokens_seen": 5734388, "step": 2087, "train_runtime": 5325.3133, "train_tokens_per_second": 1076.817 }, { "epoch": 0.1677815946483457, "grad_norm": 0.32424411177635193, "learning_rate": 6.0968280467445746e-05, "loss": 0.9961, "num_input_tokens_seen": 5737374, "step": 2088, "train_runtime": 5327.6219, "train_tokens_per_second": 1076.911 }, { "epoch": 0.16786194981819644, "grad_norm": 0.4448409378528595, "learning_rate": 6.0901502504173626e-05, "loss": 1.0527, "num_input_tokens_seen": 5739696, "step": 2089, "train_runtime": 5329.524, "train_tokens_per_second": 1076.962 }, { "epoch": 0.16794230498804716, "grad_norm": 0.3010452091693878, "learning_rate": 6.083472454090151e-05, "loss": 1.08, "num_input_tokens_seen": 5745940, "step": 2090, "train_runtime": 5333.6509, "train_tokens_per_second": 1077.3 }, { "epoch": 0.1680226601578979, "grad_norm": 0.3194243907928467, "learning_rate": 6.0767946577629386e-05, "loss": 0.8631, "num_input_tokens_seen": 5747926, "step": 2091, "train_runtime": 5335.4773, "train_tokens_per_second": 1077.303 }, { "epoch": 0.16810301532774866, "grad_norm": 0.33902600407600403, "learning_rate": 6.070116861435726e-05, "loss": 1.2106, "num_input_tokens_seen": 5752358, "step": 2092, "train_runtime": 5338.5443, "train_tokens_per_second": 1077.514 }, { "epoch": 0.16818337049759938, "grad_norm": 0.31348052620887756, "learning_rate": 6.0634390651085146e-05, "loss": 1.0063, "num_input_tokens_seen": 5755212, "step": 2093, "train_runtime": 5340.715, "train_tokens_per_second": 1077.611 }, { "epoch": 0.16826372566745013, "grad_norm": 0.3678327798843384, "learning_rate": 6.0567612687813026e-05, "loss": 1.0293, "num_input_tokens_seen": 5759412, "step": 2094, "train_runtime": 5343.8144, "train_tokens_per_second": 1077.772 }, { "epoch": 0.16834408083730087, "grad_norm": 0.25327804684638977, "learning_rate": 6.05008347245409e-05, "loss": 0.8533, "num_input_tokens_seen": 5762774, "step": 2095, "train_runtime": 5346.213, "train_tokens_per_second": 1077.917 }, { "epoch": 0.16842443600715162, "grad_norm": 0.31719061732292175, "learning_rate": 6.0434056761268785e-05, "loss": 1.2534, "num_input_tokens_seen": 5766262, "step": 2096, "train_runtime": 5348.7901, "train_tokens_per_second": 1078.05 }, { "epoch": 0.16850479117700234, "grad_norm": 0.28992027044296265, "learning_rate": 6.0367278797996665e-05, "loss": 0.869, "num_input_tokens_seen": 5770454, "step": 2097, "train_runtime": 5351.8107, "train_tokens_per_second": 1078.225 }, { "epoch": 0.1685851463468531, "grad_norm": 0.28021690249443054, "learning_rate": 6.030050083472455e-05, "loss": 1.0398, "num_input_tokens_seen": 5774530, "step": 2098, "train_runtime": 5354.7263, "train_tokens_per_second": 1078.399 }, { "epoch": 0.16866550151670384, "grad_norm": 0.34704574942588806, "learning_rate": 6.0233722871452425e-05, "loss": 0.8232, "num_input_tokens_seen": 5777106, "step": 2099, "train_runtime": 5356.7587, "train_tokens_per_second": 1078.47 }, { "epoch": 0.16874585668655456, "grad_norm": 0.35061630606651306, "learning_rate": 6.01669449081803e-05, "loss": 0.9711, "num_input_tokens_seen": 5779562, "step": 2100, "train_runtime": 5358.8311, "train_tokens_per_second": 1078.512 }, { "epoch": 0.16874585668655456, "eval_loss": 0.9555262327194214, "eval_runtime": 91.7902, "eval_samples_per_second": 10.829, "eval_steps_per_second": 5.415, "num_input_tokens_seen": 5779562, "step": 2100 }, { "epoch": 0.1688262118564053, "grad_norm": 0.29205822944641113, "learning_rate": 6.0100166944908185e-05, "loss": 1.0588, "num_input_tokens_seen": 5782154, "step": 2101, "train_runtime": 5454.7148, "train_tokens_per_second": 1060.029 }, { "epoch": 0.16890656702625606, "grad_norm": 0.37343764305114746, "learning_rate": 6.0033388981636065e-05, "loss": 1.1664, "num_input_tokens_seen": 5784936, "step": 2102, "train_runtime": 5456.8828, "train_tokens_per_second": 1060.117 }, { "epoch": 0.16898692219610678, "grad_norm": 0.2603963613510132, "learning_rate": 5.996661101836394e-05, "loss": 1.057, "num_input_tokens_seen": 5788276, "step": 2103, "train_runtime": 5459.425, "train_tokens_per_second": 1060.235 }, { "epoch": 0.16906727736595753, "grad_norm": 0.3672252297401428, "learning_rate": 5.9899833055091825e-05, "loss": 1.218, "num_input_tokens_seen": 5790588, "step": 2104, "train_runtime": 5461.4335, "train_tokens_per_second": 1060.269 }, { "epoch": 0.16914763253580828, "grad_norm": 0.3165772557258606, "learning_rate": 5.98330550918197e-05, "loss": 0.7407, "num_input_tokens_seen": 5793890, "step": 2105, "train_runtime": 5463.9333, "train_tokens_per_second": 1060.388 }, { "epoch": 0.169227987705659, "grad_norm": 0.3723558485507965, "learning_rate": 5.9766277128547585e-05, "loss": 1.043, "num_input_tokens_seen": 5796290, "step": 2106, "train_runtime": 5466.069, "train_tokens_per_second": 1060.413 }, { "epoch": 0.16930834287550975, "grad_norm": 0.3076302111148834, "learning_rate": 5.9699499165275465e-05, "loss": 0.9268, "num_input_tokens_seen": 5798656, "step": 2107, "train_runtime": 5468.0054, "train_tokens_per_second": 1060.47 }, { "epoch": 0.1693886980453605, "grad_norm": 0.3354271352291107, "learning_rate": 5.963272120200334e-05, "loss": 1.1592, "num_input_tokens_seen": 5801386, "step": 2108, "train_runtime": 5470.2001, "train_tokens_per_second": 1060.544 }, { "epoch": 0.16946905321521125, "grad_norm": 0.2791424095630646, "learning_rate": 5.9565943238731224e-05, "loss": 0.9955, "num_input_tokens_seen": 5803808, "step": 2109, "train_runtime": 5472.253, "train_tokens_per_second": 1060.588 }, { "epoch": 0.16954940838506197, "grad_norm": 0.3554924726486206, "learning_rate": 5.9499165275459104e-05, "loss": 0.9301, "num_input_tokens_seen": 5805480, "step": 2110, "train_runtime": 5473.88, "train_tokens_per_second": 1060.579 }, { "epoch": 0.16962976355491272, "grad_norm": 0.36179855465888977, "learning_rate": 5.943238731218698e-05, "loss": 1.238, "num_input_tokens_seen": 5806822, "step": 2111, "train_runtime": 5475.4525, "train_tokens_per_second": 1060.519 }, { "epoch": 0.16971011872476346, "grad_norm": 0.33809080719947815, "learning_rate": 5.9365609348914864e-05, "loss": 0.9749, "num_input_tokens_seen": 5809482, "step": 2112, "train_runtime": 5477.6398, "train_tokens_per_second": 1060.581 }, { "epoch": 0.16979047389461419, "grad_norm": 0.35085058212280273, "learning_rate": 5.929883138564274e-05, "loss": 0.9903, "num_input_tokens_seen": 5812106, "step": 2113, "train_runtime": 5479.785, "train_tokens_per_second": 1060.645 }, { "epoch": 0.16987082906446493, "grad_norm": 0.5488579869270325, "learning_rate": 5.9232053422370624e-05, "loss": 0.9423, "num_input_tokens_seen": 5814802, "step": 2114, "train_runtime": 5481.9787, "train_tokens_per_second": 1060.712 }, { "epoch": 0.16995118423431568, "grad_norm": 0.250041127204895, "learning_rate": 5.9165275459098504e-05, "loss": 0.9151, "num_input_tokens_seen": 5817138, "step": 2115, "train_runtime": 5483.8562, "train_tokens_per_second": 1060.775 }, { "epoch": 0.1700315394041664, "grad_norm": 0.2918633818626404, "learning_rate": 5.909849749582638e-05, "loss": 0.8644, "num_input_tokens_seen": 5821178, "step": 2116, "train_runtime": 5486.6776, "train_tokens_per_second": 1060.966 }, { "epoch": 0.17011189457401715, "grad_norm": 0.3103772699832916, "learning_rate": 5.9031719532554264e-05, "loss": 0.7843, "num_input_tokens_seen": 5823280, "step": 2117, "train_runtime": 5488.652, "train_tokens_per_second": 1060.967 }, { "epoch": 0.1701922497438679, "grad_norm": 0.4383689761161804, "learning_rate": 5.896494156928214e-05, "loss": 0.9798, "num_input_tokens_seen": 5827230, "step": 2118, "train_runtime": 5491.5274, "train_tokens_per_second": 1061.131 }, { "epoch": 0.17027260491371862, "grad_norm": 0.31260019540786743, "learning_rate": 5.889816360601002e-05, "loss": 0.9507, "num_input_tokens_seen": 5829018, "step": 2119, "train_runtime": 5493.187, "train_tokens_per_second": 1061.136 }, { "epoch": 0.17035296008356937, "grad_norm": 0.3282405734062195, "learning_rate": 5.8831385642737904e-05, "loss": 0.7941, "num_input_tokens_seen": 5831650, "step": 2120, "train_runtime": 5495.2362, "train_tokens_per_second": 1061.219 }, { "epoch": 0.17043331525342012, "grad_norm": 0.4777829647064209, "learning_rate": 5.876460767946578e-05, "loss": 1.209, "num_input_tokens_seen": 5833540, "step": 2121, "train_runtime": 5497.0435, "train_tokens_per_second": 1061.214 }, { "epoch": 0.17051367042327087, "grad_norm": 0.2787031829357147, "learning_rate": 5.8697829716193664e-05, "loss": 1.0741, "num_input_tokens_seen": 5836860, "step": 2122, "train_runtime": 5499.5386, "train_tokens_per_second": 1061.336 }, { "epoch": 0.1705940255931216, "grad_norm": 0.25041425228118896, "learning_rate": 5.863105175292154e-05, "loss": 0.5899, "num_input_tokens_seen": 5839532, "step": 2123, "train_runtime": 5501.8578, "train_tokens_per_second": 1061.375 }, { "epoch": 0.17067438076297234, "grad_norm": 0.27655819058418274, "learning_rate": 5.856427378964942e-05, "loss": 0.8819, "num_input_tokens_seen": 5842316, "step": 2124, "train_runtime": 5504.0998, "train_tokens_per_second": 1061.448 }, { "epoch": 0.1707547359328231, "grad_norm": 0.2906401753425598, "learning_rate": 5.84974958263773e-05, "loss": 0.7467, "num_input_tokens_seen": 5845314, "step": 2125, "train_runtime": 5506.4001, "train_tokens_per_second": 1061.549 }, { "epoch": 0.1708350911026738, "grad_norm": 0.3474268615245819, "learning_rate": 5.8430717863105176e-05, "loss": 1.0808, "num_input_tokens_seen": 5849972, "step": 2126, "train_runtime": 5509.7259, "train_tokens_per_second": 1061.754 }, { "epoch": 0.17091544627252456, "grad_norm": 0.2856059968471527, "learning_rate": 5.8363939899833056e-05, "loss": 0.7916, "num_input_tokens_seen": 5852764, "step": 2127, "train_runtime": 5511.945, "train_tokens_per_second": 1061.833 }, { "epoch": 0.1709958014423753, "grad_norm": 0.3286946713924408, "learning_rate": 5.829716193656094e-05, "loss": 1.1438, "num_input_tokens_seen": 5856044, "step": 2128, "train_runtime": 5514.4225, "train_tokens_per_second": 1061.951 }, { "epoch": 0.17107615661222603, "grad_norm": 0.24851734936237335, "learning_rate": 5.8230383973288816e-05, "loss": 0.8662, "num_input_tokens_seen": 5859522, "step": 2129, "train_runtime": 5516.9343, "train_tokens_per_second": 1062.097 }, { "epoch": 0.17115651178207678, "grad_norm": 0.3044750392436981, "learning_rate": 5.81636060100167e-05, "loss": 0.8745, "num_input_tokens_seen": 5861638, "step": 2130, "train_runtime": 5518.7387, "train_tokens_per_second": 1062.134 }, { "epoch": 0.17123686695192752, "grad_norm": 0.33549076318740845, "learning_rate": 5.8096828046744576e-05, "loss": 0.9702, "num_input_tokens_seen": 5864052, "step": 2131, "train_runtime": 5522.7266, "train_tokens_per_second": 1061.804 }, { "epoch": 0.17131722212177827, "grad_norm": 0.3433608412742615, "learning_rate": 5.8030050083472456e-05, "loss": 1.2358, "num_input_tokens_seen": 5867970, "step": 2132, "train_runtime": 5525.467, "train_tokens_per_second": 1061.986 }, { "epoch": 0.171397577291629, "grad_norm": 0.31587350368499756, "learning_rate": 5.796327212020034e-05, "loss": 1.0999, "num_input_tokens_seen": 5871172, "step": 2133, "train_runtime": 5527.9147, "train_tokens_per_second": 1062.095 }, { "epoch": 0.17147793246147974, "grad_norm": 0.29557958245277405, "learning_rate": 5.7896494156928216e-05, "loss": 0.9023, "num_input_tokens_seen": 5874522, "step": 2134, "train_runtime": 5530.494, "train_tokens_per_second": 1062.206 }, { "epoch": 0.1715582876313305, "grad_norm": 0.3485921621322632, "learning_rate": 5.782971619365609e-05, "loss": 1.4575, "num_input_tokens_seen": 5877366, "step": 2135, "train_runtime": 5532.6758, "train_tokens_per_second": 1062.301 }, { "epoch": 0.1716386428011812, "grad_norm": 0.328443706035614, "learning_rate": 5.7762938230383976e-05, "loss": 0.9593, "num_input_tokens_seen": 5879546, "step": 2136, "train_runtime": 5534.6312, "train_tokens_per_second": 1062.319 }, { "epoch": 0.17171899797103196, "grad_norm": 0.30363771319389343, "learning_rate": 5.7696160267111856e-05, "loss": 0.9198, "num_input_tokens_seen": 5883364, "step": 2137, "train_runtime": 5537.4513, "train_tokens_per_second": 1062.468 }, { "epoch": 0.1717993531408827, "grad_norm": 0.34566518664360046, "learning_rate": 5.762938230383974e-05, "loss": 0.9268, "num_input_tokens_seen": 5886500, "step": 2138, "train_runtime": 5539.9076, "train_tokens_per_second": 1062.563 }, { "epoch": 0.17187970831073343, "grad_norm": 0.26693105697631836, "learning_rate": 5.7562604340567616e-05, "loss": 0.6212, "num_input_tokens_seen": 5888414, "step": 2139, "train_runtime": 5541.6587, "train_tokens_per_second": 1062.572 }, { "epoch": 0.17196006348058418, "grad_norm": 0.22253353893756866, "learning_rate": 5.749582637729549e-05, "loss": 0.5865, "num_input_tokens_seen": 5891498, "step": 2140, "train_runtime": 5544.0344, "train_tokens_per_second": 1062.673 }, { "epoch": 0.17204041865043493, "grad_norm": 0.3196808099746704, "learning_rate": 5.7429048414023375e-05, "loss": 1.2904, "num_input_tokens_seen": 5895136, "step": 2141, "train_runtime": 5546.7029, "train_tokens_per_second": 1062.818 }, { "epoch": 0.17212077382028565, "grad_norm": 0.2977009415626526, "learning_rate": 5.7362270450751255e-05, "loss": 1.0414, "num_input_tokens_seen": 5896872, "step": 2142, "train_runtime": 5548.3192, "train_tokens_per_second": 1062.821 }, { "epoch": 0.1722011289901364, "grad_norm": 0.603030264377594, "learning_rate": 5.729549248747913e-05, "loss": 1.3422, "num_input_tokens_seen": 5899618, "step": 2143, "train_runtime": 5550.4526, "train_tokens_per_second": 1062.908 }, { "epoch": 0.17228148415998715, "grad_norm": 0.3160606324672699, "learning_rate": 5.7228714524207015e-05, "loss": 1.1736, "num_input_tokens_seen": 5902676, "step": 2144, "train_runtime": 5552.8535, "train_tokens_per_second": 1062.999 }, { "epoch": 0.1723618393298379, "grad_norm": 0.33425402641296387, "learning_rate": 5.7161936560934895e-05, "loss": 1.0781, "num_input_tokens_seen": 5904826, "step": 2145, "train_runtime": 5554.7041, "train_tokens_per_second": 1063.032 }, { "epoch": 0.17244219449968862, "grad_norm": 0.3198067843914032, "learning_rate": 5.709515859766278e-05, "loss": 1.0518, "num_input_tokens_seen": 5911678, "step": 2146, "train_runtime": 5559.2346, "train_tokens_per_second": 1063.398 }, { "epoch": 0.17252254966953937, "grad_norm": 0.3363427221775055, "learning_rate": 5.7028380634390655e-05, "loss": 0.6258, "num_input_tokens_seen": 5914912, "step": 2147, "train_runtime": 5561.6859, "train_tokens_per_second": 1063.511 }, { "epoch": 0.17260290483939011, "grad_norm": 0.40328025817871094, "learning_rate": 5.696160267111853e-05, "loss": 0.8357, "num_input_tokens_seen": 5918354, "step": 2148, "train_runtime": 5564.2906, "train_tokens_per_second": 1063.631 }, { "epoch": 0.17268326000924084, "grad_norm": 0.2903386354446411, "learning_rate": 5.6894824707846415e-05, "loss": 0.9364, "num_input_tokens_seen": 5921040, "step": 2149, "train_runtime": 5566.3747, "train_tokens_per_second": 1063.716 }, { "epoch": 0.17276361517909158, "grad_norm": 0.31180712580680847, "learning_rate": 5.6828046744574295e-05, "loss": 0.9142, "num_input_tokens_seen": 5923840, "step": 2150, "train_runtime": 5568.6209, "train_tokens_per_second": 1063.789 }, { "epoch": 0.17284397034894233, "grad_norm": 0.3400718569755554, "learning_rate": 5.676126878130217e-05, "loss": 0.7969, "num_input_tokens_seen": 5926654, "step": 2151, "train_runtime": 5570.7788, "train_tokens_per_second": 1063.882 }, { "epoch": 0.17292432551879305, "grad_norm": 0.32087886333465576, "learning_rate": 5.6694490818030055e-05, "loss": 1.1123, "num_input_tokens_seen": 5933130, "step": 2152, "train_runtime": 5575.1339, "train_tokens_per_second": 1064.213 }, { "epoch": 0.1730046806886438, "grad_norm": 0.26884207129478455, "learning_rate": 5.662771285475793e-05, "loss": 0.908, "num_input_tokens_seen": 5937852, "step": 2153, "train_runtime": 5578.5348, "train_tokens_per_second": 1064.411 }, { "epoch": 0.17308503585849455, "grad_norm": 0.37048181891441345, "learning_rate": 5.6560934891485815e-05, "loss": 0.7005, "num_input_tokens_seen": 5940014, "step": 2154, "train_runtime": 5580.3666, "train_tokens_per_second": 1064.449 }, { "epoch": 0.17316539102834527, "grad_norm": 0.3180694580078125, "learning_rate": 5.6494156928213694e-05, "loss": 0.9271, "num_input_tokens_seen": 5943994, "step": 2155, "train_runtime": 5583.3319, "train_tokens_per_second": 1064.596 }, { "epoch": 0.17324574619819602, "grad_norm": 0.2703879475593567, "learning_rate": 5.642737896494157e-05, "loss": 0.6581, "num_input_tokens_seen": 5947668, "step": 2156, "train_runtime": 5585.9431, "train_tokens_per_second": 1064.756 }, { "epoch": 0.17332610136804677, "grad_norm": 0.2960408329963684, "learning_rate": 5.6360601001669454e-05, "loss": 0.9948, "num_input_tokens_seen": 5949860, "step": 2157, "train_runtime": 5587.8377, "train_tokens_per_second": 1064.788 }, { "epoch": 0.17340645653789752, "grad_norm": 0.371141642332077, "learning_rate": 5.629382303839733e-05, "loss": 1.0421, "num_input_tokens_seen": 5952540, "step": 2158, "train_runtime": 5590.0524, "train_tokens_per_second": 1064.845 }, { "epoch": 0.17348681170774824, "grad_norm": 0.4357776343822479, "learning_rate": 5.622704507512521e-05, "loss": 0.8462, "num_input_tokens_seen": 5954938, "step": 2159, "train_runtime": 5592.0527, "train_tokens_per_second": 1064.893 }, { "epoch": 0.173567166877599, "grad_norm": 0.356094092130661, "learning_rate": 5.6160267111853094e-05, "loss": 1.0046, "num_input_tokens_seen": 5956392, "step": 2160, "train_runtime": 5593.652, "train_tokens_per_second": 1064.849 }, { "epoch": 0.17364752204744974, "grad_norm": 0.23461705446243286, "learning_rate": 5.609348914858097e-05, "loss": 0.759, "num_input_tokens_seen": 5959500, "step": 2161, "train_runtime": 5598.6446, "train_tokens_per_second": 1064.454 }, { "epoch": 0.17372787721730046, "grad_norm": 0.31692934036254883, "learning_rate": 5.6026711185308854e-05, "loss": 1.0124, "num_input_tokens_seen": 5961598, "step": 2162, "train_runtime": 5600.4215, "train_tokens_per_second": 1064.491 }, { "epoch": 0.1738082323871512, "grad_norm": 0.40736809372901917, "learning_rate": 5.5959933222036734e-05, "loss": 0.9999, "num_input_tokens_seen": 5963460, "step": 2163, "train_runtime": 5602.1499, "train_tokens_per_second": 1064.495 }, { "epoch": 0.17388858755700196, "grad_norm": 0.2923264801502228, "learning_rate": 5.589315525876461e-05, "loss": 0.8445, "num_input_tokens_seen": 5965208, "step": 2164, "train_runtime": 5603.87, "train_tokens_per_second": 1064.48 }, { "epoch": 0.17396894272685268, "grad_norm": 0.31024986505508423, "learning_rate": 5.5826377295492494e-05, "loss": 1.2309, "num_input_tokens_seen": 5968326, "step": 2165, "train_runtime": 5606.2184, "train_tokens_per_second": 1064.59 }, { "epoch": 0.17404929789670343, "grad_norm": 0.382074773311615, "learning_rate": 5.575959933222037e-05, "loss": 1.0833, "num_input_tokens_seen": 5970660, "step": 2166, "train_runtime": 5608.2012, "train_tokens_per_second": 1064.63 }, { "epoch": 0.17412965306655417, "grad_norm": 0.32277077436447144, "learning_rate": 5.569282136894825e-05, "loss": 0.8775, "num_input_tokens_seen": 5972126, "step": 2167, "train_runtime": 5609.7733, "train_tokens_per_second": 1064.593 }, { "epoch": 0.17421000823640492, "grad_norm": 0.3061690330505371, "learning_rate": 5.5626043405676134e-05, "loss": 0.7693, "num_input_tokens_seen": 5973952, "step": 2168, "train_runtime": 5611.6301, "train_tokens_per_second": 1064.566 }, { "epoch": 0.17429036340625564, "grad_norm": 0.4055381119251251, "learning_rate": 5.555926544240401e-05, "loss": 1.2553, "num_input_tokens_seen": 5975970, "step": 2169, "train_runtime": 5613.4791, "train_tokens_per_second": 1064.575 }, { "epoch": 0.1743707185761064, "grad_norm": 0.38947683572769165, "learning_rate": 5.5492487479131893e-05, "loss": 1.0117, "num_input_tokens_seen": 5978158, "step": 2170, "train_runtime": 5615.4511, "train_tokens_per_second": 1064.591 }, { "epoch": 0.17445107374595714, "grad_norm": 0.2549003064632416, "learning_rate": 5.5425709515859767e-05, "loss": 0.5143, "num_input_tokens_seen": 5980528, "step": 2171, "train_runtime": 5617.437, "train_tokens_per_second": 1064.636 }, { "epoch": 0.17453142891580786, "grad_norm": 0.3197709321975708, "learning_rate": 5.5358931552587646e-05, "loss": 0.8939, "num_input_tokens_seen": 5983044, "step": 2172, "train_runtime": 5619.566, "train_tokens_per_second": 1064.681 }, { "epoch": 0.1746117840856586, "grad_norm": 0.32079893350601196, "learning_rate": 5.529215358931553e-05, "loss": 1.0111, "num_input_tokens_seen": 5986838, "step": 2173, "train_runtime": 5622.3213, "train_tokens_per_second": 1064.834 }, { "epoch": 0.17469213925550936, "grad_norm": 0.3871116638183594, "learning_rate": 5.5225375626043406e-05, "loss": 1.0913, "num_input_tokens_seen": 5988310, "step": 2174, "train_runtime": 5623.8987, "train_tokens_per_second": 1064.797 }, { "epoch": 0.17477249442536008, "grad_norm": 0.39901208877563477, "learning_rate": 5.5158597662771286e-05, "loss": 1.3411, "num_input_tokens_seen": 5990742, "step": 2175, "train_runtime": 5625.9333, "train_tokens_per_second": 1064.844 }, { "epoch": 0.17485284959521083, "grad_norm": 0.2963050305843353, "learning_rate": 5.509181969949917e-05, "loss": 0.8994, "num_input_tokens_seen": 5993482, "step": 2176, "train_runtime": 5628.0454, "train_tokens_per_second": 1064.931 }, { "epoch": 0.17493320476506158, "grad_norm": 0.3584640324115753, "learning_rate": 5.5025041736227046e-05, "loss": 1.1943, "num_input_tokens_seen": 5995374, "step": 2177, "train_runtime": 5629.8282, "train_tokens_per_second": 1064.93 }, { "epoch": 0.1750135599349123, "grad_norm": 0.30105990171432495, "learning_rate": 5.495826377295493e-05, "loss": 0.9561, "num_input_tokens_seen": 5998136, "step": 2178, "train_runtime": 5631.9653, "train_tokens_per_second": 1065.017 }, { "epoch": 0.17509391510476305, "grad_norm": 0.3401104509830475, "learning_rate": 5.4891485809682806e-05, "loss": 1.2485, "num_input_tokens_seen": 6000356, "step": 2179, "train_runtime": 5633.8603, "train_tokens_per_second": 1065.052 }, { "epoch": 0.1751742702746138, "grad_norm": 0.3163185119628906, "learning_rate": 5.4824707846410686e-05, "loss": 1.0947, "num_input_tokens_seen": 6003166, "step": 2180, "train_runtime": 5636.1367, "train_tokens_per_second": 1065.121 }, { "epoch": 0.17525462544446455, "grad_norm": 0.3311319053173065, "learning_rate": 5.475792988313857e-05, "loss": 1.0749, "num_input_tokens_seen": 6005678, "step": 2181, "train_runtime": 5638.2072, "train_tokens_per_second": 1065.175 }, { "epoch": 0.17533498061431527, "grad_norm": 0.30566927790641785, "learning_rate": 5.4691151919866446e-05, "loss": 1.0406, "num_input_tokens_seen": 6009646, "step": 2182, "train_runtime": 5641.1383, "train_tokens_per_second": 1065.325 }, { "epoch": 0.17541533578416602, "grad_norm": 0.2625481188297272, "learning_rate": 5.462437395659432e-05, "loss": 0.8298, "num_input_tokens_seen": 6013836, "step": 2183, "train_runtime": 5644.0808, "train_tokens_per_second": 1065.512 }, { "epoch": 0.17549569095401676, "grad_norm": 0.29297178983688354, "learning_rate": 5.4557595993322206e-05, "loss": 0.9246, "num_input_tokens_seen": 6016636, "step": 2184, "train_runtime": 5646.2712, "train_tokens_per_second": 1065.595 }, { "epoch": 0.17557604612386749, "grad_norm": 0.2942541837692261, "learning_rate": 5.4490818030050086e-05, "loss": 0.9006, "num_input_tokens_seen": 6021172, "step": 2185, "train_runtime": 5649.4554, "train_tokens_per_second": 1065.797 }, { "epoch": 0.17565640129371823, "grad_norm": 0.33823662996292114, "learning_rate": 5.442404006677797e-05, "loss": 1.0208, "num_input_tokens_seen": 6024588, "step": 2186, "train_runtime": 5651.9796, "train_tokens_per_second": 1065.925 }, { "epoch": 0.17573675646356898, "grad_norm": 0.3025861382484436, "learning_rate": 5.4357262103505845e-05, "loss": 0.7754, "num_input_tokens_seen": 6026486, "step": 2187, "train_runtime": 5653.716, "train_tokens_per_second": 1065.934 }, { "epoch": 0.1758171116334197, "grad_norm": 0.34149742126464844, "learning_rate": 5.429048414023372e-05, "loss": 0.8844, "num_input_tokens_seen": 6028020, "step": 2188, "train_runtime": 5655.3211, "train_tokens_per_second": 1065.902 }, { "epoch": 0.17589746680327045, "grad_norm": 0.30632808804512024, "learning_rate": 5.4223706176961605e-05, "loss": 0.9067, "num_input_tokens_seen": 6031950, "step": 2189, "train_runtime": 5658.2195, "train_tokens_per_second": 1066.051 }, { "epoch": 0.1759778219731212, "grad_norm": 0.35990339517593384, "learning_rate": 5.4156928213689485e-05, "loss": 0.8391, "num_input_tokens_seen": 6033782, "step": 2190, "train_runtime": 5660.0219, "train_tokens_per_second": 1066.035 }, { "epoch": 0.17605817714297192, "grad_norm": 0.32285207509994507, "learning_rate": 5.409015025041736e-05, "loss": 1.0469, "num_input_tokens_seen": 6035710, "step": 2191, "train_runtime": 5663.5833, "train_tokens_per_second": 1065.705 }, { "epoch": 0.17613853231282267, "grad_norm": 0.3809260129928589, "learning_rate": 5.4023372287145245e-05, "loss": 1.1226, "num_input_tokens_seen": 6037460, "step": 2192, "train_runtime": 5665.2713, "train_tokens_per_second": 1065.697 }, { "epoch": 0.17621888748267342, "grad_norm": 0.28848832845687866, "learning_rate": 5.3956594323873125e-05, "loss": 0.912, "num_input_tokens_seen": 6040066, "step": 2193, "train_runtime": 5667.4408, "train_tokens_per_second": 1065.748 }, { "epoch": 0.17629924265252417, "grad_norm": 0.2915174961090088, "learning_rate": 5.388981636060101e-05, "loss": 0.7903, "num_input_tokens_seen": 6042672, "step": 2194, "train_runtime": 5669.5079, "train_tokens_per_second": 1065.819 }, { "epoch": 0.1763795978223749, "grad_norm": 0.25477486848831177, "learning_rate": 5.3823038397328885e-05, "loss": 0.7922, "num_input_tokens_seen": 6044656, "step": 2195, "train_runtime": 5671.3154, "train_tokens_per_second": 1065.83 }, { "epoch": 0.17645995299222564, "grad_norm": 0.3283901810646057, "learning_rate": 5.375626043405676e-05, "loss": 0.9957, "num_input_tokens_seen": 6047492, "step": 2196, "train_runtime": 5673.5133, "train_tokens_per_second": 1065.917 }, { "epoch": 0.1765403081620764, "grad_norm": 0.33062899112701416, "learning_rate": 5.3689482470784645e-05, "loss": 0.9998, "num_input_tokens_seen": 6049486, "step": 2197, "train_runtime": 5675.3365, "train_tokens_per_second": 1065.926 }, { "epoch": 0.1766206633319271, "grad_norm": 0.27277809381484985, "learning_rate": 5.3622704507512525e-05, "loss": 1.0771, "num_input_tokens_seen": 6054772, "step": 2198, "train_runtime": 5678.9557, "train_tokens_per_second": 1066.177 }, { "epoch": 0.17670101850177786, "grad_norm": 0.331997811794281, "learning_rate": 5.35559265442404e-05, "loss": 1.0936, "num_input_tokens_seen": 6057470, "step": 2199, "train_runtime": 5681.2069, "train_tokens_per_second": 1066.229 }, { "epoch": 0.1767813736716286, "grad_norm": 0.30002301931381226, "learning_rate": 5.3489148580968285e-05, "loss": 0.728, "num_input_tokens_seen": 6059150, "step": 2200, "train_runtime": 5682.8509, "train_tokens_per_second": 1066.217 }, { "epoch": 0.17686172884147933, "grad_norm": 0.3315964341163635, "learning_rate": 5.342237061769616e-05, "loss": 0.7822, "num_input_tokens_seen": 6065192, "step": 2201, "train_runtime": 5687.092, "train_tokens_per_second": 1066.484 }, { "epoch": 0.17694208401133008, "grad_norm": 0.3553049862384796, "learning_rate": 5.3355592654424044e-05, "loss": 1.2104, "num_input_tokens_seen": 6067588, "step": 2202, "train_runtime": 5689.2827, "train_tokens_per_second": 1066.494 }, { "epoch": 0.17702243918118082, "grad_norm": 0.27361515164375305, "learning_rate": 5.3288814691151924e-05, "loss": 1.0252, "num_input_tokens_seen": 6070078, "step": 2203, "train_runtime": 5691.3186, "train_tokens_per_second": 1066.55 }, { "epoch": 0.17710279435103157, "grad_norm": 0.30246469378471375, "learning_rate": 5.32220367278798e-05, "loss": 1.1775, "num_input_tokens_seen": 6072462, "step": 2204, "train_runtime": 5693.2606, "train_tokens_per_second": 1066.605 }, { "epoch": 0.1771831495208823, "grad_norm": 0.2991829216480255, "learning_rate": 5.3155258764607684e-05, "loss": 0.9873, "num_input_tokens_seen": 6074842, "step": 2205, "train_runtime": 5695.2927, "train_tokens_per_second": 1066.643 }, { "epoch": 0.17726350469073304, "grad_norm": 0.3418027460575104, "learning_rate": 5.308848080133556e-05, "loss": 0.8657, "num_input_tokens_seen": 6076696, "step": 2206, "train_runtime": 5697.1007, "train_tokens_per_second": 1066.63 }, { "epoch": 0.1773438598605838, "grad_norm": 0.3597825765609741, "learning_rate": 5.302170283806344e-05, "loss": 1.199, "num_input_tokens_seen": 6079590, "step": 2207, "train_runtime": 5699.3843, "train_tokens_per_second": 1066.71 }, { "epoch": 0.1774242150304345, "grad_norm": 0.29662024974823, "learning_rate": 5.2954924874791324e-05, "loss": 0.8954, "num_input_tokens_seen": 6083138, "step": 2208, "train_runtime": 5702.1327, "train_tokens_per_second": 1066.818 }, { "epoch": 0.17750457020028526, "grad_norm": 0.3632822036743164, "learning_rate": 5.28881469115192e-05, "loss": 0.9905, "num_input_tokens_seen": 6086604, "step": 2209, "train_runtime": 5704.691, "train_tokens_per_second": 1066.947 }, { "epoch": 0.177584925370136, "grad_norm": 0.4715336263179779, "learning_rate": 5.2821368948247084e-05, "loss": 0.8444, "num_input_tokens_seen": 6089566, "step": 2210, "train_runtime": 5706.9798, "train_tokens_per_second": 1067.038 }, { "epoch": 0.17766528053998673, "grad_norm": 0.3637067973613739, "learning_rate": 5.2754590984974964e-05, "loss": 1.1719, "num_input_tokens_seen": 6091198, "step": 2211, "train_runtime": 5708.601, "train_tokens_per_second": 1067.021 }, { "epoch": 0.17774563570983748, "grad_norm": 0.3065914213657379, "learning_rate": 5.268781302170284e-05, "loss": 1.0216, "num_input_tokens_seen": 6093536, "step": 2212, "train_runtime": 5710.6367, "train_tokens_per_second": 1067.05 }, { "epoch": 0.17782599087968823, "grad_norm": 0.28996747732162476, "learning_rate": 5.2621035058430724e-05, "loss": 1.1535, "num_input_tokens_seen": 6096170, "step": 2213, "train_runtime": 5712.7073, "train_tokens_per_second": 1067.125 }, { "epoch": 0.17790634604953895, "grad_norm": 0.33675292134284973, "learning_rate": 5.25542570951586e-05, "loss": 0.9864, "num_input_tokens_seen": 6098406, "step": 2214, "train_runtime": 5714.6553, "train_tokens_per_second": 1067.152 }, { "epoch": 0.1779867012193897, "grad_norm": 0.35894355177879333, "learning_rate": 5.248747913188648e-05, "loss": 1.29, "num_input_tokens_seen": 6101070, "step": 2215, "train_runtime": 5716.7987, "train_tokens_per_second": 1067.218 }, { "epoch": 0.17806705638924045, "grad_norm": 0.29682108759880066, "learning_rate": 5.2420701168614363e-05, "loss": 0.9371, "num_input_tokens_seen": 6104104, "step": 2216, "train_runtime": 5719.2471, "train_tokens_per_second": 1067.292 }, { "epoch": 0.1781474115590912, "grad_norm": 0.34291523694992065, "learning_rate": 5.2353923205342237e-05, "loss": 1.1021, "num_input_tokens_seen": 6109426, "step": 2217, "train_runtime": 5722.9345, "train_tokens_per_second": 1067.534 }, { "epoch": 0.17822776672894192, "grad_norm": 0.27323198318481445, "learning_rate": 5.228714524207012e-05, "loss": 1.0301, "num_input_tokens_seen": 6112258, "step": 2218, "train_runtime": 5725.1115, "train_tokens_per_second": 1067.623 }, { "epoch": 0.17830812189879267, "grad_norm": 0.32020869851112366, "learning_rate": 5.2220367278797996e-05, "loss": 1.0896, "num_input_tokens_seen": 6113846, "step": 2219, "train_runtime": 5726.7018, "train_tokens_per_second": 1067.603 }, { "epoch": 0.17838847706864341, "grad_norm": 0.352998286485672, "learning_rate": 5.2153589315525876e-05, "loss": 0.9862, "num_input_tokens_seen": 6116594, "step": 2220, "train_runtime": 5728.9033, "train_tokens_per_second": 1067.673 }, { "epoch": 0.17846883223849414, "grad_norm": 0.3459780514240265, "learning_rate": 5.208681135225376e-05, "loss": 0.9316, "num_input_tokens_seen": 6119074, "step": 2221, "train_runtime": 5733.0229, "train_tokens_per_second": 1067.338 }, { "epoch": 0.17854918740834488, "grad_norm": 0.367080420255661, "learning_rate": 5.2020033388981636e-05, "loss": 0.9275, "num_input_tokens_seen": 6120440, "step": 2222, "train_runtime": 5734.5782, "train_tokens_per_second": 1067.287 }, { "epoch": 0.17862954257819563, "grad_norm": 0.2654534876346588, "learning_rate": 5.195325542570952e-05, "loss": 0.6607, "num_input_tokens_seen": 6122078, "step": 2223, "train_runtime": 5736.2811, "train_tokens_per_second": 1067.256 }, { "epoch": 0.17870989774804635, "grad_norm": 0.2552686929702759, "learning_rate": 5.18864774624374e-05, "loss": 0.8954, "num_input_tokens_seen": 6126014, "step": 2224, "train_runtime": 5739.2236, "train_tokens_per_second": 1067.394 }, { "epoch": 0.1787902529178971, "grad_norm": 0.31892409920692444, "learning_rate": 5.1819699499165276e-05, "loss": 1.163, "num_input_tokens_seen": 6129302, "step": 2225, "train_runtime": 5741.822, "train_tokens_per_second": 1067.484 }, { "epoch": 0.17887060808774785, "grad_norm": 0.31341803073883057, "learning_rate": 5.175292153589316e-05, "loss": 1.2026, "num_input_tokens_seen": 6132292, "step": 2226, "train_runtime": 5744.1113, "train_tokens_per_second": 1067.579 }, { "epoch": 0.17895096325759857, "grad_norm": 0.34947773814201355, "learning_rate": 5.1686143572621036e-05, "loss": 0.9215, "num_input_tokens_seen": 6134406, "step": 2227, "train_runtime": 5746.062, "train_tokens_per_second": 1067.584 }, { "epoch": 0.17903131842744932, "grad_norm": 0.2981410622596741, "learning_rate": 5.1619365609348916e-05, "loss": 0.9967, "num_input_tokens_seen": 6136788, "step": 2228, "train_runtime": 5748.0223, "train_tokens_per_second": 1067.635 }, { "epoch": 0.17911167359730007, "grad_norm": 0.322319895029068, "learning_rate": 5.15525876460768e-05, "loss": 0.9858, "num_input_tokens_seen": 6138824, "step": 2229, "train_runtime": 5749.9562, "train_tokens_per_second": 1067.63 }, { "epoch": 0.17919202876715082, "grad_norm": 0.3060888946056366, "learning_rate": 5.1485809682804676e-05, "loss": 0.9619, "num_input_tokens_seen": 6141296, "step": 2230, "train_runtime": 5752.0445, "train_tokens_per_second": 1067.672 }, { "epoch": 0.17927238393700154, "grad_norm": 0.2686266005039215, "learning_rate": 5.141903171953256e-05, "loss": 0.91, "num_input_tokens_seen": 6143836, "step": 2231, "train_runtime": 5754.1701, "train_tokens_per_second": 1067.719 }, { "epoch": 0.1793527391068523, "grad_norm": 0.3219556212425232, "learning_rate": 5.1352253756260436e-05, "loss": 1.0496, "num_input_tokens_seen": 6145532, "step": 2232, "train_runtime": 5755.8004, "train_tokens_per_second": 1067.711 }, { "epoch": 0.17943309427670304, "grad_norm": 0.30096307396888733, "learning_rate": 5.1285475792988315e-05, "loss": 0.7293, "num_input_tokens_seen": 6147114, "step": 2233, "train_runtime": 5757.4422, "train_tokens_per_second": 1067.681 }, { "epoch": 0.17951344944655376, "grad_norm": 0.42000851035118103, "learning_rate": 5.12186978297162e-05, "loss": 1.2816, "num_input_tokens_seen": 6149128, "step": 2234, "train_runtime": 5759.2989, "train_tokens_per_second": 1067.687 }, { "epoch": 0.1795938046164045, "grad_norm": 0.30302050709724426, "learning_rate": 5.1151919866444075e-05, "loss": 1.0725, "num_input_tokens_seen": 6152618, "step": 2235, "train_runtime": 5761.9761, "train_tokens_per_second": 1067.797 }, { "epoch": 0.17967415978625526, "grad_norm": 0.34265613555908203, "learning_rate": 5.108514190317195e-05, "loss": 1.109, "num_input_tokens_seen": 6155284, "step": 2236, "train_runtime": 5764.1388, "train_tokens_per_second": 1067.858 }, { "epoch": 0.17975451495610598, "grad_norm": 0.3333062529563904, "learning_rate": 5.1018363939899835e-05, "loss": 1.0783, "num_input_tokens_seen": 6157294, "step": 2237, "train_runtime": 5765.9684, "train_tokens_per_second": 1067.868 }, { "epoch": 0.17983487012595673, "grad_norm": 0.29393231868743896, "learning_rate": 5.0951585976627715e-05, "loss": 0.9709, "num_input_tokens_seen": 6160650, "step": 2238, "train_runtime": 5768.4622, "train_tokens_per_second": 1067.988 }, { "epoch": 0.17991522529580747, "grad_norm": 0.35577812790870667, "learning_rate": 5.08848080133556e-05, "loss": 1.0123, "num_input_tokens_seen": 6163518, "step": 2239, "train_runtime": 5770.7793, "train_tokens_per_second": 1068.056 }, { "epoch": 0.17999558046565822, "grad_norm": 0.3715101182460785, "learning_rate": 5.0818030050083475e-05, "loss": 1.0461, "num_input_tokens_seen": 6164740, "step": 2240, "train_runtime": 5772.2902, "train_tokens_per_second": 1067.989 }, { "epoch": 0.18007593563550894, "grad_norm": 0.3006369173526764, "learning_rate": 5.0751252086811355e-05, "loss": 0.9726, "num_input_tokens_seen": 6166876, "step": 2241, "train_runtime": 5774.1876, "train_tokens_per_second": 1068.008 }, { "epoch": 0.1801562908053597, "grad_norm": 0.27124038338661194, "learning_rate": 5.068447412353924e-05, "loss": 1.0184, "num_input_tokens_seen": 6168608, "step": 2242, "train_runtime": 5775.8722, "train_tokens_per_second": 1067.996 }, { "epoch": 0.18023664597521044, "grad_norm": 0.33870163559913635, "learning_rate": 5.0617696160267115e-05, "loss": 1.0748, "num_input_tokens_seen": 6171164, "step": 2243, "train_runtime": 5777.9868, "train_tokens_per_second": 1068.047 }, { "epoch": 0.18031700114506116, "grad_norm": 0.3271868824958801, "learning_rate": 5.055091819699499e-05, "loss": 0.9215, "num_input_tokens_seen": 6173436, "step": 2244, "train_runtime": 5779.9888, "train_tokens_per_second": 1068.071 }, { "epoch": 0.1803973563149119, "grad_norm": 0.3185940682888031, "learning_rate": 5.0484140233722875e-05, "loss": 1.1283, "num_input_tokens_seen": 6175948, "step": 2245, "train_runtime": 5782.0879, "train_tokens_per_second": 1068.117 }, { "epoch": 0.18047771148476266, "grad_norm": 0.3163585364818573, "learning_rate": 5.0417362270450755e-05, "loss": 0.9332, "num_input_tokens_seen": 6178670, "step": 2246, "train_runtime": 5784.2214, "train_tokens_per_second": 1068.194 }, { "epoch": 0.18055806665461338, "grad_norm": 0.3045605719089508, "learning_rate": 5.035058430717864e-05, "loss": 1.5736, "num_input_tokens_seen": 6182328, "step": 2247, "train_runtime": 5786.8281, "train_tokens_per_second": 1068.345 }, { "epoch": 0.18063842182446413, "grad_norm": 0.28818830847740173, "learning_rate": 5.0283806343906514e-05, "loss": 1.2267, "num_input_tokens_seen": 6184828, "step": 2248, "train_runtime": 5788.8769, "train_tokens_per_second": 1068.399 }, { "epoch": 0.18071877699431488, "grad_norm": 0.35958895087242126, "learning_rate": 5.021702838063439e-05, "loss": 0.7491, "num_input_tokens_seen": 6186976, "step": 2249, "train_runtime": 5790.8594, "train_tokens_per_second": 1068.404 }, { "epoch": 0.1807991321641656, "grad_norm": 0.2572154402732849, "learning_rate": 5.0150250417362274e-05, "loss": 0.8362, "num_input_tokens_seen": 6188974, "step": 2250, "train_runtime": 5792.6095, "train_tokens_per_second": 1068.426 }, { "epoch": 0.18087948733401635, "grad_norm": 0.2994706630706787, "learning_rate": 5.0083472454090154e-05, "loss": 1.1099, "num_input_tokens_seen": 6193522, "step": 2251, "train_runtime": 5797.717, "train_tokens_per_second": 1068.269 }, { "epoch": 0.1809598425038671, "grad_norm": 0.2824646234512329, "learning_rate": 5.001669449081803e-05, "loss": 0.7092, "num_input_tokens_seen": 6195504, "step": 2252, "train_runtime": 5799.4813, "train_tokens_per_second": 1068.286 }, { "epoch": 0.18104019767371785, "grad_norm": 0.32443007826805115, "learning_rate": 4.9949916527545914e-05, "loss": 0.8126, "num_input_tokens_seen": 6197450, "step": 2253, "train_runtime": 5801.2977, "train_tokens_per_second": 1068.287 }, { "epoch": 0.18112055284356857, "grad_norm": 0.33935296535491943, "learning_rate": 4.988313856427379e-05, "loss": 0.5973, "num_input_tokens_seen": 6200882, "step": 2254, "train_runtime": 5803.9293, "train_tokens_per_second": 1068.394 }, { "epoch": 0.18120090801341932, "grad_norm": 0.3202540874481201, "learning_rate": 4.9816360601001674e-05, "loss": 0.882, "num_input_tokens_seen": 6203588, "step": 2255, "train_runtime": 5806.1281, "train_tokens_per_second": 1068.455 }, { "epoch": 0.18128126318327006, "grad_norm": 0.3738347589969635, "learning_rate": 4.9749582637729554e-05, "loss": 1.0906, "num_input_tokens_seen": 6204936, "step": 2256, "train_runtime": 5807.6338, "train_tokens_per_second": 1068.41 }, { "epoch": 0.18136161835312078, "grad_norm": 0.3130134642124176, "learning_rate": 4.9682804674457434e-05, "loss": 0.9808, "num_input_tokens_seen": 6207264, "step": 2257, "train_runtime": 5809.6093, "train_tokens_per_second": 1068.448 }, { "epoch": 0.18144197352297153, "grad_norm": 0.35142961144447327, "learning_rate": 4.961602671118531e-05, "loss": 0.8468, "num_input_tokens_seen": 6208718, "step": 2258, "train_runtime": 5811.2405, "train_tokens_per_second": 1068.398 }, { "epoch": 0.18152232869282228, "grad_norm": 0.3048270344734192, "learning_rate": 4.9549248747913194e-05, "loss": 0.6867, "num_input_tokens_seen": 6210984, "step": 2259, "train_runtime": 5813.1614, "train_tokens_per_second": 1068.435 }, { "epoch": 0.181602683862673, "grad_norm": 0.2752719521522522, "learning_rate": 4.9482470784641074e-05, "loss": 0.9185, "num_input_tokens_seen": 6213820, "step": 2260, "train_runtime": 5815.355, "train_tokens_per_second": 1068.519 }, { "epoch": 0.18168303903252375, "grad_norm": 0.40631142258644104, "learning_rate": 4.9415692821368953e-05, "loss": 0.8205, "num_input_tokens_seen": 6216630, "step": 2261, "train_runtime": 5817.5943, "train_tokens_per_second": 1068.591 }, { "epoch": 0.1817633942023745, "grad_norm": 0.3239935040473938, "learning_rate": 4.934891485809683e-05, "loss": 1.1012, "num_input_tokens_seen": 6218662, "step": 2262, "train_runtime": 5819.5233, "train_tokens_per_second": 1068.586 }, { "epoch": 0.18184374937222522, "grad_norm": 0.39451807737350464, "learning_rate": 4.9282136894824707e-05, "loss": 0.7311, "num_input_tokens_seen": 6221182, "step": 2263, "train_runtime": 5821.5694, "train_tokens_per_second": 1068.643 }, { "epoch": 0.18192410454207597, "grad_norm": 0.36721745133399963, "learning_rate": 4.921535893155259e-05, "loss": 0.7233, "num_input_tokens_seen": 6223126, "step": 2264, "train_runtime": 5823.3943, "train_tokens_per_second": 1068.642 }, { "epoch": 0.18200445971192672, "grad_norm": 0.24146652221679688, "learning_rate": 4.914858096828047e-05, "loss": 0.7028, "num_input_tokens_seen": 6226154, "step": 2265, "train_runtime": 5825.7432, "train_tokens_per_second": 1068.731 }, { "epoch": 0.18208481488177747, "grad_norm": 0.322639524936676, "learning_rate": 4.9081803005008346e-05, "loss": 0.7768, "num_input_tokens_seen": 6229964, "step": 2266, "train_runtime": 5828.5276, "train_tokens_per_second": 1068.874 }, { "epoch": 0.1821651700516282, "grad_norm": 0.32387587428092957, "learning_rate": 4.9015025041736226e-05, "loss": 0.917, "num_input_tokens_seen": 6232198, "step": 2267, "train_runtime": 5830.5358, "train_tokens_per_second": 1068.889 }, { "epoch": 0.18224552522147894, "grad_norm": 0.37525859475135803, "learning_rate": 4.894824707846411e-05, "loss": 0.8793, "num_input_tokens_seen": 6234590, "step": 2268, "train_runtime": 5832.5035, "train_tokens_per_second": 1068.939 }, { "epoch": 0.1823258803913297, "grad_norm": 0.28123602271080017, "learning_rate": 4.888146911519199e-05, "loss": 0.8465, "num_input_tokens_seen": 6236906, "step": 2269, "train_runtime": 5834.4655, "train_tokens_per_second": 1068.976 }, { "epoch": 0.1824062355611804, "grad_norm": 0.3211343586444855, "learning_rate": 4.8814691151919866e-05, "loss": 0.7852, "num_input_tokens_seen": 6243846, "step": 2270, "train_runtime": 5839.2002, "train_tokens_per_second": 1069.298 }, { "epoch": 0.18248659073103116, "grad_norm": 0.390897661447525, "learning_rate": 4.8747913188647746e-05, "loss": 0.7559, "num_input_tokens_seen": 6245240, "step": 2271, "train_runtime": 5840.7348, "train_tokens_per_second": 1069.256 }, { "epoch": 0.1825669459008819, "grad_norm": 0.3211084008216858, "learning_rate": 4.8681135225375626e-05, "loss": 0.8246, "num_input_tokens_seen": 6247572, "step": 2272, "train_runtime": 5842.6495, "train_tokens_per_second": 1069.305 }, { "epoch": 0.18264730107073263, "grad_norm": 0.3849484622478485, "learning_rate": 4.861435726210351e-05, "loss": 1.0931, "num_input_tokens_seen": 6249328, "step": 2273, "train_runtime": 5844.3815, "train_tokens_per_second": 1069.288 }, { "epoch": 0.18272765624058337, "grad_norm": 0.32431185245513916, "learning_rate": 4.8547579298831386e-05, "loss": 1.034, "num_input_tokens_seen": 6253152, "step": 2274, "train_runtime": 5847.1441, "train_tokens_per_second": 1069.437 }, { "epoch": 0.18280801141043412, "grad_norm": 0.3326425552368164, "learning_rate": 4.8480801335559266e-05, "loss": 0.9919, "num_input_tokens_seen": 6256082, "step": 2275, "train_runtime": 5849.4119, "train_tokens_per_second": 1069.523 }, { "epoch": 0.18288836658028487, "grad_norm": 0.29046377539634705, "learning_rate": 4.8414023372287146e-05, "loss": 0.8487, "num_input_tokens_seen": 6258048, "step": 2276, "train_runtime": 5851.2065, "train_tokens_per_second": 1069.531 }, { "epoch": 0.1829687217501356, "grad_norm": 0.4438607096672058, "learning_rate": 4.834724540901503e-05, "loss": 0.9298, "num_input_tokens_seen": 6259816, "step": 2277, "train_runtime": 5852.9488, "train_tokens_per_second": 1069.515 }, { "epoch": 0.18304907691998634, "grad_norm": 0.3096592426300049, "learning_rate": 4.8280467445742906e-05, "loss": 0.8273, "num_input_tokens_seen": 6262084, "step": 2278, "train_runtime": 5854.9615, "train_tokens_per_second": 1069.535 }, { "epoch": 0.1831294320898371, "grad_norm": 0.3317062556743622, "learning_rate": 4.8213689482470785e-05, "loss": 1.1396, "num_input_tokens_seen": 6263846, "step": 2279, "train_runtime": 5856.7215, "train_tokens_per_second": 1069.514 }, { "epoch": 0.1832097872596878, "grad_norm": 0.3365456461906433, "learning_rate": 4.8146911519198665e-05, "loss": 1.1601, "num_input_tokens_seen": 6265866, "step": 2280, "train_runtime": 5858.6592, "train_tokens_per_second": 1069.505 }, { "epoch": 0.18329014242953856, "grad_norm": 0.32816290855407715, "learning_rate": 4.8080133555926545e-05, "loss": 0.9689, "num_input_tokens_seen": 6270664, "step": 2281, "train_runtime": 5863.6826, "train_tokens_per_second": 1069.407 }, { "epoch": 0.1833704975993893, "grad_norm": 0.3837275207042694, "learning_rate": 4.8013355592654425e-05, "loss": 1.3614, "num_input_tokens_seen": 6275480, "step": 2282, "train_runtime": 5867.0544, "train_tokens_per_second": 1069.613 }, { "epoch": 0.18345085276924003, "grad_norm": 0.3201889395713806, "learning_rate": 4.7946577629382305e-05, "loss": 0.8872, "num_input_tokens_seen": 6277180, "step": 2283, "train_runtime": 5868.6885, "train_tokens_per_second": 1069.605 }, { "epoch": 0.18353120793909078, "grad_norm": 0.26214835047721863, "learning_rate": 4.7879799666110185e-05, "loss": 0.6135, "num_input_tokens_seen": 6280390, "step": 2284, "train_runtime": 5871.0665, "train_tokens_per_second": 1069.719 }, { "epoch": 0.18361156310894153, "grad_norm": 0.3387789726257324, "learning_rate": 4.7813021702838065e-05, "loss": 0.9593, "num_input_tokens_seen": 6285522, "step": 2285, "train_runtime": 5874.683, "train_tokens_per_second": 1069.934 }, { "epoch": 0.18369191827879225, "grad_norm": 0.4115189015865326, "learning_rate": 4.7746243739565945e-05, "loss": 0.9443, "num_input_tokens_seen": 6287382, "step": 2286, "train_runtime": 5876.4711, "train_tokens_per_second": 1069.925 }, { "epoch": 0.183772273448643, "grad_norm": 0.2629833519458771, "learning_rate": 4.7679465776293825e-05, "loss": 1.1946, "num_input_tokens_seen": 6290098, "step": 2287, "train_runtime": 5878.5678, "train_tokens_per_second": 1070.005 }, { "epoch": 0.18385262861849375, "grad_norm": 0.3172478973865509, "learning_rate": 4.7612687813021705e-05, "loss": 1.0908, "num_input_tokens_seen": 6292668, "step": 2288, "train_runtime": 5880.6891, "train_tokens_per_second": 1070.056 }, { "epoch": 0.1839329837883445, "grad_norm": 0.3685589134693146, "learning_rate": 4.7545909849749585e-05, "loss": 0.9134, "num_input_tokens_seen": 6294796, "step": 2289, "train_runtime": 5882.6749, "train_tokens_per_second": 1070.057 }, { "epoch": 0.18401333895819522, "grad_norm": 0.3100009560585022, "learning_rate": 4.7479131886477465e-05, "loss": 0.8958, "num_input_tokens_seen": 6297902, "step": 2290, "train_runtime": 5885.0113, "train_tokens_per_second": 1070.16 }, { "epoch": 0.18409369412804596, "grad_norm": 0.34115126729011536, "learning_rate": 4.7412353923205345e-05, "loss": 1.0444, "num_input_tokens_seen": 6300448, "step": 2291, "train_runtime": 5887.0616, "train_tokens_per_second": 1070.219 }, { "epoch": 0.1841740492978967, "grad_norm": 0.3575955927371979, "learning_rate": 4.7345575959933225e-05, "loss": 1.0956, "num_input_tokens_seen": 6301970, "step": 2292, "train_runtime": 5888.6741, "train_tokens_per_second": 1070.185 }, { "epoch": 0.18425440446774743, "grad_norm": 0.3460978865623474, "learning_rate": 4.7278797996661104e-05, "loss": 1.1619, "num_input_tokens_seen": 6306278, "step": 2293, "train_runtime": 5891.7978, "train_tokens_per_second": 1070.349 }, { "epoch": 0.18433475963759818, "grad_norm": 0.3807061016559601, "learning_rate": 4.7212020033388984e-05, "loss": 1.2679, "num_input_tokens_seen": 6308894, "step": 2294, "train_runtime": 5893.8825, "train_tokens_per_second": 1070.414 }, { "epoch": 0.18441511480744893, "grad_norm": 0.3346267640590668, "learning_rate": 4.7145242070116864e-05, "loss": 0.9922, "num_input_tokens_seen": 6310684, "step": 2295, "train_runtime": 5895.5551, "train_tokens_per_second": 1070.414 }, { "epoch": 0.18449546997729965, "grad_norm": 0.2876211404800415, "learning_rate": 4.7078464106844744e-05, "loss": 1.1814, "num_input_tokens_seen": 6313498, "step": 2296, "train_runtime": 5897.8163, "train_tokens_per_second": 1070.481 }, { "epoch": 0.1845758251471504, "grad_norm": 0.2939240634441376, "learning_rate": 4.7011686143572624e-05, "loss": 0.8314, "num_input_tokens_seen": 6315472, "step": 2297, "train_runtime": 5899.6443, "train_tokens_per_second": 1070.484 }, { "epoch": 0.18465618031700115, "grad_norm": 0.28995025157928467, "learning_rate": 4.6944908180300504e-05, "loss": 1.0929, "num_input_tokens_seen": 6318302, "step": 2298, "train_runtime": 5901.9067, "train_tokens_per_second": 1070.553 }, { "epoch": 0.18473653548685187, "grad_norm": 0.3637752830982208, "learning_rate": 4.6878130217028384e-05, "loss": 0.8314, "num_input_tokens_seen": 6319344, "step": 2299, "train_runtime": 5903.3586, "train_tokens_per_second": 1070.466 }, { "epoch": 0.18481689065670262, "grad_norm": 0.2879713475704193, "learning_rate": 4.6811352253756264e-05, "loss": 0.6484, "num_input_tokens_seen": 6323512, "step": 2300, "train_runtime": 5906.3927, "train_tokens_per_second": 1070.622 }, { "epoch": 0.18489724582655337, "grad_norm": 0.28264346718788147, "learning_rate": 4.6744574290484144e-05, "loss": 0.9958, "num_input_tokens_seen": 6325804, "step": 2301, "train_runtime": 5908.2474, "train_tokens_per_second": 1070.674 }, { "epoch": 0.18497760099640412, "grad_norm": 0.3375772535800934, "learning_rate": 4.667779632721202e-05, "loss": 0.8864, "num_input_tokens_seen": 6327514, "step": 2302, "train_runtime": 5909.975, "train_tokens_per_second": 1070.65 }, { "epoch": 0.18505795616625484, "grad_norm": 0.33063581585884094, "learning_rate": 4.6611018363939904e-05, "loss": 0.9557, "num_input_tokens_seen": 6329634, "step": 2303, "train_runtime": 5911.8692, "train_tokens_per_second": 1070.665 }, { "epoch": 0.1851383113361056, "grad_norm": 0.32154470682144165, "learning_rate": 4.6544240400667784e-05, "loss": 1.2514, "num_input_tokens_seen": 6332200, "step": 2304, "train_runtime": 5913.9963, "train_tokens_per_second": 1070.714 }, { "epoch": 0.18521866650595634, "grad_norm": 0.3089728355407715, "learning_rate": 4.6477462437395664e-05, "loss": 0.9419, "num_input_tokens_seen": 6334566, "step": 2305, "train_runtime": 5916.0117, "train_tokens_per_second": 1070.749 }, { "epoch": 0.18529902167580706, "grad_norm": 0.3115226626396179, "learning_rate": 4.641068447412354e-05, "loss": 1.2372, "num_input_tokens_seen": 6336808, "step": 2306, "train_runtime": 5917.9917, "train_tokens_per_second": 1070.77 }, { "epoch": 0.1853793768456578, "grad_norm": 0.27321842312812805, "learning_rate": 4.6343906510851423e-05, "loss": 1.0608, "num_input_tokens_seen": 6338128, "step": 2307, "train_runtime": 5919.5686, "train_tokens_per_second": 1070.708 }, { "epoch": 0.18545973201550855, "grad_norm": 0.2833107113838196, "learning_rate": 4.6277128547579303e-05, "loss": 0.7515, "num_input_tokens_seen": 6340670, "step": 2308, "train_runtime": 5921.6334, "train_tokens_per_second": 1070.764 }, { "epoch": 0.18554008718535928, "grad_norm": 0.3309327960014343, "learning_rate": 4.621035058430718e-05, "loss": 1.0604, "num_input_tokens_seen": 6342012, "step": 2309, "train_runtime": 5923.1966, "train_tokens_per_second": 1070.708 }, { "epoch": 0.18562044235521002, "grad_norm": 0.33111390471458435, "learning_rate": 4.6143572621035056e-05, "loss": 1.1106, "num_input_tokens_seen": 6344012, "step": 2310, "train_runtime": 5924.9883, "train_tokens_per_second": 1070.721 }, { "epoch": 0.18570079752506077, "grad_norm": 0.3710658550262451, "learning_rate": 4.6076794657762936e-05, "loss": 0.8322, "num_input_tokens_seen": 6346142, "step": 2311, "train_runtime": 5928.5952, "train_tokens_per_second": 1070.429 }, { "epoch": 0.18578115269491152, "grad_norm": 0.42098838090896606, "learning_rate": 4.601001669449082e-05, "loss": 0.9208, "num_input_tokens_seen": 6349276, "step": 2312, "train_runtime": 5931.0157, "train_tokens_per_second": 1070.521 }, { "epoch": 0.18586150786476224, "grad_norm": 0.379133939743042, "learning_rate": 4.59432387312187e-05, "loss": 1.2124, "num_input_tokens_seen": 6351484, "step": 2313, "train_runtime": 5933.056, "train_tokens_per_second": 1070.525 }, { "epoch": 0.185941863034613, "grad_norm": 0.2824403941631317, "learning_rate": 4.5876460767946576e-05, "loss": 0.8327, "num_input_tokens_seen": 6353198, "step": 2314, "train_runtime": 5934.7507, "train_tokens_per_second": 1070.508 }, { "epoch": 0.18602221820446374, "grad_norm": 0.2821195423603058, "learning_rate": 4.5809682804674456e-05, "loss": 0.7801, "num_input_tokens_seen": 6355340, "step": 2315, "train_runtime": 5936.6381, "train_tokens_per_second": 1070.528 }, { "epoch": 0.18610257337431446, "grad_norm": 0.3796484172344208, "learning_rate": 4.574290484140234e-05, "loss": 1.2639, "num_input_tokens_seen": 6357318, "step": 2316, "train_runtime": 5938.468, "train_tokens_per_second": 1070.532 }, { "epoch": 0.1861829285441652, "grad_norm": 0.29804062843322754, "learning_rate": 4.567612687813022e-05, "loss": 0.801, "num_input_tokens_seen": 6362200, "step": 2317, "train_runtime": 5941.8702, "train_tokens_per_second": 1070.74 }, { "epoch": 0.18626328371401596, "grad_norm": 0.34569695591926575, "learning_rate": 4.5609348914858096e-05, "loss": 1.0351, "num_input_tokens_seen": 6367904, "step": 2318, "train_runtime": 5945.7448, "train_tokens_per_second": 1071.002 }, { "epoch": 0.18634363888386668, "grad_norm": 0.3258000612258911, "learning_rate": 4.5542570951585976e-05, "loss": 0.8478, "num_input_tokens_seen": 6372234, "step": 2319, "train_runtime": 5948.8619, "train_tokens_per_second": 1071.169 }, { "epoch": 0.18642399405371743, "grad_norm": 0.5333878993988037, "learning_rate": 4.5475792988313856e-05, "loss": 0.7371, "num_input_tokens_seen": 6374028, "step": 2320, "train_runtime": 5950.5584, "train_tokens_per_second": 1071.165 }, { "epoch": 0.18650434922356818, "grad_norm": 0.34493404626846313, "learning_rate": 4.540901502504174e-05, "loss": 1.025, "num_input_tokens_seen": 6376504, "step": 2321, "train_runtime": 5952.5597, "train_tokens_per_second": 1071.221 }, { "epoch": 0.1865847043934189, "grad_norm": 0.35565921664237976, "learning_rate": 4.5342237061769616e-05, "loss": 0.8247, "num_input_tokens_seen": 6378186, "step": 2322, "train_runtime": 5954.2389, "train_tokens_per_second": 1071.201 }, { "epoch": 0.18666505956326965, "grad_norm": 0.2732880413532257, "learning_rate": 4.5275459098497496e-05, "loss": 1.4874, "num_input_tokens_seen": 6382574, "step": 2323, "train_runtime": 5957.5968, "train_tokens_per_second": 1071.334 }, { "epoch": 0.1867454147331204, "grad_norm": 0.28319212794303894, "learning_rate": 4.5208681135225376e-05, "loss": 0.9535, "num_input_tokens_seen": 6386954, "step": 2324, "train_runtime": 5960.7084, "train_tokens_per_second": 1071.509 }, { "epoch": 0.18682576990297114, "grad_norm": 0.3138498067855835, "learning_rate": 4.514190317195326e-05, "loss": 0.9758, "num_input_tokens_seen": 6389560, "step": 2325, "train_runtime": 5962.8551, "train_tokens_per_second": 1071.561 }, { "epoch": 0.18690612507282187, "grad_norm": 0.3402535915374756, "learning_rate": 4.5075125208681135e-05, "loss": 1.0171, "num_input_tokens_seen": 6392596, "step": 2326, "train_runtime": 5965.1924, "train_tokens_per_second": 1071.65 }, { "epoch": 0.18698648024267261, "grad_norm": 0.3673248887062073, "learning_rate": 4.5008347245409015e-05, "loss": 1.116, "num_input_tokens_seen": 6394160, "step": 2327, "train_runtime": 5966.868, "train_tokens_per_second": 1071.611 }, { "epoch": 0.18706683541252336, "grad_norm": 0.3493563234806061, "learning_rate": 4.4941569282136895e-05, "loss": 1.0953, "num_input_tokens_seen": 6397894, "step": 2328, "train_runtime": 5969.5821, "train_tokens_per_second": 1071.749 }, { "epoch": 0.18714719058237408, "grad_norm": 0.356676310300827, "learning_rate": 4.4874791318864775e-05, "loss": 1.0006, "num_input_tokens_seen": 6401426, "step": 2329, "train_runtime": 5972.2754, "train_tokens_per_second": 1071.857 }, { "epoch": 0.18722754575222483, "grad_norm": 0.34382879734039307, "learning_rate": 4.4808013355592655e-05, "loss": 1.2569, "num_input_tokens_seen": 6403920, "step": 2330, "train_runtime": 5974.3, "train_tokens_per_second": 1071.911 }, { "epoch": 0.18730790092207558, "grad_norm": 0.271439790725708, "learning_rate": 4.4741235392320535e-05, "loss": 1.0944, "num_input_tokens_seen": 6406330, "step": 2331, "train_runtime": 5976.2713, "train_tokens_per_second": 1071.961 }, { "epoch": 0.1873882560919263, "grad_norm": 0.3470132648944855, "learning_rate": 4.4674457429048415e-05, "loss": 1.2693, "num_input_tokens_seen": 6408936, "step": 2332, "train_runtime": 5978.475, "train_tokens_per_second": 1072.002 }, { "epoch": 0.18746861126177705, "grad_norm": 0.340411514043808, "learning_rate": 4.4607679465776295e-05, "loss": 0.99, "num_input_tokens_seen": 6410980, "step": 2333, "train_runtime": 5980.3985, "train_tokens_per_second": 1071.999 }, { "epoch": 0.1875489664316278, "grad_norm": 0.31622838973999023, "learning_rate": 4.4540901502504175e-05, "loss": 0.9647, "num_input_tokens_seen": 6414012, "step": 2334, "train_runtime": 5982.7868, "train_tokens_per_second": 1072.078 }, { "epoch": 0.18762932160147852, "grad_norm": 0.3553694188594818, "learning_rate": 4.4474123539232055e-05, "loss": 1.0953, "num_input_tokens_seen": 6417172, "step": 2335, "train_runtime": 5985.1355, "train_tokens_per_second": 1072.185 }, { "epoch": 0.18770967677132927, "grad_norm": 0.320942223072052, "learning_rate": 4.4407345575959935e-05, "loss": 0.7614, "num_input_tokens_seen": 6418362, "step": 2336, "train_runtime": 5986.6348, "train_tokens_per_second": 1072.115 }, { "epoch": 0.18779003194118002, "grad_norm": 0.3402732014656067, "learning_rate": 4.4340567612687815e-05, "loss": 0.9423, "num_input_tokens_seen": 6420638, "step": 2337, "train_runtime": 5988.5982, "train_tokens_per_second": 1072.144 }, { "epoch": 0.18787038711103077, "grad_norm": 0.29002895951271057, "learning_rate": 4.4273789649415695e-05, "loss": 1.2723, "num_input_tokens_seen": 6424186, "step": 2338, "train_runtime": 5991.2178, "train_tokens_per_second": 1072.267 }, { "epoch": 0.1879507422808815, "grad_norm": 0.3135744631290436, "learning_rate": 4.4207011686143574e-05, "loss": 0.7233, "num_input_tokens_seen": 6426764, "step": 2339, "train_runtime": 5993.3702, "train_tokens_per_second": 1072.312 }, { "epoch": 0.18803109745073224, "grad_norm": 0.32115882635116577, "learning_rate": 4.4140233722871454e-05, "loss": 1.0044, "num_input_tokens_seen": 6429174, "step": 2340, "train_runtime": 5995.4218, "train_tokens_per_second": 1072.347 }, { "epoch": 0.188111452620583, "grad_norm": 0.29237309098243713, "learning_rate": 4.4073455759599334e-05, "loss": 0.8649, "num_input_tokens_seen": 6431370, "step": 2341, "train_runtime": 5999.0424, "train_tokens_per_second": 1072.066 }, { "epoch": 0.1881918077904337, "grad_norm": 0.29760250449180603, "learning_rate": 4.4006677796327214e-05, "loss": 0.8849, "num_input_tokens_seen": 6434130, "step": 2342, "train_runtime": 6001.1684, "train_tokens_per_second": 1072.146 }, { "epoch": 0.18827216296028446, "grad_norm": 0.31768155097961426, "learning_rate": 4.3939899833055094e-05, "loss": 1.2445, "num_input_tokens_seen": 6437588, "step": 2343, "train_runtime": 6003.7344, "train_tokens_per_second": 1072.264 }, { "epoch": 0.1883525181301352, "grad_norm": 0.2507043778896332, "learning_rate": 4.3873121869782974e-05, "loss": 0.5031, "num_input_tokens_seen": 6445040, "step": 2344, "train_runtime": 6008.7274, "train_tokens_per_second": 1072.613 }, { "epoch": 0.18843287329998593, "grad_norm": 0.2699557840824127, "learning_rate": 4.3806343906510854e-05, "loss": 0.6923, "num_input_tokens_seen": 6446724, "step": 2345, "train_runtime": 6010.3856, "train_tokens_per_second": 1072.597 }, { "epoch": 0.18851322846983667, "grad_norm": 0.3183298707008362, "learning_rate": 4.373956594323873e-05, "loss": 0.4887, "num_input_tokens_seen": 6449376, "step": 2346, "train_runtime": 6012.5392, "train_tokens_per_second": 1072.654 }, { "epoch": 0.18859358363968742, "grad_norm": 0.2718125581741333, "learning_rate": 4.3672787979966614e-05, "loss": 0.8204, "num_input_tokens_seen": 6451784, "step": 2347, "train_runtime": 6014.5947, "train_tokens_per_second": 1072.688 }, { "epoch": 0.18867393880953817, "grad_norm": 0.3327609896659851, "learning_rate": 4.3606010016694494e-05, "loss": 0.9818, "num_input_tokens_seen": 6454174, "step": 2348, "train_runtime": 6016.5705, "train_tokens_per_second": 1072.733 }, { "epoch": 0.1887542939793889, "grad_norm": 0.2682245373725891, "learning_rate": 4.3539232053422374e-05, "loss": 0.764, "num_input_tokens_seen": 6457878, "step": 2349, "train_runtime": 6019.3973, "train_tokens_per_second": 1072.845 }, { "epoch": 0.18883464914923964, "grad_norm": 0.27816519141197205, "learning_rate": 4.3472454090150254e-05, "loss": 0.6938, "num_input_tokens_seen": 6460140, "step": 2350, "train_runtime": 6021.3789, "train_tokens_per_second": 1072.867 }, { "epoch": 0.1889150043190904, "grad_norm": 0.40029385685920715, "learning_rate": 4.3405676126878134e-05, "loss": 1.0792, "num_input_tokens_seen": 6462378, "step": 2351, "train_runtime": 6023.3642, "train_tokens_per_second": 1072.885 }, { "epoch": 0.1889953594889411, "grad_norm": 0.3159874975681305, "learning_rate": 4.3338898163606014e-05, "loss": 0.9472, "num_input_tokens_seen": 6464216, "step": 2352, "train_runtime": 6025.0806, "train_tokens_per_second": 1072.885 }, { "epoch": 0.18907571465879186, "grad_norm": 0.26435011625289917, "learning_rate": 4.3272120200333893e-05, "loss": 1.0529, "num_input_tokens_seen": 6467076, "step": 2353, "train_runtime": 6027.3932, "train_tokens_per_second": 1072.947 }, { "epoch": 0.1891560698286426, "grad_norm": 0.31573250889778137, "learning_rate": 4.3205342237061773e-05, "loss": 1.1073, "num_input_tokens_seen": 6469118, "step": 2354, "train_runtime": 6029.2498, "train_tokens_per_second": 1072.956 }, { "epoch": 0.18923642499849333, "grad_norm": 0.279494047164917, "learning_rate": 4.313856427378965e-05, "loss": 0.9573, "num_input_tokens_seen": 6472412, "step": 2355, "train_runtime": 6031.8175, "train_tokens_per_second": 1073.045 }, { "epoch": 0.18931678016834408, "grad_norm": 0.3572263717651367, "learning_rate": 4.307178631051753e-05, "loss": 0.9254, "num_input_tokens_seen": 6474856, "step": 2356, "train_runtime": 6033.7637, "train_tokens_per_second": 1073.104 }, { "epoch": 0.18939713533819483, "grad_norm": 0.3090859353542328, "learning_rate": 4.300500834724541e-05, "loss": 1.1394, "num_input_tokens_seen": 6477788, "step": 2357, "train_runtime": 6036.23, "train_tokens_per_second": 1073.151 }, { "epoch": 0.18947749050804555, "grad_norm": 0.4273018538951874, "learning_rate": 4.293823038397329e-05, "loss": 0.8537, "num_input_tokens_seen": 6480154, "step": 2358, "train_runtime": 6038.226, "train_tokens_per_second": 1073.188 }, { "epoch": 0.1895578456778963, "grad_norm": 0.282573401927948, "learning_rate": 4.2871452420701166e-05, "loss": 0.9571, "num_input_tokens_seen": 6483698, "step": 2359, "train_runtime": 6040.971, "train_tokens_per_second": 1073.287 }, { "epoch": 0.18963820084774705, "grad_norm": 0.3736294209957123, "learning_rate": 4.280467445742905e-05, "loss": 1.1787, "num_input_tokens_seen": 6485350, "step": 2360, "train_runtime": 6042.5952, "train_tokens_per_second": 1073.272 }, { "epoch": 0.1897185560175978, "grad_norm": 0.35731983184814453, "learning_rate": 4.273789649415693e-05, "loss": 1.2476, "num_input_tokens_seen": 6489322, "step": 2361, "train_runtime": 6045.4784, "train_tokens_per_second": 1073.417 }, { "epoch": 0.18979891118744852, "grad_norm": 0.27530911564826965, "learning_rate": 4.267111853088481e-05, "loss": 0.6291, "num_input_tokens_seen": 6491520, "step": 2362, "train_runtime": 6047.2803, "train_tokens_per_second": 1073.461 }, { "epoch": 0.18987926635729926, "grad_norm": 0.3326406180858612, "learning_rate": 4.2604340567612686e-05, "loss": 1.0815, "num_input_tokens_seen": 6494368, "step": 2363, "train_runtime": 6049.5072, "train_tokens_per_second": 1073.537 }, { "epoch": 0.18995962152715, "grad_norm": 0.3549513816833496, "learning_rate": 4.253756260434057e-05, "loss": 0.9236, "num_input_tokens_seen": 6496210, "step": 2364, "train_runtime": 6051.2104, "train_tokens_per_second": 1073.539 }, { "epoch": 0.19003997669700073, "grad_norm": 0.3189884424209595, "learning_rate": 4.247078464106845e-05, "loss": 1.0045, "num_input_tokens_seen": 6498918, "step": 2365, "train_runtime": 6053.4713, "train_tokens_per_second": 1073.585 }, { "epoch": 0.19012033186685148, "grad_norm": 0.4169856905937195, "learning_rate": 4.240400667779633e-05, "loss": 0.9863, "num_input_tokens_seen": 6500360, "step": 2366, "train_runtime": 6055.0558, "train_tokens_per_second": 1073.543 }, { "epoch": 0.19020068703670223, "grad_norm": 0.27368399500846863, "learning_rate": 4.2337228714524206e-05, "loss": 0.6798, "num_input_tokens_seen": 6503998, "step": 2367, "train_runtime": 6057.8511, "train_tokens_per_second": 1073.648 }, { "epoch": 0.19028104220655295, "grad_norm": 0.331129789352417, "learning_rate": 4.2270450751252086e-05, "loss": 0.8617, "num_input_tokens_seen": 6505764, "step": 2368, "train_runtime": 6059.5472, "train_tokens_per_second": 1073.639 }, { "epoch": 0.1903613973764037, "grad_norm": 0.4752596914768219, "learning_rate": 4.220367278797997e-05, "loss": 0.9673, "num_input_tokens_seen": 6507824, "step": 2369, "train_runtime": 6061.3396, "train_tokens_per_second": 1073.661 }, { "epoch": 0.19044175254625445, "grad_norm": 0.32049426436424255, "learning_rate": 4.213689482470785e-05, "loss": 0.9059, "num_input_tokens_seen": 6510262, "step": 2370, "train_runtime": 6063.4035, "train_tokens_per_second": 1073.698 }, { "epoch": 0.19052210771610517, "grad_norm": 0.3731323778629303, "learning_rate": 4.2070116861435725e-05, "loss": 1.1558, "num_input_tokens_seen": 6512640, "step": 2371, "train_runtime": 6067.1397, "train_tokens_per_second": 1073.428 }, { "epoch": 0.19060246288595592, "grad_norm": 0.38448357582092285, "learning_rate": 4.2003338898163605e-05, "loss": 1.1643, "num_input_tokens_seen": 6514484, "step": 2372, "train_runtime": 6068.9161, "train_tokens_per_second": 1073.418 }, { "epoch": 0.19068281805580667, "grad_norm": 0.3158486783504486, "learning_rate": 4.193656093489149e-05, "loss": 1.1535, "num_input_tokens_seen": 6518266, "step": 2373, "train_runtime": 6071.776, "train_tokens_per_second": 1073.535 }, { "epoch": 0.19076317322565742, "grad_norm": 0.36079153418540955, "learning_rate": 4.186978297161937e-05, "loss": 0.7358, "num_input_tokens_seen": 6521742, "step": 2374, "train_runtime": 6074.4449, "train_tokens_per_second": 1073.636 }, { "epoch": 0.19084352839550814, "grad_norm": 0.27630579471588135, "learning_rate": 4.1803005008347245e-05, "loss": 0.7908, "num_input_tokens_seen": 6523998, "step": 2375, "train_runtime": 6076.3599, "train_tokens_per_second": 1073.669 }, { "epoch": 0.1909238835653589, "grad_norm": 0.41513073444366455, "learning_rate": 4.1736227045075125e-05, "loss": 0.8549, "num_input_tokens_seen": 6525714, "step": 2376, "train_runtime": 6078.0685, "train_tokens_per_second": 1073.649 }, { "epoch": 0.19100423873520964, "grad_norm": 0.31493115425109863, "learning_rate": 4.1669449081803005e-05, "loss": 0.9587, "num_input_tokens_seen": 6527792, "step": 2377, "train_runtime": 6079.9809, "train_tokens_per_second": 1073.653 }, { "epoch": 0.19108459390506036, "grad_norm": 0.32812929153442383, "learning_rate": 4.160267111853089e-05, "loss": 0.849, "num_input_tokens_seen": 6529466, "step": 2378, "train_runtime": 6081.6239, "train_tokens_per_second": 1073.639 }, { "epoch": 0.1911649490749111, "grad_norm": 0.3051978349685669, "learning_rate": 4.1535893155258765e-05, "loss": 1.2035, "num_input_tokens_seen": 6531546, "step": 2379, "train_runtime": 6083.5258, "train_tokens_per_second": 1073.645 }, { "epoch": 0.19124530424476185, "grad_norm": 0.3230092227458954, "learning_rate": 4.1469115191986645e-05, "loss": 1.0275, "num_input_tokens_seen": 6534402, "step": 2380, "train_runtime": 6085.7987, "train_tokens_per_second": 1073.713 }, { "epoch": 0.19132565941461258, "grad_norm": 0.4046890139579773, "learning_rate": 4.1402337228714525e-05, "loss": 1.1253, "num_input_tokens_seen": 6536086, "step": 2381, "train_runtime": 6087.4224, "train_tokens_per_second": 1073.703 }, { "epoch": 0.19140601458446332, "grad_norm": 0.35911914706230164, "learning_rate": 4.133555926544241e-05, "loss": 0.8435, "num_input_tokens_seen": 6537544, "step": 2382, "train_runtime": 6089.0922, "train_tokens_per_second": 1073.648 }, { "epoch": 0.19148636975431407, "grad_norm": 0.2804661989212036, "learning_rate": 4.1268781302170285e-05, "loss": 0.8464, "num_input_tokens_seen": 6539790, "step": 2383, "train_runtime": 6091.0568, "train_tokens_per_second": 1073.671 }, { "epoch": 0.19156672492416482, "grad_norm": 0.3444625437259674, "learning_rate": 4.1202003338898165e-05, "loss": 1.2321, "num_input_tokens_seen": 6542590, "step": 2384, "train_runtime": 6093.2774, "train_tokens_per_second": 1073.739 }, { "epoch": 0.19164708009401554, "grad_norm": 0.3022491931915283, "learning_rate": 4.1135225375626044e-05, "loss": 0.7703, "num_input_tokens_seen": 6545400, "step": 2385, "train_runtime": 6095.4623, "train_tokens_per_second": 1073.815 }, { "epoch": 0.1917274352638663, "grad_norm": 0.38246074318885803, "learning_rate": 4.1068447412353924e-05, "loss": 0.7253, "num_input_tokens_seen": 6548834, "step": 2386, "train_runtime": 6097.9584, "train_tokens_per_second": 1073.939 }, { "epoch": 0.19180779043371704, "grad_norm": 0.3465690016746521, "learning_rate": 4.1001669449081804e-05, "loss": 0.8618, "num_input_tokens_seen": 6552600, "step": 2387, "train_runtime": 6100.9864, "train_tokens_per_second": 1074.023 }, { "epoch": 0.19188814560356776, "grad_norm": 0.2807244658470154, "learning_rate": 4.0934891485809684e-05, "loss": 1.0056, "num_input_tokens_seen": 6555216, "step": 2388, "train_runtime": 6103.1002, "train_tokens_per_second": 1074.08 }, { "epoch": 0.1919685007734185, "grad_norm": 0.28758811950683594, "learning_rate": 4.0868113522537564e-05, "loss": 0.7992, "num_input_tokens_seen": 6556970, "step": 2389, "train_runtime": 6104.822, "train_tokens_per_second": 1074.064 }, { "epoch": 0.19204885594326926, "grad_norm": 0.31233835220336914, "learning_rate": 4.0801335559265444e-05, "loss": 0.8729, "num_input_tokens_seen": 6559388, "step": 2390, "train_runtime": 6106.843, "train_tokens_per_second": 1074.105 }, { "epoch": 0.19212921111311998, "grad_norm": 0.2847444713115692, "learning_rate": 4.0734557595993324e-05, "loss": 1.0129, "num_input_tokens_seen": 6562582, "step": 2391, "train_runtime": 6109.2983, "train_tokens_per_second": 1074.196 }, { "epoch": 0.19220956628297073, "grad_norm": 0.30738258361816406, "learning_rate": 4.0667779632721204e-05, "loss": 0.8534, "num_input_tokens_seen": 6565360, "step": 2392, "train_runtime": 6111.4727, "train_tokens_per_second": 1074.268 }, { "epoch": 0.19228992145282148, "grad_norm": 0.34981194138526917, "learning_rate": 4.0601001669449084e-05, "loss": 0.9299, "num_input_tokens_seen": 6568706, "step": 2393, "train_runtime": 6113.9057, "train_tokens_per_second": 1074.388 }, { "epoch": 0.1923702766226722, "grad_norm": 0.33307093381881714, "learning_rate": 4.0534223706176964e-05, "loss": 0.8867, "num_input_tokens_seen": 6570248, "step": 2394, "train_runtime": 6115.5821, "train_tokens_per_second": 1074.345 }, { "epoch": 0.19245063179252295, "grad_norm": 0.28083500266075134, "learning_rate": 4.0467445742904844e-05, "loss": 1.0867, "num_input_tokens_seen": 6572680, "step": 2395, "train_runtime": 6117.6535, "train_tokens_per_second": 1074.379 }, { "epoch": 0.1925309869623737, "grad_norm": 0.25081828236579895, "learning_rate": 4.0400667779632724e-05, "loss": 0.6236, "num_input_tokens_seen": 6575098, "step": 2396, "train_runtime": 6119.6416, "train_tokens_per_second": 1074.425 }, { "epoch": 0.19261134213222444, "grad_norm": 0.3000496029853821, "learning_rate": 4.0333889816360604e-05, "loss": 0.8846, "num_input_tokens_seen": 6577948, "step": 2397, "train_runtime": 6121.8345, "train_tokens_per_second": 1074.506 }, { "epoch": 0.19269169730207517, "grad_norm": 0.33908024430274963, "learning_rate": 4.0267111853088484e-05, "loss": 0.9774, "num_input_tokens_seen": 6580748, "step": 2398, "train_runtime": 6124.0722, "train_tokens_per_second": 1074.571 }, { "epoch": 0.19277205247192591, "grad_norm": 0.3886743187904358, "learning_rate": 4.0200333889816363e-05, "loss": 1.2201, "num_input_tokens_seen": 6583026, "step": 2399, "train_runtime": 6126.0713, "train_tokens_per_second": 1074.592 }, { "epoch": 0.19285240764177666, "grad_norm": 0.33162257075309753, "learning_rate": 4.0133555926544243e-05, "loss": 0.9361, "num_input_tokens_seen": 6585668, "step": 2400, "train_runtime": 6128.1505, "train_tokens_per_second": 1074.658 }, { "epoch": 0.19285240764177666, "eval_loss": 0.9504203200340271, "eval_runtime": 91.9657, "eval_samples_per_second": 10.808, "eval_steps_per_second": 5.404, "num_input_tokens_seen": 6585668, "step": 2400 }, { "epoch": 0.19293276281162738, "grad_norm": 0.32750827074050903, "learning_rate": 4.006677796327212e-05, "loss": 0.9879, "num_input_tokens_seen": 6587752, "step": 2401, "train_runtime": 6223.9332, "train_tokens_per_second": 1058.455 }, { "epoch": 0.19301311798147813, "grad_norm": 0.3905124068260193, "learning_rate": 4e-05, "loss": 1.1807, "num_input_tokens_seen": 6589056, "step": 2402, "train_runtime": 6225.4982, "train_tokens_per_second": 1058.398 }, { "epoch": 0.19309347315132888, "grad_norm": 0.2537885904312134, "learning_rate": 3.9933222036727876e-05, "loss": 0.8074, "num_input_tokens_seen": 6591830, "step": 2403, "train_runtime": 6227.6576, "train_tokens_per_second": 1058.477 }, { "epoch": 0.1931738283211796, "grad_norm": 0.2999289035797119, "learning_rate": 3.986644407345576e-05, "loss": 0.8308, "num_input_tokens_seen": 6593994, "step": 2404, "train_runtime": 6229.5632, "train_tokens_per_second": 1058.5 }, { "epoch": 0.19325418349103035, "grad_norm": 0.3161380887031555, "learning_rate": 3.979966611018364e-05, "loss": 1.1495, "num_input_tokens_seen": 6596840, "step": 2405, "train_runtime": 6231.7913, "train_tokens_per_second": 1058.578 }, { "epoch": 0.1933345386608811, "grad_norm": 0.28440114855766296, "learning_rate": 3.973288814691152e-05, "loss": 0.9586, "num_input_tokens_seen": 6601202, "step": 2406, "train_runtime": 6234.8798, "train_tokens_per_second": 1058.754 }, { "epoch": 0.19341489383073182, "grad_norm": 0.3244627118110657, "learning_rate": 3.9666110183639396e-05, "loss": 0.6884, "num_input_tokens_seen": 6603970, "step": 2407, "train_runtime": 6237.1354, "train_tokens_per_second": 1058.815 }, { "epoch": 0.19349524900058257, "grad_norm": 0.31390276551246643, "learning_rate": 3.959933222036728e-05, "loss": 0.9528, "num_input_tokens_seen": 6606010, "step": 2408, "train_runtime": 6238.9019, "train_tokens_per_second": 1058.842 }, { "epoch": 0.19357560417043332, "grad_norm": 0.33451029658317566, "learning_rate": 3.953255425709516e-05, "loss": 0.8656, "num_input_tokens_seen": 6609482, "step": 2409, "train_runtime": 6241.5444, "train_tokens_per_second": 1058.95 }, { "epoch": 0.19365595934028407, "grad_norm": 0.2858388423919678, "learning_rate": 3.946577629382304e-05, "loss": 0.9274, "num_input_tokens_seen": 6612334, "step": 2410, "train_runtime": 6243.754, "train_tokens_per_second": 1059.032 }, { "epoch": 0.1937363145101348, "grad_norm": 0.27476608753204346, "learning_rate": 3.9398998330550916e-05, "loss": 0.8203, "num_input_tokens_seen": 6614684, "step": 2411, "train_runtime": 6245.7469, "train_tokens_per_second": 1059.07 }, { "epoch": 0.19381666967998554, "grad_norm": 0.33219289779663086, "learning_rate": 3.93322203672788e-05, "loss": 0.9426, "num_input_tokens_seen": 6619112, "step": 2412, "train_runtime": 6248.9617, "train_tokens_per_second": 1059.234 }, { "epoch": 0.19389702484983629, "grad_norm": 0.2844533920288086, "learning_rate": 3.926544240400668e-05, "loss": 0.87, "num_input_tokens_seen": 6621710, "step": 2413, "train_runtime": 6251.0844, "train_tokens_per_second": 1059.29 }, { "epoch": 0.193977380019687, "grad_norm": 0.2911604642868042, "learning_rate": 3.919866444073456e-05, "loss": 0.807, "num_input_tokens_seen": 6624134, "step": 2414, "train_runtime": 6253.1218, "train_tokens_per_second": 1059.332 }, { "epoch": 0.19405773518953776, "grad_norm": 0.37950772047042847, "learning_rate": 3.9131886477462436e-05, "loss": 1.2061, "num_input_tokens_seen": 6626408, "step": 2415, "train_runtime": 6255.1404, "train_tokens_per_second": 1059.354 }, { "epoch": 0.1941380903593885, "grad_norm": 0.3641248643398285, "learning_rate": 3.9065108514190316e-05, "loss": 1.0681, "num_input_tokens_seen": 6628788, "step": 2416, "train_runtime": 6257.1809, "train_tokens_per_second": 1059.389 }, { "epoch": 0.19421844552923923, "grad_norm": 0.31378281116485596, "learning_rate": 3.89983305509182e-05, "loss": 1.2204, "num_input_tokens_seen": 6631396, "step": 2417, "train_runtime": 6259.2567, "train_tokens_per_second": 1059.454 }, { "epoch": 0.19429880069908997, "grad_norm": 0.25066882371902466, "learning_rate": 3.893155258764608e-05, "loss": 0.7568, "num_input_tokens_seen": 6634142, "step": 2418, "train_runtime": 6261.4039, "train_tokens_per_second": 1059.529 }, { "epoch": 0.19437915586894072, "grad_norm": 0.3530522584915161, "learning_rate": 3.8864774624373955e-05, "loss": 0.861, "num_input_tokens_seen": 6637412, "step": 2419, "train_runtime": 6263.8928, "train_tokens_per_second": 1059.631 }, { "epoch": 0.19445951103879147, "grad_norm": 0.3219548165798187, "learning_rate": 3.8797996661101835e-05, "loss": 0.9204, "num_input_tokens_seen": 6639986, "step": 2420, "train_runtime": 6265.9187, "train_tokens_per_second": 1059.699 }, { "epoch": 0.1945398662086422, "grad_norm": 0.31155136227607727, "learning_rate": 3.873121869782972e-05, "loss": 1.1368, "num_input_tokens_seen": 6642074, "step": 2421, "train_runtime": 6267.7409, "train_tokens_per_second": 1059.724 }, { "epoch": 0.19462022137849294, "grad_norm": 0.3154776990413666, "learning_rate": 3.86644407345576e-05, "loss": 0.9429, "num_input_tokens_seen": 6644438, "step": 2422, "train_runtime": 6269.6787, "train_tokens_per_second": 1059.773 }, { "epoch": 0.1947005765483437, "grad_norm": 0.2579866945743561, "learning_rate": 3.8597662771285475e-05, "loss": 0.5127, "num_input_tokens_seen": 6647748, "step": 2423, "train_runtime": 6272.1858, "train_tokens_per_second": 1059.877 }, { "epoch": 0.1947809317181944, "grad_norm": 0.28103676438331604, "learning_rate": 3.8530884808013355e-05, "loss": 0.9606, "num_input_tokens_seen": 6650942, "step": 2424, "train_runtime": 6274.567, "train_tokens_per_second": 1059.984 }, { "epoch": 0.19486128688804516, "grad_norm": 0.31860002875328064, "learning_rate": 3.8464106844741235e-05, "loss": 1.0137, "num_input_tokens_seen": 6653204, "step": 2425, "train_runtime": 6276.4407, "train_tokens_per_second": 1060.028 }, { "epoch": 0.1949416420578959, "grad_norm": 0.32986995577812195, "learning_rate": 3.839732888146912e-05, "loss": 0.9636, "num_input_tokens_seen": 6657364, "step": 2426, "train_runtime": 6279.4053, "train_tokens_per_second": 1060.19 }, { "epoch": 0.19502199722774663, "grad_norm": 0.2918531894683838, "learning_rate": 3.8330550918196995e-05, "loss": 0.7397, "num_input_tokens_seen": 6663302, "step": 2427, "train_runtime": 6283.4524, "train_tokens_per_second": 1060.452 }, { "epoch": 0.19510235239759738, "grad_norm": 0.33364513516426086, "learning_rate": 3.8263772954924875e-05, "loss": 1.0251, "num_input_tokens_seen": 6668602, "step": 2428, "train_runtime": 6286.9381, "train_tokens_per_second": 1060.707 }, { "epoch": 0.19518270756744813, "grad_norm": 0.30675721168518066, "learning_rate": 3.8196994991652755e-05, "loss": 1.0195, "num_input_tokens_seen": 6670712, "step": 2429, "train_runtime": 6288.69, "train_tokens_per_second": 1060.747 }, { "epoch": 0.19526306273729885, "grad_norm": 0.2794005274772644, "learning_rate": 3.813021702838064e-05, "loss": 0.8031, "num_input_tokens_seen": 6673344, "step": 2430, "train_runtime": 6290.7487, "train_tokens_per_second": 1060.819 }, { "epoch": 0.1953434179071496, "grad_norm": 0.2989581823348999, "learning_rate": 3.8063439065108514e-05, "loss": 0.9371, "num_input_tokens_seen": 6677694, "step": 2431, "train_runtime": 6295.8081, "train_tokens_per_second": 1060.657 }, { "epoch": 0.19542377307700035, "grad_norm": 0.319682240486145, "learning_rate": 3.7996661101836394e-05, "loss": 1.1694, "num_input_tokens_seen": 6680228, "step": 2432, "train_runtime": 6297.7972, "train_tokens_per_second": 1060.725 }, { "epoch": 0.1955041282468511, "grad_norm": 0.34445488452911377, "learning_rate": 3.7929883138564274e-05, "loss": 1.1355, "num_input_tokens_seen": 6681880, "step": 2433, "train_runtime": 6299.4504, "train_tokens_per_second": 1060.708 }, { "epoch": 0.19558448341670182, "grad_norm": 0.36404046416282654, "learning_rate": 3.7863105175292154e-05, "loss": 0.8176, "num_input_tokens_seen": 6684426, "step": 2434, "train_runtime": 6301.6144, "train_tokens_per_second": 1060.748 }, { "epoch": 0.19566483858655256, "grad_norm": 0.307226300239563, "learning_rate": 3.7796327212020034e-05, "loss": 0.9641, "num_input_tokens_seen": 6686416, "step": 2435, "train_runtime": 6303.4884, "train_tokens_per_second": 1060.749 }, { "epoch": 0.1957451937564033, "grad_norm": 0.2776503264904022, "learning_rate": 3.7729549248747914e-05, "loss": 0.7334, "num_input_tokens_seen": 6687934, "step": 2436, "train_runtime": 6305.1103, "train_tokens_per_second": 1060.716 }, { "epoch": 0.19582554892625403, "grad_norm": 0.32679176330566406, "learning_rate": 3.7662771285475794e-05, "loss": 0.9927, "num_input_tokens_seen": 6690244, "step": 2437, "train_runtime": 6307.047, "train_tokens_per_second": 1060.757 }, { "epoch": 0.19590590409610478, "grad_norm": 0.36547166109085083, "learning_rate": 3.7595993322203674e-05, "loss": 1.18, "num_input_tokens_seen": 6693160, "step": 2438, "train_runtime": 6309.3187, "train_tokens_per_second": 1060.837 }, { "epoch": 0.19598625926595553, "grad_norm": 0.31803661584854126, "learning_rate": 3.7529215358931554e-05, "loss": 0.696, "num_input_tokens_seen": 6694940, "step": 2439, "train_runtime": 6311.1235, "train_tokens_per_second": 1060.816 }, { "epoch": 0.19606661443580625, "grad_norm": 0.34208938479423523, "learning_rate": 3.7462437395659434e-05, "loss": 0.8492, "num_input_tokens_seen": 6697220, "step": 2440, "train_runtime": 6313.1404, "train_tokens_per_second": 1060.838 }, { "epoch": 0.196146969605657, "grad_norm": 0.2791343629360199, "learning_rate": 3.7395659432387314e-05, "loss": 1.0493, "num_input_tokens_seen": 6702412, "step": 2441, "train_runtime": 6316.8527, "train_tokens_per_second": 1061.037 }, { "epoch": 0.19622732477550775, "grad_norm": 0.2930096983909607, "learning_rate": 3.7328881469115194e-05, "loss": 1.1102, "num_input_tokens_seen": 6706494, "step": 2442, "train_runtime": 6319.7433, "train_tokens_per_second": 1061.197 }, { "epoch": 0.19630767994535847, "grad_norm": 0.27030718326568604, "learning_rate": 3.7262103505843074e-05, "loss": 0.9448, "num_input_tokens_seen": 6708596, "step": 2443, "train_runtime": 6321.5725, "train_tokens_per_second": 1061.223 }, { "epoch": 0.19638803511520922, "grad_norm": 0.28284841775894165, "learning_rate": 3.7195325542570954e-05, "loss": 0.768, "num_input_tokens_seen": 6710428, "step": 2444, "train_runtime": 6323.3645, "train_tokens_per_second": 1061.212 }, { "epoch": 0.19646839028505997, "grad_norm": 0.24541085958480835, "learning_rate": 3.7128547579298833e-05, "loss": 0.8682, "num_input_tokens_seen": 6713602, "step": 2445, "train_runtime": 6325.7785, "train_tokens_per_second": 1061.308 }, { "epoch": 0.19654874545491072, "grad_norm": 0.26650404930114746, "learning_rate": 3.7061769616026713e-05, "loss": 0.8112, "num_input_tokens_seen": 6715268, "step": 2446, "train_runtime": 6327.4473, "train_tokens_per_second": 1061.292 }, { "epoch": 0.19662910062476144, "grad_norm": 0.2887314260005951, "learning_rate": 3.699499165275459e-05, "loss": 0.9284, "num_input_tokens_seen": 6717818, "step": 2447, "train_runtime": 6329.537, "train_tokens_per_second": 1061.344 }, { "epoch": 0.1967094557946122, "grad_norm": 0.27001363039016724, "learning_rate": 3.692821368948247e-05, "loss": 0.8024, "num_input_tokens_seen": 6720532, "step": 2448, "train_runtime": 6331.7748, "train_tokens_per_second": 1061.398 }, { "epoch": 0.19678981096446294, "grad_norm": 0.35359224677085876, "learning_rate": 3.686143572621035e-05, "loss": 1.2375, "num_input_tokens_seen": 6725752, "step": 2449, "train_runtime": 6335.3254, "train_tokens_per_second": 1061.627 }, { "epoch": 0.19687016613431366, "grad_norm": 0.2674376368522644, "learning_rate": 3.679465776293823e-05, "loss": 0.8288, "num_input_tokens_seen": 6728112, "step": 2450, "train_runtime": 6337.2923, "train_tokens_per_second": 1061.67 }, { "epoch": 0.1969505213041644, "grad_norm": 0.3892456591129303, "learning_rate": 3.6727879799666106e-05, "loss": 0.8965, "num_input_tokens_seen": 6730768, "step": 2451, "train_runtime": 6339.4992, "train_tokens_per_second": 1061.719 }, { "epoch": 0.19703087647401515, "grad_norm": 0.45840367674827576, "learning_rate": 3.666110183639399e-05, "loss": 1.5376, "num_input_tokens_seen": 6733332, "step": 2452, "train_runtime": 6341.5603, "train_tokens_per_second": 1061.778 }, { "epoch": 0.19711123164386588, "grad_norm": 0.31940752267837524, "learning_rate": 3.659432387312187e-05, "loss": 1.2081, "num_input_tokens_seen": 6736724, "step": 2453, "train_runtime": 6344.0347, "train_tokens_per_second": 1061.899 }, { "epoch": 0.19719158681371662, "grad_norm": 0.31960538029670715, "learning_rate": 3.652754590984975e-05, "loss": 0.7606, "num_input_tokens_seen": 6739186, "step": 2454, "train_runtime": 6346.1753, "train_tokens_per_second": 1061.929 }, { "epoch": 0.19727194198356737, "grad_norm": 0.2756505608558655, "learning_rate": 3.6460767946577626e-05, "loss": 1.1466, "num_input_tokens_seen": 6742722, "step": 2455, "train_runtime": 6348.7388, "train_tokens_per_second": 1062.057 }, { "epoch": 0.19735229715341812, "grad_norm": 0.293165385723114, "learning_rate": 3.639398998330551e-05, "loss": 1.3314, "num_input_tokens_seen": 6745248, "step": 2456, "train_runtime": 6350.8175, "train_tokens_per_second": 1062.107 }, { "epoch": 0.19743265232326884, "grad_norm": 0.3405793011188507, "learning_rate": 3.632721202003339e-05, "loss": 0.9363, "num_input_tokens_seen": 6747486, "step": 2457, "train_runtime": 6352.8011, "train_tokens_per_second": 1062.128 }, { "epoch": 0.1975130074931196, "grad_norm": 0.32479724287986755, "learning_rate": 3.626043405676127e-05, "loss": 1.1031, "num_input_tokens_seen": 6749332, "step": 2458, "train_runtime": 6354.5351, "train_tokens_per_second": 1062.128 }, { "epoch": 0.19759336266297034, "grad_norm": 0.30004751682281494, "learning_rate": 3.6193656093489146e-05, "loss": 1.1166, "num_input_tokens_seen": 6752850, "step": 2459, "train_runtime": 6357.1873, "train_tokens_per_second": 1062.239 }, { "epoch": 0.19767371783282106, "grad_norm": 0.32536259293556213, "learning_rate": 3.6126878130217026e-05, "loss": 0.8243, "num_input_tokens_seen": 6754952, "step": 2460, "train_runtime": 6359.0399, "train_tokens_per_second": 1062.26 }, { "epoch": 0.1977540730026718, "grad_norm": 0.21679791808128357, "learning_rate": 3.606010016694491e-05, "loss": 1.2679, "num_input_tokens_seen": 6757206, "step": 2461, "train_runtime": 6363.03, "train_tokens_per_second": 1061.948 }, { "epoch": 0.19783442817252256, "grad_norm": 0.3343377709388733, "learning_rate": 3.599332220367279e-05, "loss": 0.694, "num_input_tokens_seen": 6759614, "step": 2462, "train_runtime": 6365.0191, "train_tokens_per_second": 1061.994 }, { "epoch": 0.19791478334237328, "grad_norm": 0.34032630920410156, "learning_rate": 3.5926544240400665e-05, "loss": 1.2218, "num_input_tokens_seen": 6762950, "step": 2463, "train_runtime": 6367.5206, "train_tokens_per_second": 1062.101 }, { "epoch": 0.19799513851222403, "grad_norm": 0.3259252607822418, "learning_rate": 3.5859766277128545e-05, "loss": 0.864, "num_input_tokens_seen": 6764568, "step": 2464, "train_runtime": 6369.2484, "train_tokens_per_second": 1062.067 }, { "epoch": 0.19807549368207478, "grad_norm": 0.36383065581321716, "learning_rate": 3.579298831385643e-05, "loss": 0.7951, "num_input_tokens_seen": 6766578, "step": 2465, "train_runtime": 6371.0441, "train_tokens_per_second": 1062.083 }, { "epoch": 0.1981558488519255, "grad_norm": 0.36285698413848877, "learning_rate": 3.572621035058431e-05, "loss": 0.6244, "num_input_tokens_seen": 6769278, "step": 2466, "train_runtime": 6373.2886, "train_tokens_per_second": 1062.133 }, { "epoch": 0.19823620402177625, "grad_norm": 0.3284915089607239, "learning_rate": 3.5659432387312185e-05, "loss": 0.8725, "num_input_tokens_seen": 6771400, "step": 2467, "train_runtime": 6375.1712, "train_tokens_per_second": 1062.152 }, { "epoch": 0.198316559191627, "grad_norm": 0.34764623641967773, "learning_rate": 3.5592654424040065e-05, "loss": 1.0129, "num_input_tokens_seen": 6774194, "step": 2468, "train_runtime": 6377.4395, "train_tokens_per_second": 1062.212 }, { "epoch": 0.19839691436147774, "grad_norm": 0.314209520816803, "learning_rate": 3.5525876460767945e-05, "loss": 1.2032, "num_input_tokens_seen": 6777538, "step": 2469, "train_runtime": 6379.9604, "train_tokens_per_second": 1062.317 }, { "epoch": 0.19847726953132847, "grad_norm": 0.2474755197763443, "learning_rate": 3.545909849749583e-05, "loss": 0.5714, "num_input_tokens_seen": 6781134, "step": 2470, "train_runtime": 6382.6045, "train_tokens_per_second": 1062.44 }, { "epoch": 0.19855762470117921, "grad_norm": 0.415279358625412, "learning_rate": 3.5392320534223705e-05, "loss": 0.8931, "num_input_tokens_seen": 6784054, "step": 2471, "train_runtime": 6384.8581, "train_tokens_per_second": 1062.522 }, { "epoch": 0.19863797987102996, "grad_norm": 0.3680597245693207, "learning_rate": 3.5325542570951585e-05, "loss": 0.9366, "num_input_tokens_seen": 6785938, "step": 2472, "train_runtime": 6386.6441, "train_tokens_per_second": 1062.52 }, { "epoch": 0.19871833504088068, "grad_norm": 0.32916340231895447, "learning_rate": 3.5258764607679465e-05, "loss": 0.8794, "num_input_tokens_seen": 6787884, "step": 2473, "train_runtime": 6388.3378, "train_tokens_per_second": 1062.543 }, { "epoch": 0.19879869021073143, "grad_norm": 0.3731456398963928, "learning_rate": 3.519198664440735e-05, "loss": 1.212, "num_input_tokens_seen": 6790908, "step": 2474, "train_runtime": 6390.7884, "train_tokens_per_second": 1062.609 }, { "epoch": 0.19887904538058218, "grad_norm": 0.3627934753894806, "learning_rate": 3.5125208681135225e-05, "loss": 1.0878, "num_input_tokens_seen": 6794140, "step": 2475, "train_runtime": 6393.2212, "train_tokens_per_second": 1062.71 }, { "epoch": 0.1989594005504329, "grad_norm": 0.29463857412338257, "learning_rate": 3.5058430717863105e-05, "loss": 0.7593, "num_input_tokens_seen": 6797450, "step": 2476, "train_runtime": 6395.782, "train_tokens_per_second": 1062.802 }, { "epoch": 0.19903975572028365, "grad_norm": 0.31568753719329834, "learning_rate": 3.4991652754590984e-05, "loss": 1.3336, "num_input_tokens_seen": 6800806, "step": 2477, "train_runtime": 6398.3314, "train_tokens_per_second": 1062.903 }, { "epoch": 0.1991201108901344, "grad_norm": 0.3566600978374481, "learning_rate": 3.492487479131887e-05, "loss": 1.2366, "num_input_tokens_seen": 6803638, "step": 2478, "train_runtime": 6400.7014, "train_tokens_per_second": 1062.952 }, { "epoch": 0.19920046605998512, "grad_norm": 0.3126729726791382, "learning_rate": 3.4858096828046744e-05, "loss": 1.1001, "num_input_tokens_seen": 6806108, "step": 2479, "train_runtime": 6402.8289, "train_tokens_per_second": 1062.985 }, { "epoch": 0.19928082122983587, "grad_norm": 0.2759259343147278, "learning_rate": 3.4791318864774624e-05, "loss": 0.625, "num_input_tokens_seen": 6808676, "step": 2480, "train_runtime": 6405.0031, "train_tokens_per_second": 1063.025 }, { "epoch": 0.19936117639968662, "grad_norm": 0.298539936542511, "learning_rate": 3.4724540901502504e-05, "loss": 0.8877, "num_input_tokens_seen": 6811472, "step": 2481, "train_runtime": 6407.2884, "train_tokens_per_second": 1063.082 }, { "epoch": 0.19944153156953737, "grad_norm": 0.2916746139526367, "learning_rate": 3.4657762938230384e-05, "loss": 0.8358, "num_input_tokens_seen": 6814338, "step": 2482, "train_runtime": 6409.6097, "train_tokens_per_second": 1063.144 }, { "epoch": 0.1995218867393881, "grad_norm": 0.3314656913280487, "learning_rate": 3.459098497495827e-05, "loss": 1.0687, "num_input_tokens_seen": 6817654, "step": 2483, "train_runtime": 6412.1109, "train_tokens_per_second": 1063.246 }, { "epoch": 0.19960224190923884, "grad_norm": 0.3381015956401825, "learning_rate": 3.4524207011686144e-05, "loss": 1.1911, "num_input_tokens_seen": 6819462, "step": 2484, "train_runtime": 6413.8793, "train_tokens_per_second": 1063.235 }, { "epoch": 0.19968259707908959, "grad_norm": 0.3587280213832855, "learning_rate": 3.4457429048414024e-05, "loss": 0.8833, "num_input_tokens_seen": 6824428, "step": 2485, "train_runtime": 6417.4358, "train_tokens_per_second": 1063.42 }, { "epoch": 0.1997629522489403, "grad_norm": 0.29025721549987793, "learning_rate": 3.4390651085141904e-05, "loss": 0.8576, "num_input_tokens_seen": 6826822, "step": 2486, "train_runtime": 6419.3817, "train_tokens_per_second": 1063.47 }, { "epoch": 0.19984330741879106, "grad_norm": 0.26699090003967285, "learning_rate": 3.432387312186979e-05, "loss": 0.8747, "num_input_tokens_seen": 6828642, "step": 2487, "train_runtime": 6421.113, "train_tokens_per_second": 1063.467 }, { "epoch": 0.1999236625886418, "grad_norm": 0.3921565115451813, "learning_rate": 3.4257095158597664e-05, "loss": 0.833, "num_input_tokens_seen": 6829966, "step": 2488, "train_runtime": 6422.6846, "train_tokens_per_second": 1063.413 }, { "epoch": 0.20000401775849252, "grad_norm": 0.322794109582901, "learning_rate": 3.4190317195325544e-05, "loss": 1.1786, "num_input_tokens_seen": 6834044, "step": 2489, "train_runtime": 6425.6764, "train_tokens_per_second": 1063.552 }, { "epoch": 0.20008437292834327, "grad_norm": 0.3190370798110962, "learning_rate": 3.4123539232053424e-05, "loss": 1.005, "num_input_tokens_seen": 6837172, "step": 2490, "train_runtime": 6428.0826, "train_tokens_per_second": 1063.641 }, { "epoch": 0.20016472809819402, "grad_norm": 0.25128650665283203, "learning_rate": 3.4056761268781303e-05, "loss": 0.6746, "num_input_tokens_seen": 6839372, "step": 2491, "train_runtime": 6431.9319, "train_tokens_per_second": 1063.346 }, { "epoch": 0.20024508326804477, "grad_norm": 0.2743060886859894, "learning_rate": 3.3989983305509183e-05, "loss": 0.9751, "num_input_tokens_seen": 6841322, "step": 2492, "train_runtime": 6433.6852, "train_tokens_per_second": 1063.36 }, { "epoch": 0.2003254384378955, "grad_norm": 0.2684800922870636, "learning_rate": 3.392320534223706e-05, "loss": 0.9082, "num_input_tokens_seen": 6843902, "step": 2493, "train_runtime": 6435.745, "train_tokens_per_second": 1063.42 }, { "epoch": 0.20040579360774624, "grad_norm": 0.3017663061618805, "learning_rate": 3.385642737896494e-05, "loss": 1.0876, "num_input_tokens_seen": 6846730, "step": 2494, "train_runtime": 6437.941, "train_tokens_per_second": 1063.497 }, { "epoch": 0.200486148777597, "grad_norm": 0.24603429436683655, "learning_rate": 3.378964941569282e-05, "loss": 1.1759, "num_input_tokens_seen": 6849506, "step": 2495, "train_runtime": 6440.0774, "train_tokens_per_second": 1063.575 }, { "epoch": 0.2005665039474477, "grad_norm": 0.37041062116622925, "learning_rate": 3.37228714524207e-05, "loss": 0.8201, "num_input_tokens_seen": 6851176, "step": 2496, "train_runtime": 6441.7505, "train_tokens_per_second": 1063.558 }, { "epoch": 0.20064685911729846, "grad_norm": 0.3324015438556671, "learning_rate": 3.365609348914858e-05, "loss": 0.92, "num_input_tokens_seen": 6854918, "step": 2497, "train_runtime": 6444.5417, "train_tokens_per_second": 1063.678 }, { "epoch": 0.2007272142871492, "grad_norm": 0.3053337633609772, "learning_rate": 3.358931552587646e-05, "loss": 1.0511, "num_input_tokens_seen": 6857064, "step": 2498, "train_runtime": 6446.49, "train_tokens_per_second": 1063.69 }, { "epoch": 0.20080756945699993, "grad_norm": 0.37749725580215454, "learning_rate": 3.352253756260434e-05, "loss": 1.0809, "num_input_tokens_seen": 6859868, "step": 2499, "train_runtime": 6448.7584, "train_tokens_per_second": 1063.75 }, { "epoch": 0.20088792462685068, "grad_norm": 0.2786153256893158, "learning_rate": 3.345575959933222e-05, "loss": 0.7254, "num_input_tokens_seen": 6861820, "step": 2500, "train_runtime": 6450.5111, "train_tokens_per_second": 1063.764 }, { "epoch": 0.20096827979670143, "grad_norm": 0.3043036162853241, "learning_rate": 3.33889816360601e-05, "loss": 1.2435, "num_input_tokens_seen": 6864276, "step": 2501, "train_runtime": 6452.4659, "train_tokens_per_second": 1063.822 }, { "epoch": 0.20104863496655215, "grad_norm": 0.29842492938041687, "learning_rate": 3.332220367278798e-05, "loss": 0.9389, "num_input_tokens_seen": 6868786, "step": 2502, "train_runtime": 6455.7018, "train_tokens_per_second": 1063.987 }, { "epoch": 0.2011289901364029, "grad_norm": 0.3799628019332886, "learning_rate": 3.325542570951586e-05, "loss": 0.7088, "num_input_tokens_seen": 6869876, "step": 2503, "train_runtime": 6457.2087, "train_tokens_per_second": 1063.908 }, { "epoch": 0.20120934530625365, "grad_norm": 0.39191216230392456, "learning_rate": 3.318864774624374e-05, "loss": 0.8537, "num_input_tokens_seen": 6871742, "step": 2504, "train_runtime": 6459.0027, "train_tokens_per_second": 1063.901 }, { "epoch": 0.2012897004761044, "grad_norm": 0.2769601345062256, "learning_rate": 3.312186978297162e-05, "loss": 1.0407, "num_input_tokens_seen": 6873866, "step": 2505, "train_runtime": 6460.9644, "train_tokens_per_second": 1063.907 }, { "epoch": 0.20137005564595511, "grad_norm": 0.4551903307437897, "learning_rate": 3.30550918196995e-05, "loss": 0.7974, "num_input_tokens_seen": 6876014, "step": 2506, "train_runtime": 6462.9258, "train_tokens_per_second": 1063.917 }, { "epoch": 0.20145041081580586, "grad_norm": 0.2582300007343292, "learning_rate": 3.298831385642738e-05, "loss": 0.6837, "num_input_tokens_seen": 6878138, "step": 2507, "train_runtime": 6464.7705, "train_tokens_per_second": 1063.942 }, { "epoch": 0.2015307659856566, "grad_norm": 0.29647937417030334, "learning_rate": 3.2921535893155256e-05, "loss": 1.0044, "num_input_tokens_seen": 6880764, "step": 2508, "train_runtime": 6466.9028, "train_tokens_per_second": 1063.997 }, { "epoch": 0.20161112115550733, "grad_norm": 0.2961001396179199, "learning_rate": 3.285475792988314e-05, "loss": 1.2751, "num_input_tokens_seen": 6884026, "step": 2509, "train_runtime": 6469.462, "train_tokens_per_second": 1064.08 }, { "epoch": 0.20169147632535808, "grad_norm": 0.3233042061328888, "learning_rate": 3.278797996661102e-05, "loss": 0.8876, "num_input_tokens_seen": 6886030, "step": 2510, "train_runtime": 6471.2494, "train_tokens_per_second": 1064.096 }, { "epoch": 0.20177183149520883, "grad_norm": 0.31158211827278137, "learning_rate": 3.27212020033389e-05, "loss": 0.8903, "num_input_tokens_seen": 6888694, "step": 2511, "train_runtime": 6473.4197, "train_tokens_per_second": 1064.151 }, { "epoch": 0.20185218666505955, "grad_norm": 0.35895296931266785, "learning_rate": 3.2654424040066775e-05, "loss": 1.1882, "num_input_tokens_seen": 6892362, "step": 2512, "train_runtime": 6476.0984, "train_tokens_per_second": 1064.277 }, { "epoch": 0.2019325418349103, "grad_norm": 0.3267019987106323, "learning_rate": 3.258764607679466e-05, "loss": 0.828, "num_input_tokens_seen": 6895408, "step": 2513, "train_runtime": 6478.4322, "train_tokens_per_second": 1064.364 }, { "epoch": 0.20201289700476105, "grad_norm": 0.3304426670074463, "learning_rate": 3.252086811352254e-05, "loss": 0.5703, "num_input_tokens_seen": 6899018, "step": 2514, "train_runtime": 6481.0315, "train_tokens_per_second": 1064.494 }, { "epoch": 0.20209325217461177, "grad_norm": 0.30019691586494446, "learning_rate": 3.245409015025042e-05, "loss": 0.9755, "num_input_tokens_seen": 6901990, "step": 2515, "train_runtime": 6483.3692, "train_tokens_per_second": 1064.568 }, { "epoch": 0.20217360734446252, "grad_norm": 0.3224036991596222, "learning_rate": 3.2387312186978295e-05, "loss": 1.1182, "num_input_tokens_seen": 6906232, "step": 2516, "train_runtime": 6486.3679, "train_tokens_per_second": 1064.73 }, { "epoch": 0.20225396251431327, "grad_norm": 0.28178849816322327, "learning_rate": 3.2320534223706175e-05, "loss": 1.2554, "num_input_tokens_seen": 6908974, "step": 2517, "train_runtime": 6488.505, "train_tokens_per_second": 1064.802 }, { "epoch": 0.20233431768416402, "grad_norm": 0.3748055696487427, "learning_rate": 3.225375626043406e-05, "loss": 1.0476, "num_input_tokens_seen": 6911370, "step": 2518, "train_runtime": 6490.4681, "train_tokens_per_second": 1064.849 }, { "epoch": 0.20241467285401474, "grad_norm": 0.3252844214439392, "learning_rate": 3.218697829716194e-05, "loss": 0.849, "num_input_tokens_seen": 6913494, "step": 2519, "train_runtime": 6492.316, "train_tokens_per_second": 1064.873 }, { "epoch": 0.2024950280238655, "grad_norm": 0.23035064339637756, "learning_rate": 3.2120200333889815e-05, "loss": 0.6645, "num_input_tokens_seen": 6916264, "step": 2520, "train_runtime": 6494.5213, "train_tokens_per_second": 1064.938 }, { "epoch": 0.20257538319371624, "grad_norm": 0.22935079038143158, "learning_rate": 3.2053422370617695e-05, "loss": 0.7179, "num_input_tokens_seen": 6919738, "step": 2521, "train_runtime": 6499.1175, "train_tokens_per_second": 1064.72 }, { "epoch": 0.20265573836356696, "grad_norm": 0.3111288249492645, "learning_rate": 3.198664440734558e-05, "loss": 0.683, "num_input_tokens_seen": 6922012, "step": 2522, "train_runtime": 6501.012, "train_tokens_per_second": 1064.759 }, { "epoch": 0.2027360935334177, "grad_norm": 0.3371312618255615, "learning_rate": 3.191986644407346e-05, "loss": 0.5878, "num_input_tokens_seen": 6924750, "step": 2523, "train_runtime": 6503.1509, "train_tokens_per_second": 1064.83 }, { "epoch": 0.20281644870326845, "grad_norm": 0.28429242968559265, "learning_rate": 3.1853088480801334e-05, "loss": 0.8481, "num_input_tokens_seen": 6926450, "step": 2524, "train_runtime": 6504.7521, "train_tokens_per_second": 1064.829 }, { "epoch": 0.20289680387311917, "grad_norm": 0.28056249022483826, "learning_rate": 3.1786310517529214e-05, "loss": 1.0278, "num_input_tokens_seen": 6929038, "step": 2525, "train_runtime": 6506.8304, "train_tokens_per_second": 1064.887 }, { "epoch": 0.20297715904296992, "grad_norm": 0.343074232339859, "learning_rate": 3.1719532554257094e-05, "loss": 0.8376, "num_input_tokens_seen": 6932302, "step": 2526, "train_runtime": 6509.3591, "train_tokens_per_second": 1064.975 }, { "epoch": 0.20305751421282067, "grad_norm": 0.3657798171043396, "learning_rate": 3.165275459098498e-05, "loss": 1.0568, "num_input_tokens_seen": 6934786, "step": 2527, "train_runtime": 6511.4316, "train_tokens_per_second": 1065.017 }, { "epoch": 0.20313786938267142, "grad_norm": 0.39345574378967285, "learning_rate": 3.1585976627712854e-05, "loss": 1.1339, "num_input_tokens_seen": 6936608, "step": 2528, "train_runtime": 6513.2353, "train_tokens_per_second": 1065.002 }, { "epoch": 0.20321822455252214, "grad_norm": 0.2972884476184845, "learning_rate": 3.1519198664440734e-05, "loss": 1.0111, "num_input_tokens_seen": 6938784, "step": 2529, "train_runtime": 6515.1279, "train_tokens_per_second": 1065.027 }, { "epoch": 0.2032985797223729, "grad_norm": 0.29959917068481445, "learning_rate": 3.1452420701168614e-05, "loss": 0.9685, "num_input_tokens_seen": 6941472, "step": 2530, "train_runtime": 6517.3115, "train_tokens_per_second": 1065.082 }, { "epoch": 0.20337893489222364, "grad_norm": 0.3754681944847107, "learning_rate": 3.13856427378965e-05, "loss": 1.0576, "num_input_tokens_seen": 6945244, "step": 2531, "train_runtime": 6520.0172, "train_tokens_per_second": 1065.219 }, { "epoch": 0.20345929006207436, "grad_norm": 0.30845966935157776, "learning_rate": 3.1318864774624374e-05, "loss": 0.7853, "num_input_tokens_seen": 6949136, "step": 2532, "train_runtime": 6522.803, "train_tokens_per_second": 1065.36 }, { "epoch": 0.2035396452319251, "grad_norm": 0.32504501938819885, "learning_rate": 3.1252086811352254e-05, "loss": 1.0266, "num_input_tokens_seen": 6951800, "step": 2533, "train_runtime": 6524.8404, "train_tokens_per_second": 1065.436 }, { "epoch": 0.20362000040177586, "grad_norm": 0.27619948983192444, "learning_rate": 3.1185308848080134e-05, "loss": 0.8903, "num_input_tokens_seen": 6955344, "step": 2534, "train_runtime": 6527.5022, "train_tokens_per_second": 1065.544 }, { "epoch": 0.20370035557162658, "grad_norm": 0.36974743008613586, "learning_rate": 3.111853088480802e-05, "loss": 1.168, "num_input_tokens_seen": 6958496, "step": 2535, "train_runtime": 6529.9366, "train_tokens_per_second": 1065.63 }, { "epoch": 0.20378071074147733, "grad_norm": 0.3140815198421478, "learning_rate": 3.1051752921535894e-05, "loss": 0.8182, "num_input_tokens_seen": 6961644, "step": 2536, "train_runtime": 6532.4645, "train_tokens_per_second": 1065.699 }, { "epoch": 0.20386106591132808, "grad_norm": 0.2374127209186554, "learning_rate": 3.0984974958263773e-05, "loss": 0.5429, "num_input_tokens_seen": 6963914, "step": 2537, "train_runtime": 6534.4251, "train_tokens_per_second": 1065.727 }, { "epoch": 0.2039414210811788, "grad_norm": 0.30528032779693604, "learning_rate": 3.0918196994991653e-05, "loss": 0.9504, "num_input_tokens_seen": 6967408, "step": 2538, "train_runtime": 6537.0058, "train_tokens_per_second": 1065.841 }, { "epoch": 0.20402177625102955, "grad_norm": 0.28372102975845337, "learning_rate": 3.085141903171953e-05, "loss": 1.0239, "num_input_tokens_seen": 6969096, "step": 2539, "train_runtime": 6538.6651, "train_tokens_per_second": 1065.829 }, { "epoch": 0.2041021314208803, "grad_norm": 0.2745300829410553, "learning_rate": 3.078464106844741e-05, "loss": 1.0085, "num_input_tokens_seen": 6970954, "step": 2540, "train_runtime": 6540.422, "train_tokens_per_second": 1065.826 }, { "epoch": 0.20418248659073104, "grad_norm": 0.4016948938369751, "learning_rate": 3.071786310517529e-05, "loss": 0.9755, "num_input_tokens_seen": 6973208, "step": 2541, "train_runtime": 6542.4188, "train_tokens_per_second": 1065.846 }, { "epoch": 0.20426284176058176, "grad_norm": 0.3127979040145874, "learning_rate": 3.065108514190317e-05, "loss": 0.8566, "num_input_tokens_seen": 6974720, "step": 2542, "train_runtime": 6544.0163, "train_tokens_per_second": 1065.816 }, { "epoch": 0.2043431969304325, "grad_norm": 0.2961050271987915, "learning_rate": 3.058430717863105e-05, "loss": 0.8619, "num_input_tokens_seen": 6976470, "step": 2543, "train_runtime": 6545.6652, "train_tokens_per_second": 1065.815 }, { "epoch": 0.20442355210028326, "grad_norm": 0.3067968785762787, "learning_rate": 3.051752921535893e-05, "loss": 0.9161, "num_input_tokens_seen": 6978776, "step": 2544, "train_runtime": 6547.6325, "train_tokens_per_second": 1065.847 }, { "epoch": 0.20450390727013398, "grad_norm": 0.29742324352264404, "learning_rate": 3.0450751252086813e-05, "loss": 1.2435, "num_input_tokens_seen": 6981800, "step": 2545, "train_runtime": 6549.961, "train_tokens_per_second": 1065.93 }, { "epoch": 0.20458426243998473, "grad_norm": 1.1142953634262085, "learning_rate": 3.0383973288814693e-05, "loss": 0.7926, "num_input_tokens_seen": 6983706, "step": 2546, "train_runtime": 6551.6653, "train_tokens_per_second": 1065.944 }, { "epoch": 0.20466461760983548, "grad_norm": 0.33697038888931274, "learning_rate": 3.0317195325542573e-05, "loss": 0.8405, "num_input_tokens_seen": 6986260, "step": 2547, "train_runtime": 6553.7381, "train_tokens_per_second": 1065.996 }, { "epoch": 0.2047449727796862, "grad_norm": 0.30040961503982544, "learning_rate": 3.025041736227045e-05, "loss": 0.7504, "num_input_tokens_seen": 6989338, "step": 2548, "train_runtime": 6556.1074, "train_tokens_per_second": 1066.08 }, { "epoch": 0.20482532794953695, "grad_norm": 0.28556397557258606, "learning_rate": 3.0183639398998333e-05, "loss": 0.8503, "num_input_tokens_seen": 6991216, "step": 2549, "train_runtime": 6557.8535, "train_tokens_per_second": 1066.083 }, { "epoch": 0.2049056831193877, "grad_norm": 0.42993345856666565, "learning_rate": 3.0116861435726213e-05, "loss": 0.975, "num_input_tokens_seen": 6994302, "step": 2550, "train_runtime": 6560.1569, "train_tokens_per_second": 1066.179 }, { "epoch": 0.20498603828923842, "grad_norm": 0.32767632603645325, "learning_rate": 3.0050083472454093e-05, "loss": 0.9443, "num_input_tokens_seen": 6996802, "step": 2551, "train_runtime": 6564.0704, "train_tokens_per_second": 1065.924 }, { "epoch": 0.20506639345908917, "grad_norm": 0.3201397657394409, "learning_rate": 2.998330550918197e-05, "loss": 0.8547, "num_input_tokens_seen": 6999148, "step": 2552, "train_runtime": 6566.0875, "train_tokens_per_second": 1065.954 }, { "epoch": 0.20514674862893992, "grad_norm": 0.2681242823600769, "learning_rate": 2.991652754590985e-05, "loss": 0.83, "num_input_tokens_seen": 7001700, "step": 2553, "train_runtime": 6568.2147, "train_tokens_per_second": 1065.997 }, { "epoch": 0.20522710379879067, "grad_norm": 0.281637579202652, "learning_rate": 2.9849749582637732e-05, "loss": 0.9952, "num_input_tokens_seen": 7005058, "step": 2554, "train_runtime": 6570.7853, "train_tokens_per_second": 1066.091 }, { "epoch": 0.2053074589686414, "grad_norm": 0.3066181242465973, "learning_rate": 2.9782971619365612e-05, "loss": 0.8452, "num_input_tokens_seen": 7006698, "step": 2555, "train_runtime": 6572.3758, "train_tokens_per_second": 1066.083 }, { "epoch": 0.20538781413849214, "grad_norm": 0.43828171491622925, "learning_rate": 2.971619365609349e-05, "loss": 1.0042, "num_input_tokens_seen": 7008880, "step": 2556, "train_runtime": 6574.282, "train_tokens_per_second": 1066.106 }, { "epoch": 0.20546816930834289, "grad_norm": 0.22972333431243896, "learning_rate": 2.964941569282137e-05, "loss": 0.9515, "num_input_tokens_seen": 7012440, "step": 2557, "train_runtime": 6576.882, "train_tokens_per_second": 1066.226 }, { "epoch": 0.2055485244781936, "grad_norm": 0.32284027338027954, "learning_rate": 2.9582637729549252e-05, "loss": 0.9505, "num_input_tokens_seen": 7015090, "step": 2558, "train_runtime": 6579.0679, "train_tokens_per_second": 1066.274 }, { "epoch": 0.20562887964804435, "grad_norm": 0.2418496161699295, "learning_rate": 2.9515859766277132e-05, "loss": 0.8734, "num_input_tokens_seen": 7018630, "step": 2559, "train_runtime": 6581.6306, "train_tokens_per_second": 1066.397 }, { "epoch": 0.2057092348178951, "grad_norm": 0.31431302428245544, "learning_rate": 2.944908180300501e-05, "loss": 1.0124, "num_input_tokens_seen": 7022046, "step": 2560, "train_runtime": 6584.2637, "train_tokens_per_second": 1066.489 }, { "epoch": 0.20578958998774582, "grad_norm": 0.32687124609947205, "learning_rate": 2.938230383973289e-05, "loss": 0.828, "num_input_tokens_seen": 7024366, "step": 2561, "train_runtime": 6586.2513, "train_tokens_per_second": 1066.52 }, { "epoch": 0.20586994515759657, "grad_norm": 0.2755314111709595, "learning_rate": 2.931552587646077e-05, "loss": 0.75, "num_input_tokens_seen": 7026568, "step": 2562, "train_runtime": 6588.1639, "train_tokens_per_second": 1066.544 }, { "epoch": 0.20595030032744732, "grad_norm": 0.311623215675354, "learning_rate": 2.924874791318865e-05, "loss": 1.0934, "num_input_tokens_seen": 7032308, "step": 2563, "train_runtime": 6592.2321, "train_tokens_per_second": 1066.757 }, { "epoch": 0.20603065549729807, "grad_norm": 0.2689889073371887, "learning_rate": 2.9181969949916528e-05, "loss": 0.9113, "num_input_tokens_seen": 7034958, "step": 2564, "train_runtime": 6594.4275, "train_tokens_per_second": 1066.803 }, { "epoch": 0.2061110106671488, "grad_norm": 0.338100403547287, "learning_rate": 2.9115191986644408e-05, "loss": 0.9602, "num_input_tokens_seen": 7037022, "step": 2565, "train_runtime": 6596.1829, "train_tokens_per_second": 1066.832 }, { "epoch": 0.20619136583699954, "grad_norm": 0.3333339989185333, "learning_rate": 2.9048414023372288e-05, "loss": 1.2499, "num_input_tokens_seen": 7039262, "step": 2566, "train_runtime": 6598.0852, "train_tokens_per_second": 1066.864 }, { "epoch": 0.2062717210068503, "grad_norm": 0.2797660231590271, "learning_rate": 2.898163606010017e-05, "loss": 1.0527, "num_input_tokens_seen": 7041886, "step": 2567, "train_runtime": 6600.2254, "train_tokens_per_second": 1066.916 }, { "epoch": 0.206352076176701, "grad_norm": 0.21665260195732117, "learning_rate": 2.8914858096828045e-05, "loss": 0.4836, "num_input_tokens_seen": 7048516, "step": 2568, "train_runtime": 6604.6541, "train_tokens_per_second": 1067.204 }, { "epoch": 0.20643243134655176, "grad_norm": 0.38138285279273987, "learning_rate": 2.8848080133555928e-05, "loss": 1.0912, "num_input_tokens_seen": 7051190, "step": 2569, "train_runtime": 6606.8892, "train_tokens_per_second": 1067.248 }, { "epoch": 0.2065127865164025, "grad_norm": 0.40003708004951477, "learning_rate": 2.8781302170283808e-05, "loss": 1.2075, "num_input_tokens_seen": 7052824, "step": 2570, "train_runtime": 6608.4814, "train_tokens_per_second": 1067.238 }, { "epoch": 0.20659314168625323, "grad_norm": 0.298174649477005, "learning_rate": 2.8714524207011688e-05, "loss": 0.8016, "num_input_tokens_seen": 7056034, "step": 2571, "train_runtime": 6611.0225, "train_tokens_per_second": 1067.314 }, { "epoch": 0.20667349685610398, "grad_norm": 0.2843630611896515, "learning_rate": 2.8647746243739564e-05, "loss": 0.7817, "num_input_tokens_seen": 7059210, "step": 2572, "train_runtime": 6613.5279, "train_tokens_per_second": 1067.389 }, { "epoch": 0.20675385202595473, "grad_norm": 0.3161008358001709, "learning_rate": 2.8580968280467448e-05, "loss": 0.9338, "num_input_tokens_seen": 7061704, "step": 2573, "train_runtime": 6615.5676, "train_tokens_per_second": 1067.437 }, { "epoch": 0.20683420719580545, "grad_norm": 0.3127140998840332, "learning_rate": 2.8514190317195328e-05, "loss": 0.65, "num_input_tokens_seen": 7063208, "step": 2574, "train_runtime": 6617.2057, "train_tokens_per_second": 1067.4 }, { "epoch": 0.2069145623656562, "grad_norm": 0.45175424218177795, "learning_rate": 2.8447412353923207e-05, "loss": 0.8879, "num_input_tokens_seen": 7066348, "step": 2575, "train_runtime": 6619.6717, "train_tokens_per_second": 1067.477 }, { "epoch": 0.20699491753550694, "grad_norm": 0.3343769311904907, "learning_rate": 2.8380634390651084e-05, "loss": 1.0982, "num_input_tokens_seen": 7067970, "step": 2576, "train_runtime": 6621.2544, "train_tokens_per_second": 1067.467 }, { "epoch": 0.2070752727053577, "grad_norm": 0.3058067560195923, "learning_rate": 2.8313856427378964e-05, "loss": 0.871, "num_input_tokens_seen": 7070704, "step": 2577, "train_runtime": 6623.3464, "train_tokens_per_second": 1067.543 }, { "epoch": 0.20715562787520841, "grad_norm": 0.31188082695007324, "learning_rate": 2.8247078464106847e-05, "loss": 0.8766, "num_input_tokens_seen": 7074054, "step": 2578, "train_runtime": 6625.8045, "train_tokens_per_second": 1067.652 }, { "epoch": 0.20723598304505916, "grad_norm": 0.33825647830963135, "learning_rate": 2.8180300500834727e-05, "loss": 0.875, "num_input_tokens_seen": 7076172, "step": 2579, "train_runtime": 6627.6876, "train_tokens_per_second": 1067.668 }, { "epoch": 0.2073163382149099, "grad_norm": 0.28344404697418213, "learning_rate": 2.8113522537562604e-05, "loss": 1.0178, "num_input_tokens_seen": 7078598, "step": 2580, "train_runtime": 6629.8123, "train_tokens_per_second": 1067.692 }, { "epoch": 0.20739669338476063, "grad_norm": 0.34717726707458496, "learning_rate": 2.8046744574290484e-05, "loss": 0.9004, "num_input_tokens_seen": 7081574, "step": 2581, "train_runtime": 6633.8341, "train_tokens_per_second": 1067.493 }, { "epoch": 0.20747704855461138, "grad_norm": 0.33153900504112244, "learning_rate": 2.7979966611018367e-05, "loss": 1.059, "num_input_tokens_seen": 7085034, "step": 2582, "train_runtime": 6636.4238, "train_tokens_per_second": 1067.598 }, { "epoch": 0.20755740372446213, "grad_norm": 0.24847878515720367, "learning_rate": 2.7913188647746247e-05, "loss": 0.9254, "num_input_tokens_seen": 7087960, "step": 2583, "train_runtime": 6638.6533, "train_tokens_per_second": 1067.68 }, { "epoch": 0.20763775889431285, "grad_norm": 0.3006184995174408, "learning_rate": 2.7846410684474123e-05, "loss": 0.9193, "num_input_tokens_seen": 7091708, "step": 2584, "train_runtime": 6641.4229, "train_tokens_per_second": 1067.799 }, { "epoch": 0.2077181140641636, "grad_norm": 0.24109326303005219, "learning_rate": 2.7779632721202003e-05, "loss": 0.811, "num_input_tokens_seen": 7097692, "step": 2585, "train_runtime": 6645.4647, "train_tokens_per_second": 1068.051 }, { "epoch": 0.20779846923401435, "grad_norm": 0.27665063738822937, "learning_rate": 2.7712854757929883e-05, "loss": 0.9955, "num_input_tokens_seen": 7102658, "step": 2586, "train_runtime": 6648.9607, "train_tokens_per_second": 1068.236 }, { "epoch": 0.20787882440386507, "grad_norm": 0.30551180243492126, "learning_rate": 2.7646076794657767e-05, "loss": 1.0939, "num_input_tokens_seen": 7105280, "step": 2587, "train_runtime": 6651.1024, "train_tokens_per_second": 1068.286 }, { "epoch": 0.20795917957371582, "grad_norm": 0.34263044595718384, "learning_rate": 2.7579298831385643e-05, "loss": 1.0195, "num_input_tokens_seen": 7108260, "step": 2588, "train_runtime": 6653.442, "train_tokens_per_second": 1068.358 }, { "epoch": 0.20803953474356657, "grad_norm": 0.31950539350509644, "learning_rate": 2.7512520868113523e-05, "loss": 1.1237, "num_input_tokens_seen": 7113474, "step": 2589, "train_runtime": 6657.0473, "train_tokens_per_second": 1068.563 }, { "epoch": 0.20811988991341732, "grad_norm": 0.3273375928401947, "learning_rate": 2.7445742904841403e-05, "loss": 1.044, "num_input_tokens_seen": 7116646, "step": 2590, "train_runtime": 6659.5073, "train_tokens_per_second": 1068.645 }, { "epoch": 0.20820024508326804, "grad_norm": 0.4363780617713928, "learning_rate": 2.7378964941569286e-05, "loss": 0.9577, "num_input_tokens_seen": 7118516, "step": 2591, "train_runtime": 6661.2619, "train_tokens_per_second": 1068.644 }, { "epoch": 0.20828060025311879, "grad_norm": 0.2938719391822815, "learning_rate": 2.731218697829716e-05, "loss": 1.2035, "num_input_tokens_seen": 7121542, "step": 2592, "train_runtime": 6663.57, "train_tokens_per_second": 1068.728 }, { "epoch": 0.20836095542296953, "grad_norm": 0.32434898614883423, "learning_rate": 2.7245409015025043e-05, "loss": 0.9278, "num_input_tokens_seen": 7124434, "step": 2593, "train_runtime": 6665.8409, "train_tokens_per_second": 1068.797 }, { "epoch": 0.20844131059282026, "grad_norm": 0.34501877427101135, "learning_rate": 2.7178631051752923e-05, "loss": 0.5575, "num_input_tokens_seen": 7127106, "step": 2594, "train_runtime": 6667.9953, "train_tokens_per_second": 1068.853 }, { "epoch": 0.208521665762671, "grad_norm": 0.2891291081905365, "learning_rate": 2.7111853088480803e-05, "loss": 0.7796, "num_input_tokens_seen": 7129588, "step": 2595, "train_runtime": 6670.0028, "train_tokens_per_second": 1068.903 }, { "epoch": 0.20860202093252175, "grad_norm": 0.3389528691768646, "learning_rate": 2.704507512520868e-05, "loss": 1.2186, "num_input_tokens_seen": 7131818, "step": 2596, "train_runtime": 6671.9101, "train_tokens_per_second": 1068.932 }, { "epoch": 0.20868237610237247, "grad_norm": 0.331019788980484, "learning_rate": 2.6978297161936563e-05, "loss": 0.7591, "num_input_tokens_seen": 7134266, "step": 2597, "train_runtime": 6673.9387, "train_tokens_per_second": 1068.974 }, { "epoch": 0.20876273127222322, "grad_norm": 0.5408254265785217, "learning_rate": 2.6911519198664442e-05, "loss": 0.74, "num_input_tokens_seen": 7137480, "step": 2598, "train_runtime": 6676.368, "train_tokens_per_second": 1069.066 }, { "epoch": 0.20884308644207397, "grad_norm": 0.4499052166938782, "learning_rate": 2.6844741235392322e-05, "loss": 0.8022, "num_input_tokens_seen": 7139864, "step": 2599, "train_runtime": 6678.4226, "train_tokens_per_second": 1069.094 }, { "epoch": 0.20892344161192472, "grad_norm": 0.3211537003517151, "learning_rate": 2.67779632721202e-05, "loss": 1.0694, "num_input_tokens_seen": 7143004, "step": 2600, "train_runtime": 6680.8664, "train_tokens_per_second": 1069.173 }, { "epoch": 0.20900379678177544, "grad_norm": 0.32943010330200195, "learning_rate": 2.671118530884808e-05, "loss": 1.2333, "num_input_tokens_seen": 7147510, "step": 2601, "train_runtime": 6684.1297, "train_tokens_per_second": 1069.325 }, { "epoch": 0.2090841519516262, "grad_norm": 0.29366013407707214, "learning_rate": 2.6644407345575962e-05, "loss": 0.97, "num_input_tokens_seen": 7150262, "step": 2602, "train_runtime": 6686.3203, "train_tokens_per_second": 1069.387 }, { "epoch": 0.20916450712147694, "grad_norm": 0.42908358573913574, "learning_rate": 2.6577629382303842e-05, "loss": 0.7171, "num_input_tokens_seen": 7153274, "step": 2603, "train_runtime": 6688.6324, "train_tokens_per_second": 1069.467 }, { "epoch": 0.20924486229132766, "grad_norm": 0.2905648946762085, "learning_rate": 2.651085141903172e-05, "loss": 0.6807, "num_input_tokens_seen": 7159390, "step": 2604, "train_runtime": 6692.8467, "train_tokens_per_second": 1069.708 }, { "epoch": 0.2093252174611784, "grad_norm": 0.36995115876197815, "learning_rate": 2.64440734557596e-05, "loss": 0.9172, "num_input_tokens_seen": 7161184, "step": 2605, "train_runtime": 6694.5556, "train_tokens_per_second": 1069.703 }, { "epoch": 0.20940557263102916, "grad_norm": 0.3697642683982849, "learning_rate": 2.6377295492487482e-05, "loss": 1.1028, "num_input_tokens_seen": 7163334, "step": 2606, "train_runtime": 6696.4025, "train_tokens_per_second": 1069.729 }, { "epoch": 0.20948592780087988, "grad_norm": 0.2805689573287964, "learning_rate": 2.6310517529215362e-05, "loss": 0.9916, "num_input_tokens_seen": 7165998, "step": 2607, "train_runtime": 6698.5314, "train_tokens_per_second": 1069.786 }, { "epoch": 0.20956628297073063, "grad_norm": 0.34024694561958313, "learning_rate": 2.624373956594324e-05, "loss": 0.9108, "num_input_tokens_seen": 7169338, "step": 2608, "train_runtime": 6700.9744, "train_tokens_per_second": 1069.895 }, { "epoch": 0.20964663814058138, "grad_norm": 0.34759029746055603, "learning_rate": 2.6176961602671118e-05, "loss": 0.8615, "num_input_tokens_seen": 7171878, "step": 2609, "train_runtime": 6703.0758, "train_tokens_per_second": 1069.938 }, { "epoch": 0.2097269933104321, "grad_norm": 0.29292887449264526, "learning_rate": 2.6110183639398998e-05, "loss": 0.9368, "num_input_tokens_seen": 7175876, "step": 2610, "train_runtime": 6705.9241, "train_tokens_per_second": 1070.08 }, { "epoch": 0.20980734848028285, "grad_norm": 0.35517358779907227, "learning_rate": 2.604340567612688e-05, "loss": 1.0702, "num_input_tokens_seen": 7178460, "step": 2611, "train_runtime": 6709.9519, "train_tokens_per_second": 1069.823 }, { "epoch": 0.2098877036501336, "grad_norm": 0.391550749540329, "learning_rate": 2.597662771285476e-05, "loss": 0.7596, "num_input_tokens_seen": 7180238, "step": 2612, "train_runtime": 6711.7046, "train_tokens_per_second": 1069.808 }, { "epoch": 0.20996805881998434, "grad_norm": 0.29763591289520264, "learning_rate": 2.5909849749582638e-05, "loss": 0.9017, "num_input_tokens_seen": 7183710, "step": 2613, "train_runtime": 6714.2835, "train_tokens_per_second": 1069.915 }, { "epoch": 0.21004841398983506, "grad_norm": 0.35687410831451416, "learning_rate": 2.5843071786310518e-05, "loss": 1.3214, "num_input_tokens_seen": 7187950, "step": 2614, "train_runtime": 6717.2198, "train_tokens_per_second": 1070.078 }, { "epoch": 0.2101287691596858, "grad_norm": 0.27503442764282227, "learning_rate": 2.57762938230384e-05, "loss": 0.8821, "num_input_tokens_seen": 7190992, "step": 2615, "train_runtime": 6719.5529, "train_tokens_per_second": 1070.159 }, { "epoch": 0.21020912432953656, "grad_norm": 0.33326447010040283, "learning_rate": 2.570951585976628e-05, "loss": 1.1317, "num_input_tokens_seen": 7193508, "step": 2616, "train_runtime": 6721.5633, "train_tokens_per_second": 1070.214 }, { "epoch": 0.21028947949938728, "grad_norm": 0.4501754641532898, "learning_rate": 2.5642737896494158e-05, "loss": 0.7386, "num_input_tokens_seen": 7195122, "step": 2617, "train_runtime": 6723.1615, "train_tokens_per_second": 1070.199 }, { "epoch": 0.21036983466923803, "grad_norm": 0.25743284821510315, "learning_rate": 2.5575959933222038e-05, "loss": 0.7228, "num_input_tokens_seen": 7199788, "step": 2618, "train_runtime": 6726.5604, "train_tokens_per_second": 1070.352 }, { "epoch": 0.21045018983908878, "grad_norm": 0.37954598665237427, "learning_rate": 2.5509181969949918e-05, "loss": 1.0888, "num_input_tokens_seen": 7201342, "step": 2619, "train_runtime": 6728.1832, "train_tokens_per_second": 1070.325 }, { "epoch": 0.2105305450089395, "grad_norm": 0.2765674293041229, "learning_rate": 2.54424040066778e-05, "loss": 0.8129, "num_input_tokens_seen": 7204266, "step": 2620, "train_runtime": 6730.4785, "train_tokens_per_second": 1070.394 }, { "epoch": 0.21061090017879025, "grad_norm": 0.3497758209705353, "learning_rate": 2.5375626043405677e-05, "loss": 1.0757, "num_input_tokens_seen": 7206274, "step": 2621, "train_runtime": 6732.3507, "train_tokens_per_second": 1070.395 }, { "epoch": 0.210691255348641, "grad_norm": 0.3260670304298401, "learning_rate": 2.5308848080133557e-05, "loss": 1.0409, "num_input_tokens_seen": 7208778, "step": 2622, "train_runtime": 6734.3594, "train_tokens_per_second": 1070.447 }, { "epoch": 0.21077161051849172, "grad_norm": 0.3261588513851166, "learning_rate": 2.5242070116861437e-05, "loss": 0.9688, "num_input_tokens_seen": 7211160, "step": 2623, "train_runtime": 6736.4843, "train_tokens_per_second": 1070.463 }, { "epoch": 0.21085196568834247, "grad_norm": 0.332161009311676, "learning_rate": 2.517529215358932e-05, "loss": 0.7956, "num_input_tokens_seen": 7213212, "step": 2624, "train_runtime": 6738.3343, "train_tokens_per_second": 1070.474 }, { "epoch": 0.21093232085819322, "grad_norm": 0.31648534536361694, "learning_rate": 2.5108514190317194e-05, "loss": 0.9231, "num_input_tokens_seen": 7216274, "step": 2625, "train_runtime": 6740.7297, "train_tokens_per_second": 1070.548 }, { "epoch": 0.21101267602804397, "grad_norm": 0.3199121654033661, "learning_rate": 2.5041736227045077e-05, "loss": 0.8654, "num_input_tokens_seen": 7219034, "step": 2626, "train_runtime": 6742.9141, "train_tokens_per_second": 1070.61 }, { "epoch": 0.2110930311978947, "grad_norm": 0.36725541949272156, "learning_rate": 2.4974958263772957e-05, "loss": 0.8796, "num_input_tokens_seen": 7221744, "step": 2627, "train_runtime": 6745.1631, "train_tokens_per_second": 1070.655 }, { "epoch": 0.21117338636774544, "grad_norm": 0.26133593916893005, "learning_rate": 2.4908180300500837e-05, "loss": 0.851, "num_input_tokens_seen": 7223944, "step": 2628, "train_runtime": 6747.1141, "train_tokens_per_second": 1070.672 }, { "epoch": 0.21125374153759618, "grad_norm": 0.24963918328285217, "learning_rate": 2.4841402337228717e-05, "loss": 1.0526, "num_input_tokens_seen": 7228004, "step": 2629, "train_runtime": 6749.9509, "train_tokens_per_second": 1070.823 }, { "epoch": 0.2113340967074469, "grad_norm": 0.44179970026016235, "learning_rate": 2.4774624373956597e-05, "loss": 0.8394, "num_input_tokens_seen": 7230254, "step": 2630, "train_runtime": 6751.9408, "train_tokens_per_second": 1070.841 }, { "epoch": 0.21141445187729765, "grad_norm": 0.45255523920059204, "learning_rate": 2.4707846410684477e-05, "loss": 1.1112, "num_input_tokens_seen": 7232764, "step": 2631, "train_runtime": 6753.985, "train_tokens_per_second": 1070.888 }, { "epoch": 0.2114948070471484, "grad_norm": 0.3996327221393585, "learning_rate": 2.4641068447412353e-05, "loss": 1.0531, "num_input_tokens_seen": 7235238, "step": 2632, "train_runtime": 6756.0367, "train_tokens_per_second": 1070.929 }, { "epoch": 0.21157516221699912, "grad_norm": 0.38754984736442566, "learning_rate": 2.4574290484140237e-05, "loss": 1.175, "num_input_tokens_seen": 7238556, "step": 2633, "train_runtime": 6758.5238, "train_tokens_per_second": 1071.026 }, { "epoch": 0.21165551738684987, "grad_norm": 0.2536124587059021, "learning_rate": 2.4507512520868113e-05, "loss": 0.8024, "num_input_tokens_seen": 7242192, "step": 2634, "train_runtime": 6761.2341, "train_tokens_per_second": 1071.135 }, { "epoch": 0.21173587255670062, "grad_norm": 0.35031622648239136, "learning_rate": 2.4440734557595996e-05, "loss": 1.1753, "num_input_tokens_seen": 7244398, "step": 2635, "train_runtime": 6763.1332, "train_tokens_per_second": 1071.16 }, { "epoch": 0.21181622772655137, "grad_norm": 0.3115178346633911, "learning_rate": 2.4373956594323873e-05, "loss": 1.0367, "num_input_tokens_seen": 7248448, "step": 2636, "train_runtime": 6766.02, "train_tokens_per_second": 1071.302 }, { "epoch": 0.2118965828964021, "grad_norm": 0.3466339707374573, "learning_rate": 2.4307178631051756e-05, "loss": 0.6242, "num_input_tokens_seen": 7251678, "step": 2637, "train_runtime": 6768.4347, "train_tokens_per_second": 1071.397 }, { "epoch": 0.21197693806625284, "grad_norm": 0.3892398774623871, "learning_rate": 2.4240400667779633e-05, "loss": 0.7594, "num_input_tokens_seen": 7255652, "step": 2638, "train_runtime": 6771.2308, "train_tokens_per_second": 1071.541 }, { "epoch": 0.2120572932361036, "grad_norm": 0.2880546450614929, "learning_rate": 2.4173622704507516e-05, "loss": 0.6689, "num_input_tokens_seen": 7258814, "step": 2639, "train_runtime": 6773.595, "train_tokens_per_second": 1071.634 }, { "epoch": 0.2121376484059543, "grad_norm": 0.33683693408966064, "learning_rate": 2.4106844741235393e-05, "loss": 0.9005, "num_input_tokens_seen": 7261264, "step": 2640, "train_runtime": 6775.73, "train_tokens_per_second": 1071.658 }, { "epoch": 0.21221800357580506, "grad_norm": 0.3389016389846802, "learning_rate": 2.4040066777963273e-05, "loss": 1.077, "num_input_tokens_seen": 7263852, "step": 2641, "train_runtime": 6779.7983, "train_tokens_per_second": 1071.396 }, { "epoch": 0.2122983587456558, "grad_norm": 0.35491853952407837, "learning_rate": 2.3973288814691153e-05, "loss": 0.9035, "num_input_tokens_seen": 7265538, "step": 2642, "train_runtime": 6781.5295, "train_tokens_per_second": 1071.372 }, { "epoch": 0.21237871391550653, "grad_norm": 0.38348373770713806, "learning_rate": 2.3906510851419033e-05, "loss": 0.935, "num_input_tokens_seen": 7268478, "step": 2643, "train_runtime": 6783.9147, "train_tokens_per_second": 1071.428 }, { "epoch": 0.21245906908535728, "grad_norm": 0.3012312352657318, "learning_rate": 2.3839732888146912e-05, "loss": 0.9347, "num_input_tokens_seen": 7270988, "step": 2644, "train_runtime": 6786.0063, "train_tokens_per_second": 1071.468 }, { "epoch": 0.21253942425520803, "grad_norm": 0.25290215015411377, "learning_rate": 2.3772954924874792e-05, "loss": 0.8887, "num_input_tokens_seen": 7273678, "step": 2645, "train_runtime": 6788.2374, "train_tokens_per_second": 1071.512 }, { "epoch": 0.21261977942505875, "grad_norm": 0.29149237275123596, "learning_rate": 2.3706176961602672e-05, "loss": 0.9653, "num_input_tokens_seen": 7275446, "step": 2646, "train_runtime": 6790.0114, "train_tokens_per_second": 1071.492 }, { "epoch": 0.2127001345949095, "grad_norm": 0.30114826560020447, "learning_rate": 2.3639398998330552e-05, "loss": 1.0161, "num_input_tokens_seen": 7277926, "step": 2647, "train_runtime": 6792.107, "train_tokens_per_second": 1071.527 }, { "epoch": 0.21278048976476024, "grad_norm": 0.3214522898197174, "learning_rate": 2.3572621035058432e-05, "loss": 1.1982, "num_input_tokens_seen": 7281208, "step": 2648, "train_runtime": 6794.5576, "train_tokens_per_second": 1071.624 }, { "epoch": 0.212860844934611, "grad_norm": 0.43071138858795166, "learning_rate": 2.3505843071786312e-05, "loss": 0.9475, "num_input_tokens_seen": 7283412, "step": 2649, "train_runtime": 6796.5115, "train_tokens_per_second": 1071.64 }, { "epoch": 0.21294120010446171, "grad_norm": 0.39023107290267944, "learning_rate": 2.3439065108514192e-05, "loss": 1.2034, "num_input_tokens_seen": 7285842, "step": 2650, "train_runtime": 6798.5606, "train_tokens_per_second": 1071.674 }, { "epoch": 0.21302155527431246, "grad_norm": 0.35178694128990173, "learning_rate": 2.3372287145242072e-05, "loss": 1.1156, "num_input_tokens_seen": 7288624, "step": 2651, "train_runtime": 6800.7516, "train_tokens_per_second": 1071.738 }, { "epoch": 0.2131019104441632, "grad_norm": 0.3110933005809784, "learning_rate": 2.3305509181969952e-05, "loss": 0.9604, "num_input_tokens_seen": 7292628, "step": 2652, "train_runtime": 6803.6143, "train_tokens_per_second": 1071.876 }, { "epoch": 0.21318226561401393, "grad_norm": 0.2999524176120758, "learning_rate": 2.3238731218697832e-05, "loss": 1.0385, "num_input_tokens_seen": 7295632, "step": 2653, "train_runtime": 6805.9416, "train_tokens_per_second": 1071.95 }, { "epoch": 0.21326262078386468, "grad_norm": 0.31076672673225403, "learning_rate": 2.3171953255425712e-05, "loss": 0.887, "num_input_tokens_seen": 7298492, "step": 2654, "train_runtime": 6808.302, "train_tokens_per_second": 1071.999 }, { "epoch": 0.21334297595371543, "grad_norm": 0.2822515070438385, "learning_rate": 2.310517529215359e-05, "loss": 0.7181, "num_input_tokens_seen": 7302234, "step": 2655, "train_runtime": 6811.0159, "train_tokens_per_second": 1072.121 }, { "epoch": 0.21342333112356615, "grad_norm": 0.29139649868011475, "learning_rate": 2.3038397328881468e-05, "loss": 0.7603, "num_input_tokens_seen": 7303838, "step": 2656, "train_runtime": 6812.6968, "train_tokens_per_second": 1072.092 }, { "epoch": 0.2135036862934169, "grad_norm": 0.34181493520736694, "learning_rate": 2.297161936560935e-05, "loss": 1.024, "num_input_tokens_seen": 7307208, "step": 2657, "train_runtime": 6815.1543, "train_tokens_per_second": 1072.2 }, { "epoch": 0.21358404146326765, "grad_norm": 0.30981960892677307, "learning_rate": 2.2904841402337228e-05, "loss": 0.9214, "num_input_tokens_seen": 7309716, "step": 2658, "train_runtime": 6817.2121, "train_tokens_per_second": 1072.244 }, { "epoch": 0.21366439663311837, "grad_norm": 0.3379795253276825, "learning_rate": 2.283806343906511e-05, "loss": 0.9486, "num_input_tokens_seen": 7315028, "step": 2659, "train_runtime": 6820.9329, "train_tokens_per_second": 1072.438 }, { "epoch": 0.21374475180296912, "grad_norm": 0.3424399495124817, "learning_rate": 2.2771285475792988e-05, "loss": 1.1573, "num_input_tokens_seen": 7316896, "step": 2660, "train_runtime": 6822.7476, "train_tokens_per_second": 1072.427 }, { "epoch": 0.21382510697281987, "grad_norm": 0.3007705509662628, "learning_rate": 2.270450751252087e-05, "loss": 1.3266, "num_input_tokens_seen": 7319546, "step": 2661, "train_runtime": 6824.8194, "train_tokens_per_second": 1072.489 }, { "epoch": 0.21390546214267062, "grad_norm": 0.22102737426757812, "learning_rate": 2.2637729549248748e-05, "loss": 0.4628, "num_input_tokens_seen": 7321902, "step": 2662, "train_runtime": 6826.7466, "train_tokens_per_second": 1072.532 }, { "epoch": 0.21398581731252134, "grad_norm": 0.32190918922424316, "learning_rate": 2.257095158597663e-05, "loss": 0.9612, "num_input_tokens_seen": 7324602, "step": 2663, "train_runtime": 6828.9039, "train_tokens_per_second": 1072.588 }, { "epoch": 0.21406617248237209, "grad_norm": 0.3150859773159027, "learning_rate": 2.2504173622704508e-05, "loss": 0.8958, "num_input_tokens_seen": 7326422, "step": 2664, "train_runtime": 6830.5725, "train_tokens_per_second": 1072.593 }, { "epoch": 0.21414652765222283, "grad_norm": 0.24605362117290497, "learning_rate": 2.2437395659432388e-05, "loss": 0.6223, "num_input_tokens_seen": 7329524, "step": 2665, "train_runtime": 6832.9372, "train_tokens_per_second": 1072.675 }, { "epoch": 0.21422688282207356, "grad_norm": 0.31505972146987915, "learning_rate": 2.2370617696160268e-05, "loss": 0.9699, "num_input_tokens_seen": 7332948, "step": 2666, "train_runtime": 6835.4707, "train_tokens_per_second": 1072.779 }, { "epoch": 0.2143072379919243, "grad_norm": 0.3338657319545746, "learning_rate": 2.2303839732888147e-05, "loss": 1.0288, "num_input_tokens_seen": 7334594, "step": 2667, "train_runtime": 6837.097, "train_tokens_per_second": 1072.764 }, { "epoch": 0.21438759316177505, "grad_norm": 0.30498605966567993, "learning_rate": 2.2237061769616027e-05, "loss": 0.8056, "num_input_tokens_seen": 7337100, "step": 2668, "train_runtime": 6839.0923, "train_tokens_per_second": 1072.818 }, { "epoch": 0.21446794833162577, "grad_norm": 0.26526975631713867, "learning_rate": 2.2170283806343907e-05, "loss": 0.5352, "num_input_tokens_seen": 7341566, "step": 2669, "train_runtime": 6842.3069, "train_tokens_per_second": 1072.966 }, { "epoch": 0.21454830350147652, "grad_norm": 0.29485267400741577, "learning_rate": 2.2103505843071787e-05, "loss": 1.0351, "num_input_tokens_seen": 7347226, "step": 2670, "train_runtime": 6846.0991, "train_tokens_per_second": 1073.199 }, { "epoch": 0.21462865867132727, "grad_norm": 0.3023536503314972, "learning_rate": 2.2036727879799667e-05, "loss": 1.0583, "num_input_tokens_seen": 7351488, "step": 2671, "train_runtime": 6851.2074, "train_tokens_per_second": 1073.021 }, { "epoch": 0.21470901384117802, "grad_norm": 0.3053301274776459, "learning_rate": 2.1969949916527547e-05, "loss": 0.991, "num_input_tokens_seen": 7354532, "step": 2672, "train_runtime": 6853.4359, "train_tokens_per_second": 1073.116 }, { "epoch": 0.21478936901102874, "grad_norm": 0.24701736867427826, "learning_rate": 2.1903171953255427e-05, "loss": 1.0048, "num_input_tokens_seen": 7356676, "step": 2673, "train_runtime": 6855.2744, "train_tokens_per_second": 1073.141 }, { "epoch": 0.2148697241808795, "grad_norm": 0.2527194917201996, "learning_rate": 2.1836393989983307e-05, "loss": 0.7104, "num_input_tokens_seen": 7360688, "step": 2674, "train_runtime": 6858.1179, "train_tokens_per_second": 1073.281 }, { "epoch": 0.21495007935073024, "grad_norm": 0.2915332615375519, "learning_rate": 2.1769616026711187e-05, "loss": 0.9118, "num_input_tokens_seen": 7363500, "step": 2675, "train_runtime": 6860.3455, "train_tokens_per_second": 1073.342 }, { "epoch": 0.21503043452058096, "grad_norm": 0.32805347442626953, "learning_rate": 2.1702838063439067e-05, "loss": 1.0744, "num_input_tokens_seen": 7366078, "step": 2676, "train_runtime": 6862.5163, "train_tokens_per_second": 1073.379 }, { "epoch": 0.2151107896904317, "grad_norm": 0.2782030403614044, "learning_rate": 2.1636060100166947e-05, "loss": 0.6709, "num_input_tokens_seen": 7368460, "step": 2677, "train_runtime": 6864.5478, "train_tokens_per_second": 1073.408 }, { "epoch": 0.21519114486028246, "grad_norm": 0.35958606004714966, "learning_rate": 2.1569282136894827e-05, "loss": 0.8976, "num_input_tokens_seen": 7370048, "step": 2678, "train_runtime": 6866.2331, "train_tokens_per_second": 1073.376 }, { "epoch": 0.21527150003013318, "grad_norm": 0.35285475850105286, "learning_rate": 2.1502504173622707e-05, "loss": 1.0993, "num_input_tokens_seen": 7371954, "step": 2679, "train_runtime": 6868.0118, "train_tokens_per_second": 1073.375 }, { "epoch": 0.21535185519998393, "grad_norm": 0.2908136546611786, "learning_rate": 2.1435726210350583e-05, "loss": 0.8416, "num_input_tokens_seen": 7374582, "step": 2680, "train_runtime": 6870.0835, "train_tokens_per_second": 1073.434 }, { "epoch": 0.21543221036983468, "grad_norm": 0.3031177520751953, "learning_rate": 2.1368948247078466e-05, "loss": 0.8274, "num_input_tokens_seen": 7376486, "step": 2681, "train_runtime": 6871.7699, "train_tokens_per_second": 1073.448 }, { "epoch": 0.2155125655396854, "grad_norm": 0.2759515643119812, "learning_rate": 2.1302170283806343e-05, "loss": 0.9795, "num_input_tokens_seen": 7378832, "step": 2682, "train_runtime": 6873.698, "train_tokens_per_second": 1073.488 }, { "epoch": 0.21559292070953615, "grad_norm": 0.35168221592903137, "learning_rate": 2.1235392320534226e-05, "loss": 1.2491, "num_input_tokens_seen": 7381410, "step": 2683, "train_runtime": 6875.7596, "train_tokens_per_second": 1073.541 }, { "epoch": 0.2156732758793869, "grad_norm": 0.3279869556427002, "learning_rate": 2.1168614357262103e-05, "loss": 0.8237, "num_input_tokens_seen": 7384458, "step": 2684, "train_runtime": 6878.1204, "train_tokens_per_second": 1073.616 }, { "epoch": 0.21575363104923764, "grad_norm": 0.2660094201564789, "learning_rate": 2.1101836393989986e-05, "loss": 0.8046, "num_input_tokens_seen": 7389552, "step": 2685, "train_runtime": 6881.7289, "train_tokens_per_second": 1073.793 }, { "epoch": 0.21583398621908836, "grad_norm": 0.31938111782073975, "learning_rate": 2.1035058430717863e-05, "loss": 0.8759, "num_input_tokens_seen": 7391530, "step": 2686, "train_runtime": 6883.4879, "train_tokens_per_second": 1073.806 }, { "epoch": 0.2159143413889391, "grad_norm": 0.3493044376373291, "learning_rate": 2.0968280467445746e-05, "loss": 0.6627, "num_input_tokens_seen": 7393370, "step": 2687, "train_runtime": 6885.1023, "train_tokens_per_second": 1073.821 }, { "epoch": 0.21599469655878986, "grad_norm": 0.33528077602386475, "learning_rate": 2.0901502504173623e-05, "loss": 0.9373, "num_input_tokens_seen": 7397214, "step": 2688, "train_runtime": 6887.931, "train_tokens_per_second": 1073.938 }, { "epoch": 0.21607505172864058, "grad_norm": 0.2748642861843109, "learning_rate": 2.0834724540901503e-05, "loss": 0.7841, "num_input_tokens_seen": 7400056, "step": 2689, "train_runtime": 6890.1277, "train_tokens_per_second": 1074.009 }, { "epoch": 0.21615540689849133, "grad_norm": 0.4419088065624237, "learning_rate": 2.0767946577629382e-05, "loss": 0.9283, "num_input_tokens_seen": 7402320, "step": 2690, "train_runtime": 6892.0847, "train_tokens_per_second": 1074.032 }, { "epoch": 0.21623576206834208, "grad_norm": 0.3332759737968445, "learning_rate": 2.0701168614357262e-05, "loss": 0.8147, "num_input_tokens_seen": 7404310, "step": 2691, "train_runtime": 6893.915, "train_tokens_per_second": 1074.036 }, { "epoch": 0.2163161172381928, "grad_norm": 0.35181930661201477, "learning_rate": 2.0634390651085142e-05, "loss": 0.6183, "num_input_tokens_seen": 7408904, "step": 2692, "train_runtime": 6897.1517, "train_tokens_per_second": 1074.198 }, { "epoch": 0.21639647240804355, "grad_norm": 0.2954927980899811, "learning_rate": 2.0567612687813022e-05, "loss": 0.7353, "num_input_tokens_seen": 7410632, "step": 2693, "train_runtime": 6898.8635, "train_tokens_per_second": 1074.182 }, { "epoch": 0.2164768275778943, "grad_norm": 0.3183957040309906, "learning_rate": 2.0500834724540902e-05, "loss": 1.1305, "num_input_tokens_seen": 7413232, "step": 2694, "train_runtime": 6901.0044, "train_tokens_per_second": 1074.225 }, { "epoch": 0.21655718274774502, "grad_norm": 0.26527586579322815, "learning_rate": 2.0434056761268782e-05, "loss": 0.6788, "num_input_tokens_seen": 7416196, "step": 2695, "train_runtime": 6903.2506, "train_tokens_per_second": 1074.305 }, { "epoch": 0.21663753791759577, "grad_norm": 0.2783952057361603, "learning_rate": 2.0367278797996662e-05, "loss": 0.9476, "num_input_tokens_seen": 7419270, "step": 2696, "train_runtime": 6905.6032, "train_tokens_per_second": 1074.384 }, { "epoch": 0.21671789308744652, "grad_norm": 0.3151261806488037, "learning_rate": 2.0300500834724542e-05, "loss": 0.739, "num_input_tokens_seen": 7420666, "step": 2697, "train_runtime": 6907.2119, "train_tokens_per_second": 1074.336 }, { "epoch": 0.21679824825729727, "grad_norm": 0.34722790122032166, "learning_rate": 2.0233722871452422e-05, "loss": 0.9448, "num_input_tokens_seen": 7422662, "step": 2698, "train_runtime": 6909.0533, "train_tokens_per_second": 1074.339 }, { "epoch": 0.216878603427148, "grad_norm": 0.3775460422039032, "learning_rate": 2.0166944908180302e-05, "loss": 1.0543, "num_input_tokens_seen": 7425192, "step": 2699, "train_runtime": 6911.1317, "train_tokens_per_second": 1074.381 }, { "epoch": 0.21695895859699874, "grad_norm": 0.3494967818260193, "learning_rate": 2.0100166944908182e-05, "loss": 0.9087, "num_input_tokens_seen": 7426926, "step": 2700, "train_runtime": 6912.7909, "train_tokens_per_second": 1074.374 }, { "epoch": 0.21695895859699874, "eval_loss": 0.9462488889694214, "eval_runtime": 91.8617, "eval_samples_per_second": 10.821, "eval_steps_per_second": 5.41, "num_input_tokens_seen": 7426926, "step": 2700 }, { "epoch": 0.21703931376684948, "grad_norm": 0.23258782923221588, "learning_rate": 2.003338898163606e-05, "loss": 0.6272, "num_input_tokens_seen": 7429876, "step": 2701, "train_runtime": 7008.9304, "train_tokens_per_second": 1060.058 }, { "epoch": 0.2171196689367002, "grad_norm": 0.32834675908088684, "learning_rate": 1.9966611018363938e-05, "loss": 1.1235, "num_input_tokens_seen": 7433088, "step": 2702, "train_runtime": 7011.5475, "train_tokens_per_second": 1060.121 }, { "epoch": 0.21720002410655095, "grad_norm": 0.30189961194992065, "learning_rate": 1.989983305509182e-05, "loss": 0.677, "num_input_tokens_seen": 7435490, "step": 2703, "train_runtime": 7013.6099, "train_tokens_per_second": 1060.152 }, { "epoch": 0.2172803792764017, "grad_norm": 0.4429466724395752, "learning_rate": 1.9833055091819698e-05, "loss": 0.8828, "num_input_tokens_seen": 7438714, "step": 2704, "train_runtime": 7016.0518, "train_tokens_per_second": 1060.242 }, { "epoch": 0.21736073444625242, "grad_norm": 0.2981514036655426, "learning_rate": 1.976627712854758e-05, "loss": 0.8641, "num_input_tokens_seen": 7441586, "step": 2705, "train_runtime": 7018.3498, "train_tokens_per_second": 1060.304 }, { "epoch": 0.21744108961610317, "grad_norm": 0.3092416226863861, "learning_rate": 1.9699499165275458e-05, "loss": 1.1596, "num_input_tokens_seen": 7444180, "step": 2706, "train_runtime": 7020.4766, "train_tokens_per_second": 1060.353 }, { "epoch": 0.21752144478595392, "grad_norm": 0.31896716356277466, "learning_rate": 1.963272120200334e-05, "loss": 1.0078, "num_input_tokens_seen": 7446328, "step": 2707, "train_runtime": 7022.5245, "train_tokens_per_second": 1060.349 }, { "epoch": 0.21760179995580467, "grad_norm": 0.38206470012664795, "learning_rate": 1.9565943238731218e-05, "loss": 0.9398, "num_input_tokens_seen": 7449000, "step": 2708, "train_runtime": 7024.8444, "train_tokens_per_second": 1060.379 }, { "epoch": 0.2176821551256554, "grad_norm": 0.3746073544025421, "learning_rate": 1.94991652754591e-05, "loss": 1.1794, "num_input_tokens_seen": 7452144, "step": 2709, "train_runtime": 7027.2468, "train_tokens_per_second": 1060.464 }, { "epoch": 0.21776251029550614, "grad_norm": 0.3502049744129181, "learning_rate": 1.9432387312186978e-05, "loss": 0.8753, "num_input_tokens_seen": 7458520, "step": 2710, "train_runtime": 7031.5253, "train_tokens_per_second": 1060.726 }, { "epoch": 0.2178428654653569, "grad_norm": 0.3128703832626343, "learning_rate": 1.936560934891486e-05, "loss": 0.7591, "num_input_tokens_seen": 7460892, "step": 2711, "train_runtime": 7033.6334, "train_tokens_per_second": 1060.745 }, { "epoch": 0.2179232206352076, "grad_norm": 0.2930780053138733, "learning_rate": 1.9298831385642738e-05, "loss": 0.8508, "num_input_tokens_seen": 7463138, "step": 2712, "train_runtime": 7035.5719, "train_tokens_per_second": 1060.772 }, { "epoch": 0.21800357580505836, "grad_norm": 0.3618297576904297, "learning_rate": 1.9232053422370617e-05, "loss": 0.8672, "num_input_tokens_seen": 7465172, "step": 2713, "train_runtime": 7037.566, "train_tokens_per_second": 1060.76 }, { "epoch": 0.2180839309749091, "grad_norm": 0.3108785152435303, "learning_rate": 1.9165275459098497e-05, "loss": 1.2028, "num_input_tokens_seen": 7468206, "step": 2714, "train_runtime": 7039.9215, "train_tokens_per_second": 1060.837 }, { "epoch": 0.21816428614475983, "grad_norm": 0.302286297082901, "learning_rate": 1.9098497495826377e-05, "loss": 0.9869, "num_input_tokens_seen": 7469672, "step": 2715, "train_runtime": 7041.6064, "train_tokens_per_second": 1060.791 }, { "epoch": 0.21824464131461058, "grad_norm": 0.3044348955154419, "learning_rate": 1.9031719532554257e-05, "loss": 1.1177, "num_input_tokens_seen": 7472026, "step": 2716, "train_runtime": 7043.6345, "train_tokens_per_second": 1060.82 }, { "epoch": 0.21832499648446133, "grad_norm": 0.3829231262207031, "learning_rate": 1.8964941569282137e-05, "loss": 1.1893, "num_input_tokens_seen": 7473822, "step": 2717, "train_runtime": 7045.3432, "train_tokens_per_second": 1060.817 }, { "epoch": 0.21840535165431205, "grad_norm": 0.33265331387519836, "learning_rate": 1.8898163606010017e-05, "loss": 0.869, "num_input_tokens_seen": 7475930, "step": 2718, "train_runtime": 7047.1866, "train_tokens_per_second": 1060.839 }, { "epoch": 0.2184857068241628, "grad_norm": 0.2811022996902466, "learning_rate": 1.8831385642737897e-05, "loss": 0.7001, "num_input_tokens_seen": 7480962, "step": 2719, "train_runtime": 7050.6597, "train_tokens_per_second": 1061.03 }, { "epoch": 0.21856606199401354, "grad_norm": 0.3676680028438568, "learning_rate": 1.8764607679465777e-05, "loss": 0.9166, "num_input_tokens_seen": 7483488, "step": 2720, "train_runtime": 7052.7755, "train_tokens_per_second": 1061.07 }, { "epoch": 0.2186464171638643, "grad_norm": 0.3773687481880188, "learning_rate": 1.8697829716193657e-05, "loss": 1.1516, "num_input_tokens_seen": 7487532, "step": 2721, "train_runtime": 7055.8931, "train_tokens_per_second": 1061.174 }, { "epoch": 0.218726772333715, "grad_norm": 0.33698898553848267, "learning_rate": 1.8631051752921537e-05, "loss": 1.0416, "num_input_tokens_seen": 7490190, "step": 2722, "train_runtime": 7058.0962, "train_tokens_per_second": 1061.22 }, { "epoch": 0.21880712750356576, "grad_norm": 0.3313373327255249, "learning_rate": 1.8564273789649417e-05, "loss": 1.0212, "num_input_tokens_seen": 7492270, "step": 2723, "train_runtime": 7059.9386, "train_tokens_per_second": 1061.237 }, { "epoch": 0.2188874826734165, "grad_norm": 0.41645348072052, "learning_rate": 1.8497495826377297e-05, "loss": 1.2292, "num_input_tokens_seen": 7494912, "step": 2724, "train_runtime": 7062.216, "train_tokens_per_second": 1061.269 }, { "epoch": 0.21896783784326723, "grad_norm": 0.3400404155254364, "learning_rate": 1.8430717863105177e-05, "loss": 0.9372, "num_input_tokens_seen": 7502262, "step": 2725, "train_runtime": 7067.224, "train_tokens_per_second": 1061.557 }, { "epoch": 0.21904819301311798, "grad_norm": 0.434825599193573, "learning_rate": 1.8363939899833053e-05, "loss": 0.9718, "num_input_tokens_seen": 7504992, "step": 2726, "train_runtime": 7069.4429, "train_tokens_per_second": 1061.61 }, { "epoch": 0.21912854818296873, "grad_norm": 0.3313480317592621, "learning_rate": 1.8297161936560936e-05, "loss": 0.9407, "num_input_tokens_seen": 7507210, "step": 2727, "train_runtime": 7071.3254, "train_tokens_per_second": 1061.641 }, { "epoch": 0.21920890335281945, "grad_norm": 0.3347714841365814, "learning_rate": 1.8230383973288813e-05, "loss": 0.9767, "num_input_tokens_seen": 7509756, "step": 2728, "train_runtime": 7073.4817, "train_tokens_per_second": 1061.677 }, { "epoch": 0.2192892585226702, "grad_norm": 0.3706495761871338, "learning_rate": 1.8163606010016696e-05, "loss": 0.9196, "num_input_tokens_seen": 7511502, "step": 2729, "train_runtime": 7075.1574, "train_tokens_per_second": 1061.673 }, { "epoch": 0.21936961369252095, "grad_norm": 0.2683712840080261, "learning_rate": 1.8096828046744573e-05, "loss": 0.9637, "num_input_tokens_seen": 7514504, "step": 2730, "train_runtime": 7077.4961, "train_tokens_per_second": 1061.746 }, { "epoch": 0.21944996886237167, "grad_norm": 0.3433111608028412, "learning_rate": 1.8030050083472456e-05, "loss": 0.9535, "num_input_tokens_seen": 7516332, "step": 2731, "train_runtime": 7081.2034, "train_tokens_per_second": 1061.448 }, { "epoch": 0.21953032403222242, "grad_norm": 0.3412112593650818, "learning_rate": 1.7963272120200333e-05, "loss": 0.847, "num_input_tokens_seen": 7518756, "step": 2732, "train_runtime": 7083.2854, "train_tokens_per_second": 1061.479 }, { "epoch": 0.21961067920207317, "grad_norm": 0.3159896731376648, "learning_rate": 1.7896494156928216e-05, "loss": 0.8763, "num_input_tokens_seen": 7521188, "step": 2733, "train_runtime": 7085.2766, "train_tokens_per_second": 1061.524 }, { "epoch": 0.21969103437192392, "grad_norm": 0.30528387427330017, "learning_rate": 1.7829716193656093e-05, "loss": 1.2493, "num_input_tokens_seen": 7523178, "step": 2734, "train_runtime": 7087.0701, "train_tokens_per_second": 1061.536 }, { "epoch": 0.21977138954177464, "grad_norm": 0.30628272891044617, "learning_rate": 1.7762938230383973e-05, "loss": 0.5852, "num_input_tokens_seen": 7524804, "step": 2735, "train_runtime": 7088.6891, "train_tokens_per_second": 1061.523 }, { "epoch": 0.21985174471162539, "grad_norm": 0.3449867367744446, "learning_rate": 1.7696160267111852e-05, "loss": 0.7541, "num_input_tokens_seen": 7528124, "step": 2736, "train_runtime": 7091.273, "train_tokens_per_second": 1061.604 }, { "epoch": 0.21993209988147613, "grad_norm": 0.3475934863090515, "learning_rate": 1.7629382303839732e-05, "loss": 0.843, "num_input_tokens_seen": 7530232, "step": 2737, "train_runtime": 7093.1845, "train_tokens_per_second": 1061.615 }, { "epoch": 0.22001245505132686, "grad_norm": 0.28976932168006897, "learning_rate": 1.7562604340567612e-05, "loss": 0.8691, "num_input_tokens_seen": 7532906, "step": 2738, "train_runtime": 7095.3236, "train_tokens_per_second": 1061.672 }, { "epoch": 0.2200928102211776, "grad_norm": 0.33810850977897644, "learning_rate": 1.7495826377295492e-05, "loss": 1.1956, "num_input_tokens_seen": 7534788, "step": 2739, "train_runtime": 7097.08, "train_tokens_per_second": 1061.674 }, { "epoch": 0.22017316539102835, "grad_norm": 0.2440091371536255, "learning_rate": 1.7429048414023372e-05, "loss": 0.7232, "num_input_tokens_seen": 7536906, "step": 2740, "train_runtime": 7098.973, "train_tokens_per_second": 1061.69 }, { "epoch": 0.22025352056087907, "grad_norm": 0.4699127674102783, "learning_rate": 1.7362270450751252e-05, "loss": 1.0435, "num_input_tokens_seen": 7539552, "step": 2741, "train_runtime": 7101.1193, "train_tokens_per_second": 1061.741 }, { "epoch": 0.22033387573072982, "grad_norm": 0.3182070553302765, "learning_rate": 1.7295492487479135e-05, "loss": 1.1047, "num_input_tokens_seen": 7542468, "step": 2742, "train_runtime": 7103.3859, "train_tokens_per_second": 1061.813 }, { "epoch": 0.22041423090058057, "grad_norm": 0.29897093772888184, "learning_rate": 1.7228714524207012e-05, "loss": 0.882, "num_input_tokens_seen": 7545064, "step": 2743, "train_runtime": 7105.455, "train_tokens_per_second": 1061.869 }, { "epoch": 0.22049458607043132, "grad_norm": 0.2339617758989334, "learning_rate": 1.7161936560934895e-05, "loss": 0.7417, "num_input_tokens_seen": 7547950, "step": 2744, "train_runtime": 7107.6417, "train_tokens_per_second": 1061.949 }, { "epoch": 0.22057494124028204, "grad_norm": 0.33375948667526245, "learning_rate": 1.7095158597662772e-05, "loss": 1.0305, "num_input_tokens_seen": 7550510, "step": 2745, "train_runtime": 7109.7677, "train_tokens_per_second": 1061.991 }, { "epoch": 0.2206552964101328, "grad_norm": 0.3424736261367798, "learning_rate": 1.7028380634390652e-05, "loss": 1.039, "num_input_tokens_seen": 7552700, "step": 2746, "train_runtime": 7111.6861, "train_tokens_per_second": 1062.013 }, { "epoch": 0.22073565157998354, "grad_norm": 0.26616615056991577, "learning_rate": 1.696160267111853e-05, "loss": 0.7395, "num_input_tokens_seen": 7555232, "step": 2747, "train_runtime": 7113.7743, "train_tokens_per_second": 1062.057 }, { "epoch": 0.22081600674983426, "grad_norm": 0.2896953225135803, "learning_rate": 1.689482470784641e-05, "loss": 0.971, "num_input_tokens_seen": 7557462, "step": 2748, "train_runtime": 7115.6848, "train_tokens_per_second": 1062.085 }, { "epoch": 0.220896361919685, "grad_norm": 0.3005113899707794, "learning_rate": 1.682804674457429e-05, "loss": 0.8776, "num_input_tokens_seen": 7560614, "step": 2749, "train_runtime": 7118.0764, "train_tokens_per_second": 1062.171 }, { "epoch": 0.22097671708953576, "grad_norm": 0.3157309591770172, "learning_rate": 1.676126878130217e-05, "loss": 1.0592, "num_input_tokens_seen": 7562062, "step": 2750, "train_runtime": 7119.7255, "train_tokens_per_second": 1062.128 }, { "epoch": 0.22105707225938648, "grad_norm": 0.30210593342781067, "learning_rate": 1.669449081803005e-05, "loss": 1.1242, "num_input_tokens_seen": 7565244, "step": 2751, "train_runtime": 7122.1925, "train_tokens_per_second": 1062.207 }, { "epoch": 0.22113742742923723, "grad_norm": 0.3235064446926117, "learning_rate": 1.662771285475793e-05, "loss": 0.9333, "num_input_tokens_seen": 7568790, "step": 2752, "train_runtime": 7124.8272, "train_tokens_per_second": 1062.312 }, { "epoch": 0.22121778259908798, "grad_norm": 0.3814135789871216, "learning_rate": 1.656093489148581e-05, "loss": 0.6731, "num_input_tokens_seen": 7571830, "step": 2753, "train_runtime": 7127.2932, "train_tokens_per_second": 1062.371 }, { "epoch": 0.2212981377689387, "grad_norm": 0.3221556842327118, "learning_rate": 1.649415692821369e-05, "loss": 1.0155, "num_input_tokens_seen": 7574554, "step": 2754, "train_runtime": 7129.5174, "train_tokens_per_second": 1062.422 }, { "epoch": 0.22137849293878945, "grad_norm": 0.29579707980155945, "learning_rate": 1.642737896494157e-05, "loss": 0.7501, "num_input_tokens_seen": 7577142, "step": 2755, "train_runtime": 7131.7048, "train_tokens_per_second": 1062.459 }, { "epoch": 0.2214588481086402, "grad_norm": 0.23488302528858185, "learning_rate": 1.636060100166945e-05, "loss": 0.6321, "num_input_tokens_seen": 7580082, "step": 2756, "train_runtime": 7134.0728, "train_tokens_per_second": 1062.518 }, { "epoch": 0.22153920327849094, "grad_norm": 0.2756893038749695, "learning_rate": 1.629382303839733e-05, "loss": 0.7717, "num_input_tokens_seen": 7582392, "step": 2757, "train_runtime": 7136.0213, "train_tokens_per_second": 1062.552 }, { "epoch": 0.22161955844834166, "grad_norm": 0.33371415734291077, "learning_rate": 1.622704507512521e-05, "loss": 1.2048, "num_input_tokens_seen": 7585716, "step": 2758, "train_runtime": 7138.4669, "train_tokens_per_second": 1062.653 }, { "epoch": 0.2216999136181924, "grad_norm": 0.3020438551902771, "learning_rate": 1.6160267111853087e-05, "loss": 0.9294, "num_input_tokens_seen": 7587408, "step": 2759, "train_runtime": 7140.1474, "train_tokens_per_second": 1062.64 }, { "epoch": 0.22178026878804316, "grad_norm": 0.3730298578739166, "learning_rate": 1.609348914858097e-05, "loss": 0.7758, "num_input_tokens_seen": 7590666, "step": 2760, "train_runtime": 7142.7447, "train_tokens_per_second": 1062.71 }, { "epoch": 0.22186062395789388, "grad_norm": 0.3398522734642029, "learning_rate": 1.6026711185308847e-05, "loss": 1.0886, "num_input_tokens_seen": 7593454, "step": 2761, "train_runtime": 7147.0288, "train_tokens_per_second": 1062.463 }, { "epoch": 0.22194097912774463, "grad_norm": 0.28900668025016785, "learning_rate": 1.595993322203673e-05, "loss": 1.1081, "num_input_tokens_seen": 7596162, "step": 2762, "train_runtime": 7149.1478, "train_tokens_per_second": 1062.527 }, { "epoch": 0.22202133429759538, "grad_norm": 0.26332908868789673, "learning_rate": 1.5893155258764607e-05, "loss": 1.0853, "num_input_tokens_seen": 7599620, "step": 2763, "train_runtime": 7151.8001, "train_tokens_per_second": 1062.616 }, { "epoch": 0.2221016894674461, "grad_norm": 0.3361031115055084, "learning_rate": 1.582637729549249e-05, "loss": 1.1744, "num_input_tokens_seen": 7602324, "step": 2764, "train_runtime": 7154.0234, "train_tokens_per_second": 1062.664 }, { "epoch": 0.22218204463729685, "grad_norm": 0.31317827105522156, "learning_rate": 1.5759599332220367e-05, "loss": 0.7566, "num_input_tokens_seen": 7604942, "step": 2765, "train_runtime": 7156.1307, "train_tokens_per_second": 1062.717 }, { "epoch": 0.2222623998071476, "grad_norm": 0.36296823620796204, "learning_rate": 1.569282136894825e-05, "loss": 0.9936, "num_input_tokens_seen": 7607210, "step": 2766, "train_runtime": 7158.0767, "train_tokens_per_second": 1062.745 }, { "epoch": 0.22234275497699832, "grad_norm": 0.3713575601577759, "learning_rate": 1.5626043405676127e-05, "loss": 0.7825, "num_input_tokens_seen": 7609224, "step": 2767, "train_runtime": 7159.941, "train_tokens_per_second": 1062.75 }, { "epoch": 0.22242311014684907, "grad_norm": 0.2904340624809265, "learning_rate": 1.555926544240401e-05, "loss": 0.7011, "num_input_tokens_seen": 7611612, "step": 2768, "train_runtime": 7162.011, "train_tokens_per_second": 1062.776 }, { "epoch": 0.22250346531669982, "grad_norm": 0.3913591206073761, "learning_rate": 1.5492487479131887e-05, "loss": 0.8902, "num_input_tokens_seen": 7615296, "step": 2769, "train_runtime": 7164.9327, "train_tokens_per_second": 1062.857 }, { "epoch": 0.22258382048655057, "grad_norm": 0.2655889391899109, "learning_rate": 1.5425709515859767e-05, "loss": 0.9361, "num_input_tokens_seen": 7617554, "step": 2770, "train_runtime": 7166.8552, "train_tokens_per_second": 1062.887 }, { "epoch": 0.2226641756564013, "grad_norm": 0.37378987669944763, "learning_rate": 1.5358931552587647e-05, "loss": 1.2193, "num_input_tokens_seen": 7621758, "step": 2771, "train_runtime": 7169.8825, "train_tokens_per_second": 1063.024 }, { "epoch": 0.22274453082625204, "grad_norm": 0.39028868079185486, "learning_rate": 1.5292153589315527e-05, "loss": 0.9422, "num_input_tokens_seen": 7624642, "step": 2772, "train_runtime": 7172.1362, "train_tokens_per_second": 1063.092 }, { "epoch": 0.22282488599610278, "grad_norm": 0.3148764371871948, "learning_rate": 1.5225375626043406e-05, "loss": 0.8326, "num_input_tokens_seen": 7627618, "step": 2773, "train_runtime": 7174.462, "train_tokens_per_second": 1063.162 }, { "epoch": 0.2229052411659535, "grad_norm": 0.3463549017906189, "learning_rate": 1.5158597662771286e-05, "loss": 0.7761, "num_input_tokens_seen": 7632144, "step": 2774, "train_runtime": 7177.9553, "train_tokens_per_second": 1063.276 }, { "epoch": 0.22298559633580425, "grad_norm": 0.2773972749710083, "learning_rate": 1.5091819699499166e-05, "loss": 0.8171, "num_input_tokens_seen": 7634462, "step": 2775, "train_runtime": 7179.9033, "train_tokens_per_second": 1063.31 }, { "epoch": 0.223065951505655, "grad_norm": 0.29489219188690186, "learning_rate": 1.5025041736227046e-05, "loss": 0.7423, "num_input_tokens_seen": 7637066, "step": 2776, "train_runtime": 7182.1101, "train_tokens_per_second": 1063.346 }, { "epoch": 0.22314630667550572, "grad_norm": 0.3101787269115448, "learning_rate": 1.4958263772954924e-05, "loss": 1.2891, "num_input_tokens_seen": 7639400, "step": 2777, "train_runtime": 7184.084, "train_tokens_per_second": 1063.378 }, { "epoch": 0.22322666184535647, "grad_norm": 0.3292182981967926, "learning_rate": 1.4891485809682806e-05, "loss": 1.0232, "num_input_tokens_seen": 7641670, "step": 2778, "train_runtime": 7186.082, "train_tokens_per_second": 1063.399 }, { "epoch": 0.22330701701520722, "grad_norm": 0.3355922996997833, "learning_rate": 1.4824707846410684e-05, "loss": 0.9747, "num_input_tokens_seen": 7644130, "step": 2779, "train_runtime": 7188.1654, "train_tokens_per_second": 1063.433 }, { "epoch": 0.22338737218505797, "grad_norm": 0.38050124049186707, "learning_rate": 1.4757929883138566e-05, "loss": 1.1495, "num_input_tokens_seen": 7646682, "step": 2780, "train_runtime": 7190.3454, "train_tokens_per_second": 1063.465 }, { "epoch": 0.2234677273549087, "grad_norm": 0.29221051931381226, "learning_rate": 1.4691151919866444e-05, "loss": 1.0444, "num_input_tokens_seen": 7649800, "step": 2781, "train_runtime": 7192.7621, "train_tokens_per_second": 1063.541 }, { "epoch": 0.22354808252475944, "grad_norm": 0.329502671957016, "learning_rate": 1.4624373956594326e-05, "loss": 1.2311, "num_input_tokens_seen": 7652364, "step": 2782, "train_runtime": 7194.8995, "train_tokens_per_second": 1063.582 }, { "epoch": 0.2236284376946102, "grad_norm": 0.5192813277244568, "learning_rate": 1.4557595993322204e-05, "loss": 1.0872, "num_input_tokens_seen": 7657690, "step": 2783, "train_runtime": 7198.7038, "train_tokens_per_second": 1063.76 }, { "epoch": 0.2237087928644609, "grad_norm": 0.2748900055885315, "learning_rate": 1.4490818030050086e-05, "loss": 1.121, "num_input_tokens_seen": 7661360, "step": 2784, "train_runtime": 7201.4884, "train_tokens_per_second": 1063.858 }, { "epoch": 0.22378914803431166, "grad_norm": 0.336200088262558, "learning_rate": 1.4424040066777964e-05, "loss": 0.8542, "num_input_tokens_seen": 7662968, "step": 2785, "train_runtime": 7203.1515, "train_tokens_per_second": 1063.835 }, { "epoch": 0.2238695032041624, "grad_norm": 0.3252107799053192, "learning_rate": 1.4357262103505844e-05, "loss": 0.6889, "num_input_tokens_seen": 7664384, "step": 2786, "train_runtime": 7204.7823, "train_tokens_per_second": 1063.791 }, { "epoch": 0.22394985837401313, "grad_norm": 0.3249092102050781, "learning_rate": 1.4290484140233724e-05, "loss": 0.9642, "num_input_tokens_seen": 7665848, "step": 2787, "train_runtime": 7206.4266, "train_tokens_per_second": 1063.752 }, { "epoch": 0.22403021354386388, "grad_norm": 0.30040207505226135, "learning_rate": 1.4223706176961604e-05, "loss": 1.1605, "num_input_tokens_seen": 7668158, "step": 2788, "train_runtime": 7208.3572, "train_tokens_per_second": 1063.787 }, { "epoch": 0.22411056871371463, "grad_norm": 0.2391747534275055, "learning_rate": 1.4156928213689482e-05, "loss": 0.9312, "num_input_tokens_seen": 7670494, "step": 2789, "train_runtime": 7210.359, "train_tokens_per_second": 1063.816 }, { "epoch": 0.22419092388356535, "grad_norm": 0.24021784961223602, "learning_rate": 1.4090150250417364e-05, "loss": 0.6008, "num_input_tokens_seen": 7672992, "step": 2790, "train_runtime": 7212.4287, "train_tokens_per_second": 1063.857 }, { "epoch": 0.2242712790534161, "grad_norm": 0.2623099088668823, "learning_rate": 1.4023372287145242e-05, "loss": 1.1019, "num_input_tokens_seen": 7676050, "step": 2791, "train_runtime": 7216.8544, "train_tokens_per_second": 1063.628 }, { "epoch": 0.22435163422326684, "grad_norm": 0.3006986379623413, "learning_rate": 1.3956594323873123e-05, "loss": 1.0244, "num_input_tokens_seen": 7680218, "step": 2792, "train_runtime": 7219.8453, "train_tokens_per_second": 1063.765 }, { "epoch": 0.2244319893931176, "grad_norm": 0.3254138231277466, "learning_rate": 1.3889816360601002e-05, "loss": 1.1955, "num_input_tokens_seen": 7684362, "step": 2793, "train_runtime": 7222.9531, "train_tokens_per_second": 1063.881 }, { "epoch": 0.2245123445629683, "grad_norm": 0.30785423517227173, "learning_rate": 1.3823038397328883e-05, "loss": 0.7092, "num_input_tokens_seen": 7686524, "step": 2794, "train_runtime": 7224.8765, "train_tokens_per_second": 1063.897 }, { "epoch": 0.22459269973281906, "grad_norm": 0.3039698600769043, "learning_rate": 1.3756260434056762e-05, "loss": 1.0811, "num_input_tokens_seen": 7688250, "step": 2795, "train_runtime": 7226.594, "train_tokens_per_second": 1063.883 }, { "epoch": 0.2246730549026698, "grad_norm": 0.34966331720352173, "learning_rate": 1.3689482470784643e-05, "loss": 1.0938, "num_input_tokens_seen": 7691452, "step": 2796, "train_runtime": 7228.9636, "train_tokens_per_second": 1063.977 }, { "epoch": 0.22475341007252053, "grad_norm": 0.2906704843044281, "learning_rate": 1.3622704507512521e-05, "loss": 0.92, "num_input_tokens_seen": 7694226, "step": 2797, "train_runtime": 7231.1877, "train_tokens_per_second": 1064.034 }, { "epoch": 0.22483376524237128, "grad_norm": 0.29575860500335693, "learning_rate": 1.3555926544240401e-05, "loss": 0.7041, "num_input_tokens_seen": 7698728, "step": 2798, "train_runtime": 7234.3646, "train_tokens_per_second": 1064.189 }, { "epoch": 0.22491412041222203, "grad_norm": 0.2830314040184021, "learning_rate": 1.3489148580968281e-05, "loss": 0.8335, "num_input_tokens_seen": 7701848, "step": 2799, "train_runtime": 7236.8206, "train_tokens_per_second": 1064.259 }, { "epoch": 0.22499447558207275, "grad_norm": 0.30267012119293213, "learning_rate": 1.3422370617696161e-05, "loss": 1.0311, "num_input_tokens_seen": 7704054, "step": 2800, "train_runtime": 7238.6722, "train_tokens_per_second": 1064.291 }, { "epoch": 0.2250748307519235, "grad_norm": 0.2815823554992676, "learning_rate": 1.335559265442404e-05, "loss": 0.9588, "num_input_tokens_seen": 7709760, "step": 2801, "train_runtime": 7242.709, "train_tokens_per_second": 1064.486 }, { "epoch": 0.22515518592177425, "grad_norm": 0.3106796443462372, "learning_rate": 1.3288814691151921e-05, "loss": 0.7551, "num_input_tokens_seen": 7712384, "step": 2802, "train_runtime": 7244.8426, "train_tokens_per_second": 1064.534 }, { "epoch": 0.22523554109162497, "grad_norm": 0.46703192591667175, "learning_rate": 1.32220367278798e-05, "loss": 1.188, "num_input_tokens_seen": 7714664, "step": 2803, "train_runtime": 7246.9056, "train_tokens_per_second": 1064.546 }, { "epoch": 0.22531589626147572, "grad_norm": 0.3115676939487457, "learning_rate": 1.3155258764607681e-05, "loss": 0.9955, "num_input_tokens_seen": 7717418, "step": 2804, "train_runtime": 7249.0705, "train_tokens_per_second": 1064.608 }, { "epoch": 0.22539625143132647, "grad_norm": 0.3923710286617279, "learning_rate": 1.3088480801335559e-05, "loss": 0.9465, "num_input_tokens_seen": 7720622, "step": 2805, "train_runtime": 7251.4792, "train_tokens_per_second": 1064.696 }, { "epoch": 0.22547660660117722, "grad_norm": 0.38434702157974243, "learning_rate": 1.302170283806344e-05, "loss": 0.8667, "num_input_tokens_seen": 7722630, "step": 2806, "train_runtime": 7253.4237, "train_tokens_per_second": 1064.688 }, { "epoch": 0.22555696177102794, "grad_norm": 0.3066710829734802, "learning_rate": 1.2954924874791319e-05, "loss": 0.8483, "num_input_tokens_seen": 7725104, "step": 2807, "train_runtime": 7255.4333, "train_tokens_per_second": 1064.734 }, { "epoch": 0.22563731694087868, "grad_norm": 0.24363166093826294, "learning_rate": 1.28881469115192e-05, "loss": 0.7707, "num_input_tokens_seen": 7727402, "step": 2808, "train_runtime": 7257.4068, "train_tokens_per_second": 1064.761 }, { "epoch": 0.22571767211072943, "grad_norm": 0.2831483483314514, "learning_rate": 1.2821368948247079e-05, "loss": 0.9463, "num_input_tokens_seen": 7731166, "step": 2809, "train_runtime": 7260.1278, "train_tokens_per_second": 1064.88 }, { "epoch": 0.22579802728058015, "grad_norm": 0.36960479617118835, "learning_rate": 1.2754590984974959e-05, "loss": 0.8618, "num_input_tokens_seen": 7733192, "step": 2810, "train_runtime": 7261.8793, "train_tokens_per_second": 1064.902 }, { "epoch": 0.2258783824504309, "grad_norm": 0.3136604428291321, "learning_rate": 1.2687813021702839e-05, "loss": 1.0546, "num_input_tokens_seen": 7735074, "step": 2811, "train_runtime": 7263.6456, "train_tokens_per_second": 1064.902 }, { "epoch": 0.22595873762028165, "grad_norm": 0.33273473381996155, "learning_rate": 1.2621035058430719e-05, "loss": 1.0375, "num_input_tokens_seen": 7737414, "step": 2812, "train_runtime": 7265.6748, "train_tokens_per_second": 1064.927 }, { "epoch": 0.22603909279013237, "grad_norm": 0.3242916166782379, "learning_rate": 1.2554257095158597e-05, "loss": 1.1273, "num_input_tokens_seen": 7740026, "step": 2813, "train_runtime": 7267.8137, "train_tokens_per_second": 1064.973 }, { "epoch": 0.22611944795998312, "grad_norm": 0.304437518119812, "learning_rate": 1.2487479131886479e-05, "loss": 0.626, "num_input_tokens_seen": 7743526, "step": 2814, "train_runtime": 7270.623, "train_tokens_per_second": 1065.043 }, { "epoch": 0.22619980312983387, "grad_norm": 0.33516693115234375, "learning_rate": 1.2420701168614358e-05, "loss": 0.8642, "num_input_tokens_seen": 7746918, "step": 2815, "train_runtime": 7273.2653, "train_tokens_per_second": 1065.122 }, { "epoch": 0.22628015829968462, "grad_norm": 0.3425694406032562, "learning_rate": 1.2353923205342238e-05, "loss": 0.9588, "num_input_tokens_seen": 7749070, "step": 2816, "train_runtime": 7275.104, "train_tokens_per_second": 1065.149 }, { "epoch": 0.22636051346953534, "grad_norm": 0.34973594546318054, "learning_rate": 1.2287145242070118e-05, "loss": 1.1461, "num_input_tokens_seen": 7751182, "step": 2817, "train_runtime": 7276.9547, "train_tokens_per_second": 1065.168 }, { "epoch": 0.2264408686393861, "grad_norm": 0.3162853419780731, "learning_rate": 1.2220367278797998e-05, "loss": 1.0239, "num_input_tokens_seen": 7753020, "step": 2818, "train_runtime": 7278.6801, "train_tokens_per_second": 1065.168 }, { "epoch": 0.22652122380923684, "grad_norm": 0.33880770206451416, "learning_rate": 1.2153589315525878e-05, "loss": 0.6929, "num_input_tokens_seen": 7755194, "step": 2819, "train_runtime": 7280.6995, "train_tokens_per_second": 1065.172 }, { "epoch": 0.22660157897908756, "grad_norm": 0.3280443251132965, "learning_rate": 1.2086811352253758e-05, "loss": 0.7346, "num_input_tokens_seen": 7757484, "step": 2820, "train_runtime": 7282.6962, "train_tokens_per_second": 1065.194 }, { "epoch": 0.2266819341489383, "grad_norm": 0.2715861201286316, "learning_rate": 1.2020033388981636e-05, "loss": 0.93, "num_input_tokens_seen": 7760738, "step": 2821, "train_runtime": 7287.0263, "train_tokens_per_second": 1065.008 }, { "epoch": 0.22676228931878906, "grad_norm": 0.33349916338920593, "learning_rate": 1.1953255425709516e-05, "loss": 0.8541, "num_input_tokens_seen": 7763130, "step": 2822, "train_runtime": 7289.0782, "train_tokens_per_second": 1065.036 }, { "epoch": 0.22684264448863978, "grad_norm": 0.2905218303203583, "learning_rate": 1.1886477462437396e-05, "loss": 1.2399, "num_input_tokens_seen": 7768128, "step": 2823, "train_runtime": 7292.4876, "train_tokens_per_second": 1065.223 }, { "epoch": 0.22692299965849053, "grad_norm": 0.2846352159976959, "learning_rate": 1.1819699499165276e-05, "loss": 1.0046, "num_input_tokens_seen": 7770704, "step": 2824, "train_runtime": 7294.6479, "train_tokens_per_second": 1065.261 }, { "epoch": 0.22700335482834127, "grad_norm": 0.3132615387439728, "learning_rate": 1.1752921535893156e-05, "loss": 0.8045, "num_input_tokens_seen": 7772632, "step": 2825, "train_runtime": 7296.423, "train_tokens_per_second": 1065.266 }, { "epoch": 0.227083709998192, "grad_norm": 0.284273236989975, "learning_rate": 1.1686143572621036e-05, "loss": 0.5296, "num_input_tokens_seen": 7775532, "step": 2826, "train_runtime": 7298.7683, "train_tokens_per_second": 1065.321 }, { "epoch": 0.22716406516804274, "grad_norm": 0.36679720878601074, "learning_rate": 1.1619365609348916e-05, "loss": 0.9873, "num_input_tokens_seen": 7777886, "step": 2827, "train_runtime": 7300.6926, "train_tokens_per_second": 1065.363 }, { "epoch": 0.2272444203378935, "grad_norm": 0.3023168444633484, "learning_rate": 1.1552587646076796e-05, "loss": 0.8889, "num_input_tokens_seen": 7780918, "step": 2828, "train_runtime": 7303.0048, "train_tokens_per_second": 1065.441 }, { "epoch": 0.22732477550774424, "grad_norm": 0.3108291029930115, "learning_rate": 1.1485809682804676e-05, "loss": 1.0372, "num_input_tokens_seen": 7783254, "step": 2829, "train_runtime": 7304.9604, "train_tokens_per_second": 1065.475 }, { "epoch": 0.22740513067759496, "grad_norm": 0.3111181855201721, "learning_rate": 1.1419031719532556e-05, "loss": 1.3196, "num_input_tokens_seen": 7786082, "step": 2830, "train_runtime": 7307.22, "train_tokens_per_second": 1065.533 }, { "epoch": 0.2274854858474457, "grad_norm": 0.29720649123191833, "learning_rate": 1.1352253756260436e-05, "loss": 1.0281, "num_input_tokens_seen": 7787492, "step": 2831, "train_runtime": 7308.8079, "train_tokens_per_second": 1065.494 }, { "epoch": 0.22756584101729646, "grad_norm": 0.4728342592716217, "learning_rate": 1.1285475792988316e-05, "loss": 0.8499, "num_input_tokens_seen": 7789354, "step": 2832, "train_runtime": 7310.6382, "train_tokens_per_second": 1065.482 }, { "epoch": 0.22764619618714718, "grad_norm": 0.3209225833415985, "learning_rate": 1.1218697829716194e-05, "loss": 0.876, "num_input_tokens_seen": 7791106, "step": 2833, "train_runtime": 7312.3845, "train_tokens_per_second": 1065.467 }, { "epoch": 0.22772655135699793, "grad_norm": 0.2421085387468338, "learning_rate": 1.1151919866444074e-05, "loss": 0.5991, "num_input_tokens_seen": 7796354, "step": 2834, "train_runtime": 7316.0531, "train_tokens_per_second": 1065.65 }, { "epoch": 0.22780690652684868, "grad_norm": 0.33176374435424805, "learning_rate": 1.1085141903171954e-05, "loss": 1.0241, "num_input_tokens_seen": 7797930, "step": 2835, "train_runtime": 7317.7093, "train_tokens_per_second": 1065.624 }, { "epoch": 0.2278872616966994, "grad_norm": 0.3912816345691681, "learning_rate": 1.1018363939899834e-05, "loss": 1.2112, "num_input_tokens_seen": 7803436, "step": 2836, "train_runtime": 7321.5706, "train_tokens_per_second": 1065.814 }, { "epoch": 0.22796761686655015, "grad_norm": 0.32537949085235596, "learning_rate": 1.0951585976627714e-05, "loss": 0.8654, "num_input_tokens_seen": 7806686, "step": 2837, "train_runtime": 7324.0952, "train_tokens_per_second": 1065.891 }, { "epoch": 0.2280479720364009, "grad_norm": 0.41164231300354004, "learning_rate": 1.0884808013355593e-05, "loss": 0.7822, "num_input_tokens_seen": 7808626, "step": 2838, "train_runtime": 7326.0177, "train_tokens_per_second": 1065.876 }, { "epoch": 0.22812832720625162, "grad_norm": 0.21988171339035034, "learning_rate": 1.0818030050083473e-05, "loss": 0.5962, "num_input_tokens_seen": 7813740, "step": 2839, "train_runtime": 7329.5564, "train_tokens_per_second": 1066.059 }, { "epoch": 0.22820868237610237, "grad_norm": 0.42122432589530945, "learning_rate": 1.0751252086811353e-05, "loss": 0.7253, "num_input_tokens_seen": 7815254, "step": 2840, "train_runtime": 7331.1427, "train_tokens_per_second": 1066.035 }, { "epoch": 0.22828903754595312, "grad_norm": 0.3596966862678528, "learning_rate": 1.0684474123539233e-05, "loss": 1.2278, "num_input_tokens_seen": 7820932, "step": 2841, "train_runtime": 7335.0457, "train_tokens_per_second": 1066.242 }, { "epoch": 0.22836939271580387, "grad_norm": 0.27379220724105835, "learning_rate": 1.0617696160267113e-05, "loss": 0.8762, "num_input_tokens_seen": 7824268, "step": 2842, "train_runtime": 7337.6548, "train_tokens_per_second": 1066.317 }, { "epoch": 0.22844974788565459, "grad_norm": 0.26335805654525757, "learning_rate": 1.0550918196994993e-05, "loss": 0.7938, "num_input_tokens_seen": 7827360, "step": 2843, "train_runtime": 7339.9795, "train_tokens_per_second": 1066.401 }, { "epoch": 0.22853010305550533, "grad_norm": 0.31241142749786377, "learning_rate": 1.0484140233722873e-05, "loss": 0.9654, "num_input_tokens_seen": 7830142, "step": 2844, "train_runtime": 7342.3408, "train_tokens_per_second": 1066.437 }, { "epoch": 0.22861045822535608, "grad_norm": 0.2643781900405884, "learning_rate": 1.0417362270450751e-05, "loss": 0.7209, "num_input_tokens_seen": 7834530, "step": 2845, "train_runtime": 7345.4189, "train_tokens_per_second": 1066.587 }, { "epoch": 0.2286908133952068, "grad_norm": 0.3357027471065521, "learning_rate": 1.0350584307178631e-05, "loss": 0.9132, "num_input_tokens_seen": 7837466, "step": 2846, "train_runtime": 7347.6646, "train_tokens_per_second": 1066.661 }, { "epoch": 0.22877116856505755, "grad_norm": 0.2800379991531372, "learning_rate": 1.0283806343906511e-05, "loss": 0.7535, "num_input_tokens_seen": 7839400, "step": 2847, "train_runtime": 7349.4723, "train_tokens_per_second": 1066.662 }, { "epoch": 0.2288515237349083, "grad_norm": 0.2625751495361328, "learning_rate": 1.0217028380634391e-05, "loss": 1.2553, "num_input_tokens_seen": 7842714, "step": 2848, "train_runtime": 7352.0432, "train_tokens_per_second": 1066.739 }, { "epoch": 0.22893187890475902, "grad_norm": 0.26711219549179077, "learning_rate": 1.0150250417362271e-05, "loss": 0.8721, "num_input_tokens_seen": 7846890, "step": 2849, "train_runtime": 7354.9753, "train_tokens_per_second": 1066.882 }, { "epoch": 0.22901223407460977, "grad_norm": 0.44203436374664307, "learning_rate": 1.0083472454090151e-05, "loss": 0.8652, "num_input_tokens_seen": 7849840, "step": 2850, "train_runtime": 7357.2167, "train_tokens_per_second": 1066.958 }, { "epoch": 0.22909258924446052, "grad_norm": 0.3775481581687927, "learning_rate": 1.001669449081803e-05, "loss": 1.0818, "num_input_tokens_seen": 7851864, "step": 2851, "train_runtime": 7361.0026, "train_tokens_per_second": 1066.684 }, { "epoch": 0.22917294441431127, "grad_norm": 0.3612276613712311, "learning_rate": 9.94991652754591e-06, "loss": 0.9377, "num_input_tokens_seen": 7854684, "step": 2852, "train_runtime": 7363.1545, "train_tokens_per_second": 1066.755 }, { "epoch": 0.229253299584162, "grad_norm": 0.3302251398563385, "learning_rate": 9.88313856427379e-06, "loss": 1.0098, "num_input_tokens_seen": 7857074, "step": 2853, "train_runtime": 7365.1826, "train_tokens_per_second": 1066.786 }, { "epoch": 0.22933365475401274, "grad_norm": 0.3119541108608246, "learning_rate": 9.81636060100167e-06, "loss": 1.0693, "num_input_tokens_seen": 7859954, "step": 2854, "train_runtime": 7367.434, "train_tokens_per_second": 1066.851 }, { "epoch": 0.2294140099238635, "grad_norm": 0.31083476543426514, "learning_rate": 9.74958263772955e-06, "loss": 0.9766, "num_input_tokens_seen": 7862176, "step": 2855, "train_runtime": 7369.3726, "train_tokens_per_second": 1066.872 }, { "epoch": 0.2294943650937142, "grad_norm": 0.3210439682006836, "learning_rate": 9.68280467445743e-06, "loss": 0.9786, "num_input_tokens_seen": 7864320, "step": 2856, "train_runtime": 7371.2841, "train_tokens_per_second": 1066.886 }, { "epoch": 0.22957472026356496, "grad_norm": 0.3303755819797516, "learning_rate": 9.616026711185309e-06, "loss": 1.245, "num_input_tokens_seen": 7865732, "step": 2857, "train_runtime": 7372.8087, "train_tokens_per_second": 1066.857 }, { "epoch": 0.2296550754334157, "grad_norm": 0.4303469657897949, "learning_rate": 9.549248747913189e-06, "loss": 0.7776, "num_input_tokens_seen": 7866982, "step": 2858, "train_runtime": 7374.3863, "train_tokens_per_second": 1066.798 }, { "epoch": 0.22973543060326643, "grad_norm": 0.3318173587322235, "learning_rate": 9.482470784641069e-06, "loss": 1.1827, "num_input_tokens_seen": 7869742, "step": 2859, "train_runtime": 7376.5709, "train_tokens_per_second": 1066.856 }, { "epoch": 0.22981578577311718, "grad_norm": 0.3349165618419647, "learning_rate": 9.415692821368949e-06, "loss": 1.2823, "num_input_tokens_seen": 7873914, "step": 2860, "train_runtime": 7379.4401, "train_tokens_per_second": 1067.007 }, { "epoch": 0.22989614094296792, "grad_norm": 0.44777733087539673, "learning_rate": 9.348914858096828e-06, "loss": 1.1932, "num_input_tokens_seen": 7877024, "step": 2861, "train_runtime": 7381.8517, "train_tokens_per_second": 1067.08 }, { "epoch": 0.22997649611281865, "grad_norm": 0.2634897232055664, "learning_rate": 9.282136894824708e-06, "loss": 0.6923, "num_input_tokens_seen": 7881064, "step": 2862, "train_runtime": 7384.7315, "train_tokens_per_second": 1067.211 }, { "epoch": 0.2300568512826694, "grad_norm": 0.32381150126457214, "learning_rate": 9.215358931552588e-06, "loss": 0.8596, "num_input_tokens_seen": 7882750, "step": 2863, "train_runtime": 7386.3447, "train_tokens_per_second": 1067.206 }, { "epoch": 0.23013720645252014, "grad_norm": 0.28828147053718567, "learning_rate": 9.148580968280468e-06, "loss": 0.7077, "num_input_tokens_seen": 7884816, "step": 2864, "train_runtime": 7388.1629, "train_tokens_per_second": 1067.223 }, { "epoch": 0.2302175616223709, "grad_norm": 0.311092346906662, "learning_rate": 9.081803005008348e-06, "loss": 0.8973, "num_input_tokens_seen": 7886860, "step": 2865, "train_runtime": 7389.9721, "train_tokens_per_second": 1067.238 }, { "epoch": 0.2302979167922216, "grad_norm": 0.3248305320739746, "learning_rate": 9.015025041736228e-06, "loss": 1.0069, "num_input_tokens_seen": 7889794, "step": 2866, "train_runtime": 7392.2721, "train_tokens_per_second": 1067.303 }, { "epoch": 0.23037827196207236, "grad_norm": 0.41866010427474976, "learning_rate": 8.948247078464108e-06, "loss": 0.6156, "num_input_tokens_seen": 7892032, "step": 2867, "train_runtime": 7394.1612, "train_tokens_per_second": 1067.333 }, { "epoch": 0.2304586271319231, "grad_norm": 0.2685219645500183, "learning_rate": 8.881469115191986e-06, "loss": 0.7219, "num_input_tokens_seen": 7893876, "step": 2868, "train_runtime": 7395.8705, "train_tokens_per_second": 1067.336 }, { "epoch": 0.23053898230177383, "grad_norm": 0.33013466000556946, "learning_rate": 8.814691151919866e-06, "loss": 1.0515, "num_input_tokens_seen": 7897892, "step": 2869, "train_runtime": 7398.7903, "train_tokens_per_second": 1067.457 }, { "epoch": 0.23061933747162458, "grad_norm": 0.3439158797264099, "learning_rate": 8.747913188647746e-06, "loss": 0.9476, "num_input_tokens_seen": 7900860, "step": 2870, "train_runtime": 7401.1311, "train_tokens_per_second": 1067.521 }, { "epoch": 0.23069969264147533, "grad_norm": 0.47075122594833374, "learning_rate": 8.681135225375626e-06, "loss": 0.818, "num_input_tokens_seen": 7903916, "step": 2871, "train_runtime": 7403.4968, "train_tokens_per_second": 1067.592 }, { "epoch": 0.23078004781132605, "grad_norm": 0.34985777735710144, "learning_rate": 8.614357262103506e-06, "loss": 1.2345, "num_input_tokens_seen": 7906336, "step": 2872, "train_runtime": 7405.5741, "train_tokens_per_second": 1067.62 }, { "epoch": 0.2308604029811768, "grad_norm": 0.3292609751224518, "learning_rate": 8.547579298831386e-06, "loss": 0.8414, "num_input_tokens_seen": 7908388, "step": 2873, "train_runtime": 7407.5154, "train_tokens_per_second": 1067.617 }, { "epoch": 0.23094075815102755, "grad_norm": 0.2691466808319092, "learning_rate": 8.480801335559266e-06, "loss": 0.5495, "num_input_tokens_seen": 7910158, "step": 2874, "train_runtime": 7409.2047, "train_tokens_per_second": 1067.612 }, { "epoch": 0.23102111332087827, "grad_norm": 0.48094266653060913, "learning_rate": 8.414023372287146e-06, "loss": 1.5238, "num_input_tokens_seen": 7913244, "step": 2875, "train_runtime": 7411.558, "train_tokens_per_second": 1067.69 }, { "epoch": 0.23110146849072902, "grad_norm": 0.26958349347114563, "learning_rate": 8.347245409015026e-06, "loss": 1.1002, "num_input_tokens_seen": 7915352, "step": 2876, "train_runtime": 7413.3457, "train_tokens_per_second": 1067.717 }, { "epoch": 0.23118182366057977, "grad_norm": 0.3663804233074188, "learning_rate": 8.280467445742906e-06, "loss": 0.8882, "num_input_tokens_seen": 7918284, "step": 2877, "train_runtime": 7415.6583, "train_tokens_per_second": 1067.779 }, { "epoch": 0.23126217883043051, "grad_norm": 0.30901092290878296, "learning_rate": 8.213689482470786e-06, "loss": 0.9035, "num_input_tokens_seen": 7921850, "step": 2878, "train_runtime": 7418.3172, "train_tokens_per_second": 1067.877 }, { "epoch": 0.23134253400028124, "grad_norm": 0.32220202684402466, "learning_rate": 8.146911519198665e-06, "loss": 0.8439, "num_input_tokens_seen": 7924204, "step": 2879, "train_runtime": 7420.3741, "train_tokens_per_second": 1067.898 }, { "epoch": 0.23142288917013198, "grad_norm": 0.33323851227760315, "learning_rate": 8.080133555926544e-06, "loss": 1.2147, "num_input_tokens_seen": 7927764, "step": 2880, "train_runtime": 7423.0877, "train_tokens_per_second": 1067.987 }, { "epoch": 0.23150324433998273, "grad_norm": 0.32072654366493225, "learning_rate": 8.013355592654424e-06, "loss": 0.7404, "num_input_tokens_seen": 7929586, "step": 2881, "train_runtime": 7426.6932, "train_tokens_per_second": 1067.714 }, { "epoch": 0.23158359950983345, "grad_norm": 0.25004059076309204, "learning_rate": 7.946577629382304e-06, "loss": 0.8091, "num_input_tokens_seen": 7932858, "step": 2882, "train_runtime": 7429.1247, "train_tokens_per_second": 1067.805 }, { "epoch": 0.2316639546796842, "grad_norm": 0.3316909074783325, "learning_rate": 7.879799666110184e-06, "loss": 1.0841, "num_input_tokens_seen": 7936180, "step": 2883, "train_runtime": 7431.5776, "train_tokens_per_second": 1067.9 }, { "epoch": 0.23174430984953495, "grad_norm": 0.31683462858200073, "learning_rate": 7.813021702838063e-06, "loss": 1.1515, "num_input_tokens_seen": 7939672, "step": 2884, "train_runtime": 7434.0602, "train_tokens_per_second": 1068.013 }, { "epoch": 0.23182466501938567, "grad_norm": 0.28647980093955994, "learning_rate": 7.746243739565943e-06, "loss": 0.856, "num_input_tokens_seen": 7942304, "step": 2885, "train_runtime": 7436.2105, "train_tokens_per_second": 1068.058 }, { "epoch": 0.23190502018923642, "grad_norm": 0.34173357486724854, "learning_rate": 7.679465776293823e-06, "loss": 0.8874, "num_input_tokens_seen": 7944342, "step": 2886, "train_runtime": 7438.0798, "train_tokens_per_second": 1068.064 }, { "epoch": 0.23198537535908717, "grad_norm": 0.4894322156906128, "learning_rate": 7.612687813021703e-06, "loss": 0.8204, "num_input_tokens_seen": 7946780, "step": 2887, "train_runtime": 7440.0672, "train_tokens_per_second": 1068.106 }, { "epoch": 0.23206573052893792, "grad_norm": 0.29378753900527954, "learning_rate": 7.545909849749583e-06, "loss": 0.8396, "num_input_tokens_seen": 7949056, "step": 2888, "train_runtime": 7442.0464, "train_tokens_per_second": 1068.128 }, { "epoch": 0.23214608569878864, "grad_norm": 0.4440731704235077, "learning_rate": 7.479131886477462e-06, "loss": 1.5238, "num_input_tokens_seen": 7950558, "step": 2889, "train_runtime": 7443.6071, "train_tokens_per_second": 1068.106 }, { "epoch": 0.2322264408686394, "grad_norm": 0.3225192725658417, "learning_rate": 7.412353923205342e-06, "loss": 1.0, "num_input_tokens_seen": 7953398, "step": 2890, "train_runtime": 7445.8224, "train_tokens_per_second": 1068.169 }, { "epoch": 0.23230679603849014, "grad_norm": 0.3230671286582947, "learning_rate": 7.345575959933222e-06, "loss": 0.9854, "num_input_tokens_seen": 7956788, "step": 2891, "train_runtime": 7448.3302, "train_tokens_per_second": 1068.265 }, { "epoch": 0.23238715120834086, "grad_norm": 0.28703269362449646, "learning_rate": 7.278797996661102e-06, "loss": 1.0658, "num_input_tokens_seen": 7958956, "step": 2892, "train_runtime": 7450.291, "train_tokens_per_second": 1068.275 }, { "epoch": 0.2324675063781916, "grad_norm": 0.3324466943740845, "learning_rate": 7.212020033388982e-06, "loss": 0.8563, "num_input_tokens_seen": 7960240, "step": 2893, "train_runtime": 7451.8441, "train_tokens_per_second": 1068.224 }, { "epoch": 0.23254786154804236, "grad_norm": 0.28836894035339355, "learning_rate": 7.145242070116862e-06, "loss": 0.9315, "num_input_tokens_seen": 7964606, "step": 2894, "train_runtime": 7455.0547, "train_tokens_per_second": 1068.35 }, { "epoch": 0.23262821671789308, "grad_norm": 0.32132986187934875, "learning_rate": 7.078464106844741e-06, "loss": 0.9448, "num_input_tokens_seen": 7967774, "step": 2895, "train_runtime": 7457.5341, "train_tokens_per_second": 1068.419 }, { "epoch": 0.23270857188774383, "grad_norm": 0.313288152217865, "learning_rate": 7.011686143572621e-06, "loss": 0.9615, "num_input_tokens_seen": 7969556, "step": 2896, "train_runtime": 7459.321, "train_tokens_per_second": 1068.402 }, { "epoch": 0.23278892705759457, "grad_norm": 0.3201817572116852, "learning_rate": 6.944908180300501e-06, "loss": 0.7358, "num_input_tokens_seen": 7972040, "step": 2897, "train_runtime": 7461.4026, "train_tokens_per_second": 1068.437 }, { "epoch": 0.2328692822274453, "grad_norm": 0.270537793636322, "learning_rate": 6.878130217028381e-06, "loss": 0.7319, "num_input_tokens_seen": 7973974, "step": 2898, "train_runtime": 7463.0965, "train_tokens_per_second": 1068.454 }, { "epoch": 0.23294963739729604, "grad_norm": 0.30717888474464417, "learning_rate": 6.811352253756261e-06, "loss": 0.6131, "num_input_tokens_seen": 7975220, "step": 2899, "train_runtime": 7464.6087, "train_tokens_per_second": 1068.404 }, { "epoch": 0.2330299925671468, "grad_norm": 0.3329704999923706, "learning_rate": 6.744574290484141e-06, "loss": 1.0444, "num_input_tokens_seen": 7978612, "step": 2900, "train_runtime": 7467.1717, "train_tokens_per_second": 1068.492 }, { "epoch": 0.23311034773699754, "grad_norm": 0.3216586709022522, "learning_rate": 6.67779632721202e-06, "loss": 0.9202, "num_input_tokens_seen": 7981040, "step": 2901, "train_runtime": 7469.1513, "train_tokens_per_second": 1068.534 }, { "epoch": 0.23319070290684826, "grad_norm": 0.3532184660434723, "learning_rate": 6.6110183639399e-06, "loss": 1.1332, "num_input_tokens_seen": 7984168, "step": 2902, "train_runtime": 7471.6063, "train_tokens_per_second": 1068.601 }, { "epoch": 0.233271058076699, "grad_norm": 0.3200591802597046, "learning_rate": 6.5442404006677796e-06, "loss": 1.0378, "num_input_tokens_seen": 7986090, "step": 2903, "train_runtime": 7473.4554, "train_tokens_per_second": 1068.594 }, { "epoch": 0.23335141324654976, "grad_norm": 0.34241044521331787, "learning_rate": 6.4774624373956595e-06, "loss": 1.0959, "num_input_tokens_seen": 7989238, "step": 2904, "train_runtime": 7475.8081, "train_tokens_per_second": 1068.679 }, { "epoch": 0.23343176841640048, "grad_norm": 0.34307292103767395, "learning_rate": 6.4106844741235394e-06, "loss": 1.1283, "num_input_tokens_seen": 7991828, "step": 2905, "train_runtime": 7477.9181, "train_tokens_per_second": 1068.724 }, { "epoch": 0.23351212358625123, "grad_norm": 0.3693479001522064, "learning_rate": 6.343906510851419e-06, "loss": 0.9773, "num_input_tokens_seen": 7994854, "step": 2906, "train_runtime": 7480.2302, "train_tokens_per_second": 1068.798 }, { "epoch": 0.23359247875610198, "grad_norm": 0.3348240554332733, "learning_rate": 6.2771285475792984e-06, "loss": 1.063, "num_input_tokens_seen": 7996460, "step": 2907, "train_runtime": 7481.8134, "train_tokens_per_second": 1068.786 }, { "epoch": 0.2336728339259527, "grad_norm": 0.426025390625, "learning_rate": 6.210350584307179e-06, "loss": 0.6624, "num_input_tokens_seen": 7998892, "step": 2908, "train_runtime": 7483.8507, "train_tokens_per_second": 1068.82 }, { "epoch": 0.23375318909580345, "grad_norm": 0.40392255783081055, "learning_rate": 6.143572621035059e-06, "loss": 0.7834, "num_input_tokens_seen": 8002782, "step": 2909, "train_runtime": 7486.6932, "train_tokens_per_second": 1068.934 }, { "epoch": 0.2338335442656542, "grad_norm": 0.3087678551673889, "learning_rate": 6.076794657762939e-06, "loss": 0.7977, "num_input_tokens_seen": 8005676, "step": 2910, "train_runtime": 7488.9499, "train_tokens_per_second": 1068.998 }, { "epoch": 0.23391389943550492, "grad_norm": 0.32012656331062317, "learning_rate": 6.010016694490818e-06, "loss": 0.9661, "num_input_tokens_seen": 8007100, "step": 2911, "train_runtime": 7492.5151, "train_tokens_per_second": 1068.68 }, { "epoch": 0.23399425460535567, "grad_norm": 0.2771163582801819, "learning_rate": 5.943238731218698e-06, "loss": 0.7767, "num_input_tokens_seen": 8010128, "step": 2912, "train_runtime": 7494.8461, "train_tokens_per_second": 1068.751 }, { "epoch": 0.23407460977520642, "grad_norm": 0.28324493765830994, "learning_rate": 5.876460767946578e-06, "loss": 0.7878, "num_input_tokens_seen": 8011928, "step": 2913, "train_runtime": 7496.6383, "train_tokens_per_second": 1068.736 }, { "epoch": 0.23415496494505716, "grad_norm": 0.42554348707199097, "learning_rate": 5.809682804674458e-06, "loss": 0.8004, "num_input_tokens_seen": 8013598, "step": 2914, "train_runtime": 7498.4033, "train_tokens_per_second": 1068.707 }, { "epoch": 0.23423532011490789, "grad_norm": 0.32236963510513306, "learning_rate": 5.742904841402338e-06, "loss": 1.0473, "num_input_tokens_seen": 8016122, "step": 2915, "train_runtime": 7500.4596, "train_tokens_per_second": 1068.751 }, { "epoch": 0.23431567528475863, "grad_norm": 0.29543444514274597, "learning_rate": 5.676126878130218e-06, "loss": 0.8251, "num_input_tokens_seen": 8017744, "step": 2916, "train_runtime": 7502.0766, "train_tokens_per_second": 1068.737 }, { "epoch": 0.23439603045460938, "grad_norm": 0.42115992307662964, "learning_rate": 5.609348914858097e-06, "loss": 0.8719, "num_input_tokens_seen": 8019734, "step": 2917, "train_runtime": 7503.9417, "train_tokens_per_second": 1068.736 }, { "epoch": 0.2344763856244601, "grad_norm": 0.31785961985588074, "learning_rate": 5.542570951585977e-06, "loss": 1.1883, "num_input_tokens_seen": 8022950, "step": 2918, "train_runtime": 7506.4343, "train_tokens_per_second": 1068.81 }, { "epoch": 0.23455674079431085, "grad_norm": 0.307235449552536, "learning_rate": 5.475792988313857e-06, "loss": 1.1506, "num_input_tokens_seen": 8027022, "step": 2919, "train_runtime": 7509.2837, "train_tokens_per_second": 1068.946 }, { "epoch": 0.2346370959641616, "grad_norm": 0.2724400460720062, "learning_rate": 5.409015025041737e-06, "loss": 0.7967, "num_input_tokens_seen": 8029058, "step": 2920, "train_runtime": 7511.1206, "train_tokens_per_second": 1068.956 }, { "epoch": 0.23471745113401232, "grad_norm": 0.34455740451812744, "learning_rate": 5.342237061769617e-06, "loss": 1.1755, "num_input_tokens_seen": 8032596, "step": 2921, "train_runtime": 7513.7369, "train_tokens_per_second": 1069.055 }, { "epoch": 0.23479780630386307, "grad_norm": 0.34917742013931274, "learning_rate": 5.2754590984974965e-06, "loss": 1.2025, "num_input_tokens_seen": 8035236, "step": 2922, "train_runtime": 7515.9475, "train_tokens_per_second": 1069.092 }, { "epoch": 0.23487816147371382, "grad_norm": 0.31094813346862793, "learning_rate": 5.208681135225376e-06, "loss": 0.8137, "num_input_tokens_seen": 8038310, "step": 2923, "train_runtime": 7518.2876, "train_tokens_per_second": 1069.168 }, { "epoch": 0.23495851664356457, "grad_norm": 0.3259291648864746, "learning_rate": 5.1419031719532556e-06, "loss": 1.2322, "num_input_tokens_seen": 8041862, "step": 2924, "train_runtime": 7520.9054, "train_tokens_per_second": 1069.268 }, { "epoch": 0.2350388718134153, "grad_norm": 0.3635278642177582, "learning_rate": 5.0751252086811355e-06, "loss": 0.9854, "num_input_tokens_seen": 8044136, "step": 2925, "train_runtime": 7522.8269, "train_tokens_per_second": 1069.297 }, { "epoch": 0.23511922698326604, "grad_norm": 0.33314600586891174, "learning_rate": 5.008347245409015e-06, "loss": 0.6917, "num_input_tokens_seen": 8046452, "step": 2926, "train_runtime": 7524.85, "train_tokens_per_second": 1069.317 }, { "epoch": 0.2351995821531168, "grad_norm": 0.3343305289745331, "learning_rate": 4.941569282136895e-06, "loss": 0.8613, "num_input_tokens_seen": 8050578, "step": 2927, "train_runtime": 7527.8506, "train_tokens_per_second": 1069.439 }, { "epoch": 0.2352799373229675, "grad_norm": 0.2475036084651947, "learning_rate": 4.874791318864775e-06, "loss": 0.7761, "num_input_tokens_seen": 8055048, "step": 2928, "train_runtime": 7531.0326, "train_tokens_per_second": 1069.581 }, { "epoch": 0.23536029249281826, "grad_norm": 0.3320787847042084, "learning_rate": 4.808013355592654e-06, "loss": 0.9233, "num_input_tokens_seen": 8062624, "step": 2929, "train_runtime": 7536.0394, "train_tokens_per_second": 1069.876 }, { "epoch": 0.235440647662669, "grad_norm": 0.3156088590621948, "learning_rate": 4.741235392320534e-06, "loss": 0.783, "num_input_tokens_seen": 8064260, "step": 2930, "train_runtime": 7537.7486, "train_tokens_per_second": 1069.85 }, { "epoch": 0.23552100283251973, "grad_norm": 0.3170846700668335, "learning_rate": 4.674457429048414e-06, "loss": 0.9894, "num_input_tokens_seen": 8067966, "step": 2931, "train_runtime": 7540.4163, "train_tokens_per_second": 1069.963 }, { "epoch": 0.23560135800237048, "grad_norm": 0.32855215668678284, "learning_rate": 4.607679465776294e-06, "loss": 1.1993, "num_input_tokens_seen": 8072422, "step": 2932, "train_runtime": 7543.6664, "train_tokens_per_second": 1070.093 }, { "epoch": 0.23568171317222122, "grad_norm": 0.30814823508262634, "learning_rate": 4.540901502504174e-06, "loss": 1.0975, "num_input_tokens_seen": 8074270, "step": 2933, "train_runtime": 7545.4666, "train_tokens_per_second": 1070.082 }, { "epoch": 0.23576206834207195, "grad_norm": 0.3340173363685608, "learning_rate": 4.474123539232054e-06, "loss": 0.927, "num_input_tokens_seen": 8076026, "step": 2934, "train_runtime": 7547.1305, "train_tokens_per_second": 1070.079 }, { "epoch": 0.2358424235119227, "grad_norm": 0.2794358432292938, "learning_rate": 4.407345575959933e-06, "loss": 0.8787, "num_input_tokens_seen": 8077654, "step": 2935, "train_runtime": 7548.7851, "train_tokens_per_second": 1070.06 }, { "epoch": 0.23592277868177344, "grad_norm": 0.3027331233024597, "learning_rate": 4.340567612687813e-06, "loss": 1.0477, "num_input_tokens_seen": 8079394, "step": 2936, "train_runtime": 7550.4611, "train_tokens_per_second": 1070.053 }, { "epoch": 0.2360031338516242, "grad_norm": 0.36117789149284363, "learning_rate": 4.273789649415693e-06, "loss": 1.0531, "num_input_tokens_seen": 8082796, "step": 2937, "train_runtime": 7553.1072, "train_tokens_per_second": 1070.129 }, { "epoch": 0.2360834890214749, "grad_norm": 0.33424028754234314, "learning_rate": 4.207011686143573e-06, "loss": 0.9032, "num_input_tokens_seen": 8084530, "step": 2938, "train_runtime": 7554.8794, "train_tokens_per_second": 1070.107 }, { "epoch": 0.23616384419132566, "grad_norm": 0.3893217444419861, "learning_rate": 4.140233722871453e-06, "loss": 1.0802, "num_input_tokens_seen": 8085684, "step": 2939, "train_runtime": 7556.3951, "train_tokens_per_second": 1070.045 }, { "epoch": 0.2362441993611764, "grad_norm": 0.34217315912246704, "learning_rate": 4.073455759599333e-06, "loss": 1.0972, "num_input_tokens_seen": 8087684, "step": 2940, "train_runtime": 7558.2903, "train_tokens_per_second": 1070.041 }, { "epoch": 0.23632455453102713, "grad_norm": 0.32231464982032776, "learning_rate": 4.006677796327212e-06, "loss": 0.8265, "num_input_tokens_seen": 8090178, "step": 2941, "train_runtime": 7562.2381, "train_tokens_per_second": 1069.813 }, { "epoch": 0.23640490970087788, "grad_norm": 0.3164416551589966, "learning_rate": 3.939899833055092e-06, "loss": 0.8601, "num_input_tokens_seen": 8091982, "step": 2942, "train_runtime": 7564.0161, "train_tokens_per_second": 1069.8 }, { "epoch": 0.23648526487072863, "grad_norm": 0.28371524810791016, "learning_rate": 3.873121869782972e-06, "loss": 0.704, "num_input_tokens_seen": 8094278, "step": 2943, "train_runtime": 7565.9239, "train_tokens_per_second": 1069.833 }, { "epoch": 0.23656562004057935, "grad_norm": 0.39141759276390076, "learning_rate": 3.8063439065108516e-06, "loss": 0.6815, "num_input_tokens_seen": 8096112, "step": 2944, "train_runtime": 7567.6515, "train_tokens_per_second": 1069.832 }, { "epoch": 0.2366459752104301, "grad_norm": 0.3549150228500366, "learning_rate": 3.739565943238731e-06, "loss": 1.1416, "num_input_tokens_seen": 8098100, "step": 2945, "train_runtime": 7569.4856, "train_tokens_per_second": 1069.835 }, { "epoch": 0.23672633038028085, "grad_norm": 0.33833369612693787, "learning_rate": 3.672787979966611e-06, "loss": 1.2012, "num_input_tokens_seen": 8099646, "step": 2946, "train_runtime": 7571.0573, "train_tokens_per_second": 1069.817 }, { "epoch": 0.23680668555013157, "grad_norm": 0.3133547902107239, "learning_rate": 3.606010016694491e-06, "loss": 1.1224, "num_input_tokens_seen": 8101918, "step": 2947, "train_runtime": 7572.982, "train_tokens_per_second": 1069.845 }, { "epoch": 0.23688704071998232, "grad_norm": 0.30431944131851196, "learning_rate": 3.5392320534223705e-06, "loss": 0.9183, "num_input_tokens_seen": 8107114, "step": 2948, "train_runtime": 7576.6564, "train_tokens_per_second": 1070.012 }, { "epoch": 0.23696739588983307, "grad_norm": 0.30427950620651245, "learning_rate": 3.4724540901502504e-06, "loss": 1.1034, "num_input_tokens_seen": 8108794, "step": 2949, "train_runtime": 7578.3324, "train_tokens_per_second": 1069.997 }, { "epoch": 0.23704775105968381, "grad_norm": 0.34604355692863464, "learning_rate": 3.4056761268781303e-06, "loss": 0.9188, "num_input_tokens_seen": 8111558, "step": 2950, "train_runtime": 7580.6007, "train_tokens_per_second": 1070.042 }, { "epoch": 0.23712810622953454, "grad_norm": 0.329996258020401, "learning_rate": 3.33889816360601e-06, "loss": 0.8895, "num_input_tokens_seen": 8113664, "step": 2951, "train_runtime": 7582.5268, "train_tokens_per_second": 1070.048 }, { "epoch": 0.23720846139938528, "grad_norm": 0.35375866293907166, "learning_rate": 3.2721202003338898e-06, "loss": 0.5765, "num_input_tokens_seen": 8115088, "step": 2952, "train_runtime": 7584.1142, "train_tokens_per_second": 1070.011 }, { "epoch": 0.23728881656923603, "grad_norm": 0.3138856887817383, "learning_rate": 3.2053422370617697e-06, "loss": 0.9511, "num_input_tokens_seen": 8118080, "step": 2953, "train_runtime": 7586.4993, "train_tokens_per_second": 1070.069 }, { "epoch": 0.23736917173908675, "grad_norm": 0.3197863698005676, "learning_rate": 3.1385642737896492e-06, "loss": 0.9779, "num_input_tokens_seen": 8121460, "step": 2954, "train_runtime": 7588.9963, "train_tokens_per_second": 1070.163 }, { "epoch": 0.2374495269089375, "grad_norm": 0.37144437432289124, "learning_rate": 3.0717863105175296e-06, "loss": 1.2845, "num_input_tokens_seen": 8124492, "step": 2955, "train_runtime": 7591.2886, "train_tokens_per_second": 1070.239 }, { "epoch": 0.23752988207878825, "grad_norm": 0.5184103846549988, "learning_rate": 3.005008347245409e-06, "loss": 1.414, "num_input_tokens_seen": 8126102, "step": 2956, "train_runtime": 7593.0321, "train_tokens_per_second": 1070.205 }, { "epoch": 0.23761023724863897, "grad_norm": 0.2918568551540375, "learning_rate": 2.938230383973289e-06, "loss": 1.0303, "num_input_tokens_seen": 8129702, "step": 2957, "train_runtime": 7595.6467, "train_tokens_per_second": 1070.311 }, { "epoch": 0.23769059241848972, "grad_norm": 0.33410003781318665, "learning_rate": 2.871452420701169e-06, "loss": 0.6886, "num_input_tokens_seen": 8132176, "step": 2958, "train_runtime": 7597.7294, "train_tokens_per_second": 1070.343 }, { "epoch": 0.23777094758834047, "grad_norm": 0.32255151867866516, "learning_rate": 2.8046744574290484e-06, "loss": 0.9506, "num_input_tokens_seen": 8134450, "step": 2959, "train_runtime": 7599.7847, "train_tokens_per_second": 1070.353 }, { "epoch": 0.23785130275819122, "grad_norm": 0.45826491713523865, "learning_rate": 2.7378964941569284e-06, "loss": 0.8267, "num_input_tokens_seen": 8139176, "step": 2960, "train_runtime": 7603.1713, "train_tokens_per_second": 1070.498 }, { "epoch": 0.23793165792804194, "grad_norm": 0.35797688364982605, "learning_rate": 2.6711185308848083e-06, "loss": 0.9327, "num_input_tokens_seen": 8142284, "step": 2961, "train_runtime": 7605.5174, "train_tokens_per_second": 1070.576 }, { "epoch": 0.2380120130978927, "grad_norm": 0.3346036672592163, "learning_rate": 2.604340567612688e-06, "loss": 0.9001, "num_input_tokens_seen": 8143858, "step": 2962, "train_runtime": 7607.1052, "train_tokens_per_second": 1070.559 }, { "epoch": 0.23809236826774344, "grad_norm": 0.26113417744636536, "learning_rate": 2.5375626043405677e-06, "loss": 0.8289, "num_input_tokens_seen": 8145894, "step": 2963, "train_runtime": 7608.9296, "train_tokens_per_second": 1070.57 }, { "epoch": 0.23817272343759416, "grad_norm": 0.37985503673553467, "learning_rate": 2.4707846410684477e-06, "loss": 0.7447, "num_input_tokens_seen": 8147672, "step": 2964, "train_runtime": 7610.62, "train_tokens_per_second": 1070.566 }, { "epoch": 0.2382530786074449, "grad_norm": 0.3743630349636078, "learning_rate": 2.404006677796327e-06, "loss": 0.9972, "num_input_tokens_seen": 8151302, "step": 2965, "train_runtime": 7613.342, "train_tokens_per_second": 1070.66 }, { "epoch": 0.23833343377729566, "grad_norm": 0.2937847077846527, "learning_rate": 2.337228714524207e-06, "loss": 1.2896, "num_input_tokens_seen": 8154100, "step": 2966, "train_runtime": 7615.6077, "train_tokens_per_second": 1070.709 }, { "epoch": 0.23841378894714638, "grad_norm": 0.3713630139827728, "learning_rate": 2.270450751252087e-06, "loss": 0.9951, "num_input_tokens_seen": 8155920, "step": 2967, "train_runtime": 7617.3183, "train_tokens_per_second": 1070.708 }, { "epoch": 0.23849414411699713, "grad_norm": 0.33164307475090027, "learning_rate": 2.2036727879799665e-06, "loss": 0.903, "num_input_tokens_seen": 8159650, "step": 2968, "train_runtime": 7619.9835, "train_tokens_per_second": 1070.823 }, { "epoch": 0.23857449928684787, "grad_norm": 0.48896369338035583, "learning_rate": 2.1368948247078465e-06, "loss": 0.8399, "num_input_tokens_seen": 8162546, "step": 2969, "train_runtime": 7622.3141, "train_tokens_per_second": 1070.875 }, { "epoch": 0.2386548544566986, "grad_norm": 0.2850237190723419, "learning_rate": 2.0701168614357264e-06, "loss": 0.7736, "num_input_tokens_seen": 8165076, "step": 2970, "train_runtime": 7624.4194, "train_tokens_per_second": 1070.911 }, { "epoch": 0.23873520962654934, "grad_norm": 0.3177092969417572, "learning_rate": 2.003338898163606e-06, "loss": 0.9229, "num_input_tokens_seen": 8169654, "step": 2971, "train_runtime": 7629.6834, "train_tokens_per_second": 1070.772 }, { "epoch": 0.2388155647964001, "grad_norm": 0.32074159383773804, "learning_rate": 1.936560934891486e-06, "loss": 1.2391, "num_input_tokens_seen": 8172598, "step": 2972, "train_runtime": 7632.0303, "train_tokens_per_second": 1070.829 }, { "epoch": 0.23889591996625084, "grad_norm": 0.3533782660961151, "learning_rate": 1.8697829716193656e-06, "loss": 0.9408, "num_input_tokens_seen": 8175678, "step": 2973, "train_runtime": 7634.3486, "train_tokens_per_second": 1070.907 }, { "epoch": 0.23897627513610156, "grad_norm": 0.17639051377773285, "learning_rate": 1.8030050083472455e-06, "loss": 0.5982, "num_input_tokens_seen": 8179426, "step": 2974, "train_runtime": 7637.0742, "train_tokens_per_second": 1071.016 }, { "epoch": 0.2390566303059523, "grad_norm": 0.3037920892238617, "learning_rate": 1.7362270450751252e-06, "loss": 0.9133, "num_input_tokens_seen": 8181330, "step": 2975, "train_runtime": 7638.8352, "train_tokens_per_second": 1071.018 }, { "epoch": 0.23913698547580306, "grad_norm": 0.29526981711387634, "learning_rate": 1.669449081803005e-06, "loss": 1.0546, "num_input_tokens_seen": 8184290, "step": 2976, "train_runtime": 7641.1425, "train_tokens_per_second": 1071.082 }, { "epoch": 0.23921734064565378, "grad_norm": 0.2659931182861328, "learning_rate": 1.6026711185308849e-06, "loss": 0.6936, "num_input_tokens_seen": 8185886, "step": 2977, "train_runtime": 7642.7435, "train_tokens_per_second": 1071.066 }, { "epoch": 0.23929769581550453, "grad_norm": 0.2962379455566406, "learning_rate": 1.5358931552587648e-06, "loss": 1.0793, "num_input_tokens_seen": 8189026, "step": 2978, "train_runtime": 7645.1237, "train_tokens_per_second": 1071.144 }, { "epoch": 0.23937805098535528, "grad_norm": 0.2869679033756256, "learning_rate": 1.4691151919866445e-06, "loss": 0.8109, "num_input_tokens_seen": 8191782, "step": 2979, "train_runtime": 7647.2669, "train_tokens_per_second": 1071.204 }, { "epoch": 0.239458406155206, "grad_norm": 0.3432118594646454, "learning_rate": 1.4023372287145242e-06, "loss": 0.812, "num_input_tokens_seen": 8194612, "step": 2980, "train_runtime": 7649.4137, "train_tokens_per_second": 1071.273 }, { "epoch": 0.23953876132505675, "grad_norm": 0.32874420285224915, "learning_rate": 1.3355592654424042e-06, "loss": 1.0621, "num_input_tokens_seen": 8197462, "step": 2981, "train_runtime": 7651.6827, "train_tokens_per_second": 1071.328 }, { "epoch": 0.2396191164949075, "grad_norm": 0.29024678468704224, "learning_rate": 1.2687813021702839e-06, "loss": 1.039, "num_input_tokens_seen": 8201198, "step": 2982, "train_runtime": 7654.4315, "train_tokens_per_second": 1071.431 }, { "epoch": 0.23969947166475822, "grad_norm": 0.4135216772556305, "learning_rate": 1.2020033388981636e-06, "loss": 0.7295, "num_input_tokens_seen": 8204784, "step": 2983, "train_runtime": 7656.9932, "train_tokens_per_second": 1071.541 }, { "epoch": 0.23977982683460897, "grad_norm": 0.2965007722377777, "learning_rate": 1.1352253756260435e-06, "loss": 0.8961, "num_input_tokens_seen": 8208730, "step": 2984, "train_runtime": 7659.9785, "train_tokens_per_second": 1071.639 }, { "epoch": 0.23986018200445972, "grad_norm": 0.3110213577747345, "learning_rate": 1.0684474123539232e-06, "loss": 0.9759, "num_input_tokens_seen": 8212202, "step": 2985, "train_runtime": 7662.4615, "train_tokens_per_second": 1071.745 }, { "epoch": 0.23994053717431046, "grad_norm": 0.3023281693458557, "learning_rate": 1.001669449081803e-06, "loss": 0.8993, "num_input_tokens_seen": 8216986, "step": 2986, "train_runtime": 7665.8781, "train_tokens_per_second": 1071.891 }, { "epoch": 0.24002089234416119, "grad_norm": 0.2991240620613098, "learning_rate": 9.348914858096828e-07, "loss": 0.9214, "num_input_tokens_seen": 8219304, "step": 2987, "train_runtime": 7667.8302, "train_tokens_per_second": 1071.92 }, { "epoch": 0.24010124751401193, "grad_norm": 0.28949102759361267, "learning_rate": 8.681135225375626e-07, "loss": 0.829, "num_input_tokens_seen": 8222132, "step": 2988, "train_runtime": 7670.056, "train_tokens_per_second": 1071.978 }, { "epoch": 0.24018160268386268, "grad_norm": 0.27209827303886414, "learning_rate": 8.013355592654424e-07, "loss": 0.8092, "num_input_tokens_seen": 8224578, "step": 2989, "train_runtime": 7672.1561, "train_tokens_per_second": 1072.003 }, { "epoch": 0.2402619578537134, "grad_norm": 0.5143537521362305, "learning_rate": 7.345575959933223e-07, "loss": 1.0663, "num_input_tokens_seen": 8228546, "step": 2990, "train_runtime": 7674.9998, "train_tokens_per_second": 1072.123 }, { "epoch": 0.24034231302356415, "grad_norm": 0.3822253942489624, "learning_rate": 6.677796327212021e-07, "loss": 0.8202, "num_input_tokens_seen": 8231618, "step": 2991, "train_runtime": 7677.3573, "train_tokens_per_second": 1072.194 }, { "epoch": 0.2404226681934149, "grad_norm": 0.3168606162071228, "learning_rate": 6.010016694490818e-07, "loss": 0.9721, "num_input_tokens_seen": 8233942, "step": 2992, "train_runtime": 7679.363, "train_tokens_per_second": 1072.217 }, { "epoch": 0.24050302336326562, "grad_norm": 0.2644681930541992, "learning_rate": 5.342237061769616e-07, "loss": 1.1678, "num_input_tokens_seen": 8237552, "step": 2993, "train_runtime": 7681.9391, "train_tokens_per_second": 1072.327 }, { "epoch": 0.24058337853311637, "grad_norm": 0.3312743902206421, "learning_rate": 4.674457429048414e-07, "loss": 0.9957, "num_input_tokens_seen": 8239090, "step": 2994, "train_runtime": 7683.5754, "train_tokens_per_second": 1072.299 }, { "epoch": 0.24066373370296712, "grad_norm": 0.33308568596839905, "learning_rate": 4.006677796327212e-07, "loss": 0.8272, "num_input_tokens_seen": 8243064, "step": 2995, "train_runtime": 7686.5121, "train_tokens_per_second": 1072.406 }, { "epoch": 0.24074408887281787, "grad_norm": 0.3265121877193451, "learning_rate": 3.3388981636060104e-07, "loss": 0.8331, "num_input_tokens_seen": 8245414, "step": 2996, "train_runtime": 7688.5347, "train_tokens_per_second": 1072.43 }, { "epoch": 0.2408244440426686, "grad_norm": 0.33722981810569763, "learning_rate": 2.671118530884808e-07, "loss": 0.9718, "num_input_tokens_seen": 8248748, "step": 2997, "train_runtime": 7691.0796, "train_tokens_per_second": 1072.508 }, { "epoch": 0.24090479921251934, "grad_norm": 0.29454463720321655, "learning_rate": 2.003338898163606e-07, "loss": 0.9714, "num_input_tokens_seen": 8250556, "step": 2998, "train_runtime": 7692.8277, "train_tokens_per_second": 1072.5 }, { "epoch": 0.2409851543823701, "grad_norm": 0.33806341886520386, "learning_rate": 1.335559265442404e-07, "loss": 1.148, "num_input_tokens_seen": 8253372, "step": 2999, "train_runtime": 7695.0414, "train_tokens_per_second": 1072.557 }, { "epoch": 0.2410655095522208, "grad_norm": 0.28387361764907837, "learning_rate": 6.67779632721202e-08, "loss": 0.7471, "num_input_tokens_seen": 8256702, "step": 3000, "train_runtime": 7697.5834, "train_tokens_per_second": 1072.636 }, { "epoch": 0.2410655095522208, "eval_loss": 0.9442114233970642, "eval_runtime": 91.5536, "eval_samples_per_second": 10.857, "eval_steps_per_second": 5.429, "num_input_tokens_seen": 8256702, "step": 3000 } ], "logging_steps": 1, "max_steps": 3000, "num_input_tokens_seen": 8256702, "num_train_epochs": 1, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.5978029402170368e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }