{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 272, "global_step": 2719, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.000367816091954023, "grad_norm": 1.6896029710769653, "learning_rate": 0.0, "loss": 5.7428, "num_input_tokens_seen": 3536, "step": 1, "train_runtime": 4.3917, "train_tokens_per_second": 805.149 }, { "epoch": 0.000735632183908046, "grad_norm": 1.2463716268539429, "learning_rate": 4e-05, "loss": 4.9214, "num_input_tokens_seen": 10672, "step": 2, "train_runtime": 10.5288, "train_tokens_per_second": 1013.597 }, { "epoch": 0.001103448275862069, "grad_norm": 1.4572627544403076, "learning_rate": 8e-05, "loss": 5.5503, "num_input_tokens_seen": 14976, "step": 3, "train_runtime": 13.4789, "train_tokens_per_second": 1111.07 }, { "epoch": 0.001471264367816092, "grad_norm": 2.21268367767334, "learning_rate": 0.00012, "loss": 5.2587, "num_input_tokens_seen": 18768, "step": 4, "train_runtime": 16.172, "train_tokens_per_second": 1160.521 }, { "epoch": 0.0018390804597701149, "grad_norm": 1.9235576391220093, "learning_rate": 0.00016, "loss": 3.9436, "num_input_tokens_seen": 25744, "step": 5, "train_runtime": 20.5776, "train_tokens_per_second": 1251.07 }, { "epoch": 0.002206896551724138, "grad_norm": 2.0342299938201904, "learning_rate": 0.0002, "loss": 3.1697, "num_input_tokens_seen": 30800, "step": 6, "train_runtime": 23.8891, "train_tokens_per_second": 1289.288 }, { "epoch": 0.002574712643678161, "grad_norm": 1.2459954023361206, "learning_rate": 0.00019992630803242447, "loss": 2.8914, "num_input_tokens_seen": 36976, "step": 7, "train_runtime": 27.7393, "train_tokens_per_second": 1332.981 }, { "epoch": 0.002942528735632184, "grad_norm": 1.0456387996673584, "learning_rate": 0.00019985261606484894, "loss": 2.4046, "num_input_tokens_seen": 42256, "step": 8, "train_runtime": 31.2325, "train_tokens_per_second": 1352.949 }, { "epoch": 0.003310344827586207, "grad_norm": 0.9048787355422974, "learning_rate": 0.0001997789240972734, "loss": 2.3319, "num_input_tokens_seen": 46512, "step": 9, "train_runtime": 34.1051, "train_tokens_per_second": 1363.784 }, { "epoch": 0.0036781609195402297, "grad_norm": 0.9737868905067444, "learning_rate": 0.00019970523212969787, "loss": 2.0549, "num_input_tokens_seen": 49696, "step": 10, "train_runtime": 36.44, "train_tokens_per_second": 1363.775 }, { "epoch": 0.004045977011494253, "grad_norm": 0.6913642883300781, "learning_rate": 0.00019963154016212233, "loss": 1.8302, "num_input_tokens_seen": 55584, "step": 11, "train_runtime": 40.1665, "train_tokens_per_second": 1383.839 }, { "epoch": 0.004413793103448276, "grad_norm": 1.6613901853561401, "learning_rate": 0.00019955784819454683, "loss": 1.8091, "num_input_tokens_seen": 62592, "step": 12, "train_runtime": 44.641, "train_tokens_per_second": 1402.12 }, { "epoch": 0.0047816091954022985, "grad_norm": 0.4619045853614807, "learning_rate": 0.00019948415622697126, "loss": 1.6159, "num_input_tokens_seen": 66032, "step": 13, "train_runtime": 47.0748, "train_tokens_per_second": 1402.704 }, { "epoch": 0.005149425287356322, "grad_norm": 0.47745728492736816, "learning_rate": 0.00019941046425939573, "loss": 1.6412, "num_input_tokens_seen": 73744, "step": 14, "train_runtime": 51.9028, "train_tokens_per_second": 1420.81 }, { "epoch": 0.005517241379310344, "grad_norm": 0.4540255069732666, "learning_rate": 0.0001993367722918202, "loss": 1.6662, "num_input_tokens_seen": 77504, "step": 15, "train_runtime": 54.4595, "train_tokens_per_second": 1423.149 }, { "epoch": 0.005885057471264368, "grad_norm": 0.3938988745212555, "learning_rate": 0.00019926308032424468, "loss": 1.4674, "num_input_tokens_seen": 82928, "step": 16, "train_runtime": 58.0412, "train_tokens_per_second": 1428.777 }, { "epoch": 0.006252873563218391, "grad_norm": 0.39807504415512085, "learning_rate": 0.00019918938835666915, "loss": 1.3737, "num_input_tokens_seen": 86832, "step": 17, "train_runtime": 60.8146, "train_tokens_per_second": 1427.814 }, { "epoch": 0.006620689655172414, "grad_norm": 0.3505794107913971, "learning_rate": 0.0001991156963890936, "loss": 1.5536, "num_input_tokens_seen": 91056, "step": 18, "train_runtime": 63.7535, "train_tokens_per_second": 1428.252 }, { "epoch": 0.006988505747126437, "grad_norm": 0.3215710520744324, "learning_rate": 0.00019904200442151805, "loss": 1.4985, "num_input_tokens_seen": 97776, "step": 19, "train_runtime": 68.0162, "train_tokens_per_second": 1437.54 }, { "epoch": 0.0073563218390804595, "grad_norm": 0.29926809668540955, "learning_rate": 0.00019896831245394254, "loss": 1.546, "num_input_tokens_seen": 103888, "step": 20, "train_runtime": 71.8153, "train_tokens_per_second": 1446.599 }, { "epoch": 0.007724137931034483, "grad_norm": 0.28521886467933655, "learning_rate": 0.000198894620486367, "loss": 1.4762, "num_input_tokens_seen": 113280, "step": 21, "train_runtime": 77.4735, "train_tokens_per_second": 1462.177 }, { "epoch": 0.008091954022988505, "grad_norm": 0.3224157691001892, "learning_rate": 0.00019882092851879147, "loss": 1.5076, "num_input_tokens_seen": 117072, "step": 22, "train_runtime": 80.1039, "train_tokens_per_second": 1461.502 }, { "epoch": 0.00845977011494253, "grad_norm": 0.31227555871009827, "learning_rate": 0.0001987472365512159, "loss": 1.5553, "num_input_tokens_seen": 123536, "step": 23, "train_runtime": 84.2535, "train_tokens_per_second": 1466.241 }, { "epoch": 0.008827586206896552, "grad_norm": 0.39832526445388794, "learning_rate": 0.0001986735445836404, "loss": 1.4392, "num_input_tokens_seen": 127312, "step": 24, "train_runtime": 86.9827, "train_tokens_per_second": 1463.648 }, { "epoch": 0.009195402298850575, "grad_norm": 0.34754133224487305, "learning_rate": 0.00019859985261606487, "loss": 1.3843, "num_input_tokens_seen": 130896, "step": 25, "train_runtime": 89.569, "train_tokens_per_second": 1461.398 }, { "epoch": 0.009563218390804597, "grad_norm": 0.3295925259590149, "learning_rate": 0.00019852616064848933, "loss": 1.5071, "num_input_tokens_seen": 134416, "step": 26, "train_runtime": 92.054, "train_tokens_per_second": 1460.186 }, { "epoch": 0.009931034482758621, "grad_norm": 0.4134153127670288, "learning_rate": 0.00019845246868091377, "loss": 1.5796, "num_input_tokens_seen": 138304, "step": 27, "train_runtime": 94.8348, "train_tokens_per_second": 1458.368 }, { "epoch": 0.010298850574712644, "grad_norm": 0.3494221270084381, "learning_rate": 0.00019837877671333826, "loss": 1.6521, "num_input_tokens_seen": 146096, "step": 28, "train_runtime": 99.7402, "train_tokens_per_second": 1464.766 }, { "epoch": 0.010666666666666666, "grad_norm": 0.3704027235507965, "learning_rate": 0.00019830508474576273, "loss": 1.5089, "num_input_tokens_seen": 150480, "step": 29, "train_runtime": 102.7398, "train_tokens_per_second": 1464.671 }, { "epoch": 0.011034482758620689, "grad_norm": 0.4166102707386017, "learning_rate": 0.0001982313927781872, "loss": 1.3976, "num_input_tokens_seen": 154704, "step": 30, "train_runtime": 105.7012, "train_tokens_per_second": 1463.597 }, { "epoch": 0.011402298850574713, "grad_norm": 0.3029329180717468, "learning_rate": 0.00019815770081061166, "loss": 1.451, "num_input_tokens_seen": 162656, "step": 31, "train_runtime": 113.0576, "train_tokens_per_second": 1438.7 }, { "epoch": 0.011770114942528736, "grad_norm": 0.3309914171695709, "learning_rate": 0.00019808400884303612, "loss": 1.464, "num_input_tokens_seen": 169392, "step": 32, "train_runtime": 117.2968, "train_tokens_per_second": 1444.132 }, { "epoch": 0.012137931034482758, "grad_norm": 0.3266368806362152, "learning_rate": 0.0001980103168754606, "loss": 1.3301, "num_input_tokens_seen": 173984, "step": 33, "train_runtime": 120.3639, "train_tokens_per_second": 1445.483 }, { "epoch": 0.012505747126436782, "grad_norm": 0.3363005816936493, "learning_rate": 0.00019793662490788505, "loss": 1.3506, "num_input_tokens_seen": 179200, "step": 34, "train_runtime": 123.8413, "train_tokens_per_second": 1447.013 }, { "epoch": 0.012873563218390805, "grad_norm": 0.3295206129550934, "learning_rate": 0.00019786293294030952, "loss": 1.4824, "num_input_tokens_seen": 184384, "step": 35, "train_runtime": 127.2886, "train_tokens_per_second": 1448.551 }, { "epoch": 0.013241379310344827, "grad_norm": 0.31550225615501404, "learning_rate": 0.00019778924097273398, "loss": 1.3962, "num_input_tokens_seen": 190720, "step": 36, "train_runtime": 131.3805, "train_tokens_per_second": 1451.662 }, { "epoch": 0.01360919540229885, "grad_norm": 0.3353164792060852, "learning_rate": 0.00019771554900515845, "loss": 1.4282, "num_input_tokens_seen": 195200, "step": 37, "train_runtime": 134.4224, "train_tokens_per_second": 1452.139 }, { "epoch": 0.013977011494252874, "grad_norm": 0.3152875304222107, "learning_rate": 0.0001976418570375829, "loss": 1.4053, "num_input_tokens_seen": 199600, "step": 38, "train_runtime": 137.4833, "train_tokens_per_second": 1451.813 }, { "epoch": 0.014344827586206896, "grad_norm": 0.3619515597820282, "learning_rate": 0.00019756816507000738, "loss": 1.4137, "num_input_tokens_seen": 203696, "step": 39, "train_runtime": 140.2899, "train_tokens_per_second": 1451.965 }, { "epoch": 0.014712643678160919, "grad_norm": 0.3786216080188751, "learning_rate": 0.00019749447310243184, "loss": 1.4399, "num_input_tokens_seen": 209632, "step": 40, "train_runtime": 144.1946, "train_tokens_per_second": 1453.813 }, { "epoch": 0.015080459770114943, "grad_norm": 0.3696210980415344, "learning_rate": 0.0001974207811348563, "loss": 1.4629, "num_input_tokens_seen": 213136, "step": 41, "train_runtime": 146.7748, "train_tokens_per_second": 1452.129 }, { "epoch": 0.015448275862068966, "grad_norm": 0.3269001841545105, "learning_rate": 0.00019734708916728077, "loss": 1.465, "num_input_tokens_seen": 220544, "step": 42, "train_runtime": 151.4699, "train_tokens_per_second": 1456.025 }, { "epoch": 0.01581609195402299, "grad_norm": 0.33651697635650635, "learning_rate": 0.00019727339719970524, "loss": 1.3787, "num_input_tokens_seen": 224128, "step": 43, "train_runtime": 154.0748, "train_tokens_per_second": 1454.67 }, { "epoch": 0.01618390804597701, "grad_norm": 0.49768590927124023, "learning_rate": 0.00019719970523212973, "loss": 1.3881, "num_input_tokens_seen": 227808, "step": 44, "train_runtime": 156.7743, "train_tokens_per_second": 1453.095 }, { "epoch": 0.016551724137931035, "grad_norm": 0.3080534040927887, "learning_rate": 0.00019712601326455416, "loss": 1.3805, "num_input_tokens_seen": 232656, "step": 45, "train_runtime": 160.0058, "train_tokens_per_second": 1454.048 }, { "epoch": 0.01691954022988506, "grad_norm": 0.3345535397529602, "learning_rate": 0.00019705232129697863, "loss": 1.4768, "num_input_tokens_seen": 237120, "step": 46, "train_runtime": 163.0919, "train_tokens_per_second": 1453.904 }, { "epoch": 0.01728735632183908, "grad_norm": 0.34982284903526306, "learning_rate": 0.0001969786293294031, "loss": 1.4573, "num_input_tokens_seen": 241696, "step": 47, "train_runtime": 166.2746, "train_tokens_per_second": 1453.595 }, { "epoch": 0.017655172413793104, "grad_norm": 0.33389902114868164, "learning_rate": 0.00019690493736182759, "loss": 1.2849, "num_input_tokens_seen": 248656, "step": 48, "train_runtime": 170.7243, "train_tokens_per_second": 1456.477 }, { "epoch": 0.018022988505747125, "grad_norm": 0.3556322157382965, "learning_rate": 0.00019683124539425205, "loss": 1.4287, "num_input_tokens_seen": 252240, "step": 49, "train_runtime": 173.2828, "train_tokens_per_second": 1455.655 }, { "epoch": 0.01839080459770115, "grad_norm": 0.37753573060035706, "learning_rate": 0.0001967575534266765, "loss": 1.315, "num_input_tokens_seen": 256400, "step": 50, "train_runtime": 176.2014, "train_tokens_per_second": 1455.153 }, { "epoch": 0.018758620689655173, "grad_norm": 0.36437854170799255, "learning_rate": 0.00019668386145910095, "loss": 1.4924, "num_input_tokens_seen": 261280, "step": 51, "train_runtime": 179.5139, "train_tokens_per_second": 1455.486 }, { "epoch": 0.019126436781609194, "grad_norm": 0.30621838569641113, "learning_rate": 0.00019661016949152545, "loss": 1.3666, "num_input_tokens_seen": 267856, "step": 52, "train_runtime": 183.8031, "train_tokens_per_second": 1457.299 }, { "epoch": 0.01949425287356322, "grad_norm": 0.38290640711784363, "learning_rate": 0.0001965364775239499, "loss": 1.458, "num_input_tokens_seen": 272320, "step": 53, "train_runtime": 186.9012, "train_tokens_per_second": 1457.027 }, { "epoch": 0.019862068965517243, "grad_norm": 0.32105013728141785, "learning_rate": 0.00019646278555637438, "loss": 1.4186, "num_input_tokens_seen": 277392, "step": 54, "train_runtime": 190.3458, "train_tokens_per_second": 1457.306 }, { "epoch": 0.020229885057471263, "grad_norm": 0.3524461090564728, "learning_rate": 0.0001963890935887988, "loss": 1.4047, "num_input_tokens_seen": 280832, "step": 55, "train_runtime": 192.9167, "train_tokens_per_second": 1455.716 }, { "epoch": 0.020597701149425288, "grad_norm": 0.3453088402748108, "learning_rate": 0.0001963154016212233, "loss": 1.3904, "num_input_tokens_seen": 285504, "step": 56, "train_runtime": 196.0411, "train_tokens_per_second": 1456.347 }, { "epoch": 0.020965517241379312, "grad_norm": 0.3295742869377136, "learning_rate": 0.00019624170965364777, "loss": 1.278, "num_input_tokens_seen": 289984, "step": 57, "train_runtime": 199.0408, "train_tokens_per_second": 1456.907 }, { "epoch": 0.021333333333333333, "grad_norm": 0.3913592994213104, "learning_rate": 0.00019616801768607223, "loss": 1.405, "num_input_tokens_seen": 296512, "step": 58, "train_runtime": 203.198, "train_tokens_per_second": 1459.227 }, { "epoch": 0.021701149425287357, "grad_norm": 0.33533012866973877, "learning_rate": 0.00019609432571849667, "loss": 1.427, "num_input_tokens_seen": 300992, "step": 59, "train_runtime": 206.2951, "train_tokens_per_second": 1459.036 }, { "epoch": 0.022068965517241378, "grad_norm": 0.37227025628089905, "learning_rate": 0.00019602063375092116, "loss": 1.4043, "num_input_tokens_seen": 305952, "step": 60, "train_runtime": 209.6428, "train_tokens_per_second": 1459.396 }, { "epoch": 0.022436781609195402, "grad_norm": 0.35552677512168884, "learning_rate": 0.00019594694178334563, "loss": 1.4877, "num_input_tokens_seen": 314752, "step": 61, "train_runtime": 217.2613, "train_tokens_per_second": 1448.725 }, { "epoch": 0.022804597701149426, "grad_norm": 0.3486213684082031, "learning_rate": 0.0001958732498157701, "loss": 1.5117, "num_input_tokens_seen": 319488, "step": 62, "train_runtime": 220.4752, "train_tokens_per_second": 1449.088 }, { "epoch": 0.023172413793103447, "grad_norm": 0.3574698567390442, "learning_rate": 0.00019579955784819456, "loss": 1.4744, "num_input_tokens_seen": 324656, "step": 63, "train_runtime": 223.9049, "train_tokens_per_second": 1449.973 }, { "epoch": 0.02354022988505747, "grad_norm": 0.35368311405181885, "learning_rate": 0.00019572586588061902, "loss": 1.4704, "num_input_tokens_seen": 330208, "step": 64, "train_runtime": 227.6251, "train_tokens_per_second": 1450.666 }, { "epoch": 0.023908045977011495, "grad_norm": 0.3501671254634857, "learning_rate": 0.0001956521739130435, "loss": 1.5263, "num_input_tokens_seen": 334320, "step": 65, "train_runtime": 230.4913, "train_tokens_per_second": 1450.467 }, { "epoch": 0.024275862068965516, "grad_norm": 0.3009653389453888, "learning_rate": 0.00019557848194546795, "loss": 1.4436, "num_input_tokens_seen": 340592, "step": 66, "train_runtime": 234.5821, "train_tokens_per_second": 1451.91 }, { "epoch": 0.02464367816091954, "grad_norm": 0.3149993419647217, "learning_rate": 0.00019550478997789242, "loss": 1.4211, "num_input_tokens_seen": 345856, "step": 67, "train_runtime": 238.027, "train_tokens_per_second": 1453.012 }, { "epoch": 0.025011494252873565, "grad_norm": 0.38887569308280945, "learning_rate": 0.00019543109801031688, "loss": 1.5181, "num_input_tokens_seen": 349728, "step": 68, "train_runtime": 240.699, "train_tokens_per_second": 1452.968 }, { "epoch": 0.025379310344827585, "grad_norm": 0.3457549810409546, "learning_rate": 0.00019535740604274135, "loss": 1.3213, "num_input_tokens_seen": 354640, "step": 69, "train_runtime": 244.0063, "train_tokens_per_second": 1453.405 }, { "epoch": 0.02574712643678161, "grad_norm": 0.3572216033935547, "learning_rate": 0.0001952837140751658, "loss": 1.4212, "num_input_tokens_seen": 359808, "step": 70, "train_runtime": 247.5256, "train_tokens_per_second": 1453.619 }, { "epoch": 0.026114942528735634, "grad_norm": 0.3528576195240021, "learning_rate": 0.00019521002210759028, "loss": 1.5576, "num_input_tokens_seen": 363856, "step": 71, "train_runtime": 250.3053, "train_tokens_per_second": 1453.649 }, { "epoch": 0.026482758620689655, "grad_norm": 0.30931103229522705, "learning_rate": 0.00019513633014001477, "loss": 1.3123, "num_input_tokens_seen": 368320, "step": 72, "train_runtime": 253.4049, "train_tokens_per_second": 1453.484 }, { "epoch": 0.02685057471264368, "grad_norm": 0.31904783844947815, "learning_rate": 0.0001950626381724392, "loss": 1.3431, "num_input_tokens_seen": 372272, "step": 73, "train_runtime": 256.1682, "train_tokens_per_second": 1453.233 }, { "epoch": 0.0272183908045977, "grad_norm": 0.35796838998794556, "learning_rate": 0.00019498894620486367, "loss": 1.2837, "num_input_tokens_seen": 375664, "step": 74, "train_runtime": 258.6393, "train_tokens_per_second": 1452.463 }, { "epoch": 0.027586206896551724, "grad_norm": 0.3376178741455078, "learning_rate": 0.00019491525423728814, "loss": 1.4641, "num_input_tokens_seen": 379536, "step": 75, "train_runtime": 261.4376, "train_tokens_per_second": 1451.727 }, { "epoch": 0.027954022988505748, "grad_norm": 0.3116322457790375, "learning_rate": 0.00019484156226971263, "loss": 1.3307, "num_input_tokens_seen": 382944, "step": 76, "train_runtime": 263.8597, "train_tokens_per_second": 1451.317 }, { "epoch": 0.02832183908045977, "grad_norm": 0.290591299533844, "learning_rate": 0.00019476787030213707, "loss": 1.411, "num_input_tokens_seen": 387696, "step": 77, "train_runtime": 267.0011, "train_tokens_per_second": 1452.039 }, { "epoch": 0.028689655172413793, "grad_norm": 0.34067365527153015, "learning_rate": 0.00019469417833456153, "loss": 1.3646, "num_input_tokens_seen": 392016, "step": 78, "train_runtime": 269.9263, "train_tokens_per_second": 1452.307 }, { "epoch": 0.029057471264367817, "grad_norm": 0.31595438718795776, "learning_rate": 0.000194620486366986, "loss": 1.4867, "num_input_tokens_seen": 400864, "step": 79, "train_runtime": 275.3932, "train_tokens_per_second": 1455.606 }, { "epoch": 0.029425287356321838, "grad_norm": 0.3195711672306061, "learning_rate": 0.0001945467943994105, "loss": 1.4826, "num_input_tokens_seen": 406096, "step": 80, "train_runtime": 278.8267, "train_tokens_per_second": 1456.446 }, { "epoch": 0.029793103448275862, "grad_norm": 0.3230014443397522, "learning_rate": 0.00019447310243183495, "loss": 1.4192, "num_input_tokens_seen": 409888, "step": 81, "train_runtime": 281.5895, "train_tokens_per_second": 1455.623 }, { "epoch": 0.030160919540229886, "grad_norm": 0.3409586548805237, "learning_rate": 0.0001943994104642594, "loss": 1.3791, "num_input_tokens_seen": 415520, "step": 82, "train_runtime": 285.3375, "train_tokens_per_second": 1456.24 }, { "epoch": 0.030528735632183907, "grad_norm": 0.3579333424568176, "learning_rate": 0.00019432571849668386, "loss": 1.6083, "num_input_tokens_seen": 419472, "step": 83, "train_runtime": 288.0587, "train_tokens_per_second": 1456.203 }, { "epoch": 0.03089655172413793, "grad_norm": 0.3503994643688202, "learning_rate": 0.00019425202652910835, "loss": 1.279, "num_input_tokens_seen": 424192, "step": 84, "train_runtime": 291.3277, "train_tokens_per_second": 1456.065 }, { "epoch": 0.03126436781609195, "grad_norm": 0.3124304711818695, "learning_rate": 0.0001941783345615328, "loss": 1.2399, "num_input_tokens_seen": 428928, "step": 85, "train_runtime": 294.4718, "train_tokens_per_second": 1456.601 }, { "epoch": 0.03163218390804598, "grad_norm": 0.3414918780326843, "learning_rate": 0.00019410464259395728, "loss": 1.277, "num_input_tokens_seen": 433936, "step": 86, "train_runtime": 297.8887, "train_tokens_per_second": 1456.705 }, { "epoch": 0.032, "grad_norm": 0.3402044177055359, "learning_rate": 0.00019403095062638171, "loss": 1.3645, "num_input_tokens_seen": 439344, "step": 87, "train_runtime": 301.4631, "train_tokens_per_second": 1457.372 }, { "epoch": 0.03236781609195402, "grad_norm": 0.3228797912597656, "learning_rate": 0.0001939572586588062, "loss": 1.3342, "num_input_tokens_seen": 443456, "step": 88, "train_runtime": 304.3388, "train_tokens_per_second": 1457.113 }, { "epoch": 0.03273563218390805, "grad_norm": 0.362979531288147, "learning_rate": 0.00019388356669123067, "loss": 1.5969, "num_input_tokens_seen": 448336, "step": 89, "train_runtime": 307.7029, "train_tokens_per_second": 1457.042 }, { "epoch": 0.03310344827586207, "grad_norm": 0.31592848896980286, "learning_rate": 0.00019380987472365514, "loss": 1.3154, "num_input_tokens_seen": 452912, "step": 90, "train_runtime": 310.8176, "train_tokens_per_second": 1457.163 }, { "epoch": 0.03347126436781609, "grad_norm": 0.37438368797302246, "learning_rate": 0.0001937361827560796, "loss": 1.279, "num_input_tokens_seen": 458864, "step": 91, "train_runtime": 317.0511, "train_tokens_per_second": 1447.287 }, { "epoch": 0.03383908045977012, "grad_norm": 0.3996255695819855, "learning_rate": 0.00019366249078850407, "loss": 1.4509, "num_input_tokens_seen": 462208, "step": 92, "train_runtime": 319.4927, "train_tokens_per_second": 1446.693 }, { "epoch": 0.03420689655172414, "grad_norm": 0.35339540243148804, "learning_rate": 0.00019358879882092853, "loss": 1.315, "num_input_tokens_seen": 466336, "step": 93, "train_runtime": 322.2881, "train_tokens_per_second": 1446.954 }, { "epoch": 0.03457471264367816, "grad_norm": 0.33935806155204773, "learning_rate": 0.000193515106853353, "loss": 1.4, "num_input_tokens_seen": 473200, "step": 94, "train_runtime": 326.6885, "train_tokens_per_second": 1448.475 }, { "epoch": 0.03494252873563218, "grad_norm": 0.37198519706726074, "learning_rate": 0.00019344141488577746, "loss": 1.2492, "num_input_tokens_seen": 479120, "step": 95, "train_runtime": 330.6315, "train_tokens_per_second": 1449.106 }, { "epoch": 0.03531034482758621, "grad_norm": 0.3687741756439209, "learning_rate": 0.00019336772291820192, "loss": 1.377, "num_input_tokens_seen": 483088, "step": 96, "train_runtime": 333.422, "train_tokens_per_second": 1448.878 }, { "epoch": 0.03567816091954023, "grad_norm": 0.34657415747642517, "learning_rate": 0.0001932940309506264, "loss": 1.4442, "num_input_tokens_seen": 487088, "step": 97, "train_runtime": 336.2316, "train_tokens_per_second": 1448.668 }, { "epoch": 0.03604597701149425, "grad_norm": 0.3943544030189514, "learning_rate": 0.00019322033898305085, "loss": 1.3582, "num_input_tokens_seen": 490912, "step": 98, "train_runtime": 338.9424, "train_tokens_per_second": 1448.364 }, { "epoch": 0.03641379310344828, "grad_norm": 0.35165315866470337, "learning_rate": 0.00019314664701547532, "loss": 1.3541, "num_input_tokens_seen": 494032, "step": 99, "train_runtime": 341.2972, "train_tokens_per_second": 1447.513 }, { "epoch": 0.0367816091954023, "grad_norm": 0.35324153304100037, "learning_rate": 0.00019307295504789978, "loss": 1.4833, "num_input_tokens_seen": 502432, "step": 100, "train_runtime": 346.6342, "train_tokens_per_second": 1449.459 }, { "epoch": 0.03714942528735632, "grad_norm": 0.3213910460472107, "learning_rate": 0.00019299926308032425, "loss": 1.3556, "num_input_tokens_seen": 507248, "step": 101, "train_runtime": 349.8347, "train_tokens_per_second": 1449.965 }, { "epoch": 0.03751724137931035, "grad_norm": 0.3446355164051056, "learning_rate": 0.00019292557111274871, "loss": 1.3074, "num_input_tokens_seen": 510336, "step": 102, "train_runtime": 352.2047, "train_tokens_per_second": 1448.976 }, { "epoch": 0.03788505747126437, "grad_norm": 0.3802237808704376, "learning_rate": 0.00019285187914517318, "loss": 1.4042, "num_input_tokens_seen": 513392, "step": 103, "train_runtime": 354.5584, "train_tokens_per_second": 1447.976 }, { "epoch": 0.03825287356321839, "grad_norm": 0.3681686222553253, "learning_rate": 0.00019277818717759767, "loss": 1.3513, "num_input_tokens_seen": 517072, "step": 104, "train_runtime": 357.169, "train_tokens_per_second": 1447.696 }, { "epoch": 0.038620689655172416, "grad_norm": 0.3716645836830139, "learning_rate": 0.0001927044952100221, "loss": 1.3036, "num_input_tokens_seen": 521168, "step": 105, "train_runtime": 360.0461, "train_tokens_per_second": 1447.504 }, { "epoch": 0.03898850574712644, "grad_norm": 0.34930476546287537, "learning_rate": 0.00019263080324244657, "loss": 1.3586, "num_input_tokens_seen": 524528, "step": 106, "train_runtime": 362.559, "train_tokens_per_second": 1446.738 }, { "epoch": 0.03935632183908046, "grad_norm": 0.3603226840496063, "learning_rate": 0.00019255711127487104, "loss": 1.4267, "num_input_tokens_seen": 528400, "step": 107, "train_runtime": 365.3047, "train_tokens_per_second": 1446.464 }, { "epoch": 0.039724137931034485, "grad_norm": 0.3882533609867096, "learning_rate": 0.00019248341930729553, "loss": 1.364, "num_input_tokens_seen": 531488, "step": 108, "train_runtime": 367.6695, "train_tokens_per_second": 1445.559 }, { "epoch": 0.040091954022988506, "grad_norm": 0.3208283483982086, "learning_rate": 0.00019240972733971997, "loss": 1.4234, "num_input_tokens_seen": 537232, "step": 109, "train_runtime": 371.4983, "train_tokens_per_second": 1446.123 }, { "epoch": 0.04045977011494253, "grad_norm": 0.37671953439712524, "learning_rate": 0.00019233603537214443, "loss": 1.3872, "num_input_tokens_seen": 541552, "step": 110, "train_runtime": 374.5105, "train_tokens_per_second": 1446.026 }, { "epoch": 0.040827586206896554, "grad_norm": 0.36036062240600586, "learning_rate": 0.0001922623434045689, "loss": 1.2919, "num_input_tokens_seen": 547280, "step": 111, "train_runtime": 378.2819, "train_tokens_per_second": 1446.752 }, { "epoch": 0.041195402298850575, "grad_norm": 0.4014540910720825, "learning_rate": 0.0001921886514369934, "loss": 1.4405, "num_input_tokens_seen": 550816, "step": 112, "train_runtime": 380.8525, "train_tokens_per_second": 1446.271 }, { "epoch": 0.041563218390804596, "grad_norm": 0.3496030271053314, "learning_rate": 0.00019211495946941785, "loss": 1.3179, "num_input_tokens_seen": 555056, "step": 113, "train_runtime": 383.6774, "train_tokens_per_second": 1446.674 }, { "epoch": 0.041931034482758624, "grad_norm": 0.318844199180603, "learning_rate": 0.0001920412675018423, "loss": 1.2955, "num_input_tokens_seen": 559472, "step": 114, "train_runtime": 386.6985, "train_tokens_per_second": 1446.791 }, { "epoch": 0.042298850574712644, "grad_norm": 0.35854312777519226, "learning_rate": 0.00019196757553426676, "loss": 1.284, "num_input_tokens_seen": 562672, "step": 115, "train_runtime": 389.1303, "train_tokens_per_second": 1445.973 }, { "epoch": 0.042666666666666665, "grad_norm": 0.41531145572662354, "learning_rate": 0.00019189388356669125, "loss": 1.4152, "num_input_tokens_seen": 568096, "step": 116, "train_runtime": 392.6683, "train_tokens_per_second": 1446.758 }, { "epoch": 0.04303448275862069, "grad_norm": 0.3431352972984314, "learning_rate": 0.0001918201915991157, "loss": 1.4023, "num_input_tokens_seen": 571680, "step": 117, "train_runtime": 395.3275, "train_tokens_per_second": 1446.092 }, { "epoch": 0.043402298850574714, "grad_norm": 0.35485905408859253, "learning_rate": 0.00019174649963154018, "loss": 1.4465, "num_input_tokens_seen": 576048, "step": 118, "train_runtime": 398.2846, "train_tokens_per_second": 1446.322 }, { "epoch": 0.043770114942528734, "grad_norm": 0.3515053391456604, "learning_rate": 0.00019167280766396462, "loss": 1.3382, "num_input_tokens_seen": 579824, "step": 119, "train_runtime": 400.9737, "train_tokens_per_second": 1446.04 }, { "epoch": 0.044137931034482755, "grad_norm": 0.35786688327789307, "learning_rate": 0.0001915991156963891, "loss": 1.3336, "num_input_tokens_seen": 585760, "step": 120, "train_runtime": 404.9769, "train_tokens_per_second": 1446.403 }, { "epoch": 0.04450574712643678, "grad_norm": 0.33091384172439575, "learning_rate": 0.00019152542372881357, "loss": 1.3462, "num_input_tokens_seen": 589200, "step": 121, "train_runtime": 409.5632, "train_tokens_per_second": 1438.606 }, { "epoch": 0.044873563218390804, "grad_norm": 0.3029051423072815, "learning_rate": 0.00019145173176123804, "loss": 1.4302, "num_input_tokens_seen": 595152, "step": 122, "train_runtime": 413.4911, "train_tokens_per_second": 1439.334 }, { "epoch": 0.045241379310344824, "grad_norm": 0.3376113176345825, "learning_rate": 0.0001913780397936625, "loss": 1.3544, "num_input_tokens_seen": 599360, "step": 123, "train_runtime": 416.3831, "train_tokens_per_second": 1439.444 }, { "epoch": 0.04560919540229885, "grad_norm": 0.33625632524490356, "learning_rate": 0.00019130434782608697, "loss": 1.4003, "num_input_tokens_seen": 603616, "step": 124, "train_runtime": 419.2971, "train_tokens_per_second": 1439.59 }, { "epoch": 0.04597701149425287, "grad_norm": 0.40393340587615967, "learning_rate": 0.00019123065585851143, "loss": 1.4769, "num_input_tokens_seen": 609008, "step": 125, "train_runtime": 422.8715, "train_tokens_per_second": 1440.173 }, { "epoch": 0.046344827586206894, "grad_norm": 0.3525630831718445, "learning_rate": 0.0001911569638909359, "loss": 1.2941, "num_input_tokens_seen": 613712, "step": 126, "train_runtime": 426.0505, "train_tokens_per_second": 1440.468 }, { "epoch": 0.04671264367816092, "grad_norm": 0.3761114478111267, "learning_rate": 0.00019108327192336036, "loss": 1.2634, "num_input_tokens_seen": 618240, "step": 127, "train_runtime": 429.1152, "train_tokens_per_second": 1440.732 }, { "epoch": 0.04708045977011494, "grad_norm": 0.35774338245391846, "learning_rate": 0.00019100957995578483, "loss": 1.2951, "num_input_tokens_seen": 627248, "step": 128, "train_runtime": 434.7159, "train_tokens_per_second": 1442.892 }, { "epoch": 0.04744827586206896, "grad_norm": 0.3444937765598297, "learning_rate": 0.0001909358879882093, "loss": 1.1266, "num_input_tokens_seen": 631424, "step": 129, "train_runtime": 437.6847, "train_tokens_per_second": 1442.646 }, { "epoch": 0.04781609195402299, "grad_norm": 0.3678358793258667, "learning_rate": 0.00019086219602063376, "loss": 1.4521, "num_input_tokens_seen": 636256, "step": 130, "train_runtime": 440.9446, "train_tokens_per_second": 1442.939 }, { "epoch": 0.04818390804597701, "grad_norm": 0.32934266328811646, "learning_rate": 0.00019078850405305825, "loss": 1.1365, "num_input_tokens_seen": 640400, "step": 131, "train_runtime": 443.8612, "train_tokens_per_second": 1442.793 }, { "epoch": 0.04855172413793103, "grad_norm": 0.3722214996814728, "learning_rate": 0.00019071481208548269, "loss": 1.4527, "num_input_tokens_seen": 644416, "step": 132, "train_runtime": 446.6875, "train_tokens_per_second": 1442.655 }, { "epoch": 0.04891954022988506, "grad_norm": 0.4163220226764679, "learning_rate": 0.00019064112011790715, "loss": 1.4116, "num_input_tokens_seen": 648288, "step": 133, "train_runtime": 449.4526, "train_tokens_per_second": 1442.395 }, { "epoch": 0.04928735632183908, "grad_norm": 0.3490603566169739, "learning_rate": 0.00019056742815033162, "loss": 1.3319, "num_input_tokens_seen": 652416, "step": 134, "train_runtime": 452.3438, "train_tokens_per_second": 1442.301 }, { "epoch": 0.0496551724137931, "grad_norm": 0.34180787205696106, "learning_rate": 0.0001904937361827561, "loss": 1.2957, "num_input_tokens_seen": 657360, "step": 135, "train_runtime": 455.6559, "train_tokens_per_second": 1442.667 }, { "epoch": 0.05002298850574713, "grad_norm": 0.36564236879348755, "learning_rate": 0.00019042004421518057, "loss": 1.2748, "num_input_tokens_seen": 661840, "step": 136, "train_runtime": 458.7545, "train_tokens_per_second": 1442.689 }, { "epoch": 0.05039080459770115, "grad_norm": 0.3804440200328827, "learning_rate": 0.000190346352247605, "loss": 1.3977, "num_input_tokens_seen": 665712, "step": 137, "train_runtime": 461.5453, "train_tokens_per_second": 1442.355 }, { "epoch": 0.05075862068965517, "grad_norm": 0.3501209318637848, "learning_rate": 0.00019027266028002947, "loss": 1.4359, "num_input_tokens_seen": 668976, "step": 138, "train_runtime": 463.9435, "train_tokens_per_second": 1441.934 }, { "epoch": 0.0511264367816092, "grad_norm": 0.42087605595588684, "learning_rate": 0.00019019896831245397, "loss": 1.2101, "num_input_tokens_seen": 672672, "step": 139, "train_runtime": 466.5359, "train_tokens_per_second": 1441.844 }, { "epoch": 0.05149425287356322, "grad_norm": 0.3437168300151825, "learning_rate": 0.00019012527634487843, "loss": 1.4146, "num_input_tokens_seen": 676944, "step": 140, "train_runtime": 469.4428, "train_tokens_per_second": 1442.016 }, { "epoch": 0.05186206896551724, "grad_norm": 0.37178879976272583, "learning_rate": 0.0001900515843773029, "loss": 1.3036, "num_input_tokens_seen": 683776, "step": 141, "train_runtime": 473.8884, "train_tokens_per_second": 1442.905 }, { "epoch": 0.05222988505747127, "grad_norm": 0.41747716069221497, "learning_rate": 0.00018997789240972733, "loss": 1.2937, "num_input_tokens_seen": 689152, "step": 142, "train_runtime": 477.4701, "train_tokens_per_second": 1443.341 }, { "epoch": 0.05259770114942529, "grad_norm": 0.3657858669757843, "learning_rate": 0.00018990420044215183, "loss": 1.2967, "num_input_tokens_seen": 692880, "step": 143, "train_runtime": 480.1332, "train_tokens_per_second": 1443.1 }, { "epoch": 0.05296551724137931, "grad_norm": 0.353496253490448, "learning_rate": 0.0001898305084745763, "loss": 1.3631, "num_input_tokens_seen": 697040, "step": 144, "train_runtime": 483.115, "train_tokens_per_second": 1442.803 }, { "epoch": 0.05333333333333334, "grad_norm": 0.3528427183628082, "learning_rate": 0.00018975681650700076, "loss": 1.4055, "num_input_tokens_seen": 704880, "step": 145, "train_runtime": 488.0491, "train_tokens_per_second": 1444.281 }, { "epoch": 0.05370114942528736, "grad_norm": 0.362886518239975, "learning_rate": 0.0001896831245394252, "loss": 1.3992, "num_input_tokens_seen": 709392, "step": 146, "train_runtime": 491.1384, "train_tokens_per_second": 1444.383 }, { "epoch": 0.05406896551724138, "grad_norm": 0.34845200181007385, "learning_rate": 0.00018960943257184968, "loss": 1.3727, "num_input_tokens_seen": 713856, "step": 147, "train_runtime": 494.1905, "train_tokens_per_second": 1444.496 }, { "epoch": 0.0544367816091954, "grad_norm": 0.3569094240665436, "learning_rate": 0.00018953574060427415, "loss": 1.3373, "num_input_tokens_seen": 717872, "step": 148, "train_runtime": 497.0183, "train_tokens_per_second": 1444.357 }, { "epoch": 0.05480459770114943, "grad_norm": 0.36434394121170044, "learning_rate": 0.00018946204863669861, "loss": 1.2812, "num_input_tokens_seen": 722768, "step": 149, "train_runtime": 500.211, "train_tokens_per_second": 1444.926 }, { "epoch": 0.05517241379310345, "grad_norm": 0.3712742030620575, "learning_rate": 0.00018938835666912308, "loss": 1.3474, "num_input_tokens_seen": 729504, "step": 150, "train_runtime": 504.5186, "train_tokens_per_second": 1445.941 }, { "epoch": 0.05554022988505747, "grad_norm": 0.3964684009552002, "learning_rate": 0.00018931466470154754, "loss": 1.4236, "num_input_tokens_seen": 733488, "step": 151, "train_runtime": 509.5647, "train_tokens_per_second": 1439.44 }, { "epoch": 0.055908045977011496, "grad_norm": 0.3355660140514374, "learning_rate": 0.000189240972733972, "loss": 1.3053, "num_input_tokens_seen": 737424, "step": 152, "train_runtime": 512.2659, "train_tokens_per_second": 1439.534 }, { "epoch": 0.05627586206896552, "grad_norm": 0.40488651394844055, "learning_rate": 0.00018916728076639647, "loss": 1.2128, "num_input_tokens_seen": 741600, "step": 153, "train_runtime": 515.1577, "train_tokens_per_second": 1439.559 }, { "epoch": 0.05664367816091954, "grad_norm": 0.3622351884841919, "learning_rate": 0.00018909358879882094, "loss": 1.2979, "num_input_tokens_seen": 746752, "step": 154, "train_runtime": 518.5181, "train_tokens_per_second": 1440.166 }, { "epoch": 0.057011494252873565, "grad_norm": 0.3706391751766205, "learning_rate": 0.0001890198968312454, "loss": 1.2089, "num_input_tokens_seen": 750496, "step": 155, "train_runtime": 521.1917, "train_tokens_per_second": 1439.962 }, { "epoch": 0.057379310344827586, "grad_norm": 0.4029405117034912, "learning_rate": 0.00018894620486366987, "loss": 1.2611, "num_input_tokens_seen": 754064, "step": 156, "train_runtime": 523.798, "train_tokens_per_second": 1439.608 }, { "epoch": 0.05774712643678161, "grad_norm": 0.38390249013900757, "learning_rate": 0.00018887251289609433, "loss": 1.3915, "num_input_tokens_seen": 757776, "step": 157, "train_runtime": 526.5468, "train_tokens_per_second": 1439.143 }, { "epoch": 0.058114942528735634, "grad_norm": 0.36949944496154785, "learning_rate": 0.0001887988209285188, "loss": 1.1603, "num_input_tokens_seen": 761584, "step": 158, "train_runtime": 529.2233, "train_tokens_per_second": 1439.06 }, { "epoch": 0.058482758620689655, "grad_norm": 0.4374903738498688, "learning_rate": 0.00018872512896094326, "loss": 1.3452, "num_input_tokens_seen": 765376, "step": 159, "train_runtime": 531.9152, "train_tokens_per_second": 1438.906 }, { "epoch": 0.058850574712643676, "grad_norm": 0.3176044821739197, "learning_rate": 0.00018865143699336773, "loss": 1.275, "num_input_tokens_seen": 770336, "step": 160, "train_runtime": 535.2815, "train_tokens_per_second": 1439.123 }, { "epoch": 0.059218390804597704, "grad_norm": 0.34038686752319336, "learning_rate": 0.0001885777450257922, "loss": 1.2403, "num_input_tokens_seen": 775664, "step": 161, "train_runtime": 538.7396, "train_tokens_per_second": 1439.775 }, { "epoch": 0.059586206896551724, "grad_norm": 0.32963263988494873, "learning_rate": 0.00018850405305821666, "loss": 1.331, "num_input_tokens_seen": 781216, "step": 162, "train_runtime": 542.4392, "train_tokens_per_second": 1440.191 }, { "epoch": 0.059954022988505745, "grad_norm": 0.3501686751842499, "learning_rate": 0.00018843036109064115, "loss": 1.3088, "num_input_tokens_seen": 785248, "step": 163, "train_runtime": 545.2676, "train_tokens_per_second": 1440.115 }, { "epoch": 0.06032183908045977, "grad_norm": 0.35881733894348145, "learning_rate": 0.0001883566691230656, "loss": 1.5079, "num_input_tokens_seen": 788960, "step": 164, "train_runtime": 547.9221, "train_tokens_per_second": 1439.913 }, { "epoch": 0.060689655172413794, "grad_norm": 0.33264872431755066, "learning_rate": 0.00018828297715549005, "loss": 1.1775, "num_input_tokens_seen": 798256, "step": 165, "train_runtime": 553.7521, "train_tokens_per_second": 1441.54 }, { "epoch": 0.061057471264367814, "grad_norm": 0.3732989728450775, "learning_rate": 0.00018820928518791452, "loss": 1.4259, "num_input_tokens_seen": 801872, "step": 166, "train_runtime": 556.2786, "train_tokens_per_second": 1441.493 }, { "epoch": 0.06142528735632184, "grad_norm": 0.3586452007293701, "learning_rate": 0.000188135593220339, "loss": 1.3993, "num_input_tokens_seen": 804960, "step": 167, "train_runtime": 558.6359, "train_tokens_per_second": 1440.939 }, { "epoch": 0.06179310344827586, "grad_norm": 0.3551160991191864, "learning_rate": 0.00018806190125276347, "loss": 1.3561, "num_input_tokens_seen": 809408, "step": 168, "train_runtime": 561.6759, "train_tokens_per_second": 1441.059 }, { "epoch": 0.062160919540229884, "grad_norm": 0.42596322298049927, "learning_rate": 0.0001879882092851879, "loss": 1.4839, "num_input_tokens_seen": 814688, "step": 169, "train_runtime": 565.2366, "train_tokens_per_second": 1441.322 }, { "epoch": 0.0625287356321839, "grad_norm": 0.33639150857925415, "learning_rate": 0.00018791451731761238, "loss": 1.2385, "num_input_tokens_seen": 823520, "step": 170, "train_runtime": 570.7503, "train_tokens_per_second": 1442.873 }, { "epoch": 0.06289655172413793, "grad_norm": 0.3430693447589874, "learning_rate": 0.00018784082535003687, "loss": 1.3859, "num_input_tokens_seen": 827872, "step": 171, "train_runtime": 573.7823, "train_tokens_per_second": 1442.833 }, { "epoch": 0.06326436781609196, "grad_norm": 0.3821863532066345, "learning_rate": 0.00018776713338246133, "loss": 1.4072, "num_input_tokens_seen": 832000, "step": 172, "train_runtime": 576.7272, "train_tokens_per_second": 1442.623 }, { "epoch": 0.06363218390804598, "grad_norm": 0.3700842261314392, "learning_rate": 0.0001876934414148858, "loss": 1.401, "num_input_tokens_seen": 838384, "step": 173, "train_runtime": 580.8296, "train_tokens_per_second": 1443.425 }, { "epoch": 0.064, "grad_norm": 0.3754938840866089, "learning_rate": 0.00018761974944731024, "loss": 1.3558, "num_input_tokens_seen": 842000, "step": 174, "train_runtime": 583.4802, "train_tokens_per_second": 1443.065 }, { "epoch": 0.06436781609195402, "grad_norm": 0.32714033126831055, "learning_rate": 0.00018754605747973473, "loss": 1.3782, "num_input_tokens_seen": 848800, "step": 175, "train_runtime": 587.9049, "train_tokens_per_second": 1443.771 }, { "epoch": 0.06473563218390804, "grad_norm": 0.3436740040779114, "learning_rate": 0.0001874723655121592, "loss": 1.4766, "num_input_tokens_seen": 855120, "step": 176, "train_runtime": 591.9989, "train_tokens_per_second": 1444.462 }, { "epoch": 0.06510344827586206, "grad_norm": 0.37590697407722473, "learning_rate": 0.00018739867354458366, "loss": 1.4055, "num_input_tokens_seen": 858960, "step": 177, "train_runtime": 594.7385, "train_tokens_per_second": 1444.265 }, { "epoch": 0.0654712643678161, "grad_norm": 0.36898568272590637, "learning_rate": 0.0001873249815770081, "loss": 1.3238, "num_input_tokens_seen": 864256, "step": 178, "train_runtime": 598.3052, "train_tokens_per_second": 1444.507 }, { "epoch": 0.06583908045977012, "grad_norm": 0.32526057958602905, "learning_rate": 0.00018725128960943259, "loss": 1.2297, "num_input_tokens_seen": 870912, "step": 179, "train_runtime": 602.5428, "train_tokens_per_second": 1445.394 }, { "epoch": 0.06620689655172414, "grad_norm": 0.34319373965263367, "learning_rate": 0.00018717759764185705, "loss": 1.3742, "num_input_tokens_seen": 874720, "step": 180, "train_runtime": 605.2113, "train_tokens_per_second": 1445.313 }, { "epoch": 0.06657471264367816, "grad_norm": 0.30405378341674805, "learning_rate": 0.00018710390567428152, "loss": 1.1638, "num_input_tokens_seen": 882656, "step": 181, "train_runtime": 612.2259, "train_tokens_per_second": 1441.716 }, { "epoch": 0.06694252873563218, "grad_norm": 0.3960118293762207, "learning_rate": 0.00018703021370670598, "loss": 1.2142, "num_input_tokens_seen": 887728, "step": 182, "train_runtime": 615.6804, "train_tokens_per_second": 1441.865 }, { "epoch": 0.0673103448275862, "grad_norm": 0.36837369203567505, "learning_rate": 0.00018695652173913045, "loss": 1.4049, "num_input_tokens_seen": 893824, "step": 183, "train_runtime": 619.6219, "train_tokens_per_second": 1442.531 }, { "epoch": 0.06767816091954024, "grad_norm": 0.3938405513763428, "learning_rate": 0.0001868828297715549, "loss": 1.3685, "num_input_tokens_seen": 898352, "step": 184, "train_runtime": 622.6986, "train_tokens_per_second": 1442.675 }, { "epoch": 0.06804597701149426, "grad_norm": 0.35122594237327576, "learning_rate": 0.00018680913780397938, "loss": 1.1811, "num_input_tokens_seen": 901744, "step": 185, "train_runtime": 625.1633, "train_tokens_per_second": 1442.413 }, { "epoch": 0.06841379310344828, "grad_norm": 0.38768187165260315, "learning_rate": 0.00018673544583640384, "loss": 1.4322, "num_input_tokens_seen": 906928, "step": 186, "train_runtime": 628.5985, "train_tokens_per_second": 1442.778 }, { "epoch": 0.0687816091954023, "grad_norm": 0.3452443778514862, "learning_rate": 0.0001866617538688283, "loss": 1.3319, "num_input_tokens_seen": 912016, "step": 187, "train_runtime": 632.0175, "train_tokens_per_second": 1443.023 }, { "epoch": 0.06914942528735632, "grad_norm": 0.33809736371040344, "learning_rate": 0.00018658806190125277, "loss": 1.3433, "num_input_tokens_seen": 918256, "step": 188, "train_runtime": 636.0156, "train_tokens_per_second": 1443.763 }, { "epoch": 0.06951724137931034, "grad_norm": 0.35644927620887756, "learning_rate": 0.00018651436993367723, "loss": 1.3148, "num_input_tokens_seen": 922656, "step": 189, "train_runtime": 639.0061, "train_tokens_per_second": 1443.892 }, { "epoch": 0.06988505747126436, "grad_norm": 0.34792211651802063, "learning_rate": 0.0001864406779661017, "loss": 1.323, "num_input_tokens_seen": 926560, "step": 190, "train_runtime": 641.8039, "train_tokens_per_second": 1443.681 }, { "epoch": 0.0702528735632184, "grad_norm": 0.3884986340999603, "learning_rate": 0.0001863669859985262, "loss": 1.2509, "num_input_tokens_seen": 931408, "step": 191, "train_runtime": 645.0317, "train_tokens_per_second": 1443.972 }, { "epoch": 0.07062068965517242, "grad_norm": 0.37056735157966614, "learning_rate": 0.00018629329403095063, "loss": 1.3281, "num_input_tokens_seen": 936560, "step": 192, "train_runtime": 648.4631, "train_tokens_per_second": 1444.277 }, { "epoch": 0.07098850574712644, "grad_norm": 0.32564520835876465, "learning_rate": 0.0001862196020633751, "loss": 1.3638, "num_input_tokens_seen": 944752, "step": 193, "train_runtime": 653.5674, "train_tokens_per_second": 1445.531 }, { "epoch": 0.07135632183908046, "grad_norm": 0.37514346837997437, "learning_rate": 0.00018614591009579956, "loss": 1.319, "num_input_tokens_seen": 948752, "step": 194, "train_runtime": 656.4037, "train_tokens_per_second": 1445.379 }, { "epoch": 0.07172413793103448, "grad_norm": 0.4033873975276947, "learning_rate": 0.00018607221812822405, "loss": 1.2798, "num_input_tokens_seen": 953440, "step": 195, "train_runtime": 659.5663, "train_tokens_per_second": 1445.556 }, { "epoch": 0.0720919540229885, "grad_norm": 0.3493629992008209, "learning_rate": 0.0001859985261606485, "loss": 1.2205, "num_input_tokens_seen": 959104, "step": 196, "train_runtime": 663.291, "train_tokens_per_second": 1445.978 }, { "epoch": 0.07245977011494253, "grad_norm": 0.3406820297241211, "learning_rate": 0.00018592483419307295, "loss": 1.3426, "num_input_tokens_seen": 964304, "step": 197, "train_runtime": 666.7029, "train_tokens_per_second": 1446.377 }, { "epoch": 0.07282758620689656, "grad_norm": 0.3422794044017792, "learning_rate": 0.00018585114222549742, "loss": 1.2411, "num_input_tokens_seen": 967392, "step": 198, "train_runtime": 669.0131, "train_tokens_per_second": 1445.999 }, { "epoch": 0.07319540229885058, "grad_norm": 0.4126717448234558, "learning_rate": 0.0001857774502579219, "loss": 1.5401, "num_input_tokens_seen": 971648, "step": 199, "train_runtime": 671.9361, "train_tokens_per_second": 1446.042 }, { "epoch": 0.0735632183908046, "grad_norm": 0.45348045229911804, "learning_rate": 0.00018570375829034637, "loss": 1.2581, "num_input_tokens_seen": 975040, "step": 200, "train_runtime": 674.4174, "train_tokens_per_second": 1445.752 }, { "epoch": 0.07393103448275862, "grad_norm": 0.3561207056045532, "learning_rate": 0.0001856300663227708, "loss": 1.3483, "num_input_tokens_seen": 980496, "step": 201, "train_runtime": 678.0653, "train_tokens_per_second": 1446.02 }, { "epoch": 0.07429885057471264, "grad_norm": 0.3428356945514679, "learning_rate": 0.00018555637435519528, "loss": 1.4107, "num_input_tokens_seen": 984352, "step": 202, "train_runtime": 680.8003, "train_tokens_per_second": 1445.875 }, { "epoch": 0.07466666666666667, "grad_norm": 0.3632093667984009, "learning_rate": 0.00018548268238761977, "loss": 1.4813, "num_input_tokens_seen": 989776, "step": 203, "train_runtime": 684.3976, "train_tokens_per_second": 1446.2 }, { "epoch": 0.0750344827586207, "grad_norm": 0.3488505780696869, "learning_rate": 0.00018540899042004423, "loss": 1.1855, "num_input_tokens_seen": 993376, "step": 204, "train_runtime": 686.9903, "train_tokens_per_second": 1445.983 }, { "epoch": 0.07540229885057471, "grad_norm": 0.3393392264842987, "learning_rate": 0.0001853352984524687, "loss": 1.4086, "num_input_tokens_seen": 997376, "step": 205, "train_runtime": 689.8343, "train_tokens_per_second": 1445.82 }, { "epoch": 0.07577011494252874, "grad_norm": 0.34985506534576416, "learning_rate": 0.00018526160648489314, "loss": 1.2578, "num_input_tokens_seen": 1001456, "step": 206, "train_runtime": 692.7212, "train_tokens_per_second": 1445.684 }, { "epoch": 0.07613793103448276, "grad_norm": 0.3500637114048004, "learning_rate": 0.00018518791451731763, "loss": 1.2264, "num_input_tokens_seen": 1009216, "step": 207, "train_runtime": 697.551, "train_tokens_per_second": 1446.799 }, { "epoch": 0.07650574712643678, "grad_norm": 0.38763341307640076, "learning_rate": 0.0001851142225497421, "loss": 1.515, "num_input_tokens_seen": 1014288, "step": 208, "train_runtime": 701.0069, "train_tokens_per_second": 1446.902 }, { "epoch": 0.07687356321839081, "grad_norm": 0.34014877676963806, "learning_rate": 0.00018504053058216656, "loss": 1.2957, "num_input_tokens_seen": 1018640, "step": 209, "train_runtime": 704.0858, "train_tokens_per_second": 1446.756 }, { "epoch": 0.07724137931034483, "grad_norm": 0.41478997468948364, "learning_rate": 0.00018496683861459102, "loss": 1.3014, "num_input_tokens_seen": 1022784, "step": 210, "train_runtime": 706.9888, "train_tokens_per_second": 1446.676 }, { "epoch": 0.07760919540229885, "grad_norm": 0.3496479392051697, "learning_rate": 0.0001848931466470155, "loss": 1.3461, "num_input_tokens_seen": 1027360, "step": 211, "train_runtime": 711.8041, "train_tokens_per_second": 1443.318 }, { "epoch": 0.07797701149425287, "grad_norm": 0.3588869571685791, "learning_rate": 0.00018481945467943995, "loss": 1.4353, "num_input_tokens_seen": 1033456, "step": 212, "train_runtime": 715.6723, "train_tokens_per_second": 1444.035 }, { "epoch": 0.0783448275862069, "grad_norm": 0.35271963477134705, "learning_rate": 0.00018474576271186442, "loss": 1.0946, "num_input_tokens_seen": 1036304, "step": 213, "train_runtime": 717.8905, "train_tokens_per_second": 1443.54 }, { "epoch": 0.07871264367816092, "grad_norm": 0.39200204610824585, "learning_rate": 0.00018467207074428888, "loss": 1.15, "num_input_tokens_seen": 1039936, "step": 214, "train_runtime": 720.4172, "train_tokens_per_second": 1443.519 }, { "epoch": 0.07908045977011494, "grad_norm": 0.4076039791107178, "learning_rate": 0.00018459837877671335, "loss": 1.3758, "num_input_tokens_seen": 1045536, "step": 215, "train_runtime": 724.1097, "train_tokens_per_second": 1443.892 }, { "epoch": 0.07944827586206897, "grad_norm": 0.37207478284835815, "learning_rate": 0.0001845246868091378, "loss": 1.3664, "num_input_tokens_seen": 1049056, "step": 216, "train_runtime": 726.6894, "train_tokens_per_second": 1443.61 }, { "epoch": 0.07981609195402299, "grad_norm": 0.3728545904159546, "learning_rate": 0.00018445099484156228, "loss": 1.3072, "num_input_tokens_seen": 1052304, "step": 217, "train_runtime": 729.0769, "train_tokens_per_second": 1443.338 }, { "epoch": 0.08018390804597701, "grad_norm": 0.3534899652004242, "learning_rate": 0.00018437730287398674, "loss": 1.2736, "num_input_tokens_seen": 1057936, "step": 218, "train_runtime": 732.8309, "train_tokens_per_second": 1443.629 }, { "epoch": 0.08055172413793103, "grad_norm": 0.3420320749282837, "learning_rate": 0.0001843036109064112, "loss": 1.2494, "num_input_tokens_seen": 1061312, "step": 219, "train_runtime": 735.2926, "train_tokens_per_second": 1443.387 }, { "epoch": 0.08091954022988505, "grad_norm": 0.34126317501068115, "learning_rate": 0.00018422991893883567, "loss": 1.257, "num_input_tokens_seen": 1066144, "step": 220, "train_runtime": 738.6091, "train_tokens_per_second": 1443.448 }, { "epoch": 0.08128735632183907, "grad_norm": 0.34283459186553955, "learning_rate": 0.00018415622697126014, "loss": 1.1256, "num_input_tokens_seen": 1071584, "step": 221, "train_runtime": 742.1626, "train_tokens_per_second": 1443.867 }, { "epoch": 0.08165517241379311, "grad_norm": 0.33624303340911865, "learning_rate": 0.0001840825350036846, "loss": 1.1587, "num_input_tokens_seen": 1076064, "step": 222, "train_runtime": 745.1788, "train_tokens_per_second": 1444.035 }, { "epoch": 0.08202298850574713, "grad_norm": 0.3778267800807953, "learning_rate": 0.0001840088430361091, "loss": 1.2877, "num_input_tokens_seen": 1079504, "step": 223, "train_runtime": 747.7495, "train_tokens_per_second": 1443.671 }, { "epoch": 0.08239080459770115, "grad_norm": 0.37978050112724304, "learning_rate": 0.00018393515106853353, "loss": 1.425, "num_input_tokens_seen": 1084768, "step": 224, "train_runtime": 751.1746, "train_tokens_per_second": 1444.096 }, { "epoch": 0.08275862068965517, "grad_norm": 0.36541327834129333, "learning_rate": 0.000183861459100958, "loss": 1.2708, "num_input_tokens_seen": 1088720, "step": 225, "train_runtime": 753.9348, "train_tokens_per_second": 1444.051 }, { "epoch": 0.08312643678160919, "grad_norm": 0.31823718547821045, "learning_rate": 0.00018378776713338246, "loss": 1.3592, "num_input_tokens_seen": 1093152, "step": 226, "train_runtime": 757.0196, "train_tokens_per_second": 1444.021 }, { "epoch": 0.08349425287356321, "grad_norm": 0.35182780027389526, "learning_rate": 0.00018371407516580695, "loss": 1.3989, "num_input_tokens_seen": 1097904, "step": 227, "train_runtime": 760.2168, "train_tokens_per_second": 1444.199 }, { "epoch": 0.08386206896551725, "grad_norm": 0.3908786475658417, "learning_rate": 0.0001836403831982314, "loss": 1.1939, "num_input_tokens_seen": 1101776, "step": 228, "train_runtime": 762.9056, "train_tokens_per_second": 1444.184 }, { "epoch": 0.08422988505747127, "grad_norm": 0.3624025285243988, "learning_rate": 0.00018356669123065585, "loss": 1.3764, "num_input_tokens_seen": 1108368, "step": 229, "train_runtime": 767.1154, "train_tokens_per_second": 1444.852 }, { "epoch": 0.08459770114942529, "grad_norm": 0.41629868745803833, "learning_rate": 0.00018349299926308032, "loss": 1.2741, "num_input_tokens_seen": 1111984, "step": 230, "train_runtime": 769.7166, "train_tokens_per_second": 1444.667 }, { "epoch": 0.08496551724137931, "grad_norm": 0.39580047130584717, "learning_rate": 0.0001834193072955048, "loss": 1.4093, "num_input_tokens_seen": 1117008, "step": 231, "train_runtime": 773.035, "train_tokens_per_second": 1444.964 }, { "epoch": 0.08533333333333333, "grad_norm": 0.3515931963920593, "learning_rate": 0.00018334561532792928, "loss": 1.2854, "num_input_tokens_seen": 1120448, "step": 232, "train_runtime": 775.5121, "train_tokens_per_second": 1444.785 }, { "epoch": 0.08570114942528735, "grad_norm": 0.34929874539375305, "learning_rate": 0.00018327192336035371, "loss": 1.2306, "num_input_tokens_seen": 1124304, "step": 233, "train_runtime": 778.2103, "train_tokens_per_second": 1444.73 }, { "epoch": 0.08606896551724139, "grad_norm": 0.3431086540222168, "learning_rate": 0.00018319823139277818, "loss": 1.3612, "num_input_tokens_seen": 1130192, "step": 234, "train_runtime": 782.0628, "train_tokens_per_second": 1445.142 }, { "epoch": 0.0864367816091954, "grad_norm": 0.3813183605670929, "learning_rate": 0.00018312453942520267, "loss": 1.2279, "num_input_tokens_seen": 1135392, "step": 235, "train_runtime": 785.5012, "train_tokens_per_second": 1445.436 }, { "epoch": 0.08680459770114943, "grad_norm": 0.44352656602859497, "learning_rate": 0.00018305084745762714, "loss": 1.3339, "num_input_tokens_seen": 1139280, "step": 236, "train_runtime": 788.2441, "train_tokens_per_second": 1445.339 }, { "epoch": 0.08717241379310345, "grad_norm": 0.38422566652297974, "learning_rate": 0.0001829771554900516, "loss": 1.2985, "num_input_tokens_seen": 1143744, "step": 237, "train_runtime": 791.3359, "train_tokens_per_second": 1445.333 }, { "epoch": 0.08754022988505747, "grad_norm": 0.3571647107601166, "learning_rate": 0.00018290346352247604, "loss": 1.4091, "num_input_tokens_seen": 1148784, "step": 238, "train_runtime": 794.709, "train_tokens_per_second": 1445.54 }, { "epoch": 0.08790804597701149, "grad_norm": 0.4143889844417572, "learning_rate": 0.00018282977155490053, "loss": 1.3371, "num_input_tokens_seen": 1153568, "step": 239, "train_runtime": 797.9099, "train_tokens_per_second": 1445.737 }, { "epoch": 0.08827586206896551, "grad_norm": 0.399534672498703, "learning_rate": 0.000182756079587325, "loss": 1.2132, "num_input_tokens_seen": 1158576, "step": 240, "train_runtime": 801.2734, "train_tokens_per_second": 1445.919 }, { "epoch": 0.08864367816091955, "grad_norm": 0.36167678236961365, "learning_rate": 0.00018268238761974946, "loss": 1.2518, "num_input_tokens_seen": 1163104, "step": 241, "train_runtime": 806.239, "train_tokens_per_second": 1442.629 }, { "epoch": 0.08901149425287357, "grad_norm": 0.32895228266716003, "learning_rate": 0.00018260869565217392, "loss": 1.3456, "num_input_tokens_seen": 1171792, "step": 242, "train_runtime": 811.5482, "train_tokens_per_second": 1443.897 }, { "epoch": 0.08937931034482759, "grad_norm": 0.3777807354927063, "learning_rate": 0.0001825350036845984, "loss": 1.3755, "num_input_tokens_seen": 1175696, "step": 243, "train_runtime": 814.3467, "train_tokens_per_second": 1443.729 }, { "epoch": 0.08974712643678161, "grad_norm": 0.39932459592819214, "learning_rate": 0.00018246131171702285, "loss": 1.3449, "num_input_tokens_seen": 1179888, "step": 244, "train_runtime": 817.3093, "train_tokens_per_second": 1443.625 }, { "epoch": 0.09011494252873563, "grad_norm": 0.4072055518627167, "learning_rate": 0.00018238761974944732, "loss": 1.5742, "num_input_tokens_seen": 1185408, "step": 245, "train_runtime": 820.9659, "train_tokens_per_second": 1443.919 }, { "epoch": 0.09048275862068965, "grad_norm": 0.31552496552467346, "learning_rate": 0.00018231392778187178, "loss": 1.3173, "num_input_tokens_seen": 1188960, "step": 246, "train_runtime": 823.5105, "train_tokens_per_second": 1443.77 }, { "epoch": 0.09085057471264368, "grad_norm": 0.3510066866874695, "learning_rate": 0.00018224023581429625, "loss": 1.46, "num_input_tokens_seen": 1192240, "step": 247, "train_runtime": 825.9115, "train_tokens_per_second": 1443.544 }, { "epoch": 0.0912183908045977, "grad_norm": 0.3247656226158142, "learning_rate": 0.0001821665438467207, "loss": 1.3657, "num_input_tokens_seen": 1196592, "step": 248, "train_runtime": 828.9675, "train_tokens_per_second": 1443.473 }, { "epoch": 0.09158620689655173, "grad_norm": 0.4057351350784302, "learning_rate": 0.00018209285187914518, "loss": 1.451, "num_input_tokens_seen": 1200816, "step": 249, "train_runtime": 831.8998, "train_tokens_per_second": 1443.462 }, { "epoch": 0.09195402298850575, "grad_norm": 0.31586751341819763, "learning_rate": 0.00018201915991156964, "loss": 1.2866, "num_input_tokens_seen": 1205264, "step": 250, "train_runtime": 834.9428, "train_tokens_per_second": 1443.529 }, { "epoch": 0.09232183908045977, "grad_norm": 0.35121411085128784, "learning_rate": 0.0001819454679439941, "loss": 1.4238, "num_input_tokens_seen": 1208912, "step": 251, "train_runtime": 837.6257, "train_tokens_per_second": 1443.26 }, { "epoch": 0.09268965517241379, "grad_norm": 0.39062920212745667, "learning_rate": 0.00018187177597641857, "loss": 1.3669, "num_input_tokens_seen": 1212624, "step": 252, "train_runtime": 840.3025, "train_tokens_per_second": 1443.08 }, { "epoch": 0.09305747126436782, "grad_norm": 0.32011306285858154, "learning_rate": 0.00018179808400884304, "loss": 1.2237, "num_input_tokens_seen": 1217712, "step": 253, "train_runtime": 843.6832, "train_tokens_per_second": 1443.329 }, { "epoch": 0.09342528735632184, "grad_norm": 0.3875138461589813, "learning_rate": 0.00018172439204126753, "loss": 1.4564, "num_input_tokens_seen": 1223008, "step": 254, "train_runtime": 847.2923, "train_tokens_per_second": 1443.431 }, { "epoch": 0.09379310344827586, "grad_norm": 0.3403080999851227, "learning_rate": 0.000181650700073692, "loss": 1.3242, "num_input_tokens_seen": 1226864, "step": 255, "train_runtime": 849.9705, "train_tokens_per_second": 1443.419 }, { "epoch": 0.09416091954022988, "grad_norm": 0.36226019263267517, "learning_rate": 0.00018157700810611643, "loss": 1.2468, "num_input_tokens_seen": 1235056, "step": 256, "train_runtime": 855.0662, "train_tokens_per_second": 1444.398 }, { "epoch": 0.0945287356321839, "grad_norm": 0.377728670835495, "learning_rate": 0.0001815033161385409, "loss": 1.3328, "num_input_tokens_seen": 1240816, "step": 257, "train_runtime": 858.8108, "train_tokens_per_second": 1444.807 }, { "epoch": 0.09489655172413793, "grad_norm": 0.380744069814682, "learning_rate": 0.0001814296241709654, "loss": 1.2312, "num_input_tokens_seen": 1244576, "step": 258, "train_runtime": 861.483, "train_tokens_per_second": 1444.69 }, { "epoch": 0.09526436781609196, "grad_norm": 0.3609914481639862, "learning_rate": 0.00018135593220338985, "loss": 1.3088, "num_input_tokens_seen": 1248608, "step": 259, "train_runtime": 864.353, "train_tokens_per_second": 1444.558 }, { "epoch": 0.09563218390804598, "grad_norm": 0.35212814807891846, "learning_rate": 0.00018128224023581432, "loss": 1.3645, "num_input_tokens_seen": 1252336, "step": 260, "train_runtime": 867.1025, "train_tokens_per_second": 1444.277 }, { "epoch": 0.096, "grad_norm": 0.30638137459754944, "learning_rate": 0.00018120854826823876, "loss": 1.4044, "num_input_tokens_seen": 1261744, "step": 261, "train_runtime": 872.8491, "train_tokens_per_second": 1445.547 }, { "epoch": 0.09636781609195402, "grad_norm": 0.3573840856552124, "learning_rate": 0.00018113485630066325, "loss": 1.2195, "num_input_tokens_seen": 1265440, "step": 262, "train_runtime": 875.5308, "train_tokens_per_second": 1445.34 }, { "epoch": 0.09673563218390804, "grad_norm": 0.3774884343147278, "learning_rate": 0.0001810611643330877, "loss": 1.3894, "num_input_tokens_seen": 1269168, "step": 263, "train_runtime": 878.2173, "train_tokens_per_second": 1445.164 }, { "epoch": 0.09710344827586206, "grad_norm": 0.410137802362442, "learning_rate": 0.00018098747236551218, "loss": 1.2193, "num_input_tokens_seen": 1274224, "step": 264, "train_runtime": 881.5883, "train_tokens_per_second": 1445.373 }, { "epoch": 0.09747126436781609, "grad_norm": 0.3597395420074463, "learning_rate": 0.00018091378039793662, "loss": 1.3967, "num_input_tokens_seen": 1278160, "step": 265, "train_runtime": 884.3763, "train_tokens_per_second": 1445.267 }, { "epoch": 0.09783908045977012, "grad_norm": 0.3798868656158447, "learning_rate": 0.0001808400884303611, "loss": 1.3412, "num_input_tokens_seen": 1282352, "step": 266, "train_runtime": 887.2775, "train_tokens_per_second": 1445.266 }, { "epoch": 0.09820689655172414, "grad_norm": 0.3923279345035553, "learning_rate": 0.00018076639646278557, "loss": 1.346, "num_input_tokens_seen": 1287392, "step": 267, "train_runtime": 890.7253, "train_tokens_per_second": 1445.33 }, { "epoch": 0.09857471264367816, "grad_norm": 0.41670191287994385, "learning_rate": 0.00018069270449521004, "loss": 1.2068, "num_input_tokens_seen": 1290848, "step": 268, "train_runtime": 893.2523, "train_tokens_per_second": 1445.11 }, { "epoch": 0.09894252873563218, "grad_norm": 0.3499112129211426, "learning_rate": 0.0001806190125276345, "loss": 1.1829, "num_input_tokens_seen": 1295056, "step": 269, "train_runtime": 896.1665, "train_tokens_per_second": 1445.106 }, { "epoch": 0.0993103448275862, "grad_norm": 0.3606136441230774, "learning_rate": 0.00018054532056005897, "loss": 1.3168, "num_input_tokens_seen": 1300800, "step": 270, "train_runtime": 899.9738, "train_tokens_per_second": 1445.375 }, { "epoch": 0.09967816091954022, "grad_norm": 0.3754916191101074, "learning_rate": 0.00018047162859248343, "loss": 1.4176, "num_input_tokens_seen": 1304848, "step": 271, "train_runtime": 904.7959, "train_tokens_per_second": 1442.146 }, { "epoch": 0.10004597701149426, "grad_norm": 0.40887537598609924, "learning_rate": 0.0001803979366249079, "loss": 1.5235, "num_input_tokens_seen": 1309296, "step": 272, "train_runtime": 907.8267, "train_tokens_per_second": 1442.231 }, { "epoch": 0.10004597701149426, "eval_loss": 1.3052144050598145, "eval_runtime": 15.5033, "eval_samples_per_second": 64.503, "eval_steps_per_second": 4.064, "num_input_tokens_seen": 1309296, "step": 272 }, { "epoch": 0.10041379310344828, "grad_norm": 0.4006941318511963, "learning_rate": 0.00018032424465733236, "loss": 1.2035, "num_input_tokens_seen": 1313280, "step": 273, "train_runtime": 926.1272, "train_tokens_per_second": 1418.034 }, { "epoch": 0.1007816091954023, "grad_norm": 0.3529790937900543, "learning_rate": 0.00018025055268975683, "loss": 1.2604, "num_input_tokens_seen": 1318528, "step": 274, "train_runtime": 929.6168, "train_tokens_per_second": 1418.356 }, { "epoch": 0.10114942528735632, "grad_norm": 0.403448224067688, "learning_rate": 0.0001801768607221813, "loss": 1.34, "num_input_tokens_seen": 1323008, "step": 275, "train_runtime": 932.6673, "train_tokens_per_second": 1418.521 }, { "epoch": 0.10151724137931034, "grad_norm": 0.34158387780189514, "learning_rate": 0.00018010316875460576, "loss": 1.3079, "num_input_tokens_seen": 1327296, "step": 276, "train_runtime": 935.6092, "train_tokens_per_second": 1418.644 }, { "epoch": 0.10188505747126436, "grad_norm": 0.3838740885257721, "learning_rate": 0.00018002947678703022, "loss": 1.4125, "num_input_tokens_seen": 1332400, "step": 277, "train_runtime": 939.0933, "train_tokens_per_second": 1418.815 }, { "epoch": 0.1022528735632184, "grad_norm": 0.3493935763835907, "learning_rate": 0.00017995578481945468, "loss": 1.2636, "num_input_tokens_seen": 1340480, "step": 278, "train_runtime": 944.1631, "train_tokens_per_second": 1419.755 }, { "epoch": 0.10262068965517242, "grad_norm": 0.3681679666042328, "learning_rate": 0.00017988209285187915, "loss": 1.3285, "num_input_tokens_seen": 1344400, "step": 279, "train_runtime": 946.8945, "train_tokens_per_second": 1419.799 }, { "epoch": 0.10298850574712644, "grad_norm": 0.3373294472694397, "learning_rate": 0.00017980840088430361, "loss": 1.3849, "num_input_tokens_seen": 1348496, "step": 280, "train_runtime": 949.8071, "train_tokens_per_second": 1419.758 }, { "epoch": 0.10335632183908046, "grad_norm": 0.32788580656051636, "learning_rate": 0.00017973470891672808, "loss": 1.2813, "num_input_tokens_seen": 1357056, "step": 281, "train_runtime": 955.1543, "train_tokens_per_second": 1420.771 }, { "epoch": 0.10372413793103448, "grad_norm": 0.3648260831832886, "learning_rate": 0.00017966101694915257, "loss": 1.17, "num_input_tokens_seen": 1362240, "step": 282, "train_runtime": 958.7496, "train_tokens_per_second": 1420.851 }, { "epoch": 0.1040919540229885, "grad_norm": 0.3272045850753784, "learning_rate": 0.000179587324981577, "loss": 1.2861, "num_input_tokens_seen": 1369136, "step": 283, "train_runtime": 963.1842, "train_tokens_per_second": 1421.469 }, { "epoch": 0.10445977011494254, "grad_norm": 0.4226033091545105, "learning_rate": 0.00017951363301400147, "loss": 1.4487, "num_input_tokens_seen": 1374848, "step": 284, "train_runtime": 966.9991, "train_tokens_per_second": 1421.768 }, { "epoch": 0.10482758620689656, "grad_norm": 0.3636164665222168, "learning_rate": 0.00017943994104642594, "loss": 1.3257, "num_input_tokens_seen": 1379760, "step": 285, "train_runtime": 970.2296, "train_tokens_per_second": 1422.096 }, { "epoch": 0.10519540229885058, "grad_norm": 0.3344646394252777, "learning_rate": 0.00017936624907885043, "loss": 1.4043, "num_input_tokens_seen": 1385920, "step": 286, "train_runtime": 974.1866, "train_tokens_per_second": 1422.643 }, { "epoch": 0.1055632183908046, "grad_norm": 0.35804253816604614, "learning_rate": 0.0001792925571112749, "loss": 1.3529, "num_input_tokens_seen": 1389824, "step": 287, "train_runtime": 976.8889, "train_tokens_per_second": 1422.704 }, { "epoch": 0.10593103448275862, "grad_norm": 0.36252444982528687, "learning_rate": 0.00017921886514369933, "loss": 1.3426, "num_input_tokens_seen": 1395008, "step": 288, "train_runtime": 980.2779, "train_tokens_per_second": 1423.074 }, { "epoch": 0.10629885057471264, "grad_norm": 0.41811102628707886, "learning_rate": 0.0001791451731761238, "loss": 1.4098, "num_input_tokens_seen": 1403952, "step": 289, "train_runtime": 985.7571, "train_tokens_per_second": 1424.237 }, { "epoch": 0.10666666666666667, "grad_norm": 0.41715559363365173, "learning_rate": 0.0001790714812085483, "loss": 1.3552, "num_input_tokens_seen": 1408304, "step": 290, "train_runtime": 988.6836, "train_tokens_per_second": 1424.423 }, { "epoch": 0.1070344827586207, "grad_norm": 0.4006524682044983, "learning_rate": 0.00017899778924097275, "loss": 1.3274, "num_input_tokens_seen": 1413904, "step": 291, "train_runtime": 992.4063, "train_tokens_per_second": 1424.723 }, { "epoch": 0.10740229885057472, "grad_norm": 0.37396982312202454, "learning_rate": 0.00017892409727339722, "loss": 1.2964, "num_input_tokens_seen": 1422160, "step": 292, "train_runtime": 997.5305, "train_tokens_per_second": 1425.681 }, { "epoch": 0.10777011494252874, "grad_norm": 0.3324640691280365, "learning_rate": 0.00017885040530582166, "loss": 1.2427, "num_input_tokens_seen": 1425712, "step": 293, "train_runtime": 1000.0263, "train_tokens_per_second": 1425.674 }, { "epoch": 0.10813793103448276, "grad_norm": 0.33719897270202637, "learning_rate": 0.00017877671333824615, "loss": 1.3184, "num_input_tokens_seen": 1430064, "step": 294, "train_runtime": 1002.9771, "train_tokens_per_second": 1425.819 }, { "epoch": 0.10850574712643678, "grad_norm": 0.3992919623851776, "learning_rate": 0.00017870302137067061, "loss": 1.2449, "num_input_tokens_seen": 1433520, "step": 295, "train_runtime": 1005.4712, "train_tokens_per_second": 1425.72 }, { "epoch": 0.1088735632183908, "grad_norm": 0.4201892614364624, "learning_rate": 0.00017862932940309508, "loss": 1.2702, "num_input_tokens_seen": 1438624, "step": 296, "train_runtime": 1008.8583, "train_tokens_per_second": 1425.992 }, { "epoch": 0.10924137931034483, "grad_norm": 0.4159906506538391, "learning_rate": 0.00017855563743551952, "loss": 1.4088, "num_input_tokens_seen": 1443616, "step": 297, "train_runtime": 1012.2013, "train_tokens_per_second": 1426.214 }, { "epoch": 0.10960919540229885, "grad_norm": 0.35260722041130066, "learning_rate": 0.000178481945467944, "loss": 1.3253, "num_input_tokens_seen": 1449504, "step": 298, "train_runtime": 1015.9359, "train_tokens_per_second": 1426.767 }, { "epoch": 0.10997701149425287, "grad_norm": 0.3388993740081787, "learning_rate": 0.00017840825350036847, "loss": 1.4653, "num_input_tokens_seen": 1454432, "step": 299, "train_runtime": 1019.1331, "train_tokens_per_second": 1427.127 }, { "epoch": 0.1103448275862069, "grad_norm": 0.3940805494785309, "learning_rate": 0.00017833456153279294, "loss": 1.2955, "num_input_tokens_seen": 1459664, "step": 300, "train_runtime": 1022.638, "train_tokens_per_second": 1427.352 }, { "epoch": 0.11071264367816092, "grad_norm": 0.3170969486236572, "learning_rate": 0.0001782608695652174, "loss": 1.1511, "num_input_tokens_seen": 1462800, "step": 301, "train_runtime": 1026.9756, "train_tokens_per_second": 1424.377 }, { "epoch": 0.11108045977011494, "grad_norm": 0.3472290337085724, "learning_rate": 0.00017818717759764187, "loss": 1.2986, "num_input_tokens_seen": 1468608, "step": 302, "train_runtime": 1030.7486, "train_tokens_per_second": 1424.798 }, { "epoch": 0.11144827586206897, "grad_norm": 0.33495432138442993, "learning_rate": 0.00017811348563006633, "loss": 1.2575, "num_input_tokens_seen": 1472784, "step": 303, "train_runtime": 1033.6794, "train_tokens_per_second": 1424.798 }, { "epoch": 0.11181609195402299, "grad_norm": 0.36378833651542664, "learning_rate": 0.0001780397936624908, "loss": 1.1909, "num_input_tokens_seen": 1477312, "step": 304, "train_runtime": 1036.7518, "train_tokens_per_second": 1424.943 }, { "epoch": 0.11218390804597701, "grad_norm": 0.3660285770893097, "learning_rate": 0.00017796610169491526, "loss": 1.2604, "num_input_tokens_seen": 1484480, "step": 305, "train_runtime": 1041.3434, "train_tokens_per_second": 1425.543 }, { "epoch": 0.11255172413793103, "grad_norm": 0.3172094523906708, "learning_rate": 0.00017789240972733973, "loss": 1.2402, "num_input_tokens_seen": 1494912, "step": 306, "train_runtime": 1047.642, "train_tokens_per_second": 1426.93 }, { "epoch": 0.11291954022988505, "grad_norm": 0.3556981384754181, "learning_rate": 0.0001778187177597642, "loss": 1.2463, "num_input_tokens_seen": 1503152, "step": 307, "train_runtime": 1052.8105, "train_tokens_per_second": 1427.752 }, { "epoch": 0.11328735632183908, "grad_norm": 0.37304648756980896, "learning_rate": 0.00017774502579218866, "loss": 1.2684, "num_input_tokens_seen": 1511104, "step": 308, "train_runtime": 1057.7744, "train_tokens_per_second": 1428.569 }, { "epoch": 0.11365517241379311, "grad_norm": 0.36995697021484375, "learning_rate": 0.00017767133382461312, "loss": 1.227, "num_input_tokens_seen": 1514752, "step": 309, "train_runtime": 1060.3849, "train_tokens_per_second": 1428.493 }, { "epoch": 0.11402298850574713, "grad_norm": 0.3357091546058655, "learning_rate": 0.0001775976418570376, "loss": 1.2474, "num_input_tokens_seen": 1520704, "step": 310, "train_runtime": 1064.2988, "train_tokens_per_second": 1428.832 }, { "epoch": 0.11439080459770115, "grad_norm": 0.32784029841423035, "learning_rate": 0.00017752394988946205, "loss": 1.1841, "num_input_tokens_seen": 1524512, "step": 311, "train_runtime": 1067.0563, "train_tokens_per_second": 1428.708 }, { "epoch": 0.11475862068965517, "grad_norm": 0.3780510723590851, "learning_rate": 0.00017745025792188652, "loss": 1.0959, "num_input_tokens_seen": 1529264, "step": 312, "train_runtime": 1070.2708, "train_tokens_per_second": 1428.857 }, { "epoch": 0.11512643678160919, "grad_norm": 0.37813234329223633, "learning_rate": 0.00017737656595431098, "loss": 1.2165, "num_input_tokens_seen": 1537888, "step": 313, "train_runtime": 1075.614, "train_tokens_per_second": 1429.777 }, { "epoch": 0.11549425287356321, "grad_norm": 0.3664109706878662, "learning_rate": 0.00017730287398673547, "loss": 1.3155, "num_input_tokens_seen": 1544080, "step": 314, "train_runtime": 1079.6735, "train_tokens_per_second": 1430.136 }, { "epoch": 0.11586206896551725, "grad_norm": 0.32953914999961853, "learning_rate": 0.0001772291820191599, "loss": 1.3003, "num_input_tokens_seen": 1548144, "step": 315, "train_runtime": 1082.5469, "train_tokens_per_second": 1430.094 }, { "epoch": 0.11622988505747127, "grad_norm": 0.32690170407295227, "learning_rate": 0.00017715549005158438, "loss": 1.3154, "num_input_tokens_seen": 1553200, "step": 316, "train_runtime": 1086.0107, "train_tokens_per_second": 1430.188 }, { "epoch": 0.11659770114942529, "grad_norm": 0.3233182728290558, "learning_rate": 0.00017708179808400884, "loss": 1.2467, "num_input_tokens_seen": 1558304, "step": 317, "train_runtime": 1089.4037, "train_tokens_per_second": 1430.419 }, { "epoch": 0.11696551724137931, "grad_norm": 0.3660307824611664, "learning_rate": 0.00017700810611643333, "loss": 1.3191, "num_input_tokens_seen": 1562912, "step": 318, "train_runtime": 1092.6112, "train_tokens_per_second": 1430.437 }, { "epoch": 0.11733333333333333, "grad_norm": 0.40045297145843506, "learning_rate": 0.0001769344141488578, "loss": 1.1062, "num_input_tokens_seen": 1567984, "step": 319, "train_runtime": 1096.0431, "train_tokens_per_second": 1430.586 }, { "epoch": 0.11770114942528735, "grad_norm": 0.4017600417137146, "learning_rate": 0.00017686072218128223, "loss": 1.0655, "num_input_tokens_seen": 1572240, "step": 320, "train_runtime": 1098.9569, "train_tokens_per_second": 1430.666 }, { "epoch": 0.11806896551724137, "grad_norm": 0.4012167155742645, "learning_rate": 0.0001767870302137067, "loss": 1.3542, "num_input_tokens_seen": 1576912, "step": 321, "train_runtime": 1102.1809, "train_tokens_per_second": 1430.72 }, { "epoch": 0.11843678160919541, "grad_norm": 0.3356454074382782, "learning_rate": 0.0001767133382461312, "loss": 1.3085, "num_input_tokens_seen": 1581520, "step": 322, "train_runtime": 1105.2999, "train_tokens_per_second": 1430.852 }, { "epoch": 0.11880459770114943, "grad_norm": 0.3676871955394745, "learning_rate": 0.00017663964627855566, "loss": 1.1754, "num_input_tokens_seen": 1585024, "step": 323, "train_runtime": 1107.8524, "train_tokens_per_second": 1430.718 }, { "epoch": 0.11917241379310345, "grad_norm": 0.3801829516887665, "learning_rate": 0.00017656595431098012, "loss": 1.3644, "num_input_tokens_seen": 1589952, "step": 324, "train_runtime": 1111.1965, "train_tokens_per_second": 1430.847 }, { "epoch": 0.11954022988505747, "grad_norm": 0.334855854511261, "learning_rate": 0.00017649226234340456, "loss": 1.3466, "num_input_tokens_seen": 1594864, "step": 325, "train_runtime": 1114.4727, "train_tokens_per_second": 1431.048 }, { "epoch": 0.11990804597701149, "grad_norm": 0.3540022671222687, "learning_rate": 0.00017641857037582905, "loss": 1.3566, "num_input_tokens_seen": 1600256, "step": 326, "train_runtime": 1118.006, "train_tokens_per_second": 1431.348 }, { "epoch": 0.12027586206896551, "grad_norm": 0.3691379725933075, "learning_rate": 0.00017634487840825352, "loss": 1.4399, "num_input_tokens_seen": 1607072, "step": 327, "train_runtime": 1122.4744, "train_tokens_per_second": 1431.723 }, { "epoch": 0.12064367816091955, "grad_norm": 0.3574798107147217, "learning_rate": 0.00017627118644067798, "loss": 1.2646, "num_input_tokens_seen": 1611088, "step": 328, "train_runtime": 1125.3089, "train_tokens_per_second": 1431.685 }, { "epoch": 0.12101149425287357, "grad_norm": 0.33182525634765625, "learning_rate": 0.00017619749447310242, "loss": 1.2291, "num_input_tokens_seen": 1614976, "step": 329, "train_runtime": 1128.0716, "train_tokens_per_second": 1431.625 }, { "epoch": 0.12137931034482759, "grad_norm": 0.3294955790042877, "learning_rate": 0.0001761238025055269, "loss": 1.29, "num_input_tokens_seen": 1619008, "step": 330, "train_runtime": 1130.9122, "train_tokens_per_second": 1431.595 }, { "epoch": 0.12174712643678161, "grad_norm": 0.32767629623413086, "learning_rate": 0.00017605011053795137, "loss": 1.2442, "num_input_tokens_seen": 1622832, "step": 331, "train_runtime": 1135.2508, "train_tokens_per_second": 1429.492 }, { "epoch": 0.12211494252873563, "grad_norm": 0.34242504835128784, "learning_rate": 0.00017597641857037584, "loss": 1.214, "num_input_tokens_seen": 1626144, "step": 332, "train_runtime": 1137.649, "train_tokens_per_second": 1429.39 }, { "epoch": 0.12248275862068965, "grad_norm": 0.29884108901023865, "learning_rate": 0.0001759027266028003, "loss": 1.0849, "num_input_tokens_seen": 1637072, "step": 333, "train_runtime": 1148.1181, "train_tokens_per_second": 1425.874 }, { "epoch": 0.12285057471264368, "grad_norm": 0.36340370774269104, "learning_rate": 0.00017582903463522477, "loss": 1.3963, "num_input_tokens_seen": 1640976, "step": 334, "train_runtime": 1150.9221, "train_tokens_per_second": 1425.792 }, { "epoch": 0.1232183908045977, "grad_norm": 0.3351694345474243, "learning_rate": 0.00017575534266764923, "loss": 1.2571, "num_input_tokens_seen": 1644432, "step": 335, "train_runtime": 1153.4056, "train_tokens_per_second": 1425.719 }, { "epoch": 0.12358620689655173, "grad_norm": 0.39297762513160706, "learning_rate": 0.0001756816507000737, "loss": 1.3074, "num_input_tokens_seen": 1649184, "step": 336, "train_runtime": 1156.678, "train_tokens_per_second": 1425.794 }, { "epoch": 0.12395402298850575, "grad_norm": 0.33720138669013977, "learning_rate": 0.00017560795873249816, "loss": 1.2003, "num_input_tokens_seen": 1654160, "step": 337, "train_runtime": 1160.0199, "train_tokens_per_second": 1425.976 }, { "epoch": 0.12432183908045977, "grad_norm": 0.3647576868534088, "learning_rate": 0.00017553426676492263, "loss": 1.3519, "num_input_tokens_seen": 1659792, "step": 338, "train_runtime": 1163.6894, "train_tokens_per_second": 1426.319 }, { "epoch": 0.12468965517241379, "grad_norm": 0.3617439866065979, "learning_rate": 0.0001754605747973471, "loss": 1.2487, "num_input_tokens_seen": 1665264, "step": 339, "train_runtime": 1167.2748, "train_tokens_per_second": 1426.625 }, { "epoch": 0.1250574712643678, "grad_norm": 0.3797023892402649, "learning_rate": 0.00017538688282977156, "loss": 1.2513, "num_input_tokens_seen": 1668864, "step": 340, "train_runtime": 1169.8841, "train_tokens_per_second": 1426.521 }, { "epoch": 0.12542528735632183, "grad_norm": 0.3398475646972656, "learning_rate": 0.00017531319086219602, "loss": 1.1765, "num_input_tokens_seen": 1672240, "step": 341, "train_runtime": 1172.3457, "train_tokens_per_second": 1426.405 }, { "epoch": 0.12579310344827585, "grad_norm": 0.36390501260757446, "learning_rate": 0.00017523949889462051, "loss": 1.3972, "num_input_tokens_seen": 1679920, "step": 342, "train_runtime": 1177.0879, "train_tokens_per_second": 1427.183 }, { "epoch": 0.1261609195402299, "grad_norm": 0.3486977815628052, "learning_rate": 0.00017516580692704495, "loss": 1.3217, "num_input_tokens_seen": 1684208, "step": 343, "train_runtime": 1180.0993, "train_tokens_per_second": 1427.175 }, { "epoch": 0.12652873563218392, "grad_norm": 0.38147181272506714, "learning_rate": 0.00017509211495946942, "loss": 1.3411, "num_input_tokens_seen": 1687824, "step": 344, "train_runtime": 1182.656, "train_tokens_per_second": 1427.147 }, { "epoch": 0.12689655172413794, "grad_norm": 0.3574577569961548, "learning_rate": 0.00017501842299189388, "loss": 1.3632, "num_input_tokens_seen": 1692064, "step": 345, "train_runtime": 1185.5686, "train_tokens_per_second": 1427.217 }, { "epoch": 0.12726436781609196, "grad_norm": 0.3400028347969055, "learning_rate": 0.00017494473102431837, "loss": 1.1166, "num_input_tokens_seen": 1696112, "step": 346, "train_runtime": 1188.356, "train_tokens_per_second": 1427.276 }, { "epoch": 0.12763218390804598, "grad_norm": 0.3180460035800934, "learning_rate": 0.0001748710390567428, "loss": 1.2668, "num_input_tokens_seen": 1699824, "step": 347, "train_runtime": 1191.0307, "train_tokens_per_second": 1427.187 }, { "epoch": 0.128, "grad_norm": 0.3954669237136841, "learning_rate": 0.00017479734708916728, "loss": 1.3874, "num_input_tokens_seen": 1703840, "step": 348, "train_runtime": 1193.7618, "train_tokens_per_second": 1427.286 }, { "epoch": 0.12836781609195402, "grad_norm": 0.33969107270240784, "learning_rate": 0.00017472365512159174, "loss": 1.4295, "num_input_tokens_seen": 1707936, "step": 349, "train_runtime": 1196.5025, "train_tokens_per_second": 1427.44 }, { "epoch": 0.12873563218390804, "grad_norm": 0.4104045033454895, "learning_rate": 0.00017464996315401623, "loss": 1.482, "num_input_tokens_seen": 1712528, "step": 350, "train_runtime": 1199.712, "train_tokens_per_second": 1427.449 }, { "epoch": 0.12910344827586206, "grad_norm": 0.3302443325519562, "learning_rate": 0.0001745762711864407, "loss": 1.1095, "num_input_tokens_seen": 1716928, "step": 351, "train_runtime": 1202.69, "train_tokens_per_second": 1427.573 }, { "epoch": 0.12947126436781609, "grad_norm": 0.3219512403011322, "learning_rate": 0.00017450257921886514, "loss": 1.165, "num_input_tokens_seen": 1723392, "step": 352, "train_runtime": 1206.8425, "train_tokens_per_second": 1428.017 }, { "epoch": 0.1298390804597701, "grad_norm": 0.33770471811294556, "learning_rate": 0.0001744288872512896, "loss": 1.4201, "num_input_tokens_seen": 1727408, "step": 353, "train_runtime": 1209.6783, "train_tokens_per_second": 1427.99 }, { "epoch": 0.13020689655172413, "grad_norm": 0.35589832067489624, "learning_rate": 0.0001743551952837141, "loss": 1.393, "num_input_tokens_seen": 1732096, "step": 354, "train_runtime": 1212.9339, "train_tokens_per_second": 1428.022 }, { "epoch": 0.13057471264367815, "grad_norm": 0.36610502004623413, "learning_rate": 0.00017428150331613856, "loss": 1.1047, "num_input_tokens_seen": 1738816, "step": 355, "train_runtime": 1217.3457, "train_tokens_per_second": 1428.367 }, { "epoch": 0.1309425287356322, "grad_norm": 0.37327292561531067, "learning_rate": 0.00017420781134856302, "loss": 1.3669, "num_input_tokens_seen": 1746192, "step": 356, "train_runtime": 1222.019, "train_tokens_per_second": 1428.94 }, { "epoch": 0.13131034482758622, "grad_norm": 0.33279553055763245, "learning_rate": 0.00017413411938098746, "loss": 1.1447, "num_input_tokens_seen": 1752176, "step": 357, "train_runtime": 1225.8912, "train_tokens_per_second": 1429.308 }, { "epoch": 0.13167816091954024, "grad_norm": 0.34545910358428955, "learning_rate": 0.00017406042741341195, "loss": 1.251, "num_input_tokens_seen": 1755136, "step": 358, "train_runtime": 1228.1842, "train_tokens_per_second": 1429.049 }, { "epoch": 0.13204597701149426, "grad_norm": 0.3195616900920868, "learning_rate": 0.00017398673544583642, "loss": 1.2323, "num_input_tokens_seen": 1760656, "step": 359, "train_runtime": 1231.8626, "train_tokens_per_second": 1429.263 }, { "epoch": 0.13241379310344828, "grad_norm": 0.3158402144908905, "learning_rate": 0.00017391304347826088, "loss": 1.1428, "num_input_tokens_seen": 1766080, "step": 360, "train_runtime": 1235.5088, "train_tokens_per_second": 1429.435 }, { "epoch": 0.1327816091954023, "grad_norm": 0.3613432049751282, "learning_rate": 0.00017383935151068535, "loss": 1.3147, "num_input_tokens_seen": 1771264, "step": 361, "train_runtime": 1240.8473, "train_tokens_per_second": 1427.463 }, { "epoch": 0.13314942528735632, "grad_norm": 0.31645074486732483, "learning_rate": 0.0001737656595431098, "loss": 1.2493, "num_input_tokens_seen": 1774912, "step": 362, "train_runtime": 1243.4147, "train_tokens_per_second": 1427.45 }, { "epoch": 0.13351724137931034, "grad_norm": 0.38054177165031433, "learning_rate": 0.00017369196757553428, "loss": 1.4005, "num_input_tokens_seen": 1780800, "step": 363, "train_runtime": 1247.353, "train_tokens_per_second": 1427.663 }, { "epoch": 0.13388505747126436, "grad_norm": 0.3522668778896332, "learning_rate": 0.00017361827560795874, "loss": 1.2367, "num_input_tokens_seen": 1785168, "step": 364, "train_runtime": 1250.295, "train_tokens_per_second": 1427.797 }, { "epoch": 0.13425287356321838, "grad_norm": 0.36981090903282166, "learning_rate": 0.0001735445836403832, "loss": 1.31, "num_input_tokens_seen": 1790560, "step": 365, "train_runtime": 1253.8682, "train_tokens_per_second": 1428.029 }, { "epoch": 0.1346206896551724, "grad_norm": 0.38494235277175903, "learning_rate": 0.00017347089167280767, "loss": 1.2425, "num_input_tokens_seen": 1794720, "step": 366, "train_runtime": 1256.7756, "train_tokens_per_second": 1428.035 }, { "epoch": 0.13498850574712642, "grad_norm": 0.3471364378929138, "learning_rate": 0.00017339719970523214, "loss": 1.2496, "num_input_tokens_seen": 1801584, "step": 367, "train_runtime": 1261.0931, "train_tokens_per_second": 1428.589 }, { "epoch": 0.13535632183908047, "grad_norm": 0.36003199219703674, "learning_rate": 0.0001733235077376566, "loss": 1.2732, "num_input_tokens_seen": 1806048, "step": 368, "train_runtime": 1264.1584, "train_tokens_per_second": 1428.656 }, { "epoch": 0.1357241379310345, "grad_norm": 0.36972132325172424, "learning_rate": 0.00017324981577008106, "loss": 1.2372, "num_input_tokens_seen": 1814080, "step": 369, "train_runtime": 1269.3247, "train_tokens_per_second": 1429.169 }, { "epoch": 0.13609195402298851, "grad_norm": 0.3443167209625244, "learning_rate": 0.00017317612380250553, "loss": 1.2402, "num_input_tokens_seen": 1818784, "step": 370, "train_runtime": 1272.5184, "train_tokens_per_second": 1429.279 }, { "epoch": 0.13645977011494254, "grad_norm": 0.38251325488090515, "learning_rate": 0.00017310243183493, "loss": 1.2565, "num_input_tokens_seen": 1824608, "step": 371, "train_runtime": 1276.2877, "train_tokens_per_second": 1429.621 }, { "epoch": 0.13682758620689656, "grad_norm": 0.4466417729854584, "learning_rate": 0.00017302873986735446, "loss": 1.3363, "num_input_tokens_seen": 1828992, "step": 372, "train_runtime": 1279.2636, "train_tokens_per_second": 1429.723 }, { "epoch": 0.13719540229885058, "grad_norm": 0.35756662487983704, "learning_rate": 0.00017295504789977892, "loss": 1.4238, "num_input_tokens_seen": 1833424, "step": 373, "train_runtime": 1282.3214, "train_tokens_per_second": 1429.769 }, { "epoch": 0.1375632183908046, "grad_norm": 0.36335867643356323, "learning_rate": 0.00017288135593220342, "loss": 1.3744, "num_input_tokens_seen": 1837504, "step": 374, "train_runtime": 1285.1716, "train_tokens_per_second": 1429.773 }, { "epoch": 0.13793103448275862, "grad_norm": 0.3521118760108948, "learning_rate": 0.00017280766396462785, "loss": 1.1201, "num_input_tokens_seen": 1841888, "step": 375, "train_runtime": 1288.1896, "train_tokens_per_second": 1429.827 }, { "epoch": 0.13829885057471264, "grad_norm": 0.33666011691093445, "learning_rate": 0.00017273397199705232, "loss": 1.2316, "num_input_tokens_seen": 1849456, "step": 376, "train_runtime": 1292.8825, "train_tokens_per_second": 1430.49 }, { "epoch": 0.13866666666666666, "grad_norm": 0.40880200266838074, "learning_rate": 0.0001726602800294768, "loss": 1.3432, "num_input_tokens_seen": 1854640, "step": 377, "train_runtime": 1296.3377, "train_tokens_per_second": 1430.677 }, { "epoch": 0.13903448275862068, "grad_norm": 0.34930717945098877, "learning_rate": 0.00017258658806190128, "loss": 1.3542, "num_input_tokens_seen": 1864832, "step": 378, "train_runtime": 1302.513, "train_tokens_per_second": 1431.719 }, { "epoch": 0.1394022988505747, "grad_norm": 0.38795962929725647, "learning_rate": 0.00017251289609432574, "loss": 1.3718, "num_input_tokens_seen": 1869536, "step": 379, "train_runtime": 1305.6807, "train_tokens_per_second": 1431.848 }, { "epoch": 0.13977011494252872, "grad_norm": 0.34071630239486694, "learning_rate": 0.00017243920412675018, "loss": 1.3193, "num_input_tokens_seen": 1875632, "step": 380, "train_runtime": 1309.7488, "train_tokens_per_second": 1432.055 }, { "epoch": 0.14013793103448277, "grad_norm": 0.3350682854652405, "learning_rate": 0.00017236551215917467, "loss": 1.2953, "num_input_tokens_seen": 1880576, "step": 381, "train_runtime": 1313.0213, "train_tokens_per_second": 1432.251 }, { "epoch": 0.1405057471264368, "grad_norm": 0.35839366912841797, "learning_rate": 0.00017229182019159913, "loss": 1.2984, "num_input_tokens_seen": 1884256, "step": 382, "train_runtime": 1315.6269, "train_tokens_per_second": 1432.212 }, { "epoch": 0.1408735632183908, "grad_norm": 0.3593604862689972, "learning_rate": 0.0001722181282240236, "loss": 1.3049, "num_input_tokens_seen": 1888016, "step": 383, "train_runtime": 1318.3432, "train_tokens_per_second": 1432.113 }, { "epoch": 0.14124137931034483, "grad_norm": 0.35749468207359314, "learning_rate": 0.00017214443625644804, "loss": 1.15, "num_input_tokens_seen": 1891888, "step": 384, "train_runtime": 1321.1286, "train_tokens_per_second": 1432.024 }, { "epoch": 0.14160919540229885, "grad_norm": 0.4240542948246002, "learning_rate": 0.00017207074428887253, "loss": 1.2574, "num_input_tokens_seen": 1896720, "step": 385, "train_runtime": 1324.4688, "train_tokens_per_second": 1432.061 }, { "epoch": 0.14197701149425287, "grad_norm": 0.3442443609237671, "learning_rate": 0.000171997052321297, "loss": 1.3985, "num_input_tokens_seen": 1901360, "step": 386, "train_runtime": 1327.6283, "train_tokens_per_second": 1432.148 }, { "epoch": 0.1423448275862069, "grad_norm": 0.43367230892181396, "learning_rate": 0.00017192336035372146, "loss": 1.4627, "num_input_tokens_seen": 1905408, "step": 387, "train_runtime": 1330.4959, "train_tokens_per_second": 1432.104 }, { "epoch": 0.14271264367816092, "grad_norm": 0.4000196158885956, "learning_rate": 0.00017184966838614592, "loss": 1.3171, "num_input_tokens_seen": 1910544, "step": 388, "train_runtime": 1333.9981, "train_tokens_per_second": 1432.194 }, { "epoch": 0.14308045977011494, "grad_norm": 0.4140348732471466, "learning_rate": 0.0001717759764185704, "loss": 1.2402, "num_input_tokens_seen": 1915472, "step": 389, "train_runtime": 1337.3269, "train_tokens_per_second": 1432.314 }, { "epoch": 0.14344827586206896, "grad_norm": 0.3835417628288269, "learning_rate": 0.00017170228445099485, "loss": 1.2875, "num_input_tokens_seen": 1920368, "step": 390, "train_runtime": 1340.6689, "train_tokens_per_second": 1432.395 }, { "epoch": 0.14381609195402298, "grad_norm": 0.3389739990234375, "learning_rate": 0.00017162859248341932, "loss": 1.3775, "num_input_tokens_seen": 1923568, "step": 391, "train_runtime": 1344.9367, "train_tokens_per_second": 1430.229 }, { "epoch": 0.144183908045977, "grad_norm": 0.34423133730888367, "learning_rate": 0.00017155490051584378, "loss": 1.2596, "num_input_tokens_seen": 1929104, "step": 392, "train_runtime": 1348.4832, "train_tokens_per_second": 1430.573 }, { "epoch": 0.14455172413793105, "grad_norm": 0.31878727674484253, "learning_rate": 0.00017148120854826825, "loss": 1.1904, "num_input_tokens_seen": 1933120, "step": 393, "train_runtime": 1351.3408, "train_tokens_per_second": 1430.52 }, { "epoch": 0.14491954022988507, "grad_norm": 0.39297088980674744, "learning_rate": 0.0001714075165806927, "loss": 1.2576, "num_input_tokens_seen": 1937232, "step": 394, "train_runtime": 1354.3271, "train_tokens_per_second": 1430.402 }, { "epoch": 0.1452873563218391, "grad_norm": 0.3405814468860626, "learning_rate": 0.00017133382461311718, "loss": 1.3358, "num_input_tokens_seen": 1941232, "step": 395, "train_runtime": 1357.1096, "train_tokens_per_second": 1430.417 }, { "epoch": 0.1456551724137931, "grad_norm": 0.31894049048423767, "learning_rate": 0.00017126013264554164, "loss": 1.2919, "num_input_tokens_seen": 1946096, "step": 396, "train_runtime": 1360.4301, "train_tokens_per_second": 1430.501 }, { "epoch": 0.14602298850574713, "grad_norm": 0.30518004298210144, "learning_rate": 0.0001711864406779661, "loss": 1.2456, "num_input_tokens_seen": 1957120, "step": 397, "train_runtime": 1367.1031, "train_tokens_per_second": 1431.582 }, { "epoch": 0.14639080459770115, "grad_norm": 0.3538399934768677, "learning_rate": 0.00017111274871039057, "loss": 1.4283, "num_input_tokens_seen": 1961840, "step": 398, "train_runtime": 1370.2305, "train_tokens_per_second": 1431.759 }, { "epoch": 0.14675862068965517, "grad_norm": 0.4415174126625061, "learning_rate": 0.00017103905674281504, "loss": 1.2578, "num_input_tokens_seen": 1966112, "step": 399, "train_runtime": 1373.2288, "train_tokens_per_second": 1431.744 }, { "epoch": 0.1471264367816092, "grad_norm": 0.4373137950897217, "learning_rate": 0.0001709653647752395, "loss": 1.4214, "num_input_tokens_seen": 1969536, "step": 400, "train_runtime": 1375.7143, "train_tokens_per_second": 1431.646 }, { "epoch": 0.14749425287356321, "grad_norm": 0.3483783006668091, "learning_rate": 0.000170891672807664, "loss": 1.453, "num_input_tokens_seen": 1976128, "step": 401, "train_runtime": 1379.9346, "train_tokens_per_second": 1432.045 }, { "epoch": 0.14786206896551723, "grad_norm": 0.3300085663795471, "learning_rate": 0.00017081798084008843, "loss": 1.2722, "num_input_tokens_seen": 1979696, "step": 402, "train_runtime": 1382.5772, "train_tokens_per_second": 1431.888 }, { "epoch": 0.14822988505747126, "grad_norm": 0.3039983808994293, "learning_rate": 0.0001707442888725129, "loss": 1.1046, "num_input_tokens_seen": 1989376, "step": 403, "train_runtime": 1388.5576, "train_tokens_per_second": 1432.692 }, { "epoch": 0.14859770114942528, "grad_norm": 0.3359440863132477, "learning_rate": 0.00017067059690493736, "loss": 1.4073, "num_input_tokens_seen": 1994928, "step": 404, "train_runtime": 1392.2734, "train_tokens_per_second": 1432.856 }, { "epoch": 0.1489655172413793, "grad_norm": 0.381528377532959, "learning_rate": 0.00017059690493736185, "loss": 1.3089, "num_input_tokens_seen": 1999056, "step": 405, "train_runtime": 1395.1902, "train_tokens_per_second": 1432.82 }, { "epoch": 0.14933333333333335, "grad_norm": 0.32278943061828613, "learning_rate": 0.00017052321296978632, "loss": 1.3792, "num_input_tokens_seen": 2005632, "step": 406, "train_runtime": 1399.3481, "train_tokens_per_second": 1433.262 }, { "epoch": 0.14970114942528737, "grad_norm": 0.4173831045627594, "learning_rate": 0.00017044952100221076, "loss": 1.4602, "num_input_tokens_seen": 2009440, "step": 407, "train_runtime": 1402.0397, "train_tokens_per_second": 1433.226 }, { "epoch": 0.1500689655172414, "grad_norm": 0.335906058549881, "learning_rate": 0.00017037582903463522, "loss": 1.2627, "num_input_tokens_seen": 2013456, "step": 408, "train_runtime": 1404.8643, "train_tokens_per_second": 1433.203 }, { "epoch": 0.1504367816091954, "grad_norm": 0.3314789831638336, "learning_rate": 0.0001703021370670597, "loss": 1.2863, "num_input_tokens_seen": 2018272, "step": 409, "train_runtime": 1408.0975, "train_tokens_per_second": 1433.333 }, { "epoch": 0.15080459770114943, "grad_norm": 0.3679824769496918, "learning_rate": 0.00017022844509948418, "loss": 1.28, "num_input_tokens_seen": 2022832, "step": 410, "train_runtime": 1411.2397, "train_tokens_per_second": 1433.372 }, { "epoch": 0.15117241379310345, "grad_norm": 0.3312888741493225, "learning_rate": 0.00017015475313190864, "loss": 1.2087, "num_input_tokens_seen": 2027792, "step": 411, "train_runtime": 1414.5455, "train_tokens_per_second": 1433.529 }, { "epoch": 0.15154022988505747, "grad_norm": 0.3557579219341278, "learning_rate": 0.00017008106116433308, "loss": 1.3052, "num_input_tokens_seen": 2032048, "step": 412, "train_runtime": 1417.5023, "train_tokens_per_second": 1433.541 }, { "epoch": 0.1519080459770115, "grad_norm": 0.38084933161735535, "learning_rate": 0.00017000736919675757, "loss": 1.2378, "num_input_tokens_seen": 2036224, "step": 413, "train_runtime": 1420.4101, "train_tokens_per_second": 1433.547 }, { "epoch": 0.1522758620689655, "grad_norm": 0.40804681181907654, "learning_rate": 0.00016993367722918204, "loss": 1.3993, "num_input_tokens_seen": 2042672, "step": 414, "train_runtime": 1424.6429, "train_tokens_per_second": 1433.813 }, { "epoch": 0.15264367816091953, "grad_norm": 0.356699675321579, "learning_rate": 0.0001698599852616065, "loss": 1.3581, "num_input_tokens_seen": 2047392, "step": 415, "train_runtime": 1427.7212, "train_tokens_per_second": 1434.028 }, { "epoch": 0.15301149425287355, "grad_norm": 0.36977219581604004, "learning_rate": 0.00016978629329403094, "loss": 1.3457, "num_input_tokens_seen": 2054368, "step": 416, "train_runtime": 1432.1738, "train_tokens_per_second": 1434.44 }, { "epoch": 0.15337931034482757, "grad_norm": 0.3046276569366455, "learning_rate": 0.00016971260132645543, "loss": 1.1488, "num_input_tokens_seen": 2060224, "step": 417, "train_runtime": 1436.0747, "train_tokens_per_second": 1434.622 }, { "epoch": 0.15374712643678162, "grad_norm": 0.35704097151756287, "learning_rate": 0.0001696389093588799, "loss": 1.2044, "num_input_tokens_seen": 2064544, "step": 418, "train_runtime": 1439.0453, "train_tokens_per_second": 1434.662 }, { "epoch": 0.15411494252873564, "grad_norm": 0.33867743611335754, "learning_rate": 0.00016956521739130436, "loss": 1.2563, "num_input_tokens_seen": 2068560, "step": 419, "train_runtime": 1441.933, "train_tokens_per_second": 1434.574 }, { "epoch": 0.15448275862068966, "grad_norm": 0.336556077003479, "learning_rate": 0.00016949152542372882, "loss": 1.356, "num_input_tokens_seen": 2080528, "step": 420, "train_runtime": 1449.0782, "train_tokens_per_second": 1435.76 }, { "epoch": 0.15485057471264368, "grad_norm": 0.3474124073982239, "learning_rate": 0.0001694178334561533, "loss": 1.2698, "num_input_tokens_seen": 2084000, "step": 421, "train_runtime": 1453.5086, "train_tokens_per_second": 1433.772 }, { "epoch": 0.1552183908045977, "grad_norm": 0.35970601439476013, "learning_rate": 0.00016934414148857775, "loss": 1.287, "num_input_tokens_seen": 2089888, "step": 422, "train_runtime": 1457.3837, "train_tokens_per_second": 1434.0 }, { "epoch": 0.15558620689655173, "grad_norm": 0.31702131032943726, "learning_rate": 0.00016927044952100222, "loss": 1.1189, "num_input_tokens_seen": 2093472, "step": 423, "train_runtime": 1459.9758, "train_tokens_per_second": 1433.909 }, { "epoch": 0.15595402298850575, "grad_norm": 0.32167336344718933, "learning_rate": 0.00016919675755342668, "loss": 1.2787, "num_input_tokens_seen": 2098096, "step": 424, "train_runtime": 1463.1316, "train_tokens_per_second": 1433.976 }, { "epoch": 0.15632183908045977, "grad_norm": 0.3513907194137573, "learning_rate": 0.00016912306558585115, "loss": 1.2525, "num_input_tokens_seen": 2103440, "step": 425, "train_runtime": 1466.7478, "train_tokens_per_second": 1434.084 }, { "epoch": 0.1566896551724138, "grad_norm": 0.3481293022632599, "learning_rate": 0.00016904937361827561, "loss": 1.3526, "num_input_tokens_seen": 2108112, "step": 426, "train_runtime": 1469.8695, "train_tokens_per_second": 1434.217 }, { "epoch": 0.1570574712643678, "grad_norm": 0.3324897885322571, "learning_rate": 0.00016897568165070008, "loss": 1.3382, "num_input_tokens_seen": 2112240, "step": 427, "train_runtime": 1472.7851, "train_tokens_per_second": 1434.181 }, { "epoch": 0.15742528735632183, "grad_norm": 0.3185710310935974, "learning_rate": 0.00016890198968312454, "loss": 1.2524, "num_input_tokens_seen": 2120640, "step": 428, "train_runtime": 1478.0089, "train_tokens_per_second": 1434.795 }, { "epoch": 0.15779310344827585, "grad_norm": 0.3544529974460602, "learning_rate": 0.00016882829771554904, "loss": 1.2214, "num_input_tokens_seen": 2125760, "step": 429, "train_runtime": 1481.4673, "train_tokens_per_second": 1434.902 }, { "epoch": 0.15816091954022987, "grad_norm": 0.33514347672462463, "learning_rate": 0.00016875460574797347, "loss": 1.3911, "num_input_tokens_seen": 2130016, "step": 430, "train_runtime": 1484.3044, "train_tokens_per_second": 1435.026 }, { "epoch": 0.15852873563218392, "grad_norm": 0.33542317152023315, "learning_rate": 0.00016868091378039794, "loss": 1.3581, "num_input_tokens_seen": 2135024, "step": 431, "train_runtime": 1487.6554, "train_tokens_per_second": 1435.16 }, { "epoch": 0.15889655172413794, "grad_norm": 0.3252404034137726, "learning_rate": 0.0001686072218128224, "loss": 1.3684, "num_input_tokens_seen": 2140656, "step": 432, "train_runtime": 1491.4062, "train_tokens_per_second": 1435.327 }, { "epoch": 0.15926436781609196, "grad_norm": 0.35924550890922546, "learning_rate": 0.0001685335298452469, "loss": 1.4129, "num_input_tokens_seen": 2144416, "step": 433, "train_runtime": 1494.0865, "train_tokens_per_second": 1435.269 }, { "epoch": 0.15963218390804598, "grad_norm": 0.32163017988204956, "learning_rate": 0.00016845983787767133, "loss": 1.3567, "num_input_tokens_seen": 2150144, "step": 434, "train_runtime": 1497.9466, "train_tokens_per_second": 1435.394 }, { "epoch": 0.16, "grad_norm": 0.38988184928894043, "learning_rate": 0.0001683861459100958, "loss": 1.2821, "num_input_tokens_seen": 2153296, "step": 435, "train_runtime": 1500.2712, "train_tokens_per_second": 1435.271 }, { "epoch": 0.16036781609195402, "grad_norm": 0.3610256612300873, "learning_rate": 0.00016831245394252026, "loss": 1.2969, "num_input_tokens_seen": 2156688, "step": 436, "train_runtime": 1502.7894, "train_tokens_per_second": 1435.123 }, { "epoch": 0.16073563218390804, "grad_norm": 0.35343337059020996, "learning_rate": 0.00016823876197494475, "loss": 1.3713, "num_input_tokens_seen": 2160752, "step": 437, "train_runtime": 1505.6297, "train_tokens_per_second": 1435.115 }, { "epoch": 0.16110344827586207, "grad_norm": 0.3229235112667084, "learning_rate": 0.00016816507000736922, "loss": 1.2714, "num_input_tokens_seen": 2164832, "step": 438, "train_runtime": 1508.4733, "train_tokens_per_second": 1435.115 }, { "epoch": 0.1614712643678161, "grad_norm": 0.34250307083129883, "learning_rate": 0.00016809137803979366, "loss": 1.1873, "num_input_tokens_seen": 2168880, "step": 439, "train_runtime": 1511.3412, "train_tokens_per_second": 1435.07 }, { "epoch": 0.1618390804597701, "grad_norm": 0.36971795558929443, "learning_rate": 0.00016801768607221812, "loss": 1.256, "num_input_tokens_seen": 2174864, "step": 440, "train_runtime": 1515.3279, "train_tokens_per_second": 1435.243 }, { "epoch": 0.16220689655172413, "grad_norm": 0.3265184760093689, "learning_rate": 0.0001679439941046426, "loss": 1.2169, "num_input_tokens_seen": 2180304, "step": 441, "train_runtime": 1519.0008, "train_tokens_per_second": 1435.354 }, { "epoch": 0.16257471264367815, "grad_norm": 0.37642019987106323, "learning_rate": 0.00016787030213706708, "loss": 1.261, "num_input_tokens_seen": 2185216, "step": 442, "train_runtime": 1522.3337, "train_tokens_per_second": 1435.438 }, { "epoch": 0.1629425287356322, "grad_norm": 0.35478144884109497, "learning_rate": 0.00016779661016949154, "loss": 1.1235, "num_input_tokens_seen": 2189168, "step": 443, "train_runtime": 1525.0951, "train_tokens_per_second": 1435.431 }, { "epoch": 0.16331034482758622, "grad_norm": 0.3368073105812073, "learning_rate": 0.00016772291820191598, "loss": 1.2992, "num_input_tokens_seen": 2193648, "step": 444, "train_runtime": 1528.1172, "train_tokens_per_second": 1435.523 }, { "epoch": 0.16367816091954024, "grad_norm": 0.43296244740486145, "learning_rate": 0.00016764922623434047, "loss": 1.4187, "num_input_tokens_seen": 2197392, "step": 445, "train_runtime": 1530.7159, "train_tokens_per_second": 1435.532 }, { "epoch": 0.16404597701149426, "grad_norm": 0.4027699828147888, "learning_rate": 0.00016757553426676494, "loss": 1.3037, "num_input_tokens_seen": 2200880, "step": 446, "train_runtime": 1533.2024, "train_tokens_per_second": 1435.479 }, { "epoch": 0.16441379310344828, "grad_norm": 0.3729379177093506, "learning_rate": 0.0001675018422991894, "loss": 1.2391, "num_input_tokens_seen": 2203952, "step": 447, "train_runtime": 1535.5547, "train_tokens_per_second": 1435.281 }, { "epoch": 0.1647816091954023, "grad_norm": 0.3396291732788086, "learning_rate": 0.00016742815033161384, "loss": 1.2727, "num_input_tokens_seen": 2207584, "step": 448, "train_runtime": 1538.2027, "train_tokens_per_second": 1435.171 }, { "epoch": 0.16514942528735632, "grad_norm": 0.33090853691101074, "learning_rate": 0.00016735445836403833, "loss": 1.3714, "num_input_tokens_seen": 2214384, "step": 449, "train_runtime": 1542.5859, "train_tokens_per_second": 1435.501 }, { "epoch": 0.16551724137931034, "grad_norm": 0.3716526925563812, "learning_rate": 0.0001672807663964628, "loss": 1.3241, "num_input_tokens_seen": 2218624, "step": 450, "train_runtime": 1545.5852, "train_tokens_per_second": 1435.459 }, { "epoch": 0.16588505747126436, "grad_norm": 0.32018139958381653, "learning_rate": 0.00016720707442888726, "loss": 1.1954, "num_input_tokens_seen": 2226688, "step": 451, "train_runtime": 1552.659, "train_tokens_per_second": 1434.113 }, { "epoch": 0.16625287356321838, "grad_norm": 0.3496841788291931, "learning_rate": 0.00016713338246131173, "loss": 1.3889, "num_input_tokens_seen": 2230656, "step": 452, "train_runtime": 1555.5039, "train_tokens_per_second": 1434.041 }, { "epoch": 0.1666206896551724, "grad_norm": 0.32573357224464417, "learning_rate": 0.0001670596904937362, "loss": 1.3581, "num_input_tokens_seen": 2235152, "step": 453, "train_runtime": 1558.5137, "train_tokens_per_second": 1434.156 }, { "epoch": 0.16698850574712643, "grad_norm": 0.3681710958480835, "learning_rate": 0.00016698599852616066, "loss": 1.3239, "num_input_tokens_seen": 2240256, "step": 454, "train_runtime": 1561.8838, "train_tokens_per_second": 1434.329 }, { "epoch": 0.16735632183908045, "grad_norm": 0.31902021169662476, "learning_rate": 0.00016691230655858512, "loss": 1.3712, "num_input_tokens_seen": 2247984, "step": 455, "train_runtime": 1566.7686, "train_tokens_per_second": 1434.79 }, { "epoch": 0.1677241379310345, "grad_norm": 0.37209877371788025, "learning_rate": 0.00016683861459100959, "loss": 1.2074, "num_input_tokens_seen": 2251200, "step": 456, "train_runtime": 1569.1997, "train_tokens_per_second": 1434.617 }, { "epoch": 0.16809195402298852, "grad_norm": 0.3461419343948364, "learning_rate": 0.00016676492262343405, "loss": 1.2965, "num_input_tokens_seen": 2256976, "step": 457, "train_runtime": 1572.9015, "train_tokens_per_second": 1434.912 }, { "epoch": 0.16845977011494254, "grad_norm": 0.331448495388031, "learning_rate": 0.00016669123065585852, "loss": 1.2546, "num_input_tokens_seen": 2260768, "step": 458, "train_runtime": 1575.6662, "train_tokens_per_second": 1434.801 }, { "epoch": 0.16882758620689656, "grad_norm": 0.388141393661499, "learning_rate": 0.00016661753868828298, "loss": 1.3422, "num_input_tokens_seen": 2266432, "step": 459, "train_runtime": 1579.4389, "train_tokens_per_second": 1434.96 }, { "epoch": 0.16919540229885058, "grad_norm": 0.34401068091392517, "learning_rate": 0.00016654384672070744, "loss": 1.2571, "num_input_tokens_seen": 2271392, "step": 460, "train_runtime": 1582.8521, "train_tokens_per_second": 1435.0 }, { "epoch": 0.1695632183908046, "grad_norm": 0.353071928024292, "learning_rate": 0.00016647015475313194, "loss": 1.1926, "num_input_tokens_seen": 2276016, "step": 461, "train_runtime": 1586.0107, "train_tokens_per_second": 1435.057 }, { "epoch": 0.16993103448275862, "grad_norm": 0.3545515239238739, "learning_rate": 0.00016639646278555637, "loss": 1.3086, "num_input_tokens_seen": 2281568, "step": 462, "train_runtime": 1589.6648, "train_tokens_per_second": 1435.251 }, { "epoch": 0.17029885057471264, "grad_norm": 0.33702024817466736, "learning_rate": 0.00016632277081798084, "loss": 1.3195, "num_input_tokens_seen": 2285024, "step": 463, "train_runtime": 1592.153, "train_tokens_per_second": 1435.179 }, { "epoch": 0.17066666666666666, "grad_norm": 0.396621972322464, "learning_rate": 0.0001662490788504053, "loss": 1.2395, "num_input_tokens_seen": 2291584, "step": 464, "train_runtime": 1596.4086, "train_tokens_per_second": 1435.462 }, { "epoch": 0.17103448275862068, "grad_norm": 0.34218865633010864, "learning_rate": 0.0001661753868828298, "loss": 1.2186, "num_input_tokens_seen": 2295456, "step": 465, "train_runtime": 1599.1769, "train_tokens_per_second": 1435.398 }, { "epoch": 0.1714022988505747, "grad_norm": 0.36157292127609253, "learning_rate": 0.00016610169491525423, "loss": 1.3077, "num_input_tokens_seen": 2301776, "step": 466, "train_runtime": 1603.2734, "train_tokens_per_second": 1435.673 }, { "epoch": 0.17177011494252872, "grad_norm": 0.3664705157279968, "learning_rate": 0.0001660280029476787, "loss": 1.3709, "num_input_tokens_seen": 2305968, "step": 467, "train_runtime": 1606.0913, "train_tokens_per_second": 1435.764 }, { "epoch": 0.17213793103448277, "grad_norm": 0.3933860957622528, "learning_rate": 0.00016595431098010316, "loss": 1.3227, "num_input_tokens_seen": 2310768, "step": 468, "train_runtime": 1609.3503, "train_tokens_per_second": 1435.839 }, { "epoch": 0.1725057471264368, "grad_norm": 0.35732167959213257, "learning_rate": 0.00016588061901252766, "loss": 1.2522, "num_input_tokens_seen": 2314752, "step": 469, "train_runtime": 1612.1725, "train_tokens_per_second": 1435.797 }, { "epoch": 0.1728735632183908, "grad_norm": 0.3423457145690918, "learning_rate": 0.00016580692704495212, "loss": 1.1958, "num_input_tokens_seen": 2319984, "step": 470, "train_runtime": 1615.6381, "train_tokens_per_second": 1435.955 }, { "epoch": 0.17324137931034483, "grad_norm": 0.37787607312202454, "learning_rate": 0.00016573323507737656, "loss": 1.3952, "num_input_tokens_seen": 2323184, "step": 471, "train_runtime": 1618.0736, "train_tokens_per_second": 1435.772 }, { "epoch": 0.17360919540229885, "grad_norm": 0.3515986204147339, "learning_rate": 0.00016565954310980102, "loss": 1.3096, "num_input_tokens_seen": 2329216, "step": 472, "train_runtime": 1621.9949, "train_tokens_per_second": 1436.019 }, { "epoch": 0.17397701149425288, "grad_norm": 0.37123268842697144, "learning_rate": 0.00016558585114222551, "loss": 1.404, "num_input_tokens_seen": 2334000, "step": 473, "train_runtime": 1625.2386, "train_tokens_per_second": 1436.097 }, { "epoch": 0.1743448275862069, "grad_norm": 0.3338044583797455, "learning_rate": 0.00016551215917464998, "loss": 1.4175, "num_input_tokens_seen": 2341040, "step": 474, "train_runtime": 1629.7076, "train_tokens_per_second": 1436.479 }, { "epoch": 0.17471264367816092, "grad_norm": 0.3517896234989166, "learning_rate": 0.00016543846720707444, "loss": 1.433, "num_input_tokens_seen": 2347440, "step": 475, "train_runtime": 1633.9029, "train_tokens_per_second": 1436.707 }, { "epoch": 0.17508045977011494, "grad_norm": 0.32335546612739563, "learning_rate": 0.00016536477523949888, "loss": 1.3124, "num_input_tokens_seen": 2354816, "step": 476, "train_runtime": 1638.6389, "train_tokens_per_second": 1437.056 }, { "epoch": 0.17544827586206896, "grad_norm": 0.3357498049736023, "learning_rate": 0.00016529108327192337, "loss": 1.3454, "num_input_tokens_seen": 2358736, "step": 477, "train_runtime": 1641.4382, "train_tokens_per_second": 1436.993 }, { "epoch": 0.17581609195402298, "grad_norm": 0.3742138147354126, "learning_rate": 0.00016521739130434784, "loss": 1.3781, "num_input_tokens_seen": 2362496, "step": 478, "train_runtime": 1644.0364, "train_tokens_per_second": 1437.01 }, { "epoch": 0.176183908045977, "grad_norm": 0.3452815115451813, "learning_rate": 0.0001651436993367723, "loss": 1.3116, "num_input_tokens_seen": 2366656, "step": 479, "train_runtime": 1646.9372, "train_tokens_per_second": 1437.004 }, { "epoch": 0.17655172413793102, "grad_norm": 0.31542301177978516, "learning_rate": 0.00016507000736919677, "loss": 1.4107, "num_input_tokens_seen": 2371408, "step": 480, "train_runtime": 1650.2199, "train_tokens_per_second": 1437.025 }, { "epoch": 0.17691954022988507, "grad_norm": 0.3817698359489441, "learning_rate": 0.00016499631540162123, "loss": 1.2445, "num_input_tokens_seen": 2375584, "step": 481, "train_runtime": 1655.7192, "train_tokens_per_second": 1434.775 }, { "epoch": 0.1772873563218391, "grad_norm": 0.37903985381126404, "learning_rate": 0.0001649226234340457, "loss": 1.2607, "num_input_tokens_seen": 2381008, "step": 482, "train_runtime": 1659.2591, "train_tokens_per_second": 1434.983 }, { "epoch": 0.1776551724137931, "grad_norm": 0.37075647711753845, "learning_rate": 0.00016484893146647016, "loss": 1.2386, "num_input_tokens_seen": 2385280, "step": 483, "train_runtime": 1662.2592, "train_tokens_per_second": 1434.963 }, { "epoch": 0.17802298850574713, "grad_norm": 0.3169528841972351, "learning_rate": 0.00016477523949889463, "loss": 1.3309, "num_input_tokens_seen": 2391648, "step": 484, "train_runtime": 1666.3337, "train_tokens_per_second": 1435.276 }, { "epoch": 0.17839080459770115, "grad_norm": 0.3421877920627594, "learning_rate": 0.0001647015475313191, "loss": 1.4214, "num_input_tokens_seen": 2395536, "step": 485, "train_runtime": 1669.0601, "train_tokens_per_second": 1435.26 }, { "epoch": 0.17875862068965517, "grad_norm": 0.35942426323890686, "learning_rate": 0.00016462785556374356, "loss": 1.3059, "num_input_tokens_seen": 2399312, "step": 486, "train_runtime": 1671.8617, "train_tokens_per_second": 1435.114 }, { "epoch": 0.1791264367816092, "grad_norm": 0.3300853967666626, "learning_rate": 0.00016455416359616802, "loss": 1.3302, "num_input_tokens_seen": 2404816, "step": 487, "train_runtime": 1675.5811, "train_tokens_per_second": 1435.213 }, { "epoch": 0.17949425287356321, "grad_norm": 0.32718613743782043, "learning_rate": 0.0001644804716285925, "loss": 1.2576, "num_input_tokens_seen": 2408816, "step": 488, "train_runtime": 1678.3337, "train_tokens_per_second": 1435.243 }, { "epoch": 0.17986206896551724, "grad_norm": 0.3190445601940155, "learning_rate": 0.00016440677966101695, "loss": 1.2407, "num_input_tokens_seen": 2414576, "step": 489, "train_runtime": 1682.1122, "train_tokens_per_second": 1435.443 }, { "epoch": 0.18022988505747126, "grad_norm": 0.38515108823776245, "learning_rate": 0.00016433308769344142, "loss": 1.3565, "num_input_tokens_seen": 2418080, "step": 490, "train_runtime": 1684.6028, "train_tokens_per_second": 1435.401 }, { "epoch": 0.18059770114942528, "grad_norm": 0.34255078434944153, "learning_rate": 0.00016425939572586588, "loss": 1.2903, "num_input_tokens_seen": 2424032, "step": 491, "train_runtime": 1688.5065, "train_tokens_per_second": 1435.607 }, { "epoch": 0.1809655172413793, "grad_norm": 0.37366923689842224, "learning_rate": 0.00016418570375829035, "loss": 1.3299, "num_input_tokens_seen": 2428160, "step": 492, "train_runtime": 1691.4537, "train_tokens_per_second": 1435.546 }, { "epoch": 0.18133333333333335, "grad_norm": 0.33095481991767883, "learning_rate": 0.00016411201179071484, "loss": 1.14, "num_input_tokens_seen": 2433200, "step": 493, "train_runtime": 1694.816, "train_tokens_per_second": 1435.672 }, { "epoch": 0.18170114942528737, "grad_norm": 0.31714820861816406, "learning_rate": 0.00016403831982313928, "loss": 1.3351, "num_input_tokens_seen": 2439088, "step": 494, "train_runtime": 1698.6442, "train_tokens_per_second": 1435.903 }, { "epoch": 0.1820689655172414, "grad_norm": 0.34027791023254395, "learning_rate": 0.00016396462785556374, "loss": 1.3259, "num_input_tokens_seen": 2444304, "step": 495, "train_runtime": 1702.1216, "train_tokens_per_second": 1436.034 }, { "epoch": 0.1824367816091954, "grad_norm": 0.34417229890823364, "learning_rate": 0.0001638909358879882, "loss": 1.3235, "num_input_tokens_seen": 2448736, "step": 496, "train_runtime": 1705.1225, "train_tokens_per_second": 1436.106 }, { "epoch": 0.18280459770114943, "grad_norm": 0.3466030955314636, "learning_rate": 0.0001638172439204127, "loss": 1.3202, "num_input_tokens_seen": 2454352, "step": 497, "train_runtime": 1708.8569, "train_tokens_per_second": 1436.254 }, { "epoch": 0.18317241379310345, "grad_norm": 0.3568847179412842, "learning_rate": 0.00016374355195283714, "loss": 1.3818, "num_input_tokens_seen": 2458944, "step": 498, "train_runtime": 1712.0227, "train_tokens_per_second": 1436.28 }, { "epoch": 0.18354022988505747, "grad_norm": 0.3216519355773926, "learning_rate": 0.0001636698599852616, "loss": 1.3315, "num_input_tokens_seen": 2462848, "step": 499, "train_runtime": 1714.7409, "train_tokens_per_second": 1436.28 }, { "epoch": 0.1839080459770115, "grad_norm": 0.32724398374557495, "learning_rate": 0.0001635961680176861, "loss": 1.2368, "num_input_tokens_seen": 2466752, "step": 500, "train_runtime": 1717.5292, "train_tokens_per_second": 1436.221 }, { "epoch": 0.1842758620689655, "grad_norm": 0.37495991587638855, "learning_rate": 0.00016352247605011056, "loss": 1.319, "num_input_tokens_seen": 2470656, "step": 501, "train_runtime": 1720.2957, "train_tokens_per_second": 1436.181 }, { "epoch": 0.18464367816091953, "grad_norm": 0.30906328558921814, "learning_rate": 0.00016344878408253502, "loss": 1.1545, "num_input_tokens_seen": 2475792, "step": 502, "train_runtime": 1723.7368, "train_tokens_per_second": 1436.294 }, { "epoch": 0.18501149425287355, "grad_norm": 0.34888771176338196, "learning_rate": 0.00016337509211495946, "loss": 1.2204, "num_input_tokens_seen": 2480400, "step": 503, "train_runtime": 1726.9576, "train_tokens_per_second": 1436.283 }, { "epoch": 0.18537931034482757, "grad_norm": 0.3419767916202545, "learning_rate": 0.00016330140014738395, "loss": 1.2839, "num_input_tokens_seen": 2485456, "step": 504, "train_runtime": 1730.2338, "train_tokens_per_second": 1436.486 }, { "epoch": 0.1857471264367816, "grad_norm": 0.3836863338947296, "learning_rate": 0.00016322770817980842, "loss": 1.3313, "num_input_tokens_seen": 2488864, "step": 505, "train_runtime": 1732.7458, "train_tokens_per_second": 1436.37 }, { "epoch": 0.18611494252873564, "grad_norm": 0.3446231186389923, "learning_rate": 0.00016315401621223288, "loss": 1.1375, "num_input_tokens_seen": 2492512, "step": 506, "train_runtime": 1735.3503, "train_tokens_per_second": 1436.316 }, { "epoch": 0.18648275862068966, "grad_norm": 0.33684930205345154, "learning_rate": 0.00016308032424465735, "loss": 1.1534, "num_input_tokens_seen": 2496864, "step": 507, "train_runtime": 1738.3742, "train_tokens_per_second": 1436.321 }, { "epoch": 0.18685057471264369, "grad_norm": 0.36668455600738525, "learning_rate": 0.0001630066322770818, "loss": 1.2738, "num_input_tokens_seen": 2500288, "step": 508, "train_runtime": 1740.9184, "train_tokens_per_second": 1436.189 }, { "epoch": 0.1872183908045977, "grad_norm": 0.43545395135879517, "learning_rate": 0.00016293294030950628, "loss": 1.2834, "num_input_tokens_seen": 2506624, "step": 509, "train_runtime": 1745.0035, "train_tokens_per_second": 1436.458 }, { "epoch": 0.18758620689655173, "grad_norm": 0.3866064250469208, "learning_rate": 0.00016285924834193074, "loss": 1.2799, "num_input_tokens_seen": 2511216, "step": 510, "train_runtime": 1748.1168, "train_tokens_per_second": 1436.526 }, { "epoch": 0.18795402298850575, "grad_norm": 0.43094202876091003, "learning_rate": 0.0001627855563743552, "loss": 1.3075, "num_input_tokens_seen": 2515040, "step": 511, "train_runtime": 1752.7918, "train_tokens_per_second": 1434.877 }, { "epoch": 0.18832183908045977, "grad_norm": 0.3287125527858734, "learning_rate": 0.00016271186440677967, "loss": 1.2294, "num_input_tokens_seen": 2518608, "step": 512, "train_runtime": 1755.292, "train_tokens_per_second": 1434.866 }, { "epoch": 0.1886896551724138, "grad_norm": 0.38001322746276855, "learning_rate": 0.00016263817243920413, "loss": 1.2967, "num_input_tokens_seen": 2524528, "step": 513, "train_runtime": 1759.0632, "train_tokens_per_second": 1435.155 }, { "epoch": 0.1890574712643678, "grad_norm": 0.36320173740386963, "learning_rate": 0.0001625644804716286, "loss": 1.2356, "num_input_tokens_seen": 2528528, "step": 514, "train_runtime": 1761.8651, "train_tokens_per_second": 1435.143 }, { "epoch": 0.18942528735632183, "grad_norm": 0.32575723528862, "learning_rate": 0.00016249078850405306, "loss": 1.2527, "num_input_tokens_seen": 2533584, "step": 515, "train_runtime": 1765.2838, "train_tokens_per_second": 1435.228 }, { "epoch": 0.18979310344827585, "grad_norm": 0.37583526968955994, "learning_rate": 0.00016241709653647753, "loss": 1.2864, "num_input_tokens_seen": 2537456, "step": 516, "train_runtime": 1767.9687, "train_tokens_per_second": 1435.238 }, { "epoch": 0.19016091954022987, "grad_norm": 0.3317106068134308, "learning_rate": 0.000162343404568902, "loss": 1.1857, "num_input_tokens_seen": 2540880, "step": 517, "train_runtime": 1770.4916, "train_tokens_per_second": 1435.127 }, { "epoch": 0.19052873563218392, "grad_norm": 0.29974696040153503, "learning_rate": 0.00016226971260132646, "loss": 1.2705, "num_input_tokens_seen": 2548032, "step": 518, "train_runtime": 1775.034, "train_tokens_per_second": 1435.484 }, { "epoch": 0.19089655172413794, "grad_norm": 0.3364499807357788, "learning_rate": 0.00016219602063375092, "loss": 1.2728, "num_input_tokens_seen": 2552400, "step": 519, "train_runtime": 1778.0662, "train_tokens_per_second": 1435.492 }, { "epoch": 0.19126436781609196, "grad_norm": 0.3244878649711609, "learning_rate": 0.00016212232866617542, "loss": 1.2699, "num_input_tokens_seen": 2559888, "step": 520, "train_runtime": 1782.8718, "train_tokens_per_second": 1435.823 }, { "epoch": 0.19163218390804598, "grad_norm": 0.3346767723560333, "learning_rate": 0.00016204863669859985, "loss": 1.1798, "num_input_tokens_seen": 2563360, "step": 521, "train_runtime": 1785.3748, "train_tokens_per_second": 1435.755 }, { "epoch": 0.192, "grad_norm": 0.3296874761581421, "learning_rate": 0.00016197494473102432, "loss": 1.2463, "num_input_tokens_seen": 2566000, "step": 522, "train_runtime": 1787.4619, "train_tokens_per_second": 1435.555 }, { "epoch": 0.19236781609195402, "grad_norm": 0.3505805730819702, "learning_rate": 0.00016190125276344878, "loss": 1.2946, "num_input_tokens_seen": 2570928, "step": 523, "train_runtime": 1790.8093, "train_tokens_per_second": 1435.624 }, { "epoch": 0.19273563218390805, "grad_norm": 0.3358633816242218, "learning_rate": 0.00016182756079587327, "loss": 1.3498, "num_input_tokens_seen": 2576352, "step": 524, "train_runtime": 1794.2966, "train_tokens_per_second": 1435.856 }, { "epoch": 0.19310344827586207, "grad_norm": 0.3377569615840912, "learning_rate": 0.00016175386882829774, "loss": 1.452, "num_input_tokens_seen": 2579856, "step": 525, "train_runtime": 1796.8332, "train_tokens_per_second": 1435.779 }, { "epoch": 0.1934712643678161, "grad_norm": 0.39165809750556946, "learning_rate": 0.00016168017686072218, "loss": 1.2713, "num_input_tokens_seen": 2583376, "step": 526, "train_runtime": 1799.3331, "train_tokens_per_second": 1435.741 }, { "epoch": 0.1938390804597701, "grad_norm": 0.33097031712532043, "learning_rate": 0.00016160648489314664, "loss": 1.1863, "num_input_tokens_seen": 2588144, "step": 527, "train_runtime": 1802.5206, "train_tokens_per_second": 1435.847 }, { "epoch": 0.19420689655172413, "grad_norm": 0.32664138078689575, "learning_rate": 0.00016153279292557113, "loss": 1.2256, "num_input_tokens_seen": 2592272, "step": 528, "train_runtime": 1805.4258, "train_tokens_per_second": 1435.823 }, { "epoch": 0.19457471264367815, "grad_norm": 0.35744956135749817, "learning_rate": 0.0001614591009579956, "loss": 1.2275, "num_input_tokens_seen": 2598816, "step": 529, "train_runtime": 1809.5927, "train_tokens_per_second": 1436.133 }, { "epoch": 0.19494252873563217, "grad_norm": 0.36398911476135254, "learning_rate": 0.00016138540899042006, "loss": 1.3013, "num_input_tokens_seen": 2603792, "step": 530, "train_runtime": 1812.8989, "train_tokens_per_second": 1436.259 }, { "epoch": 0.19531034482758622, "grad_norm": 0.3198075592517853, "learning_rate": 0.0001613117170228445, "loss": 1.3522, "num_input_tokens_seen": 2611088, "step": 531, "train_runtime": 1817.6382, "train_tokens_per_second": 1436.528 }, { "epoch": 0.19567816091954024, "grad_norm": 0.3598136305809021, "learning_rate": 0.000161238025055269, "loss": 1.3588, "num_input_tokens_seen": 2614496, "step": 532, "train_runtime": 1820.2013, "train_tokens_per_second": 1436.377 }, { "epoch": 0.19604597701149426, "grad_norm": 0.35406559705734253, "learning_rate": 0.00016116433308769346, "loss": 1.27, "num_input_tokens_seen": 2620320, "step": 533, "train_runtime": 1823.9909, "train_tokens_per_second": 1436.586 }, { "epoch": 0.19641379310344828, "grad_norm": 0.37063267827033997, "learning_rate": 0.00016109064112011792, "loss": 1.311, "num_input_tokens_seen": 2627840, "step": 534, "train_runtime": 1828.7531, "train_tokens_per_second": 1436.957 }, { "epoch": 0.1967816091954023, "grad_norm": 0.3614117205142975, "learning_rate": 0.00016101694915254236, "loss": 1.1944, "num_input_tokens_seen": 2634128, "step": 535, "train_runtime": 1832.8949, "train_tokens_per_second": 1437.141 }, { "epoch": 0.19714942528735632, "grad_norm": 0.3317558765411377, "learning_rate": 0.00016094325718496685, "loss": 1.3098, "num_input_tokens_seen": 2643760, "step": 536, "train_runtime": 1838.7941, "train_tokens_per_second": 1437.768 }, { "epoch": 0.19751724137931034, "grad_norm": 0.34399816393852234, "learning_rate": 0.00016086956521739132, "loss": 1.1071, "num_input_tokens_seen": 2647184, "step": 537, "train_runtime": 1841.2836, "train_tokens_per_second": 1437.684 }, { "epoch": 0.19788505747126436, "grad_norm": 0.3315516412258148, "learning_rate": 0.00016079587324981578, "loss": 1.3203, "num_input_tokens_seen": 2653200, "step": 538, "train_runtime": 1845.2351, "train_tokens_per_second": 1437.866 }, { "epoch": 0.19825287356321838, "grad_norm": 0.3801349401473999, "learning_rate": 0.00016072218128224025, "loss": 1.2821, "num_input_tokens_seen": 2657136, "step": 539, "train_runtime": 1848.0085, "train_tokens_per_second": 1437.838 }, { "epoch": 0.1986206896551724, "grad_norm": 0.34804943203926086, "learning_rate": 0.0001606484893146647, "loss": 1.0843, "num_input_tokens_seen": 2660224, "step": 540, "train_runtime": 1850.3064, "train_tokens_per_second": 1437.721 }, { "epoch": 0.19898850574712643, "grad_norm": 0.42285385727882385, "learning_rate": 0.00016057479734708918, "loss": 1.3023, "num_input_tokens_seen": 2663152, "step": 541, "train_runtime": 1854.7352, "train_tokens_per_second": 1435.866 }, { "epoch": 0.19935632183908045, "grad_norm": 0.33356553316116333, "learning_rate": 0.00016050110537951364, "loss": 1.3245, "num_input_tokens_seen": 2667472, "step": 542, "train_runtime": 1857.6688, "train_tokens_per_second": 1435.924 }, { "epoch": 0.1997241379310345, "grad_norm": 0.322724848985672, "learning_rate": 0.0001604274134119381, "loss": 1.1768, "num_input_tokens_seen": 2672304, "step": 543, "train_runtime": 1860.8516, "train_tokens_per_second": 1436.065 }, { "epoch": 0.20009195402298852, "grad_norm": 0.36868584156036377, "learning_rate": 0.00016035372144436257, "loss": 1.3712, "num_input_tokens_seen": 2676272, "step": 544, "train_runtime": 1863.6677, "train_tokens_per_second": 1436.024 }, { "epoch": 0.20009195402298852, "eval_loss": 1.2722872495651245, "eval_runtime": 15.4745, "eval_samples_per_second": 64.623, "eval_steps_per_second": 4.071, "num_input_tokens_seen": 2676272, "step": 544 }, { "epoch": 0.20045977011494254, "grad_norm": 0.36055392026901245, "learning_rate": 0.00016028002947678704, "loss": 1.3256, "num_input_tokens_seen": 2682256, "step": 545, "train_runtime": 1882.9622, "train_tokens_per_second": 1424.487 }, { "epoch": 0.20082758620689656, "grad_norm": 0.3377590775489807, "learning_rate": 0.0001602063375092115, "loss": 1.1309, "num_input_tokens_seen": 2687840, "step": 546, "train_runtime": 1886.6051, "train_tokens_per_second": 1424.697 }, { "epoch": 0.20119540229885058, "grad_norm": 0.3443763256072998, "learning_rate": 0.00016013264554163597, "loss": 1.2654, "num_input_tokens_seen": 2691312, "step": 547, "train_runtime": 1889.0955, "train_tokens_per_second": 1424.656 }, { "epoch": 0.2015632183908046, "grad_norm": 0.39379337430000305, "learning_rate": 0.00016005895357406046, "loss": 1.42, "num_input_tokens_seen": 2695120, "step": 548, "train_runtime": 1891.816, "train_tokens_per_second": 1424.621 }, { "epoch": 0.20193103448275862, "grad_norm": 0.29482370615005493, "learning_rate": 0.0001599852616064849, "loss": 1.2013, "num_input_tokens_seen": 2699568, "step": 549, "train_runtime": 1894.7995, "train_tokens_per_second": 1424.725 }, { "epoch": 0.20229885057471264, "grad_norm": 0.3238631784915924, "learning_rate": 0.00015991156963890936, "loss": 1.3776, "num_input_tokens_seen": 2704608, "step": 550, "train_runtime": 1898.1532, "train_tokens_per_second": 1424.863 }, { "epoch": 0.20266666666666666, "grad_norm": 0.31853145360946655, "learning_rate": 0.00015983787767133382, "loss": 1.2264, "num_input_tokens_seen": 2709088, "step": 551, "train_runtime": 1901.2593, "train_tokens_per_second": 1424.891 }, { "epoch": 0.20303448275862068, "grad_norm": 0.34621456265449524, "learning_rate": 0.00015976418570375832, "loss": 1.1675, "num_input_tokens_seen": 2713008, "step": 552, "train_runtime": 1904.0395, "train_tokens_per_second": 1424.87 }, { "epoch": 0.2034022988505747, "grad_norm": 0.32944974303245544, "learning_rate": 0.00015969049373618275, "loss": 1.4432, "num_input_tokens_seen": 2720256, "step": 553, "train_runtime": 1908.6301, "train_tokens_per_second": 1425.24 }, { "epoch": 0.20377011494252872, "grad_norm": 0.38964101672172546, "learning_rate": 0.00015961680176860722, "loss": 1.4091, "num_input_tokens_seen": 2723888, "step": 554, "train_runtime": 1911.2318, "train_tokens_per_second": 1425.2 }, { "epoch": 0.20413793103448277, "grad_norm": 0.3687337338924408, "learning_rate": 0.00015954310980103168, "loss": 1.3001, "num_input_tokens_seen": 2728176, "step": 555, "train_runtime": 1914.1401, "train_tokens_per_second": 1425.275 }, { "epoch": 0.2045057471264368, "grad_norm": 0.33243492245674133, "learning_rate": 0.00015946941783345618, "loss": 1.3448, "num_input_tokens_seen": 2732048, "step": 556, "train_runtime": 1916.8689, "train_tokens_per_second": 1425.266 }, { "epoch": 0.20487356321839081, "grad_norm": 0.3270266652107239, "learning_rate": 0.00015939572586588064, "loss": 1.1297, "num_input_tokens_seen": 2738000, "step": 557, "train_runtime": 1920.8298, "train_tokens_per_second": 1425.426 }, { "epoch": 0.20524137931034483, "grad_norm": 0.35209283232688904, "learning_rate": 0.00015932203389830508, "loss": 1.2505, "num_input_tokens_seen": 2741328, "step": 558, "train_runtime": 1923.3322, "train_tokens_per_second": 1425.301 }, { "epoch": 0.20560919540229886, "grad_norm": 0.31420478224754333, "learning_rate": 0.00015924834193072954, "loss": 1.1736, "num_input_tokens_seen": 2748224, "step": 559, "train_runtime": 1927.8068, "train_tokens_per_second": 1425.57 }, { "epoch": 0.20597701149425288, "grad_norm": 0.3479740619659424, "learning_rate": 0.00015917464996315404, "loss": 1.1734, "num_input_tokens_seen": 2751024, "step": 560, "train_runtime": 1930.0153, "train_tokens_per_second": 1425.39 }, { "epoch": 0.2063448275862069, "grad_norm": 0.33000895380973816, "learning_rate": 0.0001591009579955785, "loss": 1.411, "num_input_tokens_seen": 2758640, "step": 561, "train_runtime": 1934.8688, "train_tokens_per_second": 1425.75 }, { "epoch": 0.20671264367816092, "grad_norm": 0.3301312327384949, "learning_rate": 0.00015902726602800296, "loss": 1.3243, "num_input_tokens_seen": 2770816, "step": 562, "train_runtime": 1942.2134, "train_tokens_per_second": 1426.628 }, { "epoch": 0.20708045977011494, "grad_norm": 0.358114629983902, "learning_rate": 0.0001589535740604274, "loss": 1.1099, "num_input_tokens_seen": 2775056, "step": 563, "train_runtime": 1945.1652, "train_tokens_per_second": 1426.643 }, { "epoch": 0.20744827586206896, "grad_norm": 0.39302560687065125, "learning_rate": 0.0001588798820928519, "loss": 1.1804, "num_input_tokens_seen": 2780848, "step": 564, "train_runtime": 1949.0215, "train_tokens_per_second": 1426.792 }, { "epoch": 0.20781609195402298, "grad_norm": 0.33622652292251587, "learning_rate": 0.00015880619012527636, "loss": 1.2061, "num_input_tokens_seen": 2785424, "step": 565, "train_runtime": 1952.1362, "train_tokens_per_second": 1426.859 }, { "epoch": 0.208183908045977, "grad_norm": 0.35917094349861145, "learning_rate": 0.00015873249815770082, "loss": 1.2738, "num_input_tokens_seen": 2790352, "step": 566, "train_runtime": 1955.4066, "train_tokens_per_second": 1426.993 }, { "epoch": 0.20855172413793102, "grad_norm": 0.41483211517333984, "learning_rate": 0.00015865880619012526, "loss": 1.3201, "num_input_tokens_seen": 2793760, "step": 567, "train_runtime": 1957.8828, "train_tokens_per_second": 1426.929 }, { "epoch": 0.20891954022988507, "grad_norm": 0.367186039686203, "learning_rate": 0.00015858511422254975, "loss": 1.2594, "num_input_tokens_seen": 2797104, "step": 568, "train_runtime": 1960.3465, "train_tokens_per_second": 1426.842 }, { "epoch": 0.2092873563218391, "grad_norm": 0.35813453793525696, "learning_rate": 0.00015851142225497422, "loss": 1.3491, "num_input_tokens_seen": 2805328, "step": 569, "train_runtime": 1965.4896, "train_tokens_per_second": 1427.292 }, { "epoch": 0.2096551724137931, "grad_norm": 0.34246182441711426, "learning_rate": 0.00015843773028739868, "loss": 1.2319, "num_input_tokens_seen": 2811904, "step": 570, "train_runtime": 1969.6662, "train_tokens_per_second": 1427.604 }, { "epoch": 0.21002298850574713, "grad_norm": 0.364341139793396, "learning_rate": 0.00015836403831982315, "loss": 1.4294, "num_input_tokens_seen": 2819184, "step": 571, "train_runtime": 1976.3213, "train_tokens_per_second": 1426.481 }, { "epoch": 0.21039080459770115, "grad_norm": 0.3529500961303711, "learning_rate": 0.0001582903463522476, "loss": 1.3549, "num_input_tokens_seen": 2823456, "step": 572, "train_runtime": 1979.2725, "train_tokens_per_second": 1426.512 }, { "epoch": 0.21075862068965517, "grad_norm": 0.3735297918319702, "learning_rate": 0.00015821665438467208, "loss": 1.3024, "num_input_tokens_seen": 2827664, "step": 573, "train_runtime": 1982.2422, "train_tokens_per_second": 1426.498 }, { "epoch": 0.2111264367816092, "grad_norm": 0.3497689664363861, "learning_rate": 0.00015814296241709654, "loss": 1.1662, "num_input_tokens_seen": 2831728, "step": 574, "train_runtime": 1985.0397, "train_tokens_per_second": 1426.535 }, { "epoch": 0.21149425287356322, "grad_norm": 0.4035835266113281, "learning_rate": 0.000158069270449521, "loss": 1.3886, "num_input_tokens_seen": 2835472, "step": 575, "train_runtime": 1987.6621, "train_tokens_per_second": 1426.536 }, { "epoch": 0.21186206896551724, "grad_norm": 0.33833611011505127, "learning_rate": 0.00015799557848194547, "loss": 1.3622, "num_input_tokens_seen": 2839664, "step": 576, "train_runtime": 1990.5618, "train_tokens_per_second": 1426.564 }, { "epoch": 0.21222988505747126, "grad_norm": 0.33022499084472656, "learning_rate": 0.00015792188651436994, "loss": 1.2793, "num_input_tokens_seen": 2845008, "step": 577, "train_runtime": 1994.1098, "train_tokens_per_second": 1426.706 }, { "epoch": 0.21259770114942528, "grad_norm": 0.3520048260688782, "learning_rate": 0.0001578481945467944, "loss": 1.353, "num_input_tokens_seen": 2848944, "step": 578, "train_runtime": 1996.8617, "train_tokens_per_second": 1426.711 }, { "epoch": 0.2129655172413793, "grad_norm": 0.33845770359039307, "learning_rate": 0.00015777450257921887, "loss": 1.2187, "num_input_tokens_seen": 2853120, "step": 579, "train_runtime": 1999.7525, "train_tokens_per_second": 1426.737 }, { "epoch": 0.21333333333333335, "grad_norm": 0.37855276465415955, "learning_rate": 0.00015770081061164336, "loss": 1.2547, "num_input_tokens_seen": 2856768, "step": 580, "train_runtime": 2002.3631, "train_tokens_per_second": 1426.698 }, { "epoch": 0.21370114942528737, "grad_norm": 0.32887569069862366, "learning_rate": 0.0001576271186440678, "loss": 1.2656, "num_input_tokens_seen": 2861136, "step": 581, "train_runtime": 2005.3736, "train_tokens_per_second": 1426.735 }, { "epoch": 0.2140689655172414, "grad_norm": 0.3663339912891388, "learning_rate": 0.00015755342667649226, "loss": 1.3917, "num_input_tokens_seen": 2866848, "step": 582, "train_runtime": 2009.0935, "train_tokens_per_second": 1426.936 }, { "epoch": 0.2144367816091954, "grad_norm": 0.37052851915359497, "learning_rate": 0.00015747973470891673, "loss": 1.3527, "num_input_tokens_seen": 2870224, "step": 583, "train_runtime": 2011.4821, "train_tokens_per_second": 1426.92 }, { "epoch": 0.21480459770114943, "grad_norm": 0.33706924319267273, "learning_rate": 0.00015740604274134122, "loss": 1.2399, "num_input_tokens_seen": 2874144, "step": 584, "train_runtime": 2014.1927, "train_tokens_per_second": 1426.946 }, { "epoch": 0.21517241379310345, "grad_norm": 0.3673574924468994, "learning_rate": 0.00015733235077376566, "loss": 1.2418, "num_input_tokens_seen": 2880528, "step": 585, "train_runtime": 2018.2948, "train_tokens_per_second": 1427.209 }, { "epoch": 0.21554022988505747, "grad_norm": 0.3524503707885742, "learning_rate": 0.00015725865880619012, "loss": 1.3842, "num_input_tokens_seen": 2887648, "step": 586, "train_runtime": 2022.8254, "train_tokens_per_second": 1427.532 }, { "epoch": 0.2159080459770115, "grad_norm": 0.3508240282535553, "learning_rate": 0.00015718496683861459, "loss": 1.4001, "num_input_tokens_seen": 2892816, "step": 587, "train_runtime": 2026.3138, "train_tokens_per_second": 1427.625 }, { "epoch": 0.2162758620689655, "grad_norm": 0.34460121393203735, "learning_rate": 0.00015711127487103908, "loss": 1.1965, "num_input_tokens_seen": 2896704, "step": 588, "train_runtime": 2029.0787, "train_tokens_per_second": 1427.596 }, { "epoch": 0.21664367816091953, "grad_norm": 0.3157898187637329, "learning_rate": 0.00015703758290346354, "loss": 1.2097, "num_input_tokens_seen": 2900912, "step": 589, "train_runtime": 2032.0618, "train_tokens_per_second": 1427.571 }, { "epoch": 0.21701149425287355, "grad_norm": 0.37705808877944946, "learning_rate": 0.00015696389093588798, "loss": 1.297, "num_input_tokens_seen": 2905200, "step": 590, "train_runtime": 2035.0686, "train_tokens_per_second": 1427.569 }, { "epoch": 0.21737931034482758, "grad_norm": 0.33461806178092957, "learning_rate": 0.00015689019896831244, "loss": 1.1567, "num_input_tokens_seen": 2910864, "step": 591, "train_runtime": 2038.7705, "train_tokens_per_second": 1427.755 }, { "epoch": 0.2177471264367816, "grad_norm": 0.3506442606449127, "learning_rate": 0.00015681650700073694, "loss": 1.2028, "num_input_tokens_seen": 2917024, "step": 592, "train_runtime": 2042.699, "train_tokens_per_second": 1428.024 }, { "epoch": 0.21811494252873564, "grad_norm": 0.3706601560115814, "learning_rate": 0.0001567428150331614, "loss": 1.3113, "num_input_tokens_seen": 2920928, "step": 593, "train_runtime": 2045.5071, "train_tokens_per_second": 1427.973 }, { "epoch": 0.21848275862068967, "grad_norm": 0.3287620544433594, "learning_rate": 0.00015666912306558587, "loss": 1.3289, "num_input_tokens_seen": 2928656, "step": 594, "train_runtime": 2050.3697, "train_tokens_per_second": 1428.355 }, { "epoch": 0.2188505747126437, "grad_norm": 0.30894625186920166, "learning_rate": 0.0001565954310980103, "loss": 1.1406, "num_input_tokens_seen": 2931920, "step": 595, "train_runtime": 2052.7269, "train_tokens_per_second": 1428.305 }, { "epoch": 0.2192183908045977, "grad_norm": 0.3249402344226837, "learning_rate": 0.0001565217391304348, "loss": 1.1654, "num_input_tokens_seen": 2936672, "step": 596, "train_runtime": 2055.9805, "train_tokens_per_second": 1428.356 }, { "epoch": 0.21958620689655173, "grad_norm": 0.3295873999595642, "learning_rate": 0.00015644804716285926, "loss": 1.2612, "num_input_tokens_seen": 2942768, "step": 597, "train_runtime": 2059.9486, "train_tokens_per_second": 1428.564 }, { "epoch": 0.21995402298850575, "grad_norm": 0.42991822957992554, "learning_rate": 0.00015637435519528373, "loss": 1.3704, "num_input_tokens_seen": 2947712, "step": 598, "train_runtime": 2063.2948, "train_tokens_per_second": 1428.643 }, { "epoch": 0.22032183908045977, "grad_norm": 0.3534640967845917, "learning_rate": 0.0001563006632277082, "loss": 1.2164, "num_input_tokens_seen": 2951280, "step": 599, "train_runtime": 2065.8086, "train_tokens_per_second": 1428.632 }, { "epoch": 0.2206896551724138, "grad_norm": 0.348354697227478, "learning_rate": 0.00015622697126013266, "loss": 1.2605, "num_input_tokens_seen": 2955248, "step": 600, "train_runtime": 2068.6458, "train_tokens_per_second": 1428.591 }, { "epoch": 0.2210574712643678, "grad_norm": 0.3614390790462494, "learning_rate": 0.00015615327929255712, "loss": 1.3987, "num_input_tokens_seen": 2958992, "step": 601, "train_runtime": 2073.2854, "train_tokens_per_second": 1427.2 }, { "epoch": 0.22142528735632183, "grad_norm": 0.3639795482158661, "learning_rate": 0.00015607958732498158, "loss": 1.3568, "num_input_tokens_seen": 2963344, "step": 602, "train_runtime": 2076.2633, "train_tokens_per_second": 1427.249 }, { "epoch": 0.22179310344827585, "grad_norm": 0.4041186571121216, "learning_rate": 0.00015600589535740605, "loss": 1.1738, "num_input_tokens_seen": 2967424, "step": 603, "train_runtime": 2079.0606, "train_tokens_per_second": 1427.291 }, { "epoch": 0.22216091954022987, "grad_norm": 0.3762064576148987, "learning_rate": 0.00015593220338983051, "loss": 1.2329, "num_input_tokens_seen": 2971952, "step": 604, "train_runtime": 2082.1878, "train_tokens_per_second": 1427.322 }, { "epoch": 0.22252873563218392, "grad_norm": 0.3315386474132538, "learning_rate": 0.00015585851142225498, "loss": 1.4211, "num_input_tokens_seen": 2975424, "step": 605, "train_runtime": 2084.7305, "train_tokens_per_second": 1427.246 }, { "epoch": 0.22289655172413794, "grad_norm": 0.35764938592910767, "learning_rate": 0.00015578481945467944, "loss": 1.374, "num_input_tokens_seen": 2978880, "step": 606, "train_runtime": 2087.2191, "train_tokens_per_second": 1427.2 }, { "epoch": 0.22326436781609196, "grad_norm": 0.3803774118423462, "learning_rate": 0.0001557111274871039, "loss": 1.2384, "num_input_tokens_seen": 2982160, "step": 607, "train_runtime": 2089.6994, "train_tokens_per_second": 1427.076 }, { "epoch": 0.22363218390804598, "grad_norm": 0.37342971563339233, "learning_rate": 0.00015563743551952837, "loss": 1.2087, "num_input_tokens_seen": 2985520, "step": 608, "train_runtime": 2092.2483, "train_tokens_per_second": 1426.943 }, { "epoch": 0.224, "grad_norm": 0.38321128487586975, "learning_rate": 0.00015556374355195284, "loss": 1.2303, "num_input_tokens_seen": 2989152, "step": 609, "train_runtime": 2094.8329, "train_tokens_per_second": 1426.917 }, { "epoch": 0.22436781609195403, "grad_norm": 0.34238046407699585, "learning_rate": 0.0001554900515843773, "loss": 1.2595, "num_input_tokens_seen": 2995040, "step": 610, "train_runtime": 2098.636, "train_tokens_per_second": 1427.136 }, { "epoch": 0.22473563218390805, "grad_norm": 0.3561033308506012, "learning_rate": 0.00015541635961680177, "loss": 1.3446, "num_input_tokens_seen": 2998640, "step": 611, "train_runtime": 2101.2837, "train_tokens_per_second": 1427.052 }, { "epoch": 0.22510344827586207, "grad_norm": 0.35131025314331055, "learning_rate": 0.00015534266764922626, "loss": 1.1862, "num_input_tokens_seen": 3003376, "step": 612, "train_runtime": 2104.4455, "train_tokens_per_second": 1427.158 }, { "epoch": 0.2254712643678161, "grad_norm": 0.37832045555114746, "learning_rate": 0.0001552689756816507, "loss": 1.3236, "num_input_tokens_seen": 3008112, "step": 613, "train_runtime": 2107.5896, "train_tokens_per_second": 1427.276 }, { "epoch": 0.2258390804597701, "grad_norm": 0.35437673330307007, "learning_rate": 0.00015519528371407516, "loss": 1.1955, "num_input_tokens_seen": 3012304, "step": 614, "train_runtime": 2110.5478, "train_tokens_per_second": 1427.262 }, { "epoch": 0.22620689655172413, "grad_norm": 0.33689314126968384, "learning_rate": 0.00015512159174649963, "loss": 1.1469, "num_input_tokens_seen": 3016448, "step": 615, "train_runtime": 2113.422, "train_tokens_per_second": 1427.281 }, { "epoch": 0.22657471264367815, "grad_norm": 0.37024691700935364, "learning_rate": 0.00015504789977892412, "loss": 1.216, "num_input_tokens_seen": 3021536, "step": 616, "train_runtime": 2116.7711, "train_tokens_per_second": 1427.427 }, { "epoch": 0.22694252873563217, "grad_norm": 0.34888485074043274, "learning_rate": 0.00015497420781134856, "loss": 1.2034, "num_input_tokens_seen": 3031472, "step": 617, "train_runtime": 2122.8118, "train_tokens_per_second": 1428.046 }, { "epoch": 0.22731034482758622, "grad_norm": 0.3368101119995117, "learning_rate": 0.00015490051584377302, "loss": 1.1672, "num_input_tokens_seen": 3036832, "step": 618, "train_runtime": 2126.3711, "train_tokens_per_second": 1428.176 }, { "epoch": 0.22767816091954024, "grad_norm": 0.3308377265930176, "learning_rate": 0.0001548268238761975, "loss": 1.2279, "num_input_tokens_seen": 3040640, "step": 619, "train_runtime": 2129.0783, "train_tokens_per_second": 1428.148 }, { "epoch": 0.22804597701149426, "grad_norm": 0.34152933955192566, "learning_rate": 0.00015475313190862198, "loss": 1.259, "num_input_tokens_seen": 3048544, "step": 620, "train_runtime": 2133.8726, "train_tokens_per_second": 1428.644 }, { "epoch": 0.22841379310344828, "grad_norm": 0.33772867918014526, "learning_rate": 0.00015467943994104644, "loss": 1.1684, "num_input_tokens_seen": 3054352, "step": 621, "train_runtime": 2137.7081, "train_tokens_per_second": 1428.798 }, { "epoch": 0.2287816091954023, "grad_norm": 0.370492547750473, "learning_rate": 0.00015460574797347088, "loss": 1.4057, "num_input_tokens_seen": 3060176, "step": 622, "train_runtime": 2141.4916, "train_tokens_per_second": 1428.993 }, { "epoch": 0.22914942528735632, "grad_norm": 0.41318953037261963, "learning_rate": 0.00015453205600589537, "loss": 1.1883, "num_input_tokens_seen": 3064016, "step": 623, "train_runtime": 2144.2031, "train_tokens_per_second": 1428.977 }, { "epoch": 0.22951724137931034, "grad_norm": 0.3290882706642151, "learning_rate": 0.00015445836403831984, "loss": 1.2908, "num_input_tokens_seen": 3068288, "step": 624, "train_runtime": 2147.1118, "train_tokens_per_second": 1429.03 }, { "epoch": 0.22988505747126436, "grad_norm": 0.331515371799469, "learning_rate": 0.0001543846720707443, "loss": 1.3962, "num_input_tokens_seen": 3072016, "step": 625, "train_runtime": 2149.8027, "train_tokens_per_second": 1428.976 }, { "epoch": 0.23025287356321839, "grad_norm": 0.3490446209907532, "learning_rate": 0.00015431098010316877, "loss": 1.2267, "num_input_tokens_seen": 3076016, "step": 626, "train_runtime": 2152.5587, "train_tokens_per_second": 1429.004 }, { "epoch": 0.2306206896551724, "grad_norm": 0.34286853671073914, "learning_rate": 0.00015423728813559323, "loss": 1.3973, "num_input_tokens_seen": 3083056, "step": 627, "train_runtime": 2157.0813, "train_tokens_per_second": 1429.272 }, { "epoch": 0.23098850574712643, "grad_norm": 0.3316624164581299, "learning_rate": 0.0001541635961680177, "loss": 1.2641, "num_input_tokens_seen": 3087984, "step": 628, "train_runtime": 2160.3462, "train_tokens_per_second": 1429.393 }, { "epoch": 0.23135632183908045, "grad_norm": 0.32378822565078735, "learning_rate": 0.00015408990420044216, "loss": 1.1981, "num_input_tokens_seen": 3094496, "step": 629, "train_runtime": 2164.5291, "train_tokens_per_second": 1429.639 }, { "epoch": 0.2317241379310345, "grad_norm": 0.3374817669391632, "learning_rate": 0.00015401621223286663, "loss": 1.2519, "num_input_tokens_seen": 3097744, "step": 630, "train_runtime": 2166.9657, "train_tokens_per_second": 1429.531 }, { "epoch": 0.23209195402298852, "grad_norm": 0.3515070378780365, "learning_rate": 0.0001539425202652911, "loss": 1.4411, "num_input_tokens_seen": 3101824, "step": 631, "train_runtime": 2171.7969, "train_tokens_per_second": 1428.229 }, { "epoch": 0.23245977011494254, "grad_norm": 0.3360339403152466, "learning_rate": 0.00015386882829771556, "loss": 1.229, "num_input_tokens_seen": 3106960, "step": 632, "train_runtime": 2175.1845, "train_tokens_per_second": 1428.366 }, { "epoch": 0.23282758620689656, "grad_norm": 0.3126661479473114, "learning_rate": 0.00015379513633014002, "loss": 1.2524, "num_input_tokens_seen": 3111024, "step": 633, "train_runtime": 2177.9921, "train_tokens_per_second": 1428.391 }, { "epoch": 0.23319540229885058, "grad_norm": 0.32186412811279297, "learning_rate": 0.00015372144436256449, "loss": 1.2399, "num_input_tokens_seen": 3115136, "step": 634, "train_runtime": 2180.8308, "train_tokens_per_second": 1428.417 }, { "epoch": 0.2335632183908046, "grad_norm": 0.3627889156341553, "learning_rate": 0.00015364775239498895, "loss": 1.1929, "num_input_tokens_seen": 3120464, "step": 635, "train_runtime": 2184.3213, "train_tokens_per_second": 1428.574 }, { "epoch": 0.23393103448275862, "grad_norm": 0.3592092990875244, "learning_rate": 0.00015357406042741342, "loss": 1.4087, "num_input_tokens_seen": 3126080, "step": 636, "train_runtime": 2187.9955, "train_tokens_per_second": 1428.742 }, { "epoch": 0.23429885057471264, "grad_norm": 0.3188234865665436, "learning_rate": 0.00015350036845983788, "loss": 1.248, "num_input_tokens_seen": 3131056, "step": 637, "train_runtime": 2191.3305, "train_tokens_per_second": 1428.838 }, { "epoch": 0.23466666666666666, "grad_norm": 0.3150631785392761, "learning_rate": 0.00015342667649226235, "loss": 1.3449, "num_input_tokens_seen": 3138384, "step": 638, "train_runtime": 2196.0512, "train_tokens_per_second": 1429.103 }, { "epoch": 0.23503448275862068, "grad_norm": 0.36316341161727905, "learning_rate": 0.00015335298452468684, "loss": 1.3747, "num_input_tokens_seen": 3142352, "step": 639, "train_runtime": 2198.8694, "train_tokens_per_second": 1429.076 }, { "epoch": 0.2354022988505747, "grad_norm": 0.3514518141746521, "learning_rate": 0.00015327929255711128, "loss": 1.2717, "num_input_tokens_seen": 3146864, "step": 640, "train_runtime": 2201.9838, "train_tokens_per_second": 1429.104 }, { "epoch": 0.23577011494252872, "grad_norm": 0.34906163811683655, "learning_rate": 0.00015320560058953574, "loss": 1.1923, "num_input_tokens_seen": 3152784, "step": 641, "train_runtime": 2205.8944, "train_tokens_per_second": 1429.254 }, { "epoch": 0.23613793103448275, "grad_norm": 0.3031584620475769, "learning_rate": 0.0001531319086219602, "loss": 1.2025, "num_input_tokens_seen": 3160096, "step": 642, "train_runtime": 2210.4306, "train_tokens_per_second": 1429.629 }, { "epoch": 0.2365057471264368, "grad_norm": 0.3557109534740448, "learning_rate": 0.0001530582166543847, "loss": 1.2924, "num_input_tokens_seen": 3166704, "step": 643, "train_runtime": 2214.5628, "train_tokens_per_second": 1429.945 }, { "epoch": 0.23687356321839081, "grad_norm": 0.33845528960227966, "learning_rate": 0.00015298452468680916, "loss": 1.2173, "num_input_tokens_seen": 3172432, "step": 644, "train_runtime": 2218.4093, "train_tokens_per_second": 1430.048 }, { "epoch": 0.23724137931034484, "grad_norm": 0.3227993845939636, "learning_rate": 0.0001529108327192336, "loss": 1.1944, "num_input_tokens_seen": 3176624, "step": 645, "train_runtime": 2221.3908, "train_tokens_per_second": 1430.016 }, { "epoch": 0.23760919540229886, "grad_norm": 0.33973607420921326, "learning_rate": 0.00015283714075165806, "loss": 1.2882, "num_input_tokens_seen": 3181744, "step": 646, "train_runtime": 2224.8343, "train_tokens_per_second": 1430.104 }, { "epoch": 0.23797701149425288, "grad_norm": 0.35896897315979004, "learning_rate": 0.00015276344878408256, "loss": 1.2382, "num_input_tokens_seen": 3185936, "step": 647, "train_runtime": 2227.8318, "train_tokens_per_second": 1430.061 }, { "epoch": 0.2383448275862069, "grad_norm": 0.37523940205574036, "learning_rate": 0.00015268975681650702, "loss": 1.2286, "num_input_tokens_seen": 3189488, "step": 648, "train_runtime": 2230.3394, "train_tokens_per_second": 1430.046 }, { "epoch": 0.23871264367816092, "grad_norm": 0.3502814471721649, "learning_rate": 0.00015261606484893149, "loss": 1.2112, "num_input_tokens_seen": 3194720, "step": 649, "train_runtime": 2233.9256, "train_tokens_per_second": 1430.092 }, { "epoch": 0.23908045977011494, "grad_norm": 0.35990142822265625, "learning_rate": 0.00015254237288135592, "loss": 1.3038, "num_input_tokens_seen": 3202496, "step": 650, "train_runtime": 2238.8049, "train_tokens_per_second": 1430.449 }, { "epoch": 0.23944827586206896, "grad_norm": 0.3870561718940735, "learning_rate": 0.00015246868091378042, "loss": 1.3588, "num_input_tokens_seen": 3206320, "step": 651, "train_runtime": 2241.5207, "train_tokens_per_second": 1430.422 }, { "epoch": 0.23981609195402298, "grad_norm": 0.36193016171455383, "learning_rate": 0.00015239498894620488, "loss": 1.2423, "num_input_tokens_seen": 3214016, "step": 652, "train_runtime": 2246.3831, "train_tokens_per_second": 1430.751 }, { "epoch": 0.240183908045977, "grad_norm": 0.4229816794395447, "learning_rate": 0.00015232129697862935, "loss": 1.2857, "num_input_tokens_seen": 3218112, "step": 653, "train_runtime": 2249.2306, "train_tokens_per_second": 1430.761 }, { "epoch": 0.24055172413793102, "grad_norm": 0.4027053415775299, "learning_rate": 0.00015224760501105378, "loss": 1.2014, "num_input_tokens_seen": 3222432, "step": 654, "train_runtime": 2252.2611, "train_tokens_per_second": 1430.754 }, { "epoch": 0.24091954022988507, "grad_norm": 0.3395320177078247, "learning_rate": 0.00015217391304347827, "loss": 1.2439, "num_input_tokens_seen": 3229632, "step": 655, "train_runtime": 2256.8678, "train_tokens_per_second": 1431.024 }, { "epoch": 0.2412873563218391, "grad_norm": 0.3750961124897003, "learning_rate": 0.00015210022107590274, "loss": 1.2973, "num_input_tokens_seen": 3233120, "step": 656, "train_runtime": 2259.4178, "train_tokens_per_second": 1430.953 }, { "epoch": 0.2416551724137931, "grad_norm": 0.3356698751449585, "learning_rate": 0.0001520265291083272, "loss": 1.2474, "num_input_tokens_seen": 3236640, "step": 657, "train_runtime": 2262.0109, "train_tokens_per_second": 1430.868 }, { "epoch": 0.24202298850574713, "grad_norm": 0.31609296798706055, "learning_rate": 0.00015195283714075167, "loss": 1.1402, "num_input_tokens_seen": 3242816, "step": 658, "train_runtime": 2265.9665, "train_tokens_per_second": 1431.096 }, { "epoch": 0.24239080459770115, "grad_norm": 0.3269003629684448, "learning_rate": 0.00015187914517317613, "loss": 1.3452, "num_input_tokens_seen": 3251440, "step": 659, "train_runtime": 2271.333, "train_tokens_per_second": 1431.512 }, { "epoch": 0.24275862068965517, "grad_norm": 0.3321452736854553, "learning_rate": 0.0001518054532056006, "loss": 1.2074, "num_input_tokens_seen": 3255072, "step": 660, "train_runtime": 2273.952, "train_tokens_per_second": 1431.46 }, { "epoch": 0.2431264367816092, "grad_norm": 0.359015554189682, "learning_rate": 0.00015173176123802506, "loss": 1.3853, "num_input_tokens_seen": 3258992, "step": 661, "train_runtime": 2278.7706, "train_tokens_per_second": 1430.154 }, { "epoch": 0.24349425287356322, "grad_norm": 0.33611130714416504, "learning_rate": 0.00015165806927044953, "loss": 1.136, "num_input_tokens_seen": 3263104, "step": 662, "train_runtime": 2281.5981, "train_tokens_per_second": 1430.183 }, { "epoch": 0.24386206896551724, "grad_norm": 0.3454429805278778, "learning_rate": 0.000151584377302874, "loss": 1.2523, "num_input_tokens_seen": 3267648, "step": 663, "train_runtime": 2284.6702, "train_tokens_per_second": 1430.249 }, { "epoch": 0.24422988505747126, "grad_norm": 0.3487210273742676, "learning_rate": 0.00015151068533529846, "loss": 1.1537, "num_input_tokens_seen": 3271728, "step": 664, "train_runtime": 2287.547, "train_tokens_per_second": 1430.234 }, { "epoch": 0.24459770114942528, "grad_norm": 0.3361564576625824, "learning_rate": 0.00015143699336772292, "loss": 1.3944, "num_input_tokens_seen": 3275936, "step": 665, "train_runtime": 2290.4519, "train_tokens_per_second": 1430.257 }, { "epoch": 0.2449655172413793, "grad_norm": 0.34907296299934387, "learning_rate": 0.0001513633014001474, "loss": 1.2817, "num_input_tokens_seen": 3280256, "step": 666, "train_runtime": 2293.4253, "train_tokens_per_second": 1430.287 }, { "epoch": 0.24533333333333332, "grad_norm": 0.34399649500846863, "learning_rate": 0.00015128960943257185, "loss": 1.1997, "num_input_tokens_seen": 3284928, "step": 667, "train_runtime": 2296.6832, "train_tokens_per_second": 1430.292 }, { "epoch": 0.24570114942528737, "grad_norm": 0.328960120677948, "learning_rate": 0.00015121591746499632, "loss": 1.3485, "num_input_tokens_seen": 3289328, "step": 668, "train_runtime": 2299.6873, "train_tokens_per_second": 1430.337 }, { "epoch": 0.2460689655172414, "grad_norm": 0.3279968500137329, "learning_rate": 0.00015114222549742078, "loss": 1.2129, "num_input_tokens_seen": 3294288, "step": 669, "train_runtime": 2302.9694, "train_tokens_per_second": 1430.452 }, { "epoch": 0.2464367816091954, "grad_norm": 0.3576563000679016, "learning_rate": 0.00015106853352984525, "loss": 1.1662, "num_input_tokens_seen": 3302624, "step": 670, "train_runtime": 2308.1902, "train_tokens_per_second": 1430.828 }, { "epoch": 0.24680459770114943, "grad_norm": 0.33015739917755127, "learning_rate": 0.00015099484156226974, "loss": 1.4062, "num_input_tokens_seen": 3306256, "step": 671, "train_runtime": 2310.8257, "train_tokens_per_second": 1430.768 }, { "epoch": 0.24717241379310345, "grad_norm": 0.3386419415473938, "learning_rate": 0.00015092114959469418, "loss": 1.1945, "num_input_tokens_seen": 3310096, "step": 672, "train_runtime": 2313.522, "train_tokens_per_second": 1430.761 }, { "epoch": 0.24754022988505747, "grad_norm": 0.3697667717933655, "learning_rate": 0.00015084745762711864, "loss": 1.1111, "num_input_tokens_seen": 3314272, "step": 673, "train_runtime": 2316.4016, "train_tokens_per_second": 1430.785 }, { "epoch": 0.2479080459770115, "grad_norm": 0.38225889205932617, "learning_rate": 0.0001507737656595431, "loss": 1.1731, "num_input_tokens_seen": 3317856, "step": 674, "train_runtime": 2318.9524, "train_tokens_per_second": 1430.756 }, { "epoch": 0.2482758620689655, "grad_norm": 0.4129439890384674, "learning_rate": 0.0001507000736919676, "loss": 1.2218, "num_input_tokens_seen": 3321136, "step": 675, "train_runtime": 2321.362, "train_tokens_per_second": 1430.684 }, { "epoch": 0.24864367816091953, "grad_norm": 0.33089080452919006, "learning_rate": 0.00015062638172439206, "loss": 1.332, "num_input_tokens_seen": 3325712, "step": 676, "train_runtime": 2324.4806, "train_tokens_per_second": 1430.733 }, { "epoch": 0.24901149425287356, "grad_norm": 0.31337490677833557, "learning_rate": 0.0001505526897568165, "loss": 1.1848, "num_input_tokens_seen": 3330656, "step": 677, "train_runtime": 2327.7262, "train_tokens_per_second": 1430.862 }, { "epoch": 0.24937931034482758, "grad_norm": 0.3710203468799591, "learning_rate": 0.00015047899778924097, "loss": 1.3389, "num_input_tokens_seen": 3335504, "step": 678, "train_runtime": 2330.9035, "train_tokens_per_second": 1430.992 }, { "epoch": 0.2497471264367816, "grad_norm": 0.3893492519855499, "learning_rate": 0.00015040530582166546, "loss": 1.2191, "num_input_tokens_seen": 3340224, "step": 679, "train_runtime": 2334.0724, "train_tokens_per_second": 1431.071 }, { "epoch": 0.2501149425287356, "grad_norm": 0.3619728684425354, "learning_rate": 0.00015033161385408992, "loss": 1.2595, "num_input_tokens_seen": 3344176, "step": 680, "train_runtime": 2336.8979, "train_tokens_per_second": 1431.032 }, { "epoch": 0.25048275862068964, "grad_norm": 0.3799172043800354, "learning_rate": 0.0001502579218865144, "loss": 1.2605, "num_input_tokens_seen": 3347440, "step": 681, "train_runtime": 2339.2882, "train_tokens_per_second": 1430.965 }, { "epoch": 0.25085057471264366, "grad_norm": 0.3770306408405304, "learning_rate": 0.00015018422991893882, "loss": 1.2391, "num_input_tokens_seen": 3351424, "step": 682, "train_runtime": 2342.0126, "train_tokens_per_second": 1431.002 }, { "epoch": 0.2512183908045977, "grad_norm": 0.33930251002311707, "learning_rate": 0.00015011053795136332, "loss": 1.3171, "num_input_tokens_seen": 3355168, "step": 683, "train_runtime": 2344.7316, "train_tokens_per_second": 1430.939 }, { "epoch": 0.2515862068965517, "grad_norm": 0.3217930197715759, "learning_rate": 0.00015003684598378778, "loss": 1.2046, "num_input_tokens_seen": 3361392, "step": 684, "train_runtime": 2348.6808, "train_tokens_per_second": 1431.183 }, { "epoch": 0.2519540229885057, "grad_norm": 0.3601853847503662, "learning_rate": 0.00014996315401621225, "loss": 1.2486, "num_input_tokens_seen": 3365360, "step": 685, "train_runtime": 2351.4679, "train_tokens_per_second": 1431.174 }, { "epoch": 0.2523218390804598, "grad_norm": 0.33223655819892883, "learning_rate": 0.00014988946204863668, "loss": 1.3917, "num_input_tokens_seen": 3370176, "step": 686, "train_runtime": 2354.6809, "train_tokens_per_second": 1431.267 }, { "epoch": 0.2526896551724138, "grad_norm": 0.3874072730541229, "learning_rate": 0.00014981577008106118, "loss": 1.3981, "num_input_tokens_seen": 3375168, "step": 687, "train_runtime": 2358.0085, "train_tokens_per_second": 1431.364 }, { "epoch": 0.25305747126436784, "grad_norm": 0.3030243217945099, "learning_rate": 0.00014974207811348564, "loss": 1.2081, "num_input_tokens_seen": 3382064, "step": 688, "train_runtime": 2362.475, "train_tokens_per_second": 1431.577 }, { "epoch": 0.25342528735632186, "grad_norm": 0.309259295463562, "learning_rate": 0.0001496683861459101, "loss": 1.2918, "num_input_tokens_seen": 3389872, "step": 689, "train_runtime": 2367.395, "train_tokens_per_second": 1431.9 }, { "epoch": 0.2537931034482759, "grad_norm": 0.3466988205909729, "learning_rate": 0.00014959469417833457, "loss": 1.171, "num_input_tokens_seen": 3393456, "step": 690, "train_runtime": 2369.9487, "train_tokens_per_second": 1431.869 }, { "epoch": 0.2541609195402299, "grad_norm": 0.3572579026222229, "learning_rate": 0.00014952100221075904, "loss": 1.3573, "num_input_tokens_seen": 3399648, "step": 691, "train_runtime": 2376.0364, "train_tokens_per_second": 1430.806 }, { "epoch": 0.2545287356321839, "grad_norm": 0.35369816422462463, "learning_rate": 0.0001494473102431835, "loss": 1.1169, "num_input_tokens_seen": 3403392, "step": 692, "train_runtime": 2378.7839, "train_tokens_per_second": 1430.728 }, { "epoch": 0.25489655172413794, "grad_norm": 0.339080810546875, "learning_rate": 0.00014937361827560796, "loss": 1.1781, "num_input_tokens_seen": 3411264, "step": 693, "train_runtime": 2383.7404, "train_tokens_per_second": 1431.055 }, { "epoch": 0.25526436781609196, "grad_norm": 0.3506729006767273, "learning_rate": 0.00014929992630803243, "loss": 1.1749, "num_input_tokens_seen": 3415440, "step": 694, "train_runtime": 2386.6959, "train_tokens_per_second": 1431.033 }, { "epoch": 0.255632183908046, "grad_norm": 0.3485318720340729, "learning_rate": 0.0001492262343404569, "loss": 1.2567, "num_input_tokens_seen": 3419168, "step": 695, "train_runtime": 2389.363, "train_tokens_per_second": 1430.996 }, { "epoch": 0.256, "grad_norm": 0.38310953974723816, "learning_rate": 0.00014915254237288136, "loss": 1.2558, "num_input_tokens_seen": 3423680, "step": 696, "train_runtime": 2392.46, "train_tokens_per_second": 1431.029 }, { "epoch": 0.256367816091954, "grad_norm": 0.34740230441093445, "learning_rate": 0.00014907885040530582, "loss": 1.2216, "num_input_tokens_seen": 3427920, "step": 697, "train_runtime": 2395.4158, "train_tokens_per_second": 1431.033 }, { "epoch": 0.25673563218390805, "grad_norm": 0.31901097297668457, "learning_rate": 0.0001490051584377303, "loss": 1.206, "num_input_tokens_seen": 3432432, "step": 698, "train_runtime": 2398.4438, "train_tokens_per_second": 1431.108 }, { "epoch": 0.25710344827586207, "grad_norm": 0.3171537220478058, "learning_rate": 0.00014893146647015478, "loss": 1.1877, "num_input_tokens_seen": 3437312, "step": 699, "train_runtime": 2401.7849, "train_tokens_per_second": 1431.149 }, { "epoch": 0.2574712643678161, "grad_norm": 0.38633808493614197, "learning_rate": 0.00014885777450257922, "loss": 1.3395, "num_input_tokens_seen": 3440704, "step": 700, "train_runtime": 2404.2488, "train_tokens_per_second": 1431.093 }, { "epoch": 0.2578390804597701, "grad_norm": 0.36124300956726074, "learning_rate": 0.00014878408253500368, "loss": 1.376, "num_input_tokens_seen": 3446160, "step": 701, "train_runtime": 2407.9137, "train_tokens_per_second": 1431.181 }, { "epoch": 0.25820689655172413, "grad_norm": 0.3738381862640381, "learning_rate": 0.00014871039056742815, "loss": 1.2993, "num_input_tokens_seen": 3450000, "step": 702, "train_runtime": 2410.6088, "train_tokens_per_second": 1431.174 }, { "epoch": 0.25857471264367815, "grad_norm": 0.41211527585983276, "learning_rate": 0.00014863669859985264, "loss": 1.3984, "num_input_tokens_seen": 3454160, "step": 703, "train_runtime": 2413.5428, "train_tokens_per_second": 1431.158 }, { "epoch": 0.25894252873563217, "grad_norm": 0.3279429078102112, "learning_rate": 0.00014856300663227708, "loss": 1.2641, "num_input_tokens_seen": 3457440, "step": 704, "train_runtime": 2415.9856, "train_tokens_per_second": 1431.068 }, { "epoch": 0.2593103448275862, "grad_norm": 0.305835098028183, "learning_rate": 0.00014848931466470154, "loss": 0.9934, "num_input_tokens_seen": 3461680, "step": 705, "train_runtime": 2418.9059, "train_tokens_per_second": 1431.093 }, { "epoch": 0.2596781609195402, "grad_norm": 0.25167855620384216, "learning_rate": 0.000148415622697126, "loss": 1.0183, "num_input_tokens_seen": 3475792, "step": 706, "train_runtime": 2427.4112, "train_tokens_per_second": 1431.893 }, { "epoch": 0.26004597701149423, "grad_norm": 0.34948840737342834, "learning_rate": 0.0001483419307295505, "loss": 1.1742, "num_input_tokens_seen": 3480096, "step": 707, "train_runtime": 2430.4296, "train_tokens_per_second": 1431.885 }, { "epoch": 0.26041379310344825, "grad_norm": 0.33695265650749207, "learning_rate": 0.00014826823876197496, "loss": 1.3288, "num_input_tokens_seen": 3483664, "step": 708, "train_runtime": 2432.9934, "train_tokens_per_second": 1431.843 }, { "epoch": 0.2607816091954023, "grad_norm": 0.3297808766365051, "learning_rate": 0.0001481945467943994, "loss": 1.1475, "num_input_tokens_seen": 3489824, "step": 709, "train_runtime": 2437.0575, "train_tokens_per_second": 1431.983 }, { "epoch": 0.2611494252873563, "grad_norm": 0.340537428855896, "learning_rate": 0.00014812085482682387, "loss": 1.3406, "num_input_tokens_seen": 3493296, "step": 710, "train_runtime": 2439.5964, "train_tokens_per_second": 1431.916 }, { "epoch": 0.2615172413793104, "grad_norm": 0.3442951738834381, "learning_rate": 0.00014804716285924836, "loss": 1.3046, "num_input_tokens_seen": 3499600, "step": 711, "train_runtime": 2443.7034, "train_tokens_per_second": 1432.089 }, { "epoch": 0.2618850574712644, "grad_norm": 0.33428308367729187, "learning_rate": 0.00014797347089167282, "loss": 1.1656, "num_input_tokens_seen": 3506608, "step": 712, "train_runtime": 2448.2463, "train_tokens_per_second": 1432.294 }, { "epoch": 0.2622528735632184, "grad_norm": 0.3170371353626251, "learning_rate": 0.0001478997789240973, "loss": 1.2762, "num_input_tokens_seen": 3511072, "step": 713, "train_runtime": 2451.3211, "train_tokens_per_second": 1432.318 }, { "epoch": 0.26262068965517243, "grad_norm": 0.35202986001968384, "learning_rate": 0.00014782608695652173, "loss": 1.1412, "num_input_tokens_seen": 3514560, "step": 714, "train_runtime": 2453.8613, "train_tokens_per_second": 1432.257 }, { "epoch": 0.26298850574712646, "grad_norm": 0.3663095235824585, "learning_rate": 0.00014775239498894622, "loss": 1.308, "num_input_tokens_seen": 3519328, "step": 715, "train_runtime": 2457.0199, "train_tokens_per_second": 1432.356 }, { "epoch": 0.2633563218390805, "grad_norm": 0.3512764871120453, "learning_rate": 0.00014767870302137068, "loss": 1.0741, "num_input_tokens_seen": 3522624, "step": 716, "train_runtime": 2459.5229, "train_tokens_per_second": 1432.239 }, { "epoch": 0.2637241379310345, "grad_norm": 0.323486864566803, "learning_rate": 0.00014760501105379515, "loss": 1.2378, "num_input_tokens_seen": 3528512, "step": 717, "train_runtime": 2463.3762, "train_tokens_per_second": 1432.389 }, { "epoch": 0.2640919540229885, "grad_norm": 0.34799066185951233, "learning_rate": 0.0001475313190862196, "loss": 1.405, "num_input_tokens_seen": 3534688, "step": 718, "train_runtime": 2467.4415, "train_tokens_per_second": 1432.532 }, { "epoch": 0.26445977011494254, "grad_norm": 0.41243162751197815, "learning_rate": 0.00014745762711864408, "loss": 1.3616, "num_input_tokens_seen": 3539584, "step": 719, "train_runtime": 2470.7963, "train_tokens_per_second": 1432.568 }, { "epoch": 0.26482758620689656, "grad_norm": 0.32138335704803467, "learning_rate": 0.00014738393515106854, "loss": 1.1256, "num_input_tokens_seen": 3547360, "step": 720, "train_runtime": 2475.6586, "train_tokens_per_second": 1432.895 }, { "epoch": 0.2651954022988506, "grad_norm": 0.3641934096813202, "learning_rate": 0.000147310243183493, "loss": 1.1522, "num_input_tokens_seen": 3551760, "step": 721, "train_runtime": 2480.4266, "train_tokens_per_second": 1431.915 }, { "epoch": 0.2655632183908046, "grad_norm": 0.35957276821136475, "learning_rate": 0.00014723655121591747, "loss": 1.3313, "num_input_tokens_seen": 3555520, "step": 722, "train_runtime": 2483.1092, "train_tokens_per_second": 1431.882 }, { "epoch": 0.2659310344827586, "grad_norm": 0.40129801630973816, "learning_rate": 0.00014716285924834194, "loss": 1.2624, "num_input_tokens_seen": 3559632, "step": 723, "train_runtime": 2485.9943, "train_tokens_per_second": 1431.875 }, { "epoch": 0.26629885057471264, "grad_norm": 0.3500661849975586, "learning_rate": 0.0001470891672807664, "loss": 1.3401, "num_input_tokens_seen": 3563920, "step": 724, "train_runtime": 2488.9607, "train_tokens_per_second": 1431.891 }, { "epoch": 0.26666666666666666, "grad_norm": 0.35723426938056946, "learning_rate": 0.00014701547531319087, "loss": 1.2805, "num_input_tokens_seen": 3567712, "step": 725, "train_runtime": 2491.6605, "train_tokens_per_second": 1431.861 }, { "epoch": 0.2670344827586207, "grad_norm": 0.39261963963508606, "learning_rate": 0.00014694178334561533, "loss": 1.3561, "num_input_tokens_seen": 3572800, "step": 726, "train_runtime": 2495.1222, "train_tokens_per_second": 1431.914 }, { "epoch": 0.2674022988505747, "grad_norm": 0.3508819043636322, "learning_rate": 0.0001468680913780398, "loss": 1.2249, "num_input_tokens_seen": 3577008, "step": 727, "train_runtime": 2498.0399, "train_tokens_per_second": 1431.926 }, { "epoch": 0.2677701149425287, "grad_norm": 0.3440887928009033, "learning_rate": 0.00014679439941046426, "loss": 1.1955, "num_input_tokens_seen": 3582048, "step": 728, "train_runtime": 2501.4453, "train_tokens_per_second": 1431.991 }, { "epoch": 0.26813793103448275, "grad_norm": 0.35490262508392334, "learning_rate": 0.00014672070744288873, "loss": 1.2922, "num_input_tokens_seen": 3585728, "step": 729, "train_runtime": 2504.0363, "train_tokens_per_second": 1431.979 }, { "epoch": 0.26850574712643677, "grad_norm": 0.3532816469669342, "learning_rate": 0.0001466470154753132, "loss": 1.2326, "num_input_tokens_seen": 3590192, "step": 730, "train_runtime": 2507.1604, "train_tokens_per_second": 1431.975 }, { "epoch": 0.2688735632183908, "grad_norm": 0.3759276568889618, "learning_rate": 0.00014657332350773768, "loss": 1.3548, "num_input_tokens_seen": 3593472, "step": 731, "train_runtime": 2509.6458, "train_tokens_per_second": 1431.864 }, { "epoch": 0.2692413793103448, "grad_norm": 0.3194345533847809, "learning_rate": 0.00014649963154016212, "loss": 1.2122, "num_input_tokens_seen": 3597552, "step": 732, "train_runtime": 2512.4704, "train_tokens_per_second": 1431.878 }, { "epoch": 0.26960919540229883, "grad_norm": 0.36756789684295654, "learning_rate": 0.00014642593957258658, "loss": 1.3636, "num_input_tokens_seen": 3602544, "step": 733, "train_runtime": 2515.9041, "train_tokens_per_second": 1431.908 }, { "epoch": 0.26997701149425285, "grad_norm": 0.35430723428726196, "learning_rate": 0.00014635224760501105, "loss": 1.228, "num_input_tokens_seen": 3606368, "step": 734, "train_runtime": 2518.7316, "train_tokens_per_second": 1431.819 }, { "epoch": 0.27034482758620687, "grad_norm": 0.3631165325641632, "learning_rate": 0.00014627855563743554, "loss": 1.3099, "num_input_tokens_seen": 3610240, "step": 735, "train_runtime": 2521.4438, "train_tokens_per_second": 1431.815 }, { "epoch": 0.27071264367816095, "grad_norm": 0.3637069761753082, "learning_rate": 0.00014620486366985998, "loss": 1.1917, "num_input_tokens_seen": 3613984, "step": 736, "train_runtime": 2524.0764, "train_tokens_per_second": 1431.804 }, { "epoch": 0.27108045977011497, "grad_norm": 0.3546808063983917, "learning_rate": 0.00014613117170228444, "loss": 1.2892, "num_input_tokens_seen": 3618560, "step": 737, "train_runtime": 2527.1452, "train_tokens_per_second": 1431.877 }, { "epoch": 0.271448275862069, "grad_norm": 0.3709617853164673, "learning_rate": 0.0001460574797347089, "loss": 1.1953, "num_input_tokens_seen": 3623408, "step": 738, "train_runtime": 2530.4085, "train_tokens_per_second": 1431.946 }, { "epoch": 0.271816091954023, "grad_norm": 0.35431450605392456, "learning_rate": 0.0001459837877671334, "loss": 1.3198, "num_input_tokens_seen": 3627232, "step": 739, "train_runtime": 2533.1074, "train_tokens_per_second": 1431.93 }, { "epoch": 0.27218390804597703, "grad_norm": 0.37465333938598633, "learning_rate": 0.00014591009579955787, "loss": 1.3503, "num_input_tokens_seen": 3633280, "step": 740, "train_runtime": 2537.0819, "train_tokens_per_second": 1432.07 }, { "epoch": 0.27255172413793105, "grad_norm": 0.43079355359077454, "learning_rate": 0.0001458364038319823, "loss": 1.1911, "num_input_tokens_seen": 3637856, "step": 741, "train_runtime": 2540.1823, "train_tokens_per_second": 1432.124 }, { "epoch": 0.27291954022988507, "grad_norm": 0.3299473226070404, "learning_rate": 0.00014576271186440677, "loss": 1.1145, "num_input_tokens_seen": 3641328, "step": 742, "train_runtime": 2542.7578, "train_tokens_per_second": 1432.039 }, { "epoch": 0.2732873563218391, "grad_norm": 0.3805535137653351, "learning_rate": 0.00014568901989683126, "loss": 1.0764, "num_input_tokens_seen": 3645056, "step": 743, "train_runtime": 2545.4204, "train_tokens_per_second": 1432.006 }, { "epoch": 0.2736551724137931, "grad_norm": 0.37547579407691956, "learning_rate": 0.00014561532792925573, "loss": 1.3328, "num_input_tokens_seen": 3648336, "step": 744, "train_runtime": 2547.8761, "train_tokens_per_second": 1431.913 }, { "epoch": 0.27402298850574713, "grad_norm": 0.3682103455066681, "learning_rate": 0.0001455416359616802, "loss": 1.1308, "num_input_tokens_seen": 3652496, "step": 745, "train_runtime": 2550.7942, "train_tokens_per_second": 1431.905 }, { "epoch": 0.27439080459770115, "grad_norm": 0.3358018398284912, "learning_rate": 0.00014546794399410463, "loss": 1.2951, "num_input_tokens_seen": 3658128, "step": 746, "train_runtime": 2554.5524, "train_tokens_per_second": 1432.003 }, { "epoch": 0.2747586206896552, "grad_norm": 0.3322310745716095, "learning_rate": 0.00014539425202652912, "loss": 1.3045, "num_input_tokens_seen": 3664848, "step": 747, "train_runtime": 2558.8606, "train_tokens_per_second": 1432.219 }, { "epoch": 0.2751264367816092, "grad_norm": 0.4266640245914459, "learning_rate": 0.00014532056005895358, "loss": 1.3532, "num_input_tokens_seen": 3671216, "step": 748, "train_runtime": 2562.9936, "train_tokens_per_second": 1432.394 }, { "epoch": 0.2754942528735632, "grad_norm": 0.3696272075176239, "learning_rate": 0.00014524686809137805, "loss": 1.3086, "num_input_tokens_seen": 3676736, "step": 749, "train_runtime": 2566.6764, "train_tokens_per_second": 1432.489 }, { "epoch": 0.27586206896551724, "grad_norm": 0.3480525016784668, "learning_rate": 0.00014517317612380251, "loss": 1.309, "num_input_tokens_seen": 3679520, "step": 750, "train_runtime": 2568.8727, "train_tokens_per_second": 1432.348 }, { "epoch": 0.27622988505747126, "grad_norm": 0.38454583287239075, "learning_rate": 0.00014509948415622698, "loss": 1.1951, "num_input_tokens_seen": 3686448, "step": 751, "train_runtime": 2574.8935, "train_tokens_per_second": 1431.689 }, { "epoch": 0.2765977011494253, "grad_norm": 0.3347504436969757, "learning_rate": 0.00014502579218865144, "loss": 1.1769, "num_input_tokens_seen": 3690368, "step": 752, "train_runtime": 2577.6272, "train_tokens_per_second": 1431.692 }, { "epoch": 0.2769655172413793, "grad_norm": 0.3606038987636566, "learning_rate": 0.0001449521002210759, "loss": 1.2629, "num_input_tokens_seen": 3694816, "step": 753, "train_runtime": 2580.6924, "train_tokens_per_second": 1431.715 }, { "epoch": 0.2773333333333333, "grad_norm": 0.34804779291152954, "learning_rate": 0.00014487840825350037, "loss": 1.27, "num_input_tokens_seen": 3698912, "step": 754, "train_runtime": 2583.5852, "train_tokens_per_second": 1431.697 }, { "epoch": 0.27770114942528734, "grad_norm": 0.3687753975391388, "learning_rate": 0.00014480471628592484, "loss": 1.0952, "num_input_tokens_seen": 3702352, "step": 755, "train_runtime": 2586.0673, "train_tokens_per_second": 1431.653 }, { "epoch": 0.27806896551724136, "grad_norm": 0.39494216442108154, "learning_rate": 0.0001447310243183493, "loss": 1.1941, "num_input_tokens_seen": 3707136, "step": 756, "train_runtime": 2589.3509, "train_tokens_per_second": 1431.685 }, { "epoch": 0.2784367816091954, "grad_norm": 0.3711467981338501, "learning_rate": 0.00014465733235077377, "loss": 1.2653, "num_input_tokens_seen": 3711856, "step": 757, "train_runtime": 2592.5878, "train_tokens_per_second": 1431.719 }, { "epoch": 0.2788045977011494, "grad_norm": 0.374125599861145, "learning_rate": 0.00014458364038319826, "loss": 1.1164, "num_input_tokens_seen": 3715200, "step": 758, "train_runtime": 2595.0367, "train_tokens_per_second": 1431.656 }, { "epoch": 0.2791724137931034, "grad_norm": 0.37214595079421997, "learning_rate": 0.0001445099484156227, "loss": 1.2924, "num_input_tokens_seen": 3719248, "step": 759, "train_runtime": 2597.8939, "train_tokens_per_second": 1431.64 }, { "epoch": 0.27954022988505745, "grad_norm": 0.3690154552459717, "learning_rate": 0.00014443625644804716, "loss": 1.1959, "num_input_tokens_seen": 3723152, "step": 760, "train_runtime": 2600.6256, "train_tokens_per_second": 1431.637 }, { "epoch": 0.2799080459770115, "grad_norm": 0.3575315773487091, "learning_rate": 0.00014436256448047163, "loss": 1.1708, "num_input_tokens_seen": 3726816, "step": 761, "train_runtime": 2603.2924, "train_tokens_per_second": 1431.578 }, { "epoch": 0.28027586206896554, "grad_norm": 0.4088453948497772, "learning_rate": 0.00014428887251289612, "loss": 1.2665, "num_input_tokens_seen": 3731472, "step": 762, "train_runtime": 2606.4992, "train_tokens_per_second": 1431.603 }, { "epoch": 0.28064367816091956, "grad_norm": 0.35154807567596436, "learning_rate": 0.00014421518054532058, "loss": 1.2909, "num_input_tokens_seen": 3735184, "step": 763, "train_runtime": 2609.1233, "train_tokens_per_second": 1431.586 }, { "epoch": 0.2810114942528736, "grad_norm": 0.36001941561698914, "learning_rate": 0.00014414148857774502, "loss": 1.1534, "num_input_tokens_seen": 3740592, "step": 764, "train_runtime": 2612.6182, "train_tokens_per_second": 1431.741 }, { "epoch": 0.2813793103448276, "grad_norm": 0.38879626989364624, "learning_rate": 0.00014406779661016949, "loss": 1.4079, "num_input_tokens_seen": 3744448, "step": 765, "train_runtime": 2615.3836, "train_tokens_per_second": 1431.701 }, { "epoch": 0.2817471264367816, "grad_norm": 0.38309088349342346, "learning_rate": 0.00014399410464259398, "loss": 1.3834, "num_input_tokens_seen": 3751168, "step": 766, "train_runtime": 2619.6309, "train_tokens_per_second": 1431.945 }, { "epoch": 0.28211494252873565, "grad_norm": 0.37338167428970337, "learning_rate": 0.00014392041267501844, "loss": 1.2634, "num_input_tokens_seen": 3755472, "step": 767, "train_runtime": 2622.5824, "train_tokens_per_second": 1431.975 }, { "epoch": 0.28248275862068967, "grad_norm": 0.35141757130622864, "learning_rate": 0.0001438467207074429, "loss": 1.187, "num_input_tokens_seen": 3760624, "step": 768, "train_runtime": 2626.0891, "train_tokens_per_second": 1432.025 }, { "epoch": 0.2828505747126437, "grad_norm": 0.3733404278755188, "learning_rate": 0.00014377302873986735, "loss": 1.2634, "num_input_tokens_seen": 3764880, "step": 769, "train_runtime": 2629.1064, "train_tokens_per_second": 1432.0 }, { "epoch": 0.2832183908045977, "grad_norm": 0.35038959980010986, "learning_rate": 0.00014369933677229184, "loss": 1.2856, "num_input_tokens_seen": 3768560, "step": 770, "train_runtime": 2631.7664, "train_tokens_per_second": 1431.951 }, { "epoch": 0.28358620689655173, "grad_norm": 0.4066001772880554, "learning_rate": 0.0001436256448047163, "loss": 1.2666, "num_input_tokens_seen": 3771728, "step": 771, "train_runtime": 2634.1337, "train_tokens_per_second": 1431.867 }, { "epoch": 0.28395402298850575, "grad_norm": 0.36203107237815857, "learning_rate": 0.00014355195283714077, "loss": 1.2935, "num_input_tokens_seen": 3779408, "step": 772, "train_runtime": 2638.9535, "train_tokens_per_second": 1432.162 }, { "epoch": 0.28432183908045977, "grad_norm": 0.3711211681365967, "learning_rate": 0.0001434782608695652, "loss": 1.2945, "num_input_tokens_seen": 3783328, "step": 773, "train_runtime": 2641.7507, "train_tokens_per_second": 1432.129 }, { "epoch": 0.2846896551724138, "grad_norm": 0.3628079295158386, "learning_rate": 0.0001434045689019897, "loss": 1.285, "num_input_tokens_seen": 3792112, "step": 774, "train_runtime": 2647.1875, "train_tokens_per_second": 1432.506 }, { "epoch": 0.2850574712643678, "grad_norm": 0.3806452453136444, "learning_rate": 0.00014333087693441416, "loss": 1.2512, "num_input_tokens_seen": 3795872, "step": 775, "train_runtime": 2649.8756, "train_tokens_per_second": 1432.472 }, { "epoch": 0.28542528735632183, "grad_norm": 0.37157365679740906, "learning_rate": 0.00014325718496683863, "loss": 1.3842, "num_input_tokens_seen": 3802144, "step": 776, "train_runtime": 2653.9266, "train_tokens_per_second": 1432.649 }, { "epoch": 0.28579310344827585, "grad_norm": 0.35492148995399475, "learning_rate": 0.0001431834929992631, "loss": 1.2058, "num_input_tokens_seen": 3804944, "step": 777, "train_runtime": 2656.098, "train_tokens_per_second": 1432.532 }, { "epoch": 0.2861609195402299, "grad_norm": 0.3418777585029602, "learning_rate": 0.00014310980103168756, "loss": 1.2545, "num_input_tokens_seen": 3810304, "step": 778, "train_runtime": 2659.6487, "train_tokens_per_second": 1432.634 }, { "epoch": 0.2865287356321839, "grad_norm": 0.34898510575294495, "learning_rate": 0.00014303610906411202, "loss": 1.2304, "num_input_tokens_seen": 3814720, "step": 779, "train_runtime": 2662.6579, "train_tokens_per_second": 1432.674 }, { "epoch": 0.2868965517241379, "grad_norm": 0.351762980222702, "learning_rate": 0.00014296241709653649, "loss": 1.1135, "num_input_tokens_seen": 3817904, "step": 780, "train_runtime": 2665.0414, "train_tokens_per_second": 1432.587 }, { "epoch": 0.28726436781609194, "grad_norm": 0.33062925934791565, "learning_rate": 0.00014288872512896095, "loss": 1.1541, "num_input_tokens_seen": 3822288, "step": 781, "train_runtime": 2670.1056, "train_tokens_per_second": 1431.512 }, { "epoch": 0.28763218390804596, "grad_norm": 0.37835007905960083, "learning_rate": 0.00014281503316138542, "loss": 1.3553, "num_input_tokens_seen": 3826272, "step": 782, "train_runtime": 2672.8532, "train_tokens_per_second": 1431.531 }, { "epoch": 0.288, "grad_norm": 0.3742969334125519, "learning_rate": 0.00014274134119380988, "loss": 1.1948, "num_input_tokens_seen": 3830544, "step": 783, "train_runtime": 2675.7975, "train_tokens_per_second": 1431.552 }, { "epoch": 0.288367816091954, "grad_norm": 0.3816350996494293, "learning_rate": 0.00014266764922623434, "loss": 1.373, "num_input_tokens_seen": 3834896, "step": 784, "train_runtime": 2678.7294, "train_tokens_per_second": 1431.61 }, { "epoch": 0.288735632183908, "grad_norm": 0.31429529190063477, "learning_rate": 0.0001425939572586588, "loss": 1.1678, "num_input_tokens_seen": 3838720, "step": 785, "train_runtime": 2681.4032, "train_tokens_per_second": 1431.609 }, { "epoch": 0.2891034482758621, "grad_norm": 0.34054291248321533, "learning_rate": 0.00014252026529108327, "loss": 1.1999, "num_input_tokens_seen": 3842800, "step": 786, "train_runtime": 2684.2349, "train_tokens_per_second": 1431.618 }, { "epoch": 0.2894712643678161, "grad_norm": 0.3909076452255249, "learning_rate": 0.00014244657332350774, "loss": 1.1922, "num_input_tokens_seen": 3848688, "step": 787, "train_runtime": 2688.1308, "train_tokens_per_second": 1431.734 }, { "epoch": 0.28983908045977014, "grad_norm": 0.3771749436855316, "learning_rate": 0.0001423728813559322, "loss": 1.2433, "num_input_tokens_seen": 3853808, "step": 788, "train_runtime": 2691.583, "train_tokens_per_second": 1431.8 }, { "epoch": 0.29020689655172416, "grad_norm": 0.39928269386291504, "learning_rate": 0.00014229918938835667, "loss": 1.4231, "num_input_tokens_seen": 3858016, "step": 789, "train_runtime": 2694.4798, "train_tokens_per_second": 1431.822 }, { "epoch": 0.2905747126436782, "grad_norm": 0.345500111579895, "learning_rate": 0.00014222549742078116, "loss": 1.3395, "num_input_tokens_seen": 3864576, "step": 790, "train_runtime": 2698.6146, "train_tokens_per_second": 1432.059 }, { "epoch": 0.2909425287356322, "grad_norm": 0.33229881525039673, "learning_rate": 0.0001421518054532056, "loss": 1.3211, "num_input_tokens_seen": 3869104, "step": 791, "train_runtime": 2701.67, "train_tokens_per_second": 1432.116 }, { "epoch": 0.2913103448275862, "grad_norm": 0.3693390488624573, "learning_rate": 0.00014207811348563006, "loss": 1.4466, "num_input_tokens_seen": 3872880, "step": 792, "train_runtime": 2704.2742, "train_tokens_per_second": 1432.133 }, { "epoch": 0.29167816091954024, "grad_norm": 0.42008399963378906, "learning_rate": 0.00014200442151805453, "loss": 1.2877, "num_input_tokens_seen": 3878096, "step": 793, "train_runtime": 2707.7595, "train_tokens_per_second": 1432.216 }, { "epoch": 0.29204597701149426, "grad_norm": 0.3797346353530884, "learning_rate": 0.00014193072955047902, "loss": 1.2511, "num_input_tokens_seen": 3882688, "step": 794, "train_runtime": 2710.8803, "train_tokens_per_second": 1432.261 }, { "epoch": 0.2924137931034483, "grad_norm": 0.3746705949306488, "learning_rate": 0.00014185703758290349, "loss": 1.2108, "num_input_tokens_seen": 3889456, "step": 795, "train_runtime": 2715.1749, "train_tokens_per_second": 1432.488 }, { "epoch": 0.2927816091954023, "grad_norm": 0.38660576939582825, "learning_rate": 0.00014178334561532792, "loss": 1.1945, "num_input_tokens_seen": 3893216, "step": 796, "train_runtime": 2717.8414, "train_tokens_per_second": 1432.466 }, { "epoch": 0.2931494252873563, "grad_norm": 0.35182976722717285, "learning_rate": 0.0001417096536477524, "loss": 1.2695, "num_input_tokens_seen": 3898144, "step": 797, "train_runtime": 2721.2337, "train_tokens_per_second": 1432.491 }, { "epoch": 0.29351724137931035, "grad_norm": 0.374563604593277, "learning_rate": 0.00014163596168017688, "loss": 1.3673, "num_input_tokens_seen": 3902384, "step": 798, "train_runtime": 2724.1908, "train_tokens_per_second": 1432.493 }, { "epoch": 0.29388505747126437, "grad_norm": 0.33761313557624817, "learning_rate": 0.00014156226971260134, "loss": 1.1371, "num_input_tokens_seen": 3908016, "step": 799, "train_runtime": 2727.9158, "train_tokens_per_second": 1432.601 }, { "epoch": 0.2942528735632184, "grad_norm": 0.36212578415870667, "learning_rate": 0.0001414885777450258, "loss": 1.3324, "num_input_tokens_seen": 3912384, "step": 800, "train_runtime": 2730.9785, "train_tokens_per_second": 1432.594 }, { "epoch": 0.2946206896551724, "grad_norm": 0.3794098198413849, "learning_rate": 0.00014141488577745025, "loss": 1.2653, "num_input_tokens_seen": 3918592, "step": 801, "train_runtime": 2734.9526, "train_tokens_per_second": 1432.782 }, { "epoch": 0.29498850574712643, "grad_norm": 0.33707788586616516, "learning_rate": 0.00014134119380987474, "loss": 1.1963, "num_input_tokens_seen": 3924432, "step": 802, "train_runtime": 2738.8145, "train_tokens_per_second": 1432.894 }, { "epoch": 0.29535632183908045, "grad_norm": 0.3408147096633911, "learning_rate": 0.0001412675018422992, "loss": 1.2344, "num_input_tokens_seen": 3928400, "step": 803, "train_runtime": 2741.6374, "train_tokens_per_second": 1432.866 }, { "epoch": 0.29572413793103447, "grad_norm": 0.4036368131637573, "learning_rate": 0.00014119380987472367, "loss": 1.3421, "num_input_tokens_seen": 3931920, "step": 804, "train_runtime": 2744.1924, "train_tokens_per_second": 1432.815 }, { "epoch": 0.2960919540229885, "grad_norm": 0.3561180531978607, "learning_rate": 0.0001411201179071481, "loss": 1.3033, "num_input_tokens_seen": 3937200, "step": 805, "train_runtime": 2747.6812, "train_tokens_per_second": 1432.917 }, { "epoch": 0.2964597701149425, "grad_norm": 0.3317915201187134, "learning_rate": 0.0001410464259395726, "loss": 1.2202, "num_input_tokens_seen": 3941488, "step": 806, "train_runtime": 2750.6343, "train_tokens_per_second": 1432.938 }, { "epoch": 0.29682758620689653, "grad_norm": 0.3520815670490265, "learning_rate": 0.00014097273397199706, "loss": 1.2568, "num_input_tokens_seen": 3946640, "step": 807, "train_runtime": 2754.0538, "train_tokens_per_second": 1433.029 }, { "epoch": 0.29719540229885055, "grad_norm": 0.3856048285961151, "learning_rate": 0.00014089904200442153, "loss": 1.3211, "num_input_tokens_seen": 3949952, "step": 808, "train_runtime": 2756.4612, "train_tokens_per_second": 1432.979 }, { "epoch": 0.2975632183908046, "grad_norm": 0.3464462161064148, "learning_rate": 0.000140825350036846, "loss": 1.2971, "num_input_tokens_seen": 3953760, "step": 809, "train_runtime": 2759.174, "train_tokens_per_second": 1432.951 }, { "epoch": 0.2979310344827586, "grad_norm": 0.3052591383457184, "learning_rate": 0.00014075165806927046, "loss": 1.0736, "num_input_tokens_seen": 3973888, "step": 810, "train_runtime": 2777.3701, "train_tokens_per_second": 1430.81 }, { "epoch": 0.29829885057471267, "grad_norm": 0.37174367904663086, "learning_rate": 0.00014067796610169492, "loss": 1.1998, "num_input_tokens_seen": 3978432, "step": 811, "train_runtime": 2782.5261, "train_tokens_per_second": 1429.791 }, { "epoch": 0.2986666666666667, "grad_norm": 0.33270713686943054, "learning_rate": 0.0001406042741341194, "loss": 1.3258, "num_input_tokens_seen": 3982688, "step": 812, "train_runtime": 2785.4371, "train_tokens_per_second": 1429.825 }, { "epoch": 0.2990344827586207, "grad_norm": 0.3413871228694916, "learning_rate": 0.00014053058216654385, "loss": 1.1881, "num_input_tokens_seen": 3986352, "step": 813, "train_runtime": 2787.996, "train_tokens_per_second": 1429.827 }, { "epoch": 0.29940229885057473, "grad_norm": 0.3527846932411194, "learning_rate": 0.00014045689019896832, "loss": 1.1748, "num_input_tokens_seen": 3993104, "step": 814, "train_runtime": 2792.2466, "train_tokens_per_second": 1430.069 }, { "epoch": 0.29977011494252875, "grad_norm": 0.35125231742858887, "learning_rate": 0.00014038319823139278, "loss": 1.2081, "num_input_tokens_seen": 3997856, "step": 815, "train_runtime": 2795.5103, "train_tokens_per_second": 1430.099 }, { "epoch": 0.3001379310344828, "grad_norm": 0.3626596927642822, "learning_rate": 0.00014030950626381725, "loss": 1.2606, "num_input_tokens_seen": 4002688, "step": 816, "train_runtime": 2798.856, "train_tokens_per_second": 1430.116 }, { "epoch": 0.3001379310344828, "eval_loss": 1.2582504749298096, "eval_runtime": 15.4607, "eval_samples_per_second": 64.68, "eval_steps_per_second": 4.075, "num_input_tokens_seen": 4002688, "step": 816 }, { "epoch": 0.3005057471264368, "grad_norm": 0.34670722484588623, "learning_rate": 0.0001402358142962417, "loss": 1.222, "num_input_tokens_seen": 4013536, "step": 817, "train_runtime": 2821.0771, "train_tokens_per_second": 1422.696 }, { "epoch": 0.3008735632183908, "grad_norm": 0.3271850645542145, "learning_rate": 0.0001401621223286662, "loss": 1.1984, "num_input_tokens_seen": 4019024, "step": 818, "train_runtime": 2824.7163, "train_tokens_per_second": 1422.806 }, { "epoch": 0.30124137931034484, "grad_norm": 0.36956825852394104, "learning_rate": 0.00014008843036109064, "loss": 1.2282, "num_input_tokens_seen": 4027216, "step": 819, "train_runtime": 2829.7549, "train_tokens_per_second": 1423.168 }, { "epoch": 0.30160919540229886, "grad_norm": 0.37119704484939575, "learning_rate": 0.0001400147383935151, "loss": 1.2695, "num_input_tokens_seen": 4031088, "step": 820, "train_runtime": 2832.6029, "train_tokens_per_second": 1423.104 }, { "epoch": 0.3019770114942529, "grad_norm": 0.3455086648464203, "learning_rate": 0.00013994104642593957, "loss": 1.1874, "num_input_tokens_seen": 4036592, "step": 821, "train_runtime": 2836.2378, "train_tokens_per_second": 1423.221 }, { "epoch": 0.3023448275862069, "grad_norm": 0.32548725605010986, "learning_rate": 0.00013986735445836406, "loss": 1.259, "num_input_tokens_seen": 4042752, "step": 822, "train_runtime": 2840.2091, "train_tokens_per_second": 1423.399 }, { "epoch": 0.3027126436781609, "grad_norm": 0.38643863797187805, "learning_rate": 0.0001397936624907885, "loss": 1.3641, "num_input_tokens_seen": 4049392, "step": 823, "train_runtime": 2844.4764, "train_tokens_per_second": 1423.598 }, { "epoch": 0.30308045977011494, "grad_norm": 0.33685386180877686, "learning_rate": 0.00013971997052321296, "loss": 1.161, "num_input_tokens_seen": 4052960, "step": 824, "train_runtime": 2847.1058, "train_tokens_per_second": 1423.537 }, { "epoch": 0.30344827586206896, "grad_norm": 0.34240755438804626, "learning_rate": 0.00013964627855563743, "loss": 1.3907, "num_input_tokens_seen": 4056784, "step": 825, "train_runtime": 2849.7671, "train_tokens_per_second": 1423.549 }, { "epoch": 0.303816091954023, "grad_norm": 0.36610493063926697, "learning_rate": 0.00013957258658806192, "loss": 1.1741, "num_input_tokens_seen": 4061424, "step": 826, "train_runtime": 2852.9142, "train_tokens_per_second": 1423.605 }, { "epoch": 0.304183908045977, "grad_norm": 0.3073885440826416, "learning_rate": 0.0001394988946204864, "loss": 1.224, "num_input_tokens_seen": 4070176, "step": 827, "train_runtime": 2858.4139, "train_tokens_per_second": 1423.928 }, { "epoch": 0.304551724137931, "grad_norm": 0.3592829406261444, "learning_rate": 0.00013942520265291082, "loss": 1.2882, "num_input_tokens_seen": 4073824, "step": 828, "train_runtime": 2861.0739, "train_tokens_per_second": 1423.879 }, { "epoch": 0.30491954022988504, "grad_norm": 0.34713849425315857, "learning_rate": 0.0001393515106853353, "loss": 1.2273, "num_input_tokens_seen": 4077792, "step": 829, "train_runtime": 2863.9315, "train_tokens_per_second": 1423.844 }, { "epoch": 0.30528735632183907, "grad_norm": 0.3161631226539612, "learning_rate": 0.00013927781871775978, "loss": 1.2369, "num_input_tokens_seen": 4082384, "step": 830, "train_runtime": 2867.1532, "train_tokens_per_second": 1423.846 }, { "epoch": 0.3056551724137931, "grad_norm": 0.3770533502101898, "learning_rate": 0.00013920412675018425, "loss": 1.2978, "num_input_tokens_seen": 4087136, "step": 831, "train_runtime": 2870.4385, "train_tokens_per_second": 1423.872 }, { "epoch": 0.3060229885057471, "grad_norm": 0.34934914112091064, "learning_rate": 0.0001391304347826087, "loss": 1.2095, "num_input_tokens_seen": 4091360, "step": 832, "train_runtime": 2873.4129, "train_tokens_per_second": 1423.868 }, { "epoch": 0.3063908045977011, "grad_norm": 0.3711075484752655, "learning_rate": 0.00013905674281503315, "loss": 1.3721, "num_input_tokens_seen": 4095984, "step": 833, "train_runtime": 2876.5479, "train_tokens_per_second": 1423.923 }, { "epoch": 0.30675862068965515, "grad_norm": 0.40674078464508057, "learning_rate": 0.00013898305084745764, "loss": 1.195, "num_input_tokens_seen": 4099296, "step": 834, "train_runtime": 2879.0, "train_tokens_per_second": 1423.861 }, { "epoch": 0.30712643678160917, "grad_norm": 0.3847304880619049, "learning_rate": 0.0001389093588798821, "loss": 1.2805, "num_input_tokens_seen": 4103968, "step": 835, "train_runtime": 2882.2299, "train_tokens_per_second": 1423.886 }, { "epoch": 0.30749425287356325, "grad_norm": 0.3264797031879425, "learning_rate": 0.00013883566691230657, "loss": 1.2059, "num_input_tokens_seen": 4107600, "step": 836, "train_runtime": 2884.8201, "train_tokens_per_second": 1423.867 }, { "epoch": 0.30786206896551727, "grad_norm": 0.31736651062965393, "learning_rate": 0.00013876197494473103, "loss": 1.2878, "num_input_tokens_seen": 4119152, "step": 837, "train_runtime": 2891.7585, "train_tokens_per_second": 1424.445 }, { "epoch": 0.3082298850574713, "grad_norm": 0.37409865856170654, "learning_rate": 0.0001386882829771555, "loss": 1.1886, "num_input_tokens_seen": 4123792, "step": 838, "train_runtime": 2894.9126, "train_tokens_per_second": 1424.496 }, { "epoch": 0.3085977011494253, "grad_norm": 0.31045854091644287, "learning_rate": 0.00013861459100957996, "loss": 1.2056, "num_input_tokens_seen": 4129296, "step": 839, "train_runtime": 2898.6389, "train_tokens_per_second": 1424.564 }, { "epoch": 0.30896551724137933, "grad_norm": 0.38559892773628235, "learning_rate": 0.00013854089904200443, "loss": 1.3225, "num_input_tokens_seen": 4133088, "step": 840, "train_runtime": 2901.3552, "train_tokens_per_second": 1424.537 }, { "epoch": 0.30933333333333335, "grad_norm": 0.3517187535762787, "learning_rate": 0.0001384672070744289, "loss": 1.1359, "num_input_tokens_seen": 4136672, "step": 841, "train_runtime": 2906.2971, "train_tokens_per_second": 1423.348 }, { "epoch": 0.30970114942528737, "grad_norm": 0.32055985927581787, "learning_rate": 0.00013839351510685336, "loss": 1.1527, "num_input_tokens_seen": 4141024, "step": 842, "train_runtime": 2909.2928, "train_tokens_per_second": 1423.378 }, { "epoch": 0.3100689655172414, "grad_norm": 0.34698328375816345, "learning_rate": 0.00013831982313927782, "loss": 1.0366, "num_input_tokens_seen": 4146720, "step": 843, "train_runtime": 2913.0825, "train_tokens_per_second": 1423.482 }, { "epoch": 0.3104367816091954, "grad_norm": 0.3303372859954834, "learning_rate": 0.0001382461311717023, "loss": 1.1924, "num_input_tokens_seen": 4152224, "step": 844, "train_runtime": 2916.847, "train_tokens_per_second": 1423.532 }, { "epoch": 0.31080459770114943, "grad_norm": 0.34514808654785156, "learning_rate": 0.00013817243920412675, "loss": 1.1748, "num_input_tokens_seen": 4155280, "step": 845, "train_runtime": 2919.2146, "train_tokens_per_second": 1423.424 }, { "epoch": 0.31117241379310345, "grad_norm": 0.3158557415008545, "learning_rate": 0.00013809874723655122, "loss": 1.1718, "num_input_tokens_seen": 4162064, "step": 846, "train_runtime": 2923.603, "train_tokens_per_second": 1423.608 }, { "epoch": 0.3115402298850575, "grad_norm": 0.41774293780326843, "learning_rate": 0.00013802505526897568, "loss": 1.2337, "num_input_tokens_seen": 4166496, "step": 847, "train_runtime": 2926.6241, "train_tokens_per_second": 1423.653 }, { "epoch": 0.3119080459770115, "grad_norm": 0.3888136148452759, "learning_rate": 0.00013795136330140015, "loss": 1.1873, "num_input_tokens_seen": 4170656, "step": 848, "train_runtime": 2929.5387, "train_tokens_per_second": 1423.656 }, { "epoch": 0.3122758620689655, "grad_norm": 0.36558911204338074, "learning_rate": 0.0001378776713338246, "loss": 1.2043, "num_input_tokens_seen": 4174304, "step": 849, "train_runtime": 2932.1898, "train_tokens_per_second": 1423.613 }, { "epoch": 0.31264367816091954, "grad_norm": 0.34464168548583984, "learning_rate": 0.0001378039793662491, "loss": 1.3803, "num_input_tokens_seen": 4182480, "step": 850, "train_runtime": 2937.1931, "train_tokens_per_second": 1423.972 }, { "epoch": 0.31301149425287356, "grad_norm": 0.38367730379104614, "learning_rate": 0.00013773028739867354, "loss": 1.2086, "num_input_tokens_seen": 4187792, "step": 851, "train_runtime": 2940.7539, "train_tokens_per_second": 1424.054 }, { "epoch": 0.3133793103448276, "grad_norm": 0.36858445405960083, "learning_rate": 0.000137656595431098, "loss": 1.2054, "num_input_tokens_seen": 4197328, "step": 852, "train_runtime": 2946.6626, "train_tokens_per_second": 1424.435 }, { "epoch": 0.3137471264367816, "grad_norm": 0.36488014459609985, "learning_rate": 0.00013758290346352247, "loss": 1.2279, "num_input_tokens_seen": 4200848, "step": 853, "train_runtime": 2949.2275, "train_tokens_per_second": 1424.389 }, { "epoch": 0.3141149425287356, "grad_norm": 0.3878115713596344, "learning_rate": 0.00013750921149594696, "loss": 1.1837, "num_input_tokens_seen": 4206064, "step": 854, "train_runtime": 2952.7468, "train_tokens_per_second": 1424.458 }, { "epoch": 0.31448275862068964, "grad_norm": 0.374013751745224, "learning_rate": 0.0001374355195283714, "loss": 1.1583, "num_input_tokens_seen": 4212608, "step": 855, "train_runtime": 2956.9923, "train_tokens_per_second": 1424.626 }, { "epoch": 0.31485057471264366, "grad_norm": 0.32198452949523926, "learning_rate": 0.00013736182756079587, "loss": 1.0892, "num_input_tokens_seen": 4218368, "step": 856, "train_runtime": 2960.6824, "train_tokens_per_second": 1424.796 }, { "epoch": 0.3152183908045977, "grad_norm": 0.3488846719264984, "learning_rate": 0.00013728813559322033, "loss": 1.22, "num_input_tokens_seen": 4224032, "step": 857, "train_runtime": 2964.4227, "train_tokens_per_second": 1424.909 }, { "epoch": 0.3155862068965517, "grad_norm": 0.35620829463005066, "learning_rate": 0.00013721444362564482, "loss": 1.2182, "num_input_tokens_seen": 4232656, "step": 858, "train_runtime": 2969.731, "train_tokens_per_second": 1425.266 }, { "epoch": 0.3159540229885057, "grad_norm": 0.3545152544975281, "learning_rate": 0.0001371407516580693, "loss": 1.2895, "num_input_tokens_seen": 4236976, "step": 859, "train_runtime": 2972.7789, "train_tokens_per_second": 1425.258 }, { "epoch": 0.31632183908045974, "grad_norm": 0.3103776276111603, "learning_rate": 0.00013706705969049373, "loss": 1.2293, "num_input_tokens_seen": 4244128, "step": 860, "train_runtime": 2977.2706, "train_tokens_per_second": 1425.51 }, { "epoch": 0.3166896551724138, "grad_norm": 0.3932916820049286, "learning_rate": 0.0001369933677229182, "loss": 1.2819, "num_input_tokens_seen": 4247472, "step": 861, "train_runtime": 2979.6948, "train_tokens_per_second": 1425.472 }, { "epoch": 0.31705747126436784, "grad_norm": 0.3986624777317047, "learning_rate": 0.00013691967575534268, "loss": 1.2419, "num_input_tokens_seen": 4251840, "step": 862, "train_runtime": 2982.7573, "train_tokens_per_second": 1425.473 }, { "epoch": 0.31742528735632186, "grad_norm": 0.3446524739265442, "learning_rate": 0.00013684598378776715, "loss": 1.2602, "num_input_tokens_seen": 4257024, "step": 863, "train_runtime": 2986.2977, "train_tokens_per_second": 1425.519 }, { "epoch": 0.3177931034482759, "grad_norm": 0.35753557085990906, "learning_rate": 0.0001367722918201916, "loss": 1.2159, "num_input_tokens_seen": 4260304, "step": 864, "train_runtime": 2988.7913, "train_tokens_per_second": 1425.427 }, { "epoch": 0.3181609195402299, "grad_norm": 0.36021220684051514, "learning_rate": 0.00013669859985261605, "loss": 1.1423, "num_input_tokens_seen": 4265776, "step": 865, "train_runtime": 2992.402, "train_tokens_per_second": 1425.536 }, { "epoch": 0.3185287356321839, "grad_norm": 0.36315014958381653, "learning_rate": 0.00013662490788504054, "loss": 1.2235, "num_input_tokens_seen": 4269584, "step": 866, "train_runtime": 2995.0121, "train_tokens_per_second": 1425.565 }, { "epoch": 0.31889655172413794, "grad_norm": 0.37905824184417725, "learning_rate": 0.000136551215917465, "loss": 1.2489, "num_input_tokens_seen": 4273360, "step": 867, "train_runtime": 2997.7276, "train_tokens_per_second": 1425.533 }, { "epoch": 0.31926436781609197, "grad_norm": 0.3535110056400299, "learning_rate": 0.00013647752394988947, "loss": 1.3607, "num_input_tokens_seen": 4278000, "step": 868, "train_runtime": 3000.9476, "train_tokens_per_second": 1425.55 }, { "epoch": 0.319632183908046, "grad_norm": 0.41026008129119873, "learning_rate": 0.00013640383198231394, "loss": 1.3032, "num_input_tokens_seen": 4281264, "step": 869, "train_runtime": 3003.3614, "train_tokens_per_second": 1425.491 }, { "epoch": 0.32, "grad_norm": 0.36517083644866943, "learning_rate": 0.0001363301400147384, "loss": 1.1699, "num_input_tokens_seen": 4285504, "step": 870, "train_runtime": 3006.6246, "train_tokens_per_second": 1425.354 }, { "epoch": 0.320367816091954, "grad_norm": 0.38390645384788513, "learning_rate": 0.00013625644804716287, "loss": 1.232, "num_input_tokens_seen": 4291184, "step": 871, "train_runtime": 3012.417, "train_tokens_per_second": 1424.499 }, { "epoch": 0.32073563218390805, "grad_norm": 0.34316956996917725, "learning_rate": 0.00013618275607958733, "loss": 1.2474, "num_input_tokens_seen": 4295120, "step": 872, "train_runtime": 3015.2289, "train_tokens_per_second": 1424.476 }, { "epoch": 0.32110344827586207, "grad_norm": 0.3473661541938782, "learning_rate": 0.0001361090641120118, "loss": 1.2379, "num_input_tokens_seen": 4299536, "step": 873, "train_runtime": 3018.3052, "train_tokens_per_second": 1424.487 }, { "epoch": 0.3214712643678161, "grad_norm": 0.3860956132411957, "learning_rate": 0.00013603537214443626, "loss": 1.1806, "num_input_tokens_seen": 4303776, "step": 874, "train_runtime": 3021.1917, "train_tokens_per_second": 1424.529 }, { "epoch": 0.3218390804597701, "grad_norm": 0.3867058753967285, "learning_rate": 0.00013596168017686072, "loss": 1.2291, "num_input_tokens_seen": 4308144, "step": 875, "train_runtime": 3024.2323, "train_tokens_per_second": 1424.541 }, { "epoch": 0.32220689655172413, "grad_norm": 0.3715849220752716, "learning_rate": 0.0001358879882092852, "loss": 1.3374, "num_input_tokens_seen": 4313248, "step": 876, "train_runtime": 3027.5392, "train_tokens_per_second": 1424.671 }, { "epoch": 0.32257471264367815, "grad_norm": 0.39966294169425964, "learning_rate": 0.00013581429624170968, "loss": 1.1806, "num_input_tokens_seen": 4318528, "step": 877, "train_runtime": 3031.1347, "train_tokens_per_second": 1424.723 }, { "epoch": 0.3229425287356322, "grad_norm": 0.34188470244407654, "learning_rate": 0.00013574060427413412, "loss": 1.2269, "num_input_tokens_seen": 4322608, "step": 878, "train_runtime": 3033.9163, "train_tokens_per_second": 1424.762 }, { "epoch": 0.3233103448275862, "grad_norm": 0.3809266984462738, "learning_rate": 0.00013566691230655858, "loss": 1.264, "num_input_tokens_seen": 4327824, "step": 879, "train_runtime": 3037.38, "train_tokens_per_second": 1424.854 }, { "epoch": 0.3236781609195402, "grad_norm": 0.33910226821899414, "learning_rate": 0.00013559322033898305, "loss": 1.202, "num_input_tokens_seen": 4332736, "step": 880, "train_runtime": 3040.7361, "train_tokens_per_second": 1424.897 }, { "epoch": 0.32404597701149424, "grad_norm": 0.38752177357673645, "learning_rate": 0.00013551952837140754, "loss": 1.2626, "num_input_tokens_seen": 4336864, "step": 881, "train_runtime": 3043.6928, "train_tokens_per_second": 1424.869 }, { "epoch": 0.32441379310344826, "grad_norm": 0.3363444209098816, "learning_rate": 0.000135445836403832, "loss": 1.2612, "num_input_tokens_seen": 4340288, "step": 882, "train_runtime": 3046.2645, "train_tokens_per_second": 1424.79 }, { "epoch": 0.3247816091954023, "grad_norm": 0.34718260169029236, "learning_rate": 0.00013537214443625644, "loss": 1.155, "num_input_tokens_seen": 4343376, "step": 883, "train_runtime": 3048.5796, "train_tokens_per_second": 1424.721 }, { "epoch": 0.3251494252873563, "grad_norm": 0.4002636671066284, "learning_rate": 0.0001352984524686809, "loss": 1.3875, "num_input_tokens_seen": 4349152, "step": 884, "train_runtime": 3052.385, "train_tokens_per_second": 1424.837 }, { "epoch": 0.3255172413793103, "grad_norm": 0.35120221972465515, "learning_rate": 0.0001352247605011054, "loss": 1.1387, "num_input_tokens_seen": 4353232, "step": 885, "train_runtime": 3055.2488, "train_tokens_per_second": 1424.837 }, { "epoch": 0.3258850574712644, "grad_norm": 0.3691864311695099, "learning_rate": 0.00013515106853352987, "loss": 1.2017, "num_input_tokens_seen": 4358288, "step": 886, "train_runtime": 3058.7541, "train_tokens_per_second": 1424.857 }, { "epoch": 0.3262528735632184, "grad_norm": 0.3733488619327545, "learning_rate": 0.00013507737656595433, "loss": 1.2489, "num_input_tokens_seen": 4362208, "step": 887, "train_runtime": 3061.5269, "train_tokens_per_second": 1424.847 }, { "epoch": 0.32662068965517244, "grad_norm": 0.3438883125782013, "learning_rate": 0.00013500368459837877, "loss": 1.2437, "num_input_tokens_seen": 4366880, "step": 888, "train_runtime": 3064.7051, "train_tokens_per_second": 1424.894 }, { "epoch": 0.32698850574712646, "grad_norm": 0.3556538224220276, "learning_rate": 0.00013492999263080326, "loss": 1.1462, "num_input_tokens_seen": 4370704, "step": 889, "train_runtime": 3067.3671, "train_tokens_per_second": 1424.904 }, { "epoch": 0.3273563218390805, "grad_norm": 0.35471776127815247, "learning_rate": 0.00013485630066322772, "loss": 1.1785, "num_input_tokens_seen": 4376976, "step": 890, "train_runtime": 3071.4714, "train_tokens_per_second": 1425.042 }, { "epoch": 0.3277241379310345, "grad_norm": 0.37259984016418457, "learning_rate": 0.0001347826086956522, "loss": 1.2901, "num_input_tokens_seen": 4381040, "step": 891, "train_runtime": 3074.2758, "train_tokens_per_second": 1425.064 }, { "epoch": 0.3280919540229885, "grad_norm": 0.3603115379810333, "learning_rate": 0.00013470891672807663, "loss": 1.3182, "num_input_tokens_seen": 4384912, "step": 892, "train_runtime": 3077.0913, "train_tokens_per_second": 1425.019 }, { "epoch": 0.32845977011494254, "grad_norm": 0.3494568169116974, "learning_rate": 0.00013463522476050112, "loss": 1.2556, "num_input_tokens_seen": 4390144, "step": 893, "train_runtime": 3080.5308, "train_tokens_per_second": 1425.126 }, { "epoch": 0.32882758620689656, "grad_norm": 0.3400580585002899, "learning_rate": 0.00013456153279292558, "loss": 1.2658, "num_input_tokens_seen": 4394352, "step": 894, "train_runtime": 3083.4253, "train_tokens_per_second": 1425.153 }, { "epoch": 0.3291954022988506, "grad_norm": 0.3196541666984558, "learning_rate": 0.00013448784082535005, "loss": 1.2209, "num_input_tokens_seen": 4400384, "step": 895, "train_runtime": 3087.3267, "train_tokens_per_second": 1425.306 }, { "epoch": 0.3295632183908046, "grad_norm": 0.36949363350868225, "learning_rate": 0.0001344141488577745, "loss": 1.1314, "num_input_tokens_seen": 4406416, "step": 896, "train_runtime": 3091.2935, "train_tokens_per_second": 1425.428 }, { "epoch": 0.3299310344827586, "grad_norm": 0.33267271518707275, "learning_rate": 0.00013434045689019898, "loss": 1.2986, "num_input_tokens_seen": 4410320, "step": 897, "train_runtime": 3094.0737, "train_tokens_per_second": 1425.409 }, { "epoch": 0.33029885057471264, "grad_norm": 0.32091811299324036, "learning_rate": 0.00013426676492262344, "loss": 1.221, "num_input_tokens_seen": 4418288, "step": 898, "train_runtime": 3099.0573, "train_tokens_per_second": 1425.688 }, { "epoch": 0.33066666666666666, "grad_norm": 0.3471040427684784, "learning_rate": 0.0001341930729550479, "loss": 1.2233, "num_input_tokens_seen": 4421936, "step": 899, "train_runtime": 3101.5775, "train_tokens_per_second": 1425.705 }, { "epoch": 0.3310344827586207, "grad_norm": 0.32608795166015625, "learning_rate": 0.00013411938098747237, "loss": 1.1769, "num_input_tokens_seen": 4425792, "step": 900, "train_runtime": 3104.3238, "train_tokens_per_second": 1425.686 }, { "epoch": 0.3314022988505747, "grad_norm": 0.3313031792640686, "learning_rate": 0.00013404568901989684, "loss": 1.0861, "num_input_tokens_seen": 4430528, "step": 901, "train_runtime": 3109.7062, "train_tokens_per_second": 1424.742 }, { "epoch": 0.3317701149425287, "grad_norm": 0.3731558322906494, "learning_rate": 0.0001339719970523213, "loss": 1.252, "num_input_tokens_seen": 4436208, "step": 902, "train_runtime": 3113.4198, "train_tokens_per_second": 1424.867 }, { "epoch": 0.33213793103448275, "grad_norm": 0.3392798900604248, "learning_rate": 0.00013389830508474577, "loss": 1.1572, "num_input_tokens_seen": 4439680, "step": 903, "train_runtime": 3115.987, "train_tokens_per_second": 1424.807 }, { "epoch": 0.33250574712643677, "grad_norm": 0.3852826654911041, "learning_rate": 0.00013382461311717023, "loss": 1.2067, "num_input_tokens_seen": 4444576, "step": 904, "train_runtime": 3119.2539, "train_tokens_per_second": 1424.884 }, { "epoch": 0.3328735632183908, "grad_norm": 0.3363071084022522, "learning_rate": 0.0001337509211495947, "loss": 1.0688, "num_input_tokens_seen": 4448080, "step": 905, "train_runtime": 3121.8841, "train_tokens_per_second": 1424.806 }, { "epoch": 0.3332413793103448, "grad_norm": 0.3272119462490082, "learning_rate": 0.00013367722918201916, "loss": 1.2854, "num_input_tokens_seen": 4453152, "step": 906, "train_runtime": 3125.2852, "train_tokens_per_second": 1424.879 }, { "epoch": 0.33360919540229883, "grad_norm": 0.37685421109199524, "learning_rate": 0.00013360353721444363, "loss": 1.2419, "num_input_tokens_seen": 4458672, "step": 907, "train_runtime": 3128.9176, "train_tokens_per_second": 1424.989 }, { "epoch": 0.33397701149425285, "grad_norm": 0.36570993065834045, "learning_rate": 0.0001335298452468681, "loss": 1.2802, "num_input_tokens_seen": 4462336, "step": 908, "train_runtime": 3131.5372, "train_tokens_per_second": 1424.967 }, { "epoch": 0.33434482758620687, "grad_norm": 0.406149685382843, "learning_rate": 0.00013345615327929258, "loss": 1.2721, "num_input_tokens_seen": 4467568, "step": 909, "train_runtime": 3135.0733, "train_tokens_per_second": 1425.028 }, { "epoch": 0.3347126436781609, "grad_norm": 0.3404579758644104, "learning_rate": 0.00013338246131171702, "loss": 1.1655, "num_input_tokens_seen": 4473040, "step": 910, "train_runtime": 3138.7322, "train_tokens_per_second": 1425.11 }, { "epoch": 0.33508045977011497, "grad_norm": 0.39098358154296875, "learning_rate": 0.00013330876934414149, "loss": 1.3671, "num_input_tokens_seen": 4478624, "step": 911, "train_runtime": 3142.6039, "train_tokens_per_second": 1425.132 }, { "epoch": 0.335448275862069, "grad_norm": 0.37660473585128784, "learning_rate": 0.00013323507737656595, "loss": 1.2616, "num_input_tokens_seen": 4483696, "step": 912, "train_runtime": 3146.0172, "train_tokens_per_second": 1425.198 }, { "epoch": 0.335816091954023, "grad_norm": 0.353767067193985, "learning_rate": 0.00013316138540899044, "loss": 1.2041, "num_input_tokens_seen": 4490336, "step": 913, "train_runtime": 3150.3059, "train_tokens_per_second": 1425.365 }, { "epoch": 0.33618390804597703, "grad_norm": 0.3491032123565674, "learning_rate": 0.0001330876934414149, "loss": 1.2778, "num_input_tokens_seen": 4496720, "step": 914, "train_runtime": 3154.4769, "train_tokens_per_second": 1425.504 }, { "epoch": 0.33655172413793105, "grad_norm": 0.3640507459640503, "learning_rate": 0.00013301400147383934, "loss": 1.2892, "num_input_tokens_seen": 4501040, "step": 915, "train_runtime": 3157.4112, "train_tokens_per_second": 1425.548 }, { "epoch": 0.3369195402298851, "grad_norm": 0.40220198035240173, "learning_rate": 0.0001329403095062638, "loss": 1.3624, "num_input_tokens_seen": 4504624, "step": 916, "train_runtime": 3160.0123, "train_tokens_per_second": 1425.508 }, { "epoch": 0.3372873563218391, "grad_norm": 0.3427709639072418, "learning_rate": 0.0001328666175386883, "loss": 1.2901, "num_input_tokens_seen": 4511392, "step": 917, "train_runtime": 3164.3259, "train_tokens_per_second": 1425.704 }, { "epoch": 0.3376551724137931, "grad_norm": 0.3462558388710022, "learning_rate": 0.00013279292557111277, "loss": 1.2467, "num_input_tokens_seen": 4516704, "step": 918, "train_runtime": 3167.8003, "train_tokens_per_second": 1425.817 }, { "epoch": 0.33802298850574714, "grad_norm": 0.371421754360199, "learning_rate": 0.00013271923360353723, "loss": 1.3749, "num_input_tokens_seen": 4524016, "step": 919, "train_runtime": 3172.4881, "train_tokens_per_second": 1426.015 }, { "epoch": 0.33839080459770116, "grad_norm": 0.41616541147232056, "learning_rate": 0.00013264554163596167, "loss": 1.3602, "num_input_tokens_seen": 4530240, "step": 920, "train_runtime": 3176.6814, "train_tokens_per_second": 1426.092 }, { "epoch": 0.3387586206896552, "grad_norm": 0.33587488532066345, "learning_rate": 0.00013257184966838616, "loss": 1.1841, "num_input_tokens_seen": 4535056, "step": 921, "train_runtime": 3179.9795, "train_tokens_per_second": 1426.127 }, { "epoch": 0.3391264367816092, "grad_norm": 0.31753021478652954, "learning_rate": 0.00013249815770081063, "loss": 1.2611, "num_input_tokens_seen": 4540384, "step": 922, "train_runtime": 3183.5169, "train_tokens_per_second": 1426.216 }, { "epoch": 0.3394942528735632, "grad_norm": 0.3612062931060791, "learning_rate": 0.0001324244657332351, "loss": 1.3056, "num_input_tokens_seen": 4543744, "step": 923, "train_runtime": 3186.0013, "train_tokens_per_second": 1426.159 }, { "epoch": 0.33986206896551724, "grad_norm": 0.3625712990760803, "learning_rate": 0.00013235077376565953, "loss": 1.2293, "num_input_tokens_seen": 4547408, "step": 924, "train_runtime": 3188.6542, "train_tokens_per_second": 1426.121 }, { "epoch": 0.34022988505747126, "grad_norm": 0.34556490182876587, "learning_rate": 0.00013227708179808402, "loss": 1.2502, "num_input_tokens_seen": 4551360, "step": 925, "train_runtime": 3191.4758, "train_tokens_per_second": 1426.099 }, { "epoch": 0.3405977011494253, "grad_norm": 0.3499390482902527, "learning_rate": 0.00013220338983050849, "loss": 1.232, "num_input_tokens_seen": 4554560, "step": 926, "train_runtime": 3193.8558, "train_tokens_per_second": 1426.038 }, { "epoch": 0.3409655172413793, "grad_norm": 0.3291085362434387, "learning_rate": 0.00013212969786293295, "loss": 1.2285, "num_input_tokens_seen": 4560256, "step": 927, "train_runtime": 3197.5843, "train_tokens_per_second": 1426.157 }, { "epoch": 0.3413333333333333, "grad_norm": 0.34726017713546753, "learning_rate": 0.00013205600589535741, "loss": 1.2759, "num_input_tokens_seen": 4564288, "step": 928, "train_runtime": 3200.3212, "train_tokens_per_second": 1426.197 }, { "epoch": 0.34170114942528734, "grad_norm": 0.3745157718658447, "learning_rate": 0.00013198231392778188, "loss": 1.3754, "num_input_tokens_seen": 4569280, "step": 929, "train_runtime": 3203.6142, "train_tokens_per_second": 1426.289 }, { "epoch": 0.34206896551724136, "grad_norm": 0.3378608822822571, "learning_rate": 0.00013190862196020634, "loss": 1.2081, "num_input_tokens_seen": 4572592, "step": 930, "train_runtime": 3206.0812, "train_tokens_per_second": 1426.225 }, { "epoch": 0.3424367816091954, "grad_norm": 0.3454687297344208, "learning_rate": 0.0001318349299926308, "loss": 1.3007, "num_input_tokens_seen": 4579328, "step": 931, "train_runtime": 3212.5794, "train_tokens_per_second": 1425.437 }, { "epoch": 0.3428045977011494, "grad_norm": 0.4085744619369507, "learning_rate": 0.00013176123802505527, "loss": 1.4149, "num_input_tokens_seen": 4588288, "step": 932, "train_runtime": 3218.0075, "train_tokens_per_second": 1425.816 }, { "epoch": 0.3431724137931034, "grad_norm": 0.3527067005634308, "learning_rate": 0.00013168754605747974, "loss": 1.074, "num_input_tokens_seen": 4591760, "step": 933, "train_runtime": 3220.5356, "train_tokens_per_second": 1425.775 }, { "epoch": 0.34354022988505745, "grad_norm": 0.40089431405067444, "learning_rate": 0.0001316138540899042, "loss": 1.2684, "num_input_tokens_seen": 4595872, "step": 934, "train_runtime": 3223.4665, "train_tokens_per_second": 1425.755 }, { "epoch": 0.34390804597701147, "grad_norm": 0.39275211095809937, "learning_rate": 0.00013154016212232867, "loss": 1.2534, "num_input_tokens_seen": 4599536, "step": 935, "train_runtime": 3226.1158, "train_tokens_per_second": 1425.719 }, { "epoch": 0.34427586206896554, "grad_norm": 0.38221997022628784, "learning_rate": 0.00013146647015475313, "loss": 1.1681, "num_input_tokens_seen": 4604496, "step": 936, "train_runtime": 3229.4178, "train_tokens_per_second": 1425.798 }, { "epoch": 0.34464367816091956, "grad_norm": 0.37064045667648315, "learning_rate": 0.00013139277818717763, "loss": 1.4688, "num_input_tokens_seen": 4608336, "step": 937, "train_runtime": 3232.0935, "train_tokens_per_second": 1425.805 }, { "epoch": 0.3450114942528736, "grad_norm": 0.38732385635375977, "learning_rate": 0.00013131908621960206, "loss": 1.3264, "num_input_tokens_seen": 4614224, "step": 938, "train_runtime": 3235.8867, "train_tokens_per_second": 1425.954 }, { "epoch": 0.3453793103448276, "grad_norm": 0.3807511627674103, "learning_rate": 0.00013124539425202653, "loss": 1.1603, "num_input_tokens_seen": 4619024, "step": 939, "train_runtime": 3239.1126, "train_tokens_per_second": 1426.015 }, { "epoch": 0.3457471264367816, "grad_norm": 0.3849567472934723, "learning_rate": 0.000131171702284451, "loss": 1.2313, "num_input_tokens_seen": 4624240, "step": 940, "train_runtime": 3242.5871, "train_tokens_per_second": 1426.096 }, { "epoch": 0.34611494252873565, "grad_norm": 0.4086439609527588, "learning_rate": 0.00013109801031687548, "loss": 1.0856, "num_input_tokens_seen": 4628928, "step": 941, "train_runtime": 3245.7458, "train_tokens_per_second": 1426.152 }, { "epoch": 0.34648275862068967, "grad_norm": 0.34102317690849304, "learning_rate": 0.00013102431834929992, "loss": 1.2654, "num_input_tokens_seen": 4632928, "step": 942, "train_runtime": 3248.543, "train_tokens_per_second": 1426.156 }, { "epoch": 0.3468505747126437, "grad_norm": 0.34738168120384216, "learning_rate": 0.0001309506263817244, "loss": 1.2962, "num_input_tokens_seen": 4637584, "step": 943, "train_runtime": 3251.6173, "train_tokens_per_second": 1426.239 }, { "epoch": 0.3472183908045977, "grad_norm": 0.36523938179016113, "learning_rate": 0.00013087693441414885, "loss": 1.1524, "num_input_tokens_seen": 4642128, "step": 944, "train_runtime": 3254.7734, "train_tokens_per_second": 1426.252 }, { "epoch": 0.34758620689655173, "grad_norm": 0.3553354740142822, "learning_rate": 0.00013080324244657334, "loss": 1.173, "num_input_tokens_seen": 4647184, "step": 945, "train_runtime": 3258.1284, "train_tokens_per_second": 1426.335 }, { "epoch": 0.34795402298850575, "grad_norm": 0.35105282068252563, "learning_rate": 0.0001307295504789978, "loss": 1.2189, "num_input_tokens_seen": 4651216, "step": 946, "train_runtime": 3260.969, "train_tokens_per_second": 1426.329 }, { "epoch": 0.34832183908045977, "grad_norm": 0.3944171369075775, "learning_rate": 0.00013065585851142225, "loss": 1.2914, "num_input_tokens_seen": 4656112, "step": 947, "train_runtime": 3264.2687, "train_tokens_per_second": 1426.387 }, { "epoch": 0.3486896551724138, "grad_norm": 0.3476920425891876, "learning_rate": 0.0001305821665438467, "loss": 1.1136, "num_input_tokens_seen": 4663328, "step": 948, "train_runtime": 3268.8119, "train_tokens_per_second": 1426.613 }, { "epoch": 0.3490574712643678, "grad_norm": 0.34117260575294495, "learning_rate": 0.0001305084745762712, "loss": 1.1779, "num_input_tokens_seen": 4672080, "step": 949, "train_runtime": 3274.2392, "train_tokens_per_second": 1426.921 }, { "epoch": 0.34942528735632183, "grad_norm": 0.40067145228385925, "learning_rate": 0.00013043478260869567, "loss": 1.2826, "num_input_tokens_seen": 4679568, "step": 950, "train_runtime": 3278.9844, "train_tokens_per_second": 1427.139 }, { "epoch": 0.34979310344827585, "grad_norm": 0.3745213449001312, "learning_rate": 0.00013036109064112013, "loss": 1.1688, "num_input_tokens_seen": 4683456, "step": 951, "train_runtime": 3281.7133, "train_tokens_per_second": 1427.137 }, { "epoch": 0.3501609195402299, "grad_norm": 0.3064570724964142, "learning_rate": 0.00013028739867354457, "loss": 1.1255, "num_input_tokens_seen": 4689072, "step": 952, "train_runtime": 3285.3409, "train_tokens_per_second": 1427.271 }, { "epoch": 0.3505287356321839, "grad_norm": 0.349273681640625, "learning_rate": 0.00013021370670596906, "loss": 1.1948, "num_input_tokens_seen": 4692464, "step": 953, "train_runtime": 3287.8948, "train_tokens_per_second": 1427.194 }, { "epoch": 0.3508965517241379, "grad_norm": 0.32461249828338623, "learning_rate": 0.00013014001473839353, "loss": 1.2896, "num_input_tokens_seen": 4699344, "step": 954, "train_runtime": 3292.3643, "train_tokens_per_second": 1427.346 }, { "epoch": 0.35126436781609194, "grad_norm": 0.4004507064819336, "learning_rate": 0.000130066322770818, "loss": 1.3518, "num_input_tokens_seen": 4705856, "step": 955, "train_runtime": 3296.5393, "train_tokens_per_second": 1427.514 }, { "epoch": 0.35163218390804596, "grad_norm": 0.32188403606414795, "learning_rate": 0.00012999263080324246, "loss": 1.1949, "num_input_tokens_seen": 4709616, "step": 956, "train_runtime": 3299.2295, "train_tokens_per_second": 1427.49 }, { "epoch": 0.352, "grad_norm": 0.35095903277397156, "learning_rate": 0.00012991893883566692, "loss": 1.174, "num_input_tokens_seen": 4713936, "step": 957, "train_runtime": 3302.1052, "train_tokens_per_second": 1427.555 }, { "epoch": 0.352367816091954, "grad_norm": 0.3721597492694855, "learning_rate": 0.00012984524686809139, "loss": 1.2676, "num_input_tokens_seen": 4718448, "step": 958, "train_runtime": 3305.1539, "train_tokens_per_second": 1427.603 }, { "epoch": 0.352735632183908, "grad_norm": 0.35347044467926025, "learning_rate": 0.00012977155490051585, "loss": 1.3514, "num_input_tokens_seen": 4727920, "step": 959, "train_runtime": 3310.8936, "train_tokens_per_second": 1427.989 }, { "epoch": 0.35310344827586204, "grad_norm": 0.3443051874637604, "learning_rate": 0.00012969786293294032, "loss": 1.2247, "num_input_tokens_seen": 4731696, "step": 960, "train_runtime": 3313.537, "train_tokens_per_second": 1427.989 }, { "epoch": 0.3534712643678161, "grad_norm": 0.34611454606056213, "learning_rate": 0.00012962417096536478, "loss": 1.2259, "num_input_tokens_seen": 4736896, "step": 961, "train_runtime": 3318.983, "train_tokens_per_second": 1427.213 }, { "epoch": 0.35383908045977014, "grad_norm": 0.33163970708847046, "learning_rate": 0.00012955047899778925, "loss": 1.2611, "num_input_tokens_seen": 4740432, "step": 962, "train_runtime": 3321.5338, "train_tokens_per_second": 1427.182 }, { "epoch": 0.35420689655172416, "grad_norm": 0.3706001937389374, "learning_rate": 0.0001294767870302137, "loss": 1.1212, "num_input_tokens_seen": 4744208, "step": 963, "train_runtime": 3324.1479, "train_tokens_per_second": 1427.195 }, { "epoch": 0.3545747126436782, "grad_norm": 0.3629588484764099, "learning_rate": 0.00012940309506263818, "loss": 1.1623, "num_input_tokens_seen": 4751520, "step": 964, "train_runtime": 3328.7503, "train_tokens_per_second": 1427.419 }, { "epoch": 0.3549425287356322, "grad_norm": 0.3300287425518036, "learning_rate": 0.00012932940309506264, "loss": 1.1344, "num_input_tokens_seen": 4756784, "step": 965, "train_runtime": 3332.1707, "train_tokens_per_second": 1427.533 }, { "epoch": 0.3553103448275862, "grad_norm": 0.36114373803138733, "learning_rate": 0.0001292557111274871, "loss": 1.2865, "num_input_tokens_seen": 4761280, "step": 966, "train_runtime": 3335.2529, "train_tokens_per_second": 1427.562 }, { "epoch": 0.35567816091954024, "grad_norm": 0.36843106150627136, "learning_rate": 0.00012918201915991157, "loss": 1.3296, "num_input_tokens_seen": 4765984, "step": 967, "train_runtime": 3338.3947, "train_tokens_per_second": 1427.627 }, { "epoch": 0.35604597701149426, "grad_norm": 0.3429054915904999, "learning_rate": 0.00012910832719233603, "loss": 1.195, "num_input_tokens_seen": 4770784, "step": 968, "train_runtime": 3341.6176, "train_tokens_per_second": 1427.687 }, { "epoch": 0.3564137931034483, "grad_norm": 0.3531000316143036, "learning_rate": 0.00012903463522476053, "loss": 1.3216, "num_input_tokens_seen": 4776048, "step": 969, "train_runtime": 3345.1242, "train_tokens_per_second": 1427.764 }, { "epoch": 0.3567816091954023, "grad_norm": 0.35412395000457764, "learning_rate": 0.00012896094325718496, "loss": 1.2612, "num_input_tokens_seen": 4782544, "step": 970, "train_runtime": 3349.256, "train_tokens_per_second": 1427.942 }, { "epoch": 0.3571494252873563, "grad_norm": 0.35063204169273376, "learning_rate": 0.00012888725128960943, "loss": 1.2589, "num_input_tokens_seen": 4788160, "step": 971, "train_runtime": 3352.908, "train_tokens_per_second": 1428.062 }, { "epoch": 0.35751724137931035, "grad_norm": 0.4041181802749634, "learning_rate": 0.0001288135593220339, "loss": 1.4218, "num_input_tokens_seen": 4798224, "step": 972, "train_runtime": 3358.9967, "train_tokens_per_second": 1428.469 }, { "epoch": 0.35788505747126437, "grad_norm": 0.37234970927238464, "learning_rate": 0.00012873986735445839, "loss": 1.1347, "num_input_tokens_seen": 4803760, "step": 973, "train_runtime": 3362.6615, "train_tokens_per_second": 1428.559 }, { "epoch": 0.3582528735632184, "grad_norm": 0.3577387034893036, "learning_rate": 0.00012866617538688282, "loss": 1.2643, "num_input_tokens_seen": 4807904, "step": 974, "train_runtime": 3365.5693, "train_tokens_per_second": 1428.556 }, { "epoch": 0.3586206896551724, "grad_norm": 0.320300817489624, "learning_rate": 0.0001285924834193073, "loss": 1.2285, "num_input_tokens_seen": 4812032, "step": 975, "train_runtime": 3368.4502, "train_tokens_per_second": 1428.56 }, { "epoch": 0.35898850574712643, "grad_norm": 0.34907546639442444, "learning_rate": 0.00012851879145173175, "loss": 1.287, "num_input_tokens_seen": 4817520, "step": 976, "train_runtime": 3371.9347, "train_tokens_per_second": 1428.711 }, { "epoch": 0.35935632183908045, "grad_norm": 0.36896204948425293, "learning_rate": 0.00012844509948415625, "loss": 1.2219, "num_input_tokens_seen": 4822112, "step": 977, "train_runtime": 3375.0871, "train_tokens_per_second": 1428.737 }, { "epoch": 0.35972413793103447, "grad_norm": 0.3503137528896332, "learning_rate": 0.0001283714075165807, "loss": 1.2138, "num_input_tokens_seen": 4826384, "step": 978, "train_runtime": 3378.0733, "train_tokens_per_second": 1428.739 }, { "epoch": 0.3600919540229885, "grad_norm": 0.32998669147491455, "learning_rate": 0.00012829771554900515, "loss": 1.1317, "num_input_tokens_seen": 4829760, "step": 979, "train_runtime": 3380.5225, "train_tokens_per_second": 1428.702 }, { "epoch": 0.3604597701149425, "grad_norm": 0.3305336833000183, "learning_rate": 0.0001282240235814296, "loss": 1.1226, "num_input_tokens_seen": 4835984, "step": 980, "train_runtime": 3384.7151, "train_tokens_per_second": 1428.771 }, { "epoch": 0.36082758620689653, "grad_norm": 0.3566102087497711, "learning_rate": 0.0001281503316138541, "loss": 1.0873, "num_input_tokens_seen": 4840800, "step": 981, "train_runtime": 3387.9279, "train_tokens_per_second": 1428.838 }, { "epoch": 0.36119540229885055, "grad_norm": 0.3306235074996948, "learning_rate": 0.00012807663964627857, "loss": 1.1995, "num_input_tokens_seen": 4846384, "step": 982, "train_runtime": 3391.6798, "train_tokens_per_second": 1428.904 }, { "epoch": 0.3615632183908046, "grad_norm": 0.3327372074127197, "learning_rate": 0.00012800294767870303, "loss": 1.2495, "num_input_tokens_seen": 4850208, "step": 983, "train_runtime": 3394.3494, "train_tokens_per_second": 1428.907 }, { "epoch": 0.3619310344827586, "grad_norm": 0.32935208082199097, "learning_rate": 0.00012792925571112747, "loss": 1.2944, "num_input_tokens_seen": 4854432, "step": 984, "train_runtime": 3397.2232, "train_tokens_per_second": 1428.941 }, { "epoch": 0.3622988505747126, "grad_norm": 0.3445834219455719, "learning_rate": 0.00012785556374355196, "loss": 1.3027, "num_input_tokens_seen": 4862320, "step": 985, "train_runtime": 3402.1135, "train_tokens_per_second": 1429.206 }, { "epoch": 0.3626666666666667, "grad_norm": 0.36261871457099915, "learning_rate": 0.00012778187177597643, "loss": 1.3979, "num_input_tokens_seen": 4866848, "step": 986, "train_runtime": 3405.0901, "train_tokens_per_second": 1429.286 }, { "epoch": 0.3630344827586207, "grad_norm": 0.37101832032203674, "learning_rate": 0.0001277081798084009, "loss": 1.2875, "num_input_tokens_seen": 4871568, "step": 987, "train_runtime": 3408.25, "train_tokens_per_second": 1429.346 }, { "epoch": 0.36340229885057473, "grad_norm": 0.31869280338287354, "learning_rate": 0.00012763448784082536, "loss": 1.1483, "num_input_tokens_seen": 4880112, "step": 988, "train_runtime": 3413.4524, "train_tokens_per_second": 1429.67 }, { "epoch": 0.36377011494252876, "grad_norm": 0.37963733077049255, "learning_rate": 0.00012756079587324982, "loss": 1.2981, "num_input_tokens_seen": 4884320, "step": 989, "train_runtime": 3416.3965, "train_tokens_per_second": 1429.67 }, { "epoch": 0.3641379310344828, "grad_norm": 0.3426075279712677, "learning_rate": 0.0001274871039056743, "loss": 1.3062, "num_input_tokens_seen": 4892016, "step": 990, "train_runtime": 3421.2239, "train_tokens_per_second": 1429.902 }, { "epoch": 0.3645057471264368, "grad_norm": 0.36241981387138367, "learning_rate": 0.00012741341193809875, "loss": 1.1224, "num_input_tokens_seen": 4896128, "step": 991, "train_runtime": 3426.1408, "train_tokens_per_second": 1429.05 }, { "epoch": 0.3648735632183908, "grad_norm": 0.3554629385471344, "learning_rate": 0.00012733971997052322, "loss": 1.3198, "num_input_tokens_seen": 4900880, "step": 992, "train_runtime": 3429.3353, "train_tokens_per_second": 1429.105 }, { "epoch": 0.36524137931034484, "grad_norm": 0.3605075180530548, "learning_rate": 0.00012726602800294768, "loss": 1.2784, "num_input_tokens_seen": 4906304, "step": 993, "train_runtime": 3432.8568, "train_tokens_per_second": 1429.219 }, { "epoch": 0.36560919540229886, "grad_norm": 0.3608716130256653, "learning_rate": 0.00012719233603537215, "loss": 1.2771, "num_input_tokens_seen": 4911216, "step": 994, "train_runtime": 3436.0811, "train_tokens_per_second": 1429.307 }, { "epoch": 0.3659770114942529, "grad_norm": 0.3807471990585327, "learning_rate": 0.0001271186440677966, "loss": 1.3637, "num_input_tokens_seen": 4916960, "step": 995, "train_runtime": 3439.7987, "train_tokens_per_second": 1429.433 }, { "epoch": 0.3663448275862069, "grad_norm": 0.3879953622817993, "learning_rate": 0.0001270449521002211, "loss": 1.3138, "num_input_tokens_seen": 4921472, "step": 996, "train_runtime": 3442.7866, "train_tokens_per_second": 1429.502 }, { "epoch": 0.3667126436781609, "grad_norm": 0.38234058022499084, "learning_rate": 0.00012697126013264554, "loss": 1.1955, "num_input_tokens_seen": 4925840, "step": 997, "train_runtime": 3445.7929, "train_tokens_per_second": 1429.523 }, { "epoch": 0.36708045977011494, "grad_norm": 0.36829519271850586, "learning_rate": 0.00012689756816507, "loss": 1.2126, "num_input_tokens_seen": 4935904, "step": 998, "train_runtime": 3451.8197, "train_tokens_per_second": 1429.943 }, { "epoch": 0.36744827586206896, "grad_norm": 0.378055214881897, "learning_rate": 0.00012682387619749447, "loss": 1.1742, "num_input_tokens_seen": 4939904, "step": 999, "train_runtime": 3454.5562, "train_tokens_per_second": 1429.968 }, { "epoch": 0.367816091954023, "grad_norm": 0.33647602796554565, "learning_rate": 0.00012675018422991896, "loss": 1.1596, "num_input_tokens_seen": 4945104, "step": 1000, "train_runtime": 3458.0131, "train_tokens_per_second": 1430.042 }, { "epoch": 0.368183908045977, "grad_norm": 0.3450307250022888, "learning_rate": 0.00012667649226234343, "loss": 1.3509, "num_input_tokens_seen": 4949616, "step": 1001, "train_runtime": 3461.0538, "train_tokens_per_second": 1430.089 }, { "epoch": 0.368551724137931, "grad_norm": 0.3409826457500458, "learning_rate": 0.00012660280029476787, "loss": 1.2557, "num_input_tokens_seen": 4955568, "step": 1002, "train_runtime": 3464.8782, "train_tokens_per_second": 1430.229 }, { "epoch": 0.36891954022988505, "grad_norm": 0.344571590423584, "learning_rate": 0.00012652910832719233, "loss": 1.1829, "num_input_tokens_seen": 4964048, "step": 1003, "train_runtime": 3470.0093, "train_tokens_per_second": 1430.558 }, { "epoch": 0.36928735632183907, "grad_norm": 0.33147361874580383, "learning_rate": 0.00012645541635961682, "loss": 1.2453, "num_input_tokens_seen": 4971616, "step": 1004, "train_runtime": 3474.7641, "train_tokens_per_second": 1430.778 }, { "epoch": 0.3696551724137931, "grad_norm": 0.33022987842559814, "learning_rate": 0.0001263817243920413, "loss": 1.2299, "num_input_tokens_seen": 4977968, "step": 1005, "train_runtime": 3478.7439, "train_tokens_per_second": 1430.967 }, { "epoch": 0.3700229885057471, "grad_norm": 0.33206284046173096, "learning_rate": 0.00012630803242446575, "loss": 1.1737, "num_input_tokens_seen": 4981744, "step": 1006, "train_runtime": 3481.3857, "train_tokens_per_second": 1430.966 }, { "epoch": 0.37039080459770113, "grad_norm": 0.3408454656600952, "learning_rate": 0.0001262343404568902, "loss": 1.3833, "num_input_tokens_seen": 4987616, "step": 1007, "train_runtime": 3485.0999, "train_tokens_per_second": 1431.126 }, { "epoch": 0.37075862068965515, "grad_norm": 0.3427160382270813, "learning_rate": 0.00012616064848931468, "loss": 1.2127, "num_input_tokens_seen": 4992992, "step": 1008, "train_runtime": 3488.5941, "train_tokens_per_second": 1431.233 }, { "epoch": 0.37112643678160917, "grad_norm": 0.36299392580986023, "learning_rate": 0.00012608695652173915, "loss": 1.2585, "num_input_tokens_seen": 4996336, "step": 1009, "train_runtime": 3491.0463, "train_tokens_per_second": 1431.186 }, { "epoch": 0.3714942528735632, "grad_norm": 0.3574354946613312, "learning_rate": 0.0001260132645541636, "loss": 1.1855, "num_input_tokens_seen": 5000064, "step": 1010, "train_runtime": 3493.7222, "train_tokens_per_second": 1431.157 }, { "epoch": 0.37186206896551727, "grad_norm": 0.35885098576545715, "learning_rate": 0.00012593957258658805, "loss": 1.1812, "num_input_tokens_seen": 5003440, "step": 1011, "train_runtime": 3496.1463, "train_tokens_per_second": 1431.13 }, { "epoch": 0.3722298850574713, "grad_norm": 0.34946689009666443, "learning_rate": 0.00012586588061901254, "loss": 1.2643, "num_input_tokens_seen": 5008176, "step": 1012, "train_runtime": 3499.2998, "train_tokens_per_second": 1431.194 }, { "epoch": 0.3725977011494253, "grad_norm": 0.3375435173511505, "learning_rate": 0.000125792188651437, "loss": 1.2861, "num_input_tokens_seen": 5012208, "step": 1013, "train_runtime": 3502.1225, "train_tokens_per_second": 1431.191 }, { "epoch": 0.37296551724137933, "grad_norm": 0.3539506196975708, "learning_rate": 0.00012571849668386147, "loss": 1.2749, "num_input_tokens_seen": 5016544, "step": 1014, "train_runtime": 3505.0395, "train_tokens_per_second": 1431.238 }, { "epoch": 0.37333333333333335, "grad_norm": 0.372263103723526, "learning_rate": 0.00012564480471628594, "loss": 1.4011, "num_input_tokens_seen": 5021040, "step": 1015, "train_runtime": 3508.0542, "train_tokens_per_second": 1431.289 }, { "epoch": 0.37370114942528737, "grad_norm": 0.34841859340667725, "learning_rate": 0.0001255711127487104, "loss": 1.2685, "num_input_tokens_seen": 5025776, "step": 1016, "train_runtime": 3511.2199, "train_tokens_per_second": 1431.348 }, { "epoch": 0.3740689655172414, "grad_norm": 0.3994417190551758, "learning_rate": 0.00012549742078113487, "loss": 1.1669, "num_input_tokens_seen": 5029760, "step": 1017, "train_runtime": 3513.9952, "train_tokens_per_second": 1431.351 }, { "epoch": 0.3744367816091954, "grad_norm": 0.39053210616111755, "learning_rate": 0.00012542372881355933, "loss": 1.2908, "num_input_tokens_seen": 5035312, "step": 1018, "train_runtime": 3517.6172, "train_tokens_per_second": 1431.455 }, { "epoch": 0.37480459770114943, "grad_norm": 0.33367887139320374, "learning_rate": 0.0001253500368459838, "loss": 1.1579, "num_input_tokens_seen": 5040048, "step": 1019, "train_runtime": 3520.7724, "train_tokens_per_second": 1431.518 }, { "epoch": 0.37517241379310345, "grad_norm": 0.40413036942481995, "learning_rate": 0.00012527634487840826, "loss": 1.4021, "num_input_tokens_seen": 5044320, "step": 1020, "train_runtime": 3523.6925, "train_tokens_per_second": 1431.544 }, { "epoch": 0.3755402298850575, "grad_norm": 0.35045018792152405, "learning_rate": 0.00012520265291083272, "loss": 1.1458, "num_input_tokens_seen": 5048512, "step": 1021, "train_runtime": 3528.7259, "train_tokens_per_second": 1430.69 }, { "epoch": 0.3759080459770115, "grad_norm": 0.34468555450439453, "learning_rate": 0.0001251289609432572, "loss": 1.2014, "num_input_tokens_seen": 5052768, "step": 1022, "train_runtime": 3531.5804, "train_tokens_per_second": 1430.738 }, { "epoch": 0.3762758620689655, "grad_norm": 0.32207825779914856, "learning_rate": 0.00012505526897568165, "loss": 1.2258, "num_input_tokens_seen": 5057568, "step": 1023, "train_runtime": 3534.7308, "train_tokens_per_second": 1430.821 }, { "epoch": 0.37664367816091954, "grad_norm": 0.3663703203201294, "learning_rate": 0.00012498157700810612, "loss": 1.3653, "num_input_tokens_seen": 5062048, "step": 1024, "train_runtime": 3537.7337, "train_tokens_per_second": 1430.873 }, { "epoch": 0.37701149425287356, "grad_norm": 0.34460243582725525, "learning_rate": 0.00012490788504053058, "loss": 1.2623, "num_input_tokens_seen": 5066080, "step": 1025, "train_runtime": 3540.4588, "train_tokens_per_second": 1430.911 }, { "epoch": 0.3773793103448276, "grad_norm": 0.3607901334762573, "learning_rate": 0.00012483419307295505, "loss": 1.0976, "num_input_tokens_seen": 5071136, "step": 1026, "train_runtime": 3543.8172, "train_tokens_per_second": 1430.981 }, { "epoch": 0.3777471264367816, "grad_norm": 0.36720073223114014, "learning_rate": 0.0001247605011053795, "loss": 1.2161, "num_input_tokens_seen": 5076224, "step": 1027, "train_runtime": 3547.181, "train_tokens_per_second": 1431.059 }, { "epoch": 0.3781149425287356, "grad_norm": 0.33790916204452515, "learning_rate": 0.000124686809137804, "loss": 1.1806, "num_input_tokens_seen": 5081168, "step": 1028, "train_runtime": 3550.3945, "train_tokens_per_second": 1431.156 }, { "epoch": 0.37848275862068964, "grad_norm": 0.35793933272361755, "learning_rate": 0.00012461311717022844, "loss": 1.0849, "num_input_tokens_seen": 5085968, "step": 1029, "train_runtime": 3553.5919, "train_tokens_per_second": 1431.219 }, { "epoch": 0.37885057471264366, "grad_norm": 0.31205907464027405, "learning_rate": 0.0001245394252026529, "loss": 1.2986, "num_input_tokens_seen": 5091168, "step": 1030, "train_runtime": 3557.1312, "train_tokens_per_second": 1431.257 }, { "epoch": 0.3792183908045977, "grad_norm": 0.3675948679447174, "learning_rate": 0.00012446573323507737, "loss": 1.298, "num_input_tokens_seen": 5096304, "step": 1031, "train_runtime": 3560.774, "train_tokens_per_second": 1431.235 }, { "epoch": 0.3795862068965517, "grad_norm": 0.3270435631275177, "learning_rate": 0.00012439204126750186, "loss": 1.1731, "num_input_tokens_seen": 5105872, "step": 1032, "train_runtime": 3566.6098, "train_tokens_per_second": 1431.576 }, { "epoch": 0.3799540229885057, "grad_norm": 0.3730880916118622, "learning_rate": 0.00012431834929992633, "loss": 1.2093, "num_input_tokens_seen": 5110688, "step": 1033, "train_runtime": 3569.8467, "train_tokens_per_second": 1431.627 }, { "epoch": 0.38032183908045974, "grad_norm": 0.3573417663574219, "learning_rate": 0.00012424465733235077, "loss": 1.1703, "num_input_tokens_seen": 5114576, "step": 1034, "train_runtime": 3572.6081, "train_tokens_per_second": 1431.608 }, { "epoch": 0.38068965517241377, "grad_norm": 0.3891686201095581, "learning_rate": 0.00012417096536477523, "loss": 1.3439, "num_input_tokens_seen": 5119088, "step": 1035, "train_runtime": 3575.6517, "train_tokens_per_second": 1431.652 }, { "epoch": 0.38105747126436784, "grad_norm": 0.3356412649154663, "learning_rate": 0.00012409727339719972, "loss": 1.1172, "num_input_tokens_seen": 5122720, "step": 1036, "train_runtime": 3578.2597, "train_tokens_per_second": 1431.623 }, { "epoch": 0.38142528735632186, "grad_norm": 0.3492901027202606, "learning_rate": 0.0001240235814296242, "loss": 1.1965, "num_input_tokens_seen": 5126288, "step": 1037, "train_runtime": 3580.7981, "train_tokens_per_second": 1431.605 }, { "epoch": 0.3817931034482759, "grad_norm": 0.3627444803714752, "learning_rate": 0.00012394988946204865, "loss": 1.2814, "num_input_tokens_seen": 5130912, "step": 1038, "train_runtime": 3583.9062, "train_tokens_per_second": 1431.654 }, { "epoch": 0.3821609195402299, "grad_norm": 0.4016261398792267, "learning_rate": 0.0001238761974944731, "loss": 1.3845, "num_input_tokens_seen": 5134592, "step": 1039, "train_runtime": 3586.5609, "train_tokens_per_second": 1431.62 }, { "epoch": 0.3825287356321839, "grad_norm": 0.3393212556838989, "learning_rate": 0.00012380250552689758, "loss": 1.2972, "num_input_tokens_seen": 5138016, "step": 1040, "train_runtime": 3588.9888, "train_tokens_per_second": 1431.605 }, { "epoch": 0.38289655172413795, "grad_norm": 0.36610278487205505, "learning_rate": 0.00012372881355932205, "loss": 1.1849, "num_input_tokens_seen": 5140912, "step": 1041, "train_runtime": 3591.2023, "train_tokens_per_second": 1431.53 }, { "epoch": 0.38326436781609197, "grad_norm": 0.3711596131324768, "learning_rate": 0.0001236551215917465, "loss": 1.2966, "num_input_tokens_seen": 5145600, "step": 1042, "train_runtime": 3594.5427, "train_tokens_per_second": 1431.503 }, { "epoch": 0.383632183908046, "grad_norm": 0.33255723118782043, "learning_rate": 0.00012358142962417095, "loss": 1.1432, "num_input_tokens_seen": 5149904, "step": 1043, "train_runtime": 3597.4764, "train_tokens_per_second": 1431.532 }, { "epoch": 0.384, "grad_norm": 0.35760384798049927, "learning_rate": 0.00012350773765659544, "loss": 1.2683, "num_input_tokens_seen": 5154608, "step": 1044, "train_runtime": 3600.5796, "train_tokens_per_second": 1431.605 }, { "epoch": 0.38436781609195403, "grad_norm": 0.37174364924430847, "learning_rate": 0.0001234340456890199, "loss": 1.2198, "num_input_tokens_seen": 5158784, "step": 1045, "train_runtime": 3603.4169, "train_tokens_per_second": 1431.637 }, { "epoch": 0.38473563218390805, "grad_norm": 0.3620304465293884, "learning_rate": 0.00012336035372144437, "loss": 1.2691, "num_input_tokens_seen": 5162032, "step": 1046, "train_runtime": 3605.8137, "train_tokens_per_second": 1431.586 }, { "epoch": 0.38510344827586207, "grad_norm": 0.32890260219573975, "learning_rate": 0.00012328666175386884, "loss": 1.1396, "num_input_tokens_seen": 5166944, "step": 1047, "train_runtime": 3609.0055, "train_tokens_per_second": 1431.681 }, { "epoch": 0.3854712643678161, "grad_norm": 0.35326966643333435, "learning_rate": 0.0001232129697862933, "loss": 1.1628, "num_input_tokens_seen": 5169952, "step": 1048, "train_runtime": 3611.3092, "train_tokens_per_second": 1431.6 }, { "epoch": 0.3858390804597701, "grad_norm": 0.32441720366477966, "learning_rate": 0.00012313927781871777, "loss": 1.1884, "num_input_tokens_seen": 5173600, "step": 1049, "train_runtime": 3613.8808, "train_tokens_per_second": 1431.591 }, { "epoch": 0.38620689655172413, "grad_norm": 0.36308610439300537, "learning_rate": 0.00012306558585114223, "loss": 1.1562, "num_input_tokens_seen": 5177712, "step": 1050, "train_runtime": 3616.6444, "train_tokens_per_second": 1431.634 }, { "epoch": 0.38657471264367815, "grad_norm": 0.3232983648777008, "learning_rate": 0.0001229918938835667, "loss": 1.1819, "num_input_tokens_seen": 5185008, "step": 1051, "train_runtime": 3623.2532, "train_tokens_per_second": 1431.037 }, { "epoch": 0.3869425287356322, "grad_norm": 0.3701878786087036, "learning_rate": 0.00012291820191599116, "loss": 1.1784, "num_input_tokens_seen": 5190944, "step": 1052, "train_runtime": 3627.0151, "train_tokens_per_second": 1431.189 }, { "epoch": 0.3873103448275862, "grad_norm": 0.34583258628845215, "learning_rate": 0.00012284450994841563, "loss": 1.2214, "num_input_tokens_seen": 5198704, "step": 1053, "train_runtime": 3631.7461, "train_tokens_per_second": 1431.461 }, { "epoch": 0.3876781609195402, "grad_norm": 0.3805807828903198, "learning_rate": 0.0001227708179808401, "loss": 1.303, "num_input_tokens_seen": 5203696, "step": 1054, "train_runtime": 3635.0008, "train_tokens_per_second": 1431.553 }, { "epoch": 0.38804597701149424, "grad_norm": 0.39817777276039124, "learning_rate": 0.00012269712601326456, "loss": 1.3051, "num_input_tokens_seen": 5207680, "step": 1055, "train_runtime": 3637.682, "train_tokens_per_second": 1431.593 }, { "epoch": 0.38841379310344826, "grad_norm": 0.3692329227924347, "learning_rate": 0.00012262343404568905, "loss": 1.2677, "num_input_tokens_seen": 5212496, "step": 1056, "train_runtime": 3640.9108, "train_tokens_per_second": 1431.646 }, { "epoch": 0.3887816091954023, "grad_norm": 0.3591819703578949, "learning_rate": 0.00012254974207811349, "loss": 1.2449, "num_input_tokens_seen": 5217264, "step": 1057, "train_runtime": 3644.1407, "train_tokens_per_second": 1431.686 }, { "epoch": 0.3891494252873563, "grad_norm": 0.3706558346748352, "learning_rate": 0.00012247605011053795, "loss": 1.1845, "num_input_tokens_seen": 5220848, "step": 1058, "train_runtime": 3646.6948, "train_tokens_per_second": 1431.666 }, { "epoch": 0.3895172413793103, "grad_norm": 0.35494890809059143, "learning_rate": 0.00012240235814296241, "loss": 1.2491, "num_input_tokens_seen": 5224128, "step": 1059, "train_runtime": 3649.0922, "train_tokens_per_second": 1431.624 }, { "epoch": 0.38988505747126434, "grad_norm": 0.3704403340816498, "learning_rate": 0.0001223286661753869, "loss": 1.3511, "num_input_tokens_seen": 5227776, "step": 1060, "train_runtime": 3651.7018, "train_tokens_per_second": 1431.6 }, { "epoch": 0.3902528735632184, "grad_norm": 0.37094739079475403, "learning_rate": 0.00012225497420781134, "loss": 1.1495, "num_input_tokens_seen": 5231776, "step": 1061, "train_runtime": 3654.5698, "train_tokens_per_second": 1431.571 }, { "epoch": 0.39062068965517244, "grad_norm": 0.3463454246520996, "learning_rate": 0.0001221812822402358, "loss": 1.2725, "num_input_tokens_seen": 5236256, "step": 1062, "train_runtime": 3657.5643, "train_tokens_per_second": 1431.624 }, { "epoch": 0.39098850574712646, "grad_norm": 0.421294629573822, "learning_rate": 0.00012210759027266027, "loss": 1.4387, "num_input_tokens_seen": 5240720, "step": 1063, "train_runtime": 3660.5191, "train_tokens_per_second": 1431.688 }, { "epoch": 0.3913563218390805, "grad_norm": 0.3991212844848633, "learning_rate": 0.00012203389830508477, "loss": 1.3859, "num_input_tokens_seen": 5246624, "step": 1064, "train_runtime": 3664.3405, "train_tokens_per_second": 1431.806 }, { "epoch": 0.3917241379310345, "grad_norm": 0.3889915347099304, "learning_rate": 0.00012196020633750922, "loss": 1.2784, "num_input_tokens_seen": 5252688, "step": 1065, "train_runtime": 3668.2583, "train_tokens_per_second": 1431.93 }, { "epoch": 0.3920919540229885, "grad_norm": 0.3894662857055664, "learning_rate": 0.00012188651436993368, "loss": 1.3165, "num_input_tokens_seen": 5257264, "step": 1066, "train_runtime": 3671.291, "train_tokens_per_second": 1431.993 }, { "epoch": 0.39245977011494254, "grad_norm": 0.34579962491989136, "learning_rate": 0.00012181282240235813, "loss": 1.2072, "num_input_tokens_seen": 5261792, "step": 1067, "train_runtime": 3674.3245, "train_tokens_per_second": 1432.043 }, { "epoch": 0.39282758620689656, "grad_norm": 0.32758286595344543, "learning_rate": 0.00012173913043478263, "loss": 1.2067, "num_input_tokens_seen": 5265856, "step": 1068, "train_runtime": 3677.0774, "train_tokens_per_second": 1432.076 }, { "epoch": 0.3931954022988506, "grad_norm": 0.3422364294528961, "learning_rate": 0.00012166543846720708, "loss": 1.2137, "num_input_tokens_seen": 5270336, "step": 1069, "train_runtime": 3680.1711, "train_tokens_per_second": 1432.09 }, { "epoch": 0.3935632183908046, "grad_norm": 0.3267379403114319, "learning_rate": 0.00012159174649963154, "loss": 1.2792, "num_input_tokens_seen": 5274528, "step": 1070, "train_runtime": 3683.1396, "train_tokens_per_second": 1432.074 }, { "epoch": 0.3939310344827586, "grad_norm": 0.3592357635498047, "learning_rate": 0.000121518054532056, "loss": 1.2102, "num_input_tokens_seen": 5279264, "step": 1071, "train_runtime": 3686.2913, "train_tokens_per_second": 1432.134 }, { "epoch": 0.39429885057471264, "grad_norm": 0.344771146774292, "learning_rate": 0.00012144436256448048, "loss": 1.212, "num_input_tokens_seen": 5285984, "step": 1072, "train_runtime": 3690.6102, "train_tokens_per_second": 1432.279 }, { "epoch": 0.39466666666666667, "grad_norm": 0.34492745995521545, "learning_rate": 0.00012137067059690495, "loss": 1.1521, "num_input_tokens_seen": 5290384, "step": 1073, "train_runtime": 3693.5284, "train_tokens_per_second": 1432.339 }, { "epoch": 0.3950344827586207, "grad_norm": 0.30357855558395386, "learning_rate": 0.0001212969786293294, "loss": 1.152, "num_input_tokens_seen": 5298320, "step": 1074, "train_runtime": 3698.5493, "train_tokens_per_second": 1432.54 }, { "epoch": 0.3954022988505747, "grad_norm": 0.3603195548057556, "learning_rate": 0.00012122328666175387, "loss": 1.1997, "num_input_tokens_seen": 5303712, "step": 1075, "train_runtime": 3702.175, "train_tokens_per_second": 1432.594 }, { "epoch": 0.39577011494252873, "grad_norm": 0.3354949355125427, "learning_rate": 0.00012114959469417834, "loss": 1.1641, "num_input_tokens_seen": 5309264, "step": 1076, "train_runtime": 3705.7836, "train_tokens_per_second": 1432.697 }, { "epoch": 0.39613793103448275, "grad_norm": 0.374262273311615, "learning_rate": 0.00012107590272660281, "loss": 1.316, "num_input_tokens_seen": 5313056, "step": 1077, "train_runtime": 3708.3959, "train_tokens_per_second": 1432.71 }, { "epoch": 0.39650574712643677, "grad_norm": 0.34046006202697754, "learning_rate": 0.00012100221075902727, "loss": 1.2667, "num_input_tokens_seen": 5317088, "step": 1078, "train_runtime": 3711.2048, "train_tokens_per_second": 1432.712 }, { "epoch": 0.3968735632183908, "grad_norm": 0.4357326328754425, "learning_rate": 0.00012092851879145172, "loss": 1.3433, "num_input_tokens_seen": 5321136, "step": 1079, "train_runtime": 3714.0049, "train_tokens_per_second": 1432.722 }, { "epoch": 0.3972413793103448, "grad_norm": 0.3166910707950592, "learning_rate": 0.00012085482682387622, "loss": 1.1968, "num_input_tokens_seen": 5327184, "step": 1080, "train_runtime": 3717.9476, "train_tokens_per_second": 1432.829 }, { "epoch": 0.39760919540229883, "grad_norm": 0.3849300146102905, "learning_rate": 0.00012078113485630067, "loss": 1.173, "num_input_tokens_seen": 5333392, "step": 1081, "train_runtime": 3723.9439, "train_tokens_per_second": 1432.189 }, { "epoch": 0.39797701149425285, "grad_norm": 0.3317451775074005, "learning_rate": 0.00012070744288872513, "loss": 1.1804, "num_input_tokens_seen": 5338208, "step": 1082, "train_runtime": 3727.1008, "train_tokens_per_second": 1432.268 }, { "epoch": 0.3983448275862069, "grad_norm": 0.31019216775894165, "learning_rate": 0.0001206337509211496, "loss": 1.2013, "num_input_tokens_seen": 5342896, "step": 1083, "train_runtime": 3730.256, "train_tokens_per_second": 1432.313 }, { "epoch": 0.3987126436781609, "grad_norm": 0.3194737136363983, "learning_rate": 0.00012056005895357408, "loss": 1.2644, "num_input_tokens_seen": 5347552, "step": 1084, "train_runtime": 3733.2594, "train_tokens_per_second": 1432.408 }, { "epoch": 0.3990804597701149, "grad_norm": 0.35167330503463745, "learning_rate": 0.00012048636698599853, "loss": 1.2333, "num_input_tokens_seen": 5352048, "step": 1085, "train_runtime": 3736.1995, "train_tokens_per_second": 1432.485 }, { "epoch": 0.399448275862069, "grad_norm": 0.3975164294242859, "learning_rate": 0.00012041267501842299, "loss": 1.1807, "num_input_tokens_seen": 5356624, "step": 1086, "train_runtime": 3739.2608, "train_tokens_per_second": 1432.536 }, { "epoch": 0.399816091954023, "grad_norm": 0.33640673756599426, "learning_rate": 0.00012033898305084746, "loss": 1.0823, "num_input_tokens_seen": 5360752, "step": 1087, "train_runtime": 3742.1242, "train_tokens_per_second": 1432.543 }, { "epoch": 0.40018390804597703, "grad_norm": 0.3588925004005432, "learning_rate": 0.00012026529108327194, "loss": 1.1697, "num_input_tokens_seen": 5364016, "step": 1088, "train_runtime": 3744.4739, "train_tokens_per_second": 1432.515 }, { "epoch": 0.40018390804597703, "eval_loss": 1.2428745031356812, "eval_runtime": 15.1969, "eval_samples_per_second": 65.803, "eval_steps_per_second": 4.146, "num_input_tokens_seen": 5364016, "step": 1088 }, { "epoch": 0.40055172413793105, "grad_norm": 0.33775821328163147, "learning_rate": 0.0001201915991156964, "loss": 1.2168, "num_input_tokens_seen": 5367936, "step": 1089, "train_runtime": 3762.4401, "train_tokens_per_second": 1426.717 }, { "epoch": 0.4009195402298851, "grad_norm": 0.3454897999763489, "learning_rate": 0.00012011790714812085, "loss": 1.3041, "num_input_tokens_seen": 5378176, "step": 1090, "train_runtime": 3768.5169, "train_tokens_per_second": 1427.133 }, { "epoch": 0.4012873563218391, "grad_norm": 0.34462302923202515, "learning_rate": 0.00012004421518054532, "loss": 1.2234, "num_input_tokens_seen": 5381872, "step": 1091, "train_runtime": 3771.0969, "train_tokens_per_second": 1427.137 }, { "epoch": 0.4016551724137931, "grad_norm": 0.3986961841583252, "learning_rate": 0.0001199705232129698, "loss": 1.3212, "num_input_tokens_seen": 5386576, "step": 1092, "train_runtime": 3774.1991, "train_tokens_per_second": 1427.21 }, { "epoch": 0.40202298850574714, "grad_norm": 0.3640199601650238, "learning_rate": 0.00011989683124539426, "loss": 1.2773, "num_input_tokens_seen": 5391744, "step": 1093, "train_runtime": 3777.5051, "train_tokens_per_second": 1427.329 }, { "epoch": 0.40239080459770116, "grad_norm": 0.3769136369228363, "learning_rate": 0.00011982313927781872, "loss": 1.241, "num_input_tokens_seen": 5396416, "step": 1094, "train_runtime": 3780.5673, "train_tokens_per_second": 1427.409 }, { "epoch": 0.4027586206896552, "grad_norm": 0.3686259388923645, "learning_rate": 0.00011974944731024318, "loss": 1.313, "num_input_tokens_seen": 5400320, "step": 1095, "train_runtime": 3783.3186, "train_tokens_per_second": 1427.403 }, { "epoch": 0.4031264367816092, "grad_norm": 0.3390229046344757, "learning_rate": 0.00011967575534266767, "loss": 1.1134, "num_input_tokens_seen": 5405328, "step": 1096, "train_runtime": 3786.6879, "train_tokens_per_second": 1427.455 }, { "epoch": 0.4034942528735632, "grad_norm": 0.3467003107070923, "learning_rate": 0.00011960206337509212, "loss": 1.1132, "num_input_tokens_seen": 5410832, "step": 1097, "train_runtime": 3790.2789, "train_tokens_per_second": 1427.555 }, { "epoch": 0.40386206896551724, "grad_norm": 0.3521224558353424, "learning_rate": 0.00011952837140751658, "loss": 1.2108, "num_input_tokens_seen": 5417024, "step": 1098, "train_runtime": 3794.3081, "train_tokens_per_second": 1427.671 }, { "epoch": 0.40422988505747126, "grad_norm": 0.3469099700450897, "learning_rate": 0.00011945467943994105, "loss": 1.3315, "num_input_tokens_seen": 5420608, "step": 1099, "train_runtime": 3796.8821, "train_tokens_per_second": 1427.647 }, { "epoch": 0.4045977011494253, "grad_norm": 0.35697469115257263, "learning_rate": 0.00011938098747236553, "loss": 1.2473, "num_input_tokens_seen": 5425936, "step": 1100, "train_runtime": 3800.4101, "train_tokens_per_second": 1427.724 }, { "epoch": 0.4049655172413793, "grad_norm": 0.32476937770843506, "learning_rate": 0.00011930729550478998, "loss": 1.2057, "num_input_tokens_seen": 5430400, "step": 1101, "train_runtime": 3803.349, "train_tokens_per_second": 1427.794 }, { "epoch": 0.4053333333333333, "grad_norm": 0.34049010276794434, "learning_rate": 0.00011923360353721444, "loss": 1.3402, "num_input_tokens_seen": 5434176, "step": 1102, "train_runtime": 3805.9782, "train_tokens_per_second": 1427.8 }, { "epoch": 0.40570114942528734, "grad_norm": 0.3352499008178711, "learning_rate": 0.00011915991156963891, "loss": 0.9929, "num_input_tokens_seen": 5438304, "step": 1103, "train_runtime": 3808.7535, "train_tokens_per_second": 1427.844 }, { "epoch": 0.40606896551724136, "grad_norm": 0.3618566691875458, "learning_rate": 0.00011908621960206339, "loss": 1.2383, "num_input_tokens_seen": 5442208, "step": 1104, "train_runtime": 3811.4145, "train_tokens_per_second": 1427.871 }, { "epoch": 0.4064367816091954, "grad_norm": 0.36079367995262146, "learning_rate": 0.00011901252763448785, "loss": 1.367, "num_input_tokens_seen": 5447200, "step": 1105, "train_runtime": 3814.6324, "train_tokens_per_second": 1427.975 }, { "epoch": 0.4068045977011494, "grad_norm": 0.3755130171775818, "learning_rate": 0.0001189388356669123, "loss": 1.1368, "num_input_tokens_seen": 5451536, "step": 1106, "train_runtime": 3817.6161, "train_tokens_per_second": 1427.995 }, { "epoch": 0.4071724137931034, "grad_norm": 0.3543834388256073, "learning_rate": 0.00011886514369933677, "loss": 1.2331, "num_input_tokens_seen": 5455488, "step": 1107, "train_runtime": 3820.3957, "train_tokens_per_second": 1427.99 }, { "epoch": 0.40754022988505745, "grad_norm": 0.3687877357006073, "learning_rate": 0.00011879145173176125, "loss": 1.3265, "num_input_tokens_seen": 5459648, "step": 1108, "train_runtime": 3823.2891, "train_tokens_per_second": 1427.998 }, { "epoch": 0.40790804597701147, "grad_norm": 0.3760135769844055, "learning_rate": 0.00011871775976418571, "loss": 1.3001, "num_input_tokens_seen": 5465184, "step": 1109, "train_runtime": 3826.8726, "train_tokens_per_second": 1428.107 }, { "epoch": 0.40827586206896554, "grad_norm": 0.3332124352455139, "learning_rate": 0.00011864406779661017, "loss": 1.1981, "num_input_tokens_seen": 5470768, "step": 1110, "train_runtime": 3830.573, "train_tokens_per_second": 1428.185 }, { "epoch": 0.40864367816091957, "grad_norm": 0.3272831439971924, "learning_rate": 0.00011857037582903463, "loss": 1.1764, "num_input_tokens_seen": 5474064, "step": 1111, "train_runtime": 3835.1153, "train_tokens_per_second": 1427.353 }, { "epoch": 0.4090114942528736, "grad_norm": 0.3936535716056824, "learning_rate": 0.00011849668386145912, "loss": 1.2311, "num_input_tokens_seen": 5481728, "step": 1112, "train_runtime": 3839.9344, "train_tokens_per_second": 1427.558 }, { "epoch": 0.4093793103448276, "grad_norm": 0.37798210978507996, "learning_rate": 0.00011842299189388357, "loss": 1.3299, "num_input_tokens_seen": 5485536, "step": 1113, "train_runtime": 3842.6111, "train_tokens_per_second": 1427.554 }, { "epoch": 0.40974712643678163, "grad_norm": 0.3663480579853058, "learning_rate": 0.00011834929992630803, "loss": 1.1728, "num_input_tokens_seen": 5491392, "step": 1114, "train_runtime": 3846.436, "train_tokens_per_second": 1427.657 }, { "epoch": 0.41011494252873565, "grad_norm": 0.36282312870025635, "learning_rate": 0.0001182756079587325, "loss": 1.2436, "num_input_tokens_seen": 5496432, "step": 1115, "train_runtime": 3849.8243, "train_tokens_per_second": 1427.71 }, { "epoch": 0.41048275862068967, "grad_norm": 0.3399622142314911, "learning_rate": 0.00011820191599115698, "loss": 1.1582, "num_input_tokens_seen": 5500816, "step": 1116, "train_runtime": 3852.8612, "train_tokens_per_second": 1427.722 }, { "epoch": 0.4108505747126437, "grad_norm": 0.3496538996696472, "learning_rate": 0.00011812822402358144, "loss": 1.2399, "num_input_tokens_seen": 5507408, "step": 1117, "train_runtime": 3857.091, "train_tokens_per_second": 1427.866 }, { "epoch": 0.4112183908045977, "grad_norm": 0.33703044056892395, "learning_rate": 0.0001180545320560059, "loss": 1.2687, "num_input_tokens_seen": 5511920, "step": 1118, "train_runtime": 3860.1916, "train_tokens_per_second": 1427.888 }, { "epoch": 0.41158620689655173, "grad_norm": 0.3628682494163513, "learning_rate": 0.00011798084008843037, "loss": 1.3816, "num_input_tokens_seen": 5515376, "step": 1119, "train_runtime": 3862.7681, "train_tokens_per_second": 1427.83 }, { "epoch": 0.41195402298850575, "grad_norm": 0.3717058300971985, "learning_rate": 0.00011790714812085484, "loss": 1.2138, "num_input_tokens_seen": 5520752, "step": 1120, "train_runtime": 3866.3199, "train_tokens_per_second": 1427.909 }, { "epoch": 0.4123218390804598, "grad_norm": 0.3626756966114044, "learning_rate": 0.0001178334561532793, "loss": 1.2262, "num_input_tokens_seen": 5524640, "step": 1121, "train_runtime": 3869.1016, "train_tokens_per_second": 1427.887 }, { "epoch": 0.4126896551724138, "grad_norm": 0.31174394488334656, "learning_rate": 0.00011775976418570375, "loss": 1.1207, "num_input_tokens_seen": 5529072, "step": 1122, "train_runtime": 3872.1255, "train_tokens_per_second": 1427.917 }, { "epoch": 0.4130574712643678, "grad_norm": 0.37022605538368225, "learning_rate": 0.00011768607221812824, "loss": 1.3078, "num_input_tokens_seen": 5537360, "step": 1123, "train_runtime": 3877.2642, "train_tokens_per_second": 1428.162 }, { "epoch": 0.41342528735632184, "grad_norm": 0.34345361590385437, "learning_rate": 0.0001176123802505527, "loss": 1.3267, "num_input_tokens_seen": 5543360, "step": 1124, "train_runtime": 3881.2358, "train_tokens_per_second": 1428.246 }, { "epoch": 0.41379310344827586, "grad_norm": 0.34921231865882874, "learning_rate": 0.00011753868828297716, "loss": 1.2609, "num_input_tokens_seen": 5551456, "step": 1125, "train_runtime": 3886.3287, "train_tokens_per_second": 1428.458 }, { "epoch": 0.4141609195402299, "grad_norm": 0.3794352114200592, "learning_rate": 0.00011746499631540163, "loss": 1.2211, "num_input_tokens_seen": 5556896, "step": 1126, "train_runtime": 3889.9685, "train_tokens_per_second": 1428.52 }, { "epoch": 0.4145287356321839, "grad_norm": 0.35784193873405457, "learning_rate": 0.0001173913043478261, "loss": 1.1596, "num_input_tokens_seen": 5561696, "step": 1127, "train_runtime": 3893.1934, "train_tokens_per_second": 1428.569 }, { "epoch": 0.4148965517241379, "grad_norm": 0.32974863052368164, "learning_rate": 0.00011731761238025057, "loss": 1.2636, "num_input_tokens_seen": 5566560, "step": 1128, "train_runtime": 3896.4539, "train_tokens_per_second": 1428.622 }, { "epoch": 0.41526436781609194, "grad_norm": 0.34522899985313416, "learning_rate": 0.00011724392041267502, "loss": 1.1703, "num_input_tokens_seen": 5571744, "step": 1129, "train_runtime": 3899.8517, "train_tokens_per_second": 1428.707 }, { "epoch": 0.41563218390804596, "grad_norm": 0.3814712166786194, "learning_rate": 0.00011717022844509948, "loss": 1.2741, "num_input_tokens_seen": 5575744, "step": 1130, "train_runtime": 3902.6921, "train_tokens_per_second": 1428.692 }, { "epoch": 0.416, "grad_norm": 0.37492799758911133, "learning_rate": 0.00011709653647752396, "loss": 1.2739, "num_input_tokens_seen": 5581072, "step": 1131, "train_runtime": 3906.2097, "train_tokens_per_second": 1428.769 }, { "epoch": 0.416367816091954, "grad_norm": 0.35911741852760315, "learning_rate": 0.00011702284450994843, "loss": 1.1149, "num_input_tokens_seen": 5585680, "step": 1132, "train_runtime": 3909.3336, "train_tokens_per_second": 1428.806 }, { "epoch": 0.416735632183908, "grad_norm": 0.3211018741130829, "learning_rate": 0.00011694915254237289, "loss": 1.2267, "num_input_tokens_seen": 5590096, "step": 1133, "train_runtime": 3912.3798, "train_tokens_per_second": 1428.822 }, { "epoch": 0.41710344827586204, "grad_norm": 0.3716791570186615, "learning_rate": 0.00011687546057479734, "loss": 1.3457, "num_input_tokens_seen": 5593680, "step": 1134, "train_runtime": 3914.9356, "train_tokens_per_second": 1428.805 }, { "epoch": 0.4174712643678161, "grad_norm": 0.3171387314796448, "learning_rate": 0.00011680176860722182, "loss": 1.0486, "num_input_tokens_seen": 5599104, "step": 1135, "train_runtime": 3918.5086, "train_tokens_per_second": 1428.886 }, { "epoch": 0.41783908045977014, "grad_norm": 0.34421542286872864, "learning_rate": 0.00011672807663964629, "loss": 1.1311, "num_input_tokens_seen": 5606176, "step": 1136, "train_runtime": 3922.9796, "train_tokens_per_second": 1429.061 }, { "epoch": 0.41820689655172416, "grad_norm": 0.37732580304145813, "learning_rate": 0.00011665438467207075, "loss": 1.2176, "num_input_tokens_seen": 5610048, "step": 1137, "train_runtime": 3925.7245, "train_tokens_per_second": 1429.048 }, { "epoch": 0.4185747126436782, "grad_norm": 0.3768428862094879, "learning_rate": 0.0001165806927044952, "loss": 1.2225, "num_input_tokens_seen": 5614240, "step": 1138, "train_runtime": 3928.6497, "train_tokens_per_second": 1429.051 }, { "epoch": 0.4189425287356322, "grad_norm": 0.377395898103714, "learning_rate": 0.0001165070007369197, "loss": 1.2007, "num_input_tokens_seen": 5617600, "step": 1139, "train_runtime": 3931.1105, "train_tokens_per_second": 1429.011 }, { "epoch": 0.4193103448275862, "grad_norm": 0.34873583912849426, "learning_rate": 0.00011643330876934415, "loss": 1.2882, "num_input_tokens_seen": 5623024, "step": 1140, "train_runtime": 3934.786, "train_tokens_per_second": 1429.055 }, { "epoch": 0.41967816091954024, "grad_norm": 0.32570594549179077, "learning_rate": 0.00011635961680176861, "loss": 1.1753, "num_input_tokens_seen": 5626896, "step": 1141, "train_runtime": 3939.4902, "train_tokens_per_second": 1428.331 }, { "epoch": 0.42004597701149426, "grad_norm": 0.32342666387557983, "learning_rate": 0.00011628592483419308, "loss": 1.1558, "num_input_tokens_seen": 5633504, "step": 1142, "train_runtime": 3943.6904, "train_tokens_per_second": 1428.485 }, { "epoch": 0.4204137931034483, "grad_norm": 0.3442724347114563, "learning_rate": 0.00011621223286661755, "loss": 1.2874, "num_input_tokens_seen": 5637360, "step": 1143, "train_runtime": 3946.3761, "train_tokens_per_second": 1428.49 }, { "epoch": 0.4207816091954023, "grad_norm": 0.3737703859806061, "learning_rate": 0.00011613854089904202, "loss": 1.3107, "num_input_tokens_seen": 5641600, "step": 1144, "train_runtime": 3949.2657, "train_tokens_per_second": 1428.519 }, { "epoch": 0.4211494252873563, "grad_norm": 0.3702608644962311, "learning_rate": 0.00011606484893146647, "loss": 1.2314, "num_input_tokens_seen": 5647200, "step": 1145, "train_runtime": 3952.8818, "train_tokens_per_second": 1428.629 }, { "epoch": 0.42151724137931035, "grad_norm": 0.3603191375732422, "learning_rate": 0.00011599115696389094, "loss": 1.284, "num_input_tokens_seen": 5650688, "step": 1146, "train_runtime": 3955.4686, "train_tokens_per_second": 1428.576 }, { "epoch": 0.42188505747126437, "grad_norm": 0.3344424366950989, "learning_rate": 0.00011591746499631541, "loss": 1.4159, "num_input_tokens_seen": 5656464, "step": 1147, "train_runtime": 3959.227, "train_tokens_per_second": 1428.679 }, { "epoch": 0.4222528735632184, "grad_norm": 0.37944796681404114, "learning_rate": 0.00011584377302873988, "loss": 1.2642, "num_input_tokens_seen": 5660176, "step": 1148, "train_runtime": 3961.8482, "train_tokens_per_second": 1428.671 }, { "epoch": 0.4226206896551724, "grad_norm": 0.36027365922927856, "learning_rate": 0.00011577008106116434, "loss": 1.1157, "num_input_tokens_seen": 5667648, "step": 1149, "train_runtime": 3966.6452, "train_tokens_per_second": 1428.827 }, { "epoch": 0.42298850574712643, "grad_norm": 0.34349489212036133, "learning_rate": 0.0001156963890935888, "loss": 1.2262, "num_input_tokens_seen": 5671328, "step": 1150, "train_runtime": 3969.2535, "train_tokens_per_second": 1428.815 }, { "epoch": 0.42335632183908045, "grad_norm": 0.36051565408706665, "learning_rate": 0.00011562269712601327, "loss": 1.2615, "num_input_tokens_seen": 5676528, "step": 1151, "train_runtime": 3972.7327, "train_tokens_per_second": 1428.872 }, { "epoch": 0.4237241379310345, "grad_norm": 0.39821335673332214, "learning_rate": 0.00011554900515843774, "loss": 1.2289, "num_input_tokens_seen": 5681392, "step": 1152, "train_runtime": 3975.933, "train_tokens_per_second": 1428.946 }, { "epoch": 0.4240919540229885, "grad_norm": 0.3495023846626282, "learning_rate": 0.0001154753131908622, "loss": 1.301, "num_input_tokens_seen": 5686832, "step": 1153, "train_runtime": 3979.5207, "train_tokens_per_second": 1429.024 }, { "epoch": 0.4244597701149425, "grad_norm": 0.3514029383659363, "learning_rate": 0.00011540162122328665, "loss": 1.3733, "num_input_tokens_seen": 5690480, "step": 1154, "train_runtime": 3982.1354, "train_tokens_per_second": 1429.002 }, { "epoch": 0.42482758620689653, "grad_norm": 0.31979987025260925, "learning_rate": 0.00011532792925571115, "loss": 1.1896, "num_input_tokens_seen": 5694896, "step": 1155, "train_runtime": 3985.1922, "train_tokens_per_second": 1429.014 }, { "epoch": 0.42519540229885056, "grad_norm": 0.3527876138687134, "learning_rate": 0.0001152542372881356, "loss": 1.344, "num_input_tokens_seen": 5698896, "step": 1156, "train_runtime": 3987.9732, "train_tokens_per_second": 1429.021 }, { "epoch": 0.4255632183908046, "grad_norm": 0.4048612713813782, "learning_rate": 0.00011518054532056006, "loss": 1.278, "num_input_tokens_seen": 5702384, "step": 1157, "train_runtime": 3990.4991, "train_tokens_per_second": 1428.99 }, { "epoch": 0.4259310344827586, "grad_norm": 0.3892061114311218, "learning_rate": 0.00011510685335298453, "loss": 1.3818, "num_input_tokens_seen": 5710000, "step": 1158, "train_runtime": 3995.3618, "train_tokens_per_second": 1429.157 }, { "epoch": 0.4262988505747126, "grad_norm": 0.37503063678741455, "learning_rate": 0.000115033161385409, "loss": 1.1966, "num_input_tokens_seen": 5717456, "step": 1159, "train_runtime": 4000.1757, "train_tokens_per_second": 1429.301 }, { "epoch": 0.4266666666666667, "grad_norm": 0.3696037828922272, "learning_rate": 0.00011495946941783347, "loss": 1.2336, "num_input_tokens_seen": 5721744, "step": 1160, "train_runtime": 4003.2383, "train_tokens_per_second": 1429.279 }, { "epoch": 0.4270344827586207, "grad_norm": 0.36025142669677734, "learning_rate": 0.00011488577745025792, "loss": 1.2687, "num_input_tokens_seen": 5725504, "step": 1161, "train_runtime": 4005.9685, "train_tokens_per_second": 1429.243 }, { "epoch": 0.42740229885057474, "grad_norm": 0.37280407547950745, "learning_rate": 0.00011481208548268239, "loss": 1.3401, "num_input_tokens_seen": 5729856, "step": 1162, "train_runtime": 4009.0174, "train_tokens_per_second": 1429.242 }, { "epoch": 0.42777011494252876, "grad_norm": 0.5364356637001038, "learning_rate": 0.00011473839351510686, "loss": 1.2517, "num_input_tokens_seen": 5734672, "step": 1163, "train_runtime": 4012.2114, "train_tokens_per_second": 1429.305 }, { "epoch": 0.4281379310344828, "grad_norm": 0.33989518880844116, "learning_rate": 0.00011466470154753133, "loss": 1.077, "num_input_tokens_seen": 5738016, "step": 1164, "train_runtime": 4014.721, "train_tokens_per_second": 1429.244 }, { "epoch": 0.4285057471264368, "grad_norm": 0.3356742262840271, "learning_rate": 0.0001145910095799558, "loss": 1.2565, "num_input_tokens_seen": 5742352, "step": 1165, "train_runtime": 4017.754, "train_tokens_per_second": 1429.244 }, { "epoch": 0.4288735632183908, "grad_norm": 0.33251529932022095, "learning_rate": 0.00011451731761238025, "loss": 1.1648, "num_input_tokens_seen": 5747456, "step": 1166, "train_runtime": 4021.137, "train_tokens_per_second": 1429.311 }, { "epoch": 0.42924137931034484, "grad_norm": 0.3364160358905792, "learning_rate": 0.00011444362564480474, "loss": 1.2334, "num_input_tokens_seen": 5752896, "step": 1167, "train_runtime": 4024.7353, "train_tokens_per_second": 1429.385 }, { "epoch": 0.42960919540229886, "grad_norm": 0.36181768774986267, "learning_rate": 0.00011436993367722919, "loss": 1.2421, "num_input_tokens_seen": 5756608, "step": 1168, "train_runtime": 4027.3286, "train_tokens_per_second": 1429.386 }, { "epoch": 0.4299770114942529, "grad_norm": 0.3630189299583435, "learning_rate": 0.00011429624170965365, "loss": 1.0806, "num_input_tokens_seen": 5761264, "step": 1169, "train_runtime": 4030.5433, "train_tokens_per_second": 1429.401 }, { "epoch": 0.4303448275862069, "grad_norm": 0.3320649266242981, "learning_rate": 0.0001142225497420781, "loss": 1.2026, "num_input_tokens_seen": 5767712, "step": 1170, "train_runtime": 4034.7117, "train_tokens_per_second": 1429.523 }, { "epoch": 0.4307126436781609, "grad_norm": 0.34025683999061584, "learning_rate": 0.0001141488577745026, "loss": 1.1531, "num_input_tokens_seen": 5776464, "step": 1171, "train_runtime": 4042.2467, "train_tokens_per_second": 1429.023 }, { "epoch": 0.43108045977011494, "grad_norm": 0.362405389547348, "learning_rate": 0.00011407516580692705, "loss": 1.2082, "num_input_tokens_seen": 5782448, "step": 1172, "train_runtime": 4046.1714, "train_tokens_per_second": 1429.116 }, { "epoch": 0.43144827586206896, "grad_norm": 0.3381401002407074, "learning_rate": 0.00011400147383935151, "loss": 1.3184, "num_input_tokens_seen": 5786352, "step": 1173, "train_runtime": 4048.9633, "train_tokens_per_second": 1429.095 }, { "epoch": 0.431816091954023, "grad_norm": 0.41051506996154785, "learning_rate": 0.00011392778187177598, "loss": 1.3395, "num_input_tokens_seen": 5790864, "step": 1174, "train_runtime": 4052.0158, "train_tokens_per_second": 1429.132 }, { "epoch": 0.432183908045977, "grad_norm": 0.3421885371208191, "learning_rate": 0.00011385408990420046, "loss": 1.1728, "num_input_tokens_seen": 5798192, "step": 1175, "train_runtime": 4056.7068, "train_tokens_per_second": 1429.285 }, { "epoch": 0.432551724137931, "grad_norm": 0.3680936396121979, "learning_rate": 0.00011378039793662492, "loss": 1.3333, "num_input_tokens_seen": 5802368, "step": 1176, "train_runtime": 4059.6054, "train_tokens_per_second": 1429.294 }, { "epoch": 0.43291954022988505, "grad_norm": 0.397718608379364, "learning_rate": 0.00011370670596904937, "loss": 1.3145, "num_input_tokens_seen": 5806176, "step": 1177, "train_runtime": 4062.2614, "train_tokens_per_second": 1429.296 }, { "epoch": 0.43328735632183907, "grad_norm": 0.33635425567626953, "learning_rate": 0.00011363301400147384, "loss": 1.2446, "num_input_tokens_seen": 5811376, "step": 1178, "train_runtime": 4065.7383, "train_tokens_per_second": 1429.353 }, { "epoch": 0.4336551724137931, "grad_norm": 0.32526007294654846, "learning_rate": 0.00011355932203389832, "loss": 1.2973, "num_input_tokens_seen": 5818240, "step": 1179, "train_runtime": 4070.131, "train_tokens_per_second": 1429.497 }, { "epoch": 0.4340229885057471, "grad_norm": 0.3307048976421356, "learning_rate": 0.00011348563006632278, "loss": 1.2138, "num_input_tokens_seen": 5821696, "step": 1180, "train_runtime": 4072.6649, "train_tokens_per_second": 1429.456 }, { "epoch": 0.43439080459770113, "grad_norm": 0.4009729325771332, "learning_rate": 0.00011341193809874724, "loss": 1.1518, "num_input_tokens_seen": 5827008, "step": 1181, "train_runtime": 4076.1265, "train_tokens_per_second": 1429.545 }, { "epoch": 0.43475862068965515, "grad_norm": 0.39996057748794556, "learning_rate": 0.0001133382461311717, "loss": 1.4002, "num_input_tokens_seen": 5834432, "step": 1182, "train_runtime": 4080.8989, "train_tokens_per_second": 1429.693 }, { "epoch": 0.43512643678160917, "grad_norm": 0.3483218550682068, "learning_rate": 0.00011326455416359619, "loss": 1.0175, "num_input_tokens_seen": 5837360, "step": 1183, "train_runtime": 4083.1852, "train_tokens_per_second": 1429.609 }, { "epoch": 0.4354942528735632, "grad_norm": 0.3229388892650604, "learning_rate": 0.00011319086219602064, "loss": 1.2757, "num_input_tokens_seen": 5842272, "step": 1184, "train_runtime": 4086.4878, "train_tokens_per_second": 1429.656 }, { "epoch": 0.43586206896551727, "grad_norm": 0.3437669575214386, "learning_rate": 0.0001131171702284451, "loss": 1.2059, "num_input_tokens_seen": 5848128, "step": 1185, "train_runtime": 4090.3537, "train_tokens_per_second": 1429.737 }, { "epoch": 0.4362298850574713, "grad_norm": 0.3559442460536957, "learning_rate": 0.00011304347826086956, "loss": 1.2055, "num_input_tokens_seen": 5852800, "step": 1186, "train_runtime": 4093.4785, "train_tokens_per_second": 1429.786 }, { "epoch": 0.4365977011494253, "grad_norm": 0.3661964237689972, "learning_rate": 0.00011296978629329405, "loss": 1.3441, "num_input_tokens_seen": 5857936, "step": 1187, "train_runtime": 4096.9417, "train_tokens_per_second": 1429.831 }, { "epoch": 0.43696551724137933, "grad_norm": 0.36302024126052856, "learning_rate": 0.0001128960943257185, "loss": 1.1984, "num_input_tokens_seen": 5861712, "step": 1188, "train_runtime": 4099.6586, "train_tokens_per_second": 1429.805 }, { "epoch": 0.43733333333333335, "grad_norm": 0.3588753342628479, "learning_rate": 0.00011282240235814296, "loss": 1.2675, "num_input_tokens_seen": 5865856, "step": 1189, "train_runtime": 4102.608, "train_tokens_per_second": 1429.787 }, { "epoch": 0.4377011494252874, "grad_norm": 0.38231196999549866, "learning_rate": 0.00011274871039056743, "loss": 1.2625, "num_input_tokens_seen": 5870288, "step": 1190, "train_runtime": 4105.6332, "train_tokens_per_second": 1429.813 }, { "epoch": 0.4380689655172414, "grad_norm": 0.3439554274082184, "learning_rate": 0.0001126750184229919, "loss": 1.1443, "num_input_tokens_seen": 5875040, "step": 1191, "train_runtime": 4108.9182, "train_tokens_per_second": 1429.826 }, { "epoch": 0.4384367816091954, "grad_norm": 0.3980753719806671, "learning_rate": 0.00011260132645541637, "loss": 1.1575, "num_input_tokens_seen": 5879184, "step": 1192, "train_runtime": 4111.8306, "train_tokens_per_second": 1429.822 }, { "epoch": 0.43880459770114943, "grad_norm": 0.34824803471565247, "learning_rate": 0.00011252763448784082, "loss": 1.2916, "num_input_tokens_seen": 5883888, "step": 1193, "train_runtime": 4115.1211, "train_tokens_per_second": 1429.821 }, { "epoch": 0.43917241379310346, "grad_norm": 0.34816622734069824, "learning_rate": 0.00011245394252026529, "loss": 1.2445, "num_input_tokens_seen": 5888640, "step": 1194, "train_runtime": 4118.3069, "train_tokens_per_second": 1429.869 }, { "epoch": 0.4395402298850575, "grad_norm": 0.38447898626327515, "learning_rate": 0.00011238025055268977, "loss": 1.1334, "num_input_tokens_seen": 5893984, "step": 1195, "train_runtime": 4121.8758, "train_tokens_per_second": 1429.928 }, { "epoch": 0.4399080459770115, "grad_norm": 0.39275237917900085, "learning_rate": 0.00011230655858511423, "loss": 1.4061, "num_input_tokens_seen": 5897616, "step": 1196, "train_runtime": 4124.4836, "train_tokens_per_second": 1429.904 }, { "epoch": 0.4402758620689655, "grad_norm": 0.35407283902168274, "learning_rate": 0.0001122328666175387, "loss": 1.2315, "num_input_tokens_seen": 5902736, "step": 1197, "train_runtime": 4127.9273, "train_tokens_per_second": 1429.952 }, { "epoch": 0.44064367816091954, "grad_norm": 0.35835179686546326, "learning_rate": 0.00011215917464996315, "loss": 1.2255, "num_input_tokens_seen": 5906816, "step": 1198, "train_runtime": 4130.7407, "train_tokens_per_second": 1429.965 }, { "epoch": 0.44101149425287356, "grad_norm": 0.3749407231807709, "learning_rate": 0.00011208548268238764, "loss": 1.2637, "num_input_tokens_seen": 5910784, "step": 1199, "train_runtime": 4133.505, "train_tokens_per_second": 1429.969 }, { "epoch": 0.4413793103448276, "grad_norm": 0.3695550560951233, "learning_rate": 0.00011201179071481209, "loss": 1.2706, "num_input_tokens_seen": 5919504, "step": 1200, "train_runtime": 4138.8237, "train_tokens_per_second": 1430.238 }, { "epoch": 0.4417471264367816, "grad_norm": 0.33353039622306824, "learning_rate": 0.00011193809874723655, "loss": 1.2446, "num_input_tokens_seen": 5925264, "step": 1201, "train_runtime": 4144.715, "train_tokens_per_second": 1429.595 }, { "epoch": 0.4421149425287356, "grad_norm": 0.3443011939525604, "learning_rate": 0.00011186440677966102, "loss": 1.2483, "num_input_tokens_seen": 5929904, "step": 1202, "train_runtime": 4147.8556, "train_tokens_per_second": 1429.631 }, { "epoch": 0.44248275862068964, "grad_norm": 0.3490920662879944, "learning_rate": 0.0001117907148120855, "loss": 1.2847, "num_input_tokens_seen": 5934512, "step": 1203, "train_runtime": 4151.0616, "train_tokens_per_second": 1429.637 }, { "epoch": 0.44285057471264366, "grad_norm": 0.311960369348526, "learning_rate": 0.00011171702284450995, "loss": 1.1286, "num_input_tokens_seen": 5939200, "step": 1204, "train_runtime": 4154.2897, "train_tokens_per_second": 1429.655 }, { "epoch": 0.4432183908045977, "grad_norm": 0.3815508484840393, "learning_rate": 0.00011164333087693441, "loss": 1.2408, "num_input_tokens_seen": 5944768, "step": 1205, "train_runtime": 4157.9165, "train_tokens_per_second": 1429.747 }, { "epoch": 0.4435862068965517, "grad_norm": 0.3875328600406647, "learning_rate": 0.00011156963890935888, "loss": 1.258, "num_input_tokens_seen": 5948304, "step": 1206, "train_runtime": 4160.4839, "train_tokens_per_second": 1429.714 }, { "epoch": 0.4439540229885057, "grad_norm": 0.36638692021369934, "learning_rate": 0.00011149594694178336, "loss": 1.3522, "num_input_tokens_seen": 5951808, "step": 1207, "train_runtime": 4163.032, "train_tokens_per_second": 1429.681 }, { "epoch": 0.44432183908045975, "grad_norm": 0.3697892129421234, "learning_rate": 0.00011142225497420782, "loss": 1.1856, "num_input_tokens_seen": 5956128, "step": 1208, "train_runtime": 4166.0194, "train_tokens_per_second": 1429.693 }, { "epoch": 0.44468965517241377, "grad_norm": 0.3350822925567627, "learning_rate": 0.00011134856300663227, "loss": 1.2526, "num_input_tokens_seen": 5959904, "step": 1209, "train_runtime": 4168.6596, "train_tokens_per_second": 1429.693 }, { "epoch": 0.44505747126436784, "grad_norm": 0.3635978400707245, "learning_rate": 0.00011127487103905674, "loss": 1.1705, "num_input_tokens_seen": 5964608, "step": 1210, "train_runtime": 4171.7609, "train_tokens_per_second": 1429.758 }, { "epoch": 0.44542528735632186, "grad_norm": 0.3655666708946228, "learning_rate": 0.00011120117907148122, "loss": 1.2799, "num_input_tokens_seen": 5975136, "step": 1211, "train_runtime": 4178.305, "train_tokens_per_second": 1430.038 }, { "epoch": 0.4457931034482759, "grad_norm": 0.3381154537200928, "learning_rate": 0.00011112748710390568, "loss": 1.2709, "num_input_tokens_seen": 5978880, "step": 1212, "train_runtime": 4181.0461, "train_tokens_per_second": 1429.996 }, { "epoch": 0.4461609195402299, "grad_norm": 0.34990912675857544, "learning_rate": 0.00011105379513633015, "loss": 1.1869, "num_input_tokens_seen": 5984496, "step": 1213, "train_runtime": 4184.7765, "train_tokens_per_second": 1430.063 }, { "epoch": 0.4465287356321839, "grad_norm": 0.3995387554168701, "learning_rate": 0.0001109801031687546, "loss": 1.2954, "num_input_tokens_seen": 5989872, "step": 1214, "train_runtime": 4188.3403, "train_tokens_per_second": 1430.13 }, { "epoch": 0.44689655172413795, "grad_norm": 0.4230879247188568, "learning_rate": 0.00011090641120117909, "loss": 1.2431, "num_input_tokens_seen": 5993008, "step": 1215, "train_runtime": 4190.7061, "train_tokens_per_second": 1430.071 }, { "epoch": 0.44726436781609197, "grad_norm": 0.33954480290412903, "learning_rate": 0.00011083271923360354, "loss": 1.1937, "num_input_tokens_seen": 5996592, "step": 1216, "train_runtime": 4193.2649, "train_tokens_per_second": 1430.053 }, { "epoch": 0.447632183908046, "grad_norm": 0.417182981967926, "learning_rate": 0.000110759027266028, "loss": 1.2867, "num_input_tokens_seen": 6003120, "step": 1217, "train_runtime": 4197.5178, "train_tokens_per_second": 1430.159 }, { "epoch": 0.448, "grad_norm": 0.382184773683548, "learning_rate": 0.00011068533529845247, "loss": 1.1929, "num_input_tokens_seen": 6008240, "step": 1218, "train_runtime": 4200.9443, "train_tokens_per_second": 1430.212 }, { "epoch": 0.44836781609195403, "grad_norm": 0.3704416751861572, "learning_rate": 0.00011061164333087695, "loss": 1.1453, "num_input_tokens_seen": 6012944, "step": 1219, "train_runtime": 4204.0888, "train_tokens_per_second": 1430.261 }, { "epoch": 0.44873563218390805, "grad_norm": 0.3858819305896759, "learning_rate": 0.0001105379513633014, "loss": 1.3237, "num_input_tokens_seen": 6020160, "step": 1220, "train_runtime": 4208.7156, "train_tokens_per_second": 1430.403 }, { "epoch": 0.44910344827586207, "grad_norm": 0.3485792875289917, "learning_rate": 0.00011046425939572586, "loss": 1.3126, "num_input_tokens_seen": 6023616, "step": 1221, "train_runtime": 4211.3003, "train_tokens_per_second": 1430.346 }, { "epoch": 0.4494712643678161, "grad_norm": 0.36032938957214355, "learning_rate": 0.00011039056742815033, "loss": 1.2516, "num_input_tokens_seen": 6026944, "step": 1222, "train_runtime": 4213.7157, "train_tokens_per_second": 1430.316 }, { "epoch": 0.4498390804597701, "grad_norm": 0.33639198541641235, "learning_rate": 0.00011031687546057481, "loss": 1.1945, "num_input_tokens_seen": 6030512, "step": 1223, "train_runtime": 4216.2695, "train_tokens_per_second": 1430.296 }, { "epoch": 0.45020689655172413, "grad_norm": 0.3770942986011505, "learning_rate": 0.00011024318349299927, "loss": 1.1821, "num_input_tokens_seen": 6033808, "step": 1224, "train_runtime": 4218.6686, "train_tokens_per_second": 1430.264 }, { "epoch": 0.45057471264367815, "grad_norm": 0.35923275351524353, "learning_rate": 0.00011016949152542372, "loss": 1.2543, "num_input_tokens_seen": 6042512, "step": 1225, "train_runtime": 4224.0798, "train_tokens_per_second": 1430.492 }, { "epoch": 0.4509425287356322, "grad_norm": 0.3461097478866577, "learning_rate": 0.00011009579955784819, "loss": 1.3266, "num_input_tokens_seen": 6046368, "step": 1226, "train_runtime": 4226.8599, "train_tokens_per_second": 1430.463 }, { "epoch": 0.4513103448275862, "grad_norm": 0.3811730742454529, "learning_rate": 0.00011002210759027267, "loss": 1.1791, "num_input_tokens_seen": 6050656, "step": 1227, "train_runtime": 4229.7985, "train_tokens_per_second": 1430.483 }, { "epoch": 0.4516781609195402, "grad_norm": 0.3463786542415619, "learning_rate": 0.00010994841562269713, "loss": 1.2673, "num_input_tokens_seen": 6054304, "step": 1228, "train_runtime": 4232.4393, "train_tokens_per_second": 1430.453 }, { "epoch": 0.45204597701149424, "grad_norm": 0.3345196545124054, "learning_rate": 0.0001098747236551216, "loss": 1.3401, "num_input_tokens_seen": 6058720, "step": 1229, "train_runtime": 4235.5187, "train_tokens_per_second": 1430.455 }, { "epoch": 0.45241379310344826, "grad_norm": 0.3485439419746399, "learning_rate": 0.00010980103168754605, "loss": 1.1461, "num_input_tokens_seen": 6065264, "step": 1230, "train_runtime": 4239.719, "train_tokens_per_second": 1430.582 }, { "epoch": 0.4527816091954023, "grad_norm": 0.3488841652870178, "learning_rate": 0.00010972733971997054, "loss": 1.0778, "num_input_tokens_seen": 6070448, "step": 1231, "train_runtime": 4245.283, "train_tokens_per_second": 1429.928 }, { "epoch": 0.4531494252873563, "grad_norm": 0.37106987833976746, "learning_rate": 0.00010965364775239499, "loss": 1.4014, "num_input_tokens_seen": 6074320, "step": 1232, "train_runtime": 4248.0271, "train_tokens_per_second": 1429.916 }, { "epoch": 0.4535172413793103, "grad_norm": 0.3421705365180969, "learning_rate": 0.00010957995578481946, "loss": 1.3484, "num_input_tokens_seen": 6082816, "step": 1233, "train_runtime": 4253.3233, "train_tokens_per_second": 1430.133 }, { "epoch": 0.45388505747126434, "grad_norm": 0.3919673264026642, "learning_rate": 0.00010950626381724392, "loss": 1.2733, "num_input_tokens_seen": 6086736, "step": 1234, "train_runtime": 4256.1252, "train_tokens_per_second": 1430.112 }, { "epoch": 0.4542528735632184, "grad_norm": 0.42163845896720886, "learning_rate": 0.0001094325718496684, "loss": 1.3779, "num_input_tokens_seen": 6090256, "step": 1235, "train_runtime": 4258.6724, "train_tokens_per_second": 1430.083 }, { "epoch": 0.45462068965517244, "grad_norm": 0.31236323714256287, "learning_rate": 0.00010935887988209285, "loss": 1.2582, "num_input_tokens_seen": 6096592, "step": 1236, "train_runtime": 4262.7771, "train_tokens_per_second": 1430.193 }, { "epoch": 0.45498850574712646, "grad_norm": 0.3515360951423645, "learning_rate": 0.00010928518791451732, "loss": 1.3312, "num_input_tokens_seen": 6100256, "step": 1237, "train_runtime": 4265.4034, "train_tokens_per_second": 1430.171 }, { "epoch": 0.4553563218390805, "grad_norm": 0.35068124532699585, "learning_rate": 0.00010921149594694178, "loss": 1.2454, "num_input_tokens_seen": 6105776, "step": 1238, "train_runtime": 4269.0479, "train_tokens_per_second": 1430.243 }, { "epoch": 0.4557241379310345, "grad_norm": 0.36568590998649597, "learning_rate": 0.00010913780397936626, "loss": 1.1489, "num_input_tokens_seen": 6112448, "step": 1239, "train_runtime": 4273.3726, "train_tokens_per_second": 1430.357 }, { "epoch": 0.4560919540229885, "grad_norm": 0.4195767939090729, "learning_rate": 0.00010906411201179072, "loss": 1.2759, "num_input_tokens_seen": 6116112, "step": 1240, "train_runtime": 4276.0327, "train_tokens_per_second": 1430.324 }, { "epoch": 0.45645977011494254, "grad_norm": 0.3691119849681854, "learning_rate": 0.00010899042004421517, "loss": 1.3591, "num_input_tokens_seen": 6122784, "step": 1241, "train_runtime": 4280.2975, "train_tokens_per_second": 1430.458 }, { "epoch": 0.45682758620689656, "grad_norm": 0.37664496898651123, "learning_rate": 0.00010891672807663967, "loss": 1.19, "num_input_tokens_seen": 6126368, "step": 1242, "train_runtime": 4282.9, "train_tokens_per_second": 1430.425 }, { "epoch": 0.4571954022988506, "grad_norm": 0.3803861141204834, "learning_rate": 0.00010884303610906412, "loss": 1.4098, "num_input_tokens_seen": 6130176, "step": 1243, "train_runtime": 4285.6065, "train_tokens_per_second": 1430.41 }, { "epoch": 0.4575632183908046, "grad_norm": 0.3393901586532593, "learning_rate": 0.00010876934414148858, "loss": 1.1721, "num_input_tokens_seen": 6135680, "step": 1244, "train_runtime": 4289.2725, "train_tokens_per_second": 1430.471 }, { "epoch": 0.4579310344827586, "grad_norm": 0.3811853229999542, "learning_rate": 0.00010869565217391305, "loss": 1.3572, "num_input_tokens_seen": 6142368, "step": 1245, "train_runtime": 4293.5758, "train_tokens_per_second": 1430.595 }, { "epoch": 0.45829885057471265, "grad_norm": 0.3287411630153656, "learning_rate": 0.00010862196020633753, "loss": 1.1254, "num_input_tokens_seen": 6148128, "step": 1246, "train_runtime": 4297.4141, "train_tokens_per_second": 1430.658 }, { "epoch": 0.45866666666666667, "grad_norm": 0.3776017427444458, "learning_rate": 0.00010854826823876199, "loss": 1.1667, "num_input_tokens_seen": 6151232, "step": 1247, "train_runtime": 4299.7626, "train_tokens_per_second": 1430.598 }, { "epoch": 0.4590344827586207, "grad_norm": 0.3635268807411194, "learning_rate": 0.00010847457627118644, "loss": 1.2381, "num_input_tokens_seen": 6155104, "step": 1248, "train_runtime": 4302.4617, "train_tokens_per_second": 1430.601 }, { "epoch": 0.4594022988505747, "grad_norm": 0.34583720564842224, "learning_rate": 0.00010840088430361091, "loss": 1.2012, "num_input_tokens_seen": 6161088, "step": 1249, "train_runtime": 4306.3849, "train_tokens_per_second": 1430.687 }, { "epoch": 0.45977011494252873, "grad_norm": 0.37768661975860596, "learning_rate": 0.00010832719233603539, "loss": 1.3583, "num_input_tokens_seen": 6166640, "step": 1250, "train_runtime": 4310.0186, "train_tokens_per_second": 1430.769 }, { "epoch": 0.46013793103448275, "grad_norm": 0.41959473490715027, "learning_rate": 0.00010825350036845985, "loss": 1.3245, "num_input_tokens_seen": 6172032, "step": 1251, "train_runtime": 4313.61, "train_tokens_per_second": 1430.828 }, { "epoch": 0.46050574712643677, "grad_norm": 0.3565807640552521, "learning_rate": 0.00010817980840088431, "loss": 1.2997, "num_input_tokens_seen": 6179120, "step": 1252, "train_runtime": 4318.1718, "train_tokens_per_second": 1430.957 }, { "epoch": 0.4608735632183908, "grad_norm": 0.35290762782096863, "learning_rate": 0.00010810611643330877, "loss": 1.2975, "num_input_tokens_seen": 6182800, "step": 1253, "train_runtime": 4320.7099, "train_tokens_per_second": 1430.969 }, { "epoch": 0.4612413793103448, "grad_norm": 0.3748103678226471, "learning_rate": 0.00010803242446573324, "loss": 1.3029, "num_input_tokens_seen": 6187296, "step": 1254, "train_runtime": 4323.8035, "train_tokens_per_second": 1430.985 }, { "epoch": 0.46160919540229883, "grad_norm": 0.36973637342453003, "learning_rate": 0.00010795873249815771, "loss": 1.2859, "num_input_tokens_seen": 6193424, "step": 1255, "train_runtime": 4327.8263, "train_tokens_per_second": 1431.07 }, { "epoch": 0.46197701149425285, "grad_norm": 0.3441025912761688, "learning_rate": 0.00010788504053058217, "loss": 1.278, "num_input_tokens_seen": 6197440, "step": 1256, "train_runtime": 4330.6671, "train_tokens_per_second": 1431.059 }, { "epoch": 0.4623448275862069, "grad_norm": 0.3740573823451996, "learning_rate": 0.00010781134856300663, "loss": 1.1992, "num_input_tokens_seen": 6201168, "step": 1257, "train_runtime": 4333.3016, "train_tokens_per_second": 1431.049 }, { "epoch": 0.4627126436781609, "grad_norm": 0.36677950620651245, "learning_rate": 0.00010773765659543112, "loss": 1.2677, "num_input_tokens_seen": 6204752, "step": 1258, "train_runtime": 4335.8207, "train_tokens_per_second": 1431.044 }, { "epoch": 0.4630804597701149, "grad_norm": 0.33686837553977966, "learning_rate": 0.00010766396462785557, "loss": 1.1555, "num_input_tokens_seen": 6208272, "step": 1259, "train_runtime": 4338.3877, "train_tokens_per_second": 1431.009 }, { "epoch": 0.463448275862069, "grad_norm": 0.3118646740913391, "learning_rate": 0.00010759027266028003, "loss": 1.2825, "num_input_tokens_seen": 6212320, "step": 1260, "train_runtime": 4341.2198, "train_tokens_per_second": 1431.008 }, { "epoch": 0.463816091954023, "grad_norm": 0.3848208487033844, "learning_rate": 0.0001075165806927045, "loss": 1.3584, "num_input_tokens_seen": 6221824, "step": 1261, "train_runtime": 4349.5918, "train_tokens_per_second": 1430.439 }, { "epoch": 0.46418390804597703, "grad_norm": 0.35913828015327454, "learning_rate": 0.00010744288872512898, "loss": 1.2013, "num_input_tokens_seen": 6227248, "step": 1262, "train_runtime": 4353.2599, "train_tokens_per_second": 1430.479 }, { "epoch": 0.46455172413793105, "grad_norm": 0.41634610295295715, "learning_rate": 0.00010736919675755344, "loss": 1.1727, "num_input_tokens_seen": 6233472, "step": 1263, "train_runtime": 4357.3071, "train_tokens_per_second": 1430.579 }, { "epoch": 0.4649195402298851, "grad_norm": 0.38134899735450745, "learning_rate": 0.00010729550478997789, "loss": 1.2966, "num_input_tokens_seen": 6237136, "step": 1264, "train_runtime": 4359.9793, "train_tokens_per_second": 1430.543 }, { "epoch": 0.4652873563218391, "grad_norm": 0.38777005672454834, "learning_rate": 0.00010722181282240236, "loss": 1.2314, "num_input_tokens_seen": 6241104, "step": 1265, "train_runtime": 4362.7074, "train_tokens_per_second": 1430.558 }, { "epoch": 0.4656551724137931, "grad_norm": 0.38832637667655945, "learning_rate": 0.00010714812085482684, "loss": 1.2465, "num_input_tokens_seen": 6247824, "step": 1266, "train_runtime": 4367.0115, "train_tokens_per_second": 1430.686 }, { "epoch": 0.46602298850574714, "grad_norm": 0.36237862706184387, "learning_rate": 0.0001070744288872513, "loss": 1.0657, "num_input_tokens_seen": 6252944, "step": 1267, "train_runtime": 4370.469, "train_tokens_per_second": 1430.726 }, { "epoch": 0.46639080459770116, "grad_norm": 0.390701562166214, "learning_rate": 0.00010700073691967577, "loss": 1.4827, "num_input_tokens_seen": 6256736, "step": 1268, "train_runtime": 4373.2168, "train_tokens_per_second": 1430.694 }, { "epoch": 0.4667586206896552, "grad_norm": 0.36114194989204407, "learning_rate": 0.00010692704495210022, "loss": 1.2605, "num_input_tokens_seen": 6260432, "step": 1269, "train_runtime": 4375.8548, "train_tokens_per_second": 1430.676 }, { "epoch": 0.4671264367816092, "grad_norm": 0.40937262773513794, "learning_rate": 0.0001068533529845247, "loss": 1.1864, "num_input_tokens_seen": 6264000, "step": 1270, "train_runtime": 4378.4245, "train_tokens_per_second": 1430.652 }, { "epoch": 0.4674942528735632, "grad_norm": 0.33223870396614075, "learning_rate": 0.00010677966101694916, "loss": 1.1763, "num_input_tokens_seen": 6267760, "step": 1271, "train_runtime": 4381.1289, "train_tokens_per_second": 1430.627 }, { "epoch": 0.46786206896551724, "grad_norm": 0.3518359363079071, "learning_rate": 0.00010670596904937362, "loss": 1.2233, "num_input_tokens_seen": 6273456, "step": 1272, "train_runtime": 4384.906, "train_tokens_per_second": 1430.693 }, { "epoch": 0.46822988505747126, "grad_norm": 0.3486008048057556, "learning_rate": 0.00010663227708179808, "loss": 1.1921, "num_input_tokens_seen": 6277344, "step": 1273, "train_runtime": 4387.6846, "train_tokens_per_second": 1430.673 }, { "epoch": 0.4685977011494253, "grad_norm": 0.3802790939807892, "learning_rate": 0.00010655858511422257, "loss": 1.2854, "num_input_tokens_seen": 6281616, "step": 1274, "train_runtime": 4390.615, "train_tokens_per_second": 1430.692 }, { "epoch": 0.4689655172413793, "grad_norm": 0.3698502779006958, "learning_rate": 0.00010648489314664702, "loss": 1.263, "num_input_tokens_seen": 6285152, "step": 1275, "train_runtime": 4393.2049, "train_tokens_per_second": 1430.653 }, { "epoch": 0.4693333333333333, "grad_norm": 0.397744745016098, "learning_rate": 0.00010641120117907148, "loss": 1.2312, "num_input_tokens_seen": 6288624, "step": 1276, "train_runtime": 4395.7017, "train_tokens_per_second": 1430.63 }, { "epoch": 0.46970114942528735, "grad_norm": 0.3773235082626343, "learning_rate": 0.00010633750921149595, "loss": 1.0731, "num_input_tokens_seen": 6292848, "step": 1277, "train_runtime": 4398.6347, "train_tokens_per_second": 1430.637 }, { "epoch": 0.47006896551724137, "grad_norm": 0.33362874388694763, "learning_rate": 0.00010626381724392043, "loss": 1.2441, "num_input_tokens_seen": 6298832, "step": 1278, "train_runtime": 4402.6273, "train_tokens_per_second": 1430.698 }, { "epoch": 0.4704367816091954, "grad_norm": 0.36299988627433777, "learning_rate": 0.00010619012527634489, "loss": 1.1648, "num_input_tokens_seen": 6302304, "step": 1279, "train_runtime": 4405.1823, "train_tokens_per_second": 1430.657 }, { "epoch": 0.4708045977011494, "grad_norm": 0.4033413827419281, "learning_rate": 0.00010611643330876934, "loss": 1.334, "num_input_tokens_seen": 6308736, "step": 1280, "train_runtime": 4409.3679, "train_tokens_per_second": 1430.757 }, { "epoch": 0.47117241379310343, "grad_norm": 0.3534686267375946, "learning_rate": 0.00010604274134119381, "loss": 1.2313, "num_input_tokens_seen": 6313872, "step": 1281, "train_runtime": 4412.8017, "train_tokens_per_second": 1430.808 }, { "epoch": 0.47154022988505745, "grad_norm": 0.3610369861125946, "learning_rate": 0.00010596904937361829, "loss": 1.4434, "num_input_tokens_seen": 6318544, "step": 1282, "train_runtime": 4416.0242, "train_tokens_per_second": 1430.822 }, { "epoch": 0.47190804597701147, "grad_norm": 0.3407459855079651, "learning_rate": 0.00010589535740604275, "loss": 1.2618, "num_input_tokens_seen": 6323072, "step": 1283, "train_runtime": 4419.1162, "train_tokens_per_second": 1430.845 }, { "epoch": 0.4722758620689655, "grad_norm": 0.37021225690841675, "learning_rate": 0.00010582166543846722, "loss": 1.2868, "num_input_tokens_seen": 6328976, "step": 1284, "train_runtime": 4422.9672, "train_tokens_per_second": 1430.934 }, { "epoch": 0.47264367816091957, "grad_norm": 0.406423956155777, "learning_rate": 0.00010574797347089167, "loss": 1.1297, "num_input_tokens_seen": 6333776, "step": 1285, "train_runtime": 4426.2085, "train_tokens_per_second": 1430.971 }, { "epoch": 0.4730114942528736, "grad_norm": 0.3668529987335205, "learning_rate": 0.00010567428150331616, "loss": 1.2369, "num_input_tokens_seen": 6336976, "step": 1286, "train_runtime": 4428.6273, "train_tokens_per_second": 1430.912 }, { "epoch": 0.4733793103448276, "grad_norm": 0.4330931603908539, "learning_rate": 0.00010560058953574061, "loss": 1.4164, "num_input_tokens_seen": 6340608, "step": 1287, "train_runtime": 4431.2583, "train_tokens_per_second": 1430.882 }, { "epoch": 0.47374712643678163, "grad_norm": 0.36734557151794434, "learning_rate": 0.00010552689756816508, "loss": 1.2767, "num_input_tokens_seen": 6344992, "step": 1288, "train_runtime": 4434.2433, "train_tokens_per_second": 1430.907 }, { "epoch": 0.47411494252873565, "grad_norm": 0.34771713614463806, "learning_rate": 0.00010545320560058953, "loss": 1.1343, "num_input_tokens_seen": 6349456, "step": 1289, "train_runtime": 4437.326, "train_tokens_per_second": 1430.919 }, { "epoch": 0.47448275862068967, "grad_norm": 0.33599287271499634, "learning_rate": 0.00010537951363301402, "loss": 1.0908, "num_input_tokens_seen": 6353600, "step": 1290, "train_runtime": 4440.1962, "train_tokens_per_second": 1430.928 }, { "epoch": 0.4748505747126437, "grad_norm": 0.3521447479724884, "learning_rate": 0.00010530582166543847, "loss": 1.22, "num_input_tokens_seen": 6359744, "step": 1291, "train_runtime": 4446.2197, "train_tokens_per_second": 1430.371 }, { "epoch": 0.4752183908045977, "grad_norm": 0.3271966278553009, "learning_rate": 0.00010523212969786293, "loss": 1.1256, "num_input_tokens_seen": 6363504, "step": 1292, "train_runtime": 4448.8778, "train_tokens_per_second": 1430.362 }, { "epoch": 0.47558620689655173, "grad_norm": 0.38395509123802185, "learning_rate": 0.0001051584377302874, "loss": 1.2161, "num_input_tokens_seen": 6366288, "step": 1293, "train_runtime": 4451.0679, "train_tokens_per_second": 1430.283 }, { "epoch": 0.47595402298850575, "grad_norm": 0.3537251353263855, "learning_rate": 0.00010508474576271188, "loss": 1.341, "num_input_tokens_seen": 6371728, "step": 1294, "train_runtime": 4454.7019, "train_tokens_per_second": 1430.338 }, { "epoch": 0.4763218390804598, "grad_norm": 0.3379925489425659, "learning_rate": 0.00010501105379513634, "loss": 1.2562, "num_input_tokens_seen": 6375328, "step": 1295, "train_runtime": 4457.2202, "train_tokens_per_second": 1430.337 }, { "epoch": 0.4766896551724138, "grad_norm": 0.3717350363731384, "learning_rate": 0.0001049373618275608, "loss": 1.1476, "num_input_tokens_seen": 6380464, "step": 1296, "train_runtime": 4460.6865, "train_tokens_per_second": 1430.377 }, { "epoch": 0.4770574712643678, "grad_norm": 0.3562183976173401, "learning_rate": 0.00010486366985998526, "loss": 1.2088, "num_input_tokens_seen": 6385040, "step": 1297, "train_runtime": 4463.8364, "train_tokens_per_second": 1430.393 }, { "epoch": 0.47742528735632184, "grad_norm": 0.3495655059814453, "learning_rate": 0.00010478997789240974, "loss": 1.0605, "num_input_tokens_seen": 6388704, "step": 1298, "train_runtime": 4466.3586, "train_tokens_per_second": 1430.406 }, { "epoch": 0.47779310344827586, "grad_norm": 0.3826037347316742, "learning_rate": 0.0001047162859248342, "loss": 1.3307, "num_input_tokens_seen": 6394224, "step": 1299, "train_runtime": 4470.0406, "train_tokens_per_second": 1430.462 }, { "epoch": 0.4781609195402299, "grad_norm": 0.360375314950943, "learning_rate": 0.00010464259395725867, "loss": 1.1802, "num_input_tokens_seen": 6398496, "step": 1300, "train_runtime": 4472.9385, "train_tokens_per_second": 1430.491 }, { "epoch": 0.4785287356321839, "grad_norm": 0.39885199069976807, "learning_rate": 0.00010456890198968312, "loss": 1.2222, "num_input_tokens_seen": 6403088, "step": 1301, "train_runtime": 4476.0208, "train_tokens_per_second": 1430.531 }, { "epoch": 0.4788965517241379, "grad_norm": 0.4102533757686615, "learning_rate": 0.00010449521002210761, "loss": 1.1182, "num_input_tokens_seen": 6406432, "step": 1302, "train_runtime": 4478.4776, "train_tokens_per_second": 1430.493 }, { "epoch": 0.47926436781609194, "grad_norm": 0.3570133149623871, "learning_rate": 0.00010442151805453206, "loss": 1.301, "num_input_tokens_seen": 6410080, "step": 1303, "train_runtime": 4481.0902, "train_tokens_per_second": 1430.473 }, { "epoch": 0.47963218390804596, "grad_norm": 0.38149404525756836, "learning_rate": 0.00010434782608695653, "loss": 1.2595, "num_input_tokens_seen": 6415984, "step": 1304, "train_runtime": 4484.8975, "train_tokens_per_second": 1430.575 }, { "epoch": 0.48, "grad_norm": 0.33905965089797974, "learning_rate": 0.00010427413411938098, "loss": 1.0739, "num_input_tokens_seen": 6422784, "step": 1305, "train_runtime": 4489.2181, "train_tokens_per_second": 1430.713 }, { "epoch": 0.480367816091954, "grad_norm": 0.39441245794296265, "learning_rate": 0.00010420044215180547, "loss": 1.1301, "num_input_tokens_seen": 6426384, "step": 1306, "train_runtime": 4491.8253, "train_tokens_per_second": 1430.684 }, { "epoch": 0.480735632183908, "grad_norm": 0.34629571437835693, "learning_rate": 0.00010412675018422992, "loss": 1.2152, "num_input_tokens_seen": 6432912, "step": 1307, "train_runtime": 4496.0448, "train_tokens_per_second": 1430.794 }, { "epoch": 0.48110344827586204, "grad_norm": 0.35656386613845825, "learning_rate": 0.00010405305821665439, "loss": 1.3009, "num_input_tokens_seen": 6441328, "step": 1308, "train_runtime": 4501.2577, "train_tokens_per_second": 1431.006 }, { "epoch": 0.48147126436781607, "grad_norm": 0.33565548062324524, "learning_rate": 0.00010397936624907885, "loss": 1.1521, "num_input_tokens_seen": 6446576, "step": 1309, "train_runtime": 4504.6836, "train_tokens_per_second": 1431.083 }, { "epoch": 0.48183908045977014, "grad_norm": 0.3866482377052307, "learning_rate": 0.00010390567428150333, "loss": 1.3206, "num_input_tokens_seen": 6453680, "step": 1310, "train_runtime": 4509.2201, "train_tokens_per_second": 1431.219 }, { "epoch": 0.48220689655172416, "grad_norm": 0.3796980082988739, "learning_rate": 0.0001038319823139278, "loss": 1.2841, "num_input_tokens_seen": 6457776, "step": 1311, "train_runtime": 4512.0656, "train_tokens_per_second": 1431.224 }, { "epoch": 0.4825747126436782, "grad_norm": 0.3984972834587097, "learning_rate": 0.00010375829034635224, "loss": 1.3831, "num_input_tokens_seen": 6461776, "step": 1312, "train_runtime": 4514.8796, "train_tokens_per_second": 1431.218 }, { "epoch": 0.4829425287356322, "grad_norm": 0.34100502729415894, "learning_rate": 0.00010368459837877671, "loss": 1.0627, "num_input_tokens_seen": 6465712, "step": 1313, "train_runtime": 4517.6207, "train_tokens_per_second": 1431.221 }, { "epoch": 0.4833103448275862, "grad_norm": 0.3587813079357147, "learning_rate": 0.00010361090641120119, "loss": 1.2466, "num_input_tokens_seen": 6469312, "step": 1314, "train_runtime": 4520.2359, "train_tokens_per_second": 1431.189 }, { "epoch": 0.48367816091954025, "grad_norm": 0.34215959906578064, "learning_rate": 0.00010353721444362565, "loss": 1.1964, "num_input_tokens_seen": 6473920, "step": 1315, "train_runtime": 4523.385, "train_tokens_per_second": 1431.211 }, { "epoch": 0.48404597701149427, "grad_norm": 0.3500029444694519, "learning_rate": 0.00010346352247605012, "loss": 1.1479, "num_input_tokens_seen": 6480384, "step": 1316, "train_runtime": 4527.4588, "train_tokens_per_second": 1431.351 }, { "epoch": 0.4844137931034483, "grad_norm": 0.3848787248134613, "learning_rate": 0.00010338983050847457, "loss": 1.2403, "num_input_tokens_seen": 6484512, "step": 1317, "train_runtime": 4530.4302, "train_tokens_per_second": 1431.324 }, { "epoch": 0.4847816091954023, "grad_norm": 0.3544035851955414, "learning_rate": 0.00010331613854089906, "loss": 1.2762, "num_input_tokens_seen": 6488672, "step": 1318, "train_runtime": 4533.3076, "train_tokens_per_second": 1431.333 }, { "epoch": 0.48514942528735633, "grad_norm": 0.35067224502563477, "learning_rate": 0.00010324244657332351, "loss": 1.354, "num_input_tokens_seen": 6492832, "step": 1319, "train_runtime": 4536.2511, "train_tokens_per_second": 1431.321 }, { "epoch": 0.48551724137931035, "grad_norm": 0.3909823000431061, "learning_rate": 0.00010316875460574798, "loss": 1.2899, "num_input_tokens_seen": 6497024, "step": 1320, "train_runtime": 4539.1968, "train_tokens_per_second": 1431.316 }, { "epoch": 0.48588505747126437, "grad_norm": 0.3614167273044586, "learning_rate": 0.00010309506263817244, "loss": 1.2836, "num_input_tokens_seen": 6500864, "step": 1321, "train_runtime": 4543.9491, "train_tokens_per_second": 1430.664 }, { "epoch": 0.4862528735632184, "grad_norm": 0.3644118905067444, "learning_rate": 0.00010302137067059692, "loss": 1.447, "num_input_tokens_seen": 6504784, "step": 1322, "train_runtime": 4546.6647, "train_tokens_per_second": 1430.672 }, { "epoch": 0.4866206896551724, "grad_norm": 0.3544730544090271, "learning_rate": 0.00010294767870302137, "loss": 1.252, "num_input_tokens_seen": 6508144, "step": 1323, "train_runtime": 4549.0708, "train_tokens_per_second": 1430.653 }, { "epoch": 0.48698850574712643, "grad_norm": 0.3122788071632385, "learning_rate": 0.00010287398673544584, "loss": 1.1436, "num_input_tokens_seen": 6513664, "step": 1324, "train_runtime": 4552.7466, "train_tokens_per_second": 1430.711 }, { "epoch": 0.48735632183908045, "grad_norm": 0.3575507700443268, "learning_rate": 0.0001028002947678703, "loss": 1.1869, "num_input_tokens_seen": 6518896, "step": 1325, "train_runtime": 4556.1955, "train_tokens_per_second": 1430.776 }, { "epoch": 0.4877241379310345, "grad_norm": 0.37507253885269165, "learning_rate": 0.00010272660280029478, "loss": 1.3157, "num_input_tokens_seen": 6522880, "step": 1326, "train_runtime": 4558.9646, "train_tokens_per_second": 1430.781 }, { "epoch": 0.4880919540229885, "grad_norm": 0.3586728274822235, "learning_rate": 0.00010265291083271924, "loss": 1.4229, "num_input_tokens_seen": 6526928, "step": 1327, "train_runtime": 4561.8625, "train_tokens_per_second": 1430.759 }, { "epoch": 0.4884597701149425, "grad_norm": 0.3385562002658844, "learning_rate": 0.0001025792188651437, "loss": 1.0994, "num_input_tokens_seen": 6531136, "step": 1328, "train_runtime": 4564.7751, "train_tokens_per_second": 1430.768 }, { "epoch": 0.48882758620689654, "grad_norm": 0.35088372230529785, "learning_rate": 0.00010250552689756816, "loss": 1.3271, "num_input_tokens_seen": 6535568, "step": 1329, "train_runtime": 4567.8035, "train_tokens_per_second": 1430.79 }, { "epoch": 0.48919540229885056, "grad_norm": 0.38748985528945923, "learning_rate": 0.00010243183492999264, "loss": 1.2878, "num_input_tokens_seen": 6540736, "step": 1330, "train_runtime": 4571.2934, "train_tokens_per_second": 1430.828 }, { "epoch": 0.4895632183908046, "grad_norm": 0.3386608362197876, "learning_rate": 0.0001023581429624171, "loss": 1.2251, "num_input_tokens_seen": 6546160, "step": 1331, "train_runtime": 4574.9183, "train_tokens_per_second": 1430.88 }, { "epoch": 0.4899310344827586, "grad_norm": 0.3482246994972229, "learning_rate": 0.00010228445099484157, "loss": 1.1065, "num_input_tokens_seen": 6550768, "step": 1332, "train_runtime": 4578.1044, "train_tokens_per_second": 1430.891 }, { "epoch": 0.4902988505747126, "grad_norm": 0.3264620006084442, "learning_rate": 0.00010221075902726602, "loss": 1.2931, "num_input_tokens_seen": 6555584, "step": 1333, "train_runtime": 4581.3368, "train_tokens_per_second": 1430.933 }, { "epoch": 0.49066666666666664, "grad_norm": 0.33076241612434387, "learning_rate": 0.00010213706705969051, "loss": 1.3031, "num_input_tokens_seen": 6559728, "step": 1334, "train_runtime": 4584.1738, "train_tokens_per_second": 1430.951 }, { "epoch": 0.4910344827586207, "grad_norm": 0.3627939224243164, "learning_rate": 0.00010206337509211496, "loss": 1.4815, "num_input_tokens_seen": 6563360, "step": 1335, "train_runtime": 4586.7038, "train_tokens_per_second": 1430.954 }, { "epoch": 0.49140229885057474, "grad_norm": 0.33887478709220886, "learning_rate": 0.00010198968312453943, "loss": 1.1529, "num_input_tokens_seen": 6567840, "step": 1336, "train_runtime": 4589.7288, "train_tokens_per_second": 1430.987 }, { "epoch": 0.49177011494252876, "grad_norm": 0.3291918933391571, "learning_rate": 0.00010191599115696389, "loss": 1.2626, "num_input_tokens_seen": 6573024, "step": 1337, "train_runtime": 4593.1026, "train_tokens_per_second": 1431.064 }, { "epoch": 0.4921379310344828, "grad_norm": 0.3514147400856018, "learning_rate": 0.00010184229918938837, "loss": 1.2106, "num_input_tokens_seen": 6576208, "step": 1338, "train_runtime": 4595.536, "train_tokens_per_second": 1430.999 }, { "epoch": 0.4925057471264368, "grad_norm": 0.34737372398376465, "learning_rate": 0.00010176860722181282, "loss": 1.3024, "num_input_tokens_seen": 6581408, "step": 1339, "train_runtime": 4598.9773, "train_tokens_per_second": 1431.059 }, { "epoch": 0.4928735632183908, "grad_norm": 0.35335344076156616, "learning_rate": 0.00010169491525423729, "loss": 1.2746, "num_input_tokens_seen": 6585552, "step": 1340, "train_runtime": 4601.8569, "train_tokens_per_second": 1431.064 }, { "epoch": 0.49324137931034484, "grad_norm": 0.36211875081062317, "learning_rate": 0.00010162122328666175, "loss": 1.1778, "num_input_tokens_seen": 6593152, "step": 1341, "train_runtime": 4606.5882, "train_tokens_per_second": 1431.244 }, { "epoch": 0.49360919540229886, "grad_norm": 0.3507351875305176, "learning_rate": 0.00010154753131908623, "loss": 1.2887, "num_input_tokens_seen": 6597936, "step": 1342, "train_runtime": 4609.8619, "train_tokens_per_second": 1431.265 }, { "epoch": 0.4939770114942529, "grad_norm": 0.3622756004333496, "learning_rate": 0.0001014738393515107, "loss": 1.3343, "num_input_tokens_seen": 6602608, "step": 1343, "train_runtime": 4613.0846, "train_tokens_per_second": 1431.278 }, { "epoch": 0.4943448275862069, "grad_norm": 0.3753416836261749, "learning_rate": 0.00010140014738393515, "loss": 1.1923, "num_input_tokens_seen": 6610240, "step": 1344, "train_runtime": 4617.8029, "train_tokens_per_second": 1431.469 }, { "epoch": 0.4947126436781609, "grad_norm": 0.3428008258342743, "learning_rate": 0.00010132645541635961, "loss": 1.2438, "num_input_tokens_seen": 6615056, "step": 1345, "train_runtime": 4621.0526, "train_tokens_per_second": 1431.504 }, { "epoch": 0.49508045977011494, "grad_norm": 0.3488641381263733, "learning_rate": 0.00010125276344878409, "loss": 1.2486, "num_input_tokens_seen": 6619712, "step": 1346, "train_runtime": 4624.2059, "train_tokens_per_second": 1431.535 }, { "epoch": 0.49544827586206897, "grad_norm": 0.38282790780067444, "learning_rate": 0.00010117907148120855, "loss": 1.3044, "num_input_tokens_seen": 6624128, "step": 1347, "train_runtime": 4627.2046, "train_tokens_per_second": 1431.562 }, { "epoch": 0.495816091954023, "grad_norm": 0.3703167736530304, "learning_rate": 0.00010110537951363302, "loss": 1.1798, "num_input_tokens_seen": 6627712, "step": 1348, "train_runtime": 4629.8505, "train_tokens_per_second": 1431.517 }, { "epoch": 0.496183908045977, "grad_norm": 0.3638324737548828, "learning_rate": 0.00010103168754605747, "loss": 1.3771, "num_input_tokens_seen": 6631808, "step": 1349, "train_runtime": 4632.7253, "train_tokens_per_second": 1431.513 }, { "epoch": 0.496551724137931, "grad_norm": 0.36770474910736084, "learning_rate": 0.00010095799557848196, "loss": 1.2583, "num_input_tokens_seen": 6635152, "step": 1350, "train_runtime": 4635.2262, "train_tokens_per_second": 1431.462 }, { "epoch": 0.49691954022988505, "grad_norm": 0.33029529452323914, "learning_rate": 0.00010088430361090641, "loss": 1.1961, "num_input_tokens_seen": 6639088, "step": 1351, "train_runtime": 4640.0733, "train_tokens_per_second": 1430.815 }, { "epoch": 0.49728735632183907, "grad_norm": 0.38102835416793823, "learning_rate": 0.00010081061164333088, "loss": 1.1888, "num_input_tokens_seen": 6643072, "step": 1352, "train_runtime": 4642.8299, "train_tokens_per_second": 1430.824 }, { "epoch": 0.4976551724137931, "grad_norm": 0.4221692681312561, "learning_rate": 0.00010073691967575534, "loss": 1.2982, "num_input_tokens_seen": 6646832, "step": 1353, "train_runtime": 4645.5409, "train_tokens_per_second": 1430.798 }, { "epoch": 0.4980229885057471, "grad_norm": 0.3427620530128479, "learning_rate": 0.00010066322770817982, "loss": 1.2295, "num_input_tokens_seen": 6653344, "step": 1354, "train_runtime": 4649.7806, "train_tokens_per_second": 1430.894 }, { "epoch": 0.49839080459770113, "grad_norm": 0.3641730546951294, "learning_rate": 0.00010058953574060427, "loss": 1.2287, "num_input_tokens_seen": 6658560, "step": 1355, "train_runtime": 4653.2374, "train_tokens_per_second": 1430.952 }, { "epoch": 0.49875862068965515, "grad_norm": 0.27332767844200134, "learning_rate": 0.00010051584377302874, "loss": 0.9757, "num_input_tokens_seen": 6671968, "step": 1356, "train_runtime": 4661.2082, "train_tokens_per_second": 1431.382 }, { "epoch": 0.4991264367816092, "grad_norm": 0.326118141412735, "learning_rate": 0.0001004421518054532, "loss": 1.1437, "num_input_tokens_seen": 6675136, "step": 1357, "train_runtime": 4663.5794, "train_tokens_per_second": 1431.333 }, { "epoch": 0.4994942528735632, "grad_norm": 0.33779895305633545, "learning_rate": 0.00010036845983787768, "loss": 1.155, "num_input_tokens_seen": 6680528, "step": 1358, "train_runtime": 4667.2464, "train_tokens_per_second": 1431.364 }, { "epoch": 0.4998620689655172, "grad_norm": 0.3250412940979004, "learning_rate": 0.00010029476787030215, "loss": 1.0596, "num_input_tokens_seen": 6683824, "step": 1359, "train_runtime": 4669.7042, "train_tokens_per_second": 1431.316 }, { "epoch": 0.5002298850574712, "grad_norm": 0.3165808916091919, "learning_rate": 0.0001002210759027266, "loss": 1.186, "num_input_tokens_seen": 6688752, "step": 1360, "train_runtime": 4673.0562, "train_tokens_per_second": 1431.344 }, { "epoch": 0.5002298850574712, "eval_loss": 1.234187126159668, "eval_runtime": 15.5047, "eval_samples_per_second": 64.497, "eval_steps_per_second": 4.063, "num_input_tokens_seen": 6688752, "step": 1360 }, { "epoch": 0.5005977011494253, "grad_norm": 0.3671439588069916, "learning_rate": 0.00010014738393515106, "loss": 1.1942, "num_input_tokens_seen": 6692464, "step": 1361, "train_runtime": 4691.2291, "train_tokens_per_second": 1426.591 }, { "epoch": 0.5009655172413793, "grad_norm": 0.38166704773902893, "learning_rate": 0.00010007369196757554, "loss": 1.3655, "num_input_tokens_seen": 6697280, "step": 1362, "train_runtime": 4694.5481, "train_tokens_per_second": 1426.608 }, { "epoch": 0.5013333333333333, "grad_norm": 0.43827009201049805, "learning_rate": 0.0001, "loss": 1.2117, "num_input_tokens_seen": 6700880, "step": 1363, "train_runtime": 4697.1177, "train_tokens_per_second": 1426.594 }, { "epoch": 0.5017011494252873, "grad_norm": 0.3412015438079834, "learning_rate": 9.992630803242447e-05, "loss": 1.1908, "num_input_tokens_seen": 6706288, "step": 1364, "train_runtime": 4700.7699, "train_tokens_per_second": 1426.636 }, { "epoch": 0.5020689655172413, "grad_norm": 0.35053691267967224, "learning_rate": 9.985261606484893e-05, "loss": 1.2373, "num_input_tokens_seen": 6710736, "step": 1365, "train_runtime": 4703.7755, "train_tokens_per_second": 1426.67 }, { "epoch": 0.5024367816091954, "grad_norm": 0.33263084292411804, "learning_rate": 9.977892409727341e-05, "loss": 1.3199, "num_input_tokens_seen": 6715456, "step": 1366, "train_runtime": 4707.0267, "train_tokens_per_second": 1426.687 }, { "epoch": 0.5028045977011494, "grad_norm": 0.3621940612792969, "learning_rate": 9.970523212969786e-05, "loss": 1.2034, "num_input_tokens_seen": 6719072, "step": 1367, "train_runtime": 4709.6324, "train_tokens_per_second": 1426.666 }, { "epoch": 0.5031724137931034, "grad_norm": 0.3386554718017578, "learning_rate": 9.963154016212234e-05, "loss": 1.1709, "num_input_tokens_seen": 6722064, "step": 1368, "train_runtime": 4711.9308, "train_tokens_per_second": 1426.605 }, { "epoch": 0.5035402298850574, "grad_norm": 0.3810170292854309, "learning_rate": 9.95578481945468e-05, "loss": 1.3903, "num_input_tokens_seen": 6726720, "step": 1369, "train_runtime": 4715.0819, "train_tokens_per_second": 1426.639 }, { "epoch": 0.5039080459770114, "grad_norm": 0.33149290084838867, "learning_rate": 9.948415622697127e-05, "loss": 1.2115, "num_input_tokens_seen": 6732768, "step": 1370, "train_runtime": 4719.0674, "train_tokens_per_second": 1426.716 }, { "epoch": 0.5042758620689655, "grad_norm": 0.3657072186470032, "learning_rate": 9.941046425939574e-05, "loss": 1.4278, "num_input_tokens_seen": 6736592, "step": 1371, "train_runtime": 4721.7078, "train_tokens_per_second": 1426.728 }, { "epoch": 0.5046436781609196, "grad_norm": 0.3391696512699127, "learning_rate": 9.93367722918202e-05, "loss": 1.1667, "num_input_tokens_seen": 6742800, "step": 1372, "train_runtime": 4725.6766, "train_tokens_per_second": 1426.843 }, { "epoch": 0.5050114942528736, "grad_norm": 0.37643301486968994, "learning_rate": 9.926308032424467e-05, "loss": 1.2547, "num_input_tokens_seen": 6746240, "step": 1373, "train_runtime": 4728.2489, "train_tokens_per_second": 1426.795 }, { "epoch": 0.5053793103448276, "grad_norm": 0.39713141322135925, "learning_rate": 9.918938835666913e-05, "loss": 1.3092, "num_input_tokens_seen": 6750016, "step": 1374, "train_runtime": 4731.0326, "train_tokens_per_second": 1426.753 }, { "epoch": 0.5057471264367817, "grad_norm": 0.3885817527770996, "learning_rate": 9.91156963890936e-05, "loss": 1.035, "num_input_tokens_seen": 6754576, "step": 1375, "train_runtime": 4734.1275, "train_tokens_per_second": 1426.784 }, { "epoch": 0.5061149425287357, "grad_norm": 0.37782612442970276, "learning_rate": 9.904200442151806e-05, "loss": 1.1138, "num_input_tokens_seen": 6761088, "step": 1376, "train_runtime": 4738.3231, "train_tokens_per_second": 1426.895 }, { "epoch": 0.5064827586206897, "grad_norm": 0.37984251976013184, "learning_rate": 9.896831245394253e-05, "loss": 1.2703, "num_input_tokens_seen": 6766368, "step": 1377, "train_runtime": 4741.8911, "train_tokens_per_second": 1426.934 }, { "epoch": 0.5068505747126437, "grad_norm": 0.34817638993263245, "learning_rate": 9.889462048636699e-05, "loss": 1.23, "num_input_tokens_seen": 6773664, "step": 1378, "train_runtime": 4746.5275, "train_tokens_per_second": 1427.078 }, { "epoch": 0.5072183908045977, "grad_norm": 0.3688991963863373, "learning_rate": 9.882092851879146e-05, "loss": 1.3542, "num_input_tokens_seen": 6779040, "step": 1379, "train_runtime": 4750.1649, "train_tokens_per_second": 1427.117 }, { "epoch": 0.5075862068965518, "grad_norm": 0.4449474513530731, "learning_rate": 9.874723655121592e-05, "loss": 1.2917, "num_input_tokens_seen": 6784096, "step": 1380, "train_runtime": 4753.5825, "train_tokens_per_second": 1427.154 }, { "epoch": 0.5079540229885058, "grad_norm": 0.3971673548221588, "learning_rate": 9.867354458364039e-05, "loss": 1.2483, "num_input_tokens_seen": 6788176, "step": 1381, "train_runtime": 4758.3867, "train_tokens_per_second": 1426.571 }, { "epoch": 0.5083218390804598, "grad_norm": 0.32641008496284485, "learning_rate": 9.859985261606486e-05, "loss": 1.1284, "num_input_tokens_seen": 6793824, "step": 1382, "train_runtime": 4762.1058, "train_tokens_per_second": 1426.643 }, { "epoch": 0.5086896551724138, "grad_norm": 0.36454838514328003, "learning_rate": 9.852616064848931e-05, "loss": 1.0799, "num_input_tokens_seen": 6801056, "step": 1383, "train_runtime": 4766.6858, "train_tokens_per_second": 1426.789 }, { "epoch": 0.5090574712643678, "grad_norm": 0.3873193860054016, "learning_rate": 9.845246868091379e-05, "loss": 1.3625, "num_input_tokens_seen": 6805920, "step": 1384, "train_runtime": 4770.0645, "train_tokens_per_second": 1426.798 }, { "epoch": 0.5094252873563219, "grad_norm": 0.3755558431148529, "learning_rate": 9.837877671333824e-05, "loss": 1.2728, "num_input_tokens_seen": 6810080, "step": 1385, "train_runtime": 4773.0058, "train_tokens_per_second": 1426.791 }, { "epoch": 0.5097931034482759, "grad_norm": 0.35195860266685486, "learning_rate": 9.830508474576272e-05, "loss": 1.295, "num_input_tokens_seen": 6816080, "step": 1386, "train_runtime": 4776.9224, "train_tokens_per_second": 1426.877 }, { "epoch": 0.5101609195402299, "grad_norm": 0.3220309913158417, "learning_rate": 9.823139277818719e-05, "loss": 1.2098, "num_input_tokens_seen": 6821344, "step": 1387, "train_runtime": 4780.425, "train_tokens_per_second": 1426.933 }, { "epoch": 0.5105287356321839, "grad_norm": 0.3427046835422516, "learning_rate": 9.815770081061165e-05, "loss": 1.2658, "num_input_tokens_seen": 6828784, "step": 1388, "train_runtime": 4785.1989, "train_tokens_per_second": 1427.064 }, { "epoch": 0.510896551724138, "grad_norm": 0.4271998703479767, "learning_rate": 9.808400884303612e-05, "loss": 1.2027, "num_input_tokens_seen": 6833344, "step": 1389, "train_runtime": 4788.2983, "train_tokens_per_second": 1427.092 }, { "epoch": 0.511264367816092, "grad_norm": 0.3685409724712372, "learning_rate": 9.801031687546058e-05, "loss": 1.1689, "num_input_tokens_seen": 6838928, "step": 1390, "train_runtime": 4792.0227, "train_tokens_per_second": 1427.149 }, { "epoch": 0.511632183908046, "grad_norm": 0.3594321608543396, "learning_rate": 9.793662490788505e-05, "loss": 1.2483, "num_input_tokens_seen": 6843216, "step": 1391, "train_runtime": 4794.9385, "train_tokens_per_second": 1427.175 }, { "epoch": 0.512, "grad_norm": 0.34025707840919495, "learning_rate": 9.786293294030951e-05, "loss": 1.1582, "num_input_tokens_seen": 6849104, "step": 1392, "train_runtime": 4798.818, "train_tokens_per_second": 1427.248 }, { "epoch": 0.512367816091954, "grad_norm": 0.3693334758281708, "learning_rate": 9.778924097273398e-05, "loss": 1.3104, "num_input_tokens_seen": 6853184, "step": 1393, "train_runtime": 4801.7021, "train_tokens_per_second": 1427.241 }, { "epoch": 0.512735632183908, "grad_norm": 0.31527236104011536, "learning_rate": 9.771554900515844e-05, "loss": 1.3171, "num_input_tokens_seen": 6860464, "step": 1394, "train_runtime": 4806.2938, "train_tokens_per_second": 1427.392 }, { "epoch": 0.5131034482758621, "grad_norm": 0.32845792174339294, "learning_rate": 9.76418570375829e-05, "loss": 1.1775, "num_input_tokens_seen": 6864464, "step": 1395, "train_runtime": 4809.1549, "train_tokens_per_second": 1427.374 }, { "epoch": 0.5134712643678161, "grad_norm": 0.33912116289138794, "learning_rate": 9.756816507000738e-05, "loss": 1.1522, "num_input_tokens_seen": 6867952, "step": 1396, "train_runtime": 4811.7325, "train_tokens_per_second": 1427.335 }, { "epoch": 0.5138390804597701, "grad_norm": 0.3654550015926361, "learning_rate": 9.749447310243184e-05, "loss": 1.1388, "num_input_tokens_seen": 6872032, "step": 1397, "train_runtime": 4814.6619, "train_tokens_per_second": 1427.314 }, { "epoch": 0.5142068965517241, "grad_norm": 0.34746071696281433, "learning_rate": 9.742078113485631e-05, "loss": 1.2127, "num_input_tokens_seen": 6877360, "step": 1398, "train_runtime": 4818.1965, "train_tokens_per_second": 1427.372 }, { "epoch": 0.5145747126436782, "grad_norm": 0.34591183066368103, "learning_rate": 9.734708916728077e-05, "loss": 1.2691, "num_input_tokens_seen": 6881008, "step": 1399, "train_runtime": 4820.8572, "train_tokens_per_second": 1427.341 }, { "epoch": 0.5149425287356322, "grad_norm": 0.36108094453811646, "learning_rate": 9.727339719970524e-05, "loss": 1.2256, "num_input_tokens_seen": 6885152, "step": 1400, "train_runtime": 4823.6595, "train_tokens_per_second": 1427.371 }, { "epoch": 0.5153103448275862, "grad_norm": 0.3229909837245941, "learning_rate": 9.71997052321297e-05, "loss": 1.0822, "num_input_tokens_seen": 6888768, "step": 1401, "train_runtime": 4826.2824, "train_tokens_per_second": 1427.345 }, { "epoch": 0.5156781609195402, "grad_norm": 0.3228570222854614, "learning_rate": 9.712601326455417e-05, "loss": 1.2148, "num_input_tokens_seen": 6898720, "step": 1402, "train_runtime": 4832.3362, "train_tokens_per_second": 1427.616 }, { "epoch": 0.5160459770114942, "grad_norm": 0.32842516899108887, "learning_rate": 9.705232129697864e-05, "loss": 1.1983, "num_input_tokens_seen": 6906928, "step": 1403, "train_runtime": 4837.4113, "train_tokens_per_second": 1427.815 }, { "epoch": 0.5164137931034483, "grad_norm": 0.32673364877700806, "learning_rate": 9.69786293294031e-05, "loss": 1.1338, "num_input_tokens_seen": 6913296, "step": 1404, "train_runtime": 4841.5113, "train_tokens_per_second": 1427.921 }, { "epoch": 0.5167816091954023, "grad_norm": 0.33890852332115173, "learning_rate": 9.690493736182757e-05, "loss": 1.1692, "num_input_tokens_seen": 6917824, "step": 1405, "train_runtime": 4844.6083, "train_tokens_per_second": 1427.943 }, { "epoch": 0.5171494252873563, "grad_norm": 0.34418174624443054, "learning_rate": 9.683124539425203e-05, "loss": 1.2507, "num_input_tokens_seen": 6921520, "step": 1406, "train_runtime": 4847.2199, "train_tokens_per_second": 1427.936 }, { "epoch": 0.5175172413793103, "grad_norm": 0.33793869614601135, "learning_rate": 9.67575534266765e-05, "loss": 1.1249, "num_input_tokens_seen": 6926432, "step": 1407, "train_runtime": 4850.5251, "train_tokens_per_second": 1427.976 }, { "epoch": 0.5178850574712643, "grad_norm": 0.36337676644325256, "learning_rate": 9.668386145910096e-05, "loss": 1.3168, "num_input_tokens_seen": 6931856, "step": 1408, "train_runtime": 4854.0802, "train_tokens_per_second": 1428.047 }, { "epoch": 0.5182528735632184, "grad_norm": 0.34077227115631104, "learning_rate": 9.661016949152543e-05, "loss": 1.2219, "num_input_tokens_seen": 6939136, "step": 1409, "train_runtime": 4858.7154, "train_tokens_per_second": 1428.183 }, { "epoch": 0.5186206896551724, "grad_norm": 0.35585498809814453, "learning_rate": 9.653647752394989e-05, "loss": 1.2912, "num_input_tokens_seen": 6942992, "step": 1410, "train_runtime": 4861.4351, "train_tokens_per_second": 1428.177 }, { "epoch": 0.5189885057471264, "grad_norm": 0.3456760048866272, "learning_rate": 9.646278555637436e-05, "loss": 1.1418, "num_input_tokens_seen": 6947824, "step": 1411, "train_runtime": 4866.8124, "train_tokens_per_second": 1427.592 }, { "epoch": 0.5193563218390804, "grad_norm": 0.3090837001800537, "learning_rate": 9.638909358879884e-05, "loss": 1.1177, "num_input_tokens_seen": 6954096, "step": 1412, "train_runtime": 4870.843, "train_tokens_per_second": 1427.699 }, { "epoch": 0.5197241379310344, "grad_norm": 0.3940297067165375, "learning_rate": 9.631540162122329e-05, "loss": 1.167, "num_input_tokens_seen": 6959008, "step": 1413, "train_runtime": 4874.0793, "train_tokens_per_second": 1427.758 }, { "epoch": 0.5200919540229885, "grad_norm": 0.35202744603157043, "learning_rate": 9.624170965364776e-05, "loss": 1.2153, "num_input_tokens_seen": 6965280, "step": 1414, "train_runtime": 4878.043, "train_tokens_per_second": 1427.884 }, { "epoch": 0.5204597701149425, "grad_norm": 0.3534502387046814, "learning_rate": 9.616801768607222e-05, "loss": 1.2572, "num_input_tokens_seen": 6968352, "step": 1415, "train_runtime": 4880.3989, "train_tokens_per_second": 1427.824 }, { "epoch": 0.5208275862068965, "grad_norm": 0.36782732605934143, "learning_rate": 9.60943257184967e-05, "loss": 1.1387, "num_input_tokens_seen": 6972256, "step": 1416, "train_runtime": 4883.1046, "train_tokens_per_second": 1427.833 }, { "epoch": 0.5211954022988505, "grad_norm": 0.38094982504844666, "learning_rate": 9.602063375092115e-05, "loss": 1.1373, "num_input_tokens_seen": 6979472, "step": 1417, "train_runtime": 4887.6965, "train_tokens_per_second": 1427.968 }, { "epoch": 0.5215632183908046, "grad_norm": 0.3493528962135315, "learning_rate": 9.594694178334562e-05, "loss": 1.153, "num_input_tokens_seen": 6985504, "step": 1418, "train_runtime": 4891.6238, "train_tokens_per_second": 1428.054 }, { "epoch": 0.5219310344827586, "grad_norm": 0.3825155794620514, "learning_rate": 9.587324981577009e-05, "loss": 1.1144, "num_input_tokens_seen": 6990112, "step": 1419, "train_runtime": 4894.7302, "train_tokens_per_second": 1428.089 }, { "epoch": 0.5222988505747126, "grad_norm": 0.3287540376186371, "learning_rate": 9.579955784819455e-05, "loss": 1.2909, "num_input_tokens_seen": 6997648, "step": 1420, "train_runtime": 4899.508, "train_tokens_per_second": 1428.235 }, { "epoch": 0.5226666666666666, "grad_norm": 0.3626883327960968, "learning_rate": 9.572586588061902e-05, "loss": 1.2793, "num_input_tokens_seen": 7001648, "step": 1421, "train_runtime": 4902.3196, "train_tokens_per_second": 1428.232 }, { "epoch": 0.5230344827586207, "grad_norm": 0.4033142626285553, "learning_rate": 9.565217391304348e-05, "loss": 1.1882, "num_input_tokens_seen": 7005488, "step": 1422, "train_runtime": 4904.9947, "train_tokens_per_second": 1428.236 }, { "epoch": 0.5234022988505748, "grad_norm": 0.3712122142314911, "learning_rate": 9.557848194546795e-05, "loss": 1.2233, "num_input_tokens_seen": 7008720, "step": 1423, "train_runtime": 4907.3812, "train_tokens_per_second": 1428.2 }, { "epoch": 0.5237701149425288, "grad_norm": 0.3646475672721863, "learning_rate": 9.550478997789241e-05, "loss": 1.2466, "num_input_tokens_seen": 7013504, "step": 1424, "train_runtime": 4910.6601, "train_tokens_per_second": 1428.22 }, { "epoch": 0.5241379310344828, "grad_norm": 0.385348379611969, "learning_rate": 9.543109801031688e-05, "loss": 1.2902, "num_input_tokens_seen": 7017872, "step": 1425, "train_runtime": 4913.6948, "train_tokens_per_second": 1428.227 }, { "epoch": 0.5245057471264368, "grad_norm": 0.3624279201030731, "learning_rate": 9.535740604274134e-05, "loss": 1.2451, "num_input_tokens_seen": 7024192, "step": 1426, "train_runtime": 4917.7704, "train_tokens_per_second": 1428.329 }, { "epoch": 0.5248735632183908, "grad_norm": 0.3650817573070526, "learning_rate": 9.528371407516581e-05, "loss": 1.2346, "num_input_tokens_seen": 7027712, "step": 1427, "train_runtime": 4920.22, "train_tokens_per_second": 1428.333 }, { "epoch": 0.5252413793103449, "grad_norm": 0.38149765133857727, "learning_rate": 9.521002210759029e-05, "loss": 1.2122, "num_input_tokens_seen": 7031200, "step": 1428, "train_runtime": 4922.7569, "train_tokens_per_second": 1428.305 }, { "epoch": 0.5256091954022989, "grad_norm": 0.3471353352069855, "learning_rate": 9.513633014001474e-05, "loss": 1.1466, "num_input_tokens_seen": 7034560, "step": 1429, "train_runtime": 4925.2256, "train_tokens_per_second": 1428.272 }, { "epoch": 0.5259770114942529, "grad_norm": 0.3440505564212799, "learning_rate": 9.506263817243922e-05, "loss": 1.1731, "num_input_tokens_seen": 7039472, "step": 1430, "train_runtime": 4928.5523, "train_tokens_per_second": 1428.304 }, { "epoch": 0.5263448275862069, "grad_norm": 0.3367503881454468, "learning_rate": 9.498894620486367e-05, "loss": 1.1563, "num_input_tokens_seen": 7043056, "step": 1431, "train_runtime": 4931.1903, "train_tokens_per_second": 1428.267 }, { "epoch": 0.526712643678161, "grad_norm": 0.37291184067726135, "learning_rate": 9.491525423728815e-05, "loss": 1.2209, "num_input_tokens_seen": 7047216, "step": 1432, "train_runtime": 4934.1741, "train_tokens_per_second": 1428.246 }, { "epoch": 0.527080459770115, "grad_norm": 0.33535143733024597, "learning_rate": 9.48415622697126e-05, "loss": 1.2184, "num_input_tokens_seen": 7053808, "step": 1433, "train_runtime": 4938.4373, "train_tokens_per_second": 1428.348 }, { "epoch": 0.527448275862069, "grad_norm": 0.3484176993370056, "learning_rate": 9.476787030213707e-05, "loss": 1.2478, "num_input_tokens_seen": 7058144, "step": 1434, "train_runtime": 4941.4719, "train_tokens_per_second": 1428.348 }, { "epoch": 0.527816091954023, "grad_norm": 0.36846980452537537, "learning_rate": 9.469417833456154e-05, "loss": 1.1772, "num_input_tokens_seen": 7063456, "step": 1435, "train_runtime": 4944.96, "train_tokens_per_second": 1428.415 }, { "epoch": 0.528183908045977, "grad_norm": 0.3910638689994812, "learning_rate": 9.4620486366986e-05, "loss": 1.2322, "num_input_tokens_seen": 7069552, "step": 1436, "train_runtime": 4948.8915, "train_tokens_per_second": 1428.512 }, { "epoch": 0.5285517241379311, "grad_norm": 0.41100719571113586, "learning_rate": 9.454679439941047e-05, "loss": 1.4005, "num_input_tokens_seen": 7074240, "step": 1437, "train_runtime": 4952.0394, "train_tokens_per_second": 1428.551 }, { "epoch": 0.5289195402298851, "grad_norm": 0.3543812334537506, "learning_rate": 9.447310243183493e-05, "loss": 1.174, "num_input_tokens_seen": 7078064, "step": 1438, "train_runtime": 4954.7094, "train_tokens_per_second": 1428.553 }, { "epoch": 0.5292873563218391, "grad_norm": 0.3710232675075531, "learning_rate": 9.43994104642594e-05, "loss": 1.3199, "num_input_tokens_seen": 7083088, "step": 1439, "train_runtime": 4958.0439, "train_tokens_per_second": 1428.605 }, { "epoch": 0.5296551724137931, "grad_norm": 0.34313949942588806, "learning_rate": 9.432571849668386e-05, "loss": 1.153, "num_input_tokens_seen": 7086640, "step": 1440, "train_runtime": 4960.6411, "train_tokens_per_second": 1428.573 }, { "epoch": 0.5300229885057471, "grad_norm": 0.3154895007610321, "learning_rate": 9.425202652910833e-05, "loss": 1.1942, "num_input_tokens_seen": 7093472, "step": 1441, "train_runtime": 4967.1111, "train_tokens_per_second": 1428.088 }, { "epoch": 0.5303908045977012, "grad_norm": 0.33226457238197327, "learning_rate": 9.41783345615328e-05, "loss": 1.4049, "num_input_tokens_seen": 7098416, "step": 1442, "train_runtime": 4970.4813, "train_tokens_per_second": 1428.114 }, { "epoch": 0.5307586206896552, "grad_norm": 0.35245200991630554, "learning_rate": 9.410464259395726e-05, "loss": 1.4884, "num_input_tokens_seen": 7106176, "step": 1443, "train_runtime": 4975.4591, "train_tokens_per_second": 1428.245 }, { "epoch": 0.5311264367816092, "grad_norm": 0.3660103380680084, "learning_rate": 9.403095062638174e-05, "loss": 1.0861, "num_input_tokens_seen": 7109744, "step": 1444, "train_runtime": 4978.0762, "train_tokens_per_second": 1428.211 }, { "epoch": 0.5314942528735632, "grad_norm": 0.3780525326728821, "learning_rate": 9.395725865880619e-05, "loss": 1.2801, "num_input_tokens_seen": 7114240, "step": 1445, "train_runtime": 4981.273, "train_tokens_per_second": 1428.197 }, { "epoch": 0.5318620689655172, "grad_norm": 0.3413727879524231, "learning_rate": 9.388356669123067e-05, "loss": 1.1914, "num_input_tokens_seen": 7118448, "step": 1446, "train_runtime": 4984.2092, "train_tokens_per_second": 1428.2 }, { "epoch": 0.5322298850574713, "grad_norm": 0.34549179673194885, "learning_rate": 9.380987472365512e-05, "loss": 1.3134, "num_input_tokens_seen": 7124640, "step": 1447, "train_runtime": 4988.2442, "train_tokens_per_second": 1428.286 }, { "epoch": 0.5325977011494253, "grad_norm": 0.35517168045043945, "learning_rate": 9.37361827560796e-05, "loss": 1.0905, "num_input_tokens_seen": 7130592, "step": 1448, "train_runtime": 4992.1535, "train_tokens_per_second": 1428.36 }, { "epoch": 0.5329655172413793, "grad_norm": 0.33144551515579224, "learning_rate": 9.366249078850405e-05, "loss": 1.1364, "num_input_tokens_seen": 7135360, "step": 1449, "train_runtime": 4995.3349, "train_tokens_per_second": 1428.405 }, { "epoch": 0.5333333333333333, "grad_norm": 0.332100510597229, "learning_rate": 9.358879882092853e-05, "loss": 1.2122, "num_input_tokens_seen": 7141248, "step": 1450, "train_runtime": 4999.1342, "train_tokens_per_second": 1428.497 }, { "epoch": 0.5337011494252873, "grad_norm": 0.3594553768634796, "learning_rate": 9.351510685335299e-05, "loss": 1.2517, "num_input_tokens_seen": 7146752, "step": 1451, "train_runtime": 5002.7979, "train_tokens_per_second": 1428.551 }, { "epoch": 0.5340689655172414, "grad_norm": 0.3523523509502411, "learning_rate": 9.344141488577746e-05, "loss": 1.2063, "num_input_tokens_seen": 7150448, "step": 1452, "train_runtime": 5005.4119, "train_tokens_per_second": 1428.543 }, { "epoch": 0.5344367816091954, "grad_norm": 0.33943164348602295, "learning_rate": 9.336772291820192e-05, "loss": 1.1565, "num_input_tokens_seen": 7154672, "step": 1453, "train_runtime": 5008.3272, "train_tokens_per_second": 1428.555 }, { "epoch": 0.5348045977011494, "grad_norm": 0.35627835988998413, "learning_rate": 9.329403095062638e-05, "loss": 1.2225, "num_input_tokens_seen": 7158416, "step": 1454, "train_runtime": 5011.0472, "train_tokens_per_second": 1428.527 }, { "epoch": 0.5351724137931034, "grad_norm": 0.35724586248397827, "learning_rate": 9.322033898305085e-05, "loss": 1.3647, "num_input_tokens_seen": 7162480, "step": 1455, "train_runtime": 5013.913, "train_tokens_per_second": 1428.521 }, { "epoch": 0.5355402298850575, "grad_norm": 0.33584490418434143, "learning_rate": 9.314664701547531e-05, "loss": 1.3424, "num_input_tokens_seen": 7166864, "step": 1456, "train_runtime": 5016.8585, "train_tokens_per_second": 1428.556 }, { "epoch": 0.5359080459770115, "grad_norm": 0.3489488959312439, "learning_rate": 9.307295504789978e-05, "loss": 1.3379, "num_input_tokens_seen": 7171152, "step": 1457, "train_runtime": 5019.7897, "train_tokens_per_second": 1428.576 }, { "epoch": 0.5362758620689655, "grad_norm": 0.3750684857368469, "learning_rate": 9.299926308032424e-05, "loss": 1.3421, "num_input_tokens_seen": 7175072, "step": 1458, "train_runtime": 5022.5173, "train_tokens_per_second": 1428.581 }, { "epoch": 0.5366436781609195, "grad_norm": 0.3445059061050415, "learning_rate": 9.292557111274871e-05, "loss": 1.143, "num_input_tokens_seen": 7178800, "step": 1459, "train_runtime": 5025.1948, "train_tokens_per_second": 1428.562 }, { "epoch": 0.5370114942528735, "grad_norm": 0.339100182056427, "learning_rate": 9.285187914517319e-05, "loss": 1.2948, "num_input_tokens_seen": 7184144, "step": 1460, "train_runtime": 5028.7712, "train_tokens_per_second": 1428.608 }, { "epoch": 0.5373793103448276, "grad_norm": 0.33574753999710083, "learning_rate": 9.277818717759764e-05, "loss": 1.1967, "num_input_tokens_seen": 7188400, "step": 1461, "train_runtime": 5031.7253, "train_tokens_per_second": 1428.615 }, { "epoch": 0.5377471264367816, "grad_norm": 0.3918282389640808, "learning_rate": 9.270449521002212e-05, "loss": 1.2405, "num_input_tokens_seen": 7192928, "step": 1462, "train_runtime": 5034.8113, "train_tokens_per_second": 1428.639 }, { "epoch": 0.5381149425287356, "grad_norm": 0.3533143103122711, "learning_rate": 9.263080324244657e-05, "loss": 1.3731, "num_input_tokens_seen": 7197952, "step": 1463, "train_runtime": 5038.203, "train_tokens_per_second": 1428.674 }, { "epoch": 0.5384827586206896, "grad_norm": 0.3659995496273041, "learning_rate": 9.255711127487105e-05, "loss": 1.2669, "num_input_tokens_seen": 7203536, "step": 1464, "train_runtime": 5041.9099, "train_tokens_per_second": 1428.732 }, { "epoch": 0.5388505747126436, "grad_norm": 0.3859991133213043, "learning_rate": 9.248341930729551e-05, "loss": 1.2924, "num_input_tokens_seen": 7210736, "step": 1465, "train_runtime": 5046.4629, "train_tokens_per_second": 1428.869 }, { "epoch": 0.5392183908045977, "grad_norm": 0.33815860748291016, "learning_rate": 9.240972733971998e-05, "loss": 1.1381, "num_input_tokens_seen": 7214736, "step": 1466, "train_runtime": 5049.3082, "train_tokens_per_second": 1428.856 }, { "epoch": 0.5395862068965517, "grad_norm": 0.37804386019706726, "learning_rate": 9.233603537214444e-05, "loss": 1.2564, "num_input_tokens_seen": 7221104, "step": 1467, "train_runtime": 5053.4827, "train_tokens_per_second": 1428.936 }, { "epoch": 0.5399540229885057, "grad_norm": 0.3668687641620636, "learning_rate": 9.22623434045689e-05, "loss": 1.1892, "num_input_tokens_seen": 7225408, "step": 1468, "train_runtime": 5056.4195, "train_tokens_per_second": 1428.957 }, { "epoch": 0.5403218390804597, "grad_norm": 0.3522321581840515, "learning_rate": 9.218865143699337e-05, "loss": 1.116, "num_input_tokens_seen": 7231248, "step": 1469, "train_runtime": 5060.2624, "train_tokens_per_second": 1429.026 }, { "epoch": 0.5406896551724137, "grad_norm": 0.34292274713516235, "learning_rate": 9.211495946941784e-05, "loss": 1.1913, "num_input_tokens_seen": 7235232, "step": 1470, "train_runtime": 5063.0051, "train_tokens_per_second": 1429.039 }, { "epoch": 0.5410574712643678, "grad_norm": 0.39232829213142395, "learning_rate": 9.20412675018423e-05, "loss": 1.1431, "num_input_tokens_seen": 7239360, "step": 1471, "train_runtime": 5067.8903, "train_tokens_per_second": 1428.476 }, { "epoch": 0.5414252873563219, "grad_norm": 0.3699335753917694, "learning_rate": 9.196757553426677e-05, "loss": 1.2261, "num_input_tokens_seen": 7244096, "step": 1472, "train_runtime": 5071.1896, "train_tokens_per_second": 1428.481 }, { "epoch": 0.5417931034482759, "grad_norm": 0.34099844098091125, "learning_rate": 9.189388356669123e-05, "loss": 1.2193, "num_input_tokens_seen": 7249120, "step": 1473, "train_runtime": 5074.5549, "train_tokens_per_second": 1428.523 }, { "epoch": 0.5421609195402299, "grad_norm": 0.39217302203178406, "learning_rate": 9.18201915991157e-05, "loss": 1.3514, "num_input_tokens_seen": 7252608, "step": 1474, "train_runtime": 5077.0821, "train_tokens_per_second": 1428.499 }, { "epoch": 0.542528735632184, "grad_norm": 0.3623465895652771, "learning_rate": 9.174649963154016e-05, "loss": 1.1799, "num_input_tokens_seen": 7256240, "step": 1475, "train_runtime": 5079.669, "train_tokens_per_second": 1428.487 }, { "epoch": 0.542896551724138, "grad_norm": 0.36307892203330994, "learning_rate": 9.167280766396464e-05, "loss": 1.131, "num_input_tokens_seen": 7260016, "step": 1476, "train_runtime": 5082.324, "train_tokens_per_second": 1428.483 }, { "epoch": 0.543264367816092, "grad_norm": 0.3880380094051361, "learning_rate": 9.159911569638909e-05, "loss": 1.2634, "num_input_tokens_seen": 7263824, "step": 1477, "train_runtime": 5085.0841, "train_tokens_per_second": 1428.457 }, { "epoch": 0.543632183908046, "grad_norm": 0.38017377257347107, "learning_rate": 9.152542372881357e-05, "loss": 1.2838, "num_input_tokens_seen": 7271696, "step": 1478, "train_runtime": 5090.0658, "train_tokens_per_second": 1428.605 }, { "epoch": 0.544, "grad_norm": 0.37988346815109253, "learning_rate": 9.145173176123802e-05, "loss": 1.3246, "num_input_tokens_seen": 7277808, "step": 1479, "train_runtime": 5094.0697, "train_tokens_per_second": 1428.682 }, { "epoch": 0.5443678160919541, "grad_norm": 0.40572696924209595, "learning_rate": 9.13780397936625e-05, "loss": 1.1419, "num_input_tokens_seen": 7284496, "step": 1480, "train_runtime": 5098.4092, "train_tokens_per_second": 1428.778 }, { "epoch": 0.5447356321839081, "grad_norm": 0.3993561863899231, "learning_rate": 9.130434782608696e-05, "loss": 1.3171, "num_input_tokens_seen": 7288880, "step": 1481, "train_runtime": 5101.3945, "train_tokens_per_second": 1428.801 }, { "epoch": 0.5451034482758621, "grad_norm": 0.3429904878139496, "learning_rate": 9.123065585851143e-05, "loss": 1.1614, "num_input_tokens_seen": 7294032, "step": 1482, "train_runtime": 5104.8663, "train_tokens_per_second": 1428.839 }, { "epoch": 0.5454712643678161, "grad_norm": 0.3459399938583374, "learning_rate": 9.115696389093589e-05, "loss": 1.1332, "num_input_tokens_seen": 7298528, "step": 1483, "train_runtime": 5107.9103, "train_tokens_per_second": 1428.868 }, { "epoch": 0.5458390804597701, "grad_norm": 0.33769845962524414, "learning_rate": 9.108327192336036e-05, "loss": 1.0937, "num_input_tokens_seen": 7302544, "step": 1484, "train_runtime": 5110.6401, "train_tokens_per_second": 1428.89 }, { "epoch": 0.5462068965517242, "grad_norm": 0.37438470125198364, "learning_rate": 9.100957995578482e-05, "loss": 1.3188, "num_input_tokens_seen": 7309600, "step": 1485, "train_runtime": 5115.2012, "train_tokens_per_second": 1428.996 }, { "epoch": 0.5465747126436782, "grad_norm": 0.3531028628349304, "learning_rate": 9.093588798820929e-05, "loss": 1.3727, "num_input_tokens_seen": 7312896, "step": 1486, "train_runtime": 5117.6116, "train_tokens_per_second": 1428.967 }, { "epoch": 0.5469425287356322, "grad_norm": 0.35417547821998596, "learning_rate": 9.086219602063376e-05, "loss": 1.2232, "num_input_tokens_seen": 7316544, "step": 1487, "train_runtime": 5120.2516, "train_tokens_per_second": 1428.942 }, { "epoch": 0.5473103448275862, "grad_norm": 0.3925384283065796, "learning_rate": 9.078850405305822e-05, "loss": 1.3288, "num_input_tokens_seen": 7320544, "step": 1488, "train_runtime": 5122.9592, "train_tokens_per_second": 1428.968 }, { "epoch": 0.5476781609195402, "grad_norm": 0.3428603410720825, "learning_rate": 9.07148120854827e-05, "loss": 1.1466, "num_input_tokens_seen": 7325136, "step": 1489, "train_runtime": 5126.0314, "train_tokens_per_second": 1429.007 }, { "epoch": 0.5480459770114943, "grad_norm": 0.34437793493270874, "learning_rate": 9.064112011790716e-05, "loss": 1.1909, "num_input_tokens_seen": 7330576, "step": 1490, "train_runtime": 5129.7072, "train_tokens_per_second": 1429.044 }, { "epoch": 0.5484137931034483, "grad_norm": 0.35966598987579346, "learning_rate": 9.056742815033162e-05, "loss": 1.2855, "num_input_tokens_seen": 7334560, "step": 1491, "train_runtime": 5132.51, "train_tokens_per_second": 1429.04 }, { "epoch": 0.5487816091954023, "grad_norm": 0.3296428620815277, "learning_rate": 9.049373618275609e-05, "loss": 1.1789, "num_input_tokens_seen": 7338880, "step": 1492, "train_runtime": 5135.5379, "train_tokens_per_second": 1429.038 }, { "epoch": 0.5491494252873563, "grad_norm": 0.33403250575065613, "learning_rate": 9.042004421518055e-05, "loss": 1.0913, "num_input_tokens_seen": 7342592, "step": 1493, "train_runtime": 5138.23, "train_tokens_per_second": 1429.012 }, { "epoch": 0.5495172413793104, "grad_norm": 0.3356791138648987, "learning_rate": 9.034635224760502e-05, "loss": 1.1621, "num_input_tokens_seen": 7346608, "step": 1494, "train_runtime": 5141.0444, "train_tokens_per_second": 1429.011 }, { "epoch": 0.5498850574712644, "grad_norm": 0.36152005195617676, "learning_rate": 9.027266028002948e-05, "loss": 1.1491, "num_input_tokens_seen": 7351232, "step": 1495, "train_runtime": 5144.1615, "train_tokens_per_second": 1429.044 }, { "epoch": 0.5502528735632184, "grad_norm": 0.3728543221950531, "learning_rate": 9.019896831245395e-05, "loss": 1.3075, "num_input_tokens_seen": 7355008, "step": 1496, "train_runtime": 5146.8104, "train_tokens_per_second": 1429.042 }, { "epoch": 0.5506206896551724, "grad_norm": 0.3417280614376068, "learning_rate": 9.012527634487841e-05, "loss": 1.317, "num_input_tokens_seen": 7359856, "step": 1497, "train_runtime": 5150.1016, "train_tokens_per_second": 1429.07 }, { "epoch": 0.5509885057471264, "grad_norm": 0.38008061051368713, "learning_rate": 9.005158437730288e-05, "loss": 1.2398, "num_input_tokens_seen": 7363424, "step": 1498, "train_runtime": 5152.6932, "train_tokens_per_second": 1429.044 }, { "epoch": 0.5513563218390805, "grad_norm": 0.3422344923019409, "learning_rate": 8.997789240972734e-05, "loss": 1.2273, "num_input_tokens_seen": 7368832, "step": 1499, "train_runtime": 5156.2332, "train_tokens_per_second": 1429.111 }, { "epoch": 0.5517241379310345, "grad_norm": 0.3224169909954071, "learning_rate": 8.990420044215181e-05, "loss": 1.2853, "num_input_tokens_seen": 7372432, "step": 1500, "train_runtime": 5158.8867, "train_tokens_per_second": 1429.074 }, { "epoch": 0.5520919540229885, "grad_norm": 0.35514792799949646, "learning_rate": 8.983050847457629e-05, "loss": 1.0594, "num_input_tokens_seen": 7376400, "step": 1501, "train_runtime": 5163.7448, "train_tokens_per_second": 1428.498 }, { "epoch": 0.5524597701149425, "grad_norm": 0.3709370493888855, "learning_rate": 8.975681650700074e-05, "loss": 1.2589, "num_input_tokens_seen": 7380432, "step": 1502, "train_runtime": 5166.5773, "train_tokens_per_second": 1428.495 }, { "epoch": 0.5528275862068965, "grad_norm": 0.3260691165924072, "learning_rate": 8.968312453942522e-05, "loss": 1.1489, "num_input_tokens_seen": 7384992, "step": 1503, "train_runtime": 5169.6657, "train_tokens_per_second": 1428.524 }, { "epoch": 0.5531954022988506, "grad_norm": 0.3615417778491974, "learning_rate": 8.960943257184967e-05, "loss": 1.1495, "num_input_tokens_seen": 7389872, "step": 1504, "train_runtime": 5172.9174, "train_tokens_per_second": 1428.569 }, { "epoch": 0.5535632183908046, "grad_norm": 0.3600541353225708, "learning_rate": 8.953574060427414e-05, "loss": 1.2627, "num_input_tokens_seen": 7394800, "step": 1505, "train_runtime": 5176.2298, "train_tokens_per_second": 1428.607 }, { "epoch": 0.5539310344827586, "grad_norm": 0.32656240463256836, "learning_rate": 8.946204863669861e-05, "loss": 1.2052, "num_input_tokens_seen": 7398848, "step": 1506, "train_runtime": 5179.0722, "train_tokens_per_second": 1428.605 }, { "epoch": 0.5542988505747126, "grad_norm": 0.35126733779907227, "learning_rate": 8.938835666912307e-05, "loss": 1.2179, "num_input_tokens_seen": 7406288, "step": 1507, "train_runtime": 5183.7464, "train_tokens_per_second": 1428.752 }, { "epoch": 0.5546666666666666, "grad_norm": 0.3632078170776367, "learning_rate": 8.931466470154754e-05, "loss": 1.2913, "num_input_tokens_seen": 7411152, "step": 1508, "train_runtime": 5187.0165, "train_tokens_per_second": 1428.789 }, { "epoch": 0.5550344827586207, "grad_norm": 0.3276430666446686, "learning_rate": 8.9240972733972e-05, "loss": 1.1918, "num_input_tokens_seen": 7414992, "step": 1509, "train_runtime": 5189.763, "train_tokens_per_second": 1428.773 }, { "epoch": 0.5554022988505747, "grad_norm": 0.40329283475875854, "learning_rate": 8.916728076639647e-05, "loss": 1.2579, "num_input_tokens_seen": 7419104, "step": 1510, "train_runtime": 5192.6238, "train_tokens_per_second": 1428.777 }, { "epoch": 0.5557701149425287, "grad_norm": 0.3633747696876526, "learning_rate": 8.909358879882093e-05, "loss": 1.2176, "num_input_tokens_seen": 7423280, "step": 1511, "train_runtime": 5195.4816, "train_tokens_per_second": 1428.795 }, { "epoch": 0.5561379310344827, "grad_norm": 0.37626203894615173, "learning_rate": 8.90198968312454e-05, "loss": 1.1892, "num_input_tokens_seen": 7429328, "step": 1512, "train_runtime": 5199.4065, "train_tokens_per_second": 1428.88 }, { "epoch": 0.5565057471264367, "grad_norm": 0.3440423309803009, "learning_rate": 8.894620486366986e-05, "loss": 1.2773, "num_input_tokens_seen": 7435152, "step": 1513, "train_runtime": 5203.1178, "train_tokens_per_second": 1428.98 }, { "epoch": 0.5568735632183908, "grad_norm": 0.3534166216850281, "learning_rate": 8.887251289609433e-05, "loss": 1.2264, "num_input_tokens_seen": 7439568, "step": 1514, "train_runtime": 5206.2377, "train_tokens_per_second": 1428.972 }, { "epoch": 0.5572413793103448, "grad_norm": 0.34926795959472656, "learning_rate": 8.87988209285188e-05, "loss": 1.2183, "num_input_tokens_seen": 7443664, "step": 1515, "train_runtime": 5209.0466, "train_tokens_per_second": 1428.988 }, { "epoch": 0.5576091954022988, "grad_norm": 0.35664013028144836, "learning_rate": 8.872512896094326e-05, "loss": 1.2729, "num_input_tokens_seen": 7447312, "step": 1516, "train_runtime": 5211.6163, "train_tokens_per_second": 1428.983 }, { "epoch": 0.5579770114942528, "grad_norm": 0.31531840562820435, "learning_rate": 8.865143699336774e-05, "loss": 1.122, "num_input_tokens_seen": 7453424, "step": 1517, "train_runtime": 5215.5911, "train_tokens_per_second": 1429.066 }, { "epoch": 0.5583448275862068, "grad_norm": 0.35419803857803345, "learning_rate": 8.857774502579219e-05, "loss": 1.2165, "num_input_tokens_seen": 7459232, "step": 1518, "train_runtime": 5219.4465, "train_tokens_per_second": 1429.123 }, { "epoch": 0.5587126436781609, "grad_norm": 0.3428138196468353, "learning_rate": 8.850405305821667e-05, "loss": 1.0832, "num_input_tokens_seen": 7464944, "step": 1519, "train_runtime": 5223.1947, "train_tokens_per_second": 1429.191 }, { "epoch": 0.5590804597701149, "grad_norm": 0.389974981546402, "learning_rate": 8.843036109064112e-05, "loss": 1.2682, "num_input_tokens_seen": 7468640, "step": 1520, "train_runtime": 5225.8292, "train_tokens_per_second": 1429.178 }, { "epoch": 0.5594482758620689, "grad_norm": 0.3580048382282257, "learning_rate": 8.83566691230656e-05, "loss": 1.2654, "num_input_tokens_seen": 7473520, "step": 1521, "train_runtime": 5229.0927, "train_tokens_per_second": 1429.219 }, { "epoch": 0.559816091954023, "grad_norm": 0.34142670035362244, "learning_rate": 8.828297715549006e-05, "loss": 1.1834, "num_input_tokens_seen": 7478080, "step": 1522, "train_runtime": 5232.2702, "train_tokens_per_second": 1429.223 }, { "epoch": 0.5601839080459771, "grad_norm": 0.35978788137435913, "learning_rate": 8.820928518791453e-05, "loss": 1.2212, "num_input_tokens_seen": 7482064, "step": 1523, "train_runtime": 5235.0182, "train_tokens_per_second": 1429.234 }, { "epoch": 0.5605517241379311, "grad_norm": 0.3566664457321167, "learning_rate": 8.813559322033899e-05, "loss": 1.2121, "num_input_tokens_seen": 7487008, "step": 1524, "train_runtime": 5238.4107, "train_tokens_per_second": 1429.252 }, { "epoch": 0.5609195402298851, "grad_norm": 0.37518709897994995, "learning_rate": 8.806190125276345e-05, "loss": 1.322, "num_input_tokens_seen": 7494880, "step": 1525, "train_runtime": 5243.3558, "train_tokens_per_second": 1429.405 }, { "epoch": 0.5612873563218391, "grad_norm": 0.3378138542175293, "learning_rate": 8.798820928518792e-05, "loss": 1.3046, "num_input_tokens_seen": 7498992, "step": 1526, "train_runtime": 5246.1702, "train_tokens_per_second": 1429.422 }, { "epoch": 0.5616551724137931, "grad_norm": 0.33979520201683044, "learning_rate": 8.791451731761238e-05, "loss": 1.2412, "num_input_tokens_seen": 7504512, "step": 1527, "train_runtime": 5249.7796, "train_tokens_per_second": 1429.491 }, { "epoch": 0.5620229885057472, "grad_norm": 0.3645789325237274, "learning_rate": 8.784082535003685e-05, "loss": 1.1553, "num_input_tokens_seen": 7510080, "step": 1528, "train_runtime": 5253.3499, "train_tokens_per_second": 1429.579 }, { "epoch": 0.5623908045977012, "grad_norm": 0.3475429117679596, "learning_rate": 8.776713338246131e-05, "loss": 1.2072, "num_input_tokens_seen": 7515136, "step": 1529, "train_runtime": 5256.7019, "train_tokens_per_second": 1429.629 }, { "epoch": 0.5627586206896552, "grad_norm": 0.39109325408935547, "learning_rate": 8.769344141488578e-05, "loss": 1.2434, "num_input_tokens_seen": 7519008, "step": 1530, "train_runtime": 5259.5112, "train_tokens_per_second": 1429.602 }, { "epoch": 0.5631264367816092, "grad_norm": 0.3514973223209381, "learning_rate": 8.761974944731026e-05, "loss": 1.0944, "num_input_tokens_seen": 7525248, "step": 1531, "train_runtime": 5265.5413, "train_tokens_per_second": 1429.15 }, { "epoch": 0.5634942528735633, "grad_norm": 0.36799776554107666, "learning_rate": 8.754605747973471e-05, "loss": 1.3268, "num_input_tokens_seen": 7529232, "step": 1532, "train_runtime": 5268.3203, "train_tokens_per_second": 1429.152 }, { "epoch": 0.5638620689655173, "grad_norm": 0.38167804479599, "learning_rate": 8.747236551215919e-05, "loss": 1.1402, "num_input_tokens_seen": 7533152, "step": 1533, "train_runtime": 5271.0938, "train_tokens_per_second": 1429.144 }, { "epoch": 0.5642298850574713, "grad_norm": 0.36129435896873474, "learning_rate": 8.739867354458364e-05, "loss": 1.157, "num_input_tokens_seen": 7537488, "step": 1534, "train_runtime": 5274.1097, "train_tokens_per_second": 1429.149 }, { "epoch": 0.5645977011494253, "grad_norm": 0.31032782793045044, "learning_rate": 8.732498157700812e-05, "loss": 1.2479, "num_input_tokens_seen": 7542896, "step": 1535, "train_runtime": 5277.6584, "train_tokens_per_second": 1429.213 }, { "epoch": 0.5649655172413793, "grad_norm": 0.33601248264312744, "learning_rate": 8.725128960943257e-05, "loss": 1.1178, "num_input_tokens_seen": 7548576, "step": 1536, "train_runtime": 5281.4201, "train_tokens_per_second": 1429.27 }, { "epoch": 0.5653333333333334, "grad_norm": 0.32082489132881165, "learning_rate": 8.717759764185705e-05, "loss": 1.2136, "num_input_tokens_seen": 7553744, "step": 1537, "train_runtime": 5284.7894, "train_tokens_per_second": 1429.337 }, { "epoch": 0.5657011494252874, "grad_norm": 0.3529646694660187, "learning_rate": 8.710390567428151e-05, "loss": 1.1445, "num_input_tokens_seen": 7559152, "step": 1538, "train_runtime": 5288.4881, "train_tokens_per_second": 1429.36 }, { "epoch": 0.5660689655172414, "grad_norm": 0.3776971995830536, "learning_rate": 8.703021370670598e-05, "loss": 1.1139, "num_input_tokens_seen": 7563968, "step": 1539, "train_runtime": 5291.7811, "train_tokens_per_second": 1429.38 }, { "epoch": 0.5664367816091954, "grad_norm": 0.3826366662979126, "learning_rate": 8.695652173913044e-05, "loss": 1.2649, "num_input_tokens_seen": 7568208, "step": 1540, "train_runtime": 5294.7419, "train_tokens_per_second": 1429.382 }, { "epoch": 0.5668045977011494, "grad_norm": 0.3375912308692932, "learning_rate": 8.68828297715549e-05, "loss": 1.1855, "num_input_tokens_seen": 7573648, "step": 1541, "train_runtime": 5298.334, "train_tokens_per_second": 1429.44 }, { "epoch": 0.5671724137931035, "grad_norm": 0.3581699728965759, "learning_rate": 8.680913780397937e-05, "loss": 1.2801, "num_input_tokens_seen": 7578288, "step": 1542, "train_runtime": 5301.5126, "train_tokens_per_second": 1429.458 }, { "epoch": 0.5675402298850575, "grad_norm": 0.3506247103214264, "learning_rate": 8.673544583640384e-05, "loss": 1.0998, "num_input_tokens_seen": 7581680, "step": 1543, "train_runtime": 5303.9404, "train_tokens_per_second": 1429.443 }, { "epoch": 0.5679080459770115, "grad_norm": 0.3562047779560089, "learning_rate": 8.66617538688283e-05, "loss": 1.249, "num_input_tokens_seen": 7586400, "step": 1544, "train_runtime": 5307.0955, "train_tokens_per_second": 1429.482 }, { "epoch": 0.5682758620689655, "grad_norm": 0.4296574294567108, "learning_rate": 8.658806190125276e-05, "loss": 1.3815, "num_input_tokens_seen": 7592752, "step": 1545, "train_runtime": 5311.2583, "train_tokens_per_second": 1429.558 }, { "epoch": 0.5686436781609195, "grad_norm": 0.3460198640823364, "learning_rate": 8.651436993367723e-05, "loss": 1.3356, "num_input_tokens_seen": 7597296, "step": 1546, "train_runtime": 5314.312, "train_tokens_per_second": 1429.592 }, { "epoch": 0.5690114942528736, "grad_norm": 0.37243911623954773, "learning_rate": 8.644067796610171e-05, "loss": 1.2701, "num_input_tokens_seen": 7600352, "step": 1547, "train_runtime": 5316.6655, "train_tokens_per_second": 1429.534 }, { "epoch": 0.5693793103448276, "grad_norm": 0.37210336327552795, "learning_rate": 8.636698599852616e-05, "loss": 1.2796, "num_input_tokens_seen": 7604144, "step": 1548, "train_runtime": 5319.2615, "train_tokens_per_second": 1429.549 }, { "epoch": 0.5697471264367816, "grad_norm": 0.35311219096183777, "learning_rate": 8.629329403095064e-05, "loss": 1.2223, "num_input_tokens_seen": 7607872, "step": 1549, "train_runtime": 5321.9327, "train_tokens_per_second": 1429.532 }, { "epoch": 0.5701149425287356, "grad_norm": 0.33246049284935, "learning_rate": 8.621960206337509e-05, "loss": 1.1023, "num_input_tokens_seen": 7611424, "step": 1550, "train_runtime": 5324.5287, "train_tokens_per_second": 1429.502 }, { "epoch": 0.5704827586206896, "grad_norm": 0.3722507357597351, "learning_rate": 8.614591009579957e-05, "loss": 1.2594, "num_input_tokens_seen": 7617152, "step": 1551, "train_runtime": 5328.3123, "train_tokens_per_second": 1429.562 }, { "epoch": 0.5708505747126437, "grad_norm": 0.3631453216075897, "learning_rate": 8.607221812822402e-05, "loss": 1.212, "num_input_tokens_seen": 7620800, "step": 1552, "train_runtime": 5330.9807, "train_tokens_per_second": 1429.531 }, { "epoch": 0.5712183908045977, "grad_norm": 0.35323989391326904, "learning_rate": 8.59985261606485e-05, "loss": 1.2393, "num_input_tokens_seen": 7625632, "step": 1553, "train_runtime": 5334.2467, "train_tokens_per_second": 1429.561 }, { "epoch": 0.5715862068965517, "grad_norm": 0.36066100001335144, "learning_rate": 8.592483419307296e-05, "loss": 1.2232, "num_input_tokens_seen": 7632032, "step": 1554, "train_runtime": 5338.3866, "train_tokens_per_second": 1429.651 }, { "epoch": 0.5719540229885057, "grad_norm": 0.3540048599243164, "learning_rate": 8.585114222549743e-05, "loss": 1.2513, "num_input_tokens_seen": 7637328, "step": 1555, "train_runtime": 5341.8947, "train_tokens_per_second": 1429.704 }, { "epoch": 0.5723218390804597, "grad_norm": 0.36024242639541626, "learning_rate": 8.577745025792189e-05, "loss": 1.239, "num_input_tokens_seen": 7642720, "step": 1556, "train_runtime": 5345.4446, "train_tokens_per_second": 1429.763 }, { "epoch": 0.5726896551724138, "grad_norm": 0.34701937437057495, "learning_rate": 8.570375829034636e-05, "loss": 1.2198, "num_input_tokens_seen": 7648496, "step": 1557, "train_runtime": 5349.2536, "train_tokens_per_second": 1429.825 }, { "epoch": 0.5730574712643678, "grad_norm": 0.33805257081985474, "learning_rate": 8.563006632277082e-05, "loss": 1.3458, "num_input_tokens_seen": 7653152, "step": 1558, "train_runtime": 5352.4503, "train_tokens_per_second": 1429.841 }, { "epoch": 0.5734252873563218, "grad_norm": 0.3685722053050995, "learning_rate": 8.555637435519529e-05, "loss": 1.2973, "num_input_tokens_seen": 7664784, "step": 1559, "train_runtime": 5359.5333, "train_tokens_per_second": 1430.122 }, { "epoch": 0.5737931034482758, "grad_norm": 0.34516969323158264, "learning_rate": 8.548268238761975e-05, "loss": 1.3319, "num_input_tokens_seen": 7673408, "step": 1560, "train_runtime": 5364.7883, "train_tokens_per_second": 1430.328 }, { "epoch": 0.5741609195402299, "grad_norm": 0.3682008385658264, "learning_rate": 8.540899042004422e-05, "loss": 1.3695, "num_input_tokens_seen": 7678816, "step": 1561, "train_runtime": 5370.4033, "train_tokens_per_second": 1429.84 }, { "epoch": 0.5745287356321839, "grad_norm": 0.351102739572525, "learning_rate": 8.533529845246868e-05, "loss": 1.0719, "num_input_tokens_seen": 7683680, "step": 1562, "train_runtime": 5373.6442, "train_tokens_per_second": 1429.883 }, { "epoch": 0.5748965517241379, "grad_norm": 0.3792226016521454, "learning_rate": 8.526160648489316e-05, "loss": 1.1213, "num_input_tokens_seen": 7688160, "step": 1563, "train_runtime": 5376.6922, "train_tokens_per_second": 1429.905 }, { "epoch": 0.5752643678160919, "grad_norm": 0.37403708696365356, "learning_rate": 8.518791451731761e-05, "loss": 1.3069, "num_input_tokens_seen": 7693200, "step": 1564, "train_runtime": 5380.154, "train_tokens_per_second": 1429.922 }, { "epoch": 0.5756321839080459, "grad_norm": 0.3389625549316406, "learning_rate": 8.511422254974209e-05, "loss": 1.1747, "num_input_tokens_seen": 7697888, "step": 1565, "train_runtime": 5383.286, "train_tokens_per_second": 1429.961 }, { "epoch": 0.576, "grad_norm": 0.38302186131477356, "learning_rate": 8.504053058216654e-05, "loss": 1.2867, "num_input_tokens_seen": 7702640, "step": 1566, "train_runtime": 5386.4768, "train_tokens_per_second": 1429.996 }, { "epoch": 0.576367816091954, "grad_norm": 0.3931235671043396, "learning_rate": 8.496683861459102e-05, "loss": 1.3135, "num_input_tokens_seen": 7706704, "step": 1567, "train_runtime": 5389.3049, "train_tokens_per_second": 1430.0 }, { "epoch": 0.576735632183908, "grad_norm": 0.3440674841403961, "learning_rate": 8.489314664701547e-05, "loss": 1.2389, "num_input_tokens_seen": 7711328, "step": 1568, "train_runtime": 5392.4639, "train_tokens_per_second": 1430.019 }, { "epoch": 0.577103448275862, "grad_norm": 0.36354872584342957, "learning_rate": 8.481945467943995e-05, "loss": 1.1611, "num_input_tokens_seen": 7715776, "step": 1569, "train_runtime": 5395.5077, "train_tokens_per_second": 1430.037 }, { "epoch": 0.577471264367816, "grad_norm": 0.34597697854042053, "learning_rate": 8.474576271186441e-05, "loss": 1.097, "num_input_tokens_seen": 7720128, "step": 1570, "train_runtime": 5398.5457, "train_tokens_per_second": 1430.038 }, { "epoch": 0.5778390804597701, "grad_norm": 0.34855154156684875, "learning_rate": 8.467207074428888e-05, "loss": 1.117, "num_input_tokens_seen": 7724576, "step": 1571, "train_runtime": 5401.702, "train_tokens_per_second": 1430.026 }, { "epoch": 0.5782068965517242, "grad_norm": 0.37674474716186523, "learning_rate": 8.459837877671334e-05, "loss": 1.2255, "num_input_tokens_seen": 7731168, "step": 1572, "train_runtime": 5406.021, "train_tokens_per_second": 1430.103 }, { "epoch": 0.5785747126436782, "grad_norm": 0.3757065534591675, "learning_rate": 8.452468680913781e-05, "loss": 1.1987, "num_input_tokens_seen": 7738704, "step": 1573, "train_runtime": 5410.7509, "train_tokens_per_second": 1430.246 }, { "epoch": 0.5789425287356322, "grad_norm": 0.35863828659057617, "learning_rate": 8.445099484156227e-05, "loss": 1.1842, "num_input_tokens_seen": 7744400, "step": 1574, "train_runtime": 5414.5252, "train_tokens_per_second": 1430.301 }, { "epoch": 0.5793103448275863, "grad_norm": 0.3289389908313751, "learning_rate": 8.437730287398674e-05, "loss": 1.3038, "num_input_tokens_seen": 7753232, "step": 1575, "train_runtime": 5420.0126, "train_tokens_per_second": 1430.482 }, { "epoch": 0.5796781609195403, "grad_norm": 0.31837430596351624, "learning_rate": 8.43036109064112e-05, "loss": 1.4199, "num_input_tokens_seen": 7764304, "step": 1576, "train_runtime": 5426.7195, "train_tokens_per_second": 1430.755 }, { "epoch": 0.5800459770114943, "grad_norm": 0.34056252241134644, "learning_rate": 8.422991893883567e-05, "loss": 0.9954, "num_input_tokens_seen": 7767440, "step": 1577, "train_runtime": 5429.1391, "train_tokens_per_second": 1430.695 }, { "epoch": 0.5804137931034483, "grad_norm": 0.3496263921260834, "learning_rate": 8.415622697126013e-05, "loss": 1.1382, "num_input_tokens_seen": 7772704, "step": 1578, "train_runtime": 5432.6302, "train_tokens_per_second": 1430.744 }, { "epoch": 0.5807816091954023, "grad_norm": 0.36682674288749695, "learning_rate": 8.408253500368461e-05, "loss": 1.3116, "num_input_tokens_seen": 7778304, "step": 1579, "train_runtime": 5436.3262, "train_tokens_per_second": 1430.802 }, { "epoch": 0.5811494252873564, "grad_norm": 0.3761027455329895, "learning_rate": 8.400884303610906e-05, "loss": 1.0612, "num_input_tokens_seen": 7782928, "step": 1580, "train_runtime": 5439.4989, "train_tokens_per_second": 1430.817 }, { "epoch": 0.5815172413793104, "grad_norm": 0.3057478964328766, "learning_rate": 8.393515106853354e-05, "loss": 1.0748, "num_input_tokens_seen": 7792784, "step": 1581, "train_runtime": 5445.7031, "train_tokens_per_second": 1430.997 }, { "epoch": 0.5818850574712644, "grad_norm": 0.3722552955150604, "learning_rate": 8.386145910095799e-05, "loss": 1.264, "num_input_tokens_seen": 7798480, "step": 1582, "train_runtime": 5449.4447, "train_tokens_per_second": 1431.06 }, { "epoch": 0.5822528735632184, "grad_norm": 0.38350504636764526, "learning_rate": 8.378776713338247e-05, "loss": 1.2435, "num_input_tokens_seen": 7806656, "step": 1583, "train_runtime": 5454.449, "train_tokens_per_second": 1431.246 }, { "epoch": 0.5826206896551724, "grad_norm": 0.3597047030925751, "learning_rate": 8.371407516580692e-05, "loss": 1.2914, "num_input_tokens_seen": 7811504, "step": 1584, "train_runtime": 5457.7825, "train_tokens_per_second": 1431.26 }, { "epoch": 0.5829885057471265, "grad_norm": 0.35457006096839905, "learning_rate": 8.36403831982314e-05, "loss": 1.2324, "num_input_tokens_seen": 7818128, "step": 1585, "train_runtime": 5462.1282, "train_tokens_per_second": 1431.334 }, { "epoch": 0.5833563218390805, "grad_norm": 0.4037728011608124, "learning_rate": 8.356669123065586e-05, "loss": 1.2973, "num_input_tokens_seen": 7821376, "step": 1586, "train_runtime": 5464.5292, "train_tokens_per_second": 1431.299 }, { "epoch": 0.5837241379310345, "grad_norm": 0.3242194950580597, "learning_rate": 8.349299926308033e-05, "loss": 1.1664, "num_input_tokens_seen": 7825424, "step": 1587, "train_runtime": 5467.3301, "train_tokens_per_second": 1431.306 }, { "epoch": 0.5840919540229885, "grad_norm": 0.3614206314086914, "learning_rate": 8.341930729550479e-05, "loss": 1.0722, "num_input_tokens_seen": 7833552, "step": 1588, "train_runtime": 5472.4124, "train_tokens_per_second": 1431.462 }, { "epoch": 0.5844597701149425, "grad_norm": 0.36593663692474365, "learning_rate": 8.334561532792926e-05, "loss": 1.3346, "num_input_tokens_seen": 7837776, "step": 1589, "train_runtime": 5475.3155, "train_tokens_per_second": 1431.475 }, { "epoch": 0.5848275862068966, "grad_norm": 0.32114365696907043, "learning_rate": 8.327192336035372e-05, "loss": 1.2286, "num_input_tokens_seen": 7843584, "step": 1590, "train_runtime": 5479.1522, "train_tokens_per_second": 1431.532 }, { "epoch": 0.5851954022988506, "grad_norm": 0.35319972038269043, "learning_rate": 8.319823139277819e-05, "loss": 1.2805, "num_input_tokens_seen": 7847504, "step": 1591, "train_runtime": 5483.9903, "train_tokens_per_second": 1430.984 }, { "epoch": 0.5855632183908046, "grad_norm": 0.37851041555404663, "learning_rate": 8.312453942520265e-05, "loss": 1.3903, "num_input_tokens_seen": 7852048, "step": 1592, "train_runtime": 5487.0549, "train_tokens_per_second": 1431.013 }, { "epoch": 0.5859310344827586, "grad_norm": 0.361674964427948, "learning_rate": 8.305084745762712e-05, "loss": 1.2077, "num_input_tokens_seen": 7856528, "step": 1593, "train_runtime": 5490.1351, "train_tokens_per_second": 1431.026 }, { "epoch": 0.5862988505747126, "grad_norm": 0.3516424298286438, "learning_rate": 8.297715549005158e-05, "loss": 1.2541, "num_input_tokens_seen": 7859712, "step": 1594, "train_runtime": 5492.6153, "train_tokens_per_second": 1430.96 }, { "epoch": 0.5866666666666667, "grad_norm": 0.36594077944755554, "learning_rate": 8.290346352247606e-05, "loss": 1.2502, "num_input_tokens_seen": 7864448, "step": 1595, "train_runtime": 5495.8083, "train_tokens_per_second": 1430.99 }, { "epoch": 0.5870344827586207, "grad_norm": 0.3563876152038574, "learning_rate": 8.282977155490051e-05, "loss": 1.3529, "num_input_tokens_seen": 7869936, "step": 1596, "train_runtime": 5499.3828, "train_tokens_per_second": 1431.058 }, { "epoch": 0.5874022988505747, "grad_norm": 0.3402424156665802, "learning_rate": 8.275607958732499e-05, "loss": 1.1151, "num_input_tokens_seen": 7876272, "step": 1597, "train_runtime": 5503.5174, "train_tokens_per_second": 1431.134 }, { "epoch": 0.5877701149425287, "grad_norm": 0.37097758054733276, "learning_rate": 8.268238761974944e-05, "loss": 1.1777, "num_input_tokens_seen": 7882080, "step": 1598, "train_runtime": 5507.3417, "train_tokens_per_second": 1431.195 }, { "epoch": 0.5881379310344828, "grad_norm": 0.35348713397979736, "learning_rate": 8.260869565217392e-05, "loss": 1.2938, "num_input_tokens_seen": 7886048, "step": 1599, "train_runtime": 5510.1555, "train_tokens_per_second": 1431.184 }, { "epoch": 0.5885057471264368, "grad_norm": 0.36142581701278687, "learning_rate": 8.253500368459838e-05, "loss": 1.2518, "num_input_tokens_seen": 7892912, "step": 1600, "train_runtime": 5514.5341, "train_tokens_per_second": 1431.293 }, { "epoch": 0.5888735632183908, "grad_norm": 0.34320446848869324, "learning_rate": 8.246131171702285e-05, "loss": 1.3004, "num_input_tokens_seen": 7896464, "step": 1601, "train_runtime": 5517.0436, "train_tokens_per_second": 1431.285 }, { "epoch": 0.5892413793103448, "grad_norm": 0.35260260105133057, "learning_rate": 8.238761974944731e-05, "loss": 1.1938, "num_input_tokens_seen": 7900624, "step": 1602, "train_runtime": 5519.912, "train_tokens_per_second": 1431.295 }, { "epoch": 0.5896091954022988, "grad_norm": 0.37798693776130676, "learning_rate": 8.231392778187178e-05, "loss": 1.4233, "num_input_tokens_seen": 7906464, "step": 1603, "train_runtime": 5523.7664, "train_tokens_per_second": 1431.354 }, { "epoch": 0.5899770114942529, "grad_norm": 0.3189416825771332, "learning_rate": 8.224023581429624e-05, "loss": 1.1915, "num_input_tokens_seen": 7909920, "step": 1604, "train_runtime": 5526.3058, "train_tokens_per_second": 1431.321 }, { "epoch": 0.5903448275862069, "grad_norm": 0.3486345112323761, "learning_rate": 8.216654384672071e-05, "loss": 1.1839, "num_input_tokens_seen": 7914416, "step": 1605, "train_runtime": 5529.4389, "train_tokens_per_second": 1431.324 }, { "epoch": 0.5907126436781609, "grad_norm": 0.36112046241760254, "learning_rate": 8.209285187914517e-05, "loss": 1.1562, "num_input_tokens_seen": 7920560, "step": 1606, "train_runtime": 5533.4603, "train_tokens_per_second": 1431.394 }, { "epoch": 0.5910804597701149, "grad_norm": 0.3525996208190918, "learning_rate": 8.201915991156964e-05, "loss": 1.3363, "num_input_tokens_seen": 7924608, "step": 1607, "train_runtime": 5536.2677, "train_tokens_per_second": 1431.399 }, { "epoch": 0.5914482758620689, "grad_norm": 0.35944250226020813, "learning_rate": 8.19454679439941e-05, "loss": 1.3444, "num_input_tokens_seen": 7929232, "step": 1608, "train_runtime": 5539.4608, "train_tokens_per_second": 1431.409 }, { "epoch": 0.591816091954023, "grad_norm": 0.3544812798500061, "learning_rate": 8.187177597641857e-05, "loss": 1.1643, "num_input_tokens_seen": 7933472, "step": 1609, "train_runtime": 5542.5033, "train_tokens_per_second": 1431.388 }, { "epoch": 0.592183908045977, "grad_norm": 0.3513464033603668, "learning_rate": 8.179808400884305e-05, "loss": 1.0798, "num_input_tokens_seen": 7938256, "step": 1610, "train_runtime": 5545.6623, "train_tokens_per_second": 1431.435 }, { "epoch": 0.592551724137931, "grad_norm": 0.3400366008281708, "learning_rate": 8.172439204126751e-05, "loss": 1.0744, "num_input_tokens_seen": 7944656, "step": 1611, "train_runtime": 5549.8162, "train_tokens_per_second": 1431.517 }, { "epoch": 0.592919540229885, "grad_norm": 0.3588066101074219, "learning_rate": 8.165070007369198e-05, "loss": 1.1398, "num_input_tokens_seen": 7950960, "step": 1612, "train_runtime": 5553.9969, "train_tokens_per_second": 1431.574 }, { "epoch": 0.593287356321839, "grad_norm": 0.3882015347480774, "learning_rate": 8.157700810611644e-05, "loss": 1.3625, "num_input_tokens_seen": 7956848, "step": 1613, "train_runtime": 5557.8548, "train_tokens_per_second": 1431.64 }, { "epoch": 0.5936551724137931, "grad_norm": 0.3832549750804901, "learning_rate": 8.15033161385409e-05, "loss": 1.2174, "num_input_tokens_seen": 7962336, "step": 1614, "train_runtime": 5561.5085, "train_tokens_per_second": 1431.686 }, { "epoch": 0.5940229885057471, "grad_norm": 0.34523752331733704, "learning_rate": 8.142962417096537e-05, "loss": 1.1365, "num_input_tokens_seen": 7966576, "step": 1615, "train_runtime": 5564.5522, "train_tokens_per_second": 1431.665 }, { "epoch": 0.5943908045977011, "grad_norm": 0.3599925637245178, "learning_rate": 8.135593220338983e-05, "loss": 1.2142, "num_input_tokens_seen": 7971392, "step": 1616, "train_runtime": 5567.8557, "train_tokens_per_second": 1431.681 }, { "epoch": 0.5947586206896551, "grad_norm": 0.3558957874774933, "learning_rate": 8.12822402358143e-05, "loss": 1.3562, "num_input_tokens_seen": 7976240, "step": 1617, "train_runtime": 5571.2462, "train_tokens_per_second": 1431.68 }, { "epoch": 0.5951264367816091, "grad_norm": 0.39159995317459106, "learning_rate": 8.120854826823876e-05, "loss": 1.2635, "num_input_tokens_seen": 7981296, "step": 1618, "train_runtime": 5574.6939, "train_tokens_per_second": 1431.701 }, { "epoch": 0.5954942528735632, "grad_norm": 0.38039717078208923, "learning_rate": 8.113485630066323e-05, "loss": 1.1417, "num_input_tokens_seen": 7984496, "step": 1619, "train_runtime": 5577.1275, "train_tokens_per_second": 1431.65 }, { "epoch": 0.5958620689655172, "grad_norm": 0.35429835319519043, "learning_rate": 8.106116433308771e-05, "loss": 1.27, "num_input_tokens_seen": 7988720, "step": 1620, "train_runtime": 5580.0287, "train_tokens_per_second": 1431.663 }, { "epoch": 0.5962298850574712, "grad_norm": 0.3473983108997345, "learning_rate": 8.098747236551216e-05, "loss": 1.1802, "num_input_tokens_seen": 7994096, "step": 1621, "train_runtime": 5585.7775, "train_tokens_per_second": 1431.152 }, { "epoch": 0.5965977011494253, "grad_norm": 0.35925814509391785, "learning_rate": 8.091378039793664e-05, "loss": 1.164, "num_input_tokens_seen": 7997472, "step": 1622, "train_runtime": 5588.2055, "train_tokens_per_second": 1431.134 }, { "epoch": 0.5969655172413794, "grad_norm": 0.3355098068714142, "learning_rate": 8.084008843036109e-05, "loss": 1.2693, "num_input_tokens_seen": 8004656, "step": 1623, "train_runtime": 5592.8504, "train_tokens_per_second": 1431.23 }, { "epoch": 0.5973333333333334, "grad_norm": 0.3596530854701996, "learning_rate": 8.076639646278557e-05, "loss": 1.4136, "num_input_tokens_seen": 8010496, "step": 1624, "train_runtime": 5596.6575, "train_tokens_per_second": 1431.3 }, { "epoch": 0.5977011494252874, "grad_norm": 0.35510095953941345, "learning_rate": 8.069270449521003e-05, "loss": 1.2209, "num_input_tokens_seen": 8015312, "step": 1625, "train_runtime": 5599.9028, "train_tokens_per_second": 1431.331 }, { "epoch": 0.5980689655172414, "grad_norm": 0.33866769075393677, "learning_rate": 8.06190125276345e-05, "loss": 1.1828, "num_input_tokens_seen": 8019280, "step": 1626, "train_runtime": 5602.6376, "train_tokens_per_second": 1431.34 }, { "epoch": 0.5984367816091954, "grad_norm": 0.40151500701904297, "learning_rate": 8.054532056005896e-05, "loss": 1.1759, "num_input_tokens_seen": 8024464, "step": 1627, "train_runtime": 5606.0198, "train_tokens_per_second": 1431.401 }, { "epoch": 0.5988045977011495, "grad_norm": 0.3653234541416168, "learning_rate": 8.047162859248343e-05, "loss": 1.1834, "num_input_tokens_seen": 8028960, "step": 1628, "train_runtime": 5609.0426, "train_tokens_per_second": 1431.431 }, { "epoch": 0.5991724137931035, "grad_norm": 0.34185248613357544, "learning_rate": 8.039793662490789e-05, "loss": 1.1726, "num_input_tokens_seen": 8033584, "step": 1629, "train_runtime": 5612.2245, "train_tokens_per_second": 1431.444 }, { "epoch": 0.5995402298850575, "grad_norm": 0.4381316304206848, "learning_rate": 8.032424465733236e-05, "loss": 1.3913, "num_input_tokens_seen": 8038368, "step": 1630, "train_runtime": 5615.5364, "train_tokens_per_second": 1431.452 }, { "epoch": 0.5999080459770115, "grad_norm": 0.33758002519607544, "learning_rate": 8.025055268975682e-05, "loss": 1.292, "num_input_tokens_seen": 8042352, "step": 1631, "train_runtime": 5618.3713, "train_tokens_per_second": 1431.438 }, { "epoch": 0.6002758620689655, "grad_norm": 1.249489426612854, "learning_rate": 8.017686072218129e-05, "loss": 1.2454, "num_input_tokens_seen": 8049712, "step": 1632, "train_runtime": 5623.0957, "train_tokens_per_second": 1431.545 }, { "epoch": 0.6002758620689655, "eval_loss": 1.2253098487854004, "eval_runtime": 15.5364, "eval_samples_per_second": 64.365, "eval_steps_per_second": 4.055, "num_input_tokens_seen": 8049712, "step": 1632 }, { "epoch": 0.6006436781609196, "grad_norm": 0.34538760781288147, "learning_rate": 8.010316875460575e-05, "loss": 1.1245, "num_input_tokens_seen": 8055312, "step": 1633, "train_runtime": 5642.3456, "train_tokens_per_second": 1427.653 }, { "epoch": 0.6010114942528736, "grad_norm": 0.3712161183357239, "learning_rate": 8.002947678703023e-05, "loss": 1.2901, "num_input_tokens_seen": 8060576, "step": 1634, "train_runtime": 5645.8862, "train_tokens_per_second": 1427.69 }, { "epoch": 0.6013793103448276, "grad_norm": 0.38065770268440247, "learning_rate": 7.995578481945468e-05, "loss": 1.339, "num_input_tokens_seen": 8069712, "step": 1635, "train_runtime": 5651.4722, "train_tokens_per_second": 1427.896 }, { "epoch": 0.6017471264367816, "grad_norm": 0.3502139151096344, "learning_rate": 7.988209285187916e-05, "loss": 1.3599, "num_input_tokens_seen": 8076080, "step": 1636, "train_runtime": 5655.5522, "train_tokens_per_second": 1427.991 }, { "epoch": 0.6021149425287357, "grad_norm": 0.37293684482574463, "learning_rate": 7.980840088430361e-05, "loss": 1.2456, "num_input_tokens_seen": 8081248, "step": 1637, "train_runtime": 5658.9642, "train_tokens_per_second": 1428.044 }, { "epoch": 0.6024827586206897, "grad_norm": 0.3323860764503479, "learning_rate": 7.973470891672809e-05, "loss": 1.2696, "num_input_tokens_seen": 8100240, "step": 1638, "train_runtime": 5670.0685, "train_tokens_per_second": 1428.597 }, { "epoch": 0.6028505747126437, "grad_norm": 0.37038612365722656, "learning_rate": 7.966101694915254e-05, "loss": 1.34, "num_input_tokens_seen": 8104528, "step": 1639, "train_runtime": 5673.0309, "train_tokens_per_second": 1428.606 }, { "epoch": 0.6032183908045977, "grad_norm": 0.41014528274536133, "learning_rate": 7.958732498157702e-05, "loss": 1.1197, "num_input_tokens_seen": 8109264, "step": 1640, "train_runtime": 5676.2848, "train_tokens_per_second": 1428.622 }, { "epoch": 0.6035862068965517, "grad_norm": 0.36411958932876587, "learning_rate": 7.951363301400148e-05, "loss": 1.1882, "num_input_tokens_seen": 8113520, "step": 1641, "train_runtime": 5679.2976, "train_tokens_per_second": 1428.613 }, { "epoch": 0.6039540229885058, "grad_norm": 0.3903307616710663, "learning_rate": 7.943994104642595e-05, "loss": 1.4, "num_input_tokens_seen": 8117360, "step": 1642, "train_runtime": 5682.0151, "train_tokens_per_second": 1428.606 }, { "epoch": 0.6043218390804598, "grad_norm": 0.34962713718414307, "learning_rate": 7.936624907885041e-05, "loss": 1.1911, "num_input_tokens_seen": 8121984, "step": 1643, "train_runtime": 5685.0339, "train_tokens_per_second": 1428.661 }, { "epoch": 0.6046896551724138, "grad_norm": 0.3581300675868988, "learning_rate": 7.929255711127488e-05, "loss": 1.343, "num_input_tokens_seen": 8127648, "step": 1644, "train_runtime": 5688.7355, "train_tokens_per_second": 1428.727 }, { "epoch": 0.6050574712643678, "grad_norm": 0.3512268662452698, "learning_rate": 7.921886514369934e-05, "loss": 1.211, "num_input_tokens_seen": 8132432, "step": 1645, "train_runtime": 5692.0152, "train_tokens_per_second": 1428.744 }, { "epoch": 0.6054252873563218, "grad_norm": 0.3820294439792633, "learning_rate": 7.91451731761238e-05, "loss": 1.2591, "num_input_tokens_seen": 8145056, "step": 1646, "train_runtime": 5699.6026, "train_tokens_per_second": 1429.057 }, { "epoch": 0.6057931034482759, "grad_norm": 0.366929292678833, "learning_rate": 7.907148120854827e-05, "loss": 1.3052, "num_input_tokens_seen": 8149600, "step": 1647, "train_runtime": 5702.7167, "train_tokens_per_second": 1429.073 }, { "epoch": 0.6061609195402299, "grad_norm": 0.4067031741142273, "learning_rate": 7.899778924097274e-05, "loss": 1.2315, "num_input_tokens_seen": 8153280, "step": 1648, "train_runtime": 5705.4079, "train_tokens_per_second": 1429.044 }, { "epoch": 0.6065287356321839, "grad_norm": 0.39430102705955505, "learning_rate": 7.89240972733972e-05, "loss": 1.1819, "num_input_tokens_seen": 8157264, "step": 1649, "train_runtime": 5708.2292, "train_tokens_per_second": 1429.036 }, { "epoch": 0.6068965517241379, "grad_norm": 0.3571094274520874, "learning_rate": 7.885040530582168e-05, "loss": 1.319, "num_input_tokens_seen": 8162848, "step": 1650, "train_runtime": 5711.9407, "train_tokens_per_second": 1429.085 }, { "epoch": 0.6072643678160919, "grad_norm": 0.40118053555488586, "learning_rate": 7.877671333824613e-05, "loss": 1.2625, "num_input_tokens_seen": 8166320, "step": 1651, "train_runtime": 5716.5158, "train_tokens_per_second": 1428.548 }, { "epoch": 0.607632183908046, "grad_norm": 0.3696447014808655, "learning_rate": 7.870302137067061e-05, "loss": 1.2195, "num_input_tokens_seen": 8172272, "step": 1652, "train_runtime": 5720.3147, "train_tokens_per_second": 1428.64 }, { "epoch": 0.608, "grad_norm": 0.3668355345726013, "learning_rate": 7.862932940309506e-05, "loss": 1.3403, "num_input_tokens_seen": 8176416, "step": 1653, "train_runtime": 5723.1675, "train_tokens_per_second": 1428.652 }, { "epoch": 0.608367816091954, "grad_norm": 0.3291745185852051, "learning_rate": 7.855563743551954e-05, "loss": 1.1815, "num_input_tokens_seen": 8180896, "step": 1654, "train_runtime": 5726.2525, "train_tokens_per_second": 1428.665 }, { "epoch": 0.608735632183908, "grad_norm": 0.3443072736263275, "learning_rate": 7.848194546794399e-05, "loss": 1.1011, "num_input_tokens_seen": 8184224, "step": 1655, "train_runtime": 5728.7426, "train_tokens_per_second": 1428.625 }, { "epoch": 0.609103448275862, "grad_norm": 0.355884313583374, "learning_rate": 7.840825350036847e-05, "loss": 1.2486, "num_input_tokens_seen": 8188320, "step": 1656, "train_runtime": 5731.6319, "train_tokens_per_second": 1428.619 }, { "epoch": 0.6094712643678161, "grad_norm": 0.346994549036026, "learning_rate": 7.833456153279293e-05, "loss": 1.238, "num_input_tokens_seen": 8198144, "step": 1657, "train_runtime": 5737.627, "train_tokens_per_second": 1428.839 }, { "epoch": 0.6098390804597701, "grad_norm": 0.3324006199836731, "learning_rate": 7.82608695652174e-05, "loss": 1.245, "num_input_tokens_seen": 8202336, "step": 1658, "train_runtime": 5740.5104, "train_tokens_per_second": 1428.851 }, { "epoch": 0.6102068965517241, "grad_norm": 0.3342224955558777, "learning_rate": 7.818717759764186e-05, "loss": 1.1237, "num_input_tokens_seen": 8207344, "step": 1659, "train_runtime": 5743.8458, "train_tokens_per_second": 1428.894 }, { "epoch": 0.6105747126436781, "grad_norm": 0.3513737916946411, "learning_rate": 7.811348563006633e-05, "loss": 1.2363, "num_input_tokens_seen": 8211168, "step": 1660, "train_runtime": 5746.5795, "train_tokens_per_second": 1428.879 }, { "epoch": 0.6109425287356322, "grad_norm": 0.33271244168281555, "learning_rate": 7.803979366249079e-05, "loss": 1.2682, "num_input_tokens_seen": 8216992, "step": 1661, "train_runtime": 5750.3954, "train_tokens_per_second": 1428.944 }, { "epoch": 0.6113103448275862, "grad_norm": 0.330715537071228, "learning_rate": 7.796610169491526e-05, "loss": 1.1741, "num_input_tokens_seen": 8220848, "step": 1662, "train_runtime": 5753.1671, "train_tokens_per_second": 1428.926 }, { "epoch": 0.6116781609195402, "grad_norm": 0.3354067802429199, "learning_rate": 7.789240972733972e-05, "loss": 1.2572, "num_input_tokens_seen": 8227328, "step": 1663, "train_runtime": 5757.3748, "train_tokens_per_second": 1429.007 }, { "epoch": 0.6120459770114942, "grad_norm": 0.38026654720306396, "learning_rate": 7.781871775976419e-05, "loss": 1.2293, "num_input_tokens_seen": 8231152, "step": 1664, "train_runtime": 5760.0483, "train_tokens_per_second": 1429.007 }, { "epoch": 0.6124137931034482, "grad_norm": 0.38024336099624634, "learning_rate": 7.774502579218865e-05, "loss": 1.3161, "num_input_tokens_seen": 8237152, "step": 1665, "train_runtime": 5763.9649, "train_tokens_per_second": 1429.077 }, { "epoch": 0.6127816091954023, "grad_norm": 0.36663687229156494, "learning_rate": 7.767133382461313e-05, "loss": 1.2095, "num_input_tokens_seen": 8241568, "step": 1666, "train_runtime": 5767.0356, "train_tokens_per_second": 1429.082 }, { "epoch": 0.6131494252873563, "grad_norm": 0.35605117678642273, "learning_rate": 7.759764185703758e-05, "loss": 1.1832, "num_input_tokens_seen": 8248112, "step": 1667, "train_runtime": 5771.2867, "train_tokens_per_second": 1429.163 }, { "epoch": 0.6135172413793103, "grad_norm": 0.34538206458091736, "learning_rate": 7.752394988946206e-05, "loss": 1.2124, "num_input_tokens_seen": 8252032, "step": 1668, "train_runtime": 5773.9686, "train_tokens_per_second": 1429.179 }, { "epoch": 0.6138850574712643, "grad_norm": 0.37975063920021057, "learning_rate": 7.745025792188651e-05, "loss": 1.21, "num_input_tokens_seen": 8256160, "step": 1669, "train_runtime": 5776.8044, "train_tokens_per_second": 1429.192 }, { "epoch": 0.6142528735632183, "grad_norm": 0.385015070438385, "learning_rate": 7.737656595431099e-05, "loss": 1.2157, "num_input_tokens_seen": 8260176, "step": 1670, "train_runtime": 5779.6329, "train_tokens_per_second": 1429.187 }, { "epoch": 0.6146206896551724, "grad_norm": 0.3640705645084381, "learning_rate": 7.730287398673544e-05, "loss": 1.2995, "num_input_tokens_seen": 8266448, "step": 1671, "train_runtime": 5783.7064, "train_tokens_per_second": 1429.265 }, { "epoch": 0.6149885057471265, "grad_norm": 0.3843008279800415, "learning_rate": 7.722918201915992e-05, "loss": 1.1236, "num_input_tokens_seen": 8270528, "step": 1672, "train_runtime": 5786.5618, "train_tokens_per_second": 1429.265 }, { "epoch": 0.6153563218390805, "grad_norm": 0.3321741223335266, "learning_rate": 7.715549005158438e-05, "loss": 1.1477, "num_input_tokens_seen": 8274448, "step": 1673, "train_runtime": 5789.318, "train_tokens_per_second": 1429.261 }, { "epoch": 0.6157241379310345, "grad_norm": 0.363680899143219, "learning_rate": 7.708179808400885e-05, "loss": 1.4119, "num_input_tokens_seen": 8278752, "step": 1674, "train_runtime": 5792.3767, "train_tokens_per_second": 1429.25 }, { "epoch": 0.6160919540229886, "grad_norm": 0.3656877875328064, "learning_rate": 7.700810611643331e-05, "loss": 1.3734, "num_input_tokens_seen": 8282112, "step": 1675, "train_runtime": 5794.8791, "train_tokens_per_second": 1429.212 }, { "epoch": 0.6164597701149426, "grad_norm": 0.3490371108055115, "learning_rate": 7.693441414885778e-05, "loss": 1.0974, "num_input_tokens_seen": 8291488, "step": 1676, "train_runtime": 5800.5803, "train_tokens_per_second": 1429.424 }, { "epoch": 0.6168275862068966, "grad_norm": 0.35831621289253235, "learning_rate": 7.686072218128224e-05, "loss": 1.2945, "num_input_tokens_seen": 8294896, "step": 1677, "train_runtime": 5803.2077, "train_tokens_per_second": 1429.364 }, { "epoch": 0.6171954022988506, "grad_norm": 0.3728373050689697, "learning_rate": 7.678703021370671e-05, "loss": 1.2804, "num_input_tokens_seen": 8299376, "step": 1678, "train_runtime": 5806.2739, "train_tokens_per_second": 1429.381 }, { "epoch": 0.6175632183908046, "grad_norm": 0.35205045342445374, "learning_rate": 7.671333824613117e-05, "loss": 1.1876, "num_input_tokens_seen": 8306080, "step": 1679, "train_runtime": 5810.491, "train_tokens_per_second": 1429.497 }, { "epoch": 0.6179310344827587, "grad_norm": 0.34353363513946533, "learning_rate": 7.663964627855564e-05, "loss": 1.2488, "num_input_tokens_seen": 8311088, "step": 1680, "train_runtime": 5813.894, "train_tokens_per_second": 1429.522 }, { "epoch": 0.6182988505747127, "grad_norm": 0.3545430600643158, "learning_rate": 7.65659543109801e-05, "loss": 1.2714, "num_input_tokens_seen": 8316720, "step": 1681, "train_runtime": 5819.7315, "train_tokens_per_second": 1429.056 }, { "epoch": 0.6186666666666667, "grad_norm": 0.3599246144294739, "learning_rate": 7.649226234340458e-05, "loss": 1.0997, "num_input_tokens_seen": 8320144, "step": 1682, "train_runtime": 5822.2177, "train_tokens_per_second": 1429.033 }, { "epoch": 0.6190344827586207, "grad_norm": 0.33515429496765137, "learning_rate": 7.641857037582903e-05, "loss": 1.254, "num_input_tokens_seen": 8324192, "step": 1683, "train_runtime": 5825.0793, "train_tokens_per_second": 1429.026 }, { "epoch": 0.6194022988505747, "grad_norm": 0.35460397601127625, "learning_rate": 7.634487840825351e-05, "loss": 1.1662, "num_input_tokens_seen": 8328320, "step": 1684, "train_runtime": 5827.9777, "train_tokens_per_second": 1429.024 }, { "epoch": 0.6197701149425288, "grad_norm": 0.33717334270477295, "learning_rate": 7.627118644067796e-05, "loss": 1.1742, "num_input_tokens_seen": 8332064, "step": 1685, "train_runtime": 5830.6363, "train_tokens_per_second": 1429.015 }, { "epoch": 0.6201379310344828, "grad_norm": 0.39270511269569397, "learning_rate": 7.619749447310244e-05, "loss": 1.2929, "num_input_tokens_seen": 8336096, "step": 1686, "train_runtime": 5833.4447, "train_tokens_per_second": 1429.018 }, { "epoch": 0.6205057471264368, "grad_norm": 0.354690283536911, "learning_rate": 7.612380250552689e-05, "loss": 1.1895, "num_input_tokens_seen": 8339424, "step": 1687, "train_runtime": 5835.9405, "train_tokens_per_second": 1428.977 }, { "epoch": 0.6208735632183908, "grad_norm": 0.34419217705726624, "learning_rate": 7.605011053795137e-05, "loss": 1.2396, "num_input_tokens_seen": 8344176, "step": 1688, "train_runtime": 5839.2142, "train_tokens_per_second": 1428.99 }, { "epoch": 0.6212413793103448, "grad_norm": 0.38825803995132446, "learning_rate": 7.597641857037583e-05, "loss": 1.0687, "num_input_tokens_seen": 8352576, "step": 1689, "train_runtime": 5844.4953, "train_tokens_per_second": 1429.136 }, { "epoch": 0.6216091954022989, "grad_norm": 0.32436880469322205, "learning_rate": 7.59027266028003e-05, "loss": 1.1041, "num_input_tokens_seen": 8357584, "step": 1690, "train_runtime": 5847.8726, "train_tokens_per_second": 1429.167 }, { "epoch": 0.6219770114942529, "grad_norm": 0.35893768072128296, "learning_rate": 7.582903463522476e-05, "loss": 1.1916, "num_input_tokens_seen": 8361472, "step": 1691, "train_runtime": 5850.5938, "train_tokens_per_second": 1429.166 }, { "epoch": 0.6223448275862069, "grad_norm": 0.3316190540790558, "learning_rate": 7.575534266764923e-05, "loss": 1.1044, "num_input_tokens_seen": 8365648, "step": 1692, "train_runtime": 5853.4557, "train_tokens_per_second": 1429.181 }, { "epoch": 0.6227126436781609, "grad_norm": 0.34904029965400696, "learning_rate": 7.56816507000737e-05, "loss": 1.1768, "num_input_tokens_seen": 8369600, "step": 1693, "train_runtime": 5856.2494, "train_tokens_per_second": 1429.174 }, { "epoch": 0.623080459770115, "grad_norm": 0.34622156620025635, "learning_rate": 7.560795873249816e-05, "loss": 1.1642, "num_input_tokens_seen": 8372896, "step": 1694, "train_runtime": 5858.7018, "train_tokens_per_second": 1429.138 }, { "epoch": 0.623448275862069, "grad_norm": 0.39177048206329346, "learning_rate": 7.553426676492262e-05, "loss": 1.4457, "num_input_tokens_seen": 8377296, "step": 1695, "train_runtime": 5861.7435, "train_tokens_per_second": 1429.147 }, { "epoch": 0.623816091954023, "grad_norm": 0.36550185084342957, "learning_rate": 7.546057479734709e-05, "loss": 1.2474, "num_input_tokens_seen": 8384384, "step": 1696, "train_runtime": 5866.1669, "train_tokens_per_second": 1429.278 }, { "epoch": 0.624183908045977, "grad_norm": 0.3592674136161804, "learning_rate": 7.538688282977155e-05, "loss": 1.1728, "num_input_tokens_seen": 8389152, "step": 1697, "train_runtime": 5869.4197, "train_tokens_per_second": 1429.298 }, { "epoch": 0.624551724137931, "grad_norm": 0.36256006360054016, "learning_rate": 7.531319086219603e-05, "loss": 1.1662, "num_input_tokens_seen": 8395920, "step": 1698, "train_runtime": 5873.7059, "train_tokens_per_second": 1429.408 }, { "epoch": 0.624919540229885, "grad_norm": 0.37653040885925293, "learning_rate": 7.523949889462048e-05, "loss": 1.3271, "num_input_tokens_seen": 8399632, "step": 1699, "train_runtime": 5876.417, "train_tokens_per_second": 1429.38 }, { "epoch": 0.6252873563218391, "grad_norm": 0.366256982088089, "learning_rate": 7.516580692704496e-05, "loss": 1.1338, "num_input_tokens_seen": 8403280, "step": 1700, "train_runtime": 5879.1221, "train_tokens_per_second": 1429.343 }, { "epoch": 0.6256551724137931, "grad_norm": 0.372652143239975, "learning_rate": 7.509211495946941e-05, "loss": 1.2001, "num_input_tokens_seen": 8406480, "step": 1701, "train_runtime": 5881.503, "train_tokens_per_second": 1429.308 }, { "epoch": 0.6260229885057471, "grad_norm": 0.3536698520183563, "learning_rate": 7.501842299189389e-05, "loss": 1.1611, "num_input_tokens_seen": 8414080, "step": 1702, "train_runtime": 5886.3073, "train_tokens_per_second": 1429.433 }, { "epoch": 0.6263908045977011, "grad_norm": 0.38645151257514954, "learning_rate": 7.494473102431834e-05, "loss": 1.2416, "num_input_tokens_seen": 8418352, "step": 1703, "train_runtime": 5889.2821, "train_tokens_per_second": 1429.436 }, { "epoch": 0.6267586206896552, "grad_norm": 0.44208791851997375, "learning_rate": 7.487103905674282e-05, "loss": 1.2463, "num_input_tokens_seen": 8423376, "step": 1704, "train_runtime": 5892.592, "train_tokens_per_second": 1429.486 }, { "epoch": 0.6271264367816092, "grad_norm": 0.36852338910102844, "learning_rate": 7.479734708916729e-05, "loss": 1.2882, "num_input_tokens_seen": 8429136, "step": 1705, "train_runtime": 5896.3849, "train_tokens_per_second": 1429.543 }, { "epoch": 0.6274942528735632, "grad_norm": 0.44526517391204834, "learning_rate": 7.472365512159175e-05, "loss": 1.1301, "num_input_tokens_seen": 8438560, "step": 1706, "train_runtime": 5902.2457, "train_tokens_per_second": 1429.72 }, { "epoch": 0.6278620689655172, "grad_norm": 0.3883841931819916, "learning_rate": 7.464996315401621e-05, "loss": 1.2752, "num_input_tokens_seen": 8442128, "step": 1707, "train_runtime": 5904.8067, "train_tokens_per_second": 1429.704 }, { "epoch": 0.6282298850574712, "grad_norm": 0.37330782413482666, "learning_rate": 7.457627118644068e-05, "loss": 1.11, "num_input_tokens_seen": 8447296, "step": 1708, "train_runtime": 5908.2233, "train_tokens_per_second": 1429.752 }, { "epoch": 0.6285977011494253, "grad_norm": 0.3426826000213623, "learning_rate": 7.450257921886514e-05, "loss": 1.224, "num_input_tokens_seen": 8451120, "step": 1709, "train_runtime": 5910.8956, "train_tokens_per_second": 1429.753 }, { "epoch": 0.6289655172413793, "grad_norm": 0.33743831515312195, "learning_rate": 7.442888725128961e-05, "loss": 1.094, "num_input_tokens_seen": 8455648, "step": 1710, "train_runtime": 5914.0251, "train_tokens_per_second": 1429.762 }, { "epoch": 0.6293333333333333, "grad_norm": 0.33115074038505554, "learning_rate": 7.435519528371407e-05, "loss": 1.1234, "num_input_tokens_seen": 8460160, "step": 1711, "train_runtime": 5919.2328, "train_tokens_per_second": 1429.266 }, { "epoch": 0.6297011494252873, "grad_norm": 0.3846089243888855, "learning_rate": 7.428150331613854e-05, "loss": 1.2594, "num_input_tokens_seen": 8466016, "step": 1712, "train_runtime": 5923.0893, "train_tokens_per_second": 1429.324 }, { "epoch": 0.6300689655172413, "grad_norm": 0.37581756711006165, "learning_rate": 7.4207811348563e-05, "loss": 1.2047, "num_input_tokens_seen": 8470976, "step": 1713, "train_runtime": 5926.4594, "train_tokens_per_second": 1429.349 }, { "epoch": 0.6304367816091954, "grad_norm": 0.3285261392593384, "learning_rate": 7.413411938098748e-05, "loss": 1.1702, "num_input_tokens_seen": 8475072, "step": 1714, "train_runtime": 5929.2624, "train_tokens_per_second": 1429.364 }, { "epoch": 0.6308045977011494, "grad_norm": 0.3255341947078705, "learning_rate": 7.406042741341193e-05, "loss": 1.1993, "num_input_tokens_seen": 8480336, "step": 1715, "train_runtime": 5932.8379, "train_tokens_per_second": 1429.389 }, { "epoch": 0.6311724137931034, "grad_norm": 0.3650467097759247, "learning_rate": 7.398673544583641e-05, "loss": 1.1929, "num_input_tokens_seen": 8485184, "step": 1716, "train_runtime": 5936.0374, "train_tokens_per_second": 1429.436 }, { "epoch": 0.6315402298850574, "grad_norm": 0.32892972230911255, "learning_rate": 7.391304347826086e-05, "loss": 1.1589, "num_input_tokens_seen": 8488448, "step": 1717, "train_runtime": 5938.468, "train_tokens_per_second": 1429.4 }, { "epoch": 0.6319080459770114, "grad_norm": 0.37333914637565613, "learning_rate": 7.383935151068534e-05, "loss": 1.275, "num_input_tokens_seen": 8493840, "step": 1718, "train_runtime": 5942.016, "train_tokens_per_second": 1429.454 }, { "epoch": 0.6322758620689655, "grad_norm": 0.3702186644077301, "learning_rate": 7.37656595431098e-05, "loss": 1.2836, "num_input_tokens_seen": 8498704, "step": 1719, "train_runtime": 5945.371, "train_tokens_per_second": 1429.466 }, { "epoch": 0.6326436781609195, "grad_norm": 0.39659491181373596, "learning_rate": 7.369196757553427e-05, "loss": 1.2489, "num_input_tokens_seen": 8502144, "step": 1720, "train_runtime": 5947.8739, "train_tokens_per_second": 1429.443 }, { "epoch": 0.6330114942528735, "grad_norm": 0.34572821855545044, "learning_rate": 7.361827560795874e-05, "loss": 1.2434, "num_input_tokens_seen": 8505824, "step": 1721, "train_runtime": 5950.5455, "train_tokens_per_second": 1429.419 }, { "epoch": 0.6333793103448276, "grad_norm": 0.3726195991039276, "learning_rate": 7.35445836403832e-05, "loss": 1.2399, "num_input_tokens_seen": 8510784, "step": 1722, "train_runtime": 5953.8061, "train_tokens_per_second": 1429.469 }, { "epoch": 0.6337471264367817, "grad_norm": 0.35379770398139954, "learning_rate": 7.347089167280767e-05, "loss": 1.3305, "num_input_tokens_seen": 8514208, "step": 1723, "train_runtime": 5956.3298, "train_tokens_per_second": 1429.439 }, { "epoch": 0.6341149425287357, "grad_norm": 0.36143144965171814, "learning_rate": 7.339719970523213e-05, "loss": 1.1167, "num_input_tokens_seen": 8518400, "step": 1724, "train_runtime": 5959.2424, "train_tokens_per_second": 1429.443 }, { "epoch": 0.6344827586206897, "grad_norm": 0.3915243148803711, "learning_rate": 7.33235077376566e-05, "loss": 1.3042, "num_input_tokens_seen": 8524928, "step": 1725, "train_runtime": 5963.3754, "train_tokens_per_second": 1429.547 }, { "epoch": 0.6348505747126437, "grad_norm": 0.3500584363937378, "learning_rate": 7.324981577008106e-05, "loss": 1.1139, "num_input_tokens_seen": 8534320, "step": 1726, "train_runtime": 5969.1137, "train_tokens_per_second": 1429.747 }, { "epoch": 0.6352183908045977, "grad_norm": 0.41126441955566406, "learning_rate": 7.317612380250552e-05, "loss": 1.2846, "num_input_tokens_seen": 8540400, "step": 1727, "train_runtime": 5973.053, "train_tokens_per_second": 1429.822 }, { "epoch": 0.6355862068965518, "grad_norm": 0.323826402425766, "learning_rate": 7.310243183492999e-05, "loss": 1.2211, "num_input_tokens_seen": 8547040, "step": 1728, "train_runtime": 5977.3366, "train_tokens_per_second": 1429.908 }, { "epoch": 0.6359540229885058, "grad_norm": 0.3922103941440582, "learning_rate": 7.302873986735445e-05, "loss": 1.2249, "num_input_tokens_seen": 8553584, "step": 1729, "train_runtime": 5981.6217, "train_tokens_per_second": 1429.977 }, { "epoch": 0.6363218390804598, "grad_norm": 0.3563559651374817, "learning_rate": 7.295504789977893e-05, "loss": 1.1275, "num_input_tokens_seen": 8562672, "step": 1730, "train_runtime": 5987.2531, "train_tokens_per_second": 1430.15 }, { "epoch": 0.6366896551724138, "grad_norm": 0.34606972336769104, "learning_rate": 7.288135593220338e-05, "loss": 1.1647, "num_input_tokens_seen": 8567040, "step": 1731, "train_runtime": 5990.2886, "train_tokens_per_second": 1430.155 }, { "epoch": 0.6370574712643678, "grad_norm": 0.36875972151756287, "learning_rate": 7.280766396462786e-05, "loss": 1.2265, "num_input_tokens_seen": 8571376, "step": 1732, "train_runtime": 5993.2536, "train_tokens_per_second": 1430.171 }, { "epoch": 0.6374252873563219, "grad_norm": 0.3302783668041229, "learning_rate": 7.273397199705231e-05, "loss": 1.2149, "num_input_tokens_seen": 8579904, "step": 1733, "train_runtime": 5998.5997, "train_tokens_per_second": 1430.318 }, { "epoch": 0.6377931034482759, "grad_norm": 0.3487246036529541, "learning_rate": 7.266028002947679e-05, "loss": 1.2711, "num_input_tokens_seen": 8585664, "step": 1734, "train_runtime": 6002.3843, "train_tokens_per_second": 1430.376 }, { "epoch": 0.6381609195402299, "grad_norm": 0.34984487295150757, "learning_rate": 7.258658806190126e-05, "loss": 1.0415, "num_input_tokens_seen": 8589168, "step": 1735, "train_runtime": 6004.8669, "train_tokens_per_second": 1430.368 }, { "epoch": 0.6385287356321839, "grad_norm": 0.33944281935691833, "learning_rate": 7.251289609432572e-05, "loss": 1.2221, "num_input_tokens_seen": 8593280, "step": 1736, "train_runtime": 6007.7107, "train_tokens_per_second": 1430.375 }, { "epoch": 0.638896551724138, "grad_norm": 0.3744630515575409, "learning_rate": 7.243920412675019e-05, "loss": 1.3095, "num_input_tokens_seen": 8597760, "step": 1737, "train_runtime": 6010.8044, "train_tokens_per_second": 1430.384 }, { "epoch": 0.639264367816092, "grad_norm": 0.38167956471443176, "learning_rate": 7.236551215917465e-05, "loss": 1.2901, "num_input_tokens_seen": 8608656, "step": 1738, "train_runtime": 6017.3674, "train_tokens_per_second": 1430.635 }, { "epoch": 0.639632183908046, "grad_norm": 0.35250505805015564, "learning_rate": 7.229182019159913e-05, "loss": 1.2224, "num_input_tokens_seen": 8611776, "step": 1739, "train_runtime": 6019.6915, "train_tokens_per_second": 1430.601 }, { "epoch": 0.64, "grad_norm": 0.3379589319229126, "learning_rate": 7.221812822402358e-05, "loss": 1.0406, "num_input_tokens_seen": 8616384, "step": 1740, "train_runtime": 6022.7709, "train_tokens_per_second": 1430.635 }, { "epoch": 0.640367816091954, "grad_norm": 0.4123132526874542, "learning_rate": 7.214443625644806e-05, "loss": 1.3314, "num_input_tokens_seen": 8620400, "step": 1741, "train_runtime": 6027.706, "train_tokens_per_second": 1430.129 }, { "epoch": 0.640735632183908, "grad_norm": 0.38162675499916077, "learning_rate": 7.207074428887251e-05, "loss": 1.2229, "num_input_tokens_seen": 8624976, "step": 1742, "train_runtime": 6030.8467, "train_tokens_per_second": 1430.143 }, { "epoch": 0.6411034482758621, "grad_norm": 0.3775383234024048, "learning_rate": 7.199705232129699e-05, "loss": 1.3291, "num_input_tokens_seen": 8629472, "step": 1743, "train_runtime": 6033.9782, "train_tokens_per_second": 1430.146 }, { "epoch": 0.6414712643678161, "grad_norm": 0.36281177401542664, "learning_rate": 7.192336035372145e-05, "loss": 1.2229, "num_input_tokens_seen": 8634112, "step": 1744, "train_runtime": 6037.1953, "train_tokens_per_second": 1430.153 }, { "epoch": 0.6418390804597701, "grad_norm": 0.38396233320236206, "learning_rate": 7.184966838614592e-05, "loss": 1.2697, "num_input_tokens_seen": 8641824, "step": 1745, "train_runtime": 6042.0258, "train_tokens_per_second": 1430.286 }, { "epoch": 0.6422068965517241, "grad_norm": 0.39428532123565674, "learning_rate": 7.177597641857038e-05, "loss": 1.2465, "num_input_tokens_seen": 8645904, "step": 1746, "train_runtime": 6044.8586, "train_tokens_per_second": 1430.291 }, { "epoch": 0.6425747126436782, "grad_norm": 0.3777850568294525, "learning_rate": 7.170228445099485e-05, "loss": 1.2897, "num_input_tokens_seen": 8649856, "step": 1747, "train_runtime": 6047.5995, "train_tokens_per_second": 1430.296 }, { "epoch": 0.6429425287356322, "grad_norm": 0.37085989117622375, "learning_rate": 7.162859248341931e-05, "loss": 1.3786, "num_input_tokens_seen": 8654768, "step": 1748, "train_runtime": 6050.8791, "train_tokens_per_second": 1430.332 }, { "epoch": 0.6433103448275862, "grad_norm": 0.35489970445632935, "learning_rate": 7.155490051584378e-05, "loss": 1.3616, "num_input_tokens_seen": 8658880, "step": 1749, "train_runtime": 6053.7682, "train_tokens_per_second": 1430.329 }, { "epoch": 0.6436781609195402, "grad_norm": 0.37047791481018066, "learning_rate": 7.148120854826824e-05, "loss": 1.3575, "num_input_tokens_seen": 8662144, "step": 1750, "train_runtime": 6056.1594, "train_tokens_per_second": 1430.303 }, { "epoch": 0.6440459770114942, "grad_norm": 0.3515414297580719, "learning_rate": 7.140751658069271e-05, "loss": 1.354, "num_input_tokens_seen": 8666096, "step": 1751, "train_runtime": 6058.9181, "train_tokens_per_second": 1430.304 }, { "epoch": 0.6444137931034483, "grad_norm": 0.398267924785614, "learning_rate": 7.133382461311717e-05, "loss": 1.1688, "num_input_tokens_seen": 8670672, "step": 1752, "train_runtime": 6062.0909, "train_tokens_per_second": 1430.31 }, { "epoch": 0.6447816091954023, "grad_norm": 0.35337409377098083, "learning_rate": 7.126013264554164e-05, "loss": 1.2443, "num_input_tokens_seen": 8674656, "step": 1753, "train_runtime": 6064.9413, "train_tokens_per_second": 1430.295 }, { "epoch": 0.6451494252873563, "grad_norm": 0.3913950026035309, "learning_rate": 7.11864406779661e-05, "loss": 1.2636, "num_input_tokens_seen": 8678352, "step": 1754, "train_runtime": 6067.5314, "train_tokens_per_second": 1430.294 }, { "epoch": 0.6455172413793103, "grad_norm": 0.3143499791622162, "learning_rate": 7.111274871039058e-05, "loss": 1.1459, "num_input_tokens_seen": 8684656, "step": 1755, "train_runtime": 6071.6067, "train_tokens_per_second": 1430.372 }, { "epoch": 0.6458850574712643, "grad_norm": 0.3837677538394928, "learning_rate": 7.103905674281503e-05, "loss": 1.1757, "num_input_tokens_seen": 8687936, "step": 1756, "train_runtime": 6074.0305, "train_tokens_per_second": 1430.341 }, { "epoch": 0.6462528735632184, "grad_norm": 0.34883350133895874, "learning_rate": 7.096536477523951e-05, "loss": 1.1783, "num_input_tokens_seen": 8692688, "step": 1757, "train_runtime": 6077.2516, "train_tokens_per_second": 1430.365 }, { "epoch": 0.6466206896551724, "grad_norm": 0.37379708886146545, "learning_rate": 7.089167280766396e-05, "loss": 1.1724, "num_input_tokens_seen": 8697776, "step": 1758, "train_runtime": 6080.6046, "train_tokens_per_second": 1430.413 }, { "epoch": 0.6469885057471264, "grad_norm": 0.3478778600692749, "learning_rate": 7.081798084008844e-05, "loss": 1.1709, "num_input_tokens_seen": 8702768, "step": 1759, "train_runtime": 6084.0177, "train_tokens_per_second": 1430.431 }, { "epoch": 0.6473563218390804, "grad_norm": 0.3637995719909668, "learning_rate": 7.07442888725129e-05, "loss": 1.2735, "num_input_tokens_seen": 8708448, "step": 1760, "train_runtime": 6087.7386, "train_tokens_per_second": 1430.49 }, { "epoch": 0.6477241379310344, "grad_norm": 0.3367466926574707, "learning_rate": 7.067059690493737e-05, "loss": 1.1286, "num_input_tokens_seen": 8712896, "step": 1761, "train_runtime": 6090.7652, "train_tokens_per_second": 1430.509 }, { "epoch": 0.6480919540229885, "grad_norm": 0.3800182342529297, "learning_rate": 7.059690493736183e-05, "loss": 1.1854, "num_input_tokens_seen": 8719328, "step": 1762, "train_runtime": 6094.9137, "train_tokens_per_second": 1430.591 }, { "epoch": 0.6484597701149425, "grad_norm": 0.40403521060943604, "learning_rate": 7.05232129697863e-05, "loss": 1.3117, "num_input_tokens_seen": 8724560, "step": 1763, "train_runtime": 6098.4609, "train_tokens_per_second": 1430.617 }, { "epoch": 0.6488275862068965, "grad_norm": 0.3457203507423401, "learning_rate": 7.044952100221076e-05, "loss": 1.1243, "num_input_tokens_seen": 8728928, "step": 1764, "train_runtime": 6101.4944, "train_tokens_per_second": 1430.621 }, { "epoch": 0.6491954022988505, "grad_norm": 0.3725492060184479, "learning_rate": 7.037582903463523e-05, "loss": 1.2636, "num_input_tokens_seen": 8733952, "step": 1765, "train_runtime": 6104.8527, "train_tokens_per_second": 1430.657 }, { "epoch": 0.6495632183908046, "grad_norm": 0.34399518370628357, "learning_rate": 7.03021370670597e-05, "loss": 1.2447, "num_input_tokens_seen": 8739456, "step": 1766, "train_runtime": 6108.5181, "train_tokens_per_second": 1430.7 }, { "epoch": 0.6499310344827586, "grad_norm": 0.4023468494415283, "learning_rate": 7.022844509948416e-05, "loss": 1.2799, "num_input_tokens_seen": 8743008, "step": 1767, "train_runtime": 6111.0663, "train_tokens_per_second": 1430.685 }, { "epoch": 0.6502988505747126, "grad_norm": 0.3690298795700073, "learning_rate": 7.015475313190862e-05, "loss": 1.1633, "num_input_tokens_seen": 8746288, "step": 1768, "train_runtime": 6113.4582, "train_tokens_per_second": 1430.661 }, { "epoch": 0.6506666666666666, "grad_norm": 0.360746830701828, "learning_rate": 7.00810611643331e-05, "loss": 1.2309, "num_input_tokens_seen": 8749696, "step": 1769, "train_runtime": 6115.9301, "train_tokens_per_second": 1430.64 }, { "epoch": 0.6510344827586206, "grad_norm": 0.35331016778945923, "learning_rate": 7.000736919675755e-05, "loss": 1.2066, "num_input_tokens_seen": 8753840, "step": 1770, "train_runtime": 6118.8282, "train_tokens_per_second": 1430.64 }, { "epoch": 0.6514022988505748, "grad_norm": 0.31782907247543335, "learning_rate": 6.993367722918203e-05, "loss": 1.2213, "num_input_tokens_seen": 8760928, "step": 1771, "train_runtime": 6125.3261, "train_tokens_per_second": 1430.279 }, { "epoch": 0.6517701149425288, "grad_norm": 0.35930871963500977, "learning_rate": 6.985998526160648e-05, "loss": 1.1641, "num_input_tokens_seen": 8766544, "step": 1772, "train_runtime": 6129.1413, "train_tokens_per_second": 1430.305 }, { "epoch": 0.6521379310344828, "grad_norm": 0.3347841799259186, "learning_rate": 6.978629329403096e-05, "loss": 1.2085, "num_input_tokens_seen": 8771408, "step": 1773, "train_runtime": 6132.4403, "train_tokens_per_second": 1430.329 }, { "epoch": 0.6525057471264368, "grad_norm": 0.3424447178840637, "learning_rate": 6.971260132645541e-05, "loss": 1.2922, "num_input_tokens_seen": 8775616, "step": 1774, "train_runtime": 6135.3754, "train_tokens_per_second": 1430.331 }, { "epoch": 0.6528735632183909, "grad_norm": 0.36627665162086487, "learning_rate": 6.963890935887989e-05, "loss": 1.1149, "num_input_tokens_seen": 8780352, "step": 1775, "train_runtime": 6138.555, "train_tokens_per_second": 1430.361 }, { "epoch": 0.6532413793103449, "grad_norm": 0.37700387835502625, "learning_rate": 6.956521739130436e-05, "loss": 1.2168, "num_input_tokens_seen": 8788112, "step": 1776, "train_runtime": 6143.4436, "train_tokens_per_second": 1430.486 }, { "epoch": 0.6536091954022989, "grad_norm": 0.33836108446121216, "learning_rate": 6.949152542372882e-05, "loss": 1.1739, "num_input_tokens_seen": 8792128, "step": 1777, "train_runtime": 6146.168, "train_tokens_per_second": 1430.506 }, { "epoch": 0.6539770114942529, "grad_norm": 0.3440338671207428, "learning_rate": 6.941783345615328e-05, "loss": 1.3012, "num_input_tokens_seen": 8797120, "step": 1778, "train_runtime": 6149.5407, "train_tokens_per_second": 1430.533 }, { "epoch": 0.6543448275862069, "grad_norm": 0.35122546553611755, "learning_rate": 6.934414148857775e-05, "loss": 1.3452, "num_input_tokens_seen": 8801632, "step": 1779, "train_runtime": 6152.5495, "train_tokens_per_second": 1430.567 }, { "epoch": 0.654712643678161, "grad_norm": 0.326999306678772, "learning_rate": 6.927044952100221e-05, "loss": 1.2079, "num_input_tokens_seen": 8807632, "step": 1780, "train_runtime": 6156.4956, "train_tokens_per_second": 1430.624 }, { "epoch": 0.655080459770115, "grad_norm": 0.35183876752853394, "learning_rate": 6.919675755342668e-05, "loss": 1.1984, "num_input_tokens_seen": 8811376, "step": 1781, "train_runtime": 6159.2182, "train_tokens_per_second": 1430.6 }, { "epoch": 0.655448275862069, "grad_norm": 0.360561341047287, "learning_rate": 6.912306558585114e-05, "loss": 1.1207, "num_input_tokens_seen": 8816576, "step": 1782, "train_runtime": 6162.6637, "train_tokens_per_second": 1430.644 }, { "epoch": 0.655816091954023, "grad_norm": 0.3827435076236725, "learning_rate": 6.904937361827561e-05, "loss": 1.0998, "num_input_tokens_seen": 8822512, "step": 1783, "train_runtime": 6166.6277, "train_tokens_per_second": 1430.687 }, { "epoch": 0.656183908045977, "grad_norm": 0.3594070374965668, "learning_rate": 6.897568165070007e-05, "loss": 1.244, "num_input_tokens_seen": 8825856, "step": 1784, "train_runtime": 6169.0415, "train_tokens_per_second": 1430.669 }, { "epoch": 0.6565517241379311, "grad_norm": 0.36453524231910706, "learning_rate": 6.890198968312455e-05, "loss": 1.2792, "num_input_tokens_seen": 8829952, "step": 1785, "train_runtime": 6171.9656, "train_tokens_per_second": 1430.655 }, { "epoch": 0.6569195402298851, "grad_norm": 0.383881539106369, "learning_rate": 6.8828297715549e-05, "loss": 1.3045, "num_input_tokens_seen": 8834192, "step": 1786, "train_runtime": 6174.9483, "train_tokens_per_second": 1430.65 }, { "epoch": 0.6572873563218391, "grad_norm": 0.3531823754310608, "learning_rate": 6.875460574797348e-05, "loss": 1.0776, "num_input_tokens_seen": 8842064, "step": 1787, "train_runtime": 6179.8857, "train_tokens_per_second": 1430.781 }, { "epoch": 0.6576551724137931, "grad_norm": 0.3610166311264038, "learning_rate": 6.868091378039793e-05, "loss": 1.2063, "num_input_tokens_seen": 8846544, "step": 1788, "train_runtime": 6182.9988, "train_tokens_per_second": 1430.785 }, { "epoch": 0.6580229885057471, "grad_norm": 0.41903409361839294, "learning_rate": 6.860722181282241e-05, "loss": 1.1257, "num_input_tokens_seen": 8854112, "step": 1789, "train_runtime": 6187.8122, "train_tokens_per_second": 1430.895 }, { "epoch": 0.6583908045977012, "grad_norm": 0.35946381092071533, "learning_rate": 6.853352984524686e-05, "loss": 1.1565, "num_input_tokens_seen": 8859184, "step": 1790, "train_runtime": 6191.2282, "train_tokens_per_second": 1430.925 }, { "epoch": 0.6587586206896552, "grad_norm": 0.3825937509536743, "learning_rate": 6.845983787767134e-05, "loss": 1.3219, "num_input_tokens_seen": 8863216, "step": 1791, "train_runtime": 6193.9898, "train_tokens_per_second": 1430.938 }, { "epoch": 0.6591264367816092, "grad_norm": 0.31378173828125, "learning_rate": 6.83861459100958e-05, "loss": 1.0779, "num_input_tokens_seen": 8869888, "step": 1792, "train_runtime": 6198.1329, "train_tokens_per_second": 1431.058 }, { "epoch": 0.6594942528735632, "grad_norm": 0.3681214451789856, "learning_rate": 6.831245394252027e-05, "loss": 1.2146, "num_input_tokens_seen": 8875712, "step": 1793, "train_runtime": 6201.9276, "train_tokens_per_second": 1431.121 }, { "epoch": 0.6598620689655172, "grad_norm": 0.3513132333755493, "learning_rate": 6.823876197494474e-05, "loss": 1.1929, "num_input_tokens_seen": 8883408, "step": 1794, "train_runtime": 6206.8064, "train_tokens_per_second": 1431.237 }, { "epoch": 0.6602298850574713, "grad_norm": 0.35128530859947205, "learning_rate": 6.81650700073692e-05, "loss": 1.0909, "num_input_tokens_seen": 8892832, "step": 1795, "train_runtime": 6212.4787, "train_tokens_per_second": 1431.447 }, { "epoch": 0.6605977011494253, "grad_norm": 0.3785873353481293, "learning_rate": 6.809137803979367e-05, "loss": 1.2206, "num_input_tokens_seen": 8899152, "step": 1796, "train_runtime": 6216.5977, "train_tokens_per_second": 1431.515 }, { "epoch": 0.6609655172413793, "grad_norm": 0.3689374029636383, "learning_rate": 6.801768607221813e-05, "loss": 1.2212, "num_input_tokens_seen": 8903200, "step": 1797, "train_runtime": 6219.5073, "train_tokens_per_second": 1431.496 }, { "epoch": 0.6613333333333333, "grad_norm": 0.35654157400131226, "learning_rate": 6.79439941046426e-05, "loss": 1.1282, "num_input_tokens_seen": 8910192, "step": 1798, "train_runtime": 6223.9936, "train_tokens_per_second": 1431.588 }, { "epoch": 0.6617011494252873, "grad_norm": 0.3701092302799225, "learning_rate": 6.787030213706706e-05, "loss": 1.252, "num_input_tokens_seen": 8913952, "step": 1799, "train_runtime": 6226.6117, "train_tokens_per_second": 1431.59 }, { "epoch": 0.6620689655172414, "grad_norm": 0.36222463846206665, "learning_rate": 6.779661016949152e-05, "loss": 1.2092, "num_input_tokens_seen": 8916896, "step": 1800, "train_runtime": 6228.8995, "train_tokens_per_second": 1431.536 }, { "epoch": 0.6624367816091954, "grad_norm": 0.3272439241409302, "learning_rate": 6.7722918201916e-05, "loss": 1.1512, "num_input_tokens_seen": 8920624, "step": 1801, "train_runtime": 6233.5561, "train_tokens_per_second": 1431.065 }, { "epoch": 0.6628045977011494, "grad_norm": 0.3526923656463623, "learning_rate": 6.764922623434045e-05, "loss": 1.1256, "num_input_tokens_seen": 8925584, "step": 1802, "train_runtime": 6236.922, "train_tokens_per_second": 1431.088 }, { "epoch": 0.6631724137931034, "grad_norm": 0.3336963653564453, "learning_rate": 6.757553426676493e-05, "loss": 1.1617, "num_input_tokens_seen": 8930064, "step": 1803, "train_runtime": 6239.9543, "train_tokens_per_second": 1431.11 }, { "epoch": 0.6635402298850575, "grad_norm": 0.3636209964752197, "learning_rate": 6.750184229918938e-05, "loss": 1.1992, "num_input_tokens_seen": 8935552, "step": 1804, "train_runtime": 6243.6211, "train_tokens_per_second": 1431.149 }, { "epoch": 0.6639080459770115, "grad_norm": 0.3536466956138611, "learning_rate": 6.742815033161386e-05, "loss": 1.2405, "num_input_tokens_seen": 8938960, "step": 1805, "train_runtime": 6246.1387, "train_tokens_per_second": 1431.118 }, { "epoch": 0.6642758620689655, "grad_norm": 0.37251850962638855, "learning_rate": 6.735445836403831e-05, "loss": 1.2534, "num_input_tokens_seen": 8944688, "step": 1806, "train_runtime": 6249.8934, "train_tokens_per_second": 1431.174 }, { "epoch": 0.6646436781609195, "grad_norm": 0.3681562840938568, "learning_rate": 6.728076639646279e-05, "loss": 1.1789, "num_input_tokens_seen": 8950016, "step": 1807, "train_runtime": 6253.4018, "train_tokens_per_second": 1431.224 }, { "epoch": 0.6650114942528735, "grad_norm": 0.35245054960250854, "learning_rate": 6.720707442888726e-05, "loss": 1.3615, "num_input_tokens_seen": 8954848, "step": 1808, "train_runtime": 6256.6823, "train_tokens_per_second": 1431.245 }, { "epoch": 0.6653793103448276, "grad_norm": 0.3475450277328491, "learning_rate": 6.713338246131172e-05, "loss": 1.2396, "num_input_tokens_seen": 8959280, "step": 1809, "train_runtime": 6259.8175, "train_tokens_per_second": 1431.237 }, { "epoch": 0.6657471264367816, "grad_norm": 0.3447854518890381, "learning_rate": 6.705969049373619e-05, "loss": 1.2954, "num_input_tokens_seen": 8963472, "step": 1810, "train_runtime": 6262.7232, "train_tokens_per_second": 1431.242 }, { "epoch": 0.6661149425287356, "grad_norm": 0.3926207721233368, "learning_rate": 6.698599852616065e-05, "loss": 1.182, "num_input_tokens_seen": 8971232, "step": 1811, "train_runtime": 6267.6476, "train_tokens_per_second": 1431.356 }, { "epoch": 0.6664827586206896, "grad_norm": 0.3552563488483429, "learning_rate": 6.691230655858512e-05, "loss": 1.153, "num_input_tokens_seen": 8975536, "step": 1812, "train_runtime": 6270.6742, "train_tokens_per_second": 1431.351 }, { "epoch": 0.6668505747126436, "grad_norm": 0.3268927335739136, "learning_rate": 6.683861459100958e-05, "loss": 1.1059, "num_input_tokens_seen": 8981040, "step": 1813, "train_runtime": 6274.3463, "train_tokens_per_second": 1431.391 }, { "epoch": 0.6672183908045977, "grad_norm": 0.36756736040115356, "learning_rate": 6.676492262343405e-05, "loss": 1.1799, "num_input_tokens_seen": 8985056, "step": 1814, "train_runtime": 6277.0844, "train_tokens_per_second": 1431.406 }, { "epoch": 0.6675862068965517, "grad_norm": 0.37198054790496826, "learning_rate": 6.669123065585851e-05, "loss": 1.1645, "num_input_tokens_seen": 8989008, "step": 1815, "train_runtime": 6279.8848, "train_tokens_per_second": 1431.397 }, { "epoch": 0.6679540229885057, "grad_norm": 0.36678871512413025, "learning_rate": 6.661753868828298e-05, "loss": 1.3249, "num_input_tokens_seen": 8996080, "step": 1816, "train_runtime": 6284.3199, "train_tokens_per_second": 1431.512 }, { "epoch": 0.6683218390804597, "grad_norm": 0.33646324276924133, "learning_rate": 6.654384672070745e-05, "loss": 1.1876, "num_input_tokens_seen": 9000176, "step": 1817, "train_runtime": 6287.2273, "train_tokens_per_second": 1431.502 }, { "epoch": 0.6686896551724137, "grad_norm": 0.3421087861061096, "learning_rate": 6.64701547531319e-05, "loss": 1.3747, "num_input_tokens_seen": 9004032, "step": 1818, "train_runtime": 6290.0007, "train_tokens_per_second": 1431.483 }, { "epoch": 0.6690574712643678, "grad_norm": 0.4438786208629608, "learning_rate": 6.639646278555638e-05, "loss": 1.312, "num_input_tokens_seen": 9008288, "step": 1819, "train_runtime": 6292.9153, "train_tokens_per_second": 1431.497 }, { "epoch": 0.6694252873563218, "grad_norm": 0.339505672454834, "learning_rate": 6.632277081798083e-05, "loss": 1.1924, "num_input_tokens_seen": 9011968, "step": 1820, "train_runtime": 6295.5831, "train_tokens_per_second": 1431.475 }, { "epoch": 0.6697931034482759, "grad_norm": 0.34662675857543945, "learning_rate": 6.624907885040531e-05, "loss": 1.2922, "num_input_tokens_seen": 9015872, "step": 1821, "train_runtime": 6298.4191, "train_tokens_per_second": 1431.45 }, { "epoch": 0.6701609195402299, "grad_norm": 0.3761582374572754, "learning_rate": 6.617538688282976e-05, "loss": 1.1373, "num_input_tokens_seen": 9019824, "step": 1822, "train_runtime": 6301.2307, "train_tokens_per_second": 1431.438 }, { "epoch": 0.670528735632184, "grad_norm": 0.3703620731830597, "learning_rate": 6.610169491525424e-05, "loss": 1.1427, "num_input_tokens_seen": 9026384, "step": 1823, "train_runtime": 6305.5133, "train_tokens_per_second": 1431.507 }, { "epoch": 0.670896551724138, "grad_norm": 0.3850911259651184, "learning_rate": 6.602800294767871e-05, "loss": 1.28, "num_input_tokens_seen": 9030576, "step": 1824, "train_runtime": 6308.3937, "train_tokens_per_second": 1431.518 }, { "epoch": 0.671264367816092, "grad_norm": 0.3600991368293762, "learning_rate": 6.595431098010317e-05, "loss": 1.2281, "num_input_tokens_seen": 9036560, "step": 1825, "train_runtime": 6312.2085, "train_tokens_per_second": 1431.6 }, { "epoch": 0.671632183908046, "grad_norm": 0.3798394203186035, "learning_rate": 6.588061901252764e-05, "loss": 1.3111, "num_input_tokens_seen": 9040352, "step": 1826, "train_runtime": 6314.8561, "train_tokens_per_second": 1431.601 }, { "epoch": 0.672, "grad_norm": 0.4036741852760315, "learning_rate": 6.58069270449521e-05, "loss": 1.2882, "num_input_tokens_seen": 9046352, "step": 1827, "train_runtime": 6318.8109, "train_tokens_per_second": 1431.654 }, { "epoch": 0.6723678160919541, "grad_norm": 0.3849335014820099, "learning_rate": 6.573323507737657e-05, "loss": 1.1751, "num_input_tokens_seen": 9049760, "step": 1828, "train_runtime": 6321.3295, "train_tokens_per_second": 1431.623 }, { "epoch": 0.6727356321839081, "grad_norm": 0.3657708466053009, "learning_rate": 6.565954310980103e-05, "loss": 1.2536, "num_input_tokens_seen": 9053680, "step": 1829, "train_runtime": 6324.0259, "train_tokens_per_second": 1431.632 }, { "epoch": 0.6731034482758621, "grad_norm": 0.4086407721042633, "learning_rate": 6.55858511422255e-05, "loss": 1.4151, "num_input_tokens_seen": 9057600, "step": 1830, "train_runtime": 6326.8135, "train_tokens_per_second": 1431.621 }, { "epoch": 0.6734712643678161, "grad_norm": 0.3436093032360077, "learning_rate": 6.551215917464996e-05, "loss": 1.1478, "num_input_tokens_seen": 9062992, "step": 1831, "train_runtime": 6332.6858, "train_tokens_per_second": 1431.145 }, { "epoch": 0.6738390804597701, "grad_norm": 0.3341924846172333, "learning_rate": 6.543846720707443e-05, "loss": 1.1927, "num_input_tokens_seen": 9066352, "step": 1832, "train_runtime": 6335.1493, "train_tokens_per_second": 1431.119 }, { "epoch": 0.6742068965517242, "grad_norm": 0.36981868743896484, "learning_rate": 6.53647752394989e-05, "loss": 1.2557, "num_input_tokens_seen": 9070304, "step": 1833, "train_runtime": 6337.9877, "train_tokens_per_second": 1431.102 }, { "epoch": 0.6745747126436782, "grad_norm": 0.3636479675769806, "learning_rate": 6.529108327192336e-05, "loss": 1.3673, "num_input_tokens_seen": 9074496, "step": 1834, "train_runtime": 6340.9341, "train_tokens_per_second": 1431.098 }, { "epoch": 0.6749425287356322, "grad_norm": 0.38223516941070557, "learning_rate": 6.521739130434783e-05, "loss": 1.1859, "num_input_tokens_seen": 9078144, "step": 1835, "train_runtime": 6343.5448, "train_tokens_per_second": 1431.084 }, { "epoch": 0.6753103448275862, "grad_norm": 0.37790757417678833, "learning_rate": 6.514369933677229e-05, "loss": 1.304, "num_input_tokens_seen": 9081648, "step": 1836, "train_runtime": 6346.127, "train_tokens_per_second": 1431.054 }, { "epoch": 0.6756781609195402, "grad_norm": 0.4128868877887726, "learning_rate": 6.507000736919676e-05, "loss": 1.2607, "num_input_tokens_seen": 9085184, "step": 1837, "train_runtime": 6348.6613, "train_tokens_per_second": 1431.039 }, { "epoch": 0.6760459770114943, "grad_norm": 0.3606361746788025, "learning_rate": 6.499631540162123e-05, "loss": 1.2152, "num_input_tokens_seen": 9089296, "step": 1838, "train_runtime": 6351.5085, "train_tokens_per_second": 1431.045 }, { "epoch": 0.6764137931034483, "grad_norm": 0.369467556476593, "learning_rate": 6.492262343404569e-05, "loss": 1.2048, "num_input_tokens_seen": 9098016, "step": 1839, "train_runtime": 6356.8465, "train_tokens_per_second": 1431.215 }, { "epoch": 0.6767816091954023, "grad_norm": 0.3669975996017456, "learning_rate": 6.484893146647016e-05, "loss": 1.1768, "num_input_tokens_seen": 9103168, "step": 1840, "train_runtime": 6360.2995, "train_tokens_per_second": 1431.248 }, { "epoch": 0.6771494252873563, "grad_norm": 0.3667323887348175, "learning_rate": 6.477523949889462e-05, "loss": 1.1826, "num_input_tokens_seen": 9107904, "step": 1841, "train_runtime": 6363.5143, "train_tokens_per_second": 1431.27 }, { "epoch": 0.6775172413793104, "grad_norm": 0.372950941324234, "learning_rate": 6.470154753131909e-05, "loss": 1.2482, "num_input_tokens_seen": 9111808, "step": 1842, "train_runtime": 6366.4978, "train_tokens_per_second": 1431.212 }, { "epoch": 0.6778850574712644, "grad_norm": 0.34295400977134705, "learning_rate": 6.462785556374355e-05, "loss": 1.1972, "num_input_tokens_seen": 9115616, "step": 1843, "train_runtime": 6369.2423, "train_tokens_per_second": 1431.193 }, { "epoch": 0.6782528735632184, "grad_norm": 0.35535502433776855, "learning_rate": 6.455416359616802e-05, "loss": 1.155, "num_input_tokens_seen": 9120000, "step": 1844, "train_runtime": 6372.2647, "train_tokens_per_second": 1431.202 }, { "epoch": 0.6786206896551724, "grad_norm": 0.3609297275543213, "learning_rate": 6.448047162859248e-05, "loss": 1.1983, "num_input_tokens_seen": 9125168, "step": 1845, "train_runtime": 6375.7512, "train_tokens_per_second": 1431.23 }, { "epoch": 0.6789885057471264, "grad_norm": 0.3910728693008423, "learning_rate": 6.440677966101695e-05, "loss": 1.376, "num_input_tokens_seen": 9130928, "step": 1846, "train_runtime": 6379.5748, "train_tokens_per_second": 1431.275 }, { "epoch": 0.6793563218390805, "grad_norm": 0.34996485710144043, "learning_rate": 6.433308769344141e-05, "loss": 1.2125, "num_input_tokens_seen": 9134880, "step": 1847, "train_runtime": 6382.3282, "train_tokens_per_second": 1431.277 }, { "epoch": 0.6797241379310345, "grad_norm": 0.36965256929397583, "learning_rate": 6.425939572586588e-05, "loss": 1.1865, "num_input_tokens_seen": 9139920, "step": 1848, "train_runtime": 6385.626, "train_tokens_per_second": 1431.327 }, { "epoch": 0.6800919540229885, "grad_norm": 0.36250296235084534, "learning_rate": 6.418570375829035e-05, "loss": 1.2429, "num_input_tokens_seen": 9144064, "step": 1849, "train_runtime": 6388.5808, "train_tokens_per_second": 1431.314 }, { "epoch": 0.6804597701149425, "grad_norm": 0.40359920263290405, "learning_rate": 6.41120117907148e-05, "loss": 1.2092, "num_input_tokens_seen": 9148256, "step": 1850, "train_runtime": 6391.5033, "train_tokens_per_second": 1431.315 }, { "epoch": 0.6808275862068965, "grad_norm": 0.4024823307991028, "learning_rate": 6.403831982313928e-05, "loss": 1.1363, "num_input_tokens_seen": 9154480, "step": 1851, "train_runtime": 6395.5385, "train_tokens_per_second": 1431.385 }, { "epoch": 0.6811954022988506, "grad_norm": 0.37563154101371765, "learning_rate": 6.396462785556374e-05, "loss": 1.0199, "num_input_tokens_seen": 9161280, "step": 1852, "train_runtime": 6400.1541, "train_tokens_per_second": 1431.416 }, { "epoch": 0.6815632183908046, "grad_norm": 0.38258638978004456, "learning_rate": 6.389093588798821e-05, "loss": 1.2741, "num_input_tokens_seen": 9166544, "step": 1853, "train_runtime": 6403.696, "train_tokens_per_second": 1431.446 }, { "epoch": 0.6819310344827586, "grad_norm": 0.37171056866645813, "learning_rate": 6.381724392041268e-05, "loss": 1.2824, "num_input_tokens_seen": 9170240, "step": 1854, "train_runtime": 6406.3479, "train_tokens_per_second": 1431.43 }, { "epoch": 0.6822988505747126, "grad_norm": 0.36011645197868347, "learning_rate": 6.374355195283714e-05, "loss": 1.1489, "num_input_tokens_seen": 9175040, "step": 1855, "train_runtime": 6409.6583, "train_tokens_per_second": 1431.44 }, { "epoch": 0.6826666666666666, "grad_norm": 0.37741726636886597, "learning_rate": 6.366985998526161e-05, "loss": 1.1609, "num_input_tokens_seen": 9179296, "step": 1856, "train_runtime": 6412.5882, "train_tokens_per_second": 1431.449 }, { "epoch": 0.6830344827586207, "grad_norm": 0.35376110672950745, "learning_rate": 6.359616801768607e-05, "loss": 1.2731, "num_input_tokens_seen": 9183008, "step": 1857, "train_runtime": 6415.1709, "train_tokens_per_second": 1431.452 }, { "epoch": 0.6834022988505747, "grad_norm": 0.35565951466560364, "learning_rate": 6.352247605011055e-05, "loss": 1.2774, "num_input_tokens_seen": 9186608, "step": 1858, "train_runtime": 6417.6818, "train_tokens_per_second": 1431.453 }, { "epoch": 0.6837701149425287, "grad_norm": 0.34637174010276794, "learning_rate": 6.3448784082535e-05, "loss": 1.0784, "num_input_tokens_seen": 9190896, "step": 1859, "train_runtime": 6420.6898, "train_tokens_per_second": 1431.45 }, { "epoch": 0.6841379310344827, "grad_norm": 0.3382808268070221, "learning_rate": 6.337509211495948e-05, "loss": 1.1368, "num_input_tokens_seen": 9196160, "step": 1860, "train_runtime": 6424.2139, "train_tokens_per_second": 1431.484 }, { "epoch": 0.6845057471264367, "grad_norm": 0.3636821210384369, "learning_rate": 6.330140014738393e-05, "loss": 1.0651, "num_input_tokens_seen": 9200048, "step": 1861, "train_runtime": 6428.9818, "train_tokens_per_second": 1431.027 }, { "epoch": 0.6848735632183908, "grad_norm": 0.3772403597831726, "learning_rate": 6.322770817980841e-05, "loss": 1.1643, "num_input_tokens_seen": 9206688, "step": 1862, "train_runtime": 6433.2295, "train_tokens_per_second": 1431.114 }, { "epoch": 0.6852413793103448, "grad_norm": 0.3455715775489807, "learning_rate": 6.315401621223288e-05, "loss": 1.1697, "num_input_tokens_seen": 9211296, "step": 1863, "train_runtime": 6436.3186, "train_tokens_per_second": 1431.144 }, { "epoch": 0.6856091954022988, "grad_norm": 0.32315951585769653, "learning_rate": 6.308032424465734e-05, "loss": 1.2082, "num_input_tokens_seen": 9219232, "step": 1864, "train_runtime": 6441.1762, "train_tokens_per_second": 1431.296 }, { "epoch": 0.6859770114942528, "grad_norm": 0.35601308941841125, "learning_rate": 6.30066322770818e-05, "loss": 1.1205, "num_input_tokens_seen": 9223504, "step": 1865, "train_runtime": 6444.1893, "train_tokens_per_second": 1431.29 }, { "epoch": 0.6863448275862069, "grad_norm": 0.3578878343105316, "learning_rate": 6.293294030950627e-05, "loss": 1.3482, "num_input_tokens_seen": 9228288, "step": 1866, "train_runtime": 6447.4622, "train_tokens_per_second": 1431.305 }, { "epoch": 0.6867126436781609, "grad_norm": 0.38044896721839905, "learning_rate": 6.285924834193074e-05, "loss": 1.2671, "num_input_tokens_seen": 9232192, "step": 1867, "train_runtime": 6450.2302, "train_tokens_per_second": 1431.297 }, { "epoch": 0.6870804597701149, "grad_norm": 0.35539358854293823, "learning_rate": 6.27855563743552e-05, "loss": 1.0913, "num_input_tokens_seen": 9237776, "step": 1868, "train_runtime": 6453.8758, "train_tokens_per_second": 1431.353 }, { "epoch": 0.6874482758620689, "grad_norm": 0.4087512195110321, "learning_rate": 6.271186440677966e-05, "loss": 1.4946, "num_input_tokens_seen": 9244736, "step": 1869, "train_runtime": 6458.3793, "train_tokens_per_second": 1431.433 }, { "epoch": 0.6878160919540229, "grad_norm": 0.38253363966941833, "learning_rate": 6.263817243920413e-05, "loss": 1.1972, "num_input_tokens_seen": 9250560, "step": 1870, "train_runtime": 6462.1429, "train_tokens_per_second": 1431.5 }, { "epoch": 0.6881839080459771, "grad_norm": 0.33830374479293823, "learning_rate": 6.25644804716286e-05, "loss": 1.0928, "num_input_tokens_seen": 9255024, "step": 1871, "train_runtime": 6465.1691, "train_tokens_per_second": 1431.521 }, { "epoch": 0.6885517241379311, "grad_norm": 0.3524548411369324, "learning_rate": 6.249078850405306e-05, "loss": 1.274, "num_input_tokens_seen": 9258224, "step": 1872, "train_runtime": 6467.5569, "train_tokens_per_second": 1431.487 }, { "epoch": 0.6889195402298851, "grad_norm": 0.38763436675071716, "learning_rate": 6.241709653647752e-05, "loss": 1.0899, "num_input_tokens_seen": 9262272, "step": 1873, "train_runtime": 6470.3487, "train_tokens_per_second": 1431.495 }, { "epoch": 0.6892873563218391, "grad_norm": 0.3447798490524292, "learning_rate": 6.2343404568902e-05, "loss": 1.1273, "num_input_tokens_seen": 9267568, "step": 1874, "train_runtime": 6473.9055, "train_tokens_per_second": 1431.527 }, { "epoch": 0.6896551724137931, "grad_norm": 0.34311696887016296, "learning_rate": 6.226971260132645e-05, "loss": 1.1664, "num_input_tokens_seen": 9272192, "step": 1875, "train_runtime": 6477.063, "train_tokens_per_second": 1431.543 }, { "epoch": 0.6900229885057472, "grad_norm": 0.3738171458244324, "learning_rate": 6.219602063375093e-05, "loss": 1.3383, "num_input_tokens_seen": 9276832, "step": 1876, "train_runtime": 6480.2122, "train_tokens_per_second": 1431.563 }, { "epoch": 0.6903908045977012, "grad_norm": 0.3437025845050812, "learning_rate": 6.212232866617538e-05, "loss": 1.2243, "num_input_tokens_seen": 9282960, "step": 1877, "train_runtime": 6484.2288, "train_tokens_per_second": 1431.621 }, { "epoch": 0.6907586206896552, "grad_norm": 0.3527766466140747, "learning_rate": 6.204863669859986e-05, "loss": 1.2312, "num_input_tokens_seen": 9286672, "step": 1878, "train_runtime": 6486.8531, "train_tokens_per_second": 1431.614 }, { "epoch": 0.6911264367816092, "grad_norm": 0.34566250443458557, "learning_rate": 6.197494473102433e-05, "loss": 1.1619, "num_input_tokens_seen": 9291568, "step": 1879, "train_runtime": 6490.0455, "train_tokens_per_second": 1431.665 }, { "epoch": 0.6914942528735633, "grad_norm": 0.3459474742412567, "learning_rate": 6.190125276344879e-05, "loss": 1.281, "num_input_tokens_seen": 9294944, "step": 1880, "train_runtime": 6492.5178, "train_tokens_per_second": 1431.639 }, { "epoch": 0.6918620689655173, "grad_norm": 0.3621971905231476, "learning_rate": 6.182756079587326e-05, "loss": 1.2377, "num_input_tokens_seen": 9298144, "step": 1881, "train_runtime": 6494.946, "train_tokens_per_second": 1431.597 }, { "epoch": 0.6922298850574713, "grad_norm": 0.3718065023422241, "learning_rate": 6.175386882829772e-05, "loss": 1.1842, "num_input_tokens_seen": 9302624, "step": 1882, "train_runtime": 6498.0336, "train_tokens_per_second": 1431.606 }, { "epoch": 0.6925977011494253, "grad_norm": 0.3204992115497589, "learning_rate": 6.168017686072219e-05, "loss": 1.0915, "num_input_tokens_seen": 9308000, "step": 1883, "train_runtime": 6501.6177, "train_tokens_per_second": 1431.644 }, { "epoch": 0.6929655172413793, "grad_norm": 0.3641936480998993, "learning_rate": 6.160648489314665e-05, "loss": 1.2156, "num_input_tokens_seen": 9314032, "step": 1884, "train_runtime": 6505.5074, "train_tokens_per_second": 1431.715 }, { "epoch": 0.6933333333333334, "grad_norm": 0.33905354142189026, "learning_rate": 6.153279292557112e-05, "loss": 1.255, "num_input_tokens_seen": 9317776, "step": 1885, "train_runtime": 6508.1929, "train_tokens_per_second": 1431.699 }, { "epoch": 0.6937011494252874, "grad_norm": 0.3809105455875397, "learning_rate": 6.145910095799558e-05, "loss": 1.1799, "num_input_tokens_seen": 9324080, "step": 1886, "train_runtime": 6512.2401, "train_tokens_per_second": 1431.778 }, { "epoch": 0.6940689655172414, "grad_norm": 0.4171127676963806, "learning_rate": 6.138540899042005e-05, "loss": 1.2886, "num_input_tokens_seen": 9327216, "step": 1887, "train_runtime": 6514.6094, "train_tokens_per_second": 1431.738 }, { "epoch": 0.6944367816091954, "grad_norm": 0.3351636528968811, "learning_rate": 6.131171702284452e-05, "loss": 1.1496, "num_input_tokens_seen": 9331952, "step": 1888, "train_runtime": 6517.8359, "train_tokens_per_second": 1431.756 }, { "epoch": 0.6948045977011494, "grad_norm": 0.34816426038742065, "learning_rate": 6.123802505526897e-05, "loss": 1.1456, "num_input_tokens_seen": 9337376, "step": 1889, "train_runtime": 6521.3646, "train_tokens_per_second": 1431.813 }, { "epoch": 0.6951724137931035, "grad_norm": 0.33218374848365784, "learning_rate": 6.116433308769345e-05, "loss": 1.053, "num_input_tokens_seen": 9342416, "step": 1890, "train_runtime": 6524.7475, "train_tokens_per_second": 1431.843 }, { "epoch": 0.6955402298850575, "grad_norm": 0.37147361040115356, "learning_rate": 6.10906411201179e-05, "loss": 1.1641, "num_input_tokens_seen": 9350512, "step": 1891, "train_runtime": 6531.6901, "train_tokens_per_second": 1431.561 }, { "epoch": 0.6959080459770115, "grad_norm": 0.377197265625, "learning_rate": 6.101694915254238e-05, "loss": 1.2976, "num_input_tokens_seen": 9357072, "step": 1892, "train_runtime": 6535.9712, "train_tokens_per_second": 1431.627 }, { "epoch": 0.6962758620689655, "grad_norm": 0.3650781810283661, "learning_rate": 6.094325718496684e-05, "loss": 1.1569, "num_input_tokens_seen": 9361984, "step": 1893, "train_runtime": 6539.3028, "train_tokens_per_second": 1431.649 }, { "epoch": 0.6966436781609195, "grad_norm": 0.34893959760665894, "learning_rate": 6.086956521739131e-05, "loss": 1.1522, "num_input_tokens_seen": 9367536, "step": 1894, "train_runtime": 6542.9072, "train_tokens_per_second": 1431.709 }, { "epoch": 0.6970114942528736, "grad_norm": 0.35472455620765686, "learning_rate": 6.079587324981577e-05, "loss": 1.134, "num_input_tokens_seen": 9372240, "step": 1895, "train_runtime": 6546.0875, "train_tokens_per_second": 1431.732 }, { "epoch": 0.6973793103448276, "grad_norm": 0.3683747947216034, "learning_rate": 6.072218128224024e-05, "loss": 1.1356, "num_input_tokens_seen": 9376096, "step": 1896, "train_runtime": 6548.8341, "train_tokens_per_second": 1431.72 }, { "epoch": 0.6977471264367816, "grad_norm": 0.34663519263267517, "learning_rate": 6.06484893146647e-05, "loss": 1.0954, "num_input_tokens_seen": 9381408, "step": 1897, "train_runtime": 6552.3427, "train_tokens_per_second": 1431.764 }, { "epoch": 0.6981149425287356, "grad_norm": 0.38044968247413635, "learning_rate": 6.057479734708917e-05, "loss": 1.1224, "num_input_tokens_seen": 9386816, "step": 1898, "train_runtime": 6555.9786, "train_tokens_per_second": 1431.795 }, { "epoch": 0.6984827586206896, "grad_norm": 0.3662697970867157, "learning_rate": 6.050110537951364e-05, "loss": 1.2003, "num_input_tokens_seen": 9391200, "step": 1899, "train_runtime": 6559.042, "train_tokens_per_second": 1431.794 }, { "epoch": 0.6988505747126437, "grad_norm": 0.33618733286857605, "learning_rate": 6.042741341193811e-05, "loss": 1.1694, "num_input_tokens_seen": 9395264, "step": 1900, "train_runtime": 6561.8635, "train_tokens_per_second": 1431.798 }, { "epoch": 0.6992183908045977, "grad_norm": 0.40789663791656494, "learning_rate": 6.0353721444362566e-05, "loss": 1.1237, "num_input_tokens_seen": 9398848, "step": 1901, "train_runtime": 6564.4486, "train_tokens_per_second": 1431.78 }, { "epoch": 0.6995862068965517, "grad_norm": 0.36087027192115784, "learning_rate": 6.028002947678704e-05, "loss": 1.082, "num_input_tokens_seen": 9402144, "step": 1902, "train_runtime": 6566.94, "train_tokens_per_second": 1431.739 }, { "epoch": 0.6999540229885057, "grad_norm": 0.36859339475631714, "learning_rate": 6.0206337509211496e-05, "loss": 1.1294, "num_input_tokens_seen": 9407472, "step": 1903, "train_runtime": 6570.4776, "train_tokens_per_second": 1431.779 }, { "epoch": 0.7003218390804598, "grad_norm": 0.3652470111846924, "learning_rate": 6.013264554163597e-05, "loss": 1.1833, "num_input_tokens_seen": 9414960, "step": 1904, "train_runtime": 6575.2716, "train_tokens_per_second": 1431.874 }, { "epoch": 0.7003218390804598, "eval_loss": 1.2160385847091675, "eval_runtime": 15.4936, "eval_samples_per_second": 64.543, "eval_steps_per_second": 4.066, "num_input_tokens_seen": 9414960, "step": 1904 }, { "epoch": 0.7006896551724138, "grad_norm": 0.3549385666847229, "learning_rate": 6.0058953574060426e-05, "loss": 1.0774, "num_input_tokens_seen": 9419824, "step": 1905, "train_runtime": 6594.1029, "train_tokens_per_second": 1428.522 }, { "epoch": 0.7010574712643678, "grad_norm": 0.40111044049263, "learning_rate": 5.99852616064849e-05, "loss": 1.3336, "num_input_tokens_seen": 9426320, "step": 1906, "train_runtime": 6598.2909, "train_tokens_per_second": 1428.6 }, { "epoch": 0.7014252873563218, "grad_norm": 0.3566766679286957, "learning_rate": 5.991156963890936e-05, "loss": 1.2749, "num_input_tokens_seen": 9433712, "step": 1907, "train_runtime": 6602.9706, "train_tokens_per_second": 1428.707 }, { "epoch": 0.7017931034482758, "grad_norm": 0.34691503643989563, "learning_rate": 5.9837877671333834e-05, "loss": 1.2687, "num_input_tokens_seen": 9437584, "step": 1908, "train_runtime": 6605.7028, "train_tokens_per_second": 1428.702 }, { "epoch": 0.7021609195402299, "grad_norm": 0.3621295690536499, "learning_rate": 5.976418570375829e-05, "loss": 1.0866, "num_input_tokens_seen": 9442336, "step": 1909, "train_runtime": 6608.9436, "train_tokens_per_second": 1428.721 }, { "epoch": 0.7025287356321839, "grad_norm": 0.3740859925746918, "learning_rate": 5.969049373618276e-05, "loss": 1.2191, "num_input_tokens_seen": 9447008, "step": 1910, "train_runtime": 6612.1062, "train_tokens_per_second": 1428.744 }, { "epoch": 0.7028965517241379, "grad_norm": 0.36735615134239197, "learning_rate": 5.961680176860722e-05, "loss": 1.408, "num_input_tokens_seen": 9453824, "step": 1911, "train_runtime": 6616.5543, "train_tokens_per_second": 1428.814 }, { "epoch": 0.7032643678160919, "grad_norm": 0.33453720808029175, "learning_rate": 5.954310980103169e-05, "loss": 1.018, "num_input_tokens_seen": 9458240, "step": 1912, "train_runtime": 6619.5646, "train_tokens_per_second": 1428.831 }, { "epoch": 0.7036321839080459, "grad_norm": 0.3643985986709595, "learning_rate": 5.946941783345615e-05, "loss": 1.2118, "num_input_tokens_seen": 9463200, "step": 1913, "train_runtime": 6622.9093, "train_tokens_per_second": 1428.858 }, { "epoch": 0.704, "grad_norm": 0.3474371135234833, "learning_rate": 5.939572586588062e-05, "loss": 1.0819, "num_input_tokens_seen": 9467536, "step": 1914, "train_runtime": 6625.8575, "train_tokens_per_second": 1428.877 }, { "epoch": 0.704367816091954, "grad_norm": 0.36465346813201904, "learning_rate": 5.932203389830509e-05, "loss": 1.2481, "num_input_tokens_seen": 9471808, "step": 1915, "train_runtime": 6628.8327, "train_tokens_per_second": 1428.88 }, { "epoch": 0.704735632183908, "grad_norm": 0.35101088881492615, "learning_rate": 5.924834193072956e-05, "loss": 1.2469, "num_input_tokens_seen": 9478512, "step": 1916, "train_runtime": 6633.1398, "train_tokens_per_second": 1428.963 }, { "epoch": 0.705103448275862, "grad_norm": 0.3579235076904297, "learning_rate": 5.917464996315402e-05, "loss": 1.0934, "num_input_tokens_seen": 9483392, "step": 1917, "train_runtime": 6636.3826, "train_tokens_per_second": 1429.0 }, { "epoch": 0.705471264367816, "grad_norm": 0.38996049761772156, "learning_rate": 5.910095799557849e-05, "loss": 1.29, "num_input_tokens_seen": 9487472, "step": 1918, "train_runtime": 6639.2459, "train_tokens_per_second": 1428.998 }, { "epoch": 0.7058390804597701, "grad_norm": 0.35924428701400757, "learning_rate": 5.902726602800295e-05, "loss": 1.2439, "num_input_tokens_seen": 9494416, "step": 1919, "train_runtime": 6643.6823, "train_tokens_per_second": 1429.089 }, { "epoch": 0.7062068965517241, "grad_norm": 0.3391769230365753, "learning_rate": 5.895357406042742e-05, "loss": 1.12, "num_input_tokens_seen": 9501152, "step": 1920, "train_runtime": 6647.8737, "train_tokens_per_second": 1429.202 }, { "epoch": 0.7065747126436782, "grad_norm": 0.34716150164604187, "learning_rate": 5.8879882092851876e-05, "loss": 1.1751, "num_input_tokens_seen": 9506160, "step": 1921, "train_runtime": 6653.1794, "train_tokens_per_second": 1428.815 }, { "epoch": 0.7069425287356322, "grad_norm": 0.36143097281455994, "learning_rate": 5.880619012527635e-05, "loss": 1.3488, "num_input_tokens_seen": 9510160, "step": 1922, "train_runtime": 6655.9287, "train_tokens_per_second": 1428.825 }, { "epoch": 0.7073103448275863, "grad_norm": 0.3692696690559387, "learning_rate": 5.873249815770081e-05, "loss": 1.2048, "num_input_tokens_seen": 9515392, "step": 1923, "train_runtime": 6659.3707, "train_tokens_per_second": 1428.873 }, { "epoch": 0.7076781609195403, "grad_norm": 0.35383716225624084, "learning_rate": 5.8658806190125284e-05, "loss": 1.2238, "num_input_tokens_seen": 9519216, "step": 1924, "train_runtime": 6662.0237, "train_tokens_per_second": 1428.878 }, { "epoch": 0.7080459770114943, "grad_norm": 0.37925904989242554, "learning_rate": 5.858511422254974e-05, "loss": 1.2483, "num_input_tokens_seen": 9522752, "step": 1925, "train_runtime": 6664.6275, "train_tokens_per_second": 1428.85 }, { "epoch": 0.7084137931034483, "grad_norm": 0.33492371439933777, "learning_rate": 5.8511422254974214e-05, "loss": 1.2185, "num_input_tokens_seen": 9530688, "step": 1926, "train_runtime": 6669.6051, "train_tokens_per_second": 1428.973 }, { "epoch": 0.7087816091954023, "grad_norm": 0.36645299196243286, "learning_rate": 5.843773028739867e-05, "loss": 1.115, "num_input_tokens_seen": 9534176, "step": 1927, "train_runtime": 6672.1486, "train_tokens_per_second": 1428.951 }, { "epoch": 0.7091494252873564, "grad_norm": 0.33114898204803467, "learning_rate": 5.8364038319823144e-05, "loss": 1.0731, "num_input_tokens_seen": 9537760, "step": 1928, "train_runtime": 6674.7271, "train_tokens_per_second": 1428.936 }, { "epoch": 0.7095172413793104, "grad_norm": 0.36399704217910767, "learning_rate": 5.82903463522476e-05, "loss": 1.1155, "num_input_tokens_seen": 9546368, "step": 1929, "train_runtime": 6680.0861, "train_tokens_per_second": 1429.079 }, { "epoch": 0.7098850574712644, "grad_norm": 0.3734672963619232, "learning_rate": 5.821665438467207e-05, "loss": 1.1804, "num_input_tokens_seen": 9550528, "step": 1930, "train_runtime": 6682.9829, "train_tokens_per_second": 1429.082 }, { "epoch": 0.7102528735632184, "grad_norm": 0.3941843509674072, "learning_rate": 5.814296241709654e-05, "loss": 1.1189, "num_input_tokens_seen": 9554112, "step": 1931, "train_runtime": 6685.616, "train_tokens_per_second": 1429.055 }, { "epoch": 0.7106206896551724, "grad_norm": 0.3478284478187561, "learning_rate": 5.806927044952101e-05, "loss": 1.139, "num_input_tokens_seen": 9560208, "step": 1932, "train_runtime": 6689.5866, "train_tokens_per_second": 1429.118 }, { "epoch": 0.7109885057471265, "grad_norm": 0.37273889780044556, "learning_rate": 5.799557848194547e-05, "loss": 1.2675, "num_input_tokens_seen": 9565504, "step": 1933, "train_runtime": 6693.0761, "train_tokens_per_second": 1429.164 }, { "epoch": 0.7113563218390805, "grad_norm": 0.33759135007858276, "learning_rate": 5.792188651436994e-05, "loss": 1.0943, "num_input_tokens_seen": 9569184, "step": 1934, "train_runtime": 6695.7085, "train_tokens_per_second": 1429.152 }, { "epoch": 0.7117241379310345, "grad_norm": 0.3741821348667145, "learning_rate": 5.78481945467944e-05, "loss": 1.3709, "num_input_tokens_seen": 9572320, "step": 1935, "train_runtime": 6698.0788, "train_tokens_per_second": 1429.114 }, { "epoch": 0.7120919540229885, "grad_norm": 0.36867663264274597, "learning_rate": 5.777450257921887e-05, "loss": 1.0813, "num_input_tokens_seen": 9577968, "step": 1936, "train_runtime": 6701.775, "train_tokens_per_second": 1429.169 }, { "epoch": 0.7124597701149425, "grad_norm": 0.33169442415237427, "learning_rate": 5.770081061164333e-05, "loss": 1.0825, "num_input_tokens_seen": 9581776, "step": 1937, "train_runtime": 6704.4381, "train_tokens_per_second": 1429.169 }, { "epoch": 0.7128275862068966, "grad_norm": 0.35956621170043945, "learning_rate": 5.76271186440678e-05, "loss": 1.2338, "num_input_tokens_seen": 9585360, "step": 1938, "train_runtime": 6707.0328, "train_tokens_per_second": 1429.151 }, { "epoch": 0.7131954022988506, "grad_norm": 0.36173951625823975, "learning_rate": 5.7553426676492263e-05, "loss": 1.1735, "num_input_tokens_seen": 9591344, "step": 1939, "train_runtime": 6710.918, "train_tokens_per_second": 1429.215 }, { "epoch": 0.7135632183908046, "grad_norm": 0.4012773931026459, "learning_rate": 5.7479734708916735e-05, "loss": 1.2553, "num_input_tokens_seen": 9595280, "step": 1940, "train_runtime": 6713.7203, "train_tokens_per_second": 1429.205 }, { "epoch": 0.7139310344827586, "grad_norm": 0.36968138813972473, "learning_rate": 5.740604274134119e-05, "loss": 1.0821, "num_input_tokens_seen": 9599344, "step": 1941, "train_runtime": 6716.5218, "train_tokens_per_second": 1429.214 }, { "epoch": 0.7142988505747127, "grad_norm": 0.3253781795501709, "learning_rate": 5.7332350773765665e-05, "loss": 1.2087, "num_input_tokens_seen": 9604096, "step": 1942, "train_runtime": 6719.7493, "train_tokens_per_second": 1429.234 }, { "epoch": 0.7146666666666667, "grad_norm": 0.34529078006744385, "learning_rate": 5.725865880619012e-05, "loss": 1.2329, "num_input_tokens_seen": 9611168, "step": 1943, "train_runtime": 6724.193, "train_tokens_per_second": 1429.341 }, { "epoch": 0.7150344827586207, "grad_norm": 0.31104111671447754, "learning_rate": 5.7184966838614594e-05, "loss": 1.1661, "num_input_tokens_seen": 9619568, "step": 1944, "train_runtime": 6729.3699, "train_tokens_per_second": 1429.49 }, { "epoch": 0.7154022988505747, "grad_norm": 0.36981260776519775, "learning_rate": 5.711127487103905e-05, "loss": 1.2791, "num_input_tokens_seen": 9622624, "step": 1945, "train_runtime": 6731.669, "train_tokens_per_second": 1429.456 }, { "epoch": 0.7157701149425287, "grad_norm": 0.3541151285171509, "learning_rate": 5.7037582903463524e-05, "loss": 1.2053, "num_input_tokens_seen": 9626432, "step": 1946, "train_runtime": 6734.3535, "train_tokens_per_second": 1429.452 }, { "epoch": 0.7161379310344828, "grad_norm": 0.38977038860321045, "learning_rate": 5.696389093588799e-05, "loss": 1.2271, "num_input_tokens_seen": 9631600, "step": 1947, "train_runtime": 6737.8178, "train_tokens_per_second": 1429.484 }, { "epoch": 0.7165057471264368, "grad_norm": 0.3207605481147766, "learning_rate": 5.689019896831246e-05, "loss": 1.1311, "num_input_tokens_seen": 9634656, "step": 1948, "train_runtime": 6740.1266, "train_tokens_per_second": 1429.447 }, { "epoch": 0.7168735632183908, "grad_norm": 0.36478957533836365, "learning_rate": 5.681650700073692e-05, "loss": 1.3074, "num_input_tokens_seen": 9639008, "step": 1949, "train_runtime": 6743.1415, "train_tokens_per_second": 1429.454 }, { "epoch": 0.7172413793103448, "grad_norm": 0.3832957446575165, "learning_rate": 5.674281503316139e-05, "loss": 0.978, "num_input_tokens_seen": 9644464, "step": 1950, "train_runtime": 6746.6232, "train_tokens_per_second": 1429.525 }, { "epoch": 0.7176091954022988, "grad_norm": 0.3567690849304199, "learning_rate": 5.666912306558585e-05, "loss": 1.2101, "num_input_tokens_seen": 9650656, "step": 1951, "train_runtime": 6752.649, "train_tokens_per_second": 1429.166 }, { "epoch": 0.7179770114942529, "grad_norm": 0.30054405331611633, "learning_rate": 5.659543109801032e-05, "loss": 1.1557, "num_input_tokens_seen": 9656368, "step": 1952, "train_runtime": 6756.4971, "train_tokens_per_second": 1429.197 }, { "epoch": 0.7183448275862069, "grad_norm": 0.3316233456134796, "learning_rate": 5.652173913043478e-05, "loss": 0.9968, "num_input_tokens_seen": 9662848, "step": 1953, "train_runtime": 6760.6282, "train_tokens_per_second": 1429.283 }, { "epoch": 0.7187126436781609, "grad_norm": 0.38092342019081116, "learning_rate": 5.644804716285925e-05, "loss": 1.2992, "num_input_tokens_seen": 9666080, "step": 1954, "train_runtime": 6763.012, "train_tokens_per_second": 1429.257 }, { "epoch": 0.7190804597701149, "grad_norm": 0.3728266656398773, "learning_rate": 5.6374355195283714e-05, "loss": 1.3001, "num_input_tokens_seen": 9670416, "step": 1955, "train_runtime": 6766.0335, "train_tokens_per_second": 1429.259 }, { "epoch": 0.7194482758620689, "grad_norm": 0.3573281764984131, "learning_rate": 5.6300663227708186e-05, "loss": 1.0498, "num_input_tokens_seen": 9675520, "step": 1956, "train_runtime": 6769.5092, "train_tokens_per_second": 1429.279 }, { "epoch": 0.719816091954023, "grad_norm": 0.3668102025985718, "learning_rate": 5.6226971260132644e-05, "loss": 1.3063, "num_input_tokens_seen": 9679248, "step": 1957, "train_runtime": 6772.1412, "train_tokens_per_second": 1429.274 }, { "epoch": 0.720183908045977, "grad_norm": 0.3725837171077728, "learning_rate": 5.6153279292557115e-05, "loss": 1.2212, "num_input_tokens_seen": 9683536, "step": 1958, "train_runtime": 6775.0333, "train_tokens_per_second": 1429.297 }, { "epoch": 0.720551724137931, "grad_norm": 0.37918996810913086, "learning_rate": 5.607958732498157e-05, "loss": 1.1328, "num_input_tokens_seen": 9688480, "step": 1959, "train_runtime": 6778.4599, "train_tokens_per_second": 1429.304 }, { "epoch": 0.720919540229885, "grad_norm": 0.3398841917514801, "learning_rate": 5.6005895357406045e-05, "loss": 1.0351, "num_input_tokens_seen": 9693968, "step": 1960, "train_runtime": 6781.9684, "train_tokens_per_second": 1429.374 }, { "epoch": 0.721287356321839, "grad_norm": 0.35706812143325806, "learning_rate": 5.593220338983051e-05, "loss": 1.133, "num_input_tokens_seen": 9699376, "step": 1961, "train_runtime": 6785.5186, "train_tokens_per_second": 1429.423 }, { "epoch": 0.7216551724137931, "grad_norm": 0.3878159821033478, "learning_rate": 5.5858511422254975e-05, "loss": 1.3867, "num_input_tokens_seen": 9703024, "step": 1962, "train_runtime": 6788.0374, "train_tokens_per_second": 1429.43 }, { "epoch": 0.7220229885057471, "grad_norm": 0.35455986857414246, "learning_rate": 5.578481945467944e-05, "loss": 1.072, "num_input_tokens_seen": 9707088, "step": 1963, "train_runtime": 6790.8753, "train_tokens_per_second": 1429.431 }, { "epoch": 0.7223908045977011, "grad_norm": 0.3683864176273346, "learning_rate": 5.571112748710391e-05, "loss": 1.2966, "num_input_tokens_seen": 9710800, "step": 1964, "train_runtime": 6793.453, "train_tokens_per_second": 1429.435 }, { "epoch": 0.7227586206896551, "grad_norm": 0.3618786633014679, "learning_rate": 5.563743551952837e-05, "loss": 1.1108, "num_input_tokens_seen": 9714576, "step": 1965, "train_runtime": 6796.1236, "train_tokens_per_second": 1429.429 }, { "epoch": 0.7231264367816091, "grad_norm": 0.44552484154701233, "learning_rate": 5.556374355195284e-05, "loss": 1.1554, "num_input_tokens_seen": 9718384, "step": 1966, "train_runtime": 6798.8977, "train_tokens_per_second": 1429.406 }, { "epoch": 0.7234942528735632, "grad_norm": 0.36063694953918457, "learning_rate": 5.54900515843773e-05, "loss": 1.2525, "num_input_tokens_seen": 9723264, "step": 1967, "train_runtime": 6802.1861, "train_tokens_per_second": 1429.432 }, { "epoch": 0.7238620689655172, "grad_norm": 0.39343586564064026, "learning_rate": 5.541635961680177e-05, "loss": 1.1781, "num_input_tokens_seen": 9727472, "step": 1968, "train_runtime": 6805.0746, "train_tokens_per_second": 1429.444 }, { "epoch": 0.7242298850574712, "grad_norm": 0.3574298918247223, "learning_rate": 5.5342667649226235e-05, "loss": 1.1394, "num_input_tokens_seen": 9735920, "step": 1969, "train_runtime": 6810.3377, "train_tokens_per_second": 1429.58 }, { "epoch": 0.7245977011494252, "grad_norm": 0.3609323501586914, "learning_rate": 5.52689756816507e-05, "loss": 1.2069, "num_input_tokens_seen": 9740112, "step": 1970, "train_runtime": 6813.3353, "train_tokens_per_second": 1429.566 }, { "epoch": 0.7249655172413794, "grad_norm": 0.3511142134666443, "learning_rate": 5.5195283714075165e-05, "loss": 1.0898, "num_input_tokens_seen": 9748624, "step": 1971, "train_runtime": 6818.7, "train_tokens_per_second": 1429.69 }, { "epoch": 0.7253333333333334, "grad_norm": 0.3796879053115845, "learning_rate": 5.5121591746499636e-05, "loss": 1.2731, "num_input_tokens_seen": 9752032, "step": 1972, "train_runtime": 6821.2686, "train_tokens_per_second": 1429.651 }, { "epoch": 0.7257011494252874, "grad_norm": 0.3540513217449188, "learning_rate": 5.5047899778924094e-05, "loss": 1.1299, "num_input_tokens_seen": 9757760, "step": 1973, "train_runtime": 6825.0448, "train_tokens_per_second": 1429.699 }, { "epoch": 0.7260689655172414, "grad_norm": 0.33710286021232605, "learning_rate": 5.4974207811348566e-05, "loss": 1.0978, "num_input_tokens_seen": 9761824, "step": 1974, "train_runtime": 6827.8741, "train_tokens_per_second": 1429.702 }, { "epoch": 0.7264367816091954, "grad_norm": 0.35127952694892883, "learning_rate": 5.4900515843773024e-05, "loss": 1.1884, "num_input_tokens_seen": 9765088, "step": 1975, "train_runtime": 6830.2605, "train_tokens_per_second": 1429.68 }, { "epoch": 0.7268045977011495, "grad_norm": 0.4071696102619171, "learning_rate": 5.4826823876197496e-05, "loss": 1.2901, "num_input_tokens_seen": 9769408, "step": 1976, "train_runtime": 6833.2158, "train_tokens_per_second": 1429.694 }, { "epoch": 0.7271724137931035, "grad_norm": 0.38829708099365234, "learning_rate": 5.475313190862196e-05, "loss": 1.2401, "num_input_tokens_seen": 9775056, "step": 1977, "train_runtime": 6836.9118, "train_tokens_per_second": 1429.747 }, { "epoch": 0.7275402298850575, "grad_norm": 0.4717738628387451, "learning_rate": 5.4679439941046425e-05, "loss": 1.622, "num_input_tokens_seen": 9779168, "step": 1978, "train_runtime": 6839.8034, "train_tokens_per_second": 1429.744 }, { "epoch": 0.7279080459770115, "grad_norm": 0.39373430609703064, "learning_rate": 5.460574797347089e-05, "loss": 1.2383, "num_input_tokens_seen": 9782848, "step": 1979, "train_runtime": 6842.4602, "train_tokens_per_second": 1429.727 }, { "epoch": 0.7282758620689656, "grad_norm": 0.38938674330711365, "learning_rate": 5.453205600589536e-05, "loss": 1.1347, "num_input_tokens_seen": 9787456, "step": 1980, "train_runtime": 6845.5015, "train_tokens_per_second": 1429.765 }, { "epoch": 0.7286436781609196, "grad_norm": 0.37794309854507446, "learning_rate": 5.445836403831983e-05, "loss": 1.3076, "num_input_tokens_seen": 9793664, "step": 1981, "train_runtime": 6851.719, "train_tokens_per_second": 1429.373 }, { "epoch": 0.7290114942528736, "grad_norm": 0.4039067327976227, "learning_rate": 5.438467207074429e-05, "loss": 1.1806, "num_input_tokens_seen": 9797184, "step": 1982, "train_runtime": 6854.2879, "train_tokens_per_second": 1429.351 }, { "epoch": 0.7293793103448276, "grad_norm": 0.37168362736701965, "learning_rate": 5.431098010316876e-05, "loss": 1.1072, "num_input_tokens_seen": 9803904, "step": 1983, "train_runtime": 6858.5662, "train_tokens_per_second": 1429.439 }, { "epoch": 0.7297471264367816, "grad_norm": 0.37610507011413574, "learning_rate": 5.423728813559322e-05, "loss": 1.2056, "num_input_tokens_seen": 9808304, "step": 1984, "train_runtime": 6861.5665, "train_tokens_per_second": 1429.456 }, { "epoch": 0.7301149425287357, "grad_norm": 0.36628156900405884, "learning_rate": 5.416359616801769e-05, "loss": 1.1143, "num_input_tokens_seen": 9812736, "step": 1985, "train_runtime": 6864.6168, "train_tokens_per_second": 1429.466 }, { "epoch": 0.7304827586206897, "grad_norm": 0.36420294642448425, "learning_rate": 5.408990420044216e-05, "loss": 1.2567, "num_input_tokens_seen": 9816304, "step": 1986, "train_runtime": 6867.2194, "train_tokens_per_second": 1429.444 }, { "epoch": 0.7308505747126437, "grad_norm": 0.3996455669403076, "learning_rate": 5.401621223286662e-05, "loss": 1.2983, "num_input_tokens_seen": 9820896, "step": 1987, "train_runtime": 6870.3501, "train_tokens_per_second": 1429.461 }, { "epoch": 0.7312183908045977, "grad_norm": 0.36641180515289307, "learning_rate": 5.394252026529109e-05, "loss": 1.2829, "num_input_tokens_seen": 9824720, "step": 1988, "train_runtime": 6873.1052, "train_tokens_per_second": 1429.444 }, { "epoch": 0.7315862068965517, "grad_norm": 0.40277162194252014, "learning_rate": 5.386882829771556e-05, "loss": 1.2458, "num_input_tokens_seen": 9828624, "step": 1989, "train_runtime": 6875.8833, "train_tokens_per_second": 1429.434 }, { "epoch": 0.7319540229885058, "grad_norm": 0.3662918508052826, "learning_rate": 5.379513633014002e-05, "loss": 1.4541, "num_input_tokens_seen": 9834880, "step": 1990, "train_runtime": 6879.9502, "train_tokens_per_second": 1429.499 }, { "epoch": 0.7323218390804598, "grad_norm": 0.3359386622905731, "learning_rate": 5.372144436256449e-05, "loss": 1.1518, "num_input_tokens_seen": 9839440, "step": 1991, "train_runtime": 6883.0285, "train_tokens_per_second": 1429.522 }, { "epoch": 0.7326896551724138, "grad_norm": 0.34676942229270935, "learning_rate": 5.3647752394988946e-05, "loss": 1.2788, "num_input_tokens_seen": 9844256, "step": 1992, "train_runtime": 6886.3564, "train_tokens_per_second": 1429.53 }, { "epoch": 0.7330574712643678, "grad_norm": 0.3641933500766754, "learning_rate": 5.357406042741342e-05, "loss": 1.2664, "num_input_tokens_seen": 9848016, "step": 1993, "train_runtime": 6889.1178, "train_tokens_per_second": 1429.503 }, { "epoch": 0.7334252873563218, "grad_norm": 0.3946431875228882, "learning_rate": 5.350036845983788e-05, "loss": 1.2664, "num_input_tokens_seen": 9852464, "step": 1994, "train_runtime": 6892.2322, "train_tokens_per_second": 1429.503 }, { "epoch": 0.7337931034482759, "grad_norm": 0.3413759469985962, "learning_rate": 5.342667649226235e-05, "loss": 1.3558, "num_input_tokens_seen": 9857840, "step": 1995, "train_runtime": 6895.7472, "train_tokens_per_second": 1429.554 }, { "epoch": 0.7341609195402299, "grad_norm": 0.3781610429286957, "learning_rate": 5.335298452468681e-05, "loss": 1.2013, "num_input_tokens_seen": 9864672, "step": 1996, "train_runtime": 6900.1912, "train_tokens_per_second": 1429.623 }, { "epoch": 0.7345287356321839, "grad_norm": 0.375271201133728, "learning_rate": 5.3279292557111284e-05, "loss": 1.1249, "num_input_tokens_seen": 9868688, "step": 1997, "train_runtime": 6903.0303, "train_tokens_per_second": 1429.617 }, { "epoch": 0.7348965517241379, "grad_norm": 0.3385009765625, "learning_rate": 5.320560058953574e-05, "loss": 1.2295, "num_input_tokens_seen": 9873968, "step": 1998, "train_runtime": 6906.6201, "train_tokens_per_second": 1429.638 }, { "epoch": 0.735264367816092, "grad_norm": 0.35097870230674744, "learning_rate": 5.3131908621960214e-05, "loss": 1.2998, "num_input_tokens_seen": 9880016, "step": 1999, "train_runtime": 6910.643, "train_tokens_per_second": 1429.681 }, { "epoch": 0.735632183908046, "grad_norm": 0.3186858892440796, "learning_rate": 5.305821665438467e-05, "loss": 1.31, "num_input_tokens_seen": 9885664, "step": 2000, "train_runtime": 6914.3079, "train_tokens_per_second": 1429.74 }, { "epoch": 0.736, "grad_norm": 0.37143802642822266, "learning_rate": 5.298452468680914e-05, "loss": 1.2539, "num_input_tokens_seen": 9889280, "step": 2001, "train_runtime": 6916.9153, "train_tokens_per_second": 1429.724 }, { "epoch": 0.736367816091954, "grad_norm": 0.34992706775665283, "learning_rate": 5.291083271923361e-05, "loss": 1.2064, "num_input_tokens_seen": 9894432, "step": 2002, "train_runtime": 6920.3477, "train_tokens_per_second": 1429.759 }, { "epoch": 0.736735632183908, "grad_norm": 0.3759583830833435, "learning_rate": 5.283714075165808e-05, "loss": 1.2319, "num_input_tokens_seen": 9902912, "step": 2003, "train_runtime": 6925.7199, "train_tokens_per_second": 1429.875 }, { "epoch": 0.737103448275862, "grad_norm": 0.30717042088508606, "learning_rate": 5.276344878408254e-05, "loss": 1.1022, "num_input_tokens_seen": 9907472, "step": 2004, "train_runtime": 6928.7942, "train_tokens_per_second": 1429.898 }, { "epoch": 0.7374712643678161, "grad_norm": 0.3640108108520508, "learning_rate": 5.268975681650701e-05, "loss": 1.0412, "num_input_tokens_seen": 9912592, "step": 2005, "train_runtime": 6932.1369, "train_tokens_per_second": 1429.948 }, { "epoch": 0.7378390804597701, "grad_norm": 0.37335336208343506, "learning_rate": 5.261606484893147e-05, "loss": 1.1765, "num_input_tokens_seen": 9916336, "step": 2006, "train_runtime": 6934.7502, "train_tokens_per_second": 1429.949 }, { "epoch": 0.7382068965517241, "grad_norm": 0.3571365475654602, "learning_rate": 5.254237288135594e-05, "loss": 1.3221, "num_input_tokens_seen": 9921552, "step": 2007, "train_runtime": 6938.2039, "train_tokens_per_second": 1429.989 }, { "epoch": 0.7385747126436781, "grad_norm": 0.35716331005096436, "learning_rate": 5.24686809137804e-05, "loss": 1.0862, "num_input_tokens_seen": 9928768, "step": 2008, "train_runtime": 6942.8361, "train_tokens_per_second": 1430.074 }, { "epoch": 0.7389425287356322, "grad_norm": 0.36532944440841675, "learning_rate": 5.239498894620487e-05, "loss": 1.1792, "num_input_tokens_seen": 9933120, "step": 2009, "train_runtime": 6945.8431, "train_tokens_per_second": 1430.081 }, { "epoch": 0.7393103448275862, "grad_norm": 0.3846795856952667, "learning_rate": 5.2321296978629333e-05, "loss": 1.2027, "num_input_tokens_seen": 9937104, "step": 2010, "train_runtime": 6948.6349, "train_tokens_per_second": 1430.08 }, { "epoch": 0.7396781609195402, "grad_norm": 0.3514174818992615, "learning_rate": 5.2247605011053805e-05, "loss": 1.1343, "num_input_tokens_seen": 9940672, "step": 2011, "train_runtime": 6953.7508, "train_tokens_per_second": 1429.541 }, { "epoch": 0.7400459770114942, "grad_norm": 0.35756951570510864, "learning_rate": 5.217391304347826e-05, "loss": 1.1809, "num_input_tokens_seen": 9945344, "step": 2012, "train_runtime": 6956.8756, "train_tokens_per_second": 1429.57 }, { "epoch": 0.7404137931034482, "grad_norm": 0.39096799492836, "learning_rate": 5.2100221075902735e-05, "loss": 1.3275, "num_input_tokens_seen": 9948576, "step": 2013, "train_runtime": 6959.2651, "train_tokens_per_second": 1429.544 }, { "epoch": 0.7407816091954023, "grad_norm": 0.38563162088394165, "learning_rate": 5.202652910832719e-05, "loss": 1.1817, "num_input_tokens_seen": 9951904, "step": 2014, "train_runtime": 6961.7263, "train_tokens_per_second": 1429.517 }, { "epoch": 0.7411494252873563, "grad_norm": 0.3683525323867798, "learning_rate": 5.1952837140751664e-05, "loss": 1.2449, "num_input_tokens_seen": 9955904, "step": 2015, "train_runtime": 6964.6006, "train_tokens_per_second": 1429.501 }, { "epoch": 0.7415172413793103, "grad_norm": 0.4213060736656189, "learning_rate": 5.187914517317612e-05, "loss": 1.3772, "num_input_tokens_seen": 9961088, "step": 2016, "train_runtime": 6968.1352, "train_tokens_per_second": 1429.52 }, { "epoch": 0.7418850574712643, "grad_norm": 0.4007192552089691, "learning_rate": 5.1805453205600594e-05, "loss": 1.2908, "num_input_tokens_seen": 9966800, "step": 2017, "train_runtime": 6971.9148, "train_tokens_per_second": 1429.564 }, { "epoch": 0.7422528735632183, "grad_norm": 0.3853626251220703, "learning_rate": 5.173176123802506e-05, "loss": 1.3185, "num_input_tokens_seen": 9971472, "step": 2018, "train_runtime": 6975.0795, "train_tokens_per_second": 1429.585 }, { "epoch": 0.7426206896551724, "grad_norm": 0.39276832342147827, "learning_rate": 5.165806927044953e-05, "loss": 1.3106, "num_input_tokens_seen": 9976048, "step": 2019, "train_runtime": 6978.2776, "train_tokens_per_second": 1429.586 }, { "epoch": 0.7429885057471264, "grad_norm": 0.3647022247314453, "learning_rate": 5.158437730287399e-05, "loss": 1.2766, "num_input_tokens_seen": 9984800, "step": 2020, "train_runtime": 6983.6494, "train_tokens_per_second": 1429.74 }, { "epoch": 0.7433563218390805, "grad_norm": 0.3334828317165375, "learning_rate": 5.151068533529846e-05, "loss": 1.0391, "num_input_tokens_seen": 9992192, "step": 2021, "train_runtime": 6988.5539, "train_tokens_per_second": 1429.794 }, { "epoch": 0.7437241379310345, "grad_norm": 0.3582146465778351, "learning_rate": 5.143699336772292e-05, "loss": 1.1515, "num_input_tokens_seen": 9997376, "step": 2022, "train_runtime": 6992.075, "train_tokens_per_second": 1429.815 }, { "epoch": 0.7440919540229886, "grad_norm": 0.3577844798564911, "learning_rate": 5.136330140014739e-05, "loss": 1.2602, "num_input_tokens_seen": 10001856, "step": 2023, "train_runtime": 6995.0471, "train_tokens_per_second": 1429.848 }, { "epoch": 0.7444597701149426, "grad_norm": 0.36794063448905945, "learning_rate": 5.128960943257185e-05, "loss": 1.1986, "num_input_tokens_seen": 10005824, "step": 2024, "train_runtime": 6997.8952, "train_tokens_per_second": 1429.833 }, { "epoch": 0.7448275862068966, "grad_norm": 0.33305928111076355, "learning_rate": 5.121591746499632e-05, "loss": 1.1856, "num_input_tokens_seen": 10011776, "step": 2025, "train_runtime": 7001.6977, "train_tokens_per_second": 1429.907 }, { "epoch": 0.7451954022988506, "grad_norm": 0.3727646470069885, "learning_rate": 5.1142225497420784e-05, "loss": 1.1093, "num_input_tokens_seen": 10016912, "step": 2026, "train_runtime": 7005.0587, "train_tokens_per_second": 1429.954 }, { "epoch": 0.7455632183908046, "grad_norm": 0.42127686738967896, "learning_rate": 5.1068533529845256e-05, "loss": 1.3303, "num_input_tokens_seen": 10022400, "step": 2027, "train_runtime": 7008.6693, "train_tokens_per_second": 1430.0 }, { "epoch": 0.7459310344827587, "grad_norm": 0.36830392479896545, "learning_rate": 5.0994841562269714e-05, "loss": 1.3581, "num_input_tokens_seen": 10026128, "step": 2028, "train_runtime": 7011.3494, "train_tokens_per_second": 1429.986 }, { "epoch": 0.7462988505747127, "grad_norm": 0.3702619969844818, "learning_rate": 5.0921149594694185e-05, "loss": 1.1841, "num_input_tokens_seen": 10031888, "step": 2029, "train_runtime": 7015.1022, "train_tokens_per_second": 1430.042 }, { "epoch": 0.7466666666666667, "grad_norm": 0.3536003828048706, "learning_rate": 5.0847457627118643e-05, "loss": 1.2594, "num_input_tokens_seen": 10035856, "step": 2030, "train_runtime": 7017.9464, "train_tokens_per_second": 1430.027 }, { "epoch": 0.7470344827586207, "grad_norm": 0.38960978388786316, "learning_rate": 5.0773765659543115e-05, "loss": 1.2737, "num_input_tokens_seen": 10039216, "step": 2031, "train_runtime": 7020.6099, "train_tokens_per_second": 1429.964 }, { "epoch": 0.7474022988505747, "grad_norm": 0.4064590632915497, "learning_rate": 5.070007369196757e-05, "loss": 1.2461, "num_input_tokens_seen": 10045440, "step": 2032, "train_runtime": 7024.6007, "train_tokens_per_second": 1430.037 }, { "epoch": 0.7477701149425288, "grad_norm": 0.3747829794883728, "learning_rate": 5.0626381724392045e-05, "loss": 1.2312, "num_input_tokens_seen": 10048752, "step": 2033, "train_runtime": 7026.9578, "train_tokens_per_second": 1430.029 }, { "epoch": 0.7481379310344828, "grad_norm": 0.3794178068637848, "learning_rate": 5.055268975681651e-05, "loss": 1.337, "num_input_tokens_seen": 10053440, "step": 2034, "train_runtime": 7030.1801, "train_tokens_per_second": 1430.04 }, { "epoch": 0.7485057471264368, "grad_norm": 0.3810683488845825, "learning_rate": 5.047899778924098e-05, "loss": 1.2665, "num_input_tokens_seen": 10058368, "step": 2035, "train_runtime": 7033.4954, "train_tokens_per_second": 1430.067 }, { "epoch": 0.7488735632183908, "grad_norm": 0.3513549566268921, "learning_rate": 5.040530582166544e-05, "loss": 1.2018, "num_input_tokens_seen": 10062400, "step": 2036, "train_runtime": 7036.3181, "train_tokens_per_second": 1430.066 }, { "epoch": 0.7492413793103448, "grad_norm": 0.3836992383003235, "learning_rate": 5.033161385408991e-05, "loss": 1.1851, "num_input_tokens_seen": 10065888, "step": 2037, "train_runtime": 7038.7933, "train_tokens_per_second": 1430.059 }, { "epoch": 0.7496091954022989, "grad_norm": 0.34747523069381714, "learning_rate": 5.025792188651437e-05, "loss": 1.1054, "num_input_tokens_seen": 10069808, "step": 2038, "train_runtime": 7041.575, "train_tokens_per_second": 1430.051 }, { "epoch": 0.7499770114942529, "grad_norm": 0.37715470790863037, "learning_rate": 5.018422991893884e-05, "loss": 1.1988, "num_input_tokens_seen": 10074704, "step": 2039, "train_runtime": 7044.7484, "train_tokens_per_second": 1430.101 }, { "epoch": 0.7503448275862069, "grad_norm": 0.33090466260910034, "learning_rate": 5.01105379513633e-05, "loss": 1.1553, "num_input_tokens_seen": 10082032, "step": 2040, "train_runtime": 7049.3306, "train_tokens_per_second": 1430.211 }, { "epoch": 0.7507126436781609, "grad_norm": 0.39747190475463867, "learning_rate": 5.003684598378777e-05, "loss": 1.0709, "num_input_tokens_seen": 10086928, "step": 2041, "train_runtime": 7054.9362, "train_tokens_per_second": 1429.769 }, { "epoch": 0.751080459770115, "grad_norm": 0.3875967562198639, "learning_rate": 4.9963154016212235e-05, "loss": 1.2019, "num_input_tokens_seen": 10091072, "step": 2042, "train_runtime": 7057.7623, "train_tokens_per_second": 1429.783 }, { "epoch": 0.751448275862069, "grad_norm": 0.3462505638599396, "learning_rate": 4.9889462048636706e-05, "loss": 1.0891, "num_input_tokens_seen": 10096384, "step": 2043, "train_runtime": 7061.3305, "train_tokens_per_second": 1429.813 }, { "epoch": 0.751816091954023, "grad_norm": 0.36672234535217285, "learning_rate": 4.981577008106117e-05, "loss": 1.2469, "num_input_tokens_seen": 10099776, "step": 2044, "train_runtime": 7063.8023, "train_tokens_per_second": 1429.793 }, { "epoch": 0.752183908045977, "grad_norm": 0.32974258065223694, "learning_rate": 4.9742078113485636e-05, "loss": 1.2321, "num_input_tokens_seen": 10106224, "step": 2045, "train_runtime": 7068.0646, "train_tokens_per_second": 1429.843 }, { "epoch": 0.752551724137931, "grad_norm": 0.3559560179710388, "learning_rate": 4.96683861459101e-05, "loss": 1.103, "num_input_tokens_seen": 10112880, "step": 2046, "train_runtime": 7072.4201, "train_tokens_per_second": 1429.904 }, { "epoch": 0.752919540229885, "grad_norm": 0.3330234885215759, "learning_rate": 4.9594694178334566e-05, "loss": 1.187, "num_input_tokens_seen": 10116688, "step": 2047, "train_runtime": 7075.1164, "train_tokens_per_second": 1429.897 }, { "epoch": 0.7532873563218391, "grad_norm": 0.36663639545440674, "learning_rate": 4.952100221075903e-05, "loss": 1.1006, "num_input_tokens_seen": 10120224, "step": 2048, "train_runtime": 7077.6891, "train_tokens_per_second": 1429.877 }, { "epoch": 0.7536551724137931, "grad_norm": 0.3912426233291626, "learning_rate": 4.9447310243183495e-05, "loss": 1.3455, "num_input_tokens_seen": 10125088, "step": 2049, "train_runtime": 7080.9942, "train_tokens_per_second": 1429.896 }, { "epoch": 0.7540229885057471, "grad_norm": 0.34763529896736145, "learning_rate": 4.937361827560796e-05, "loss": 1.149, "num_input_tokens_seen": 10130208, "step": 2050, "train_runtime": 7084.3911, "train_tokens_per_second": 1429.933 }, { "epoch": 0.7543908045977011, "grad_norm": 0.3467884957790375, "learning_rate": 4.929992630803243e-05, "loss": 1.2697, "num_input_tokens_seen": 10136432, "step": 2051, "train_runtime": 7088.47, "train_tokens_per_second": 1429.989 }, { "epoch": 0.7547586206896552, "grad_norm": 0.3817930817604065, "learning_rate": 4.9226234340456897e-05, "loss": 1.188, "num_input_tokens_seen": 10141984, "step": 2052, "train_runtime": 7092.1059, "train_tokens_per_second": 1430.038 }, { "epoch": 0.7551264367816092, "grad_norm": 0.3571681082248688, "learning_rate": 4.915254237288136e-05, "loss": 1.1959, "num_input_tokens_seen": 10151216, "step": 2053, "train_runtime": 7097.7786, "train_tokens_per_second": 1430.196 }, { "epoch": 0.7554942528735632, "grad_norm": 0.397423654794693, "learning_rate": 4.9078850405305826e-05, "loss": 1.2399, "num_input_tokens_seen": 10157984, "step": 2054, "train_runtime": 7102.1167, "train_tokens_per_second": 1430.276 }, { "epoch": 0.7558620689655172, "grad_norm": 0.38847312331199646, "learning_rate": 4.900515843773029e-05, "loss": 1.2781, "num_input_tokens_seen": 10166256, "step": 2055, "train_runtime": 7107.2779, "train_tokens_per_second": 1430.401 }, { "epoch": 0.7562298850574712, "grad_norm": 0.35216590762138367, "learning_rate": 4.8931466470154756e-05, "loss": 1.1085, "num_input_tokens_seen": 10170496, "step": 2056, "train_runtime": 7110.1578, "train_tokens_per_second": 1430.418 }, { "epoch": 0.7565977011494253, "grad_norm": 0.3902183175086975, "learning_rate": 4.885777450257922e-05, "loss": 1.262, "num_input_tokens_seen": 10176368, "step": 2057, "train_runtime": 7113.9998, "train_tokens_per_second": 1430.471 }, { "epoch": 0.7569655172413793, "grad_norm": 0.34320852160453796, "learning_rate": 4.878408253500369e-05, "loss": 1.0795, "num_input_tokens_seen": 10184000, "step": 2058, "train_runtime": 7118.7297, "train_tokens_per_second": 1430.592 }, { "epoch": 0.7573333333333333, "grad_norm": 0.35162466764450073, "learning_rate": 4.871039056742816e-05, "loss": 1.2492, "num_input_tokens_seen": 10187632, "step": 2059, "train_runtime": 7121.4246, "train_tokens_per_second": 1430.561 }, { "epoch": 0.7577011494252873, "grad_norm": 0.3756692111492157, "learning_rate": 4.863669859985262e-05, "loss": 1.214, "num_input_tokens_seen": 10191984, "step": 2060, "train_runtime": 7124.4596, "train_tokens_per_second": 1430.562 }, { "epoch": 0.7580689655172413, "grad_norm": 0.3153895437717438, "learning_rate": 4.856300663227709e-05, "loss": 1.0061, "num_input_tokens_seen": 10199488, "step": 2061, "train_runtime": 7129.2065, "train_tokens_per_second": 1430.662 }, { "epoch": 0.7584367816091954, "grad_norm": 0.3751019537448883, "learning_rate": 4.848931466470155e-05, "loss": 1.2012, "num_input_tokens_seen": 10202912, "step": 2062, "train_runtime": 7131.7605, "train_tokens_per_second": 1430.63 }, { "epoch": 0.7588045977011494, "grad_norm": 0.3560206890106201, "learning_rate": 4.8415622697126016e-05, "loss": 1.0746, "num_input_tokens_seen": 10207184, "step": 2063, "train_runtime": 7134.7109, "train_tokens_per_second": 1430.637 }, { "epoch": 0.7591724137931034, "grad_norm": 0.3726266920566559, "learning_rate": 4.834193072955048e-05, "loss": 1.2619, "num_input_tokens_seen": 10212992, "step": 2064, "train_runtime": 7138.4889, "train_tokens_per_second": 1430.694 }, { "epoch": 0.7595402298850574, "grad_norm": 0.39077332615852356, "learning_rate": 4.8268238761974946e-05, "loss": 1.2568, "num_input_tokens_seen": 10219312, "step": 2065, "train_runtime": 7142.6261, "train_tokens_per_second": 1430.75 }, { "epoch": 0.7599080459770114, "grad_norm": 0.3722257912158966, "learning_rate": 4.819454679439942e-05, "loss": 1.113, "num_input_tokens_seen": 10224768, "step": 2066, "train_runtime": 7146.332, "train_tokens_per_second": 1430.771 }, { "epoch": 0.7602758620689655, "grad_norm": 0.3605303466320038, "learning_rate": 4.812085482682388e-05, "loss": 1.1458, "num_input_tokens_seen": 10230400, "step": 2067, "train_runtime": 7150.0216, "train_tokens_per_second": 1430.821 }, { "epoch": 0.7606436781609195, "grad_norm": 0.36080196499824524, "learning_rate": 4.804716285924835e-05, "loss": 1.1532, "num_input_tokens_seen": 10238480, "step": 2068, "train_runtime": 7155.0315, "train_tokens_per_second": 1430.948 }, { "epoch": 0.7610114942528735, "grad_norm": 0.35726282000541687, "learning_rate": 4.797347089167281e-05, "loss": 1.1386, "num_input_tokens_seen": 10242720, "step": 2069, "train_runtime": 7158.0099, "train_tokens_per_second": 1430.945 }, { "epoch": 0.7613793103448275, "grad_norm": 0.38103166222572327, "learning_rate": 4.789977892409728e-05, "loss": 1.1797, "num_input_tokens_seen": 10246576, "step": 2070, "train_runtime": 7160.7166, "train_tokens_per_second": 1430.943 }, { "epoch": 0.7617471264367817, "grad_norm": 0.3718661367893219, "learning_rate": 4.782608695652174e-05, "loss": 1.1831, "num_input_tokens_seen": 10250816, "step": 2071, "train_runtime": 7165.7955, "train_tokens_per_second": 1430.52 }, { "epoch": 0.7621149425287357, "grad_norm": 0.32570597529411316, "learning_rate": 4.7752394988946207e-05, "loss": 1.1222, "num_input_tokens_seen": 10256656, "step": 2072, "train_runtime": 7169.5766, "train_tokens_per_second": 1430.58 }, { "epoch": 0.7624827586206897, "grad_norm": 0.37853527069091797, "learning_rate": 4.767870302137067e-05, "loss": 1.297, "num_input_tokens_seen": 10261056, "step": 2073, "train_runtime": 7172.5789, "train_tokens_per_second": 1430.595 }, { "epoch": 0.7628505747126437, "grad_norm": 0.3393378257751465, "learning_rate": 4.760501105379514e-05, "loss": 1.0361, "num_input_tokens_seen": 10264256, "step": 2074, "train_runtime": 7174.9787, "train_tokens_per_second": 1430.563 }, { "epoch": 0.7632183908045977, "grad_norm": 0.3383787274360657, "learning_rate": 4.753131908621961e-05, "loss": 1.1802, "num_input_tokens_seen": 10268752, "step": 2075, "train_runtime": 7178.038, "train_tokens_per_second": 1430.579 }, { "epoch": 0.7635862068965518, "grad_norm": 0.3437236249446869, "learning_rate": 4.745762711864407e-05, "loss": 1.0817, "num_input_tokens_seen": 10272240, "step": 2076, "train_runtime": 7180.5496, "train_tokens_per_second": 1430.565 }, { "epoch": 0.7639540229885058, "grad_norm": 0.39617833495140076, "learning_rate": 4.738393515106854e-05, "loss": 1.3022, "num_input_tokens_seen": 10277056, "step": 2077, "train_runtime": 7183.7675, "train_tokens_per_second": 1430.594 }, { "epoch": 0.7643218390804598, "grad_norm": 0.34657150506973267, "learning_rate": 4.7310243183493e-05, "loss": 1.2007, "num_input_tokens_seen": 10281104, "step": 2078, "train_runtime": 7186.5477, "train_tokens_per_second": 1430.604 }, { "epoch": 0.7646896551724138, "grad_norm": 0.37454310059547424, "learning_rate": 4.723655121591747e-05, "loss": 1.2335, "num_input_tokens_seen": 10285968, "step": 2079, "train_runtime": 7189.7481, "train_tokens_per_second": 1430.644 }, { "epoch": 0.7650574712643678, "grad_norm": 0.3676322400569916, "learning_rate": 4.716285924834193e-05, "loss": 1.0868, "num_input_tokens_seen": 10291136, "step": 2080, "train_runtime": 7193.1111, "train_tokens_per_second": 1430.693 }, { "epoch": 0.7654252873563219, "grad_norm": 0.39924076199531555, "learning_rate": 4.70891672807664e-05, "loss": 1.2072, "num_input_tokens_seen": 10296560, "step": 2081, "train_runtime": 7196.8275, "train_tokens_per_second": 1430.708 }, { "epoch": 0.7657931034482759, "grad_norm": 0.3459792137145996, "learning_rate": 4.701547531319087e-05, "loss": 1.1102, "num_input_tokens_seen": 10302400, "step": 2082, "train_runtime": 7200.6383, "train_tokens_per_second": 1430.762 }, { "epoch": 0.7661609195402299, "grad_norm": 0.37597450613975525, "learning_rate": 4.694178334561533e-05, "loss": 1.1711, "num_input_tokens_seen": 10308656, "step": 2083, "train_runtime": 7204.6843, "train_tokens_per_second": 1430.827 }, { "epoch": 0.7665287356321839, "grad_norm": 0.3689568042755127, "learning_rate": 4.68680913780398e-05, "loss": 1.0629, "num_input_tokens_seen": 10317856, "step": 2084, "train_runtime": 7210.2449, "train_tokens_per_second": 1430.999 }, { "epoch": 0.766896551724138, "grad_norm": 0.4066593050956726, "learning_rate": 4.679439941046426e-05, "loss": 1.2215, "num_input_tokens_seen": 10322560, "step": 2085, "train_runtime": 7213.4809, "train_tokens_per_second": 1431.01 }, { "epoch": 0.767264367816092, "grad_norm": 0.3608400523662567, "learning_rate": 4.672070744288873e-05, "loss": 1.2937, "num_input_tokens_seen": 10329680, "step": 2086, "train_runtime": 7218.0218, "train_tokens_per_second": 1431.096 }, { "epoch": 0.767632183908046, "grad_norm": 0.3691215217113495, "learning_rate": 4.664701547531319e-05, "loss": 1.1806, "num_input_tokens_seen": 10336144, "step": 2087, "train_runtime": 7222.1782, "train_tokens_per_second": 1431.167 }, { "epoch": 0.768, "grad_norm": 0.3937698304653168, "learning_rate": 4.657332350773766e-05, "loss": 1.1588, "num_input_tokens_seen": 10339504, "step": 2088, "train_runtime": 7224.5675, "train_tokens_per_second": 1431.159 }, { "epoch": 0.768367816091954, "grad_norm": 0.3723428249359131, "learning_rate": 4.649963154016212e-05, "loss": 1.1998, "num_input_tokens_seen": 10343408, "step": 2089, "train_runtime": 7227.3515, "train_tokens_per_second": 1431.148 }, { "epoch": 0.7687356321839081, "grad_norm": 0.3708900213241577, "learning_rate": 4.6425939572586594e-05, "loss": 1.1635, "num_input_tokens_seen": 10348672, "step": 2090, "train_runtime": 7230.8118, "train_tokens_per_second": 1431.191 }, { "epoch": 0.7691034482758621, "grad_norm": 0.36263126134872437, "learning_rate": 4.635224760501106e-05, "loss": 1.3147, "num_input_tokens_seen": 10354880, "step": 2091, "train_runtime": 7234.7381, "train_tokens_per_second": 1431.272 }, { "epoch": 0.7694712643678161, "grad_norm": 0.3652060329914093, "learning_rate": 4.627855563743552e-05, "loss": 1.1557, "num_input_tokens_seen": 10358752, "step": 2092, "train_runtime": 7237.4355, "train_tokens_per_second": 1431.274 }, { "epoch": 0.7698390804597701, "grad_norm": 0.3801341652870178, "learning_rate": 4.620486366985999e-05, "loss": 1.2374, "num_input_tokens_seen": 10362608, "step": 2093, "train_runtime": 7240.1998, "train_tokens_per_second": 1431.26 }, { "epoch": 0.7702068965517241, "grad_norm": 0.35437583923339844, "learning_rate": 4.613117170228445e-05, "loss": 1.2502, "num_input_tokens_seen": 10366560, "step": 2094, "train_runtime": 7243.007, "train_tokens_per_second": 1431.251 }, { "epoch": 0.7705747126436782, "grad_norm": 0.3846490681171417, "learning_rate": 4.605747973470892e-05, "loss": 1.2677, "num_input_tokens_seen": 10372224, "step": 2095, "train_runtime": 7246.6955, "train_tokens_per_second": 1431.304 }, { "epoch": 0.7709425287356322, "grad_norm": 0.3832799792289734, "learning_rate": 4.598378776713338e-05, "loss": 1.2278, "num_input_tokens_seen": 10379280, "step": 2096, "train_runtime": 7251.1839, "train_tokens_per_second": 1431.391 }, { "epoch": 0.7713103448275862, "grad_norm": 0.3387010395526886, "learning_rate": 4.591009579955785e-05, "loss": 1.1699, "num_input_tokens_seen": 10385904, "step": 2097, "train_runtime": 7255.3935, "train_tokens_per_second": 1431.474 }, { "epoch": 0.7716781609195402, "grad_norm": 0.41282057762145996, "learning_rate": 4.583640383198232e-05, "loss": 1.1454, "num_input_tokens_seen": 10390848, "step": 2098, "train_runtime": 7258.7237, "train_tokens_per_second": 1431.498 }, { "epoch": 0.7720459770114942, "grad_norm": 0.36254802346229553, "learning_rate": 4.5762711864406784e-05, "loss": 1.0989, "num_input_tokens_seen": 10396160, "step": 2099, "train_runtime": 7262.1879, "train_tokens_per_second": 1431.547 }, { "epoch": 0.7724137931034483, "grad_norm": 0.35990336537361145, "learning_rate": 4.568901989683125e-05, "loss": 1.2364, "num_input_tokens_seen": 10401408, "step": 2100, "train_runtime": 7265.6634, "train_tokens_per_second": 1431.584 }, { "epoch": 0.7727816091954023, "grad_norm": 0.3373374044895172, "learning_rate": 4.5615327929255713e-05, "loss": 1.0395, "num_input_tokens_seen": 10405232, "step": 2101, "train_runtime": 7270.6098, "train_tokens_per_second": 1431.136 }, { "epoch": 0.7731494252873563, "grad_norm": 0.4272858202457428, "learning_rate": 4.554163596168018e-05, "loss": 1.1808, "num_input_tokens_seen": 10409104, "step": 2102, "train_runtime": 7273.3011, "train_tokens_per_second": 1431.139 }, { "epoch": 0.7735172413793103, "grad_norm": 0.35010093450546265, "learning_rate": 4.546794399410464e-05, "loss": 1.0808, "num_input_tokens_seen": 10412544, "step": 2103, "train_runtime": 7275.7651, "train_tokens_per_second": 1431.127 }, { "epoch": 0.7738850574712643, "grad_norm": 0.3812684714794159, "learning_rate": 4.539425202652911e-05, "loss": 1.1303, "num_input_tokens_seen": 10416704, "step": 2104, "train_runtime": 7278.5331, "train_tokens_per_second": 1431.154 }, { "epoch": 0.7742528735632184, "grad_norm": 0.3618868291378021, "learning_rate": 4.532056005895358e-05, "loss": 1.224, "num_input_tokens_seen": 10421824, "step": 2105, "train_runtime": 7281.899, "train_tokens_per_second": 1431.196 }, { "epoch": 0.7746206896551724, "grad_norm": 0.32397451996803284, "learning_rate": 4.5246868091378044e-05, "loss": 1.2166, "num_input_tokens_seen": 10427488, "step": 2106, "train_runtime": 7285.6429, "train_tokens_per_second": 1431.238 }, { "epoch": 0.7749885057471264, "grad_norm": 0.3255363404750824, "learning_rate": 4.517317612380251e-05, "loss": 1.117, "num_input_tokens_seen": 10434816, "step": 2107, "train_runtime": 7290.2, "train_tokens_per_second": 1431.348 }, { "epoch": 0.7753563218390804, "grad_norm": 0.39174115657806396, "learning_rate": 4.5099484156226974e-05, "loss": 1.1382, "num_input_tokens_seen": 10439248, "step": 2108, "train_runtime": 7293.539, "train_tokens_per_second": 1431.301 }, { "epoch": 0.7757241379310345, "grad_norm": 0.3679260015487671, "learning_rate": 4.502579218865144e-05, "loss": 1.1387, "num_input_tokens_seen": 10442592, "step": 2109, "train_runtime": 7296.008, "train_tokens_per_second": 1431.275 }, { "epoch": 0.7760919540229885, "grad_norm": 0.3300345242023468, "learning_rate": 4.4952100221075904e-05, "loss": 1.0843, "num_input_tokens_seen": 10446832, "step": 2110, "train_runtime": 7298.9582, "train_tokens_per_second": 1431.277 }, { "epoch": 0.7764597701149425, "grad_norm": 0.36731183528900146, "learning_rate": 4.487840825350037e-05, "loss": 1.1997, "num_input_tokens_seen": 10452608, "step": 2111, "train_runtime": 7302.6544, "train_tokens_per_second": 1431.344 }, { "epoch": 0.7768275862068965, "grad_norm": 0.3751862645149231, "learning_rate": 4.480471628592483e-05, "loss": 1.234, "num_input_tokens_seen": 10458272, "step": 2112, "train_runtime": 7306.3281, "train_tokens_per_second": 1431.399 }, { "epoch": 0.7771954022988505, "grad_norm": 0.39682427048683167, "learning_rate": 4.4731024318349305e-05, "loss": 1.1767, "num_input_tokens_seen": 10464096, "step": 2113, "train_runtime": 7310.1416, "train_tokens_per_second": 1431.449 }, { "epoch": 0.7775632183908046, "grad_norm": 0.3733166754245758, "learning_rate": 4.465733235077377e-05, "loss": 1.1189, "num_input_tokens_seen": 10468480, "step": 2114, "train_runtime": 7313.1152, "train_tokens_per_second": 1431.467 }, { "epoch": 0.7779310344827586, "grad_norm": 0.3759706914424896, "learning_rate": 4.4583640383198234e-05, "loss": 1.2198, "num_input_tokens_seen": 10473504, "step": 2115, "train_runtime": 7316.4262, "train_tokens_per_second": 1431.505 }, { "epoch": 0.7782988505747126, "grad_norm": 0.3869493901729584, "learning_rate": 4.45099484156227e-05, "loss": 1.2462, "num_input_tokens_seen": 10478944, "step": 2116, "train_runtime": 7320.021, "train_tokens_per_second": 1431.546 }, { "epoch": 0.7786666666666666, "grad_norm": 0.392558217048645, "learning_rate": 4.4436256448047164e-05, "loss": 1.112, "num_input_tokens_seen": 10485296, "step": 2117, "train_runtime": 7324.0797, "train_tokens_per_second": 1431.62 }, { "epoch": 0.7790344827586206, "grad_norm": 0.41828736662864685, "learning_rate": 4.436256448047163e-05, "loss": 1.2317, "num_input_tokens_seen": 10488912, "step": 2118, "train_runtime": 7326.8515, "train_tokens_per_second": 1431.572 }, { "epoch": 0.7794022988505747, "grad_norm": 0.3480420410633087, "learning_rate": 4.4288872512896094e-05, "loss": 1.1233, "num_input_tokens_seen": 10492272, "step": 2119, "train_runtime": 7329.3035, "train_tokens_per_second": 1431.551 }, { "epoch": 0.7797701149425287, "grad_norm": 0.3556925356388092, "learning_rate": 4.421518054532056e-05, "loss": 1.2759, "num_input_tokens_seen": 10498576, "step": 2120, "train_runtime": 7333.33, "train_tokens_per_second": 1431.625 }, { "epoch": 0.7801379310344828, "grad_norm": 0.391644686460495, "learning_rate": 4.414148857774503e-05, "loss": 1.2512, "num_input_tokens_seen": 10504592, "step": 2121, "train_runtime": 7337.2486, "train_tokens_per_second": 1431.68 }, { "epoch": 0.7805057471264368, "grad_norm": 0.3730500042438507, "learning_rate": 4.4067796610169495e-05, "loss": 1.2504, "num_input_tokens_seen": 10514624, "step": 2122, "train_runtime": 7343.2973, "train_tokens_per_second": 1431.867 }, { "epoch": 0.7808735632183909, "grad_norm": 0.35692721605300903, "learning_rate": 4.399410464259396e-05, "loss": 1.1246, "num_input_tokens_seen": 10518320, "step": 2123, "train_runtime": 7345.9169, "train_tokens_per_second": 1431.859 }, { "epoch": 0.7812413793103449, "grad_norm": 0.3872193992137909, "learning_rate": 4.3920412675018425e-05, "loss": 1.1556, "num_input_tokens_seen": 10524128, "step": 2124, "train_runtime": 7349.7361, "train_tokens_per_second": 1431.906 }, { "epoch": 0.7816091954022989, "grad_norm": 0.34768128395080566, "learning_rate": 4.384672070744289e-05, "loss": 1.1912, "num_input_tokens_seen": 10527616, "step": 2125, "train_runtime": 7352.201, "train_tokens_per_second": 1431.9 }, { "epoch": 0.7819770114942529, "grad_norm": 0.35486099123954773, "learning_rate": 4.3773028739867354e-05, "loss": 1.1583, "num_input_tokens_seen": 10533632, "step": 2126, "train_runtime": 7356.021, "train_tokens_per_second": 1431.974 }, { "epoch": 0.7823448275862069, "grad_norm": 0.3728826940059662, "learning_rate": 4.369933677229182e-05, "loss": 1.3217, "num_input_tokens_seen": 10537456, "step": 2127, "train_runtime": 7358.6015, "train_tokens_per_second": 1431.992 }, { "epoch": 0.782712643678161, "grad_norm": 0.3817051947116852, "learning_rate": 4.3625644804716284e-05, "loss": 1.1696, "num_input_tokens_seen": 10544192, "step": 2128, "train_runtime": 7362.7906, "train_tokens_per_second": 1432.092 }, { "epoch": 0.783080459770115, "grad_norm": 0.39544183015823364, "learning_rate": 4.3551952837140756e-05, "loss": 1.2827, "num_input_tokens_seen": 10550016, "step": 2129, "train_runtime": 7366.56, "train_tokens_per_second": 1432.15 }, { "epoch": 0.783448275862069, "grad_norm": 0.42103514075279236, "learning_rate": 4.347826086956522e-05, "loss": 1.1435, "num_input_tokens_seen": 10554192, "step": 2130, "train_runtime": 7369.4241, "train_tokens_per_second": 1432.16 }, { "epoch": 0.783816091954023, "grad_norm": 0.3514348268508911, "learning_rate": 4.3404568901989685e-05, "loss": 1.3526, "num_input_tokens_seen": 10559488, "step": 2131, "train_runtime": 7375.0906, "train_tokens_per_second": 1431.777 }, { "epoch": 0.784183908045977, "grad_norm": 0.4109044075012207, "learning_rate": 4.333087693441415e-05, "loss": 1.1822, "num_input_tokens_seen": 10564192, "step": 2132, "train_runtime": 7378.1956, "train_tokens_per_second": 1431.812 }, { "epoch": 0.7845517241379311, "grad_norm": 0.33501356840133667, "learning_rate": 4.3257184966838615e-05, "loss": 1.2004, "num_input_tokens_seen": 10570400, "step": 2133, "train_runtime": 7382.2336, "train_tokens_per_second": 1431.87 }, { "epoch": 0.7849195402298851, "grad_norm": 0.3741925060749054, "learning_rate": 4.318349299926308e-05, "loss": 1.0734, "num_input_tokens_seen": 10575824, "step": 2134, "train_runtime": 7385.8048, "train_tokens_per_second": 1431.912 }, { "epoch": 0.7852873563218391, "grad_norm": 0.3550627827644348, "learning_rate": 4.3109801031687544e-05, "loss": 1.2629, "num_input_tokens_seen": 10582336, "step": 2135, "train_runtime": 7389.8617, "train_tokens_per_second": 1432.007 }, { "epoch": 0.7856551724137931, "grad_norm": 0.3435611426830292, "learning_rate": 4.303610906411201e-05, "loss": 1.0417, "num_input_tokens_seen": 10585904, "step": 2136, "train_runtime": 7392.3224, "train_tokens_per_second": 1432.013 }, { "epoch": 0.7860229885057471, "grad_norm": 0.37348830699920654, "learning_rate": 4.296241709653648e-05, "loss": 1.258, "num_input_tokens_seen": 10590464, "step": 2137, "train_runtime": 7395.412, "train_tokens_per_second": 1432.032 }, { "epoch": 0.7863908045977012, "grad_norm": 0.341295063495636, "learning_rate": 4.2888725128960946e-05, "loss": 1.1567, "num_input_tokens_seen": 10594848, "step": 2138, "train_runtime": 7398.3796, "train_tokens_per_second": 1432.05 }, { "epoch": 0.7867586206896552, "grad_norm": 0.34383878111839294, "learning_rate": 4.281503316138541e-05, "loss": 1.1565, "num_input_tokens_seen": 10598880, "step": 2139, "train_runtime": 7401.1578, "train_tokens_per_second": 1432.057 }, { "epoch": 0.7871264367816092, "grad_norm": 0.3610958755016327, "learning_rate": 4.2741341193809875e-05, "loss": 1.2002, "num_input_tokens_seen": 10603104, "step": 2140, "train_runtime": 7404.0138, "train_tokens_per_second": 1432.075 }, { "epoch": 0.7874942528735632, "grad_norm": 0.3590060770511627, "learning_rate": 4.266764922623434e-05, "loss": 1.3145, "num_input_tokens_seen": 10610400, "step": 2141, "train_runtime": 7408.4911, "train_tokens_per_second": 1432.194 }, { "epoch": 0.7878620689655172, "grad_norm": 0.36746180057525635, "learning_rate": 4.2593957258658805e-05, "loss": 1.1656, "num_input_tokens_seen": 10614160, "step": 2142, "train_runtime": 7411.183, "train_tokens_per_second": 1432.182 }, { "epoch": 0.7882298850574713, "grad_norm": 0.4026757776737213, "learning_rate": 4.252026529108327e-05, "loss": 1.3014, "num_input_tokens_seen": 10618192, "step": 2143, "train_runtime": 7413.9877, "train_tokens_per_second": 1432.184 }, { "epoch": 0.7885977011494253, "grad_norm": 0.37475791573524475, "learning_rate": 4.2446573323507735e-05, "loss": 1.4171, "num_input_tokens_seen": 10622368, "step": 2144, "train_runtime": 7416.9176, "train_tokens_per_second": 1432.181 }, { "epoch": 0.7889655172413793, "grad_norm": 0.35653188824653625, "learning_rate": 4.2372881355932206e-05, "loss": 1.1512, "num_input_tokens_seen": 10629968, "step": 2145, "train_runtime": 7421.668, "train_tokens_per_second": 1432.288 }, { "epoch": 0.7893333333333333, "grad_norm": 0.3764266073703766, "learning_rate": 4.229918938835667e-05, "loss": 1.1602, "num_input_tokens_seen": 10636928, "step": 2146, "train_runtime": 7426.0222, "train_tokens_per_second": 1432.386 }, { "epoch": 0.7897011494252874, "grad_norm": 0.3702530860900879, "learning_rate": 4.2225497420781136e-05, "loss": 1.212, "num_input_tokens_seen": 10644272, "step": 2147, "train_runtime": 7430.5594, "train_tokens_per_second": 1432.499 }, { "epoch": 0.7900689655172414, "grad_norm": 0.3757065236568451, "learning_rate": 4.21518054532056e-05, "loss": 1.2507, "num_input_tokens_seen": 10649552, "step": 2148, "train_runtime": 7434.0824, "train_tokens_per_second": 1432.531 }, { "epoch": 0.7904367816091954, "grad_norm": 0.3695482611656189, "learning_rate": 4.2078113485630066e-05, "loss": 1.0818, "num_input_tokens_seen": 10653616, "step": 2149, "train_runtime": 7436.8915, "train_tokens_per_second": 1432.536 }, { "epoch": 0.7908045977011494, "grad_norm": 0.39494508504867554, "learning_rate": 4.200442151805453e-05, "loss": 1.3179, "num_input_tokens_seen": 10660784, "step": 2150, "train_runtime": 7441.3266, "train_tokens_per_second": 1432.646 }, { "epoch": 0.7911724137931034, "grad_norm": 0.3682766556739807, "learning_rate": 4.1930729550478995e-05, "loss": 1.1862, "num_input_tokens_seen": 10665456, "step": 2151, "train_runtime": 7444.4, "train_tokens_per_second": 1432.682 }, { "epoch": 0.7915402298850575, "grad_norm": 0.38218170404434204, "learning_rate": 4.185703758290346e-05, "loss": 1.3696, "num_input_tokens_seen": 10670624, "step": 2152, "train_runtime": 7447.7892, "train_tokens_per_second": 1432.724 }, { "epoch": 0.7919080459770115, "grad_norm": 0.34641164541244507, "learning_rate": 4.178334561532793e-05, "loss": 1.2038, "num_input_tokens_seen": 10677104, "step": 2153, "train_runtime": 7451.8744, "train_tokens_per_second": 1432.808 }, { "epoch": 0.7922758620689655, "grad_norm": 0.382000207901001, "learning_rate": 4.1709653647752396e-05, "loss": 1.1334, "num_input_tokens_seen": 10687360, "step": 2154, "train_runtime": 7458.0642, "train_tokens_per_second": 1432.994 }, { "epoch": 0.7926436781609195, "grad_norm": 0.35297074913978577, "learning_rate": 4.163596168017686e-05, "loss": 1.0983, "num_input_tokens_seen": 10691584, "step": 2155, "train_runtime": 7460.9209, "train_tokens_per_second": 1433.011 }, { "epoch": 0.7930114942528735, "grad_norm": 0.33983173966407776, "learning_rate": 4.1562269712601326e-05, "loss": 1.2581, "num_input_tokens_seen": 10697632, "step": 2156, "train_runtime": 7464.7815, "train_tokens_per_second": 1433.08 }, { "epoch": 0.7933793103448276, "grad_norm": 0.38186582922935486, "learning_rate": 4.148857774502579e-05, "loss": 1.2129, "num_input_tokens_seen": 10701152, "step": 2157, "train_runtime": 7467.3031, "train_tokens_per_second": 1433.068 }, { "epoch": 0.7937471264367816, "grad_norm": 0.36720943450927734, "learning_rate": 4.1414885777450256e-05, "loss": 1.3464, "num_input_tokens_seen": 10704976, "step": 2158, "train_runtime": 7469.9774, "train_tokens_per_second": 1433.067 }, { "epoch": 0.7941149425287356, "grad_norm": 0.35176119208335876, "learning_rate": 4.134119380987472e-05, "loss": 1.1796, "num_input_tokens_seen": 10711024, "step": 2159, "train_runtime": 7473.8773, "train_tokens_per_second": 1433.128 }, { "epoch": 0.7944827586206896, "grad_norm": 0.36766719818115234, "learning_rate": 4.126750184229919e-05, "loss": 1.2194, "num_input_tokens_seen": 10715472, "step": 2160, "train_runtime": 7476.8314, "train_tokens_per_second": 1433.157 }, { "epoch": 0.7948505747126436, "grad_norm": 0.3604617714881897, "learning_rate": 4.119380987472366e-05, "loss": 1.297, "num_input_tokens_seen": 10719584, "step": 2161, "train_runtime": 7482.2381, "train_tokens_per_second": 1432.671 }, { "epoch": 0.7952183908045977, "grad_norm": 0.35564473271369934, "learning_rate": 4.112011790714812e-05, "loss": 1.2508, "num_input_tokens_seen": 10723424, "step": 2162, "train_runtime": 7484.9512, "train_tokens_per_second": 1432.665 }, { "epoch": 0.7955862068965517, "grad_norm": 0.358351469039917, "learning_rate": 4.1046425939572587e-05, "loss": 1.1678, "num_input_tokens_seen": 10727888, "step": 2163, "train_runtime": 7488.0283, "train_tokens_per_second": 1432.672 }, { "epoch": 0.7959540229885057, "grad_norm": 0.3639545440673828, "learning_rate": 4.097273397199705e-05, "loss": 1.1054, "num_input_tokens_seen": 10732912, "step": 2164, "train_runtime": 7491.3757, "train_tokens_per_second": 1432.702 }, { "epoch": 0.7963218390804597, "grad_norm": 0.38622066378593445, "learning_rate": 4.089904200442152e-05, "loss": 1.2808, "num_input_tokens_seen": 10738496, "step": 2165, "train_runtime": 7495.0496, "train_tokens_per_second": 1432.745 }, { "epoch": 0.7966896551724137, "grad_norm": 0.35459399223327637, "learning_rate": 4.082535003684599e-05, "loss": 1.1949, "num_input_tokens_seen": 10742624, "step": 2166, "train_runtime": 7497.8397, "train_tokens_per_second": 1432.763 }, { "epoch": 0.7970574712643678, "grad_norm": 0.3667961657047272, "learning_rate": 4.075165806927045e-05, "loss": 1.2046, "num_input_tokens_seen": 10746592, "step": 2167, "train_runtime": 7500.6226, "train_tokens_per_second": 1432.76 }, { "epoch": 0.7974252873563218, "grad_norm": 0.36509400606155396, "learning_rate": 4.067796610169492e-05, "loss": 1.2754, "num_input_tokens_seen": 10754144, "step": 2168, "train_runtime": 7505.255, "train_tokens_per_second": 1432.882 }, { "epoch": 0.7977931034482758, "grad_norm": 0.35090118646621704, "learning_rate": 4.060427413411938e-05, "loss": 1.2592, "num_input_tokens_seen": 10765440, "step": 2169, "train_runtime": 7512.0198, "train_tokens_per_second": 1433.095 }, { "epoch": 0.7981609195402298, "grad_norm": 0.31430619955062866, "learning_rate": 4.0530582166543854e-05, "loss": 1.1928, "num_input_tokens_seen": 10776496, "step": 2170, "train_runtime": 7518.6907, "train_tokens_per_second": 1433.294 }, { "epoch": 0.798528735632184, "grad_norm": 0.3578290343284607, "learning_rate": 4.045689019896832e-05, "loss": 1.1974, "num_input_tokens_seen": 10780768, "step": 2171, "train_runtime": 7521.6037, "train_tokens_per_second": 1433.307 }, { "epoch": 0.798896551724138, "grad_norm": 0.35479453206062317, "learning_rate": 4.0383198231392783e-05, "loss": 1.1515, "num_input_tokens_seen": 10786080, "step": 2172, "train_runtime": 7525.1122, "train_tokens_per_second": 1433.345 }, { "epoch": 0.799264367816092, "grad_norm": 0.3450087010860443, "learning_rate": 4.030950626381725e-05, "loss": 1.246, "num_input_tokens_seen": 10789728, "step": 2173, "train_runtime": 7527.6927, "train_tokens_per_second": 1433.338 }, { "epoch": 0.799632183908046, "grad_norm": 0.36223742365837097, "learning_rate": 4.023581429624171e-05, "loss": 1.3354, "num_input_tokens_seen": 10794064, "step": 2174, "train_runtime": 7530.6743, "train_tokens_per_second": 1433.346 }, { "epoch": 0.8, "grad_norm": 0.3862453103065491, "learning_rate": 4.016212232866618e-05, "loss": 1.2895, "num_input_tokens_seen": 10804720, "step": 2175, "train_runtime": 7537.0892, "train_tokens_per_second": 1433.54 }, { "epoch": 0.8003678160919541, "grad_norm": 0.3645070493221283, "learning_rate": 4.008843036109064e-05, "loss": 1.1983, "num_input_tokens_seen": 10811552, "step": 2176, "train_runtime": 7541.3356, "train_tokens_per_second": 1433.639 }, { "epoch": 0.8003678160919541, "eval_loss": 1.2086011171340942, "eval_runtime": 15.5238, "eval_samples_per_second": 64.417, "eval_steps_per_second": 4.058, "num_input_tokens_seen": 10811552, "step": 2176 }, { "epoch": 0.8007356321839081, "grad_norm": 0.39066165685653687, "learning_rate": 4.0014738393515114e-05, "loss": 1.2683, "num_input_tokens_seen": 10815472, "step": 2177, "train_runtime": 7559.6274, "train_tokens_per_second": 1430.689 }, { "epoch": 0.8011034482758621, "grad_norm": 0.3674662709236145, "learning_rate": 3.994104642593958e-05, "loss": 1.1264, "num_input_tokens_seen": 10820000, "step": 2178, "train_runtime": 7562.7024, "train_tokens_per_second": 1430.706 }, { "epoch": 0.8014712643678161, "grad_norm": 0.39019522070884705, "learning_rate": 3.9867354458364044e-05, "loss": 1.2636, "num_input_tokens_seen": 10824704, "step": 2179, "train_runtime": 7565.9112, "train_tokens_per_second": 1430.72 }, { "epoch": 0.8018390804597701, "grad_norm": 0.36135849356651306, "learning_rate": 3.979366249078851e-05, "loss": 1.1094, "num_input_tokens_seen": 10829824, "step": 2180, "train_runtime": 7569.2761, "train_tokens_per_second": 1430.761 }, { "epoch": 0.8022068965517242, "grad_norm": 0.33432087302207947, "learning_rate": 3.9719970523212974e-05, "loss": 1.2246, "num_input_tokens_seen": 10833600, "step": 2181, "train_runtime": 7571.856, "train_tokens_per_second": 1430.772 }, { "epoch": 0.8025747126436782, "grad_norm": 0.34472835063934326, "learning_rate": 3.964627855563744e-05, "loss": 1.1524, "num_input_tokens_seen": 10840256, "step": 2182, "train_runtime": 7576.1201, "train_tokens_per_second": 1430.845 }, { "epoch": 0.8029425287356322, "grad_norm": 0.36489275097846985, "learning_rate": 3.95725865880619e-05, "loss": 1.2153, "num_input_tokens_seen": 10843888, "step": 2183, "train_runtime": 7578.7159, "train_tokens_per_second": 1430.834 }, { "epoch": 0.8033103448275862, "grad_norm": 0.3496350944042206, "learning_rate": 3.949889462048637e-05, "loss": 1.1331, "num_input_tokens_seen": 10847504, "step": 2184, "train_runtime": 7581.4713, "train_tokens_per_second": 1430.791 }, { "epoch": 0.8036781609195403, "grad_norm": 0.34375157952308655, "learning_rate": 3.942520265291084e-05, "loss": 1.0461, "num_input_tokens_seen": 10851472, "step": 2185, "train_runtime": 7584.2024, "train_tokens_per_second": 1430.799 }, { "epoch": 0.8040459770114943, "grad_norm": 0.3992886245250702, "learning_rate": 3.9351510685335305e-05, "loss": 1.3437, "num_input_tokens_seen": 10856912, "step": 2186, "train_runtime": 7587.7458, "train_tokens_per_second": 1430.848 }, { "epoch": 0.8044137931034483, "grad_norm": 0.3416062295436859, "learning_rate": 3.927781871775977e-05, "loss": 0.9705, "num_input_tokens_seen": 10860896, "step": 2187, "train_runtime": 7590.5901, "train_tokens_per_second": 1430.837 }, { "epoch": 0.8047816091954023, "grad_norm": 0.4134158492088318, "learning_rate": 3.9204126750184234e-05, "loss": 1.3652, "num_input_tokens_seen": 10866416, "step": 2188, "train_runtime": 7594.2799, "train_tokens_per_second": 1430.869 }, { "epoch": 0.8051494252873563, "grad_norm": 0.3477571904659271, "learning_rate": 3.91304347826087e-05, "loss": 1.1635, "num_input_tokens_seen": 10872944, "step": 2189, "train_runtime": 7598.469, "train_tokens_per_second": 1430.939 }, { "epoch": 0.8055172413793104, "grad_norm": 0.3680364787578583, "learning_rate": 3.9056742815033164e-05, "loss": 1.1893, "num_input_tokens_seen": 10880304, "step": 2190, "train_runtime": 7603.0756, "train_tokens_per_second": 1431.04 }, { "epoch": 0.8058850574712644, "grad_norm": 0.33584916591644287, "learning_rate": 3.898305084745763e-05, "loss": 1.0544, "num_input_tokens_seen": 10883856, "step": 2191, "train_runtime": 7607.8385, "train_tokens_per_second": 1430.611 }, { "epoch": 0.8062528735632184, "grad_norm": 0.3721490800380707, "learning_rate": 3.8909358879882093e-05, "loss": 1.1083, "num_input_tokens_seen": 10888176, "step": 2192, "train_runtime": 7610.7579, "train_tokens_per_second": 1430.63 }, { "epoch": 0.8066206896551724, "grad_norm": 0.3533916771411896, "learning_rate": 3.8835666912306565e-05, "loss": 1.278, "num_input_tokens_seen": 10892560, "step": 2193, "train_runtime": 7613.6766, "train_tokens_per_second": 1430.657 }, { "epoch": 0.8069885057471264, "grad_norm": 0.38169029355049133, "learning_rate": 3.876197494473103e-05, "loss": 1.2225, "num_input_tokens_seen": 10896208, "step": 2194, "train_runtime": 7616.339, "train_tokens_per_second": 1430.636 }, { "epoch": 0.8073563218390805, "grad_norm": 0.3399798572063446, "learning_rate": 3.8688282977155495e-05, "loss": 1.1528, "num_input_tokens_seen": 10900240, "step": 2195, "train_runtime": 7619.1576, "train_tokens_per_second": 1430.636 }, { "epoch": 0.8077241379310345, "grad_norm": 0.374094694852829, "learning_rate": 3.861459100957996e-05, "loss": 1.2981, "num_input_tokens_seen": 10905696, "step": 2196, "train_runtime": 7622.7302, "train_tokens_per_second": 1430.681 }, { "epoch": 0.8080919540229885, "grad_norm": 0.3852567672729492, "learning_rate": 3.8540899042004424e-05, "loss": 1.3074, "num_input_tokens_seen": 10909904, "step": 2197, "train_runtime": 7625.612, "train_tokens_per_second": 1430.692 }, { "epoch": 0.8084597701149425, "grad_norm": 0.3825359642505646, "learning_rate": 3.846720707442889e-05, "loss": 1.2137, "num_input_tokens_seen": 10913824, "step": 2198, "train_runtime": 7628.3177, "train_tokens_per_second": 1430.699 }, { "epoch": 0.8088275862068965, "grad_norm": 0.37729591131210327, "learning_rate": 3.8393515106853354e-05, "loss": 1.1584, "num_input_tokens_seen": 10919216, "step": 2199, "train_runtime": 7631.8241, "train_tokens_per_second": 1430.748 }, { "epoch": 0.8091954022988506, "grad_norm": 0.35168570280075073, "learning_rate": 3.831982313927782e-05, "loss": 1.1989, "num_input_tokens_seen": 10923136, "step": 2200, "train_runtime": 7634.5589, "train_tokens_per_second": 1430.749 }, { "epoch": 0.8095632183908046, "grad_norm": 0.373208224773407, "learning_rate": 3.824613117170229e-05, "loss": 1.1844, "num_input_tokens_seen": 10928224, "step": 2201, "train_runtime": 7637.8986, "train_tokens_per_second": 1430.789 }, { "epoch": 0.8099310344827586, "grad_norm": 0.3567676842212677, "learning_rate": 3.8172439204126755e-05, "loss": 1.1947, "num_input_tokens_seen": 10932864, "step": 2202, "train_runtime": 7641.0302, "train_tokens_per_second": 1430.81 }, { "epoch": 0.8102988505747126, "grad_norm": 0.4092943072319031, "learning_rate": 3.809874723655122e-05, "loss": 1.1706, "num_input_tokens_seen": 10939552, "step": 2203, "train_runtime": 7645.3388, "train_tokens_per_second": 1430.879 }, { "epoch": 0.8106666666666666, "grad_norm": 0.35322707891464233, "learning_rate": 3.8025055268975685e-05, "loss": 1.2156, "num_input_tokens_seen": 10944144, "step": 2204, "train_runtime": 7648.3843, "train_tokens_per_second": 1430.909 }, { "epoch": 0.8110344827586207, "grad_norm": 0.39123642444610596, "learning_rate": 3.795136330140015e-05, "loss": 1.136, "num_input_tokens_seen": 10949328, "step": 2205, "train_runtime": 7651.8119, "train_tokens_per_second": 1430.946 }, { "epoch": 0.8114022988505747, "grad_norm": 0.3603310286998749, "learning_rate": 3.7877671333824615e-05, "loss": 1.1049, "num_input_tokens_seen": 10955296, "step": 2206, "train_runtime": 7655.525, "train_tokens_per_second": 1431.031 }, { "epoch": 0.8117701149425287, "grad_norm": 0.39141908288002014, "learning_rate": 3.780397936624908e-05, "loss": 1.176, "num_input_tokens_seen": 10958592, "step": 2207, "train_runtime": 7657.9013, "train_tokens_per_second": 1431.018 }, { "epoch": 0.8121379310344827, "grad_norm": 0.3875255882740021, "learning_rate": 3.7730287398673544e-05, "loss": 1.2343, "num_input_tokens_seen": 10964544, "step": 2208, "train_runtime": 7661.8026, "train_tokens_per_second": 1431.066 }, { "epoch": 0.8125057471264368, "grad_norm": 0.3603978455066681, "learning_rate": 3.7656595431098016e-05, "loss": 1.1432, "num_input_tokens_seen": 10968384, "step": 2209, "train_runtime": 7664.5354, "train_tokens_per_second": 1431.057 }, { "epoch": 0.8128735632183908, "grad_norm": 0.3609590530395508, "learning_rate": 3.758290346352248e-05, "loss": 1.1367, "num_input_tokens_seen": 10973136, "step": 2210, "train_runtime": 7667.6589, "train_tokens_per_second": 1431.093 }, { "epoch": 0.8132413793103448, "grad_norm": 0.4301469326019287, "learning_rate": 3.7509211495946945e-05, "loss": 1.1845, "num_input_tokens_seen": 10978128, "step": 2211, "train_runtime": 7670.981, "train_tokens_per_second": 1431.124 }, { "epoch": 0.8136091954022988, "grad_norm": 0.36393284797668457, "learning_rate": 3.743551952837141e-05, "loss": 1.2357, "num_input_tokens_seen": 10982400, "step": 2212, "train_runtime": 7674.0159, "train_tokens_per_second": 1431.115 }, { "epoch": 0.8139770114942528, "grad_norm": 0.3666031062602997, "learning_rate": 3.7361827560795875e-05, "loss": 1.0967, "num_input_tokens_seen": 10986512, "step": 2213, "train_runtime": 7676.8909, "train_tokens_per_second": 1431.115 }, { "epoch": 0.8143448275862069, "grad_norm": 0.340594083070755, "learning_rate": 3.728813559322034e-05, "loss": 1.195, "num_input_tokens_seen": 10991888, "step": 2214, "train_runtime": 7680.4017, "train_tokens_per_second": 1431.161 }, { "epoch": 0.8147126436781609, "grad_norm": 0.38579240441322327, "learning_rate": 3.7214443625644805e-05, "loss": 1.2717, "num_input_tokens_seen": 10995872, "step": 2215, "train_runtime": 7683.1653, "train_tokens_per_second": 1431.164 }, { "epoch": 0.8150804597701149, "grad_norm": 0.374298095703125, "learning_rate": 3.714075165806927e-05, "loss": 1.072, "num_input_tokens_seen": 11002304, "step": 2216, "train_runtime": 7687.325, "train_tokens_per_second": 1431.227 }, { "epoch": 0.8154482758620689, "grad_norm": 0.36412107944488525, "learning_rate": 3.706705969049374e-05, "loss": 1.1551, "num_input_tokens_seen": 11006096, "step": 2217, "train_runtime": 7690.0185, "train_tokens_per_second": 1431.218 }, { "epoch": 0.8158160919540229, "grad_norm": 0.3489569425582886, "learning_rate": 3.6993367722918206e-05, "loss": 1.2231, "num_input_tokens_seen": 11013152, "step": 2218, "train_runtime": 7694.5239, "train_tokens_per_second": 1431.297 }, { "epoch": 0.816183908045977, "grad_norm": 0.3949083387851715, "learning_rate": 3.691967575534267e-05, "loss": 1.2647, "num_input_tokens_seen": 11017792, "step": 2219, "train_runtime": 7697.6911, "train_tokens_per_second": 1431.311 }, { "epoch": 0.8165517241379311, "grad_norm": 0.3573471009731293, "learning_rate": 3.6845983787767136e-05, "loss": 1.2449, "num_input_tokens_seen": 11021088, "step": 2220, "train_runtime": 7700.0701, "train_tokens_per_second": 1431.297 }, { "epoch": 0.8169195402298851, "grad_norm": 0.367899090051651, "learning_rate": 3.67722918201916e-05, "loss": 1.2773, "num_input_tokens_seen": 11025216, "step": 2221, "train_runtime": 7705.1169, "train_tokens_per_second": 1430.895 }, { "epoch": 0.8172873563218391, "grad_norm": 0.43307703733444214, "learning_rate": 3.6698599852616065e-05, "loss": 1.3283, "num_input_tokens_seen": 11029488, "step": 2222, "train_runtime": 7708.0306, "train_tokens_per_second": 1430.909 }, { "epoch": 0.8176551724137932, "grad_norm": 0.381436824798584, "learning_rate": 3.662490788504053e-05, "loss": 1.1985, "num_input_tokens_seen": 11032928, "step": 2223, "train_runtime": 7710.4838, "train_tokens_per_second": 1430.9 }, { "epoch": 0.8180229885057472, "grad_norm": 0.360688179731369, "learning_rate": 3.6551215917464995e-05, "loss": 1.1584, "num_input_tokens_seen": 11037488, "step": 2224, "train_runtime": 7713.5048, "train_tokens_per_second": 1430.93 }, { "epoch": 0.8183908045977012, "grad_norm": 0.3755568563938141, "learning_rate": 3.6477523949889466e-05, "loss": 1.106, "num_input_tokens_seen": 11042016, "step": 2225, "train_runtime": 7716.6039, "train_tokens_per_second": 1430.942 }, { "epoch": 0.8187586206896552, "grad_norm": 0.34972530603408813, "learning_rate": 3.640383198231393e-05, "loss": 0.9777, "num_input_tokens_seen": 11046384, "step": 2226, "train_runtime": 7719.5414, "train_tokens_per_second": 1430.964 }, { "epoch": 0.8191264367816092, "grad_norm": 0.4256415069103241, "learning_rate": 3.6330140014738396e-05, "loss": 1.3821, "num_input_tokens_seen": 11049760, "step": 2227, "train_runtime": 7721.9841, "train_tokens_per_second": 1430.948 }, { "epoch": 0.8194942528735633, "grad_norm": 0.3539048135280609, "learning_rate": 3.625644804716286e-05, "loss": 1.219, "num_input_tokens_seen": 11053232, "step": 2228, "train_runtime": 7724.4618, "train_tokens_per_second": 1430.939 }, { "epoch": 0.8198620689655173, "grad_norm": 0.34744372963905334, "learning_rate": 3.6182756079587326e-05, "loss": 1.186, "num_input_tokens_seen": 11057280, "step": 2229, "train_runtime": 7727.1989, "train_tokens_per_second": 1430.956 }, { "epoch": 0.8202298850574713, "grad_norm": 0.3572700023651123, "learning_rate": 3.610906411201179e-05, "loss": 1.131, "num_input_tokens_seen": 11062912, "step": 2230, "train_runtime": 7730.8321, "train_tokens_per_second": 1431.012 }, { "epoch": 0.8205977011494253, "grad_norm": 0.34894219040870667, "learning_rate": 3.6035372144436255e-05, "loss": 1.3993, "num_input_tokens_seen": 11071264, "step": 2231, "train_runtime": 7736.0791, "train_tokens_per_second": 1431.121 }, { "epoch": 0.8209655172413793, "grad_norm": 0.36651894450187683, "learning_rate": 3.596168017686073e-05, "loss": 1.0528, "num_input_tokens_seen": 11074352, "step": 2232, "train_runtime": 7738.383, "train_tokens_per_second": 1431.094 }, { "epoch": 0.8213333333333334, "grad_norm": 0.37314262986183167, "learning_rate": 3.588798820928519e-05, "loss": 1.1481, "num_input_tokens_seen": 11080928, "step": 2233, "train_runtime": 7742.5022, "train_tokens_per_second": 1431.182 }, { "epoch": 0.8217011494252874, "grad_norm": 0.3408365845680237, "learning_rate": 3.5814296241709657e-05, "loss": 1.1784, "num_input_tokens_seen": 11085616, "step": 2234, "train_runtime": 7745.757, "train_tokens_per_second": 1431.186 }, { "epoch": 0.8220689655172414, "grad_norm": 0.409574031829834, "learning_rate": 3.574060427413412e-05, "loss": 1.1684, "num_input_tokens_seen": 11089136, "step": 2235, "train_runtime": 7748.2761, "train_tokens_per_second": 1431.175 }, { "epoch": 0.8224367816091954, "grad_norm": 0.382395476102829, "learning_rate": 3.5666912306558586e-05, "loss": 1.1465, "num_input_tokens_seen": 11097488, "step": 2236, "train_runtime": 7753.5567, "train_tokens_per_second": 1431.277 }, { "epoch": 0.8228045977011494, "grad_norm": 0.35066017508506775, "learning_rate": 3.559322033898305e-05, "loss": 1.2212, "num_input_tokens_seen": 11101600, "step": 2237, "train_runtime": 7756.4119, "train_tokens_per_second": 1431.28 }, { "epoch": 0.8231724137931035, "grad_norm": 0.3712022006511688, "learning_rate": 3.5519528371407516e-05, "loss": 1.2685, "num_input_tokens_seen": 11105312, "step": 2238, "train_runtime": 7759.0206, "train_tokens_per_second": 1431.278 }, { "epoch": 0.8235402298850575, "grad_norm": 0.3650802969932556, "learning_rate": 3.544583640383198e-05, "loss": 1.0869, "num_input_tokens_seen": 11108944, "step": 2239, "train_runtime": 7761.6182, "train_tokens_per_second": 1431.266 }, { "epoch": 0.8239080459770115, "grad_norm": 0.34153664112091064, "learning_rate": 3.537214443625645e-05, "loss": 1.2786, "num_input_tokens_seen": 11115968, "step": 2240, "train_runtime": 7766.0717, "train_tokens_per_second": 1431.35 }, { "epoch": 0.8242758620689655, "grad_norm": 0.3589034676551819, "learning_rate": 3.529845246868092e-05, "loss": 1.1396, "num_input_tokens_seen": 11120800, "step": 2241, "train_runtime": 7769.3388, "train_tokens_per_second": 1431.37 }, { "epoch": 0.8246436781609195, "grad_norm": 0.3497578501701355, "learning_rate": 3.522476050110538e-05, "loss": 1.2812, "num_input_tokens_seen": 11124496, "step": 2242, "train_runtime": 7771.8913, "train_tokens_per_second": 1431.376 }, { "epoch": 0.8250114942528736, "grad_norm": 0.3567488193511963, "learning_rate": 3.515106853352985e-05, "loss": 1.1238, "num_input_tokens_seen": 11128224, "step": 2243, "train_runtime": 7774.5255, "train_tokens_per_second": 1431.37 }, { "epoch": 0.8253793103448276, "grad_norm": 0.37901973724365234, "learning_rate": 3.507737656595431e-05, "loss": 1.2452, "num_input_tokens_seen": 11131872, "step": 2244, "train_runtime": 7777.1698, "train_tokens_per_second": 1431.353 }, { "epoch": 0.8257471264367816, "grad_norm": 0.3546604514122009, "learning_rate": 3.5003684598378776e-05, "loss": 1.2136, "num_input_tokens_seen": 11135600, "step": 2245, "train_runtime": 7779.832, "train_tokens_per_second": 1431.342 }, { "epoch": 0.8261149425287356, "grad_norm": 0.39348286390304565, "learning_rate": 3.492999263080324e-05, "loss": 1.1029, "num_input_tokens_seen": 11139184, "step": 2246, "train_runtime": 7782.354, "train_tokens_per_second": 1431.339 }, { "epoch": 0.8264827586206897, "grad_norm": 0.34764671325683594, "learning_rate": 3.4856300663227706e-05, "loss": 1.0123, "num_input_tokens_seen": 11143712, "step": 2247, "train_runtime": 7785.4539, "train_tokens_per_second": 1431.35 }, { "epoch": 0.8268505747126437, "grad_norm": 0.35627540946006775, "learning_rate": 3.478260869565218e-05, "loss": 1.157, "num_input_tokens_seen": 11149728, "step": 2248, "train_runtime": 7789.3734, "train_tokens_per_second": 1431.402 }, { "epoch": 0.8272183908045977, "grad_norm": 0.35804876685142517, "learning_rate": 3.470891672807664e-05, "loss": 1.1953, "num_input_tokens_seen": 11153520, "step": 2249, "train_runtime": 7792.0955, "train_tokens_per_second": 1431.389 }, { "epoch": 0.8275862068965517, "grad_norm": 0.3648607134819031, "learning_rate": 3.463522476050111e-05, "loss": 1.2814, "num_input_tokens_seen": 11160592, "step": 2250, "train_runtime": 7796.6243, "train_tokens_per_second": 1431.465 }, { "epoch": 0.8279540229885057, "grad_norm": 0.4124414920806885, "learning_rate": 3.456153279292557e-05, "loss": 1.2525, "num_input_tokens_seen": 11164992, "step": 2251, "train_runtime": 7801.6859, "train_tokens_per_second": 1431.1 }, { "epoch": 0.8283218390804598, "grad_norm": 0.4313027560710907, "learning_rate": 3.448784082535004e-05, "loss": 1.2966, "num_input_tokens_seen": 11169216, "step": 2252, "train_runtime": 7804.5487, "train_tokens_per_second": 1431.116 }, { "epoch": 0.8286896551724138, "grad_norm": 0.34469956159591675, "learning_rate": 3.44141488577745e-05, "loss": 1.1824, "num_input_tokens_seen": 11174400, "step": 2253, "train_runtime": 7808.0642, "train_tokens_per_second": 1431.136 }, { "epoch": 0.8290574712643678, "grad_norm": 0.38931646943092346, "learning_rate": 3.4340456890198967e-05, "loss": 1.2728, "num_input_tokens_seen": 11178592, "step": 2254, "train_runtime": 7810.959, "train_tokens_per_second": 1431.142 }, { "epoch": 0.8294252873563218, "grad_norm": 0.3734469711780548, "learning_rate": 3.426676492262343e-05, "loss": 1.2284, "num_input_tokens_seen": 11183664, "step": 2255, "train_runtime": 7814.3296, "train_tokens_per_second": 1431.174 }, { "epoch": 0.8297931034482758, "grad_norm": 0.34597718715667725, "learning_rate": 3.41930729550479e-05, "loss": 1.2758, "num_input_tokens_seen": 11188928, "step": 2256, "train_runtime": 7817.7848, "train_tokens_per_second": 1431.215 }, { "epoch": 0.8301609195402299, "grad_norm": 0.35527363419532776, "learning_rate": 3.411938098747237e-05, "loss": 1.1719, "num_input_tokens_seen": 11194368, "step": 2257, "train_runtime": 7821.3777, "train_tokens_per_second": 1431.253 }, { "epoch": 0.8305287356321839, "grad_norm": 0.3635798990726471, "learning_rate": 3.404568901989683e-05, "loss": 1.0338, "num_input_tokens_seen": 11201376, "step": 2258, "train_runtime": 7825.8569, "train_tokens_per_second": 1431.329 }, { "epoch": 0.8308965517241379, "grad_norm": 0.36341825127601624, "learning_rate": 3.39719970523213e-05, "loss": 1.1644, "num_input_tokens_seen": 11206656, "step": 2259, "train_runtime": 7829.3427, "train_tokens_per_second": 1431.366 }, { "epoch": 0.8312643678160919, "grad_norm": 0.4638970196247101, "learning_rate": 3.389830508474576e-05, "loss": 1.3294, "num_input_tokens_seen": 11210160, "step": 2260, "train_runtime": 7831.8261, "train_tokens_per_second": 1431.36 }, { "epoch": 0.8316321839080459, "grad_norm": 0.38175779581069946, "learning_rate": 3.382461311717023e-05, "loss": 1.2148, "num_input_tokens_seen": 11213232, "step": 2261, "train_runtime": 7834.1561, "train_tokens_per_second": 1431.326 }, { "epoch": 0.832, "grad_norm": 0.3692260682582855, "learning_rate": 3.375092114959469e-05, "loss": 1.215, "num_input_tokens_seen": 11218016, "step": 2262, "train_runtime": 7837.3362, "train_tokens_per_second": 1431.356 }, { "epoch": 0.832367816091954, "grad_norm": 0.36855754256248474, "learning_rate": 3.367722918201916e-05, "loss": 1.1863, "num_input_tokens_seen": 11222256, "step": 2263, "train_runtime": 7840.3362, "train_tokens_per_second": 1431.349 }, { "epoch": 0.832735632183908, "grad_norm": 0.3529607653617859, "learning_rate": 3.360353721444363e-05, "loss": 1.2546, "num_input_tokens_seen": 11228112, "step": 2264, "train_runtime": 7844.23, "train_tokens_per_second": 1431.385 }, { "epoch": 0.833103448275862, "grad_norm": 0.33194971084594727, "learning_rate": 3.352984524686809e-05, "loss": 1.1762, "num_input_tokens_seen": 11235600, "step": 2265, "train_runtime": 7848.9221, "train_tokens_per_second": 1431.483 }, { "epoch": 0.833471264367816, "grad_norm": 0.3698999285697937, "learning_rate": 3.345615327929256e-05, "loss": 1.324, "num_input_tokens_seen": 11241920, "step": 2266, "train_runtime": 7853.0252, "train_tokens_per_second": 1431.54 }, { "epoch": 0.8338390804597701, "grad_norm": 0.3352484703063965, "learning_rate": 3.338246131171702e-05, "loss": 1.1774, "num_input_tokens_seen": 11248640, "step": 2267, "train_runtime": 7857.293, "train_tokens_per_second": 1431.618 }, { "epoch": 0.8342068965517241, "grad_norm": 0.3569459617137909, "learning_rate": 3.330876934414149e-05, "loss": 1.1983, "num_input_tokens_seen": 11253344, "step": 2268, "train_runtime": 7860.4294, "train_tokens_per_second": 1431.645 }, { "epoch": 0.8345747126436781, "grad_norm": 0.3377792239189148, "learning_rate": 3.323507737656595e-05, "loss": 1.1995, "num_input_tokens_seen": 11257616, "step": 2269, "train_runtime": 7863.4488, "train_tokens_per_second": 1431.638 }, { "epoch": 0.8349425287356322, "grad_norm": 0.3700810372829437, "learning_rate": 3.316138540899042e-05, "loss": 1.1721, "num_input_tokens_seen": 11260928, "step": 2270, "train_runtime": 7865.9019, "train_tokens_per_second": 1431.613 }, { "epoch": 0.8353103448275863, "grad_norm": 0.37969207763671875, "learning_rate": 3.308769344141488e-05, "loss": 1.2362, "num_input_tokens_seen": 11265936, "step": 2271, "train_runtime": 7869.2105, "train_tokens_per_second": 1431.648 }, { "epoch": 0.8356781609195403, "grad_norm": 0.3042827546596527, "learning_rate": 3.3014001473839354e-05, "loss": 1.0416, "num_input_tokens_seen": 11271264, "step": 2272, "train_runtime": 7872.7361, "train_tokens_per_second": 1431.683 }, { "epoch": 0.8360459770114943, "grad_norm": 0.3895162343978882, "learning_rate": 3.294030950626382e-05, "loss": 1.2003, "num_input_tokens_seen": 11277920, "step": 2273, "train_runtime": 7876.9019, "train_tokens_per_second": 1431.771 }, { "epoch": 0.8364137931034483, "grad_norm": 0.34355947375297546, "learning_rate": 3.286661753868828e-05, "loss": 1.1156, "num_input_tokens_seen": 11281072, "step": 2274, "train_runtime": 7879.2639, "train_tokens_per_second": 1431.742 }, { "epoch": 0.8367816091954023, "grad_norm": 0.3605348765850067, "learning_rate": 3.279292557111275e-05, "loss": 1.2835, "num_input_tokens_seen": 11287072, "step": 2275, "train_runtime": 7883.2458, "train_tokens_per_second": 1431.78 }, { "epoch": 0.8371494252873564, "grad_norm": 0.37450411915779114, "learning_rate": 3.271923360353721e-05, "loss": 1.1573, "num_input_tokens_seen": 11290656, "step": 2276, "train_runtime": 7885.8722, "train_tokens_per_second": 1431.757 }, { "epoch": 0.8375172413793104, "grad_norm": 0.39006364345550537, "learning_rate": 3.264554163596168e-05, "loss": 1.1191, "num_input_tokens_seen": 11295024, "step": 2277, "train_runtime": 7888.8491, "train_tokens_per_second": 1431.771 }, { "epoch": 0.8378850574712644, "grad_norm": 0.39977237582206726, "learning_rate": 3.257184966838614e-05, "loss": 1.1304, "num_input_tokens_seen": 11298704, "step": 2278, "train_runtime": 7891.4723, "train_tokens_per_second": 1431.761 }, { "epoch": 0.8382528735632184, "grad_norm": 0.3386874794960022, "learning_rate": 3.2498157700810614e-05, "loss": 1.0305, "num_input_tokens_seen": 11303984, "step": 2279, "train_runtime": 7894.975, "train_tokens_per_second": 1431.795 }, { "epoch": 0.8386206896551724, "grad_norm": 0.37369704246520996, "learning_rate": 3.242446573323508e-05, "loss": 1.2185, "num_input_tokens_seen": 11308736, "step": 2280, "train_runtime": 7898.1684, "train_tokens_per_second": 1431.818 }, { "epoch": 0.8389885057471265, "grad_norm": 0.3337636888027191, "learning_rate": 3.2350773765659544e-05, "loss": 1.1213, "num_input_tokens_seen": 11314416, "step": 2281, "train_runtime": 7903.9686, "train_tokens_per_second": 1431.485 }, { "epoch": 0.8393563218390805, "grad_norm": 0.40354880690574646, "learning_rate": 3.227708179808401e-05, "loss": 1.3279, "num_input_tokens_seen": 11318368, "step": 2282, "train_runtime": 7906.7065, "train_tokens_per_second": 1431.49 }, { "epoch": 0.8397241379310345, "grad_norm": 0.37759336829185486, "learning_rate": 3.2203389830508473e-05, "loss": 1.2324, "num_input_tokens_seen": 11324336, "step": 2283, "train_runtime": 7910.5392, "train_tokens_per_second": 1431.55 }, { "epoch": 0.8400919540229885, "grad_norm": 0.3506891131401062, "learning_rate": 3.212969786293294e-05, "loss": 1.2108, "num_input_tokens_seen": 11328160, "step": 2284, "train_runtime": 7913.2181, "train_tokens_per_second": 1431.549 }, { "epoch": 0.8404597701149426, "grad_norm": 0.38749098777770996, "learning_rate": 3.20560058953574e-05, "loss": 1.2173, "num_input_tokens_seen": 11333504, "step": 2285, "train_runtime": 7916.7276, "train_tokens_per_second": 1431.589 }, { "epoch": 0.8408275862068966, "grad_norm": 0.3610440492630005, "learning_rate": 3.198231392778187e-05, "loss": 1.194, "num_input_tokens_seen": 11337648, "step": 2286, "train_runtime": 7919.6302, "train_tokens_per_second": 1431.588 }, { "epoch": 0.8411954022988506, "grad_norm": 0.34255412220954895, "learning_rate": 3.190862196020634e-05, "loss": 1.0885, "num_input_tokens_seen": 11343856, "step": 2287, "train_runtime": 7923.6604, "train_tokens_per_second": 1431.643 }, { "epoch": 0.8415632183908046, "grad_norm": 0.3525124192237854, "learning_rate": 3.1834929992630804e-05, "loss": 1.1454, "num_input_tokens_seen": 11348512, "step": 2288, "train_runtime": 7926.8055, "train_tokens_per_second": 1431.663 }, { "epoch": 0.8419310344827586, "grad_norm": 0.3775132894515991, "learning_rate": 3.1761238025055276e-05, "loss": 1.3019, "num_input_tokens_seen": 11353040, "step": 2289, "train_runtime": 7929.8157, "train_tokens_per_second": 1431.69 }, { "epoch": 0.8422988505747127, "grad_norm": 0.3541698157787323, "learning_rate": 3.168754605747974e-05, "loss": 1.0868, "num_input_tokens_seen": 11357936, "step": 2290, "train_runtime": 7933.1536, "train_tokens_per_second": 1431.705 }, { "epoch": 0.8426666666666667, "grad_norm": 0.3667600154876709, "learning_rate": 3.1613854089904206e-05, "loss": 1.1032, "num_input_tokens_seen": 11361568, "step": 2291, "train_runtime": 7935.7209, "train_tokens_per_second": 1431.7 }, { "epoch": 0.8430344827586207, "grad_norm": 0.39227744936943054, "learning_rate": 3.154016212232867e-05, "loss": 1.1824, "num_input_tokens_seen": 11365344, "step": 2292, "train_runtime": 7938.3863, "train_tokens_per_second": 1431.694 }, { "epoch": 0.8434022988505747, "grad_norm": 0.34459492564201355, "learning_rate": 3.1466470154753135e-05, "loss": 1.2114, "num_input_tokens_seen": 11371376, "step": 2293, "train_runtime": 7942.2651, "train_tokens_per_second": 1431.755 }, { "epoch": 0.8437701149425287, "grad_norm": 0.3658595383167267, "learning_rate": 3.13927781871776e-05, "loss": 1.2453, "num_input_tokens_seen": 11375232, "step": 2294, "train_runtime": 7944.9421, "train_tokens_per_second": 1431.758 }, { "epoch": 0.8441379310344828, "grad_norm": 0.3694017827510834, "learning_rate": 3.1319086219602065e-05, "loss": 1.2455, "num_input_tokens_seen": 11381216, "step": 2295, "train_runtime": 7948.7883, "train_tokens_per_second": 1431.818 }, { "epoch": 0.8445057471264368, "grad_norm": 0.37624162435531616, "learning_rate": 3.124539425202653e-05, "loss": 1.1637, "num_input_tokens_seen": 11384464, "step": 2296, "train_runtime": 7951.1329, "train_tokens_per_second": 1431.804 }, { "epoch": 0.8448735632183908, "grad_norm": 0.36825355887413025, "learning_rate": 3.1171702284451e-05, "loss": 1.2203, "num_input_tokens_seen": 11389600, "step": 2297, "train_runtime": 7954.5341, "train_tokens_per_second": 1431.837 }, { "epoch": 0.8452413793103448, "grad_norm": 0.496214896440506, "learning_rate": 3.1098010316875466e-05, "loss": 1.228, "num_input_tokens_seen": 11393712, "step": 2298, "train_runtime": 7957.4135, "train_tokens_per_second": 1431.836 }, { "epoch": 0.8456091954022988, "grad_norm": 0.3443017899990082, "learning_rate": 3.102431834929993e-05, "loss": 1.1756, "num_input_tokens_seen": 11397776, "step": 2299, "train_runtime": 7960.2278, "train_tokens_per_second": 1431.84 }, { "epoch": 0.8459770114942529, "grad_norm": 0.35658949613571167, "learning_rate": 3.0950626381724396e-05, "loss": 1.1155, "num_input_tokens_seen": 11402944, "step": 2300, "train_runtime": 7963.6341, "train_tokens_per_second": 1431.877 }, { "epoch": 0.8463448275862069, "grad_norm": 0.3757800757884979, "learning_rate": 3.087693441414886e-05, "loss": 1.2837, "num_input_tokens_seen": 11407648, "step": 2301, "train_runtime": 7966.7998, "train_tokens_per_second": 1431.898 }, { "epoch": 0.8467126436781609, "grad_norm": 0.41095036268234253, "learning_rate": 3.0803242446573325e-05, "loss": 1.2237, "num_input_tokens_seen": 11414336, "step": 2302, "train_runtime": 7971.0219, "train_tokens_per_second": 1431.979 }, { "epoch": 0.8470804597701149, "grad_norm": 0.40145936608314514, "learning_rate": 3.072955047899779e-05, "loss": 1.2939, "num_input_tokens_seen": 11417760, "step": 2303, "train_runtime": 7973.4476, "train_tokens_per_second": 1431.973 }, { "epoch": 0.847448275862069, "grad_norm": 0.3589552342891693, "learning_rate": 3.065585851142226e-05, "loss": 1.2338, "num_input_tokens_seen": 11425040, "step": 2304, "train_runtime": 7977.9205, "train_tokens_per_second": 1432.082 }, { "epoch": 0.847816091954023, "grad_norm": 0.36281466484069824, "learning_rate": 3.058216654384673e-05, "loss": 1.197, "num_input_tokens_seen": 11429312, "step": 2305, "train_runtime": 7980.7975, "train_tokens_per_second": 1432.101 }, { "epoch": 0.848183908045977, "grad_norm": 0.34846553206443787, "learning_rate": 3.050847457627119e-05, "loss": 1.2261, "num_input_tokens_seen": 11434960, "step": 2306, "train_runtime": 7984.5259, "train_tokens_per_second": 1432.14 }, { "epoch": 0.848551724137931, "grad_norm": 0.35105523467063904, "learning_rate": 3.0434782608695656e-05, "loss": 1.0301, "num_input_tokens_seen": 11442864, "step": 2307, "train_runtime": 7989.3839, "train_tokens_per_second": 1432.259 }, { "epoch": 0.848919540229885, "grad_norm": 0.43849313259124756, "learning_rate": 3.036109064112012e-05, "loss": 1.3086, "num_input_tokens_seen": 11449632, "step": 2308, "train_runtime": 7993.6769, "train_tokens_per_second": 1432.336 }, { "epoch": 0.849287356321839, "grad_norm": 0.3420996367931366, "learning_rate": 3.0287398673544586e-05, "loss": 1.2129, "num_input_tokens_seen": 11453632, "step": 2309, "train_runtime": 7996.3677, "train_tokens_per_second": 1432.354 }, { "epoch": 0.8496551724137931, "grad_norm": 0.3746173083782196, "learning_rate": 3.0213706705969054e-05, "loss": 1.252, "num_input_tokens_seen": 11458880, "step": 2310, "train_runtime": 7999.7986, "train_tokens_per_second": 1432.396 }, { "epoch": 0.8500229885057471, "grad_norm": 0.33470419049263, "learning_rate": 3.014001473839352e-05, "loss": 1.0921, "num_input_tokens_seen": 11462624, "step": 2311, "train_runtime": 8004.5234, "train_tokens_per_second": 1432.018 }, { "epoch": 0.8503908045977011, "grad_norm": 0.3931296467781067, "learning_rate": 3.0066322770817984e-05, "loss": 1.2004, "num_input_tokens_seen": 11469040, "step": 2312, "train_runtime": 8008.5529, "train_tokens_per_second": 1432.099 }, { "epoch": 0.8507586206896551, "grad_norm": 0.3638696074485779, "learning_rate": 2.999263080324245e-05, "loss": 1.1885, "num_input_tokens_seen": 11473184, "step": 2313, "train_runtime": 8011.4053, "train_tokens_per_second": 1432.106 }, { "epoch": 0.8511264367816092, "grad_norm": 0.37879887223243713, "learning_rate": 2.9918938835666917e-05, "loss": 1.3213, "num_input_tokens_seen": 11476880, "step": 2314, "train_runtime": 8014.0154, "train_tokens_per_second": 1432.101 }, { "epoch": 0.8514942528735632, "grad_norm": 0.3558363616466522, "learning_rate": 2.984524686809138e-05, "loss": 1.1794, "num_input_tokens_seen": 11482480, "step": 2315, "train_runtime": 8017.6018, "train_tokens_per_second": 1432.159 }, { "epoch": 0.8518620689655172, "grad_norm": 0.3671194612979889, "learning_rate": 2.9771554900515846e-05, "loss": 1.2351, "num_input_tokens_seen": 11487008, "step": 2316, "train_runtime": 8020.6021, "train_tokens_per_second": 1432.188 }, { "epoch": 0.8522298850574712, "grad_norm": 0.41130730509757996, "learning_rate": 2.969786293294031e-05, "loss": 1.3448, "num_input_tokens_seen": 11491648, "step": 2317, "train_runtime": 8023.6487, "train_tokens_per_second": 1432.222 }, { "epoch": 0.8525977011494252, "grad_norm": 0.3718991279602051, "learning_rate": 2.962417096536478e-05, "loss": 1.1617, "num_input_tokens_seen": 11496720, "step": 2318, "train_runtime": 8027.0472, "train_tokens_per_second": 1432.248 }, { "epoch": 0.8529655172413793, "grad_norm": 0.38872313499450684, "learning_rate": 2.9550478997789244e-05, "loss": 1.247, "num_input_tokens_seen": 11500704, "step": 2319, "train_runtime": 8029.7984, "train_tokens_per_second": 1432.253 }, { "epoch": 0.8533333333333334, "grad_norm": 0.3886869549751282, "learning_rate": 2.947678703021371e-05, "loss": 1.3846, "num_input_tokens_seen": 11504224, "step": 2320, "train_runtime": 8032.321, "train_tokens_per_second": 1432.242 }, { "epoch": 0.8537011494252874, "grad_norm": 0.37152817845344543, "learning_rate": 2.9403095062638174e-05, "loss": 1.3175, "num_input_tokens_seen": 11507456, "step": 2321, "train_runtime": 8034.6608, "train_tokens_per_second": 1432.227 }, { "epoch": 0.8540689655172414, "grad_norm": 0.3631071448326111, "learning_rate": 2.9329403095062642e-05, "loss": 1.2335, "num_input_tokens_seen": 11511184, "step": 2322, "train_runtime": 8037.2787, "train_tokens_per_second": 1432.224 }, { "epoch": 0.8544367816091955, "grad_norm": 0.37639376521110535, "learning_rate": 2.9255711127487107e-05, "loss": 1.1944, "num_input_tokens_seen": 11516992, "step": 2323, "train_runtime": 8041.1031, "train_tokens_per_second": 1432.265 }, { "epoch": 0.8548045977011495, "grad_norm": 0.37705475091934204, "learning_rate": 2.9182019159911572e-05, "loss": 1.2569, "num_input_tokens_seen": 11522464, "step": 2324, "train_runtime": 8044.6137, "train_tokens_per_second": 1432.32 }, { "epoch": 0.8551724137931035, "grad_norm": 0.392872154712677, "learning_rate": 2.9108327192336037e-05, "loss": 1.2066, "num_input_tokens_seen": 11527312, "step": 2325, "train_runtime": 8047.8517, "train_tokens_per_second": 1432.346 }, { "epoch": 0.8555402298850575, "grad_norm": 0.3412322700023651, "learning_rate": 2.9034635224760505e-05, "loss": 1.1425, "num_input_tokens_seen": 11532544, "step": 2326, "train_runtime": 8051.2496, "train_tokens_per_second": 1432.392 }, { "epoch": 0.8559080459770115, "grad_norm": 0.3914344310760498, "learning_rate": 2.896094325718497e-05, "loss": 1.18, "num_input_tokens_seen": 11538032, "step": 2327, "train_runtime": 8054.7802, "train_tokens_per_second": 1432.445 }, { "epoch": 0.8562758620689656, "grad_norm": 0.3546917140483856, "learning_rate": 2.8887251289609434e-05, "loss": 1.2681, "num_input_tokens_seen": 11543168, "step": 2328, "train_runtime": 8058.2268, "train_tokens_per_second": 1432.47 }, { "epoch": 0.8566436781609196, "grad_norm": 0.41026362776756287, "learning_rate": 2.88135593220339e-05, "loss": 1.4283, "num_input_tokens_seen": 11547056, "step": 2329, "train_runtime": 8060.8879, "train_tokens_per_second": 1432.479 }, { "epoch": 0.8570114942528736, "grad_norm": 0.3765309154987335, "learning_rate": 2.8739867354458367e-05, "loss": 1.0912, "num_input_tokens_seen": 11551456, "step": 2330, "train_runtime": 8063.8757, "train_tokens_per_second": 1432.494 }, { "epoch": 0.8573793103448276, "grad_norm": 0.4597894549369812, "learning_rate": 2.8666175386882832e-05, "loss": 1.3273, "num_input_tokens_seen": 11559200, "step": 2331, "train_runtime": 8068.5559, "train_tokens_per_second": 1432.623 }, { "epoch": 0.8577471264367816, "grad_norm": 0.3727620542049408, "learning_rate": 2.8592483419307297e-05, "loss": 1.1774, "num_input_tokens_seen": 11563056, "step": 2332, "train_runtime": 8071.2183, "train_tokens_per_second": 1432.628 }, { "epoch": 0.8581149425287357, "grad_norm": 0.3988867402076721, "learning_rate": 2.8518791451731762e-05, "loss": 1.1822, "num_input_tokens_seen": 11566320, "step": 2333, "train_runtime": 8073.5278, "train_tokens_per_second": 1432.623 }, { "epoch": 0.8584827586206897, "grad_norm": 0.3431839942932129, "learning_rate": 2.844509948415623e-05, "loss": 1.2776, "num_input_tokens_seen": 11570448, "step": 2334, "train_runtime": 8076.3766, "train_tokens_per_second": 1432.629 }, { "epoch": 0.8588505747126437, "grad_norm": 0.3561246693134308, "learning_rate": 2.8371407516580695e-05, "loss": 1.1009, "num_input_tokens_seen": 11574304, "step": 2335, "train_runtime": 8079.0243, "train_tokens_per_second": 1432.636 }, { "epoch": 0.8592183908045977, "grad_norm": 0.36138033866882324, "learning_rate": 2.829771554900516e-05, "loss": 1.2186, "num_input_tokens_seen": 11577936, "step": 2336, "train_runtime": 8081.5805, "train_tokens_per_second": 1432.633 }, { "epoch": 0.8595862068965517, "grad_norm": 0.382767915725708, "learning_rate": 2.8224023581429625e-05, "loss": 1.2227, "num_input_tokens_seen": 11581488, "step": 2337, "train_runtime": 8084.0905, "train_tokens_per_second": 1432.627 }, { "epoch": 0.8599540229885058, "grad_norm": 0.37188485264778137, "learning_rate": 2.8150331613854093e-05, "loss": 1.2467, "num_input_tokens_seen": 11590336, "step": 2338, "train_runtime": 8089.3785, "train_tokens_per_second": 1432.784 }, { "epoch": 0.8603218390804598, "grad_norm": 0.36899954080581665, "learning_rate": 2.8076639646278558e-05, "loss": 1.1596, "num_input_tokens_seen": 11593856, "step": 2339, "train_runtime": 8091.9096, "train_tokens_per_second": 1432.771 }, { "epoch": 0.8606896551724138, "grad_norm": 0.3485456705093384, "learning_rate": 2.8002947678703022e-05, "loss": 1.1614, "num_input_tokens_seen": 11597680, "step": 2340, "train_runtime": 8094.5559, "train_tokens_per_second": 1432.775 }, { "epoch": 0.8610574712643678, "grad_norm": 0.3754168152809143, "learning_rate": 2.7929255711127487e-05, "loss": 1.1861, "num_input_tokens_seen": 11604432, "step": 2341, "train_runtime": 8100.8765, "train_tokens_per_second": 1432.491 }, { "epoch": 0.8614252873563218, "grad_norm": 0.3656279146671295, "learning_rate": 2.7855563743551956e-05, "loss": 1.1541, "num_input_tokens_seen": 11609104, "step": 2342, "train_runtime": 8104.0379, "train_tokens_per_second": 1432.509 }, { "epoch": 0.8617931034482759, "grad_norm": 0.36324989795684814, "learning_rate": 2.778187177597642e-05, "loss": 1.2718, "num_input_tokens_seen": 11615248, "step": 2343, "train_runtime": 8107.9474, "train_tokens_per_second": 1432.576 }, { "epoch": 0.8621609195402299, "grad_norm": 0.39646971225738525, "learning_rate": 2.7708179808400885e-05, "loss": 1.1867, "num_input_tokens_seen": 11621872, "step": 2344, "train_runtime": 8112.1238, "train_tokens_per_second": 1432.655 }, { "epoch": 0.8625287356321839, "grad_norm": 0.3751087486743927, "learning_rate": 2.763448784082535e-05, "loss": 1.2859, "num_input_tokens_seen": 11626000, "step": 2345, "train_runtime": 8114.8918, "train_tokens_per_second": 1432.675 }, { "epoch": 0.8628965517241379, "grad_norm": 0.3649898171424866, "learning_rate": 2.7560795873249818e-05, "loss": 1.1061, "num_input_tokens_seen": 11631792, "step": 2346, "train_runtime": 8118.5796, "train_tokens_per_second": 1432.737 }, { "epoch": 0.863264367816092, "grad_norm": 0.3596176505088806, "learning_rate": 2.7487103905674283e-05, "loss": 1.1859, "num_input_tokens_seen": 11637808, "step": 2347, "train_runtime": 8122.4444, "train_tokens_per_second": 1432.796 }, { "epoch": 0.863632183908046, "grad_norm": 0.4087933301925659, "learning_rate": 2.7413411938098748e-05, "loss": 1.2644, "num_input_tokens_seen": 11641392, "step": 2348, "train_runtime": 8124.9819, "train_tokens_per_second": 1432.79 }, { "epoch": 0.864, "grad_norm": 0.3594960570335388, "learning_rate": 2.7339719970523213e-05, "loss": 1.2586, "num_input_tokens_seen": 11647424, "step": 2349, "train_runtime": 8128.9176, "train_tokens_per_second": 1432.838 }, { "epoch": 0.864367816091954, "grad_norm": 0.37164241075515747, "learning_rate": 2.726602800294768e-05, "loss": 1.245, "num_input_tokens_seen": 11653200, "step": 2350, "train_runtime": 8132.6316, "train_tokens_per_second": 1432.894 }, { "epoch": 0.864735632183908, "grad_norm": 0.3846262991428375, "learning_rate": 2.7192336035372146e-05, "loss": 1.0308, "num_input_tokens_seen": 11657504, "step": 2351, "train_runtime": 8135.5037, "train_tokens_per_second": 1432.917 }, { "epoch": 0.865103448275862, "grad_norm": 0.4109100103378296, "learning_rate": 2.711864406779661e-05, "loss": 1.1317, "num_input_tokens_seen": 11661808, "step": 2352, "train_runtime": 8138.4569, "train_tokens_per_second": 1432.926 }, { "epoch": 0.8654712643678161, "grad_norm": 0.38728392124176025, "learning_rate": 2.704495210022108e-05, "loss": 1.304, "num_input_tokens_seen": 11666240, "step": 2353, "train_runtime": 8141.482, "train_tokens_per_second": 1432.938 }, { "epoch": 0.8658390804597701, "grad_norm": 0.38073766231536865, "learning_rate": 2.6971260132645544e-05, "loss": 1.0767, "num_input_tokens_seen": 11669392, "step": 2354, "train_runtime": 8143.8651, "train_tokens_per_second": 1432.906 }, { "epoch": 0.8662068965517241, "grad_norm": 0.3477320671081543, "learning_rate": 2.689756816507001e-05, "loss": 1.1248, "num_input_tokens_seen": 11673856, "step": 2355, "train_runtime": 8146.8508, "train_tokens_per_second": 1432.929 }, { "epoch": 0.8665747126436781, "grad_norm": 0.3762071430683136, "learning_rate": 2.6823876197494473e-05, "loss": 1.1214, "num_input_tokens_seen": 11679568, "step": 2356, "train_runtime": 8150.4795, "train_tokens_per_second": 1432.992 }, { "epoch": 0.8669425287356322, "grad_norm": 0.36011943221092224, "learning_rate": 2.675018422991894e-05, "loss": 1.097, "num_input_tokens_seen": 11683952, "step": 2357, "train_runtime": 8153.3689, "train_tokens_per_second": 1433.021 }, { "epoch": 0.8673103448275862, "grad_norm": 0.3860645294189453, "learning_rate": 2.6676492262343406e-05, "loss": 1.2445, "num_input_tokens_seen": 11689376, "step": 2358, "train_runtime": 8156.904, "train_tokens_per_second": 1433.065 }, { "epoch": 0.8676781609195402, "grad_norm": 0.3797599971294403, "learning_rate": 2.660280029476787e-05, "loss": 1.1711, "num_input_tokens_seen": 11695104, "step": 2359, "train_runtime": 8160.684, "train_tokens_per_second": 1433.103 }, { "epoch": 0.8680459770114942, "grad_norm": 0.39891761541366577, "learning_rate": 2.6529108327192336e-05, "loss": 1.2976, "num_input_tokens_seen": 11699504, "step": 2360, "train_runtime": 8163.6629, "train_tokens_per_second": 1433.119 }, { "epoch": 0.8684137931034482, "grad_norm": 0.3743274211883545, "learning_rate": 2.6455416359616804e-05, "loss": 1.0993, "num_input_tokens_seen": 11705600, "step": 2361, "train_runtime": 8167.5662, "train_tokens_per_second": 1433.181 }, { "epoch": 0.8687816091954023, "grad_norm": 0.3728826940059662, "learning_rate": 2.638172439204127e-05, "loss": 1.1218, "num_input_tokens_seen": 11710704, "step": 2362, "train_runtime": 8170.9151, "train_tokens_per_second": 1433.218 }, { "epoch": 0.8691494252873563, "grad_norm": 0.36612221598625183, "learning_rate": 2.6308032424465734e-05, "loss": 1.124, "num_input_tokens_seen": 11716400, "step": 2363, "train_runtime": 8174.5546, "train_tokens_per_second": 1433.277 }, { "epoch": 0.8695172413793103, "grad_norm": 0.35945627093315125, "learning_rate": 2.62343404568902e-05, "loss": 1.2693, "num_input_tokens_seen": 11719888, "step": 2364, "train_runtime": 8176.994, "train_tokens_per_second": 1433.276 }, { "epoch": 0.8698850574712643, "grad_norm": 0.3450169861316681, "learning_rate": 2.6160648489314667e-05, "loss": 1.0919, "num_input_tokens_seen": 11723200, "step": 2365, "train_runtime": 8179.3493, "train_tokens_per_second": 1433.268 }, { "epoch": 0.8702528735632183, "grad_norm": 0.36018115282058716, "learning_rate": 2.608695652173913e-05, "loss": 1.0416, "num_input_tokens_seen": 11727456, "step": 2366, "train_runtime": 8182.2025, "train_tokens_per_second": 1433.288 }, { "epoch": 0.8706206896551724, "grad_norm": 0.3790985941886902, "learning_rate": 2.6013264554163596e-05, "loss": 1.2022, "num_input_tokens_seen": 11733024, "step": 2367, "train_runtime": 8185.7586, "train_tokens_per_second": 1433.346 }, { "epoch": 0.8709885057471264, "grad_norm": 0.37325188517570496, "learning_rate": 2.593957258658806e-05, "loss": 1.1948, "num_input_tokens_seen": 11737232, "step": 2368, "train_runtime": 8188.6892, "train_tokens_per_second": 1433.347 }, { "epoch": 0.8713563218390804, "grad_norm": 0.35205021500587463, "learning_rate": 2.586588061901253e-05, "loss": 1.2889, "num_input_tokens_seen": 11740784, "step": 2369, "train_runtime": 8191.1948, "train_tokens_per_second": 1433.342 }, { "epoch": 0.8717241379310345, "grad_norm": 0.3960356116294861, "learning_rate": 2.5792188651436994e-05, "loss": 1.303, "num_input_tokens_seen": 11746192, "step": 2370, "train_runtime": 8194.7635, "train_tokens_per_second": 1433.378 }, { "epoch": 0.8720919540229886, "grad_norm": 0.39275914430618286, "learning_rate": 2.571849668386146e-05, "loss": 1.2338, "num_input_tokens_seen": 11750960, "step": 2371, "train_runtime": 8200.1646, "train_tokens_per_second": 1433.015 }, { "epoch": 0.8724597701149426, "grad_norm": 0.37443453073501587, "learning_rate": 2.5644804716285924e-05, "loss": 1.133, "num_input_tokens_seen": 11753840, "step": 2372, "train_runtime": 8202.3889, "train_tokens_per_second": 1432.978 }, { "epoch": 0.8728275862068966, "grad_norm": 0.3933907151222229, "learning_rate": 2.5571112748710392e-05, "loss": 1.24, "num_input_tokens_seen": 11758256, "step": 2373, "train_runtime": 8205.3341, "train_tokens_per_second": 1433.001 }, { "epoch": 0.8731954022988506, "grad_norm": 0.3632223606109619, "learning_rate": 2.5497420781134857e-05, "loss": 1.2591, "num_input_tokens_seen": 11763040, "step": 2374, "train_runtime": 8208.4342, "train_tokens_per_second": 1433.043 }, { "epoch": 0.8735632183908046, "grad_norm": 0.3614504635334015, "learning_rate": 2.5423728813559322e-05, "loss": 1.2917, "num_input_tokens_seen": 11767712, "step": 2375, "train_runtime": 8211.5212, "train_tokens_per_second": 1433.073 }, { "epoch": 0.8739310344827587, "grad_norm": 0.3508528470993042, "learning_rate": 2.5350036845983787e-05, "loss": 1.2213, "num_input_tokens_seen": 11771280, "step": 2376, "train_runtime": 8214.0226, "train_tokens_per_second": 1433.071 }, { "epoch": 0.8742988505747127, "grad_norm": 0.3659219741821289, "learning_rate": 2.5276344878408255e-05, "loss": 1.2203, "num_input_tokens_seen": 11778752, "step": 2377, "train_runtime": 8218.5787, "train_tokens_per_second": 1433.186 }, { "epoch": 0.8746666666666667, "grad_norm": 0.4087873697280884, "learning_rate": 2.520265291083272e-05, "loss": 1.2277, "num_input_tokens_seen": 11782480, "step": 2378, "train_runtime": 8221.2016, "train_tokens_per_second": 1433.182 }, { "epoch": 0.8750344827586207, "grad_norm": 0.3752245306968689, "learning_rate": 2.5128960943257184e-05, "loss": 1.1933, "num_input_tokens_seen": 11786624, "step": 2379, "train_runtime": 8224.0211, "train_tokens_per_second": 1433.195 }, { "epoch": 0.8754022988505747, "grad_norm": 0.36517125368118286, "learning_rate": 2.505526897568165e-05, "loss": 1.2637, "num_input_tokens_seen": 11789904, "step": 2380, "train_runtime": 8226.4211, "train_tokens_per_second": 1433.175 }, { "epoch": 0.8757701149425288, "grad_norm": 0.3739364445209503, "learning_rate": 2.4981577008106117e-05, "loss": 1.1952, "num_input_tokens_seen": 11795040, "step": 2381, "train_runtime": 8229.7892, "train_tokens_per_second": 1433.213 }, { "epoch": 0.8761379310344828, "grad_norm": 0.39218613505363464, "learning_rate": 2.4907885040530586e-05, "loss": 1.3, "num_input_tokens_seen": 11799552, "step": 2382, "train_runtime": 8232.786, "train_tokens_per_second": 1433.239 }, { "epoch": 0.8765057471264368, "grad_norm": 0.364801287651062, "learning_rate": 2.483419307295505e-05, "loss": 1.1685, "num_input_tokens_seen": 11804800, "step": 2383, "train_runtime": 8236.2268, "train_tokens_per_second": 1433.278 }, { "epoch": 0.8768735632183908, "grad_norm": 0.4224899411201477, "learning_rate": 2.4760501105379515e-05, "loss": 1.0667, "num_input_tokens_seen": 11810272, "step": 2384, "train_runtime": 8239.785, "train_tokens_per_second": 1433.323 }, { "epoch": 0.8772413793103448, "grad_norm": 0.3898802101612091, "learning_rate": 2.468680913780398e-05, "loss": 1.1808, "num_input_tokens_seen": 11815056, "step": 2385, "train_runtime": 8242.9541, "train_tokens_per_second": 1433.352 }, { "epoch": 0.8776091954022989, "grad_norm": 0.36671003699302673, "learning_rate": 2.4613117170228448e-05, "loss": 1.1094, "num_input_tokens_seen": 11819008, "step": 2386, "train_runtime": 8245.6328, "train_tokens_per_second": 1433.366 }, { "epoch": 0.8779770114942529, "grad_norm": 0.3437158167362213, "learning_rate": 2.4539425202652913e-05, "loss": 1.1374, "num_input_tokens_seen": 11823488, "step": 2387, "train_runtime": 8248.6682, "train_tokens_per_second": 1433.381 }, { "epoch": 0.8783448275862069, "grad_norm": 0.3442572057247162, "learning_rate": 2.4465733235077378e-05, "loss": 1.0513, "num_input_tokens_seen": 11831648, "step": 2388, "train_runtime": 8253.7413, "train_tokens_per_second": 1433.489 }, { "epoch": 0.8787126436781609, "grad_norm": 0.42760980129241943, "learning_rate": 2.4392041267501846e-05, "loss": 1.2651, "num_input_tokens_seen": 11836720, "step": 2389, "train_runtime": 8257.1131, "train_tokens_per_second": 1433.518 }, { "epoch": 0.879080459770115, "grad_norm": 0.36846694350242615, "learning_rate": 2.431834929992631e-05, "loss": 1.1469, "num_input_tokens_seen": 11842512, "step": 2390, "train_runtime": 8260.9375, "train_tokens_per_second": 1433.555 }, { "epoch": 0.879448275862069, "grad_norm": 0.36522969603538513, "learning_rate": 2.4244657332350776e-05, "loss": 1.1699, "num_input_tokens_seen": 11847168, "step": 2391, "train_runtime": 8264.0625, "train_tokens_per_second": 1433.577 }, { "epoch": 0.879816091954023, "grad_norm": 0.3250475525856018, "learning_rate": 2.417096536477524e-05, "loss": 1.1779, "num_input_tokens_seen": 11852832, "step": 2392, "train_runtime": 8267.7978, "train_tokens_per_second": 1433.614 }, { "epoch": 0.880183908045977, "grad_norm": 0.3469904959201813, "learning_rate": 2.409727339719971e-05, "loss": 1.0961, "num_input_tokens_seen": 11856096, "step": 2393, "train_runtime": 8270.2039, "train_tokens_per_second": 1433.592 }, { "epoch": 0.880551724137931, "grad_norm": 0.36842042207717896, "learning_rate": 2.4023581429624174e-05, "loss": 1.136, "num_input_tokens_seen": 11861136, "step": 2394, "train_runtime": 8273.4665, "train_tokens_per_second": 1433.636 }, { "epoch": 0.8809195402298851, "grad_norm": 0.3704577386379242, "learning_rate": 2.394988946204864e-05, "loss": 1.2025, "num_input_tokens_seen": 11864768, "step": 2395, "train_runtime": 8275.9489, "train_tokens_per_second": 1433.644 }, { "epoch": 0.8812873563218391, "grad_norm": 0.3620859682559967, "learning_rate": 2.3876197494473103e-05, "loss": 1.2302, "num_input_tokens_seen": 11868896, "step": 2396, "train_runtime": 8278.8079, "train_tokens_per_second": 1433.648 }, { "epoch": 0.8816551724137931, "grad_norm": 0.3965453505516052, "learning_rate": 2.380250552689757e-05, "loss": 1.1548, "num_input_tokens_seen": 11872864, "step": 2397, "train_runtime": 8281.5575, "train_tokens_per_second": 1433.651 }, { "epoch": 0.8820229885057471, "grad_norm": 0.36142468452453613, "learning_rate": 2.3728813559322036e-05, "loss": 1.0315, "num_input_tokens_seen": 11877536, "step": 2398, "train_runtime": 8284.7576, "train_tokens_per_second": 1433.661 }, { "epoch": 0.8823908045977011, "grad_norm": 0.350455641746521, "learning_rate": 2.36551215917465e-05, "loss": 1.1378, "num_input_tokens_seen": 11882064, "step": 2399, "train_runtime": 8287.7531, "train_tokens_per_second": 1433.689 }, { "epoch": 0.8827586206896552, "grad_norm": 0.38785919547080994, "learning_rate": 2.3581429624170966e-05, "loss": 1.2479, "num_input_tokens_seen": 11886336, "step": 2400, "train_runtime": 8290.6085, "train_tokens_per_second": 1433.711 }, { "epoch": 0.8831264367816092, "grad_norm": 0.31994694471359253, "learning_rate": 2.3507737656595434e-05, "loss": 1.1543, "num_input_tokens_seen": 11893536, "step": 2401, "train_runtime": 8297.0721, "train_tokens_per_second": 1433.462 }, { "epoch": 0.8834942528735632, "grad_norm": 0.36156028509140015, "learning_rate": 2.34340456890199e-05, "loss": 1.0872, "num_input_tokens_seen": 11897856, "step": 2402, "train_runtime": 8299.9955, "train_tokens_per_second": 1433.477 }, { "epoch": 0.8838620689655172, "grad_norm": 0.3720942735671997, "learning_rate": 2.3360353721444364e-05, "loss": 1.348, "num_input_tokens_seen": 11902208, "step": 2403, "train_runtime": 8303.002, "train_tokens_per_second": 1433.482 }, { "epoch": 0.8842298850574712, "grad_norm": 0.41489970684051514, "learning_rate": 2.328666175386883e-05, "loss": 1.2107, "num_input_tokens_seen": 11906096, "step": 2404, "train_runtime": 8305.6874, "train_tokens_per_second": 1433.487 }, { "epoch": 0.8845977011494253, "grad_norm": 0.3562310039997101, "learning_rate": 2.3212969786293297e-05, "loss": 1.2216, "num_input_tokens_seen": 11911024, "step": 2405, "train_runtime": 8308.9931, "train_tokens_per_second": 1433.51 }, { "epoch": 0.8849655172413793, "grad_norm": 0.4116514027118683, "learning_rate": 2.313927781871776e-05, "loss": 1.3029, "num_input_tokens_seen": 11914736, "step": 2406, "train_runtime": 8311.6595, "train_tokens_per_second": 1433.497 }, { "epoch": 0.8853333333333333, "grad_norm": 0.35498255491256714, "learning_rate": 2.3065585851142226e-05, "loss": 1.1718, "num_input_tokens_seen": 11918320, "step": 2407, "train_runtime": 8314.2888, "train_tokens_per_second": 1433.474 }, { "epoch": 0.8857011494252873, "grad_norm": 0.36428338289260864, "learning_rate": 2.299189388356669e-05, "loss": 1.2047, "num_input_tokens_seen": 11921616, "step": 2408, "train_runtime": 8316.7034, "train_tokens_per_second": 1433.455 }, { "epoch": 0.8860689655172413, "grad_norm": 0.3640618920326233, "learning_rate": 2.291820191599116e-05, "loss": 1.2264, "num_input_tokens_seen": 11926944, "step": 2409, "train_runtime": 8320.1945, "train_tokens_per_second": 1433.493 }, { "epoch": 0.8864367816091954, "grad_norm": 0.4203958511352539, "learning_rate": 2.2844509948415624e-05, "loss": 1.2425, "num_input_tokens_seen": 11930480, "step": 2410, "train_runtime": 8322.717, "train_tokens_per_second": 1433.484 }, { "epoch": 0.8868045977011494, "grad_norm": 0.37219858169555664, "learning_rate": 2.277081798084009e-05, "loss": 1.229, "num_input_tokens_seen": 11934480, "step": 2411, "train_runtime": 8325.487, "train_tokens_per_second": 1433.487 }, { "epoch": 0.8871724137931034, "grad_norm": 0.37115055322647095, "learning_rate": 2.2697126013264554e-05, "loss": 1.1379, "num_input_tokens_seen": 11938832, "step": 2412, "train_runtime": 8328.4305, "train_tokens_per_second": 1433.503 }, { "epoch": 0.8875402298850574, "grad_norm": 0.3520651161670685, "learning_rate": 2.2623434045689022e-05, "loss": 1.011, "num_input_tokens_seen": 11944752, "step": 2413, "train_runtime": 8332.2515, "train_tokens_per_second": 1433.556 }, { "epoch": 0.8879080459770115, "grad_norm": 0.3684951066970825, "learning_rate": 2.2549742078113487e-05, "loss": 1.0369, "num_input_tokens_seen": 11951408, "step": 2414, "train_runtime": 8336.5168, "train_tokens_per_second": 1433.621 }, { "epoch": 0.8882758620689655, "grad_norm": 0.3673064410686493, "learning_rate": 2.2476050110537952e-05, "loss": 1.2615, "num_input_tokens_seen": 11959376, "step": 2415, "train_runtime": 8341.5768, "train_tokens_per_second": 1433.707 }, { "epoch": 0.8886436781609195, "grad_norm": 0.360674113035202, "learning_rate": 2.2402358142962417e-05, "loss": 1.0447, "num_input_tokens_seen": 11963120, "step": 2416, "train_runtime": 8344.2185, "train_tokens_per_second": 1433.702 }, { "epoch": 0.8890114942528735, "grad_norm": 0.37171250581741333, "learning_rate": 2.2328666175386885e-05, "loss": 1.1654, "num_input_tokens_seen": 11966944, "step": 2417, "train_runtime": 8346.8483, "train_tokens_per_second": 1433.708 }, { "epoch": 0.8893793103448275, "grad_norm": 0.3843598961830139, "learning_rate": 2.225497420781135e-05, "loss": 1.19, "num_input_tokens_seen": 11973888, "step": 2418, "train_runtime": 8351.1857, "train_tokens_per_second": 1433.795 }, { "epoch": 0.8897471264367816, "grad_norm": 0.41382521390914917, "learning_rate": 2.2181282240235814e-05, "loss": 1.3103, "num_input_tokens_seen": 11981024, "step": 2419, "train_runtime": 8355.7133, "train_tokens_per_second": 1433.872 }, { "epoch": 0.8901149425287357, "grad_norm": 0.32924750447273254, "learning_rate": 2.210759027266028e-05, "loss": 1.2093, "num_input_tokens_seen": 11985840, "step": 2420, "train_runtime": 8358.9326, "train_tokens_per_second": 1433.896 }, { "epoch": 0.8904827586206897, "grad_norm": 0.391390860080719, "learning_rate": 2.2033898305084748e-05, "loss": 1.0946, "num_input_tokens_seen": 11990752, "step": 2421, "train_runtime": 8362.207, "train_tokens_per_second": 1433.922 }, { "epoch": 0.8908505747126437, "grad_norm": 0.36776503920555115, "learning_rate": 2.1960206337509212e-05, "loss": 1.0493, "num_input_tokens_seen": 11995136, "step": 2422, "train_runtime": 8365.1772, "train_tokens_per_second": 1433.937 }, { "epoch": 0.8912183908045977, "grad_norm": 0.3330918848514557, "learning_rate": 2.1886514369933677e-05, "loss": 1.1392, "num_input_tokens_seen": 12000784, "step": 2423, "train_runtime": 8368.8469, "train_tokens_per_second": 1433.983 }, { "epoch": 0.8915862068965518, "grad_norm": 0.38090014457702637, "learning_rate": 2.1812822402358142e-05, "loss": 1.1236, "num_input_tokens_seen": 12004464, "step": 2424, "train_runtime": 8371.3916, "train_tokens_per_second": 1433.987 }, { "epoch": 0.8919540229885058, "grad_norm": 0.3741970956325531, "learning_rate": 2.173913043478261e-05, "loss": 1.2068, "num_input_tokens_seen": 12009664, "step": 2425, "train_runtime": 8374.7362, "train_tokens_per_second": 1434.035 }, { "epoch": 0.8923218390804598, "grad_norm": 0.3657437264919281, "learning_rate": 2.1665438467207075e-05, "loss": 1.1584, "num_input_tokens_seen": 12014784, "step": 2426, "train_runtime": 8378.0849, "train_tokens_per_second": 1434.073 }, { "epoch": 0.8926896551724138, "grad_norm": 0.38468652963638306, "learning_rate": 2.159174649963154e-05, "loss": 1.2108, "num_input_tokens_seen": 12019056, "step": 2427, "train_runtime": 8380.9722, "train_tokens_per_second": 1434.089 }, { "epoch": 0.8930574712643679, "grad_norm": 0.3464387059211731, "learning_rate": 2.1518054532056005e-05, "loss": 1.2607, "num_input_tokens_seen": 12023072, "step": 2428, "train_runtime": 8383.7336, "train_tokens_per_second": 1434.095 }, { "epoch": 0.8934252873563219, "grad_norm": 0.3254941999912262, "learning_rate": 2.1444362564480473e-05, "loss": 1.1208, "num_input_tokens_seen": 12028672, "step": 2429, "train_runtime": 8387.2997, "train_tokens_per_second": 1434.153 }, { "epoch": 0.8937931034482759, "grad_norm": 0.383190780878067, "learning_rate": 2.1370670596904938e-05, "loss": 1.2589, "num_input_tokens_seen": 12032576, "step": 2430, "train_runtime": 8389.9919, "train_tokens_per_second": 1434.158 }, { "epoch": 0.8941609195402299, "grad_norm": 0.3317315876483917, "learning_rate": 2.1296978629329402e-05, "loss": 1.0787, "num_input_tokens_seen": 12036272, "step": 2431, "train_runtime": 8394.624, "train_tokens_per_second": 1433.807 }, { "epoch": 0.8945287356321839, "grad_norm": 0.34554919600486755, "learning_rate": 2.1223286661753867e-05, "loss": 1.0744, "num_input_tokens_seen": 12039504, "step": 2432, "train_runtime": 8396.98, "train_tokens_per_second": 1433.79 }, { "epoch": 0.894896551724138, "grad_norm": 0.34781625866889954, "learning_rate": 2.1149594694178336e-05, "loss": 1.2288, "num_input_tokens_seen": 12046848, "step": 2433, "train_runtime": 8401.5451, "train_tokens_per_second": 1433.885 }, { "epoch": 0.895264367816092, "grad_norm": 0.3810427486896515, "learning_rate": 2.10759027266028e-05, "loss": 1.2652, "num_input_tokens_seen": 12051744, "step": 2434, "train_runtime": 8404.8086, "train_tokens_per_second": 1433.911 }, { "epoch": 0.895632183908046, "grad_norm": 0.35943153500556946, "learning_rate": 2.1002210759027265e-05, "loss": 1.1269, "num_input_tokens_seen": 12055360, "step": 2435, "train_runtime": 8407.4064, "train_tokens_per_second": 1433.898 }, { "epoch": 0.896, "grad_norm": 0.3595828413963318, "learning_rate": 2.092851879145173e-05, "loss": 1.3073, "num_input_tokens_seen": 12059888, "step": 2436, "train_runtime": 8410.4383, "train_tokens_per_second": 1433.919 }, { "epoch": 0.896367816091954, "grad_norm": 0.3479820787906647, "learning_rate": 2.0854826823876198e-05, "loss": 1.0591, "num_input_tokens_seen": 12063344, "step": 2437, "train_runtime": 8412.9306, "train_tokens_per_second": 1433.905 }, { "epoch": 0.8967356321839081, "grad_norm": 0.4258720576763153, "learning_rate": 2.0781134856300663e-05, "loss": 1.1266, "num_input_tokens_seen": 12069552, "step": 2438, "train_runtime": 8416.9393, "train_tokens_per_second": 1433.96 }, { "epoch": 0.8971034482758621, "grad_norm": 0.38927775621414185, "learning_rate": 2.0707442888725128e-05, "loss": 1.3002, "num_input_tokens_seen": 12072912, "step": 2439, "train_runtime": 8419.4031, "train_tokens_per_second": 1433.939 }, { "epoch": 0.8974712643678161, "grad_norm": 0.3939809203147888, "learning_rate": 2.0633750921149596e-05, "loss": 1.2204, "num_input_tokens_seen": 12076928, "step": 2440, "train_runtime": 8422.1889, "train_tokens_per_second": 1433.942 }, { "epoch": 0.8978390804597701, "grad_norm": 0.37524181604385376, "learning_rate": 2.056005895357406e-05, "loss": 1.1172, "num_input_tokens_seen": 12082016, "step": 2441, "train_runtime": 8425.5927, "train_tokens_per_second": 1433.966 }, { "epoch": 0.8982068965517241, "grad_norm": 0.3529812693595886, "learning_rate": 2.0486366985998526e-05, "loss": 1.1422, "num_input_tokens_seen": 12085712, "step": 2442, "train_runtime": 8428.1437, "train_tokens_per_second": 1433.971 }, { "epoch": 0.8985747126436782, "grad_norm": 0.36355653405189514, "learning_rate": 2.0412675018422994e-05, "loss": 1.1259, "num_input_tokens_seen": 12089248, "step": 2443, "train_runtime": 8430.7314, "train_tokens_per_second": 1433.95 }, { "epoch": 0.8989425287356322, "grad_norm": 0.38057613372802734, "learning_rate": 2.033898305084746e-05, "loss": 1.0715, "num_input_tokens_seen": 12093120, "step": 2444, "train_runtime": 8433.4656, "train_tokens_per_second": 1433.944 }, { "epoch": 0.8993103448275862, "grad_norm": 0.3674173653125763, "learning_rate": 2.0265291083271927e-05, "loss": 1.2794, "num_input_tokens_seen": 12103136, "step": 2445, "train_runtime": 8439.5163, "train_tokens_per_second": 1434.103 }, { "epoch": 0.8996781609195402, "grad_norm": 0.3886840343475342, "learning_rate": 2.0191599115696392e-05, "loss": 1.2219, "num_input_tokens_seen": 12107664, "step": 2446, "train_runtime": 8442.5025, "train_tokens_per_second": 1434.132 }, { "epoch": 0.9000459770114942, "grad_norm": 0.36319077014923096, "learning_rate": 2.0117907148120857e-05, "loss": 1.1283, "num_input_tokens_seen": 12112640, "step": 2447, "train_runtime": 8445.7575, "train_tokens_per_second": 1434.169 }, { "epoch": 0.9004137931034483, "grad_norm": 0.365339994430542, "learning_rate": 2.004421518054532e-05, "loss": 1.0311, "num_input_tokens_seen": 12116192, "step": 2448, "train_runtime": 8448.3127, "train_tokens_per_second": 1434.155 }, { "epoch": 0.9004137931034483, "eval_loss": 1.2033369541168213, "eval_runtime": 15.3222, "eval_samples_per_second": 65.265, "eval_steps_per_second": 4.112, "num_input_tokens_seen": 12116192, "step": 2448 }, { "epoch": 0.9007816091954023, "grad_norm": 0.37838661670684814, "learning_rate": 1.997052321296979e-05, "loss": 1.2124, "num_input_tokens_seen": 12123168, "step": 2449, "train_runtime": 8468.1029, "train_tokens_per_second": 1431.627 }, { "epoch": 0.9011494252873563, "grad_norm": 0.379877507686615, "learning_rate": 1.9896831245394254e-05, "loss": 1.1355, "num_input_tokens_seen": 12128208, "step": 2450, "train_runtime": 8471.4127, "train_tokens_per_second": 1431.663 }, { "epoch": 0.9015172413793103, "grad_norm": 0.38910603523254395, "learning_rate": 1.982313927781872e-05, "loss": 1.1078, "num_input_tokens_seen": 12131680, "step": 2451, "train_runtime": 8473.9126, "train_tokens_per_second": 1431.65 }, { "epoch": 0.9018850574712644, "grad_norm": 0.3610929846763611, "learning_rate": 1.9749447310243184e-05, "loss": 1.1257, "num_input_tokens_seen": 12134944, "step": 2452, "train_runtime": 8476.3088, "train_tokens_per_second": 1431.631 }, { "epoch": 0.9022528735632184, "grad_norm": 0.37164750695228577, "learning_rate": 1.9675755342667652e-05, "loss": 1.1522, "num_input_tokens_seen": 12138240, "step": 2453, "train_runtime": 8478.6699, "train_tokens_per_second": 1431.621 }, { "epoch": 0.9026206896551724, "grad_norm": 0.3993352949619293, "learning_rate": 1.9602063375092117e-05, "loss": 1.2239, "num_input_tokens_seen": 12143008, "step": 2454, "train_runtime": 8481.843, "train_tokens_per_second": 1431.647 }, { "epoch": 0.9029885057471264, "grad_norm": 0.37187516689300537, "learning_rate": 1.9528371407516582e-05, "loss": 1.1776, "num_input_tokens_seen": 12148320, "step": 2455, "train_runtime": 8485.3594, "train_tokens_per_second": 1431.68 }, { "epoch": 0.9033563218390804, "grad_norm": 0.3434256315231323, "learning_rate": 1.9454679439941047e-05, "loss": 1.1513, "num_input_tokens_seen": 12151616, "step": 2456, "train_runtime": 8487.7751, "train_tokens_per_second": 1431.661 }, { "epoch": 0.9037241379310345, "grad_norm": 0.3511615991592407, "learning_rate": 1.9380987472365515e-05, "loss": 1.3006, "num_input_tokens_seen": 12156032, "step": 2457, "train_runtime": 8490.8279, "train_tokens_per_second": 1431.666 }, { "epoch": 0.9040919540229885, "grad_norm": 0.3882412016391754, "learning_rate": 1.930729550478998e-05, "loss": 1.1631, "num_input_tokens_seen": 12160480, "step": 2458, "train_runtime": 8493.8436, "train_tokens_per_second": 1431.682 }, { "epoch": 0.9044597701149425, "grad_norm": 0.36855489015579224, "learning_rate": 1.9233603537214445e-05, "loss": 1.2051, "num_input_tokens_seen": 12167392, "step": 2459, "train_runtime": 8498.0703, "train_tokens_per_second": 1431.783 }, { "epoch": 0.9048275862068965, "grad_norm": 0.3787379264831543, "learning_rate": 1.915991156963891e-05, "loss": 1.1731, "num_input_tokens_seen": 12172544, "step": 2460, "train_runtime": 8501.5298, "train_tokens_per_second": 1431.806 }, { "epoch": 0.9051954022988505, "grad_norm": 0.357272207736969, "learning_rate": 1.9086219602063378e-05, "loss": 1.1767, "num_input_tokens_seen": 12176064, "step": 2461, "train_runtime": 8506.5689, "train_tokens_per_second": 1431.372 }, { "epoch": 0.9055632183908046, "grad_norm": 0.3510552942752838, "learning_rate": 1.9012527634487842e-05, "loss": 1.1362, "num_input_tokens_seen": 12179440, "step": 2462, "train_runtime": 8508.9599, "train_tokens_per_second": 1431.366 }, { "epoch": 0.9059310344827586, "grad_norm": 0.36177706718444824, "learning_rate": 1.8938835666912307e-05, "loss": 1.2651, "num_input_tokens_seen": 12184320, "step": 2463, "train_runtime": 8512.245, "train_tokens_per_second": 1431.387 }, { "epoch": 0.9062988505747126, "grad_norm": 0.35650742053985596, "learning_rate": 1.8865143699336772e-05, "loss": 1.1847, "num_input_tokens_seen": 12188928, "step": 2464, "train_runtime": 8515.338, "train_tokens_per_second": 1431.409 }, { "epoch": 0.9066666666666666, "grad_norm": 0.35153520107269287, "learning_rate": 1.879145173176124e-05, "loss": 1.0763, "num_input_tokens_seen": 12193216, "step": 2465, "train_runtime": 8518.2521, "train_tokens_per_second": 1431.422 }, { "epoch": 0.9070344827586206, "grad_norm": 0.3745214343070984, "learning_rate": 1.8717759764185705e-05, "loss": 1.0905, "num_input_tokens_seen": 12198560, "step": 2466, "train_runtime": 8521.6546, "train_tokens_per_second": 1431.478 }, { "epoch": 0.9074022988505747, "grad_norm": 0.6005309820175171, "learning_rate": 1.864406779661017e-05, "loss": 1.1381, "num_input_tokens_seen": 12202640, "step": 2467, "train_runtime": 8524.5246, "train_tokens_per_second": 1431.475 }, { "epoch": 0.9077701149425287, "grad_norm": 0.3786957859992981, "learning_rate": 1.8570375829034635e-05, "loss": 1.1231, "num_input_tokens_seen": 12209984, "step": 2468, "train_runtime": 8529.0861, "train_tokens_per_second": 1431.57 }, { "epoch": 0.9081379310344827, "grad_norm": 0.37910813093185425, "learning_rate": 1.8496683861459103e-05, "loss": 1.0957, "num_input_tokens_seen": 12214944, "step": 2469, "train_runtime": 8532.3487, "train_tokens_per_second": 1431.604 }, { "epoch": 0.9085057471264368, "grad_norm": 0.39273855090141296, "learning_rate": 1.8422991893883568e-05, "loss": 1.1858, "num_input_tokens_seen": 12219808, "step": 2470, "train_runtime": 8535.5674, "train_tokens_per_second": 1431.634 }, { "epoch": 0.9088735632183909, "grad_norm": 0.39350464940071106, "learning_rate": 1.8349299926308033e-05, "loss": 1.1622, "num_input_tokens_seen": 12224800, "step": 2471, "train_runtime": 8538.9557, "train_tokens_per_second": 1431.65 }, { "epoch": 0.9092413793103449, "grad_norm": 0.3747163414955139, "learning_rate": 1.8275607958732497e-05, "loss": 1.1086, "num_input_tokens_seen": 12233248, "step": 2472, "train_runtime": 8544.1552, "train_tokens_per_second": 1431.768 }, { "epoch": 0.9096091954022989, "grad_norm": 0.36554378271102905, "learning_rate": 1.8201915991156966e-05, "loss": 1.149, "num_input_tokens_seen": 12236976, "step": 2473, "train_runtime": 8546.7917, "train_tokens_per_second": 1431.763 }, { "epoch": 0.9099770114942529, "grad_norm": 0.3639166057109833, "learning_rate": 1.812822402358143e-05, "loss": 1.0614, "num_input_tokens_seen": 12242512, "step": 2474, "train_runtime": 8550.4639, "train_tokens_per_second": 1431.795 }, { "epoch": 0.9103448275862069, "grad_norm": 0.4087698757648468, "learning_rate": 1.8054532056005895e-05, "loss": 1.1927, "num_input_tokens_seen": 12251312, "step": 2475, "train_runtime": 8555.745, "train_tokens_per_second": 1431.94 }, { "epoch": 0.910712643678161, "grad_norm": 0.35056373476982117, "learning_rate": 1.7980840088430363e-05, "loss": 1.0884, "num_input_tokens_seen": 12255104, "step": 2476, "train_runtime": 8558.4163, "train_tokens_per_second": 1431.936 }, { "epoch": 0.911080459770115, "grad_norm": 0.39144542813301086, "learning_rate": 1.7907148120854828e-05, "loss": 1.249, "num_input_tokens_seen": 12260080, "step": 2477, "train_runtime": 8561.6894, "train_tokens_per_second": 1431.97 }, { "epoch": 0.911448275862069, "grad_norm": 0.3819919228553772, "learning_rate": 1.7833456153279293e-05, "loss": 1.2446, "num_input_tokens_seen": 12264432, "step": 2478, "train_runtime": 8564.7175, "train_tokens_per_second": 1431.972 }, { "epoch": 0.911816091954023, "grad_norm": 0.37486758828163147, "learning_rate": 1.7759764185703758e-05, "loss": 1.2748, "num_input_tokens_seen": 12268384, "step": 2479, "train_runtime": 8567.4436, "train_tokens_per_second": 1431.977 }, { "epoch": 0.912183908045977, "grad_norm": 0.3709360659122467, "learning_rate": 1.7686072218128226e-05, "loss": 1.2766, "num_input_tokens_seen": 12273120, "step": 2480, "train_runtime": 8570.5952, "train_tokens_per_second": 1432.003 }, { "epoch": 0.9125517241379311, "grad_norm": 0.3885132372379303, "learning_rate": 1.761238025055269e-05, "loss": 1.2032, "num_input_tokens_seen": 12277584, "step": 2481, "train_runtime": 8573.7554, "train_tokens_per_second": 1431.996 }, { "epoch": 0.9129195402298851, "grad_norm": 0.3441966772079468, "learning_rate": 1.7538688282977156e-05, "loss": 1.1289, "num_input_tokens_seen": 12281088, "step": 2482, "train_runtime": 8576.3067, "train_tokens_per_second": 1431.979 }, { "epoch": 0.9132873563218391, "grad_norm": 0.332922101020813, "learning_rate": 1.746499631540162e-05, "loss": 1.1557, "num_input_tokens_seen": 12286544, "step": 2483, "train_runtime": 8579.9477, "train_tokens_per_second": 1432.007 }, { "epoch": 0.9136551724137931, "grad_norm": 0.3894675374031067, "learning_rate": 1.739130434782609e-05, "loss": 1.205, "num_input_tokens_seen": 12292000, "step": 2484, "train_runtime": 8583.5373, "train_tokens_per_second": 1432.044 }, { "epoch": 0.9140229885057471, "grad_norm": 0.3474193215370178, "learning_rate": 1.7317612380250554e-05, "loss": 1.2556, "num_input_tokens_seen": 12297152, "step": 2485, "train_runtime": 8587.0062, "train_tokens_per_second": 1432.065 }, { "epoch": 0.9143908045977012, "grad_norm": 0.39839980006217957, "learning_rate": 1.724392041267502e-05, "loss": 1.064, "num_input_tokens_seen": 12300752, "step": 2486, "train_runtime": 8589.5539, "train_tokens_per_second": 1432.059 }, { "epoch": 0.9147586206896552, "grad_norm": 0.33552855253219604, "learning_rate": 1.7170228445099483e-05, "loss": 1.1282, "num_input_tokens_seen": 12304608, "step": 2487, "train_runtime": 8592.2305, "train_tokens_per_second": 1432.062 }, { "epoch": 0.9151264367816092, "grad_norm": 0.3747282326221466, "learning_rate": 1.709653647752395e-05, "loss": 1.0453, "num_input_tokens_seen": 12311968, "step": 2488, "train_runtime": 8596.8005, "train_tokens_per_second": 1432.157 }, { "epoch": 0.9154942528735632, "grad_norm": 0.3756624162197113, "learning_rate": 1.7022844509948416e-05, "loss": 1.2382, "num_input_tokens_seen": 12316528, "step": 2489, "train_runtime": 8599.8703, "train_tokens_per_second": 1432.176 }, { "epoch": 0.9158620689655173, "grad_norm": 0.37141913175582886, "learning_rate": 1.694915254237288e-05, "loss": 1.0413, "num_input_tokens_seen": 12320016, "step": 2490, "train_runtime": 8602.3705, "train_tokens_per_second": 1432.165 }, { "epoch": 0.9162298850574713, "grad_norm": 0.3895915150642395, "learning_rate": 1.6875460574797346e-05, "loss": 1.2209, "num_input_tokens_seen": 12323440, "step": 2491, "train_runtime": 8606.8155, "train_tokens_per_second": 1431.823 }, { "epoch": 0.9165977011494253, "grad_norm": 0.4433688223361969, "learning_rate": 1.6801768607221814e-05, "loss": 1.2876, "num_input_tokens_seen": 12327728, "step": 2492, "train_runtime": 8609.7421, "train_tokens_per_second": 1431.835 }, { "epoch": 0.9169655172413793, "grad_norm": 0.3654894232749939, "learning_rate": 1.672807663964628e-05, "loss": 1.1085, "num_input_tokens_seen": 12331840, "step": 2493, "train_runtime": 8612.6297, "train_tokens_per_second": 1431.832 }, { "epoch": 0.9173333333333333, "grad_norm": 0.3452780842781067, "learning_rate": 1.6654384672070744e-05, "loss": 1.0985, "num_input_tokens_seen": 12336688, "step": 2494, "train_runtime": 8615.8882, "train_tokens_per_second": 1431.853 }, { "epoch": 0.9177011494252874, "grad_norm": 0.3547157943248749, "learning_rate": 1.658069270449521e-05, "loss": 1.1784, "num_input_tokens_seen": 12342240, "step": 2495, "train_runtime": 8619.5322, "train_tokens_per_second": 1431.892 }, { "epoch": 0.9180689655172414, "grad_norm": 0.37024760246276855, "learning_rate": 1.6507000736919677e-05, "loss": 1.1215, "num_input_tokens_seen": 12352240, "step": 2496, "train_runtime": 8625.5367, "train_tokens_per_second": 1432.055 }, { "epoch": 0.9184367816091954, "grad_norm": 0.4070953130722046, "learning_rate": 1.643330876934414e-05, "loss": 1.2314, "num_input_tokens_seen": 12358288, "step": 2497, "train_runtime": 8629.3706, "train_tokens_per_second": 1432.119 }, { "epoch": 0.9188045977011494, "grad_norm": 0.42430737614631653, "learning_rate": 1.6359616801768606e-05, "loss": 1.1096, "num_input_tokens_seen": 12363984, "step": 2498, "train_runtime": 8633.0736, "train_tokens_per_second": 1432.165 }, { "epoch": 0.9191724137931034, "grad_norm": 0.4190928637981415, "learning_rate": 1.628592483419307e-05, "loss": 1.1957, "num_input_tokens_seen": 12367520, "step": 2499, "train_runtime": 8635.6013, "train_tokens_per_second": 1432.155 }, { "epoch": 0.9195402298850575, "grad_norm": 0.36764538288116455, "learning_rate": 1.621223286661754e-05, "loss": 1.2321, "num_input_tokens_seen": 12372640, "step": 2500, "train_runtime": 8639.0174, "train_tokens_per_second": 1432.181 }, { "epoch": 0.9199080459770115, "grad_norm": 0.3932344317436218, "learning_rate": 1.6138540899042004e-05, "loss": 1.0861, "num_input_tokens_seen": 12376704, "step": 2501, "train_runtime": 8641.8016, "train_tokens_per_second": 1432.19 }, { "epoch": 0.9202758620689655, "grad_norm": 0.390630841255188, "learning_rate": 1.606484893146647e-05, "loss": 1.2483, "num_input_tokens_seen": 12383472, "step": 2502, "train_runtime": 8646.1442, "train_tokens_per_second": 1432.254 }, { "epoch": 0.9206436781609195, "grad_norm": 0.3736308217048645, "learning_rate": 1.5991156963890934e-05, "loss": 1.2097, "num_input_tokens_seen": 12388912, "step": 2503, "train_runtime": 8649.7678, "train_tokens_per_second": 1432.283 }, { "epoch": 0.9210114942528735, "grad_norm": 0.3684477210044861, "learning_rate": 1.5917464996315402e-05, "loss": 1.1588, "num_input_tokens_seen": 12391984, "step": 2504, "train_runtime": 8652.0962, "train_tokens_per_second": 1432.252 }, { "epoch": 0.9213793103448276, "grad_norm": 0.3766310214996338, "learning_rate": 1.584377302873987e-05, "loss": 1.3325, "num_input_tokens_seen": 12397216, "step": 2505, "train_runtime": 8655.5247, "train_tokens_per_second": 1432.289 }, { "epoch": 0.9217471264367816, "grad_norm": 0.40472573041915894, "learning_rate": 1.5770081061164335e-05, "loss": 1.3397, "num_input_tokens_seen": 12401088, "step": 2506, "train_runtime": 8658.1997, "train_tokens_per_second": 1432.294 }, { "epoch": 0.9221149425287356, "grad_norm": 0.36540356278419495, "learning_rate": 1.56963890935888e-05, "loss": 1.2042, "num_input_tokens_seen": 12407328, "step": 2507, "train_runtime": 8662.1559, "train_tokens_per_second": 1432.36 }, { "epoch": 0.9224827586206896, "grad_norm": 0.3810074031352997, "learning_rate": 1.5622697126013265e-05, "loss": 1.1581, "num_input_tokens_seen": 12412256, "step": 2508, "train_runtime": 8665.4316, "train_tokens_per_second": 1432.388 }, { "epoch": 0.9228505747126436, "grad_norm": 0.373441606760025, "learning_rate": 1.5549005158437733e-05, "loss": 1.2202, "num_input_tokens_seen": 12416256, "step": 2509, "train_runtime": 8668.2917, "train_tokens_per_second": 1432.376 }, { "epoch": 0.9232183908045977, "grad_norm": 0.39730438590049744, "learning_rate": 1.5475313190862198e-05, "loss": 1.2659, "num_input_tokens_seen": 12422336, "step": 2510, "train_runtime": 8672.2362, "train_tokens_per_second": 1432.426 }, { "epoch": 0.9235862068965517, "grad_norm": 0.3227142095565796, "learning_rate": 1.5401621223286663e-05, "loss": 1.1228, "num_input_tokens_seen": 12428512, "step": 2511, "train_runtime": 8676.2907, "train_tokens_per_second": 1432.468 }, { "epoch": 0.9239540229885057, "grad_norm": 0.35089659690856934, "learning_rate": 1.532792925571113e-05, "loss": 1.1555, "num_input_tokens_seen": 12434928, "step": 2512, "train_runtime": 8680.4554, "train_tokens_per_second": 1432.52 }, { "epoch": 0.9243218390804597, "grad_norm": 0.38634735345840454, "learning_rate": 1.5254237288135596e-05, "loss": 1.2185, "num_input_tokens_seen": 12438384, "step": 2513, "train_runtime": 8682.9606, "train_tokens_per_second": 1432.505 }, { "epoch": 0.9246896551724137, "grad_norm": 0.36329758167266846, "learning_rate": 1.518054532056006e-05, "loss": 1.1645, "num_input_tokens_seen": 12441984, "step": 2514, "train_runtime": 8685.4576, "train_tokens_per_second": 1432.508 }, { "epoch": 0.9250574712643678, "grad_norm": 0.3851502239704132, "learning_rate": 1.5106853352984527e-05, "loss": 1.1352, "num_input_tokens_seen": 12447440, "step": 2515, "train_runtime": 8689.0797, "train_tokens_per_second": 1432.538 }, { "epoch": 0.9254252873563218, "grad_norm": 0.37889960408210754, "learning_rate": 1.5033161385408992e-05, "loss": 1.2014, "num_input_tokens_seen": 12454224, "step": 2516, "train_runtime": 8693.439, "train_tokens_per_second": 1432.6 }, { "epoch": 0.9257931034482758, "grad_norm": 0.39130479097366333, "learning_rate": 1.4959469417833458e-05, "loss": 1.2034, "num_input_tokens_seen": 12458032, "step": 2517, "train_runtime": 8696.1442, "train_tokens_per_second": 1432.593 }, { "epoch": 0.9261609195402298, "grad_norm": 0.3867555856704712, "learning_rate": 1.4885777450257923e-05, "loss": 1.1046, "num_input_tokens_seen": 12463840, "step": 2518, "train_runtime": 8699.9164, "train_tokens_per_second": 1432.639 }, { "epoch": 0.9265287356321839, "grad_norm": 0.3491637408733368, "learning_rate": 1.481208548268239e-05, "loss": 1.1492, "num_input_tokens_seen": 12467376, "step": 2519, "train_runtime": 8702.4386, "train_tokens_per_second": 1432.63 }, { "epoch": 0.926896551724138, "grad_norm": 0.3786649703979492, "learning_rate": 1.4738393515106855e-05, "loss": 1.1248, "num_input_tokens_seen": 12472976, "step": 2520, "train_runtime": 8706.0471, "train_tokens_per_second": 1432.68 }, { "epoch": 0.927264367816092, "grad_norm": 0.33817291259765625, "learning_rate": 1.4664701547531321e-05, "loss": 1.0623, "num_input_tokens_seen": 12476560, "step": 2521, "train_runtime": 8710.5778, "train_tokens_per_second": 1432.346 }, { "epoch": 0.927632183908046, "grad_norm": 0.4019729197025299, "learning_rate": 1.4591009579955786e-05, "loss": 1.3792, "num_input_tokens_seen": 12480688, "step": 2522, "train_runtime": 8713.3667, "train_tokens_per_second": 1432.361 }, { "epoch": 0.928, "grad_norm": 0.36243730783462524, "learning_rate": 1.4517317612380252e-05, "loss": 1.1777, "num_input_tokens_seen": 12486608, "step": 2523, "train_runtime": 8717.2246, "train_tokens_per_second": 1432.406 }, { "epoch": 0.9283678160919541, "grad_norm": 0.40555229783058167, "learning_rate": 1.4443625644804717e-05, "loss": 1.2722, "num_input_tokens_seen": 12490032, "step": 2524, "train_runtime": 8719.6435, "train_tokens_per_second": 1432.402 }, { "epoch": 0.9287356321839081, "grad_norm": 0.40432339906692505, "learning_rate": 1.4369933677229184e-05, "loss": 1.1675, "num_input_tokens_seen": 12494720, "step": 2525, "train_runtime": 8722.8133, "train_tokens_per_second": 1432.419 }, { "epoch": 0.9291034482758621, "grad_norm": 0.4040227234363556, "learning_rate": 1.4296241709653649e-05, "loss": 1.2355, "num_input_tokens_seen": 12500048, "step": 2526, "train_runtime": 8726.2638, "train_tokens_per_second": 1432.463 }, { "epoch": 0.9294712643678161, "grad_norm": 0.36101672053337097, "learning_rate": 1.4222549742078115e-05, "loss": 1.1843, "num_input_tokens_seen": 12503296, "step": 2527, "train_runtime": 8728.6895, "train_tokens_per_second": 1432.437 }, { "epoch": 0.9298390804597702, "grad_norm": 0.3777821660041809, "learning_rate": 1.414885777450258e-05, "loss": 1.1627, "num_input_tokens_seen": 12507456, "step": 2528, "train_runtime": 8731.5779, "train_tokens_per_second": 1432.439 }, { "epoch": 0.9302068965517242, "grad_norm": 0.38835227489471436, "learning_rate": 1.4075165806927046e-05, "loss": 1.2043, "num_input_tokens_seen": 12512368, "step": 2529, "train_runtime": 8734.8654, "train_tokens_per_second": 1432.463 }, { "epoch": 0.9305747126436782, "grad_norm": 0.3832857608795166, "learning_rate": 1.4001473839351511e-05, "loss": 1.1951, "num_input_tokens_seen": 12516848, "step": 2530, "train_runtime": 8737.891, "train_tokens_per_second": 1432.479 }, { "epoch": 0.9309425287356322, "grad_norm": 0.35440483689308167, "learning_rate": 1.3927781871775978e-05, "loss": 1.087, "num_input_tokens_seen": 12527152, "step": 2531, "train_runtime": 8744.115, "train_tokens_per_second": 1432.638 }, { "epoch": 0.9313103448275862, "grad_norm": 0.3388694226741791, "learning_rate": 1.3854089904200443e-05, "loss": 1.1632, "num_input_tokens_seen": 12531728, "step": 2532, "train_runtime": 8747.1868, "train_tokens_per_second": 1432.658 }, { "epoch": 0.9316781609195403, "grad_norm": 0.37156593799591064, "learning_rate": 1.3780397936624909e-05, "loss": 1.0575, "num_input_tokens_seen": 12537328, "step": 2533, "train_runtime": 8750.7462, "train_tokens_per_second": 1432.715 }, { "epoch": 0.9320459770114943, "grad_norm": 0.36473792791366577, "learning_rate": 1.3706705969049374e-05, "loss": 1.2026, "num_input_tokens_seen": 12541328, "step": 2534, "train_runtime": 8753.4487, "train_tokens_per_second": 1432.73 }, { "epoch": 0.9324137931034483, "grad_norm": 0.3509726822376251, "learning_rate": 1.363301400147384e-05, "loss": 1.1565, "num_input_tokens_seen": 12546368, "step": 2535, "train_runtime": 8756.8869, "train_tokens_per_second": 1432.743 }, { "epoch": 0.9327816091954023, "grad_norm": 0.3323367238044739, "learning_rate": 1.3559322033898305e-05, "loss": 1.1789, "num_input_tokens_seen": 12554608, "step": 2536, "train_runtime": 8761.9476, "train_tokens_per_second": 1432.856 }, { "epoch": 0.9331494252873563, "grad_norm": 0.39954280853271484, "learning_rate": 1.3485630066322772e-05, "loss": 1.2408, "num_input_tokens_seen": 12558608, "step": 2537, "train_runtime": 8764.8355, "train_tokens_per_second": 1432.84 }, { "epoch": 0.9335172413793104, "grad_norm": 0.378231018781662, "learning_rate": 1.3411938098747237e-05, "loss": 1.3176, "num_input_tokens_seen": 12561872, "step": 2538, "train_runtime": 8767.2727, "train_tokens_per_second": 1432.814 }, { "epoch": 0.9338850574712644, "grad_norm": 0.38415512442588806, "learning_rate": 1.3338246131171703e-05, "loss": 1.2404, "num_input_tokens_seen": 12567104, "step": 2539, "train_runtime": 8770.8248, "train_tokens_per_second": 1432.83 }, { "epoch": 0.9342528735632184, "grad_norm": 0.3389279246330261, "learning_rate": 1.3264554163596168e-05, "loss": 1.1042, "num_input_tokens_seen": 12570432, "step": 2540, "train_runtime": 8773.2796, "train_tokens_per_second": 1432.809 }, { "epoch": 0.9346206896551724, "grad_norm": 0.33893299102783203, "learning_rate": 1.3190862196020634e-05, "loss": 1.0801, "num_input_tokens_seen": 12574432, "step": 2541, "train_runtime": 8776.0549, "train_tokens_per_second": 1432.811 }, { "epoch": 0.9349885057471264, "grad_norm": 0.403434693813324, "learning_rate": 1.31171702284451e-05, "loss": 1.1139, "num_input_tokens_seen": 12579056, "step": 2542, "train_runtime": 8779.074, "train_tokens_per_second": 1432.845 }, { "epoch": 0.9353563218390805, "grad_norm": 0.39922621846199036, "learning_rate": 1.3043478260869566e-05, "loss": 1.2206, "num_input_tokens_seen": 12583968, "step": 2543, "train_runtime": 8782.3478, "train_tokens_per_second": 1432.871 }, { "epoch": 0.9357241379310345, "grad_norm": 0.3386867940425873, "learning_rate": 1.296978629329403e-05, "loss": 1.1265, "num_input_tokens_seen": 12588064, "step": 2544, "train_runtime": 8785.1712, "train_tokens_per_second": 1432.876 }, { "epoch": 0.9360919540229885, "grad_norm": 0.3719545006752014, "learning_rate": 1.2896094325718497e-05, "loss": 1.1342, "num_input_tokens_seen": 12592336, "step": 2545, "train_runtime": 8788.1685, "train_tokens_per_second": 1432.874 }, { "epoch": 0.9364597701149425, "grad_norm": 0.4040217399597168, "learning_rate": 1.2822402358142962e-05, "loss": 1.1269, "num_input_tokens_seen": 12596976, "step": 2546, "train_runtime": 8791.3135, "train_tokens_per_second": 1432.889 }, { "epoch": 0.9368275862068965, "grad_norm": 0.3798476755619049, "learning_rate": 1.2748710390567428e-05, "loss": 1.1829, "num_input_tokens_seen": 12604400, "step": 2547, "train_runtime": 8796.0338, "train_tokens_per_second": 1432.964 }, { "epoch": 0.9371954022988506, "grad_norm": 0.36366572976112366, "learning_rate": 1.2675018422991893e-05, "loss": 1.1791, "num_input_tokens_seen": 12609392, "step": 2548, "train_runtime": 8799.3262, "train_tokens_per_second": 1432.995 }, { "epoch": 0.9375632183908046, "grad_norm": 0.3968220055103302, "learning_rate": 1.260132645541636e-05, "loss": 1.159, "num_input_tokens_seen": 12615264, "step": 2549, "train_runtime": 8803.1812, "train_tokens_per_second": 1433.035 }, { "epoch": 0.9379310344827586, "grad_norm": 0.34876206517219543, "learning_rate": 1.2527634487840825e-05, "loss": 1.1937, "num_input_tokens_seen": 12621904, "step": 2550, "train_runtime": 8807.4091, "train_tokens_per_second": 1433.101 }, { "epoch": 0.9382988505747126, "grad_norm": 0.36600789427757263, "learning_rate": 1.2453942520265293e-05, "loss": 1.1573, "num_input_tokens_seen": 12625760, "step": 2551, "train_runtime": 8812.2221, "train_tokens_per_second": 1432.756 }, { "epoch": 0.9386666666666666, "grad_norm": 0.4065242111682892, "learning_rate": 1.2380250552689758e-05, "loss": 1.2907, "num_input_tokens_seen": 12630928, "step": 2552, "train_runtime": 8815.6538, "train_tokens_per_second": 1432.784 }, { "epoch": 0.9390344827586207, "grad_norm": 0.3677788972854614, "learning_rate": 1.2306558585114224e-05, "loss": 1.1828, "num_input_tokens_seen": 12635392, "step": 2553, "train_runtime": 8818.6534, "train_tokens_per_second": 1432.803 }, { "epoch": 0.9394022988505747, "grad_norm": 0.38127607107162476, "learning_rate": 1.2232866617538689e-05, "loss": 1.2158, "num_input_tokens_seen": 12639776, "step": 2554, "train_runtime": 8821.6439, "train_tokens_per_second": 1432.814 }, { "epoch": 0.9397701149425287, "grad_norm": 0.3584839105606079, "learning_rate": 1.2159174649963155e-05, "loss": 1.129, "num_input_tokens_seen": 12647728, "step": 2555, "train_runtime": 8826.6192, "train_tokens_per_second": 1432.907 }, { "epoch": 0.9401379310344827, "grad_norm": 0.35018038749694824, "learning_rate": 1.208548268238762e-05, "loss": 1.1501, "num_input_tokens_seen": 12653712, "step": 2556, "train_runtime": 8830.5315, "train_tokens_per_second": 1432.95 }, { "epoch": 0.9405057471264368, "grad_norm": 0.3529202342033386, "learning_rate": 1.2011790714812087e-05, "loss": 1.1141, "num_input_tokens_seen": 12658416, "step": 2557, "train_runtime": 8833.6765, "train_tokens_per_second": 1432.973 }, { "epoch": 0.9408735632183908, "grad_norm": 0.36576128005981445, "learning_rate": 1.1938098747236552e-05, "loss": 1.0964, "num_input_tokens_seen": 12665728, "step": 2558, "train_runtime": 8838.2206, "train_tokens_per_second": 1433.063 }, { "epoch": 0.9412413793103448, "grad_norm": 0.38364243507385254, "learning_rate": 1.1864406779661018e-05, "loss": 1.2179, "num_input_tokens_seen": 12673776, "step": 2559, "train_runtime": 8843.2391, "train_tokens_per_second": 1433.16 }, { "epoch": 0.9416091954022988, "grad_norm": 0.38225045800209045, "learning_rate": 1.1790714812085483e-05, "loss": 1.0608, "num_input_tokens_seen": 12679968, "step": 2560, "train_runtime": 8847.2828, "train_tokens_per_second": 1433.205 }, { "epoch": 0.9419770114942528, "grad_norm": 0.3517354428768158, "learning_rate": 1.171702284450995e-05, "loss": 1.0932, "num_input_tokens_seen": 12686352, "step": 2561, "train_runtime": 8851.4069, "train_tokens_per_second": 1433.258 }, { "epoch": 0.9423448275862069, "grad_norm": 0.3529907464981079, "learning_rate": 1.1643330876934414e-05, "loss": 1.1662, "num_input_tokens_seen": 12691264, "step": 2562, "train_runtime": 8854.6544, "train_tokens_per_second": 1433.287 }, { "epoch": 0.9427126436781609, "grad_norm": 0.44911494851112366, "learning_rate": 1.156963890935888e-05, "loss": 1.1467, "num_input_tokens_seen": 12698480, "step": 2563, "train_runtime": 8859.2483, "train_tokens_per_second": 1433.359 }, { "epoch": 0.9430804597701149, "grad_norm": 0.3625054955482483, "learning_rate": 1.1495946941783346e-05, "loss": 1.123, "num_input_tokens_seen": 12702864, "step": 2564, "train_runtime": 8862.2128, "train_tokens_per_second": 1433.374 }, { "epoch": 0.9434482758620689, "grad_norm": 0.3507109582424164, "learning_rate": 1.1422254974207812e-05, "loss": 1.2098, "num_input_tokens_seen": 12706896, "step": 2565, "train_runtime": 8865.0445, "train_tokens_per_second": 1433.371 }, { "epoch": 0.9438160919540229, "grad_norm": 0.37830185890197754, "learning_rate": 1.1348563006632277e-05, "loss": 1.2039, "num_input_tokens_seen": 12710448, "step": 2566, "train_runtime": 8867.6649, "train_tokens_per_second": 1433.348 }, { "epoch": 0.944183908045977, "grad_norm": 0.37593886256217957, "learning_rate": 1.1274871039056743e-05, "loss": 1.0765, "num_input_tokens_seen": 12715456, "step": 2567, "train_runtime": 8870.9802, "train_tokens_per_second": 1433.377 }, { "epoch": 0.944551724137931, "grad_norm": 0.36541810631752014, "learning_rate": 1.1201179071481208e-05, "loss": 1.1554, "num_input_tokens_seen": 12718928, "step": 2568, "train_runtime": 8873.5351, "train_tokens_per_second": 1433.355 }, { "epoch": 0.944919540229885, "grad_norm": 0.34366193413734436, "learning_rate": 1.1127487103905675e-05, "loss": 1.0039, "num_input_tokens_seen": 12724192, "step": 2569, "train_runtime": 8877.0485, "train_tokens_per_second": 1433.381 }, { "epoch": 0.9452873563218391, "grad_norm": 0.3616051971912384, "learning_rate": 1.105379513633014e-05, "loss": 1.2761, "num_input_tokens_seen": 12728064, "step": 2570, "train_runtime": 8879.7794, "train_tokens_per_second": 1433.376 }, { "epoch": 0.9456551724137932, "grad_norm": 0.3893207907676697, "learning_rate": 1.0980103168754606e-05, "loss": 1.2434, "num_input_tokens_seen": 12733440, "step": 2571, "train_runtime": 8883.3757, "train_tokens_per_second": 1433.401 }, { "epoch": 0.9460229885057472, "grad_norm": 0.38037747144699097, "learning_rate": 1.0906411201179071e-05, "loss": 1.3139, "num_input_tokens_seen": 12737264, "step": 2572, "train_runtime": 8886.0055, "train_tokens_per_second": 1433.407 }, { "epoch": 0.9463908045977012, "grad_norm": 0.41482865810394287, "learning_rate": 1.0832719233603538e-05, "loss": 1.1259, "num_input_tokens_seen": 12743360, "step": 2573, "train_runtime": 8889.95, "train_tokens_per_second": 1433.457 }, { "epoch": 0.9467586206896552, "grad_norm": 0.4118165969848633, "learning_rate": 1.0759027266028002e-05, "loss": 1.2237, "num_input_tokens_seen": 12747872, "step": 2574, "train_runtime": 8892.9988, "train_tokens_per_second": 1433.473 }, { "epoch": 0.9471264367816092, "grad_norm": 0.4312781095504761, "learning_rate": 1.0685335298452469e-05, "loss": 1.2888, "num_input_tokens_seen": 12752000, "step": 2575, "train_runtime": 8895.8468, "train_tokens_per_second": 1433.478 }, { "epoch": 0.9474942528735633, "grad_norm": 0.31879571080207825, "learning_rate": 1.0611643330876934e-05, "loss": 1.0762, "num_input_tokens_seen": 12756016, "step": 2576, "train_runtime": 8898.5845, "train_tokens_per_second": 1433.488 }, { "epoch": 0.9478620689655173, "grad_norm": 0.37517669796943665, "learning_rate": 1.05379513633014e-05, "loss": 1.1017, "num_input_tokens_seen": 12761696, "step": 2577, "train_runtime": 8902.2535, "train_tokens_per_second": 1433.535 }, { "epoch": 0.9482298850574713, "grad_norm": 0.38680213689804077, "learning_rate": 1.0464259395725865e-05, "loss": 1.2187, "num_input_tokens_seen": 12767776, "step": 2578, "train_runtime": 8906.1848, "train_tokens_per_second": 1433.585 }, { "epoch": 0.9485977011494253, "grad_norm": 0.37336546182632446, "learning_rate": 1.0390567428150332e-05, "loss": 1.2181, "num_input_tokens_seen": 12772320, "step": 2579, "train_runtime": 8909.2796, "train_tokens_per_second": 1433.597 }, { "epoch": 0.9489655172413793, "grad_norm": 0.3453748822212219, "learning_rate": 1.0316875460574798e-05, "loss": 1.2581, "num_input_tokens_seen": 12777440, "step": 2580, "train_runtime": 8912.7079, "train_tokens_per_second": 1433.62 }, { "epoch": 0.9493333333333334, "grad_norm": 0.349387526512146, "learning_rate": 1.0243183492999263e-05, "loss": 1.1171, "num_input_tokens_seen": 12781008, "step": 2581, "train_runtime": 8917.4782, "train_tokens_per_second": 1433.254 }, { "epoch": 0.9497011494252874, "grad_norm": 0.35860323905944824, "learning_rate": 1.016949152542373e-05, "loss": 1.1587, "num_input_tokens_seen": 12787392, "step": 2582, "train_runtime": 8921.6211, "train_tokens_per_second": 1433.304 }, { "epoch": 0.9500689655172414, "grad_norm": 0.3526651859283447, "learning_rate": 1.0095799557848196e-05, "loss": 1.1402, "num_input_tokens_seen": 12791872, "step": 2583, "train_runtime": 8924.68, "train_tokens_per_second": 1433.314 }, { "epoch": 0.9504367816091954, "grad_norm": 0.3840789198875427, "learning_rate": 1.002210759027266e-05, "loss": 1.3412, "num_input_tokens_seen": 12799696, "step": 2584, "train_runtime": 8929.6252, "train_tokens_per_second": 1433.397 }, { "epoch": 0.9508045977011494, "grad_norm": 0.3874008357524872, "learning_rate": 9.948415622697127e-06, "loss": 1.1957, "num_input_tokens_seen": 12805120, "step": 2585, "train_runtime": 8933.1839, "train_tokens_per_second": 1433.433 }, { "epoch": 0.9511724137931035, "grad_norm": 0.3895336985588074, "learning_rate": 9.874723655121592e-06, "loss": 1.2269, "num_input_tokens_seen": 12810320, "step": 2586, "train_runtime": 8936.6843, "train_tokens_per_second": 1433.453 }, { "epoch": 0.9515402298850575, "grad_norm": 0.38132545351982117, "learning_rate": 9.801031687546059e-06, "loss": 1.2226, "num_input_tokens_seen": 12814624, "step": 2587, "train_runtime": 8939.6801, "train_tokens_per_second": 1433.454 }, { "epoch": 0.9519080459770115, "grad_norm": 0.38565635681152344, "learning_rate": 9.727339719970523e-06, "loss": 1.3191, "num_input_tokens_seen": 12819920, "step": 2588, "train_runtime": 8943.1142, "train_tokens_per_second": 1433.496 }, { "epoch": 0.9522758620689655, "grad_norm": 0.3734370172023773, "learning_rate": 9.65364775239499e-06, "loss": 1.2672, "num_input_tokens_seen": 12824256, "step": 2589, "train_runtime": 8946.0142, "train_tokens_per_second": 1433.516 }, { "epoch": 0.9526436781609195, "grad_norm": 0.38229501247406006, "learning_rate": 9.579955784819455e-06, "loss": 1.067, "num_input_tokens_seen": 12827936, "step": 2590, "train_runtime": 8948.607, "train_tokens_per_second": 1433.512 }, { "epoch": 0.9530114942528736, "grad_norm": 0.35377880930900574, "learning_rate": 9.506263817243921e-06, "loss": 1.1216, "num_input_tokens_seen": 12831744, "step": 2591, "train_runtime": 8951.3088, "train_tokens_per_second": 1433.505 }, { "epoch": 0.9533793103448276, "grad_norm": 0.3394309878349304, "learning_rate": 9.432571849668386e-06, "loss": 1.2458, "num_input_tokens_seen": 12837200, "step": 2592, "train_runtime": 8954.9699, "train_tokens_per_second": 1433.528 }, { "epoch": 0.9537471264367816, "grad_norm": 0.3668551743030548, "learning_rate": 9.358879882092853e-06, "loss": 1.2165, "num_input_tokens_seen": 12840992, "step": 2593, "train_runtime": 8957.6589, "train_tokens_per_second": 1433.521 }, { "epoch": 0.9541149425287356, "grad_norm": 0.32961776852607727, "learning_rate": 9.285187914517317e-06, "loss": 1.2615, "num_input_tokens_seen": 12845296, "step": 2594, "train_runtime": 8960.653, "train_tokens_per_second": 1433.522 }, { "epoch": 0.9544827586206897, "grad_norm": 0.40517279505729675, "learning_rate": 9.211495946941784e-06, "loss": 1.1891, "num_input_tokens_seen": 12850880, "step": 2595, "train_runtime": 8964.3592, "train_tokens_per_second": 1433.553 }, { "epoch": 0.9548505747126437, "grad_norm": 0.37425488233566284, "learning_rate": 9.137803979366249e-06, "loss": 1.1559, "num_input_tokens_seen": 12855984, "step": 2596, "train_runtime": 8967.7607, "train_tokens_per_second": 1433.578 }, { "epoch": 0.9552183908045977, "grad_norm": 0.37122002243995667, "learning_rate": 9.064112011790715e-06, "loss": 1.1885, "num_input_tokens_seen": 12860224, "step": 2597, "train_runtime": 8970.7211, "train_tokens_per_second": 1433.578 }, { "epoch": 0.9555862068965517, "grad_norm": 0.3670824468135834, "learning_rate": 8.990420044215182e-06, "loss": 1.149, "num_input_tokens_seen": 12863360, "step": 2598, "train_runtime": 8973.0784, "train_tokens_per_second": 1433.55 }, { "epoch": 0.9559540229885057, "grad_norm": 0.41599032282829285, "learning_rate": 8.916728076639647e-06, "loss": 1.299, "num_input_tokens_seen": 12867632, "step": 2599, "train_runtime": 8975.9753, "train_tokens_per_second": 1433.564 }, { "epoch": 0.9563218390804598, "grad_norm": 0.3932607173919678, "learning_rate": 8.843036109064113e-06, "loss": 1.2306, "num_input_tokens_seen": 12872960, "step": 2600, "train_runtime": 8979.5026, "train_tokens_per_second": 1433.594 }, { "epoch": 0.9566896551724138, "grad_norm": 0.3910403847694397, "learning_rate": 8.769344141488578e-06, "loss": 1.3124, "num_input_tokens_seen": 12877552, "step": 2601, "train_runtime": 8982.6007, "train_tokens_per_second": 1433.611 }, { "epoch": 0.9570574712643678, "grad_norm": 0.38028043508529663, "learning_rate": 8.695652173913044e-06, "loss": 1.1597, "num_input_tokens_seen": 12883952, "step": 2602, "train_runtime": 8986.69, "train_tokens_per_second": 1433.67 }, { "epoch": 0.9574252873563218, "grad_norm": 0.39262303709983826, "learning_rate": 8.62196020633751e-06, "loss": 1.2596, "num_input_tokens_seen": 12887696, "step": 2603, "train_runtime": 8989.271, "train_tokens_per_second": 1433.675 }, { "epoch": 0.9577931034482758, "grad_norm": 0.32645902037620544, "learning_rate": 8.548268238761976e-06, "loss": 1.1844, "num_input_tokens_seen": 12898432, "step": 2604, "train_runtime": 8995.6472, "train_tokens_per_second": 1433.853 }, { "epoch": 0.9581609195402299, "grad_norm": 0.34202808141708374, "learning_rate": 8.47457627118644e-06, "loss": 1.1345, "num_input_tokens_seen": 12904416, "step": 2605, "train_runtime": 8999.5357, "train_tokens_per_second": 1433.898 }, { "epoch": 0.9585287356321839, "grad_norm": 0.3665388524532318, "learning_rate": 8.400884303610907e-06, "loss": 1.2556, "num_input_tokens_seen": 12909888, "step": 2606, "train_runtime": 9003.0978, "train_tokens_per_second": 1433.938 }, { "epoch": 0.9588965517241379, "grad_norm": 0.35638895630836487, "learning_rate": 8.327192336035372e-06, "loss": 1.1493, "num_input_tokens_seen": 12915232, "step": 2607, "train_runtime": 9006.5265, "train_tokens_per_second": 1433.986 }, { "epoch": 0.9592643678160919, "grad_norm": 0.3463881313800812, "learning_rate": 8.253500368459838e-06, "loss": 1.099, "num_input_tokens_seen": 12919280, "step": 2608, "train_runtime": 9009.3218, "train_tokens_per_second": 1433.99 }, { "epoch": 0.9596321839080459, "grad_norm": 0.37970536947250366, "learning_rate": 8.179808400884303e-06, "loss": 1.1595, "num_input_tokens_seen": 12925504, "step": 2609, "train_runtime": 9013.3023, "train_tokens_per_second": 1434.048 }, { "epoch": 0.96, "grad_norm": 0.33949676156044006, "learning_rate": 8.10611643330877e-06, "loss": 1.1059, "num_input_tokens_seen": 12932624, "step": 2610, "train_runtime": 9017.7466, "train_tokens_per_second": 1434.13 }, { "epoch": 0.960367816091954, "grad_norm": 0.38554108142852783, "learning_rate": 8.032424465733235e-06, "loss": 1.1818, "num_input_tokens_seen": 12936144, "step": 2611, "train_runtime": 9022.348, "train_tokens_per_second": 1433.789 }, { "epoch": 0.960735632183908, "grad_norm": 0.40498021245002747, "learning_rate": 7.958732498157701e-06, "loss": 1.1977, "num_input_tokens_seen": 12944112, "step": 2612, "train_runtime": 9027.3734, "train_tokens_per_second": 1433.874 }, { "epoch": 0.961103448275862, "grad_norm": 0.35562485456466675, "learning_rate": 7.885040530582168e-06, "loss": 1.2872, "num_input_tokens_seen": 12947984, "step": 2613, "train_runtime": 9030.127, "train_tokens_per_second": 1433.865 }, { "epoch": 0.961471264367816, "grad_norm": 0.3915903866291046, "learning_rate": 7.811348563006632e-06, "loss": 1.2613, "num_input_tokens_seen": 12952080, "step": 2614, "train_runtime": 9033.0331, "train_tokens_per_second": 1433.857 }, { "epoch": 0.9618390804597701, "grad_norm": 0.38376888632774353, "learning_rate": 7.737656595431099e-06, "loss": 1.1156, "num_input_tokens_seen": 12955440, "step": 2615, "train_runtime": 9035.5185, "train_tokens_per_second": 1433.835 }, { "epoch": 0.9622068965517241, "grad_norm": 0.3606862723827362, "learning_rate": 7.663964627855565e-06, "loss": 1.2131, "num_input_tokens_seen": 12958896, "step": 2616, "train_runtime": 9038.0468, "train_tokens_per_second": 1433.816 }, { "epoch": 0.9625747126436781, "grad_norm": 0.35248076915740967, "learning_rate": 7.59027266028003e-06, "loss": 1.2635, "num_input_tokens_seen": 12964512, "step": 2617, "train_runtime": 9041.7146, "train_tokens_per_second": 1433.855 }, { "epoch": 0.9629425287356321, "grad_norm": 0.4109298586845398, "learning_rate": 7.516580692704496e-06, "loss": 1.1903, "num_input_tokens_seen": 12970128, "step": 2618, "train_runtime": 9045.401, "train_tokens_per_second": 1433.892 }, { "epoch": 0.9633103448275863, "grad_norm": 0.38341623544692993, "learning_rate": 7.442888725128962e-06, "loss": 1.3705, "num_input_tokens_seen": 12973488, "step": 2619, "train_runtime": 9047.8819, "train_tokens_per_second": 1433.87 }, { "epoch": 0.9636781609195403, "grad_norm": 0.37579721212387085, "learning_rate": 7.369196757553427e-06, "loss": 1.1324, "num_input_tokens_seen": 12981168, "step": 2620, "train_runtime": 9052.7103, "train_tokens_per_second": 1433.954 }, { "epoch": 0.9640459770114943, "grad_norm": 0.388622522354126, "learning_rate": 7.295504789977893e-06, "loss": 1.2855, "num_input_tokens_seen": 12985168, "step": 2621, "train_runtime": 9055.4927, "train_tokens_per_second": 1433.955 }, { "epoch": 0.9644137931034483, "grad_norm": 0.36083441972732544, "learning_rate": 7.221812822402359e-06, "loss": 1.147, "num_input_tokens_seen": 12990240, "step": 2622, "train_runtime": 9058.9246, "train_tokens_per_second": 1433.972 }, { "epoch": 0.9647816091954023, "grad_norm": 0.3841739892959595, "learning_rate": 7.148120854826824e-06, "loss": 1.1187, "num_input_tokens_seen": 12996256, "step": 2623, "train_runtime": 9062.7806, "train_tokens_per_second": 1434.025 }, { "epoch": 0.9651494252873564, "grad_norm": 0.35147175192832947, "learning_rate": 7.07442888725129e-06, "loss": 1.1573, "num_input_tokens_seen": 13001728, "step": 2624, "train_runtime": 9066.4402, "train_tokens_per_second": 1434.05 }, { "epoch": 0.9655172413793104, "grad_norm": 0.38508978486061096, "learning_rate": 7.000736919675756e-06, "loss": 1.2295, "num_input_tokens_seen": 13006512, "step": 2625, "train_runtime": 9069.6659, "train_tokens_per_second": 1434.067 }, { "epoch": 0.9658850574712644, "grad_norm": 0.3841729164123535, "learning_rate": 6.927044952100221e-06, "loss": 1.2373, "num_input_tokens_seen": 13013792, "step": 2626, "train_runtime": 9074.1357, "train_tokens_per_second": 1434.163 }, { "epoch": 0.9662528735632184, "grad_norm": 0.3278234601020813, "learning_rate": 6.853352984524687e-06, "loss": 1.2258, "num_input_tokens_seen": 13022400, "step": 2627, "train_runtime": 9079.4286, "train_tokens_per_second": 1434.275 }, { "epoch": 0.9666206896551724, "grad_norm": 0.3791029453277588, "learning_rate": 6.779661016949153e-06, "loss": 1.0661, "num_input_tokens_seen": 13026704, "step": 2628, "train_runtime": 9082.4326, "train_tokens_per_second": 1434.275 }, { "epoch": 0.9669885057471265, "grad_norm": 0.45164456963539124, "learning_rate": 6.705969049373618e-06, "loss": 1.1975, "num_input_tokens_seen": 13030656, "step": 2629, "train_runtime": 9085.2075, "train_tokens_per_second": 1434.272 }, { "epoch": 0.9673563218390805, "grad_norm": 0.3532894551753998, "learning_rate": 6.632277081798084e-06, "loss": 1.2566, "num_input_tokens_seen": 13035440, "step": 2630, "train_runtime": 9088.4308, "train_tokens_per_second": 1434.289 }, { "epoch": 0.9677241379310345, "grad_norm": 0.35183894634246826, "learning_rate": 6.55858511422255e-06, "loss": 1.2102, "num_input_tokens_seen": 13038544, "step": 2631, "train_runtime": 9090.7743, "train_tokens_per_second": 1434.261 }, { "epoch": 0.9680919540229885, "grad_norm": 0.3607577085494995, "learning_rate": 6.484893146647015e-06, "loss": 1.1183, "num_input_tokens_seen": 13043536, "step": 2632, "train_runtime": 9094.0634, "train_tokens_per_second": 1434.291 }, { "epoch": 0.9684597701149426, "grad_norm": 0.3834487795829773, "learning_rate": 6.411201179071481e-06, "loss": 1.3596, "num_input_tokens_seen": 13050496, "step": 2633, "train_runtime": 9098.3932, "train_tokens_per_second": 1434.374 }, { "epoch": 0.9688275862068966, "grad_norm": 0.3820025324821472, "learning_rate": 6.337509211495947e-06, "loss": 1.145, "num_input_tokens_seen": 13056144, "step": 2634, "train_runtime": 9102.0635, "train_tokens_per_second": 1434.416 }, { "epoch": 0.9691954022988506, "grad_norm": 0.361589252948761, "learning_rate": 6.263817243920412e-06, "loss": 1.1775, "num_input_tokens_seen": 13061920, "step": 2635, "train_runtime": 9105.7989, "train_tokens_per_second": 1434.462 }, { "epoch": 0.9695632183908046, "grad_norm": 0.3981812596321106, "learning_rate": 6.190125276344879e-06, "loss": 1.1227, "num_input_tokens_seen": 13069408, "step": 2636, "train_runtime": 9110.5384, "train_tokens_per_second": 1434.537 }, { "epoch": 0.9699310344827586, "grad_norm": 0.3458286225795746, "learning_rate": 6.1164333087693445e-06, "loss": 1.1424, "num_input_tokens_seen": 13073968, "step": 2637, "train_runtime": 9113.6476, "train_tokens_per_second": 1434.548 }, { "epoch": 0.9702988505747127, "grad_norm": 0.3819259703159332, "learning_rate": 6.04274134119381e-06, "loss": 1.1816, "num_input_tokens_seen": 13083936, "step": 2638, "train_runtime": 9119.7206, "train_tokens_per_second": 1434.686 }, { "epoch": 0.9706666666666667, "grad_norm": 0.3737925589084625, "learning_rate": 5.969049373618276e-06, "loss": 1.2839, "num_input_tokens_seen": 13087856, "step": 2639, "train_runtime": 9122.459, "train_tokens_per_second": 1434.685 }, { "epoch": 0.9710344827586207, "grad_norm": 0.3687480390071869, "learning_rate": 5.8953574060427415e-06, "loss": 1.1696, "num_input_tokens_seen": 13091808, "step": 2640, "train_runtime": 9125.2682, "train_tokens_per_second": 1434.677 }, { "epoch": 0.9714022988505747, "grad_norm": 0.35901394486427307, "learning_rate": 5.821665438467207e-06, "loss": 1.0964, "num_input_tokens_seen": 13096064, "step": 2641, "train_runtime": 9130.1924, "train_tokens_per_second": 1434.369 }, { "epoch": 0.9717701149425287, "grad_norm": 0.36465173959732056, "learning_rate": 5.747973470891673e-06, "loss": 1.1083, "num_input_tokens_seen": 13100192, "step": 2642, "train_runtime": 9132.9918, "train_tokens_per_second": 1434.381 }, { "epoch": 0.9721379310344828, "grad_norm": 0.37539973855018616, "learning_rate": 5.6742815033161385e-06, "loss": 1.3061, "num_input_tokens_seen": 13103952, "step": 2643, "train_runtime": 9135.65, "train_tokens_per_second": 1434.375 }, { "epoch": 0.9725057471264368, "grad_norm": 0.3692229986190796, "learning_rate": 5.600589535740604e-06, "loss": 1.1398, "num_input_tokens_seen": 13108592, "step": 2644, "train_runtime": 9138.7596, "train_tokens_per_second": 1434.395 }, { "epoch": 0.9728735632183908, "grad_norm": 0.3598920702934265, "learning_rate": 5.52689756816507e-06, "loss": 1.0703, "num_input_tokens_seen": 13112192, "step": 2645, "train_runtime": 9141.3593, "train_tokens_per_second": 1434.381 }, { "epoch": 0.9732413793103448, "grad_norm": 0.39512544870376587, "learning_rate": 5.4532056005895355e-06, "loss": 1.267, "num_input_tokens_seen": 13115952, "step": 2646, "train_runtime": 9144.1131, "train_tokens_per_second": 1434.36 }, { "epoch": 0.9736091954022988, "grad_norm": 0.3510258197784424, "learning_rate": 5.379513633014001e-06, "loss": 1.1143, "num_input_tokens_seen": 13119696, "step": 2647, "train_runtime": 9146.7728, "train_tokens_per_second": 1434.352 }, { "epoch": 0.9739770114942529, "grad_norm": 0.378836989402771, "learning_rate": 5.305821665438467e-06, "loss": 1.1973, "num_input_tokens_seen": 13125200, "step": 2648, "train_runtime": 9150.422, "train_tokens_per_second": 1434.382 }, { "epoch": 0.9743448275862069, "grad_norm": 0.3684450387954712, "learning_rate": 5.2321296978629325e-06, "loss": 1.1651, "num_input_tokens_seen": 13129376, "step": 2649, "train_runtime": 9153.419, "train_tokens_per_second": 1434.369 }, { "epoch": 0.9747126436781609, "grad_norm": 0.3807239234447479, "learning_rate": 5.158437730287399e-06, "loss": 1.0743, "num_input_tokens_seen": 13135184, "step": 2650, "train_runtime": 9157.2302, "train_tokens_per_second": 1434.406 }, { "epoch": 0.9750804597701149, "grad_norm": 0.3260813355445862, "learning_rate": 5.084745762711865e-06, "loss": 1.0861, "num_input_tokens_seen": 13139328, "step": 2651, "train_runtime": 9160.0983, "train_tokens_per_second": 1434.409 }, { "epoch": 0.975448275862069, "grad_norm": 0.35605546832084656, "learning_rate": 5.01105379513633e-06, "loss": 1.1935, "num_input_tokens_seen": 13142864, "step": 2652, "train_runtime": 9162.7131, "train_tokens_per_second": 1434.386 }, { "epoch": 0.975816091954023, "grad_norm": 0.4067990481853485, "learning_rate": 4.937361827560796e-06, "loss": 1.2467, "num_input_tokens_seen": 13149600, "step": 2653, "train_runtime": 9167.0399, "train_tokens_per_second": 1434.443 }, { "epoch": 0.976183908045977, "grad_norm": 0.3621925413608551, "learning_rate": 4.863669859985262e-06, "loss": 1.1553, "num_input_tokens_seen": 13152624, "step": 2654, "train_runtime": 9169.3626, "train_tokens_per_second": 1434.41 }, { "epoch": 0.976551724137931, "grad_norm": 0.39945676922798157, "learning_rate": 4.789977892409727e-06, "loss": 1.256, "num_input_tokens_seen": 13156864, "step": 2655, "train_runtime": 9172.2776, "train_tokens_per_second": 1434.416 }, { "epoch": 0.976919540229885, "grad_norm": 0.34752747416496277, "learning_rate": 4.716285924834193e-06, "loss": 1.2401, "num_input_tokens_seen": 13161104, "step": 2656, "train_runtime": 9175.1876, "train_tokens_per_second": 1434.423 }, { "epoch": 0.977287356321839, "grad_norm": 0.36894023418426514, "learning_rate": 4.642593957258659e-06, "loss": 1.1463, "num_input_tokens_seen": 13167216, "step": 2657, "train_runtime": 9179.0885, "train_tokens_per_second": 1434.48 }, { "epoch": 0.9776551724137931, "grad_norm": 0.3994079828262329, "learning_rate": 4.568901989683124e-06, "loss": 1.1976, "num_input_tokens_seen": 13172848, "step": 2658, "train_runtime": 9182.85, "train_tokens_per_second": 1434.505 }, { "epoch": 0.9780229885057471, "grad_norm": 0.3812773525714874, "learning_rate": 4.495210022107591e-06, "loss": 1.2223, "num_input_tokens_seen": 13177632, "step": 2659, "train_runtime": 9186.0748, "train_tokens_per_second": 1434.523 }, { "epoch": 0.9783908045977011, "grad_norm": 0.3517211973667145, "learning_rate": 4.4215180545320565e-06, "loss": 1.0889, "num_input_tokens_seen": 13185376, "step": 2660, "train_runtime": 9190.9199, "train_tokens_per_second": 1434.609 }, { "epoch": 0.9787586206896551, "grad_norm": 0.37851017713546753, "learning_rate": 4.347826086956522e-06, "loss": 1.0837, "num_input_tokens_seen": 13192432, "step": 2661, "train_runtime": 9195.2901, "train_tokens_per_second": 1434.694 }, { "epoch": 0.9791264367816092, "grad_norm": 0.3822534680366516, "learning_rate": 4.274134119380988e-06, "loss": 1.277, "num_input_tokens_seen": 13196880, "step": 2662, "train_runtime": 9198.3425, "train_tokens_per_second": 1434.702 }, { "epoch": 0.9794942528735632, "grad_norm": 0.3740699589252472, "learning_rate": 4.2004421518054535e-06, "loss": 1.2112, "num_input_tokens_seen": 13201440, "step": 2663, "train_runtime": 9201.3801, "train_tokens_per_second": 1434.724 }, { "epoch": 0.9798620689655172, "grad_norm": 0.40683114528656006, "learning_rate": 4.126750184229919e-06, "loss": 1.2945, "num_input_tokens_seen": 13206576, "step": 2664, "train_runtime": 9204.7476, "train_tokens_per_second": 1434.757 }, { "epoch": 0.9802298850574712, "grad_norm": 0.3855752944946289, "learning_rate": 4.053058216654385e-06, "loss": 1.1944, "num_input_tokens_seen": 13212512, "step": 2665, "train_runtime": 9208.5481, "train_tokens_per_second": 1434.809 }, { "epoch": 0.9805977011494252, "grad_norm": 0.3845732510089874, "learning_rate": 3.9793662490788505e-06, "loss": 1.1988, "num_input_tokens_seen": 13221056, "step": 2666, "train_runtime": 9213.7912, "train_tokens_per_second": 1434.92 }, { "epoch": 0.9809655172413793, "grad_norm": 0.38011282682418823, "learning_rate": 3.905674281503316e-06, "loss": 1.1812, "num_input_tokens_seen": 13224976, "step": 2667, "train_runtime": 9216.5361, "train_tokens_per_second": 1434.918 }, { "epoch": 0.9813333333333333, "grad_norm": 0.3793037235736847, "learning_rate": 3.831982313927783e-06, "loss": 1.2654, "num_input_tokens_seen": 13229072, "step": 2668, "train_runtime": 9219.3938, "train_tokens_per_second": 1434.918 }, { "epoch": 0.9817011494252874, "grad_norm": 0.3945206105709076, "learning_rate": 3.758290346352248e-06, "loss": 1.1835, "num_input_tokens_seen": 13233872, "step": 2669, "train_runtime": 9222.6265, "train_tokens_per_second": 1434.935 }, { "epoch": 0.9820689655172414, "grad_norm": 0.3916941285133362, "learning_rate": 3.6845983787767136e-06, "loss": 1.2922, "num_input_tokens_seen": 13237392, "step": 2670, "train_runtime": 9225.2451, "train_tokens_per_second": 1434.91 }, { "epoch": 0.9824367816091955, "grad_norm": 0.35781216621398926, "learning_rate": 3.6109064112011793e-06, "loss": 1.1003, "num_input_tokens_seen": 13241072, "step": 2671, "train_runtime": 9229.8816, "train_tokens_per_second": 1434.587 }, { "epoch": 0.9828045977011495, "grad_norm": 0.39518725872039795, "learning_rate": 3.537214443625645e-06, "loss": 1.1756, "num_input_tokens_seen": 13245280, "step": 2672, "train_runtime": 9232.7503, "train_tokens_per_second": 1434.597 }, { "epoch": 0.9831724137931035, "grad_norm": 0.3739321529865265, "learning_rate": 3.4635224760501106e-06, "loss": 1.3331, "num_input_tokens_seen": 13248752, "step": 2673, "train_runtime": 9235.2515, "train_tokens_per_second": 1434.585 }, { "epoch": 0.9835402298850575, "grad_norm": 0.3432806432247162, "learning_rate": 3.3898305084745763e-06, "loss": 1.0935, "num_input_tokens_seen": 13253216, "step": 2674, "train_runtime": 9238.3072, "train_tokens_per_second": 1434.594 }, { "epoch": 0.9839080459770115, "grad_norm": 0.3220776915550232, "learning_rate": 3.316138540899042e-06, "loss": 1.0416, "num_input_tokens_seen": 13263680, "step": 2675, "train_runtime": 9244.5786, "train_tokens_per_second": 1434.752 }, { "epoch": 0.9842758620689656, "grad_norm": 0.3478752374649048, "learning_rate": 3.2424465733235076e-06, "loss": 1.139, "num_input_tokens_seen": 13268816, "step": 2676, "train_runtime": 9247.9822, "train_tokens_per_second": 1434.78 }, { "epoch": 0.9846436781609196, "grad_norm": 0.37755367159843445, "learning_rate": 3.1687546057479733e-06, "loss": 1.0579, "num_input_tokens_seen": 13274720, "step": 2677, "train_runtime": 9251.7823, "train_tokens_per_second": 1434.828 }, { "epoch": 0.9850114942528736, "grad_norm": 0.35921499133110046, "learning_rate": 3.0950626381724394e-06, "loss": 1.2193, "num_input_tokens_seen": 13280816, "step": 2678, "train_runtime": 9255.7344, "train_tokens_per_second": 1434.874 }, { "epoch": 0.9853793103448276, "grad_norm": 0.36000990867614746, "learning_rate": 3.021370670596905e-06, "loss": 1.2805, "num_input_tokens_seen": 13284896, "step": 2679, "train_runtime": 9258.4904, "train_tokens_per_second": 1434.888 }, { "epoch": 0.9857471264367816, "grad_norm": 0.34659695625305176, "learning_rate": 2.9476787030213707e-06, "loss": 1.065, "num_input_tokens_seen": 13289152, "step": 2680, "train_runtime": 9261.3648, "train_tokens_per_second": 1434.902 }, { "epoch": 0.9861149425287357, "grad_norm": 0.36805298924446106, "learning_rate": 2.8739867354458364e-06, "loss": 1.2633, "num_input_tokens_seen": 13294432, "step": 2681, "train_runtime": 9264.8288, "train_tokens_per_second": 1434.936 }, { "epoch": 0.9864827586206897, "grad_norm": 0.3604376018047333, "learning_rate": 2.800294767870302e-06, "loss": 1.1101, "num_input_tokens_seen": 13297696, "step": 2682, "train_runtime": 9267.2003, "train_tokens_per_second": 1434.921 }, { "epoch": 0.9868505747126437, "grad_norm": 0.4133100211620331, "learning_rate": 2.7266028002947677e-06, "loss": 1.268, "num_input_tokens_seen": 13301488, "step": 2683, "train_runtime": 9269.9022, "train_tokens_per_second": 1434.911 }, { "epoch": 0.9872183908045977, "grad_norm": 0.36944735050201416, "learning_rate": 2.6529108327192334e-06, "loss": 1.1549, "num_input_tokens_seen": 13308800, "step": 2684, "train_runtime": 9274.5558, "train_tokens_per_second": 1434.98 }, { "epoch": 0.9875862068965517, "grad_norm": 0.36020931601524353, "learning_rate": 2.5792188651436995e-06, "loss": 0.9927, "num_input_tokens_seen": 13311904, "step": 2685, "train_runtime": 9276.8974, "train_tokens_per_second": 1434.952 }, { "epoch": 0.9879540229885058, "grad_norm": 0.3761769235134125, "learning_rate": 2.505526897568165e-06, "loss": 1.1888, "num_input_tokens_seen": 13315360, "step": 2686, "train_runtime": 9279.4447, "train_tokens_per_second": 1434.931 }, { "epoch": 0.9883218390804598, "grad_norm": 0.3514864146709442, "learning_rate": 2.431834929992631e-06, "loss": 1.1336, "num_input_tokens_seen": 13319872, "step": 2687, "train_runtime": 9282.5809, "train_tokens_per_second": 1434.932 }, { "epoch": 0.9886896551724138, "grad_norm": 0.4007459282875061, "learning_rate": 2.3581429624170965e-06, "loss": 1.1083, "num_input_tokens_seen": 13325088, "step": 2688, "train_runtime": 9286.0272, "train_tokens_per_second": 1434.961 }, { "epoch": 0.9890574712643678, "grad_norm": 0.4084776043891907, "learning_rate": 2.284450994841562e-06, "loss": 1.1634, "num_input_tokens_seen": 13329920, "step": 2689, "train_runtime": 9289.264, "train_tokens_per_second": 1434.981 }, { "epoch": 0.9894252873563218, "grad_norm": 0.39426979422569275, "learning_rate": 2.2107590272660283e-06, "loss": 1.1331, "num_input_tokens_seen": 13333968, "step": 2690, "train_runtime": 9291.9757, "train_tokens_per_second": 1434.998 }, { "epoch": 0.9897931034482759, "grad_norm": 0.3781372010707855, "learning_rate": 2.137067059690494e-06, "loss": 1.161, "num_input_tokens_seen": 13337968, "step": 2691, "train_runtime": 9294.7259, "train_tokens_per_second": 1435.004 }, { "epoch": 0.9901609195402299, "grad_norm": 0.3930552303791046, "learning_rate": 2.0633750921149596e-06, "loss": 1.2381, "num_input_tokens_seen": 13341200, "step": 2692, "train_runtime": 9297.1622, "train_tokens_per_second": 1434.976 }, { "epoch": 0.9905287356321839, "grad_norm": 0.3918300271034241, "learning_rate": 1.9896831245394253e-06, "loss": 1.1624, "num_input_tokens_seen": 13346416, "step": 2693, "train_runtime": 9300.6979, "train_tokens_per_second": 1434.991 }, { "epoch": 0.9908965517241379, "grad_norm": 0.4089981019496918, "learning_rate": 1.9159911569638914e-06, "loss": 1.3183, "num_input_tokens_seen": 13351536, "step": 2694, "train_runtime": 9304.1306, "train_tokens_per_second": 1435.012 }, { "epoch": 0.991264367816092, "grad_norm": 0.3748939633369446, "learning_rate": 1.8422991893883568e-06, "loss": 1.2059, "num_input_tokens_seen": 13356304, "step": 2695, "train_runtime": 9307.3, "train_tokens_per_second": 1435.035 }, { "epoch": 0.991632183908046, "grad_norm": 0.3489076495170593, "learning_rate": 1.7686072218128225e-06, "loss": 1.1273, "num_input_tokens_seen": 13360720, "step": 2696, "train_runtime": 9310.3048, "train_tokens_per_second": 1435.046 }, { "epoch": 0.992, "grad_norm": 0.3759075999259949, "learning_rate": 1.6949152542372882e-06, "loss": 1.2313, "num_input_tokens_seen": 13364704, "step": 2697, "train_runtime": 9312.994, "train_tokens_per_second": 1435.06 }, { "epoch": 0.992367816091954, "grad_norm": 0.3778208792209625, "learning_rate": 1.6212232866617538e-06, "loss": 1.2682, "num_input_tokens_seen": 13368560, "step": 2698, "train_runtime": 9315.6845, "train_tokens_per_second": 1435.059 }, { "epoch": 0.992735632183908, "grad_norm": 0.39586445689201355, "learning_rate": 1.5475313190862197e-06, "loss": 1.1028, "num_input_tokens_seen": 13373104, "step": 2699, "train_runtime": 9318.7639, "train_tokens_per_second": 1435.073 }, { "epoch": 0.993103448275862, "grad_norm": 0.34999415278434753, "learning_rate": 1.4738393515106854e-06, "loss": 1.1526, "num_input_tokens_seen": 13377872, "step": 2700, "train_runtime": 9322.0195, "train_tokens_per_second": 1435.083 }, { "epoch": 0.9934712643678161, "grad_norm": 0.39181894063949585, "learning_rate": 1.400147383935151e-06, "loss": 1.1644, "num_input_tokens_seen": 13382752, "step": 2701, "train_runtime": 9327.35, "train_tokens_per_second": 1434.786 }, { "epoch": 0.9938390804597701, "grad_norm": 0.35605180263519287, "learning_rate": 1.3264554163596167e-06, "loss": 1.123, "num_input_tokens_seen": 13387296, "step": 2702, "train_runtime": 9330.5136, "train_tokens_per_second": 1434.787 }, { "epoch": 0.9942068965517241, "grad_norm": 0.389503538608551, "learning_rate": 1.2527634487840826e-06, "loss": 1.2023, "num_input_tokens_seen": 13391424, "step": 2703, "train_runtime": 9333.3876, "train_tokens_per_second": 1434.787 }, { "epoch": 0.9945747126436781, "grad_norm": 0.356380432844162, "learning_rate": 1.1790714812085483e-06, "loss": 1.2694, "num_input_tokens_seen": 13395712, "step": 2704, "train_runtime": 9336.2019, "train_tokens_per_second": 1434.814 }, { "epoch": 0.9949425287356322, "grad_norm": 0.38404738903045654, "learning_rate": 1.1053795136330141e-06, "loss": 1.1005, "num_input_tokens_seen": 13404560, "step": 2705, "train_runtime": 9341.5956, "train_tokens_per_second": 1434.933 }, { "epoch": 0.9953103448275862, "grad_norm": 0.39288413524627686, "learning_rate": 1.0316875460574798e-06, "loss": 1.235, "num_input_tokens_seen": 13409056, "step": 2706, "train_runtime": 9344.6909, "train_tokens_per_second": 1434.938 }, { "epoch": 0.9956781609195402, "grad_norm": 0.35604438185691833, "learning_rate": 9.579955784819457e-07, "loss": 1.2303, "num_input_tokens_seen": 13415040, "step": 2707, "train_runtime": 9348.606, "train_tokens_per_second": 1434.978 }, { "epoch": 0.9960459770114942, "grad_norm": 0.3633836507797241, "learning_rate": 8.843036109064112e-07, "loss": 1.1844, "num_input_tokens_seen": 13420800, "step": 2708, "train_runtime": 9352.438, "train_tokens_per_second": 1435.006 }, { "epoch": 0.9964137931034482, "grad_norm": 0.335910826921463, "learning_rate": 8.106116433308769e-07, "loss": 1.0622, "num_input_tokens_seen": 13425072, "step": 2709, "train_runtime": 9355.3056, "train_tokens_per_second": 1435.022 }, { "epoch": 0.9967816091954023, "grad_norm": 0.3533064126968384, "learning_rate": 7.369196757553427e-07, "loss": 1.2354, "num_input_tokens_seen": 13428880, "step": 2710, "train_runtime": 9358.031, "train_tokens_per_second": 1435.011 }, { "epoch": 0.9971494252873563, "grad_norm": 0.3506322503089905, "learning_rate": 6.632277081798084e-07, "loss": 1.2809, "num_input_tokens_seen": 13434128, "step": 2711, "train_runtime": 9361.4711, "train_tokens_per_second": 1435.045 }, { "epoch": 0.9975172413793103, "grad_norm": 0.3724497854709625, "learning_rate": 5.895357406042741e-07, "loss": 1.2338, "num_input_tokens_seen": 13439616, "step": 2712, "train_runtime": 9365.1353, "train_tokens_per_second": 1435.069 }, { "epoch": 0.9978850574712643, "grad_norm": 0.35516542196273804, "learning_rate": 5.158437730287399e-07, "loss": 1.1765, "num_input_tokens_seen": 13445984, "step": 2713, "train_runtime": 9369.1385, "train_tokens_per_second": 1435.136 }, { "epoch": 0.9982528735632183, "grad_norm": 0.3694939613342285, "learning_rate": 4.421518054532056e-07, "loss": 1.2878, "num_input_tokens_seen": 13450576, "step": 2714, "train_runtime": 9372.1452, "train_tokens_per_second": 1435.165 }, { "epoch": 0.9986206896551724, "grad_norm": 0.3756771385669708, "learning_rate": 3.6845983787767134e-07, "loss": 1.1811, "num_input_tokens_seen": 13454272, "step": 2715, "train_runtime": 9374.8052, "train_tokens_per_second": 1435.152 }, { "epoch": 0.9989885057471264, "grad_norm": 0.3870641887187958, "learning_rate": 2.9476787030213706e-07, "loss": 1.0927, "num_input_tokens_seen": 13460928, "step": 2716, "train_runtime": 9379.0286, "train_tokens_per_second": 1435.216 }, { "epoch": 0.9993563218390804, "grad_norm": 0.3609115183353424, "learning_rate": 2.210759027266028e-07, "loss": 1.2228, "num_input_tokens_seen": 13465152, "step": 2717, "train_runtime": 9381.9636, "train_tokens_per_second": 1435.217 }, { "epoch": 0.9997241379310344, "grad_norm": 0.36089998483657837, "learning_rate": 1.4738393515106853e-07, "loss": 1.1128, "num_input_tokens_seen": 13468816, "step": 2718, "train_runtime": 9384.5989, "train_tokens_per_second": 1435.204 }, { "epoch": 1.0, "grad_norm": 0.4428732395172119, "learning_rate": 7.369196757553427e-08, "loss": 1.1919, "num_input_tokens_seen": 13472656, "step": 2719, "train_runtime": 9387.199, "train_tokens_per_second": 1435.216 } ], "logging_steps": 1, "max_steps": 2719, "num_input_tokens_seen": 13472656, "num_train_epochs": 1, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.6071728602210304e+18, "train_batch_size": 16, "trial_name": null, "trial_params": null }