{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 30, "global_step": 294, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.006837606837606838, "grad_norm": 32.511837005615234, "learning_rate": 0.0, "loss": 1.2298, "num_input_tokens_seen": 35008, "step": 1, "train_runtime": 8.0497, "train_tokens_per_second": 4348.976 }, { "epoch": 0.013675213675213675, "grad_norm": 28.007068634033203, "learning_rate": 4.000000000000001e-06, "loss": 0.9948, "num_input_tokens_seen": 83776, "step": 2, "train_runtime": 12.057, "train_tokens_per_second": 6948.356 }, { "epoch": 0.020512820512820513, "grad_norm": 30.101133346557617, "learning_rate": 8.000000000000001e-06, "loss": 1.0103, "num_input_tokens_seen": 123392, "step": 3, "train_runtime": 15.3107, "train_tokens_per_second": 8059.208 }, { "epoch": 0.02735042735042735, "grad_norm": 19.826982498168945, "learning_rate": 1.2e-05, "loss": 0.7465, "num_input_tokens_seen": 163904, "step": 4, "train_runtime": 18.5797, "train_tokens_per_second": 8821.648 }, { "epoch": 0.03418803418803419, "grad_norm": 5.2462077140808105, "learning_rate": 1.6000000000000003e-05, "loss": 0.4954, "num_input_tokens_seen": 204512, "step": 5, "train_runtime": 21.9294, "train_tokens_per_second": 9325.92 }, { "epoch": 0.041025641025641026, "grad_norm": 6.633277893066406, "learning_rate": 2e-05, "loss": 0.5549, "num_input_tokens_seen": 241824, "step": 6, "train_runtime": 25.0124, "train_tokens_per_second": 9668.169 }, { "epoch": 0.04786324786324787, "grad_norm": 3.92435884475708, "learning_rate": 1.9930795847750867e-05, "loss": 0.447, "num_input_tokens_seen": 291392, "step": 7, "train_runtime": 28.9989, "train_tokens_per_second": 10048.39 }, { "epoch": 0.0547008547008547, "grad_norm": 2.5249392986297607, "learning_rate": 1.9861591695501733e-05, "loss": 0.5641, "num_input_tokens_seen": 325088, "step": 8, "train_runtime": 31.8438, "train_tokens_per_second": 10208.84 }, { "epoch": 0.06153846153846154, "grad_norm": 1.8566827774047852, "learning_rate": 1.9792387543252595e-05, "loss": 0.4856, "num_input_tokens_seen": 357280, "step": 9, "train_runtime": 34.5322, "train_tokens_per_second": 10346.275 }, { "epoch": 0.06837606837606838, "grad_norm": 2.148573160171509, "learning_rate": 1.972318339100346e-05, "loss": 0.5044, "num_input_tokens_seen": 397440, "step": 10, "train_runtime": 37.8542, "train_tokens_per_second": 10499.228 }, { "epoch": 0.07521367521367521, "grad_norm": 2.142800807952881, "learning_rate": 1.9653979238754327e-05, "loss": 0.464, "num_input_tokens_seen": 446592, "step": 11, "train_runtime": 44.1229, "train_tokens_per_second": 10121.553 }, { "epoch": 0.08205128205128205, "grad_norm": 1.9147850275039673, "learning_rate": 1.9584775086505192e-05, "loss": 0.4892, "num_input_tokens_seen": 477888, "step": 12, "train_runtime": 46.7615, "train_tokens_per_second": 10219.683 }, { "epoch": 0.08888888888888889, "grad_norm": 1.8965516090393066, "learning_rate": 1.9515570934256058e-05, "loss": 0.4817, "num_input_tokens_seen": 517056, "step": 13, "train_runtime": 49.9951, "train_tokens_per_second": 10342.129 }, { "epoch": 0.09572649572649573, "grad_norm": 1.7629674673080444, "learning_rate": 1.9446366782006923e-05, "loss": 0.516, "num_input_tokens_seen": 551104, "step": 14, "train_runtime": 52.8297, "train_tokens_per_second": 10431.717 }, { "epoch": 0.10256410256410256, "grad_norm": 1.6642876863479614, "learning_rate": 1.9377162629757786e-05, "loss": 0.455, "num_input_tokens_seen": 587104, "step": 15, "train_runtime": 55.844, "train_tokens_per_second": 10513.294 }, { "epoch": 0.1094017094017094, "grad_norm": 1.685402274131775, "learning_rate": 1.930795847750865e-05, "loss": 0.4607, "num_input_tokens_seen": 624800, "step": 16, "train_runtime": 59.0018, "train_tokens_per_second": 10589.5 }, { "epoch": 0.11623931623931624, "grad_norm": 1.7894681692123413, "learning_rate": 1.9238754325259517e-05, "loss": 0.4795, "num_input_tokens_seen": 667424, "step": 17, "train_runtime": 62.5071, "train_tokens_per_second": 10677.567 }, { "epoch": 0.12307692307692308, "grad_norm": 1.5134732723236084, "learning_rate": 1.9169550173010383e-05, "loss": 0.4488, "num_input_tokens_seen": 705056, "step": 18, "train_runtime": 65.654, "train_tokens_per_second": 10738.968 }, { "epoch": 0.12991452991452992, "grad_norm": 1.671798825263977, "learning_rate": 1.910034602076125e-05, "loss": 0.4473, "num_input_tokens_seen": 735200, "step": 19, "train_runtime": 68.188, "train_tokens_per_second": 10781.957 }, { "epoch": 0.13675213675213677, "grad_norm": 1.7231043577194214, "learning_rate": 1.9031141868512114e-05, "loss": 0.4886, "num_input_tokens_seen": 769856, "step": 20, "train_runtime": 71.1292, "train_tokens_per_second": 10823.354 }, { "epoch": 0.14358974358974358, "grad_norm": 1.4723550081253052, "learning_rate": 1.8961937716262976e-05, "loss": 0.3481, "num_input_tokens_seen": 846016, "step": 21, "train_runtime": 81.9017, "train_tokens_per_second": 10329.653 }, { "epoch": 0.15042735042735042, "grad_norm": 1.5541292428970337, "learning_rate": 1.8892733564013842e-05, "loss": 0.4992, "num_input_tokens_seen": 880352, "step": 22, "train_runtime": 84.7765, "train_tokens_per_second": 10384.389 }, { "epoch": 0.15726495726495726, "grad_norm": 1.5459015369415283, "learning_rate": 1.8823529411764708e-05, "loss": 0.4687, "num_input_tokens_seen": 920448, "step": 23, "train_runtime": 88.149, "train_tokens_per_second": 10441.956 }, { "epoch": 0.1641025641025641, "grad_norm": 1.7185068130493164, "learning_rate": 1.8754325259515573e-05, "loss": 0.4597, "num_input_tokens_seen": 966944, "step": 24, "train_runtime": 92.0191, "train_tokens_per_second": 10508.075 }, { "epoch": 0.17094017094017094, "grad_norm": 1.4897587299346924, "learning_rate": 1.868512110726644e-05, "loss": 0.4537, "num_input_tokens_seen": 1008384, "step": 25, "train_runtime": 95.4709, "train_tokens_per_second": 10562.217 }, { "epoch": 0.17777777777777778, "grad_norm": 1.5461437702178955, "learning_rate": 1.8615916955017305e-05, "loss": 0.4948, "num_input_tokens_seen": 1045088, "step": 26, "train_runtime": 98.5427, "train_tokens_per_second": 10605.434 }, { "epoch": 0.18461538461538463, "grad_norm": 1.5771409273147583, "learning_rate": 1.8546712802768167e-05, "loss": 0.5204, "num_input_tokens_seen": 1089184, "step": 27, "train_runtime": 102.2145, "train_tokens_per_second": 10655.869 }, { "epoch": 0.19145299145299147, "grad_norm": 1.4081662893295288, "learning_rate": 1.8477508650519033e-05, "loss": 0.452, "num_input_tokens_seen": 1131168, "step": 28, "train_runtime": 105.7371, "train_tokens_per_second": 10697.931 }, { "epoch": 0.19829059829059828, "grad_norm": 1.6867786645889282, "learning_rate": 1.8408304498269898e-05, "loss": 0.4906, "num_input_tokens_seen": 1164352, "step": 29, "train_runtime": 108.5496, "train_tokens_per_second": 10726.45 }, { "epoch": 0.20512820512820512, "grad_norm": 1.3786219358444214, "learning_rate": 1.833910034602076e-05, "loss": 0.4705, "num_input_tokens_seen": 1201440, "step": 30, "train_runtime": 111.6624, "train_tokens_per_second": 10759.575 }, { "epoch": 0.20512820512820512, "eval_loss": 0.4640962481498718, "eval_runtime": 6.7936, "eval_samples_per_second": 146.903, "eval_steps_per_second": 4.71, "num_input_tokens_seen": 1201440, "step": 30 }, { "epoch": 0.21196581196581196, "grad_norm": 1.7535614967346191, "learning_rate": 1.826989619377163e-05, "loss": 0.487, "num_input_tokens_seen": 1236704, "step": 31, "train_runtime": 139.6017, "train_tokens_per_second": 8858.806 }, { "epoch": 0.2188034188034188, "grad_norm": 1.4274615049362183, "learning_rate": 1.8200692041522492e-05, "loss": 0.4459, "num_input_tokens_seen": 1278464, "step": 32, "train_runtime": 143.0525, "train_tokens_per_second": 8937.028 }, { "epoch": 0.22564102564102564, "grad_norm": 1.527426838874817, "learning_rate": 1.8131487889273357e-05, "loss": 0.5151, "num_input_tokens_seen": 1315616, "step": 33, "train_runtime": 146.1773, "train_tokens_per_second": 9000.14 }, { "epoch": 0.23247863247863249, "grad_norm": 1.4509639739990234, "learning_rate": 1.8062283737024223e-05, "loss": 0.473, "num_input_tokens_seen": 1351200, "step": 34, "train_runtime": 149.1958, "train_tokens_per_second": 9056.555 }, { "epoch": 0.23931623931623933, "grad_norm": 1.574431300163269, "learning_rate": 1.799307958477509e-05, "loss": 0.4562, "num_input_tokens_seen": 1393888, "step": 35, "train_runtime": 152.7492, "train_tokens_per_second": 9125.335 }, { "epoch": 0.24615384615384617, "grad_norm": 1.421439290046692, "learning_rate": 1.792387543252595e-05, "loss": 0.4213, "num_input_tokens_seen": 1432000, "step": 36, "train_runtime": 155.9721, "train_tokens_per_second": 9181.127 }, { "epoch": 0.252991452991453, "grad_norm": 1.3346866369247437, "learning_rate": 1.785467128027682e-05, "loss": 0.4865, "num_input_tokens_seen": 1474912, "step": 37, "train_runtime": 159.5609, "train_tokens_per_second": 9243.568 }, { "epoch": 0.25982905982905985, "grad_norm": 1.401798129081726, "learning_rate": 1.7785467128027682e-05, "loss": 0.4983, "num_input_tokens_seen": 1514688, "step": 38, "train_runtime": 162.9161, "train_tokens_per_second": 9297.352 }, { "epoch": 0.26666666666666666, "grad_norm": 1.5963151454925537, "learning_rate": 1.7716262975778548e-05, "loss": 0.5577, "num_input_tokens_seen": 1553248, "step": 39, "train_runtime": 166.1397, "train_tokens_per_second": 9349.045 }, { "epoch": 0.27350427350427353, "grad_norm": 1.3875170946121216, "learning_rate": 1.7647058823529414e-05, "loss": 0.4095, "num_input_tokens_seen": 1593120, "step": 40, "train_runtime": 169.4554, "train_tokens_per_second": 9401.41 }, { "epoch": 0.28034188034188035, "grad_norm": 1.6025474071502686, "learning_rate": 1.757785467128028e-05, "loss": 0.5361, "num_input_tokens_seen": 1628256, "step": 41, "train_runtime": 172.428, "train_tokens_per_second": 9443.106 }, { "epoch": 0.28717948717948716, "grad_norm": 1.3887425661087036, "learning_rate": 1.750865051903114e-05, "loss": 0.4542, "num_input_tokens_seen": 1674016, "step": 42, "train_runtime": 176.2327, "train_tokens_per_second": 9498.898 }, { "epoch": 0.294017094017094, "grad_norm": 1.7252106666564941, "learning_rate": 1.743944636678201e-05, "loss": 0.4771, "num_input_tokens_seen": 1706944, "step": 43, "train_runtime": 179.0413, "train_tokens_per_second": 9533.802 }, { "epoch": 0.30085470085470084, "grad_norm": 1.5482698678970337, "learning_rate": 1.7370242214532873e-05, "loss": 0.4532, "num_input_tokens_seen": 1748128, "step": 44, "train_runtime": 182.4655, "train_tokens_per_second": 9580.595 }, { "epoch": 0.3076923076923077, "grad_norm": 1.6200870275497437, "learning_rate": 1.730103806228374e-05, "loss": 0.4823, "num_input_tokens_seen": 1780032, "step": 45, "train_runtime": 185.183, "train_tokens_per_second": 9612.285 }, { "epoch": 0.3145299145299145, "grad_norm": 1.4116896390914917, "learning_rate": 1.7231833910034604e-05, "loss": 0.4341, "num_input_tokens_seen": 1820128, "step": 46, "train_runtime": 188.5419, "train_tokens_per_second": 9653.708 }, { "epoch": 0.3213675213675214, "grad_norm": 1.6274487972259521, "learning_rate": 1.716262975778547e-05, "loss": 0.4756, "num_input_tokens_seen": 1853536, "step": 47, "train_runtime": 191.3682, "train_tokens_per_second": 9685.703 }, { "epoch": 0.3282051282051282, "grad_norm": 1.4281944036483765, "learning_rate": 1.7093425605536332e-05, "loss": 0.4333, "num_input_tokens_seen": 1890560, "step": 48, "train_runtime": 194.4859, "train_tokens_per_second": 9720.806 }, { "epoch": 0.335042735042735, "grad_norm": 1.411935567855835, "learning_rate": 1.70242214532872e-05, "loss": 0.4519, "num_input_tokens_seen": 1939648, "step": 49, "train_runtime": 198.5911, "train_tokens_per_second": 9767.042 }, { "epoch": 0.3418803418803419, "grad_norm": 1.4910825490951538, "learning_rate": 1.6955017301038063e-05, "loss": 0.4128, "num_input_tokens_seen": 1971584, "step": 50, "train_runtime": 201.3116, "train_tokens_per_second": 9793.692 }, { "epoch": 0.3487179487179487, "grad_norm": 1.67446768283844, "learning_rate": 1.688581314878893e-05, "loss": 0.5384, "num_input_tokens_seen": 2021536, "step": 51, "train_runtime": 205.4602, "train_tokens_per_second": 9839.062 }, { "epoch": 0.35555555555555557, "grad_norm": 1.500937581062317, "learning_rate": 1.6816608996539795e-05, "loss": 0.4733, "num_input_tokens_seen": 2066656, "step": 52, "train_runtime": 209.327, "train_tokens_per_second": 9872.859 }, { "epoch": 0.3623931623931624, "grad_norm": 1.6410099267959595, "learning_rate": 1.6747404844290657e-05, "loss": 0.4283, "num_input_tokens_seen": 2100160, "step": 53, "train_runtime": 212.1628, "train_tokens_per_second": 9898.815 }, { "epoch": 0.36923076923076925, "grad_norm": 1.507749080657959, "learning_rate": 1.6678200692041523e-05, "loss": 0.4679, "num_input_tokens_seen": 2133888, "step": 54, "train_runtime": 215.0512, "train_tokens_per_second": 9922.696 }, { "epoch": 0.37606837606837606, "grad_norm": 1.5565907955169678, "learning_rate": 1.6608996539792388e-05, "loss": 0.43, "num_input_tokens_seen": 2169472, "step": 55, "train_runtime": 218.0654, "train_tokens_per_second": 9948.72 }, { "epoch": 0.38290598290598293, "grad_norm": 1.380922555923462, "learning_rate": 1.6539792387543254e-05, "loss": 0.4838, "num_input_tokens_seen": 2214720, "step": 56, "train_runtime": 221.8928, "train_tokens_per_second": 9981.036 }, { "epoch": 0.38974358974358975, "grad_norm": 1.6342693567276, "learning_rate": 1.647058823529412e-05, "loss": 0.4654, "num_input_tokens_seen": 2251648, "step": 57, "train_runtime": 225.0239, "train_tokens_per_second": 10006.263 }, { "epoch": 0.39658119658119656, "grad_norm": 1.5192848443984985, "learning_rate": 1.6401384083044985e-05, "loss": 0.5026, "num_input_tokens_seen": 2284064, "step": 58, "train_runtime": 227.7635, "train_tokens_per_second": 10028.225 }, { "epoch": 0.40341880341880343, "grad_norm": 1.5925633907318115, "learning_rate": 1.6332179930795848e-05, "loss": 0.4585, "num_input_tokens_seen": 2312512, "step": 59, "train_runtime": 230.219, "train_tokens_per_second": 10044.836 }, { "epoch": 0.41025641025641024, "grad_norm": 1.4670740365982056, "learning_rate": 1.6262975778546713e-05, "loss": 0.434, "num_input_tokens_seen": 2348320, "step": 60, "train_runtime": 233.2567, "train_tokens_per_second": 10067.536 }, { "epoch": 0.41025641025641024, "eval_loss": 0.4576193392276764, "eval_runtime": 5.7904, "eval_samples_per_second": 172.354, "eval_steps_per_second": 5.526, "num_input_tokens_seen": 2348320, "step": 60 }, { "epoch": 0.4170940170940171, "grad_norm": 1.5287467241287231, "learning_rate": 1.619377162629758e-05, "loss": 0.4578, "num_input_tokens_seen": 2391232, "step": 61, "train_runtime": 259.4978, "train_tokens_per_second": 9214.845 }, { "epoch": 0.4239316239316239, "grad_norm": 1.507736325263977, "learning_rate": 1.6124567474048444e-05, "loss": 0.4129, "num_input_tokens_seen": 2428096, "step": 62, "train_runtime": 262.5473, "train_tokens_per_second": 9248.225 }, { "epoch": 0.4307692307692308, "grad_norm": 1.5525883436203003, "learning_rate": 1.605536332179931e-05, "loss": 0.4635, "num_input_tokens_seen": 2457504, "step": 63, "train_runtime": 265.0656, "train_tokens_per_second": 9271.305 }, { "epoch": 0.4376068376068376, "grad_norm": 1.6987532377243042, "learning_rate": 1.5986159169550176e-05, "loss": 0.5224, "num_input_tokens_seen": 2490496, "step": 64, "train_runtime": 267.8475, "train_tokens_per_second": 9298.187 }, { "epoch": 0.4444444444444444, "grad_norm": 1.3846668004989624, "learning_rate": 1.5916955017301038e-05, "loss": 0.4179, "num_input_tokens_seen": 2529888, "step": 65, "train_runtime": 271.0955, "train_tokens_per_second": 9332.093 }, { "epoch": 0.4512820512820513, "grad_norm": 1.4100641012191772, "learning_rate": 1.5847750865051904e-05, "loss": 0.4574, "num_input_tokens_seen": 2563744, "step": 66, "train_runtime": 273.9696, "train_tokens_per_second": 9357.767 }, { "epoch": 0.4581196581196581, "grad_norm": 1.4976650476455688, "learning_rate": 1.577854671280277e-05, "loss": 0.4836, "num_input_tokens_seen": 2607584, "step": 67, "train_runtime": 277.6271, "train_tokens_per_second": 9392.398 }, { "epoch": 0.46495726495726497, "grad_norm": 1.4736229181289673, "learning_rate": 1.5709342560553635e-05, "loss": 0.403, "num_input_tokens_seen": 2650848, "step": 68, "train_runtime": 281.2134, "train_tokens_per_second": 9426.463 }, { "epoch": 0.4717948717948718, "grad_norm": 1.4522730112075806, "learning_rate": 1.56401384083045e-05, "loss": 0.4548, "num_input_tokens_seen": 2678816, "step": 69, "train_runtime": 283.5945, "train_tokens_per_second": 9445.936 }, { "epoch": 0.47863247863247865, "grad_norm": 1.5067986249923706, "learning_rate": 1.5570934256055366e-05, "loss": 0.4432, "num_input_tokens_seen": 2717472, "step": 70, "train_runtime": 286.8288, "train_tokens_per_second": 9474.195 }, { "epoch": 0.48547008547008547, "grad_norm": 1.542819857597351, "learning_rate": 1.550173010380623e-05, "loss": 0.4915, "num_input_tokens_seen": 2754592, "step": 71, "train_runtime": 289.9357, "train_tokens_per_second": 9500.7 }, { "epoch": 0.49230769230769234, "grad_norm": 1.4620888233184814, "learning_rate": 1.5432525951557094e-05, "loss": 0.3876, "num_input_tokens_seen": 2799296, "step": 72, "train_runtime": 293.7189, "train_tokens_per_second": 9530.527 }, { "epoch": 0.49914529914529915, "grad_norm": 1.526044487953186, "learning_rate": 1.536332179930796e-05, "loss": 0.4648, "num_input_tokens_seen": 2828800, "step": 73, "train_runtime": 296.237, "train_tokens_per_second": 9549.112 }, { "epoch": 0.505982905982906, "grad_norm": 1.4033782482147217, "learning_rate": 1.5294117647058822e-05, "loss": 0.4114, "num_input_tokens_seen": 2876800, "step": 74, "train_runtime": 300.199, "train_tokens_per_second": 9582.978 }, { "epoch": 0.5128205128205128, "grad_norm": 1.6525285243988037, "learning_rate": 1.522491349480969e-05, "loss": 0.4523, "num_input_tokens_seen": 2924736, "step": 75, "train_runtime": 304.1673, "train_tokens_per_second": 9615.551 }, { "epoch": 0.5196581196581197, "grad_norm": 1.3782298564910889, "learning_rate": 1.5155709342560554e-05, "loss": 0.416, "num_input_tokens_seen": 2969600, "step": 76, "train_runtime": 307.8767, "train_tokens_per_second": 9645.42 }, { "epoch": 0.5264957264957265, "grad_norm": 1.2422502040863037, "learning_rate": 1.5086505190311421e-05, "loss": 0.3851, "num_input_tokens_seen": 3030912, "step": 77, "train_runtime": 313.0558, "train_tokens_per_second": 9681.699 }, { "epoch": 0.5333333333333333, "grad_norm": 1.7053712606430054, "learning_rate": 1.5017301038062285e-05, "loss": 0.5167, "num_input_tokens_seen": 3069312, "step": 78, "train_runtime": 316.2163, "train_tokens_per_second": 9706.369 }, { "epoch": 0.5401709401709401, "grad_norm": 1.57555091381073, "learning_rate": 1.494809688581315e-05, "loss": 0.5093, "num_input_tokens_seen": 3099456, "step": 79, "train_runtime": 318.7901, "train_tokens_per_second": 9722.56 }, { "epoch": 0.5470085470085471, "grad_norm": 1.528808355331421, "learning_rate": 1.4878892733564014e-05, "loss": 0.5011, "num_input_tokens_seen": 3137024, "step": 80, "train_runtime": 321.9542, "train_tokens_per_second": 9743.697 }, { "epoch": 0.5538461538461539, "grad_norm": 1.358077049255371, "learning_rate": 1.480968858131488e-05, "loss": 0.4043, "num_input_tokens_seen": 3183648, "step": 81, "train_runtime": 325.824, "train_tokens_per_second": 9771.066 }, { "epoch": 0.5606837606837607, "grad_norm": 1.7505600452423096, "learning_rate": 1.4740484429065744e-05, "loss": 0.4766, "num_input_tokens_seen": 3214592, "step": 82, "train_runtime": 328.4491, "train_tokens_per_second": 9787.183 }, { "epoch": 0.5675213675213675, "grad_norm": 1.6043431758880615, "learning_rate": 1.4671280276816611e-05, "loss": 0.4837, "num_input_tokens_seen": 3242720, "step": 83, "train_runtime": 330.8621, "train_tokens_per_second": 9800.82 }, { "epoch": 0.5743589743589743, "grad_norm": 1.3557583093643188, "learning_rate": 1.4602076124567475e-05, "loss": 0.4051, "num_input_tokens_seen": 3278816, "step": 84, "train_runtime": 333.921, "train_tokens_per_second": 9819.136 }, { "epoch": 0.5811965811965812, "grad_norm": 1.4810553789138794, "learning_rate": 1.4532871972318341e-05, "loss": 0.4385, "num_input_tokens_seen": 3315008, "step": 85, "train_runtime": 336.9782, "train_tokens_per_second": 9837.454 }, { "epoch": 0.588034188034188, "grad_norm": 1.520869493484497, "learning_rate": 1.4463667820069205e-05, "loss": 0.4663, "num_input_tokens_seen": 3349152, "step": 86, "train_runtime": 339.8919, "train_tokens_per_second": 9853.58 }, { "epoch": 0.5948717948717949, "grad_norm": 1.5246199369430542, "learning_rate": 1.439446366782007e-05, "loss": 0.4519, "num_input_tokens_seen": 3377696, "step": 87, "train_runtime": 342.3568, "train_tokens_per_second": 9866.012 }, { "epoch": 0.6017094017094017, "grad_norm": 1.554733157157898, "learning_rate": 1.4325259515570935e-05, "loss": 0.5046, "num_input_tokens_seen": 3414656, "step": 88, "train_runtime": 345.4265, "train_tokens_per_second": 9885.332 }, { "epoch": 0.6085470085470085, "grad_norm": 1.571320652961731, "learning_rate": 1.4256055363321802e-05, "loss": 0.4736, "num_input_tokens_seen": 3446080, "step": 89, "train_runtime": 348.0842, "train_tokens_per_second": 9900.134 }, { "epoch": 0.6153846153846154, "grad_norm": 1.624376893043518, "learning_rate": 1.4186851211072666e-05, "loss": 0.4512, "num_input_tokens_seen": 3475168, "step": 90, "train_runtime": 350.5802, "train_tokens_per_second": 9912.62 }, { "epoch": 0.6153846153846154, "eval_loss": 0.4554298520088196, "eval_runtime": 5.7133, "eval_samples_per_second": 174.681, "eval_steps_per_second": 5.601, "num_input_tokens_seen": 3475168, "step": 90 }, { "epoch": 0.6222222222222222, "grad_norm": 1.713934063911438, "learning_rate": 1.4117647058823532e-05, "loss": 0.4519, "num_input_tokens_seen": 3500032, "step": 91, "train_runtime": 376.436, "train_tokens_per_second": 9297.815 }, { "epoch": 0.629059829059829, "grad_norm": 1.5343419313430786, "learning_rate": 1.4048442906574396e-05, "loss": 0.4543, "num_input_tokens_seen": 3535136, "step": 92, "train_runtime": 379.3304, "train_tokens_per_second": 9319.412 }, { "epoch": 0.6358974358974359, "grad_norm": 1.4790829420089722, "learning_rate": 1.3979238754325261e-05, "loss": 0.439, "num_input_tokens_seen": 3564192, "step": 93, "train_runtime": 381.791, "train_tokens_per_second": 9335.453 }, { "epoch": 0.6427350427350428, "grad_norm": 1.435154914855957, "learning_rate": 1.3910034602076125e-05, "loss": 0.4486, "num_input_tokens_seen": 3600640, "step": 94, "train_runtime": 384.8183, "train_tokens_per_second": 9356.727 }, { "epoch": 0.6495726495726496, "grad_norm": 1.7755075693130493, "learning_rate": 1.3840830449826989e-05, "loss": 0.486, "num_input_tokens_seen": 3634336, "step": 95, "train_runtime": 387.6562, "train_tokens_per_second": 9375.153 }, { "epoch": 0.6564102564102564, "grad_norm": 1.542274832725525, "learning_rate": 1.3771626297577856e-05, "loss": 0.476, "num_input_tokens_seen": 3667328, "step": 96, "train_runtime": 390.429, "train_tokens_per_second": 9393.073 }, { "epoch": 0.6632478632478632, "grad_norm": 1.5652968883514404, "learning_rate": 1.370242214532872e-05, "loss": 0.4655, "num_input_tokens_seen": 3700224, "step": 97, "train_runtime": 393.1811, "train_tokens_per_second": 9410.992 }, { "epoch": 0.67008547008547, "grad_norm": 1.433912992477417, "learning_rate": 1.3633217993079586e-05, "loss": 0.4575, "num_input_tokens_seen": 3744448, "step": 98, "train_runtime": 396.8421, "train_tokens_per_second": 9435.611 }, { "epoch": 0.676923076923077, "grad_norm": 1.5182974338531494, "learning_rate": 1.356401384083045e-05, "loss": 0.4643, "num_input_tokens_seen": 3779936, "step": 99, "train_runtime": 399.8119, "train_tokens_per_second": 9454.287 }, { "epoch": 0.6837606837606838, "grad_norm": 1.5050530433654785, "learning_rate": 1.3494809688581316e-05, "loss": 0.4509, "num_input_tokens_seen": 3828608, "step": 100, "train_runtime": 403.7792, "train_tokens_per_second": 9481.935 }, { "epoch": 0.6905982905982906, "grad_norm": 1.3182984590530396, "learning_rate": 1.342560553633218e-05, "loss": 0.4183, "num_input_tokens_seen": 3881632, "step": 101, "train_runtime": 408.1485, "train_tokens_per_second": 9510.342 }, { "epoch": 0.6974358974358974, "grad_norm": 1.4368970394134521, "learning_rate": 1.3356401384083047e-05, "loss": 0.5363, "num_input_tokens_seen": 3911200, "step": 102, "train_runtime": 410.6666, "train_tokens_per_second": 9524.028 }, { "epoch": 0.7042735042735043, "grad_norm": 1.702073335647583, "learning_rate": 1.3287197231833911e-05, "loss": 0.4391, "num_input_tokens_seen": 3951424, "step": 103, "train_runtime": 414.0044, "train_tokens_per_second": 9544.4 }, { "epoch": 0.7111111111111111, "grad_norm": 1.484083652496338, "learning_rate": 1.3217993079584777e-05, "loss": 0.4622, "num_input_tokens_seen": 3984992, "step": 104, "train_runtime": 416.8268, "train_tokens_per_second": 9560.306 }, { "epoch": 0.717948717948718, "grad_norm": 1.5703684091567993, "learning_rate": 1.314878892733564e-05, "loss": 0.4656, "num_input_tokens_seen": 4022400, "step": 105, "train_runtime": 419.9371, "train_tokens_per_second": 9578.578 }, { "epoch": 0.7247863247863248, "grad_norm": 1.617999792098999, "learning_rate": 1.3079584775086506e-05, "loss": 0.475, "num_input_tokens_seen": 4056160, "step": 106, "train_runtime": 422.7581, "train_tokens_per_second": 9594.517 }, { "epoch": 0.7316239316239316, "grad_norm": 1.7811297178268433, "learning_rate": 1.301038062283737e-05, "loss": 0.517, "num_input_tokens_seen": 4092928, "step": 107, "train_runtime": 425.86, "train_tokens_per_second": 9610.97 }, { "epoch": 0.7384615384615385, "grad_norm": 1.3520305156707764, "learning_rate": 1.2941176470588238e-05, "loss": 0.4112, "num_input_tokens_seen": 4153440, "step": 108, "train_runtime": 431.5262, "train_tokens_per_second": 9625.002 }, { "epoch": 0.7452991452991453, "grad_norm": 1.4912413358688354, "learning_rate": 1.2871972318339102e-05, "loss": 0.4536, "num_input_tokens_seen": 4187744, "step": 109, "train_runtime": 434.4156, "train_tokens_per_second": 9639.948 }, { "epoch": 0.7521367521367521, "grad_norm": 1.4879883527755737, "learning_rate": 1.2802768166089967e-05, "loss": 0.4744, "num_input_tokens_seen": 4226496, "step": 110, "train_runtime": 437.6348, "train_tokens_per_second": 9657.586 }, { "epoch": 0.7589743589743589, "grad_norm": 1.5085774660110474, "learning_rate": 1.2733564013840831e-05, "loss": 0.5143, "num_input_tokens_seen": 4262176, "step": 111, "train_runtime": 440.6057, "train_tokens_per_second": 9673.447 }, { "epoch": 0.7658119658119659, "grad_norm": 1.4866958856582642, "learning_rate": 1.2664359861591697e-05, "loss": 0.3955, "num_input_tokens_seen": 4299200, "step": 112, "train_runtime": 443.6903, "train_tokens_per_second": 9689.643 }, { "epoch": 0.7726495726495727, "grad_norm": 1.7484487295150757, "learning_rate": 1.259515570934256e-05, "loss": 0.5021, "num_input_tokens_seen": 4339904, "step": 113, "train_runtime": 447.0564, "train_tokens_per_second": 9707.733 }, { "epoch": 0.7794871794871795, "grad_norm": 1.5065933465957642, "learning_rate": 1.2525951557093428e-05, "loss": 0.4726, "num_input_tokens_seen": 4369728, "step": 114, "train_runtime": 449.5826, "train_tokens_per_second": 9719.522 }, { "epoch": 0.7863247863247863, "grad_norm": 1.4008255004882812, "learning_rate": 1.2456747404844292e-05, "loss": 0.4908, "num_input_tokens_seen": 4407936, "step": 115, "train_runtime": 452.8133, "train_tokens_per_second": 9734.554 }, { "epoch": 0.7931623931623931, "grad_norm": 1.5314161777496338, "learning_rate": 1.2387543252595158e-05, "loss": 0.5017, "num_input_tokens_seen": 4439520, "step": 116, "train_runtime": 455.4893, "train_tokens_per_second": 9746.705 }, { "epoch": 0.8, "grad_norm": 1.3641289472579956, "learning_rate": 1.2318339100346022e-05, "loss": 0.4654, "num_input_tokens_seen": 4475552, "step": 117, "train_runtime": 458.5097, "train_tokens_per_second": 9761.084 }, { "epoch": 0.8068376068376069, "grad_norm": 1.6261942386627197, "learning_rate": 1.2249134948096886e-05, "loss": 0.4088, "num_input_tokens_seen": 4530112, "step": 118, "train_runtime": 463.158, "train_tokens_per_second": 9780.921 }, { "epoch": 0.8136752136752137, "grad_norm": 1.4655214548110962, "learning_rate": 1.2179930795847751e-05, "loss": 0.4371, "num_input_tokens_seen": 4559936, "step": 119, "train_runtime": 465.6803, "train_tokens_per_second": 9791.988 }, { "epoch": 0.8205128205128205, "grad_norm": 1.5850762128829956, "learning_rate": 1.2110726643598615e-05, "loss": 0.4721, "num_input_tokens_seen": 4601120, "step": 120, "train_runtime": 469.1647, "train_tokens_per_second": 9807.046 }, { "epoch": 0.8205128205128205, "eval_loss": 0.4540318250656128, "eval_runtime": 5.7037, "eval_samples_per_second": 174.974, "eval_steps_per_second": 5.61, "num_input_tokens_seen": 4601120, "step": 120 }, { "epoch": 0.8273504273504273, "grad_norm": 1.4847512245178223, "learning_rate": 1.2041522491349483e-05, "loss": 0.4827, "num_input_tokens_seen": 4635648, "step": 121, "train_runtime": 496.058, "train_tokens_per_second": 9344.972 }, { "epoch": 0.8341880341880342, "grad_norm": 1.4828547239303589, "learning_rate": 1.1972318339100347e-05, "loss": 0.4849, "num_input_tokens_seen": 4674560, "step": 122, "train_runtime": 499.2917, "train_tokens_per_second": 9362.382 }, { "epoch": 0.841025641025641, "grad_norm": 1.5140576362609863, "learning_rate": 1.1903114186851212e-05, "loss": 0.521, "num_input_tokens_seen": 4717344, "step": 123, "train_runtime": 502.8538, "train_tokens_per_second": 9381.145 }, { "epoch": 0.8478632478632478, "grad_norm": 1.1721268892288208, "learning_rate": 1.1833910034602076e-05, "loss": 0.3616, "num_input_tokens_seen": 4778304, "step": 124, "train_runtime": 507.9229, "train_tokens_per_second": 9407.537 }, { "epoch": 0.8547008547008547, "grad_norm": 1.3763750791549683, "learning_rate": 1.1764705882352942e-05, "loss": 0.4127, "num_input_tokens_seen": 4814464, "step": 125, "train_runtime": 510.9361, "train_tokens_per_second": 9422.83 }, { "epoch": 0.8615384615384616, "grad_norm": 1.4982727766036987, "learning_rate": 1.1695501730103806e-05, "loss": 0.433, "num_input_tokens_seen": 4860768, "step": 126, "train_runtime": 514.8181, "train_tokens_per_second": 9441.719 }, { "epoch": 0.8683760683760684, "grad_norm": 1.4128450155258179, "learning_rate": 1.1626297577854673e-05, "loss": 0.5173, "num_input_tokens_seen": 4900512, "step": 127, "train_runtime": 518.1154, "train_tokens_per_second": 9458.342 }, { "epoch": 0.8752136752136752, "grad_norm": 1.564786434173584, "learning_rate": 1.1557093425605537e-05, "loss": 0.4603, "num_input_tokens_seen": 4938752, "step": 128, "train_runtime": 521.2991, "train_tokens_per_second": 9473.931 }, { "epoch": 0.882051282051282, "grad_norm": 1.5176303386688232, "learning_rate": 1.1487889273356403e-05, "loss": 0.4633, "num_input_tokens_seen": 4979584, "step": 129, "train_runtime": 524.6889, "train_tokens_per_second": 9490.545 }, { "epoch": 0.8888888888888888, "grad_norm": 1.5156581401824951, "learning_rate": 1.1418685121107267e-05, "loss": 0.4556, "num_input_tokens_seen": 5017216, "step": 130, "train_runtime": 527.841, "train_tokens_per_second": 9505.166 }, { "epoch": 0.8957264957264958, "grad_norm": 1.4633028507232666, "learning_rate": 1.1349480968858132e-05, "loss": 0.3931, "num_input_tokens_seen": 5054016, "step": 131, "train_runtime": 530.9057, "train_tokens_per_second": 9519.612 }, { "epoch": 0.9025641025641026, "grad_norm": 1.8066245317459106, "learning_rate": 1.1280276816608996e-05, "loss": 0.4996, "num_input_tokens_seen": 5080544, "step": 132, "train_runtime": 533.1694, "train_tokens_per_second": 9528.95 }, { "epoch": 0.9094017094017094, "grad_norm": 1.4042011499404907, "learning_rate": 1.1211072664359864e-05, "loss": 0.4592, "num_input_tokens_seen": 5116960, "step": 133, "train_runtime": 536.2021, "train_tokens_per_second": 9542.969 }, { "epoch": 0.9162393162393162, "grad_norm": 1.4731768369674683, "learning_rate": 1.1141868512110728e-05, "loss": 0.4417, "num_input_tokens_seen": 5152288, "step": 134, "train_runtime": 539.1624, "train_tokens_per_second": 9556.096 }, { "epoch": 0.9230769230769231, "grad_norm": 1.2772272825241089, "learning_rate": 1.1072664359861593e-05, "loss": 0.4064, "num_input_tokens_seen": 5204448, "step": 135, "train_runtime": 543.4474, "train_tokens_per_second": 9576.729 }, { "epoch": 0.9299145299145299, "grad_norm": 1.6605689525604248, "learning_rate": 1.1003460207612457e-05, "loss": 0.4421, "num_input_tokens_seen": 5255488, "step": 136, "train_runtime": 547.7055, "train_tokens_per_second": 9595.463 }, { "epoch": 0.9367521367521368, "grad_norm": 1.5701137781143188, "learning_rate": 1.0934256055363323e-05, "loss": 0.4587, "num_input_tokens_seen": 5282848, "step": 137, "train_runtime": 550.0393, "train_tokens_per_second": 9604.491 }, { "epoch": 0.9435897435897436, "grad_norm": 1.4943722486495972, "learning_rate": 1.0865051903114187e-05, "loss": 0.4801, "num_input_tokens_seen": 5319456, "step": 138, "train_runtime": 553.1186, "train_tokens_per_second": 9617.207 }, { "epoch": 0.9504273504273504, "grad_norm": 1.5468835830688477, "learning_rate": 1.0795847750865054e-05, "loss": 0.4504, "num_input_tokens_seen": 5359296, "step": 139, "train_runtime": 556.4596, "train_tokens_per_second": 9631.06 }, { "epoch": 0.9572649572649573, "grad_norm": 1.409867763519287, "learning_rate": 1.0726643598615918e-05, "loss": 0.4377, "num_input_tokens_seen": 5416672, "step": 140, "train_runtime": 561.16, "train_tokens_per_second": 9652.634 }, { "epoch": 0.9641025641025641, "grad_norm": 1.3638184070587158, "learning_rate": 1.0657439446366782e-05, "loss": 0.3818, "num_input_tokens_seen": 5498976, "step": 141, "train_runtime": 568.811, "train_tokens_per_second": 9667.493 }, { "epoch": 0.9709401709401709, "grad_norm": 1.4294383525848389, "learning_rate": 1.0588235294117648e-05, "loss": 0.4468, "num_input_tokens_seen": 5532992, "step": 142, "train_runtime": 571.6619, "train_tokens_per_second": 9678.784 }, { "epoch": 0.9777777777777777, "grad_norm": 1.3784202337265015, "learning_rate": 1.0519031141868512e-05, "loss": 0.4106, "num_input_tokens_seen": 5585280, "step": 143, "train_runtime": 576.0752, "train_tokens_per_second": 9695.4 }, { "epoch": 0.9846153846153847, "grad_norm": 1.6159602403640747, "learning_rate": 1.0449826989619377e-05, "loss": 0.4474, "num_input_tokens_seen": 5622976, "step": 144, "train_runtime": 579.2137, "train_tokens_per_second": 9707.948 }, { "epoch": 0.9914529914529915, "grad_norm": 1.510590672492981, "learning_rate": 1.0380622837370241e-05, "loss": 0.4664, "num_input_tokens_seen": 5661472, "step": 145, "train_runtime": 582.3983, "train_tokens_per_second": 9720.962 }, { "epoch": 0.9982905982905983, "grad_norm": 1.3742411136627197, "learning_rate": 1.0311418685121109e-05, "loss": 0.4175, "num_input_tokens_seen": 5698240, "step": 146, "train_runtime": 585.4675, "train_tokens_per_second": 9732.803 }, { "epoch": 1.0, "grad_norm": 2.935847282409668, "learning_rate": 1.0242214532871973e-05, "loss": 0.4182, "num_input_tokens_seen": 5709310, "step": 147, "train_runtime": 587.7866, "train_tokens_per_second": 9713.235 }, { "epoch": 1.0068376068376068, "grad_norm": 1.3502393960952759, "learning_rate": 1.0173010380622838e-05, "loss": 0.3852, "num_input_tokens_seen": 5746654, "step": 148, "train_runtime": 590.9756, "train_tokens_per_second": 9724.013 }, { "epoch": 1.0136752136752136, "grad_norm": 1.4006216526031494, "learning_rate": 1.0103806228373702e-05, "loss": 0.3924, "num_input_tokens_seen": 5777726, "step": 149, "train_runtime": 593.6371, "train_tokens_per_second": 9732.758 }, { "epoch": 1.0205128205128204, "grad_norm": 1.4392833709716797, "learning_rate": 1.0034602076124568e-05, "loss": 0.4426, "num_input_tokens_seen": 5812574, "step": 150, "train_runtime": 596.583, "train_tokens_per_second": 9743.111 }, { "epoch": 1.0205128205128204, "eval_loss": 0.45281028747558594, "eval_runtime": 6.2291, "eval_samples_per_second": 160.216, "eval_steps_per_second": 5.137, "num_input_tokens_seen": 5812574, "step": 150 }, { "epoch": 1.0273504273504273, "grad_norm": 1.3533525466918945, "learning_rate": 9.965397923875434e-06, "loss": 0.4033, "num_input_tokens_seen": 5855934, "step": 151, "train_runtime": 626.0707, "train_tokens_per_second": 9353.471 }, { "epoch": 1.0341880341880343, "grad_norm": 1.3957024812698364, "learning_rate": 9.896193771626298e-06, "loss": 0.4154, "num_input_tokens_seen": 5883870, "step": 152, "train_runtime": 628.4362, "train_tokens_per_second": 9362.717 }, { "epoch": 1.041025641025641, "grad_norm": 1.2741293907165527, "learning_rate": 9.826989619377163e-06, "loss": 0.4497, "num_input_tokens_seen": 5932190, "step": 153, "train_runtime": 632.3789, "train_tokens_per_second": 9380.752 }, { "epoch": 1.047863247863248, "grad_norm": 1.3246592283248901, "learning_rate": 9.757785467128029e-06, "loss": 0.3884, "num_input_tokens_seen": 5981854, "step": 154, "train_runtime": 636.5436, "train_tokens_per_second": 9397.398 }, { "epoch": 1.0547008547008547, "grad_norm": 1.3506548404693604, "learning_rate": 9.688581314878893e-06, "loss": 0.3601, "num_input_tokens_seen": 6030590, "step": 155, "train_runtime": 640.5068, "train_tokens_per_second": 9415.341 }, { "epoch": 1.0615384615384615, "grad_norm": 1.298898458480835, "learning_rate": 9.619377162629759e-06, "loss": 0.4158, "num_input_tokens_seen": 6072030, "step": 156, "train_runtime": 643.9463, "train_tokens_per_second": 9429.405 }, { "epoch": 1.0683760683760684, "grad_norm": 1.4321287870407104, "learning_rate": 9.550173010380624e-06, "loss": 0.4496, "num_input_tokens_seen": 6107006, "step": 157, "train_runtime": 646.8903, "train_tokens_per_second": 9440.559 }, { "epoch": 1.0752136752136752, "grad_norm": 1.362835168838501, "learning_rate": 9.480968858131488e-06, "loss": 0.4082, "num_input_tokens_seen": 6153086, "step": 158, "train_runtime": 650.7394, "train_tokens_per_second": 9455.529 }, { "epoch": 1.082051282051282, "grad_norm": 1.332863211631775, "learning_rate": 9.411764705882354e-06, "loss": 0.4156, "num_input_tokens_seen": 6192222, "step": 159, "train_runtime": 653.9789, "train_tokens_per_second": 9468.535 }, { "epoch": 1.0888888888888888, "grad_norm": 1.3329721689224243, "learning_rate": 9.34256055363322e-06, "loss": 0.4446, "num_input_tokens_seen": 6234430, "step": 160, "train_runtime": 657.5263, "train_tokens_per_second": 9481.643 }, { "epoch": 1.0957264957264958, "grad_norm": 1.4851776361465454, "learning_rate": 9.273356401384083e-06, "loss": 0.4104, "num_input_tokens_seen": 6267262, "step": 161, "train_runtime": 660.3125, "train_tokens_per_second": 9491.358 }, { "epoch": 1.1025641025641026, "grad_norm": 1.3695839643478394, "learning_rate": 9.204152249134949e-06, "loss": 0.3741, "num_input_tokens_seen": 6301214, "step": 162, "train_runtime": 663.1514, "train_tokens_per_second": 9501.923 }, { "epoch": 1.1094017094017095, "grad_norm": 1.3758296966552734, "learning_rate": 9.134948096885815e-06, "loss": 0.3491, "num_input_tokens_seen": 6348382, "step": 163, "train_runtime": 667.043, "train_tokens_per_second": 9517.2 }, { "epoch": 1.1162393162393163, "grad_norm": 1.564186692237854, "learning_rate": 9.065743944636679e-06, "loss": 0.3936, "num_input_tokens_seen": 6380958, "step": 164, "train_runtime": 669.7803, "train_tokens_per_second": 9526.942 }, { "epoch": 1.123076923076923, "grad_norm": 1.4669296741485596, "learning_rate": 8.996539792387544e-06, "loss": 0.4147, "num_input_tokens_seen": 6420126, "step": 165, "train_runtime": 673.027, "train_tokens_per_second": 9539.18 }, { "epoch": 1.12991452991453, "grad_norm": 1.2374634742736816, "learning_rate": 8.92733564013841e-06, "loss": 0.3456, "num_input_tokens_seen": 6466430, "step": 166, "train_runtime": 676.9123, "train_tokens_per_second": 9552.833 }, { "epoch": 1.1367521367521367, "grad_norm": 1.3043692111968994, "learning_rate": 8.858131487889274e-06, "loss": 0.3613, "num_input_tokens_seen": 6500990, "step": 167, "train_runtime": 679.8269, "train_tokens_per_second": 9562.714 }, { "epoch": 1.1435897435897435, "grad_norm": 1.5178890228271484, "learning_rate": 8.78892733564014e-06, "loss": 0.4367, "num_input_tokens_seen": 6534718, "step": 168, "train_runtime": 682.6614, "train_tokens_per_second": 9572.414 }, { "epoch": 1.1504273504273503, "grad_norm": 1.3679075241088867, "learning_rate": 8.719723183391005e-06, "loss": 0.4432, "num_input_tokens_seen": 6586718, "step": 169, "train_runtime": 686.9418, "train_tokens_per_second": 9588.466 }, { "epoch": 1.1572649572649572, "grad_norm": 1.356967806816101, "learning_rate": 8.65051903114187e-06, "loss": 0.3925, "num_input_tokens_seen": 6618526, "step": 170, "train_runtime": 689.6389, "train_tokens_per_second": 9597.089 }, { "epoch": 1.1641025641025642, "grad_norm": 1.5362049341201782, "learning_rate": 8.581314878892735e-06, "loss": 0.4119, "num_input_tokens_seen": 6648830, "step": 171, "train_runtime": 692.1817, "train_tokens_per_second": 9605.614 }, { "epoch": 1.170940170940171, "grad_norm": 1.4113274812698364, "learning_rate": 8.5121107266436e-06, "loss": 0.4419, "num_input_tokens_seen": 6683454, "step": 172, "train_runtime": 695.0911, "train_tokens_per_second": 9615.22 }, { "epoch": 1.1777777777777778, "grad_norm": 1.4560883045196533, "learning_rate": 8.442906574394465e-06, "loss": 0.4328, "num_input_tokens_seen": 6717822, "step": 173, "train_runtime": 697.9616, "train_tokens_per_second": 9624.916 }, { "epoch": 1.1846153846153846, "grad_norm": 1.3433024883270264, "learning_rate": 8.373702422145328e-06, "loss": 0.3697, "num_input_tokens_seen": 6759774, "step": 174, "train_runtime": 701.4628, "train_tokens_per_second": 9636.683 }, { "epoch": 1.1914529914529914, "grad_norm": 1.3296136856079102, "learning_rate": 8.304498269896194e-06, "loss": 0.3546, "num_input_tokens_seen": 6802974, "step": 175, "train_runtime": 704.9944, "train_tokens_per_second": 9649.685 }, { "epoch": 1.1982905982905983, "grad_norm": 1.3747283220291138, "learning_rate": 8.23529411764706e-06, "loss": 0.3864, "num_input_tokens_seen": 6838686, "step": 176, "train_runtime": 707.9671, "train_tokens_per_second": 9659.61 }, { "epoch": 1.205128205128205, "grad_norm": 1.498785138130188, "learning_rate": 8.166089965397924e-06, "loss": 0.4183, "num_input_tokens_seen": 6873086, "step": 177, "train_runtime": 710.8358, "train_tokens_per_second": 9669.021 }, { "epoch": 1.2119658119658119, "grad_norm": 1.4664194583892822, "learning_rate": 8.09688581314879e-06, "loss": 0.3918, "num_input_tokens_seen": 6916254, "step": 178, "train_runtime": 714.3711, "train_tokens_per_second": 9681.599 }, { "epoch": 1.218803418803419, "grad_norm": 1.299894094467163, "learning_rate": 8.027681660899655e-06, "loss": 0.3753, "num_input_tokens_seen": 6957598, "step": 179, "train_runtime": 717.7521, "train_tokens_per_second": 9693.594 }, { "epoch": 1.2256410256410257, "grad_norm": 1.4512171745300293, "learning_rate": 7.958477508650519e-06, "loss": 0.4402, "num_input_tokens_seen": 6991550, "step": 180, "train_runtime": 720.5836, "train_tokens_per_second": 9702.621 }, { "epoch": 1.2256410256410257, "eval_loss": 0.4540201723575592, "eval_runtime": 5.6718, "eval_samples_per_second": 175.959, "eval_steps_per_second": 5.642, "num_input_tokens_seen": 6991550, "step": 180 }, { "epoch": 1.2324786324786325, "grad_norm": 1.360262393951416, "learning_rate": 7.889273356401385e-06, "loss": 0.3946, "num_input_tokens_seen": 7025758, "step": 181, "train_runtime": 747.3736, "train_tokens_per_second": 9400.598 }, { "epoch": 1.2393162393162394, "grad_norm": 1.4997259378433228, "learning_rate": 7.82006920415225e-06, "loss": 0.4529, "num_input_tokens_seen": 7064478, "step": 182, "train_runtime": 750.5493, "train_tokens_per_second": 9412.41 }, { "epoch": 1.2461538461538462, "grad_norm": 1.585199236869812, "learning_rate": 7.750865051903114e-06, "loss": 0.4257, "num_input_tokens_seen": 7089886, "step": 183, "train_runtime": 752.7622, "train_tokens_per_second": 9418.493 }, { "epoch": 1.252991452991453, "grad_norm": 1.3399189710617065, "learning_rate": 7.68166089965398e-06, "loss": 0.3918, "num_input_tokens_seen": 7134814, "step": 184, "train_runtime": 756.4288, "train_tokens_per_second": 9432.235 }, { "epoch": 1.2598290598290598, "grad_norm": 1.4995014667510986, "learning_rate": 7.612456747404845e-06, "loss": 0.481, "num_input_tokens_seen": 7178046, "step": 185, "train_runtime": 760.0338, "train_tokens_per_second": 9444.377 }, { "epoch": 1.2666666666666666, "grad_norm": 1.4340060949325562, "learning_rate": 7.5432525951557104e-06, "loss": 0.4483, "num_input_tokens_seen": 7212158, "step": 186, "train_runtime": 762.8937, "train_tokens_per_second": 9453.686 }, { "epoch": 1.2735042735042734, "grad_norm": 1.4529216289520264, "learning_rate": 7.474048442906575e-06, "loss": 0.4695, "num_input_tokens_seen": 7245886, "step": 187, "train_runtime": 765.7249, "train_tokens_per_second": 9462.779 }, { "epoch": 1.2803418803418802, "grad_norm": 1.3756847381591797, "learning_rate": 7.40484429065744e-06, "loss": 0.4277, "num_input_tokens_seen": 7287646, "step": 188, "train_runtime": 769.1612, "train_tokens_per_second": 9474.797 }, { "epoch": 1.287179487179487, "grad_norm": 1.4164284467697144, "learning_rate": 7.335640138408306e-06, "loss": 0.4475, "num_input_tokens_seen": 7326238, "step": 189, "train_runtime": 772.3229, "train_tokens_per_second": 9485.978 }, { "epoch": 1.294017094017094, "grad_norm": 1.3923799991607666, "learning_rate": 7.2664359861591705e-06, "loss": 0.3954, "num_input_tokens_seen": 7364894, "step": 190, "train_runtime": 775.5465, "train_tokens_per_second": 9496.393 }, { "epoch": 1.300854700854701, "grad_norm": 1.3876417875289917, "learning_rate": 7.197231833910035e-06, "loss": 0.4325, "num_input_tokens_seen": 7401534, "step": 191, "train_runtime": 778.6241, "train_tokens_per_second": 9505.915 }, { "epoch": 1.3076923076923077, "grad_norm": 1.337653398513794, "learning_rate": 7.128027681660901e-06, "loss": 0.3433, "num_input_tokens_seen": 7442494, "step": 192, "train_runtime": 782.0513, "train_tokens_per_second": 9516.631 }, { "epoch": 1.3145299145299145, "grad_norm": 1.3862982988357544, "learning_rate": 7.058823529411766e-06, "loss": 0.3943, "num_input_tokens_seen": 7487582, "step": 193, "train_runtime": 785.7613, "train_tokens_per_second": 9529.079 }, { "epoch": 1.3213675213675213, "grad_norm": 1.5185152292251587, "learning_rate": 6.989619377162631e-06, "loss": 0.3824, "num_input_tokens_seen": 7520734, "step": 194, "train_runtime": 788.5665, "train_tokens_per_second": 9537.222 }, { "epoch": 1.3282051282051281, "grad_norm": 1.3591375350952148, "learning_rate": 6.9204152249134946e-06, "loss": 0.3988, "num_input_tokens_seen": 7557854, "step": 195, "train_runtime": 791.673, "train_tokens_per_second": 9546.686 }, { "epoch": 1.335042735042735, "grad_norm": 1.5463569164276123, "learning_rate": 6.85121107266436e-06, "loss": 0.4155, "num_input_tokens_seen": 7594110, "step": 196, "train_runtime": 794.7163, "train_tokens_per_second": 9555.75 }, { "epoch": 1.341880341880342, "grad_norm": 1.3969792127609253, "learning_rate": 6.782006920415225e-06, "loss": 0.4054, "num_input_tokens_seen": 7634878, "step": 197, "train_runtime": 798.1263, "train_tokens_per_second": 9566.003 }, { "epoch": 1.3487179487179488, "grad_norm": 1.4635127782821655, "learning_rate": 6.71280276816609e-06, "loss": 0.3989, "num_input_tokens_seen": 7668894, "step": 198, "train_runtime": 801.0008, "train_tokens_per_second": 9574.14 }, { "epoch": 1.3555555555555556, "grad_norm": 1.4537571668624878, "learning_rate": 6.6435986159169555e-06, "loss": 0.4503, "num_input_tokens_seen": 7705598, "step": 199, "train_runtime": 804.0791, "train_tokens_per_second": 9583.135 }, { "epoch": 1.3623931623931624, "grad_norm": 1.5418137311935425, "learning_rate": 6.57439446366782e-06, "loss": 0.4482, "num_input_tokens_seen": 7737630, "step": 200, "train_runtime": 806.81, "train_tokens_per_second": 9590.399 }, { "epoch": 1.3692307692307693, "grad_norm": 1.512305736541748, "learning_rate": 6.505190311418685e-06, "loss": 0.4625, "num_input_tokens_seen": 7772446, "step": 201, "train_runtime": 809.7648, "train_tokens_per_second": 9598.399 }, { "epoch": 1.376068376068376, "grad_norm": 1.2927024364471436, "learning_rate": 6.435986159169551e-06, "loss": 0.434, "num_input_tokens_seen": 7825886, "step": 202, "train_runtime": 814.22, "train_tokens_per_second": 9611.513 }, { "epoch": 1.3829059829059829, "grad_norm": 1.3422515392303467, "learning_rate": 6.3667820069204156e-06, "loss": 0.4471, "num_input_tokens_seen": 7877566, "step": 203, "train_runtime": 818.5631, "train_tokens_per_second": 9623.652 }, { "epoch": 1.3897435897435897, "grad_norm": 1.5034905672073364, "learning_rate": 6.29757785467128e-06, "loss": 0.4317, "num_input_tokens_seen": 7915038, "step": 204, "train_runtime": 821.6717, "train_tokens_per_second": 9632.847 }, { "epoch": 1.3965811965811965, "grad_norm": 1.4573144912719727, "learning_rate": 6.228373702422146e-06, "loss": 0.4127, "num_input_tokens_seen": 7945950, "step": 205, "train_runtime": 824.2951, "train_tokens_per_second": 9639.691 }, { "epoch": 1.4034188034188033, "grad_norm": 1.424501657485962, "learning_rate": 6.159169550173011e-06, "loss": 0.4444, "num_input_tokens_seen": 7981854, "step": 206, "train_runtime": 827.3346, "train_tokens_per_second": 9647.674 }, { "epoch": 1.4102564102564101, "grad_norm": 1.52495276927948, "learning_rate": 6.089965397923876e-06, "loss": 0.4204, "num_input_tokens_seen": 8024286, "step": 207, "train_runtime": 830.8818, "train_tokens_per_second": 9657.554 }, { "epoch": 1.4170940170940172, "grad_norm": 1.3244974613189697, "learning_rate": 6.020761245674741e-06, "loss": 0.3899, "num_input_tokens_seen": 8062558, "step": 208, "train_runtime": 834.1195, "train_tokens_per_second": 9665.951 }, { "epoch": 1.423931623931624, "grad_norm": 1.4783118963241577, "learning_rate": 5.951557093425606e-06, "loss": 0.4001, "num_input_tokens_seen": 8097406, "step": 209, "train_runtime": 837.0288, "train_tokens_per_second": 9673.987 }, { "epoch": 1.4307692307692308, "grad_norm": 1.4629509449005127, "learning_rate": 5.882352941176471e-06, "loss": 0.4112, "num_input_tokens_seen": 8130526, "step": 210, "train_runtime": 839.833, "train_tokens_per_second": 9681.123 }, { "epoch": 1.4307692307692308, "eval_loss": 0.4539625346660614, "eval_runtime": 5.7425, "eval_samples_per_second": 173.792, "eval_steps_per_second": 5.572, "num_input_tokens_seen": 8130526, "step": 210 }, { "epoch": 1.4376068376068376, "grad_norm": 1.35781991481781, "learning_rate": 5.8131487889273366e-06, "loss": 0.376, "num_input_tokens_seen": 8170302, "step": 211, "train_runtime": 867.0208, "train_tokens_per_second": 9423.421 }, { "epoch": 1.4444444444444444, "grad_norm": 1.5642489194869995, "learning_rate": 5.743944636678201e-06, "loss": 0.4331, "num_input_tokens_seen": 8204958, "step": 212, "train_runtime": 869.9438, "train_tokens_per_second": 9431.596 }, { "epoch": 1.4512820512820512, "grad_norm": 1.4987717866897583, "learning_rate": 5.674740484429066e-06, "loss": 0.4854, "num_input_tokens_seen": 8244126, "step": 213, "train_runtime": 873.217, "train_tokens_per_second": 9441.097 }, { "epoch": 1.458119658119658, "grad_norm": 1.4428235292434692, "learning_rate": 5.605536332179932e-06, "loss": 0.4259, "num_input_tokens_seen": 8286910, "step": 214, "train_runtime": 876.729, "train_tokens_per_second": 9452.077 }, { "epoch": 1.464957264957265, "grad_norm": 1.5963438749313354, "learning_rate": 5.536332179930797e-06, "loss": 0.4945, "num_input_tokens_seen": 8322110, "step": 215, "train_runtime": 879.6762, "train_tokens_per_second": 9460.425 }, { "epoch": 1.471794871794872, "grad_norm": 1.3209023475646973, "learning_rate": 5.4671280276816615e-06, "loss": 0.5295, "num_input_tokens_seen": 8360894, "step": 216, "train_runtime": 882.8992, "train_tokens_per_second": 9469.818 }, { "epoch": 1.4786324786324787, "grad_norm": 1.3461143970489502, "learning_rate": 5.397923875432527e-06, "loss": 0.3801, "num_input_tokens_seen": 8393630, "step": 217, "train_runtime": 885.6709, "train_tokens_per_second": 9477.143 }, { "epoch": 1.4854700854700855, "grad_norm": 1.5508912801742554, "learning_rate": 5.328719723183391e-06, "loss": 0.479, "num_input_tokens_seen": 8422910, "step": 218, "train_runtime": 888.188, "train_tokens_per_second": 9483.251 }, { "epoch": 1.4923076923076923, "grad_norm": 1.4699424505233765, "learning_rate": 5.259515570934256e-06, "loss": 0.4195, "num_input_tokens_seen": 8458014, "step": 219, "train_runtime": 891.1228, "train_tokens_per_second": 9491.412 }, { "epoch": 1.4991452991452991, "grad_norm": 1.3626216650009155, "learning_rate": 5.190311418685121e-06, "loss": 0.4021, "num_input_tokens_seen": 8500670, "step": 220, "train_runtime": 894.6464, "train_tokens_per_second": 9501.709 }, { "epoch": 1.505982905982906, "grad_norm": 1.6453019380569458, "learning_rate": 5.121107266435986e-06, "loss": 0.4276, "num_input_tokens_seen": 8531038, "step": 221, "train_runtime": 897.2331, "train_tokens_per_second": 9508.162 }, { "epoch": 1.5128205128205128, "grad_norm": 1.3846372365951538, "learning_rate": 5.051903114186851e-06, "loss": 0.3921, "num_input_tokens_seen": 8562014, "step": 222, "train_runtime": 899.8779, "train_tokens_per_second": 9514.64 }, { "epoch": 1.5196581196581196, "grad_norm": 1.5681668519973755, "learning_rate": 4.982698961937717e-06, "loss": 0.4713, "num_input_tokens_seen": 8593054, "step": 223, "train_runtime": 902.506, "train_tokens_per_second": 9521.326 }, { "epoch": 1.5264957264957264, "grad_norm": 1.4132840633392334, "learning_rate": 4.913494809688582e-06, "loss": 0.3994, "num_input_tokens_seen": 8628254, "step": 224, "train_runtime": 905.4606, "train_tokens_per_second": 9529.133 }, { "epoch": 1.5333333333333332, "grad_norm": 1.4908711910247803, "learning_rate": 4.8442906574394464e-06, "loss": 0.4021, "num_input_tokens_seen": 8689630, "step": 225, "train_runtime": 910.705, "train_tokens_per_second": 9541.652 }, { "epoch": 1.54017094017094, "grad_norm": 1.1932868957519531, "learning_rate": 4.775086505190312e-06, "loss": 0.3898, "num_input_tokens_seen": 8734526, "step": 226, "train_runtime": 914.4429, "train_tokens_per_second": 9551.746 }, { "epoch": 1.547008547008547, "grad_norm": 1.253638744354248, "learning_rate": 4.705882352941177e-06, "loss": 0.4028, "num_input_tokens_seen": 8799582, "step": 227, "train_runtime": 919.89, "train_tokens_per_second": 9565.907 }, { "epoch": 1.5538461538461539, "grad_norm": 1.322104573249817, "learning_rate": 4.636678200692042e-06, "loss": 0.3858, "num_input_tokens_seen": 8840638, "step": 228, "train_runtime": 923.2956, "train_tokens_per_second": 9575.089 }, { "epoch": 1.5606837606837607, "grad_norm": 1.377384901046753, "learning_rate": 4.567474048442907e-06, "loss": 0.3577, "num_input_tokens_seen": 8895710, "step": 229, "train_runtime": 927.776, "train_tokens_per_second": 9588.209 }, { "epoch": 1.5675213675213675, "grad_norm": 1.4464075565338135, "learning_rate": 4.498269896193772e-06, "loss": 0.3797, "num_input_tokens_seen": 8940670, "step": 230, "train_runtime": 931.4748, "train_tokens_per_second": 9598.402 }, { "epoch": 1.5743589743589743, "grad_norm": 1.4492119550704956, "learning_rate": 4.429065743944637e-06, "loss": 0.3816, "num_input_tokens_seen": 8984350, "step": 231, "train_runtime": 935.1105, "train_tokens_per_second": 9607.795 }, { "epoch": 1.5811965811965814, "grad_norm": 1.6883492469787598, "learning_rate": 4.359861591695503e-06, "loss": 0.4917, "num_input_tokens_seen": 9019390, "step": 232, "train_runtime": 938.0738, "train_tokens_per_second": 9614.797 }, { "epoch": 1.5880341880341882, "grad_norm": 1.4682198762893677, "learning_rate": 4.2906574394463675e-06, "loss": 0.3746, "num_input_tokens_seen": 9059294, "step": 233, "train_runtime": 941.4183, "train_tokens_per_second": 9623.028 }, { "epoch": 1.594871794871795, "grad_norm": 1.3500458002090454, "learning_rate": 4.221453287197232e-06, "loss": 0.4348, "num_input_tokens_seen": 9097854, "step": 234, "train_runtime": 944.6072, "train_tokens_per_second": 9631.362 }, { "epoch": 1.6017094017094018, "grad_norm": 1.5531758069992065, "learning_rate": 4.152249134948097e-06, "loss": 0.4281, "num_input_tokens_seen": 9131518, "step": 235, "train_runtime": 947.4585, "train_tokens_per_second": 9637.908 }, { "epoch": 1.6085470085470086, "grad_norm": 1.503575325012207, "learning_rate": 4.083044982698962e-06, "loss": 0.4181, "num_input_tokens_seen": 9170014, "step": 236, "train_runtime": 950.6625, "train_tokens_per_second": 9645.919 }, { "epoch": 1.6153846153846154, "grad_norm": 1.5178425312042236, "learning_rate": 4.0138408304498275e-06, "loss": 0.4313, "num_input_tokens_seen": 9211198, "step": 237, "train_runtime": 954.0784, "train_tokens_per_second": 9654.551 }, { "epoch": 1.6222222222222222, "grad_norm": 1.4492536783218384, "learning_rate": 3.944636678200692e-06, "loss": 0.4175, "num_input_tokens_seen": 9240734, "step": 238, "train_runtime": 956.6363, "train_tokens_per_second": 9659.611 }, { "epoch": 1.629059829059829, "grad_norm": 1.4955025911331177, "learning_rate": 3.875432525951557e-06, "loss": 0.4145, "num_input_tokens_seen": 9279966, "step": 239, "train_runtime": 959.9009, "train_tokens_per_second": 9667.63 }, { "epoch": 1.6358974358974359, "grad_norm": 1.3603522777557373, "learning_rate": 3.8062283737024224e-06, "loss": 0.3571, "num_input_tokens_seen": 9318206, "step": 240, "train_runtime": 963.044, "train_tokens_per_second": 9675.784 }, { "epoch": 1.6358974358974359, "eval_loss": 0.4540530741214752, "eval_runtime": 5.7145, "eval_samples_per_second": 174.643, "eval_steps_per_second": 5.6, "num_input_tokens_seen": 9318206, "step": 240 }, { "epoch": 1.6427350427350427, "grad_norm": 1.3077824115753174, "learning_rate": 3.7370242214532876e-06, "loss": 0.3903, "num_input_tokens_seen": 9357278, "step": 241, "train_runtime": 989.9944, "train_tokens_per_second": 9451.849 }, { "epoch": 1.6495726495726495, "grad_norm": 1.4134607315063477, "learning_rate": 3.667820069204153e-06, "loss": 0.4299, "num_input_tokens_seen": 9401246, "step": 242, "train_runtime": 993.6355, "train_tokens_per_second": 9461.464 }, { "epoch": 1.6564102564102563, "grad_norm": 1.3824211359024048, "learning_rate": 3.5986159169550177e-06, "loss": 0.4513, "num_input_tokens_seen": 9439326, "step": 243, "train_runtime": 996.8489, "train_tokens_per_second": 9469.164 }, { "epoch": 1.6632478632478631, "grad_norm": 1.3873765468597412, "learning_rate": 3.529411764705883e-06, "loss": 0.4037, "num_input_tokens_seen": 9474398, "step": 244, "train_runtime": 999.7516, "train_tokens_per_second": 9476.752 }, { "epoch": 1.67008547008547, "grad_norm": 1.5342257022857666, "learning_rate": 3.4602076124567473e-06, "loss": 0.4479, "num_input_tokens_seen": 9504830, "step": 245, "train_runtime": 1002.3332, "train_tokens_per_second": 9482.704 }, { "epoch": 1.676923076923077, "grad_norm": 1.4302300214767456, "learning_rate": 3.3910034602076125e-06, "loss": 0.4137, "num_input_tokens_seen": 9550430, "step": 246, "train_runtime": 1006.0494, "train_tokens_per_second": 9493.003 }, { "epoch": 1.6837606837606838, "grad_norm": 1.516709566116333, "learning_rate": 3.3217993079584777e-06, "loss": 0.4088, "num_input_tokens_seen": 9583806, "step": 247, "train_runtime": 1008.8176, "train_tokens_per_second": 9500.038 }, { "epoch": 1.6905982905982906, "grad_norm": 1.4347656965255737, "learning_rate": 3.2525951557093425e-06, "loss": 0.3991, "num_input_tokens_seen": 9644798, "step": 248, "train_runtime": 1013.8333, "train_tokens_per_second": 9513.199 }, { "epoch": 1.6974358974358974, "grad_norm": 1.2900501489639282, "learning_rate": 3.1833910034602078e-06, "loss": 0.3854, "num_input_tokens_seen": 9699294, "step": 249, "train_runtime": 1018.4019, "train_tokens_per_second": 9524.034 }, { "epoch": 1.7042735042735044, "grad_norm": 1.4763895273208618, "learning_rate": 3.114186851211073e-06, "loss": 0.3875, "num_input_tokens_seen": 9738238, "step": 250, "train_runtime": 1021.6841, "train_tokens_per_second": 9531.554 }, { "epoch": 1.7111111111111112, "grad_norm": 1.5247527360916138, "learning_rate": 3.044982698961938e-06, "loss": 0.4356, "num_input_tokens_seen": 9774910, "step": 251, "train_runtime": 1024.7713, "train_tokens_per_second": 9538.626 }, { "epoch": 1.717948717948718, "grad_norm": 1.3282755613327026, "learning_rate": 2.975778546712803e-06, "loss": 0.3761, "num_input_tokens_seen": 9816158, "step": 252, "train_runtime": 1028.1704, "train_tokens_per_second": 9547.21 }, { "epoch": 1.7247863247863249, "grad_norm": 1.5729610919952393, "learning_rate": 2.9065743944636683e-06, "loss": 0.411, "num_input_tokens_seen": 9860414, "step": 253, "train_runtime": 1031.7918, "train_tokens_per_second": 9556.593 }, { "epoch": 1.7316239316239317, "grad_norm": 1.3676373958587646, "learning_rate": 2.837370242214533e-06, "loss": 0.3885, "num_input_tokens_seen": 9895518, "step": 254, "train_runtime": 1034.7479, "train_tokens_per_second": 9563.216 }, { "epoch": 1.7384615384615385, "grad_norm": 1.3123220205307007, "learning_rate": 2.7681660899653983e-06, "loss": 0.3553, "num_input_tokens_seen": 9931838, "step": 255, "train_runtime": 1037.7767, "train_tokens_per_second": 9570.304 }, { "epoch": 1.7452991452991453, "grad_norm": 1.4366247653961182, "learning_rate": 2.6989619377162636e-06, "loss": 0.42, "num_input_tokens_seen": 9975582, "step": 256, "train_runtime": 1041.3876, "train_tokens_per_second": 9579.125 }, { "epoch": 1.7521367521367521, "grad_norm": 1.330451488494873, "learning_rate": 2.629757785467128e-06, "loss": 0.3794, "num_input_tokens_seen": 10009150, "step": 257, "train_runtime": 1044.2188, "train_tokens_per_second": 9585.3 }, { "epoch": 1.758974358974359, "grad_norm": 1.1759202480316162, "learning_rate": 2.560553633217993e-06, "loss": 0.3586, "num_input_tokens_seen": 10082110, "step": 258, "train_runtime": 1050.4616, "train_tokens_per_second": 9597.79 }, { "epoch": 1.7658119658119658, "grad_norm": 1.5406081676483154, "learning_rate": 2.4913494809688584e-06, "loss": 0.4238, "num_input_tokens_seen": 10116126, "step": 259, "train_runtime": 1053.3071, "train_tokens_per_second": 9604.156 }, { "epoch": 1.7726495726495726, "grad_norm": 1.5332951545715332, "learning_rate": 2.4221453287197232e-06, "loss": 0.4283, "num_input_tokens_seen": 10152958, "step": 260, "train_runtime": 1056.3542, "train_tokens_per_second": 9611.32 }, { "epoch": 1.7794871794871794, "grad_norm": 1.3916773796081543, "learning_rate": 2.3529411764705885e-06, "loss": 0.4203, "num_input_tokens_seen": 10190046, "step": 261, "train_runtime": 1059.4345, "train_tokens_per_second": 9618.382 }, { "epoch": 1.7863247863247862, "grad_norm": 1.3282185792922974, "learning_rate": 2.2837370242214537e-06, "loss": 0.3668, "num_input_tokens_seen": 10230334, "step": 262, "train_runtime": 1062.7483, "train_tokens_per_second": 9626.3 }, { "epoch": 1.793162393162393, "grad_norm": 1.3999195098876953, "learning_rate": 2.2145328719723185e-06, "loss": 0.3823, "num_input_tokens_seen": 10262302, "step": 263, "train_runtime": 1065.4169, "train_tokens_per_second": 9632.194 }, { "epoch": 1.8, "grad_norm": 1.483365535736084, "learning_rate": 2.1453287197231837e-06, "loss": 0.437, "num_input_tokens_seen": 10306046, "step": 264, "train_runtime": 1069.0582, "train_tokens_per_second": 9640.304 }, { "epoch": 1.8068376068376069, "grad_norm": 1.5923428535461426, "learning_rate": 2.0761245674740485e-06, "loss": 0.4307, "num_input_tokens_seen": 10335582, "step": 265, "train_runtime": 1071.5688, "train_tokens_per_second": 9645.281 }, { "epoch": 1.8136752136752137, "grad_norm": 1.4312759637832642, "learning_rate": 2.0069204152249138e-06, "loss": 0.4697, "num_input_tokens_seen": 10369214, "step": 266, "train_runtime": 1074.4014, "train_tokens_per_second": 9651.154 }, { "epoch": 1.8205128205128205, "grad_norm": 1.4313794374465942, "learning_rate": 1.9377162629757786e-06, "loss": 0.4429, "num_input_tokens_seen": 10415998, "step": 267, "train_runtime": 1078.2698, "train_tokens_per_second": 9659.918 }, { "epoch": 1.8273504273504273, "grad_norm": 1.440711259841919, "learning_rate": 1.8685121107266438e-06, "loss": 0.427, "num_input_tokens_seen": 10457470, "step": 268, "train_runtime": 1081.7021, "train_tokens_per_second": 9667.607 }, { "epoch": 1.8341880341880343, "grad_norm": 1.5918058156967163, "learning_rate": 1.7993079584775088e-06, "loss": 0.4871, "num_input_tokens_seen": 10496382, "step": 269, "train_runtime": 1084.9586, "train_tokens_per_second": 9674.454 }, { "epoch": 1.8410256410256411, "grad_norm": 1.4235551357269287, "learning_rate": 1.7301038062283736e-06, "loss": 0.5227, "num_input_tokens_seen": 10529278, "step": 270, "train_runtime": 1087.7757, "train_tokens_per_second": 9679.64 }, { "epoch": 1.8410256410256411, "eval_loss": 0.45376113057136536, "eval_runtime": 5.8063, "eval_samples_per_second": 171.881, "eval_steps_per_second": 5.511, "num_input_tokens_seen": 10529278, "step": 270 }, { "epoch": 1.847863247863248, "grad_norm": 1.3479825258255005, "learning_rate": 1.6608996539792389e-06, "loss": 0.4222, "num_input_tokens_seen": 10573694, "step": 271, "train_runtime": 1115.6749, "train_tokens_per_second": 9477.397 }, { "epoch": 1.8547008547008548, "grad_norm": 1.4445607662200928, "learning_rate": 1.5916955017301039e-06, "loss": 0.4388, "num_input_tokens_seen": 10615710, "step": 272, "train_runtime": 1119.1547, "train_tokens_per_second": 9485.471 }, { "epoch": 1.8615384615384616, "grad_norm": 1.6135919094085693, "learning_rate": 1.522491349480969e-06, "loss": 0.4083, "num_input_tokens_seen": 10651486, "step": 273, "train_runtime": 1122.1591, "train_tokens_per_second": 9491.957 }, { "epoch": 1.8683760683760684, "grad_norm": 1.567018747329712, "learning_rate": 1.4532871972318341e-06, "loss": 0.4997, "num_input_tokens_seen": 10684862, "step": 274, "train_runtime": 1124.9704, "train_tokens_per_second": 9497.905 }, { "epoch": 1.8752136752136752, "grad_norm": 1.5761120319366455, "learning_rate": 1.3840830449826992e-06, "loss": 0.4252, "num_input_tokens_seen": 10718174, "step": 275, "train_runtime": 1127.7815, "train_tokens_per_second": 9503.768 }, { "epoch": 1.882051282051282, "grad_norm": 1.516058325767517, "learning_rate": 1.314878892733564e-06, "loss": 0.4248, "num_input_tokens_seen": 10751358, "step": 276, "train_runtime": 1130.5976, "train_tokens_per_second": 9509.447 }, { "epoch": 1.8888888888888888, "grad_norm": 1.4651241302490234, "learning_rate": 1.2456747404844292e-06, "loss": 0.4218, "num_input_tokens_seen": 10785278, "step": 277, "train_runtime": 1133.4807, "train_tokens_per_second": 9515.185 }, { "epoch": 1.8957264957264957, "grad_norm": 1.470118761062622, "learning_rate": 1.1764705882352942e-06, "loss": 0.4166, "num_input_tokens_seen": 10829086, "step": 278, "train_runtime": 1137.1675, "train_tokens_per_second": 9522.859 }, { "epoch": 1.9025641025641025, "grad_norm": 1.4548068046569824, "learning_rate": 1.1072664359861592e-06, "loss": 0.4197, "num_input_tokens_seen": 10869246, "step": 279, "train_runtime": 1140.5065, "train_tokens_per_second": 9530.192 }, { "epoch": 1.9094017094017093, "grad_norm": 1.4155503511428833, "learning_rate": 1.0380622837370243e-06, "loss": 0.3839, "num_input_tokens_seen": 10908350, "step": 280, "train_runtime": 1143.7836, "train_tokens_per_second": 9537.075 }, { "epoch": 1.916239316239316, "grad_norm": 1.5686092376708984, "learning_rate": 9.688581314878893e-07, "loss": 0.4483, "num_input_tokens_seen": 10936542, "step": 281, "train_runtime": 1146.1984, "train_tokens_per_second": 9541.578 }, { "epoch": 1.9230769230769231, "grad_norm": 1.4835528135299683, "learning_rate": 8.996539792387544e-07, "loss": 0.4117, "num_input_tokens_seen": 10970366, "step": 282, "train_runtime": 1149.0912, "train_tokens_per_second": 9546.994 }, { "epoch": 1.92991452991453, "grad_norm": 1.5472915172576904, "learning_rate": 8.304498269896194e-07, "loss": 0.4556, "num_input_tokens_seen": 11005310, "step": 283, "train_runtime": 1152.0483, "train_tokens_per_second": 9552.82 }, { "epoch": 1.9367521367521368, "grad_norm": 1.345395565032959, "learning_rate": 7.612456747404845e-07, "loss": 0.392, "num_input_tokens_seen": 11039710, "step": 284, "train_runtime": 1154.9982, "train_tokens_per_second": 9558.205 }, { "epoch": 1.9435897435897436, "grad_norm": 1.640942931175232, "learning_rate": 6.920415224913496e-07, "loss": 0.4268, "num_input_tokens_seen": 11068126, "step": 285, "train_runtime": 1157.4718, "train_tokens_per_second": 9562.329 }, { "epoch": 1.9504273504273504, "grad_norm": 1.4688515663146973, "learning_rate": 6.228373702422146e-07, "loss": 0.4585, "num_input_tokens_seen": 11100222, "step": 286, "train_runtime": 1160.1879, "train_tokens_per_second": 9567.607 }, { "epoch": 1.9572649572649574, "grad_norm": 1.353981375694275, "learning_rate": 5.536332179930796e-07, "loss": 0.4352, "num_input_tokens_seen": 11142846, "step": 287, "train_runtime": 1163.7686, "train_tokens_per_second": 9574.795 }, { "epoch": 1.9641025641025642, "grad_norm": 1.4443548917770386, "learning_rate": 4.844290657439446e-07, "loss": 0.4597, "num_input_tokens_seen": 11179038, "step": 288, "train_runtime": 1166.8565, "train_tokens_per_second": 9580.474 }, { "epoch": 1.970940170940171, "grad_norm": 1.463306188583374, "learning_rate": 4.152249134948097e-07, "loss": 0.3708, "num_input_tokens_seen": 11216158, "step": 289, "train_runtime": 1169.997, "train_tokens_per_second": 9586.485 }, { "epoch": 1.9777777777777779, "grad_norm": 1.3856064081192017, "learning_rate": 3.460207612456748e-07, "loss": 0.397, "num_input_tokens_seen": 11297406, "step": 290, "train_runtime": 1177.6388, "train_tokens_per_second": 9593.269 }, { "epoch": 1.9846153846153847, "grad_norm": 1.567358136177063, "learning_rate": 2.768166089965398e-07, "loss": 0.4152, "num_input_tokens_seen": 11332094, "step": 291, "train_runtime": 1180.5843, "train_tokens_per_second": 9598.717 }, { "epoch": 1.9914529914529915, "grad_norm": 1.3738164901733398, "learning_rate": 2.0761245674740486e-07, "loss": 0.3608, "num_input_tokens_seen": 11394046, "step": 292, "train_runtime": 1185.9037, "train_tokens_per_second": 9607.902 }, { "epoch": 1.9982905982905983, "grad_norm": 1.5582184791564941, "learning_rate": 1.384083044982699e-07, "loss": 0.4101, "num_input_tokens_seen": 11428286, "step": 293, "train_runtime": 1188.8125, "train_tokens_per_second": 9613.194 }, { "epoch": 2.0, "grad_norm": 2.8240842819213867, "learning_rate": 6.920415224913495e-08, "loss": 0.3817, "num_input_tokens_seen": 11435966, "step": 294, "train_runtime": 1189.5451, "train_tokens_per_second": 9613.731 } ], "logging_steps": 1, "max_steps": 294, "num_input_tokens_seen": 11435966, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.9039331026231296e+17, "train_batch_size": 32, "trial_name": null, "trial_params": null }